A detecção de anomalias de vídeo fracamente supervisionada é uma técnica essencial que depende exclusivamente de rótulos de nível de vídeo para identificar eventos anômalos. No entanto, os métodos tradicionais de aprendizado de múltiplas instâncias (MIL) dependem da supervisão binária de granularidade grossa. Essa abordagem dificulta a distinção entre categorias de anomalias refinadas. Esses métodos geralmente se concentram apenas nos segmentos mais anômalos, resultando em resultados de detecção que carecem de interpretabilidade. Para superar essas limitações, este estudo propõe uma abordagem de modelagem de recursos que incorpora conhecimento estruturado. Ao utilizar um mecanismo de orientação semântica dinâmica, a detecção de anomalias de vídeo fracamente supervisionada combina informações externas em nível de categoria com prompts que podem ser aprendidos para gerar sinais semânticos dentro do espaço de recursos. Esses sinais são alinhados com as evidências visuais extraídas pelo módulo base de detecção de anomalias, produzindo duas saídas complementares: uma pontuação de anomalias para quantificar a gravidade de eventos anômalos e descrições semânticas alinhadas com conceitos externos, que podem ser usadas para gerar textos explicativos estruturados e interpretáveis por meio de modelos predefinidos. Os resultados experimentais demonstram que o método proposto atinge uma AUC de 88,03% no conjunto de dados UCF-Crime e 98,23% no conjunto de dados ShanghaiTech, atingindo 87,05% de precisão em tarefas de classificação de anomalias refinadas. Além disso, as explicações semânticas geradas estendem a detecção fracamente supervisionada de uma tarefa de classificação binária para uma estrutura de análise de anomalias interpretável e orientada pela semântica.