$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo usa apenas conjuntos de dados disponíveis publicamente (UCF-Crime13 e ShanghaiTech14). Todos os vídeos foram obtidos a partir das versões oficiais dos conjuntos de dados, que anonimizam informações de identificação pessoal na medida em que são fornecidas pelos mantenedores do conjunto de dados. Nenhuma coleta de dados adicional ou interação com seres humanos foi conduzida pelos autores; portanto, nenhuma nova aprovação do IRB foi necessária. O uso de dados está em conformidade com as licenças e termos de uso dos respectivos conjuntos de dados.
Preparação de dados e extração de recursos
Preparação do conjunto de dados: Os conjuntos de dados UCF-Crime13 (1.610 trens / 290 vídeos de teste) e ShanghaiTech14 (238 trens / 199 vídeos de teste) foram adotados de acordo com suas divisões padrão. Os vídeos foram pré-processados usando FFmpeg para garantir a reprodutibilidade, recodificados para H.264, reamostrados para 25 fps e redimensionados para resolução de 256 x 256 com o comando: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/.
Extração de recursos: Os recursos RGB foram extraídos por um backbone I3D15 pré-treinado no conjunto de dados Kinetics16. Os vídeos foram divididos em clipes de 16 quadros não sobrepostos; Cada clipe foi cortado no centro para 224 x 224 pixels. As penúltimas ativações de camada foram agrupadas em média para obter um recurso 1024-D por clipe. No PyTorch, isso corresponde ao encaminhamento de tensores de forma [B, 3, T, H, W] através do backbone I3D e à aplicação de adaptive_avg_pool3d seguido de nivelamento. Os recursos extraídos foram salvos em arquivos .npy (um por vídeo) junto com carimbos de data/hora do clipe para reprodutibilidade exata (semente = 123). Para cada vídeo, features///
Arquitetura e metodologia do modelo
Detecção básica: fusão de contexto temporal
Dada uma sequência de videoclipe representada por uma matriz de recursos Z
RTx1024, o módulo TCF (Temporal Context Fusion) primeiro calculou representações de consulta, chave e valor por meio de três projeções lineares aprendidas:
Q = ZWQ, K = ZWK, V = ZWV (1)
onde WQ, WK, WV
RTx1024xd são parâmetros treináveis (PyTorch: três nn. Camadas lineares (1024,d)). A afinidade intersegmentar foi S =
, uma Incorporação de Relacionalidade Temporal (TRE) foi incorporada, onde cada elemento foi calculado como Rij = α exp (
) + β . A afinidade com reconhecimento de localização foi
= S + R. Um mapa de contexto global A = softmax(
) agregado V para obter recursos de área ampla G = AV. As características locais L foram calculadas com uma convolução 1-D em profundidade (nn. Conv1d) do tamanho do kernel 3 sobre Z. Uma porta dinâmica g = σ(MLP ([G;L])) misturou os dois: U = g
G + (1 - g)
L . Finalmente, a normalização da camada e uma camada linear residual foram aplicadas para produzir Y (Pytorch:LayerNorm+Linear+residual).
Detecção básica: preditor temporal causal
A saída Y foi passada por duas convoluções causais 1-D com GELU e dropout (Pytorch: padding = 'causal' ou conv mascarado) para obter logits de anomalia por clipe. A aplicação da função sigmóide produziu valores
de probabilidade [0,1]T.
Aprimoramento semântico: aprendizado imediato com conhecimento externo
Construir âncoras semânticas: Para cada anomalia classe c, Kc os conceitos foram consultados no Wikidata11 e, codificados, cada frase conceitual foi codificada com o codificador detexto 12do BLIP para ei
R768. A âncora de classe foi a média normalizada l2 Dc = norm(
Σiei) . Para reduzir o ruído, os conceitos com semelhança de cosseno com o nome da classe abaixo de 0,2 foram descartados e o top-M pela pontuação TF-IDF foi mantido.
Execute a separação sensível ao contexto: os pesos de primeiro plano αt = softmax(rst) foram calculados a partir das pontuações do detector de base st e os pesos de fundo bt = softmax(r( 1 - st)). As características ponderadas são ffg = Σtαzt e fbg = Σtbzt .
Alinhar recursos visuais e semânticos
Defina o objetivo de alinhamento: Durante a etapa de alinhamento, o objetivo é minimizar a distância entre o recurso visual de primeiro plano e sua âncora semântica correspondente da categoria anômala dentro do espaço do recurso. Crie uma coleção de guias semânticos,
, compreendendo guias semânticos de categoria anômala C e um guia semântico normal padrão. Determine a verossimilhança, P(Dk|v), que uma característica visual, v, corresponde ao k-ésimo guia semântico, Dk. Calcule isso usando a similaridade de cosseno em escala de temperatura seguida pela normalização Softmax, conforme mostrado na Eq. (2).
(2)
A entropia cruzada foi minimizada para unir pares positivos e separar negativos, com τs definido como um parâmetro aprendível e inicializando-o para 10. Realize o alinhamento otimizando a probabilidade de correlacionar pares de amostras positivas e reduzindo a probabilidade de correlacionar pares de amostras negativas.
Módulo de interpretabilidade baseado em modelo
Com base na representação de recursos aprimorada por aprendizado imediato com conhecimento externo (PLE), um classificador linear produz logits por classe, que foram posteriormente normalizados em probabilidades de classe pela função softmax; O tipo de anomalia predita foi determinado como a categoria com maior probabilidade. Enquanto isso, uma pontuação global de anomalias foi calculada a partir da saída do detector. Para determinar o nível de gravidade, essa pontuação foi comparada com três limites predefinidos otimizados por meio de pesquisa em grade no conjunto de validação.
Os limites padrão foram definidos como θalto = 0,8, θmédio = 0,5 e θbaixo = 0,2. Especificamente, se a pontuação fosse maior que θalta, a gravidade era rotulada como alta; se a pontuação estiver entre θmédio e θalto, foi rotulado como médio; se entre θbaixo e θmédio, foi rotulado como baixo; caso contrário, foi marcado como nenhum.
Durante a fase de geração da explicação, um modelo correspondente ao tipo previsto foi selecionado de uma biblioteca de modelos predefinida, Arquivo Suplementar 1. Esta biblioteca contém várias variantes de modelo que foram validadas por vários anotadores17 para aumentar a diversidade do texto gerado. Se o tipo previsto existir na biblioteca de modelos, um modelo correspondente foi selecionado aleatoriamente; caso contrário, um modelo padrão para o tipo Desconhecido foi usado. Por fim, um texto explicativo estruturado foi gerado integrando o tipo previsto, o escore global de anomalias, a descrição da gravidade e o modelo selecionado. O sistema retorna o tipo de anomalia previsto, a pontuação global de anomalias e o texto explicativo gerado como a saída final. Os resultados estão ilustrados na Figura 2.
Todos os parâmetros de limite foram otimizados usando pesquisa de grade no conjunto de validação, e a qualidade das explicações geradas foi avaliada de forma abrangente usando avaliação humana e métricas automatizadas. Os resultados são apresentados na Tabela 1.
Treinamento e avaliação de modelos
Treinamento: O modelo foi treinado de ponta a ponta com Adam (lr 1 x 10-4, decaimento de peso 5 x 10-4), tamanho do lote 128, 50 épocas, recozimento de cosseno para lr. As sementes aleatórias foram definidas como 123 para Python / Numpy / Pytorch e habilitadas torch.backends.cudnn.deterministic=True. Os pontos de verificação foram salvos a cada 5 épocas em checkpoints//epoch_XX.pt, e o melhor modelo foi selecionado por AUC de validação. Todos os experimentos foram conduzidos em um sistema com uma GPU NVIDIA GeForce RTX 4060 Ti (16 GB) executando Windows 11, com Python 3.8.20, PyTorch 1.8.0 e CUDA 11.1. O tempo aproximado de treinamento por época foi de 30 s para o conjunto de dados ShanghaiTech e 3,5 min para o conjunto de dados UCF-Crime.
Perda: O objetivo geral é L = LMIL+ λ • Lalinhar. O hiperparâmetro λ foi varrido pelo conjunto {0,01,0,1,0,5,1,5,10} no conjunto de validação, e o melhor valor foi fixado para o relatório de teste. Consulte a Figura 3 para agregação MIL top-K e a Eq. (3-4) para definições.
(3)
(4)
Avaliação: A AUC em nível de quadro foi calculada seguindo o protocolo padrão usado por trabalhos anteriores do WS-VAD 2,5. Para reconhecimento de tipo refinado no UCF-Crime, mAP em IoU 0,1-0,5 e AVG mAP foram relatados, conforme resumido na Tabela 2; as AUCs por classe são mostradas na Figura 4 e os resultados gerais na Tabela 3 e na Tabela 4; a separabilidade incorporada e a dinâmica do escore de anomalias estão na Figura 4, Figura 5 e Figura 6.