Artículo de investigación

Modelo semántico alineado con anclaje para la detección de anomalías de video interpretable bajo supervisión débil multimodal

DOI:

10.3791/69286

14 de noviembre de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo tiene como objetivo mejorar la detección de anomalías de video débilmente supervisadas mediante la integración de conocimiento estructurado. Su objetivo es permitir la clasificación de tipos de anomalías específicas y proporcionar explicaciones claras e interpretables para los resultados de la detección, yendo más allá de las simples decisiones binarias y mejorando la transparencia.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La detección de anomalías de video débilmente supervisada es una técnica clave que se basa únicamente en etiquetas a nivel de video para identificar eventos anómalos. Sin embargo, los métodos tradicionales de aprendizaje de instancias múltiples (MIL) se basan en la supervisión binaria de grano grueso. Este enfoque dificulta la distinción entre categorías de anomalías de grano fino. Estos métodos a menudo se centran únicamente en los segmentos más anómalos, lo que da como resultado resultados de detección que carecen de interpretabilidad. Para superar estas limitaciones, este estudio propone un enfoque de modelado de características que incorpora conocimiento estructurado. Al utilizar un mecanismo de guía semántica dinámica, la detección de anomalías de video débilmente supervisada combina información externa a nivel de categoría con indicaciones aprendibles para generar señales semánticas dentro del espacio de características. Estas señales están alineadas con la evidencia visual extraída por el módulo de detección de anomalías base, produciendo dos salidas complementarias: una puntuación de anomalía para cuantificar la gravedad de los eventos anómalos, y descripciones semánticas alineadas con conceptos externos, que pueden utilizarse para generar textos explicativos estructurados e interpretables a través de plantillas predefinidas. Los resultados experimentales demuestran que el método propuesto logra un AUC del 88,03% en el conjunto de datos UCF-Crime y del 98,23% en el conjunto de datos ShanghaiTech, logrando una precisión del 87,05% en tareas de clasificación de anomalías de grano fino. Además, las explicaciones semánticas generadas extienden la detección débilmente supervisada de una tarea de clasificación binaria a un marco de análisis de anomalías interpretable y basado en semántica.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La detección de anomalías por vídeo (VAD) juega un papel esencial en campos como la seguridad pública y la fabricación inteligente, donde ofrece una solución escalable a las limitaciones de la vigilancia manual1. En particular, la detección de anomalías de video débilmente supervisada (WS-VAD) ha ganado prominencia debido a su dependencia de las etiquetas de nivel de video, lo que reduce sustancialmente la carga de la anotación manual y mejora la generalización en diversas escenas. A pesar de sus ventajas prácticas, los métodos WS-VAD aún enfrentan desafíos significativos para identificar con precisión la naturaleza de los eventos anormales2. Los modelos existentes a menudo detectan la presencia de anomalías, pero tienen dificultades para determinar su categoría exacta o proporcionar información diagnóstica significativa 3,4. Por ejemplo, en entornos industriales, un modelo puede confundir el humo de los cojinetes sobrecalentados con emisiones de vapor inofensivas o creer incorrectamente que las chispas de soldadura normales son signos tempranos de incendio, lo que lleva a costosos errores de juicio y paradas innecesarias. Estas confusiones semánticas surgen de las limitaciones inherentes de los enfoques actuales de WS-VAD5. Las etiquetas binarias a nivel de video simplemente indican si existe una anomalía, sin ofrecer información sobre su causa, ubicación y gravedad. Además, los marcos de aprendizaje de instancias múltiples (MIL) convencionales6 agregan predicciones a nivel de clip utilizando heurísticas simples7 que no logran capturar la semántica matizada de diferentes tipos de eventos. Como resultado, el espacio de características visuales aprendidas se vuelve ambiguo, donde los fenómenos visualmente similares pero semánticamente distintos, como el humo y el vapor, se mapean demasiado de cerca, difuminando los límites de decisión.

Han surgido dos direcciones principales de investigación para abordar estas limitaciones. Uno se centra en mejorar el marco MIL a través de un modelado temporal mejorado 4,5,8 o una selección de características guiada por prominencia3. Aunque estos métodos mejoran la localización de anomalías, aún no ofrecen claridad semántica e interpretabilidad. La otra dirección implica alinear las representaciones de la visión y el lenguaje mediante la integración de modelos multimodales preentrenados, como VadCLIP9. Si bien esta estrategia es prometedora, a menudo no aprovecha plenamente la riqueza semántica del lenguaje. Esto conduce a asociaciones intermodales débiles y procesos de toma de decisiones opacos, lo que resulta en dos deficiencias centrales. En primer lugar, los modelos actuales no pueden distinguir consistentemente entre categorías de anomalías debido a una semántica de características vaga y un conocimiento externo insuficiente. En segundo lugar, el proceso de toma de decisiones contiene una caja negra, sin una explicación transparente de por qué un evento en particular se clasifica como anómalo. Aunque algunos métodos incorporan indicaciones textuales (por ejemplo, peleas, disparos), estos son siempre simplistas y poco organizados, y carecen tanto de profundidad semántica como de comprensión contextual.

Para abordar estas brechas, se introduce un nuevo método WS-VAD que integra conocimiento externo estructurado con mecanismos de decisión interpretables, un objetivo central dentro del campo más amplio de la Inteligencia Artificial Explicable (XAI)10. En lugar de usar nombres de categorías básicas como indicaciones, el método construye representaciones semánticas ricas, denominadas nubes de conceptos semánticos, utilizando Wikidata11. A diferencia de los métodos multimodales existentes, como VadCLIP9 , que se basan en indicaciones de texto estáticas o etiquetas de categorías simples, estas nubes de conceptos semánticos encapsulan un conocimiento contextual integral, incluidas entidades relacionadas, atributos y relaciones causales extraídas de gráficos de conocimiento estructurados. Estas nubes de conceptos se codifican en anclajes semánticos mediante el modelo BLIP12, que permite al sistema acceder a la semántica de eventos de grano fino. La innovación clave del mecanismo de anclaje semántico radica en su capacidad para crear representaciones dinámicas y enriquecidas con conocimiento que se adaptan a contextos de anomalías específicas, mientras que los métodos anteriores basados en indicaciones utilizan descripciones textuales fijas que carecen de profundidad contextual y relaciones semánticas. Para refinar aún más el espacio de características, un mecanismo de alineación guiado por prominencia asocia selectivamente estos anclajes con la evidencia visual más relevante. Esta alineación dirigida mejora el poder discriminativo de las características al tiempo que mejora la claridad semántica de los resultados de la detección. Más importante aún, el método propuesto apoya una interpretación transparente. Una vez que un anclaje semántico se alinea con la evidencia visual, el modelo genera explicaciones estructuradas en lenguaje natural utilizando plantillas predefinidas, abordando explícitamente tanto la naturaleza como la justificación de la anomalía. Es importante tener en cuenta que la implementación de este método se basa en requisitos previos específicos, incluido el uso de características visuales I3D extraídas previamente, acceso a una base de conocimiento externa (Wikidata) y un codificador BLIP preentrenado. Por lo tanto, el marco es más beneficioso en aplicaciones en las que es fundamental ir más allá de la simple detección binaria para clasificar tipos de anomalías específicas y proporcionar justificaciones interpretables para los resultados.

Las contribuciones clave son las siguientes. Se desarrolla un novedoso método WS-VAD combinando conocimiento externo con interpretabilidad estructurada para mejorar la comprensión semántica y la transparencia de las decisiones. Se introduce un método de solicitud basado en incrustación semántica y un mecanismo de alineación sensible al contexto para superar las limitaciones de los modelos MIL solo visuales. Se incorpora un módulo de explicación generativa, utilizando anclajes semánticos como unidades interpretables para producir fundamentos textuales coherentes. Los extensos experimentos realizados en los conjuntos de datos UCF-Crime y ShanghaiTech demuestran la efectividad del método propuesto, logrando puntajes AUC sólidos (88.03% / 98.23%) y un rendimiento de reconocimiento superior de grano fino, con resultados claros e interpretables.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utiliza solo conjuntos de datos disponibles públicamente (UCF-Crime13 y ShanghaiTech14). Todos los videos se obtuvieron de los lanzamientos oficiales de los conjuntos de datos, que anonimizan la información de identificación personal en la medida proporcionada por los mantenedores del conjunto de datos. Los autores no realizaron ninguna recopilación de datos adicional ni interacción con sujetos humanos; por lo tanto, no se requirió una nueva aprobación del IRB. El uso de datos cumple con las licencias y los términos de uso de los respectivos conjuntos de datos.

Preparación de datos y extracción de características

Preparación del conjunto de datos: Los conjuntos de datos UCF-Crime13 (1.610 trenes / 290 videos de prueba) y ShanghaiTech14 (238 trenes / 199 videos de prueba) se adoptaron bajo sus divisiones estándar. Los videos se preprocesaron usando FFmpeg para garantizar la reproducibilidad, se recodificaron a H.264, se volvieron a muestrear a 25 fps y se redimensionaron a una resolución de 256 x 256 con el comando: ffmpeg -i v.mp4 -vf "fps = 25, escala = 256: 256" -c: v libx264 -crf 23 -preset veryfast pre/.

Extracción de características: Las características RGB fueron extraídas por una red troncal I3D15 preentrenada en el conjunto de datos Kinetics16. Los videos se dividieron en clips de 16 cuadros no superpuestos; Cada clip se recortó al centro a 224 x 224 píxeles. Las activaciones de la penúltima capa se agruparon de forma media para obtener una característica 1024-D por clip. En PyTorch, esto corresponde a reenviar tensores de forma [B, 3, T, H, W] a través de la red troncal I3D y aplicar adaptive_avg_pool3d seguido de aplanamiento. Las características extraídas se guardaron en archivos .npy (uno por video) junto con las marcas de tiempo del clip para una reproducibilidad exacta (semilla = 123). Para cada vídeo, features///

Arquitectura y metodología del modelo

Detección básica: fusión de contexto temporal
Dada una secuencia de clip de vídeo representada por una matriz de características Z figure-protocol-1 RTx1024, el módulo Temporal Context Fusion (TCF) calculó primero representaciones de consultas, claves y valores a través de tres proyecciones lineales aprendidas:

Q = ZWQ, K = ZWK, V = ZWV (1)

donde WQ, WK, WV figure-protocol-2 RTx1024xd son parámetros entrenables (PyTorch: tres nn. Capas lineales (1024,d)). La afinidad intersegmento fue S = figure-protocol-3, se incorporó una incrustación de relacionalidad temporal (TRE), donde cada elemento se calculó como Rij = α exp (figure-protocol-4) + β . La afinidad consciente de la ubicación fue figure-protocol-5 = S + R. Un mapa de contexto global A = softmax(figure-protocol-6) agregado V para obtener características de área amplia G = AV. Las características locales L se calcularon con una convolución 1-D en profundidad (nn. Conv1d) del tamaño del grano 3 sobre Z. Una puerta dinámica g = σ(MLP ([G;L])) mezcló los dos: U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L . Finalmente, se aplicó la normalización de capas y una capa lineal residual para producir Y (Pytorch: LayerNorm + Linear + residual).

Detección básica: predictor temporal causal

La salida Y se pasó a través de dos convoluciones causales 1-D con GELU y dropout (Pytorch: padding = 'causal' o conv enmascarado) para obtener logits de anomalías por clip. La aplicación de la función sigmoide arrojó valores figure-protocol-9 de probabilidad [0,1]T.

Mejora semántica: aprendizaje rápido con conocimiento externo

Construir anclajes semánticos: Para cada clase de anomalía c, se consultaron conceptos de Kc de Wikidata11, y se codificó cada frase conceptual con el codificador de texto12de BLIP en ei figure-protocol-10 R768. El ancla de clase fue la media normalizada l2 Dc = norm(figure-protocol-11Σiei) . Para reducir el ruido, se eliminaron los conceptos con similitud de coseno con el nombre de la clase por debajo de 0.2 y se mantuvo la puntuación top-M by TF-IDF.

Realice una separación sensible al contexto: Los pesos de primer plano αt = softmax(rst) se calcularon a partir de las puntuaciones del detector base st, y los pesos de fondo bt = softmax(r(1 - st)). Las características ponderadas son ffg = Σtαzt y fbg = Σtbzt .

Alinear características visuales y semánticas

Definir el objetivo de alineación: durante el paso de alineación, el objetivo es minimizar la distancia entre la característica visual en primer plano y su correspondiente anclaje semántico de la categoría anómala dentro del espacio de características. Cree una colección de guías semánticas, figure-protocol-12, que comprenda guías semánticas de categoría anómala C y una guía semántica normal estándar. Determinar la probabilidad, P(Dk|v), que una característica visual, v, corresponde a la k-ésima guía semántica, Dk. Calcule esto usando la similitud del coseno a escala de temperatura seguida de la normalización Softmax, como se muestra en la Ec. (2).

figure-protocol-13(2)

La entropía cruzada se minimizó para unir pares positivos y negativos, estableciéndose τs como parámetro aprendible e inicializándolo en 10. Logre la alineación optimizando la probabilidad de correlacionar pares de muestras positivas mientras reduce la probabilidad de correlacionar pares de muestras negativos.

Módulo de interpretabilidad basado en plantillas

Basado en el aprendizaje rápido con representación de características mejorada por conocimiento externo (PLE), un clasificador lineal produce logits por clase, que posteriormente se normalizaron en probabilidades de clase mediante la función softmax; El tipo de anomalía predicho se determinó como la categoría con mayor probabilidad. Mientras tanto, se calculó una puntuación de anomalía global a partir de la salida del detector. Para determinar el nivel de gravedad, esta puntuación se comparó con tres umbrales predefinidos optimizados a través de la búsqueda en cuadrícula en el conjunto de validación.

Los umbrales predeterminados se establecieron en θalto = 0,8, θmedio = 0,5 y θbajo = 0,2. Específicamente, si la puntuación era mayor que θalta, la gravedad se etiquetó como alta; si la puntuación se encuentra entre θmedia y θalta, se etiquetó como media; si entre θbajo y θmedio, se etiquetó como bajo; de lo contrario, se marcó como ninguno.

Durante la fase de generación de explicaciones, se seleccionó una plantilla correspondiente al tipo predicho de una biblioteca de plantillas predefinida, Archivo complementario 1. Esta biblioteca contiene múltiples variantes de plantilla que han sido validadas de forma cruzada por múltiples anotadores17 para mejorar la diversidad del texto generado. Si el tipo de predicción existe en la biblioteca de plantillas, se seleccionó aleatoriamente una plantilla correspondiente; de lo contrario, se usó una plantilla predeterminada para el tipo Desconocido. Finalmente, se generó un texto explicativo estructurado integrando el tipo predicho, la puntuación global de anomalías, la descripción de la gravedad y la plantilla seleccionada. El sistema devuelve el tipo de anomalía predicho, la puntuación de anomalía global y el texto explicativo generado como resultado final. Los resultados se ilustran en la Figura 2.

Todos los parámetros de umbral se optimizaron mediante la búsqueda en cuadrícula en el conjunto de validación, y la calidad de las explicaciones generadas se evaluó exhaustivamente utilizando tanto la evaluación humana como las métricas automatizadas. Los resultados se presentan en la Tabla 1.

Entrenamiento y evaluación de modelos

Entrenamiento: El modelo se entrenó de extremo a extremo con Adam (lr 1 x 10-4, decaimiento de peso 5 x 10-4), tamaño de lote 128, 50 épocas, recocido de coseno para lr. Las semillas aleatorias se establecieron en 123 para Python / Numpy / Pytorch y habilitaron torch.backends.cudnn.deterministic=True. Los puntos de control se guardaron cada 5 épocas en checkpoints//epoch_XX.pt, y el mejor modelo se seleccionó mediante validación AUC. Todos los experimentos se realizaron en un sistema con una GPU NVIDIA GeForce RTX 4060 Ti (16 GB) con Windows 11, con Python 3.8.20, PyTorch 1.8.0 y CUDA 11.1. El tiempo de entrenamiento aproximado por época fue de 30 s para el conjunto de datos de ShanghaiTech y de 3,5 minutos para el conjunto de datos de UCF-Crime.

Pérdida: El objetivo general es L = LMIL+ λ • Lalineado. El hiperparámetro λ se barrió por el conjunto {0.01,0.1,0.5,1,5,10} en el conjunto de validación y se fijó el mejor valor para los informes de prueba. Consulte la Figura 3 para la agregación de MIL de K superior y la Ec. (3-4) para las definiciones.

figure-protocol-14(3)

figure-protocol-15(4)

Evaluación: El AUC a nivel de trama se calculó siguiendo el protocolo estándar utilizado por trabajos anteriores de WS-VAD 2,5. Para el reconocimiento de tipos de grano fino en UCF-Crime, se informaron mAP en IoU 0.1-0.5 y AVG mAP, como se resume en la Tabla 2; los AUC por clase se muestran en la Figura 4 y los resultados generales en la Tabla 3 y la Tabla 4; la integración de la separabilidad y la dinámica de puntuación de anomalías se encuentran en la Figura 4, la Figura 5 y la Figura 6.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para validar aún más la utilidad de los anclajes semánticos, se realizó un experimento adicional para comparar diferentes plantillas de avisos (ver Tabla 1). La variante que utiliza prototipos semánticos aumentados por Wikidata no solo logró valores de AUC más altos, sino que también condujo a mejoras en la puntuación BLEU-4 de 16,6 y 14,8 para las explicaciones generadas. Estos hallazgos indican un fuerte vínculo entre la riqueza semántica de las indicaciones y la calid...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El protocolo presentado aquí introduce un avance significativo en la detección de anomalías de video débilmente supervisadas al cambiar el paradigma de una clasificación binaria simple a un análisis interpretable y con base semántica. La importancia de este método radica en su capacidad no solo para identificar si ocurrió una anomalía, sino también qué tipo de anomalía es y por qué el modelo llegó a esa conclusión, abordando una limitación importante en los sistemas WS-VAD existentes

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de intereses.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Reconocemos con gratitud el apoyo financiero brindado por Aerospace Hongka Intelligent Technology (Beijing) CO., LTD.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios

BLIP Modelo

Investigación de SalesforceViT-B/16Se utiliza como codificador de texto para crear anclas semánticas.
GPUNVIDIARTX 4060TiUtilizado para entrenar el modelo
Modelo I3DGoogle DeepMindPreentrenado en Cinética Se utiliza como columna vertebral para la extracción de funciones de vídeo.
EntumecidoEl equipo de desarrollo de NumPy1.21.2Se utiliza para manejar y procesar matrices numéricas de datos, como las funciones de vídeo, antes de que se introduzcan en el modelo de aprendizaje profundo.
PyTorchInvestigación en IA en Facebook1.8.0Se utiliza para definir la arquitectura del modelo, implementar las funciones de pérdida personalizadas y ejecutar la retropropagación para optimización.
PitónFundación de Software Python3.8.20Utilizado para escribir todos los scripts de procesamiento de datos, implementación de modelos, entrenamiento y evaluación
Conjunto de datos ShanghaiTechUniversidad ShanghaiTechSe utiliza para formación y evaluación en 13 escenas diferentes del campus.
UCF-Crime Dataset  Universidad de Florida CentralUtilizado para la formación y evaluación de 13 categorías de anomalías.
WikidatosFundación WikimediaSe utiliza como grafo de conocimiento externo para la construcción de prompts.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Artículos relacionados