研究文章

跨模态弱监督下可解释视频异常检测的语义锚点对齐模型

DOI:

10.3791/69286

2025年11月14日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议旨在通过整合结构化知识来改进弱监督视频异常检测。其目标是实现特定异常类型的分类,并为检测结果提供清晰、可解释的解释,超越简单的二元决策并提高透明度。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

弱监督视频异常检测是一项关键技术,它仅依靠视频级标签来识别异常事件。然而,传统的多实例学习(MIL)方法依赖于粗粒度二进制监督。这种方法使得很难区分细粒度的异常类别。这些方法通常只关注最异常的片段,导致检测结果缺乏可解释性。为了克服这些局限性,本研究提出了一种结合结构化知识的特征建模方法。弱监督视频异常检测利用动态语义引导机制,将外部类别级信息与可学习提示相结合,在特征空间内生成语义信号。这些信号与基本异常检测模块提取的视觉证据对齐,产生两个互补的输出:用于量化异常事件严重程度的异常评分,以及与外部概念一致的语义描述,可用于通过预定义模板生成结构化和可解释的解释性文本。实验结果表明,所提方法在UCF-Crime数据集上的AUC为88.03%,在ShanghaiTech数据集上为98.23%,在细粒度异常分类任务中达到了87.05%的准确率。此外,生成的语义解释将弱监督检测从二元分类任务扩展到语义驱动的、可解释的异常分析框架。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

视频异常检测 (VAD) 在公共安全和智能制造等领域发挥着至关重要的作用,它为手动监控的局限性提供了可扩展的解决方案1。特别是,弱监督视频异常检测(WS-VAD)因其对视频级标签的依赖而受到重视,大大减轻了手动标注的负担,同时提高了跨不同场景的通用性。尽管WS-VAD方法具有实际优势,但在精确识别异常事件的性质方面仍面临重大挑战2。现有模型经常检测异常的存在,但很难确定其确切类别或提供有意义的诊断信息 3,4。例如,在工业环境中,模型可能会将过热轴承产生的烟雾与无害的蒸汽排放混淆,或者错误地将正常的焊接火花视为火灾的早期迹象,这两者都会导致代价高昂的误判和不必要的停机。这些语义混淆源于当前WS-VAD方法的固有局限性5。二进制视频级标签仅指示是否存在异常,而无法深入了解其原因、位置和严重性。此外,主流的多实例学习(MIL)框架6使用简单的启发式7聚合剪辑级预测,无法捕获不同事件类型的细微语义。结果,学习到的视觉特征空间变得模糊,视觉上相似但语义上不同的现象(例如烟雾和蒸汽)映射得过于紧密,从而模糊了决策边界。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究仅使用公开可用的数据集(UCF-Crime13 和 ShanghaiTech14)。所有视频均来自数据集的官方版本,这些数据集在数据集维护者提供的范围内对个人身份信息进行匿名化。作者没有进行额外的数据收集或人类受试者互动;因此,不需要新的 IRB 批准。数据使用符合相应数据集的许可和使用条款。

数据准备和特征提取

数据集准备:采用UCF-Crime13 (1,610列车/290测试视频)和ShanghaiTech14 (238列车/199测试视频)数据集。使用 FFmpeg 对视频进行预处理以确保可重复性,重新编码为 H.264,重新采样为 25 fps,并使用以下命令调整为 256 x 256 分辨率:ffmpeg -i v.mp4 -vf “fps=25,scale=256:256” -c:v libx264 -crf 23 -preset veryfast pre/。

特征提取:RGB特征由在动力学数据集16上预训练的....

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

为了进一步验证语义锚点的效用,进行了额外的实验来比较不同的提示模板(见 表 1)。使用维基数据增强语义原型的变体不仅实现了更高的 AUC 值,而且还使生成的解释的 BLEU-4 分数提高了 16.6 和 14.8。这些发现表明,提示的语义丰富性与文本解释的质量之间存在密切联系,证实解释生成过程通过利用丰富的语义结构超越了僵化的模板填充。

对异常类型的卓越细粒度识别

该协议的有效性在UCF-Crime数据集上的细粒度异常识别任务中得到了进一步证明。如 表 2 所示,该框架在所有 IoU 阈值上都优于 VADCLIP9 等同样针对细粒度识别的方法,达到了 11.88 的最高平均分。这一结果支持了该研究的核心前提:精确的语义对齐对于提高识别准确性至关重要。在较高的IoU阈值下,性能提升变得更加明显,凸显了所提出的显著性.......

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

这里介绍的协议通过将范式从简单的二元分类转变为语义基础的可解释分析,引入了弱监督视频异常检测的重大进步。该方法的意义在于它不仅能够识别是否发生了异常,还能够识别它是什么类型的异常以及模型为何得出该结论,从而解决了现有WS-VAD系统9,29中的主要限制。

设计选择和基本原理

该方法由三个相互关联的阶段组成:基本检测模块、语义增强模块和基于模板的可解释性模块。整体架构如图 1 所示。对于基本异常检测阶段,时间上下文融合 (TCF) 模块旨在熟练地捕获复杂的时间连接。当前的方法要么无法通过强调局部相互作用来有效模拟远程相互依赖3,要么通过依赖全局自注意力20来充.......

访问受限。请登录或开始试用以查看此内容。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们感谢航天宏卡智能科技(北京)有限公司提供的资金支持。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论

BLIP模型

Salesforce 研究ViT-B/16用作文本编码器,用于创建语义锚点。
GPUNVIDIARTX 4060Ti用于训练模型
I3D模型谷歌DeepMind我已经用Kinetics和nbsp预先训练过;作为视频特征提取的骨干。
NumpyNumPy 开发团队1.21.2用于处理和处理数值数据阵列,如视频特征,然后再输入深度学习模型。
PyTorchFacebook人工智能研究1.8.0用于定义模型架构、实现自定义损耗函数以及运行反向传播以优化。
Python 软件基础3.8.20用于编写所有用于数据处理、模型实现、训练和评估的脚本
上海科技数据集上海科技大学用于13个不同校园场景的培训和评估。
UCF-犯罪数据集 中佛罗里达大学用于训练和评估13个异常类别。
维基数据维基媒体基金会用作提示构建的外部知识图谱。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. ....

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

相关文章