研究記事

クロスモーダル弱監視下での解釈可能なビデオ異常検出のためのセマンティックアンカーアライメントモデル

DOI:

10.3791/69286

2025年11月14日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このプロトコルは、構造化された知識を統合することにより、弱教師ありビデオの異常検出を改善することを目的としています。その目標は、特定の異常タイプの分類を可能にし、検出結果について明確で解釈可能な説明を提供し、単純な二項対立の決定を超えて透明性を高めることです。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

弱教師ありビデオの異常検出は、ビデオレベルのラベルのみに依存して異常なイベントを特定する重要な手法です。ただし、従来のマルチインスタンス学習 (MIL) 手法は、粗粒度のバイナリ監視に依存しています。このアプローチでは、きめ細かな異常カテゴリを区別することが困難になります。これらの方法は、多くの場合、最も異常なセグメントのみに焦点を当てているため、解釈可能性に欠ける検出結果が得られます。これらの制限を克服するために、この研究では、構造化された知識を組み込んだ特徴モデリングアプローチを提案します。弱教師ありビデオ異常検出は、動的セマンティック ガイダンス メカニズムを利用することで、外部カテゴリ レベルの情報と学習可能なプロンプトを組み合わせて、特徴空間内でセマンティック シグナルを生成します。これらの信号は、基本異常検出モジュールによって抽出された視覚的証拠と一致し、異常イベントの重大度を定量化するための異常スコアと、外部概念に沿ったセマンティックな説明という 2 つの補完的な出力を生成し、事前定義されたテンプレートを通じて構造化され解釈可能な説明テキストを生成するために使用できます。実験結果は、提案手法がUCF-Crimeデータセットで88.03%、ShanghaiTechデータセットで98.23%のAUCを達成し、きめ細かな異常分類タスクで87.05%の精度を達成することを実証しています。さらに、生成されたセマンティック説明は、弱教師あり検出を二項分類タスクからセマンティクス主導の解釈可能な異常分析フレームワークに拡張します。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ビデオ異常検出 (VAD) は、公共の安全やインテリジェント製造などの分野で重要な役割を果たしており、手動監視の限界に対するスケーラブルなソリューションを提供します1。特に、弱教師ありビデオ異常検出 (WS-VAD) は、ビデオレベルのラベルに依存しているため注目を集めており、手動アノテーションの負担を大幅に軽減すると同時に、さまざまなシーンにわたる一般化可能性が向上しています。WS-VAD 法は、その実用的な利点にもかかわらず、異常事象の性質を正確に特定する上で依然として重大な課題に直面しています2。既存のモデルは、多くの場合、異常の存在を検出しますが、正確なカテゴリを特定したり、意味のある診断情報を提供したりするのに苦労しています3,4。たとえば、産業環境では、モデルが過熱したベアリングからの煙と無害な蒸気の放出を混同したり、通常の溶接火花を火災の初期兆候と誤って信じたりする可能性があり、どちらもコストのかかる誤判断や不必要なシャットダウンにつながります。これらの意味論的混乱は、現在の WS-VAD アプローチの固有の制限から生じます5。バイナリビデオレベルのラベルは、異常が存在するかどうかを示すだけで、その原因、場所、重大度に関する洞察は提供されません。さらに、主流のマルチインスタンス学習(MIL)フレームワーク6は、単純なヒューリスティック7を使用してクリップレベルの予測を集約し、異なるイベントタイプの微妙な意味論を捉えることができません。その結果、学習した視覚的特徴空間はあいまいになり、煙や蒸気など、視覚的には類似しているが意味的に異なる現象があまりにも密接にマッピングされ、決定の境界が曖昧になります。

これらの制限に対処するために、2 つの主要な研究方向が浮上しています。1つは、改善された時間モデリング458 または顕著性誘導特徴選択3を通じてMILフレームワークを強化することに焦点を当てています。このような方法は異常のローカリゼーションを改善しますが、意味の明確さと解釈可能性を提供するには依然として不十分です。もう1つの方向性は、VadCLIP9などの事前トレーニングされたマルチモーダルモデルを統合することにより、視覚と言語表現を調整することです。この戦略は有望ですが、言語の意味の豊かさを十分に活用できないことがよくあります。これにより、モード間の関連性が弱くなり、意思決定プロセスが不透明になり、2 つの主要な欠陥が生じます。まず、現在のモデルでは、特徴の意味論が曖昧で外部知識が不十分なため、異常カテゴリを一貫して区別できません。第二に、意思決定プロセスにはブラックボックスが含まれており、特定のイベントが異常として分類される理由についての透明性のある説明がありません。一部の方法にはテキスト プロンプト (戦闘、射撃など) が組み込まれていますが、これらは常に単純で緩やかに構成されており、意味の深さと文脈の理解の両方が欠けています。

これらのギャップに対処するために、構造化された外部知識と解釈可能な意思決定メカニズムを統合する新しいWS-VAD手法が導入され、これは説明可能な人工知能(XAI)10のより広範な分野における中心的な目的です。基本的なカテゴリ名をプロンプトとして使用する代わりに、このメソッドはウィキデータ11を使用して、セマンティックコンセプトクラウドと呼ばれる豊富なセマンティック表現を構築します。静的なテキスト プロンプトや単純なカテゴリ ラベルに依存する VadCLIP9 などの既存のマルチモーダル手法とは異なり、これらのセマンティック コンセプト クラウドは、構造化されたナレッジ グラフから抽出された関連エンティティ、属性、因果関係を含む包括的なコンテキスト知識をカプセル化します。これらのコンセプト クラウドは、BLIP モデル12 を使用してセマンティック アンカーにエンコードされ、システムがきめ細かなイベント セマンティクスにアクセスできるようにします。セマンティック アンカー メカニズムの主な革新は、特定の異常コンテキストに適応する動的で知識が豊富な表現を作成する能力にありますが、以前のプロンプトベースの方法では、コンテキストの深さや意味関係を欠いた固定テキスト記述が使用されていました。特徴空間をさらに細化するために、顕著性誘導アライメントメカニズムは、これらのアンカーを最も関連性の高い視覚的証拠に選択的に関連付けます。このターゲットを絞ったアライメントにより、検出結果の意味論的明瞭さが向上しながら、特徴の識別力が向上します。さらに重要なことは、提案された方法が透明性のある解釈をサポートしていることです。セマンティック アンカーが視覚的証拠と一致すると、モデルは事前定義されたテンプレートを使用して構造化された自然言語説明を生成し、異常の性質と正当化の両方に明示的に対応します。この方法の実装は、事前に抽出された I3D ビジュアル機能の使用、外部ナレッジ ベース (Wikidata) へのアクセス、事前トレーニングされた BLIP エンコーダーなど、特定の前提条件に依存していることに注意することが重要です。したがって、このフレームワークは、単純なバイナリ検出を超えて、特定の異常タイプを分類し、結果の解釈可能な正当化を提供することが重要なアプリケーションで最も有益です。

主な貢献は以下の通りである。新しいWS-VAD手法は、外部の知識と構造化された解釈可能性を組み合わせて開発され、意味理解と意思決定の透明性を向上させます。セマンティック埋め込みベースのプロンプト手法とコンテキスト認識アライメントメカニズムを導入し、ビジュアルのみのMILモデルの限界を克服します。生成説明モジュールが組み込まれており、意味アンカーを解釈可能な単位として使用して、首尾一貫したテキストの理論的根拠を生成します。UCF-Crime と ShanghaiTech のデータセットで実施された広範な実験により、提案された方法の有効性が実証され、強力な AUC スコア (88.03% / 98.23%) と優れたきめ細かな認識パフォーマンスを達成し、明確で解釈可能な出力が得られます。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究では、公開されているデータセット (UCF-Crime13 および ShanghaiTech14) のみを使用しています。すべてのビデオは、データセットのメンテナから提供された範囲で個人を特定できる情報を匿名化するデータセットの公式リリースから取得されました。著者らは追加のデータ収集やヒト被験者との相互作用は行わなかった。したがって、新たなIRBの承認は必要ありませんでした。データ使用は、それぞれのデータセットのライセンスおよび利用規約に準拠しています。

データの準備と特徴抽出

データセットの準備:UCF-Crime13 (1,610 列車/290 テスト ビデオ) と ShanghaiTech14 (238 列車/199 テスト ビデオ) のデータセットは、標準分割で採用されました。ビデオは、再現性を確保するためにFFmpegを使用して前処理され、H.264に再エンコードされ、25fpsにリサンプリングされ、コマンドで256 x 256解像度にサイズ変更されました:ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/。

特徴抽出:RGB特徴は、キネティクスデータセット16で事前トレーニングされたI3Dバックボーン15によって抽出された。ビデオは重複しない 16 フレームのクリップに分割されました。各クリップは中央で 224 x 224 ピクセルにトリミングされました。最後から2番目の層の活性化は、クリップごとに1024-Dの特徴を得るために平均プールされました。PyTorch では、これは I3D バックボーンを介して形状 [B, 3, T, H, W] のテンソルを転送し、adaptive_avg_pool3dを適用してからフラット化することに対応します。抽出された特徴は、正確な再現性(シード= 123)のためにクリップのタイムスタンプとともに.npyファイル(ビデオごとに1つ)に保存されました。各ビデオについて、features///

モデルのアーキテクチャと方法論

基本的な検出:時間的コンテキスト融合
特徴行列 Z figure-protocol-1 RTx1024 で表されるビデオ クリップ シーケンスが与えられた場合、Temporal Context Fusion (TCF) モジュールは、最初に 3 つの学習した線形投影を通じてクエリ、キー、および値の表現を計算しました。

Q = ZWQ、K = ZWK、V = ZWV (1)

ここで、WQWKWV figure-protocol-2RTx1024xd はトレーニング可能なパラメーター (PyTorch: 3 nn.線形(1024,d)レイヤー)。セグメント間の親和性はS = figure-protocol-3であり、時間的関係性埋め込み(TRE)が組み込まれており、各要素はRij = α exp(figure-protocol-4)+ βとして計算されました。位置認識アフィニティは figure-protocol-5 = S + R でしたグローバルコンテキストマップA = softmax(figure-protocol-6)は、広域特徴G = AVを取得するためにVを集約しました。局所特徴 L は、深さ方向の 1 次元畳み込み (nn.Conv1d) を Z 上のカーネルサイズ 3 に置き換えます。動的ゲートg = σ(MLP([G;L]))は、U = gfigure-protocol-7 G +(1 - g)figure-protocol-8Lの2つを混合しました。最後に、層の正規化と残差線形層を適用して、Y(Pytorch:LayerNorm+Linear+residual)を生成しました。 

基本的な検出:因果時間的予測子

出力 Y は、GELU とドロップアウト (Pytorch:padding='causal' またはマスクされた conv) による 2 つの因果 1 次元畳み込みを通過させ、クリップごとの異常ロジットを取得しました。シグモイド関数を適用すると、確率値は [0,1]T figure-protocol-9得られました。

セマンティックエンハンスメント:外部知識による迅速な学習

セマンティックアンカーの構築 : 各異常クラスcについて、Kcの概念をウィキデータ11から照会し、エンコードされた各概念フレーズは、BLIPの12テキストエンコーダーでeifigure-protocol-10R768にエンコードされました。クラスアンカーは、l2正規化平均D c =norm(figure-protocol-11Σiei)でした。ノイズを減らすために、クラス名とのコサイン類似性が0.2未満の概念は削除され、TF-IDFスコアによる上位Mは維持されました。  

コンテキスト依存分離の実行 :前景 の重み α t = softmax(rst) は、ベース検出器スコア st と背景の重み bt = softmax(r(1 - st)) から計算されました。重み付けされた特徴は、 ffg = Σtαztおよびfbg = Σtbztです。

視覚的特徴と意味的特徴の整列

配置の目的を定義する: 配置ステップでは、前景の視覚的特徴と、特徴空間内の異常カテゴリの対応するセマンティック アンカーとの間の距離を最小化することが目的です。C 異常カテゴリのセマンティック ガイドと 1 つの標準の通常のセマンティック ガイドで構成されるセマンティック ガイドのコレクション figure-protocol-12 を作成します。尤度を決定する P(Dk|v)、視覚的特徴 v は、k 番目の意味ガイド Dk に対応します。式(2)に示すように、温度スケールのコサイン類似度とそれに続くSoftmax正規化を使用してこれを計算します。

figure-protocol-13(2)

クロスエントロピーは、学習可能なパラメータとして τsを設定し、10に初期化することで、正のペアを一緒に押し、負のペアを離すように最小化しました。正のサンプルペアを相関させる可能性を最適化し、負のサンプルペアを相関させる可能性を減らすことで、アライメントを実現します。

テンプレートベースの解釈可能性モジュール

外部知識によるプロンプト学習(PLE)で強化された特徴表現に基づいて、線形分類器はクラスごとのロジットを生成し、その後、softmax関数によってクラス確率に正規化されます。予測された異常タイプは、確率が最も高いカテゴリとして決定されました。一方、検出器の出力からグローバルな異常スコアが計算されました。重大度レベルを決定するために、このスコアを、検証セットのグリッド検索によって最適化された 3 つの事前定義されたしきい値と比較しました。

デフォルトのしきい値は、θ =0.8、θ中=0.5、θ=0.2に設定されました。具体的には、スコアがθより大きい場合、重症度は高とラベル付けされました。スコアが θ中と θの間にある場合、中とラベル付けされました。θとθ中の間にある場合、それは低としてラベル付けされました。それ以外の場合は、なしとしてマークされました。

説明生成フェーズでは、予測されたタイプに対応するテンプレートが、定義済みのテンプレートライブラリである 補足ファイル 1 から選択されました。このライブラリは、生成されたテキストの多様性を高めるために、複数のアノテーター17 によって交差検証された複数のテンプレートバリアントを含んでいる。予測された型がテンプレートライブラリに存在する場合、対応するテンプレートがランダムに選択されました。それ以外の場合は、不明タイプのデフォルト・テンプレートが使用されました。最後に、予測されたタイプ、グローバル異常スコア、重大度の説明、および選択したテンプレートを統合して、構造化された説明テキストが生成されました。システムは、予測された異常タイプ、グローバル異常スコア、および生成された説明テキストを最終出力として返します。結果を 図 2 に示します。

すべてのしきい値パラメータは、検証セットのグリッド検索を使用して最適化され、生成された説明の品質は、人間による評価と自動メトリックの両方を使用して包括的に評価されました。結果を 表1に示します。

モデルのトレーニングと評価

トレーニング: モデルは、Adam (lr 1 x 10-4、重み減衰 5 x 10-4)、バッチ サイズ 128、50 エポック、lr のコサイン アニーリングを使用してエンドツーエンドでトレーニングされました。Python/Numpy/Pytorch のランダムシードは 123 に設定され、torch.backends.cudnn.deterministic=True を有効にしました。チェックポイントは 5 エポックごとに checkpoints//epoch_XX.pt に保存され、検証 AUC によって最適なモデルが選択されました。すべての実験は、Windows 11、Python 3.8.20、PyTorch 1.8.0、CUDA 11.1 を搭載した NVIDIA GeForce RTX 4060 Ti (16GB) GPU を搭載したシステムで実施されました。エポックあたりのおおよそのトレーニング時間は、ShanghaiTechデータセットで30秒、UCF-Crimeデータセットで3.5分でした。

損失: 全体的な目的は、 L = LMIL+ λ • Lalign です。ハイパーパラメータλは、検証セットのセット{0.01,0.1,0.5,1,5,10}を横切ってスイープされ、テストレポート用に固定された最適な値を固定しました。上位K MIL集計については 図3 、定義については式(3-4)を参照してください。

figure-protocol-14(3)

figure-protocol-15(4)

評価: フレーム レベルの AUC は、以前の WS-VAD 作品で使用されていた標準プロトコルに従って計算されました 2,5。UCF-Crimeのきめ細かな型認識については、表2に要約されているように、IoU 0.1-0.5でのmAPとAVG mAPが報告されました。クラスごとのAUCを図4に示し、全体的な結果を表3表4に示します。埋め込み分離可能性と異常スコアのダイナミクスを図4図5および図6に示します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

セマンティックアンカーの有用性をさらに検証するために、さまざまなプロンプトテンプレートを比較する追加の実験が実施されました( 表1を参照)。ウィキデータ拡張セマンティックプロトタイプを使用したバリアントは、より高いAUC値を達成しただけでなく、生成された説明のBLEU-4スコアを16.6と14.8に改善しました。これらの発見は、プロンプトの意味の豊かさとテキスト解釈の質との間に強い関連性があることを示しており、説明生成プロセスが充実した意味構造を活用することで厳格なテンプレート入力を超えていることを確認しています。

異常タイプの優れたきめ細かな認識

このプロトコルの有効性は、UCF-Crimeデータセットのきめ細かな異常認識タスクでさらに実証されています。 表2に示すように、このフレームワークは、同じくきめ細かな認識を目標とするVADCLIP

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ここで紹介するプロトコルは、パラダイムを単純な二項分類から意味的に根拠のある解釈可能な分析に移行することにより、弱教師ありビデオ異常検出の大幅な進歩をもたらします。この方法の重要性は、異常が発生したかどうかだけでなく、それがどのような種類の異常であり、モデルがなぜその結論に達したのかを識別できることにあり、既存のWS-VADシステムの主要な制限に対処します9,29

設計上の選択と理論的根拠

この方法は、基本検出モジュール、セマンティック拡張モジュール、およびテンプレートベースの解釈可能性モジュールの 3 つの相互接続された段階で構成されています。全体的なアーキテクチャを 図 1 に示します。基本的な異常検出フェーズでは、時間的コンテキスト フュージョ...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者には利益相反はありません。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aerospace Hongka Intelligent Technology (Beijing) CO., LTD からの財政的支援に感謝します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント

BLIPモデル

SalesforceリサーチViT-B/16セマンティックアンカーを作成するためのテキストエンコーダとして使用されます。
GPUNVIDIARTX 4060Tiモデルのトレーニングに使用
I3DモデルGoogleでDeepMindを検索してくださいKineticsで事前訓練を受けており、ビデオ特徴抽出のバックボーンとして使用されます。
ナンピーNumPy開発チーム1.21.2ビデオ特徴量などの数値データ配列をディープラーニングモデルに入力する前に処理・処理するために使用されます。
パイトーチFacebookのAI研究1.8.0モデルアーキテクチャの定義、カスタム損失関数の実装、最適化のためのバックプロパゲーションの実行に使用されます。
ニシキヘビPythonソフトウェア財団3.8.20データ処理、モデル実装、トレーニング、評価のためのすべてのスクリプト作成に使用されました
上海科技大学データセット上海工業大学13の異なるキャンパスシーンでトレーニングと評価に使用されました。
UCF-犯罪データセット セントラルフロリダ大学13の異常カテゴリーの訓練および評価に使用されます。
ウィキデータウィキメディア財団プロンプト作成のための外部知識グラフとして使用されます。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

関連記事