本研究では、事前学習済みのGARNNモデルを用いて視聴覚機能を統合することにより、動画要約のためのマルチモーダル深層学習フレームワークを提案します。このシステムは、GRU、AlexNet、および敵対的 LSTM 分類器を活用して、キーフレーム検出を強化し、冗長性を低減し、平均 F スコア 0.985 という高い要約精度を実現します。
研究記事
本研究では、事前学習済みのGARNNモデルを用いて視聴覚機能を統合することにより、動画要約のためのマルチモーダル深層学習フレームワークを提案します。このシステムは、GRU、AlexNet、および敵対的 LSTM 分類器を活用して、キーフレーム検出を強化し、冗長性を低減し、平均 F スコア 0.985 という高い要約精度を実現します。
ビデオの要約は、重要なコンテンツを保持して、長いビデオの簡潔なバージョンを作成することに重点を置いています。この研究は、GARNN と呼ばれる事前トレーニング済みのゲート リカレント ニューラル ネットワーク アーキテクチャを使用し、ゲート リカレント ユニット (GRU) と AlexNet を組み合わせて、オーディオ、画像、および視覚的特徴を抽出することにより、視覚情報と聴覚情報を統合するマルチモーダル機械学習戦略を明らかにしました。キーフレーム検出は、冗長なフレームを削除し、モーション補正された特徴削減を適用し、その後、オプションの PCA ベースの次元削減を適用することで改善されます。敵対的エンコーダーベースの長短期記憶(AE-LSTM)分類器は、要約の精度を高めることにより、時間モデリングに採用されています。結果は感度、Fスコア、陽性的中率を用いて評価し、平均Fスコアは0.985であった。ゲート付き AlexNet はマルチモーダル GARNN-AE-LSTM フレームワークに導入され、モーション補正 PCA ベースの削減により冗長性が排除され、GRU が時間的進行を記録し、ゲーティングが空間特徴の選択を微調整し、これらすべてがより正確で効率的なビデオ要約システムに貢献します。改善された F1 スコアは、意味のあるビデオを作成することで、ビデオ要約の精度を生成するモデルの有効性を示しています。このアプローチは、堅牢なビデオ分析と圧縮のためのマルチモーダル特徴抽出と高度な深層学習技術の可能性を強調しています。
マルチモーダル分析 (MMA) システムが登場し、オーディオ、ビデオ、テキスト、センサー データなどのいくつかのモダリティを組み合わせて、生徒がどのように学習するかについての洞察を提供します1.これらのテクノロジーは、マルチモーダル データを評価することで、生徒の行動とエンゲージメント レベルを完全に理解するのに役立ちます2。ただし、効率的な MMA システムの作成に関しては、多くの障害や制限があります3.インターネットとセキュリティカメラの成長により、デジタルビデオが大量に存在します。これらのビデオをデータベースにまとめることが不可欠です。この状況では、ビデオの概要が役立ちます。実際のビデオの有用な概要の作成はビデオ要約として知られており、アクティビティの追跡、異常検出、およびビデオの取得に役立ちます4。ビデオの概要は、さまざまな戦略を使用して実現できます。これらの方法は、抽出的および抽象的なビデオ要約など、2つのカテゴリ5,のいずれかに分類されます。
動画の要約には多くの計算が必要なため、効率的な方法が必要です。ムービーのすべてのフレームが選択のために調べられると、要約プロセスが遅くて時間がかかり、処理リソースが同一または類似のフレームに費やされる可能性があります。さらに、プロセスを迅速化し、重要な機能のみが考慮されるようにするには、任意の機能セットに対してスペースを削減する必要があります6。ビデオ要約のための技術は、生成され、エンドユーザ7, またはそれらの出力に表示される視聴覚信号の種類に基づいて、4つの主要な領域に分類することができる。より具体的には、ビデオ要約計算の結果は、次のものを含むことができる:(i)一般に静的要約として知られている抽出されたビデオフレームが順次表示される一次フレーム8;(ii)動的要約と呼ばれるビデオフレーム9。(iii)視覚信号10は、他の手がかりにグラフィカルベースの構文を追加することにより、エンドユーザのための要約を強化する。(iv)ビデオ情報の効率的な要約を提供するように設計された、コンピューターによって生成されたテキスト注釈11。
キーフレームに基づく要約は、通常、キーショットに基づく要約よりも小さくなります。キーフレームとは、ビデオから選択された個々の代表的なフレームを指します。キーショットとは、キーフレームを中心にグループ化されたビデオフレームの短い連続セグメントを指します。サマリークラスは、分類子の出力ラベル付けフレームまたはセグメントを、有益(要約に含まれる)または非有益(除外される)として参照します。 それにもかかわらず、この利点は、要約の過程で重要な詳細を省略する代償を払ってもたらされます。たとえば、キーフレームベースの要約で先行フレームのコンテキストを取得するのは難しい場合があります。また、元のサウンドも欠けています。これらの問題に対処するために、キーショットベースのビデオ要約手法が頻繁に選択されます。Keyshot ベースのビデオ要約手法は、長編または短編ビデオのサブセットを作成するために利用されます。通常、短編動画と長編動画の長さはそれぞれ 10 分未満と 10 分を超えています12。短編動画のキーショット支援サブセットの生成は非現実的であり、すでに短い再生時間のために成功しない可能性があります。さらに、長編ビデオ、特に映画やスポーツビデオの再生時間は90分を超える場合があります。このようなビデオカテゴリの場合、キーショットベースの要約手法は、ユーザーに簡単な概要を提供する上でより有用かつ効率的です。
ビデオの要約は主観的な性質を持っているため、困難な作業になります。これは、同等のビデオコンテンツであっても、ユーザーごとに異なる好みを持っているという事実によるものです。この問題は、カスタマイズされたビデオ要約アプローチ13の助けを借りて正確に解決することができる。アルゴリズムの目標は、各ユーザーの興味に合わせたコンテンツを提供することです。ただし、新しい長編動画(スポーツイベントなど)に最適な長さのアダプテーションされた動画の概要は、すぐには入手できません。現在の方法14,15では、個別の要約をリアルタイムで提供するために、顧客の好みデータとビデオ映像を評価するために膨大なコンピューターリソースが必要です。リアルタイムのパーソナライズされたビデオ要約は、集中型専用サーバーから取得できます。Babu Veesam と Satish16 は、膨大な量のビデオ データを効果的に圧縮する広く使用されているアプローチを示す、すべての主要なビデオ要約戦略の徹底的な分類学的分析について議論しました。このレビューでは、マルチモーダル統合戦略、深層学習フレームワーク、クラスタリングベースの手法などの基本的なアプローチに関連して、方法論を分類および評価します。注目すべき方法としては、教師あり要約に知識蒸留を使用するKDANフレームワークと、人工藻類アルゴリズムによって最適化されたDBSCANクラスタリングを使用するSVS_MCO方法があります。さらに、このレビューでは、動的でマルチモーダルなビデオ要約の問題を管理するのに非常に効果的であることがわかっている、視聴覚リカレントネットワークやクエリベースのディープアフリカハゲワシ学習などの高度なモデルを提供しています。
ビデオ要約のためのゲート付き AlexNet リカレント ニューラル ネットワーク (GARNN-AE-LSTM) マルチモーダル フレームワークが含まれていることが、この研究を斬新なものにしている理由です。このアプローチは、モーション補正PCAによる冗長性の削減、GRUによる時間ダイナミクスのキャプチャ、ゲーティング方式による空間特徴選択の最適化により、ビデオ要約プロセスの精度と効率を向上させます。複雑さを軽減しながらビデオ要約を効率的に提供するために、本論文は以下に貢献しています。(i) マルチモーダルビデオ要約: ゲート付き RNN と AlexNet を組み合わせた事前トレーニング済みの GARNN モデルを使用して、視覚情報と聴覚情報の両方を統合することにより、簡潔なビデオ要約を生成するフレームワークを提案しました。(ii) 特徴量の改良のためのゲート付き AlexNet: AlexNet の高密度層に新しいゲート メカニズム (シグモイド ゲート) を導入して、無関係な空間特徴をフィルタリングし、それによって高レベルの視覚的特徴の抽出を強化しました。RNNとの統合により、フレーム間の依存関係の効果的な時間モデリングが可能になります。(iii) 冗長フレームの除去: キーフレーム検出前に同一または類似のフレームを削除し、その後、効率的な特徴表現のためにオプションの PCA ベースの次元削減を行うためのモーション補正分散ベースのアプローチを開発しました。(iv) 正確なキーフレーム検出: 時間モデリングに敵対的エンコーダーベースの LSTM 分類器を採用し、平均 F スコア 0.985 を達成し、ベースライン アプローチと比較して優れた要約精度を実証しました。(v) トランスフォーマーモデルに対する効率:提案されたGARNNモデルは計算効率が高く、AlexNetは空間特徴を効果的にキャプチャし、RNNモデルは逐次依存関係をモデル化し、ゲートメカニズムは重要でないフレームを除外し、特徴の選択と要約においてトランスフォーマーベースの代替案よりも優れていることを示しました。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究では、一般にビデオスキミングと呼ばれる一般的なビデオ要約カテゴリに分類されるマルチモーダルな教師ありビデオ要約方法を提案します。これには、大きなビデオの主要なセグメントを見つけて、時間的に凝縮されたバージョンを作成することに集中する手法が含まれます。この研究は、 図1に示すように、オーディオとビジュアル表現を含む1秒のセクションでビデオストリームを分析する教師あり手法を提案しています。これらのセグメントは、「面白くない」または「有益な」のいずれかに分類されます。合成データやシミュレーションデータとは対照的に、「リアルデータ」は、実験に利用される実際のビデオデータセットを指します。要約に必要な重要なオーディオビジュアル信号(ハイモーション、音声、シーントランジションなど)を提供するビデオセグメントは、「情報セグメント」と呼ばれます。「面白くない」部分は、あらすじに新しいものを追加しない反復的または冗長なフレームとして定義されます。
入力されたビデオはフレームに分割され、提案されたGARNNモデルを使用して各フレームからマルチモーダル特徴が抽出されます。オーディオとビジュアルの機能は融合され、次元削減フェーズへの入力として供給され、冗長なフレームはさらに処理するために削除されます。最後に、提案されたAELSTMを、ビデオ要約のために削減されたデータに適用します。これを実現するには、マルチモダリティと呼ばれる、視覚、音声、または混合モダリティからの特徴表現でトレーニングされた教師ありバイナリ分類器が使用されます。

図1:提案されたビデオ要約モデルの概要。 パイプラインには、マルチモーダル特徴抽出、次元削減、AELSTM を使用した要約生成が含まれます。 この図の拡大版を表示するには、ここをクリックしてください。
データセット
提案されたソリューションの有効性は、静的ビデオ要約のベンチマークデータセットのペアであるVSUMM17 データセットとSumMe18 データセットを使用して決定されます。AlexNet と LSTM を使用して作成された CNN 特徴量と実際のデータがデータセットの中にあります。実際のデータとデータセットは一般の人々がアクセスできます19.VSUMMデータセットの50本の映画は、YouTubeなどのWebサイトからのもので、毎秒30フレームで110分に及びます。漫画、ニュース、スポーツ、広告、テレビシリーズ、ホームビデオなど、さまざまなジャンルがあります。このうち、有名なYouTubeサイトから入手した休日、お祭り、スポーツを含んだ25本の動画が、少なくとも15件の人間が生成した要約(合計390件)がタグ付けされ、「SumMe」20 の動画要約データセットを構成しています。ビデオの長さの範囲は1〜6分です。
元のビデオはRGB画像に変換され、特徴抽出のために事前トレーニングされた提案されたGARNNモデルに入力として入力されます。このモデルは、AlexNetとゲートRNNで構成されています。元の機能数は 64 で、AlexNet の機能には 4100 の機能があります。
Gated-AlexNet-RNNベースの特徴抽出の提案
ビデオを要約するために、情報の視覚モードと音声モードの両方が使用されています。両方のモダリティで特徴表現を実現するために、画像検索、ビデオ分類、聴覚シーン分析、音楽情報検索など、オーディオおよびビジュアルのクラスタリングおよび分類タスクでよく使用される手作りの特徴を特定しました。目標は、できるだけ多くの教育用ビジュアルおよびオーディオコンポーネントを含めることでした。 図 2 は、オーディオおよびビジュアルモダリティの特徴を抽出するために使用されるプロセスの概念図を示しています。

図2:提案されたマルチモーダルGARNNベースの特徴抽出。 視覚モダリティとオーディオモダリティの両方から特徴は、AlexNetおよびGARNNコンポーネントを使用して抽出されます。 この図の拡大版を表示するには、ここをクリックしてください。
ゲート - AlexNetRNN: (GARNN)
仮想像解析では、CNNが一般的なDLモデル21である。一般に、CNN は画像を入力として使用し、それをいくつかのグループに分割します。入力ニューロン、畳み込みプーリングを持つ一連の層、完全にリンクされた層、および正規化層がその構造を構成します22。畳み込み層のニューロンは、狭い領域を介して前の層に接続されています。その下の層は、完全にリンクされた層の活性化ニューロンに完全に接続されています。式(1)は、完全結合関数の順方向および逆方向の伝播を表します。
(1)
(2)
ここで、
は l番目の層の i番目のニューロンの活性化、 は
は l番目の層の i番目のニューロンの勾配
、 は l+1番目の層の i番目のニューロンの重みです。最近の研究の進歩の結果として、数多くのCNNデザインが登場しました。この作品では AlexNet が使用されています。
図 3 に示す AlexNet のアーキテクチャは、細心の注意を払って適切に構造化された設計を反映しています。3つの完全に接続された層と5つの畳み込み層が、8つの学習層を構成しています。クラスラベルは、最後の層の結果をsoftmaxをアクティブにする関数に入力することによって生成されます。第 2 層、第 4 層、または第 5 層のカーネルは、GPU 共有を介して先行レベルに接続されます。2 層目と 3 層目のカーネルは互いに完全に接続されています。正規化層は、第 1 レベルと第 2 レベルの後に最大プーリング層に接続されます。ReLUは、すべての学習層にリンクされています。

図3:AlexNetのアーキテクチャ。 5 つの畳み込み層と 3 つの完全結合層を使用して、要約モデルで視覚データを処理します。 この図の拡大版を表示するには、ここをクリックしてください。
この作業の主要なバックボーンネットワークは、高密度層のGARNNでした。厚いRNNには3つの層があります。2 番目の層に 80 個のニューロン、第 1 層に 170 個のニューロンがあり、2 つの完全接続 (fc) 層で構成されています。次のレイヤーは、バッチ正規化とドロップアウトです。最後の層であるfcは3つのニューロンで構成され、画像を分割するために使用されます。LSTMの後に来る緻密な層は、脳腫瘍の周囲の領域を分割します。AlexNetはLSTMレイヤーの特徴を与えます。データセットには最大 20 個のスライスがあり、これは宣言されたシーケンスの総数に等しくなります。GARNNの最初の層には100個の隠しユニットが含まれ、3番目の層には125個の隠しユニットが含まれています。
ゲーティングメカニズムは、提案されたGARNN-AE-LSTMフレームワークのAlexNetの高密度(完全にリンクされた)層に組み込まれました。畳み込み特徴マップは、多くの場合、AlexNetによって処理され、分類のために完全接続された層に直接送信されます。冗長なパターンや重要度の低いパターンを含む、取得されたすべての空間特性は、この方法によって均等に扱われます。この問題に対処したのは、特徴フィルターとして機能し、シグモイドに基づくゲーティング関数を導入することです。数学的には、ゲートベクトルg = σ(wX) + bは、σシグモイド関数を表し、高密度層の出力を変調します。トレーニング中、このゲートは 0 から 1 の範囲のさまざまな特徴活性化の重みを与えることを学習します。それらは次のとおりです。(i)低いゲート値は、無関係な機能(バックグラウンドノイズや冗長なテクスチャなど)を抑制します。(ii) ゲート値が高いほど、識別可能な特徴 (重要な物体領域やモーションセンシティブ パターンなど) が強調表示されます。(iii) この改善された機能セットは RNN コンポーネントによって使用され、無関係な空間情報によって脇道にそれることなく、時間的依存関係をより適切に捉えることができます。(iv)バックプロパゲーションは、AlexNetおよびRNNと連携してトレーニング中にゲーティングパラメータを変更するために使用されます。これは、時間の経過とともに、モデルが抽出する特徴に加えて、要約に最も重要な側面を学習することを意味します。
図4では、変数Xは入力データ、Cはセル、Hは隠れ状態を表しています。

図4:ゲートリカレントニューラルネットワークアーキテクチャ(GARNN)モデル。 GARNNは、バッチ正規化、ドロップアウト、および複数の高密度層を統合して、効果的なシーケンスモデリングを実現します。 この図の拡大版を表示するには、ここをクリックしてください。
各ブロックでは、式(3)から式(5)のように、Iw、Rw、および入力、リカレントウェイト、バイアスと呼ばれるバイアスなどのそれぞれの重みが利用されています
(3)
(4)
(5)
特定のタイムスタンプtで、セルの状態は式(6)のように示されます
(6)
ここで、
Hadamard の積と隠れた単位の状態は、式 (7) のように示されます。
(7)
したがって、py Audio Analysis モジュールを利用して、ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23 を利用して、対応するビデオファイルから抽出されたすべてのオーディオクリップのセグメントレベルのオーディオ特性を計算します。抽出された特徴を 表 1 に示します。 このプロセスに従って、オーディオ特徴の抽出は最初は一時的に行われます。リプレゼンテーションの最後の部分は、2 番目のレベルで計算されるセグメント レベルのフィーチャ統計で構成されます。具体的には、オーディオ信号のセグメントごとに短期処理が実行され、その結果、セグメントレベルのウィンドウごとに68の短期特徴(34の特徴と34のデルタ)が計算され、重複または非重複する可能性があります。映像の音声信号から聴覚要素を抽出するほか、視覚情報の内容を伝えるために、さまざまな視覚特性を駆使してきました。このモダリティは、要約プロセスにとって重要であると予想されます。multimodal_movie_analysisライブラリ(https://github.com/tyiannak/multimodal_movie_analysis)は、これらの視覚的要素を抽出するために、ビデオの視覚的側面を反映する特徴を抽出するために使用されてきました。具体的には、以下にリストされている88の視覚要素は、0.2秒ごとに一致するフレームから取得されます。この中では、マルチモーダル特徴が融合され、合計59の特徴が、動画の要約を行うことで、動画を有益で面白くないものとして分類するためのさらなる分析に用いられる。
PCAを使用した特徴量の削減
この研究の特徴の次元は、主成分分析 (PCA) の適用によって縮小されました。基本的な特性は、その卓越性と重要性を高めるために主要な機能に変換されます。PCAは、さまざまな分野の多くの研究者によって広く使用されています24。固有値は、プロパティを決定するために使用されます。最も高い固有値特徴量が選択され、最も低い固有値特徴量が削除されます。
余分なフレームの削除に続いて、この研究ではオプションの特徴削減ステップとしてPCAが使用されます。PCAは、GARNNによって生成された高次元特徴ベクトルを小さな部分空間に圧縮することにより、ノイズと冗長情報を抑制します。これにより、AE-LSTMの計算効率が向上し、キーフレーム検出が最も識別力のある視覚的および聴覚的手がかりによって支配されることが保証されます。ビデオ要約のスケーラビリティと精度のバランスをとるために、PCA は便利なツールとして利用されます。アルゴリズム(アルゴリズム1)は、 補足ファイル1として提供されます。
前のフレームとまったく同じ、または驚くほど同等のフレームは、冗長と見なされます。フレームレートを変更すると、削除されるビデオ フレームの割合に影響を与える可能性があることは明らかです。具体的には、フレームレートが上がると、連続するフレーム間の類似性も高まり、削除されるフレームの割合が高くなります。現在、次元削減された特徴量は、敵対的 AE-LSTM モデルと呼ばれる ML モデルのトレーニングに使用されます。
AELSTM を使用したトレーニング
GAN25 と呼ばれるニューラルネットワークは、i)未知の分布に似たデータを作成する「ジェネレータ」ネットワーク(G)と、作成されたサンプルと実際の観測からのサンプルを区別する「ディスクリミネーター」ネットワーク(D)の2つの競合するサブネットワークで構成されています。目的は、実際のデータ分布に適合させながら、ディスクリミネーターが間違いを犯す可能性を最大化するジェネレーターを見つけることです。
Xが入力で、Eが事前入力ノイズであると仮定すると、X'= g(E)が生成されたサンプルです。ミニマックス最適化を使用して、学習が定式化されます。
(8)
ここで、D は分類の正しい確率を取得する資格があります。開発したトレーニングモデルのコンポーネントを 図5に示します。セレクター LSTM は、入力ビデオ シーケンス X からフレームのサブセットを選択します。選択したフレームは、エンコーダ LSTM を使用して固定長の特徴 E に変換され、続いてデコーダ LSTM を使用してビデオ再構成 X' に変換されます。X' の実際のビデオまたは要約クラスへの分類は、ディスクリミネーター LSTM によって実行されます。本研究では、AE-LSTMをGAN構造の動画要約に用い、効率的で多様かつ構造化された動画要約を実現しました。AEは不要な背景の変化を排除でき、LSTMはフレームを画像として扱うのではなくシーンの遷移を検出でき、GANはジェネレーターがビデオを要約し、ディスクリミネーターは要約が多様であることを保証します

図5:AELSTM要約モデルのアーキテクチャ。 Selector-LSTM、Encoder-LSTM、Decoder-LSTM、およびDiscriminator-LSTMが含まれており、敵対的トレーニングを介してビデオサマリーを最適化します。 この図の拡大版を表示するには、ここをクリックしてください。
入力ビデオ
Xの各フレームにGARNN特徴を与えることにより、サマライザーはセレクターLSTMを使用してフレームサブセットを選択し、エンコーダーはフレームをEとしてエンコードし、続いてデコーダーは各フレーム xtでビデオをX'として再構築します。セレクターは、フレームを選択するときに重要度スコアを利用します。特徴量は、スコアを使用した重み値によって与えられ、エンコーダーに移動します。スコア st = 1 の各フレームについて、サブセットはエンコーダーによってのみ受信されます。ディスクリミネーターは、X と X' の間の距離を推定し、ラベルを割り当てることにより、クラスを元のクラスまたは要約として選択します。この場合、ディスクリミネーターは元のビデオと要約ビデオの間の誤差を計算します。アルゴリズム 2 (補足ファイル 2) は、ビデオ要約のための AELSTM のトレーニングの要約を示します。
後処理 – ビデオの要約
ビデオの概要は、トレーニングが完了すると、セグメントレベルの分類子によって作成できます。これを達成するには、次の 3 つのステップが含まれます。(i) 各ビデオ セグメントのオーディオ、ビジュアル、またはブレンド特性を決定します。(ii) 適切なオーディオ、ビジュアル、またはフュージョン分類器を使用して、各ビデオセグメントを分類します。(iii) 明らかな間違いを防ぐために、整然とした分類器の予測を後処理します。
この需要を満たすために、後処理ステップ用に 2 つの異なるフィルターで構成されるパイプラインが開発されました。入力配列は、順次分類器の予測を平滑化するために、ローカルウィンドウを利用して、まず長さN1の中央値フィルターを受けます。最終的な予測は、少なくともN2のセグメントがそのシーケンスに含まれている場合、一連の連続した正の予測(有益なセグメント)を維持する簡単な方法を使用したハードフィルタリングによって決定されます。別の言い方をすれば、この基準では、教育的なセグメントが少なくとも N2 秒続く必要があります。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
提案されたGARNNベースの特徴抽出とAGLSTMベースの長いビデオのビデオ要約は、VSUMMとSumMeの2つのデータセットで実験されました。ここでは、実験結果と従来のアプローチとの比較について説明します。ディスクリミネーターLSTMでは、各層に1024個の隠れユニットを持つ2層LSTMを採用しています。encoder_LSTMとdecoder_LSTMには、それぞれ2つの2層LSTMを採用し、各層に2048個の隠れユニットを配置しています。逆配列を格納および合成しようとするデコーダLSTMは、26を訓練する方が簡単であることが実証されている。特徴シーケンスも、デコーダLSTMによって逆の順序で再構築されます。元のムービーの特徴シーケンスでトレーニングされた事前トレーニング済みの繰り返しオートエンコーダー モデルの設定を使用して、エンコーダー LSTM モデルとデコーダー LSTM モデルを初期化します。これにより、収束が高速化され、全体的な精度の向上に役立つことがわかりました。
評価メトリック
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本研究では、入力データから生成されたデータの音声、画像、視覚モダリティを使用する効率的なマルチモーダルMLおよびDLモデルを使用して、長いビデオのビデオ要約を提示します。バイナリ分類器は、生成された要約部分である重要なセグメントと、破棄される「重要でない」セグメントの間の識別を学習するようにトレーニングされます。モデルはSumMeやVSUMMなどのデータセットを使用してトレーニングされ、モデルのスケーラビリティはメトリックの観点から実証されます。最初に、GARNNモデルを使用してビデオから特徴を抽出し、PCAを使用してさらに処理して次元を削減します。AELSTMベースの分類器を使用して、定量的および定性的評価に基づいてモデルの効率がテストされます。このモデルの優位性を主張するために、オーディオ、画像、およびビデオの特徴に基づく既存の 4 つの ML および DL ベースのビデオ要約アプローチと比較されます。結果は、マルチモーダル特徴の重要性により、SumMeデータセットのPPvが0.947、感度が0.982、F1スコアが0.956、OAが98.4%と強化された結果を確保...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者には利益相反はありません。
著者らは、調査研究を実施するための実験施設を提供してくれた四川映画テレビ大学のドクター・テレビジョン・スクールに感謝している。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| AlexNet (事前トレーニング済みモデル) | MATLAB / PyTorch | PyTorch ハブ —AlexNet 事前トレーニング済みモデル: https://pytorch.org/hub/pytorch_vision_alexnet/ | 視覚的特徴抽出に使用 |
| FFmpeg | FFmpeg.org | https://ffmpeg.org/ | ビデオからのオーディオ抽出 |
| GRNNベースのモデル | カスタム実装 | 図書館」ノイピー」GRNNを実装します:http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.html | マルチモーダル特徴融合に使用 |
| LSTM(長短期記憶) | パイトーチ | https://pytorch.org/docs/stable/generated/torch.nn.LSTM.html | セレクター、エンコーダー、デコーダーで使用 |
| Multimodal_movie_analysisライブラリ | ギットハブ | https://github.com/tyiannak/multimodal_movie_analysis | 視覚的特徴抽出用 |
| ナンパイ | Pythonソフトウェア財団 | https://pypi.org/project/numpy/ | 数値計算と行列演算 |
| PCA(主成分分析) | Scikit-learn | https://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.html | 次元削減 |
| PyAudio分析 | ギットハブ | https://github.com/tyiannak/pyaudioanalysis | オーディオ特徴抽出 |
| パイトーチ | PyTorch 財団 | https://pytorch.org/ | ディープラーニングフレームワーク |
| SumMeデータセット | パブリックデータセット | https://gyglim.github.io/me/vsum/index.html | ベンチマーク動画要約データセット |
| VSUMMデータセット | パブリックデータセット | http://www.vision.ime.usp.br/~creativision/vsumm/ | ベンチマーク動画要約データセット |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト