この研究は、医学および看護教育における教室での行動を認識するための Transformer ベースの AI システムを提示します。マルチモーダル データを使用して、システムは学習者の関与と感情状態を評価します。この結果は、従来のモデルと比較して精度が高いことを実証し、リアルタイムのフィードバックを可能にし、教育の質と生徒のメンタルヘルスに対するサポートを強化しました。
研究記事
この研究は、医学および看護教育における教室での行動を認識するための Transformer ベースの AI システムを提示します。マルチモーダル データを使用して、システムは学習者の関与と感情状態を評価します。この結果は、従来のモデルと比較して精度が高いことを実証し、リアルタイムのフィードバックを可能にし、教育の質と生徒のメンタルヘルスに対するサポートを強化しました。
この研究では、医学および看護教育における教育の質の評価とメンタルヘルスのモニタリングを強化することを目的として、教室での行動認識用に設計された Transformer ベースの人工知能システムを導入します。このモデルは、マルチモーダル データ、特にビデオ、オーディオ、骨格の動きを利用して、注意力の持続時間、対話頻度、感情の変動など、生徒の関与の主要な指標を評価します。新しいマルチモーダル融合戦略と時空間注意メカニズムを組み合わせることで、システムは精度と堅牢性を向上させて複雑な教室の行動をキャプチャできます。EduSenseとSBU Kinectのデータセットでの実験結果は、提案手法が精度と誤報率の両方において従来のモデルを大幅に上回っていることを示しています。さらに、アブレーション研究により、システムの認識能力に対する空間的および時間的注意モジュールの寄与が確認されています。このフレームワークはリアルタイムのフィードバックと視覚的な行動マッピングをサポートし、体験学習環境で実用的な価値を提供します。このアプローチは、教室での行動監視のためのスケーラブルで適応性のあるソリューションを提供し、医学教育における早期介入戦略をサポートします。
学業上および臨床的ストレスにより看護学生や医学生の間でメンタルヘルスの課題が増加する中、人工知能を教室環境に統合することで、教育の質のモニタリングだけでなく、リアルタイムの心理的サポートも提供できます。この研究では、体験学習をサポートし、学生の幸福を促進するために、医学教育の中に行動認識を位置づけています1.インテリジェント教室とは、情報技術、人工知能、ビッグデータ、モノのインターネットなどの最先端テクノロジーの適用を通じて、インテリジェントでパーソナライズされた教育プロセスを組み合わせて、教育管理と教室での相互作用を支援する、新しく高品質の教育モデルを指します 2,3,4.現在、カメラやセンサーなどの技術の発展に伴い、教室で収集される行動データには、映像だけでなく、音声や音声などのマルチモーダルデータも含まれる5。しかし、この複雑な時空間情報とデータを処理し、そこから貴重な行動特徴を正確に抽出することが、インテリジェントな教室行動認識の分野が直面している主な課題です6,7。既存の行動認識アプローチは、主に、教室のビデオストリームやシーケンシャル画像などの単一モーダルデータソースからの特徴抽出に依存しています8。これらの方法は、粗い行動イベントを検出できますが、学習者の幸福と集中力を理解するために重要な生徒のジェスチャー、表情、または相互作用頻度の要因の時間的進化と空間的ニュアンスをモデル化できないことがよくあります9。さらに、現在のモデルには、音声キューや骨格の動きなどの異種データソースを融合する堅牢なメカニズムが欠けているため、感情的または離脱した行動に対する感度が制限されます10。これらの制限に対処するために、この研究では、時空間注意メカニズムで強化されたトランスフォーマーベースの教室行動認識システムを提案します。提案されたシステムは、長距離依存関係をモデル化するTransformerの機能を活用し、マルチモーダルな特徴融合戦略と組み合わせることで、行動分類の精度を向上させながら、エンゲージメントと感情の指標をリアルタイムで視覚化することを目指しています。最終的な目標は、医学教育における動的な教育の質評価と組み込みのメンタルヘルスフィードバックをサポートし、指導効果と学習者の幸福の両方を監視および強化するためのスケーラブルで適応性のあるソリューションを提供することです。
この評価では、医療および看護教育におけるスマート教室観察に合わせた、時空間注意メカニズムとマルチモーダルデータ融合(ビデオおよびスケルトン入力)を組み合わせた新しいTransformerベースの行動認識システムを提案しています。既存のモデルとは対照的に、新しいモデルは、正確でリアルタイムの生徒の注意力と感情状態の検出を容易にし、教育の質の評価と心理的幸福の両方にとって価値があります。
関連作品
インテリジェント教室は、最新の情報技術を利用して、教育の相互作用、パーソナライズされた学習、および教育管理を強化する新しい教育環境です。インテリジェントな教育方法を使用して、教育効率と質を向上させながら、より豊かでパーソナライズされた学習体験を生徒に提供できます。したがって、世界中の多くの学者がインテリジェントテクノロジーと教室での教育を研究してきました。Radosavljevicらは、環境インテリジェンスに基づくインテリジェントな教室モデルを提案し、生徒の疲労レベルを評価し、学習成果を最適化するために毎日の学業活動データを分析することで学習戦略を調整します11。Tai T. Y は、インテリジェント パーソナル アシスタントが外国語のスピーキング能力の向上に及ぼす影響を研究し、Google アシスタントを使用すると非ネイティブ スピーカーのスピーキング能力が大幅に向上し、コミュニケーションにおいてネイティブ スピーカーと同様の効果が得られることを発見しました12。研究を通じて、チャットボットを教育ツールとして使用することで、生徒のニーズに迅速に対応し、インタラクティブ性を高め、教室でのインテリジェント テクノロジーの潜在的な応用を実証できることを発見しました13。研究では、カッコウ探索アルゴリズムと極限学習機14を使用して評価の精度を向上させたインテリジェント教育モードに基づく教室教育効果評価方法が提起されました。
インテリジェント教室における行動認識は、パーソナライズされた教育を実現し、教室管理を最適化するための重要なテクノロジーです。生徒の行動状況をリアルタイムで監視し、効果的なフィードバックを提供できます。行動認識を通じて、教師は生徒の参加と集中力を正確に理解できるため、教育効果が向上し、意思決定を支援します。これに関連して、世界中の学者は、インテリジェントな教室行動認識に関する広範な研究を行ってきました。研究では、人工知能に基づくリアルタイム視覚監視システムを提案し、機械学習を使用して生徒の行動認識モデルをトレーニングし、教師が生徒の参加と教室での相互作用をより適切に監視できるようにし、それによって教育の質を最適化しました15。Chonggao P は、クラスタリング分析とランダム フォレスト アルゴリズム、および人間の骨格モデル16 を組み合わせることにより、リアルタイムの生徒の行動認識を実現し、遠隔教育における教室行動分析の精度を向上させました。Wu S は、粒子群の最適化と K 最近傍アルゴリズムを組み合わせた生徒の行動認識モデルを開発し、教室での教育の実際的なニーズを満たすために感情認識の精度を促進しました17。Ramakrishnan らによって提案された ACORN システムは、マルチモーダル機械学習と畳み込みニューラル ネットワークを組み合わせて、音声、顔の表情、および画像データを分析しました。時間畳み込みネットワークを通じてこれらの機能を統合することで、教室の雰囲気の自動評価が達成され、予備的な進歩が見られました18。
要約すると、既存の研究では、生徒の疲労検出、感情分析、教室での相互作用の監視などの分野をカバーする、インテリジェントな教室行動認識のためのさまざまな機械学習およびディープラーニングベースの技術が提案されています。しかし、現在の研究にはまだいくつかの欠点があり、多くの方法では実際の応用において十分なリアルタイム性と拡張性が欠けており、複雑で変化する教室のシナリオに適応することが困難になっています。したがって、この研究では、TransformerとAMを使用したインテリジェントな教室行動認識方法を提案します。この研究の革新性は、時空間AMと組み合わせたトランスフォーマーの強力な時間モデリング機能を利用して、教室内の重要な行動瞬間と領域を正確に捉え、マルチモーダルデータ融合を通じてビデオやオーディオなどの複数の情報源を統合して、行動認識の包括性と精度を高めることにあります。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この調査では、個人を特定できる情報を含まない公開されているデータセットを使用しています。研究で使用されるすべてのデータは、参加者のプライバシーを確保するために匿名化されています。データ収集時にすべての参加者からインフォームドコンセントが得られ、研究は倫理ガイドラインに準拠しています。このプロトコルは、マルチモーダルデータ融合に基づく特徴抽出と、Transformerとアテンションに基づく時空間行動認識からなるインテリジェント教室行動認識手法を説明しています。共同訓練により、メソッド全体の性能が最適化されます。
1. マルチモデルデータ収集
マルチモーダルデータ収集には、EduSenseデータセットとSBU Kinectインタラクションデータセットの2つのデータセットから同期された教室行動データを収集することが含まれていました。EduSenseは実際の大学の教室の記録を記録し、SBU Kinectはインタラクションベースの骨格シーケンスを記録しました。データセットには、学生の姿勢と動きをモデル化するためのビデオストリーム、音声キュー、および3D骨格関節情報が含まれていました。データの前処理により、時間的アライメントとクリーニングのためのノイズ除去が保証されます。このコンバージェンスにより、エンドツーエンドの行動モニタリングが提供され、多くの学習状況で視覚的なジェスチャーと体の動きが記録されました。
2. マルチモーダルデータ融合に基づく特徴抽出
インテリジェント教室における生徒の行動認識の問題を対象として、TransformerとAMによるインテリジェント教室行動認識の手法を提案する。生徒数が多い教室は複雑な性質上、シーン内の要因の変化が生徒の行動認識に支障をきたす可能性があります。さらに、単一特徴抽出には、不完全な情報、環境干渉の影響を受けやすい、複雑な動作のキャプチャの難しさなどの制限があります19,20。したがって、この研究では、マルチモーダルデータ融合に基づく学生教室の特徴抽出方法を最初に提案します。この方法は、ビデオと骨格モダリティからのデータを組み合わせ、それらの相補性を利用して、生徒の行動のより包括的かつ正確な特徴抽出を実現します。特に、すべての入力ビデオシーケンスはフレームごとに分割されます。フレームは、事前トレーニングされたFaster R-CNNに供給され、人間の関心領域をローカライズします。検出された領域は、畳み込みニューラルネットワークバックボーンに供給され、時間的な視覚的特徴が得られます。骨格モダリティの場合、3D 関節位置をシーケンスとしてポーズし、事前トレーニングされた BERT モデルを使用してエンコードして、時間的および空間的依存性を取得します。これらは、マルチモーダル フュージョン ネットワークに入力される前に正規化され、埋め込まれます。このうち、ビデオモダリティは主に生徒の動きや表情などの視覚的特徴を捉える役割を果たし、骨格モダリティは関節点情報を通じて生徒の姿勢の変化を正確に記述します。ビデオモダリティは視覚のグローバルな特徴に依存していますが、骨格モダリティは人間の行動を表すためにグローバルな視覚的特徴に依存していますが、骨格モダリティは関節位置の動的な変化に焦点を当てており、2つの間に大きな意味の違いが生じます21。したがって、2つのモダリティ間の相関関係を効果的にモデル化するために、特殊なマルチモーダル融合ネットワークを開発する必要があります。マルチモーダル融合ネットワークを図1に示します。
図 1 では、ネットワークは主に 3 つのモジュールに分かれています。このうち、ビデオモダリティ処理モジュールの入力はビデオシーケンスであり、特徴抽出のためにFaster Region-based Convolutional Neural Network(Faster R-CNN)を介して抽出されます。ビデオモダリティの処理は、教室でのビデオショットをフレームごとの入力に変換して特徴抽出することから始まります。フレームは、ImageNet でトレーニングされた ResNet-50 ベースを備えた Faster Region-Based Convolutional Neural Network (Faster R-CNN) で処理されます。このネットワークは、224 ピクセル× 224 ピクセルにサイズ変更された RGB フレームを処理し、その結果、生徒の活動の空間的およびオブジェクト固有の特徴を備えた高レベルの視覚的特徴マップが作成されます。これらの特徴は、Transformer層を介して時空間埋め込みにエンコードする前に、フレーム間の時間的関係を学習するセルフアテンションモジュールに入力されます。これにより、頭の傾きや手の挙げなどのかすかな行動信号が、後の融合のために埋め込み表現に保持されます。抽出されたビデオ特徴は、セルフアテンションモジュールによってキャプチャされ、ビデオモダリティ内の時間的および空間的関係がキャプチャされ、次にトランスフォーマーによってさらにモデル化されて、ビデオシーケンスの時空間情報の埋め込みベクトルが生成されます。骨格モダリティ処理モジュールの入力は骨格シーケンスであり、これはトランスフォーマーからの双方向エンコーダー表現 (BERT) によって処理され、骨格関節の時間的および空間的特徴を抽出します。骨格データの場合、すべての生徒のポーズは、OpenPose ベースのポーズ推定器を使用して、教室のビデオからの一連の 2D 関節座標としてモデル化されます。これらのシーケンスは、すべてのトークンが 18 個のキーポイントを持つフレームに対応する埋め込みトークンに変換されます。これらのジョイントシーケンスの時間的コンテキストと依存関係は、双方向エンコーダー表現トランスフォーマー(BERT)モデルを使用してモデル化されます。このモデルは、12 のトランスフォーマー層、8 つのアテンションヘッド、および標準の BERT ベースのアーキテクチャである 768 の隠しサイズを採用しています。モデルはトレーニング中に微調整され、行動固有の関節パターンを取得します。出力埋め込みは、生徒の行動の構造的および動き関連の特性を表し、その後、ビデオモダリティ機能と組み合わされます。その後、骨格の特徴は、3D CNNとプーリング操作を通じてさらに空間的および時間的特徴に集約され、骨格モダリティの特徴表現として骨格の埋め込みベクトルが生成されます。
3. クロスアテンション融合モジュール
クロスアテンション融合モジュールでは、マルチヘッドアテンションメカニズム(MHAM)を使用してビデオモダリティと骨格モダリティの間の相互作用関係を構築し、生成されたマルチモーダル融合特徴から3D CNNとプーリング操作を通じて、よりコンパクトな融合特徴をさらに抽出します。融合プロセスは、各モダリティの時間的埋め込みが 3D CNN と双方向 GRU を通過する 2 ストリーム アテンション ネットワークを使用して実現されます。マルチモーダルデータストリームは、マルチヘッドアテンションモジュール(MHAM)を使用してアライメントされ、スケーリングされたドット積アテンションを使用して、モダリティ間の依存関係を実現します。次に、埋め込みは次元の複雑さに対処するためにプールされ、分類のために完全に接続された Softmax 層に送信されます。
マルチモーダル融合ネットワークでは、自己注意モジュールを使用して単一モード内の時間的および空間的依存性をモデル化し、クロスアテンション融合モジュールを使用して、異なるモード間の関連性と情報相互作用を確立します。したがって、どちらも非常に重要です。セルフアテンション モジュールは、クエリ Q、キー K、および値 V の間の関係を計算することにより、入力シーケンスの内部依存関係をキャプチャします。 Q、 キーK、および値 V の計算を式(1)に示します。ここで、
はそれぞれクエリ、キー、および値の行列です。 dk はキーベクトルの次元であり、 dk は値ベクトルの次元です。次元係数 dk は、学習中の勾配の安定性に影響を与える内積が大きくならないようにするために採用されています。
(1)
式(1)では、
は入力特徴を表し、nは入力シーケンスの長さ、dモデルは特徴の次元、WQ、WK、およびWVは学習可能な射影行列の3セットを表します。これらの行列マッピングを通じて、入力特徴量はクエリ、キー、および値に変換されます。式 (2) に示すように、クエリ Q とキー K の内積を利用して、注意の重みを計算し、スケーリングします。
(2)
式(2)では、dkはQとキーKのクエリの次元を表し、softmaxはアテンションウェイト行列を取得するために利用されるsoftmax関数を示します。スケーリングは、次元によって引き起こされる過剰な内積値による勾配が小さすぎるという問題を効果的に防ぐことができます。式(3)に示すように、アテンションウェイト行列を値Vに適用して、セルフアテンションモジュールの出力Zを取得します。
(3)
式(3)では、ijは、j番目のキーベクトルに対するi番目のクエリベクトルのアテンションウェイトを意味します。クロスアテンション融合モジュールの具体的な構造を図2に示します。
図2から、このモジュールは主にスケルトンモダリティとビデオモダリティからの入力特徴の処理を開始します。まず、スケルトンシーケンスとビデオシーケンスを別々に3D畳み込み層にさらして時空間の特徴を抽出し、次にこれらの時空間特徴を双方向ゲートリカレントユニット(Bi-GRU)を使用して時間モデリングにモデル化します。次に、MHAMによって2つのモダリティの特徴をさらに抽出し、モダリティ内の相関関係を抽出します。各モダリティは、クエリ、キー、および値のメカニズムを通じて内部的に特徴表現を実現します。次に、時間次元の複雑さを軽減するために、出力特徴に対して時間平均プーリングが実行されます。プーリング後、マルチモーダル特徴を統計的にプールして各モダリティの平均と標準偏差を計算し、最後に全結合層 (FCL) と Softmax 分類器を通じて学生の行動認識と分類を出力します。したがって、本研究で提案されたマルチモーダルデータ融合に基づく特徴抽出は、セルフアテンションとクロスAMを利用して、ビデオと骨格モダリティからのデータを融合することで、生徒の行動の時空間的特徴を正確に捉えてモデル化し、それによってインテリジェント教室における生徒の行動認識の精度と包括性を向上させます。
4. Transformerと注意に基づく時空間行動認識
マルチモーダルデータ融合に基づく特徴抽出は、ビデオと骨格モダリティからのデータを融合することで、学生の行動の包括性と精度の予備的な改善を実現します。ただし、インテリジェント教室の文脈では、生徒の行動は時間の経過とともに変化することが多く、同じ行動でも異なる時点で異なる特性を示す場合があります。マルチモーダル特徴から融合した静的情報のみに依存すると、行動シーケンス22,23における複雑な時空間動的関係を完全に捉えることはできません。したがって、さらなる研究では、Transformerに基づく時空間行動モデリングとAMが提案されます。この研究では、自己AMを通じて入力のグローバルな時空間情報をモデル化でき、時空間の依存関係を捉える能力がより強いVision Transformer(ViT)をネットワークアーキテクチャとして選択しました。マルチモーダル融合に続いて、融合した特徴は再びビジョントランスフォーマー(ViT)を使用して表現され、時空間挙動が予測されます。入力の特徴マップは、不連続なパッチ 16 × 16 パッチに分割され、1 次元ベクトルに線形に埋め込まれ、空間秩序を維持するために位置的にエンコードされます。ViT構造には、マルチヘッドセルフアテンション(8ヘッド)と、隠れ寸法が768のフィードフォワード層で構成される12個のTransformerエンコーダブロックがあります。行動の顕著性を高めるために、空間的注意 (SA) および時間的注意 (TA) モジュールが提案されます。SA モジュールは Tanh 活性化を介して空間領域における特徴の関連性を促進し、TA モジュールは ReLU 活性化を介して重要な時間フレームを強調表示します。その後、これら 2 つのアテンション ストリームは、2 段階のトレーニング方法を介して ViT バックボーンと組み合わされ、モデルは教室での行動の動的な進化を効率的に捉える方法を学習します。ViTの構造を図3に示します。
図 3 の ViT では、元の入力は、複数の固定サイズの小さなブロックにセグメント化され、それぞれが画像の一部として表され、1 次元ベクトルに線形に平坦化された画像です。Transformer は位置情報を認識できないため、各小さなブロックには Transformer に入力される前に位置情報が埋め込まれ、異なる小さなブロック間の相対的な空間位置関係を確実にキャプチャできます。ViT のコア モジュールは Transformer エンコーダーで、複数のスタックされた Transformer エンコーディング ブロックで構成されています。エンコードブロックは、MHAMとフィードフォワードニューラルネットワークで構成されています。MHAM は入力シーケンス間の依存関係を並列にキャプチャし、フィードフォワード ニューラル ネットワークは結果に対して非線形変換を実行して、グローバル情報をキャプチャして表現するモデルの能力を強化します。Transformer エンコーダーがすべての小さな情報を処理した後、最後のエンコード層の出力が多層パーセプトロン ヘッド (MLP ヘッド) に渡され、最終的な学生の行動認識と分類の結果が出力されます。
実際には、各フレームは、空間関係を維持するために、重なり合わない 16 × 16 のパッチに分割され、フラット化され、位置的に埋め込まれます。パッチ埋め込みは、ViTアーキテクチャのスタックトランスエンコーダーによって順次処理されます。空間的注意 (SA) モジュールは tanh 活性化を利用して各フレーム内の関心領域全体で注意を変化させ、時間的注意 (TA) モジュールは ReLU を利用して時間的に重要なフレームを強調表示します。この2つの注意メカニズムにより、空間と時間の行動ダイナミクスの効果的なモデル化が可能になります。
複雑な行動シーケンスにおける ViT のパフォーマンスをさらに向上させるために、空間注意 (SA) と時間的注意 (TA) が導入され、ViT が重要な空間関節を自律的に選択できるだけでなく、さまざまな時点での行動に焦点を当て、行動の時空間的動的変化をよりよく捉えることができます。SA モジュールと TA モジュールを 図 4 に示します。
図4Aでは、SAモジュールは、現在のフレームの特徴をViT層に渡して隠れた状態を抽出することにより、入力の空間次元情報を処理します。これらは、前のフレームの機能と組み合わされ、FCLに共同で供給されます。FCL は、特徴に対して線形変換を実行して、潜在的な特徴表現を生成します。その後、Tanh活性化関数に渡され、出力が[-1,1]の範囲にマッピングされ、非線形性が強化され、重要な特徴と重要でない特徴をより適切に区別できます。最後に、特徴は正規化層を介して正規化され、出力特徴が比較的安定したスケールを持つようにします。図 4B では、TA モジュールは、時間的次元の各フレームに含まれる重要な情報に重点を置いています。SA の Tanh とは異なり、TA モジュールは ReLU 活性化関数を使用して負の値を抑制し、正の値の出力のみを保持するため、負のノイズ情報を効果的に除去し、モデルの時間的キャプチャ能力を強化します。
5. 共同訓練法
Transformer とアテンションに基づく時空間行動認識における ViT、SA モジュール、および TA モジュール間の相互影響によって引き起こされる偏った冗長な時空間特徴の問題を効果的に解決するために、3 つのモジュールを最適化する共同トレーニング方法が採用されています。具体的なプロセスを 図5に示します。
図5では、ジョイントトレーニング戦略は、最初にモデルのトレーニングパラメータを入力し、ネットワーク構造とハイパーパラメータを設定します。その後、SAとTAで個別の事前トレーニングを実施し、局所的な特徴をよりよく学習します。一方のモデルの事前トレーニング中、もう一方のモデルの重みは固定されたままであり、更新されないことに注意してください。個々の事前学習が完了した後、ViT層を組み合わせて学習します。次に、2 つのアテンション モデルが固定され、メインの ViT ネットワークが個別にトレーニングされます。最後に、メインの ViT ネットワーク、SA、および TA モジュールを共同でトレーニングすることにより、ネットワーク全体が最適化され、インテリジェントな教室行動認識の最終モデルが生成されます。トレーニング手順は段階的に実行されます:(1)フリーズされたViTパラメータを使用したSAおよびTAモジュールの自律的な事前トレーニング、(2)フリーズされたアテンションモジュールの重みを使用したViTの段階的なトレーニング、および(3)Adamオプティマイザーと一緒にすべてのコンポーネントのエンドツーエンドの微調整(学習率= 0.001、バッチサイズ= 64、エポック= 100)。このアプローチにより、特徴学習が安定し、最適化中のモジュール間の干渉が軽減されます。
全体として、提案されたインテリジェントな教室行動認識方法は、ビデオと骨格モダリティを組み合わせて、セルフアテンションとクロスAMを通じて時空間関係をモデル化します。ViT のグローバルな時空間モデリング機能を利用し、空間モジュールと TA モジュールを組み合わせることで、モデルは主要な行動と時間的ダイナミクスをキャプチャするように最適化され、より包括的で正確な学生の行動認識を実現します。マルチモーダル特徴表現が組み合わされるクリティカルフュージョン操作は、検討中のアーキテクチャで実行されます。具体的には、CNNによって学習された空間的特徴は、Bi-LSTMの時間的特徴と結びついています。この出力は、分類タスクの前に MHAM の注意拡張機能と融合されます。これらの融合操作は、行動データの補完的なビューの融合にとって重要であり、 図1 と 図5で強調されています。
アルゴリズム 1 は、ViT、BERT、および GCN ベースのモデルを使用して、クラス内の有益な特徴を抽出し、複合されたマルチモーダル データ、スケルタル、テキスト、およびビデオ情報を示しています。次に、結合表現をマークして、クロスモーダル学習を使用してより高い精度で生徒の行動を識別します。
アルゴリズム1 ViT,BERT,GCNを用いたマルチモーダル行動認識のプロセス
初期化する:
事前トレーニング済みのBERTモデル
事前トレーニング済みの高速 R-CNN モデル
事前トレーニング済みの ViT モデル
スケルトンデータのGCNモデル
分類器(MLPやトランスフォーマーなど)
データセットを読み込む:
マルチモーダルデータセットの各サンプルについて:
ビデオフレームを抽出する
音声トランスクリプトを抽出する
スケルトンデータを抽出する(OpenPoseまたはMediaPipe)
ステップ 1: ビデオモダリティ処理
動画の各フレームについて:
Faster R-CNNを適用してオブジェクト/参加者を検出
Vision Transformer(ViT)を適用してフレームレベルの特徴を抽出する
時間表現のための時間的特徴の経時的な集計
ステップ 2: テキスト モダリティ処理
トランスクリプトテキストの前処理:
BERTトークナイザーを使用したトークン化
BERTモデルによるトークンの渡し
[CLS] トークンまたは平均プーリングからコンテキスト埋め込みを抽出する
ステップ3:骨格モダリティ処理
スケルトンシーケンスごとに:
座標を正規化する
GCNまたはST-GCNを通過してモーション特徴を抽出
ステップ 4: 機能の融合
連結またはアテンション・フューズ:
ビデオ機能
テキスト機能
骨格の特徴
統一されたマルチモーダル表現の取得
ステップ 5: 分類
融合表現を最終分類子に渡す
教室の行動ラベルを予測する (例: 注意深い、注意散漫)
ステップ 6: 評価
予測とグラウンドトゥルースを比較する
計算メトリック: 精度、精度、再現率、F1 スコア
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
TransformerとAMを用いた高額な知教室行動認識法の有効性と優位性を評価するために、実験的な性能検証と分析が行われた。まず、 表1に示すように、実験環境とパラメータを設定しました。
表1に基づいて、この研究では、実験データセットとしてEduSenseデータセットとSBU Kinectインタラクションデータセットを選択し、それぞれD1とD2という名前を付けました。D1は大学の教室での学生と教師の行動を収集し、D2は行動相互作用の認識に使用されました。ただし、そのデータ型とシナリオは、教室での行動認識の補足データとして使用できます。データセットは、トレーニングセットとテストセットに7:3の比率で分割されました。まず、図6に示すように、マルチモーダルデータ融合の有効性が検証されました。
図6では、提案された行動認識モデルのパフォーマンスを評...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
複雑な生徒の行動とマルチモーダルデータ認識の課題に対処するために、TransformerとAMに基づくインテリジェント教室の行動認識方法が提案されました。ビデオと骨格モダリティからのデータを統合して、グローバルな時空間モデリング機能を備えたViTネットワークを構築し、セルフアテンションとクロスAMを利用して行動の時空間的特徴を捉えました。マルチモーダル フレームワーク トランスフォーマー (MFT) を使用してビデオとオーディオ データを新しいインテリジェント センシング フレームワーク (ISF) フレームワークに統合することにより、評価は教室の行動検出の改善を目指しています24。学生の関与に関するリアルタイムの洞察は、静的な単一モダリティアプローチの欠点を克服する能力によって可能になります。完全な教室のダイナミクスには、統合されたインストラクターの行動分析はまだ含まれていません。従来の研究では、冗長チャネル抑制と物体空間アテンション(RCSOSA)、空間深度コンボリューション(SPDConv)、適応型細粒度チャネルアテ...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者らは開示するものは何もない。
何一つ。
著者の貢献:
Liu Lei: 研究の構想と設計を担当します。インテリジェントな教室行動認識のためのTransformerベースのマルチモーダルデータ融合法を提案しました。モデルの開発と実験計画を主導し、データの収集と処理を管理し、最初の原稿を起草しました。実験結果の分析と議論に貢献した。
He Zhihua: 研究の全体的な指導と監督を提供しました。研究の枠組みと方法論的サポートに貢献しました。モデルの最適化と実験分析に参加し、原稿のレビューと修正を行い、倫理基準の遵守を確認し、投稿の最終承認を与えました。通信を担当します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 128 GB DDR4 RAM | 複数のベンダー | https://www.crucial.com/memory/ddr4 | マルチモーダルデータ処理に十分なメモリ |
| 2 TB SSD ストレージ | 複数のベンダー | https://www.samsung.com/ssd | データセットとモデルの保存用 |
| BERT (基本構成) | Hugging Face | https://huggingface.co/bert-base-uncased | 骨格配列埋め込みのための言語モデル |
| CUDA 11.1 ツールキット | NVIDIA | https://developer.nvidia.com/cuda-toolkit | PyTorch |
| cuDNN 8.0 ライブラリ | NVIDIA | https://developer.nvidia.com/cudnn | ディープ ニューラル ネットワーク用の GPU アクセラレーション ライブラリ |
| EduSense データセット | カーネギーメロン大学 | https://www.cs.cmu.edu/~./edusense | 実際の大学の教室データセット |
| より高速なR-CNN(ResNet-50) | オープンソース(PyTorch) | https://github.com/facebookresearch/detectron2 | ビデオ特徴抽出に使用されるオブジェクト検出器 |
| Intel Xeon E5-2680 v4 CPU | Intel | https://www.intel.com/products/xeon-e5-2680-v4 | モデルトレーニング用の高性能プロセッサ |
| Matplotlib | オープンソース | https://matplotlib.org | パフォーマンスメトリック |
| NVIDIA Tesla V100 GPU | NVIDIA | https://www.nvidia.com/en-us/data-center/tesla-v100 | トレーニングと推論に使用、リアルタイムの行動認識をサポート |
| OpenPose | CMU | https://github.com/CMU-Perceptual-Computing-Lab/openpose | ビデオフレームから 2D スケルトンキーポイントを抽出 |
| PyTorch 1.8 フレームワーク | オープンソース | https://www.pytorch.org | ディープラーニングライブラリモデル開発 |
| SBU Kinect Interaction Dataset | Stony Brook University | https://www3.cs.stonybrook.edu/~kyunghan/sbu_kinect | Interaction-based skeletal dataset |
| TensorBoard | Open Source (Google) | https://www.tensorflow.org/tensorboard | 学習の可視化に使用 |
| Ubuntu 20.04 LTS オペレーティングシステム | Canonical | https://www.ubuntu.com/download | 開発環境として使用されるLinux OS |
| Vision Transformer(ViT)Google | / Hugging Face | https://huggingface.co/google/vit-base-patch16-224 | 空間行動モデリングに使用 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト