レビュー記事

構音障害発話における音素ラベルの不正確さのためのマルチモーダルアーキテクチャ:臨床リハビリテーションのためのトランスフォーマーとTCNの統合

DOI:

10.3791/70447

2026年5月26日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本レビューでは、聴覚、発音、視覚情報を組み合わせたマルチモーダルアーキテクチャとトランスフォーマーおよびTCNモデルが、構音障害発話における音素識別の改善にどのように貢献できるかを検証します。また、通常のASRシステムの能力を超えて、音声明晰性評価や個別化療法を向上させる可能性を強調しています。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

発音の問題や音素の変動により、構音障害などの言語障害は臨床リハビリテーションにおいて大きな課題をもたらします。従来の自動音声認識(ASR)システムは、通常は規範的なデータセットで訓練されていますが、ディサルス(構音障害)の音声を正確に解読できないことが多いです。人工知能やディープラーニングの最近のブレークスルーにより、聴覚、発音、視覚情報を統合するマルチモーダルアーキテクチャの統合が可能となり、複雑な音声パターンを記録することが可能になっています。本レビューでは、マルチモーダル枠組み内でトランスフォーマーと時間畳み込みネットワーク(TCN)の収束を探り、構音障害発話における音素ラベルの不正確さを解決しました。ここでは、トランスフォーマーベースの文脈モデリングとTCN駆動の時間的精度が、音素境界の検出、分類、リハビリフィードバックをどのように向上させるかについて論じます。また、個別化言語療法、解釈可能性の問題、臨床応用におけるハイブリッドシステムの可能性についても論じています。マルチモーダルアーキテクチャは、臨床医学と医療情報学を橋渡しすることで、運動言語障害を持つ人々に対する治療的モニタリング、コミュニケーション支援、発話明瞭性評価を向上させるためのトランスレーショナルアプローチです。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

神経系の障害は、筋骨格系障害、神経血管障害、神経原性コミュニケーション障害など、劇的かつ急激な健康被害をもたらすことが多いです。神経原性コミュニケーション障害には、構音障害や失行症などがあり、これらは筋力低下や発話動作の計画の困難による言葉のもつれと定義できます。発話は呼吸、発声、共鳴、発音、プロソディの5つのサブシステムで構成されており、これらすべてが効果的にコミュニケーションするためには相乗効果がありシームレスに連携しなければなりません。これらのサブシステムの機能障害によって引き起こされる構音障害は、聴覚性、自然さ、明瞭性、コミュニケーション効率を低下させ、結果として患者やその家族の生活に大きな影響を与えます。構音障害は、大脳皮質、基底核、小脳、基底核、脳神経、末梢神経の機能障害など、さまざまな神経疾患や基礎疾患によって引き起こされることがあります。その他の要因としては、舌、喉頭、喉の一次運動障害があります。

構音障害とは、呼吸、発声、共鳴、発話、発声、リズムに影響を与える神経筋制御の変化によって引き起こされる運動発話障害の総称です。したがって、構音障害は神経筋障害やけがと関連し、発話に使われる筋肉が弱く、遅く、または麻痺している状態と関連しています。発話に関与する特定の筋肉の種類には、舌、喉、顔、唇、声帯、顎、上気道の筋肉などがあります。これらの筋肉への損傷は、運動ニューロンや血管の損傷など様々な形をとることがあり、酸素を奪われることもあります。発話を妨げる典型的な神経学的損傷には、上位運動ニューロンの損傷(発話筋のこわばりや痙縮を引き起こすことがある)、下位運動ニューロンの損傷(神経信号の中断により筋力低下や麻痺を引き起こすことがある)、筋肉間の協調性を欠くことが多い小脳損傷(運動失調症)、または協調運動を妨げ不随意運動を引き起こす基底核損傷(過運動障害)などがあります。筋肉の硬直(運動低下)5.

構音障害はさまざまな神経障害の一般的な症状であり、進行性の神経疾患としばしば関連しています。コミュニケーションは人格を表現し、社会的なつながりを維持する上で重要な役割を果たし、患者とその家族に大きな影響を与えます。この障害は発話の明瞭さの低下を特徴とします。話し言葉の内容はそのまま残り、患者は話し言葉と書面の両方を書き、解釈できます。一方、無関節症は最も重度で、運動発話の完全な喪失をもたらします。構音障害には主に6つの分類があります。低位運動神経機能障害に関連する弛緩性構音症、大脳皮質の運動領域に関連する上位運動ニューロンの損傷から生じる痙性構音障害;主に小脳の問題に起因する失調性構音障害;そして、錐体外系の障害と関連した過運動性構音障害および低運動性構音障害。第六のタイプは通常混合性構音障害と呼ばれ、複数の部位に損傷が生じ、少なくとも2つのカテゴリーの特徴を示す発話特徴が現れることがよくあります。これら6つの主要な構音障害に関連する発話障害は独特であり、構音障害の診断と治療に役立ちます。

関節障害の原因要因には、感染症(クロイツフェルト–ヤコブ病や後天性免疫不全症候群など)、血管の問題(虚血性および出血性脳卒中)、腫瘍(脳腫瘍)、脱髄性疾患(多発性硬化症やギラン・バレー症候群を含む)、変性疾患(パーキンソン病やハンチントン病など)、外傷(外傷性脳損傷および脳性麻痺)、有害物質曝露(重金属、 アルコールや薬物)、および遺伝的疾患(例えばSANDO)7.さらに、口唇裂や口蓋裂などの非神経学的要因も発音障害を引き起こすことがありますが、これらは構音障害8のカテゴリーには該当しません。

臨床現場における構音障害の重要性は、個人の生活の質に大きな影響を与える点にあります。コミュニケーションは社会的、教育的、職業的な関与に不可欠であるため、コミュニケーションに苦しむ人々は孤立感や幸福感の低下に直面することが多い6.弛緩型、痙攣性、運動障害、過運動性障害、低運動障害、混合型など、さまざまなタイプの構音障害を正確に診断することは、根本的な神経学的問題を特定しリハビリテーションのアプローチを評価する上で不可欠です。言語聴覚士や臨床医は、治療法をカスタマイズし、達成可能なコミュニケーション目標を確立し、補助的および代替的コミュニケーション方法の必要性を評価するために、構音障害の特徴や重症度を分析することに依存しています。発話に困難がある人に対しては、自動音声認識(ASR)システムがアクセシビリティや社会的交流を改善することがわかっています。それにもかかわらず、不十分な音響モデルがASRの障害性発話治療の広範な成功を妨げています。したがって、本論文は構音異音における音素問題、既存のASRシステムとその限界、創造的なマルチモーダル技術、トランスフォーマーベースの文脈モデリング、そして時間的および逐次的な洗練のためのTCNについて掘り下げます。

ASR技術の大幅な進歩があっても、主要なASRシステムは言語障害者に対して多くの欠点を抱えています。これらの欠点は、多様で代表的な発話の訓練データセットを得る難しさに部分的に起因している可能性があります。障害性発話ASRにおける一つの課題は、人によって異なる多様な異常な発話特徴と、これらの変動が訓練データセットで十分に反映されていないことに関連していると考えられます。それにもかかわらず、構音障害に関連するASRの研究ではこの多様性がしばしば見落とされてきました。

ASRシステムは、スピーカー独立型(SI)、スピーカー依存型(SD)、スピーカー適応型(SA)の3つのカテゴリーに分類されます。SIシステムは健康な話者には良好に働きますが、発話の劣化には苦労し、トレーニングデータに構音障害のある話者を含めるとより良い性能を示します。対照的に、SDシステムは個々のユーザーに重点を置き、優れた精度を達成しますが、SAシステムは時間とともにユーザーの音声に適応し、SIモデルやSDモデルの両方を上回ります。しかし、SAシステムもSDシステムもトレーニングデータを必要とし、これは神経変性疾患を持つ人々にとってさらに大きな障壁となっています11。大きな進展があったにもかかわらず、既存のASRモデルは異なる訓練データセットの不足により、障害のある話者には依然として適していません。このギャップを埋めるためには、構音障害のさまざまな側面を捉える徹底的なデータ収集手法を開発し、認識しにくい話者のASRパフォーマンスを向上させる必要があります。

これらの制約を克服するために、音響、発音、視覚信号を融合させたマルチモーダル戦略を用いて、構音障害症状における発話の生成と洗練を包括的に表現できます。例えば、舌の画像診断などの発音運動に関するデータは超音波検査や電磁発音造影を用いて取得されます。このデータはしばしば視覚的な唇の動きと組み合わせられ、音響情報の障害を補うことができ、音素の識別や区別能力を高めます。このマルチモーダルシステムに見られる冗長性は臨床評価法と整合しており、聴覚発話とともに口腔顔面の動きを観察するセラピストの能力を強化します。逆に、特にトランスフォーマーやTCNなどのディープラーニングフレームワークは、音声シーケンス内の時間的依存関係や変動の優れたモデリングを提供します。これらのモデルは、トランスフォーマーが全体的な文脈的関係を捉えることで機能し、音響信号が減弱、遮蔽、または減少しても音素識別を可能にします13。TCNは安定した受容野と時間的平滑化を提供することで、音素境界検出の精度を高めることでさらに貢献します。これら両手法をマルチモーダル融合フレームワークに統合することで、構音障害発話における音素ラベル付けの精度を大幅に向上させ、より正確でフィードバック重視の臨床リハビリテーションを促進します。したがって、これらのマルチモーダルなディープラーニングアーキテクチャは、発話明瞭度の測定の向上、リハビリテーションの経過のモニタリング、個人の特定の運動発話障害プロファイルに合わせた技術支援療法の提供など、リアルタイムの臨床目標と直接連携しています14

これらのマルチモーダルなディープラーニングアーキテクチャは、音素ラベルの不正確さを解消する大きな可能性を秘めていますが、実験的な枠組みから信頼できる診断ツールへ効果的に移行するには、統一された運用構造が必要です。これに対応するため、以下の研究では、マルチモーダルデータ収集、特徴抽出、モデルトレーニングを含む包括的な計算ワークフローについて説明します。目標は、これらの複雑なシステムを幅広い臨床状況で再現可能かつ検証可能にすることです。このような透明な方法論的パイプラインを確立することは、言語聴覚士や臨床技術者が幅広い患者の特徴や障害レベルにわたってアルゴリズムを検証するために極めて重要です。最後に、この体系的な手法は臨床実装の前段階となり、高度な音声モデルを規制評価、電子医療システム、長期治療モニタリングプラットフォームに統合することを可能にします。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

レビューと展望

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

構音障害発話におけるマルチモーダルデータ取得の概要

構音障害の症状の複雑さと多様性を踏まえ、発話運動制御を徹底的に調査し、効率的な診断およびリハビリテーション技術を開発するためには、マルチモーダルデータ収集が必要です。

アコースティック録音セットアップ

音響チャンネルは依然として中心的です。録音は残響や周囲のノイズを軽減するために音響処理された環境で行うのが最適です。一般的なマイクロフォンは高品質なコンデンサー製で、カーディオイドヘッドマウント型またはテーブルトップ型で、信号レベルを制御しセッション間で変動を避けるために一定に配置されています。16 kHzまたは44.1 kHzのサンプリングレートは非常に一般的で、16 kHzで明瞭性と韻律解析に十分であり、44.1 kHzはより高い忠実度を提供し、細かな音響・音響研究に有用です。マルチチャンネルオーディオインターフェースは複数のストリームを同期的にキャプチャでき、クリッピングやフロアノイズを避けるためにゲイン設定とヘッドルームを一定に保つ必要があります。再現性のためには、キャリブレーションの確立とマイクの利得、環境ノイズフロア、ドリフトの記録が重要です。構音障害性音声コーパスでは、音質が特に重要で、音響信号の欠陥は微妙であり、録音条件の悪さによって簡単に隠されてしまうことがある15

任意で関節型/リップトラッキング/筋電図/超音波検査のモダリティ

音響波形を超えて進むには、発音運動学や生理的筋肉活動を捉えるための追加のモダリティが必要になることが多いです。したがって、リップトラッキングや顔のモーションキャプチャは、唇や顎の開口、動き、速度、対称性を定量化することを可能にします。電磁発音図(EMA)は舌、顎、唇のセンサーを3次元で追跡し、咬合器の時間的・位置的解像度を提供します。一方、表面筋電図(sEMG)は筋肉活動を記録し、構音障害の根底にある神経筋活性化の欠損を探ります。超音波舌画像診断(UTI)は、発音中の舌表面をリアルタイムで撮影し、EMAに耐えられない被験者に有用です。マルチモーダルシステムは、発話運動障害の識別が同時音響療法と発音・視覚捕捉を補うことで改善されることを示しています。

倫理的配慮と患者の同意

構音障害のある話者との関わりは、しばしば脆弱な人々を対象とします。研究者は機関審査委員会(IRB)または倫理委員会の承認を得て、録音方法(音声、映像、生理的センサー)、保存、匿名化、将来の使用、取り下げ権利について説明するインフォームドコンセントを確保しなければなりません。同意書には、ビデオ撮影(口唇や顔の追跡)や、必要に応じてEMGのような繊細な手法について明示的に記載すべきです。特に動画や顔画像が保存される場合は、データプライバシーの管理が必要です。参加者の快適さ、疲労、動きの制限、潜在的なリスクを評価する必要があります。セッションには休息時間が含まれ、参加者はいつでも中断しても問題ないと伝えるべきです。構音障害性音声コーパス研究における参加者の希少性と多様性は、倫理的厳密さの重要性をさらに強調しています17

データ前処理のステップ(セグメンテーション、ノイズリダクション、正規化)

MAV-HuBERTシステムは、音響および視覚データをフレームレベルで時間的に整列させ、元の波形から26次元の対数フィルタバンクエネルギーを抽出し、Dlibベースの顔識別で収集された25Hzの視覚フレームと同期させます。連続したオーディオフレームは通常、短期的な揺らぎを安定化するために組み合わせられ、融合した視覚領域は多モーダル特徴融合前に空間的に正規化されます。これらの前処理活動は連続的な時間的一貫性を提供し、音声および映像モダリティ間の変動を低減することで、下流の識別精度向上につながります15,18

特徴量工学と計算ワークフロー

マルチモーダル深層学習モデルは、構音障害発話における音素を正確にラベル付けするために、音響、発音、視覚情報の同期表現を必要とします。このセクションでは、マルチモーダル音声解析で使用される特徴表現技術の概要を提供し、その後、モデルトレーニング前にこれらの特徴を抽出・整合させるためのステップバイステップの計算ワークフローを紹介します。

特徴抽出と表現

マルチモーダル音声解析では、生の音声や動き信号を深層学習モデルで処理可能な意味のある表現に変換しなければなりません。最も広く使われている表現の一つが スペクトログラムで、信号エネルギーが時間や周波数によってどのように変化するかを示します。スペクトログラムベースの表現は、ディスラッチ、息遣い、不規則なタイミングなどの特徴を捉えるのに有用であり、これらは構音障害発話でよく観察されます19

もう一つよく使われる特徴はMel周波数セプストラル係数(MFCCs)で、これは人間の聴覚知覚に近似した形で音声のスペクトル特性を表します。MFCC機能は、音声が歪んでいても安定し続けるコンパクトでノイズに耐性のある表現を提供するため、音声認識で広く使われています。音響的特徴に加え、多様態アプローチには舌、唇、顎の動きの軌跡などの発音情報も取り入れられます。これらの信号は電磁関節造影(EMA)、超音波舌画像(UTI)、または光学的運動追跡を用いて取得できます。発音機能は発話運動制御に関する直接的な情報を提供し、劣化した音響信号の補正に役立ちます。

視覚情報は構音障害の発話分析にも有用です。ビデオ記録から抽出された顔のランドマーク、例えば唇の輪郭、顎の位置、口の開きなどは、可動に関する追加の手がかりを提供します。これらの視覚的特徴は、特に音響信号が不明瞭な場合に音素識別を改善します。教師あり学習では、すべての特徴ストリームが 音素レベルの転写 と整合し、各時間枠が正しい音声ユニットに対応していることを保証します。正確なアラインメントは、特に音素境界が曖昧になるディスチャルス(構音障害)発話において、音素表示モデルの訓練に不可欠です。

計算ワークフロー

このセクションでは、特徴抽出からモデル評価まで、マルチモーダル音素ラベル付けのワークフローを再現するために必要なすべてのステップがどのように必要かを示します(図1)。

スペクトログラムおよびMFCCSによる音響特徴抽出

まず、短時間フーリエ変換(STFT)を用いて生の音声信号を時間周波数の表現に変換します。スペクトログラムを作成するために、信号は短い重なり合うフレームに分割され、それぞれのフレームにフーリエ変換をかけられます。
メル周波数セプストラル係数(MFCC)は、スペクトログラムから知覚的に重み付けされた音響特徴を抽出するために用いられます。音声認識および構音障害解析において、MFCCはコンパクトでノイズに耐性のある表現を提供します23,24。その堅牢性と効果により、MFCCは音声認識や話者認識に関連する応用で一般的に使用されています。そのため、その有用性からMFCCは抽出され、人間の聴覚知覚レベルを計算・近似し、圧縮されたノイズに強靭な音響特性を提供します。以降25

発音軌道の習得

発音運動データは、発話器官の物理的な動きを捉えるために取得されます。電磁関節造影(EMA)は、舌、唇、顎に取り付けられたセンサーを用いて、3次元の関節運動を追跡します。あるいは超音波による舌の動きを非侵襲的に推定する方法もあります。記録された軌道はフィルタリング、正規化、ダウンサンプリングされ、音響特徴のフレームレートに合わせられ、時間的な一貫性が確保されます。音声を超音波舌イメージング(UTI)シーケンスに変換するのは、聴覚特性を生理的な舌の動きにマッピングすることで、音声データから超音波の舌の軌跡を推定する技術です。この方法論は、発話および声道の異常の監視と治療に必要な直接発音データ収集技術に代わる非侵襲的な代替手段を提供し、直接測定アプローチに内在する特定の機器や臨床経験を必要としません。27,28。EMAや超音波検査(UTI)で記録される舌、唇、顎の動きの軌道などの関節機能の利用可能性に基づき、信号はフィルタリングされ、音響フレームのレートに合わせてダウンサンプリングされます。

視覚的ランドマークの検出

音声や動画の入力では、顔のキー入力(唇の角や顎の動き)をMediapipeやOpenFaceなどのツールで抽出し、それらを正規化してヘッドポーズ効果を除去する必要があります。MediaPipeは顔と体のポーズを推定するためにディープラーニングフレームワークを用いており、一般的なポーズ認識用のランドマークを33つ、そのうち顔に特化した11個を提供しています。特に閉塞の場合、その効果はさまざまです。MediaPipe FaceMeshモデルは、顔の468個の3Dランドマークと、頭部ポーズ推定のための幾何学的手法を用いることで信頼性を向上させます。OpenFace 2.0は顔の挙動を分析するためのツールボックスとして機能し、顔のランドマーク検出、頭部ポーズの推定、目の視線追跡、顔のアクションユニットの認識を可能にします。さまざまなプログラミング言語との統合をサポートし、ライブ映像フィードや静止画の処理も可能です。顔のランドマークや視線ベクトルなどの出力はCSV形式でエクスポートできます。OpenFace 2.0は、ランドマーク形状の変動を説明するポイント分布モデルや、局所的な外観の違いに対応するパッチエキスポーターを含む畳み込み専門家制約局所モデル(CE-CLM)を使用しています。

音素転写のアライメント

次のステップは、Montreal Forced Aligner(MFA)などの強制整列ツールを用いて、特徴的なすべてのストリーム(音響、発音、視覚)を一時的に音素レベルの注釈に整列させ、計算モデル訓練のための同期されたマルチモーダル入力を保証します。強制アライメント(FA)は、音声信号と書き起こしを照らし合わせて音声ユニットの時間的境界を決定する技術です。これにより、より正確な音声処理が可能になり、言語学の研究が進展します。音韻学の研究でますます利用されており、手動のアライメントよりもはるかに速いことが証明されています。一般的には自動音声認識(ASR)システムに関連付けられますが、FAは自動音声処理の中でより広範なタスクであり、話し言葉の解析や文字起こしも含まれます。モントリオール強制アライナー(MFA)は、HMM-GMMアルゴリズムを用いて効果的なアライメントを実現する一流のFAツールキットです。ASR技術の進歩にもかかわらず、HMM-GMMのような従来の手法はFAタスクで依然として人気があります。MFAはMFCCの特徴と4段階のトレーニング手法を用いて、正確な音声的整合31を持つ音響モデルを作成します。

モデルのアーキテクチャの構成要素

ディサルスリスティック音声認識のためのマルチモーダル深層学習モデルは、文脈的、時間的、マルチモーダル的な情報を捉えるために連携するいくつかの重要なコンポーネントで構成されています。主な構成要素には、コンテキストエンコーダ、時間的精錬モジュール、そしてマルチモーダル融合機構が含まれます。各要素は、障害のある発話における音素ラベル付けの精度向上に特有の役割を果たします。

トランスフォーマーベースのコンテキストエンコーダ

トランスエンコーダは音声シーケンスの長距離依存関係をモデル化するために使われます。構音障害の発話はしばしば不規則なタイミングや不明瞭な音素境界を含み、従来のモデルでは文脈情報を捉えるのが困難です。トランスフォーマーはマルチヘッドセルフアテンションを用いて、入力シーケンス内の異なる時間枠間の関係を分析します。これにより、モデルは音素を予測する際に過去および将来の音声フレームの両方を考慮することができます。その結果、エンコーダーは構音障害によく見られる発音や発音の違いをよりよく処理できるようになります。マルチモーダルアーキテクチャでは、トランスは同期された音響的、関節的、視覚的特徴を受け取り、コンテキスト認識された表現を生成し、モデル32,33の次の段階に渡されます。

TCNベースの時間的配列の精緻化

文脈符号化後、特徴列は時間畳み込みネットワーク(TCN)によって処理され、時間的な精度が向上します。構音障害発話には不安定なタイミングや間、伸びた音素が含まれることが多く、文脈モデルを超えたさらなる洗練が必要です。TCNは拡張された因果畳み込みを用いて、計算効率を維持しつつ長い時間的依存関係を捉えます。この構造により、ノイズの多い予測を平滑化し、時間を超えて一貫した音素境界を維持できます。アーキテクチャでは、TCNはトランスエンコーダの出力を受け取り、シーケンスを洗練して安定かつ時間的に整合した特徴表現333435を生成します。

マルチモーダル融合戦略

構音障害評価の診断精度を高めるために、マルチモーダル融合は音声、テキスト、映像、生理的センサーなど多様な情報源を取り入れます。主要な技術は、初期融合、後期融合、中間融合の3つの明確なステップで構成されています。初期の核融合は、多くのモダリティからデータを根本レベルで統合し、モデルが最初から複雑な関係性を理解することを可能にします。複数のサンプリングレートやデータ型の同期が必要なため、用途は限定的です。後期融合は各モダリティを独立したモデルで処理し、最終評価のために結果を組み合わせます。この手法は、あるモダリティのデータが欠けている場合に柔軟かつ効果的です。さらに、中間融合は中間レベルでモダリティを統合し、しばしばクロスアテンション技術を用いて依存関係を検出します。この方法は臨床の文脈で特に有用であり、言語参照と音響データを組み合わせることで結果を向上させています。まとめると、中間融合とクロスアテンションは、単一のモダリティに基づく方法よりも自動構音障害評価において優れた結果をもたらします36,37

構音障害モデルのトレーニングと評価のベストプラクティス:

構音障害の評価と認識のための筋付きモデルを開発するには、データセットの分割、指標の評価、解釈可能性に細心の注意を払う必要があります。最近の研究では、データ不足、変動性、臨床的関連性など、構音障害の独特な課題に対処するための標準化されたアプローチや革新的な解決策が強調されています(38,39)。

データセットの分割戦略

トレーニング、検証、テストデータセットが話者情報のやり取りを防ぎ、データの漏洩や過学習を防ぐために、階層化されたグループK-Foldクロスバリデーションが現在一般的に用いられています。38,39。このアプローチにより、限られたデータセットや多様なデータセットでもバランスの取れた分布と信頼性の高いパフォーマンス評価をモデルが維持できます。スピーカーによる分割がバイアス防止に不可欠であるため、一般的な分割は75:25または85:15のトレイン/テスト比率に加え、検証40のためのさらなる分割で構成されます。限られたディサルス(構音障害)データを扱うために、合成データ生成、テンポ摂動、健康的な発話からの転移学習などの一般的なデータ拡張手法が適用されます41,42

評価指標

モデル解釈可能性の考慮事項

  1. 注意マップとアライメント曲線:注意に基づくモデルは、優先する音声セグメントや音素を強調する視覚的表現を提供し、臨床的な解釈可能性と信頼構築に寄与します。
  2. 音素/特徴分析:構音障害の重症度に関連する重要な音素や音響特性を認識することで、モデルの透明性と臨床理解の両方が促進されます。
  3. ハイブリッドアプローチ:ASRに基づく明瞭性と従来の音響的特徴を融合させることで、解釈可能性がさらに向上します。

したがって、徹底した構音障害モデルパイプラインには、階層化された話者非依存のデータ分割、多面的な評価(PER、明瞭性、臨床入力)、注意メカニズムによる解釈性が含まれます。これらのアプローチにより、構音障害の評価と認識のためのモデルシステムが堅牢で臨床的に関連性があり、透明性が保たれています。

代表的な成果

複数の研究で、マルチモーダル特徴が用いられると音素境界の精度が向上したと報告されています。構音障害の発音はしばしば発音の移行がぼやけたり長く感じたりするため、音素間の正確な境界を特定するのが困難です。音響、発音、視覚的特徴を組み合わせた公開モデルは、単一峰性システムよりも参照注釈との整合性が良好であることを示しています。これらの改善はしばしばアライメント曲線を用いて可視化され、マルチモーダルモデルは特に子音–母音遷移時のタイミング誤差の減少を示します。文献報告では、音素分類の精度の向上も記述されています。マルチモーダルアーキテクチャは、特にディスチャルスリアで頻繁に歪む摩擦音や母音に対して置換誤差や欠失誤差を減らすことが示されています。過去の研究で報告された混乱行列は、視覚情報と発音情報を組み合わせることで、モデルが類似した音素をより確実に区別するのに役立つことを示しています。音素境界精度の向上はその顕著な例です。構音障害発話の発音の移行や変化はしばしば伸びたりぼやけたりしており、どちらが音素の終わりで別の音素が始まるのかを解釈しづらい。音素の開始とオフセットをより正確に識別するために、マルチモーダルシステムは視覚的な唇の動き、関節軌跡、音声からの共有データを活用します。ユニモーダル音響モデルで生成されるものと比べて、可視化された予測音素境界は真の注釈により近いものとなっています。これらの改善を可視化するためにアライメント曲線が用いられており、マルチモーダルモデルは特に母音と子音(VCとCV)間の遷移においてタイミングの誤差が少ないことを示しています。臨床現場では、これによりセグメンテーションマップが改善され、言語療法士や臨床医が唇の丸みの不足や顎の閉鎖遅延など運動制御の特定の問題を特定するのを助けます。

さらに、モデルは最も可能性の高い音声音素列を特定するための差分分類出力も生成できます。マルチモーダルシステムは、従来のモデルや基準モデルと比較して、音素置換や欠失誤差の減少を示します。例えば、唇の視覚的な形状や咬合器の位置の手がかりを取り入れることで、/s/や/ʃ/のような摩擦音の分類精度が向上します。これらは構音障害で歪んだり方向感覚を失ったりすることが多いです。混同行列もこのような改善を示すために用いられ、音素識別や分岐の改善はカテゴリー間の混同の減少によって示されます48

モデル支持補正前後の音声明瞭度測定は、臨床関連チャートを用いて比較できます。音節の安定性やタイミング、母音空間面積の推定、子音の精度評価、全体的な明瞭度スコアなどの指標もこのチャートに含めることができます。一般的に、すでに修正された出力は韻律、リズム、アーティキュレーションの境界が改善されています。例えば、矯正後、母音空間の表現は通常拡大し、母音の音響的特徴性の向上を示し、多くの構音障害治療における重要な治療目標となります(39)。

重要なのは、これらのモデル出力が臨床医の判断力を置き換えるのではなく、強化することで臨床意思決定を支援することを意図している点です。このシステムは、予想された、あるいは理論的に仮定されたパターンから大きく逸脱する特定の音素や発音の移行を強調することができます。この情報をもとに、セラピストは以下の目標を以下に調整できます:(a) 歯茎子音の舌の上昇一貫性(例:/t/、/d/)、(b) 丸みを帯びた母音の唇の突出に集中する(例:/u/)、(c) 有声音破裂音の発音タイミングを改善すること。

発表された研究では、これらの成果は医師の判断を置き換えるのではなく、臨床解釈を補完すべきだと強調されています。注意マップや音素の整合プロットなどのモデル可視化は、舌の上昇不足、唇の丸みの低下、声の発音遅延など、特定の発音問題を特定するのに役立ちます。全体として、複数の研究のデータによると、マルチモーダルなディープラーニングアーキテクチャは技術的パフォーマンス指標を向上させるとともに、治療計画やリハビリテーションの進捗追跡に役立つ解釈可能なアウトプットも提供します。

臨床統合およびリハビリテーションのワークフロー

構音障害リハビリテーションにおけるデジタル技術と高度な音声モデルの導入は、患者の成果、治療の提供、臨床実践を変革しています。このセクションでは、フィードバック指向の発音トレーニングの枠組み、言語療法士と患者モニタリングの役割の進化、モデル出力の治療ツールへの統合、そして重大なユーザビリティの懸念について扱います。

これらのモデル出力はどのように言語療法ツールに反映されるのでしょうか?

ASRや重症度分類器を含む現代のAIおよび深層学習モデルは、音声明瞭度、発音誤差、重症度レベル48に関する詳細で客観的なデータを生成できます。これらの成果は、近年ますますデジタルセラピープラットフォームやモバイルアプリケーションに組み込まれており、患者やセラピストにリアルタイムかつパーソナライズされたフィードバックを提供します。例えば、タブレットベースのアプリケーションやクラウドベースの遠隔モニタリングシステムは、モデル生成の指標を用いて進捗を可視化し、特定の発音障害を強調し、運動難易度を調整します。これらのシステムは治療進捗の客観的な追跡、個別の運動選択、デジタルプラットフォーム505152を通じた遠隔モニタリングの支援を可能にします。

フィードバック型の発音トレーニングモジュール

フィードバック型トレーニングモジュールは、デジタル構音障害リハビリテーションの中心です。過去の研究では、デジタルリハビリテーションモジュールにはバイオフィードバック、自動エラー検出、適応型運動設計が含まれていることが多いと報告されています。言語療法におけるバイオフィードバックは、波形表示や咬合器の動きの可視化などの視覚的・聴覚的な手がかりを用いて、患者にリアルタイムの指導を提供します。さらに、音声的または発音の誤りを識別するAIモデルによる自動エラー検出が可能となり、学習を向上させるための即時の修正フィードバックを提供します。訓練プロセスは階層的かつ適応的であり、音声、音節、単語を対象としたより単純なタスクからより複雑な課題へと進んでいきます。これらのエクササイズは患者のパフォーマンスに応じて動的に調整され、個別化された学習体験を保証します。さらに、ゲーミフィケーション要素やバーチャルリアリティ(VR)を一部のプラットフォームに取り入れることで、患者のモチベーションやコンプライアンスが向上し、治療過程をより魅力的なものにしています。これらのモジュールは集中的かつ反復的な練習を支援し、運動学習や発話改善の鍵でありながら、自立またはセラピストの指導による使用を可能にします 51,53,54。

言語療法士の役割と患者モニタリング

言語療法士(SLT)は、デジタルツールが過去10年間でより普及したにもかかわらず、リハビリテーションプロセスの中心的な役割を果たし続けています。評価と目標設定には、モデルの出力を解釈して適切な治療対象を選択し、個々の患者のニーズに合わせた差別治療計画をカスタマイズすることを含みます。患者の進捗を監視するためには、監督とフィードバックが不可欠です。専門家は発話の矯正についてフィードバックを提供し、必要に応じて治療の調整を行います。さらに、患者教育とサポートも重視され、リハビリテーション過程でデジタルツールを効果的に活用する方法を教えています。多職種間の協力は不可欠であり、さまざまな分野の専門家が協力してリハビリテーションの広範なニーズに対応し、包括的な患者ケアのアプローチを実現します。患者モニタリングはデジタルプラットフォームによって強化されており、セラピストや臨床医は患者の遵守状況、回復、パフォーマンス、アウトカムを遠隔で追跡でき、タイムリーな介入や継続的なサポートが可能となります。

使いやすさの考慮:患者の快適さと再現性

デジタルリハビリ技術を成功裏に導入するためには、使いやすさが不可欠であり、多様な患者ニーズに応える使いやすいインターフェースに重点を置いています。柔軟な治療法はモバイルプラットフォームによって可能となり、快適さとアクセス性が向上しています。適応可能なモジュールや自動フィードバックなどの重要な機能は、一貫した自律的な参加を促進し、これは運動学習に不可欠です。パイロットテストでは高い受容率と満足度が示されていますが、技術的な問題も依然として存在します。患者やセラピストからの継続的なフィードバックにより、これらのツールは現実の要件に合わせたものに強化されます。意味のある治療体験の開発に重点を置き、AIとフィードバック駆動型トレーニングの活用が構音症リハビリテーションにおける有効性、アクセスしやすさ、パーソナライズの向上に寄与しています

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結論

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本レビューでは、ディスアトースリアにおける音素表示や音声回復におけるマルチモーダル深層学習アーキテクチャの応用が増加していることを説明しています。これらのアーキテクチャは、音響的「発音」と視覚的解析を組み合わせ、低明瞭性や非標準的な発音構成を特徴とする病理的発話における音声認識の限界を克服します。電磁発音法、超音波、舌イメージング、顔のランドマークは、より包括的なモデルです。音声生成により、障害のある発話における音響的詳細や運動指令を捉えられる可能性があります。これらの技術は、音素境界識別の「シーケンス安定性」や劣化モダリティへの耐性の向上が期待されています。トランスフォーマーモデルの時間畳み込み精緻化やマルチモーダル融合戦略を用いた注意ベースの文脈符号化の実装は、音声評価ツールの改善や治療のより効果的なモニタリングにつながる可能性があります進展。臨床的には、マルチモーダルモデルは発話の産出およびリハビリテーション成果の客観的かつ解釈可能な指標を提供する可能性があります。今後の方向性には、より大規模なマルチモーダルデータセットでのトレーニング、モデルの解釈可能性の向上、...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは利益相反を一切認めていない。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者らは、南京南京中医薬大学付属病院である中医学大学に必要なフェローシップと資金提供(江蘇省大学院科学研究イノベーションプログラムKYCX25_2282)に感謝の意を表します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kundi, P., Gencer, Z. K., Muluk, N. B. Speech Disorders and Aphasia: Overview. Phys Ther Rehabil Otorhinolaryngol. , 487-494 (2025).
  2. Rose, K. R., Hughes, P. M. Speech systems. Br Telecom Technol J. 13 (2), 51-62 (1995).
  3. Ackermann, H., Hertrich, I. The contribution of the cerebellum to speech processing. J Neurolinguistics. 13 (2–3), 95-116 (2000).
  4. Johnson, J. A. Speech, Voice, and Communication. Int Rev Neurobiol. 134, 1189-1205 (2017).
  5. Enderby, P. Disorders of communication: dysarthria. Handb Clin Neurol. 110, 273-281 (2013).
  6. Feenaughty, L., Mefferd, A., Tjaden, K. Dysarthria. Encycl Hum Brain. 1-5, V5-301-V5-315 (2023).
  7. Pan, T., Wang, S. Dysarthria as a Presenting Symptom With Rapidly Progressive Imaging Features in Sporadic Creutzfeldt-Jakob Disease: A Case Report. Cureus. 16 (6), e62687 (2024).
  8. Kieling, M. L. M., Finkelsztejn, A., Konzen, V. R., dos Santos, V. B., Ayres, A., et al. Articulatory speech measures can be related to the severity of multiple sclerosis. Front Neurol. 14, (2023).
  9. Kirshner, H. S., Samuels, M. A. Speech and Language Disorders. Neurol Localization Diagnosis. , 177-189 (2023).
  10. Gutz, S. E., Stipancic, K. L., Yunusova, Y., Berry, J. D., Green, J. R. Validity of Off-the-Shelf Automatic Speech Recognition for Assessing Speech Intelligibility and Speech Severity in Speakers With Amyotrophic Lateral Sclerosis. J Speech Lang Hear Res. 65 (6), 2128 (2022).
  11. Nasereddin, H. H. O., Omari, A. A. R. Classification techniques for automatic speech recognition (ASR) algorithms used with real-time speech translation. Proc Comput Conf 2017. , 200-207 (2018).
  12. Ríos-Urrego, C. D., Escobar-Grisales, D., Orozco-Arroyave, J. R. Synchronous Analysis of Speech Production and Lips Movement to Detect Parkinson’s Disease Using Deep Learning Methods. Diagnostics. 15 (1), 73 (2024).
  13. Deng, S., Du, J., Zhang, J., Wang, X. Deep learning approach for short-term entry passenger flow forecasting in urban rail transit stations. Eng Appl Artif Intell. 163, 112989 (2026).
  14. Tunio, N. A., Tunio, M. A., Raza, M. A., Faheem, M., Hashmani, A. A., Nadeem, R. Performance Comparison Between Deep Learning Models for Fault Classification in Transmission Lines Using Time Series Data. Energy Sci Eng. 13 (5), 2330-2351 (2025).
  15. Yu, C., Su, X., Qian, Z. Multi-Stage Audio-Visual Fusion for Dysarthric Speech Recognition With Pre-Trained Models. IEEE Trans Neural Syst Rehabil Eng. 31, 1912-1921 (2023).
  16. Qian, Z., Xiao, K. A Survey of Automatic Speech Recognition for Dysarthric Speech. Electron. 12 (20), 4278 (2023).
  17. Strand, E. A. Clinical and professional ethics in the management of motor speech disorders. Semin Speech Lang. 24 (4), 301-311 (2003).
  18. Alhinti, L., Cunningham, S., Christensen, H. The Dysarthric Expressed Emotional Database (DEED): An audio-visual database in British English. PLoS One. 18, (2023).
  19. Lee, S. E., Huang, M. L., Hsu, T. C. Using Spectrogram to Evaluate Dysarthric Treatment Effectiveness. Rehabil Pract Sci. 18 (1), 177-185 (1990).
  20. Abdul, Z. K., Al-Talabani, A. K. Mel Frequency Cepstral Coefficient and Its Applications: A Review. IEEE Access. 10, 122136-122158 (2022).
  21. Chartier, J., Anumanchipalli, G. K., Johnson, K., Chang, E. F. Encoding of articulatory kinematic trajectories in human speech sensorimotor cortex. Neuron. 98 (5), 1042 (2018).
  22. Williams, S., Foulkes, P., Hughes, V. Analysis of forced aligner performance on L2 English speech. Speech Commun. 158, (2024).
  23. Janbakhshi, P., Kodrasi, I. . Experimental investigation on STFT phase representations for deep learning-based dysarthric speech detection. , (2022).
  24. Varma, V. J., Jana, A., Samal, A. K., S, A. u. r. o. b. i. n. d. o., Naidu, R. C., et al. Enhancing dysarthria severity classification: efficient audio-based deep learning models. Discov Appl Sci. 7 (8), (2025).
  25. Fadlil, A., Perdana, L., Pujiyanta, A., Imam Karim Fathurrahman, H., Muhammad Jogo Samodro, M. Implementation of Dysarthria Identification Using MFCC and Multilayer Perceptron Algorithm. SSRG Int J Electr Electron Eng. 12, 32-46 (2025).
  26. Rebernik, T., Jacobi, J., Jonkers, R., Noiray, A., Wieling, M., et al. A review of data collection practices using electromagnetic articulography. Lab Phonol. 12 (1), 1-42 (2021).
  27. Girod-Roux, M., Hueber, T., Fabre, D., Gerber, S., Canault, M., et al. Rehabilitation of speech disorders following glossectomy, based on ultrasound visual illustration and feedback. Clinical Linguist Phonetics. 34 (9), 826-843 (2020).
  28. Yang, Y., Su, R., Zhao, S., Ng, M. L., Yan, N., et al. Towards unified diffusion model for speech to ultrasound tongue imaging synthesis. Inf Fusion. 127, 103896 (2026).
  29. Bian, Y., Küster, D., Liu, H., Krumhuber, E. G. Understanding Naturalistic Facial Expressions with Deep Learning and Multimodal Large Language Models. Sensors (Basel). 24 (1), 126 (2023).
  30. Hammadi, Y., Grondin, F., Ferland, F., Lebel, K. Evaluation of Various State-of-the-Art Head Pose Estimation Algorithms for Clinical Scenarios. Sensors (Basel). 22 (18), 6850 (2022).
  31. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi. , 498-502 (2017).
  32. Yi, F., Wen, H., Jiang, T. ASFormer: Transformer for Action Segmentation. , (2021).
  33. Bharilya, V., Kumar, N. Machine learning for autonomous vehicles’ trajectory prediction: A comprehensive survey, challenges, and future research directions. Veh Commun. 46, (2024).
  34. Li, H., Qiu, T. Continuous Manufacturing Process Sequential Prediction using Temporal Convolutional Network. Comput Aided Chem Eng. 49, 1789-1794 (2022).
  35. Biffi, C., Roffo, G., Salvagnini, P., Cherubini, A. A temporal convolutional network-based approach and a benchmark dataset for colonoscopy video temporal segmentation. Comput Methods Programs Biomed. 270, 108782 (2025).
  36. Alzahrani, S., Hussain, N., Mohammad, F. Enhancing Phoneme Labeling in Dysarthric Speech with Digital Twin-Driven Multi-Modal Architecture. Comput Mater Contin. 84 (3), 4825-4849 (2025).
  37. Lv, C., Fan, L., Li, H., Ma, J., Jiang, W., et al. Leveraging multimodal deep learning framework and a comprehensive audio-visual dataset to advance Parkinson’s detection. Biomed Signal Process Control. 95, 106480 (2024).
  38. Dai, W., Li, M., He, Y., Zhu, Y. Fine-Tuning Pre-Trained Audio Models for Dysarthria Severity Classification: A Second Place Solution in the Multimodal Dysarthria Severity Classification Challenge. , 151-153 (2024).
  39. Qi, J., Van hamme, H. A Study on Model Training Strategies for Speaker-Independent and Vocabulary-Mismatched Dysarthric Speech Recognition. Appl Sci. 15 (4), 2006 (2025).
  40. Shahamiri, S. R., Lal, V., Shah, D. Dysarthric Speech Transformer: A Sequence-to-Sequence Dysarthric Speech Recognition System. IEEE Trans Neural Syst Rehabil Eng. 31, 3407-3416 (2023).
  41. Vinotha, R., Hepsiba, D., Vijay Anand, L. D., Andrew, J., Jennifer Eunice, R. Enhancing dysarthric speech recognition through SepFormer and hierarchical attention network models with multistage transfer learning. Sci Reports. 14 (1), 1-23 (2024).
  42. Hashan, A. M., Alexandrovich Khlebnikov, N., Bredikhin, B. A. Attention Based Encoder-Decoder for Automatic Hyperkinetic Dysarthria Speech Recognition in Educational Organizational Systems. , 1-4 (2025).
  43. Merler, M., Agurto, C., Peller, J., Roitberg, E., Taitz, A., et al. Clinical assessment and interpretation of dysarthria in ALS using attention based deep learning AI models. NPJ Digit Med. 8 (1), 260 (2025).
  44. Van Nuffelen, G., Middag, C., De Bodt, M., Martens, J. Speech technology-based assessment of phoneme intelligibility in dysarthria. Int J Lang Commun Disord. 44 (5), 716-730 (2009).
  45. Middag, C., Bocklet, T., Martens, J. P., Nöth, E. Combining phonological and acoustic ASR-free features for pathological speech intelligibility assessment. , 3005-3008 (2011).
  46. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  47. Zhu, T., Duan, S., Liang, H., Li, F., Zhang, W. Multiangle Correlation Feature Extraction and Disease Prediction Model Construction for Patients With Post-Stroke Dysarthria. IEEE Trans Neural Syst Rehabil Eng. 33, 587-597 (2025).
  48. Stell, A., Vogel, A. P., Vera Soto, J. P., Pareja, A. A., Sinnott, R. A Platform for the Delivery of Speech Treatment for Dysarthria in Multisystemic Ataxia. Proc - IEEE Symp Comput Med Syst. , 405-410 (2025).
  49. Gupta, S., Patil, A. T., Purohit, M., Parmar, M., Patel, M., et al. Residual Neural Network precisely quantifies dysarthria severity-level based on short-duration speech segments. Neural Networks. 139, 105-117 (2021).
  50. Javanmardi, F., Kadiri, S. R., Alku, P. Pre-trained models for detection and severity level classification of dysarthria from speech. Speech Commun. 158, 103047 (2024).
  51. Mulfari, D., La Placa, D., Rovito, C., Celesti, A., Villari, M. Deep learning applications in telerehabilitation speech therapy scenarios. Comput Biol Med. 148, 105864 (2022).
  52. Bhat, C., Strika, H. Speech Technology for Automatic Recognition and Assessment of Dysarthric Speech: An Overview. J Speech, Lang Hear Res. 68 (2), 547-577 (2025).
  53. Michizoe, R., Kinosada, H., Nishikawa, H., Taniguchi, I., Matsunaga, K., et al. Japanese Vowel-mora Visualization for Dysarthria Rehabilitation with Variational Autoencoder. , 494-498 (2024).
  54. Woo, S. T., Ha, J. W., Na, S. Design of a personalized oral—motor exercise device for speech impairment rehabilitation. Front Bioeng Biotechnol. 13, 1543259 (2025).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

関連記事