本記事では、ナイキストシフト強化と機械学習アンサンブルモデルを組み合わせた自動特徴抽出パイプラインを提示し、人間の介入を必要とせずにアルツハイマー病、前頭側頭認知症、健康クラスを区別します。
研究記事
本記事では、ナイキストシフト強化と機械学習アンサンブルモデルを組み合わせた自動特徴抽出パイプラインを提示し、人間の介入を必要とせずにアルツハイマー病、前頭側頭認知症、健康クラスを区別します。
アルツハイマー病(AD)と前頭側頭型認知症(FTD)は、記憶、認知機能、実行処理を妨げる一般的な神経変性疾患です。本研究の目的は、臨床的介入を必要とせずに早期にアルツハイマー病を予測するための完全自動化された機械学習パイプラインを開発することです。この方法論は、微妙な神経活動の変化を定量的に分析することを提案します。目標は、EEGデータを活用して患者をAD、FTD、健康対照群に分類し、人間の介入や臨床評価を不要にする信頼性の高い完全自動化システムを構築することです。システムの大きな革新は、信号処理アプローチと自動化された機能パイプラインにあります。具体的には、ナイキスト周波数の戦略的修正により、多領域EEGの特徴と人口統計データを統合したハイブリッド融合層と組み合わせて脳波信号の解像度を向上させています。その後、双方向のANOVAベースの特徴選択により、このハイブリッドセットが洗練されます。この強化により、より効果的な特徴抽出が可能となり、分類精度の向上に寄与します。提案された手法では、訓練データセットを豊かにするために周波数を時代化しています。したがって、標準的なランダムフォレストモデルは99.72%の訓練精度を得ます。手法の堅牢性と汎用性を確保するために、ハイブリッド核融合モデルを提案します。
アルツハイマー病の一般的な症状には、記憶喪失、認知障害、睡眠障害、混乱、方向感覚喪失、人格の変化などがあります。したがって、早期予測により患者が最悪の状態に陥り、24時間365日支援を必要とする状態に陥ることを防ぐことができます。この病気の診断方法は、MRI1、CT、PET2、EEG3など様々な方法で行われます。特に、脳波信号とMMSEの組み合わせは、アルツハイマー病の予測において非侵襲的であることが証明されています。脳波信号の周波数はアルファ、ベータ、シータ、ガンマ、デルタなど多様です。アルファ波は、人がリラックス状態にあるときに検出されます。3.アルファ波の周波数は8から12 Hz4の範囲です。β波は脳の覚醒期に活動し、13から30 Hz4の範囲です。シータ波とデルタ波は、それぞれ睡眠状態と深い睡眠状態で活動しています。周波数帯域はシータ波(4-7 Hz)とデルタ波(< 3.5 Hz)です [4]。従来の診断方法はMMSEのような画像診断や臨床評価に依存しており、これらは主観的で費用もかかることが多いのに対し、EEG信号は脳活動をリアルタイムで捉え、効率的な代替手段を提供します。
本研究は、EEG信号のみを入力として受け取る完全自動化の診断パイプラインを提案し、臨床スコアリングの必要性を回避します。これらの波を脳から抽出するためには様々な方法が用いられます。ナイキスト周波数を考慮するバンドパスフィルターは、EEG周波数を抽出する方法です。ナイキスト周波数はサンプリング周波数を半分に下げ、前処理信号の鮮明さを向上させます。したがって、EEG検査とミニメンタルステート検査(MMSE)を組み合わせることは、神経内科医がアルツハイマー病(AD)のさまざまな段階を評価するために用いる方法です。欧州神経科学者連盟5は、この疾患のさまざまな分類の診断ガイドラインを定めています。
本記事は、アルツハイマー病(AD)、前頭側頭認知症(FTD)、および健康な被験者(対照群)を大まかに分類します。前頭側頭認知症は、前頭部と側頭葉のみが影響を受ける人間の脳の状態です 6,7。図1は、前頭側頭型認知症(FTD)で通常影響を受ける脳の領域、前頭葉と側頭葉を示しています。本研究では、EEG信号の時間領域および周波数領域の特徴を人口統計的特徴と組み合わせています。機械学習フレームワークの客観性と自律性を確保するため、ミニメンタルステート検査(MMSE)スコアは意図的に機能セットから除外されました。MMSEは認知評価の臨床指標として広く使われていますが、臨床医の評価に本質的に影響を受け、分類課題において優勢なバイアスを生じさせます。MMSEを省略することで、提案された方法は主観的な臨床入力に依存しずに機能する自立したデータ駆動型診断モデルを開発し、将来的に完全自動化されたAIベースのスクリーニングツールの開発を支援することを目指しています。MMSEスコアを除く最終の特徴はラベル付けされ、提案されたEEGハイフュージョンモデルに提供されます。詳細はプロトコルのセクションに記載されています。
文献調査
脳波検査(EEG)は、神経疾患の早期診断に向けた非侵襲的かつ費用対効果の高いツールを提供します。EEGの特徴抽出と周波数帯解析は、神経科学や臨床研究において重要なモダリティとして台頭し、認知的および病理的状態の幅広い脳活動に関する洞察を提供しています。近年、EEGデータを解析するために機械学習を活用することは注目を集めており、認知状態のモニタリングからアルツハイマー病のような神経疾患の早期診断まで幅広い応用が広がっています。本文献調査は、EEG特徴抽出、分類、モデル開発に関する既存の研究における主要な貢献とギャップを明らかにします。
EEG信号認知関連性
SubhaらはEEG信号の非定常性を効率的に捉える時間周波数領域特徴であるRMSを強調しました が、彼らの研究はモデル構築を導入していません。したがって、本研究は病気の診断精度を判断するために機械学習モデルを提案しました。
Barryら9はEEG周波数帯域と認知状態の関係を示し、特定の周波数帯域(例:アルファ波)がリラクゼーションや注意と結びついていることを示しました。Buzsáki10は神経振動の生理学的意義と脳機能における役割を探り、EEG研究における周波数特異的解析の有用性を強調しました。周波数帯域解析は確立されていますが、効率的かつ拡張性のある特徴抽出パイプラインの必要性は依然として注目の的であり、特に高次元データセットにおいて重要です。
EEG特徴抽出技術
センカヤ、クルナズらは、PSDやエントロピーなどのスペクトル的特徴を用いてアルツハイマー病を予測しています。これらのスペクトルパワーは、脳活動の減速をより正確に捉えるのに役立ちます。11 この研究はスペクトル特徴に効果的に対処していましたが、RMSのような時領域特徴は組み込んでいませんでした。したがって、本研究はアルファ、ベータ、ガンマ、シータ、デルタなどの周波数から抽出された時間領域特徴を提案します。
LuckらとKappenmanらは注意と作業記憶のEEGバイオマーカーをレビュー し、認知状態識別における周波数帯の特徴の重要性を強調しました。Cassaniら13 は、アルツハイマー病の診断ツールとしてEEGを探求し、周波数帯の特徴を活用して認知機能低下の神経シグネチャーを特定しました。MichelとMurray14 は、認知過程や神経接続性を理解するためのマルチチャネルEEG解析の有用性について論じ、機械学習応用の基盤を築きました。これらの進歩にもかかわらず、Random ForestやXG-Boostのようなスケーラブルな機械学習モデルと自動特徴抽出パイプラインの統合は依然として十分に探求されていません。既存の文献では、認知および臨床応用における周波数帯域解析と機械学習技術の組み合わせが強調されています。
認知症分類のための機械学習とハイブリッド融合モデル
特にXGBoostのようなアンサンブルベースの機械学習モデルは、EEG由来の特徴の分類に有望であることを示しています15。これらのモデルは、入力特徴と出力ラベル間の非線形関係を学習することで、EEG信号の複雑さや変動性に対応します。研究15 は適切なモデルを提案しましたが、精度スコアは損なわれています。
Craikら16 はEEG解析のためのディープラーニングおよび従来の機械学習モデルの包括的なレビューを提供し、構造化データにおける勾配ブースティングフレームワークの成功を強調しました。Abiriらは脳コンピュータインターフェースアプリケーション向けにXG-Boostを応用し 、特徴冗長性やノイズの処理能力により堅牢な分類性能を実現しました。Aghababaeiら18 は、XG-Boostを含むアンサンブル手法をEEGベースの感情認識課題に用い、従来の手法に比べて精度と一般化の向上を報告しました。しかし、データセットのバランスの欠如、特定のクラスの過小代表、機械学習モデルの解釈可能性などの課題は依然として存在し、モデル最適化や正則化技術のさらなる研究が必要です。
Zhengら19 は、安静状態の目を閉じたEEG(19チャンネル)を用いて時間・周波数の機能的結合性測定を計算し、AD、FTD、健康対照を分離するために機械学習分類器を訓練しました。しかし、信号表現を強化し、堅牢なアンサンブル分類を提供する手法の必要性を強調しました。
EEGに基づく分類は、認知神経科学や臨床分野で広く応用されています。これまでの研究は機械学習に基づくEEG解析の強固な基盤を提供していますが、いくつかのギャップが残っています。多くの研究は手作りの機能(例:RMS、PSD)に依存しており、すべての関連情報を捉えきれない場合があります。自動化された特徴量エンジニアリングやディープラーニング手法は、従来の手法を補完する可能性があります。
特に多クラス環境におけるEEGデータセットの不均衡は、分類結果を歪めることが多いです。クラスごとの重み付けやデータ拡張などの戦略は、代表性の低いクラスのパフォーマンス向上に期待できます。しかし、特徴抽出とモデル分類を統合した効率的で解釈可能かつ汎用化可能なパイプラインの必要性は依然として存在します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
提案された手法は、脳波信号を周波数領域に戦略的に分割し、スペクトル分解能を向上させます。その後、キャプチャされたEEG信号は10セグメントに分割され、特徴計算における時間的解像度と一貫性を高めます。提案された手法は、派生したEEG特徴に対してRF、XGBoost、SVMベースの分類器を実装し、強固でスケーラブルなEEG解析手法の開発に貢献します。特定のハイパーパラメータ変更を含むRFモデルは、他の標準モデルの中で最も性能が優れていることが証明されています。そのため、RFとXG-Boostを組み合わせたハイブリッド、融合、積み重ねメタルアーナーモデルが提案され、予測精度をさらに向上させます。
この方法で使用されたデータセットは、機関の倫理基準に従って収集されました。データセット提供者はデータ取得前に参加者の同意を得ています。
1. データセット仕様
システムの堅牢性を証明するために、2つのデータセットが用いられています。最初のデータセットはEEGデータリポジトリ20から収集され、88名の参加者が安静状態の目を閉じた状態で、36名がAD(うつ伏線条形)と診断され、23名がFTD(前蹄顳頭離脱症)、29名が健康でした。EEG記録は、国際的な10-20モンタージュの後、19チャンネルシステムを用いて静止状態で目を閉じた状態で取得されました。 図2に示されたデータセットでは、すべての信号が500Hzでサンプリングされ、データセット提供者による予備前処理とともにBIDS形式で提供されました。
2つ目のデータセットは、外部の公開リポジトリ21 から収集され、35名の参加者が安静状態にあります。そのうち13名がアルツハイマー病(AD)と診断され、7名が軽度認知障害(MCI)患者、15名が健康な高齢者です。2番目のデータセットの安静状態ベースラインセグメントのみが使用され、最初のデータセットとの整合性を維持しました。2番目のデータセット21 は、 図3に示されているように完全な前処理パイプラインを必要としました。
2. 前処理
既存の研究では、複雑な前処理パイプライン、手動の人工物修正ステップ、またはICA-ASRが筋肉の動きを除去することが多く、臨床ワークフローでの再現性を制限しています。これらの制約に対処するため、提案されたパイプラインは計算負荷の高いアーティファクト除去手順を排除し、制御されたフィルタリング、エポックセグメンテーション、周波数特有の特徴計算を重視する、効率的なEEGのみのアプローチに焦点を当てています。
3. 特徴抽出
前処理されたEEG信号は特徴抽出法に渡されます。EEG信号はバンドパスフィルタリングで5つの標準周波数帯、デルタ(0.5-4 Hz)、シータ(4-8 Hz)、アルファ(8-13 Hz)、ベータ(13-25 Hz)、ガンマ(25-40 Hz)に分かれます。
各フィルタリング信号ごとに、すべてのEEGチャネルで平均平方根(RMS)値を計算しました。RMSの数学的定式化は式(1)で示されます。
RMS =
(1)
ここで、xi は第 i 回目のサンプルにおける脳波信号振幅です。Nは信号セグメント内のサンプル数の合計です。
RMSは各周波数帯における振動活動のエネルギーを定量化できる能力から、主要な特徴として選ばれました。アルツハイマー病は、デルタおよびシータ活性の増加、アルファおよびベータ活性の低下としばしば関連しています。前頭側頭認知症(FTD)はこれらのバンドで明確なパターンを示すことがあります20,21。PSDは数学的にRMSと冗長であるため、特徴とはみなされません。コンパクトなデータセットを維持するために、HjorthやEntropyなどの残りの特徴は除外します。
4. ハイブリッド核融合
抽出された時間領域RMS特徴は、バンドパスフィルタリングから得られる周波数領域特徴と組み合わせられ、モデル入力のためのハイブリッド空間とされました。コンパイルの詳細は 図3に示されています。最終的な正規化されたデータセットは、参加者を表す行と、年齢、性別、グループなどの人口統計的特徴を表す列が表形式で整理されています。 図2 に示されたパイプラインは、アルツハイマー病研究に関連するEEGの特徴を効率的に抽出します。抽出された特徴は、主要な周波数帯域内の神経活動に関する洞察を提供し、機械学習や統計解析に活用可能です。
5. 特徴選択
モデルの性能向上と特徴次元の低減のために、2方向分散分析(ANOVA)に基づくアプローチが適用されました。ANOVAに基づく選択は、グループと年齢を独立因子として、RMS周波数帯を依存特徴として適用しました。この分析では、グループ、年齢、年齢間相互作用が各特徴に与える影響を評価しました。少なくとも1つの要因でp値が0.05<特徴を選定し、さらなる分類を行った。詳細なANOVAに基づく結果は結果セクションに示されています。これらの特徴は分類において最も有益な変数であり、最終的な予測モデルの精度と一般化の向上に寄与しました。ANOVAテストの結果、モデル作成のために最も有益な特徴のみが選ばれました。また、数値以外の属性である性別とparticipant_idは分析から除外されました。対象変数グループは分類のためにラベルエンコードされました。
6. モデルの説明
この疾患をアルツハイマー、コントロール、前頭型認知症の3つのクラスに分類するために、XG-Boost、ランダムフォレスト、サポートベクターマシンSVM、スタックドモデルなどの3つの教師あり機械学習モデルが構築されました。挙げられたすべてのモデルは、トレーニングデータセットの70%、テストデータセットの30%を使用していました。各モデルは、医療データ解析における実証された性能と、非線形および高次元特徴空間の処理能力を評価して選ばれました。モデルの一般化可能性を評価するために検証データセットで評価が行われました。
モデルの性能は、真陽性(TP)、偽陽性(FP)、真陰性(TN)、偽陰性(FN)からなる混同行列を用いて評価されました。パフォーマンス指標には、精度や各クラスの精度、想起率、F1スコアを詳細に記載した分類レポートが含まれていました。以下の式はパフォーマンス指標を示しています。
(2)
(3)
(4)
(5)
1. XG-ブースト分類器
この手法は、XGBoostアルゴリズムを用いて多クラス分類モデルを実装し、抽出した特徴からEEG由来の認知状態を予測するもので、 図3の出力1に示されています。出力1にはRMSの特徴とMMSEスコアが含まれています。XGBoostモデルを構築する際には、RMS特徴の非線形な挙動を検証するためにMMSEスコアも含まれています。これはシステム開発のベンチマークおよび基準として使用されます。完全自動化された臨床医非依存システムの目標を達成するため、後の段階でMMSEは除外されました。
XG-Boostは効率と精度に最適化された勾配ブースティングフレームワークであり、分類タスクにおける構造化データの扱いに適しています。少数のハイパーパラメータは、クロスバリデーションやグリッドサーチなどの手法を用いてEEGデータセット上で調整されます。以下に定義する主要なパラメータ値は、正則化 による 過学習制御と、過度に複雑にならずにEEGの特徴の複雑さを捉えるために選ばれています。
モデルの主要なパラメータは以下の通りです:(1) 最大木深さ=8。これにより決定木の深さを制限し、過学習を減らし一般化を強化します。浅い木は不要な情報を見逃してしまうため、より深い木は過学習しやすいからです。(2) L2 正則化(λ = 10)は、モデルの複雑性を制御することで過学習を最小限に抑えるために、大きな係数に対してペナルティを加えます。(2) L1正則化(α = 5)が導入され、モデルにさらなるスパーシティを与え、解釈可能性と堅牢性を向上させます。推定量の数(n_estimators=8)は、計算効率を維持しつつパフォーマンスのバランスを取るためにブースティングの反復回数を制限しました。
2. ランダムフォレスト分類器
ランダムフォレストは、データや特徴のランダムな部分集合に基づいて複数の決定木を構築し、それらの出力を集約して最終的な予測を行うアンサンブル分類器です。ノイズに対する堅牢性を持ち、非線形データを適切に扱い、多様な木の予測を平均することで過学習を減らします。この研究では、ランダムフォレストモデルを試行錯誤法を用いて主要なパラメータを設定しました。これらのパラメータは以下に説明します。
1) n_estimators=100
これは森林内の決定木の数を制限するために選ばれています。木の数が多いほど一般化が良くなり、予測も安定します。
2) max_depth=10
各木の最大深さを示します。木の深さが低いと、フィッティング不足の可能性があります。高深度は詳細を捉え、訓練データを記憶するかもしれませんが、過学習になることがあります。したがって、特にEEGのようなノイズや複雑な信号には10を選ぶのが最適なポイントです。
3) random_state=40
これは、ブートストラップサンプリングやツリー構築に使われる乱数生成シードを修正します。これにより再現性が保証されます
4) n_jobs=-1
n_jobsの値を-1に設定することで、モデルはすべてのCPUコアを効率的に活用しています。
7. サポートベクターマシン(SVM)
サポートベクトルマシンは、二値および多クラス分類22における線形性能で知られるマージンベースの分類器です。このモデルは非線形EEG信号を捉えられるため、放射基底関数カーネルを使用していました。しかし、モデルは特徴スケーリングの不足とデータセットサイズの制限が原因と思われ、最適とは言えませんでした。SVMは理論的には強力ですが、ハイパーパラメータ調整やデータ分布に対する感度が高いため、木構造モデルに比べて精度が低い理由が説明できるかもしれません。
8. 提案されたHY-fusionモデル
ランダムフォレストモデルは高精度を達成しましたが、一般化とスケーラビリティを確保するために、ランダムフォレストとXG-Boostで積み重ねモデルを構築しました。出力はロジスティック回帰モデルへの入力として入力されます。そしてロジスティック回帰はメタルアンダーとして働きます。モデルのアーキテクチャ図は 図4に示されています。
スタックモデルは入力20の1セットに加え、2番目のデータ23セットからの入力も受け取りました。Mendely21のデータセットは、RMSを抽出し、10秒までのエポーチを用いてモデルに理解可能な形に事前処理されます。各モデルで得られた結果は結果セクションに示されています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
エポック法の強みを正当化するために、データセットをエポッホージせずにRFモデルの性能を比較します。非時代条件下では、連続記録全体から特徴を抽出し、RFモデルに割り当てました。非エポホージング信号は53%の精度を示しました。これは、エポホージングがモデル作成においてより安定した情報提供方法を提供することを示しています。したがって、p<0.05のANOVAに基づく特徴は有意とみなされます。例えば、alpha_rmsは有意なグループ効果(p = 9.007147 × 10⁻³⁷)を示した一方で、年齢グループおよび相互作用効果は統計的に有意でなく、alpha_rmsの変動は主に年齢ではなく疾患状態によるものであることを示唆している。同様に、beta_rmsはグループ(p = 1.773449 × 10⁻⁸)および年齢グループ(p = 4.457329 × 10⁻²)の両方に有意性を示し、病理的および年齢関連の変化に対する感受性を示しました。Gamma_rmsはグループ(p = 4.212443 × 10⁻¹°)および相互作用項(p = 4.527135 × 10⁻⁴)において有...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本研究で提案される研究では、Hy-Fusion積みアーキテクチャを使用する動機は、RFのような木ベースの学習器の補完的な強みを組み合わせ、ロジスティック回帰メタ学習器を通じて予測分散を減らすことです。スタック戦略は、基礎学習者が異なる帰納バイアスや誤りパターンを持つ場合に一般的に採用されます。メタ学習者は基底分類器の系統的な誤りを修正し、より校正されたアンサンブル出力を生成することを学びます。
エポックを作成するプロセスは、データセットを豊かにするだけでなく、モデルのパフォーマンスをより高いレベルに押し上げるのにも役立ちました。 表5は 提案されたアプローチと既存のEEGに基づく認知症分類法25、26、27との比較研究を示しています。
本研究...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは、本出版物に利益相反の申告がないことを確認しています。
著者たちは編集者と匿名のレビュアーの皆様に感謝の意を表します。これにより作品の質が向上しました。本研究は、公共、商業、非営利分野の資金提供機関から特定の助成金を受けていません。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| バンドパスフィルタリングツール | MNE-Python | 内蔵フィルタ | 前処理に使用 |
| コンピュータワークステーション | — | Windows/Linux | 分析計算 |
| EEG取得システム | データセット作成者によって提供 | — | 著者によって使用されていない(データセットが提供されている) |
| エポッキング関数 | MNE-Python | 内蔵関数 | セグメンテーションに使用 |
| GitHubまたはGoogle Drive | — | — | コード/データの保存 |
| Google Colab | オンライン | クラウドコンピューティング環境 | |
| MATLAB(信号チェックに使用) | MathWorks | R202x | オプション |
| Mendeley EEGデータセット | Mendeley Data | 外部検証データセット | |
| MNE-Python | https://mne.tools | v1.x | EEGの前処理/分析 |
| NumPy | NumPy開発者 | 最新 | 配列計算 |
| OpenNeuro EEGデータセット | OpenNeuro | ds004504(v1.0.8) | AD/FTD/HC EEGの主要データセット |
| Python | Python Foundation | v3.10+ | プログラミング環境 |
| scikit-learn | sklearn開発者 | v1.x | 機械学習モデル |
| SciPy | SciPy開発者 | 最新 | 信号処理 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエストThis corrects the article 10.3791/69762