本研究のモデルは、複数のデータベースからの心電図(ECG)データセットにおける初期不整脈を5つの主要な心拍タイプに分類するために構築されています。他のモデルと比べて、このモデルは精度、感度、精度、呼び戻しの面で優れています。
研究記事
本研究のモデルは、複数のデータベースからの心電図(ECG)データセットにおける初期不整脈を5つの主要な心拍タイプに分類するために構築されています。他のモデルと比べて、このモデルは精度、感度、精度、呼び戻しの面で優れています。
心血管疾患、特に不整脈は世界的に主要な死因の一つです。これは、これらの状態を早期に検出・診断できる自動化システムの必要性を浮き彫りにしています。本研究では、心電図(ECG)信号を用いて不整脈を特定する深層学習モデルを導入します。このモデルは主に5つの心拍タイプに焦点を当てています:正常(N)、左束枝ブロック(L)、右束枝ブロック(R)、心房早発心拍(A)、および早期心室収縮(V)。このシステムは、MIT-BIH不整脈、心室上、INCART 12リード、突然性心死ホルターなど複数のデータベースからのリードI信号を使用しています。これにより、390万以上のトレーニングセグメントと112,575のテストセグメントが提供されています。
データは180サンプルの固定ウィンドウに分割され、最小最大正規化でスケーリングされ、合成少数派オーバーサンプリング技術でクラスをバランス調整することで前処理されます。このモデルは空間特徴を抽出するための1次元畳み込みニューラルネットワークと、時間ベースのパターンを捉えるトランス層を組み合わせています。Adamオプティマイザーを使用し、ドロップアウトやバッチ正規化を含んでパフォーマンスを向上させます。このシステムは全クラスで99.99%の精度、精度、F1スコアを達成しており、これはTN4モデルや他のトップ性能モデルよりも優れています。畳み込みニューラルネットワークやディープハイブリッドアーキテクチャの利用により、特徴の堅牢性が向上します。このモデルは、スケーラブルでリアルタイムの不整脈検出に大きな可能性を示し、AI駆動のパーソナライズされたデジタルヘルスケアの発展に貢献します。
心血管疾患は人間の健康問題の最も重要な原因であり、毎年1700万人以上が亡くなっています。世界心臓連盟によると、心血管疾患(CVD)症例のほぼ4分の3が世界の低所得国に住んでいます。心電図(ECG)は、心臓の脱分極によって生じる電気活動を捉えます。電気信号は皮膚に伝わります。心電図信号は少なくとも2つの重要な情報を伝えます。一つは健康関連の生物医学です。もう一つは、個人関連の資格情報や生体認証です。その簡潔さゆえに、ECG信号の分類には自作手法や機械学習手法など様々な方法が検討されています。手動の方法は時間がかかり非効率的です。心電図のようなリアルタイム信号や大規模なコンピュータインフラが必要です。機械学習のアプローチは手動方法よりもブラケット精度が低い可能性が高いですが、未検出の不整脈リスクを減らすために適切なアルゴリズムが必要です。
最も一般的な心血管疾患は不整脈で、心拍パターンが異常である状態です。これらの異常なパターンは、治療に影響を与える可能性があるため、カテゴリーごとに分類する必要があります。心電図は異常な心拍パターンの検出や心臓病の予測に広く用いられており、早期発見を可能にします。不整脈の診断は主に心電図に依存しており、心電図は心臓の興奮性を記録し、信号を送信し、回復の監視を行う重要な医療機器です。現代医学では心電図が必要で信頼できるものです。心電図信号解釈の自動化は臨床実践を大幅に向上させ、患者の安全性を向上させます。不整脈は異常な心拍リズムやパターンのことです。人工知能、特に機械学習は、心血管疾患の疾患予測や意見分析に優れたツールです。
患者記録などの異なる医療データは、一般的に病院で臨床目的で使用されています。また、機械学習アルゴリズムの最適化を支援するために、医療データもタイムリーに生成できます。マシンは最終的に学習するデータセット上で訓練されます。訓練が完了すれば、症例が健康かどうか、または記録の異なる属性に基づいて識別・分類できます3,4。機械は与えられたデータの中のパターンを検出することもでき、時間や資源の制限により人間には容易に認識されないことがあります。心電図信号の分類には、K近傍解析(KNN)、サポートベクターマシン(SVM)、ニューラルネットワーク(NN)、意思決定木、線形判別解析(LDA)、ベイズ分類器など、いくつかの手法が用いられています。SVMは、心電図信号を分類して不整脈を検出するための最も効果的な教師あり学習アルゴリズムの一つと考えられています5,6。
NNと多層パーセプトロン(MLP)を用いた優れたブラケットモデルは、他の従来手法よりも優れています。人工ニューラルネットワーク(ANN)などの深層学習アルゴリズムは、情報検索、画像認識、物体検出、言語処理などのタスクで成功裏に活用されています。CNNは、心電図波形からスタイリスティックな特徴を抽出し、QRS複合体やSTセグメント、P波7,8の発見など様々な目的でこれらの特徴を解剖するために広く研究に用いられています。1D CNNは心電図信号の最も関連する特徴を検出し、それらを5つの不整脈タイプに分類します。信号品質を向上させるためにベースラインワンダリングおよび高周波ノイズ除去フィルターが適用されました。これにより不整脈は5つのカテゴリーに分類されました。
図1に示すように、P波、QRS複合体、T波は心電図の重要な部分です。P波は心房の脱分極、すなわち心房収縮を引き起こす電気活動を表します。QRS複合体は心室の脱分極を反映しています。心室収縮を引き起こすのは電気信号です。T波は心室の再分極、すなわち収縮後の心室回復期を示します。これらの波は一つの完全な心周期を表します。心臓の仕組みを理解し、心臓の問題を診断するために不可欠です。
これらすべての波は一つの心拍サイクルを表しています。心臓の仕組みを理解し、心臓疾患の診断に非常に重要です。ディープラーニングモデルは最近、ECG信号を含むコンピュータ支援医療信号解釈において大きな進展を遂げています。従来の手作業で作られた特徴ベースの機械学習モデルは、異なる患者集団間でのスケーラビリティや適応性の問題を抱えています。これらの課題に対処するために、CNNやLSTMのような再帰モデルを組み合わせたハイブリッドモデルなどの深層モデルが登場し、生のECG信号から関連特徴を自動的に学習しています。これにより分類精度は大幅に向上しました。
本研究は、心電図信号を正常(N)、左脚枝ブロック(L)、右脚枝ブロック(R)、心房早発拍動(A)、早発心室収縮(V)の5つの心拍カテゴリーに分類するためのディープラーニングフレームワークを提案します。モデルの訓練には、MIT-BIH不整脈データベースや上室データベースなどの公開されている心電図データセットを利用しています。これらのデータセットは前処理され、固定長のセグメントに分割されて分析されます。クラスの不均衡は不整脈データでよく見られる問題であるため、合成少数派オーバーサンプリング技術(SMOTE)を用いてトレーニングデータのバランスを取っています。これにより、モデルはすべてのクラスから効果的に学習でき、異なる心拍の分類精度が向上します。
連続ウェーブレット変換(CWT)やCNNアーキテクチャを用いたモデルを含む最近のECG分類の進展に着想を得て、標準CNNとトランス層を取り入れたハイブリッドモデルの両方を用いるアプローチを提案しています。空間的特徴抽出のためのCNNと時間的依存性の捕捉用トランスを組み合わせることで、このシステムはF1とすべてのクラスでほぼ100%に近い高精度を達成しています。
「空間的特徴」とは、距離、方向、形状など、何かの位置や位置に関連する特性を指します。一方、「時間的特徴」は、出来事がいつ起こったか、その持続時間、出来事の順序など、時間に関連する要素を表します。本質的に、「空間的」は「空間」を意味し、「時間的」は「時間」を意味します。
この研究の主な目的は、リアルタイムの不整脈検出のための正確でスケーラブルなモデルを開発し、医療分野でAI駆動の診断分野の拡大を支援することでした。このシステムはリアルタイムモニタリングに有望であり、心臓イベントのリスクのある患者の早期発見と介入を可能にします。
この研究活動の目的は多面的です。まず、この提案された手法は不整脈を正常(N)、左脚支ブロック(L)、右脚ブロック(R)、心房早拍(A)、早発心室収縮(V)の5つのカテゴリーに分類することを目的としています。第二に、本研究は前処理なしにECG信号から形態的および時間的情報を学習できるハイブリッドCNNとトランスモデルを構築することを目指しています。第三に、この提案された手法は、リアルタイムで実装可能なパフォーマンス志向のソリューションを提供することを目指しています。第四に、本研究は提案モデルの精度および感度の向上を最先端モデルと比較して示すことを目指します。
さらに、構造化されたグラフ内の生理的要因間の相互作用をモデル化するグラフ畳み込みネットワーク(GCN)が生物医学的予測課題に導入されており、リード間依存性を考慮する将来の不整脈分類モデルにも役割を果たす可能性があります。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
倫理的声明
この研究は、PhysioNetからダウンロードした公開された匿名化された心電図データに完全に依存していました。本研究で使用されたすべてのデータセットは、被験者の同意と各データ所有者の倫理承認を得て収集されました。この研究は、データ収集やヒトまたは動物の被験者を用いた実験作業、患者の個人情報情報を必要としませんでした。したがって、追加の倫理審査は求められませんでした。
方法論
図2 は提案されたアーキテクチャのワークフローを示しています。
データ収集
心電図データは生理学的信号の人気リポジトリであるPhysioNetデータベースから収集されます。複数のデータセットがデータベースから取得されます。これらのデータセットは統合され、さまざまな心電図信号クラスを含む単一のメインデータセットにまとめられます。
使用データセット
本研究では、公開されている複数のECGデータセットを用いて、不整脈分類のための深層学習モデルの開発と評価を行いました。これらのデータセットの選択は、患者人口統計や不整脈タイプの多様性を考慮し、提案モデルが異なるシナリオで良好に機能することを確実にするために慎重に選定されました。本研究では、MIT-BIH不整脈データベース、MIT-BIH上室性不整脈データベース、サンクトペテルブルクINCART 12誘導不整脈データベース、および突然死ホルターデータベースのLead-Iデータのみを統合しました。これらのデータセットは、幅広い不整脈クラスを含む高品質で注釈付き心電図記録で知られています。
上記の統合データセットには、患者の人口統計、記録機器、サンプリング頻度、環境が含まれます。上記のモデルの変動性は、幅広い心電図の形態、ノイズ、リズムにさらすことでその一般化を向上させています。
データセットの説明
MIT-BIH不整脈データベース
MIT-BIH不整脈データセットには、100-234番の30分の心電図記録が48件含まれています。各レコードには、360サンプル/秒でデジタル化された2チャンネルの心電図信号が含まれています。データは.dat、.hea、.atrの形式で保存されます。
MIT-BIH上室性不整脈データベース
これはMIT-BIHデータベースの特定のサブセットです。MIT-BIH上室不整脈データベースには、30分から数時間までの78件の全長心電図記録が801から811まで番号付けられています。各レコードには2チャンネルの心電図信号が含まれており、128サンプル毎秒のデジタル変換が行われます。
サンクトペテルブルクINCART12誘導不整脈データベース
このデータベースには、32台のホルターモニターから取得された75件の注釈付き録音が含まれています。各録音は30分で、12本の標準リードが257Hzでサンプリングされています。信号強度は1ミリボルトあたり250から1100アナログ-デジタル変換ユニットの間で変動します。
予期せぬ心死 ホルターデータベース
このデータセットは、心室頻拍(VT)および心室細動(VF)の事実発生を捉えた多くのオープンアクセスホルター記録の一つです。どちらも予期せぬ心死を引き起こす可能性があります。各レコードは24時間の長さで、250Hzでサンプリングされています。
データ前処理
本研究では、異なるサンプリングレートを持つ4つの公開心電図データベースが使用されました:MIT-BIH不整脈(360Hz)、MIT-BIH上室性不整脈(128Hz)、サンクトペテルブルクINCART12リード(257Hz)、および突然死ホルター(250Hz)。すべてのデータを一貫性を持ち、モデルトレーニング中に組み合わせられるようにするため、すべての心電図信号はMIT-BIHの不整脈データベースと一致し、心電図研究の標準として一般的に用いられる360 Hzの共通レートに再サンプリングされました。リサンプリングはバンド制限補間によって行われました。当初、心電図信号はエイリアス防止のためにローパスフィルタリングされ、その後補間にはシンクベースの再構成カーネルが用いられ、最終的に360 Hzで再サンプリングが行われました。リサンプリング後、各信号は180サンプルのウィンドウに分割され、約0.5秒分のデータに相当し、すべてのデータセットが同じ時間分解能を持つようにしました。この標準化により、異なるデータベースからの信号を組み合わせて訓練やテストを行うことができ、モデルが時間をかけて一貫したパターンを学習できるようになりました。
前処理には入力データの品質を確保するためのいくつかの重要なステップが含まれていました:
データセグメンテーション:
リサンプリング後、各心電図信号は180サンプルの固定長ウィンドウに分割されました。これはサンプリングレート360Hzで約0.5秒の信号持続時間に相当します。この研究では、固定された重なりのないスライドウィンドウを区切るために用いられました。各ウィンドウは連続した心電図サンプルのシーケンスを収集しました。研究が180サンプルのウィンドウを選んだのは、0.5秒の間隔で心臓サイクル全体、すなわち典型的な成人心拍数のP波、QRS複合体、T波を捉えられるためです。各セグメントには、中央の注釈に基づいてクラスラベルが割り当てられました。こうすることで、セグメントラベルはそのウィンドウ内の主要な心拍形状と一致します。スライディングウィンドウ法を用いて、この分割関数を適用しました。

ここでsi は時刻iの心電図サンプル です。
正規化:
セグメント化された心電図データをMin-Maxスケーリングで正規化し、すべての特徴が0から110の範囲であることを確認しました。

このステップはトレーニング中のモデルの収束を加速させるのに役立ちます。
SMOTEによるクラスバランス
心電図データセットでは正常(N)拍動が異常心拍クラスを大きく上回り、顕著なクラス不均衡が示されました。分割、正規化、トレインテスト分割を経て、この問題に対処するために合成少数派オーバーサンプリング技術(SMOTE)を用いました。
各ECGセグメントを表すには180次元の特徴空間が用いられ、180の正規化されたサンプルで構成されていました。SMOTEはユークリッド距離を用いて、各少数派クラスのサンプルのk個の最近傍(k=5)をそのクラス内で決定しました。SMOTEは訓練データにのみ適用され、70%が訓練、30%が検査セットに分割され、層別抽出が行われました。これにより、人工サンプルが試験セットに追加されず、過剰抽出プロセスの影響を受けないようにしました。テストデータは変更されず、元のクラス分布を維持し、モデルの公正な評価にのみ使用されました。その結果、この研究の高いパフォーマンス結果は、過剰学習や追加サンプルによるスコアの過大化によるものではなく、モデルの真の一般化能力を示しています。
列車試験の分割:
前処理とクラスフィルタリングを経て、層別ランダムサンプリングを用いて70%から30%の分割でトレーニングサブセットとテストサブセットに分割されました。この階層化はクラスラベルに基づいており、訓練セットおよびテストセットで各心拍クラスの相対的な割合が維持されるようにしています。
この分割は再現性のためにランダムシードを用いて行われました。すべての心電図セグメントはトレーニングセットかテストセットのいずれかに限定されていました。バイアスやデータ偏差を避けるため、データ分布に影響を与える可能性のある前処理ステップ(すなわちSMOTEによるクラスバランシング)はすべて、分割後のみ、しかも訓練データのみに対して実施されました。
この点で、クラス比率を維持し、ランダム層化を用い、サンプルを訓練セットとテストセットに厳密に分けることで、分割プロセスはサンプルのバイアスの可能性を低減し、パフォーマンス指標がデータ固有の残差ではなくモデルの一般化を反映できるようにします。
データセット分割とクラス分布
最終データセットはトレーニングセットとテストセットに分けられ、70%がトレーニング、30%がテストに割り当てられました。SMOTEを適用した後、クラスの不均衡は減少し、各不整脈タイプがトレーニングセットとテストセットの両方で適切に表現されることが保証されました。合計3,966,620のECGセグメントがトレーニングに使用され、112,575のECGセグメントが検査に使用されました。膨大なデータ量と多様な不整脈タイプが組み合わさることで、実際の心電図信号における異なる不整脈タイプを効果的に識別するモデルが作成されました。本研究はディープラーニングモデルを用いて心電図の不整脈を分類します。5つの心拍タイプ、すなわち正常(N)、左束枝ブロック(L)、右束枝ブロック(R)、心房早発拍動(A)、早発心室収縮(V)は、MIT-BIH不整脈データベースに標準化された拍準注釈および心電図拍拍注釈に関するAAMIガイドラインに従って選ばれました。ここで述べた5つの拍動注釈はすべて、不整脈の広範カテゴリーに属する重大な心臓疾患を含み、P波、QRS、T波周辺の心電図信号で独特の波形特徴を示します。
さらに、これらのクラスは公的な心電図データベースで最も頻繁にラベル付けされているため、他の心電図ベースの心拍リズム分類法と比べてその効果を検証しやすくなっています。データセットは患者間分割法で分割されました。この仕組みにより、単一の患者の心電図セグメントがトレーニングセットとテストセットの両方に同時に現れることがないようにしました。その分裂が起きると、SMOTEはトレーニングセットにのみ適用されました。試験セットは合成サンプルや繰り返しの時間的ウィンドウを含まなかった。これらすべてがセグメント間の重複を避け、これまで診察されたことのない患者への真の一般化を支援します。
SMOTE前後のクラス分布:
元のデータセットではクラス間で著しい不均衡があり、正常(N)ビートが多く、異常なクラスのサンプル数は少なかった。SMOTEを使用する前の訓練データは、約133,320の正常(N)、8,075の左束枝ブロック(L)、10,431の右束の枝ブロック(R)、4,489の心房早発拍動(A)、60,682の早期心室収縮(V)セグメントが含まれていました。この不均衡に対処するため、SMOTEは訓練セットにのみ適用され、少数クラスのサンプル数を多数クラスに合わせるように増やしました。増強後、各クラスは793,324セグメントを持ち、訓練用の心電図セグメントは合計3,966,620となりました。112,575セグメントからなるテストセットは元のクラス分布を維持し、過剰サンプリングされませんでした。このアプローチにより、モデルのパフォーマンスの公正かつ偏りのない評価が保証されました。
訓練と推論
6GBメモリを搭載したNVIDIA RTX 3050 GPUのトレーニングと推論性能を検証することで計算効率を検証しました。訓練過程は60エポックで約3.2時間かかりました。推論遅延は180サンプル1セグメントあたり平均0.45msで、リアルタイム利用が可能となりました。GPUのメモリ使用量は最大4.2GBに達し、モデルはパラメータ数が180万個にとどまるため、ほとんどのトランス系心電図と比べると軽量に感じられます。
トレーニングと推論のプロセスには以下のステップがあります。
トレーニングセットアップ:学習率、バッチサイズ、エポックなどのトレーニングパラメータが定義されます。
モデルトレーニング:CNN-トランスフォーマーモデルはトレーニングデータをもとに訓練されます。
検証:トレーニング後、モデルの検証精度と損失がチェックされます。パフォーマンスが良ければモデルは保存されます。パフォーマンスが低い場合は、パイプラインは異なる訓練パラメータで繰り返し、パラメータ設定ステップに戻ります。
モデルアーキテクチャ
CNN-トランスフォーマー全体の構成は、畳み込み特徴抽出、射影層、トランスコーダー、そして最後に分類ヘッドの4つの主要な部分で構成されています。畳み込みブロックは、32個のフィルターを持つ一次元畳み込み層、核サイズ3、ストライド1、パディング1から始まり、その後にReLUが続きます。最大プーリング(カーネルサイズ2)で信号の時間分解能を削減します。最初の畳み込み層の後には、64フィルターを持つ別の畳み込み層があり、同じカーネルサイズ3、ストライド1、パディング1、再びReLU、そしてサイズ2のマックスプーリングが続きます。これらすべての出力は平坦化され、線形射影層を通って特徴を128次元埋め込み空間にマッピングし、そこからトランスフォーマー18,19に送られます。
トランスブロックは2つのエンコーダ層を持ち、それぞれに4つのヘッドを使ってECG信号の長距離依存関係を捉えるマルチヘッドセルフアテンションを備えています。各層には、過学習を助けるために隠れたサイズが256、ドロップアウトが0.5の位置別フィードフォワードネットワークがあります。各サブレイヤーの後にレイヤー正規化が行われ、トレーニングが安定化します。
分類ヘッドは完全連結層で、128から64に下がり、その後ReLUと再び0.5のドロップアウトが続きます。出力層には不整脈クラス用の5つのニューロンがあり、確率を得るためにSoftmaxが使われます。
1次元畳み込みニューラルネットワーク(CNN)ブロック:
CNNブロックは2つの1次元畳み込み層で構成されており、それぞれにReLU活性化層とmaxプーリング層が続きます。これらの層は入力された心電図信号内の空間的関係を特定するのに役立ちます。特徴抽出を強化するために、CNN層の各変換ステップの後に追加のReLU活性化関数が適用されます。
第一畳み込み層:この層は入力信号に対して32個のフィルター(それぞれサイズ3)を使用します。この過程は次のように表せます:

ここでyi は出力、wj はフィルターの重み、xi+j は入力セグメント、bはバイアス項、σは活性化関数(ReLU)を表します。その結果得られる特徴マップは、非線形性を加えるためにReLUアクティベーションレイヤーを通過します。

プーリング層:各畳み込み操作の後に最大プーリングステップを適用し、空間次元を半分に減らします。このプロセスは次のように定義されます:

これにより、最も重要な特徴を保持しつつ、計算負荷を軽減します。
第2畳み込み層:この層は3×3サイズの64個のフィルターを用いて前の層の特徴マップを処理し、より複雑なパターンを検出できるようにします。畳み込みの後、モデルに非線形性を導入するためにReLU活性化関数が適用されます。

このステップにより、モデルは心電図信号から詳細なパターンを捉えることができます。
追加の活性化層:ReLU活性化は、複雑なパターンをより正確に捉え、モデルがポジティブな活性化に焦点を当てるようにするため、各ステップの後に適用されます。
フラッティングプロセス:2回目の最大プーリング操作の後、特徴マップはトランスブロックへの入力用に単一のベクトルにフラット化されます。
トランスブロック:
トランスブロックは2層のマルチヘッドセルフアタッションで構成されており、これによりモデルがECG信号の異なる部分間の関係を時間経過で理解するのに役立ちます。マルチヘッドセルフアテンションは、シーケンス内のすべての要素ペアを見ることで機能します。クエリQ、鍵K、値Vを持つ列の場合、注意は次のように計算されます。

ここでdkは鍵ベクトルの次元であり、スケール不変性を保証します。
フィードフォワード層:各自己注意出力は、ReLUが活性化され、その後レイヤー正規化が行われる完全接続されたフィードフォワードネットワークを通過します。このステップでは抽出された時間的特徴を洗練します:

ここでW1とb1はフィードフォワード層の重みとバイアスです。
バッチ優先表現:トランスフォーマーはバッチ優先の配列で動作し、CNNブロックの入力形式との互換性を確保します。
完全連結(濃い)層:
トランスブロックを通過した後、出力シーケンスは平坦化され、2つの完全接続層を通過して分類が行われます。最初の完全連結層は入力ベクトルを128次元の特徴空間に変換し、その過程で再形成します。

ここでWは重み行列、xは入力ベクトル、bはバイアスベクトルです。ReLUアクティベーションレイヤーが適用されます:

過学習を防ぐために、速度0.5のドロップアウト層が続きます。
第2の完全連結層:最後の層は128次元の特徴を心拍クラスの数(例:不整脈検出の5クラス)にマッピングします。出力はlog-SoftMax関数を経て対数確率を計算します:exp(xi)
ハイブリッドCNN-トランスモデル
提示されたモデルは、CNNとトランスフォーマーの強みを組み合わせ、空間的および時間的表現の両方を用いるハイブリッド深層学習モデルです。このようなアーキテクチャは、生理信号のような複雑で長い配列データの処理に特に適しています。

この式は入力表現を表しており、N = サンプル数、T = 時間ステップ数、d = 時間ステップごとの特徴次元を表します。

この式は位置埋め込みを表し、ここで pos = 順位;i = 埋め込み次元指数。
CNNモジュール – 局所特徴抽出
CNNは、連続データのピーク、傾き、スパイクなどの局所的な依存関係や形態パターンを効率的に学習します。畳み込み層は入力テンソル
上で空間範囲
の
核を使用します。各出力チャネルmは以下の方法で決まります:

= 入力チャネル数;K = 核のサイズ;W = フィルターの重み;b = バイアス
ReLU関数
この場合、
は学習可能な重みを表し、
はチャネル mA のバイアスであり、整流線形単位(ReLU)のような非線形活性化が適用されます。

プーリングと特徴圧縮
プーリング層は特徴マップの空間的または時間的次元を低減し、重要な特徴を保持し計算を削減します。ウィンドウサイズ
とストライドsを用いる最大プーリングでは、
位置でのプール特徴は次のようになります。

プーリング後の出力長

ここで
は入力長、ストライドはプーリングウィンドウをスライドさせるためのステップサイズを定義します。この式は、プーリング操作(例:最大プーリング)後の特徴マップの出力長さを計算します。入力長、プールサイズ、ストライドに基づいてフィーチャーマップの縮小量を計算します。多次元特徴写像を完全連結層のベクトルに変換します。
トランスエンコーダ – 長距離依存関係のキャプチャ
トランスフォーマーは自己注意を用いて、列の長距離時間依存性を学習します。
スケールドット積注意

Q、K、Vは学習された射影によって計算されるクエリ、キー、値の行列です。
は内積をスケールさせるための主要な次元です。
マルチヘッドアテンション

各ヘッドは独立して注意を計算します。出力は連結され、線形変換されます。
各ヘッドに対する学習型射影行列です。
は連結後の最終射影重み18,19です。
最終予測と喪失
完全連結層は特徴をロジットにマッピングし、それを活性化関数を用いて予測に変換します。畳み込み層やプーリング層を経て、
はベクトルに平坦化されます
完全連結層はロジットを計算します。完全連結層は次にクラスロジットを計算します。

シグモイド/ソフトマックスの有効化:

活性化関数はモデルの生出力「z」を確率にマッピングします。Sigmoidは二値分類に適用され、Softmaxはクラス間の確率分布に関する多クラス問題に適用されます。z は線形出力(例:最後の層:z = Wx + b)。出力 ŷ は (0, 1) の間であり、これは確率20 を示します。
トレーニングプロセス
訓練は以下のハードウェア仕様のシステム上で実施されました:
プロセッサー:AMD Ryzen 7 7840HS
CPUメモリ:16GB
GPU RAM:6GB NVIDIA GeForce RTX 3050
モデルはAdam optimizerで訓練され、勾配の第1モーメントと第2モーメントに基づいて学習率を調整します。アダムの更新ルールは次のように与えられます:

この構成では、mt とvt が第一モーメントと第二モーメントの推定値を表し、αは学習率、εはゼロでの割り除きを防ぐための小さな定数です。モデルは60エポック向けに訓練され、過学習を防ぐために早期停止が行われました。バッチサイズは1024で、トレーニングデータはPyTorchのDataLoaderを使ってモデルに読み込みました。モデルの正則化と収束の加速のためにドロップアウトとバッチ正規化が組み込まれました。ドロップアウトは、トレーニング中にニューロンの一部をランダムにオフにする正規化法で、過学習を減らすのに役立ちます。数学的には、i番目の ニューロンの活性化をziとします。トレーニングフェーズ中、修正起動z'は次のように計算されます:

ここでpはドロップアウト率(例:50%ドロップアウトの場合p = 0.5)。推論中はドロップアウトは適用されず、ネットワーク全体が使用されます。
ニューラルネットワークにおける収束は、医療分野の既存の分類システムに大きな影響を与える問題であり、特に収束が不十分なために診断が一貫性がない場合に顕著です。事前定義時間最適化手法と固定時刻での収束に関する最近の研究では、すべての初期状態に対して固定された反復数以内に収束するモデルを訓練することが依然として可能であることが示されています。このモデルに基づく将来のモデルには、事前定定時間最適化を含めることができます。
バッチ正規化:
バッチ正規化は各層の入力を正規化することで訓練を安定化・加速します。起動のミニバッチ x = {x1,x 2, . . ., xN} が与えられると、バッチ正規化出力 xi .は次のように計算されます:


ここでμBとσB2はバッチの平均と分散、εは数値的安定性のための小さな定数、γとβは正規化値をスケール・シフトする学習可能なパラメータです。バッチ正規化は内部共変量シフトを低減し、より高い学習率の利用を可能にします。これらの手法とアダム最適化器の組み合わせにより、過学習の緩和と収束速度の向上により堅牢な訓練が保証されます。
図3は、機械学習モデルのトレーニング中のエポックにおける検証損失と検証精度を示しています。検証精度(青線、右Y軸)は比較的低く(約97.5%)始まり、最初の10エポック以内に急速に増加します。その後も改善し、約20時代を経て約99.7%から99.8%のレベルに達します。これはモデルが検証セット上で知識をうまく学習し適用していることを示しています。検証損失(赤線、左Y軸)は最初は高く、最初の数エポック(約2〜3エポック)で急激にほぼゼロに落ちます。その後はトレーニングの残りの間、ほぼゼロのままです。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このセクションでは、心電図データから不整脈を分類するためのハイブリッドディープラーニングモデルを紹介します。このモデルは、臨床的に重要な5つの心拍分類、すなわち心房早期収縮、正常、左脚束枝ブロック、右脚束枝ブロック、早期心室収縮を認識する能力で評価されています。これらの不整脈クラスの臨床的関連性や、不均衡なデータセットや信号の変動性による課題を考えると、包括的な評価が不可欠です。
データ収集フェーズの最初の前処理段階では、MIT-BIH不整脈データベース、MIT-BIH上室性不整脈データベース、サンクトペテルブルクINCART12誘導不整脈データベース、および突然死ホルターデータベースのLead Iデータセットがすべて収集されました(図4参照)。これらのデータセットには、幅広い不整脈タイプにわたる高品質で注釈付きの心電図記録が含まれています。各患者のフル信号は連続した180msのセグメントに分割され、それぞれのセグメントに...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
ECGバイオ信号から不整脈を認識・分類する際、提案されたディープラーニングハイブリッドモデルはトランス構造と1次元畳み込みニューラルネットワーク(CNN)を組み合わせ、優れた性能を示しています。この組み合わせは、トランスが自己注意機構を通じてグローバルな時間依存性を学習する能力と、生の心電図波形から局所的な空間特徴を特定するCNNの能力を活用しています。このモデルは、正常心拍、左束枝ブロック、右脚束支ブロック、心房早縮、早発心室収縮の5つの重要な心拍クラスを用いて検証されました。
CNN-トランスフォーマーモデルは、孤立したCNN、CNN-VAE(変分オートエンコーダ)、TN4アーキテクチャを含むベースラインモデルを一貫して上回る性能を示しました。これはF1スコア、リコール率、正確さ、精度、感度、特異度などの性能指標を用いた徹底的な分析に基づいています。混同行列は、モデルがL、R、Vクラスで優れた成績を収め、誤分類が最小限で、5つのクラスすべてで非常に高い精度を示していることを示しました。ノーマルクラスの21,79...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者には利益相反を主張するものはありません。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| アダム・オプティマイザー | オープンソース(PyTorch) | https://pytorch.org/docs/stable/optim.html | バック伝播中の学習率を適応させることで、ディープラーニングモデルを訓練するための最適化アルゴリズム。 |
| ハードウェア(計算システム) | AMD;NVIDIA | https://www.amd.com/en/products/processors/laptop/ryzen/7000-series/amd-ryzen-7-7840hs;https://www.nvidia.com | プロセッサー:AMD Ryzen 7 7840HS;CPUメモリ:16GB;GPU:NVIDIA GeForce RTX 3050(6GB VRAM)。モデルトレーニングおよび評価に使用されます。 |
| 不均衡学習 | 不均衡学習 | https://imbalanced-learn.org | 合成少数派オーバーサンプリング技術(SMOTE)を用いたクラスバランスに使われるPythonライブラリ。 |
| Matplotlib | Matplotlib | https://matplotlib.org | 心電図信号、混乱行列、パフォーマンスグラフのプロットに使用されるPythonライブラリ。 |
| PhysioNet 心電図データベース | フィジオネット | https://physionet.org | 研究で使用された公開心電図データセットには、MIT-BIH不整脈、MIT-BIH上室性不整脈、INCART12リード、および突然性心死ホルターデータベースが含まれます。 |
| パイトーチ | パイトーチ | https://pytorch.org | CNNやトランスフォーマーモデル、トレーニングパイプライン、推論の実装に使われるPythonのディープラーニングフレームワーク。 |
| パイソン | Pythonソフトウェア財団 | https://www.python.org | データ前処理、モデル開発、トレーニング、評価に使用されるプログラミング言語。 |
| シーボーン | シーボーン | https://seaborn.pydata.org | 統計プロットや結果の可視化に使用されるPythonデータ可視化ライブラリ。 |
| WFDBは | WFDBは | https://wfdb.readthedocs.io | PhysioNetデータベースから生理学的信号や注釈を読み書き、処理し、プロットするために使われるPythonパッケージです。 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト