本研究は、多機関電子カルテを用いた死亡リスク予測のための敵対的・ロバスト連邦学習(AR-FL)モデルを提案します。このモデルは、最小最大対抗訓練、ドメイン認識型注意、プライバシー保護型集約を統合し、堅牢性、適応性、データの機密性を高め、異種医療環境に適した安全で信頼性が高く一般化可能な臨床意思決定支援システムを実現します。
研究記事
本研究は、多機関電子カルテを用いた死亡リスク予測のための敵対的・ロバスト連邦学習(AR-FL)モデルを提案します。このモデルは、最小最大対抗訓練、ドメイン認識型注意、プライバシー保護型集約を統合し、堅牢性、適応性、データの機密性を高め、異種医療環境に適した安全で信頼性が高く一般化可能な臨床意思決定支援システムを実現します。
電子カルテ(EHR)は、データ駆動型の臨床意思決定を可能にする主要なデータ源です。しかし、EHRの繊細な性質と医療分野の厳しいプライバシーポリシーにより、中央集権的なモデルトレーニングは困難または不可能となっています。敵対的に堅牢な連邦学習(AR-FL)モデルを提案し、元のEHRデータを共有せずに異なる機関間で患者死亡率リスクを予測します。本研究の主な目的は、プライバシーを守り、敵対的に強靭な予測モデルを多様な臨床環境で訓練するための、安全で再現性があり、スケーラブルな手順を導入することです。本研究では、各機関で最悪の摂動に対する堅牢性を高めるために、最小-最大対抗的トレーニングアプローチを用いています。ドメイン認識型注意メカニズムも用いられ、機関内の臨床特徴分布の違いに動的に適応します。機密性のため、モデルの更新はプライバシー保護の手法で統合され、連邦通信中に機密患者データの露出を阻止します。本研究は、データ前処理や敵対的例生成からローカルトレーニング、安全な集約、グローバルモデル評価に至るまでの全プロセスを明示し、さまざまな医療環境での一貫した実装を可能にします。実験的検証により、AR-FLモデルは優れた予測性能、敵対的堅牢性、そして機関横断的な一般化を実現していることが示されています。標準化された研修および評価パイプラインを確立することで、本研究は信頼性が高く倫理的に準拠した臨床意思決定支援システムの開発を支援します。
Federated Learning(FL)は、生の患者情報を共有することなく分散型電子カルテ(EHR)データ上で協調モデルトレーニングを可能にすることで、プライバシー保護の医療分析における変革的なパラダイムとして登場しました。このアプローチはデータのサイロ化や規制の制約を緩和しつつ、死亡率予測などの予測性能を向上させます。しかし、これらの利点にもかかわらず、FLシステムは敵対的攻撃や毒攻撃に対して脆弱なままです。 図1 は、分散した臨床機関間でのフェデレーテッドラーニングの協働的なアーキテクチャとワークフローを示しています。

図1:汎用連邦学習アーキテクチャおよび医療画像アプリケーション。 この図は標準的なフェデレーテッド学習ワークフローを示しており、分散型データストレージ、ローカルモデルトレーニング、安全なサーバーサイド集約、そしてその医療画像解析への応用を示しています。 この図の拡大版はこちらをクリックしてご覧ください。
近年の医療分析の進展は、大規模なEHRデータの処理におけるディープラーニングモデルの有効性を強調しています。先行研究1 では、深層学習が生の臨床データを用いて正確かつ拡張可能な予測を実現できることが示されました。さらに、Miottoらは医療システムにおけるディープラーニングの展開に伴う広範な機会と課題をレビューしています。 さらに、ClinicalBERT3 のようなドメイン特有の革新により、臨床テキストの理解と予測能力が向上し、MIMIC-III4、MIMIC-IV5 、eICU6 などのベンチマークデータセットは、集中治療研究における再現性かつ大規模な評価を可能にしました。
フェデレーテッドラーニングは、データプライバシーを損なうことなく協働的な医療分析を可能にするソリューションとして大きな注目を集めています。既存の研究7,8件は、デジタルヘルス開発におけるその役割、関連する課題や未解決の研究課題について論じています。さらに、連邦学習は、多機関協働やCOVID-19患者の臨床アウトカム予測など、実際の医療シナリオにおいて実用的な適用性を示しています。しかし、データの異質性といった課題は依然として重大です。これに対処するために、異種環境11の最適化戦略や局所バッチ正規化を利用するFedBN12のような手法が提案されており、モデルの収束性と一般化の改善を目指しています。
連合学習におけるセキュリティと堅牢性は、敵対的脅威への曝露が増加する中で重要な懸念となっています。対抗例の概念13は、小さな摂動がディープラーニングモデルを高い信頼度で誤導できることを示しました。連邦環境では、バックドア攻撃やモデルポイゾンなどの脅威によってこれらの脆弱性が悪化します。これらのリスクに対処するために、敵対者耐性のあるクラスター連邦学習アプローチや敵対的訓練に基づく堅牢な最適化手法が提案されています15,16。さらに、グラデーションブースティングとLSTMモデル17を統合した安全な通信フレームワークも開発され、中間者攻撃を軽減しています。同時に、DBAFL18,19のような高度なアーキテクチャは、分散環境におけるポイゾン攻撃からの防御を目指しています。
プライバシーの保護は、連邦医療システムにおいて依然として基本的な要件です。協働学習されたモデルはGANベースの攻撃を通じて機密情報を漏らすことがあり、その本質的なプライバシーリスクが浮き彫りになります。こうした問題を軽減するために、分散学習における機密性を確保するために、セキュアアグリゲーションプロトコル21と差別プライバシー技術22が導入されました。さらに、安全なEHR管理とデータ共有のためにブロックチェーンベースのソリューション23,24が提案されており、さらに25、26、27、28の研究がこれらのアプローチを拡張し、医療システムにおける相互運用性、セキュリティ、効率性の向上を目指しています。
医療における人工知能の急速な進歩は、予測性能や意思決定を向上させるハイブリッドインテリジェントモデルや統合システムの開発にもつながりました。過去の研究では、医療におけるAIの変革的役割や、機械学習システムにおける敵対的攻撃と防御メカニズムについても議論されています(29,30)。
これらの進展にもかかわらず、既存の研究は依然として断片化しています。多くの連邦学習モデルは敵対的堅牢性を組み込んでおらず、攻撃を受けやすいです。さらに、ドメインの異質性は十分に対処されず、機関間の一般化が制限されます。プライバシー保護メカニズムはしばしば孤立して実装され、堅牢性やドメイン適応戦略との統合が行われず、その結果、医療AIシステムは不完全で信頼性が低いとされています。これらの制限に対処するため、本論文は対抗的訓練、ドメイン認識型注意メカニズム、安全な集約を組み合わせた統合型対抗的ロバスト連邦学習フレームワークを提案します。提案されたアプローチは、攻撃に対する堅牢性を高め、異種な臨床環境間での適応性を向上させ、患者データのプライバシーを確保することで、現実世界の多機関医療アプリケーションに対する包括的なソリューションを提供します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
提案された方法論
提案されている敵対的ロバスト連邦学習(AR-FL)モデルは、異なる医療機関間で安全かつ協働的に患者の死亡リスクを予測しつつ、データプライバシーを保護し、システムを敵対的な摂動に対して強靭化することを目的としています。この展開には主に4つの要素が含まれています:(1) フェデレーテッドラーニング構造、(2) 最適化に基づく最小最大対抗訓練、(3) ドメイン認識型注意メカニズム、(4) プライバシー保護パラメータ集約。この手法は、死亡リスクを推定するための敵対的ロバスト連邦学習を目的とした体系的なフローで実行されます。 図2に示されているこのプロセスは、多数の医療機関からのデータ取得から始まり、その後、特徴の標準化や欠損値の処理のためのデータ前処理が行われます。グローバルモデルはまず中央サーバーによって作成され、その後すべての医療機関に送信されます。局所的な対抗訓練は医療機関内で行われ、モデルの乱動に対する堅牢性を高めつつ、ドメイン固有のデータに適応させることを可能にします。トレーニング後、ローカルモデルのパラメータは安全なパラメータ集約によってサーバーに安全に届けられます。サーバーはこれらのローカルモデルの貢献を取り入れてグローバルモデルを更新します。このプロセスは、モデルの協働的な洗練を促進するために、反復最適化の中で何度も繰り返されます。その結果、モデルは予測性能、敵対的堅牢性、機関間での一般化を評価する臨床ベンチマークを用いて厳密に評価されます。

図2:提案されたAR-FLモデル。 この図は、提案された敵対的・ロバスト連邦学習モデルの全体的なアーキテクチャを示しており、敵対的訓練、ドメイン認識型注意、プライバシーを保つ安全なアグリゲーションを含みます。 この図の拡大版はこちらをクリックしてご覧ください。
データ収集
本研究では、公開されている電子カルテ(EHR)データセットの2つ、MIMIC-III4 とeICU共同研究データベース6が利用されています。MIMIC-IIIは、1つの主要病院から40,000件以上のICU入院を提供しているのに対し、eICUデータは米国内のさまざまな病院から20万件以上のICU入院を含んでいます。これらのデータストリームに記録された患者人口統計、臨床測定、検査結果、記録された出来事、アウトカムは、死亡率リスク予測課題にとって非常に魅力的なものとなっています。EHRデータセットはそれぞれ異なる部分に分割され、現実的な多機関連携型学習環境を形成しています。それぞれの部分は異なる病院や機関を表しています。この手法は、患者の特徴、臨床プロトコル、文書化スタイル、データの利用可能性において、機関間の違いを捉えます。各シミュレートされた機関は、自身のデータサブセットのみにアクセスでき、中央サーバーや他の参加クライアントと生の記録を共有しません。このアプローチはプライバシー保護原則の完全な遵守を保証すると同時に、病院間協力の現実的な制約をシミュレートします。死亡率ラベルは、例えば入院死亡率指標などデータセットに示されたアウトカムフィールドから抽出されます。これらのラベルはフェデレーテッドラーニングモデルの予測ターゲットとして機能します。各機関は死亡結果に関連する独自の患者特徴記録をローカルに管理し、機密性を漏らさずに分散型モデルトレーニングを可能にします。
データ前処理
各機関はモデルトレーニング開始前に独立してローカルEHRデータを処理します。フェデレーテッドラーニングでは、参加機関間で患者レベルのデータや要約統計の共有が禁止されているため、すべての前処理ステップは各機関でローカルに行われ、その機関のデータセットの情報のみに基づいて行われます。前処理の流れはいくつかの重要なステップで構成されています。まず、バイタルサイン、検査結果、生理学的測定などの数値的臨床変数を正規化し、値の範囲の差を排除し、モデルの収束を安定させます。正規化に用いられる統計を計算するには、各機関のローカルデータのみが唯一の情報源です。次に、性別、入学タイプ、診断カテゴリーなどのカテゴリ属性を、ワンホットエンコーディングや機関別マッピングなどの手法を用いて数値表現に変換します。したがって、連邦モデルは共有のエンコーディング辞書や機関間参照表を必要とせずにカテゴリカルデータを扱うことができます。第三に、臨床データセットでよく見られる欠損データは局所補完技術を用いて処理されます。特徴の種類や臨床文脈によっては、機関は平均補完、過去の観察に基づくフォワードフィル、さらにはルールベースの臨床置換に頼ることもあります。各機関が独立して補完を行うため、外部メタデータや共有補完パラメータは必要ありません。これらの手順を経て、各機関は関連する死亡率結果を含む完全な処理済み特徴データセットを作成できます。その後、ローカルデータセットはフェデレーテッドモデルのトレーニング入力として使用されます。前処理パイプライン全体を通じて、生データ、派生統計、中間出力は機関外に送信されず、プライバシー保護のためのデータ管理の厳格な遵守が保証されています。
モデル初期化
K {1, 2,..., K}を関係機関(クライアント)の集合とし、各機関がローカルデータセットを持つとします。
{
は入力EHRの特徴を表し、
は関連する死亡ラベル(二値またはカテゴリ)です。グローバルモデル
は、すべてのクライアント間で協働的に訓練され、θは共有モデルパラメータです。
このプロセスは標準的なFederated Averaging(FedAvg)プロトコルに従っています:
中央サーバーはグローバルな
パラメータを初期化し、それをブロードキャストします。各クライアントk∈Kは自身のデータを使ってローカルトレーニングを行い、モデルを
に更新します。サーバーは更新情報を加重平均で組み合わせます:

、ここで n =
中央サーバーの初期化手順とローカルトレーニングの手順は、Tラウンドのグローバル通信ラウンドで継続されます。
局所対立訓練(最小最大最適化)
堅牢性を高めるために、各クライアントは地元の現場で対抗訓練を実施します。クリーンなデータに対して経験的リスクを最小化する代わりに、クライアントはミニマックス問題に取り組んでいます。
(x+δ),y)
L:損失関数
δ:対抗的摂動は 
S:敵対的脅威領域
(x+δ):摂動入力下での予測
各局所エポックの時点で、敵対的サンプルは投影勾配降下法(PGD)または高速勾配符号法(FGSM)を用いて作成されます。その後、モデルはこれらのサンプルを用いて学習を進め、堅牢性を高めます。
ドメイン認識型注意メカニズム
異なる機関の電子カルテ(EHR)データは、データの配布、特徴の意味論、臨床実践の面で大きく異なる場合があります。この問題に対処するため、AR-FLモデルはドメイン固有の注意モジュールをモデルに組み込んでいます。

機関kからの入力ベクトルとします。各特徴jに対する注意重み
は次のように計算されます∈ {1..., d}
=
ここで、は訓練可能な注意の重みです。入力は次のように再重み付けされます:

この仕組みを通じて、モデルは機関が使用するデータの性質に応じて臨床実践に重要な特性を強調でき、適応性と解釈可能性を高めます。
プライバシー保護パラメータ集約
AR-FLは、通信中に最高レベルのプライバシーを維持するために、必要に応じて非常に安全な集約と差別的なプライバシー技術を組み合わせて使用します。セキュアアグリゲーション:ユーザーはモデルの更新を暗号化し、サーバーは合計のみを計算でき、個別の寄与は計算できません。
差別プライバシー:モデルアップデートにノイズを加える:

プライバシーと正確性のトレードオフσコントロールしています。
分散型更新の際には、プライベートな患者データや機関情報が漏洩するリスクを防いでいます。
グローバルモデルの更新
各機関でローカルトレーニングフェーズが完了すると、中央サーバーはクライアントから提出されたモデルの更新情報を収集します。これらの更新はモデルパラメータの変更のみで構成されており、生の患者データや中間的な特徴表現は含まれていません。各機関から得られた知識を統合するために、サーバーはFederated Averaging(FedAvg)法を適用します。このプロセスでは、サーバーは各機関で利用可能なデータ量に基づいて、地域のモデルの加重平均を計算します。より大きなデータセットを提供する機関ほど、更新されたグローバルモデルへの影響が比例して大きくなります。更新は安全な集約技術で送信されたため、サーバーは個々の機関のパラメータを閲覧または分離することはできません。むしろ、サーバーは暗号化されたかプライバシー保護された混合表現のみを受け取っています。これにより、研修プロセスの機密性が保証され、発見された可能性のある施設特有のパターンや患者の特徴が破棄されます。集約された更新を計算した後、サーバーはその通信ラウンドで協力機関から得られた総知識を表す新しいグローバルモデルを作成します。新しいグローバルモデルはすべての機関に送られ、次の地域対抗訓練が開始されます。
反復最適化
フェデレーテッドラーニングは、複数のコミュニケーションラウンドを含む多段階のプロセスです。各ラウンドは、ローカルモデルのトレーニング、安全な更新送信、グローバル集約、そして改良モデルの参加者への配布で構成されています。繰り返すラウンドはモデルが徐々に堅牢で安定した解へと向かうのを助けます。これらのラウンドでは、各組織が患者集団に関する知識を持ち込み、異なる環境で臨床パターンを特定できるモデルを作成します。対立訓練やドメイン認識注意メカニズムは、各ラウンドで局所的な訓練を通じて実施されることもあることに注意が必要です。したがって、モデルは常に洗練され続け、敵対的攻撃に対抗する力が増大し、機関間で異なる特徴分布に適応する能力も向上しています。反復最適化を通じて、モデルは一般化性能を向上させるだけでなく、データの不均衡、制度の変動、敵対的な環境に対してますます寛容になります。この手順は、あらかじめ設定された通信ラウンド数に達するか、グローバルモデルが安定した収束を示すまで続けます。
評価
すべてのコミュニケーションラウンド終了時に、参加者のデータセットから得られた保留テストセットを用いて最終的なグローバルモデルが徹底的に評価されます。これらのテストセットはモデルトレーニングには使用されないため、モデルのパフォーマンスを公正かつ公平に測定できます。モデルの有効性は、複数の角度から異なる指標を計算することで評価されます。クリーン・アシオリティは、通常の条件が整っている状況を評価するものです。このモデルが死亡率の結果を予測する正確性を測定します。これに対し、敵対的精度は入力データが敵対的に変更された場合でもモデルが性能を維持できる程度を推定します。受講者操作特性(ROC)曲線(AUC-ROC)下の面積は、モデルが生存患者と死亡患者の識別能力を示す手がかりとなります。F1スコアは精度とリコール関係の指標として機能し、特に不均衡な臨床データセットで顕著です。一般化ギャップは異なる機関間のパフォーマンス格差を示し、多様なデータソースに適応するモデルの柔軟性を示しています。プライバシーリスクは最終的に、シミュレートされた敵対的攻撃を用いて定量化され、安全な集約やオプションの差別的プライバシーが患者の機密性保護に効果的かどうかを判断します。これらすべての評価指標を合わせることで、モデルの予測力、敵対的攻撃への耐性、異なる機関間の安定性、プライバシー保護要件の遵守状況を包括的に把握できます。以下のアルゴリズム1(補足ファイル1)は、死亡リスク予測のための敵対的ロバスト連邦学習(AR-FL)を示しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
AR-FLモデルは、MIMIC-IIIとeICU共同研究データベースという、病院内死亡率アウトカムを含むICU患者記録を含む、公開されている非識別化された多機関電子健康記録(EHR)データセットで検証されました。データセットは、機関間のデータ特性に関する実際の違いを表すシミュレートされた病院シナリオに分散されました。各クライアント(機関)ごとに独自のプライベートEHRデータを用いて別モデルを訓練し、集約されたグローバルモデルは差分プライバシーを伴う安全な平均化によって得られました。
実験装置
AR-FLモデルの評価は、シミュレーションされたフェデレーテッドクライアントを通じて一貫性があり再現性があり、計算的に堅牢な実験セットアップで実施されました。モデル開発、敵対的訓練、連邦最適化の全プロセスはPyTorchとNVIDIA Tesla V100 GPUを用いて行われ、さらにCUDA Toolkitによってフォワードパス、勾配計算、PGDベースの敵対的摂動生成の効率的な実行が補...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本論文は、多機関電子カルテ(EHR)を用いて死亡率リスク予測を向上させることを目的とした対抗的・堅牢な連邦学習(AR-FL)モデルを提示し、正確性、堅牢性、一般化可能性を向上させます。この研究は、フェデレーテッド環境に敵対的訓練を組み込むことで、異なる機関間での入力の摂動やドメイン変動に対する耐性を高めることでモデルに大きな利点をもたらすことを明らかにしました。これらの新結果は、対抗的最適化が臨床予測タスク中の モデルの安定性を向上させ、フェデレーテッドラーニングが患者のプライバシーを確保しつつ多センター協働を可能にすることを示す以前の結果と一致しています。ドメイン認識型注意メカニズムは、ドメインシフト緩和がEHRモデルで予測信頼性を高めることを示す文献と一致し、機関固有のパターンへの特徴レベルの適応を可能にすることでモデルを強化しています。これらの貢献は、AR-FLが患者プライバシーを損なうことなく分散型臨床インテリジェンスを提供できる新しいアプローチの中で最も安全かつ好ま...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは競合する利害関係を一切認めていない。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| アダム・オプティマイザー | パイトーチ | https://pytorch.org/docs/stable/generated/torch.optim.Adam.html | 最適化 |
| CUDAツールキット | NVIDIA | https://developer.nvidia.com/cuda-toolkit | バージョン11.8;GPUアクセラレーション |
| 差分プライバシーライブラリ | オパカス | https://opacus.ai | バージョン1.3.0;DPベースのプライバシー保護訓練 |
| eICU協働研究データベース | フィジオネット | https://physionet.org/content/eicu-crd/2.0/ | ICU患者EHRデータ |
| ミミックIII | フィジオネット | https://physionet.org/content/mimiciii/1.4/ | ICU患者EHRデータ |
| PGDアタックスクリプト | GitHub | https://github.com/Saswati-C/AR-FL-HER | バージョン:コミットハッシュ;敵対例生成 |
| パイトーチ | PyTorch.org | https://pytorch.org | バージョン2.0;モデル実装と訓練 |
| テスラ V100 GPU | NVIDIA | https://www.nvidia.com/en-us/data-center/v100/ | モデルトレーニング |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト