本研究は、肺炎関連ARDSの早期診断と臨床表現型化のために機械学習モデルを統合し、精密治療を促進するウェブベースのシステムを開発し、外部検証を行うことを目的としています。
Research Article
本研究は、肺炎関連ARDSの早期診断と臨床表現型化のために機械学習モデルを統合し、精密治療を促進するウェブベースのシステムを開発し、外部検証を行うことを目的としています。
急性呼吸困難症候群(ARDS)は非常に多様で、重度肺炎と重度肺炎と重なる臨床症状があり、正確な分化に課題があります。したがって、早期予測とARDS患者の迅速なサブタイプクラスタリングが緊急に求められています。本研究は、早期診断や臨床サブグループ分類の検証済みモデルを含むウェブベースのシステムを開発し、肺炎関連ARDSの発症と表現型を予測することを目的としています。診断モデルおよびサブグループモデルは、Medical Information Mart for Intensive Care IV(MIMIC-IV)およびテレヘルス集中治療ユニット(eICU)という2つの大規模データベースから開発・検証され、ウェブベースの予測システムに組み込まれました。2008年から2019年の間に肺炎患者が24時間以上入院したデータを分析しました。MIMIC-IV派生コホートには肺炎患者24,987名(肺炎関連ARDS患者14,121名)、eICU検証コホートには肺炎患者20,676名(肺炎関連ARDS患者9,946名)が含まれていました。診断において、機械学習のスタッキング法はMIMIC-IV導出コホートにおいてAUC0.919、精度70.00%、精度69.88%、リコール率82.27%で最も優れた成績を収めました。eICU検証コホートのAUC、正確性、精度、リコール率はそれぞれ0.915%、70.87%、69.70%、69.70%でした。肺炎関連ARDSは、異なる臨床的特徴とアウトカムを持つ3つの臨床表現型に分類され、それぞれ治療に対する反応が異なっていました。クラスター0および1の患者では、早期コルチコステロイド治療を受けた患者の入院死亡率が未治療者より高かったのに対し、クラスター2の患者では、コルチコステロイド投与を受けた患者の入院死亡率が未治療者より低かった。肺炎関連ARDSの診断予測および臨床サブグループ分類のウェブ変換を実施しました。当社のウェブベースの早期ベッドサイド診断および肺炎関連ARDSの臨床サブグループ分類モデルは、臨床医が疾患の診断と治療、そして個別化された精密治療の促進に役立つ可能性があります。
急性呼吸不全、特に肺感染症後の急性呼吸困難症候群(ARDS)は、重篤な患者に共通して深刻な問題に直面します。研究によれば、集中治療室(ICU)患者におけるARDSの発生率は最大10%に達し、死亡率は約40%です2,3。重度の肺炎はARDS4の主な原因と広く考えられています。重度肺炎とARDSの臨床症状が似ているため、ARDSと重度肺炎の区別が難しいことが多いです。したがって、肺炎の症例におけるARDS発症の早期予測は、ARDSの発生率や死亡率の低減につながる可能性があります5。さらに、ARDSは非常に異質な疾患であるため、早期かつ正確なサブグループ分類は精密医療を可能にします。このような分類は、世界中の呼吸器重症疾患に関する研究の主要な方向性の一つでもあります。7、目標はターゲットを絞ったサブグループ介入の効果を向上させることです。
現在、ARDSの独立リスク要因は広く研究されていますが、肺炎患者におけるARDSの予測に焦点を当てた研究はほとんどありません。さらに、肺炎関連ARDSの特定の臨床表現型に関する研究は行われていません。ほとんどの表現型研究はARDS患者の全集団に焦点を当てています。Calfeeら9はARDSを高炎症表現型と低炎症表現型に分類しました 。これらの生物学的表現型を定義するには、血漿バイオマーカーをカテゴリー的に定義する変数として用いる必要がありますが、そのような調査は臨床現場では容易に利用できません。ある研究では、入手可能な臨床指標を用いてARDSを3つの臨床表現型に分類し、ランダム化介入への反応も評価しましたが、研究はARDS患者の全集団に基づいていました。肺炎など異なる原因でARDSの臨床表現型を定義することで、より精密で正確な結果が得られる可能性があります。
本研究の目的は、機械学習を用いて早期臨床データを用いた肺炎関連ARDSの予測モデルを構築することでした。早期かつ容易に入手可能な臨床データを用いて肺炎関連ARDSを臨床表現型に分類し、それらの臨床的特徴、転帰、治療反応の違いを探ること;また、予測モデルおよび分類モデルをウェブベースのアプリケーションとして実装し、肺炎関連ARDSの診断と治療を支援し、さらなる研究を促進することを目指しました。
Access restricted. Please log in or start a trial to view this content.
本研究は、Protecting Human Research Participates検査(記録ID:44151052)を完了した後、Medical Information Mart for Intensive Care IV(MIMIC-IV)データベース11(バージョン1.0、PhysioNet: https://physionet.org/content/mimiciv/1.0/)およびテレヘルス集中治療室(eICU)データベース12(バージョン2.0、PhysioNet: https://physionet.org/content/eicu-crd/2.0/)にアクセスしました。本研究はヘルシンキ宣言(2013年)の原則に従って実施され、患者は2つのデータベースにデータを収集することに同意していました。本研究の倫理承認は免除されました。これはeICUおよびMIMIC-IVデータベースのデータが完全に匿名化されていたため(個人識別子は保持されていません)、
材料と道具
データソース:MIMIC-IVデータベース:バージョン1.0、単一センターオープンアクセスレジストリ、76,540件のICU入院(2008-2019年)、PhysioNet経由でアクセス。eICUデータベース:バージョン2.0、マルチセンターデータベースで、2014年から2015年(2014-2015年)の米国208病院335ユニットから20万件の電子カルテ>を収録し、PhysioNet経由でアクセス。ソフトウェアおよび実行環境:RapidMiner Studio:バージョン9.10.001(実行環境:Windows 10 Pro 64ビット)、モデル構築(分類/クラスタリング)および機能選択に使用;IBM SPSS Statistics:バージョン23.0(実行環境:Windows 10 Pro 64ビット)、統計解析および欠損値補完に使用;Java Development Kit(JDK):バージョン Java SE 8u381(実行環境:Windows 10 Pro 64ビット)、ウェブアプリケーション開発に使用されます。サポートIDE:Eclipse IDE 2023-09;Apache Tomcat:バージョン9.0.85、ウェブベースのアプリケーションの展開に使用されます。
研究デザインと環境
本研究の概念は 補足図1に示されています。本研究は、集中治療IVのための医療情報市場(MIMIC-IV)および遠隔医療集中治療室(eICU)データベースの2つの大規模情報源からデータを分析し、肺炎関連ARDSの予測モデルを構築し、臨床表現型に基づいて患者を分類しました。本研究は、個人の予後または診断のための多変数予測モデルの透明報告(TRIPOD)のガイドラインに従って行われました。
研究サンプル
本研究のトレーニングおよび試験データはMIMIC-IVから取得されました。外部検証の出典は多センターeICUデータベースでした。本研究では、国際疾病分類(第9版および第10版)を用いて肺炎および肺炎関連ARDS患者に関するデータを抽出しました。入院期間24時間未満の患者は除外しました。
予測因子
MIMIC-IVおよびeICUデータセットにおけるデータの利用可能性と欠落した臨床変数の発生率を評価した後、患者の人口統計的特徴、検査所見、疾患重症度のスコアを含む52の肺炎関連ARDS変数を機械学習で使用する候補変数として選定しました。本研究では、変数とアウトカム間の相関重みに基づく重み別相関アルゴリズムを用いて、52の候補変数の主要予測因子(最終的にモデルに含まれる変数)をスクリーニングし、その中から主要な予測因子からサブグループのクラスタリング因子を選定しました。
これを行うには、RapidMiner Studioを開き、新しいプロセスを作成し、相関による重み付け(Weight by Correlation)オペレーターを追加してください。特徴 選択>相関による重み付け>プロセス>オペレーターをクリックしてください。パラメータを設定します:相関閾値=0.04(重み>0.04の変数を保持)。病気の初期段階と適時性を考慮したモデルに強制するため、入院後24時間以内に検査所の指標の最大値と最小値を取得しました。急性生理学スコアIII(APSIII)はeICUデータベースに含まれていなかったため、急性生理学および慢性健康評価IV(APACHE IV)のスコアが代わりに使用されました。この研究では、多重補完法を用いてデータをクリーン化し欠損値を補間し、予測およびサブフェノタイプモデルの開発時に入力変数を標準化しました。
統計解析
SPSS 23.0を開き、前処理済みデータセットをインポートし、「 記述統計>分析」>探索を選択します。連続変数のコルモゴロフ・スミルノフ検定を行うには、検 定で正規性プロット を検証してください。偏った分布変数は中央値(四分位範囲、IQR)として報告されます。カテゴリ変数はカウント(パーセンテージ、%)として報告されます。グループ間の連続変数を比較するために、必要に応じてマン・ホイットニーU検定またはクルスカル・ウォリス検定が用いられました。グループ間のカテゴリ変数を比較するために、適切な場合はピアソンのカイ二乗検定またはフィッシャーの正確検定が用いられました。
モデル開発とウェブプレゼンテーション
モデル開発に関して、本研究ではMIMIC-IV導出コホートをトレーニングセット(モデル開発とハイパーパラメータ調整のためにサンプルの90%をランダムに選出)とテストセット(内部テスト用にランダムに選ばれる10%)に分けました。本研究はeICUで外部検証を行いました。本研究では、意思決定木、ロジスティック回帰、ナイーブベイズ、スタッキング(基本学習器はロジスティック回帰、ナイーブベイズ、ランダムフォレスト法、スタッキングラーナーは決定木法)、およびランダムフォレスト法の5つの手法で機械学習を実装しました。意思決定木:プロセス >演算子>モデリング>分類 > Decision Tree アルゴリズム = C4.5、最小葉サイズ = 5 を含みます。ロジスティック回帰については、正則化強度=0.1、最大反復数=100 >ロジスティック回帰>モデリング>分類のプロセス>演算 子をクリックしてください。ナイーブベイズについては、Kernel type = Gaussian > Modeling > Classification > Process > operators Naive Bayes をクリックしてください。ランダムフォレストについては、「 プロセス>オペレーションズ > モデリング>分類 > 木数=100、最大深さ=20のランダムフォレスト」をクリックしてください。スタッキングについては、 プロセス>オペレーター > モデリング > アンサンブル > ベース学習者によるスタッキング = ロジスティック回帰 + ナイーブベイズ + ランダムフォレスト;学習者を積み重ねる = 意思決定木。本研究では、受信機の動作特性曲線(AUC)下面積、精度、精度、リコール率を計算することで、開発されたモデルの予測性能を測定しました。
肺炎関連ARDS臨床サブグループの分類構築にあたり、本研究では主要な予測因子を含む k-平均クラスタリングを用いました。クラスタkの最適数を決定するために、ギャップ統計プロットのギャップ統計値を調べ、最適なクラスタ数を示唆しました。本研究では、異なる表現型の臨床的特徴とアウトカムを分析し、早期の低用量から中用量コルチコステロイド治療を受けた患者と受けなかった患者間の入院死亡率の差を比較しました。
RapidMiner Studioで「 ファイル>モデルエクスポート 」を選択し、診断予測モデルおよびサブグループ分類モデルを.modelファイルとして保存します。JDK Java SE 8u381およびEclipse IDE 2023-09を使ってJava言語でウェブページを書くことができます。.modelファイルをプロジェクトにインポートします。本研究ではJava言語を用いて、診断モデルと臨床サブグループクラスタリングモデルを埋め込んだウェブページを作成し、モデルをオンラインにアップロードしました。
Access restricted. Please log in or start a trial to view this content.
参加者
MIMIC-IVデータベースには、肺炎患者24,987名のデータを含み、そのうち14,121名が肺炎関連ARDSを有していました(表1)。eICUデータベースには肺炎患者20,676名のデータが含まれ、そのうち9,946名が肺炎関連ARDSを有していました(補足表1)。
肺炎関連ARDS予測モデルの確立と検証
MIMIC-IVコホートのデータを用いて肺炎関連ARDSの診断モデルを構築しました。モデルはeICUコホートのデータで外部検証されました。MIMIC-IVコホートの患者は、トレーニングコホート(n = 22,488人[90%])とテストコホート(n = 2,499人[10%])に無作為に分けられました。重み相関アルゴリズムを用いて、入力変数の中から重みが高い18の主要予測変数(>0.04)を選びました(補足図2):APSIII;アニオンギャップ、重炭酸塩、グルコース、カリウム、ナトリ...
Access restricted. Please log in or start a trial to view this content.
ご存知の通り、これは機械学習を用いて肺炎患者のARDSを報告する初の診断モデルおよび臨床サブグループ分類モデルであり、肺炎関連ARDSの診断および臨床サブグループ分類を報告する最大規模の研究です。本研究では、2つの機械学習ベースのモデルを導出・検証し、臨床実践およびその後の研究のためのウェブベースの応用に翻訳しました。eICU検証コホートでは、肺炎患者が肺炎関連ARDSを発症する予測はAUC0.915、正確率70.87%、正確率69.70%、想起率69.70%でした。また、肺炎関連ARDS患者に対して、簡易かつ迅速な臨床予測因子を用いて臨床サブグループクラスタリングを実施しました。これら3つの表現型は、初期の低用量から中用量のコルチコステロイド治療に対して異なる反応を示しました。
本研究で機械学習に用いられたスタッキング手法は、本質的にkフォールドクロス検証モデルでした。モデルの第一層には複数の基本分類器が含まれ、予測結果(メタ特徴)を第二層(スタッキングモデル学習器)に提供し、第二層の分類器では...
Access restricted. Please log in or start a trial to view this content.
著者たちは競合する利害関係がないと宣言しています。
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| アパッチ・トムキャット | Apacheソフトウェア基盤 | バージョン 9.0.85 | |
| Eclipse IDE | 日食 | 2023-09 | |
| Java Development Kit | ジャワ | バージョン Java SE 8u381 | |
| ラピッドマイナー・スタジオ | アルタイル・エンジニアリング社 | バージョン 9.10.001 | |
| SPSS統計 | IBM | バージョン 23.0 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission