研究記事

非アルコール性脂肪肝疾患予測および外部コホート検証のための自動機械学習モデル

DOI:

10.3791/70033

2026年7月3日

* These authors contributed equally

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NHANESデータと外部コホートを用いて非アルコール性脂肪肝疾患のスクリーニングを行うステップバイステップのAutoMLプロトコルを提示します。この手法は機能の優先順位付けとモデル選択(GBM)を自動化し、SHAPベースの解釈と外部検証を含み、再現可能な臨床展開を実現します。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

非アルコール性脂肪肝疾患(NAFLD)は、肥満、インスリン抵抗性、代謝症候群に関連する一般的な肝疾患であり、しばしば進行期まで診断されず発見されます。画像診断や肝生検などの従来の診断法は早期発見に限界があります。早期のNAFLDスクリーニングには効率的で非侵襲的なツールが必要です。自動化機械学習(AutoML)技術を用いて、NHANESの大規模なデータセット(n = 2677)を活用してNAFLDの診断モデルが開発されました。さらに、独立した外部検証コホート(n=200名)を用いてモデルの外部妥当性と性能を評価しました。有望な臨床特徴の選定には、LASSO回帰とChatGPT-4ベースの知的分析を組み合わせた2段階の特徴選択法を適用しました。その後、複数の機械学習アルゴリズムを統合したAutoMLプロセスがモデルの訓練と検証のために実施されました。モデルの性能はROC曲線、F1スコア、SHapley加法説明(SHAP)解析を用いて評価されました。GBMモデルは訓練セットでAUCが0.843、テストセットで0.851、外部検証セットで0.945を記録し、異なるデータセットで高い診断精度を示しました。BMI、トリグリセリド、GGTなどの主要な予測因子がモデルの予測に有意に寄与していると特定されました。SHAP解析により、これらの変数がNAFLDの予測に重要であることがさらに確認されました。NAFLDのAutoML駆動診断モデルは早期発見性能を大幅に向上させ、従来の診断方法に対する信頼性が高く非侵襲的かつ効率的な代替手段を提供しました。この方法は、専門家知識への依存を減らし診断精度を向上させることで、NAFLDにおけるより広範な臨床応用の可能性を秘めています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

非アルコール性脂肪肝疾患(NAFLD)は世界的に最も多く見られる肝疾患の一つであり、現在成人人口の約35%に影響を及ぼしていますが、過度の飲酒によるものではありません肝細胞の5%以上に脂肪が蓄積し、炎症、肝線維化、肝硬変、最終的には肝不全など、より重篤な状態へと進行する可能性が特徴です。 現在、NAFLDの従来の診断方法は主に異常な肝生化学マーカーと超音波検査に依存しています。しかし、ステアトーシスの度合いが20%未満では超音波の感度が限られ、軽度の脂肪浸潤の検出信頼性が低下し、初期のNAFLD4の診断見逃しにつながることが多いです。肝生検はNAFLD診断のゴールドスタンダードとされていますが、その侵襲的性質や痛み、感染、出血などの合併症のリスクから、大規模なスクリーニングの実現可能性は制限されています。したがって、NAFLDスクリーニングを促進するために、効率的で非侵襲的かつ費用対効果が高く、高感度のツールが緊急に求められています。

人工知能(AI)や機械学習(ML)技術の急速な発展により、データ駆動型アプローチはNAFLDの早期診断とリスク評価のための新たな解決策を提供しています。大規模で複雑なデータを分析することで、ML技術は潜在的なパターンや関係を自動的に特定でき、さまざまな病気の診断や予測に広く応用されています例えば、MLアルゴリズムを用いて慢性B型肝炎ウイルス感染者の肝硬変リスクを予測し、有望な結果を達成しました。NAFLD分野の類似研究では、サポートベクターマシン(SVM)やランダムフォレスト(RF)などの従来の機械学習アルゴリズムを用いた診断モデルが成功裏に開発され、高い精度を達成し、強い臨床応用性を示しました。8,9,10,11,12,13,14,15,16,1718。例えば、研究者たちは、通常の検査データを解析することで一般集団のNAFLDを効果的にスクリーニングするための機械学習モデルを開発しました。一般集団の通常の検査データを分析することでNAFLDを効果的にスクリーニングするために、実験室パラメータを用いたMLモデルが開発されました。米国におけるNAFLDの有病率は、一時的なエラストグラフィーと機械学習手法を組み合わせてNHANES 2017–2018年のデータを用いたもので予測されました16。研究チームは機械学習アルゴリズムを用いて、一時的なエラストグラフィーと他の臨床変数との相関を調査し、多様な集団におけるNAFLDの有病率を信頼性高く推定する予測モデルを開発しました。

しかし、従来の機械学習手法は、特に特徴工学、モデル選択、パラメータチューニングなど、専門的な知識と経験を必要とするため、かなりの手作業が必要です。これらの制約に対処するために、自動機械学習(AutoML)が開発されました。AutoMLは、データ前処理、特徴選択、モデル選択、ハイパーパラメータ最適化を含むモデル構築パイプライン全体を自動化し、機械学習プロセスの効率と精度を大幅に向上させます19。食道静脈瘤出血の予測モデルがH2O AutoMLプラットフォーム20を用いて開発・検証されました。このモデルは、ディープラーニング(DL)、極限勾配ブースティング(XGBoost)、一般化線形モデル(GLM)、勾配ブースティングマシン(GBM)、ランダムフォレスト(RF)、スタッキングアンサンブルなど様々なアルゴリズムを用い、予測期間は12か月でした。AutoMLは、SEERデータベースのデータを活用して消化管間質腫瘍患者の肝転移リスクを予測するために用いられた。AutoMLプラットフォームは、日常的な臨床データを用いて、迅速かつコスト効率の高い前立腺がん診断ツールの開発に活用されました。AutoMLの登場により、臨床診断においてより効率的な解決策が提供されており、NAFLDスクリーニングにおけるその可能性はさらなる探求に値します。NAFLDの早期発見と正確な診断は重要ですが、無症状であることは診断に大きな課題をもたらします。AutoML技術は疾患診断において大きな可能性を示してきましたが、NAFLD診断への応用は依然として限定的であり、この研究分野の有望な展望を示しています。

本研究は、AutoML技術と一時的エラストグラフィーを組み合わせて、米国NHANESデータベース(2017–2018年)のデータを活用し、非アルコール性脂肪肝(NAFLD)診断モデルを開発しました。このモデルは、温州医科大学第一附属病院感染症科の個人データセットを用いて外部検証されました(2018–2020年)。この研究は、外部データセットでのモデルのパフォーマンスを評価し、従来の手法と比較することで、既存の研究ギャップを埋めました。複数の血液および生化学マーカーの解析を通じて、ロジスティック回帰やランダムフォレストなどのアルゴリズムを用いて予測モデルを構築しました。結果は、非NAFLD患者の正確な同定においてモデルの優れた性能を示しました。これにより、早期のNAFLDスクリーニングに効率的かつ正確なツールを提供するだけでなく、医療応用におけるAutoMLの統合も進展します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

患者と研究デザイン

本研究の最初のデータセットは、2017年から2018年の国立健康・栄養検査調査(NHANES)データベースから取得されました。この特定の期間が選ばれたのは、調査データにFibroScan®技術を用いた肝超音波一時的なエラストグラフィー測定が含まれていたためです。NHANESは階層化された多段階確率サンプリング設計を採用し、全国規模の人口ベースの調査として隔年で実施されています。米国の非施設化された人口に関する全国代表的な健康関連データを体系的に収集し、一般市民の栄養および健康状態を評価しています。NHANESは、国立健康統計センター(NCHS)が実施する全国代表的な横断研究です。調査プロトコルはNCHS研究倫理審査委員会の承認を受け、すべての参加者から書面によるインフォームドコンセントが得られました。この研究はヘルシンキ宣言とイスタンブール宣言の両方に従って実施され、温州医科大学第一附属病院の倫理委員会(2016–246年、2016年12月1日)によって承認され、参加者全員から書面によるインフォームド・コンセントが取得されました。

最初のデータセットは、2017年から2018年のNHANES調査でFibroScan検査を受けた5494名の個人で構成されていました。以下の除外に基づき、合計2677名の参加者が分析に含まれ、そのうちNAFLDの患者718人、非NAFLDの患者1959人が含まれていました。これらの参加者は、トレーニングセット(n = 1785)とテストセット(n = 892)にランダムに分けられました。2つ目のデータセットは、温州医科大学第一附属病院感染症科(2018–2020年)の582名で構成されました。同じ除外基準を適用した結果、合計200名が対象となり、そのうち159名がNAFLD患者、41名が非NAFLD患者でした。このコホートは独立した検証セットとして利用されました。この研究デザインは、多中心データを用いてモデルを構築し検証するために開発され、その結果の信頼性と一般化可能性を高めました。NAFLD群および非NAFLD群のベースライン臨床的特徴は、表1パッケージ(表1)を用いてまとめられました。さらに、患者選択のプロセスと全体の研究プロセスは図1示されています。

NAFLDの診断基準および除外基準

NAFLDの診断基準は以下の16に基づいていました。18歳以上、過去12か月間に女性はアルコール摂取量を週に≤140g、男性は週210g≤に制限した一時的エラストグラフィー(FibroScan)スクリーニングへの参加、FibroScan 502 V2 Touchシステム(Echosens)を用いて測定した制御減衰パラメータ(CAP)値は≥ 302 dB/mであること、 中型(M)または超大型(XL)プローブ、または温州医科大学第一附属病院感染症科での肝生検病理で確定診断された23

NAFLDの除外基準は以下の通りです高アルコール摂取量(NHANESアルコール使用調査5によると女性>平均1日20g、男性>30g)、B型またはC型肝炎の存在、HIV感染、自己免疫性肝炎、原発性胆管炎、ウィルソン病、非ステロイド抗炎症薬の長期使用、カルシウムチャネル遮断薬、タモキシフェン、アミオダロン、コルチコステロイド、イソニアジド、メトトレキサート、妊娠または授乳、 肝臓がんやその他の良性または悪性腫瘍の診断。

データ収集と変数選択

本研究に含まれる可能性のある予測変数は以下の通りです。

人口統計的特徴(年齢と性別);体格指数(BMI);NHANESデータベースにおける参加者のCAP値;一般的な生化学検査[すなわち、アルブミン(ALB)、グロブリン(GLO)、総タンパク質(TP)、乳酸脱水素酵素(LDH)、血尿素窒素(BUN)、尿酸(UA)、ガンマグルタミルトランスフェラーゼ(GGT)、トリグリセリド(TG)、血清グルコース(Glu)、血清クレアチニン(SCr)、総ビリルビン(TBIL)、ナトリウム(Na⁺)、塩化物(Cl⁻)、カリウム(K⁺)、カルシウム(Ca)、重炭酸塩(HCO₃)、総コレステロール(TC)、アスパラギン酸アミノトランスフェラーゼ(AST)、アラニンアミノトランスフェラーゼ(ALT)];標準的な血液学的パラメータ(例:赤血球数(RBC)、白血球数(WBC)、好中球数(NEUT)、好酸球数(EOS)、リンパ球数(LYM)、単球数(MON)、赤血球分布幅(RDW)、血小板数(PLT));高血圧および糖尿病(DM)の既往歴があります。研究対象者の中で、糖尿病および高血圧の診断基準は、NAFLD24に焦点を当てた機械学習に基づく予測モデル研究から得られました。

欠損データ処理と特徴選択

本研究で使用されたコホートデータには欠損値を含んでいました。すべての不完全記録を除外すると、分析サンプル数が減少するだけでなく、データの質が損なわれ、予測結果に偏りが生じる可能性があります。したがって、欠損率が20%を超えるデータは除外されました。欠損データ≤20%)のデータセットでは、データ型に応じて異なる補完方法が適用されました。連続変数には「norm」、二値分類変数には「logreg」、多重クラス変数には「polyreg」です。これらの補完は、多重補完25に対してRの「マウス」パッケージを用いて実施されました。本研究では、すべての連続変数を二項変数に二分化し、最適な分類閾値は受信者動作特性(ROC)曲線解析によって決定されました。具体的には、ROC曲線上の最大Youden指数に対応するカットオフポイントを最適な分類基準として選定し、感度と特異度の適切なバランスを維持しつつ分類性能を最適化しました。その後、部分最小二乗判別分析(PLS-DA)を用いてデータを効果的にクラスタリングしました。

さらなる特徴選択のために、「caret」パッケージを用いて7:3の比率で個体を訓練セットとテストセットにランダムに割り当てました。まず、最小絶対縮小および選択演算子(LASSO)回帰を特徴選択に用い、14の主要変数を特定して後続解析を行いました。次に、ChatGPT-4を用いて各変数に重要度スコアを割り当てました。特徴重要度を体系的に評価しつつ、潜在的なバイアスや確率変動を制御するために、標準化された評価プロトコルが実装されました。モデルに提供された具体的なプロンプトは「非アルコール性脂肪肝疾患(NAFLD)に関する確立された臨床文献に基づき、LASSO回帰によって特定された以下の14変数それぞれに対して、1(最低)から10(最高)までの重要度スコアを割り当てる」というものでした。評価をLASSO回帰で事前に選択された変数に厳密に限定することで、幻覚や無関係な特徴が組み込まれるリスクを最小限に抑えました。潜在的なデータ漏洩やアウトカムの有病率の誤用を防ぐため、言語モデルは実証データセットを完全に盲目化しました。このスコアリングは、変数名に関する既存の医学的知識を統合することに限定されました。この手法は、LASSO安定性選択やSHAPベースの剪定といった従来の手法を強化し、純粋にデータ駆動型の特徴が最終モデル統合前に堅牢な病態生理学的妥当性を示すことを保証します。さらに、単一応答分散を軽減するために、この手順は独立して10回繰り返し実施されました。各変数の平均スコアはこれらの反復で計算され、客観的な優先順位付けが確保されました。変数は平均スコアに基づいて降順にランク付けされました。最終的に、平均重要度スコアが5を超える変数のみを対象に絞り込み、SCr、UA、GGT、Glu、高血圧、糖尿病、TG、BMIの8つの主要変数となりました。

NAFLD向けのAutoMLベース予測モデルの開発

本研究では、NAFLDの効果的な診断のためにH2O AutoMLを用いて、古典的および高度な機械学習アルゴリズムの包括的なスイートを統合しました。H2O.ai プラットフォームのAutoML機能を活用することで、二値分類タスクのための機械学習解析が実施されました。使用されたアルゴリズムには、極限勾配ブースティング(XGBoost)、グラデーションブースティングマシン(GBM)、一般化線形モデル(GLM)、極度ランダム化木(XRT)、ディープラーニング(DL)、積み重ねアンサンブルが含まれます。これらのアルゴリズムは、疾患診断に最適なモデルを特定するために体系的に評価されました。厳密な方法論的再現性を確保するため、H2O AutoMLの実行パラメータは明示的に定義されました。自動検索は最大11,687秒の実行時間と最大302モデルに制限され、固定されたランダムシード13を使用していました。内部前処理フラグには、平均・モードアルゴリズムを用いた残差欠損値の自動補完や、高濃度のカテゴリ変数に対するターゲットエンコーディングが含まれていました。選ばれた最適アーキテクチャ(GBM_grid_1_model77とラベル付け)は、以下の特定のハイパーパラメータを持つ勾配ブースティングマシンでした:合計28木、最大木深5、学習率0.1。

モデルの堅牢性を高め、過学習リスクを軽減するために、体系的なハイパーパラメータチューニングおよび検証プロトコルを組み込んだAutoMLフレームワークが実装されました。このプロセスは、ハイパーパラメータ最適化を用いて200の異なるモデル構成を自動探索し、5重クロスバリデーションを用いて訓練データセットを5つの相互排他的なサブセットに分割することから始まりました。反復訓練中、各構成はモデル構築に4つのサブセット(80%)を使用し、検証用に1つのサブセット(20%)を予約し、この検証役割はすべてのフォールドで順番にローテーションされました。計算効率と性能最適化のバランスを取るため、ROC曲線下面積(AUC)指標に基づく動的早期停止が実装されました。この仕組みは、AUCの改善が3サイクル連続で0.001を下回った場合、個別モデルの改良と全体のAutoML検索プロセスの両方に適用され、トレーニングを一時停止しました。最終モデル選択では、トレーニングセットと検証セットの両方で最大平均AUCを示す構成を優先しつつ、これらのセット間で一貫したパフォーマンスとクロスバリデーション反復間でのメトリクス分散を最小限に抑えることが求められました。この統合的アプローチにより、厳格な検証プロトコルと自動最適化制約を通じて、最適な予測精度を確保しつつ強い一般化可能性を維持しました。

モデル性能評価と予測結果の解釈

モデルの性能および予測結果の解釈は、ROC曲線、F1スコア、SHapley加法説明(SHAP)解析を用いて包括的に評価されました。モデルの性能および予測結果の解釈は、ROC曲線、F1スコア、SHapley加法説明(SHAP)解析を用いて包括的に評価されました。当初は、訓練済みモデルを用いてテストデータセットに予測を生成し、正のクラス(すなわちクラス1)の予測確率を抽出しました(pred_prob)。ROC曲線はpROCパッケージを用いて構築され、モデルのAUCと95%信頼区間が計算されました。ROC曲線の最適閾値は、二値分類ラベルの決定においてユーデンのJ統計量(J = 感度 + 特異度−1)を用いて決定されました。ROC曲線から導き出されたこの閾値に基づき、予測確率は2値予測ラベル(0または1)に変換され、その後混同行列が生成されました。テストセットのF1スコアは混乱行列関数を用いて計算され、その可視化が作成され保存されました。さらに、温州医科大学第一附属病院からの独立した外部検証データセット(200件)でも検証されました。SHAP値は「shapviz」パッケージを用いて分析され、各変数がモデルの予測結果に与える影響を明らかにし、個々のNAFLD尤度予測の解釈に関する洞察を提供しました。

統計的手法

「統計解析とソフトウェア開発はRバージョン4.2.3(R Foundation for Statistical Computing、ウィーン、オーストリア)を使用して行われました。連続変数は、Shapiro-Wilk検定またはQ-Qプロットの目視検査を用いて当初正規性を評価しました。正規分布データは平均±標準偏差(SD)として提示され、独立した2つのグループ間の比較は独立した標本t検定を用いて行われました。複数群比較では、適切な場合に事後Tukey氏HSD検査と一方向ANOVAが用いられました。正規分布でない連続データは中央値[四分位数範囲(IQR)、P25–P75]として要約され、2つの独立したグループにはマン・ホイットニーU検定、複数グループにはクラスカル・ウォリス検定、必要に応じてダンの事後分析検定を用いて比較が行われました。カテゴリ変数は頻度とパーセンテージ(%)で表され、グループ間の割合比較は、期待細胞数が5未満の場合はカイ二乗検定(χ2 検定)またはフィッシャーの正確検定で分析されました。有意水準はα = 0.05(両側判定)に設定され、p値<0.05は統計的に有意とされました。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NAFLDの臨床的特徴

本研究では、NAFLD有無の個人の臨床的特徴を体系的に分析しました。これらの特徴の分布とサンプル母集団内での違いを明確に示すために、さまざまな手法が用いられました(表1)。分析には合計2,677人が含まれ、そのうち718人がNAFLDを有していました。分析はBMI、TG、GGT、UAなど、さまざまな臨床指標を対象としました( 図1参照)。臨床および代謝変数に対してPLS-DAを行うことで、NAFLD群と非NAFLD群の間に有意な分離が観察され(図2A)、これらの臨床的特徴がNAFLDと非NAFLDの区別に重要であることが示されました。さらに、ヒートマップ(図2B)では、NAFLD群内でWBC、NE、MO、RBC、UA、GGT、ALT、AST、TG、...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NAFLDは世界的に慢性肝疾患の最も一般的な原因であり、その有病率は毎年約1%増加しています26。世界人口の約30%が影響を受けており、NAFLDは慢性肝疾患の主要な疾患であるだけでなく、肝移植の適応症として最も急速に増加しています3 自動機械学習(AutoML)は医療分野で価値あるツールとして浮上しており、その主な目的の一つは入力特徴間の相関を特定して予測モデルを構築することです。増え続ける研究が、脂肪肝疾患の診断モデル開発におけるMLの大きな可能性を強調しています。本研究ではAutoML技術を効果的に活用し、NAFLDの診断モデルを構築しました。

NHANES 2017–2018データセットに厳格な診断および除外基準を適用することで、参加者を明確に定義されたNAFLD群と非NAFLD群に階層化しました。比較解析の結果、NAFLD群は従...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは利益相反がないと宣言しています。本研究では、ChatGPT-4(OpenAI)を特徴選択段階で知能的な分析ツールとして用い、LASSO回帰で特定された変数の臨床的関連性を評価しました。すべてのAI生成スコアは著者によって慎重に審査され、その後のAutoMLプロセスで実証的に検証されました。ChatGPT-4は生データの改変や数学的計算には使われていません。著者は最終結果の完全性と正確性について全責任を負います。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は福建医科大学科学研究スタートアップ基金[2021QH1176]の支援を受けました。浙江省臨床検査診断・トランスレーショナルリサーチ重点研究所[2022E10022];浙江省医医保健科学技術計画プロジェクト[2024KY1265];温州市基礎公共福祉研究プロジェクト[Y2023096]。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

```html

この記事で使用された材料の一覧
名前会社カタログ番号コメント
NAFLD(2017–2018)のためのデータセットNHANESデータベース[https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017]N/Aモデル構築のためのトレーニングセットとして
NAFLD(2018–2020)のためのデータセット温州医科大学第一附属病院(2018–2020年)、中国。[https://doi.org/10.6084/m9.figshare.32105248.]N/Aモデルの外部検証のためのテストセットとして
R(バージョン4.2.3)R統計計算財団N/A他のツールと併せてデータ分析を行い、視覚的・グラフィカルなプレゼンテーションを生成するために使用
Adobe Illustrator 2025(バージョン29.2)Adobe Systems IncorporatedN/A画像のレイアウトと編集用
ChatGPT-4OpenAI Inc.N/A各選択変数に重要度スコアを割り当てるために使用
H2O AutoML(3.44.0.3)H2O.aiN/A包括的な機械学習アルゴリズムセットを統合するために使用
```

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

233233JoVEAutoML

関連記事