Research Article

予測的健康分析のための機械学習に基づくマルチモーダル分子バイオマーカー

DOI:

10.3791/69241

January 16th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

マルチモーダルバイオマーカーを用いた機械学習は、疾患の予測とモニタリングを強化し、正確な疾患予測を通じて医療成果を向上させるさまざまな分野での医療の進歩に期待を寄せています。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

毎年、世界中の多くの人々が心臓病、呼吸器感染症、神経機能障害、認知ストレス、がん、脳卒中、糖尿病などの壊滅的な健康問題に徐々に影響を受けており、それが深刻な健康合併症やそれに伴う異常を引き起こしています。したがって、早期の健康分析は標的治療によるタイムリーな介入を可能にし、即時の緩和と長期的な効果をもたらす可能性があり、病気の進行を遅らせる可能性があります。複雑な病態生理学的プロセスと多様な健康状態における臨床試験の多様性により、患者の健康結果を正確に検出・監視するためには、高感度で多様性のバイオマーカーと効果的な調査アプローチが求められています。したがって、予後、リスク評価、患者層分け、疾患モニタリングなど、さまざまなカテゴリや手法を持つ機械学習アルゴリズムが、アウトカム予測に考慮されています。提案された作業の流れは3つの段階に分かれており、第1段階ではケーススタディを通じて医療の重要性を定義し、その後に伝統的な機械学習(ML)アルゴリズム、従来のディープラーニング(DL)アプローチ、そして現代のDL技術(TabNetやAutoInt)が第2段階で行われます。最後に、結果を正当化するために実験が実施されます。この研究は、分子タンパク質、化学的、遺伝的バイオマーカーを新興の機械学習特徴と統合することでモダリティをグループ化することを強調しています。結果は提案された手法を用いた精度予測の大幅な向上を示しています。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

医療システムは、予測分析を活用して患者を監視し、健康結果をタイムリーに診断することで、積極的なケアを促進し患者の成果を向上させています。予測分析とバイオマーカーを統合することで、臨床医は診断の精度を高め、効果的な治療法を特定し、治療の進捗を監視し、疾患のメカニズムに関する貴重な洞察を得ることで、最終的にはより情報に基づいた効果的な治療決定につながります。バイオマーカーとは、バイオフルイド、組織、細胞、DNA、RNA、血液、尿などのサンプルに含まれる生物学的分子や指標の特徴を指し、人体における疾患の存在や進行を測定し、治療の効果を評価するのに役立ちます。

分子バイオマーカーの応用の進歩は、特定の分子を正確に測定して患者の独自の健康問題を特定し、初期段階から標的的を絞った治療戦略を可能にすることで、個別化医療において重要な役割を果たします今後は、マルチモーダルアプローチが複雑な疾患パターンの複数のモダリティを統合し、高度な予測分析技術を通じてがんや神経変性疾患の疾患予後をより正確に特定することを可能にします3。最先端の手法は、マルチオミクスデータ、バイオインフォマティクス、機械学習アルゴリズムを活用して新規バイオマーカーを特定し、心血管疾患(CVD)やその他の複雑な疾患に対する患者特有のリスクプロファイリングや主観的な治療戦略を可能にします分子バイオマーカーとマルチオミクス手法の組み合わせは、神経疾患における診断精度の向上と治療的層化に期待を秘めています5。

機械学習技術の進歩により、マルチモーダル分子バイオマーカーは多様なデータタイプを統合し、さまざまな健康状態における新しい疾患の特徴を特定することができ、より正確な診断と個別化された治療戦略が可能になります。この可能性を踏まえ、著者は医療におけるさまざまな機械学習技術を探り、疾患診断リスク要因を予測し、その重要性をさまざまな医療分野で強調しています。機器学習が疾患の診断と治療を変革する中、製薬機関は意思決定アルゴリズムを活用して患者の健康結果を分析し、日々のニーズに応えることで、より情報に基づいた効果的なケアを実現しています7.マルチモーダルデータ統合の必要性を活かし、本研究はマルチモーダルデータ(MRIおよび遺伝学)を用いてアルツハイマー病の発症と進行を予測するバイオマーカーを開発し、遺伝子データが正常な対照群における将来のアルツハイマー進行をよりよく予測し、MRIデータが安定した軽度認知障害をよりよく特徴づけ、両者を組み合わせてより高品質な分類性能を実現していることを示しました。

マルチモーダルデータ解析の応用をさらに進めるため、マルチモーダルディープラーニングは遺伝子発現データを活用して新規生物分子の特定の細胞株を標的とする薬剤を特定し、ゲノム変異が治療反応にどのように影響するかを明らかにしますマルチモーダルデータ解析の進歩と並行して、AIおよび機械学習指標を用いて評価される非侵襲的バイオマーカーは、特定の応用やデータ文脈に応じて特異性や感度プロファイルを持つ診断の有望なツールとして浮上しています。10。マルチモーダルデータ解析の重要性の高まりに合わせて、ディープラーニング(DL)アンサンブルモデルは遺伝子-タンパク質相互作用を含む新しいバイオマーカーを統合することで複雑なデータを効果的に扱い、がん研究の強化と治療戦略の最適化を可能にします。DLアンサンブルモデルががん研究を進展させる中で、予測分析は多様な健康状態を含む複数の情報源からの大量の集合データを分析し、リスク評価や診断など状態の包括的な概要を提供することで、疾患診断と治療において重要な役割を果たします。

提案されたプロトコルの目的は、異なる生物学的マーカーを統合するMLベースおよびDLベースのアルゴリズムを実装し、医療分析の精度を高めることです。バイオマーカーを利用する従来の予測手法は、通常単一モダリティデータや線形統計モデルに依存しており、疾患の発症や個人差に影響を与える複雑で非線形な関係を十分に捉えきれない場合があります。観察、e-ヘルス記録、検査室の測定、身体的測定、臨床評価からの膨大なデータの取り入れは、患者診断におけるリスク評価を統合・最適化する大きな機会を提供します。バイオマーカーは精密医療において重要な役割を果たし、適切なタイミングでの的確な治療を可能にします。バイオマーカーは複雑で疾患のサブタイプや分子増殖の測定に課題をもたらしますが、さまざまな異常条件下での毒性反応を評価する上で非常に貴重であり、さらなる解析を容易にします。臨床観察中にバイオマーカーを活用することで、医療従事者は疾患の進行をより正確に予測し、治療反応をモニタリングできます。最終的に、医療分析におけるマルチモーダル分子バイオマーカーとAIの融合により、既存の特性を一致させ、臨床への影響を軽減するより効果的なパターン認識が可能になります。

特にSomepalliらの研究14では、代謝データ、エピジェネティックデータ、プロテオームデータなどのゲノムデータに対してMLアルゴリズムを提案し、MLアルゴリズム選択の一般的なガイドラインを提案した最先端の手法と比較して、しかし、データの分析には制限があります。既存の研究15では、計算上の課題に焦点を当てた無監督積分手法がオミクスデータに適用されました。対照的に、手法の範囲や分析には限界があります。さらに、Huangらは多様な応用を分析するためのDL手法のほとんどをカバー し、ビッグデータと計算フレームワークの力を理解することを目指しました。欠点としては、データの不均衡、過学習、解釈の問題がありました。提案されたプロトコルは、統合バイオマーカー研究における重要なギャップを埋めるために極めて重要です。現行の技術では高次元かつ多様な生物学的データを効果的に組み合わせられていないためです。パターン認識、特徴選択、マルチモーダル融合に優れた高度な機械学習と言語学習を活用し、提案された提出物は早期診断、予後、個別治療の選択肢を強化する堅牢な予測シグネチャーを特定することを目指しています。このプロトコルは、バラエティバイオマーカー評価の限界に直接対応し、包括的でデータ駆動型のモデルを提示し、拡張可能で解釈可能かつ臨床的に関連性の高い健康予測を可能にします。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 実験的ワークフロー

図1 は、機械学習および深層学習技術を用いて分子バイオマーカーをリスクまたは診断適応のカテゴリーに分類するために設計された組織的かつモジュール化されたワークフローパイプラインを示しています。以下はそのプロセスの詳細なステップバイステップの説明です:

  1. データセット取得
    このデータセットは、分子バイオマーカーの厳選データベースであるMarkerDB 2.0から収集されています。
  2. データ前処理
    これにより、ヌル値や欠損エントリの処理、カテゴリカル特徴のエンコード(LabelEncoder)、数値特徴(例:entrez_gene_id)のスケーリングをStandardScalerで行うことで、データの品質と一貫性が保証されます。
  3. 特徴解析
    バイオマーカー分類に影響を与え、データの漏洩を防ぎ、モデル性能を向上させる関連特徴の選択が推奨されます。
  4. モデル開発
    使用されているアプローチはロジスティック回帰、ランダムフォレスト、XGBoostであり、DLではMLP、LRスケジューラ付きMLP、AutoInt、TabNetがあります。実施される活動は、分類タスクのためのハイパーパラメータ調整、クロスバリデーション、最適化です。
  5. データ分割
    ここでは、トレーニングセット(80%)がモデルパラメータの学習に、テストセット(20%)が未表示データでのモデル評価に使われます。最終段階では、評価指標を用いて、特に不均衡なクラスの状況において、業績が全体的に測定されるようにします。

figure-protocol-1
図1:提案された作業のフローダイアグラム。 提案された問題のワークフローはこの図に示されています。手順は、データ前処理、特徴量エンジニアリング、モデル開発、分割、指標を用いたモデル評価、バイオマーカー解析です。 この図の拡大版はこちらをクリックしてご覧ください。

2. データセットの説明

データセット名はcsv拡張でall_sequence_variantsされています。「id」「variation」「position」「external_link」「gene_symbol」「entrez_gene_id」「reference」「conditions」「indication_types」といった名前の列があり、idがint型、entrez_gene_idがfloat型である以外はすべてオブジェクトタイプです。行数は42,818行で、列は9つです。さらに、このデータセットには変動、位置、external_link、entrez_gene_id、参照、条件、indication_typesの無効化値が存在します。データセットは以下のリンクから取得しています:https://markerdb.ca/downloads17

3. データセットの前処理

この段階で、データの前処理はデータセット情報の収集、記述、重複の特定、欠損・無効値の特定から始まります。相関係数で測定してもexternal_link特徴の影響はなく、したがって除去されます。カテゴリカルカラムと数値カラムのヌル値は、それぞれ中央値と平均値で埋められます。最後に、入力と出力のデータセット形状は(42787, 6)(42787,)です。入力列は「id」「variation」「position」「gene_symbol」「entrez_gene_id」「conditions」で、ターゲット列はindication_typesです。

4. バイオマーカー:カテゴリー、データの課題、分子リスクの役割

バイオマーカーとは、さまざまな曝露や介入に対する正常または異常な生物学的活動や反応を示す定量化可能な形質です。バイオマーカーは分子的、組織学的、放射線学的、生理学的なものがあり、主に7つのカテゴリーに分けられます:(1) 診断バイオマーカーは、個人が特定の病気や障害を持っているかどうか、またはそれがサブタイプに該当するかを判断する、(2) モニタリングバイオマーカーは疾患の進行と治療への反応を示す、(3) 反応バイオマーカーは患者が薬物や治療に反応しているかどうかを示します。 例えば心拍数の変化、(4)予測バイオマーカーは個人が特定の病気を発症するリスクがあるかどうか、特定の治療にどのように反応するかを判断できる、(5)予後バイオマーカーは、患者が特定の健康結果に素因がある場合に病気の進行や再発の可能性を示す洞察を提供します。 (6) リスクバイオマーカーは、患者が正式な診断を受ける前に状態の潜在的リスクレベルを評価するものであり、(7) 安全性バイオマーカーは治療によって生じる可能性のある毒性または有害反応の可能性を評価します。本研究は主に 、図2に示すようにリスク評価および診断に関連する分子バイオマーカーの解析に焦点を当てています。世界中で利用可能な膨大な臨床データを考慮すると、バイオマーカーは臨床判断の導き、研究の進展、個別化医療の促進に不可欠です。

figure-protocol-2
図2:臨床意思決定のためのバイオマーカーカテゴリー。 バイオマーカーの決定はこの図に示されています。バイオマーカーに適用された分析に基づいて臨床判断が検討され、機械学習アルゴリズムが導入されます。 この図の拡大版はこちらをクリックしてご覧ください。

臨床的に有用なバイオマーカー情報を見つけ理解することは、バイオマーカーの種類、特徴、質が幅広く異なるため困難です。過去20年間のバイオマーカー研究の急速な増加は、特に分子バイオマーカーに関して包括的かつ最新のデータへのアクセスをさらに複雑にしています。これにより、一貫性のなさ、既存のバイオマーカーの重複性の再発見、矛盾した結果、確立されたバイオマーカーの活用機会の見落としといった問題が生じています。「オミクス」測定の登場はこの問題を悪化させ、臨床試験や文献で新規分子バイオマーカーが急増し、バイオマーカーの知識を効果的に活用することがますます困難になっています。

MarkerDB 2.0は実験目的で多様な分子バイオマーカーへのアクセスを提供します20.さまざまなバイオマーカーが臨床研究や医療分野で、病気の診断、予測、モニタリングに利用されています。その中でも、血清、血液、脳脊髄液(CSF)、腹膜液、羊水、血漿、尿などのバイオフルイドを用いて、糖尿病、結核、ダウン症、筋症関連疾患などの疾患を分析します。同様に、遺伝子バイオマーカーはLRP1、LPP、MAPT、SPI1などの遺伝子シンボルを用いて、加齢黄斑変性症、アレルギー疾患、アルツハイマー病、がん、喘息などの疾患を解析します。さらに、マルチモーダル分子バイオマーカーは患者リスクや診断指標の測定にも役立ちます21。この研究は、病気の診断、予測、個別化された治療を強化するために、機械学習手法を用いた医療分析の必要性を強調しています。

5. バイオマーカー発見のための統計的機械学習手法のモデリング

ML手法の応用は、医療分野を多方面で変革しました。具体的には、分子バイオマーカーは主成分解析(PCA)、K-meansクラスタリング(KMA)、近隣解析(NNA)、ニューラルネットワークアルゴリズムなど様々な機械学習技術を用いて解析されています。これらのモデルは、選択した特徴から複雑なパターンを特定し、不完全または一貫性のないデータを管理し、病気の進行をリアルタイムで追跡します。病気の診断に加え、MLアルゴリズムはデータ分析や可視化を通じて患者の問題に関する重要な洞察を提供し、迅速かつ的確なケアを可能にします。その結果、特殊な状況下でも患者の健康結果が向上します。さらに、分子バイオマーカーの解析を含む様々な疾患におけるバイオマーカー発見や治療効果を革新する機械学習の能力はますます活発になっています。

MLアルゴリズムは図3に示されているように、主に5つのタイプに分類されます。教師あり学習とは、ラベル付きデータセット上で入力と出力の関係を理解するための学習プロセスであり、決定木やサポートベクターマシンなどの分類や回帰などのタスクに最適です。教師ありなし学習はラベルのないデータ内のパターンを特定し、k平均クラスタリングや主成分分析などの手法でクラスタリングや次元削減にしばしば適用されます。セミ教師あり学習は、ラベル付きデータとラベルなしデータの両方を統合して予測を生成します。強化学習は環境からのフィードバックに基づく意思決定に焦点を当てており、Qラーニングや深層強化学習ネットワークなどの手法でゲームやロボティクスで頻繁に用いられています。ディープラーニングは、多層構造の人工ニューラルネットワークを用いてデータの複雑なパターンを特定します。この技術は、がん、脳卒中、アルツハイマー病、パーキンソン病などの一般的な疾患のバイオマーカーの予測に役立ちます。多くの臨床承認されたアプリケーションがこの技術を利用しています24,25。悪性腫瘍患者の正確な診断は通常、組織サンプルの取得と病理解析に依存し、組織学的グレード、サブタイプ、病期、その他さまざまな腫瘍バイオマーカーに関する重要な情報が得られます。

figure-protocol-3
図3:臨床意思決定のための機械学習アルゴリズムの分類。 図に示されたMLアルゴリズムの種類は、適用された手法を理解するために示されています。 この図の拡大版はこちらをクリックしてご覧ください。

統計学と機械学習は、頻繁に交差する別々の分野です。統計学はデータを収集、分析、解釈することを含み、通常はより小さく明確に定義されたデータセットを扱い、主に情報の比較と要約に焦点を当てています。一方、MLは予測モデルを作成する人工知能の一部であり、しばしば大規模で複雑なデータセットを扱います。統計学は確認的研究や基礎となるメカニズムの理解において重要な役割を果たしますが、機械学習は探索的研究や複雑なパターンの発見、欠落データの管理により効果的です。ロジスティック回帰のような手法は、統計モデルであると同時に教師ありMLモデルともみなされ、両領域の曖昧な区別を示しています。最終的に、研究者は研究目的とデータの性質を評価し、最適な方法を選択しなければなりません。

6. MLPのモデリングとそのバリエーション

MLPは多層パーセプトロンとも呼ばれ、 図4に示されているように、入力層と出力層の間に複数のニューロン層を持つニューラルネットワークアーキテクチャの一種です。MLPは1950年代に導入され、1980年代の逆伝播の進歩とともに広く利用され、損失を最小限に抑えるのに役立ちました。MLPの基本的な学習原理は、出力を計算するためのニューラルネット、重み、バイアス値です。最後に、出力層で出力を得るための活性化関数と閾値を知ること。提案された方法論では、入力層、隠れ層、出力層のノードが臨床および遺伝子特徴に対応し、ReLU活性化を持つ完全連結層、そしてS状結腸活性化を持つ単一のニューロンに対応し、それぞれ適応症(リスク、診断)タイプの二項結果を予測します。主な利点は、訓練と解釈が簡単であることです。しかし、単純なMLPは大規模なデータセットを扱えず、学習率に敏感です。したがって、これらの欠点を克服するために、 図3Bに示されたアーキテクチャで学習率スケジューラを用いたMLPを検討します。LRを用いたMLPは、急激な減衰、指数関数的減衰、逆時間減衰、ReduceLROnPlateau、コサインアニーリングを伴う強力な動的メカニズムです。固定されたLR値の代わりに、学習率はモデルのパフォーマンスやトレーニングに応じて変化します。

figure-protocol-4
図4:LRスケジューラを用いた多層PerceptronおよびMLPのモデリング。 (A) 多層パーセプトロン:MLPの構造は、入力層、隠れ層、出力層で示されます。第一層は入力を受け取り、第二層で活性化処理を行い、出力は最後の層で受け取ります。MLPは実装が簡単です。(B) LRスケジューラ付きのMLP:これはMLPに似ています。しかし、学習速度を制御するための学習速度スケジューラが追加され、収束率の向上を目指しています。学習率は停滞期で低下します。これによりオーバーシューティングの最小限が減少します。 この図の拡大版はこちらをクリックしてご覧ください。

この方法は表形式のデータに対してより効率的で信頼性が高く、効果的です。さらに、ノイズの多いデータに対する安定した収束改善、一般化の改善、ハイパーパラメータチューニングの手間軽減などの利点もあります。しかし、一部の予測課題では局所最小値で詰まるなどの困難が生じることがあります。さらに、図5に示された広範かつ深いMLPアーキテクチャでは、相関写像、ルールの暗記、新しいパターンの学習に優れ、高い一般化基準を維持するために、MLPに幅と深いコンポーネントが導入されています。これらの要素を出力層に組み合わせることで、2進出力は27と予測されます。しかし、見えない特徴の一般化や過度の一般化には限界があります。結論として、バッチノルムとドロップアウトを含むMLPは、学習や未知属性の一般化にドロップアウトを取り入れ、学習過程を正規化するために用いられます。特に、この手法は高次元データに適用でき、過学習の防止に役立ちます。しかしながら、この手法はバッチサイズの制限や(バッチ正規化層による)メモリ消費の増加、そして万能的な解決策ではありません(28,29)。

figure-protocol-5
図5:MLPワイドおよびディープネットワークのモデリング。 図はMLPの深い経路を示しており、非線形関係を捉え、出力とシグモイド単位を組み合わせて分類します。このアーキテクチャは、異種バイオマーカーデータのパターン学習と知識を捉えます。 この図の拡大版はこちらをクリックしてご覧ください。

7. タブネット

TabNetは、GoogleResearchチームによって開発されたTabular Networkとして知られるディープラーニングモデルです。TabNetモデルの主な動機は、画像、テキスト、音声(CNN、オートエンコーダー、トランスフォーマー)と木構造のML(XGBoost、ランダムフォレスト、LightGBM)アプローチのDLアプローチの違いを調和させることにあります。さらに、DLアプローチの限界はTabNetモデルに大きな影響を与え、MLPはパラメータ化モデルです。何よりも、DLアプローチは現実世界の問題における解釈、自己監督学習、逐次学習能力を欠いています。TabNetモデルは、保険リスク予測32、石炭灰含有量推定33、化学毒性予測34、教育試験不正検出35などの応用に限定されています。TabNetのアーキテクチャは 図6に示されています。

figure-protocol-6
図6:表状ネットワークのモデリング。 タブラーネットワークは入力特徴を表形式で取り、各ブロックでトランス技術を順番に適用します。GLUブロックはゲート線形単位ブロックとも呼ばれ、ネットワーク内の情報の流れを制御し、特徴選択と安定した学習を促進します。出力は累積された出力から出力層に表示されます。 この図の拡大版はこちらをクリックしてご覧ください。

上記のアーキテクチャ図から、システムは入力ブロック、共有特徴トランスフォーマー、逐次判定ステップ、そして最適化による損失計算の4つのコンポーネントに分割されています。カテゴリカル特徴では、埋め込み層の後に特徴が整数に変換されます。同時に、連続した特徴はそのまま取られています。最後に、特徴は x ∈ Rd.次のステップでは、活性化関数を持つ完全連結層を実装し、その後データをベクトルに変換し、決定が下されます。第3段階では、注意変換器、マスキング、意思決定変換器、予測蓄積を順に使用します。このステップの目的は選択的注意、順序的推論、意思決定経路です。最後のステップでは、二値クロスエントロピーや類似の手法を用いて損失を特定し、値を最適化します。さらに、過学習を防ぐためにスパースアテンションを用いて正則化が行われます。

8. オートイント

自己注意ニューラルネットワーク による 自動特徴相互作用学習(AutoInt)は、クリック率(CTR)予測36 で導入され、その後ソフトウェア欠陥予測37、推奨システム38、ゲノム検出39など様々な応用に応用されたAutoIntの完全な形態です。既存の機械学習アプローチには、高次元スパースデータの処理、高次組合せ特徴の扱い、予測における特徴量の理解、手動の特徴量エンジニアリングの必要性など、制約があります。これらすべての課題は、AutoIntモデルによって効率性、効果性、説明可能性をもって解決されています。提案された方法論におけるAutoIntの目的は、与えられた変異がリスク適応タイプか診断適応かを予測することです。図 6に示すように、与えられたデータセットに対して7つのステップが提案されており、ソースコードも示されています。まず、データの読み取りと前処理が実装され、すべてのカテゴリ特徴を整数としてエンコードし、リスクと診断のラベルをそれぞれ0と1にマッピングします。第2段階では、特徴表現を行い埋め込み行列を作成します。さらに、行列は数値特徴を正規化するために変換されます。トランスとの手動操作なしに、特徴間の中立的な自動相互作用が学習される相互作用層があります。さらに、複数の頭部が異なる種類の相互作用を学び、最終的に特徴が連結されて表現が強化されます。残差接続は、1特徴量、2特徴量、3特徴量など、低階・高階相互作用の両方を学習するために存在します。最後に、残差ネットワークから出力がシグモイド関数に渡され、図 7に示されるようにバイナリ値計算を行います。

figure-protocol-7
図7:AutoIntネットワークのモデリング。 AutoIntネットワークは特徴を自動的に学習し、埋め込み層は特徴を取り込み、自己注意機構と残留接続を用いて次の層にマッピングします。最後のコンポーネントにはMLP層と出力を生成する活性化関数があります。 この図の拡大版はこちらをクリックしてご覧ください。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

実験はMLおよびDL手法を用いて性能を比較しています。同時に、教師あり学習と教師なし学習の両方を利用する機械学習モデルの作成も検討されています。この手法で用いられる教師あり手法には、ロジスティック回帰、意思決定木、ランダムフォレスト、勾配ブースト、サポートベクターマシン、K近傍アルゴリズムがあります。これらのアルゴリズムは、単純な統計モデルから複雑な木構造解析まで多岐にわたります。一方、教師ありのMLアルゴリズムにはK平均クラスタリング、DBSCANクラスタリング、集約クラスタリングの技術があります。一方、使用されているディープラーニング技術は、シンプルなMLP、MLP + バッチ正規化+早期停止、ワイド&ディープネットワーク(タブラーハイブリッド)、および学習率スケジューラ付きMLP(上級)です。結果を解析する前に、モデルベースの置換重要度、SHapley加法的説明(SHAP)および局所解釈可能なモデル非依存的説明(LIME)手法を用いて特徴重要度を計算します。さらに、これらのアプローチはAdaboost技術のブラックボックスとして機能し、モデル間の関係性の理解、冗長...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

提案された研究は、病気とその特徴の特定とモニタリングにおけるバイオマーカーの重要性を明確に論じています。バイオマーカー手法の提案は、4つの重要なステップに基づいています:慎重なデータ準備(クリーニング、符号化、識別子の除去);均一ターゲット符号化(リスク=0、診断=1);AutoInt37やTabNetなどのモデルにおける特徴の正規化と高品質なディープ埋め込み;そして、評価プロセスの健全性(適切な訓練・試験区分、正確な指標報告)を確保。さらに、遺伝子を用いた疾患の適応はMLおよびDLアルゴリズムの支援を用いて予測されました。最も一般的に使われるMLアルゴリズムはデータセット上で実装され、アルゴリズムとデータセットの調整と効率性は上記のセクションの結果に沿ったものでした。さらに、MLP29、TabNet、AutoInt以外の新しいDLモデルもデータセットと共に解析され、モデルの動作は検討されたデータセットと同期されました。一方で、モデルは既存の研究を上回っており、結果もこの主張...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは何も明かすことはありません。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは外部からの資金援助を受けていません。

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AutoIntモデル北京大学https://github.com/shichence/AutoInt自己注意ニューラルネットワークによる自動特徴相互作用学習:(スパース)カテゴリおよび数値特徴の高次特徴相互作用を自動的に学習する効率的なアルゴリズム
deepctr_torch.モデルオープンソースhttps://github.com/shenweichen/DeepCTR-TorchディープラーニングベースのCTRモデルをモジュール化し拡張可能なパッケージで、独自のカスタムモデルを簡単に構築できます。
Google Colaboratoryグーグルhttps://colab.research.google.com/クラウドベース 機械学習やデータ分析のためにブラウザを通じてPythonコードを書き、実行するための環境
Keras 2.6.0ケラスhttps://keras.io/Tensorflow上で動作するニューラルネットワーク実行のためのPythonインターフェースを提供します
MarkerDB 2.0マーカーDBhttps://markerdb.ca/downloads公開可能な分子バイオマーカーデータベース
Matplotlib 3.4.3Matplotlib https://matplotlib.org/Python用の可視化ライブラリ
Numpy 1.21.4ナンピーhttps://numpy.org/Pythonを用いた科学計算のための基本パッケージ
パンダス 1.3.4パンダhttps://pandas.pydata.org/Pythonプログラミング言語の上に構築された、強力で柔軟かつ使いやすいオープンソースのデータ分析・操作ツールです。
Python 3.8.10Pythonソフトウェア財団https://www.python.org/ディープラーニングシステムをより効果的に統合する人気のプログラミング言語。
pytorch_tabnet.tab_modelパイトーチhttps://pypi.org/project/pytorch-tabnet/二値/多クラス分類および回帰問題の実装。
Scikit-learn(シキット学習)Scikit-learn(シキット学習)https://scikit-learn.org/stable/機械学習アルゴリズム用のPythonモジュール
シーボーンシーボーンhttps://seaborn.pydata.org/魅力的で情報豊富な統計グラフィックスを描画するための高レベルデータ可視化ライブラリ
タブネットモデルグーグルhttps://github.com/dreamquark-ai/tabnetTabNetは、表状データを直接扱うために設計されたエンドツーエンドのニューラルネットワークです
Tensorflow 2.6.0グーグルhttps://www.tensorflow.org/機械学習のためのエンドツーエンドプラットフォーム

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Mollarasouli, F., Bakirhan, N. K., Ozkan, S. A. Introduction to biomarkers. The detection of biomarkers. , Academic Press. 1-22 (2022).
  2. Doroszkiewicz, J., Groblewska, M., Mroczko, B. Molecular biomarkers and their implications for the early diagnosis of selected neurodegenerative diseases. Int J Mol Sci. 23 (9), 4610(2022).
  3. Steyaert, S., et al. Multimodal data fusion for cancer biomarker discovery with deep learning. Nat Mach Intell. 5 (4), 351-362 (2023).
  4. DeGroat, W., et al. Multimodal AI/ML for discovering novel biomarkers and predicting disease using multi-omics profiles of patients with cardiovascular diseases. Sci Rep. 14 (1), 26503(2024).
  5. Myrou, A., Barmpagiannos, K., Ioakimidou, A., Savopoulos, C. Molecular biomarkers in neurological diseases: advances in diagnosis and prognosis. Int J Mol Sci. 26 (5), 2231(2025).
  6. Bansal, A., Shukla, A. K., Bansal, S. Machine learning methods for predictive analytics in health care. Proc IEEE Int Conf Syst Modeling Adv Res Trends. , 258-262 (2021).
  7. Adeghe, E. P., Okolo, C. A., Ojeyinka, O. T. A review of the use of machine learning in predictive analytics for patient health outcomes in pharmacy practice. OARJ Life Sci. 7 (1), 052-058 (2024).
  8. Mirabnahrazam, G., et al. Machine learning based multimodal neuroimaging genomics dementia score for predicting future conversion to Alzheimer's disease. J Alzheimers Dis. 87 (3), 1345-1365 (2022).
  9. Taj, F., Stein, L. D. MMDRP: drug response prediction and biomarker discovery using multimodal deep learning. Bioinform Adv. 4 (1), vbae010(2024).
  10. Lazaros, K., et al. Non-invasive biomarkers in the era of big data and machine learning. Sens. 25 (5), 1396(2025).
  11. Mathema, V. B., Sen, P., Lamichhane, S., Orešič, M., Khoomrung, S. Deep learning facilitates multi-data type analysis and predictive biomarker discovery in cancer precision medicine. Comput Struct Biotechnol J. 21, 1372-1382 (2023).
  12. Pearson, T. A., et al. Precision health analytics with predictive analytics and implementation research: JACC state-of-the-art review. JACC. 76 (3), 306-320 (2020).
  13. Parvin, N., Joo, S. W., Jung, J. H., Mandal, T. K. Multimodal AI in biomedicine: Pioneering the future of biomaterials, diagnostics, and personalized healthcare. Nanomaterials. 15 (12), 895(2025).
  14. Somepalli, G., Goldblum, M., Schwarzschild, A., Bruss, C. B., Goldstein, T. SAINT: Improved neural networks for tabular data via row attention and contrastive pre-training. arXiv. , (2021).
  15. Libbrecht, M. W., Noble, W. S. Machine learning applications in genetics and genomics. Nat Rev Genet. 16 (6), 321-332 (2015).
  16. Huang, S., Chaudhary, K., Garmire, L. X. More is better: Recent progress in multi-omics data integration methods. Front Genet. 8, 84(2017).
  17. Li, Y., Huang, C., Ding, L., Li, Z., Pan, Y., Gao, X. Deep learning in bioinformatics: introduction, application, and perspective in the big data era. Methods. 166, 4-21 (2019).
  18. Frangogiannis, N. G. Biomarkers: Hopes and challenges in the path from discovery to clinical practice. Transl Res. 159 (4), 197-204 (2012).
  19. Frantzi, M., et al. Omics-derived biomarkers and novel drug targets for improved intervention in advanced prostate cancer. Diagn. 10 (9), 658(2020).
  20. Jackson, H., et al. MarkerDB 2.0: A comprehensive molecular biomarker database for 2025. Nucleic Acids Res. 53, D1415-D1426 (2025).
  21. DeGroat, W., et al. IntelliGenes: A novel machine learning pipeline for biomarker discovery and predictive analysis using multi-genomic profiles. Bioinform. 39 (12), btad755(2023).
  22. Thelagathoti, R. K., et al. A hybrid sequential feature selection approach for identifying new potential mRNA biomarkers for Usher syndrome using machine learning. Biomol. 15 (7), 963(2025).
  23. Ng, S., Masarone, S., Watson, D., Barnes, M. R. The benefits and pitfalls of machine learning for biomarker discovery. Cell Tissue Res. 394 (1), 17-31 (2023).
  24. Chudzik, A., Śledzianowski, A., Przybyszewski, A. W. Machine learning and digital biomarkers can detect early stages of neurodegenerative diseases. Sens. 24 (5), 1572(2024).
  25. Chang, C. H., Lin, C. H., Lane, H. Y. Machine learning and novel biomarkers for the diagnosis of Alzheimer's disease. Int J Mol Sci. 22 (5), 2761(2021).
  26. Bzdo, D., Altman, N., Krzywinski, M. Statistics versus machine learning. Nat Methods. 15 (4), 233-234 (2018).
  27. Bikku, T. Multi-layered deep learning perceptron approach for health risk prediction. J Big Data. 7 (1), 50(2020).
  28. Smith, L. N. A disciplined approach to neural network hyper-parameters: part 1-learning rate, batch size, momentum, and weight decay. arXiv. , (2018).
  29. Kim, T. Generalizing MLPs with dropouts, batch normalization, and skip connections. arXiv. , (2021).
  30. Chen, G., Chen, P., Shi, Y., Hsieh, C. Y., Liao, B., Zhang, S. Rethinking the usage of batch normalization and dropout in the training of deep neural networks. arXiv. , (2019).
  31. Arik, S. Ö, Pfister, T. Tabnet: attentive interpretable tabular learning. Proc AAAI Conf Artif Intell. 35 (8), 6679-6687 (2021).
  32. Qamar, T., Bawany, N. Z. Understanding the black-box: towards interpretable and reliable deep learning models. PeerJ Comput Sci. 9, e1629(2023).
  33. McDonnell, K., Murphy, F., Sheehan, B., Masello, L., Castignani, G. Deep learning in insurance: accuracy and model interpretability using TabNet. Expert Syst Appl. 217, 119543(2023).
  34. Zhou, M., Wen, Z., Xu, G., Zhang, Z., Zhou, C. Deep learning with TabNet: Rapid coal ash content estimation via X-ray fluorescence. Int J Coal Prep Util. 45 (3), 523-547 (2025).
  35. Mustafa, F. M., et al. TabNet and TabTransformer: Novel deep learning models for chemical toxicity prediction in comparison with machine learning. J Appl Toxicol. , (2025).
  36. Zhen, Y., Zhu, X. An ensemble learning approach based on TabNet and machine learning models for cheating detection in educational tests. Educ Psychol Meas. 84 (4), 780-809 (2024).
  37. Song, W., et al. Autoint: Automatic feature interaction learning via self-attentive neural networks. Proc ACM Int Conf Inf Knowl Manage. , 1161-1170 (2019).
  38. Jadhav, S., Manikandan, S., Ryu, D. Enhancing the software defect prediction using AutoInt. IEEE Int Conf Big Data Smart Comput. , 103-104 (2025).
  39. He, H., Zhang, R., Zhang, Y., Ren, J. AAIN: Attentional aggregative interaction network for deep learning based recommender systems. Neurocomputing. 547, 126374(2023).
  40. Fan, Y., Waldmann, P. Tabular deep learning: A comparative study applied to multi-task genome-wide prediction. BMC Bioinform. 25 (1), 22(2024).
  41. Kanász, R., Drotár, P., Gnip, P., Zoričák, M. Clash of titans on imbalanced data: TabNet vs XGBoost. Conf IEEE Trans Artif. , 320-325 (2024).
  42. Hwang, Y., Song, J. Recent deep learning methods for tabular data. Commun Stat Appl Methods. 30 (2), 215-226 (2023).
  43. Gorishniy, Y., et al. TabR: Tabular deep learning meets nearest neighbors in 2023. arXiv. , (2023).
  44. Kalidindi, A., Arrama, M. B. A TabTransformer based model for detecting botnet-attacks on internet of things using deep learning. J Theor Appl Inf Technol. 101 (13), 5206-5218 (2023).
  45. Holzmüller, D., Grinsztajn, L., Steinwart, I. RealMLP: Advancing MLPs and default parameters for tabular data. ELLIS Workshop on Representation Learning and Generative Models for Structured Data. , (2025).
  46. Zhu, B., et al. Xtab: cross-table pretraining for tabular transformers. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Machine Learning BiomarkersMultimodal BiomarkersPredictive Health AnalyticsMolecular BiomarkersDisease MonitoringRisk AssessmentPatient StratificationDeep Learning TechniquesProtein BiomarkersGenetic Biomarkers

Related Articles