本稿では、磁気共鳴画像法(MRI)シーケンスを用いて耳下腺腫瘍を正確に分類するための数ショットマルチモーダル深層学習フレームワークを提示します。
方法論記事
本稿では、磁気共鳴画像法(MRI)シーケンスを用いて耳下腺腫瘍を正確に分類するための数ショットマルチモーダル深層学習フレームワークを提示します。
良性と悪性耳下腺腫瘍の正確な鑑別は患者の予後に不可欠です。しかし、耳下腺腫瘍の多様性が非常に高く、画像診断データの入手も限られているため、術前診断は依然として大きな課題となっています。この問題に対処するため、本研究では小サンプル学習に基づくマルチモーダル深層学習フレームワークを提案します。このフレームワークは、多シーケンスのMRI情報を統合し、多スケールの空間注意メカニズムを組み込んで、サンプル数が限られている状況下で特徴抽出と分類性能を向上させます。このモデルは、組織病理学的に確定した原発耳下腺腫瘍を持つ198人の患者(良性107名、悪性91名)を用いて、先行治療なしで全術前MRIを受けた198名の後ろ向きコホートを用いて体系的に評価されました。コホートは患者レベルでトレーニング(70%)、検証(15%)、テスト(15%)に分けられ、良性と悪性の比率を保持し、相互排他的サブセットを確保しデータの漏洩を防ぎました。モデルは曲線下面積(AUC)を0.9822に達成しました。この発見は、良性腫瘍と悪性腫瘍を区別するシステムがいかに重要かを裏付けています。さらに、このモデルは経験豊富な放射線科医と比較して診断精度において大きな利点を示し、術前良性・悪性分化および耳下腺腫瘍の臨床的意思決定支援への応用可能性を強調しました。
疫学的データによると、耳下腺腫瘍の発生率は増加しています。耳下腺は人体最大の唾液腺であり、頭頸部腫瘍の発生率が高い部位の一つです。耳下腺腫瘍は比較的まれで、頭頸部腫瘍の約5%を占めますが、良性病変は悪性腫瘍をはるかに上回り、全耳下腺腫瘍の約80%を占めています。良性および悪性耳下腺腫瘍は、生物学的行動、治療戦略、予後において有意な違いを示します。良性腫瘍は通常、成長が遅く、広がりを見せ、転移は稀です。完全切除手術後は良好な結果が得られます。対照的に、悪性腫瘍は明確な侵襲的な成長パターンを示し、顔面神経、皮膚、骨などの周囲組織に侵入することが多いです。また、遠隔転移も可能であり、予後がより悪化します。
それにもかかわらず、良性と悪性耳下腺腫瘍の術前鑑別は依然として臨床診断上の課題です。特定の臨床症状がないため、ほとんどの耳下腺腫瘍の初期症状(悪性腫瘍の有無にかかわらず)は無痛の腫瘤であり、これは症状や兆候のみに基づく分化を複雑にします。痛みや顔面麻痺などの症状は悪性腫瘍の兆候と考えられがちですが、初期の悪性病変ではまれです。逆に、炎症反応を伴う良性腫瘍でも同様の症状を示すことがあります。耳下腺腫瘍の術前評価は主に画像診断によって行われ、これが主要な非侵襲的評価方法です。ただし、各画像診断手法には限界があることに注意が必要です。磁気共鳴画像法(MRI)は、その優れた軟部組織の解像度により、良性病変と悪性病変の識別において最大93%の精度を示す研究により、耳下腺腫瘍評価に最適な手法とされています8。しかし、従来型の配列は信号特性に有意な重複を示します。CTは主に骨の関与を評価するために用いられます。しかし、良性と悪性の腫瘍を区別する際にはMRIよりも感度が低い10,11。超音波検査は表在性病変の予備評価に有効な手法であり、しかし、その効果はオペレーターの専門知識に依存します。PET-CTは高い代謝感受性が特徴です。しかし、高コストと偽陽性率のため初期診断での使用が制限され、悪性腫瘍の病期診断や追跡観察により適しています。その結果、単一の画像診断法では正確な診断が難しいことが多く、良性病変と悪性病変の術前鑑別は通常、多様性情報の包括的な分析に依存します。
近年、人工知能(AI)分野、特に畳み込みニューラルネットワーク(CNN)に代表される深層学習(DL)技術の一部が、腫瘍画像診断の進歩に大きく貢献しています。これは、これらの技術がもたらす強力な画像特徴抽出およびパターン認識能力によるものです。ディープラーニングモデルは、多層ニューラルネットワークを通じて複雑なマルチスケール特徴を自動的に抽出し、手動の特徴設計への依存を大幅に減らしつつ、診断性能を向上させます。多くの研究がマルチモーダル医療画像技術における彼らの可能性を検証しています。Gu Jionghuiらは、乳房超音波とMRIを統合したマルチモーダル深層学習システムを開発し、 従来の方法を上回る効果を効果的に予測しました。Lu Gら14 は、超音波、マンモグラフィー、MRI画像と移転学習戦略を統合することで、良性乳がんと悪性乳腺腫瘍の正確な区別を達成し、AUCは0.947となりました。Horasan Aらは、ResNetおよびInceptionアーキテクチャを用いた3D CNNを用いた前立多重パラメータMRI(mpMRI)の融合解析を行い、 約91.3%の精度を達成しました。耳下腺イメージングにおいて、Zhang Gらは良性・悪性分化のための超音波と臨床データを統合した深層学習モデルを構築しました 。Hu XとWang H.17 は、CT画像に基づくaResNet50モデルを用いて92.3%の分類精度(AUC=0.96)を達成しました。これらの研究の総合的な証拠は、耳下腺やその他の固形腫瘍画像の解析にディープラーニングモデルを用いることの大きな利点を示しています。
しかし、従来の深層学習手法は最適なパフォーマンスを得るために大量のデータセットに依存することが多いです。耳下腺がんは低発生率の腫瘍であり、比較的限られたデータしか持っていません18。さらに、耳下腺腫瘍は信号強度、形態構造、周囲の腺組織との関係に複雑な変動を示す高い画像異質性を示します。これらの特徴は、腫瘍全体の形態や境界定義、内部信号の異質性や浸潤パターンといった局所的特徴など、多様な空間スケールにまたがるため、単一スケールや単純な特徴抽出法では良性病変と悪性病変の重要な区別を完全に捉えるのは困難です。さらに、過去の研究では単一のMRIシーケンス(例:構造的または機能的画像のみ)に依存することが多かったため、腫瘍の特徴を包括的に表現する能力が制限されており、これは先行研究19,20で報告されています。
これらの課題に対処するため、多シーケンスMRIと多スケールの空間注意メカニズムを統合した小サンプルマルチモーダルディープラーニングフレームワークが、限られたデータ条件下で良性および悪性耳下腺腫瘍を効果的に区別し、従来の手法や放射線科医の評価を上回る性能を発揮できると仮定します。具体的には、このフレームワークは、限られた数の代表的な良性および悪性症例から識別的特徴を学習するために、数発学習21 戦略を用いています。このモデルは空間的注意メカニズムを用いて主要な病変領域に焦点を合わせ、良性と悪性耳下腺腫瘍の識別精度を向上させています。このモデルは、当機関で病理学的に確認された耳下腺腫瘍を持つ198人の後ろ向きコホートを用いて評価されました。本研究は、形態的および機能的情報を支援するために、構造的(T1WI、T2WI)および機能的(DWI)MRIシーケンスを統合します。提案された枠組みは、良性腫瘍と悪性耳下腺腫瘍の術前識別を促進することを目的としています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本研究で使用されたすべての患者データは無錫人民病院で収集され、198件の病理的に確認された耳下腺腫瘍症例で構成されていました。本研究は無錫人民病院の機関審査委員会(IRB番号)により承認されました。KY24068)および制度のガイドラインおよび国際倫理基準に完全に従ったまま実施されます。すべてのデータは分析前に完全に匿名化されました。
MRI画像取得
すべてのMRIシーケンス(T1加重イメージング、T2加重イメージング、拡散加重画像)は、3.0テスラ製MRIスキャナー(シーメンスMAGNETOM、VerioまたはPrisma)で16チャンネルの頭頸コイルを使用して取得されました。取得パラメータは以下の通りです:T1加重画像はTR/TE = 500/15 ms、スライス厚さ=3 mm、行列=256 × 256、視野角=240 mmで取得されました。T2加重画像はTR/TE = 4000/90 ms、スライス厚さ=3 mm、行列=320 × 320、視野角=240 mmで取得されました。拡散加重画像はTR/TE = 5000/80 ms、B値=0および1000 s/mm2、スライス厚さ=3 mm、行列=128 × 128、視野角=240 mmで取得され、見かけの拡散係数マップが自動的に生成されました。すべての配列は軸面上で取得され、スライス間ギャップはありませんでした。
研究デザイン
この回顧的研究は、組織病理学的に確定した原発耳下腺腫瘍を持つ198人の患者(良性107名、悪性91名)の術前MRIデータを分析しました。全患者は、耳下腺病変に対する事前治療なしに、T1加重画像、T2加重画像、拡散加重画像検査を含む完全な耳下腺MRI検査を受けました。外科的切除標本やコア生検を基準としてください。選定基準は、組織病理学的に確認された原発耳下腺腫瘍、当院で利用可能なすべての必要配列を持つ術前MRI、そして耳下腺病変に対する手術、放射線療法、化学療法、焼灼術の既往歴なしでした。除外基準には、耳下腺への転移性腫瘍、著しい運動アーティファクトまたは画像が診断に不適切な不完全な配列、および前治療後の再発腫瘍が含まれていました。全体のコホートは、男性118名(59.6%)、女性80名(40.4%)で、年齢は26歳から89歳(平均標準差53.0歳±±12.8歳)で、腫瘍タイプ別に階層化された人口統計的特徴は以下の通りです:良性群(n=107)で男性59名(55.1%)、女性48名(44.9%)、年齢範囲28〜87歳(平均標準標準±54.2歳±12.1歳)、 悪性群(n=91)は男性59名(64.8%)、女性32名(35.2%)で、年齢は26歳から89歳(平均標準差51.6、13.4歳±±)です。階層化されたランダムサンプリング手法を用いて、198人の患者をトレーニング組(70%、n=138)、検証組(15%、n=30)、テスト組(15%、n=30)に分け、良性・悪性比率をすべてのサブセットで保持しました(検証セットと検査セットはそれぞれ16件の良性症例と14件悪性の症例を含みました)。分割はスライスごとや画像ごとのレベルではなく、患者レベルで行われました。 すべてのトレーニング、検証、テストセットが相互排他的で患者との重複がないようにすることで、データの漏洩を防ぎ、モデルの一般化可能性を偏りなく評価すること。
データ前処理
本研究では、すべてのMRI画像に対して、画像登録と再サンプリング、ノイズ除去、データ補正、正規化の4つの主要なステップを通じて標準化された前処理を実施しました。MRIプロトコルや患者の体位の違いに対応するため、すべてのT1WI、T2WI、DWI体積をまずT1WI配列に厳格登録し、トリリニア補間を用いて等方性1 mm3分解能にリサンプリングしました。その後、非局所平均(NLM)アルゴリズム22を用いてすべての登録体に対してノイズ除去を行い、平滑化パラメータは推定ノイズ標準偏差の0.8倍に自動的に設定され、探索ウィンドウは21×21×21ボクセル、類似ウィンドウは7×7×7ボクセルに設定されました。このアプローチは、重要な構造的詳細を保ちつつ、ランダムノイズを効果的に低減します。その後、効果的な訓練サンプルサイズを拡大し、モデルの一般化を改善し、限られたデータセットでの過学習を軽減するために、ランダム回転(±15°)やランダムスケーリング(0.9–1.1)23,24を含む複数のデータ拡張戦略が各訓練エポックの訓練セット画像にオンザフライで適用され、すべての変換は完全な再現性を確保するために固定されたランダムシード42を用いて生成されました。検証およびテストセットは、客観的なモデル評価を確保するために拡張されませんでした。最後に、異なるスキャン機器やセッション間で信号強度の体系的な変動を排除するため、平均を引いて標準偏差で割ったZスコア正規化を各ボリュームに適用し、その後正規化されたピクセル値はPyTorchディープラーニングフレームワーク25の入力要件を満たす範囲[0, 1]まで線形にスケールされました。
モデルアーキテクチャ
本研究は、複数のMRIシーケンス(T1加重イメージング、T2加重イメージング、拡散加重イメージング)からの補完情報を統合し、多スケール空間注意メカニズムを組み込むマルチスケール空間注意メカニズムを組み合わせ、限られたサンプル条件下で特徴表現と分類性能を向上させるマルチモーダルディープラーニングフレームワークを提案します。すべてのMRIボリュームは同じスキャナーで軸面上で取得されました。入力前に、配列間での空間的整列を確保するための厳格な登録を受け、アラインメントの質は上級放射線科医によって手動で検証され、耳腺病変を中心とした完全な3D体積は標準化された関心領域にトリミングされ、等方性分解能にリサンプリングされ、一貫した寸法にリサイズされました。少数ショット学習パラダイム、多スケール空間注意モジュール、チャネル間連結によるクロスモーダル特徴融合を組み合わせることで、このフレームワークはデータ希少環境でのモデル一般化に伴う課題に対処し、少数の注釈付きサンプルから判別特徴の堅牢な学習を可能にします。完全なアーキテクチャは 図1に示されています.データセットには198人の患者が含まれていますが、耳下腺腫瘍は画像の異質性が高く、注釈付き体積マルチモーダルデータは課題の複雑さに比べて比較的限定的であるため、限られたラベル付き例で実際の臨床シナリオをよりよくシミュレートできるため、少数発射方式が採用されています。従来の教師あり訓練法も比較のために評価され、少発射構成の利点は結果セクションのアブレーション研究で示されています。バックボーンネットワークは、Kinetics-400で事前学習済みのR3D-1826 (完全な時空間畳み込みを持つ3D ResNet-18バリアント)を、各MRIシーケンスの共有重み特徴抽出器として使用しています。適応中は、少数ショット分類のためにプロトタイプなネットワークヘッドが使用され、各モダリティ特有の枝の畳み込み段階の後にマルチスケール空間注意モジュールが挿入され、その後クロスモーダル融合と共有分類器が導入されます。提案された多スケール空間注意機構の新規性は、核サイズが1×1、3×3、5×5の並列畳み込み経路を用いる点にあります。これらの経路は異なる受容野で独立して空間注意マップを生成し、その後softmaxで正規化し、重み付き和によって入力特徴と適応的に融合させます。この設計は、内部信号の不均一性のような細かな局所的ディテールから、腫瘍縁や周囲組織との接点といったより広い文脈構造に至るまで、複数の空間スケールにわたる病変特性を明示的に捉え、従来の注意モジュールよりも優れた性能を提供します。微調整戦略は2段階で進みます。まず、事前学習済みのR3D-18のバックボーン層を凍結して一般的な時空的表象を保持し、注意モジュール、融合層、プロトタイプ頭部のみを訓練します。その後、各骨格の最後の2つの残留ブロック(レイヤー3とレイヤー4)を解凍し、MRI特異的な体積的特徴へのエンドツーエンド適応を可能にします。学習はAdam最適化器を用いて行われ、初期学習率は0.0001で、ステップ減衰スケジューリングにより20エポックごとに0.1倍に減少しました。モデルは100エポックのエピソード訓練を行い、8つのバッチサイズ(それぞれサポートセットとクエリセットを含む)を用いて、標準的な数ショットプロトコルと2方向Kショット構成(一次メタトレーニングと評価時にはK=5)を用いました。すべての実験は24GBメモリの高性能GPU上で行われ、データ分割、ウェイト初期化、拡張の際に固定されたランダムシード42が適用され、完全な再現性を確保しました。
耳下腺腫瘍分類のためのフューショット学習課題パラダイム
耳下腺腫瘍に関する高品質な注釈付きデータの入手が限られており、これらの病変の画像的異質性が高いことを考慮し、本研究は198人の患者を含むデータセットにもかかわらず、計量ベースの少数ショット学習パラダイムを採用しています。サポートセット–クエリセットのタスク構造は、臨床実践における診断推論プロセスをシミュレートするために用いられており、希少または異種の腫瘍サブタイプに対しては代表的な例がごくわずかしか存在しません。各トレーニングタスクはNウェイKショット形式(N=2、良性/悪性分類に対応し)で定義されており、少数のサンプルから識別的な特徴表現を学習できます。具体的には、各タスクに対して、サポートセットにはクラスごとにK個のマルチモーダルサンプル(T1加重イメージング、T2加重イメージング、拡散加重イメージング)が含まれ、クラスプロトタイプを構築するために含まれます。一方、クエリセットには分類すべきサンプルが含まれています。このモデルは、埋め込み空間におけるクエリサンプル特徴とクラスプロトタイプの類似性を計算することで距離指標に基づく分類決定を行います。この学習メカニズムは、大規模な注釈付きデータへの依存からモデルを解放し、データ不足の臨床現場での実用的応用により適している点で注目されます。直接比較のために、エピソード的な少ショットサンプリングを使わない全訓練セットを用いた従来型教師あり訓練法も評価され、限定サンプル条件下での一般化と安定性という点での少ショット構成の利点は、結果セクションで示されたアブレーション研究で定量的に示されています。
分類段階では、本研究は分類器としてプロトタイプなネットワークを用います。支持集合内の各カテゴリcに対して、プロトタイプベクトルp_cは埋め込み支持サンプルの平均として計算されます。
(1)
ここでf(·)は埋め込み関数(特徴抽出器)、
はカテゴリーcの第i番目の支持サンプル、Kはクラスごとのショット数を表します。
与えられたクエリサンプルxに対して、カテゴリcに属する確率は、負のユークリッド距離上のソフトマックス関数を用いて計算されます。
(2)
ここで d(·, ·) はユークリッド距離関数を表します。
マルチモーダル特徴融合に基づくアーキテクチャ
多シーケンスMRIデータの補完的な価値を最大限に活用するため、本研究はT1加重イメージング(T1WI)、T2加重イメージング(T2WI)、拡散加重イメージング(DWI)シーケンスを別々に処理する3分岐特徴融合ネットワークを設計しました。各シーケンスはまず、Kinetics-400データセット上で事前学習された共有重みのR3D-18モデルを用いて特徴抽出を受けます。その重みは公式のPyTorch TorchVision実装から得られます。適応過程では、事前学習済みのバックボーンの全層を最初に固定して一般的な時空的表現を保持し、マルチスケール空間注意モジュール、クロスモーダル融合層、プロトタイプネットワークヘッドのみを訓練し、その後各バックボーンの最後の2つの残留ブロック(レイヤー3とレイヤー4)を解凍してMRI特有の体積特性へのエンドツーエンド適応を行った。 前の層(レイヤー1とレイヤー2)はトレーニング中ずっと凍結されたままです。このネットワークは、空間的および時間的次元を横断する3D畳み込みカーネルを活用し、腫瘍の体積形態や空間的文脈情報を効果的に捉えます。特徴融合の際には、連結ベースのクロスモーダル戦略が用いられ、3つのモダリティからの注意強化特徴表現をチャネル次元に沿って連結して包括的なマルチモーダル特徴ベクトルを形成します。この融合アプローチは、T1WIの解剖学的明瞭さ、T2WIの組織組成感受性、DWIの細胞密度機能といった各モダリティの独自の情報を保持しつつ、診断情報の効果的な補完性を実現し、特徴発現の豊かさと識別力を大幅に向上させます。
多スケール空間注意メカニズム
本研究は、異なる空間スケールでの病変特性を捉えるために、多スケールの空間注意モジュールを組み込んでいます。図2に示すように、このモジュールは核サイズが1×1、3×3、5×5の並列畳み込み経路を採用しています。各経路は独立して空間注意マップを生成し、softmaxで正規化した後、重み付き総和によって入力特徴と適応的に融合されます。この設計により、良性と悪性病変の区別に関連性の高い領域に焦点を当て、無関係な背景領域の影響を軽減できます。その結果、画像内の注目マップが注目される部分を強調するのに役立つかもしれません。
データの利用可能性:
研究コホートからの完全匿名化されたマルチモーダルMRIシーケンス(T1WI、T2WI、DWI)の代表的なサブセットは、Zenodoリポジトリで公開されています:https://doi.org/10.5281/zenodo.17744149(バージョンv1)。これらのデータは、アクセス制限なしのクリエイティブ・コモンズ 表示4.0国際ライセンス(CC-BY 4.0)のもとで共有されています。完全な匿名化データセットはまだ一般公開されておらず、本原稿の正式な出版後に、機関および倫理的承認を条件にリポジトリの次回バージョンで公開される予定です。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
モデル性能概要
モデルの診断性能を評価するために、正確さ、精度、リコール、F1スコアなどの標準的な指標が用いられました。2方向5ショット構成の下で、R3D-18に基づくマルチモーダル少ショット学習モデルは、耳下腺腫瘍の分類テストセットで以下の結果を達成しました:精度96.88%、精度97.50%、想起率96.88%、F1スコア96.83%。図3Aに示された混同行列は、モデルがテストセット内の良性症例の93.75%と悪性症例の100%を正しく分類したことを示しています。これは良性の場合の偽陽性率6.25%、悪性の場合偽陰性がゼロに相当します。正確率97.50%は、陽性予測の中で偽陽性の割合が低いことを反映し、リコール値96.88%は実際の陽性の確率が高いことを示しています。F1スコアの96.83%は、精度とリコール性能のバランスの取れた指標を提供します。混乱行列の対角要素は対角外の要素よりもかなり大きく、これは観察された全体...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本研究では、多段階MRI(T1加重、T2加重、拡散加重画像)と多スケール空間注意メカニズムを統合したマルチモーダルの少数ショット深層学習フレームワークが、限られた注釈付きデータ条件下で良性および悪性耳下腺腫瘍を正確に区別し、従来の深層学習手法や経験豊富な放射線科医を上回る性能を発揮できると仮説を立てました。
実験結果はこの仮説を強く支持しています。独立テストセットでは、提案されたフレームワークは2方向5ショット構成でAUC0.9822、精度96.88%、精度97.50%、リコール率96.88%、F1スコア96.83%を達成しました。これらの指標は従来の3Dバックボーンネットワークや最先端の数ショット手法を大きく上回り、マルチモーダル融合およびマルチスケールアテンション設計の優位性を直接示しています。1発から5発への段階的なパフォーマンス向上は、限られたサンプルを活用する少ショット学習パラダイムの有効性をさらに裏付けています。さらに、単独AIモデルはジュニア(AUC 0.8242)およびシニア(AUC 0.8555)...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは競合する金融的または非財務的利害関係を一切表明していない。
本研究は中国国家自然科学基金(No.82473200)、江蘇省衛生委員会重点医学研究プロジェクト(No.K2023061)、および江蘇省衛生委員会高齢者健康プロジェクト(KLM2023019)からYJHに資金提供されました
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 大学院・CAM | https://github.com/jacobgil/pytorch-grad-cam | ||
| NumPy 1.25 | NumPy 開発者 | https://numpy.org/ | |
| パンダス 2.1 | パンダス開発者 | https://pandas.pydata.org/ | |
| パイチャーム | ジェットブレインズ | https://www.jetbrains.com/zh-cn/pycharm/ | |
| Python 3.10 | Pythonソフトウェア財団 | https://www.python.org/ | |
| パイトーチ 2.1 | メタ・プラットフォームズ社 | https://pytorch.org/ | |
| scikit-learn 1.3 | Scikit-learn開発者 | https://scikit-learn.org/ | |
| シャップ | https://github.com/slundberg/shap | ||
| シーメンス MAGNETOM プリズマ 3.0T 磁気共鳴画像システム | シーメンス・ヘルシニアーズ | https://www.siemens-healthineers.cn/magnetic-resonance-imaging/3t-mri-scanner/magnetom-prisma |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト