方法論記事

医療画像セグメンテーションのためのマルチビュービジョンマンバU字型ネットワークフレームワーク

DOI:

10.3791/72616

2026年8月7日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このプロトコルは、医療画像セグメンテーションのためのマルチビューVision Mamba U型ネットワークフレームワークの構築、トレーニング、評価方法を説明し、標準化されたデータセットの準備、モデル実装、パフォーマンス評価を通じて皮膚病変や腹部臓器の再現可能なセグメンテーションを可能にします。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

医療画像セグメンテーションは、グローバルな文脈、局所的な境界、多スケールの解剖学的構造を正確に捉えつつ、異なる応用間で再現性を保つ計算手法を必要とします。本記事では、2次元医療画像セグメンテーションのためのマルチビュービジョン・マンバU型ネットワークフレームワークの構築、トレーニング、評価のためのプロトコルを提示します。このプロトコルは、公開データセットの取得、画像およびマスクの前処理、ネットワーク構築、モデルトレーニング、チェックポイント選択、定量的および定性的のパフォーマンス評価を含む再現可能なワークフローを提供します。このフレームワークはマルチビュー特徴スキャンを組み込み、空間的、等高線、スケール、境界情報を補完的に捉え、U字型エンコーダ-デコーダアーキテクチャ内で多段階の特徴融合を適用して、セグメンテーション中の特徴統合を向上させます。このプロトコルは、公開されている皮膚病変および腹部臓器のセグメンテーションデータセットを用いて実証されています。説明された実装ワークフローの下で、フレームワークは標準評価指標を用いて競争力のあるセグメンテーション性能を達成しています。このプロトコルで示された手順に従うことで、研究者はモデル実装を再現し、定義された実験設定でネットワークを訓練し、セグメンテーションの性能を評価し、再現可能な深層学習ベースの解析を必要とする関連する医療画像セグメンテーションタスクに対応できるようになっています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

医療画像セグメンテーションは、コンピュータビジョンおよび医療画像解析の分野で基本的な課題です1,2,3。画像を複数の領域やオブジェクトに分割し、さらなる分析と処理を行うことを含みます。この技術は特に医療画像において重要であり、臨床医が病理領域を特定し局所化するのを支援し、診断の正確性と治療計画を向上させます。MRI(磁気共鳴画像法)、CT(コンピュータ断層撮影)、陽電子断層撮影(PET)などの医療画像技術の進歩に伴い、正確な医療画像セグメンテーション技術の需要は増加し続けています。現在の医療画像セグメンテーション手法は大きく分けて3つのアプローチに分類できます:畳み込みニューラルネットワーク(CNN)ベースの手法4、トランスフォーマーベースの手法5、そして状態空間モデル(SSM)ベースの手法6,7CNNベースの手法では、医療画像のセグメンテーションに通常U字型ネットワークアーキテクチャが用いられます。このカテゴリで最も広く使われているアーキテクチャはU-Net8であり、生体医学画像セグメンテーションにおけるU字型エンコーダ–デコーダアーキテクチャの有効性を示しました。U-Net3+は、UNet++9の高密度スキップ接続とフルスケールスキップ接続を組み合わせ、マルチスケールの特徴集約を強化します。しかし、CNNベースの手法は長距離依存関係を捉える能力が限られており、長期の文脈情報を効果的にモデル化できない可能性があります。

トランスを基盤とした手法は自己注意メカニズムを通じて長距離依存関係を効果的に捉え、並列計算を可能にし、異なる関心領域に異なる注意の重みを割り当てます。UNETR++10 はパラメータ数と計算コストを減らすために効率的なペアアテンション(EPA)モジュールを導入しています。nnFormer11 は、インターリーブド畳み込み演算と自己注意演算を組み合わせ、三次元(3D)医療画像セグメンテーションにおける体積表現学習のための局所的・グローバルな体積ベースの自己注意メカニズムを導入します。H2Former12 は、注意メカニズムとCNNベースの特徴抽出をエンコーダ内で組み合わせた効率的な階層的ハイブリッドビジョントランスフォーマーを提案します。しかし、トランスフォーマーベースの手法は、列の長さが増加するにつれて計算複雑さが二次に増加し、計算コストが大幅に増加します。 図1 はMVM-UNetの動機を示し、提案されたマルチビュースキャニング戦略と既存のSSMベースのセグメンテーションフレームワークを比較しています。

figure-introduction-1
図1。MVM-UNetと既存の純粋状態空間モデル(SSM)ベースのセグメンテーションアーキテクチャとの比較。 従来の純粋状態空間モデル(SSM)ベースのセグメンテーションフレームワークと提案されたマルチビューマンバU-Net(MVM-UNet)アーキテクチャとの比較。上部パネルはMVM-UNetを示しており、マルチビュー4方向(MV4D)モジュールがジグザグ、階層的、スパイラル、ラジアルスキャンペアを用いて補完的な特徴を抽出し、これらは空間融合マンバ(SFusion Mamba)によって統合されます。一方、マルチステージ融合マンバ(MFusion Mamba)は復号前にマルチスケールエンコーダの特徴を集約します。下のパネルは、選択的スキャン2次元(SS2D)モジュールを用いたクロススキャンを用いた代表的な純粋SSMベースのアーキテクチャを示しています。図は、従来のSSMベースのセグメンテーションネットワークと提案されているMVM-UNetとのアーキテクチャ上の違いを示しています。 この図の拡大版はこちらをクリックしてご覧ください。

SSMベースの手法は、トランスフォーマーのグローバルモデリング能力と線形計算複雑性を組み合わせています。マンバアーキテクチャは選択的状態空間モデル(Selective-SSM)を用いて入力情報を選択的に処理し、モデルは入力に応じてパラメータを動的に調整しつつ、無関係な情報をフィルタリングし、有益な特徴を強調できます。Vim13 とVMamba14 は、Mambaアーキテクチャをコンピュータビジョンのタスクに適応させています。U-Mamba15 は医療画像セグメンテーションにおけるSSMの応用を探るためにハイブリッドなCNN–SSMアーキテクチャを採用していますが、Mamba-UNet16 は医療画像セグメンテーションに完全SSMベースのエンコーダ–デコーダアーキテクチャを採用しています。これらの手法は、大幅に少ないパラメータを使いながら競争力のある性能を達成しています。しかし、現在のSSM/マンバベースの手法は、単純な画像パッチやSS2Dスキャン戦略を用いて画像特徴を抽出しており、医療画像セグメンテーションにはいくつかの制約があります。まず、SS2Dおよびパッチベースの技術は主に一般的なコンピュータビジョン作業向けに設計されています。Local Mamba17 およびMotion Mamba18 は、SS2Dスキャン戦略はすべての視覚的タスクに不十分であると示唆しています。なぜなら、異なるスキャニング戦略が異なる種類の視覚情報を捉えるからです。第二に、SS2Dスキャン戦略は比較的単純で、水平および垂直のスキャン方向のみに依存します。そのため、複雑な空間的関係や細かい構造的ディテールを十分に捉えきれない場合があります。医療画像セグメンテーションは、グローバルな空間的文脈と正確な局所的解剖学的特徴の両方を同時にモデリングする必要があります。さらに、現在のSSM/Mambaベースの手法は、エンコーダとデコーダ間の限定的な特徴融合を提供します。UNet++やFATNetなどのアーキテクチャは、特徴融合の強化を通じてセグメンテーションの精度を向上させ、医療画像セグメンテーションにおける効果的な特徴統合の重要性を強調しています。

これらの制約に対処するため、本論文はMVM-UNetと呼ばれる新しいMambaベースの医療画像セグメンテーションフレームワークを提案します。 図1に示すように、提案されているマルチビュー四方向(MV4D)モジュールはMVM-UNetの中核的な特徴抽出コンポーネントであり、4つの異なるスキャン戦略から情報を統合することで医療画像セグメンテーションに特化して設計されています。各走査戦略は補完的な画像特徴を抽出し、入力画像の異なるビューを表現します。ジグザグ走査19 は、各行または列の末尾で移動方向を交互に行うことで、局所的およびグローバルな空間情報のバランスを取っています。これに対し、螺旋および放射状スキャン方式20 は、中心から外側または周辺部から内側に伸びることで包括的なカバレッジを提供します。階層的スキャン18 は、局所的およびグローバルな特徴を複数のスケールで捉えます。各走査戦略の堅牢性を高めるために、S6ブロックに入力する前にスキャンペアをマージします。Scan-view Fusion Mamba(SFusion Mamba)モジュールは、4つのスキャンモダリティから抽出された特徴を統合します。マルチスケールエンコーダの特徴を効果的に活用するために、本論文ではマルチスケールマンバ融合モジュール(MFusion Mamba)を提案します。これは各エンコーダ段階の出力を蓄積・融合させ、融合した特徴をデコーダに渡します。MVM-UNetはISIC 2017、ISIC 2018、Synapseデータセットで評価されました。実験結果により、MVM-UNetはISIC 2017、ISIC 2018、Synapseデータセットにおいて競争力のあるセグメンテーション性能を達成していることが示されています。

代表的なセグメンテーションアーキテクチャは、医療画像セグメンテーションをさらに進化させています。U-Netはまた、細胞計数、検出、形態計測21などの生物医学画像解析にも成功裏に応用されています。CA-Net22のような注意強化型CNNアーキテクチャは、包括的な注意メカニズムを通じて特徴表現を向上させます。TransUNet23、Pyramid Medical Transformer24、Swin U-Net25、TransAttUNet26、TransCUNet27などの代表的なトランスフォーマーベースのセグメンテーションフレームワークは、医療画像セグメンテーションにおける注意ベースのグローバル特徴モデリングの有効性をさらに示しています。

MVM-UNetの設計は、既存のSSM/Mambaベースのセグメンテーション手法の2つの限界に動機づけられています。まず、多くの現在のVision Mambaモデルは単純な二次元スキャン技術に依存しており、不規則な病変境界、小さな標的領域、多スケール解剖構造を含む医療画像には不十分かもしれません。第二に、従来のU字型エンコーダ–デコーダアーキテクチャは主に対応するスキップ接続を通じて特徴を転送するため、復号時に多段階エンコーダ情報の直接的な使用を制限しています。そのため、MVM-UNetはマルチビュー空間モデリングを強化するためにMV4Dを導入し、マルチステージエンコーダ機能を明示的に集約するMFusion Mambaを導入しています。この設計は、マンバベースの長距離モデリングを医療画像セグメンテーションの特定の要件に適応させることを意図しています。

MVM-UNetは一般的なエンコーダー–デコーダパラダイムとマンバベースのシーケンスモデリングに基づいていますが、その新規性はこれらのコンポーネントが医療画像セグメンテーションに適応・統合される点にあります。標準的なマンバブロックをU字型ネットワークバックボーンに単に組み込むのではなく、提案されたフレームワークは複数のタスク指向スキャンペアブランチを通じて空間モデリングプロセスを再設計し、SFusion Mambaを導入してスキャン固有の表現を統合し、MVVブロックを残留および投影経路で強化し、MFusion Mambaをエンコーダとデコーダの間に挿入して多段エンコーダの特徴を集約してから復号します。このアーキテクチャレベルの設計は、医療画像で一般的に見られる不規則な境界、小さなターゲット領域、多スケールの解剖構造に対応することを目的としています。

このプロトコルは、長距離の文脈情報、不規則な物体境界、多スケールの解剖構造を同時にモデリングする必要があるセグメンテーション作業に最も適しています。CNNベースのセグメンテーション手法と比較して、マンバベースのエンコーダ–デコーダ設計は、医療画像セグメンテーション研究者に馴染みのあるU字型ワークフローを維持しつつ、効果的なコンテキストモデリング機構を提供します。トランスフォーマーベースの手法と比較して、提案されたフレームワークは二次的自己注意の直接的な使用を避けており、比較的効率的なシーケンスモデリング機構を用いたグローバルな文脈モデリングを目指す研究者を対象としています。したがって、このプロトコルは皮膚病変の断片、腹部臓器の断片、そして全体的な構造情報と局所境界の詳細の両方が重要な二次元医療画像の分割作業に適しています。

このプロトコルには使用前に考慮すべき制限もあります。軽量CNNがすでに十分な性能を提供する比較的単純なセグメンテーション作業には必ずしも必要とは限りません。さらに、建築的適応なしに完全な三次元体積セグメンテーションを直接設計しているわけではありません。注釈付きデータが非常に限られている研究者、GPUリソースが限られている場合、または高度に解釈可能な古典モデルの要件がある場合も、プロトコルを適用する前にこれらの制約を考慮する必要があります。全体として、この手法は長距離文脈モデリング、局所境界表現、多段階の特徴融合をバランスよく組み合わせたマンバベースのU字型セグメンテーションフレームワークを再現・評価しようとする研究者を対象としています。

主な貢献は以下の通りです。

1. 本論文は、MVM-UNetと呼ばれる新しいマンバベースの医療画像セグメンテーションフレームワークを提示します。既存のSS2Dベースや標準的なMambaブロックを直接組み込む手法とは異なり、MVM-UNetはMV4Dを導入し、ジグザグスキャン、階層スキャン、スパイラルスキャン、放射スキャンを含む4つの補完的なスキャンペアビューから医療画像の特徴をモデル化します。

2. 本論文はSFusion MambaとMVVブロックを設計し、スキャン固有の表現を統合し特徴変換を強化する。SFusion Mambaは異なるスキャンペア枝から抽出された特徴を融合させ、MVVブロック内の残差枝とアップダウン投影枝は、特徴表現を安定化・豊かにする補完的な特徴経路を提供します。

3. 本論文では、MFusion Mambaをエンコーダとデコーダ間の中間多段融合モジュールとして紹介します。従来のスキップ接続が主に対応する段階の特徴を転送するのとは異なり、MFusion Mambaは粗い段階から細かい融合まで多段エンコーダの特徴を明示的に集約し、復号のための豊富な情報を提供します。

4. 広範な実験結果により、提案されたMVM-UNetはISIC 2017およびISIC 2018データセットで競争力のあるセグメンテーション性能を達成し、Synapseの多臓器セグメンテーションデータセットでも高い性能を達成しています。さらに、包括的なアブレーション研究により、MVM-UNetにおける各成分の貢献が検証されています。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究では、ISIC 2017、ISIC 2018、Synapseを含む公開されている医療画像データセットのみを使用しました。本研究では新たなヒト参加者、動物被験者、または特定可能な民間医療記録は収集されませんでした。本研究で使用されたISIC 2017データセットは、国際皮膚イメージング協働チャレンジデータリポジトリ(https://challenge.isic-archive.com/data/#2017)から取得したISIC 2017チャレンジ皮膚病変セグメンテーションデータセットです。本研究で使用されたデータセットバージョンは、ISIC 2017の病変分割タスクに対応しており、公式のトレーニング、検証、テストの分割を含みます。データセットは2024年3月15日にダウンロードされました。本研究で使用されたISIC 2018データセットは、公式の国際皮膚イメージング協働チャレンジデータリポジトリ(https://challenge.isic-archive.com/data/#2018)から取得したISIC 2018チャレンジタスク1の病変境界分割データセットです。本研究で使用されたデータセットのバージョンは、ISIC 2018のタスク1:病変境界分割に対応しています。データセットは2024年7月8日にダウンロードされました。

本研究で使用されたシナプスデータセットは、Synapseリポジトリから取得したマルチアトラス・ラベリング・ビヨンド・ザ・クラニアル・ヴォール腹部CTデータセットで、accession identifier syn3193805(https://www.synapse.org/Synapse:syn3193805)で取得されました。本研究で使用されたデータセットは、一般的に使用されている30件の腹部CT多臓器分割データセットに対応しています。ダウンロードされたアーカイブはAbdomen/RawData.zipで、accession syn3193805で入手可能でした。ダウンロード時点には、リポジトリから別途バージョン番号、リリースラベル、または日付表示のタグは提供されていませんでした。以前の研究で採用された標準的な分割に従い、18ケースがトレーニングに、12ケースがテストに使用されました。データ分割はTransUNet23が使用した症例リストに従っていました。具体的には、トレーニングケースはcase0031、case0007、case0009、case0005、case0026、case0039、case0024、case0034、case0033、case0030、case0023、case0040、case0010、case0021、case0006、case0027、case0028、case0037であり、テストケースはcase0008、case0022、case0038、case0036、case0032、case0002、case0029、case0003、case0001、case0004、case0025、case0035でした。データセットは2024年7月9日にダウンロードされました。本研究は公開されている非識別データセットのみを使用し、新たなヒト被験者データや特定可能な個人情報の収集を伴わなかったため、本プロトコルで記述された計算実験には機関審査委員会の承認は必要ありませんでした。正式な機関による免除決定は得られませんでした。地域の機関方針で求められる場合、研究者は公開データセットの二次分析を行う前に機関免除の判断を得るべきです。本研究に関しては、機関倫理の免除参照番号や正式な免除書類は提供されていませんでした。

1. データセットの準備

  1. ISIC 2017の皮膚病変セグメンテーションデータセットは、国際皮膚イメージングコラボレーションの公式リポジトリからダウンロードできます。公式のトレーニング、検証、テストパーティションを使ってください。データセットに2,000枚のトレーニング画像、150枚の検証画像、600枚のテスト画像が含まれていることを確認してください。
  2. ISIC 2018の皮膚病変セグメンテーションデータセットは、国際皮膚イメージング協働の公式リポジトリからダウンロードできます。公式のトレーニング、検証、テストパーティションを使ってください。セグメンテーションデータセットに2,594枚のトレーニング画像、100枚の検証画像、1,000枚のテスト画像が含まれていることを確認します。
  3. シナプス多臓器セグメンテーションデータセットをダウンロードしてください。トレーニングには18ケース(2,212軸方向スライス)、テストには12ケース(1,567軸方向スライス)からなる標準スプリットを使用します。別途検証セットを導入しないでください。
    1. 12件の検査ケースは最終評価専用に予約してください。テストケースはモデルトレーニング、ハイパーパラメータチューニング、モデル選択に使わないでください。分割課題には、大動脈、胆嚢、脾臓、左腎臓、右腎臓、肝臓、膵臓、胃の8つの腹部臓器が含まれます。
    2. 以下のSynapseデータセットの分割をご利用ください。18の訓練ケースは、case0031、case0007、case0009、case0005、case0026、case0039、case0024、case0034、case0033、case0030、case0023、case0040、case0010、case0021、case0006、case0027、case0028、case0037です。12件の検査ケースは、case0008、case0022、case0038、case0036、case0032、case0002、case0029、case0003、case0001、case0004、case0025、case0035でした。
  4. 各データセットを画像とマスクのフォルダに整理してください。各画像に対応するセグメンテーションマスクが同じケース識別子を持つことを確認してください。
    1. 各皮膚病変マスクを二進の前景-背景分割マップに変換します。Synapseデータセットの元の多クラス器官ラベルを保持してください。
    2. ISIC 2017およびISIC 2018のデータセットでは、バイナリマスク変換後に背景ピクセルにラベル値が0、病変(前景)ピクセルに1を割り当てます。元のマスク値が0より大きいピクセルは前景として1に変換されますが、元のマスク値が0のピクセルは背景として扱われ、0のまま保持されます。Synapseデータセットでは、元の整数ラベル値を保持し、0は背景クラス、1から8は前景の8つのオルガンクラスを表します。
  5. ISIC 2017およびISIC 2018の画像とマスクを元のアスペクト比を保持せずに256×256ピクセルにリサイズします。クロッピングやパッドは適用しないでください。
    1. 各Synapse CTスライスと対応するラベルを224ピクセル×224ピクセルにリサイズします。RGB画像にはバイリニア補間、CTスライスには三次スプライン補間、セグメンテーションマスクには近傍補間を用います。
    2. Pythonで画像のサイズを調整できます。
      1. ISIC 2017およびISIC 2018のデータセットでは、utils.py で実装されたカスタムのmyResize変換を使用し、torchvision.transforms.functional.resizeを呼び出して画像とマスクテンソルの両方を256ピクセル×256ピクセルにリサイズします。この変換において明示的な補間モードやアンチエイリアシングの引数を指定しないでください。
      2. Synapseデータセットについては、datasets/dataset.py でscipy.ndimage.zoomを使ってください。CT画像のスライスを3次スプライン補間(次数=3)で224×224ピクセルにリサイズし、ラベルマップのサイズは最近傍補間(次数=0)でリサイズします。リサイズ時には別のアンチエイリアシング操作やanti_aliasing=True設定を適用しないでください。
  6. テンソル変換前に、各ISIC RGB画像を、データ特有の平均および標準偏差(SD)を用いて、式 1 を用いて次のように正規化します。
    figure-protocol-1(1)
    次に、最小最大正規化を用いて正規化画像を0–255の範囲に再スケールします。
    1. ISIC 2017のトレーニングセットにはμ = 159.922および σ = 28.871、ISIC 2017の検証およびテストセットにはμ = 148.429およびσ = 25.748を用いてください。ISIC 2018の学習セットにはμ = 157.561およびσ = 26.706、ISIC 2018の検証およびテストセットにはμ = 149.034およびσ = 32.022を用いてください。
    2. 各正規化された画像を形3×256×256のテンソルに変換します。各2値マスクを形1 × 256 × 256のテンソルに変換します。
    3. データセットごとの平均および標準偏差正規化後、各画像ごとに独立して最小最大正規化を行います。具体的には、各画像からデータセット固有の平均を差し引き、対応する標準偏差で割ります。
    4. 正規化された画像から最小および最大強度値を計算し、これらの画像ごとの最小値と最大値を用いて0–255の範囲に再スケールします。この最小最大リスケーリングステップにはデータセット全体の最小値および最大値を使用しないでください。
  7. 各Synapse CTスライスを二次元のグレースケール画像として準備します。各CTスライスをfloat32に変換し、シングルトンチャネル次元を加えることで、形1×224×224の入力テンソルが得られます。
    1. 各Synapseラベルマップは、形状224×224の単一チャネル整数マスクとして保持します。データローダーで追加のデータセットレベルの平均標準差正規化を適用しないでください。
    2. トレーニングスライスには.npz形式で、ボリュームテストには.npy.h5形式で提供されている前処理されたSynapseファイルを使用してください。トレーニング中は各.npzファイルから直接画像とラベル配列を読み込み、テスト中は各.npy.h5ファイルから直接読み込みます。公開データローダーでは、追加の強度クリッピング、CTウィンドウ、データセットレベルの正規化、生体積リサンプリングを適用しないでください。
    3. モデルトレーニング中、読み込んだ各2次元スライスをfloat32に変換し、scipy.ndimage.zoomを使って画像スライスは次数=3、ラベルマップは順序=0で目標空間サイズにリサイズし、その後リサイズ配列をシングルトンチャネル次元のテンソルに変換します。
  8. データ拡張はトレーニングセットにのみ適用してください。ISIC 2017およびISIC 2018では、0°から360°の角度でランダムな水平反転(p = 0.5)、ランダムな垂直反転(p = 0.5)、ランダム回転(p = 0.5)を適用します。
    1. 各画像マスクペアに同じ幾何学的変換を適用します。検証およびテスト中は、リサイズ、正規化、テンソル変換のみを適用してください。
    2. Synapseデータセットでは、トレーニング中にランダム回転とランダム反転を適用してください。各画像ラベルペアを 90°(ここで k∈{0,1,2,3})ランダムに回転させるか、あるいは画像ラベルペアを空間軸に沿ってランダムに反転させるか、−20°から20°までの角度で画像ラベルペアをランダムに回転させます。
    3. テスト中は確率増強を適用しないでください。
    4. RandomGenerator変換で実装された相互排他的分岐を用いてSynapseデータセットにデータ拡張を適用します。
      1. 各トレーニングサンプルに対して、まず条件random.random()>0.5を評価します。この条件が満たされた場合、random_rot_flipを適用します。これはランダムな90°回転(k = 0, 1, 2, または3)の後、空間軸に沿ってランダムに反転するものです。
      2. 最初の枝が選択されない場合は、2つ目の条件であるrandom.random()>0.5を評価します。この条件が満たされれば、−20°から20°の間でランダムに選ばれた回転角を使ってrandom_rotateを適用します。いずれの条件も満たされない場合は、サンプルに確率的増強を適用しないでください。
      3. 入力画像と対応するラベルマップの両方に同じ変換を適用します。
  9. データセットの読み込み、前処理、トレーニング前にランダムシードを設定してください。主な比較実験にはランダムシード1、52、100を使用し、特に指定がない限りアブレーション研究にはシード100を使用してください。
    1. データローダーを構築する前に、Python、NumPy、PyTorch CPU、PyTorch CUDA、cuDNNのランダムジェネレーターを初期化してください。すべてのシードランでデータセットのパーティション、前処理手順、拡張設定、正規化パラメータ、リサイズ戦略、評価前処理は変更せずに保ちます。
    2. ISICおよびSynapse実験の両方でnum_workers = 0を設定し、メインプロセスでデータロードを行います。データセットを構築しDataLoaderを作成する前に、set_seed関数を使ってグローバルランダムシードを初期化し、Python、NumPy、PyTorch CPU、PyTorch CUDA、cuDNNの乱数ジェネレーターをシードします。リリースされた実装では使われていないため、別途worker_init_fnやDataLoader固有のランダムジェネレーターを定義しないでください。

2. MVM-UNetアーキテクチャの構築

  1. 提案されたマルチビュービジョン・マンバUNet(MVM-UNet)をU字型のエンコーダ-デコーダアーキテクチャで構築します。
  2. 入力画像の寸法をH × W × 3に設定します。入力画像をパッチ埋め込みレイヤーに通します。
    1. パッチ埋め込み層を、カーネルサイズ4 × 4、ストライド4、入力チャンネル3、出力チャンネル96の2次元畳み込みを用いて実装します。
    2. 入力特徴マップを空間分解能H/4 × W/4に変換し、C = 96の出力チャネルを備えます。
  3. 4つのエンコーダステージと4つのデコーダステージを構築します。各エンコーダ段階ごとに空間分解能を半分にし、チャネル寸法を2倍にします。
  4. 対称エンコーダ-デコーダ構成を用いてください。エンコーダとデコーダの両方でMVVブロックの数を{2, 2, 2, 2}に設定します。
    1. 各エンコーダステージに2つのMVVブロックを、各デコーダーステージに2つのMVVブロックを配置します。
  5. すべてのエンコーダとデコーダの段階にMVVブロックを挿入します。MV4Dモジュールを各MVVブロック内のコア特徴抽出モジュールとして使用してください。
  6. MFusion Mambaモジュールをエンコーダとデコーダの間に挿入します。このモジュールを使って、復号前に多段エンコーダ機能を融合させてください。
  7. MVM-UNet全体のワークフローを設定してください。エンコーダ全体で特徴抽出にはMV4Dを使いましょう。
    1. エンコーダ出力はスキップ接続として保持してください。エンコーダの出力を対応するデコーダ段階にパスします。
    2. デコード前にエンコーダー機能をMFusion Mambaに渡します。フュージョン表現をデコーダで段階的にアップサンプリングし、セグメンテーションヘッドを使って最終的なセグメンテーションマップを生成します。
  8. 入力画像 Iを∈RB×H×W× 3をパッチ埋め込み層に通すと、 figure-protocol-2 ここでC = 96が得られます。
    1. エンコーダーの特徴マップを生成する: E1 ∈ RB×H/4×W/4×CE2 ∈ RB×H/8×W/8×2CE3 ∈ RB×H/16×W/16×4CE4 R B×H/32×W/32×8C。すべてのエンコーダ段階にMV4Dを含むMVVブロックを使用してください。
    2. 対応するスキップ接続のすべてのエンコーダ機能を保持します。すべてのエンコーダ機能をMFusion Mambaに渡してマルチステージの機能融合を行います。
    3. MFusion Mamba内で粗い融合と細かい融合を行う前に、エンコーダの特徴を共通の特徴空間に整列させます。融合した表現をデコーダに渡します。
    4. デコーダ表現を段階的にアップサンプリングします。デコーダ機能をE3をH/16×W/16、E2をH/8×W/8、E1をH/4×W/4に融合させます。
    5. 最終的なデコーダ機能を元の画像解像度にアップサンプリングします。RB×H×W×Kfigure-protocol-3 ∈予測マップを生成します。ここで、二元病変断節ではK = 1、シナプス多臓器断片ではK = 8です。
    6. 全体のネットワークアーキテクチャについては 図2 、各段階の操作、主要パラメータ、出力機能寸法を含む層別アーキテクチャ仕様は 補足表1 を参照してください
    7. エンコーダ–デコーダ遷移層
      1. ダウンサンプルエンコーダはパッチマージ遷移層を用いた機能です。各遷移に対して、2×2近傍から空間的に交差した4つの特徴群をサンプリングし、チャネル次元に沿って連結し、レイヤー正規化(LayerNorm)を適用し、得られた4C次元特徴をバイアスフリー線形層を用いて2Cチャネルに投影します。この操作により空間分解能は2倍に低下し、チャネル次元は2倍になります。
      2. アップサンプルデコーダはパッチ拡張遷移層を用いた機能です。バイアスフリーの線形射影を適用し、拡張した特徴を空間的に再配置して分解能を2倍にし、空間展開後にレイヤーノルムを適用します。この操作を繰り返し、H/32からW/32×H/16、H/8××W/8、H/4×W/4へと段階的に特徴マップを再構築します。
      3. MFusion Mambaモジュール内のエンコーダの特徴を、双線形補間(align_corners = False)を用いてターゲットの空間分解能にリサイズし、特徴融合前に学習可能な線形チャネル投影を適用します。
    8. セグメンテーションヘッド
      1. 最終的なデコーダの特徴マップを、最終的なハッキロ拡大レイヤーを用いてH/4×W/4から元の画像解像度(H×W)にアップサンプリングします。線形射影を適用し、展開係数4で空間再配置を行い、レイヤーノルムを適用します。
      2. テンソルをチャネルファースト形式に変換した後、1 × 1畳み込みを用いて再構成された特徴マップをKの出力チャネルに投影します。
      3. 評価時に、二項病変断節にはS状結腸活性化関数を適用し、シナプス多臓器断片にはソフトマックス活性化後にargmaxを適用して最終予測を生成します。セグメンテーションヘッド自体にアクティベーション関数を適用しないでください。

figure-protocol-4
図2。マルチビューマンバU-Net(MVM-UNet)の全体アーキテクチャ。 提案されたマルチビューマンバU-Net(MVM-UNet)アーキテクチャの概要。入力画像はパッチ埋め込みに変換され、マルチビュービジョン(MVV)ブロックで構成される4つのエンコーダ段階を通過し、パッチマージ操作で分離されます。エンコーダの機能はマルチステージフュージョンマンバ(MFusion Mamba)によって集約され、スキップ接続を通じてデコーダに伝播されます。デコーダはパッチ拡張操作を用いて空間解像度を段階的に復元し、投影層を通じて最終的なセグメンテーションマップを生成します。 この図の拡大版はこちらをクリックしてご覧ください。

3. MV4Dモジュールの構築

  1. MVVブロックの基本特徴抽出ユニットとしてMV4Dモジュールを使用します。入力特徴パッチを4つのスキャンペアブランチに入力します。空間平坦化、スキャンペアインデックス構築、シーケンス収集、S6/Mamba処理、逆空間再順序付け、スキャンペア融合、SFusion Mamba融合、射影、出力再形成の完全な疑似コードについては、 アルゴリズム1、補足ファイル1 を参照してください。
  2. モデル/mvmunet/core.py で実装されている正確なジグザグ、階層、スパイラル、ラジアルスキャンインデックス生成手順を使用してください。各走査戦略では、順方向走査順序と逆走順を1つの双方向スキャンペアとして使用します。
  3. ジグザグスキャンペアを構築します。画像を各行や列の終わりに交互方向に走らせます。このスキャンパターンを使って、局所的とグローバルな空間情報をバランスよく調整します。
  4. 階層的なスキャンペアを構築します。複数の空間スケールでのキャプチャ特徴。このスキャンパターンを使って、局所表現とグローバル表現の両方の抽出を強化しましょう。
  5. スパイラルスキャンペアを構築します。画像の特徴を中心から境界方向、または境界から中心方向にスキャンします。このスキャンパターンを使って、グローバルな輪郭情報の抽出を強化しましょう。
  6. 放射状スキャンペアを構築します。複数の放射方向に沿った画像特徴をスキャンします。このスキャンパターンを使って、局所的な境界やエッジの詳細抽出を強化しましょう。
  7. マージしたシーケンスをS6ブロックに入力する前に、各スキャンペアをマージしてください。ペア設計を活用することで、各走査戦略の堅牢性を向上させつつ計算効率を維持しましょう。
  8. 各スキャンペアの出力シーケンスをS6ブロックに送ります。ジグザグ、階層的、螺旋、放射状のスキャン図に対応する4つの特徴表現を得ます。
  9. 抽出した4つの特徴表現をSFusion Mambaモジュールで融合します。2つの並行した融合経路を使いましょう。最初の経路では、要素ごとに加算によって4つの特徴を積分します。
  10. 第二のSFusion Mambaパスでは、4つの特徴を連結します。Conv1dとMambaを用いて連結表現を処理します。チャンネルの寸法を投影層で減らし、S6ブロックの出力寸法に合わせます。
  11. モデル次元として特徴次元Cを使ってS6/Mambaブロックを設定します。投影レイヤーを使って、融合前の各合成スキャンペア特徴をチャネル次元Cにマッピングします。
  12. SFusion Mambaでは、最初の経路で要素ごとの加算を行います。Conv1d、Mamba、線形射影の前の2つの経路で4つのスキャンビュー特徴を連結します。ステップ4で説明されているMV4Dを取り巻く正規化、線形射影、深さごとの分離可能な畳み込み、活性化操作を活用してください。
  13. 2つの融合経路の出力を合計してMV4Dモジュールの最終出力を得る。
  14. 水平・垂直走査方向だけを使うのではなく、4つの補完的なスキャンペア分岐を構築しましょう。ジグザグ走査で連続的な空間移動を重視し、階層的走査で多スケール表現を強化し、スパイラル走査で中心から境界までの等高線情報を取得し、ラジアル走査で境界指向の局所詳細抽出を強化します。
  15. 各スキャンペアの分岐を独立して処理します。SFusion Mambaを使って得られた特徴を融合させます。処理済みの各配列を融合前の元の空間順序にマッピングします。
  16. 入力特徴写像X∈RB×H×W×Cが与えられ、それをRB×L×CXの∈順序に平坦化し、L = H × W
  17. 各スキャンペア分岐の走査インデックスに従ってフラットな配列を再配置します。再順序付けされた各配列をS6ブロックで処理します。処理済みのシーケンスを元の空間順序に戻します。
  18. 4つのスキャンビュー特徴を加法経路とSFusion Mamba経路に融合させ、最終的なMV4D出力を得る。MV4Dアーキテクチャについては 図3 、テンソルレベルの実装ワークフロー全体については アルゴリズム1、補足ファイル1 を参照してください。
  19. モデル/mvmunet/core.py で完全なソフトウェア実装を使用してください。このファイルにはスキャンインデックスジェネレーター、PairwiseScanMamba、SequenceS6、SFusion Mamba、そしてMV4Dラッパーモジュールが含まれています。
  20. マルチビュースキャンインデックスを生成する
    1. models/mvmunet/core.py でリリースされた実装に従ってスキャンインデックスを生成してください。空間サイズH×Wの入力特徴マップに対して、各ピクセル位置を1次元インデックスに平坦化します。次の方法でインデックス=r×W + c。ここで、rとcはそれぞれ行座標と列座標を表します。
    2. 画像の対角線を一定のr+cで走査してジグザグスキャンを生成します。各対角線の有効なピクセルインデックスを集め、偶数の対角線の順序を逆にして移動方向を交互にします。
    3. 画像を再帰的に4つの象限に分割して階層的スキャンを生成します。左上、右上、左下、右下の四分円を順に訪れ、サブリージョンの高さまたは幅が2ピクセル以下になるまで進み、残りのピクセルを行長順に走査します。
    4. スパイラルスキャンは、画像の外側境界を上行に沿って左から右へ、右列に沿って下へ、下行を右から左へ、左列に沿って上向きに進みながら、画像中央に向かって境界を徐々に縮小させることで生成します。
    5. 各ピクセルを画像中心からの二乗距離でソートし、atan2関数で計算した極角に従って半径スキャンを生成します。
    6. 対応する順方向スキャンの順序を逆にして、各走査戦略ごとに逆走査を生成します。順方向および後方スキャンシーケンスを組み合わせて、各スキャン戦略ごとに1組のスキャンペアを形成し、その後MV4Dモジュールにスキャンペアを渡します。

figure-protocol-5
図3。マルチビュー4方向(MV4D)モジュールのアーキテクチャ。 マルチビュー4方向(MV4D)特徴抽出モジュールの構造。入力パッチは、ジグザグ、階層、スパイラル、ラジアルスキャンを含む4つの補完的なスキャンペアブランチを通じて処理されます。4つの枝から抽出された特徴は統合され、状態空間ブロックで処理され、Spatial Fusion Mamba(SFusion Mamba)によって統合されて出力の特徴表現が生成されます。 この図の拡大版はこちらをクリックしてご覧ください。

4. MVV棟の建設

  1. MVVブロックは1つの主支線と2つの補助支線を使って建設します。 図4に示された全体的な構造を活用してください。
  2. メインブランチの入力特徴にレイヤー正規化を適用します。正規化された特徴を線形層に送り込みます。変換された特徴量を深さごとに分離可能な畳み込みに渡します。
  3. 変換された特徴量は深さごとに分離可能な畳み込みを用いて処理します。GELUアクティベーション関数を適用してください。起動した機能をMV4Dモジュールに入力してください。
  4. 最初の補助枝を単位残留接続として構築します。入力機能を最終出力に直接接続します。この枝を使って元の表現を保存し、訓練を安定させましょう。
  5. 2番目の補助枝を投影下上分岐として構成します。入力特徴をダウンプロジェクションレイヤーで圧縮します。上投影レイヤーを使って特徴寸法を復元します。
  6. メインブランチと両方の補助ブランチの出力を統合します。最終的なMVVブロック出力を取得してください。完全なアーキテクチャについては図4を参照してください。
  7. メインブランチの隠れ次元を入力チャネル次元 Cs に等しく設定します。主な線形投影の前にLayerNorm(Cs)を適用し、次元CCsの線形レイヤーを使用します。深さごとに分離可能な畳み込みを用います。これは、3×3の深さ方向畳み込み(パディング1、群=Cs、バイアスなし)、続いて1×1の点ごとの畳み込み(バイアスなし)からなる畳み込みです。
  8. 深さごとに分離可能な畳み込みの後にGELU活性化関数を適用します。活性化した特徴をMV4Dに入力し、次元CsCsの出力線形投影を適用します。LayerNorm(Cs)、射影比4、ダウンプロジェクションCのsCs/4、GELUの活性化、および上向きの投影C/4→Csを用いて投影を構成します。
  9. 単位単位加算を用いて、同一分岐、投影下アップ分岐、ドロップパス処理主分岐を組み合わせて最終的なMVVブロック出力を得る。

figure-protocol-6
図4。マルチビュービジョン(MVV)ブロックのアーキテクチャ。 マルチビュービジョン(MVV)ブロックの構造。このブロックは、マルチビュー4方向(MV4D)モジュールと、深さごとの畳み込み、正規化、線形射影層を含むメイン特徴抽出ブランチで構成されています。補助的な上下投影分岐は、残差加算による要素ごとの乗算によるゲート付き特徴変調を提供し、出力特徴表現を生成します。 この図の拡大版はこちらをクリックしてご覧ください。

5. MFusion Mambaの建設

  1. すべてのエンコーダーステージから特徴マップを集めてください。必要に応じてエンコーダの特徴をリサイズや投影で統一された表現空間に整列させます。テンソルレベルの実装ワークフローについては 、アルゴリズム2、補足ファイル1 を参照してください。
  2. 必要に応じてエンコーダの特徴を目標の空間分解能に合わせてリサイズします。異なるチャネル寸法を持つ特徴を同じチャネル寸法に投影します。マルチステージ融合前にすべてのエンコーダー機能を整列させます。
  3. アラインドされたエンコーダーの機能を粗獌(Coarse Fusion)コンポーネントに入力します。ハダマール積を用いて粗核融合を行います。粗い融合表現を生成します。
  4. 粗い融合表現をファインフュージョンコンポーネントに入力します。2本の平行な微細融合経路を構築します。両方の経路を独立して処理します。
  5. 最初のファインフュージョン経路を線形層で処理します。2つ目のファインフュージョン経路は、アッププロジェクション、コンヴワンデッド、マンバ、ダウンプロジェクションを用いて処理します。下投影後に特徴寸法を復元します。
  6. ハダマー積を用いて、2つの微細融合経路の出力を統合します。最終線形レイヤーを適用します。MFusion Mamba出力を取得してください。
  7. MFusion Mambaの出力をデコーダーに入力します。フューズされた多段表現とエンコーダ-デコーダのスキップ機能を組み合わせて復号します。最終的なセグメンテーションマップを生成します。
  8. 粗い融合の前に、異なる段階のエンコーダ機能を統一された特徴空間に整列させます。整列した特徴表現を粗核および細かい融合段階で処理します。MFusion Mambaアーキテクチャについては 図5 、テンソルレベルの実装ワークフロー全体については補足アルゴリズム2を参照してください。
  9. MFusion Mambaの実装パラメータは以下のように使用してください。各エンコーダ機能 Eiに対して、チャネル次元を Ci から Ctに投影します。必要に応じてalign_corners=Falseを用いて、目標空間サイズに投影した特徴をリサイズします。
  10. アラインドされたエンコーダの特徴に粗い融合を行うために、Hadamard積を適用します。最初のファインフュージョン経路は、寸法Ct→Ctの線形層を用いて構成します。2番目のファインフュージョン経路は、2Ct→アッププロジェクション Ct コンv1d、モデル次元 2Ct、1方向走査方向、状態次元 16 のダウンプロジェクション 2Ct Ct を用いて構成します。
  11. ハダマール積を使って微細融合経路の出力を融合させます。次元 Ct から Ct への最終線形射影を適用します。融合した多段表現をデコーダに入力します。
  12. MFusion Mambaを用いたフューズマルチステージエンコーダ機能
    1. 4つのエンコーダステージ(E1E 2、E3、E4)すべてのエンコーダ機能を収集し、MFusion Mambaモジュールの入力として使用します。デコーダフュージョンには対応する段階のエンコーダ機能だけを選択しないでください。
    2. すべてのエンコーダ機能を現在のデコーダ段階に必要な空間分解能に合わせて整列させます。エンコーダの特徴量を目標解像度にリサイズし、特徴融合前に必要なチャネル寸法に投影します。
    3. 各デコーダ段階で特徴のアラインメント手順を繰り返します。デコーダがH/16× W/16、H/8×W/8、H/4×W/4で動作した場合、E1E 2、E3、E4 を対応するターゲット特徴空間にリサイズし、投影します。
    4. MFusion Mambaモジュールの粗い融合および微細融合操作を使って整列した多段エンコーダの特徴を融合し、該当するスケールのデコーダ機能と融合表現を組み合わせます。
    5. モデル/mvmunet/core.py でリリースされた実装に従って特徴投影、リサイズ、融合操作を実行します。

figure-protocol-7
図5。多段融合マンバ(MFusion Mamba)モジュールのアーキテクチャ。 多段融合マンバ(MFusion Mamba)モジュールの構造。マルチスケールエンコーダの特徴はまず粗融合によって結合され、その後、線形射影、一次元畳み込み(Conv1d)、マンバブロック、特徴射影層からなるファインフュージョンモジュールを通じて精緻化され、その後デコーダで使用される融合特徴表現が生成されます。 この図の拡大版はこちらをクリックしてご覧ください。

6. モデルトレーニング

  1. Ubuntu 22.04.1でLinuxカーネルバージョン6.8.0を搭載してMVM-UNetをトレーニングします。13世代Intel Core i9-13900K CPUとNVIDIA A800 GPUを搭載したワークステーションを使用してください。トレーニングや評価の間は同じハードウェア構成を使いましょう。
  2. PyTorch 2.0.1とCUDA 11.8を使ってモデルを実装・訓練します。トレーニング前に必要なすべてのソフトウェア依存関係をインストールしてください。
  3. 初期学習率が3×10⁻⁻、β1 = 0.9、β2 = 0.999、ε = 1 × 10⁻⁹、重み減衰0.01のAdamW最適化器を使用します。特に指定がない限り、バッチサイズは32に設定してください。
  4. 各モデルを300エポック分トレーニングします。η =1 × 10−5のコサインアニーリング学習率スケジュールを用いましょう。入力画像のサイズをISIC 2017×256、Synapse×224に設定してください。
  5. 主な比較実験には3つの独立したランダムシード(1、52、100)を使用します。各シードに対して完全なトレーニングと評価手順を繰り返します。最終的な定量的結果は、3回のランで平均±SDとして報告してください。
  6. 特に指定がない限り、すべてのアブレーション検査には固定されたランダムシード100を使用します。すべてのアブレーション実験において、データセットの分割、前処理戦略、ネットワークアーキテクチャ、最適化器、学習率、バッチサイズ、訓練エポック数は変更せずに保ちます。
  7. ISIC 2017およびISIC 2018の二項病変分割にはBCE-Dice損失を用いてください。BCEとDiceの減量重みを1.0に設定してください。SynapseのCE-Dice損失を使い、クロスエントロピーとDice損失の重みを1.0に設定してください。
  8. ステップ1で説明した前処理手順を用いて、ISIC 2017およびISIC 2018のトレーニング画像のサイズ変更、正規化、補強を行います。ステップ1で説明したように、Synapseのトレーニング画像にリサイズ、ランダム回転、ランダム反転を適用します。すべてのトレーニングランで同じ前処理設定を使いましょう。
  9. データセット固有の検証プロトコルに従ってモデルチェックポイントを選択します。ISIC 2017およびISIC 2018の検証性能が最も良いチェックポイントを保存し、30エポックごとに検証を行います。検証セットなしで300エポックのSynapseを訓練し、最終的なトレーニングチェックポイントをテストに使います。
  10. ISIC 2017およびISIC 2018のモデル選択には公式検証セットのみを使用してください。Synapseテストセットはトレーニング、ハイパーパラメータチューニング、チェックポイント選択には使わないでください。すべての検査データは最終評価専用に予約してください。
  11. 再現性のために以下のトレーニングパラメータを使用してください。すべてのデータセットでバッチサイズを32に設定してください。AdamWを、初期学習率3 × 10⁻⁻、β1 = 0.9、β2 = 0.999、ε = 1 × 10⁻⁹、重み減衰が1 × 10⁻²のものを用います。
  12. ISIC 2017およびISIC 2018では、コサインアニーリング学習率スケジューラを T最大 値=50、最小 η10 −5×10−5 に設定してください。シナプスの場合、スケジューラを Tmax = 100、 ηmin = 1×10−5 に設定します。繰り返し実験を行ってもスケジューラ設定は変更せずに保ちましょう。
  13. 全モデルを全精度FP32演算で訓練してください。自動混合精密訓練を無効にしてください。最適化中にグラデーションクリッピングを適用しないでください。
  14. 精密設定、勾配更新戦略、最適化装置の設定、学習率スケジュール、ランダムシードプロトコルは、すべての比較実験、アブレーション研究、再現性ランにおいて変更せずに維持してください。
  15. 最適なモデルチェックポイントを選びます
    1. ISIC 2017およびISIC 2018データセットの各トレーニングエポック後、検証セット上でモデルを評価します。
    2. 各検証バッチのバイナリクロスエントロピー(BCE)-ダイス損失を計算し、検証セット全体の平均検証損失を計算します。
    3. 平均検証損失が以前に記録された最小検証損失より低い場合、現在のモデルを最良のチェックポイントとして保存します。
    4. パフォーマンス監視の検証中は、平均交差点(mIoU)、ダイス類似係数(DSC)、精度(Acc)、特異度(Spe)、感度(Sen)を記録し、パフォーマンス監視のみを行います。これらの指標をチェックポイント選択基準として使用しないでください。

7. モデル評価

  1. 各データセットの公式テストセットを使って訓練済みのモデルを評価します。テストセットは最終的なパフォーマンス評価にのみ使用してください。
  2. ISIC 2017およびISIC 2018では、mIoU、DSC、Acc、Sen、Speを計算します。すべての計算にはピクセル単位の真陽性(TP)、偽陽性(FP)、真陰性(TN)、偽陰性(FN)を使用します。
  3. ISIC 2017およびISIC 2018のモデル出力にシグモイド活性化関数を適用します。確率マップを0.5の閾値で二値分割マスクに変換します。評価指標は式 2–6を用いて計算します。
    figure-protocol-8 (2)
    figure-protocol-9 (3)
    figure-protocol-10 (4)
    figure-protocol-11 (5)
    figure-protocol-12 (6)
  4. Synapseでは、モデル出力にsoftmaxアクティベーション関数を適用してください。argmax演算を使って、各ピクセルまたはボクセルを最も確率の高いクラスに割り当てます。各前景器官のDSCと95パーセンタイルハウスドルフ距離(HD95)を計算し、すべての検査ケースの平均値を報告します。
  5. MVM-UNetと、代表的なCNNベース、トランスフォーマーベース、状態空間モデル(SSM)ベースのセグメンテーション手法を比較してください。すべての手法で同一のデータセット分割、前処理手順、入力解析、評価指標を用いましょう。
  6. ISIC 2017およびISIC 2018の公式トレーニング、検証、テストパーティションを使用してください。Synapseは標準的な18のトレーニングケースと12のテストケースを使いましょう。ISICデータセットとSynapseの入力解像度を に設定します。
  7. 利用可能な場合は、公式実装を使ってベースラインの手法を再現してください。レポートは繰り返しの実行にかけて平均±SDとして結果を再現しました。文献で報告された値は元の公表通りに保持し、対応する表ノートで区別してください。
  8. 特に指定がない限り、固定されたランダムシード100を用いてアブレーション研究を行う。すべてのアブレーション実験において、データセットのパーティション、前処理手順、入力解析、最適化器、学習率スケジュール、バッチサイズ、エポック数、損失関数、評価指標は変更せずに管理してください。
  9. MV4D、SFusion Mamba、MVVブロック内のアップダウンプロジェクション分岐、MFusion Mamba、入力画像サイズ、ドロップアウト値、エンコーダ-デコーダ層構成の貢献を評価する。各アブレーション実験では、対象成分またはパラメータのみを修正してください。
  10. ISIC 2017およびISIC 2018のペア画像結果と、Synapseのケースごとのペア結果を用いてWilcoxon署名順位検定を実施します。統計的有意性を示すためにp値が0.05未満と考えます。
  11. すべての手法で同じハードウェア環境と入力解像度を用いて計算効率を評価します。エポックごとの訓練時間、画像ごとの推論時間、トレーニング中のGPUメモリ使用量のピーク、モデルパラメータ数、浮動小数点演算(FLOP)を測定します。単一のフォワードパスでFLOPを計算します。
  12. モデル評価を完了した後、テストセットから代表的な質的例のみを選択します。すべての手法で同一のテストケースを用いて、元の画像、グラウンドトゥルースマスク、予測マスクを比較します。小さな標的、不規則な境界、曖昧な境界、代表的な多臓器構造を含む代表的な例を選びます。
  13. 評価指標を計算し、統計分析を行う
    1. NumPyとsklearn.metrics.confusion_matrixを使って、PythonでISIC 2017およびISIC 2018データセットのセグメンテーション指標を計算します。予測確率マップを0.5でしきい値にしきい値し、ピクセルレベルのTP、FP、TN、FNを取得し、これらの値からmIoU、DSC、Acc、Sen、Speを計算します。
    2. シナプスデータセットのDSCとHD95は、それぞれmedpy.metric.binary.dcおよびmedpy.metric.binary.hd95を用いて計算します。評価指標を計算する前に、モデル出力にsoftmaxを適用し、その後argmaxを適用します。
    3. thop.profileを使ってFLOPの数と訓練可能なパラメータを単一のフォワードパスで計算します。
    4. Pythonでscipy.stats.wilcoxonを使ってWilcoxon署名順位テストを行います。ISIC 2017およびISIC 2018データセットにはペアリングされた画像ごとのメトリクス値を使用し、Synapseデータセットにはペア化されたケースごとのメトリクス値を用います。

8. 損失関数の定義

  1. マルチクラスセグメンテーションには標準のクロスエントロピー(CE)ロスを、バイナリセグメンテーションには標準BCEロスを用いましょう。セグメンテーションには標準的なDice損失の定式を使いましょう。 式7–11 は、このプロトコルで使用される損失関数を定義しています。
    figure-protocol-13(7)
    figure-protocol-14(8)
    figure-protocol-15(9)
    figure-protocol-16(10)
    figure-protocol-17(11)
  2. ISIC 2017とISIC 2018ではBCEとDiceの損失重みを1.0に設定し、figure-protocol-181=1.0、figure-protocol-192=1.0とします。シナプスではCEとダイスの損失重みを1.0に設定し、例えば1 = 1.0 that φ φ2 = 1.0とします。
  3. 損失関数を utils.py で実装してください。nnを使いましょう。BCE学期のBCELossとnn。CE項のCrossEntropyLoss。各予測マスクとグラウンドトゥルースマスクを平坦化し、各サンプルのダイス損失を計算し、バッチ全体の損失を平均することで二値のDice損失を計算します。ターゲットラベルマップをワンホット形式に変換し、モデル出力にソフトマックスを適用し、各クラスのダイス損失を計算し、すべてのクラスで損失を平均させることでマルチクラスのダイス損失を計算します。
  4. 平滑定数を二項ダイス損失は1、マルチクラスのダイス損失は1×10−5 に設定します。b_c.Diceの損失をbceDiceLossクラスで実装し、wb = 1かつwd = 1で実装します。CE-Dice損失をCeDiceLossクラスでloss_weight = [1, 1]で実装します。すべてのデータセット、ランダムシード、実験について、平滑化定数、還元戦略、ソフトウェアの実装は変更せずに保ちましょう。
  5. 損失削減の設定
    1. インスタンス化 nn。BCELoss()とnn。CrossEntropyLoss() は、還元引数を明示的に指定せずに使います。
    2. 両方の損失関数にデフォルトのPyTorch損失削減設定(reduction = 「平均」)を使いましょう。reduction = 「sum」や未減少損失出力は使わないでください。

9. 再現性設定と実行

  1. https://github.com/LIXUEGUANG002/MVM-UNet からリリースされた実装をダウンロードしてください。このリポジトリは、材料表に記載されたソフトウェアパッケージ、データセット、ハードウェア仕様、計算資源とともに利用してください。
  2. リポジトリをクローンし、git clone https://github.com/LIXUEGUANG002/MVM-UNet.git を実行してプロジェクトディレクトリに入り、その後cd MVM-Unetを実行します。
  3. ISIC 2017またはISIC 2018実験の設定には、データセット名、データセット経路、入力サイズ、バッチサイズ、エポック数、損失関数、最適化器、学習率スケジューラ、ランダムシードをconfig/config_setting.pyで設定できます。リポジトリのルートからpython train.py を使ってトレーニングスクリプトを実行してください。
  4. Synapse実験の設定には、データセット名、トレーニングデータパス、テストボリュームパス、リストディレクトリ、入力サイズ、クラス数、バッチサイズ、エポック数、損失関数、最適化器、学習率スケジューラ、ランダムシードを設定/config_setting_synapse.pyで設定します。リポジトリのルートからpython train_synapse.pyを使ってトレーニングスクリプトを実行します。
  5. 推論のみの評価は、only_test_and_save_figs = True、best_ckpt_pathを訓練済みチェックポイントに、対応する設定ファイルの出力ディレクトリにimg_save_pathして行います。ISIC 2017やISIC 2018のためにpython train.py を実行し、SynapseのためにPython train_synapse.pyを実行して予測結果や定性的数値を生成してください。
  6. 公開されたソースコード版をご利用ください
    1. 公開されたGitHubリポジトリをクローンし、データセット、トレーニングスクリプト、評価設定の設定前にマスターブランチでee891b42c2f2c2f1d4463adc5e103eのコミットを確認してください。
    2. このコミットを使って、本研究で報告された実験を再現してください。原稿改訂時にはタグ付きのリリースバージョンはリポジトリに存在しませんでした。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

期待される結果と解釈
このプロトコルが正しく実装されれば、訓練済みのMVM-UNetモデルは、ほとんどの評価指標において異なるランダムシード間でわずかな変動を伴い、繰り返し実行間で安定したセグメンテーション性能を生み出すことが期待されます。ISIC 2017およびISIC 2018では、成功した結果は高いDSC、mIoU、Acc、Sen、Spe値と、地底真実の病変境界に密接に従う予測病変マスクによって反映されています(図6および図7)。シナプスの場合、成功した結果は前景器官全体で平均DSC値が高いこととHD95値の低さによって反映されています(図8)。プロトコル実行時には、定量的な指標と対応する定性的セグメンテーション結果を併用して解釈する必要があります。高いDSCを達成しながら境界漏れ、小さな構造の欠落、または予測の断片化を示すモデルは部分的にしか成功したとみなせず、前処理手順、チェックポイント選択、推論設定の検証が必要です。

figure-results-1
図6。ISIC 2017データセットにおける代表的な定性的セグメンテーション結果。 国際皮膚イメージング協働(ISIC)2017年の皮膚病変分割データセットで得られた代表的な質的セグメンテーション結果。各例は元の皮膚鏡画像(Image)、対応するグラウンドトゥルース分割マスク(GT)、およびMVM-UNet(Pred)によって生成された予測を示します。代表的なテストケースは、大小、形態、境界の複雑さが異なる病変に対するセグメンテーション性能を示しています。 この図の拡大版はこちらをクリックしてご覧ください。

figure-results-2
図7。ISIC 2018データセットにおける代表的な質的セグメンテーション結果。 国際皮膚イメージング協働(ISIC)2018年の皮膚病変分割データセットで得られた代表的な質的セグメンテーション結果。各例は元の皮膚鏡画像(Image)、対応するグラウンドトゥルース分割マスク(GT)、およびMVM-UNet(Pred)によって生成された予測を示します。代表的なテストケースは、多様な病変の外観や境界特性におけるセグメンテーション性能を示します。 この図の拡大版はこちらをクリックしてご覧ください。

figure-results-3
図8。Synapse多臓器コンピュータ断層撮影データセットにおける代表的な定性セグメンテーション結果。 Synapseの頭蓋骨庫を超えたマルチアトラスラベリングデータセットで得られた代表的な質的多臓器分割結果。各例は、元のコンピュータ断層撮影画像(Image)、対応する地帯真実の臓器注釈(GT)、およびMVM-UNet(Pred)によって生成された予測を示します。代表例として、複数の腹部臓器にわたる予測断片と参照分断の一致が示されています。 この図の拡大版はこちらをクリックしてご覧ください。

ISIC 2017でのパフォーマンス
MVM-UNetの再現性を評価するため、主要な比較実験はすべて3つの独立したランダムシード(1、52、100)を用いて繰り返し行われ、結果は平均±SDとして報告されました。統計的有意性は、ISIC 2017およびISIC 2018のペア単位画像結果とSynapseのペア単位結果に基づくWilcoxon署名順位検定を用いて評価されました。統計解析はシードレベルの平均ではなく、ペアメトリクス値を用いて行われました。公平な比較のため、平均±SDとして報告された結果は、可能な限り同じデータセット分割、入力解像度、評価指標の公式実装を用いて再現し、単一値の結果は対応する元の論文から保持しました。

MVM-UNetはISIC 2017の皮膚病変分割データセット上で評価され、UNet 8,21、TransUNet23、H-vmunet28、MISSFormer30、MaLUNet31、VM-UNet32、UNeXt-S33、HResFormer34、MedScale-Former35、MCAFT36、H2Former12などの代表的なセグメンテーション手法と比較されました(表1).MVM-UNetは3つの独立ラン±でmIoU 80.94 1.01%、DSCは91.32%±0.68%、精度は96.58%±0.27%、特異度は98.31%±0.23%、感度は91.65%±0.77%を記録しました。評価された手法と比較して、MVM-UNetはmIoU、DSC、感度が最高を記録しました。代表的な質的セグメンテーション結果は図6に示されており、予測されたマスクは代表的なテスト画像のグラウンドトゥルース病変境界に密接に従っています。

モデル参考文献。mIoU(%)DSC(%)AC(%)Spe(%)セン(%)
UNet876.9886.9995.6597.4386.82
トランスUNet2375.3281.2391.4595.7782.63
MaLUNet(マルンネット)3178.7888.1396.1898.4784.78
VM-UNet3280.2389.0396.2997.5889.90
UNeXt-S3378.2687.8095.9597.7487.04
HResFormer3479.89 ± 1.0588.82 ± 0.6596.25 ± 0.2497.73 ± 0.2287.72 ± 0.79
H-ヴムネト2880.34 ± 1.0290.68 ± 0.5596.42 ± 0.1898.23 ± 0.3288.97 ± 0.88
フォーマーさん3080.16 ± 0.7889.27 ± 0.6194.36 ± 0.2897.52 ± 0.3887.71 ± 0.69
H2Former1280.35 ± 0.9588.56 ± 0.7296.61 ± 0.1998.15 ± 0.1488.21 ± 0.81
メッドスケール・フォーマー3580.31 ± 0.8289.11 ± 0.5995.68 ± 0.3398.24 ± 0.2189.96 ± 0.92
MCAFT3680.59 ± 0.9389.27 ± 0.6396.42 ± 0.2097.95 ± 0.1790.05 ± 0.84
MVM-UNet(我々の)80.94 ± 1.0191.32 ± 0.6896.58 ± 0.2798.31 ± 0.2391.65 ± 0.77

表1:ISIC 2017皮膚病変分割データセットにおけるパフォーマンス比較。 MVM-UNetと、平均交差点(mIoU)、ダイス類似係数(DSC)、精度(Acc.)、特異度(Spe.)、感度(Sen.)を用いた代表的な畳み込みニューラルネットワーク(CNN)、トランスフォーマーモデル、状態空間モデル(SSM)ベースのセグメンテーション手法との比較。MVM-UNetの結果は、3つの独立したランダムシード実験から平均±標準偏差として報告されています。結果は単一値として報告され、対応する原文から再現されました。

定性的例はさらに、MVM-UNetが不規則な境界を持つ小さな病変と大きな病変の両方を正確に区分していることを示しています。これらの代表的な例では、予測されたマスクは対応するグラウンドトゥルース注釈とほぼ一致し、損傷境界を最小限の漏れや断片化で保持していました。

観察された改善が統計的に有意かどうかをさらに評価するため、Wilcoxon署名順位検定を用いて画像ごとのペアセグメンテーション結果を用いて実施しました。mIoU指標では、MVM-UNetはMCAFTよりも統計的に有意な改善を示し、p値は0.0114でした。DSC指標においても、MVM-UNetはH-vmunetを大きく上回り、p値0.0031でした。これらの結果は、ISIC 2017での観察された改善がランダムな変動によるものとは考えにくいことを裏付けています。

全体として、MVM-UNetは比較手法の中で、ISIC 2017データセットにおけるmIoU、DSC、感度の各手法の中で最高の性能を達成しました(表1)。図6に示された定性的セグメンテーションの例は、これらの定量的発見と一致しています。

ISIC 2018でのパフォーマンス
MVM-UNetはISIC 2018の皮膚病変分割データセットでさらに評価され、UNet 8,21、UNet++9、UTNetV237、SANet38、MaLUNet31、VM-UNet32、H-vmunet28、MISSFormer30、H2Former12、HResFormer34、MedScale-Former35、MCAFT36などの代表的な分割手法と比較されました(表2).MVM-UNetは3つの独立ラン±でmIoUが82.47%1.28%、DSCが90.65%±0.94%、精度96.02%±0.36%、特異度97.06%±0.31%、感度が91.80%±0.82%を記録しました。これらの結果は、MVM-UNetの性能が異なるランダムシード間で一貫していることを示しています。代表的な定性的セグメンテーション結果は図7に示されています。

モデル参考文献。mIoU(%)DSC(%)AC(%)Spe(%)セン(%)
UNet877.8687.5594.0596.6985.86
UNet++978.3187.8394.0295.7588.65
UTNetV23778.9788.2594.3296.4887.60
サネット3879.5288.5994.3995.9789.46
MaLUNet(マルンネット)3180.2589.0494.6296.1989.74
VM-UNet3281.3589.7194.9196.1391.12
H-ヴムネト2881.93 ± 1.4590.46 ± 0.6295.19 ± 0.3096.82 ± 0.2188.37 ± 1.13
フォーマーさん3080.27 ± 1.2189.91 ± 0.4694.76 ± 0.2797.22 ± 0.1590.84 ± 1.07
H2Former1280.40 ± 0.8390.26 ± 0.7394.89 ± 0.3896.98 ± 0.2591.57 ± 0.54
HResFormer3481.12 ± 1.1888.86 ± 0.8494.96 ± 0.3396.43 ± 0.2291.86 ± 1.01
メッドスケール・フォーマー3580.97 ± 0.7490.47 ± 0.6895.02 ± 0.4195.89 ± 0.2690.65 ± 0.92
MCAFT3681.46 ± 1.0389.06 ± 0.7695.23 ± 0.2996.72 ± 0.1791.82 ± 0.57
MVM-UNet(我々の)82.47 ± 1.2890.65 ± 0.9496.02 ± 0.3697.06 ± 0.3191.80 ± 0.82

表2:ISIC 2018皮膚病変分割データセットにおけるパフォーマンス比較。 MVM-UNetを、平均交差点(mIoU)、ダイス類似係数(DSC)、精度(Acc.)、特異度(Spe.)、感度(Sen.)を用いた代表的なCNN、トランスフォーマー、SSMベースのセグメンテーション手法との比較。MVM-UNetの結果は、3つの独立したランダムシード実験から平均±標準偏差として報告されています。結果は単一値として報告され、対応する原文から再現されました。

H-vmunetと比較して、MVM-UNetはmIoUを0.54%改善しました。MedScale-Formerと比較して、MVM-UNetはDSCを0.18%改善しました。MVM-UNetは比較手法の中でも最も高い精度を達成しました。 図7 に示された代表的な質的例は、小さな病変領域や不規則な境界を持つ病変を含む代表的な皮膚病変の正確な分割を示しています。

ISIC 2018では、ペア単位の画像分割結果に基づくWilcoxon署名順位検定を用いて統計的有意性を評価しました。mIoU指標において、MVM-UNetはMCAFTに対して統計的に有意な改善を達成し、p値は< 0.001でした。これらの結果は、ISIC 2018で観察された性能向上がランダムな変動によるものとは考えにくいことを支持しています。

全体として、MVM-UNetはISIC 2018データセットにおいて比較手法の中で最高のmIoU、DSC、精度を達成しました(表2)。図7に示された定性的例は、これらの定量的改善と整合しています。

シナプスでの演奏
提案された手法はSynapse多臓器分割データセットでも評価され、UNet 8,21、Attention U-Net39、TransUNet23、TransNorm40、Swin U-Net25、TransDeepLab41、MEW-UNet42、MISSFormer30、H2Former12、HResFormer34、MedScale-Former35、MCAFT36などの代表的な手法と比較されました(表3).シナプスデータセットには、大動脈、胆嚢、脾臓、左腎臓、右腎臓、肝臓、膵臓、胃の8つの腹部臓器が含まれていました。標準的な実験プロトコルに従い、18ケース(2,212軸方向スライス)が訓練に、12ケース(1,567軸方向スライス)が試験に使用されました。別個の検証セットは導入されませんでした。テストケースは最終評価のみに使用され、モデルトレーニング、ハイパーパラメータ調整、モデル選択には使用されませんでした。代表的な質的多臓器分断結果は図8に示されており、定量的比較は表3にまとめられています。

モデル参考文献。DSCHD95Aor。ギャル。子供。(左)子供。(R)リヴ。パン。ススペル。スト。
UNet876.8539.7889.0769.7277.7768.6993.4354.0186.6675.59
アット・ユニット3977.7736.0289.5468.8877.9871.1193.5758.0487.3175.74
トランスUNet2377.4831.6987.2363.1381.8777.0294.0855.8485.0675.62
トランスノーム4078.430.2586.2365.1882.1878.6394.2255.3289.5376.02
スウィンU-Net2579.1321.5585.4766.5383.2879.6194.2956.5890.6276.59
トランスディープラボ4180.1621.2586.0469.1684.0879.8893.5361.1589.0178.36
ミュー・ユネット4278.9221.6886.6865.3282.8780.0293.6358.3890.1674.27
フォーマーさん3080.92 ± 4.2320.09 ± 1.8986.43 ± 0.9869.81 ± 4.5684.29 ± 2.1181.03 ± 3.3493.85 ± 0.8961.11 ± 4.6790.05 ± 3.7880.62 ± 1.02
H2Former1281.05 ± 2.5620.13 ± 7.2386.61 ± 3.2169.32 ± 1.2385.12 ± 4.7882.01 ± 2.8994.09 ± 2.4561.16 ± 0.7689.97 ± 4.1280.94 ± 3.56
HResFormer3480.65 ± 4.0217.48 ± 6.8989.16 ± 2.7866.94 ± 0.7884.61 ± 4.3482.15 ± 2.5693.11 ± 1.3459.92 ± 4.1291.08 ± 3.4580.75 ± 2.01
メッドスケール・フォーマー3580.78 ± 1.3420.02 ± 3.7888.79 ± 4.0269.82 ± 2.5685.13 ± 0.8781.63 ± 4.7894.10 ± 2.7860.72 ± 1.8990.14 ± 1.5680.93 ± 4.56
MCAFT3681.03 ± 3.4519.98 ± 5.1289.76 ± 0.7668.96 ± 3.8984.54 ± 2.5681.98 ± 3.1294.32 ± 4.0160.85 ± 3.6789.06 ± 4.8980.91 ± 1.78
MVM-UNet(我々の)81.26 ± 1.8918.72 ± 2.1688.53 ± 3.2269.84 ± 4.2385.37 ± 2.6982.67 ± 1.6794.41 ± 3.5661.02 ± 2.7890.19 ± 0.6781.48 ± 3.12

表3:Synapse多臓器分割データセットにおけるパフォーマンス比較。 MVM-UNetを、Dice類似係数(DSC)、95パーセンタイルハウスドルフ距離(HD95)、および大動脈(Aor.)、胆嚢(Gal.)、左腎臓(Kid)の臓器特異的Diceスコアを用いた代表的なCNN、トランスフォーマー、SSMベースのセグメンテーション手法との比較。(L))、右腎臓(キッド。(R))、肝臓(Liv.)、膵臓(Pan.)、脾臓(Spl.)、胃(Sto.)です。MVM-UNetの結果は、3つの独立したランダムシード実験から平均±標準偏差として報告されています。結果は単一値として報告され、対応する原文から再現されました。

MVM-UNetは3回の独立選挙で平均DSC81.26%±1.89%、平均HD95は18.72±2.16を記録しました。結果はSynapseデータセットにおける安定したセグメンテーション性能を示しています。評価された手法の中で、MVM-UNetは平均DSCが最も高く、平均HD95は2番目に低い平均を記録しました。

シナプスについては、ケースごとのDSC値を組み合わせたウィルコクソン署名順位検定を用いて統計的有意性を評価しました。MVM-UNetはH2Formerに比べて統計的に有意な改善を示し、p値0.026を示し、分断性能の改善が統計的に有意であることを示しました。

代表的な成功結果と最適でない結果
代表的な成功した質的結果は 図6–8に示されています。成功した結果は、予備的な断片マスクがグラウンドトゥルース注釈に密接に対応し、原発病変や臓器境界を正確に区分することが特徴です。代表的な最適でない結果は、非常に小さな標的、低コントラスト境界、不規則な病変形状、強度コントラストが弱い臓器、または解剖学的に曖昧な境界で現れることがあり、通常はアンダーセグメンテーション、オーバースグセクテーション、境界漏れ、または不連続なマスク断片として現れます。このような結果が観察された場合、画像のリサイズ、正規化、マスク補間、モデルチェックポイントの選択、推論閾値(ISICデータセットの場合)、argmax予測(Synapseの場合)、およびメトリック計算手順が プロトコルで説明されているものと整合しているかをユーザーは検証すべきです。

MV4Dモジュールのアブレーション研究
MV4Dモジュールの貢献度は、ジグザグ、階層、スパイラル、ラジアルスキャンペアを段階的に追加し、その後SFusion Mambaモジュールを導入することで評価されました(表4; 図9)。ジグザグスキャンペアのみを使用した場合、セグメンテーション性能は制限されました。階層的スキャンペアの追加により性能が大幅に向上し、マルチスケール情報を組み込む利点が示されています。その後、螺旋スキャンと放射状スキャンペアの追加により、輪郭や境界表現を強化し、セグメンテーション性能がさらに向上しました。SFusion Mambaモジュールの導入により、評価された構成の中で最高の性能が得られました。

モデルジグザグスキャンペア階層的スキャンペアスパイラルスキャンペア放射状スキャンペアSFusion MambaISIC 2017 mIoU(%)ISIC 2017 DSC(%)ISIC 2018 mIoU(%)ISIC 2018 DSC(%)
MVM-UNet56.7572.4658.0373.45
MVM-UNet72.3884.0173.4584.7
MVM-UNet75.6986.2076.9486.94
MVM-UNet76.4186.6178.2887.82
MVM-UNet80.9491.3282.4790.65

表4:マルチビュー4方向(MV4D)モジュールのアブレーション研究。 階層的、スパイラル、ラジアルスキャンペアと空間融合マンバ(SFusion Mamba)モジュールをベースラインのジグザグスキャンペアアーキテクチャに段階的に組み込むことで性能が得られます。性能は、ISIC 2017およびISIC 2018データセットにおける平均交差点対結合(mIoU)およびダイス類似係数(DSC)を用いて報告されます。

figure-results-4
図9。マルチビュー4方向(MV4D)モジュールのアブレーション研究。(A) 階層的スキャンペア、スパイラルスキャンペア、放射状スキャンペア、空間融合マンバ(SFusion Mamba)をベースラインアーキテクチャに順次組み込んだ後の、ユニオン上での平均交差(mIoU)の変化。 (B) 階層的スキャンペア、スパイラルスキャンペア、放射スキャンペア、空間融合マンバ(SFusion Mamba)をベースラインアーキテクチャに順次組み込んだ後のダイス類似係数(DSC)の変化。 (C) 階層的スキャンペア、スパイラルスキャンペア、放射スキャンペア、空間融合マンバ(SFusion Mamba) を第2の実験環境下でベースラインアーキテクチャに順次組み込んだ後のmIoU変化。 (D) 階層的スキャンペア、スパイラルスキャンペア、放射スキャンペア、空間融合マンバ(SFusion Mamba)を第2の実験設定下でベースラインアーキテクチャに順次組み込んだ後のDSCの変化。 この図の拡大版はこちらをクリックしてご覧ください。

ISIC 2017データセットでは、完全なMV4DモジュールはmIoUが80.94%、DSCが91.32%を記録しました。mIoUとDSCの対応する性能傾向は、それぞれ 図9A図9Bに示されています。ISIC 2018データセットでは、完全なMV4Dモジュールは82.47%のmIoU、90.65%のDSCを記録しました。対応する性能傾向はそれぞれ 図9C図9Dに示されています。

特に指定がない限り、すべてのアブレーション実験は固定されたランダムシード100を用いて行われ、主な比較結果は3つの独立したランダムシード(1、52、100)に対する平均±SDとして報告されました。したがって、アブレーション結果は、主要な比較実験で報告された最終的なマルチシード性能を再現するのではなく、制御された単一シード設定下での個々の成分の相対的な寄与を比較することを意図しています。

全体として、追加のスキャンペアとSFusion Mambaモジュールを段階的に組み込むことで、セグメンテーション性能が一貫して向上し、完全なMV4D構成は両データセットで最高のパフォーマンスを達成しました。

マルチビュービジョン(MVV)ブロックのアブレーション研究
MVVブロックは、ベースラインアーキテクチャとアップダウンプロジェクションブランチを含むバージョン(表5)を比較して評価されました。ISIC 2017データセットでは、アップダウンプロジェクション部門を含めることでmIoUは78.83%から80.96%に、DSCは88.15%から91.02%に増加しました。ISIC 2018データセットでは、mIoUは80.32%から82.46%に増加し、DSCは89.15%から90.57%に上昇しました。

モデルベースラインMVVブロックアップダウンプロジェクションISIC 2017 mIoU(%)ISIC 2017 DSC(%)ISIC 2018 mIoU(%)ISIC 2018 DSC(%)
MVM-UNet78.8388.1580.3289.15
MVM-UNet80.9691.0282.4690.57

表5:マルチビュービジョン(MVV)ブロックのアブレーション研究。 アップダウンプロジェクションブランチ付きおよびなしのベースラインマルチビュービジョン(MVV)ブロックのパフォーマンス比較。性能は、ISIC 2017およびISIC 2018データセットにおける平均交差点対結合(mIoU)およびダイス類似係数(DSC)を用いて報告されます。

MVVブロックアブレーション実験は、固定ランダムシード100を用いて実施されました。したがって、アップダウン投影分岐を含む構成の性能は制御された単一シードアブレーション設定を反映しており、主要な比較実験で報告された完全なMVM-UNetモデルの3シード平均性能とは若干異なる場合があります。

全体として、アップ・ダウンプロジェクションの導入は両データセットのセグメンテーション性能を一貫して向上させ、mIoUとDSCの両方で増加が観察されました。

多段階融合マンバ(MFusion Mamba)モジュールのアブレーション研究
MFusion Mambaモジュールは、異なる粗核融合戦略と微細融合成分を比較して評価されました(表6; 図10)。MFusion Mambaを使わないと、MVM-UNetはISIC 2017データセットでmIoUが75.47%、DSCが86.01%、ISIC 2018データセットでmIoUが77.49%、DSCが87.29%となりました。評価された粗核融合戦略の中で、ハダマール製品は最大の改善を達成しました。ファインフュージョンコンポーネントの導入により、セグメンテーション性能がさらに向上しました。完全なMFusion Mamba構成はISIC 2017で80.95%のmIoUと91.18%のDSCを達成し、ISIC 2018では82.51%のmIoUと90.58%のDSCを記録しました。

モデル粗核融合要素ごとの最大粗核融合要素ごとの加算粗核融合ハダマール積ファイン・フュージョン・モジュールISIC 2017 mIoU(%)ISIC 2017 DSC(%)ISIC 2018 mIoU(%)ISIC 2018 DSC(%)
MVM-UNet75.4786.0177.4987.29
MVM-UNet76.2186.4778.3587.82
MVM-UNet76.8386.8679.1188.30
MVM-UNet78.2687.8380.0688.96
MVM-UNet80.9591.1882.5190.58

表6:多段融合マンバ(MFusion Mamba)モジュールのアブレーション研究。 最大融合(Max)、元素ごとの加算(⊕)、ハダマール積(⊙)を含む様々な粗核融合戦略のパフォーマンス比較と、完全なファインフュージョンモジュールを含みます。性能は、ISIC 2017およびISIC 2018データセットにおける平均交差点対結合(mIoU)およびダイス類似係数(DSC)を用いて報告されます。

figure-results-5
図10。多段融合マンバ(MFusion Mamba)モジュールのアブレーション研究。(A) 異なる粗核融合戦略(最大、要素ごとの加算、ハダマー積)および完全な微細融合モジュールを用いて得られる平均交差(mIoU)の変化。 (B) 異なる粗核融合戦略(最大、要素ごとの加算、ハダマール積)および完全なファインフュージョンモジュールを用いて得られるダイス類似係数(DSC)の変化。 (C) 異なる粗核融合戦略(最大、元素ごとの付加法、ハダマール積)および2つ目の実験設定下での完全なファインフュージョンモジュールを用いて得られたmIoUの変化。 (D) 異なる粗核融合戦略(最大、元素ごとの加算、ハダマール積)および2つ目の実験設定における完全なファインフュージョンモジュールを用いたDSCの変化。 この図の拡大版はこちらをクリックしてご覧ください。

ISIC 2017データセットでは、完全なMFusion Mamba構成はmIoUが80.95%、DSCが91.18%に達しました。mIoUとDSCの対応する性能傾向は、それぞれ 図10A および 図10Bに示されています。ISIC 2018データセットでは、完全なMFusion Mamba構成はmIoUが82.51%、DSCが90.58%に達しました。対応する性能傾向はそれぞれ 図10C および 図10Dに示されています。MFusion Mambaアブレーション実験は、固定されたランダムシード100を用いて実施されました。したがって、完全なMFusion Mamba構成は制御された単一シードアブレーションの結果を表しており、主要な比較実験で報告された完全なMVM-UNetモデルの3シード平均性能とは若干異なる場合があります。

全体として、Hadamard積粗融合戦略とFine Fusionコンポーネントを段階的に取り入れることで、セグメンテーション性能が一貫して向上し、完全なMFusion Mamba構成が両データセットで最高のパフォーマンスを達成しました。

アブレーション研究の概要
アブレーション実験全体で、階層的、螺旋的、放射状のスキャンペア枝とSFusion Mambaモジュールを段階的に取り入れることで、一貫してセグメンテーション性能が向上しました(表4; 図9)。同様に、MVVブロックにアップダウンプロジェクション分岐を含めることで、ISIC 2017およびISIC 2018データセットのmIoUおよびDSCの両方が向上しました(表5)。完全なMFusion Mamba構成は、評価された多段特徴融合戦略の中でも最高の性能を達成しました(表6; 図10)。

ハイパーパラメータのアブレーション研究
入力サイズおよびドロップアウト値の影響は、ISIC 2017およびISIC 2018データセットで評価されました(表7)。3つの入力解像度(256 × 256、384 × 384、512 × 512)が比較されました。評価された設定では、256×256の入力解像度が両データセットで最高のセグメンテーション性能を達成しました。

モデル入力サイズ 256 × 256入力サイズ 384 × 384入力サイズ 512 × 512ドロップアウト 0.0ドロップアウト 0.1ドロップアウト 0.2ドロップアウト 0.3ISIC 2017 mIoU(%)ISIC 2017 DSC(%)ISIC 2018 mIoU(%)ISIC 2018 DSC(%)
MVM-UNet80.0288.9181.7689.92
MVM-UNet79.9688.8780.9789.47
MVM-UNet77.4887.2878.7688.11
MVM-UNet79.3688.5381.1389.62
MVM-UNet80.9490.1582.4990.50
MVM-UNet79.7188.7180.4689.18

表7:入力画像サイズおよびドロップアウト値のアブレーション研究。 異なる入力画像サイズとドロップアウト値を用いたMVM-UNetのパフォーマンス比較。セグメンテーション性能は、ISIC 2017およびISIC 2018データセットにおける平均交差点対結合(mIoU)およびダイス類似係数(DSC)を用いて報告されます。

異なるドロップアウトの値も評価されました。テストされた構成の中で、ドロップアウト値0.2が両データセットで最高のセグメンテーション性能を達成し、主実験で使用されました。

エンコーダ-デコーダ層構成のアブレーション研究
ネットワークの深さがセグメンテーション性能および計算コストに与える影響を検証するために、異なるエンコーダ-デコーダ層構成が評価されました(表8)。評価された構成の中で、対称的な{2, 2, 2, 2}-{2, 2, 2, 2}アーキテクチャは、比較的低いモデル複雑さを維持しつつ、最高の全体セグメンテーション性能を達成しました。ネットワーク深さを{2, 2, 9, 2}-{2, 9, 2, 2}に増やすことでセグメンテーション性能は同等でしたが、パラメータ数と計算コストの両方が増加しました。

モデルエンコーダ-デコーダ層構成パラメータ (M)フロップ(G)ISIC 2017 mIoU(%)ISIC 2017 DSC(%)ISIC 2018 mIoU(%)ISIC 2018 DSC(%)
MVM-UNet{2,2,2,1}-{2,2,2,2}28.224.1280.0288.9181.1689.64
MVM-UNet{2,2,2,2}-{2,2,2,2}28.364.3980.9590.1782.590.41
MVM-UNet{2,2,2,3}-{2,3,2,2}30.144.8879.8388.881.5689.85
MVM-UNet{2,4,2,2}-{2,2,4,2}33.465.3279.6588.781.4589.79
MVM-UNet{2,2,9,2}-{2,9,2,2}45.637.7880.9690.0982.4890.43

表8:エンコーダ-デコーダ層構成のアブレーション研究。 異なるエンコーダ・デコーダ層構成の性能比較。この表は、ISIC 2017およびISIC 2018データセットにおけるモデルパラメータ(パラメータ)、浮動小数点演算(FLOP)、平均交差点対ユニオン(mIoU)、ダイス類似係数(DSC)の数を報告しています。

計算コスト比較
最終的なMVM-UNetモデルの計算効率は、同じハードウェア環境と入力解像度のもとで、HResFormer、H-vmunet、MISSFormer、H2Former、MedScale-Former、MCAFTなどの代表的なベースライン手法と比較されました(表9)。評価された指標には、エポックごとの訓練時間、画像ごとの推論時間、トレーニング中のGPUメモリ使用量のピーク、訓練可能なパラメータ数(パラム)、FLOPが含まれていました。訓練時間は1つの訓練エポックを完了するのに必要な時間として測定され、推論時間はテスト画像あたりの平均処理時間として測定され、FLOPは単一の前方通過で計算されました。

方法参考文献。訓練時間(年代別)推論時間(ms/画像)ピークGPUメモリ(GB)パラメータ (M)フロップ(G)
HResFormer34520213.0819.2117.00131.70
H-ヴムネト288827.005.010.748.97
フォーマーさん3035592.8612.642.33109.45
H2Former1213029.028.833.7133.56
メッドスケール・フォーマー358023.505.94.963.79
MCAFT3614534.008.730.0012.00
MVM-UNet(我々の)10426.807.928.364.39

表9:MVM-UNetおよび代表的なベースライン手法の計算コスト比較。 同じハードウェア環境と入力解像度における計算効率の比較。報告される指標には、エポックごとの訓練時間、画像ごとの推論時間、トレーニング中のGPUメモリ使用量のピーク、モデルパラメータ数(パラメータ)、浮動小数点演算(FLOP)などが含まれます。利用可能な実装方法を、可能な限り同じ実験環境で評価しました。

表9にまとめられたように、MVM-UNetは1トレーニングエポークあたり104秒、推論に1画像あたり26.8ms、ピークGPUメモリ7.9GB、2836万の訓練可能なパラメータ、4.39のGFLOPsを必要としました。HResFormer、MISSFormer、H2Former、MCAFTと比較して、MVM-UNetは訓練時間、推論時間、ピークGPUメモリ使用量の低さ、FLOPの減少を必要としました。軽量なH-vmunetやMedScale-Formerモデルと比較して、MVM-UNetはより多くの訓練時間とメモリ使用を必要としましたが、比較的低い計算複雑さを維持しつつ、同等の推論速度を維持しました。

データとコードの利用可能性
ISIC 2017およびISIC 2018のデータセットは国際皮膚イメージング協働(ISIC)アーカイブから公開されており、SynapseデータセットはSynapseリポジトリから公開されています。データセット取得の詳細は倫理声明に記載されています。簡単に言うと、ISIC 2017データセットは公式ISIC 2017チャレンジデータリポジトリ(https://challenge.isic-archive.com/data/#2017)から取得され、ISIC 2018データセットは公式ISIC 2018チャレンジタスク1データリポジトリ(https://challenge.isic-archive.com/data/#2018)から取得され、SynapseデータセットはSynapseリポジトリのaccession identifier syn3193805(https://www.synapse.org/Synapse:syn3193805)で取得されました。対応するダウンロード日は倫理声明に記載されています。MVM-UNetのソースコードの初期公開版は https://github.com/LIXUEGUANG002/MVM-UNet で入手可能です。リポジトリにはモデル実装、主要なネットワークモジュール、設定ファイル、データセットの整理手順、トレーニングスクリプト、評価スクリプトが含まれています。最終的な設定ファイル、完全な実験スクリプト、追加ドキュメント、訓練済みモデルチェックポイントを含む完全な再現性パッケージは、公開時に公開されます。

補足表1。マルチビュービジョンマンバUNet(MVM-UNet)の層ごとのアーキテクチャ。 表は、MVM-UNetのシーケンシャルネットワークアーキテクチャをまとめており、入力層、パッチ埋め込み、エンコーダステージ、マルチビュービジョン(MVV)ブロック、パッチマージ操作、マルチステージ融合マンバ(MFusion Mamba)、デコーダステージ、最終アップサンプリング、セグメンテーションヘッドを含みます。各段階ごとに、対応する操作、主パラメータ、出力特徴サイズが一覧化されています。 E1–E4 は多段特徴融合に用いられるエンコーダ段階の特徴マップを示します。 BHW はそれぞれバッチサイズ、画像高さ、幅を示し、 K は出力クラスの数を示します(二重皮膚病変切断はK = 1 、シナプス多分類切断は K = 9 で、背景クラス1つと前景オルガンクラス8個から成ります)。MFusion Mambaは、デコーダ再構築時に対応するデコーダ機能と統合される融合多段エンコーダ機能を生成します。このファイルをダウンロードするには、こちらをクリックしてください。

補足ファイル1。マルチビュー四方向モジュール(MV4D)および多段融合マンバ(MFusion Mamba)の擬似コード。 補足ファイルはMVM-UNetで使用される2つの主要モジュールのアルゴリズムワークフローを示しています。 アルゴリズム1は 、マルチビュー四方向(MV4D)モジュールの完全な処理パイプラインを記述しており、特徴の平坦化、4つのスキャンペアシーケンス(ジグザグ、階層、スパイラル、ラジアル)の構築、選択状態空間(S6)処理、スキャンビュー融合マンバ(SFusion Mamba)、および出力特徴マップの再構築が含まれます。 アルゴリズム2 は、多段フュージョンマンバ(MFusion Mamba)モジュールを説明し、多段エンコーダの特徴整列、粗獭融合、微細融合、デコーダ積分、フューズデコーダ入力機能の生成を含みます。変数とテンソル次元はアルゴリズム内で定義されます。このファイルをダウンロードするには、こちらをクリックしてください。

補助コーディングファイル1。MVM-UNet(MVM-UNet-master)のソースコードパッケージ。 補足的なZIPアーカイブには、本研究で使用されたMVM-UNetの完全なソースコード実装が含まれています。このパッケージには、ネットワークアーキテクチャ、マルチビュー四方向(MV4D)およびマルチステージ融合マンバ(MFusion Mamba)モジュール、設定ファイル、ISIC 2017、ISIC 2018、およびSynapseデータセットのトレーニングおよび評価スクリプト、ユーティリティ関数、そしてこのプロトコルで記述された実験を再現するために必要なプロジェクトドキュメントが含まれています。このパッケージには、インストール手順、ソフトウェア依存関係、データセットの整理、トレーニングおよび推論ワークフローを含むREADMEファイルも含まれています。このファイルをダウンロードするには、こちらをクリックしてください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このプロトコルは、Mambaベースの医療画像セグメンテーションフレームワークであるMVM-UNetを説明しています。この手法は、既存のセグメンテーションモデルの2つの制約に対応するために設計されました。まず、従来のCNNベースの手法は、複雑な医療画像における長距離依存関係や階層的な文脈情報をモデル化する能力が限られています。第二に、トランスフォーマーベースの手法はグローバルなコンテキストをモデル化できますが、通常は計算コストが高くなります 23,25。MVM-UNetはMamba アーキテクチャ 13,14,15,16,17,18,19,20 を採用し、効率的な長距離モデリングを実現し、マルチビュースキャンと多段階特徴融合を導入してセグメンテーションの精度を向上させています。プロトコルの実行と再現性の観点から、本研究で報告された結果と同等の結果を得るためには、いくつかのステップが重要です。まず、データセットの分割、画像リサイズ、マスク補間、正規化戦略、チャネル変換はプロトコルと一貫性を保つべきです。なぜなら、前処理の違いは入力分布やマスク境界を直接変える可能性があるためです。特に、セグメンテーションマスクは非整数ラベル値44を導入しないため、最近傍補間でリサイズする必要があります。次に、入力解像度、バッチサイズ、最適化器設定、学習率スケジュール、ランダムシード、損失重み係数、チェックポイント選択ルール、推論閾値またはARGMAX操作などの訓練構成を比較前に確認すべきです。再現結果が報告値より明らかに低い場合は、まずデータセットの経路、注釈フォーマット、フォアグラウンドとバックグラウンドのラベル慣習、チェックポイントの読み込み、検証またはテストスプリット、メトリクス計算手順を検証する必要があります。境界漏れ、断片的なマスク、または小さな構造の欠落は、通常、前処理、マスク補間、チェックポイント選択、または推論の不整合を示唆します。

MVM-UNetの主な貢献はMV4Dモジュールです。従来の状態空間モデルベースのアーキテクチャ(14,15,16,17,18,19,20)で採用されていた単純な二次元スキャン戦略とは異なり、MV4Dはジグザグ、階層的、スパイラル、ラジアルスキャンのペアを用いて補完的な視覚情報を捉えます。ジグザグスキャンペアは局所的およびグローバルな空間情報のバランスを取るのに役立ち、階層的スキャンペアは多スケールの特徴抽出を強化し、スパイラルスキャンペアは全体の等高線表現を強化し、放射状スキャンペアは局所的なエッジおよび境界の特徴抽出を改善します。SFusion Mambaはこれらの補完的なスキャンモダリティを統合しています。代表的な結果およびアブレーション実験(表4および表5;図9)スキャンパターンの多様性と融合機構の両方がセグメンテーション性能の向上に寄与していることを示しました。もう一つの重要なコンポーネントはMFusion Mambaで、エンコーダとデコーダの間の機能融合モジュールとして機能します。従来のU字型アーキテクチャ、例えばU-Net821、V-Net44、およびその後の多くのバリアント92325は、主に段階ごとのスキップ接続を通じて情報を転送します。この戦略は、補完的な多段エンコーダ表現を完全に活用できない場合があります。MFusion Mambaは、デコード前に粗睍化(Coarse Fusion)とファインフュージョン(Fine Fusion)を組み合わせることでこの制限を解消します。代表的な結果(表6;図10)MFusion Mambaが一貫してセグメンテーション性能を向上させていることを示し、明示的な多段階特徴融合が医療画像セグメンテーションに有益であることを示しています。

MVM-UNetの方法論的貢献は、すべての個別操作を一から発明したものではなく、アーキテクチャレベルの再設計として理解されるべきです。U字型エンコーダ-デコーダアーキテクチャ、残留接続、射影層、マンバ/状態空間モデル(SSM)ブロックは、過去の研究で広く調査されています。8,13,14,15,16,17,18,19,20,21,23,24,25 2944。しかし、これらの要素を直接組み合わせることだけでは、医療画像セグメンテーションの特有の課題に必ずしも解決できるわけではありません。MVM-UNetの新規性は、3つの側面の協調設計にあります。まず、MV4Dモジュールは単一または限定的なスキャンパターンを4つの補完的なスキャンペア分岐に置き換え、空間的連続性、多スケール構造、グローバルな等高線情報、局所境界の詳細をモデルに捉えることを可能にします。次に、SFusion MambaとMVV Blockは、スキャン固有の機能を統合・強化し、次のネットワーク段階に移行します。第三に、MFusion Mambaは復号前に多段階エンコーダ機能を明示的に集約し、従来のスキップ接続82144を補完し、階層情報の利用を改善します。焼灼結果(表4–6;図9および図10)この設計理由をさらに裏付けており、マルチビュースキャン、スキャン固有の融合、アップダウン投影ブランチ、多段階の機能融合がそれぞれセグメンテーション性能の向上に寄与していることを示しています。したがって、MVM-UNetの貢献は、マンバベースの空間モデリングとエンコーダ・デコーダの特徴融合を医療画像セグメンテーションに応用し、タスク特有かつ実験的に検証された統合にあります。

優れた性能を持つにもかかわらず、MVM-UNetにはいくつかの制限があります。まず、入力画像サイズが大きくなるとセグメンテーション性能が一貫して向上しなかったため、現行アーキテクチャでは高解像度画像情報を完全に活用できていない可能性が示唆されました。第二に、このモデルは臨床現場で頻繁に見られる高ノイズや低コントラストの画像条件下で十分に評価されず、セグメンテーションの堅牢性に影響を与える可能性があります。第三に、このモデルは公開されている3つのデータセットで高い性能を達成しましたが、より大規模で多様な医療画像データセットでのさらなる検証が必要です。このプロトコルは他の医療画像セグメンテーションタスクにも適応可能ですが、いくつかの修正は慎重に実装する必要があります。新しいバイナリセグメンテーションタスクでは、ユーザーはデータセットのローダー、正規化パラメータ、入力解像度、前景閾値を修正しつつ、バイナリBCE-Diceの損失と評価手順を維持しなければなりません。新しいマルチクラスセグメンテーションタスクでは、出力クラス数、クラスインデックスマッピング、ワンホットラベル変換、CE-Dice損失設定、クラス別評価指標44を更新する必要があります。グレースケールデータセットの場合、入力チャネル構成はモデルアーキテクチャに合わせて、実装によって単一チャネル入力投影を使用するか、グレースケール画像を繰り返して3チャンネル入力を作成する必要があります。ターゲット構造が非常に小さい場合、境界が弱いまたは曖昧な場合、画像コントラストが訓練データと大きく異なる場合、またはターゲットデータセットに大きなドメインシフトが見られる場合、この手法は最適でない場合があります。このような条件下では、ユーザーは入力解像度、増強戦略、クラスバランス、損失重み付け、または微調整スケジュールを調整しつつ、公正な比較を確実にするために同じ評価プロトコルを維持する必要がある場合があります。

Synapseデータセットにおいて、MVM-UNetは一般的に使われる18ケースのトレーニングと12ケースのテスト区分の下で強力な多臓器断片性能を達成しました。提案された方法は本研究で評価された代表的なベースライン手法の中で最も高い平均DSCを記録しました(表3)が、より新しい手法では異なるトレーニング環境や評価プロトコルの下でシナプスのパフォーマンスが高かったと報告されています29。したがって、MVM-UNetをSynapseで最先端の性能を達成したと表現することは避け、評価された実験環境下での強い性能を達成したと表現します。これらの発見は、MVM-UNetの性能がマンバベースのモデリングによる医療画像セグメンテーション13,14,15,16,17,18,19,20のタスク特有の適応から生じていることを示唆しています。単一のスキャン戦略に依存するのではなく、MVM-UNetは視覚的特徴モデリングを複数の補完的なスキャンビューに分解し、SFusion Mambaを通じて統合します。さらに、MFusion Mambaは、従来のスキップ接続8,21,44を超えた多段エンコーダ機能を明示的に集約することで、エンコーダとデコーダ間の情報フローを改善します。この設計により、提案されたモデルは二元皮膚病変の断片および多臓器断片の両方で高い性能を達成できます。

今後の研究は、高解像度医療画像セグメンテーションのためのMVM-UNetの改善に焦点を当てるべきです。より深い、または適応的なマルチスケールアーキテクチャにより、モデルは高解像度画像情報をより効果的に活用できる可能性があります。今後の研究では、ノイズが多く、コントラストが低く、ドメインシフトが混じった画像条件下でMVM-UNetの堅牢性も評価されるべきです。さらに、提案されたマルチビュースキャン戦略は病変検出4、臓器局在、腫瘍分類、三次元セグメンテーションなど他の医療画像解析課題にも拡張される可能性があります。まとめると、MVM-UNetは医療画像セグメンテーションのための効果的かつ再現性の高いフレームワークを提供します。MV4DモジュールとMFusion Mambaの統合により、モデルは補完的な空間情報、マルチスケールコンテキスト、グローバルな等高線情報、局所的な境界の詳細、多段階の意味的特徴を捉えることができます。ISIC 2017、ISIC 2018、Synapseデータセットで得られた代表的な結果は、提案されたアーキテクチャの有効性を示しています。このプロトコルは、医療画像セグメンテーション13,14,15,16,17,18,19,20のための効率的なSSM/マンバベースのアーキテクチャを開発する研究者にとって実用的な参考資料を提供します。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは競合する金銭的利害関係がないと宣言しています。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は外部からの資金援助を受けていません。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
ハードウェア - GPUワークステーションまたはGPUサーバー機関のコンピューティングプラットフォーム/ローカルワークステーションカスタムビルトのローカルGPUワークステーション;Ubuntu 22.04.1とLinuxカーネル6.8.0;Intel Core i9-13900K CPU;NVIDIA A800 GPU;128 GB RAM;512 GBローカルストレージ。トレーニング、検証、テスト、アブレーション、および推論のみの実験用のコンピューティングプラットフォーム。
ハードウェア - グラフィックス処理ユニット(GPU)NVIDIA CorporationNVIDIA A800 GPU(80 GBメモリ)。GPUによるモデルトレーニングと推論の加速。
ハードウェア - 中央処理ユニット(CPU)Intel Corporation / AMD第13世代Intel Core i9-13900K CPU。データの読み込み、前処理、および実験の実行を行うホストプロセッサ。
ハードウェア - システムメモリ(RAM)機関のコンピューティングプラットフォーム/ローカルワークステーション128 GBシステムRAMデータセットの読み込み、前処理、およびトレーニングに使用するメモリ。
ハードウェア - ストレージ機関のコンピューティングプラットフォーム/ローカルワークステーション2 TB NVMeソリッドステートドライブ。データセット、チェックポイント、ログ、および生成された予測図の保存用ストレージ。
ソフトウェア環境 - オペレーティングシステムCanonical Ltd.推奨:Ubuntu 22.04.1 LTSコンピューティング環境用のオペレーティングシステム。
ソフトウェア環境 - Conda環境Anaconda, Inc. / Miniconda環境名:mvmunet依存関係をインストールし、分離するために使用するPython環境。
ソフトウェア環境 - PythonPython Software FoundationPython 3.8実装と実験実行に使用するプログラミング言語。
ソフトウェア環境 - CUDAツールキットNVIDIA CorporationCUDA Toolkit 11.8PyTorchおよびMamba関連パッケージに必要なGPUコンピューティングバックエンド。
ソフトウェア環境 - cuDNNNVIDIA CorporationcuDNN 8.7.0。PyTorchを通じて使用されるGPU加速ディープラーニングプリミティブ。
Pythonパッケージ - PyTorchPyTorchtorch == 2.0.1モデルのトレーニング、損失の計算、最適化、および推論を行うためのディープラーニングフレームワーク。
Pythonパッケージ - TorchvisionPyTorchtorchvision == 0.14.0前処理と拡張で使用される画像変換ユーティリティ。
Pythonパッケージ - TorchaudioPyTorchtorchaudio == 0.13.0推奨されるPyTorch環境と一緒にインストールされます。
Pythonパッケージ - timmtimm開発者timm == 0.4.12リポジトリ環境指示書に記載されているモデルコンポーネントまたはユーティリティ依存関係。
Pythonパッケージ - tritonOpenAI / Triton開発者triton == 2.0.0GPU加速シーケンスモデリングコンポーネントで使用される依存関係。
Pythonパッケージ - causal-conv1dcausal-conv1d開発者causal_conv1d == 1.0.0Mamba実装に必要な効率的な因果畳み込み依存関係。
Pythonパッケージ - mamba-ssmMamba SSM開発者mamba_ssm == 1.0.1Mamba/S6関連コンポーネントに使用される状態空間シーケンスモデリングパッケージ。
Pythonパッケージ - NumPyNumPy開発者NumPyバージョン1.24.3。数値計算と配列操作。
Pythonパッケージ - SciPySciPy開発者SciPyバージョン1.10.1。科学的計算;scipy.ndimage.zoomはutils.pyでインポートされます。
Pythonパッケージ - SimpleITKInsight Software ConsortiumSimpleITKバージョン2.2.1。utils.pyでインポートされる医療画像の入出力および前処理ユーティリティ。
Pythonパッケージ - MedPyMedPy開発者MedPyバージョン0.4.0。utils.pyでインポートされる医療画像メトリック計算パッケージ。
Pythonパッケージ - scikit-imagescikit-image開発者scikit-imageバージョン0.21.0。READMEに記載されている画像処理依存関係。
Pythonパッケージ - scikit-learnscikit-learn開発者scikit-learnバージョン1.3.2。READMEに記載されている機械学習ユーティリティパッケージ。
Pythonパッケージ - matplotlibMatplotlib開発者Matplotlibバージョン3.7.2。定性的視覚化図の保存に使用されます。
Pythonパッケージ - h5pyh5py開発者h5pyバージョン3.9.0。SynapseテストボリュームのHDF5ファイルサポート。
Pythonパッケージ - thopTHOP開発者THOPバージョン0.1.1.post2209072238。FLOPsとパラメータ関連の計算コストを計算する際に使用されます。
Pythonパッケージ - packagingPython Packaging Authoritypackagingバージョン23.1。READMEに記載されている依存関係。
Pythonパッケージ - pytestpytest開発者pytestバージョン7.4.0。READMEに記載されている依存関係。
Pythonパッケージ - chardetchardet開発者chardetバージョン5.2.0。READMEに記載されている依存関係。
Pythonパッケージ - yacsYACS開発者yacsバージョン0.1.8。READMEに記載されている設定ユーティリティ依存関係。
Pythonパッケージ - termcolortermcolor開発者termcolorバージョン2.3.0。READMEに記載されているログ/ターミナルユーティリティ依存関係。
Pythonパッケージ - submititsubmitit開発者submititバージョン1.4.5。READMEに記載されている実験/ジョブユーティリティ依存関係。
Pythonパッケージ - tensorboardXtensorboardX開発者tensorboardXバージョン2.6.2.2。READMEに記載されているトレーニングログ視覚化ユーティリティ。
Pythonパッケージ - ml-collectionsml_collections開発者ml-collectionsバージョン0.1.1。configs/config_setting_synapse.pyによってインポートされます。
データセット - ISIC 2017 ChallengeデータセットInternational Skin Imaging CollaborationISIC 2017皮膚病変分割データセットバイナリ分割に使用される公開された匿名化された皮膚鏡検査皮膚病変画像とマスク。
データセット - ISIC 2018 Challenge Task 1データセットInternational Skin Imaging CollaborationISIC 2018 Task 1:病変境界分割バイナリ分割に使用される公開された匿名化された皮膚鏡検査皮膚病変画像とマスク。
データセット - Synapse Multi-Atlas Labeling Beyond the Cranial VaultデータセットSynapse / Sage Bionetworksアクセス識別子:syn3193805公開された腹部CT多臓器分割データセット。
データ組織 - ISIC 2017データフォルダ著者/リポジトリのレイアウトdata/isic2017/trainおよびvalidation画像/マスクを含むローカルフォルダを想定しています。
データ組織 - ISIC 2018データフォルダ著者/リポジトリのレイアウト

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang F, et al. Cross co-teaching for semi-supervised medical image segmentation. Pattern Recognit. 2024;152:110485.
  2. Gu Y, et al. Dual-scale enhanced and cross-generative consistency learning for semi-supervised medical image segmentation. Pattern Recognit. 2025;158:111140.
  3. Zhu X, Wang W, Zhang C, Wang H. Polyp-Mamba: A hybrid multi-frequency perception gated selection network for polyp segmentation. Inf Fusion. 2025;115:103161.
  4. Iqbal S, et al. TBConvL-Net: A hybrid deep learning architecture for robust medical image segmentation. Pattern Recognit. 2025;158:111147.
  5. Zhao Z, et al. Balanced feature fusion collaborative training for semi-supervised medical image segmentation. Pattern Recognit. 2025;157:110986.
  6. Zhou T, et al. MambaYOLACT: You only look at Mamba prediction head for head-neck lymph nodes. Artif Intell Rev. 2025;58(6).
  7. Zhao Y, et al. MGF-GCN: Multimodal interaction Mamba-aided graph convolutional fusion network for semantic segmentation of remote sensing images. Inf Fusion. 2025;122:103268.
  8. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional networks for biomedical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2015.
  9. Zhou Z, Siddiquee MMR, Tajbakhsh N, Liang J. UNet++: Redesigning skip connections to exploit multiscale features in image segmentation. IEEE Trans Med Imaging. 2019;39(6):1856-1867.
  10. Shaker A, et al. UNETR++: Delving into efficient and accurate 3D medical image segmentation. IEEE Trans Med Imaging. 2024;43(9):3377-3390.
  11. Zhou HY, et al. nnFormer: Volumetric medical image segmentation via a 3D Transformer. IEEE Trans Image Process. 2023;32:4036-4045.
  12. He A, et al. H2Former: An efficient hierarchical hybrid Transformer for medical image segmentation. IEEE Trans Med Imaging. 2023;42(9):2763-2775.
  13. Zhu L, et al. Vision Mamba: Efficient visual representation learning with bidirectional state space model. In: Proceedings of the 41st International Conference on Machine Learning (ICML). 2024.
  14. Liu Y, et al. VMamba: Visual state space model. Adv Neural Inf Process Syst. 2024;37:103031-103063.
  15. Ma J, Li F, Wang B. U-Mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv. 2024;arXiv:2401.04722.
  16. Wang Z, et al. Mamba-UNet: UNet-like pure visual Mamba for medical image segmentation. arXiv. 2024;arXiv:2402.05079.
  17. Huang T, et al. LocalMamba: Visual state space model with windowed selective scan. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  18. Zhang Z, et al. Motion Mamba: Efficient and long sequence motion generation. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  19. Hu VT, et al. Zigma: A DiT-style zigzag Mamba diffusion model. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  20. Rahman MM, et al. Mamba in vision: A comprehensive survey of techniques and applications. arXiv. 2024;arXiv:2410.03105.
  21. Falk T, et al. U-Net: Deep learning for cell counting, detection, and morphometry. Nat Methods. 2019;16(1):67-70.
  22. Gu R, et al. CA-Net: Comprehensive attention convolutional neural networks for explainable medical image segmentation. IEEE Trans Med Imaging. 2020;40(2):699-711.
  23. Chen J, et al. TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of Transformers. Med Image Anal. 2024;97:103280.
  24. Zhang Z, Zhang W. Pyramid medical Transformer for medical image segmentation. arXiv. 2021;arXiv:2104.14702.
  25. Cao H, et al. Swin-Unet: UNet-like pure Transformer for medical image segmentation. In: European Conference on Computer Vision (ECCV). Springer; 2022.
  26. Chen B, et al. TransAttUNet: Multi-level attention-guided U-Net with Transformer for medical image segmentation. IEEE Trans Emerg Top Comput Intell. 2023.
  27. Jiang S, Li J. TransCUNet: UNet cross-fused Transformer for medical image segmentation. Comput Biol Med. 2022;150:106207.
  28. Wu R, Liu Y, Liang P, Chang Q. H-vmunet: High-order Vision Mamba UNet for medical image segmentation. Neurocomputing. 2025;624:129447.
  29. Liu J, et al. Swin-UMamba: Adapting Mamba-based vision foundation models for medical image segmentation. IEEE Trans Med Imaging. 2024.
  30. Huang X, et al. MISSFormer: An effective Transformer for 2D medical image segmentation. IEEE Trans Med Imaging. 2023;42(5):1484-1494.
  31. Ruan J, et al. MALUNet: A multi-attention and lightweight U-Net for skin lesion segmentation. In: 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). IEEE; 2022.
  32. Ruan J, Xiang S. VM-UNet: Vision Mamba UNet for medical image segmentation. arXiv. 2024;arXiv:2402.02491.
  33. Valanarasu JMJ, Patel VM. UNeXt: MLP-based rapid medical image segmentation network. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2022.
  34. Ren S, Li X. HResFormer: Hybrid residual Transformer for volumetric medical image segmentation. IEEE Trans Neural Netw Learn Syst. 2025;36(6):10558-10566.
  35. Karimijafarbigloo S, Azad R, Kazerouni A, Merhof D. MedScale-Former: Self-guided multiscale Transformer for medical image segmentation. Med Image Anal. 2025;103.
  36. Yan S, et al. Multi-scale convolutional attention frequency-enhanced Transformer network for medical image segmentation. Inf Fusion. 2025;119.
  37. Gao Y, Zhou M, Metaxas DN. UTNet: A hybrid Transformer architecture for medical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2021.
  38. Mei J, et al. SANet: A slice-aware network for pulmonary nodule detection. IEEE Trans Pattern Anal Mach Intell. 2021;44(8):4374-4387.
  39. Hu XZ, Jeon WS, Rhee SY. ATT-UNet: Pixel-wise staircase attention for weed and crop detection. In: 2023 International Conference on Fuzzy Theory and Its Applications (iFUZZY). IEEE; 2023.
  40. Wang X, et al. Transferable normalization: Towards improving transferability of deep neural networks. Adv Neural Inf Process Syst. 2019;32.
  41. Azad R, et al. TransDeepLab: Convolution-free Transformer-based DeepLabV3+ for medical image segmentation. In: International Workshop on Predictive Intelligence in Medicine (PRIME). Springer; 2022.
  42. Ruan J, Gao J, Xie M, Xiang S. Learning multi-axis representation in frequency domain for medical image segmentation. Mach Learn. 2025;114(1):10.
  43. Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press; Cambridge, MA; 2016.
  44. Milletari F, Navab N, Ahmadi SA. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. In: 2016 Fourth International Conference on 3D Vision (3DV). IEEE; 2016.

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

234234UNet

関連記事