方法論記事

MixKNet:医用画像セグメンテーションのためのハイブリッドチャネル畳み込みを用いた修正U字型ネットワーク

DOI:

10.3791/68450

2025年7月15日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究では、ハイブリッド畳み込みとチャネルアテンションを使用してセグメンテーション精度を向上させた軽量のU-Netバリアントを示し、より少ないパラメータでMoNusegとGlaSで最先端の結果を達成します。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人工ニューラルネットワークを用いたコンピュータ画像処理技術は、近年急速に発展し、複数の分野で広く応用されています。医用画像処理では、UNetとその亜種は、病変検出、細胞セグメンテーション、およびポリープセグメンテーションタスクで大きな成功を収めています。本研究では、ネットワークの深さを減らし、ネットワークチャネルを増やすことで、モデルの学習能力を向上させることで、ネットワークパラメータを減少させた修正U字型ネットワークを提示します。深度圧縮による学習能力の低下を打ち消すために、元のネットワークの畳み込みモジュールを置き換えるハイブリッドチャネル畳み込みモジュールが導入されています。このモデルは、層と点畳み込み層の間にチャネルアテンションメカニズムを導入して、実用的なチャネル特徴抽出能力を向上させます。また、この記事では、混合深度畳み込みを使用すると、セグメンテーション ターゲットのサイズ スパンを効果的に解決できるため、1 つのモデルを複数のデータ セットに適合させることが困難になると結論付けています。提案されたモデルは、MoNusegとGlaSという2つの一般的な公開データセットで最先端の結果を達成し、サイコロの平均増加率はそれぞれ1.0%と1.37%です。変更されたモデルの合計パラメータは1.71Mに減少し、UCtransNetの65.6Mパラメータと比較して38.6倍の削減になります。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

医用画像のセグメンテーションは、診断、治療計画、疾患モニタリングなど、さまざまな臨床アプリケーションで重要です。特徴量エンジニアリングアルゴリズムに基づく従来の画像処理手法は、現代の医療環境で生成される大量のデータを処理するのにもはや適していません。幸いなことに、人工ニューラルネットワーク技術の進歩とコンピュータハードウェア機能の向上により、大規模なニューラルネットワークモデルの学習と展開が可能になりました。その結果、機械学習モデルに基づくコンピュータビジョン処理アルゴリズムが継続的に開発され、さまざまな分野で適用されています。

医用画像のセマンティックセグメンテーションにおける最も代表的なモデル構造は、エンコードデコードアーキテクチャを備えたUNet1 です。このモデルでは、最初にマルチレベル エンコーダーを使用して、入力画像からさまざまなスケールの特徴を抽出します。次に、デコーダは、対応するレベルのエンコーダによって出力されたセマンティック特徴をスキップ接続として組み合わせながら、段階的にアップサンプリングします。ただし、UNet アーキテクチャのパフォーマンスは、いくつかの方法を適用することでさらに向上させることができます。例えば、アテンションメカニズムは、畳み込みニューラルネットワークのパフォーマンスを向上させるのに効果的であることが示されています。これらのメカニズムは、入力データの本質的な特徴を選択的に強調できるため、表現学習とセグメンテーションの精度が向上します。

現在、多くの研究者は、エンコーダーによって抽出された特徴をデコード段階で効果的に融合することに焦点を当てています。UNet の最も一般的なバリアントには、Attention UNet2、Recurrent UNet3、V-Net4 などがあります。これらのアプローチは、空間的アテンションなどのアテンションメカニズム5を使用して、特徴マップの情報領域を強調し、非情報領域を抑制する。さらに、一部のバリアントには、再帰型ニューラルネットワークが組み込まれており、医療画像のシーケンシャルな性質をモデル化し、特徴表現を改善します。VGG6、ResNet7、DenseNet8などの事前学習モデルは、大規模なデータセットから学習した豊富な知識を活用してU字型ネットワークのパフォーマンスを向上させるために広く使用されています。さらに、セルフアテンションやマルチヘッドアテンションなどのトランスフォーマーメカニズムが長期モデルの依存関係に導入され、グローバルなコンテキスト情報をキャプチャすることで、セグメンテーションのパフォーマンスが向上しています。

ただし、これらのバリアントは元のUNet1よりも改善されていますが、さまざまなスケールや形状の複雑な医療画像の処理には依然として一定の制限があります。さらに、これらのバリアントの複雑さが増すと、多くの場合、計算コストが高くなり、トレーニング時間が長くなり、実際の環境での適用が制限されます。

UNet1 アーキテクチャを強化するために、MixKNet(Mix Kernel Size U-shape Net)という名前の修正モデルが提案されています。これは、ネットワークの深さを減らしながらチャネル数を増やして学習能力を向上させるものです。ただし、深さが減少すると、全体的なパフォーマンスが低下する可能性があります。この問題を軽減するために、元の畳み込みニューラルモジュールに代わるハイブリッドチャネル畳み込みモジュールが導入されています。このモジュールには、深さ方向と点方向の畳み込み層の間にチャネル アテンション メカニズムが組み込まれており、効果的なチャネル特徴を抽出するモデルの能力を強化することを目的としています。

実用化を導くためには、提案された方法が比較的小規模な医用画像データセットで評価され、個々の画像解像度が500×500から1000×1000ピクセルの範囲であることに注意することが重要です。モデルのトレーニングでは、すべての画像のサイズが 224 ピクセル× 224 ピクセルに変更されました。この実装は、1 つの NVIDIA RTX 3090 GPU で PyTorch を使用して実行されました。これらの操作パラメータは、この方法が中程度の実験セットアップで計算可能であり、限られたデータセットサイズに適応可能であることを示唆しています。

結論として、この記事では、U字型ネットワーク構造の新しい変更を提示し、ハイブリッドチャネル畳み込みモジュールとチャネルアテンションメカニズムを紹介します。これにより、どちらも医用画像データセットのセグメンテーション性能が向上します。この作業の主な貢献は次のとおりです:(1)元の畳み込みニューラルモジュールを置き換えるハイブリッド深化畳み込みモジュールを備えた修正されたU字型ネットワーク構造の提案。(2)深層畳み込み層と点畳み込み層の間にチャネルアテンションメカニズムを導入し、モデルの効果的なチャネル特徴抽出能力を向上させます。(3)MoNuseg9 核セグメンテーションデータセットの2つの一般的な公開データセットで、モデルパラメータが大幅に少なく(UCtransNet10 の64Mパラメータと比較して)、GlaS11 グランドセグメンテーションデータセットのパフォーマンスが向上した、最先端の結果を同時に達成しました。

この記事の残りの部分は、次のように構成されています。ステップ2では、UNet1 とその医用画像セグメンテーションのバリエーションに関する以前の研究を包括的にレビューします。既存のアプローチの長所と限界、およびアテンションメカニズム、混合深さ畳み込みネットワーク、およびセグメンテーションモデルでのそれらのアプリケーションに関する関連研究について検討します。ステップ3では、UNet構造の変更、チャネルアテンションメカニズムの統合、混合深度畳み込みの使用など、提案されたMixKNetモデルのアーキテクチャについて詳しく説明します。ステップ4では、広範な実験の結果を報告し、各コンポーネントの寄与を評価するためのディスカッションとアブレーション研究を伴います。最後に、ステップ5では論文を締めくくり、将来の研究の潜在的な方向性を概説します。

このセクションでは、まず、医用画像セグメンテーションにおけるUNetとそのバリエーションに関する先行研究のレビューから始め、既存の方法の長所と限界を概説します。さらに、アテンションメカニズムとセグメンテーションモデルにおけるそれらの応用に関する関連研究についても議論します。セグメンテーションのパフォーマンスを向上させるための深さ方向の畳み込み技術に関する最近の開発についても検討します。提案されたMixKNet(c)と他のモデルとの比較分析を 図1に示します(破線はスキップ接続を示しています)。

UNetとそのバリエーション
UNetアーキテクチャは、2015年にRonnebergerらによって最初に提案され、1 以来、医療画像のセグメンテーションで広く使用されています。このモデルは、エンコード パスとデコード パスで構成されます。エンコーダーは入力画像から高レベルの特徴を抽出し、デコーダーは特徴をアップサンプリングして組み合わせ、セグメンテーション マップを生成します。それ以来、UNetアーキテクチャにはさまざまな変更が加えられ、医用画像のセグメンテーションにおけるパフォーマンスが向上しています。最も一般的な変更の 1 つは、セグメンテーションの精度が向上することが示されているスキップ接続の導入です。Zhou et al.12 は、高密度のスキップ接続を使用して、モデルが空間情報をより適切に保持できるようにする UNet バリアントを提案しました。

UNet アーキテクチャのもう 1 つの一般的な変更は、アテンション メカニズムの追加です。これらのメカニズムは、モデルが最も重要な特徴を選択的に強調するのに役立ち、表現学習とセグメンテーションの精度の向上につながります。アテンションメカニズムを持つバリアントの例としては、アテンションUNet2、アテンションゲート13を持つResUNet、およびアテンションゲート14を持つDense-UNetなどがあります。上記の変更に加えて、UNetアーキテクチャの他の多くのバリアントが医用画像のセグメンテーションのために提案されています。UCTransNet10 は、スキップ接続と Transformer モジュールを組み込んだ U-Net アーキテクチャのバリアントです。UCTransNet10 のスキップ接続は、チャネルごとの観点から再考され、機能の再利用が向上し、パラメーターの数が削減されます。Transformer モジュールは、長期的な依存関係をキャプチャし、翻訳品質を向上させるために追加されました。UCTransNet10 は、いくつかの機械翻訳ベンチマークで最先端の結果を達成していることが示されています。Zihanらは、LViT15と呼ばれる深層学習モデルを提案し、これを医用画像解析タスクに適用しました。LViT15 の半教師ありバージョンを拡張し、画像データの品質不足を補うために、彼らはExponential Pseudo Label Iterationメカニズム(EPI)を提案しました。さらに、画像の局所的な特徴を保持するために、重要な画像の特徴に選択的に焦点を合わせるピクセルレベルアテンションモジュール(PLAM)を提案しました。

アテンションメカニズム
アテンションメカニズムは、機械学習、特に自然言語処理とコンピュータービジョンで広く研究されてきました。近年では、画像セグメンテーションなどの医用画像解析タスクにもアテンションメカニズムが応用されています。Bahdanauら16 は、翻訳の品質を向上させるために、ニューラル機械翻訳にアテンションメカニズムを導入しました。このメカニズムにより、モデルは入力シーケンスの関連部分に選択的に焦点を合わせることができ、翻訳品質が向上します。それ以来、画像解析タスクに対して様々なアテンションメカニズムが提案されてきました。アテンションメカニズムの一般的なタイプの1つは、空間アテンションメカニズムであり、これは、重要度に基づいて特徴マップの各ピクセルに重みを適用することを含みます。例えば、Guoら17 は、網膜血管のセグメンテーションのタスクのための空間的注意メカニズムを提案しました。このメカニズムでは、ゲート メカニズムを使用して空間フィーチャの重み付けを調整し、ベッセルと非ベッセル ピクセルを区別するモデルの能力を向上させます。別のタイプのアテンション メカニズムはチャネル アテンションであり、チャネル間で特徴マップの重みを調整することに焦点を当てています。Hu et al.18 は、特徴マップにチャネルごとの注意を当てて画像分類タスクのパフォーマンスを向上させる SENet (Squeeze-and Excitation Network) を提案しました。最近では、アテンションメカニズムが畳み込みニューラルネットワーク(CNN)と組み合わされて、画像セグメンテーションタスクが行われています。例えば、Chenら19 は、空間的およびチャネル的な注意メカニズムを組み合わせた脳腫瘍のセグメンテーションのための注意誘導ネットワークを提案しました。

医用画像解析とリモートセンシングのためのセミ教師あり学習とマルチモーダル学習の最近の進歩は、有望なパフォーマンスの向上を示しています。Yang et al.20 は、クロスモダリティの生成学習と半教師あり戦略を活用する新しい不対マルチモーダル セグメンテーション フレームワークである UMSCS を提案しました。Zhangらは、いくつかの最先端の技術を紹介しました:半教師ありセグメンテーションのための証拠強化三分岐一貫性モデル21、医用画像セグメンテーション22のための自己認識およびクロスサンプルプロトタイプ学習フレームワーク22、航空宇宙領域における合成開口レーダー(SAR)ジャミング認識のための時間周波数認識階層的特徴最適化アプローチ23.これらの研究は、医療とエンジニアリングの両方のイメージングタスクにおけるハイブリッド監視とドメイン認識特徴モデリングの重要性を総合的に強調しています。

深さ方向畳み込み
深さ方向の畳み込みは、入力特徴マップのチャネルごとの相関をキャプチャするように設計されており、畳み込みニューラル ネットワークの効率と精度を向上させることが示されています。

最も早く、最も影響力のある深さ方向の畳み込みモデルの1つは、2017年にHowardらによって提案されたMobileNet24です。MobileNet は、深さ方向の分離可能な畳み込み (深さ方向の畳み込みとそれに続く点単位の畳み込みを適用する) を使用して、畳み込み層に必要なパラメーターと計算の数を減らします。これにより、MobileNetは、従来の畳み込みニューラルネットワークよりも大幅に少ないパラメータを使用しながら、画像分類タスクで最先端の精度を達成できます。MobileNet の導入以来、ShuffleNet25、Xception26、ResNeXt27 など、他にも多くの深さ方向の畳み込みアーキテクチャが提案されています。これらのモデルは、深層畳み込みの具体的な実装が異なりますが、精度を維持または向上させながら畳み込み層の計算複雑さを軽減するという目標はすべて共有しています。深層畳み込みはセマンティックセグメンテーションのタスクにも適用されており、PSPNet28 などのモデルは深さ方向の分離可能な畳み込みを使用して、大規模な畳み込み層の計算とメモリの必要量を削減しています。MixNet29 は、複数のカーネル サイズを使用してさまざまなスケールで特徴をキャプチャする混合深度ワイズ畳み込みを導入することで、ディープワイズ畳み込みの概念をさらに拡張します。これは、同等のパラメータとFLOPを維持しながら、他の最先端のモデルを凌駕することが示されています。これらのモデルは、さまざまなセマンティックセグメンテーションタスクにおいて、従来の畳み込みニューラルネットワークよりも精度と効率が大幅に向上していることを実証しています。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このセクションでは、医用画像のセグメンテーションのために提案されているMixKNetアーキテクチャについて説明します。MixKNet モデルは、UNet アーキテクチャを拡張し、アテンション メカニズムと混合された深さ方向の畳み込み層を組み込んでいます。この調査で使用したソフトウェアは、 資料の表に記載されています。

1. 全体的なアーキテクチャ

  1. 図2に示すMixKNetアーキテクチャは、エンコーダとデコーダで構成される標準のUNet構造に従います。入力形状を 224 × 224 × 3 に設定します。エンコーダーでは、2 つの DownBlock モジュールを使用します。それぞれに 1×1 の深さ方向の畳み込み、2×2 の最大プーリング レイヤー、および [1, 3, 5] や [3-13] などのカーネル サイズのマルチカーネル畳み込み (MDConv) が含まれています。
  2. デコーダーでは、2 つの UpBlock モジュールを使用します (それぞれがバイリニア アップサンプリング、スキップ接続連結、1×1 深度方向の畳み込み、マルチカーネル畳み込みを実行します)。
  3. 各畳み込みブロックの後に ReLU アクティベーションを使用します。最終的な 1×1 畳み込みを適用して出力を生成し、その後に Sigmoid のアクティブ化でバイナリ セグメンテーションを行うか、マルチクラス タスクの外部 Softmax を非アクティブのままにします。

2.平らにされたU字型

注: ニューラル ネットワーク アーキテクチャの深さを減らして、計算の複雑さとモデル サイズを減らしますが、複雑なデータ表現を学習する能力が低下する可能性があることに注意してください。

  1. 図 3 に示すように、4 レベルの UNet アーキテクチャを 2 レベルのバージョンに縮小して、コア エンコードおよびデコード コンポーネントを保持しながらモデル パラメーターの数を減らします。
    1. エンコーダーとデコーダーの両方のパスからレベル 3 と 4 を削除してフラット化されたアーキテクチャを構築し、レベル 2 で機能接続を保持します。
    2. ダウンサンプリング操作とアップサンプリング操作は、深さの削減に一致するように調整します。ボトルネックの前には 1 つのダウンサンプリング ステップを使用し、ボトルネックの後には 1 つのアップサンプリング ステップを使用します。
      注: この深さの減少は、入力と出力の間の複雑な関係をキャプチャしない可能性があるため、モデルの学習能力を低下させる可能性があります。各モデル層の基本畳み込みチャネルの数を増やすと、モデルの識別特性を学習する能力を強化することで、この制限を克服できます。畳み込みチャネルが増えると、モデルは入力データ内のより複雑なパターンと関係をキャプチャでき、深さの減少を補い、パフォーマンスが向上します。
  2. 畳み込みチャネルの数を増やすと、モデルの計算の複雑さとメモリ使用量も増加し、トレーニング速度と推論速度とのトレードオフが生じる可能性があることを考慮してください。モデル容量と計算効率の適切なバランスを見つけます。

3. エンコーダーのカーネルサイズを混在させる

  1. エンコーダのパフォーマンスを向上させるには、 図 4 に示すように、DC-CA (Depthwise Convolution and Channel Attention) モジュールで混合カーネル サイズ アプローチを採用します。単一のカーネルサイズに頼るのではなく、さまざまなカーネルサイズ(1、3、5、7、9、11、13など)と並行して複数の深さ方向の畳み込みを適用し、複数の受容野で特徴を抽出します。
  2. 連結する前に、バッチ正規化とReLUアクティベーションを各ブランチに個別に適用します。各カーネル分岐からの出力をチャネル次元に沿って連結します。
  3. 連結後にポイント単位の 1×1 畳み込みを使用してフィーチャを融合し、固定数の出力チャネルに投影します。これにより、次のレイヤーの予想される入力サイズとの一貫性が維持されます。
    注: 混合深さ方向の畳み込み層は、カーネル サイズが異なる複数の深さ方向の畳み込みと、それに続く点方向の畳み込みで構成されます。この設計により、医用画像のセグメンテーションタスクで重要なさまざまなスケールで特徴をキャプチャできます。最初のモジュールは、受容野を増やすために 3 つのカーネル サイズ (1、3、5) を使用し、2 番目のモジュールは、より大きなカーネル サイズとより多くのグループ (具体的には 3、5、7、9、11、13) を使用します。

4. チャネルの注意

  1. チャネル アテンション メカニズムを DC-CA モジュールに統合して、フィーチャの表現を強化します。
    1. 1×1 畳み込みと "same" パディングを使用して、チャネルごとのアテンション マップを生成します。空間次元全体にグローバル平均プーリングを適用して、各チャネルのコンパクトな記述子を生成します。
    2. ReLU 活性化を挟んだ 2 つの 1×1 畳み込みで構成される軽量畳み込みネットワークを使用します。チャネル間でのウェイトシェアリングを避ける - チャネルごとに固有のアテンションウェイトを学習します。
    3. 最終出力にシグモイド活性化を適用して、正規化されたアテンション スコアを取得します。入力特徴マップの重み付けをチャネル単位の乗算 変更します。
      注:入力テンソルを xとします。チャネル・アテンションは、次の式によって実装されます。
      (アテンション)_tensor = σ(conv(ReLU(conv(x)))) (1)
      ここで、σ はシグモイド活性化関数、conv は畳み込み演算、ReLU は整流線形ユニット活性化関数を表します。
  2. アテンション テンソルで適応平均プーリング演算を実行し、その後、異なるカーネル サイズ y で畳み込み後の出力テンソルのサイズに一致するように拡張することで、アテンション マップを取得します
    attention = expand(avg_pool([attention]_tensor),size(y)) (2)
  3. 入力テンソル y とアテンション マップの要素ごとの乗算を実行して、出力テンソル z を計算します。
    z = z * 注意 (3)
    ここで、* は要素ごとの乗算を表します

5. データセット

注:表1表2に示すように、この研究では、GlaS(Sirinukunwattana et al.11)とMoNuSeg(Kumar et al.9)の2つの公開されている医用画像データセットが利用されています。

  1. デジタル病理スキャナーを使用して取得し、組織サンプル内の個々の腺構造をセグメント化するために手動で注釈を付けた腺セグメンテーションデータセット(Sirinukunwattana et al.11)を使用します。
    注: データセットは 165 枚の画像で構成され、各画像の解像度は 500 × 500 ピクセルで、対応するグラウンド トゥルース セグメンテーション マスクも使用されています。MoNuSegデータセット(Kumar et al.9)は、51枚の微細な原子核の画像で構成されており、各画像は1000ピクセル×1000ピクセルの解像度を持っています。

6. 実施内容

  1. PyTorch を使用して、1 つの NVIDIA RTX 3090 GPU にモデルを実装します。オペレーティングシステムとしてUbuntu22.04を使用します。
  2. すべての入力画像のサイズを 224 ピクセル× 224 ピクセルの固定サイズに変更します。データ拡張技術を適用して、トレーニングの多様性を強化します。
    1. オーグメンテーションは、水平方向のフリップ→垂直方向のフリップ、回転→回転→ガンマ補正→対数変換→ランダムスケーリングの順にランダムに適用します。
    2. ランダムな水平方向の反転を0.5の確率で、垂直方向の反転を0.5の確率で、±15度以内の回転を0.5の確率で適用します。
    3. ガンマ補正を 0.3 の確率で、対数変換を 0.3 の確率で、スケール係数が 0.9 から 1.1 のランダム スケーリングを 0.3 の確率で適用します。
    4. 平均値 [0.485, 0.456, 0.406] と標準偏差 [0.229, 0.224, 0.225] を使用して画像を正規化します。
  3. Adam オプティマイザーを使用して、学習率 0.001、バッチ サイズ 4 でモデルに学習させます。ウォーム リスタートの学習率スケジューリング手法を使用したコサイン アニーリングを使用して、学習率スケジュールに変動性を導入し、局所最適値への収束を防ぎます。
    注: PyTorch の組み込みtorch.optim.lr_schedulerを使用します。CosineAnnealingWarmスケジューラを再起動します。オプティマイザとスケジューラは、次のように実装されました。
    オプティマイザー = torch.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    scheduler = torch.optim.lr_schedulerです。コサインアニーリングウォームリスタート(
    オプティマイザ、T_0=10、T_mult=2、eta_min=1e-6)
    ここで、T_0=10 は最初の再起動前のエポック数、T_mult=2 は各サイクル後の再起動期間を 2 倍に、eta_min=1e-6 は最小学習率を設定します。各エポックの終了時に学習率を更新するには、scheduler.step() を呼び出します。
  4. 損失関数としてバイナリクロスエントロピーを使用します。オーバーフィットを防ぐために、早期停止を適用してください。最大 5000 エポックでモデルをトレーニングします。
  5. 平均 Intersection over Union (mIoU) と Dice 係数を使用してモデルのパフォーマンスを評価します。
    サイコロ =(2|A∩B|)/(|A|+|B|)(4)
    IoU=(|A∩B|)/(|A∪B|)(5)
    注: mIoU は、予測されたセグメンテーション マスクとグラウンド トゥルース セグメンテーション マスクの交差とそれらの結合の比率です。同時に、サイコロ係数は、予測セグメンテーション マスクとグラウンド トゥルース セグメンテーション マスクの合計に対する交差の 2 倍の比率です。
  6. 小さなデータセットに対して、5分割交差検証を3回行い、合計15回の評価を行い、厳密な評価を行います。各ラウンドで交差検証分割をランダムにシャッフルして、フォールド間の変動性を確保します。クラス分布に基づいてフォールドを層化し、各フォールド内のラベルバランスを維持します。
  7. フォールド全体の平均パフォーマンスを計算して、局所最適値への収束のリスクを軽減します。統計的検定を実行して、提案されたアプローチが同等の方法よりも統計的に有意な改善を達成することを実証します。
  8. トレーニング中の代表的な検証予測を 図 5 に示して、セグメンテーション品質の漸進的な改善を示します。トレーニングが完了したら、検証パフォーマンス (mIoU や Dice スコアの最高値など) に基づいて、最もパフォーマンスの高いモデル チェックポイントを読み込みます。
    1. 検証セットでモデルを実行し、保存されたパラメーターを使用して予測されたセグメンテーション マスクを生成します。
    2. Matplotlib を使用して、入力画像、グラウンド トゥルース マスク、および予測マスクを並べて表示することで、結果を可視化します。
    3. セグメンテーション性能における提案手法の優位性を強調するために、可視化で代表的な領域を赤枠でマークします。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

最先端の方法との比較
MixKNetのアーキテクチャは、GlaSとMoNuSegの2つの医用画像セグメンテーションデータセットで評価され、この分野の最先端の手法と比較されています。評価は、 表3に示すように、提案された方法といくつかの比較可能なモデルのサイコロとIoUスコアを報告することによって実施されました。その結果、MixKNetアーキテクチャは他のモデルよりも優れており、両方のデータセットで最も高い平均サイコロスコアとIoUスコアを達成していることが示されています。GlaS11データセットでは、提案されたMixKNetは、他のどのモデルよりも高い平均サイコロスコア91.18%と平均IoUスコア84.51%を達成しました。MoNuSeg9データセットでは、提案されたMixKNetは、それぞれ80.45%と67.55%の最高平均サイコロスコアと67.55%のIoUスコアも達成しました。これらの結果は、MixKNetアーキテクチャが医用画像のセグメンテーションに非常に効果的であり、最先端の方法よりも...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究では、医用画像セグメンテーションのためのUNet1 アーキテクチャの新たな修正版であるMixKNetを紹介し、混合深度畳み込みとチャネルアテンションメカニズムを統合して、計算の複雑さを大幅に軽減しながらセグメンテーションの性能を向上させます。ハイブリッド チャネル畳み込みは、別々のチャネル グループで動作する複数の畳み込みカーネルを結合します。この設計により、ネットワークは、同じレイヤー内の異なる受容野スケールで多様な空間的および文脈的特徴をキャプチャできるため、ローカル構造とグローバル構造の両方を表現するモデルの能力が向上します。すべてのチャネルを均一に扱う標準的な畳み込みとは異なり、このハイブリッド戦略は、計算コストの増加を最小限に抑えながら表現の柔軟性を高めます。

一方、チャネル アテンションを組み込むことで、モデルは関連性に応じて特徴マップの重みを適応的に再調整できます。理論的には、このメカニズムは動的な特徴選択の一形態として機能し、情報量が少ない活性...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者は、競合する金銭的利益またはその他の利益相反を宣言しません。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

寧波市の 2023 年社会福祉研究プロジェクトの第 2 バッチ: オントロジーと NLP に基づく通信ネットワーク詐欺の特定のための主要技術の研究と応用 (2023S169)。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
Linux OS (Ubuntu 22.04) 各種 (オープンソースコミュニティ)該当なし(バージョン 22.04 LTS)開発用オープンソースオペレーティングシステム
https://releases.ubuntu.com/22.04/
NVIDIA RTX 3090 GPUNVIDIA3090高性能 GPU
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationN/A (バージョン > 3.8)AI/ML開発のためのプログラミング言語
https://www.python.org/
PyTorchMeta AI N/A (Version 1.13)オープンソースの機械学習フレームワーク
https://pytorch.org/
Visual Studio Code (VS Code)MicrosoftN/A軽量で強力なコードエディタ
https://code.visualstudio.com/
ディープラーニング用

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

U Net
動画は近日公開

関連記事