この研究では、ハイブリッド畳み込みとチャネルアテンションを使用してセグメンテーション精度を向上させた軽量のU-Netバリアントを示し、より少ないパラメータでMoNusegとGlaSで最先端の結果を達成します。
方法論記事
この研究では、ハイブリッド畳み込みとチャネルアテンションを使用してセグメンテーション精度を向上させた軽量のU-Netバリアントを示し、より少ないパラメータでMoNusegとGlaSで最先端の結果を達成します。
人工ニューラルネットワークを用いたコンピュータ画像処理技術は、近年急速に発展し、複数の分野で広く応用されています。医用画像処理では、UNetとその亜種は、病変検出、細胞セグメンテーション、およびポリープセグメンテーションタスクで大きな成功を収めています。本研究では、ネットワークの深さを減らし、ネットワークチャネルを増やすことで、モデルの学習能力を向上させることで、ネットワークパラメータを減少させた修正U字型ネットワークを提示します。深度圧縮による学習能力の低下を打ち消すために、元のネットワークの畳み込みモジュールを置き換えるハイブリッドチャネル畳み込みモジュールが導入されています。このモデルは、層と点畳み込み層の間にチャネルアテンションメカニズムを導入して、実用的なチャネル特徴抽出能力を向上させます。また、この記事では、混合深度畳み込みを使用すると、セグメンテーション ターゲットのサイズ スパンを効果的に解決できるため、1 つのモデルを複数のデータ セットに適合させることが困難になると結論付けています。提案されたモデルは、MoNusegとGlaSという2つの一般的な公開データセットで最先端の結果を達成し、サイコロの平均増加率はそれぞれ1.0%と1.37%です。変更されたモデルの合計パラメータは1.71Mに減少し、UCtransNetの65.6Mパラメータと比較して38.6倍の削減になります。
医用画像のセグメンテーションは、診断、治療計画、疾患モニタリングなど、さまざまな臨床アプリケーションで重要です。特徴量エンジニアリングアルゴリズムに基づく従来の画像処理手法は、現代の医療環境で生成される大量のデータを処理するのにもはや適していません。幸いなことに、人工ニューラルネットワーク技術の進歩とコンピュータハードウェア機能の向上により、大規模なニューラルネットワークモデルの学習と展開が可能になりました。その結果、機械学習モデルに基づくコンピュータビジョン処理アルゴリズムが継続的に開発され、さまざまな分野で適用されています。
医用画像のセマンティックセグメンテーションにおける最も代表的なモデル構造は、エンコードデコードアーキテクチャを備えたUNet1 です。このモデルでは、最初にマルチレベル エンコーダーを使用して、入力画像からさまざまなスケールの特徴を抽出します。次に、デコーダは、対応するレベルのエンコーダによって出力されたセマンティック特徴をスキップ接続として組み合わせながら、段階的にアップサンプリングします。ただし、UNet アーキテクチャのパフォーマンスは、いくつかの方法を適用することでさらに向上させることができます。例えば、アテンションメカニズムは、畳み込みニューラルネットワークのパフォーマンスを向上させるのに効果的であることが示されています。これらのメカニズムは、入力データの本質的な特徴を選択的に強調できるため、表現学習とセグメンテーションの精度が向上します。
現在、多くの研究者は、エンコーダーによって抽出された特徴をデコード段階で効果的に融合することに焦点を当てています。UNet の最も一般的なバリアントには、Attention UNet2、Recurrent UNet3、V-Net4 などがあります。これらのアプローチは、空間的アテンションなどのアテンションメカニズム5を使用して、特徴マップの情報領域を強調し、非情報領域を抑制する。さらに、一部のバリアントには、再帰型ニューラルネットワークが組み込まれており、医療画像のシーケンシャルな性質をモデル化し、特徴表現を改善します。VGG6、ResNet7、DenseNet8などの事前学習モデルは、大規模なデータセットから学習した豊富な知識を活用してU字型ネットワークのパフォーマンスを向上させるために広く使用されています。さらに、セルフアテンションやマルチヘッドアテンションなどのトランスフォーマーメカニズムが長期モデルの依存関係に導入され、グローバルなコンテキスト情報をキャプチャすることで、セグメンテーションのパフォーマンスが向上しています。
ただし、これらのバリアントは元のUNet1よりも改善されていますが、さまざまなスケールや形状の複雑な医療画像の処理には依然として一定の制限があります。さらに、これらのバリアントの複雑さが増すと、多くの場合、計算コストが高くなり、トレーニング時間が長くなり、実際の環境での適用が制限されます。
UNet1 アーキテクチャを強化するために、MixKNet(Mix Kernel Size U-shape Net)という名前の修正モデルが提案されています。これは、ネットワークの深さを減らしながらチャネル数を増やして学習能力を向上させるものです。ただし、深さが減少すると、全体的なパフォーマンスが低下する可能性があります。この問題を軽減するために、元の畳み込みニューラルモジュールに代わるハイブリッドチャネル畳み込みモジュールが導入されています。このモジュールには、深さ方向と点方向の畳み込み層の間にチャネル アテンション メカニズムが組み込まれており、効果的なチャネル特徴を抽出するモデルの能力を強化することを目的としています。
実用化を導くためには、提案された方法が比較的小規模な医用画像データセットで評価され、個々の画像解像度が500×500から1000×1000ピクセルの範囲であることに注意することが重要です。モデルのトレーニングでは、すべての画像のサイズが 224 ピクセル× 224 ピクセルに変更されました。この実装は、1 つの NVIDIA RTX 3090 GPU で PyTorch を使用して実行されました。これらの操作パラメータは、この方法が中程度の実験セットアップで計算可能であり、限られたデータセットサイズに適応可能であることを示唆しています。
結論として、この記事では、U字型ネットワーク構造の新しい変更を提示し、ハイブリッドチャネル畳み込みモジュールとチャネルアテンションメカニズムを紹介します。これにより、どちらも医用画像データセットのセグメンテーション性能が向上します。この作業の主な貢献は次のとおりです:(1)元の畳み込みニューラルモジュールを置き換えるハイブリッド深化畳み込みモジュールを備えた修正されたU字型ネットワーク構造の提案。(2)深層畳み込み層と点畳み込み層の間にチャネルアテンションメカニズムを導入し、モデルの効果的なチャネル特徴抽出能力を向上させます。(3)MoNuseg9 核セグメンテーションデータセットの2つの一般的な公開データセットで、モデルパラメータが大幅に少なく(UCtransNet10 の64Mパラメータと比較して)、GlaS11 グランドセグメンテーションデータセットのパフォーマンスが向上した、最先端の結果を同時に達成しました。
この記事の残りの部分は、次のように構成されています。ステップ2では、UNet1 とその医用画像セグメンテーションのバリエーションに関する以前の研究を包括的にレビューします。既存のアプローチの長所と限界、およびアテンションメカニズム、混合深さ畳み込みネットワーク、およびセグメンテーションモデルでのそれらのアプリケーションに関する関連研究について検討します。ステップ3では、UNet構造の変更、チャネルアテンションメカニズムの統合、混合深度畳み込みの使用など、提案されたMixKNetモデルのアーキテクチャについて詳しく説明します。ステップ4では、広範な実験の結果を報告し、各コンポーネントの寄与を評価するためのディスカッションとアブレーション研究を伴います。最後に、ステップ5では論文を締めくくり、将来の研究の潜在的な方向性を概説します。
このセクションでは、まず、医用画像セグメンテーションにおけるUNetとそのバリエーションに関する先行研究のレビューから始め、既存の方法の長所と限界を概説します。さらに、アテンションメカニズムとセグメンテーションモデルにおけるそれらの応用に関する関連研究についても議論します。セグメンテーションのパフォーマンスを向上させるための深さ方向の畳み込み技術に関する最近の開発についても検討します。提案されたMixKNet(c)と他のモデルとの比較分析を 図1に示します(破線はスキップ接続を示しています)。
UNetとそのバリエーション
UNetアーキテクチャは、2015年にRonnebergerらによって最初に提案され、1 以来、医療画像のセグメンテーションで広く使用されています。このモデルは、エンコード パスとデコード パスで構成されます。エンコーダーは入力画像から高レベルの特徴を抽出し、デコーダーは特徴をアップサンプリングして組み合わせ、セグメンテーション マップを生成します。それ以来、UNetアーキテクチャにはさまざまな変更が加えられ、医用画像のセグメンテーションにおけるパフォーマンスが向上しています。最も一般的な変更の 1 つは、セグメンテーションの精度が向上することが示されているスキップ接続の導入です。Zhou et al.12 は、高密度のスキップ接続を使用して、モデルが空間情報をより適切に保持できるようにする UNet バリアントを提案しました。
UNet アーキテクチャのもう 1 つの一般的な変更は、アテンション メカニズムの追加です。これらのメカニズムは、モデルが最も重要な特徴を選択的に強調するのに役立ち、表現学習とセグメンテーションの精度の向上につながります。アテンションメカニズムを持つバリアントの例としては、アテンションUNet2、アテンションゲート13を持つResUNet、およびアテンションゲート14を持つDense-UNetなどがあります。上記の変更に加えて、UNetアーキテクチャの他の多くのバリアントが医用画像のセグメンテーションのために提案されています。UCTransNet10 は、スキップ接続と Transformer モジュールを組み込んだ U-Net アーキテクチャのバリアントです。UCTransNet10 のスキップ接続は、チャネルごとの観点から再考され、機能の再利用が向上し、パラメーターの数が削減されます。Transformer モジュールは、長期的な依存関係をキャプチャし、翻訳品質を向上させるために追加されました。UCTransNet10 は、いくつかの機械翻訳ベンチマークで最先端の結果を達成していることが示されています。Zihanらは、LViT15と呼ばれる深層学習モデルを提案し、これを医用画像解析タスクに適用しました。LViT15 の半教師ありバージョンを拡張し、画像データの品質不足を補うために、彼らはExponential Pseudo Label Iterationメカニズム(EPI)を提案しました。さらに、画像の局所的な特徴を保持するために、重要な画像の特徴に選択的に焦点を合わせるピクセルレベルアテンションモジュール(PLAM)を提案しました。
アテンションメカニズム
アテンションメカニズムは、機械学習、特に自然言語処理とコンピュータービジョンで広く研究されてきました。近年では、画像セグメンテーションなどの医用画像解析タスクにもアテンションメカニズムが応用されています。Bahdanauら16 は、翻訳の品質を向上させるために、ニューラル機械翻訳にアテンションメカニズムを導入しました。このメカニズムにより、モデルは入力シーケンスの関連部分に選択的に焦点を合わせることができ、翻訳品質が向上します。それ以来、画像解析タスクに対して様々なアテンションメカニズムが提案されてきました。アテンションメカニズムの一般的なタイプの1つは、空間アテンションメカニズムであり、これは、重要度に基づいて特徴マップの各ピクセルに重みを適用することを含みます。例えば、Guoら17 は、網膜血管のセグメンテーションのタスクのための空間的注意メカニズムを提案しました。このメカニズムでは、ゲート メカニズムを使用して空間フィーチャの重み付けを調整し、ベッセルと非ベッセル ピクセルを区別するモデルの能力を向上させます。別のタイプのアテンション メカニズムはチャネル アテンションであり、チャネル間で特徴マップの重みを調整することに焦点を当てています。Hu et al.18 は、特徴マップにチャネルごとの注意を当てて画像分類タスクのパフォーマンスを向上させる SENet (Squeeze-and Excitation Network) を提案しました。最近では、アテンションメカニズムが畳み込みニューラルネットワーク(CNN)と組み合わされて、画像セグメンテーションタスクが行われています。例えば、Chenら19 は、空間的およびチャネル的な注意メカニズムを組み合わせた脳腫瘍のセグメンテーションのための注意誘導ネットワークを提案しました。
医用画像解析とリモートセンシングのためのセミ教師あり学習とマルチモーダル学習の最近の進歩は、有望なパフォーマンスの向上を示しています。Yang et al.20 は、クロスモダリティの生成学習と半教師あり戦略を活用する新しい不対マルチモーダル セグメンテーション フレームワークである UMSCS を提案しました。Zhangらは、いくつかの最先端の技術を紹介しました:半教師ありセグメンテーションのための証拠強化三分岐一貫性モデル21、医用画像セグメンテーション22のための自己認識およびクロスサンプルプロトタイプ学習フレームワーク22、航空宇宙領域における合成開口レーダー(SAR)ジャミング認識のための時間周波数認識階層的特徴最適化アプローチ23.これらの研究は、医療とエンジニアリングの両方のイメージングタスクにおけるハイブリッド監視とドメイン認識特徴モデリングの重要性を総合的に強調しています。
深さ方向畳み込み
深さ方向の畳み込みは、入力特徴マップのチャネルごとの相関をキャプチャするように設計されており、畳み込みニューラル ネットワークの効率と精度を向上させることが示されています。
最も早く、最も影響力のある深さ方向の畳み込みモデルの1つは、2017年にHowardらによって提案されたMobileNet24です。MobileNet は、深さ方向の分離可能な畳み込み (深さ方向の畳み込みとそれに続く点単位の畳み込みを適用する) を使用して、畳み込み層に必要なパラメーターと計算の数を減らします。これにより、MobileNetは、従来の畳み込みニューラルネットワークよりも大幅に少ないパラメータを使用しながら、画像分類タスクで最先端の精度を達成できます。MobileNet の導入以来、ShuffleNet25、Xception26、ResNeXt27 など、他にも多くの深さ方向の畳み込みアーキテクチャが提案されています。これらのモデルは、深層畳み込みの具体的な実装が異なりますが、精度を維持または向上させながら畳み込み層の計算複雑さを軽減するという目標はすべて共有しています。深層畳み込みはセマンティックセグメンテーションのタスクにも適用されており、PSPNet28 などのモデルは深さ方向の分離可能な畳み込みを使用して、大規模な畳み込み層の計算とメモリの必要量を削減しています。MixNet29 は、複数のカーネル サイズを使用してさまざまなスケールで特徴をキャプチャする混合深度ワイズ畳み込みを導入することで、ディープワイズ畳み込みの概念をさらに拡張します。これは、同等のパラメータとFLOPを維持しながら、他の最先端のモデルを凌駕することが示されています。これらのモデルは、さまざまなセマンティックセグメンテーションタスクにおいて、従来の畳み込みニューラルネットワークよりも精度と効率が大幅に向上していることを実証しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このセクションでは、医用画像のセグメンテーションのために提案されているMixKNetアーキテクチャについて説明します。MixKNet モデルは、UNet アーキテクチャを拡張し、アテンション メカニズムと混合された深さ方向の畳み込み層を組み込んでいます。この調査で使用したソフトウェアは、 資料の表に記載されています。
1. 全体的なアーキテクチャ
2.平らにされたU字型
注: ニューラル ネットワーク アーキテクチャの深さを減らして、計算の複雑さとモデル サイズを減らしますが、複雑なデータ表現を学習する能力が低下する可能性があることに注意してください。
3. エンコーダーのカーネルサイズを混在させる
4. チャネルの注意
5. データセット
注:表1と表2に示すように、この研究では、GlaS(Sirinukunwattana et al.11)とMoNuSeg(Kumar et al.9)の2つの公開されている医用画像データセットが利用されています。
6. 実施内容
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
最先端の方法との比較
MixKNetのアーキテクチャは、GlaSとMoNuSegの2つの医用画像セグメンテーションデータセットで評価され、この分野の最先端の手法と比較されています。評価は、 表3に示すように、提案された方法といくつかの比較可能なモデルのサイコロとIoUスコアを報告することによって実施されました。その結果、MixKNetアーキテクチャは他のモデルよりも優れており、両方のデータセットで最も高い平均サイコロスコアとIoUスコアを達成していることが示されています。GlaS11データセットでは、提案されたMixKNetは、他のどのモデルよりも高い平均サイコロスコア91.18%と平均IoUスコア84.51%を達成しました。MoNuSeg9データセットでは、提案されたMixKNetは、それぞれ80.45%と67.55%の最高平均サイコロスコアと67.55%のIoUスコアも達成しました。これらの結果は、MixKNetアーキテクチャが医用画像のセグメンテーションに非常に効果的であり、最先端の方法よりも...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究では、医用画像セグメンテーションのためのUNet1 アーキテクチャの新たな修正版であるMixKNetを紹介し、混合深度畳み込みとチャネルアテンションメカニズムを統合して、計算の複雑さを大幅に軽減しながらセグメンテーションの性能を向上させます。ハイブリッド チャネル畳み込みは、別々のチャネル グループで動作する複数の畳み込みカーネルを結合します。この設計により、ネットワークは、同じレイヤー内の異なる受容野スケールで多様な空間的および文脈的特徴をキャプチャできるため、ローカル構造とグローバル構造の両方を表現するモデルの能力が向上します。すべてのチャネルを均一に扱う標準的な畳み込みとは異なり、このハイブリッド戦略は、計算コストの増加を最小限に抑えながら表現の柔軟性を高めます。
一方、チャネル アテンションを組み込むことで、モデルは関連性に応じて特徴マップの重みを適応的に再調整できます。理論的には、このメカニズムは動的な特徴選択の一形態として機能し、情報量が少ない活性...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者は、競合する金銭的利益またはその他の利益相反を宣言しません。
寧波市の 2023 年社会福祉研究プロジェクトの第 2 バッチ: オントロジーと NLP に基づく通信ネットワーク詐欺の特定のための主要技術の研究と応用 (2023S169)。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| Linux OS (Ubuntu 22.04) | 各種 (オープンソースコミュニティ) | 該当なし(バージョン 22.04 LTS) | 開発用オープンソースオペレーティングシステム https://releases.ubuntu.com/22.04/ |
| NVIDIA RTX 3090 GPU | NVIDIA | 3090 | 高性能 GPU https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N/A (バージョン > 3.8) | AI/ML開発のためのプログラミング言語 https://www.python.org/ |
| PyTorch | Meta AI N | /A (Version 1.13) | オープンソースの機械学習フレームワーク https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | N/A | 軽量で強力なコードエディタ https://code.visualstudio.com/ |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト