Yöntem makalesi

Çok görüşlü Görüş Mamba U-Şekilli Ağ Çerçevesi Tıbbi Görüntü Segmentasyonu İçin

DOI:

10.3791/72616

7 Ağustos 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, tıbbi görüntü segmentasyonu için çok görüşlü Vision Mamba U-Shaped Network çerçevesinin nasıl oluşturulacağını, eğitileceğini ve değerlendirileceğini açıklar; böylece standart veri seti hazırlama, model uygulaması ve performans değerlendirmesi yoluyla cilt lezyonları ve karın organlarının tekrarlanabilir segmentasyonunu mümkün kılar.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tıbbi görüntü segmentasyonu, küresel bağlamı, yerel sınırları ve çok ölçekli anatomik yapıları doğru şekilde yakalayan ve farklı uygulamalarda tekrarlanabilir kalan hesaplamalı yöntemler gerektirir. Bu makale, iki boyutlu tıbbi görüntü segmentasyonu için Multi-view Vision Mamba U-Shaped Network çerçevesinin oluşturulması, eğitilmesi ve değerlendirilmesi için bir protokol sunmaktadır. Protokol, kamuya açık veri seti edinimi, görüntü ve maske ön işleme, ağ oluşturma, model eğitimi, kontrol noktası seçimi ve nicel ve niteliksel performans değerlendirmesini içeren tekrarlanabilir bir iş akışı sağlar. Çerçeve, tamamlayıcı mekânsal, kontur, ölçek ve sınır bilgilerini yakalamak için çoklu görünüm özellik taramasını içerir ve segmentasyon sırasında özellik entegrasyonunu iyileştirmek için U şeklinde kodlayıcı-kodlayıcı mimarisi içinde çok aşamalı özellik birleşimi uygular. Protokol, halka açık cilt lezyonu ve karın organı segmentasyon veri setleri kullanılarak gösterilmiştir. Tarif edilen uygulama iş akışı kapsamında, çerçeve standart değerlendirme metrikleri kullanarak rekabetçi segmentasyon performansı elde eder. Bu protokolde sunulan prosedürleri takip ederek, araştırmacular model uygulamasını yeniden üretebilir, tanımlanmış deneysel ayarlarla ağı eğitebilir, segmentasyon performansını değerlendirebilir ve tekrarlanabilir derin öğrenme tabanlı analiz gerektiren ilgili tıbbi görüntü segmentasyon görevlerine iş akışını uyarlayabilir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tıbbi görüntü segmentasyonu, bilgisayar görme ve tıbbi görüntü analizi alanlarındatemel bir görevdir 1,2,3. Bu, bir görüntünün daha fazla analiz ve işleme için birden fazla bölgeye veya nesneye bölünmesini içerir. Bu teknoloji, klinisyenlerin patolojik bölgeleri tanımlama ve lokalize etmelerine yardımcı olmasıyla tıbbi görüntülemede özellikle önemlidir; böylece tanı doğruluğunu ve tedavi planlamasını iyileştirir. Manyetik rezonans görüntüleme (MRI), bilgisayarlı tomografi (BT) ve pozitron emisyon tomografisi (PET) gibi tıbbi görüntüleme teknolojilerinin ilerlemesiyle birlikte, doğru tıbbi görüntü segmentasyon tekniklerine olan talep artmaya devam etmiştir. Tıbbi görüntü segmentasyonu için mevcut yöntemler genel olarak üç ana yaklaşıma ayrılabilir: konvolüsyon sinir ağı (CNN) tabanlı yöntemler4, Transformer tabanlıyöntemler 5 ve durum-uzay modeli (SSM) tabanlıyöntemler 6,7. CNN tabanlı yöntemler genellikle tıbbi görüntü segmentasyonu için U şeklinde ağ mimarileri kullanır. Bu kategoride en yaygın kullanılan mimari, biyomedikal görüntü segmentasyonu için U şeklinde kodlayıcı–kodlayıcı mimarisinin etkinliğini gösteren U-Net8'dir. U-Net3+, UNet++9'dan yoğun atlama bağlantılarını tam ölçekli atlama bağlantılarıyla birleştirerek çok ölçekli özellik toplamayı geliştirir. Ancak, CNN tabanlı yöntemlerin uzun vadeli bağımlılıkları yakalama yeteneği sınırlıdır ve bu nedenle uzun vadeli bağlamsal bilgiyi etkili şekilde modellemeyebilir.

Transformator tabanlı yöntemler, paralel hesaplamayı mümkün kılan ve ilgi alanlarına farklı dikkat ağırlıkları atayan öz-dikkat mekanizması aracılığıyla uzun menzilli bağımlılıkları etkili şekilde yakalar. UNETR++10 , parametre sayısını ve hesaplama maliyetini azaltmak için Verimli Eşleştirilmiş Dikkat (EPA) modülünü tanıtır. nnFormer11 , aralı yapraklı konvolüsyon ve öz-dikkat işlemlerini birleştirir ve üç boyutlu (3D) tıbbi görüntü segmentasyonunda hacimsel temsilleri öğrenmek için yerel-küresel hacim tabanlı öz-dikkat mekanizması sunar. H2Former12 , dikkat mekanizmalarını kodlayıcıda CNN tabanlı özellik çıkarımı ile birleştiren verimli hiyerarşik hibrit bir Vizyon Dönüştürücüsü önerir. Ancak, Transformer tabanlı yöntemler, dizi uzunluğu arttıkça kuadratik hesaplama karmaşıklığı sergiler ve bu da hesaplama maliyetinin önemli ölçüde artmasına yol açar. Şekil 1 , MVM-UNet'in motivasyonunu göstermekte ve önerilen çoklu görüş tarama stratejisini mevcut SSM tabanlı segmentasyon çerçeveleriyle karşılaştırmaktadır.

figure-introduction-1
Şekil 1. MVM-UNet'in mevcut saf durum uzayı modeli (SSM) tabanlı segmentasyon mimarileriyle karşılaştırılması. Geleneksel saf durum alanı modeli (SSM) tabanlı segmentasyon çerçevesi ile önerilen Multi-View Mamba U-Net (MVM-UNet) mimarisi arasında karşılaştırma. Üst panel, Multi-View 4-Yönlü (MV4D) modülünün, Spatial Fusion Mamba (SFusion Mamba) tarafından entegre edilen zigzag, hiyerarşik, spiral ve radyal tarama çiftleri kullanarak tamamlayıcı özellikleri çıkardığı MVM-UNet'i gösterirken, Multi-Stage Fusion Mamba (MFusion Mamba) çok ölçekli kodlayıcı özelliklerini çözmeden önce birleştirir. Alt panel, çapraz taramalı Selective Scan 2-Boyutlu (SS2D) modüller kullanılarak temsil eden saf SSM tabanlı bir mimariyi gösterir. Şekil, geleneksel SSM tabanlı segmentasyon ağları ile önerilen MVM-UNet arasındaki mimari farklılıkları vurgulamaktadır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

SSM tabanlı yöntemler, Transformers'ın küresel modelleme yeteneğini doğrusal hesaplama karmaşıklığı ile birleştirir. Mamba mimarisi, seçmeli durum uzayı modeli (Selective-SSM) kullanarak giriş bilgisini seçici olarak işler; böylece model, girdiye göre parametrelerini dinamik olarak ayarlayabilir, alakasız bilgileri filtrelerek ve bilgilendirici özellikleri vurgular. Vim13 ve VMamba14 , Mamba mimarisini bilgisayar görüşü görevleri için uyarlar. U-Mamba15 , tıbbi görüntü segmentasyonunda SSM'lerin uygulamasını incelemek için hibrit CNN–SSM mimarisi kullanırken, Mamba-UNet16 tıbbi görüntü segmentasyonu için tamamen SSM tabanlı kodlayıcı-kodlayıcı mimarisi benimser. Bu yöntemler, önemli ölçüde daha az parametre kullanarak rekabetçi performans sağlar. Ancak mevcut SSM/Mamba tabanlı yöntemler, temel olarak basit görüntü yamaları ve SS2D tarama stratejileri kullanarak görüntü özelliklerini çıkarır ve bu da tıbbi görüntü segmentasyonu için çeşitli sınırlamalar sunar. Birincisi, SS2D ve yama tabanlı teknikler öncelikle genel bilgisayar görme görevleri için tasarlanmıştır. Yerel Mamba17 ve Motion Mamba18 , farklı tarama stratejilerinin farklı görsel bilgi türlerini yakaladığı için SS2D tarama stratejisinin tüm görsel görevler için yetersiz olduğunu öne sürmüştür. İkinci olarak, SS2D tarama stratejisi nispeten basittir ve yalnızca yatay ve dikey tarama yönlerine dayanır. Sonuç olarak, karmaşık mekansal ilişkileri ve ince yapısal detayları yeterince yakalayamayabilir. Tıbbi görüntü segmentasyonu, hem küresel mekansal bağlamın hem de kesin yerel anatomik özelliklerin eşzamanlı modellenmesini gerektirir. Ayrıca, mevcut SSM/Mamba tabanlı yöntemler, kodlayıcı ile çözücü arasında sınırlı özellik birleşimi sağlar. UNet++ ve FATNet gibi mimariler, gelişmiş özellik birleşmesiyle segmentasyon doğruluğunu artırır ve tıbbi görüntü segmentasyonu için etkili özellik entegrasyonunun önemini vurgular.

Bu sınırlamaları gidermek için, bu makale MVM-UNet olarak adlandırılan yeni bir Mamba tabanlı tıbbi görüntü segmentasyon çerçevesi önermektedir. Şekil 1'de gösterildiği gibi, önerilen Çok Görüşlü Dört Yönlü (MV4D) modülü, MVM-UNet'in temel özellik çıkarma bileşeni olarak hizmet verir ve dört farklı tarama stratejisinden gelen bilgilerin entegre edilmesiyle tıbbi görüntü segmentasyonu için özel olarak tasarlanmıştır. Her tarama stratejisi, tamamlayıcı görüntü özelliklerini çıkarır ve giriş görüntüsünün farklı bir görünümünü temsil eder. Zikzak tarama19 , her satırın veya sütunun sonunda geçiş yönünü değiştirerek yerel ve küresel mekânsal bilgiyi dengeler. Buna karşılık, spiral ve radyal taramaşemaları 20 , merkezden dışa veya çevreden içe doğru uzanarak kapsamlı kapsama sağlar. Hiyerarşik tarama18 , hem yerel hem de küresel özellikleri birden fazla ölçekte yakalar. Her tarama stratejisinin dayanıklılığını artırmak için, tarama çiftleri S6 Bloğuna girilmeden önce birleştirilir. Scan-view Fusion Mamba (SFusion Mamba) modülü, dört tarama modalitesinden çıkarılan özellikleri daha sonra entegre eder. Çok ölçekli kodlayıcı özelliklerini etkili bir şekilde kullanmak için, bu makale ayrıca çok ölçekli bir Mamba füzyon modülü (MFusion Mamba) önermektedir; bu modül, her kodlayıcı aşamasından çıkan çıktıları biriktirip birleştirir ve ardından füzülmüş özellikleri çözücüye aktarır. MVM-UNet, ISIC 2017, ISIC 2018 ve Synapse veri setleri üzerinde değerlendirildi. Deneysel sonuçlar, MVM-UNet'in ISIC 2017, ISIC 2018 ve Synapse veri setlerinde rekabetçi segmentasyon performansı elde ettiğini göstermektedir.

Temsilci segmentasyon mimarileri tıbbi görüntü segmentasyonunu daha da geliştirmiştir. U-Net, hücre sayma, tespit ve morfometri21 gibi biyomedikal görüntü analiz görevlerinde de başarıyla uygulanmıştır. CA-Net 22 gibi dikkat artırılmış CNN mimarileri, kapsamlı dikkat mekanizmaları aracılığıyla özellik temsilini iyileştirir. TransUNet 23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26 ve TransCUNet27 gibi temsil Transformer tabanlı segmentasyon çerçeveleri, tıbbi görüntü segmentasyonu için dikkat temelli küresel özellik modellemesinin etkinliğini daha da göstermektedir.

MVM-UNet'in tasarımı, mevcut SSM/Mamba tabanlı segmentasyon yöntemlerinin iki sınırlaması nedeniyle motive edilmiştir. İlk olarak, günümüzdeki birçok Vision Mamba modeli, düzensiz lezyon sınırları, küçük hedef bölgeler ve çok ölçekli anatomik yapılar içeren tıbbi görüntüler için yetersiz olabilecek basit iki boyutlu tarama stratejilerine dayanır. İkinci olarak, geleneksel U şeklindeki kodlayıcı-kodlayıcı mimarileri, özellikleri öncelikle karşılık gelen atlama bağlantıları üzerinden aktarır ve dekodlama sırasında çok aşamalı kodlayıcı bilgisinin doğrudan kullanımını sınırlar. Bu nedenle, MVM-UNet çok görüşlü mekânsal modellemeyi geliştirmek için MV4D ve çok aşamalı kodlayıcı özelliklerini açıkça birleştirmek için MFusion Mamba'yı tanıtır. Bu tasarım, Mamba tabanlı uzun menzilli modellemeyi tıbbi görüntü segmentasyonunun özel gereksinimlerine uyarlamayı amaçlamaktadır.

MVM-UNet genel kodlayıcı–kodlayıcı paradigması ve Mamba tabanlı dizi modelleme üzerine inşa edilmiş olsa da, yeniliği, bu bileşenlerin tıbbi görüntü segmentasyonu için nasıl uyarlanıp entegre edildiğinde yatmaktadır. Standart bir Mamba bloğunu U-şeklindeki ağ omurgasına entegre etmek yerine, önerilen çerçeve, mekânsal modelleme sürecini birden fazla görev odaklı tarama çifti dalıyla yeniden tasarlar, taramaya özgü temsilleri entegre etmek için SFusion Mamba'yı tanıtır, MVV Bloğunu kalıntı ve projeksiyon yolları ile güçlendirir ve kodlayıcı ile çözücü arasına MFusion Mamba'yı ekleyerek çok aşamalı kodlayıcı özelliklerini dekodlamadan önce birleştirir. Bu mimari düzeydeki tasarım, tıbbi görüntülerde sıkça gözlemlenen düzensiz sınırları, küçük hedef bölgeleri ve çok ölçekli anatomik yapıları ele almayı amaçlar.

Bu protokol, iki boyutlu tıbbi görüntülerde uzun süreli bağlamsal bilginin, düzensiz nesne sınırlarının ve çok ölçekli anatomik yapıların eşzamanlı modellenmesini gerektiren segmentasyon görevleri için en uygundur. CNN tabanlı segmentasyon yöntemleriyle karşılaştırıldığında, Mamba tabanlı kodlayıcı–kodlayıcı tasarımı, tıbbi görüntü segmentasyon araştırmacılarına aşina olan U şeklindeki iş akışını korurken etkili bir bağlam modelleme mekanizması sunar. Transformer tabanlı yöntemlerle karşılaştırıldığında, önerilen çerçeve doğrudan kuadratik öz-dikkat kullanımından kaçınmakta ve nispeten verimli bir dizi modelleme mekanizması kullanarak küresel bağlamsal modelleme arayan araştırmacılar için tasarlanmıştır. Buna göre, bu protokol cilt lezyonu segmentasyonu, karın organı segmentasyonu ve küresel yapısal bilgilerin ve yerel sınır detaylarının önemli olduğu benzer iki boyutlu tıbbi görüntü segmentasyon görevleri için uygundur.

Bu protokolün ayrıca kullanımdan önce dikkate alınması gereken sınırlamaları vardır. Hafif bir CNN'in zaten yeterli performans sağladığı nispeten basit segmentasyon görevleri için gerekli olmayabilir. Ayrıca, mimari uyarlama olmadan tam üç boyutlu hacimsel segmentasyon için doğrudan tasarlanmamıştır. Çok sınırlı açıklamalı verilere, sınırlı grafik işlem birimi (GPU) kaynaklarına veya oldukça yorumlanabilir klasik modellere ihtiyaç duyan araştırmacılar da protokolü uygulamadan önce bu kısıtlamaları göz önünde bulundurmalıdır. Genel olarak, bu yöntem, uzun vadeli bağlam modellemesi, yerel sınır temsili ve çok aşamalı özellik birleşimini dengeleyen Mamba tabanlı U şeklinde segmentasyon çerçevesini yeniden üretip değerlendirmek isteyen araştırmacılar için tasarlanmıştır.

Başlıca katkılar şunlardır:

1. Bu makale, MVM-UNet olarak adlandırılan yeni bir Mamba tabanlı tıbbi görüntü segmentasyon çerçevesini sunmaktadır. Mevcut SS2D tabanlı veya standart Mamba bloklarını doğrudan dahil eden yaklaşımların aksine, MVM-UNet zikzak, hiyerarşik, spiral ve radyal tarama dahil olmak üzere dört tamamlayıcı tarama çifti görünümünden tıbbi görüntü özelliklerini modellemek için MV4D'yi tanıtır.

2. Bu makale, taramaya özgü temsilleri entegre etmek ve özellik dönüşümünü geliştirmek için SFusion Mamba ve MVV Bloğunu tasarlamaktadır. SFusion Mamba, farklı tarama çift dallarından çıkarılan özellikleri birleştirirken, MVV Bloğu içindeki kalıntı ve Yukarı-Aşağı Projeksiyon dalları, özellik temsillerini stabilize eden ve zenginleştiren tamamlayıcı özellik yolları sağlar.

3. Bu makale, MFusion Mamba'yı kodlayıcı ile çözücü arasında ara çok aşamalı bir füzyon modülü olarak tanıtmaktadır. Geleneksel atlama bağlantılarının aksine, özellikle karşılık gelen aşama özelliklerini aktarırken, MFusion Mamba çok aşamalı kodlayıcı özelliklerini kabaca ve ince füzyon yoluyla açıkça birleştirir ve kod çözme için zenginleştirilmiş bilgi sağlar.

4. Kapsamlı deneysel sonuçlar, önerilen MVM-UNet'in ISIC 2017 ve ISIC 2018 veri setlerinde rekabetçi segmentasyon performansı ve Synapse çoklu organ segmentasyon veri setinde güçlü performans sağladığını göstermektedir. Ayrıca, kapsamlı ablasyon çalışmaları MVM-UNet'teki her bileşenin katkısını doğrular.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, ISIC 2017, ISIC 2018 ve Synapse dahil olmak üzere yalnızca kamuya açık ve kimliği yok edilmiş tıbbi görüntü veri setlerini kullanmıştır. Bu çalışmada yeni insan katılımcılar, hayvan denek veya tanımlanabilir özel tıbbi kayıtlar toplanmadı. Bu çalışmada kullanılan ISIC 2017 veri seti, resmi Uluslararası Cilt Görüntüleme İşbirliyi meydan okuma veri deposundan (https://challenge.isic-archive.com/data/#2017) elde edilen ISIC 2017 Challenge cilt lezyonu segmentasyon veri setidir. Bu çalışmada kullanılan veri seti versiyonu, resmi eğitim, doğrulama ve test bölümlerini içeren ISIC 2017 lezyon segmentasyon görevine karşılık gelmektedir. Veri seti 15 Mart 2024'te indirildi. Bu çalışmada kullanılan ISIC 2018 veri seti, resmi Uluslararası Cilt Görüntüleme İşbirliği meydan okuma veri deposundan (https://challenge.isic-archive.com/data/#2018) elde edilen ISIC 2018 Challenge Görev 1 lezyon sınır segmentasyon veri setidir. Bu çalışmada kullanılan veri seti versiyonu, ISIC 2018 Görev 1: Lezyon Sınır Segmentasyonu'na karşılık gelmektedir. Veri seti 8 Temmuz 2024'te indirildi.

Bu çalışmada kullanılan Synapse veri seti, Synapse deposundan accession identifor syn3193805 (https://www.synapse.org/Synapse:syn3193805) altında elde edilen Multi-Atlas Etiketleme Beyond the Cranial Vault abdominal CT veri setidir. Bu çalışmada kullanılan veri seti, yaygın olarak kullanılan 30 vakalı abdominal BT çoklu organ segmentasyon veri setine karşılık gelir. İndirilen arşiv Abdomen/RawData.zip idi ve accession syn3193805 altında mevcut. İndirme sırasında depo tarafından ayrı bir sürüm numarası, yayın etiketi veya tarihli bir etiket sağlanmamıştır. Önceki çalışmalarda benimsenen standart bölünme taktiklerinde, 18 vaka eğitim için, 12 vaka ise test için kullanıldı. Veri paylaşımı, TransUNet23 tarafından kullanılan vaka listesini takip etti. Özellikle eğitim davaları case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028 ve case0037 idi; test vakaları ise case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025 ve case0035 idi. Veri seti 9 Temmuz 2024'te indirildi. Bu çalışma yalnızca kamuya açık olan, kimliği yok veri setlerini kullandığı ve yeni insan-denek verileri veya tanımlanabilir özel bilgilerin toplanmasını içermediği için, bu protokolde tanımlanan hesaplamalı deneyler için kurumsal inceleme kurulu onayı gerekmemiştir. Resmi yazılı kurumsal muafiyet kararı alınmadı. Yerel kurumsal politika gereği gerekliyse, araştırmacılar kamuya açık veri setlerinin ikincil analizlerini yapmadan önce kurumsal muafiyet belirlemesi almalıdır. Bu çalışma için kurumsal etik muafiyet referans numarası veya resmi muafiyet belgeleri mevcut değildi.

1. Veri setlerinin hazırlanması

  1. ISIC 2017 cilt lezyonu segmentasyon veri setini resmi Uluslararası Cilt Görüntüleme İşbirliği deposundan indirin. Resmi eğitim, doğrulama ve test bölümlerini kullanın. Veri setinin 2.000 eğitim görsesi, 150 doğrulama görüntüsü ve 600 test görsesi içerdiğini doğrulayın.
  2. ISIC 2018 cilt lezyonu segmentasyon veri setini resmi Uluslararası Cilt Görüntüleme İşbirliği deposundan indirin. Resmi eğitim, doğrulama ve test bölümlerini kullanın. Segmentasyon veri setinin 2.594 eğitim görüntüsü, 100 doğrulama görüntüsü ve 1.000 test görsesi içerdiğini doğrulayın.
  3. Synapse çoklu organ segmentasyon veri setini indirin. Eğitim için 18 vaka (2.212 eksenel dilim) ve test için 12 vaka (1.567 eksenel dilim) olan standart bölünmeyi kullanın. Ayrı bir doğrulama seti eklemeyin.
    1. 12 test vakasını yalnızca nihai değerlendirme için ayırın. Test vakalarını model eğitimi, hiperparametre ayarlaması veya model seçimi için kullanmayın. Segmentasyon görevi sekiz karın organını içerir: aorta, safra kesesi, dalak, sol böbrek, sağ böbrek, karaciğer, pankreas ve mide.
    2. Aşağıdaki Synapse veri seti bölünmesini kullanın. 18 eğitim vakası ise case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028 ve case0037 idi. 12 test vakası ise case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025 ve case0035 idi.
  4. Her veri setini ayrı görsel ve maske klasörlerine düzenleyin. Her görüntünün aynı küçük harf tanımlayıcısına sahip bir segmentasyon maskesi olduğundan emin olun.
    1. Her cilt lezyonu maskesini ikili bir ön plan-arka plan segmentasyon haritasına dönüştürün. Synapse veri seti için orijinal çok sınıflı organ etiketlerini koruyun.
    2. ISIC 2017 ve ISIC 2018 veri setleri için, ikili maske dönüşümünden sonra arka plan piksellerine 0, lezyon (ön plan) piksellerine ise 1 etiket değeri atayın. Orijinal maske değerleri 0'dan büyük olan pikseller ön plan olarak kabul edilir ve 1'e dönüştürülürken, orijinal maske değerleri 0'a olan pikseller arka plan olarak kabul edilir ve 0 olarak korunur. Synapse veri seti için, orijinal tam sayı etiket değerlerini koruyun; 0 arka plan sınıfını, 1–8 ise sekiz ön plan organ sınıfını temsil eder.
  5. ISIC 2017 ve ISIC 2018 görüntülerini ve maskelerini orijinal en-boy oranını korumadan 256 × 256 piksele yeniden boyutlandırmak. Kırpma veya dolgu uygulamayın.
    1. Her Synapse CT dilimini ve karşılık gelen etiket eşlemesini 224 × 224 piksel olarak yeniden boyutlandırın. RGB görüntüler için bilinezik enterpolasyon, CT dilimleri için üçüncü dereceden spline interpolasyonu ve segmentasyon maskeleri için en yakın komşu interpolasyonu kullanın.
    2. Python'da görüntüleri boyutlandırmak.
      1. ISIC 2017 ve ISIC 2018 veri setleri için, utils.py'de uygulanan özel myResize dönüşümünü kullanın; bu dönüşüm torchvision.transforms.functional.resize çağrısı ile hem görüntü hem de maske tensorlarını 256 × 256 piksele boyutlandırır. Bu dönüşümde açık bir interpolasyon modu veya anti-aliasing argümanı belirtmeyin.
      2. Synapse veri seti için datasets/dataset.py içinde scipy.ndimage.zoom kullanın. CT görüntü dilimlerini üçüncü dereceden spline interpolasyonu (düzen = 3) kullanarak 224 × 224 piksele boyutlandırılır ve en yakın komşu enterpolasyonu ile etiket haritalarını yeniden boyutlandırır (sıra = 0). Yeniden boyutlandırma sırasında ayrı bir anti-aliasing işlemi veya anti_aliasing=True ayarı uygulamayın.
  6. Tenzor dönüşümünden önce her ISIC RGB görüntünü veri setine özgü ortalama ve standart sapma (SD) kullanarak Denklem 1 kullanılarak aşağıdaki şekilde normalleştirin:
    figure-protocol-1(1)
    Daha sonra normalize edilmiş görüntüyü minimum–maksimum normalizasyon kullanarak 0–255 aralığına yeniden ölçeklendirin.
    1. ISIC 2017 eğitim seti için μ = 159.922 ve σ = 28.871, ISIC 2017 doğrulama ve test setleri için ise μ = 148.429 ve σ = 25.748 kullanın. ISIC 2018 eğitim seti için μ = 157.561 ve σ = 26.706, ISIC 2018 doğrulama ve test setleri için ise μ = 149.034 ve σ = 32.022 kullanın.
    2. Her normalize edilmiş görüntüyü 256 × 256 × şekilli bir tensöre dönüştürün. Her ikili maske, 256 × 256 × şekilli bir tensöre dönüştürün.
    3. Veri setine özgü ortalama ve standart sapma normalizasyonundan sonra her görüntü için bağımsız olarak min–max normalizasyonu gerçekleştirilin. Özellikle, her görsemden veri setine özgü ortalamayı çıkarıp karşılık gelen standart sapmaya bölür.
    4. Normalize edilmiş görüntüden minimum ve maksimum yoğunluk değerlerini hesaplayın ve bu görüntü başına minimum ve maksimum değerleri kullanarak görüntüyü 0–255 aralığına yeniden ölçeklendirin. Bu mini–maksimum ölçeklendirme adımı için veri seti genelindeki minimum ve maksimum değerleri kullanmayın.
  7. Her Synapse CT dilimi iki boyutlu gri tonlu bir görüntü olarak hazırlanır. Her CT dilimi float32'ye dönüştürün ve tekli bir kanal boyutu ekleyerek 1 × 224 × 224 şeklinde bir giriş tensoru elde edinin.
    1. Her Synapse etiket haritasını 224 × 224 şekline sahip tek kanallı bir tamsayı maskesi olarak koruyun. Veri yükleyicide ek veri seti seviyesinde ortalama-SD normalizasyonu uygulamayın.
    2. Dilimleri eğitmek için .npz formatında sağlanan önceden işlenmiş Synapse dosyalarını, hacimleri test etmek için ise .npy.h5 formatını kullanın. Eğitim sırasında her .npz dosyasından ve test sırasında doğrudan .npy.h5 dosyasından görüntü ve etiket dizilerini yükleyin. Serbest bırakılan veri yükleyicide ek yoğunluk kırpma, CT pencereleme, veri seti düzeyinde normalizasyon veya ham hacim yeniden örnekleme uygulaması uygulanmamalıdır.
    3. Model eğitimi sırasında, yüklenmiş her iki boyutlu dilimi float32'ye dönüştürün, scipy.ndimage.zoom kullanarak hedef mekansal boyutuna dönüştürün; görüntü dilimleri için sıra = 3, etiket haritaları için sıra = 0 ile ve ardından yeniden boyutlandırılmış dizileri tek kanal boyutuna sahip tensorlara dönüştürün.
  8. Veri artırma sadece eğitim setine uygulanır. ISIC 2017 ve ISIC 2018 için, 0° ile 360° arasında örneklenen açı ile rastgele yatay çevirme (p = 0.5), rastgele dikey çevirme (p = 0.5) uygulanır.
    1. Her görüntü-maske çiftine aynı geometrik dönüşümü uygulayın. Doğrulama ve test sırasında yalnızca yeniden boyutlandırma, normalizasyon ve tensör dönüşümü uygulanır.
    2. Synapse veri seti için, eğitim sırasında rastgele dönüş ve rastgele çevirme uygulanır. Her görüntü-etiket çiftini k × 90° rastgele döndürün; burada k {0,1,2,3} ∈, görüntü-etiket çiftini bir uzamsal eksen boyunca rastgele çevirin veya görüntü-etiket çiftini −20°'den 20°'ye örneklenmiş bir açı ile rastgele döndürün.
    3. Test sırasında stokastik artırma uygulamayın.
    4. RandomGenerator dönüşümünde uygulanan karşılıklı dışlayıcı dallar kullanılarak Synapse veri setine veri artırımı uygulanır.
      1. Her eğitim örneği için, önce random.random() koşulu 0.5 > değerlendirin. Bu koşul sağlanırsa, rastgele 90° dönüş (k = 0, 1, 2 veya 3) ve ardından bir mekânsal eksen boyunca rastgele bir dönüşten oluşan random_rot_flip uygulanır.
      2. Birinci dal seçilmezse, ikinci bir koşul olan random.random() > 0.5 değerlendirin. Bu koşul sağlanırsa, −20° ile 20° arasında rastgele seçilmiş bir dönme açısı kullanarak random_rotate uygulanır. Hiçbir koşul karşılanmazsa, örnekle stokastik artırma uygulanmaz.
      3. Aynı dönüşümü hem giriş görüntüsüne hem de ilgili etiket haritasına uygulayın.
  9. Veri seti yükleme, ön işleme ve eğitim öncesinde rastgele tohumu ayarlayın. Ana karşılaştırma deneyleri için rastgele tohum 1, 52 ve 100 kullanın, ablasyon çalışmaları için ise başka belirtilmedikçe tohum 100 kullanın.
    1. Veri yükleyicisini oluşturmadan önce Python, NumPy, PyTorch CPU, PyTorch CUDA ve cuDNN rastgele üreteçlerini başlatın. Tüm tohum çalışmalarında veri seti bölümlerini, ön işleme prosedürlerini, artırma ayarlarını, normalizasyon parametrelerini, boyutlandırma stratejisini ve değerlendirme ön işlemesini değiştirmeden tutun.
    2. Ana süreçte veri yükleme yapmak için hem ISIC hem de Synapse deneyleri için num_workers = 0 ayarlanır. Veri setini oluşturmadan ve DataLoader oluşturmadan önce, Python, NumPy, PyTorch CPU, PyTorch CUDA ve cuDNN rastgele sayı üreteçlerini tohumlamak için set_seed fonksiyonuyla küresel rastgele tohumu başlatın. Yayınlanan uygulamada kullanılmadığı için ayrı bir worker_init_fn veya DataLoader'a özgü rastgele üretici tanımlamayın.

2. MVM-UNet mimarisinin inşası

  1. Önerilen Çok görüşlü Görüş Mamba UNet'i (MVM-UNet) U şeklinde kodlayıcı-çözücü mimarisi kullanarak inşa edin.
  2. Giriş görüntü boyutunu H × W × 3 olarak ayarlayın. Giriş görüntüsünü patch gömme katmanından geçirin.
    1. Patch gömüleme katmanını, çekirdek boyutu 4 × 4, adımı 4, üç giriş kanalı ve 96 çıkış kanalı ile 2D bir konvolüsyon kullanarak uygulayın.
    2. Giriş özellik haritasını H/4 × W/4 mekansal çözünürlüğüne dönüştürün ve C = 96 çıkış kanalı ile değiştirilin.
  3. Dört kodlayıcı aşaması ve dört kodlayıcı aşaması oluşturun. Her kodlayıcı aşamasından sonra mekansal çözünürlüğü yarıya düşürüp kanal boyutunu iki katına çıkar.
  4. Simetrik kodlayıcı-kodlayıcı konfigürasyonu kullanın. Hem kodlayıcıda hem de kodlayıcıda MVV Blok sayısını {2, 2, 2, 2} olarak ayarlayın.
    1. Her kodlayıcı aşamasına iki MVV Bloğu, her kodlayıcı aşamasına ise iki MVV Bloğu yerleştirin.
  5. Her kodlayıcı ve kodlayıcı aşamasına bir MVV Bloğu ekleyin. Her MVV Bloğu içinde temel özellik çıkarma modülü olarak MV4D modülünü kullanın.
  6. MFusion Mamba modülünü kodlayıcı ile çözücü arasına yerleştirin. Bu modülü çok aşamalı kodlayıcı özelliklerini çözmeden önce birleştirmek için kullanın.
  7. Genel MVM-UNet iş akışını yapılandırın. Encoder boyunca özellik çıkarımı için MV4D kullanın.
    1. Kodlayıcı çıkışlarını atlama bağlantıları olarak kalın. Kodlayıcı çıktılarını ilgili kodlayıcı aşamalarına iletin.
    2. Kodlayıcı özelliklerini çözmeden önce MFusion Mamba'ya geçirin. Birleştirilmiş temsilin dekoder üzerinden kademeli olarak yukarı örneklenmesi ve segmentasyon başlığı kullanılarak nihai segmentasyon haritasını oluşturulması.
  8. I ∈ R B×H×W×3 giriş görüntüsünü patch gömüleme katmanından geçirerek burada, C = 96 elde edilirfigure-protocol-2.
    1. Kodlayıcı özellik haritaları oluşturuldu: E1 R B×H/4×W/4×C, E2 ∈ RB×H/8×W/8×2C, E3 ∈ RB×H/16×W/16×4C, ve E4 ∈ RB×H/32×W/32×8C. Her kodlayıcı aşamasında MV4D içeren MVV Blokları kullanın.
    2. İlgili atlama bağlantısı için tüm kodlayıcı özelliklerini koruyun. Tüm kodlayıcı özelliklerini çoklu aşamalı özelliklerin birleşmesi için MFusion Mamba'ya aktarın.
    3. MFusion Mamba içinde kaba ve ince füzyon öncesi kodlayıcı özelliklerini ortak bir özellik alanına hizalamak. Füzelenmiş temsilini kod çözücüye verin.
    4. Dekoder temsilini aşamalı olarak yukarı örnekleyin. Dekoder özelliklerini H/16 × W/16 E 2, H/8 × W/8 ve H/4 × W/4 ile E1 ile birleştirin.
    5. Son kod çözücü özelliğini orijinal görüntü çözünürlüğüne örnekleyin. Tahmin haritasını figure-protocol-3 RB×H×W×K oluşturun. Burada, ikili lezyon segmentasyonu için K = 1 ve Sinaps çok organlı segmentasyonu için K = 8.
    6. Genel ağ mimarisi için Şekil 2'ye ve her aşama için işlemler, ana parametreler ve çıktı özellik boyutları dahil olmak üzere tam katman-katman mimari spesifikasyonu için Ek Tablo 1'e bakınız
    7. Kodlayıcı–kodlayıcı geçiş katmanları
      1. Downsample kodlayıcı özellikleri patch-birleştirme geçiş katmanları kullanır. Her geçiş için, 2 × 2 komşuluktan dört uzamsal olarak iç içe girmiş özellik grubu örneklerini alıp kanal boyutu boyunca birleştirin, Katman Normalizasyonu (LayerNorm) uygulanır ve ortaya çıkan 4C boyutlu özelliği önyargısız doğrusal katman kullanarak 2C kanallarına projeksiyon edin. Bu işlem, kanal boyutunu iki katına çıkarırken mekansal çözünürlüğü 2 kat azaltır.
      2. Upsample dekoder özellikleri yama-genişletici geçiş katmanları kullanır. Önyargısız doğrusal bir projeksiyon uygulayın, genişletilmiş özellikleri mekânsal olarak yeniden düzenleyerek çözünürlüğü 2 kat artırın ve mekânsal genişlemeden sonra LayerNorm uygulayın. Bu işlemi tekrarlayarak H/32 × W/32'den H/16'ya × W/16, H/8 × W/8 ve H/4 × W/4'e kadar olan özellikler haritalarını kademeli olarak yeniden inşa edin.
      3. MFusion Mamba modülündeki kodlayıcı özelliklerini, bilinear interpolasyon (align_corners = Yanlış) kullanarak hedef mekansal çözünürlüğe göre boyutlandırarak ve ardından özellik birleşiminden önce öğrenilebilir doğrusal kanal projeksiyonu uygulayarak hizalamak.
    8. Segmentasyon başlığı
      1. Son kod çözücü özellik haritasını H/4 × W/4'ten orijinal görüntü çözünürlüğüne (H × W) son patch-genişleme katmanı kullanarak yukarı örnekleyin. Doğrusal projeksiyon uygulayın, 4 genişleme faktörü ile mekânsal yeniden düzenleme yapın ve LayerNorm uygulayın.
      2. Yeniden oluşturulan özellik haritasını, tensörü kanal öncelikli formata dönüştürdükten sonra 1'e ×1 konvolüsyonuyla K çıkış kanalına projeksiyon yapın.
      3. Değerlendirme sırasında ikili lezyon segmentasyonu için sigmoid aktivasyon fonksiyonu veya softmax aktivasyonu uygulayarak ardından Synapse multiorgan segmentasyonu için argmax uygulanarak nihai tahmini oluşturun. Segmentasyon başının içinde aktivasyon fonksiyonu uygulama.

figure-protocol-4
Şekil 2. Multi-View Mamba U-Net'in (MVM-UNet) genel mimarisi. Önerilen Multi-View Mamba U-Net (MVM-UNet) mimarisinin genel görünümü. Giriş görüntüsü, patch gömmelerine dönüştürülür ve patch-birleştirme işlemleriyle ayrılmış Multi-View Vision (MVV) Bloklarından oluşan dört kodlayıcı aşamasından geçer. Kodlayıcı özellikleri, Çok aşamalı Birleşme Mamba (MFusion Mamba) ile toplanır ve atlama bağlantıları aracılığıyla kodlayıcıya iletilir. Kodlayıcı, yama genişletme işlemleriyle mekânsal çözünürlüğü kademeli olarak geri kazanır ve projeksiyon katmanı boyunca nihai segmentasyon haritasını oluşturur. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

3. MV4D modülünün inşası

  1. MVV Bloğunda temel özellik çıkarma birimi olarak MV4D modülünü kullanın. Giriş özellik yamalarını dört tarama çifti dalına besleyin. Mekânsal düzleştirme, tarama çifti indeks oluşturma, dizi toplama, S6/Mamba işleme, ters mekansal yeniden sıralama, tarama çifti birleşimi, SFusion Mamba füzyon, projeksiyon ve çıktı yeniden şekillendirme gibi tam sözde kod için Algoritma 1, Ek Dosya 1'e bakınız.
  2. modeller/mvmunet/core.py'de uygulanan tam zigzag, hiyerarşik, spiral ve radyal tarama-indeks oluşturma prosedürlerini kullanın. Her tarama stratejisi için, ileri tarama sırasını ve onun ters sırasını tek bir çift yönlü tarama çifti olarak kullanın.
  3. Zikzak tarama çiftini oluştur. Her satır veya sütunun sonunda görüntü özelliklerini dönüşümlü yönlerde gezdirin. Bu tarama desenini yerel ve küresel mekânsal bilgiyi dengelemek için kullanın.
  4. Hiyerarşik tarama çiftini oluşturun. Özellikleri birden fazla mekansal ölçekte yakalayın. Bu tarama desenini hem yerel hem de küresel temsillerin çıkarımını güçlendirmek için kullanın.
  5. Spiral tarama çiftini oluşturun. Görüntü özelliklerini merkezden sınıra doğru veya sınırdan merkeze doğru tara. Bu tarama desenini küresel kontur bilgisinin çıkarımını artırmak için kullanın.
  6. Radyal tarama çiftini oluşturun. Görüntü özelliklerini birden fazla radyal yön boyunca tara. Bu tarama desenini yerel sınır ve kenar detaylarının çıkarımını geliştirmek için kullanın.
  7. Her tarama çiftini birleştirin ve birleştirilen diziyi S6 bloğuna aktarın. Eşleştirilmiş tasarımı kullanarak her tarama stratejisinin dayanıklılığını artırırken hesaplama verimliliğini koruyabilirsiniz.
  8. Her tarama çiftinin çıkış dizisini bir S6 bloğuna besleyin. Zigzag, hiyerarşik, spiral ve radyal tarama görünümlerine karşılık gelen dört özellik temsili elde edin.
  9. Çıkarılan dört özellik temsili SFusion Mamba modülü kullanılarak birleştirin. İki paralel füzyon yolu kullanın. İlk yolda, dört özelliği eleman bazında ekleme yoluyla entegre edin.
  10. İkinci SFusion Mamba yolunda, dört özelliği birleştirin. Birleştirilmiş temsili Conv1d ve Mamba ile işleyin. Kanal boyutunu, S6 blok çıkış boyutuna uyacak bir projeksiyon katmanı kullanarak küçültün.
  11. Model boyutu olarak özellik boyutu C kullanılarak S6/Mamba bloğunu yapılandırın. Her birleşmiş tarama çifti özelliğini füzyondan önce kanal boyutu C'ye eşlemek için bir projeksiyon katmanı kullanın.
  12. SFusion Mamba'da, ilk yolda eleman bazında toplama işlemi yapılabilir. Conv1d, Mamba ve doğrusal projeksiyondan önceki ikinci yolda dört tarama görünümü özelliğini birleştirin. Adımda belirtildiği gibi normalizasyon, doğrusal projeksiyon, derinlik açısından ayrılabilir konvolüsyon ve MV4D etrafındaki aktivasyon işlemlerini kullanın.
  13. MV4D modülünün nihai çıktısını elde etmek için iki füzyon yolunun çıktılarını ekleyin.
  14. Yalnızca yatay ve dikey tarama yönleri kullanmak yerine dört tamamlayıcı tarama çifti dalı oluşturun. Sürekli mekansal geçişi vurgulamak için zikzak tarama, çok ölçekli temsili güçlendirmek için hiyerarşik tarama, merkezden sınıra kontur bilgisini yakalamak için spiral tarama ve sınır odaklı yerel detay çıkarımı artırmak için radyal tarama kullanın.
  15. Her tarama çiftini bağımsız olarak işleyin. Ortaya çıkan özellikleri SFusion Mamba ile birleştirin. Her işlenen diziyi füzyon öncesi orijinal mekansal sırasına geri eşle.
  16. Bir giriş özellik haritası X ∈ RB×H×W×C, onu Xdizili olarak düzleştirin ∈ RB×L×C, burada L = H × W.
  17. Her tarama çifti dalının tarama indekslerine göre düzleştirilmiş diziyi yeniden düzenleyin. Her yeniden sıralanmış diziyi S6 bloğunu kullanarak işleyin. İşlenen diziyi orijinal mekansal sıraya geri döndürün.
  18. Dört tarama görünümü özelliğini ekleme yolu ve SFusion Mamba yolu üzerinden birleştirerek nihai MV4D çıktısını elde edin. MV4D mimarisi için Şekil 3'e ve tam tensör seviyesinde uygulama iş akışı için Algoritma 1, Ek Dosya 1'e bakınız.
  19. Models/mvmunet/core.py içindeki tam yazılım uygulamasını kullanın. Bu dosya, tarama indeks üreteçleri PairwiseScanMamba, SequenceS6, SFusion Mamba ve MV4D wrapper modülünü içerir.
  20. Çok görüşlü tarama indeksleri oluşturun
    1. Tarama indekslerini models/mvmunet/core.py içinde yayınlanan uygulamayı takip ederek oluşturun. H × W boyutlu bir giriş özellik haritası için, her piksel konumunu tek boyutlu bir indekse düzleştirin: index = r × W + c, burada are ve c sırasıyla satır ve sütun koordinatlarını gösterir.
    2. Zigzag taramayı sabit r + c ile görüntü çapagonlarını geçerek oluşturun. Her çapraz için geçerli piksel indekslerini toplayın ve her çift numaralı çaprazın sırasını tersine çevirerek geçiş yönünü dönüşümlü yapın.
    3. Hiyerarşik taramayı görüntüyü dört dörtre ayırarak oluşturun. Alt bölge yüksekliği veya genişliği 2 pikselden büyük olmayana kadar üst sol, üst-sağ, alt-sol ve alt-sağ dörtlükleri sırayla ziyaret edin ve ardından kalan pikselleri satır-majör sırayla gezin.
    4. Dış görüntü sınırını üst sıra boyunca soldan sağa, sağ sütun boyunca aşağıya, alt sıra boyunca sağdan sola ve sol sütun boyunca yukarı doğru ilerleyerek spiral taramayı oluşturun; sınırı görüntü merkezine doğru kademeli olarak küçültün.
    5. Radyal taramayı, her pikseli görüntü merkezinden kare mesafesine göre ve ardından atan2 fonksiyonu kullanılarak hesaplanan kutup açısına göre sıralayarak oluşturun.
    6. Her tarama stratejisi için karşılık gelen ileri tarama sırasını tersine çevirerek ters tarama oluşturun. Öndeki ve geri tarama dizilerini birleştirerek her tarama stratejisi için bir tarama çifti oluşturun ve ardından çiftleri MV4D modülüne aktarın.

figure-protocol-5
Şekil 3. Multi-View 4-Yönlü (MV4D) modülünün mimarisi. Multi-View 4-Yönlü (MV4D) özellik çıkarma modülünün yapısı. Giriş yamaları, zigzag, hiyerarşik, spiral ve radyal tarama dahil olmak üzere dört tamamlayıcı tarama-çift dalı aracılığıyla işlenir. Dört daldan çıkarılan özellikler birleştirilir, durum-uzay blokları kullanılarak işlenir ve Spatial Fusion Mamba (SFusion Mamba) tarafından entegre edilerek çıktı özellik temsili oluşturulur. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

4. MVV Bloğunun İnşası

  1. MVV Bloğunu bir ana dal ve iki yardımcı şube kullanarak inşa edin. Şekil 4'te gösterilen genel yapıyı kullanın.
  2. Ana daldaki giriş özelliğine katman normalizasyonu uygulanır. Normalleştirilmiş özelliği doğrusal bir katmana besleyin. Dönüştürülmüş özelliği derinlik açısından ayrılabilir konvolüsiyona aktarın.
  3. Dönüştürülmüş özelliği derinlik açısından ayrılabilir konvolüsyon kullanarak işleyin. GELU aktivasyon fonksiyonunu uygula. Etkinleştirilen özelliği MV4D modülüne besleyin.
  4. İlk yardımcı dalı kimlik kalıntısı bağlantısı olarak inşa edin. Giriş özelliğini doğrudan nihai çıkışa bağlayın. Bu dalı orijinal temsilini korumak ve eğitimi stabilize etmek için kullanın.
  5. İkinci yardımcı kolu bir projeksiyon aşağı-yukarı dal olarak inşa etmek. Giriş özelliğini aşağı projeksiyon katmanı kullanarak sıkıştırın. Özellik boyutunu yukarı projeksiyon katmanı kullanarak geri kazandırın.
  6. Ana dalın ve her iki yardımcı dalın çıkışlarını birleştirin. Son MVV Blok çıkışını elde edin. Tam mimari için Şekil 4'e bakınız.
  7. Ana dalın gizli boyutunu giriş kanalı boyutu Cs'ye eşit olarak ayarlayın. Ana doğrusal projeksiyondan önce LayerNorm(Cs) uygulayın ve boyutları CsCs olan doğrusal bir katman kullanın. Derinlik açısından ayrılabilir bir konvolüsyon kullanın; 3×3 derinlik bazında konvolüsyon ile dolgu 1, gruplar = Cs ve önyargı yok, ardından 1×1 nokta başına konvolüsyon ile yanlışlıksız bir konvolüsyon uygulanır.
  8. Derinlik açısından ayrılabilir konvolüsyondan sonra GELU aktivasyon fonksiyonunu uygulayın. Etkinleştirilmiş özelliği MV4D'ye besin ve CsCs boyutlarında bir çıkış lineer projeksiyonu uygulayın. Projection down-up dalını LayerNorm(Cs) ile yapılandırın; projeksiyon oranı 4, aşağı projeksiyon CsCs/4, GELU aktivasyonu ve yukarı projeksiyon Cs/4→Cs.
  9. Kimlik dalını, projeksiyon aşağı-yukarı dalı ve drop-path işlenmiş ana dalı eleman bazında toplama ile birleştirerek nihai MVV Blok çıktısını elde edin.

figure-protocol-6
Şekil 4. Çok Görüşlü Görüş (MVV) Bloğunun Mimarisi. Çok Görüşlü Görüş (MVV) Bloğunun Yapısı. Blok, Multi-View 4-Yönlü (MV4D) modülünü içeren ana özellik çıkarma dalından oluşur; derinlik olarak konvolüsyon, normalizasyon ve doğrusal projeksiyon katmanları içerir. Yardımcı yukarı-aşağı projeksiyon dalı, çıkış özellik temsili oluşturmak için kalıntı eklemeden önce elemanlar bazında çarpma yoluyla kapılı özellik modülasyonu sağlar. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

5. MFusion Mamba'nın İnşası

  1. Tüm kodlayıcı aşamalarından özellik haritalarını toplayın. Kodlayıcı özelliklerini, gerektiğinde boyutlandırarak veya yansıtarak birleşik bir temsil alanına hizalayın. Tam tensör seviyesinde uygulama iş akışı için Algoritma 2, Ek Dosya 1'e bakınız.
  2. Gerektiğinde kodlayıcı özelliklerini hedef mekansal çözünürlüğe göre boyutlandırın. Farklı kanal boyutlarına sahip proje özellikleri aynı kanal boyutuna girer. Çok aşamalı füzyon öncesi tüm kodlayıcı özelliklerini hizalayın.
  3. Hizalanmış kodlayıcı özelliklerini Kaba, Birleşme bileşenine besleyin. Hadamard ürünü kullanarak kaba füzyon gerçekleştirin. Kabaca birleşmiş temsil oluşturun.
  4. Kaba, füzyon temsili ince füzyon bileşenine beslenir. İki paralel ince füzyon yolu inşa edin. Her iki yolu bağımsız olarak işleyin.
  5. İlk ince füzyon yolunu doğrusal bir katman kullanarak işleyin. İkinci İnce Füzyon yolunu yukarı projeksiyon, Conv1d, Mamba ve aşağı projeksiyon kullanarak işleyin. Aşağıya projeksiyondan sonra özellik boyutunu geri getirin.
  6. İki İnce Füzyon yolunun çıktılarını Hadamard ürünü kullanarak birleştirin. Son doğrusal katmanı uygulayın. MFusion Mamba çıktısını elde edin.
  7. MFusion Mamba çıkışını çözücüye besleyin. Birleştirilmiş çok aşamalı temsil, kodlayıcı-kodlayıcı atlama özellikleri ile birlikte çözülür. Son segmentasyon haritasını oluşturun.
  8. Farklı aşamalardan kodlayıcı özelliklerini, kaba füzyondan önce birleşik bir özellik alanına hizalamak. Hizalanmış özellik temsillerini kaba ve ince füzyon aşamaları kullanarak işleyin. MFusion Mamba mimarisi için Şekil 5'e ve tam tensör seviyesinde uygulama iş akışı için Ek Algoritma 2'ye bakınız.
  9. MFusion Mamba'nın uygulama parametrelerini aşağıdaki gibi kullanın. Her kodlayıcı özelliği Ei için, kanal boyutunu Ci'den Ct'ye yansıtın. Projeksiyon özelliklerini hedef mekansal boyuta göre align_corners=Yanlış olarak bilineşer enterpolasyon kullanarak yeniden boyutlandırın.
  10. Hizalanmış kodlayıcı özellikleri arasında Kaba Füzyon gerçekleştirmek için Hadamard ürününü uygulayın. İlk İnce Füzyon yolunu C t → C t boyutlarında doğrusal bir katman kullanarak yapılandırın. İkinci İnce Füzyon yolunu yukarı projeksiyonlu Ct → 2Ct, Conv1d, model boyutu 2Ct, bir tarama yönü, durum boyutu 16 ve aşağı projeksiyon 2Ct → Ct ile yapılandırın.
  11. İnce Füzyon yollarının çıkışlarını Hadamard ürünü kullanarak birleştirin. Ct'den C t'ye boyutlu nihai doğrusal bir projeksiyon uygulayın. Birleşmiş çok aşamalı temsilini çözücüye besleyin.
  12. MFusion Mamba kullanarak çok aşamalı kodlayıcı özellikleri sigortalamak
    1. Tüm dört kodlayıcı aşamasından (E1, E2, E3 veE 4) kodlayıcı özelliklerini toplayın ve bunları MFusion Mamba modülüne giriş olarak kullanın. Dekoder füzyonu için yalnızca karşılık gelen aşama kodlayıcı özelliğini seçmeyin.
    2. Tüm kodlayıcı özelliklerini, mevcut dekoder aşaması için gereken mekânsal çözünürlüğe hizalayın. Kodlayıcı özelliklerini hedef çözünürlüğe göre yeniden boyutlandırın ve özellik birleşmeden önce gerekli kanal boyutuna yansıtın.
    3. Her kod çözücü aşaması için özellik hizalama prosedürünü tekrarlayın. Kodlayıcı H/16 × W/16, H/8 × W/8 ve H/4 × W/4 koordinatlarında çalıştığında, E1, E2, E3 ve E4'ü uygun hedef özellik alanına yeniden boyutlandırılıp projeksiyon yapın.
    4. MFusion Mamba modülünün Kabaca Füzyon ve İnce Füzyon işlemleriyle hizalanmış çok aşamalı kodlayıcı özelliklerini birleştirin ve birleşen temsil, ilgili ölçekte dekoder özellikleriyle birleştirin.
    5. Models/mvmunet/core.py'de yayınlanan uygulamaya göre özellik projeksiyonu, yeniden boyutlandırma ve füzyon işlemlerini gerçekleştirin.

figure-protocol-7
Şekil 5. Çok aşamalı Fusion Mamba (MFusion Mamba) modülünün mimarisi. Çok aşamalı Füzyon Mamba (MFusion Mamba) modülünün yapısı. Çok ölçekli kodlayıcı özellikleri önce kaba füzyon ile birleştirilir ve ardından doğrusal projeksiyon, tek boyutlu konvolüsyon (Conv1d), bir Mamba bloğu ve özellik projeksiyon katmanlarından oluşan İnce Füzyon modülü aracılığıyla geliştirilir; bu modül çözücü tarafından kullanılan birleşmiş özellik temsili oluşturulur. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

6. Model eğitimi

  1. MVM-UNet'i Ubuntu 22.04.1 üzerinde Linux çekirdeği 6.8.0 sürümüyle eğitin. 13. nesil Intel Core i9-13900K CPU ve NVIDIA A800 GPU ile donatılmış bir iş istasyonu kullanın. Eğitim ve değerlendirme boyunca aynı donanım konfigürasyonunu kullanın.
  2. Modeli PyTorch 2.0.1 ile CUDA 11.8 kullanarak uygulayın ve eğitin. Eğitimden önce tüm gerekli yazılım bağımlılıklarını kurun.
  3. AdamW optimizer'ini 3 × 10−5, β1 = 0.9, β2 = 0.999, ε = 1 × 10−8 ve ağırlık kaybı 0.01 olan AdamW optimizatorunu kullanın. Parti büyüklüğünü 32 olarak ayarlayın, aksi belirtilmedikçe.
  4. Her modeli 300 dönem boyunca eğitin. ηmin = 1 × 10−5 olan bir kosinüs tavlama öğrenme hızı takvimi kullanın. Giriş görüntü boyutunu ISIC 2017 ve ISIC 2018 için 256 × 256, Synapse için ise 224 × 224 olarak ayarlayın.
  5. Ana karşılaştırma deneyleri için üç bağımsız rastgele tohum (1, 52 ve 100) kullanın. Her tohum için tam eğitim ve değerlendirme prosedürünü tekrarlayın. Nihai nicel sonuçları üç koşu boyunca ortalama ± SD olarak bildirin.
  6. Tüm ablasyon çalışmaları için aksi belirtilmedikçe sabit rastgele 100 tohum kullanın. Tüm ablasyon deneylerinde veri seti bölümlerini, ön işlem stratejisini, ağ mimarisini, optimize edicisini, öğrenme hızını, parti büyüklüğünü ve eğitim dönemi sayısını değiştirmeden tutun.
  7. ISIC 2017 ve ISIC 2018'de ikili lezyon segmentasyonu için BCE-Dice kaybını kullanın. BCE ve zar kaybı ağırlıklarını 1.0'a ayarlayın. Synapse için CE-Dice kaybını kullanın ve hem çapraz entropi hem de zar kaybı ağırlıklarını 1.0'a ayarlayın.
  8. ISIC 2017 ve ISIC 2018 eğitim görüntülerini Adım 1'de tanımlanan ön işleme prosedürünü kullanarak yeniden boyutlandırın, normalize edin ve artırın. Adım 1'de açıklandığı gibi Synapse eğitim görgelerine yeniden boyutlandırma, rastgele dönüş ve rastgele çevirme uygulayın. Tüm antrenman çalışmalarında aynı ön işleme ayarlarını kullanın.
  9. Veri setine özgü doğrulama protokolüne göre model kontrol noktalarını seçin. ISIC 2017 ve ISIC 2018 için en iyi doğrulama performansına sahip kontrol noktasını kaydedin ve her 30 dönemde bir doğrulama yapın. Synapse'ı 300 dönem boyunca doğrulama seti olmadan eğitin ve test için son eğitim kontrol noktasını kullanın.
  10. ISIC 2017 ve ISIC 2018 modellerinde sadece resmi doğrulama setini kullanın. Synapse test setini eğitim, hiperparametre ayarlama veya kontrol noktası seçimi için kullanmayın. Tüm test verilerini yalnızca nihai değerlendirme için ayırın.
  11. Tekrarlanabilirlik için aşağıdaki eğitim parametrelerini kullanın. Tüm veri setleri için toplu boyutu 32'ye ayarlayın. AdamW'yi 3 × 10−5, β1 = 0.9, β2 = 0.999, ε = 1 × 10−8 ve ağırlık kaybı 1 × 10−2 ile kullanın.
  12. ISIC 2017 ve ISIC 2018 için kosinüs tavlama öğrenme hızı zamanlayıcısını Tmax = 50 ve ηmin = 1×10−5 olarak yapılandırın. Zamanlayıcıyı Tmax = 100 ve ηmin = 1×10−5 olarak Synapse için yapılandırın. Tüm tekrarlanan deneyler için zamanlayıcı konfigürasyonunu değiştirmeden tutun.
  13. Tüm modelleri tam hassasiyetli FP32 aritmetiği ile eğitin. Otomatik karma hassasiyetli eğitimi devre dışı bırakın. Optimizasyon sırasında gradyan krampası uygulamayın.
  14. Tüm karşılaştırma deneylerinde, ablasyon çalışmalarında ve tekrarlanabilirlik çalışmalarında hassasiyet ayarlarını, gradyan güncelleme stratejisini, optimizator yapılandırmasını, öğrenme hızı takvimini ve rastgele tohum protokolünü değiştirmeden tutun.
  15. En iyi model kontrol noktasını seçin
    1. ISIC 2017 ve ISIC 2018 veri setleri için her eğitim döneminden sonra doğrulama setinde modeli değerlendirin.
    2. Her doğrulama partisi için İkili Çapraz Entropi (BCE)-Zar kaybını hesaplayın ve tüm doğrulama seti boyunca ortalama doğrulama kaybını hesaplayın.
    3. Ortalama doğrulama kaybı daha önce kaydedilen minimum doğrulama kaybından daha düşük olduğunda mevcut modeli en iyi kontrol noktası olarak saklayın.
    4. Doğrulama sırasında sadece performans izleme için Union (mIoU), zar benzerlik katsayısı (DSC), doğruluk (Acc), özgüllük (Spe) ve hassasiyet (Sen) üzerinden ortalama kesişim kaydı yapın. Bu metrikleri kontrol noktası seçimi kriteri olarak kullanmayın.

7. Model değerlendirmesi

  1. Her veri seti için resmi test seti kullanılarak eğitilen modeli değerlendirin. Test setini yalnızca nihai performans değerlendirmesi için kullanın.
  2. ISIC 2017 ve ISIC 2018 için mIoU, DSC, Acc, Sen ve Spe hesaplanın. Tüm hesaplamalar için piksel düzeyinde gerçek pozitifler (TP), yanlış pozitifler (FP), gerçek negatifler (TN) ve yanlış negatifler (FN) kullanın.
  3. ISIC 2017 ve ISIC 2018 için model çıktısına sigmoid aktivasyon fonksiyonu uygulan. Olasılık haritasını 0.5 eşik kullanarak ikili segmentasyon maskesine dönüştürün. Değerlendirme metriklerini Denklemler 2–6 kullanarak hesaplayın:
    figure-protocol-8 (2)
    figure-protocol-9 (3)
    figure-protocol-10 (4)
    figure-protocol-11 (5)
    figure-protocol-12 (6)
  4. Synapse için, model çıktısına softmax aktivasyon fonksiyonunu uygulayın. Her piksel veya voxel, argmax işlemini kullanarak en yüksek olasılıklı sınıfa atayın. Her ön plan organı için DSC ve 95. perdelik Hausdorff mesafesini (HD95) hesaplayın ve tüm test vakalarında ortalama değerleri raporlayın.
  5. MVM-UNet'i temsil eden CNN tabanlı, Transformer tabanlı ve durum-uzay modeli (SSM) tabanlı segmentasyon yöntemleriyle karşılaştırın. Tüm yöntemler için aynı veri seti bölümlerini, ön işleme prosedürlerini, giriş çözünürlüklerini ve değerlendirme metriklerini kullanın.
  6. ISIC 2017 ve ISIC 2018 için resmi eğitim, doğrulama ve test bölümlerini kullanın. Synapse için standart 18 eğitim vakası ve 12 test vakası bölünmesini kullanın. Giriş çözünürlüğünü ISIC veri setleri ve Synapse için ayarlayın.
  7. Mevcut olan zaman resmi uygulamalarıyla temel yöntemleri yeniden üretin. Rapor, tekrarlanan çalışmalarda ortalama ± SD olarak sonuçları yeniden yayımladı. Orijinal olarak yayımlanan literatür verilerini koruyun ve ilgili tablo notlarında ayırt edin.
  8. Aksi belirtilmedikçe sabit rastgele 100 tohum kullanarak ablasyon çalışmaları yapın. Tüm ablasyon deneylerinde veri seti bölümlerini, ön işleme prosedürü, giriş çözümlemesi, optimize edici, öğrenme hızı takvimi, parti büyüklüğü, epoch sayısı, kayıp fonksiyonu ve değerlendirme metriklerini değiştirmeden tutun.
  9. MV4D, SFusion Mamba, MVV Bloğundaki Yukarı-Aşağı Projeksiyon dalı, MFusion Mamba, giriş görüntü boyutu, kopma değeri ve kodlayıcı-kodlayıcı katmanı yapılandırmasının katkılarını değerlendirin. Her ablasyon deneyinde yalnızca hedef bileşeni veya parametreyi değiştirin.
  10. ISIC 2017 ve ISIC 2018 için eşleştirilmiş görüntü sonuçları ve Synapse için eşleştirilmiş vaka sonuçları kullanılarak Wilcoxon imzalı sıralama testini gerçekleştirin. İstatistiksel anlamlılığı belirtmek için 0.05'ten küçük bir p-değeri düşünün.
  11. Tüm yöntemler için aynı donanım ortamı ve giriş çözünürlüğü kullanılarak hesaplama verimliliğini değerlendirin. Dönem başına eğitim süresini, görüntü başına çıkarım süresini, eğitim sırasında GPU belleğinin zirve kullanımını, model parametrelerinin sayısını ve kayan nokta işlemlerini (FLOP'lar) ölçün. Tek bir ileri pas kullanarak FLOP'ları hesaplayın.
  12. Model değerlendirmesi tamamlandıktan sonra yalnızca test setinden temsil niteliksel örnekler seçin. Orijinal görüntü, gerçek gerçek maskesi ve tahmin edilen maske, tüm yöntemlerde aynı test vakalarını kullanarak karşılaştırın. Küçük hedefler, düzensiz sınırlar, belirsiz sınırlar ve temsil çok organlı yapıları içeren temsilci örnekleri seçin.
  13. Değerlendirme metriklerini hesaplayın ve istatistiksel analiz yapın
    1. ISIC 2017 ve ISIC 2018 veri setleri için segmentasyon metriklerini Python ile NumPy ve sklearn.metrics.confusion_matrix kullanarak hesaplayın. Tahmin edilen olasılık haritasını 0.5'e eşik olarak belirleyin, piksel düzeyinde TP, FP, TN ve FN'yi alın ve bu değerlerden mIoU, DSC, Acc, Sen ve Spe'yi hesaplayın.
    2. Synapse veri seti için DSC ve HD95'i sırasıyla medpy.metric.binary.dc ve medpy.metric.binary.hd95 kullanarak hesaplayın. Değerlendirme metriklerini hesaplamadan önce model çıktısına softmax ve ardından argmax uygulayın.
    3. Tek bir ileri geçişle thop.profile kullanarak FLOP sayısını ve eğitilebilir parametreleri hesaplayın.
    4. Wilcoxon imzalı sıralama testini scipy.stats.wilcoxon kullanarak Python'da gerçekleştirin. ISIC 2017 ve ISIC 2018 veri setleri için eşleştirilmiş görüntü başına metrik değerleri ve Synapse veri seti için çiftleştirilmiş vaka başına metrik değerler kullanın.

8. Kayıp fonksiyonu tanımı

  1. Çok sınıflı segmentasyon için standart Çapraz Entropi (CE) kaybını, ikili segmentasyon için ise standart BCE kaybını kullanın. Segmentasyon için standart Zar kaybı formülasyonunu kullanın. 7–11 denklemleri bu protokolde kullanılan kayıp fonksiyonlarını tanımlar.
    figure-protocol-13(7)
    figure-protocol-14(8)
    figure-protocol-15(9)
    figure-protocol-16(10)
    figure-protocol-17(11)
  2. ISIC 2017 ve ISIC 2018 için BCE ve zar kaybı ağırlıklarını 1.0 olarak ayarlayın; figure-protocol-18böylece 1 = 1.0 ve figure-protocol-192 = 1.0. Synapse için CE ve zar kaybetme ağırlıklarını 1.0 olarak ayarlayın, örneğin 1 = 1.0 ve φ 2 = 1.0 gibi φ.
  3. Kayıp fonksiyonlarını utils.py'de uygulayın. nn kullanın. BCE terimi ve nn için BCELoss. CE dönemi için CrossEntropyLoss (CrossEntropyLoss) için geçerlidir. İkili Zar kaybı, tahmin edilen maske ve zemin-doğruluk maskesini düzleştirerek, her örnek için zar kaybını hesaplayarak ve parti boyunca kaybın ortalamasını hesaplayın. Çok sınıflı zar kaybını, hedef etiket haritasını tek sıcak formata dönüştürerek, model çıktısına softmax uygulayarak, her sınıf için zar kaybını hesaplayarak ve tüm sınıflar arasında kaybı ortalamayı hesaplayarak hesaplayın.
  4. İkili zar kaybı için yumuşatma sabitini 1 olarak, çok sınıflı zar kaybı için ise 1×10−5 olarak ayarlayın. BCE-Zar kaybını, wb = 1 ve wd = 1 ile BceDiceLoss sınıfını kullanarak uygulayın. CE-Zar kaybını CeDiceLoss sınıfı kullanarak loss_weight = [1, 1] ile uygulayın. Tüm veri setleri, rastgele tohumlar ve deneyler için yumuşatma sabitlerini, azaltma stratejisini ve yazılım uygulamasını değiştirmeden tutun.
  5. Kayıp azaltma yapılandırılması
    1. Instantiate nn. BCELoss() ve nn. CrossEntropyLoss() ile birlikte indirgeme argümanını açıkça belirtmeden CrossEntropyLoss() ile karşılaşır.
    2. Her iki kayıp fonksiyonu için varsayılan PyTorch kayıp azaltma ayarını (azaltma = "ortalama") kullanın. İnredasyon = "toplam" veya azaltılmamış kayıp çıktısı kullanmayın.

9. Tekrarlanabilirlik ayarları ve uygulama

  1. Yayınlanan uygulamayı https://github.com/LIXUEGUANG002/MVM-UNet'dan indirin. Depo, Materyaller Tablosu'nda listelenen yazılım paketleri, veri setleri, donanım özellikleri ve hesaplama kaynaklarıyla birlikte kullanın.
  2. Depoyu klonlayın ve git clone https://github.com/LIXUEGUANG002/MVM-UNet.git çalıştırarak proje dizinine girin, ardından cd MVM-Unet ile devam edin.
  3. ISIC 2017 veya ISIC 2018 deneyini, veri seti adı, veri seti yolu, giriş boyutu, parti büyüklüğü, epoch sayısı, kayıp fonksiyonu, optimizator, öğrenme hızı zamanlayıcısı ve rastgele tohumu configs/config_setting.py'de ayarlayarak yapılandırın. Eğitim betisini depo kökünden python train.py kullanarak çalıştırın.
  4. Synapse deneyini, configs/config_setting_synapse.py'de veri seti adı, eğitim veri yolu, test hacmi yolu, liste dizini, giriş boyutu, sınıf sayısı, toplu büyüklüğü, epoch sayısı, kayıp fonksiyonu, optimizator, öğrenme hızı zamanlayıcısı ve rastgele tohum ayarları ile yapılandırmak/. Eğitim betesini depo kökünden python train_synapse.py kullanarak çalıştırın.
  5. Yalnızca çıkarma değerlendirmesini gerçekleştirmek için only_test_and_save_figs = Doğru, best_ckpt_path eğitilmiş kontrol noktasına ve img_save_path ilgili yapılandırma dosyasındaki çıktı dizinine ayarlayın. ISIC 2017 veya ISIC 2018 için python train.py çalıştırın, tahmin sonuçları ve niteliksel rakamlar oluşturmak için Synapse için python train_synapse.py çalıştırın.
  6. Yayınlanan kaynak kodu sürümünü kullanın
    1. Yayınlanan GitHub deposunu klonlayın ve veri setlerini, eğitim betiklerini ve değerlendirme ayarlarını yapılandırmadan önce master dalda commit ee891b42c2f2f1d4463adc5e103e üzerinde inceleyin.
    2. Bu taahhüdü kullanarak bu çalışmada bildirilen deneyleri tekrar edin. El yazması revizyonu sırasında depo için etiketlenmiş bir sürüm mevcut değildi.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Beklenen sonuçlar ve yorumlama
Bu protokol doğru uygulandığında, eğitilmiş MVM-UNet modelinin çoğu değerlendirme metrikinde farklı rastgele tohumlar arasında sadece küçük farklılıklarla tekrarlanan çalışmalar arasında istikrarlı segmentasyon performansı üretmesi beklenmektedir. ISIC 2017 ve ISIC 2018 için başarılı sonuçlar, yüksek DSC, mIoU, Acc, Sen ve Spe değerleri ile yer-gerçeklik lezyon sınırlarını yakından takip eden öngörülen lezyon maskeleriyle yansıtılır (Şekil 6 ve 7). Synapse için başarılı sonuçlar, ön plan organlarında yüksek ortalama DSC değerleri ve düşük HD95 değerleri ile yansıtılır (Şekil 8). Protokol yürütme sırasında, nicel metrikler ilgili nitel segmentasyon sonuçlarıyla birlikte yorumlanmalıdır. Yüksek DSC elde eden ancak sınır sızıntısı, küçük yapıların atlanması veya parçalanmış tahminler gösteren bir model yalnızca kısmen başarılı olarak kabul edilmeli ve ön işleme prosedürü, kontrol noktası seçimi ve çıkarım ayarları doğrulanmalıdır.

figure-results-1
Şekil 6. ISIC 2017 veri seti üzerinde temsil nitel segmentasyon sonuçları. Uluslararası Cilt Görüntüleme İşbirliği (ISIC) 2017 cilt lezyonu segmentasyon veri setinde temsil nitel segmentasyon sonuçları elde edilmiştir. Her örnek, orijinal dermoskopik görüntü (Image), karşılık gelen yer-gerçeklik segmentasyon maskesi (GT) ve MVM-UNet (Pred) tarafından oluşturulan tahmini gösterir. Temsilci test vakaları, farklı boyut, morfoloji ve sınır karmaşıklığına sahip lezyonlar için segmentasyon performansını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-2
Şekil 7. ISIC 2018 veri setinde temsil nitel segmentasyon sonuçları. Uluslararası Cilt Görüntüleme İşbirliği (ISIC) 2018 cilt lezyonu segmentasyon veri setinde temsil nitel segmentasyon sonuçları elde edilmiştir. Her örnek, orijinal dermoskopik görüntü (Image), karşılık gelen yer-gerçeklik segmentasyon maskesi (GT) ve MVM-UNet (Pred) tarafından oluşturulan tahmini gösterir. Temsilci test vakaları, çeşitli lezyon görünümleri ve sınır özellikleri arasında segmentasyon performansını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-3
Şekil 8. Synapse çoklu organlı bilgisayarlı tomografi veri setinde temsil nitel segmentasyon sonuçları. Synapse Multi-Atlas Etiketleme Kranial Vault veri seti üzerinde temsil niteliksel çok organ segmentasyon sonuçları elde edildi. Her örnek, orijinal bilgisayarlı tomografi görüntüsünü (Image), karşılık gelen yer-gerçeklik organ açıklamalarını (GT) ve MVM-UNet (Pred) tarafından oluşturulan tahmini gösterir. Temsilci örnekler, birden fazla karın organı arasında tahmin edilen ve referans segmentasyonlar arasındaki uyumu gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

ISIC 2017'deki Performans
MVM-UNet'in tekrarlanabilirliğini değerlendirmek için, tüm ana karşılaştırma deneyleri üç bağımsız rastgele tohum (1, 52 ve 100) kullanılarak tekrarlandı ve sonuçlar ortalama SD ± olarak bildirildi. İstatistiksel anlamlılık, ISIC 2017 ve ISIC 2018 için eşleştirilmiş görüntü başına sonuçlara ve Synapse için eşleştirilmiş vaka sonuçlarına dayalı Wilcoxon imzalı sıralama testi kullanılarak değerlendirildi. İstatistiksel analiz, tohum seviyesindeki ortalamalar yerine eşleştirilmiş metrik değerleri kullanılarak gerçekleştirildi. Adil karşılaştırma için, ortalama SD olarak bildirilen sonuçlar aynı veri seti bölümleri, giriş çözünürlükleri ve değerlendirme metrikleri altında ±resmi uygulamalar kullanılarak mümkün olduğunca yeniden üretildi; tek değerli sonuçlar ise ilgili orijinal yayınlardan korundu.

MVM-UNet, ISIC 2017 cilt lezyonu segmentasyon veri seti üzerinde değerlendirildi ve UNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36 ve H2Former12 gibi temsilli segmentasyon yöntemleriyle karşılaştırıldı (Tablo 1). MVM-UNet, üç bağımsız koşuda %80,94 ± %1,01, %91,32 ± %0,68 DSC, %96,58 doğruluk ± %0,27, %98,31 özgüllük ± %0,23 ve %91,65 ± %0,77 hassasiyet elde etti. Değerlendirilen yöntemlerle karşılaştırıldığında, MVM-UNet en yüksek mIoU, DSC ve hassasiyeti elde etti. Temsil eden nitel segmentasyon sonuçları, tahmin edilen maskelerin temsil test görüntülerindeki yer-gerçeklik lezyon sınırlarını yakından takip ettiği Şekil 6'da gösterilmiştir.

ModelHakem.mIoU (%)DSC (%)Acc (%)Spe (%)Sen (%)
UNet876.9886.9995.6597.4386.82
TransUNet2375.3281.2391.4595.7782.63
MaLUNet3178.7888.1396.1898.4784.78
VM-UNet3280.2389.0396.2997.5889.90
UNeXt-S3378.2687.8095.9597.7487.04
HResFormer3479.89 ± 1.0588.82 ± 0.6596.25 ± 0.2497.73 ± 0.2287.72 ± 0.79
H-vmunet2880.34 ± 1.0290.68 ± 0.5596.42 ± 0.1898.23 ± 0.3288.97 ± 0.88
MISSFormer3080.16 ± 0.7889.27 ± 0.6194.36 ± 0.2897.52 ± 0.3887.71 ± 0.69
H2Former1280.35 ± 0.9588.56 ± 0.7296.61 ± 0.1998.15 ± 0.1488.21 ± 0.81
MedScale-Former3580.31 ± 0.8289.11 ± 0.5995.68 ± 0.3398.24 ± 0.2189.96 ± 0.92
MCAFT3680.59 ± 0.9389.27 ± 0.6396.42 ± 0.2097.95 ± 0.1790.05 ± 0.84
MVM-UNet (Bizimki)80.94 ± 1.0191.32 ± 0.6896.58 ± 0.2798.31 ± 0.2391.65 ± 0.77

Tablo 1: ISIC 2017 cilt lezyonu segmentasyon veri seti üzerinde performans karşılaştırması. MVM-UNet'in, temsil eden konvolüsyon sinir ağı (CNN), Transformer- ve durum-uzay modeli (SSM) tabanlı segmentasyon yöntemleriyle karşılaştırılması; ortalama Birlik Kesişimi (mIoU), zar benzerlik katsayısı (DSC), doğruluk (Acc.), özgülük (Spe.) ve hassasiyet (Sen.) kullanılıyor. MVM-UNet sonuçları, üç bağımsız rastgele tohum deneyinden ortalama ± standart sapma olarak bildirilmiştir. Tek değer olarak bildirilen sonuçlar, ilgili orijinal yayınlardan yeniden üretilmiştir.

Nitel örnekler, MVM-UNet'in hem küçük lezyonları hem de düzensiz sınırlı büyük lezyonları doğru şekilde segmentlere ayırdığını göstermektedir. Bu temsilci örneklerde, öngörülen maskeler, ilgili yer doğruluğu açıklamalarıyla yakından eşleşmiş ve minimum sızıntı veya parçalanma ile korunmuş lezyon sınırlarını oluşturmuştur.

Gözlemlenen iyileşmelerin istatistiksel olarak anlamlı olup olmadığını daha iyi değerlendirmek için, Wilcoxon imzalı sıralama testleri eşleştirilmiş görüntü başına segmentasyon sonuçları kullanılarak gerçekleştirildi. mIoU ölçütü için MVM-UNet, MCAFT'ye göre istatistiksel olarak anlamlı bir iyileşme gösterdi ve p-değeri 0.0114 oldu. DSC metrikinde MVM-UNet de H-vmunet'i önemli ölçüde geride bıraktı ve p-değeri 0.0031 oldu. Bu sonuçlar, ISIC 2017'de gözlemlenen iyileşmelerin rastgele varyasyondan kaynaklanmasının pek olası olmadığını desteklemektedir.

Genel olarak, MVM-UNet, ISIC 2017 veri setinde mIoU, DSC ve hassasiyet için karşılaştırılan yöntemler arasında en yüksek performansı elde etti (Tablo 1). Şekil 6'da gösterilen nitel segmentasyon örnekleri, bu nicel bulgularla tutarlıdır.

ISIC 2018'deki Performans
MVM-UNet, ISIC 2018 cilt lezyonu segmentasyon veri seti üzerinde ayrıca değerlendirildi ve UNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 ve MCAFT36 gibi temsilli segmentasyon yöntemleriyle karşılaştırıldı (Tablo 2). MVM-UNet, üç bağımsız denemede %82,47 ± %1,28, %90,65 ± %0,94 DSC, %96,02 doğruluk ± %0,36, %97,06 ± %0,31 özgüllük ve %91,80 ± %0,82 hassasiyet elde etti. Bu sonuçlar, MVM-UNet'in performansının farklı rastgele tohumlar arasında tutarlı kaldığını göstermektedir. Temsilci nitel segmentasyon sonuçları Şekil 7'de gösterilmiştir.

ModelHakem.mIoU (%)DSC (%)Acc (%)Spe (%)Sen (%)
UNet877.8687.5594.0596.6985.86
UNet++978.3187.8394.0295.7588.65
UTNetV23778.9788.2594.3296.4887.60
SANet3879.5288.5994.3995.9789.46
MaLUNet3180.2589.0494.6296.1989.74
VM-UNet3281.3589.7194.9196.1391.12
H-vmunet2881.93 ± 1.4590.46 ± 0.6295.19 ± 0.3096.82 ± 0.2188.37 ± 1.13
MISSFormer3080.27 ± 1.2189.91 ± 0.4694.76 ± 0.2797.22 ± 0.1590.84 ± 1.07
H2Former1280.40 ± 0.8390.26 ± 0.7394.89 ± 0.3896.98 ± 0.2591.57 ± 0.54
HResFormer3481.12 ± 1.1888.86 ± 0.8494.96 ± 0.3396.43 ± 0.2291.86 ± 1.01
MedScale-Former3580.97 ± 0.7490.47 ± 0.6895.02 ± 0.4195.89 ± 0.2690.65 ± 0.92
MCAFT3681.46 ± 1.0389.06 ± 0.7695.23 ± 0.2996.72 ± 0.1791.82 ± 0.57
MVM-UNet (Bizimki)82.47 ± 1.2890.65 ± 0.9496.02 ± 0.3697.06 ± 0.3191.80 ± 0.82

Tablo 2: ISIC 2018 cilt lezyonu segmentasyon veri seti üzerinde performans karşılaştırması. MVM-UNet'in, ortalama Kesişim (mIoU), Zar Benzerlik Katsayısı (DSC), doğruluk (Acc.), özgüllük (Spe.) ve hassasiyet (Sen.) kullanılarak temsil eden CNN-, Transformer- ve SSM tabanlı segmentasyon yöntemleriyle karşılaştırılması. MVM-UNet sonuçları, üç bağımsız rastgele tohum deneyinden ortalama ± standart sapma olarak bildirilmiştir. Tek değer olarak bildirilen sonuçlar, ilgili orijinal yayınlardan yeniden üretilmiştir.

H-vmunet ile karşılaştırıldığında, MVM-UNet mIoU'yu %0,54 oranında iyileştirdi. MedScale-Former ile karşılaştırıldığında, MVM-UNet DSC'yi %0,18 artırdı. MVM-UNet ayrıca karşılaştırılan yöntemler arasında en yüksek doğruluğu elde etti. Şekil 7'de gösterilen temsili nitel örnekler, küçük lezyon bölgeleri ve düzensiz sınırlı lezyonlar dahil olmak üzere temsil deri lezyonlarının doğru segmentasyonunu göstermektedir.

ISIC 2018 için, istatistiksel anlamlılık Wilcoxon imzalı sıralama testi kullanılarak eşleştirilmiş görüntü segmentasyon sonuçlarına dayanarak değerlendirildi. mIoU ölçütü için MVM-UNet, MCAFT'ye göre istatistiksel olarak anlamlı bir iyileşme elde etmiş ve p-değeri < 0.001 olmuştur. Bu sonuçlar, ISIC 2018'de gözlemlenen performans artışının rastgele varyasyondan kaynaklanmasının pek olası olmadığını desteklemektedir.

Genel olarak, MVM-UNet, ISIC 2018 veri setinde karşılaştırılan yöntemler arasında en yüksek mIoU, DSC ve doğruluğu elde etti (Tablo 2). Şekil 7'de gösterilen nitel örnekler, bu nicel iyileştirmelerle tutarlıdır.

Synapse üzerindeki performans
Önerilen yöntem ayrıca Synapse çoklu organ segmentasyon veri seti üzerinde değerlendirildi ve UNet 8,21, AttentionU-Net 39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 ve MCAFT36 gibi temsil yöntemlerle karşılaştırıldı (Tablo 3). Synapse veri seti sekiz karın organını içeriyordu: aorta, safra kesesi, dalak, sol böbrek, sağ böbrek, karaciğer, pankreas ve mide. Standart deneysel protokole uygun olarak, eğitim için 18 vaka (2.212 eksenel dilim) ve test için 12 vaka (1.567 eksenel dilim) kullanıldı. Ayrı bir doğrulama seti tanıtılmamıştır. Test vakaları yalnızca nihai değerlendirme için kullanıldı ve model eğitimi, hiperparametre ayarlama veya model seçimi için kullanılmadı. Temsil niteliksel çok organlı segmentasyon sonuçları Şekil 8'de gösterilmekte olup, nicel karşılaştırma Tablo 3'te özetlenmiştir.

ModelHakem.DSCHD95Aor.Gal.Çocuk. (L)Çocuk. (R)Liv.Pan.Spl.Sto.
UNet876.8539.7889.0769.7277.7768.6993.4354.0186.6675.59
Att-UNet3977.7736.0289.5468.8877.9871.1193.5758.0487.3175.74
TransUNet2377.4831.6987.2363.1381.8777.0294.0855.8485.0675.62
TransNorm4078.430.2586.2365.1882.1878.6394.2255.3289.5376.02
Swin U-Net2579.1321.5585.4766.5383.2879.6194.2956.5890.6276.59
TransDeepLab4180.1621.2586.0469.1684.0879.8893.5361.1589.0178.36
MEW-UNet4278.9221.6886.6865.3282.8780.0293.6358.3890.1674.27
MISSFormer3080.92 ± 4.2320.09 ± 1.8986.43 ± 0.9869.81 ± 4.5684.29 ± 2.1181.03 ± 3.3493.85 ± 0.8961.11 ± 4.6790.05 ± 3.7880.62 ± 1.02
H2Former1281.05 ± 2.5620.13 ± 7.2386.61 ± 3.2169.32 ± 1.2385.12 ± 4.7882.01 ± 2.8994.09 ± 2.4561.16 ± 0.7689.97 ± 4.1280.94 ± 3.56
HResFormer3480.65 ± 4.0217.48 ± 6.8989.16 ± 2.7866.94 ± 0.7884.61 ± 4.3482.15 ± 2.5693.11 ± 1.3459.92 ± 4.1291.08 ± 3.4580.75 ± 2.01
MedScale-Former3580.78 ± 1.3420.02 ± 3.7888.79 ± 4.0269.82 ± 2.5685.13 ± 0.8781.63 ± 4.7894.10 ± 2.7860.72 ± 1.8990.14 ± 1.5680.93 ± 4.56
MCAFT3681.03 ± 3.4519.98 ± 5.1289.76 ± 0.7668.96 ± 3.8984.54 ± 2.5681.98 ± 3.1294.32 ± 4.0160.85 ± 3.6789.06 ± 4.8980.91 ± 1.78
MVM-UNet (Bizimki)81.26 ± 1.8918.72 ± 2.1688.53 ± 3.2269.84 ± 4.2385.37 ± 2.6982.67 ± 1.6794.41 ± 3.5661.02 ± 2.7890.19 ± 0.6781.48 ± 3.12

Tablo 3: Synapse çoklu organ segmentasyon veri setinde performans karşılaştırması. MVM-UNet'in, Zar Benzerlik Katsayısı (DSC), 95. perdelik Hausdorff mesafesi (HD95) ve organa özgü Zar puanları kullanılarak temsil CNN-, Transformer- ve SSM tabanlı segmentasyon yöntemleriyle karşılaştırılması (Kid. (L)), sağ böbrek (Çocuk. (R)), karaciğer (Liv.), pankreas (Pan.), dalak (Spl.) ve mide (Sto.). MVM-UNet sonuçları, üç bağımsız rastgele tohum deneyinden ortalama ± standart sapma olarak bildirilmiştir. Tek değer olarak bildirilen sonuçlar, ilgili orijinal yayınlardan yeniden üretilmiştir.

MVM-UNet, üç bağımsız yayında ortalama %81,26 ± %1,89 ve ortalama HD95 oranı 18,72 ± 2,16 %'ye ulaştı. Sonuçlar, Synapse veri setinde stabil segmentasyon performansını göstermektedir. Değerlendirilen yöntemler arasında MVM-UNet en yüksek ortalama DSC ve ikinci en düşük ortalama HD95'i elde etti.

Synapse için, istatistiksel anlamlılık vaka başına eşleştirilmiş DSC değerlerine dayalı Wilcoxon işaretli sıralama testi kullanılarak değerlendirildi. MVM-UNet, H2Former'a göre istatistiksel olarak anlamlı bir iyileşme gösterdi ve p-değeri 0.026 oldu; bu da gözlemlenen segmentasyon performansındaki iyileşmenin istatistiksel olarak anlamlı olduğunu gösterdi.

Temsil eden başarılı ve yetersiz sonuçlar
Temsil eden başarılı nitel sonuçlar Şekiller 6–8'de gösterilmiştir. Başarılı sonuçlar, temel gerçek açıklamalarına yakından karşılık gelen ve birincil lezyon veya organ sınırlarını doğru şekilde belirleyen tahmini segmentasyon maskeleriyle karakterize edilir. Çok küçük hedeflerde, düşük kontrastlı sınırlarda, düzensiz lezyon şekillerinde, zayıf yoğunlukta kontrastlı organlarda veya anatomik olarak belirsiz sınırlarda temsil edici suboptimal sonuçlar ortaya çıkabilir ve genellikle alt segmentasyon, aşırı segmentasyon, sınır sızıntısı veya kesintisiz maske parçaları şeklinde görülebilir. Bu tür sonuçlar gözlemlendiğinde, kullanıcılar görüntü boyutlandırması, normalizasyon, maske enterpolasyonu, model kontrol noktası seçimi, çıkarım eşiği (ISIC veri setleri için) veya argmax tahmini (Synapse için) ve metrik hesaplama prosedürlerinin Protokol'de tanımlananlarla uyumlu olduğunu doğrulamalıdır.

MV4D modülünün ablasyon çalışması
MV4D modülünün katkısı, zikzak, hiyerarşik, spiral ve radyal tarama çiftlerinin kademeli olarak eklenmesiyle değerlendirildi; ardından SFusion Mamba modülü eklendi (Tablo 4; Şekil 9). Sadece zikzak tarama çifti kullanıldığında, segmentasyon performansı sınırlıydı. Hiyerarşik tarama çiftinin eklenmesi performansı önemli ölçüde artırdı ve çok ölçekli bilginin dahil edilmesinin faydasını gösterdi. Spiral ve radyal tarama çiftlerinin eklenmesi, kontur ve sınır temsilini geliştirerek segmentasyon performansını daha da iyileştirmiştir. SFusion Mamba modülünün dahil edilmesi, değerlendirilen konfigürasyonlar arasında en yüksek performansı sağladı.

ModelZikzak tarama çiftiHiyerarşik tarama çiftiSpiral tarama çiftiRadyal tarama çiftiSFusion MambaISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet56.7572.4658.0373.45
MVM-UNet72.3884.0173.4584.7
MVM-UNet75.6986.2076.9486.94
MVM-UNet76.4186.6178.2887.82
MVM-UNet80.9491.3282.4790.65

Tablo 4: Çok Görüşlü 4-Yönlü (MV4D) modülünün ablasyon çalışması. Hiyerarşik, spiral ve radyal tarama çiftleri ile Spatial Fusion Mamba (SFusion Mamba) modülünün temel zikzak tarama çifti mimarisine kademeli olarak dahil edilmesiyle elde edilen performans. Performans, ISIC 2017 ve ISIC 2018 veri setlerinde Ortalama Birleşik Kesişimi (mIoU) ve Zar Benzerlik Katsayısı (DSC) kullanılarak raporlanmaktadır.

figure-results-4
Şekil 9. Multi-View 4-Yönlü (MV4D) modülünün ablasyon çalışması. (A) Hiyerarşik tarama çifti, spiral tarama çifti, radyal tarama çifti ve Uzamsal Birleşme Mamba'nın (SFusion Mamba) temel mimariye ardışık olarak dahil edilmesinden sonra Birlik (mIoU) üzerinde ortalama kesişim değişikliği. (B) Hiyerarşik tarama çifti, spiral tarama çifti, radyal tarama çifti ve Uzamsal Füzyon Mamba (SFusion Mamba) temel mimariye ardışık olarak dahil edildikten sonra Zar Benzerlik Katsayısında (DSC) değişiklik. (C) İkinci deneysel ayarda hiyerarşik tarama çifti, spiral tarama çifti, radyal tarama çifti ve Uzaysal Birleşme Mamba'nın (SFusion Mamba) temel mimariye ardışık olarak dahil edilmesinden sonra mIoU'daki değişim. (D) İkinci deneysel ayarda hiyerarşik tarama çifti, spiral tarama çifti, radyal tarama çifti ve Spatial Fusion Mamba (SFusion Mamba) temel mimariye ardışık olarak dahil edildikten sonra DSC'deki değişiklik. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

ISIC 2017 veri setinde, tam MV4D modülü %80,94 mIoU ve %91,32 DSC elde etti. mIoU ve DSC için ilgili performans eğilimleri sırasıyla Şekil 9A ve Şekil 9B'de gösterilmiştir. ISIC 2018 veri setinde, tam MV4D modülü %82,47 mIoU ve %90,65 DSC elde etti. İlgili performans eğilimleri sırasıyla Şekil 9C ve Şekil 9D'de gösterilmiştir.

Aksi belirtilmedikçe, tüm ablasyon deneyleri sabit rastgele 100 tohum kullanılarak yapıldı; ana karşılaştırma sonuçları ise üç bağımsız rastgele tohum (1, 52 ve 100) üzerinde ortalama SD ± olarak bildirildi. Sonuç olarak, ablasyon sonuçları, ana karşılaştırma deneylerinde bildirilen nihai çoklu tohum performansını tekrarlamak yerine kontrollü tek tohumlu ortamda bireysel bileşenlerin göreceli katkılarını karşılaştırmayı amaçlamaktadır.

Genel olarak, ek tarama çiftleri ve SFusion Mamba modülünün kademeli olarak dahil edilmesi, segmentasyon performansını sürekli olarak iyileştirdi ve tam MV4D konfigürasyonu her iki veri setinde de en yüksek performansı elde etti.

Çok Görüşlü Görüş (MVV) Bloğunun ablasyon çalışması
MVV Bloğu, temel mimari, Yukarı-Aşağı Projeksiyon dalı içeren bir versiyonla karşılaştırılarak değerlendirildi (Tablo 5). ISIC 2017 veri setinde, Yukarı-Aşağı Projeksiyon dalı dahil edilmesiyle mIoU'yu %78,83'ten %80,96'ya, DSC'yi ise %88,15'ten %91,02'ye yükseltti. ISIC 2018 veri setinde mIoU %80,32'den %82,46'ya yükselirken, DSC %89,15'ten %90,57'ye yükseldi.

ModelTemel MVV BloğuYukarı-Aşağı ProjeksiyonISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet78.8388.1580.3289.15
MVM-UNet80.9691.0282.4690.57

Tablo 5: Çok Görüşlü Görüş (MVV) Bloğunun ablasyon çalışması. Temel Multi-View Vision (MVV) Bloğunun Yukarı-Aşağı Projeksiyon dalı ile ve olmadan performans karşılaştırması. Performans, ISIC 2017 ve ISIC 2018 veri setlerinde Ortalama Birleşik Kesişimi (mIoU) ve Zar Benzerlik Katsayısı (DSC) kullanılarak raporlanmaktadır.

MVV Blok ablasyon deneyleri, sabit rastgele tohum 100 kullanılarak gerçekleştirildi. Sonuç olarak, Yukarı-Aşağı Projeksiyon dalını içeren konfigürasyonun performansı, kontrollü tek tohum ablasyon ayarını yansıtır ve ana karşılaştırma deneylerinde tam MVM-UNet modeli için bildirilen üç tohumlu ortalama performanstan biraz farklı olabilir.

Genel olarak, Yukarı-Aşağı Projeksiyon dalanının dahil edilmesi, her iki veri setinde de segmentasyon performansını tutarlı şekilde iyileştirdi; hem mIoU hem de DSC için artışlar gözlemlendi.

Çok aşamalı Birleşme Mamba (MFusion Mamba) modülünün ablasyon çalışması
MFusion Mamba modülü, farklı kaba füzyon stratejileri ile İnce Füzyon bileşeni karşılaştırılarak değerlendirildi (Tablo 6; Şekil 10). MFusion Mamba olmadan, MVM-UNet ISIC 2017 veri setinde %75,47 mIoU ve %86,01 DSC, ISIC 2018 veri setinde ise %77,49 ve %87,29 DSC elde etti. Değerlendirilen kaba füzyon stratejileri arasında Hadamard ürünü en büyük gelişmeyi sağladı. İnce Füzyon bileşeninin dahil edilmesi, segmentasyon performansını daha da artırdı. Tam MFusion Mamba konfigürasyonu, ISIC 2017'de %80,95 mIoU ve %91,18 DSC, ISIC 2018'de %82,51 ve %90,58 DSC elde etti.

ModelKaba füzyon Elementler açısından MaksimumumKabaca Füzyon Elementlere Göre ToplamaKaba, Füzyon Hadamard Ürünüİnce Füzyon ModülüISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet75.4786.0177.4987.29
MVM-UNet76.2186.4778.3587.82
MVM-UNet76.8386.8679.1188.30
MVM-UNet78.2687.8380.0688.96
MVM-UNet80.9591.1882.5190.58

Tablo 6: Çok aşamalı Füzyon Mamba (MFusion Mamba) modülünün ablasyon çalışması. Farklı Kaba Füzyon stratejilerinin, maksimum füzyon (Max), eleman bazında toplama (⊕) ve Hadamard ürünü (⊙) dahil olmak üzere performans karşılaştırması, tam İnce Füzyon modülü ile birlikte. Performans, ISIC 2017 ve ISIC 2018 veri setlerinde Ortalama Birleşik Kesişimi (mIoU) ve Zar Benzerlik Katsayısı (DSC) kullanılarak raporlanmaktadır.

figure-results-5
Şekil 10. Çok aşamalı Birleşme Mamba (MFusion Mamba) modülünün ablasyon çalışması. (A) Farklı kaba füzyon stratejileri (maksimum, eleman bazında toplama ve Hadamard çarpımı) ve tam İnce Füzyon modülü kullanılarak elde edilen Union (mIoU) üzerindeki ortalama kesişim değişimi. (B) Farklı kaba füzyon stratejileri (maksimum, eleman bazında toplama ve Hadamard çarpımı) ve tam İnce Füzyon modülü kullanılarak elde edilen Zar Benzerlik Katsayısı (DSC) değişimi. (C) Farklı kaba füzyon stratejileri (maksimum, element bazında toplama ve Hadamard çarpımı) ve ikinci deneysel ayarda tam İnce Füzyon modülü kullanılarak elde edilen mIoU değişimi. (D) Farklı kaba füzyon stratejileri (maksimum, element bazında toplama ve Hadamard çarpımı) kullanılarak elde edilen DSC'deki değişim ve ikinci deneysel ayarda tam İnce Füzyon modülü. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

ISIC 2017 veri setinde, tam MFusion Mamba yapılandırması %80,95 mIoU ve %91,18 DSC elde etti. mIoU ve DSC için ilgili performans eğilimleri sırasıyla Şekil 10A ve Şekil 10B'de gösterilmiştir. ISIC 2018 veri setinde, tam MFusion Mamba konfigürasyonu %82,51 mIoU ve %90,58 DSC elde etti. İlgili performans eğilimleri sırasıyla Şekil 10C ve Şekil 10D'de gösterilmiştir. MFusion Mamba ablasyon deneyleri, sabit rastgele 100 tohum kullanılarak gerçekleştirildi. Sonuç olarak, tam MFusion Mamba konfigürasyonu kontrollü tek tohum ablasyon sonucunu temsil eder ve ana karşılaştırma deneylerinde tam MVM-UNet modeli için bildirilen üç tohumlu ortalama performanstan biraz farklı olabilir.

Genel olarak, Hadamard ürünü kaba füzyon stratejisi ve Fine Fusion bileşeninin kademeli olarak entegre edilmesi, segmentasyon performansını sürekli olarak iyileştirdi ve tam MFusion Mamba konfigürasyonu her iki veri setinde de en yüksek performansı elde etti.

Ablasyon çalışmalarının özeti
Ablasyon deneyleri boyunca, hiyerarşik, spiral ve radyal tarama çift dallarının kademeli olarak entegre edilmesi, SFusion Mamba modülü ile birlikte segmentasyon performansını tutarlı şekilde iyileştirdi (Tablo 4; Şekil 9). Benzer şekilde, MVV Bloğuna Yukarı-Aşağı Projeksiyon dalının dahil edilmesi, ISIC 2017 ve ISIC 2018 veri setlerinde hem mIoU hem de DSC'yi iyileştirmiştir (Tablo 5). Tam MFusion Mamba konfigürasyonu, değerlendirilen çok aşamalı özellik füzyon stratejileri arasında en yüksek performansı da elde etti (Tablo 6; Şekil 10).

Hiperparametrelerin ablasyon çalışması
Girdi boyutu ve çıkış değerinin etkileri, ISIC 2017 ve ISIC 2018 veri setlerinde değerlendirildi (Tablo 7). Üç giriş çözünürlüğü (256 × 256, 384 × 384 ve 512 × 512) karşılaştırıldı. Değerlendirilen ayarlarda, 256 × 256 giriş çözünürlüğü her iki veri setinde de en yüksek segmentasyon performansını sağladı.

ModelGiriş boyutu 256 × 256Giriş boyutu 384 × 384Giriş boyutu 512 × 512Dropout 0.0Dropout 0.1Dropout 0.2Dropout 0.3ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet80.0288.9181.7689.92
MVM-UNet79.9688.8780.9789.47
MVM-UNet77.4887.2878.7688.11
MVM-UNet79.3688.5381.1389.62
MVM-UNet80.9490.1582.4990.50
MVM-UNet79.7188.7180.4689.18

Tablo 7: Giriş görüntü boyutu ve kesinti değerinin ablasyon çalışması. MVM-UNet'in farklı giriş görüntü boyutları ve kesilme değerleri kullanılarak performans karşılaştırması. Segmentasyon performansı, ISIC 2017 ve ISIC 2018 veri setlerinde ortalama Birlik Kesişimi (mIoU) ve Zar Benzerlik Katsayısı (DSC) kullanılarak rapor edilmiştir.

Farklı okuldan ayrılma değerleri de değerlendirildi. Test edilen yapılandırmalar arasında, 0.2 kesinti değeri her iki veri setinde de en yüksek segmentasyon performansını sağladı ve bu nedenle ana deneylerde kullanıldı.

Kodlayıcı-kodlayıcı katman konfigürasyonunun ablasyon çalışması
Farklı kodlayıcı-kodlayıcı katman konfigürasyonları, ağ derinliğinin segmentasyon performansı ve hesaplama maliyeti üzerindeki etkisini incelemek için değerlendirildi (Tablo 8). Değerlendirilen yapılandırmalar arasında, simetrik {2, 2, 2, 2}-{2, 2, 2, 2} mimarisi, nispeten düşük model karmaşıklığını koruyarak en yüksek genel segmentasyon performansını sağladı. Ağ derinliğini {2, 2, 9, 2}-{2, 9, 2, 2}'e yükseltmek, karşılaştırılabilir segmentasyon performansı sağlarken hem parametre sayısını hem de hesaplama maliyetini artırır.

ModelKodlayıcı-dekoder katmanı yapılandırmasıParametreler (M)FLOP'lar (G)ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet{2,2,2,1}-{2,2,2,2}28.224.1280.0288.9181.1689.64
MVM-UNet{2,2,2,2}-{2,2,2,2}28.364.3980.9590.1782.590.41
MVM-UNet{2,2,2,3}-{2,3,2,2}30.144.8879.8388.881.5689.85
MVM-UNet{2,4,2,2}-{2,2,4,2}33.465.3279.6588.781.4589.79
MVM-UNet{2,2,9,2}-{2,9,2,2}45.637.7880.9690.0982.4890.43

Tablo 8: Kodlayıcı-kodlayıcı katman konfigürasyonlarının ablasyon çalışması. Farklı kodlayıcı-kodlayıcı katman konfigürasyonlarının performans karşılaştırması. Tablo, ISIC 2017 ve ISIC 2018 veri setlerinde model parametrelerinin (Parametreler), kayan nokta işlemlerinin (FLOP'lar), Union üzerindeki ortalama kesişim (mIoU) ve Zar Benzerlik Katsayısının (DSC) sayısını rapor eder.

Hesaplamalı maliyet karşılaştırması
Nihai MVM-UNet modelinin hesaplama verimliliği, HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former ve MCAFT gibi temsilli temel yöntemlerle aynı donanım ortamı ve giriş çözünürlüğü altında karşılaştırıldı (Tablo 9). Değerlendirilen metrikler arasında dönem başına eğitim süresi, görüntü başına çıkarım süresi, eğitim sırasında GPU belleği zirve kullanımı, eğitilebilir parametreler (Paramlar) sayısı ve FLOP'lar yer aldı. Eğitim süresi, bir eğitim dönemini tamamlamak için gereken süre olarak ölçüldü, çıkarım süresi test görüntüsü başına ortalama işleme süresi olarak ölçüldü ve FLOP'lar tek bir ileri geçiş için hesaplandı.

YöntemHakem.Eğitim süresi (s/epoch)Çıkarım süresi (ms/image)Zirve GPU belleği (GB)Parametreler (M)FLOP'lar (G)
HResFormer34520213.0819.2117.00131.70
H-vmunet288827.005.010.748.97
MISSFormer3035592.8612.642.33109.45
H2Former1213029.028.833.7133.56
MedScale-Former358023.505.94.963.79
MCAFT3614534.008.730.0012.00
MVM-UNet (Bizimki)10426.807.928.364.39

Tablo 9: MVM-UNet ve temsilci temel yöntemlerin hesaplamalı maliyet karşılaştırması. Aynı donanım ortamı altında hesaplama verimliliği ve giriş çözünürlüğünün karşılaştırılması. Bildirilen metrikler arasında epoch başına eğitim süresi, görüntü başına çıkarım süresi, eğitim sırasında grafik işlem birimi (GPU) bellek kullanımı, model parametreleri sayısı (Parametreler) ve kayan nokta işlemleri (FLOP'lar) yer alır. Mevcut uygulamalara sahip yöntemler, mümkün olduğunda aynı deneysel ortamda değerlendirildi.

Tablo 9'da özetlendiği üzere, MVM-UNet eğitim epoşu başına 104 s, çıkarım için görüntü başına 26,8 ms, 7,9 GB maksimum GPU belleği, 28,36 milyon eğitilebilir parametre ve 4,39 GFLOP gerektiriyordu. HResFormer, MISSFormer, H2Former ve MCAFT ile karşılaştırıldığında, MVM-UNet daha kısa eğitim süresi, daha düşük çıkarım süresi, daha düşük GPU bellek kullanımı ve daha az FLOP gerektiriyordu. Hafif H-vmunet ve MedScale-Former modelleriyle karşılaştırıldığında, MVM-UNet daha fazla eğitim süresi ve bellek kullanımı gerektiriyordu ancak karşılaştırılabilir çıkarım hızını koruyarak nispeten düşük hesaplama karmaşıklığını koruyordu.

Veri ve Kod Erişilebilirliği
ISIC 2017 ve ISIC 2018 veri setleri Uluslararası Cilt Görüntüleme İşbirliği (ISIC) arşivinden, Synapse veri seti ise Synapse deposundan halka açık olarak erişilebilir durumdadır. Veri seti edinimi detayları Etik beyannamesinde verilmiştir. Kısaca, ISIC 2017 veri seti resmi ISIC 2017 Challenge veri deposundan (https://challenge.isic-archive.com/data/#2017), ISIC 2018 veri seti resmi ISIC 2018 Challenge Task 1 veri deposundan (https://challenge.isic-archive.com/data/#2018) ve Synapse veri seti ise erişim tanımlayıcısı syn3193805 (https://www.synapse.org/Synapse:syn3193805) ile Synapse deposundan alınmıştır. İlgili indirme tarihleri Etik bildirisinde bildirilmiştir. MVM-UNet kaynak kodunun ilk halka açık versiyonu https://github.com/LIXUEGUANG002/MVM-UNet'da mevcuttur. Depo, model uygulamasını, ana ağ modüllerini, yapılandırma dosyalarını, veri seti organizasyon talimatlarını, eğitim betiklerini ve değerlendirme betiklerini içerir. Tamamlanmış yapılandırma dosyaları, tam deney betikleri, ek dokümantasyon ve eğitilmiş model kontrol noktaları dahil olmak üzere tam tekrarlanabilirlik paketi, yayımlandığında kamuya açık hale getirilecektir.

Ek Tablo 1. Multi-view Vision Mamba UNet'in (MVM-UNet) katman katman mimarisi. Tablo, MVM-UNet'in ardışık ağ mimarisini özetlemektedir; giriş katmanı, patch gömme, kodlayıcı aşamaları, Multi-View Vision (MVV) Blokları, patch-birleştirme işlemleri, Çok aşamalı Fusion Mamba (MFusion Mamba), kod çözme aşamaları, son örnekleme ve segmentasyon başlığı dahildir. Her aşama için ilgili işlem, ana parametreler ve çıktı özellik boyutu listelenir. E1–E4, çok aşamalı özellik birleşmesi için kullanılan kodlayıcı aşaması özellik haritalarını gösterir. B, H ve W sırasıyla parti büyüklüğünü, görüntü yüksekliğini ve görüntü genişliğini gösterir; K ise çıktı sınıflarının sayısını gösterir (K = 1 ikili cilt lezyonu segmentasyonu için ve K = 9 Synapse çoklu sınıf segmentasyonu için, bir arka plan sınıfı ve sekiz ön plan organ sınıfını içerir). MFusion Mamba, dekoder yeniden yapılandırması sırasında ilgili çözücü özellikleriyle entegre edilen birleşmiş çok aşamalı kodlayıcı özellikleri üretir. Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Dosya 1. Multi-View Dört Yönlü (MV4D) modülünün ve Çok aşamalı Fusion Mamba'nın (MFusion Mamba) sözde kodu. Ek dosya, MVM-UNet'te kullanılan iki ana modülün algoritmik iş akışını sunar. Algoritma 1, Multi-View Dört Yönlü (MV4D) modülünün tam işleme hattını tanımlar; özelliklerin düzleştirilmesi, dört tarama çifti dizisinin (zigzag, hiyerarşik, spiral ve radyal) inşası, seçici durum uzayı (S6) işlemesi, tarama görünümü Fusion Mamba (SFusion Mamba) ve çıktı özellik haritasının yeniden inşası dahildir. Algoritma 2 , çok aşamalı kodlayıcı özellik hizası, kaba füzyon, ince füzyon, dekoder entegrasyonu ve birleşmiş kodlayıcı giriş özelliğinin oluşturulmasını içeren Çok aşamalı Fusion Mamba (MFusion Mamba) modülünü tanımlar. Değişkenler ve tensör boyutları algoritmalar içinde tanımlanır. Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Kodlama Dosyası 1. MVM-UNet (MVM-UNet-master) için kaynak kod paketi. Ek ZIP arşivi, bu çalışmada kullanılan MVM-UNet'in tam kaynak kodu uygulamasını içerir. Paket, ağ mimarisi, Multi-View Dört Yönlü (MV4D) ve Çok aşamalı Fusion Mamba (MFusion Mamba) modüllerini, yapılandırma dosyalarını, ISIC 2017, ISIC 2018 ve Synapse veri setleri için eğitim ve değerlendirme betiklerini, yardımcı fonksiyonları ve bu protokolde tanımlanan deneylerin yeniden üretilmesi için gereken proje dokümantasyonunu içerir. Paket ayrıca kurulum talimatları, yazılım bağımlılıkları, veri seti organizasyonu ve eğitim ile çıkarım iş akışları içeren README dosyasını da içerir. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, Mamba tabanlı tıbbi görüntü segmentasyon çerçevesi olan MVM-UNet'i tanımlar. Yöntem, mevcut segmentasyon modellerinin iki sınırlamasını ele almak için tasarlandı. Birincisi, geleneksel CNN tabanlı yöntemler, karmaşık tıbbi görüntülerde uzun vadeli bağımlılıkları ve hiyerarşik bağlamsal bilgileri modelleme konusunda sınırlı bir yetkiyesahiptir 43. İkinci olarak, Transformer tabanlı yöntemler küresel bağlamı modelleyebilir ancak genellikle daha yüksek hesaplamamaliyeti gerektirir 23,25. MVM-UNet, verimli uzun menzilli modelleme sağlamak için Mambamimarisi 13,14,15,16,17,18,19,20 kullanır ve segmentasyon doğruluğunu artırmak için çoklu görüş tarama ve çok aşamalı özelliklerin birleştirilmesini sunar. Protokol yürütme ve tekrarlanabilirlik açısından, bu çalışmada bildirilenlerle karşılaştırılabilir sonuçlar elde etmek için birkaç adım kritik öneme sahiptir. İlk olarak, veri seti bölünmesi, görüntü yeniden boyutlandırma, maske enterpolasyonu, normalleştirme stratejisi ve kanal dönüşümü protokolle tutarlı tutulmalıdır çünkü ön işlemedeki farklılıklar doğrudan giriş dağılımını ve maske sınırlarını değiştirebilir. Özellikle, segmentasyon maskeleri, tam sayı olmayan etiketdeğerlerinin 44 eklenmemesi için en yakın komşu interpolasyonu kullanılarak yeniden boyutlandırılmalıdır. İkinci olarak, giriş çözünürlüğü, parti büyüklüğü, optimizator ayarları, öğrenme hızı takvimi, rastgele tohum, kayıp ağırlık katsayıları, kontrol noktası seçim kuralı ve çıkarım eşiği veya argmax işlemi dahil olmak üzere eğitim yapılandırması sonuçları karşılaştırmadan önce kontrol edilmelidir. Eğer tekrarlanan sonuçlar bildirilen değerlerden açıkça daha düşükse, kullanıcılar önce veri seti yolunu, notlama formatını, ön plan arka plan etiket sözleşmesini, kontrol noktası yüklemesini, doğrulama veya test bölünmesini ve metrik hesaplama prosedürünü doğrulamalıdır. Sınır sızıntısı, parçalanmış maskeler veya eksik küçük yapılar genellikle ön işleme, maske enterpolasyonu, kontrol noktası seçimi veya çıkarım sonrası işlemlerde potansiyel tutarsızlıkları gösterir.

MVM-UNet'in ana katkısı MV4D modülüdür. Önceki durum-uzay-model tabanlımimarilerde benimsenen basit iki boyutlu tarama stratejileri olan 14,15,16,17,18,19,20'nin aksine, MV4D tamamlayıcı görsel bilgiyi yakalamak için zikzak, hiyerarşik, spiral ve radyal tarama çiftleri kullanır. Zikzak tarama çiftleri yerel ve küresel uzamsal bilgiyi dengelemeye yardımcı olur, hiyerarşik tarama çiftleri çok ölçekli özellik çıkarımı artırır, spiral tarama çiftleri küresel kontur temsilini güçlendirir ve radyal tarama çiftleri yerel kenar ve sınır özellik çıkarımı iyileştirir. SFusion Mamba bu tamamlayıcı tarama modalitelerini entegre eder. Temsil eden sonuçlar ve ablasyon deneyleri (Tablo 4 ve 5; Şekil 9) hem tarama desenlerinin çeşitliliğinin hem de füzyon mekanizmasının segmentasyon performansının artmasına katkıda bulunduğunu göstermektedir. Bir diğer önemli bileşen ise kodlayıcı ile çözücü arasında bir özellik birleştirme modülü olarak hizmet veren MFusion Mamba'dır. U-Net 8,21,V-Net 44 ve sonraki birçok varyant 9,23,25 gibi geleneksel U şeklindeki mimariler, öncelikle aşama bazında geçiş bağlantılarıyla bilgi aktarır. Bu strateji, tamamlayıcı çok aşamalı kodlayıcı temsillerini tam olarak kullanamayabilir. MFusion Mamba, kodlayıcı özelliklerini Coarse Fusion ve Fine Fusion ile birleştirerek bu sınırlamayı çözer. Temsilci sonuçlar (Tablo 6; Şekil 10) MFusion Mamba'nın segmentasyon performansını tutarlı şekilde iyileştirdiğini göstermek, bu da açık çok aşamalı özellik birleşiminin tıbbi görüntü segmentasyonu için faydalı olduğunu gösterir.

MVM-UNet'in metodolojik katkısı, her operasyonun sıfırdan icat edilmesi yerine mimari düzeyde bir yeniden tasarım olarak anlaşılmalıdır. U-şekilli kodlayıcı-dekoder mimarileri, kalıntı bağlantılar, projeksiyon katmanları ve Mamba/durum mekânı modeli (SSM) blokları önceki çalışmalardakapsamlı şekilde incelenmiştir: 8,13,14,15,16,17,18,19,20,21,23,24,25 ,29,44. Ancak, bu bileşenleri doğrudan birleştirmek, tıbbi görüntü segmentasyonunun özel zorluklarını mutlaka çözmez. MVM-UNet'in yeniliği, üç yönün koordineli tasarımında yatıyor. İlk olarak, MV4D modülü tek veya sınırlı tarama desenini dört tamamlayıcı tarama çifti dalıyla değiştirerek modelin mekânsal sürekliliği, çok ölçekli yapıyı, küresel kontur bilgisini ve yerel sınır detaylarını yakalamasını sağlar. İkinci olarak, SFusion Mamba ve MVV Bloğu, taramaya özgü özellikleri birleştirir ve geliştirir, ardından bir sonraki ağ aşamasına geçirilir. Üçüncü olarak, MFusion Mamba çok aşamalı kodlayıcı özelliklerini kodlamadan önce açıkça bir şekilde birleştirir; bu da geleneksel atlamabağlantıları 8,21,44'ü tamamlayarak hiyerarşik bilginin kullanımını iyileştirir. Ablasyon sonuçları (Tablo 4–6; Şekiller 9 ve 10) Bu tasarım gerekçesini daha da destekliyor; çoklu görüş taraması, taramaya özgü füzyon, Yukarı-Aşağı Projeksiyon dalı ve çok aşamalı özellik birleşiminin her birinin segmentasyon performansını iyileştirmeye katkıda bulunduğunu gösteriyor. Bu nedenle, MVM-UNet'in katkısı, tıbbi görüntü segmentasyonu için Mamba tabanlı mekânsal modelleme ile kodlayıcı-kodlayıcı özellik birleşiminin göreve özel ve deneysel olarak doğrulanmış entegrasyonunda yatmaktadır.

Güçlü performansına rağmen, MVM-UNet'in birkaç sınırlaması vardır. Birincisi, segmentasyon performansı daha büyük girdi görüntü boyutlarıyla tutarlı şekilde iyileşmedi; bu da mevcut mimarinin yüksek çözünürlüklü görüntü bilgilerini tam olarak kullanamayabileceğini düşündürüyor. İkinci olarak, model klinik uygulamada sıkça karşılaşılan ve segmentasyon dayanıklılığını etkileyebilecek yüksek gürültülü veya düşük kontrastlı görüntüleme koşullarında kapsamlı şekilde değerlendirilmemiştir. Üçüncü olarak, model üç kamuya açık veri setinde güçlü performans gösterse de, daha büyük ve çeşitli tıbbi görüntüleme veri setlerinde daha fazla doğrulama gerekmektedir. Protokol diğer tıbbi görüntü segmentasyon görevlerine uyarlanabilir, ancak birkaç değişiklik dikkatlice uygulanmalıdır. Yeni bir ikili segmentasyon görevi için, kullanıcılar veri seti yükleyicisini, normalizasyon parametrelerini, giriş çözünürlüğünü ve ön plan eşiğini değiştirirken, ikili BCE-Zar kaybı ve değerlendirme prosedürünü korumalıdır. Yeni bir çok sınıflı segmentasyon görevi için, kullanıcılar çıktı sınıflarının sayısını, sınıf-indeks eşlemesini, tek sıcak etiket dönüşümünü, CE-zar kaybı yapılandırmasını ve sınıf bazında değerlendirme metriklerinigüncellemelidir 44. Gri tonlu veri setleri için, giriş kanalı yapılandırması model mimarisiyle eşleştirilmelidir; ya tek kanallı giriş projeksiyonu kullanılarak ya da gri tonlu görüntü tekrarlanarak üç kanallı bir giriş oluşturulur; uygulamaya bağlı olarak. Yöntem, hedef yapılar çok küçük olduğunda, sınırlar zayıf veya belirsizse, görüntü kontrastı eğitim verisinden önemli ölçüde farklılaştığında veya hedef veri setinde önemli ölçüde alan kayması gösterdiğinde optimal olmayabilir. Bu koşullarda, kullanıcıların adil karşılaştırmalar için aynı değerlendirme protokolünü korurken girdi çözünürlüğünü, artırma stratejisini, sınıf dengesini, kayıp ağırlık veya ince ayar takvimini ayarlamaları gerekebilir.

Synapse veri setinde, MVM-UNet yaygın olarak kullanılan 18 vaka eğitim ve 12 vaka test bölünümünde güçlü çok organlı segmentasyon performansı elde etti. Önerilen yöntem, bu çalışmada değerlendirilen temsil taban yöntemler arasında en yüksek ortalama DSC'yi elde etmiş (Tablo 3), bazı daha yeni yöntemler farklı eğitim ortamları ve değerlendirme protokollerinde daha yüksek Synapse performansı bildirmiştir29. Bu nedenle, MVM-UNet'i Synapse'ta genel en son teknoloji performans elde eden biri olarak tanımlamaktan kaçınıyor ve bunun yerine değerlendirilen deneysel ortamda güçlü performans elde ettiği şeklinde tanımlıyoruz. Bu bulgular, MVM-UNet'in performansının, tıbbi görüntü segmentasyonu için Mamba tabanlı modellemenin göreve özgü uyarlanmasındankaynaklandığını göstermektedir: 13,14,15,16,17,18,19,20. MVM-UNet, tek bir tarama stratejisine dayanmak yerine, görsel özellik modellemesini birden fazla tamamlayıcı tarama görünümüne ayırır ve bunları SFusion Mamba aracılığıyla entegre eder. Ayrıca, MFusion Mamba, geleneksel atlama bağlantılarının ötesinde çok aşamalı kodlayıcı özelliklerini açıkça birleştirerek kodlayıcı ile kodlayıcı arasındaki bilgi akışınıiyileştirir; 8,21,44. Bu tasarım, önerilen modelin hem ikili cilt lezyonu segmentasyonu hem de çok organlı segmentasyon görevlerinde güçlü performans elde etmesini sağlar.

Gelecekteki çalışmalar, yüksek çözünürlüklü tıbbi görüntü segmentasyonu için MVM-UNet'in geliştirilmesine odaklanmalıdır. Daha derin veya uyarlanabilir çok ölçekli mimariler, modelin yüksek çözünürlüklü görüntü bilgisini daha etkili kullanmasını sağlayabilir. Gelecekteki çalışmalar ayrıca MVM-UNet'in gürültülü, düşük kontrastlı ve alan kaydırmalı görüntüleme koşullarında sağlamlığını değerlendirmelidir. Ayrıca, önerilen çoklu görüş tarama stratejisi, lezyontespiti 4, organ lokalizasyonu, tümör sınıflandırması ve üç boyutlu segmentasyon10,11 gibi diğer tıbbi görüntü analiz görevlerine de genişletilebilir. Özetle, MVM-UNet tıbbi görüntü segmentasyonu için etkili ve tekrarlanabilir bir çerçeve sağlar. MV4D modülü ve MFusion Mamba'nın entegrasyonu, modelin tamamlayıcı mekansal bilgiyi, çok ölçekli bağlamı, küresel kontur bilgisini, yerel sınır detaylarını ve çok aşamalı anlamsal özellikleri yakalamasını sağlar. ISIC 2017, ISIC 2018 ve Synapse veri setlerinde elde edilen temsil sonuçları, önerilen mimarinin etkinliğini göstermektedir. Bu protokol, tıbbi görüntü segmentasyonu 13,14,15,16,17,18,19,20 için verimli SSM/Mamba tabanlı mimariler geliştiren araştırmacılar için pratik bir referans sağlar.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, rekabet eden finansal çıkarları olmadığını belirtirler.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu araştırma dış bir fon almadı.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Hardware - GPU workstation or GPU serverInstitutional computing platform / local workstationCustom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage.Training, validation, testing, ablation, and inference-only experiments için hesaplama platformu.
Hardware - Graphics processing unit (GPU)NVIDIA CorporationNVIDIA A800 GPU (80 GB bellek).GPU hızlandırmalı model eğitimi ve çıkarımı.
Hardware - Central processing unit (CPU)Intel Corporation / AMD13. Nesil Intel Core i9-13900K CPU.Veri yükleme, ön işleme ve deney yürütme için ana işlemci.
Hardware - System memory (RAM)Institutional computing platform / local workstation128 GB sistem RAMVeri seti yükleme, ön işleme ve eğitim için bellek.
Hardware - StorageInstitutional computing platform / local workstation2 TB NVMe katı hal sürücüsü.Veri setleri, kontrol noktaları, günlükler ve oluşturulan tahmin şekilleri için depolama.
Software environment - Operating systemCanonical Ltd.Önerilen: Ubuntu 22.04.1 LTSHesaplama ortamı için işletim sistemi.
Software environment - Conda environmentAnaconda, Inc. / MinicondaOrtam adı: mvmunetBağımlılıkları yüklemek ve izole etmek için kullanılan Python ortamı.
Software environment - PythonPython Software FoundationPython 3.8Uygulama ve deney yürütme için kullanılan programlama dili.
Software environment - CUDA toolkitNVIDIA CorporationCUDA Toolkit 11.8PyTorch ve Mamba ile ilgili paketler tarafından gerektirilen GPU hesaplama arka ucu.
Software environment - cuDNNNVIDIA CorporationcuDNN 8.7.0.PyTorch aracılığıyla kullanılan GPU hızlandırmalı derin öğrenme ilkelileri.
Python package - PyTorchPyTorchtorch == 2.0.1Model eğitimi, kayıp hesaplaması, optimizasyon ve çıkarım için derin öğrenme çerçevesi.
Python package - TorchvisionPyTorchtorchvision == 0.14.0Ön işleme ve artırma sırasında kullanılan görüntü dönüştürme yardımcı programları.
Python package - TorchaudioPyTorchtorchaudio == 0.13.0Önerilen PyTorch ortamı ile birlikte yüklenir.
Python package - timmtimm developerstimm == 0.4.12Depolama ortamı talimatlarında listelenen model bileşeni veya yardımcı program bağımlılığı.
Python package - tritonOpenAI / Triton developerstriton == 2.0.0GPU hızlandırmalı dizi modelleme bileşenleri tarafından kullanılan bağımlılık.
Python package - causal-conv1dcausal-conv1d developerscausal_conv1d == 1.0.0Mamba uygulaması tarafından gerektirilen verimli nedensel evrişim bağımlılığı.
Python package - mamba-ssmMamba SSM developersmamba_ssm == 1.0.1Mamba/S6 ile ilgili bileşenler için kullanılan durum-uzay dizi modelleme paketi.
Python package - NumPyNumPy developersNumPy sürümü 1.24.3.Sayısal hesaplama ve dizi işlemleri.
Python package - SciPySciPy developersSciPy sürümü 1.10.1.Bilimsel hesaplama; scipy.ndimage.zoom, utils.py'de içe aktarılır.
Python package - SimpleITKInsight Software ConsortiumSimpleITK sürümü 2.2.1.utils.py'de içe aktarılan tıbbi görüntü giriş/çıkışı ve ön işleme yardımcı programı.
Python package - MedPyMedPy developersMedPy sürümü 0.4.0.utils.py'de içe aktarılan tıbbi görüntü metrik hesaplama paketi.
Python package - scikit-imagescikit-image developersscikit-image sürümü 0.21.0.README'de listelenen görüntü işleme bağımlılığı.
Python package - scikit-learnscikit-learn developersscikit-learn sürümü 1.3.2.README'de listelenen makine öğrenimi yardımcı programı paketi.
Python package - matplotlibMatplotlib developersMatplotlib sürümü 3.7.2.Niteliksel görselleştirme şekillerini kaydetmek için kullanılır.
Python package - h5pyh5py developersh5py sürümü 3.9.0.Synapse test hacimleri için HDF5 dosya desteği.
Python package - thopTHOP developersTHOP sürümü 0.1.1.post2209072238.FLOP'lar ve parametreyle ilgili hesaplama maliyeti hesaplanırken kullanılır.
Python package - packagingPython Packaging Authoritypackaging sürümü 23.1.README'de listelenen bağımlılık.
Python package - pytestpytest developerspytest sürümü 7.4.0.README'de listelenen bağımlılık.
Python package - chardetchardet developerschardet sürümü 5.2.0.README'de listelenen bağımlılık.
Python package - yacsYACS developersyacs sürümü 0.1.8.README'de listelenen yapılandırma yardımcı programı bağımlılığı.
Python package - termcolortermcolor developerstermcolor sürümü 2.3.0.README'de listelenen oturum açma/terminal yardımcı programı bağımlılığı.
Python package - submititsubmitit developerssubmitit sürümü 1.4.5.README'de listelenen deney/iş yardımcı programı bağımlılığı.
Python package - tensorboardXtensorboardX developerstensorboardX sürümü 2.6.2.2.README'de listelenen eğitim günlüğü görselleştirme yardımcı programı.
Python package - ml-collectionsml_collections developersml-collections sürümü 0.1.1.configs/config_setting_synapse.py tarafından içe aktarılır.
Dataset

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang F, et al. Cross co-teaching for semi-supervised medical image segmentation. Pattern Recognit. 2024;152:110485.
  2. Gu Y, et al. Dual-scale enhanced and cross-generative consistency learning for semi-supervised medical image segmentation. Pattern Recognit. 2025;158:111140.
  3. Zhu X, Wang W, Zhang C, Wang H. Polyp-Mamba: A hybrid multi-frequency perception gated selection network for polyp segmentation. Inf Fusion. 2025;115:103161.
  4. Iqbal S, et al. TBConvL-Net: A hybrid deep learning architecture for robust medical image segmentation. Pattern Recognit. 2025;158:111147.
  5. Zhao Z, et al. Balanced feature fusion collaborative training for semi-supervised medical image segmentation. Pattern Recognit. 2025;157:110986.
  6. Zhou T, et al. MambaYOLACT: You only look at Mamba prediction head for head-neck lymph nodes. Artif Intell Rev. 2025;58(6).
  7. Zhao Y, et al. MGF-GCN: Multimodal interaction Mamba-aided graph convolutional fusion network for semantic segmentation of remote sensing images. Inf Fusion. 2025;122:103268.
  8. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional networks for biomedical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2015.
  9. Zhou Z, Siddiquee MMR, Tajbakhsh N, Liang J. UNet++: Redesigning skip connections to exploit multiscale features in image segmentation. IEEE Trans Med Imaging. 2019;39(6):1856-1867.
  10. Shaker A, et al. UNETR++: Delving into efficient and accurate 3D medical image segmentation. IEEE Trans Med Imaging. 2024;43(9):3377-3390.
  11. Zhou HY, et al. nnFormer: Volumetric medical image segmentation via a 3D Transformer. IEEE Trans Image Process. 2023;32:4036-4045.
  12. He A, et al. H2Former: An efficient hierarchical hybrid Transformer for medical image segmentation. IEEE Trans Med Imaging. 2023;42(9):2763-2775.
  13. Zhu L, et al. Vision Mamba: Efficient visual representation learning with bidirectional state space model. In: Proceedings of the 41st International Conference on Machine Learning (ICML). 2024.
  14. Liu Y, et al. VMamba: Visual state space model. Adv Neural Inf Process Syst. 2024;37:103031-103063.
  15. Ma J, Li F, Wang B. U-Mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv. 2024;arXiv:2401.04722.
  16. Wang Z, et al. Mamba-UNet: UNet-like pure visual Mamba for medical image segmentation. arXiv. 2024;arXiv:2402.05079.
  17. Huang T, et al. LocalMamba: Visual state space model with windowed selective scan. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  18. Zhang Z, et al. Motion Mamba: Efficient and long sequence motion generation. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  19. Hu VT, et al. Zigma: A DiT-style zigzag Mamba diffusion model. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  20. Rahman MM, et al. Mamba in vision: A comprehensive survey of techniques and applications. arXiv. 2024;arXiv:2410.03105.
  21. Falk T, et al. U-Net: Deep learning for cell counting, detection, and morphometry. Nat Methods. 2019;16(1):67-70.
  22. Gu R, et al. CA-Net: Comprehensive attention convolutional neural networks for explainable medical image segmentation. IEEE Trans Med Imaging. 2020;40(2):699-711.
  23. Chen J, et al. TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of Transformers. Med Image Anal. 2024;97:103280.
  24. Zhang Z, Zhang W. Pyramid medical Transformer for medical image segmentation. arXiv. 2021;arXiv:2104.14702.
  25. Cao H, et al. Swin-Unet: UNet-like pure Transformer for medical image segmentation. In: European Conference on Computer Vision (ECCV). Springer; 2022.
  26. Chen B, et al. TransAttUNet: Multi-level attention-guided U-Net with Transformer for medical image segmentation. IEEE Trans Emerg Top Comput Intell. 2023.
  27. Jiang S, Li J. TransCUNet: UNet cross-fused Transformer for medical image segmentation. Comput Biol Med. 2022;150:106207.
  28. Wu R, Liu Y, Liang P, Chang Q. H-vmunet: High-order Vision Mamba UNet for medical image segmentation. Neurocomputing. 2025;624:129447.
  29. Liu J, et al. Swin-UMamba: Adapting Mamba-based vision foundation models for medical image segmentation. IEEE Trans Med Imaging. 2024.
  30. Huang X, et al. MISSFormer: An effective Transformer for 2D medical image segmentation. IEEE Trans Med Imaging. 2023;42(5):1484-1494.
  31. Ruan J, et al. MALUNet: A multi-attention and lightweight U-Net for skin lesion segmentation. In: 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). IEEE; 2022.
  32. Ruan J, Xiang S. VM-UNet: Vision Mamba UNet for medical image segmentation. arXiv. 2024;arXiv:2402.02491.
  33. Valanarasu JMJ, Patel VM. UNeXt: MLP-based rapid medical image segmentation network. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2022.
  34. Ren S, Li X. HResFormer: Hybrid residual Transformer for volumetric medical image segmentation. IEEE Trans Neural Netw Learn Syst. 2025;36(6):10558-10566.
  35. Karimijafarbigloo S, Azad R, Kazerouni A, Merhof D. MedScale-Former: Self-guided multiscale Transformer for medical image segmentation. Med Image Anal. 2025;103.
  36. Yan S, et al. Multi-scale convolutional attention frequency-enhanced Transformer network for medical image segmentation. Inf Fusion. 2025;119.
  37. Gao Y, Zhou M, Metaxas DN. UTNet: A hybrid Transformer architecture for medical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2021.
  38. Mei J, et al. SANet: A slice-aware network for pulmonary nodule detection. IEEE Trans Pattern Anal Mach Intell. 2021;44(8):4374-4387.
  39. Hu XZ, Jeon WS, Rhee SY. ATT-UNet: Pixel-wise staircase attention for weed and crop detection. In: 2023 International Conference on Fuzzy Theory and Its Applications (iFUZZY). IEEE; 2023.
  40. Wang X, et al. Transferable normalization: Towards improving transferability of deep neural networks. Adv Neural Inf Process Syst. 2019;32.
  41. Azad R, et al. TransDeepLab: Convolution-free Transformer-based DeepLabV3+ for medical image segmentation. In: International Workshop on Predictive Intelligence in Medicine (PRIME). Springer; 2022.
  42. Ruan J, Gao J, Xie M, Xiang S. Learning multi-axis representation in frequency domain for medical image segmentation. Mach Learn. 2025;114(1):10.
  43. Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press; Cambridge, MA; 2016.
  44. Milletari F, Navab N, Ahmadi SA. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. In: 2016 Fourth International Conference on 3D Vision (3DV). IEEE; 2016.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

T pSay 234Say 234B y k dil modeliSSMUNet

İlgili makaleler