Tıbbi görüntü segmentasyonu, bilgisayar görme ve tıbbi görüntü analizi alanlarındatemel bir görevdir 1,2,3. Bu, bir görüntünün daha fazla analiz ve işleme için birden fazla bölgeye veya nesneye bölünmesini içerir. Bu teknoloji, klinisyenlerin patolojik bölgeleri tanımlama ve lokalize etmelerine yardımcı olmasıyla tıbbi görüntülemede özellikle önemlidir; böylece tanı doğruluğunu ve tedavi planlamasını iyileştirir. Manyetik rezonans görüntüleme (MRI), bilgisayarlı tomografi (BT) ve pozitron emisyon tomografisi (PET) gibi tıbbi görüntüleme teknolojilerinin ilerlemesiyle birlikte, doğru tıbbi görüntü segmentasyon tekniklerine olan talep artmaya devam etmiştir. Tıbbi görüntü segmentasyonu için mevcut yöntemler genel olarak üç ana yaklaşıma ayrılabilir: konvolüsyon sinir ağı (CNN) tabanlı yöntemler4, Transformer tabanlıyöntemler 5 ve durum-uzay modeli (SSM) tabanlıyöntemler 6,7. CNN tabanlı yöntemler genellikle tıbbi görüntü segmentasyonu için U şeklinde ağ mimarileri kullanır. Bu kategoride en yaygın kullanılan mimari, biyomedikal görüntü segmentasyonu için U şeklinde kodlayıcı–kodlayıcı mimarisinin etkinliğini gösteren U-Net8'dir. U-Net3+, UNet++9'dan yoğun atlama bağlantılarını tam ölçekli atlama bağlantılarıyla birleştirerek çok ölçekli özellik toplamayı geliştirir. Ancak, CNN tabanlı yöntemlerin uzun vadeli bağımlılıkları yakalama yeteneği sınırlıdır ve bu nedenle uzun vadeli bağlamsal bilgiyi etkili şekilde modellemeyebilir.
Transformator tabanlı yöntemler, paralel hesaplamayı mümkün kılan ve ilgi alanlarına farklı dikkat ağırlıkları atayan öz-dikkat mekanizması aracılığıyla uzun menzilli bağımlılıkları etkili şekilde yakalar. UNETR++10 , parametre sayısını ve hesaplama maliyetini azaltmak için Verimli Eşleştirilmiş Dikkat (EPA) modülünü tanıtır. nnFormer11 , aralı yapraklı konvolüsyon ve öz-dikkat işlemlerini birleştirir ve üç boyutlu (3D) tıbbi görüntü segmentasyonunda hacimsel temsilleri öğrenmek için yerel-küresel hacim tabanlı öz-dikkat mekanizması sunar. H2Former12 , dikkat mekanizmalarını kodlayıcıda CNN tabanlı özellik çıkarımı ile birleştiren verimli hiyerarşik hibrit bir Vizyon Dönüştürücüsü önerir. Ancak, Transformer tabanlı yöntemler, dizi uzunluğu arttıkça kuadratik hesaplama karmaşıklığı sergiler ve bu da hesaplama maliyetinin önemli ölçüde artmasına yol açar. Şekil 1 , MVM-UNet'in motivasyonunu göstermekte ve önerilen çoklu görüş tarama stratejisini mevcut SSM tabanlı segmentasyon çerçeveleriyle karşılaştırmaktadır.

Şekil 1. MVM-UNet'in mevcut saf durum uzayı modeli (SSM) tabanlı segmentasyon mimarileriyle karşılaştırılması. Geleneksel saf durum alanı modeli (SSM) tabanlı segmentasyon çerçevesi ile önerilen Multi-View Mamba U-Net (MVM-UNet) mimarisi arasında karşılaştırma. Üst panel, Multi-View 4-Yönlü (MV4D) modülünün, Spatial Fusion Mamba (SFusion Mamba) tarafından entegre edilen zigzag, hiyerarşik, spiral ve radyal tarama çiftleri kullanarak tamamlayıcı özellikleri çıkardığı MVM-UNet'i gösterirken, Multi-Stage Fusion Mamba (MFusion Mamba) çok ölçekli kodlayıcı özelliklerini çözmeden önce birleştirir. Alt panel, çapraz taramalı Selective Scan 2-Boyutlu (SS2D) modüller kullanılarak temsil eden saf SSM tabanlı bir mimariyi gösterir. Şekil, geleneksel SSM tabanlı segmentasyon ağları ile önerilen MVM-UNet arasındaki mimari farklılıkları vurgulamaktadır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
SSM tabanlı yöntemler, Transformers'ın küresel modelleme yeteneğini doğrusal hesaplama karmaşıklığı ile birleştirir. Mamba mimarisi, seçmeli durum uzayı modeli (Selective-SSM) kullanarak giriş bilgisini seçici olarak işler; böylece model, girdiye göre parametrelerini dinamik olarak ayarlayabilir, alakasız bilgileri filtrelerek ve bilgilendirici özellikleri vurgular. Vim13 ve VMamba14 , Mamba mimarisini bilgisayar görüşü görevleri için uyarlar. U-Mamba15 , tıbbi görüntü segmentasyonunda SSM'lerin uygulamasını incelemek için hibrit CNN–SSM mimarisi kullanırken, Mamba-UNet16 tıbbi görüntü segmentasyonu için tamamen SSM tabanlı kodlayıcı-kodlayıcı mimarisi benimser. Bu yöntemler, önemli ölçüde daha az parametre kullanarak rekabetçi performans sağlar. Ancak mevcut SSM/Mamba tabanlı yöntemler, temel olarak basit görüntü yamaları ve SS2D tarama stratejileri kullanarak görüntü özelliklerini çıkarır ve bu da tıbbi görüntü segmentasyonu için çeşitli sınırlamalar sunar. Birincisi, SS2D ve yama tabanlı teknikler öncelikle genel bilgisayar görme görevleri için tasarlanmıştır. Yerel Mamba17 ve Motion Mamba18 , farklı tarama stratejilerinin farklı görsel bilgi türlerini yakaladığı için SS2D tarama stratejisinin tüm görsel görevler için yetersiz olduğunu öne sürmüştür. İkinci olarak, SS2D tarama stratejisi nispeten basittir ve yalnızca yatay ve dikey tarama yönlerine dayanır. Sonuç olarak, karmaşık mekansal ilişkileri ve ince yapısal detayları yeterince yakalayamayabilir. Tıbbi görüntü segmentasyonu, hem küresel mekansal bağlamın hem de kesin yerel anatomik özelliklerin eşzamanlı modellenmesini gerektirir. Ayrıca, mevcut SSM/Mamba tabanlı yöntemler, kodlayıcı ile çözücü arasında sınırlı özellik birleşimi sağlar. UNet++ ve FATNet gibi mimariler, gelişmiş özellik birleşmesiyle segmentasyon doğruluğunu artırır ve tıbbi görüntü segmentasyonu için etkili özellik entegrasyonunun önemini vurgular.
Bu sınırlamaları gidermek için, bu makale MVM-UNet olarak adlandırılan yeni bir Mamba tabanlı tıbbi görüntü segmentasyon çerçevesi önermektedir. Şekil 1'de gösterildiği gibi, önerilen Çok Görüşlü Dört Yönlü (MV4D) modülü, MVM-UNet'in temel özellik çıkarma bileşeni olarak hizmet verir ve dört farklı tarama stratejisinden gelen bilgilerin entegre edilmesiyle tıbbi görüntü segmentasyonu için özel olarak tasarlanmıştır. Her tarama stratejisi, tamamlayıcı görüntü özelliklerini çıkarır ve giriş görüntüsünün farklı bir görünümünü temsil eder. Zikzak tarama19 , her satırın veya sütunun sonunda geçiş yönünü değiştirerek yerel ve küresel mekânsal bilgiyi dengeler. Buna karşılık, spiral ve radyal taramaşemaları 20 , merkezden dışa veya çevreden içe doğru uzanarak kapsamlı kapsama sağlar. Hiyerarşik tarama18 , hem yerel hem de küresel özellikleri birden fazla ölçekte yakalar. Her tarama stratejisinin dayanıklılığını artırmak için, tarama çiftleri S6 Bloğuna girilmeden önce birleştirilir. Scan-view Fusion Mamba (SFusion Mamba) modülü, dört tarama modalitesinden çıkarılan özellikleri daha sonra entegre eder. Çok ölçekli kodlayıcı özelliklerini etkili bir şekilde kullanmak için, bu makale ayrıca çok ölçekli bir Mamba füzyon modülü (MFusion Mamba) önermektedir; bu modül, her kodlayıcı aşamasından çıkan çıktıları biriktirip birleştirir ve ardından füzülmüş özellikleri çözücüye aktarır. MVM-UNet, ISIC 2017, ISIC 2018 ve Synapse veri setleri üzerinde değerlendirildi. Deneysel sonuçlar, MVM-UNet'in ISIC 2017, ISIC 2018 ve Synapse veri setlerinde rekabetçi segmentasyon performansı elde ettiğini göstermektedir.
Temsilci segmentasyon mimarileri tıbbi görüntü segmentasyonunu daha da geliştirmiştir. U-Net, hücre sayma, tespit ve morfometri21 gibi biyomedikal görüntü analiz görevlerinde de başarıyla uygulanmıştır. CA-Net 22 gibi dikkat artırılmış CNN mimarileri, kapsamlı dikkat mekanizmaları aracılığıyla özellik temsilini iyileştirir. TransUNet 23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26 ve TransCUNet27 gibi temsil Transformer tabanlı segmentasyon çerçeveleri, tıbbi görüntü segmentasyonu için dikkat temelli küresel özellik modellemesinin etkinliğini daha da göstermektedir.
MVM-UNet'in tasarımı, mevcut SSM/Mamba tabanlı segmentasyon yöntemlerinin iki sınırlaması nedeniyle motive edilmiştir. İlk olarak, günümüzdeki birçok Vision Mamba modeli, düzensiz lezyon sınırları, küçük hedef bölgeler ve çok ölçekli anatomik yapılar içeren tıbbi görüntüler için yetersiz olabilecek basit iki boyutlu tarama stratejilerine dayanır. İkinci olarak, geleneksel U şeklindeki kodlayıcı-kodlayıcı mimarileri, özellikleri öncelikle karşılık gelen atlama bağlantıları üzerinden aktarır ve dekodlama sırasında çok aşamalı kodlayıcı bilgisinin doğrudan kullanımını sınırlar. Bu nedenle, MVM-UNet çok görüşlü mekânsal modellemeyi geliştirmek için MV4D ve çok aşamalı kodlayıcı özelliklerini açıkça birleştirmek için MFusion Mamba'yı tanıtır. Bu tasarım, Mamba tabanlı uzun menzilli modellemeyi tıbbi görüntü segmentasyonunun özel gereksinimlerine uyarlamayı amaçlamaktadır.
MVM-UNet genel kodlayıcı–kodlayıcı paradigması ve Mamba tabanlı dizi modelleme üzerine inşa edilmiş olsa da, yeniliği, bu bileşenlerin tıbbi görüntü segmentasyonu için nasıl uyarlanıp entegre edildiğinde yatmaktadır. Standart bir Mamba bloğunu U-şeklindeki ağ omurgasına entegre etmek yerine, önerilen çerçeve, mekânsal modelleme sürecini birden fazla görev odaklı tarama çifti dalıyla yeniden tasarlar, taramaya özgü temsilleri entegre etmek için SFusion Mamba'yı tanıtır, MVV Bloğunu kalıntı ve projeksiyon yolları ile güçlendirir ve kodlayıcı ile çözücü arasına MFusion Mamba'yı ekleyerek çok aşamalı kodlayıcı özelliklerini dekodlamadan önce birleştirir. Bu mimari düzeydeki tasarım, tıbbi görüntülerde sıkça gözlemlenen düzensiz sınırları, küçük hedef bölgeleri ve çok ölçekli anatomik yapıları ele almayı amaçlar.
Bu protokol, iki boyutlu tıbbi görüntülerde uzun süreli bağlamsal bilginin, düzensiz nesne sınırlarının ve çok ölçekli anatomik yapıların eşzamanlı modellenmesini gerektiren segmentasyon görevleri için en uygundur. CNN tabanlı segmentasyon yöntemleriyle karşılaştırıldığında, Mamba tabanlı kodlayıcı–kodlayıcı tasarımı, tıbbi görüntü segmentasyon araştırmacılarına aşina olan U şeklindeki iş akışını korurken etkili bir bağlam modelleme mekanizması sunar. Transformer tabanlı yöntemlerle karşılaştırıldığında, önerilen çerçeve doğrudan kuadratik öz-dikkat kullanımından kaçınmakta ve nispeten verimli bir dizi modelleme mekanizması kullanarak küresel bağlamsal modelleme arayan araştırmacılar için tasarlanmıştır. Buna göre, bu protokol cilt lezyonu segmentasyonu, karın organı segmentasyonu ve küresel yapısal bilgilerin ve yerel sınır detaylarının önemli olduğu benzer iki boyutlu tıbbi görüntü segmentasyon görevleri için uygundur.
Bu protokolün ayrıca kullanımdan önce dikkate alınması gereken sınırlamaları vardır. Hafif bir CNN'in zaten yeterli performans sağladığı nispeten basit segmentasyon görevleri için gerekli olmayabilir. Ayrıca, mimari uyarlama olmadan tam üç boyutlu hacimsel segmentasyon için doğrudan tasarlanmamıştır. Çok sınırlı açıklamalı verilere, sınırlı grafik işlem birimi (GPU) kaynaklarına veya oldukça yorumlanabilir klasik modellere ihtiyaç duyan araştırmacılar da protokolü uygulamadan önce bu kısıtlamaları göz önünde bulundurmalıdır. Genel olarak, bu yöntem, uzun vadeli bağlam modellemesi, yerel sınır temsili ve çok aşamalı özellik birleşimini dengeleyen Mamba tabanlı U şeklinde segmentasyon çerçevesini yeniden üretip değerlendirmek isteyen araştırmacılar için tasarlanmıştır.
Başlıca katkılar şunlardır:
1. Bu makale, MVM-UNet olarak adlandırılan yeni bir Mamba tabanlı tıbbi görüntü segmentasyon çerçevesini sunmaktadır. Mevcut SS2D tabanlı veya standart Mamba bloklarını doğrudan dahil eden yaklaşımların aksine, MVM-UNet zikzak, hiyerarşik, spiral ve radyal tarama dahil olmak üzere dört tamamlayıcı tarama çifti görünümünden tıbbi görüntü özelliklerini modellemek için MV4D'yi tanıtır.
2. Bu makale, taramaya özgü temsilleri entegre etmek ve özellik dönüşümünü geliştirmek için SFusion Mamba ve MVV Bloğunu tasarlamaktadır. SFusion Mamba, farklı tarama çift dallarından çıkarılan özellikleri birleştirirken, MVV Bloğu içindeki kalıntı ve Yukarı-Aşağı Projeksiyon dalları, özellik temsillerini stabilize eden ve zenginleştiren tamamlayıcı özellik yolları sağlar.
3. Bu makale, MFusion Mamba'yı kodlayıcı ile çözücü arasında ara çok aşamalı bir füzyon modülü olarak tanıtmaktadır. Geleneksel atlama bağlantılarının aksine, özellikle karşılık gelen aşama özelliklerini aktarırken, MFusion Mamba çok aşamalı kodlayıcı özelliklerini kabaca ve ince füzyon yoluyla açıkça birleştirir ve kod çözme için zenginleştirilmiş bilgi sağlar.
4. Kapsamlı deneysel sonuçlar, önerilen MVM-UNet'in ISIC 2017 ve ISIC 2018 veri setlerinde rekabetçi segmentasyon performansı ve Synapse çoklu organ segmentasyon veri setinde güçlü performans sağladığını göstermektedir. Ayrıca, kapsamlı ablasyon çalışmaları MVM-UNet'teki her bileşenin katkısını doğrular.