Bu araştırma, hesaplamalı araştırma ve veri işleme için kurumsal yönergelere uygun olarak gerçekleştirilmiştir. Bu çalışmada insan veya omurgalı hayvan yer almadı.
Veri seti hazırlama ve ön işleme
Veri seti toplama ve organizasyon
Dermoskopik görüntüler PH2, ISIC2018 ve ISIC2017 veri setlerinden toplandı ve Materyaller Tablosu'nda özel bağlantılar sağlandı. PH2 veri seti 200 yüksek çözünürlüklü görüntü (1000 × 1000 piksel) içerir, ISIC2018 ilgili segmentasyon maskeleriyle 2.594 görüntü içerir ve ISIC2017 segmentasyon maskeleriyle birlikte 2.150 görüntü içerir. Veriler, standart protokollere uygun şekilde eğitim, doğrulama ve test setlerine organize edildi; böylece görüntüler uyumlu formatlarda (örneğin .jpg, .png veya .tiff) ve karşılık gelen taban gerçeklik maskelerini ikili formatta içeriyordu.
Veriler, standart protokollere uygun olarak eğitim, doğrulama ve test setlerine organize edildi. Veri setleri şu şekilde bölündü: ISIC2018 için 1.815 görüntü eğitim için, 259 doğrulama için ve 520 test için ayrıldı. ISIC2017 için 1.500 görüntü eğitim için, 220 görüntü doğrulama için ve 430 görüntü test için tahsis edildi. PH2 için veri seti 160 eğitim görseli, 10 doğrulama görüntüsü ve 30 test görsemine bölündü. Ön işlem hattı boyunca 256 × 256 piksel tutarlı bir görüntü çözünürlüğü korundu.
Veri artırma ve normalizasyon
Model genellemesini artırmak için veri artırma teknikleri uygulandı. ±15° aralığında yatay çevirme, dikey çevirme ve rastgele dönüş uygulandı. Gamma düzeltmesi ve logaritmik dönüşüm, her biri 0,3 olasılıkla uygulandı. Piksel değerleri ImageNet istatistikleri kullanılarak normalize edildi (ortalama = [0.485, 0.456, 0.406], standart sapma = [0.229, 0.224, 0.225]).
Tüm giriş görüntülerini 256 × 256 piksele yeniden boyutlandırın: Hesaplama verimliliğini sağlamak için tüm giriş görüntüleri 256 × 256 piksel arasında eşit çözünürlükte yeniden boyutlandırıldı. Veri setindeki (1000 × 1000 piksel) gibi yüksek çözünürlüklü görüntüler, hassas lezyon sınırı belirlemesi için kritik olan ince tanenli detaylar ve doku bilgileri içerirken, çözünürlüğün artırılması modelin performansını önemli ölçüde artırmadı. Bu nedenle, hesaplama verimliliği ile model doğruluğu arasında denge sağlamak için çözünürlük artırılmadı. Gelecekteki çalışmalar, daha yüksek çözünürlüklü girdilerin etkilerini daha fazla inceleyerek, segmentasyon doğruluğundaki faydaların artan hesaplama maliyetini haklı çıkarıp çıkarmadığını belirleyebilir. Gerektiğinde görüntüler RGB formatına dönüştürülürdü. Önden işlenen veriler, orijinal veri seti bölünmeleri korunurken yapılandırılmış dizinlerde kaydedildi.
HMP-MUNet mimarisi uygulaması
Ağ mimarisi tasarımı
HMP-MUNet , Şekil 1'de gösterildiği gibi hiyerarşik U şeklinde kodlayıcı-kodlayıcı yapısına uygun şekilde yapılandırılmıştır. Ağ, kademeli kanal genişletme ile yapılandırıldı: 8→16→32→64→128→256 kanal, kodlayıcı seviyelerinde kullanıldı.
Ağ derinliğini dört hiyerarşik seviyeden ikiye düşürerek önemli bir mimari değişiklik yapıldı; bu da modeli basitleştirmeye ve hesaplama verimliliğini artırmaya yardımcı oldu. Derinlik azaltılmış olsa da, her seviyede kanal boyutları artırılmış, böylece ağ daha zengin ve ifade edici özellikleri yakalayabiliyor. Modelin özellik öğrenimini daha da geliştirmek için, ağı birden fazla ölçekte en ilgili özelliklere odaklamak için dikkat mekanizmaları tanıtıldı. Bu dikkat mekanizmaları, daha sığ mimari nedeniyle hiyerarşik özellik soyutlamasının potansiyel kaybını etkili bir şekilde telafi eder.
Kodlayıcı, giriş tensorları X(C, H×W)'dan ilk özellik çıkarımı için çift Conv2D işlemiyle başlatıldı. Üç özel modülün dönüşümlü konfigürasyonu uygulandı: Yüksek Dereceli Görme Mamba Tabanlı Anahtarlama Şeması (H-VSS), Paralel Çok Derinlikli Esnek Ağ (PMFlex) ve Çok Ölçekli Genişletilmiş Dikkat Birleşme Ağı (MSDAFN).
Model, normalleştirme için ImageNet istatistiklerini (ortalama ve standart sapma) kullanır; böylece her veri seti için yeniden hesaplama gerekmez ve böylece hesaplama verimliliğini artırır. ImageNet'in bilgisayar görüş görevlerindeki geniş kullanımından yararlanarak istikrar ve genellenebilirlik sağlar. Bu seçim, ön işleme karmaşıklığını azaltarak tasarımı basitleştirir ve veri kümesi çapraz aktarılabilirliğini artırır; böylece modelin çeşitli cilt lezyonu görüntüleri arasında etkili şekilde genelleştirilmesini sağlar.
Yüksek dereceli vizyon mamba tabanlı anahtarlama şeması (H-VSS) uygulaması
H-VSS modülü, Şekil 2'deki mimariye göre uygulanmıştır. Katman Normalizasyonu (LN) ve Hardswish aktivasyonu (HS), Denklem (1) izinde kalıntı bağlantılarla yapılandırıldı:

Yerel Uzamsal Tanımlayıcı (LSD) bileşeni, mekânsal tutarlılığı korumak için uygulanmıştır. Mekansal Seçici 2D Tarama (SS2D) modülü, Denklem (2) aşağıdaki çok yönlü tarama desenleriyle yapılandırıldı:

Çok Katmanlı Perceptron (MLP) işleme, Denklem (3)'te belirtildiği gibi kalıntı bağlantılarla eklenmiştir:

Yüksek dereceli 2D Seçici Tarama (H-SS2D) mekanizması, giriş özelliklerini gelişmiş bağlamsal modelleme için 2C boyutlu uzaya yansıtır.
Paralel çok derinlikli esnek ağ (PMFlex) uygulaması
PMFlex modülü, Şekil 3 spesifikasyonlarına göre yapılandırıldı. Katman Normalizasyonu, giriş özellik haritaları X(C, H×W) için uygulanmış, ardından Denklem (4) izlediği şekilde kanal boyutu boyunca dört segmente bölünmüştür:

Her segmentli özellik Y_i paylaşılan Visual Mamba (VMamba) modülleri aracılığıyla işleniyordu. İşlenen çıktılar birleştirildi ve Katman Normalizasyonu ile Denklem (5)'te açıklandığı gibi iyileştirme uygulandı:

Çok Ölçekli Genişletilmiş Dikkat Füzyon Ağı (MSDAFN) uygulaması
MSDAFN modülü, Şekil 4 mimarisi izlenerek uygulanmıştır. Paralel konvolüsyon işlemleri, çok ölçekli özellik çıkarımı için 6, 12 ve 18 genişleme oranlarıyla Denklem (6)'ya göre yapılandırılmıştır:

Çok ölçekli özellikler, Denklem (7)'de belirtildiği gibi kanal birleştirme yoluyla entegre edildi:

Özellik yeniden kalibrasyonu için çift dikkat mekanizmaları uygulandı. Kanal dikkat ağırlıkları, Denklem (8) takip ederek küresel ortalama havuzlama kullanılarak hesaplandı:

Kanal dikkat ağırlıkları, Denklem (9)'da açıklandığı gibi uygulanmıştır:

Mekansal dikkat, Denklem (10) aşağıdaki konvolüsyon işlemleriyle yapılandırıldı:

Kanal ve mekansal dikkat, Denklem (11)'de belirtildiği gibi birleştirildi:

Eğitim yapılandırması ve optimizasyonu
Ortam kurulumu
Deneysel ortam, GPU (32 GB VRAM) ile Ubuntu 20.04 sisteminde yapılandırılmıştır. Python 3.8, derin öğrenme çerçevesi (RRID: SCR_018536) ve CUDA 11.8 kuruldu. Deri lezyonu görevleri için giriş görüntü boyutu 256 × 256 piksel olarak ayarlandı.
Kayıp fonksiyonu ve optimizator yapılandırması
BceDice kayıp fonksiyonu, eğitim optimizasyonu için uygulandı. AdamW optimizer, başlangıç öğrenme oranı 0.001, parti büyüklüğü 8 ve 250 eğitim epoşu ile yapılandırıldı. Düzenlendirme için 1 × 10⁻5 ağırlık kaybı uygulandı.
Temel konfigürasyon için, bu çalışma Liu ve ark. (2024) tarafından yapılan Vmamba modeli üzerine yapılan çalışmalara atıfta bulunuyor; bu model, tıbbi görüntü sınıflandırmagörevi 11 için görsel durum uzayı modeli olarak kullanılmıştır. Vmamba'nın uygulanmasında kullanılan kesin yapılandırmalar ve scriptler, yayımlanan çalışmalara dayanır ve tıbbi görüntüleme veri setine daha iyi uyacak özel ayarlamalarla bu çalışma için uyarlanmıştır.
Öğrenme hızı planlaması, sıcak yeniden başlatmalarla kosinüs tavlama kullanılarak kuruldu. Başlangıç yeniden başlatma dönemi için T_0 = 10 dönem, periyot çarpımı için T_mult = 2 ve minimum öğrenme hızı için η_min = 1 × 10⁻6 olarak yapılandırılır.
Hiperparametre optimizasyonu
Tekrarlanabilirlik ve tutarlılığı sağlamak için tüm deneyler sabit rastgele 42 tohum kullanılarak gerçekleştirildi. Sistematik hiperparametre optimizasyonu, parti büyüklüğü, öğrenme oranı ve bırakma yolu oranına odaklanarak gerçekleştirildi. 4, 8, 16 ve 32 parti büyüklükleri değerlendirildi. 0.0005, 0.001, 0.0015 ve 0.002 öğrenme oranları test edildi. Doğrulama performansı, birincil metrik olarak Zar Benzerlik Katsayısı (DSC) kullanılarak izlendi. 8'den büyük parti boyutları, 32 GB'ın altında VRAM'e sahip GPU'larda bellek taşmasına yol açabilir.
Model değerlendirmesi ve performans değerlendirmesi
Değerlendirme metrikleri yapılandırması
Birleşme Üzerinden Ortalama Kesişim (mIoU), Zar Benzerlik Katsayısı (DSC), Duyarlılık (Sen), Özgüllük (Spe) ve Doğruluk (Acc) gibi kapsamlı değerlendirme metrikleri uygulandı. Metrikler aşağıdaki formülasyonlara göre hesaplandı:
Ortalama Birleşik Kesişimi (mIoU), tahmin edilen ve temel doğruluk segmentasyonu arasındaki örtüşmeyi nicelikle nicelikleder:

Zar Benzerlik Katsayısı (DSC), segmentasyon tutarlılığını ölçür. Değerler 0'dan 1'e kadar değişirken, daha yüksek değerler daha iyi performans gösterir:

Duyarlılık (Sen), modelin pozitif örnekleri tespit etme yeteneğini ölçür:

Specificity (Spe) doğru negatif örneklem tanıma değerini değerlendirir:

Doğruluk (Acc), genel tahmin doğruluğunu ölçür:

Parametreler (M), model karmaşıklığını yansıtır ve toplam eğitilebilir parametreleri ölçür:

burada Pi , i-ci katmandaki parametrelerin sayısı, N ise toplam katman sayısıdır. Daha küçük parametre sayıları, klinik uygulamaya uygun daha hafif modelleri gösterir.
Ablasyon çalışma protokolü
Tablo 1'deki deneysel tasarımın ardından mimari bileşen katkılarını doğrulamak için kapsamlı ablasyon çalışmaları yapılmıştır. Dört mimari varyant değerlendirildi: H-MUNet (MSDAFN ve PMFlex olmadan taban), HP-MUNet (MSDAFN olmadan), HM-MUNet (PMFlex olmadan) ve HMP-MUNet (tam model).
Tüm varyantlarda aynı eğitim parametreleri yapılandırıldı: öğrenme oranı 0.001, parti boyutu 8, 250 eprodak. Eğitim yakınsaması izlendi ve her bileşen eklemesi için performans iyileştirmeleri doğrulandı.
Hesaplamalı verimlilik analizi
Parametre sayısı, FLOP'lar ve farklı mimariler arasında çıkarım süresi dahil olmak üzere hesaplama verimliliği metrikleri ölçüldü. Modelin standart klinik seviyeli GPU üzerindeki çıkarım süresinin değerlendirilmesi, yüksek performanslı GPU'larda en iyi performans gösterse de, modelin daha yaygın kullanılan donanımlarda yaklaşık %70 daha yavaş olduğunu göstermektedir. Yine de, verimli çıkarım hızları yapabildiği için pratik klinik uygulama için uygundur. Sistem kararlılığını sağlamak için eğitim sırasında GPU bellek kullanımını izleyin. Önerilen minimum 16 GB GPU bellek için parti boyutu 8.
Doğrulama ve analiz
Performans kıyaslaması
HMP-MUNet'in performansı, her iki veri setinde de son teknoloji yöntemlerle karşılaştırıldı. Tüm karşılaştırılan modeller, performans farklılıklarının yalnızca mimari farklılıklardan kaynaklandığını sağlamak için aynı veri bölmeleri, ön işleme, veri artırma ve eğitim protokolleri altında uygulandı ve eğitildi. ISIC2018 ve PH2 veri setlerinde DSC'de %2,89 ve %5,25 iyileştirmeleri dahil olmak üzere nicel sonuçlar belgelendi. Çalışma, parametre sayısının U-Net başlangıç seviyesine göre 4,55 kat azaldığını doğruladı.
İstatistiksel analiz
Performans karşılaştırmaları için çift t-testleri kullanılarak istatistiksel anlamlılık testi yapıldı. Bildirilen metrikler için güven aralıkları hesaplandı. Tekrarlanabilirlik, farklı rastgele tohumlarla yapılan çoklu antrenman çalışmalarıyla sağlandı.
Optimal hiperparametre yapılandırmaları, toplu boyut 8 ve öğrenme oranı 0.001 olarak kaydedildi; deneysel sonuçlarda belgelendiği üzere PH2 veri setinde 0.9585 ve ISIC2018 veri setinde 0.9044 zirve DSC elde edildi. Aşırı uyumu önlemek için yeterli doğrulama verisi sağlandı. Doğrulama kayıp eğrileri erken durma kriterleri uygulanarak izlendi.