Araştırma makalesi

HMP-MUNet: Dermoskopik Görüntülerde Otomatik Cilt Lezyonu Segmentasyonu için Hibrit Derin Öğrenme Çerçevesi

167 görüntüleme

DOI:

10.3791/69449

17 Mart 2026

* These authors contributed equally

Bu makalede

Özet

HMP-MUNet, otomatik cilt lezyonu segmentasyonu için hibrit derin öğrenme çerçevesi sunar. Durum-Uzay Modellerini çok ölçekli dikkat mekanizmalarıyla entegre ederek, segmentasyon doğruluğunu artırırken hesaplama verimliliğini optimize eder ve klinik ortamlarda cilt kanseri teşhisi için sağlam bir çözüm sunar.

Özet

Deri lezyonları için bilgisayar destekli tanı sistemleri, hem yüksek tanı doğruluğu hem de hesaplama verimliliği sağlamada önemli zorluklarla karşı karşıyadır. Mevcut derin öğrenme yaklaşımları, farklı ölçeklerdeki cilt lezyonlarında bulunan karmaşık morfolojik varyasyonları yakalamakta zorlanırken genellikle önemli hesaplama kaynakları gerektirir. Yüksek dereceli Çok ölçekli Paralel Görüş Mamba U-Net (HMP-MUNet), bu sınırlamaları Durum-Uzay Modelleri ile gelişmiş çok ölçekli işleme yeteneklerini birleştiren yenilikçi bir mimari tasarım aracılığıyla ele alan yenilikçi bir derin öğrenme çerçevesidir.

Bu çalışmada tanımlanan yaklaşım, küresel bağlam modelleme için yüksek dereceli görme durum alanı modülü, birden fazla alıcı alan arasında hiyerarşik özellik çıkarımı için çok ölçekli genişletilmiş dikkat füzyon ağı ve hesaplamalı optimizasyon için paralel çok derinlikli esnek bir ağ birleştiren hibrit bir U-Net çerçevesini entegre eder. Bu mimari, özellik öğrenimini geliştirmek için artırılmış kanal boyutları ve gelişmiş dikkat mekanizmalarıyla modifiye edilmiş U şeklinde kodlayıcı-kodlayıcı kullanır.

Kıyaslama veri setlerinin kapsamlı değerlendirmesi, PH2'de %95,85 ve ISIC2018'de %90,44 Zar Benzerlik Katsayısı olduğunu göstermektedir. Model, bu üstün doğruluğu yalnızca 7,61M parametrelerle elde ediyor; bu, mevcut Vision Mamba mimarilerine kıyasla %72,2'lik dikkat çekici bir azalmayı temsil ederken yüksek segmentasyon doğruluğunu korur. Hafif tasarım, uzman dermatoloji merkezlerinden birincil bakım tesislerine kadar çeşitli klinik ortamlarda ve görüntüleme modalitelerinde uygulanma potansiyelini gösteriyor.

HMP-MUNet, tanı tutarlılığını artıran ve klinik iş akışlarını destekleyen otomatik bir cilt lezyonu segmentasyonu çözümü sunar; klinik kullanımda daha fazla doğrulama potansiyeli sunar. Yüksek düzey modelleme yeteneklerinin pratik dağıtım konularıyla entegrasyonu, cilt kanseri tarama protokollerini iyileştirmek ve bilgisayar destekli tanı uygulamalarında sağlık erişimini genişletmek için potansiyel bir çözüm sunmaktadır.

Giriş

Bilgisayar destekli tanı (CAD) sistemleri, klinik uzmanlıklar arasında tıbbi görüntüleme uygulamalarını geliştirmeyi, hastalık tespiti, tanı ve tedavi planlama yaklaşımlarını geliştirmeyiamaçlar 1. Dermatolojide, yapay zeka (YZE) ve gelişmiş görüntüleme tekniklerinin entegrasyonu, özellikle cilt kanserinin erken tespitinde tanı doğruluğunu ve klinik sonuçları artırmak için kritik bir araç olarak ortaya çıkmıştır; bu kanser tüm cilt kanserlerinin yaklaşık %90'ını oluşturur2. Otomatik deri lezyonu analizi için gelişmiş algoritmik yaklaşımların geliştirilmesi, hassas tıbbın ilerlemesine katkıda bulunur ve standartlaştırılmış, tekrarlanabilir tanı desteğini mümkün kılarak çeşitli sağlık ortamlarında klinik karar alma süreçlerinigeliştirir 3,4.

Modern dermatolojik görüntüleme, dermoskopi, dijital fotoğrafçılık, optik koherens tomografi ve multispektral görüntüleme sistemleri dahil olmak üzere birden fazla yöntemikapsar 5. Tıbbi profesyoneller, cilt kanserini manuel olarak teşhis etmek için dermoskopik görüntüler kullanır; bu yöntem emek yoğun ve zaman alıcı yöntemlerle ve önemli bir uzmanlıkgerektirir 6. Farklı klinik ortamlar ve görüntüleme koşullarında tanı tutarlılığını koruma zorluğu, deri lezyonlarının objektif ve nicel analizini sağlayan CAD sistemlerinin geliştirilmesini sağlamıştır. Dermoskopik görüntülerden deri lezyonlarının segmentasyonu, sonraki sınıflandırma doğruluğunu ve klinik faydayı doğrudan etkileyen temel bir ön işlemeadımını oluşturur 7. Genellikle, bilgisayar destekli cilt kanseri teşhisi beş adımdan oluşur: görüntü edinimi, ön işleme, segmentasyon, özellik çıkarma vesınıflandırma 8. Kesin sınır belirleme, doğru lezyon karakterizasyonu için gereklidir; bu da klinisyenlerin asimetri, sınır düzensizliği, renk varyasyonu ve çapı gibi morfolojik özellikleri değerlendirmesini sağlar—bunlar belirlenmiş tanıkriterlerinde anahtar parametrelerdir 9.

Durum-Uzay Modellerinin (SSM'ler) ortaya çıkışı, özellikle Mamba mimarisi, doğrusal hesaplama karmaşıklığı sunarken, hesaplama verimliliğini artırırken üstün uzun menzilli bağımlılık modelleme yeteneklerinikorurken 10. U-Net9, Att-UNet12, UTNetV213 ve UNet++14 gibi cilt lezyonu segmentasyonu11'deki son gelişmeler, segmentasyon doğruluğunda kayda değer iyileşmeler göstermiştir. Örneğin, U-Net ISIC2018 veri setinde %87,55 Zar Benzerlik Katsayısı (DSC) elde ederken, UNet++ %87,83'e ulaşır ve Att-UNet %87,91'e ulaşır. PH2 veri setinde U-Net %90,6 DSC'ye ulaşırken, C2SDG15 veSCR-Net 16sırasıyla %90,3 ve %89,89 oranına ulaşmaktadır. HMP-MUNet, çok ölçekli dikkat mekanizması ve paralel işleme yeteneklerini entegre ederek bu modelleri geliştirir; parametre sayısını %72,2 azaltırken, PH2 veri setinde %95,85 ve ISIC2018 veri setinde %90,44 DSC ile üstün doğruluk elde eder. Görsel temsil öğrenme yetenekleri ile hesaplama kaynak tüketiminin dengelenmesinin önemi göz önüne alındığında, optimal tavanları sağlayan genel tıbbi görüntü sınıflandırma mimarilerinin incelenmesi, akıllı klinik tanı sistemi geliştirme için önemlidir17. Yapılandırılmış uzamsal SSM çerçevesi, durum geçiş matrislerini optimize ederek, hesaplama verimliliğini artırarak ve bellek yükünü azaltarak geleneksel Mamba mimarileri geliştirir—bu, çeşitli görüntüleme modalitelerinde klinik uygulama için gerekliözelliklerdir 18.

Son araştırmalar, özellikle Yüksek Dereceli Vision Mamba tabanlı Anahtarlama Şeması (H-VSS) kullananların, geleneksel transformatorlara kıyasla önemli ölçüde daha düşük parametre sayısıyla üstün performans elde ettiğini ve bu nedenle klinik iş akışı entegrasyonu için özellikle uygunkıldığını göstermektedir 19. Ancak, mevcut Vision Mamba uygulamaları, bellek tüketimi ve klinik uygulama koşullarında ölçeklenebilirlik kısıtlamaları gibi zorluklarla karşıkarşıya 20. Mevcut tıbbi görüntü segmentasyon yöntemleri genellikle CNN'ler ve transformatör tabanlı modeller olarak ikiye ayrılır; geleneksel CNN'ler alıcı alan kısıtlamalarıyla sınırlandırılır ve uzun menzilli bağımlılık yakalamayızorlaştırır. Tıbbi görüntülemede, lezyonlar gibi kritik bölgeleri sağlıklı deriden ayırt etmek yüksek hassasiyet gerektirir ve bu zorlukları ele almak için ileri teknolojik çözümlerin benimsenmesinigerektirir 22. Çağdaş segmentasyon mimarileri, gerçek zamanlı uygulamalar için hesaplama verimliliği, kritik tanı görevleri için doğruluk ve çeşitli görüntüleme protokollerinde dayanıklılık gibi özel klinik gereksinimleri karşılamak üzere evrilmiştir23. Dikkat mekanizmaları, çok ölçekli özellik birleşme stratejileri ve transformatör tabanlı kodlayıcılar içeren gelişmiş U-Net varyantları, karmaşık tıbbi görüntüleme senaryolarında üstün performans göstermiştir12,24. Bu mimari yenilikler, anatomik yapıların doğru şekilde tanımlanmasını, patolojik bölgelerin tanımlanmasını ve nicel biyobelirteçlerin çıkarılmasını sağlayarak klinik uygulamaları doğrudan geliştirir; bunların tümü kanıta dayalı tıp için hayati öneme sahiptir25,26. Ancak, mevcut elektronik tıbbi kayıtlarla (EMR) arayüz uyumluluğu, büyük görüntülerin depolanması ve geri alınması ile farklı kurumsal sistemler arasında birlikte çalışabilirlik gibi entegrasyon zorlukları, yaygın klinik benimseme için önemli engellerolarak kalmaktadır 27.

Bu makale, klinik uygulamada otomatik deri lezyonu segmentasyonu için özel olarak tasarlanmış yeni bir CAD sistemi olan Yüksek Dereceli Çok Ölçekli Paralel Görüş Mamba U-Net'i (HMP-MUNet) tanıtmaktadır. Buradaki çerçeve, mevcut tıbbi görüntüleme sistemlerindeki kritik boşlukları yenilikçi mimari bileşenleri dahil ederek giderir: Çok Ölçekli Genişletilmiş Dikkat Birleşme Ağı (MSDAFN) ve Paralel Çok Derinlikli Esnek Ağ (PMFlex). MSDAFN, mekânsal ve kanal dikkat mekanizmalarını çok ölçekli genişletilmiş konvolyutsiyalarla birleştiren gelişmiş özellik çıkarma stratejileri uygular; böylece farklı ölçeklerde ince lezyon özelliklerinin daha iyi tespit edilmesini sağlar — bu, klinik uygulamada karşılaşılan çeşitli lezyon tiplerinin doğru teşhisi içinkritik öneme sahiptir 28. PMFlex, birden fazla giriş akışının eşzamanlı analizini mümkün kılan paralel işleme yetenekleri sunar; bu da hesaplama verimliliğini önemli ölçüde artırırken klinik düzeyde doğruluk için gerekli olan yüksek dereceli modellemeyeteneklerini korurken 29. HMP-MUNet, yenilikçi segmentasyon teknikleri ve hesaplama stratejileri sayesinde, cilt kanseri teşhisinin sınırlarını zorlamayı ve gerçek zamanlı ve doğru klinik tanıyapılmasını mümkün kılmayı amaçlamaktadır 30,31.

Bu araştırmanın temel katkıları, tıbbi görüntülemede CAD'in ilerletilmesi temel hedefleriyle örtüşüyor: MSDAFN ile geliştirilmiş küresel bağlam modelleme, çeşitli klinik sunumlarda doğru lezyon lokalizasyonu için özellik çıkarımı ve füzyon verimliliğini artırmak; PMFlex ile verimli paralel işleme, hesaplama yükünü azaltırken klinik düzeyde doğruluğu koruyarak kaynak kısıtlı klinik ortamlarda uygulamayı kolaylaştırıyor; donanım farkında tasarım yoluyla klinik dağıtım optimizasyonu, gerçek zamanlı klinik iş akışlarını destekleyen yüksek çözünürlüklü dermoskopik görüntülerin verimli işlemesini sağlıyor; Klinik entegrasyona uygun performans metrikleriyle standart veri setlerinde kapsamlı değerlendirme yoluyla gösterilen klinik performans; ve yüksek dereceli modelleme, çok ölçekli analiz ve paralel hesaplamayı birleştiren entegre tanı çözümleri, hassas dermatolojik tanı için kapsamlı çözümler sunar. Bu araştırma, çağdaş sağlık ortamlarında otomatik deri lezyonu analizi için hem teknolojik hem de pratik gereksinimleri karşılayan yenilikçi ve klinik olarak uygulanabilir çözümler sunarak bilgisayarlı tıbbi görüntülemeyi geliştirmektedir.

Çerçeve, genellikle 256 × 256 giriş çözünürlüklü yüksek çözünürlüklü dermoskopik görüntüleri işlemek için tasarlanmıştır ve hesaplama verimliliği ile görüntü detayları arasında bir denge sağlar. Ancak, aydınlatma, ten rengi ve saç varlığındaki farklılıklar gibi ekipman ve görüntü kalitesindeki değişkenlik, segmentasyon performansını etkileyebilir. Bu zorluklara rağmen, sistemin tasarımı gerçek zamanlı klinik iş akışları için optimize edilmiş ve farklı görüntüleme cihazlarına uyarlanabilir, böylece çeşitli klinik ortamlarda sağlam performans sağlanmaktadır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Bu araştırma, hesaplamalı araştırma ve veri işleme için kurumsal yönergelere uygun olarak gerçekleştirilmiştir. Bu çalışmada insan veya omurgalı hayvan yer almadı.

Veri seti hazırlama ve ön işleme

Veri seti toplama ve organizasyon

Dermoskopik görüntüler PH2, ISIC2018 ve ISIC2017 veri setlerinden toplandı ve Materyaller Tablosu'nda özel bağlantılar sağlandı. PH2 veri seti 200 yüksek çözünürlüklü görüntü (1000 × 1000 piksel) içerir, ISIC2018 ilgili segmentasyon maskeleriyle 2.594 görüntü içerir ve ISIC2017 segmentasyon maskeleriyle birlikte 2.150 görüntü içerir. Veriler, standart protokollere uygun şekilde eğitim, doğrulama ve test setlerine organize edildi; böylece görüntüler uyumlu formatlarda (örneğin .jpg, .png veya .tiff) ve karşılık gelen taban gerçeklik maskelerini ikili formatta içeriyordu.

Veriler, standart protokollere uygun olarak eğitim, doğrulama ve test setlerine organize edildi. Veri setleri şu şekilde bölündü: ISIC2018 için 1.815 görüntü eğitim için, 259 doğrulama için ve 520 test için ayrıldı. ISIC2017 için 1.500 görüntü eğitim için, 220 görüntü doğrulama için ve 430 görüntü test için tahsis edildi. PH2 için veri seti 160 eğitim görseli, 10 doğrulama görüntüsü ve 30 test görsemine bölündü. Ön işlem hattı boyunca 256 × 256 piksel tutarlı bir görüntü çözünürlüğü korundu.

Veri artırma ve normalizasyon

Model genellemesini artırmak için veri artırma teknikleri uygulandı. ±15° aralığında yatay çevirme, dikey çevirme ve rastgele dönüş uygulandı. Gamma düzeltmesi ve logaritmik dönüşüm, her biri 0,3 olasılıkla uygulandı. Piksel değerleri ImageNet istatistikleri kullanılarak normalize edildi (ortalama = [0.485, 0.456, 0.406], standart sapma = [0.229, 0.224, 0.225]).

Tüm giriş görüntülerini 256 × 256 piksele yeniden boyutlandırın: Hesaplama verimliliğini sağlamak için tüm giriş görüntüleri 256 × 256 piksel arasında eşit çözünürlükte yeniden boyutlandırıldı. Veri setindeki (1000 × 1000 piksel) gibi yüksek çözünürlüklü görüntüler, hassas lezyon sınırı belirlemesi için kritik olan ince tanenli detaylar ve doku bilgileri içerirken, çözünürlüğün artırılması modelin performansını önemli ölçüde artırmadı. Bu nedenle, hesaplama verimliliği ile model doğruluğu arasında denge sağlamak için çözünürlük artırılmadı. Gelecekteki çalışmalar, daha yüksek çözünürlüklü girdilerin etkilerini daha fazla inceleyerek, segmentasyon doğruluğundaki faydaların artan hesaplama maliyetini haklı çıkarıp çıkarmadığını belirleyebilir. Gerektiğinde görüntüler RGB formatına dönüştürülürdü. Önden işlenen veriler, orijinal veri seti bölünmeleri korunurken yapılandırılmış dizinlerde kaydedildi.

HMP-MUNet mimarisi uygulaması

Ağ mimarisi tasarımı

HMP-MUNet , Şekil 1'de gösterildiği gibi hiyerarşik U şeklinde kodlayıcı-kodlayıcı yapısına uygun şekilde yapılandırılmıştır. Ağ, kademeli kanal genişletme ile yapılandırıldı: 8→16→32→64→128→256 kanal, kodlayıcı seviyelerinde kullanıldı.

Ağ derinliğini dört hiyerarşik seviyeden ikiye düşürerek önemli bir mimari değişiklik yapıldı; bu da modeli basitleştirmeye ve hesaplama verimliliğini artırmaya yardımcı oldu. Derinlik azaltılmış olsa da, her seviyede kanal boyutları artırılmış, böylece ağ daha zengin ve ifade edici özellikleri yakalayabiliyor. Modelin özellik öğrenimini daha da geliştirmek için, ağı birden fazla ölçekte en ilgili özelliklere odaklamak için dikkat mekanizmaları tanıtıldı. Bu dikkat mekanizmaları, daha sığ mimari nedeniyle hiyerarşik özellik soyutlamasının potansiyel kaybını etkili bir şekilde telafi eder.

Kodlayıcı, giriş tensorları X(C, H×W)'dan ilk özellik çıkarımı için çift Conv2D işlemiyle başlatıldı. Üç özel modülün dönüşümlü konfigürasyonu uygulandı: Yüksek Dereceli Görme Mamba Tabanlı Anahtarlama Şeması (H-VSS), Paralel Çok Derinlikli Esnek Ağ (PMFlex) ve Çok Ölçekli Genişletilmiş Dikkat Birleşme Ağı (MSDAFN).

Model, normalleştirme için ImageNet istatistiklerini (ortalama ve standart sapma) kullanır; böylece her veri seti için yeniden hesaplama gerekmez ve böylece hesaplama verimliliğini artırır. ImageNet'in bilgisayar görüş görevlerindeki geniş kullanımından yararlanarak istikrar ve genellenebilirlik sağlar. Bu seçim, ön işleme karmaşıklığını azaltarak tasarımı basitleştirir ve veri kümesi çapraz aktarılabilirliğini artırır; böylece modelin çeşitli cilt lezyonu görüntüleri arasında etkili şekilde genelleştirilmesini sağlar.

Yüksek dereceli vizyon mamba tabanlı anahtarlama şeması (H-VSS) uygulaması                

H-VSS modülü, Şekil 2'deki mimariye göre uygulanmıştır. Katman Normalizasyonu (LN) ve Hardswish aktivasyonu (HS), Denklem (1) izinde kalıntı bağlantılarla yapılandırıldı:

figure-protocol-1

Yerel Uzamsal Tanımlayıcı (LSD) bileşeni, mekânsal tutarlılığı korumak için uygulanmıştır. Mekansal Seçici 2D Tarama (SS2D) modülü, Denklem (2) aşağıdaki çok yönlü tarama desenleriyle yapılandırıldı:

figure-protocol-2

Çok Katmanlı Perceptron (MLP) işleme, Denklem (3)'te belirtildiği gibi kalıntı bağlantılarla eklenmiştir:

figure-protocol-3

Yüksek dereceli 2D Seçici Tarama (H-SS2D) mekanizması, giriş özelliklerini gelişmiş bağlamsal modelleme için 2C boyutlu uzaya yansıtır.

Paralel çok derinlikli esnek ağ (PMFlex) uygulaması

PMFlex modülü, Şekil 3 spesifikasyonlarına göre yapılandırıldı. Katman Normalizasyonu, giriş özellik haritaları X(C, H×W) için uygulanmış, ardından Denklem (4) izlediği şekilde kanal boyutu boyunca dört segmente bölünmüştür:

figure-protocol-4

Her segmentli özellik Y_i paylaşılan Visual Mamba (VMamba) modülleri aracılığıyla işleniyordu. İşlenen çıktılar birleştirildi ve Katman Normalizasyonu ile Denklem (5)'te açıklandığı gibi iyileştirme uygulandı:

figure-protocol-5

Çok Ölçekli Genişletilmiş Dikkat Füzyon Ağı (MSDAFN) uygulaması

MSDAFN modülü, Şekil 4 mimarisi izlenerek uygulanmıştır. Paralel konvolüsyon işlemleri, çok ölçekli özellik çıkarımı için 6, 12 ve 18 genişleme oranlarıyla Denklem (6)'ya göre yapılandırılmıştır:

figure-protocol-6

Çok ölçekli özellikler, Denklem (7)'de belirtildiği gibi kanal birleştirme yoluyla entegre edildi:

figure-protocol-7

Özellik yeniden kalibrasyonu için çift dikkat mekanizmaları uygulandı. Kanal dikkat ağırlıkları, Denklem (8) takip ederek küresel ortalama havuzlama kullanılarak hesaplandı:

figure-protocol-8

Kanal dikkat ağırlıkları, Denklem (9)'da açıklandığı gibi uygulanmıştır:

figure-protocol-9

Mekansal dikkat, Denklem (10) aşağıdaki konvolüsyon işlemleriyle yapılandırıldı:

figure-protocol-10

Kanal ve mekansal dikkat, Denklem (11)'de belirtildiği gibi birleştirildi:

figure-protocol-11

Eğitim yapılandırması ve optimizasyonu

Ortam kurulumu

Deneysel ortam, GPU (32 GB VRAM) ile Ubuntu 20.04 sisteminde yapılandırılmıştır. Python 3.8, derin öğrenme çerçevesi (RRID: SCR_018536) ve CUDA 11.8 kuruldu. Deri lezyonu görevleri için giriş görüntü boyutu 256 × 256 piksel olarak ayarlandı.

Kayıp fonksiyonu ve optimizator yapılandırması

BceDice kayıp fonksiyonu, eğitim optimizasyonu için uygulandı. AdamW optimizer, başlangıç öğrenme oranı 0.001, parti büyüklüğü 8 ve 250 eğitim epoşu ile yapılandırıldı. Düzenlendirme için 1 × 10⁻5 ağırlık kaybı uygulandı.

Temel konfigürasyon için, bu çalışma Liu ve ark. (2024) tarafından yapılan Vmamba modeli üzerine yapılan çalışmalara atıfta bulunuyor; bu model, tıbbi görüntü sınıflandırmagörevi 11 için görsel durum uzayı modeli olarak kullanılmıştır. Vmamba'nın uygulanmasında kullanılan kesin yapılandırmalar ve scriptler, yayımlanan çalışmalara dayanır ve tıbbi görüntüleme veri setine daha iyi uyacak özel ayarlamalarla bu çalışma için uyarlanmıştır.

Öğrenme hızı planlaması, sıcak yeniden başlatmalarla kosinüs tavlama kullanılarak kuruldu. Başlangıç yeniden başlatma dönemi için T_0 = 10 dönem, periyot çarpımı için T_mult = 2 ve minimum öğrenme hızı için η_min = 1 × 10⁻6 olarak yapılandırılır.

Hiperparametre optimizasyonu

Tekrarlanabilirlik ve tutarlılığı sağlamak için tüm deneyler sabit rastgele 42 tohum kullanılarak gerçekleştirildi. Sistematik hiperparametre optimizasyonu, parti büyüklüğü, öğrenme oranı ve bırakma yolu oranına odaklanarak gerçekleştirildi. 4, 8, 16 ve 32 parti büyüklükleri değerlendirildi. 0.0005, 0.001, 0.0015 ve 0.002 öğrenme oranları test edildi. Doğrulama performansı, birincil metrik olarak Zar Benzerlik Katsayısı (DSC) kullanılarak izlendi. 8'den büyük parti boyutları, 32 GB'ın altında VRAM'e sahip GPU'larda bellek taşmasına yol açabilir.

Model değerlendirmesi ve performans değerlendirmesi

Değerlendirme metrikleri yapılandırması

Birleşme Üzerinden Ortalama Kesişim (mIoU), Zar Benzerlik Katsayısı (DSC), Duyarlılık (Sen), Özgüllük (Spe) ve Doğruluk (Acc) gibi kapsamlı değerlendirme metrikleri uygulandı. Metrikler aşağıdaki formülasyonlara göre hesaplandı:

Ortalama Birleşik Kesişimi (mIoU), tahmin edilen ve temel doğruluk segmentasyonu arasındaki örtüşmeyi nicelikle nicelikleder:

figure-protocol-12

Zar Benzerlik Katsayısı (DSC), segmentasyon tutarlılığını ölçür. Değerler 0'dan 1'e kadar değişirken, daha yüksek değerler daha iyi performans gösterir:

figure-protocol-13

Duyarlılık (Sen), modelin pozitif örnekleri tespit etme yeteneğini ölçür:

figure-protocol-14

Specificity (Spe) doğru negatif örneklem tanıma değerini değerlendirir:

figure-protocol-15

Doğruluk (Acc), genel tahmin doğruluğunu ölçür:

figure-protocol-16

Parametreler (M), model karmaşıklığını yansıtır ve toplam eğitilebilir parametreleri ölçür:

figure-protocol-17

burada Pi , i-ci katmandaki parametrelerin sayısı, N ise toplam katman sayısıdır. Daha küçük parametre sayıları, klinik uygulamaya uygun daha hafif modelleri gösterir.

Ablasyon çalışma protokolü

Tablo 1'deki deneysel tasarımın ardından mimari bileşen katkılarını doğrulamak için kapsamlı ablasyon çalışmaları yapılmıştır. Dört mimari varyant değerlendirildi: H-MUNet (MSDAFN ve PMFlex olmadan taban), HP-MUNet (MSDAFN olmadan), HM-MUNet (PMFlex olmadan) ve HMP-MUNet (tam model).

Tüm varyantlarda aynı eğitim parametreleri yapılandırıldı: öğrenme oranı 0.001, parti boyutu 8, 250 eprodak. Eğitim yakınsaması izlendi ve her bileşen eklemesi için performans iyileştirmeleri doğrulandı.

Hesaplamalı verimlilik analizi

Parametre sayısı, FLOP'lar ve farklı mimariler arasında çıkarım süresi dahil olmak üzere hesaplama verimliliği metrikleri ölçüldü. Modelin standart klinik seviyeli GPU üzerindeki çıkarım süresinin değerlendirilmesi, yüksek performanslı GPU'larda en iyi performans gösterse de, modelin daha yaygın kullanılan donanımlarda yaklaşık %70 daha yavaş olduğunu göstermektedir. Yine de, verimli çıkarım hızları yapabildiği için pratik klinik uygulama için uygundur. Sistem kararlılığını sağlamak için eğitim sırasında GPU bellek kullanımını izleyin. Önerilen minimum 16 GB GPU bellek için parti boyutu 8.

Doğrulama ve analiz

Performans kıyaslaması

HMP-MUNet'in performansı, her iki veri setinde de son teknoloji yöntemlerle karşılaştırıldı. Tüm karşılaştırılan modeller, performans farklılıklarının yalnızca mimari farklılıklardan kaynaklandığını sağlamak için aynı veri bölmeleri, ön işleme, veri artırma ve eğitim protokolleri altında uygulandı ve eğitildi. ISIC2018 ve PH2 veri setlerinde DSC'de %2,89 ve %5,25 iyileştirmeleri dahil olmak üzere nicel sonuçlar belgelendi. Çalışma, parametre sayısının U-Net başlangıç seviyesine göre 4,55 kat azaldığını doğruladı.

İstatistiksel analiz

Performans karşılaştırmaları için çift t-testleri kullanılarak istatistiksel anlamlılık testi yapıldı. Bildirilen metrikler için güven aralıkları hesaplandı. Tekrarlanabilirlik, farklı rastgele tohumlarla yapılan çoklu antrenman çalışmalarıyla sağlandı.

Optimal hiperparametre yapılandırmaları, toplu boyut 8 ve öğrenme oranı 0.001 olarak kaydedildi; deneysel sonuçlarda belgelendiği üzere PH2 veri setinde 0.9585 ve ISIC2018 veri setinde 0.9044 zirve DSC elde edildi. Aşırı uyumu önlemek için yeterli doğrulama verisi sağlandı. Doğrulama kayıp eğrileri erken durma kriterleri uygulanarak izlendi.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Tıbbi görüntü segmentasyonu için HMP-MUNet mimari tasarımı

Önerilen HMP-MUNet mimarisi, otomatik deri lezyonu segmentasyon görevlerinde olağanüstü performans göstermiştir. Şekil 1 , hiyerarşik U şeklindeki kodlayıcı-kodlayıcı yapısını 8'den 256 kanala ilerleyerek göstermektedir. Üç özel modülün dönüşümlü konfigürasyonda entegrasyonu, hem yerel morfolojik özellikleri hem de kesin lezyon sınır belirlemesi için gerek...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Bu çalışma, HMP-MUNet (Yüksek Dereceli Çok Ölçekli Paralel Görüş Mamba U-Net) adlı yeni derin öğrenme çerçevesini sunar; deri lezyonu segmentasyonu için bilgisayar destekli teşhiste (CAD) temel zorlukları Durum-Uzay Modelleri (SSM'ler) ile gelişmiş mimari bileşenlerle yenilikçi entegrasyon yoluylaele alır 1. Burada açıklanan yaklaşım, yüksek dereceli özellik etkileşim mekanizmalarını çok ölçekli dikkat ve paralel işlemeyle birleştirmenin, klinik uygulama için krit...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Yazarlar, bu araştırmayla ilgili çıkar çatışmaları olmadığını belirtmektedir. Yazarlar ile bu el yazmasında sunulan çalışmayı uygunsuz şekilde etkileyebilecek herhangi bir ticari kuruluş arasında herhangi bir finansal ilişki yoktur. Bu araştırma bağımsız olarak yapılmış olup, bulgular ve sonuçlar yalnızca yazarlara aittir. Bu el yazmasının metni, yazarların ana dili İngilizce olmadığı için ChatGPT'nin yardımıyla revize edilip cilalandırılmıştır. Yazarlar, yapay zeka yardımının sadece dil düzenlemeyle sınırlı olduğunu ve çalışmanın bilimsel bütünlüğünü etkileyecek herhangi bir içerik üretimi veya analiz içermediğini doğrulamaktadır.

Teşekkürler

Yazarlar, bu araştırmayı mümkün kılan Liaoning Eyaleti Eğitim Bakanlığı Bilimsel Araştırma Projesi'nin Ulusal Doğa Bilimleri Vakfı 2024-MSLH-377 Genel Programı LJ212510149013 ve Grant kapsamında sağlanan mali desteği minnettarlıkla takdir etmektedir. Bu çalışmada kullanılan ve önerilen metodolojimizin kapsamlı doğrulanmasını sağlayan kamuya açık veri setlerine katkıda bulunan araştırma katılımcılarına ve kurumlara teşekkür ederiz.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
CUDA 11.8NVIDIA Corporation, Santa Clara, CA, ABDYazılım
GPU (32 GB VRAM)NVIDIAİşletim sistemi
ISIC2017 Veri SetiISIC Meydan Okumasıhttps://challenge.isic-archive.com/dataVeri setleri
ISIC2018 Veri SetiISIC Meydan Okumasıhttps://challenge.isic-archive.com/dataVeri setleri
NVIDIA V100 GPUNVIDIA Corporation, Santa Clara, CA, ABDDonanım
PH2 Veri SetiUniversidade Do Portohttps://www.fc.up.pt/addi/ph2Veri setleri
Python 3.8PythonRRID:SCR_018536Yazılım
PyTorch 1.13.0PyTorchRRID:SCR_018536Yazılım
Ubuntu 20.04KanonikDonanım

Kaynaklar

  1. Maurya, S., et al. A review on recent developments in cancer detection using machine learning and deep learning models. Biomed Signal Process Control. 80 (2), 104398(2023).
  2. Siegel, R. L., Miller, K. D., Wagle, N. S., Jemal, A. Cancer statistics, 2023. CA Cancer J Clin. 73 (1), 17-48 (2023).
  3. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542 (7639), 115-118 (2017).
  4. Haenssle, H. A., et al. against machine: diagnostic performance of a deep learning convolutional neural network for dermoscopic melanoma recognition in comparison to 58 dermatologists. Ann Oncol. 29 (8), 1836-1842 (2018).
  5. Argenziano, G., et al. Dermoscopy of pigmented skin lesions: results of a consensus meeting via the Internet. J Am Acad Dermatol. 48 (5), 679-693 (2003).
  6. Naeem, A., et al. SNC_Net: skin cancer detection by integrating handcrafted and deep learning-based features using dermoscopy images. Mathematics. 12 (7), 1030(2024).
  7. Celebi, M. E., et al. A state-of-the-art survey on lesion border detection in dermoscopy images. Dermoscopy Image Anal. 10, 97-129 (2015).
  8. Nachbar, F., et al. The ABCD rule of dermatoscopy: high prospective value in the diagnosis of doubtful melanocytic skin lesions. J Am Acad Dermatol. 30 (4), 551-559 (1994).
  9. Ronneberger, O., Fischer, P., Brox, T. U-net: convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  10. Gu, A., Dao, T. Mamba:linear-time sequence modeling with selective state spaces. arXiv. , (2023).
  11. Liu, Y., et al. Vmamba: visual state space model. Adv Neural Inf Process Syst. 37, 103031-103063 (2024).
  12. Zhang, J., Zhu, H., Wang, P., Ling, X. ATT squeeze U-net: a lightweight network for forest fire detection and recognition. IEEE Access. 9, 10858-10870 (2021).
  13. U-net v2: rethinking the skip connections of U-net for medical image segmentation. Peng, Y., Chen, D. Z., Sonka, M. 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, , (2025).
  14. Zhou, Z., et al. UNet++: a nested U-net architecture for medical image segmentation. Deep Learn Med Image Anal Multimodal Learn Clin Decis Support (2018). 11045, 3-11 (2018).
  15. Hu, S., Liao, Z., Xia, Y. Devil is in channels: contrastive single domain generalization for medical image segmentation. Medical Image Computing and Computer Assisted Intervention – MICCAI 2023. , Springer. Cham. (2023).
  16. Xu, W., Wang, Z. SCRNet:spatial-channel regulation network for medical ultrasound image segmentation. arXiv. arXiv. , (2025).
  17. Yue, Y., Li, Z. MedMamba: vision mamba for medical image classification. arXiv. , (2024).
  18. Efficiently modeling long sequences with structured state spaces. Gu, A., Goel, K., Ré, C. Proc Int Conf Mach Learn, 162, 8098-8109 (2022).
  19. Wu, R., Liu, Y., Liang, P., Chang, Q. UltraLight VM-UNet: parallel vision mamba significantly reduces parameters for skin lesion segmentation. arXiv. , (2024).
  20. Wu, R., Liu, Y., Liang, P., Chang, Q. H-vmunet:high-order vision mamba unet for medical image segmentation. Neurocomput. 624, 129447(2025).
  21. Fully convolutional networks for semantic segmentation. Long, J., Shelhamer, E., Darrell, T. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, , (2015).
  22. Chen, J., et al. TransUNet: transformers make strong encoders for medical image segmentation. arXiv. , (2021).
  23. Cao, H., et al. Swin-unet:unet-like pure transformer for medical image segmentation. Lect Notes Comput Sci. 13803, 205-218 (2023).
  24. Ibtehaz, N., Rahman, M. S. MultiResUNet: rethinking the U-net architecture for multimodal biomedical image segmentation. Neural Netw. 121, 74-87 (2020).
  25. Aruk, I., Pacal, I., Toprak, A. N. A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification. Expert Syst Appl. 283, 127721(2025).
  26. Pacal, I., et al. A novel CNN-ViT-based deep learning model for early skin cancer diagnosis. Biomed Signal Process Control. 104, 107627(2025).
  27. Zhang, D. Y., et al. Implementation of digital pathology and artificial intelligence in routine pathology practice. Lab Invest. 104 (9), 102111(2024).
  28. Malunet: a multi-attention and lightweight unet for skin lesion segmentation. Ruan, J., Xiang, S., Xie, M., Liu, T., Fu, Y. 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM), Las Vegas, NV, USA, , (2022).
  29. Wu, R., et al. Mhorunet:high-order spatial interaction unet for skin lesion segmentation. Biomed Signal Process Control. 88, 105517(2024).
  30. Pacal, I., Attallah, O. Hybrid deep learning model for automated colorectal cancer detection using local and global feature extraction. Knowl Based Syst. 319, 113625(2025).
  31. Pacal, I., Attallah, O. InceptionNeXt-transformer: a novel multi-scale deep feature learning architecture for multimodal breast cancer diagnosis. Biomed Signal Process Control. 110, 108116(2025).
  32. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  33. Phillips, M., et al. Assessment of accuracy of an artificial intelligence algorithm to detect melanoma in images of skin lesions. JAMA Netw Open. 2 (10), e1913436(2019).
  34. Wang, S., et al. Linformer:self-attention with linear complexity. arXiv. , (2020).
  35. A simple framework for contrastive learning of visual representations. Chen, T., et al. Proceedings of the 37th International Conference on Machine Learning, 119, Vienna, Austria. 1597-1607 (2020).
  36. Huang, S. C., et al. Fusion of medical imaging and electronic health records using deep learning: a systematic review and implementation guidelines. NPJ Digit Med. 3, 136(2020).
  37. Litjens, G., et al. A survey on deep learning in medical image analysis. Med Image Anal. 42, 60-88 (2017).
  38. Campanella, G., et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images. Nat Med. 25 (8), 1301-1309 (2019).
  39. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  40. McKinney, S. M., et al. International evaluation of an AI system for breast cancer screening. Nat. 577 (7788), 89-94 (2020).
  41. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

U Net MimarisiDurum Uzay Modelleriok l ekli lemeDikkat MekizmalarBilgisayar Destekli Tanznitelik kar mVision Mamba

İlgili makaleler