Yöntem makalesi

MixKNet: Tıbbi Görüntü Segmentasyonu için Hibrit Kanal Evrişimli Değiştirilmiş U-şekilli Bir Ağ

DOI:

10.3791/68450

15 Temmuz 2025

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, hibrit evrişim ve kanal dikkatini kullanarak gelişmiş segmentasyon doğruluğuna sahip hafif bir U-Net varyantı sunar ve MoNuseg ve GlaS'ta daha az parametreyle son teknoloji sonuçlar elde eder.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yapay sinir ağı tabanlı bilgisayar görüntü işleme teknolojisi son yıllarda hızla gelişti ve birden çok alanda yaygın uygulamalar buldu. Tıbbi görüntü işlemede, UNet ve varyantları lezyon tespiti, hücre segmentasyonu ve polip segmentasyonu görevlerinde büyük başarı göstermiştir. Bu araştırma, modelin öğrenme yeteneğini geliştirmek için ağ derinliğini azaltarak ve ağ kanallarını artırarak elde edilen azaltılmış ağ parametrelerine sahip değiştirilmiş U şeklinde bir ağ sunmaktadır. Derinlik sıkıştırmasının neden olduğu öğrenme kapasitesindeki azalmayı önlemek için, orijinal ağın evrişimli modülünün yerini alacak bir hibrit kanallı evrişimli modül tanıtıldı. Model, pratik kanal özelliği çıkarma yeteneğini geliştirmek için katman ile nokta evrişim katmanı arasında bir kanal dikkat mekanizması sunar. Makale ayrıca, karışık derinlikli evrişim kullanmanın segmentasyon hedefinin boyut aralığını etkili bir şekilde çözebileceği ve bir modelin birden çok veri setine uygun olmasını zorlaştırabileceği sonucuna varıyor. Önerilen model, sırasıyla %1,0 ve %1,37'lik bir ortalama zar artışıyla iki popüler halka açık veri seti olan MoNuseg ve GlaS üzerinde son teknoloji sonuçlar elde ediyor. Modifiye edilmiş modelin toplam parametreleri, 65,6 milyon parametreli UCtransNet'e kıyasla 38,6 katlık bir azalmayı temsil eden 1,71 milyona düşürülmüştür.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tıbbi görüntü segmentasyonu, tanı, tedavi planlaması ve hastalık izleme dahil olmak üzere çeşitli klinik uygulamalarda kritik öneme sahiptir. Özellik mühendisliği algoritmalarına dayalı geleneksel görüntü işleme yöntemleri, modern sağlık hizmeti ortamlarında üretilen büyük hacimli verileri işlemek için artık uygun değildir. Neyse ki, yapay sinir ağı teknolojisinin ilerlemesi ve bilgisayar donanım yeteneklerindeki gelişmeler, büyük ölçekli sinir ağı modellerinin eğitilmesini ve dağıtılmasını mümkün kılmıştır. Sonuç olarak, makine öğrenimi modellerine dayalı bilgisayarla görme işleme algoritmaları sürekli olarak geliştirilmekte ve çeşitli alanlarda uygulanmaktadır.

Tıbbi görüntülerin anlamsal segmentasyonunda en temsili model yapısı, kodlama-kod çözme mimarisine sahip UNet1'dir . Model, giriş görüntüsünden farklı ölçeklerin özelliklerini çıkarmak için önce çok seviyeli bir kodlayıcı kullanır. Ardından, kod çözücü, ilgili seviyenin kodlayıcısı tarafından çıkan anlamsal özellikleri bir atlama bağlantısı olarak birleştirirken adım adım örnekler oluşturur. Bununla birlikte, UNet mimarisinin performansı çeşitli yöntemler uygulanarak daha da geliştirilebilir. Örneğin, dikkat mekanizmalarının evrişimli sinir ağlarının performansını artırmada etkili olduğu gösterilmiştir. Bu mekanizmalar, girdi verilerindeki temel özellikleri seçici bir şekilde vurgulayarak daha iyi temsil öğrenimi ve segmentasyon doğruluğuna yol açabilir.

Şu anda, birçok araştırmacı, kod çözme aşamasında kodlayıcı tarafından çıkarılan özellikleri etkili bir şekilde birleştirmeye odaklanmaktadır. UNet'in en yaygın varyantlarından bazıları Attention UNet2, Recurrent UNet3 ve V-Net4'tür. Bu yaklaşımlar, özellik haritalarının bilgilendirici bölgelerini vurgulamak ve bilgilendirici olmayan bölgeleri bastırmak için uzamsal dikkat gibi dikkat mekanizmalarını5 kullanır. Ek olarak, bazı varyantlar, tıbbi görüntülerin sıralı doğasını modellemek ve özellik temsillerini iyileştirmek için tekrarlayan sinir ağları içerir. VGG6, ResNet7 ve DenseNet8 gibi ön eğitim modelleri, büyük ölçekli veri kümelerinden öğrenilen zengin bilgilerinden yararlanarak U şeklindeki ağların performansını artırmak için yaygın olarak kullanılmaktadır. Ek olarak, kendi kendine dikkat ve çok kafalı dikkat gibi transformatör mekanizmaları, uzun vadeli model bağımlılıklarına tanıtıldı ve küresel bağlamsal bilgileri yakalayarak daha iyi segmentasyon performansına yol açtı.

Bununla birlikte, bu varyantlar orijinal UNet1'e göre geliştirilmiş olsa da, değişen ölçek ve şekillere sahip karmaşık tıbbi görüntülerin işlenmesinde hala belirli sınırlamaları vardır. Ayrıca, bu varyantların artan karmaşıklığı genellikle daha yüksek hesaplama maliyetlerine ve daha uzun eğitim sürelerine yol açar ve bu da pratik ortamlarda uygulanabilirliklerini sınırlar.

UNet1 mimarisini geliştirmek için, öğrenme kapasitesini artırmak için kanal sayısını artırırken ağ derinliğini azaltan MixKNet (Mix Kernel Size U-shape Net) adlı değiştirilmiş bir model önerilmiştir. Bununla birlikte, derinlikteki azalma genel performansta bir düşüşe neden olabilir. Bu sorunu azaltmak için, orijinal evrişimli nöral modülün yerini alan bir hibrit kanallı evrişimli modül tanıtıldı. Bu modül, modelin etkili kanal özelliklerini çıkarma yeteneğini güçlendirmeyi amaçlayan, derinliksel ve noktasal evrişim katmanları arasında bir kanal dikkat mekanizması içerir.

Pratik uygulanabilirliğe rehberlik etmek için, önerilen yöntemin, 500 ×ila 500 ila 1000 × 1000 piksel arasında değişen bireysel görüntü çözünürlüklerine sahip nispeten küçük ölçekli tıbbi görüntü veri kümelerinde değerlendirildiğine dikkat etmek önemlidir. Model eğitimi için tüm görüntüler 224 × 224 piksel olarak yeniden boyutlandırıldı. Uygulama, tek bir NVIDIA RTX 3090 GPU üzerinde PyTorch kullanılarak gerçekleştirildi. Bu operasyonel parametreler, yöntemin orta düzeyde deney kurulumları için hesaplama açısından uygulanabilir olduğunu ve sınırlı veri kümesi boyutlarına uyarlanabilir olduğunu göstermektedir.

Sonuç olarak, bu makale U şeklindeki ağ yapısında yeni bir değişiklik sunmakta ve her ikisi de tıbbi görüntü veri kümelerinde segmentasyon performansını artıran bir kanal dikkat mekanizması ile birlikte bir hibrit kanal evrişim modülünü tanıtmaktadır. Bu çalışmanın ana katkıları aşağıdaki gibidir: (1) Orijinal evrişimli nöral modülün yerini alan hibrit derin bilge evrişim modülü ile değiştirilmiş U şeklinde bir ağ yapısı önermek. (2) Modelin etkili kanal özelliği çıkarma yeteneğini geliştirmek için derin bilge ve nokta bilge evrişim katmanı arasında bir kanal dikkat mekanizmasının tanıtılması. (3) MoNuseg9 nükleer segmentasyon veri setindeki iki popüler genel veri setinde aynı anda en son teknoloji ürünü sonuçların elde edilmesi, önemli ölçüde daha az model parametresi (64M parametreli UCtransNet10 ile karşılaştırıldığında) ve GlaS11 bezi segmentasyon veri setinde iyileştirilmiş performans.

Bu makalenin geri kalanı aşağıdaki gibi düzenlenmiştir. Adım 2, UNet1 ile ilgili önceki çalışmaların ve tıbbi görüntü segmentasyonundaki varyasyonlarının kapsamlı bir incelemesini sağlar. Mevcut yaklaşımların güçlü yönleri ve sınırlılıkları, dikkat mekanizmaları, karışık derinlikli evrişimli ağlar ve bunların segmentasyon modellerindeki uygulamaları ile ilgili çalışmalarla birlikte incelenmektedir. Adım 3, UNet yapısında yapılan değişiklikler, bir kanal dikkat mekanizmasının entegrasyonu ve karışık derinlikli evrişim kullanımı dahil olmak üzere önerilen MixKNet modelinin mimarisini detaylandırır. Adım 4, her bir bileşenin katkılarını değerlendirmek için bir tartışma ve bir ablasyon çalışması eşliğinde kapsamlı deneylerin sonuçlarını raporlar. Son olarak, 5. adım makaleyi sonlandırır ve gelecekteki araştırmalar için potansiyel yönleri ana hatlarıyla belirtir.

Bu bölüm, UNet ve tıbbi görüntü segmentasyonundaki varyantları ile ilgili önceki çalışmaların gözden geçirilmesiyle başlamakta ve mevcut yöntemlerin güçlü yönlerini ve sınırlamalarını özetlemektedir. Ayrıca, dikkat mekanizmaları ve bunların segmentasyon modellerindeki uygulamaları ile ilgili araştırmalar tartışılmaktadır. Segmentasyon performansını artırmak için derinlemesine evrişim tekniklerini içeren son gelişmeler de incelenmektedir. Önerilen MixKNet (c) ve diğer modellerin karşılaştırmalı bir analizi, kesikli çizgilerin atlama bağlantılarını gösterdiği Şekil 1'de sunulmuştur.

UNet ve varyasyonları
UNet mimarisi ilk olarak 2015yılında Ronneberger ve ark. 1 ve o zamandan beri tıbbi görüntü segmentasyonunda yaygın olarak kullanılmaktadır. Model, bir kodlama yolu ve bir kod çözme yolundan oluşur. Kodlayıcı, giriş görüntüsünden üst düzey özellikleri ayıklarken, kod çözücü yukarı örnekler oluşturur ve bir segmentasyon haritası oluşturmak için özellikleri birleştirir. O zamandan beri, tıbbi görüntü segmentasyonundaki performansını iyileştirmek için UNet mimarisinde çeşitli değişiklikler yapıldı. En yaygın değişikliklerden biri, segmentasyonun doğruluğunu artırdığı gösterilen atlama bağlantılarının tanıtılmasıdır. Zhou ve ark.12 , modelin uzamsal bilgileri daha iyi korumasına olanak tanıyan yoğun atlama bağlantıları kullanan bir UNet varyantı önerdi.

UNet mimarisinde yapılan bir diğer popüler değişiklik, dikkat mekanizmalarının eklenmesidir. Bu mekanizmalar, modelin en önemli özellikleri seçici olarak vurgulamasına yardımcı olarak daha iyi temsil öğrenimi ve segmentasyon doğruluğuna yol açabilir. Dikkat mekanizmalarına sahip varyantların bazı örnekleri arasında Attention UNet2, dikkat kapıları13 ile ResUNet ve dikkat kapıları14 ile Dense-UNet bulunur. Yukarıdaki değişikliklere ek olarak, tıbbi görüntü segmentasyonu için UNet mimarisinin birçok başka varyantı önerilmiştir. UCTransNet10 , atlama bağlantıları ve bir Transformatör modülü içeren U-Net mimarisinin bir çeşididir. UCTransNet10'daki atlama bağlantıları, özelliklerin daha iyi yeniden kullanılmasına izin veren ve parametre sayısını azaltan kanal bazında bir perspektiften yeniden düşünülmüştür. Uzun menzilli bağımlılıkları yakalamak ve çeviri kalitesini artırmak için Transformer modülü eklenmiştir. UCTransNet10'un çeşitli makine çevirisi karşılaştırmalarında son teknoloji sonuçlar elde ettiği gösterilmiştir. Zihan ve arkadaşları, LViT15 adlı bir derin öğrenme modeli önerdiler ve bu modeli tıbbi görüntü analizi görevlerine uyguladılar. LViT15'in yarı denetimli sürümünü genişletmek ve görüntü verilerindeki kalite eksikliğini telafi etmek için Üstel Sahte Etiket Yineleme mekanizmasını (EPI) önerdiler. Ek olarak, görüntülerin yerel özelliklerini korumak için, seçici olarak önemli görüntü özelliklerine odaklanan Piksel Düzeyinde Dikkat Modülünü (PLAM) önerdiler.

Dikkat mekanizması
Dikkat mekanizmaları, makine öğreniminde, özellikle doğal dil işleme ve bilgisayarla görmede geniş çapta incelenmiştir. Son yıllarda, görüntü segmentasyonu da dahil olmak üzere tıbbi görüntü analizi görevlerine dikkat mekanizmaları da uygulanmıştır. Bahdanau ve ark.16 , çevirinin kalitesini artırmak için nöral makine çevirisinde bir dikkat mekanizması tanıttı. Mekanizma, modelin giriş dizisinin ilgili bölümlerine seçici olarak odaklanmasına olanak tanıyarak çeviri kalitesini artırır. O zamandan beri, görüntü analizi görevleri için çeşitli dikkat mekanizmaları önerilmiştir. Yaygın bir dikkat mekanizması türü, özellik haritasındaki her piksele önemine bağlı olarak bir ağırlık uygulanmasını içeren uzamsal dikkat mekanizmasıdır. Örneğin, Guo ve ark.17 , retinal damar segmentasyonu görevi için uzamsal bir dikkat mekanizması önerdi. Mekanizma, uzamsal özelliklerin ağırlığını ayarlamak için bir geçit mekanizması kullanır ve modelin kap ve damar olmayan pikseller arasında ayrım yapma yeteneğini geliştirir. Başka bir dikkat mekanizması türü, kanallar arasındaki özellik haritalarının ağırlıklarını ayarlamaya odaklanan kanal dikkatidir. Hu ve ark.18 , özellik haritalarına kanal bazında dikkat uygulayan ve görüntü sınıflandırma görevinin performansını artıran bir sıkıştırma ve uyarma ağı (SENet) önerdi. Daha yakın zamanlarda, dikkat mekanizmaları, görüntü segmentasyon görevleri için evrişimli sinir ağları (CNN'ler) ile birleştirilmiştir. Örneğin, Chen ve ark.19 , beyin tümörü segmentasyonu için uzamsal ve kanal bazında dikkat mekanizmalarını birleştiren dikkat güdümlü bir ağ önerdi.

Tıbbi görüntü analizi ve uzaktan algılama için yarı denetimli ve çok modlu öğrenmedeki son gelişmeler, umut verici performans iyileştirmeleri göstermiştir. Yang ve ark.20 , modaliteler arası üretken öğrenme ve yarı denetimli stratejilerden yararlanan yeni bir eşleştirilmemiş çok modlu segmentasyon çerçevesi olan UMSCS'yi önerdi. Zhang ve ark. birkaç son teknoloji teknik tanıttı: yarı denetimli segmentasyon21 için kanıta dayalı olarak geliştirilmiş üç dallı tutarlılık modeli, tıbbi görüntü segmentasyonu22 için kendi kendini tanıyan ve çapraz örneklem prototipik öğrenme çerçevesi ve havacılık alanında sentetik açıklıklı radar (SAR) sıkışma tanıma için zaman-frekansa duyarlı hiyerarşik özellik optimizasyonu yaklaşımı23. Bu çalışmalar toplu olarak, hem tıbbi hem de mühendislik görüntüleme görevlerinde hibrit denetimin ve alana duyarlı özellik modellemenin önemini vurgulamaktadır.

Derinlik bilge evrişim
Derinlik açısından evrişim, giriş özelliği haritalarında kanal bazında korelasyonları yakalamak için tasarlanmıştır ve evrişimli sinir ağlarının verimliliğini ve doğruluğunu iyileştirdiği gösterilmiştir.

En eski ve en etkili derinlik bilge evrişim modellerinden biri, Howard ve arkadaşları tarafından 2017'de önerilen MobileNet 24'tür. MobileNet, evrişimli katmanlar için gereken parametre ve hesaplama sayısını azaltmak için derinlik açısından ayrılabilir evrişim ve ardından nokta bazında evrişim uygulayan derinlik açısından ayrılabilir evrişim kullanır. Bu, MobileNet'in geleneksel evrişimli sinir ağlarından önemli ölçüde daha az parametre kullanırken görüntü sınıflandırma görevlerinde son teknoloji doğruluk elde etmesini sağlar. MobileNet'in piyasaya sürülmesinden bu yana, ShuffleNet25, Xception26 ve ResNeXt27 dahil olmak üzere bir dizi başka derinlik bilge evrişim mimarisi önerilmiştir. Bu modeller, derinlemesine evrişimin özel uygulamalarına göre değişir, ancak tümü, doğruluğu korurken veya geliştirirken evrişimli katmanların hesaplama karmaşıklığını azaltma hedefini paylaşır. Büyük ölçekli evrişimli katmanların hesaplama ve bellek gereksinimlerini azaltmak için derinlemesine ayrılabilir evrişim kullanan PSPNet28 gibi modellerle, anlamsal segmentasyon görevine de derin evrişim uygulanmıştır. MixNet29, farklı ölçeklerdeki özellikleri yakalamak için birden çok çekirdek boyutu kullanan karışık bir derinlik evrişimi sunarak derin evrişim fikrini daha da genişletir. Karşılaştırılabilir parametreleri ve FLOP'ları korurken diğer son teknoloji modellerden daha iyi performans gösterdiği gösterilmiştir. Bu modeller, çeşitli anlamsal segmentasyon görevlerinde geleneksel evrişimli sinir ağlarına göre doğruluk ve verimlilikte önemli gelişmeler göstermiştir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu bölüm, tıbbi görüntü segmentasyonu için önerilen MixKNet mimarisini açıklamaktadır. MixKNet modeli, dikkat mekanizmalarını ve karışık derinlikli evrişim katmanlarını birleştirerek UNet mimarisini genişletir. Bu çalışmada kullanılan yazılım Malzeme Tablosu'nda listelenmiştir.

1. Genel mimari

  1. Şekil 2'de gösterilen MixKNet mimarisi, bir kodlayıcı ve bir kod çözücüden oluşan standart UNet yapısını takip eder. Giriş şeklini 224 × 224 × 3 olarak ayarlayın. Kodlayıcıda, her biri 1×1 derinlik evrişimi, 2×2 maksimum havuzlama katmanı ve [1, 35] veya [3-13] gibi çekirdek boyutlarına sahip çok çekirdekli bir evrişim (MDConv) içeren iki DownBlock modülü kullanın.
  2. Kod çözücüde iki UpBlock modülü kullanın - her biri çift doğrusal yükseltme, atlama bağlantı birleştirme, 1×1 derinlik evrişimi ve çok çekirdekli evrişim gerçekleştirir.
  3. Her evrişimli bloktan sonra ReLU aktivasyonlarını kullanın. Çıktıyı üretmek için son bir 1×1 evrişim uygulayın, ardından ikili segmentasyon için bir Sigmoid aktivasyonu uygulayın veya çok sınıflı görevlerde harici Softmax için etkinleştirilmeden bırakın.

2. Düzleştirilmiş U şekli

NOT: Hesaplama karmaşıklığını ve model boyutunu azaltmak için sinir ağı mimarisinin derinliğini azaltın ve bunun karmaşık veri temsillerini öğrenme kapasitesini azaltabileceğinin farkında olun.

  1. Çekirdek kodlama ve kod çözme bileşenlerini korurken model parametrelerinin sayısını azaltmak için dört seviyeli bir UNet mimarisini Şekil 3'te gösterildiği gibi iki seviyeli bir sürüme düşürün.
    1. Hem kodlayıcı hem de kod çözücü yollarından düzey 3 ve 4'ü kaldırarak düzleştirilmiş mimariyi oluşturun ve özellik bağlantılarını düzey 2'de koruyun.
    2. Altörnekleme ve yukarı örnekleme işlemlerini, azaltılmış derinlikle eşleşecek şekilde ayarlayın - darboğazdan önce yalnızca bir altörnekleme adımı ve bir yukarı örnekleme adımından sonra kullanın.
      NOT: Derinlikteki bu azalma, girdi ve çıktı arasındaki karmaşık ilişkileri yakalayamayabileceğinden modelin öğrenme yeteneğini azaltabilir. Her model katmanındaki temel evrişim kanallarının sayısını artırmak, modelin ayırt edici özellikleri öğrenme kapasitesini artırarak bu sınırlamanın üstesinden gelmeye yardımcı olabilir. Daha fazla evrişim kanalıyla model, giriş verilerinde daha karmaşık desenler ve ilişkiler yakalayabilir, bu da azalan derinliği telafi eder ve performansı artırır.
  2. Evrişim kanallarının sayısını artırmanın, modelin hesaplama karmaşıklığını ve bellek kullanımını da artırabileceğini, eğitim ve çıkarım hızı ile bir denge sunabileceğini düşünün. Model kapasitesi ve hesaplama verimliliği arasında uygun bir denge bulun.

3. Kodlayıcı için çekirdek boyutunu karıştırın

  1. Kodlayıcı performansını artırmak için, Şekil 4'te gösterildiği gibi DC-CA (Derinlemesine Evrişim ve Kanal Dikkati) modülünde karışık bir çekirdek boyutu yaklaşımı kullanın. Tek bir çekirdek boyutuna güvenmek yerine, birden çok alıcı alandaki özellikleri çıkarmak için değişen çekirdek boyutlarına (örneğin, 1, 3, 5, 7, 9, 11, 13) paralel olarak birden çok derinlemesine evrişim uygulayın.
  2. Birleştirmeden önce her dala ayrı ayrı toplu normalleştirme ve ReLU etkinleştirmesi uygulayın. Kanal boyutu boyunca her çekirdek dalından gelen çıktıları birleştirin.
  3. Özellikleri birleştirmek için birleştirmeden sonra noktasal 1×1 evrişim kullanın ve bunları sabit sayıda çıkış kanalına yansıtarak sonraki katmanın beklenen giriş boyutuyla tutarlılığı koruyun.
    NOT: Karışık derinliksel evrişim katmanı, değişen çekirdek boyutlarına sahip birden çok derinliksel evrişimden ve ardından noktasal bir evrişimden oluşur. Bu tasarım, tıbbi görüntü segmentasyon görevlerinde kritik olan farklı ölçeklerde özelliklerin yakalanmasını sağlar. İlk modül, alıcı alanı artırmak için 1, 3 ve 5 olmak üzere üç çekirdek boyutu kullanırken, ikinci modül daha büyük çekirdek boyutları ve daha fazla grup, özellikle 3, 5, 7, 9, 11 ve 13 kullanır.

4. Dikkati kanalize edin

  1. Özellik gösterimini geliştirmek için DC-CA modülüne bir kanal dikkat mekanizması entegre edin.
    1. Kanal bazında dikkat haritaları oluşturmak için "aynı" dolgulu 1×1 evrişim kullanın. Her kanal için kompakt bir tanımlayıcı oluşturmak için uzamsal boyutlar arasında genel ortalama havuzlama uygulayın.
    2. Aralarında bir ReLU aktivasyonu olan iki 1×1 evrişimden oluşan hafif bir evrişimli ağ kullanın. Kanallar arasında ağırlık paylaşımından kaçının ve kanal başına benzersiz dikkat ağırlıklarını öğrenin.
    3. Normalleştirilmiş dikkat puanları elde etmek için son çıktıya bir sigmoid aktivasyonu uygulayın. Kanal bazında çarpma yoluyla giriş özelliği haritalarını yeniden ağırlıklandırın.
      NOT: Giriş tensörü x olsun. Kanal dikkati aşağıdaki ifade ile uygulanır:
      (dikkat)_tensor = σ(conv(ReLU(conv(x)))) (1)
      burada σ sigmoid aktivasyon fonksiyonunu temsil eder, conv evrişim işlemidir ve ReLU doğrultulmuş doğrusal birim aktivasyon fonksiyonudur.
  2. Dikkat tensörü üzerinde uyarlanabilir bir ortalama havuzlama işlemi gerçekleştirerek ve ardından farklı bir çekirdek boyutu y ile evrişimden sonra çıkış tensörünün boyutuyla eşleşecek şekilde genişleterek dikkat haritasını elde edin :
    dikkat = genişlet(avg_pool([dikkat]_tensor),boyut(y)) (2)
  3. Dikkat haritası ile giriş tensörü y'nin eleman bazında çarpımını gerçekleştirerek çıkış tensörü z'yi hesaplayın:
    z = z * dikkat (3)
    burada * eleman bazında çarpmayı temsil eder

5. Veri kümeleri

NOT: Bu çalışmada Tablo 1 ve Tablo 2'de sunulduğu gibi halka açık iki tıbbi görüntü veri seti kullanılmıştır: GlaS (Sirinukunwattana ve ark.11) ve MoNuSeg (Kumar ve ark.9).

  1. Dijital bir patoloji tarayıcısı kullanılarak elde edilen ve doku örnekleri içindeki tek tek glandüler yapıları segmentlere ayırmak için manuel olarak açıklama eklenen Bez Segmentasyonu veri setini (Sirinukunwattana ve ark.11) kullanın.
    NOT: Veri seti, her biri 500 × 500 piksel çözünürlüğe sahip 165 görüntüden ve karşılık gelen temel gerçek segmentasyon maskelerinden oluşur. MoNuSeg veri seti (Kumar ve ark.9), her biri 1000 × 1000 piksel çözünürlüğe sahip 51 mikroskobik çekirdek görüntüsünden oluşur.

6. Uygulama ayrıntıları

  1. Modeli PyTorch kullanarak tek bir NVIDIA RTX 3090 GPU'da uygulayın. İşletim sistemi olarak Ubuntu 22.04 kullanın.
  2. Tüm giriş görüntülerini 224 × 224 piksellik sabit bir boyuta yeniden boyutlandırın. Eğitim çeşitliliğini artırmak için veri artırma tekniklerini uygulayın.
    1. Büyütmeleri şu sırayla rastgele uygulayın: yatay çevirme → dikey çevirme → döndürme → gama düzeltmesi → logaritmik dönüştürme → rastgele ölçekleme.
    2. 0,5 olasılıkla rastgele yatay çevirmeler, 0,5 olasılıkla dikey çevirmeler ve 0,5 olasılıkla ±15 derece içinde döndürmeler uygulayın.
    3. 0,3 olasılıkla gama düzeltmesi, 0,3 olasılıkla logaritmik dönüşüm ve 0,3 olasılıkla uygulanan 0,9 ile 1,1 arasında bir ölçeklendirme faktörü ile rastgele ölçeklendirme uygulayın.
    4. [0,485, 0,456, 0,406] ortalama değerlerini ve [0,229, 0,224, 0,225] standart sapmalarını kullanarak görüntüleri normalleştirin.
  3. Modeli, 0,001 öğrenme oranı ve 4 toplu iş boyutu ile Adam iyileştiricisini kullanarak eğitin. Öğrenme oranı programına değişkenlik katmak ve yerel optimuma yakınsamayı önlemek için Sıcak Yeniden Başlatmalarla Kosinüs Tavlama öğrenme oranı çizelgeleme tekniğini kullanın.
    NOT: PyTorch'un yerleşik torch.optim.lr_scheduler kullanın. CosineTavingWarmRestarts zamanlayıcısı. Optimize edici ve zamanlayıcı aşağıdaki gibi uygulandı:
    optimize edici = torch.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    zamanlayıcı = torch.optim.lr_scheduler. CosineTavingWarmRestarts(
    optimize edici, T_0=10, T_mult=2, eta_min=1E-6)
    Burada, T_0=10 ilk yeniden başlatmadan önceki dönem sayısını gösterir, T_mult=2 her döngüden sonra yeniden başlatma süresini iki katına çıkarır ve eta_min=1e-6 minimum öğrenme oranını belirler. Her dönemin sonunda scheduler.step() öğesini çağırarak öğrenme oranını güncelleyin.
  4. Kayıp fonksiyonu olarak ikili çapraz entropi kullanın. Aşırı öğrenmeyi önlemek için erken durdurma uygulayın. Modeli en fazla 5000 dönem için eğitin.
  5. Birleşim Üzerinden Ortalama Kesişim (mIoU) ve Zar katsayısını kullanarak model performansını değerlendirin.
    Zar =(2|A∩B|)/(|Bir|+|B|) (4)
    IoU=(|A∩B|)/(|A∪B|) (5)
    NOT: mIoU, tahmin edilen ve temel gerçek segmentasyon maskeleri arasındaki kesişimin birleşimlerine oranıdır. Aynı zamanda, Zar katsayısı, kesişimin iki katının tahmin edilen ve temel gerçek segmentasyon maskelerinin toplamına oranıdır.
  6. Üç tur 5 katlı çapraz doğrulama kullanarak küçük veri kümeleri üzerinde titiz bir değerlendirme yapın ve toplam 15 değerlendirme elde edin. Kıvrımlar arasında değişkenliği sağlamak için her turda çapraz doğrulama bölümlerini rastgele karıştırın. Her katta etiket dengesini korumak için kıvrımları sınıf dağılımlarına göre katmanlandırın.
  7. Yerel optimuma yakınsama riskini azaltmak için kıvrımlar arasında ortalama performansı hesaplayın. Önerilen yaklaşımın karşılaştırılabilir yöntemlere göre istatistiksel olarak anlamlı iyileştirmeler sağladığını göstermek için istatistiksel bir test yapın.
  8. Segmentasyon kalitesindeki aşamalı iyileşmeyi göstermek için Şekil 5'te eğitim sırasında temsili doğrulama tahminlerini gösterin. Eğitim tamamlandıktan sonra, doğrulama performansına (örneğin, en yüksek mIoU ve Zar puanı) göre en iyi performans gösteren model kontrol noktasını yükleyin.
    1. Kaydedilen parametreleri kullanarak tahmin edilen segmentasyon maskeleri oluşturmak için modeli doğrulama kümesinde çalıştırın.
    2. Giriş görüntüsünü, temel doğruluk maskesini ve tahmin edilen maskeyi yan yana biçimde görüntüleyerek Matplotlib kullanarak sonuçları görselleştirin.
    3. Görselleştirmede temsili bölgeleri kırmızı kutularla işaretleyerek önerilen yöntemin segmentasyon performansındaki üstünlüğünü vurgulayın.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En gelişmiş yöntemlerle karşılaştırma
MixKNet mimarisi, GlaS ve MoNuSeg olmak üzere iki tıbbi görüntü segmentasyon veri seti üzerinde değerlendirilmiş ve sahadaki en son yöntemlerle karşılaştırılmıştır. Değerlendirme, Tablo 3'te



Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, tıbbi görüntü segmentasyonu için UNet1 mimarisinin yeni bir modifikasyonu olan MixKNet'i, hesaplama karmaşıklığını önemli ölçüde azaltırken segmentasyon performansını artırmak için karışık derinlikli evrişim ve bir kanal dikkat mekanizmasını entegre ederek sunmaktadır. Hibrit kanal evrişimi, ayrı kanal gruplarında çalışan birden çok evrişimli çekirdeği birleştirir. Bu tasarım, ağın aynı katman içinde farklı alıcı alan ölçeklerinde çeşitli uzamsal ve ba...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, rekabet eden finansal çıkarlar veya diğer çıkar çatışmaları olmadığını beyan ederler.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ningbo Şehri'nin 2023 Sosyal Refah Araştırma Projelerinin ikinci partisi: Ontoloji ve NLP'ye Dayalı Telekom Ağı Dolandırıcılığı Tespiti için Temel Teknolojilerin Araştırılması ve Uygulanması (2023S169).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Linux İşletim Sistemi (Ubuntu 22.04)  Çeşitli (Açık Kaynak Topluluğu)N/A(Sürüm 22.04 LTS)Geliştirme için açık kaynaklı işletim sistemi
https://releases.ubuntu.com/22.04/
NVIDIA RTX 3090 GPUNVIDIA3090Derin öğrenme için yüksek performanslı GPU
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationN/A (Sürüm &; ge; 3.8)AI/ML geliştirme için programlama dili
https://www.python.org/
PyTorchMeta AIN/A (Sürüm 1.13)Açık kaynak makine öğrenimi çerçevesi
https://pytorch.org/
Visual Studio Code (VS Code)MicrosoftN/AHafif ve güçlü kod düzenleyici
https://code.visualstudio.com/

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

U Net VaryantlarKanal Dikkat MekanizmasKarma Derinlikli Konvol syonLezyon TespitiH cre SegmentasyonuPolip SegmentasyonuModel Parametre Azalt mznitelik kar m
Video yakında

İlgili makaleler