Bu içeriği görüntülemek için JoVE aboneliğiniz gereklidir. Giriş yapın veya ücretsiz denemenizi bugün başlatın.

Yöntem makalesi

Kolorektal Prekanser Lezyon Teşhisi için Pinwheel Konvolüsyonu ve Çift Dikkat Temelli Poyp Segmentasyon Ağı

51 görüntülenme

DOI:

10.3791/71178

26 Haziran 2026

* These authors contributed equally

Bu makalede

Özet

Bu protokol, kolorektal polipleri segment etmek için pinwheel konvolüsyon, çift dikkat ve çok ölçekli füzyon entegre eden U şeklinde derin öğrenme ağı uygular.

Özet

Kolorektal poliplerin doğru segmentasyonu, kolorektal kanserin erken önlenmesi ve teşhisi için çok önemlidir. Ancak, poliplerin şekil, boyut ve doku açısından yüksek heterojenliği ile bağırsak ortamının karmaşıklığı (kıvrımlar, speküler yansımalar ve dışkı kalıntıları gibi) nedeniyle, mevcut yöntemler sınır lokalizasyonu ve küçük polip tespitinde hâlâ önemli zorluklarla karşı karşıyadır. Bu sorunları ele almak için, bu makale Pinwheel Konvolüsyonu ve Çift Dikkat (PWD-Net) temelli bir Polyp Segmentasyon Ağı önermektedir. Önerilen ağ, çok katmanlı yerel özellikleri çıkarmak için önceden eğitilmiş bir ResNet'in kodlayıcı olarak kullanıldığı U şeklinde kodlayıcı–kodlayıcı mimarisi benimser. Özellikle, dar boğaz katmanında poliplerin küresel geometrik yapısını ve çok yönlü bağlamsal bilgisini çok açılı dönmüş konvolüsyon çekirdekleri aracılığıyla yakalamak için bir Pinwheel Konvolüsyon Modülü (PCM) tanıtılır. Kanal dikkati ve mekânsal dikkati entegre eden Çift Dikkat Mekanizması (DAM), arka plan gürültüsünü adapte edici şekilde bastırmak ve polip bölgesi özelliklerini artırmak için tasarlanmıştır. Ayrıca, derin anlamsal bilgiyi sığ sınır detaylarıyla birleştiren Çok ölçekli Özellik Birleşimi (MSF) stratejisi uygulanarak segmentasyon sonuçlarının hem tamlığını hem de hassasiyetini garanti eder. Kvasir-SEG ve CVC-ClinicDB veri setleri üzerinde yapılan deneyler, PWD-Net'in ortalama zar katsayıları sırasıyla 0.865 ve 0.944 ile IoU puanları 0.765 ve 0.892 olarak elde ettiğini ve mevcut en son yöntemleri önemli ölçüde geride bıraktığını göstermektedir. Ablasyon çalışmaları her modülün etkinliğini doğrular, veri kümeleri çapraz değerlendirmeler ise modelin güçlü genelleştirme yeteneğini doğrular. Bu çalışma, klinik polip segmentasyonu için yüksek hassasiyetli ve sağlam bir çözüm sunar; kolorektal prekanser lezyonlarının erken teşhisi için önemli bir değer sunar ve bilgisayar destekli müdahaleyi destekler.

Giriş

Kolorektal kanser, dünya genelinde en yaygın malign tümörlerden biridir ve sürekli yüksek insidans ve ölüm oranlarına sahiptir. Çalışmalar, kolorektal kanserlerin çoğunun adenomatoz poliplerden geliştiğini göstermiştir; bu süreç genellikle 10–15 yıl sürer ve erken tespit ve müdahale için değerli bir zaman aralığı sağlar. Adenom tespit oranında (ADR) %1 artış, kolorektal kanser riskini yaklaşık %3 azaltabilir ve hasta ölümünü önemli ölçüdedüşürür 1. Kolonoskopi, kolorektal kanser taramasında altın standart olarak kabul edilir ve muayene sırasında poliplerin doğrudan çıkarılmasını sağlar ve böylece kanser sisidanlığını ve ölümünü etkili bir şekilde azaltır.

Ancak, geleneksel kolonoskopi büyük ölçüde endoskopistlerin deneyim ve beceri seviyesine bağlıdır. Öznel yargı, görsel yorgunluk ve dikkat dağınıklığı gibi faktörler, doğrudan tarama etkinliğini etkileyen %20–%30 kaçırma oranına yolaçabilir 2. Bu nedenle, kolorektal poliplerin otomatik segmentasyonu için bilgisayar destekli tespit (CAD) sistemlerinin geliştirilmesi, ADR'yi iyileştirmek ve kaçırılan tanıları azaltmak için önemli bir öneme sahiptir. Son klinik anketler, yapay zekanın endoskopik lezyon değerlendirme iş akışlarına entegre edilmesine olan ilgiyi daha da vurgulamış ve sağlam ve tekrarlanabilir segmentasyon yöntemlerine olan ihtiyacıpekiştirmiştir 3.

Son yıllarda, derin öğrenme tıbbi görüntü analizinde, özellikle görüntü segmentasyon görevleri için özellik çıkarma ve temsil etme konusunda güçlü yetenek gösteren konvolüsyon sinir ağlarında (CNN) dikkat çekici ilerlemelerkaydetmiştir 4. Klasik bir tıbbi görüntü segmentasyon modeli olarak, U-Net, doğru piksel düzeyinde segmentasyon sağlamak için simetrik kodlayıcı–kodlayıcı mimarisi ve atlama bağlantıları kullanır ve bu alanda bir kıyaslama halinegelir 5. U-Net üzerine inşa edilerek, karmaşık tıbbi görüntü segmentasyon görevlerini çözmek için birçok geliştirilmiş mimari önerilmiştir. UNet++, iç içe ve yoğun atlama bağlantıları getirerek kodlayıcı ve kodlayıcı özellik haritaları arasındaki anlamsal boşluğuazaltır 6. ResUNet++ kalıntı blokları, sıkıştırma ve uyarılma modüllerini, genişletilmiş konvolüsyonları ve dikkat mekanizmalarını entegre ederek polipsegmentasyonunda güçlü performans sağlar 7. U2-Net, çok ölçekli özellik bilgisini yakalamak için iki seviyeli, iç içe U-şekilli bir yapıbenimser 8. Daha yakın zamanda, paralel kodlama ve çözme yollarını kullanarak segmentasyon doğruluğunu daha da artıran çift kodlayıcı-kodlayıcı tabanlı derin polip segmentasyon ağıönerilmiştir9.

Bu arada, dikkat mekanizmalarının tanıtılması özellik geliştirme ve gürültü bastırma için yeni çözümler sunuyor. Dikkat U-Net, hedef bölgelere odaklanmak için dikkat kapıları kullanırken, alakasız arka plan bilgilerinibastırır 10. Çift Dikkat Ağı (DANet), hem kanal hem de mekansalboyutlardan özellikleri uyarlayarak kritik özelliklerin algılanmasını iyileştirir. Üçlü Dikkat Ağları (TANet), çok ölçekli özelliklerin adaptif seçimi yoluyla segmentasyon performansını daha da artırır12.

Transformer mimarilerinin doğal dil işleme ve bilgisayar görme13'teki başarısıyla birlikte, araştırmacılar tıbbi görüntü segmentasyonunda uygulamalarını araştırmaya başladılar. TransUNet, uzun menzilli bağımlılıkları etkili şekilde modellemek için bir Transformer kodlayıcı olarak ilk kezkullanan 14 oldu. Swin-UNet, saf bir Transformer mimarisini benimser ve kaydırılmış penceremekanizması 15 aracılığıyla verimli küresel bilgi toplama sağlar. UTNet, CNN'lerin yerel özellik çıkarma yeteneğini Transformers16'nın küresel modelleme yeteneğiyle birleştiren hibrit bir mimari önermektedir.

Polip segmentasyonu alanında, Polyp-PVT piramit vizyonlu bir Transformer kullanarak çok ölçekli küresel anlamsalbilgiyi 17 yakalarken, çok ölçekli iç içe UNet, Transformers18'i entegre ederek bağlamsal anlayışı artırır. Son çalışmalar ayrıca, çapraz alan polip segmentasyonu19, Gompertz ile artırılmış segmentasyongeliştirme 20 ve sınır rehberliğini içeren dikkat temelli mimariler için negatif korelasyon öğrenmestratejilerini de incelemiştir. Bu yaklaşımlar segmentasyon performansını bir dereceye kadar iyileştirse de, polip segmentasyonu hâlâ çeşitli zorluklarla karşı karşıyadır. Birincisi, polipler morfoloji, boyut ve doku açısından yüksek heterojenlik gösterir; 5 mm'den küçük mikropoliplerden 30 mm'yi geçen büyük poliplere kadar değişir; şekilleri dairesel ve eliptikten çok düzensiz formlara kadar değişir. İkinci olarak, bağırsak ortamı karmaşık ve değişkendir; mukoza kıvrımları, speküler yansımalar, dışkı kalıntıları ve gıda kalıntıları ciddi arka plan girişimi oluşturur. Üçüncüsü, birçok polipin sınırları bulanıklaşmış, kısmen kıvrımlarla kapanmış olabilir veya bağırsak sıvılarının içinde kalmış olabilir, bu da kesin sınır lokalizasyonunu son derecezorlaştırır 22.

Mevcut yöntemler bu zorlukları ele almada hâlâ açık sınırlamalar sunmaktadır. Geleneksel CNN'ler yerel doku ve kenar özelliklerini çıkarmada etkilidir; Ancak, sabit kare konvolüsyon çekirdekler, özellikle çok düzensiz polipler için çeşitli geometrikşekilleri yakalamak için uygun değildir ve çok yönlü geometrik özellikleri etkili bir şekilde modelleyemez. Transformator tabanlı yöntemler küresel bağımlılıkları modelleyebilir ancak ince yerel detayları ve sınır bilgilerini yakalamada daha az etkilidir. Ayrıca, yüksek hesaplama karmaşıklıkları onları gerçek zamanlı klinik uygulamalar için daha az uygunkılar 24. Son zamanlarda kullanılan polip segmentasyon yaklaşımları, örneğin anahtarbölgeleri 25 iyileştirmek için ters dikkat modüllerini kullanan, sınır özellik çıkarımı26'yı geliştiren sınır yönlendirmeli kaskad dikkat ağları ve çapraz dikkat mekanizmalarıyla kodlayıcı ve çözücü özelliklerinibirleştiren CAFE-Net, küçük poliplerle uğraşırken hâlâ yeterli özellik temsili ve yanlış sınır lokalizasyonuile karşılaşmaktadır 28, bulanık sınırlar ve karmaşık arka planlar. Ayrıca, çoğu yöntem geometrik morfolojiyi ihmal eder ve çok yönlü bağlamsal bilgiyi tam olarak kullanamaz, bu da düzensiz şekilli poliplerin optimal olmayan segmentasyonuna yol açar.

Özetle, mevcut CNN tabanlı yöntemler, sabit kare konvolüsyon çekirdeklerine dayandıkları için çok yönlü geometrik özellikleri yakalama yeteneğinden yoksundur. Transformator tabanlı yaklaşımlar küresel modelleme sunar ancak yerel sınır hassasiyetinden ödün verir ve yüksek hesaplama maliyetleri getirir. Bu arada, mevcut dikkat artırılmış ve çok ölçekli füzyon stratejileri, polip segmentasyonu için özel olarak tasarlanmış birleşik bir çerçeveiçinde ortak olarak optimize edilmemiştir 29. Bu boşluklar, geometrik özellik modellemesi, uyarlanabilir gürültü bastırma ve çapraz ölçekli özellik entegrasyonunu aynı anda ele alan bir yöntemin geliştirilmesini motive etmektedir.

Bu sorunları ele almak için bu protokol, Pinwheel Konvolüsyonu ve Çift Dikkat (PWD-Net) tabanlı bir Polyp Segmentasyon Ağı sunar. Önerilen ağ, geometrik özellik modellemesi, çok boyutlu dikkat geliştirme ve çok ölçekli özellik birleşmesini entegre ederek karmaşık poliplerin hassas segmentasyonunu mümkün kılar. Bu çalışmanın başlıca katkıları şu şekilde özetlenmiştir: pinwheel konvolüsyon modülü (PCM), pinwheel'in yapısından esinlenerek, poliplerin çok yönlü geometrik özelliklerini çoklu açılarda (0°, 45°, 90°, 135°, 180°, 225°, 270° ve 315°) konvolüsyon işlemleriyle yakalanan yeni bir döner konvolüsyon çekirdeği tasarımı önerilmiştir. Bu modül, darboğaz aşamasında geleneksel konvolüsyon katmanının yerini alır; çeşitli kenar yönlerinin etkili algılanmasını sağlar ve düzensiz şekilli poliplerin temsilini önemli ölçüde iyileştirir. Çift dikkat mekanizması (DAM), kolonoskopi görüntülerindeki kıvrımlar, yansımalar ve dışkı kalıntıları gibi arka plan gürültüsünü ele alır. Kanal dikkati ve mekânsal dikkati entegre eden çift dikkat modülü tasarlanır. Atlama bağlantılarına gömülü olan bu modül, arka plan parazitini uyarlayıcı şekilde bastırır ve polip bölgelerinde "neyin" önemli olduğunu (kanal boyutu) ve hedefin "nerede" bulunduğunu (mekansal boyut) birlikte belirleyerek özellik yanıtlarını artırır; böylece sonraki füzyonda yalnızca rafine özelliklerin yer almasını sağlar. Çok ölçekli özellik birleşme stratejisi (MSF), çözücüye getirilen hiyerarşik mekanizma aracılığıyla hem derin anlamsal bilgiyi hem de sığ sınır detaylarını korur. DAM ile güçlendirilmiş kodlayıcı özelliklerini yukarı örneklenmiş kodlayıcı özellikleriyle aşamalı olarak entegre ederek, bu strateji downssampling nedeniyle oluşan mekansal detay kaybını etkili bir şekilde telafi eder; böylece küçük poliplerin doğru tespiti ve kesin sınır çizimleri sağlanır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Bu çalışma yalnızca kamuya açık olan, anonimleştirilmiş kolonoskopi görüntü veri setlerini (Kvasir-SEG) kullanır. Yeni insan denek veri toplanmadı. Kurumsal etik onayı ve bilgilendirilmiş hasta onayı gerekmemişti; bu, kimliği açıklanmış kamu veri setlerinin retrospektif analizleri için kurumsal inceleme politikalarıyla da doğrulanmıştır.

1. Veri Hazırlığı

  1. Kvasir-SEG veri setini resmi depodan33 indirin (https://datasets.simula.no/kvasir-seg/). Veri seti, karşılık gelen piksel düzeyinde yer gerçekliği maskeleriyle birlikte 1.000 polip görüntüsü içerir.
  2. Veri setini, sabit rastgele tohum (tohum = 42) kullanılarak 8:1:1 oranında eğitim (800 resim), doğrulama (100 resim) ve test (100 resim) setlerine rastgele bölerek dağıtın. Veri sızıntısını önlemek için üç alt küme arasında hiçbir görüntünün örtüşmediğini doğrulayın.
  3. Tüm görüntüleri ve ilgili maskeleri, görüntüler için bilineşer interpolasyon ve maskeler için en yakın komşu interpolasyonu kullanarak 352 x 352 piksele yeniden boyutlandırılır.
  4. Piksel değerlerini 255'e bölerek [0, 1] olarak normalize edin, ardından ImageNet kanal bazında ortalama çıkarma (0.485, 0.456, 0.406) ve standart sapma normalizasyonu (0.229, 0.224, 0.225) uygulansın.
  5. Aşağıdaki artırma dönüşümlerini yalnızca eğitim kümesine uygulayın (doğrulama veya test setlerine değil): rastgele yatay çevirme (olasılık = 0.5); rastgele dikey flip (olasılık = 0.5); rastgele dönüş (aralık: −30° ile +30°, olasılık = 0.5); rastgele çok ölçekli boyutlandırma (ölçek faktörü: 0,75 ila 1,25, olasılık = 0,5)
    NOT: Hizalanmayı korumak için hem görüntüye hem de ona karşılık gelen maskeye aynı uzaysal dönüşümler uygulayın. Eğitime başlamadan önce birkaç artırılmış görüntü-maske çiftini görsel olarak inceleyerek artırma doğruluğunu doğrulayın.

2. Genel Mimari

NOT: PWD-Net'in makro seviyeli kodlayıcı–kodlayıcı omurgası için Şekil 1'e ve özellik akışındaki çekirdek modüllerin entegrasyonu ve etkileşimi için Şekil 2'ye bakınız. Genel mimari, kolonoskopi görüntülerindeki poliplerin ölçek değişimlerini ve arka plan parazitini yönetmek için U şeklinde kodlayıcı-çözücü tasarımını takip eder.

  1. Omurga ve Kodlama Yolu (Şekil 1)
    1. ImageNet'te önceden eğitilmiş bir ResNet-50 (resmi PyTorch model hayvanat bahçesinden alınmış) omurga kodlayıcısı olarak kullanın30. Eğitim sırasında tüm kodlayıcı katmanlarını ince ayarlayın.
    2. Giriş kolonoskopi görüntüsünü (352 x 352 piksele boyutlandırılmış) beş aşamalı kalıntı konvolüsyon bloklardan geçirerek hiyerarşik özellikleri çıkarın. Özellik haritalarının mekansal çözünürlüğü beş aşamadan aşağı salınırken, kanal boyutları buna göre artarken (64 → 128 → 256 → 512 → 1024).
    3. Darboğazda (en derin kodlayıcı katman), standart konvolüsyon katmanı Pinwheel Konvolüsyon Modülü (PCM, Bölüm 3'te açıklanmıştır) ile değiştirerek küresel geometrik morfolojiyi ve çok yönlü bağlamsal bilgileri düşük çözünürlükte yakalayabilirsiniz.
      NOT: Beş kodlayıcı aşaması standart ResNet-50 katman gruplarına karşılık gelir: conv1, layer1, layer2, layer3 ve layer4. Önceden eğitilen ağırlıklar, düşük ve orta seviye özelliklerin sağlam başlatılması sağlar ve küçük tıbbi veri setlerinde yakınsama süresini azaltır.
  2. Ana Bileşenler ve Özellik Etkileşimi (Şekil 2 ve Şekil 3)
    1. Her kodlayıcı aşamasının çıkışına Çiftli Dikkat Mekanizmasını (DAM, Bölüm 4'te açıklanmıştır) uygulayın, ardından atlama bağlantılarıyla kodlayıcıya iletin. Bu adım, bağırsak kıvrımları ve speküler yansımalar tarafından üretilen arka plan gürültüsünü uyarlayıcı olarak bastırırken, polip bölgelerindeki özellik yanıtını artırır. Sadece filtrelenen özellikler ilgili kod çözücü katmanına aktarılır.
    2. Kod çözücüde, bilinezik yukarı örnekleme yoluyla mekânsal çözünürlüğü kademeli olarak geri kazandırılır. Her kod çözücü katmanında, önceki kodlayıcı aşamasından yukarı örnekler alınan özellikleri, aynı mekansal çözünürlükte DAM ile geliştirilmiş kodlayıcı özellikleriyle birleştirin.
    3. Çok ölçekli bilgiyi birleştirmek için ardışık iki konvolüsyon katman uygulayın (her biri parti normalizasyonu ve ReLU aktivasyonu takip eder). Bu, Bölüm 5'te tanımlanan Çok Ölçekli Özellik Füzyon (MSF) stratejisini oluşturur.
      NOT: Kod çözücü, derin katmanlardan sığ katmanlara (5. aşama → 1. aşama) ilerler, böylece derin anlamsal lokalizasyon bilgisi ile sığ sınır detay bilgisi her seviyede etkili şekilde entegre edilir.
  3. Üretim Üretimi
    1. Son dekoder çıktısına konvolüsyon katman ve ardından Sigmoid aktivasyon fonksiyonu uygulayarak tahmin maskesi oluşturulur.
    2. Tahmin maskesini 0.5 eşik kullanarak ikili hale getirerek nihai segmentasyon sonucunu elde edin; burada tahmin edilen olasılık ≥ 0.5'e sahip pikseller polip olarak, kalan pikseller ise arka plan olarak sınıflandırılır.

3. Pinwheel Konvolüsyon Modülü (Şekil 3)

  1. Pinwheel Konvolüsyon Modülü (PCM), poliplerin çok yönlü geometrik özelliklerini yakalamak için standart darboğaz konvolüsyonunun yerini alır. Bu modülü aşağıdaki şekilde uygulayın:
    1. Giriş kanallarında C veçıkış çıkış kanallarında C olan 3 x 3 boyutunda bir temel konvolüsyon çekirdeği W tanımlayın.
    2. Dönme açıları kümesini tanımlayın: Θ = {0°, 45°, 90°, ..., 315°}. Her açı θ ∈ Θ için, W'ye bilinear enterpolasyon tabanlı dönüş uygulayarak dönen çekirdek Wθ oluşturulur. Tüm sekiz döndürülmüş çekirdek aynı temel parametreleri paylaşır; sadece ağırlıkların mekansal düzeni farklıdır.
    3. Her θ açısı için, yöne özgü özellik haritasını hesaplayın:
      figure-protocol-1
      burada X, giriş özellik haritasıdır.
    4. Kanal ekseni boyunca kanal başına bağlanma ile sekiz yönlü özellik haritasını birleştirerek boyutlu (8 x Cçıkış) x H x W boyutlu bir tensör elde edin. Sonra kanal boyutunu tekrar Cout'a indirmek için 1 x 1 konvolüsyon uygulanır, ardından toplu normalizasyon ve ReLUaktivasyonu 31 yapılır:
      figure-protocol-2
      NOT: Döndürme ve enterpolasyon çekirdeği ağırlıkları üzerinde yapılır, giriş özellik haritasında değil. Bu tasarım, giriş çözünürlüğünü artırmadan parametre açısından verimli çok yönlü özellik çıkarımı sağlar. Mevcut uygulamada, dar boğaz aşamasında Cin = 1024 ve Cout = 1024 olarak ResNet-50 katman 4'ün çıkış kanalı boyutuyla eşleşir. Tam uygulama için ek kod paketine bakabilirsiniz.

4. Çift Dikkat Mekanizması (Şekil 4)

NOT: Çift Dikkat Mekanizması (DAM), her atlama bağlantısına yerleştirilerek arka plan gürültüsünü bastırır ve hem kanal hem de mekansal boyutlardan polip bölgesi özelliklerini güçlendirir.

  1. Kanal Dikkati
    Kanal dikkat dalı, hangi özellik kanallarının en bilgilendirici olduğunu belirler. F ∈ RC×H×W giriş özelliği verildiğinde:
    1. Küresel Ortalama Havuzlama ile uzamsal boyutları sıkıştırarak kanal tanımlayıcısı z ∈ RC×1×1 elde edin.
    2. z'yi iki katmanlı bir MLP (tam bağlı katmanlar) üzerinden geçirin, indirgeme oranı r = 16. İlk katman, ReLU aktivasyonuyla boyutu C'den C/16'ya indirir; ikinci katman, Sigmoid aktivasyonuyla C/16'dan C'ye geri kazandırarak kanal ağırlık vektörü Ac'yi üretir:
      figure-protocol-3
      burada δ ReLU'yu ve σ Sigmoid'i gösterir.
  2. Mekânsal Dikkat
    Mekânsal dikkat dalı, hedef bölgelerin nerede olduğunu belirler:
    1. Kanal boyutu boyunca hem maksimum havuzlama hem de ortalama havuzlama uygulayarak 1 x H x W boyutunda iki 2D özellik haritası oluşturulur.
    2. İki haritayı kanal ekseni boyunca birleştirerek 2 x H x W tensör oluşturun. 7 x 7 konvolüsyon katman uygulayın, ardından Sigmoid aktivasyonu uygulanarak As ∈ R1×H×W mekânsal ağırlık haritası oluşturulur:
      figure-protocol-4
  3. Özellik Fusion
    1. Kanal ve mekansal dikkat çıkışlarını giriş özelliğiyle eleman bazında çarpma yoluyla birleştirin:
      figure-protocol-5
      burada α ve β, öğrenilebilir denge katsayılarıdır; her ikisi de 0.5'e başlatılır ve eğitim sırasında gradyan tabanlı optimizasyon yoluyla ağ parametreleriyle ortaklaşa güncellenir.
      NOT: Tam uygulama için ek kod paketine (dam_module.py) bakınız.

5. Çok Ölçekli Özellik Füzyonu

  1. Derin özelliklerdeki mekansal detay kaybını gidermek için dekoderda çok ölçekli özellik birleşimi (MSF) stratejisini uygulayın. Her kod çözücü aşamasında aşağıdakileri gerçekleştirin:
  2. Önceki dekoder aşamasından özellik haritasını bilinear interpolasyon kullanarak 2 kat yukarı örnekleyin.
  3. Yukarı örneklenen özellikleri, kanal ekseni boyunca ilgili mekansal çözünürlüğe sahip DAM ile geliştirilmiş kodlayıcı özellikleriyle birleştirin.
  4. Birleştirilmiş özellikleri birleştirmek için ardışık iki 3 x 3 konvolüsyon katman uygulayın (her biri parti normalizasyonu ve ReLUaktivasyonu 32 ile takip edilir).
    NOT: Bu çapraz seviye birleşim, poliplerin sınır detaylarının (sığ kodlayıcı özellikler tarafından sağlanan) ve anlamsal lokalizasyonun (derin özellikler tarafından sağlanan) aynı anda korunmasını sağlar ve ince taneli segmentasyon sonuçları üretir.

6. Kayıp Fonksiyonu ve Eğitim Konfigürasyonu

  1. Kayıp Fonksiyonu
    1. Ağı ortak optimize etmek için kullanılan hibrit kayıp fonksiyonu L_total benimsenir ve polip segmentasyonunda yaygın ön plan–arka plan sınıf dengesizliğini giderir.
      İkili Çapraz Entropi Kaybı (L BCE) piksel düzeyinde sınıflandırma doğruluğunu ölçür:
      figure-protocol-6
      burada N toplam piksel sayısıdır, yi ∈ {0,1} zemin-gerçeklik etiketi ve ŷi ∈ [0,1] tahmin edilen olasılıktır.
    2. Zar Kaybı (LZar), tahmin edilen ve temel gerçeklik bölgeleri arasındaki küme benzerliğini nicelikle ölçülür:
      figure-protocol-7
      figure-protocol-8
      burada ε, sıfıra bölünmeyi önlemek için bir düzgünleştirme faktörüdür (1 x 10⁻5 olarak ayarlanmıştır).
      İki kayıp teriminin katkılarını dengelemek için λ = 0.5 ayarlayın.
  2. Eğitim Konfigürasyonu
    1. Kodlayıcıyı ImageNet önceden eğitilmiş ResNet-50 ağırlıklarıyla başlatın. Tüm kod çözücü katmanlarını, PCM ve DAM parametrelerini Kaiming uniform başlatma yöntemiyle başlatın.
    2. Optimize ediciyi ve eğitim programını aşağıdaki gibi yapılandırın. Adam optimizer'ını β₁ = 0.9 ve β₂ = 0.999 ile kullanın. Başlangıç öğrenme hızını 1 x 10⁻⁴ olarak ayarlayın. Tmax = 50 ve ηmin = 1 x 10⁻⁶ olan kosinüs tavlama öğrenme hızı takvimi uygulan. 16 adet parti boyutu kullanın ve modeli 50 dönem için eğitin.
    3. Modeli eğitim setinde 50 dönem boyunca eğitin (800 fotoğraf). Her dönemin sonunda, modeli doğrulama setinde (100 görsel) birincil izleme metriği olarak Zar katsayısı kullanarak değerlendirin.
    4. Doğrulama setinde en yüksek zar katsayısına ulaşan model kontrol noktasını kaydedin. Bu kontrol noktasını, test setindeki tüm sonraki değerlendirmeler için nihai model olarak kullanın.
      NOT: Erken durma açıkça uygulanmaz. En iyi doğrulama-zar kontrol noktası seçim stratejisi, model seçim kriteri olarak hizmet eder. Tüm deneyler, Materyal Tablosu'nda belirtilen donanım ve yazılım ortamı kullanılarak yapılır. 800 görüntü üzerinde 50 dönem için eğitim tarif edilen konfigürasyonda yaklaşık 2 saat sürer. Tüm bildirilen sonuçlar, belirtilen rastgele tohum kullanılarak tek bir antrenman çalışmasından elde edilir (tohum = 42). Tam eğitim betikleri için ek kod paketine bakabilirsiniz.

7. Sözde kod

  1. Algoritma 1'i PWD Net için tam iş akışı haritası olarak kullanın. Algoritmadaki PCM, DAM, ana mimari ve eğitim boru hattı bloklarını ek kod paketindeki ilgili dosyalarla eşleştirin.
  2. 4 ile 12. satırlarda gösterilen PCM bloğunu uygulayın. Bir taban 3 x 3 konvolüsyon çekirdeği tanımlayın ve bilinear interpolasyon kullanarak 0°, 45°, 90°, 135°, 180°, 225°, 270° ve 315° pozisyonlarında sekiz döner çekirdek oluşturun.
  3. Tüm döndürülmüş PCM çekirdekleri için aynı öğrenilebilir temel parametreleri koruyun. Her dönüş açısı için, bir yöne özgü özellik haritası hesaplayın.
  4. Kanal boyutu boyunca sekiz PCM özellik haritasını birleştirin. Orijinal kanal boyutunu geri kazanmak için 1 x 1 konvolüsyon, toplu normalizasyon ve ReLU aktivasyonu uygulayın.
  5. 14 ile 19 numaralı hatlarda gösterilen DAM bloğunu uygulayın. Kanal tanımlayıcısını oluşturmak için Küresel Ortalama Havuzlama uygulayın, ardından kanal ağırlıklarını elde etmek için 16 indirme oranıyla iki katmanlı bir MLP'den geçirin.
  6. Giriş özelliğine kanal bazında ortalama havuzlama ve maksimum havuzlama uygulayarak mekânsal dikkat haritası oluşturun. İki haritayı birleştirin ve 7 x 7 konvolüsyonla ardından Sigmoid aktivasyonu ile işleyin.
  7. DAM kanalı ve mekansal dikkat çıkışlarını giriş özelliğiyle eleman bazında çarpma yöntemiyle birleştirin. İki dikkat haritasını öğrenilebilir katsayıları α ve β ile ağırlıklandırın, her ikisi de 0.5 olarak başlangıldırılmış.
  8. 21'den 32'ye kadar olan satırlarda gösterilen ana PWD Net mimarisini inşa edin. Giriş görüntüsünü önceden eğitilmiş bir ResNet 50 kodlayıcısının beş aşamasından geçirerek e1'den e5'e kadar uzanır ve mekânsal çözünürlük H x W'den H/32 x W/32'ye düşürülür.
  9. Dar boğazda e5'e PCM uygulayın. Bu özellikleri atlama bağlantılarıyla kodlayıcıya göndermeden önce e1'den e4'e DAM uygulayın.
  10. Özellik haritasını derinden sığ katmanlara doğru çöz. Her kodlayıcı seviyesinde önceki özelliği örnekleyin, ilgili DAM geliştirilmiş kodlayıcı özelliğiyle birleştirin ve özellik birleşimi için DoubleConv uygulayın.
  11. Segmentasyon çıktısını 1 x 1 konvolüsyonla ve ardından Sigmoid aktivasyonu ile üretin. Ortaya çıkan piksel bazında olasılık haritasını tahmin edilen maske olarak kullanın.
  12. 34 ile 39 numaralı hatlarda gösterilen eğitim döngüsünü uygulayın. Her dönemde, PWD Ağı üzerinden ileriye yayılmayı çalıştırın ve tahmin edilen maske hesaplanın.
  13. Antrenman kaybını 0.5 x BCE kaybı artı 0.5 x zar kaybı olarak hesaplayın. Tüm öğrenilebilir parametreleri Adam optimizer'ı ile geri yayılma yoluyla güncelleyin.

Algoritma 1: PWD-Net Polip Segmentasyonu
1: Giriş: Kolonoskopi görüntüsü I ∈ RH×W×3
2: Çıkış: Segmentation mask M ∈ {0,1}(H×W)
3:
4: işlev PCM(X) ▷ Pinwheel Konvolüsyon Modülü
5: Temel çekirdeği W (3 x 3), açılar Θ = {0°, 45°, ..., 315°} tanımlayın
6: her θ ∈ Θ için
7: Wθ ← BilinearRotate(W, θ) ▷ Çekirdeği döndür
8: Yθ ← Conv2d(X, Wθ) ▷ Yöne özgü özellikler
9: son
10: Yout ← ReLU(BN(Conv1 x 1(Concat({Yθ})))) ▷ Aggregate
11: Ydönüşü out
12: son fonksiyon
13:
14: Fonksiyon DAM(F) ▷ Çift Dikkat Mekanizması
15: Ac ← Sigmoid(MLP(AvgPool(F))) ▷ Kanal dikkati (r=16)
16: As ← Sigmoid(Conv7 x 7([AvgPool(F); MaxPool(F)])) ▷ Mekânsal dikkat
17: F' ← F ⊗ (α · Ac + β · As) ▷ Öğrenilebilir α ile birleş, β (init=0.5)
18: dönüş F'
19: son fonksiyon
20:
21: işlev PWD-Net(I)
22: Kodlayıcı: e1, e2, e3, e4, e5 ← ResNet50_Stages(I) ▷ 5 aşamalı önceden eğitilmiş kodlayıcı
23: Darboğaz: b ← PCM(e5) ▷ PCM darboğazında uygulanır
24: Bağlantıları atla: si ← DAM(ei) for i = 1, 2, 3, 4 ▷ Filtre kodlayıcı özellikleri
25: Kod çözücü:
26: d4 ← DoubleConv(Concat(Up(b), s4))
27: d3 ← DoubleConv(Concat(Up(d4), s3))
28: d2 ← DoubleConv(Concat(Up(d3), s2))
29: d1 ← DoubleConv (Concat(Up(d2), s1))
30: M ← Sigmoid(Conv1 x 1(d1))
31: dönüş M
32: son fonksiyon
33:
34: Eğitim:
35: Her dönem için do
36: M̂ ← PWD-Net(I)
37: L ← 0.5 · M.Ö. (M̂,M gt) + 0.5 · ZarKayıp(M̂, Mgt) ▷ λ = 0.5

38: Parametreleri geri yayma yoluyla güncelle (Adam optimizer)
39: son

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Deneysel Kurulum
Veri seti

Kvasir SEG veri seti, heterojen polip görünümlü kolonoskopi görüntülerde PWD Net'in segmentasyon davranışını değerlendirmek için kullanıldı. Veri seti 1.000 piksel açıklamalı polip görüntüleri içerir ve polip boyutu, şekli, dokusu, aydınlatması ve arka plan karmaşıklığında farklılıklar içerir; bu da küçük hedef tespiti, sınır lokalizasyonu ve görsel müdahaleye dayanıklılığı değerlendirmek için uygundur. Veri seti ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

PWD-Net protokolündeki birkaç tasarım seçeneği, güvenilir segmentasyon sonuçları elde etmek için kritik öneme sahiptir ve uygulama sırasında dikkatli bir dikkat gerektirir. Birincisi, kodlayıcı omurgasının seçimi ve başlatılması doğrudan yakınsama davranışını ve nihai performansı etkiler. Protokol, ImageNet üzerinde önceden eğitilmiş bir ResNet-50 kodlayıcı kullanır ve bu da sağlam düşük seviye ve orta seviye özellik başlatma sağlar. Bu özellikle, mevcut eğitim verilerinin sınırlı olduğu...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Yazarların açıklayacak hiçbir şeyi yok.

Teşekkürler

Bu çalışma, Çin Ulusal Anahtar Ar-Ge Programı (Program No. 2022YFC3500200 ve 2022YFC3500204) tarafından finanse edilmiştir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Adam OptimizerPyTorch'da bulunur
AlbumentationsAlbumentations Teamv1.0+Veri artırma kütüphanesi
CUDA ToolkitNVIDIAv11.3+GPU hızlandırma
Kvasir-SEG datasetSimulaMethttps://datasets.simula.no/kvasir-seg/
MatplotlibMatplotlib Communityv3.4+Eğitim eğrilerinin görselleştirilmesi
NumPyNumPy Communityv1.21+Sayısal hesaplama
NVIDIA Tesla P100NVIDIAP100-PCIE-16GBEğitim ve çıkarım için GPU
OpenCVOpenCV Communityv4.5+Görüntü ön işleme
PythonPython Software Foundationv3.8+Programlama dili
PyTorchMeta Platformsv1.12+Derin öğrenme çerçevesi
ResNet-50 pretrained weightsPyTorch Model ZooImageNet-1K öneğitilmiş
UbuntuCanonical18.04+İşletim sistemi

Yeniden basım ve izinler

Etiketler

TıpSayı 232Sayı 232Boş DeğerSayıÇift dikkat mekanizmasıÇok ölçekli özellik füzyonuderin öğrenmeTıbbi görüntü işleme