Bu çalışma, hibrit evrişim ve kanal dikkatini kullanarak gelişmiş segmentasyon doğruluğuna sahip hafif bir U-Net varyantı sunar ve MoNuseg ve GlaS'ta daha az parametreyle son teknoloji sonuçlar elde eder.
Yöntem makalesi
Bu çalışma, hibrit evrişim ve kanal dikkatini kullanarak gelişmiş segmentasyon doğruluğuna sahip hafif bir U-Net varyantı sunar ve MoNuseg ve GlaS'ta daha az parametreyle son teknoloji sonuçlar elde eder.
Yapay sinir ağı tabanlı bilgisayar görüntü işleme teknolojisi son yıllarda hızla gelişti ve birden çok alanda yaygın uygulamalar buldu. Tıbbi görüntü işlemede, UNet ve varyantları lezyon tespiti, hücre segmentasyonu ve polip segmentasyonu görevlerinde büyük başarı göstermiştir. Bu araştırma, modelin öğrenme yeteneğini geliştirmek için ağ derinliğini azaltarak ve ağ kanallarını artırarak elde edilen azaltılmış ağ parametrelerine sahip değiştirilmiş U şeklinde bir ağ sunmaktadır. Derinlik sıkıştırmasının neden olduğu öğrenme kapasitesindeki azalmayı önlemek için, orijinal ağın evrişimli modülünün yerini alacak bir hibrit kanallı evrişimli modül tanıtıldı. Model, pratik kanal özelliği çıkarma yeteneğini geliştirmek için katman ile nokta evrişim katmanı arasında bir kanal dikkat mekanizması sunar. Makale ayrıca, karışık derinlikli evrişim kullanmanın segmentasyon hedefinin boyut aralığını etkili bir şekilde çözebileceği ve bir modelin birden çok veri setine uygun olmasını zorlaştırabileceği sonucuna varıyor. Önerilen model, sırasıyla %1,0 ve %1,37'lik bir ortalama zar artışıyla iki popüler halka açık veri seti olan MoNuseg ve GlaS üzerinde son teknoloji sonuçlar elde ediyor. Modifiye edilmiş modelin toplam parametreleri, 65,6 milyon parametreli UCtransNet'e kıyasla 38,6 katlık bir azalmayı temsil eden 1,71 milyona düşürülmüştür.
Tıbbi görüntü segmentasyonu, tanı, tedavi planlaması ve hastalık izleme dahil olmak üzere çeşitli klinik uygulamalarda kritik öneme sahiptir. Özellik mühendisliği algoritmalarına dayalı geleneksel görüntü işleme yöntemleri, modern sağlık hizmeti ortamlarında üretilen büyük hacimli verileri işlemek için artık uygun değildir. Neyse ki, yapay sinir ağı teknolojisinin ilerlemesi ve bilgisayar donanım yeteneklerindeki gelişmeler, büyük ölçekli sinir ağı modellerinin eğitilmesini ve dağıtılmasını mümkün kılmıştır. Sonuç olarak, makine öğrenimi modellerine dayalı bilgisayarla görme işleme algoritmaları sürekli olarak geliştirilmekte ve çeşitli alanlarda uygulanmaktadır.
Tıbbi görüntülerin anlamsal segmentasyonunda en temsili model yapısı, kodlama-kod çözme mimarisine sahip UNet1'dir . Model, giriş görüntüsünden farklı ölçeklerin özelliklerini çıkarmak için önce çok seviyeli bir kodlayıcı kullanır. Ardından, kod çözücü, ilgili seviyenin kodlayıcısı tarafından çıkan anlamsal özellikleri bir atlama bağlantısı olarak birleştirirken adım adım örnekler oluşturur. Bununla birlikte, UNet mimarisinin performansı çeşitli yöntemler uygulanarak daha da geliştirilebilir. Örneğin, dikkat mekanizmalarının evrişimli sinir ağlarının performansını artırmada etkili olduğu gösterilmiştir. Bu mekanizmalar, girdi verilerindeki temel özellikleri seçici bir şekilde vurgulayarak daha iyi temsil öğrenimi ve segmentasyon doğruluğuna yol açabilir.
Şu anda, birçok araştırmacı, kod çözme aşamasında kodlayıcı tarafından çıkarılan özellikleri etkili bir şekilde birleştirmeye odaklanmaktadır. UNet'in en yaygın varyantlarından bazıları Attention UNet2, Recurrent UNet3 ve V-Net4'tür. Bu yaklaşımlar, özellik haritalarının bilgilendirici bölgelerini vurgulamak ve bilgilendirici olmayan bölgeleri bastırmak için uzamsal dikkat gibi dikkat mekanizmalarını5 kullanır. Ek olarak, bazı varyantlar, tıbbi görüntülerin sıralı doğasını modellemek ve özellik temsillerini iyileştirmek için tekrarlayan sinir ağları içerir. VGG6, ResNet7 ve DenseNet8 gibi ön eğitim modelleri, büyük ölçekli veri kümelerinden öğrenilen zengin bilgilerinden yararlanarak U şeklindeki ağların performansını artırmak için yaygın olarak kullanılmaktadır. Ek olarak, kendi kendine dikkat ve çok kafalı dikkat gibi transformatör mekanizmaları, uzun vadeli model bağımlılıklarına tanıtıldı ve küresel bağlamsal bilgileri yakalayarak daha iyi segmentasyon performansına yol açtı.
Bununla birlikte, bu varyantlar orijinal UNet1'e göre geliştirilmiş olsa da, değişen ölçek ve şekillere sahip karmaşık tıbbi görüntülerin işlenmesinde hala belirli sınırlamaları vardır. Ayrıca, bu varyantların artan karmaşıklığı genellikle daha yüksek hesaplama maliyetlerine ve daha uzun eğitim sürelerine yol açar ve bu da pratik ortamlarda uygulanabilirliklerini sınırlar.
UNet1 mimarisini geliştirmek için, öğrenme kapasitesini artırmak için kanal sayısını artırırken ağ derinliğini azaltan MixKNet (Mix Kernel Size U-shape Net) adlı değiştirilmiş bir model önerilmiştir. Bununla birlikte, derinlikteki azalma genel performansta bir düşüşe neden olabilir. Bu sorunu azaltmak için, orijinal evrişimli nöral modülün yerini alan bir hibrit kanallı evrişimli modül tanıtıldı. Bu modül, modelin etkili kanal özelliklerini çıkarma yeteneğini güçlendirmeyi amaçlayan, derinliksel ve noktasal evrişim katmanları arasında bir kanal dikkat mekanizması içerir.
Pratik uygulanabilirliğe rehberlik etmek için, önerilen yöntemin, 500 ×ila 500 ila 1000 × 1000 piksel arasında değişen bireysel görüntü çözünürlüklerine sahip nispeten küçük ölçekli tıbbi görüntü veri kümelerinde değerlendirildiğine dikkat etmek önemlidir. Model eğitimi için tüm görüntüler 224 × 224 piksel olarak yeniden boyutlandırıldı. Uygulama, tek bir NVIDIA RTX 3090 GPU üzerinde PyTorch kullanılarak gerçekleştirildi. Bu operasyonel parametreler, yöntemin orta düzeyde deney kurulumları için hesaplama açısından uygulanabilir olduğunu ve sınırlı veri kümesi boyutlarına uyarlanabilir olduğunu göstermektedir.
Sonuç olarak, bu makale U şeklindeki ağ yapısında yeni bir değişiklik sunmakta ve her ikisi de tıbbi görüntü veri kümelerinde segmentasyon performansını artıran bir kanal dikkat mekanizması ile birlikte bir hibrit kanal evrişim modülünü tanıtmaktadır. Bu çalışmanın ana katkıları aşağıdaki gibidir: (1) Orijinal evrişimli nöral modülün yerini alan hibrit derin bilge evrişim modülü ile değiştirilmiş U şeklinde bir ağ yapısı önermek. (2) Modelin etkili kanal özelliği çıkarma yeteneğini geliştirmek için derin bilge ve nokta bilge evrişim katmanı arasında bir kanal dikkat mekanizmasının tanıtılması. (3) MoNuseg9 nükleer segmentasyon veri setindeki iki popüler genel veri setinde aynı anda en son teknoloji ürünü sonuçların elde edilmesi, önemli ölçüde daha az model parametresi (64M parametreli UCtransNet10 ile karşılaştırıldığında) ve GlaS11 bezi segmentasyon veri setinde iyileştirilmiş performans.
Bu makalenin geri kalanı aşağıdaki gibi düzenlenmiştir. Adım 2, UNet1 ile ilgili önceki çalışmaların ve tıbbi görüntü segmentasyonundaki varyasyonlarının kapsamlı bir incelemesini sağlar. Mevcut yaklaşımların güçlü yönleri ve sınırlılıkları, dikkat mekanizmaları, karışık derinlikli evrişimli ağlar ve bunların segmentasyon modellerindeki uygulamaları ile ilgili çalışmalarla birlikte incelenmektedir. Adım 3, UNet yapısında yapılan değişiklikler, bir kanal dikkat mekanizmasının entegrasyonu ve karışık derinlikli evrişim kullanımı dahil olmak üzere önerilen MixKNet modelinin mimarisini detaylandırır. Adım 4, her bir bileşenin katkılarını değerlendirmek için bir tartışma ve bir ablasyon çalışması eşliğinde kapsamlı deneylerin sonuçlarını raporlar. Son olarak, 5. adım makaleyi sonlandırır ve gelecekteki araştırmalar için potansiyel yönleri ana hatlarıyla belirtir.
Bu bölüm, UNet ve tıbbi görüntü segmentasyonundaki varyantları ile ilgili önceki çalışmaların gözden geçirilmesiyle başlamakta ve mevcut yöntemlerin güçlü yönlerini ve sınırlamalarını özetlemektedir. Ayrıca, dikkat mekanizmaları ve bunların segmentasyon modellerindeki uygulamaları ile ilgili araştırmalar tartışılmaktadır. Segmentasyon performansını artırmak için derinlemesine evrişim tekniklerini içeren son gelişmeler de incelenmektedir. Önerilen MixKNet (c) ve diğer modellerin karşılaştırmalı bir analizi, kesikli çizgilerin atlama bağlantılarını gösterdiği Şekil 1'de sunulmuştur.
UNet ve varyasyonları
UNet mimarisi ilk olarak 2015yılında Ronneberger ve ark. 1 ve o zamandan beri tıbbi görüntü segmentasyonunda yaygın olarak kullanılmaktadır. Model, bir kodlama yolu ve bir kod çözme yolundan oluşur. Kodlayıcı, giriş görüntüsünden üst düzey özellikleri ayıklarken, kod çözücü yukarı örnekler oluşturur ve bir segmentasyon haritası oluşturmak için özellikleri birleştirir. O zamandan beri, tıbbi görüntü segmentasyonundaki performansını iyileştirmek için UNet mimarisinde çeşitli değişiklikler yapıldı. En yaygın değişikliklerden biri, segmentasyonun doğruluğunu artırdığı gösterilen atlama bağlantılarının tanıtılmasıdır. Zhou ve ark.12 , modelin uzamsal bilgileri daha iyi korumasına olanak tanıyan yoğun atlama bağlantıları kullanan bir UNet varyantı önerdi.
UNet mimarisinde yapılan bir diğer popüler değişiklik, dikkat mekanizmalarının eklenmesidir. Bu mekanizmalar, modelin en önemli özellikleri seçici olarak vurgulamasına yardımcı olarak daha iyi temsil öğrenimi ve segmentasyon doğruluğuna yol açabilir. Dikkat mekanizmalarına sahip varyantların bazı örnekleri arasında Attention UNet2, dikkat kapıları13 ile ResUNet ve dikkat kapıları14 ile Dense-UNet bulunur. Yukarıdaki değişikliklere ek olarak, tıbbi görüntü segmentasyonu için UNet mimarisinin birçok başka varyantı önerilmiştir. UCTransNet10 , atlama bağlantıları ve bir Transformatör modülü içeren U-Net mimarisinin bir çeşididir. UCTransNet10'daki atlama bağlantıları, özelliklerin daha iyi yeniden kullanılmasına izin veren ve parametre sayısını azaltan kanal bazında bir perspektiften yeniden düşünülmüştür. Uzun menzilli bağımlılıkları yakalamak ve çeviri kalitesini artırmak için Transformer modülü eklenmiştir. UCTransNet10'un çeşitli makine çevirisi karşılaştırmalarında son teknoloji sonuçlar elde ettiği gösterilmiştir. Zihan ve arkadaşları, LViT15 adlı bir derin öğrenme modeli önerdiler ve bu modeli tıbbi görüntü analizi görevlerine uyguladılar. LViT15'in yarı denetimli sürümünü genişletmek ve görüntü verilerindeki kalite eksikliğini telafi etmek için Üstel Sahte Etiket Yineleme mekanizmasını (EPI) önerdiler. Ek olarak, görüntülerin yerel özelliklerini korumak için, seçici olarak önemli görüntü özelliklerine odaklanan Piksel Düzeyinde Dikkat Modülünü (PLAM) önerdiler.
Dikkat mekanizması
Dikkat mekanizmaları, makine öğreniminde, özellikle doğal dil işleme ve bilgisayarla görmede geniş çapta incelenmiştir. Son yıllarda, görüntü segmentasyonu da dahil olmak üzere tıbbi görüntü analizi görevlerine dikkat mekanizmaları da uygulanmıştır. Bahdanau ve ark.16 , çevirinin kalitesini artırmak için nöral makine çevirisinde bir dikkat mekanizması tanıttı. Mekanizma, modelin giriş dizisinin ilgili bölümlerine seçici olarak odaklanmasına olanak tanıyarak çeviri kalitesini artırır. O zamandan beri, görüntü analizi görevleri için çeşitli dikkat mekanizmaları önerilmiştir. Yaygın bir dikkat mekanizması türü, özellik haritasındaki her piksele önemine bağlı olarak bir ağırlık uygulanmasını içeren uzamsal dikkat mekanizmasıdır. Örneğin, Guo ve ark.17 , retinal damar segmentasyonu görevi için uzamsal bir dikkat mekanizması önerdi. Mekanizma, uzamsal özelliklerin ağırlığını ayarlamak için bir geçit mekanizması kullanır ve modelin kap ve damar olmayan pikseller arasında ayrım yapma yeteneğini geliştirir. Başka bir dikkat mekanizması türü, kanallar arasındaki özellik haritalarının ağırlıklarını ayarlamaya odaklanan kanal dikkatidir. Hu ve ark.18 , özellik haritalarına kanal bazında dikkat uygulayan ve görüntü sınıflandırma görevinin performansını artıran bir sıkıştırma ve uyarma ağı (SENet) önerdi. Daha yakın zamanlarda, dikkat mekanizmaları, görüntü segmentasyon görevleri için evrişimli sinir ağları (CNN'ler) ile birleştirilmiştir. Örneğin, Chen ve ark.19 , beyin tümörü segmentasyonu için uzamsal ve kanal bazında dikkat mekanizmalarını birleştiren dikkat güdümlü bir ağ önerdi.
Tıbbi görüntü analizi ve uzaktan algılama için yarı denetimli ve çok modlu öğrenmedeki son gelişmeler, umut verici performans iyileştirmeleri göstermiştir. Yang ve ark.20 , modaliteler arası üretken öğrenme ve yarı denetimli stratejilerden yararlanan yeni bir eşleştirilmemiş çok modlu segmentasyon çerçevesi olan UMSCS'yi önerdi. Zhang ve ark. birkaç son teknoloji teknik tanıttı: yarı denetimli segmentasyon21 için kanıta dayalı olarak geliştirilmiş üç dallı tutarlılık modeli, tıbbi görüntü segmentasyonu22 için kendi kendini tanıyan ve çapraz örneklem prototipik öğrenme çerçevesi ve havacılık alanında sentetik açıklıklı radar (SAR) sıkışma tanıma için zaman-frekansa duyarlı hiyerarşik özellik optimizasyonu yaklaşımı23. Bu çalışmalar toplu olarak, hem tıbbi hem de mühendislik görüntüleme görevlerinde hibrit denetimin ve alana duyarlı özellik modellemenin önemini vurgulamaktadır.
Derinlik bilge evrişim
Derinlik açısından evrişim, giriş özelliği haritalarında kanal bazında korelasyonları yakalamak için tasarlanmıştır ve evrişimli sinir ağlarının verimliliğini ve doğruluğunu iyileştirdiği gösterilmiştir.
En eski ve en etkili derinlik bilge evrişim modellerinden biri, Howard ve arkadaşları tarafından 2017'de önerilen MobileNet 24'tür. MobileNet, evrişimli katmanlar için gereken parametre ve hesaplama sayısını azaltmak için derinlik açısından ayrılabilir evrişim ve ardından nokta bazında evrişim uygulayan derinlik açısından ayrılabilir evrişim kullanır. Bu, MobileNet'in geleneksel evrişimli sinir ağlarından önemli ölçüde daha az parametre kullanırken görüntü sınıflandırma görevlerinde son teknoloji doğruluk elde etmesini sağlar. MobileNet'in piyasaya sürülmesinden bu yana, ShuffleNet25, Xception26 ve ResNeXt27 dahil olmak üzere bir dizi başka derinlik bilge evrişim mimarisi önerilmiştir. Bu modeller, derinlemesine evrişimin özel uygulamalarına göre değişir, ancak tümü, doğruluğu korurken veya geliştirirken evrişimli katmanların hesaplama karmaşıklığını azaltma hedefini paylaşır. Büyük ölçekli evrişimli katmanların hesaplama ve bellek gereksinimlerini azaltmak için derinlemesine ayrılabilir evrişim kullanan PSPNet28 gibi modellerle, anlamsal segmentasyon görevine de derin evrişim uygulanmıştır. MixNet29, farklı ölçeklerdeki özellikleri yakalamak için birden çok çekirdek boyutu kullanan karışık bir derinlik evrişimi sunarak derin evrişim fikrini daha da genişletir. Karşılaştırılabilir parametreleri ve FLOP'ları korurken diğer son teknoloji modellerden daha iyi performans gösterdiği gösterilmiştir. Bu modeller, çeşitli anlamsal segmentasyon görevlerinde geleneksel evrişimli sinir ağlarına göre doğruluk ve verimlilikte önemli gelişmeler göstermiştir.
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
Bu bölüm, tıbbi görüntü segmentasyonu için önerilen MixKNet mimarisini açıklamaktadır. MixKNet modeli, dikkat mekanizmalarını ve karışık derinlikli evrişim katmanlarını birleştirerek UNet mimarisini genişletir. Bu çalışmada kullanılan yazılım Malzeme Tablosu'nda listelenmiştir.
1. Genel mimari
2. Düzleştirilmiş U şekli
NOT: Hesaplama karmaşıklığını ve model boyutunu azaltmak için sinir ağı mimarisinin derinliğini azaltın ve bunun karmaşık veri temsillerini öğrenme kapasitesini azaltabileceğinin farkında olun.
3. Kodlayıcı için çekirdek boyutunu karıştırın
4. Dikkati kanalize edin
5. Veri kümeleri
NOT: Bu çalışmada Tablo 1 ve Tablo 2'de sunulduğu gibi halka açık iki tıbbi görüntü veri seti kullanılmıştır: GlaS (Sirinukunwattana ve ark.11) ve MoNuSeg (Kumar ve ark.9).
6. Uygulama ayrıntıları
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
En gelişmiş yöntemlerle karşılaştırma
MixKNet mimarisi, GlaS ve MoNuSeg olmak üzere iki tıbbi görüntü segmentasyon veri seti üzerinde değerlendirilmiş ve sahadaki en son yöntemlerle karşılaştırılmıştır. Değerlendirme, Tablo 3'te
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
Bu çalışma, tıbbi görüntü segmentasyonu için UNet1 mimarisinin yeni bir modifikasyonu olan MixKNet'i, hesaplama karmaşıklığını önemli ölçüde azaltırken segmentasyon performansını artırmak için karışık derinlikli evrişim ve bir kanal dikkat mekanizmasını entegre ederek sunmaktadır. Hibrit kanal evrişimi, ayrı kanal gruplarında çalışan birden çok evrişimli çekirdeği birleştirir. Bu tasarım, ağın aynı katman içinde farklı alıcı alan ölçeklerinde çeşitli uzamsal ve ba...
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
Yazarlar, rekabet eden finansal çıkarlar veya diğer çıkar çatışmaları olmadığını beyan ederler.
Ningbo Şehri'nin 2023 Sosyal Refah Araştırma Projelerinin ikinci partisi: Ontoloji ve NLP'ye Dayalı Telekom Ağı Dolandırıcılığı Tespiti için Temel Teknolojilerin Araştırılması ve Uygulanması (2023S169).
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
| Ad | Şirket | Katalog numarası | Yorumlar |
|---|---|---|---|
| Linux İşletim Sistemi (Ubuntu 22.04) | Çeşitli (Açık Kaynak Topluluğu) | N/A(Sürüm 22.04 LTS) | Geliştirme için açık kaynaklı işletim sistemi https://releases.ubuntu.com/22.04/ |
| NVIDIA RTX 3090 GPU | NVIDIA | 3090 | Derin öğrenme için yüksek performanslı GPU https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N/A (Sürüm &; ge; 3.8) | AI/ML geliştirme için programlama dili https://www.python.org/ |
| PyTorch | Meta AI | N/A (Sürüm 1.13) | Açık kaynak makine öğrenimi çerçevesi https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | N/A | Hafif ve güçlü kod düzenleyici https://code.visualstudio.com/ |
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste
İzin iste