$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışma, kamuya açık ve anonimleştirilmiş bir veri seti kullandı; bu nedenle, bilgilendirilmiş onay gerekmiyordu. Önerilen yaklaşım altı bileşenden oluşur: ön işleme, konvolüsyon modülü, dikkat modülü, konvolüsyon ve dikkat modüllerinin entegrasyonu ve tamamen bağlı (FC) katmanlar. Şekil 1 , yöntemimizin tüm iş akışını göstermektedir.
Veri seti edinimi
Etiketlenmiş beyin MRI görüntüleri, dört tümör kategorisi ve normal dokudan oluşan kamuya açık bir Kaggle veri setinden elde edilir.
Veri ön işleme
Görüntüler eşit bir çözünürlükte yeniden boyutlandırılır ve yoğunluk normalleştirilir. Genelleştirmeyi iyileştirmek için isteğe bağlı artırma (dönme, takla atma, yakınlaştırma) uygulanır. Veri seti, eğitim (%70) ve test (%30) setlerine ayrılmıştır.
Model mimarisi
ImageNet'te önceden eğitilmiş üç omurga CNN'i—MobileNetV2, EfficientNetV1 ve Inception-ResNet-V2—MRI görüntüleri kullanılarak beyin tümörlerini dört kategoriye ayırmak için kullanıldı. MobileNetV2 ve EfficientNetV1, 224 × 224 piksel giriş boyutuyla yapılandırılmışken, Inception-ResNet-V2 ise 299 × 299 piksel giriş boyutu gerektiriyordu. Transfer öğrenme sürecinde, başlangıçtaki konvolüsyon katmanlar genelleştirilmiş görüntü özelliklerini korumak için dondurulurken, üst katmanlar beyin tümörü sınıflandırması için modeli uyarlamak üzere ince ayar edilmiştir. Her omurga, Küresel Ortalama Havuzlama, yoğun katmanlar, düzenlendirme için dropout ve dört sınıfı tahmin etmek için Softmax aktivasyon fonksiyonunu içeren hafif bir sınıflandırma başıyla eşleştirildi. Dropout, aşırı uyumu azaltmak ve genellemeyi artırmak için uygulandı. Tasarlanmış mimari, verimli özellik çıkarımı daha düşük hesaplama talepleriyle etkili bir şekilde birleştirerek, hassas sınıflandırmayı kolaylaştırırken kaynak sınırlı ve kavram kanıtı senaryolarında kullanıma uygun kaldı.
Dikkat odaklı özellik çıkarımı
Giriş görüntüleri, başlangıçta bir konvolüsyon katmandan ve ardından özel bir dikkat modülünden geçer. Paralel maksimum havuzlama ve ortalama havuzlama, belirgin ve bağlamsal özellikleri yakalar; bunlar tümörle ilgili bölgeleri vurgulamak için konvolüsyonla birleştirilir ve iyileştirilir.
Konvolüsyon omurga ve füzyon
Dikkat ağırlıklı özellikler önceden eğitilmiş omurgalara (MobileNetV2, EfficientNetV1 veya Inception-ResNet-V2) iletilir. Yüksek seviyeli konvolüsyon katmanlar, bellek erişimini azaltmak ve hesaplama verimliliğini artırmak için mantıksal olarak birleştirilir.
Sınıflandırma
Düzleştirilmiş özellikler, ReLU6 aktivasyonu ve dropout ile tamamen bağlı katmanlardan geçirilir, böylece son dört sınıf softmax sınıflandırması için kompakt bir temsil oluşturur.
Değerlendirme
Model performansı, test setinde doğruluk, hassasiyet, hatırlama, F1 puanı ve karışıklık matrisleri kullanılarak değerlendirilir.
Çerçeve geliştirme
Önerilen çözüm Python dilinde uygulanmış ve yürütme için Keras kullanılmıştır. Tablo 1 hiperparametreleri göstermektedir. Veri seti, 70:30 oranında bir eğitim seti ve test seti olarak bölünür. Her veri seti için nihai dengeli performansı göstermek için beş farklı rastgele tren/test bölünmesi kullanılır.
Ön işleme
Giriş görüntüleri güncellenmelidir çünkü MobileNetV2 çerçevesi önerilen çözümün temelini oluşturur. Fotoğraflardan yüksek çözünürlüklü özellikleri çıkarmak için, giriş boyutuyla önceden eğitilmiş MobileNetV2 modeli kullanılır. Her giriş görüntüsü daha sonra [-1, 1] aralığında 224×224 piksele ölçeklenir.
Konvolüsyon modeli
MobileNetV2, hesaplama taleplerini en aza indirmek için tasarlanmış verimli bir Konvolüsyon Sinir Ağı (CNN) mimarisini kullanarak görüntü tanıma yeteneğini geliştirir. Geleneksel CNN'ler yüksek hassasiyet sağlarken, genellikle önemli bellek ve işlem gücü gerektirirler. MobileNetV1, standart konvolüsyonu iki ayrı işleme ayıran derinlik olarak ayrılabilir konvolüsyon kavramını tanıttı: girdileri filtrelemek için derinlik yoluyla konvolüsyon ve özellikleri entegre etmek için noktasal konvolüsyon (nokta yoluyla konvolüsyon). MobileNetV2, bu fikri genişletme katmanları, derinlik konvolüsyonu, projeksiyon katmanları ve kalıntı bağlantılardan oluşan darboğaz kalıntı blokları dahil ederek geliştirir. Projeksiyon katmanı, özellik kanallarını sıkıştırırken, kalıntı bağlantılar ağ boyunca daha iyi bilgi akışını sağlar. Kararlılığı artırmak ve öğrenme performansını artırmak için, konvolüsyon işlemlerden sonra ReLU6 aktivasyonu ve toplu normalizasyon uygulanır.
Bu araştırmada, ImageNet üzerinde önceden eğitilmiş MobileNetV2, özellikleri çıkarmak için omurga modeli olarak kullanıldı; böylece etkili yüksek seviyeli anlamsal temsiller sunuldu ve beyin tümörü sınıflandırması için hesaplama maliyetlerini düşük tuttu. Her konvolüsyon katmanından sonra, ReLU aktivasyon fonksiyonunun bir uyarlaması olan bir ReLU6 aktivasyon katmanı bulunur; burada boyut altı olarak maksimize edilir, ayrıca bir toplu normalizasyon katmanı bulunur. Yaygın 1x1 konvolüsyon, ortalama havuzlama ve sınıflandırma katmanları, kalan 17 darboğaz bloğuna uygulanarak tam MobileNetV2 mimarisini oluşturur. MobileNetV2'yi omurga ağı olarak ImageNet üzerinde önceden eğitilmiş olarak kullandık. Böyle bir durumda, konvolüsyon harita, MobileNetV2 konvolüsyon katmanından geçtikten sonra son kalıntı bloktan elde edilir. Alt seviyedeki kalıntı bloklar daha küçük özellik haritaları üretir. Bu tür bloklar, genel görüntü tanımlaması için yüksek seviyeli veri toplamadıkları için araştırmamıza katkıda bulunmazlar. Model oluşturma ve eğitim sırasında, 7 × 7 3D özellik haritası üreten konvolüsyon katmanlardan önceki katmanlar sabit tutulur. Matematiksel terimlerle, bu aşağıdaki Eq (1)'de ifade edilir:
F1(I) = Konv(I) (1)
Burada, F1(I), giriş görüntüsünün I'inden çıkarılan konvolüsyon özelliği temsil eder.
Odak modülü
İnsan beyninin dikkat mekanizması, insanların doğal olarak bir görüntüdeki her detaydan çok önemli görsel girdilere odaklandığını ima eder ve bu dönüşüm ağının tasarımının temelini oluşturur. Bu fikir sayesinde derin öğrenme araştırmalarında çok sayıda dikkat temelli model oluşturulmuştur. Beyin tümörü temsillerinde görülen mekânsal korelasyonlar, önerilen dikkat mekanizmasıyla vurgulanır. Kanal dikkat modülü özellik kanalları arasında en önemli tümörle ilgili bilgileri yakarken, bölgesel dikkat birimi MRI görüntüsünün en bilgilendirici bölgelerini belirler. Yapılandırılmış dikkat yöntemi kullanılarak, önerilen odak birimi ayırt edici tümör bilgisi içeren alanlara odaklanır.
Özellik temsili iyileştirmek için, uzamsal özellik tespit aşamasından önce Üst Aktivasyon Havuzu ve dengeli özellik çıkarma gibi teknikler kullanılır. Bu strateji, modelin klinik açıdan önemli tümör bölgelerini vurgulama yeteneğini artırırken, alakasız arka plan detaylarını en aza indirir; böylece sınıflandırma doğruluğunu ve özellik öğrenme verimliliğini artırır. İkincisi ise maksimum havuzlu ve ortalama havuzlu tensorların birleştirilişidir. Son olarak, sigma aktivasyon fonksiyonu, 7x7 konvolüsyon filtre ile birleşerek görseller içindeki görsel uyaranlar aktive edilir. Odak modülünün farklı aşamaları (2) ve (3) denklemlerinde belirtilmiştir. burada dengeli Pool(F) ∈ RHxWx1 ortalama havuzlama işlemini temsil eder ve MaxPool(F) ∈ RHxWx1 maksimum havuzlama işlemini tanımlar.
F2(I) = [AvgPool(F); MaxPool(F)] (2)
Bu iki eleman haritası 3D olarak birleştirilerek bir eleman haritası oluşturulabilir
F2(I) = ∈ RHxwx1. F3(I) = σ(f7x7(F2(I))) (3)
burada σ, sigma'yı gösteren aktivasyon fonksiyonudur. HxWxC yükseklik kodlu tensör (V), genişlik (W) ve kalınlık (C) ile temsil edilen dikkat özellikleri, F3(I) ile temsil edilirken, f7x7 filtre boyutu konvolüsyon işlemini (7x7) temsil eder.
Dikkatin birleşimi ve bir konvolüsyon modeli
Tek bir kodlayıcıya dayanan bir ağın aksine, çoklu modal bir Birleştirme Birimi, modalitelerin büyük çoğunluğu için çok daha verimli ve kapsamlı bilgi çıkarabilir. Füzyon bloğu, maksimum temel Cross-modal özelliklere doğru yönlendirmek için tasarlanmıştır; bu nedenle, tümör bölgesi ekstraksiyonu için dikkat çekilecek alanları belirler. Bu, bireysel gizli temsillerin basit bir birleşimidir, ancak bazı bilgiler kaybolur. Böylece, Sitaula ve diğerlerinin temel özellik birleştirme yöntemi kullanılarak konvolüsyon ve gözlem modüllerinin özellik haritaları birleştirilerek birleşik nesne haritası oluşturuldu. Bu iki özellik haritası çeşitli görüntü özelliklerindeki farklılıkları yakaladığı için, max, minimum veya toplam tabanlı stratejiler yerine basit bir birleştirme yöntemi kullanmaya karar verdik. Bu ayrıca, tensör çarpım hesaplaması biçimi olarak bilineşer yöntemleri kullanan alternatif yöntemlere göre hesaplama açısından daha hafif hale getirir. Bu iki özellik birleştirildiğinde, ortaya çıkan şey özellik tensörü olarak adlandırılır. T karakterlerinin toplanmış tensör çıktısının matematiksel ifadesi, Denklem (4) ile verilir.
[F1(I), F3(I)] = T(I) (4)
Burada F1(I) ∈ RHxWx1 ve F2(I) ∈ RHxWx1280. Bunlar, aynı genişliğe (W) ve yüksekliğe (H) sahip 3D tensorlardır. Ayrıca, bunlar 3D K üretiminde birleştirilebilir; burada T(I) ∈ LxWx1281.
Tam Bağlı Katmanlar (FC)
Özellik birleşiminden sonra hacimsel tensörü lineer özellik vektöre dönüştürmek için bir dizi FC katmanı kullandık. Sınıflandırma başı, bir Küresel Ortalama Havuzlama katmanı, tamamen bağlı yoğun katmanlar, kesilme düzenleme ve bir Softmax çıkış katmanından oluşur. ReLU6 aktivasyon fonksiyonu kullanılır; 128 birim ve %50 kesinti olasılığı vardır.