Dünyadaki en tehdit edici hastalıklardan biri beyin tümörüdür. Doğru bir teşhis, hastaların sağkalımı açısından faydalı olabilir. Buna rağmen, beyin tümörlerini erken evrede tespit edebilecek doğru bir tanı sistemine ihtiyaç duyulmaktadır. Bu sorunu çözmek için, DenseNet121 ve EfficientNetB7 modellerine dayalı, optimize edilmiş hiperparametreler ve ince ayarlı katmanlarla donatılmış hibrit bir çift derin öğrenme mekanizması kullanılarak, beyin tümörlerinin erken evrelerinde doğru şekilde tespit edilmesi için daha güvenilir bir teknik önerilmiştir. Önerilen yaklaşım, girdi olarak 2D MRI görüntülerini alır ve binary sınıflandırma veri seti Br35H için tümör varlığı veya yokluğu tahmini, diğer dört multiclass sınıflandırma veri seti için ise tümör kategorizasyonu çıktısı verir. Bu nedenle bu bölüm, Şekil 1'de gösterildiği gibi; veri toplama, veri ön işleme, veri bölme, model seçimi, öznitelik çıkarımı, tümör tahmini ve önerilen modelin değerlendirilmesi dahil olmak üzere, veri toplama aşamasından nihai çıktıya kadar önerilen yaklaşımın ana adımlarını göstermektedir.

Şekil 1: Önerilen metodoloji iş akışı. Bu diyagram; veri edinimi ve ön işlemeyi, özellik çıkarımı için iki ön eğitimli modeli, bu özelliklerin birleştirilmesini ve tümör sınıflandırması ile tipi için hiperparametre ince ayarlarını içeren önerilen modelin genel mimarisini göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.
Veri toplama
Herhangi bir deneysel araştırmada ilk adım veri edinimdir. Bunun için, beyin tümörü tespitinin teşhisi amacıyla birçok araştırmacı tarafından halihazırda kullanılmış olan Br35H24, Figshare25, Sartaj26, Masoud27 ve açık kaynaklı Kaggle28 kütüphanesinden alınan beyin tümörü MRI görüntü tabanlı veri seti dahil olmak üzere halka açık beş farklı veri seti seçilmiştir. Br35H veri seti, her bir sınıfta 1.500 adet olmak üzere sağlıklı ve sağlıksız (tümörlü) beyin görüntüleri şeklinde iki sınıftan oluşan 3.000 görüntüye sahiptir; Figshare veri seti ise tümör tipine göre üç gruba ayrılmış toplam 3.064 görüntüden oluşmaktadır: 1.426 gliom görüntüsü, 708 meningioma görüntüsü ve 930 hipofiz tümörü görüntüsü. Sartaj veri seti; gliomlar (926 görüntü), meningiomalar (937 görüntü), hipofiz tümörleri (901 görüntü) ve sağlıklı veya tümör yok (500 görüntü) olmak üzere dört tümör sınıfına ayrılmış 3.264 görüntüye sahiptir. Ayrıca Masoud veri seti de dört farklı tümör sınıfından oluşmakta olup görüntüleri yukarıda belirtilen üç veri setinden alınmıştır; toplam 7.023 görüntüden oluşan bu set daha sonra gliom (1621 görüntü), meningioma (1645 görüntü), hipofiz (1757 görüntü) ve sağlıklı veya tümör yok (2000 görüntü) şeklinde kategorize edilmiştir. Seçilen son veri seti, toplam 5.248 görüntü ile yine dört sınıftan oluşan MRI görüntü tabanlı bir veri setidir; bu set 1.312 gliom görüntüsü, 1.312 meningioma görüntüsü, 1.312 hipofiz görüntüsü ve 1.312 sağlıklı veya tümör yok görüntüsü şeklinde tümör tiplerine ayrılmıştır ve tümör tiplerine eşit şekilde bölündüğü için dengeli bir veri seti olarak kabul edilmektedir.
Veri ön işleme
Veri toplama işleminden sonraki adım, daha iyi sonuçlar elde etmek ve verilerden en iyi özelliklerin çıkarılması ile öğrenilmesini sağlayarak daha doğru sonuçlar üreten hesaplama yaklaşımları için temel olan ön işlemedir. Uygulanan ilk adım görüntü boyutlandırmasıdır. Farklı sınıflara ve aynı veri seti içinde bile farklı tümör sınıfları için farklı görüntü boyutlarına sahip, kamuya açık beş veri seti seçilmiş ve daha iyi model yorumlaması ve öğrenimi için tek tipleştirilerek 224 x 224 boyutuna getirilmiştir. Ayrıca, farklı açılardan ek örnekler oluşturularak tüm veri setlerine veri artırımı uygulanmış, böylece derin öğrenme (DL) modelleri tarafından özellik çıkarımı ve öğrenimi iyileştirilmiştir. Bunun için tüm görüntülere %7'lik bir döndürme aralığı uygulanarak görüntüler 7 dereceye kadar döndürülmüştür. Ayrıca, tüm görüntülere yatay ve dikey olarak %5 rastgele kaydırma uygulanmış, orijinal görüntülere göre yükseklik ve genişlikte %5 kaydırma yapılmıştır. Ardından görüntüler orijinal boyutlarına göre %10 yakınlaştırılmış ve son olarak tüm görüntüler yatay ve dikey olarak çevrilmiştir. Veri artırımı29 gerçekleştirmenin temel nedeni, orijinal veri örneklerinin çeşitli dönüştürülmüş versiyonları üzerinde eğitim yaparak aşırı öğrenmenin (overfitting) önüne geçmek ve modellerin genelleme yeteneğini artırmaktır. Veri setleri eğitim ve doğrulama olarak ayrılmadan önce, eğitim ve doğrulama sırasında kayıp (loss) hesaplamalarına yardımcı olan ve aynı zamanda veri örneklerini modellerin etiketleri doğru işlemesi için daha uygun hale getiren etiket kodlama (label encoding) işlemi uygulanmıştır. Ek olarak, veri seti her biri için %80'e %20 oranında30 eğitim ve doğrulama setlerine bölünmüştür ve Tablo 2 veri örneklerinin genel dağılımını ve eğitim ile doğrulama oranlarını göstermektedir.
| Veri Seti | Tümör Sınıfları | Toplam görüntü | Eğitim görüntüleri | Doğrulama görüntüleri |
| Br35H | Sağlıklı | 1500 | 1200 | 300 |
| Tümör | 1500 | 1200 | 300 |
| Toplam görüntü | 3000 | 2400 | 600 |
| Figshare | Gliom | 1426 | 1141 | 285 |
| Meningiom | 708 | 566 | 142 |
| Hipofiz | 930 | 744 | 186 |
| Toplam görüntü | 3064 | 2451 | 613 |
| Sartaj | Gliom | 926 | 741 | 185 |
| Meningiom | 937 | 749 | 188 |
| Tümör yok | 500 | 400 | 100 |
| Hipofiz | 901 | 721 | 180 |
| Toplam görüntü | 3264 | 2611 | 653 |
| Masoud | Gliom | 1621 | 1297 | 324 |
| Meningiom | 1645 | 1316 | 329 |
| Tümör yok | 2000 | 1600 | 400 |
| Hipofiz | 1757 | 1405 | 352 |
| Toplam görüntü | 7023 | 5618 | 1405 |
| Dengelenmiş beyin tümörü veri seti (BBT-Dataset) | Gliom | 1312 | 1050 | 262 |
| Meningiom | 1312 | 1050 | 262 |
| Tümör yok | 1312 | 1050 | 262 |
| Hipofiz | 1312 | 1050 | 262 |
| Toplam görüntü | 5248 | 4200 | 1048 |
Tablo 2: Veri seti dağılımı. Tablo, beyin tümörü veri setlerindeki toplam, eğitim ve doğrulama görüntü sayılarına ilişkin sınıf bazlı istatistikleri göstermektedir.
Br35H veri seti, 2400'ü eğitim ve 600'ü doğrulama için seçilmiş toplam 3000 görüntüden oluşmaktadır. Figshare veri seti 3064 görüntü içermektedir. Tüm görüntülerden 2451'i eğitim için seçilmiş, kalan 613'ü ise doğrulama için ayrılmıştır. Sartaj veri seti toplam 3264 görüntüye sahiptir; bunların 2611'i eğitimde ve kalan 653'ü doğrulamada kullanılmıştır. Masoud veri seti toplam 7023 görüntüye sahiptir; bunlardan 5618'i eğitim için, kalan 1405'i ise doğrulama için kullanılmıştır. BBT veri seti toplam 5248 görüntüye sahiptir. Toplam görüntülerden 4200'ü eğitim amaçlı, diğer kalan 1048 görüntü ise doğrulama amaçlı değerlendirilmiştir. Ek olarak, aşağıdaki Şekil 2 çeşitli beyin tümörü görüntülerini göstermektedir.

Şekil 2: Tümör tiplerini içeren beyin tümörü görüntüleri. Veri seti, dört sağlıklı beyin dokusu görüntüsü ve üç tümörlü görüntü içerir: gliom, meningiom ve hipofiz. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Önerilen model
Önişleme aşamasını takiben, bir sonraki adım yalnızca beyin tümörü sınıflandırması için etkili bir eğitim modeli önermektir. Bu amaçla, özellikle beyin tümörlerini sınıflandırmak için verimli bir eğitim modeli önerilmiştir. Bu kapsamda, görüntülerden özellik çıkarmak için DenseNet12131,32 ve EfficientNetB733 modellerini içeren, yeni ve verimli, hibrit özellik füzyonuna dayalı önceden eğitilmiş bir model önerilmiştir; ayrıca, çıkarılan bu özellikler birleştirilmiş ve beyin tümörlerini doğru şekilde teşhis etmek amacıyla eğitilebilir ve eğitilemez katmanlar dahil olmak üzere farklı şekilde optimize edilmiş hiperparametrelere aktarılmış ve yukarıdaki ilgili bölümlerde tartışılan halka açık beş farklı veri seti üzerinde uygulanmıştır. Ayrıca, DenseNet121 modeli 2017 yılında Gao Huang ve çalışma arkadaşları tarafından geliştirilmiştir ve 121 katmandan oluşmaktadır. Bu modelin temel amacı, özelliklerin yeniden kullanımını maksimize etmeye odaklanmak ve kaybolan gradyan problemini önlemektir34. Bu modeldeki katmanlar, her biri özellikleri çıkaran ve öğrenen çoklu konvolüsyonel katmanlar içeren yoğun bloklar (dense blocks) şeklinde düzenlenmiştir. Her katman, kendisinden önceki tüm katmanların özellik haritasını girdi olarak alır ve çıktısı bu katmanların çıktılarına bağlanarak aynı bloktaki sonraki katmanlara ileri beslemeli bir şekilde girdi olarak aktarılır. Ayrıca, yoğun bloklar arasına, her biri 1 × 1 konvolüsyonel katman, bir BatchNormalization katmanı ve 2 × 2 ortalama havuzlama (average pooling) katmanlarından oluşan ve model karmaşıklığını kontrol etmek için özellik haritasını küçülten geçiş katmanları eklenmiştir. Dahası, sınıflandırma için küresel ortalama havuzlama katmanından önce SoftMax aktivasyon fonksiyonuna (AF) sahip nihai bir katman eklenmiştir. DenseNet121 modelinin temel tasarımı aşağıdaki Şekil 334'te gösterilmiştir.

Şekil 3: DenseNet121 mimari detayı34. Bu şekil, tüm yoğun ve geçiş blokları dahil olmak üzere DenseNet121 modelinin mimari detaylarını göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Ayrıca, EfficientNetB7 modeli 2019 yılında Tan ve Lee tarafından geliştirilmiştir. B0'dan B7'ye kadar varyantları olan EfficientNet ailesine ait olan bu modelin temel amacı, daha az parametre ve daha az işlem gücü kullanarak diğer modellerden daha yüksek performans sergilemekle ilgilidir. Modelin temel özelliği olan bileşik ölçeklendirme (compound scaling) aracılığıyla; model genişliği (katman başına kanal sayısı), derinliği (katman sayısı) ve çözünürlüğün tamamı hassas bir şekilde ayarlanabilmektedir. Dahası, bu model; kanalları genişletmekten sorumlu olan 1 × 1 konvolüsyonel genişleme katmanı, her kanala ayrı ayrı konvolüsyon uygulamaktan sorumlu olan derinlemesine ayrılabilir konvolüsyon (depthwise separable convolution) ve kanal sayısını orijinal haline düşüren 1 × 1 konvolüsyonel projeksiyon katmanından oluşan MBConv (mobile inverted bottleneck convolutional) bloklarını içerir. Ayrıca, her MBConv bloğu, kanal bazlı özellikleri yeniden kalibre ederek ağın en önemli olanlara odaklanmasına yardımcı olan Sıkıştırma ve Uyarma (Squeeze and Excitation - SE) bloklarından35 oluşur. Ayrıca, sigmoid veya başka bir aktivasyon fonksiyonu (AF) yerine, negatif değerlere izin vererek ReLU'dan daha iyi performans gösteren ve gradyan akışına yardımcı olan Swish fonksiyonu kullanılır. Dahası, sınıflandırma amacıyla, küresel ortalama havuzlama (global average pooling) katmanından önce SoftMax AF içeren nihai bir çıktı katmanı eklenir. Şekil 435 EfficientNetB7 modelinin temel tasarımını, Şekil 5 ise önerilen model mimarisini göstermektedir.

Şekil 4: EfficientNetB7 mimari detayı35. Bu şekil, tüm mobil ters darboğaz evrişimli bloklarını içeren EfficientNetB7 modelinin mimari detayını göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 5: Önerilen hibrit füzyon model mimarisi. Önerilen mimari, ön işlemeden geçmiş görüntülerin, farklı hiperparametrelerle özelleştirilmiş üç bloktan oluşan özellik çıkarıcıya ve ardından bir çıktı katmanına nasıl aktarıldığını göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Ek olarak, ilk öznitelikler önceden eğitilmiş DenseNet121 ve EfficientNetB7 modellerinden çıkarılmıştır. Önceden eğitilmiş modellerin güncellenmiş ağırlıkları eğitilmiş modellere yüklenmiş ve modelin yeniden eğitilmesini önlemek için modellerin eğitilemez taban katmanları dondurulmuştur. Bunun, modelin geçmişteki en iyi bilgisini korumasına, yakınsamayı iyileştirmek için bu bilgileri yeni veri örnekleri ışığında uyarlamasına ve gelişmiş öznitelikleri eğitmek ve çıkarmak için ek katmanlara odaklanmasına yardımcı olması beklenmektedir. Aşağıdaki denklem 1 ve 2, DenseNet121 ve EfficientNetB7 modellerinin çalışma prensiplerini göstermektedir.
(1)
(2)
Yukarıdaki 1 ve 2 numaralı denklemler, önceden eğitilmiş modelin öznitelik çıkarma ile ilgili işleyişini göstermektedir; F1, X ile temsil edilen giriş görüntülerine işlem uygulanarak önceden eğitilmiş DenseNet121 modeli tarafından üretilen çıktı öznitelik haritalarını, F2 ise önceden eğitilmiş EfficientNetB7 modeli tarafından üretilen çıktı öznitelik haritalarını ifade eder. Ayrıca, W1 ve W2 sırasıyla DenseNet121 ve EfficientNetB7 modellerinin ilk blokları ve katmanlarıyla ilişkili öğrenilebilir parametreler veya ağırlıklardır. Dahası, ∈ RN ×H1×W1×C1 ve ∈ RN ×H2×W2×C2, sırasıyla DenseNet121 ve EfficientNetB7 modellerinin çıktı öznitelik haritalarının boyutluluğunu temsil eder ve boyutları H1 ×N×W1×C1 ile H2 ×N×W2×C2'dir; burada N, 16 olarak kabul edilen görüntülerin grup boyutunu (batch size) temsil eder. Ayrıca, H1×W1 DenseNet121 modeli için görüntülerin sırasıyla yüksekliğini ve genişliğini, H2×W2 ise EfficientNetB7 modeli için görüntülerin yüksekliğini ve genişliğini temsil eder ve 224 × 224 yükseklik ve genişlik boyutlarında seçilmiştir. C1 ve C2 sırasıyla DenseNet121 ve EfficientNetB7 modelleri için renk kanalını temsil eder. EfficientNetB7'den 2560 kanal ve DenseNet121'den 1024 kanal olarak modelden çıktı öznitelik haritaları alındıktan sonra, tüm uzamsal boyutların ortalaması alınarak uzamsal boyutu tek bir vektöre indirgemek için çıktı öznitelik haritalarına global average pooling 2D36 katmanı uygulanır; bu işlem, yorumlanabilir öznitelikler açısından daha iyi öznitelik çıkarma ve örüntü tanıma için bir sonraki katmana iletimi daha uygun hale getirir.
(3)
(4)
Yukarıdaki 3 ve 4 numaralı denklemler, sırasıyla DenseNet121 ve EfficientNetB7 modellerine uygulanan global average pooling 2D katmanının işleyişini göstermektedir; burada
ve
, havuzlanmış çıktının basit bir toplamdan ziyade bir ortalama olmasını sağlamak için her iki modelde de toplam uzamsal konum sayısına bölerek toplamın normalize edilmesi işlemini göstermektedir.
ve
ise özellik haritalarının uzamsal boyutlar boyunca toplamını temsil ederken, i ve j her iki model için özellik haritalarını toplamak amacıyla sırasıyla yükseklik ve genişlik boyunca yinelemek için kullanılır. Ayrıca, F1(i, j, :) ve F2(i, j, :), sırasıyla DenseNet121 ve EfficientNetB7 modelleri için tüm kanallar boyunca belirli uzamsal konumlardaki (i, j) özellik haritası değerlerini temsil eder. Bu havuzlama işlemi, her görüntüdeki en önemli özellikleri korurken uzamsal bilgileri daha kompakt ve doğru bir temsile toplar. Dahası, global average pooling katmanlarının çıktıları, her örnek için tek bir özellik vektörü üretmek üzere birleştirilir; bu işlem, her iki modelin güçlü yönlerinden yararlanarak performansı artırmak için farklı modellerden gelen özellikleri birleştirmek amacıyla sıklıkla kullanılır; Denklem 5 bunun nasıl çalıştığını göstermektedir.
(5)
Yukarıdaki denklem 5, G1 DenseNet121 modelinin özellikler vektörünü ve G2 EfficientNetB7 modelinin özellik vektörünü temsil ettiği iki farklı model özellik vektörünün [G1, G2] birleştirme prosedürünü göstermektedir; birleştirilmiş özellik vektörünün şekli RN ×(C1+ C2) ile temsil edilirken, burada N paralel olarak ilerleyen örneklerin sayısını temsil eden grup boyutudur ve (C1+ C2) sırasıyla model 1 ve 2'den elde edilen ve paralel olarak işlenen yaklaşık 3584 olan toplam özellik sayısıdır; birleştirilmiş çıktı özellik vektörü ise G ile temsil edilir. Ayrıca, daha doğru ve verimli sonuçlar elde etmek amacıyla, daha karmaşık özellikleri çıkarmak, genellemeyi iyileştirmek ve aşırı öğrenmeyi (overfitting) önlemek için birleştirilmiş modeli modifiye eden üç farklı blok eklenmiştir. Her blok, farklı sayıda nörona sahip bir yoğun katmandan (dense layer) oluşur; birinci blok, verilerdeki geniş bir özellik yelpazesini ve daha genel kalıpları yakalamaya odaklanan, yoğun katmanlarında 1024 nöron bulunduran bloktur, ikinci blok ise boyutluluğu azaltarak ve daha spesifik kalıplara odaklanarak özellikleri özellikle rafine eden, yoğun katmanında 512 nöron bulunduran bloktur. Üçüncü blok, sadece en ilgili özelliklerin ve kalıpların daha ilgili bir görevi yerine getirmek üzere çıktı katmanına aktarılmasını sağlamak için özellikleri daha spesifik olarak damıtan, yoğun katmanında 256 nöron içeren bloktur. Ayrıca, büyük ağırlıkları cezalandırarak aşırı öğrenmeyi önlemek için her bloktaki her yoğun katmana L2 düzenlileştirme37 yaklaşımları eklenmiştir ve bu durum aynı zamanda modelin daha karmaşık hale gelmesine neden olmaktadır. Ağların, tek bir nörona bağımlı olmayan daha sağlam özellikler geliştirmesini zorlamak amacıyla, her bloktan sonra sırasıyla 1, 2 ve 3. bloklar için nöronların rastgele %30, %20 ve %10'unu yok sayan bir dropout katmanı38 eklenmiştir. Ayrıca, eğitim sürecini stabilize etmek için her yoğun katmandan sonra, aktivasyonların sabit bir aralıkta kalmasını sağlayan ve ayrıca modelin eğitim aşamasında kaybolan gradyanlar (vanishing gradients) ve patlayan gradyanlar (exploding gradients) gibi sorunlardan kaçınmasına yardımcı olan bir BatchNormalization39 katmanı uygulanmıştır. Ek olarak, bu BatchNormalization katmanı, kayıp yüzeyini (loss landscape) düzleştirerek modelin daha hızlı yakınsamasına olanak tanıyarak eğitim sürecini hızlandırmış ve optimizatörler için küresel minimuma ulaşmayı kolaylaştırmıştır. Ayrıca, her blokta doğrusal olmama (non-linearity) durumu üretmek için, modelin karmaşık kalıpları öğrenmesini sağlayan leaky ReLU aktivasyonu40 kullanılmıştır; leaky ReLU, negatif girdiler için küçük, sıfır olmayan bir gradyana izin vererek nöronun inaktif hale gelmemesini sağladığı için diğer aktivasyon fonksiyonlarına göre avantajlara sahiptir. Ayrıca, aşağıdaki denklem 6, hibrit birleştirilmiş model ile entegre edilen farklı blokların çalışma prensibini göstermektedir.
(6)
Birleştirilmiş vektör elde edildikten sonra, G, 1024 nöronlu blok 1 yoğun katmana (tam bağlantılı) aktarılır; burada W1 ağırlık matrisi, giriş vektörü G'yi 1024 boyutlu bir çıkış vektörüne dönüştürür ve çıkış vektöründeki her bir öge, giriş özelliklerinin lineer bir kombinasyonudur. Ayrıca, modelin giriş özelliklerinin çıktısını bağımsız olarak kaydırmasına olanak tanıyan b1 sapma (bias) vektörü, çıktının 1024 ögesinin her birine eklenir. Dahası, L2 düzenleme terimi olan λ||W1||22, büyük ağırlıkları cezalandırarak modelin tek bir nörona aşırı bağımlı olmasını engeller ve böylece aşırı öğrenmenin (overfitting) önüne geçilmesine yardımcı olur. Burada, sinir ağındaki belirli bir katmanın ağırlık matrisi W1 iken, ||W1||22 ağırlık matrisi W1'nin karesel L2 normunu ve λ ise tüm bloklarda 0,1 olarak ayarlanan ve uygulanan düzenleme derecesini kontrol eden düzenleme parametresini ifade eder. Denklem 6'da gösterildiği üzere, birleştirilmiş vektör G'den gelen girişe yoğun katmanın ve L2 düzenlemesinin uygulanmasının ardından Z1 yeni özellik temsili haline gelir.
Blok 1'in yoğun katmanından Z1 olarak çıktı alındıktan sonra, eğitim sürecini hızlandırmak için kullanılan BatchNormalization katmanı uygulanmıştır ve aşağıdaki denklem 7 bunun nasıl çalıştığını göstermektedir.
(7)
σ2, son katman Z1 çıktısının batch genelindeki varyansını temsil ederken; μ, ilk yoğun katmanda 1024 olan ve her nöron için ayrı ayrı hesaplanan Z1 çıktısının ortalamasıdır. ε ise sayısal kararlılığı sağlamak ve sıfıra bölünmeyi önlemek için eklenen küçük bir sabittir. Normalize edilmiş çıktı, öğrenilebilir ölçek parametresi γ ile model tarafından ayarlanabilirken, normalize edilmiş çıktı öğrenilebilir kaydırma parametresi β ile kaydırılabilir. Son olarak, yoğun katman çıktısına BatchNormalization katmanı uygulandıktan sonra, normalize edilmiş çıktı Z1, aktivasyonların farklı katmanlar genelinde tutarlı bir dağılıma sahip olmasını sağlayarak eğitimin stabilize edilmesine ve hızlandırılmasına yardımcı olur. BatchNormalization işleminden sonra, normalize edilmiş çıktı Z1, ağda doğrusal olmama durumu yaratarak verilerdeki karmaşık örüntülerin öğrenilmesine yardımcı olan leaky ReLu aktivasyon fonksiyonundan geçer. ReLU veya başka bir aktivasyon fonksiyonu seçmek yerine, ReLU aktivasyon fonksiyonu gibi küçük negatif değerleri 0 yapmak yerine bunları da dikkate alan ve böylece "dying ReLU" problemini aşan ReLU fonksiyonunun modifiye edilmiş versiyonu olan leaky ReLU seçilmiştir. Aşağıdaki Denklem 8 bunun nasıl çalıştığını göstermektedir.
(8)
Z1, BatchNormalization katmanının çıktısını temsil eder ve doğrusal olmama işlemini gerçekleştirmek üzere Leaky ReLU'ya girdi olarak aktarılır; ∝ ise fonksiyonun negatif kısmının eğimini belirlemek için kullanılan küçük bir sabittir. Ayrıca, A1, doğrusal olmama işlemi uygulandıktan sonra elde edilen çıktıyı gösterir. Son olarak, Leaky ReLU aktivasyonundan girdi olarak alınan A1 çıktısına, denklem 9'da gösterildiği üzere bir dropout katmanı uygulanır.
(9)
Burada A1, son ReLu aktivasyon fonksiyonundan alınan orijinal aktivasyon fonksiyonu çıktısıdır ve p, nöronların bir kısmını devre dışı bırakmak için 0 ile 1 arasında değişen ve üç blok katmanı için sırasıyla 0.3, 0.2 ve 0.1 olarak seçilen dropout oranıdır. Ayrıca A1′, bazı nöronların 0'a ayarlandığı dropout katmanının uygulanmasından sonraki modifiye edilmiş çıktıyı göstermektedir. Bunu kullanmanın temel avantajı, ko-adaptasyonu azaltmanın yanı sıra aşırı öğrenme (overfitting) sorunlarını önlemektir. Dahası, blok1'den gelen çıktı A1′, daha soyut özellikler çıkarmak için tekrar bir sonraki bloğa aktarılmış ve blok 1'deki parametrelerin aynısı uygulanmıştır; ancak yoğun katmanda 1024 yerine 512 nöron ve 0.3 yerine 0.2 dropout oranı ile bazı farklılıklar gözetilmiş, diğer operasyonel dizilimler ise aynı tutulmuştur; bu durum aşağıdaki 10 ila 13 numaralı denklemlerde açıklanmıştır.
(10)
(11)
(12)
(13)
Blok 1'den alınan A1′ çıktısı, ağırlık matrisi W2'nin giriş vektörü A1′'i 512 boyutlu bir çıktı vektörüne dönüştürdüğü ve çıktı vektöründeki her bir öğenin giriş özelliklerinin doğrusal bir kombinasyonu olduğu 512 nöronlu blok 2 yoğun katmanından (tam bağlantılı) geçirilir. Ayrıca, modelin giriş özelliklerinin çıktısını bağımsız olarak kaydırmasına olanak tanıyan b2 sapma (bias) vektörü, çıktının 512 öğesinin her birine eklenir. Buna ek olarak, büyük ağırlıkları cezalandıran λ||W2||22 şeklinde L2 regülarizasyonu uygulanmıştır; bu, modelin bu spesifik bloktaki herhangi bir nörona aşırı derecede güvenmesini önleyerek aşırı öğrenmeyi (overfitting) azaltmaya hizmet eder. Burada, W2 sinir ağındaki belirli bir katmanın ağırlık matrisi, λ ise 0,1 olarak uygulanan ve regülarizasyon derecesini kontrol eden regülarizasyon parametresidir. Blok 1'den gelen girişe yoğun katman ve L2 regülarizasyonu uygulandıktan sonra ortaya çıkan yeni özellik temsili Z2 olur ve bu durum denklem 10'da gösterilmiştir.
Ayrıca, eğitim sürecini hızlandırmak için yeni özellik Z2'ye BatchNormalization katmanı uygulanmıştır; σ22 grup genelindeki varyansı temsil ederken, μ2 ise Z2 çıktısının ortalamasıdır. ε, sayısal kararlılığı sağlamak için dahil edilen küçük bir sabit iken, γ modelin normalize edilmiş çıktıyı değiştirmesine olanak tanıyan öğrenilebilir bir ölçekleme parametresidir ve β modelin normalize edilmiş çıktıyı kaydırmasına olanak tanıyan öğrenilebilir bir kaydırma parametresidir. Son olarak, Denklem 11'de gösterilen BatchNormalization katmanı uygulandıktan sonra, normalize edilmiş Z2 çıktısı, ağda doğrusal olmama durumu oluşturan ve Denklem 12'de gösterilen leaky ReLU AF'den geçirilmiştir. Burada Z2, doğrusal olmama işlemini gerçekleştirmek üzere Leaky ReLU'ya girdi olarak aktarılan BatchNormalization katmanının çıktısına aittir. A2 ise doğrusal olmama durumu uygulandıktan sonra elde edilen çıktıyı göstermektedir.
Son olarak, Denklem 13'te gösterildiği üzere, Leaky ReLU aktivasyonundan girdi olarak alınan A2 çıktısına bir dropout katmanı uygulanır. Burada A2, son ReLU aktivasyon fonksiyonundan alınan çıktıyı; p2 ise nöronların bir kısmını devre dışı bırakmak amacıyla bu blok için 0,2 olarak seçilen dropout oranını temsil eder. Ayrıca A2′, dropout katmanı uygulandıktan sonra bazı nöronların 0'a ayarlandığı modifiye edilmiş çıktıyı göstermektedir. Daha sonra, blok 2'den gelen A2′ çıktısı, daha soyut öznitelikler çıkarmak için tekrar üçüncü bloğa aktarılır ve blok 2'deki parametrelerin aynısı uygulanır; ancak yoğun katmanda 512 yerine 256 nöron ve 0,2 yerine 0,1'lik bir dropout oranı ile farklılaşır. Diğer işlemsel diziler aynıdır ve aşağıdaki 14 ile 17 arasındaki denklemlerde açıklanmıştır.
(14)
(15)
(16)
(17)
Blok 2'den A2′ şeklinde alınan çıktı, 256 nöronlu blok 3 yoğun katmanına (tam bağlantılı) aktarılır; burada ağırlık matrisi W3, giriş vektörü A2′'yi 256 boyutlu bir çıktı vektörüne dönüştürür ve çıktı vektöründeki her bir eleman, giriş özelliklerinin lineer bir kombinasyonudur. Ayrıca, modelin giriş özelliklerinin çıktısını bağımsız olarak kaydırmasına olanak tanıyan b3 sapma (bias) vektörü, çıktının 256 elemanının her birine eklenir. Dahası, büyük ağırlıkları cezalandırarak modelin tek bir nörona aşırı bağımlı olmasını engelleyen ve böylece aşırı öğrenmenin (overfitting) önüne geçmeye yardımcı olan L2 düzenlemesi uygulanır; burada λ||W3||22 formülü kullanılır. Burada W3, sinir ağındaki belirli bir katmanın ağırlık matrisidir; uygulanan düzenleme derecesi ise 0,01 olarak belirlenen λ düzenleme parametresi ile kontrol edilir. Denklem 14'te gösterildiği üzere, blok 3'ten aktarılan girişe yoğun katman ve L2 düzenlemesi uygulandıktan sonra yeni özellik temsili Z3 olur.
Ayrıca, eğitim sürecini hızlandırmak için yeni özellik Z3'e BatchNormalization katmanı uygulanmıştır; burada σ32 grup genelindeki varyansı, μ3 ise Z3 çıktısının ortalamasını temsil eder. ε ise sayısal kararlılık için eklenen küçük bir sabittir. Normalize edilmiş çıktı, model tarafından öğrenilebilir ölçek parametresi γ3 kullanılarak ayarlanabilir ve öğrenilebilir kaydırma parametresi β3 kullanılarak kaydırılabilir. Son olarak, Denklem 15'te gösterilen BatchNormalization katmanının uygulanmasının ardından, normalize edilmiş Z3 çıktısı, ağda lineer olmayan bir yapı oluşturan ve Denklem 16'da gösterilen leaky ReLU aktivasyon fonksiyonundan geçirilmiştir. Burada Z3, lineerlik dışı işlem gerçekleştirmek üzere Leaky ReLU'ya girdi olarak aktarılan BatchNormalization katmanı çıktısına aittir. A3 ise lineerlik dışı işlem uygulandıktan sonra elde edilen çıktıyı göstermektedir.
Son olarak, denklem 17'de gösterilen, Leaky ReLU aktivasyonundan girdi olarak alınan A3 çıktısına bir dropout katmanı uygulanır. Burada A3, son ReLU aktivasyon fonksiyonundan alınan çıktıyı; p3 ise nöronların bir kısmını devre dışı bırakmak için bu blok için 0,1 olarak seçilen dropout oranını temsil eder. Ayrıca A3′, dropout katmanı uygulandıktan sonra, bazı nöronların 0'a ayarlandığı modifiye edilmiş çıktıyı göstermektedir.
Ayrıca, blok 3 A3′ çıktısı, veri setindeki gerçek sınıf sayısını temsil eden K sayıda nörona sahip olan son yoğun katmandan sınıflandırma amacıyla geçirilmiştir; bu durum aşağıdaki denklem 18'de açıklanmıştır.
(18)
Kalın katmanla ilişkili ağırlık matrisi, 256 boyutlu A3′ vektörünü, önceki bloktan öğrenilen özellikleri temsil eden ve çıktı olarak gelen k-boyutlu vektöre dönüştürmekten sorumlu olan Wk'dir. Ayrıca, bk girdinin sıfır olduğu durumlarda aktivasyon fonksiyonunun sıfır olmayan bir çıktı vermesini sağlamak için tahmini ayarlayan sapma (bias) vektörünü temsil eder ve Zk aktivasyon fonksiyonu uygulanmadan önceki son katmanın çıktısıdır; bu çıktı her bir sınıfa karşılık gelen logitleri üretir ve son olarak logit Zk'yı her bir sınıfın olasılığına dönüştüren SoftMax41 sınıflandırıcı uygulanmıştır; bu durum denklem 19 ve 20'de gösterilmiştir.
(19)
(20)
iinci sınıfın öngörülen olasılığı yi ile, K sınıf sayısı, Zk, i iinci sınıfın logiti ve eZk, i ise iinci sınıfın logitinin eksponansiyeli ile temsil edilir. y, tüm olası sınıfların olasılık dağılımını gösterir ve olasılıkların toplamının 1 olmasını sağlar. Aşağıdaki Tablo 3, yeniden üretilebilirliği ve performansı artırmak için benimsenen mimari ayrıntılar da dahil olmak üzere, önerilen hibrit modeli eğitmek için kullanılan hiperparametre ayrıntılarını sunmaktadır.
| Hiper Parametreler | Önerilen Model (FusionNetX) |
| Görüntü boyutu | 224 × 224 |
| Omurga Mimarisi | BBA1 ve BBA2 olarak önceden eğitilmiş EfficientNetB7 ve DenseNet121 |
| Veri Artırımı | Rotasyon aralığı = 7, |
| Genişlik/yükseklik – kaydırma aralığı 0.05'e kadar, |
| Yakınlaştırma aralığı 0.01'e kadar, |
| Yatay/dikey – çevirme |
| Veri bölme oranı | Sabit randome_state = 42 ile tabakalı örnekleme üzerinden eğitim için %80 ve doğrulama için %20 |
| Öznitelik çıkarımı ve füzyon | Her bir omurganın çıktısına küresel ortalama havuzlama uygulanır: BBA1 için 2560 ve BBA2 için 1024; 3584 ortak öznitelik vektörü elde etmek için birleştirilir. |
| Tam Bağlantılı Blok Kompozisyonu | 1 çıktı katmanlı 3 tam bağlantılı blok. Her blok sırasıyla L2 düzenlemesi (λ=0.01), BatchNormalization, LeakyReLU (α=0.01), (0.3, 0.2 ve 0.1) Dropout ve (1024, 512, 256) gizli boyut içerir. Füzyon kafasında ek bir Atlamalı bağlantı (Skip connection) kullanılmamıştır |
| Aktivasyon fonksiyonu | Leaky ReLU & SoftMax |
| Optimize edici ve Öğrenme oranı | Öğrenme oranı zamanlayıcısı olmaksızın sabit 0.00001 ile Adam. |
| Kayıp fonksiyonu | sparse_categorical_crossentropy |
| Yığın boyutu | 16 |
| Epoklar | Her veri seti için sabit 100 epok |
| Kullanılan platform | TensorFlow ve Keras platformları ile P100 GPU ve 16GB VRAM içeren Kaggle Notebook. |
Tablo 3: Önerilen modeli eğitmek için kullanılan hiperparametreler ve önerilen mimari detaylar.Bu tablo, ince ayarlı parametreler ve uygulama ortamıyla birlikte, önerilen modelin yapısal ve mimari detaylarını sunmaktadır.