$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Veri seti, 110 vakadan toplam 1.190 BT tarama dilimini içerir ve üç sınıfa ayrılır: normal (55 vaka), iyi huylu (15 vaka) ve kötü niyetli (40 vaka). Her vaka, birden fazla BT diliminden oluşur (her vaka başına yaklaşık 80 ila 200 dilim) ve torasik bölgenin çeşitli eksenel görüşleri sunar. BT görüntüleri, tam nefes tutma sırasında SOMATOM tarayıcı ile DICOM'da standart görüntüleme parametreleriyle alındı: tüp voltajı = 120 kV, dilim kalınlığı = 1 mm, pencere genişliği = 350–1.200 Hounsfield Birimi (HU) ve pencere merkezi değerleri = 50–600 HU.
Tüm görüntüler, analiz öncesinde tamamen kimliği silinerek kişisel tanım bilgilerini (PII) kaldırdı. Veri seti, katılımcı tıp merkezlerinin kurumsal inceleme kurulları tarafından etik olarak onaylandı ve denetim inceleme kurulu tarafından yazılı onay verildi. Vakalar, devlet çalışanları, çiftçiler ve cinsiyet, yaş, eğitim seviyesi ve yaşam statüsü açısından çeşitliliğe sahip çeşitli Irak eyaletlerinden (Bağdat, Vasit, Diyala, Salahuddin ve Babil dahil) sakinleri içeriyordu.
Veri seti kamuya açık ve kimliği silindiğinden, bu çalışmada kullanımı için ek etik onay gerekmemiştir. Veri seti, orijinal katkıda bulunanları ve barındırma platformu tarafından belirtilen şartlara ve koşullara uygundur.
Bu araştırmanın metodolojisi, IQ-OTH/NCCD akciğer kanseri veriseti 21 yardımıyla bir tahmin modeli oluşturmak için tasarlanmış çok aşamalı bir süreç kullanır. Bu metodoloji, daha az gecikme gerektiren tüketici odaklı sağlık cihazları için güçlü bir zemin oluşturur ve bu da daha iyi doğruluk sağlar. Şekil 2 , önerilen modelin çalışma mekanizmasını göstermektedir.

Şekil 2: Ön işleme, artırma, Görme Transformatörü sınıflandırması ve değerlendirme adımlarını gösteren önerilen modelin iş akışı diyagramı. Bu şekilin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
1. Veri seti açıklaması
IQ-OTH/NCCD akciğer kanseri veri seti, 2019 sonbaharında Irak-Onkoloji Eğitim Hastanesi/Ulusal Kanser Hastalıkları Merkezi'nde toplanmıştır. Kullanılan veri setinin eğitim kısmı, farklı sınıfların örnek örneklerinin sayısını gösteren Tablo 2'de açıklaması verilen 1.097 görüntü içeriyordu.
| Sınıf | Görüntü sayısı |
| Normal | 416 |
| Benign | 120 |
| Habis | 561 |
Tablo 2: Veri setinden normal, iyi huylu ve kötü niyetli BT görüntülerinin örnek örnekleri.
IQ-OTH/NCCD akciğer kanseri veri seti, normal, iyi huylu ve kötü huylu BT taramalarının kapsamlı şekilde temsil edilmesi nedeniyle seçilmiştir. LIDC-IDRI ve NSCLC-Radiomics gibi diğer veri setleri mevcut olsa da, ya öncelikle nodul tespitine odaklanır ya da iyi huylu vakalardan yeterli örnekleri yoktur. IQ-OTH/NCCD veri seti çalışmamız için özellikle uygundur; çünkü Görme Transformatoru'nun üç sınıfta ayrım edici özellikleri öğrenmesine olanak tanır ve akciğer BT görüntülerindeki ince desenlerin sağlam sınıflandırılmasını sağlar.
2. Veri ön işleme
Ön işleme, sinir ağı üzerinden işlenecek verilerde tutarlılık ve uygun ayarlamalar yoluyla model performansını artırmada önemli bir adımdır. Sinir ağı için giriş boyutunda tutarlılığı sağlamak amacıyla, tüm görüntüleri aynı boyutta olan 256 x 256 piksele ölçeklendirdik ve veri 0 ile 1 arasında piksel değerine normalleştirildi, böylece model eğitimi ve yakınsamasını iyileştirmek umuduyla elde edildik. Tablo 3 , artırma tekniği değerlerini içermektedir.
| Teknik | Değer |
| Normal -leştirme | - |
| Yeni -den boyutlandırma | image_size x image_size |
| RandomRotation | faktör=0.02 |
| RandomZoom | height_factor=0.2, width_factor=0.2 |
Tablo 3: Parametre aralıklarıyla uygulamalı artırma teknikleri.
Modelin aşırı uyuma karşı dayanıklılığını artırmak ve genelleştirme yeteneğini artırmak için, rastgele dönüşler ve zoom gibi veri artırma teknikleri uygulanır; bu teknikler, farklı hastalarda görülebilecek akciğer kanseri belirtilerinin farklı açılar ve boyutları simüle edilir. Bu çalışmada 0,02 radyan'dan eşit açılarla rastgele dönüşler ve yükseklik ile genişlik faktörleri değişen rastgele zoom dönüşümleri uygulandı. Artırma sonrası görüntüler Şekil 3'te gösterilmiştir.

Şekil 3: Dönüşüm, yakınlaştırma ve modelin genelleştirilmesini iyileştirmek için dönüşüm, yakınlaştırma ve normalizasyonu gösteren artırma sonrası BT görüntüleri. Bu şekilin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Bu ön işleme teknikleri gereklidir ve modelin dayanıklılığını sağlamak için tüm sınıflarda artırma uygulanmıştır.
3. Model mimarisi
Yeni Vision Transformer (ViT) çerçevesini karmaşık görüntü verilerini etkili şekilde işlemek için uyarlayan model mimarisi, BT taramalarını normal, iyi huylu ve kötü niyetli olmak üzere üç kategoriye ayırmayı amaçlamaktadır. Bu yöntemle 256 x 256 piksel giriş görüntüleri işlenir. Tutarlılığı garanti etmek ve daha verimli model öğrenimini teşvik etmek için, her görüntü boyutlandırma ve normalleştirme gibi birkaç ön işleme işleminden geçirilir. Modelin görüntü ölçeği ve yönelimindeki değişikliklere karşı dayanıklılığını artırmak için tasarım, normalizasyon, yeniden boyutlandırma, 0.02 radyanlık rastgele dönüşler ve %20'ye kadar rastgele yakınlaştırmalar gibi yöntemler kullanan bir veri artırma katmanıyla başlar. Büyütme sonrası model, her fotoğraftan 16 x 16 piksel yama alır, böylece her görüntüde 256 patch bulunur.
Algoritma 1, önerilen modelin iş akışını, nasıl inşa edildiğini ve modele göre yapılan ince ayarları tanımlar.
Algoritma 1: Görme Transformatörleri kullanılarak akciğer kanseri sınıflandırması
Giriş: IQ-OTH/NCCD veri setinden CT görüntüleri I seti
Çıktı: Sınıflandırma sonuçları C'yi kategorilere ayırır: Normal, İyi Zararlı, Kötü Zararlı
Ön:
for each image i in I do
i <- Resize(i, 256 x 256) // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i) // Apply random rotations and zooms
end for
Model Kurulumu:
Initialize Vision Transformer (ViT) Model
Set number of patches P = 16 x 16
Set number of heads H = 6 in multi-head attention
Antrenman:
for epoch = 1 to MaxEpochs do
for each batch b in I do
Patches <- ExtractPatches(b, P)
EncodedPatches <- PatchEncoder(Patches)
AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
ClassLogits <- TransformerEncoder(AttentionWeights)
Loss <- ComputeLoss(ClassLogits, TrueLabels)
UpdateModelWeights(Loss)
end for
if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
break
end if
end for
Doğrulama:
Split data into TrainingSet (80%) and ValidationSet (20%)
ComputeValidationMetrics(ValidationSet)
Değerlendirme:
C <- Classify(I)
ComputePerformanceMetrics(C)
Return C
Yamalar arasındaki uzamsal ilişkileri korumak için, bu yamalar (denklem 1) 768 boyutlu vektörlere düzleştirilir (çünkü her yama 16 x 16 x 3 = 768 boyutludur) ve ardından bir patch kodlama katmanından geçer; bu katman, her vektörün konumsal gömülemeler entegre edilerek 64 boyutlu bir uzaya projeksiyonu sağlar. Mimarinin çekirdeği, her biri altı başlı çoklu başlı dikkat mekanizmasına sahip sekiz transformator katmanından oluşur; bu da modelin görüntünün farklı bölümlerine aynı anda odaklanmasını ve geniş bir özellik yelpazesini yakalamasını sağlar. 2, 3 ve 4 denklemleri kullanılarak temsil edilir.

Burada μ ortalamadır ve σ2 x girdisinin varyansıdır ve ε sıfıra bölünmeyi önlemek için küçük bir sabittir.

Burada Q sorgu matrisi, K anahtar matris, V değer matrisi ve dk anahtar vektörlerin boyutudur.


Burada WiQ, WiK ve WiV sırasıyla sorgular, anahtarlar ve değerler için öğrenilen ağırlık matrisleridir ve WO çıkış ağırlık matrisidir.
Önerilen modelin blok diyagramı Şekil 4'te gösterilmiştir.

Şekil 4: MLP başlığı ile Vision Transformer modelinin blok diyagramı, ana işlem katmanları ve mimarisi detaylandırıyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Her transformatör katmanı, gizli birimlerin önce 128'e yükseltilmiş ve sonra 64'e indirilmiş çok katmanlı bir algı (MLP) içerir; bu da karmaşık bağımlılıkları yakalamak için bilgi akışını etkili bir şekilde genişletir ve sıkıştırır.
Dropout, aşırı uyumu önlemek için dikkat mekanizmaları ve MLP'ler içinde stratejik olarak 0.1 oranında uygulanır. Transformatör kodlayıcısından çıkan çıktı, sırasıyla 2.048 ve 1.024 birimden oluşan iki yoğun katmandan oluşan bir MLP başlığı üzerinden işlenir; aktivasyon için Gauss Hata Doğrusal Birimleri (GELU) kullanılır; bu ünitenin derin öğrenme uygulamalarında iyi performans gösterdiği gösterilmiştir. Bu, denklem 5 kullanılarak sağlanır.

W1 ve W2 ağırlık matrisleri, b1 ve b2 yanlılıktır ve GELU kullanılan aktivasyon fonksiyonudur.
Transformatör katmanlarında aşırı uyumu önlemek için önemli özellik bilgilerini kaybetmeden 0.1 bir çıkış kullanıldı. GELU aktivasyon fonksiyonu, trafo tabanlı modellerde gradyan akışını ve yakınsamayı teşvik eden pürüzsüz doğrusal olmayan özellikleri nedeniyle kullanılmıştır. Dışarı çıkma, denklem 6 kullanılarak düzenlenir.
Burada p, terk oranıdır (örneğin, 0.1 veya 0.5), ve antrenman sırasında giriş birimlerinin p'sini rastgele sıfıra ayarlar.
Bu katmanlarda 0.5 drop out oranı, aşırı uyumu azaltmaya daha da yardımcı olur. Modelin son katmanı, bu çok sınıflı sınıflandırma ayarı için uygun seyrek kategorik çapraz entropi kaybı fonksiyonu (denklem 8) kullanarak normal, iyi huylu ve kötü huylu kategorilere karşılık gelen üç sınıf logitini çıkaran bir logits katmanıdır (denklem 7).


Burada zi , i sınıfı için logits vektörüdür, SoftMax(zi)) tahmin edilen olasılıkları temsil eder ve yi gerçek sınıf etiketidir.
Model, Adam optimizatorunun bir uzantısı olan AdamW optimizatörü (denklemler 9, 10, 11, 12 ve 13) ile derlenmiştir; bu da ağırlık düşüşünü daha etkili şekilde yöneten, öğrenme hızı 0.001 ve ağırlık düşüşünü 0.0001 olarak ayarlayan, hem öğrenme hızını hem de model kararlılığını optimize eden bir yöntemdir.





Burada mt ve v t gradyanların birinci ve ikinci momentleridir
ve
önyargılı momentlerdir, η öğrenme hızıdır ve ε sıfıra bölünmeyi önlemek için küçük bir sabittir.
Model eğitildiğinde, GPU hızlandırmadan daha hızlı hesaplama için 32 parti boyutu kullanır ve 100 dönem boyunca eğitim alacak şekilde yapılandırılmıştır.
Ancak eğitim, model gelişmeyi durdurduğunda eğitimi sınırlamak için doğrulama kaybını erken durdurma mekanizmasına sahiptir; böylece hesaplama kaynakları tasarrufu sağlanır ve 5 ardışık dönem aşırı eğitilmesini önler. Model performansı, seyrek kategorik doğruluk ve en iyi 2 doğruluk gibi metriklerle takip edilir; bu ölçümler, modelin en olası tahmin edilen kategoriler arasında sınıflandırma yeteneği hakkında bilgi verir. Model eğitimi için geri çağrılar, en yüksek performanslı modeli doğrulama doğruluğuna göre kaydeden kontrol noktalarını içerir; böylece eğitim süreci bittikten sonra modelin en başarılı versiyonunun korunmasını sağlar. Bu sağlam ve iyi planlanmış mimari, tıbbi görüntüleme verilerini işleme için transformatörlerin yeteneklerinden yararlanarak, sağlık tanısında ana uygulamalar için çağdaş yapay zeka yöntemlerini kullanırken son derece gelişmiş bir yaklaşımla hizmet vermektedir.
4. Eğitim ve doğrulama
Model, NVIDIA P100 GPU kullanılarak Kaggle ortamında eğitildi ve eğitim sürecinde 32 toplu toplu gradyan inişi kullanıldı. Eğitim sırasında kullanılan optimizer AdamW idi; öğrenme oranı 0.001 ve ağırlık kaybı 0.0001; Bu, hızlı bir yakınlaşma ile biraz düzenleme arasında iyi bir dengeydi. Model 100 dönem için eğitilmişti, ancak doğrulama kaybı durumunda erken durma ve 5 dönemlik sabırla kullanıldı. Basitçe söylemek gerekirse, eğitim 5 sürekli dönem boyunca doğrulama kaybını iyileştirmezse, aşırı uyum ve hesaplama verimliliği nedeniyle eğitim dururdu. Çoğu durumda, bu model dönemin ağırlıklarını en az doğrulama kaybıyla geri getiriyor, bu da en iyi performans gösterdiğini ve tüm 100 dönemi çalıştırmasına gerek olmadığını gösteriyordu. Modeli eğitmek için toplamda yaklaşık 32 dakika kaldı.
Eğitim sırasında, metrikler seyrek kategorik doğruluk ve ilk 2 doğruluk içeriyordu; bu doğruluk hem eğitim hem de doğrulama setlerinde izlendi. Bu metrikler, bir modelin doğru sınıfı ne sıklıkla tahmin ettiğine ve doğru sınıfın en iyi iki tahmin arasında olup olmadığına dair içgörü sağlar; bu da tıbbi uygulamalarda önemlidir çünkü yüksek güvenle yanlış sınıflandırmalar önemli sonuçlar doğurabilir. Kayıp ve doğruluk için öğrenme eğrileri Şekil 5'te görselleştirilmiştir.
.
Şekil 5: Eğitim ve doğrulama doğruluğu ve kayıp eğrileri, 50 dönem boyunca istikrarlı öğrenme ve minimum aşırı uyum göstermektedir. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Mevcut çalışmada çapraz doğrulama yapılmadı. Bu kurulum, transformator katmanlarında ve MLP başlıklarının boyutlarında ayarlamalar dahil olmak üzere model mimarisiyle verimli denemeler yapılmasına olanak sağladı ve modelin görünmeyen doğrulama verileri üzerinde iyi genelleştirilmesini sağladı.
5. İstatistiksel analiz
Vision Transformer modelinin performansı, IQ-OTH/NCCD akciğer kanseri veri setine dayanarak istatistiksel olarak analiz edilmiştir. Hassasiyet, hatırlama, F1 puanı ve doğruluk sırasıyla 14,15,16,17 denklemleri kullanılarak hesaplandı. Bu dördü, sınıflandırma görevleri için kullanılan geleneksel ölçütler olarak kabul edilir; çünkü her sınıf için sınıflandırma ve sınıflandırma aşamasında modelin performansı hakkında bilgi ortaya koyabiliyorlar.




Habarat, bir modelin sınıftaki tüm ilgili örnekleri tanımlama yeteneğinin ölçüsüdür; hassasiyet ise gerçekten doğru olan pozitif tanımlamaların oranıdır. F1 puanı, her ikisi de önemli olduğunda hatırlama ve hassasiyeti dengeler.
Bu ödevde kullanılan performans ölçütleri Matthews Korelasyon Katsayısı (MCC)-denklem 18- ve Cohen'in Kappa denklemi 19'du.


Burada P0 gözlemlenen anlaşma, Pe ise beklenen anlaşmadır.
MCC, hem gerçek pozitifleri hem negatifleri, hem yanlış pozitifleri hem de yanlış negatifleri dikkate alan her şeyi kapsayan sınıflandırma performansının bir ölçütüdür. Değeri -1 ile 1 arasında olabilir; 1 mükemmel tahmin, 0 rastgele tahmin ve -1 tahmin ile doğru etiketler arasındaki tam uyumsuzluğu ifade eder. MCC, dengesiz veri setlerine uygulandığında farklı model performansları karşılaştırmaları için değerli oldu ve farklı sınıf büyüklüklerine bakmaksızın dengeli bir ölçüt sağladı.
Ek istatistiksel analizin bir parçası olarak, geri çağırmayı önceliklendiren F2 puanı, denklem 20'de gösterildiği gibi hesaplandı.

Modelin performansı ayrıca Ortalama Kare Hata (MSE), Kök Ortalama Kare Hatası (RMSE) ve Ortalama Mutlak Hata (MAE) kullanılarak da nicele edildi; bunlar genellikle regresyon görevleri için ölçümlerdir ancak burada sınıflandırma görevi için yön dikkate alınmadan ortalama hatanın büyüklüğünü nicele etmek üzere değiştirilmiştir.
ViT'lerin tüketici odaklı sağlık cihazlarına entegre edilmesinin pratik olup olmadığını belirlemek için, yalnızca modelin zamansal verimliliğine odaklanan kapsamlı performans değerlendirme sonuçları gerçekleştirdik. Tek veya sadece birden fazla görüntünün tahmin edilmesi için geçen süreyi raporlayan fonksiyonlar oluşturduk; çünkü bu durum gerçek zamanlı uygulamalar için özellikle önemli hale geliyor. Her görüntü için, tahmin yapmaya başlamadan önce, veriler önce modelin istediği giriş görüntüsünün şekline girecek şekilde önceden işlenir. Tahminin başladığı ve tahminin tamamlandığı zamanı, zaman ve gecikme sonuçlarını almak için kaydettik. Zaman ve ortalama gecikme, sırasıyla denklem 21 ve denklem 22 kullanılarak hesaplandı.


Nerede:
- N, görüntülerin (örneklerin) sayısıdır.
- Tenden, I-ci görüntünün tahmin edilmesinden sonra kaydedilen zamandır.
- tstart, i-ci görüntünün tahmin edilmesinden önce kaydedilen zamandır.
Önerdiğimiz Vision Transformer modelinin sağlamlığını değerlendirmek için görüntülere sistematik olarak ek gürültü ve bulanıklık eklenerek daha fazla deneyler yapıldı. Gauss gürültüsü, her piksele 0.4 gürültü faktörü ile eklenirken, [0,1] aralığındaki piksel değerleri kırpılırdı. Bulaştırma faktörü, Gauss bulanıklığı ile 45× 45 çekirdek boyutuyla azaltıldı. Bu deneyler, modeli simüle edilmiş algısal görüntü kalitesi bozulmaları altında kapsamlı değerlendirmek için tasarlanmıştır.