Araştırma makalesi

Akciğer Kanseri Tespiti için BT Tarama Analizi İçin Yapay Zeki-Görme Transformatörü Kullanan Yeni Bir Yaklaşım

DOI:

10.3791/69302

28 Kasım 2025

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışmada Görme Transformatörlerinin kullanımı, BT görüntülerinden akciğer kanserinin sınıflandırılmasına olanak tanıyor ve 1.190 taramada %98,18 doğruluk elde edilmektedir. Model, tüketici sağlık tanı uygulamalarında standart konvolüsyon sinir ağı (CNN) modellerine kıyasla (%80–88) oranında gürültülü ve bulanık görüntülerde doğruluk seviyeleri ile tatmin edici bir dayanıklılık seviyesini korudu.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Görüntüleme çalışmalarında iyi huylu ve kötü huylu hastalık arasındaki ince farklar nedeniyle akciğer kanseri teşhisi zor olmaya devam etmektedir. Geleneksel, konvolüsyon sinir ağları (CNN'ler) tıbbi görüntüleme analizinin temel taşı olsa da, görüntüleme yöntemlerinin çeşitliliğinde uygulanabilirlik ve sağlamlık sınırlıdır. Makine öğreniminin ilerlemesi, tüketiciye yönelik sağlık teknolojilerinde geleneksel tanı yöntemlerini dönüştürüyor, erişilebilirlik ve kişiselleştirilmiş hasta bakımındaki süreçleri değiştiriyor. Bu makale, tüketici sağlık uygulamalarıyla ilişkili olarak BT taramalarıyla akciğer kanseri sınıflandırma görevinde Görme Transformatörlerinin (ViT) kullanımını açıklamaktadır. Vision Transformer modeli, 1.190 CT görüntüsünün tam veri seti üzerinde eğitildi ve 0,9676 Matthews Korelasyon Katsayısı ile %98,18 sınıflandırma oranı elde etti. Ayrıca, modelin performansı gerçek zamanlı gürültüler ve bulanık veri setleri kullanılarak simüle edilmiş gerçek zamanlı senaryolarda doğrulandı. Doğrulama yöntemlerini güçlü tanı doğruluğuyla korumasına rağmen, tüm veri setinde ViT modeli, bu koşullarda bile gürültülü görüntülerle bulanık görüntüleri ayırt etmek için %80-88 arasında doğruluk göstererek geleneksel doğrulanmış yöntemi geride bırakmıştır. İlk sonuçlar, görüntü varyasyonuyla ilgilenirken ViT'lerin sağlamlığı hakkında umut verici bilgiler verse de, değerlendirme çalışmaları nispeten küçük bir veri seti ve simülasyon ortamında tamamlandığı için sonuçları bağlamlandırmada yine de temkinli bir yaklaşım uygulanmalıdır. Gelecekteki araştırma çalışmaları için, gerçek klinik durumları daha temsil eden daha büyük veri setleri ve klinik olarak doğrulanmış veri setleri kullanmak, ViT'lerin onkoloji tanısının klinik tespitinde avantajlı olup olmadığını belirlemek ve erken tespiti geliştirmek için değerli olacaktır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Akciğer kanseri, her yıl milyonlarca hayatı etkileyen önemli bir küresel yüke sahiptir. Kanserin agresif yapısı ve sık sık geç ortaya çıkan hastalık durumu nedeniyle, akciğer kanseriyle ilişkili ölüm oranı yüksektir. Erken teşhis gereklidir çünkü müdahale tedavi etkinliğini ve sağkalım oranlarını büyük ölçüdeartırabilir 1. Ön tarama ve tanı için geleneksel yaklaşım, akciğer yapılarının daha ayrıntılı görselleştirilmesini sağlamak için bilgisayarlı tomografi (BT) kullanımı olarak devam etmektedir. Ancak, BT görüntülerinin değerlendirilmesi karmaşıktır ve tamamen radyolog olarak incelemecilere bağlıdır. Büyüklük, şekil ve yoğunluk gibi özelliklerdeki tümör değişkenliği de herhangi bir insan gözleminin güvenilirliğini azaltır. Çevresel faktörler, insan analizine dayalı karar vermenin doğruluğunu ve tekrarlanabilirliğini zorlayabilir.
Bu sınırlayıcı faktörler göz önünde bulundurulduğunda, son literatür, yapay zekanın (AI) tıbbi görüntülemeye uygulanması için güçlü bir çaba gösterdi ve derin öğrenme (DL) modellerine daha fazla odaklanıldı. DL, özellikle Konvolüsyon Sinir Ağları (CNN) ile, tıbbi görüntülemede gözlem kalıplarını bozarak görüntü analizlerinideğiştirmiştir 2. CNN'ler, onkolojide tanı süreçlerini önemli ölçüde geliştirerek, insan gözünde sıklıkla ayırt edilemez olan görüntüleme verilerindeki ince ve karmaşık özellikleri tespit etme yeteneğini göstermiştir. Bu gelişmelere rağmen, CNN'ler küçük veri setlerinde aşırı uyum sağlama, değişken alım koşullarında daha az dayanıklılık ve küresel bağımlılıkları kaçırabilecek yerel alıcı alanlara bağımlılık gibi kırılmalarla karşı karşıya. Hibrit CNN-Transformer yaklaşımları, konvolüsyon öncelikleri dikkat mekanizmalarıyla birleştirmeye çalışsa da, yine de konvolüsyon mimarilerin önyargılarını miras alır. Şekil 1 , veri setinden farklı sınıfları gösteren birkaç örneği gösterir.

figure-introduction-1
Şekil 1: Normal, iyi huylu ve kötü huylu akciğerlerin temsilci BT tarama dilimlerini gösteren farklı sınıfların görsel illüstrasyonu, benzerliklerini ve farklılıklarını vurgulamak. Bu şekilin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Normal, iyi huylu ve kötü huylu vakalar için temsil BT görüntüleri gösterilmektedir. Ayırt edici bölgelerin açıkça işaretlenmesi görsel yorumu kolaylaştırsa da, manuel açıklama uzman radyologlar gerektirir ve bu çalışmanın kapsamının dışındadır.

Doğal görüntüsınıflandırması 3 için tanıtılan Vision Transformers (ViT) umut verici bir alternatif sunuyor. CNN'ler veya CNN-Transformer hibritlerinin aksine, ViT'ler tüm görüntü boyunca küresel bağlamsal bilgileri yakalayan tamamen dikkat odaklı bir çerçeve kullanır. Bu çalışma özellikle BT görüntüleme için önemlidir; çünkü tümör özelliklerinin dağınık ve düzensiz karakteri sadece lokal alıcı alanlarla sınırlı değil, bölgelere yayılabilir. CNN-Transformer hibrit ağları konvolüsyon endüktif yanlılığı stabilize ederken, Vision Transformers (ViT) tamamen dikkat odaklı bir mimari uygular; bu da ViT modelinin tüm BT görüntülerinde uzun menzilli bağımlılıkları yakalamasına olanak tanır - bu, diffuz veya düzensiz akciğer tümörü özelliklerini değerlendirmede bir faydadır.

Tıbbi görüntüleme alanında transformatör tabanlı modellerin ortaya çıkışı yakın zamandadır; yumuşak radyoloji ve histopatolojide bazı örnekler bulunur; bu örnekler, geleneksel CNN sistemlerine kıyasla gürültüye dayanıklılık, bulanıklık ve tarayıcılar arası değişkenlik açısından belirgin avantajlar sergilemiştir; bu da bu klinik bağlamda yeniliği fazla vurgulamadan ViT'in gerekçelendirilmesini desteklemiştir. Akciğer kanseri görüntülemesine ve tüketici sağlık uygulamalarına karşı daha katı bir yaklaşım göz önüne alındığında, bu çalışma, kanıta dayalı tıbbın sağlam bir alanında pratikliği haklı çıkarmayı ve kendini transformatörler ve uygulamaları hakkında son zamanlarda sunulan tamamen fazla olmayan literatürler arasında konumlandırmayı amaçlamaktadır. Önceki literatürler, CNN tanı modalitelerinden alınan doğrulukların alımdeğişkenliği 7 nedeniyle ciddi şekilde düştüğünü göstermiştir; burada karşılık gelen ViT aynı bozulmalarla daha iyi performans gösterir,8 bu da değerlendirme modalitelerinde ViT kullanma kavramına inanç kazandırır ve tanı iş akışlarında tekrarlanabilirliği artırma seçeneği sunar. Ayrıca, veri seti boyutu, hesaplama yükü ve farklı klinik ortamlara genelleştirilebilirlik gibi pratik konular, veri artırma, transfer öğrenimi ve verimli ViTvaryantı 9,10 gibi yöntemlerin gerçek dünyada kullanımdaki bu potansiyel zorlukları ele almasıyla açıkça ortaya çıkmaktadır.

Bu çalışma, BT görüntü verilerini kullanarak akciğer kanseri aşamasında ViT'leri uygulayarak ve modelin gerçek dünya görüntüleme sorunları ortamında sağlamlığını ve genellenebilirliğini inceleyerek bu ilerlemeyi sürdürmektedir. BT verileri, klinisyenler için anlamlı özellikleri gizleyebilecek ölçüde artefaktlar, gürültü ve bulanıklık içerebilir. Bu görüntüleme değişikliklerine karşı dayanıklılığı inceleyerek, bu çalışma bakım ve tedaviyle ilgili kararlar alınırken uygulamada güvenilebilecek ek bir aşamalama çerçevesi sunmayı amaçlamaktadır.

Bu çalışmanın katkıları şunları içerir: i) özellikle IQ-OTH/NCCD veri setindeki BT görüntülerinden akciğer kanserini tespit etmek; Vision Transformer modelinin performansını kullanarak ve incelemek; ii) modelin gürültü ve bulanıklık gibi CT verilerinde yaygın olan gerçek dünya klinik görüntüleme senaryolarında ne kadar iyi performans gösterdiğini değerlendirmek; iii) ViT'lerin doğruluğu, hassasiyeti ve özgüllüğünün geleneksel CNN modellerine alternatif olarak karşılaştırılması.

Bu makalenin geri kalanının organizasyonu şöyledir: Bölüm II, derin öğrenme teknikleri kullanılarak akciğer kanseri tespitiyle ilgili önceki çalışmaları ve CNN'lerden ViT'ler gibi daha gelişmiş mimarilere geçişi içeren önceki çalışmaları içeren literatür incelemesini içerir. Bölüm III, veri ön işleme, model mimarisi bilgileri ve eğitim prosedürü detaylarını içeren bu çalışma için benimsenen yaklaşımı sunmaktadır. IV. Bölüm, ViT'lerin klinik yöntem olarak karayıcı özelliklerini ve bunun akciğer kanseri taramalarının doğruluğunu ve güvenilirliğini nasıl artırabileceğini özellikle ele alan bulguları sunmaktadır. Bölüm V, bulguları ve uygulamaya katkıları özetler ve tıbbi ortamda derin öğrenme bağlamında gelecekteki yönleri tartışır.

İLGİLİ ÇALIŞMALAR:

Derin öğrenme (DL), son on yılda özellikle akciğer kanseri teşhisinde tıbbi görüntülemeyi devrim niteliğinde dönüştürdü. Başlangıçta, disiplin, iyi oluşturulmuş ve doğru elde edilen özelliklere olan ihtiyaç nedeniyle kısıtlanan Destek Vektör Makineleri (SVM) ve karar ağaçları gibi geleneksel makine öğrenimi tekniklerine dayanıyordu. Bu özellikler, tıbbi filmlerin karmaşıklıklarını kötü ele alıyor ve çoğu zaman öznellik katıyordu.

Önemli bir değişim, veri11'den otomatik olarak hiyerarşik özelliklerin çıkarılmasını mümkün kılan Konvolüsyon Sinir Ağlarının (CNN) icadı ile gerçekleşti. CNN'ler, BT taraması tabanlı kanser aşamalama, nodul tespiti ve iyi huylu veya kötü niyetli olarak sınıflandırmada yaygın olarak kullanılmıştır. CNN'ler başarılıdır, ancak sınırları vardır. Bunlar arasında görüntü toplama ayarlarındaki farklılıklar ve gizlilik sorunları ile tıbbi açıklamanın emek yoğun doğası nedeniyle elde edilmesi zor olan büyük, açıklamalı veri setlerine ihtiyaç yer alıyor. Tablo1 12,13,14,15,16,17,18,19,20, akciğer kanseri teşhisi alanında yapılan son çalışmaların özetini sunar.

Crasta, Lavina Jean, Rupal Neema ve Alwyn Roshan Pais (2024) [20]BT görüntüleri kullanarak akciğer kanseri tespiti ve sınıflandırması için yeni bir derin öğrenme çerçevesi sunmak [20].Makale, segmentasyon için 3D-VNet ve sınıflandırma için 3D-ResNet tanıtarak, önceki yöntemlere göre doğruluk ve dayanıklılık artışlarını sergiliyor.
Crasta, Lavina Jean, Rupal Neema ve Alwyn Roshan Pais (2024) [20]BT görüntüleri kullanarak akciğer kanseri tespiti ve sınıflandırması için yeni bir derin öğrenme çerçevesi sunmak [20].Makale, segmentasyon için 3D-VNet ve sınıflandırma için 3D-ResNet tanıtarak, önceki yöntemlere göre doğruluk ve dayanıklılık artışlarını sergiliyor.

Tablo 1: Kullanılan teknikleri ve rapor edilen performansı anlatan son çalışmaların özeti.

Bir görüntünün tüm bağlamını aynı anda dikkate alan öz-dikkat süreçleri kullanılarak, Vizyon Dönüştürücüleri (ViT), görüntüyle ilgili görevlerde CNN'lere rekabetçi bir alternatif olarak ortaya çıkmaya başlamıştır. ViT'ler özellikle tıbbi görüntüleme için umut vericidir, çünkü bazı bölgelerin önemi, küresel işleme yetenekleri nedeniyle görüntünün daha uzak kısımlarına bağlı olabilir. Ancak, taramalarda birçok hastalık göstergesi arasındaki korelasyonları tanımak gibi karmaşık görevleri üstlenme kapasitelerine rağmen, ViT'ler tıbbi görüntüleme alanında hâlâ iyi incelenmemiştir.

ViT, tüketici odaklı sağlık cihazları alanında geniş kapsamlı şekilde incelenmemiştir. Bu çalışma, tüketici odaklı sağlık hizmetleri cihazlarının iyi performans gösterebileceği ve gerçek zamanlı olarak doğru tahminler verebilecekleri yüksek doğruluk ile daha az gecikme arasındaki boşluğu kapatmayı amaçlamaktadır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Veri seti, 110 vakadan toplam 1.190 BT tarama dilimini içerir ve üç sınıfa ayrılır: normal (55 vaka), iyi huylu (15 vaka) ve kötü niyetli (40 vaka). Her vaka, birden fazla BT diliminden oluşur (her vaka başına yaklaşık 80 ila 200 dilim) ve torasik bölgenin çeşitli eksenel görüşleri sunar. BT görüntüleri, tam nefes tutma sırasında SOMATOM tarayıcı ile DICOM'da standart görüntüleme parametreleriyle alındı: tüp voltajı = 120 kV, dilim kalınlığı = 1 mm, pencere genişliği = 350–1.200 Hounsfield Birimi (HU) ve pencere merkezi değerleri = 50–600 HU.

Tüm görüntüler, analiz öncesinde tamamen kimliği silinerek kişisel tanım bilgilerini (PII) kaldırdı. Veri seti, katılımcı tıp merkezlerinin kurumsal inceleme kurulları tarafından etik olarak onaylandı ve denetim inceleme kurulu tarafından yazılı onay verildi. Vakalar, devlet çalışanları, çiftçiler ve cinsiyet, yaş, eğitim seviyesi ve yaşam statüsü açısından çeşitliliğe sahip çeşitli Irak eyaletlerinden (Bağdat, Vasit, Diyala, Salahuddin ve Babil dahil) sakinleri içeriyordu.

Veri seti kamuya açık ve kimliği silindiğinden, bu çalışmada kullanımı için ek etik onay gerekmemiştir. Veri seti, orijinal katkıda bulunanları ve barındırma platformu tarafından belirtilen şartlara ve koşullara uygundur.

Bu araştırmanın metodolojisi, IQ-OTH/NCCD akciğer kanseri veriseti 21 yardımıyla bir tahmin modeli oluşturmak için tasarlanmış çok aşamalı bir süreç kullanır. Bu metodoloji, daha az gecikme gerektiren tüketici odaklı sağlık cihazları için güçlü bir zemin oluşturur ve bu da daha iyi doğruluk sağlar. Şekil 2 , önerilen modelin çalışma mekanizmasını göstermektedir.

figure-protocol-1
Şekil 2: Ön işleme, artırma, Görme Transformatörü sınıflandırması ve değerlendirme adımlarını gösteren önerilen modelin iş akışı diyagramı. Bu şekilin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

1. Veri seti açıklaması

IQ-OTH/NCCD akciğer kanseri veri seti, 2019 sonbaharında Irak-Onkoloji Eğitim Hastanesi/Ulusal Kanser Hastalıkları Merkezi'nde toplanmıştır. Kullanılan veri setinin eğitim kısmı, farklı sınıfların örnek örneklerinin sayısını gösteren Tablo 2'de açıklaması verilen 1.097 görüntü içeriyordu.

SınıfGörüntü sayısı
Normal416
Benign120
Habis561

Tablo 2: Veri setinden normal, iyi huylu ve kötü niyetli BT görüntülerinin örnek örnekleri.

IQ-OTH/NCCD akciğer kanseri veri seti, normal, iyi huylu ve kötü huylu BT taramalarının kapsamlı şekilde temsil edilmesi nedeniyle seçilmiştir. LIDC-IDRI ve NSCLC-Radiomics gibi diğer veri setleri mevcut olsa da, ya öncelikle nodul tespitine odaklanır ya da iyi huylu vakalardan yeterli örnekleri yoktur. IQ-OTH/NCCD veri seti çalışmamız için özellikle uygundur; çünkü Görme Transformatoru'nun üç sınıfta ayrım edici özellikleri öğrenmesine olanak tanır ve akciğer BT görüntülerindeki ince desenlerin sağlam sınıflandırılmasını sağlar.

2. Veri ön işleme

Ön işleme, sinir ağı üzerinden işlenecek verilerde tutarlılık ve uygun ayarlamalar yoluyla model performansını artırmada önemli bir adımdır. Sinir ağı için giriş boyutunda tutarlılığı sağlamak amacıyla, tüm görüntüleri aynı boyutta olan 256 x 256 piksele ölçeklendirdik ve veri 0 ile 1 arasında piksel değerine normalleştirildi, böylece model eğitimi ve yakınsamasını iyileştirmek umuduyla elde edildik. Tablo 3 , artırma tekniği değerlerini içermektedir.

TeknikDeğer
Normal -leştirme-
Yeni -den boyutlandırmaimage_size x image_size
RandomRotationfaktör=0.02
RandomZoomheight_factor=0.2, width_factor=0.2

Tablo 3: Parametre aralıklarıyla uygulamalı artırma teknikleri.

Modelin aşırı uyuma karşı dayanıklılığını artırmak ve genelleştirme yeteneğini artırmak için, rastgele dönüşler ve zoom gibi veri artırma teknikleri uygulanır; bu teknikler, farklı hastalarda görülebilecek akciğer kanseri belirtilerinin farklı açılar ve boyutları simüle edilir. Bu çalışmada 0,02 radyan'dan eşit açılarla rastgele dönüşler ve yükseklik ile genişlik faktörleri değişen rastgele zoom dönüşümleri uygulandı. Artırma sonrası görüntüler Şekil 3'te gösterilmiştir.

figure-protocol-2
Şekil 3: Dönüşüm, yakınlaştırma ve modelin genelleştirilmesini iyileştirmek için dönüşüm, yakınlaştırma ve normalizasyonu gösteren artırma sonrası BT görüntüleri. Bu şekilin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Bu ön işleme teknikleri gereklidir ve modelin dayanıklılığını sağlamak için tüm sınıflarda artırma uygulanmıştır.

3. Model mimarisi

Yeni Vision Transformer (ViT) çerçevesini karmaşık görüntü verilerini etkili şekilde işlemek için uyarlayan model mimarisi, BT taramalarını normal, iyi huylu ve kötü niyetli olmak üzere üç kategoriye ayırmayı amaçlamaktadır. Bu yöntemle 256 x 256 piksel giriş görüntüleri işlenir. Tutarlılığı garanti etmek ve daha verimli model öğrenimini teşvik etmek için, her görüntü boyutlandırma ve normalleştirme gibi birkaç ön işleme işleminden geçirilir. Modelin görüntü ölçeği ve yönelimindeki değişikliklere karşı dayanıklılığını artırmak için tasarım, normalizasyon, yeniden boyutlandırma, 0.02 radyanlık rastgele dönüşler ve %20'ye kadar rastgele yakınlaştırmalar gibi yöntemler kullanan bir veri artırma katmanıyla başlar. Büyütme sonrası model, her fotoğraftan 16 x 16 piksel yama alır, böylece her görüntüde 256 patch bulunur.

Algoritma 1, önerilen modelin iş akışını, nasıl inşa edildiğini ve modele göre yapılan ince ayarları tanımlar.

Algoritma 1: Görme Transformatörleri kullanılarak akciğer kanseri sınıflandırması
Giriş: IQ-OTH/NCCD veri setinden CT görüntüleri I seti
Çıktı: Sınıflandırma sonuçları C'yi kategorilere ayırır: Normal, İyi Zararlı, Kötü Zararlı
Ön:
   for each image i in I do
i <- Resize(i, 256 x 256)         // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i)        // Apply random rotations and zooms
   end for

Model Kurulumu:
  Initialize Vision Transformer (ViT) Model
  Set number of patches P = 16 x 16
  Set number of heads H = 6 in multi-head attention

Antrenman:
  for epoch = 1 to MaxEpochs do
    for each batch b in I do
      Patches <- ExtractPatches(b, P)
      EncodedPatches <- PatchEncoder(Patches)
      AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
      ClassLogits <- TransformerEncoder(AttentionWeights)
      Loss <- ComputeLoss(ClassLogits, TrueLabels)
      UpdateModelWeights(Loss)
    end for
    if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
      break
    end if
  end for

Doğrulama:
  Split data into TrainingSet (80%) and ValidationSet (20%)
  ComputeValidationMetrics(ValidationSet)

Değerlendirme:
  C <- Classify(I)
  ComputePerformanceMetrics(C)
  Return C

Yamalar arasındaki uzamsal ilişkileri korumak için, bu yamalar (denklem 1) 768 boyutlu vektörlere düzleştirilir (çünkü her yama 16 x 16 x 3 = 768 boyutludur) ve ardından bir patch kodlama katmanından geçer; bu katman, her vektörün konumsal gömülemeler entegre edilerek 64 boyutlu bir uzaya projeksiyonu sağlar. Mimarinin çekirdeği, her biri altı başlı çoklu başlı dikkat mekanizmasına sahip sekiz transformator katmanından oluşur; bu da modelin görüntünün farklı bölümlerine aynı anda odaklanmasını ve geniş bir özellik yelpazesini yakalamasını sağlar. 2, 3 ve 4 denklemleri kullanılarak temsil edilir.

figure-protocol-3

Burada μ ortalamadır ve σ2 x girdisinin varyansıdır ve ε sıfıra bölünmeyi önlemek için küçük bir sabittir.

figure-protocol-4

Burada Q sorgu matrisi, K anahtar matris, V değer matrisi ve dk anahtar vektörlerin boyutudur.

figure-protocol-5
figure-protocol-6

Burada WiQ, WiK ve WiV sırasıyla sorgular, anahtarlar ve değerler için öğrenilen ağırlık matrisleridir ve WO çıkış ağırlık matrisidir.

Önerilen modelin blok diyagramı Şekil 4'te gösterilmiştir.

figure-protocol-7
Şekil 4: MLP başlığı ile Vision Transformer modelinin blok diyagramı, ana işlem katmanları ve mimarisi detaylandırıyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Her transformatör katmanı, gizli birimlerin önce 128'e yükseltilmiş ve sonra 64'e indirilmiş çok katmanlı bir algı (MLP) içerir; bu da karmaşık bağımlılıkları yakalamak için bilgi akışını etkili bir şekilde genişletir ve sıkıştırır.

Dropout, aşırı uyumu önlemek için dikkat mekanizmaları ve MLP'ler içinde stratejik olarak 0.1 oranında uygulanır. Transformatör kodlayıcısından çıkan çıktı, sırasıyla 2.048 ve 1.024 birimden oluşan iki yoğun katmandan oluşan bir MLP başlığı üzerinden işlenir; aktivasyon için Gauss Hata Doğrusal Birimleri (GELU) kullanılır; bu ünitenin derin öğrenme uygulamalarında iyi performans gösterdiği gösterilmiştir. Bu, denklem 5 kullanılarak sağlanır.

figure-protocol-8

W1 ve W2 ağırlık matrisleri, b1 ve b2 yanlılıktır ve GELU kullanılan aktivasyon fonksiyonudur.

Transformatör katmanlarında aşırı uyumu önlemek için önemli özellik bilgilerini kaybetmeden 0.1 bir çıkış kullanıldı. GELU aktivasyon fonksiyonu, trafo tabanlı modellerde gradyan akışını ve yakınsamayı teşvik eden pürüzsüz doğrusal olmayan özellikleri nedeniyle kullanılmıştır. Dışarı çıkma, denklem 6 kullanılarak düzenlenir.figure-protocol-9

Burada p, terk oranıdır (örneğin, 0.1 veya 0.5), ve antrenman sırasında giriş birimlerinin p'sini rastgele sıfıra ayarlar.

Bu katmanlarda 0.5 drop out oranı, aşırı uyumu azaltmaya daha da yardımcı olur. Modelin son katmanı, bu çok sınıflı sınıflandırma ayarı için uygun seyrek kategorik çapraz entropi kaybı fonksiyonu (denklem 8) kullanarak normal, iyi huylu ve kötü huylu kategorilere karşılık gelen üç sınıf logitini çıkaran bir logits katmanıdır (denklem 7).

figure-protocol-10

figure-protocol-11

Burada zi , i sınıfı için logits vektörüdür, SoftMax(zi)) tahmin edilen olasılıkları temsil eder ve yi gerçek sınıf etiketidir.

Model, Adam optimizatorunun bir uzantısı olan AdamW optimizatörü (denklemler 9, 10, 11, 12 ve 13) ile derlenmiştir; bu da ağırlık düşüşünü daha etkili şekilde yöneten, öğrenme hızı 0.001 ve ağırlık düşüşünü 0.0001 olarak ayarlayan, hem öğrenme hızını hem de model kararlılığını optimize eden bir yöntemdir.

figure-protocol-12

figure-protocol-13
figure-protocol-14
figure-protocol-15
figure-protocol-16

Burada mt ve v t gradyanların birinci ve ikinci momentleridir figure-protocol-17 ve figure-protocol-18 önyargılı momentlerdir, η öğrenme hızıdır ve ε sıfıra bölünmeyi önlemek için küçük bir sabittir.

Model eğitildiğinde, GPU hızlandırmadan daha hızlı hesaplama için 32 parti boyutu kullanır ve 100 dönem boyunca eğitim alacak şekilde yapılandırılmıştır.

Ancak eğitim, model gelişmeyi durdurduğunda eğitimi sınırlamak için doğrulama kaybını erken durdurma mekanizmasına sahiptir; böylece hesaplama kaynakları tasarrufu sağlanır ve 5 ardışık dönem aşırı eğitilmesini önler. Model performansı, seyrek kategorik doğruluk ve en iyi 2 doğruluk gibi metriklerle takip edilir; bu ölçümler, modelin en olası tahmin edilen kategoriler arasında sınıflandırma yeteneği hakkında bilgi verir. Model eğitimi için geri çağrılar, en yüksek performanslı modeli doğrulama doğruluğuna göre kaydeden kontrol noktalarını içerir; böylece eğitim süreci bittikten sonra modelin en başarılı versiyonunun korunmasını sağlar. Bu sağlam ve iyi planlanmış mimari, tıbbi görüntüleme verilerini işleme için transformatörlerin yeteneklerinden yararlanarak, sağlık tanısında ana uygulamalar için çağdaş yapay zeka yöntemlerini kullanırken son derece gelişmiş bir yaklaşımla hizmet vermektedir.

4. Eğitim ve doğrulama

Model, NVIDIA P100 GPU kullanılarak Kaggle ortamında eğitildi ve eğitim sürecinde 32 toplu toplu gradyan inişi kullanıldı. Eğitim sırasında kullanılan optimizer AdamW idi; öğrenme oranı 0.001 ve ağırlık kaybı 0.0001; Bu, hızlı bir yakınlaşma ile biraz düzenleme arasında iyi bir dengeydi. Model 100 dönem için eğitilmişti, ancak doğrulama kaybı durumunda erken durma ve 5 dönemlik sabırla kullanıldı. Basitçe söylemek gerekirse, eğitim 5 sürekli dönem boyunca doğrulama kaybını iyileştirmezse, aşırı uyum ve hesaplama verimliliği nedeniyle eğitim dururdu. Çoğu durumda, bu model dönemin ağırlıklarını en az doğrulama kaybıyla geri getiriyor, bu da en iyi performans gösterdiğini ve tüm 100 dönemi çalıştırmasına gerek olmadığını gösteriyordu. Modeli eğitmek için toplamda yaklaşık 32 dakika kaldı.

Eğitim sırasında, metrikler seyrek kategorik doğruluk ve ilk 2 doğruluk içeriyordu; bu doğruluk hem eğitim hem de doğrulama setlerinde izlendi. Bu metrikler, bir modelin doğru sınıfı ne sıklıkla tahmin ettiğine ve doğru sınıfın en iyi iki tahmin arasında olup olmadığına dair içgörü sağlar; bu da tıbbi uygulamalarda önemlidir çünkü yüksek güvenle yanlış sınıflandırmalar önemli sonuçlar doğurabilir. Kayıp ve doğruluk için öğrenme eğrileri Şekil 5'te görselleştirilmiştir.

.figure-protocol-19

Şekil 5: Eğitim ve doğrulama doğruluğu ve kayıp eğrileri, 50 dönem boyunca istikrarlı öğrenme ve minimum aşırı uyum göstermektedir. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Mevcut çalışmada çapraz doğrulama yapılmadı. Bu kurulum, transformator katmanlarında ve MLP başlıklarının boyutlarında ayarlamalar dahil olmak üzere model mimarisiyle verimli denemeler yapılmasına olanak sağladı ve modelin görünmeyen doğrulama verileri üzerinde iyi genelleştirilmesini sağladı.

5. İstatistiksel analiz

Vision Transformer modelinin performansı, IQ-OTH/NCCD akciğer kanseri veri setine dayanarak istatistiksel olarak analiz edilmiştir. Hassasiyet, hatırlama, F1 puanı ve doğruluk sırasıyla 14,15,16,17 denklemleri kullanılarak hesaplandı. Bu dördü, sınıflandırma görevleri için kullanılan geleneksel ölçütler olarak kabul edilir; çünkü her sınıf için sınıflandırma ve sınıflandırma aşamasında modelin performansı hakkında bilgi ortaya koyabiliyorlar.

figure-protocol-20
figure-protocol-21
figure-protocol-22
figure-protocol-23

Habarat, bir modelin sınıftaki tüm ilgili örnekleri tanımlama yeteneğinin ölçüsüdür; hassasiyet ise gerçekten doğru olan pozitif tanımlamaların oranıdır. F1 puanı, her ikisi de önemli olduğunda hatırlama ve hassasiyeti dengeler.
Bu ödevde kullanılan performans ölçütleri Matthews Korelasyon Katsayısı (MCC)-denklem 18- ve Cohen'in Kappa denklemi 19'du.

figure-protocol-24
figure-protocol-25

Burada P0 gözlemlenen anlaşma, Pe ise beklenen anlaşmadır.

MCC, hem gerçek pozitifleri hem negatifleri, hem yanlış pozitifleri hem de yanlış negatifleri dikkate alan her şeyi kapsayan sınıflandırma performansının bir ölçütüdür. Değeri -1 ile 1 arasında olabilir; 1 mükemmel tahmin, 0 rastgele tahmin ve -1 tahmin ile doğru etiketler arasındaki tam uyumsuzluğu ifade eder. MCC, dengesiz veri setlerine uygulandığında farklı model performansları karşılaştırmaları için değerli oldu ve farklı sınıf büyüklüklerine bakmaksızın dengeli bir ölçüt sağladı.

Ek istatistiksel analizin bir parçası olarak, geri çağırmayı önceliklendiren F2 puanı, denklem 20'de gösterildiği gibi hesaplandı.

figure-protocol-26

Modelin performansı ayrıca Ortalama Kare Hata (MSE), Kök Ortalama Kare Hatası (RMSE) ve Ortalama Mutlak Hata (MAE) kullanılarak da nicele edildi; bunlar genellikle regresyon görevleri için ölçümlerdir ancak burada sınıflandırma görevi için yön dikkate alınmadan ortalama hatanın büyüklüğünü nicele etmek üzere değiştirilmiştir.

ViT'lerin tüketici odaklı sağlık cihazlarına entegre edilmesinin pratik olup olmadığını belirlemek için, yalnızca modelin zamansal verimliliğine odaklanan kapsamlı performans değerlendirme sonuçları gerçekleştirdik. Tek veya sadece birden fazla görüntünün tahmin edilmesi için geçen süreyi raporlayan fonksiyonlar oluşturduk; çünkü bu durum gerçek zamanlı uygulamalar için özellikle önemli hale geliyor. Her görüntü için, tahmin yapmaya başlamadan önce, veriler önce modelin istediği giriş görüntüsünün şekline girecek şekilde önceden işlenir. Tahminin başladığı ve tahminin tamamlandığı zamanı, zaman ve gecikme sonuçlarını almak için kaydettik. Zaman ve ortalama gecikme, sırasıyla denklem 21 ve denklem 22 kullanılarak hesaplandı.

figure-protocol-27
figure-protocol-28

Nerede:

  • N, görüntülerin (örneklerin) sayısıdır.
  • Tenden, I-ci görüntünün tahmin edilmesinden sonra kaydedilen zamandır.
  • tstart, i-ci görüntünün tahmin edilmesinden önce kaydedilen zamandır.

Önerdiğimiz Vision Transformer modelinin sağlamlığını değerlendirmek için görüntülere sistematik olarak ek gürültü ve bulanıklık eklenerek daha fazla deneyler yapıldı. Gauss gürültüsü, her piksele 0.4 gürültü faktörü ile eklenirken, [0,1] aralığındaki piksel değerleri kırpılırdı. Bulaştırma faktörü, Gauss bulanıklığı ile 45× 45 çekirdek boyutuyla azaltıldı. Bu deneyler, modeli simüle edilmiş algısal görüntü kalitesi bozulmaları altında kapsamlı değerlendirmek için tasarlanmıştır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vision Transformer modeli, IQ-OTH/NCCD akciğer kanseri veri setlerinde çoklu değerlendirme metriklerinde olağanüstü sonuçlar göstererek normal, iyi huylu ve kötü huylu BT görüntülerini etkili bir şekilde ayırt etti. Genel model performansı, 220 görüntüden oluşan test veri setinde %98,18 yüksek doğruluğa ulaştı. Bu son derece yüksek doğruluk, modelin çok etkili bir şekilde genelletelebildiğini ve bu nedenle klinik ortamda kullanılabileceğini gösterir.

...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vision Transformer modelinin IQ-OTH/NCCD akciğer kanseri veri setinde yüksek doğrulukla değerlendirilmesi ve uygulanmasında dikkat çekici sonuçlar elde etmiştir. Bu modelde bir BT taramasının normal, iyi huylu ve kötü huylu olarak sınıflandırmanın genel doğruluğu %98,18'dir.

Bu üstün doğruluk, erken tanı ve yönetiminde çok önemli olan malign vaka tespiti için %100 hassasiyet gibi diğer önemli skorlarda modelin performansı ile daha da kanıtlanmaktadır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, çıkar çatışmaları olmadığını belirtirler.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, Prenses Nourah bint Abdulrahman Üniversitesi Araştırmacı Destek Projesi numarası (PNURSP2025R432), Prenses Nourah bint Abdulrahman Üniversitesi, Riyad, Suudi Arabistan tarafından desteklenmiştir.  Yazarlar, bu çalışmayı Büyüme Fonlama Programı hibe kodu (NU/GP/SERC/13/575-6) kapsamında finanse ettiği için Najran Üniversitesi Lisansüstü Çalışmalar ve Bilimsel Araştırmalar Dekanlığı'na minnettardır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
A100 GPU (CUDA)NVIDIACUDA Sürüm 11.6Model eğitimi ve değerlendirmesi için GPU hızlandırma.
AMD EPYC-7502P CPUAMDYokYüksek performanslı hesaplama için kullanılan işlemci.
Gigabit EthernetIntelYokCPS'de eşler arası güvenli iletişim için ağ oluşturma.
MatplotlibPython Yazılım VakfıSürüm 3.5Sonuçları çizmek için görselleştirme kütüphanesi.
Paillier KriptosistemiAçık Kaynak (TenSEAL aracılığıyla uygulanmıştır)YokGradyentler üzerinde toplama homomorfik şifrelemeyi etkinleştirir.
PySyftOpenMinedSürüm 0.6.0Farklılık gizlilik ve federe öğrenme kütüphanesi.
Python (Anaconda Dağıtımı)Anaconda IncSürüm 3.9Ön yüklü paketler ve ortam yönetim araçları içerir, betik yazma ve çerçeve geliştirme için kullanılır.
PyTorchMeta AISürüm 1.12Modelleri eğitmek için derin öğrenme çerçevesi.
RAMCorsair256 GigaByte (GB) Yoğun antrenman için yüksek hafıza desteği.
Scikit-learnPython Yazılım VakfıSürüm 1.1Performans değerlendirmesi için makine öğrenimi araçları.
SeabornPython Yazılım VakfıSürüm 0.11İstatistiksel veri görselleştirme kütüphanesi.
SSD DepolamaSeagate1 TeraBayt (TB)Hızlı veri depolama ve alma için.
TenSEALOpenMinedSürüm 0.3Güvenli toplama için homomorfik şifreleme kütüphanesi.
TensorFlowGoogleSürüm 2.9Difüzyon modelleri için derin öğrenme çerçevesi.
Ubuntu OSKanonikSürüm 20.04 LTSTüm deneyler için kullanılan işletim sistemi.

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Yapay Zeka T bbi G r nt lemeMakine renmesi Sa l k HizmetleriAkci er Kanseri S n fland rmasG r nt leme Dayan kl lTan sal Do rulukT bbi G r nt G r lt sOnkoloji Tan lar

İlgili makaleler