Onderzoeksartikel

Een nieuwe benadering met behulp van een AI-vision Transformer voor CT-scananalyse voor longkankerdetectie

DOI:

10.3791/69302

28 november 2025

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het gebruik van Vision Transformers in deze studie maakt het mogelijk om longkanker te classificeren op basis van CT-beelden, met een nauwkeurigheid van 98,18%, bij 1.190 scans. Het model behield een bevredigend niveau van robuustheid, met nauwkeurigheidsniveaus tussen (80–88%) bij ruisachtige en wazige beelden, vergeleken met standaard convolutionele neurale netwerkmodellen (CNN), in consumentengezondheidsdiagnostische toepassingen.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het diagnosticeren van longkanker blijft een uitdaging vanwege de subtiele verschillen tussen goedaardige en kwaadaardige ziekte in beeldvormingsonderzoeken. Hoewel traditionele, convolutionele neurale netwerken (CNN's) de ruggeneen zijn geweest van medische beeldvormingsanalyse, hebben ze nog steeds beperkte toepasbaarheid en robuustheid bij variatie in beeldvormingsmethoden. De vooruitgang van machine learning transformeert traditionele diagnosemethoden in consumentgerichte zorgtechnologieën, en verandert processen op het gebied van toegankelijkheid en gepersonaliseerde patiëntenzorg. Dit artikel beschrijft het gebruik van Vision Transformers (ViTs) voor de taak van longkankerclassificatie met CT-scans, in verband met consumentengezondheidstoepassingen. Het Vision Transformer-model werd getraind op een volledige dataset van 1.190 CT-beelden en behaalde een classificatiepercentage van 98,18% met een Matthews-correlatiecoëfficiënt van 0,9676. Daarnaast werd de prestaties van het model gevalideerd op gesimuleerde realtime scenario's met behulp van realtime ruisen en vervaagde datasets. Hoewel validatiemethoden met hoge diagnostische nauwkeurigheid worden behouden, presteerde het ViT-model over de gehele dataset ook beter dan de conventionele gevalideerde methode door een nauwkeurigheid van tussen de 80-88% te tonen om onderscheid te maken tussen ruisachtige beelden en vage beelden, zelfs onder deze omstandigheden. Hoewel de eerste resultaten veelbelovende informatie geven over de robuustheid van ViTs bij het omgaan met beeldvariatie, moet toch een voorzichtige benadering worden toegepast bij het contextualiseren van resultaten, aangezien de evaluatiestudies zijn uitgevoerd binnen een relatief kleine dataset en simulatieomgevingen. Het zal waardevol zijn voor toekomstige onderzoeksstudies om grotere datasets te gebruiken die representatiever zijn voor echte klinische aandoeningen en klinisch gevalideerde datasets om te bepalen of ViTs voordelig zijn voor klinische identificatie van oncologische diagnostiek en om vroege detectie te verbeteren.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Longkanker heeft een aanzienlijke wereldwijde last en treft elk jaar miljoenen levens. Door de agressieve aard van de kanker en de frequente laat-presenterende ziekte is de sterfte die samenhangt met longkanker hoog. Vroege opsporing is essentieel omdat de interventie de effectiviteit en overlevingskansen van de behandeling aanzienlijk kanverbeteren. De conventionele aanpak voor voorlopige screening en diagnose blijft het gebruik van computertomografie (CT) om een gedetailleerdere visualisatie van de longstructuren mogelijk te maken. De evaluatie van de CT-beelden is echter complex en volledig afhankelijk van de beoordelaars als radiologen. Tumorvariabiliteit in eigenschappen zoals grootte, vorm en dichtheid beperkt ook de betrouwbaarheid van menselijke observaties. Omgevingsfactoren kunnen de nauwkeurigheid en reproduceerbaarheid van besluitvorming op basis van menselijke analyse in twijfel trekken.
Met deze beperkende factoren in gedachten heeft recente literatuur sterk ingezet voor de toepassing van kunstmatige intelligentie (AI) op medische beeldvorming, met meer focus op deep learning (DL)-modellen. DL, vooral met Convolutionele Neurale Netwerken (CNN's), heeft het patroon van waarnemingen in medische beeldvorming verstoord door de analyses van beeldente veranderen 2. CNN's hebben de diagnostische processen in de oncologie aanzienlijk verbeterd, wat aantoont dat ze subtiele en complexe kenmerken kunnen identificeren in beeldvormende gegevens die vaak niet te onderscheiden zijn voor het menselijk oog. Ondanks deze ontwikkelingen kampen CNN's met beperkingen door overfitting op kleine datasets, verminderde robuustheid onder variabele acquisitieomstandigheden en afhankelijkheid van lokale receptieve velden die globale afhankelijkheden kunnen missen. Hoewel hybride CNN-Transformer-benaderingen proberen convolutionele priors te combineren met aandachtsmechanismen, erven ze nog steeds vooroordelen van convolutionele architecturen. Figuur 1 toont enkele voorbeelden uit de dataset die verschillende klassen tonen.

figure-introduction-1
Figuur 1: Visuele illustratie van verschillende klassen die representatieve CT-scansnedes van normale, goedaardige en kwaadaardige longen tonen, waarbij hun overeenkomsten en verschillen worden benadrukt. Klik hier om een grotere versie van deze figuur te bekijken.

Voor normale, goedaardige en kwaadaardige gevallen worden representatieve CT-beelden getoond. Hoewel expliciete markering van discriminerende gebieden de visuele interpretatie zou bevorderen, vereist handmatige annotatie deskundige radiologen en viel het buiten de reikwijdte van deze studie.

Vision Transformers (ViTs), oorspronkelijk geïntroduceerd voor natuurlijke beeldclassificatie3, vormen een veelbelovend alternatief. In tegenstelling tot CNN's of CNN-Transformer-hybriden maken ViTs gebruik van een volledig aandachtsgedreven kader dat globale contextuele informatie over een gehele afbeelding vastlegt. Deze studie is vooral relevant voor CT-beeldvorming, waarbij het diffuse en onregelmatige karakter van tumorkenmerken zich kan uitstrekken over regio's in plaats van beperkt te zijn tot lokale receptieve velden. Terwijl CNN-Transformer hybride netwerken de convolutionele inductieve bias stabiliseren, implementeren Vision Transformers (ViTs) een volledig op aandacht gebaseerde architectuur, waardoor het ViT-model langeafstandsafhankelijkheden over volledige CT-beelden kan vastleggen – een voordeel bij het beoordelen van diffuse of onregelmatige longtumorkenmerken.

De opkomst van transformator-gebaseerde modellen op het gebied van medische beeldvorming is recent, met enkele voorbeelden in zachte radiologie en histopathologie,4,5,6 die aanzienlijke voordelen hebben getoond voor robuustheid tegen ruis, blur en variabiliteit tussen scanners ten opzichte van traditionele CNN-systemen, door een rechtvaardiging voor ViT in zo'n klinische context te ondersteunen zonder de nieuwheid te overdrijven. Gezien een strengere benadering van longkankerbeeldvorming ten opzichte van consumentengezondheidstoepassingen, is deze studie bedoeld om de praktische realiteit te rechtvaardigen op een robuust gebied van evidence-based medicine, terwijl het zich plaatst tussen de niet overweldigend beschikbare literatuur over transformatoren en hun toepassingen. Eerdere literatuur heeft aangetoond dat nauwkeurigheden van CNN-diagnostische modaliteiten drastisch dalen door verwervingsvariabiliteit7, waarbij de overeenkomstige ViT beter presteert met dezelfde verstoringen,8 wat geloofwaardigheid geeft aan het concept van het gebruik van een ViT in beoordelingsmodaliteiten en een optie biedt voor verhoogde reproduceerbaarheid in diagnostische workflows. Bovendien worden praktische kwesties, zoals de vereiste datasetgrootte, rekenkracht en generaliseerbaarheid naar verschillende klinische omgevingen, duidelijk aan bod gebracht in de studie met behulp van methoden zoals data-augmentatie, transfer learning en efficiënte ViT-varianten 9,10 om deze potentiële uitdagingen in de praktijk aan te pakken.

Deze studie bouwt voort op deze vooruitgang door ViTs te implementeren voor longkankerstadiering met behulp van CT-beeldgegevens en de robuustheid en generaliseerbaarheid van het model te onderzoeken in aanwezigheid van beeldvormingsproblemen in de praktijk. CT-gegevens kunnen artefacten, ruis en vervaging omvatten in een mate die kenmerkende eigenschappen voor clinici kan verhullen. Door de veerkracht tegen deze veranderingen in beeldvorming te onderzoeken, wil deze studie een extra stadieringskader bieden waarop in de praktijk kan worden vertrouwd bij het nemen van beslissingen over zorg en behandeling.

De bijdragen van deze studie omvatten: i) specifiek het detecteren van longkanker aan de hand van CT-beelden in de IQ-OTH/NCCD-dataset door gebruik te maken van en de prestaties van een Vision Transformer-model te onderzoeken; ii) beoordelen hoe goed het model presteert in klinische beeldvormingssituaties in de praktijk die vaak voorkomen bij CT-gegevens, zoals ruis en wazigheid; iii) vergelijking van nauwkeurigheid, gevoeligheid en specificiteit van ViTs als alternatief voor traditionele CNN-modellen.

De opbouw van de rest van dit artikel is als volgt: Sectie II behandelt de literatuuroverzicht met eerder werk over longkankerdetectie met behulp van deep learning-technieken en de overgang van CNN's naar meer geavanceerde architecturen zoals de ViTs. Sectie III presenteert de aanpak die voor dit werk is gehanteerd, inclusief datapreprocessing, modelarchitectuurinformatie en details over trainingsprocedures. Sectie IV presenteert de bevindingen met name over de voorschrijvende kenmerken van ViTs als klinische methode en hoe dit de nauwkeurigheid en betrouwbaarheid van longkankerscreenings kan verbeteren. Sectie V vat de bevindingen en bijdragen aan de praktijk samen en bespreekt toekomstige richtingen in de context van deep learning in een medische omgeving.

GERELATEERD WERK:

Deep learning (DL) heeft de medische beeldvorming de afgelopen tien jaar gerevolutioneerd, vooral bij de diagnose van longkanker. Aanvankelijk was de discipline afhankelijk van conventionele machine learning-technieken zoals Support Vector Machines (SVM's) en beslissingsbomen, die werden beperkt door de behoefte aan goed gebouwde, correct verkregen functies. Deze rubrieken gingen slecht om met de complexiteit van medische beelden en voegden vaak subjectiviteit toe.

Een belangrijke verandering werd teweeggebracht met de uitvinding van Convolutionele Neurale Netwerken (CNN's), waarmee het mogelijk werd om automatisch hiërarchische kenmerken uit data11 te halen. CNN's zijn veelvuldig gebruikt bij CT-scan-gebaseerde kankerstadiering, het opsporen van knobbels en classificatie als goedaardig of kwaadaardig. CNN's zijn succesvol, maar ze hebben beperkingen. Deze omvatten verschillen in beeldverzamelingsinstellingen en de noodzaak van grote, geannoteerde datasets, die moeilijk te verkrijgen zijn vanwege privacyproblemen en de arbeidsintensieve aard van medische annotatie. Tabel 1 12,13,14,15,16,17,18,19,20 geeft een samenvatting van recente studies uitgevoerd op het gebied van longkankerdiagnose.

Crasta, Lavina Jean, Rupal Neema en Alwyn Roshan Pais (2024) [20]Het presenteren van een nieuw deep learning-kader voor de detectie en classificatie van longkanker met behulp van CT-beelden [20].Het artikel introduceert een 3D-VNet voor segmentatie en een 3D-ResNet voor classificatie, waarmee verbeteringen in nauwkeurigheid en robuustheid ten opzichte van eerdere methoden worden getoond.
Crasta, Lavina Jean, Rupal Neema en Alwyn Roshan Pais (2024) [20]Het presenteren van een nieuw deep learning-kader voor de detectie en classificatie van longkanker met behulp van CT-beelden [20].Het artikel introduceert een 3D-VNet voor segmentatie en een 3D-ResNet voor classificatie, waarmee verbeteringen in nauwkeurigheid en robuustheid ten opzichte van eerdere methoden worden getoond.

Tabel 1: Samenvatting van recente studies waarin gebruikte technieken worden beschreven en prestaties worden gerapporteerd voor context.

Door zelfaandachtprocessen te gebruiken die de volledige context van een afbeelding tegelijk meenemen, beginnen Vision Transformers (ViTs) zich te ontwikkelen tot een concurrerend alternatief voor CNN's bij beeldgerelateerde taken. ViTs zijn vooral veelbelovend voor medische beeldvorming, omdat het belang van sommige regio's kan afhangen van verder gelegen delen van het beeld vanwege hun wereldwijde verwerkingscapaciteit. Toch zijn ViTs, ondanks hun vermogen om ingewikkelde taken uit te voeren, zoals het herkennen van correlaties tussen verschillende ziekte-indicatoren in scans, nog steeds niet goed bestudeerd in het medische beeldvormingsveld.

ViTs zijn nog niet in grote mate onderzocht op het gebied van consumentgerichte zorgapparaten. Deze studie is bedoeld om de kloof te overbruggen tussen hoge nauwkeurigheid en minder latentie voor consumentgerichte zorgapparaten, waar ze goed kunnen presteren en nauwkeurige voorspellingen in realtime kunnen geven.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De dataset bevat in totaal 1.190 CT-scansnedes uit 110 gevallen, onderverdeeld in drie klassen: normaal (55 gevallen), goedaardig (15 gevallen) en kwaadaardig (40 gevallen). Elke casus bestaat uit meerdere CT-sneden (variërend van ongeveer 80 tot 200 sneden per geval), die diverse axiale aanzichten van het thoracale gebied bieden. De CT-beelden werden verkregen in DICOM met behulp van de SOMATOM-scanner en standaard beeldparameters: buisspanning = 120 kV, slicedikte = 1 mm, vensterbreedte = 350–1.200 Hounsfield-units (HU), en venstermiddenwaarden = 50–600 HU, tijdens een volledige inademhaling.

Alle beelden werden volledig gedeïdenificeerd vóór de analyse om persoonlijke identificeerbare informatie (PII) te verwijderen. De dataset werd ethisch goedgekeurd door de institutionele beoordelingscommissies van de deelnemende medische centra, waarbij schriftelijke toestemming werd opgegeven door de toezichtscommissie. De gevallen betroffen personen uit verschillende achtergronden, zoals overheidsmedewerkers, boeren en inwoners uit verschillende Iraakse provincies (waaronder Bagdad, Wasit, Diyala, Salahuddin en Babylon) met diversiteit in geslacht, leeftijd, opleidingsniveau en levensstatus.

Omdat de dataset openbaar beschikbaar is en gedeidentificeerd, was er geen extra ethische goedkeuring nodig voor het gebruik ervan in deze studie. De dataset voldoet aan de voorwaarden die zijn gespecificeerd door de oorspronkelijke bijdragers en het hostingplatform.

De methodologie van dit onderzoek maakt gebruik van een meerfasenproces dat is ontworpen om een voorspellingsmodel te creëren met behulp van de IQ-OTH/NCCD Longkankerdataset21. Deze methodologie vormt een sterk fundament voor consumentgerichte zorgapparaten, waarbij minder latentie nodig is, wat voor betere nauwkeurigheid kan zorgen. Figuur 2 toont het werkingsmechanisme van het voorgestelde model.

figure-protocol-1
Figuur 2: Workflowdiagram van het voorgestelde model met preprocessing, augmentatie, Vision Transformer-classificatie en evaluatiestappen. Klik hier om een grotere versie van deze figuur te bekijken.

1. Datasetbeschrijving

De IQ-OTH/NCCD-longkankerdataset werd verzameld in het Iraq-Oncology Teaching Hospital/National Center for Cancer Diseases in het najaar van 2019. Het trainingsgedeelte van de gebruikte dataset bevatte 1.097 afbeeldingen waarvan de beschrijving in Tabel 2 wordt gegeven, die het aantal voorbeelden van verschillende klassen illustreert.

KlasAantal afbeeldingen
Normaal416
Goedaardig120
Kwaadaardig561

Tabel 2: Voorbeelden van normale, goedaardige en kwaadaardige CT-beelden uit de dataset.

De IQ-OTH/NCCD-longkankerdataset is gekozen vanwege de uitgebreide weergave van normale, goedaardige en kwaadaardige CT-scans. Hoewel andere datasets, zoals LIDC-IDRI en NSCLC-Radiomics, beschikbaar zijn, richten deze zich ofwel voornamelijk op noduledetectie of ontbreken ze voldoende monsters van goedaardige gevallen. De IQ-OTH/NCCD-dataset is bijzonder geschikt voor ons onderzoek omdat het de Vision Transformer in staat stelt om onderscheidende kenmerken te leren over alle drie de klassen, waardoor subtiele patronen in long-CT-beelden robuust kunnen worden geclassificeerd.

2. Gegevensvoorverwerking

Preprocessing is een belangrijke stap in het verbeteren van modelprestaties door consistentie en passende aanpassingen aan de data die via het neurale netwerk verwerkt zullen worden. Om consistentie in de invoergrootte voor het neurale netwerk te waarborgen, hebben we alle afbeeldingen geschaald tot dezelfde dimensie van 256 x 256 pixels, en de data genormaliseerd naar een pixelwaarde tussen 0 en 1 in de hoop modeltraining en convergentie te verbeteren. Tabel 3 bevat de waarden van de augmentatietechniek.

TechniekWaarde
Normalisatie-
Resizingimage_size x image_size
RandomRotationfactor=0,02
RandomZoomheight_factor=0,2, width_factor=0,2

Tabel 3: Toegepaste augmentatietechnieken met parameterbereiken.

Om de robuustheid van het model tegen overfitting te vergroten en het vermogen om te generaliseren te verbeteren, worden data-augmentatietechnieken zoals willekeurige rotaties en zooms toegepast, waarbij verschillende hoeken en groottes van longkankermanifestaties worden gesimuleerd zoals ze bij verschillende patiënten kunnen voorkomen. Willekeurige rotaties met hoeken die uniform werden bemonsterd uit 0,02 radialen en willekeurige zoomtransformaties met wisselende hoogte- en breedtefactoren werden in deze studie toegepast. De beelden na de augmentatie zijn weergegeven in Figuur 3.

figure-protocol-2
Figuur 3: CT-beelden na augmentatie die rotatie, zoom en normalisatie tonen om de generalisatie van het model te verbeteren. Klik hier om een grotere versie van deze figuur te bekijken.

Deze preprocessingtechnieken zijn vereist en augmentatie is gebruikt over alle klassen om de robuustheid van het model te waarborgen.

3. Modelarchitectuur

Door het nieuwe Vision Transformer (ViT)-framework aan te passen om effectief met ingewikkelde beeldgegevens om te gaan, is de modelarchitectuur bedoeld om CT-scans in drie categorieën te categoriseren: normaal, goedaardig en kwaadaardig. Met deze methode worden invoerbeelden van 256 x 256 pixels verwerkt. Om consistentie te garanderen en efficiënter modelleren te bevorderen, wordt elke afbeelding door verschillende preprocessing-operaties gevoerd, zoals het vergroten van grootte en normalisatie. Om de veerkracht van het model tegen veranderingen in beeldschaal en -oriëntatie te verbeteren, begint het ontwerp met een data-augmentatielaag die methoden gebruikt zoals normalisatie, verkleining, willekeurige rotaties van 0,02 radialen en willekeurige zooms tot 20%. Na de augmentatie haalt het model 16 x 16 pixelpatches uit elke afbeelding, waardoor elke afbeelding 256 patches heeft.

Algoritme 1 definieert de workflow, het voorgestelde model, hoe het wordt opgebouwd, en de fijne afstemming die wordt uitgevoerd ten opzichte van het model.

Algoritme 1: Classificatie van longkanker met behulp van Vision Transformers
Invoer: Set CT-beelden I uit de IQ-OTH/NCCD-dataset
Output: Classificatieresultaten C in categorieën: Normaal, Goedaardig, Kwaadaardig
Preprocessing:
   for each image i in I do
i <- Resize(i, 256 x 256)         // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i)        // Apply random rotations and zooms
   end for

Modelopstelling:
  Initialize Vision Transformer (ViT) Model
  Set number of patches P = 16 x 16
  Set number of heads H = 6 in multi-head attention

Opleiding:
  for epoch = 1 to MaxEpochs do
    for each batch b in I do
      Patches <- ExtractPatches(b, P)
      EncodedPatches <- PatchEncoder(Patches)
      AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
      ClassLogits <- TransformerEncoder(AttentionWeights)
      Loss <- ComputeLoss(ClassLogits, TrueLabels)
      UpdateModelWeights(Loss)
    end for
    if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
      break
    end if
  end for

Validering:
  Split data into TrainingSet (80%) and ValidationSet (20%)
  ComputeValidationMetrics(ValidationSet)

Evaluatie:
  C <- Classify(I)
  ComputePerformanceMetrics(C)
  Return C

Om de ruimtelijke relaties tussen patches te behouden, worden deze patches afgevlakt (vergelijking 1) tot 768-dimensionale vectoren (omdat elke patch 16 x 16 x 3 = 768 heeft) en vervolgens door een patch-coderinglaag gestuurd, die elke vector projecteert in een 64-dimensionale ruimte door positionele embeddings te integreren. De kern van de architectuur bestaat uit acht transformatorlagen, elk met een multi-head aandachtmechanisme met zes koppen, waardoor het model gelijktijdig op verschillende delen van het beeld kan focussen en een breed scala aan kenmerken kan vastleggen. Het wordt weergegeven met behulp van vergelijkingen 2, 3 en 4.

figure-protocol-3

Waarbij μ het gemiddelde is en σ2 de variantie van de invoer x, en ε een kleine constante is om deling door nul te voorkomen.

figure-protocol-4

Waarbij Q de querymatrix is, K de sleutelmatrix, V de waardematrix en dk de dimensie van de sleutelvectoren.

figure-protocol-5
figure-protocol-6

Waarbij WiQ, WiK en WiV de geleerde gewichtmatrices zijn voor respectievelijk zoekopdrachten, sleutels en waarden, en WO de outputgewichtmatrix is.

Het blokdiagram van het voorgestelde model is weergegeven in Figuur 4.

figure-protocol-7
Figuur 4: Blokdiagram van het Vision Transformer-model met MLP-kop, waarin de belangrijkste verwerkingslagen en architectuur worden beschreven. Klik hier om een grotere versie van deze figuur te bekijken.

Elke transformatorlaag bevat een multi-layer perception (MLP) met verborgen eenheden die eerst worden opgeschaald tot 128 en daarna weer terug naar 64, waardoor de informatiestroom effectief wordt uitgebreid en gecomprimeerd om complexe afhankelijkheden te vangen.

Drop-out wordt strategisch toegepast met een frequentie van 0,1 binnen de aandachtsmechanismen en MLP's om overfitting te voorkomen. De uitgang van de transformatorencoder wordt verwerkt via een MLP-kop bestaande uit twee dichte lagen met respectievelijk 2.048 en 1.024 eenheden, waarbij gebruik wordt gemaakt van Gaussian Error Linear Units (GELU) voor activatie, wat goed is aangetoond te presteren in deep learning-toepassingen. Dit wordt bereikt met behulp van vergelijking 5.

figure-protocol-8

Waar W1 en W2 gewichtsmatrices zijn, b1 en b2 biases, en GELU de gebruikte activatiefunctie is.

Een dropout van 0,1 werd gebruikt in de transformatorlagen om overfitting te voorkomen zonder belangrijke feature-informatie te verliezen. De GELU-activatiefunctie werd gebruikt vanwege zijn gladde niet-lineaire eigenschappen, die gradiëntstroom en convergentie bevorderen in transformator-gebaseerde modellen. De uitval wordt geregulariseerd met behulp van vergelijking 6.figure-protocol-9

Waarbij p het uitvalpercentage is (bijvoorbeeld 0,1 of 0,5), en de uitvallaag een fractie p van de invoereenheden willekeurig op nul zet tijdens de training.

Een uitvalpercentage van 0,5 in deze lagen helpt verder bij het beperken van overfitting. De laatste laag van het model is een logitslaag (vergelijking 7) die drie klasse-logits produceert die overeenkomen met de categorieën normaal, goedaardig en kwaadaardig, met behulp van een spaar categorische kruisentropieverliesfunctie (vergelijking 8) die geschikt is voor deze multi-klasse classificatie.

figure-protocol-10

figure-protocol-11

Waarbij zi de logitsvector is voor klasse i, SoftMax(zi)) de voorspelde kansen voorstelt, en yi het ware klasselabel.

Het model wordt gecompileerd met de AdamW-optimizer (vergelijkingen 9, 10, 11, 12 en 13), een uitbreiding van de Adam-optimizer die gewichtsafname effectiever aankan, ingesteld met een leersnelheid van 0,001 en een gewichtsafname van 0,0001, waarmee zowel de leersnelheid als de stabiliteit van het model worden geoptimaliseerd.

figure-protocol-12

figure-protocol-13
figure-protocol-14
figure-protocol-15
figure-protocol-16

Waarbij mt en vt het eerste en tweede moment van de gradiënten zijn, figure-protocol-17 en figure-protocol-18 de bias-gecorrigeerde momenten, η de leersnelheid is, en ε een kleine constante is om deling door nul te voorkomen.

Het model gebruikt bij training een batchgrootte van 32 om gebruik te maken van GPU-versnelling voor snellere berekeningen en is geconfigureerd om te trainen voor 100 epochs.

Maar de training heeft een vroegtijdig stopmechanisme bij validatieverlies om de training te beperken wanneer het model stopt met verbeteren, om rekenkracht te besparen en overtraining van 5 opeenvolgende epochs te voorkomen. De prestaties van het model worden gevolgd met meetwaarden zoals spaarzame categorische nauwkeurigheid en top 2 nauwkeurigheid, die informeren over de classificatiecapaciteit van het model over de meest waarschijnlijke voorspelde categorieën. Callbacks voor modeltraining omvatten checkpointing waarbij het best presterende model wordt opgeslagen op basis van validatienauwkeurigheid, zodat de meest succesvolle versie van het model behouden blijft zodra het trainingsproces is afgerond. Deze robuuste en goed geplande architectuur maakt gebruik van de mogelijkheden van transformatoren om medische beeldvormingsdata te verwerken met een zeer geavanceerde benadering om hedendaagse AI-methoden te gebruiken voor belangrijke toepassingen in de gezondheidszorgdiagnostiek.

4. Training en validatie

Het model werd getraind in een Kaggle-omgeving met een NVIDIA P100 GPU, en tijdens het trainingsproces werd een mini-batch gradient descent met een batchgrootte van 32 gebruikt tijdens het trainingsproces. De optimizer die tijdens de training werd gebruikt was AdamW met een leersnelheid van 0,001 en een gewichtsafname van 0,0001; Dit was een goede balans tussen een snelle convergentie en enige regularisatie. Het model werd getraind voor 100 epochs, maar vroegtijdig stopte bij validatieverlies met een geduld van 5 epochs. Simpel gezegd: als de training validatieverlies niet verbetert voor 5 opeenvolgende epochs, zou de training stoppen vanwege overfitting en rekenefficiëntie. In de meeste gevallen herstelde dit model gewichten uit het tijdperk met het minste validatieverlies, wat aangeeft dat het optimaal presteerde en niet de volledige 100 epochen hoefde te lopen. In totaal ongeveer 32 minuten om het model te trainen.

Tijdens de training omvatten de meetwaarden een schaarse categorische nauwkeurigheid en top-2 nauwkeurigheid, gemonitord op zowel trainings- als validatiesets. Deze metrics geven inzicht in hoe vaak een model de juiste klasse voorspelt en of de juiste klasse tot de top twee voorspellingen behoort, wat in medische toepassingen belangrijk is omdat misclassificaties met hoge betrouwbaarheid aanzienlijke gevolgen kunnen hebben. De leercurves voor verlies en nauwkeurigheid zijn zichtbaar in Figuur 5.

.figure-protocol-19

Figuur 5: Trainings- en validatienauwkeurigheid en verliescurves over 50 tijdperken, wat stabiel leren en minimale overfitting laat zien. Klik hier om een grotere versie van deze figuur te bekijken.

In de huidige studie werd geen kruisvalidatie uitgevoerd. Deze opstelling maakte efficiënt experimenteren met de modelarchitectuur mogelijk, inclusief aanpassingen aan transformatorlagen en de afmetingen van MLP-koppen, terwijl het model goed gegeneraliseerd werd op onzichtbare validatiegegevens.

5. Statistische analyse

De prestaties van het Vision Transformer-model werden statistisch geanalyseerd op basis van de IQ-OTH/NCCD-longkankerdataset. Precisie, herinnering, F1-score en nauwkeurigheid werden respectievelijk berekend met vergelijkingen 14, 15, 16, 17. Deze vier worden beschouwd als de conventionele maatstaven voor classificatietaken, omdat ze informatie kunnen onthullen over de prestaties van het model bij classificatie en classificatie per klasse voor elke klasse.

figure-protocol-20
figure-protocol-21
figure-protocol-22
figure-protocol-23

Recall is een maat voor het vermogen van een model om alle relevante gevallen in een klasse te identificeren, terwijl precisie het aandeel positieve identificaties is dat daadwerkelijk correct was. De F1-score balanceert herinnering en precisie wanneer beide belangrijk zijn.
De prestatiematen die voor deze opdracht werden gebruikt, waren de Matthews Correlatiecoëfficiënt (MCC)-vergelijking 18 en Cohen's Kappa-vergelijking 19.

figure-protocol-24
figure-protocol-25

Waarbij P0 de waargenomen overeenkomst is en Pe de verwachte overeenkomst.

De MCC is een allesomvattende maatstaf voor classificatieprestaties, waarbij zowel ware positieven als negatieven, vals-positieven en vals-negatief worden meegenomen. De waarde kan tussen -1 en 1 liggen, waarbij 1 perfecte voorspelling is, 0 willekeurige voorspelling, en -1 volledige onenigheid tussen de voorspelde en ware labels. De MCC was waardevol voor vergelijkingen tussen verschillende modelprestaties wanneer toegepast op onevenwichtige datasets en biedt een maat die in balans is, ongeacht verschillende klassengroottes.

Als onderdeel van aanvullende statistische analyse werd de F2-score, met prioriteit voor terugroepen, berekend zoals weergegeven in vergelijking 20.

figure-protocol-26

De prestaties van het model werden ook gekwantificeerd met behulp van Mean Squared Error (MSE), Root Mean Squared Error (RMSE) en Mean Absolute Error (MAE) – dit zijn typisch metingen voor regressietaken, maar hier aangepast voor de classificatietaak om te kwantificeren hoe groot de gemiddelde fout was, zonder rekening te houden met richting.

Om te bepalen of het praktisch zou zijn om ViTs te integreren in consumentgerichte zorgapparatuur, hebben we uitgebreide prestatie-evaluatieresultaten uitgevoerd die zich uitsluitend richtten op de temporele efficiëntie van het model. We hebben functies gemaakt om de tijd te rapporteren die nodig is om één of meerdere afbeeldingen te voorspellen, omdat dit vooral relevant wordt voor realtime toepassingen. Voor elke afbeelding wordt de data vóór het beginnen met voorspellen eerst voorbewerkt zodat deze de vorm heeft van het door het model gewenste invoerbeeld. Het tijdstip waarop de voorspelling begon en het moment waarop de voorspelling voltooid was, registreerden we om de resultaten van tijd en latentie te verkrijgen. Tijd en gemiddelde latentie werden berekend met behulp van respectievelijk vergelijking 21 en vergelijking 22.

figure-protocol-27
figure-protocol-28

Waar:

  • N is het aantal afbeeldingen (samples).
  • Tend is de tijd die wordt vastgelegd na het voorspellen van het i-de beeld.
  • tstart is de tijd die wordt vastgelegd voordat het i-de beeld wordt voorspeld.

Verdere experimenten werden uitgevoerd om de robuustheid van het Vision Transformer-model dat we voorstelden te evalueren door systematisch extra ruis en vervaging aan de beelden toe te voegen. Gaussische ruis werd toegevoegd aan elke pixel met een ruisfactor van 0,4 terwijl pixelwaarden in het bereik van [0,1] werden afgeknipt. De vervagingsfactor werd verminderd door Gaussische blur met een kernelgrootte van 45× 45. Deze experimenten zijn ontworpen om het model volledig te evalueren onder gesimuleerde waarneembare beeldkwaliteitsverlagingen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het Vision Transformer-model toonde uitzonderlijke resultaten op meerdere evaluatiemetrics op de IQ-OTH/NCCD-longkankerdatasets, waarbij normale, goedaardige en kwaadaardige CT-beelden effectief werden onderscheiden. De algehele modelprestaties bereikten een hoge nauwkeurigheid van 98,18% over de testdataset bestaande uit 220 afbeeldingen. Deze extreem hoge nauwkeurigheid geeft aan dat het model zeer effectief kan generaliseren en daarom in een klinische ...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het heeft opmerkelijke resultaten behaald in de evaluatie en implementatie van het Vision Transformer-model op de IQ-OTH/NCCD longkankerdataset met hoge nauwkeurigheid. De algemene nauwkeurigheid van het classificeren van een CT-scan als normaal, goedaardig en kwaadaardig is 98,18% met dit model.

Deze superieure nauwkeurigheid wordt verder bewezen door de prestaties van het model in de andere belangrijke scores, zoals 100% precisie bij het opsporen van maligne...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat zij geen belangenconflicten hebben.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit werk werd ondersteund door Princess Nourah bint Abdulrahman University Researchers Supporting Project nummer (PNURSP2025R432), Princess Nourah bint Abdulrahman University, Riyad, Saoedi-Arabië.  De auteurs zijn dankbaar voor de Deanship of Graduate Studies and Scientific Research aan de Najran University voor de financiering van dit werk onder de subsidiecode van het Growth Funding Program (NU/GP/SERC/13/575-6).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
A100 GPU (CUDA)NVIDIACUDA Version 11.6GPU-versnelling voor modeltraining en evaluatie.
AMD EPYC-7502P CPUAMDN/AProcessor gebruikt voor high-performance computing.
Gigabit EthernetIntelN/ANetwerken voor beveiligde peer-to-peer communicatie in CPS.
MatplotlibPython Software FoundationVersie 3.5Visualisatiebibliotheek voor het plotten van resultaten.
Paillier CryptosystemOpen Source (geïmplementeerd via TenSEAL)N/AMaakt additieve homomorfe encryptie op gradiënten mogelijk.
PySyftOpenMinedVersie 0.6.0Bibliotheek voor differentiële privacy en federated learning.
Python (Anaconda Distribution)Anaconda IncVersie 3.9Bevat vooraf geïnstalleerde pakketten en omgevingsbeheertools, gebruikt voor scripting en frameworkontwikkeling.
PyTorchMeta AIVersie 1.12Deep learning framework voor het trainen van modellen.
RAMCorsair256 GigaByte (GB) Hoge geheugenondersteuning voor intensieve training.
Scikit-learnPython Software FoundationVersie 1.1Machine learning tools voor prestatie-evaluatie.
SeabornPython Software FoundationVersie 0.11Statistische datavisualisatiebibliotheek.
SSD-opslagSeagate1 TeraByte (TB)Voor snelle gegevensopslag en -ophaling.
TenSEALOpenMinedVersie 0.3Homomorfe encryptiebibliotheek voor veilige aggregatie.
TensorFlowGoogleVersie 2.9Deep learning framework voor diffusiemodellen.
Ubuntu OSCanonicalVersie 20.04 LTSBesturingssysteem gebruikt voor alle experimenten.

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

AI Medische BeeldvormingMachine Learning in de GezondheidszorgClassificatie van LongkankerRobuustheid van BeeldvormingDiagnostische NauwkeurigheidRuis in Medische BeeldenOncologische Diagnostiek

Gerelateerde artikelen