Articolo di ricerca

Un approccio innovativo che utilizza un trasformatore visivo AI per l'analisi della TAC per la rilevazione del cancro ai polmoni

DOI:

10.3791/69302

28 novembre 2025

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'uso dei Transformers Visionali in questo studio permette di classificare il cancro ai polmoni a partire dalle immagini TC, raggiungendo una precisione del 98,18% in 1.190 scansioni. Il modello ha mantenuto un livello soddisfacente di robustezza, con livelli di accuratezza compresi (80–88%) con immagini rumorose e sfocate, rispetto ai modelli standard di reti neurali convoluzionali (CNN), nelle applicazioni diagnostiche per la salute per consumatori.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La diagnosi del cancro ai polmoni rimane difficile a causa delle sottili differenze tra malattie benigne e maligne negli studi di imaging. Sebbene le tradizionali reti neurali convoluzionali (CNN) siano state il pilastro dell'analisi di imaging medico, hanno ancora un'applicabilità e robustezza limitate con la varietà di metodi di imaging. Il progresso del machine learning sta trasformando i metodi tradizionali di diagnosi nelle tecnologie sanitarie rivolte al consumatore, cambiando i processi di accessibilità e la cura personalizzata dei pazienti. Questo articolo descrive l'uso dei Trasformatori Visivi (ViTs) per la classificazione del cancro polmonare con le TAC, associate ad applicazioni sanitarie per consumatori. Il modello Vision Transformer è stato addestrato su un dataset completo di 1.190 immagini CT, raggiungendo un tasso di classificazione del 98,18% con un coefficiente di correlazione di Matthews di 0,9676. Inoltre, le prestazioni del modello sono state validate su scenari simulati in tempo reale utilizzando rumori in tempo reale e dataset sfocati. Pur preservando i metodi di validazione con forte accuratezza diagnostica, in tutto il dataset il modello ViT ha anche superato il metodo convalidato convenzionale mostrando un'accuratezza compresa tra l'80 e l'88% per distinguere tra immagini rumorose e immagini sfocate, anche in queste circostanze. Sebbene i risultati iniziali forniscano informazioni promettenti sulla robustezza delle ViT nel confrontarsi con la variazione delle immagini, è comunque necessario adottare un approccio cauto nel contestualizzare i risultati, poiché gli studi di valutazione sono stati completati all'interno di un dataset e di contesti di simulazione relativamente ristretti. Sarà prezioso per i futuri studi di ricerca utilizzare dataset più ampi, più rappresentativi delle vere condizioni cliniche, e dataset clinicamente validati per determinare se i ViT siano vantaggiosi per l'identificazione clinica della diagnostica oncologica e per migliorare la diagnosi precoce.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il cancro ai polmoni ha un peso globale notevole, che colpisce milioni di vite ogni anno. A causa della natura aggressiva del cancro e del frequente stato di malattia a presentazione tardiva, la mortalità associata al cancro ai polmoni è elevata. La diagnosi precoce è essenziale perché l'intervento può migliorare notevolmente l'efficacia del trattamento e i tassi disopravvivenza. L'approccio convenzionale per lo screening preliminare e la diagnosi rimane l'utilizzo della tomografia computerizzata (TC) per consentire una visualizzazione più dettagliata delle strutture polmonari. Tuttavia, la valutazione delle immagini TC è complessa e dipende interamente dai revisori in qualità di radiologi. La variabilità tumorale in attributi come dimensione, forma e densità mitiga anche l'affidabilità di qualsiasi osservazione umana. I fattori ambientali possono mettere in discussione l'accuratezza e la riproducibilità delle decisioni basate sull'analisi umana.
Tenendo conto di questi fattori limitanti, la letteratura recente ha spinto fortemente per l'applicazione dell'intelligenza artificiale (IA) all'imaging medico, con maggiore attenzione ai modelli di deep learning (DL). DL, specialmente con le Reti Neurali Convoluzionali (CNN), hanno interrotto il modello delle osservazioni nell'imaging medico modificando le analisi delleimmagini 2. Le CNN hanno migliorato significativamente i processi diagnostici in oncologia, dimostrando la capacità di identificare caratteristiche sottili e complesse nei dati di imaging che spesso sono indistinguibili all'occhio umano. Nonostante questi progressi, le CNN affrontano limitazioni dovute al sovrafitting su piccoli dataset, una minore robustezza in condizioni di acquisizione variabili e una dipendenza da campi ricettivi locali che possono non rilevare dipendenze globali. Sebbene gli approcci ibridi CNN-Transformer tentino di combinare priori convoluzionali con meccanismi di attenzione, ereditano comunque i bias delle architetture convoluzionali. La Figura 1 mostra alcuni esempi dal dataset che mostrano diverse classi.

figure-introduction-1
Figura 1: Illustrazione visiva delle diverse classi che mostra fette rappresentative della TAC di polmoni normali, benigni e maligni, evidenziandone le somiglianze e le differenze. Clicca qui per visualizzare una versione più grande di questa figura.

Sono mostrate immagini CT rappresentative per casi normali, benigni e maligni. Mentre la marcatura esplicita delle regioni discriminative avrebbe facilitato l'interpretazione visiva, l'annotazione manuale richiede radiologi esperti ed era al di fuori dell'ambito di questo studio.

I Transformers di Visione (ViTs), originariamente introdottiper la classificazione 3 delle immagini naturali, rappresentano un'alternativa promettente. A differenza delle CNN o degli ibridi CNN-Transformer, i ViT impiegano un framework completamente orientato all'attenzione che cattura informazioni contestuali globali su un'intera immagine. Questo studio è particolarmente pertinente per l'imaging CT, dove il carattere diffuso e irregolare degli attributi tumorali può estendersi in tutte le regioni invece di essere limitato solo ai campi recettivi locali. Mentre le reti ibride CNN-Transformer stabilizzano il bias induttivo convoluzionale, i Vision Transformers (ViTs) implementano un'architettura completamente basata sull'attenzione, permettendo al modello ViT di catturare dipendenze a lungo raggio su intere immagini TC - un vantaggio nella valutazione di attributi tumorali polmonari diffusi o irregolari.

L'avvento dei modelli basati su transformer nel campo dell'imaging medico è recente, con alcuni esempi in radiologia morbida e istopatologia,4,5,6 che hanno mostrato vantaggi significativi per la robustezza al rumore, alla sfocatura e alla variabilità inter-scanner rispetto ai sistemi CNN tradizionali, nel sostenere una giustificazione per ViT in un contesto clinico simile senza eccessivo sottolineare la novità. Adottando un approccio più rigoroso all'imaging del cancro polmonare rispetto alle applicazioni per il consumo, questo studio mira a giustificare la praticità in un'area solida della medicina basata sull'evidenza, collocandosi tra la letteratura non del tutto schiacciante recentemente disponibile riguardo ai transformer e alle sue applicazioni. La letteratura precedente ha dimostrato che le accuratezze delle modalità diagnostiche CNN diminuiscono drasticamente a causa della variabilitàdell'acquisizione 7, dove il ViT corrispondente funziona meglio con le stesse perturbazioni,8 il che dà credito al concetto di utilizzare un ViT nelle modalità di valutazione e di presentare un'opzione per aumentare la riproducibilità nei flussi di lavoro diagnostici. Inoltre, questioni pratiche, come la dimensione richiesta del dataset, il carico computazionale e la generalizzabilità a diversi contesti clinici, sono chiaramente affrontate nello studio con l'uso di metodi come l'aumento dei dati, l'apprendimento tramite trasferimento e le varianti ViTefficienti 9,10 per affrontare queste potenziali sfide nell'uso reale.

Questo studio si basa su questo progresso implementando ViTs per la stadiazione del cancro polmonare utilizzando dati di immagini TC ed esaminando la robustezza e la generalizzazione del modello in presenza di problemi di imaging reali. I dati CT possono includere artefatti, rumore e sfocatura in misura comune che possono oscurare caratteristiche significative per i clinici. Esaminando la resilienza a questi cambiamenti nell'imaging, questo studio mira a offrire un ulteriore quadro di stadiazione su cui si può fare affidamento nella pratica quando si prendono decisioni relative alla cura e al trattamento.

I contributi di questo studio includono: i) la rilevazione specifica del cancro ai polmoni da immagini TC nel dataset IQ-OTH/NCCD utilizzando ed esaminando le prestazioni di un modello Vision Transformer; ii) valutare quanto bene il modello si comporta in scenari di imaging clinico reali comuni ai dati CT, come rumore e sfocatura; iii) confronto di accuratezza, sensibilità e specificità dei ViT come alternativa ai modelli CNN tradizionali.

L'organizzazione del resto di questo articolo è la seguente: la Sezione II esamina la revisione della letteratura che fornisce lavori precedenti relativi alla rilevazione del cancro ai polmoni tramite tecniche di deep learning e alla progressione dalle CNN ad architetture più avanzate come i ViTs. La Sezione III presenta l'approccio adottato per questo lavoro, che include la pre-elaborazione dei dati, le informazioni sull'architettura del modello e i dettagli delle procedure di addestramento. La Sezione IV presenta i risultati che affrontano specificamente le caratteristiche prescrittive delle ViTs come metodo clinico e come possano migliorare l'accuratezza e l'affidabilità degli screening per il cancro polmonare. La Sezione V riassume i risultati e i contributi alla pratica e discute le direzioni future nel contesto del deep learning in un ambiente medico.

OPERE CORRELATE:

Il deep learning (DL) ha rivoluzionato l'imaging medico negli ultimi dieci anni, specialmente nella diagnosi del cancro ai polmoni. All'inizio, la disciplina dipendeva da tecniche convenzionali di machine learning come le Support Vector Machines (SVM) e gli alberi decisionali, vincolati dalla necessità di funzionalità ben costruite e correttamente ottenute. Queste caratteristiche hanno gestito male le complessità delle immagini mediche e spesso hanno inserito soggettività di soggettività.

Un cambiamento significativo fu portato con l'invenzione delle Reti Neurali Convoluzionali (CNN), che rese possibile estrarre automaticamente caratteristiche gerarchiche dai dati11. Le CNN sono state ampiamente utilizzate nella stadizzazione del cancro basata su TAC, nella rilevazione dei noduli e nella classificazione come benigne o maligna. Le CNN hanno successo, ma hanno dei limiti. Queste includono differenze nelle impostazioni di raccolta delle immagini e la necessità di grandi dataset annotati, difficili da reperire a causa di problemi di privacy e della natura laboriosa delle annotazioni mediche. La Tabella 1 12,13,14,15,16,17,18,19,20 fornisce il riepilogo degli studi recenti condotti nel campo della diagnosi del cancro ai polmoni.

Crasta, Lavina Jean, Rupal Neema e Alwyn Roshan Pais (2024) [20]Presentare un nuovo framework di deep learning per la rilevazione e la classificazione del cancro polmonare utilizzando immagini TC [20].L'articolo introduce un 3D-VNet per la segmentazione e un 3D-ResNet per la classificazione, mostrando miglioramenti in accuratezza e robustezza rispetto ai metodi precedenti.
Crasta, Lavina Jean, Rupal Neema e Alwyn Roshan Pais (2024) [20]Presentare un nuovo framework di deep learning per la rilevazione e la classificazione del cancro polmonare utilizzando immagini TC [20].L'articolo introduce un 3D-VNet per la segmentazione e un 3D-ResNet per la classificazione, mostrando miglioramenti in accuratezza e robustezza rispetto ai metodi precedenti.

Tabella 1: Riepilogo degli studi recenti che illustrano le tecniche utilizzate e le prestazioni riportate per contestualizzare.

Utilizzando processi di autoattenzione che considerano l'intero contesto di un'immagine contemporaneamente, i Trasformatori di Visione (ViTs) stanno iniziando a emergere come un'alternativa competitiva alle CNN nei compiti legati all'immagine. Le ViT sono particolarmente promettenti per l'imaging medico, perché l'importanza di alcune regioni può dipendere da porzioni più distanti dell'immagine grazie alla loro capacità globale di elaborazione. Tuttavia, nonostante la loro capacità di gestire compiti complessi come il riconoscimento delle correlazioni tra numerosi indicatori di malattia nelle scansioni, le ViT non sono ancora ben studiate nel campo dell'imaging medico.

I ViT non sono stati esplorati in modo approfondito nel campo dei dispositivi sanitari centrati sul consumatore. Questo studio mira a colmare il divario tra alta accuratezza e minore latenza per i dispositivi sanitari orientati al consumatore, dove possono funzionare bene e fornire previsioni accurate in tempo reale.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il dataset include un totale di 1.190 sezioni di TAC provenienti da 110 casi, suddivise in tre categorie: normali (55 casi), benigni (15 casi) e maligni (40 casi). Ogni caso comprende più tacce CT (che variano da circa 80 a 200 fette per caso), offrendo diverse viste assiali della regione toracica. Le immagini TC sono state ottenute in DICOM utilizzando lo scanner SOMATOM con parametri di imaging standard: tensione del tubo = 120 kV, spessore della fetta = 1 mm, larghezza finestra = 350–1.200 unità di Hounsfield (HU) e valori centrici della finestra = 50–600 HU, durante una piena ricezione di ispirazione.

Tutte le immagini sono state completamente de-identificate prima dell'analisi per rimuovere qualsiasi informazione personale identificabile (PII). Il dataset è stato eticamente approvato dai comitati di revisione istituzionali dei centri medici partecipanti, con il consenso scritto rinunciato dal comitato di supervisione. I casi includevano persone di contesti vari come dipendenti pubblici, agricoltori e residenti di diverse province irachene (tra cui Baghdad, Wasit, Diyala, Salahuddin e Babilonia) con diversità di genere, età, livello educativo e status abitativo.

Poiché il dataset è pubblicamente disponibile e de-identificato, non è stata necessaria un'ulteriore approvazione etica per il suo utilizzo in questo studio. Il dataset rispetta i termini e le condizioni specificati dai suoi contributori originali e dalla piattaforma ospitante.

La metodologia di questa ricerca utilizza un processo multi-fasi progettato per creare un modello previsionale con l'aiuto del dataset IQ-OTH/NCCD sul cancropolmonare 21. Questa metodologia crea un terreno solido per dispositivi sanitari orientati al consumatore, dove è richiesta una latenza minore, il che può garantire una maggiore accuratezza. La Figura 2 mostra il meccanismo di funzionamento del modello proposto.

figure-protocol-1
Figura 2: Diagramma del flusso di lavoro del modello proposto che mostra preprocessing, augmentation, classificazione Vision Transformer e passaggi di valutazione. Clicca qui per visualizzare una versione più grande di questa figura.

1. Descrizione del dataset

Il dataset IQ-OTH/NCCD sul cancro polmonare è stato raccolto presso l'Iraq-Oncology Teaching Hospital/National Center for Cancer Diseases nell'autunno del 2019. La parte di addestramento del dataset utilizzata conteneva 1.097 immagini la cui descrizione è fornita nella Tabella 2, che illustra il conteggio dei campioni di diverse classi.

ClasseNumero di immagini
Normale416
Benigno120
Maligno561

Tabella 2: Esempio di immagini TC normali, benigne e maligne dal dataset.

Il dataset IQ-OTH/NCCD sul cancro polmonare è stato scelto per la sua rappresentazione completa delle TAC normali, benigne e maligne. Sebbene siano disponibili altri dataset, come LIDC-IDRI e NSCLC-Radiomics, essi si concentrano principalmente sulla rilevazione dei noduli o mancano di campioni sufficienti di casi benigni. Il dataset IQ-OTH/NCCD è particolarmente adatto al nostro studio poiché consente al Vision-Transformer di apprendere caratteristiche discriminative in tutte e tre le classi, consentendo una classificazione robusta di schemi sottili nelle immagini TC polmonari.

2. Preprocessing dei dati

La pre-elaborazione è un passaggio importante per migliorare le prestazioni del modello attraverso la coerenza e adeguate modifiche ai dati che verranno elaborati attraverso la rete neurale. Per garantire coerenza nella dimensione di input della rete neurale, abbiamo scalato tutte le immagini alla misura di 256 x 256 pixel e normalizzato i dati a un valore di pixel compreso tra 0 e 1 nella speranza di migliorare l'addestramento e la convergenza del modello. La Tabella 3 contiene i valori della tecnica di aumento.

TecnicaValore
Normalizzazione-
Ridimensionamentoimage_size x image_size
RandomRotationfattore=0,02
RandomZoomheight_factor=0,2, width_factor=0,2

Tabella 3: Tecniche di aumento applicate con intervalli di parametri.

Per aumentare la robustezza del modello contro l'overfitting e migliorare la sua capacità di generalizzazione, vengono applicate tecniche di aumento dei dati come rotazioni casuali e zoom, che simulano vari angoli e dimensioni delle manifestazioni del tumore polmonare come potrebbero comparire in diversi pazienti. In questo studio sono state applicate rotazioni casuali con angoli campionati uniformemente da 0,02 radiani e trasformazioni di zoom casuali con fattori di altezza e larghezza variabili. Le immagini successive all'aumento sono mostrate nella Figura 3.

figure-protocol-2
Figura 3: Immagini CT dopo l'aumento che dimostrano rotazione, zoom e normalizzazione per migliorare la generalizzazione del modello. Clicca qui per visualizzare una versione più grande di questa figura.

Queste tecniche di preprocessing sono necessarie e l'aumento è stato utilizzato in tutte le classi per garantire la robustezza del modello.

3. Architettura del modello

Adattando il nuovo framework Vision Transformer (ViT) per gestire efficacemente dati di immagini complessi, l'architettura del modello è pensata per categorizzare le TAC in tre categorie: normale, benigna e maligna. Con questo metodo, vengono elaborate immagini di input da 256 x 256 pixel. Per garantire coerenza e promuovere un apprendimento più efficiente del modello, ogni immagine viene sottoposta a diverse operazioni di preelaborazione, come ridimensionamento e normalizzazione. Per migliorare la resilienza del modello ai cambiamenti di scala e orientamento dell'immagine, il progetto inizia con uno strato di aumento dati che utilizza metodi come normalizzazione, ridimensionamento, rotazioni casuali di 0,02 radiani e zoom casuali fino al 20%. Dopo l'augmentazione, il modello prende 16 patch da 16 pixel da ogni immagine, quindi ogni immagine ha 256 patch.

L'algoritmo 1 definisce il flusso di lavoro, il modello proposto e come viene costruito, nonché la fine tuning che viene eseguita rispetto al modello.

Algoritmo 1: Classificazione del cancro ai polmoni utilizzando Vision Transformers
Input: Set di immagini CT I dal dataset IQ-OTH/NCCD
Output: Risultati della classificazione C in categorie: Normale, Benigno, Maligno
Preelaborazione:
   for each image i in I do
i <- Resize(i, 256 x 256)         // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i)        // Apply random rotations and zooms
   end for

Configurazione dei modelli:
  Initialize Vision Transformer (ViT) Model
  Set number of patches P = 16 x 16
  Set number of heads H = 6 in multi-head attention

Formazione:
  for epoch = 1 to MaxEpochs do
    for each batch b in I do
      Patches <- ExtractPatches(b, P)
      EncodedPatches <- PatchEncoder(Patches)
      AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
      ClassLogits <- TransformerEncoder(AttentionWeights)
      Loss <- ComputeLoss(ClassLogits, TrueLabels)
      UpdateModelWeights(Loss)
    end for
    if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
      break
    end if
  end for

Convalida:
  Split data into TrainingSet (80%) and ValidationSet (20%)
  ComputeValidationMetrics(ValidationSet)

Valutazione:
  C <- Classify(I)
  ComputePerformanceMetrics(C)
  Return C

Per preservare le relazioni spaziali tra le patch, queste patch vengono appiattite (equazione 1) in vettori di 768 dimensioni (poiché ogni patch ha 16 x 16 x 3 = 768) e poi inviate attraverso uno strato di codifica patch, che proietta ogni vettore in uno spazio a 64 dimensioni integrando embedding posizionali. Il nucleo dell'architettura comprende otto strati trasformer, ciascuno dotato di un meccanismo di attenzione multi-testa con sei testine, permettendo al modello di mettere a fuoco su diverse parti dell'immagine contemporaneamente e catturare un'ampia gamma di caratteristiche. È rappresentato tramite le equazioni 2, 3 e 4.

figure-protocol-3

Dove μ è la media e σ2 è la varianza dell'input x, e ε è una piccola costante per evitare la divisione per zero.

figure-protocol-4

Dove Q è la matrice di interrogazione, K è la matrice chiave, V è la matrice dei valori e dk è la dimensione dei vettori chiave.

figure-protocol-5
figure-protocol-6

Dove WiQ, WiK e WiV sono rispettivamente le matrici di pesi apprese per query, chiavi e valori, e WO è la matrice di pesi in uscita.

Il diagramma a blocchi del modello proposto è stato mostrato nella Figura 4.

figure-protocol-7
Figura 4: Diagramma a blocchi del modello Vision Transformer con testa MLP, che dettaglia i principali strati di elaborazione e l'architettura. Clicca qui per visualizzare una versione più grande di questa figura.

Ogni layer di trasformatore include una percezione multilivello (MLP) con unità nascoste inizialmente scalate fino a 128 e poi di nuovo a 64, espandendo e comprimendo efficacemente il flusso di informazioni per catturare dipendenze complesse.

Il dropout viene applicato strategicamente a un tasso di 0,1 nei meccanismi di attenzione e nelle MLP per prevenire il sovrafitting. L'uscita dall'encoder del trasformatore viene elaborata attraverso una testa MLP composta da due strati densi rispettivamente da 2.048 e 1.024 unità, impiegando Unità Lineari di Errore Gaussiano (GELU) per l'attivazione, che si è dimostrato efficace nelle applicazioni di deep learning. Questo si ottiene usando l'equazione 5.

figure-protocol-8

Dove W1 e W2 sono matrici di peso, b1 e b2 sono bias e GELU è la funzione di attivazione utilizzata.

Un dropout di 0,1 veniva utilizzato negli strati trasformatori per evitare il sovrafitting senza perdere informazioni importanti sulle caratteristiche. La funzione di attivazione GELU è stata utilizzata per le sue caratteristiche non lineari e lisce, che promuovono il flusso gradiente e la convergenza nei modelli basati su trasformatori. Il dropout viene regolarizzato usando l'equazione 6.figure-protocol-9

Dove p è il tasso di abbandono (ad esempio, 0,1 o 0,5), e lo strato di abbandono imposta casualmente una frazione p delle unità di input a zero durante l'addestramento.

Un tasso di dropout di 0,5 in questi strati aiuta ulteriormente a mitigare il sovrafitting. L'ultimo livello del modello è uno strato logits (equazione 7) che produce tre logit di classe corrispondenti alle categorie normale, benigna e maligna, utilizzando una funzione di perdita di entropia incrociata categorica sparsa (equazione 8) appropriata per questo contesto di classificazione multiclasse.

figure-protocol-10

figure-protocol-11

Dove zi è il vettore logits per la classe i, SoftMax(zi)) rappresenta le probabilità previste, e yi è la vera etichetta di classe.

Il modello è compilato con l'ottimizzatore AdamW (equazioni 9, 10, 11, 12 e 13), un'estensione dell'ottimizzatore Adam che gestisce in modo più efficace il decadimento del peso, impostato a un tasso di apprendimento di 0,001 e un decadimento del peso di 0,0001, ottimizzando sia la velocità di apprendimento che la stabilità del modello.

figure-protocol-12

figure-protocol-13
figure-protocol-14
figure-protocol-15
figure-protocol-16

Dove mt e vt sono il primo e il secondo momento dei gradienti, figure-protocol-17 e figure-protocol-18 sono i momenti corretti per bias, η è il tasso di apprendimento, e ε è una piccola costante per evitare la divisione per zero.

Il modello, una volta addestrato, utilizza una dimensione di batch di 32 per sfruttare l'accelerazione GPU e un calcolo più rapido ed è configurato per addestrarsi per 100 epoche.

Ma l'addestramento ha un meccanismo di arresto precoce sulla perdita di validazione per limitare l'addestramento quando il modello smette di migliorare, per risparmiare risorse computazionali ed evitare il sovraaddestramento di 5 epoche consecutive. Le prestazioni del modello vengono monitorate con metriche come l'accuratezza categoriale scarsa e l'accuratezza delle prime 2, che informano sulla capacità di classificazione del modello nelle categorie previste più probabili. I callback per l'addestramento del modello comprendono checkpointing che salverà il modello con le prestazioni più alte in base all'accuratezza della validazione, per garantire che la versione più efficace del modello venga mantenuta una volta terminato il processo di addestramento. Questa architettura robusta e ben pianificata sfrutta le capacità dei transformer per elaborare dati di imaging medico con un approccio altamente avanzato all'utilizzo dei metodi IA contemporanei per applicazioni importanti nella diagnostica sanitaria.

4. Formazione e validazione

Il modello è stato addestrato in un ambiente Kaggle utilizzando una GPU NVIDIA P100, e durante il processo di addestramento è stato utilizzato un mini-batch gradient descent con una dimensione di 32 lotti. L'ottimizzatore utilizzato durante l'addestramento era AdamW con un tasso di apprendimento di 0,001 e un decadimento del peso di 0,0001; Questo era un buon equilibrio tra una rapida convergenza e una certa regolarizzazione. Il modello è stato addestrato per 100 epoche, tuttavia si è utilizzato l'arresto precoce sulla perdita di validazione con una pazienza di 5 epoche. Per dirla semplicemente, se l'addestramento non migliorava la perdita di validazione per 5 epoche continue, l'addestramento si fermava per sovrafitting e efficienza computazionale. Nella maggior parte dei casi, questo modello ripristinava i pesi dell'epoca con la minima perdita di validazione, indicando che stava funzionando in modo ottimale e non aveva bisogno di eseguire l'intera epoca di 100 epoche. Un totale di circa 32 minuti per addestrare il modello.

Durante l'addestramento, le metriche includevano un'accuratezza categoriale scarsa e una precisione top 2, monitorate sia su set di addestramento che su quelli di validazione. Queste metriche forniscono informazioni su quanto spesso un modello prevede la classe corretta e se la classe corretta si trova tra le prime due previsioni, cosa che nelle applicazioni mediche è importante perché le errate classificazioni ad alta fiducia possono avere conseguenze significative. Le curve di apprendimento per perdita e accuratezza sono visualizzate nella Figura 5.

.figure-protocol-19

Figura 5: Accuratezza dell'addestramento e della validazione e curve di perdita in 50 epoche che mostrano un apprendimento stabile e un overfitting minimo. Clicca qui per visualizzare una versione più grande di questa figura.

Non è stata effettuata alcuna validazione incrociata nel presente studio. Questa configurazione permise una sperimentazione efficiente dell'architettura del modello, inclusi aggiustamenti ai livelli dei transformer e alle dimensioni delle testine MLP, assicurando al contempo che il modello si generalizzasse bene su dati di validazione non visti.

5. Analisi statistica

Le prestazioni del modello Vision Transformer sono state analizzate statisticamente sulla base del dataset IQ-OTH/NCCD sul cancro ai polmoni. Precisione, richiamo, punteggio F1 e accuratezza sono stati calcolati utilizzando rispettivamente le equazioni 14, 15, 16 e 17. Queste quattro sono considerate le misure convenzionali da utilizzare per compiti di classificazione, in quanto possono rivelare informazioni sulle prestazioni del modello nella classificazione e classificazione per classe per ogni classe.

figure-protocol-20
figure-protocol-21
figure-protocol-22
figure-protocol-23

Il ricordo è una misura della capacità di un modello di identificare tutte le istanze rilevanti in una classe, mentre la precisione è la proporzione di identificazioni positive che erano effettivamente corrette. Il punteggio F1 bilancia richiamo e precisione quando entrambe sono importanti.
Le misure di performance utilizzate per questo compito sono state l'equazione 18 del Coefficiente di Correlazione di Matthews (MCC) e l'equazione di Kappa 19 di Cohen.

figure-protocol-24
figure-protocol-25

Dove P0 è l'accordo osservato mentre Pe è l'accordo atteso.

Il MCC è una misura onnicomprensiva delle prestazioni nella classificazione, tenendo conto sia dei veri positivi che dei negativi, dei falsi positivi e dei falsi negativi. Il suo valore può essere compreso tra -1 e 1, con 1 che rappresenta la previsione perfetta, 0 la previsione casuale e -1 il completo disaccordo tra le etichette prevista e vera. Il MCC era utile per confronti tra diverse prestazioni di modelli quando applicato a dataset sbilanciati e fornendo una misura bilanciata indipendentemente dalle diverse dimensioni delle classi.

Come parte di un'ulteriore analisi statistica, il punteggio F2, che dà priorità al richiamo, è stato calcolato come mostrato dall'equazione 20.

figure-protocol-26

Le prestazioni del modello sono state anche quantificate utilizzando l'Errore Quadratico Medio (MSE), l'Errore Quadratico Medio Radice (RMSE) e l'Errore Assoluto Medio (MAE) - che sono tipicamente misurazioni per compiti di regressione ma modificate qui per il compito di classificazione per quantificare quanto fosse grande in media l'errore senza considerare la direzione.

Per determinare se fosse pratico integrare i ViT nei dispositivi sanitari orientati al consumatore, abbiamo effettuato ampi risultati di valutazione delle prestazioni concentrandoci esclusivamente sull'efficienza temporale del modello. Abbiamo creato funzioni per riportare il tempo necessario per prevedere una singola o semplicemente più immagini, poiché questo diventa particolarmente rilevante per applicazioni in tempo reale. Per ogni immagine, prima di iniziare a prevedere, i dati vengono prima pre-elaborati per assumere la forma dell'immagine di input desiderata dal modello. L'ora in cui la previsione è iniziata e quella completata la previsione li abbiamo registrati per ottenere i risultati di tempo e latenza. Il tempo e la latenza media sono stati calcolati utilizzando rispettivamente l'equazione 21 e l'equazione 22.

figure-protocol-27
figure-protocol-28

Dove:

  • N è il numero di immagini (campioni).
  • Tend è il tempo registrato dopo la previsione dell'i-esima immagine.
  • Tstart è il tempo registrato prima di prevedere la i-esima immagine.

Ulteriori esperimenti sono stati condotti per valutare la robustezza del modello Vision Transformer che abbiamo proposto, introducendo sistematicamente ulteriore rumore e sfocatura nelle immagini. Il rumore gaussiano veniva aggiunto a ogni pixel con un fattore di rumore di 0,4 mentre i valori dei pixel erano ritagliati nell'intervallo di [0,1]. Il fattore di sfocatura è stato ridotto tramite la sfocatura gaussiana con una dimensione del chicco di 45× 45. Questi esperimenti sono progettati per valutare il modello in modo completo sotto degradazioni simulate della qualità percettiva dell'immagine.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il modello Vision Transformer ha dimostrato risultati eccezionali su più metriche di valutazione sui dataset IQ-OTH/NCCD sul cancro polmonare, differenziando efficacemente immagini TC normali, benigne e maligne. Le prestazioni complessive del modello hanno raggiunto un'alta accuratezza del 98,18% su tutto il dataset di test composto da 220 immagini. Questa altissima accuratezza indica che il modello è in grado di generalizzare in modo molto efficace e può...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ha ottenuto risultati notevoli nella valutazione e implementazione del modello Vision Transformer sul dataset IQ-OTH/NCCD sul cancro al polmone con grande accuratezza. L'accuratezza generale nella classificazione di una TAC come normale, benigna e maligna è del 98,18% utilizzando questo modello.

Questa superiore accuratezza è ulteriormente dimostrata dalle prestazioni del modello negli altri punteggi chiave, come la precisione del 100% per la rilevazione dei c...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere conflitti di interesse.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo lavoro è stato supportato dal Progetto di Supporto dei Ricercatori della Principessa Nourah bint Abdulrahman University numero (PNURSP2025R432), Principessa Nourah bint Abdulrahman University, Riyadh, Arabia Saudita.  Gli autori ringrazionano il Decanship of Graduate Studies and Scientific Research dell'Università di Najran per aver finanziato questo lavoro sotto il codice di sovvenzione del Growth Funding Program (NU/GP/SERC/13/575-6).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
GPU A100 (CUDA)NVIDIACUDA Versione 11.6Accelerazione GPU per l'addestramento e la valutazione del modello.
AMD EPYC-7502P CPUAMDN/AProcessore utilizzato per calcolo ad alte prestazioni.
Gigabit EthernetIntelN/ANetworking per una comunicazione sicura peer-to-peer in CPS.
MatplotlibPython Software FoundationVersione 3.5Libreria di visualizzazione per tracciare i risultati.
Crittosistema PaillierOpen Source (implementato tramite TenSEAL)N/AConsente la crittografia omomorfa additiva sui gradienti.
PySyftOpenMinedVersione 0.6.0Biblioteca di privacy differenziale e apprendimento federato.
Python (distribuzione Anaconda)Anaconda IncVersione 3.9Include pacchetti preinstallati e strumenti di gestione dell'ambiente, utilizzati per scripting e sviluppo di framework.
PyTorchMeta AIVersione 1.12Framework di deep learning per addestrare modelli.
RAMCorsare256 GigaByte (GB) Supporto ad alto livello di memoria per un addestramento intensivo.
Scikit-learnPython Software FoundationVersione 1.1Strumenti di machine learning per la valutazione delle prestazioni.
SeabornPython Software FoundationVersione 0.11Libreria di visualizzazione statistica dei dati.
Memoria SSDSeagate1 TeraByte (TB)Per una rapida archiviazione e recupero dati.
TenSEALOpenMinedVersione 0.3Libreria di crittografia omomorfa per aggregazione sicura.
TensorFlowGoogleVersione 2.9Framework di deep learning per modelli di diffusione.
Ubuntu OSCanonicoVersione 20.04 LTSSistema operativo utilizzato per tutti gli esperimenti.

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Imaging medica basata su IAMachine learning in ambito sanitarioClassificazione del tumore al polmoneRobustezza dell imagingAccuratezza diagnosticaRumore nelle immagini medicheDiagnostica oncologica

Articoli correlati