$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Il cancro ai polmoni rimane uno dei principali tipi di cancro, che porta a gravi problemi di salute, spesso con la morte1. La radiomica consente la caratterizzazione quantitativa delle immagini mediche estraendo ampi insiemi di caratteristiche che descrivono la forma, la texture e i modelli di intensità deltumore 2,3. Queste caratteristiche, detti anche caratteristiche artigianali, fungono da potenziali biomarcatori per la diagnosi, la prognosi e la risposta terapeutica del cancro ai polmoni. Tuttavia, i dataset radiomici sono tipicamente ad alta dimensione e limitati al campione, portando a caratteristiche ridondanti e rumorose che degradano le prestazioni delmodello 4,5,6,7. Pertanto, una selezione efficiente e spiegabile delle caratteristiche è fondamentale per sviluppare modelli predittivi robusti basati sulla radiomica.
Approcci tradizionali di selezione delle caratteristiche come i metodi di filtro (ad esempio, analisi di correlazione, analisi della varianza [ANOVA], informazioni mutue) e metodi di wrapper (ad esempio, Selezione Sequenziale delle Caratteristiche, Eliminazione Ricorsiva delle Caratteristiche) sono ampiamente utilizzati per i modelli di rilevamento del cancro basati sulla radiomica 4,8,9. Tuttavia, spesso non riescono a catturare interazioni non lineari di caratteristiche e profonde dipendenze contestuali insite nei dati radiomici 9,10,11. Le tecniche di apprendimento delle caratteristiche in ensemble sono state esplorate per la classificazione delle immagini mediche, ma hanno raggiunto una precisione moderata, che potrebbe essere ulteriormentemigliorata 12.
I metodi di deep learning, in particolare le reti neurali profonde (DNN), hanno dimostrato una capacità superiore nel modellare relazioni non lineari e gerarchiche tra caratteristiche ed esiti, rendendoli ideali per guidare la selezione delle caratteristiche e fornire modelli accurati di rilevamento delcancro 13,14. In questo contesto, viene esplorato il potenziale dell'uso di una rete neurale convoluzionale, tecniche di IA multimodali e VCG-16, un modello pre-addestrato per la diagnosi del cancro, 1,15,16. Un modello ibrido di deeplearning 17, che include il modello VGG-19 pre-addestrato e le reti di memoria a lungo termine (LSTM), è stato proposto, addestrato e testato su un gran numero di immagini, raggiungendo un'accuratezza superiore al 99%.
Oltre alla diagnosi del cancro, sono state condotte anche ricerche sullo stadio del cancro. Hugo et al.18 hanno progettato un modello di rete neurale feed-forward sul database NSCLC di 300 pazienti per classificare i tumori stadio I, II e III con una precisione del 74,52% nei test modelli. Un metodo bayesianodi inversione basato su radiomicità 3 è stato presentato per la rilevazione dello stadio del cancro ai polmoni utilizzando il dataset NLST su un campione di 200. Il metodo proposto ha raggiunto un'accuratezza dell'86%. La revisione della letteratura ha rivelato che la maggior parte degli studi sulla diagnosi del cancro si è concentrata esclusivamente sulla classificazione dei tumori benigni e maligni, e solo pochi hanno affrontato la classificazione dello stadio oncologico, con accuratezze inferiori al 90% che possono essere ulteriormente migliorate. Questo articolo di ricerca affronta la lacuna di ricerca menzionata e propone un solido quadro di classificazione basato sulle caratteristiche radiomiche per una rilevazione accurata dello stadio del cancro ai polmoni.
In questo studio è stato introdotto un framework di eliminazione delle caratteristiche ricorsive basato sulla perdita di gradiente (GL-RFE), integrando la retropropagazione del gradiente dalle reti neurali nel processo RFE. A differenza dei metodi RFE convenzionali che si basano su metriche statiche di importanza delle caratteristiche, GL-RFE sfrutta i gradienti della funzione di perdita rispetto a ciascuna caratteristica di input per misurare quanto fortemente ciascuna caratteristica influenzi le previsioni del modello. Rimuovendo iterativamente le caratteristiche con contributi minimi al gradiente, il modello presentato esegue la selezione delle caratteristiche delle prime 15 caratteristiche diagnostiche ottimizzate per la rilevazione dello stadio del cancro polmonare in 2 classi (stadio I e II combinati e stadi IIIa e IIIb combinati). Il diagramma del flusso di lavoro svolto è riportato nella Figura 1. Il dataset scelto per il cancro ai polmoni per il modello presentato è NSCLC Radiomics19, che comprende 411 volumi in formato denominati Digital Imaging and Communications in Medicine (DICOM) con informazioni cliniche sullo stadio oncologico. Un totale di 106 caratteristiche radiomiche 3D di ciascun volume DICOM per tumori ai polmoni viene estratto utilizzando PyRadiomics20, un'estensione di un software open source, 3D Slicer21. Queste caratteristiche appartengono a sette classidi caratteristiche: 22, tra cui forma, metodo della differenza di livello di grigio (GLDM), matrice di co-incidenza a livello di grigio (GLCM), primo ordine, matrice della lunghezza della corsa a livello di grigio (GLRLM), matrice della zona di dimensione del livello di grigio (GLSZM), matrice di differenza di toni di grigio di quartiere (NGTDM). I dati radiomici della classe minoritaria (stadio I e stadio II) sono stati sovracampionati utilizzando la tecnica di sovracampionamento sintetico delle minoranze (SMOTE)23.
La novità del framework proposto GL-RFE risiede nell'integrazione dell'analisi di sensibilità basata su gradiente derivata dall'addestramento delle reti neurali nel processo di eliminazione delle caratteristiche ricorsive. A differenza degli approcci RFE convenzionali che si basano su misure statiche di importanza, GL-RFE valuta dinamicamente la rilevanza delle caratteristiche attraverso gradienti retropropagati della funzione di perdita. Ciò consente l'identificazione di caratteristiche che influenzano direttamente le previsioni del modello per lo stadio oncologico, mantenendo al contempo l'interpretabilità e la fattibilità computazionale per dataset medici relativamente piccoli.
Il dataset utilizzato per l'addestramento e il test del framework proposto è un dataset di immagini CT pubblicamente disponibile di 422 pazienti con cancro polmonare, noto come NSCLC Radiomics17. Per ogni paziente, il set di dati include un volume CT, un set di strutture radioterapiche DICOM (RTSTRUCT) e un file di segmentazione DICOM (SEG). Questi fascicoli contengono delineazioni manuali eseguite da un oncologo radioterapico del volume tridimensionale del volume primario del tumore macroscopico (GTV-1), così come l'immagine polmonare. Il set di dati è un set pre-elaborato, e le dimensioni delle immagini sono 512 x 512 pixel.
A causa della natura non lineare delle caratteristiche radiomiche realizzate a mano, queste caratteristiche non possono essere utilizzate direttamente con modelli di deep learning per la diagnosi del cancro, e i loro modelli di dati intrinseci devono essere catturati tramite tecniche di IA. GL-RFE classifica le caratteristiche in base al modulo di gradiente della perdita L rispetto a ciascuna caratteristica di ingresso xi.
Per ogni caratteristica di input xi, il gradiente assoluto medio viene calcolato come segue:
(1)
Qui, N è il numero totale di campioni. Lj è la perdita per il jcampione. xij è la icaratteristica del jesimo campione.
rappresenta la sensibilità della perdita rispetto alla caratteristica di input.
Le caratteristiche con basse magnitudini di gradiente hanno un impatto minimo sugli aggiornamenti dei modelli e vengono eliminate ricorsivamente. Il flusso di lavoro proposto per eliminare le caratteristiche radiomiche a basso gradiente utilizzando un perceptrone multilivello (MLP) e per addestrare una rete neurale di deep learning (DNN) sulle prime 15 caratteristiche è mostrato nella Figura 1. Le prestazioni del metodo GL-RFE per la selezione delle caratteristiche vengono quindi valutate.
Il modello di deep learning menzionato con il metodo GL–RFE è implementato in un Jupyter notebook su Google Colab, che consente di scrivere ed eseguire codice Python in un ambiente online. È necessario scaricare diversi pacchetti, inclusi nei passaggi del protocollo e nei materiali, per compilare il codice. Utilizzando il metodo descritto nella sezione Protocollo, vengono identificate e utilizzate le 15 principali caratteristiche radiomiche per la rilevazione del cancro ai polmoni per ottenere una rilevazione accurata nei dataset di test.