Una panoramica schematica del flusso di lavoro di preelaborazione dell'EEG, estrazione delle caratteristiche e classificazione è mostrata nella Figura 1. I materiali e il software utilizzati nello studio sono elencati nella Tabella dei materiali.

Figura 1: Flusso di lavoro della pre-elaborazione dell'EEG, estrazione delle caratteristiche e classificazione. Schema riassuntivo del flusso di lavoro dello studio, comprensivo di verifica dei dati EEG, filtraggio passa-banda e riferimento, estrazione delle caratteristiche di root mean square (RMS), densità spettrale di potenza (PSD) ed entropia, aggiunta dell'età, suddivisione in training e test, sviluppo del modello Random Forest, analisi della stabilità delle caratteristiche, analisi SHAP, analisi dell'effetto dimensionale di Cohen’s d, selezione integrata delle caratteristiche, ablazione delle caratteristiche di entropia, riaddestramento del modello e valutazione delle prestazioni. Cliccare qui per visualizzare una versione ingrandita di questa figura.
1. Acquisizione dei dati
Il set di dati EEG a riposo disponibile pubblicamente è stato ottenuto dal repository OpenNeuro (dataset ds004504, versione 1.0.9)33. Sono stati verificati i codici identificativi dei partecipanti e le informazioni demografiche. Il set di dati comprendeva 88 partecipanti, di cui 36 con malattia di Alzheimer (AD), 23 con demenza frontotemporale (FTD) e 29 controlli sani (HC).
2. Importazione della registrazione EEG
Per ogni partecipante, la registrazione EEG è stata caricata utilizzando la libreria MNE-Python. Ogni file EEG è stato verificato per confermare che fosse accessibile, potesse essere importato correttamente e contenesse un identificatore valido del partecipante. Le registrazioni con file mancanti o danneggiati sono state escluse. La frequenza di campionamento originale dell'EEG di 500 Hz è stata mantenuta in questa fase. I segnali sono stati sottocampionati per ridurre il carico computazionale preservando tutte le informazioni EEG clinicamente rilevanti per questo studio.
3. Filtraggio passa-banda
Le registrazioni EEG continue sono state filtrate utilizzando un filtro passa-banda del quarto ordine con una frequenza di taglio inferiore di 0,5 Hz e una frequenza di taglio superiore di 40 Hz.
4. Riferimento medio comune ed epoche
È stato applicato il riferimento medio comune (CAR) alle registrazioni EEG filtrate. In ogni campione temporale, è stato calcolato il segnale medio su tutti i canali EEG disponibili e sottratto da ciascun canale. I segnali EEG riferiti sono stati conservati per le analisi successive. Ogni registrazione EEG riferita è stata suddivisa in epoche di durata fissa utilizzando la funzione make_fixed_length_epochs() in MNE-Python. È stata utilizzata un’epoca della durata di 10 s con sovrapposizione di 0 s.
5. Convalida delle epoche
Per ogni partecipante, sono state mantenute solo le epoche complete di 10 s. Ogni segmento EEG residuo più breve di 10 s alla fine di una registrazione è stato scartato. Ciascuna epoca mantenuta è stata successivamente utilizzata come campione singolo per l'estrazione delle caratteristiche.
6. Preparazione delle caratteristiche
Sebbene i dati del Mini-Mental State Examination (MMSE) fossero disponibili nel set di dati originale, sono stati esclusi dall'analisi attuale. Le caratteristiche estratte dall'EEG sono state unite alle informazioni demografiche dei partecipanti, inclusi età ed etichette diagnostiche, ottenute dal file di metadati participants.csv. L'identificatore del partecipante è stato utilizzato come chiave comune, e sono stati mantenuti solo i partecipanti che presentavano sia i record delle caratteristiche EEG sia le corrispondenti informazioni demografiche.
La matrice multidominio delle caratteristiche includeva cinque parametri di root mean square (RMS) (delta_rms, theta_rms, alpha_rms, beta_rms e gamma_rms), cinque parametri di densità spettrale di potenza (PSD) (delta_psd, theta_psd, alpha_psd, beta_psd e gamma_psd) e cinque parametri di entropia (delta_entropy, theta_entropy, alpha_entropy, beta_entropy e gamma_entropy). L'età è stata inclusa come variabile demografica complementare. Poiché le distribuzioni di età possono differire tra i gruppi diagnostici, non è stato possibile escludere completamente un confondimento demografico. Il gruppo diagnostico, definito come AD, HC o FTD, è stato assegnato come etichetta obiettivo.
7. Preelaborazione dei dati e suddivisione in training e test
Durante la preelaborazione, le registrazioni sono state sottocampionate da 500 Hz a 250 Hz per ridurre i requisiti computazionali mantenendo al contempo le informazioni sulle frequenze EEG di interesse.
Il dataset è stato suddiviso in sottoinsiemi di addestramento (80%) e di test (20%) a livello di soggetto, utilizzando una strategia di suddivisione raggruppata. Le previsioni a livello di soggetto sono state successivamente ottenute mediante votazione maggioritaria sui singoli intervalli temporali (epoch) predetti appartenenti a ciascun partecipante. La valutazione principale ha adottato una suddivisione train-test raggruppata a livello di soggetto, al fine di evitare che intervalli temporali dello stesso partecipante fossero presenti in entrambi i sottoinsiemi. Le previsioni a livello di soggetto sono state ottenute mediante votazione maggioritaria sui singoli intervalli temporali predetti appartenenti a ciascun partecipante. Il dataset è stato esaminato alla ricerca di valori mancanti, e le osservazioni mancanti sono state rimosse o imputate secondo opportunità. Le etichette diagnostiche sono state codificate. Uno StandardScaler è stato addestrato sui dati di training e successivamente applicato sia al dataset di addestramento che a quello di test.
8. Sviluppo del modello di foresta casuale
Un classificatore di foresta casuale è stato inizializzato utilizzando 80 alberi, una profondità massima dell'albero di 10, un massimo di quattro caratteristiche, un minimo di cinque campioni per foglia e un valore di randomizzazione pari a 42. Il classificatore è stato addestrato utilizzando il set di dati di addestramento standardizzato.
9. Valutazione del modello
Sono state previste le etichette delle classi sia per il set di dati di addestramento che per quello di test. È stata costruita una matrice di confusione e sono stati calcolati accuratezza, precisione, richiamo e punteggio F1 insieme al report di classificazione. Sono state registrate le accuratezze ottenute nell'addestramento e nel test.
Per la valutazione per partecipante, assicurarsi che tutte le epoche di un determinato partecipante siano assegnate esclusivamente al sottoinsieme di addestramento o a quello di test. Il classificatore Random Forest è stato addestrato utilizzando gli stessi iperparametri dell'analisi primaria.
10. Validazione incrociata
Come ulteriore procedura di valutazione del modello, è stata eseguita una validazione incrociata stratificata a cinque ripetizioni utilizzando shuffle = True e random_state = 30. Sono stati calcolati la precisione media e la deviazione standard sulle cinque ripetizioni. Questa analisi è stata considerata separatamente rispetto alla valutazione primaria con campione trattenuto a livello di soggetto.
11. Analisi della stabilità delle caratteristiche
La stabilità delle caratteristiche è stata valutata ripetendo l'addestramento della foresta casuale 10 volte, utilizzando semi casuali compresi tra 0 e 9. Per ogni esecuzione, sono stati registrati l'accuratezza nel test e i punteggi di importanza delle caratteristiche. Sono stati calcolati la media e la deviazione standard del punteggio di importanza di ciascun predittore su tutte le 10 esecuzioni, e i predittori sono stati ordinati in base alla loro stabilità. Questa analisi è stata utilizzata per valutare la coerenza dei ranghi delle caratteristiche, piuttosto che per sostituire la valutazione principale a livello di soggetto.
12. Analisi di intelligenza artificiale interpretabile
È stato applicato l'analizzatore SHAP TreeExplainer al modello Random Forest addestrato. I valori SHAP sono stati calcolati per stimare il contributo di ciascuna caratteristica alle previsioni del modello. È stato calcolato il valore assoluto medio dei valori SHAP per ogni caratteristica, e le caratteristiche sono state ordinate in base ai loro contributi SHAP. Sono state identificate le caratteristiche con valori SHAP costantemente bassi e confrontate con i risultati delle analisi di stabilità delle caratteristiche e di Cohen’s d. Le caratteristiche che mostravano contributi costantemente ridotti sono state selezionate per la successiva ablazione e riaddestramento del modello.
13. Analisi dell'entità dell'effetto statistico
È stato calcolato il valore d di Cohen per ciascun biomarcatore EEG nei confronti tra AD versus HC, AD versus FTD e FTD versus HC. L'entità degli effetti è stata interpretata utilizzando soglie pari a 0,20 per un effetto piccolo, 0,50 per un effetto medio e 0,80 per un effetto grande.
14. Selezione integrata delle caratteristiche
Sono stati confrontati i risultati dell'analisi dell'importanza delle caratteristiche mediante Random Forest, dell'analisi SHAP e dell'analisi di Cohen’s d. I predittori che hanno mostrato in modo consistente un'importanza ridotta, un basso contributo SHAP e dimensioni dell'effetto piccole sono stati identificati come candidati per l'eliminazione.
15. Ablazione delle caratteristiche
Le caratteristiche di entropia sono state valutate mediante un'analisi esplorativa di ablazione, e una matrice ridotta di caratteristiche contenente RMS, PSD ed età è stata costruita. Il classificatore Random Forest è stato rieseguito con gli stessi iperparametri. L'addestramento del modello, la verifica, la validazione incrociata e l'analisi della curva caratteristica operativa del ricevitore (ROC) sono stati ripetuti utilizzando l'insieme ridotto di caratteristiche.
16. Analisi ROC
Le probabilità delle classi sono state ottenute dal classificatore Random Forest ottimizzato. Le curve ROC multiclasse sono state generate utilizzando una strategia uno-contro-tutti (one-versus-rest). Sono stati calcolati i valori dell'area sotto la curva (AUC) specifici per ogni classe e l'AUC media.
17. Confronto delle prestazioni
Le prestazioni del modello di caratteristiche completo sono state confrontate con quelle del modello di caratteristiche ridotto ottenuto dopo l'ablazione delle caratteristiche in base all'entropia.