Un aperçu schématique du flux de travail de prétraitement des EEG, d'extraction des caractéristiques et de classification est présenté dans la Figure 1. Les matériaux et logiciels utilisés dans l'étude sont répertoriés dans le Tableau des matériaux.

Figure 1 : Schéma du flux de travail de prétraitement des EEG, d'extraction des caractéristiques et de classification. Présentation schématique du flux de travail de l'étude, incluant la vérification des données EEG, le filtrage passe-bande et la re-référence, l'extraction des caractéristiques de la racine carrée de la moyenne des carrés (RMS), de la densité spectrale de puissance (PSD) et de l'entropie, l'ajout de l'âge, la séparation entre ensemble d'apprentissage et de test, le développement du modèle Forêt aléatoire, l'analyse de la stabilité des caractéristiques, l'analyse SHAP, l'analyse de la taille de l'effet par le d de Cohen, la sélection intégrée des caractéristiques, l'ablation des caractéristiques d'entropie, le réentraînement du modèle et l'évaluation des performances. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
1. Acquisition des données
Le jeu de données publiquement disponible d'EEG au repos a été obtenu à partir du dépôt OpenNeuro (jeu de données ds004504, version 1.0.9)33. Les étiquettes des participants et les informations démographiques ont été vérifiées. Le jeu de données comprenait 88 participants, dont 36 atteints de la maladie d'Alzheimer (AD), 23 de démence frontotemporale (FTD) et 29 témoins sains (HC).
2. Importation de l'enregistrement EEG
Pour chaque participant, l'enregistrement EEG a été chargé à l'aide de la bibliothèque MNE-Python. Chaque fichier EEG a été vérifié afin de confirmer qu'il était accessible, pouvait être importé avec succès et contenait un identifiant de participant valide. Les enregistrements dont les fichiers étaient manquants ou corrompus ont été exclus. La fréquence d'échantillonnage EEG d'origine de 500 Hz a été conservée à ce stade. Les signaux ont été sous-échantillonnés afin de réduire la charge de calcul tout en préservant toutes les informations EEG cliniquement pertinentes pour cette étude.
3. Filtrage passe-bande
Les enregistrements EEG continus ont été filtrés à l’aide d’un filtre passe-bande du quatrième ordre, avec une fréquence de coupure basse de 0,5 Hz et une fréquence de coupure haute de 40 Hz.
4. Référencement par moyenne commune et segmentation en époques
Un référencement par moyenne commune (CAR) a été appliqué aux enregistrements EEG filtrés. À chaque échantillon temporel, le signal moyen calculé sur tous les canaux EEG disponibles a été soustrait à chaque canal. Les signaux EEG ainsi référencés ont été conservés pour les analyses ultérieures. Chaque enregistrement EEG référencé a été segmenté en époques de durée fixe à l’aide de la fonction make_fixed_length_epochs() dans MNE-Python. Une durée d’époque de 10 s sans chevauchement a été utilisée.
5. Validation des époques
Pour chaque participant, seules les époques complètes de 10 s ont été conservées. Tout segment d'EEG restant plus court que 10 s à la fin d'un enregistrement a été écarté. Chaque époque conservée a ensuite été utilisée comme échantillon individuel pour l'extraction des caractéristiques.
6. Préparation des caractéristiques
Bien que les données du Mini-Mental State Examination (MMSE) étaient disponibles dans le jeu de données source, elles ont été exclues de l'analyse actuelle. Les caractéristiques extraites de l'EEG ont été fusionnées avec les informations démographiques des participants, incluant l'âge et les étiquettes diagnostiques, obtenues à partir du fichier de métadonnées participants.csv. L'identifiant du participant a été utilisé comme clé commune, et seuls les participants disposant à la fois de données sur les caractéristiques de l'EEG et d'informations démographiques correspondantes ont été conservés.
La matrice multidomaine comprenait cinq caractéristiques de la racine carrée de la moyenne des carrés (RMS) (delta_rms, theta_rms, alpha_rms, beta_rms et gamma_rms), cinq caractéristiques de densité spectrale de puissance (PSD) (delta_psd, theta_psd, alpha_psd, beta_psd et gamma_psd) et cinq caractéristiques d'entropie (delta_entropy, theta_entropy, alpha_entropy, beta_entropy et gamma_entropy). L'âge a été inclus comme variable démographique complémentaire. Étant donné que les distributions d'âge peuvent différer entre les groupes diagnostiques, un biais de confusion démographique n'a pas pu être complètement écarté. Le groupe diagnostique, défini comme AD, HC ou FTD, a été attribué comme étiquette cible.
7. Prétraitement des données et partitionnement en ensembles d'apprentissage et de test
Lors du prétraitement, les enregistrements ont été sous-échantillonnés de 500 Hz à 250 Hz afin de réduire les exigences informatiques tout en conservant les informations de fréquence EEG d'intérêt.
L'ensemble de données a été divisé en sous-ensembles d'apprentissage (80 %) et de test (20 %) au niveau des sujets à l'aide d'une stratégie de fractionnement groupée. Les prédictions au niveau des sujets ont ensuite été obtenues par un vote majoritaire sur les époques prédites appartenant à chaque participant. L'évaluation principale a utilisé une séparation groupée entraînement-test au niveau des sujets afin d'éviter que des époques provenant du même participant n'apparaissent dans les deux sous-ensembles. Les prédictions au niveau des sujets ont été obtenues par un vote majoritaire sur les époques prédites appartenant à chaque participant. L'ensemble de données a été examiné pour détecter les valeurs manquantes, et les observations manquantes ont été supprimées ou imputées selon le cas. Les étiquettes diagnostiques ont été encodées. Un StandardScaler a été ajusté sur les données d'apprentissage, puis appliqué aux ensembles de données d'apprentissage et de test.
8. Développement du modèle de forêt aléatoire
Un classificateur de forêt aléatoire a été initialisé avec 80 arbres, une profondeur maximale d'arbre de 10, un maximum de quatre caractéristiques, un minimum de cinq échantillons par feuille et un état aléatoire de 42. Le classificateur a été entraîné à l'aide du jeu de données d'entraînement standardisé.
9. Évaluation du modèle
Des étiquettes de classe ont été prédites pour les jeux de données d'apprentissage et de test. Une matrice de confusion a été construite, et l'exactitude, la précision, le rappel ainsi que le score F1 ont été calculés conjointement avec le rapport de classification. Les exactitudes d'apprentissage et de test ont été enregistrées.
Pour l'évaluation par participant, veillez à ce que toutes les époques d'un participant donné soient attribuées exclusivement soit à l'ensemble d'entraînement, soit à l'ensemble de test. Le classificateur Forêt aléatoire a été entraîné en utilisant les mêmes hyperparamètres que dans l'analyse principale.
10. Validation croisée
En tant que procédure supplémentaire d'évaluation du modèle, une validation croisée stratifiée en cinq parties a été réalisée en utilisant shuffle = True et random_state = 30. La précision moyenne et l'écart type sur les cinq parties ont été calculés. Cette analyse a été considérée indépendamment de l'évaluation principale par réservation de sujets.
11. Analyse de la stabilité des caractéristiques
La stabilité des caractéristiques a été évaluée en répétant l'apprentissage du forêt aléatoire 10 fois à l'aide de graines aléatoires allant de 0 à 9. Pour chaque exécution, la précision sur l'ensemble de test et les scores d'importance des caractéristiques ont été enregistrés. La moyenne et l'écart type du score d'importance de chaque prédicteur ont été calculés sur les 10 exécutions, puis les prédicteurs ont été classés selon leur stabilité. Cette analyse a été utilisée pour évaluer la cohérence des classements des caractéristiques, et non pour remplacer l'évaluation principale au niveau des sujets.
12. Analyse d'intelligence artificielle explicative
L'analyseur de type TreeExplainer de SHAP a été appliqué au modèle de forêt aléatoire entraîné. Les valeurs SHAP ont été calculées afin d'estimer la contribution de chaque caractéristique aux prédictions du modèle. La valeur absolue moyenne de SHAP a été calculée pour chaque caractéristique, et celles-ci ont été classées selon leurs contributions SHAP. Les caractéristiques présentant des valeurs SHAP constamment faibles ont été identifiées et comparées aux résultats des analyses de stabilité des caractéristiques et de d de Cohen. Les caractéristiques montrant des contributions constamment faibles ont été sélectionnées pour une suppression ultérieure et un nouvel entraînement du modèle.
13. Analyse de la taille de l'effet statistique
Le d de Cohen a été calculé pour chaque biomarqueur EEG dans les comparaisons MA versus CS, MA versus DFT et DFT versus CS. L'ampleur des tailles d'effet a été interprétée à l'aide de seuils fixés à 0,20 pour un effet faible, 0,50 pour un effet modéré et 0,80 pour un effet important.
14. Sélection intégrée des caractéristiques
Les résultats de l'analyse d'importance des caractéristiques par forêt aléatoire, de l'analyse SHAP et de l'analyse de Cohen’s d ont été comparés. Les prédicteurs qui présentaient de façon constante une faible importance des caractéristiques, une faible contribution SHAP et de petites tailles d'effet ont été identifiés comme candidats à l'élimination.
15. Ablation des caractéristiques
Les caractéristiques d'entropie ont été évaluées dans une analyse d'ablation exploratoire, et une matrice réduite de caractéristiques contenant la RMS, la DSE et l'âge a été construite. Le classificateur Forêt aléatoire a été réentraîné en utilisant les mêmes hyperparamètres. L'entraînement du modèle, les tests, la validation croisée et l'analyse de la courbe caractéristique de fonctionnement du récepteur (ROC) ont été répétés à l'aide de l'ensemble réduit de caractéristiques.
16. Analyse ROC
Les probabilités des classes ont été obtenues à partir du classificateur Random Forest optimisé. Les courbes ROC multiclasse ont été générées en utilisant une stratégie un-contre-le-reste. Les valeurs de la surface sous la courbe (AUC) spécifiques à chaque classe ainsi que l'AUC moyenne ont été calculées.
17. Comparaison des performances
Les performances du modèle complet basé sur les caractéristiques ont été comparées à celles du modèle réduit obtenu après l'ablation des caractéristiques selon l'entropie.