Article de recherche

SET Net : un cadre hybride d’apprentissage profond pour la classification de la relaxation de l’attention basée sur l’EEG dans les applications d’interface cerveau-ordinateur

DOI :

10.3791/70700

29 mai 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cet article présente le réseau de transformateurs à compression et excitation (SET-Net), un réseau hybride CNN-Transformer qui reconnaît les états d’attention et de relaxation en utilisant des caractéristiques de spectrogrammes pour identifier les états d’attention et de relaxation basés sur l’EEG avec une précision de 93,7 % et une forte généralisation, destiné à être utilisé dans les applications Interface Cerveau-Ordinateur (BCI).

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La technologie d’interface cerveau-ordinateur (BCI) est utilisée comme un outil pour fournir un canal de communication direct entre le cerveau humain et l’environnement extérieur. Cela a des applications dans les systèmes d’assistance et interactifs. L’acquisition non invasive de l’activité neuronale par électroencéphalographie (EEG) est la norme avec les systèmes BCI. Cependant, il est difficile de classer efficacement les états cognitifs, y compris l’attention et la relaxation, car le signal EEG est non stationnaire et bruyant. Pour surmonter ces lacunes, cette étude propose une nouvelle architecture hybride d’apprentissage profond, à savoir le réseau transformateur de compression et excitation (SE) (SET-Net). Dans cette méthode, les signaux EEG sont prétraités et divisés en fenêtres temporelles pour analyser les représentations significatives du spectrogramme. Le modèle proposé atteint une précision de classification de 93,7 %, avec un score F1 de 0,93 et un ROC-AUC de 0,98. Cela démontre l’efficacité du modèle hybride d’apprentissage profond avec une discrimination accrue de l’état d’attention-relaxation basé sur l’EEG. Cela offre un système évolutif pour les applications BCI en temps réel en tant que technologie d’assistance dans l’interaction homme-machine.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les interfaces cerveau-ordinateur (ICC) sont devenues une technologie perturbatrice qui permet au cerveau humain et aux dispositifs externes de communiquer directement sans recourir aux connexions neuromusculaires traditionnelles. L’électroencéphalographie (EEG) est la technique la plus courante et la plus largement utilisée en raison de sa nature non invasive, de sa portabilité et de son rapportcoût-efficacité 1. Les ICC basées sur l’EEG ont été utilisées dans la santé ainsi que dans la neurorééducation, le jeu vidéo et les technologies d’assistance pour les personnes ayant des troubles neurologiques en examinant l’activitécérébrale 2. L’une des applications les plus importantes est l’identification des états cognitifs, y compris l’attention et la relaxation, qui peuvent être utilisés pour créer des interfaces homme-machine adaptatives et une accessibilité numérique3. Un faible rapport signal/bruit, une grande variabilité entre sujets et une dynamique temporelle compliquée entre les états d’attention et de relaxation, interprétées à l’aide d’EEG ; par conséquent, classer les états d’attention et de relaxation à l’aide de l’EEG estdifficile 4. Les modèles classiques d’apprentissage automatique, y compris la machine à vecteurs de support (SVM) et la forêt aléatoire, ont montré des performances modérées ; cependant, ils sont généralement basés sur l’ingénierie des caractéristiques car ils n’exploitent pas pleinement la complexité spatiale-spectrale-temporelle del’EEG 5. Les développements récents en apprentissage profond, en particulier les réseaux de neurones convolutionnels (CNN) et les transformateurs, ont offert de nouvelles opportunités pour l’extraction automatisée des caractéristiques et une classification forte des signauxEEG 6.

Les systèmes BCI basés sur l’EEG ont été largement étudiés pendant de longues périodes comme outil de surveillance de l’état cognitif, de neuroréhabilitation et de systèmes interactifs. La définition de l’état mental est l’un des défis les plus cruciaux, par exemple les états de relaxation et d’attention. En réponse à cela, les scientifiques ont démontré diverses solutions, telles que l’ingénierie des caractéristiques standard et les modèles avancés d’apprentissage profond. Les approches classiques d’apprentissage automatique reposent principalement sur des caractéristiques manuellement conçues dans le temps, la fréquence ou l’espace temps-fréquence. La recherche sur les algorithmes hybrides d’apprentissage profond dans le cadre du système SET-Net de classification attention-relaxation basée sur l’EEG s’est révélée être une orientation scientifique importante, car elle pourrait potentiellement améliorer les systèmes BCI pouvant être utilisés dans des contextes réels7,8. Les modèles d’apprentissage profond, y compris les réseaux de neurones convolutionnels (CNN), les réseaux de neurones récurrents (RNN) et les transformateurs, ont réalisé des progrès significatifs dans le décodage des signaux EEG au cours de la dernière décennie9,10. Ces développements ont conduit à une amélioration et une meilleure efficacité du décodage des états cognitifs, qui sont souhaitables pour les états cognitifs de neurorééducation et de technologies d’assistance11,12. La popularité croissante des systèmes BCI souligne l’importance appliquée d’améliorer la précision de la classification, et des résultats récents ont montré que la classification peut dépasser 85 % en imagerie motrice et activités d’attention13,14. Néanmoins, des défis subsistent malgré ces avancées pour obtenir des classifications en temps réel solides dans des environnements divers et bruyants15,16. Le problème clé abordé dans cette étude est la précision et la validité externe des modèles de classification attention-relaxation basés sur l’EEG, en particulier les modèles consistant en apprentissage profond hybride dans l’architecture SET-Net17,18, sont limités. Les méthodes existantes sont généralement associées à des problèmes de variabilité entre sujets, de faible bruit de signal et d’exploitation limitée des propriétés spatiotemporelles19,20,21. Il existe des méthodes orientées vers l’extraction convolutionnelle de caractéristiques, et d’autres vers l’architecture de l’attention ou des transformateurs, ce qui conduit à diverses opinions sur la meilleure conception de modèle22,23,24. De plus, les modèles EEG ne sont pas faciles à entraîner et à justifier en raison de l’indisponibilité de grands ensembles de données annotés25,26. Ce manque de connaissances limite l’utilisation des ICC dans des conditions réelles, ce qui est le plus important pour être flexible et précis 27,28. Cela est établi théoriquement sur un mélange d’extraction de caractéristiques spatiales, temporelles et d’attention utilisant des modèles hybrides d’apprentissage profond29,30,31. Cette combinaison se retrouve dans le cadre SET-Net, qui est obtenu via des couches convolutionnelles pour extraire des caractéristiques locales et des mécanismes d’auto-attention pour apprendre les dépendances globales32. Cette synergie améliore la représentation des signaux EEG et peut être appliquée à une meilleure classification des états de relaxation et d’attention. La théorie est initiée sur le fait que la variabilité des signaux EEG et du bruit peut être éliminée grâce à la force des caractéristiques spatiotemporelles multi-échelle et des techniques d’adaptation de domaine33. La revue systématique vise à examiner de manière critique les progrès théoriques de la précision et de l’application pratique des méthodes hybrides d’apprentissage profond de l’architecture SET-Net de classification attention-relaxation basée sur l’EEG34. La revue sera utilisée pour guider la création d’un système BCI meilleur, plus interprétatif et généralisable lors de futures expériences, grâce à la synthèse des développements les plus récents et à l’identification des forces et des limites des méthodes. De telles lacunes aideront au développement futur d’applications concrètes de la BCI qui amélioreront l’utilisateur et la fiabilité du système. La revue a appliqué une approche de revue de littérature large, où des articles évalués par des pairs ont été exercés en s’appuyant sur des modèles hybrides d’apprentissage profond dans la classification EEG attention-relaxation34. Les critères d’inclusion se concentrent sur les tendances récentes des architectures convolutionnelles, récurrentes et basées sur l’attention dans le cadre de systèmes SET-Net ou similaires35. Les modèles analytiques évaluent les conceptions de modèles, les algorithmes de sélection des caractéristiques, la précision de la classification et la praticabilité dans un contexte réel. Les résultats sont organisés pour expliquer la construction de théories, la pratique et les opportunités de recherche futures.

Malgré les avancées récentes, les méthodes existantes ne parviennent pas à capturer simultanément les dépendances spatiales, spectrales et temporelles à longue portée dans les signaux EEG à canal unique, ce qui entraîne des performances sous-optimales dans la classification attention-relaxation. De plus, les méthodes existantes reposent sur des caractéristiques ajoutées manuellement ou ne considèrent que quelques caractéristiques des signaux EEG ; ainsi, ils ne peuvent pas être généralisés entre les participants et les conditions en temps réel. Ainsi, il est nécessaire d’un cadre unifié capable de modéliser suffisamment les caractéristiques EEG multidimensionnelles et qui soit solide et recherché en temps réel.

Pour surmonter ces inconvénients, cette étude propose un article de recherche suggérant un modèle hybride d’apprentissage profond, appelé Réseau de Transformateurs de Pression et d’Excitation (SET-Net). En particulier, le module CNN apprend les motifs spectraux spatiaux locaux grâce à des spectrogrammes EEG et surmonte les contraintes de l’extraction de caractéristiques artisanale. Le bloc SE améliore la représentation des caractéristiques en adaptant l’importance par canal et en augmentant la robustesse du bruit et de la variabilité. L’encodeur transformateur mopère des dépendances temporelles à longue portée qui ne sont pas limitées aux modèles CNN uniquement. De plus, l’analyse temps-fréquence peut être réalisée efficacement en utilisant une représentation basée sur le spectrogramme, ce qui améliore l’apprentissage des caractéristiques discriminatives. Pour garantir une performance stable, un entraînement équilibré et une validation sans fuite ont été adoptés, ce qui a amélioré la généralisation des performances entre les sujets.

De plus, la structure suggérée est confirmée dans une application en temps réel, dans laquelle les états cognitifs catégorisés sont transformés en instructions de contrôle de systèmes interactifs. Cela montre que le modèle est pratiquement applicable aux technologies d’assistance et à l’accessibilité numérique, et pourrait potentiellement être utilisé dans la mise en œuvre pratique de la BCI.

La principale réalisation de cette étude est la conception d’une nouvelle architecture hybride SET-Net qui intègre des réseaux neuronaux convolutionnels, une attention de compression et d’excitation, ainsi que des encodeurs transformateurs pour mieux modéliser les signaux EEG. De plus, une représentation basée sur un spectrogramme a été utilisée pour représenter avec succès les propriétés temps-fréquence des signaux EEG. Le cadre suggéré permet une classification riguette des états cognitifs d’attention et de relaxation. De plus, il a été démontré que le modèle avait une applicabilité pratique dans une application d’interface cerveau-ordinateur en temps réel.

Cet article est organisé en sections dans lesquelles une revue des études catégorisant les classes d’attention et de relaxation de l’activité cérébrale appliquées aux systèmes BCI. Cet article est structuré pour présenter d’abord les lacunes et défis de recherche liés au développement des systèmes BCI, puis présenter le processus d’acquisition des données et la méthodologie comprenant l’enregistrement des signaux EEG, Prétraitement et représentation des caractéristiques. Il aborde l’importance des activités d’attention et de relaxation, ainsi que le processus d’obtention de caractéristiques significatives à partir des données EEG. Les résultats sont ensuite présentés et évalués à l’aide d’analyses quantitatives et comparatives, ainsi que de la performance réelle de l’application. La dernière partie aborde les résultats, les limites de l’étude et les orientations futures des travaux.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’étude a été menée conformément à la Déclaration d’Helsinki et approuvée par le Comité d’éthique institutionnelle de l’Université SR, Warangal, Telangana, Inde (Approbation n° 007/2026). Le consentement éclairé a été obtenu par écrit de tous les participants avant la collecte des données.

Sélection des participants

Les données EEG ont été collectées auprès de 11 participants en bonne santé (tranche d’âge : 25–45 ans ; moyenne : 28 ans) sans antécédents de troubles neurologiques ou psychiatriques. Dans cette étude, un total de 1175 segments EEG ont été considérés, dont 527 appartiennent à la classe de relaxation et 648 à la classe de l’attention. Les participants dont les enregistrements EEG présentaient des artefacts de mouvement excessifs ou une mauvaise qualité du signal ont été exclus.

Installation de l’acquisition EEG

La disposition générale du système d’interface cerveau-ordinateur suggéré basé sur l’EEG est illustrée à la Figure 1, qui montre l’ensemble du pipeline d’acquisition, de classification et d’utilisation en temps réel du signal. Les données EEG ont été enregistrées à l’aide d’un petit module d’acquisition de biopotentiel relié à un système basé sur un microcontrôleur. Les électrodes gel ont été placées selon le système International 10–20, à savoir les points préfrontaux de Fp1 et Fp2, avec des électrodes de référence et de masse placées aux lobes de l’oreille, comme indiqué à la Figure 2. Les signaux étaient numérisés à un débit de 128 Hz et envoyés à un ordinateur à l’aide d’un script d’acquisition Python auto-écrit. Un prétraitement adéquat de la peau et un gel conducteur ont été utilisés pour réduire l’impédance des électrodes et améliorer la qualité du signal.

Procédure expérimentale

Les enregistrements EEG ont été réalisés sous deux conditions cognitives, relaxation et attention, selon un protocole standardisé. En état de relaxation, le participant était assis dans un environnement confortable et à faible bruit et on lui a demandé de rester immobile avec un minimum de mouvements. Un audio instrumental apaisant était diffusé dans des écouteurs, et l’acquisition de l’EEG était initiée à l’aide de la commande Python collect.py. Les signaux EEG étaient enregistrés pendant 5 minutes par séance et répétés pendant quatre séances. Dans l’état d’attention, le participant a été instruit à effectuer des tâches exigeantes d’attention telles que des jeux interactifs tout en maintenant la même configuration d’acquisition que dans la condition de relaxation. Les signaux EEG étaient enregistrés pendant 5 minutes par séance et répétés pendant quatre séances. Chaque participant a participé pendant un total de 40 minutes, comprenant 20 minutes de relaxation et 20 minutes d’attention, permettant une comparaison fiable des états cognitifs.

Le jeu de données traité était organisé en segments identifiés comme suit : Relaxation (0) ; Attention (1). Chaque segment avait une durée de 4 s avec un chevauchement de 50 % et était représenté par un spectrogramme à l’aide d’une transformée de Fourier à court temps.

Traitement du signal, représentation des caractéristiques et implémentation des modèles

Les signaux EEG obtenus étaient pré-traités pour éliminer le bruit et les artefacts. Un filtre à encoches de 50 Hz était utilisé pour éliminer les interférences sur la ligne électrique, et un filtre passe-bande Butterworth de 4e ordre dans le signal entre 0,5 et 30 Hz était utilisé pour sélectionner les bandes de fréquences EEG pertinentes. Le seuil d’amplitude et l’inspection visuelle ont été utilisés pour identifier les segments contaminés par des artefacts, et environ 8 à 12 % des données ont été supprimées. L’ajout de bruit gaussienne, le masquage temporel et le masquage de fréquence sont des méthodes d’augmentation de données utilisées pour améliorer la robustesse des modèles. Les signaux EEG ont été filtrés puis divisés en fenêtres de 4 secondes séparées par 50 %.

Les segments EEG individuels ont été convertis en une représentation temps-fréquence (transformée de Fourier à court terme), comme montré dans l’équation (1), afin de permettre l’extraction des caractéristiques temporelles et spectrales.

figure-protocol-1(1)

Les spectrogrammes résultants ont été normalisés et redimensionnés à des dimensions fixes pour servir d’entrées au modèle de classification. Pour éviter les fuites de données induites par des chevauchements, le jeu de données a été divisé en sous-ensembles d’entraînement (70 %), de validation (10 %) et de tests (20 %) avant la segmentation, comme illustré à la Figure 3. De plus, une validation croisée « laissez-un-sujet dehors » (LOSO) a été réalisée pour évaluer la généralisation inter-sujets, où les données d’un sujet étaient utilisées pour les tests, tandis que les données restantes étaient utilisées pour l’entraînement.

L’architecture proposée SET-Net, comme illustrée à la Figure 4, a été conçue pour capturer des caractéristiques EEG multidimensionnelles. Le modèle intègre un réseau de neurones convolutionnel (CNN) pour extraire des représentations spatiales-spectrales, suivi d’un bloc de compression et d’excitation (SE) qui recalibre adaptativement l’importance des caractéristiques canal par canal, comme décrit dans l’équation (2). Le réseau central CNN se compose de deux couches convolutionnelles avec une taille de noyau de 3 × 3, suivies d’une normalisation par lots et d’une activation par unité linéaire exponentielle (ELU)

figure-protocol-2(2)

La structure interne du bloc SE est illustrée à la Figure 5. Pour capturer les dépendances temporelles à longue portée, un encodeur transformateur a été intégré, dont le mécanisme d’attention est défini dans l’équation (3) et illustré à la Figure 6.

figure-protocol-3(3)

Une couche de pooling moyen adaptatif a été utilisée pour réduire les cartes de caractéristiques à une taille fixe de 16 × 16. Le rapport de réduction du bloc SE est de 8, utilisé pour recalibrer les réponses de caractéristiques par canal. L’encodeur transformateur se composait de quatre couches avec quatre têtes d’attention, d’une dimension d’avance de 256, et d’une taille d’immersion de modèle de 128.

La classification finale a été réalisée à l’aide de couches entièrement connectées avec régularisation de dropout et une fonction d’activation softmax pour distinguer les états d’attention et de relaxation. L’architecture détaillée couche par couche du modèle proposé est présentée dans le Tableau 1.

Le modèle a été entraîné à l’aide de l’optimiseur AdamW avec un taux d’apprentissage initial de 0,001 et une décroissance du poids de 1×10⁻4. Un ordonnanceur de recuit cosinus a été utilisé pour améliorer la convergence, et 50 époques ont été entraînées en utilisant une taille de lot de 32. Le déséquilibre de classe a été surmonté à l’aide d’une fonction de perte pondérée en entropie croisée, comme décrit dans l’équation (4).

figure-protocol-4(4)

Le tableau 2 résume la configuration d’entraînement, et le tableau 3 présente la recherche par hyperparamètres du SET-Net proposé, utilisé dans la classification d’attention-relaxation basée sur l’EEG. Les paramètres sélectionnés assurent la stabilité de l’entraînement, une généralisation accrue et une tolérance aux variations des signaux EEG. Les paramètres choisis apportent de la stabilité au processus d’entraînement, favorisent la généralisation et résistent aux modifications du signal EEG. La précision, la précision, le rappel, le score F1 et le ROC-AUC ont été utilisés pour mesurer la performance du modèle. Tous les pipelines impliquant le prétraitement, l’entraînement et l’évaluation des modèles ont été écrits en Python en utilisant le cadre PyTorch pour garantir la reproductibilité. Le tableau 4 fournit une description détaillée du dépannage pour guider et résoudre les problèmes liés à l’acquisition EEG, au prétraitement, à l’entraînement des modèles et à l’utilisation en temps réel. Le tableau 5 offre un aperçu des matériaux de l’appareil EEG afin de permettre un cadre facile pour mener des expériences et la mise en place expérimentale. Python 3.8 avec le cadre d’apprentissage profond PyTorch a été utilisé pour implémenter le cadre SET-Net proposé. Des bibliothèques informatiques scientifiques standard étaient utilisées pour le prétraitement du signal et l’extraction de caractéristiques en utilisant NumPy, SciPy et Matplotlib. Chaque procédure expérimentale était réalisée sur un système équipé d’un processeur Intel i7 et de 16 Go de RAM pour accélérer l’entraînement des modèles.

DISPONIBILITÉ DES DONNÉES :

L’ensemble de données EEG anonymisé généré et analysé durant cette étude est disponible publiquement dans le dépôt Zenodo sous le lien d’accès suivant : https://zenodo.org/records/19627795.

Toutes les données ont été désidentifiées afin d’assurer la confidentialité des participants conformément aux directives éthiques institutionnelles approuvées par le Comité d’éthique institutionnelle de l’Université SR (Approbation n° 007/2026).

Les informations traitées, les paramètres du modèle et les détails d’implémentation nécessaires pour recréer les résultats sont présentés dans le manuscrit, et le code source est accessible publiquement à : https://github.com/Ravichanderj/SET-Net-EEG-BCI.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Représentation des caractéristiques basée sur un spectrogramme

L’objectif principal de cette étude était de classifier correctement les états d’attention et de relaxation à l’aide des signaux EEG. La conversion des signaux EEG bruts en spectrogrammes a permis d’extraire efficacement des caractéristiques discriminantes. Les spectrogrammes indiquent une augmentation de l’activité de la bande alpha (8–13 Hz) lors de la relaxation et une augmentat...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les recherches actuelles suggèrent un modèle hybride d’apprentissage profond, SET-Net, pour la classification de l’attention-relaxation basée sur l’EEG. Pour apprendre les caractéristiques spatiales, spectrales et temporelles des signaux EEG, l’architecture combine réseaux neuronaux convolutionnels, attention par compression et excitation, et encodeurs transformateurs, comme illustré à la Figure 5. Les résultats indiquent que la méthode proposée peut atteind...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont aucun intérêt financier concurrent ou relation personnelle connue qui pourrait influencer le travail rapporté dans cette étude.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs remercient l’Université SR, Warangal, État du Telangana, Inde, pour avoir fourni l’installation nécessaire des laboratoires et l’approbation éthique pour mener cette étude.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Ordinateur / Ordinateur portableGénériqueTout système standard&ge ; 8 Go de RAM recommandés
Script d’acquisition de donnéesCoutumescollect.pyScript d’acquisition basé sur Python
Électrodes en gel jetablesGénériqueÉlectrodes Ag/AgCl pré-geliséesAdhésif à usage unique
Module d’acquisition EEGLabs À l’EnversBioAmp EXG PillInterface analogique pour les signaux biopotentiels
Gel d’électrodes (si électrodes réutilisables utilisées)GénériqueGel conducteurAméliore la conductivité du signal
Application interactive (jeu)GénériqueN’importe quel jeu simple (par exemple, la course)Interface contrôlée par clavier
Fils de démarrageGénériqueMasculin&ndash ; Connecteurs femellesFils standards de type breadboard
Matplotlib / SeabornOpen sourceDernières versionsBibliothèques de visualisation
Carte microcontrôleurArduinoUno / Maker UnoADC 10 bits, interface USB
Environnement de programmation PythonFondation Python SoftwarePython & ge ; 3.8Langage de programmation open source
Bibliothèque PyTorchMéta IAVersion &ge ; 1.12Cadre d’apprentissage profond
Scikit-learnOpen sourceDernière version stableUtilitaires ML
Bibliothèques de traitement du signalSciPyDernière versionFiltrage, STFT
Câble USBGénériqueUSB de type A à BCâble de transfert de données

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Brain Computer InterfaceEEG ClassificationAttention RelaxationDeep LearningHybrid Neural NetworkSET NetSqueeze Excitation NetworkTransformer NetworkSpectrogram AnalysisHuman Computer Interaction
Vidéo bientôt disponible

Articles connexes