Research Article

SET Net: Un marco híbrido de aprendizaje profundo para la clasificación de la relajación de la atención basada en EEG en aplicaciones de interfaces cerebro-ordenador

DOI:

10.3791/70700

May 29th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este artículo presenta la red de transformadores de presión y excitación (SET-Net), que es una red híbrida CNN-Transformer que reconoce estados de atención y relajación utilizando características de espectrograma para identificar estados de atención y relajación basados en EEG con un 93,7% de precisión y alta generalización, para ser utilizada en aplicaciones de Interfaz Cerebro-Ordenador (BCI).

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La tecnología de Interfaz Cerebro-Ordenador (BCI) se utiliza como herramienta para proporcionar un canal de comunicación directo entre el cerebro humano y el entorno externo. Esto tiene aplicaciones en sistemas asistenciales e interactivos. La adquisición no invasiva de actividad neuronal mediante electroencefalografía (EEG) es estándar en los sistemas BCI. Sin embargo, es difícil clasificar eficazmente los estados cognitivos, incluyendo la atención y la relajación, porque la señal EEG no es estacionaria y es ruidosa. Para superar estas carencias, este estudio propone una nueva arquitectura híbrida de aprendizaje profundo, concretamente la red transformadora de presión y excitación (SE) (SET-Net). En este método, las señales EEG se preprocesan y dividen en ventanas temporales para analizar las representaciones significativas del espectrograma. El modelo propuesto alcanza una precisión de clasificación del 93,7%, con una puntuación F1 de 0,93 y un ROC-AUC de 0,98. Esto demuestra la eficacia del modelo híbrido de aprendizaje profundo con una discriminación mejorada del estado de atención-relajación basado en EEG. Esto ofrece un sistema escalable para aplicaciones BCI en tiempo real como tecnología de asistencia en la interacción humano-ordenador.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Las interfaces cerebro-ordenador (BCIs) se han convertido en una tecnología disruptiva que permite al cerebro humano y a dispositivos externos comunicarse directamente sin utilizar conexiones neuromusculares tradicionales. La electroencefalografía (EEG) es la técnica más común y ampliamente utilizada debido a su naturaleza no invasiva, portabilidad y rentabilidad. Las BCI basadas en EEG se han utilizado tanto en la sanidad, como en neurorehabilitación, juegos y tecnologías asistenciales para personas con discapacidades neurológicas, examinando la actividadcerebral 2. Una de las aplicaciones más significativas es la identificación de estados cognitivos, incluyendo la atención y la relajación, que pueden utilizarse para crear interfaces adaptativas humano-ordenador y accesibilidaddigital 3. Una baja relación señal-ruido, gran variabilidad entre sujetos y dinámicas temporales complicadas entre los estados de atención y relajación que se interpretan mediante EEG; por lo tanto, clasificar los estados de atención y relajación usando EEG es difícil4. Los modelos clásicos de aprendizaje automático, incluyendo la máquina de vectores de soporte (SVM) y el bosque aleatorio, han mostrado un rendimiento moderado; sin embargo, normalmente se basan en la ingeniería de características porque no aprovechan plenamente la complejidad espacio-espectral-temporal delEEG 5. Los desarrollos recientes en aprendizaje profundo, especialmente en redes neuronales convolucionales (CNN) y transformadores, han presentado nuevas oportunidades para la extracción automatizada de características y una clasificación sólida de señalesEEG 6.

Los sistemas de BCI basados en EEG han sido ampliamente estudiados durante mucho tiempo como herramienta en el monitoreo del estado cognitivo, la neurorrehabilitación y sistemas interactivos. La definición de condición mental es uno de los desafíos más importantes, por ejemplo, los estados de relajación y atención. En respuesta a esto, los científicos han demostrado una variedad de soluciones, como la ingeniería estándar de características y modelos avanzados de aprendizaje profundo. Los enfoques clásicos de aprendizaje automático dependen principalmente de características manualmente diseñadas en tiempo, frecuencia o espacio-tiempo-frecuencia. La investigación sobre algoritmos híbridos de aprendizaje profundo como parte del sistema SET-Net de clasificación de atención-relajación basada en EEG ha sido considerada una dirección científica importante, ya que podría potenciar los sistemas BCI que pueden utilizarse en entornos reales7,8. Los modelos de aprendizaje profundo, incluyendo redes neuronales convolucionales (CNN), redes neuronales recurrentes (RNN) y transformadores, han logrado avances significativos en la decodificación de señales EEG en la última década9,10. Estos avances han llevado a una mejor y más eficiente decodificación de estados cognitivos, que son deseables para estados cognitivos en neurorrehabilitación y tecnologías asistenciales11,12. La creciente popularidad de los sistemas BCI enfatiza la importancia aplicada de mejorar la precisión de la clasificación, y resultados recientes han demostrado que la clasificación puede superar el 85% en la imagen motora y las actividades de atención13,14. No obstante, aún existen desafíos para lograr clasificaciones sólidas en tiempo real en entornos diversos y ruidosos a pesar de estos desarrollos15,16. El problema clave abordado en este estudio es la precisión y validez externa de los modelos de clasificación de atención-relajación basados en EEG, especialmente los modelos que consisten en aprendizaje profundo híbrido en la arquitectura SET-Net17,18, son limitadas. Los métodos existentes suelen estar asociados a problemas de variabilidad entre sujetos, bajo ruido de señal y pobre explotación de las propiedades espaciotemporales19,20,21. Existen métodos orientados a la extracción de características convolucionales, y otros orientados a la arquitectura de atención o transformadores, lo que lleva a diversas opiniones sobre el mejor diseño de modelos22,23,24. Además, los modelos EEG no son fáciles de entrenar ni justificar debido a la falta de disponibilidad de grandes conjuntos de datos anotados25,26. Esta falta de conocimiento limita el uso de BCIs en condiciones reales, lo cual es fundamental para ser flexible y preciso 27,28. Esto se establece teóricamente a partir de una combinación de extracción de características espaciales, temporales y de atención utilizando modelos híbridos de aprendizaje profundo29,30,31. Esta combinación se observa en el marco SET-Net, que se logra mediante capas convolucionales para extraer características locales y mecanismos de autoatención para aprender dependencias globales32. Esta sinergia mejora la representación de las señales EEG y puede aplicarse para una mejor clasificación de los estados de relajación y atención. La teoría se inicia en la realidad de que la variabilidad de las señales EEG y el ruido puede eliminarse utilizando la fuerza de características espaciotemporales multiescala y técnicas de adaptación de dominios33. La revisión sistemática se centra en revisar críticamente el progreso teórico de la precisión y aplicación práctica de métodos híbridos de aprendizaje profundo de la arquitectura SET-Net de la clasificación de atención-relajación basada en EEG34. La revisión se utilizará para guiar la creación de un sistema BCI mejor, más interpretativo y generalizable en futuros experimentos, mediante la síntesis de los desarrollos más recientes y la identificación de las fortalezas y limitaciones de los métodos. Estas carencias ayudarán en el desarrollo futuro de aplicaciones reales de BCI que mejorarán el usuario y la fiabilidad del sistema. La revisión aplicó un enfoque de revisión amplia de la literatura, donde los artículos revisados por pares se ejercitaron en función de modelos híbridos de aprendizaje profundo en la clasificación EEG de atención-relajación34. Los criterios de inclusión se centran en tendencias recientes en arquitecturas convolucionales, recurrentes y basadas en la atención en el marco de SET-Net o sistemas similares35. Los modelos analíticos evalúan diseños de modelos, algoritmos de selección de características, precisión de clasificación y viabilidad en un entorno real. Los hallazgos están organizados para explicar la construcción teórica, la práctica y las oportunidades futuras de investigación.

A pesar de los avances recientes, los métodos existentes no logran capturar simultáneamente dependencias espaciales, espectrales y temporales de largo alcance en señales EEG de canal único, lo que resulta en un rendimiento subóptimo en la clasificación de atención-relajación. Además, los métodos existentes se basan en características añadidas manualmente o solo consideran algunas características de las señales EEG; por tanto, no pueden generalizarse entre participantes y condiciones en tiempo real. Por tanto, existe la necesidad de un marco unificado que pueda modelar suficientemente las características multidimensionales del EEG y que sea sólido e investigable en tiempo real.

Para superar estas desventajas, este estudio propone un artículo de investigación que sugiere un modelo híbrido de aprendizaje profundo, denominado Red de Transformadores de Presión y Excitación (SET-Net). En particular, el módulo CNN aprende patrones espaciales espectrales locales con espectrogramas EEG y supera las limitaciones de la extracción de características artesanal. El bloque SE mejora la representación de características adaptando la importancia por canal y aumentando la robustez del ruido y la variabilidad. El codificador de transformadores modela dependencias temporales a largo alcance que no se limitan a modelos solo CNN. Además, el análisis tiempo-frecuencia puede realizarse eficazmente usando representación basada en espectrogramas, lo que mejora el aprendizaje de características discriminativas. Para garantizar un rendimiento estable, se adoptó un entrenamiento equilibrado y una validación sin fugas, lo que mejoró la generalización del rendimiento entre los sujetos.

Además, la estructura sugerida se confirma en una aplicación en tiempo real, en la que los estados cognitivos categorizados se transforman en instrucciones de control de sistemas interactivos. Esto demuestra que el modelo es aplicable en la práctica en tecnologías asistenciales y accesibilidad digital, y podría utilizarse en la implementación práctica de BCI.

El principal logro de este estudio es el diseño de una nueva arquitectura híbrida SET-Net que incorpora redes neuronales convolucionales, atención de presión y excitación, y codificadores transformadores para modelar mejor las señales EEG. Además, se utilizó una representación basada en espectrogramas para representar con éxito las propiedades tiempo-frecuencia de las señales EEG. El marco sugerido permite una clasificación sólida de los estados cognitivos de atención y relajación. Además, se demostró que el modelo tiene aplicabilidad práctica en una aplicación de interfaz cerebro-ordenador en tiempo real.

Este artículo está organizado en secciones en las que se reseña estudios que categorizan las clases de atención y relajación de la actividad cerebral aplicadas a los sistemas BCI. Este artículo está estructurado para presentar primero las lagunas y desafíos de la investigación asociados con el desarrollo de sistemas BCI, y posteriormente presenta el proceso y la metodología de adquisición de datos que comprenden el registro de señales EEG, preprocesamiento y representación de características. Analiza la importancia de las actividades de atención y relajación, así como el proceso de derivar características significativas a partir de los datos del EEG. Los resultados se presentan y evalúan mediante análisis cuantitativos y comparativos, así como el rendimiento real de la aplicación. La última parte trata los hallazgos, las limitaciones del estudio y las direcciones futuras de trabajo.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El estudio se realizó conforme a la Declaración de Helsinki y fue aprobado por el Comité de Ética Institucional de la Universidad SR, Warangal, Telangana, India (Aprobación nº 007/2026). Se obtuvo el consentimiento informado por escrito de todos los participantes antes de la recogida de datos.

Selección de participantes

Se recogieron datos de EEG de 11 participantes sanos (rango de edad: 25–45 años; edad media: 28 años) sin antecedentes de trastornos neurológicos o psiquiátricos. En este estudio se consideraron un total de 1175 segmentos de EEG, de los cuales 527 pertenecen a la clase de relajación y 648 a la clase de atención. Se excluyeron los participantes cuyos registros de EEG mostraron artefactos de movimiento excesivos o mala calidad de señal.

Configuración de adquisición de EEG

La disposición general del sistema sugerido de interfaz cerebro-ordenador basado en EEG se muestra en la Figura 1, que muestra toda la cadena de adquisición de señales, clasificación y uso en tiempo real. Los datos del EEG se registraron utilizando un pequeño módulo de adquisición de biopotencial conectado a un sistema basado en microcontroladores. Los electrodos de gel se colocaron según el sistema internacional 10–20, es decir, los puntos prefrontales de Fp1 y Fp2, con electrodos de referencia y de tierra colocados en los lóbulos auditivos, como se indica en la Figura 2. Las señales se digitalizaban a una velocidad de 128 Hz y se enviaban a un ordenador usando un script de adquisición en Python autoescrito. Se utilizó un pretratamiento adecuado de la piel y gel conductor para reducir la impedancia del electrodo y mejorar la calidad de la señal.

Procedimiento experimental

Los registros EEG se realizaron bajo dos condiciones cognitivas, relajación y atención, siguiendo un protocolo estandarizado. En la condición de relajación, el participante estaba sentado en un entorno cómodo y de bajo ruido y se le indicaba que permaneciera quieto con movimientos mínimos. Se reproducía audio instrumental calmante a través de auriculares y la adquisición del EEG se iniciaba usando el comando Python collect.py. Se registraron señales EEG durante 5 minutos por sesión y se repitieron durante cuatro sesiones. En la condición de atención, se instruyó al participante para realizar tareas que demandaban atención, como juegos interactivos, manteniendo la misma configuración de adquisición que en la condición de relajación. Se registraron señales EEG durante 5 minutos por sesión y se repitieron durante cuatro sesiones. Cada participante participó durante un total de 40 minutos, que consisten en 20 minutos de relajación y 20 minutos de atención, lo que permitió una comparación fiable de estados cognitivos.

El conjunto de datos procesado se organizó en segmentos etiquetados de la siguiente manera: Relajación (0); Atención (1). Cada segmento tenía una duración de 4 s con un 50% de solapamiento y se representaba como un espectrograma mediante una transformada de Fourier de corto tiempo.

Procesamiento de señales, representación de características e implementación de modelos

Las señales EEG obtenidas se preprocesaron para eliminar ruido y artefactos. Se utilizó un filtro muesca de 50 Hz para eliminar interferencias en la línea eléctrica, y un filtro pasa-banda Butterworth de 4º orden en la señal entre 0,5 y 30 Hz para seleccionar las bandas de frecuencia EEG relevantes. Se utilizaron el umbral de amplitud y la inspección visual para identificar segmentos contaminados por artefactos, y aproximadamente entre el 8 y el 12% de los datos fueron eliminados. La adición de ruido gaussiano, el enmascaramiento temporal y el enmascaramiento de frecuencia son métodos de aumento de datos utilizados para mejorar la robustez del modelo. Las señales EEG se filtraron y luego se dividieron en ventanas de 4 segundos separadas por un 50 por ciento.

Los segmentos EEG individuales se convirtieron a una representación tiempo-frecuencia (Transformada de Fourier de Tiempo Corto), como se muestra en la Ecuación (1), para permitir la extracción de características temporales y espectrales.

figure-protocol-1(1)

Los espectrogramas resultantes se normalizaron y redimensionaron a dimensiones fijas para servir como entradas al modelo de clasificación. Para evitar fugas de datos inducidas por solapamiento, el conjunto de datos se dividió en subconjuntos de entrenamiento (70%), validación (10%) y pruebas (20%) antes de la segmentación, como se ilustra en la Figura 3. Además, se realizó la validación cruzada de dejar un sujeto fuera (LOSO) para evaluar la generalización entre sujetos, donde los datos de un sujeto se usaron para pruebas y el resto de datos para entrenamiento.

La arquitectura SET-Net propuesta, como se muestra en la Figura 4, fue diseñada para capturar características EEG multidimensionales. El modelo integra una red troncal de red neuronal convolucional (CNN) para extraer representaciones espacio-espectrales, seguida de un bloque de presión y excitación (SE) que recalibra adaptativamente la importancia de características canal a canal, como se describe en la Ecuación (2). La columna vertebral CNN consta de dos capas convolucionales con un tamaño de núcleo de 3 × 3, seguidas de normalización por lotes y activación por unidades lineales exponenciales (ELU)

figure-protocol-2(2)

La estructura interna del bloque SE se muestra en la Figura 5. Para capturar dependencias temporales a largo alcance, se incorporó un codificador transformador, cuyo mecanismo de atención está definido en la Ecuación (3) e ilustrado en la Figura 6.

figure-protocol-3(3)

Se utilizó una capa de pooling adaptativo promedio para reducir los mapas de características a un tamaño fijo de 16 × 16. La relación de reducción del bloque SE es 8, que se utiliza para recalibrar las respuestas de características por canal. El codificador del transformador constaba de cuatro capas con cuatro cabezas de atención, una dimensión de avance de 256 y un tamaño de incrustación de modelo de 128.

La clasificación final se realizó utilizando capas totalmente conectadas con regularización de dropout y una función de activación softmax para distinguir entre los estados de atención y de relajación. La arquitectura detallada por capas del modelo propuesto se presenta en la Tabla 1.

El modelo se entrenó usando el optimizador AdamW con una tasa de aprendizaje inicial de 0,001 y una disminución de peso de 1×10⁻4. Se utilizó un planificador de recocido coseno para mejorar la convergencia, y se entrenaron 50 épocas usando un tamaño de lote de 32. El desequilibrio de clase se superó utilizando una función de pérdida ponderada por entropía cruzada, como se describe en la Ecuación (4).

figure-protocol-4(4)

La Tabla 2 resume la configuración de entrenamiento, y la Tabla 3 presenta la búsqueda por hiperparámetros de la SET-Net propuesta, que se utilizó en la clasificación de atención-relajación basada en EEG. Los parámetros seleccionados proporcionan estabilidad en el entrenamiento, una generalización mejorada y tolerancia a cambios en las señales EEG. Los parámetros elegidos proporcionan estabilidad al proceso de entrenamiento, mejoran la generalización y resisten alteraciones de la señal EEG. Se utilizaron precisión, precisión, recuerdo, puntuación F1 y ROC-AUC para medir el rendimiento del modelo. Todas las canalizaciones que implicaban preprocesamiento, entrenamiento de modelos y evaluación se escribían en Python utilizando el marco PyTorch para garantizar la reproducibilidad. La Tabla 4 ofrece una descripción detallada de la resolución de problemas para guiar y resolver problemas asociados con la adquisición de EEG, preprocesamiento, entrenamiento de modelos y uso en tiempo real. La Tabla 5 ofrece una visión general de los materiales del dispositivo EEG para permitir un marco sencillo para realizar experimentos y la configuración experimental. Se utilizó Python 3.8 con el framework de aprendizaje profundo PyTorch para implementar el framework SET-Net propuesto. Se usaban bibliotecas estándar de computación científica para el preprocesamiento de señales y la extracción de características usando NumPy, SciPy y Matplotlib. Cada procedimiento experimental se realizó en un sistema con un procesador Intel i7 y 16 GB de RAM para acelerar el entrenamiento de los modelos.

DISPONIBILIDAD DE DATOS:

El conjunto de datos EEG anonimizado generado y analizado durante este estudio está disponible públicamente en el repositorio Zenodo bajo el siguiente enlace de acceso: https://zenodo.org/records/19627795.

Todos los datos han sido desidentificados para garantizar la confidencialidad de los participantes, de acuerdo con las directrices éticas institucionales aprobadas por el Comité de Ética Institucional de la Universidad SR (Aprobación nº 007/2026).

La información procesada, la configuración del modelo y los detalles de implementación necesarios para recrear los resultados se presentan en el manuscrito, y el código fuente está disponible públicamente en: https://github.com/Ravichanderj/SET-Net-EEG-BCI.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Representación de características basada en espectrogramas

El objetivo principal de este estudio fue clasificar correctamente los estados de atención y relajación con la ayuda de señales EEG. La conversión de señales de EEG en bruto en espectrogramas ha hecho posible extraer características discriminativas de manera eficaz. Los espectrogramas indican un aumento de la actividad en la banda alfa (8–13 Hz) durante la relajación y un aumento de la...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La investigación actual sugiere un modelo híbrido de aprendizaje profundo, SET-Net, para la clasificación de atención-relajación basada en EEG. Para aprender las características espaciales, espectrales y temporales de las señales EEG, la arquitectura combina redes neuronales convolucionales, atención de presión y excitación y codificadores transformadores, como se muestra en la Figura 5. Los resultados indican que el método propuesto puede cumplir con el obj...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores afirman que no tienen intereses financieros en competencia ni relaciones personales conocidas que puedan influir en el trabajo reportado en este estudio.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen a la Universidad SR, Warangal, Estado de Telangana, India, por proporcionar la instalación necesaria de laboratorios y la aprobación ética para llevar a cabo este estudio.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Ordenador / PortátilGenéricoCualquier sistema estándar≥ Se recomienda 8 GB de RAM
Script de adquisición de datosCostumbrescollect.pyScript de adquisición basado en Python
Electrodos desechables en gelGenéricoElectrodos de Ag/AgCl pre-gelificadosAdhesivo de un solo uso
Módulo de adquisición de EEGLaboratorios InvertidosPíldora EXG BioAmpInterfaz analógica para señales de biopotencial
Gel de electrodos (si se usan electrodos reutilizables)GenéricoGel conductorMejora la conductividad de la señal
Aplicación interactiva (juego)GenéricoCualquier juego sencillo (por ejemplo, carreras)Interfaz controlada por teclado
Cables puentesGenéricoMasculino– Conectores hembraCables estándar de placa de prueba
Matplotlib / SeabornCódigo abiertoÚltimas versionesBibliotecas de visualización
Placa microcontroladorArduinoUno / Maker UnoADC de 10 bits, interfaz USB
Entorno de programación en PythonFundación de Software PythonPython & ge; 3.8Lenguaje de programación de código abierto
Biblioteca PyTorchMeta IAVersión ≥ 1.12Marco de aprendizaje profundo
Scikit-learnCódigo abiertoÚltima versión estableUtilidades ML
Bibliotecas de procesamiento de señalesSciPyÚltima versiónFiltrado, STFT
Cable USBGenéricoUSB Tipo-A a BCable de transferencia de datos

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Brain Computer InterfaceEEG ClassificationAttention RelaxationDeep LearningHybrid Neural NetworkSET NetSqueeze Excitation NetworkTransformer NetworkSpectrogram AnalysisHuman Computer Interaction
Video Coming Soon

Related Articles