$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El estudio se realizó conforme a la Declaración de Helsinki y fue aprobado por el Comité de Ética Institucional de la Universidad SR, Warangal, Telangana, India (Aprobación nº 007/2026). Se obtuvo el consentimiento informado por escrito de todos los participantes antes de la recogida de datos.
Selección de participantes
Se recogieron datos de EEG de 11 participantes sanos (rango de edad: 25–45 años; edad media: 28 años) sin antecedentes de trastornos neurológicos o psiquiátricos. En este estudio se consideraron un total de 1175 segmentos de EEG, de los cuales 527 pertenecen a la clase de relajación y 648 a la clase de atención. Se excluyeron los participantes cuyos registros de EEG mostraron artefactos de movimiento excesivos o mala calidad de señal.
Configuración de adquisición de EEG
La disposición general del sistema sugerido de interfaz cerebro-ordenador basado en EEG se muestra en la Figura 1, que muestra toda la cadena de adquisición de señales, clasificación y uso en tiempo real. Los datos del EEG se registraron utilizando un pequeño módulo de adquisición de biopotencial conectado a un sistema basado en microcontroladores. Los electrodos de gel se colocaron según el sistema internacional 10–20, es decir, los puntos prefrontales de Fp1 y Fp2, con electrodos de referencia y de tierra colocados en los lóbulos auditivos, como se indica en la Figura 2. Las señales se digitalizaban a una velocidad de 128 Hz y se enviaban a un ordenador usando un script de adquisición en Python autoescrito. Se utilizó un pretratamiento adecuado de la piel y gel conductor para reducir la impedancia del electrodo y mejorar la calidad de la señal.
Procedimiento experimental
Los registros EEG se realizaron bajo dos condiciones cognitivas, relajación y atención, siguiendo un protocolo estandarizado. En la condición de relajación, el participante estaba sentado en un entorno cómodo y de bajo ruido y se le indicaba que permaneciera quieto con movimientos mínimos. Se reproducía audio instrumental calmante a través de auriculares y la adquisición del EEG se iniciaba usando el comando Python collect.py. Se registraron señales EEG durante 5 minutos por sesión y se repitieron durante cuatro sesiones. En la condición de atención, se instruyó al participante para realizar tareas que demandaban atención, como juegos interactivos, manteniendo la misma configuración de adquisición que en la condición de relajación. Se registraron señales EEG durante 5 minutos por sesión y se repitieron durante cuatro sesiones. Cada participante participó durante un total de 40 minutos, que consisten en 20 minutos de relajación y 20 minutos de atención, lo que permitió una comparación fiable de estados cognitivos.
El conjunto de datos procesado se organizó en segmentos etiquetados de la siguiente manera: Relajación (0); Atención (1). Cada segmento tenía una duración de 4 s con un 50% de solapamiento y se representaba como un espectrograma mediante una transformada de Fourier de corto tiempo.
Procesamiento de señales, representación de características e implementación de modelos
Las señales EEG obtenidas se preprocesaron para eliminar ruido y artefactos. Se utilizó un filtro muesca de 50 Hz para eliminar interferencias en la línea eléctrica, y un filtro pasa-banda Butterworth de 4º orden en la señal entre 0,5 y 30 Hz para seleccionar las bandas de frecuencia EEG relevantes. Se utilizaron el umbral de amplitud y la inspección visual para identificar segmentos contaminados por artefactos, y aproximadamente entre el 8 y el 12% de los datos fueron eliminados. La adición de ruido gaussiano, el enmascaramiento temporal y el enmascaramiento de frecuencia son métodos de aumento de datos utilizados para mejorar la robustez del modelo. Las señales EEG se filtraron y luego se dividieron en ventanas de 4 segundos separadas por un 50 por ciento.
Los segmentos EEG individuales se convirtieron a una representación tiempo-frecuencia (Transformada de Fourier de Tiempo Corto), como se muestra en la Ecuación (1), para permitir la extracción de características temporales y espectrales.
(1)
Los espectrogramas resultantes se normalizaron y redimensionaron a dimensiones fijas para servir como entradas al modelo de clasificación. Para evitar fugas de datos inducidas por solapamiento, el conjunto de datos se dividió en subconjuntos de entrenamiento (70%), validación (10%) y pruebas (20%) antes de la segmentación, como se ilustra en la Figura 3. Además, se realizó la validación cruzada de dejar un sujeto fuera (LOSO) para evaluar la generalización entre sujetos, donde los datos de un sujeto se usaron para pruebas y el resto de datos para entrenamiento.
La arquitectura SET-Net propuesta, como se muestra en la Figura 4, fue diseñada para capturar características EEG multidimensionales. El modelo integra una red troncal de red neuronal convolucional (CNN) para extraer representaciones espacio-espectrales, seguida de un bloque de presión y excitación (SE) que recalibra adaptativamente la importancia de características canal a canal, como se describe en la Ecuación (2). La columna vertebral CNN consta de dos capas convolucionales con un tamaño de núcleo de 3 × 3, seguidas de normalización por lotes y activación por unidades lineales exponenciales (ELU)
(2)
La estructura interna del bloque SE se muestra en la Figura 5. Para capturar dependencias temporales a largo alcance, se incorporó un codificador transformador, cuyo mecanismo de atención está definido en la Ecuación (3) e ilustrado en la Figura 6.
(3)
Se utilizó una capa de pooling adaptativo promedio para reducir los mapas de características a un tamaño fijo de 16 × 16. La relación de reducción del bloque SE es 8, que se utiliza para recalibrar las respuestas de características por canal. El codificador del transformador constaba de cuatro capas con cuatro cabezas de atención, una dimensión de avance de 256 y un tamaño de incrustación de modelo de 128.
La clasificación final se realizó utilizando capas totalmente conectadas con regularización de dropout y una función de activación softmax para distinguir entre los estados de atención y de relajación. La arquitectura detallada por capas del modelo propuesto se presenta en la Tabla 1.
El modelo se entrenó usando el optimizador AdamW con una tasa de aprendizaje inicial de 0,001 y una disminución de peso de 1×10⁻4. Se utilizó un planificador de recocido coseno para mejorar la convergencia, y se entrenaron 50 épocas usando un tamaño de lote de 32. El desequilibrio de clase se superó utilizando una función de pérdida ponderada por entropía cruzada, como se describe en la Ecuación (4).
(4)
La Tabla 2 resume la configuración de entrenamiento, y la Tabla 3 presenta la búsqueda por hiperparámetros de la SET-Net propuesta, que se utilizó en la clasificación de atención-relajación basada en EEG. Los parámetros seleccionados proporcionan estabilidad en el entrenamiento, una generalización mejorada y tolerancia a cambios en las señales EEG. Los parámetros elegidos proporcionan estabilidad al proceso de entrenamiento, mejoran la generalización y resisten alteraciones de la señal EEG. Se utilizaron precisión, precisión, recuerdo, puntuación F1 y ROC-AUC para medir el rendimiento del modelo. Todas las canalizaciones que implicaban preprocesamiento, entrenamiento de modelos y evaluación se escribían en Python utilizando el marco PyTorch para garantizar la reproducibilidad. La Tabla 4 ofrece una descripción detallada de la resolución de problemas para guiar y resolver problemas asociados con la adquisición de EEG, preprocesamiento, entrenamiento de modelos y uso en tiempo real. La Tabla 5 ofrece una visión general de los materiales del dispositivo EEG para permitir un marco sencillo para realizar experimentos y la configuración experimental. Se utilizó Python 3.8 con el framework de aprendizaje profundo PyTorch para implementar el framework SET-Net propuesto. Se usaban bibliotecas estándar de computación científica para el preprocesamiento de señales y la extracción de características usando NumPy, SciPy y Matplotlib. Cada procedimiento experimental se realizó en un sistema con un procesador Intel i7 y 16 GB de RAM para acelerar el entrenamiento de los modelos.
DISPONIBILIDAD DE DATOS:
El conjunto de datos EEG anonimizado generado y analizado durante este estudio está disponible públicamente en el repositorio Zenodo bajo el siguiente enlace de acceso: https://zenodo.org/records/19627795.
Todos los datos han sido desidentificados para garantizar la confidencialidad de los participantes, de acuerdo con las directrices éticas institucionales aprobadas por el Comité de Ética Institucional de la Universidad SR (Aprobación nº 007/2026).
La información procesada, la configuración del modelo y los detalles de implementación necesarios para recrear los resultados se presentan en el manuscrito, y el código fuente está disponible públicamente en: https://github.com/Ravichanderj/SET-Net-EEG-BCI.