$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio se llevó a cabo de acuerdo con las directrices del Comité de Ética de la Universidad de Quzhou. El protocolo de investigación fue aprobado por la Junta de Revisión Institucional (IRB) de la Universidad de Quzhou bajo el número de aprobación QZU-IRB-2026-037. Todos los participantes proporcionaron su consentimiento informado antes de su inclusión en el estudio.
Preparación experimental y reclutamiento de participantes
El experimento constó de cuatro etapas (Figura 1): preparación, diseño experimental, construcción del modelo y análisis de resultados. En la fase de preparación, los objetivos de investigación se definieron basándose en una revisión de la literatura sobre musicoterapia, adquisición de datos EEG y modelos de aprendizaje profundo. En la fase de diseño experimental, se reclutaron a 30 participantes sanos para realizar tareas de escucha musical. Se registraron señales EEG y calificaciones de familiaridad musical. Los datos EEG se estandarizaron y segmentaron en ventanas de 2048 muestras con 1024 muestras solapadas. Las características de familiaridad se combinaron con datos EEG como entradas de modelo. Se construyeron dos modelos, CNN+RNN y EEGNet. Las capas CNN extrajeron características tiempo-frecuencia, y el LSTM bidireccional capturó dependencias temporales. Se utilizó una capa totalmente conectada con una función de activación softmax para la clasificación. Los modelos se entrenaron con un tamaño de lote de 50 durante 30 épocas usando el optimizador Adam. Se aplicaron abandonos y paradas anticipadas. El rendimiento se evaluó principalmente utilizando la Precisión como métrica reportada, calculándose también las métricas de Precisión, Memoria y puntuación F1 para una evaluación adicional.
Entorno experimental y configuración del equipo
El experimento se llevó a cabo en una sala silenciosa y cerrada, libre de interferencias externas, manteniendo la temperatura de la sala en 27 ºC. Se utilizó el siguiente equipo: un dispositivo EEG (Muse S, InteraXon Inc.), un sistema EEG de cuatro canales (TP9, AF7, AF8, TP10) con una frecuencia de muestreo de 256 Hz; Auriculares intraauriculares Final E3000; y un ordenador de adquisición de datos que ejecuta el SDK Muse y la Capa de Streaming de Laboratorio (LSL).
Antes de cada sesión experimental, se limpiaban con alcohol las superficies de contacto auditivo de los auriculares para garantizar la higiene y reducir el riesgo de contaminación cruzada. El casco Muse S se instaló en cada participante, asegurando un contacto estable entre los cuatro electrodos secos (TP9, AF7, AF8, TP10) y la piel. Si la calidad de la señal era mala, la posición de la diadema se ajustaba hasta obtener señales estables. Los participantes fueron sentados en una silla cómoda con soporte para la espalda y se les indicó que mantuvieran los ojos cerrados, evitaran hablar y minimizaran los movimientos corporales grandes durante el experimento.
Preparación de estímulos musicales
Se prepararon tres géneros musicales: rock, lírica (balada) y música folk. Cada género incluía tres canciones chinas, para un total de nueve canciones. Para controlar las diferencias en la familiaridad musical, las canciones de cada género se seleccionaron según los siguientes criterios: una canción antigua; una canción popular actual (de la lista Spotify Top Songs); y una canción nueva (de la lista de nuevos lanzamientos de Spotify).
Cada canción se editaba en un segmento de audio estandarizado, comenzando por la introducción, seguido por el verso y terminando en el primer estribillo, con una duración total de 90–130 s. Se asignaba un identificador único a cada canción (por ejemplo, R1–R3, B1–B3, F1–F3) para el posterior etiquetado de datos y la gestión de archivos.
Procedimiento experimental y registro de cuestionarios
Antes del experimento formal, se realizaba una prueba de volumen reproduciendo un clip de audio de prueba. Los participantes ajustaron el volumen a un nivel claro, cómodo y no excesivamente alto, y lo mantuvieron constante durante todo el experimento. El orden de reproducción de las nueve canciones fue aleatorizado (por ejemplo, usando una tabla de números aleatorios o aleatorización por software) para reducir los efectos de orden. Todos los participantes completaron las tareas de escucha de música de forma independiente. Cada segmento musical se presentaba desde la introducción hasta el primer estribillo, con una duración de 90–130 segundos. Se ofrecía un descanso de 30 segundos entre canciones. Durante este intervalo, los participantes completaron un cuestionario de familiaridad utilizando una plataforma online (Questionnaire Star). Los participantes valoraron su familiaridad con cada canción utilizando una escala Likert de cinco puntos (1 = completamente desconocido; 5 = muy familiar). La etiqueta de preferencia del participante para cada canción se registraba (0 = dislike; 1 = like) según el esquema de clasificación binaria predefinido. El procedimiento experimental completo se ilustra en la Figura 2.
Adquisición de EEG y registro de datos
Los datos EEG se adquirieron usando el SDK oficial de Muse y se transmitieron en streaming a través de la Capa de Streaming de Laboratorio (LSL). Los datos EEG correspondientes a cada canción se guardaban como archivos de Valores Separados por Comas (CSV), que contenían como mínimo los siguientes campos: marca de tiempo (milisegundos); señales EEG en bruto de cuatro canales (TP9, AF7, AF8, TP10); puntuación de familiaridad registrada manualmente (1–5); y etiqueta de preferencia (0/1). Se utilizó una convención consistente de nombres de archivos (por ejemplo, S01_R1.csv, que indica participante 01 y canción rock 1) para facilitar el procesamiento automatizado y la trazabilidad.
Preprocesado, normalización y ventanas de datos
Las señales EEG se grababan usando un dispositivo EEG Muse S de cuatro canales con una frecuencia de muestreo de 256 Hz, y se desarrollaban programas personalizados usando el kit oficial de desarrollo. Los datos en bruto del EEG se adquirían a través de la Capa de Streaming de Laboratorio (LSL) y se guardaban en formato CSV. Los archivos CSV incluían las siguientes columnas: marca de tiempo (milisegundos), valores EEG de cuatro canales (TP9, AF7, AF8, TP10), valoraciones de familiaridad musical del usuario (1–5) y valoraciones de preferencia musical del usuario.
El número total de entradas de datos corresponde a múltiples ventanas generadas para cada participante y cada pieza musical, resultando en un conjunto de datos a gran escala dependiendo del esquema de ventanas. En el experimento original, la preferencia musical se representaba como una etiqueta binaria (0 = dislike, 1 = like), lo que puede llevar a una precisión artificialmente alta y a una generalización limitada del modelo.
Para mejorar la importancia práctica de la tarea de predicción, las etiquetas de preferencia se convirtieron en una escala de valoración multinivel: 0 = Fuertemente en desacuerdo; 1 = No está de acuerdo; 2 = Neutral; 3 = De acuerdo; 4 = Totalmente de acuerdo.
Antes del aprendizaje automático, los datos se estandarizaban y segmentaban en ventanas de 2048 muestras cada una, con 1024 muestras solapándose entre ventanas adyacentes para preservar la continuidad temporal. Además, se aplicó aumento de datos para aumentar el número de muestras de entrenamiento y reducir el riesgo de sobreajuste.
Arquitectura del modelo
El modelo de investigación consistía en tres capas convolucionales, tres capas de agrupación y una capa completamente conectada. Se utilizaba el pool máximo para la selección de características, se aplicaba dropout para reducir el sobreajuste y la salida final se generaba usando una capa de clasificación softmax. Cada ventana de entrada incluía señales EEG de cuatro canales (2048 muestras por ventana) y una función de familiaridad. La producción representaba una clasificación de preferencia de cinco clases. La arquitectura se muestra en la Figura 3, y los parámetros del modelo se describen en la Tabla 2.
Entrenamiento de modelos y validación cruzada
El conjunto de datos se dividió aleatoriamente en un 80% para entrenamiento y un 20% para pruebas. Se aplicó una validación cruzada diez veces, con un subconjunto usado para validación y los nueve restantes para el entrenamiento en cada iteración. Este proceso se repitió diez veces y los resultados se agregaron. Los hiperparámetros de entrenamiento se establecieron de la siguiente manera: Épocas = 30; Tamaño del lote = 50; optimizador = Adam; Función de pérdida = cruz categórica; Métrica de evaluación = Precisión. El rendimiento del modelo se grabó bajo condiciones solo EEG y EEG + familiaridad, tanto para todos los géneros combinados como para géneros individuales.
Métodos de análisis estadístico
El análisis de datos se realizó usando Python 3.10 con TensorFlow 2.12, Keras 2.12 y MNE-Python 1.3. El procesamiento y análisis de datos se realizaron utilizando Pandas 2.1 y NumPy 1.26. Se agregaron las métricas de rendimiento de la validación cruzada de 10 veces, y se calcularon valores de media y desviación estándar. Las comparaciones estadísticas entre condiciones se realizaron utilizando pruebas t pareadas o pruebas de rango por signo de Wilcoxon, con un nivel de significación de P < 0,05.