$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo foi realizado de acordo com as diretrizes do Comitê de Ética da Universidade de Quzhou. O protocolo de pesquisa foi aprovado pelo Conselho de Revisão Institucional (IRB) da Universidade de Quzhou sob o número de aprovação QZU-IRB-2026-037. Todos os participantes forneceram consentimento informado antes de serem incluídos no estudo.
Preparação experimental e recrutamento de participantes
O experimento consistiu em quatro etapas (Figura 1): preparação, desenho experimental, construção do modelo e análise de resultados. Na fase de preparação, os objetivos da pesquisa foram definidos com base em uma revisão da literatura sobre musicoterapia, aquisição de dados de EEG e modelos de aprendizado profundo. Na fase de desenho experimental, 30 participantes saudáveis foram recrutados para realizar tarefas de escuta musical. Sinais de EEG e avaliações de familiaridade musical foram registrados. Os dados de EEG foram padronizados e segmentados em janelas de 2048 amostras com 1024 amostras sobrepostas. As características de familiaridade foram combinadas com dados de EEG como entradas do modelo. Dois modelos, CNN+RNN e EEGNet, foram construídos. Camadas CNN extraíram características tempo-frequência, e o LSTM bidirecional capturou dependências temporais. Uma camada totalmente conectada com função softmax de ativação foi usada para classificação. Os modelos eram treinados com um tamanho de lote de 50 para 30 épocas usando o otimizador Adam. Foram aplicados abandonos e paradas antecipadas. O desempenho foi avaliado principalmente usando a Precisão como métrica reportada, com métricas de Precisão, Recordação e pontuação F1 também calculadas para avaliação adicional.
Ambiente experimental e configuração de equipamentos
O experimento foi realizado em uma sala silenciosa e fechada, livre de interferências externas, com a temperatura do ambiente mantida em 27 °C. O seguinte equipamento era utilizado: um dispositivo de EEG (Muse S, InteraXon Inc.), um sistema de EEG de quatro canais (TP9, AF7, AF8, TP10) com taxa de amostragem de 256 Hz; Fones finais E3000 intra-auriculares; e um computador de aquisição de dados rodando o SDK Muse e a Camada de Streaming de Laboratório (LSL).
Antes de cada sessão experimental, as superfícies de contato auditivo dos fones eram limpas com álcool para garantir a higiene e reduzir o risco de contaminação cruzada. O headset Muse S foi instalado em cada participante, garantindo contato estável entre os quatro eletrodos secos (TP9, AF7, AF8, TP10) e a pele. Se a qualidade do sinal fosse ruim, a posição da faixa era ajustada até que sinais estáveis fossem obtidos. Os participantes foram sentados em uma cadeira confortável com suporte para as costas e instruídos a manter os olhos fechados, evitar falar e minimizar grandes movimentos corporais durante o experimento.
Preparação de estímulos musicais
Três gêneros musicais foram preparados: rock, lírica (balada) e música folclórica. Cada gênero incluía três canções chinesas, totalizando nove músicas. Para controlar diferenças de familiaridade musical, músicas de cada gênero foram selecionadas segundo os seguintes critérios: uma canção antiga; uma música popular atual (da parada Top Songs do Spotify); e uma música nova (da parada de novos lançamentos do Spotify).
Cada música foi editada em um segmento de áudio padronizado, começando pela introdução, seguido pelo verso e terminando no primeiro refrão, com duração total de 90–130 s. Um identificador único era atribuído a cada música (por exemplo, R1–R3, B1–B3, F1–F3) para rotulagem de dados subsequentes e gerenciamento de arquivos.
Procedimento experimental e registro de questionários
Antes do experimento formal, um teste de volume era realizado reproduzindo um clipe de áudio de teste. Os participantes ajustaram o volume para um nível claro, confortável e não excessivamente alto, mantendo-o constante durante todo o experimento. A ordem de reprodução das nove músicas era randomizada (por exemplo, usando uma tabela de números aleatórios ou randomização por software) para reduzir os efeitos de ordem. Todos os participantes completaram as tarefas de escuta musical de forma independente. Cada segmento musical era apresentado da introdução ao primeiro refrão, com duração de 90 a 130 segundos. Um período de descanso de 30 segundos era concedido entre as músicas. Durante esse intervalo, os participantes preencheram um questionário de familiaridade usando uma plataforma online (Questionnaire Star). Os participantes avaliaram sua familiaridade com cada música usando uma escala Likert de cinco pontos (1 = completamente desconhecido; 5 = muito familiar). O rótulo de preferência do participante para cada música foi registrado (0 = não gostar; 1 = curtir) de acordo com o esquema de classificação binária pré-definido. O procedimento experimental completo está ilustrado na Figura 2.
Aquisição de EEG e registro de dados
Os dados do EEG eram adquiridos usando o SDK oficial do Muse e transmitidos via Lab Streaming Layer (LSL). Os dados EEG correspondentes a cada música eram salvos como arquivos de Valores Separados por Vírgulas (CSV), contendo no mínimo os seguintes campos: carimbo de tempo (milissegundos); sinais EEG brutos de quatro canais (TP9, AF7, AF8, TP10); pontuação de familiaridade registrada manualmente (1–5); e o rótulo de preferência (0/1). Uma convenção consistente de nomeação de arquivos foi usada (por exemplo, S01_R1.csv, indicando participante 01 e música rock 1) para facilitar o processamento automatizado e a rastreabilidade.
Pré-processamento de dados, normalização e janelas
Os sinais de EEG eram gravados usando um dispositivo de EEG Muse S de quatro canais com taxa de amostragem de 256 Hz, e programas personalizados eram desenvolvidos usando o kit oficial de desenvolvimento. Os dados brutos do EEG eram adquiridos pela Camada de Streaming do Laboratório (LSL) e salvos no formato CSV. Os arquivos CSV incluíam as seguintes colunas: carimbo de tempo (milissegundos), valores de EEG de quatro canais (TP9, AF7, AF8, TP10), classificações de familiaridade musical do usuário (1–5) e classificações de preferência musical do usuário.
O número total de entradas de dados corresponde a múltiplas janelas geradas para cada participante e cada peça musical, resultando em um conjunto de dados de grande escala dependendo do esquema de janelas. No experimento original, a preferência musical foi representada como um rótulo binário (0 = não gostar, 1 = gostar), o que pode levar a uma precisão artificialmente alta e a uma generalização limitada do modelo.
Para melhorar a importância prática da tarefa de previsão, os rótulos de preferência foram convertidos em uma escala de avaliação multinível: 0 = Discordar fortemente; 1 = Discordar; 2 = Neutro; 3 = Concordo; 4 = Concordo plenamente.
Antes do aprendizado de máquina, os dados eram padronizados e segmentados em janelas de 2048 amostras cada, com 1024 amostras sobrepondo-se entre janelas adjacentes para preservar a continuidade temporal. Além disso, a ampliação de dados foi aplicada para aumentar o número de amostras de treinamento e reduzir o risco de sobreajuste.
Arquitetura do modelo
O modelo de pesquisa consistia em três camadas convolucionais, três camadas de agrupamento e uma camada totalmente conectada. Max pooling era usado para seleção de características, dropout era aplicado para reduzir o overfitting, e a saída final era gerada usando uma camada de classificação softmax. Cada janela de entrada incluía sinais EEG de quatro canais (2048 amostras por janela) e um recurso de familiaridade. A produção representava uma classificação de preferência de cinco classes. A arquitetura é mostrada na Figura 3, e os parâmetros do modelo estão delineados na Tabela 2.
Treinamento de modelos e validação cruzada
O conjunto de dados foi dividido aleatoriamente em 80% para treinamento e 20% para testes. A validação cruzada dez vezes foi aplicada, com um subconjunto usado para validação e os nove restantes para treinamento em cada iteração. Esse processo foi repetido dez vezes, e os resultados foram agregados. Os hiperparâmetros de treinamento foram definidos da seguinte forma: Épocas = 30; Tamanho do lote = 50; Otimizador = Adam; Função de perda = cruzamento categórico; Métrica de avaliação = Precisão. O desempenho do modelo foi registrado sob condições apenas EEG e EEG + familiaridade, tanto para todos os gêneros combinados quanto para gêneros individuais.
Métodos de análise estatística
A análise de dados foi realizada usando Python 3.10 com TensorFlow 2.12, Keras 2.12 e MNE-Python 1.3. O processamento e a análise de dados foram realizados usando Pandas 2.1 e NumPy 1.26. Métricas de desempenho da validação cruzada 10 vezes foram agregadas, e valores de média e desvio padrão foram calculados. Comparações estatísticas entre condições foram realizadas usando testes t pareados ou testes de Wilcoxon com patente gestual, com nível de significância de P < 0,05.