$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Questo studio è stato condotto in conformità con le linee guida del Comitato Etico dell'Università di Quzhou. Il protocollo di ricerca è stato approvato dal Consiglio di Revisione Istituzionale (IRB) dell'Università di Quzhou con il numero di approvazione QZU-IRB-2026-037. Tutti i partecipanti hanno fornito il consenso informato prima della loro inclusione nello studio.
Preparazione sperimentale e reclutamento dei partecipanti
L'esperimento è stato composto da quattro fasi (Figura 1): preparazione, progettazione sperimentale, costruzione del modello e analisi dei risultati. Nella fase di preparazione, gli obiettivi della ricerca sono stati definiti sulla base di una revisione della letteratura sulla musicoterapia, l'acquisizione dati EEG e i modelli di deep learning. Nella fase di progettazione sperimentale, sono stati reclutati 30 partecipanti sani per svolgere compiti di ascolto musicale. Sono stati registrati segnali EEG e valutazioni di familiarità musicale. I dati EEG sono stati standardizzati e suddivisi in finestre di 2048 campioni con sovrapposizione di 1024 campioni. Le caratteristiche di familiarità sono state combinate con dati EEG come input del modello. Furono costruiti due modelli, CNN+RNN ed EEGNet. I livelli CNN estraevano le caratteristiche tempo-frequenza e la LSTM bidirezionale catturava le dipendenze temporali. Per la classificazione veniva utilizzato uno strato completamente connesso con funzione di attivazione softmax. I modelli venivano addestrati con una dimensione di lotto di 50 per 30 epoche utilizzando l'ottimizzatore Adam. Furono applicati l'abbandono e la fermata anticipata. Le prestazioni sono state valutate principalmente utilizzando la Precisione come metrica riportata, con anche metriche di Precisione, Richiamo e punteggio F1 calcolate per ulteriori valutazioni.
Ambiente sperimentale e configurazione delle apparecchiature
L'esperimento fu condotto in una stanza chiusa e silenziosa, libera da interferenze esterne, con la temperatura della stanza mantenuta a 27 °C. Veniva utilizzato il seguente apparecchiatura: un dispositivo EEG (Muse S, InteraXon Inc.), un sistema EEG a quattro canali (TP9, AF7, AF8, TP10) con una frequenza di campionamento di 256 Hz; Cuffie in-ear Final E3000; e un computer di acquisizione dati che esegue il Muse SDK e il Lab Streaming Layer (LSL).
Prima di ogni sessione sperimentale, le superfici a contatto delle cuffie venivano pulite con alcol per garantire l'igiene e ridurre il rischio di contaminazione incrociata. Il visore Muse S è stato montato su ciascun partecipante, garantendo un contatto stabile tra tutti e quattro gli elettrodi asciutti (TP9, AF7, AF8, TP10) e la pelle. Se la qualità del segnale era scarsa, la posizione della fascia veniva regolata fino a ottenere segnali stabili. I partecipanti sono stati seduti su una sedia comoda con supporto per la schiena e hanno ricevuto istruzioni per tenere gli occhi chiusi, evitare di parlare e minimizzare i grandi movimenti del corpo durante l'esperimento.
Preparazione degli stimoli musicali
Furono preparati tre generi musicali: rock, lirica (ballata) e folk. Ogni genere comprendeva tre canzoni cinesi, per un totale di nove canzoni. Per controllare le differenze di familiarità musicale, le canzoni di ogni genere venivano selezionate secondo i seguenti criteri: una vecchia canzone; una canzone popolare attuale (dalla classifica Spotify Top Songs); e una nuova canzone (dalla classifica Spotify New Releases).
Ogni brano veniva montato in un segmento audio standardizzato, a partire dall'introduzione, seguito dalla strofa e terminando al primo ritornello, con una durata totale di 90–130 secondi. A ogni canzone veniva assegnato un identificatore unico (ad esempio, R1–R3, B1–B3, F1–F3) per l'etichettatura successiva dei dati e la gestione dei file.
Procedura sperimentale e registrazione del questionario
Prima dell'esperimento formale, veniva condotto un test di volume riproducendo un clip audio di prova. I partecipanti hanno regolato il volume a un livello chiaro, confortevole e non eccessivamente alto, mantenendolo costante durante tutto l'esperimento. L'ordine di riproduzione delle nove canzoni era randomizzato (ad esempio, usando una tabella dei numeri casuali o randomizzazione software) per ridurre gli effetti di ordine. Tutti i partecipanti completarono autonomamente i compiti di ascolto musicale. Ogni segmento musicale veniva presentato dall'introduzione fino al primo ritornello, con una durata di 90–130 secondi. Era previsto un periodo di riposo di 30 secondi tra una canzone e l'altra. Durante questo intervallo, i partecipanti hanno compilato un questionario di familiarità utilizzando una piattaforma online (Questionnaire Star). I partecipanti valutavano la loro familiarità con ogni brano utilizzando una scala Likert di cinque punti (1 = completamente estraneo; 5 = molto familiare). L'etichetta di preferenza del partecipante per ogni brano veniva registrata (0 = dislike; 1 = like) secondo lo schema di classificazione binaria predefinito. La procedura sperimentale completa è illustrata nella Figura 2.
Acquisizione EEG e registrazione dei dati
I dati EEG venivano acquisiti utilizzando l'SDK ufficiale di Muse e trasmessi in streaming tramite il Lab Streaming Layer (LSL). I dati EEG corrispondenti a ogni canzone venivano salvati come file CSV (Comma-Separated Values), contenenti almeno i seguenti campi: timestamp (millisecondi); segnali EEG grezzi da quattro canali (TP9, AF7, AF8, TP10); punteggio di familiarità registrato manualmente (1–5); e l'etichetta di preferenza (0/1). È stata utilizzata una convenzione coerente di denominazione dei file (ad esempio, S01_R1.csv, che indica partecipante 01 e canzone rock 1) per facilitare l'elaborazione automatica e la tracciabilità.
Preelaborazione dei dati, normalizzazione e finestre
I segnali EEG venivano registrati utilizzando un dispositivo EEG Muse S a quattro canali con una frequenza di campionamento di 256 Hz, e programmi personalizzati venivano sviluppati utilizzando il kit di sviluppo ufficiale. I dati EEG grezzi venivano acquisiti tramite il Lab Streaming Layer (LSL) e salvati in formato CSV. I file CSV includevano le seguenti colonne: timestamp (millisecondi), valori EEG a quattro canali (TP9, AF7, AF8, TP10), valutazioni di familiarità musicale degli utenti (1–5) e valutazioni di preferenza musicale degli utenti.
Il numero totale di dati corrisponde a più finestre generate per ogni partecipante e ogni pezzo musicale, risultando in un dataset su larga scala a seconda dello schema di finestre. Nell'esperimento originale, la preferenza musicale era rappresentata come un'etichetta binaria (0 = dispiace, 1 = piace), il che può portare a un'accuratezza artificialmente alta e a una generalizzazione limitata del modello.
Per migliorare il significato pratico del compito di previsione, le etichette di preferenza sono state convertite in una scala di valutazione multilivello: 0 = Fortemente in disaccordo; 1 = Non sono d'accordo; 2 = Neutrale; 3 = Concordo; 4 = Fortemente d'accordo.
Prima del machine learning, i dati erano standardizzati e segmentati in finestre di 2048 campioni ciascuna, con 1024 campioni che si sovrapponevano tra finestre adiacenti per preservare la continuità temporale. Inoltre, è stato applicato l'aumento dei dati per aumentare il numero di campioni di addestramento e ridurre il rischio di sovrafitting.
Architettura del modello
Il modello di ricerca era composto da tre strati convoluzionali, tre strati di pooling e uno strato completamente connesso. Il pool max veniva utilizzato per la selezione delle caratteristiche, il dropout veniva applicato per ridurre l'overfitting e l'output finale veniva generato utilizzando uno strato di classificazione softmax. Ogni finestra di ingresso includeva segnali EEG a quattro canali (2048 campioni per finestra) e una funzione di familiarità. Il risultato rappresentava una valutazione di preferenze di cinque classi. L'architettura è mostrata nella Figura 3, e i parametri del modello sono delineati nella Tabella 2.
Addestramento del modello e validazione incrociata
Il dataset è stato suddiviso casualmente in 80% per l'addestramento e 20% per i test. È stata applicata una validazione incrociata di dieci volte, con un sottoinsieme usato per la validazione e i restanti nove per l'addestramento in ogni iterazione. Questo processo fu ripetuto dieci volte e i risultati furono aggregati. Gli iperparametri di addestramento erano impostati come segue: Epoche = 30; Dimensione del lotto = 50; Ottimizzatore = Adam; Funzione di perdita = entropia incrociata categorica; Metrica di valutazione = Accuratezza. La performance del modello veniva registrata solo in EEG e in condizioni di familiarità EEG +, sia per tutti i generi combinati sia per i singoli generi.
Metodi di analisi statistica
L'analisi dei dati è stata condotta utilizzando Python 3.10 con TensorFlow 2.12, Keras 2.12 e MNE-Python 1.3. L'elaborazione e l'analisi dei dati sono state effettuate utilizzando Pandas 2.1 e NumPy 1.26. Le metriche di performance della validazione incrociata a 10 volte sono state aggregate, e sono state calcolate le medie e i valori di deviazione standard. I confronti statistici tra le condizioni sono stati effettuati utilizzando test t accoppiati o test Wilcoxon con rango firmato, con un livello di significatività di P < 0,05.