$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Это исследование было проведено в соответствии с руководящими принципами Этического комитета Университета Цюйчжоу. Протокол исследований был утверждён Институциональным обзорным советом Университета Цюйчжоу (IRB) под номером одобрения QZU-IRB-2026-037. Все участники дали информированное согласие до их включения в исследование.
Экспериментальная подготовка и набор участников
Эксперимент состоял из четырёх этапов (рисунок 1): подготовка, проектирование эксперимента, создание модели и анализ результатов. На этапе подготовки цели исследований определялись на основе обзора литературы по музыкальной терапии, сбору данных ЭЭГ и моделям глубокого обучения. На этапе экспериментального проектирования было привлечено 30 здоровых участников для выполнения задач по прослушиванию музыки. Записывались сигналы ЭЭГ и оценки знакомства с музыкой. Данные ЭЭГ были стандартизированы и сегментированы на окна из 2048 образцов с перекрытием 1024 выборок. Признаки знакомства сочетались с данными ЭЭГ в качестве входных данных модели. Были построены две модели — CNN+RNN и EEGNet. Слои CNN извлекали временно-частотные характеристики, а двунаправленный LSTM — временные зависимости. Для классификации использовался полностью связанный слой с функцией активации softmax. Модели обучались с размером партии 50 для 30 эпох с использованием оптимизатора Адама. Применялись отказ от учёбы и досрочное прекращение. Производительность в основном оценивалась с использованием Точности в качестве отчётной метрики, при этом для дополнительной оценки также рассчитывались метрики Точности, Отзыва и F1.
Экспериментальная среда и настройка оборудования
Эксперимент проводился в тихой, закрытой комнате, свободной от внешних помех, с поддержанной температурой в комнате на уровне 27 °C. Использовалось следующее оборудование: устройство ЭЭГ (Muse S, InteraXon Inc.), четырёхканальная система ЭЭГ (TP9, AF7, AF8, TP10) с частотой дискретизации 256 Гц; Финальные наушники E3000; а также компьютер для сбора данных, работающий под управлением Muse SDK и Lab Streaming Layer (LSL).
Перед каждой экспериментальной сессией поверхности наушников очищались спиртом для поддержания гигиены и снижения риска перекрёстного загрязнения. Гарнитура Muse S устанавливалась на каждого участника, обеспечивая стабильный контакт между всеми четырьмя сухими электродами (TP9, AF7, AF8, TP10) и обшивкой. Если качество сигнала было плохим, положение головной повязки корректировалось до получения стабильных сигналов. Участников посадили в удобное кресло с поддержкой спины и инструктовали держать глаза закрытыми, избегать разговоров и минимизировать большие движения тела во время эксперимента.
Подготовка музыкальных стимулов
Были подготовлены три музыкальных жанра: рок, лирическая (баллада) и народная музыка. Каждый жанр включал три китайские песни, всего девять песен. Для контроля различий в музыкальном знакомстве песни каждого жанра отбирались по следующим критериям: одна старая песня; одна актуальная популярная песня (из чарта Spotify Top Songs); и одну новую песню (из чарта Spotify New Releases).
Каждая песня была смонтирована в стандартизированный аудиосегмент, начинающийся с вступления, за которым следовал куплет и заканчивался первым припевом, с общей длительностью 90–130 секунд. Каждой песне присваивался уникальный идентификатор (например, R1–R3, B1–B3, F1–F3) для последующего маркировки данных и управления файлами.
Экспериментальная процедура и запись анкет
Перед формальным экспериментом проводился тест громкости с воспроизведением тестового аудиофрагмента. Участники регулировали громкость на чистый, комфортный и не слишком громкий, поддерживая её постоянной на протяжении всего эксперимента. Порядок воспроизведения девяти песен был рандомизирован (например, с использованием таблицы случайных чисел или программного обеспечения) для уменьшения эффектов порядка. Все участники самостоятельно выполняли задачи по прослушиванию музыки. Каждый музыкальный сегмент был представлен от вступления до первого хора, продолжительностью 90–130 секунд. Между песнями был предусмотрен 30-секундный перерыв. В этот период участники заполняли анкету знакомства с помощью онлайн-платформы (Questionnaire Star). Участники оценивали своё знакомство с каждой песней с помощью пятибалльной шкалы Лайкерта (1 = полностью незнакомый; 5 = очень знакомый). Метка предпочтений участника для каждой песни записывалась (0 = не нравится; 1 = лайк) согласно заранее определённой бинарной классификации. Полная экспериментальная процедура показана на рисунке 2.
Получение ЭЭГ и журналирование данных
Данные EEG собирались с помощью официального Muse SDK и передавались через Lab Streaming Layer (LSL). Данные EEG, соответствующие каждой песне, сохранялись в виде файлов Comma-Separated Values (CSV), содержащих минимум следующие поля: временная метка (миллисекунды); сырые ЭЭГ-сигналы с четырёх каналов (TP9, AF7, AF8, TP10); ручной записанный балл знакомства (1–5); и этикетка предпочтений (0/1). Использовалась согласованная система именования файлов (например, S01_R1.csv, указывающая участника 01 и рок-песню 1) для облегчения автоматизированной обработки и отслеживания.
Предобработка, нормализация и оконная обработка данных
ЭЭГ-сигналы записывались с помощью четырёхканального EEG-устройства Muse S с частотой дискретизации 256 Гц, а индивидуальные программы разрабатывались с использованием официального комплекта разработки. Сырые данные EEG собирались через Lab Streaming Layer (LSL) и сохранялись в формате CSV. Файлы CSV включали следующие столбцы: временная метка (миллисекунды), значения четырёхканального EEG (TP9, AF7, AF8, TP10), оценки знакомства с пользовательской музыкой (1–5) и рейтинги пользовательских музыкальных предпочтений.
Общее количество записей данных соответствует нескольким оконам, сгенерируемым для каждого участника и каждого музыкального произведения, что приводит к крупномасштабному набору данных в зависимости от схемы окон. В оригинальном эксперименте музыкальные предпочтения представлялись как бинарная метка (0 = не нравится, 1 = нравится), что может привести к искусственно высокой точности и ограниченному обобщению моделей.
Для повышения практической значимости задачи прогнозирования метки предпочтений были преобразованы в многоуровневую оценочную шкалу: 0 = Сильно не согласен; 1 = Не согласен; 2 = Нейтральный; 3 = Согласен; 4 = Полностью согласен.
До появления машинного обучения данные стандартизировались и сегментировались на окна по 2048 образцов каждое, при этом 1024 выборки перекрывались между соседними окнами для сохранения временной непрерывности. Кроме того, была применена дополнительная система данных для увеличения количества обучающих образцов и снижения риска перенагонки.
Архитектура модели
Исследовательская модель состояла из трёх сверточных слоёв, трёх слоёв пула и полностью соединённого слоя. Max pooling использовался для выбора признаков, dropout применялся для уменьшения перенагона, а итоговый результат генерировался с помощью слоя softmax классификации. Каждое входное окно включало четырёхканальные ЭЭГ-сигналы (2048 выборок в окно) и функцию знакомства. Результат представлял собой рейтинг предпочтений из пяти классов. Архитектура показана на рисунке 3, а параметры модели изложены в таблице 2.
Обучение модели и кросс-валидация
Набор данных был случайным образом разделён на 80% для обучения и 20% для тестирования. Была применена десятикратная кросс-валидация: для валидации использовалась одна подгруппа, а оставшиеся девять — для обучения в каждой итерации. Этот процесс повторялся десять раз, и результаты были агрегированы. Обучающие гиперпараметры были установлены следующим образом: эпохи = 30; Размер партии = 50; Оптимизатор = Адам; Функция потерь = категориальная кроссентропия; Метрика оценки = Точность. Исполнение модели записывалось только в условиях ЭЭГ и ЭЭГ + знакомства, как для всех жанров вместе взятых, так и для отдельных жанров.
Методы статистического анализа
Анализ данных проводился с использованием Python 3.10 с TensorFlow 2.12, Keras 2.12 и MNE-Python 1.3. Обработка и анализ данных проводились с использованием Pandas 2.1 и NumPy 1.26. Метрики производительности из 10-кратной перекрёстной валидации были агрегированы, и рассчитаны средние и стандартные значения отклонения. Статистические сравнения состояний проводились с помощью парных t-тестов или тестов с знаками Уилкоксона, при этом уровень значимости P < 0,05.