这项研究利用脑电信号和音乐熟悉度构建了一个深度学习模型,预测音乐类型的偏好。数据通过低成本Muse S设备收集,并使用CNN+RNN和EEGNet模型进行分析。熟悉度显著提升了准确率,最高可达99%,显示出其在偏好预测中的显著价值。
研究文章
这项研究利用脑电信号和音乐熟悉度构建了一个深度学习模型,预测音乐类型的偏好。数据通过低成本Muse S设备收集,并使用CNN+RNN和EEGNet模型进行分析。熟悉度显著提升了准确率,最高可达99%,显示出其在偏好预测中的显著价值。
随着心理健康问题日益普及,音乐治疗作为一种非药物干预手段受到关注,深度学习技术在音乐情感识别和偏好预测方面展现出潜力。本研究构建了一个深度神经网络模型(CNN+RNN/EEGNet),以高效识别音乐类型偏好,并探讨用户熟悉度对预测准确性的影响。脑电信号通过四通道Muse S可穿戴设备收集,用户熟悉度分数作为输入功能。该研究遵循四个阶段的工作流程:准备、实验设计、模型构建和结果分析。在实验设计中,音乐被分为摇滚、抒情和民谣,并为每个类别收集了脑电图数据和熟悉度评分。数据通过CNN+RNN或EEGNet模型进行训练和测试,模型表现通过受试者层面的10折交叉验证进行评估。结果显示,仅用脑电图数据预测所有音乐类型的准确率为82.28±3.42%。在各个音乐类型中,准确度为91.13±3.60%(摇滚),91.83±2.07%(抒情曲),87.87±4.76%(民谣)。将用户熟悉度纳入功能并采用多层级评分输出时,整体预测准确率提升至94.94±1.61%,而单个音乐类型的准确度为99.15±1.56%(摇滚)、98.51±2.30%(抒情曲)、98.21±2.60%(民谣)。这些结果表明,将熟悉度特征与多层次评分系统结合,显著提升了对音乐偏好的预测能力。通过使用价格实惠的可穿戴Muse S EEG设备并利用用户熟悉度,本研究成功开发出高效的深度神经网络模型(CNN+RNN/EEGNet),用于识别音乐类型的偏好。研究结果表明,整体和个人音乐类型的预测都受益于熟悉度信息,凸显了该方法在个性化音乐推荐和音乐治疗应用中的潜力。
音乐在人类生活中扮演着重要角色,网络平台的广泛使用使听音乐成为日常活动。除了娱乐,音乐还作为一种治疗工具,促进放松、减轻疼痛,并支持有发育障碍的个体。音乐偏好直接影响治疗效果和情绪反应。以往研究表明,偏好音乐能提升身体表现,如耐力和冲刺能力,1,减轻压力和疼痛,2。它也是老年人的重要干预措施,个体偏好会影响治疗效果 3,4。研究还显示,偏好音乐能降低心率和呼吸频率,促进放松。此外,音乐偏好还能提高情绪预测准确率5,增强情绪反应6,并提升机器学习模型性能,使预测准确率从53.18%提升至71.09%。反复暴露进一步增加偏好,无论初始偏差如何。
尽管有这些发现,现有关于预测音乐偏好的研究仍受限于样本量小、年龄范围狭窄以及用户熟悉度不足。这些限制降低了模型的泛化性和实际应用性。将用户特定因素如熟悉度纳入,仍是提升预测性能的广泛应用。
音乐情感识别(EMR)已成为一个活跃的研究领域,其准确性受音乐偏好和熟悉度的影响 8,9,10,11。参与者在接触熟悉和偏好的音乐时,能够提供更一致的情绪评估,增加熟悉度能提升实验和教育环境中的识别准确性(12,13,14,15,16,17)。这些发现凸显了熟悉度在情感识别和偏好预测中的关键因素。
基于人工神经网络的深度学习能够自动提取高维特征,并展现出比浅模型更强的模式识别能力(18,19,20)。深度学习技术也被广泛应用于音乐相关任务,包括流派分类、信号识别和个性化推荐系统(21,22,23,24,25,26)。脑电图(EEG)被广泛用于测量跨频段的大脑电活动(见表1),用于认知和情绪分析(27,28)。EEG与深度学习的结合为捕捉神经对音乐偏好的反应提供了有效框架。
传统的脑电系统通常需要基于凝胶的电极和高成本设备,限制了其在现实环境中的适用性。带干电极的可穿戴脑电图设备提供了实用的替代方案,降低成本、提升可用性和更大的灵活性。Muse S设备记录关键脑区(TP9、TP10、AF7、AF8)的256 Hz信号,实现了对控实验和实际应用的数据采集,既可靠且可扩展。
本研究通过结合脑电信号与用户熟悉度特征,利用深度学习模型预测音乐偏好,解决了已识别的局限性。CNN+RNN和EEGNet架构被用于提取时间-频率特征和时间依赖性,使得脑电信号的表现优于传统方法。研究检验了两个假设:(1)用户音乐熟悉度提高了基于脑电图的偏好预测准确性;(2)特定类型的模型(摇滚、抒情和民谣)优于混合类别训练的模型。
纳入了30名性别分布均衡的健康成年人队列。尽管样本量有限且使用四通道脑电图限制了泛化性和信号分辨率,但将熟悉度特征与深度学习模型整合,能够实现稳健的预测性能。目标是对音乐类型进行分类,并为每个类别进行个别预测,并将用户熟悉度作为提升预测准确性的功能。
访问受限。请登录或开始试用以查看此内容。
本研究依据衢州大学伦理委员会的指导方针进行。该研究方案已获得曲州大学机构审查委员会(IRB)批准,批准号为QZU-IRB-2026-037。所有参与者在纳入研究前均提供了知情同意。
实验准备与参与者招募
实验分为四个阶段 (见图1):准备、实验设计、模型构建和结果分析。在准备阶段,基于音乐治疗、脑电图数据采集和深度学习模型文献综述,确定了研究目标。在实验设计阶段,招募了30名健康参与者进行音乐聆听任务。记录了脑电信号和音乐熟悉度评分。脑电图数据被标准化,并细分为2048个样本窗口,1024个样本重叠。熟悉度特征与脑电图数据结合作为模型输入。构建了两个模型,CNN+RNN和EEGNet。CNN层提取时间-频率特征,双向LSTM捕捉时间依赖性。分类使用了带有软最大激活函数的全连通层。模型以50个批次规模,使用Adam优化器训练30个时代。采用了退出和提前停止的措施。主要以准确度为评估指标,同时计算准确率、回忆率和F1分数指标以供进一步评估。
实验环境与设备配置
实验在一个安静、封闭、无外部干扰的房间内进行,室温保持在27 摄氏度。使用了以下设备:脑电图设备(Muse S,InteraXon Inc.)、四通道脑电系统(TP9、AF7、AF8、TP10),采样率为256 Hz;最终E3000入耳式耳机;以及运行Muse SDK和实验室流层(LSL)的数据采集计算机。
每次实验前,耳机的耳膜接触面都会用酒精清洁,以确保卫生并降低交叉污染风险。每位参与者都配备了Muse S头盔,确保四个干电极(TP9、AF7、AF8、TP10)与皮肤之间的稳定接触。如果信号质量较差,则会调整头带位置直到获得稳定信号。参与者被安排坐在带有背部支撑的舒适椅子上,并被指示在实验过程中闭眼、避免说话,并尽量减少大动作。
音乐刺激的准备
准备了三种音乐类型:摇滚、抒情(抒情)和民谣。每个曲风包含三首中文歌曲,共九首。为了控制音乐熟悉度的差异,每个流派的歌曲根据以下标准进行选择:一首老歌;一首当前流行歌曲(来自Spotify热门歌曲榜);以及一首新歌(来自Spotify新发行榜)。
每首歌都被剪辑成一个标准化音频片段,从引子开始,接着是主歌,最后到第一个副歌,总时长为90至130秒。每首歌曲都会被分配一个唯一的标识符(例如,R1–R3,B1–B3,F1–F3),以便后续的数据标记和文件管理。
实验程序与问卷记录
在正式实验之前,通过播放测试音频片段进行音量测试。参与者将音量调整到清晰、舒适且不过于响亮的水平,并在整个实验过程中保持恒定。九首歌曲的播放顺序被随机化(例如使用随机数表或软件随机化),以减少顺序效应。所有参与者独立完成了音乐聆听任务。每个音乐片段从开头到第一副歌,时长90至130秒。歌曲之间设有30秒的休息时间。在此期间,参与者通过在线平台(Questionnaire Star)填写了熟悉度问卷。参与者用五点李克特量表(1 = 完全陌生;5 = 非常熟悉)来评定他们对每首歌的熟悉程度。参与者对每首歌的偏好标签会根据预设的二元分类方案记录(0=不喜欢;1=喜欢)。完整的实验过程如 图2所示。
脑电图采集与数据记录
脑电图数据通过官方Muse SDK获取,并通过实验室流层(LSL)进行流式传输。每首歌曲对应的脑电图数据保存为逗号分隔值(CSV)文件,至少包含以下字段:时间戳(毫秒);来自四个通道(TP9、AF7、AF8、TP10)的原始脑电信号;手动记录的熟悉度分数(1–5);以及偏好标签(0/1)。采用了一致的文件命名规范(例如,S01_R1.csv表示参与者01和摇滚歌曲1),以促进自动处理和可追溯性。
数据预处理、归一化与窗口处理
脑电信号使用Muse S四通道脑电设备录制,采样率为256赫兹,并使用官方开发套件开发定制程序。原始脑电图数据通过实验室流层(LSL)获取并保存为CSV格式。CSV文件包含以下列:时间戳(毫秒)、四通道脑电图值(TP9、AF7、AF8、TP10)、用户音乐熟悉度评分(1–5)以及用户音乐偏好评分。
总数据条目数对应于每个参与者和每首音乐作品生成的多个窗口,从而形成一个规模庞大的数据集,具体取决于窗口方案。在最初的实验中,音乐偏好被表示为二元标签(0 = 不喜欢,1 = 喜欢),这可能导致人为的高准确率和有限的模型泛化。
为了提高预测任务的实际意义,偏好标签被转换为多层次评分量表:0 = 强烈不同意;1 = 不同意;2 = 中性;3 = 同意;4 = 强烈同意。
在机器学习出现之前,数据被标准化并分割为每扇2048个样本的窗口,相邻窗口间有1024个样本重叠以保持时间连续性。此外,还应用了数据增强以增加训练样本数量并降低过拟合风险。
模型架构
研究模型由三层卷积层、三层池化层和一层全连通层组成。使用最大池化进行特征选择,应用掉落以减少过拟合,最终输出通过软最大分类层生成。每个输入窗口包含四通道脑电信号(每个窗口2048个样本)和熟悉度功能。结果代表了五个类别的优先评级。架构如 图3所示,模型参数详见 表2。
模型训练与交叉验证
数据集被随机分为80%用于训练,20%用于测试。采用十倍交叉验证,每次迭代中一部分用于验证,其余九个子集用于训练。这一过程重复了十次,结果被汇总。训练超参数设置如下:Epochs = 30;批次数量=50;优化器 = 亚当;损失函数 = 范畴交叉熵;评估指标=准确性。模型表现在仅用脑电图和EEG+熟悉度条件下记录,涵盖所有体型的综合和单个体型。
统计分析方法
数据分析使用了 Python 3.10,配合 TensorFlow 2.12、Keras 2.12 和 MNE-Python 1.3 进行。数据处理和分析使用了Pandas 2.1和NumPy 1.26。汇总了10折交叉验证的绩效指标,并计算了均值和标准差值。使用配对t检验或Wilcoxon符号秩检验进行疾病间的统计比较,显著性水平为P<0.05。
访问受限。请登录或开始试用以查看此内容。
模型表现在两种条件下进行评估:(1)仅有脑电图特征,(2)脑电图特征结合音乐熟悉度。分级涵盖了综合音乐类别和单一音乐类别(摇滚、抒情和民谣)。
表3 展示了仅使用脑电图特征获得的结果,表4则展示了结合脑电特征与熟悉度所得的结果。CNN+RNN和EEGNet模型均在这些条件下进行了评估,最终选定EEGNet作为最终模型,因其整体性能更优。
仅使用脑电图特征(见表3, 图4),模型在所有音乐类别中实现了82.28%±3.42%的整体准确率。单独评估时,摇滚音乐准确率为91.13%±3.60%,抒情音乐为91.83%±2.07%,民谣音乐为87.87%±4.76%。
当脑电图特征与熟悉度结合时(表4, 图5
访问受限。请登录或开始试用以查看此内容。
此前基于脑电图的音乐偏好预测研究主要依赖多声道系统,限制了实际应用 21,22,23,24,25,26。本研究中,四通道可穿戴脑电设备(Muse S)结合深度学习模型和熟悉度功能,实现了相当性能,展示了更实用且可扩展的方法。
结果显示,将脑电信号与用户熟悉度整合,显著提升了所有音乐类别的预测准确性。这一发现表明,音乐偏好不仅受神经反应影响,还受先前接触的影响,这与现有关于音乐认知和熟悉度效应的研究一致,8,9,10,11。
访问受限。请登录或开始试用以查看此内容。
作者没有利益冲突需要披露。
作者衷心感谢该研究机构在本研究过程中提供的支持和设施。特别感谢实验室工作人员在技术操作上的协助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 酒精湿巾 | 任何标准供应商 | 无 | 用于在参与者之间清洁耳机 |
| 数据采集计算机 | 任何标准制造商 | 无 | 运行Muse SDK和实验室流层(LSL) |
| 脑电图耳机(Muse S) | InteraXon公司 | https://choosemuse.com/muse-s/ | 四通道可穿戴脑电设备(TP9、AF7、AF8、TP10) |
| 最终款E3000入耳式耳机 | 最终音频设计 | https://snext-final.com/en/products/detail/E3000 | 实验中用于音频播放 |
| 实验室流层(LSL)软件 | 开源 | https://github.com/sccn/labstreaminglayer | 用于脑电图数据流 |
| Muse SDK | InteraXon公司 | https://developer.choosemuse.com/ | 用于脑电图数据采集 |
| 问卷之星(在线平台) | 长沙兰兴信息技术有限公司 | https://www.wjx.cn/ | 用于熟悉度数据收集 |
| Python 3.10 | Python 软件基础 | https://www.python.org/downloads/ | 用于数据处理和分析 |
| 张量流 2.12 | 谷歌 | https://www.tensorflow.org/ | 深度学习框架 |
| Keras 2.12 | 谷歌 | https://keras.io/ | 神经网络 API |
| MNE-Python 1.3 | 开源 | https://mne.tools/stable/index.html | 脑电图数据分析 |
| 数字Py 1.26 | 开源 | https://numpy.org/ | 数值计算 |
| 熊猫 2.1 | 开源 | https://pandas.pydata.org/ | 数据操作 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可