研究文章

基于深度学习构建音乐流派偏好识别模型

DOI:

10.3791/70514

2026年5月26日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

这项研究利用脑电信号和音乐熟悉度构建了一个深度学习模型,预测音乐类型的偏好。数据通过低成本Muse S设备收集,并使用CNN+RNN和EEGNet模型进行分析。熟悉度显著提升了准确率,最高可达99%,显示出其在偏好预测中的显著价值。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着心理健康问题日益普及,音乐治疗作为一种非药物干预手段受到关注,深度学习技术在音乐情感识别和偏好预测方面展现出潜力。本研究构建了一个深度神经网络模型(CNN+RNN/EEGNet),以高效识别音乐类型偏好,并探讨用户熟悉度对预测准确性的影响。脑电信号通过四通道Muse S可穿戴设备收集,用户熟悉度分数作为输入功能。该研究遵循四个阶段的工作流程:准备、实验设计、模型构建和结果分析。在实验设计中,音乐被分为摇滚、抒情和民谣,并为每个类别收集了脑电图数据和熟悉度评分。数据通过CNN+RNN或EEGNet模型进行训练和测试,模型表现通过受试者层面的10折交叉验证进行评估。结果显示,仅用脑电图数据预测所有音乐类型的准确率为82.28±3.42%。在各个音乐类型中,准确度为91.13±3.60%(摇滚),91.83±2.07%(抒情曲),87.87±4.76%(民谣)。将用户熟悉度纳入功能并采用多层级评分输出时,整体预测准确率提升至94.94±1.61%,而单个音乐类型的准确度为99.15±1.56%(摇滚)、98.51±2.30%(抒情曲)、98.21±2.60%(民谣)。这些结果表明,将熟悉度特征与多层次评分系统结合,显著提升了对音乐偏好的预测能力。通过使用价格实惠的可穿戴Muse S EEG设备并利用用户熟悉度,本研究成功开发出高效的深度神经网络模型(CNN+RNN/EEGNet),用于识别音乐类型的偏好。研究结果表明,整体和个人音乐类型的预测都受益于熟悉度信息,凸显了该方法在个性化音乐推荐和音乐治疗应用中的潜力。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

音乐在人类生活中扮演着重要角色,网络平台的广泛使用使听音乐成为日常活动。除了娱乐,音乐还作为一种治疗工具,促进放松、减轻疼痛,并支持有发育障碍的个体。音乐偏好直接影响治疗效果和情绪反应。以往研究表明,偏好音乐能提升身体表现,如耐力和冲刺能力,1,减轻压力和疼痛,2。它也是老年人的重要干预措施,个体偏好会影响治疗效果 3,4。研究还显示,偏好音乐能降低心率和呼吸频率,促进放松。此外,音乐偏好还能提高情绪预测准确率5,增强情绪反应6,并提升机器学习模型性能,使预测准确率从53.18%提升至71.09%。反复暴露进一步增加偏好,无论初始偏差如何。

尽管有这些发现,现有关于预测音乐偏好的研究仍受限于样本量小、年龄范围狭窄以及用户熟悉度不足。这些限制降低了模型的泛化性和实际应用性。将用户特定因素如熟悉度纳入,仍是提升预测性能的广泛应用。

音乐情感识别(EMR)已成为一个活跃的研究领域,其准确性受音乐偏好和熟悉度的影响 8,9,10,11。参与者在接触熟悉和偏好的音乐时,能够提供更一致的情绪评估,增加熟悉度能提升实验和教育环境中的识别准确性(12,13,14,15,16,17)。这些发现凸显了熟悉度在情感识别和偏好预测中的关键因素。

基于人工神经网络的深度学习能够自动提取高维特征,并展现出比浅模型更强的模式识别能力(18,19,20)。深度学习技术也被广泛应用于音乐相关任务,包括流派分类、信号识别和个性化推荐系统(21,22,23,24,25,26)。脑电图(EEG)被广泛用于测量跨频段的大脑电活动(见表1),用于认知和情绪分析(27,28)。EEG与深度学习的结合为捕捉神经对音乐偏好的反应提供了有效框架。

传统的脑电系统通常需要基于凝胶的电极和高成本设备,限制了其在现实环境中的适用性。带干电极的可穿戴脑电图设备提供了实用的替代方案,降低成本、提升可用性和更大的灵活性。Muse S设备记录关键脑区(TP9、TP10、AF7、AF8)的256 Hz信号,实现了对控实验和实际应用的数据采集,既可靠且可扩展。

本研究通过结合脑电信号与用户熟悉度特征,利用深度学习模型预测音乐偏好,解决了已识别的局限性。CNN+RNN和EEGNet架构被用于提取时间-频率特征和时间依赖性,使得脑电信号的表现优于传统方法。研究检验了两个假设:(1)用户音乐熟悉度提高了基于脑电图的偏好预测准确性;(2)特定类型的模型(摇滚、抒情和民谣)优于混合类别训练的模型。

纳入了30名性别分布均衡的健康成年人队列。尽管样本量有限且使用四通道脑电图限制了泛化性和信号分辨率,但将熟悉度特征与深度学习模型整合,能够实现稳健的预测性能。目标是对音乐类型进行分类,并为每个类别进行个别预测,并将用户熟悉度作为提升预测准确性的功能。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究依据衢州大学伦理委员会的指导方针进行。该研究方案已获得曲州大学机构审查委员会(IRB)批准,批准号为QZU-IRB-2026-037。所有参与者在纳入研究前均提供了知情同意。

实验准备与参与者招募
实验分为四个阶段见图1):准备、实验设计、模型构建和结果分析。在准备阶段,基于音乐治疗、脑电图数据采集和深度学习模型文献综述,确定了研究目标。在实验设计阶段,招募了30名健康参与者进行音乐聆听任务。记录了脑电信号和音乐熟悉度评分。脑电图数据被标准化,并细分为2048个样本窗口,1024个样本重叠。熟悉度特征与脑电图数据结合作为模型输入。构建了两个模型,CNN+RNN和EEGNet。CNN层提取时间-频率特征,双向LSTM捕捉时间依赖性。分类使用了带有软最大激活函数的全连通层。模型以50个批次规模,使用Adam优化器训练30个时代。采用了退出和提前停止的措施。主要以准确度为评估指标,同时计算准确率、回忆率和F1分数指标以供进一步评估。

实验环境与设备配置
实验在一个安静、封闭、无外部干扰的房间内进行,室温保持在27 摄氏度。使用了以下设备:脑电图设备(Muse S,InteraXon Inc.)、四通道脑电系统(TP9、AF7、AF8、TP10),采样率为256 Hz;最终E3000入耳式耳机;以及运行Muse SDK和实验室流层(LSL)的数据采集计算机。

每次实验前,耳机的耳膜接触面都会用酒精清洁,以确保卫生并降低交叉污染风险。每位参与者都配备了Muse S头盔,确保四个干电极(TP9、AF7、AF8、TP10)与皮肤之间的稳定接触。如果信号质量较差,则会调整头带位置直到获得稳定信号。参与者被安排坐在带有背部支撑的舒适椅子上,并被指示在实验过程中闭眼、避免说话,并尽量减少大动作。

音乐刺激的准备
准备了三种音乐类型:摇滚、抒情(抒情)和民谣。每个曲风包含三首中文歌曲,共九首。为了控制音乐熟悉度的差异,每个流派的歌曲根据以下标准进行选择:一首老歌;一首当前流行歌曲(来自Spotify热门歌曲榜);以及一首新歌(来自Spotify新发行榜)。

每首歌都被剪辑成一个标准化音频片段,从引子开始,接着是主歌,最后到第一个副歌,总时长为90至130秒。每首歌曲都会被分配一个唯一的标识符(例如,R1–R3,B1–B3,F1–F3),以便后续的数据标记和文件管理。

实验程序与问卷记录
在正式实验之前,通过播放测试音频片段进行音量测试。参与者将音量调整到清晰、舒适且不过于响亮的水平,并在整个实验过程中保持恒定。九首歌曲的播放顺序被随机化(例如使用随机数表或软件随机化),以减少顺序效应。所有参与者独立完成了音乐聆听任务。每个音乐片段从开头到第一副歌,时长90至130秒。歌曲之间设有30秒的休息时间。在此期间,参与者通过在线平台(Questionnaire Star)填写了熟悉度问卷。参与者用五点李克特量表(1 = 完全陌生;5 = 非常熟悉)来评定他们对每首歌的熟悉程度。参与者对每首歌的偏好标签会根据预设的二元分类方案记录(0=不喜欢;1=喜欢)。完整的实验过程如 图2所示。

脑电图采集与数据记录
脑电图数据通过官方Muse SDK获取,并通过实验室流层(LSL)进行流式传输。每首歌曲对应的脑电图数据保存为逗号分隔值(CSV)文件,至少包含以下字段:时间戳(毫秒);来自四个通道(TP9、AF7、AF8、TP10)的原始脑电信号;手动记录的熟悉度分数(1–5);以及偏好标签(0/1)。采用了一致的文件命名规范(例如,S01_R1.csv表示参与者01和摇滚歌曲1),以促进自动处理和可追溯性。

数据预处理、归一化与窗口处理
脑电信号使用Muse S四通道脑电设备录制,采样率为256赫兹,并使用官方开发套件开发定制程序。原始脑电图数据通过实验室流层(LSL)获取并保存为CSV格式。CSV文件包含以下列:时间戳(毫秒)、四通道脑电图值(TP9、AF7、AF8、TP10)、用户音乐熟悉度评分(1–5)以及用户音乐偏好评分。

总数据条目数对应于每个参与者和每首音乐作品生成的多个窗口,从而形成一个规模庞大的数据集,具体取决于窗口方案。在最初的实验中,音乐偏好被表示为二元标签(0 = 不喜欢,1 = 喜欢),这可能导致人为的高准确率和有限的模型泛化。

为了提高预测任务的实际意义,偏好标签被转换为多层次评分量表:0 = 强烈不同意;1 = 不同意;2 = 中性;3 = 同意;4 = 强烈同意。

在机器学习出现之前,数据被标准化并分割为每扇2048个样本的窗口,相邻窗口间有1024个样本重叠以保持时间连续性。此外,还应用了数据增强以增加训练样本数量并降低过拟合风险。

模型架构
研究模型由三层卷积层、三层池化层和一层全连通层组成。使用最大池化进行特征选择,应用掉落以减少过拟合,最终输出通过软最大分类层生成。每个输入窗口包含四通道脑电信号(每个窗口2048个样本)和熟悉度功能。结果代表了五个类别的优先评级。架构如 图3所示,模型参数详见 表2

模型训练与交叉验证
数据集被随机分为80%用于训练,20%用于测试。采用十倍交叉验证,每次迭代中一部分用于验证,其余九个子集用于训练。这一过程重复了十次,结果被汇总。训练超参数设置如下:Epochs = 30;批次数量=50;优化器 = 亚当;损失函数 = 范畴交叉熵;评估指标=准确性。模型表现在仅用脑电图和EEG+熟悉度条件下记录,涵盖所有体型的综合和单个体型。

统计分析方法
数据分析使用了 Python 3.10,配合 TensorFlow 2.12、Keras 2.12 和 MNE-Python 1.3 进行。数据处理和分析使用了Pandas 2.1和NumPy 1.26。汇总了10折交叉验证的绩效指标,并计算了均值和标准差值。使用配对t检验或Wilcoxon符号秩检验进行疾病间的统计比较,显著性水平为P<0.05。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

模型表现在两种条件下进行评估:(1)仅有脑电图特征,(2)脑电图特征结合音乐熟悉度。分级涵盖了综合音乐类别和单一音乐类别(摇滚、抒情和民谣)。

表3 展示了仅使用脑电图特征获得的结果,表4则展示了结合脑电特征与熟悉度所得的结果。CNN+RNN和EEGNet模型均在这些条件下进行了评估,最终选定EEGNet作为最终模型,因其整体性能更优。

仅使用脑电图特征(见表3, 图4),模型在所有音乐类别中实现了82.28%±3.42%的整体准确率。单独评估时,摇滚音乐准确率为91.13%±3.60%,抒情音乐为91.83%±2.07%,民谣音乐为87.87%±4.76%。

当脑电图特征与熟悉度结合时(表4, 图5

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

此前基于脑电图的音乐偏好预测研究主要依赖多声道系统,限制了实际应用 21,22,23,24,25,26。本研究中,四通道可穿戴脑电设备(Muse S)结合深度学习模型和熟悉度功能,实现了相当性能,展示了更实用且可扩展的方法。

结果显示,将脑电信号与用户熟悉度整合,显著提升了所有音乐类别的预测准确性。这一发现表明,音乐偏好不仅受神经反应影响,还受先前接触的影响,这与现有关于音乐认知和熟悉度效应的研究一致,8,9,10,11。

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者没有利益冲突需要披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者衷心感谢该研究机构在本研究过程中提供的支持和设施。特别感谢实验室工作人员在技术操作上的协助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
酒精湿巾任何标准供应商用于在参与者之间清洁耳机
数据采集计算机任何标准制造商运行Muse SDK和实验室流层(LSL)
脑电图耳机(Muse S)InteraXon公司https://choosemuse.com/muse-s/四通道可穿戴脑电设备(TP9、AF7、AF8、TP10)
最终款E3000入耳式耳机最终音频设计https://snext-final.com/en/products/detail/E3000实验中用于音频播放
实验室流层(LSL)软件开源https://github.com/sccn/labstreaminglayer用于脑电图数据流
Muse SDKInteraXon公司https://developer.choosemuse.com/用于脑电图数据采集
问卷之星(在线平台)长沙兰兴信息技术有限公司https://www.wjx.cn/用于熟悉度数据收集
Python 3.10Python 软件基础https://www.python.org/downloads/用于数据处理和分析
张量流 2.12谷歌https://www.tensorflow.org/深度学习框架
Keras 2.12谷歌https://keras.io/神经网络 API
MNE-Python 1.3开源https://mne.tools/stable/index.html脑电图数据分析
数字Py 1.26开源https://numpy.org/数值计算
熊猫 2.1开源https://pandas.pydata.org/数据操作

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ballmann, C. G., McCullum, M. J., Rogers, R. R., Marshall, M. R., Williams, T. D. Effects of preferred vs. nonpreferred music on resistance exercise performance. J. Strength Cond. Res. 35 (6), 1650-1655 (2021).
  2. Banks, D. Neurotechnology: microelectronics. Handbook of Neuroprosthetic Methods. Finn, W. E., LoPresti, P. G. , CRC Press. Boca Raton, FL. 361-400 (2002).
  3. Aldridge, D. An overview of music therapy research. Complement. Ther. Med. 2, 204-216 (1994).
  4. Hillecke, T., Nickel, A., Bolay, H. V. Scientific perspectives on music therapy. Ann. N. Y. Acad. Sci. 1060, 271-282 (2005).
  5. Lai, H. L. Music preference and relaxation in Taiwanese elderly people. Geriatr. Nurs. 25 (5), 286-291 (2004).
  6. Kreutz, G., Lotze, M. Neuroscience of music and emotion. Neurosciences in Music Pedagogy. Rauscher, F., Gruhn, W. , Nova Science Publishers. New York. 143-167 (2007).
  7. Madison, G., Schiölde, G. Repeated listening increases the liking for music regardless of its complexity: implications for the appreciation and aesthetics of music. Front. Neurosci. 11, 147(2017).
  8. Pereira, C. S., et al. Music and emotions in the brain: familiarity matters. PLoS One. 6 (11), e27241(2011).
  9. Hamlen, K. R., Shuell, T. J. The effects of familiarity and audiovisual stimuli on preference for classical music. Bull. Counc. Res. Music Educ. 168, 21-34 (2006).
  10. Liu, W. J. Unit learning in junior high school music class based on deep understanding. Prim. Second. Sch. Music Educ. 3, 5(2022).
  11. A vocal range balancing method, device, and system based on deep learning. China Patent. , CN109147807B (2024).
  12. Yin, D. H. Constructing a music classroom teaching paradigm from the perspective of deep learning (Part 2). Prim. Second. Sch. Music Educ. 6, 4(2022).
  13. Zhang, C., Shi, T., Ai, J., Tian, W. Construction of GUI elements recognition model for AI testing based on deep learning. Proceedings of the 2021 8th International Conference on Dependable Systems and Their Applications (DSA), , 508-515 (2021).
  14. Shi, Y., Ko, Y. C. Construction of English pronunciation judgment and detection model based on deep learning neural networks data stream fusion. Int. J. Pattern Recognit. Artif. Intell. 36 (6), 2252011(2022).
  15. Li, X. H., et al. Survey of remote sensing image registration based on deep learning. Natl. Remote Sens. Bull. 27 (2), 267-284 (2023).
  16. Bishop, C. M., Nasrabadi, N. M. Pattern recognition and machine learning. , Springer. New York. (2006).
  17. Goodfellow, I., Bengio, Y., Courville, A. Deep learning. , MIT Press. Cambridge, MA. (2016).
  18. LeCun, Y., Bengio, Y., Hinton, G. Deep learning. Nature. 521, 436-444 (2015).
  19. Janiesch, C., Zschech, P., Heinrich, K. Machine learning and deep learning. Electron. Mark. 31 (3), 685-695 (2021).
  20. A deep learning-based system and method for Gongche notation character recognition. China Patent. , CN202210650096.0 (2024).
  21. Sun, L. Y. Research on music genre classification and generation technology based on deep learning. , Nanjing Audit University. Nanjing, China. Master's thesis (2022).
  22. Gan, Q. Deep learning-based electronic music signal recognition method. Inf. Comput. 35, 54-56 (2023).
  23. Zhang, H. Building a music teaching and research community using deep learning. Music World. 1, 16-19 (2022).
  24. Liu, L., Kong, M., Cao, C., Shu, Z., Liu, K., et al. Personalized music recommendation algorithm based on machine learning. Multimed. Syst. 31, 166(2025).
  25. Naser, D. S., Saha, G. Influence of music liking on EEG-based emotion recognition. Biomed. Signal Process. Control. 64, 102251(2021).
  26. Cannard, C., Brandmeyer, T., Wahbeh, H., Delorme, A. Self-health monitoring and wearable neurotechnologies. Handbook of Clinical Neurology. Ramsey, N. F., Millán, J. delR. 168, 207-232 (2020).
  27. Kumari, P., Vaish, A. Brainwave-based user identification system: a pilot study in robotics environment. Robot. Auton. Syst. 65, 15-23 (2015).
  28. Asif, A., Majid, M., Anwar, S. M. Human stress classification using EEG signals in response to music tracks. Comput. Biol. Med. 107, 182-196 (2019).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

CNN RNN EEGNet Muse S

相关文章