研究記事

ディープラーニングに基づく音楽ジャンル好み認識モデルの構築

DOI:

10.3791/70514

2026年5月26日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究では、EEG信号と音楽の親しみを用いて、音楽ジャンルの好みを予測するディープラーニングモデルを構築しました。データは低コストのMuse S装置で収集され、CNN+RNNおよびEEGNetモデルを用いて解析されました。慣れ親しさは精度を大幅に向上させ、最大99%に達し、好み予測におけるその大きな価値を示しました。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

メンタルヘルスの問題が増加する中で、音楽療法は非薬物的介入として注目を集め、ディープラーニング技術は音楽の感情認識や好み予測に有望な効果を示しています。本研究では、音楽タイプの好みを効率的に特定し、ユーザーの親しみが予測精度に与える影響を調査するために、深層ニューラルネットワークモデル(CNN+RNN/EEGNet)を構築しました。EEG信号は4チャンネルのMuse Sウェアラブルデバイスで収集され、ユーザーの親しみやすさスコアが入力機能として使用されました。この研究は、準備、実験設計、モデル構築、結果分析の4段階のワークフローを踏みました。実験デザインでは、音楽をロック、バラード、フォークに分類し、それぞれのカテゴリーでEEGデータと親しみやすさ評価を収集しました。データはCNN+RNNまたはEEGNetモデルで訓練・検証され、モデルのパフォーマンスは被験者レベルの10折交叉検証によって評価されました。結果は、EEGデータのみで全音楽タイプを予測した場合、82.28±3.42%の精度を達成したことが示されました。個々の音楽タイプでは、正確度は91.13±3.60%(ロック)、91.83±2.07%(バラード)、87.87±4.76%(フォーク)でした。ユーザー親しみを特徴として取り入れ、マルチレベル評価出力を用いると、全体の予測精度は94.94±1.61%に向上し、個々の音楽タイプの正確さは99.15±1.56%(ロック)、98.51±2.30%(バラード)、98.21±2.60%(フォーク)に達しました。これらの結果は、親しみやすさの特徴と多層スコアリングシステムを組み合わせることで、音楽の好みの予測が大幅に向上することを示しています。手頃な価格でウェアラブルなMuse S EEGデバイスを用い、ユーザーの親しみを活かすことで、本研究は音楽タイプの好みを認識するための非常に効果的なディープニューラルネットワークモデル(CNN+RNN/EEGNet)を成功裏に開発しました。この結果は、全体的および個別の音楽タイプ予測に親しみ情報を含めることで恩恵を受けていることを示し、このアプローチがパーソナライズされた音楽推薦や音楽療法の応用に応用できる可能性を強調しています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

音楽は人間の生活において重要な役割を果たしており、オンラインプラットフォームの普及により音楽を聴くことが日常的な活動となっています。娯楽を超えて、音楽はリラクゼーションを促進し、痛みを軽減し、発達障害のある人々を支援する治療ツールとして機能します。音楽の好みは治療効果と感情的反応の両方に直接影響を与えます。以前の研究では、好みの音楽が持久力やスプリント能力などの身体能力を高め、ストレスや痛みを軽減すること、2。また、個々の好みが治療効果に影響を与える高齢者にとっても重要な介入です 3,4。好む音楽は心拍数や呼吸数を下げ、リラクゼーションを促進することも示されています。さらに、音楽の好みは感情予測の精度5を向上させ、感情反応を強化し6、機械学習モデルのパフォーマンスを向上させ、予測精度を53.18%から71.09%に向上させます。繰り返し曝露すると、初期バイアスに関係なくさらに好みが増加します。

これらの発見にもかかわらず、音楽嗜好の予測に関する既存の研究は、サンプル数が少なく、年齢層が狭く、ユーザーの馴染みが十分でないという点で制限されています。これらの制約はモデルの汎用性や実用的な適用性を低下させます。ユーザー固有の要素、例えば親しみやすさを取り入れることは、予測性能向上のためのあまり研究されていないアプローチです。

音楽感情認識(EMR)は活発な研究分野となっており、その精度は音楽の好みや親しみやすさに影響されます 8,9,10,11。参加者は馴染みのある音楽や好む音楽に触れると、より一貫した感情評価を提供し、親しみを高めることで実験的および教育的環境の両方で認識の精度が向上します(12,13,14,15,16,17)。これらの発見は、感情認識と好み予測の両方において、親しみやすさが重要な要素であることを強調しています。

人工ニューラルネットワークに基づくディープラーニングは、高次元特徴の自動抽出を可能にし、浅いモデルよりも強力なパターン認識を示します(18,19,20)。ディープラーニング技術は、ジャンル分類、信号認識、パーソナライズされた推薦システム(21,22,23,24,25,26)などの音楽関連タスクにも広く応用されています。脳波計(EEG)は、認知および感情分析のために周波数帯域を超えた脳の電気活動を測定するために広く用いられています(表1)。EEGとディープラーニングの統合は、音楽の好みに対する神経反応を捉える効果的な枠組みを提供します。

従来のEEGシステムは、ゲルベースの電極や高コストな機器を必要とすることが多く、実際の環境での適用性が制限されています。乾燥電極を用いたウェアラブルEEGデバイスは、コスト削減、使いやすさの向上、柔軟性の向上という実用的な代替手段を提供します。Muse Sデバイスは主要な脳領域(TP9、TP10、AF7、AF8)からの信号を256Hzで記録し、制御実験から実際の応用まで信頼性が高くスケーラブルなデータ取得を可能にします。

本研究は、EEG信号とユーザー親しみ機能を組み合わせて、ディープラーニングモデルを用いて音楽の好みを予測することで、特定された限界に対応します。CNN+RNNおよびEEGNetアーキテクチャは、時間周波数の特徴と時間的依存性の両方を抽出するために用いられ、従来の手法と比べてEEG信号の表現が改善されることを可能にします。この研究は2つの仮説を検証しています。(1) ユーザーの音楽の親しみがEEGに基づく嗜好予測の精度を向上させる;(2) ジャンル特有モデル(ロック、リリカル、フォーク)は、混合カテゴリで訓練されたモデルを上回る。

性別分布のバランスの取れた健康な成人30名のコホートを対象にしました。サンプル数の制限と4チャネルEEGの使用は一般化や信号分解能を制限しますが、深層学習モデルと慣れ度特徴を統合することで堅牢な予測性能を実現します。目的は音楽ジャンルを分類し、各カテゴリーごとに個別の予測を行い、ユーザーへの慣れ親しみを機能として取り入れて予測の精度を高めることです。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究は、曲州大学倫理委員会の指針に従って実施されました。研究プロトコルは、曲州大学機関審査委員会(IRB)により承認され、承認番号QZU-IRB-2026-037となりました。すべての参加者は研究に含める前にインフォームド・コンセントを提供しました。

実験準備と参加者募集
実験は準備、実験設計、モデル構築、結果分析の4段階で構成されていました(図1)。準備段階では、音楽療法、EEGデータ取得、ディープラーニングモデルに関する文献レビューに基づき研究目標が定められました。実験デザイン段階では、30人の健康な参加者が音楽聴取課題に採用されました。脳波信号と音楽の親しみ度評価が記録されました。EEGデータは標準化され、2048サンプルのウィンドウに分割され、1024サンプルの重複が行われました。慣熟度の特徴はEEGデータとモデル入力として組み合わされました。CNN+RNNとEEGNetの2つのモデルが構築されました。CNN層は時間-周波数の特徴を抽出し、双方向LSTMは時間的依存性を捉えました。分類にはソフトマックス活性化関数を持つ完全連結層が用いられました。モデルは50のバッチサイズで30エポックにわたりAdam optimizerを用いて訓練されました。ドロップアウトと早期停止が適用されました。パフォーマンスは主に報告された指標として「正確性」を用いて評価され、追加評価のために精度、リコール率、F1スコアの指標も計算されました。

実験環境と機器のセットアップ
実験は外部干渉のない静かで密閉された部屋で行われ、室温は27 °Cに保たれました。使用された機器は以下の通りです:EEG装置(Muse S、InteraXon Inc.)、256 Hzのサンプリングレートを持つ4チャンネルEEGシステム(TP9、AF7、AF8、TP10);最終版E3000インイヤーヘッドホン;Muse SDKおよびLab Streaming Layer(LSL)を動作させるデータ取得コンピュータも搭載しています。

各実験セッションの前に、ヘッドホンの耳当て面はアルコールで洗浄され、衛生面を確保し交差汚染のリスクを軽減しました。Muse Sヘッドセットは各参加者に装着され、4つの乾燥電極(TP9、AF7、AF8、TP10)と皮膚の安定した接触を確保しました。信号品質が悪い場合は、ヘッドバンドの位置を調整し、安定した信号が得られるまで調整しました。参加者は背もたれ付きの快適な椅子に座り、目を閉じて話さず、実験中は大きな体を動かさないように指示されました。

音楽刺激の準備
ロック、叙情的(バラード)、フォークの3つの音楽ジャンルが準備されました。各ジャンルには3曲の中国語歌曲が含まれ、合計9曲が収録されました。音楽の親しみやすさの違いを抑えるために、各ジャンルの曲は以下の基準で選ばれました:古い曲が1曲;現在人気のある曲(Spotifyトップソングチャートより);そしてSpotify新曲チャートから1曲の新曲を披露しました。

各曲はイントロから始まり、ヴァース、そして最初のコーラスで終わる標準化された音声セグメントに編集され、合計90〜130秒の長さでした。各曲には固有の識別子(例:R1–R3、B1–B3、F1–F3)が割り当てられ、その後のデータラベル付けやファイル管理が行われました。

実験的手順とアンケート記録
正式な実験の前に、テスト音声クリップを再生して音量テストが行われました。参加者は音量をクリアで快適、過度に大きくないレベルに調整し、実験中ずっと一定に保ちました。9曲の再生順はランダム化され(例:乱数表やソフトウェアのランダム化など)、順番効果を軽減しました。すべての参加者は独立して音楽聴取課題を完了しました。各音楽セグメントは導入から最初のコーラスまで90〜130秒にわたって提供されました。曲間には30秒の休憩時間が設けられていました。この期間中、参加者はオンラインプラットフォーム(Questionnaire Star)を使って親しみ度質問票に回答しました。参加者は5点リッカート尺度(1=完全に知らない、5=非常に馴染み深い)を使って各曲の馴染みを評価しました。参加者の各曲の好みラベル(0=嫌い、1=好き)は、あらかじめ定められた二項分類方式に従って記録されました。完全な実験手順は 図2に示されています。

EEG取得とデータログ
EEGデータは公式のMuse SDKを使用して取得され、Lab Streaming Layer(LSL)を通じてストリーミングされました。各曲に対応するEEGデータは、最低でも以下のフィールドを含むカンマ区切り値(CSV)ファイルとして保存されました:タイムスタンプ(ミリ秒);4つのチャンネル(TP9、AF7、AF8、TP10)からの生脳波信号;手動で記録された親しみ度スコア(1–5);そして優先ラベル(0/1)です。一貫したファイル名の定まり(例:S01_R1.csv、参加者01およびロックソング1を示す)が用いられ、自動処理とトレーサビリティを促進しました。

データ前処理、正規化、ウィンドウ化
脳波信号は256Hzのサンプリングレートを持つMuse Sの4チャンネルEEG装置で記録され、公式の開発キットを使ってカスタムプログラムが開発されました。生のEEGデータはLab Streaming Layer(LSL)を通じて取得され、CSV形式で保存されました。CSVファイルには以下の列が含まれていました:タイムスタンプ(ミリ秒)、4チャンネルのEEG値(TP9、AF7、AF8、TP10)、ユーザーの音楽親しみ評価(1–5)、およびユーザーの音楽好み評価。

データエントリの総数は、各参加者と各音楽作品ごとに生成された複数のウィンドウに対応し、ウィンドウ方式によって大規模なデータセットとなります。元の実験では、音楽の好みはバイナリラベル(0=嫌い、1=似)で表され、これは人工的に高い精度と限られたモデルの一般化につながる可能性があります。

予測課題の実用的な重要性を高めるために、好みラベルは多層評価尺度に変換されました:0 = 強く異議;1 = 意見が合わない;2 = ニュートラル;3 = 同意;4 = 強く同意。

機械学習以前は、データは標準化され、2048サンプルずつのウィンドウに分割され、時間的な連続性を保つために隣接するウィンドウ間で1024サンプルが重なり合っていました。さらに、データ拡張を適用し、訓練サンプル数を増やし、過学習のリスクを低減しました。

モデルアーキテクチャ
研究モデルは3つの畳み込み層、3つのプーリング層、そして完全連結層で構成されていました。特徴選択には最大プーリングが用いられ、過学習を減らすためにドロップアウトが適用され、最終出力はソフトマックス分類層を用いて生成されました。各入力ウィンドウには4チャンネルのEEG信号(1ウィンドウあたり2048サンプル)と、親しみ込み機能が含まれていました。出力は5クラスの優先評価を表していました。アーキテクチャは 図3に示されており、モデルのパラメータは 表2に示されています。

モデルトレーニングとクロスバリデーション
データセットは80%がトレーニング用、20%がテスト用にランダムに分割されました。10分割のクロスバリデーションが適用され、1つのサブセットは検証に、残りの9つは各反復のトレーニングに使用されました。このプロセスは10回繰り返され、結果が集計されました。訓練ハイパーパラメータは次のように設定されました:エポーク = 30;バッチサイズ=50;最適化器 = アダム;損失関数 = 圏的交差エントロピー;評価指標=正確性。モデルのパフォーマンスは、すべてのジャンルを合わせたものおよび個別のジャンルで、EEGのみおよびEEG+の親しみの条件で記録されました。

統計解析手法
データ解析はPython 3.10とTensorFlow 2.12、Keras 2.12、MNE-Python 1.3を用いて行われました。データ処理と解析はPandas 2.1およびNumPy 1.26を使用して行われました。10分割クロスバリデーションの結果を集約し、平均および標準偏差値を算出しました。条件間の統計比較はペアt検定またはWilcoxon符号付きランク検定を用いて行われ、有意水準はP<0.05でした。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

モデルの性能は2つの条件下で評価されました:(1) 脳波の特徴のみ、(2) 脳波の特徴と音楽の認知度を組み合わせたもの。分類は、複合音楽カテゴリーと個別音楽カテゴリー(ロック、リリカル、フォーク)の両方で実施されました。

表3は EEGの特徴のみを用いた結果を示し、表4はEEGの特徴と親しみを組み合わせた結果を示しています。CNN+RNNとEEGNetの両方のモデルがこれらの条件下で評価され、全体的に優れた性能からEEGNetが最終モデルとして選ばれました。

EEGの特徴のみを用いると(表3、 図4)、モデルはすべての音楽カテゴリーで82.28%±3.42%の総合精度を達成しました。別途評価すると、ロック音楽は91.13%±3.60%、歌詞音楽は91.83%±2.07%、フォーク音楽は87.87%±4.76%でした。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

これまでのEEGベースの音楽嗜好予測の研究は主にマルチチャンネルシステムに依存しており、実際の応用は限られていました 21,22,23,24,25,26。本研究では、4チャンネルのウェアラブルEEGデバイス(Muse S)が、ディープラーニングモデルや親しみやすさ機能と組み合わせることで同等の性能を達成し、より実用的でスケーラブルなアプローチを示しました。

その結果、EEG信号とユーザーの親しみを統合することで、すべての音楽カテゴリーで予測精度が大幅に向上することが示されています。この発見は、音楽の好みが神経反応だけでなく、...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者には開示すべき利益相反はありません。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者は本研究の過程で提供された研究機関の支援と施設に感謝の意を表します。技術手順でのご協力に感謝申し上げます。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
アルコールワイプどの標準サプライヤーでも該当なし参加者間のヘッドホンの掃除に使用
データ取得コンピュータどの標準メーカーでも該当なしMuse SDKとLab Streaming Layer(LSL)を実行
EEGヘッドセット(Muse S)インターアクソン社https://choosemuse.com/muse-s/4チャンネルのウェアラブルEEGデバイス(TP9、AF7、AF8、TP10)
最終的なE3000インイヤーヘッドホン最終音声デザインhttps://snext-final.com/en/products/detail/E3000実験中の音声再生に使用
ラボストリーミングレイヤー(LSL)ソフトウェアオープンソースhttps://github.com/sccn/labstreaminglayerEEGデータのストリーミングに使用
Muse SDKインターアクソン社https://developer.choosemuse.com/EEGデータ取得に使用
Questionnaire Star(オンラインプラットフォーム)長沙蘭興情報技術有限公司https://www.wjx.cn/親しみデータ収集に使用
Python 3.10Pythonソフトウェア財団https://www.python.org/downloads/データ処理および解析に使用
テンソルフロー 2.12グーグルhttps://www.tensorflow.org/ディープラーニングフレームワーク
ケラス 2.12グーグルhttps://keras.io/ニューラルネットワークAPI
MNE-Python 1.3オープンソースhttps://mne.tools/stable/index.htmlEEGデータ解析
NumPy 1.26オープンソースhttps://numpy.org/数値計算
パンダス 2.1オープンソースhttps://pandas.pydata.org/データ操作

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ballmann, C. G., McCullum, M. J., Rogers, R. R., Marshall, M. R., Williams, T. D. Effects of preferred vs. nonpreferred music on resistance exercise performance. J. Strength Cond. Res. 35 (6), 1650-1655 (2021).
  2. Banks, D. Neurotechnology: microelectronics. Handbook of Neuroprosthetic Methods. Finn, W. E., LoPresti, P. G. , CRC Press. Boca Raton, FL. 361-400 (2002).
  3. Aldridge, D. An overview of music therapy research. Complement. Ther. Med. 2, 204-216 (1994).
  4. Hillecke, T., Nickel, A., Bolay, H. V. Scientific perspectives on music therapy. Ann. N. Y. Acad. Sci. 1060, 271-282 (2005).
  5. Lai, H. L. Music preference and relaxation in Taiwanese elderly people. Geriatr. Nurs. 25 (5), 286-291 (2004).
  6. Kreutz, G., Lotze, M. Neuroscience of music and emotion. Neurosciences in Music Pedagogy. Rauscher, F., Gruhn, W. , Nova Science Publishers. New York. 143-167 (2007).
  7. Madison, G., Schiölde, G. Repeated listening increases the liking for music regardless of its complexity: implications for the appreciation and aesthetics of music. Front. Neurosci. 11, 147(2017).
  8. Pereira, C. S., et al. Music and emotions in the brain: familiarity matters. PLoS One. 6 (11), e27241(2011).
  9. Hamlen, K. R., Shuell, T. J. The effects of familiarity and audiovisual stimuli on preference for classical music. Bull. Counc. Res. Music Educ. 168, 21-34 (2006).
  10. Liu, W. J. Unit learning in junior high school music class based on deep understanding. Prim. Second. Sch. Music Educ. 3, 5(2022).
  11. A vocal range balancing method, device, and system based on deep learning. China Patent. , CN109147807B (2024).
  12. Yin, D. H. Constructing a music classroom teaching paradigm from the perspective of deep learning (Part 2). Prim. Second. Sch. Music Educ. 6, 4(2022).
  13. Zhang, C., Shi, T., Ai, J., Tian, W. Construction of GUI elements recognition model for AI testing based on deep learning. Proceedings of the 2021 8th International Conference on Dependable Systems and Their Applications (DSA), , 508-515 (2021).
  14. Shi, Y., Ko, Y. C. Construction of English pronunciation judgment and detection model based on deep learning neural networks data stream fusion. Int. J. Pattern Recognit. Artif. Intell. 36 (6), 2252011(2022).
  15. Li, X. H., et al. Survey of remote sensing image registration based on deep learning. Natl. Remote Sens. Bull. 27 (2), 267-284 (2023).
  16. Bishop, C. M., Nasrabadi, N. M. Pattern recognition and machine learning. , Springer. New York. (2006).
  17. Goodfellow, I., Bengio, Y., Courville, A. Deep learning. , MIT Press. Cambridge, MA. (2016).
  18. LeCun, Y., Bengio, Y., Hinton, G. Deep learning. Nature. 521, 436-444 (2015).
  19. Janiesch, C., Zschech, P., Heinrich, K. Machine learning and deep learning. Electron. Mark. 31 (3), 685-695 (2021).
  20. A deep learning-based system and method for Gongche notation character recognition. China Patent. , CN202210650096.0 (2024).
  21. Sun, L. Y. Research on music genre classification and generation technology based on deep learning. , Nanjing Audit University. Nanjing, China. Master's thesis (2022).
  22. Gan, Q. Deep learning-based electronic music signal recognition method. Inf. Comput. 35, 54-56 (2023).
  23. Zhang, H. Building a music teaching and research community using deep learning. Music World. 1, 16-19 (2022).
  24. Liu, L., Kong, M., Cao, C., Shu, Z., Liu, K., et al. Personalized music recommendation algorithm based on machine learning. Multimed. Syst. 31, 166(2025).
  25. Naser, D. S., Saha, G. Influence of music liking on EEG-based emotion recognition. Biomed. Signal Process. Control. 64, 102251(2021).
  26. Cannard, C., Brandmeyer, T., Wahbeh, H., Delorme, A. Self-health monitoring and wearable neurotechnologies. Handbook of Clinical Neurology. Ramsey, N. F., Millán, J. delR. 168, 207-232 (2020).
  27. Kumari, P., Vaish, A. Brainwave-based user identification system: a pilot study in robotics environment. Robot. Auton. Syst. 65, 15-23 (2015).
  28. Asif, A., Majid, M., Anwar, S. M. Human stress classification using EEG signals in response to music tracks. Comput. Biol. Med. 107, 182-196 (2019).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

Music Genre RecognitionDeep Learning ModelEEG Signal AnalysisMusic Preference PredictionCNN RNN ModelEEGNet ArchitectureUser Familiarity FeatureMuse S DeviceMusic Therapy ApplicationPersonalized Music Recommendation

関連記事