이 연구는 EEG 신호와 음악 친숙도를 이용한 딥러닝 모델을 구축하여 음악 장르 선호도를 예측했습니다. 데이터는 저비용 Muse S 장치를 사용해 수집되었으며, CNN+RNN과 EEGNet 모델을 사용해 분석하였습니다. 익숙함은 정확도를 크게 향상시켜 최대 99%에 달해 선호 예측에 큰 가치를 보였습니다.
연구 논문
이 연구는 EEG 신호와 음악 친숙도를 이용한 딥러닝 모델을 구축하여 음악 장르 선호도를 예측했습니다. 데이터는 저비용 Muse S 장치를 사용해 수집되었으며, CNN+RNN과 EEGNet 모델을 사용해 분석하였습니다. 익숙함은 정확도를 크게 향상시켜 최대 99%에 달해 선호 예측에 큰 가치를 보였습니다.
정신 건강 문제의 유병률이 증가함에 따라 음악 치료는 비약물적 개입으로 주목받고 있으며, 딥러닝 기법은 음악 감정 인식과 선호 예측에서 가능성을 보여주고 있습니다. 이 연구는 음악 유형 선호도를 효율적으로 식별하고 사용자 친숙도가 예측 정확도에 미치는 영향을 조사하기 위해 심층 신경망 모델(CNN+RNN/EEGNet)을 구축하였습니다. EEG 신호는 4채널 Muse S 웨어러블 기기를 사용해 수집했으며, 사용자 친숙도 점수를 입력 기능으로 사용했습니다. 연구는 준비, 실험 설계, 모델 구축, 결과 분석의 네 단계 워크플로우를 따랐습니다. 실험 설계에서는 음악을 록, 발라드, 포크로 분류하고, 각 범주별로 EEG 데이터와 친숙도 평가를 수집했습니다. 데이터는 CNN+RNN 또는 EEGNet 모델을 사용해 학습 및 테스트되었으며, 모델 성능은 피험자 수준 10배 교차 검증을 통해 평가되었습니다. 결과는 EEG 데이터만으로 모든 음악 유형을 예측했을 때 정확도가 82.28± 3.42%를 달성함을 보여주었습니다. 개별 음악 유형에서는 91.13± 3.60%(록), 91.83± 2.07%(발라드), 87.87± 4.76%(포크)였습니다. 사용자 친숙도를 특징으로 반영하고 다중 수준 평가 결과를 사용했을 때, 전체 예측 정확도는 94.94± 1.61%로 증가했으며, 개별 음악 유형의 정확도는 99.15± 1.56%(록), 98.51± 2.30%(발라드), 98.21± 2.60%(포크)에 달했습니다. 이 결과들은 친숙도 특성과 다단계 점수 체계를 결합하면 음악 선호도의 예측이 크게 향상된다는 것을 보여줍니다. 저렴한 착용형 Muse S EEG 기기를 사용하고 사용자 친숙도를 활용하여, 이 연구는 음악 유형 선호도를 인식하는 매우 효과적인 딥 뉴럴 네트워크 모델(CNN+RNN/EEGNet)을 성공적으로 개발했습니다. 연구 결과는 전체 및 개별 음악 유형 예측 모두에 친숙도 정보 포함이 혜택을 준다는 점을 보여주며, 개인화된 음악 추천과 음악 치료 응용에 이 접근법의 잠재력을 강조합니다.
음악은 인간 삶에서 중요한 역할을 하며, 온라인 플랫폼의 광범위한 사용으로 음악 감상이 일상적인 활동이 되었습니다. 오락을 넘어 음악은 이완을 촉진하고 통증을 줄이며 발달 장애를 가진 사람들을 지원하는 치료 도구로 기능합니다. 음악 선호는 치료 결과와 감정적 반응 모두에 직접적인 영향을 미칩니다. 이전 연구들은 선호하는 음악이 지구력과 전력 질주력 같은 신체 능력을 향상시키고, 스트레스와 통증을 줄여준다는 것을 보여줍니다. 또한 노인에게도 중요한 중재로, 개인의 선호가 치료 효과에 영향을 미친다 3,4. 선호하는 음악은 심박수와 호흡수를 낮추어 이완을 촉진하는 데도 효과가 있음이 밝혀졌습니다. 또한 음악 선호는 감정예측 정확도를 높이고, 감정 반응을 강화하며, 머신러닝 모델 성능을 향상시켜 예측 정확도를 53.18%에서 71.09%로 높입니다. 반복 노출은 초기 편향과 관계없이 선호도를 더욱 높여줍니다. 7.
이러한 발견에도 불구하고, 음악 선호도를 예측하는 기존 연구들은 표본 크기가 적고, 연령대가 좁으며, 사용자 친숙도에 대한 고려가 부족함에 의해 여전히 제한되고 있습니다. 이러한 한계는 모델 일반화 가능성과 실용적 적용성을 저하시킵니다. 익숙도와 같은 사용자 특화 요소를 반영하는 것은 예측 성능 향상을 위한 접근법으로는 아직 충분히 탐구되지 않았습니다.
음악 감정 인식(EMR)은 활발한 연구 분야가 되었으며, 그 정확도는 음악 선호도와 친숙도에 의해 영향을 받습니다 8,9,10,11. 참가자들은 친숙하고 선호하는 음악에 노출될 때 더 일관된 감정 평가를 제공하며, 익숙함이 증가하면 실험 및 교육 환경 모두에서 인식 정확도가 향상됩니다 12,13,14,15,16,17. 이 결과들은 친숙함이 감정 인식과 선호 예측 모두에서 중요한 요소임을 강조합니다.
인공 신경망을 기반으로 한 딥러닝은 고차원 특징을 자동으로 추출할 수 있게 하며, 얕은 모델보다 더 강한 패턴 인식을 보여줍니다 18,19,20. 딥러닝 기법은 장르 분류, 신호 인식, 맞춤형 추천 시스템 21,22,23,24,25,26 등 음악 관련 작업에도 널리 적용되어 왔습니다. 뇌파검사(EEG)는인지 및 정서 분석을 위해 주파수 대역에 걸쳐 뇌의 전기 활동을 측정하는 데 널리 사용됩니다(표 1). EEG와 딥러닝의 통합은 음악 선호에 대한 신경 반응을 포착하는 효과적인 틀을 제공합니다.
전통적인 EEG 시스템은 종종 젤 기반 전극과 고가의 장비가 필요해 실제 환경에서의 적용이 제한적입니다. 건조 전극을 가진 웨어러블 EEG 장치는 비용 절감, 사용성 향상, 유연성 향상을 제공하는 실용적인 대안을 제공합니다. Muse S 장치는 주요 뇌 영역(TP9, TP10, AF7, AF8)에서 256 Hz의 신호를 기록하여, 통제된 실험과 실제 응용 모두에서 신뢰할 수 있고 확장 가능한 데이터 수집을 가능하게 합니다.
본 연구는 EEG 신호와 사용자 친숙도 기능을 결합하여 딥러닝 모델을 사용해 음악 선호도를 예측함으로써 확인된 한계를 해결합니다. CNN+RNN과 EEGNet 아키텍처는 시간-주파수 특성과 시간적 의존성을 모두 추출하는 데 사용되어, 전통적인 접근법에 비해 EEG 신호의 표현을 개선할 수 있습니다. 이 연구는 두 가지 가설을 검증합니다: (1) 사용자 음악 친숙도가 EEG 기반 선호도 예측 정확도를 높인다; (2) 장르별 모델(록, 서정, 포크)이 혼합 카테고리에서 훈련된 모델보다 우수한 성능을 보입니다.
균형 잡힌 성별 분포를 가진 건강한 성인 30명 코호트가 포함되었습니다. 제한된 표본 크기와 4채널 EEG의 사용은 일반화와 신호 해상도를 제한하지만, 친숙도 기능을 딥러닝 모델과 통합하면 견고한 예측 성능을 가능하게 합니다. 목표는 음악 장르를 분류하고 각 카테고리별로 개별 예측을 수행하며, 사용자 친숙도를 기능으로 반영하여 예측 정확도를 높이는 것입니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 곡저우대학교 윤리위원회의 지침에 따라 수행되었습니다. 연구 프로토콜은 QZU-IRB-2026-037 승인을 받아 취저우 대학 기관심의위원회(IRB)에서 승인되었습니다. 모든 참가자는 연구에 포함되기 전에 사전 동의를 제공하였습니다.
실험 준비 및 참가자 모집
이 실험은 준비, 실험 설계, 모델 구축, 결과 분석의 네 단계로 구성되었습니다(그림 1). 준비 단계에서는 음악 치료, EEG 데이터 획득, 딥러닝 모델에 관한 문헌 검토를 바탕으로 연구 목표가 정의되었습니다. 실험 설계 단계에서는 30명의 건강한 참가자가 음악 듣기 과제를 수행하도록 모집되었습니다. EEG 신호와 음악 친숙도 평가가 기록되었습니다. EEG 데이터는 표준화되어 2048개의 샘플과 1024개의 샘플이 겹치는 창으로 분할되었습니다. 친숙도 특징은 EEG 데이터와 모델 입력으로 결합되었습니다. CNN+RNN과 EEGNet이라는 두 가지 모델이 제작되었습니다. CNN 계층은 시간-주파수 특징을 추출했고, 양방향 LSTM은 시간적 의존성을 포착했습니다. 분류에는 소프트맥스 활성화 함수가 있는 완전 연결 계층이 사용되었습니다. 모델은 Adam 최적화기를 사용해 30 에포크 동안 50개의 배치 크기로 학습되었습니다. 드롭아웃과 조기 정차가 적용되었습니다. 수행 능력은 주로 보고된 지표로 정확도를 사용해 평가했으며, 추가 평가를 위해 정확도, 회상률, F1 점수 지표도 계산되었습니다.
실험 환경 및 장비 설치
실험은 외부 간섭이 없는 조용하고 밀폐된 방에서 진행되었으며, 실내 온도는 27 도C로 유지되었습니다. 사용된 장비는 다음과 같습니다: 뇌파 장치(Muse S, InteraXon Inc.), 256 Hz 샘플링 속도를 가진 4채널 EEG 시스템(TP9, AF7, AF8, TP10); 최종 E3000 인이어 헤드폰; 그리고 Muse SDK와 Lab 스트리밍 레이어(LSL)를 실행하는 데이터 수집 컴퓨터가 있습니다.
각 실험 세션 전에 헤드폰의 귀 접촉면은 위생을 위해 알코올로 세척되어 교차 오염 위험을 줄였습니다. Muse S 헤드셋은 각 참가자에게 장착되어 네 개의 건식 전극(TP9, AF7, AF8, TP10) 모두와 피부 간 안정적인 접촉을 보장했습니다. 신호 품질이 좋지 않으면 헤드밴드 위치를 조정하여 안정적인 신호가 나올 때까지 조절했습니다. 참가자들은 등받이가 있는 편안한 의자에 앉아 눈을 감고 말을 피하며 실험 중 큰 신체 움직임을 최소화하라는 지시를 받았습니다.
음악 자극 준비
록, 서정적(발라드), 민속 음악 세 가지 장르가 준비되었다. 각 장르에는 세 곡의 중국어 노래가 포함되어 총 9곡이 포함되어 있습니다. 음악 친숙도의 차이를 조절하기 위해 각 장르의 노래는 다음 기준에 따라 선정되었습니다: 한 개의 오래된 노래; 현재 인기 있는 곡 한 곡(스포티파이 톱송 차트에서); 그리고 스포티파이 신곡 차트에서 신곡 한 곡을 선보였습니다.
각 노래는 도입부부터 시작해 벌스, 첫 후렴구에서 끝나는 표준화된 오디오 세그먼트로 편집되었으며, 총 길이는 90에서 130초 사이였습니다. 각 곡에는 고유 식별자(예: R1–R3, B1–B3, F1–F3)가 할당되어 이후 데이터 라벨링과 파일 관리를 위해 사용되었습니다.
실험 절차 및 설문지 기록
공식 실험 전에 테스트 오디오 클립을 재생하여 볼륨 테스트를 수행했습니다. 참가자들은 볼륨을 맑고 편안하며 지나치게 크지 않은 수준으로 조절하고, 실험 내내 일정하게 유지했습니다. 9곡의 재생 순서는 무작위화되었으며(예: 난수 표나 소프트웨어 무작위화 등) 순서 효과를 줄였습니다. 모든 참가자는 독립적으로 음악 듣기 과제를 완료했습니다. 각 음악 세그먼트는 도입부부터 첫 후렴까지 90에서 130초 동안 진행되었습니다. 노래 사이에는 30초간의 휴식 시간이 제공되었습니다. 이 기간 동안 참가자들은 온라인 플랫폼(Questionnaire Star)을 이용한 친숙도 설문지를 작성했습니다. 참가자들은 각 노래에 대한 친숙도를 5점 리커트 척도(1 = 완전히 낯설다; 5 = 매우 친숙함)로 평가했습니다. 참가자의 각 노래에 대한 선호 라벨(0 = 싫어함, 1 = 좋아함)은 미리 정의된 이진 분류 체계에 따라 기록되었습니다. 전체 실험 절차는 그림 2에 나와 있습니다.
EEG 획득 및 데이터 로깅
EEG 데이터는 공식 Muse SDK를 사용하여 수집되었으며, Lab Streaming Layer(LSL)를 통해 스트리밍되었습니다. 각 곡에 대응하는 EEG 데이터는 최소 다음 필드를 포함하는 쉼표 분리값(CSV) 파일로 저장되었습니다: 타임스탬프(밀리초); 네 개 채널(TP9, AF7, AF8, TP10)에서 나오는 원시 EEG 신호; 수작업으로 기록한 친숙도 점수(1–5); 그리고 선호 표시(0/1). 일관된 파일 이름 규칙(예: S01_R1.csv, 참가자 01과 록 송 1을 표시)이 사용되어 자동 처리와 추적을 촉진했습니다.
데이터 전처리, 정규화 및 윈도우
뇌파 신호는 256 Hz 샘플링 속도의 Muse S 4채널 EEG 장치를 사용해 기록되었으며, 공식 개발 키트를 사용해 맞춤형 프로그램이 개발되었습니다. 원시 EEG 데이터는 Lab Streaming Layer(LSL)를 통해 수집되어 CSV 형식으로 저장되었습니다. CSV 파일에는 다음 열이 포함되어 있습니다: 타임스탬프(밀리초), 4채널 EEG 값(TP9, AF7, AF8, TP10), 사용자 음악 친숙도 평가(1–5), 그리고 사용자 음악 선호도 평가.
총 데이터 항목 수는 각 참가자와 각 음악 작품에 대해 생성된 여러 창에 해당하며, 창 방식에 따라 대규모 데이터셋을 형성합니다. 원래 실험에서는 음악 선호도를 이진 라벨(0 = 싫어, 1 = 좋아함)로 표현했는데, 이는 인위적으로 높은 정확도와 제한된 모델 일반화로 이어질 수 있습니다.
예측 과제의 실질적 유의성을 높이기 위해 선호 라벨을 다단계 평가 척도로 변환했습니다: 0 = 강하게 반대; 1 = 동의하지 않음; 2 = 중립; 3 = 동의; 4 = 강력히 동의합니다.
머신러닝 이전에는 데이터가 표준화되어 각 창마다 2048개의 샘플로 분할되었으며, 시간적 연속성을 유지하기 위해 인접한 창들 사이에 1024개의 샘플이 겹쳐졌습니다. 또한 데이터 증강을 적용하여 훈련 샘플 수를 늘리고 과적합 위험을 줄였습니다.
모델 아키텍처
연구 모델은 세 개의 합성곱 층, 세 개의 풀링 계층, 그리고 완전 연결된 층으로 구성되었습니다. 최대 풀링은 특징 선택에 사용되었고, 드롭아웃은 과적합을 줄이기 위해 적용되었으며, 최종 출력은 소프트맥스 분류 계층을 사용해 생성되었습니다. 각 입력 창에는 4채널 EEG 신호(창당 2048개 샘플)와 친숙도 기능이 포함되어 있었습니다. 결과물은 5개 클래스 선호 등급을 나타냈습니다. 아키텍처는 그림 3에 나타나 있으며, 모델 매개변수는 표 2에 설명되어 있습니다.
모델 훈련 및 교차 검증
데이터셋은 무작위로 80%가 훈련용, 20%가 테스트용으로 나뉘었습니다. 10배 교차 검증이 적용되었으며, 각 반복마다 한 부분은 검증에, 나머지 9개는 학습에 사용되었습니다. 이 과정은 10번 반복되었고, 결과를 집계했습니다. 훈련 하이퍼파라미터는 다음과 같이 설정되었습니다: Epochs = 30; 배치 크기 = 50; 옵티마이저 = 아담; 손실 함수 = 범주적 교차엔트로피; 평가 지표 = 정확도. 모델 수행은 EEG 단독 및 EEG + 친숙도 조건 하에서 모든 장르 합산 및 개별 장르 모두에서 기록되었습니다.
통계 분석 방법
데이터 분석은 Python 3.10과 TensorFlow 2.12, Keras 2.12, MNE-Python 1.3을 사용하여 수행되었습니다. 데이터 처리 및 분석은 Pandas 2.1과 NumPy 1.26을 사용하여 수행되었습니다. 10배 교차 검증에서 나온 성과 지표를 집계하고, 평균 및 표준편차 값을 산출하였습니다. 조건 간 통계적 비교는 쌍 t검정 또는 Wilcoxon 부호 순위 검정을 사용하여 수행되었으며, 유의수준은 P < 0.05였습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
모델 성능은 두 가지 조건에서 평가되었습니다: (1) EEG 특징만, (2) EEG 특징과 음악 친숙함이 결합된 경우. 분류는 결합된 음악 부문과 개별 음악 부문(록, 서정, 포크) 모두에 대해 수행되었습니다.
표 3은 EEG 특징만을 사용하여 얻은 결과를 제시하고, 표 4는 EEG 기능과 친숙함을 결합해 얻은 결과를 제시합니다. CNN+RNN과 EEGNet 모델 모두 이러한 조건에서 평가되었으며, EEGNet이 전반적으로 우수한 성능을 이유로 최종 모델로 선정되었습니다.
EEG 기능만 사용하면(표 3, 그림 4) 모든 음악 카테고리에서 전체 정확도는 82.28%± 3.42%를 달성했습니다. 별도로 평가했을 때, 록 음악은 91.13% ± 3.60%, 서정 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
EEG 기반 음악 선호 예측에 대한 이전 연구들은 주로 다중 채널 시스템에 의존해 실용적 적용이 제한되어 있습니다 21,22,23,24,25,26. 본 연구에서는 4채널 웨어러블 EEG 장치(Muse S)가 딥러닝 모델과 친숙도 기능과 결합했을 때 유사한 성능을 보이며 보다 실용적이고 확장 가능한 접근법을 입증했습니다.
결과는 EEG 신호와 사용자 친숙도를 통합하면 모든 음악 분야에서 예측 정확도가 크게 향상된다는 것을 보여줍니다. 이 발견은 음악 선호가 신경 반응뿐만 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자는 이해 상충을 공개할 필요가 없습니다.
저자는 이 연구 과정에서 연구 기관이 제공한 지원과 편의에 깊이 감사드립니다. 기술 절차에 도움을 주신 실험실 직원분들께 특별히 감사드립니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 알코올 물티슈 | 표준 공급업체 | 해당 없음 | 참가자 간 헤드폰 청소에 사용됩니다 |
| 데이터 수집 컴퓨터 | 표준 제조사 | 해당 없음 | Muse SDK와 Lab 스트리밍 레이어(LSL) 실행 |
| EEG 헤드셋 (뮤즈 S) | 인터아크슨 주식회사 | https://choosemuse.com/muse-s/ | 4채널 웨어러블 EEG 기기 (TP9, AF7, AF8, TP10) |
| 최종 E3000 인이어 헤드폰 | 최종 오디오 디자인 | https://snext-final.com/en/products/detail/E3000 | 실험 중 오디오 재생에 사용됨 |
| Lab 스트리밍 레이어(LSL) 소프트웨어 | 오픈 소스 | https://github.com/sccn/labstreaminglayer | EEG 데이터 스트리밍에 사용 |
| 뮤즈 SDK | 인터아크슨 주식회사 | https://developer.choosemuse.com/ | EEG 데이터 수집에 사용 |
| 설문지 스타 (온라인 플랫폼) | 창사 란싱 정보기술유한회사. | https://www.wjx.cn/ | 친숙도 데이터 수집에 사용됨 |
| 파이썬 3.10 | 파이썬 소프트웨어 재단 | https://www.python.org/downloads/ | 데이터 처리 및 분석에 사용됨 |
| 텐서플로우 2.12 | 구글 | https://www.tensorflow.org/ | 딥러닝 프레임워크 |
| 케라스 2.12 | 구글 | https://keras.io/ | 신경망 API |
| MNE-Python 1.3 | 오픈 소스 | https://mne.tools/stable/index.html | EEG 데이터 분석 |
| NumPy 1.26 | 오픈 소스 | https://numpy.org/ | 수치 계산 |
| 판다스 2.1 | 오픈 소스 | https://pandas.pydata.org/ | 데이터 조작 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청