방법 논문

XGBoost 기반 병리학적 음성 인식 연구

DOI:

10.3791/68784

2026년 5월 29일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

여기서는 Saarbrücken 데이터베이스를 이용해 성대 용종을 진단하기 위한 비침습적 XGBoost 기반 AI 모델을 구축하는 프로토콜을 제시합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

인간의 사회적 소통이 지속적으로 성장함에 따라 음성 장애를 겪는 사람들의 수도 증가하고 있습니다. 병리학적 음성에 대한 음향 탐지 방법의 객관적이고 비침습적인 이점 덕분에, 병리적 음성 인식을 위한 음성 신호 분석의 활용은 연구 중심지가 되었습니다. 이 논문은 먼저 독일 SVD 데이터베이스에서 101개의 연속 모음 /a/를 연구 대상으로 선정했습니다. 둘째, 웨이블릿 패킷 기술을 사용해 시간-주파수 분석을 수행하여, 병적 음성 분류기의 특징 매개변수 집합으로 하위 신호에서 네 가지 비선형 동적 매개변수(근사 엔트로피, 샘플 엔트로피, 퍼지 엔트로피, 순열 엔트로피)를 추출합니다. 마지막으로, 병적인 음성 분류기를 구축하기 위해 머신러닝 알고리즘 XGBoost가 패턴 인식 방법으로 선택되었으며, 분류 성능은 5중 교차 검증과 ROC 곡선을 통해 검증되었습니다. 실험 결과, XGBoost의 병리적 음성 분류기의 정확도는 0.857, F1 점수는 0.875, AUC 값은 0.944로, 모두 SVM이 만든 분류기보다 높다는 것을 보여주어 XGBoost가 병리적 음성 인식에서 더 우수한 성능을 보인다는 것을 보여줍니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

음성 장애를 겪는 사람들의 수는 끊임없이 증가하고 있습니다. 통계에 따르면, 인구의 3분의 1이 인생의 어느 시점에서 음성 문제를 경험합니다.1. 가수나 교사와 같은 전문 음성 사용자들은 목소리를 자주 오용하고 남용하기 때문에 목 질환 발생률이 더 높습니다. 톈진과 우루무치의 교사들을 대상으로 한 두 연구의 설문조사 결과, 음성 장애를 겪을 확률은 각각 33.81%와 28.23%로 2.3%로 나타났다. 그 결과, 임상 실무에서 병리학적 목소리의 발견과 진단에 대한 중요성이 점점 커지고 있습니다. 현재임상 실무에서 음성 질환 진단에는 주관적 평가법, 후두경 검사, 음향 검출법이 주로 사용되고 있습니다. 음향 감지 방법은 음성 신호를 디지털 신호로 변환하여 연구를 위해 객관성을 확보하고 환자 통증을 방지합니다6. 따라서 음향 탐지는 임상 진단에서 의사들의 효과적인 보조 도구가 되었으며, 이에 대한 연구가 증가하고 있습니다.

음향 분석 방법을 이용해 병리적 목소리를 진단하는 데 가장 중요한 기법은 특징 추출과 패턴 인식입니다. 1960년대 이후 연구자들은 병리적 음성 연구를 위해 전통적인 음향 매개변수를 추출해 왔으며, 기본 주파수 섭동, 진폭 섭동, 멜 주파수 셉스트럴 계수(MFCC)와 같은 효과적이고 견고한 음향 특징 매개변수를 많이 발견했습니다. 최근 몇 년간 연구자들은 전통적인 음향 특성 매개변수 연구에만 국한하지 않고, 비선형 동적 매개변수도 병리학적 음성 인식 분야에서도 사용하기 시작했습니다. 효과도 매우 좋습니다. 머신러닝의 급속한 발전과 함께 빠른 실행 속도와 우수한 분류 성능을 가진 패턴 인식 기법들이 더 많이 등장했습니다. 또한 병리적 음성 인식에서 사용되는 패턴 인식 기법도 점점 더 많아지고 있는데, 예를 들어 지원 벡터 기계(SVM), 랜덤 포레스트, 신경망, 딥러닝 9,10. XGBoost는최근 몇 년간 주목받고 있는 패턴 인식 기법입니다. 특징 정규화가 필요 없으며 스스로 특징을 선택할 수 있습니다. 다양한 손실 함수에 적응할 수 있으며, 과적합을 방지하기 위해 정규화 항을 사용합니다. 빠른 속도, 휴대성, 내결함성 등의 특성을 가지고 있습니다. 따라서 본 글에서는 더 나은 인식 결과를 얻기 위해 XGBoost 방법을 병적인 음성 인식에 적용하고자 합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구의 기술적 워크플로우는 그림 1에 나와 있습니다.

1. 음성 샘플 획득

  1. 독일 SVD의 실험 데이터 출처12.
  2. 모음 /a/ 음성 데이터 101건을 얻으며, 이 중 45건(남성 19명, 여성 26명)은 성대 용종 환자, 56건(남성 28명, 여성 28명)은 정상인입니다.

2. 음성 데이터의 웨이블릿 패킷 분해13

  1. MATLAB R2023a 소프트웨어를 사용하여 세 개의 도베시스 웨이브릿(db1, 3, 5)과 세 가지 분해 깊이(4, 6, 8 레벨)에 대해 포괄적인 탐색을 수행하세요.
  2. 16 kHz 샘플링 속도, 4레벨 db3 웨이블릿 패킷 분해(WPD)를 사용하여 음성 신호를 16개의 서브밴드(각각 500 Hz 해상도)로 나눕니다(그림 2).

3. 특징 매개변수 추출

  1. Python 3.10에서 4레벨 WPD를 통해 얻은 16개의 하위 밴드에서 이산 계수 수열을 추출하며, 아래에 설명하는 모든 엔트로피 방정식의 입력값으로 사용됩니다.
    참고: 본 연구에서 사용된 모든 방정식은 이전에 발표된 알고리즘(r의참조)에서 도출되었으며, 독립적으로 도출된 것이 아닙니다.
  2. 14 아래 공식을 사용하여 16개의 WPD 서브밴드 서열에 대한 대략적인 엔트로피를 계산합니다:
    figure-protocol-1(1)
    figure-protocol-2(2)
    Cim (r)={d[X(i), X(j)]매개변수: 패턴 차원 m은 2로 선택되고, 유사도 허용 차는 표준편차14의 0.1에서 0.25로 선택됩니다.
  3. 15미만의 공식을 사용하여 16개의 WPD 서브밴드 서열에 대한 샘플 엔트로피를 계산합니다:
    figure-protocol-3(4)
    figure-protocol-4(5)
    Bim (r) = {d[X(i), X(j)]매개변수: 패턴 차원 m은 1 또는 2로 선택되며, 유사도 허용 오차 r은 표준편차15의 0.1에서 0.25로 선택됩니다.
  4. 16 미만의 공식으로 퍼지 소속 함수를 계산합니다:
    figure-protocol-5(7)
  5. 퍼지 엔트로피는17 미만의 공식으로 계산합니다:
    figure-protocol-6(8)
    figure-protocol-7(9)
    figure-protocol-8(10)
    매개변수: 패턴 차원 m은 2로 선택되며, 유사도 허용오차 r은 표준편차의 0.15배로 선택됩니다.
  6. 18 미만의 공식으로 순열 엔트로피를 계산하라:
    figure-protocol-9(11)
    매개변수: 패턴 차원 m은 6으로 선택되었고, 순열 엔트로피 추출을 위해 시간 지연 L = 2가 최종적으로 결정되었습니다.

4. 모델 설립

  1. 정상 환자와 성대 폴립 환자의 음성 샘플을 8:2 비율로 훈련 데이터셋과 테스트 데이터셋으로 나눕니다.
  2. 훈련 데이터셋을 매개변수 튜닝과 모델 훈련에 사용하고, 그 결과 분류기를 질병 분류를 위해 테스트 데이터셋에 적용합니다.
  3. Python 3.10을 사용하여 SVM 모델링 절차를 수행하세요.
    1. SVM 커널 성능을 비교하여 데이터의 비선형성을 확인하세요. 선형 커널을 사용한 초기 테스트는 정확도가 낮았으나, 방사형 기저 함수(RBF) 커널은 분류 결과를 크게 개선하여 특징 공간이 비선형 결정 경계를 필요로 함을 보여준다.
    2. 16차원 엔트로피 특징 벡터(WPD를 통해 추출됨)를 SVM 분류기의 입력으로 사용하세요. 비선형 음성 특징들을 고차원 공간에 매핑하는 RBF 커널을 구현하세요.
    3. Python(scikit-learn)을 사용해 훈련 단계에서 페널티 계수 C와 커널 폭 γ의 최적 조합을 찾기 위해 그리드 검색을 수행하세요. 각 매개변수 집합을 교차 검증 인식률을 최대화하여 평가합니다.
    4. 정상인과 성대 폴립 환자의 음성 샘플을 사용하여 SVM 모델을 훈련합니다. 그리드 탐색에서 얻은 최적의 하이퍼파라미터를 사용해 최종 학습 모델을 구성합니다.
    5. 훈련된 모델을 보이지 않는 테스트 샘플에 적용합니다. 각 테스트 샘플은 훈련 데이터와 동일한 WPD 및 엔트로피 추출 절차를 거칩니다. SVM은 최적화된 결정 경계에 대한 테스트 특징 벡터의 공간 위치를 바탕으로 이진 클래스 라벨(정상 폴립 대 성대 용종)을 예측합니다.
  4. Python 3.10을 사용하여 XGBoost 모델링 절차를 수행하세요.
    1. 훈련 단계에서 학습 속도와 트리 깊이 등 주요 하이퍼파라미터를 최적화하기 위해 Python 기반 그리드 검색을 사용하세요. 교차 검증을 통해 여러 매개변수 조합을 평가하여 분류 정확도를 극대화하는 구성을 식별합니다.
    2. 음성 샘플에서 추출한 16가지 엔트로피 특징을 사용하여 이진 XGBoost 분류기를 학습합니다. 그리드 탐색에서 얻은 최적 하이퍼파라미터를 적용하여 최종 모델을 구성합니다.
    3. 보이지 않는 샘플로 구성된 독립 검증 세트에서 학습된 모델을 테스트합니다. 이 단계는 훈련 중에 사용하지 않은 데이터에 대한 분류기의 성능을 평가하여 일반화 능력을 평가합니다.

5. 모델 성능 평가

  1. 5중 교차 검증 방식을 수행하세요.
    1. 사전 처리된 음성 데이터셋을 무작위로 다섯 개의 동일한 분할로 나누세요. 네 가지 폴드를 훈련 세트로 사용해 모델을 구성하고, 나머지 한 폴드를 성과 평가의 검증 세트로 사용하세요.
    2. 이 과정을 다섯 번 반복하세요. 다섯 번의 반복 결과 평균을 최종 모델 성능으로 사용하세요.
  2. 혼동 행렬을 얻으세요.
    1. 분류기의 예측 라벨과 모든 테스트 샘플의 진실(ground truth) 라벨을 5배 교차 검증 결과에 따라 비교하여 혼동 행렬을 생성합니다. Python scikit-learn 라이브러리를 사용하여 이 개별 비교를 집계하여 올바른 분류와 잘못된 분류를 정량화하는 표 1에 나타난 것입니다.
  3. 분류 모델의 효과를 설명하기 위해 정확도, 정밀도, 민감도, F1 점수를 계산하세요. 관련 계산 공식은 다음과 같습니다.
    정확도 = (TP + TN)/(TP + TN + FP + FN)
    정밀도 = TP/(TP + FP)
    민감도 = 회상 = TPR = TP/(TP+ FN)
    F1 = (2 × 정밀도 × 호출)/ (정밀도 + 호출)
    참고: 이 지표들(TP, TN, FP, FN)은 혼동 행렬의 요소들에서 도출되었습니다.
  4. AUC를 가진 ROC 곡선을 설명하세요.
    1. ROC 곡선을 그려 모든 분류 임계값에서 진양성률(TPR)과 거짓양성률(FPR) 간의 상충관계를 시각화합니다. 모델의 전체 판별 능력을 정량화하기 위해 곡선 면적(AUC)을 요약 지표로 계산합니다.
      참고: AUC 값이 1에 가까울수록 분류기가 정상인과 성대 용종자를 올바르게 구별할 확률이 높으며, 이는 특정 결정 임계값과 무관합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구에서는 웨이블릿 패킷 분석을 사용하여 음성 신호의 시빈도 분해를 수행하였습니다. 근사 엔트로피, 샘플 엔트로피, 퍼지 엔트로피, 순열 엔트로피 등 비선형 동적 매개변수를 통합함으로써, 성대 폴립과 관련된 병리적 음성의 복잡성과 불규칙성 특성을 체계적으로 특성화하였습니다. 이후 각각 지지 벡터 기계(SVM) 알고리즘과 XGBoost 알고리즘을 기반으로 두 가지 병적인 음성 분류기가 구축되었습니다. 그리드 탐색 방식을 사용하여 각 모델의 최적 매개변수 구성을 표 2에 자세히 설명하였습니다.

그림 3의 5중 교차 검증 결과에서 보듯, SVM 기반 분류기의 평가 지표는 뚜렷한 변동을 보인 반면, XGBoost 기반 분류기의 평가는 비교적 안정적이었으며, 이는 XGBoost 알고리즘 기반의 병적 음성 분류기가 더 안정적인 인식 성능을 달성...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

음성 신호 분석을 이용한 병리적 음성 진단은 비침습적이고 객관적인 접근법입니다19. 따라서 병리적 음성 분류는 음성 신호 처리 및 인식 분야에서 중요한 연구 초점으로 부상했으며, 상당한 임상 적용 가치와 발달 전망을 입증하고 있습니다20. 이 연구는 SVD에서 수집한 음성 샘플을 실험 코퍼스로 사용했습니다. 음성 신호 처리와 머신러닝 기법을 통해 병리적 음성 분류기가 확립되었습니다.

국부 신호 특성을 보존하기 위해 웨이블릿 패킷 변환이 시빈도 분석에 채택되어 다양한 주파수 대역에서 특징 매개변수를 정밀하게 추출할 수 있게 되었습니다. 더 나아가, 웨이브렛 기저 함수가 체계적으로 평가되었으며, db3는 4차 WPD에 선택되었습니다. 기존의 음향 매개변수에서 벗어나, 본 연구는 근사 엔트로피, 샘플 엔트로피, 퍼지 엔트로피, 순열 엔트로피...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 서로 상충하는 이해관계가 없다고 선언한다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 작업은 장쑤성 병원 역량 향상 프로젝트(JSPH-MC-2023-12)의 지원을 받았습니다. 저자들은 난징항공우주대학교 경제경영대학의 샨 리 부교수와 교육부 뇌기계지능기술중기관 핵심연구소 직원들에게 방법론, 데이터 분석, 도형 생성에 대한 지도에 감사드립니다. 이러한 기여 덕분에 연구가 원활히 진행될 수 있었습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
MATLAB 더 매스웍스R2023a수치 계산 및 알고리즘 프로토타이핑을 위한 주요 소프트웨어 플랫폼입니다.
파이썬 소프트웨어파이썬 소프트웨어 재단파이썬 3.10연구 전반에 걸쳐 사용된 핵심 프로그래밍 언어.
자르브뤼켄 음성 데이터베이스, SVD자를란트 대학교 음성학 연구소사르브르우움; 켄 보이스 데이터베이스 (SVD)병리학적 및 정상 음성 녹음의 공개 데이터베이스입니다. 성대 용종 등 질환을 가진 피험자와 건강한 대조군의 지속 모음과 연속 말화를 포함합니다. 지정된 접근 조건 하에 학술 연구에 사용됩니다.

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

XGBoost5ROC

관련 논문