方法論記事

XGBoostに基づく病理的音声認識の研究

DOI:

10.3791/68784

2026年5月29日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ここでは、ザールブリュッケンデータベースを用いて声帯ポリープを診断するための非侵襲的なXGBoostベースのAIモデルを構築するプロトコルを紹介します。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人間の社会的コミュニケーションが継続的に発展する中で、声障害に苦しむ人々の数も増加しています。病的音声検出法の客観的かつ非侵襲的な利点により、音声信号解析を用いた病的音声認識は研究のホットスポットとなっています。本記事はまず、ドイツのSVDデータベースから101の連続母音/a/を研究対象として選びました。次に、ウェーブレットパケット技術を用いた時間-周波数解析を用いて、サブ信号から近似エントロピー、サンプルエントロピー、ファジィエントロピー、置換エントロピーの4つの非線形動的パラメータを、病的音声分類器の特徴パラメータセットとして抽出します。最後に、パターン認識手法として機械学習アルゴリズムXGBoostが選定され、病的音声分類器を確立し、5重交叉検証とROC曲線を用いて分類性能が検証されます。実験結果により、XGBoostの病的音声分類器の精度は0.857、F1スコアは0.875、AUC値は0.944であり、いずれもSVMが構築した分類器よりも高いことを示しています。これはXGBoostの病的音声認識において優れた性能を示しています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

声の障害に苦しむ人の数は絶えず増加しています。統計によると、人口の3分の1が人生のどこかで声の問題を経験しています。歌手や教師などのプロの声楽使用者は、声の頻繁な誤用や乱用のために喉の病気の発生率が高いです。天津とウルムチの教師を対象に2つの調査が行われ、声障害に苦しむ確率はそれぞれ33.81%と28.23%で、2.3でした。その結果、臨床実践において病理学的声の検出と診断にますます注目が集まっています。現在、主観的評価法、喉頭鏡検査、音響検出法が主に臨床実践における声疾患の診断に用いられています。音響検出法は音声信号をデジタル信号に変換し、研究のために客観性を確保し、検査中の患者の痛みを回避します6.したがって、音響検知は臨床診断における医師の効果的な補助ツールとなり、研究も増加しています。

音響解析手法を用いた病的な声の診断において最も重要な技術は特徴抽出とパターン認識です。1960年代以降、研究者たちは病的声の研究のために伝統的な音響パラメータを抽出し、基本周波数摂動、振幅摂動、メル周波数セプストラル係数(MFCC)など、多くの効果的かつ堅牢な音響特徴パラメータを発見しています。近年、研究者たちは従来の音響特性パラメータの研究にとどまらず、非線形動的パラメータも病理的音声認識の分野で利用され始めています。また、非常に良い効果もあります。機械学習の急速な発展により、高速かつ優れた分類性能を持つパターン認識手法が増えています。また、サポートベクターマシン(SVM)、ランダムフォレスト、ニューラルネットワーク、ディープラーニングなど、病的音声認識で使われるパターン認識手法も増えています。XGBoostは近年注目を集めているパターン認識手法です。特徴正規化は不要で、自然に特徴を選択できます。さまざまな損失関数に適応でき、過学習を防ぐために正則化項を用います。高速、携帯性、フォールトトレランスという特徴を持っています。したがって、本記事では、より良い認識結果を得るために、XGBoost手法を病理的な音声認識に適用しようと試みます。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究の技術的なワークフローは 図1に示されています。

1. 音声サンプルの取得

  1. 実験データの出典はドイツのSVDからです。12.
  2. 母音/a/音声データ101例を取得し、そのうち45例(男性19名、女性26名)が声帯ポリープ患者、56例(男性28名、女性28名)が正常な個体です。

2. 音声データのウェーブレットパケット分解13

  1. ソフトウェアMATLAB R2023aを用いて、3つのドーベシーウェーブレット(db1, 3, 5)と3つの分解深度(4, 6, 8レベル)を網羅的に検索します。
  2. 16 kHzのサンプリングレート、4レベルのdb3ウェーブレットパケット分解(WPD)を用いて音声信号を16のサブバンド(それぞれ500 Hz解像度)に分割します(図2)。

3. 特徴パラメータ抽出

  1. Python 3.10によって4レベルWPDで得られた16の部分バンドから離散係数列を抽出し、以下で説明するすべてのエントロピー方程式の入力値として機能します。
    注:本研究で使用されたすべての方程式は、以前に発表されたアルゴリズム(r次など)から導出されており、独立して導出されたものではありません。
  2. 14以下の式を用いて16のWPDサブバンド配列の近似エントロピーを計算します。
    figure-protocol-1(1)
    figure-protocol-2(2)
    Cim (r)={d[X(i), X(j)]パラメータ:パターン次元 m は 2 として選び、類似許容範囲 r は標準偏差14 の 0.1 から 0.25 倍に選ばれます。
  3. 16のWPDサブバンド配列のサンプルエントロピーは、15以下の式を用いて計算します。
    figure-protocol-3(4)
    figure-protocol-4(5)
    Bim (r) = {d[X(i), X(j)]パラメータ:パターン次元 m は 1 または 2 として選び、類似度許容範囲 r は標準偏差15 の 0.1 から 0.25 倍として選ばれます。
  4. 16以下の式でファジィメンバーシップ関数を計算します:
    figure-protocol-5(7)
  5. ファジィエントロピーは17以下の式で計算します:
    figure-protocol-6(8)
    figure-protocol-7(9)
    figure-protocol-8(10)
    パラメータ:パターン次元 m は 2 として選び、類似許容度 r は標準偏差の0.15倍として選ばれます。
  6. 置換エントロピーは18以下の式で計算します。
    figure-protocol-9(11)
    パラメータ:パターン次元 m は 6 として選ばれ、置換エントロピー抽出のために時間遅延 L = 2 が最終的に決定されました。

4. モデル設立

  1. 正常な声帯ポリープ患者と声帯ポリープ患者の音声サンプルを、トレーニングデータセットとテストデータセットに8:2の比率で分けます。
  2. トレーニングデータセットをパラメータチューニングとモデルトレーニングに使い、その結果得られた分類器をテストデータセットに適用して疾病分類を行います。
  3. Python 3.10を使ってSVMモデリング手順を実行します。
    1. SVMカーネル性能を比較してデータの非線形性を確認しましょう。線形核を用いた初期のテストでは精度が低かったのに対し、放射基底関数(RBF)核は分類結果を大幅に改善し、特徴空間が非線形決定境界を必要とすることを示しました。
    2. 16次元エントロピー特徴ベクトル(WPDで抽出)をSVM分類器の入力として使用してください。非線形音声特徴を高次元空間にマッピングするRBFカーネルを実装します。
    3. Python(scikit-learn)を使ってグリッドサーチを行い、訓練段階でペナルティ係数Cとカーネル幅γの最適の組み合わせを特定します。各パラメータセットを、クロスバリデーション認識率を最大化して評価します。
    4. 正常な患者および声帯ポリープ患者の声サンプルを用いてSVMモデルを訓練します。グリッド探索から得られる最適なハイパーパラメータを用いて最終的な訓練済みモデルを構築します。
    5. 訓練済みのモデルを見えないテストサンプルに適用します。各テストサンプルは、トレーニングデータと同じWPDおよびエントロピー抽出手順を経ます。SVMは、テスト特徴ベクトルの空間的位置と最適化された決定境界の相対に基づいて、二値クラスラベル(正常ポリープと声帯ポリープ)を予測します。
  4. Python 3.10を使ってXGBoostモデリング手順を実行します。
    1. トレーニングフェーズ中に、学習速度や木の深さを含む主要なハイパーパラメータを最適化するために、Pythonベースのグリッド検索を活用しましょう。複数のパラメータの組み合わせをクロスバリデーションで評価し、分類精度を最大化する構成を特定します。
    2. 音声サンプルから抽出された16のエントロピー特徴を使って、二進XGBoost分類器を訓練します。グリッド探索から得られた最適なハイパーパラメータを適用して最終モデルを構築します。
    3. 未確認サンプルからなる独立した検証セット上で訓練済みモデルをテストします。このステップでは、訓練中に使用されなかったデータに対する分類器の性能を評価することで、分類器の一般化能力を評価します。

5. モデル性能の評価

  1. 5回のクロスバリデーション手法を実施します。
    1. 前処理された音声データセットをランダムに5つの等しい分割に分割します。4つのフォールドをトレーニングセットとしてモデルを構築し、残りの1つのフォールドをパフォーマンス評価の検証セットとして使います。
    2. このプロセスを5回繰り返します。5回の反復の結果の平均を最終的なモデル性能として用いてください。
  2. 混乱行列を取得します。
    1. 分類器の予測ラベルと、5重クロス検証結果に基づくすべてのテストサンプルのグラウンドトゥルースラベルを比較して混乱行列を生成します。これらの個別比較をPythonのscikit-learnライブラリを使ってコンティンジェンシーテーブルに集約し、 表1に示すように正しい分類と誤った分類を定量化します。
  3. 分類モデルの有効性を説明するために、精度、精度、感度、F1スコアを計算します。関連する計算式は以下の通りです。
    命中率 = (TP + TN)/(TP + TN + FP + FN)
    精度 = TP/(TP + FP)
    感度 = リコール = TPR = TP/(TP+ FN)
    F1 = (2 × 精度×リコール)/ (精度 + リコール)
    注:これらの指標(TP、TN、FP、FN)は混同行列の要素から導出されました。
  4. ROC曲線をAUCで記述します。
    1. ROC曲線をプロットし、すべての分類閾値における真陽性率(TPR)と偽陽性率(FPR)のトレードオフを可視化します。曲線下面積(AUC)を要約指標として計算し、モデル全体の識別能力を定量化します。
      注:AUC値が1に近いほど、分類器が正常な個体と声帯ポリープを持つ個体を正しく区別する確率が高いことを示します。これは特定の判断閾値に依存しません。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究では、ウェーブレットパケット解析を用いて音声信号の時間周波数分解を行いました。近似エントロピー、サンプルエントロピー、ファジィエントロピー、置換エントロピーなどの非線形動的パラメータを統合することで、声帯ポリープに関連する病的声の複雑さと不規則性の特徴を体系的に特徴付けました。その後、サポートベクターマシン(SVM)アルゴリズムとXGBoostアルゴリズムに基づく2つの病的音声分類器が構築されました。グリッドサーチ手法を用いることで、各モデルの最適なパラメータ構成が特定されました(表 2に詳述)。

図3の5分割交差検証結果に示されているように、SVMベースの分類器の評価指標は顕著な変動を示したのに対し、XGBoostベースの分類器は比較的安定しており、XGBoostアルゴリズムに基づく病的音声分類器の方がより安定した認識性能を実現していることを示しています。

<...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

音声信号解析を用いた病理的音声診断は、非侵襲的かつ客観的なアプローチを示しています19。その結果、病的な音声分類は音声信号処理および認識における重要な研究焦点として浮上し、臨床応用の価値と開発の見通しを示しています20。本研究では、SVDから収集した音声サンプルを実験コーパスとして用いました。音声信号処理と機械学習技術を通じて、病的な音声分類器が確立されました。

局所信号特性の保存を確保するため、ウェーブレットパケット変換が時間・周波数解析に採用され、異なる周波数帯域にわたる特徴パラメータの正確な抽出が可能となりました。さらに、ウェーブレット基底関数も体系的に評価され、db3は4レベルWPDに選ばれました。従来の音響パラメータから離れ、本研究は近似エントロピー、サンプルエントロピー、ファジィエントロピー、置換エントロピーの4つの非線形動的パラメータを取り入れ、声信号の時系列の複雑さを定量化し、内在する非線

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは競合する利害関係がないと宣言しています。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この作業は江蘇省病院能力向上プロジェクト(JSPH-MC-2023-12)の支援を受けました。著者らは、南京航空宇宙大学経済経営学部のシャン・リー准教授および教育部脳機械知能技術重点研究所のスタッフの皆様に、方法論、データ解析、図形生成に関する指導に感謝申し上げます。これらの貢献により、本研究の円滑な進展が実現しました。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
MATLAB ザ・マスワークスR2023a数値計算およびアルゴリズムプロトタイピングのための主要なソフトウェアプラットフォーム。
PythonソフトウェアPythonソフトウェア財団Python 3.10研究全体で使用されたコアプログラミング言語。
ザールブリュッケン音声データベース、SVDザールラント大学音声学研究所ザールブルムル;ckenボイスデータベース(SVD)病理的および正常な音声記録の公開データベース。声帯ポリープを含む疾患を持つ被験者および健康な対照群の持続母音および連続発話を含みます。指定されたアクセス条件のもとで学術研究に使用されます。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

XGBoost 5 ROC

関連記事