Методическая статья

Исследования патологического распознавания голоса на основе XGBoost

DOI:

10.3791/68784

29 мая 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь мы представляем протокол создания неинвазивной ИИ-модели на основе XGBoost для диагностики полипов голосовых связок с использованием базы данных Саарбрюккена.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

С постоянным ростом человеческой социальной коммуникации также увеличивается число людей, страдающих от нарушений голоса. Благодаря объективным и неинвазивным преимуществам методов акустического обнаружения патологического голоса, использование анализа речевых сигналов для патологического распознавания голоса стало горячей точкой исследований. В этой статье впервые выбрали 101 непрерывный гласный /a/ из немецкой базы данных SVD в качестве объекта исследования. Во-вторых, используя технологию вейвлет-пакетов для анализа времени и частоты, из подсигналов в качестве набора параметров признаков для классификатора патологического голоса извлекаются четыре нелинейных динамических параметра: приближённая энтропия, энтропия выборки, нечеткая энтропия и энтропия перестановок. Наконец, алгоритм машинного обучения XGBoost выбирается в качестве метода распознавания образов для создания патологического голосового классификатора, а производительность классификации проверяется с помощью пятикратной перекрёстной валидации и кривой ROC. Экспериментальные результаты показали, что точность патологического классификатора голоса XGBoost составляет 0,857, балл F1 — 0,875, а значение AUC — 0,944, что все выше классификатора, созданного SVM, что указывает на лучшие результаты XGBoost в патологическом распознавании голоса.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Число людей, страдающих от нарушений голоса, постоянно растёт. Согласно статистике, треть населения сталкивается с проблемами голоса в какой-то моментжизни1. Для профессиональных пользователей голоса, таких как певцы и преподаватели, из-за частого неправильного использования и злоупотребления голосом, заболеваемость горла выше. Два исследования провели опросы среди учителей в Тяньцзине и Урумчи, и результаты показали, что вероятность развития голосовых нарушений составляет соответственно 33,81% и 28,23%,что 2,3. В результате в клинической практике всё больше внимания уделяется выявлению и диагностике патологического голоса. В настоящее время субъективные методы оценки, ларингоскопическое исследование и методы акустического обнаружения в клинической практике в основном используются для диагностики голосовых заболеваний 4,5. Метод акустического обнаружения преобразует голосовые сигналы в цифровые для исследований, обеспечивая объективность и избегая боли пациентов во времяосмотра 6. Таким образом, акустическое обнаружение стало эффективным вспомогательным инструментом для врачей в клинической диагностике, и исследования в этой области растёт.

Наиболее важными методами диагностики патологического голоса с помощью методов акустического анализа являются извлечение признаков и распознавание образов. С 1960-х годов исследователи извлекают некоторые традиционные акустические параметры для изучения патологического голоса и обнаружили множество эффективных и надёжных параметров акустических признаков, таких как фундаментальное возмущение частоты, амплитудное возмущение и коэффициенты цепстрольных коэффициентов Mel-частоты (MFCC)7. В последние годы исследователи ограничились не только изучением традиционных акустических характеристик, но и начали применяться нелинейные динамические параметры в области патологического распознаванияголоса 8. Это также оказывает очень хороший эффект. С быстрым развитием машинного обучения появилось больше методов распознавания образов с высокой скоростью работы и хорошей классификацией. Также всё больше методов распознавания образов используется в патологическом распознавании голоса, таких как опорные векторные машины (SVM), случайный лес, нейронные сети, глубокое обучение 9,10. XGBoost — это метод распознавания паттернов, который привлёк внимание в последниегоды 11. Он не требует нормализации признаков и может выбирать признаки самостоятельно. Он может адаптироваться к различным функциям потерь и использует регуляризационные термины для предотвращения перенагона. Он обладает характеристиками высокой скорости, портативности и отказоустойчивости. Поэтому в данной статье пытается применить метод XGBoost к патологическому распознаванию голоса с целью достижения лучших результатов распознавания.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Технический процесс этого исследования иллюстрирован на рисунке 1.

1. Получение голосовых образцов

  1. Источник экспериментальных данных из SVD в Германии12.
  2. Получено 101 случай голосовых данных гласных /a/, включая 45 случаев (19 мужчин и 26 женщин) у пациентов с голосовым полипом и 56 случаев (28 мужчин и 28 женщин) у нормальных людей.

2. Вейвлет-пакетная декомпозиция голосовых данных13

  1. Проведите исчерпывающий поиск по трём вейвлетам Daubechies (db1, 3, 5) и трём глубинам разложения (4, 6, 8 уровней) с использованием программного обеспечения MATLAB R2023a.
  2. Используйте частоту дискретизации 16 кГц, четырёхуровневую дb3-вейвлет-пакетную декомпозицию (WPD), чтобы разбить речевой сигнал на 16 поддиапазонов (разрешение 500 Гц каждая) (рисунок 2).

3. Извлечение параметров признаков

  1. Извлеките дискретные последовательности коэффициентов из 16 поддиапазонов, полученных через 4-уровневую WPD в Python 3.10, которые служат входными значениями для всех энтропийных уравнений, описанных ниже.
    ПРИМЕЧАНИЕ: Все уравнения, использованные в этом исследовании, были получены из ранее опубликованных алгоритмов (например, в rэференс) и не были независимо выведены.
  2. Вычислите приблизительную энтропию для 16 последовательностей подполос WPD, используя формулу ниже14:
    figure-protocol-1(1)
    figure-protocol-2(2)
    Cim (r)={d[X(i), X(j)]Параметры: размерность шаблона m выбирается как 2, а допуск сходства r выбирается как 0,1–0,25, умноженный на стандартноеотклонение 14.
  3. Рассчитайте энтропию выборки для 16 последовательностей подполос WPD, используя формулу ниже15:
    figure-protocol-3(4)
    figure-protocol-4(5)
    Bim (r) = {d[X(i), X(j)]Параметры: размерность шаблона m выбирается как 1 или 2, а допуск сходства r — как 0,1–0,25 умножается на стандартноеотклонение 15.
  4. Вычислим функцию нечеткой принадлежности по формуле ниже16:
    figure-protocol-5(7)
  5. Вычислим размытую энтропию по формуле ниже17:
    figure-protocol-6(8)
    figure-protocol-7(9)
    figure-protocol-8(10)
    Параметры: размерность узора m выбирается как 2, а допуск сходства r — 0,15 раза от стандартного отклонения.
  6. Вычислите энтропию перестановок по формуле ниже18:
    figure-protocol-9(11)
    Параметры: размерность паттерна m выбирается как 6, а временная задержка L = 2 в итоге определяется для извлечения перестановки энтропии.

4. Создание модели

  1. Разделите голосовые образцы нормальных и пациентов с полипами голосовых связок на обучающий набор данных и тестовый набор данных в соотношении 8:2.
  2. Используйте обучающий набор данных для настройки параметров и обучения моделей, а затем примените полученный классификатор к тестовому набору данных для классификации заболеваний.
  3. Выполните процедуру моделирования SVM с использованием Python 3.10.
    1. Подтвердите нелинейный характер данных, сравнив производительность ядра SVM. Первоначальные тесты с линейным ядром показали низкую точность, тогда как ядро радиальной базисной функции (RBF) значительно улучшило результаты классификации, показав, что пространство признаков требует нелинейной границы принятия решений.
    2. Используйте 16-мерные векторы признаков энтропии (извлеченные через WPD) в качестве входа для классификатора SVM. Реализовать ядро RBF для отображения нелинейных голосовых признаков в высокомерное пространство.
    3. Выполните поиск по сетке с помощью Python (scikit-learn), чтобы определить оптимальное сочетание штрафного коэффициента C и ширины ядра γ на этапе обучения. Оценивайте каждый набор параметров, максимизируя скорость распознавания перекрёстной валидации.
    4. Обучайте модель SVM с использованием голосовых образцов обычных людей и пациентов с полипами голосовых связок. Используйте оптимальные гиперпараметры, полученные из поиска по сетке, чтобы построить окончательную обученную модель.
    5. Примените обученную модель к невидимым тестовым образцам. Каждый тестовый образец проходит ту же процедуру экстракции WPD и энтропии, что и обучающие данные. SVM предсказывает бинарную метку класса (нормальные и полипы голосовых связок) на основе пространственного положения вектора признаков теста относительно оптимальной границы принятия решения.
  4. Выполните процедуру моделирования XGBoost с использованием Python 3.10.
    1. Используйте поиск по сетке на основе Python для оптимизации ключевых гиперпараметров (включая скорость обучения и глубину дерева) на этапе обучения. Оценивайте комбинации нескольких параметров с помощью перекрёстной валидации для определения конфигурации, максимизирующей точность классификации.
    2. Обучить бинарный классификатор XGBoost, используя шестнадцать признаков энтропии, извлечённых из голосовых сэмплов. Примените оптимальные гиперпараметры, полученные в поиске по сетке, чтобы построить окончательную модель.
    3. Протестируйте обученную модель на независимом наборе валидации, состоящем из невидимых образцов. Этот этап оценивает возможности обобщения классификатора путём его эффективности на данных, не используемых во время обучения.

5. Оценка производительности модели

  1. Проведите пятикратный метод перекрёстной валидации.
    1. Случайным образом разбийте предварительно обработанный голосовой набор данных на пять равных слоёв. Используйте четыре сложки в качестве обучающего набора для построения модели, а оставшуюся — как валидационный набор для оценки эффективности.
    2. Повторите этот процесс пять раз. Используйте среднее значение результатов пяти итераций как итоговую производительность модели.
  2. Получите матрицу путаницы.
    1. Сгенерируйте матрицу путаницы, сравнивая прогнозируемые метки классификатора с метками ground-truth-true для всех тестовых выборок согласно результатам пятикратной перекрёстной валидации. Агрегировать эти отдельные сравнения в таблицу непредвиденных обстоятельств с помощью библиотеки Python scikit-learn для количественной оценки правильных и неправильных классификаций, как показано в Таблице 1.
  3. Рассчитайте точность, точность, чувствительность и балл F1 для описания эффективности классификационной модели. Соответствующие формулы расчёта следующие.
    Точность = (TP + TN)/(TP + TN + FP + FN)
    Точность = TP/(TP + FP)
    Чувствительность = Воспоминание = TPR = TP/(TP+ FN)
    F1 = (2 × Точность × Отзыв)/ (Точность + отзыв)
    ПРИМЕЧАНИЕ: Эти метрики (TP, TN, FP, FN) были получены из элементов матрицы путаницы.
  4. Опишите кривую ROC с AUC.
    1. Постройте кривую ROC, чтобы визуализировать компромисс между истинным показателем положительных результатов (TPR) и коэффициентом ложноположительных результатов (FPR) по всем порогам классификации. Рассчитайте площадь под кривой (AUC) как сводную метрику для количественной оценки общей дискриминационной способности модели.
      ПРИМЕЧАНИЕ: Значение AUC, ближе к 1, указывает на более высокую вероятность того, что классификатор правильно различает нормальных людей от тех, у кого есть полипы голосовых связок, независимо от конкретного порога принятия решения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании был использован вейвлет-пакетный анализ для декомпозиции голосовых сигналов по времени-частоте. Интегрируя нелинейные динамические параметры — включая приближённую энтропию, энтропию выборки, размытую энтропию и энтропию перестановок — были систематически охарактеризованы характеристики сложности и нерегулярности патологических голосов, связанных с полипами голосовых складок. Впоследствии были построены два патологических голосовых классификатора на основе алгоритмов ...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Патологическая голосовая диагностика с использованием анализа речевых сигналов представляет собой неинвазивный и объективныйподход 19. В результате патологическая классификация голоса стала важным направлением исследований в области обработки и распознавания речевых сигналов, демонстрируя значительную клиническую применение и перспективы развития20. В этом исследовании использовались образцы речи, собранные из SVD, в качестве эксперименталь...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конкурирующих интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Работа была поддержана проектом по улучшению возможностей больниц провинции Цзянсу (JSPH-MC-2023-12). Авторы выражают благодарность доценту Шань Ли из Школы экономики и менеджмента, а также сотрудников Ключевой лаборатории технологий мозга-машинного интеллекта (Министерство образования) Нанкинского университета аэронавтики и астронавтики за их руководство по методологии, анализу данных и генерации фигур. Эти вклады обеспечили бесперебойный прогресс исследований.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
MATLAB The MathWorksR2023aОсновная программная платформа для численных вычислений и прототипирования алгоритмов.
Программное обеспечение для PythonФонд программного обеспечения PythonPython 3.10Основной язык программирования, используемый на протяжении всего исследования.
Saarbruecken Voice Database, SVDИнститут фонетики, Саарский университетSaarbrü База данных cken Voice (SVD)Общедоступная база данных патологических и нормальных голосовых записей. Содержит устойчивые гласные звуки и непрерывную речь у пациентов с такими заболеваниями, как полипы голосовых связок, а также здоровые контроли. Используется для академических исследований в соответствии с установленными условиями доступа.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

XGBoostROC

Похожие статьи