Artykuł metodologiczny

Badania nad patologicznym rozpoznawaniem mowy oparte na XGBoost

DOI:

10.3791/68784

29 maja 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przedstawiamy tutaj protokół umożliwiający utworzenie nieinwazyjnego modelu AI opartego na XGBoost do diagnozowania polipów strun głosowych z wykorzystaniem bazy danych Saarbrücken.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wraz z ciągłym rozwojem komunikacji społecznej rośnie także liczba osób cierpiących na zaburzenia głosu. Ze względu na obiektywne i nieinwazyjne zalety akustycznych metod wykrywania głosu patologicznego, wykorzystanie analizy sygnałów mowy do rozpoznawania mowy patologicznego stało się gorącym punktem badań. Artykuł ten po raz pierwszy wybrał 101 ciągłych samogłosek /a/ z niemieckiej bazy danych SVD jako obiekt badawczy. Po drugie, wykorzystując technologię pakietów falkowych do analizy czasowo-częstotliwościowej, cztery nieliniowe parametry dynamiczne: przybliżoną entropię, entropię próbki, entropię rozmytą oraz entropię permutacyjną, wyodrębniane są z podsygnałów jako zestaw parametrów cech dla patologicznego klasyfikatora głosowego. Na koniec algorytm uczenia maszynowego XGBoost jest wybierany jako metoda rozpoznawania wzorców do ustanowienia patologicznego klasyfikatora głosowego, a wydajność klasyfikacji jest weryfikowana za pomocą pięciokrotnej walidacji krzyżowej i krzywej ROC. Wyniki eksperymentalne wykazały, że dokładność patologicznego klasyfikatora głosu XGBoost wynosi 0,857, wynik F1 0,875, a wartość AUC 0,944, co jest wyższe niż klasyfikator skonstruowany przez SVM, co wskazuje, że XGBoost ma lepsze wyniki w patologicznym rozpoznawaniu mowy.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Liczba osób cierpiących na zaburzenia głosu stale rośnie. Według statystyk, jedna trzecia populacji doświadcza problemów z głosem w pewnym momencie swojego życia1. Dla profesjonalnych użytkowników głosu, takich jak śpiewacy i nauczyciele, ze względu na częste nadużywanie i nadużywanie głosu, częstość chorób gardła jest wyższa. Dwa badania przeprowadziły badania wśród nauczycieli w Tiencinie i Urumczi, a wyniki wykazały, że prawdopodobieństwo wystąpienia zaburzeń głosu wynosi odpowiednio 33,81% i 28,23%, czyli 2,3%. W rezultacie coraz większy nacisk kładzie się na wykrywanie i diagnozowanie patologicznego głosu w praktyce klinicznej. Obecnie metody subiektywnej oceny, badanie laryngoskopowe oraz metody detekcji akustycznej są głównie wykorzystywane do diagnozowania chorób głosu w praktyce klinicznej 4,5. Metoda detekcji akustycznej przekształca sygnały głosowe w cyfrowe do badań, zapewniając obiektywizm i unikając bólu pacjenta podczas badania6. Dlatego detekcja akustyczna stała się skutecznym narzędziem pomocniczym dla lekarzy w diagnostyce klinicznej, a badania nad tym obszarem rosną.

Najważniejszymi technikami diagnozowania patologicznego głosu z wykorzystaniem metod analizy akustycznej są ekstrakcja cech i rozpoznawanie wzorców. Od lat 60. XX wieku naukowcy wyodrębniają niektóre tradycyjne parametry akustyczne do badań głosu patologicznego i odkryli wiele efektywnych i odpornych parametrów cech akustycznych, takich jak perturbacja częstotliwości fundamentalnej, perturbacja amplitudy oraz współczynniki cepstralne o częstotliwości Mela (MFCC)7. W ostatnich latach naukowcy nie tylko ograniczyli się do badania tradycyjnych parametrów charakterystycznych akustycznych, ale także nieliniowe parametry dynamiczne zaczęły być wykorzystywane w dziedzinie patologicznego rozpoznawania mowy8. Ma też bardzo dobry efekt. Wraz z szybkim rozwojem uczenia maszynowego pojawiło się więcej metod rozpoznawania wzorców o szybkim biegu i dobrej wydajności klasyfikacji. Coraz więcej stosuje się także metody rozpoznawania wzorców w patologicznym rozpoznawaniu głosu, takie jak maszyny wektorowe wspierające (SVM), las losowy, sieci neuronowe oraz głębokie uczenie 9,10. XGBoost to metoda rozpoznawania wzorców, która zyskała na sobie uwagę w ostatnich latach11. Nie wymaga normalizacji funkcji i może wybierać je samodzielnie. Może dostosować się do różnych funkcji strat i wykorzystuje terminy regularizacyjne, aby zapobiec nadmiernemu dopasowaniu. Cechuje się dużą prędkością, przenośnością i odpornością na awarie. Dlatego niniejszy artykuł próbuje zastosować metodę XGBoost do patologicznego rozpoznawania głosu, aby osiągnąć lepsze wyniki rozpoznawania.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Techniczny przepływ pracy tego badania przedstawiono na Rysunku 1.

1. Pozyskiwanie próbek głosowych

  1. Źródło danych eksperymentalnych z SVD w Niemczech12.
  2. Uzyskanie 101 przypadków danych o głosie samogłoskowym /a/, w tym 45 przypadków (19 mężczyzn i 26 kobiet) pacjentów z polipami głosowymi oraz 56 przypadków (28 mężczyzn i 28 kobiet) osób zdrowych.

2. Rozkład pakietów falkowych danych głosowych13

  1. Przeprowadź wyczerpujące wyszukiwanie w trzech falkach Daubechiego (db1, 3, 5) oraz trzech głębokościach rozkładu (poziomy 4, 6, 8) przy użyciu oprogramowania MATLAB R2023a.
  2. Użyj częstotliwości próbkowania 16 kHz, czteropoziomowej dekompozycji pakietów db3 (WPD), aby podzielić sygnał mowy na 16 podpasm (każde o rozdzielczości 500 Hz) (Rysunek 2).

3. Ekstrakcja parametrów cech

  1. Wyodrębniaj sekwencje dyskretnych współczynników z 16 podpasm uzyskanych za pomocą 4-poziomowego WPD w Pythonie 3.10, służące jako wartości wejściowe dla wszystkich opisanych poniżej równań entropii.
    UWAGA: Wszystkie równania użyte w tym badaniu pochodzą z wcześniej opublikowanych algorytmów (np. references) i nie zostały niezależnie wyprowadzone.
  2. Oblicz przybliżoną entropię dla 16 sekwencji podpasm WPD, stosując wzór poniżej14:
    figure-protocol-1    (1)
    figure-protocol-2    (2)
    Cim (r)={d[X(i), X(j)]Parametry: Wymiar wzoru m wybiera się jako 2, a tolerancję podobieństwa r jako 0,1 do 0,25 razy odchylenie standardowe14.
  3. Oblicz entropię próbki dla 16 sekwencji podpasm WPD, stosując wzórponiżej 15:
    figure-protocol-3     (4)
    figure-protocol-4    (5)
    Bim (r) = {d[X(i), X(j)]Parametry: Wymiar wzoru m wybiera się jako 1 lub 2, a tolerancję podobieństwa r jako 0,1 do 0,25 razy odchylenia standardowego15.
  4. Oblicz funkcję przynależności rozmytej według wzoruponiżej 16:
    figure-protocol-5     (7)
  5. Oblicz entropię rozmytą według wzoruponiżej 17:
    figure-protocol-6    (8)
    figure-protocol-7    (9)
    figure-protocol-8    (10)
    Parametry: Wymiar wzorca m wybiera się jako 2, a tolerancja podobieństwa r jako 0,15 razy odchylenia standardowego.
  6. Oblicz entropię permutacji według wzoruponiżej 18:
    figure-protocol-9     (11)
    Parametry: Wymiar wzorca m wybrano jako 6, a ostatecznie wyznaczono opóźnienie czasowe L = 2 dla ekstrakcji entropii permutacyjnej.

4. Ustanowienie modelu

  1. Podziel próbki głosu od osób z polipami struny głosowej i u pacjentów na zestaw treningowy i testowy zestaw danych w stosunku 8:2.
  2. Użyj zbioru danych treningowych do strojenia parametrów i modelu, a następnie zastosuj powstały klasyfikator do testowego zbioru danych do klasyfikacji chorób.
  3. Wykonaj procedurę modelowania SVM w Pythonie 3.10.
    1. Potwierdź nieliniowy charakter danych, porównując wydajność jądra SVM. Początkowe testy z jądrem liniowym wykazały słabą dokładność, podczas gdy jądro funkcji bazowej radialnej (RBF) znacząco poprawiło wyniki klasyfikacji, wykazując, że przestrzeń cech wymaga nieliniowej granicy decyzyjnej.
    2. Użyj 16-wymiarowych wektorów cech entropii (wyodrębnionych za pomocą WPD) jako danych wejściowych dla klasyfikatora SVM. Zaimplementuj jądro RBF, aby odwzorować nieliniowe cechy głosowe na przestrzeń o wysokim wymiarze.
    3. Wykonaj wyszukiwanie siatki za pomocą Pythona (scikit-learn), aby zidentyfikować optymalną kombinację współczynnika kary C i szerokości jądra γ podczas fazy treningowej. Ocenuj każdy zestaw parametrów, maksymalizując wskaźnik rozpoznawania walidacji krzyżowej.
    4. Trenuj model SVM na próbkach głosu osób normalnych oraz pacjentów z polipami strun głosowych. Wykorzystaj optymalne hiperparametry uzyskane podczas przeszukiwania siatki do skonstruowania ostatecznego wytrenowanego modelu.
    5. Zastosuj wytrenowany model do niewidocznych próbek testowych. Każda próbka testowa przechodzi tę samą procedurę ekstrakcji WPD i entropii co dane treningowe. SVM przewiduje binarną etykietę klasy (normalne vs. polipy strun głosowych) na podstawie przestrzennej pozycji wektora cech testowych względem zoptymalizowanej granicy decyzyjnej.
  4. Wykonaj procedurę modelowania XGBoost w Pythonie 3.10.
    1. Użyj wyszukiwania siatkowego opartego na Pythonie, aby zoptymalizować kluczowe hiperparametry (w tym tempo uczenia i głębokość drzewa) podczas fazy treningowej. Oceniaj kombinacje wielu parametrów za pomocą walidacji krzyżowej, aby zidentyfikować konfigurację maksymalizującą dokładność klasyfikacji.
    2. Wytrenuj binarny klasyfikator XGBoost z wykorzystaniem szesnastu cech entropii wyodrębnionych z próbek głosowych. Zastosuj optymalne hiperparametry uzyskane z przeszukiwania siatki do skonstruowania ostatecznego modelu.
    3. Przetestuj wytrenowany model na niezależnym zbiorze walidacyjnym składającym się z niewidzianych próbek. Ten krok ocenia zdolność uogólnienia klasyfikatora poprzez ocenę jego wydajności na danych nieużywanych podczas treningu.

5. Ocena wydajności modelu

  1. Przeprowadź pięciokrotną metodę walidacji krzyżowej.
    1. Podzielić preprzetwarzany zbiór danych głosowych losowo na pięć równych składów. Użyj czterech foldów jako zbioru treningowego do budowy modelu, a pozostałego jednego foldu jako zbioru walidacyjnego do oceny wydajności.
    2. Powtórz ten proces pięć razy. Użyj średniej wyników z pięciu iteracji jako ostatecznej wydajności modelu.
  2. Uzyskaj macierz pomyłki.
    1. Generuj macierz pomyłki, porównując przewidywane etykiety klasyfikatora z etykietami prawdziwości podstawowej dla wszystkich próbek testowych zgodnie z pięciokrotnymi wynikami walidacji krzyżowej. Zagreguj te poszczególne porównania w tabelę kontingencyjną za pomocą biblioteki Python scikit-learn, aby ilościowo określić poprawne i błędne klasyfikacje, jak pokazano w Tabeli 1.
  3. Oblicz dokładność, precyzję, czułość oraz wynik F1, aby opisać skuteczność modelu klasyfikacyjnego. Odpowiednie wzory obliczeniowe są następujące.
    Dokładność = (TP + TN)/(TP + TN + FP + FN)
    Precyzja = TP/(TP + FP)
    Czułość = Przypomnienie = TPR = TP/(TP+ FN)
    F1 = (2 × Precyzja × Przywołanie)/ (Precyzja + Przywołanie)
    UWAGA: Te metryki (TP, TN, FP, FN) zostały wyprowadzone z elementów macierzy pomyłek.
  4. Opisz krzywą ROC za pomocą AUC.
    1. Na wykresie krzywej ROC zobrazuj kompromis między wskaźnikiem rzeczywistych pozytywnych wyników (TPR) a wskaźnikiem fałszywie pozytywnych (FPR) na wszystkich progach klasyfikacji. Oblicz powierzchnię pod krzywą (AUC) jako metrykę podsumowującą w celu określenia ogólnej dyskryminacyjnej zdolności modelu.
      UWAGA: Wartość AUC bliższa 1 wskazuje na wyższe prawdopodobieństwo, że klasyfikator poprawnie rozróżni osobniki normalne od tych z polipami strun głosowych, niezależnie od konkretnego progu decyzyjnego.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tym badaniu zastosowano analizę pakietów falkowych do przeprowadzenia rozkładu czasowo-częstotliwościowego sygnałów głosowych. Poprzez integrację nieliniowych parametrów dynamicznych — w tym przybliżonej entropii, entropii próbki, entropii rozmytej oraz entropii permutacyjnej — systematycznie scharakteryzowano złożoność i nieregularności patologicznych głosów związanych z polipami fałdów głosowych. Następnie skonstruowano dwa patologiczne klasyfikatory głosowe na podstawie algorytmu maszyny wektorowej wsparcia (SVM) or...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Patologiczna diagnostyka głosu z wykorzystaniem analizy sygnałów mowy stanowi nieinwazyjne i obiektywne podejście19. W konsekwencji klasyfikacja głosu patologicznego stała się istotnym obszarem badań w zakresie przetwarzania i rozpoznawania sygnałów mowy, wykazując znaczącą wartość kliniczną i perspektywy rozwojowe20. W badaniu wykorzystano próbki mowy pobrane z SVD jako eksperymentalne korpusory. Dzięki przetwarzaniu sygnałów mowy i technikom uczenia maszynowego opracowano...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają ze sobą rywalizujących interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prace zostały wsparte przez Projekt Poprawy Zdolności Szpitali Prowincji Jiangsu (JSPH-MC-2023-12). Autorzy pragną podziękować profesorowi nadzwyczajnemu Shan Li ze Szkoły Ekonomii i Zarządzania oraz pracownikom Kluczowego Laboratorium Technologii Inteligencji Mózg-Maszyna (Ministerstwo Edukacji) na Uniwersytecie Aeronautyki i Astronautyki w Nankinie za wskazówki dotyczące metodologii, analiza danych i generowanie danych. Te osiągnięcia zapewniły płynny postęp tych badań.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
MATLAB The MathWorksR2023aPodstawowa platforma programowa do obliczeń numerycznych i prototypowania algorytmów.
Oprogramowanie PythonPython Software FoundationPython 3.10Podstawowy język programowania używany przez całe badanie.
Baza danych głosu Saarbruecken, SVDInstytut Fonetyki, Uniwersytet SaarySaarbrü Cken Voice Database (SVD)Publicznie dostępna baza danych patologicznych i normalnych nagrań głosu. Zawiera samogłoski podtrzymywane i ciągłą mowę u osób z takimi schorzeniami, jak polipy strun głosowych, a także zdrową kontrolę. Wykorzystywane do badań naukowych na określonych warunkach dostępu.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Klasyfikator XGBoostanaliza sygna w mowyzaburzenia g osupakiety faloweanaliza czasowo cz stotliwo ciowanieliniowe parametry dynamicznecechy entropijnepi ciokrotna walidacja krzy owakrzywa ROC

Powiązane artykuły