Methodenartikel

Onderzoek naar pathologische spraakherkenning gebaseerd op XGBoost

DOI:

10.3791/68784

29 mei 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hier presenteren we een protocol voor het opzetten van een niet-invasief XGBoost-gebaseerd AI-model voor het diagnosticeren van stembandpoliepen met behulp van de Saarbrücken-database.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Met de voortdurende groei van menselijke sociale communicatie neemt het aantal mensen met stemstoornissen ook toe. Vanwege de objectieve en niet-invasieve voordelen van akoestische detectiemethoden voor pathologische stem, is het gebruik van spraaksignaalanalyse voor pathologische spraakherkenning een onderzoekscentrum geworden. Dit artikel selecteerde eerst 101 continue klinkers /a/ uit de Duitse SVD-database als onderzoeksobject. Ten tweede worden met behulp van wavelet-pakkettechnologie voor tijd-frequentieanalyse vier niet-lineaire dynamische parameters, namelijk benaderende entropie, monsterentropie, fuzzy-entropie en permutatie-entropie, uit de subsignalen gehaald als de feature-parameter set voor de pathologische stemclassificator. Ten slotte wordt het machine learning-algoritme XGBoost geselecteerd als patroonherkenningsmethode om een pathologische stemclassifier vast te stellen, en wordt de classificatieprestaties geverifieerd met behulp van vijfvoudige kruisvalidatie en ROC-curve. Experimentele resultaten hebben aangetoond dat de nauwkeurigheid van XGBoost's pathologische stemclassifier 0,857 is, de F1-score 0,875 en de AUC-waarde 0,944, allemaal hoger dan de classifier die door SVM is geconstrueerd, wat aangeeft dat XGBoost beter presteert in pathologische spraakherkenning.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het aantal mensen dat lijdt aan stemstoornissen neemt voortdurend toe. Volgens statistieken ervaart een derde van de bevolking op enig moment in hun levenstemproblemen 1. Voor professionele stemgebruikers zoals zangers en docenten is de incidentie van keelziekten hoger, vanwege hun frequente misbruik en misbruik van hun stem. Twee studies voerden enquêtes uit onder leraren in Tianjin en Urumqi, en de resultaten toonden aan dat de kans op spraakstoornissen respectievelijk 33,81% en 28,23% bedraagt. Als gevolg hiervan ligt er steeds meer nadruk op de detectie en diagnose van pathologische stem in de klinische praktijk. Momenteel worden subjectieve evaluatiemethoden, laryngoscopieonderzoek en akoestische detectiemethoden voornamelijk gebruikt voor de diagnose van stemziekten in de klinische praktijk 4,5. De akoestische detectiemethode zet spraaksignalen om in digitale signalen voor onderzoek, waarbij objectiviteit wordt gewaarborgd en pijn van de patiënt tijdenshet onderzoek wordt voorkomen. Daarom is akoestische detectie een effectief hulpmiddel geworden voor artsen bij klinische diagnose, en het onderzoek hiernaar neemt toe.

De belangrijkste technieken voor het diagnosticeren van pathologische stem met behulp van akoestische analysemethoden zijn feature-extractie en patroonherkenning. Sinds de jaren zestig hebben onderzoekers enkele traditionele akoestische parameters geëxtraheerd voor de studie van pathologische stem, en hebben ze veel effectieve en robuuste akoestische kenmerken gevonden, zoals fundamentele frequentieverstoring, amplitude-verstoring en Mel-frequentie cepstrale coëfficiënten (MFCC)7. In de afgelopen jaren hebben onderzoekers zich niet alleen beperkt tot het bestuderen van traditionele akoestische karakteristiekparameters, maar zijn er ook niet-lineaire dynamische parameters gaan worden gebruikt op het gebied van pathologische spraakherkenning8. Het heeft ook een heel goed effect. Met de snelle ontwikkeling van machine learning zijn er meer patroonherkenningsmethoden met hoge loopsnelheid en goede classificatieprestaties ontstaan. Er worden ook steeds meer patroonherkenningsmethoden gebruikt in pathologische spraakherkenning, zoals support vector machines (SVM), random forest, neurale netwerken, deep learning 9,10. XGBoost is een patroonherkenningsmethode die de afgelopen jaren veel aandacht heeft gekregen11. Het vereist geen feature-normalisatie en kan zelf functies selecteren. Het kan zich aanpassen aan verschillende verliesfuncties en gebruikt regularisatietermen om overfitting te voorkomen. Het heeft kenmerken van hoge snelheid, draagbaarheid en fouttolerantie. Daarom probeert dit artikel de XGBoost-methode toe te passen op pathologische spraakherkenning om betere herkenningsresultaten te behalen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De technische workflow van deze studie is geïllustreerd in Figuur 1.

1. Verwerving van stemmonsters

  1. Haal de experimentele gegevens uit de SVD in Duitsland12.
  2. Verkrijg 101 gevallen van klinker/a/stemgegevens, waaronder 45 gevallen (19 mannen en 26 vrouwen) van vocale polieppatiënten en 56 gevallen (28 mannen en 28 vrouwen) van normale personen.

2. Wavelet-pakketdecompositie van spraakdata13

  1. Voer een uitputtende zoektocht uit over drie Daubechies-wavelets (db1, 3, 5) en drie decompositiedieptes (4, 6, 8 niveaus) met behulp van de software MATLAB R2023a.
  2. Gebruik een samplefrequentie van 16 kHz, een vier-niveau db3 wavelet packet decompositie (WPD) om het spraaksignaal te verdelen in 16 subbanden (elk 500 Hz resolutie) (Figuur 2).

3. Featureparameter-extractie

  1. Extraheren discrete coëfficiëntenreeksen uit de 16 subbanden die via 4-niveau WPD door Python 3.10 zijn verkregen, en dienen als de invoerwaarden voor alle hieronder beschreven entropievergelijkingen.
    OPMERKING: Alle vergelijkingen die in deze studie zijn gebruikt, zijn afgeleid van eerder gepubliceerde algoritmen (zoals in referenties) en zijn niet onafhankelijk afgeleid.
  2. Bereken de benaderende entropie voor de 16 WPD subbandreeksen met behulp van de onderstaandeformule 14:
    figure-protocol-1(1)
    figure-protocol-2(2)
    Cim (r)={d[X(i), X(j)]Parameters: De patroondimensie m wordt gekozen als 2, en de gelijkenistolerantie r is gekozen als 0,1 tot 0,25 keer de standaardafwijking14.
  3. Bereken de steekproefentropie voor de 16 WPD subbandreeksen met behulp van de formule hieronder15:
    figure-protocol-3(4)
    figure-protocol-4(5)
    Bim (r) = {d[X(i), X(j)]Parameters: De patroondimensie m wordt gekozen als 1 of 2, en de gelijkenistolerantie r wordt gekozen als 0,1 tot 0,25 keer de standaardafwijking15.
  4. Bereken de fuzzy membership functie met de onderstaande formule16:
    figure-protocol-5(7)
  5. Bereken de fuzzy entropie met de formule hieronder17:
    figure-protocol-6(8)
    figure-protocol-7(9)
    figure-protocol-8(10)
    Parameters: De patroondimensie m wordt gekozen als 2, en de gelijkenistolerantie r is gekozen als 0,15 keer de standaarddeviatie.
  6. Bereken de permutatie-entropie met de onderstaandeformule 18:
    figure-protocol-9(11)
    Parameters: De patroondimensie m wordt gekozen als 6, en tijdsvertraging L = 2 werd uiteindelijk bepaald voor permutatie-entropie-extractie.

4. Modeloprichting

  1. Verdeel stemmonsters van normale en patiënten met stembandpoliepen in een trainingsdataset en een testdataset in een verhouding van 8:2.
  2. Gebruik de trainingsdataset voor parameterafstemming en modeltraining, en pas vervolgens de resulterende classifier toe op de testdataset voor ziekteclassificatie.
  3. Voer de SVM-modelleringsprocedure uit met Python 3.10.
    1. Bevestig de niet-lineaire aard van de data door de prestaties van de SVM-kernel te vergelijken. Eerste tests met een lineaire kernel leverden een slechte nauwkeurigheid op, terwijl de radiale basisfunctie (RBF) kernel de classificatieresultaten aanzienlijk verbeterde, wat aantoonde dat de featureruimte een niet-lineaire beslissingsgrens vereist.
    2. Gebruik de 16-dimensionale entropiekenmerkvectoren (geëxtraheerd via WPD) als invoer voor de SVM-classifier. Implementeer een RBF-kernel om de niet-lineaire spraakkenmerken in een hoogdimensionale ruimte te mappen.
    3. Voer een rasterzoekopdracht uit met Python (scikit-learn) om de optimale combinatie van de strafcoëfficiënt C en de kernelbreedte te identificeren γ tijdens de trainingsfase. Evalueer elke parameterset door de kruisvalidatie-herkenningssnelheid te maximaliseren.
    4. Train het SVM-model met behulp van stemmonsters van normale personen en patiënten met stembandpoliepen. Gebruik de optimale hyperparameters verkregen uit de rasterzoektocht om het uiteindelijke getrainde model te construeren.
    5. Pas het getrainde model toe op onzichtbare testmonsters. Elk testmonster ondergaat dezelfde WPD- en entropie-extractieprocedure als de trainingsgegevens. De SVM voorspelt het binaire klasselabel (normale versus stembandpoliepen) op basis van de ruimtelijke positie van de testkenmerkvector ten opzichte van de geoptimaliseerde beslissingsgrens.
  4. Voer de XGBoost-modelleringsprocedure uit met Python 3.10.
    1. Gebruik een op Python gebaseerde rasterzoekopdracht om belangrijke hyperparameters (inclusief leersnelheid en boomdiepte) tijdens de trainingsfase te optimaliseren. Evalueer meerdere parametercombinaties via kruisvalidatie om de configuratie te identificeren die de classificatienauwkeurigheid maximaliseert.
    2. Train een binaire XGBoost-classifier met behulp van de zestien entropiekenmerken die uit spraakmonsters zijn geëxtraheerd. Pas de optimale hyperparameters toe die uit de rasterzoekopdracht zijn verkregen om het uiteindelijke model te construeren.
    3. Test het getrainde model op een onafhankelijke validatieset bestaande uit onzichtbare samples. Deze stap beoordeelt het generalisatievermogen van de classifier door de prestaties te evalueren op data die niet tijdens de training is gebruikt.

5. Evaluatie van de modelprestaties

  1. Voer een vijfvoudige kruisvalidatiemethode uit.
    1. Verdeel de voorbewerkte spraakdataset willekeurig in vijf gelijke vouwen. Gebruik vier vouwen als trainingsset om het model te construeren en gebruik de resterende eenvoudige als validatieset voor prestatiebeoordeling.
    2. Herhaal dit proces vijf keer. Gebruik het gemiddelde van de resultaten van de vijf iteraties als de uiteindelijke modelprestatie.
  2. Verkrijg de verwarringsmatrix.
    1. Genereer de verwarringsmatrix door de voorspelde labels van de classifier te vergelijken met de grond-waarheidslabels voor alle testmonsters volgens de vijfvoudige kruisvalidatieresultaten. Verzamel deze individuele vergelijkingen in een contingentabel, met behulp van de Python scikit-learn-bibliotheek om correcte en onjuiste classificaties te kwantificeren, zoals weergegeven in Tabel 1.
  3. Bereken nauwkeurigheid, precisie, gevoeligheid en F1-score om de effectiviteit van een classificatiemodel te beschrijven. De relevante berekeningsformules zijn als volgt.
    Nauwkeurigheid = (TP + TN)/(TP + TN + FP + FN)
    Precisie = TP/(TP + FP)
    Gevoeligheid = Herinnering = TPR = TP/(TP+ FN)
    F1 = (2 × Precisie × terugroepen)/ (Precisie + terugroepen)
    OPMERKING: Deze metrieken (TP, TN, FP, FN) zijn afgeleid van de elementen van de confusion-matrix.
  4. Beschrijf de ROC-curve met AUC.
    1. Plot de ROC-curve om de afweging te visualiseren tussen het werkelijke positieve percentage (TPR) en het vals-positieve percentage (FPR) over alle classificatiedrempels. Bereken de Area Under the Curve (AUC) als samenvattende maatstaf om het algehele discriminatievermogen van het model te kwantificeren.
      OPMERKING: Een AUC-waarde dichter bij 1 geeft een hogere kans aan dat de classifier correct onderscheidt tussen normale individuen en die met stembandpoliepen, onafhankelijk van de specifieke beslissingsdrempel.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In deze studie werd wavelet-pakketanalyse gebruikt om tijd-frequentie ontbinding van spraaksignalen uit te voeren. Door niet-lineaire dynamische parameters te integreren—waaronder benaderende entropie, monsterentropie, vae entropie en permutatie-entropie—werden de complexiteits- en onregelmatigheidskenmerken van pathologische stemmen die geassocieerd zijn met stemplooipoliepen systematisch gekarakteriseerd. Vervolgens werden twee pathologische stemclassifiers geconstrueerd op basis van r...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pathologische stemdiagnose met behulp van spraaksignaalanalyse is een niet-invasieve en objectieve benadering19. Daardoor is pathologische stemclassificatie uitgegroeid tot een belangrijk onderzoeksgebied in spraaksignaalverwerking en -herkenning, met aanzienlijke klinische toepassingswaarde en ontwikkelingsvooruitzichten20. Deze studie gebruikte spraakmonsters verzameld uit SVD als experimentele corpora. Door middel van spraaksignaalverwer...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat zij geen concurrerende belangen hebben.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het werk werd ondersteund door het Jiangsu Province Hospital Capability Improvement Project (JSPH-MC-2023-12). De auteurs willen universitair hoofddocent Shan Li van de School of Economics and Management en het personeel van het Key Laboratory of Brain-Machine Intelligence Technology (Ministerie van Onderwijs) aan de Nanjing University of Aeronautics and Astronautics bedanken voor hun begeleiding op het gebied van methodologie, data-analyse en figuurgeneratie. Deze bijdragen hebben de soepele voortgang van dit onderzoek verzekerd.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
MATLAB The MathWorksR2023aPrimaire softwareplatform voor numerieke berekening en algoritme prototyping.
Python softwarePython Software FoundationPython 3.10Kernprogrammeertaal die in de hele studie wordt gebruikt.
Saarbruecken Voice Database,SVDInstitute of Phonetics, Saarland UniversitySaarbrücken Voice Database (SVD)Openbaar beschikbare database van pathologische en normale stemopnamen. Bevat langdurige klinkers en doorlopende spraak van proefpersonen met aandoeningen waaronder stembandpoliepen, evenals gezonde controles. Gebruikt voor academisch onderzoek onder de gespecificeerde voorwaarden van toegang.

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

XGBoost classificatorspraaksignaalanalysestemstoornissenwavelet pakkettijd frequentieanalyseniet lineaire dynamische parametersentropiekenmerkenvijfvoudige kruisvalidatieROC curve

Gerelateerde artikelen