Articolo metodologico

Ricerca sul riconoscimento vocale patologico basata su XGBoost

DOI:

10.3791/68784

29 maggio 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Qui presentiamo un protocollo per stabilire un modello AI basato su XGBoost non invasivo per la diagnosi dei polipi delle corde vocali utilizzando il database di Saarbrücken.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Con la continua crescita della comunicazione sociale umana, anche il numero di persone che soffrono di disturbi della voce sta aumentando. Grazie ai vantaggi oggettivi e non invasivi dei metodi di rilevamento acustico per la voce patologica, l'uso dell'analisi del segnale vocale per il riconoscimento vocale patologico è diventato un punto focale di ricerca. Questo articolo ha selezionato inizialmente 101 vocali continue /a/ dal database tedesco SVD come oggetto di ricerca. In secondo luogo, utilizzando la tecnologia dei pacchetti wavelet per l'analisi tempo-frequenza, quattro parametri dinamici non lineari, ovvero entropia approssimativa, entropia del campione, entropia fuzzy e entropia di permutazione, vengono estratti dai segnali secondari come set di parametri caratteristici per il classificatore vocale patologico. Infine, l'algoritmo di machine learning XGBoost viene selezionato come metodo di riconoscimento di pattern per stabilire un classificatore vocale patologico, e le prestazioni di classificazione vengono verificate utilizzando la validazione incrociata a cinque volte e la curva ROC. I risultati sperimentali hanno mostrato che l'accuratezza del classificatore vocale patologico di XGBoost è 0,857, il punteggio F1 è 0,875 e il valore AUC è 0,944, tutti superiori al classificatore costruito da SVM, indicando che XGBoost ha prestazioni migliori nel riconoscimento vocale patologico.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il numero di persone che soffrono di disturbi della voce è in costante aumento. Secondo le statistiche, un terzo della popolazione sperimenta problemi di voce in qualche momento dellapropria vita 1. Per gli utenti professionisti della voce come cantanti e insegnanti, a causa del frequente uso improprio e abuso della voce, l'incidenza delle malattie della gola è più alta. Due studi hanno condotto sondaggi su insegnanti a Tianjin e Urumqi, e i risultati hanno mostrato che la probabilità di soffrire di disturbi della voce è rispettivamente del 33,81% e del 28,23%,rispettivamente del 2,3%. Di conseguenza, nella pratica clinica si pone sempre più enfasi sulla rilevazione e diagnosi della voce patologica. Attualmente, i metodi di valutazione soggettiva, l'esame della laringoscopia e i metodi di rilevamento acustico sono utilizzati principalmente per la diagnosi delle malattie della voce nella praticaclinica 4,5. Il metodo di rilevamento acustico converte i segnali vocali in segnali digitali per la ricerca, garantendo obiettività ed evitando il dolore del paziente durantel'esame 6. Pertanto, la rilevazione acustica è diventata uno strumento ausiliario efficace per i medici nella diagnosi clinica, e la ricerca in merito è in aumento.

Le tecniche più importanti per diagnosticare la voce patologica utilizzando metodi di analisi acustica sono l'estrazione delle caratteristiche e il riconoscimento dei pattern. Dagli anni '60, i ricercatori hanno estratto alcuni parametri acustici tradizionali per lo studio della voce patologica e hanno trovato molti parametri efficaci e robusti delle caratteristiche acustiche, come la perturbazione della frequenza fondamentale, la perturbazione di ampiezza e i coefficienti cepstrali a frequenza Mel (MFCC)7. Negli ultimi anni, i ricercatori non si sono limitati solo allo studio dei parametri caratteristici acustici tradizionali, ma hanno iniziato a essere utilizzati anche parametri dinamici non lineari nel campo del riconoscimento patologicodella voce 8. Ha anche un effetto molto buono. Con il rapido sviluppo del machine learning, sono emersi più metodi di riconoscimento di modelli con velocità di corsa elevata e buone prestazioni di classificazione. Esistono anche sempre più metodi di riconoscimento di pattern utilizzati nel riconoscimento vocale patologico, come le macchine a vettori di supporto (SVM), la foresta casuale, le reti neurali, il deeplearning 9,10. XGBoost è un metodo di riconoscimento di pattern che ha attirato l'attenzione negli ultimianni 11. Non richiede la normalizzazione delle caratteristiche e può selezionare le caratteristiche da sola. Può adattarsi a varie funzioni di perdita e utilizza termini di regolarizzazione per prevenire il sovrafitting. Ha le caratteristiche di velocità elevata, portabilità e tolleranza ai guasti. Pertanto, questo articolo cerca di applicare il metodo XGBoost al riconoscimento vocale patologico per ottenere risultati migliori nel riconoscimento.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il flusso di lavoro tecnico di questo studio è illustrato nella Figura 1.

1. Acquisizione di campioni vocali

  1. Fonte dei dati sperimentali dall'SVD in Germania12.
  2. Otteniamo 101 casi di dati vocalici /a/, inclusi 45 casi (19 maschi e 26 femmine) di pazienti con polipi vocali e 56 casi (28 maschi e 28 femmine) di individui normali.

2. Decomposizione dei pacchetti wavelet dei dati vocali13

  1. Effettuare una ricerca esaustiva su tre wavelet di Daubechies (db1, 3, 5) e tre profondità di decomposizione (4, 6, 8 livelli) utilizzando il software MATLAB R2023a.
  2. Utilizzare una frequenza di campionamento di 16 kHz, una decomposizione dei pacchetti wavelet db3 a quattro livelli (WPD) per suddividere il segnale vocale in 16 sottobande (risoluzione 500 Hz ciascuna) (Figura 2).

3. Estrazione dei parametri delle caratteristiche

  1. Estrarre sequenze di coefficienti discreti dalle 16 sottobande ottenute tramite WPD a 4 livelli da Python 3.10, che servono come valori di input per tutte le equazioni di entropia descritte di seguito.
    NOTA: Tutte le equazioni utilizzate in questo studio sono state derivate da algoritmi precedentemente pubblicati (come nelle rreferenze) e non sono state derivate in modo indipendente.
  2. Calcola l'entropia approssimativa per le 16 sequenze di sottobande WPD usando la formula quisotto 14:
    figure-protocol-1(1)
    figure-protocol-2(2)
    Cim (r)={d[X(i), X(j)]Parametri: La dimensione del pattern m è scelta come 2, e la tolleranza di somiglianza r è selezionata come 0,1 a 0,25 volte la deviazione standard14.
  3. Calcola l'entropia campionaria per le 16 sequenze di sottobande WPD usando la formula quisotto 15:
    figure-protocol-3(4)
    figure-protocol-4(5)
    Bim (r) = {d[X(i), X(j)]Parametri: La dimensione del pattern m è scelta come 1 o 2, e la tolleranza di somiglianza r è selezionata come 0,1 a 0,25 volte la deviazione standard15.
  4. Calcola la funzione di appartenenza fuzzy con la formulaqui sotto 16:
    figure-protocol-5(7)
  5. Calcola l'entropia sfocata con la formula qui sotto17:
    figure-protocol-6(8)
    figure-protocol-7(9)
    figure-protocol-8(10)
    Parametri: La dimensione del pattern m è scelta come 2, e la tolleranza di somiglianza r è selezionata come 0,15 volte la deviazione standard.
  6. Calcola l'entropia delle permutazioni con la formula qui sotto18:
    figure-protocol-9(11)
    Parametri: La dimensione del pattern m è scelta come 6, e il ritardo temporale L = 2 è stato infine determinato per l'estrazione dell'entropia per permutazione.

4. Istituzione del modello

  1. Dividere i campioni vocali dei pazienti normali e dei pazienti con polipi delle corde vocali in un dataset di addestramento e un dataset di test con un rapporto 8:2.
  2. Utilizzare il dataset di addestramento per la regolazione dei parametri e l'addestramento del modello, poi applicare il classificatore risultante al dataset di test per la classificazione delle malattie.
  3. Esegui la procedura di modellazione SVM usando Python 3.10.
    1. Confermare la natura non lineare dei dati confrontando le prestazioni del kernel SVM. I test iniziali con un kernel lineare hanno prodotto scarsa accuratezza, mentre il nucleo della funzione di base radiale (RBF) ha migliorato significativamente i risultati di classificazione, dimostrando che lo spazio delle caratteristiche richiede un confine decisionale non lineare.
    2. Usa i vettori di entropia a 16 dimensioni (estratti tramite WPD) come input per il classificatore SVM. Implementa un kernel RBF per mappare le caratteristiche vocali non lineari in uno spazio ad alta dimensione.
    3. Esegui una ricerca a griglia usando Python (scikit-learn) per identificare la combinazione ottimale del coefficiente di penalità C e della larghezza del kernel γ durante la fase di addestramento. Valuta ogni insieme di parametri massimizzando il tasso di riconoscimento di validazione incrociata.
    4. Addestrare il modello SVM utilizzando campioni vocali di individui normali e pazienti con polipi delle corde vocali. Utilizzare gli iperparametri ottimali ottenuti dalla ricerca in griglia per costruire il modello addestrato finale.
    5. Applica il modello addestrato a campioni di prova non visti. Ogni campione di prova segue la stessa procedura di WPD e estrazione dell'entropia dei dati di addestramento. La SVM prevede l'etichetta binaria della classe (polipi normali vs. polipi delle corde vocali) basandosi sulla posizione spaziale del vettore delle caratteristiche di test rispetto al confine decisionale ottimizzato.
  4. Esegui la procedura di modellazione XGBoost usando Python 3.10.
    1. Utilizza una ricerca a griglia basata su Python per ottimizzare iperparametri chiave (inclusi tasso di apprendimento e profondità dell'albero) durante la fase di addestramento. Valuta più combinazioni di parametri tramite validazione incrociata per identificare la configurazione che massimizza l'accuratezza della classificazione.
    2. Addestra un classificatore binario XGBoost usando le sedici caratteristiche di entropia estratte dai campioni vocali. Applicare gli iperparametri ottimali ottenuti dalla ricerca a griglia per costruire il modello finale.
    3. Testa il modello addestrato su un set di validazione indipendente composto da campioni non visti. Questo passaggio valuta la capacità di generalizzazione del classificatore valutandone le prestazioni su dati non utilizzati durante l'addestramento.

5. Valutazione delle prestazioni del modello

  1. Conduci un metodo di validazione incrociata a cinque punti.
    1. Partiziona casualmente il dataset vocale preelaborato in cinque pieghe uguali. Utilizzare quattro fold come set di addestramento per costruire il modello e usare il resto come set di validazione per la valutazione delle prestazioni.
    2. Ripeti questo processo cinque volte. Usa la media dei risultati delle cinque iterazioni come performance finale del modello.
  2. Ottieni la matrice di confusione.
    1. Genera la matrice di confusione confrontando le etichette previste dal classificatore con quelle di accuratezza per tutti i campioni di prova secondo i risultati di validazione incrociata a cinque volte. Aggregare questi confronti individuali in una tabella di contingenza utilizzando la libreria scikit-learn in Python per quantificare classificazioni corrette e errate, come mostrato nella Tabella 1.
  3. Calcola accuratezza, precisione, sensibilità e punteggio F1 per descrivere l'efficacia di un modello di classificazione. Le formule di calcolo rilevanti sono le seguenti.
    Accuratezza = (TP + TN)/(TP + TN + FP + FN)
    Precisione = TP/(TP + FP)
    Sensibilità = Richiamo = TPR = TP/(TP+ FN)
    F1 = (2 × Precisione × Richiamo)/ (Precisione + Richiamo)
    NOTA: Queste metriche (TP, TN, FP, FN) sono derivate dagli elementi della matrice di confusione.
  4. Descrivi la curva ROC con AUC.
    1. Traccia la curva ROC per visualizzare il compromesso tra il tasso di veri positivi (TPR) e il tasso di falsi positivi (FPR) su tutte le soglie di classificazione. Calcola l'Area Sotto la Curva (AUC) come metrica riassuntiva per quantificare la capacità discriminativa complessiva del modello.
      NOTA: Un valore AUC più vicino a 1 indica una probabilità maggiore che il classificatore distingua correttamente tra individui normali e coloro con polipi delle corde vocali, indipendentemente dalla specifica soglia decisionale.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In questo studio, l'analisi dei pacchetti wavelet è stata impiegata per eseguire la decomposizione tempo-frequenza dei segnali vocali. Integrando parametri dinamici non lineari—inclusi entropia approssimativa, entropia campionaria, entropia sfocata ed entropia di permutazione—sono state caratterizzate sistematicamente le caratteristiche di complessità e irregolarità delle voci patologiche associate ai polipi delle corde vocali. Successivamente furono costruiti due classificatori vocali p...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La diagnosi patologica della voce che utilizza l'analisi del segnale del parlato rappresenta un approccio non invasivo eoggettivo 19. Di conseguenza, la classificazione patologica della voce è emersa come un importante focus di ricerca nell'elaborazione e nel riconoscimento del segnale vocale, dimostrando un notevole valore di applicazione clinica e prospettive di sviluppo20. Questo studio ha utilizzato campioni di linguaggio raccolti da SV...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi in competizione.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il lavoro è stato supportato dal Progetto di Miglioramento delle Capacità Ospedaliere della Provincia di Jiangsu (JSPH-MC-2023-12). Gli autori desiderano ringraziare il Professore Associato Shan Li della School of Economics and Management e lo staff del Key Laboratory of Brain-Machine Intelligence Technology (Ministero dell'Istruzione) presso l'Università di Aeronautica e Astronautica di Nanchino per le loro indicazioni su metodologia, analisi dei dati e generazione di figure. Questi contributi hanno garantito il progresso fluido di questa ricerca.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
MATLAB The MathWorksR2023aPiattaforma software primaria per il calcolo numerico e la prototipazione di algoritmi.
Software PythonPython Software FoundationPython 3.10Linguaggio di programmazione fondamentale utilizzato durante tutto lo studio.
Saarbruecken Voice Database, SVDIstituto di Fonetica, Università del SaarlandSaarbrü Database vocale cken (SVD)Database pubblico di registrazioni vocali patologiche e normali. Contiene vocali sostenute e un linguaggio continuo da soggetti con condizioni che includono polipi delle corde vocali, oltre a controlli sani. Utilizzato per la ricerca accademica secondo i suoi termini di accesso specificati.

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

XGBoost ClassifierSpeech Signal AnalysisVoice DisordersWavelet PacketTime Frequency AnalysisNonlinear Dynamic ParametersEntropy FeaturesFive Fold Cross ValidationROC Curve

Articoli correlati