Qui presentiamo un protocollo per stabilire un modello AI basato su XGBoost non invasivo per la diagnosi dei polipi delle corde vocali utilizzando il database di Saarbrücken.
Articolo metodologico
Qui presentiamo un protocollo per stabilire un modello AI basato su XGBoost non invasivo per la diagnosi dei polipi delle corde vocali utilizzando il database di Saarbrücken.
Con la continua crescita della comunicazione sociale umana, anche il numero di persone che soffrono di disturbi della voce sta aumentando. Grazie ai vantaggi oggettivi e non invasivi dei metodi di rilevamento acustico per la voce patologica, l'uso dell'analisi del segnale vocale per il riconoscimento vocale patologico è diventato un punto focale di ricerca. Questo articolo ha selezionato inizialmente 101 vocali continue /a/ dal database tedesco SVD come oggetto di ricerca. In secondo luogo, utilizzando la tecnologia dei pacchetti wavelet per l'analisi tempo-frequenza, quattro parametri dinamici non lineari, ovvero entropia approssimativa, entropia del campione, entropia fuzzy e entropia di permutazione, vengono estratti dai segnali secondari come set di parametri caratteristici per il classificatore vocale patologico. Infine, l'algoritmo di machine learning XGBoost viene selezionato come metodo di riconoscimento di pattern per stabilire un classificatore vocale patologico, e le prestazioni di classificazione vengono verificate utilizzando la validazione incrociata a cinque volte e la curva ROC. I risultati sperimentali hanno mostrato che l'accuratezza del classificatore vocale patologico di XGBoost è 0,857, il punteggio F1 è 0,875 e il valore AUC è 0,944, tutti superiori al classificatore costruito da SVM, indicando che XGBoost ha prestazioni migliori nel riconoscimento vocale patologico.
Il numero di persone che soffrono di disturbi della voce è in costante aumento. Secondo le statistiche, un terzo della popolazione sperimenta problemi di voce in qualche momento dellapropria vita 1. Per gli utenti professionisti della voce come cantanti e insegnanti, a causa del frequente uso improprio e abuso della voce, l'incidenza delle malattie della gola è più alta. Due studi hanno condotto sondaggi su insegnanti a Tianjin e Urumqi, e i risultati hanno mostrato che la probabilità di soffrire di disturbi della voce è rispettivamente del 33,81% e del 28,23%,rispettivamente del 2,3%. Di conseguenza, nella pratica clinica si pone sempre più enfasi sulla rilevazione e diagnosi della voce patologica. Attualmente, i metodi di valutazione soggettiva, l'esame della laringoscopia e i metodi di rilevamento acustico sono utilizzati principalmente per la diagnosi delle malattie della voce nella praticaclinica 4,5. Il metodo di rilevamento acustico converte i segnali vocali in segnali digitali per la ricerca, garantendo obiettività ed evitando il dolore del paziente durantel'esame 6. Pertanto, la rilevazione acustica è diventata uno strumento ausiliario efficace per i medici nella diagnosi clinica, e la ricerca in merito è in aumento.
Le tecniche più importanti per diagnosticare la voce patologica utilizzando metodi di analisi acustica sono l'estrazione delle caratteristiche e il riconoscimento dei pattern. Dagli anni '60, i ricercatori hanno estratto alcuni parametri acustici tradizionali per lo studio della voce patologica e hanno trovato molti parametri efficaci e robusti delle caratteristiche acustiche, come la perturbazione della frequenza fondamentale, la perturbazione di ampiezza e i coefficienti cepstrali a frequenza Mel (MFCC)7. Negli ultimi anni, i ricercatori non si sono limitati solo allo studio dei parametri caratteristici acustici tradizionali, ma hanno iniziato a essere utilizzati anche parametri dinamici non lineari nel campo del riconoscimento patologicodella voce 8. Ha anche un effetto molto buono. Con il rapido sviluppo del machine learning, sono emersi più metodi di riconoscimento di modelli con velocità di corsa elevata e buone prestazioni di classificazione. Esistono anche sempre più metodi di riconoscimento di pattern utilizzati nel riconoscimento vocale patologico, come le macchine a vettori di supporto (SVM), la foresta casuale, le reti neurali, il deeplearning 9,10. XGBoost è un metodo di riconoscimento di pattern che ha attirato l'attenzione negli ultimianni 11. Non richiede la normalizzazione delle caratteristiche e può selezionare le caratteristiche da sola. Può adattarsi a varie funzioni di perdita e utilizza termini di regolarizzazione per prevenire il sovrafitting. Ha le caratteristiche di velocità elevata, portabilità e tolleranza ai guasti. Pertanto, questo articolo cerca di applicare il metodo XGBoost al riconoscimento vocale patologico per ottenere risultati migliori nel riconoscimento.
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
Il flusso di lavoro tecnico di questo studio è illustrato nella Figura 1.
1. Acquisizione di campioni vocali
2. Decomposizione dei pacchetti wavelet dei dati vocali13
3. Estrazione dei parametri delle caratteristiche
(1)
(2)
(4)
(5)
(7)
(8)
(9)
(10)
(11)4. Istituzione del modello
5. Valutazione delle prestazioni del modello
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
In questo studio, l'analisi dei pacchetti wavelet è stata impiegata per eseguire la decomposizione tempo-frequenza dei segnali vocali. Integrando parametri dinamici non lineari—inclusi entropia approssimativa, entropia campionaria, entropia sfocata ed entropia di permutazione—sono state caratterizzate sistematicamente le caratteristiche di complessità e irregolarità delle voci patologiche associate ai polipi delle corde vocali. Successivamente furono costruiti due classificatori vocali p...
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
La diagnosi patologica della voce che utilizza l'analisi del segnale del parlato rappresenta un approccio non invasivo eoggettivo 19. Di conseguenza, la classificazione patologica della voce è emersa come un importante focus di ricerca nell'elaborazione e nel riconoscimento del segnale vocale, dimostrando un notevole valore di applicazione clinica e prospettive di sviluppo20. Questo studio ha utilizzato campioni di linguaggio raccolti da SV...
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
Gli autori dichiarano di non avere interessi in competizione.
Il lavoro è stato supportato dal Progetto di Miglioramento delle Capacità Ospedaliere della Provincia di Jiangsu (JSPH-MC-2023-12). Gli autori desiderano ringraziare il Professore Associato Shan Li della School of Economics and Management e lo staff del Key Laboratory of Brain-Machine Intelligence Technology (Ministero dell'Istruzione) presso l'Università di Aeronautica e Astronautica di Nanchino per le loro indicazioni su metodologia, analisi dei dati e generazione di figure. Questi contributi hanno garantito il progresso fluido di questa ricerca.
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
| Nome | Azienda | Numero di catalogo | Commenti |
|---|---|---|---|
| MATLAB | The MathWorks | R2023a | Piattaforma software primaria per il calcolo numerico e la prototipazione di algoritmi. |
| Software Python | Python Software Foundation | Python 3.10 | Linguaggio di programmazione fondamentale utilizzato durante tutto lo studio. |
| Saarbruecken Voice Database, SVD | Istituto di Fonetica, Università del Saarland | Saarbrü Database vocale cken (SVD) | Database pubblico di registrazioni vocali patologiche e normali. Contiene vocali sostenute e un linguaggio continuo da soggetti con condizioni che includono polipi delle corde vocali, oltre a controlli sani. Utilizzato per la ricerca accademica secondo i suoi termini di accesso specificati. |
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE
Richiedi permesso