Aquí presentamos un protocolo para establecer un modelo de IA no invasivo basado en XGBoost para diagnosticar pólipos de cuerdas vocales utilizando la base de datos de Saarbrücken.
Artículo de método
Aquí presentamos un protocolo para establecer un modelo de IA no invasivo basado en XGBoost para diagnosticar pólipos de cuerdas vocales utilizando la base de datos de Saarbrücken.
Con el crecimiento continuo de la comunicación social humana, el número de personas que sufren trastornos de la voz también está aumentando. Debido a las ventajas objetivas y no invasivas de los métodos de detección acústica para la voz patológica, el uso del análisis de señales de voz para el reconocimiento de voz patológica se ha convertido en un punto de referencia para la investigación. Este artículo seleccionó primero 101 vocales continuas /a/ de la base de datos alemana SVD como objeto de investigación. En segundo lugar, utilizando tecnología de paquetes wavelet para el análisis tiempo-frecuencia, se extraen cuatro parámetros dinámicos no lineales, a saber, entropía aproximada, entropía muestral, entropía difusa y entropía de permutación, como conjunto de parámetros de características para el clasificador de voz patológico. Finalmente, se selecciona el algoritmo de aprendizaje automático XGBoost como método de reconocimiento de patrones para establecer un clasificador de voz patológico, y el rendimiento de la clasificación se verifica mediante validación cruzada de cinco veces y curva ROC. Los resultados experimentales han demostrado que la precisión del clasificador de voz patológico de XGBoost es 0,857, la puntuación F1 es 0,875 y el valor AUC es 0,944, todos ellos superiores al clasificador construido por SVM, lo que indica que XGBoost tiene un mejor rendimiento en reconocimiento de voz patológico.
El número de personas que sufren trastornos de la voz está en constante aumento. Según las estadísticas, un tercio de la población experimenta problemas de voz en algún momento de suvida 1. Para los usuarios profesionales de la voz, como cantantes y profesores, debido a su frecuente mal uso y abuso de la voz, la incidencia de enfermedades de garganta es mayor. Dos estudios realizaron encuestas a profesores en Tianjin y Urumqi, y los resultados mostraron que la probabilidad de sufrir trastornos de la voz es del 33,81% y 28,23%, respectivamentedel 2,3%. Como resultado, hay un énfasis creciente en la detección y diagnóstico de la voz patológica en la práctica clínica. Actualmente, los métodos de evaluación subjetiva, el examen de laringuscopía y los métodos de detección acústica se utilizan principalmente para el diagnóstico de enfermedades de la voz en la prácticaclínica 4,5. El método de detección acústica convierte las señales de voz en señales digitales para la investigación, asegurando la objetividad y evitando el dolor del paciente durante elexamen 6. Por ello, la detección acústica se ha convertido en una herramienta auxiliar eficaz para los médicos en el diagnóstico clínico, y la investigación sobre ella está aumentando.
Las técnicas más importantes para diagnosticar la voz patológica mediante métodos de análisis acústico son la extracción de características y el reconocimiento de patrones. Desde la década de 1960, los investigadores han estado extrayendo algunos parámetros acústicos tradicionales para el estudio de la voz patológica, y han encontrado muchos parámetros efectivos y robustos de características acústicas, como la perturbación de frecuencia fundamental, la perturbación de amplitud y los coeficientes cepstrales de frecuencia Mel (MFCC)7. En los últimos años, los investigadores no solo se han limitado a estudiar parámetros característicos acústicos tradicionales, sino que también han comenzado a utilizarse parámetros dinámicos no lineales en el campo del reconocimiento patológicode la voz 8. Además, tiene un efecto muy bueno. Con el rápido desarrollo del aprendizaje automático, han surgido más métodos de reconocimiento de patrones con alta velocidad de ejecución y buen rendimiento en la clasificación. También se utilizan cada vez más métodos de reconocimiento de patrones en el reconocimiento patológico de voz, como las máquinas de vectores de soporte (SVM), el bosque aleatorio, las redes neuronales y el aprendizajeprofundo 9,10. XGBoost es un método de reconocimiento de patrones que ha ganado atención en los últimosaños 11. No requiere normalización de características y puede seleccionar características por sí sola. Puede adaptarse a diversas funciones de pérdida y utiliza términos de regularización para evitar el sobreajuste. Tiene las características de velocidad rápida, portabilidad y tolerancia a fallos. Por ello, este artículo intenta aplicar el método XGBoost al reconocimiento patológico de voz para lograr mejores resultados de reconocimiento.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
El flujo de trabajo técnico de este estudio se ilustra en la Figura 1.
1. Adquisición de muestras de voz
2. Descomposición por paquetes de ondas de datos de voz13
3. Extracción de parámetros de características
(1)
(2)
(4)
(5)
(7)
(8)
(9)
(10)
(11)4. Establecimiento modelo
5. Evaluación del rendimiento del modelo
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
En este estudio, se empleó el análisis de paquetes wavelet para realizar la descomposición tiempo-frecuencia de las señales de voz. Al integrar parámetros dinámicos no lineales —incluyendo entropía aproximada, entropía muestral, entropía difusa y entropía de permutación— se caracterizaron sistemáticamente las características de complejidad e irregularidad de las voces patológicas asociadas a pólipos de cuerdas vocales. Posteriormente se construyeron dos clasificadores de voz patológicos ...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
El diagnóstico patológico de la voz mediante análisis de señales de voz representa un enfoque no invasivo y objetivo19. En consecuencia, la clasificación patológica de la voz ha surgido como un foco de investigación significativo en procesamiento y reconocimiento de señales de voz, demostrando un valor clínico sustancial y perspectivas de desarrollo20. Este estudio utilizó muestras de habla recogidas de SVD como corpus experimentales. Media...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Los autores declaran que no tienen intereses en competencia.
El trabajo contó con el apoyo del Proyecto de Mejora de la Capacidad del Hospital de la Provincia de Jiangsu (JSPH-MC-2023-12). Los autores desean agradecer al profesor asociado Shan Li de la Escuela de Economía y Gestión, y al personal del Laboratorio Clave de Tecnología de Inteligencia Cerebro-Máquina (Ministerio de Educación) de la Universidad de Aeronáutica y Astronáutica de Nankín, por su orientación en metodología, análisis de datos y generación de figuras. Estas contribuciones han asegurado el buen desarrollo de esta investigación.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
| Nombre | Empresa | Número de catálogo | Comentarios |
|---|---|---|---|
| MATLAB | The MathWorks | R2023a | Plataforma de software principal para computación numérica y prototipado de algoritmos. |
| Software en Python | Fundación de Software Python | Python 3.10 | Lenguaje de programación central utilizado a lo largo del estudio. |
| Base de Datos de Voz Saarbruecken, SVD | Instituto de Fonética, Universidad del Sarre | Sarreburgo; Base de Datos de Voz Cken (SVD) | Base de datos pública de grabaciones de voz patológicas y normales. Contiene vocales sostenidas y habla continua de sujetos con condiciones que incluyen pólipos de las cuerdas vocales, así como controles sanos. Se utiliza para investigación académica bajo sus términos de acceso especificados. |
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE
Solicitar permiso