Artículo de método

Investigación sobre reconocimiento patológico de voz basada en XGBoost

DOI:

10.3791/68784

29 de mayo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aquí presentamos un protocolo para establecer un modelo de IA no invasivo basado en XGBoost para diagnosticar pólipos de cuerdas vocales utilizando la base de datos de Saarbrücken.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Con el crecimiento continuo de la comunicación social humana, el número de personas que sufren trastornos de la voz también está aumentando. Debido a las ventajas objetivas y no invasivas de los métodos de detección acústica para la voz patológica, el uso del análisis de señales de voz para el reconocimiento de voz patológica se ha convertido en un punto de referencia para la investigación. Este artículo seleccionó primero 101 vocales continuas /a/ de la base de datos alemana SVD como objeto de investigación. En segundo lugar, utilizando tecnología de paquetes wavelet para el análisis tiempo-frecuencia, se extraen cuatro parámetros dinámicos no lineales, a saber, entropía aproximada, entropía muestral, entropía difusa y entropía de permutación, como conjunto de parámetros de características para el clasificador de voz patológico. Finalmente, se selecciona el algoritmo de aprendizaje automático XGBoost como método de reconocimiento de patrones para establecer un clasificador de voz patológico, y el rendimiento de la clasificación se verifica mediante validación cruzada de cinco veces y curva ROC. Los resultados experimentales han demostrado que la precisión del clasificador de voz patológico de XGBoost es 0,857, la puntuación F1 es 0,875 y el valor AUC es 0,944, todos ellos superiores al clasificador construido por SVM, lo que indica que XGBoost tiene un mejor rendimiento en reconocimiento de voz patológico.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El número de personas que sufren trastornos de la voz está en constante aumento. Según las estadísticas, un tercio de la población experimenta problemas de voz en algún momento de suvida 1. Para los usuarios profesionales de la voz, como cantantes y profesores, debido a su frecuente mal uso y abuso de la voz, la incidencia de enfermedades de garganta es mayor. Dos estudios realizaron encuestas a profesores en Tianjin y Urumqi, y los resultados mostraron que la probabilidad de sufrir trastornos de la voz es del 33,81% y 28,23%, respectivamentedel 2,3%. Como resultado, hay un énfasis creciente en la detección y diagnóstico de la voz patológica en la práctica clínica. Actualmente, los métodos de evaluación subjetiva, el examen de laringuscopía y los métodos de detección acústica se utilizan principalmente para el diagnóstico de enfermedades de la voz en la prácticaclínica 4,5. El método de detección acústica convierte las señales de voz en señales digitales para la investigación, asegurando la objetividad y evitando el dolor del paciente durante elexamen 6. Por ello, la detección acústica se ha convertido en una herramienta auxiliar eficaz para los médicos en el diagnóstico clínico, y la investigación sobre ella está aumentando.

Las técnicas más importantes para diagnosticar la voz patológica mediante métodos de análisis acústico son la extracción de características y el reconocimiento de patrones. Desde la década de 1960, los investigadores han estado extrayendo algunos parámetros acústicos tradicionales para el estudio de la voz patológica, y han encontrado muchos parámetros efectivos y robustos de características acústicas, como la perturbación de frecuencia fundamental, la perturbación de amplitud y los coeficientes cepstrales de frecuencia Mel (MFCC)7. En los últimos años, los investigadores no solo se han limitado a estudiar parámetros característicos acústicos tradicionales, sino que también han comenzado a utilizarse parámetros dinámicos no lineales en el campo del reconocimiento patológicode la voz 8. Además, tiene un efecto muy bueno. Con el rápido desarrollo del aprendizaje automático, han surgido más métodos de reconocimiento de patrones con alta velocidad de ejecución y buen rendimiento en la clasificación. También se utilizan cada vez más métodos de reconocimiento de patrones en el reconocimiento patológico de voz, como las máquinas de vectores de soporte (SVM), el bosque aleatorio, las redes neuronales y el aprendizajeprofundo 9,10. XGBoost es un método de reconocimiento de patrones que ha ganado atención en los últimosaños 11. No requiere normalización de características y puede seleccionar características por sí sola. Puede adaptarse a diversas funciones de pérdida y utiliza términos de regularización para evitar el sobreajuste. Tiene las características de velocidad rápida, portabilidad y tolerancia a fallos. Por ello, este artículo intenta aplicar el método XGBoost al reconocimiento patológico de voz para lograr mejores resultados de reconocimiento.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El flujo de trabajo técnico de este estudio se ilustra en la Figura 1.

1. Adquisición de muestras de voz

  1. Obtenga los datos experimentales del SVD en Alemania12.
  2. Obtén 101 casos de datos vocálicos /a/, incluyendo 45 casos (19 hombres y 26 mujeres) de pacientes con pólipos vocales y 56 casos (28 hombres y 28 mujeres) de individuos normales.

2. Descomposición por paquetes de ondas de datos de voz13

  1. Realizar una búsqueda exhaustiva en tres ondas de Daubechies (db1, 3, 5) y tres profundidades de descomposición (4, 6, 8 niveles) utilizando el software MATLAB R2023a.
  2. Utiliza una tasa de muestreo de 16 kHz, una descomposición de paquetes de ondas db3 de cuatro niveles (WPD) para repartir la señal de voz en 16 subbandas (resolución de 500 Hz cada una) (Figura 2).

3. Extracción de parámetros de características

  1. Extraer secuencias discretas de coeficientes de las 16 subbandas obtenidas mediante WPD de 4 niveles por Python 3.10, que sirven como valores de entrada para todas las ecuaciones de entropía descritas a continuación.
    NOTA: Todas las ecuaciones utilizadas en este estudio se derivaron de algoritmos previamente publicados (como enrreferencias) y no fueron derivadas de forma independiente.
  2. Calcula la entropía aproximada para las 16 secuencias de subbandas WPD usando la fórmula siguientea 14:
    figure-protocol-1(1)
    figure-protocol-2(2)
    Cim (r)={d[X(i), X(j)]Parámetros: La dimensión del patrón m se elige como 2, y la tolerancia de similitud r se selecciona como 0,1 a 0,25 veces la desviación estándar14.
  3. Calcula la entropía muestral para las 16 secuencias de subbandas WPD usando la fórmula siguientea 15:
    figure-protocol-3(4)
    figure-protocol-4(5)
    Bim (r) = {d[X(i), X(j)]Parámetros: La dimensión del patrón m se elige como 1 o 2, y la tolerancia de similitud r se selecciona como 0,1 a 0,25 veces la desviación estándar15.
  4. Calcula la función de pertenencia difusa con la fórmulasiguiente 16:
    figure-protocol-5(7)
  5. Calcula la entropía difusa con la fórmula que aparecea continuación 17:
    figure-protocol-6(8)
    figure-protocol-7(9)
    figure-protocol-8(10)
    Parámetros: La dimensión del patrón m se elige como 2, y la tolerancia de similitud r se selecciona como 0,15 veces la desviación estándar.
  6. Calcula la entropía de permutación con la fórmula inferiora 18:
    figure-protocol-9(11)
    Parámetros: La dimensión del patrón m se elige como 6, y finalmente se determinó el retardo temporal L = 2 para la extracción de entropía por permutación.

4. Establecimiento modelo

  1. Divide las muestras de voz de pacientes normales y con pólipos de las cuerdas vocales en un conjunto de datos de entrenamiento y otro de prueba con una proporción de 8:2.
  2. Utiliza el conjunto de datos de entrenamiento para ajustar parámetros y entrenamiento de modelos, y luego aplicar el clasificador resultante al conjunto de datos de prueba para la clasificación de enfermedades.
  3. Realiza el procedimiento de modelado SVM usando Python 3.10.
    1. Confirma la naturaleza no lineal de los datos comparando el rendimiento del núcleo SVM. Las pruebas iniciales con núcleo lineal dieron una precisión pobre, mientras que el núcleo de función base radial (RBF) mejoró significativamente los resultados de clasificación, demostrando que el espacio de características requiere un límite de decisión no lineal.
    2. Utiliza los vectores de características de entropía de 16 dimensiones (extraídos mediante WPD) como entrada para el clasificador SVM. Implementa un núcleo RBF para mapear las características de voz no lineales en un espacio de alta dimensión.
    3. Realiza una búsqueda en cuadrícula usando Python (scikit-learn) para identificar la combinación óptima del coeficiente de penalización C y el ancho del núcleo γ durante la fase de entrenamiento. Evalúa cada conjunto de parámetros maximizando la tasa de reconocimiento de validación cruzada.
    4. Entrenar el modelo SVM utilizando muestras de voz de individuos normales y pacientes con pólipos de las cuerdas vocales. Utiliza los hiperparámetros óptimos obtenidos de la búsqueda en cuadrícula para construir el modelo entrenado final.
    5. Aplica el modelo entrenado a muestras de prueba no vistas. Cada muestra de prueba realiza el mismo procedimiento de extracción de WPD y entropía que los datos de entrenamiento. La SVM predice la etiqueta de clase binaria (pólipos normales vs. pólipos de cuerdas vocales) basándose en la posición espacial del vector de característica de prueba respecto al límite de decisión optimizado.
  4. Realiza el procedimiento de modelado XGBoost usando Python 3.10.
    1. Utiliza una búsqueda en cuadrícula basada en Python para optimizar los hiperparámetros clave (incluyendo la tasa de aprendizaje y la profundidad del árbol) durante la fase de entrenamiento. Evalúa múltiples combinaciones de parámetros mediante validación cruzada para identificar la configuración que maximice la precisión de la clasificación.
    2. Entrena un clasificador binario XGBoost usando las dieciséis características de entropía extraídas de muestras de voz. Aplicar los hiperparámetros óptimos obtenidos de la búsqueda en cuadrícula para construir el modelo final.
    3. Prueba el modelo entrenado en un conjunto de validación independiente compuesto por muestras no vistas. Este paso evalúa la capacidad de generalización del clasificador evaluando su rendimiento sobre datos no utilizados durante el entrenamiento.

5. Evaluación del rendimiento del modelo

  1. Realizar un método de validación cruzada en cinco vías.
    1. Particiona el conjunto de datos de voz preprocesado aleatoriamente en cinco dobleces iguales. Utiliza cuatro pliegues como conjunto de entrenamiento para construir el modelo y utiliza el pliegue restante como conjunto de validación para la evaluación del rendimiento.
    2. Repite este proceso cinco veces. Utiliza la media de los resultados de las cinco iteraciones como rendimiento final del modelo.
  2. Obtén la matriz de confusión.
    1. Genera la matriz de confusión comparando las etiquetas predichas del clasificador con las etiquetas de verdad para todas las muestras de prueba según los resultados de la validación cruzada de cinco veces. Agrega estas comparaciones individuales en una tabla de contingencia usando la biblioteca scikit-learn de Python para cuantificar clasificaciones correctas e incorrectas, como se muestra en la Tabla 1.
  3. Calcula precisión, exactitud, sensibilidad y puntuación F1 para describir la efectividad de un modelo de clasificación. Las fórmulas de cálculo relevantes son las siguientes.
    Precisión = (TP + TN)/(TP + TN + FP + FN)
    Precisión = TP/(TP + FP)
    Sensibilidad = Recuperación = TPR = TP/(TP+ FN)
    F1 = (2 × Precisión × Recuperación)/ (Precisión + Recuperación)
    NOTA: Estas métricas (TP, TN, FP, FN) se derivaron de los elementos de la matriz de confusión.
  4. Describe la curva ROC con AUC.
    1. Grafica la curva ROC para visualizar el equilibrio entre la tasa de verdaderos positivos (TPR) y la tasa de falsos positivos (FPR) en todos los umbrales de clasificación. Calcula el Área Bajo la Curva (AUC) como una métrica resumen para cuantificar la capacidad discriminativa global del modelo.
      NOTA: Un valor AUC más cercano a 1 indica una mayor probabilidad de que el clasificador distinga correctamente entre individuos normales y aquellos con pólipos de cuerdas vocales, independientemente del umbral específico de decisión.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En este estudio, se empleó el análisis de paquetes wavelet para realizar la descomposición tiempo-frecuencia de las señales de voz. Al integrar parámetros dinámicos no lineales —incluyendo entropía aproximada, entropía muestral, entropía difusa y entropía de permutación— se caracterizaron sistemáticamente las características de complejidad e irregularidad de las voces patológicas asociadas a pólipos de cuerdas vocales. Posteriormente se construyeron dos clasificadores de voz patológicos ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El diagnóstico patológico de la voz mediante análisis de señales de voz representa un enfoque no invasivo y objetivo19. En consecuencia, la clasificación patológica de la voz ha surgido como un foco de investigación significativo en procesamiento y reconocimiento de señales de voz, demostrando un valor clínico sustancial y perspectivas de desarrollo20. Este estudio utilizó muestras de habla recogidas de SVD como corpus experimentales. Media...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El trabajo contó con el apoyo del Proyecto de Mejora de la Capacidad del Hospital de la Provincia de Jiangsu (JSPH-MC-2023-12). Los autores desean agradecer al profesor asociado Shan Li de la Escuela de Economía y Gestión, y al personal del Laboratorio Clave de Tecnología de Inteligencia Cerebro-Máquina (Ministerio de Educación) de la Universidad de Aeronáutica y Astronáutica de Nankín, por su orientación en metodología, análisis de datos y generación de figuras. Estas contribuciones han asegurado el buen desarrollo de esta investigación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
MATLAB The MathWorksR2023aPlataforma de software principal para computación numérica y prototipado de algoritmos.
Software en PythonFundación de Software PythonPython 3.10Lenguaje de programación central utilizado a lo largo del estudio.
Base de Datos de Voz Saarbruecken, SVDInstituto de Fonética, Universidad del SarreSarreburgo; Base de Datos de Voz Cken (SVD)Base de datos pública de grabaciones de voz patológicas y normales. Contiene vocales sostenidas y habla continua de sujetos con condiciones que incluyen pólipos de las cuerdas vocales, así como controles sanos. Se utiliza para investigación académica bajo sus términos de acceso especificados.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Clasificador XGBoostan lisis de se ales de hablatrastornos de la vozpaquetes de ndulasan lisis de tiempo frecuenciapar metros din micos no linealescaracter sticas de entrop avalidaci n cruzada de cinco plieguescurva ROC

Artículos relacionados