Artículo de revisión

Arquitectura multimodal para la imprecisión del marcado fonemático en el habla disartrítica: integrando transformadores y TCNs para la rehabilitación clínica

DOI:

10.3791/70447

26 de mayo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta revisión examina cómo las arquitecturas multimodales que combinan información auditiva, articulatoria y visual, junto con modelos de transformadores y TCN, pueden mejorar la identificación de fonemas en el habla disartrícia. Enfatiza su potencial para mejorar la evaluación de la inteligibilidad del habla y la terapia personalizada más allá de las capacidades de los sistemas ASR típicos.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Debido a problemas de articulación y variabilidad fonemática, los trastornos del habla como la disartria plantean desafíos significativos en la rehabilitación clínica. Los sistemas tradicionales de reconocimiento automático de voz (ASR), que normalmente se entrenan con conjuntos de datos normativos, a menudo no logran decodificar con precisión el habla disartrícia. Los avances recientes en inteligencia artificial y aprendizaje profundo han permitido la integración de arquitecturas multimodales, como la fusión de información auditiva, articulatoria y visual, para registrar patrones complejos de habla, lo que lo hace cada vez más posible. En esta revisión, hemos explorado la convergencia de transformadores y redes convolucionales temporales (RTC) dentro de marcos multimodales para abordar la imprecisión del etiquetado fonemático en el habla disartrícia. Aquí discutimos cómo el modelado contextual basado en transformadores y la precisión temporal impulsada por TCN pueden mejorar la detección de límites fonemicos, la clasificación y la retroalimentación de rehabilitación. La revisión también analiza el potencial de estos sistemas híbridos en logopedia individualizada, cuestiones de interpretabilidad y aplicaciones clínicas. Las arquitecturas multimodales son un enfoque traslacional para mejorar la monitorización terapéutica, las ayudas a la comunicación y la evaluación de la inteligibilidad del habla en personas con trastornos motores del habla, mediante la conexión entre la medicina clínica y la informática médica.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El deterioro del sistema nervioso puede a menudo provocar consecuencias drásticas y abruptas para la salud, que incluyen trastornos musculoesqueléticos, trastornos neurovasculares y otros como trastornos neurogénicos de la comunicación. Los trastornos neurogénicos de la comunicación incluyen trastornos como la disartria y la apraxia, que pueden definirse como habla arrastrada debido a debilidad muscular y dificultad para planificar los movimientos del habla, respectivamente1. El habla está compuesto por cinco subsistemas: respiración, fonación, resonancia, articulación y prosodia, todos los cuales deben trabajar juntos de forma sinérgica y fluida para comunicarseeficazmente 2. La disartria, causada por disfunciones en estos subsistemas, reduce la audibilidad, naturalidad, inteligibilidad y eficiencia de la comunicación, lo que, a su vez, afecta significativamente la vida de los pacientes y sus familias. La disartria puede estar causada por diversas enfermedades neurológicas y patologías subyacentes, incluyendo disfunciones en la corteza cerebral, ganglios basales, cerebelo, núcleos basales, nervios craneales o nervios periféricos. Otros factores incluyen problemas motores primarios de la lengua, laringe ygarganta 3.

La disartria es un término general para los trastornos motores del habla causados por un cambio en el control neuromuscular que afecta a la respiración, la fonación, la resonancia, la producción del habla, la vocalización y el ritmo. Así, la disartria es un trastorno del habla que a menudo se asocia con deterioros y lesiones neuromusculares, en los que los músculos utilizados para el habla son débiles, lentos o están paralizados. Los tipos específicos de músculos implicados en el habla incluyen los de la lengua, la garganta, la cara, los labios, las cuerdas vocales, las mandíbulas y los músculos de las vías respiratorias superiores. El daño a estos músculos puede adoptar diversas formas, incluyendo lesiones a las neuronas motoras que los inervan o a su vasculatura, privándoles de oxígeno. Los daños neurológicos típicos que dificultan la conducción del habla incluyen daños a las neuronas motoras superiores que pueden provocar rigidez o espasticidad de los músculos del habla, lesiones en las neuronas motoras inferiores que pueden provocar debilidad o parálisis muscular como resultado de señales nerviosas interrumpidas, lesiones cerebelosas que a menudo resultan en falta de coordinación entre los músculos (ataxia) o el daño ganglionar basal que dificulta los movimientos coordinados y puede provocar movimientos involuntarios (hipercinéticos) o rigidez de los músculos (movimientos hipocinéticos)5.

La disartria es un síntoma común de diversos trastornos neurológicos y frecuentemente se asocia a enfermedades neurológicas progresivas. Tiene un impacto significativo en el paciente y sus familias, ya que la comunicación desempeña un papel crucial en la expresión de la personalidad y el mantenimiento de las conexiones sociales. El trastorno se caracteriza por una disminución de la inteligibilidad del habla. El contenido del lenguaje hablado se mantiene intacto, permitiendo al paciente escribir e interpretar tanto el lenguaje hablado como el escrito; Por otro lado, la anartria es el tipo más grave, lo que resulta en la pérdida total de la salida motoradel habla 6. Existen seis clasificaciones principales de disartria: disartria flácida, que está relacionada con la disfunción de la menor neurona motora; disartria espástica, que surge de daños en las neuronas motoras superiores conectadas a las regiones motoras de la corteza cerebral; disartria ataxica, que resulta principalmente de problemas cerebelosos; y disartria hipercinética e hipocinética, ambas asociadas con trastornos del sistema extrapiramidal. El sexto tipo se denomina típicamente disartria mixta y a menudo se asocia con daños en múltiples áreas, lo que conduce a características del habla que muestran rasgos de al menos dos categorías. Los trastornos del habla asociados a estos seis tipos principales de disartria son únicos y pueden ayudar en el diagnóstico y tratamiento de ladisartria 5,6.

Los factores etiológicos que contribuyen a los desafíos con la articulación incluyen infecciones (como la enfermedad de Creutzfeldt–Jakob y el síndrome de inmunodeficiencia adquirida), problemas vasculares (tanto ictus isquémicos como hemorrágicos), tumores (neoplasias cerebrales), enfermedades desmielinizantes (incluyendo esclerosis múltiple y síndrome de Guillain–Barré), trastornos degenerativos (como la enfermedad de Parkinson y la enfermedad de Huntington), lesiones (lesiones cerebrales traumáticas y parálisis cerebral), exposiciones tóxicas (a metales pesados, alcohol y drogas), y condiciones genéticas (por ejemplo, SANDO)7. Además, factores no neurológicos, como el labio leporino o el paladar hendido, también pueden causar problemas de articulación, pero estos no entran en la categoría dedisartria 8.

La importancia de la disartria en entornos clínicos radica en su impacto significativo en la calidad de vida de las personas. Dado que la comunicación es esencial para la participación social, educativa y profesional, quienes la padecen a menudo experimentan sentimientos de aislamiento y un bienestardisminuido 6. Diagnosticar con precisión los distintos tipos de disartria, por ejemplo, flácida, espástica, ataxica, hipercinética, hipocinética y mixta, es esencial para identificar los problemas neurológicos subyacentes y evaluar los enfoques de rehabilitación. Los logopedas y clínicos suelen depender del análisis de las características y la gravedad de la disartria para personalizar la terapia, establecer objetivos de comunicación alcanzables y evaluar la necesidad de métodos de comunicación aumentativosy alternativos 9. Para quienes tienen dificultades del habla, se ha comprobado que los sistemas de reconocimiento automático de voz (ASR) mejoran la accesibilidad y la interacción social. No obstante, la insuficiencia de modelos acústicos ha obstaculizado el éxito general de la ASR en el tratamiento de los disturbios del habla. Así, este artículo profundiza en problemas fonémicos en el habla disartrícia, los sistemas existentes de RSA y sus límites, técnicas multimodales creativas, modelado contextual basado en transformadores y los NTC para el refinamiento temporal y secuencial.

Incluso con un avance sustancial en la tecnología de RSA, los mejores sistemas de RSA siguen presentando numerosas carencias para las personas con discapacidades del habla. Estas carencias pueden deberse en parte a las dificultades para obtener un conjunto de datos de entrenamiento diverso y representativo sobre trastornos del habla. Un desafío en la ASR del habla desordenada probablemente esté vinculado a la amplia gama de características anómalas del habla que varían de una persona a otra, y a la representación inadecuada de estas variaciones en los conjuntos de datos deentrenamiento 10. A pesar de ello, la investigación sobre la ASR relacionada con la disartria a menudo ha pasado por alto esta diversidad.

Los sistemas ASR se dividen en tres categorías: independientes del hablante (SI), dependientes del hablante (SD) y adaptativos al altavoz (SA). Los sistemas SI funcionan bien con hablantes sanos, pero tienen dificultades con el habla degradada y rinden mejor cuando los datos de entrenamiento incluyen hablantes disartrícos. En cambio, los sistemas SD se centran en usuarios individuales, alcanzando una excelente precisión, mientras que los sistemas SA se adaptan al habla del usuario con el tiempo y superan tanto a los modelos SI como SD. Sin embargo, tanto los sistemas SA como SD requieren datos de entrenamiento, lo que supone otra barrera para quienes padecen trastornosneurodegenerativos 11. A pesar de los avances significativos, los modelos ASR existentes siguen siendo inadecuados para hablantes con discapacidad, debido a la falta de diferentes conjuntos de datos de entrenamiento. Para cubrir esta carencia, deben desarrollarse metodologías exhaustivas de recopilación de datos que capturen diversos aspectos de la disartria, mejorando así el rendimiento de la RSA para hablantes difíciles de reconocer.

Para superar estas limitaciones, las estrategias multimodales que combinan señales acústicas, articulatorias y visuales pueden representar eficazmente la producción y el refinamiento del habla en los síntomas disartrícos de manera integral. Por ejemplo, los datos sobre el movimiento articulatorio, como la imagen de la lengua, se obtienen mediante ecografía y articulografía electromagnética. Estos datos suelen combinarse con movimientos visuales de los labios y pueden compensar información acústica alterada, mejorando la capacidad de distinguir y diferenciarfonemas 12. Esta redundancia encontrada en sistemas multimodales es coherente con los métodos de evaluación clínica, lo que fortalece la capacidad de los terapeutas para observar los movimientos orofaciales junto con el habla auditiva. Por el contrario, los marcos de aprendizaje profundo, especialmente transformers y TCNs, ofrecen un modelado superior de las dependencias temporales y variaciones dentro de las secuencias de voz. Estos modelos funcionan permitiendo a los transformadores capturar relaciones contextuales generales, facilitando la identificación de fonemas incluso cuando las señales acústicas están disminuidas, oscurecidas oreducidas 13. Las RCT contribuyen además proporcionando campos receptivos estables y suavizado temporal, lo que mejora la precisión de la detección de los límites fonemicos. Cuando se integran dentro de marcos de fusión multimodal, ambos enfoques mejoran enormemente la precisión del marcado fonemático en el habla disartríca y facilitan una rehabilitación clínica más precisa y orientada a la retroalimentación. Por lo tanto, estas arquitecturas de aprendizaje profundo multimodal están directamente alineadas con objetivos clínicos en tiempo real, como mejorar la medición de la inteligibilidad del habla, monitorizar el proceso de rehabilitación y proporcionar terapias asistidas por tecnología personalizadas para los perfiles específicos de discapacidad motora del habla delos individuos. 14.

Aunque estas arquitecturas multimodales de aprendizaje profundo tienen un gran potencial para resolver imprecisiones en el etiquetado fonemico, su transferencia efectiva de marcos experimentales a herramientas diagnósticas fiables requiere una estructura operativa uniforme. Para abordar esto, el siguiente estudio describe un flujo de trabajo computacional integral que abarca la recogida de datos multimodales, la extracción de características y el entrenamiento de modelos. El objetivo es garantizar que estos sistemas complejos sean reproducibles y verificables en una amplia variedad de situaciones clínicas. Establecer una cadena metodológica tan transparente es fundamental para que logopedas e ingenieros clínicos validen algoritmos a través de una amplia gama de características y niveles de discapacidad de los pacientes. Finalmente, esta metodología sistemática sirve como precursora de la implementación clínica, permitiendo la integración de modelos avanzados de voz en evaluaciones regulatorias, sistemas electrónicos de salud y plataformas de monitorización de tratamientos a largo plazo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Revisión y perspectiva

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Visión general de la adquisición de datos multimodales en el habla disartrídica

La recopilación de datos multimodales es necesaria para examinar a fondo el control motor del habla y desarrollar técnicas diagnósticas y de rehabilitación eficientes, dada la complejidad y diversidad de los síntomas disartrícos.

Montaje acústico de grabación

El canal acústico sigue siendo central. Las grabaciones se realizan mejor en un entorno tratado acústicamente para mitigar la reverberación y el ruido ambiental. Los micrófonos típicos son condensadores de alta calidad y son unidades cardioides montadas en la cabeza o sobre mesa, posicionadas de forma consistente para controlar el nivel de señal y evitar variaciones entre sesiones. Las tasas de muestreo de 16 kHz o 44,1 kHz son muy comunes, donde 16 kHz es suficiente para el análisis de inteligibilidad y prosodia, mientras que 44,1 kHz proporciona mayor fidelidad, lo cual es útil para investigaciones acústicas/fonatorias de grano fino. Las interfaces de audio multicanal permiten la captura síncrona de múltiples flujos y deben mantener ajustes de ganancia y headroom consistentes para evitar saturaciones o ruido de fondo. Para la reproducibilidad, es importante establecer la calibración y documentar la ganancia del micrófono, el nivel de ruido ambiental y la deriva. En los corpus del habla disartrícos, la calidad del audio es especialmente importante porque los defectos de la señal acústica pueden ser sutiles y pueden ser fácilmente disimulados por malas condiciones de grabación15.

Modalidades opcionales de articulación / seguimiento labial / EMG / ecografía

Para ir más allá de la onda acústica, a menudo se requieren modalidades adicionales para capturar la cinemática articulatoria y la actividad muscular fisiológica. Así, el seguimiento labial o la captura de movimiento facial permite cuantificar la apertura, movimiento, velocidad y simetría de labios y mandíbulas. La articulografía electromagnética (EMA) rastrea los sensores de lengua, mandíbula y labio en tres dimensiones y proporciona resolución temporal/posicional de los articuladores, mientras que la electromiografía de superficie (sEMG) registra la actividad muscular para explorar déficits de activación neuromuscular subyacentes a la disartria. La ecografía de la imagen de la lengua (ITU) proporciona imágenes en tiempo real de la superficie de la lengua durante la articulación, útil en sujetos que no toleran la EMA. Los sistemas multimodales muestran que la identificación de déficits motores del habla mejora mediante acústica concurrente, complementada con captura articulatoria/visual 16.

Consideraciones éticas y consentimiento del paciente

Trabajar con hablantes disartrícos frecuentemente involucra poblaciones vulnerables. Los investigadores deben obtener la aprobación de la junta de revisión institucional (IRB) o del comité de ética, y garantizar un consentimiento informado que explique las modalidades de grabación (audio, vídeo, sensores fisiológicos), almacenamiento, anonimización, uso futuro y derechos de retirada. Los formularios de consentimiento deben abordar explícitamente la captura de vídeo (seguimiento labial/facial) y, opcionalmente, modalidades sensibles como EMG. La privacidad de los datos debe gestionarse, especialmente cuando se almacenan imágenes de vídeo o faciales. Es necesario evaluar el nivel de comodidad, agotamiento, limitaciones de movimiento y riesgo potencial del participante. Las sesiones deben incluir periodos de descanso y se debe decir a los participantes que pueden parar en cualquier momento sin enfrentarse a consecuencias. La escasez y diversidad de participantes en la investigación del corpus del habla disartríca enfatizan aún más la importancia del rigor ético17.

Pasos de preprocesamiento de datos (segmentación, reducción de ruido, normalización)

El sistema MAV-HuBERT alinea temporalmente los datos acústicos y visuales a nivel de fotograma, extrayendo energías de banco de filtro logarítmico de 26 dimensiones de la forma de onda original y sincronizándolas con fotogramas visuales de 25 Hz recogidos mediante identificación facial basada en Dlib. Los fotogramas de audio consecutivos suelen combinarse para estabilizar fluctuaciones a corto plazo, y las regiones visuales fusionadas se normalizan espacialmente antes de la fusión de características multimodales. Estas actividades de preprocesamiento proporcionan consistencia temporal continua y reducen la variabilidad entre modalidades de audio y visual, resultando en una mayor precisión de identificación a nivelposterior 15,18.

Ingeniería de características y flujo de trabajo computacional

Los modelos de aprendizaje profundo multimodales requieren representaciones sincronizadas de información acústica, articulatoria y visual para etiquetar con precisión los fonemas en el habla disartrícia. Esta sección ofrece un esquema de las técnicas de representación de características utilizadas en el análisis multimodal del habla, seguido de un flujo de trabajo computacional paso a paso para extraer y alinear estas características antes del entrenamiento del modelo.

Extracción y representación de características

En el análisis multimodal del habla, las señales de audio y movimiento en bruto deben convertirse en representaciones significativas que puedan ser procesadas por modelos de aprendizaje profundo. Una de las representaciones más utilizadas es el espectrograma, que muestra cómo varía la energía de la señal a lo largo del tiempo y entre frecuencias. Las representaciones basadas en espectrogramas son útiles para captar características como el arrastre, la dificultad respiratoria y el tiempo irregular, que se observan comúnmente en el habladisartríca 19.

Otra característica comúnmente utilizada son los Coeficientes Cepstrales de Frecuencia Mel (MFCCs), que representan las propiedades espectrales del habla de una manera que se aproxima a la percepción auditiva humana. Las características MFCC se utilizan ampliamente en el reconocimiento de voz porque proporcionan representaciones compactas y robustas al ruido que permanecen estables incluso cuando el habla estádistorsionada 20. Además de las características acústicas, los enfoques multimodales incorporan información articulatoria, como las trayectorias de movimiento de la lengua, los labios y la mandíbula. Estas señales pueden obtenerse mediante articulación electromagnética (EMA), imagen por ultrasonido de la lengua (ITU) o seguimiento óptico del movimiento. Las características articulatorias proporcionan información directa sobre el control motor del habla y ayudan a compensar señales acústicasdegradadas 21.

La información visual también es útil para analizar el habla disartrícia. Los puntos de referencia faciales extraídos de grabaciones de vídeo, incluyendo el contorno de los labios, el desplazamiento de la mandíbula y la apertura de la boca, proporcionan pistas adicionales sobre la articulación. Estas características visuales mejoran la discriminación fonemática, especialmente cuando la señal acústica no es clara. Para el aprendizaje supervisado, todos los flujos de características deben estar alineados con transcripciones a nivel fonema, asegurando que cada marco temporal corresponda a la unidad de voz correcta. Una alineación precisa es esencial para entrenar modelos de etiquetado fonemico, especialmente en el habla disartrícia, donde los límites fonémicos suelen estardifuminados 22.

Flujo de trabajo computacional

Esta sección demuestra cómo se requiere cada paso para reproducir el flujo de trabajo multimodal de etiquetado fonemico, desde la extracción de características hasta la evaluación del modelo (Figura 1).

Extracción de características acústicas mediante espectrogramas y MFCCs

Primero, se utiliza la transformada de Fourier de corto tiempo (STFT) para transformar la señal de voz en bruto en una representación tiempo-frecuencia. Para crear un espectrograma, la señal se divide en breves marcos superpuestos, y cada fotograma se somete a la transformada de Fourier.
Los Coeficientes Cepstrales de Frecuencia Mel (MFCC) se utilizan para extraer características acústicas ponderadas perceptualmente del espectrograma. Para el reconocimiento de voz y el análisis de disartria, las MFCC ofrecen representaciones compactas y robustas alruido 23,24. Debido a su robustez y efectividad, las MFCC se utilizan comúnmente en aplicaciones relacionadas con el reconocimiento de habla y hablante. Así, debido a su utilidad, se extraen MFCC para calcular y aproximar los niveles de percepción auditiva humana y proporcionar características acústicas comprimidas y resistentes al ruido, posteriormente25.

Adquisición de trayectorias articulatorias

Se obtienen datos de movimiento articulatorio para capturar el movimiento físico de los órganos del habla. La articulografía electromagnética (EMA) utiliza sensores acoplados a la lengua, los labios y la mandíbula para seguir el movimiento articulatorio en tres dimensiones. Alternativamente, se puede utilizar la imagen por ultrasonido de la lengua (ITU) para estimar el movimiento de la lengua de forma no invasiva. Las trayectorias grabadas se filtran, normalizan y reducen para ajustarse a la tasa de fotogramas de las características acústicas y así asegurar una consistencia temporal26. Convertir el habla en secuencias de imagen por ultrasonido de la lengua (ITU) es una técnica para estimar las trayectorias de la lengua por ultrasonido a partir de datos de habla, mapeando características auditivas con movimientos fisiológicos de la lengua. Esta metodología ofrece una alternativa no invasiva a las técnicas de recogida directa de datos articulatorios, necesarias para monitorizar y tratar anomalías del habla y del tracto vocal, evitando la necesidad de equipos específicos y experiencia clínica inherentes a los enfoques de medicióndirecta 27,28. En función de la disponibilidad de características articulatorias, como trayectorias de movimiento de la lengua, los labios y las mandíbulas, que se registran mediante EMA o ultrasonografía (ITU), las señales se filtran y reducen para ajustarse a la velocidad de los fotogramas acústicos.

Detección de puntos de referencia visuales

Para las entradas de voz y vídeos, las entradas de teclas faciales (comisuras de labios, movimiento de las líneas de la mandíbula) deben extraerse mediante herramientas como Mediapipe o OpenFace, y luego normalizarse para eliminar efectos de pose de cabeza. MediaPipe emplea un marco de aprendizaje profundo para estimar posturas faciales y corporales, proporcionando 33 puntos de referencia para el reconocimiento general de posturas, de los cuales 11 son específicamente para el rostro. Su efectividad puede variar, especialmente en casos de oclusiones. El modelo MediaPipe FaceMesh mejora la fiabilidad utilizando 468 puntos de referencia 3D de la cara junto con un método geométrico para la estimación de la posturade la cabeza 29. OpenFace 2.0 funciona como una caja de herramientas para analizar comportamientos faciales, permitiendo la detección de puntos de referencia faciales, estimación de postura de cabeza, seguimiento de la mirada ocular y reconocimiento de unidades de acción facial. Soporta la integración con varios lenguajes de programación y puede procesar transmisiones de vídeo en directo o imágenes fijas. Las salidas, como puntos de referencia faciales y vectores de mirada, pueden exportarse en formato CSV. OpenFace 2.0 utiliza el Modelo Local Restringido por Expertos Convolucionales (CE-CLM), que incluye un modelo de distribución de puntos para tener en cuenta variaciones en las formas de los puntos de referencia y expertos en parches para diferencias en aparienciaslocales 29,30.

Alineamientos de transcripción fonemática

El siguiente paso es alinear temporalmente todos los flujos destacados (acústicos, articulatorios y visuales) con anotaciones a nivel fonemático utilizando herramientas de alineación forzada como el Montreal Forced Aligner (MFA), asegurando entradas multimodales sincronizadas para el entrenamiento computacional de modelos. La alineación forzada (FA) es la técnica de alinear transcripciones con señales de audio para determinar los límites temporales de las unidades de habla. Esto permite un procesamiento de audio más preciso y avanza en el estudio lingüístico. Se emplea cada vez más en estudios fonéticos y ha demostrado ser sustancialmente más rápida que la alineación manual. Aunque generalmente está asociada con sistemas de reconocimiento automático de voz (ASR), la FA es una tarea más amplia dentro del procesamiento automático del habla que incluye el análisis y la transcripción del lenguajehablado 22. El alineador forzado de Montreal (MFA) es una de las mejores herramientas de FA que utiliza algoritmos HMM-GMM para lograr una alineación efectiva. A pesar de los avances en la tecnología ASR, enfoques tradicionales como HMM-GMM siguen siendo populares para tareas de FA. El MFA utiliza características MFCC y un método de entrenamiento en cuatro etapas para crear modelos acústicos con alineación fonéticaprecisa 31.

Componentes de la arquitectura de los modelos

Los modelos de aprendizaje profundo multimodal para el reconocimiento de voz disartríco consisten en varios componentes clave que trabajan juntos para capturar información contextual, temporal y multimodal. Los componentes principales incluyen un codificador contextual, un módulo de refinamiento temporal y un mecanismo de fusión multimodal. Cada componente desempeña un papel específico en la mejora de la precisión del etiquetado fonemático en el habla desordenada.

Codificador contextual basado en transformadores

El codificador de transformador se utiliza para modelar dependencias de largo alcance en secuencias de voz. El habla disartríca suele contener tiempos irregulares y límites fonémicos poco claros, lo que dificulta que los modelos convencionales capturen información contextual. Los transformadores utilizan la autoatención multi-cabeza para analizar las relaciones entre diferentes marcos temporales en la secuencia de entrada. Esto permite al modelo considerar tanto los marcos de habla pasados como futuros al predecir fonemas. Como resultado, el codificador puede manejar mejor las variaciones de articulación y pronunciación comunes en la disartria. En la arquitectura multimodal, el transformador recibe características acústicas, articulatorias y visuales sincronizadas y produce representaciones conscientes del contexto que se pasan a la siguiente etapa del modelo32,33.

Refinamiento de secuencias temporales basado en TCN

Tras la codificación contextual, la secuencia de características es procesada por una Red Convolucional Temporal (TCN) para mejorar la precisión temporal. El habla disartrítica suele contener tiempos inestables, pausas y fonemas alargados, que requieren refinamientos adicionales más allá del modelado contextual. Los TCN utilizan convoluciones causales dilatadas para capturar dependencias temporales largas manteniendo la eficiencia computacional. Esta estructura permite al modelo suavizar predicciones ruidosas y mantener límites fonémicos consistentes a lo largo del tiempo. En la arquitectura, el TCN recibe la salida del codificador del transformador y refina la secuencia para producir representaciones de características estables y temporalmenteconsistentes 33,34,35.

Estrategia de fusión multimodal

Para aumentar la precisión diagnóstica en la evaluación de la disartria, la fusión multimodal incorpora información de numerosas fuentes como voz, texto, vídeo y sensores fisiológicos. Las técnicas principales constan de tres pasos distintos: fusión temprana, fusión tardía y fusiónintermedia 36. La fusión temprana combina datos de muchas modalidades a un nivel fundamental, permitiendo a los modelos entender relaciones complejas desde el principio. Su uso es limitado ya que requiere sincronizar varias tasas de muestreo y tipos de datos. La fusión tardía procesa cada modalidad utilizando modelos independientes antes de combinar los resultados para las evaluaciones finales. Esta técnica es flexible y eficaz cuando faltan datos de una modalidad. Además, la fusión intermedia integra modalidades a nivel medio, a menudo utilizando técnicas de atención cruzada para detectar dependencias. Este método ha sido especialmente útil en contextos clínicos, mejorando los resultados al combinar referencias lingüísticas con datos acústicos. En resumen, la fusión intermedia con atención cruzada produce resultados superiores en la evaluación automática de disartria que los métodos basados en una solamodalidad 36,37.

Mejores prácticas para entrenar y evaluar modelos de disartria:

Desarrollar modelos fibrosos para la evaluación y reconocimiento de la disartria requiere una atención cuidadosa para la partición del conjunto de datos, la evaluación de las métricas y la interpretabilidad. Investigaciones recientes han destacado enfoques estandarizados y soluciones innovadoras para abordar estos desafíos únicos del habla disartrícia, que incluyen la escasez de datos, la variabilidad y la relevancia clínica38,39.

Estrategias de partición de conjuntos de datos

Para asegurar que los conjuntos de datos de entrenamiento, validación y prueba no intercambien información de los altavoces, evitando filtraciones y sobreajustes de datos, ahora se emplea comúnmente la validación cruzada de gruposK-Fold estratificados 38,39. Este enfoque permite a los modelos mantener distribuciones equilibradas y evaluaciones de rendimiento fiables, incluso cuando trabajan con conjuntos de datos limitados o diversos. Dado que la partición por altavoz es esencial para evitar el sesgo, las divisiones comunes consisten en proporciones tren/prueba de 75:25 o 85:15, junto con una división adicional paravalidar 40. Para manejar datos disartrícos limitados, se aplican enfoques populares de aumento de datos como la generación sintética de datos, la perturbación de tempo y el aprendizaje por transferencia a partir del hablasana 41,42.

Métricas de evaluación

Consideraciones sobre la interpretabilidad del modelo

  1. Mapas de atención y curvas de alineación: Los modelos basados en la atención ofrecen representaciones visuales que enfatizan los segmentos o fonemas del habla que el modelo prioriza, contribuyendo a la interpretabilidad clínica y generando confianza43.
  2. Análisis de fonemas/características: Reconocer fonemas importantes o características acústicas asociadas con la gravedad de la disartria promueve tanto la transparencia en el modelo como la comprensión clínica44.
  3. Enfoques híbridos: Combinar la inteligibilidad basada en ASR con características acústicas convencionales puede mejorar aún más lainterpretabilidad 45.

Así, una cadena completa de modelos de disartria incluye despartidos de datos estratificados e independientes del hablante, evaluación multifacética (PER, inteligibilidad, entrada clínica) y interpretabilidad mediante mecanismos de atención. Estos enfoques garantizan que los sistemas modelo para evaluar y reconocer la disartria sean sólidos, clínicamente relevantes y transparentes.

Resultados representativos

Varios estudios han informado de mejoras en la precisión de los límites fonémicos cuando se utilizan características multimodales. El habla disartrítica suele tener transiciones articulatorias borrosas o prolongadas, lo que dificulta determinar el límite exacto entre fonemas. Los modelos publicados que combinan características acústicas, articulatorias y visuales han mostrado mejor concordancia con las anotaciones de referencia que los sistemas unimodales. Estas mejoras suelen visualizarse mediante curvas de alineación, donde los modelos multimodales muestran una reducción de errores de tiempo, especialmente durante las transiciones consonante–vocal 46. Los informes bibliográficos también describen mejoras en la precisión de la clasificación fonemática. Se ha demostrado que las arquitecturas multimodales reducen errores de sustitución y deleción, especialmente para fricativas y vocales que frecuentemente se distorsionan en la disartria. Las matrices de confusión reportadas en estudios previos indican que combinar información visual y articulatoria ayuda al modelo a distinguir entre fonemas similares de forma más fiable. El aumento en la precisión en los límites fonémicos es un ejemplo destacado. Las transiciones articulatorias y los cambios en el habla disartrítica suelen estar alargados o difusos, lo que dificulta interpretar dónde termina un fonema y comienza otro. Para identificar con mayor precisión el inicio y desplazamiento fonemico, el sistema multimodal utiliza datos compartidos de movimientos visuales de labios, trayectorias articulatorias y audio. En comparación con los producidos por modelos acústicos unimodales, los límites fonémicos predictos visualizados coinciden más estrechamente con las anotaciones verdaderas. Se utilizan curvas de alineación para visualizar estas mejoras, donde el modelo multimodal muestra menos errores de tiempo, especialmente para transiciones entre vocales y consonantes (VC y CV). En el entorno clínico, esto puede resultar en mapas de segmentación mejorados, que ayudan aún más a logopedas y clínicos a identificar problemas concretos con el control motor, como un redondeo insuficiente de labios o un cierre demoradode la mandíbula 47.

Además, el modelo puede producir resultados diferenciales de clasificación que podrían usarse para identificar la secuencia de fonemas hablados más probable. El sistema multimodal muestra una disminución en los errores de sustitución y eliminación de fonemas en comparación con los modelos tradicionales y de línea base. Por ejemplo, la incorporación de la forma visual de los labios y las señales de posición de los articuladores mejora la precisión de clasificación de fricativas, como /s/ y /ʃ/, que frecuentemente se encuentran distorsionadas y desorientadas en la disartria. Las matrices de confusión también pueden usarse para demostrar tales mejoras, donde una mejor discriminación y bifurcación fonemática se indica mediante una disminución de la confusión entrecategorías 48.

La medición de inteligibilidad del habla antes y después de la corrección apoyada por el modelo puede compararse utilizando una tabla de relevancia clínica. Métricas como la estabilidad y el tiempo de las sílabas, la estimación del área del espacio vocál, la valoración de precisión de las consonantes y la puntuación global de inteligibilidad pueden incluirse en este gráfico. En general, la salida ya corregida muestra mejoras en los límites de prosodia, ritmo y articulación. Por ejemplo, tras la corrección, la representación del espacio vocálico suele agrandarse, lo que indica una mayor distintividad acústica vocálica, un objetivo terapéutico crucial en muchos tratamientos condisartria 39.

Es importante destacar que estos resultados del modelo están destinados a apoyar la toma de decisiones clínicas mejorando en lugar de reemplazar el juicio clínico. El sistema puede enfatizar fonemas específicos o transiciones articulatorias que se desvían significativamente de patrones anticipados o teóricamente hipotetizados. Con esta información, los terapeutas pueden adaptar sus objetivos terapéuticos para incluir: (a) mejorar la consistencia de la elevación de la lengua para las consonantes alveolares (por ejemplo, /t/, /d/), (b) centrarse en la protrusión de los labios para vocales redondeadas (por ejemplo, /u/), (c) mejorar el tiempo de inicio de las consonantes oclusivas sonoras.

Los trabajos publicados enfatizan que estos resultados deben complementar la interpretación clínica, no sustituir el juicio del médico. Las visualizaciones con modelo, como mapas de atención y diagramas de alineación fonemática, pueden ayudar a los terapeutas a identificar problemas articulatorios específicos, como la insuficiente elevación de la lengua, la disminución del redondeo de los labios o el retraso en el inicio de la voz. En conjunto, los datos de varios estudios muestran que las arquitecturas multimodales de aprendizaje profundo aumentan los indicadores técnicos de rendimiento y también proporcionan resultados interpretables que pueden ayudar en la planificación terapéutica y el seguimiento del progreso de rehabilitación.

Integración clínica y flujo de trabajo de rehabilitación

La implementación de tecnologías digitales y modelos avanzados del habla en la rehabilitación de la disartria está transformando los resultados de los pacientes, la impartición de la terapia y las prácticas clínicas. Esta sección aborda el marco de la formación articulatoria orientada a la retroalimentación, los roles evolutivos de los logopedas y la monitorización del paciente, la integración de los resultados de los modelos en herramientas terapéuticas y importantes preocupaciones sobre la usabilidad.

¿Cómo alimentan estos resultados de modelos en las herramientas de logopedia?

Los modelos modernos de IA y aprendizaje profundo, que incluyen ASR y clasificadores de severidad, podrían generar datos detallados y objetivos sobre inteligibilidad del habla, errores de articulación y nivelesde severidad 48. Estos resultados, hoy en día, están cada vez más integrados en plataformas de terapia digital y aplicaciones móviles, que proporcionan retroalimentación personalizada y en tiempo real a pacientes yterapeutas. Por ejemplo, las aplicaciones basadas en tabletas y los sistemas de telemonitorización en la nube utilizan métricas generadas por modelos para visualizar el progreso, destacar déficits articulatorios específicos y adaptar la dificultad del ejercicio. Estos sistemas permiten un seguimiento objetivo del progreso terapéutico, permiten la selección personalizada de ejercicios y apoyan la monitorización remota a través de plataformasdigitales 50, 51, 52.

Módulos de formación articulatoria basados en retroalimentación

Los módulos de formación basados en retroalimentación son fundamentales para la rehabilitación de la disartria digital. Estudios previos han informado que los módulos de rehabilitación digital suelen incluir biofeedback, detección automática de errores y diseño adaptativo de ejercicios. El biofeedback en logopedia utiliza señales visuales y auditivas, como pantallas de formas de onda y visualizaciones de movimientos de articuladores, para proporcionar orientación en tiempo real a los pacientes. Además, la detección automática de errores se facilita mediante modelos de IA que identifican errores fonológicos u articulatorios, ofreciendo retroalimentación correctiva inmediata para mejorar el aprendizaje. El proceso de formación es jerárquico y adaptativo, lo que significa que progresa de tareas más simples a más complejas, que se centran específicamente en sonidos del habla, sílabas o palabras. Estos ejercicios se ajustan dinámicamente según el rendimiento del paciente, garantizando experiencias de aprendizaje personalizadas. Además, la incorporación de elementos de gamificación y realidad virtual (VR) en algunas plataformas contribuye a aumentar la motivación y el cumplimiento entre los pacientes, haciendo que el proceso terapéutico sea más atractivo. Estos módulos apoyan así la práctica intensiva y repetitiva, que es clave para el aprendizaje motor y la mejora del habla, permitiendo al mismo tiempo un uso independiente o guiado porterapeutas 51,53,54.

Papel de los logopedas y seguimiento del paciente

Los logopedas (SLT) siguen siendo centrales en el proceso de rehabilitación, aunque las herramientas digitales se han vuelto más comunes en la última década. La evaluación y el establecimiento de objetivos implican interpretar los resultados del modelo para seleccionar objetivos terapéuticos adecuados y personalizar planes de tratamiento diferenciales adaptados a las necesidades individuales del paciente. La supervisión y la retroalimentación son vitales para monitorizar el progreso del paciente; Los expertos proporcionan comentarios sobre la rectificación del habla y realizan los ajustes necesarios en la terapia según sea necesario. Además, se enfatiza la educación y el apoyo al paciente, enseñando a los pacientes a utilizar eficazmente las herramientas digitales en su proceso de rehabilitación. La colaboración multidisciplinar es fundamental, ya que profesionales de diversas disciplinas trabajan juntos para atender las necesidades más amplias de la rehabilitación, asegurando un enfoque integral en la atención al paciente. El seguimiento del paciente se mejora mediante plataformas digitales, que permiten a terapeutas y clínicos seguir el seguimiento, recuperación, rendimiento y resultados del paciente de forma remota, facilitando intervenciones oportunas y apoyo continuo51,52.

Consideraciones de usabilidad: comodidad y repetibilidad del paciente

Para que las tecnologías de rehabilitación digital se implementen con éxito, la usabilidad es fundamental, con un enfoque en interfaces fáciles de usar que satisfagan una variedad de necesidades de los pacientes. Los métodos de terapia flexibles son posibles gracias a las plataformas móviles, que mejoran la comodidad y la accesibilidad. Características importantes como módulos adaptables y retroalimentación automatizada fomentan una participación constante y autónoma, esencial para el aprendizaje motor. Las pruebas piloto muestran alta aceptación y satisfacción, pero aún existen problemas técnicos. La retroalimentación continua de pacientes y terapeutas ayuda a mejorar estas herramientas para adaptarse a los requisitos del mundo real. Con énfasis en desarrollar experiencias terapéuticas significativas, el uso de IA y formación basada en retroalimentación en logopedia está mejorando la eficacia, accesibilidad y personalización en la rehabilitación dedisartria 48,51,52,53,54.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Conclusiones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta revisión describe la creciente aplicación de arquitecturas multimodales de aprendizaje profundo al marcado fonemático y la restauración del habla en la disartria. Estas arquitecturas combinan el análisis articulatorio y visual acústico para superar las limitaciones del reconocimiento de voz basado en audio en el habla patológica, caracterizada por una baja inteligibilidad y configuraciones articulatorias no estándar. La articulación electromagnética, la imagen por ultrasonido de la ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran no haber conflicto de intereses.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores reconocen al Hospital Afiliado de la Universidad de Medicina China de Nankín, Universidad de Medicina China, por proporcionar las becas y financiación necesarias (Programa de Investigación Científica e Innovación de Posgrado de la Provincia de Jiangsu KYCX25_2282).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kundi, P., Gencer, Z. K., Muluk, N. B. Speech Disorders and Aphasia: Overview. Phys Ther Rehabil Otorhinolaryngol. , 487-494 (2025).
  2. Rose, K. R., Hughes, P. M. Speech systems. Br Telecom Technol J. 13 (2), 51-62 (1995).
  3. Ackermann, H., Hertrich, I. The contribution of the cerebellum to speech processing. J Neurolinguistics. 13 (2–3), 95-116 (2000).
  4. Johnson, J. A. Speech, Voice, and Communication. Int Rev Neurobiol. 134, 1189-1205 (2017).
  5. Enderby, P. Disorders of communication: dysarthria. Handb Clin Neurol. 110, 273-281 (2013).
  6. Feenaughty, L., Mefferd, A., Tjaden, K. Dysarthria. Encycl Hum Brain. 1-5, V5-301-V5-315 (2023).
  7. Pan, T., Wang, S. Dysarthria as a Presenting Symptom With Rapidly Progressive Imaging Features in Sporadic Creutzfeldt-Jakob Disease: A Case Report. Cureus. 16 (6), e62687 (2024).
  8. Kieling, M. L. M., Finkelsztejn, A., Konzen, V. R., dos Santos, V. B., Ayres, A., et al. Articulatory speech measures can be related to the severity of multiple sclerosis. Front Neurol. 14, (2023).
  9. Kirshner, H. S., Samuels, M. A. Speech and Language Disorders. Neurol Localization Diagnosis. , 177-189 (2023).
  10. Gutz, S. E., Stipancic, K. L., Yunusova, Y., Berry, J. D., Green, J. R. Validity of Off-the-Shelf Automatic Speech Recognition for Assessing Speech Intelligibility and Speech Severity in Speakers With Amyotrophic Lateral Sclerosis. J Speech Lang Hear Res. 65 (6), 2128 (2022).
  11. Nasereddin, H. H. O., Omari, A. A. R. Classification techniques for automatic speech recognition (ASR) algorithms used with real-time speech translation. Proc Comput Conf 2017. , 200-207 (2018).
  12. Ríos-Urrego, C. D., Escobar-Grisales, D., Orozco-Arroyave, J. R. Synchronous Analysis of Speech Production and Lips Movement to Detect Parkinson’s Disease Using Deep Learning Methods. Diagnostics. 15 (1), 73 (2024).
  13. Deng, S., Du, J., Zhang, J., Wang, X. Deep learning approach for short-term entry passenger flow forecasting in urban rail transit stations. Eng Appl Artif Intell. 163, 112989 (2026).
  14. Tunio, N. A., Tunio, M. A., Raza, M. A., Faheem, M., Hashmani, A. A., Nadeem, R. Performance Comparison Between Deep Learning Models for Fault Classification in Transmission Lines Using Time Series Data. Energy Sci Eng. 13 (5), 2330-2351 (2025).
  15. Yu, C., Su, X., Qian, Z. Multi-Stage Audio-Visual Fusion for Dysarthric Speech Recognition With Pre-Trained Models. IEEE Trans Neural Syst Rehabil Eng. 31, 1912-1921 (2023).
  16. Qian, Z., Xiao, K. A Survey of Automatic Speech Recognition for Dysarthric Speech. Electron. 12 (20), 4278 (2023).
  17. Strand, E. A. Clinical and professional ethics in the management of motor speech disorders. Semin Speech Lang. 24 (4), 301-311 (2003).
  18. Alhinti, L., Cunningham, S., Christensen, H. The Dysarthric Expressed Emotional Database (DEED): An audio-visual database in British English. PLoS One. 18, (2023).
  19. Lee, S. E., Huang, M. L., Hsu, T. C. Using Spectrogram to Evaluate Dysarthric Treatment Effectiveness. Rehabil Pract Sci. 18 (1), 177-185 (1990).
  20. Abdul, Z. K., Al-Talabani, A. K. Mel Frequency Cepstral Coefficient and Its Applications: A Review. IEEE Access. 10, 122136-122158 (2022).
  21. Chartier, J., Anumanchipalli, G. K., Johnson, K., Chang, E. F. Encoding of articulatory kinematic trajectories in human speech sensorimotor cortex. Neuron. 98 (5), 1042 (2018).
  22. Williams, S., Foulkes, P., Hughes, V. Analysis of forced aligner performance on L2 English speech. Speech Commun. 158, (2024).
  23. Janbakhshi, P., Kodrasi, I. . Experimental investigation on STFT phase representations for deep learning-based dysarthric speech detection. , (2022).
  24. Varma, V. J., Jana, A., Samal, A. K., S, A. u. r. o. b. i. n. d. o., Naidu, R. C., et al. Enhancing dysarthria severity classification: efficient audio-based deep learning models. Discov Appl Sci. 7 (8), (2025).
  25. Fadlil, A., Perdana, L., Pujiyanta, A., Imam Karim Fathurrahman, H., Muhammad Jogo Samodro, M. Implementation of Dysarthria Identification Using MFCC and Multilayer Perceptron Algorithm. SSRG Int J Electr Electron Eng. 12, 32-46 (2025).
  26. Rebernik, T., Jacobi, J., Jonkers, R., Noiray, A., Wieling, M., et al. A review of data collection practices using electromagnetic articulography. Lab Phonol. 12 (1), 1-42 (2021).
  27. Girod-Roux, M., Hueber, T., Fabre, D., Gerber, S., Canault, M., et al. Rehabilitation of speech disorders following glossectomy, based on ultrasound visual illustration and feedback. Clinical Linguist Phonetics. 34 (9), 826-843 (2020).
  28. Yang, Y., Su, R., Zhao, S., Ng, M. L., Yan, N., et al. Towards unified diffusion model for speech to ultrasound tongue imaging synthesis. Inf Fusion. 127, 103896 (2026).
  29. Bian, Y., Küster, D., Liu, H., Krumhuber, E. G. Understanding Naturalistic Facial Expressions with Deep Learning and Multimodal Large Language Models. Sensors (Basel). 24 (1), 126 (2023).
  30. Hammadi, Y., Grondin, F., Ferland, F., Lebel, K. Evaluation of Various State-of-the-Art Head Pose Estimation Algorithms for Clinical Scenarios. Sensors (Basel). 22 (18), 6850 (2022).
  31. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi. , 498-502 (2017).
  32. Yi, F., Wen, H., Jiang, T. ASFormer: Transformer for Action Segmentation. , (2021).
  33. Bharilya, V., Kumar, N. Machine learning for autonomous vehicles’ trajectory prediction: A comprehensive survey, challenges, and future research directions. Veh Commun. 46, (2024).
  34. Li, H., Qiu, T. Continuous Manufacturing Process Sequential Prediction using Temporal Convolutional Network. Comput Aided Chem Eng. 49, 1789-1794 (2022).
  35. Biffi, C., Roffo, G., Salvagnini, P., Cherubini, A. A temporal convolutional network-based approach and a benchmark dataset for colonoscopy video temporal segmentation. Comput Methods Programs Biomed. 270, 108782 (2025).
  36. Alzahrani, S., Hussain, N., Mohammad, F. Enhancing Phoneme Labeling in Dysarthric Speech with Digital Twin-Driven Multi-Modal Architecture. Comput Mater Contin. 84 (3), 4825-4849 (2025).
  37. Lv, C., Fan, L., Li, H., Ma, J., Jiang, W., et al. Leveraging multimodal deep learning framework and a comprehensive audio-visual dataset to advance Parkinson’s detection. Biomed Signal Process Control. 95, 106480 (2024).
  38. Dai, W., Li, M., He, Y., Zhu, Y. Fine-Tuning Pre-Trained Audio Models for Dysarthria Severity Classification: A Second Place Solution in the Multimodal Dysarthria Severity Classification Challenge. , 151-153 (2024).
  39. Qi, J., Van hamme, H. A Study on Model Training Strategies for Speaker-Independent and Vocabulary-Mismatched Dysarthric Speech Recognition. Appl Sci. 15 (4), 2006 (2025).
  40. Shahamiri, S. R., Lal, V., Shah, D. Dysarthric Speech Transformer: A Sequence-to-Sequence Dysarthric Speech Recognition System. IEEE Trans Neural Syst Rehabil Eng. 31, 3407-3416 (2023).
  41. Vinotha, R., Hepsiba, D., Vijay Anand, L. D., Andrew, J., Jennifer Eunice, R. Enhancing dysarthric speech recognition through SepFormer and hierarchical attention network models with multistage transfer learning. Sci Reports. 14 (1), 1-23 (2024).
  42. Hashan, A. M., Alexandrovich Khlebnikov, N., Bredikhin, B. A. Attention Based Encoder-Decoder for Automatic Hyperkinetic Dysarthria Speech Recognition in Educational Organizational Systems. , 1-4 (2025).
  43. Merler, M., Agurto, C., Peller, J., Roitberg, E., Taitz, A., et al. Clinical assessment and interpretation of dysarthria in ALS using attention based deep learning AI models. NPJ Digit Med. 8 (1), 260 (2025).
  44. Van Nuffelen, G., Middag, C., De Bodt, M., Martens, J. Speech technology-based assessment of phoneme intelligibility in dysarthria. Int J Lang Commun Disord. 44 (5), 716-730 (2009).
  45. Middag, C., Bocklet, T., Martens, J. P., Nöth, E. Combining phonological and acoustic ASR-free features for pathological speech intelligibility assessment. , 3005-3008 (2011).
  46. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  47. Zhu, T., Duan, S., Liang, H., Li, F., Zhang, W. Multiangle Correlation Feature Extraction and Disease Prediction Model Construction for Patients With Post-Stroke Dysarthria. IEEE Trans Neural Syst Rehabil Eng. 33, 587-597 (2025).
  48. Stell, A., Vogel, A. P., Vera Soto, J. P., Pareja, A. A., Sinnott, R. A Platform for the Delivery of Speech Treatment for Dysarthria in Multisystemic Ataxia. Proc - IEEE Symp Comput Med Syst. , 405-410 (2025).
  49. Gupta, S., Patil, A. T., Purohit, M., Parmar, M., Patel, M., et al. Residual Neural Network precisely quantifies dysarthria severity-level based on short-duration speech segments. Neural Networks. 139, 105-117 (2021).
  50. Javanmardi, F., Kadiri, S. R., Alku, P. Pre-trained models for detection and severity level classification of dysarthria from speech. Speech Commun. 158, 103047 (2024).
  51. Mulfari, D., La Placa, D., Rovito, C., Celesti, A., Villari, M. Deep learning applications in telerehabilitation speech therapy scenarios. Comput Biol Med. 148, 105864 (2022).
  52. Bhat, C., Strika, H. Speech Technology for Automatic Recognition and Assessment of Dysarthric Speech: An Overview. J Speech, Lang Hear Res. 68 (2), 547-577 (2025).
  53. Michizoe, R., Kinosada, H., Nishikawa, H., Taniguchi, I., Matsunaga, K., et al. Japanese Vowel-mora Visualization for Dysarthria Rehabilitation with Variational Autoencoder. , 494-498 (2024).
  54. Woo, S. T., Ha, J. W., Na, S. Design of a personalized oral—motor exercise device for speech impairment rehabilitation. Front Bioeng Biotechnol. 13, 1543259 (2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Modelos TransformerRedes Neuronales Convolucionales Temporalesinteligibilidad del hablalogopediadetecci n de l mites de fonemastrastornos motores del habla

Artículos relacionados