Article de revue

Architecture multimodale pour l’imprécision du marquage phonémique dans la parole dysarthrique : intégrer les transformateurs et les NPC pour la rééducation clinique

DOI :

10.3791/70447

26 mai 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette revue examine comment des architectures multimodales combinant informations auditives, articulatoires et visuelles, ainsi que des modèles transformateurs et TCN, peuvent améliorer l’identification phonémique dans la parole dysarthrique. Elle met en avant leur potentiel à améliorer l’intelligibilité de la parole, l’évaluation et la thérapie personnalisée, au-delà des capacités des systèmes ASR classiques.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En raison de problèmes d’articulation et de variabilité phonémique, les troubles de la parole tels que la dysarthrie posent des défis importants en rééducation clinique. Les systèmes traditionnels de reconnaissance automatique de la parole (ASR), généralement entraînés sur des ensembles de données normatifs, échouent souvent à décoder avec précision la parole dysarthrique. Les récentes avancées en intelligence artificielle et apprentissage profond ont permis l’intégration d’architectures multimodales, telles que la fusion d’informations auditives, articulatoires et visuelles pour enregistrer des schémas de parole complexes, rendant cela de plus en plus possible. Dans cette revue, nous avons exploré la convergence des transformateurs et des réseaux convolutionnels temporels (RTC) au sein de cadres multimodaux afin de traiter l’imprécision de l’étiquetage phonémique dans la parole dysarthrique. Ici, nous discutons de la manière dont la modélisation contextuelle basée sur les transformateurs et la précision temporelle basée sur les TCN peuvent améliorer la détection, la classification et le retour de réhabilitation des limites phonèmiques. La revue aborde également le potentiel de tels systèmes hybrides en orthophonie individualisée, en questions d’interprétabilité et en applications cliniques. Les architectures multimodales sont une approche translationnelle visant à améliorer la surveillance thérapeutique, les aides à la communication et l’évaluation de l’intelligibilité de la parole chez les personnes souffrant de troubles moteurs de la parole, en faisant le lien entre la médecine clinique et l’informatique médicale.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’altération du système nerveux peut souvent entraîner des conséquences sanitaires drastiques et soudaines, incluant des troubles musculo-squelettiques, des troubles neurovasculaires et d’autres comme des troubles neurogènes de la communication. Les troubles neurogènes de la communication incluent des troubles comme la dysarthrie et l’apraxie, qui peuvent être définis comme des troubles de la parole dus à une faiblesse musculaire et à des difficultés à planifier les mouvements de la parole, respectivement1. La parole est composée de cinq sous-systèmes : la respiration, la phonation, la résonance, l’articulation et la prosodie, qui doivent tous fonctionner ensemble de manière synergique et fluide pour communiquerefficacement 2. La dysarthrie, causée par un dysfonctionnement de ces sous-systèmes, réduit l’audibilité, la naturalité, l’intelligibilité et l’efficacité de la communication, ce qui, à son tour, a un impact significatif sur la vie des patients et de leurs familles. La dysarthrie peut être causée par diverses maladies neurologiques et pathologies sous-jacentes, notamment des dysfonctionnements du cortex cérébral, des ganglions de la base, du cervelet, des noyaux basaux, des nerfs crâniens ou des nerfs périphériques. D’autres facteurs incluent des problèmes moteurs primaires de la langue, du larynx et de lagorge 3.

La dysarthrie est un terme générique pour désigner les troubles moteurs de la parole causés par un changement du contrôle neuromusculaire qui affecte la respiration, la phonation, la résonance, la production de la parole, la vocalisation et le rythme. Ainsi, la dysarthrie est un trouble de la parole souvent associé à des troubles et des blessures neuromusculaires, où les muscles utilisés pour la parole sont soit faibles, lents, soit paralysés. Les types spécifiques de muscles impliqués dans la parole incluent ceux de la langue, de la gorge, du visage, des lèvres, des cordes vocales, des mâchoires et des muscles des voies respiratoires supérieures. Les lésions de ces muscles peuvent prendre diverses formes, notamment des lésions des motoneurones qui les innervent ou de leur vasculature, les privant d’oxygène. Les lésions neurologiques typiques qui altèrent la conduction de la parole incluent des lésions des neurones moteurs supérieurs pouvant entraîner la raideur ou la spasticité des muscles de la parole, des lésions des neurones moteurs inférieurs pouvant entraîner une faiblesse ou une paralysie musculaire due à des signaux nerveux interrompus, des lésions cérébelleuses qui entraînent souvent un manque de coordination musculaire (ataxie) ou des lésions ganglionares basales qui gênent la coordination des mouvements et peuvent entraîner des mouvements involontaires (hyperkinésides) ou rigidité des muscles (mouvements hypokinétiques)5.

La dysarthrie est un symptôme fréquent de divers troubles neurologiques et est fréquemment associée à des maladies neurologiques progressives. Elle a un impact significatif sur le patient et ses familles, car la communication joue un rôle crucial dans l’expression de sa personnalité et le maintien des liens sociaux. Le trouble se caractérise par une compréhension de la parole diminuée. Le contenu parlé reste intact, permettant au patient d’écrire et d’interpréter à la fois le langage parlé et écrit ; En revanche, l’anarthrie est le type le plus sévère, entraînant une perte totale de la sortie motrice de laparole 6. Il existe six classifications principales de la dysarthrie : dysarthrie flasque, liée à la dysfonction des neurones moteurs inférieurs ; dysarthrie spastique, qui provient de lésions des neurones moteurs supérieurs connectés aux régions motrices du cortex cérébral ; la dysarthrie ataxique, principalement due à des problèmes cérébelleux ; et la dysarthrie hyperkinétique et la dysarthrie hypokinétique, toutes deux associées à des troubles du système extrapyramidal. Le sixième type est généralement appelé dysarthrie mixte et est souvent associé à des lésions dans plusieurs zones, conduisant à des caractéristiques de la parole présentant des traits d’au moins deux catégories. Les troubles de la parole associés à ces six principaux types de dysarthrie sont uniques et peuvent aider au diagnostic et au traitement de ladysarthrie 5,6.

Les facteurs étiologiques contribuant aux difficultés d’articulation comprennent les infections (telles que la maladie de Creutzfeldt–Jakob et le syndrome d’immunodéficience acquise), les problèmes vasculaires (AVC ischémiques et hémorragiques), les tumeurs (néoplasies cérébrales), les maladies démyélinisantes (y compris la sclérose en plaques et le syndrome de Guillain–Barré), les troubles dégénératifs (comme la maladie de Parkinson et la maladie de Huntington), les blessures (traumatismes crâniens et paralysie cérébrale), les expositions toxiques (aux métaux lourds, alcool et drogues), et des conditions génétiques (par exemple, SANDO)7. De plus, des facteurs non neurologiques, tels que la fente labiale ou palatine, peuvent également causer des problèmes d’articulation, mais ils ne relèvent pas de la catégorie de ladysarthrie 8.

L’importance de la dysarthrie en milieu clinique réside dans son impact significatif sur la qualité de vie des individus. Parce que la communication est essentielle à l’engagement social, éducatif et professionnel, ceux qui en souffrent éprouvent souvent des sentiments d’isolement et de bien-êtrediminué 6. Diagnostiquer avec précision les différents types de dysarthrie, par exemple flasque, spastique, ataxique, hyperkinétique, hypokinétique et mixte, est essentiel pour identifier les problèmes neurologiques sous-jacents et évaluer les approches de rééducation. Les orthophonistes et cliniciens s’appuient souvent sur l’analyse des caractéristiques et de la gravité de la dysarthrie pour personnaliser la thérapie, établir des objectifs de communication réalisables et évaluer la nécessité de méthodes de communication augmentativeset alternatives 9. Pour les personnes ayant des difficultés de parole, les systèmes de reconnaissance automatique de la parole (ASR) ont montré qu’ils améliorent l’accessibilité et les interactions sociales. Néanmoins, des modèles acoustiques insuffisants ont freiné le succès plus large de la RSA dans le traitement des troubles de la parole. Ainsi, cet article explore les problèmes phonémiques dans la parole dysarthrique, les systèmes ASR existants et leurs limites, les techniques multimodales créatives, la modélisation contextuelle basée sur les transformateurs, ainsi que les NPT pour un raffinement temporel et séquentiel.

Même avec des progrès substantiels dans la technologie ASR, les meilleurs systèmes ASR présentent encore de nombreuses lacunes pour les personnes ayant des troubles de la parole. Ces lacunes peuvent en partie provenir des difficultés à obtenir un ensemble de données d’entraînement diversifié et représentatif des troubles du langage. Un défi dans les ASR troubles de la parole est probablement lié à la large gamme de caractéristiques anormales de la parole qui varient d’une personne à l’autre, ainsi qu’à la représentation inadéquate de ces variations dans les ensembles de donnéesd’entraînement 10. Malgré cela, la recherche sur la RSA liée à la dysarthrie a souvent négligé cette diversité.

Les systèmes ASR sont divisés en trois catégories : indépendants du locuteur (SI), dépendants du haut-parleur (SD) et adaptatifs du haut-parleur (SA). Les systèmes SI fonctionnent bien avec des locuteurs sains mais ont des difficultés avec une voix dégradée et s’en sortent mieux lorsque les données d’entraînement incluent des locuteurs dysarthriques. En revanche, les systèmes SD se concentrent sur les utilisateurs individuels, obtenant une excellente précision, tandis que les systèmes SA s’adaptent à la parole de l’utilisateur au fil du temps et surpassent les modèles SI et SD. Cependant, les systèmes SA et SD nécessitent tous deux des données d’entraînement, ce qui constitue un obstacle supplémentaire pour les personnes atteintes de troublesneurodégénératifs 11. Malgré des progrès significatifs, les modèles ASR existants restent inadaptés aux locuteurs handicapés, en raison du manque de jeux de données d’entraînement différents. Pour combler cette lacune, des méthodologies de collecte de données approfondies qui capturent divers aspects de la dysarthrie doivent être développées, améliorant ainsi la performance des ASR pour les locuteurs difficiles à reconnaître.

Pour surmonter ces limites, les stratégies multimodales qui combinent des signaux acoustiques, articulatoires et visuels peuvent représenter efficacement la production et le raffinement de la parole dans les symptômes dysarthriques de manière globale. Par exemple, les données sur le mouvement articulatoire, telles que l’imagerie de la langue, sont obtenues par échographie et articulographie électromagnétique. Ces données sont souvent combinées à des mouvements visuels des lèvres et peuvent compenser une information acoustique altérée, améliorant la capacité à distinguer et différencier lesphonèmes 12. Cette redondance observée dans les systèmes multimodaux est cohérente avec les méthodes d’évaluation clinique, renforçant la capacité des thérapeutes à observer les mouvements orofaciaux parallèlement à la parole auditive. Inversement, les cadres d’apprentissage profond, en particulier les transformers et les TCN, offrent une modélisation supérieure des dépendances temporelles et des variations au sein des séquences de parole. Ces modèles fonctionnent en permettant aux transformateurs de capturer des relations contextuelles globales, permettant l’identification phonémique même lorsque les signaux acoustiques sont diminués, obscurcis ouréduits 13. Les RCT contribuent davantage en fournissant des champs récepteurs stables et un lissage temporel, ce qui améliore la précision de la détection des frontières phonèmiques. Lorsqu’elles sont intégrées dans des cadres de fusion multimodale, ces deux approches améliorent considérablement la précision du marquage phonémique dans la parole dysarthrique et facilitent une rééducation clinique plus précise et orientée vers le retour d’information. Ainsi, ces architectures d’apprentissage profond multimodal sont directement alignées sur des objectifs cliniques en temps réel, tels que l’amélioration de la mesure de l’intelligibilité de la parole, le suivi du parcours de rééducation et la fourniture de thérapies assistées par la technologie adaptées aux profils spécifiques de troubles moteurs de la parole desindividus 14.

Bien que ces architectures d’apprentissage profond multimodal aient un grand potentiel pour résoudre l’imprécision de l’étiquetage phonémique, leur transfert efficace des cadres expérimentaux vers des outils de diagnostic fiables nécessite une structure opérationnelle uniforme. Pour y répondre, l’étude suivante décrit un flux de travail computationnel complet englobant la collecte de données multimodales, l’extraction de caractéristiques et l’entraînement de modèles. L’objectif est de garantir que ces systèmes complexes soient reproductibles et vérifiables dans un large éventail de situations cliniques. Établir un tel pipeline méthodologique transparent est essentiel pour les orthophonistes et les ingénieurs cliniques afin de valider les algorithmes à travers un large éventail de caractéristiques et de niveaux d’incapacité des patients. Enfin, cette méthodologie systématique sert de précurseur à la mise en œuvre clinique, permettant l’intégration de modèles de parole avancés dans les évaluations réglementaires, les systèmes de santé électroniques et les plateformes de suivi de traitements à long terme.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Revue et perspective

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aperçu de l’acquisition de données multimodales dans la parole dysarthrique

La collecte de données multimodales est nécessaire pour examiner en profondeur le contrôle moteur de la parole et développer des techniques diagnostiques et de rééducation efficaces, compte tenu de la complexité et de la diversité des symptômes dysarthriques.

Installation d’enregistrement acoustique

Le canal acoustique reste central. Les enregistrements sont mieux réalisés dans un environnement traité acoustiquement afin d’atténuer la réverbération et le bruit ambiant. Les microphones typiques sont des condensateurs de haute qualité et sont soit des unités cardioïdes montées sur la tête, soit sur table, positionnées de manière cohérente pour contrôler le niveau du signal et éviter les variations entre les sessions. Des taux d’échantillonnage de 16 kHz ou 44,1 kHz sont très courants, où 16 kHz suffisent pour l’intelligibilité et l’analyse de prosodie, tandis que 44,1 kHz offre une plus grande fidélité, utile pour la recherche acoustique/phonatoire fine. Les interfaces audio multicanal permettent la capture synchrone de plusieurs flux et doivent maintenir des réglages de gain et une marge de tête constants pour éviter le clipping ou le bruit de fond. Pour la reproductibilité, établir la calibration et documenter le gain du micro, le bruit ambiant de fond et la dérive sont importants. Dans les corpus de la parole dysarthrique, la qualité audio est particulièrement importante car les défauts du signal acoustique peuvent être subtils et facilement masqués par de mauvaises conditions d’enregistrement15.

Modalités optionnelles articulatoires / suivi labiaux / EMG / échographies

Pour aller au-delà de la forme d’onde acoustique, des modalités supplémentaires sont souvent nécessaires pour capturer la cinématique articulatoire et l’activité musculaire physiologique. Ainsi, le suivi des lèvres ou la capture de mouvement faciale permet de quantifier l’ouverture des lèvres/mâchoires, le mouvement, la vitesse et la symétrie. L’articulographie électromagnétique (EMA) suit les capteurs de langue, de mâchoire et de lèvres en trois dimensions et fournit une résolution temporelle/positionnelle des articulateurs, tandis que l’électromyographie de surface (sEMG) enregistre l’activité musculaire pour explorer les déficits d’activation neuromusculaires sous-jacents à la dysarthrie. L’imagerie par ultrasons de la langue (ITU) permet une imagerie en temps réel de la surface de la langue lors de l’articulation, utile chez les sujets qui ne tolèrent pas l’EMA. Les systèmes multimodaux montrent que l’identification des déficits moteurs de la parole est améliorée par l’acoustique concurrente, complétée par une capture articulatoire/visuelle 16.

Considérations éthiques et consentement du patient

Travailler avec des locuteurs dysarthriques implique fréquemment des populations vulnérables. Les chercheurs doivent obtenir l’approbation du comité d’éthique institutionnel (IRB) ou du comité d’éthique, et garantir un consentement éclairé qui explique les modalités d’enregistrement (audio, vidéo, capteurs physiologiques), le stockage, l’anonymisation, l’utilisation future et les droits de retrait. Les formulaires de consentement doivent explicitement traiter de la capture vidéo (suivi labial/facial) et, éventuellement, des modalités sensibles comme l’EMG. La protection des données doit être gérée, en particulier lorsque des images vidéo ou faciales sont stockées. Il est nécessaire d’évaluer le niveau de confort, d’épuisement, de limitations de mouvement et de risque potentiel du participant. Les séances doivent inclure des périodes de repos, et les participants doivent être informés qu’ils peuvent s’arrêter à tout moment sans subir de conséquences. La rareté et la diversité des participants à la recherche sur les corpus de langage dysarthrique soulignent encore l’importance de la rigueur éthique17.

Étapes de prétraitement des données (segmentation, réduction du bruit, normalisation)

Le système MAV-HuBERT aligne les données acoustiques et visuelles de manière temporelle au niveau des images, extrayant les énergies de banque log-filtre 26 dimensions de la forme d’onde originale et les synchronisant avec les images visuelles 25 Hz collectées par identification faciale basée sur Dlib. Les images audio consécutives sont généralement combinées pour stabiliser les fluctuations à court terme, et les régions visuelles fusionnées sont normalisées spatialement avant la fusion des caractéristiques multimodales. Ces activités de prétraitement assurent une cohérence temporelle continue et réduisent la variabilité entre les modalités audio et visuelle, ce qui entraîne une précision d’identification en avalplus élevée 15,18.

Ingénierie des caractéristiques et flux de travail computationnel

Les modèles d’apprentissage profond multimodaux nécessitent des représentations synchronisées des informations acoustiques, articulatoires et visuelles pour étiqueter avec précision les phonèmes dans la parole dysarthrique. Cette section présente un aperçu des techniques de représentation des caractéristiques utilisées dans l’analyse vocale multimodale, suivi d’un flux de travail computationnel étape par étape pour extraire et aligner ces caractéristiques avant l’entraînement du modèle.

Extraction et représentation des caractéristiques

Dans l’analyse de la parole multimodale, les signaux audio et de mouvement bruts doivent être convertis en représentations significatives pouvant être traitées par des modèles d’apprentissage profond. L’une des représentations les plus répandues est le spectrogramme, qui montre comment l’énergie du signal varie dans le temps et entre les fréquences. Les représentations basées sur des spectrogrammes sont utiles pour capturer des caractéristiques telles que le balbutiement, la respiration et le timing irrégulier, qui sont couramment observés dans la paroledysarthrique 19.

Une autre caractéristique couramment utilisée est les coefficients cépstraux de la fréquence mélel (MFCC), qui représentent les propriétés spectrales de la parole d’une manière qui s’approche de la perception auditive humaine. Les fonctionnalités MFCC sont largement utilisées en reconnaissance vocale car elles offrent des représentations compactes et robustes au bruit qui restent stables même lorsque la voix estdéformée 20. En plus des caractéristiques acoustiques, les approches multimodales intègrent des informations articulatoires, telles que les trajectoires de mouvement de la langue, des lèvres et de la mâchoire. Ces signaux peuvent être obtenus par articulographie électromagnétique (EMA), imagerie par ultrasons de la langue (ITU) ou suivi optique du mouvement. Les caractéristiques articulatoires fournissent des informations directes sur le contrôle moteur de la parole et aident à compenser la dégradation des signaux acoustiques21.

Les informations visuelles sont également utiles pour analyser la parole dysarthrique. Les repères faciaux extraits d’enregistrements vidéo, notamment le contour des lèvres, le déplacement de la mâchoire et l’ouverture de la bouche, fournissent des indices supplémentaires sur l’articulation. Ces caractéristiques visuelles améliorent la discrimination phonémique, en particulier lorsque le signal acoustique est flou. Pour l’apprentissage supervisé, tous les flux de fonctionnalités doivent être alignés avec des transcriptions au niveau phonémique, garantissant que chaque délai correspond à l’unité de parole correcte. Un alignement précis est essentiel pour l’entraînement des modèles d’étiquetage phonétique, en particulier dans la parole dysarthrique, où les frontières phonèmiques sont souventfloues 22.

Flux de travail computationnel

Cette section montre comment chaque étape est nécessaire pour reproduire le flux de travail d’étiquetage phonémique multimodal, de l’extraction des caractéristiques à l’évaluation du modèle (Figure 1).

Extraction des caractéristiques acoustiques par spectrogrammes et MFCC

Premièrement, la transformée de Fourier à court terme (STFT) est utilisée pour transformer le signal brut de la parole en une représentation temps-fréquence. Pour créer un spectrogramme, le signal est divisé en brefs référentiels superposés, et chaque référentiel est soumis à la transformée de Fourier.
Les coefficients cépstraux à fréquence mel-fréquence (MFCC) sont utilisés pour extraire des caractéristiques acoustiques pondérées perceptuellement à partir du spectrogramme. Pour la reconnaissance vocale et l’analyse de la dysarthrie, les MFCC offrent des représentations compactes et robustes aubruit 23,24. En raison de leur robustesse et de leur efficacité, les MFCC sont couramment utilisées dans des applications liées à la reconnaissance de la parole et du locuteur. Ainsi, en raison de leur utilité, les MFCC sont ensuite extraites pour calculer et approximer les niveaux de perception auditive humaine et fournir des caractéristiques acoustiques compressées et robustes au bruit, puis25.

Acquisition des trajectoires articulatoires

Les données de mouvement articulatoire sont obtenues pour capturer le mouvement physique des organes de la parole. L’articulographie électromagnétique (EMA) utilise des capteurs fixés à la langue, aux lèvres et à la mâchoire pour suivre le mouvement articulatoire en trois dimensions. Alternativement, l’imagerie par ultrasons de la langue (ITU) peut être utilisée pour estimer les mouvements de la langue de manière non invasive. Les trajectoires enregistrées sont filtrées, normalisées et réduites pour correspondre à la fréquence d’images des caractéristiques acoustiques afin d’assurer une cohérencetemporelle de 26. La conversion de la parole en séquences d’imagerie par échographie de la langue (UTI) est une technique permettant d’estimer les trajectoires de la langue par échographie à partir des données de la parole, en cartographiant les caractéristiques auditives des mouvements physiologiques de la langue. Cette méthodologie offre une alternative non invasive aux techniques de collecte directe de données articulatoires, nécessaires pour surveiller et traiter les anomalies de la parole et des voix, tout en évitant le besoin d’équipements spécifiques et d’expérience clinique inhérents aux approches de mesure directe27,28. En fonction de la disponibilité de caractéristiques articulatoires, telles que les trajectoires de mouvement de la langue, des lèvres et des mâchoires, qui sont enregistrées par EMA ou par échographie (UTI), les signaux sont filtrés et échantillonnés pour correspondre à la fréquence des images acoustiques.

Détection de repères visuels

Pour les entrées de la voix et des vidéos, les entrées de touches faciales (coins des lèvres, mouvement des lignes de la mâchoire) doivent être extraites via des outils tels que Mediapipe ou OpenFace, puis normalisées pour supprimer les effets de pose de tête. MediaPipe utilise un cadre d’apprentissage profond pour estimer les poses du visage et du corps, fournissant 33 repères pour la reconnaissance générale des poses, dont 11 spécifiquement pour le visage. Son efficacité peut varier, en particulier dans les cas d’occlusions. Le modèle MediaPipe FaceMesh améliore la fiabilité en utilisant 468 repères 3D du visage ainsi qu’une méthode géométrique pour l’estimation de la posede la tête 29. OpenFace 2.0 fonctionne comme une boîte à outils pour analyser les comportements faciaux, permettant la détection de repères faciaux, l’estimation de la posture de la tête, le suivi du regard oculaire et la reconnaissance des unités d’action faciale. Il supporte l’intégration avec divers langages de programmation et peut traiter des flux vidéo en direct ou des images fixes. Les sorties, telles que les repères faciaux et les vecteurs de regard, peuvent être exportées au format CSV. OpenFace 2.0 utilise le Modèle Local Contraint des Experts Convolutionnels (CE-CLM), qui inclut un modèle de distribution de points pour tenir compte des variations de formes des monuments et des experts en patch pour les différences d’apparenceslocales 29,30.

Alignements de transcription de phonèmes

L’étape suivante consiste à aligner temporairement tous les flux présentés (acoustique, articulatoire et visuel) sur des annotations au niveau phonème en utilisant des outils d’alignement forcé tels que le Montreal Forced Aligner (MFA), assurant ainsi des entrées multimodales synchronisées pour l’entraînement des modèles computationnels. L’alignement forcé (FA) est la technique consistant à aligner les transcriptions avec les signaux audio afin de déterminer les limites temporelles des unités de parole. Cela permet un traitement audio plus précis et fait progresser l’étude linguistique. Il est de plus en plus utilisé dans les études phonétiques et s’est avéré nettement plus rapide que l’alignement manuel. Bien qu’elle soit généralement associée aux systèmes de reconnaissance automatique de la parole (ASR), l’AF est une tâche plus large au sein du traitement automatique de la parole qui inclut l’analyse du langage parlé et latranscription 22. L’aligneur forcé de Montréal (MFA) est une boîte à outils de premier plan qui utilise les algorithmes HMM-GMM pour obtenir un alignement efficace. Malgré les avancées de la technologie ASR, les approches traditionnelles telles que HMM-GMM restent populaires pour les tâches d’AG. Le MFA utilise les caractéristiques MFCC et une méthode d’entraînement en quatre étapes pour créer des modèles acoustiques avec un alignement phonétiqueprécis 31.

Composantes de l’architecture des modèles

Les modèles d’apprentissage profond multimodaux pour la reconnaissance de la parole dysarthrique se composent de plusieurs composants clés qui travaillent ensemble pour capturer des informations contextuelles, temporelles et multimodales. Les principaux composants incluent un encodeur contextuel, un module de raffinement temporel et un mécanisme de fusion multimodal. Chaque composante joue un rôle spécifique dans l’amélioration de la précision de l’étiquetage des phonèmes dans le langage désordonné.

Encodeur contextuel basé sur transformateur

L’encodeur transformateur est utilisé pour modéliser les dépendances à longue portée dans les séquences vocales. La parole dysarthrique présente souvent un temps irrégulier et des limites phonémiques peu claires, rendant difficile la capture d’informations contextuelles par les modèles conventionnels. Les transformateurs utilisent l’auto-attention multi-têtes pour analyser les relations entre différents intervalles temporels de la séquence d’entrée. Cela permet au modèle de prendre en compte à la fois les cadres de parole passés et futurs lors de la prédiction des phonèmes. Ainsi, l’encodeur peut mieux gérer les variations d’articulation et de prononciation courantes dans la dysarthrie. Dans l’architecture multimodale, le transformateur reçoit des caractéristiques acoustiques, articulatoires et visuelles synchronisées et produit des représentations contextuelles qui sont transmises à l’étape suivante du modèle32,33.

Raffinement des séquences temporelles basé sur le TCN

Après encodage contextuel, la séquence de caractéristiques est traitée par un réseau convolutionnel temporel (TCN) afin d’améliorer la précision temporelle. La parole dysarthrique comporte souvent un timing instable, des pauses et des phonèmes allongés, qui nécessitent un raffinement supplémentaire au-delà de la modélisation contextuelle. Les RCT utilisent des convolutions causales dilatées pour capturer de longues dépendances temporelles tout en maintenant l’efficacité de calcul. Cette structure permet au modèle de lisser les prédictions bruyantes et de maintenir des frontières phonémiques cohérentes à travers le temps. Dans l’architecture, le TCN reçoit la sortie de l’encodeur transformateur et affine la séquence pour produire des représentations de caractéristiques stables et temporellementcohérentes 33,34,35.

Stratégie de fusion multimodale

Pour augmenter la précision diagnostique dans l’évaluation de la dysarthrie, la fusion multimodale intègre des informations provenant de nombreuses sources telles que la voix, le texte, la vidéo et les capteurs physiologiques. Les principales techniques se composent de trois étapes distinctes : fusion précoce, fusion tardive et fusionintermédiaire 36. La fusion précoce combine des données de nombreuses modalités à un niveau fondamental, permettant aux modèles de comprendre des relations complexes dès le départ. Son utilisation est limitée car elle nécessite la synchronisation de plusieurs fréquences d’échantillonnage et types de données. La fusion tardive traite chaque modalité à l’aide de modèles indépendants avant de combiner les résultats pour les évaluations finales. Cette technique est flexible et efficace lorsque des données d’une modalité manquent. De plus, la fusion intermédiaire intègre des modalités à un niveau intermédiaire, utilisant souvent des techniques d’attention croisée pour détecter les dépendances. Cette méthode s’est avérée particulièrement utile en contexte clinique, améliorant les résultats en combinant des références linguistiques avec des données acoustiques. En résumé, la fusion intermédiaire avec attention croisée produit des résultats supérieurs en évaluation automatique de la dysarthrie que les méthodes basées sur une seulemodalité 36,37.

Meilleures pratiques pour entraîner et évaluer les modèles de dysarthrie :

Le développement de modèles sinueux pour l’évaluation et la reconnaissance de la dysarthrie nécessite une attention particulière à la partition des ensembles de données, à l’évaluation des métriques et à l’interprétabilité. Des recherches récentes ont mis en lumière des approches standardisées et des solutions innovantes pour relever ces défis uniques du langage dysarthrique, notamment la rareté des données, la variabilité et la pertinence clinique38,39.

Stratégies de partitionnement des ensembles de données

Pour garantir que les ensembles de données d’entraînement, de validation et de test n’échangent pas d’informations sur les haut-parleurs, afin d’éviter les fuites et le surajustement des données, la validation croisée par groupes K-Fold stratifiés est désormais courammentemployée 38,39. Cette approche permet aux modèles de maintenir des distributions équilibrées et des évaluations de performance fiables, même lorsqu’ils travaillent avec des ensembles de données limités ou diversifiés. Puisque la partition par haut-parleur est essentielle pour prévenir le biais, les splits courants consistent en des rapports train/test de 75:25 ou 85:15, ainsi qu’une division supplémentaire pour la validation40. Pour traiter des données dysarthriques limitées, des approches populaires d’augmentation de données telles que la génération de données synthétiques, la perturbation du tempo et l’apprentissage par transfert à partir d’un langage sain sontappliquées 41,42.

Indicateurs d’évaluation

Considérations sur l’interprétabilité du modèle

  1. Cartes d’attention et courbes d’alignement : Les modèles basés sur l’attention fournissent des représentations visuelles qui mettent en avant les segments de parole ou phonèmes prioritaires du modèle, contribuant à l’interprétabilité clinique et construisant la confiance43.
  2. Analyse phonème/caractéristique : Reconnaître des phonèmes importants ou des caractéristiques acoustiques associées à la sévérité de la dysarthrie favorise à la fois la transparence du modèle et la compréhension clinique44.
  3. Approches hybrides : Fusionner l’intelligibilité basée sur l’ASR avec des caractéristiques acoustiques conventionnelles peut encore améliorerl’interprétabilité 45.

Ainsi, un pipeline complet de modèles de dysarthrie comprend des divisions de données stratifiées et indépendantes du locuteur, une évaluation multifacette (PER, intelligibilité, entrée clinique) et une interprétabilité par mécanismes d’attention. Ces approches garantissent que les systèmes modèles pour évaluer et reconnaître la dysarthrie sont robustes, cliniquement pertinents et transparents.

Résultats représentatifs

Plusieurs études ont rapporté des améliorations de la précision des limites phonèmiques lorsque des traits multimodaux sont utilisés. La parole dysarthrique présente souvent des transitions articulatoires floues ou prolongées, ce qui rend difficile la détermination de la frontière exacte entre les phonèmes. Les modèles publiés qui combinent des caractéristiques acoustiques, articulatoires et visuelles ont montré une meilleure concordance avec les annotations de référence que les systèmes unimodaux. Ces améliorations sont souvent visualisées à l’aide de courbes d’alignement, où les modèles multimodaux montrent une réduction des erreurs de synchronisation, notamment lors des transitions consonne–voyelle 46. Les rapports de littérature décrivent également des améliorations dans la précision de la classification des phonèmes. Il a été démontré que les architectures multimodales réduisent les erreurs de substitution et de délétion, en particulier pour les fricatives et voyelles fréquemment déformées en dysarthrie. Les matrices de confusion rapportées dans des études précédentes indiquent que la combinaison des informations visuelles et articulatoires aide le modèle à distinguer plus efficacement les phonèmes similaires. L’augmentation de la précision des limites phonèmiques en est un exemple marquant. Les transitions articulatoires et les changements dans la parole dysarthrique sont souvent allongés ou flous, ce qui rend difficile l’interprétation de l’endroit où un phonème se termine et où commence un autre. Pour identifier plus précisément le début et le décalage phonémique, le système multimodal utilise des données partagées provenant des mouvements visuels des lèvres, des trajectoires articulatoires et de l’audio. Comparées à celles produites par les modèles acoustiques unimodaux, les frontières phonémiques prédites visualisées correspondent plus étroitement aux annotations véritables. Des courbes d’alignement sont utilisées pour visualiser ces améliorations, où le modèle multimodal montre moins d’erreurs de synchronisation, en particulier pour les transitions entre voyelles et consonnes (VC et CV). En milieu clinique, cela peut entraîner une amélioration des cartes de segmentation, qui aident davantage les orthophonistes et les cliniciens à identifier des problèmes particuliers liés au contrôle moteur, tels que l’arrondissement insuffisant des lèvres ou un retard de fermeturede la mâchoire 47.

De plus, le modèle peut produire des résultats de classification différentielle qui pourraient être utilisés pour identifier la séquence phonémique parlée la plus probable. Le système multimodal présente une baisse des erreurs de substitution et de suppression de phonèmes par rapport aux modèles traditionnels et de base. Par exemple, l’intégration de la forme visuelle des lèvres et des indices de position des articulateurs améliore la précision de classification des fricatives, telles que /s/ et /ʃ/, qui sont fréquemment déformées et désorientées en dysarthrie. Les matrices de confusion peuvent également être utilisées pour démontrer de telles améliorations, où une meilleure discrimination phonémique et bifurcation sont indiquées par une diminution de la confusioninter-catégories 48.

La mesure de l’intelligibilité vocale avant et après la correction supportée par le modèle peut être comparée à l’aide d’un tableau de pertinence clinique. Des métriques telles que la stabilité et le timing des syllabes, l’estimation de l’aire de l’espace vocalique, la précision des consonnes et le score global d’intelligibilité peuvent être incluses dans ce tableau. En général, la production déjà corrigée présente une amélioration des frontières de prosodie, de rythme et d’articulation. Par exemple, après correction, la représentation de l’espace vocalique s’élargit généralement, indiquant une distinction acoustique vocalique accrue, un objectif thérapeutique crucial dans de nombreux traitements de ladysarthrie 39.

Il est important de noter que ces résultats du modèle visent à soutenir la prise de décision clinique en améliorant plutôt qu’en remplaçant le jugement des cliniciens. Le système peut mettre en avant des phonèmes spécifiques ou des transitions articulatoires qui s’écartent significativement des schémas anticipés ou théoriquement hypothétiques. Avec ces informations, les thérapeutes peuvent adapter leurs objectifs thérapeutiques pour inclure : (a) améliorer la cohérence de l’élévation de la langue pour les consonnes alvéolaires (par exemple, /t/, /d/), (b) se concentrer sur la protrusion des lèvres pour les voyelles arrondies (par exemple, /u/), (c) améliorer le timing d’apparition des consonnes occlusives voisées.

Les travaux publiés soulignent que ces résultats doivent compléter l’interprétation clinique, et non remplacer le jugement des médecins. Les visualisations de modèles, telles que les cartes d’attention et les graphiques d’alignement des phonèmes, peuvent aider les thérapeutes à identifier des problèmes articulatoires spécifiques, tels que l’élévation insuffisante de la langue, la diminution de l’arrondissement des lèvres ou un retard dans l’apparition de la voix. Dans l’ensemble, les données de plusieurs études montrent que les architectures d’apprentissage profond multimodales augmentent les indicateurs de performance technique tout en fournissant des résultats interprétables pouvant aider à la planification de la thérapie et au suivi des progrès de la rééducation.

Intégration clinique et flux de travail de rééducation

La mise en œuvre des technologies numériques et des modèles avancés de la parole en rééducation de la dysarthrie transforme les résultats des patients, la prestation de la thérapie et les pratiques cliniques. Cette section aborde le cadre de la formation articulatoire orientée vers le feedback, les rôles évolutifs des orthophonistes et du suivi des patients, l’intégration des résultats des modèles dans les outils thérapeutiques, ainsi que des préoccupations majeures d’utilisabilité.

Comment ces résultats de modèles alimentent-ils les outils d’orthophonie ?

Les modèles modernes d’IA et d’apprentissage profond, qui incluent ASR et classificateurs de sévérité, pourraient générer des données détaillées et objectives sur l’intelligibilité de la parole, les erreurs d’articulation et les niveaux de sévérité48. Ces résultats, de nos jours, sont de plus en plus intégrés dans les plateformes de thérapie numérique et les applications mobiles, qui fournissent des retours personnalisés en temps réel aux patients et auxthérapeutes. Par exemple, les applications sur tablette et les systèmes de télésurveillance basés sur le cloud utilisent des indicateurs générés par des modèles pour visualiser les progrès, mettre en évidence des déficits articulatoires spécifiques et adapter la difficulté de l’exercice. Ces systèmes permettent un suivi objectif de l’évolution de la thérapie, permettent une sélection personnalisée de l’exercice et soutiennent la surveillance à distance via les plateformesnumériques 50, 51, 52.

Modules de formation articulatoires basés sur le retour d’information

Les modules de formation basés sur le retour d’information sont essentiels à la rééducation de la dysarthrie numérique. Des études antérieures ont rapporté que les modules de rééducation numérique incluent souvent le biofeedback, la détection automatisée d’erreurs et la conception d’exercices adaptatifs. Le biofeedback en orthophonie utilise des indices visuels et auditifs, tels que les affichages de formes d’onde et les visualisations des mouvements des articulateurs, pour fournir un accompagnement en temps réel aux patients. De plus, la détection automatisée des erreurs est facilitée grâce à des modèles d’IA qui identifient les erreurs phonologiques ou articulatoires, offrant un retour d’information correct immédiat pour améliorer l’apprentissage. Le processus de formation est hiérarchique et adaptatif, ce qui signifie qu’il progresse de tâches plus simples à des tâches plus complexes, qui ciblent spécifiquement les sons de la parole, les syllabes ou les mots. Ces exercices sont ajustés dynamiquement en fonction des performances du patient, garantissant des expériences d’apprentissage personnalisées. De plus, l’intégration d’éléments de ludification et de réalité virtuelle (VR) sur certaines plateformes contribue à accroître la motivation et la conformité des patients, rendant le processus thérapeutique plus engageant. Ces modules soutiennent ainsi une pratique intensive et répétitive, qui est essentielle pour l’apprentissage moteur et l’amélioration de la parole tout en permettant une utilisation indépendante ou guidéepar le thérapeute 51,53,54.

Rôle des orthophonistes et surveillance des patients

Les orthophonistes (SLT) restent au cœur du processus de rééducation, même si les outils numériques sont devenus plus répandus au cours de la dernière décennie. L’évaluation et la fixation d’objectifs consistent à interpréter les résultats des modèles pour sélectionner des objectifs thérapeutiques appropriés et à personnaliser des plans de traitement différentiels adaptés aux besoins individuels des patients. La supervision et le retour d’information sont essentiels pour suivre la progression du patient ; Les experts fournissent des retours sur la correction de la parole et apportent les ajustements nécessaires à la thérapie selon les besoins. De plus, l’éducation et le soutien des patients sont mis en avant, leur enseignant à utiliser efficacement les outils numériques dans leur processus de rééducation. La collaboration multidisciplinaire est cruciale, car des professionnels de différentes disciplines travaillent ensemble pour répondre aux besoins plus larges de la rééducation, garantissant une approche globale des soins aux patients. La surveillance des patients est renforcée par des plateformes numériques, qui permettent aux thérapeutes et cliniciens de suivre à distance l’adhésion, la récupération, la performance et les résultats des patients, facilitant des interventions rapides et un soutien continu51,52.

Considérations d’ergonomie : confort et répétabilité du patient

Pour que les technologies de rééducation numérique soient mises en œuvre avec succès, l’utilisabilité est cruciale, avec un accent particulier sur des interfaces conviviales répondant à une variété de besoins des patients. Les méthodes de thérapie flexibles sont rendues possibles grâce aux plateformes mobiles, qui améliorent le confort et l’accessibilité. Des fonctionnalités importantes comme des modules adaptables et un retour automatisé encouragent une participation cohérente et autonome, ce qui est essentiel à l’apprentissage moteur. Les tests pilotes montrent une forte acceptation et satisfaction, mais il subsiste des problèmes techniques. Le retour continu des patients et des thérapeutes aide à améliorer ces outils pour qu’ils répondent aux besoins réels. Avec un accent mis sur le développement d’expériences thérapeutiques significatives, l’utilisation de l’IA et de la formation basée sur le retour d’information en orthophonie améliore l’efficacité, l’accessibilité et la personnalisation en rééducation de la dysarthrie48,51,52,53,54.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Conclusions

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette revue décrit l’application croissante des architectures d’apprentissage profond multimodal à l’étiquetage phonémique et à la restauration de la parole en dysarthrie. Ces architectures combinent l’analyse articulatoire et visuelle acoustique pour surmonter les limites de la reconnaissance vocale audiophonique dans la parole pathologique, caractérisée par une faible intelligibilité et des configurations articulatoires non standard. L’articulographie électromagnétique, l’imagerie par ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent ne pas avoir de conflit d’intérêts.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs remercient l’Hôpital affilié de l’Université de médecine chinoise de Nankin, Université de médecine chinoise, pour avoir fourni les bourses et le financement nécessaires (Programme de recherche scientifique et d’innovation postuniversitaires de la province du Jiangsu KYCX25_2282).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kundi, P., Gencer, Z. K., Muluk, N. B. Speech Disorders and Aphasia: Overview. Phys Ther Rehabil Otorhinolaryngol. , 487-494 (2025).
  2. Rose, K. R., Hughes, P. M. Speech systems. Br Telecom Technol J. 13 (2), 51-62 (1995).
  3. Ackermann, H., Hertrich, I. The contribution of the cerebellum to speech processing. J Neurolinguistics. 13 (2–3), 95-116 (2000).
  4. Johnson, J. A. Speech, Voice, and Communication. Int Rev Neurobiol. 134, 1189-1205 (2017).
  5. Enderby, P. Disorders of communication: dysarthria. Handb Clin Neurol. 110, 273-281 (2013).
  6. Feenaughty, L., Mefferd, A., Tjaden, K. Dysarthria. Encycl Hum Brain. 1-5, V5-301-V5-315 (2023).
  7. Pan, T., Wang, S. Dysarthria as a Presenting Symptom With Rapidly Progressive Imaging Features in Sporadic Creutzfeldt-Jakob Disease: A Case Report. Cureus. 16 (6), e62687 (2024).
  8. Kieling, M. L. M., Finkelsztejn, A., Konzen, V. R., dos Santos, V. B., Ayres, A., et al. Articulatory speech measures can be related to the severity of multiple sclerosis. Front Neurol. 14, (2023).
  9. Kirshner, H. S., Samuels, M. A. Speech and Language Disorders. Neurol Localization Diagnosis. , 177-189 (2023).
  10. Gutz, S. E., Stipancic, K. L., Yunusova, Y., Berry, J. D., Green, J. R. Validity of Off-the-Shelf Automatic Speech Recognition for Assessing Speech Intelligibility and Speech Severity in Speakers With Amyotrophic Lateral Sclerosis. J Speech Lang Hear Res. 65 (6), 2128 (2022).
  11. Nasereddin, H. H. O., Omari, A. A. R. Classification techniques for automatic speech recognition (ASR) algorithms used with real-time speech translation. Proc Comput Conf 2017. , 200-207 (2018).
  12. Ríos-Urrego, C. D., Escobar-Grisales, D., Orozco-Arroyave, J. R. Synchronous Analysis of Speech Production and Lips Movement to Detect Parkinson’s Disease Using Deep Learning Methods. Diagnostics. 15 (1), 73 (2024).
  13. Deng, S., Du, J., Zhang, J., Wang, X. Deep learning approach for short-term entry passenger flow forecasting in urban rail transit stations. Eng Appl Artif Intell. 163, 112989 (2026).
  14. Tunio, N. A., Tunio, M. A., Raza, M. A., Faheem, M., Hashmani, A. A., Nadeem, R. Performance Comparison Between Deep Learning Models for Fault Classification in Transmission Lines Using Time Series Data. Energy Sci Eng. 13 (5), 2330-2351 (2025).
  15. Yu, C., Su, X., Qian, Z. Multi-Stage Audio-Visual Fusion for Dysarthric Speech Recognition With Pre-Trained Models. IEEE Trans Neural Syst Rehabil Eng. 31, 1912-1921 (2023).
  16. Qian, Z., Xiao, K. A Survey of Automatic Speech Recognition for Dysarthric Speech. Electron. 12 (20), 4278 (2023).
  17. Strand, E. A. Clinical and professional ethics in the management of motor speech disorders. Semin Speech Lang. 24 (4), 301-311 (2003).
  18. Alhinti, L., Cunningham, S., Christensen, H. The Dysarthric Expressed Emotional Database (DEED): An audio-visual database in British English. PLoS One. 18, (2023).
  19. Lee, S. E., Huang, M. L., Hsu, T. C. Using Spectrogram to Evaluate Dysarthric Treatment Effectiveness. Rehabil Pract Sci. 18 (1), 177-185 (1990).
  20. Abdul, Z. K., Al-Talabani, A. K. Mel Frequency Cepstral Coefficient and Its Applications: A Review. IEEE Access. 10, 122136-122158 (2022).
  21. Chartier, J., Anumanchipalli, G. K., Johnson, K., Chang, E. F. Encoding of articulatory kinematic trajectories in human speech sensorimotor cortex. Neuron. 98 (5), 1042 (2018).
  22. Williams, S., Foulkes, P., Hughes, V. Analysis of forced aligner performance on L2 English speech. Speech Commun. 158, (2024).
  23. Janbakhshi, P., Kodrasi, I. . Experimental investigation on STFT phase representations for deep learning-based dysarthric speech detection. , (2022).
  24. Varma, V. J., Jana, A., Samal, A. K., S, A. u. r. o. b. i. n. d. o., Naidu, R. C., et al. Enhancing dysarthria severity classification: efficient audio-based deep learning models. Discov Appl Sci. 7 (8), (2025).
  25. Fadlil, A., Perdana, L., Pujiyanta, A., Imam Karim Fathurrahman, H., Muhammad Jogo Samodro, M. Implementation of Dysarthria Identification Using MFCC and Multilayer Perceptron Algorithm. SSRG Int J Electr Electron Eng. 12, 32-46 (2025).
  26. Rebernik, T., Jacobi, J., Jonkers, R., Noiray, A., Wieling, M., et al. A review of data collection practices using electromagnetic articulography. Lab Phonol. 12 (1), 1-42 (2021).
  27. Girod-Roux, M., Hueber, T., Fabre, D., Gerber, S., Canault, M., et al. Rehabilitation of speech disorders following glossectomy, based on ultrasound visual illustration and feedback. Clinical Linguist Phonetics. 34 (9), 826-843 (2020).
  28. Yang, Y., Su, R., Zhao, S., Ng, M. L., Yan, N., et al. Towards unified diffusion model for speech to ultrasound tongue imaging synthesis. Inf Fusion. 127, 103896 (2026).
  29. Bian, Y., Küster, D., Liu, H., Krumhuber, E. G. Understanding Naturalistic Facial Expressions with Deep Learning and Multimodal Large Language Models. Sensors (Basel). 24 (1), 126 (2023).
  30. Hammadi, Y., Grondin, F., Ferland, F., Lebel, K. Evaluation of Various State-of-the-Art Head Pose Estimation Algorithms for Clinical Scenarios. Sensors (Basel). 22 (18), 6850 (2022).
  31. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi. , 498-502 (2017).
  32. Yi, F., Wen, H., Jiang, T. ASFormer: Transformer for Action Segmentation. , (2021).
  33. Bharilya, V., Kumar, N. Machine learning for autonomous vehicles’ trajectory prediction: A comprehensive survey, challenges, and future research directions. Veh Commun. 46, (2024).
  34. Li, H., Qiu, T. Continuous Manufacturing Process Sequential Prediction using Temporal Convolutional Network. Comput Aided Chem Eng. 49, 1789-1794 (2022).
  35. Biffi, C., Roffo, G., Salvagnini, P., Cherubini, A. A temporal convolutional network-based approach and a benchmark dataset for colonoscopy video temporal segmentation. Comput Methods Programs Biomed. 270, 108782 (2025).
  36. Alzahrani, S., Hussain, N., Mohammad, F. Enhancing Phoneme Labeling in Dysarthric Speech with Digital Twin-Driven Multi-Modal Architecture. Comput Mater Contin. 84 (3), 4825-4849 (2025).
  37. Lv, C., Fan, L., Li, H., Ma, J., Jiang, W., et al. Leveraging multimodal deep learning framework and a comprehensive audio-visual dataset to advance Parkinson’s detection. Biomed Signal Process Control. 95, 106480 (2024).
  38. Dai, W., Li, M., He, Y., Zhu, Y. Fine-Tuning Pre-Trained Audio Models for Dysarthria Severity Classification: A Second Place Solution in the Multimodal Dysarthria Severity Classification Challenge. , 151-153 (2024).
  39. Qi, J., Van hamme, H. A Study on Model Training Strategies for Speaker-Independent and Vocabulary-Mismatched Dysarthric Speech Recognition. Appl Sci. 15 (4), 2006 (2025).
  40. Shahamiri, S. R., Lal, V., Shah, D. Dysarthric Speech Transformer: A Sequence-to-Sequence Dysarthric Speech Recognition System. IEEE Trans Neural Syst Rehabil Eng. 31, 3407-3416 (2023).
  41. Vinotha, R., Hepsiba, D., Vijay Anand, L. D., Andrew, J., Jennifer Eunice, R. Enhancing dysarthric speech recognition through SepFormer and hierarchical attention network models with multistage transfer learning. Sci Reports. 14 (1), 1-23 (2024).
  42. Hashan, A. M., Alexandrovich Khlebnikov, N., Bredikhin, B. A. Attention Based Encoder-Decoder for Automatic Hyperkinetic Dysarthria Speech Recognition in Educational Organizational Systems. , 1-4 (2025).
  43. Merler, M., Agurto, C., Peller, J., Roitberg, E., Taitz, A., et al. Clinical assessment and interpretation of dysarthria in ALS using attention based deep learning AI models. NPJ Digit Med. 8 (1), 260 (2025).
  44. Van Nuffelen, G., Middag, C., De Bodt, M., Martens, J. Speech technology-based assessment of phoneme intelligibility in dysarthria. Int J Lang Commun Disord. 44 (5), 716-730 (2009).
  45. Middag, C., Bocklet, T., Martens, J. P., Nöth, E. Combining phonological and acoustic ASR-free features for pathological speech intelligibility assessment. , 3005-3008 (2011).
  46. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  47. Zhu, T., Duan, S., Liang, H., Li, F., Zhang, W. Multiangle Correlation Feature Extraction and Disease Prediction Model Construction for Patients With Post-Stroke Dysarthria. IEEE Trans Neural Syst Rehabil Eng. 33, 587-597 (2025).
  48. Stell, A., Vogel, A. P., Vera Soto, J. P., Pareja, A. A., Sinnott, R. A Platform for the Delivery of Speech Treatment for Dysarthria in Multisystemic Ataxia. Proc - IEEE Symp Comput Med Syst. , 405-410 (2025).
  49. Gupta, S., Patil, A. T., Purohit, M., Parmar, M., Patel, M., et al. Residual Neural Network precisely quantifies dysarthria severity-level based on short-duration speech segments. Neural Networks. 139, 105-117 (2021).
  50. Javanmardi, F., Kadiri, S. R., Alku, P. Pre-trained models for detection and severity level classification of dysarthria from speech. Speech Commun. 158, 103047 (2024).
  51. Mulfari, D., La Placa, D., Rovito, C., Celesti, A., Villari, M. Deep learning applications in telerehabilitation speech therapy scenarios. Comput Biol Med. 148, 105864 (2022).
  52. Bhat, C., Strika, H. Speech Technology for Automatic Recognition and Assessment of Dysarthric Speech: An Overview. J Speech, Lang Hear Res. 68 (2), 547-577 (2025).
  53. Michizoe, R., Kinosada, H., Nishikawa, H., Taniguchi, I., Matsunaga, K., et al. Japanese Vowel-mora Visualization for Dysarthria Rehabilitation with Variational Autoencoder. , 494-498 (2024).
  54. Woo, S. T., Ha, J. W., Na, S. Design of a personalized oral—motor exercise device for speech impairment rehabilitation. Front Bioeng Biotechnol. 13, 1543259 (2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Mod les Transformerr seaux convolutionnels temporelsintelligibilit de la paroleorthophonied tection des fronti res de phon mestroubles moteurs de la parole

Articles connexes