综述文章

用于构音障碍言语中音素标注不精确性的多模态架构:结合Transformer与TCN用于临床康复

DOI:

10.3791/70447

2026年5月26日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文综述了结合听觉、发音和视觉信息以及变换器(transformer)和时序卷积网络(TCN)模型的多模态架构,如何提升构音障碍言语中音素识别的准确性。重点强调了这些架构在言语可懂度评估和个性化治疗方面的潜力,超越了传统自动语音识别(ASR)系统的性能。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

由于构音问题和音素变异,构音障碍等言语障碍在临床康复中面临重大挑战。传统的自动语音识别(ASR)系统通常在规范数据集上进行训练,往往难以准确解码构音障碍者的语音。近年来,人工智能与深度学习的突破使得多模态架构得以整合,例如融合听觉、构音和视觉信息以记录复杂的语音模式,使这一目标日益成为可能。在本综述中,我们探讨了在多模态框架内结合Transformer模型与时间卷积网络(TCN)以解决构音障碍语音中音素标注不精确的问题。本文讨论了基于Transformer的上下文建模与基于TCN的时间精度如何提升音素边界检测、分类以及康复反馈的效果。综述还探讨了此类混合系统在个体化言语治疗中的潜力、可解释性问题及其临床应用。多模态架构通过连接临床医学与医学信息学,为运动性言语障碍患者提供了一种转化性方法,可用于增强治疗监测、交流辅助工具以及言语可懂度评估。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

神经系统损伤常可导致严重的突发性健康后果,包括肌肉骨骼系统疾病、神经血管疾病以及其他如神经源性交流障碍等疾病。神经源性交流障碍包括构音障碍和言语失用症,前者可定义为因肌肉无力导致的言语含糊,后者则为难以规划言语动作1。言语由五个子系统组成:呼吸、发声、共鸣、构音和韵律,这些子系统必须协同且无缝地工作,才能实现有效交流2。由这些子系统功能障碍引起的构音障碍会降低言语的可听性、自然性、可懂度和交流效率,从而显著影响患者及其家庭的生活质量。构音障碍可由多种神经系统疾病和潜在病理引起,包括大脑皮层、基底节、小脑、基底核、脑神经或周围神经的功能障碍。其他因素还包括舌、喉和咽喉部位的原发性运动问题3

构音障碍是用于描述一组症状的统称 由影响呼吸、发声、共鸣、言语产生和发声功能的神经肌肉控制改变所引起的运动性言语障碍, 以及节奏。因此,构音障碍是一种常与神经肌肉损伤和伤害相关的言语障碍,其特点是用于言语的肌肉变得虚弱、迟缓或瘫痪。参与言语的具体肌肉包括舌肌、咽喉肌、面部肌、唇肌、声带、下颌肌以及上呼吸道肌肉。这些肌肉的损伤可能表现为多种形式,例如支配这些肌肉的运动神经元受损,或其血管系统受损导致肌肉缺氧。常见的影响言语传导的神经系统损伤包括:上运动神经元损伤,可导致言语肌肉僵硬或痉挛;下运动神经元损伤,因神经信号中断而导致肌肉无力或瘫痪;小脑损伤,常引起肌肉协调性丧失(共济失调);以及基底节损伤,可影响肌肉的协调运动,导致不自主运动(多动型)或肌肉僵直(少动型)。5.

构音障碍是多种神经系统疾病常见的症状,常与进行性神经系统疾病相关。由于交流在表达个性和维持社会联系中起着关键作用,该障碍对患者及其家庭造成显著影响。该病症的特征是言语可懂度下降。患者的语言内容保持完整,能够书写并理解口语和书面语言;而运动性构音障碍(anarthria)是最严重的一种类型,导致运动性言语输出完全丧失6。构音障碍主要有六种分类:弛缓性构音障碍,与下运动神经元功能障碍相关;痉挛性构音障碍,由连接大脑皮层运动区的上运动神经元损伤引起;共济失调性构音障碍,主要源于小脑问题;以及与锥体外系功能障碍相关的高动型构音障碍和低动型构音障碍。第六种类型通常称为混合性构音障碍,常与多个脑区的损伤有关,其言语特征表现出至少两种类型的特点。这六种主要类型的构音障碍所伴随的言语障碍具有独特性,有助于构音障碍的诊断与治疗5,6

导致构音障碍的病因包括感染(如克雅氏病和获得性免疫缺陷综合征)、血管性问题(缺血性和出血性卒中)、肿瘤(脑部肿瘤)、脱髓鞘疾病(包括多发性硬化和吉兰-巴雷综合征)、变性疾病(如帕金森病和亨廷顿病)、损伤(创伤性脑损伤和脑性瘫痪)、中毒暴露(重金属、酒精和药物)以及遗传性疾病(例如SANDO)7。此外,非神经性因素如唇裂或腭裂也可能引起构音问题,但这些情况不属于构音障碍的范畴8

构音障碍在临床环境中的重要性在于其对个体生活质量的显著影响。由于交流对于社会、教育和职业参与至关重要,因此患有构音障碍的人常常面临孤独感和幸福感下降的问题6。准确诊断各种类型的构音障碍(例如,弛缓型、痉挛型、共济失调型、高动型、低动型以及混合型)对于识别潜在的神经系统问题并评估康复方法至关重要。言语语言病理学家和临床医生通常依赖于分析构音障碍的特征和严重程度,以个性化治疗方案、设定可实现的沟通目标,并评估是否需要使用增强性和替代性沟通手段9。对于存在言语困难的个体,自动语音识别(ASR)系统已被证明能够提升可及性和社交互动。然而,声学模型的不足限制了ASR在处理紊乱言语方面的广泛应用。因此,本文深入探讨了构音障碍言语中的音素问题、现有的ASR系统及其局限性、创新的多模态技术、基于Transformer的上下文建模方法,以及用于时序和序列优化的时间卷积网络(TCN)。

尽管自动语音识别(ASR)技术已取得显著进展,但目前最先进的ASR系统在面对言语障碍个体时仍存在诸多不足。这些不足可能部分源于难以获取具有多样性且具代表性的言语障碍语音训练数据集。言语障碍语音ASR面临的一个挑战,很可能与异常语音特征的广泛差异有关,这些特征因人而异,且在训练数据集中未能得到充分表征10。尽管如此,关于构音障碍相关ASR的研究往往忽视了这种多样性。

自动语音识别系统(ASR)分为三类:与说话人无关(SI)、依赖说话人(SD)和说话人自适应(SA)。SI 系统在健康说话人上的表现良好,但对退化的语音识别效果较差,若训练数据中包含构音障碍说话人,则性能会有所提升。相比之下,SD 系统针对个体用户进行优化,可实现很高的识别准确率;而 SA 系统则能随着时间推移适应用户的语音特征,在性能上优于 SI 和 SD 模型。然而,SA 和 SD 系统均需要训练数据,这对患有神经退行性疾病的人群而言构成了新的障碍11。尽管已有显著进展,但由于缺乏多样化的训练数据集,现有的 ASR 模型仍不适用于残障说话人。为弥补这一不足,必须建立完善的數據采集方法,以全面捕捉构音障碍的多种特征,从而提升 ASR 系统对难以识别说话人的识别性能。

为了克服这些局限性,融合声学、发音运动和视觉信号的多模态策略能够全面表征构音障碍症状中的言语产生与修正过程。例如,通过超声成像和电磁发音描记术获取舌部运动等发音器官运动数据。这些数据常与唇部视觉运动信息结合使用,可弥补受损的声学信息,从而增强对音素的辨别与区分能力12。多模态系统中存在的这种冗余性与临床评估方法一致,有助于治疗师在听觉言语评估的同时观察口面部运动。另一方面,深度学习框架(特别是Transformer和时序卷积网络TCN)在建模言语序列中的时间依赖性和变化方面表现出优越性能。这些模型通过使Transformer捕捉整体上下文关系,即使在声学信号减弱、模糊或退化的情况下也能实现音素识别13。TCN则通过提供稳定的感受野和时间平滑效应,进一步提升音素边界检测的准确性。当这两种方法整合到多模态融合框架中时,可显著提高构音障碍言语中音素标注的准确性,并促进更精确、以反馈为导向的临床康复。因此,这些多模态深度学习架构与实时临床目标高度一致,例如提升言语可懂度的测量精度、监测康复进程,以及提供针对个体特定运动性言语障碍特征定制的技术辅助治疗14

尽管这些多模态深度学习架构在解决音素标注不精确问题方面具有巨大潜力,但要将其从实验框架有效转化为可靠的诊断工具,仍需要统一的操作结构。为此,本研究描述了一个全面的计算工作流程,涵盖多模态数据采集、特征提取和模型训练。目标是确保这些复杂系统在多种临床情境下均可重复和验证。建立这样一条透明的方法学流程,对于言语语言病理学家和临床工程师在不同患者特征和障碍程度范围内验证算法至关重要。最后,这种系统化的方法为临床应用奠定了基础,有助于将先进的语音模型整合到监管评估、电子健康系统以及长期治疗监测平台中。

访问受限。请登录或开始试用以查看此内容。

综述与观点

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

构音障碍言语中多模态数据采集概述

鉴于构音障碍症状的复杂性和多样性,必须进行多模态数据采集,以全面研究言语运动控制,并开发高效的诊断和康复技术。

声学记录装置 

声学通道仍然至关重要。录音最好在经过声学处理的环境中进行,以减少混响和环境噪声。常用的麦克风为高质量电容式麦克风,可采用心形指向的头戴式或桌面式设备,并保持一致的摆放位置,以控制信号电平并避免不同录音会话之间的差异。常见的采样率为 16 kHz 或 44.1 kHz,其中 16 kHz 已足以满足可懂度和韵律分析的需求,而 44.1 kHz 可提供更高的保真度,适用于精细的声学/发声研究。多通道音频接口可实现多个音频流的同步采集,必须保持增益设置和动态余量的一致性,以避免削波或本底噪声。为了确保可重复性,建立校准流程并记录麦克风增益、环境噪声本底及漂移情况尤为重要。在构音障碍言语语料库中,音频质量尤为关键,因为声学信号的异常可能较为细微,容易被不良的录音条件所掩盖15

可选的言语运动/唇部追踪/肌电图/超声成像模态

为了超越声学波形的局限,通常需要结合其他模态来捕捉发音器官的运动学特征及生理性的肌肉活动。因此,唇部追踪或面部运动捕捉技术可用于量化唇部/下颌的开合程度、运动轨迹、速度及对称性。电磁发音描记法(EMA)能够在三维空间中追踪舌、下颌和唇部传感器的位置,提供发音器官在时间和空间上的高分辨率数据;而表面肌电图(sEMG)则记录肌肉活动,以探究构音障碍背后的神经肌肉激活缺陷。超声舌成像(UTI)可在发音过程中实时显示舌面形态,适用于无法耐受EMA检查的受试者。多模态系统研究表明,结合声学信号与发音器官/视觉运动信息的同步采集,可显著提升对言语运动障碍的识别能力16

伦理考量与患者知情同意

与构音障碍患者合作时常涉及脆弱人群。研究人员必须获得机构审查委员会(IRB)或伦理委员会的批准,并确保知情同意书明确说明录音方式(音频、视频、生理传感器)、数据存储、匿名化处理、未来使用及退出权利。知情同意书应明确提及视频采集(唇部/面部追踪),并可根据情况选择性地涵盖肌电图(EMG)等敏感模态。必须妥善管理数据隐私,尤其是在存储视频或面部图像时。有必要评估参与者的舒适度、疲劳程度、运动限制以及潜在风险。实验过程中应安排休息时间,并告知参与者可在任何时候无后果地中止实验。构音障碍语音语料库研究中参与者数量稀少且个体差异大,这进一步凸显了严格遵守伦理规范的重要性17

数据预处理步骤(分割、降噪、归一化)

MAV-HuBERT 系统在帧级别上对声学和视觉数据进行时间对齐,从原始波形中提取26维对数滤波器组能量,并将其与基于 Dlib 的人脸识别采集的25 Hz视觉帧同步。连续的音频帧通常被合并以稳定短期波动,融合后的视觉区域在多模态特征融合之前进行空间归一化。这些预处理操作提供了连续的时间一致性,并减少了音频和视觉模态之间的变异,从而提高了下游识别的准确性15,18

特征工程与计算工作流程

多模态深度学习模型需要对发音障碍言语中的声学、发音运动和视觉信息进行同步表征,以准确标注音素。本节概述了多模态语音分析中所采用的特征表征技术,随后详细介绍了在模型训练前提取并对齐这些特征的逐步计算流程。

特征提取与表示

在多模态语音分析中,原始音频和运动信号必须被转换为能够被深度学习模型处理的有意义的表示形式。其中最广泛使用的表示方法之一是频谱图,它展示了信号能量随时间及频率的变化情况。基于频谱图的表示方法有助于捕捉构音障碍语音中常见的特征,例如含糊发音、气息声以及不规则的时序19

另一个常用的特征是梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients, MFCCs),它以近似人类听觉感知的方式表征语音的频谱特性。MFCC 特征在语音识别中被广泛使用,因为它们提供了紧凑且抗噪声的表示形式,即使在语音失真的情况下仍能保持稳定20。除了声学特征外,多模态方法还融合了发音器官的信息,例如舌头、嘴唇和下颌的运动轨迹。这些信号可通过电磁发音描记术(electromagnetic articulography, EMA)、超声舌成像(ultrasound tongue imaging, UTI)或光学运动追踪技术获取。发音特征提供了关于言语运动控制的直接信息,有助于补偿退化的声学信号21

视觉信息对于分析构音障碍言语也具有重要作用。从视频记录中提取的面部特征点,包括唇部轮廓、下颌位移和 mouth opening,可为发音提供额外的线索。这些视觉特征有助于改善音素的区分能力,尤其是在声学信号不清晰的情况下。对于监督学习而言,所有特征流必须与音素级转录对齐,以确保每一时间帧对应正确的语音单元。精确的对齐对于训练音素标注模型至关重要,特别是在构音障碍言语中,音素边界常常模糊不清22

计算工作流程

本节演示了重现多模态音素标注工作流程的每一步骤,从特征提取到模型评估(图1)。

通过频谱图和梅尔频率倒谱系数提取声学特征

首先,使用短时傅里叶变换(STFT)将原始语音信号转换为时频表示。为了生成频谱图,信号被分割为短的重叠帧,每帧分别进行傅里叶变换。
梅尔频率倒谱系数(MFCCs)用于从频谱图中提取感知加权的声学特征。在语音识别和构音障碍分析中,MFCCs 提供了紧凑且抗噪声的表示形式23,24。由于其鲁棒性和有效性,MFCCs 在语音识别和说话人识别相关应用中被广泛使用。因此,鉴于其有效性,MFCCs 被进一步提取以计算并逼近人类听觉感知水平,从而提供压缩且抗噪声的声学特征25

获取发音运动轨迹

通过获取言语器官的物理运动数据来记录其运动过程。电磁发音运动描记法(EMA)利用附着在舌头、嘴唇和下颌上的传感器,以三维方式追踪发音器官的运动。另一种方法是, 超声舌成像(UTI)可用于无创估计舌部运动。记录的运动轨迹经过滤波、归一化和降采样处理,以匹配声学特征的帧率,确保时间上的一致性26将语音转换为超声舌成像(UTI)序列是一种通过将听觉特征映射到生理舌运动,从而从语音数据中估计舌部超声轨迹的技术。该方法为直接发音器官数据采集技术提供了一种非侵入性替代方案,可用于监测和治疗言语及声道异常,同时避免了直接测量方法所必需的专用设备和临床经验。27,28根据可获取的发音特征(如使用电磁发音仪(EMA)或超声成像(UTI)记录的舌头、嘴唇和下颌的运动轨迹),对信号进行滤波和降采样,以匹配声学帧的速率。

视觉标志物的检测

对于语音和视频输入,需要通过 Mediapipe 或 OpenFace 等工具提取面部关键输入(唇角、下颌线运动),然后对这些数据进行归一化处理以消除头部姿态的影响。MediaPipe 采用深度学习框架来估计面部和身体姿态,提供共 33 个用于通用姿态识别的标记点,其中 11 个专门用于面部。其有效性可能因遮挡情况而有所变化。MediaPipe FaceMesh 模型通过使用面部的 468 个三维标记点,并结合几何方法进行头部姿态估计,从而提高了可靠性29。OpenFace 2.0 是一个用于分析面部行为的工具箱,能够实现面部标记点检测、头部姿态估计、眼动追踪以及面部动作单元识别。它支持与多种编程语言集成,并可处理实时视频流或静态图像。输出内容(如面部标记点和视线向量)可以 CSV 格式导出。OpenFace 2.0 采用卷积专家约束局部模型(Convolutional Experts Constrained Local Model, CE-CLM),该模型包含点分布模型以应对标记点形状的变化,以及局部外观差异的补丁专家模型29,30

音素转录对齐

下一步是使用强制对齐工具(如蒙特利尔强制对齐器,MFA),将所有特征流(声学、发音和视觉)临时对齐到音素级别的标注,以确保为计算模型训练提供同步的多模态输入。强制对齐(FA)是一种将文本转录与音频信号对齐的技术,用于确定语音单元的时间边界。这有助于实现更精确的音频处理,并推动语言学研究。该技术在语音学研究中应用日益广泛,且已被证明比人工对齐显著更快。尽管强制对齐通常与自动语音识别(ASR)系统相关联,但它实际上是自动语音处理中更广泛的任务,涵盖口语分析与转录22。蒙特利尔强制对齐器(MFA)是一种领先的FA工具包,采用HMM-GMM算法实现高效的对齐。尽管自动语音识别技术不断进步,传统的HMM-GMM方法在强制对齐任务中仍广受欢迎。MFA利用MFCC特征和四阶段训练方法,构建具有精确音素对齐的声学模型31

模型架构的组成部分 

用于构音障碍语音识别的多模态深度学习模型包含多个关键组件,这些组件协同工作以捕捉上下文、时序和多模态信息。主要组件包括上下文编码器、时序优化模块以及多模态融合机制。每个组件在提高言语障碍语音中音素标注准确性方面均发挥特定作用。

基于 Transformer 的上下文编码器

Transformer 编码器用于建模语音序列中的长距离依赖关系。构音障碍性语音通常包含不规则的时序和模糊的音素边界,使得传统模型难以捕捉上下文信息。Transformer 利用多头自注意力机制来分析输入序列中不同时间帧之间的关系,从而使模型在预测音素时能够同时考虑过去和未来的语音帧。因此,编码器能够更好地处理构音障碍中常见的发音和语音变异。在多模态架构中,Transformer 接收同步的声学、发音和视觉特征,并生成具有上下文感知能力的表征,传递给模型的下一阶段32,33。 

基于 TCN 的时间序列优化

在上下文编码之后,特征序列通过时间卷积网络(Temporal Convolutional Network, TCN)进行处理,以提高时间精度。构音障碍性言语通常包含不稳定的时序、停顿以及延长的音素,这需要在上下文建模之外进行额外的细化。TCN 使用扩张因果卷积来捕捉长时间依赖关系,同时保持计算效率。该结构使模型能够平滑噪声预测结果,并在时间上保持一致的音素边界。在该架构中,TCN 接收 Transformer 编码器的输出,并对序列进行细化,以生成稳定且时间上一致的特征表示33,34,35。 

多模态融合策略

为了提高构音障碍评估的诊断精确性,多模态融合技术整合了来自多种来源的信息,如语音、文本、视频和生理传感器。主要技术包括三个不同步骤:早期融合、晚期融合和中间层融合36。早期融合在基础层面合并多种模态的数据,使模型能够从初始阶段就理解复杂的关联关系。但由于需要同步多种采样率和数据类型,其应用受到限制。晚期融合则首先使用独立模型分别处理各模态信息,再将结果整合以进行最终评估。当某一模态的数据缺失时,该方法具有较高的灵活性和有效性。此外,中间层融合通常在中等层次上整合模态信息,常采用交叉注意力技术来检测模态间的依赖关系。该方法在临床环境中尤为有效,通过结合语言参考信息与声学数据显著提升了评估效果。总之,在自动构音障碍评估中,采用交叉注意力的中间层融合方法相比基于单一模态的方法能够取得更优的结果36,37

构音障碍模型训练与评估的最佳实践:

构建用于构音障碍评估与识别的强健模型,需要在数据集划分、指标评估和可解释性方面给予仔细考量。近期研究强调了标准化方法和创新性解决方案,以应对构音障碍语音所特有的挑战,包括数据稀缺性、个体差异性以及临床相关性38,39

数据集划分策略

为确保训练集、验证集和测试集之间不交换说话人信息,防止数据泄露和过拟合,目前普遍采用分层分组K折交叉验证方法38,39。该方法使模型能够在数据量有限或数据多样性较高的情况下,仍保持均衡的分布和可靠的性能评估。由于按说话人进行数据划分对于避免偏差至关重要,常见的划分方式包括75:25或85:15的训练/测试比例,并进一步划分出验证集40。针对构音障碍数据有限的问题,常用的数据增强方法包括合成数据生成、语速扰动以及从健康语音中进行迁移学习41,42

评估指标

模型可解释性考虑

  1. 注意力图与对齐曲线:基于注意力机制的模型可提供可视化表征,突出模型优先关注的语音片段或音素,有助于临床解释并增强可信度43
  2. 音素/特征分析:识别与构音障碍严重程度相关的重要音素或声学特征,有助于提升模型透明度和临床理解44
  3. 混合方法:将基于自动语音识别(ASR)的可懂度评估与传统声学特征相结合,可进一步提高可解释性45

因此,一个完整的构音障碍模型流程应包括分层的、与说话人无关的数据划分,多方面的评估(错误率、可懂度、临床输入),以及通过注意力机制实现的可解释性。这些方法可确保构音障碍评估与识别的模型系统具有鲁棒性、临床相关性及透明性。

代表性结果

多项研究报道,当使用多模态特征时,音素边界判别的精确度有所提升。构音障碍性言语中常包含模糊或延长的发音过渡,使得确定音素之间的精确边界变得困难。已发表的结合声学、发音运动和视觉特征的模型,相较于单模态系统,显示出与参考标注更高的一致性。这些改进通常通过对齐曲线进行可视化,其中多模态模型在时间误差方面表现更小,尤其是在辅音-元音过渡阶段46。文献还报道了音素分类准确率的提升。多模态架构已被证明能够减少替代和删除错误,特别是针对在构音障碍中常发生畸变的擦音和元音。先前研究中报告的混淆矩阵表明,结合视觉和发音运动信息有助于模型更可靠地区分相似音素。音素边界精确度的提高是一个显著的例子。构音障碍言语中的发音过渡和变化通常被拉长或模糊,这使得判断一个音素何时结束、另一个音素何时开始变得困难。为了更精确地识别音素的起始和终止时刻,多模态系统利用了来自视觉唇部运动、发音轨迹和音频的共享数据。与单模态声学模型所预测的结果相比,可视化显示的音素边界更接近真实标注。对齐曲线用于展示这些改进,其中多模态模型在时间判断上的误差更少,特别是在元音-辅音和辅音-元音(VC 和 CV)过渡阶段。在临床环境中,这可以生成更精确的分段图谱,进一步帮助言语治疗师和临床医生识别特定的运动控制问题,例如唇部圆展不足或下颌闭合延迟47

此外,该模型能够生成差异性分类输出,可用于识别最可能的发音音素序列。与传统模型和基线模型相比,多模态系统在音素替换和删除错误方面有所减少。例如,结合嘴唇的视觉形状及发音器官位置线索,可提高对擦音(如 /s/ 和 /ʃ/)的分类准确性,这些音素在构音障碍中常出现扭曲和错位。混淆矩阵也可用于展示此类改进,其中音素辨别能力与分支能力的提升表现为跨类别混淆程度的降低48

可使用临床相关性图表比较模型支持校正前后言语可懂度的测量结果。该图表可包含音节稳定性与时间、元音空间面积估计、辅音精确度评分以及整体可懂度评分等指标。通常,经过校正后的输出在韵律、节奏和发音边界方面均有改善。例如,校正后元音空间的表征通常会扩大,表明元音声学区分度增强,这是许多构音障碍治疗中的关键治疗目标39

重要的是,这些模型的输出旨在通过增强而非取代临床医生的判断来支持临床决策。该系统可以突出显示与预期或理论假设模式显著偏离的特定音素或发音转换。根据这些信息,治疗师可以制定个性化的治疗目标,包括:(a)改善舌尖抬高动作在齿龈辅音(如 /t/、/d/)中的稳定性;(b)加强圆唇元音(如 /u/)的唇部前突训练;(c)改善浊塞音辅音的起始时间。

已有研究强调,这些输出结果应作为临床解读的补充,而非取代医生的判断。模型可视化结果(如注意力图和音素对齐图)可协助治疗师识别特定的发音问题,例如舌体抬升不足、唇部圆缩减弱或发声起始延迟。总体而言,多项研究数据显示,多模态深度学习架构不仅提升了技术性能指标,还能提供可解释的输出结果,有助于治疗方案制定及康复进展追踪。

临床整合与康复工作流程

在构音障碍康复中应用数字技术和先进的语音模型,正在改变患者的治疗效果、治疗服务的提供方式以及临床实践。本节讨论以反馈为导向的构音训练框架、言语治疗师角色的演变与患者监测、模型输出在治疗工具中的整合,以及重要的可用性问题。

这些模型输出如何应用于言语治疗工具?

现代人工智能和深度学习模型(包括自动语音识别和严重程度分类器)能够生成关于言语可懂度、发音错误及严重程度水平的详细且客观的数据48。如今,这些输出 increasingly 被整合到数字治疗平台和移动应用程序中,为患者和治疗师提供实时、个性化的反馈49。例如,基于平板电脑的应用程序和基于云的远程监测系统利用模型生成的指标来可视化治疗进展,突出特定的发音缺陷,并动态调整训练难度。这些系统可实现对治疗进展的客观追踪,支持个性化训练内容的选择,并通过数字平台实现远程监测50,51,52

基于反馈的发音训练模块

基于反馈的训练模块是数字化构音障碍康复的核心。既往研究表明,数字化康复模块通常包含生物反馈、自动错误检测以及自适应练习设计。言语治疗中的生物反馈利用视觉和听觉提示(如波形显示和发音器官运动的可视化图像),为患者提供实时指导。此外,通过人工智能模型实现自动错误检测,可识别语音或发音方面的错误,并提供即时纠正性反馈以增强学习效果。训练过程具有层次性和自适应性,即从较简单的任务逐步过渡到更复杂的任务,有针对性地训练语音、音节或单词。这些练习会根据患者的表现进行动态调整,确保实现个性化的学习体验。此外,部分平台引入了游戏化元素和虚拟现实(VR),以提高患者的治疗动机和依从性,使治疗过程更具吸引力。因此,这些模块支持高强度、重复性的练习,这正是运动学习和言语改善的关键,同时允许患者独立使用或在治疗师指导下使用51,53,54

言语治疗师的作用与患者监测

尽管近十年来数字工具的应用日益广泛,言语语言治疗师(SLTs)在康复过程中仍处于核心地位。评估与目标设定需要解读模型输出,以选择合适的治疗目标,并根据每位患者的具体需求定制差异化的治疗方案。监督与反馈对于监测患者进展至关重要;专家提供关于言语纠正的反馈,并根据需要对治疗方案进行必要调整。此外,强调对患者的教育与支持,指导患者如何在康复过程中有效使用数字工具。多学科协作至关重要,来自不同领域的专业人员共同合作,以满足康复过程中的广泛需求,确保为患者提供全面的照护。数字平台增强了对患者的监测能力,使治疗师和临床医生能够远程跟踪患者的依从性、恢复情况、表现及治疗结果,从而实现及时干预和持续支持51,52

可用性考量:患者舒适度与可重复性

要成功实施数字化康复技术,可用性至关重要,重点在于满足各类患者需求的用户友好型界面。移动平台能够实现灵活的治疗方式,从而提升舒适性和可及性。可调节模块和自动反馈等重要功能有助于促进持续、自主的参与,这对运动学习至关重要。初步测试显示患者接受度和满意度较高,但仍存在一些技术问题。来自患者和治疗师的持续反馈有助于改进这些工具,使其更符合实际应用需求。通过强调创造有意义的治疗体验,人工智能和反馈驱动训练在言语治疗中的应用正在提高构音障碍康复的疗效、可及性和个性化水平48,51,52,53,54.

访问受限。请登录或开始试用以查看此内容。

结论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文综述了多模态深度学习架构在构音障碍语音音素标注和语音恢复中的日益广泛应用。这些架构结合声学、发音运动和视觉分析,以克服基于音频的语音识别在病理语音(其特征为可懂度低和发音构型非标准化)中的局限性。电磁发音描记术、超声舌成像和面部标志点检测是更为整体化的语音产生模型,可能使我们能够捕捉到障碍语音中的声学细节和运动指令。这些技术有望改善音素边界识别、序列稳定性以及对退化模态的抗干扰能力。通过采用基于注意力机制的上下文编码(如Transformer模型)、时间卷积优化以及多模态融合策略,有望开发出更优的语音评估工具,并更有效地监测治疗进展。在临床方面,多模态模型可提供客观且可解释的语音产生及康复效果评估指标。未来的研究方向包括在更大规模的多模态数据集上进行训练、提升模型的可解释性,以及开发用户友好的临床平台,以促进这些多模态模型在真实临床环境中的应用。总体而言,深度学习的多模态方法在提高构音障碍评估与康复技术的准确性、临床实用性和可及性方面展现出巨大前景。

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明无利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢中国药科大学附属南京中医院为本研究提供了必要的奖学金和经费支持(江苏省研究生科研创新计划项目 KYCX25_2282)。

访问受限。请登录或开始试用以查看此内容。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kundi, P., Gencer, Z. K., Muluk, N. B. Speech Disorders and Aphasia: Overview. Phys Ther Rehabil Otorhinolaryngol. , 487-494 (2025).
  2. Rose, K. R., Hughes, P. M. Speech systems. Br Telecom Technol J. 13 (2), 51-62 (1995).
  3. Ackermann, H., Hertrich, I. The contribution of the cerebellum to speech processing. J Neurolinguistics. 13 (2–3), 95-116 (2000).
  4. Johnson, J. A. Speech, Voice, and Communication. Int Rev Neurobiol. 134, 1189-1205 (2017).
  5. Enderby, P. Disorders of communication: dysarthria. Handb Clin Neurol. 110, 273-281 (2013).
  6. Feenaughty, L., Mefferd, A., Tjaden, K. Dysarthria. Encycl Hum Brain. 1-5, V5-301-V5-315 (2023).
  7. Pan, T., Wang, S. Dysarthria as a Presenting Symptom With Rapidly Progressive Imaging Features in Sporadic Creutzfeldt-Jakob Disease: A Case Report. Cureus. 16 (6), e62687 (2024).
  8. Kieling, M. L. M., Finkelsztejn, A., Konzen, V. R., dos Santos, V. B., Ayres, A., et al. Articulatory speech measures can be related to the severity of multiple sclerosis. Front Neurol. 14, (2023).
  9. Kirshner, H. S., Samuels, M. A. Speech and Language Disorders. Neurol Localization Diagnosis. , 177-189 (2023).
  10. Gutz, S. E., Stipancic, K. L., Yunusova, Y., Berry, J. D., Green, J. R. Validity of Off-the-Shelf Automatic Speech Recognition for Assessing Speech Intelligibility and Speech Severity in Speakers With Amyotrophic Lateral Sclerosis. J Speech Lang Hear Res. 65 (6), 2128 (2022).
  11. Nasereddin, H. H. O., Omari, A. A. R. Classification techniques for automatic speech recognition (ASR) algorithms used with real-time speech translation. Proc Comput Conf 2017. , 200-207 (2018).
  12. Ríos-Urrego, C. D., Escobar-Grisales, D., Orozco-Arroyave, J. R. Synchronous Analysis of Speech Production and Lips Movement to Detect Parkinson’s Disease Using Deep Learning Methods. Diagnostics. 15 (1), 73 (2024).
  13. Deng, S., Du, J., Zhang, J., Wang, X. Deep learning approach for short-term entry passenger flow forecasting in urban rail transit stations. Eng Appl Artif Intell. 163, 112989 (2026).
  14. Tunio, N. A., Tunio, M. A., Raza, M. A., Faheem, M., Hashmani, A. A., Nadeem, R. Performance Comparison Between Deep Learning Models for Fault Classification in Transmission Lines Using Time Series Data. Energy Sci Eng. 13 (5), 2330-2351 (2025).
  15. Yu, C., Su, X., Qian, Z. Multi-Stage Audio-Visual Fusion for Dysarthric Speech Recognition With Pre-Trained Models. IEEE Trans Neural Syst Rehabil Eng. 31, 1912-1921 (2023).
  16. Qian, Z., Xiao, K. A Survey of Automatic Speech Recognition for Dysarthric Speech. Electron. 12 (20), 4278 (2023).
  17. Strand, E. A. Clinical and professional ethics in the management of motor speech disorders. Semin Speech Lang. 24 (4), 301-311 (2003).
  18. Alhinti, L., Cunningham, S., Christensen, H. The Dysarthric Expressed Emotional Database (DEED): An audio-visual database in British English. PLoS One. 18, (2023).
  19. Lee, S. E., Huang, M. L., Hsu, T. C. Using Spectrogram to Evaluate Dysarthric Treatment Effectiveness. Rehabil Pract Sci. 18 (1), 177-185 (1990).
  20. Abdul, Z. K., Al-Talabani, A. K. Mel Frequency Cepstral Coefficient and Its Applications: A Review. IEEE Access. 10, 122136-122158 (2022).
  21. Chartier, J., Anumanchipalli, G. K., Johnson, K., Chang, E. F. Encoding of articulatory kinematic trajectories in human speech sensorimotor cortex. Neuron. 98 (5), 1042 (2018).
  22. Williams, S., Foulkes, P., Hughes, V. Analysis of forced aligner performance on L2 English speech. Speech Commun. 158, (2024).
  23. Janbakhshi, P., Kodrasi, I. . Experimental investigation on STFT phase representations for deep learning-based dysarthric speech detection. , (2022).
  24. Varma, V. J., Jana, A., Samal, A. K., S, A. u. r. o. b. i. n. d. o., Naidu, R. C., et al. Enhancing dysarthria severity classification: efficient audio-based deep learning models. Discov Appl Sci. 7 (8), (2025).
  25. Fadlil, A., Perdana, L., Pujiyanta, A., Imam Karim Fathurrahman, H., Muhammad Jogo Samodro, M. Implementation of Dysarthria Identification Using MFCC and Multilayer Perceptron Algorithm. SSRG Int J Electr Electron Eng. 12, 32-46 (2025).
  26. Rebernik, T., Jacobi, J., Jonkers, R., Noiray, A., Wieling, M., et al. A review of data collection practices using electromagnetic articulography. Lab Phonol. 12 (1), 1-42 (2021).
  27. Girod-Roux, M., Hueber, T., Fabre, D., Gerber, S., Canault, M., et al. Rehabilitation of speech disorders following glossectomy, based on ultrasound visual illustration and feedback. Clinical Linguist Phonetics. 34 (9), 826-843 (2020).
  28. Yang, Y., Su, R., Zhao, S., Ng, M. L., Yan, N., et al. Towards unified diffusion model for speech to ultrasound tongue imaging synthesis. Inf Fusion. 127, 103896 (2026).
  29. Bian, Y., Küster, D., Liu, H., Krumhuber, E. G. Understanding Naturalistic Facial Expressions with Deep Learning and Multimodal Large Language Models. Sensors (Basel). 24 (1), 126 (2023).
  30. Hammadi, Y., Grondin, F., Ferland, F., Lebel, K. Evaluation of Various State-of-the-Art Head Pose Estimation Algorithms for Clinical Scenarios. Sensors (Basel). 22 (18), 6850 (2022).
  31. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi. , 498-502 (2017).
  32. Yi, F., Wen, H., Jiang, T. ASFormer: Transformer for Action Segmentation. , (2021).
  33. Bharilya, V., Kumar, N. Machine learning for autonomous vehicles’ trajectory prediction: A comprehensive survey, challenges, and future research directions. Veh Commun. 46, (2024).
  34. Li, H., Qiu, T. Continuous Manufacturing Process Sequential Prediction using Temporal Convolutional Network. Comput Aided Chem Eng. 49, 1789-1794 (2022).
  35. Biffi, C., Roffo, G., Salvagnini, P., Cherubini, A. A temporal convolutional network-based approach and a benchmark dataset for colonoscopy video temporal segmentation. Comput Methods Programs Biomed. 270, 108782 (2025).
  36. Alzahrani, S., Hussain, N., Mohammad, F. Enhancing Phoneme Labeling in Dysarthric Speech with Digital Twin-Driven Multi-Modal Architecture. Comput Mater Contin. 84 (3), 4825-4849 (2025).
  37. Lv, C., Fan, L., Li, H., Ma, J., Jiang, W., et al. Leveraging multimodal deep learning framework and a comprehensive audio-visual dataset to advance Parkinson’s detection. Biomed Signal Process Control. 95, 106480 (2024).
  38. Dai, W., Li, M., He, Y., Zhu, Y. Fine-Tuning Pre-Trained Audio Models for Dysarthria Severity Classification: A Second Place Solution in the Multimodal Dysarthria Severity Classification Challenge. , 151-153 (2024).
  39. Qi, J., Van hamme, H. A Study on Model Training Strategies for Speaker-Independent and Vocabulary-Mismatched Dysarthric Speech Recognition. Appl Sci. 15 (4), 2006 (2025).
  40. Shahamiri, S. R., Lal, V., Shah, D. Dysarthric Speech Transformer: A Sequence-to-Sequence Dysarthric Speech Recognition System. IEEE Trans Neural Syst Rehabil Eng. 31, 3407-3416 (2023).
  41. Vinotha, R., Hepsiba, D., Vijay Anand, L. D., Andrew, J., Jennifer Eunice, R. Enhancing dysarthric speech recognition through SepFormer and hierarchical attention network models with multistage transfer learning. Sci Reports. 14 (1), 1-23 (2024).
  42. Hashan, A. M., Alexandrovich Khlebnikov, N., Bredikhin, B. A. Attention Based Encoder-Decoder for Automatic Hyperkinetic Dysarthria Speech Recognition in Educational Organizational Systems. , 1-4 (2025).
  43. Merler, M., Agurto, C., Peller, J., Roitberg, E., Taitz, A., et al. Clinical assessment and interpretation of dysarthria in ALS using attention based deep learning AI models. NPJ Digit Med. 8 (1), 260 (2025).
  44. Van Nuffelen, G., Middag, C., De Bodt, M., Martens, J. Speech technology-based assessment of phoneme intelligibility in dysarthria. Int J Lang Commun Disord. 44 (5), 716-730 (2009).
  45. Middag, C., Bocklet, T., Martens, J. P., Nöth, E. Combining phonological and acoustic ASR-free features for pathological speech intelligibility assessment. , 3005-3008 (2011).
  46. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  47. Zhu, T., Duan, S., Liang, H., Li, F., Zhang, W. Multiangle Correlation Feature Extraction and Disease Prediction Model Construction for Patients With Post-Stroke Dysarthria. IEEE Trans Neural Syst Rehabil Eng. 33, 587-597 (2025).
  48. Stell, A., Vogel, A. P., Vera Soto, J. P., Pareja, A. A., Sinnott, R. A Platform for the Delivery of Speech Treatment for Dysarthria in Multisystemic Ataxia. Proc - IEEE Symp Comput Med Syst. , 405-410 (2025).
  49. Gupta, S., Patil, A. T., Purohit, M., Parmar, M., Patel, M., et al. Residual Neural Network precisely quantifies dysarthria severity-level based on short-duration speech segments. Neural Networks. 139, 105-117 (2021).
  50. Javanmardi, F., Kadiri, S. R., Alku, P. Pre-trained models for detection and severity level classification of dysarthria from speech. Speech Commun. 158, 103047 (2024).
  51. Mulfari, D., La Placa, D., Rovito, C., Celesti, A., Villari, M. Deep learning applications in telerehabilitation speech therapy scenarios. Comput Biol Med. 148, 105864 (2022).
  52. Bhat, C., Strika, H. Speech Technology for Automatic Recognition and Assessment of Dysarthric Speech: An Overview. J Speech, Lang Hear Res. 68 (2), 547-577 (2025).
  53. Michizoe, R., Kinosada, H., Nishikawa, H., Taniguchi, I., Matsunaga, K., et al. Japanese Vowel-mora Visualization for Dysarthria Rehabilitation with Variational Autoencoder. , 494-498 (2024).
  54. Woo, S. T., Ha, J. W., Na, S. Design of a personalized oral—motor exercise device for speech impairment rehabilitation. Front Bioeng Biotechnol. 13, 1543259 (2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Transformer

相关文章