본 리뷰는 청각, 조음, 시각 정보를 결합한 다중 모달 아키텍처와 트랜스포머 및 TCN 모델이 어떻게 디어스 말하기에서 음소 식별을 향상시킬 수 있는지 살펴봅니다. 이 보고서는 이러한 기술들이 일반적인 ASR 시스템의 능력을 넘어 음성 명료성 평가와 맞춤형 치료를 향상시킬 수 있는 잠재력을 강조합니다.
리뷰 논문
본 리뷰는 청각, 조음, 시각 정보를 결합한 다중 모달 아키텍처와 트랜스포머 및 TCN 모델이 어떻게 디어스 말하기에서 음소 식별을 향상시킬 수 있는지 살펴봅니다. 이 보고서는 이러한 기술들이 일반적인 ASR 시스템의 능력을 넘어 음성 명료성 평가와 맞춤형 치료를 향상시킬 수 있는 잠재력을 강조합니다.
조음 문제와 음소 변이로 인해, 구음장애와 같은 언어 장애는 임상 재활에 큰 도전을 제기합니다. 전통적인 자동 음성 인식(ASR) 시스템은 일반적으로 규범적 데이터셋으로 학습되지만, 종종 구음 장애 음성을 정확히 해독하지 못합니다. 인공지능과 딥러닝의 최근 돌파구는 청각, 조음, 시각 정보를 결합하는 멀티모달 아키텍처의 통합을 가능하게 하여 복잡한 음성 패턴을 기록하는 것이 점점 가능해졌습니다. 본 리뷰에서는 다중모달 프레임워크 내에서 트랜스포머와 시간적 합성곱망(TCN)의 융합을 탐구하여 디오르트(dysarthria) 발화에서 음소 라벨링 부정확성을 해결하려 했습니다. 여기서는 트랜스포머 기반 맥락 모델링과 TCN 기반 시간적 정밀도가 음소 경계 탐지, 분류, 재활 피드백을 어떻게 향상시킬 수 있는지 논의합니다. 또한 개별화된 언어치료, 해석 가능성 문제, 임상 응용에서 이러한 하이브리드 시스템의 잠재력도 논의합니다. 멀티모달 아키텍처는 임상 의학과 의료 정보학을 연결하여 운동 언어 장애를 가진 사람들을 위한 치료 모니터링, 의사소통 보조기, 음성 명료성 평가를 향상시키는 중개 접근법입니다.
신경계 기능 장애는 근골격계 질환, 신경혈관 질환, 신경성 의사소통 장애 등 급격하고 갑작스러운 건강 결과를 초래하는 경우가 많습니다. 신경성 의사소통 장애에는 근육 약화와 발음 계획 장애로 인한 발음 어눌증과 구실행증 같은 장애가 포함된다. 말하기는 호흡, 발성, 공명, 조음, 운율이라는 다섯 가지 하위 시스템으로 구성되며, 이 모든 것이 효과적으로 소통하기 위해서는 시너지 효과가 없고 매끄럽게 협력해야 합니다. 이러한 하위 시스템의 기능 장애로 인해 발생하는 구음장애는 청각성, 자연스러움, 명확성, 의사소통 효율성을 저하시켜 환자와 가족의 삶에 심각한 영향을 미칩니다. 구음장애는 대뇌 피질, 기저핵, 소뇌, 기저핵, 뇌신경 또는 말초신경의 기능 장애 등 다양한 신경학적 질환과 기저 병리로 인해 발생할 수 있습니다. 기타 원인으로는 혀, 후두, 목의 1차 운동 문제가 있습니다.
디어르트리아는 호흡, 발성, 공명, 음성 생성, 발성 및 리듬에 영향을 미치는 신경근 조절 변화로 인해 발생하는 운동 언어 장애를 포괄하는 용어입니다. 따라서 구음장애는 신경근 장애와 부상과 자주 연관되며, 말하는 데 사용되는 근육이 약하거나 느리거나 마비된 상태입니다. 말에 관여하는 특정 근육 유형으로는 혀, 목, 얼굴, 입술, 성대, 턱, 그리고 상기도 근육이 포함됩니다. 이 근육들의 손상은 다양한 형태로 나타날 수 있는데, 여기에는 근육을 지배하는 운동 뉴런이나 혈관 손상이 있어 산소 공급이 끊기는 경우도 포함됩니다. 말하기 전도에 장애를 일으키는 전형적인 신경학적 손상으로는 말하기 근육의 경직이나 경직을 유발할 수 있는 상부 운동 뉴런 손상, 신경 신호 차단으로 인해 근육 약화나 마비를 초래할 수 있는 하부 운동 뉴런 손상, 근육 간 협응력 상실(운동실조증), 또는 협응력 저하로 인한 기저핵 손상(과운동성 운동) 등이 있습니다 근육의 경직(저운동 운동)5.
디어르트리아는 다양한 신경학적 질환의 흔한 증상이며, 진행성 신경 질환과 자주 연관되어 있습니다. 의사소통은 자신의 개성을 표현하고 사회적 관계를 유지하는 데 중요한 역할을 하기 때문에 환자와 그 가족에게 큰 영향을 미칩니다. 이 질환은 말하기 명료성이 저하되는 것이 특징입니다. 구어체 내용은 그대로 유지되어 환자가 구어와 서면 언어 모두를 쓰고 해석할 수 있게 합니다; 반면, 무조화증은 가장 심한 유형으로,운동 언어 출력이 완전히 상실됩니다. 구음장애에는 여섯 가지 주요 분류가 있습니다: 하부 운동 신경 기능 장애와 관련된 이완성 구음장애; 대뇌 피질의 운동 영역과 연결된 상부 운동 뉴런 손상으로 인해 발생하는 경련성 구음장애; 주로 소뇌 문제로 인한 운동운동성 구음장애; 그리고 외피라미드계 장애와 관련된 과운동성 구음장애 및 저운동성 구음장애가 있습니다. 여섯 번째 유형은 일반적으로 혼합성 구음장애(mixed dysarthria)라고 불리며, 여러 부위의 손상과 연관되어 최소 두 가지 범주의 특성을 나타내는 말 특성을 보입니다. 이 여섯 가지 주요 유형의 구음장애와 관련된 언어 장애는 독특하며, 구음장애의 진단과 치료에 도움이 될 수 있습니다.
조음 문제의 원인은 감염(예: 크로이츠펠트-야콥병 및 후천성 면역결핍증후군), 혈관 문제(허혈성 및 출혈성 뇌졸중), 종양(뇌 신생물), 탈수초 질환(다발성 경화증 및 길랭-바레 증후군 포함), 퇴행성 질환(파킨슨병, 헌팅턴병 등), 손상(외상성 뇌손상 및 뇌성마비), 독성 노출(중금속에 의한 것), 알코올과 약물), 유전 질환(예: SANDO)7. 또한 구순열이나 구개열과 같은 비신경학적 요인도 조음 문제를 일으킬 수 있으나, 이들은 8형 구음장애(dysarthria8) 범주에는 포함되지 않습니다.
임상 환경에서 조음장애의 중요성은 개인의 삶의 질에 미치는 중대한 영향에 있습니다. 소통은 사회적, 교육적, 전문적 참여에 필수적이기 때문에, 의사소통을 겪는 사람들은 종종 고립감과웰빙 저하에 직면합니다. 예를 들어, 이완, 경련, 운동실조, 과운동, 저운동, 혼합성 등 다양한 유형의 조음장애를 정확히 진단하는 것은 근본적인 신경학적 문제를 파악하고 재활 접근법을 평가하는 데 필수적입니다. 언어치료사와 임상의는 종종 구음장애의 특성과 심각도를 분석하여 치료를 맞춤화하고, 달성 가능한 의사소통 목표를 설정하며, 보완적 및 대체 의사소통 방법의 필요성을 평가합니다. 9. 말하기 어려움이 있는 사람들에게는 자동 음성 인식(ASR) 시스템이 접근성과 사회적 상호작용을 개선하는 것으로 밝혀졌습니다. 그럼에도 불구하고, 음향 모델의 부족은 ASR이 장애 발음을 다루는 데 있어 전반적인 성공을 저해해왔습니다. 따라서 본 논문은 억음음 발음의 음소 문제, 기존 ASR 시스템과 그 한계, 창의적인 다중 모드 기법, 트랜스포머 기반 맥락 모델링, 그리고 시간적 및 순차적 정제를 위한 TCN에 대해 깊이 탐구합니다.
ASR 기술이 크게 발전했음에도 불구하고, 최고 수준의 ASR 시스템은 여전히 언어 장애인을 위한 많은 단점을 가지고 있습니다. 이러한 단점은 부분적으로 다양하고 대표성 있는 언어 장애 학습 데이터셋을 얻는 데 어려움이 있을 수 있습니다. 장애 음성 ASR에서 발생하는 한 가지 문제는 개인마다 다양한 비정상적인 음성 특성과 이러한 변이가 훈련 데이터셋에서 불충분한 표현으로 나타나는 것과 관련이 있을 가능성이큽니다. 그럼에도 불구하고, 구음장애와 관련된 ASR 연구에서는 이러한 다양성을 종종 간과해왔습니다.
ASR 시스템은 스피커 독립형(SI), 스피커 의존형(SD), 스피커 적응형(SA) 세 가지 범주로 나뉩니다. SI 시스템은 건강한 화자에게는 잘 작동하지만, 언어 저하에는 어려움을 겪으며, 학습 데이터에 구음 장애 화자가 포함될 때 더 좋은 성능을 보입니다. 반면, SD 시스템은 개별 사용자에 집중하여 뛰어난 정확도를 달성하는 반면, SA 시스템은 시간이 지남에 따라 사용자의 음성에 적응하여 SI와 SD 모델 모두를 능가합니다. 하지만 SA와 SD 모두 학습 데이터가 필요하며, 이는 신경퇴행성 장애 환자들에게 또 다른 장벽이 됩니다11. 상당한 진전에도 불구하고, 다양한 학습 데이터셋이 부족해 기존 ASR 모델은 장애인 화자에게는 여전히 적합하지 않습니다. 이 격차를 메우기 위해서는 구음장애의 다양한 측면을 포착하는 철저한 데이터 수집 방법론이 개발되어야 하며, 이를 통해 인식하기 어려운 화자들의 ASR 성능을 향상시킬 수 있습니다.
이러한 한계를 극복하기 위해 음향, 조음, 시각 신호를 결합한 다중 모달 전략이 구음 장애 증상에서 음성 생성과 정제를 포괄적으로 효과적으로 표현할 수 있습니다. 예를 들어, 혀 영상과 같은 조음 운동 데이터는 초음파 및 전자기 조음술을 통해 얻습니다. 이 데이터는 종종 시각적 입술 움직임과 결합되어 손상된 음향 정보를 보완하여 음소 구분 및 구분을 향상시키는 데 도움을 줍니다12. 이러한 중복성 시스템은 임상 평가 방법과 일치하여, 치료사들이 청각 말과 함께 구안면 움직임을 관찰할 수 있는 역량을 강화합니다. 반면, 딥러닝 프레임워크, 특히 트랜스포머와 TCN은 음성 시퀀스 내 시간적 의존성과 변동을 더 우수하게 모델링할 수 있습니다. 이 모델들은 트랜스포머가 전반적인 맥락적 관계를 포착할 수 있게 하여 음향 신호가 줄어들거나 가려지거나 감소하더라도 음소 식별을 가능하게 합니다13. TCN은 안정적인 수용 필드와 시간적 평활화를 제공함으로써 음소 경계 탐지의 정확도를 높여줍니다. 이 두 접근법이 다중 모달 융합 프레임워크에 통합될 경우, 난조음 발화에서 음소 표기의 정확성을 크게 높이고 보다 정밀하고 피드백 중심의 임상 재활을 촉진합니다. 따라서 이러한 다중 모달 딥러닝 아키텍처는 음성 명료성 측정 향상, 재활 여정 모니터링, 개인의 특정 운동 언어 장애 프로필에 맞춘 기술 지원 치료 제공과 같은 실시간 임상 목표와 직접적으로 연계되어있습니다.
이러한 다중 모달 딥러닝 아키텍처는 음소 표지 불정확성을 해결하는 데 큰 잠재력을 지니고 있지만, 실험적 프레임워크에서 신뢰할 수 있는 진단 도구로 효과적으로 전환하려면 통일된 운영 구조가 필요합니다. 이를 해결하기 위해 다음 연구는 다중 모달 데이터 수집, 특징 추출, 모델 훈련을 포함하는 포괄적인 계산 워크플로우를 설명합니다. 목표는 이러한 복잡한 시스템이 다양한 임상 상황에서 재현 가능하고 검증 가능하도록 하는 것입니다. 이러한 투명한 방법론적 파이프라인을 구축하는 것은 언어치료사와 임상 엔지니어가 다양한 환자 특성과 장애 수준에서 알고리즘을 검증하는 데 매우 중요합니다. 마지막으로, 이 체계적인 방법론은 임상 구현의 전조 역할을 하며, 고급 음성 모델을 규제 평가, 전자 건강 시스템, 장기 치료 모니터링 플랫폼에 통합할 수 있게 합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
난조음 발화에서의 다중 모달 데이터 수집 개요
다중 모달 데이터 수집은 구음장애 증상의 복잡성과 다양성을 고려할 때, 말 운동 조절을 철저히 검사하고 효율적인 진단 및 재활 기법을 개발하기 위해 필요합니다.
음향 녹음 장비
음향 채널은 여전히 중심에 머물러 있습니다. 녹음은 잔향과 주변 소음을 줄이기 위해 음향 처리된 환경에서 진행하는 것이 가장 좋습니다. 일반적인 마이크로폰은 고품질 콘덴서로, 카디오이드 헤드 마운트 또는 테이블탑 유닛으로, 신호 레벨을 조절하고 세션 간 변동을 방지하기 위해 일정하게 배치됩니다. 16 kHz 또는 44.1 kHz의 샘플링 속도가 매우 흔하며, 16 kHz는 명확성과 운율 분석에 충분하고, 44.1 kHz는 더 높은 음향 정확도를 제공하여 세밀한 음향/음향 연구에 유용합니다. 멀티채널 오디오 인터페이스는 여러 스트림의 동기식 캡처를 허용하며, 클리핑이나 플로어 노이즈를 피하기 위해 일정한 게인 설정과 헤드룸을 유지해야 합니다. 재현성을 위해서는 보정 설정과 마이크 게인, 주변 소음 바닥, 드리프트 기록이 중요합니다. 난조증 음성 코퍼스에서는 음향 신호 결함이 미묘할 수 있고 녹음 조건이 좋지 않아 쉽게 가릴 수 있기 때문에 오디오 품질이 특히 중요합니다15.
선택적 조음 / 입술 추적 / 근전도 / 초음파 기법
음향 파형을 넘어서기 위해서는 조음 운동학과 생리적 근육 활동을 포착하기 위해 추가적인 기법이 종종 필요합니다. 따라서 입술 추적 또는 얼굴 모션 캡처는 입술/턱 열림, 움직임, 속도, 대칭성을 정량화할 수 있게 해줍니다. 전자기 조영술(EMA)은 혀, 턱, 입술 센서를 3차원에서 추적하고 조음기의 시간적/위치 해상도를 제공하며, 표면근전도(sEMG)는 근육 활동을 기록하여 구음장애의 근본적인 신경근 활성화 결손을 탐구합니다. 초음파 혀 영상(UTI)은 조음 시 혀 표면을 실시간으로 촬영하여 EMA를 견딜 수 없는 환자에게 유용합니다. 다중 모드 시스템은 동시 음향 검사와 조음/시각 캡처 보완에 의해 음성 운동 결손 식별이 향상됨을 보여준다16.
윤리적 고려사항과 환자 동의
난조증 화자와 함께 일하는 일은 종종 취약한 인구와 관련됩니다. 연구자는 기관 심사위원회(IRB) 또는 윤리 위원회의 승인을 받아야 하며, 녹음 방식(오디오, 비디오, 생리학적 센서), 저장, 익명화, 향후 사용 및 철회 권리에 대해 설명하는 사전 동의를 반드시 확인해야 합니다. 동의서에는 비디오 촬영(입술/얼굴 추적)과 선택적으로 EMG와 같은 민감한 기법에 대해 명확히 다뤄야 합니다. 특히 영상이나 얼굴 이미지가 저장될 경우 데이터 프라이버시를 관리해야 합니다. 참가자의 편안함, 피로, 움직임 제한, 잠재적 위험을 평가하는 것이 필요합니다. 세션에는 휴식 시간이 포함되어야 하며, 참가자들은 언제든지 중단할 수 있으며 불이익을 받지 않도록 안내해야 합니다. 난조음 말할 말뭉치 연구에서 참가자의 희소성과 다양성은 윤리적 엄격함의 중요성을 더욱 강조합니다.
데이터 전처리 단계(세분화, 노이즈 감소, 정규화)
MAV-HuBERT 시스템은 프레임 수준에서 음향 및 시각 데이터를 시간적으로 정렬하여 원래 파형에서 26차원 로그 필터 뱅크 에너지를 추출하고, Dlib 기반 얼굴 식별로 수집된 25Hz 시각 프레임과 동기화합니다. 연속된 오디오 프레임들은 일반적으로 단기 변동을 안정화하기 위해 결합되며, 융합된 시각 영역은 다중 모달 특징 융합 전에 공간적으로 정규화됩니다. 이러한 전처리 활동은 연속적인 시간적 일관성을 제공하고 오디오 및 시각 방식 간 변동성을 줄여 더 높은 후속 식별 정확도를 가져옵니다15,18.
특징 공학 및 계산 워크플로우
다중 모달 딥러닝 모델은 난소음 음성에서 음소를 정확히 라벨링하기 위해 음향, 조음, 시각 정보를 동기화하여 표현해야 합니다. 이 절에서는 다중 모달 음성 분석에서 사용되는 특징 표현 기법을 개략적으로 소개하고, 모델 학습 전에 이러한 특징을 추출하고 정렬하기 위한 단계별 계산 워크플로우를 안내합니다.
특징 추출 및 표현
다중 모달 음성 분석에서는 원시 오디오 및 동작 신호를 딥러닝 모델이 처리할 수 있는 의미 있는 표현으로 변환해야 합니다. 가장 널리 사용되는 표현 중 하나는 스펙트로그램으로, 신호 에너지가 시간과 주파수에 따라 어떻게 변하는지를 보여줍니다. 스펙트로그램 기반 표현은 음이 흐릿함, 숨소리, 불규칙한 타이밍과 같은 특징을 포착하는 데 유용하며, 이는 구음 난조 발화에서 흔히 관찰됩니다19.
또 다른 흔히 사용되는 기능은 멜 주파수 셉스트랄 계수(MFCC)로, 이는 인간의 청각 지각에 근사한 방식으로 음성의 스펙트럼 특성을 나타냅니다. MFCC 기능은 음성 인식에서 널리 사용되며, 음성 왜곡20번에도 안정적으로 유지되는 컴팩트하고 노이즈 강인한 표현을 제공합니다. 음향적 특징 외에도, 다중 모달 접근법은 혀, 입술, 턱의 움직임 궤적과 같은 조음 정보를 포함합니다. 이 신호들은 전자기 관절조영술(EMA), 초음파 혀 영상(UTI), 또는 광학 운동 추적을 통해 얻을 수 있습니다. 조음 기능은 말하기 운동 조절에 대한 직접적인 정보를 제공하며, 저하된 음향 신호를 보상하는 데 도움을줍니다.
시각 정보는 구음 언어 분석에도 유용합니다. 영상 녹화에서 추출한 얼굴 랜드마크, 예를 들어 입술 윤곽, 턱 전위, 입 열음 등이 관절 발음에 대한 추가 단서를 제공합니다. 이러한 시각적 특징들은 특히 음향 신호가 불분명할 때 음소 구별을 향상시킵니다. 지도 학습의 경우, 모든 특징 스트림은 음소 수준 전사와 정렬되어야 하며, 각 시간 프레임이 올바른 음성 단위에 대응하도록 해야 합니다. 정확한 정렬은 특히 음소 경계가 종종 흐려지는 디심스 발화에서 음소 표지 모델 훈련에필수적입니다.
계산 워크플로우
이 섹션은 특징 추출부터 모델 평가까지 다중 모달 음소 라벨링 워크플로우를 재현하는 모든 단계를 어떻게 수행해야 하는지 보여줍니다(그림 1).
스펙트로그램과 MFCC 이용한 음향 특징 추출
첫째, 단시 푸리에 변환(STFT)을 사용하여 원시 음성 신호를 시간-주파수 표현으로 변환합니다. 스펙트로그램을 만들기 위해 신호는 짧게 겹치는 프레임으로 나뉘고, 각 프레임에 푸리에 변환을 받습니다.
멜 주파수 셉스트랄 계수(MFCC)는 스펙트로그램에서 지각에 가중된 음향 특징을 추출하는 데 사용됩니다. 음성 인식 및 억음장애 분석을 위해 MFCC(음성 장애 분석)는 컴팩트하고 노이즈가 강인한 표현을 제공합니다23,24. 견고성과 효과성 덕분에 MFCC는 음성 및 화자 인식과 관련된 응용 분야에서 흔히 사용됩니다. 따라서 MFCCC는 유용성 때문에 추출되어 인간의 청각 지각 수준을 계산하고 근사하여 압축되고 노이즈에 강한 음향 특성을 제공한다.
조음 궤적의 획득
조음 운동 데이터는 음성 기관의 물리적 움직임을 포착하기 위해 수집됩니다. 전자기 조음술(EMA)은 혀, 입술, 턱에 부착된 센서를 사용하여 조음 운동을 3차원에서 추적합니다. 또는 초음파 혀 영상(UTI)을 사용하여 비침습적으로 혀 움직임을 추정할 수 있습니다. 기록된 궤적은 필터링, 정규화, 다운샘플링되어 음향 특징의 프레임 속도와 일치하여 시간적 일관성을 보장합니다26. 음성 신호를 초음파 혀 영상(UTI) 시퀀스로 변환하는 것은 청각 특성을 생리적 혀 움직임에 매핑하여 음성 데이터를 바탕으로 초음파 혀 궤적을 추정하는 기법입니다. 이 방법론은 직접 조음 데이터 수집 기법에 대한 비침습적 대안을 제공하며, 직접 측정 접근법에 내재된 특정 장비와 임상 경험의 필요성을 피합니다. 혀, 입술, 턱의 움직임 궤적과 같은 조음 특징의 가용성을 바탕으로 EMA 또는 초음파(UTI)를 통해 기록하며, 신호는 필터링 및 다운샘플링되어 음향 프레임의 속도에 맞게 조정됩니다.
시각적 랜드마크 탐지
음성 및 영상 입력의 경우, 얼굴 키 입력(입술 모서리, 턱선 움직임)을 Mediapipe나 OpenFace 같은 도구를 통해 추출한 후 머리 포즈 효과를 제거하기 위해 정규화해야 합니다. MediaPipe는 얼굴과 신체 자세를 추정하기 위해 딥러닝 프레임워크를 사용하며, 일반 자세 인식을 위한 33개의 랜드마크를 제공하며, 그중 11개는 얼굴에 특화된 위치입니다. 특히 폐색의 경우 효과가 다양할 수 있습니다. MediaPipe FaceMesh 모델은 얼굴의 468개의 3D 랜드마크와 머리 자세 추정을 위한 기하학적 방법을 사용하여 신뢰성을향상시킵니다. OpenFace 2.0은 얼굴 행동 분석을 위한 도구 상자로 기능하며, 얼굴 랜드마크 감지, 머리 자세 추정, 눈 시선 추적, 얼굴 행동 유닛 인식을 가능하게 합니다. 다양한 프로그래밍 언어와의 통합을 지원하며 실시간 비디오 피드나 정지 이미지를 처리할 수 있습니다. 얼굴 랜드마크나 시선 벡터와 같은 출력은 CSV 형식으로 내보낼 수 있습니다. OpenFace 2.0은 컨볼루션 전문가 제한 지역 모델(CE-CLM)을 사용하며, 이 모델은 랜드마크 모양의 변동을 설명하는 점 분포 모델과 지역 외관 차이에 대한 패치 전문가를 포함하고 있습니다29,30.
음소 전사 정렬
다음 단계는 몬트리올 강제 정렬기(MFA)와 같은 강제 정렬 도구를 사용해 음소 수준 주석에 임시로 모든 특징 스트림(음향, 조음, 시각 스트림)을 정렬하여 계산 모델 학습을 위한 동기화된 멀티모달 입력을 보장하는 것입니다. 강제 정렬(FA)은 음성 단위의 시간적 경계를 결정하기 위해 전사본과 오디오 신호를 정렬하는 기법입니다. 이로 인해 오디오 처리가 더 정확해지고 언어학 연구가 발전합니다. 이 방법은 음운 연구에 점점 더 많이 사용되고 있으며, 수동 정렬보다 훨씬 빠른 것으로 입증되었습니다. 일반적으로 자동 음성 인식(ASR) 시스템과 연관되지만, FA는 음성 분석 및 전사를 포함하는 자동 음성 처리 내에서 더 넓은 작업입니다. 몬트리올 강제 교정기(MFA)는 효과적인 정렬을 달성하기 위해 HMM-GMM 알고리즘을 사용하는 최고의 FA 툴킷입니다. ASR 기술이 발전했음에도 불구하고, HMM-GMM과 같은 전통적인 접근법이 FA 작업에 여전히 인기가 많습니다. MFA는 MFCC 특성과 4단계 훈련 방법을 사용하여 정확한 음운 정렬31을 가진 음향 모델을 만듭니다.
모델 아키텍처의 구성 요소
디어스틱 음성 인식을 위한 다중 모달 딥러닝 모델은 맥락적, 시간적, 다중 모달 정보를 포착하기 위해 함께 작동하는 여러 핵심 구성 요소로 구성됩니다. 주요 구성 요소로는 컨텍스트 인코더, 시간 정제 모듈, 다중 모달 융합 메커니즘이 포함됩니다. 각 구성 요소는 장애 발음에서 음소 표명 정확도를 향상시키는 데 특별한 역할을 합니다.
트랜스포머 기반 컨텍스트 인코더
트랜스포머 인코더는 음성 시퀀스의 장거리 의존성을 모델링하는 데 사용됩니다. 구음 난조 발화는 종종 불규칙한 타이밍과 불명확한 음소 경계를 포함해 기존 모델이 맥락 정보를 포착하기 어렵게 만듭니다. 트랜스포머는 다중 헤드 자기 주의를 사용하여 입력 시퀀스 내 서로 다른 시간 프레임 간의 관계를 분석합니다. 이를 통해 모델은 음소를 예측할 때 과거와 미래의 음성 프레임을 모두 고려할 수 있습니다. 그 결과, 인코더는 구음장애에서 흔히 나타나는 조음 및 발음 변형을 더 잘 처리할 수 있습니다. 멀티모달 아키텍처에서는 트랜스포머가 동기화된 음향, 조음, 시각적 특징을 받아 맥락 인식 표현을 생성하여 모델32,33의 다음 단계로 전달합니다.
TCN 기반 시간적 시퀀스 정제화
컨텍스트 인코딩 후, 특징 시퀀스는 시간적 합성곱 네트워크(TCN)로 처리되어 시간적 정밀도를 향상시킵니다. 구음장애 발화는 종종 불안정한 타이밍, 일시 정지, 길어진 음소를 포함하며, 이는 맥락 모델링을 넘어 추가적인 정교함이 필요합니다. TCN은 확장된 인과 합성곱을 사용하여 긴 시간적 의존성을 포착하면서 계산 효율성을 유지합니다. 이 구조 덕분에 노이즈가 있는 예측을 부드럽게 하고, 시간에 따라 일관된 음소 경계를 유지할 수 있습니다. 아키텍처에서 TCN은 트랜스포머 인코더의 출력을 받아 시퀀스를 정제하여 안정적이고 시간적으로 일관된 특징표현 33,34,35를 생성합니다.
다중 모드 핵융합 전략
디어르트리아 평가의 진단 정밀도를 높이기 위해 다중 모달 융합은 목소리, 텍스트, 비디오, 생리학적 센서 등 다양한 출처의 정보를 통합합니다. 주요 기법은 초기 융합, 후기 융합, 중간 융합 세 단계로구성됩니다. 초기 핵합은 여러 모달리티의 데이터를 근본적으로 결합하여 모델이 처음부터 복잡한 관계를 이해할 수 있게 합니다. 여러 샘플링 속도와 데이터 유형을 동기화해야 하므로 사용이 제한적입니다. 후기 융합은 각 모달리티를 독립적인 모델을 사용해 처리한 후 최종 평가를 위해 결과를 결합합니다. 이 기법은 한 모달리티의 데이터가 누락된 경우에도 유연하고 효과적입니다. 더 나아가, 중간 융합은 중간 단계에서 모달리티를 통합하며, 종종 교차 주의 기법을 사용해 의존성을 감지합니다. 이 방법은 특히 임상 맥락에서 유용했으며, 언어 참조와 음향 데이터를 결합하여 결과를 개선했습니다. 요약하자면, 교차주의를 통한 중간 융합은 단일 모달리티에 기반한 방법보다 자동 구음장애 평가 결과가 더 우수하다36,37.
구음장애 모델 훈련 및 평가를 위한 모범 사례:
구음장애 평가 및 인식을 위한 강질 모델 개발은 데이터셋 분할, 지표 평가, 해석 가능성에 대한 세심한 주의가 필요합니다. 최근 연구들은 데이터 부족, 변동성, 임상적 관련성 등 구음장애 발음의 독특한 문제를 해결하기 위한 표준화된 접근법과 혁신적인 해결책을 강조했습니다38,39.
데이터셋 분할 전략
훈련, 검증, 테스트 데이터셋이 화자 정보를 교환하지 않아 데이터 유출과 과적합을 방지하기 위해, 계층화된 그룹 K-폴드 교차 검증이 현재 일반적으로 사용됩니다38,39. 이 접근법은 제한된 데이터셋이나 다양한 데이터셋을 다룰 때도 균형 잡힌 분포와 신뢰할 수 있는 성능 평가를 유지할 수 있게 합니다. 스피커별 분할이 편향 방지에 필수적이므로, 일반적인 분할은 75:25 또는 85:15의 트레인/테스트 비율과 검증40을 위한 추가 분할로 구성됩니다. 제한된 구음 데이터를 처리하기 위해 합성 데이터 생성, 템포 교란, 건강한 음성 전달 학습과 같은 인기 있는 데이터 증강 기법이 적용된다41,42.
평가 지표
모델 해석 가능성 고려사항
따라서 철저한 디어르트리아 모델 파이프라인에는 층별로 분리된 화자 독립적 데이터 분할, 다면적 평가(PER, 명료성, 임상 입력), 그리고 주의 메커니즘을 통한 해석 가능성이 포함됩니다. 이러한 접근법은 구음장애 평가 및 인식을 위한 모델 시스템이 견고하고 임상적으로 적합하며 투명함을 보장합니다.
대표성 결과
여러 연구에서 다중 모달 특징을 사용할 때 음소 경계 정밀도가 향상되었다고 보고했습니다. 억음장애 발음은 종종 발음 전환이 흐려지거나 길게 이어져 음소 간 정확한 경계를 파악하기 어렵습니다. 음향, 조음, 시각적 특징을 결합한 출판된 모델들은 단일 양식 시스템보다 참조 주석과 더 잘 일치하는 모습을 보였습니다. 이러한 개선은 종종 정렬 곡선을 통해 시각화되며, 멀티모달 모델은 특히 자음-모음 전환 시 타이밍 오차가 줄어드는 것을보여줍니다. 문헌 보고서는 음소 분류 정확도의 향상도 설명합니다. 다중 양식 구조는 특히 마찰음과 모음에서 자주 왜곡되는 치환 및 결실 오류를 줄이는 것으로 나타났습니다. 이전 연구에서 보고된 혼동 행렬에 따르면, 시각적 정보와 조음 정보를 결합하면 모델이 유사한 음소를 더 신뢰성 있게 구별하는 데 도움이 된다. 음소 경계 정밀도의 향상이 대표적인 예입니다. 디어르시스 발화의 조음 전환과 변화는 종종 길게 늘어지거나 흐릿하게 나타나, 한 음소가 어디서 끝나고 다른 음소가 시작되는지 해석하기 어렵습니다. 음소의 시작과 오프셋을 보다 정확히 식별하기 위해, 멀티모달 시스템은 시각적 입술 움직임, 조음 궤적, 청각에서 얻은 공유 데이터를 활용합니다. 유니모달 음향 모델에서 생성된 것과 비교할 때, 시각화된 예측된 음소 경계는 실제 주석과 더 가깝게 일치합니다. 정렬 곡선을 사용해 이러한 개선을 시각화하는데, 멀티모달 모델은 특히 모음과 자음(VC 및 CV) 간 전환에서 타이밍 오류가 적음을 보여줍니다. 임상 환경에서는 분할 지도가 개선되어, 언어치료사와 임상의가 입술 원형 부족이나 턱 닫힘 지연 등 운동 조절의 특정 문제를 식별하는 데 도움을 줍니다47.
또한, 모델은 가장 가능성 높은 음성 음소 시퀀스를 식별하는 데 사용할 수 있는 차별 분류 출력을 생성할 수 있습니다. 멀티모달 시스템은 전통적인 및 기준 모델에 비해 음소 치환 및 삭제 오류가 감소하는 모습을 보입니다. 예를 들어, 입술의 시각적 형태와 조음기 위치 단서의 도입은 좌음장애에서 자주 왜곡되고 방향 감각이 흐트러지는 /s/, /ʃ/와 같은 마찰음의 분류 정확도를 향상시킵니다. 혼동 행렬은 이러한 개선을 보여주는 데도 사용될 수 있으며, 음소 구별과 분기가 개선되면 범주 간 혼동이 감소하는 것으로 나타난다48.
모델 지원 교정 전후의 음성 명료도 측정은 임상 관련성 차트를 사용하여 비교할 수 있습니다. 음절의 안정성과 타이밍, 모음 공간 면적 추정, 자음의 정밀도 평가, 전체 명료도 점수와 같은 지표를 이 차트에 포함할 수 있습니다. 일반적으로 이미 수정된 출력물은 운율, 리듬, 조음 경계가 개선되어 있습니다. 예를 들어, 교정 후 모음 공간의 표현이 보통 커지며, 이는 모음 음향 독특성이 향상되었음을 나타내며, 이는 많은 디어르트리아 치료에서 중요한 치료 목표입니다39.
중요한 점은, 이러한 모델 결과물은 임상의의 판단을 대체하는 것이 아니라 향상시키기 위해 임상 의사결정을 지원하는 것을 목표로 한다는 것입니다. 이 시스템은 예상되거나 이론적으로 가정된 패턴에서 크게 벗어난 특정 음소나 조음 전환을 강조할 수 있습니다. 이 정보를 통해 치료사는 다음과 같은 치료 목표를 조정할 수 있습니다: (a) 치경 자음의 혀 상승 일관성 향상(예: /t/, /d/), (b) 둥근 모음의 입술 돌출에 집중하기(예: /u/), (c) 유성 파열음의 발음 시기 개선.
출판된 연구들은 이러한 결과물이 임상 해석을 보완해야 하며, 의사의 판단을 대체해서는 안 된다고 강조합니다. 주의 지도나 음소 정렬 플롯과 같은 모델 시각화는 혀 상승 부족, 입술 둥글음 감소, 발음 지연 등 특정 조음 문제를 파악하는 데 도움을 줄 수 있습니다. 전반적으로 여러 연구의 데이터는 다중 모드 딥러닝 아키텍처가 기술 성과 지표를 향상시키는 동시에 치료 계획과 재활 진행 상황 추적에 도움이 되는 해석 가능한 결과물을 제공한다는 것을 보여줍니다.
임상 통합 및 재활 워크플로우
디지털 기술과 첨단 음성 모델의 도입은 구음장애 재활에서 환자 결과, 치료 제공, 임상 실무를 변화시키고 있습니다. 이 섹션은 피드백 중심 조음 훈련의 틀, 언어치료사 및 환자 모니터링의 진화하는 역할, 모델 결과물의 치료 도구에 통합되는 과정, 그리고 중요한 사용성 문제를 다룹니다.
이러한 모델 출력이 언어 치료 도구에 어떻게 반영되나요?
현대 AI 및 딥러닝 모델(ASR 및 심각도 분류기를 포함)은 음성 명료도, 조음 오류, 심각도 수준에 대한 상세하고 객관적인 데이터를 생성할 수 있습니다. 이러한 결과물은 오늘날 점점 더 디지털 치료 플랫폼과 모바일 애플리케이션에 통합되어 환자와 치료사에게 실시간 맞춤형 피드백을 제공합니다49. 예를 들어, 태블릿 기반 애플리케이션과 클라우드 기반 원격 모니터링 시스템은 모델 생성 지표를 사용해 진행 상황을 시각화하고, 특정 조음 결손을 강조하며, 운동 난이도를 조정합니다. 이 시스템들은 치료 진행 상황을 객관적으로 추적하고, 개인화된 운동 선택을 가능하게 하며, 디지털 플랫폼 50,51,52를 통한 원격 모니터링을 지원합니다.
피드백 기반 조음 훈련 모듈
피드백 기반 교육 모듈은 디지털 구음장애 재활의 핵심입니다. 이전 연구들은 디지털 재활 모듈에 종종 바이오피드백, 자동 오류 감지, 적응형 운동 설계를 포함한다고 보고했습니다. 언어 치료에서 바이오피드백은 파형 표시나 조음기 움직임의 시각화와 같은 시각 및 청각 신호를 활용하여 환자에게 실시간 지침을 제공합니다. 또한, 음운 또는 조음 오류를 식별하는 AI 모델을 통해 자동 오류 감지가 이루어져 즉각적인 교정 피드백을 제공하여 학습을 향상시킵니다. 훈련 과정은 계층적이고 적응적이어서, 더 단순한 작업에서 더 복잡한 작업으로 진행되며, 특히 음성 소리, 음절 또는 단어를 집중적으로 다룹니다. 이 연습들은 환자의 수행 상태에 따라 동적으로 조정되어 개인화된 학습 경험을 보장합니다. 더 나아가, 일부 플랫폼에 게임화 요소와 가상현실(VR)을 도입하면 환자의 동기 부여와 순응도를 높여 치료 과정을 더욱 흥미롭게 만듭니다. 따라서 이 모듈들은 집중적이고 반복적인 연습을 지원하며, 이는 운동 학습과 언어 개선의 핵심이며, 독립적이거나 치료사 지도 하는 사용도 가능하게 합니다 51,53,54.
언어치료사의 역할과 환자 모니터링
언어치료사(SLT)는 지난 10년간 디지털 도구가 보편화되었음에도 불구하고 재활 과정의 중심으로 남아 있습니다. 평가 및 목표 설정은 모델 결과를 해석하여 적절한 치료 목표를 선택하고, 개별 환자의 필요에 맞춘 차별적 치료 계획을 맞춤화하는 것을 포함합니다. 감독과 피드백은 환자 진행 상황을 모니터링하는 데 필수적입니다; 전문가들은 언어 교정에 대한 피드백을 제공하며, 필요에 따라 치료 조정을 합니다. 또한 환자 교육과 지원이 강조되어 재활 과정에서 디지털 도구를 효과적으로 활용하는 법을 가르칩니다. 다양한 분야의 전문가들이 협력하여 재활의 광범위한 요구를 해결하기 위해 다학제 협력이 매우 중요하며, 환자 치료에 대한 포괄적인 접근을 보장합니다. 환자 모니터링은 디지털 플랫폼을 통해 강화되어, 치료사와 임상의가 원격으로 환자의 순응, 회복, 수행 및 결과를 추적할 수 있어 적시한 개입과 지속적인 지원을 가능하게 합니다51,52.
사용성 고려사항: 환자의 편안함과 반복성
디지털 재활 기술이 성공적으로 구현되려면 사용성이 매우 중요하며, 다양한 환자 요구를 충족하는 사용자 친화적인 인터페이스에 중점을 둡니다. 유연한 치료 방법은 모바일 플랫폼 덕분에 편안함과 접근성을 향상시킵니다. 적응형 모듈과 자동 피드백 같은 중요한 기능은 일관되고 자율적인 참여를 장려하며, 이는 운동 학습에 필수적입니다. 파일럿 테스트에서는 높은 수용과 만족도를 보여주지만, 여전히 기술적인 문제가 있습니다. 환자와 치료사의 지속적인 피드백은 이러한 도구들을 실제 요구에 맞게 강화하는 데 도움을 줍니다. 의미 있는 치료 경험 개발에 중점을 두어, AI와 피드백 기반 훈련을 언어 치료에서 활용하여 디어르트리아 재활의 효능, 접근성, 개인화 를 향상시키고 있습니다. 48,51,52,53,54.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
본 리뷰는 난조증에서 음소 라벨링 및 음성 복원에 다중 모드 딥러닝 아키텍처의 점점 더 많은 적용을 설명한다. 이 아키텍처들은 음향 조음과 시각적 분석을 결합하여 낮은 명료성과 비표준 조음 구성이 특징인 병리적 발음에서 오디오 기반 음성 인식의 한계를 극복한다. 전자기 조음술, 초음파 혀 영상, 얼굴 랜드마킹은 보다 전체론적인 모델이다. 전자기 조음술, 초음파 혀 영상, 얼굴 랜드마킹은 보다 전체론적인 모델이다. 음향 세부사항과 운동 명령을 무질서한 음성 내에서 포착할 수 있게 해줄 수 있는 음성 생성. 이 기법들은 음소 경계 식별, 시퀀스 안정성, 그리고 열화된 모달리티에 대한 저항성을 향상시킬 것으로 기대된다. 트랜스포머 모델의 시간 합성곱 정제'와 다중 모달 융합 전략을 이용한 주의 기반 맥락 인코딩을 구현하면 향상된 음성 평가 도구 개발과 치료 모니터링 효과가 향상될 수 있다 진전. 임상적으로 다중 모달 모델은 말 생성 및 재활 결과에 대한 객관적이고 해석 가능...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 충돌이 없음을 선언한다.
저자들은 난징 중의학대학교 부속병원인 중의학대학이 필요한 펠로우십과 자금을 제공해 준 것에 감사를 표합니다(장쑤성 대학원 과학 연구 및 혁신 프로그램KYCX25_2282).
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청