Обзорная статья

Мультимодальная архитектура для неточности маркировки фонем в дизартрической речи: интеграция трансформаторов и ТКН для клинической реабилитации

DOI:

10.3791/70447

26 мая 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом обзоре рассматривается, как мультимодальные архитектуры, сочетающие слуховую, артикуляционную и визуальную информацию, а также трансформерные и ТКН-модели, могут улучшить идентификацию фонем в дизартрической речи. Это подчёркивает их потенциал для улучшения оценки понятности речи и персонализированной терапии за пределами возможностей типичных систем ASR.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Из-за проблем с артикуляцией и изменчивости фонем речевые расстройства, такие как дизартрия, представляют значительные трудности в клинической реабилитации. Традиционные системы автоматического распознавания речи (ASR), которые обычно обучаются на нормативных наборах данных, часто не способны точно декодировать дизартическую речь. Недавние прорывы в области искусственного интеллекта и глубокого обучения позволили интегрировать мультимодальные архитектуры, такие как объединение слуховой, артикуляционной и визуальной информации для записи сложных речевых паттернов, что делает это всё более возможным. В этом обзоре мы исследовали слияние трансформаторов и временных сверточных сетей (ТКН) в мультимодальных рамках для устранения неточности маркировки фонем в дизартической речи. Здесь мы обсуждаем, как контекстное моделирование на основе трансформеров и временная точность, управляемая TCN, могут улучшить обнаружение границ фонем, классификацию и обратную связь при реабилитации. В обзоре также обсуждается потенциал таких гибридных систем в индивидуализированной логопедии, вопросы интерпретируемости и клинических применений. Мультимодальные архитектуры — это трансляционный подход к улучшению терапевтического мониторинга, коммуникационных средств и оценки понятности речи для людей с моторными расстройствами речи, объединяя клиническую медицину и медицинскую информатику.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Нарушения нервной системы часто приводят к резким и резким последствиям для здоровья, включая нарушения опорно-двигательного аппарата, нейроваскулярные расстройства и другие, например, нейрогенные нарушения коммуникации. Нейрогенные коммуникативные расстройства включают такие расстройства, как дизартрия и апраксия, которые можно определить как невнятную речь из-за мышечной слабости и затруднений с планированием речевых движений соответственно. 1. Речь состоит из пяти подсистем: дыхания, фонации, резонанса, артикуляции и просодии, которые должны работать синергетически и бесшовно для эффективногообщения. 2. Дизартрия, вызванная дисфункцией в этих подсистемах, снижает слышимость, естественность, понятность и эффективность коммуникации, что, в свою очередь, существенно влияет на жизнь пациентов и их семей. Дизартрия может быть вызвана различными неврологическими заболеваниями и сопутствующими патологиями, включая нарушения коры головного мозга, базальных ганглияв, мозжечка, базальных ядер, черепных нервов или периферических нервов. Другие факторы включают первичные моторные проблемы языка, гортании горла 3.

Дизартрия — это обобщённый термин для обозначения моторных речевых нарушений, вызванных изменением нервно-мышечного контроля, влияющим на дыхание, фонацию, резонанс, производство речи, вокализацию и ритм. Таким образом, дизартрия — это расстройство речи, которое часто ассоциируется с нервно-мышечными нарушениями и травмами, когда мышцы, используемые для речи, либо слабы, либо замедлены, либо парализованы. Специфические типы мышц, вовлечённых в речь, включают мышцы языка, горла, лица, губ, голосовых связок, челюстей и мышц верхних дыхательных путей. Повреждения этих мышц могут принимать различные формы, включая повреждения моторных нейронов, которые их иннервируют, или их сосудистых систем, лишая их кислорода. Типичные неврологические повреждения, нарушающие речевой проводимость, включают повреждение верхних моторных нейронов, что может привести к скованности или спастичности речевых мышц, повреждения нижних моторных нейронов, которые могут привести к слабости мышц или параличу в результате прерванных нервных сигналов, травмы мозжечка, часто приводящие к потере координации между мышцами (атаксия), или базальное ганглиозное повреждение, нарушающее координированные движения и приводящее к непроизвольным движениям (гиперкинетическим) или жёсткость мышц (гипокинетические движения)5.

Дизартрия — распространённый симптом различных неврологических расстройств и часто связана с прогрессирующими неврологическими заболеваниями. Это существенно влияет на пациента и его семьи, поскольку коммуникация играет ключевую роль в выражении личности и поддержании социальных связей. Расстройство характеризуется снижением разборчивости речи. Содержание устного языка сохраняется неизменным, что позволяет пациенту писать и интерпретировать как устный, так и письменный язык; С другой стороны, анартрия — самый тяжёлый тип, приводящий к полной потере моторнойречи 6. Существует шесть основных классификаций дизартрии: вялый дизартрия, которая связана с дисфункцией нижних моторных нейронов; спастическая дизартрия, возникающая при повреждении верхних моторных нейронов, связанных с моторными областями коры головного мозга; атаксическая дизартрия, главным образом вызванная проблемами мозжечка; а также гиперкинетическая дизартрия и гипокинетическая дизартрия, обе связанные с нарушениями экстрапирамидной системы. Шестой тип обычно называют смешанной дизартрией и часто связан с повреждением нескольких областей, что приводит к характеристикам речи, которые проявляют признаки как минимум двух категорий. Нарушения речи, связанные с этими шестью основными типами дизартрии, уникальны и могут помочь в диагностике и лечениидизартрии 5,6.

Этиологические факторы, способствующие трудностям с артикуляцией, включают инфекции (такие как болезнь Кройцфельдта–Якоба и синдром приобретенного иммунодефицита), сосудистые проблемы (как ишемические, так и геморрагические инсульты), опухоли (опухоли мозга), демиелинизирующие заболевания (включая рассеянный склероз и синдром Гийена–Барре), дегенеративные заболевания (такие как болезнь Паркинсона и болезнь Хантингтона), травмы (травматические повреждения мозга и церебральный паралич), токсическое воздействие (тяжёлые металлы, алкоголь и наркотики), а также генетические заболевания (например, SANDO)7. Кроме того, неневрологические факторы, такие как расщелина губы или нёба, также могут вызывать проблемы с артикуляцией, но они не относятся к категориидизартрии 8.

Важность дизартрии в клинических условиях заключается в её значительном влиянии на качество жизни людей. Поскольку коммуникация необходима для социальной, образовательной и профессиональной активности, те, кто страдает от неё, часто сталкиваются с чувством изоляции и ухудшённогоблагополучия 6. Точная диагностика различных типов дизартрии, таких как вялая, спастика, атаксическая, гиперкинетичная, гипокинетическая и смешанная, крайне важна для выявления основных неврологических проблем и оценки подходов к реабилитации. Логопеды и клиницисты часто полагаются на анализ характеристик и тяжести дизартрии для адаптации терапии, установления достижимых целей коммуникации и оценки необходимости дополнительных и альтернативных методовкоммуникации 9. Для людей с нарушениями речи системы автоматического распознавания речи (ASR) улучшили доступность и социальное взаимодействие. Тем не менее, недостаток акустических моделей препятствовал более широкому успеху ASR в работе с нарушением речи. Таким образом, в данной статье рассматриваются проблемы фонем в дизартической речи, существующие системы ASR и их пределы, творческие мультимодальные техники, контекстное моделирование на основе трансформаторов и TCN для временной и последовательной доработки.

Несмотря на значительный прогресс в технологии ASR, лучшие системы ASR всё ещё имеют множество недостатков для людей с нарушениями речи. Эти недостатки частично могут быть связаны с трудностями в получении разнообразного и репрезентативного набора данных по обучению неупорядоченной речи. Одна из проблем, связанных с расстроенной речевой ASR, вероятно, связана с широким спектром аномальных речевых характеристик, варьирующихся у разных людей, и с недостаточным представлением этих вариаций в обучающих наборахданных 10. Несмотря на это, исследования ASR, связанного с дизартрией, часто упускают из виду это разнообразие.

Системы ASR делятся на три категории: независимые от динамика (SI), зависящие от динамика (SD) и адаптивные к динамику (SA). Системы SI хорошо работают с здоровыми носителями, но испытывают трудности с ухудшением речи и лучше работают при обучающих данных с дизартичными носителями. В отличие от этого, системы SD ориентированы на отдельных пользователей, достигая отличной точности, тогда как системы SA со временем адаптируются к речи пользователя и превосходят обе модели SI и SD. Однако и системы SA, и SD требуют обучающих данных, что создаёт ещё одно препятствие для людей с нейродегенеративнымирасстройствами 11. Несмотря на значительный прогресс, существующие модели ASR по-прежнему неподходят для динамиков с инвалидностью из-за отсутствия различных обучающих наборов данных. Для заполнения этого пробела необходимо разработать тщательные методологии сбора данных, охватывающие различные аспекты дизартрии, что улучшает эффективность ASR для труднораспознаваемых носителей.

Для преодоления этих ограничений мультимодальные стратегии, сочетающие акустические, артикуляционные и визуальные сигналы, могут эффективно представлять производство речи и уточнение симптомов дизартрии комплексно. Например, данные о артикуляционных движениях, таких как визуализация языка, получаются с помощью ультрасонографии и электромагнитной артикулятории. Эти данные часто сочетаются с визуальными движениями губ и могут компенсировать нарушенную акустическую информацию, улучшая способность различать и различатьфонемы 12. Эта избыточность, обнаруженная в мультимодальных системах, соответствует клиническим методам оценки, усиливая возможности терапевтов наблюдать орофациальные движения наряду с слуховой речью. Напротив, фреймворки глубокого обучения, особенно трансформаторы и TCN, предлагают лучшее моделирование временных зависимостей и изменений в речевых последовательностях. Эти модели функционируют за счёт того, что трансформаторы фиксируют общие контекстуальные связи, обеспечивая идентификацию фонем даже при уменьшении, затуманении или уменьшенииакустических сигналов 13. ТКН вносят дополнительный вклад, обеспечивая стабильные рецептивные поля и временное сглаживание, что повышает точность обнаружения границ фонем. При интеграции в мультимодальные рамки слияния оба этих подхода значительно повышают точность маркировки фонем в дизартической речи и способствуют более точной, ориентированной на обратную связь клиническую реабилитацию. Таким образом, эти мультимодальные архитектуры глубокого обучения напрямую согласованы с клиническими целями в реальном времени, такими как повышение оценки понятности речи, мониторинг реабилитационного процесса и предоставление технологически поддерживаемых терапий, адаптированных к специфическим профилям нарушения моторной речи улюдей 14 лет.

Хотя эти мультимодальные архитектуры глубокого обучения обладают большим потенциалом для устранения неточности маркировки фонем, их эффективный перенос от экспериментальных фреймворков к надёжным диагностическим инструментам требует единообразной операционной структуры. Для решения этой проблемы следующее исследование описывает комплексный вычислительный рабочий процесс, включающий мультимодальный сбор данных, извлечение признаков и обучение моделей. Цель — обеспечить воспроизводимость и проверку этих сложных систем в широком спектре клинических ситуаций. Создание такой прозрачной методологической линии крайне важно для логопедов и клинических инженеров, чтобы валидировать алгоритмы в широком спектре характеристик и уровней нарушений пациентов. Наконец, эта систематическая методология служит предшественником клинической реализации, позволяя интегрировать передовые модели речи в регуляторные оценки, электронные системы здравоохранения и долгосрочные платформы мониторинга лечения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обзор и перспектива

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Обзор мультимодального сбора данных в дизартрической речи

Мультимодальный сбор данных необходим для тщательного изучения логопедического контроля и разработки эффективных методов диагностики и реабилитации, учитывая сложность и разнообразие симптомов дизартрии.

Акустическая запись

Акустический канал остаётся центральным. Записи лучше всего проводить в акустически обработанной среде для снижения реверберации и окружающего шума. Типичные микрофоны — это высококачественные конденсаторные микрофоны, которые либо устанавливаются на голову, либо настольные устройства, равномерно расположенные для контроля уровня сигнала и предотвращения вариаций между сессиями. Частоты дискретизации 16 кГц или 44,1 кГц очень распространены, при этом 16 кГц достаточно для разборчивости и анализа просодии, тогда как 44,1 кГц обеспечивает большую точность, что полезно для тонких акустических и фонаторных исследований. Многоканальные аудиоинтерфейсы позволяют синхронно захватывать несколько потоков и должны поддерживать стабильные настройки усиления и запаса высоты, чтобы избежать клиппинга или шума на полу. Для воспроизводимости важно установить калибровку и документировать усиление микрофона, уровень фонового шума и дрейфа. В дизартрических речевых корпусах качество звука особенно важно, поскольку дефекты акустического сигнала могут быть тонкими и легко скрыты плохими условиямизаписи 15.

Опциональные артикуляционные / трекинг губ / ЭМГ / ультразвуковые методы

Чтобы выйти за рамки акустической волны, часто требуются дополнительные методы для фиксации артикуляционной кинематики и физиологической активности мышц. Таким образом, отслеживание губ или захват движения лица позволяет количественно оценить отверстие губ/челюсти, движение, скорость и симметрию. Электромагнитная артикуляция (ЭМА) отслеживает датчики языка, челюсти и губ в трёх измерениях и обеспечивает временное/позиционное разрешение артикуляторов, в то время как поверхностная электромиография (sEMG) фиксирует мышечную активность для изучения дефицитов нейромышечной активации, лежащих в основе дизартрии. Ультразвуковая визуализация языка (ИМП) обеспечивает изображение поверхности языка в реальном времени во время артикуляции, что полезно для пациентов, которые не переносят ЭМА. Мультимодальные системы показывают, что идентификация речево-моторных дефицитов улучшается с помощью параллельной акустики, дополненной артикуляционной/визуальнойзаписью 16.

Этические соображения и согласие пациентов

Работа с носителями дизартрии часто затрагивает уязвимые группы населения. Исследователи должны получить одобрение институционального экспертного совета (IRB) или этического комитета, а также обеспечить информированное согласие, которое объясняет способы записи (аудио, видео, физиологические сенсоры), хранение, анонимизацию, будущее использование и права на снятие. Формы согласия должны чётко касаться видеосъемки (отслеживание губ и лица) и, по желанию, чувствительных методов, таких как ЭМГ. Конфиденциальность данных необходимо контролировать, особенно когда хранятся видео или изображения лица. Необходимо оценить уровень комфорта, усталость, ограничения в движении и потенциальный риск участника. Занятия должны включать периоды отдыха, а участникам следует предупреждать, что они могут остановиться в любой момент без последствий. Дефицит и разнообразие участников исследований дизартрических речевых корпусов дополнительно подчеркивают важность этическойстрогости 17.

Этапы предварительной обработки данных (сегментация, снижение шума, нормализация)

Система MAV-HuBERT выравнивает акустические и визуальные данные временно на уровне кадра, извлекая 26-мерные энергии логарифм-фильтра из исходной формы сигнала и синхронизируя их с визуальными кадрами 25 Гц, собранными с помощью идентификации лиц на основе Dlib. Последовательные аудиокадры обычно комбинируются для стабилизации краткосрочных флуктуаций, а сросшиеся визуальные области пространственно нормализуются перед мультимодальным слиянием признаков. Эти предварительные процессы обеспечивают непрерывную временную согласованность и снижают вариативность между аудио- и визуальными модальностями, что приводит к более высокой точности идентификации на последующихэтапах 15,18.

Инженерия функций и вычислительные рабочие процессы

Мультимодальные модели глубокого обучения требуют синхронизированных представлений акустических, артикуляционных и визуальных данных для точного обозначения фонем в дизартрической речи. В этом разделе представлен обзор техник представления признаков, используемых в мультимодальном анализе речи, а затем пошаговый вычислительный рабочий процесс для извлечения и выравнивания этих признаков перед обучением модели.

Выделение и представление признаков

В мультимодальном анализе речи необработанные аудио- и сигналы движения должны быть преобразованы в значимые представления, которые могут быть обработаны моделями глубокого обучения. Одним из наиболее широко используемых представлений является спектрограмма, которая показывает, как энергия сигнала меняется со временем и между частотами. Представления на основе спектрограмм полезны для фиксации таких характеристик, как замыканье, дыхание и нерегулярное синхронизирование, которые часто наблюдаются при дизартрическойречи 19.

Ещё одной распространённой особенностью являются коэффициенты Mel-Frequency Cepstral Coefficients (MFCC), которые отражают спектральные свойства речи так, чтобы приближаться к человеческому слуховому восприятию. Функции MFCC широко используются в распознавании речи, поскольку обеспечивают компактные, устойчивые к шуму представления, которые остаются стабильными даже при искаженииречи 20. Помимо акустических особенностей, мультимодальные подходы включают артикуляционную информацию, такую как траектории движения языка, губ и челюсти. Эти сигналы можно получить с помощью электромагнитной артикуляции (ЭМА), ультразвуковой визуализации языка (ИМП) или оптического отслеживания движения. Артикуляционные особенности дают прямую информацию о рековом моторном контроле и помогают компенсировать ухудшённые акустическиесигналы 21.

Визуальная информация также полезна для анализа дизартрической речи. Ориентиры лица, извлеченные из видеозаписей, включая контур губ, смещение челюсти и открытие рта, дают дополнительные сигналы о артикуляции. Эти визуальные особенности улучшают различение фонем, особенно когда акустический сигнал неясен. Для обучения под надзором все потоки признаков должны быть согласованы с транскрипциями на уровне фонем, чтобы каждый временной промежуток соответствовал правильной речевой единице. Точное выравнивание крайне важно для обучения моделей маркировки фонем, особенно в дизартической речи, где границы фонем часто размыты22.

Вычислительный рабочий процесс

В этом разделе показано, что для воспроизведения мультимодального процесса маркировки фонем требуется каждый шаг — от извлечения признаков до оценки модели (рисунок 1).

Выделение акустических признаков с помощью спектрограмм и MFCC

Во-первых, кратковременное преобразование Фурье (STFT) используется для преобразования исходного речового сигнала во временно-частотное представление. Для создания спектрограммы сигнал разбивается на короткие перекрывающиеся кадры, и каждый кадр подвергается преобразованию Фурье.
Мел-частотные цепстральные коэффициенты (MFCC) используются для извлечения перцептивно взвешенных акустических признаков из спектрограммы. Для распознавания речи и анализа дизартрии MFCC предлагают компактные и устойчивые к шумупредставления 23,24. Благодаря своей надёжности и эффективности MFCC широко используются в приложениях, связанных с распознаванием речи и говорящим. Таким образом, благодаря своей полезности, MFCC затем извлекаются для расчёта и приближения уровней слухового восприятия человека и предоставления сжатых, устойчивых к шуму акустических характеристик, далее25.

Приобретение артикуляционных траекторий

Данные артикуляционных движений получаются для фиксации физического движения речевых органов. Электромагнитная артикуляция (ЭМА) использует датчики, прикреплённые к языку, губам и челюсти, для отслеживания артикуляционных движений в трёх измерениях. Альтернативно, для неинвазивной оценки движения языка можно использовать ультразвуковое изображение языка (ИМП). Записанные траектории фильтруются, нормализуются и понижаются для соответствия частоте кадров акустических признаков для обеспечения временнойсогласованности 26. Преобразование речи в последовательности ультразвуковой визуализации языка (ИМП) — это метод оценки траекторий ультразвукового языка на основе речевых данных путём сопоставления слуховых характеристик с физиологическими движениями языка. Эта методология предоставляет неинвазивную альтернативу методам прямого артикуляторного сбора данных, необходимых для мониторинга и лечения аномалий речи и голосового тракта, при этом избегая необходимости в специальном оборудовании и клиническом опыте, присущих прямым методамизмерения 27,28. В зависимости от наличия артикуляционных признаков, таких как траектории движения языка, губ и челюстей, которые фиксируются с помощью ЭМА или ультрасонографии (ИМП), сигналы фильтруются и понижаются для соответствия частоте акустических кадров.

Обнаружение визуальных ориентиров

Для ввода речи и видео входные клавиши лица (уголки губ, движение линий челюсти) необходимо извлекать с помощью таких инструментов, как Mediapipe или OpenFace, после чего они нормализуются, чтобы убрать эффекты позы головы. MediaPipe использует систему глубокого обучения для оценки поз лица и тела, предоставляя 33 ориентира для общего распознавания позы, из которых 11 специально для лица. Его эффективность может различаться, особенно в случаях окклюзии. Модель MediaPipe FaceMesh повышает надёжность, используя 468 3D-ориентиров лица вместе с геометрическим методом оценки положенияголовы 29. OpenFace 2.0 функционирует как набор инструментов для анализа поведения лица, позволяя обнаруживать ориентиры, оценивать позу головы, отслеживать взгляд и распознавать единицы действий лица. Он поддерживает интеграцию с различными языками программирования и может обрабатывать живые видеопотоки или статичные изображения. Выходы, такие как ориентиры лица и векторы взгляда, могут экспортироваться в формате CSV. OpenFace 2.0 использует локальную модель Convolutional Experts Constrained Local Model (CE-CLM), которая включает модель распределения точек для учёта вариаций форм ориентиров и экспертов по патчам для различий в локальных видах29,30.

Выравнивания транскрипции фонем

Следующий шаг — временное согласование всех представленных потоков (акустических, артикуляционных и визуальных) с аннотациями на уровне фонем с помощью инструментов принудительного выравнивания, таких как Montreal Forced Aligner (MFA), обеспечивая синхронизированные мультимодальные входы для обучения вычислительной модели. Принудительное выравнивание (FA) — это метод выравнивания транскриптов с аудиосигналами для определения временных границ речевых единиц. Это обеспечивает более точную обработку аудио и продвигает лингвистическое изучение. Он всё чаще применяется в фонетических исследованиях и доказал свою эффективность значительно быстрее, чем ручное выравнивание. Хотя FA обычно ассоциируется с системами автоматического распознавания речи (ASR), это более широкая задача в области автоматической обработки речи, включающая анализ устной речи итранскрипцию 22. Монреальский принудительный элайнер (MFA) — это ведущий набор инструментов FA, использующий алгоритмы HMM-GMM для достижения эффективного выравнивания. Несмотря на достижения в технологиях ASR, традиционные подходы, такие как HMM-GMM, по-прежнему популярны для задач FA. MFA использует характеристики MFCC и четырёхступенчатый метод обучения для создания акустических моделей с точным фонетическимвыравниванием 31.

Компоненты архитектуры моделей

Мультимодальные модели глубокого обучения для распознавания дизартрической речи состоят из нескольких ключевых компонентов, которые совместно захватывают контекстную, временную и мультимодальную информацию. Основные компоненты включают контекстный кодировщик, модуль временной уточнения и мультимодальный механизм слияния. Каждый компонент играет определённую роль в повышении точности маркировки фонем при неупорядоченной речи.

Контекстный кодировщик на основе трансформатора

Трансформаторный кодировщик используется для моделирования дальнодействующих зависимостей в последовательностях речи. Дизартрическая речь часто сопровождается нерегулярным временем и неясными границами фонем, что затрудняет традиционные модели захват контекстуальной информации. Трансформаторы используют многоголовое самовнимание для анализа взаимосвязей между разными временными периодами в последовательности входа. Это позволяет модели учитывать как прошлые, так и будущие речевые кадры при предсказании фонем. В результате энкодер лучше справляется с вариациями артикуляции и произношения, характерными для дизартрии. В мультимодальной архитектуре трансформатор получает синхронизированные акустические, артикуляционные и визуальные особенности и создаёт контекстно-ориентированные представления, которые передаются на следующий этап модели32,33.

Уточнение временной последовательности на основе TCN

После контекстного кодирования последовательность признаков обрабатывается временной сверточной сетью (TCN) для повышения временной точности. Дизартическая речь часто содержит нестабильное время, паузы и удлинённые фонемы, которые требуют дополнительной доработки за пределами контекстного моделирования. TCN используют расширенные причинные свёртки для захвата длительных временных зависимостей при сохранении вычислительной эффективности. Такая структура позволяет модели сглаживать шумные прогнозы и поддерживать согласованные границы фонем на протяжении времени. В архитектуре TCN получает выход кодировщика трансформатора и уточняет последовательность для получения стабильных и временно согласованных представленийпризнаков 33,34,35.

Стратегия мультимодального синтеза

Для повышения точности диагностики при диагностике дизартрии мультимодальное слияние включает информацию из множества источников, таких как голос, текст, видео и физиологические сенсоры. Основные методы состоят из трёх отдельных этапов: раннее слияние, позднее слияние и промежуточноеслияние 36. Раннее слияние объединяет данные из множества модальностей на фундаментальном уровне, позволяя моделям понимать сложные взаимосвязи с самого начала. Его использование ограничено, поскольку требует синхронизации нескольких частот дискретизации и типов данных. Позднее слияние обрабатывает каждую модальность с использованием независимых моделей перед объединением результатов для окончательных оценок. Эта техника гибка и эффективна, когда отсутствуют данные из одной модальности. Кроме того, промежуточное слияние интегрирует модальности на среднем уровне, часто используя методы перекрёстного внимания для выявления зависимостей. Этот метод оказался особенно полезен в клинических контекстах, улучшая результаты за счёт сочетания языковых ссылок с акустическими данными. В итоге, промежуточное слияние с перекрёстным вниманием даёт лучшие результаты в автоматической диагностике дизартрии, чем методы, основанные на одноймодальности 36,37.

Лучшие практики обучения и оценки моделей дизартрии:

Разработка жилистых моделей для оценки и распознавания дизартрии требует тщательного внимания к разделению набора данных, оценке метрик и интерпретируемости. Недавние исследования выделили стандартизированные подходы и инновационные решения для решения уникальных проблем дизартрической речи, включая дефицит данных, вариабельность и клиническую значимость38,39.

Стратегии разделения наборов данных

Чтобы гарантировать, что обучающие, валидационные и тестовые наборы данных не обмениваются информацией о динамиках, предотвращая утечку и перенасадку, теперь широко используется кросс-валидация групповойK-Fold 38,39. Такой подход позволяет моделям сохранять сбалансированные распределения и надёжную оценку производительности, даже при работе с ограниченными или разнообразными наборами данных. Поскольку разбиение по динамику важно для предотвращения смещения, распространённые разделения состоят из соотношений train/test 75:25 или 85:15, а также дополнительного деления для валидации40. Для обработки ограниченных дизартрических данных применяются популярные методы увеличения данных, такие как синтетическая генерация, нарушение темпа и трансферное обучение на основе здоровойречи 41,42.

Метрики оценки

Вопросы интерпретируемости модели

  1. Карты внимания и кривые выравнивания: Модели, основанные на внимании, дают визуальные представления, подчёркивающие сегменты речи или фонемы, которые модель приоритизирует, способствуя клинической интерпретации и формированию доверия43.
  2. Анализ фонем/признаков: Распознавание важных фонем или акустических характеристик, связанных с тяжестью дизартрии, способствует как прозрачности модели, так и клиническомупониманию 44.
  3. Гибридные подходы: Объединение понятности на основе ASR с традиционными акустическими особенностями может дополнительно улучшитьинтерпретируемость 45.

Таким образом, комплексный конвейер модели дизартрии включает стратифицированные, независимые от спикера разделение данных, многогранную оценку (PER, понятность, клинический вход) и интерпретируемость через механизмы внимания. Эти подходы обеспечивают надёжность, клиническую релевантность и прозрачность модельных систем для оценки и распознавания дизартрии.

Репрезентативные результаты

Несколько исследований сообщили об улучшении точности границ фонем при использовании мультимодальных признаков. Дизартрическая речь часто сопровождается размытыми или продолжительными артикуляционными переходами, что затрудняет точное определение границы между фонемами. Опубликованные модели, сочетающие акустические, артикуляционные и визуальные особенности, показали лучшее согласование с эталонными аннотациями, чем унимодальные системы. Эти улучшения часто визуализируются с помощью кривых выравнивания, где мультимодальные модели демонстрируют снижение временных ошибок, особенно при переходах согласных–гласных 46. В литературных отчётах также описываются улучшения точности классификации фонем. Мультимодальные архитектуры показали свою эффективность в снижении ошибок замещения и удаления, особенно для фрикативов и гласных, которые часто искажаются при дизартрии. Матрицы путаницы, описанные в предыдущих исследованиях, показывают, что сочетание визуальной и артикуляционной информации помогает модели более надежно различать похожие фонемы. Повышение точности границ фонем — один из ярких примеров. Артикуляционные переходы и изменения в дизартрической речи часто удлинены или размыты, что затрудняет интерпретацию, где заканчивается одна фонема и начинается другая. Для более точного определения начала и смещения фонем мультимодальная система использует общие данные из визуальных движений губ, артикуляционных траекторий и аудио. По сравнению с моделями, созданными унимодальными акустическими моделями, предсказанные границы фонем визуализировали более точно совпадают с истинными аннотациями. Для визуализации этих улучшений используются кривые выравнивания, при этом мультимодальная модель показывает меньше ошибок в тайминге, особенно при переходах между гласными и согласными (VC и CV). В клинической среде это может привести к улучшению карт сегментации, которые дополнительно помогают логопедам и клиницистам выявлять особые проблемы с моторным контролем, такие как недостаточное округление губ или задержка закрытиячелюсти 47.

Кроме того, модель может создавать выходы дифференциальной классификации, которые можно использовать для определения наиболее вероятной последовательности произнесённых фонем. Мультимодальная система демонстрирует снижение ошибок замещения и удаления фонем по сравнению с традиционными и базовыми моделями. Например, включение визуальной формы губ и сигналов положения артикулятора повышает точность классификации фрикативов, таких как /s/ и /ʃ/, которые часто встречаются искажёнными и дезориентированными при дизартрии. Матрицы путаницы также могут использоваться для демонстрации таких улучшений, где улучшенная дискриминация фонем и бифуркация характеризуются снижением межкатегорическойпутаницы 48.

Измерение понятности речи до и после коррекции, поддерживаемой моделью, можно сравнить с помощью клинической таблицы значимости. В эту таблицу можно включить такие метрики, как стабильность и синхронизация слогов, оценка площади пространства гласных, точность согласных и общий балл по понятности. В целом, уже скорректированный выход демонстрирует улучшенные границы просодии, ритма и артикуляции. Например, после коррекции представление гласного пространства обычно увеличивается, что указывает на повышенную акустическую отличительность гласных, что является важной терапевтической целью во многих методах лечениядизартрии 39.

Важно, что результаты этих моделей предназначены для поддержки клинического принятия решений, улучшая, а не заменяя суждения клинициста. Система может подчеркнуть конкретные фонемы или артикуляционные переходы, которые значительно отклоняются от предполагаемых или теоретически предполагаемых закономерностей. Используя эту информацию, терапевты могут адаптировать свои цели терапии так, чтобы включить: (a) улучшить консистенцию поднятия языка для альвеолярных согласных (например, /t/, /d/), (b) сосредоточиться на выступлении губы для округлых гласных (например, /u/), (c) улучшить время появления для звонких стоп-согласных.

Опубликованные работы подчёркивают, что эти результаты должны дополнять клиническую интерпретацию, а не заменять суждение врачей. Визуализации моделей, такие как карты внимания и графики выравнивания фонем, могут помочь терапевтам выявить конкретные артикуляционные проблемы, такие как недостаточное приподнятие языка, уменьшение округления губ или задержка начала голоса. В целом, данные нескольких исследований показывают, что мультимодальные архитектуры глубокого обучения повышают технические показатели эффективности, а также предоставляют интерпретируемые результаты, которые могут помочь в планировании терапии и отслеживании прогресса реабилитации.

Клиническая интеграция и процесс реабилитации

Внедрение цифровых технологий и передовых речевых моделей в реабилитации при дизартрии трансформирует результаты пациентов, проведение терапии и клинические практики. В этом разделе рассматриваются рамки обучения артикуляции, ориентированной на обратную связь, меняющиеся роли логопеда и мониторинга пациентов, интеграция результатов моделей в терапевтические инструменты и значительные вопросы удобства использования.

Как результаты этих моделей влияют на инструменты логопедии?

Современные модели искусственного интеллекта и глубокого обучения, включая ASR и классификаторы тяжести, могут генерировать подробные, объективные данные о разборчивости речи, ошибках артикуляции и уровняхтяжести 48. Сегодня эти результаты всё чаще внедряются в цифровые терапевтические платформы и мобильные приложения, которые предоставляют пациентам и терапевтам персонализированную обратную связь в реальномвремени49. Например, планшетные приложения и облачные системы телемониторинга используют модельные метрики для визуализации прогресса, выделения конкретных артикуляционных недостатков и адаптации сложности упражнений. Эти системы позволяют объективно отслеживать ход терапии, обеспечивают персонализированный выбор упражнений и поддерживают удалённый мониторинг через цифровыеплатформы 50, 51 и 52.

Обучающие модули с артикуляцией на основе обратной связи

Обучающие модули на основе обратной связи являются центральными элементами цифровой реабилитации при дизартрии. Предыдущие исследования показали, что модули цифровой реабилитации часто включают биологическую обратную связь, автоматизированное обнаружение ошибок и адаптивное проектирование упражнений. Биологическая обратная связь в логопедии использует визуальные и слуховые сигналы, такие как отображение форм волн и визуализации движений артикулятора, чтобы предоставлять пациентам рекомендации в реальном времени. Кроме того, автоматизированное обнаружение ошибок реализуется с помощью моделей ИИ, которые выявляют фонологические или артикуляционные ошибки, обеспечивая мгновенную корректирующую обратную связь для улучшения обучения. Процесс обучения иерархичен и адаптивен, то есть переходит от простых к более сложным задачам, которые специально нацелены на звуки речи, слоги или слова. Эти упражнения динамически корректируются в зависимости от результатов пациента, обеспечивая персонализированный опыт обучения. Кроме того, внедрение элементов геймификации и виртуальной реальности (VR) в некоторые платформы способствует повышению мотивации и соблюдения дисциплины среди пациентов, делая терапевтический процесс более увлекательным. Таким образом, эти модули поддерживают интенсивную, повторяющуюся практику, что является ключом к моторному обучению и улучшению речи, при этом позволяя использовать самостоятельное или под руководствомтерапевта 51,53,54.

Роль логопеда и мониторинга пациентов

Логопеды (SLT) остаются центральными элементами процесса реабилитации, несмотря на то, что цифровые инструменты стали более распространёнными за последнее десятилетие. Оценка и постановка целей включают интерпретацию результатов модели для выбора подходящих целей терапии и индивидуальную адаптацию дифференциальных планов лечения, адаптированных к индивидуальным потребностям пациента. Надзор и обратная связь крайне важны для мониторинга прогресса пациента; Эксперты предоставляют обратную связь по исправлению речи и вносят необходимые корректировки в терапию по мере необходимости. Кроме того, уделяется особое внимание обучению и поддержке пациентов, обучение их эффективному использованию цифровых инструментов в процессе реабилитации. Междисциплинарное сотрудничество крайне важно, поскольку специалисты из разных дисциплин работают вместе, чтобы решать более широкие потребности реабилитации, обеспечивая комплексный подход к уходу за пациентами. Мониторинг пациентов улучшается с помощью цифровых платформ, которые позволяют терапевтам и клиницистам дистанционно отслеживать соблюдение требований, восстановление, эффективность и результаты пациентов, обеспечивая своевременное вмешательство и постояннуюподдержку 51,52.

Удобство использования: комфорт пациента и повторяемость

Для успешной реализации технологий цифровой реабилитации крайне важна удобство использования, с акцентом на удобные интерфейсы, удовлетворяющие разнообразные потребности пациентов. Гибкие методы терапии стали возможны благодаря мобильным платформам, которые повышают комфорт и доступность. Важные функции, такие как адаптируемые модули и автоматическая обратная связь, способствуют постоянному, автономному участию, что необходимо для моторного обучения. Пилотные тесты показывают высокий уровень принятия и удовлетворения, но технические проблемы всё равно остаются. Постоянная обратная связь от пациентов и терапевтов помогает улучшать эти инструменты в соответствии с реальными требованиями. С акцентом на развитие значимого терапевтического опыта, использование ИИ и обучения, основанного на обратной связи, в логопедии повышает эффективность, доступность и персонализацию в реабилитации при дизартрии48,51,52,53,54.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Выводы

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом обзоре описывается растущее применение мультимодальных архитектур глубокого обучения для маркировки фонем и восстановления речи при дизартрии. Эти архитектуры сочетают акустическую, артикуляционную и визуальную анализ, чтобы преодолеть ограничения аудио-ориентированного распознавания речи в патологической речи, характеризующейся низкой разборчивостью и нестандартными артикуляционными конфигурациями. Ультразвуковая визуализация языка в электромагнитной артикулографии и лицевые орие...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не заявляют о конфликте интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают признательность Университету китайской медицины Нанкина и Университету китайской медицины за предоставление необходимых стипендий и финансирования (Программа послевузовских научных исследований и инноваций провинции Цзянсу KYCX25_2282).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kundi, P., Gencer, Z. K., Muluk, N. B. Speech Disorders and Aphasia: Overview. Phys Ther Rehabil Otorhinolaryngol. , 487-494 (2025).
  2. Rose, K. R., Hughes, P. M. Speech systems. Br Telecom Technol J. 13 (2), 51-62 (1995).
  3. Ackermann, H., Hertrich, I. The contribution of the cerebellum to speech processing. J Neurolinguistics. 13 (2–3), 95-116 (2000).
  4. Johnson, J. A. Speech, Voice, and Communication. Int Rev Neurobiol. 134, 1189-1205 (2017).
  5. Enderby, P. Disorders of communication: dysarthria. Handb Clin Neurol. 110, 273-281 (2013).
  6. Feenaughty, L., Mefferd, A., Tjaden, K. Dysarthria. Encycl Hum Brain. 1-5, V5-301-V5-315 (2023).
  7. Pan, T., Wang, S. Dysarthria as a Presenting Symptom With Rapidly Progressive Imaging Features in Sporadic Creutzfeldt-Jakob Disease: A Case Report. Cureus. 16 (6), e62687 (2024).
  8. Kieling, M. L. M., Finkelsztejn, A., Konzen, V. R., dos Santos, V. B., Ayres, A., et al. Articulatory speech measures can be related to the severity of multiple sclerosis. Front Neurol. 14, (2023).
  9. Kirshner, H. S., Samuels, M. A. Speech and Language Disorders. Neurol Localization Diagnosis. , 177-189 (2023).
  10. Gutz, S. E., Stipancic, K. L., Yunusova, Y., Berry, J. D., Green, J. R. Validity of Off-the-Shelf Automatic Speech Recognition for Assessing Speech Intelligibility and Speech Severity in Speakers With Amyotrophic Lateral Sclerosis. J Speech Lang Hear Res. 65 (6), 2128 (2022).
  11. Nasereddin, H. H. O., Omari, A. A. R. Classification techniques for automatic speech recognition (ASR) algorithms used with real-time speech translation. Proc Comput Conf 2017. , 200-207 (2018).
  12. Ríos-Urrego, C. D., Escobar-Grisales, D., Orozco-Arroyave, J. R. Synchronous Analysis of Speech Production and Lips Movement to Detect Parkinson’s Disease Using Deep Learning Methods. Diagnostics. 15 (1), 73 (2024).
  13. Deng, S., Du, J., Zhang, J., Wang, X. Deep learning approach for short-term entry passenger flow forecasting in urban rail transit stations. Eng Appl Artif Intell. 163, 112989 (2026).
  14. Tunio, N. A., Tunio, M. A., Raza, M. A., Faheem, M., Hashmani, A. A., Nadeem, R. Performance Comparison Between Deep Learning Models for Fault Classification in Transmission Lines Using Time Series Data. Energy Sci Eng. 13 (5), 2330-2351 (2025).
  15. Yu, C., Su, X., Qian, Z. Multi-Stage Audio-Visual Fusion for Dysarthric Speech Recognition With Pre-Trained Models. IEEE Trans Neural Syst Rehabil Eng. 31, 1912-1921 (2023).
  16. Qian, Z., Xiao, K. A Survey of Automatic Speech Recognition for Dysarthric Speech. Electron. 12 (20), 4278 (2023).
  17. Strand, E. A. Clinical and professional ethics in the management of motor speech disorders. Semin Speech Lang. 24 (4), 301-311 (2003).
  18. Alhinti, L., Cunningham, S., Christensen, H. The Dysarthric Expressed Emotional Database (DEED): An audio-visual database in British English. PLoS One. 18, (2023).
  19. Lee, S. E., Huang, M. L., Hsu, T. C. Using Spectrogram to Evaluate Dysarthric Treatment Effectiveness. Rehabil Pract Sci. 18 (1), 177-185 (1990).
  20. Abdul, Z. K., Al-Talabani, A. K. Mel Frequency Cepstral Coefficient and Its Applications: A Review. IEEE Access. 10, 122136-122158 (2022).
  21. Chartier, J., Anumanchipalli, G. K., Johnson, K., Chang, E. F. Encoding of articulatory kinematic trajectories in human speech sensorimotor cortex. Neuron. 98 (5), 1042 (2018).
  22. Williams, S., Foulkes, P., Hughes, V. Analysis of forced aligner performance on L2 English speech. Speech Commun. 158, (2024).
  23. Janbakhshi, P., Kodrasi, I. . Experimental investigation on STFT phase representations for deep learning-based dysarthric speech detection. , (2022).
  24. Varma, V. J., Jana, A., Samal, A. K., S, A. u. r. o. b. i. n. d. o., Naidu, R. C., et al. Enhancing dysarthria severity classification: efficient audio-based deep learning models. Discov Appl Sci. 7 (8), (2025).
  25. Fadlil, A., Perdana, L., Pujiyanta, A., Imam Karim Fathurrahman, H., Muhammad Jogo Samodro, M. Implementation of Dysarthria Identification Using MFCC and Multilayer Perceptron Algorithm. SSRG Int J Electr Electron Eng. 12, 32-46 (2025).
  26. Rebernik, T., Jacobi, J., Jonkers, R., Noiray, A., Wieling, M., et al. A review of data collection practices using electromagnetic articulography. Lab Phonol. 12 (1), 1-42 (2021).
  27. Girod-Roux, M., Hueber, T., Fabre, D., Gerber, S., Canault, M., et al. Rehabilitation of speech disorders following glossectomy, based on ultrasound visual illustration and feedback. Clinical Linguist Phonetics. 34 (9), 826-843 (2020).
  28. Yang, Y., Su, R., Zhao, S., Ng, M. L., Yan, N., et al. Towards unified diffusion model for speech to ultrasound tongue imaging synthesis. Inf Fusion. 127, 103896 (2026).
  29. Bian, Y., Küster, D., Liu, H., Krumhuber, E. G. Understanding Naturalistic Facial Expressions with Deep Learning and Multimodal Large Language Models. Sensors (Basel). 24 (1), 126 (2023).
  30. Hammadi, Y., Grondin, F., Ferland, F., Lebel, K. Evaluation of Various State-of-the-Art Head Pose Estimation Algorithms for Clinical Scenarios. Sensors (Basel). 22 (18), 6850 (2022).
  31. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi. , 498-502 (2017).
  32. Yi, F., Wen, H., Jiang, T. ASFormer: Transformer for Action Segmentation. , (2021).
  33. Bharilya, V., Kumar, N. Machine learning for autonomous vehicles’ trajectory prediction: A comprehensive survey, challenges, and future research directions. Veh Commun. 46, (2024).
  34. Li, H., Qiu, T. Continuous Manufacturing Process Sequential Prediction using Temporal Convolutional Network. Comput Aided Chem Eng. 49, 1789-1794 (2022).
  35. Biffi, C., Roffo, G., Salvagnini, P., Cherubini, A. A temporal convolutional network-based approach and a benchmark dataset for colonoscopy video temporal segmentation. Comput Methods Programs Biomed. 270, 108782 (2025).
  36. Alzahrani, S., Hussain, N., Mohammad, F. Enhancing Phoneme Labeling in Dysarthric Speech with Digital Twin-Driven Multi-Modal Architecture. Comput Mater Contin. 84 (3), 4825-4849 (2025).
  37. Lv, C., Fan, L., Li, H., Ma, J., Jiang, W., et al. Leveraging multimodal deep learning framework and a comprehensive audio-visual dataset to advance Parkinson’s detection. Biomed Signal Process Control. 95, 106480 (2024).
  38. Dai, W., Li, M., He, Y., Zhu, Y. Fine-Tuning Pre-Trained Audio Models for Dysarthria Severity Classification: A Second Place Solution in the Multimodal Dysarthria Severity Classification Challenge. , 151-153 (2024).
  39. Qi, J., Van hamme, H. A Study on Model Training Strategies for Speaker-Independent and Vocabulary-Mismatched Dysarthric Speech Recognition. Appl Sci. 15 (4), 2006 (2025).
  40. Shahamiri, S. R., Lal, V., Shah, D. Dysarthric Speech Transformer: A Sequence-to-Sequence Dysarthric Speech Recognition System. IEEE Trans Neural Syst Rehabil Eng. 31, 3407-3416 (2023).
  41. Vinotha, R., Hepsiba, D., Vijay Anand, L. D., Andrew, J., Jennifer Eunice, R. Enhancing dysarthric speech recognition through SepFormer and hierarchical attention network models with multistage transfer learning. Sci Reports. 14 (1), 1-23 (2024).
  42. Hashan, A. M., Alexandrovich Khlebnikov, N., Bredikhin, B. A. Attention Based Encoder-Decoder for Automatic Hyperkinetic Dysarthria Speech Recognition in Educational Organizational Systems. , 1-4 (2025).
  43. Merler, M., Agurto, C., Peller, J., Roitberg, E., Taitz, A., et al. Clinical assessment and interpretation of dysarthria in ALS using attention based deep learning AI models. NPJ Digit Med. 8 (1), 260 (2025).
  44. Van Nuffelen, G., Middag, C., De Bodt, M., Martens, J. Speech technology-based assessment of phoneme intelligibility in dysarthria. Int J Lang Commun Disord. 44 (5), 716-730 (2009).
  45. Middag, C., Bocklet, T., Martens, J. P., Nöth, E. Combining phonological and acoustic ASR-free features for pathological speech intelligibility assessment. , 3005-3008 (2011).
  46. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  47. Zhu, T., Duan, S., Liang, H., Li, F., Zhang, W. Multiangle Correlation Feature Extraction and Disease Prediction Model Construction for Patients With Post-Stroke Dysarthria. IEEE Trans Neural Syst Rehabil Eng. 33, 587-597 (2025).
  48. Stell, A., Vogel, A. P., Vera Soto, J. P., Pareja, A. A., Sinnott, R. A Platform for the Delivery of Speech Treatment for Dysarthria in Multisystemic Ataxia. Proc - IEEE Symp Comput Med Syst. , 405-410 (2025).
  49. Gupta, S., Patil, A. T., Purohit, M., Parmar, M., Patel, M., et al. Residual Neural Network precisely quantifies dysarthria severity-level based on short-duration speech segments. Neural Networks. 139, 105-117 (2021).
  50. Javanmardi, F., Kadiri, S. R., Alku, P. Pre-trained models for detection and severity level classification of dysarthria from speech. Speech Commun. 158, 103047 (2024).
  51. Mulfari, D., La Placa, D., Rovito, C., Celesti, A., Villari, M. Deep learning applications in telerehabilitation speech therapy scenarios. Comput Biol Med. 148, 105864 (2022).
  52. Bhat, C., Strika, H. Speech Technology for Automatic Recognition and Assessment of Dysarthric Speech: An Overview. J Speech, Lang Hear Res. 68 (2), 547-577 (2025).
  53. Michizoe, R., Kinosada, H., Nishikawa, H., Taniguchi, I., Matsunaga, K., et al. Japanese Vowel-mora Visualization for Dysarthria Rehabilitation with Variational Autoencoder. , 494-498 (2024).
  54. Woo, S. T., Ha, J. W., Na, S. Design of a personalized oral—motor exercise device for speech impairment rehabilitation. Front Bioeng Biotechnol. 13, 1543259 (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи