$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Обзор мультимодального сбора данных в дизартрической речи
Мультимодальный сбор данных необходим для тщательного изучения логопедического контроля и разработки эффективных методов диагностики и реабилитации, учитывая сложность и разнообразие симптомов дизартрии.
Акустическая запись
Акустический канал остаётся центральным. Записи лучше всего проводить в акустически обработанной среде для снижения реверберации и окружающего шума. Типичные микрофоны — это высококачественные конденсаторные микрофоны, которые либо устанавливаются на голову, либо настольные устройства, равномерно расположенные для контроля уровня сигнала и предотвращения вариаций между сессиями. Частоты дискретизации 16 кГц или 44,1 кГц очень распространены, при этом 16 кГц достаточно для разборчивости и анализа просодии, тогда как 44,1 кГц обеспечивает большую точность, что полезно для тонких акустических и фонаторных исследований. Многоканальные аудиоинтерфейсы позволяют синхронно захватывать несколько потоков и должны поддерживать стабильные настройки усиления и запаса высоты, чтобы избежать клиппинга или шума на полу. Для воспроизводимости важно установить калибровку и документировать усиление микрофона, уровень фонового шума и дрейфа. В дизартрических речевых корпусах качество звука особенно важно, поскольку дефекты акустического сигнала могут быть тонкими и легко скрыты плохими условиямизаписи 15.
Опциональные артикуляционные / трекинг губ / ЭМГ / ультразвуковые методы
Чтобы выйти за рамки акустической волны, часто требуются дополнительные методы для фиксации артикуляционной кинематики и физиологической активности мышц. Таким образом, отслеживание губ или захват движения лица позволяет количественно оценить отверстие губ/челюсти, движение, скорость и симметрию. Электромагнитная артикуляция (ЭМА) отслеживает датчики языка, челюсти и губ в трёх измерениях и обеспечивает временное/позиционное разрешение артикуляторов, в то время как поверхностная электромиография (sEMG) фиксирует мышечную активность для изучения дефицитов нейромышечной активации, лежащих в основе дизартрии. Ультразвуковая визуализация языка (ИМП) обеспечивает изображение поверхности языка в реальном времени во время артикуляции, что полезно для пациентов, которые не переносят ЭМА. Мультимодальные системы показывают, что идентификация речево-моторных дефицитов улучшается с помощью параллельной акустики, дополненной артикуляционной/визуальнойзаписью 16.
Этические соображения и согласие пациентов
Работа с носителями дизартрии часто затрагивает уязвимые группы населения. Исследователи должны получить одобрение институционального экспертного совета (IRB) или этического комитета, а также обеспечить информированное согласие, которое объясняет способы записи (аудио, видео, физиологические сенсоры), хранение, анонимизацию, будущее использование и права на снятие. Формы согласия должны чётко касаться видеосъемки (отслеживание губ и лица) и, по желанию, чувствительных методов, таких как ЭМГ. Конфиденциальность данных необходимо контролировать, особенно когда хранятся видео или изображения лица. Необходимо оценить уровень комфорта, усталость, ограничения в движении и потенциальный риск участника. Занятия должны включать периоды отдыха, а участникам следует предупреждать, что они могут остановиться в любой момент без последствий. Дефицит и разнообразие участников исследований дизартрических речевых корпусов дополнительно подчеркивают важность этическойстрогости 17.
Этапы предварительной обработки данных (сегментация, снижение шума, нормализация)
Система MAV-HuBERT выравнивает акустические и визуальные данные временно на уровне кадра, извлекая 26-мерные энергии логарифм-фильтра из исходной формы сигнала и синхронизируя их с визуальными кадрами 25 Гц, собранными с помощью идентификации лиц на основе Dlib. Последовательные аудиокадры обычно комбинируются для стабилизации краткосрочных флуктуаций, а сросшиеся визуальные области пространственно нормализуются перед мультимодальным слиянием признаков. Эти предварительные процессы обеспечивают непрерывную временную согласованность и снижают вариативность между аудио- и визуальными модальностями, что приводит к более высокой точности идентификации на последующихэтапах 15,18.
Инженерия функций и вычислительные рабочие процессы
Мультимодальные модели глубокого обучения требуют синхронизированных представлений акустических, артикуляционных и визуальных данных для точного обозначения фонем в дизартрической речи. В этом разделе представлен обзор техник представления признаков, используемых в мультимодальном анализе речи, а затем пошаговый вычислительный рабочий процесс для извлечения и выравнивания этих признаков перед обучением модели.
Выделение и представление признаков
В мультимодальном анализе речи необработанные аудио- и сигналы движения должны быть преобразованы в значимые представления, которые могут быть обработаны моделями глубокого обучения. Одним из наиболее широко используемых представлений является спектрограмма, которая показывает, как энергия сигнала меняется со временем и между частотами. Представления на основе спектрограмм полезны для фиксации таких характеристик, как замыканье, дыхание и нерегулярное синхронизирование, которые часто наблюдаются при дизартрическойречи 19.
Ещё одной распространённой особенностью являются коэффициенты Mel-Frequency Cepstral Coefficients (MFCC), которые отражают спектральные свойства речи так, чтобы приближаться к человеческому слуховому восприятию. Функции MFCC широко используются в распознавании речи, поскольку обеспечивают компактные, устойчивые к шуму представления, которые остаются стабильными даже при искаженииречи 20. Помимо акустических особенностей, мультимодальные подходы включают артикуляционную информацию, такую как траектории движения языка, губ и челюсти. Эти сигналы можно получить с помощью электромагнитной артикуляции (ЭМА), ультразвуковой визуализации языка (ИМП) или оптического отслеживания движения. Артикуляционные особенности дают прямую информацию о рековом моторном контроле и помогают компенсировать ухудшённые акустическиесигналы 21.
Визуальная информация также полезна для анализа дизартрической речи. Ориентиры лица, извлеченные из видеозаписей, включая контур губ, смещение челюсти и открытие рта, дают дополнительные сигналы о артикуляции. Эти визуальные особенности улучшают различение фонем, особенно когда акустический сигнал неясен. Для обучения под надзором все потоки признаков должны быть согласованы с транскрипциями на уровне фонем, чтобы каждый временной промежуток соответствовал правильной речевой единице. Точное выравнивание крайне важно для обучения моделей маркировки фонем, особенно в дизартической речи, где границы фонем часто размыты22.
Вычислительный рабочий процесс
В этом разделе показано, что для воспроизведения мультимодального процесса маркировки фонем требуется каждый шаг — от извлечения признаков до оценки модели (рисунок 1).
Выделение акустических признаков с помощью спектрограмм и MFCC
Во-первых, кратковременное преобразование Фурье (STFT) используется для преобразования исходного речового сигнала во временно-частотное представление. Для создания спектрограммы сигнал разбивается на короткие перекрывающиеся кадры, и каждый кадр подвергается преобразованию Фурье.
Мел-частотные цепстральные коэффициенты (MFCC) используются для извлечения перцептивно взвешенных акустических признаков из спектрограммы. Для распознавания речи и анализа дизартрии MFCC предлагают компактные и устойчивые к шумупредставления 23,24. Благодаря своей надёжности и эффективности MFCC широко используются в приложениях, связанных с распознаванием речи и говорящим. Таким образом, благодаря своей полезности, MFCC затем извлекаются для расчёта и приближения уровней слухового восприятия человека и предоставления сжатых, устойчивых к шуму акустических характеристик, далее25.
Приобретение артикуляционных траекторий
Данные артикуляционных движений получаются для фиксации физического движения речевых органов. Электромагнитная артикуляция (ЭМА) использует датчики, прикреплённые к языку, губам и челюсти, для отслеживания артикуляционных движений в трёх измерениях. Альтернативно, для неинвазивной оценки движения языка можно использовать ультразвуковое изображение языка (ИМП). Записанные траектории фильтруются, нормализуются и понижаются для соответствия частоте кадров акустических признаков для обеспечения временнойсогласованности 26. Преобразование речи в последовательности ультразвуковой визуализации языка (ИМП) — это метод оценки траекторий ультразвукового языка на основе речевых данных путём сопоставления слуховых характеристик с физиологическими движениями языка. Эта методология предоставляет неинвазивную альтернативу методам прямого артикуляторного сбора данных, необходимых для мониторинга и лечения аномалий речи и голосового тракта, при этом избегая необходимости в специальном оборудовании и клиническом опыте, присущих прямым методамизмерения 27,28. В зависимости от наличия артикуляционных признаков, таких как траектории движения языка, губ и челюстей, которые фиксируются с помощью ЭМА или ультрасонографии (ИМП), сигналы фильтруются и понижаются для соответствия частоте акустических кадров.
Обнаружение визуальных ориентиров
Для ввода речи и видео входные клавиши лица (уголки губ, движение линий челюсти) необходимо извлекать с помощью таких инструментов, как Mediapipe или OpenFace, после чего они нормализуются, чтобы убрать эффекты позы головы. MediaPipe использует систему глубокого обучения для оценки поз лица и тела, предоставляя 33 ориентира для общего распознавания позы, из которых 11 специально для лица. Его эффективность может различаться, особенно в случаях окклюзии. Модель MediaPipe FaceMesh повышает надёжность, используя 468 3D-ориентиров лица вместе с геометрическим методом оценки положенияголовы 29. OpenFace 2.0 функционирует как набор инструментов для анализа поведения лица, позволяя обнаруживать ориентиры, оценивать позу головы, отслеживать взгляд и распознавать единицы действий лица. Он поддерживает интеграцию с различными языками программирования и может обрабатывать живые видеопотоки или статичные изображения. Выходы, такие как ориентиры лица и векторы взгляда, могут экспортироваться в формате CSV. OpenFace 2.0 использует локальную модель Convolutional Experts Constrained Local Model (CE-CLM), которая включает модель распределения точек для учёта вариаций форм ориентиров и экспертов по патчам для различий в локальных видах29,30.
Выравнивания транскрипции фонем
Следующий шаг — временное согласование всех представленных потоков (акустических, артикуляционных и визуальных) с аннотациями на уровне фонем с помощью инструментов принудительного выравнивания, таких как Montreal Forced Aligner (MFA), обеспечивая синхронизированные мультимодальные входы для обучения вычислительной модели. Принудительное выравнивание (FA) — это метод выравнивания транскриптов с аудиосигналами для определения временных границ речевых единиц. Это обеспечивает более точную обработку аудио и продвигает лингвистическое изучение. Он всё чаще применяется в фонетических исследованиях и доказал свою эффективность значительно быстрее, чем ручное выравнивание. Хотя FA обычно ассоциируется с системами автоматического распознавания речи (ASR), это более широкая задача в области автоматической обработки речи, включающая анализ устной речи итранскрипцию 22. Монреальский принудительный элайнер (MFA) — это ведущий набор инструментов FA, использующий алгоритмы HMM-GMM для достижения эффективного выравнивания. Несмотря на достижения в технологиях ASR, традиционные подходы, такие как HMM-GMM, по-прежнему популярны для задач FA. MFA использует характеристики MFCC и четырёхступенчатый метод обучения для создания акустических моделей с точным фонетическимвыравниванием 31.
Компоненты архитектуры моделей
Мультимодальные модели глубокого обучения для распознавания дизартрической речи состоят из нескольких ключевых компонентов, которые совместно захватывают контекстную, временную и мультимодальную информацию. Основные компоненты включают контекстный кодировщик, модуль временной уточнения и мультимодальный механизм слияния. Каждый компонент играет определённую роль в повышении точности маркировки фонем при неупорядоченной речи.
Контекстный кодировщик на основе трансформатора
Трансформаторный кодировщик используется для моделирования дальнодействующих зависимостей в последовательностях речи. Дизартрическая речь часто сопровождается нерегулярным временем и неясными границами фонем, что затрудняет традиционные модели захват контекстуальной информации. Трансформаторы используют многоголовое самовнимание для анализа взаимосвязей между разными временными периодами в последовательности входа. Это позволяет модели учитывать как прошлые, так и будущие речевые кадры при предсказании фонем. В результате энкодер лучше справляется с вариациями артикуляции и произношения, характерными для дизартрии. В мультимодальной архитектуре трансформатор получает синхронизированные акустические, артикуляционные и визуальные особенности и создаёт контекстно-ориентированные представления, которые передаются на следующий этап модели32,33.
Уточнение временной последовательности на основе TCN
После контекстного кодирования последовательность признаков обрабатывается временной сверточной сетью (TCN) для повышения временной точности. Дизартическая речь часто содержит нестабильное время, паузы и удлинённые фонемы, которые требуют дополнительной доработки за пределами контекстного моделирования. TCN используют расширенные причинные свёртки для захвата длительных временных зависимостей при сохранении вычислительной эффективности. Такая структура позволяет модели сглаживать шумные прогнозы и поддерживать согласованные границы фонем на протяжении времени. В архитектуре TCN получает выход кодировщика трансформатора и уточняет последовательность для получения стабильных и временно согласованных представленийпризнаков 33,34,35.
Стратегия мультимодального синтеза
Для повышения точности диагностики при диагностике дизартрии мультимодальное слияние включает информацию из множества источников, таких как голос, текст, видео и физиологические сенсоры. Основные методы состоят из трёх отдельных этапов: раннее слияние, позднее слияние и промежуточноеслияние 36. Раннее слияние объединяет данные из множества модальностей на фундаментальном уровне, позволяя моделям понимать сложные взаимосвязи с самого начала. Его использование ограничено, поскольку требует синхронизации нескольких частот дискретизации и типов данных. Позднее слияние обрабатывает каждую модальность с использованием независимых моделей перед объединением результатов для окончательных оценок. Эта техника гибка и эффективна, когда отсутствуют данные из одной модальности. Кроме того, промежуточное слияние интегрирует модальности на среднем уровне, часто используя методы перекрёстного внимания для выявления зависимостей. Этот метод оказался особенно полезен в клинических контекстах, улучшая результаты за счёт сочетания языковых ссылок с акустическими данными. В итоге, промежуточное слияние с перекрёстным вниманием даёт лучшие результаты в автоматической диагностике дизартрии, чем методы, основанные на одноймодальности 36,37.
Лучшие практики обучения и оценки моделей дизартрии:
Разработка жилистых моделей для оценки и распознавания дизартрии требует тщательного внимания к разделению набора данных, оценке метрик и интерпретируемости. Недавние исследования выделили стандартизированные подходы и инновационные решения для решения уникальных проблем дизартрической речи, включая дефицит данных, вариабельность и клиническую значимость38,39.
Стратегии разделения наборов данных
Чтобы гарантировать, что обучающие, валидационные и тестовые наборы данных не обмениваются информацией о динамиках, предотвращая утечку и перенасадку, теперь широко используется кросс-валидация групповойK-Fold 38,39. Такой подход позволяет моделям сохранять сбалансированные распределения и надёжную оценку производительности, даже при работе с ограниченными или разнообразными наборами данных. Поскольку разбиение по динамику важно для предотвращения смещения, распространённые разделения состоят из соотношений train/test 75:25 или 85:15, а также дополнительного деления для валидации40. Для обработки ограниченных дизартрических данных применяются популярные методы увеличения данных, такие как синтетическая генерация, нарушение темпа и трансферное обучение на основе здоровойречи 41,42.
Метрики оценки
Вопросы интерпретируемости модели
- Карты внимания и кривые выравнивания: Модели, основанные на внимании, дают визуальные представления, подчёркивающие сегменты речи или фонемы, которые модель приоритизирует, способствуя клинической интерпретации и формированию доверия43.
- Анализ фонем/признаков: Распознавание важных фонем или акустических характеристик, связанных с тяжестью дизартрии, способствует как прозрачности модели, так и клиническомупониманию 44.
- Гибридные подходы: Объединение понятности на основе ASR с традиционными акустическими особенностями может дополнительно улучшитьинтерпретируемость 45.
Таким образом, комплексный конвейер модели дизартрии включает стратифицированные, независимые от спикера разделение данных, многогранную оценку (PER, понятность, клинический вход) и интерпретируемость через механизмы внимания. Эти подходы обеспечивают надёжность, клиническую релевантность и прозрачность модельных систем для оценки и распознавания дизартрии.
Репрезентативные результаты
Несколько исследований сообщили об улучшении точности границ фонем при использовании мультимодальных признаков. Дизартрическая речь часто сопровождается размытыми или продолжительными артикуляционными переходами, что затрудняет точное определение границы между фонемами. Опубликованные модели, сочетающие акустические, артикуляционные и визуальные особенности, показали лучшее согласование с эталонными аннотациями, чем унимодальные системы. Эти улучшения часто визуализируются с помощью кривых выравнивания, где мультимодальные модели демонстрируют снижение временных ошибок, особенно при переходах согласных–гласных 46. В литературных отчётах также описываются улучшения точности классификации фонем. Мультимодальные архитектуры показали свою эффективность в снижении ошибок замещения и удаления, особенно для фрикативов и гласных, которые часто искажаются при дизартрии. Матрицы путаницы, описанные в предыдущих исследованиях, показывают, что сочетание визуальной и артикуляционной информации помогает модели более надежно различать похожие фонемы. Повышение точности границ фонем — один из ярких примеров. Артикуляционные переходы и изменения в дизартрической речи часто удлинены или размыты, что затрудняет интерпретацию, где заканчивается одна фонема и начинается другая. Для более точного определения начала и смещения фонем мультимодальная система использует общие данные из визуальных движений губ, артикуляционных траекторий и аудио. По сравнению с моделями, созданными унимодальными акустическими моделями, предсказанные границы фонем визуализировали более точно совпадают с истинными аннотациями. Для визуализации этих улучшений используются кривые выравнивания, при этом мультимодальная модель показывает меньше ошибок в тайминге, особенно при переходах между гласными и согласными (VC и CV). В клинической среде это может привести к улучшению карт сегментации, которые дополнительно помогают логопедам и клиницистам выявлять особые проблемы с моторным контролем, такие как недостаточное округление губ или задержка закрытиячелюсти 47.
Кроме того, модель может создавать выходы дифференциальной классификации, которые можно использовать для определения наиболее вероятной последовательности произнесённых фонем. Мультимодальная система демонстрирует снижение ошибок замещения и удаления фонем по сравнению с традиционными и базовыми моделями. Например, включение визуальной формы губ и сигналов положения артикулятора повышает точность классификации фрикативов, таких как /s/ и /ʃ/, которые часто встречаются искажёнными и дезориентированными при дизартрии. Матрицы путаницы также могут использоваться для демонстрации таких улучшений, где улучшенная дискриминация фонем и бифуркация характеризуются снижением межкатегорическойпутаницы 48.
Измерение понятности речи до и после коррекции, поддерживаемой моделью, можно сравнить с помощью клинической таблицы значимости. В эту таблицу можно включить такие метрики, как стабильность и синхронизация слогов, оценка площади пространства гласных, точность согласных и общий балл по понятности. В целом, уже скорректированный выход демонстрирует улучшенные границы просодии, ритма и артикуляции. Например, после коррекции представление гласного пространства обычно увеличивается, что указывает на повышенную акустическую отличительность гласных, что является важной терапевтической целью во многих методах лечениядизартрии 39.
Важно, что результаты этих моделей предназначены для поддержки клинического принятия решений, улучшая, а не заменяя суждения клинициста. Система может подчеркнуть конкретные фонемы или артикуляционные переходы, которые значительно отклоняются от предполагаемых или теоретически предполагаемых закономерностей. Используя эту информацию, терапевты могут адаптировать свои цели терапии так, чтобы включить: (a) улучшить консистенцию поднятия языка для альвеолярных согласных (например, /t/, /d/), (b) сосредоточиться на выступлении губы для округлых гласных (например, /u/), (c) улучшить время появления для звонких стоп-согласных.
Опубликованные работы подчёркивают, что эти результаты должны дополнять клиническую интерпретацию, а не заменять суждение врачей. Визуализации моделей, такие как карты внимания и графики выравнивания фонем, могут помочь терапевтам выявить конкретные артикуляционные проблемы, такие как недостаточное приподнятие языка, уменьшение округления губ или задержка начала голоса. В целом, данные нескольких исследований показывают, что мультимодальные архитектуры глубокого обучения повышают технические показатели эффективности, а также предоставляют интерпретируемые результаты, которые могут помочь в планировании терапии и отслеживании прогресса реабилитации.
Клиническая интеграция и процесс реабилитации
Внедрение цифровых технологий и передовых речевых моделей в реабилитации при дизартрии трансформирует результаты пациентов, проведение терапии и клинические практики. В этом разделе рассматриваются рамки обучения артикуляции, ориентированной на обратную связь, меняющиеся роли логопеда и мониторинга пациентов, интеграция результатов моделей в терапевтические инструменты и значительные вопросы удобства использования.
Как результаты этих моделей влияют на инструменты логопедии?
Современные модели искусственного интеллекта и глубокого обучения, включая ASR и классификаторы тяжести, могут генерировать подробные, объективные данные о разборчивости речи, ошибках артикуляции и уровняхтяжести 48. Сегодня эти результаты всё чаще внедряются в цифровые терапевтические платформы и мобильные приложения, которые предоставляют пациентам и терапевтам персонализированную обратную связь в реальномвремени49. Например, планшетные приложения и облачные системы телемониторинга используют модельные метрики для визуализации прогресса, выделения конкретных артикуляционных недостатков и адаптации сложности упражнений. Эти системы позволяют объективно отслеживать ход терапии, обеспечивают персонализированный выбор упражнений и поддерживают удалённый мониторинг через цифровыеплатформы 50, 51 и 52.
Обучающие модули с артикуляцией на основе обратной связи
Обучающие модули на основе обратной связи являются центральными элементами цифровой реабилитации при дизартрии. Предыдущие исследования показали, что модули цифровой реабилитации часто включают биологическую обратную связь, автоматизированное обнаружение ошибок и адаптивное проектирование упражнений. Биологическая обратная связь в логопедии использует визуальные и слуховые сигналы, такие как отображение форм волн и визуализации движений артикулятора, чтобы предоставлять пациентам рекомендации в реальном времени. Кроме того, автоматизированное обнаружение ошибок реализуется с помощью моделей ИИ, которые выявляют фонологические или артикуляционные ошибки, обеспечивая мгновенную корректирующую обратную связь для улучшения обучения. Процесс обучения иерархичен и адаптивен, то есть переходит от простых к более сложным задачам, которые специально нацелены на звуки речи, слоги или слова. Эти упражнения динамически корректируются в зависимости от результатов пациента, обеспечивая персонализированный опыт обучения. Кроме того, внедрение элементов геймификации и виртуальной реальности (VR) в некоторые платформы способствует повышению мотивации и соблюдения дисциплины среди пациентов, делая терапевтический процесс более увлекательным. Таким образом, эти модули поддерживают интенсивную, повторяющуюся практику, что является ключом к моторному обучению и улучшению речи, при этом позволяя использовать самостоятельное или под руководствомтерапевта 51,53,54.
Роль логопеда и мониторинга пациентов
Логопеды (SLT) остаются центральными элементами процесса реабилитации, несмотря на то, что цифровые инструменты стали более распространёнными за последнее десятилетие. Оценка и постановка целей включают интерпретацию результатов модели для выбора подходящих целей терапии и индивидуальную адаптацию дифференциальных планов лечения, адаптированных к индивидуальным потребностям пациента. Надзор и обратная связь крайне важны для мониторинга прогресса пациента; Эксперты предоставляют обратную связь по исправлению речи и вносят необходимые корректировки в терапию по мере необходимости. Кроме того, уделяется особое внимание обучению и поддержке пациентов, обучение их эффективному использованию цифровых инструментов в процессе реабилитации. Междисциплинарное сотрудничество крайне важно, поскольку специалисты из разных дисциплин работают вместе, чтобы решать более широкие потребности реабилитации, обеспечивая комплексный подход к уходу за пациентами. Мониторинг пациентов улучшается с помощью цифровых платформ, которые позволяют терапевтам и клиницистам дистанционно отслеживать соблюдение требований, восстановление, эффективность и результаты пациентов, обеспечивая своевременное вмешательство и постояннуюподдержку 51,52.
Удобство использования: комфорт пациента и повторяемость
Для успешной реализации технологий цифровой реабилитации крайне важна удобство использования, с акцентом на удобные интерфейсы, удовлетворяющие разнообразные потребности пациентов. Гибкие методы терапии стали возможны благодаря мобильным платформам, которые повышают комфорт и доступность. Важные функции, такие как адаптируемые модули и автоматическая обратная связь, способствуют постоянному, автономному участию, что необходимо для моторного обучения. Пилотные тесты показывают высокий уровень принятия и удовлетворения, но технические проблемы всё равно остаются. Постоянная обратная связь от пациентов и терапевтов помогает улучшать эти инструменты в соответствии с реальными требованиями. С акцентом на развитие значимого терапевтического опыта, использование ИИ и обучения, основанного на обратной связи, в логопедии повышает эффективность, доступность и персонализацию в реабилитации при дизартрии48,51,52,53,54.