مقالة مراجعة

البنية متعددة الوسائط لعدم دقة تصنيف الفونيمات في الكلام العصبي الناتجة عن العصب: دمج المحولات وشبكات TCN في إعادة التأهيل السريري

DOI:

10.3791/70447

مايو 26, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تفحص هذه المراجعة كيف يمكن للبنى متعددة الوسائط التي تجمع بين المعلومات السمعية والنطقية والبصرية، إلى جانب نماذج المحول وTCN، أن تحسن التعرف على الفونيمات في الكلام الخلفي. يؤكد على إمكاناتها لتحسين تقييم وضوح الكلام والعلاج الشخصي بما يتجاوز قدرات أنظمة ASR التقليدية.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

بسبب مشاكل النطق وتغير الفونيمات، تشكل اضطرابات النطق مثل عسر النطق تحديات كبيرة في إعادة التأهيل السريري. أنظمة التعرف التلقائي على الكلام (ASR) التقليدية، التي عادة ما تدرب على مجموعات بيانات معيارية، غالبا ما تفشل في فك شفرة الكلام العصبي بدقة. سمحت الاختراقات الحديثة في الذكاء الاصطناعي والتعلم العميق بدمج البنى متعددة الوسائط، مثل دمج المعلومات السمعية والنطقية والبصرية لتسجيل أنماط الكلام المعقدة، مما جعل ذلك ممكنا بشكل متزايد. في هذه المراجعة، استكشفنا تقارب المحولات والشبكات الالفافية الزمنية (TCNs) ضمن أطر متعددة الوسائط لمعالجة عدم دقة تصنيف الفونيمات في الكلام الخلفي. هنا، نناقش كيف يمكن للنمذجة السياقية المعتمدة على المحولات والدقة الزمنية المدفوعة ب TCN أن تعزز اكتشاف حدود الفونيمات، وتصنيفها، وردود الفعل التعويضية. تناقش المراجعة أيضا إمكانات مثل هذه الأنظمة الهجينة في علاج النطق الفردي، وقضايا قابلية التفسير، والتطبيقات السريرية. البنى متعددة الوسائط هي نهج ترجمي لتعزيز المراقبة العلاجية، ووسائل الاتصال، وتقييم وضوح الكلام للأشخاص الذين يعانون من اضطرابات النطق الحركي من خلال الربط بين الطب السريري والمعلوماتية الطبية.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يمكن أن يؤدي ضعف الجهاز العصبي غالبا إلى عواقب صحية خطيرة ومفاجئة، تشمل اضطرابات الجهاز العضلي الهيكلي، واضطرابات الأوعية الدموية العصبية، وغيرها من اضطرابات التواصل العصبي. تشمل اضطرابات التواصل العصبي اضطرابات مثل عسر النطق وفقدان النطق، والتي يمكن تعريفها بأنها تلعثم في الكلام بسبب ضعف العضلات وصعوبة في تخطيط حركات الكلام، على التوالي1. يتكون الكلام من خمسة أنظمة فرعية: التنفس، النغمات، الرنين، النطق، والنطق، والعروض، ويجب أن تعمل جميعها معا بشكل تآزري وسلس للتواصل الفعال2. عسر النثرية، الناتج عن خلل في هذه الأنظمة الفرعية، يقلل من السمع، وطبيعيتها، وقابلية الفهم، وكفاءة التواصل، مما يؤثر بشكل كبير على حياة المرضى وعائلاتهم. يمكن أن يكون عسر النهر ناتجا عن مجموعة متنوعة من الأمراض العصبية والأمراض الكامنة الكامنة، بما في ذلك خلل في القشرة الدماغية، العقد القاعدية، المخيخ، النوى القاعدية، الأعصاب القحفية، أو الأعصاب الطرفية. تشمل العوامل الأخرى مشاكل حركية أولية في اللسان، والحنجرة، والحنجرة3.

عسر النطق هو مصطلح شامل لاضطرابات الكلام الحركي الناتجة عن تغير في التحكم العصبي العضلي يؤثر على التنفس، والصلام، والرنين، وإنتاج الكلام، وإصدار الأصوات، والإيقاع. لذا، عسر النطق هو اضطراب في النطق غالبا ما يرتبط بالإعاقات العصبية العضلية، حيث تكون العضلات المستخدمة في الكلام إما ضعيفة أو بطيئة أو مشلولة. تشمل الأنواع المحددة من العضلات التي تشارك في الكلام عضلات اللسان، والحلق، والوجه، والشفاه، والحبال الصوتية، والفك، وعضلات الجهاز التنفسي العلوي. قد يتخذ الضرر الذي يلحق بهذه العضلات أشكالا مختلفة، بما في ذلك إصابات في الخلايا العصبية الحركية التي تعصبها أو في الأوعية الدموية لديها، مما يحرمها من الأكسجين. تشمل الأضرار العصبية النموذجية التي تعيق توصيل الكلام تلف الخلايا العصبية الحركية العليا التي قد تؤدي إلى تيبس أو تشنج عضلات الكلام، وإصابات العصبون الحركي السفلي التي قد تؤدي إلى ضعف العضلات أو شللها نتيجة انقطاع الإشارات العصبية، وإصابات المخيخ التي غالبا ما تؤدي إلى نقص التنسيق بين العضلات (ترنح) أو تلف العقدة القاعدية التي تعيق الحركات المنسقة وقد تؤدي إلى حركات لا إرادية (فرط الحركة) أو تيبس العضلات (الحركات منخفضة الحركة)5.

عسر النسج هو عرض شائع لمختلف الاضطرابات العصبية وغالبا ما يرتبط بالأمراض العصبية التقدمية. يؤثر ذلك بشكل كبير على المريض وعائلاته، حيث يلعب التواصل دورا حيويا في التعبير عن الشخصية والحفاظ على الروابط الاجتماعية. يتميز هذا الاضطراب بانخفاض وضوح الكلام. يبقى محتوى اللغة المنطوقة كما هو، مما يسمح للمريض بالكتابة وتفسير كل من اللغة المنطوقة والمكتوبة؛ من ناحية أخرى، فإن فقدان العصبية هو النوع الأكثر شدة، مما يؤدي إلى فقدان كامل للنطق الحركي6. هناك ستة تصنيفات رئيسية لعسر النهار: عسر الالتهاب الارتخائي، المرتبط بخلل في وظائف الخلايا العصبية الحركية السفلية؛ عسر النهر التشنج، الذي ينشأ من تلف الخلايا العصبية الحركية العليا المتصلة بالمناطق الحركية في القشرة الدماغية؛ عسر الترنح التركلي، الناتج أساسا عن مشاكل في المخيخ؛ وعسر النهر المفرط الحركة وخسر النهر منخفض الحركة، وكلاهما مرتبط باضطرابات في النظام الهرمي خارج الهرمي. النوع السادس يشار إليه عادة باسم عسر النطق المختلط وغالبا ما يرتبط بتلف في مناطق متعددة، مما يؤدي إلى خصائص في الكلام تظهر سمات من فئتين على الأقل. اضطرابات النطق المرتبطة بهذه الأنواع الستة الرئيسية من عسر النطق فريدة ويمكن أن تساعد في تشخيص وعلاج عسر النطق 5,6.

تشمل العوامل المسببة التي تساهم في تحديات النطق العدوى (مثل مرض كروتسفيلد-جاكوب ومتلازمة نقص المناعة المكتسب)، ومشاكل الأوعية الدموية (السكتات الدماغية الإقفالية والنزفية)، والأورام (أورام الدماغ)، والأمراض المزيل للميالين (بما في ذلك التصلب المتعدد ومتلازمة غيلان-باريه)، والاضطرابات التنكسية (مثل مرض باركنسون ومرض هنتنغتون)، والإصابات (إصابات دماغية رضحية وشلل دماغي)، والتعرض للسموم (للمعادن الثقيلة، الكحول والمخدرات)، والحالات الوراثية (مثل SANDO)7. بالإضافة إلى ذلك، قد تسبب عوامل غير عصبية مثل الشفة المشقوقة أو الحنك مشاكل في النطق، لكنها لا تندرج تحت فئة عسر النهار.

تكمن أهمية عسر النهر في البيئات السريرية في تأثيره الكبير على جودة حياة الأفراد. نظرا لأن التواصل ضروري للمشاركة الاجتماعية والتعليمية والمهنية (6). تشخيص الأنواع المختلفة من عسر النهارية بدقة، مثل الارتخاء، التشنج، اللاترنطي، فرط الحركة، نقص الحركة، والمختلط، أمر ضروري لتحديد المشكلات العصبية الكامنة وتقييم طرق إعادة التأهيل. غالبا ما يعتمد أخصائيو النطق واللغة والأطباء على تحليل خصائص وشدة عسر النتن لتخصيص العلاج، وتحديد أهداف التواصل القابلة للتحقيق، وتقييم ضرورةطرق التواصل المعززة والبديلة 9. بالنسبة لأولئك الذين يعانون من صعوبات في الكلام، وجد أن أنظمة التعرف التلقائي على الكلام (ASR) تحسن سهولة الوصول والتفاعل الاجتماعي. ومع ذلك، فإن النماذج الصوتية غير الكافية أعاقت النجاح الأوسع لتقنية ASR في معالجة اضطرابات الكلام. لذا، تتناول هذه الورقة مشاكل الفونيم في الكلام الخلفي، وأنظمة ASR الحالية وحدودها، والتقنيات متعددة الوسائط الإبداعية، والنمذجة السياقية المعتمدة على المحولات، وTCNs للتحسين الزمني والتسلسلي.

حتى مع التقدم الكبير في تكنولوجيا ASR، لا تزال أنظمة ASR الأعلى تعاني من العديد من العيوب للأشخاص ذوي إعاقات الكلام. قد تنبع هذه النواقص جزئيا من الصعوبات في الحصول على مجموعة بيانات تدريبية متنوعة وممثلة لاضطرابات الكلام. أحد التحديات في اضطراب النطق المفرط يرتبط على الأرجح بمجموعة واسعة من خصائص الكلام غير الطبيعية التي تختلف من شخص لآخر، وعدم تمثيل هذه الاختلافات في مجموعات بيانات التدريب10. على الرغم من ذلك، غالبا ما تجاهلت الأبحاث حول ASR المرتبطة بعسر النهار.

تنقسم أنظمة ASR إلى ثلاث فئات: مستقلة عن المتحدث (SI)، وتعتمد على المتحدث (SD)، وتعتمد على المتحدث التكيفي (SA). أنظمة SI تؤدي أداء جيدا مع المتحدثين الأصحاء لكنها تعاني من تدهور الكلام وتؤدي بشكل أفضل عندما تشمل بيانات التدريب متحدثين يعانون من عسر الزرج. على النقيض من ذلك، تركز أنظمة SD على المستخدمين الأفراد، محققة دقة ممتازة، بينما تتكيف أنظمة SA مع كلام المستخدم مع مرور الوقت وتتفوق على كل من نماذج SI وSD. ومع ذلك، يتطلب كل من أنظمة SA وSD بيانات تدريب، مما يشكل حاجزا آخر لأولئك الذين يعانون من اضطرابات تنكسية عصبية11. على الرغم من التقدم الكبير، لا تزال نماذج ASR الحالية غير مناسبة للمتحدثين ذوي الإعاقة، بسبب نقص مجموعات بيانات التدريب المختلفة. لسد هذه الفجوة، يجب تطوير منهجيات شاملة لجمع البيانات تتناول جوانب مختلفة من عسر النطاق، مما يحسن أداء ASR للمتحدثين الذين يصعب التعرف عليهم البعض.

لتجاوز هذه القيود، يمكن للاستراتيجيات متعددة الوسائط التي تمزج بين الإشارات الصوتية والنطقية والبصرية أن تمثل إنتاج الكلام وتحسينه في أعراض عسر المرض بشكل شامل. على سبيل المثال، يتم الحصول على بيانات عن الحركة النطقية، مثل تصوير اللسان، باستخدام الموجات فوق الصوتية والتصوير الكهرومغناطيسي. غالبا ما تدمج هذه البيانات مع حركات الشفاه البصرية، ويمكن أن تعوض عن ضعف المعلومات الصوتية، مما يعزز القدرة على التمييز والتمييز بين الفونيمات12. هذا التكرار الموجود في الأنظمة متعددة الوسائط يتوافق مع طرق التقييم السريري، مما يعزز قدرة المعالجين على ملاحظة حركات الوجه الفموي إلى جانب الكلام السمعي. وعلى العكس، توفر أطر التعلم العميق، وخاصة المحولات وشبكات التعلم، نمذجة متفوقة للتبعيات والتغيرات الزمنية داخل تسلسلات الكلام. تعمل هذه النماذج من خلال السماح للمحولات بالتقاط العلاقات السياقية الشاملة، مما يتيح التعرف على الفونيم حتى عندما تكون الإشارات الصوتية أقل أو محجوبة أو مخفضة13. تساهم شبكات TCN بشكل أكبر من خلال توفير مجالات استقبال مستقرة وتنعيم زمني، مما يعزز دقة اكتشاف حدود الفونيمات. عند دمجهما ضمن أطر الاندماج متعددة الوسائط، يعزز كلا النهجين دقة تصنيف الفونيمات في الكلام الخلفي ويسهل إعادة التأهيل السريري الأكثر دقة وتركيزا على التغذية الراجعة. لذلك، فإن هياكل التعلم العميق متعددة الوسائط هذه متوافقة مباشرة مع الأهداف السريرية الفورية، مثل تعزيز قياس وضوح الكلام، ومراقبة رحلة التأهيل، وتقديم علاجات مدعومة بالتقنية مصممة خصيصا لملفات ضعف النطق الحركي الخاصة بالأفراد14.

بينما تحمل هذه البنى متعددة الوسائط للتعلم العميق إمكانات كبيرة لحل عدم دقة تصنيف الفونيمات، فإن نقلها الفعال من أطر التجربة إلى أدوات تشخيصية موثوقة يتطلب هيكلا تشغيليا موحدا. لمعالجة ذلك، تصف الدراسة التالية سير عمل حسابي شامل يشمل جمع البيانات متعددة الوسائط، واستخراج الميزات، وتدريب النماذج. الهدف هو ضمان أن هذه الأنظمة المعقدة قابلة للتكرار والتحقق عبر مجموعة واسعة من الحالات السريرية. إن إنشاء مثل هذا المسار المنهجي الشفاف أمر بالغ الأهمية لأخصائيي النطق واللغة والمهندسين السريريين للتحقق من صحة الخوارزميات عبر مجموعة واسعة من خصائص المرضى ومستويات الإعاقة. وأخيرا، تعد هذه المنهجية المنهجية مقدمة للتنفيذ السريري، حيث تتيح دمج نماذج الكلام المتقدمة في التقييمات التنظيمية، وأنظمة الصحة الإلكترونية، ومنصات مراقبة العلاج طويلة الأمد.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

مراجعة ومنظور

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

نظرة عامة على جمع البيانات متعددة الوسائط في الكلام العصبي

جمع البيانات متعددة الوسائط ضروري لفحص التحكم الحركي في النطق بشكل شامل وتطوير تقنيات تشخيصية وإعادة تأهيل فعالة، نظرا لتعقيد وتنوع أعراض عسر النطق.

إعداد التسجيل الصوتي

تظل القناة الصوتية مركزية. أفضل إجراء للتسجيلات في بيئة معالجة صوتيا لتقليل الصدى والضوضاء المحيطة. الميكروفونات النموذجية هي مكثفات عالية الجودة وتكون إما مثبتة على رأس القلب أو على الطاولة، موضوعة بشكل ثابت للتحكم في مستوى الإشارة وتجنب التغيرات عبر الجلسات. معدلات أخذ العينات 16 كيلوهرتز أو 44.1 كيلوهرتز شائعة جدا، حيث تكفي 16 كيلوهرتز للفهم والتحليل النباري، بينما تعطي 44.1 كيلوهرتز دقة أكبر، وهو أمر مفيد للأبحاث الصوتية/الصوتية الدقيقة. تسمح واجهات الصوت متعددة القنوات بالتقاط متزامن لعدة تدفقات ويجب الحفاظ على إعدادات كسب متسقة ومساحة رأس لتجنب القطع أو ضوضاء الأرضية. لإمكانية التكرار، فإن تحديد المعايرة وتوثيق كسب الميكروفون، ومستوى الضوضاء المحيطة، والانحراف أمر مهم. في مجموعات الكلام العصبية (عسر النطق)، تكون جودة الصوت مهمة بشكل خاص لأن عيوب الإشارة الصوتية قد تكون دقيقة ويمكن إخفاؤها بسهولة بسبب ظروف تسجيل سيئة15.

خيارات لتقنيات النطق / تتبع الشفاه / تخطيط العضلات / الموجات فوق الصوتية

لتجاوز الموجة الصوتية، غالبا ما تكون هناك حاجة إلى طرق إضافية لالتقاط الحركية النطقية والنشاط الفسيولوجي للعضلات. لذا، يسمح تتبع الشفاه أو التقاط حركة الوجه بقياس فتح الشفاه/الفك، والحركة، والسرعة، والتناظر. يتتبع علم النطق الكهرومغناطيسي (EMA) حساسات اللسان والفك والشفة بثلاثة أبعاد ويوفر دقة زمنية وموضعية للمفاصل، بينما يسجل تخطيط العضلات السطحية (sEMG) نشاط العضلات لاستكشاف عجز تنشيط الأعصاب العضلية الكامنة وراء عسر النهار. يوفر تصوير اللسان بالموجات فوق الصوتية (UTI) تصويرا فوريا لسطح اللسان أثناء النطق، وهو مفيد للأشخاص الذين لا يستطيعون تحمل التوتر الكهرومغناطيسي. تظهر الأنظمة متعددة الوسائط أن تحديد عجز الحركة النطقية يتحسن بفضل الصوت المتزامن، مع دعم الالتقاط النطقي/البصري16.

الاعتبارات الأخلاقية وموافقة المريض

غالبا ما يشمل العمل مع المتحدثين في عسر الزواج فئات ضعيفة. يجب على الباحثين الحصول على موافقة لجنة مراجعة مؤسسية (IRB) أو لجنة الأخلاقيات، وضمان الموافقة المستنيرة التي تشرح طرق التسجيل (الصوت، الفيديو، الحساسات الفسيولوجية)، والتخزين، وعدم الهوية، والاستخدام المستقبلي، وحقوق السحب. يجب أن تتناول نماذج الموافقة بشكل صريح تصوير الفيديو (تتبع الشفاه/الوجه) واختياريا الأساليب الحساسة مثل تخطيط العضلات الكهربائية. يجب إدارة خصوصية البيانات، خاصة عند تخزين الصور بالفيديو أو الوجوه. من الضروري تقييم مستوى راحة المشارك، والإرهاق، وقيود الحركة، والمخاطر المحتملة لدى المشارك. يجب أن تتضمن الجلسات فترات راحة، ويجب إبلاغ المشاركين بأنه يمكنهم التوقف في أي وقت دون مواجهة عواقب. ندرة وتنوع المشاركين في أبحاث مجموعة النطق العسر تؤكد أهمية الصرامة الأخلاقية17.

خطوات معالجة البيانات المسبقة (تقسيم، تقليل الضوضاء، التطبيع)

يقوم نظام MAV-HuBERT بمحاذاة البيانات الصوتية والبصرية زمنيا على مستوى الإطار، مستخرجا طاقات بنك لوغاريتيم فلتر 26 بعدا من الموجة الأصلية ومزامنها مع إطارات بصرية بسرعة 25 هرتز تم جمعها بواسطة تحديد الوجه المعتمد على Dlib. عادة ما يتم دمج إطارات الصوت المتتالية لتثبيت التقلبات قصيرة المدى، ويتم تطبيع المناطق البصرية المدمجة مكانيا قبل دمج الميزات متعددة الوسائط. توفر هذه الأنشطة المسبقة للمعالجة اتساقا زمنيا مستمرا وتقلل من التباين عبر الوسائط الصوتية والبصرية، مما يؤدي إلى دقة تحديد أعلى في المراحل النهائية15,18.

هندسة الميزات وسير العمل الحسابي

تتطلب نماذج التعلم العميق متعددة الوسائط تمثيلات متزامنة للمعلومات الصوتية والنطقية والبصرية لتحديد الفونيمات بدقة في الكلام الخلفي. يقدم هذا القسم ملخصا لتقنيات تمثيل الميزات المستخدمة في تحليل الكلام متعدد الوسائط، يليه سير عمل حسابي خطوة بخطوة لاستخراج ومحاذاة هذه الميزات قبل تدريب النماذج.

استخراج الميزات والتمثيل

في تحليل الكلام متعدد الوسائط، يجب تحويل الصوت الخام وإشارات الحركة إلى تمثيلات ذات معنى يمكن معالجتها بواسطة نماذج التعلم العميق. واحدة من أكثر التمثيلات استخداما هي المخطط الطيفي، الذي يوضح كيف تتغير طاقة الإشارة مع مرور الوقت وعبر الترددات. التمثيلات القائمة على الطيف مفيدة لالتقاط خصائص مثل التلعثم، التنفس، وعدم انتظام التوقيت، والتي تلاحظ عادة في الكلام الخلفي19.

ميزة أخرى شائعة الاستخدام هي معاملات التردد الميل-سيبسترا (MFCCs)، التي تمثل الخصائص الطيفية للكلام بطريقة تقارب الإدراك السمعي البشري. تستخدم ميزات MFCC على نطاق واسع في التعرف على الكلام لأنها توفر تمثيلات مدمجة وقوية ضد الضوضاء تبقى مستقرة حتى عندما يكون الكلام مشوها20. بالإضافة إلى الميزات الصوتية، تتضمن الأساليب متعددة الوسائط معلومات نطقية، مثل مسارات حركة اللسان والشفاه والفك. يمكن الحصول على هذه الإشارات باستخدام التصوير الكهرومغناطيسي (EMA)، أو تصوير اللسان بالموجات فوق الصوتية (UTI)، أو تتبع الحركة البصرية. توفر الميزات النطقية معلومات مباشرة عن التحكم الحركي في الكلام وتساعد في تعويض تدهور الإشارات الصوتية21.

المعلومات البصرية مفيدة أيضا لتحليل الكلام المزمن. توفر المعالم الوجهية المستخرجة من تسجيلات الفيديو، بما في ذلك انحناء الشفاه، وإزاحة الفك، وفتح الفم، إشارات إضافية حول النطق. تحسن هذه الميزات البصرية التمييز بين الفونيمات، خاصة عندما تكون الإشارة الصوتية غير واضحة. للتعلم تحت الإشراف، يجب محاذاة جميع تدفقات الميزات مع نسخ على مستوى الفونيم، لضمان أن كل إطار زمني يتوافق مع وحدة الكلام الصحيحة. المحاذاة الدقيقة ضرورية لتدريب نماذج تصنيف الفونيمات، خاصة في الكلام الخلفي، حيث غالبا ما تكون حدود الفونيمات غير واضحة22.

سير العمل الحاسوبي

يوضح هذا القسم كيف أن كل خطوة مطلوبة لإعادة إنتاج سير عمل وضع العلامات الفونيمية متعددة الوسائط، من استخراج الميزات إلى تقييم النموذج (الشكل 1).

استخراج الميزات الصوتية من خلال المتغيرات الطيفية وMFCCs

أولا، يستخدم تحويل فورييه قصير الوقت (STFT) لتحويل إشارة الكلام الخام إلى تمثيل زمني وترددي. لإنشاء مخطط طيفي، يتم تقسيم الإشارة إلى إطارات متداخلة قصيرة، ويخضع كل إطار لتحويل فورييه.
تستخدم معاملات البكسترال بتردد ميل (MFCCs) لاستخراج الميزات الصوتية الموزونة إدراكيا من المقياس الطيفي. لتحليل التعرف على الكلام وخلل النهار، تقدم MFCCs تمثيلات مدمجة وقوية للضوضاء23,24. نظرا لمتانتها وفعاليتها، تستخدم MFCCs بشكل شائع في التطبيقات المتعلقة بالتعرف على الكلام ومكبرات الصوت. وبالتالي، وبسبب فائدتها، يتم استخراج MFCCs لحساب وتقريب مستويات الإدراك السمعي البشري وتوفير ميزات صوتية مضغوطة وقوية ضد الضوضاء، ثم25.

اكتساب مسارات النطق

يتم الحصول على بيانات الحركة النطقية لالتقاط الحركة الفيزيائية لأعضاء الكلام. تستخدم تقنية التصوير الكهرومغناطيسي (EMA) حساسات مثبتة على اللسان والشفاه والفك لتتبع الحركة النطقية في ثلاثة أبعاد. بدلا من ذلك، يمكن استخدام تصوير اللسان بالموجات فوق الصوتية (UTI) لتقدير حركة اللسان بشكل غير جراحي. يتم تصفية المسارات المسجلة، وتطبيعها، وتقليل عينات العينات لتتناسب مع معدل إطارات الميزات الصوتية لضمان الاتساق الزمني26. تحويل الكلام إلى تسلسلات تصوير اللسان بالموجات فوق الصوتية (UTI) هو تقنية لتقدير مسارات اللسان بالموجات فوق الصوتية من بيانات الكلام عن طريق ربط الخصائص السمعية بحركات اللسان الفسيولوجية. توفر هذه المنهجية بديلا غير جراحي لتقنيات جمع البيانات النطقية المباشرة، والتي تعتبر ضرورية لمراقبة وعلاج اضطرابات الكلام والجهاز الصوتي، مع تجنب الحاجة إلى معدات محددة وخبرة سريرية متأصلة في أساليب القياس المباشر27،28. استنادا إلى توفر ميزات نطقية، مثل مسارات حركة اللسان والشفاه والفكين، والتي يتم تسجيلها باستخدام EMA أو الموجات فوق الصوتية (UTI)، يتم ترشيح الإشارات وتقليل عينات الإشارة لتتناسب مع معدل الإطارات الصوتية.

اكتشاف المعالم البصرية

بالنسبة لمدخلات الكلام والفيديوهات، يجب استخراج مدخلات مفاتيح الوجه (زوايا الشفاه، حركة خطوط الفك) من خلال أدوات مثل Mediapipe أو OpenFace، ثم يتم تطبيعها لإزالة تأثيرات وضعية الرأس. تستخدم MediaPipe إطار عمل تعلم عميق لتقدير وضعيات الوجه والجسم، حيث توفر 33 معلما للتعرف العام على الوضعيات، منها 11 معلما مخصصا للوجه. يمكن أن تختلف فعاليتها، خاصة في حالات الإغلاق. يحسن نموذج MediaPipe FaceMesh الموثوقية باستخدام 468 معلما ثلاثي الأبعاد للوجه إلى جانب طريقة هندسية لتقدير وضعية الرأس29. يعمل OpenFace 2.0 كصندوق أدوات لتحليل سلوكيات الوجه، مما يتيح اكتشاف العلامات الوجهية، وتقدير وضعية الرأس، وتتبع النظرات، والتعرف على وحدات حركة الوجه. يدعم التكامل مع لغات برمجة مختلفة ويمكنه معالجة تغذية الفيديو الحية أو الصور الثابتة. يمكن تصدير المخرجات، مثل معالم الوجه ومتجهات النظرات، بصيغة CSV. يستخدم OpenFace 2.0 نموذج الخبراء المحلي المقيد (CE-CLM)، والذي يتضمن نموذج توزيع نقاط لأخذ التغيرات في أشكال المعالم وخبراء الترقيع للاختلافات في المظاهر المحلية29,30.

محاذاة نسخ الفونيم

الخطوة التالية هي محاذاة جميع التدفقات المميزة مؤقتا (الصوتية، النطقية، والبصرية) مع تعليقات على مستوى الفونيم باستخدام أدوات المحاذاة القسرية مثل محاذاة مونتريال القسرية (MFA)، مما يضمن مدخلات متعددة الوسائط متزامنة لتدريب النماذج الحاسوبية. المحاذاة القسرية (FA) هي تقنية محاذاة النصوص مع الإشارات الصوتية لتحديد الحدود الزمنية لوحدات الكلام. هذا يسمح بمعالجة صوتية أكثر دقة ويتقدم في الدراسة اللغوية. يستخدم بشكل متزايد في الدراسات الصوتية وقد ثبت أنه أسرع بكثير من المحاذاة اليدوية. على الرغم من ارتباطه عموما بأنظمة التعرف التلقائي على الكلام (ASR)، إلا أن FA هو مهمة أوسع ضمن معالجة الكلام التلقائي تشمل تحليل اللغة المنطوقة والنسخ22. تقويم مونتريال القسري (MFA) هو مجموعة أدوات رائدة في مجال المحاذاة القسرية تستخدم خوارزميات HMM-GMM لتحقيق محاذاة فعالة. على الرغم من التقدم في تكنولوجيا ASR، لا تزال الأساليب التقليدية مثل HMM-GMM شائعة لمهام التحليل المبكر. يستخدم MFA خصائص MFCC وطريقة تدريب من أربع مراحل لإنشاء نماذج صوتية دقيقة31.

مكونات بنية النماذج

تتكون نماذج التعلم العميق متعددة الوسائط للتعرف على الكلام الخلفي من عدة مكونات رئيسية تعمل معا لالتقاط المعلومات السياقية والزمنية ومتعددة الوسائط. تشمل المكونات الرئيسية مشفر سياقي، وحدة تحسين زمني، وآلية دمج متعددة الوسائط. يلعب كل مكون دورا محددا في تحسين دقة تصنيف الفونيمات في الكلام غير المضطرب.

المشفر السياقي القائم على المحول

يستخدم مشفر المحول لنمذجة التبعيات طويلة المدى في تسلسلات الكلام. غالبا ما يحتوي الكلام الخلفي على توقيت غير منتظم وحدود فونيمات غير واضحة، مما يصعب على النماذج التقليدية التقاط المعلومات السياقية. تستخدم المحولات الانتباه الذاتي متعدد الرؤوس لتحليل العلاقات بين أطر زمنية مختلفة في تسلسل الإدخال. وهذا يسمح للنموذج بأخذ إطارات الكلام الماضية والمستقبلية في الاعتبار عند التنبؤ بالفونيمات. وبالتالي، يمكن للمشفر التعامل بشكل أفضل مع اختلافات النطق والنطق الشائعة في عسر النطق. في البنية متعددة الوسائط، يستقبل المحول ميزات صوتية وحربية وبصرية متزامنة وينتج تمثيلات واعية للسياق تنتقل إلى المرحلة التالية من النموذج32,33.

تحسين تسلسل الزمن القائم على TCN

بعد الترميز السياقي، تتم معالجة تسلسل الميزات بواسطة شبكة الالتفاف الزمني (TCN) لتحسين الدقة الزمنية. غالبا ما يحتوي الكلام العصبي على توقيت غير مستقر، وتوقفات، وفونيمات ممدودة، مما يتطلب تحسينات إضافية تتجاوز النمذجة السياقية. تستخدم شبكات TCN الالتفافات السببية المتوسعة لالتقاط الاعتمادات الزمنية الطويلة مع الحفاظ على الكفاءة الحاسوبية. تسمح هذه البنية للنموذج بتنعيمات الصاخبة والحفاظ على حدود فونيم متسقة عبر الزمن. في البنية، يستقبل TCN مخرجات مشفر المحول ويقوم بتحسين التسلسل لإنتاج تمثيلات ميزات مستقرة ومتسقة زمنيا33،34،35.

استراتيجية الاندماج متعدد الوسائط

لزيادة دقة التشخيص في تقييم عسر النهار، يدمج الدمج متعدد الوسائط معلومات من مصادر متعددة مثل الصوت والنص والفيديو وأجهزة الاستشعار الفسيولوجية. تتكون التقنيات الرئيسية من ثلاث خطوات مميزة: الاندماج المبكر، الاندماج المتأخر، والاندماج المتوسط36. يجمع الاندماج المبكر بيانات من العديد من الأساليب على مستوى أساسي، مما يسمح للنماذج بفهم العلاقات المعقدة منذ البداية. استخدامه محدود لأنه يتطلب مزامنة عدة معدلات أخذ عينات وأنواع بيانات. يعالج الاندماج المتأخر كل نمط باستخدام نماذج مستقلة قبل دمج النتائج للتقييمات النهائية. هذه التقنية مرنة وفعالة عندما تكون البيانات من طريقة معينة مفقودة. علاوة على ذلك، يدمج الاندماج الوسيط الأنماط على المستوى المتوسط، وغالبا ما يستخدم تقنيات الانتباه المتقاطع لاكتشاف التبعيات. كانت هذه الطريقة مفيدة بشكل خاص في السياقات السريرية، حيث حسنت النتائج من خلال دمج المراجع اللغوية مع البيانات الصوتية. باختصار، الاندماج الوسيط مع التفاعل بين الانتباه ينتج نتائج أفضل في التقييم التلقائي لعسر النهر مقارنة بالطرق المعتمدة على طريقة واحدة36,37.

أفضل الممارسات لتدريب وتقييم نماذج عسر النهار:

يتطلب تطوير نماذج قوية لتقييم وتعرف عسر النهر اهتماما دقيقا لتقسيم مجموعة البيانات، وتقييم المقاييس، وقابلية التفسير. سلطت الأبحاث الحديثة الضوء على الأساليب الموحدة والحلول المبتكرة لمعالجة هذه التحديات الفريدة في النطق الناتج عن عسر الخلق، والتي تشمل ندرة البيانات، والتباين، والأهمية السريرية38,39.

استراتيجيات تقسيم مجموعات البيانات

لضمان عدم تبادل مجموعات بيانات التدريب والتحقق والاختبار لمعلومات المتحدثين، مما يمنع تسرب البيانات وفرط التركيب، أصبح التحقق المتقاطع من مجموعات K-Fold الطبقي شائعا الآن38,39. يمكن هذا النهج النماذج من الحفاظ على توزيعات متوازنة وتقييمات أداء موثوقة، حتى عند العمل مع مجموعات بيانات محدودة أو متنوعة. نظرا لأن التقسيم حسب مكبر الصوت ضروري لمنع التحيز، فإن الانقسامات الشائعة تتكون من نسب قطار إلى اختبار 75:25 أو 85:15، إلى جانب تقسيم إضافي للتحققمن 40. للتعامل مع بيانات عسر الزرافة المحدودة، يتم تطبيق طرق تعزيز البيانات الشائعة مثل توليد البيانات الاصطناعية، واضطراب السرعة، والتعلم الانتقالي من الكلام الصحي41,42.

مقاييس التقييم

اعتبارات قابلية تفسير النموذج

  1. خرائط الانتباه ومنحنيات المحاذاة: تقدم النماذج المبنية على الانتباه تمثيلات بصرية تركز على مقاطع الكلام أو الفونيمات التي يعطيها النموذج الأولوية، مما يساهم في التفسير السريري وبناء الثقة43.
  2. تحليل الفونيمات/الخصائص: التعرف على الفونيمات المهمة أو الخصائص الصوتية المرتبطة بشدة عسر النهارية يعزز الشفافية في النموذج والفهم السريري44.
  3. الأساليب الهجينة: دمج الوضوح القائم على ASR مع الميزات الصوتية التقليدية يمكن أن يحسن التفسير بشكل أكبر45.

لذا، يشمل خط أنابيب نموذج عسر النهر الشامل تقسيم البيانات الطبقي المستقل عن المتحدث، والتقييم متعدد الجوانب (PER، الفهم، المدخلات السريرية)، وقابلية التفسير من خلال آليات الانتباه. تضمن هذه الأساليب أن تكون أنظمة النماذج لتقييم وتعرف على عسر النتن قوية وذات صلة سريرية وشفافة.

النتائج التمثيلية

أفادت عدة دراسات بتحسن في دقة حدود الفونيم عند استخدام الميزات متعددة الوسائط. غالبا ما يحتوي الكلام الخلفي على انتقالات نطقية ضبابية أو طويلة، مما يصعب تحديد الحدود الدقيقة بين الفونيمات. أظهرت النماذج المنشورة التي تجمع بين الميزات الصوتية والنطقية والبصرية توافقا أفضل مع التعليقات المرجعية مقارنة بالأنظمة أحادية الوضع. غالبا ما يتم عرض هذه التحسينات باستخدام منحنيات المحاذاة، حيث تظهر النماذج متعددة الوسائط تقليل أخطاء التوقيت، خاصة أثناء انتقالات الحروف الساكنة إلى الحروف المتحركة46. تصف تقارير الأدبيات أيضا تحسينات في دقة تصنيف الفونيمات. لقد أظهرت البنى متعددة الوسائط تقليل أخطاء الاستبدال والحذف، خاصة للأشكال الاحتكاكية والحروف المتحركة التي تتشوه كثيرا في عسر النهار. تشير مصفوفات الالتباس المبلغ عنها في دراسات سابقة إلى أن دمج المعلومات البصرية والنطقية يساعد النموذج على التمييز بين الفونيمات المتشابهة بشكل أكثر موثوقية. زيادة دقة حدود الفونيم هي مثال بارز. الانتقالات النطقية والتغيرات في الكلام العضلي غالبا ما تكون طويلة أو مشوشة، مما يصعب تفسير مكان نهاية صوت وبداية أخرى. لتحديد بداية وانحراف الفونيم بدقة أكبر، يستخدم النظام متعدد الوسائط بيانات مشتركة من حركات الشفاه البصرية، ومسارات التحرك، والصوت. مقارنة بتلك التي تنتجها النماذج الصوتية أحادية الوسائط، كانت حدود الفونيم المتوقعة تتطابق مع التعليقات الصحيحة بشكل أوثق. تستخدم منحنيات المحاذاة لعرض هذه التحسينات، حيث يظهر النموذج متعدد الوسائط أخطاء أقل في التوقيت، خاصة في الانتقالات بين الحروف المتحركة والحروف الساكنة (VC و CV). في البيئة السريرية، يمكن أن يؤدي ذلك إلى تحسين خرائط التقسيم، مما يساعد معالجي النطق والأطباء على تحديد مشكلات معينة في التحكم الحركي، مثل عدم كفاية تقريب الشفة أو تأخر إغلاق الفك47.

بالإضافة إلى ذلك، يمكن للنموذج إنتاج مخرجات تصنيف تفاضلي يمكن استخدامها لتحديد تسلسل الفونيم المنطوق الأكثر احتمالا. يظهر النظام متعدد الوسائط انخفاضا في أخطاء استبدال الفونيمات والحذف مقارنة بالنماذج التقليدية والنماذج الأساسية. على سبيل المثال، دمج الشكل البصري للشفاه وإشارات موضع المفصل يحسن دقة تصنيف الحركات الفريدة مثل /s/ و /ʃ/، التي غالبا ما تكون مشوهة ومشوشة في عسر النهار. يمكن أيضا استخدام مصفوفات الالتباس لإظهار مثل هذه التحسينات، حيث يشار إلى تحسن التمييز والتفرع بين الفونيمات بانخفاض الارتباك عبر الفئات48.

يمكن مقارنة قياس وضوح الكلام قبل وبعد التصحيح المدعوم بالنموذج باستخدام مخطط الصلة السريرية. يمكن تضمين مقاييس مثل استقرار وتوقيت المقاطع، تقدير مساحة الحروف المتحركة، تقييم دقيق الحروف الساكنة، ودرجة الفهم العامة في هذا البيان. بشكل عام، يظهر الناتج الذي تم تصحيحه بالفعل تحسنا في حدود النبرة والإيقاع والنطق. على سبيل المثال، بعد التصحيح، عادة ما يتسع تمثيل مساحة الحروف المتحركة، مما يدل على تعزيز التميز الصوتي للحرف المتحرك، وهو هدف علاجي حيوي في العديد من علاجات عسر النثر39.

ومن المهم أن هذه النماذج تهدف إلى دعم اتخاذ القرار السريري من خلال تعزيز حكم الطبيب بدلا من استبداله. يمكن للنظام أن يركز على فونيمات محددة أو انتقالات نطقية تختلف بشكل كبير عن الأنماط المتوقعة أو المفترضة نظريا. وبفضل هذه المعلومات، يمكن للمعالجين تخصيص أهدافهم العلاجية لتشمل: (أ) تحسين اتساق رفع اللسان للحروف الساكنة السنيخية (مثل /t/، /d/)، (ب) التركيز على بروز الشفاه للحروف المتحركة المستديرة (مثل /u/)، (ج) تحسين توقيت بداية الحروف الساكنة الصاخبة الصاخبة.

تؤكد الأعمال المنشورة أن هذه النتائج يجب أن تكمل التفسير السريري، لا أن تحل محل حكم الطبيب. يمكن أن تساعد التصورات النموذجية، مثل خرائط الانتباه ومخططات محاذاة الفونيمات، المعالجين في تحديد مشاكل نطقية محددة، مثل عدم كفاية رفع اللسان، انخفاض استدارة الشفاه، أو تأخر ظهور الصوت. بشكل عام، تظهر بيانات من عدة دراسات أن بنى التعلم العميق متعددة الوسائط تزيد من مؤشرات الأداء التقنية، كما توفر مخرجات قابلة للتفسير تساعد في تخطيط العلاج وتتبع تقدم التأهيل.

التكامل السريري وسير عمل التأهيل

تطبيق التقنيات الرقمية والنماذج المتقدمة للنطق في إعادة تأهيل عسر النتن يغير نتائج المرضى، وتقديم العلاج، والممارسات السريرية. يتناول هذا القسم إطار التدريب النطقي المعتمد على التغذية الراجعة، والأدوار المتطورة لمعالجي النطق ومراقبة المرضى، ودمج مخرجات النماذج في الأدوات العلاجية، والمخاوف الكبيرة المتعلقة بقابلية الاستخدام.

كيف تغذي هذه النماذج أدوات علاج النطق؟

يمكن للذكاء الاصطناعي الحديث ونماذج التعلم العميق، التي تشمل ASR ومصنفات الشدة، توليد بيانات مفصلة وموضوعية حول وضوح الكلام، وأخطاء النطق، ومستويات الشدة48. هذه المخرجات أصبحت الآن مدمجة بشكل متزايد في منصات العلاج الرقمي وتطبيقات الهواتف المحمولة، التي توفر تغذية راجعة شخصية وفورية للمرضىوالمعالجين. على سبيل المثال، تستخدم التطبيقات القائمة على الأجهزة اللوحية وأنظمة المراقبة عن بعد السحابية مقاييس مولدة بالنماذج لتصور التقدم، وتسليط الضوء على عيوب النطق المحددة، والتكيف مع صعوبة التمارين. تسمح هذه الأنظمة بتتبع موضوعي لتقدم العلاج، وتمكن اختيار التمارين الشخصية، وتدعم المراقبة عن بعد عبر المنصات الرقمية 50,51,52.

وحدات تدريبية نطقية قائمة على التغذية الراجعة

تعد وحدات التدريب المعتمدة على التغذية الراجعة مركزية لإعادة تأهيل عسر النضج الرقمي. أفادت دراسات سابقة أن وحدات إعادة التأهيل الرقمية غالبا ما تتضمن التغذية الراجعة البيولوجية، واكتشاف الأخطاء الآلي، وتصميم التمارين التكيفية. يستخدم التغذية الراجعة الحيوية في علاج النطق الإشارات البصرية والسمعية، مثل عروض الموجات وتصوير حركات المفاصل، لتقديم إرشادات فورية للمرضى. بالإضافة إلى ذلك، يتم تسهيل الكشف التلقائي عن الأخطاء من خلال نماذج الذكاء الاصطناعي التي تحدد الأخطاء الصوتية أو النطقية، مما يوفر تغذية راجعة تصحيحية فورية لتعزيز التعلم. عملية التدريب هرمية وتكيفية، مما يعني أنها تتطور من مهام أبسط إلى مهام أكثر تعقيدا، والتي تستهدف بشكل خاص أصوات الكلام أو المقاطع أو الكلمات. يتم تعديل هذه التمارين ديناميكيا بناء على أداء المريض، مما يضمن تجارب تعليمية مخصصة. علاوة على ذلك، فإن دمج عناصر التلعيب والواقع الافتراضي (VR) في بعض المنصات يساهم في زيادة الدافعية والامتثال لدى المرضى، مما يجعل العملية العلاجية أكثر جاذبية. تدعم هذه الوحدات ممارسة مكثفة ومتكررة، وهو المفتاح للتعلم الحركي وتحسين الكلام مع السماح بالاستخدام المستقل أو الموجه من المعالج 51,53,54.

دور معالجي النطق ومراقبة المرضى

يظل معالجو النطق واللغة (SLTs) مركزيين في عملية إعادة التأهيل، حتى مع انتشار الأدوات الرقمية في العقد الماضي. يتضمن التقييم وتحديد الأهداف تفسير مخرجات النماذج لاختيار أهداف العلاج المناسبة وتخصيص خطط العلاج التفريقية المصممة لتلبية احتياجات المرضى الفردية. الإشراف والتغذية الراجعة ضروريان لمراقبة تقدم المرضى؛ يقدم الخبراء ملاحظات حول تصحيح الكلام ويجرون التعديلات اللازمة على العلاج حسب الحاجة. بالإضافة إلى ذلك، يتم التركيز على تثقيف المرضى ودعمهم، مما يعلم المرضى كيفية استخدام الأدوات الرقمية بفعالية في عملية إعادة التأهيل. التعاون متعدد التخصصات أمر بالغ الأهمية، حيث يعمل المهنيون من مختلف التخصصات معا لتلبية الاحتياجات الأوسع لإعادة التأهيل، مما يضمن نهجا شاملا لرعاية المرضى. تعزز مراقبة المرضى من خلال المنصات الرقمية، التي تتيح للمعالجين والأطباء تتبع امتثال المرضى وتعافي وأدائهم ونتائجهم عن بعد، مما يسهل التدخلات في الوقت المناسب والدعم المستمر51,52.

اعتبارات سهولة الاستخدام: راحة المرضى وقابليتها للتكرار

لكي يتم تنفيذ تقنيات إعادة التأهيل الرقمية بنجاح، فإن سهولة الاستخدام أمر بالغ الأهمية، مع التركيز على واجهات سهلة الاستخدام تلبي احتياجات مجموعة متنوعة من المرضى. طرق العلاج المرنة ممكنة بفضل المنصات المحمولة، التي تحسن الراحة والوصول. ميزات مهمة مثل الوحدات القابلة للتكيف والتغذية الراجعة الآلية تشجع على المشاركة المتسقة والمستقلة، وهو أمر أساسي للتعلم الحركي. تظهر اختبارات الطيران قبولا ورضا عاليا، لكن لا تزال هناك مشاكل تقنية. يساعد التغذية الراجعة المستمرة من المرضى والمعالجين في تحسين هذه الأدوات لتتوافق مع المتطلبات الواقعية. مع التركيز على تطوير تجارب علاجية ذات معنى، فإن استخدام الذكاء الاصطناعي والتدريب القائم على التغذية الراجعة في علاج النطق يحسن الفعالية وسهولة الوصول والتخصيص في إعادة تأهيل عسر النطق 48,51,52,53,54.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الاستنتاجات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تصف هذه المراجعة التطبيق المتزايد لهياكل التعلم العميق متعددة الوسائط على تصنيف الفونيمات واستعادة الكلام في عسر النهار. تجمع هذه البنى بين التحليل الصوتي والبصري لتجاوز قيود التعرف على الكلام القائم على الصوت في الكلام المرضي الذي يتميز بانخفاض الفهم وتكوينات النطق غير القياسية. التصوير اللساني بالموجات فوق الصوتية والمعلمات الوجهية في التصوير الكهرومغناطيسي هو نماذج أكثر شمولية ل إنتاج الكلام الذي قد يسمح لنا بالتقاط التفاصيل الصوتية والأوامر الحركية في الكلام المضطرب. من المتوقع أن تح...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون عدم وجود تضارب مصالح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يشكر المؤلفون مستشفى نانجينغ للطب الصيني التابع لجامعة نانجينغ للطب الصيني وجامعة الطب الصيني على توفير الزمالات والتمويل اللازم (برنامج البحث والابتكار العلمي للعليا في مقاطعة جيانغسو KYCX25_2282).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kundi, P., Gencer, Z. K., Muluk, N. B. Speech Disorders and Aphasia: Overview. Phys Ther Rehabil Otorhinolaryngol. , 487-494 (2025).
  2. Rose, K. R., Hughes, P. M. Speech systems. Br Telecom Technol J. 13 (2), 51-62 (1995).
  3. Ackermann, H., Hertrich, I. The contribution of the cerebellum to speech processing. J Neurolinguistics. 13 (2–3), 95-116 (2000).
  4. Johnson, J. A. Speech, Voice, and Communication. Int Rev Neurobiol. 134, 1189-1205 (2017).
  5. Enderby, P. Disorders of communication: dysarthria. Handb Clin Neurol. 110, 273-281 (2013).
  6. Feenaughty, L., Mefferd, A., Tjaden, K. Dysarthria. Encycl Hum Brain. 1-5, V5-301-V5-315 (2023).
  7. Pan, T., Wang, S. Dysarthria as a Presenting Symptom With Rapidly Progressive Imaging Features in Sporadic Creutzfeldt-Jakob Disease: A Case Report. Cureus. 16 (6), e62687 (2024).
  8. Kieling, M. L. M., Finkelsztejn, A., Konzen, V. R., dos Santos, V. B., Ayres, A., et al. Articulatory speech measures can be related to the severity of multiple sclerosis. Front Neurol. 14, (2023).
  9. Kirshner, H. S., Samuels, M. A. Speech and Language Disorders. Neurol Localization Diagnosis. , 177-189 (2023).
  10. Gutz, S. E., Stipancic, K. L., Yunusova, Y., Berry, J. D., Green, J. R. Validity of Off-the-Shelf Automatic Speech Recognition for Assessing Speech Intelligibility and Speech Severity in Speakers With Amyotrophic Lateral Sclerosis. J Speech Lang Hear Res. 65 (6), 2128 (2022).
  11. Nasereddin, H. H. O., Omari, A. A. R. Classification techniques for automatic speech recognition (ASR) algorithms used with real-time speech translation. Proc Comput Conf 2017. , 200-207 (2018).
  12. Ríos-Urrego, C. D., Escobar-Grisales, D., Orozco-Arroyave, J. R. Synchronous Analysis of Speech Production and Lips Movement to Detect Parkinson’s Disease Using Deep Learning Methods. Diagnostics. 15 (1), 73 (2024).
  13. Deng, S., Du, J., Zhang, J., Wang, X. Deep learning approach for short-term entry passenger flow forecasting in urban rail transit stations. Eng Appl Artif Intell. 163, 112989 (2026).
  14. Tunio, N. A., Tunio, M. A., Raza, M. A., Faheem, M., Hashmani, A. A., Nadeem, R. Performance Comparison Between Deep Learning Models for Fault Classification in Transmission Lines Using Time Series Data. Energy Sci Eng. 13 (5), 2330-2351 (2025).
  15. Yu, C., Su, X., Qian, Z. Multi-Stage Audio-Visual Fusion for Dysarthric Speech Recognition With Pre-Trained Models. IEEE Trans Neural Syst Rehabil Eng. 31, 1912-1921 (2023).
  16. Qian, Z., Xiao, K. A Survey of Automatic Speech Recognition for Dysarthric Speech. Electron. 12 (20), 4278 (2023).
  17. Strand, E. A. Clinical and professional ethics in the management of motor speech disorders. Semin Speech Lang. 24 (4), 301-311 (2003).
  18. Alhinti, L., Cunningham, S., Christensen, H. The Dysarthric Expressed Emotional Database (DEED): An audio-visual database in British English. PLoS One. 18, (2023).
  19. Lee, S. E., Huang, M. L., Hsu, T. C. Using Spectrogram to Evaluate Dysarthric Treatment Effectiveness. Rehabil Pract Sci. 18 (1), 177-185 (1990).
  20. Abdul, Z. K., Al-Talabani, A. K. Mel Frequency Cepstral Coefficient and Its Applications: A Review. IEEE Access. 10, 122136-122158 (2022).
  21. Chartier, J., Anumanchipalli, G. K., Johnson, K., Chang, E. F. Encoding of articulatory kinematic trajectories in human speech sensorimotor cortex. Neuron. 98 (5), 1042 (2018).
  22. Williams, S., Foulkes, P., Hughes, V. Analysis of forced aligner performance on L2 English speech. Speech Commun. 158, (2024).
  23. Janbakhshi, P., Kodrasi, I. . Experimental investigation on STFT phase representations for deep learning-based dysarthric speech detection. , (2022).
  24. Varma, V. J., Jana, A., Samal, A. K., S, A. u. r. o. b. i. n. d. o., Naidu, R. C., et al. Enhancing dysarthria severity classification: efficient audio-based deep learning models. Discov Appl Sci. 7 (8), (2025).
  25. Fadlil, A., Perdana, L., Pujiyanta, A., Imam Karim Fathurrahman, H., Muhammad Jogo Samodro, M. Implementation of Dysarthria Identification Using MFCC and Multilayer Perceptron Algorithm. SSRG Int J Electr Electron Eng. 12, 32-46 (2025).
  26. Rebernik, T., Jacobi, J., Jonkers, R., Noiray, A., Wieling, M., et al. A review of data collection practices using electromagnetic articulography. Lab Phonol. 12 (1), 1-42 (2021).
  27. Girod-Roux, M., Hueber, T., Fabre, D., Gerber, S., Canault, M., et al. Rehabilitation of speech disorders following glossectomy, based on ultrasound visual illustration and feedback. Clinical Linguist Phonetics. 34 (9), 826-843 (2020).
  28. Yang, Y., Su, R., Zhao, S., Ng, M. L., Yan, N., et al. Towards unified diffusion model for speech to ultrasound tongue imaging synthesis. Inf Fusion. 127, 103896 (2026).
  29. Bian, Y., Küster, D., Liu, H., Krumhuber, E. G. Understanding Naturalistic Facial Expressions with Deep Learning and Multimodal Large Language Models. Sensors (Basel). 24 (1), 126 (2023).
  30. Hammadi, Y., Grondin, F., Ferland, F., Lebel, K. Evaluation of Various State-of-the-Art Head Pose Estimation Algorithms for Clinical Scenarios. Sensors (Basel). 22 (18), 6850 (2022).
  31. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi. , 498-502 (2017).
  32. Yi, F., Wen, H., Jiang, T. ASFormer: Transformer for Action Segmentation. , (2021).
  33. Bharilya, V., Kumar, N. Machine learning for autonomous vehicles’ trajectory prediction: A comprehensive survey, challenges, and future research directions. Veh Commun. 46, (2024).
  34. Li, H., Qiu, T. Continuous Manufacturing Process Sequential Prediction using Temporal Convolutional Network. Comput Aided Chem Eng. 49, 1789-1794 (2022).
  35. Biffi, C., Roffo, G., Salvagnini, P., Cherubini, A. A temporal convolutional network-based approach and a benchmark dataset for colonoscopy video temporal segmentation. Comput Methods Programs Biomed. 270, 108782 (2025).
  36. Alzahrani, S., Hussain, N., Mohammad, F. Enhancing Phoneme Labeling in Dysarthric Speech with Digital Twin-Driven Multi-Modal Architecture. Comput Mater Contin. 84 (3), 4825-4849 (2025).
  37. Lv, C., Fan, L., Li, H., Ma, J., Jiang, W., et al. Leveraging multimodal deep learning framework and a comprehensive audio-visual dataset to advance Parkinson’s detection. Biomed Signal Process Control. 95, 106480 (2024).
  38. Dai, W., Li, M., He, Y., Zhu, Y. Fine-Tuning Pre-Trained Audio Models for Dysarthria Severity Classification: A Second Place Solution in the Multimodal Dysarthria Severity Classification Challenge. , 151-153 (2024).
  39. Qi, J., Van hamme, H. A Study on Model Training Strategies for Speaker-Independent and Vocabulary-Mismatched Dysarthric Speech Recognition. Appl Sci. 15 (4), 2006 (2025).
  40. Shahamiri, S. R., Lal, V., Shah, D. Dysarthric Speech Transformer: A Sequence-to-Sequence Dysarthric Speech Recognition System. IEEE Trans Neural Syst Rehabil Eng. 31, 3407-3416 (2023).
  41. Vinotha, R., Hepsiba, D., Vijay Anand, L. D., Andrew, J., Jennifer Eunice, R. Enhancing dysarthric speech recognition through SepFormer and hierarchical attention network models with multistage transfer learning. Sci Reports. 14 (1), 1-23 (2024).
  42. Hashan, A. M., Alexandrovich Khlebnikov, N., Bredikhin, B. A. Attention Based Encoder-Decoder for Automatic Hyperkinetic Dysarthria Speech Recognition in Educational Organizational Systems. , 1-4 (2025).
  43. Merler, M., Agurto, C., Peller, J., Roitberg, E., Taitz, A., et al. Clinical assessment and interpretation of dysarthria in ALS using attention based deep learning AI models. NPJ Digit Med. 8 (1), 260 (2025).
  44. Van Nuffelen, G., Middag, C., De Bodt, M., Martens, J. Speech technology-based assessment of phoneme intelligibility in dysarthria. Int J Lang Commun Disord. 44 (5), 716-730 (2009).
  45. Middag, C., Bocklet, T., Martens, J. P., Nöth, E. Combining phonological and acoustic ASR-free features for pathological speech intelligibility assessment. , 3005-3008 (2011).
  46. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  47. Zhu, T., Duan, S., Liang, H., Li, F., Zhang, W. Multiangle Correlation Feature Extraction and Disease Prediction Model Construction for Patients With Post-Stroke Dysarthria. IEEE Trans Neural Syst Rehabil Eng. 33, 587-597 (2025).
  48. Stell, A., Vogel, A. P., Vera Soto, J. P., Pareja, A. A., Sinnott, R. A Platform for the Delivery of Speech Treatment for Dysarthria in Multisystemic Ataxia. Proc - IEEE Symp Comput Med Syst. , 405-410 (2025).
  49. Gupta, S., Patil, A. T., Purohit, M., Parmar, M., Patel, M., et al. Residual Neural Network precisely quantifies dysarthria severity-level based on short-duration speech segments. Neural Networks. 139, 105-117 (2021).
  50. Javanmardi, F., Kadiri, S. R., Alku, P. Pre-trained models for detection and severity level classification of dysarthria from speech. Speech Commun. 158, 103047 (2024).
  51. Mulfari, D., La Placa, D., Rovito, C., Celesti, A., Villari, M. Deep learning applications in telerehabilitation speech therapy scenarios. Comput Biol Med. 148, 105864 (2022).
  52. Bhat, C., Strika, H. Speech Technology for Automatic Recognition and Assessment of Dysarthric Speech: An Overview. J Speech, Lang Hear Res. 68 (2), 547-577 (2025).
  53. Michizoe, R., Kinosada, H., Nishikawa, H., Taniguchi, I., Matsunaga, K., et al. Japanese Vowel-mora Visualization for Dysarthria Rehabilitation with Variational Autoencoder. , 494-498 (2024).
  54. Woo, S. T., Ha, J. W., Na, S. Design of a personalized oral—motor exercise device for speech impairment rehabilitation. Front Bioeng Biotechnol. 13, 1543259 (2025).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

مقالات ذات صلة