Research Article

تطوير أدوات الذكاء الاصطناعي التفاعلية لتقييم الحس الجسدي والإيقاع المخصص في منصات تعليم الموسيقى الذكية

DOI:

10.3791/69058

December 19th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة بروتوكول تعلم الموسيقى الحسي الجسدي القابل للتكرار يجمع بين التعرف المتبقي على LSTM مع TRPO لصعوبة التكيف. يغطي المعالجة المسبقة، ميزات FFT، التدريب، التخصيص، والتقييم. في مجموعة بيانات عامة، وصل النموذج الهجين إلى Acc 95.0 / P 93.5 / R 94.6 / F1 94.2 عبر ثلاث طيات منفصلة بين الموضوع.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

غالبا ما يفتقر التعليم الموسيقي التقليدي إلى التفاعل والقدرة على التكيف في الوقت الحقيقي، خاصة في البيئات النائية. تقدم هذه الدراسة إطارا شخصيا للحس الجسدي، TRPO-ResLSTM، لمنصات تعليم الموسيقى. يلتقط النظام الحركة والإيقاع ووقت الاستجابة، ويعالج البيانات مسبقا باستخدام تصفية وينر وتطبيع درجة Z، ويستخرج الميزات عبر FFT. يتم تنفيذ التعرف على الإيماءات بواسطة DeepRes-LSTM، بينما يتم تنظيم الصعوبة التكيفية بواسطة التعلم المعزز TRPO. التعلم التدريجي يضمن التخصيص عبر الجلسات. أظهرت التجارب على مجموعة بيانات إيماءات-إيقاع متاحة للجمهور ومجهولة الهوية (n = 2,730 عينة؛ تقسيم التدريب/التحقق/الاختبار 70/15/15) أداء متفوقا مقارنة بالقواعد متعددة الوسائط، حيث حققت دقة 95٪، ودقة 93.5٪، واستدعاء 94.6٪، و94.2٪ في درجة F1. تؤكد دراسات الاستئصال المساهمات الفردية ل TRPO وRes-LSTM. تكمن ابتكارات هذا البروتوكول في دمج التعلم المعزز مع النمذجة الزمنية المتبقية للتعرف على الإيماءات التكيفي، مما يتيح التعلم المستقر والمخصص. يظهر هذا العمل أن الأدوات التكيفية والمستجيبة للإيماءات يمكن أن تعزز التفاعل والتخصيصا وتطوير المهارات التدريجي في التعليم الموسيقي الذكي. تشمل القيود الاعتماد على مجموعة بيانات واحدة والحاجة إلى التحقق من صحة المتعلم الحقيقي، الذي يحدد اتجاهات العمل المستقبلي.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تعيد التطورات الحديثة في الذكاء الاصطناعي (الذكاء الاصطناعي) وتقنية الحس الجسدي تشكيل تعليم الموسيقى من خلال تمكين المتعلمين من التفاعل مع الموسيقى من خلال حركات الجسد، حيث تترجم الإيماءات إلى نغمات أو إيقاعات أو أدوات تحكم للآلات الافتراضية 1,2. تعزز هذه الميزات التفاعلية التفاعل والاحتفاظ والإبداع مقارنة بالتعليم التقليدي في الصف، كما تتيح أدوات الحس الجسدي للطلاب ممارسة الإيقاع والتنسيق والتعبير من خلال الإيقاع الجسدي، والإيماءات الموسيقية، ومحاكاة الجماعة3. بالاقتران مع المسارات التكيفية المدفوعة بالذكاء الذكاء الاصطناعي، يحصل المتعلمون على محتوى فردي، وتغذية راجعة فورية، وتطوير مهارات تدريجي تحسن الدافع والنتائج4،5.

على الرغم من هذه التطورات، غالبا ما تعتمد المنصات الحالية على وسائل محدودة، أو تفتقر إلى استمرارية التخصيص، أو تفشل في التكيف مع أنماط التعلم الثقافية والجسدية المتنوعة6،7. كما أن الأساليب التقليدية تفشل في تقديم تعديلات قائمة على البيانات في الوقت الحقيقي تعكس تطور قدرات المتعلم. على سبيل المثال، يمكن لأجهزة التقاط الحركة والارتداء توليد مجموعات بيانات غنية لكنها غالبا ما تكون غير مستغلة في التعليمات التكيفية8،9. علاوة على ذلك، رغم أن مكتبات الموسيقى وأنظمة إدارة التعلم قد وسعت سهولة الوصول، إلا أنها نادرا ما توفر تخصيصا ديناميكيا عبر الجلسات، وهو أمر حاسم في سياقات التعلم متعددة الثقافاتومتنوعة 10.

ولمعالجة هذه الفجوات، تقترح هذه الدراسة إطار عمل جديد لسياسة منطقة الثقة المحسنة للذاكرة العميقة المتبقية طويلة الأجل قصيرة المدى (TRPO-ResLSTM) لمنصات تعليم الموسيقى11. يدمج النظام طرق المعالجة المتقدمة المسبقة، بما في ذلك ترشيح وينر وتطبيع درجة Z، مع تحويل فورييه السريع لاستخراج ميزات مجال التردد. يوفر Res-LSTM إدراكا قويا للإيماءات والتسلسلات الزمنية، بينما يقوم التعلم المعزز TRPO بضبط صعوبة المهمة بشكل ديناميكي استجابة لأداء المتعلم. التعلم التدريجي يعزز التخصيص أكثر من خلال تحديث النماذج عبر الجلسات.

أجريت تجارب على مجموعة بيانات الإيماءات والإيقاع في موسيقى كاجل التي تضم 2,730 عينة، مقسمة إلى مجموعات تدريب، وتأكيد، واختبار. تظهر النتائج أن الطريقة المقترحة تتفوق باستمرار على البنى متعددة الوسائط الأساسية، محققة دقة ودقة واستدعاء وقيم F1 في نطاق 93٪-95٪. تؤكد تحليلات الاستئصال فعالية كل من مكونات TRPO وRes-LSTM. من خلال تعزيز دقة الإيقاع، وتفاعل المستخدمين، واستقرار السياسات في الوقت الفعلي، يوفر الإطار حلا عمليا لتحسين كفاءة تعليم الموسيقى في بيئات التعلم عن بعد والموارد محدودة. أبرزت الأعمال ذات الصلة حول التعليم الموسيقي المدفوع الذكاء الاصطناعي إمكانيات التفاعل الحسي الجسدي، وتخصيص التعلم التكيفي، وحتى التطبيقات في العلاج بالموسيقى والتأليف الآلي12,13. تبني هذه الدراسة على هذه النتائج من خلال تقديم بروتوكول قابل للتكرار يجمع بين التعلم المعزز والنمذجة الزمنية العميقة لتطوير مجال التعليم الموسيقي الذكي.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

حللت هذه الدراسة بيانات مجهولة الهوية ومتاحة للجمهور ولم تشمل البشر أو. لذلك، لم تكن هناك حاجة لموافقة أخلاقية إضافية.

1. نظرة عامة

يصف هذا البروتوكول إطارا قابلا للتكرار لتعليم الموسيقى الحسي الجسدي يعتمد على التعرف العميق المتبقي على LSTM وتحسين سياسة منطقة الثقة (TRPO) للتحكم في الصعوبات التكيفي. يشمل إعداد مجموعات البيانات، المعالجة المسبقة، استخراج الميزات في مجال التردد، بنية النماذج، التدريب، التخصيص، والتقييم. يوضح الشكل 1 سير العمل من البداية إلى النهاية14.

2. مجموعة البيانات

تم استخدام مجموعة بيانات إيماءات موسيقية وإيقاع مجهولة الهوية متاحة للجمهور تسجل استجابات الجسم للإشارات السمعية مثل الإيقاع وشدة الإيقاع. توفر مجموعة البيانات بيانات متعددة الوسائط من السلاسل الزمنية مناسبة لدراسة سلوكيات تنفيذ الإيقاع وتعلمها. يحتوي كل سجل على أنماط حركة، توقيت، ومقاييس دقة الإيقاع، وردود فعل الاستجابة، ووقت إكمال المهمة. وبما أن مجموعة البيانات كانت مجهولة الهوية بالكامل ومتاحة للجمهور، لم تكن هناك حاجة لموافقة إضافية من لجنة مراجعة مؤسسية15. بالنسبة للتجارب، تم تقسيم البيانات حسب الموضوع إلى مجموعات تدريب، وتحقق من الصحة، واختبارات لتجنب تسرب الهوية؛ يتم الإبلاغ عن إحصائيات مفصلة ونسب التقسيم في الجدول 1. تم استخدام ثلاث طيات منفصلة للموضوع، وبذور عشوائية ثابتة عبر جميع التشغيلات، ومعالجة مسبقة متطابقة لجميع نماذج النماذج لضمان قابلية المقارنة16.

أظهرت مجموعة البيانات توزيعا متوازنا للإيماءات الإيقاعية، مع تقسيمات التدريب والتحقق والاختبار التي أظهرت تباينا مماثلا في ميزات التوقيت والحركة. كانت الإحصائيات الوصفية (الوسيط ± IQR) لانحراف السرعة وسعة الحركة قابلة للمقارنة عبر الانقسامات، مما يشير إلى انحراف متغير طفيف.

3. معالجة البيانات مسبقا

  1. تطبيع درجة Z
    تم توحيد البيانات الخام باستخدام تطبيع درجة Z. بالنسبة للقناة c والوقت t:
    figure-protocol-1(1)
    حسبنا μc و σc على مجموعة التدريب فقط وطبقناهما على مجموعات التحقق والاختبار لتجنب التسرب17.
    بعد التطبيع، أظهرت جميع القنوات تباين متوسط ووحدة شبه صفر، مما ضمن قابلية المقارنة بين المشاركين. أكدت التشخيصات على دفعة واحدة أنه لا يوجد انحراف بين الطيات.
  2. تصفية الوينر
    لقمع الضوضاء، طبقنا مرشح وينر في مجال التردد:
    figure-protocol-2(2)
    حيث Y(k) هو الطيف المرصود، \hat{X}(k) هو التقدير الخالي من الضوضاء، وSxx(kSnn(k) يدل على كثافات طيفية لطاقة الإشارة/الضوضاء. استخدمنا طول نافذة وتداخل متوافق مع FFT في الأسفل للحفاظ على تماسك الطور18.
    خفض ترشيح الوينر الضوضاء عالية التردد بنسبة ~30٪ مع الاحتفاظ بالمكونات الإيقاعية السائدة. تحسنت نسبة الإشارة إلى الضوضاء دون تخفيف القمم المغلقة بالإيقاع.
  3. استخراج الميزات (FFT)
    تم استخدام ميزات FFT قصيرة الأجل على النوافذ المتداخلة:
    figure-protocol-3(3)
    شملت الواصفات المستخرجة التردد السائد، والتدفق الطيفي، ونسب النطاق-الطاقة. كما تم حساب بروز ذروة القفل الإيقاعي وتقلبات القمم بين القمم لالتقاط استقرار التوقيت الدقيق19.
    كشف اختبار FFT عن قمم طيفية واضحة متوافقة مع الإيقاع الموسيقي (2-3 هرتز)، مما أكد البنية الإيقاعية في مجموعة البيانات. تجاوزت نسب الذروة إلى الضوضاء 6-8 ديسيبل في المتوسط في التجارب المنفذة بشكل صحيح.

4. الطراز: TRPO-ResLSTM

  1. LSTM المتبقي (ResLSTM)
    تم نمذجة الأنماط الزمنية باستخدام نماذج LSTM مكدسة مع اختصارات متبقية:
    figure-protocol-4 (4)
    حيث P هي هوية أو إسقاط يطابق الأبعاد. الاتصالات المتبقية تقلل من الانحدارات المتلاشية وتمكن من تراكمات زمنية أعمق مع الحفاظ على استقرار التدريب20.
    حسنت الوصلات المتبقية تدفق التدرج ودقة التصنيف مقارنة ب LSTM العادي. أظهرت عمليات الاستئصال دقة +0.7-1.1 pp مقارنة بالمراكزات غير المتبقية عند أعداد معلمات مماثلة.
  2. تحسين سياسات منطقة الثقة (TRPO)
    تحكم TRPO في صعوبة المهمة بشكل ديناميكي. المكافأة الشخصية كانت:
    figure-protocol-5(5)
    مع نقاط نجاح st، انحراف الإيقاع Δtempot، اختلاف الإيماءات dt (مثل مسافة DTW أو فقدان التصنيف)، ومؤشر التبديل ut (معاقبة التغيرات المتكررة في الصعوبة). قمنا بتحسين هدف منطقة الثقة مع قيد KL:
    figure-protocol-6(6)
    1. إعداد التعلم المعزز والتدوين
      صيغت الصعوبة التكيفية كخطة MDP ذات الأفق المحدود حيث تجمع الحالة s t ميزات حسية جسدية نافذة (قنوات مقياس التسارع، أوضاع مفاصل اليد، واصفات الإيقاع بعد التطبيع، ترشيح وينر، وFFT)، ويكون الفعل at مستوى صعوبة منفصل يتحكم في تحمل الإيقاع وصرامة الإيماءات. توازن المكافأة rt نجاح المهمة، انحراف التوقيت، والاشتباك، مع عقوبة صغيرة على صعوبة التبديل المفرط لتثبيط التذبذب. تتبع تحديثات السياسات TRPO مع قيد تباعد مع كوالالمبور للخطوات المحافظة. في المعادلات. (5-6)، g(y,x) يرمز إلى تدرج الخسارة الخاص بالمهمة، W(ζ) هو منظم L2 على المعاملات ζ، πθ هو السياسة العشوائية ذات المعاملات θ، DKL يحدد منطقة الثقة، γ عامل الخصم، و δ هو نصف قطر منطقة الثقة. تم اختيار المعاملات الفائقة α، β، γ، δ عبر البحث الشبكي في تقسيم التحقق (النطاقات في الجدول 2) لتحقيق توازن بين الاستقرار والاستجابة؛ تم تفعيل التوقف المبكر عندما وصل متوسط كوالالمبور إلى 0.921.
    2. المنطق مقابل البدائل
      كانت تحديثات TLO المقيدة بسياسة KL مفضلة للدفعات الصغيرة على مستوى الجلسة وسلوك المتعلم غير الثابت؛ تظل PPO/SAC واعدة وسيتم تقييمها في العمل المستقبلي22.
      حقق TRPO تعلما مستقرا وضبط صعوبة أكثر سلاسة من وحدات التحكم الأساسية، مع تقارب مستمر. أظهرت منحنيات التعلم تحسنا أحاديا واستقرارا مبكرا في كينغزال لتربو ريسلستيم مقارنة بخطوط الأساس ذات المكون الواحد.
  3. التخصيص وتحديثات الجلسات
    قامت التحديثات التدريجية بتحسين نماذج ResLSTM وTRPO بعد كل جلسة مستخدم بمعدلات تعلم صغيرة واحتياطيات تدريب. استخدمنا مخزونا صغيرا من التجارب الحديثة لكل متعلم لمنع الانحراف، وقللنا من التحديثات لكل جلسة لميزانية ثابتة للحفاظ على الاستقرار. تم قياس فعالية التخصيص على أنها المكاسب النسبية في F1 بين الجلسة الأولى والأخيرة للمتعلم ضمن أفق ثابت23.
    زاد تخصيص الجلسة من جلسة إلى أخرى من دقة المستخدم الخاصة بنسبة 2٪-3٪ دون حدوث نسيان كارثي. كانت المكاسب الأكبر للمتعلمين ذوي الدقة الأساسية المتوسطة، مما يشير إلى وجود مساحة كبيرة للدعم التكيفي.
  4. الخوارزمية والتنفيذ
    يتم توفير الكود الزائف الكامل ("خوارزمية 1: TRPO-ResLSTM") وتنفيذ مرجعي لبايثون 3.10.1 ك. تتضمن جميع الأشكال والجداول تعريفات القياس، وأشرطة الخطأ، وأحجام العينات. نبلغ عن متوسط ± SD على ثلاث طيات منفصلة بين الشخص ونقيم الفروق بين النماذج باستخدام اختبارات ANOVA أو فريدمان ذات المقاييس المتكررة حسب الاقتضاء، مع مقارنات بعد الحدث المعدلة حسب التعددية (α = 0.05). لضمان قابلية التكرار، ندرج نسخ الحزم ومواصفات GPU/CPU في جدول المواد وندرج ملف README مع تكوين البيئة والبذور24.
    كان البروتوكول يعيد باستمرار إنتاج تحسينات مقارنة بخطوط الأساس متعددة الوسائط، مما يؤكد قابليته للتكرار. أظهرت إعادة التشغيل المستقلة عبر البذور تباين دقيق <0.5 نقطة في النموذج المتكامل.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

الإعداد التجريبي
تم تنفيذ إطار عمل TRPO-ResLSTM في بايثون 3.10.1 مع تسريع وحدة معالجة الرسوميات. بيئة الحوسبة، أجهزة استشعار الحركة، ومكتبات بايثون مدرجة في جدول المواد. تم تقسيم البيانات إلى أقسام تدريب/تحقق/اختبار منفصلة بين الشخص والشخص كما هو موضح في الجدول 1 (15/70/15). يتم تلخيص المعاملات الفائقة الرئيسية في الجدول 2. تم تقييم ثلاثة نماذج: TRPO الأساسي، ResLSTM الأساسي، وTRPO-ResLSTM المتكامل. مكن هذا الإعداد من تقييم متسق للتعر...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقترح هذه الدراسة بروتوكولا هجينا، TRPO-ResLSTM، يدمج التعلم المعزز والنمذجة الزمنية المتبقية لتعليم الموسيقى القائم على الإيماءات. من خلال دمج استقرار تحسين سياسات منطقة الثقة (TRPO) مع قدرة التعلم التسلسلي لنماذج LSTM المتبقية، يوفر الإطار التعرف على الإيماءات في الوقت الحقيقي مع التحكم التكيفي في الصعوبة، مما يمكن من تغذية راجعة شخصية واكتساب المهارات التدريجي25. لضمان قابلية التكرار، تم استخدام طيات منفصلة بين الموضوع، والبذور الثابتة، والمعالجة المسبقة المتطا...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون عدم وجود تضارب مصالح.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يشكر المؤلفون زملاءهم على الملاحظات البناءة حول تصميم الدراسة وتحضير المخطوطات. لم يحصل هذا العمل على منحة محددة من أي جهة تمويل في القطاعات العامة أو التجارية أو غير الربحية.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
بيانات حساس مقياس التسارعكاجل (الملكية العامة)إشارات الإدخال متعددة الوسائط (أنماط الحركة، ميزات التوقيت) المدرجة في مجموعة البيانات
محطة عمل GPUشركة NVIDIA، الولايات المتحدة الأمريكيةأجهزة التدريب: NVIDIA RTX 3080 (10 جيجابايت)، 32 جيجابايت رام (RAM)، أوبونتو 20.04
اليد - بيانات الموضع المشترككاجل (الملكية العامة)المدخلات الحسية الجسدية للتعرف على الإيماءات
ماتبلوتليب (الإصدار 3.7)https://matplotlib.orgمكتبة التصور لرسم الأشكال ومقاييس الأداء
نومباي (الإصدار 1.23)https://numpy.orgمكتبة الحوسبة العددية لعمليات المصفوفة
مجموعة بيانات الإيماءات والإيقاع في الموسيقى العامةكاجل (الملكية العامة)مجموعة بيانات مجهولة الهوية تضم 2,730 عينة تسجل استجابات الجسم للإيقاع والإيقاع؛ يستخدم للتدريب/التحقق/الاختبار (70/15/15)
بايثون 3.10.1مؤسسة بايثون للبرمجيات، https://www.python.orgبيئة البرمجة لتنفيذ النموذج وتحليله
PyTorch (الإصدار 1.13)https://pytorch.orgإطار عمل التعلم العميق لتنفيذ وحدات ResLSTM وTRPO
سيكيت - تعلم (الإصدار 1.2)https://scikit-learn.orgأدوات التعلم الآلي للمعالجة المسبق والتقييم
SciPy (الإصدار 1.10)https://scipy.orgمكتبة الحوسبة العلمية (المستخدمة في تصفية وينر)

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wei, J., Karuppiah, M., Prathik, A. College music education and teaching based on AI techniques. Comput Electr Eng. 100, 107851(2022).
  2. Yu, X., et al. Developments and applications of artificial intelligence in music education. Technol. 11 (2), 42(2023).
  3. Fang, J. Artificial intelligence robots based on machine learning and visual algorithms for interactive experience assistance in music classrooms. Entertain Comput. 52, 100779(2025).
  4. Zhang, S., Lu, X., Liu, X. Study on the influence of AI composition software on students' creative ability in music education. J Educ Technol Innov. 6 (2), (2024).
  5. Feng, Y. Design and research of music teaching system based on virtual reality system in the context of education informatization. PLoS One. 18 (10), e0285331(2023).
  6. Zhou, X. Entertainment performance robots application in music network classrooms based on speech sensor recognition and artificial intelligence. Entertain Comput. 52, 100782(2025).
  7. Yu, H., Zou, Z. The music education and teaching innovation using blockchain technology supported by artificial intelligence. Int J Grid Util Comput. 14 (2-3), 278-296 (2023).
  8. Hong Yun, Z., et al. A decision-support system for assessing the function of machine learning and artificial intelligence in music education for network games. Soft Comput. 26 (20), 11063-11075 (2022).
  9. Dey, M. T., Patra, S., Mitra, S. Enhancing music education with innovative tools and techniques: The role of artificial intelligence in musical works. Enhancing Music Education With Innovative Tools and Techniques. , IGI Global. 19-50 (2025).
  10. Lin, X., et al. The application of music therapy in the rehabilitation education of children with cerebral palsy. J Investig Med. 73 (1 Suppl. 1), (2025).
  11. Wang, X. Design of vocal music teaching system platform for music majors based on artificial intelligence. Wirel Commun Mob Comput. 2022 (1), 5503834(2022).
  12. Chen, Y., Sun, Y. The usage of artificial intelligence technology in music education system under deep learning. IEEE Access. , 130546-130556 (2024).
  13. Yang, Y., et al. Multi-source and heterogeneous online music education mechanism: An artificial intelligence-driven approach. Fractals. 31 (6), 2340154(2023).
  14. Sang, J. The intersection of technology and art: A study on AI-driven CTCL music teaching paradigm. , (2024).
  15. Yin, Y. Research on technological innovation and application of music education transformation under the background of technology. J Educ Theory Pract. 2 (2), (2025).
  16. Yuan, Y. Influencing factors and modeling methods of vocal music teaching quality supported by artificial intelligence technology. Int J Web Based Learn Teach Technol. 19 (1), 1-16 (2024).
  17. Sanganeria, M., Gala, R. Tuning music education: AI-powered personalization in learning music. arXiv Prepr. , (2024).
  18. Qiusi, M. Research on the improvement method of music education level under the background of AI technology. Mob Inf Syst. 2022 (1), 7616619(2022).
  19. Xu, Z. Construction of an intelligent recognition and learning education platform of national music genre under deep learning. Front Psychol. 13, 843427(2022).
  20. Wang, X., et al. College music teaching and ideological and political education integration mode based on deep learning. J Intell Syst. 31 (1), 466-476 (2022).
  21. Tang, H., Zhang, Y., Zhang, Q. The use of deep learning-based intelligent music signal identification and generation technology in national music teaching. Front Psychol. 13, 762402(2022).
  22. Artificial intelligence in music education: Exploring applications, benefits, and challenges. Yue, Y., Jing, Y. Proc Int Conf Educ Inf Technol, , 141-146 (2025).
  23. Bai, A., Yeh, C. K., Hsieh, C. J., Taly, A. An efficient rehearsal scheme for catastrophic forgetting mitigation during multi-stage fine-tuning. arXiv Prepr. , (2024).
  24. Ravi, N., Goel, A., Davis, J. C., Thiruvathukal, G. K. Improving the reproducibility of deep learning software: An initial investigation through a case study analysis. arXiv Prepr. , (2025).
  25. Chen, J., Jin, F., Jiao, Y., Zhan, Y., Qin, X. Improving dynamic gesture recognition with attention-enhanced LSTM and grounding SAM. Electronics. 14 (9), 1793(2025).
  26. Ouyang, F., Dai, X., Chen, S. Applying multimodal learning analytics to examine the immediate and delayed effects of instructor scaffoldings on small groups' collaborative programming. Int J STEM Educ. 9 (1), 45(2022).
  27. Aoyama Lawrence,, Weinberger, L., A, Being in-sync: A multimodal framework on the emotional and cognitive synchronization of collaborative learners. Front Educ. , (2022).
  28. Schulman, J., Wolski, F., Dhariwal, P., Radford, A., Klimov, O. Proximal policy optimization algorithms. arXiv Prepr. , (2017).
  29. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor. PMLR. Haarnoja, T., Zhou, A., Abbeel, P., Levine, S. Proc Int Conf Mach Learn, , (2018).
  30. Huang, S., Dossa, R. F. J., Raffin, A., Kanervisto, A., Wang, W. The 37 implementation details of proximal policy optimization. ICLR Blog Track. , https://iclr-blog-track.github.io/2022/03/25/ppo-implementation-details/ (2023).
  31. Sclater, N., Bailey, P. Code of practice for learning analytics. , https://www.jisc.ac.uk/guides/code-of-practice-for-learning-analytics (2022).
  32. Rabiner, L. R. A tutorial on hidden Markov models and selected applications in speech recognition. Proc IEEE. 77 (2), 257-286 (2002).
  33. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).
  34. Proverbio, A. M., Camporeale, E., Brusa, A. Multimodal recognition of emotions in music and facial expressions. Front Hum Neurosci. 14, 32(2025).
  35. Kang, S. Adaptations, code-switching, and novelty with cultural integrity: Musicians performing and learning musical instruments in different musical traditions. J Res Music Educ. , (2025).
  36. Han, Y., Han, L., Zeng, C., Zhao, W. The innovation path of VR technology integration into music classroom teaching in colleges and universities. Sci Rep. 15 (1), 12200(2025).
  37. Huang, A. Y., Lu, O. H., Yang, S. J. Effects of artificial intelligence-enabled personalized recommendations on learners' learning engagement, motivation, and outcomes in a flipped classroom. Comput Educ. 194, 104684(2023).
  38. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Intelligent Music EducationSomatosensory EvaluationGesture RecognitionRhythm EvaluationTRPO Reinforcement LearningResLSTM ModelAdaptive DifficultyIncremental LearningFeature ExtractionPersonalized Learning

Related Articles