Research Article

Rozwój interaktywnych narzędzi sztucznej inteligencji do spersonalizowanej oceny somatosensorycznej i rytmicznej w inteligentnych platformach edukacji muzycznej

DOI:

10.3791/69058

December 19th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie przedstawia powtarzalny protokół somatosensorycznego uczenia muzyki łączący resztkowe rozpoznawanie LSTM z TRPO dla adaptacyjnej trudności. Obejmuje wstępne przetwarzanie, funkcje FFT, szkolenia, personalizację i ocenę. Na publicznym zbiorze danych model hybrydowy osiągnął Acc 95.0 / P 93.5 / R 94.6 / F1 94.2 w trzech fałdach podmiotowo-rozłącznych.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tradycyjna edukacja muzyczna często nie jest interaktywna i adaptacyjna w czasie rzeczywistym, zwłaszcza w warunkach zdalnych. Niniejsze badanie wprowadza spersonalizowany system somatosensoryczny, TRPO-ResLSTM, dla platform edukacji muzycznej. System rejestruje ruch, rytm i czas odpowiedzi, wstępnie przetwarza dane za pomocą filtrowania Wienera i normalizacji Z-score oraz wyodrębnia cechy za pomocą FFT. Rozpoznawanie gestów jest realizowane przez DeepRes-LSTM, natomiast trudności adaptacyjne regulowane są przez uczenie ze wzmocnieniem TRPO. Stopniowe uczenie się zapewnia personalizację na różnych sesjach. Eksperymenty na publicznie dostępnym, anonimowym zbiorze danych dotyczących rytmu gestów (n = 2 730 próbek; podział trening/walidacja/test 70/15/15) wykazały lepsze wyniki w porównaniu z bazami multimodalnymi, osiągając 95% dokładności, 93,5% precyzji, 94,6% przypomnienia oraz 94,2% wyniku F1. Badania ablacji potwierdzają indywidualny wkład TRPO i Res-LSTM. Innowacją tego protokołu jest integracja uczenia ze wzmocnieniem z modelowaniem czasowym dla adaptacyjnego rozpoznawania gestów, umożliwiając stabilne, a jednocześnie spersonalizowane uczenie się. Prace te pokazują, że adaptacyjne, reagujące na gesty narzędzia mogą zwiększyć zaangażowanie, personalizację oraz stopniowy rozwój umiejętności w inteligentnej edukacji muzycznej. Ograniczenia obejmują poleganie na jednym zbiorze danych oraz konieczność weryfikacji przez prawdziwego ucznia, która definiuje kierunki przyszłej pracy.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Najnowsze osiągnięcia w dziedzinie sztucznej inteligencji (AI) i technologii somatosensorycznej przekształcają edukację muzyczną, umożliwiając uczniom interakcję z muzyką poprzez ruchy ciała, gdzie gesty są tłumaczone na nuty, rytmy lub sterowanie dla instrumentów wirtualnych 1,2. Te interaktywne funkcje zwiększają zaangażowanie, zapamiętywanie i kreatywność w porównaniu do tradycyjnej nauki w klasie, a narzędzia somatosensoryczne pozwalają uczniom ćwiczyć rytm, koordynację i ekspresję poprzez perkusję ciała, gesty dyrygujące i symulacje zespołowe3. W połączeniu z adaptacyjnymi ścieżkami opartymi na AI, uczniowie otrzymują indywidualne treści, informację zwrotną w czasie rzeczywistym oraz stopniowy rozwój umiejętności, które poprawiają motywację i wyniki 4,5.

Pomimo tych rozwojów, istniejące platformy często polegają na ograniczonych metodach, brakuje im ciągłości personalizacji lub nie potrafią dostosować się do różnorodnych stylów uczenia się kulturowego i fizycznego 6,7. Tradycyjne podejścia również nie dostatecznie dostarczają w czasie rzeczywistym, opartych na danych dostosowaniach, które odzwierciedlają ewoluujące zdolności ucznia. Na przykład motion capture i urządzenia noszone mogą generować bogate zbiory danych, ale często są niedostatecznie wykorzystywane w adaptacyjnej instrukcji 8,9. Ponadto, choć biblioteki muzyczne i systemy zarządzania nauczaniem zwiększają dostępność, rzadko zapewniają dynamiczną personalizację między sesjami, co jest kluczowe w wielokulturowych i heterogenicznych kontekstach nauczania10.

Aby wypełnić te luki, niniejsze badanie proponuje nowatorskie ramy Trust Region Policy Optimized Deep Residual Long Short-Term Memory (TRPO-ResLSTM) dla platform edukacji muzycznej11. System integruje zaawansowane metody wstępnego przetwarzania, w tym filtrowanie Wienera i normalizację Z-score, z szybką transformatą Fouriera do ekstrakcji cech w dziedzinie częstotliwości. Res-LSTM zapewnia solidne rozpoznawanie gestów i sekwencji czasowych, podczas gdy uczenie ze wzmocnieniem TRPO dynamicznie dostosowuje trudność zadania w odpowiedzi na wyniki ucznia. Uczenie się stopniowe dodatkowo wzmacnia personalizację poprzez aktualizację modeli na różnych sesjach.

Przeprowadzono eksperymenty na zbiorze danych Kaggle dotyczącym gestów i rytmów muzyki obejmującej 2 730 próbek, podzielonych na podzbiory treningowe, walidacyjne i testowe. Wyniki pokazują, że proponowana metoda konsekwentnie przewyższa bazowe architektury multimodalne, osiągając dokładność, precyzję, przypomnienie oraz wartości F1 w zakresie 93%-95%. Analizy ablacji potwierdzają skuteczność zarówno komponentów TRPO, jak i Res-LSTM. Poprzez zwiększenie dokładności rytmu, zaangażowania użytkowników i stabilności polityki w czasie rzeczywistym, ramy te stanowią praktyczne rozwiązanie poprawiające efektywność edukacji muzycznej w środowiskach nauki o ograniczonych zasobach i zdalnych. Powiązane prace nad edukacją muzyczną opartą na AI podkreśliły potencjał zaangażowania somatosensorycznego, adaptacyjnej personalizacji uczenia się, a nawet zastosowań w terapii muzycznej i zautomatyzowanej kompozycji12,13. Badanie rozwija te ustalenia, oferując powtarzalny protokół łączący uczenie ze wzmocnieniem z głębokim modelowaniem czasowym, aby rozwijać dziedzinę inteligentnej edukacji muzycznej.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie to analizowało anonimizowane, publicznie dostępne dane i nie obejmowało ludzi ani zwierząt. Dlatego nie było wymagane dodatkowe zatwierdzenie etyczne.

1. Przegląd

Protokół ten opisuje powtarzalne ramy edukacji muzycznej somatosensorycznej oparte na głębokim rozpoznawaniu LSTM oraz optymalizacji polityki regionu zaufania (TRPO) dla adaptacyjnej kontroli trudności. Obejmuje przygotowanie zbiorów danych, wstępne przetwarzanie, ekstrakcję cech w dziedzinie częstotliwości, architekturę modeli, szkolenie, personalizację oraz ocenę. Rysunek 1 ilustruje proces od początku do końca14.

2. Zbiór danych

Wykorzystano publicznie dostępny, zanonimizowany zestaw danych dotyczących gestów i rytmów muzycznych, który rejestruje reakcje ciała na bodźce słuchowe, takie jak tempo i intensywność uderzenia. Zbiór danych dostarcza wielomodalnych szeregów czasowych odpowiednich do badania wykonywania rytmu i zachowań uczenia się. Każdy rekord zawiera wzorce ruchu, miary dokładności czasu i rytmu, informacje zwrotne oraz czas wykonania zadania. Ponieważ zbiór danych był w pełni zanonimizowany i publicznie dostępny, nie wymagano dodatkowej zatwierdzania przez instytucjonalną komisję przeglądową15. W eksperymentach dane były podzielone według badanego na podzbiory treningowe, walidacyjne i testowe, aby uniknąć wycieku tożsamości; szczegółowe statystyki i wskaźniki podziału przedstawione są w Tabeli 1. Zastosowano trzy fałdy podmiotowo-rozłączne, stałe losowe nasiona we wszystkich seriach oraz identyczne wstępne opracowanie dla wszystkich wariantów modelu, aby zapewnić porównywalność16.

Zbiór danych dał zrównoważony rozkład gestów rytmicznych, a partycje treningowe, walidacyjne i testowe wykazywały porównywalną zmienność w zakresie czasu i cech ruchu. Statystyki opisowe (mediana ± IQR) dotyczące odchylenia tempa i amplitudy ruchu były porównywalne we wszystkich podziałach, wskazując na minimalne przesunięcie kowarianu.

3. Wstępne przetwarzanie danych

  1. Normalizacja wyniku Z
    Dane surowe zostały standaryzowane za pomocą normalizacji Z-score. Dla kanału c i czasu t:
    figure-protocol-1    (1)
    Obliczyliśmy μc i σc tylko na zbiorze treningowym i zastosowaliśmy je do zestawów walidacyjnych i testowych, aby uniknąć wycieku17.
    Po normalizacji wszystkie kanały wykazały niemal zerową średnią i wariancję jednostkową, co zapewniło porównywalność między uczestnikami. Diagnostyka w poszczególnych partiach potwierdziła brak dryfu między fałdami.
  2. Filtrowanie Wienera
    Aby stłumić szumy, zastosowaliśmy filtr Wienera w dziedzinie częstotliwości:
    figure-protocol-2     (2)
    gdzie Y(k) to obserwowane widmo, \hat{X}(k) to szacunek z zaciemnienia, a Sxx(k), Snn(k) oznaczają gęstość spektralną mocy sygnału/szumu. Użyliśmy długości okna i nakładania się zgodnej z dalszą FFT, aby utrzymać koherencję fazową18.
    Filtrowanie Wienera zmniejszyło szum wysokich częstotliwości o ~30%, zachowując dominujące składniki rytmiczne. Stosunek sygnału do szumu poprawił się bez tłumienia szczytów zablokowanych na uderzenie.
  3. Ekstrakcja cech (FFT)
    Funkcje krótkoterminowe FFT były stosowane na nakładających się oknach:
    figure-protocol-3    (3)
    Wyodrębniono deskryptory obejmujące częstotliwość dominującą, strumień spektralny oraz stosunki energii pasmowej. Obliczono również tempo-blokowaną prominencję szczytową oraz zmienność między szczytami, aby uchwycić stabilność mikro-timingu19.
    FFT ujawnił wyraźne szczyty spektralne zgodne z tempem muzycznym (2-3 Hz), potwierdzając strukturę rytmiczną w zbiorze danych. Stosunek szczytu do szumu przekroczył średnio 6-8 dB w poprawnie przeprowadzonych próbach.

4. Model: TRPO-ResLSTM

  1. Resztkowy LSTM (ResLSTM)
    Wzorce czasowe modelowano za pomocą ułożonych LSTM z rezydualnymi skrótami:
    figure-protocol-4 (4)
    gdzie P jest jednostką lub projekcją dopasowaną do wymiarów. Połączenia resztkowe łagodzą zanikające gradienty i umożliwiają głębsze stosy czasowe, jednocześnie zachowując stabilność treningu20.
    Połączenia resztkowe poprawiły przepływ gradientowy i dokładność klasyfikacji w porównaniu do zwykłego LSTM. Ablacje wykazały dokładność +0,7-1,1 pp w porównaniu ze stosami nierezydualnymi przy porównywalnych parametrach.
  2. Optymalizacja polityki regionu zaufania (TRPO)
    TRPO kontrolowało trudność zadania dynamicznie. Spersonalizowana nagroda to:
    figure-protocol-5   (5)
    z wynikiem sukcesu st, odchyleniem tempa Δtempot, różnicą gestów dt (np. dystansem DTW lub utratą klasyfikacji) oraz wskaźnikiem zmiany ut (karzącym częste zmiany trudności). Zoptymalizowaliśmy cel regionu zaufania z ograniczeniem KL:
    figure-protocol-6    (6)
    1. Układ i notacja uczenia ze wzmocnieniem
      Trudność adaptacyjna została sformułowana jako MDP z horyzontem skończonym, w którym stan st agreguje okna cechy somatosensoryczne (kanały akcelerometru, pozycje stawów dłoni, deskryptory rytmu po normalizacji, filtrowanie Wienera i FFT), a działanie a t to dyskretny poziom trudności kontrolujący tolerancję tempa i rygorystyczność gestów. Nagroda równoważy sukces zadania, odchylenie czasu i zaangażowanie, z niewielką karą za nadmierne trudności przełączania, aby zniechęcić do oscylacji. Aktualizacje polityki następują po TRPO z ograniczeniem rozbieżności KL dla kroków konserwatywnych. W równaniach. (5-6), g(y,x) oznacza specyficzny dla zadania gradient strat, W(ζ) to regularyzator L2 nad parametrami ζ, πθ to polityka stochastyczna z parametrami θ, DKL definiuje obszar zaufania, γ to współczynnik dyskontowy, a δ to promień obszaru zaufania. Hiperparametry α, β, γ, δ zostały wybrane za pomocą wyszukiwania siatki na podziale walidacyjnym (zakresy w Tabeli 2), aby zrównoważyć stabilność i responsywność; wczesne zatrzymanie nastąpiło, gdy średnia KL osiągnęła 0,921.
    2. Uzasadnienie kontra alternatywy
      Aktualizacje TRPO ograniczone polityką były preferowane dla małych, sesyjnych partii i niestacjonarnych zachowań uczniów; PPO/SAC pozostają obiecujące i będą analizowane w przyszłych badaniach22.
      TRPO osiągnęło stabilne uczenie się i płynniejszą regulację trudności niż kontrolery bazowe, z konsekwentną zbieżnością. Krzywe uczenia się wykazały monotoniczną poprawę i wcześniejszą stabilizację KL dla TRPO-ResLSTM w porównaniu do bazowych jednoskładnikowych.
  3. Personalizacja i aktualizacje sesji
    Aktualizacje stopniowe udoskonalają modele ResLSTM i TRPO po każdej sesji użytkownika, wprowadzając niewielkie tempo uczenia i prób. Wykorzystaliśmy niewielki bufor próbny z ostatnimi próbami na każdego ucznia, aby zapobiec dryfom, oraz ograniczyliśmy aktualizacje na sesję do stałego budżetu, aby zachować stabilność. Skuteczność personalizacji mierzono jako względny wzrost w F1 między pierwszą a ostatnią sesją uczącego się w ramach stałego horyzontu23.
    Personalizacja sesja po sesji zwiększyła dokładność użytkownika o 2%-3% bez katastrofalnego zapominania. Największe zyski były u uczniów z dokładnością bazową w średnim zakresie, co sugeruje większą rezerwę na adaptacyjne rusztowania.
  4. Algorytm i implementacja
    Pełny pseudokod ("Algorytm 1: TRPO-ResLSTM") oraz referencyjna implementacja Pythona 3.10.1 są udostępnione jako. Wszystkie rysunki i tabele zawierają definicje pomiarów, słupki błędów oraz wielkość prób. Średnią ± SD raportujemy w trzech fałdach rozdzielonych z podmiotem i oceniamy różnice między modelami za pomocą powtarzalnych testów ANOVA lub Friedmana, w razie potrzeby stosując porównania po-hoc o wielokrotność (α = 0,05). Aby zapewnić powtarzalność, w Tabeli Materiałów wymieniamy wersje pakietów i specyfikacje GPU/CPU oraz dołączamy README z konfiguracją środowiska i seed24.
    Protokół konsekwentnie odtwarzał ulepszenia względem bazowych multimodalnych, potwierdzając jego powtarzalność. Niezależne powtórki nasion dały <0,5 pp odchylenia dokładności dla modelu zintegrowanego.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Układ eksperymentalny
Framework TRPO-ResLSTM został zaimplementowany w Pythonie 3.10.1 z akceleracją GPU. Środowisko obliczeniowe, sprzęt do wykrywania ruchu oraz biblioteki Pythona są wymienione w Tabeli Materiałów. Dane zostały podzielone na podzielone na podmiot-rozłączne podziały treningowe/walidacyjne/testowe, jak pokazano w Tabeli 1 (70/15/15). Kluczowe hiperparametry podsumowano w Tabeli 2. Oceniono trzy modele: bazowe TRPO, bazowe ResLSTM oraz zintegrowany T...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie proponuje hybrydowy protokół TRPO-ResLSTM, który integruje uczenie ze wzmocnieniem oraz modelowanie czasowe resztkowe w edukacji muzycznej opartej na gestach. Łącząc stabilność optymalizacji polityki regionu zaufania (TRPO) z możliwością uczenia sekwencji pozostałych LSTM, ramy zapewniają rozpoznawanie gestów w czasie rzeczywistym wraz z adaptacyjną kontrolą trudności, umożliwiając spersonalizowaną informację zwrotną i stopniowe zdobywanie umiejętności25. Aby zapewnić powtarzalno...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują brak konfliktu interesów.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy dziękują swoim kolegom za konstruktywne uwagi dotyczące projektu badania i przygotowania manuskryptu. Prace te nie otrzymały żadnego konkretnego grantu od żadnej agencji finansującej z sektora publicznego, komercyjnego ani non-profit.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Dane z czujnika akcelerometruKaggle (domena publiczna)Multimodalne sygnały wejściowe (wzorce ruchu, cechy czasowe) zawarte w zbiorze danych
Stacja robocza GPUNVIDIA Corporation, USASprzęt treningowy: NVIDIA RTX 3080 (10 GB), 32 GB RAM, Ubuntu 20.04
Dane pozycji ręki i stawuKaggle (domena publiczna)Bodźce somatosensoryczne do rozpoznawania gestów
Matplotlib (v3.7)https://matplotlib.orgBiblioteka wizualizacji do wykresów danych i metryk wydajności
NumPy (wersja 1.23)https://numpy.orgBiblioteka obliczeń numerycznych dla operacji z tablicami
Publiczna zbiór danych o gestach i rytmie muzyki publicznejKaggle (domena publiczna)Zanonimizowany zbiór danych zawierający 2 730 próbek rejestrujących reakcje ciała na tempo i rytm; Wykorzystywane do treningu/walidacji/testowania (70/15/15)
Python 3.10.1Python Software Foundation, https://www.python.orgŚrodowisko programistyczne do implementacji i analizy modeli
PyTorch (wersja 1.13)https://pytorch.orgRamy głębokiego uczenia do implementacji modułów ResLSTM i TRPO
SCikit - Learn (wersja 1.2)https://scikit-learn.orgNarzędzia uczenia maszynowego do wstępnego przetwarzania i oceny
SciPy (wersja 1.10)https://scipy.orgBiblioteka obliczeń naukowych (używana do filtrowania Wienera)

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wei, J., Karuppiah, M., Prathik, A. College music education and teaching based on AI techniques. Comput Electr Eng. 100, 107851(2022).
  2. Yu, X., et al. Developments and applications of artificial intelligence in music education. Technol. 11 (2), 42(2023).
  3. Fang, J. Artificial intelligence robots based on machine learning and visual algorithms for interactive experience assistance in music classrooms. Entertain Comput. 52, 100779(2025).
  4. Zhang, S., Lu, X., Liu, X. Study on the influence of AI composition software on students' creative ability in music education. J Educ Technol Innov. 6 (2), (2024).
  5. Feng, Y. Design and research of music teaching system based on virtual reality system in the context of education informatization. PLoS One. 18 (10), e0285331(2023).
  6. Zhou, X. Entertainment performance robots application in music network classrooms based on speech sensor recognition and artificial intelligence. Entertain Comput. 52, 100782(2025).
  7. Yu, H., Zou, Z. The music education and teaching innovation using blockchain technology supported by artificial intelligence. Int J Grid Util Comput. 14 (2-3), 278-296 (2023).
  8. Hong Yun, Z., et al. A decision-support system for assessing the function of machine learning and artificial intelligence in music education for network games. Soft Comput. 26 (20), 11063-11075 (2022).
  9. Dey, M. T., Patra, S., Mitra, S. Enhancing music education with innovative tools and techniques: The role of artificial intelligence in musical works. Enhancing Music Education With Innovative Tools and Techniques. , IGI Global. 19-50 (2025).
  10. Lin, X., et al. The application of music therapy in the rehabilitation education of children with cerebral palsy. J Investig Med. 73 (1 Suppl. 1), (2025).
  11. Wang, X. Design of vocal music teaching system platform for music majors based on artificial intelligence. Wirel Commun Mob Comput. 2022 (1), 5503834(2022).
  12. Chen, Y., Sun, Y. The usage of artificial intelligence technology in music education system under deep learning. IEEE Access. , 130546-130556 (2024).
  13. Yang, Y., et al. Multi-source and heterogeneous online music education mechanism: An artificial intelligence-driven approach. Fractals. 31 (6), 2340154(2023).
  14. Sang, J. The intersection of technology and art: A study on AI-driven CTCL music teaching paradigm. , (2024).
  15. Yin, Y. Research on technological innovation and application of music education transformation under the background of technology. J Educ Theory Pract. 2 (2), (2025).
  16. Yuan, Y. Influencing factors and modeling methods of vocal music teaching quality supported by artificial intelligence technology. Int J Web Based Learn Teach Technol. 19 (1), 1-16 (2024).
  17. Sanganeria, M., Gala, R. Tuning music education: AI-powered personalization in learning music. arXiv Prepr. , (2024).
  18. Qiusi, M. Research on the improvement method of music education level under the background of AI technology. Mob Inf Syst. 2022 (1), 7616619(2022).
  19. Xu, Z. Construction of an intelligent recognition and learning education platform of national music genre under deep learning. Front Psychol. 13, 843427(2022).
  20. Wang, X., et al. College music teaching and ideological and political education integration mode based on deep learning. J Intell Syst. 31 (1), 466-476 (2022).
  21. Tang, H., Zhang, Y., Zhang, Q. The use of deep learning-based intelligent music signal identification and generation technology in national music teaching. Front Psychol. 13, 762402(2022).
  22. Artificial intelligence in music education: Exploring applications, benefits, and challenges. Yue, Y., Jing, Y. Proc Int Conf Educ Inf Technol, , 141-146 (2025).
  23. Bai, A., Yeh, C. K., Hsieh, C. J., Taly, A. An efficient rehearsal scheme for catastrophic forgetting mitigation during multi-stage fine-tuning. arXiv Prepr. , (2024).
  24. Ravi, N., Goel, A., Davis, J. C., Thiruvathukal, G. K. Improving the reproducibility of deep learning software: An initial investigation through a case study analysis. arXiv Prepr. , (2025).
  25. Chen, J., Jin, F., Jiao, Y., Zhan, Y., Qin, X. Improving dynamic gesture recognition with attention-enhanced LSTM and grounding SAM. Electronics. 14 (9), 1793(2025).
  26. Ouyang, F., Dai, X., Chen, S. Applying multimodal learning analytics to examine the immediate and delayed effects of instructor scaffoldings on small groups' collaborative programming. Int J STEM Educ. 9 (1), 45(2022).
  27. Aoyama Lawrence,, Weinberger, L., A, Being in-sync: A multimodal framework on the emotional and cognitive synchronization of collaborative learners. Front Educ. , (2022).
  28. Schulman, J., Wolski, F., Dhariwal, P., Radford, A., Klimov, O. Proximal policy optimization algorithms. arXiv Prepr. , (2017).
  29. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor. PMLR. Haarnoja, T., Zhou, A., Abbeel, P., Levine, S. Proc Int Conf Mach Learn, , (2018).
  30. Huang, S., Dossa, R. F. J., Raffin, A., Kanervisto, A., Wang, W. The 37 implementation details of proximal policy optimization. ICLR Blog Track. , https://iclr-blog-track.github.io/2022/03/25/ppo-implementation-details/ (2023).
  31. Sclater, N., Bailey, P. Code of practice for learning analytics. , https://www.jisc.ac.uk/guides/code-of-practice-for-learning-analytics (2022).
  32. Rabiner, L. R. A tutorial on hidden Markov models and selected applications in speech recognition. Proc IEEE. 77 (2), 257-286 (2002).
  33. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).
  34. Proverbio, A. M., Camporeale, E., Brusa, A. Multimodal recognition of emotions in music and facial expressions. Front Hum Neurosci. 14, 32(2025).
  35. Kang, S. Adaptations, code-switching, and novelty with cultural integrity: Musicians performing and learning musical instruments in different musical traditions. J Res Music Educ. , (2025).
  36. Han, Y., Han, L., Zeng, C., Zhao, W. The innovation path of VR technology integration into music classroom teaching in colleges and universities. Sci Rep. 15 (1), 12200(2025).
  37. Huang, A. Y., Lu, O. H., Yang, S. J. Effects of artificial intelligence-enabled personalized recommendations on learners' learning engagement, motivation, and outcomes in a flipped classroom. Comput Educ. 194, 104684(2023).
  38. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Intelligent Music EducationSomatosensory EvaluationGesture RecognitionRhythm EvaluationTRPO Reinforcement LearningResLSTM ModelAdaptive DifficultyIncremental LearningFeature ExtractionPersonalized Learning

Related Articles