Research Article

Desenvolvimento de Ferramentas Interativas de Inteligência Artificial para Avaliação Somatossensorial e Rítmica Personalizada em Plataformas Inteligentes de Educação Musical

DOI:

10.3791/69058

December 19th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo apresenta um protocolo somatossensorial reprodutível de aprendizagem musical que combina reconhecimento residual de LSTM com TRPO para dificuldade adaptativa. Ele abrange pré-processamento, recursos de FFT, treinamento, personalização e avaliação. Em um conjunto de dados público, o modelo híbrido alcançou Acc 95.0 / P 93.5 / R 94.6 / F1 94.2 em três dobras disjuntas entre sujeito.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A educação musical tradicional frequentemente carece de interatividade e adaptabilidade em tempo real, especialmente em ambientes remotos. Este estudo introduz uma estrutura somatossensorial personalizada, TRPO-ResLSTM, para plataformas de educação musical. O sistema captura movimento, ritmo e tempo de resposta, pré-processa dados com filtragem de Wiener e normalização Z-score, e extrai características via FFT. O reconhecimento de gestos é realizado pelo DeepRes-LSTM, enquanto a dificuldade adaptativa é regulada pelo aprendizado por reforço TRPO. O aprendizado incremental garante personalização ao longo das sessões. Experimentos em um conjunto de dados de ritmo gestual anonimizado e disponível publicamente (n = 2.730 amostras; divisão de treinamento/validação/teste 70/15/15) mostram desempenho superior em linhas de base multimodais, alcançando 95% de precisão, 93,5% de precisão, 94,6% de recordação e 94,2% de pontuação F1. Estudos de ablação confirmam as contribuições individuais do TRPO e do Res-LSTM. A inovação desse protocolo está na integração do aprendizado por reforço com modelagem temporal residual para reconhecimento adaptativo de gestos, permitindo um aprendizado estável, porém personalizado. Este trabalho demonstra que ferramentas adaptativas e responsivas a gestos podem aumentar o engajamento, a personalização e o desenvolvimento progressivo de habilidades na educação musical inteligente. As limitações incluem a dependência de um único conjunto de dados e a necessidade de validação real do aprendiz, que define direções para trabalhos futuros.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Avanços recentes em inteligência artificial (IA) e tecnologia somatossensorial estão remodelando a educação musical ao permitir que os alunos interajam com a música por meio de movimentos corporais, onde gestos são traduzidos em notas, ritmos ou controles para instrumentosvirtuais 1,2. Esses recursos interativos aumentam o engajamento, a retenção e a criatividade em comparação com a instrução tradicional em sala de aula, e as ferramentas somatossensoriais permitem que os alunos pratiquem ritmo, coordenação e expressão por meio de percussão corporal, gestos de condução e simulações de conjunto3. Combinado com caminhos adaptativos impulsionados por IA, os aprendizes recebem conteúdo individualizado, feedback em tempo real e desenvolvimento progressivo de habilidades que melhoram a motivação e os resultados 4,5.

Apesar desses desenvolvimentos, as plataformas existentes frequentemente dependem de modalidades limitadas, carecem de continuidade de personalização ou não se adaptam a diversos estilos culturais e físicosde aprendizagem 6,7. Abordagens tradicionais também falham em entregar ajustes em tempo real e baseados em dados que reflitam as capacidades em evolução do aprendiz. Por exemplo, captura de movimento e dispositivos vestíveis podem gerar conjuntos de dados ricos, mas frequentemente são subutilizados em instruçõesadaptativas 8,9. Além disso, embora bibliotecas musicais e sistemas de gestão de aprendizagem tenham ampliado a acessibilidade, raramente oferecem personalização dinâmica entre sessões, o que é fundamental em contextos de aprendizagem multiculturais eheterogêneos 10.

Para suprir essas lacunas, este estudo propõe uma nova estrutura TRPO-ResLSTM (TRPO-ResLSTM) para plataformas de educaçãomusical 11. O sistema integra métodos avançados de pré-processamento, incluindo filtragem de Wiener e normalização Z-score, com a Transformada Rápida de Fourier para extração de características no domínio da frequência. Res-LSTM oferece reconhecimento robusto de gestos e sequências temporais, enquanto o aprendizado por reforço TRPO ajusta dinamicamente a dificuldade da tarefa em resposta ao desempenho do aprendiz. O aprendizado incremental fortalece ainda mais a personalização ao atualizar modelos entre sessões.

Experimentos foram realizados com o conjunto de dados de gestos musicais e ritmos do Kaggle, que compreende 2.730 amostras, divididos em subconjuntos de treinamento, validação e teste. Os resultados mostram que o método proposto supera consistentemente as arquiteturas multimodais básicas, alcançando precisão, precisão, recordação e valores de F1 na faixa de 93% a 95%. Análises de ablação confirmam a eficácia tanto dos componentes TRPO quanto dos Res-LSTM. Ao aumentar a precisão do ritmo, o engajamento do usuário e a estabilidade das políticas em tempo real, o framework oferece uma solução prática para melhorar a eficiência da educação musical em ambientes de ensino remoto e com recursos limitados. Trabalhos relacionados à educação musical impulsionada por IA destacaram o potencial do engajamento somatossensorial, personalização de aprendizagem adaptativa e até aplicações em musicoterapia e composiçãoautomatizada 12,13. Este estudo se baseia nessas descobertas ao oferecer um protocolo reproduzível que combina aprendizado por reforço com modelagem temporal profunda para avançar o campo da educação musical inteligente.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo analisou dados anonimizados e públicos e não envolveu indivíduos humanos ou animais. Portanto, não era necessária aprovação ética adicional.

1. Visão geral

Este protocolo descreve uma estrutura reprodutível para a educação musical somatossensorial baseada no reconhecimento residual profundo de LSTM e na Otimização da Política de Região de Confiança (TRPO) para controle adaptativo da dificuldade. Inclui preparação de conjuntos de dados, pré-processamento, extração de características no domínio da frequência, arquitetura do modelo, treinamento, personalização e avaliação. A Figura 1 ilustra o fluxo de trabalho de pontaa ponta 14.

2. Conjunto de dados

Foi utilizado um conjunto de dados de gestos e ritmos musicais anonimizados e publicamente disponível para registrar as respostas do corpo a sinais auditivos, como tempo e intensidade do batida. O conjunto de dados fornece dados multimodais de séries temporais adequados para estudar execução de ritmos e comportamentos de aprendizagem. Cada registro contém padrões de movimento, medidas de precisão de tempo e ritmo, feedback de resposta e tempo de conclusão da tarefa. Como o conjunto de dados era totalmente anonimizado e acessível ao público, não foi necessária aprovação adicional do conselho de revisãoinstitucional 15. Para experimentos, os dados foram particionados por sujeito em subconjuntos de treinamento, validação e teste para evitar vazamento de identidade; estatísticas detalhadas e índices de divisão são relatadas na Tabela 1. Foram usadas três dobras disjuntas no sujeito, sementes aleatórias fixas em todas as execuções e pré-processamento idêntico para todas as variantes do modelo para garantircomparabilidade 16.

O conjunto de dados forneceu uma distribuição equilibrada de gestos rítmicos, com partições de treinamento, validação e teste mostrando variação comparável em características de tempo e movimento. Estatísticas descritivas (mediana ± IQR) para desvio de tempo e amplitude de movimento foram comparáveis em divisões, indicando um deslocamento mínimo da covariada.

3. Pré-processamento de dados

  1. Normalização do Z-score
    Os dados brutos foram padronizados usando normalização Z-score. Para o canal c e o tempo t:
    figure-protocol-1(1)
    Calculamos μc e σc apenas no conjunto de treinamento e os aplicamos a conjuntos de validação e teste para evitar o vazamento17.
    Após a normalização, todos os canais apresentaram média e variância unitária próximas de zero, garantindo comparabilidade entre os participantes. Diagnósticos por lote confirmaram que não houve deriva entre as dobras.
  2. Filtragem de Wiener
    Para suprimir o ruído, aplicamos um filtro de Wiener no domínio da frequência:
    figure-protocol-2(2)
    onde Y(k) é o espectro observado, \hat{X}(k) é a estimativa sem ruído, e S xx(k), Snn(k) denotam densidades espectrais de potência sinal/ruído. Usamos um comprimento de janela e sobreposição consistentes com a FFT a jusante para manter a coerência de fase18.
    O filtro de salsitha reduziu o ruído de alta frequência em ~30%, mantendo os componentes rítmicos dominantes. A relação sinal-ruído melhorou sem atenuar os picos travados por batida.
  3. Extração de características (FFT)
    Recursos FFT de curto prazo foram usados em janelas sobrepostas:
    figure-protocol-3(3)
    Os descritores extraídos incluíram frequência dominante, fluxo espectral e razões banda-energia. A proeminência máxima travada pelo tempo e a variabilidade entre picos também foram calculadas para capturar a estabilidade demicrotemporização 19.
    A FFT revelou picos espectrais claros alinhados com o tempo musical (2-3 Hz), confirmando a estrutura rítmica no conjunto de dados. As razões pico-ruído ultrapassaram em média 6-8 dB em testes corretamente executados.

4. Modelo: TRPO-ResLSTM

  1. LSTM residual (ResLSTM)
    Padrões temporais foram modelados usando LSTMs empilhados com atalhos residuais:
    figure-protocol-4 (4)
    onde P é identidade ou uma projeção para corresponder às dimensões. Conexões residuais mitigam gradientes nulos e permitem pilhas temporais mais profundas, preservando a estabilidadede treinamento 20.
    Conexões residuais melhoraram o fluxo de gradiente e a precisão da classificação em comparação com o LSTM simples. As ablações mostraram precisão de +0,7-1,1 pp em empilhamentos não residuais em contagem de parâmetros comparáveis.
  2. Otimização de Políticas de Região de Confiança (TRPO)
    O TRPO controlava a dificuldade das tarefas de forma dinâmica. A recompensa personalizada foi:
    figure-protocol-5(5)
    com pontuação de sucesso st, desvio de tempoΔtempo t, dissimilaridade do gesto dt (por exemplo, distância DTW ou perda de classificação) e um indicador de troca ut (penalizando mudanças frequentes de dificuldade). Otimizamos um objetivo de região de confiança com uma restrição KL:
    figure-protocol-6(6)
    1. Configuração e notação de aprendizado por reforço
      A dificuldade adaptativa foi formulada como um MDP de horizonte finito no qual o estado st agrega características somatossensoriais janelas (canais do acelerômetro, posições das articulações da mão, descritores de ritmo após normalização, filtragem de Wiener e FFT), e a ação a t é um nível de dificuldade discreto que controla a tolerância do tempo e a rigidez do gesto. A recompensa rt equilibra o sucesso da tarefa, desvio de tempo e engajamento, com uma pequena penalidade na dificuldade excessiva de trocar para desencorajar oscilações. As atualizações de políticas seguem o TRPO com uma restrição de divergência de KL para passos conservadores. Em Equalizações. (5-6), g(y,x) denota o gradiente de perda específico da tarefa, W(ζ) é um regularizador L-2 sobre parâmetros ζ, πθ é a política estocástica com parâmetros θ, DKL define a região de confiança, γ é o fator de desconto e δ é o raio da região de confiança. Os hiperparâmetros α,β,γ,δ foram selecionados por meio de busca em grade na divisão de validação (intervalos na Tabela 2) para equilibrar estabilidade e responsividade; a parada precoce era acionada quando a média de KL atingia0,9 21.
    2. Justificativa versus alternativas
      As atualizações de políticas do TRPO com limites de KL eram preferidas para pequenos lotes em nível de sessão e comportamentos de aprendizes não estacionários; PPO/SAC continuam promissores e serão referenciados em trabalhosfuturos 22.
      O TRPO alcançava aprendizado estável e ajuste de dificuldade mais suave do que os controladores base, com convergência consistente. As curvas de aprendizagem mostraram melhora monotônica e estabilização KL mais precoce para TRPO-ResLSTM do que para as linhas de base de componente único.
  3. Personalização e atualizações de sessão
    Atualizações incrementais refinavam tanto os modelos ResLSTM quanto TRPO após cada sessão de usuário com pequenas taxas de aprendizado e buffers de ensaio. Usamos um pequeno buffer de ensaio de testes recentes por aprendiz para evitar desvio, e atualizações limitadas por sessão para um orçamento fixo para preservar a estabilidade. A eficácia da personalização foi medida como o ganho relativo em F1 entre a primeira e a última sessão do aprendiz dentro de um horizontefixo 23.
    A personalização sessão para sessão aumentou a precisão específica do usuário em 2%-3% sem esquecimentos catastróficos. Os ganhos foram maiores para aprendizes com precisão de base de médio alcance, sugerindo margem para andaimes adaptativos.
  4. Algoritmo e implementação
    O pseudocódigo completo ("Algoritmo 1: TRPO-ResLSTM") e uma implementação de referência em Python 3.10.1 são fornecidos como. Todos os números e tabelas incluem definições de medição, barras de erro e tamanhos de amostras. Relatamos média ± DS em três dobras disjuntas no sujeito e avaliamos diferenças entre modelos com testes ANOVA ou Friedman de medidas repetidas, conforme apropriado, com comparações pós-hoc ajustadas pela multiplicidade (α = 0,05). Para garantir a reprodutibilidade, listamos versões de pacotes e especificações de GPU/CPU na Tabela de Materiais e incluímos um README com configuração ambiente eseed 24.
    O protocolo reproduzia consistentemente melhorias em relação a linhas de base multimodais, validando sua reprodutibilidade. Re-executações independentes entre sementes produziram uma variância de precisão de <0,5 pp para o modelo integrado.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Configuração Experimental
O framework TRPO-ResLSTM foi implementado em Python 3.10.1 com aceleração por GPU. O ambiente computacional, o hardware de detecção de movimento e as bibliotecas de Python estão listados na Tabela de Materiais. Os dados foram divididos em partições de treinamento/validação/teste disjuntas por sujeito, conforme mostrado na Tabela 1 (15/70/15). Os hiperparâmetros-chave são resumidos na Tabela 2. Três modelos fo...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo propõe um protocolo híbrido, TRPO-ResLSTM, que integra aprendizado por reforço e modelagem temporal residual para educação musical baseada em gestos. Ao combinar a estabilidade da Otimização de Políticas de Região de Confiança (TRPO) com a capacidade de aprendizado de sequências dos LSTMs residuais, a estrutura oferece reconhecimento de gestos em tempo real juntamente com controle adaptativo de dificuldade, permitindo feedback personalizado e aquisição progressiva

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não declaram conflitos de interesse.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem aos colegas pelo feedback construtivo sobre o desenho do estudo e a preparação do manuscrito. Esse trabalho não recebeu nenhuma subvenção específica de qualquer agência de financiamento dos setores público, comercial ou sem fins lucrativos.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Dados do sensor do acelerômetroKaggle (Domínio público)Sinais de entrada multimodais (padrões de movimento, características de tempo) incluídos no conjunto de dados
Estação de trabalho GPUNVIDIA Corporation, EUAHardware de treinamento: NVIDIA RTX 3080 (10 GB), 32 GB de RAM, Ubuntu 20.04
Dados de posição da mão - articulaçãoKaggle (Domínio público)Entrada somatossensorial para reconhecimento de gestos
Matplotlib (v3.7)https://matplotlib.orgBiblioteca de visualização para plotar figuras e métricas de desempenho
NumPy (v1.23)https://numpy.orgBiblioteca numérica de computação para operações de array
Conjunto de dados públicos de gestos musicais e ritmoKaggle (Domínio público)Conjunto de dados anonimizado com 2.730 amostras registrando respostas corporais ao tempo e ao batido; Usado para treinamento/validação/testes (15/70/15)
Python 3.10.1Fundação de Software em Python, https://www.python.orgAmbiente de programação para implementação e análise de modelos
PyTorch (v1.13)https://pytorch.orgFramework de deep learning para implementar módulos ResLSTM e TRPO
scikit - Learn (v1.2)https://scikit-learn.orgUtilitários de aprendizado de máquina para pré-processamento e avaliação
SciPy (v1.10)https://scipy.orgBiblioteca de computação científica (usada para filtragem de Wiener)

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wei, J., Karuppiah, M., Prathik, A. College music education and teaching based on AI techniques. Comput Electr Eng. 100, 107851(2022).
  2. Yu, X., et al. Developments and applications of artificial intelligence in music education. Technol. 11 (2), 42(2023).
  3. Fang, J. Artificial intelligence robots based on machine learning and visual algorithms for interactive experience assistance in music classrooms. Entertain Comput. 52, 100779(2025).
  4. Zhang, S., Lu, X., Liu, X. Study on the influence of AI composition software on students' creative ability in music education. J Educ Technol Innov. 6 (2), (2024).
  5. Feng, Y. Design and research of music teaching system based on virtual reality system in the context of education informatization. PLoS One. 18 (10), e0285331(2023).
  6. Zhou, X. Entertainment performance robots application in music network classrooms based on speech sensor recognition and artificial intelligence. Entertain Comput. 52, 100782(2025).
  7. Yu, H., Zou, Z. The music education and teaching innovation using blockchain technology supported by artificial intelligence. Int J Grid Util Comput. 14 (2-3), 278-296 (2023).
  8. Hong Yun, Z., et al. A decision-support system for assessing the function of machine learning and artificial intelligence in music education for network games. Soft Comput. 26 (20), 11063-11075 (2022).
  9. Dey, M. T., Patra, S., Mitra, S. Enhancing music education with innovative tools and techniques: The role of artificial intelligence in musical works. Enhancing Music Education With Innovative Tools and Techniques. , IGI Global. 19-50 (2025).
  10. Lin, X., et al. The application of music therapy in the rehabilitation education of children with cerebral palsy. J Investig Med. 73 (1 Suppl. 1), (2025).
  11. Wang, X. Design of vocal music teaching system platform for music majors based on artificial intelligence. Wirel Commun Mob Comput. 2022 (1), 5503834(2022).
  12. Chen, Y., Sun, Y. The usage of artificial intelligence technology in music education system under deep learning. IEEE Access. , 130546-130556 (2024).
  13. Yang, Y., et al. Multi-source and heterogeneous online music education mechanism: An artificial intelligence-driven approach. Fractals. 31 (6), 2340154(2023).
  14. Sang, J. The intersection of technology and art: A study on AI-driven CTCL music teaching paradigm. , (2024).
  15. Yin, Y. Research on technological innovation and application of music education transformation under the background of technology. J Educ Theory Pract. 2 (2), (2025).
  16. Yuan, Y. Influencing factors and modeling methods of vocal music teaching quality supported by artificial intelligence technology. Int J Web Based Learn Teach Technol. 19 (1), 1-16 (2024).
  17. Sanganeria, M., Gala, R. Tuning music education: AI-powered personalization in learning music. arXiv Prepr. , (2024).
  18. Qiusi, M. Research on the improvement method of music education level under the background of AI technology. Mob Inf Syst. 2022 (1), 7616619(2022).
  19. Xu, Z. Construction of an intelligent recognition and learning education platform of national music genre under deep learning. Front Psychol. 13, 843427(2022).
  20. Wang, X., et al. College music teaching and ideological and political education integration mode based on deep learning. J Intell Syst. 31 (1), 466-476 (2022).
  21. Tang, H., Zhang, Y., Zhang, Q. The use of deep learning-based intelligent music signal identification and generation technology in national music teaching. Front Psychol. 13, 762402(2022).
  22. Artificial intelligence in music education: Exploring applications, benefits, and challenges. Yue, Y., Jing, Y. Proc Int Conf Educ Inf Technol, , 141-146 (2025).
  23. Bai, A., Yeh, C. K., Hsieh, C. J., Taly, A. An efficient rehearsal scheme for catastrophic forgetting mitigation during multi-stage fine-tuning. arXiv Prepr. , (2024).
  24. Ravi, N., Goel, A., Davis, J. C., Thiruvathukal, G. K. Improving the reproducibility of deep learning software: An initial investigation through a case study analysis. arXiv Prepr. , (2025).
  25. Chen, J., Jin, F., Jiao, Y., Zhan, Y., Qin, X. Improving dynamic gesture recognition with attention-enhanced LSTM and grounding SAM. Electronics. 14 (9), 1793(2025).
  26. Ouyang, F., Dai, X., Chen, S. Applying multimodal learning analytics to examine the immediate and delayed effects of instructor scaffoldings on small groups' collaborative programming. Int J STEM Educ. 9 (1), 45(2022).
  27. Aoyama Lawrence,, Weinberger, L., A, Being in-sync: A multimodal framework on the emotional and cognitive synchronization of collaborative learners. Front Educ. , (2022).
  28. Schulman, J., Wolski, F., Dhariwal, P., Radford, A., Klimov, O. Proximal policy optimization algorithms. arXiv Prepr. , (2017).
  29. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor. PMLR. Haarnoja, T., Zhou, A., Abbeel, P., Levine, S. Proc Int Conf Mach Learn, , (2018).
  30. Huang, S., Dossa, R. F. J., Raffin, A., Kanervisto, A., Wang, W. The 37 implementation details of proximal policy optimization. ICLR Blog Track. , https://iclr-blog-track.github.io/2022/03/25/ppo-implementation-details/ (2023).
  31. Sclater, N., Bailey, P. Code of practice for learning analytics. , https://www.jisc.ac.uk/guides/code-of-practice-for-learning-analytics (2022).
  32. Rabiner, L. R. A tutorial on hidden Markov models and selected applications in speech recognition. Proc IEEE. 77 (2), 257-286 (2002).
  33. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).
  34. Proverbio, A. M., Camporeale, E., Brusa, A. Multimodal recognition of emotions in music and facial expressions. Front Hum Neurosci. 14, 32(2025).
  35. Kang, S. Adaptations, code-switching, and novelty with cultural integrity: Musicians performing and learning musical instruments in different musical traditions. J Res Music Educ. , (2025).
  36. Han, Y., Han, L., Zeng, C., Zhao, W. The innovation path of VR technology integration into music classroom teaching in colleges and universities. Sci Rep. 15 (1), 12200(2025).
  37. Huang, A. Y., Lu, O. H., Yang, S. J. Effects of artificial intelligence-enabled personalized recommendations on learners' learning engagement, motivation, and outcomes in a flipped classroom. Comput Educ. 194, 104684(2023).
  38. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Intelligent Music EducationSomatosensory EvaluationGesture RecognitionRhythm EvaluationTRPO Reinforcement LearningResLSTM ModelAdaptive DifficultyIncremental LearningFeature ExtractionPersonalized Learning

Related Articles