$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Los avances recientes en inteligencia artificial (IA) y tecnología somatosensorial están transformando la educación musical al permitir que los alumnos interactúen con la música a través de movimientos corporales, donde los gestos se traducen en notas, ritmos o controles para instrumentosvirtuales 1,2. Estas funciones interactivas aumentan la implicación, la retención y la creatividad en comparación con la instrucción tradicional en aula, y las herramientas somatosensoriales permiten a los estudiantes practicar ritmo, coordinación y expresión mediante percusión corporal, gestos de dirección y simulaciones de conjunto3. Combinado con vías adaptativas impulsadas por IA, los estudiantes reciben contenido individualizado, retroalimentación en tiempo real y un desarrollo progresivo de habilidades que mejoran la motivación y los resultados 4,5.
A pesar de estos avances, las plataformas existentes a menudo dependen de modalidades limitadas, carecen de continuidad de personalización o no logran adaptarse a estilos culturales y físicos diversos 6,7. Los enfoques tradicionales también no logran ofrecer ajustes en tiempo real basados en datos que reflejen las capacidades cambiantes del alumno. Por ejemplo, la captura de movimiento y los dispositivos portátiles pueden generar conjuntos de datos completos, pero a menudo están infrautilizados en la instrucciónadaptativa 8,9. Además, aunque las bibliotecas musicales y los sistemas de gestión del aprendizaje han ampliado su accesibilidad, rara vez proporcionan personalización dinámica entre sesiones, lo cual es fundamental en contextos de aprendizaje multiculturales yheterogéneos 10.
Para abordar estas carencias, este estudio propone un nuevo marco de Memoria Residual Profunda a Corto Plazo Optimizada por Región de Confianza (TRPO-ResLSTM) para plataformas de educaciónmusical 11. El sistema integra métodos avanzados de preprocesado, incluyendo filtrado de Wiener y normalización Z-score, con la Transformada Rápida de Fourier para la extracción de características en el dominio de la frecuencia. Res-LSTM proporciona un reconocimiento robusto de gestos y secuencias temporales, mientras que el aprendizaje por refuerzo TRPO ajusta dinámicamente la dificultad de la tarea en respuesta al rendimiento del aprendiz. El aprendizaje incremental fortalece aún más la personalización al actualizar los modelos entre sesiones.
Se realizaron experimentos con el conjunto de datos de gestos y ritmo musical de Kaggle, que comprende 2.730 muestras, divididos en subconjuntos de entrenamiento, validación y prueba. Los resultados muestran que el método propuesto supera consistentemente a las arquitecturas multimodales base, logrando valores de precisión, precisión, recuperación y F1 en el rango del 93%-95%. Los análisis de ablación confirman la eficacia tanto de los componentes TRPO como de Res-LSTM. Al mejorar la precisión del ritmo, la participación del usuario y la estabilidad de las políticas en tiempo real, el marco proporciona una solución práctica para mejorar la eficiencia de la educación musical en entornos de aprendizaje remoto y con recursos limitados. Trabajos relacionados sobre la educación musical impulsada por IA han puesto de manifiesto el potencial del compromiso somatosensorial, la personalización del aprendizaje adaptativo e incluso aplicaciones en musicoterapia y composiciónautomatizada 12,13. Este estudio se basa en estos hallazgos ofreciendo un protocolo reproducible que combina aprendizaje por refuerzo con modelado temporal profundo para avanzar en el campo de la educación musical inteligente.