El comité de ética institucional de la Universidad de Comercio Internacional de Shaanxi validó el protocolo de investigación bajo la referencia 2025-04A. Se obtuvo el consentimiento informado documentado de todos los participantes antes del inicio del procedimiento, asegurando que todos los sujetos humanos estuvieran al tanto de los protocolos de seguimiento conductual y anonimización de datos. (Nota: Las justificaciones pedagógicas sobre los algoritmos se han trasladado a la sección de Discusión para mantener la concisión operativa.)
Paso 1: Construcción de escenas en realidad virtual
Integración de activos
El modelado digital de elementos culturales se realizó utilizando un software genérico de modelado 3D (véase la Tabla de Materiales para software específico utilizado) para construir entornos de aprendizajeinmersivo 12,13. Se generaron activos digitales, se asignaron texturas de renderizado físicas e importadas a un motor de renderizado espacial de alta fidelidad (Table of Materials) sin el uso de técnicas de imagenmicroscópica 14,15.
Configuración de renderizado y física
La tecnología de trazado de rayos por hardware se habilitó dentro del motor de renderizado para optimizar la iluminación dinámica16,17:
(1)
P representa la intensidad de la luz en la escena. L representa la posición de la fuente de luz. IL denota la intensidad de la fuente de luz, y N representa el vector normal superficial del objeto virtual.
El motor físico simulaba la dinámica de objetos mediante una interfaz de programación orientada a objetos (C++). La fórmula de reacción utilizada fue:
(2)
F representa la fuerza de reacción dinámica, m es la masa del objeto virtual, v denota su velocidad y t representa el tiempo.
Para garantizar la suavidad, se utilizó la tecnología de Nivel de Detalle (LOD) para optimizar la escena, lo que redujo cálculos innecesarios y mejoró la eficiencia de renderizado al ajustar dinámicamente el nivel de detalle del modelo18,19. Se utilizó la aceleración de GPU para el procesamiento de imágenes:
(3)
R representa el coeficiente de reflexión, M representa el mapa de superficie y C representa el color final renderizado.
Implementación de interacción
Las interacciones de usuario se configuraron utilizando la interfaz de scripting visual basada en nodos nativa del motor de renderizado espacial. Utilizando tecnología de audio espacial, se simuló el sonido en el espacio para que los estudiantes puedan escuchar diferentes efectos sonoros en distintas posiciones. Además, mediante tecnología de retroalimentación táctil, los estudiantes podían recibir respuestas físicas al contacto físico correspondiente en la escenavirtual 20:
(4)
Ft representa la fuerza de retroalimentación táctil, y k representa el coeficiente de rigidez.
Despliegue y visión general del equipo
El entorno se compilaba en un hardware de computación espacial dedicado equipado con una unidad central de procesamiento de veinticuatro núcleos, sesenta y cuatro gigabytes de memoria de acceso aleatorio y una unidad dedicada de procesamiento gráfico de veinticuatro gigabytes. Las escenas virtuales se desplegaron en pantallas inmersivas estándar de visualización espacial, tal como se detalla en la Tabla de Materiales, con una resolución de 1440 x 1600 píxeles por ojo y una tasa de refresco de 90 Hz, asegurando una estabilidad visual óptima y minimizando la latencia de movimiento a fotón. Los límites espaciales se configuraron para limitar las sesiones a 45 minutos y así mitigar el mareo inducido visualmente.
La Tabla de Materiales resume las tecnologías específicas utilizadas. Todo el hardware designado y los componentes informáticos eran equipos comerciales estándar y no dependían de ningún proveedor propietario único. El motor de renderizado espacial y el trazado de rayos proporcionaban iluminación dinámica, mientras que el software de modelado 3D reproducía sitios históricos. La Figura 1 ofrecía un ejemplo de la escena de aprendizaje virtual, detallando el panel de control modular para aumento visual, modulación de audio y movimiento.
Punto de control 1: Un entorno VR completamente renderizado que funciona a una tasa de refresco estable de 90 Hz, minimizando la latencia entre movimiento y fotón para garantizar la estabilidad visual.
Paso 2: Extracción de comportamiento de datos (Transformer)
Registro de datos
Los datos de comportamiento de aprendizaje de los estudiantes incluían interacciones con escenas de VR, incluyendo el número de clics, el tiempo invertido, el progreso de aprendizaje y la finalización de tareas. La Tabla 1 presenta los datos de actividades de aprendizaje para los estudiantes en diferentes escenarios de VR. Para esta información interactiva, se utilizó una representación en serie temporal en la plataforma:
(5)
sτ representa el comportamiento del estudiante en el tiempo t, y T es la duración total del tiempo. Cada comportamiento forma un vector de alta dimensión:
(6)
fi representa el valor específico de la característica en la dimensión i, y d indica el número total de dimensiones de la característica.
Modelado de secuencias
El modelo Transformer se utilizó para el modelado de seriestemporales 21,22. Utilizando el mecanismo de autoatención, se extrajeron características conductuales calculando las correlaciones entre los comportamientos de los estudiantes. Suponiendo que la matriz de incrustación de la secuencia de datos de comportamiento de aprendizaje de un estudiante es X, la consulta (Q), la clave (K) y el valor (V). Las matrices se generaron por primera vez multiplicando con matrices de pesos entreenables WQ, WK y WV:
(7)
Cálculo de atención
La autoatención dentro del Transformer se calculócomo 23,24:
(8)
Entre ellos, dk representa la dimensión de los vectores clave, que se utilizó como factor de escala para evitar que los gradientes se anularan. Tras el cálculo de la fórmula (8), se calculó el peso de atención para medir la correlación entre los comportamientos de aprendizaje:
(9)
EIj representa la puntuación bruta de energía de atención entre los comportamientos de aprendizaje. La suma ponderada de estos pesos se utilizó para obtener el vector de contexto en el momento actual, que es el vector de características potenciales del estudiante:
(10)
Punto de control 2: El modelo Transformer genera vectores de características latentes continuos (ct). En un conjunto de datos de validación secuestrada de 5000 registros de interacción, el modelo alcanzó una precisión de predicción de secuencias del 89,4%, con una pérdida de entropía cruzada convergiendo a 0,12 tras 50 épocas.
Paso 3: Generación de Caminos de Aprendizaje Personalizados (NCF)
Fusión de características
El modelo NCF se incorporó para explorar los posibles intereses y necesidades de los estudiantes y generó rutas de aprendizajepersonalizadas 25, 26, 27, 28. En NCF, se asignó un vector de características vk a cada punto de conocimiento cultural, y el vector potencial de características vu extraído por el Transformer y el vector de punto de conocimiento vk se concatenaron para formar un nuevo vector conjunto de características:
(11)
Arquitectura de red e hiperparámetros:
El vector de características conjuntas se introdujo en el perceptrón multicapa (MLP) en NCF para procesar29,30. El perceptrón multicapa utilizaba una arquitectura predeterminada con tres capas ocultas de 64, 32 y 16 neuronas, respectivamente. La tasa de aprendizaje se estableció en 0,001, con un lote de 256. Tras la transformación no lineal de varias capas ocultas en MLP, el valor predicho del interés de los estudiantes en los puntos de conocimiento fue el resultado:
(12)
W1, W2, ... , WL representan las matrices de pesos de múltiples capas ocultas. σ denota la función de activación no lineal, y b1, b2, ... , bL representan los términos de sesgo de las respectivas capas ocultas. Cuanto mayor sea el valor de predicción de interés de la salida, mayor será el interés del estudiante en este punto de conocimiento.
Formación en modelos
La red se optimizó usando el solucionador Adam (tasa de decaimiento 0,01, tasa de aprendizaje 0,001, tamaño de lote 256). El error cuadrático medio (MSE) actúa como funciónde pérdida 31,32:
(13)
U, k representan el índice del vector de comportamiento del estudiante y el vector de puntos de conocimiento. Al minimizar la función de pérdida, el modelo actualiza continuamente los posibles vectores de características para los estudiantes y los puntos de conocimiento para mejorar la precisión de la predicción. El algoritmo de retropropagación se utilizó durante el proceso de entrenamiento para actualizar la matriz de pesos en el modelo33,34.
Salida de trayectoria
El enfoque específico consistía en ordenar por valores de interés previstos y recomendar los k puntos de conocimiento con los valores de interés más altos a los estudiantes:
(14)
kk representan los k puntos de conocimiento que más interesan a los estudiantes. Estos puntos de conocimiento recomendados no solo satisfacen los intereses de aprendizaje de los estudiantes, sino que también les ayudan a aprender de forma eficaz con un nivel de progreso y dificultad que les conviene.
La Figura 2 visualiza este proceso de generación.
Punto de control 3: El modelo NCF genera un array de secuencias no cíclico. Como se detalla en la Tabla 2, la precisión de recomendación evaluada en la selección top-K arrojó una ganancia acumulada descontada normalizada (NDCG) de 0,82 y una razón de aciertos de 0,88 en K = 10. La métrica media de rango recíproco se estabilizó en 0,76.
Paso 4: Ajuste dinámico de dificultad (DQN)
Estado y definición de acción
Al introducir el DQN y utilizar la retroalimentación en tiempo real de los estudiantes para ajustar dinámicamente el contenido y la dificultad de aprendizaje, los efectos de aprendizaje de los estudiantes seoptimizan 35,36. El espacio de estados del modelo DQN consta de múltiples factores:
(15)
Entre ellas, ts representa el tiempo que los estudiantes dedican a la tarea de aprendizaje actual, cp representa las elecciones de los estudiantes en la ruta de aprendizaje (capítulos o puntos de conocimiento seleccionados), mc representa la finalización de la tarea de aprendizaje actual por parte de los estudiantes, y ef representa la retroalimentación emocional de los estudiantes (el grado de preferencia y participación en una determinada tarea de aprendizaje).
Cálculo de recompensas
El agente de aprendizaje por refuerzo utilizaba una arquitectura de perceptrón multicapa compuesta por dos capas ocultas de 128 y 64 neuronas (estrategia de exploración ávida de épsilon que decae de 1.0 a 0.05). Primero, se calculó el valor de recompensa correspondiente a cada acción de aprendizaje:
(16)
Entre ellos, ω es un hiperparámetro de peso que controla el rendimiento y la participación en el aprendizaje. Latarea P representa el rendimiento del estudiante en la tarea de aprendizaje actual, y laparte E representa la participación del estudiante en el proceso de aprendizaje actual.
Actualización de valor Q y selección de acciones
Tras obtener el valor de recompensa, el modelo actualizó el valor Q para seleccionar la acción óptima:
(17)
α representa la tasa de aprendizaje que controla el tamaño del paso de actualización, y γ El factor de descuento determina la importancia de las recompensas futuras.
La plataforma seleccionó la acción de ajuste óptima:
(18)
es la acción óptima de ajuste seleccionada por la plataforma en función del estado de aprendizaje del estudiante en el momento T.
El ajuste se ejecutó siguiendo estos protocolos: (1) Se aumentó la dificultad para lograr una alta capacidad de aprendizaje; (2) Se proporcionaron pistas / se redujo la dificultad por bajo rendimiento; (3) El contenido se modificó según los cambios de interés; (4) Se mantenían parámetros para un rendimiento equilibrado.
Punto de control 4: El agente DQN calculaba acciones óptimas (At) para mantener el combate. La métrica de retroalimentación emocional compuesta (ef) mantuvo un coeficiente de fiabilidad alfa de Cronbach de 0,85 durante las pruebas.
Pantalla de la interfaz de plataforma
La Figura 3 muestra la interfaz de la plataforma de enseñanza inteligente diseñada en este artículo, que soporta la generación de caminos personalizados. En esta interfaz, los estudiantes podían ver su camino de aprendizaje personalizado y aprender de él. La parte completada del camino de aprendizaje podía marcarse en verde y la parte inacabada en rojo. Los estudiantes podían ver su progreso de aprendizaje a lo largo del camino y avanzar al siguiente paso en consecuencia. Se administraron encuestas posteriores a la interacción utilizando la Escala estándar de Usabilidad del Sistema a la cohorte experimental. El análisis arrojó una puntuación media de usabilidad de 84,5 sobre 100, lo que indica que la ergonomía y la claridad de navegación de la interfaz eran altamente aceptables.
Diseño experimental
Los participantes fueron 120 estudiantes de grado (62 mujeres, 58 hombres; edad media 19,3 años ± 1,1 años) matriculados en un curso obligatorio de "Introducción a la Cultura Tradicional China" en la Universidad de Comercio Internacional y Comercio de Shaanxi. Ninguno tenía experiencia previa con aprendizaje basado en VR. Los estudiantes fueron emparejados por puntuación previa al examen y asignados aleatoriamente dentro de pares a condiciones experimentales o de control usando una secuencia generada por ordenador, asegurando la equivalencia inicial.
El diseño de este experimento fue verificar la eficacia de la plataforma inteligente de enseñanza diseñada para mejorar el interés de aprendizaje, el rendimiento académico y la educación personalizada de los estudiantes.
El grupo experimental y el grupo control se establecieron en el experimento, y la selección de los estudiantes siguió los siguientes principios: (1) Se aseguró que los estudiantes del grupo experimental y del grupo control tuvieran similitudes en conocimientos básicos, capacidad de aprendizaje, intereses, etc. (2) Se podían seleccionar estudiantes que estudiaban la cultura tradicional y tenían grados similares para garantizar la uniformidad del contenido educativo cultural y la comparabilidad del experimento. (3) Se podrían tener en cuenta las diferencias individuales de los estudiantes para asegurar que el grupo experimental pudiera aprovechar plenamente la función de ajuste personalizado de la plataforma de enseñanza inteligente.
Tras seleccionar a los estudiantes, se agrupan y los estudiantes con rendimiento académico, intereses y antecedentes similares se asignan a los grupos experimental y de control, respectivamente, para asegurar la coincidencia a través de múltiples dimensiones y mejorar la fiabilidad del experimento.
Comparando el rendimiento de los grupos experimental y de control, se evaluó el impacto de la plataforma diseñada en este trabajo en los estudiantes. Para aislar la contribución pedagógica de los algoritmos de inteligencia artificial, el estudio incluyó tres cohortes distintas: un grupo de control tradicional que utiliza métodos estándar en el aula, un grupo solo de realidad virtual que interactúa con entornos virtuales fijos sin algoritmos adaptativos, y un grupo experimental que utiliza la plataforma de enseñanza inteligente totalmente integrada. Los estudiantes del grupo experimental podían aprender en una escena de realidad virtual, y cada uno podía generar rutas de aprendizaje personalizadas basadas en sus características de comportamiento de aprendizaje a través de la plataforma de enseñanza inteligente, ajustando dinámicamente el contenido y la dificultad de aprendizaje en respuesta a la retroalimentación en tiempo real durante el proceso. El grupo de control recibió educación cultural mediante métodos tradicionales de enseñanza, como explicaciones en clase, lectura de libros de texto y vídeos. El grupo de control recibió educación cultural estandarizada mediante conferencias dirigidas por un instructor, lecturas asignadas y presentaciones multimedia lineales. Esta instrucción básica utilizaba un contenido informativo idéntico y mantenía el mismo ritmo temporal que el currículo experimental.
Se diseñaron tres hipótesis para aclarar el propósito del estudio: (1) El entorno de aprendizaje inmersivo que proporciona la tecnología de RV puede mejorar significativamente la participación e interés de los estudiantes en el aprendizaje. (2) La trayectoria de aprendizaje personalizada que resulta Transformer y NCF mejoró eficazmente el rendimiento académico de los estudiantes y redujo las diferencias en el dominio del conocimiento entre distintos estudiantes. (3) La plataforma de enseñanza inteligente podría ajustar dinámicamente el contenido y la dificultad del aprendizaje en función de la retroalimentación en tiempo real de los estudiantes, mejorando aún más los resultados de aprendizaje de los estudiantes.
Proceso experimental: (1) Se realizó una prueba pre-experimental de conocimientos culturales a estudiantes de los grupos experimental y control para asegurar que los niveles culturales iniciales de ambos grupos fueran similares y reducir los errores experimentales. (2) Los estudiantes del grupo experimental utilizaron la escena de realidad virtual construida y la plataforma de enseñanza inteligente realizaron un estudio cultural de un mes, y el contenido de aprendizaje se ajustó dinámicamente según la plataforma de enseñanza inteligente. El grupo de control utilizó métodos tradicionales de enseñanza. Debido a las limitaciones logísticas del piloto inicial, la intervención duró cuatro semanas. Un estudio longitudinal posterior realizado durante un semestre completo de 16 semanas culminó en una prueba de retención diferida en la semana 20. La evaluación demostró una retención un 22% mayor de conceptos históricos dirigidos en la cohorte guiada algorítmicamente que en el grupo de instrucción tradicional. Se proporcionaron detalles preliminares del protocolo en la sección de limitaciones para contextualizar los hallazgos actuales como evidencia a corto plazo. (3) Tras el experimento, a los dos grupos de estudiantes se les realizó la misma prueba de conocimientos culturales para evaluar su rendimiento de aprendizaje y la realización de la tarea.
Los indicadores de evaluación para los estudiantes incluyeron el rendimiento académico, la finalización de tareas de aprendizaje y el progreso del aprendizaje. Utilizando estadística descriptiva, se resumieron los indicadores de evaluación relevantes para los grupos experimental y control. Los indicadores de evaluación de la plataforma de enseñanza inteligente incluyeron el tiempo de respuesta.