O comitê de ética institucional da Universidade de Comércio Internacional e Comércio de Shaanxi validou o protocolo de pesquisa sob a referência 2025-04A. Foi obtido consentimento informado documentado de todos os participantes antes do início do procedimento, garantindo que todos os participantes humanos estivessem cientes dos protocolos de rastreamento comportamental e anonimização de dados. (Nota: Justificativas pedagógicas sobre os algoritmos foram realocadas para a seção de Discussão para manter a concisão operacional.)
Passo 1: Construção de cenas em realidade virtual
Integração de ativos
A modelagem digital de elementos culturais foi executada usando um software genérico de modelagem 3D (veja a Tabela de Materiais para softwares específicos usados) para construir ambientes de aprendizagemimersiva 12,13. Ativos digitais foram gerados, texturas de renderização baseadas fisicamente foram atribuídas e importadas para um motor de renderização espacial de alta fidelidade (Table of Materials) sem o uso de técnicas de imagemmicroscópica 14,15.
Configuração de renderização e física
A tecnologia de ray tracing por hardware foi habilitada dentro do motor de renderização para otimizar a iluminação dinâmica16,17:
(1)
P representa a intensidade da luz na cena. L representa a posição da fonte de luz. IL denota a intensidade da fonte de luz, e N representa o vetor normal da superfície do objeto virtual.
O motor de física simulava a dinâmica de objetos por meio de uma interface de programação orientada a objetos (C++). A fórmula de reação utilizada foi:
(2)
F representa a força de reação dinâmica, m é a massa do objeto virtual, v denota sua velocidade, e t representa o tempo.
Para garantir a suavidade, a tecnologia de Nível de Detalhe (LOD) foi usada para otimizar a cena, o que reduziu cálculos desnecessários e melhorou a eficiência de renderização ao ajustar dinamicamente o nível de detalhe do modelo18,19. A aceleração da GPU era usada para processamento de imagem:
(3)
R representa o coeficiente de reflexão, M representa o mapa de superfície e C representa a cor final renderizada.
Implementação de interação
As interações do usuário foram configuradas utilizando a interface de script visual baseada em nós nativa do motor de renderização espacial. Utilizando tecnologia de áudio espacial, o som foi simulado no espaço para que os alunos possam ouvir diferentes efeitos sonoros em diferentes posições. Além disso, por meio da tecnologia de feedback tátil, os alunos poderiam receber respostas físicas ao toque físico correspondente na cenavirtual 20:
(4)
Ft representa a força do feedback tátil, e k representa o coeficiente de rigidez.
Visão geral do implantação e equipamentos
O ambiente foi compilado em um hardware dedicado de computação espacial equipado com uma unidade central de processamento de vinte e quatro núcleos, sessenta e quatro gigabytes de memória de acesso aleatório e uma unidade dedicada de processamento gráfico de vinte e quatro gigabytes. As cenas virtuais foram implementadas em displays imersivos padrão de visualização espacial, conforme detalhado na Tabela de Materiais, com resolução de 1440 x 1600 pixels por olho e taxa de atualização de 90 Hz, garantindo estabilidade visual ideal e minimizando a latência entre movimento e fóton. Os limites espaciais foram configurados para limitar as sessões a 45 minutos para mitigar o enjoo de movimento induzido visualmente.
A Tabela de Materiais resume as tecnologias específicas utilizadas. Todo o hardware designado e componentes de computação eram equipamentos comerciais padrão prontos para a loja e não dependiam de um único fornecedor proprietário. O motor de renderização espacial e o ray tracing forneceram iluminação dinâmica, enquanto o software de modelagem 3D reproduziu locais históricos. A Figura 1 forneceu um exemplo da cena de aprendizado virtual, detalhando o painel de controle modular para ampliação visual, modulação de áudio e movimento.
Checkpoint 1: Um ambiente VR totalmente renderizado operando em uma taxa de atualização estável de 90 Hz, minimizando a latência movimento-fóton para garantir estabilidade visual.
Passo 2: Extração de Dados de Comportamento (Transformer)
Registro de dados
Os dados de comportamento de aprendizagem dos alunos incluíam interações com cenas de VR, incluindo contagem de cliques, tempo gasto, progresso de aprendizagem e conclusão de tarefas. A Tabela 1 apresenta os dados das atividades de aprendizagem para alunos em diferentes cenários de VR. Para essa informação interativa, foi usada uma representação em série temporal na plataforma:
(5)
sτ representa o comportamento do aluno no tempo t, e T é o tempo total. Cada comportamento forma um vetor de alta dimensão:
(6)
fi representa o valor específico da característica na dimensão i, e d indica o número total de dimensões da característica.
Modelagem de Sequências
O modelo Transformer foi usado para a modelagem de sériestemporais 21,22. Usando o mecanismo de autoatenção, as características comportamentais foram extraídas calculando as correlações entre os comportamentos dos alunos. Assumindo que a matriz de incorporação da sequência de dados do comportamento de aprendizagem do aluno é X, a consulta (Q), a chave (K) e o valor (V). As matrizes foram geradas inicialmente multiplicando por matrizes de pesos treináveis WQ, WK e WV:
(7)
Cálculo de Atenção
A autoatenção dentro do Transformer foi calculadacomo 23,24:
(8)
Entre eles, dk representa a dimensão dos principais vetores, que foi utilizada como um fator de escala para evitar o desaparecimento de gradientes. Após o cálculo da fórmula (8), o peso de atenção foi calculado para medir a correlação entre os comportamentos de aprendizagem:
(9)
Eij representa a pontuação bruta de atenção e energia entre os comportamentos de aprendizagem. A soma ponderada desses pesos foi usada para obter o vetor de contexto no momento atual, que é o vetor de características potencial do estudante:
(10)
Ponto de Controle 2: O modelo Transformer gera vetores de características latentes contínuos (ct). Em um conjunto de dados de validação sequestrado com 5000 logs de interação, o modelo alcançou uma precisão de previsão de sequências de 89,4%, com a perda de entropia cruzada convergindo para 0,12 após 50 épocas.
Passo 3: Geração Personalizada de Caminhos de Aprendizagem (NCF)
Fusão de Características
O modelo NCF foi incorporado para explorar os interesses e necessidades potenciais dos alunos e gerou caminhos de aprendizagem personalizados25, 26, 27, 28. No NCF, um vetor de características vk foi atribuído a cada ponto de conhecimento cultural, e o vetor potencial de característica v u extraído pelo Transformer e o vetor de ponto de conhecimento vk foram concatenados para formar um novo vetor conjunto de características:
(11)
Arquitetura de Rede e Hiperparâmetros:
O vetor de características conjuntas foi inserido no perceptrônio multicamada (MLP) no NCF para processamento29,30. O perceptron multicamadas utilizava uma arquitetura predeterminada com três camadas ocultas de 64, 32 e 16 neurônios, respectivamente. A taxa de aprendizado foi definida para 0,001, com um lote de 256. Após a transformação não linear de várias camadas ocultas no MLP, o valor previsto do interesse dos alunos em pontos de conhecimento foi o resultado:
(12)
W1, W2, ... , WL representam as matrizes de pesos de múltiplas camadas ocultas. σ denota a função de ativação não linear, e b1, b2, ... , bL representam os termos de viés das respectivas camadas ocultas. Quanto maior o valor de previsão de juros de saída, maior o interesse do estudante nesse ponto de conhecimento.
Treinamento em Modelos
A rede foi otimizada usando o solucionador Adam (taxa de decaimento 0,01, taxa de aprendizado 0,001, tamanho de lote 256). O erro quadrático médio (MSE) serve como função de perda31,32:
(13)
U, k representam o índice do vetor de comportamento do aluno e do vetor de pontos de conhecimento. Ao minimizar a função de perda, o modelo atualiza continuamente os vetores potenciais de características para os alunos e pontos de conhecimento para melhorar a precisão das previsões. O algoritmo de retropropagação foi usado durante o processo de treinamento para atualizar a matriz de pesos no modelo33,34.
Saída de Caminho
A abordagem específica foi ordenar pelos valores de interesse previstos e recomendar os k pontos de conhecimento com os maiores valores de interesse aos alunos:
(14)
Kk representam os k pontos de conhecimento que mais interessam aos alunos. Esses pontos de conhecimento recomendados não apenas atendem aos interesses de aprendizagem dos alunos, mas também os ajudam a aprender de forma eficaz, em um nível de progresso e dificuldade que lhes convém.
A Figura 2 visualiza esse processo de geração.
Ponto de controle 3: O modelo NCF gera um array de sequência não cíclico. Como detalhado na Tabela 2, a precisão de recomendação avaliada na seleção top-K resultou em um ganho cumulativo descontado normalizado (NDCG) de 0,82 e uma razão de acerto de 0,88 em K = 10. A métrica média recíproca de classificação estabilizou em 0,76.
Passo 4: Ajuste dinâmico da dificuldade (DQN)
Definição de estado e ação
Ao introduzir o DQN e usar o feedback em tempo real dos alunos para ajustar dinamicamente o conteúdo e a dificuldade de aprendizagem, os efeitos de aprendizagem dos alunos sãootimizados 35,36. O espaço de estados do modelo DQN consiste em múltiplos fatores:
(15)
Entre eles, ts representa o tempo que os alunos passam na tarefa de aprendizagem atual, cp representa as escolhas dos alunos no caminho de aprendizagem (capítulos ou pontos de conhecimento selecionados), mc representa a conclusão da tarefa de aprendizagem atual pelos alunos, e e f representa o feedback emocional dos alunos (o grau de preferência e participação em determinada tarefa de aprendizagem).
Cálculo de Recompensa
O agente de aprendizado por reforço utilizava uma arquitetura perceptron multicamadas composta por duas camadas ocultas de 128 e 64 neurônios (estratégia de exploração gulosa por epsilon que decai de 1.0 para 0.05). Primeiro, o valor da recompensa correspondente a cada ação de aprendizagem foi calculado:
(16)
Entre eles, ω é um hiperparâmetro de peso que controla o desempenho e a participação na aprendizagem. A tarefa P representa o desempenho do aluno na tarefa de aprendizagem atual, e aparte E representa a participação do aluno no processo de aprendizagem atual.
Atualização do valor Q e seleção de ações
Após obter o valor da recompensa, o modelo atualizou o valor Q para selecionar a ação ótima:
(17)
α representa a taxa de aprendizado que controla o tamanho do passo de atualização e γ O fator de desconto determina a importância das recompensas futuras.
A plataforma selecionou a ação de ajuste ótima:
(18)
é a ação de ajuste ótima selecionada pela plataforma com base no status de aprendizagem do aluno no tempo t.
O ajuste foi executado seguindo estes protocolos: (1) A dificuldade foi aumentada para alta capacidade de aprendizagem; (2) Dicas foram fornecidas/dificuldade reduzida por baixo desempenho; (3) O conteúdo foi alterado com base em mudanças de interesse; (4) Parâmetros foram mantidos para desempenho balanceado.
Ponto de Controle 4: O agente DQN calculava ações ótimas (At) para sustentar o engajamento. A métrica composta de feedback emocional (ef) manteve um coeficiente de confiabilidade alfa de Cronbach de 0,85 durante os testes.
Exibição da interface da plataforma
A Figura 3 mostra a interface da plataforma de ensino inteligente projetada neste artigo, que suporta a geração de caminhos personalizada. Nessa interface, os alunos podiam ver seu caminho de aprendizagem personalizado e aprender com ele. A parte concluída do caminho de aprendizado podia ser marcada em verde, e a parte inacabada em vermelho. Os alunos podiam ver seu progresso de aprendizagem ao longo do caminho e avançar para o próximo passo de acordo. Pesquisas pós-interação usando a Escala de Usabilidade do Sistema padrão foram aplicadas à coorte experimental. A análise resultou em uma pontuação média de usabilidade de 84,5 de 100, indicando que a ergonomia e a clareza da navegação da interface eram altamente aceitáveis.
Desenho experimental
Os participantes foram 120 estudantes de graduação (62 mulheres, 58 homens; idade média 19,3 anos ± 1,1 ano) matriculados em um curso obrigatório de "Introdução à Cultura Tradicional Chinesa" na Universidade de Comércio Internacional e Comércio de Shaanxi. Nenhum deles tinha experiência prévia com aprendizado baseado em VR. Os alunos foram pareados por escores pré-teste e designados aleatoriamente em pares para condições experimentais ou de controle usando uma sequência gerada por computador, garantindo equivalência de base.
O design desse experimento foi para verificar a eficácia da plataforma inteligente de ensino projetada para melhorar o interesse de aprendizagem dos alunos, o desempenho acadêmico e a educação personalizada.
O grupo experimental e o grupo controle foram estabelecidos no experimento, e a seleção dos alunos seguiu os seguintes princípios: (1) Isso garantiu que os alunos do grupo experimental e do grupo controle tivessem semelhanças em conhecimentos básicos, capacidade de aprendizagem, interesses, etc. (2) Estudantes que estudam cultura tradicional e possuem anos semelhantes podiam ser selecionados para garantir a uniformidade do conteúdo da educação cultural e a comparabilidade do experimento. (3) As diferenças individuais dos alunos poderiam ser levadas em conta para garantir que o grupo experimental pudesse fazer pleno uso da função de ajuste personalizado da plataforma de ensino inteligente.
Após selecionar os alunos, eles são agrupados, e alunos com desempenho acadêmico, interesses e antecedentes semelhantes são designados para os grupos experimental e controle, respectivamente, para garantir a correspondência entre múltiplas dimensões e melhorar a confiabilidade do experimento.
Ao comparar o desempenho dos grupos experimental e controle, foi avaliado o impacto da plataforma projetada neste artigo sobre os alunos. Para isolar a contribuição pedagógica dos algoritmos de inteligência artificial, o estudo apresentou três coortes distintas: um grupo controle tradicional usando métodos padrão em sala de aula, um grupo apenas VR interagindo com ambientes virtuais fixos sem algoritmos adaptativos, e um grupo experimental usando a plataforma inteligente de ensino totalmente integrada. Os alunos do grupo experimental podiam aprender em uma cena de VR, e cada aluno podia gerar caminhos de aprendizagem personalizados com base em suas características de comportamento de aprendizagem por meio da plataforma de ensino inteligente, ajustando dinamicamente o conteúdo e a dificuldade de aprendizagem em resposta ao feedback em tempo real durante o processo de aprendizagem. O grupo controle recebeu educação cultural por meio de métodos tradicionais de ensino, como explicações em sala de aula, leitura de livros didáticos e vídeos. O grupo controle recebeu educação cultural padronizada por meio de palestras conduzidas por instrutores, leituras designadas e apresentações multimídia lineares. Essa instrução básica usava conteúdo informativo idêntico e mantinha o mesmo ritmo temporal do currículo experimental.
Três hipóteses foram elaboradas para esclarecer o propósito do estudo: (1) O ambiente de aprendizagem imersivo proporcionado pela tecnologia de RV pode melhorar significativamente a participação e o interesse dos alunos na aprendizagem. (2) A produção do caminho de aprendizagem personalizado da Transformer e da NCF melhorou efetivamente o desempenho acadêmico dos alunos e reduziu as diferenças no domínio do conhecimento entre os diferentes alunos. (3) A plataforma de ensino inteligente poderia ajustar dinamicamente o conteúdo e a dificuldade de aprendizagem com base no feedback em tempo real dos alunos, melhorando ainda mais os resultados de aprendizagem dos alunos.
Processo experimental: (1) Foi realizado um teste pré-experimental de conhecimento cultural em estudantes dos grupos experimental e controle para garantir que os níveis culturais iniciais dos dois grupos fossem semelhantes e para reduzir erros experimentais. (2) Os alunos do grupo experimental usaram a cena de VR construída e a plataforma de ensino inteligente, realizaram um estudo cultural de um mês, e o conteúdo de aprendizagem foi ajustado dinamicamente de acordo com a plataforma de ensino inteligente. O grupo controle utilizou métodos tradicionais de ensino. Devido às limitações logísticas do piloto inicial, a intervenção durou quatro semanas. Um estudo longitudinal de acompanhamento realizado durante um semestre completo de 16 semanas culminou em um teste de retenção atrasado na semana 20. A avaliação demonstrou uma retenção 22% maior de conceitos históricos-alvo na coorte orientada algoritmicamente do que no grupo tradicional de instrução. Detalhes preliminares do protocolo foram fornecidos na seção de limitações para contextualizar os achados atuais como evidências de curto prazo. (3) Após o experimento, os dois grupos de alunos receberam o mesmo teste de conhecimento cultural para avaliar seu desempenho na aprendizagem e a conclusão das tarefas.
Os indicadores de avaliação para os alunos incluíram desempenho acadêmico, conclusão das tarefas de aprendizagem e progresso da aprendizagem. Utilizando estatísticas descritivas, os indicadores de avaliação relevantes para os grupos experimental e controle foram resumidos. Os indicadores de avaliação da plataforma de ensino inteligente incluíram o tempo de resposta.