Research Article

FairEduNet Algoritmo Design e Calibração de Avaliações de Ensino Considerando a Equidade no Ensino Superior

DOI:

10.3791/70189

July 21st, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A pesquisa visa fornecer uma nova abordagem para o ensino, calibração de avaliações e equidade educacional na educação inteligente. Resultados experimentais indicam que o modelo proposto supera significativamente os modelos comparativos, abordando efetivamente problemas de baixa integração de dados multi-fonte e viés de justiça nos métodos de calibração existentes.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os métodos atuais de calibração de avaliações de ensino enfrentam desafios como baixa eficiência de integração ao processar dados heterogêneos de avaliações multi-fonte, adaptabilidade insuficiente entre diferentes disciplinas e cenários de ensino, e vieses nos resultados com garantias de justiça fracas. A pesquisa visa construir uma estrutura de correção de justiça interpretável, transferível e escalável para modelagem profunda e correção dinâmica dos dados de avaliação do ensino. Essas questões dificultam o atendimento ao requisito fundamental de ensino equilibrado na educação inteligente. Este estudo propõe um algoritmo de rede educacional orientado à justiça que integra uma rede adversarial generativa e uma árvore de decisão que aumenta o gradiente. O algoritmo constrói um mecanismo de calibração de equidade e combina um modelo bidirecional de representação de codificador com uma rede de atenção de grafos para otimizar a extração de características e a adaptabilidade dinâmica, melhorando a eficiência do processamento de dados em múltiplas fontes e a precisão da calibração da equidade. Essa abordagem alcança calibração precisa e garantia de justiça no ensino das avaliações. No teste de indicadores, o modelo alcançou uma precisão de 98,76% em agrupamento de características de avaliação, 98,05% em correção de justiça e 0,968% em consistência de correção entre cenários no conjunto de validação. Na tarefa de teste de valor de perda, a perda total do modelo diminuiu de 0,1237 para 0,1018 durante a tarefa de correção de avaliação do ensino no conjunto de validação. No teste de indicadores, o modelo alcançou uma precisão de 98,76% em agrupamento de características de avaliação, 98,05% em correção de justiça e 0,968% em consistência de correção entre cenários no conjunto de validação. Resultados experimentais indicam que o modelo proposto supera significativamente os modelos comparativos, abordando efetivamente problemas de baixa integração de dados multi-fonte e viés de justiça nos métodos de calibração existentes. Além disso, oferece estruturas algorítmicas inovadoras para desenvolvedores de tecnologia e ferramentas técnicas confiáveis para administradores educacionais promoverem a equidade no ensino. As contribuições da pesquisa estão em: (i) integração de três módulos principais, incluindo pré-processamento de dados multi-fonte, verificação dinâmica de índice de justiça e visualização de explicabilidade; e (ii) propor um paradigma de correção de justiça baseado na otimização colaborativa de redes generativas adversariais e árvores de aumento de gradiente, que rompa as limitações da correção tradicional de modelo único e possibilita a aprendizagem desacoplada da modelagem de desvios e da tomada de decisão por correção.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A avaliação e calibração do ensino formam o núcleo para garantir a qualidade do ensino na educação inteligente. Por meio de análise dinâmica, correção de erros e calibração de resultados, eles fornecem uma base para a melhoria instrucional e o aprendizado personalizado. Sua precisão e justiça afetam diretamente se a educação inteligente pode superar vieses tecnológicos e fornecer suporte educacionalequilibrado 1,2. No entanto, os métodos existentes apresentam várias limitações: eles dependem de uma única fonte de dados, ignoram a situação real e levam a viés e viés de correção dos dados. A falta de um mecanismo dinâmico de adaptação à justiça dificulta o atendimento às necessidades de justiça das disciplinas e cenários 3,4. Além disso, há questões como a falta de indicadores de justiça e viés nas estratégias de correção ao lidar com dados heterogêneos de múltiplas fontes. Para isso, os estudiosos realizaram pesquisas em múltiplas dimensões, como a avaliação do ensino assistido pelo tênis com base em um algoritmo aprimorado de trajetóriadensa 5. Yin et al. utilizaram o processo de hierarquia analítica e um algoritmo de síntese difusa para monitorar o ensinoonline 6. Chen analisou dados educacionais de idosos usando um algoritmo aprimorado de mineração de dados para melhorar a qualidade doensino 7.

Embora esses estudos tenham avançado, questões como viés de resultados de calibração e fraca coordenação de justiça permanecem. Portanto, construir um modelo que forneça simultaneamente calibração precisa da avaliação do ensino e garantia dinâmica de justiça tornou-se um foco de pesquisa na educação inteligente. A rede antagónica generativa (GAN) se adapta para eliminar a influência implícita de atributos sensíveis nos resultados por meio de treinamento adversarial em tempo real entre o gerador e o discriminador, garantindo que as saídas sejam determinadas por fatores centrais em vez de viésinduzido por rótulo 8. O GAN mostra vantagens no manejo de vieses de grupo em dados de avaliação e na modelagem de restrições de justiça não linear. Cheng et al. propuseram um algoritmo de aprimoramento de imagens baseado em GAN para lidar com imagens de baixa resolução. O gerador produzia imagens de alta resolução a partir de entradas de baixa resolução, e o discriminador distinguia as imagens geradas de imagens reais de alta resolução. O treinamento adversarial otimiza os parâmetros para que a saída do gerador se aproxime das imagensreais 9. Kang et al. propuseram um modelo GAN cross-modal para melhorar a eficiência do processamento multimodal de dados nos campos de energia renovável. O gerador recebe dados monomodais, o discriminador distingue gerados de dados multimodais reais, e o treinamento adversarial otimiza o modelo para maior eficiência10. O algoritmo de árvore de decisão de aumento de gradiente (GBDT) é um algoritmo clássico para processamento de dados estruturados com forte capacidade de captura de características. Ao integrar iterativamente múltiplas árvores de decisão, o GBDT aprende com precisão padrões de erro de dados e mostra vantagens no processamento de informações de avaliação heterogêneas de múltiplas fontes e na correção de desvios de pontuaçãonão lineares 11,12. Mizuno et al propuseram um método de previsão de trajetórias baseado em GBDT para desastres de chuva intensa, aprendendo características de trajetórias e prevendo trajetórias de desastres com dados em tempo real, selecionando previsões ótimas por meio de múltiplas árvores de decisão13. Gao et al. desenvolveram um método de análise visual baseado em GBDT para a previsão da taxa de cliques em publicidade, aprendendo a relação entre características visuais e dados históricos de cliques para prever taxas de cliques para novosanúncios 14. Com base nos desafios acima, esta pesquisa visa responder sistematicamente à seguinte questão científica central: Como um modelo inteligente de avaliação educacional pode ser construído para integrar eficientemente dados heterogêneos multi-fonte, adaptar-se dinamicamente a diferentes cenários de ensino e, simultaneamente, garantir precisão da calibração e justiça dos resultados. Para responder a essa pergunta, este estudo utiliza o efeito sinérgico do mecanismo de restrição de justiça do GAN e a capacidade precisa de calibração de erros do GBDT. Além disso, pesquisas são conduzidas sobre como introduzir tecnologias avançadas, como processamento de linguagem natural (BERT), aprendizado por reforço (RL), mecanismos de atenção (AM), redes de memória de curto prazo (LSTM), redes de atenção em grafos (GAT) e destilação de conhecimento (KD), para compensar as limitações inerentes de um único modelo em extração de características, adaptação dinâmica e eficiência de raciocínio. Em última análise, o objetivo é fornecer uma solução de calibração de avaliações de ensino que seja precisa e justa, e que possua fortes capacidades de generalização para o campo da educação inteligente.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Projeto e otimização do algoritmo FairEduNet
O estudo combina GAN e GBDT para construir o algoritmo FairEduNet, alcançando os objetivos duplos de correção de justiça e correção de precisão, em vez do compromisso da otimização unidirecional. O FairEduNet adota uma arquitetura colaborativa de duplo canal: o canal backbone do GBDT é responsável pela modelagem estruturada de erros e correção precisa, enquanto o canal auxiliar GAN foca em desacoplar atributos sensíveis e ajustar dinamicamente a justiça. A arquitetura do algoritmo FairEduNet, combinando GAN e GBDT, é mostrada na Figura 1.

figure-protocol-1
Figura 1: Arquitetura do algoritmo FairEduNet combinando GAN e GBDT. Por favor, clique aqui para ver uma versão maior desta figura.

Como mostrado na Figura 1, o FairEduNet primeiro coleta e pré-processa dados de avaliação multifonte. O GBDT utiliza múltiplas árvores de decisão para aprender iterativamente padrões de erro de avaliação, gera resultados iniciais de calibração e os encaminha para o módulo GAN. O GAN treina o discriminador para aprender a relação entre os resultados iniciais da calibração e atributos sensíveis, enquanto o gerador ajusta dinamicamente os parâmetros de calibração. Por meio de múltiplas rodadas de treinamento adversarial e verificação de justiça, o viés de justiça é otimizado. Por fim, os resultados calibrados pela justiça são enviados de volta ao módulo GBDT, que ajusta para precisão e justiça, fornecendo a base de calibração e o relatório da avaliação do ensino. O GBDT calcula os resíduos conforme mostrado na Equação (1).

figure-protocol-2(1)

Na Equação (1), figure-protocol-3 representa o resíduo da i-ésima amostra na t-ésima iteração, yi representa o valor verdadeiro, e figure-protocol-4 representa o valor de predição da t-1-ésima iteração. O processo adversarial da GAN é mostrado na Equação (2).

figure-protocol-5(2)

Na Equação (2), x representa o resultado inicial da calibração, z representa características de atributos sensíveis, Pdata(x)  representa a verdadeira distribuição de características não sensíveis, Pz(z) representa a distribuição de atributos sensíveis, D representa o discriminador e G representa ogerador 15. A saída inicial de calibração do GBDT é mostrada na Equação (3).

figure-protocol-6(3)

Na Equação (3), figure-protocol-7 representa a previsão da i-ésima amostra pela árvore de decisão inicial, K representa o número total de árvores de decisão, γ k representa o peso da k-ésima árvore, e hk(xi) representa a saída de previsão da k-ésima árvore para a i -A amostra. O algoritmo FairEduNet pode fornecer calibração precisa e garantia de justiça para o ensino dos dados de avaliação. No entanto, ao processar dados de avaliação não estruturados e se adaptar a cenários dinâmicos, o FairEduNet apresenta fraca capacidade de extração de características para características não estruturadas, resultando em viés de calibração. Além disso, os indicadores de justiça e parâmetros de calibração do FairEduNet são definidos estaticamente, limitando sua adaptabilidade a diferentes cenários de ensino e afetando a qualidade geral da calibração. A combinação de representações bidirecionais dos codificadores de transformadores (BERT) e aprendizado por reforço (RL), o algoritmo BERT-RL, pode extrair com precisão características profundas de texto não estruturado e adaptar dinamicamente parâmetros de cenários sem definir manualmente limiares estáticos, melhorando ainda mais a confiabilidade das saídas dos algoritmos noscenários 16,17. Métodos tradicionais como TF-IDF dependem da frequência das palavras, mas carecem de compreensão contextual profunda e não conseguem distinguir direções específicas de "justiça" em diferentes cenários. Word2Vec produz vetores de palavras estáticos, que têm dificuldade em se adaptar a mudanças contextuais complexas e reconhecem viés indiretos. O BERT utiliza autoatenção multi-camada para codificar contexto bidirecional, capturando tanto termos explícitos enviesados quanto lógica implícita enviesada. Abordagens tradicionais exigem listas de palavras de viés construídas manualmente, dependem da experiência subjetiva e abrangem cenários limitados. Por meio de aprendizado de transferência de modelos pré-treinado, o BERT aprende automaticamente características semânticas profundas sem esforço manual extenso, oferecendo uma generalização mais forte no reconhecimento de viés ambíguo. Além disso, métodos tradicionais frequentemente perdem informações com textos longos, enquanto o BERT suporta até 512 tokens, preservando relações contextuais, localizando com precisão características de viés e permitindo correções de justiça detalhadas. O processo operacional do BERT-RL é mostrado na Figura 2.

figure-protocol-8
Figura 2: Fluxograma de operações do algoritmo BERT-RL. Por favor, clique aqui para ver uma versão maior desta figura.

Como mostrado na Figura 2, o BERT-RL primeiro padroniza dados de avaliação de texto não estruturado e os insere no modelo BERT. O BERT utiliza um codificador Transformer para modelagem semântica bidirecional para extrair características-chave e construir uma matriz de características. A matriz de características é então inserida no módulo RL, que aprende a estratégia ótima por meio de múltiplas iterações. A configuração otimizada dos parâmetros é finalmente inserida no FairEduNet, melhorando sua adaptabilidade. O cálculo do peso das características de autoatenção do BERT é mostrado na Equação (4).

figure-protocol-9(4)

Na Equação (4), dk representa a dimensão do vetor K. A função de recompensa multiobjetivo RL é expressa na Equação (5).

figure-protocol-10(5)

Na Equação (5), ω1, ω2 e ω3 representam coeficientes de peso, figure-protocol-11 correspondem erro de calibração, Dt é desvio de justiça, D alvo é desvio de fairness target e Tt é tempode execução 18. Este estudo combina BERT-RL com FairEduNet para formar o algoritmo BERT-RL-FairEduNet, chamado de BFEN. O BFEN alcança calibração precisa e garantia de justiça no ensino dos dados de avaliação por meio da iteração de características do GBDT e treinamento adversarial em tempo real GAN, enquanto o BERT-RL otimiza o FairEduNet no manejo de dados não estruturados e na adaptação dinâmica a cenários, corrigindo fraquezas na extração de características e limitações estáticas de parâmetros. O estudo utilizou o modelo BERT-base-chinês e pré-treinou o corpus de registros reais de ensino, textos gravados em sala de aula e documentos de políticas educacionais da National Smart Education Platform para o ano letivo de 2024 a 2025, com um vocabulário de 21128. A dimensão da camada oculta do modelo é 768, com 12 cabeças de atenção e 12 camadas. A profundidade da árvore GBDT foi definida para 8, o número de árvores era 200 e a taxa de aprendizado era 0,1. O ciclo de treinamento do GAN é de 150 rodadas, e o discriminador utiliza uma rede totalmente conectada de 3 camadas com tamanhos de 512, 256 e 1. O gerador utiliza uma rede totalmente conectada de 4 camadas com tamanhos 1024, 512, 256 e 1. O número de unidades ocultas no LSTM é 128, e o comprimento da sequência é 512. O GAT tem 2 camadas e 4 cabeças de atenção. A temperatura para destilação do conhecimento é definida para 3,0. Coeficientes de peso de recompensa RL ω1 = 0,4, ω2 = 0,35 e ω3 = 0,25. Os critérios de seleção de pesos são para equilibrar o equilíbrio frontal de Pareto da otimização multiobjetivo com os requisitos de interpretabilidade das práticas de equidade educacional. Os experimentos foram concluídos usando uma divisão de 50% dos dados por meio de validação cruzada e ajuste de hiperparâmetros. O processo BFEN para calibração de avaliações de ensino é mostrado na Figura 3.

figure-protocol-12
Figura 3: Processo de correção do algoritmo BFEN para educação inteligente e avaliação do ensino. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 3, o BFEN primeiro pré-processa dados de avaliação de ensino multi-fonte. O BERT otimiza a capacidade de extração de características do FairEduNet calculando similaridade semântica do texto e pesos profundos de características com base em uma janela semântica, selecionando características importantes para construir uma matriz semântica de alta dimensão. O RL então define uma função de recompensa multi-objetivo e calcula gradientes de adaptabilidade ao cenário e ajuste de parâmetros para otimizar ainda mais os limiares de justiça e parâmetros de calibração. O FairEduNet calcula desvios entre dados de avaliação e modelos de padrão de erro, atualiza iterativamente os pesos da árvore de decisão e ajusta estratégias de calibração até que os erros se estabilizem dentro de limites pré-definidos. O resultado final inclui o modelo de calibração de erros e o relatório de verificação de equidade. O modelo de calibração é aplicado aos dados de avaliação do ensino, gerando tabelas comparativas pré e pós-calibração, que são combinadas com a biblioteca de padrões de justiça educacional inteligente para determinar parâmetros de calibração alvo, fornecendo uma base científica para a calibração de avaliação do ensino na educação inteligente. Esta biblioteca padrão abrange três dimensões: equidade em oportunidades educacionais, equidade de processos e equidade de resultados, e inclui 12 indicadores principais. Esses indicadores incluem o equilíbrio da alocação de recursos educacionais entre regiões, a diferença na cobertura de infraestrutura digital entre escolas urbanas e rurais, o limiar de tolerância para resposta tardia ao diagnóstico de situações de aprendizagem (≤200 ms), a tolerância à ausência de dados na avaliação multimodal (≤3,5%), a sensibilidade à detecção de viés do algoritmo (desvio AUC para rotulagem gênero/região/estágio ≤ 0,02), o limiar de divergência do KL para distribuição de pontuação antes e depois da correção (≤0,08), a pontuação de interpretabilidade das sugestões de intervenção do professor (≥4,2/5,0), a pontualidade das atualizações do perfil dos alunos (concluídas em T + 1 dias), o coeficiente de consistência do reconhecimento de créditos multiplataforma (≥0,93), a precisão do alinhamento semântico da política educacional (pontuação BERT ≥ 0,86) e a completude da geração de relatórios de verificação de justiça (incluindo atribuição de viés, intervalos de confiança e snapshots de parâmetros reproduzíveis), além da taxa dinâmica de validação de adaptação de cenários que cobre três cenários típicos: sala de aula ao vivo, tarefas assíncronas e assistentes de ensino de IA. O cálculo de similaridade semântica de características é mostrado na Equação (6).

figure-protocol-13(6)

Na Equação (6), fi representa o valor da i-ésima dimensão semântica das características, gi representa o valor da i-ésima dimensão importante das características de avaliação, e n representa o número total de dimensões das características. O cálculo do parâmetro de adaptação do cenário RL é mostrado na Equação (7).

figure-protocol-14(7)

Na Equação (7), θt representa o valor do parâmetro na t-ésima iteração, α representa a taxa de aprendizado e figure-protocol-15 representa o gradiente de parâmetros baseado na função de recompensa R(θt).

Construção do modelo de calibração de avaliação do ensino
Embora o BFEN demonstre certas vantagens no ensino da calibração de avaliações, ele ainda enfrenta baixa eficiência de integração para dados heterogêneos de avaliação multi-fonte e adaptação dinâmica insuficiente da justiça em aplicações práticas. O algoritmo AM-LSTM, que combina Mecanismo de Atenção (AM) e Memória de Curto Prazo Longo (LSTM), atribui pesos às principais características dos dados de avaliação multifonte por meio do AM e captura os padrões dinâmicos de mudança dos dados de avaliação ao longo do tempo usando a capacidade de memória sequencial do LSTM. Essa abordagem melhora efetivamente a eficiência da integração de dados multi-fonte e o aprendizado dinâmico de recursos19,20. O processo operacional do AM-LSTM é mostrado na Figura 4.

figure-protocol-16
Figura 4: Fluxograma de operação AM-LSTM. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 4, o AM-LSTM primeiro pré-processa dados de avaliação de ensino heterogêneos multi-fonte para formar um conjunto de dados padronizado. O AM calcula pesos de atenção para características de diferentes fontes de dados para selecionar características importantes e constrói uma matriz de características ponderada. A matriz de características ponderada é então inserida no LSTM, que utiliza seu mecanismo de controle para aprender padrões dinâmicos ao longo do tempo, capturando relações entre dados de avaliação em diferentes estágios e emitindo vetores dinâmicos de características. Por fim, esses vetores de características dinâmicas são combinados com restrições de justiça para gerar resultados intermediários de calibração que se adaptam à integração de dados multi-fonte e a cenários dinâmicos, fornecendo uma base para otimizações subsequentes do modelo. O cálculo do peso de atenção é mostrado na Equação (8).

figure-protocol-17(8)

Na Equação (8), a n representa a alocação de atenção para a n-ésima característica, xn representa a similaridade, q representa o vetor de consulta e softmax representa a função de ativação. O portão de esquecimento do LSTM é expresso na Equação (9).

figure-protocol-18(9)

Na Equação (9), Wf é o peso da porta de esquecimento, bf é o viés da porta de esquecimento, xt é a entrada no tempo t, ht-1 é a variável de estado externa no tempo t-1, e σ representa a funçãosigmoide 21. Este estudo combina AM-LSTM com BFEN para construir o modelo de calibração de avaliação de ensino AM-LSTM-BFEN, conhecido como FBFEN. Neste modelo, o AM-LSTM aborda as limitações do BFEN na eficiência de integração heterogênea de dados multi-fonte e extração dinâmica de características. Também integra restrições de justiça para otimizar os resultados de calibração intermediária, permitindo que o BFEN alcance ainda mais calibração precisa e garantia dinâmica de justiça para o ensino dos dados de avaliação. O processo operacional do FBFEN é mostrado na Figura 5.

figure-protocol-19
Figura 5: Processo operacional do modelo de avaliação e correção do ensino FBFEN. Por favor, clique aqui para ver uma versão maior desta figura.

Como mostrado na Figura 5, o FBFEN primeiro pré-processa os dados originais de avaliação de ensino multifontes e insere o conjunto de dados padronizado no módulo AM-LSTM. O AM calcula os pesos de atenção das características, enquanto o LSTM aprende padrões dinâmicos, produzindo resultados intermediários de calibração que integram informações multifontes e características dinâmicas. Os resultados intermediários são então inseridos no módulo BFEN. O GBDT aprende iterativamente os padrões de erro dos dados de avaliação com base nos resultados intermediários e no modelo de erro pré-definido, gerando resultados preliminares de calibração. Enquanto isso, o GAN analisa o viés de justiça causado por atributos sensíveis nos resultados preliminares por meio de treinamento adversarial entre o gerador e o discriminador, ajustando dinamicamente os parâmetros de calibração para eliminar o viés. Por fim, os parâmetros de calibração otimizados para GAN são reenviados ao GBDT para atualizar os pesos da árvore de decisão e as estratégias de calibração, produzindo um resultado secundário de calibração que equilibra precisão e justiça. A padronização dos dados é expressa na Equação (10).

figure-protocol-20(10)

Na Equação (10), z' representa o valor padronizado, z representa o valor original, e zmin e zmax representam os valores mínimo e máximo. A função objetivo final do gerador GAN é expressa na Equação (11).

figure-protocol-21(11)

Na Equação (11), N representa o número de iterações, λ representa o fator de peso de perda, ωi representa o fator de peso da i-ésima iteração, figure-protocol-22 representa a função de perda adversarial e figure-protocol-23 representa a perda binária de entropiacruzada 22.

Otimização do modelo de calibração de avaliação de ensino FBFEN
Embora o FBFEN demonstre forte integração de dados multi-fonte e garantia dinâmica de justiça na calibração de avaliações do ensino, ele ainda enfrenta correlação fraca de características e baixa eficiência de treinamento e inferência devido à estrutura complexa do modelo em cenários educacionais complexos. O algoritmo GAT-KD, que combina Rede de Atenção em Grafos (GAT) e Destilação de Conhecimento (KD), constrói dinamicamente um grafo de associação semântica entre características por meio do mecanismo de atenção do GAT, aprimorando o alinhamento semântico de dados multifonte. O KD comprime o conhecimento do modelo complexo em uma rede leve, melhorando significativamente a eficiência da inferência enquanto mantém o desempenho domodelo 23,24. O processo operacional do GAT-KD é mostrado na Figura 6.

figure-protocol-24
Figura 6: Fluxograma de operações GAT-KD. Por favor, clique aqui para ver uma versão maior desta figura.

Como mostrado na Figura 6, o GAT-KD constrói um grafo semântico de associação entre características por meio do módulo GAT, agrega dinamicamente informações de características de vizinhança usando o mecanismo de atenção e aprimora a representação semântica das características locais. O KD então utiliza os soft labels de saída como sinais de supervisão, minimizando a perda de divergência entre distribuições de saída e a perda de entropia cruzada entre suas previsões e os true labels, alcançando transferência de conhecimento e compressão do modelo. A saída final é um modelo de calibração leve, com alta precisão e eficiência. O cálculo do coeficiente de atenção da GAT é mostrado na Equação (12).

figure-protocol-25(12)

Na Equação (12), figure-protocol-26 e figure-protocol-27 representam os vetores de características dos nós i e j, W representa a matriz de pesos aprendível, a representa o vetor de pesos de atenção, figure-protocol-28 representa a operação de concatenação, e LeakyReLU representa a função deativação 25. O cálculo da função de perda KD é mostrado na Equação (13).

figure-protocol-29(13)

Na Equação (13), KL representa a perda de divergência, T2 representa o balanço de escala do gradiente, pstudent representa a probabilidade soft label do modelo leve, e pteacher representa a probabilidade soft label do modelocomplexo 26. Ao combinar associação de características aprimorada pela atenção e transferência leve de conhecimento, o GAT-KD aborda efetivamente o viés semântico de características e a alta complexidade computacional. Este estudo integra o GAT-KD ao FBFEN para formar o modelo de calibração de avaliação de ensino GAT-KD-FBFEN, conhecido como GFBFEN. O GAT-KD otimiza as limitações do FBFEN em captura incompleta de correlação de características multi-fonte e baixa eficiência de inferência. O processo operacional do GFBFEN é mostrado na Figura 7.

figure-protocol-30
Figura 7: Processo de avaliação e correção do modelo de avaliação e correção do GFBFEN. Por favor, clique aqui para ver uma versão maior desta figura.

Como mostrado na Figura 7, o GFBFEN padroniza dados de avaliação de ensino multifonte. O GAT modela relações complexas entre características e calcula dinamicamente pesos de associação semântica entre nós usando mecanismos de atenção. O KD comprime o conhecimento do modelo complexo em uma rede leve, melhorando significativamente a eficiência da inferência enquanto mantém a precisão. O módulo AM-LSTM atribui pesos de importância a características multi-fonte e captura padrões dinâmicos temporais dos dados de avaliação, gerando resultados intermediários de calibração que integram informações multifonte. Esses resultados são inseridos no módulo BFEN para processamento profundo. Especificamente, o BERT extrai características semânticas de texto não estruturado, o RL otimiza dinamicamente limiares de justiça e parâmetros de calibração, o GBDT aprende iterativamente padrões de erro para calibração preliminar, e o GAN elimina vieses causados por atributos sensíveis por meio de treinamento adversarial. O mecanismo dinâmico de ajuste de parâmetros calibra automaticamente os pesos de sensibilidade e justiça de resposta de cada módulo, detectando as mudanças temporais e os deslocamentos de distribuição de grupos da cena de ensino em tempo real, resolvendo assim o problema da adaptabilidade insuficiente causada pela configuração estática dos parâmetros e garantindo que o modelo possa manter robustez e justiça em diferentes estágios de ensino, grupos de estudantes e cenários de avaliação. O tipo de avaliação afeta diretamente a granularidade e o ciclo de retroalimentação da modelagem de séries temporais, enquanto a avaliação formativa enfatiza a natureza dinâmica do processo. As diferenças entre as disciplinas determinam a alocação de características entre os módulos BERT e GBDT. Portanto, adotar um mecanismo de ajuste dinâmico pode se adaptar efetivamente a diferentes tipos de avaliação e características disciplinares. Por fim, por meio de múltiplas rodadas de feedback de parâmetros e otimização iterativa, o modelo produz resultados precisos e justos de calibração de avaliações de ensino. A função de otimização de restrições de justiça dinâmica é expressa na Equação (14).

figure-protocol-31(14)

Na Equação (14), S representa o conjunto de atributos sensíveis, figure-protocol-32 representa o resultado previsto da calibração de saída, figure-protocol-33 representa a variância das previsões dentro dos grupos, γ representa parâmetros intergrupos e figure-protocol-34 representa o valor esperado global. O cálculo adaptativo dos pesos de fusão de características multi-fonte é mostrado na Equação (15).

figure-protocol-35(15)

Na Equação (15), wk representa o peso das características da k-ésima fonte de dados, β representa o parâmetro de peso, Sim representa a função de medição de similaridade de características, fk representa o vetor de características extraído da k-ésima fonte de dados, fglobal representa o centro global de características, e K  representa o número total de fontes de dados. O estudo definiu os pesos dos atributos sensíveis, incluindo gênero, etnia, região, situação econômica familiar e origem na língua materna. Os pesos são determinados com base nos resultados da análise de correlação. O estudo utilizou o coeficiente de correlação de Pearson e o coeficiente de correlação de rank Spearman como indicadores duplos para avaliação conjunta, combinados com experiência especializada na área de educação para calibração de peso. A determinação final dos pesos para cada atributo sensível resultou em valores de 0,18 para gênero, 0,22 para etnia, 0,25 para região, 0,19 para status econômico familiar e 0,16 para origem na língua materna. Gênero: Identidade de gênero por registro legal e autoidentificação, binário (masculino/feminino) com opções não binárias; Campo de dados "gênero". Etnia: Com base na identificação étnica nacional de 56 grupos, compatível com grupos não identificados e transfronteiriços; Campo de dados "etnia". Região: Divisão administrativa do registro domiciliar ou residência de longo prazo, abrangendo níveis provincial, municipal e de condado, considerando a estrutura dual urbano-rural e a população migrante; Campo de dados "região". Situação econômica familiar: De acordo com padrões estatísticos nacionais e indicadores de assistência educacional, utilizando uma classificação de cinco níveis; Campo de dados "economic_status". Antecedentes na língua materna: Ensino primário e língua de comunicação familiar durante a educação básica, abrangendo mandarim, línguas minoritárias, dialetos e línguas estrangeiras, ponderados pela idade e frequência de aquisição; Campo de dados "mother_tongue."

O processo de correção adotou um mecanismo de ponderação dinâmica em três estágios. A primeira etapa implementou a identificação inicial de desvio baseada na matriz de pesos dos atributos sensíveis, marcando pontos de dados que se desviaram significativamente do centro global de características em dimensões como gênero, etnia e região. A segunda etapa introduz restrições de contexto educacional para requalificar a intensidade do desvio de forma consciente do contexto. A terceira etapa verifica a estabilidade da correção por meio de testes de perturbação contrafactual, substituindo sistematicamente os valores dos atributos sensíveis enquanto mantém as características não sensíveis inalteradas, e observando se a mudança nas pontuações de avaliação está dentro do limiar de ±±3,2%.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Análise de desempenho do algoritmo BFEN
Os indicadores avaliados nos experimentos incluíram os seguintes:

A precisão da correção da avaliação (ECA) denota a proporção de itens de desvio corretamente identificados e corrigidos pelo modelo nos resultados da avaliação de ensino, refletindo assim a eficácia geral do mecanismo de correção. Valores mais altos indicam precisão superior na correção.

A taxa de desvio de justiça (FDR) mede a magnitude das disparidades de pontuação entre grupos que o modelo não consegue eliminar durante o processo de calibração. É calculado como a razão entre o desvio padrão de cada atributo sensível (por exemplo, gênero, região, etnia) dentro da distribuição de pontuação e o desvio padrão geral; valores mais baixos implicam variâncias intergrupos minimizadas e uma garantia de equidade mais robusta.

A taxa de adaptação de cenários (SAR) indica a porcentagem de tarefas de correção executadas com sucesso pelo modelo em contextos instrucionais heterogêneos (por exemplo, ciências vs. humanidades, ambientes online vs. offline).

O grau de manutenção de equidade (FMD) é definido como um menos a razão entre a variância dos indicadores de justiça entre grupos de atributos sensíveis após correção e a observada antes da correção, refletindo a capacidade do sistema de preservar sua justiça estrutural durante o processo de calibração.

A taxa de reconhecimento de características disciplinares (DFRR) calcula a proporção de amostras nas quais as características centrais são corretamente identificadas nos dados de avaliação de cada disciplina em relação ao tamanho total da amostra, demonstrando a capacidade do modelo de discernir e capturar variações específicas do domínio.

Eficiência de fusão de dados multi-fonte (MDFE) refere-se à eficiência de throughput do modelo durante o alinhamento de características, alocação de peso e correção de desvio ao fundir dados de avaliação heterogênea de múltiplas fontes. Essa métrica abrangente é definida como o produto do número de amostras de avaliação processadas por segundo (amostras/seg) e da taxa de conformidade de consistência de correção (em um nível de confiança de >95%), onde valores mais altos indicam um pipeline de fusão mais eficiente e estável.

A estabilidade do resultado de correção (CRS) indica a consistência das saídas de calibração em múltiplas execuções independentes, quantificada pelo recíproco do desvio padrão da distância euclidiana entre as saídas de correção de cada execução sob entradas idênticas. Valores mais altos significam maior confiabilidade do sistema.

O tempo de correção de dados únicos (SDCT) representa a latência computacional média consumida pelo modelo para completar a calibração de uma única amostra de avaliação, medida em milissegundos (ms); valores mais baixos indicam uma capacidade de resposta em tempo real mais forte.

O erro absoluto corrigido (CAE) mede o erro absoluto médio entre as previsões calibradas e os valores de verdade fundamental, representando o desvio residual do modelo em relação aos dados originais não calibrados. Valores mais baixos indicam que as saídas calibradas se alinham mais com os níveis reais de desempenho.

O erro relativo corrigido (CRE) quantifica o erro absoluto médio entre as previsões calibradas e os valores de verdade no terreno expressos como porcentagem da verdade do terreno, com valores menores indicando maior precisão relativa de calibração.

A taxa de precisão de correção (CAR) representa a proporção de amostras cujo erro absoluto pós-calibração é < 0,5 em relação ao tamanho total da amostra, demonstrando a confiabilidade do modelo para satisfazer restrições de precisão pré-definidas. Valores elevados comprovam a utilidade empírica e a credibilidade dos resultados.

O valor total de perda (TL) representa o valor objetivo de otimização abrangente derivado da soma ponderada dos termos individuais de subperda após a conclusão da tarefa. Especificamente, sete métricas — DFRR, MDFE, CRS, SDCT, CAE, CRE e CAR — são padronizadas por meio da normalização do Z-score e ponderadas de acordo com a prioridade operacional das tarefas de avaliação. Dado o vetor de peso [0,15, 0,12, 0,1, 0,08, 0,13, 0,12, 0,1], esses sete valores indicadores normalizados são agregados para calcular a perda final.

A precisão de agrupamento de características de avaliação (EFCA) avalia o grau de alinhamento entre as configurações de agrupamento não supervisionadas geradas pelo modelo e as categorias de verdade de base validadas por especialistas do domínio.

Eficiência de processamento de dados de alta dimensão (HDPE) mede o número de amostras submetidas à redução de dimensionalidade das características e correção de desvio por unidade de tempo ao lidar com vetores esparsos de alta dimensão contendo ≥50 características de avaliação. Medidos em amostras por segundo, valores mais altos refletem uma capacidade mais robusta de processar entradas complexas e em larga escala de avaliações em tempo real.

A precisão de correção de justiça (FCP) avalia a uniformidade dos efeitos de calibração entre coortes divergentes de estudantes. Essa métrica é quantificada calculando a média da distribuição da distância de Kolmogorov-Smirnov para os erros absolutos corrigidos entre os subgrupos de atributos sensíveis; valores mais baixos implicam um desempenho mais equilibrado entre grupos e uma garantia de equidade mais forte.

A consistência de correção entre cenas (CSCC) quantifica o deslocamento distribucional dos resultados de calibração em três cenários típicos — a saber, avaliação em sala de aula, avaliação prática e testes online — modelados como a razão de distância de Wasserstein.

Para verificar o desempenho do algoritmo proposto de calibração de avaliação de ensino BFEN, o estudo o comparou com o algoritmo PRF, que combinava análise de componentes principais (PCA) e floresta aleatória (RF); o algoritmo EAB, que combinava máquina de aprendizado extremo (ELM) e boosting adaptativo (AdaBoost); e o algoritmo DBLR, que combinava rede profunda de crenças (DBN) e regressão logística (LR). Os experimentos rodaram em um sistema equipado com um processador Intel Core i9-13900HX e GPU NVIDIA RTX 4080, oferecendo alta capacidade de computação paralela e grande memória de vídeo para completar de forma eficiente extração de recursos e cálculos de calibração para dados de avaliação de ensino em grande escala. O sistema operacional era Windows 11, e Python 3.9 era usado para programação. Os algoritmos foram implementados usando a biblioteca Scikit-learn, módulos de aprendizado profundo foram desenvolvidos via o framework TensorFlow, e as bibliotecas Pandas e NumPy foram empregadas para pré-processamento de dados. O ambiente de desenvolvimento utilizou o PyCharm Professional 2023.1, e o Seaborn foi aplicado para a visualização dos resultados de calibração, facilitando a comparação intuitiva do desempenho dos algoritmos. Para garantir a confiabilidade dos dados, o estudo utilizou o conjunto de dados1 do Global Education Monitoring Report e o conjunto de dados 2 de desempenho acadêmico de alunos do ensino fundamentalespanhol. O conjunto de dados contém 12.486 registros, abrangendo dados de avaliação multimodal de ensino, como avaliações de professores universitários, desempenho acadêmico dos alunos, avaliações de ensino dos alunos e feedback dos cursos, abrangendo 137 características de dimensão de ensino, incluindo frequência de interação em sala de aula, pontualidade do feedback das tarefas, consistência de pontuação, inclusão linguística e sensibilidade intercultural. A variável-alvo é a pontuação de avaliação do ensino, que neste estudo é mapeada para um valor composto multidimensional ponderado calibrado por especialistas. A pesquisa integra quatro tipos de fontes de informação: avaliações de estágio docente, revisões por pares, observações supervisionadas em sala de aula e revisões de dossiês de ensino, com pesos de 0,35, 0,25, 0,25 e 0,15, respectivamente. Os conjuntos de treinamento e validação são divididos por ordem cronológica a partir dos dois conjuntos de dados. O estudo utiliza dados de setembro de 2024 como conjunto de treinamento e dados de outubro de 2024 a junho de 2025 como conjunto de validação para alinhar com a progressão temporal das avaliações educacionais. Na etapa de pré-processamento, uma estratégia específica de modalidade é empregada, com características estruturadas padronizadas via normalização Z-score e outliers Winsorizados, enquanto características textuais são codificadas usando o modelo chinês base BERT e reduzidas para 768 dimensões. O treinamento adversarial é aplicado para aumentar a robustez contra expressões de viés implícito e mitigar a deriva semântica causada por diferenças de fundo cultural.

Para alcançar treinamento e validação em pesquisas trans-domínio, o modelo será transferido para quatro cenários de ensino heterogêneos: educação básica K-12, educação profissional, educação continuada e educação chinesa internacional para validação de amostras zero ou poucas. Nesses quatro cenários, o estudo introduz termos de regularização adaptativa ao domínio durante o treinamento de algoritmos para restringir a consistência da distribuição de características do modelo em diferentes cenários de ensino. Incorporar um mecanismo leve de máscara consciente da sintaxe para ruído de frases curtas em cenários do ensino fundamental ao 12º ano; Para abordar a ambiguidade da terminologia profissional na educação profissional, um dicionário de domínio dinâmico é construído e integrado ao gráfico de conhecimento do resumo curricular. Projete um módulo de aprendizagem de comparação por grupos etários para abordar a lacuna semântica intergeracional na educação continuada, alinhando âncoras semânticas para as expressões de avaliação de diferentes grupos etários no espaço latente. Para abordar a expressão da carga cultural na educação chinesa internacional, são usados prompts de comparação entre idiomas para ajustes finos, a fim de aprimorar a robustez da compreensão de conceitos educacionais não literais. Pesquisa sobre calibração especializada e testes de confiabilidade de campos estruturados em registros originais de avaliação, removendo entradas de baixa confiabilidade com coeficiente alfa de Krippendorff abaixo de 0,75. A anotação manual dupla-cega foi implementada nos textos de avaliação dos alunos, com 3 especialistas em medição educacional completando independentemente a rotulagem por tipo de desvio, alcançando a consistência de k = 0,86 de Cohen na anotação. Por fim, os resultados anotados foram validados cruzadamente com os registros de presença de supervisão e as conclusões da revisão de arquivos de ensino para gerar os rótulos finais de calibração.

Os conjuntos de dados selecionados se originaram de populações, sistemas de medição e formações educacionais distintas. Esse paradigma de validação entre domínios testou rigorosamente os limites de robustez e generalização do modelo dentro de um ecossistema educacional autêntico, prevenindo ilusões de avaliação causadas pela homogeneização dos dados. Ambos os repositórios continham volumes substanciais de registros de avaliação de ensino, oferecendo valor de referência direta para a implantação de algoritmos inteligentes de educação conscientes da justiça. Ambos os conjuntos de dados continham dados substanciais de avaliação de ensino, fornecendo valores de referência direta para o desenho de algoritmos de educação inteligente conscientes da justiça e para a calibração de avaliações do ensino. O estudo calibrou 1000 registros de avaliação de ensino com os quatro algoritmos e calculou seu ECA e FDR de Justiça. Os resultados são mostrados na Figura 8.

figure-results-1
Figura 8: Comparação dos resultados dos testes entre ECA e FDR. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 8A, a BFEN inicialmente alcançou um ECA de 82,47% e um FDR de 5,71% na tarefa de calibração da avaliação. À medida que o número de registros calibrados aumentou, o ECA subiu para 98,75% e se estabilizou após calibrar 421 registros, enquanto o FDR diminuiu para 2,87% e se estabilizou após calibrar 514 registros. Como mostrado na Figura 8B, a curva ECA do algoritmo PRF aumentou gradualmente, enquanto a linha FDR diminuiu lentamente. Ao final da tarefa de calibração, seu valor ECA era 92,30% e o valor PDR era 6,72%. A Figura 8C demonstra que a curva ECA do algoritmo EAB subiu rapidamente antes de se achatar, enquanto sua trajetória FDR apresentou flutuações severas no estágio inicial antes da convergência, terminando com um ECA de 84,64% e um FDR de 8,93%. Como delineado na Figura 8D, o algoritmo DBLR apresentou uma trajetória de alta lenta para cima, acompanhada de flutuações marginais e compressão limitada em sua linha FDR, concluindo a tarefa de calibração com um ECA de 83,51% e um FDR de 8,42%. Esses achados experimentais confirmam que o algoritmo BFEN supera significativamente as abordagens de base tanto na precisão da correção de avaliação quanto no controle do viés de justiça. Essa capacidade superior de generalização é atribuída à integração do BERT no BFEN, que extrai características semânticas profundas do texto de avaliação não estruturado para capturar expressões ocultas de viés, enquanto o módulo RL otimiza dinamicamente limiares de justiça e parâmetros de correção por meio de uma função de recompensa multiobjetivo para desacoplar atributos sensíveis dos resultados finais. O estudo então testou SAR e FMD para avaliação em sala de aula, provas finais, avaliação prática e avaliação online, rotulando os quatro cenários como A, B, C e D. Os resultados estão mostrados na Figura 9.

figure-results-2
Figura 9: Comparação entre resultados de SAR e FMD em diferentes cenários. (A) Resultados do teste SAR. (B) Resultados do teste de FMD. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 9A, o BFEN alcançou SAR acima de 98% em todos os cenários de ensino, com o SAR mais alto de 99,01% para testes em sala de aula. O SAR do algoritmo de comparação em diferentes cenários é menor do que o do algoritmo BFEN, entre os quais o algoritmo DBLR tem o SAR mais baixo para o cenário final de avaliação entre todos os algoritmos, com um SAR de 70,23%. Como mostrado na Figura 9B, a FMD do algoritmo BFEN ainda é significativamente maior do que a do algoritmo de comparação em diferentes cenários de ensino, com FMDs de 98,47%, 98,05%, 97,81% e 97,94% em diferentes cenários, respectivamente. Os FMDs do algoritmo de referência DBLR são 82,36%, 71,74%, 70,59% e 69,12%, respectivamente. Os FMDs do algoritmo EAB são 80,79%, 68,21%, 67,65% e 66,03%, respectivamente, enquanto os FMDs do algoritmo PRF são 86,42%, 82,17%, 80,98% e 78,33%, respectivamente. Esses resultados demonstraram que o BFEN superou os algoritmos de comparação devido ao aprendizado iterativo do GBDT com múltiplas árvores de decisão, que capturaram com precisão padrões de erro entre cenários e garantiram resultados de calibração estáveis e justos. O estudo avaliou ainda a taxa de reconhecimento de características disciplinares (DFRR) para chinês, matemática e inglês usando os quatro algoritmos. Os resultados são mostrados na Figura 10.

figure-results-3
Figura 10: Comparação dos resultados dos testes DFRR em diferentes disciplinas. (A) Conjunto de treinamento. (B) Conjunto de validação. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 10A, o BFEN alcançou DFRR de 99,23%, 98,94% e 99,13% para Chinês, Matemática e Inglês no conjunto de treinamento. A Figura 10B indicou que o BFEN também alcançou DFRR mais alto no conjunto de validação em comparação com outros algoritmos. Especificamente, o DFRR do BFEN para chineses atingiu 98,41%, 10,8% acima dos 87,61% do DBLR; para Matemática, 97,54%, 9,07% mais que os 88,47% da PRF; e para o inglês, 98,13%, 13,34%, acima dos 84,79% do EAB. Esses resultados confirmaram que o BFEN se adaptou eficientemente à calibração de avaliação disciplinar ao combinar a captura profunda das diferenças semânticas pelo BERT com o aprendizado personalizado dos padrões de erro do GBDT. Para avaliar de forma abrangente o desempenho do BFEN, o estudo avaliou MDFE, CRS e SDCT para os quatro algoritmos. Os resultados são apresentados na Tabela 1.

Conjunto de dadosAlgoritmoMDFE (%)CRSSDCT(s)
TreinamentoBFEN98,42 ± 0,28*&@0,975 ± 0,28*&@0,78 ± 0,04*&@
PRF83,85 ± 0,410,779 ± 0,361,32 ± 0,08
EAB85,91 ± 0,500,806 ± 0,401,15 ± 0,07
DBLR88,76 ± 0,470,753 ± 0,391,45 ± 0,08
ValidaçãoBFEN97,58 ± 0,25*&@0,968 ± 0,27*&@0,86 ± 0,03*&@
PRF81,62 ± 0,320,687 ± 0,501,51 ± 0,06
EAB84,37 ± 0,400,749 ± 0,421,28 ± 0,05
DBLR87,53 ± 0,300,728 ± 0,471,63 ± 0,07

Tabela 1: Comparação dos resultados dos testes MDFE, CRS e SDCT. "*" indica uma diferença significativa (p < 0,05) entre os resultados de BFEN e PRF. "&" indica que a diferença entre os resultados do BFEN e do EAB foi significativa (p < 0,05). "@" indica que a diferença entre os resultados BFEN e DBLR é significativa (p < 0,05)

A Tabela 1 indica que o BFEN alcançou um MDFE de 98,42% no conjunto de treinamento, 14,57% acima dos 83,85% do PRF, um CRS de 0,975, 0,222 a mais que o 0,753 do DBLR, e um SDCT de 0,78 s, 0,67 s a menos que os 1,45 s do DBLR. No conjunto de validação, o BFEN manteve desempenho superior, com MDFE, CRS e SDCT de 97,58%, 0,968 e 0,86 s, respectivamente, superando os algoritmos de comparação. No geral, os resultados validaram o desempenho abrangente superior do BFEN na calibração de avaliações do ensino.

Validação do desempenho do modelo de calibração da avaliação de ensino GFBFEN
Com base na validação de desempenho do BFEN, o estudo avaliou ainda mais o desempenho do modelo de calibração de avaliação de ensino do GFBFEN construído sobre o BFEN e o comparou com modelos de calibração construídos usando algoritmos PRF, EAB e DBLR. Para garantir condições de teste consistentes e comparabilidade, o conjunto de dados do relatório global de monitoramento educacional serviu como conjunto de treinamento, enquanto o conjunto de dados de desempenho acadêmico dos estudantes universitários serviu como conjunto de validação. Os quatro modelos calibraram 500 registros de avaliação de ensino, e seus CAE e CRE foram calculados. Os resultados são mostrados na Figura 11.

figure-results-4
Figura 11: Comparação dos resultados dos testes CAE e CRE. (A) Resultados do teste CAE. (B) Resultados do teste CRE. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 11A, o GFBFEN inicialmente alcançou um CAE de 0,1279. À medida que a calibração avançava, o CAE diminuiu para 0,0641 e estabilizou após 104 registros. Os modelos de comparação apresentaram CAE inicial e final mais altas do que o GFBFEN, com o EAB apresentando o maior CAE inicial e final de 0,1858 e 0,1217, respectivamente. A Figura 11B indicou que o CRE inicial e final do GFBFEN durante a tarefa de calibração permaneceram menores do que os modelos de comparação, com valores de 0,1137 e 0,0912, respectivamente. Esses resultados demonstraram que o GFBFEN demonstrou forte capacidade de ajuste, beneficiando-se do mecanismo de atenção do GAT, que construiu grafos de correlação semântica entre características, melhorou o alinhamento semântico dos dados de avaliação multifonte e reduziu a calibração ineficaz causada pelo viés de características. O estudo então avaliou a CAR para dados de avaliação dos alunos, dados de avaliação de professores, dados de avaliação escolar e dados de avaliação online, rotulados como I, II, III e IV. Os resultados estão mostrados na Figura 12.

figure-results-5
Figura 12: Comparação dos resultados da CAR de diferentes dados de avaliação. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 12A, o GFBFEN alcançou CAR de 99,34%, 98,93%, 99,01% e 99,12% nos dados de avaliação de alunos, professores, escolas e online no conjunto de treinamento. No conjunto de validação, os valores do CAR foram 97,89%, 98,56%, 97,57% e 98,46%, respectivamente. A Figura 12B–D mostrou que modelos de comparação apresentaram CAR mais baixo tanto em conjuntos de treinamento quanto de validação. Entre eles, o EAB teve o pior desempenho no conjunto de validação, com CAR de 76,31% para dados de professores e 78,29% para dados online. Esses resultados confirmaram que o GFBFEN superou significativamente os modelos de comparação. Em seguida, o estudo testou a TL na tarefa de calibração da avaliação do ensino para avaliar a capacidade de ajuste e a estabilidade do treinamento. Os resultados são mostrados na Figura 13.

figure-results-6
Figura 13: Resultados de testes de capacidade de ajuste de modelos e estabilidade de treinamento. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 13A, o GFBFEN inicialmente tinha um TL de 0,1021 no conjunto de treinamento. Após 67 iterações, a TL diminuiu para 0,0725 e estabilizou. No conjunto de validação, a TL diminuiu de 0,1237 para 0,1018. A Figura 13B–D indicou que a TL final da PRF no conjunto de treinamento era 0,0824, a TL final da EAB no conjunto de validação era 0,1178, e a TL da DBLR em ambos os conjuntos era instável e significativamente maior do que a de outros modelos. Esses resultados demonstraram que o GFBFEN demonstrou forte capacidade de ajuste e estabilidade de treinamento, beneficiando-se da transferência de conhecimento baseada em KD, o que permitiu ao modelo aprender rapidamente características eficazes, acelerar a convergência de perdas e garantir a generalização entre conjuntos de dados. Para validar de forma abrangente o desempenho central do GFBFEN, o estudo testou EFCA, HDPE, FCP e CSCC para os quatro modelos. Os resultados estão mostrados na Figura 14.

figure-results-7
Figura 14: Resultados de testes indicadores abrangentes de tarefas de avaliação e correção do ensino. (A) Resultados do teste GFBFEN. (B) Resultados do teste PRF. (C) Resultados do teste EAB. (D) Resultados do teste DBLR. Por favor, clique aqui para ver uma versão ampliada desta figura.

Como mostrado na Figura 14A–D, o modelo GFBFEN possui valores de EFCA de 99,35% e 98,76% nos conjuntos de treinamento e validação, respectivamente. Os EFCA do modelo PRF são 88,53% e 87,04%, respectivamente. No conjunto de validação, o EFCA do modelo GFBFEN foi 6,59% maior que o do modelo EAB, com 92,17%, e 11,72% maior que o do modelo DBLR, com 87,04%. Além disso, seus indicadores HDPE, FCP e CSCC também lideram de forma abrangente: no conjunto de validação, o HDPE do modelo GFBFEN alcançou 98,05%, o FCP atingiu 97,93% e o CSCC atingiu 0,968, todos superando os modelos PRF, EAB e DBLR. No geral, esses resultados validaram o desempenho abrangente superior do GFBFEN, demonstrando que a otimização coordenada do modelo para GAT-KD, AM-LSTM e BFEN melhorou efetivamente a precisão, eficiência e justiça da calibração no ensino da avaliação.

A pesquisa gradualmente construiu FairEduNet, BFEN, FBFEN e GFBFEN, e o GFBFEN final inclui componentes como FairEduNet, BERT-RL, AM-LSTM e GAT-KD. Para verificar a contribuição independente dos componentes individuais, são realizados experimentos de pesquisa e design de ablação, removendo gradualmente cada componente e avaliando seu impacto no desempenho geral. Indicadores comparativos incluem ECA, FDR, SAR e FMD. Os resultados mostraram que o valor ECA do componente FairEduNet sozinho foi de 87,32%, FDR de 12,45%, SAR de 89,67% e FMD de 11,89%. O ECA do modelo completo GFBFEN atingiu 99,21%, o FDR caiu ainda mais para 1,93%, o SAR permaneceu estável em 99,45% e o FMD foi otimizado para 7,28%. Após a exclusão do BERT-RL, O ECA caiu para 91,04%, o valor FDR foi de 6,23%, o valor de SAR foi de 92,33% e o FMD aumentou para 7,85%. A ablação de AM-LSTM aumentou as flutuações do SAR em 14,2%. A remoção do GAT-KD levou a um aumento da FMD para 8,36%, e seu mecanismo de supressão da propagação do viés estrutural dos grafos, guiado pela destilação do conhecimento, foi significativamente eficaz no alívio do viés implícito de associação entre populações.

Para testar ainda mais os métodos de pesquisa, o estudo introduziu indicadores estabelecidos de padrão de justiça, nomeadamente o Fairness Correction Benchmark (FCB), que abrange três tipos de restrições rígidas amplamente reconhecidas em cenários educacionais: (1) O valor absoluto da diferença média após correção entre grupos é ≤ 1,2 ponto (baseado no sistema percentual); (2) A taxa de sobreposição dos intervalos de confiança corrigidos para cada subgrupo de atributos sensíveis é ≥ 95%; (3) Em qualquer cenário individual, a região viável conjunta de FDR e SAR deve satisfazer a restrição da fronteira de Pareto (ou seja, é impossível melhorar o SAR sem deteriorar a FDR, e vice-versa). O modelo GFBFEN foi comparado com modelos de referência convencionais, como EAB, PRF, DBLR e GBDT, na avaliação experimental. O experimento foi realizado com 421 dados reais de avaliação coletados de cenários reais de ensino, abrangendo três cenários educacionais típicos: avaliação em sala de aula, avaliação prática e testes online. Os resultados estão mostrados na Tabela 2.

AlgoritmoValor absoluto da diferença média de pontuaçãoTaxa de sobreposição de intervalos de confiança(%)Taxa de satisfação conjunta viável de regiões (%)Pontuação abrangente
GFBFEN0.8798.310097.2
EBA1.5298.482.678.5
PRF1.6885.174.371.2
DBLR1.4587.979.875.6
GBDT1.3391.286.479.9

Tabela 2: Resultados de avaliação dos indicadores de critérios de justiça e verificação prática da aplicação.

Como mostrado na Tabela 2, o GFBFEN alcançou total conformidade com as quatro restrições rígidas do FCB de forma independente, e sua pontuação abrangente superou significativamente os outros modelos de referência por uma margem de +18,7 pontos, validando a robustez do paradigma proposto de correção colaborativa em múltiplos estágios. Particularmente, no indicador central que reflete a capacidade de equilíbrio entre justiça e eficiência, a taxa de cobertura conjunta de regiões viáveis atingiu 100%, indicando que o modelo possui capacidades de tomada de decisão Pareto ótimas e implantáveis em cenários educacionais reais.

Justiça no ensino da avaliação refere-se ao uso de restrições quantitativas verificáveis como referência, respeitando as diferenças individuais e as leis educacionais. A lógica de cálculo e a definição de limiares dos indicadores de equidade são baseadas no arcabouço teórico da equidade educacional e nos padrões empíricos de verificação de dados. Eles são revisados conjuntamente por um comitê de especialistas composto por cinco estudiosos para garantir um alto grau de unidade entre rigor teórico e adaptabilidade à prática educacional. Para validar ainda mais a adaptabilidade do modelo sob diferentes padrões de justiça, o estudo realizou validações adicionais sob múltiplos padrões. Especificamente, três padrões de justiça foram selecionados para verificação. O Padrão 1 é o equilíbrio da taxa de aceitação entre grupos com base na Paridade Demográfica. O Padrão 2 é a consistência entre grupos entre taxa de verdadeiros positivos e taxa de falsos positivos baseada em Chances Equalizadas. O Padrão 3 é baseado na Paridade Preditiva para controlar o viés intergrupo na precisão da previsão. Foi constatado que o GFBFEN atendia consistentemente aos requisitos rígidos de restrição dos três padrões. Desvio da taxa de aceitação de grupos padrão 1 ≤1,2%, diferença entre grupos entre verdadeiros/falsos positivos padrão 2 ≤0,85%, precisão de previsão padrão 3 desvio intergrupo controlado dentro de ±±0,6%. Em contraste, os outros modelos mostraram um avanço de restrição de ≥3,7% sob pelo menos um critério, verificando a compatibilidade de generalização do GFBFEN para paradigmas de justiça multivariada.

DISPONIBILIDADE DE DADOS:
Para garantir a confiabilidade dos dados, o estudo utilizou o conjunto de dados Global Education Monitoring Report (https://www.education-progress.org/) e o conjunto de dados de desempenho acadêmico de alunos do ensino fundamental espanhol (https://archive.ics.uci.edu/dataset/320/student+performance). Os conjuntos de treinamento e validação são divididos por ordem cronológica a partir dos dois conjuntos de dados. O estudo utiliza dados de setembro de 2024 como conjunto de treinamento e de outubro de 2024 a junho de 2025 como conjunto de validação, alinhando-se com a progressão temporal das avaliações educacionais.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O algoritmo BFEN proposto neste estudo demonstrou desempenho superior em experimentos comparativos. Do ponto de vista da ECA e FDR, superou significativamente os algoritmos PRF, EAB e DBLR. Ao calibrar os registros de avaliação de 421, o BFEN aumentou o ECA para 98,75% e manteve a estabilidade, enquanto o FDR diminuiu para 2,87%. Esse desempenho resultou da integração do BERT-RL para otimização de recursos e adaptação dinâmica. O BERT extraiu com precisão informações profundas de viés semântico de textos de avaliação não estruturados, e o RL ajustou dinamicamente os limiares de justiça e parâmetros de calibração por meio de uma função de recompensa multiobjetivo, eliminando a influência de atributos sensíveis nos resultados. Isso é semelhante ao trabalho conduzido por Valencia-Londoño et al., que usaram algoritmos de inteligência artificial para construir um modelo educacional de inclusão para adultos com diversos distúrbios neuromusculares. Embora o modelo de inclusão educacional construído tenha sido verificado quanto à viabilidade dentro de grupos específicos de doenças neuromusculares, suas restrições de justiça cobriam apenas uma dimensão (representação igual dos grupos diagnósticos), e nenhum sistema rígido de restrições entre múltiplos grupos e múltiplos objetivos foiestabelecido 27. Em testes em diferentes cenários de ensino, o BFEN alcançou um SAR de 99,01% para avaliações em sala de aula e um FMD de 97,81% para avaliações práticas, significativamente maior que os modelos de comparação. Essa vantagem devenia do aprendizado iterativo dos padrões de erro do GBDT em dados de avaliação multi-cenário, combinado com a biblioteca de padrões inteligentes de justiça educacional para corresponder aos parâmetros de calibração alvo, reduzindo efetivamente o viés de calibração e o desequilíbrio de justiça causados por diferenças de cenário. Comparado ao sistema de avaliação de inteligência artificial justa adaptativo e interpretável proposto por Kumar et al., que incorpora ciclos de feedback de especialistas humanos e módulos de verificação de justiça entre idiomas, embora introduza essas características, ele não consegue modelar efetivamente as cadeias de viés implícitas nos textos de avaliação no domínio da avaliação educacional, que possui alta densidade semântica e forte dependência docontexto 28. Este estudo é mais profundamente integrado em termos da rigida garantia de restrições de justiça e do acoplamento profundo da modelagem semântica educacional em comparação com a literatura28.

Em tarefas práticas de avaliação de educação inteligente, o modelo GFBFEN construído sobre BFEN também demonstrou vantagens notáveis. Para 500 registros de calibração, o GFBFEN alcançou um CAE final de 0,0641 e um CRE de 0,0912. Seu CAR para múltiplos tipos de dados de avaliação ultrapassou 97% tanto em treinamentos quanto em conjuntos de validação. Esse desempenho resultou da otimização de correlação de características e processamento leve do GAT-KD. O GAT construiu grafos de correlação semântica entre as características para reduzir o viés de características de dados multi-fonte, enquanto a transferência de conhecimento do KD aumentou a eficiência da inferência sem comprometer a precisão do modelo, evitando atrasos de calibração causados pela complexidade do modelo. Comparado à pesquisa conduzida por Deho et al. sobre o impacto da deriva do conjunto de dados na justiça dos modelos de análise de aprendizagem, embora seu estudo tenha focado no mecanismo da influência da deriva dos dados na justiça, as estratégias de correção baseavam-se em reponderação estática e compensação pós-evento, carecendo da capacidade de perceber e responder dinamicamente aos desvios semânticos em tempo real. Foi difícil lidar com a evolução dos vieses implícitos na avaliação educacional causados por expressões subjetivas dos professores e diferenças nos estilos linguísticos dos alunos. No entanto, este estudo, por meio do modelo GFBFEN, percebe e responde de forma dinâmica a desvios semânticos na semântica de avaliação, capturando as tendências implícitas de valor nos comentários dos professores, desvios de estilo linguístico nos textos de resposta dos alunos e deriva semântica nas expressões de avaliação entre notas/disciplinas, alcançando uma mudança de paradigma de "compensação estática" para "calibração dinâmica"29. Nos testes de métricas core, o GFBFEN alcançou EFCA de 99,35% e 98,76% nos conjuntos de treinamento e validação, respectivamente, e FCP de 98,52% e 97,93%, significativamente acima dos modelos de comparação. Semelhante ao sistema de exame aberto com pontuação automática baseada em inteligência artificial desenvolvido pela equipe Dimari A, embora tenha alcançado um alto grau de consistência na pontuação das respostas abertas, sua correção de justiça depende apenas do peso pré-definido das dimensões de pontuação e da biblioteca de amostras enviesada anotada por humanos, sem incorporar um mecanismo educacional de evolução dinâmica semântica. Essa pesquisa fez avanços substanciais no mecanismo dinâmico de evolução da correção de justiça e na modelagem profunda da semântica educacional em comparação com os resultados da equipe Dimari A, demonstrando especialmente robustez e interpretabilidade ao enfrentar desafios do mundo real, como a deriva na orientação de valor dos comentários dos professores, as diferenças geracionais nos estilos linguísticos dos alunos, e a ambiguidade nas expressões de avaliação interdisciplinar30.

Este estudo contribuiu em três aspectos. Primeiro, o algoritmo BFEN integrou BERT-RL com FairEduNet, melhorando a eficiência do processamento e a adaptabilidade multi-cenário para dados heterogêneos de múltiplas fontes por meio da otimização semântica de características e ajuste dinâmico de parâmetros. Segundo, o modelo GFBFEN, baseado em GAT-KD e FBFEN, introduziu a aprendizagem por correlação semântica e a transferência leve de conhecimento, resolvendo correlação fraca de características e baixa eficiência de inferência em cenários educacionais complexos, aumentando a praticidade na calibração de avaliações. Terceiro, os modelos foram aplicados para calibrar diferentes disciplinas e tipos de avaliação, fornecendo suporte técnico para avaliações precisas no ensino e promovendo a equidade educacional. Essas contribuições ofereceram uma nova abordagem para calibração inteligente de avaliações educacionais e uma referência para colaboração multi-algoritmo no processamento complexo de dados educacionais.

Os métodos atuais de calibração de avaliação da educação inteligente carecem de adaptabilidade e justiça. Este estudo propõe um modelo GFBFEN baseado no FairEduNet, usando GAN e GBDT para calibração de justiça. O BERT-RL melhora o processamento de dados não estruturados, o AM-LSTM melhora a fusão de dados entre múltiplas fontes, e o GAT-KD fortalece a correlação de características e o enlevecimento. Ao integrar esses algoritmos, o modelo alcança calibração precisa e justiça dinâmica. Os testes mostram excelente processamento de dados multi-fonte e calibração de justiça entre cenários, atendendo aos requisitos de precisão e justiça. No entanto, o modelo apresenta limitações em grupos de educação especial, que precisam de uma maior generalização. Trabalhos futuros otimizarão parâmetros e ajustarão as restrições de justiça para diversos cenários, apoiando a equidade educacional e a qualidade do ensino.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O autor não tem nada a revelar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O autor declara que não há conflito de interesses.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Global Education Monitoring Report datasetUNESCOhttps://www.education-progress.org/Dataset
NumPyNumPyhttps://numpy.org/Pré-processamento de dados
PandasPandas, NumPyhttps://pandas.pydata.org/Pré-processamento de dados
PyCharm Professional 2023.1PyCharm Versão 2023.1Ambiente de desenvolvimento
Python 3.9Python Versão 3.9‌Linguagem de programação
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/index.htmlAprendizado de máquina
SeabornSeabornhttps://seaborn.pydata.org/Visualização
Spanish middle school student academic performance datasetUC Irvine Machine Learning Repositoryhttps://archive.ics.uci.edu/dataset/320/student+performanceDataset
TensorFlowTensorFlowhttps://www.tensorflow.org/Aprendizado profundo
Windows 11MicrosoftVersão 11Sistema operacional

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

EngineeringIntelligent educationFairEduNetTeaching assessment calibrationGenerative Adversarial NetworkGradient boosting decision tree

Related Articles