Research Article

Diseño de algoritmos FairEduNet y calibración de evaluaciones docentes considerando la equidad en la educación superior

DOI:

10.3791/70189

July 21st, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La investigación pretende ofrecer un nuevo enfoque para la enseñanza, la calibración de la evaluación y la equidad educativa en la educación inteligente. Los resultados experimentales indican que el modelo propuesto supera significativamente a los modelos comparativos, abordando de forma efectiva problemas de mala integración de datos multifuente y sesgo de equidad en los métodos de calibración existentes.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los métodos actuales de calibración de evaluaciones docentes enfrentan desafíos como baja eficiencia de integración al procesar datos heterogéneos de evaluación multifuente, insuficiente adaptabilidad entre diferentes disciplinas y escenarios docentes, y sesgos en los resultados con garantías de equidad débiles. La investigación pretende construir un marco interpretable, transferible y escalable de corrección de la equidad para un modelado profundo y la corrección dinámica de los datos de evaluación docente. Estos problemas dificultan el cumplimiento del requisito fundamental de una enseñanza equilibrada en la educación inteligente. Este estudio propone un algoritmo de red educativa orientado a la equidad que integra una red generativa adversarial y un árbol de decisiones que impulsa el gradiente. El algoritmo construye un mecanismo de calibración de equidad y combina un modelo de representación bidireccional de codificadores con una red de atención de grafos para optimizar la extracción de características y la adaptabilidad dinámica, mejorando la eficiencia del procesamiento de datos en múltiples fuentes y la precisión de calibración de la equidad. Este enfoque logra una calibración precisa y garantía de equidad en las evaluaciones docentes. En la prueba de indicadores, el modelo alcanzó una precisión del 98,76% en la agrupación de características de evaluación, del 98,05% en la corrección de la equidad y del 0,968 en la consistencia de corrección entre escenarios en el conjunto de validación. En la tarea de prueba de valor de pérdida, la pérdida total del modelo disminuyó de 0,1237 a 0,1018 durante la tarea de corrección de evaluación docente en el conjunto de validación. En la prueba de indicadores, el modelo alcanzó una precisión del 98,76% en la agrupación de características de evaluación, del 98,05% en la corrección de la equidad y del 0,968 en la consistencia de corrección entre escenarios en el conjunto de validación. Los resultados experimentales indican que el modelo propuesto supera significativamente a los modelos comparativos, abordando de forma efectiva problemas de mala integración de datos multifuente y sesgo de equidad en los métodos de calibración existentes. Además, proporciona marcos algorítmicos innovadores para desarrolladores tecnológicos y herramientas técnicas fiables para que los administradores educativos promuevan la equidad docente. Las contribuciones a la investigación se centran en: (i) integrar tres módulos principales, incluyendo preprocesamiento de datos multifuente, verificación dinámica del índice de equidad y visualización de explicabilidad; y (ii) proponer un paradigma de corrección de equidad basado en la optimización colaborativa de redes generativas adversariales y árboles de aumento de gradientes, que rompa las limitaciones de la corrección tradicional de un solo modelo y permite el aprendizaje desacoplado del modelado de desviaciones y la toma de decisiones de corrección.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La evaluación y calibración docente constituyen el núcleo para garantizar la calidad docente en la educación inteligente. A través del análisis dinámico, la corrección de errores y la calibración de resultados, proporcionan una base para la mejora de la enseñanza y el aprendizaje personalizado. Su precisión y equidad afectan directamente a si la educación inteligente puede superar los sesgos tecnológicos y proporcionar un apoyo educativoequilibrado 1,2. Sin embargo, los métodos existentes presentan varias deficiencias: dependen de una única fuente de datos, ignoran la situación real y conducen a sesgos de datos y sesgos de corrección. La falta de un mecanismo dinámico de adaptación a la equidad dificulta satisfacer las necesidades de equidad de las disciplinas y escenarios 3,4. Además, existen problemas como la falta de indicadores de equidad y el sesgo en las estrategias de corrección al tratar con datos heterogéneos de múltiples fuentes. Con este fin, los investigadores han realizado investigaciones desde múltiples dimensiones, como la evaluación de la enseñanza asistida por tenis basada en un algoritmo mejorado de trayectoriadensa 5. Yin et al. utilizaron el proceso de jerarquía analítica y un algoritmo de síntesis difusa para monitorizar la enseñanza enlínea 6. Chen analizó datos educativos de personas mayores utilizando un algoritmo mejorado de minería de datos para mejorar la calidad de laenseñanza 7.

Aunque estos estudios han avanzado, persisten problemas como el sesgo de resultados de calibración y la mala coordinación de la equidad. Por ello, construir un modelo que proporcione simultáneamente una calibración precisa de la evaluación docente y una garantía dinámica de equidad se ha convertido en un foco de investigación en educación inteligente. La red generativa adversarial (GAN) se adapta para eliminar la influencia implícita de atributos sensibles sobre los resultados mediante entrenamiento adversarial en tiempo real entre el generador y el discriminador, asegurando que las salidas estén determinadas por factores centrales en lugar de por el sesgoinducido por etiquetas 8. El GAN muestra ventajas en el manejo de sesgos de grupo en los datos de evaluación y en el modelado de restricciones de equidad no lineales. Cheng et al. propusieron un algoritmo de mejora de imágenes basado en GAN para abordar imágenes de baja resolución. El generador generaba imágenes de alta resolución desde entradas de baja resolución, y el discriminador distinguía las imágenes generadas de las imágenes reales de alta resolución. El entrenamiento adversarial optimiza los parámetros para que la salida del generador se acerque a las imágenesreales 9. Kang et al. propusieron un modelo GAN cross-modal para mejorar la eficiencia del procesamiento de datos multimodal en los campos de las energías renovables. El generador recibe datos monomodales, el discriminador distingue los generados de los datos multimodales reales, y el entrenamiento adversarial optimiza el modelo para mejorar la eficiencia10. El algoritmo de árbol de decisión de aumento de gradiente (GBDT) es un algoritmo clásico para el procesamiento de datos estructurados con una fuerte capacidad de captura de características. Al integrar iterativamente múltiples árboles de decisión, GBDT aprende con precisión patrones de error de datos y muestra ventajas en el procesamiento de información de evaluación heterogénea de múltiples fuentes y en la corrección de desviaciones no linealesde puntuación 11,12. Mizuno et al propusieron un método de predicción de trayectoria basado en GBDT para desastres de lluvias intensas, aprendiendo características de trayectorias y prediciendo trayectorias de desastres con datos en tiempo real, seleccionando predicciones óptimas a través de múltiples árboles de decisión13. Gao et al. desarrollaron un método de análisis visual basado en GBDT para la predicción de la tasa de clics publicitaria, aprendiendo la relación entre las características visuales y los datos históricos de clics para predecir tasas de clics en nuevosanuncios 14. Basándose en los desafíos anteriores, esta investigación pretende responder sistemáticamente a la siguiente pregunta científica central: ¿Cómo puede construirse un modelo inteligente de evaluación educativa para integrar de manera eficiente datos heterogéneos de múltiples fuentes, adaptarse dinámicamente a diferentes escenarios de enseñanza y, al mismo tiempo, garantizar la precisión de la calibración y la equidad en los resultados? Para responder a esta pregunta, este estudio utiliza el efecto sinérgico del mecanismo de restricción de equidad de la GAN y la capacidad precisa de calibración de errores de la GBDT. Además, se investiga cómo introducir tecnologías avanzadas, como el procesamiento del lenguaje natural (BERT), el aprendizaje por refuerzo (RL), los mecanismos de atención (AM), las redes de memoria a corto plazo (LSTM), las redes de atención de grafos (GAT) y la destilación de conocimiento (KD), para compensar las limitaciones inherentes de un único modelo en la extracción de características, adaptación dinámica y eficiencia del razonamiento. En última instancia, el objetivo es proporcionar una solución de calibración de evaluaciones docentes que sea precisa y justa, y que cuente con una fuerte capacidad de generalización para el campo de la educación inteligente.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diseño y optimización del algoritmo FairEduNet
El estudio combina GAN y GBDT para construir el algoritmo FairEduNet, logrando los objetivos duales de corrección de equidad y corrección de precisión, en lugar del compromiso de la optimización unidireccional. FairEduNet adopta una arquitectura colaborativa de doble canal: el canal troncal GBDT es responsable del modelado estructurado de errores y la corrección precisa, mientras que el canal auxiliar GAN se centra en desacoplar atributos sensibles y ajustar dinámicamente la equidad. La arquitectura del algoritmo FairEduNet, que combina GAN y GBDT, se muestra en la Figura 1.

figure-protocol-1
Figura 1: Arquitectura del algoritmo FairEduNet que combina GAN y GBDT. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 1, FairEduNet primero recopila y preprocesa datos de evaluación multifuente. GBDT utiliza múltiples árboles de decisión para aprender iterativamente los patrones de error de evaluación, emite resultados iniciales de calibración y los pasa al módulo GAN. El GAN entrena al discriminador para aprender la relación entre los resultados iniciales de calibración y los atributos sensibles, mientras que el generador ajusta dinámicamente los parámetros de calibración. A través de múltiples rondas de entrenamiento adversarial y verificación de equidad, se optimiza el sesgo de equidad. Finalmente, los resultados calibrados por equidad se envían al módulo GBDT, que ajusta para precisión y equidad, generando la base de calibración de la evaluación docente y el informe. GBDT calcula los residuos como se muestra en la Ecuación (1).

figure-protocol-2(1)

En la ecuación (1), figure-protocol-3 representa el residuo de la i-ésima muestra en la t-ésima iteración, yi representa el valor verdadero, y figure-protocol-4 representa el valor de predicción de la t-1-ésima iteración. El proceso adversarial GAN se muestra en la Ecuación (2).

figure-protocol-5(2)

En la ecuación (2), x representa el resultado inicial de la calibración, z representa características de atributos sensibles, Pdata(x)  representa la verdadera distribución de características no sensibles, Pz(z) representa la distribución de atributos sensibles, D representa el discriminador y G representa el generador15. La salida inicial de calibración de GBDT se muestra en la Ecuación (3).

figure-protocol-6(3)

En la ecuación (3), figure-protocol-7 representa la predicción de la i-ésima muestra por el árbol de decisión inicial, K representa el número total de árboles de decisión, γk representa el peso del k-ésimo árbol y hk(xi) representa la salida de predicción del k-ésimo árbol para el i-La muestra. El algoritmo FairEduNet puede proporcionar calibración precisa y garantía de equidad para la enseñanza de los datos de evaluación. Sin embargo, al procesar datos de evaluación no estructurados y adaptarse a escenarios dinámicos, FairEduNet muestra una capacidad débil de extracción de características para características no estructuradas, lo que resulta en sesgo de calibración. Además, los indicadores de equidad y parámetros de calibración de FairEduNet se establecen estáticamente, limitando su adaptabilidad a diferentes escenarios de enseñanza y afectando la calidad general de la calibración. La combinación de representaciones bidireccionales de codificadores de transformadores (BERT) y aprendizaje por refuerzo (RL), el algoritmo BERT-RL, puede extraer con precisión características profundas de texto no estructurado y adaptar dinámicamente parámetros de escenarios sin establecer manualmente umbrales estáticos, mejorando aún más la fiabilidad de las salidas del algoritmo enlos escenarios 16,17. Métodos tradicionales como TF-IDF se basan en la frecuencia de palabras pero carecen de un entendimiento contextual profundo y no pueden distinguir direcciones específicas de "equidad" en diferentes escenarios. Word2Vec produce vectores de palabras estáticos, que luchan por adaptarse a cambios contextuales complejos y reconocen sesgos indirectos. BERT utiliza autoatención multicapa para codificar contexto bidireccional, capturando tanto términos explícitos sesgados como lógica implícita sesgada. Los enfoques tradicionales requieren listas de palabras de sesgo construidas manualmente, dependen de la experiencia subjetiva y cubren escenarios limitados. Mediante aprendizaje preentrenado por transferencia de modelos, BERT aprende automáticamente características semánticas profundas sin un esfuerzo manual extenso, ofreciendo una mayor generalización para reconocer sesgos ambiguos. Además, los métodos tradicionales a menudo pierden información con textos largos, mientras que BERT soporta hasta 512 tokens, preservando relaciones contextuales, localizando con precisión características de sesgo y permitiendo una corrección de equidad de grano fino. El proceso de funcionamiento de BERT-RL se muestra en la Figura 2.

figure-protocol-8
Figura 2: Diagrama de flujo de operaciones del algoritmo BERT-RL. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 2, BERT-RL primero estandariza los datos de evaluación de texto no estructurados y los introduce en el modelo BERT. BERT utiliza un codificador Transformer para modelado semántico bidireccional para extraer características clave y construir una matriz de características. La matriz de características se introduce entonces en el módulo RL, que aprende la estrategia óptima a través de múltiples iteraciones. La configuración optimizada de parámetros finalmente se introduce en FairEduNet, mejorando su adaptabilidad. El cálculo del peso de la característica de autoatención BERT se muestra en la Ecuación (4).

figure-protocol-9(4)

En la ecuación (4), dk representa la dimensión del vector K. La función de recompensa multiobjetivo RL se expresa en la Ecuación (5).

figure-protocol-10(5)

En la ecuación (5), ω1, ω2 y ω3 representan coeficientes de peso, figure-protocol-11 el error de calibración, Dt es la desviación de equidad, Del objetivo es la desviación de equidad del objetivo, y Tt es el tiempode ejecución 18. Este estudio combina BERT-RL con FairEduNet para formar el algoritmo BERT-RL-FairEduNet, conocido como BFEN. BFEN logra calibración precisa y garantía de equidad en la enseñanza de los datos de evaluación mediante iteraciones de características GBDT y entrenamiento adversarial en tiempo real GAN, mientras que BERT-RL optimiza FairEduNet en el manejo de datos no estructurados y adaptándose dinámicamente a escenarios, abordando debilidades en la extracción de características y limitaciones estáticas de parámetros. El estudio utilizó el modelo BERT-base-chino y preentrenó el corpus de registros docentes reales, textos grabados en aula y documentos de política educativa de la Plataforma Nacional de Educación Inteligente para el curso académico 2024 a 2025, con un tamaño de vocabulario de 21128. La dimensión de capa oculta del modelo es 768, con 12 cabezas de atención y 12 capas. La profundidad del árbol GBDT se estableció en 8, el número de árboles era 200 y la tasa de aprendizaje era 0,1. El ciclo de entrenamiento de GAN es de 150 disparos, y el discriminador utiliza una red totalmente conectada de 3 capas con tamaños de 512, 256 y 1. El generador utiliza una red totalmente conectada de 4 capas con tamaños 1024, 512, 256 y 1. El número de unidades ocultas en LSTM es 128, y la longitud de la secuencia es 512. El GAT tiene 2 capas y 4 cabezas de atención. La temperatura para la destilación del conocimiento está fijada en 3,0. Los coeficientes de peso de recompensa en RL ω1 = 0,4, ω2 = 0,35 y ω3 = 0,25. Los criterios de selección de pesos son equilibrar el equilibrio frontal de Pareto de la optimización multiobjetivo con los requisitos de interpretabilidad de las prácticas de equidad educativa. Los experimentos se completaron mediante una división de datos del 50% mediante validación cruzada y ajuste de hiperparámetros. El proceso BFEN para la calibración de la evaluación docente se muestra en la Figura 3.

figure-protocol-12
Figura 3: Proceso de corrección del algoritmo BFEN para la educación inteligente y la evaluación de la enseñanza. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 3, BFEN primero preprocesa datos de evaluación docente multifuente. BERT optimiza la capacidad de extracción de características de FairEduNet calculando la similitud semántica del texto y los pesos profundos de características basándose en una ventana semántica, seleccionando características importantes para construir una matriz de características semánticas de alta dimensión. RL establece entonces una función de recompensa multiobjetivo y calcula los gradientes de adaptabilidad de escenarios y ajustes de parámetros para optimizar aún más los umbrales de equidad y los parámetros de calibración. FairEduNet calcula las desviaciones entre los datos de evaluación y los modelos de patrones de error, actualiza iterativamente los pesos del árbol de decisión y ajusta estrategias de calibración hasta que los errores se estabilizan dentro de umbrales preestablecidos. El resultado final incluye el modelo de calibración de errores y el informe de verificación de equidad. El modelo de calibración se aplica a los datos de evaluación docente, generando tablas comparativas pre y post-calibración, que se combinan con la biblioteca de estándares de equidad educativa inteligente para determinar los parámetros de calibración objetivo, proporcionando una base científica para la calibración de evaluaciones docentes en educación inteligente. Esta biblioteca estándar cubre tres dimensiones: equidad en oportunidades educativas, equidad en procesos y equidad en resultados, e incluye 12 indicadores principales. Estos indicadores incluyen el equilibrio de la asignación de recursos educativos entre regiones, la diferencia en la cobertura de infraestructura digital entre escuelas urbanas y rurales, el umbral de tolerancia para la respuesta tardía al diagnóstico de situaciones de aprendizaje (≤200 ms), la tolerancia a la falta de datos en la evaluación multimodal (≤3,5%), la sensibilidad a la detección de sesgos de algoritmos (desviación AUC para el etiquetado de género/región/etapa ≤ 0,02), el umbral de divergencia KL para la distribución de puntuaciones antes y después de la corrección (≤0,08), la puntuación de interpretabilidad de las sugerencias de intervención docente (≥4,2/5,0), la puntualidad de las actualizaciones del perfil de los estudiantes (completadas en T + 1 días), el coeficiente de consistencia del reconocimiento de créditos multiplataforma (≥0,93), la precisión del alineamiento semántico de las políticas educativas (puntuación BERT ≥ 0,86) y la completitud de la generación de informes de verificación de equidad (incluida la atribución de sesgos, intervalos de confianza y instantáneas de parámetros reproducibles), así como la tasa dinámica de validación de adaptación de escenarios que cubre tres escenarios típicos: aulas en vivo, tareas asíncronas y asistentes de enseñanza con IA. El cálculo de similitud semántica de características se muestra en la Ecuación (6).

figure-protocol-13(6)

En la ecuación (6), fi representa el valor de la i-ésima dimensión semántica de la característica, gi representa el valor de la i-ésima dimensión importante de la característica de evaluación, y n representa el número total de dimensiones de características. El cálculo del parámetro de adaptación del escenario RL se muestra en la Ecuación (7).

figure-protocol-14(7)

En la ecuación (7), θt representa el valor del parámetro en la t-ésima iteración, α representa la tasa de aprendizaje y figure-protocol-15 representa el gradiente de parámetros basado en la función de recompensa R(θt).

Construcción del modelo de calibración de evaluación docente
Aunque BFEN demuestra ciertas ventajas en la calibración de evaluaciones docentes, aún se enfrenta a baja eficiencia de integración para datos heterogéneos de evaluación multifuente y una adaptación dinámica insuficiente de la equidad en aplicaciones prácticas. El algoritmo AM-LSTM, que combina el Mecanismo de Atención (AM) y la Memoria a Corto Plazo Largo (LSTM), asigna pesos a características clave de los datos de evaluación multifuente a través de AM y captura los patrones dinámicos de cambio de los datos de evaluación a lo largo del tiempo utilizando la capacidad de memoria secuencial de LSTM. Este enfoque mejora eficazmente la eficiencia en la integración de datos multifuente y el aprendizaje dinámico de características19,20. El proceso operativo del AM-LSTM se muestra en la Figura 4.

figure-protocol-16
Figura 4: Diagrama de flujo de operación AM-LSTM. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 4, AM-LSTM primero preprocesa datos heterogéneos de evaluación docente multifuente para formar un conjunto de datos estandarizado. AM calcula los pesos de atención de características de diferentes fuentes de datos para seleccionar características importantes y construye una matriz ponderada de características. La matriz de características ponderada se introduce entonces en LSTM, que utiliza su mecanismo de acceso para aprender patrones dinámicos a lo largo del tiempo, capturando relaciones entre datos de evaluación en diferentes etapas y generando vectores dinámicos de características. Finalmente, estos vectores dinámicos de características se combinan con restricciones de equidad para generar resultados intermedios de calibración que se adaptan a la integración de datos multifuente y a escenarios dinámicos, proporcionando una base para la optimización posterior del modelo. El cálculo del peso de atención se muestra en la Ecuación (8).

figure-protocol-17(8)

En la ecuación (8), n representa la asignación de atención para la n-ésima característica, xn representa la similitud, q representa el vector de consulta y softmax representa la función de activación. La puerta de olvido del LSTM se expresa en la Ecuación (9).

figure-protocol-18(9)

En la ecuación (9), Wf es el peso de la puerta de olvido, bf es el sesgo de la puerta de olvido, xt es la entrada en el tiempo t, ht-1 es la variable de estado externa en el tiempo t-1, y σ representa la funciónsigmoide 21. Este estudio combina AM-LSTM con BFEN para construir el modelo de calibración de evaluación docente AM-LSTM-BFEN, conocido como FBFEN. En este modelo, AM-LSTM aborda las limitaciones de BFEN en la eficiencia de integración heterogénea de datos multifuente y la extracción dinámica de características. También integra restricciones de equidad para optimizar los resultados de calibración intermedia, permitiendo a BFEN lograr una calibración precisa y una garantía dinámica de equidad para la enseñanza de los datos de evaluación. El proceso de funcionamiento de FBFEN se muestra en la Figura 5.

figure-protocol-19
Figura 5: Proceso operativo del modelo de evaluación y corrección de la enseñanza FBFEN. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 5, FBFEN primero preprocesa los datos originales de evaluación docente multifuente e introduce el conjunto de datos estandarizado en el módulo AM-LSTM. AM calcula los pesos de atención de las características, mientras que LSTM aprende patrones dinámicos, generando resultados intermedios de calibración que integran información multifuente y características dinámicas. Los resultados intermedios se introducen entonces en el módulo BFEN. GBDT aprende iterativamente los patrones de error de los datos de evaluación basándose en los resultados intermedios y en el modelo de error preestablecido, generando resultados preliminares de calibración. Mientras tanto, GAN analiza el sesgo de equidad causado por atributos sensibles en los resultados preliminares mediante entrenamiento adversarial entre el generador y el discriminador, ajustando dinámicamente los parámetros de calibración para eliminar el sesgo. Finalmente, los parámetros de calibración optimizados para GAN se envían a GBDT para actualizar los pesos del árbol de decisión y las estrategias de calibración, produciendo un resultado de calibración secundario que equilibra precisión y equidad. La estandarización de datos se expresa en la Ecuación (10).

figure-protocol-20(10)

En la ecuación (10), z' representa el valor estandarizado, z representa el valor original, y zmin y zmax representan los valores mínimo y máximo. La función objetivo final del generador GAN se expresa en la Ecuación (11).

figure-protocol-21(11)

En la ecuación (11), N representa el número de iteraciones, λ representa el factor de peso de pérdida, ωi representa el factor de peso de la i-ésima iteración, figure-protocol-22 representa la función de pérdida adversarial y figure-protocol-23 representa la pérdida binaria de entropíacruzada 22.

Optimización del modelo de calibración de evaluación de la enseñanza de FBFEN
Aunque FBFEN demuestra una fuerte integración de datos multifuente y garantía dinámica de equidad en la calibración de evaluaciones docentes, sigue enfrentándose a una correlación de características débil y baja eficiencia en formación e inferencia debido a la compleja estructura del modelo en escenarios educativos complejos. El algoritmo GAT-KD, que combina la Red de Atención de Grafos (GAT) y la Destilación de Conocimiento (KD), construye dinámicamente un grafo de asociación semántica entre características a través del mecanismo de atención de GAT, mejorando la alineación semántica de datos multifuente. KD comprime el conocimiento del modelo complejo en una red ligera, mejorando significativamente la eficiencia de la inferencia mientras mantiene el rendimiento delmodelo 23,24. El proceso operativo de GAT-KD se muestra en la Figura 6.

figure-protocol-24
Figura 6: Diagrama de flujo de operación GAT-KD. Haz clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 6, GAT-KD construye un grafo semántico de asociación entre características a través del módulo GAT, agrega dinámicamente información de características vecinales usando el mecanismo de atención y mejora la representación semántica de características locales. KD utiliza entonces las etiquetas blandas de salida como señales de supervisión, minimizando la pérdida de divergencia entre las distribuciones de salida y la pérdida de entropía cruzada entre sus predicciones y etiquetas verdaderas, logrando la transferencia de conocimiento y compresión del modelo. La salida final es un modelo de calibración ligero con alta precisión y eficiencia. El cálculo del coeficiente de atención de la GAT se muestra en la ecuación (12).

figure-protocol-25(12)

En la ecuación (12), figure-protocol-26 y figure-protocol-27 representan los vectores de características de los nodos i y j, W representa la matriz de pesos aprendible, a representa el vector de pesos de atención, figure-protocol-28 representa la operación de concatenación y LeakyReLU representa la funciónde activación 25. El cálculo de la función de pérdida KD se muestra en la Ecuación (13).

figure-protocol-29(13)

En la ecuación (13), KL representa la pérdida por divergencia, T2 representa el balance de escalado del gradiente, pstudent representa la probabilidad de etiqueta blanda del modelo ligero, y pprofesor representa la probabilidad de etiqueta blanda del modelocomplejo 26. Al combinar la asociación de características mejorada por atención y la transferencia ligera de conocimiento, GAT-KD aborda eficazmente el sesgo semántico de características y la alta complejidad computacional. Este estudio integra GAT-KD en FBFEN para formar el modelo de calibración de evaluación docente GAT-KD-FBFEN, conocido como GFBFEN. GAT-KD optimiza las deficiencias de FBFEN en la captura incompleta de correlación de características multifuente y la baja eficiencia de inferencia. El proceso de funcionamiento de GFBFEN se muestra en la Figura 7.

figure-protocol-30
Figura 7: Proceso de evaluación y corrección del modelo de evaluación y corrección de la enseñanza del GFBFEN. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 7, GFBFEN estandariza los datos de evaluación docente de múltiples fuentes. La GAT modela relaciones complejas entre características y calcula dinámicamente los pesos de asociación semántica entre nodos utilizando mecanismos de atención. KD comprime el conocimiento del modelo complejo en una red ligera, mejorando significativamente la eficiencia de la inferencia manteniendo la precisión. El módulo AM-LSTM asigna pesos de importancia a características multifuente y captura patrones dinámicos temporales de los datos de evaluación, generando resultados intermedios de calibración que integran información de múltiples fuentes. Estos resultados se introducen en el módulo BFEN para su procesamiento profundo. Específicamente, BERT extrae características semánticas de texto no estructurado, RL optimiza dinámicamente umbrales de equidad y parámetros de calibración, GBDT aprende iterativamente patrones de error para la calibración preliminar, y GAN elimina sesgos causados por atributos sensibles mediante entrenamiento adversarial. El mecanismo dinámico de ajuste de parámetros calibra automáticamente la sensibilidad de respuesta y los pesos de equidad de cada módulo detectando en tiempo real los cambios temporales y la distribución de grupos en la escena docente, resolviendo así el problema de la insuficiente adaptabilidad causada por la configuración estática de parámetros y asegurando que el modelo pueda mantener robustez y equidad en diferentes etapas de enseñanza, grupos de estudiantes y escenarios de evaluación. El tipo de evaluación afecta directamente a la granularidad y al ciclo de retroalimentación del modelado de series temporales, mientras que la evaluación formativa enfatiza la naturaleza dinámica del proceso. Las diferencias en disciplinas determinan la asignación de características entre los módulos BERT y GBDT. Por lo tanto, adoptar un mecanismo de ajuste dinámico puede adaptarse eficazmente a diferentes tipos de evaluación y características disciplinares. Finalmente, a través de múltiples rondas de retroalimentación de parámetros y optimización iterativa, el modelo produce resultados precisos y justos de calibración de evaluaciones docentes. La función de optimización de restricciones de equidad dinámica se expresa en la Ecuación (14).

figure-protocol-31(14)

En la ecuación (14), S representa el conjunto de atributos sensibles, figure-protocol-32 representa el resultado de calibración de salida previsto, figure-protocol-33 representa la varianza de las predicciones dentro de los grupos, γ representa parámetros intergrupos y figure-protocol-34 representa el valor esperado global. El cálculo adaptativo de los pesos de fusión de características multifuente se muestra en la Ecuación (15).

figure-protocol-35(15)

En la ecuación (15), wk representa el peso de características de la k-ésima fuente de datos, β representa el parámetro de peso, Sim representa la función de medición de similitud de características, fk representa el vector de características extraído de la k-ésima fuente de datos, fglobal representa el centro global de características y K  representa el número total de fuentes de datos. El estudio estableció los pesos de atributos sensibles, incluyendo género, etnia, región, situación económica familiar y origen en lengua materna. Los pesos se determinan en función de los resultados del análisis de correlación. El estudio utilizó el coeficiente de correlación de Pearson y el coeficiente de correlación de rango Spearman como indicadores duales para la evaluación conjunta, combinados con experiencia experta en el campo de la educación para calibración de peso. La determinación final de los pesos para cada atributo sensible arrojó valores de 0,18 para género, 0,22 para etnia, 0,25 para región, 0,19 para la situación económica familiar y 0,16 para el origen de lengua materna. Género: Identidad de género según registro legal y autoidentificación, binario (hombre/mujer) con opciones no binarias; Campo de datos "género". Etnia: Basada en la identificación étnica nacional de 56 grupos, compatibles con grupos no identificados y transfronterizos; Campo de datos "etnicidad". Región: División administrativa del registro de hogares o residencia a largo plazo, que abarca los niveles provincial, municipal y de condado, considerando la estructura dual urbano-rural y la población migrante; Campo de datos "región". Estado económico familiar: Según estándares estadísticos nacionales e indicadores de asistencia educativa, utilizando una clasificación de cinco niveles; Campo de datos "economic_status". Antecedentes de la lengua materna: Enseñanza primaria y comunicación familiar durante la educación básica, abarcando mandarín, lenguas minoritarias, dialectos y lenguas extranjeras, ponderados según la edad y frecuencia de adquisición; Campo de datos "mother_tongue."

El proceso de corrección adoptó un mecanismo dinámico de ponderación de tres etapas. La primera etapa implementó la identificación inicial de desviaciones basada en la matriz de pesos de atributos sensibles, marcando puntos de datos que se desviaban significativamente del centro global de características en dimensiones como género, etnia y región. La segunda etapa introduce restricciones educativas del contexto para recalificar la intensidad de la desviación de manera consciente del contexto. La tercera etapa verifica la estabilidad de corrección mediante pruebas de perturbación contrafactual, reemplazando sistemáticamente los valores de atributos sensibles manteniendo sin cambios las características no sensibles, y observando si el cambio en las puntuaciones de evaluación se mantiene dentro del umbral del ±±3,2%.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Análisis del rendimiento del algoritmo BFEN
Los indicadores evaluados en los experimentos incluyeron los siguientes:

La precisión de la corrección de la evaluación (ECA) denota la proporción de ítems de desviación correctamente identificados y corregidos por el modelo dentro de los resultados de la evaluación docente, reflejando así la efectividad global del mecanismo de corrección. Valores más altos indican una precisión de corrección superior.

La tasa de desviación de equidad (FDR) mide la magnitud de las disparidades de puntuación entre grupos que el modelo no logra eliminar durante el proceso de calibración. Se calcula como la razón entre la desviación estándar de cada atributo sensible (por ejemplo, género, región, etnia) dentro de la distribución de puntuaciones y la desviación estándar global; valores más bajos implican varianzas intergrupales minimizadas y una garantía de equidad más robusta.

La tasa de adaptación de escenarios (SAR) indica el porcentaje de tareas de corrección ejecutadas con éxito por el modelo en contextos instruccionales heterogéneos (por ejemplo, ciencias vs. humanidades, entornos online vs. offline).

El grado de mantenimiento de equidad (FMD) se define como uno menos la proporción entre la varianza de los indicadores de equidad entre grupos de atributos sensibles tras la corrección y la observada antes de la corrección, reflejando la capacidad del sistema para preservar su equidad estructural durante el proceso de calibración.

La tasa de reconocimiento de características disciplinarias (DFRR) calcula la proporción de muestras en las que las características centrales se identifican correctamente dentro de los datos de evaluación de cada disciplina en relación con el tamaño total de la muestra de evaluación, demostrando la capacidad del modelo para discernir y capturar variaciones específicas de dominio.

La eficiencia de fusión de datos multifuente (MDFE) se refiere a la eficiencia de rendimiento del modelo durante la alineación de características, la asignación de pesos y la corrección de desviaciones al fusionar datos de evaluación heterogénea de múltiples fuentes. Esta métrica integral se define como el producto del número de muestras de evaluación procesadas por segundo (muestras/seg) y la tasa de cumplimiento de consistencia de corrección (a un nivel de confianza del >95%), donde valores más altos significan una tubería de fusión más eficiente y estable.

La estabilidad del resultado de corrección (CRS) indica la consistencia de las salidas de calibración a lo largo de múltiples secuencias independientes, cuantificada por el recíproco de la desviación estándar de la distancia euclidiana entre las salidas de corrección de cada ejecución bajo entradas idénticas. Valores más altos indican una mayor fiabilidad del sistema.

El tiempo de corrección de datos único (SDCT) representa la latencia computacional media consumida por el modelo para completar la calibración de una sola muestra de evaluación, medida en milisegundos (ms); valores más bajos indican una mayor capacidad de respuesta en tiempo real.

El error absoluto corregido (CAE) mide el error absoluto medio entre las predicciones calibradas y los valores de la verdad fundamental, representando la desviación residual del modelo respecto a los datos originales no calibrados. Valores más bajos indican que las salidas calibradas se alinean más estrechamente con los niveles reales de rendimiento.

El error relativo corregido (CRE) cuantifica el error absoluto medio entre las predicciones calibradas y los valores de verdad sobre el terreno expresados como porcentaje de la verdad fundamental, con valores más bajos que indican una mayor precisión relativa de calibración.

La tasa de precisión de corrección (CAR) representa la proporción de muestras cuyo error absoluto tras la calibración es < 0,5 respecto al tamaño total de la muestra, demostrando la fiabilidad del modelo para satisfacer restricciones de precisión predefinidas. Valores altos respaldan la utilidad empírica y la credibilidad de los resultados.

El valor de pérdida total (TL) representa el valor objetivo de optimización integral derivado de la suma ponderada de términos individuales de subpérdida al completar la tarea. Específicamente, siete métricas —DFRR, MDFE, CRS, SDCT, CAE, CRE y CAR— están estandarizadas mediante normalización de puntuaciones Z y ponderadas según la prioridad operativa de las tareas de evaluación. Dado el vector de peso [0,15, 0,12, 0,1, 0,08, 0,13, 0,12, 0,1], estos siete valores normalizados del indicador se agregan para calcular la pérdida final.

La precisión de agrupamiento de características de evaluación (EFCA) evalúa el grado de alineación entre las configuraciones de agrupamiento no supervisadas generadas por el modelo y las categorías de precisión real validadas por expertos del dominio.

La eficiencia de procesamiento de datos de alta dimensión (HDPE) mide el número de muestras sometidas a reducción de dimensionalidad de características y corrección de desviación por unidad de tiempo al manipular vectores dispersos de alta dimensión que contienen ≥50 características de evaluación. Medidos en muestras por segundo, valores más altos reflejan una capacidad más robusta para procesar entradas complejas y a gran escala de evaluación en tiempo real.

La precisión de corrección de equidad (FCP) evalúa la uniformidad de los efectos de calibración entre cohortes estudiantiles divergentes. Esta métrica se cuantifica calculando la media de la distribución de la distancia de Kolmogorov-Smirnov para los errores absolutos corregidos entre los subgrupos de atributos sensibles; valores más bajos implican un rendimiento más equilibrado entre grupos y una mayor garantía de equidad.

La consistencia de corrección entre escenas (CSCC) cuantifica el desplazamiento distribucional de los resultados de calibración en tres escenarios típicos —a saber, evaluación en aula, evaluación práctica y pruebas en línea— modelados como la relación de distancia de Wasserstein.

Para verificar el rendimiento del algoritmo propuesto de calibración de evaluación docente BFEN, el estudio lo comparó con el algoritmo PRF, que combinaba análisis de componentes principales (PCA) y bosque aleatorio (RF); el algoritmo EAB, que combinaba máquina de aprendizaje extremo (ELM) y impulso adaptativo (AdaBoost); y el algoritmo DBLR, que combinaba red profunda de creencias (DBN) y regresión logística (LR). Los experimentos se ejecutaron en un sistema equipado con un procesador Intel Core i9-13900HX y una GPU NVIDIA RTX 4080, proporcionando una alta capacidad de computación en paralelo y una gran memoria de vídeo para completar eficientemente cálculos de extracción y calibración de características para datos de evaluación docente a gran escala. El sistema operativo era Windows 11, y se utilizaba Python 3.9 para la programación. Los algoritmos se implementaron utilizando la biblioteca Scikit-learn, los módulos de aprendizaje profundo se desarrollaron mediante el framework TensorFlow, y se emplearon las bibliotecas Pandas y NumPy para el preprocesamiento de datos. El entorno de desarrollo utilizó PyCharm Professional 2023.1, y se aplicó Seaborn para la visualización de los resultados de calibración y facilitar la comparación intuitiva del rendimiento de los algoritmos. Para garantizar la fiabilidad de los datos, el estudio utilizó el conjunto de datos1 del Informe Global de Monitorización de la Educación y el conjunto de datos 2 sobre el rendimiento académico de estudiantes españoles desecundaria. El conjunto de datos contiene 12.486 registros, que cubren datos de evaluación de enseñanza multimodal como evaluaciones docentes universitarias, rendimiento académico de estudiantes, evaluaciones docentes y retroalimentación de cursos, abarcando 137 características de la dimensión docente, incluyendo frecuencia de interacción en el aula, puntualidad de los feedbacks de las tareas, consistencia en la puntuación, inclusión lingüística y sensibilidad intercultural. La variable objetivo es la puntuación de evaluación docente, que en este estudio se asigna a un valor compuesto ponderado multidimensional calibrado por expertos. La investigación integra cuatro tipos de fuentes de información: evaluaciones de prácticas docentes, revisiones por pares, observaciones supervisoras en el aula y revisiones de expedientes docentes, con ponderaciones de 0,35, 0,25, 0,25 y 0,15, respectivamente. Los conjuntos de entrenamiento y validación se separan por orden cronológico de los dos conjuntos de datos. El estudio utiliza datos de septiembre de 2024 como conjunto de entrenamiento y datos de octubre de 2024 a junio de 2025 como conjunto de validación para alinearse con la progresión temporal de las evaluaciones educativas. En la etapa de preprocesamiento, se emplea una estrategia específica por modalidad, con características estructuradas estandarizadas mediante normalización Z-score y valores atípicos Winsorizados, mientras que las características textuales se codifican usando el modelo BERT-base-chino y se reducen a 768 dimensiones. El entrenamiento adversarial se aplica para mejorar la robustez frente a expresiones de sesgo implícito y mitigar la deriva semántica causada por diferencias culturales de fondo.

Para lograr la formación y la investigación de validación interdominio, el modelo se transferirá a cuatro escenarios de enseñanza heterogéneos: educación básica K-12, educación vocacional, educación continua y educación internacional china para una validación de muestra nula o poca. En estos cuatro escenarios, el estudio introduce términos de regularización adaptativa de dominio durante el entrenamiento de algoritmos para limitar la consistencia de la distribución de características del modelo en diferentes escenarios de enseñanza. Incorporación de un mecanismo ligero de máscara consciente de la sintaxis para ruido de frases cortas en escenarios de K-12; Para abordar la ambigüedad de la terminología profesional en la educación profesional, se construye e integra un diccionario dinámico de dominio con el esquema curricular del conocimiento del currículo. Diseñar un módulo de aprendizaje de comparación por grupos de edad para abordar la brecha semántica intergeneracional en la educación continua, alineando los anclajes semánticos para las expresiones de evaluación de diferentes grupos de edad en el espacio latente. Para abordar la expresión de la carga cultural en la educación internacional china, se utilizan estímulos de comparación entre idiomas para afinar y mejorar la solidez en la comprensión de conceptos educativos no literales. Investigación sobre calibración experta y pruebas de fiabilidad de campos estructurados en registros originales de evaluación, eliminando entradas de baja fiabilidad con coeficiente alfa de Krippendorff inferior a 0,75. Se implementó la anotación manual doble ciego en los textos de evaluación de los estudiantes, con 3 expertos en medición educativa completando de forma independiente el etiquetado por tipo de desviación, logrando la consistencia de Cohen k = 0,86 en la anotación. Finalmente, los resultados anotados se validaron cruzadamente con los registros de asistencia de supervisión y las conclusiones de revisión de expedientes docentes para generar las etiquetas finales de calibración.

Los conjuntos de datos seleccionados se originaron en poblaciones distintas, sistemas de medición y antecedentes educativos. Este paradigma de validación entre dominios probó rigurosamente los límites de robustez y generalización del modelo dentro de un ecosistema educativo auténtico, evitando ilusiones de evaluación causadas por la homogeneización de datos. Ambos repositorios contenían volúmenes considerables de registros de evaluación docente, ofreciendo un valor de referencia directa para el despliegue de algoritmos educativos inteligentes conscientes de la equidad. Ambos conjuntos de datos contenían datos sustanciales de evaluación docente, proporcionando valores de referencia directos para el diseño de algoritmos de educación inteligente conscientes de la equidad y la calibración de las evaluaciones docentes. El estudio calibró 1000 registros de evaluación docente con los cuatro algoritmos y calculó su ECA y FDR de Equidad. Los resultados se muestran en la Figura 8.

figure-results-1
Figura 8: Comparación de los resultados de las pruebas entre ECA y FDR. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 8A, BFEN logró inicialmente un ECA del 82,47% y un FDR del 5,71% en la tarea de calibración de la evaluación. A medida que aumentaba el número de registros calibrados, el ECA subía al 98,75% y se estabilizaba tras calibrar 421 registros, mientras que el FDR disminuía al 2,87% y se estabilizaba tras calibrar 514 registros. Como se muestra en la Figura 8B, la curva ECA del algoritmo PRF aumentó gradualmente, mientras que la línea FDR disminuyó lentamente. Al final de la tarea de calibración, su valor ECA era del 92,30% y el valor de PDR del 6,72%. La Figura 8C demuestra que la curva ECA del algoritmo EAB subió rápidamente antes de aplanarse, mientras que su trayectoria FDR mostró fluctuaciones severas en etapas tempranas antes de la convergencia, terminando con un ECA del 84,64% y un FDR del 8,93%. Como se delimita en la Figura 8D, el algoritmo DBLR mostró una trayectoria ascendente de ECA lenta acompañada de fluctuaciones marginales y compresión limitada en su línea FDR, concluyendo la tarea de calibración con un ECA del 83,51% y un FDR del 8,42%. Estos hallazgos experimentales confirman que el algoritmo BFEN supera significativamente a los enfoques de referencia tanto en precisión de corrección de evaluación como en control del sesgo de equidad. Esta superior capacidad de generalización se atribuye a la integración de BERT dentro de BFEN, que extrae características semánticas profundas de textos de evaluación no estructurados para capturar expresiones ocultas de sesgo, mientras que el módulo RL optimiza dinámicamente los umbrales de equidad y parámetros de corrección mediante una función de recompensa multiobjetivo para desacoplar atributos sensibles de los resultados finales. El estudio evaluó luego SAR y FMD para la evaluación en aula, exámenes finales, evaluación práctica y evaluación en línea, etiquetando los cuatro escenarios como A, B, C y D. Los resultados se muestran en la Figura 9.

figure-results-2
Figura 9: Comparación de resultados de SAR y FMD en diferentes escenarios. (A) Resultados de las pruebas SAR. (B) Resultados de pruebas de FMD. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 9A, BFEN logró un SAR superior al 98% en todos los escenarios docentes, con el SAR más alto del 99,01% en las pruebas en aula. El SAR del algoritmo de comparación en diferentes escenarios es inferior al del algoritmo BFEN, entre los cuales el algoritmo DBLR tiene el SAR más bajo para el escenario final de evaluación entre todos los algoritmos, con un SAR del 70,23%. Como se muestra en la Figura 9B, la FMD del algoritmo BFEN sigue siendo significativamente mayor que la del algoritmo de comparación en diferentes escenarios docentes, con FMDs del 98,47%, 98,05%, 97,81% y 97,94% en distintos escenarios, respectivamente. Los FMD del algoritmo de referencia DBLR son 82,36%, 71,74%, 70,59% y 69,12%, respectivamente. Las FMDs del algoritmo EAB son 80,79%, 68,21%, 67,65% y 66,03%, respectivamente, mientras que las FMDs del algoritmo PRF son 86,42%, 82,17%, 80,98% y 78,33%, respectivamente. Estos resultados demostraron que BFEN superó a los algoritmos de comparación gracias al aprendizaje iterativo de GBDT con múltiples árboles de decisión, que capturaron con precisión patrones de error entre escenarios y aseguraron resultados de calibración estables y justos. El estudio evaluó además la tasa de reconocimiento de características disciplinarias (DFRR) para chino, matemáticas e inglés utilizando los cuatro algoritmos. Los resultados se muestran en la Figura 10.

figure-results-3
Figura 10: Comparación de los resultados de pruebas DFRR en diferentes disciplinas. (A) Juego de entrenamiento. (B) Conjunto de validación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 10A, BFEN logró DFRR del 99,23%, 98,94% y 99,13% en chino, matemáticas e inglés en el conjunto de entrenamiento. La Figura 10B indicó que BFEN también alcanzó un DFRR más alto en el conjunto de validación en comparación con otros algoritmos. Concretamente, el DFRR de BFEN para chinos alcanzó el 98,41%, un 10,8% más que el 87,61% del DBLR; para Matemáticas, 97,54%, 9,07% más que el 88,47% de PRF; y para inglés, 98,13%, 13,34% superior al 84,79% de EAB. Estos resultados confirmaron que BFEN se adaptó eficazmente a la calibración de la evaluación disciplinaria combinando la captura profunda de diferencias semánticas por parte de BERT con el aprendizaje personalizado de patrones de error por parte de GBDT. Para evaluar de forma exhaustiva el desempeño de los BFEN, el estudio evaluó MDFE, CRS y SDCT para los cuatro algoritmos. Los resultados se presentan en la Tabla 1.

Conjunto de datosAlgoritmoMDFE (%)CRSSDCT (s)
FormaciónBFEN98.42 ± 0.28*&@0,975 ± 0,28*&@0,78 ± 0,04*&@
PRF83,85 ± 0,410,779 ± 0,361,32 ± 0,08
EAB85,91 ± 0,500,806 ± 0,401.15 ± 0.07
DBLR88,76 ± 0,470,753 ± 0,391,45 ± 0,08
ValidaciónBFEN97,58 ± 0,25*&@0,968 ± 0,27*&@0,86 ± 0,03*&@
PRF81,62 ± 0,320,687 ± 0,501,51 ± 0,06
EAB84,37 ± 0,400,749 ± 0,421,28 ± 0,05
DBLR87,53 ± 0,300,728 ± 0,471,63 ± 0,07

Tabla 1: Comparación de los resultados de pruebas MDFE, CRS y SDCT. "*" indica una diferencia significativa (p < 0,05) entre los resultados de BFEN y PRF. "&" indica que la diferencia entre los resultados de BFEN y EAB fue significativa (p < 0,05). "@" indica que la diferencia entre los resultados BFEN y DBLR es significativa (p < 0,05)

La Tabla 1 indica que BFEN logró un MDFE del 98,42% en el conjunto de entrenamiento, un 14,57% superior al 83,85% de PRF, un CRS de 0,975, 0,222 más que el 0,753 de DBLR, y un SDCT de 0,78 s, 0,67 s menos que los 1,45 s de DBLR. En el conjunto de validación, BFEN mantuvo un rendimiento superior, con MDFE, CRS y SDCT de 97,58%, 0,968 y 0,86 s, respectivamente, superando a los algoritmos de comparación. En general, los resultados validaron el rendimiento integral y superior de BFEN en la calibración de evaluaciones docentes.

Validación del modelo de calibración de la evaluación de la enseñanza GFBFEN
Basándose en la validación del rendimiento BFEN, el estudio evaluó además el rendimiento del modelo de calibración de evaluación de la enseñanza GFBFEN construido sobre BFEN y lo comparó con modelos de calibración construidos usando algoritmos PRF, EAB y DBLR. Para garantizar condiciones de evaluación consistentes y comparabilidad, el conjunto de datos del informe global de monitorización educativa sirvió como conjunto de entrenamiento, mientras que el conjunto de datos de rendimiento académico de estudiantes universitarios sirvió como conjunto de validación. Los cuatro modelos calibraron 500 registros de evaluación docente, y se calcularon sus CAE y CRE. Los resultados se muestran en la Figura 11.

figure-results-4
Figura 11: Comparación de los resultados de las pruebas CAE y CRE. (A) Resultados de las pruebas CAE. (B) Resultados de pruebas CRE. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 11A, GFBFEN inicialmente alcanzó una CAE de 0,1279. A medida que avanzaba la calibración, el CAE disminuyó a 0,0641 y se estabilizó tras 104 registros. Los modelos comparativos tuvieron una CAE inicial y final más alta que GFBFEN, siendo EAB la CAE inicial y final más alta de 0,1858 y 0,1217, respectivamente. La Figura 11B indicó que el CRE inicial y final de GFBFEN durante la tarea de calibración permanecieron por debajo de los modelos de comparación, con valores de 0,1137 y 0,0912, respectivamente. Estos resultados demostraron que GFBFEN mostró una fuerte capacidad de ajuste, beneficiándose del mecanismo de atención de GAT, que construyó grafos de correlación semántica entre características, mejoró la alineación semántica de datos de evaluación de múltiples fuentes y redujo la calibración ineficace causada por el sesgo de características. El estudio evaluó posteriormente la CAR para datos de evaluación estudiantil, datos de evaluación docente, datos de evaluación escolar y datos de evaluación en línea, etiquetados como I, II, III y IV. Los resultados se muestran en la Figura 12.

figure-results-5
Figura 12: Comparación de los resultados de la CAR de diferentes datos de evaluación. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 12A, GFBFEN logró un CAR del 99,34%, 98,93%, 99,01% y 99,12% en datos de evaluación de estudiantes, profesores, escuelas y en línea en el conjunto de entrenamiento. En el conjunto de validación, los valores de CAR fueron 97,89%, 98,56%, 97,57% y 98,46%, respectivamente. La figura 12B–D mostró que los modelos de comparación tenían menor CAR tanto en conjuntos de entrenamiento como de validación. Entre ellos, el EAB fue el que tuvo peor desempeño en el conjunto de validación, con un CAR del 76,31% para datos de profesores y 78,29% para datos online. Estos resultados confirmaron que GFBFEN superó significativamente a los modelos de comparación. A continuación, el estudio evaluó la lengua de aprendizaje en la tarea de calibración de la evaluación docente para evaluar la capacidad de ajuste y la estabilidad del entrenamiento. Los resultados se muestran en la Figura 13.

figure-results-6
Figura 13: Resultados de pruebas de capacidad de ajuste de modelos y estabilidad de entrenamiento. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 13A, GFBFEN inicialmente tenía un TL de 0,1021 en el conjunto de entrenamiento. Tras 67 iteraciones, la línea de transición disminuyó a 0,0725 y se estabilizó. En el conjunto de validación, la TL disminuyó de 0,1237 a 0,1018. La figura 13B–D indicó que la TL final de PRF en el conjunto de entrenamiento era 0,0824, la TL final de EAB en el conjunto de validación era 0,1178, y la TL de DBLR en ambos conjuntos era inestable y significativamente superior a la de otros modelos. Estos resultados demostraron que GFBFEN mostró una fuerte capacidad de ajuste y estabilidad en el entrenamiento, beneficiándose de la transferencia de conocimientos basada en KD, lo que permitió al modelo aprender rápidamente características efectivas, acelerar la convergencia de pérdidas y asegurar la generalización entre conjuntos de datos. Para validar de forma exhaustiva el rendimiento central de GFBFEN, el estudio evaluó EFCA, HDPE, FCP y CSCC para los cuatro modelos. Los resultados se muestran en la Figura 14.

figure-results-7
Figura 14: Resultados de pruebas de indicadores integrales de tareas de evaluación y corrección docentes. (A) Resultados de la prueba GFBFEN. (B) Resultados de la prueba PRF. (C) Resultados de la prueba EAB. (D) Resultados de la prueba DBLR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Como se muestra en la Figura 14A–D, el modelo GFBFEN tiene valores EFCA del 99,35% y 98,76% en los conjuntos de entrenamiento y validación, respectivamente. Los EFCA del modelo PRF son del 88,53% y 87,04%, respectivamente. En el conjunto de validación, la EFCA del modelo GFBFEN fue un 6,59% superior a la del modelo EAB, con un 92,17%, y un 11,72% superior a la del modelo DBLR, que fue del 87,04%. Además, sus indicadores HDPE, FCP y CSCC también lideran de forma contundente: en el conjunto de validación, el HDPE del modelo GFBFEN alcanzó el 98,05%, el FCP alcanzó el 97,93% y el CSCC alcanzó el 0,968, todos ellos superando a los modelos PRF, EAB y DBLR. En conjunto, estos resultados validaron el rendimiento integral superior de GFBFEN, demostrando que la optimización coordinada del modelo de GAT-KD, AM-LSTM y BFEN mejoró eficazmente la precisión, eficiencia y equidad de la calibración en la enseñanza de la evaluación.

La investigación fue construyendo gradualmente FairEduNet, BFEN, FBFEN y GFBFEN, y el GFBFEN final incluye componentes como FairEduNet, BERT-RL, AM-LSTM y GAT-KD. Para verificar la contribución independiente de los componentes individuales, se realizan experimentos de investigación y diseño de ablación, eliminando gradualmente cada componente y evaluando su impacto en el rendimiento global. Los indicadores comparativos incluyen ECA, FDR, SAS y FMD. Los resultados mostraron que el valor ECA del componente FairEduNet por sí solo fue del 87,32%, FDR del 12,45%, SAR del 89,67% y FMD del 11,89%. El ECA del modelo GFBFEN completo alcanzó el 99,21%, el FDR cayó aún más al 1,93%, el SAR se mantuvo estable en el 99,45% y el FMD se optimizó al 7,28%. Tras eliminar el BERT-RL, EL ECA disminuyó al 91,04%, el valor FDR fue del 6,23%, el valor SAR del 92,33% y la FMD aumentó al 7,85%. La ablación de AM-LSTM aumentó las fluctuaciones del SAR en un 14,2%. La eliminación de GAT-KD llevó a un aumento de la FMD hasta el 8,36%, y su mecanismo de supresión del sesgo de la estructura del grafo, guiado por la destilación del conocimiento, fue significativamente eficaz para aliviar el sesgo implícito de asociación entre poblaciones.

Para probar aún más los métodos de investigación, el estudio introdujo indicadores establecidos de estándares de equidad, a saber, el Fairness Correction Benchmark (FCB), que cubre tres tipos de restricciones rígidas ampliamente reconocidas en escenarios educativos: (1) El valor absoluto de la diferencia media tras corrección entre grupos es ≤ 1,2 puntos (basado en el sistema porcentual); (2) La tasa de solapamiento de los intervalos de confianza corregidos para cada subgrupo de atributos sensibles es ≥ 95%; (3) En cualquier escenario concreto, la región conjunta factible de FDR y SAR debe cumplir la restricción de la frontera de Pareto (es decir, es imposible mejorar el SAR sin deteriorar FDR, y viceversa). El modelo GFBFEN se comparó con modelos de referencia convencionales, como EAB, PRF, DBLR y GBDT, en la evaluación experimental. El experimento se llevó a cabo con 421 datos reales de evaluación recogidos de escenarios docentes reales, cubriendo tres escenarios educativos típicos: evaluación en aula, evaluación práctica y pruebas en línea. Los resultados se muestran en la Tabla 2.

AlgoritmoValor absoluto de la diferencia media de puntuaciónTasa de solapamiento de intervalos de confianza(%)Tasa de satisfacción de regiones conjuntamente factible(%)Puntuación integral
GFBFEN0.8798.310097.2
EBA1.5298.482.678.5
PRF1.6885.174.371.2
DBLR1.4587.979.875.6
GBDT1.3391.286.479.9

Tabla 2: Resultados de evaluación de indicadores de criterios de equidad y verificación práctica de aplicaciones.

Como se muestra en la Tabla 2, GFBFEN logró el cumplimiento total de las cuatro restricciones rígidas de la FCB de forma independiente, y su puntuación integral superó significativamente a los otros modelos de referencia por un margen de +18,7 puntos, validando la robustez del paradigma propuesto de corrección colaborativa multietapa. En particular, en el indicador central que refleja la capacidad de compromiso entre equidad y eficiencia, la tasa conjunta de cobertura de regiones factibles alcanzó el 100%, lo que indica que el modelo posee capacidades de toma de decisiones óptimas de Pareto desplegables en escenarios educativos reales.

La equidad en la evaluación docente se refiere al uso de restricciones cuantitativas verificables como referencia, respetando las diferencias individuales y las leyes educativas. La lógica de cálculo y el establecimiento de umbrales de los indicadores de equidad se basan en el marco teórico de la equidad educativa y los estándares empíricos de verificación de datos. Son revisados conjuntamente por un comité de expertos compuesto por cinco académicos para garantizar un alto grado de unidad entre el rigor teórico y la adaptabilidad a la práctica educativa. Para validar aún más la adaptabilidad del modelo bajo diferentes estándares de equidad, el estudio realizó una validación adicional bajo múltiples estándares. Específicamente, se seleccionaron tres estándares de equidad para su verificación. El estándar 1 es el equilibrio de tasas de aceptación entre grupos basado en la Paridad Demográfica. El estándar 2 es la consistencia entre grupos entre la tasa de positivos verdaderos y la tasa de falsos positivos basada en las probabilidades igualadas. El estándar 3 se basa en la Paridad Predictiva para controlar el sesgo intergrupal en la precisión de la predicción. Se comprobó que GFBFEN cumplía de forma consistente con los requisitos de restricción rígida bajo los tres estándares. Desviación de la tasa de aceptación de grupo estándar 1 ≤1,2%, diferencia entre intergrupos de tasa de verdaderos/falsos positivos estándar 2 ≤0,85%, precisión de predicción estándar 3 y desviación intergrupal controlada dentro del ±±0,6%. En contraste, los otros modelos mostraron un avance de restricción del ≥3,7% bajo al menos un criterio, verificando la compatibilidad generalizada de GFBFEN para paradigmas de equidad multivariante.

DISPONIBILIDAD DE DATOS:
Para garantizar la fiabilidad de los datos, el estudio utilizó el conjunto de datos del Informe Global de Monitorización de la Educación (https://www.education-progress.org/) y el conjunto de datos de rendimiento académico de estudiantes de secundaria española (https://archive.ics.uci.edu/dataset/320/student+performance). Los conjuntos de entrenamiento y validación se separan por orden cronológico de los dos conjuntos de datos. El estudio utiliza datos de septiembre de 2024 como conjunto de entrenamiento y de octubre de 2024 a junio de 2025 como conjunto de validación, alineándose con la progresión temporal de las evaluaciones educativas.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El algoritmo BFEN propuesto en este estudio demostró un rendimiento superior en experimentos comparativos. Desde la perspectiva de ECA y FDR, superó significativamente a los algoritmos PRF, EAB y DBLR. Al calibrar los registros de evaluación de 421, BFEN aumentó el ECA al 98,75% y mantuvo la estabilidad, mientras que FDR disminuyó al 2,87%. Este rendimiento resultó de la integración de BERT-RL para la optimización de características y la adaptación dinámica. BERT extrajo con precisión información de sesgo semántico profundo de textos de evaluación no estructurados, y RL ajustó dinámicamente los umbrales de equidad y parámetros de calibración mediante una función de recompensa multiobjetivo, eliminando la influencia de atributos sensibles en los resultados. Esto es similar al trabajo realizado por Valencia-Londoño et al., quienes utilizaron algoritmos de inteligencia artificial para construir un modelo de inclusión educativa para adultos con diversos trastornos neuromusculares. Aunque el modelo de inclusión educativa construido fue verificado para su viabilidad dentro de grupos específicos de enfermedades neuromusculares, sus restricciones de equidad solo cubrían una dimensión (representación igual de grupos diagnósticos), y no se estableció un sistema rígido de restricciones entre múltiples grupos y múltiplesobjetivos 27. En pruebas de diferentes escenarios docentes, BFEN logró un SAR del 99,01% en las evaluaciones en clase y un FMD del 97,81% en evaluaciones prácticas, significativamente superior al de los modelos de comparación. Esta ventaja se originaba en el aprendizaje iterativo de patrones de error en datos de evaluación multiescenario, combinado con la biblioteca de estándares inteligentes de equidad educativa para coincidir con los parámetros de calibración objetivo, reduciendo eficazmente el sesgo de calibración y el desequilibrio de equidad causados por diferencias de escenario. En comparación con el sistema de evaluación de inteligencia artificial justa adaptativo e interpretable propuesto por Kumar et al., que incorpora bucles de retroalimentación de expertos humanos y módulos de verificación de equidad entre idiomas, aunque introduce estas características, no logra modelar eficazmente las cadenas de sesgo implícito en los textos de evaluación en el ámbito de la evaluación educativa, que tiene alta densidad semántica y una fuerte dependencia delcontexto 28. Este estudio está más profundamente integrado en términos de la garantía rígida de las restricciones de equidad y el acoplamiento profundo de la modelización semántica educativa en comparación con la literatura28.

En tareas prácticas de evaluación de educación inteligente, el modelo GFBFEN construido sobre BFEN también demostró ventajas notables. Para 500 registros de calibración, GFBFEN logró una CAE final de 0,0641 y una CRE de 0,0912. Su CAR para múltiples tipos de datos de evaluación superó el 97% tanto en el entrenamiento como en el conjunto de validación. Este rendimiento resultaba de la optimización de correlación de características y el procesamiento ligero de GAT-KD. GAT construyó grafos de correlación semántica entre características para reducir el sesgo de características de datos multifuente, mientras que la transferencia de conocimiento de KD mejoró la eficiencia de la inferencia sin comprometer la precisión del modelo, evitando retrasos de calibración causados por la complejidad del modelo. En comparación con la investigación realizada por Deho et al. sobre el impacto de la deriva de conjunto de datos en la equidad de los modelos de análisis de aprendizaje, aunque su estudio se centró en el mecanismo de la influencia de la deriva de datos en la equidad, las estrategias de corrección se basaron en el reponderado estático y la compensación post-evento, careciendo de la capacidad de percibir y responder dinámicamente a las desviaciones semánticas en tiempo real. Fue difícil abordar la evolución de los sesgos implícitos en la evaluación educativa causados por las expresiones subjetivas de los profesores y las diferencias en los estilos lingüísticos de los estudiantes. Sin embargo, este estudio, a través del modelo GFBFEN, percibe y responde de forma dinámica a desviaciones semánticas en la semántica de evaluación, capturando las tendencias implícitas de valor en los comentarios del profesor, las desviaciones de estilo lingüístico en los textos de respuesta de los estudiantes y la deriva semántica en las expresiones de evaluación entre grados y asignaturas, logrando un cambio de paradigma de "compensación estática" a "calibración dinámica"29. En las pruebas de métricas principales, GFBFEN logró EFCA del 99,35% y 98,76% en los conjuntos de entrenamiento y validación, respectivamente, y FCP del 98,52% y 97,93%, significativamente superior a los modelos de comparación. Similar al sistema de exámenes abiertos con puntuación automática basada en inteligencia artificial desarrollado por el equipo Dimari A, aunque ha logrado un alto grado de consistencia en la puntuación de respuestas abiertas, su corrección de equidad solo se basa en el peso preestablecido de las dimensiones de puntuación y en la biblioteca de muestras sesgada anotada por humanos, sin incorporar un mecanismo educativo de evolución dinámica semántica. Esta investigación ha logrado avances sustanciales en el mecanismo de evolución dinámica de la corrección de la equidad y en la profunda modelización de la semántica educativa en comparación con los resultados del equipo de Dimari A, demostrando especialmente una fuerte robustez e interpretabilidad al abordar desafíos reales como la deriva en la orientación al valor de los comentarios docentes, las diferencias generacionales en los estilos lingüísticos de los estudiantes, y la ambigüedad en las expresiones de evaluación interdisciplinar30.

Este estudio aportó tres aspectos. En primer lugar, el algoritmo BFEN integró BERT-RL con FairEduNet, mejorando la eficiencia del procesamiento y la adaptabilidad multiescenario para datos heterogéneos de múltiples fuentes mediante la optimización semántica de características y el ajuste dinámico de parámetros. En segundo lugar, el modelo GFBFEN, basado en GAT-KD y FBFEN, introdujo el aprendizaje por correlación semántica y la transferencia ligera de conocimiento, resolviendo problemas de correlación de características débiles y baja eficiencia de inferencia en escenarios educativos complejos, mejorando la practicidad en la calibración de evaluaciones. En tercer lugar, los modelos se aplicaron para calibrar diferentes asignaturas y tipos de evaluación, proporcionando soporte técnico para una evaluación docente precisa y promoviendo la equidad educativa. Estas contribuciones ofrecieron un nuevo enfoque para la calibración inteligente de evaluaciones educativas y una referencia para la colaboración multi-algoritmo en el procesamiento complejo de datos educativos.

Los métodos actuales de calibración de evaluación de la educación inteligente carecen de adaptabilidad y equidad. Este estudio propone un modelo GFBFEN basado en FairEduNet, utilizando GAN y GBDT para la calibración de equidad. BERT-RL mejora el procesamiento de datos no estructurados, AM-LSTM mejora la fusión de datos multifuente, y GAT-KD refuerza la correlación de características y el aligeramiento. Al integrar estos algoritmos, el modelo logra una calibración precisa y una equidad dinámica. Las pruebas muestran un excelente procesamiento de datos multifuente y calibración de equidad entre escenarios, cumpliendo con los requisitos de precisión y equidad. Sin embargo, el modelo tiene limitaciones en los grupos de educación especial, necesitando una mayor generalización. Los trabajos futuros optimizarán parámetros y ajustarán las restricciones de equidad para diversos escenarios, apoyando la equidad educativa y la calidad docente.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El autor no tiene nada que revelar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El autor declara que no existe conflicto de intereses.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Global Education Monitoring Report datasetUNESCOhttps://www.education-progress.org/Dataset
NumPyNumPyhttps://numpy.org/Preprocesamiento de datos
PandasPandas, NumPyhttps://pandas.pydata.org/Preprocesamiento de datos
PyCharm Professional 2023.1PyCharm Versión 2023.1Entorno de desarrollo
Python 3.9Python Versión 3.9‌Lenguaje de programación
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/index.htmlAprendizaje automático
SeabornSeabornhttps://seaborn.pydata.org/Visualización
Spanish middle school student academic performance datasetUC Irvine Machine Learning Repositoryhttps://archive.ics.uci.edu/dataset/320/student+performanceDataset
TensorFlowTensorFlowhttps://www.tensorflow.org/Aprendizaje profundo
Windows 11MicrosoftVersión 11Sistema operativo

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

EngineeringIntelligent educationFairEduNetTeaching assessment calibrationGenerative Adversarial NetworkGradient boosting decision tree

Related Articles