$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Análisis del rendimiento del algoritmo BFEN
Los indicadores evaluados en los experimentos incluyeron los siguientes:
La precisión de la corrección de la evaluación (ECA) denota la proporción de ítems de desviación correctamente identificados y corregidos por el modelo dentro de los resultados de la evaluación docente, reflejando así la efectividad global del mecanismo de corrección. Valores más altos indican una precisión de corrección superior.
La tasa de desviación de equidad (FDR) mide la magnitud de las disparidades de puntuación entre grupos que el modelo no logra eliminar durante el proceso de calibración. Se calcula como la razón entre la desviación estándar de cada atributo sensible (por ejemplo, género, región, etnia) dentro de la distribución de puntuaciones y la desviación estándar global; valores más bajos implican varianzas intergrupales minimizadas y una garantía de equidad más robusta.
La tasa de adaptación de escenarios (SAR) indica el porcentaje de tareas de corrección ejecutadas con éxito por el modelo en contextos instruccionales heterogéneos (por ejemplo, ciencias vs. humanidades, entornos online vs. offline).
El grado de mantenimiento de equidad (FMD) se define como uno menos la proporción entre la varianza de los indicadores de equidad entre grupos de atributos sensibles tras la corrección y la observada antes de la corrección, reflejando la capacidad del sistema para preservar su equidad estructural durante el proceso de calibración.
La tasa de reconocimiento de características disciplinarias (DFRR) calcula la proporción de muestras en las que las características centrales se identifican correctamente dentro de los datos de evaluación de cada disciplina en relación con el tamaño total de la muestra de evaluación, demostrando la capacidad del modelo para discernir y capturar variaciones específicas de dominio.
La eficiencia de fusión de datos multifuente (MDFE) se refiere a la eficiencia de rendimiento del modelo durante la alineación de características, la asignación de pesos y la corrección de desviaciones al fusionar datos de evaluación heterogénea de múltiples fuentes. Esta métrica integral se define como el producto del número de muestras de evaluación procesadas por segundo (muestras/seg) y la tasa de cumplimiento de consistencia de corrección (a un nivel de confianza del >95%), donde valores más altos significan una tubería de fusión más eficiente y estable.
La estabilidad del resultado de corrección (CRS) indica la consistencia de las salidas de calibración a lo largo de múltiples secuencias independientes, cuantificada por el recíproco de la desviación estándar de la distancia euclidiana entre las salidas de corrección de cada ejecución bajo entradas idénticas. Valores más altos indican una mayor fiabilidad del sistema.
El tiempo de corrección de datos único (SDCT) representa la latencia computacional media consumida por el modelo para completar la calibración de una sola muestra de evaluación, medida en milisegundos (ms); valores más bajos indican una mayor capacidad de respuesta en tiempo real.
El error absoluto corregido (CAE) mide el error absoluto medio entre las predicciones calibradas y los valores de la verdad fundamental, representando la desviación residual del modelo respecto a los datos originales no calibrados. Valores más bajos indican que las salidas calibradas se alinean más estrechamente con los niveles reales de rendimiento.
El error relativo corregido (CRE) cuantifica el error absoluto medio entre las predicciones calibradas y los valores de verdad sobre el terreno expresados como porcentaje de la verdad fundamental, con valores más bajos que indican una mayor precisión relativa de calibración.
La tasa de precisión de corrección (CAR) representa la proporción de muestras cuyo error absoluto tras la calibración es < 0,5 respecto al tamaño total de la muestra, demostrando la fiabilidad del modelo para satisfacer restricciones de precisión predefinidas. Valores altos respaldan la utilidad empírica y la credibilidad de los resultados.
El valor de pérdida total (TL) representa el valor objetivo de optimización integral derivado de la suma ponderada de términos individuales de subpérdida al completar la tarea. Específicamente, siete métricas —DFRR, MDFE, CRS, SDCT, CAE, CRE y CAR— están estandarizadas mediante normalización de puntuaciones Z y ponderadas según la prioridad operativa de las tareas de evaluación. Dado el vector de peso [0,15, 0,12, 0,1, 0,08, 0,13, 0,12, 0,1], estos siete valores normalizados del indicador se agregan para calcular la pérdida final.
La precisión de agrupamiento de características de evaluación (EFCA) evalúa el grado de alineación entre las configuraciones de agrupamiento no supervisadas generadas por el modelo y las categorías de precisión real validadas por expertos del dominio.
La eficiencia de procesamiento de datos de alta dimensión (HDPE) mide el número de muestras sometidas a reducción de dimensionalidad de características y corrección de desviación por unidad de tiempo al manipular vectores dispersos de alta dimensión que contienen ≥50 características de evaluación. Medidos en muestras por segundo, valores más altos reflejan una capacidad más robusta para procesar entradas complejas y a gran escala de evaluación en tiempo real.
La precisión de corrección de equidad (FCP) evalúa la uniformidad de los efectos de calibración entre cohortes estudiantiles divergentes. Esta métrica se cuantifica calculando la media de la distribución de la distancia de Kolmogorov-Smirnov para los errores absolutos corregidos entre los subgrupos de atributos sensibles; valores más bajos implican un rendimiento más equilibrado entre grupos y una mayor garantía de equidad.
La consistencia de corrección entre escenas (CSCC) cuantifica el desplazamiento distribucional de los resultados de calibración en tres escenarios típicos —a saber, evaluación en aula, evaluación práctica y pruebas en línea— modelados como la relación de distancia de Wasserstein.
Para verificar el rendimiento del algoritmo propuesto de calibración de evaluación docente BFEN, el estudio lo comparó con el algoritmo PRF, que combinaba análisis de componentes principales (PCA) y bosque aleatorio (RF); el algoritmo EAB, que combinaba máquina de aprendizaje extremo (ELM) y impulso adaptativo (AdaBoost); y el algoritmo DBLR, que combinaba red profunda de creencias (DBN) y regresión logística (LR). Los experimentos se ejecutaron en un sistema equipado con un procesador Intel Core i9-13900HX y una GPU NVIDIA RTX 4080, proporcionando una alta capacidad de computación en paralelo y una gran memoria de vídeo para completar eficientemente cálculos de extracción y calibración de características para datos de evaluación docente a gran escala. El sistema operativo era Windows 11, y se utilizaba Python 3.9 para la programación. Los algoritmos se implementaron utilizando la biblioteca Scikit-learn, los módulos de aprendizaje profundo se desarrollaron mediante el framework TensorFlow, y se emplearon las bibliotecas Pandas y NumPy para el preprocesamiento de datos. El entorno de desarrollo utilizó PyCharm Professional 2023.1, y se aplicó Seaborn para la visualización de los resultados de calibración y facilitar la comparación intuitiva del rendimiento de los algoritmos. Para garantizar la fiabilidad de los datos, el estudio utilizó el conjunto de datos1 del Informe Global de Monitorización de la Educación y el conjunto de datos 2 sobre el rendimiento académico de estudiantes españoles desecundaria. El conjunto de datos contiene 12.486 registros, que cubren datos de evaluación de enseñanza multimodal como evaluaciones docentes universitarias, rendimiento académico de estudiantes, evaluaciones docentes y retroalimentación de cursos, abarcando 137 características de la dimensión docente, incluyendo frecuencia de interacción en el aula, puntualidad de los feedbacks de las tareas, consistencia en la puntuación, inclusión lingüística y sensibilidad intercultural. La variable objetivo es la puntuación de evaluación docente, que en este estudio se asigna a un valor compuesto ponderado multidimensional calibrado por expertos. La investigación integra cuatro tipos de fuentes de información: evaluaciones de prácticas docentes, revisiones por pares, observaciones supervisoras en el aula y revisiones de expedientes docentes, con ponderaciones de 0,35, 0,25, 0,25 y 0,15, respectivamente. Los conjuntos de entrenamiento y validación se separan por orden cronológico de los dos conjuntos de datos. El estudio utiliza datos de septiembre de 2024 como conjunto de entrenamiento y datos de octubre de 2024 a junio de 2025 como conjunto de validación para alinearse con la progresión temporal de las evaluaciones educativas. En la etapa de preprocesamiento, se emplea una estrategia específica por modalidad, con características estructuradas estandarizadas mediante normalización Z-score y valores atípicos Winsorizados, mientras que las características textuales se codifican usando el modelo BERT-base-chino y se reducen a 768 dimensiones. El entrenamiento adversarial se aplica para mejorar la robustez frente a expresiones de sesgo implícito y mitigar la deriva semántica causada por diferencias culturales de fondo.
Para lograr la formación y la investigación de validación interdominio, el modelo se transferirá a cuatro escenarios de enseñanza heterogéneos: educación básica K-12, educación vocacional, educación continua y educación internacional china para una validación de muestra nula o poca. En estos cuatro escenarios, el estudio introduce términos de regularización adaptativa de dominio durante el entrenamiento de algoritmos para limitar la consistencia de la distribución de características del modelo en diferentes escenarios de enseñanza. Incorporación de un mecanismo ligero de máscara consciente de la sintaxis para ruido de frases cortas en escenarios de K-12; Para abordar la ambigüedad de la terminología profesional en la educación profesional, se construye e integra un diccionario dinámico de dominio con el esquema curricular del conocimiento del currículo. Diseñar un módulo de aprendizaje de comparación por grupos de edad para abordar la brecha semántica intergeneracional en la educación continua, alineando los anclajes semánticos para las expresiones de evaluación de diferentes grupos de edad en el espacio latente. Para abordar la expresión de la carga cultural en la educación internacional china, se utilizan estímulos de comparación entre idiomas para afinar y mejorar la solidez en la comprensión de conceptos educativos no literales. Investigación sobre calibración experta y pruebas de fiabilidad de campos estructurados en registros originales de evaluación, eliminando entradas de baja fiabilidad con coeficiente alfa de Krippendorff inferior a 0,75. Se implementó la anotación manual doble ciego en los textos de evaluación de los estudiantes, con 3 expertos en medición educativa completando de forma independiente el etiquetado por tipo de desviación, logrando la consistencia de Cohen k = 0,86 en la anotación. Finalmente, los resultados anotados se validaron cruzadamente con los registros de asistencia de supervisión y las conclusiones de revisión de expedientes docentes para generar las etiquetas finales de calibración.
Los conjuntos de datos seleccionados se originaron en poblaciones distintas, sistemas de medición y antecedentes educativos. Este paradigma de validación entre dominios probó rigurosamente los límites de robustez y generalización del modelo dentro de un ecosistema educativo auténtico, evitando ilusiones de evaluación causadas por la homogeneización de datos. Ambos repositorios contenían volúmenes considerables de registros de evaluación docente, ofreciendo un valor de referencia directa para el despliegue de algoritmos educativos inteligentes conscientes de la equidad. Ambos conjuntos de datos contenían datos sustanciales de evaluación docente, proporcionando valores de referencia directos para el diseño de algoritmos de educación inteligente conscientes de la equidad y la calibración de las evaluaciones docentes. El estudio calibró 1000 registros de evaluación docente con los cuatro algoritmos y calculó su ECA y FDR de Equidad. Los resultados se muestran en la Figura 8.

Figura 8: Comparación de los resultados de las pruebas entre ECA y FDR. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 8A, BFEN logró inicialmente un ECA del 82,47% y un FDR del 5,71% en la tarea de calibración de la evaluación. A medida que aumentaba el número de registros calibrados, el ECA subía al 98,75% y se estabilizaba tras calibrar 421 registros, mientras que el FDR disminuía al 2,87% y se estabilizaba tras calibrar 514 registros. Como se muestra en la Figura 8B, la curva ECA del algoritmo PRF aumentó gradualmente, mientras que la línea FDR disminuyó lentamente. Al final de la tarea de calibración, su valor ECA era del 92,30% y el valor de PDR del 6,72%. La Figura 8C demuestra que la curva ECA del algoritmo EAB subió rápidamente antes de aplanarse, mientras que su trayectoria FDR mostró fluctuaciones severas en etapas tempranas antes de la convergencia, terminando con un ECA del 84,64% y un FDR del 8,93%. Como se delimita en la Figura 8D, el algoritmo DBLR mostró una trayectoria ascendente de ECA lenta acompañada de fluctuaciones marginales y compresión limitada en su línea FDR, concluyendo la tarea de calibración con un ECA del 83,51% y un FDR del 8,42%. Estos hallazgos experimentales confirman que el algoritmo BFEN supera significativamente a los enfoques de referencia tanto en precisión de corrección de evaluación como en control del sesgo de equidad. Esta superior capacidad de generalización se atribuye a la integración de BERT dentro de BFEN, que extrae características semánticas profundas de textos de evaluación no estructurados para capturar expresiones ocultas de sesgo, mientras que el módulo RL optimiza dinámicamente los umbrales de equidad y parámetros de corrección mediante una función de recompensa multiobjetivo para desacoplar atributos sensibles de los resultados finales. El estudio evaluó luego SAR y FMD para la evaluación en aula, exámenes finales, evaluación práctica y evaluación en línea, etiquetando los cuatro escenarios como A, B, C y D. Los resultados se muestran en la Figura 9.

Figura 9: Comparación de resultados de SAR y FMD en diferentes escenarios. (A) Resultados de las pruebas SAR. (B) Resultados de pruebas de FMD. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 9A, BFEN logró un SAR superior al 98% en todos los escenarios docentes, con el SAR más alto del 99,01% en las pruebas en aula. El SAR del algoritmo de comparación en diferentes escenarios es inferior al del algoritmo BFEN, entre los cuales el algoritmo DBLR tiene el SAR más bajo para el escenario final de evaluación entre todos los algoritmos, con un SAR del 70,23%. Como se muestra en la Figura 9B, la FMD del algoritmo BFEN sigue siendo significativamente mayor que la del algoritmo de comparación en diferentes escenarios docentes, con FMDs del 98,47%, 98,05%, 97,81% y 97,94% en distintos escenarios, respectivamente. Los FMD del algoritmo de referencia DBLR son 82,36%, 71,74%, 70,59% y 69,12%, respectivamente. Las FMDs del algoritmo EAB son 80,79%, 68,21%, 67,65% y 66,03%, respectivamente, mientras que las FMDs del algoritmo PRF son 86,42%, 82,17%, 80,98% y 78,33%, respectivamente. Estos resultados demostraron que BFEN superó a los algoritmos de comparación gracias al aprendizaje iterativo de GBDT con múltiples árboles de decisión, que capturaron con precisión patrones de error entre escenarios y aseguraron resultados de calibración estables y justos. El estudio evaluó además la tasa de reconocimiento de características disciplinarias (DFRR) para chino, matemáticas e inglés utilizando los cuatro algoritmos. Los resultados se muestran en la Figura 10.

Figura 10: Comparación de los resultados de pruebas DFRR en diferentes disciplinas. (A) Juego de entrenamiento. (B) Conjunto de validación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 10A, BFEN logró DFRR del 99,23%, 98,94% y 99,13% en chino, matemáticas e inglés en el conjunto de entrenamiento. La Figura 10B indicó que BFEN también alcanzó un DFRR más alto en el conjunto de validación en comparación con otros algoritmos. Concretamente, el DFRR de BFEN para chinos alcanzó el 98,41%, un 10,8% más que el 87,61% del DBLR; para Matemáticas, 97,54%, 9,07% más que el 88,47% de PRF; y para inglés, 98,13%, 13,34% superior al 84,79% de EAB. Estos resultados confirmaron que BFEN se adaptó eficazmente a la calibración de la evaluación disciplinaria combinando la captura profunda de diferencias semánticas por parte de BERT con el aprendizaje personalizado de patrones de error por parte de GBDT. Para evaluar de forma exhaustiva el desempeño de los BFEN, el estudio evaluó MDFE, CRS y SDCT para los cuatro algoritmos. Los resultados se presentan en la Tabla 1.
| Conjunto de datos | Algoritmo | MDFE (%) | CRS | SDCT (s) |
| Formación | BFEN | 98.42 ± 0.28*&@ | 0,975 ± 0,28*&@ | 0,78 ± 0,04*&@ |
| PRF | 83,85 ± 0,41 | 0,779 ± 0,36 | 1,32 ± 0,08 |
| EAB | 85,91 ± 0,50 | 0,806 ± 0,40 | 1.15 ± 0.07 |
| DBLR | 88,76 ± 0,47 | 0,753 ± 0,39 | 1,45 ± 0,08 |
| Validación | BFEN | 97,58 ± 0,25*&@ | 0,968 ± 0,27*&@ | 0,86 ± 0,03*&@ |
| PRF | 81,62 ± 0,32 | 0,687 ± 0,50 | 1,51 ± 0,06 |
| EAB | 84,37 ± 0,40 | 0,749 ± 0,42 | 1,28 ± 0,05 |
| DBLR | 87,53 ± 0,30 | 0,728 ± 0,47 | 1,63 ± 0,07 |
Tabla 1: Comparación de los resultados de pruebas MDFE, CRS y SDCT. "*" indica una diferencia significativa (p < 0,05) entre los resultados de BFEN y PRF. "&" indica que la diferencia entre los resultados de BFEN y EAB fue significativa (p < 0,05). "@" indica que la diferencia entre los resultados BFEN y DBLR es significativa (p < 0,05)
La Tabla 1 indica que BFEN logró un MDFE del 98,42% en el conjunto de entrenamiento, un 14,57% superior al 83,85% de PRF, un CRS de 0,975, 0,222 más que el 0,753 de DBLR, y un SDCT de 0,78 s, 0,67 s menos que los 1,45 s de DBLR. En el conjunto de validación, BFEN mantuvo un rendimiento superior, con MDFE, CRS y SDCT de 97,58%, 0,968 y 0,86 s, respectivamente, superando a los algoritmos de comparación. En general, los resultados validaron el rendimiento integral y superior de BFEN en la calibración de evaluaciones docentes.
Validación del modelo de calibración de la evaluación de la enseñanza GFBFEN
Basándose en la validación del rendimiento BFEN, el estudio evaluó además el rendimiento del modelo de calibración de evaluación de la enseñanza GFBFEN construido sobre BFEN y lo comparó con modelos de calibración construidos usando algoritmos PRF, EAB y DBLR. Para garantizar condiciones de evaluación consistentes y comparabilidad, el conjunto de datos del informe global de monitorización educativa sirvió como conjunto de entrenamiento, mientras que el conjunto de datos de rendimiento académico de estudiantes universitarios sirvió como conjunto de validación. Los cuatro modelos calibraron 500 registros de evaluación docente, y se calcularon sus CAE y CRE. Los resultados se muestran en la Figura 11.

Figura 11: Comparación de los resultados de las pruebas CAE y CRE. (A) Resultados de las pruebas CAE. (B) Resultados de pruebas CRE. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 11A, GFBFEN inicialmente alcanzó una CAE de 0,1279. A medida que avanzaba la calibración, el CAE disminuyó a 0,0641 y se estabilizó tras 104 registros. Los modelos comparativos tuvieron una CAE inicial y final más alta que GFBFEN, siendo EAB la CAE inicial y final más alta de 0,1858 y 0,1217, respectivamente. La Figura 11B indicó que el CRE inicial y final de GFBFEN durante la tarea de calibración permanecieron por debajo de los modelos de comparación, con valores de 0,1137 y 0,0912, respectivamente. Estos resultados demostraron que GFBFEN mostró una fuerte capacidad de ajuste, beneficiándose del mecanismo de atención de GAT, que construyó grafos de correlación semántica entre características, mejoró la alineación semántica de datos de evaluación de múltiples fuentes y redujo la calibración ineficace causada por el sesgo de características. El estudio evaluó posteriormente la CAR para datos de evaluación estudiantil, datos de evaluación docente, datos de evaluación escolar y datos de evaluación en línea, etiquetados como I, II, III y IV. Los resultados se muestran en la Figura 12.

Figura 12: Comparación de los resultados de la CAR de diferentes datos de evaluación. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 12A, GFBFEN logró un CAR del 99,34%, 98,93%, 99,01% y 99,12% en datos de evaluación de estudiantes, profesores, escuelas y en línea en el conjunto de entrenamiento. En el conjunto de validación, los valores de CAR fueron 97,89%, 98,56%, 97,57% y 98,46%, respectivamente. La figura 12B–D mostró que los modelos de comparación tenían menor CAR tanto en conjuntos de entrenamiento como de validación. Entre ellos, el EAB fue el que tuvo peor desempeño en el conjunto de validación, con un CAR del 76,31% para datos de profesores y 78,29% para datos online. Estos resultados confirmaron que GFBFEN superó significativamente a los modelos de comparación. A continuación, el estudio evaluó la lengua de aprendizaje en la tarea de calibración de la evaluación docente para evaluar la capacidad de ajuste y la estabilidad del entrenamiento. Los resultados se muestran en la Figura 13.

Figura 13: Resultados de pruebas de capacidad de ajuste de modelos y estabilidad de entrenamiento. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 13A, GFBFEN inicialmente tenía un TL de 0,1021 en el conjunto de entrenamiento. Tras 67 iteraciones, la línea de transición disminuyó a 0,0725 y se estabilizó. En el conjunto de validación, la TL disminuyó de 0,1237 a 0,1018. La figura 13B–D indicó que la TL final de PRF en el conjunto de entrenamiento era 0,0824, la TL final de EAB en el conjunto de validación era 0,1178, y la TL de DBLR en ambos conjuntos era inestable y significativamente superior a la de otros modelos. Estos resultados demostraron que GFBFEN mostró una fuerte capacidad de ajuste y estabilidad en el entrenamiento, beneficiándose de la transferencia de conocimientos basada en KD, lo que permitió al modelo aprender rápidamente características efectivas, acelerar la convergencia de pérdidas y asegurar la generalización entre conjuntos de datos. Para validar de forma exhaustiva el rendimiento central de GFBFEN, el estudio evaluó EFCA, HDPE, FCP y CSCC para los cuatro modelos. Los resultados se muestran en la Figura 14.

Figura 14: Resultados de pruebas de indicadores integrales de tareas de evaluación y corrección docentes. (A) Resultados de la prueba GFBFEN. (B) Resultados de la prueba PRF. (C) Resultados de la prueba EAB. (D) Resultados de la prueba DBLR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 14A–D, el modelo GFBFEN tiene valores EFCA del 99,35% y 98,76% en los conjuntos de entrenamiento y validación, respectivamente. Los EFCA del modelo PRF son del 88,53% y 87,04%, respectivamente. En el conjunto de validación, la EFCA del modelo GFBFEN fue un 6,59% superior a la del modelo EAB, con un 92,17%, y un 11,72% superior a la del modelo DBLR, que fue del 87,04%. Además, sus indicadores HDPE, FCP y CSCC también lideran de forma contundente: en el conjunto de validación, el HDPE del modelo GFBFEN alcanzó el 98,05%, el FCP alcanzó el 97,93% y el CSCC alcanzó el 0,968, todos ellos superando a los modelos PRF, EAB y DBLR. En conjunto, estos resultados validaron el rendimiento integral superior de GFBFEN, demostrando que la optimización coordinada del modelo de GAT-KD, AM-LSTM y BFEN mejoró eficazmente la precisión, eficiencia y equidad de la calibración en la enseñanza de la evaluación.
La investigación fue construyendo gradualmente FairEduNet, BFEN, FBFEN y GFBFEN, y el GFBFEN final incluye componentes como FairEduNet, BERT-RL, AM-LSTM y GAT-KD. Para verificar la contribución independiente de los componentes individuales, se realizan experimentos de investigación y diseño de ablación, eliminando gradualmente cada componente y evaluando su impacto en el rendimiento global. Los indicadores comparativos incluyen ECA, FDR, SAS y FMD. Los resultados mostraron que el valor ECA del componente FairEduNet por sí solo fue del 87,32%, FDR del 12,45%, SAR del 89,67% y FMD del 11,89%. El ECA del modelo GFBFEN completo alcanzó el 99,21%, el FDR cayó aún más al 1,93%, el SAR se mantuvo estable en el 99,45% y el FMD se optimizó al 7,28%. Tras eliminar el BERT-RL, EL ECA disminuyó al 91,04%, el valor FDR fue del 6,23%, el valor SAR del 92,33% y la FMD aumentó al 7,85%. La ablación de AM-LSTM aumentó las fluctuaciones del SAR en un 14,2%. La eliminación de GAT-KD llevó a un aumento de la FMD hasta el 8,36%, y su mecanismo de supresión del sesgo de la estructura del grafo, guiado por la destilación del conocimiento, fue significativamente eficaz para aliviar el sesgo implícito de asociación entre poblaciones.
Para probar aún más los métodos de investigación, el estudio introdujo indicadores establecidos de estándares de equidad, a saber, el Fairness Correction Benchmark (FCB), que cubre tres tipos de restricciones rígidas ampliamente reconocidas en escenarios educativos: (1) El valor absoluto de la diferencia media tras corrección entre grupos es ≤ 1,2 puntos (basado en el sistema porcentual); (2) La tasa de solapamiento de los intervalos de confianza corregidos para cada subgrupo de atributos sensibles es ≥ 95%; (3) En cualquier escenario concreto, la región conjunta factible de FDR y SAR debe cumplir la restricción de la frontera de Pareto (es decir, es imposible mejorar el SAR sin deteriorar FDR, y viceversa). El modelo GFBFEN se comparó con modelos de referencia convencionales, como EAB, PRF, DBLR y GBDT, en la evaluación experimental. El experimento se llevó a cabo con 421 datos reales de evaluación recogidos de escenarios docentes reales, cubriendo tres escenarios educativos típicos: evaluación en aula, evaluación práctica y pruebas en línea. Los resultados se muestran en la Tabla 2.
| Algoritmo | Valor absoluto de la diferencia media de puntuación | Tasa de solapamiento de intervalos de confianza(%) | Tasa de satisfacción de regiones conjuntamente factible(%) | Puntuación integral |
| GFBFEN | 0.87 | 98.3 | 100 | 97.2 |
| EBA | 1.52 | 98.4 | 82.6 | 78.5 |
| PRF | 1.68 | 85.1 | 74.3 | 71.2 |
| DBLR | 1.45 | 87.9 | 79.8 | 75.6 |
| GBDT | 1.33 | 91.2 | 86.4 | 79.9 |
Tabla 2: Resultados de evaluación de indicadores de criterios de equidad y verificación práctica de aplicaciones.
Como se muestra en la Tabla 2, GFBFEN logró el cumplimiento total de las cuatro restricciones rígidas de la FCB de forma independiente, y su puntuación integral superó significativamente a los otros modelos de referencia por un margen de +18,7 puntos, validando la robustez del paradigma propuesto de corrección colaborativa multietapa. En particular, en el indicador central que refleja la capacidad de compromiso entre equidad y eficiencia, la tasa conjunta de cobertura de regiones factibles alcanzó el 100%, lo que indica que el modelo posee capacidades de toma de decisiones óptimas de Pareto desplegables en escenarios educativos reales.
La equidad en la evaluación docente se refiere al uso de restricciones cuantitativas verificables como referencia, respetando las diferencias individuales y las leyes educativas. La lógica de cálculo y el establecimiento de umbrales de los indicadores de equidad se basan en el marco teórico de la equidad educativa y los estándares empíricos de verificación de datos. Son revisados conjuntamente por un comité de expertos compuesto por cinco académicos para garantizar un alto grado de unidad entre el rigor teórico y la adaptabilidad a la práctica educativa. Para validar aún más la adaptabilidad del modelo bajo diferentes estándares de equidad, el estudio realizó una validación adicional bajo múltiples estándares. Específicamente, se seleccionaron tres estándares de equidad para su verificación. El estándar 1 es el equilibrio de tasas de aceptación entre grupos basado en la Paridad Demográfica. El estándar 2 es la consistencia entre grupos entre la tasa de positivos verdaderos y la tasa de falsos positivos basada en las probabilidades igualadas. El estándar 3 se basa en la Paridad Predictiva para controlar el sesgo intergrupal en la precisión de la predicción. Se comprobó que GFBFEN cumplía de forma consistente con los requisitos de restricción rígida bajo los tres estándares. Desviación de la tasa de aceptación de grupo estándar 1 ≤1,2%, diferencia entre intergrupos de tasa de verdaderos/falsos positivos estándar 2 ≤0,85%, precisión de predicción estándar 3 y desviación intergrupal controlada dentro del ±±0,6%. En contraste, los otros modelos mostraron un avance de restricción del ≥3,7% bajo al menos un criterio, verificando la compatibilidad generalizada de GFBFEN para paradigmas de equidad multivariante.
DISPONIBILIDAD DE DATOS:
Para garantizar la fiabilidad de los datos, el estudio utilizó el conjunto de datos del Informe Global de Monitorización de la Educación (https://www.education-progress.org/) y el conjunto de datos de rendimiento académico de estudiantes de secundaria española (https://archive.ics.uci.edu/dataset/320/student+performance). Los conjuntos de entrenamiento y validación se separan por orden cronológico de los dos conjuntos de datos. El estudio utiliza datos de septiembre de 2024 como conjunto de entrenamiento y de octubre de 2024 a junio de 2025 como conjunto de validación, alineándose con la progresión temporal de las evaluaciones educativas.