$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Анализ производительности алгоритмов BFEN
Показатели, оценённые в экспериментах, включали следующее:
Точность коррекции оценки (ECA) обозначает долю элементов отклонения, правильно выявленных и исправленных моделью в результатах оценки преподавания, что отражает общую эффективность механизма коррекции. Более высокие значения указывают на лучшую точность коррекции.
Коэффициент отклонения справедливости (FDR) измеряет величину межгрупповых различий в оценках, которые модель не устраняет в процессе калибровки. Он вычисляется как отношение стандартного отклонения каждого чувствительного признака (например, пол, регион, этническая принадлежность) внутри распределения баллов к общему стандартному отклонению; Более низкие значения подразумевают минимизацию межгрупповых дисперсий и более надёжную гарантию справедливости.
Коэффициент адаптации к сценарию (SAR) показывает процент успешно выполненных корректирующих задач моделью в разнородных учебных контекстах (например, естественные науки против гуманитарных дисциплин, онлайн или офлайн).
Степень поддержания справедливости (FMD) определяется как один минус отношение дисперсии индикаторов справедливости между группами чувствительных атрибутов после коррекции к наблюдаемому до коррекции, что отражает способность системы сохранять структурную справедливость в процессе калибровки.
Уровень распознавания дисциплинарных признаков (DFRR) рассчитывает долю выборок, в которых основные признаки были правильно идентифицированы в данных оценки каждой дисциплины относительно общего размера выборки оценки, демонстрируя способность модели выявлять и фиксировать вариации, специфичные для каждой области.
Эффективность многоисточникного слияния данных (MDFE) относится к производительности модели при выравнивании признаков, распределении веса и коррекции отклонений при слиянии многоуровневых гетерогенных оценочных данных. Этот комплексный показатель определяется как произведение количества обработанных образцов оценки в секунду (образцов/сек) и уровня соответствия согласованности коррекции (на уровне >95%), где более высокие значения означают более эффективный и стабильный термоядерный конвейер.
Стабильность корректировочных результатов (CRS) указывает на согласованность калибровочных выходов на нескольких независимых проходах, количественно определяемую обратным отклонением стандартного евклидового расстояния между корректировочными выходами каждой серии при одинаковых входах. Более высокие значения свидетельствуют о повышенной надёжности системы.
Время коррекции отдельных данных (SDCT) представляет собой среднюю вычислительную задержку, потраченную моделью на завершение калибровки одной выборки, измеряемую в миллисекундах (мс); Более низкие значения указывают на более сильную способность реагирования в реальном времени.
Корректированная абсолютная ошибка (CAE) измеряет среднюю абсолютную ошибку между откалиброванными прогнозами и значениями правды, отражая остаточное отклонение модели относительно исходных неоткалиброванных данных. Более низкие значения означают, что откалиброванные выходы ближе совпадают с реальными уровнями производительности.
Скорректированная относительная ошибка (CRE) количественно определяет среднюю абсолютную ошибку между откалиброванными предсказаниями и значениями правды, выраженной в процентах от истинности на земле, при этом более низкие значения указывают на более высокую относительную точность калибровки.
Скорость точности коррекции (CAR) представляет собой долю выборок, чья абсолютная ошибка после калибровки составляет < 0,5 относительно общего размера выборки, демонстрируя надёжность модели в удовлетворении заранее заданных ограничений точности. Высокие значения подтверждают эмпирическую полезность и достоверность результатов.
Общее значение потерь (TL) представляет собой цель комплексной оптимизации, полученную из взвешенной суммы отдельных членов субпотерь после выполнения задачи. В частности, семь метрик — DFRR, MDFE, CRS, SDCT, CAE, CRE и CAR — стандартизируются посредством нормализации Z-score и взвешиваются в соответствии с операционным приоритетом задач оценки. Имея вектор веса [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1], эти семь нормализованных значений индикатора агрегируются для вычисления итоговых потерь.
Точность кластеризации признаков оценки (EFCA) оценивает степень выравнивания между неконтролируемыми конфигурациями кластеризации, сгенерируемыми моделью, и категориями по реальности, проверенными экспертами в области.
Эффективность обработки данных с высокими размерностями (HDPE) измеряет количество образцов, подвергающихся уменьшению размерности признаков и коррекции отклонений за единицу времени при работе с разреженными векторами с ≥50 признаками оценки. Измеряемые в выборках в секунду, более высокие значения отражают более надёжную способность обрабатывать сложные, масштабные данные оценки в реальном времени.
Точность коррекции справедливости (FCP) оценивает однородность эффектов калибровки между расходящимися студентскими группами. Эта метрика количественно определяется вычислением среднего распределения расстояния Колмогорова–Смирнова для скорректированных абсолютных ошибок между подгруппами чувствительных атрибутов; Более низкие значения подразумевают более сбалансированную межгрупповую работу и более сильную гарантию справедливости.
Согласованность коррекции между сценами (CSCC) количественно определяет распределение результатов калибровки по трём типичным сценариям — а именно оценке в классе, практической оценке и онлайн-тестированию — моделируемых как отношение расстояний Вассерштейна.
Для проверки эффективности предлагаемого алгоритма калибровки оценки обучения BFEN исследование сравнило его с алгоритмом PRF, который сочетал анализ основных компонентов (PCA) и случайный лес (RF); алгоритм EAB, который объединял экстремальное обучение (ELM) и адаптивное бустинг (AdaBoost); и алгоритм DBLR, который объединял глубокую сеть убеждений (DBN) и логистическую регрессию (LR). Эксперименты проводились на системе, оснащённой процессором Intel Core i9-13900HX и GPU NVIDIA RTX 4080, обеспечивая высокие параллельные вычисления и большую видеопамять для эффективного выполнения вычислений по извлечению функций и калибровке для крупномасштабных учебных оценочных данных. Операционной системой была Windows 11, а для программирования использовался Python 3.9. Алгоритмы реализовывались с использованием библиотеки Scikit-learn, модули глубокого обучения — через фреймворк TensorFlow, а библиотеки Pandas и NumPy использовались для предварительной обработки данных. Среда разработки использовала PyCharm Professional 2023.1, а Seaborn применялся для визуализации результатов калибровки с целью интуитивного сравнения производительности алгоритмов. Для обеспечения надёжности данных в исследовании использовался набор данных Global Education MonitoringReport 1 и 2 по академической успеваемости учащихся средней школы вИспании. Набор данных содержит 12 486 записей, охватывающих мультимодальные данные оценки преподавания, такие как оценки преподавателей университета, академическая успеваемость студентов, оценки студенческого преподавания и обратную связь по курсам, охватывая 137 особенностей педагогических аспектов, включая частоту взаимодействия в классе, своевременность обратной связи заданий, согласованность оценок, языковую инклюзивность и межкультурную чувствительность. Целевой переменной является балл оценки преподавания, который в данном исследовании сопоставлен с многомерным взвешенным композитным значением, откалиброванным экспертами. Исследование объединяет четыре типа источников информации: оценки студенческого преподавания, рецензирование коллегами, наблюдения в классах руководителей и обзоры преподавательских досье с весами соответственно 0,35, 0,25, 0,25 и 0,15. Наборы обучения и валидации разделены по хронологическому порядку по двум наборам данных. В исследовании используются данные за сентябрь 2024 года в качестве учебного набора, а данные с октября 2024 по июнь 2025 года — как набор валидации, чтобы соответствовать временному прогрессу образовательных оценок. На этапе предварительной обработки применяется модально-специфическая стратегия: структурированные признаки стандартизируются с помощью нормализации Z-score и выбросов — Winsorized, а текстовые признаки кодируются по модели BERT-base-Chinese и сводятся к 768 измерениям. Состязательная подготовка применяется для повышения устойчивости к неявным проявлениям предвзятости и смягчения семантического дрейфа, вызванного культурными различиями.
Для достижения межотраслевых исследований обучения и валидации модель будет перенесена в четыре разнородных сценария преподавания: базовое образование K-12, профессиональное образование, непрерывное образование и международное китайское образование с нулевой или небольшой выборкой валидации. В этих четырёх сценариях исследование вводит термины адаптивной регуляризации в области при обучении алгоритмам, чтобы ограничить согласованность распределения признаков модели в различных сценариях обучения. Внедрение легкого механизма маски с учётом синтаксиса для коротких предложений в сценариях K-12; Для устранения неоднозначности профессиональной терминологии в профессиональном образовании создаётся и интегрируется динамический доменный словарь с графом знаний учебного плана. Разработать модуль для сравнения возрастных групп для устранения межпоколенческого семантического разрыва в непрерывном образовании, выравнивая семантические якоря для оценочных выражений разных возрастных групп в латентном пространстве. Для решения проблемы культурной нагрузки в международном китайском образовании используются кросс-языковые сравнения для тонкой настройки и повышения прочности понимания небуквальных образовательных концепций. Исследования экспертной калибровки и тестирования надёжности структурированных полей в оригинальных оценочных записях, удаляя записи с низкой надёжностью с коэффициентом альфа Криппендорфа ниже 0,75. Двойная слепоя ручная аннотация была реализована на учебниках для оценки учащихся, при этом 3 эксперта по образовательным измерениям независимо заполняли маркировку по типу отклонения, достигнув согласованности Коэна k = 0,86 в аннотации. Наконец, аннотированные результаты были перекрёстно валидированы с записями о посещаемости супервизии и выводами по учебным файлам для формирования окончательных калибровочных меток.
Выбранные наборы данных были получены из различных популяций, систем измерений и образовательных оснований. Эта междоменная парадигма валидации тщательно проверяла прочность и границы обобщения модели в аутентичной образовательной экосистеме, предотвращая иллюзии оценки, вызванные гомогенизацией данных. Оба репозитория содержали значительные объемы записей по оценке преподавания, предоставляя прямую справочную ценность для внедрения интеллектуальных образовательных алгоритмов, ориентированных на справедливость. Оба набора данных содержали значительные данные по оценке преподавания, предоставляющие прямые эталонные значения для разработки алгоритмов интеллектуального образования, ориентированных на справедливость, и калибровки оценки обучения. В ходе исследования были откалиброваны 1000 записей оценки преподавателей с помощью четырёх алгоритмов и рассчитаны их ECA и Fairness FDR. Результаты показаны на рисунке 8.

Рисунок 8: Сравнение результатов тестов между ECA и FDR. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Как показано на рисунке 8A, BFEN изначально достиг ECA 82,47% и FDR 5,71% в задании калибровки оценки. По мере увеличения количества откалиброванных записей ECA вырос до 98,75% и стабилизировался после калибровки 421 записи, тогда как FDR снизился до 2,87% и стабилизировался после калибровки 514 записей. Как показано на рисунке 8B, кривая ECA алгоритма PRF постепенно увеличивалась, а линия FDR — постепенно уменьшается. В конце калибровочной задачи значение ECA составляло 92,30%, а PDR — 6,72%. Рисунок 8C демонстрирует, что кривая ЭКА алгоритма EAB быстро поднималась перед выравниванием, тогда как траектория FDR демонстрировала сильные ранние колебания перед сходимостью, завершившись с ECA 84,64% и FDR 8,93%. Как показано на рисунке 8D, алгоритм DBLR показал медленную восходящую траекторию ECA, сопровождаемую маргинальными колебаниями и ограниченным сжатием линии FDR, завершив задачу калибровки с ECA 83,51% и FDR 8,42%. Эти экспериментальные результаты подтверждают, что алгоритм BFEN значительно превосходит базовые методы как в точности коррекции оценки, так и в контроле справедливого смещения. Эта превосходная возможность обобщения связана с интеграцией BERT в BFEN, который извлекает глубокие семантические особенности из неструктурированного текста оценки для захвата скрытых выражений смещения, в то время как модуль RL динамически оптимизирует пороги справедливости и параметры коррекции с помощью многоцелевой функции вознаграждения для отделения чувствительных характеристик от конечных результатов. Затем в исследовании были протестированы SAR и ящур для оценки в классе, итоговых экзаменов, практической оценки и онлайн-тестирования, при этом четыре сценария были отмечены как A, B, C и D. Результаты показаны на рисунке 9.

Рисунок 9: Сравнение SAR и ящур приводит к разным сценариям. (A) Результаты SAR-теста. (B) Результаты теста на ящур. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Как показано на рисунке 9A, BFEN достиг SAR выше 98% во всех учебных сценариях, с самым высоким показателем SAR — 99,01% для тестов в классе. SAR алгоритма сравнения в разных сценариях ниже, чем у алгоритма BFEN, при этом алгоритм DBLR имеет самый низкий SAR для итогового сценария оценки среди всех алгоритмов — SAR 70,23%. Как показано на рисунке 9B, FMD алгоритма BFEN всё ещё значительно выше, чем у алгоритма сравнения в различных учебных сценариях, с FMD соответственно 98,47%, 98,05%, 97,81% и 97,94% в разных сценариях. Ящики в эталонном алгоритме DBLR составляют соответственно 82,36%, 71,74%, 70,59% и 69,12%. Ящуры алгоритма EAB составляют соответственно 80,79%, 68,21%, 67,65% и 66,03%, а FMD алгоритма PRF — 86,42%, 82,17%, 80,98% и 78,33% соответственно. Эти результаты показали, что BFEN превосходил алгоритмы сравнения благодаря итеративному обучению GBDT с несколькими деревьями решений, которые точно фиксировали ошибки в разных сценариях и обеспечивали стабильные и справедливые результаты калибровки. В исследовании дополнительно оценивалась степень распознавания признаков (DFRR) для китайского, математического и английского языков с использованием четырёх алгоритмов. Результаты показаны на рисунке 10.

Рисунок 10: Сравнение результатов тестов DFRR по разным дисциплинам. (A) Тренировочный набор. (B) Набор валидации. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Как показано на рисунке 10A, BFEN достиг DFRR 99,23%, 98,94% и 99,13% по китайскому, математике и английскому языку в учебном наборе. Рисунок 10B показал, что BFEN также достиг более высокого DFRR в наборе валидации по сравнению с другими алгоритмами. В частности, DFRR BFEN для китайского достиг 98,41%, что на 10,8% выше 87,61% у DBLR; по математике — 97,54%, что на 9,07% выше, чем у PRF — 88,47%; а по английскому — 98,13%, что на 13,34% выше, чем у EAB — 84,79%. Эти результаты подтвердили, что BFEN эффективно адаптировался к калибровке дисциплинарной оценки, сочетая глубокое уловление семантических различий BERT с персонализированным обучением ошибочных паттернов GBDT. Для всесторонней оценки эффективности BFEN исследование оценивало MDFE, CRS и SDCT для четырёх алгоритмов. Результаты приведены в Таблице 1.
| Набор данных | Алгоритм | MDFE (%) | CRS | SDCT(и) |
| Обучение | BFEN | 98.42 ± 0.28*&@ | 0.975 ± 0.28*&@ | 0.78 ± 0.04*&@ |
| PRF | 83,85 ± 0,41 | 0,779 ± 0,36 | 1.32 ± 0.08 |
| EAB | 85,91 ± 0,50 | 0,806 ± 0,40 | 1.15 ± 0.07 |
| DBLR | 88,76 ± 0,47 | 0,753 ± 0,39 | 1,45 ± 0,08 |
| Валидация | BFEN | 97.58 ± 0.25*&@ | 0.968 ± 0.27*&@ | 0.86 ± 0.03*&@ |
| PRF | 81,62 ± 0,32 | 0,687 ± 0,50 | 1.51 ± 0.06 |
| EAB | 84,37 ± 0,40 | 0,749 ± 0,42 | 1.28 ± 0.05 |
| DBLR | 87,53 ± 0,30 | 0,728 ± 0,47 | 1,63 ± 0,07 |
Таблица 1: Сравнение результатов тестов MDFE, CRS и SDCT. «*» указывает на значительную разницу (p < 0,05) между результатами BFEN и PRF. «&» означает, что разница между результатами BFEN и EAB была значительной (p < 0,05). «@» означает, что разница между результатами BFEN и DBLR значительна (p < 0.05)
Таблица 1 показывает, что BFEN достиг MDFE 98,42% в учебном наборе, что на 14,57% выше показателя PRF (83,85%), CRS 0,975%, на 0,222 выше 0,753 у DBLR и SDCT 0,78 с, на 0,67 с меньше, чем у DBLR 1,45 с. В валидационном наборе BFEN сохранил превосходную производительность: MDFE, CRS и SDCT соответственно на 97,58%, 0,968 и 0,86 с, превосходя алгоритмы сравнения. В целом результаты подтвердили превосходные комплексные результаты BFEN в обучении калибровке оценок.
Валидация эффективности модели калибровки оценки преподавания GFBFEN
На основе валидации эффективности BFEN исследование дополнительно оценило эффективность модели калибровки оценки обучения GFBFEN, построенной на базе BFEN, и сравнило её с калибровочными моделями, построенными на основе алгоритмов PRF, EAB и DBLR. Для обеспечения согласованных условий тестирования и сопоставимости набор глобальных отчётов по мониторингу образования служил учебным набором, а набор данных по академической успеваемости студентов университета — набором валидации. Четыре модели откалибровали 500 записей для оценки преподавания, и их CAE и CRE были рассчитаны. Результаты показаны на рисунке 11.

Рисунок 11: Сравнение результатов тестов CAE и CRE. (A) Результаты теста CAE. (B) Результаты теста CRE. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Как показано на рисунке 11A, GFBFEN изначально достиг CAE 0,1279. По мере прохождения калибровки CAE снизился до 0,0641 и стабилизировался после 104 записей. Сравнительные модели имели более высокий начальный и конечный CAE, чем GFBFEN, при этом EAB имел самый высокий начальный и конечный CAE — 0,1858 и 0,1217 соответственно. Рисунок 11B показал, что начальная и итоговая CRE GFBFEN во время калибровочной задачи оставались ниже, чем в сравнительных моделях, с значениями 0,1137 и 0,0912 соответственно. Эти результаты показали, что GFBFEN демонстрирует сильные возможности по подгонке, используя механизм внимания GAT, который строил графы семантической корреляции между признаками, улучшал семантическое согласование многоисточниковых данных оценки и снижал неэффективную калибровку, вызванную смещением признаков. Затем в исследовании была проведена оценка CAR на предмет данных оценки учеников, оценок учителей, школьных оценок и онлайн-оценок, помеченных как I, II, III и IV. Результаты показаны на рисунке 12.

Рисунок 12: Сравнение результатов CAR различных оценочных данных. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Как показано на рисунке 12A, GFBFEN достигла CAR в 99,34%, 98,93%, 99,01% и 99,12% по данным оценки учеников, учителей, школ и онлайн-оценки в наборе обучения. В валидационном наборе значения CAR составили соответственно 97,89%, 98,56%, 97,57% и 98,46%. Рисунок 12B–D показал, что сравнительные модели имели более низкий CAR как в обучающем, так и в валидационных наборах. Среди них EAB показал худший результат в наборе валидации: CAR составил 76,31% для данных учителей и 78,29% для онлайн-данных. Эти результаты подтвердили, что GFBFEN значительно превосходил сравнительные модели. Далее в исследовании был протестирован TL в задании калибровки оценки для оценки способности к подгонке и устойчивости тренировок. Результаты показаны на рисунке 13.

Рисунок 13: Результаты теста на устойчивость модели и тренировки. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Как показано на рисунке 13A, изначально TL GFBFEN составлял 0,1021 в учебном наборе. После 67 итераций TL снизился до 0,0725 и стабилизировался. В валидационном наборе TL снизился с 0,1237 до 0,1018. Рисунок 13B–D показал, что итоговый TL PRF в обучающем наборе составлял 0,0824, итоговый TL EAB в валидационном наборе — 0,1178, а TL DBLR в обоих наборах был нестабилен и значительно выше, чем у других моделей. Эти результаты показали, что GFBFEN демонстрирует высокую способность к подгонке и стабильность обучения, используя передачу знаний на основе KD, что позволило модели быстро освоить эффективные признаки, ускорить сходимость потерь и обеспечить обобщение между наборами данных. Для всесторонней проверки основных характеристик GFBFEN в исследовании были протестированы EFCA, HDPE, FCP и CSCC для четырёх моделей. Результаты показаны на рисунке 14.

Рисунок 14: Результаты комплексных показательных тестов для выполнения заданий по оценке и коррекции преподавания. (A) Результаты тестов GFBFEN. (B) Результаты теста PRF. (C) Результаты тестов EAB. (D) Результаты тестов DBLR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Как показано на рисунке 14A–D, модель GFBFEN имеет значения EFCA 99,35% и 98,76% соответственно в наборах для обучения и валидации. EFCA модели PRF составляет соответственно 88,53% и 87,04%. В валидационном наборе EFCA модели GFBFEN был на 6,59% выше, чем у модели EAB — 92,17%, и на 11,72% выше, чем у модели DBLR — 87,04%. Кроме того, показатели HDPE, FCP и CSCC также являются весьма лидирующими показателями: в наборе валидации HDPE модели GFBFEN достиг 98,05%, FCP — 97,93%, а CSCC — 0,968, что превзошло модели PRF, EAB и DBLR. В целом эти результаты подтвердили превосходную комплексную эффективность GFBFEN, демонстрируя, что координированная оптимизация GAT-KD, AM-LSTM и BFEN эффективно повысила точность, эффективность и справедливость оценки калибровки.
В ходе исследований постепенно были созданы FairEduNet, BFEN, FBFEN и GFBFEN, а окончательный GFBFEN включает такие компоненты, как FairEduNet, BERT-RL, AM-LSTM и GAT-KD. Для подтверждения независимого вклада отдельных компонентов проводятся исследования и эксперименты по абляции дизайна, постепенно удаляя каждый компонент и оценивая его влияние на общую производительность. Сравнительные показатели включают ECA, FDR, SAR и ящур. Результаты показали, что значение ECA только компонента FairEduNet составляло 87,32%, FDR — 12,45%, SAR — 89,67%, а ящур — 11,89%. ECA полной модели GFBFEN достиг 99,21%, FDR снизился до 1,93%, SAR остался стабильным на уровне 99,45%, а ящур оптимизирован до 7,28%. После удаления BERT-RL ECA снизилась до 91,04%, значение FDR — 6,23%, значение SAR — 92,33%, а ящур — до 7,85%. Абляция AM-LSTM увеличила флуктуации SAR на 14,2%. Удаление GAT-KD привело к увеличению ящуря до 8,36%, а его механизм подавления распространения смещения структуры графов с помощью дистилляции знаний оказался значительно эффективным для снижения неявных ассоциативных искажений между популяциями.
Для дальнейшего тестирования методов исследования были введены установленные стандарты справедливости, а именно Benchmark Fairness Correction Benchmark (FCB), который охватывает три типа жёстких ограничений, широко признанных в образовательных сценариях: (1) Абсолютное значение средней разницы после коррекции между группами составляет ≤ 1,2 балла (на основе процентной системы); (2) Коэффициент перекрытия скорректированных доверительных интервалов для каждой подгруппы чувствительных атрибутов составляет ≥ 95%; (3) В любом отдельном сценарии совместная целесообразная область FDR и SAR должна удовлетворять ограничению границы Парето (то есть невозможно улучшить SAR без ухудшения FDR, и наоборот). Модель GFBFEN была сравнивана с основными базовыми моделями, такими как EAB, PRF, DBLR и GBDT, в экспериментальной оценке. Эксперимент проводился на 421 реальных данных оценки, собранных из реальных учебных сценариев, охватывающих три типичных образовательных сценария: оценку в классе, практическую оценку и онлайн-тестирование. Результаты приведены в таблице 2.
| Алгоритм | Абсолютное значение средней разницы баллов | Коэффициент перекрытия доверительных интервалов (%) | Совместный уровень удовлетворённости возможных регионов (%) | Комплексная оценка |
| GFBFEN | 0.87 | 98.3 | 100 | 97.2 |
| EBA | 1.52 | 98.4 | 82.6 | 78.5 |
| PRF | 1.68 | 85.1 | 74.3 | 71.2 |
| DBLR | 1.45 | 87.9 | 79.8 | 75.6 |
| GBDT | 1.33 | 91.2 | 86.4 | 79.9 |
Таблица 2: Результаты оценки показателей критериев справедливости и практическая проверка применения.
Как показано в Таблице 2, GFBFEN независимо достиг полного соответствия всем четырём жёстким ограничениям FCB, а его комплексный балл значительно превзошел остальные базовые модели на +18,7 пункта, подтверждая устойчивость предлагаемой многоступенчатой парадигмы совместной коррекции. В частности, в ключевом индикаторе, отражающем возможность компромисса между справедливостью и эффективностью, совместный уровень охвата осуществимого региона достиг 100%, что свидетельствует о том, что модель обладает разворачиваемыми возможностями принятия решений по Парето-оптимальным решениям в реальных образовательных сценариях.
Справедливость в оценке преподавания подразумевает использование проверяемых количественных ограничений в качестве ориентира при соблюдении индивидуальных различий и образовательных законов. Логика расчёта и установка порога индикаторов равенства основаны на теоретической основе образовательного равенства и стандартах эмпирической проверки данных. Они совместно рассматриваются экспертным комитетом, состоящим из пяти учёных, чтобы обеспечить высокий уровень единства между теоретической строгостью и адаптацией к образовательной практике. Для дальнейшей проверки адаптивности модели по разным стандартам справедливости исследование проводило дополнительную валидацию по нескольким стандартам. В частности, для проверки были выбраны три стандарта справедливости. Стандарт 1 — это баланс уровня приема между группами на основе демографического паритета. Стандарт 2 — это кросс-групповая согласованность истинного и ложноположительного процента на основе уравненных шансов. Стандарт 3 основан на предсказательной паритете для контроля межгруппового смещения точности предсказаний. Было установлено, что GFBFEN последовательно соответствовал требованиям строгих ограничений по всем трём стандартам. Отклонение уровня приема по группе стандарта 1 ≤1,2%, разница между группами верно/ложноположительных результатов по стандарту 2 ≤0,85%, точность прогноза стандарта 3 контролируется межгрупповое отклонение в пределах ±±0,6%). В отличие от этого, другие модели показали прорыв по ограничениям ≥3,7% по крайней мере по одному критерию, что подтверждало совместимость генерализации GFBFEN для многомерных парадигм справедливости.
ДОСТУПНОСТЬ ДАННЫХ:
Для обеспечения надёжности данных исследование использовало набор данных Global Education Monitoring Report (https://www.education-progress.org/) и набора академических успеваемости учащихся средней школы в испанском (https://archive.ics.uci.edu/dataset/320/student+performance). Наборы обучения и валидации разделены по хронологическому порядку по двум наборам данных. В исследовании используются данные за сентябрь 2024 года в качестве набора обучения и с октября 2024 по июнь 2025 года как валидационный набор, что соответствует временной прогрессии образовательных оценок.