Research Article

Разработка алгоритмов FairEduNet и калибровка оценки в преподавании с учётом равенства в высшем образовании

DOI:

10.3791/70189

July 21st, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Цель исследования — предложить новый подход к обучению, калибровке оценки и образовательной справедливости в интеллектуальном образовании. Экспериментальные результаты показывают, что предлагаемая модель значительно превосходит сравнительные модели, эффективно решая проблемы плохой интеграции данных из нескольких источников и справедливости в существующих методах калибровки.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Современные методы калибровки оценки преподавания сталкиваются с такими трудностями, как низкая эффективность интеграции при обработке многоуровневых гетерогенных оценочных данных, недостаточная адаптивность между различными дисциплинами и сценариями преподавания, а также предвзятость в результатах с низкой гарантией справедливости. Цель исследования — создать интерпретируемую, переносимую и масштабируемую рамку коррекции справедливости для глубокого моделирования и динамической коррекции данных оценки преподавания. Эти проблемы затрудняют выполнение основных требований сбалансированного преподавания в интеллектуальном образовании. В данном исследовании предлагается ориентированный на справедливость алгоритм образовательной сети, интегрирующий генеративную состязательную сеть и дерево решений с ускорением градиента. Алгоритм строит механизм калибровки справедливости и сочетает двунаправленную модель представления энкодеров с сетью внимания графов для оптимизации извлечения признаков и динамической адаптивности, повышая эффективность обработки данных в нескольких источниках и точность калибровки справедливости. Такой подход обеспечивает точную калибровку и обеспечение справедливости в учебных оценках. В индикаторном тесте модель достигла точности 98,76% в признаках оценки кластеризации, 98,05% в коррекции справедливости и 0,968% согласованности коррекции между сценариями в наборе валидации. В задаче тестирования стоимости потерь общая потеря модели снизилась с 0,1237 до 0,1018 во время задачи коррекции оценки в валидационном наборе. В индикаторном тесте модель достигла точности 98,76% в признаках оценки кластеризации, 98,05% в коррекции справедливости и 0,968% согласованности коррекции между сценариями в наборе валидации. Экспериментальные результаты показывают, что предлагаемая модель значительно превосходит сравнительные модели, эффективно решая проблемы плохой интеграции данных из нескольких источников и справедливости в существующих методах калибровки. Кроме того, он предоставляет инновационные алгоритмические рамки для разработчиков технологий и надёжные технические инструменты для образовательных администраторов для продвижения равенства в преподавании. Вклад в исследования заключается в: (i) интеграции трёх основных модулей, включая многоисточниковую предобработку данных, динамическую верификацию индекса справедливости и визуализацию объяснимости; и (ii) предложение парадигмы коррекции справедливости, основанной на совместной оптимизации генеративных состязательных сетей и деревьев градиентного бустинга, что преодолевает ограничения традиционной коррекции с одной моделью и позволяет развязанное обучение моделированию отклонений и принятия решений по коррекции.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Оценка и калибровка преподавания составляют основу обеспечения качества преподавания в интеллектуальном образовании. Благодаря динамическому анализу, коррекции ошибок и калибровке результатов они создают основу для улучшения преподавания и персонализированного обучения. Их точность и справедливость напрямую влияют на то, сможет ли интеллектуальное образование преодолеть технологические предвзятости и обеспечить сбалансированную образовательную поддержку 1,2. Однако существующие методы имеют несколько недостатков: они опираются на один источник данных, игнорируют реальную ситуацию и приводят к смещению данных и коррекционной ошибке. Отсутствие динамического механизма адаптации справедливости затрудняет удовлетворение потребностей дисциплин исценариев 3,4. Кроме того, существуют такие проблемы, как отсутствие индикаторов справедливости и смещение в стратегиях коррекции при работе с гетерогенными данными из нескольких источников. С этой целью учёные проводили исследования по нескольким направлениям, например, оценивая обучение с теннисом на основе улучшенного алгоритма плотнойтраектории 5. Йин и др. использовали процесс аналитической иерархии и алгоритм нечеткого синтеза для мониторинга онлайн-обучения6. Чен проанализировал образовательные данные для пожилых людей с помощью усовершенствованного алгоритма анализа данных для повышения качестваобучения 7.

Хотя эти исследования добились прогресса, такие проблемы, как смещение результатов калибровки и плохая координация справедливости, остаются. Поэтому создание модели, которая одновременно обеспечивает точную калибровку оценки преподавания и динамическую гарантию справедливости, стало направлением исследований в интеллектуальном образовании. Генеративная состязательная сеть (GAN) адаптируется для устранения неявного влияния чувствительных атрибутов на результаты посредством сопернического обучения в реальном времени между генератором и дискриминатором, обеспечивая определение результатов основными факторами, а не смещениями, вызваннымиметками 8. GAN демонстрирует преимущества в работе с групповыми предвзятостями в оценочных данных и моделировании нелинейных ограничений справедливости. Ченг и др. предложили алгоритм улучшения изображения на базе GAN для работы с изображениями низкого разрешения. Генератор выводит изображения высокого разрешения с низкоразрешённых входов, а дискриминатор отличает сгенерированные изображения от реальных высокоразрешающих изображений. Состязательное обучение оптимизирует параметры так, чтобы выход генератора приближался к реальнымизображениям 9. Канг и др. предложили кроссмодальную модель GAN для повышения эффективности мультимодальной обработки данных в областях возобновляемой энергетики. Генератор получает одномодальные данные, дискриминатор отличает генерируемые данные от реальных мультимодальных данных, а adpersarial training оптимизирует модель для повышения эффективности10. Алгоритм дерева решений градиентного усиления (GBDT) — это классический алгоритм структурированной обработки данных с сильными возможностями захвата признаков. Итеративно интегрируя несколько деревьев решений, GBDT точно изучает паттерны ошибок данных и демонстрирует преимущества в обработке многоисточниковой гетерогенной оценочной информации и исправлении нелинейных отклоненийбаллов 11,12. Мизуно и соавторы предложили метод прогнозирования путей на основе GBDT для бедствий с сильными осадками, изучая особенности путей и прогнозируя пути катастроф с помощью данных в реальном времени, выбирая оптимальные прогнозы через несколько деревьеврешений 13. Гао и др. разработали метод визуального анализа на основе GBDT для прогнозирования частоты кликов в рекламе, изучая связь между визуальными признаками и историческими данными кликов для прогнозирования частоты кликовдля новых объявлений 14. Исходя из вышеуказанных задач, данное исследование направлено на систематический ответ на следующий основной научный вопрос: как можно построить интеллектуальную модель оценки образования для эффективной интеграции многоисточниковых гетерогенных данных, динамической адаптации к различным сценариям преподавания и одновременного обеспечения точности калибровки и справедливости результатов. Для ответа на этот вопрос в исследовании используется синергетический эффект механизма ограничения справедливости GAN и точную возможность калибровки ошибок GBDT. Кроме того, проводятся исследования по внедрению передовых технологий, таких как обработка естественного языка (BERT), обучение с подкреплением (RL), механизмы внимания (AM), сети длительной краткосрочной памяти (LSTM), графовые сети внимания (GAT) и дистилляция знаний (KD), чтобы компенсировать внутренние ограничения одной модели в области извлечения признаков, динамической адаптации и эффективности рассуждения. В конечном итоге цель — предоставить решение для калибровки оценки преподавания, которое будет одновременно точным и справедливым, а также обладает сильными возможностями обобщения для области интеллектуального образования.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Проектирование и оптимизация алгоритмов FairEduNet
Исследование объединяет GAN и GBDT для построения алгоритма FairEduNet, достигая двойных целей — коррекции справедливости и коррекции точности, а не компромисса односторонней оптимизации. FairEduNet использует двухканальную совместную архитектуру: основной канал GBDT отвечает за структурированное моделирование ошибок и точную коррекцию, тогда как вспомогательный канал GAN сосредоточен на разделении чувствительных атрибутов и динамической корректировке справедливости. Архитектура алгоритмов FairEduNet, объединяющая GAN и GBDT, показана на рисунке 1.

figure-protocol-1
Рисунок 1: Архитектура алгоритма FairEduNet, объединяющая GAN и GBDT. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой картины.

Как показано на рисунке 1, FairEduNet сначала собирает и предварительно обрабатывает данные многоисточниковой оценки. GBDT использует несколько деревьев решений для итеративного изучения паттернов ошибок оценки, выводит начальные результаты калибровки и передаёт их в модуль GAN. GAN обучает дискриминатор изучению связи между исходными результатами калибровки и чувствительными атрибутами, в то время как генератор динамически корректирует параметры калибровки. Через несколько раундов противоположного тренинга и проверки справедливости оптимизируется предвзятость справедливости. Наконец, результаты, откалиброванные по справедливости, возвращаются в модуль GBDT, который корректирует для точности и справедливости, выводя калибровку и отчёт для оценки преподавания. GBDT вычисляет остатки, как показано в уравнении (1).

figure-protocol-2(1)

В уравнении (1) figure-protocol-3 представляет собой остаток i-й выборки в t-й итерации, yi — истинное значение, а figure-protocol-4 — предсказывающее значение t-1-й итерации. Состязательный процесс GAN показан в уравнении (2).

figure-protocol-5(2)

В уравнении (2) x — исходный результат калибровки, z — признаки чувствительных атрибутов, Pdata(x)  — истинное распределение нечувствительных признаков, Pz(z) — распределение чувствительных атрибутов, D — дискриминатор, а G — генератор15. Начальный выход калибровки GBDT показан в уравнении (3).

figure-protocol-6(3)

В уравнении (3) figure-protocol-7 представляет предсказание i-й выборки исходным деревом решений, K — общее количество деревьев решений, γk — вес k-го дерева, а hk(xi) — результат предсказания k-го дерева для i-Этот образец. Алгоритм FairEduNet может обеспечивать точную калибровку и обеспечение справедливости для обучающих данных оценки. Однако при обработке неструктурированных оценочных данных и адаптации к динамическим сценариям FairEduNet демонстрирует слабые возможности по извлечению признаков для неструктурированных признаков, что приводит к калибровочному смещению. Кроме того, индикаторы справедливости и параметры калибровки FairEduNet устанавливаются статически, что ограничивает адаптивность к различным сценариям преподавания и влияет на общее качество калибровки. Сочетание двунаправленных представлений энкодеров из трансформаторов (BERT) и усиленного обучения (RL), алгоритма BERT-RL, позволяет точно извлекать глубокие признаки из неструктурированного текста и динамически адаптировать параметры сценария без ручной установки статических порогов, что дополнительно повышает надёжность выходных данных алгоритмов всценариях 16,17. Традиционные методы, такие как TF-IDF, опираются на частоту слов, но не обладают глубоким пониманием контекста и не могут выделить конкретные направления «справедливости» в разных ситуациях. Word2Vec создаёт статические векторы слов, которые с трудом адаптируются к сложным контекстуальным изменениям и распознают косвенные предвзятости. BERT использует многоуровневую самоконцентрацию для кодирования двунаправленного контекста, фиксируя как явные предвзятые термины, так и неявную предвзятую логику. Традиционные подходы требуют ручного составления списков слов с предвзятостью, зависят от субъективного опыта и охватывают ограниченные сценарии. Благодаря предварительно обученному обучению переноса моделей BERT автоматически осваивает глубокие семантические признаки без значительных ручных усилий, что обеспечивает более сильное обобщение в распознавании неоднозначных искажений. Кроме того, традиционные методы часто теряют информацию при длинных текстах, тогда как BERT поддерживает до 512 токенов, сохраняя контекстуальные отношения, точно определяя признаки смещения и обеспечивая тонкую коррекцию справедливости. Процесс работы BERT-RL показан на рисунке 2.

figure-protocol-8
Рисунок 2: Схема операций алгоритма BERT-RL. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Как показано на рисунке 2, BERT-RL сначала стандартизирует данные оценки неструктурированного текста и вводит их в модель BERT. BERT использует кодировщик трансформатора для двунаправленного семантического моделирования с целью извлечения ключевых признаков и построения матрицы признаков. Матрица признаков затем вводится в модуль RL, который учится оптимальной стратегии через несколько итераций. Оптимизированная конфигурация параметров наконец подаётся в FairEduNet, что повышает его адаптивность. Расчёт веса признака самовнимания BERT показан в уравнении (4).

figure-protocol-9(4)

В уравнении (4) dk представляет размерность вектора K. Многоцелевая функция вознаграждения RL выражена в уравнении (5).

figure-protocol-10(5)

В уравнении (5) ω1, ω2 и ω3 представляют коэффициенты веса, figure-protocol-11 представляют ошибку калибровки, D t — отклонение справедливости, D целевой — отклонение целевой справедливости, а Tt — время выполнения18. Это исследование объединяет BERT-RL с FairEduNet для создания алгоритма BERT-RL-FairEduNet, называемого BFEN. BFEN обеспечивает точную калибровку и обеспечение справедливости данных оценки преподавания с помощью итерации признаков GBDT и обучения противника в реальном времени GAN, в то время как BERT-RL оптимизирует FairEduNet для работы с неструктурированными данными и динамической адаптации к сценариям, устраняя слабые места в извлечении признаков и ограничениях статических параметров. В исследовании использовалась модель BERT-базовой китайской и была предварительно обучена корпус реальных учебных журналов, учебников, записанных в классах, и документов образовательной политики Национальной платформы умного образования на учебный год 2024–2025, с объёмом словарного запаса 21128. Размер скрытого слоя модели составляет 768, с 12 головами внимания и 12 слоями. Глубина дерева GBDT была установлена на 8, количество деревьев — 200, а скорость обучения — 0,1. Учебный цикл GAN состоит из 150 патронов, а дискриминатор использует трёхслойную полностью связанную сеть размерами 512, 256 и 1. Генератор использует полностью подключённую сеть с четырьмя уровнями 1024, 512, 256 и 1. Количество скрытых единиц в LSTM составляет 128, а длина последовательности — 512. GAT имеет 2 слоя и 4 головы внимания. Температура для дистилляции знаний установлена на уровне 3.0. Коэффициенты вознаграждения вознаграждения ω1 = 0,4, ω2 = 0,35 и ω3 = 0,25. Критерии выбора веса направлены на баланс равновесия фронта Парето многоцелевой оптимизации с требованиями к интерпретации практик образовательного равенства. Эксперименты проводились с использованием 50% разделения данных с помощью перекрёстной валидации и настройки гиперпараметров. Процесс BFEN для обучения калибровке оценивания показан на рисунке 3.

figure-protocol-12
Рисунок 3: Процесс коррекции алгоритма BFEN для оценки интеллектуального образования и преподавания. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Как показано на рисунке 3, BFEN сначала предварительно обрабатывает данные многоисточниковой оценки для преподавания. BERT оптимизирует возможности FairEduNet по извлечению признаков, вычисляя текстовое семантическое сходство и глубокие веса признаков на основе семантического окна, выбирая важные признаки для построения семантической матрицы признаков с высокой размерностью. RL затем устанавливает многоцелевой функцию вознаграждения и вычисляет адаптивность сценариев и градиенты корректировки параметров для дальнейшей оптимизации порогов справедливости и параметров калибровки. FairEduNet вычисляет отклонения между данными оценки и моделями шаблонов ошибок, итеративно обновляет веса дерева принятия решений и корректирует стратегии калибровки до тех пор, пока ошибки не стабилизируются в пределах заранее установленных порогов. Итоговый результат включает модель калибровки ошибок и отчет по проверке справедливости. Калибровочная модель применяется для преподавания данных оценки, создавая таблицы сравнения до и после калибровки, которые объединяются с библиотекой стандартов интеллектуального образования для определения целевых калибровочных параметров, предоставляя научную основу для обучения калибровке оценки в интеллектуальном образовании. Эта стандартная библиотека охватывает три измерения: справедливость образовательных возможностей, справедливость процессов и справедливость результатов и включает 12 основных индикаторов. К этим показателям относятся баланс распределения образовательных ресурсов между регионами, разница в охвате цифровой инфраструктуры между городскими и сельскими школами, порог толерантности к задержке реакции на диагностику учебных ситуаций (≤200 мс), толерантность к отсутствующим данным в мультимодальном оценивании (≤3,5%), чувствительность обнаружения алгоритмических искажений (отклонение AUC для маркировки гендера/региона/стадий ≤ 0,02), порог расхождения KL для распределения баллов до и после коррекции (≤0,08), показатель интерпретируемости рекомендаций по вмешательству учителя (≥4,2/5,0), своевременность обновления профиля учеников (завершённые в течение T + 1 дня), коэффициент согласованности кроссплатформенного признания кредитов (≥0,93), точность семантического согласования образовательной политики (балл BERT ≥ 0,86) и полнота подготовки отчетов по проверке справедливости (включая атрибуцию предвзятости, доверительных интервалов и воспроизводимых снимков параметров), а также динамическую валидацию адаптации сценариев, охватывающую три типичных сценария: живой класс, асинхронные задания и ассистентов преподавателей ИИ. Расчёт семантического сходства признаков показан в уравнении (6).

figure-protocol-13(6)

В уравнении (6) fi представляет значение i-й семантической размерности признака, gi — значение i-го важного размера признака, а n — общее количество размерностей признаков. Расчёт параметра адаптации сценариев RL показан в уравнении (7).

figure-protocol-14(7)

В уравнении (7) θt представляет значение параметра на t-й итерации, α — скорость обучения, а figure-protocol-15 градиент параметров на основе функции вознаграждения R(θt).

Построение модели калибровки оценки в преподавании
Хотя BFEN демонстрирует определённые преимущества в обучении калибровке оценки, он всё ещё сталкивается с низкой эффективностью интеграции для многоисточниковых гетерогенных данных оценки и недостаточной адаптацией к динамической справедливости на практике. Алгоритм AM-LSTM, объединяющий механизм внимания (AM) и долгосрочную кратковременную память (LSTM), присваивает веса ключевым особенностям многоисточниковых данных оценки через AM и фиксирует динамические изменения данных оценки со временем с помощью последовательной памяти LSTM. Этот подход эффективно повышает эффективность интеграции данных с несколькими источниками и динамическое обучениефункциям 19,20. Процесс работы AM-LSTM показан на рисунке 4.

figure-protocol-16
Рисунок 4: Блок-схема работы AM-LSTM. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Как показано на рисунке 4, AM-LSTM сначала предварительно обрабатывает многоисточниковые данные по разнородным образовательным оцениванию для формирования стандартизированного набора данных. AM рассчитывает веса внимания для признаков из различных источников данных для выбора важных признаков и строит взвешенную матрицу признаков. Взвешенная матрица признаков затем вводится в LSTM, который использует механизм гейтинга для изучения динамических паттернов с течением времени, фиксируя взаимосвязи между оценочными данными на разных стадиях и выводя динамические векторы признаков. Наконец, эти динамические векторы признаков сочетаются с ограничениями справедливости для получения промежуточных результатов калибровки, адаптированных к многоисточникной интеграции данных и динамическим сценариям, что служит основой для последующей оптимизации модели. Расчёт веса внимания показан в уравнении (8).

figure-protocol-17(8)

В уравнении (8) n обозначает распределение внимания для n-го признака, xn — сходство, q — вектор запроса, а softmax — функцию активации. Элемент забывки LSTM выражен в уравнении (9).

figure-protocol-18(9)

В уравнении (9) Wf — это вес забытого элемента, bf — смещение забытого затвора, xt — вход в момент времени t, ht-1 — внешняя переменная состояния в момент t-1, а σ — сигмоиднуюфункцию 21. В данном исследовании AM-LSTM и BFEN объединяются для создания калибровочной модели оценки для преподавания AM-LSTM-BFEN, известной как FBFEN. В этой модели AM-LSTM решает ограничения BFEN в эффективности интеграции данных с множеством источников и динамической извлечении признаков. Он также интегрирует ограничения справедливости для оптимизации результатов промежуточной калибровки, что позволяет BFEN дополнительно достичь точной калибровки и динамического обеспечения справедливости для учебных данных оценки. Процесс работы FBFEN показан на рисунке 5.

figure-protocol-19
Рисунок 5: Процесс работы модели оценки и коррекции обучения FBFEN. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Как показано на рисунке 5, FBFEN сначала предварительно обрабатывает исходные многоисточниковые данные оценки для преподавания и вводит стандартизированный набор данных в модуль AM-LSTM. AM рассчитывает веса внимания признаков, в то время как LSTM изучает динамические паттерны, выдавая промежуточные калибровочные результаты, интегрирующие мультиисточниковую информацию и динамические особенности. Промежуточные результаты затем вводятся в модуль BFEN. GBDT итеративно изучает паттерны ошибок данных оценки на основе промежуточных результатов и заранее установленной модели ошибок, выдавая предварительные результаты калибровки. В то же время GAN анализирует смещённость справедливости, вызванную чувствительными атрибутами в предварительных результатах, с помощью противостояния между генератором и дискриминатором, динамически корректируя параметры калибровки для устранения смещения. Наконец, оптимальные для GAN параметры калибровки возвращаются в GBDT для обновления весов дерева принятия решений и стратегий калибровки, что приводит к вторичному результату калибровки, который балансирует точность и справедливость. Стандартизация данных выражена в уравнении (10).

figure-protocol-20(10)

В уравнении (10) z' представляет стандартизированное значение, z — исходное значение, а zmin и zmax — минимальные и максимальные значения. Итоговая целевая функция генератора GAN выражена в уравнении (11).

figure-protocol-21(11)

В уравнении (11) N обозначает количество итераций, λ — коэффициент потери веса, ωi — коэффициент веса i-й итературы, figure-protocol-22 — функцию потерь противника и figure-protocol-23 — бинарную потерю по перекрестной энтропии22.

Оптимизация калибровочной модели оценки в FBFEN
Хотя FBFEN демонстрирует сильную многоисточниковую интеграцию данных и динамическую справедливость в калибровке оценки обучения, он всё ещё сталкивается с слабой корреляцией признаков и низкой эффективностью обучения и выводов из-за сложной структуры модели в сложных образовательных сценариях. Алгоритм GAT-KD, объединяющий сеть внимания графа (GAT) и дистилляцию знаний (KD), динамически строит граф семантических ассоциаций между признаками с помощью механизма внимания GAT, улучшая семантическое согласование многоисточниковых данных. KD сжимает знания о сложной модели в легкую сеть, значительно повышая эффективность вывода при сохранении производительностимодели 23,24. Процесс работы GAT-KD показан на рисунке 6.

figure-protocol-24
Рисунок 6: Блок-схема работы GAT-KD. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Как показано на рисунке 6, GAT-KD строит граф семантических ассоциаций между признаками через модуль ГАТ, динамически агрегирует информацию о признаках окрестностей с помощью механизма внимания и улучшает семантическое представление локальных признаков. KD затем использует выходные мягкие метки в качестве сигналов супервизии, минимизируя потери дивергенции между выходными распределениями и потерю перекрестной энтропии между своими прогнозами и истинными метками, обеспечивая передачу знаний и сжатие модели. Итоговый результат — лёгкая калибровочная модель с высокой точностью и эффективностью. Расчет коэффициента внимания GAT показан в уравнении (12).

figure-protocol-25(12)

В уравнении (12 figure-protocol-26 ) и figure-protocol-27 представляют векторы признаков узлов i и j, W — обучаемая матрица веса, a — вектор веса внимания, figure-protocol-28 — операцию конкатенации, а LeakyReLU — функциюактивации 25. Расчёт функции потерь KD показан в уравнении (13).

figure-protocol-29(13)

В уравнении (13) KL обозначает потерю дивергенции, T2 — баланс градиентного масштабирования, p student — мягкую вероятность легкой модели, а p teacher — вероятность мягкой метки комплексноймодели 26. Объединяя ассоциацию признаков с повышенным вниманием и лёгкую передачу знаний, GAT-KD эффективно решает семантическую смещённость признаков и высокую вычислительную сложность. В данном исследовании интегрируется GAT-KD в FBFEN для формирования модели калибровки оценки обучения GAT-KD-FBFEN, известной как GFBFEN. GAT-KD оптимизирует недостатки FBFEN в неполном многоисточникном захвате корреляции признаков и низкой эффективности вывода. Процесс работы GFBFEN показан на рисунке 7.

figure-protocol-30
Рисунок 7: Процесс обучения оценки и работы модели коррекции GFBFEN. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Как показано на рисунке 7, GFBFEN стандартизирует данные многоисточников по оценке преподавания. GAT моделирует сложные отношения между признаками и динамически рассчитывает веса семантических ассоциаций между узлами с помощью механизмов внимания. KD сжимает знания о сложной модели в легкую сеть, значительно повышая эффективность вывода при сохранении точности. Модуль AM-LSTM присваивает значения важности многоисточниковым характеристикам и фиксирует временные динамические паттерны оценочных данных, выводя промежуточные калибровочные результаты, интегрирующие многоисточниковую информацию. Эти результаты вводятся в модуль BFEN для глубокой обработки. В частности, BERT извлекает семантические признаки из неструктурированного текста, RL динамически оптимизирует пороги справедливости и параметры калибровки, GBDT итеративно изучает шаблоны ошибок для предварительной калибровки, а GAN устраняет искажения, вызванные чувствительными атрибутами, с помощью состязательного обучения. Механизм динамической корректировки параметров автоматически калибрует чувствительность отклика и веса справедливости каждого модуля, фиксируя временные изменения и сдвиги распределения групп в обучающей сцене в реальном времени, решая тем самым проблему недостаточной адаптивности, вызванную статической конфигурацией параметров, и обеспечивая устойчивость и справедливость модели на разных этапах обучения, Студенческие группы и сценарии оценки. Тип оценки напрямую влияет на детализацию и цикл обратной связи моделирования временных рядов, тогда как формативная оценка подчёркивает динамичный характер процесса. Различия в дисциплинах определяют распределение характеристик между модулями BERT и GBDT. Таким образом, использование динамического механизма корректировки может эффективно адаптироваться к различным типам оценки и дисциплинарным характеристикам. Наконец, через несколько раундов обратной связи параметров и итеративной оптимизации модель даёт точные и справедливые результаты калибровки оценки преподавания. Функция оптимизации по ограничению по динамической справедливости выражена в уравнении (14).

figure-protocol-31(14)

В уравнении (14) S представляет набор чувствительных атрибутов, figure-protocol-32 прогнозируемый результат калибровки выхода, figure-protocol-33 дисперсию предсказаний внутри групп, γ — межгрупповые параметры и figure-protocol-34 общее ожидаемое значение. Адаптивный расчет масс слияния многоисточникных признаков показан в уравнении (15).

figure-protocol-35(15)

В уравнении (15) wk представляет вес признаков k-го источника данных, β — параметр веса, Sim — функцию измерения сходства признаков, fk — вектор признаков, извлеченный из k-го источника данных, fглобальный — глобальный центр признаков, а K представляет общее количество источников данных. В исследовании были определены веса чувствительных признаков, включая пол, этническую принадлежность, регион, экономический статус семьи и происхождение родного языка. Веса определяются на основе результатов корреляционного анализа. В исследовании использовались коэффициенты корреляции Пирсона и коэффициент корреляции ранга Спирмана как двойные индикаторы для оценки суставов, в сочетании с экспертным опытом в области образования калибровки веса. Окончательное определение весов для каждого чувствительного признака дало значения 0,18 для пола, 0,22 для этнической принадлежности, 0,25 для региона, 0,19 для семейного экономического положения и 0,16 для родного языка. Пол: гендерная идентичность по юридической регистрации и самоидентификации, бинарная (мужчина/женщина) с небинарными вариантами; поле данных «гендер». Этническая принадлежность: основана на национальной этнической идентификации 56 групп, совместимой с неидентифицированными и трансграничными группами; поле данных «этничность». Регион: Административное деление по регистрации домохозяйства или длительного проживания, охватывающее провинциальный, муниципальный и уездный уровень, с учётом двойной структуры городского и сельского района и миграционного населения; поле данных «регион». Семейный экономический статус: Согласно национальным статистическим стандартам и показателям образовательной помощи, используя пятиуровневую классификацию; поле данных «economic_status». Происхождение родного языка: основное преподавание и язык общения с семьёй во время базового образования, охватывающий мандарин, языки меньшинств, диалекты и иностранные языки, взвешенные по возрасту и частоте освоения; Поле данных «mother_tongue».

Процесс коррекции использовал трёхступенчатый механизм динамического взвешивания. Первый этап реализовал начальную идентификацию отклонений на основе матрицы веса чувствительных признаков, отмечая точки данных, существенно отклоняющиеся от глобального центра признаков по таким измерениям, как пол, этническая принадлежность и регион. Второй этап вводит ограничения образовательного контекста для повторной квалификации интенсивности отклонений с учетом контекста. Третий этап проверяет устойчивость коррекции с помощью контрфактических возмущений, систематически заменяя значения чувствительных признаков при сохранении нечувствительных признаков без изменений, и наблюдая, находится ли изменение оценочных баллов в пределах порога ±±3,2%.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Анализ производительности алгоритмов BFEN
Показатели, оценённые в экспериментах, включали следующее:

Точность коррекции оценки (ECA) обозначает долю элементов отклонения, правильно выявленных и исправленных моделью в результатах оценки преподавания, что отражает общую эффективность механизма коррекции. Более высокие значения указывают на лучшую точность коррекции.

Коэффициент отклонения справедливости (FDR) измеряет величину межгрупповых различий в оценках, которые модель не устраняет в процессе калибровки. Он вычисляется как отношение стандартного отклонения каждого чувствительного признака (например, пол, регион, этническая принадлежность) внутри распределения баллов к общему стандартному отклонению; Более низкие значения подразумевают минимизацию межгрупповых дисперсий и более надёжную гарантию справедливости.

Коэффициент адаптации к сценарию (SAR) показывает процент успешно выполненных корректирующих задач моделью в разнородных учебных контекстах (например, естественные науки против гуманитарных дисциплин, онлайн или офлайн).

Степень поддержания справедливости (FMD) определяется как один минус отношение дисперсии индикаторов справедливости между группами чувствительных атрибутов после коррекции к наблюдаемому до коррекции, что отражает способность системы сохранять структурную справедливость в процессе калибровки.

Уровень распознавания дисциплинарных признаков (DFRR) рассчитывает долю выборок, в которых основные признаки были правильно идентифицированы в данных оценки каждой дисциплины относительно общего размера выборки оценки, демонстрируя способность модели выявлять и фиксировать вариации, специфичные для каждой области.

Эффективность многоисточникного слияния данных (MDFE) относится к производительности модели при выравнивании признаков, распределении веса и коррекции отклонений при слиянии многоуровневых гетерогенных оценочных данных. Этот комплексный показатель определяется как произведение количества обработанных образцов оценки в секунду (образцов/сек) и уровня соответствия согласованности коррекции (на уровне >95%), где более высокие значения означают более эффективный и стабильный термоядерный конвейер.

Стабильность корректировочных результатов (CRS) указывает на согласованность калибровочных выходов на нескольких независимых проходах, количественно определяемую обратным отклонением стандартного евклидового расстояния между корректировочными выходами каждой серии при одинаковых входах. Более высокие значения свидетельствуют о повышенной надёжности системы.

Время коррекции отдельных данных (SDCT) представляет собой среднюю вычислительную задержку, потраченную моделью на завершение калибровки одной выборки, измеряемую в миллисекундах (мс); Более низкие значения указывают на более сильную способность реагирования в реальном времени.

Корректированная абсолютная ошибка (CAE) измеряет среднюю абсолютную ошибку между откалиброванными прогнозами и значениями правды, отражая остаточное отклонение модели относительно исходных неоткалиброванных данных. Более низкие значения означают, что откалиброванные выходы ближе совпадают с реальными уровнями производительности.

Скорректированная относительная ошибка (CRE) количественно определяет среднюю абсолютную ошибку между откалиброванными предсказаниями и значениями правды, выраженной в процентах от истинности на земле, при этом более низкие значения указывают на более высокую относительную точность калибровки.

Скорость точности коррекции (CAR) представляет собой долю выборок, чья абсолютная ошибка после калибровки составляет < 0,5 относительно общего размера выборки, демонстрируя надёжность модели в удовлетворении заранее заданных ограничений точности. Высокие значения подтверждают эмпирическую полезность и достоверность результатов.

Общее значение потерь (TL) представляет собой цель комплексной оптимизации, полученную из взвешенной суммы отдельных членов субпотерь после выполнения задачи. В частности, семь метрик — DFRR, MDFE, CRS, SDCT, CAE, CRE и CAR — стандартизируются посредством нормализации Z-score и взвешиваются в соответствии с операционным приоритетом задач оценки. Имея вектор веса [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1], эти семь нормализованных значений индикатора агрегируются для вычисления итоговых потерь.

Точность кластеризации признаков оценки (EFCA) оценивает степень выравнивания между неконтролируемыми конфигурациями кластеризации, сгенерируемыми моделью, и категориями по реальности, проверенными экспертами в области.

Эффективность обработки данных с высокими размерностями (HDPE) измеряет количество образцов, подвергающихся уменьшению размерности признаков и коррекции отклонений за единицу времени при работе с разреженными векторами с ≥50 признаками оценки. Измеряемые в выборках в секунду, более высокие значения отражают более надёжную способность обрабатывать сложные, масштабные данные оценки в реальном времени.

Точность коррекции справедливости (FCP) оценивает однородность эффектов калибровки между расходящимися студентскими группами. Эта метрика количественно определяется вычислением среднего распределения расстояния Колмогорова–Смирнова для скорректированных абсолютных ошибок между подгруппами чувствительных атрибутов; Более низкие значения подразумевают более сбалансированную межгрупповую работу и более сильную гарантию справедливости.

Согласованность коррекции между сценами (CSCC) количественно определяет распределение результатов калибровки по трём типичным сценариям — а именно оценке в классе, практической оценке и онлайн-тестированию — моделируемых как отношение расстояний Вассерштейна.

Для проверки эффективности предлагаемого алгоритма калибровки оценки обучения BFEN исследование сравнило его с алгоритмом PRF, который сочетал анализ основных компонентов (PCA) и случайный лес (RF); алгоритм EAB, который объединял экстремальное обучение (ELM) и адаптивное бустинг (AdaBoost); и алгоритм DBLR, который объединял глубокую сеть убеждений (DBN) и логистическую регрессию (LR). Эксперименты проводились на системе, оснащённой процессором Intel Core i9-13900HX и GPU NVIDIA RTX 4080, обеспечивая высокие параллельные вычисления и большую видеопамять для эффективного выполнения вычислений по извлечению функций и калибровке для крупномасштабных учебных оценочных данных. Операционной системой была Windows 11, а для программирования использовался Python 3.9. Алгоритмы реализовывались с использованием библиотеки Scikit-learn, модули глубокого обучения — через фреймворк TensorFlow, а библиотеки Pandas и NumPy использовались для предварительной обработки данных. Среда разработки использовала PyCharm Professional 2023.1, а Seaborn применялся для визуализации результатов калибровки с целью интуитивного сравнения производительности алгоритмов. Для обеспечения надёжности данных в исследовании использовался набор данных Global Education MonitoringReport 1 и 2 по академической успеваемости учащихся средней школы вИспании. Набор данных содержит 12 486 записей, охватывающих мультимодальные данные оценки преподавания, такие как оценки преподавателей университета, академическая успеваемость студентов, оценки студенческого преподавания и обратную связь по курсам, охватывая 137 особенностей педагогических аспектов, включая частоту взаимодействия в классе, своевременность обратной связи заданий, согласованность оценок, языковую инклюзивность и межкультурную чувствительность. Целевой переменной является балл оценки преподавания, который в данном исследовании сопоставлен с многомерным взвешенным композитным значением, откалиброванным экспертами. Исследование объединяет четыре типа источников информации: оценки студенческого преподавания, рецензирование коллегами, наблюдения в классах руководителей и обзоры преподавательских досье с весами соответственно 0,35, 0,25, 0,25 и 0,15. Наборы обучения и валидации разделены по хронологическому порядку по двум наборам данных. В исследовании используются данные за сентябрь 2024 года в качестве учебного набора, а данные с октября 2024 по июнь 2025 года — как набор валидации, чтобы соответствовать временному прогрессу образовательных оценок. На этапе предварительной обработки применяется модально-специфическая стратегия: структурированные признаки стандартизируются с помощью нормализации Z-score и выбросов — Winsorized, а текстовые признаки кодируются по модели BERT-base-Chinese и сводятся к 768 измерениям. Состязательная подготовка применяется для повышения устойчивости к неявным проявлениям предвзятости и смягчения семантического дрейфа, вызванного культурными различиями.

Для достижения межотраслевых исследований обучения и валидации модель будет перенесена в четыре разнородных сценария преподавания: базовое образование K-12, профессиональное образование, непрерывное образование и международное китайское образование с нулевой или небольшой выборкой валидации. В этих четырёх сценариях исследование вводит термины адаптивной регуляризации в области при обучении алгоритмам, чтобы ограничить согласованность распределения признаков модели в различных сценариях обучения. Внедрение легкого механизма маски с учётом синтаксиса для коротких предложений в сценариях K-12; Для устранения неоднозначности профессиональной терминологии в профессиональном образовании создаётся и интегрируется динамический доменный словарь с графом знаний учебного плана. Разработать модуль для сравнения возрастных групп для устранения межпоколенческого семантического разрыва в непрерывном образовании, выравнивая семантические якоря для оценочных выражений разных возрастных групп в латентном пространстве. Для решения проблемы культурной нагрузки в международном китайском образовании используются кросс-языковые сравнения для тонкой настройки и повышения прочности понимания небуквальных образовательных концепций. Исследования экспертной калибровки и тестирования надёжности структурированных полей в оригинальных оценочных записях, удаляя записи с низкой надёжностью с коэффициентом альфа Криппендорфа ниже 0,75. Двойная слепоя ручная аннотация была реализована на учебниках для оценки учащихся, при этом 3 эксперта по образовательным измерениям независимо заполняли маркировку по типу отклонения, достигнув согласованности Коэна k = 0,86 в аннотации. Наконец, аннотированные результаты были перекрёстно валидированы с записями о посещаемости супервизии и выводами по учебным файлам для формирования окончательных калибровочных меток.

Выбранные наборы данных были получены из различных популяций, систем измерений и образовательных оснований. Эта междоменная парадигма валидации тщательно проверяла прочность и границы обобщения модели в аутентичной образовательной экосистеме, предотвращая иллюзии оценки, вызванные гомогенизацией данных. Оба репозитория содержали значительные объемы записей по оценке преподавания, предоставляя прямую справочную ценность для внедрения интеллектуальных образовательных алгоритмов, ориентированных на справедливость. Оба набора данных содержали значительные данные по оценке преподавания, предоставляющие прямые эталонные значения для разработки алгоритмов интеллектуального образования, ориентированных на справедливость, и калибровки оценки обучения. В ходе исследования были откалиброваны 1000 записей оценки преподавателей с помощью четырёх алгоритмов и рассчитаны их ECA и Fairness FDR. Результаты показаны на рисунке 8.

figure-results-1
Рисунок 8: Сравнение результатов тестов между ECA и FDR. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Как показано на рисунке 8A, BFEN изначально достиг ECA 82,47% и FDR 5,71% в задании калибровки оценки. По мере увеличения количества откалиброванных записей ECA вырос до 98,75% и стабилизировался после калибровки 421 записи, тогда как FDR снизился до 2,87% и стабилизировался после калибровки 514 записей. Как показано на рисунке 8B, кривая ECA алгоритма PRF постепенно увеличивалась, а линия FDR — постепенно уменьшается. В конце калибровочной задачи значение ECA составляло 92,30%, а PDR — 6,72%. Рисунок 8C демонстрирует, что кривая ЭКА алгоритма EAB быстро поднималась перед выравниванием, тогда как траектория FDR демонстрировала сильные ранние колебания перед сходимостью, завершившись с ECA 84,64% и FDR 8,93%. Как показано на рисунке 8D, алгоритм DBLR показал медленную восходящую траекторию ECA, сопровождаемую маргинальными колебаниями и ограниченным сжатием линии FDR, завершив задачу калибровки с ECA 83,51% и FDR 8,42%. Эти экспериментальные результаты подтверждают, что алгоритм BFEN значительно превосходит базовые методы как в точности коррекции оценки, так и в контроле справедливого смещения. Эта превосходная возможность обобщения связана с интеграцией BERT в BFEN, который извлекает глубокие семантические особенности из неструктурированного текста оценки для захвата скрытых выражений смещения, в то время как модуль RL динамически оптимизирует пороги справедливости и параметры коррекции с помощью многоцелевой функции вознаграждения для отделения чувствительных характеристик от конечных результатов. Затем в исследовании были протестированы SAR и ящур для оценки в классе, итоговых экзаменов, практической оценки и онлайн-тестирования, при этом четыре сценария были отмечены как A, B, C и D. Результаты показаны на рисунке 9.

figure-results-2
Рисунок 9: Сравнение SAR и ящур приводит к разным сценариям. (A) Результаты SAR-теста. (B) Результаты теста на ящур. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Как показано на рисунке 9A, BFEN достиг SAR выше 98% во всех учебных сценариях, с самым высоким показателем SAR — 99,01% для тестов в классе. SAR алгоритма сравнения в разных сценариях ниже, чем у алгоритма BFEN, при этом алгоритм DBLR имеет самый низкий SAR для итогового сценария оценки среди всех алгоритмов — SAR 70,23%. Как показано на рисунке 9B, FMD алгоритма BFEN всё ещё значительно выше, чем у алгоритма сравнения в различных учебных сценариях, с FMD соответственно 98,47%, 98,05%, 97,81% и 97,94% в разных сценариях. Ящики в эталонном алгоритме DBLR составляют соответственно 82,36%, 71,74%, 70,59% и 69,12%. Ящуры алгоритма EAB составляют соответственно 80,79%, 68,21%, 67,65% и 66,03%, а FMD алгоритма PRF — 86,42%, 82,17%, 80,98% и 78,33% соответственно. Эти результаты показали, что BFEN превосходил алгоритмы сравнения благодаря итеративному обучению GBDT с несколькими деревьями решений, которые точно фиксировали ошибки в разных сценариях и обеспечивали стабильные и справедливые результаты калибровки. В исследовании дополнительно оценивалась степень распознавания признаков (DFRR) для китайского, математического и английского языков с использованием четырёх алгоритмов. Результаты показаны на рисунке 10.

figure-results-3
Рисунок 10: Сравнение результатов тестов DFRR по разным дисциплинам. (A) Тренировочный набор. (B) Набор валидации. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Как показано на рисунке 10A, BFEN достиг DFRR 99,23%, 98,94% и 99,13% по китайскому, математике и английскому языку в учебном наборе. Рисунок 10B показал, что BFEN также достиг более высокого DFRR в наборе валидации по сравнению с другими алгоритмами. В частности, DFRR BFEN для китайского достиг 98,41%, что на 10,8% выше 87,61% у DBLR; по математике — 97,54%, что на 9,07% выше, чем у PRF — 88,47%; а по английскому — 98,13%, что на 13,34% выше, чем у EAB — 84,79%. Эти результаты подтвердили, что BFEN эффективно адаптировался к калибровке дисциплинарной оценки, сочетая глубокое уловление семантических различий BERT с персонализированным обучением ошибочных паттернов GBDT. Для всесторонней оценки эффективности BFEN исследование оценивало MDFE, CRS и SDCT для четырёх алгоритмов. Результаты приведены в Таблице 1.

Набор данныхАлгоритмMDFE (%)CRSSDCT(и)
ОбучениеBFEN98.42 ± 0.28*&@0.975 ± 0.28*&@0.78 ± 0.04*&@
PRF83,85 ± 0,410,779 ± 0,361.32 ± 0.08
EAB85,91 ± 0,500,806 ± 0,401.15 ± 0.07
DBLR88,76 ± 0,470,753 ± 0,391,45 ± 0,08
ВалидацияBFEN97.58 ± 0.25*&@0.968 ± 0.27*&@0.86 ± 0.03*&@
PRF81,62 ± 0,320,687 ± 0,501.51 ± 0.06
EAB84,37 ± 0,400,749 ± 0,421.28 ± 0.05
DBLR87,53 ± 0,300,728 ± 0,471,63 ± 0,07

Таблица 1: Сравнение результатов тестов MDFE, CRS и SDCT. «*» указывает на значительную разницу (p < 0,05) между результатами BFEN и PRF. «&» означает, что разница между результатами BFEN и EAB была значительной (p < 0,05). «@» означает, что разница между результатами BFEN и DBLR значительна (p < 0.05)

Таблица 1 показывает, что BFEN достиг MDFE 98,42% в учебном наборе, что на 14,57% выше показателя PRF (83,85%), CRS 0,975%, на 0,222 выше 0,753 у DBLR и SDCT 0,78 с, на 0,67 с меньше, чем у DBLR 1,45 с. В валидационном наборе BFEN сохранил превосходную производительность: MDFE, CRS и SDCT соответственно на 97,58%, 0,968 и 0,86 с, превосходя алгоритмы сравнения. В целом результаты подтвердили превосходные комплексные результаты BFEN в обучении калибровке оценок.

Валидация эффективности модели калибровки оценки преподавания GFBFEN
На основе валидации эффективности BFEN исследование дополнительно оценило эффективность модели калибровки оценки обучения GFBFEN, построенной на базе BFEN, и сравнило её с калибровочными моделями, построенными на основе алгоритмов PRF, EAB и DBLR. Для обеспечения согласованных условий тестирования и сопоставимости набор глобальных отчётов по мониторингу образования служил учебным набором, а набор данных по академической успеваемости студентов университета — набором валидации. Четыре модели откалибровали 500 записей для оценки преподавания, и их CAE и CRE были рассчитаны. Результаты показаны на рисунке 11.

figure-results-4
Рисунок 11: Сравнение результатов тестов CAE и CRE. (A) Результаты теста CAE. (B) Результаты теста CRE. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Как показано на рисунке 11A, GFBFEN изначально достиг CAE 0,1279. По мере прохождения калибровки CAE снизился до 0,0641 и стабилизировался после 104 записей. Сравнительные модели имели более высокий начальный и конечный CAE, чем GFBFEN, при этом EAB имел самый высокий начальный и конечный CAE — 0,1858 и 0,1217 соответственно. Рисунок 11B показал, что начальная и итоговая CRE GFBFEN во время калибровочной задачи оставались ниже, чем в сравнительных моделях, с значениями 0,1137 и 0,0912 соответственно. Эти результаты показали, что GFBFEN демонстрирует сильные возможности по подгонке, используя механизм внимания GAT, который строил графы семантической корреляции между признаками, улучшал семантическое согласование многоисточниковых данных оценки и снижал неэффективную калибровку, вызванную смещением признаков. Затем в исследовании была проведена оценка CAR на предмет данных оценки учеников, оценок учителей, школьных оценок и онлайн-оценок, помеченных как I, II, III и IV. Результаты показаны на рисунке 12.

figure-results-5
Рисунок 12: Сравнение результатов CAR различных оценочных данных. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Как показано на рисунке 12A, GFBFEN достигла CAR в 99,34%, 98,93%, 99,01% и 99,12% по данным оценки учеников, учителей, школ и онлайн-оценки в наборе обучения. В валидационном наборе значения CAR составили соответственно 97,89%, 98,56%, 97,57% и 98,46%. Рисунок 12B–D показал, что сравнительные модели имели более низкий CAR как в обучающем, так и в валидационных наборах. Среди них EAB показал худший результат в наборе валидации: CAR составил 76,31% для данных учителей и 78,29% для онлайн-данных. Эти результаты подтвердили, что GFBFEN значительно превосходил сравнительные модели. Далее в исследовании был протестирован TL в задании калибровки оценки для оценки способности к подгонке и устойчивости тренировок. Результаты показаны на рисунке 13.

figure-results-6
Рисунок 13: Результаты теста на устойчивость модели и тренировки. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Как показано на рисунке 13A, изначально TL GFBFEN составлял 0,1021 в учебном наборе. После 67 итераций TL снизился до 0,0725 и стабилизировался. В валидационном наборе TL снизился с 0,1237 до 0,1018. Рисунок 13B–D показал, что итоговый TL PRF в обучающем наборе составлял 0,0824, итоговый TL EAB в валидационном наборе — 0,1178, а TL DBLR в обоих наборах был нестабилен и значительно выше, чем у других моделей. Эти результаты показали, что GFBFEN демонстрирует высокую способность к подгонке и стабильность обучения, используя передачу знаний на основе KD, что позволило модели быстро освоить эффективные признаки, ускорить сходимость потерь и обеспечить обобщение между наборами данных. Для всесторонней проверки основных характеристик GFBFEN в исследовании были протестированы EFCA, HDPE, FCP и CSCC для четырёх моделей. Результаты показаны на рисунке 14.

figure-results-7
Рисунок 14: Результаты комплексных показательных тестов для выполнения заданий по оценке и коррекции преподавания. (A) Результаты тестов GFBFEN. (B) Результаты теста PRF. (C) Результаты тестов EAB. (D) Результаты тестов DBLR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Как показано на рисунке 14A–D, модель GFBFEN имеет значения EFCA 99,35% и 98,76% соответственно в наборах для обучения и валидации. EFCA модели PRF составляет соответственно 88,53% и 87,04%. В валидационном наборе EFCA модели GFBFEN был на 6,59% выше, чем у модели EAB — 92,17%, и на 11,72% выше, чем у модели DBLR — 87,04%. Кроме того, показатели HDPE, FCP и CSCC также являются весьма лидирующими показателями: в наборе валидации HDPE модели GFBFEN достиг 98,05%, FCP — 97,93%, а CSCC — 0,968, что превзошло модели PRF, EAB и DBLR. В целом эти результаты подтвердили превосходную комплексную эффективность GFBFEN, демонстрируя, что координированная оптимизация GAT-KD, AM-LSTM и BFEN эффективно повысила точность, эффективность и справедливость оценки калибровки.

В ходе исследований постепенно были созданы FairEduNet, BFEN, FBFEN и GFBFEN, а окончательный GFBFEN включает такие компоненты, как FairEduNet, BERT-RL, AM-LSTM и GAT-KD. Для подтверждения независимого вклада отдельных компонентов проводятся исследования и эксперименты по абляции дизайна, постепенно удаляя каждый компонент и оценивая его влияние на общую производительность. Сравнительные показатели включают ECA, FDR, SAR и ящур. Результаты показали, что значение ECA только компонента FairEduNet составляло 87,32%, FDR — 12,45%, SAR — 89,67%, а ящур — 11,89%. ECA полной модели GFBFEN достиг 99,21%, FDR снизился до 1,93%, SAR остался стабильным на уровне 99,45%, а ящур оптимизирован до 7,28%. После удаления BERT-RL ECA снизилась до 91,04%, значение FDR — 6,23%, значение SAR — 92,33%, а ящур — до 7,85%. Абляция AM-LSTM увеличила флуктуации SAR на 14,2%. Удаление GAT-KD привело к увеличению ящуря до 8,36%, а его механизм подавления распространения смещения структуры графов с помощью дистилляции знаний оказался значительно эффективным для снижения неявных ассоциативных искажений между популяциями.

Для дальнейшего тестирования методов исследования были введены установленные стандарты справедливости, а именно Benchmark Fairness Correction Benchmark (FCB), который охватывает три типа жёстких ограничений, широко признанных в образовательных сценариях: (1) Абсолютное значение средней разницы после коррекции между группами составляет ≤ 1,2 балла (на основе процентной системы); (2) Коэффициент перекрытия скорректированных доверительных интервалов для каждой подгруппы чувствительных атрибутов составляет ≥ 95%; (3) В любом отдельном сценарии совместная целесообразная область FDR и SAR должна удовлетворять ограничению границы Парето (то есть невозможно улучшить SAR без ухудшения FDR, и наоборот). Модель GFBFEN была сравнивана с основными базовыми моделями, такими как EAB, PRF, DBLR и GBDT, в экспериментальной оценке. Эксперимент проводился на 421 реальных данных оценки, собранных из реальных учебных сценариев, охватывающих три типичных образовательных сценария: оценку в классе, практическую оценку и онлайн-тестирование. Результаты приведены в таблице 2.

АлгоритмАбсолютное значение средней разницы балловКоэффициент перекрытия доверительных интервалов (%)Совместный уровень удовлетворённости возможных регионов (%)Комплексная оценка
GFBFEN0.8798.310097.2
EBA1.5298.482.678.5
PRF1.6885.174.371.2
DBLR1.4587.979.875.6
GBDT1.3391.286.479.9

Таблица 2: Результаты оценки показателей критериев справедливости и практическая проверка применения.

Как показано в Таблице 2, GFBFEN независимо достиг полного соответствия всем четырём жёстким ограничениям FCB, а его комплексный балл значительно превзошел остальные базовые модели на +18,7 пункта, подтверждая устойчивость предлагаемой многоступенчатой парадигмы совместной коррекции. В частности, в ключевом индикаторе, отражающем возможность компромисса между справедливостью и эффективностью, совместный уровень охвата осуществимого региона достиг 100%, что свидетельствует о том, что модель обладает разворачиваемыми возможностями принятия решений по Парето-оптимальным решениям в реальных образовательных сценариях.

Справедливость в оценке преподавания подразумевает использование проверяемых количественных ограничений в качестве ориентира при соблюдении индивидуальных различий и образовательных законов. Логика расчёта и установка порога индикаторов равенства основаны на теоретической основе образовательного равенства и стандартах эмпирической проверки данных. Они совместно рассматриваются экспертным комитетом, состоящим из пяти учёных, чтобы обеспечить высокий уровень единства между теоретической строгостью и адаптацией к образовательной практике. Для дальнейшей проверки адаптивности модели по разным стандартам справедливости исследование проводило дополнительную валидацию по нескольким стандартам. В частности, для проверки были выбраны три стандарта справедливости. Стандарт 1 — это баланс уровня приема между группами на основе демографического паритета. Стандарт 2 — это кросс-групповая согласованность истинного и ложноположительного процента на основе уравненных шансов. Стандарт 3 основан на предсказательной паритете для контроля межгруппового смещения точности предсказаний. Было установлено, что GFBFEN последовательно соответствовал требованиям строгих ограничений по всем трём стандартам. Отклонение уровня приема по группе стандарта 1 ≤1,2%, разница между группами верно/ложноположительных результатов по стандарту 2 ≤0,85%, точность прогноза стандарта 3 контролируется межгрупповое отклонение в пределах ±±0,6%). В отличие от этого, другие модели показали прорыв по ограничениям ≥3,7% по крайней мере по одному критерию, что подтверждало совместимость генерализации GFBFEN для многомерных парадигм справедливости.

ДОСТУПНОСТЬ ДАННЫХ:
Для обеспечения надёжности данных исследование использовало набор данных Global Education Monitoring Report (https://www.education-progress.org/) и набора академических успеваемости учащихся средней школы в испанском (https://archive.ics.uci.edu/dataset/320/student+performance). Наборы обучения и валидации разделены по хронологическому порядку по двум наборам данных. В исследовании используются данные за сентябрь 2024 года в качестве набора обучения и с октября 2024 по июнь 2025 года как валидационный набор, что соответствует временной прогрессии образовательных оценок.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Алгоритм BFEN, предложенный в этом исследовании, продемонстрировал превосходную производительность в сравнительных экспериментах. С точки зрения ECA и FDR, он значительно превосходил алгоритмы PRF, EAB и DBLR. При калибровке 421 оценочных записей BFEN увеличил ECA до 98,75% и сохранил стабильность, тогда как FDR снизился до 2,87%. Эта производительность была результатом интеграции BERT-RL для оптимизации функций и динамической адаптации. BERT точно извлекал информацию о глубокой семантической смещенности из неструктурированных оценочных текстов, а RL динамически корректировал пороги справедливости и параметры калибровки с помощью многоцелевой функции вознаграждения, устранив влияние чувствительных атрибутов на результаты. Это похоже на работу Валенсии-Лондоньо и др., которые использовали алгоритмы искусственного интеллекта для создания модели образовательной инклюзии для взрослых с различными нервно-мышечными расстройствами. Хотя модель конструированной образовательной инклюзии была проверена на осуществимость в конкретных группах нейромышечных заболеваний, её ограничения справедливости охватывали только одно измерение (равное представительство диагностических групп), и не было установлено жёсткой системы ограничений для нескольких групп и множествацелей 27 . В тестах по различным учебным сценариям BFEN достиг SAR 99,01% для оценки в классе и FMD 97,81% для практических оценок, что значительно выше сравнительных моделей. Это преимущество было связано с итеративным изучением ошибочных паттернов в многосценарных данных оценки, в сочетании с библиотекой стандартов справедливости в образовании для соответствия параметрам калибровки целей, эффективно снижая калибровочные искажения и дисбаланс справедливости, вызванный различиями сценариев. По сравнению с адаптивной и интерпретируемой системой оценки справедливого искусственного интеллекта, предложенной Кумаром и др., которая включает обратную связь с экспертами и модули проверки справедливости между языками, хотя и вводит эти функции, она не может эффективно моделировать неявные цепочки предвзятости в текстах оценки в области образовательного оценивания, обладающей высокой семантической плотностью и сильной зависимостью отконтекста 28. Это исследование более глубоко интегрировано с точки зрения жёсткой гарантии справедливости и глубокой связи образовательного семантического моделирования по сравнению слитературой 28.

В практических задачах интеллектуального образования модель GFBFEN, построенная на базе BFEN, также проявила заметные преимущества. Для 500 калибровочных записей GFBFEN достиг итогового CAE 0,0641 и CRE 0,0912. Его CAR для различных типов оценочных данных превысил 97% как в обучающих, так и в валидационных наборах. Эта производительность была результатом оптимизации корреляции признаков GAT-KD и лёгкой обработки. GAT строила графы семантической корреляции между признаками для снижения смещения многоисточникных данных, а передача знаний KD повышала эффективность вывода без ущерба точности моделей, избегая задержек калибровки, вызванных сложностью модели. По сравнению с исследованиями, проведёнными Дехо и др. по влиянию дрейфа наборов данных на модели анализа справедливости обучения, хотя их исследование было сосредоточено на механизме влияния дрейфа данных на справедливость, стратегии коррекции опирались на статическое перевзвешивание и компенсацию после события, не имея способности воспринимать и динамически реагировать на семантические отклонения в реальном времени. Было сложно справляться с эволюцией неявных предвзятостей в образовательной оценке, вызванных субъективными выражениями учителей и различиями в языковых стилях учащихся. Однако это исследование с помощью модели GFBFEN эффективно воспринимает и динамически реагирует на семантические отклонения в семантике оценки, фиксируя неявные ценностные тенденции в комментариях учителей, языковые отклонения в ответных текстах учащихся и семантические дрейфы в выражениях оценки между классами и предметами, достигая перехода парадигмы от «статической компенсации» к «динамической калибровке»29. В базовом метрическом тестировании GFBFEN достиг EFCA 99,35% и 98,76% соответственно в обучающих и валидационных наборах, а FCP — 98,52% и 97,93%, что значительно выше сравнительных моделей. Аналогично системе открытого экзамена с автоматическим оцениванием на основе искусственного интеллекта, разработанной командой Dimari A, хотя она достигла высокой степени согласованности в оценке открытых ответов, её коррекция справедливости опирается только на заранее заданный вес размеров оценок и предвзятую библиотеку выборок, аннотируемую людьми, без внедрения образовательного механизма семантической динамической эволюции. Эти исследования сделали значительные прорывы в динамическом эволюционном механизме коррекции справедливости и глубоком моделировании образовательной семантики по сравнению с результатами работы команды Димари А, особенно продемонстрировав высокую устойчивость и интерпретируемость при решении реальных проблем, таких как смещение ценностной ориентации комментариев учителей, поколенческие различия в языковых стилях учащихся, и неоднозначность в междисциплинарных оценочныхвыражениях 30.

Это исследование внесло вклад в три аспекта. Во-первых, алгоритм BFEN интегрировал BERT-RL с FairEduNet, что повысило эффективность обработки и многофункциональную адаптивность для многоисточниковых гетерогенных данных за счет семантической оптимизации признаков и динамической корректировки параметров. Во-вторых, модель GFBFEN, основанная на GAT-KD и FBFEN, ввела обучение семантической корреляции и лёгкую передачу знаний, решая проблемы слабой корреляции признаков и низкой эффективности вывода в сложных образовательных сценариях, что повысила практичность калибровки оценки. В-третьих, модели применялись для калибровки различных предметов и типов оценок, обеспечивая техническую поддержку точной оценки преподавания и способствуя образовательной справедливости. Эти достижения предложили новый подход к калибровке оценки интеллектуального образования и эталон для многоалгоритмического сотрудничества в сложной обработке образовательных данных.

Современные методы калибровки интеллектуального образования не обладают гибкими и справедливыми. В данном исследовании предлагается модель GFBFEN на базе FairEduNet, использующая GAN и GBDT для калибровки справедливости. BERT-RL улучшает неструктурированную обработку данных, AM-LSTM улучшает многоисточникное слияние данных, а GAT-KD усиливает корреляцию признаков и слегка вес. Интегрируя эти алгоритмы, модель достигает точной калибровки и динамической справедливости. Тесты показывают отличную обработку данных с множеством источников и калибровку справедливости между сценариями, соответствуя требованиям точности и справедливости. Однако модель имеет ограничения в отношении групп специального образования, нуждаясь в улучшении обобщения. Будущие работы будут оптимизировать параметры и корректировать ограничения справедливости для различных сценариев, поддерживая образовательную справедливость и качество преподавания.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Автору нечего раскрывать.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Автор заявляет, что конфликта интересов нет.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Набор данных отчет о мониторинге глобального образованияUNESCOhttps://www.education-progress.org/Набор данных
NumPyNumPyhttps://numpy.org/Предварительная обработка данных
PandasPandas, NumPyhttps://pandas.pydata.org/Предварительная обработка данных
PyCharm Professional 2023.1PyCharm Версия 2023.1Разработчик окружения
Python 3.9Python Версия 3.9‌Язык программирования
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/index.htmlМашинное обучение
SeabornSeabornhttps://seaborn.pydata.org/Визуализация
Набор данных академической успеваемости учеников средней школы ИспанииРепозиторий машинного обучения UC Irvinehttps://archive.ics.uci.edu/dataset/320/student+performanceНабор данных
TensorFlowTensorFlowhttps://www.tensorflow.org/Глубокое обучение
Windows 11MicrosoftВерсия 11Операционная система

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

EngineeringIntelligent educationFairEduNetTeaching assessment calibrationGenerative Adversarial NetworkGradient boosting decision tree

Related Articles