Artykuł badawczy

FairEduNet Projektowanie algorytmów i ocena nauczania Kalibracja z uwzględnieniem równości w szkolnictwie wyższym

DOI:

10.3791/70189

21 lipca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Celem badań jest zapewnienie nowego podejścia do kalibracji oceny nauczania i równości edukacyjnej w inteligentnym edukacji. Wyniki eksperymentów wskazują, że zaproponowany model znacząco przewyższa modele porównawcze, skutecznie radząc sobie z problemami słabej integracji danych z wielu źródeł oraz z uprzedzeniami dotyczącymi rzetelności w istniejących metodach kalibracji.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Obecne metody kalibracji oceniania nauczania stoją przed wyzwaniami takimi jak niska efektywność integracji podczas przetwarzania danych oceniania nauczania o zróżnicowanej źródłowości, niewystarczająca przystosowań do różnych dyscyplin i scenariuszy nauczania oraz uprzedzenia w wynikach ze słabymi gwarancjami uczciwości. Badania mają na celu skonstruowanie interpretowalnej, przenośnej i skalowalnej ramy korekcji uczciwości dla głębokiego modelowania i dynamicznej korekcji danych oceniania nauczania. Te problemy utrudniają spełnienie kluczowego wymogu zrównoważonego nauczania w inteligentnej edukacji. Niniejsze badanie proponuje kierowany na uczciwość algorytm sieci edukacyjnej, który integruje sieć generatywną o przeciwnych celach i drzewo decyzyjne wzmacniania gradientowego. Algorytm konstruuje mechanizm kalibracji uczciwości i łączy dwukierunkowy model kodujący reprezentację z siecią uwagi graficznej w celu optymalizacji wyodrębniania cech i dynamicznej przystosowań, poprawiając efektywność przetwarzania danych wieloźródłowych i dokładność kalibracji uczciwości. To podejście osiąga precyzyjną kalibrację i gwarancję uczciwości w ocenianiu nauczania. W teście wskaźników model osiągnął dokładność 98,76% w ewaluacyjnych funkcjach grupowania, 98,05% w korekcji uczciwości i 0,968 w spójności korekcji między scenariuszami w zestawie walidacyjnym. W zadaniu testowania wartości straty, całkowita strata modelu spadła z 0,1237 do 0,1018 podczas zadania korekcji oceny nauczania w zestawie walidacyjnym. W teście wskaźników model osiągnął dokładność 98,76% w ewaluacyjnych funkcjach grupowania, 98,05% w korekcji uczciwości i 0,968 w spójności korekcji między scenariuszami w zestawie walidacyjnym. Wyniki eksperymentów wskazują, że proponowany model znacząco przewyższa porównawcze modele, skutecznie rozwiązując problemy złej integracji danych wieloźródłowych i uprzedzeń uczciwości w istniejących metodach kalibracji. Ponadto zapewnia innowacyjne ramy algorytmiczne dla deweloperów technologii i niezawodne narzędzia techniczne dla administratorów edukacji w celu promowania równości nauczania. Wkład badań polega na: (i) integracji trzech kluczowych modułów, w tym przetwarzania danych wieloźródłowych, dynamicznej weryfikacji wskaźnika uczciwości i wizualizacji wyjaśnialności; oraz (ii) zaproponowaniu paradygmatu korekcji uczciwości opartego na współpracującej optymalizacji sieci generatywnych o przeciwnych celach i drzew wzmacniania gradientowego, co przełamuje ograniczenia tradycyjnej korekcji jednego modelu i umożliwia rozdzielne uczenie się modelowania odchyleń i podejmowania decyzji korekcyjnych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ocena nauczania i kalibracja stanowią podstawę zapewnienia jakości nauczania w inteligentnym edukacji. Poprzez dynamiczną analizę, korektę błędów i kalibrację wyników, zapewniają podstawę dla ulepszania instrukcji i nauczania spersonalizowanego. Ich dokładność i uczciwość bezpośrednio wpływają na to, czy inteligentna edukacja może przełamać technologiczne uprzedzenia i zapewnić zrównoważone wsparcie edukacyjne1,2. Jednakże, istniejące metody mają kilka niedociągnięć: polegają na pojedynczym źródle danych, ignorują rzeczywistą sytuację i prowadzą do zniekształceń danych i uprzedzeń w korekcji. Brak dynamicznego mechanizmu adaptacji uczciwości sprawia, że trudno jest zaspokoić potrzeby uczciwości dyscyplin i scenariuszy3,4. Ponadto, istnieją problemy takie jak brak wskaźników uczciwości i uprzedzenia w strategiach korekcji podczas radzenia sobie z heterogenicznymi danymi z wielu źródeł. W związku z tym, naukowcy przeprowadzili badania z wielu kierunków, takich jak ocena nauczania wspomaganego tenisem na podstawie ulepszonego algorytmu gęstych trajektorii5. Yin i in. wykorzystali analityczną hierarchię procesu i algorytm syntezy rozmytej do monitorowania nauczania online6. Chen przeanalizował dane edukacyjne dotyczące osób starszych za pomocą ulepszonego algorytmu górnictwa danych, aby poprawić jakość nauczania7.

Mimo że te badania osiągnęły postęp, problemy takie jak zniekształcenie wyników kalibracji i słaba koordynacja uczciwości nadal istnieją. Dlatego, budowanie modelu, który jednocześnie zapewnia dokładną kalibrację oceny nauczania i dynamiczną uczciwość, stało się punktem koncentracji badań w inteligentnej edukacji. Sieciowa sieć generatywna przeciwnikowska (GAN) adaptuje się do eliminowania ukrytego wpływu wrażliwych atrybutów na wyniki poprzez szkolenie przeciwników w czasie rzeczywistym między generatorem a dyskryminatorem, zapewniając, że wyniki są określone przez kluczowe czynniki, a nie uprzedzenie indukowane przez etykietę8. GAN pokazuje zalety w radzeniu sobie z uprzedzeniami grupowymi w danych oceniających i modelowaniu nieliniowych ograniczeń uczciwości. Cheng i in. zaproponowali algorytm ulepszania obrazu oparty na GAN, aby rozwiązać problem niskiej rozdzielczości obrazów. Generator generuje obrazy o wysokiej rozdzielczości z wejść o niskiej rozdzielczości, a dyskryminator rozróżnia wygenerowane obrazy od prawdziwych obrazów o wysokiej rozdzielczości. Szkolenie przeciwników optymalizuje parametry, tak aby wyjścia generatora zbliżały się do rzeczywistych obrazów9. Kang i in. zaproponowali model GAN wielomodalny, aby poprawić efektywność przetwarzania danych wielomodalnych w dziedzinie energetyki odnawialnej. Generator odbiera dane jednomodalowe, dyskryminator rozróżnia wygenerowane od prawdziwych danych wielomodalnych, a szkolenie przeciwników optymalizuje model w celu poprawy efektywności10. Algorytm drzewa decyzyjnego wzmacniającego gradientowo (GBDT) jest klasycznym algorytmem przetwarzania danych strukturalnych o silnej zdolności do przechwytywania cech. Poprzez iteracyjne integrowanie wielu drzew decyzyjnych, GBDT precyzyjnie uczy wzorców błędów danych i pokazuje zalety w przetwarzaniu informacji o ocenie z wielu źródeł heterogenicznych i korekcji nieliniowych odchyleń wyników11,12. Mizuno i in. zaproponowali metodę predykcji ścieżek dla katastrof związanych z ciężkimi opadami deszczu opartą na GBDT, ucząc się cech ścieżek i przewidując ścieżki katastrof z danymi w czasie rzeczywistym, wybierając optymalne przewidywania poprzez wiele drzew decyzyjnych13. Gao i in. opracowali metodę analizy wizualnej opartą na GBDT do przewidywania współczynnika kliknięć reklam, ucząc się relacji między cechami wizualnymi a historycznymi danymi kliknięć, aby przewidywać współczynniki kliknięć dla nowych reklam14. W oparciu o powyższe wyzwania, niniejsze badania mają na celu systematycznie odpowiedzieć na następujące kluczowe pytanie naukowe: Jak można zbudować inteligentny model oceny edukacyjnej, który efektywnie integruje dane heterogeniczne z wielu źródeł, dynamicznie adaptuje się do różnych scenariuszy nauczania i jednocześnie zapewnia dokładność kalibracji i uczciwość wyników. Aby odpowiedzieć na to pytanie, w badaniach wykorzystano synergiczny efekt mechanizmu ograniczenia uczciwości GAN i precyzyjnej zdolności kalibracji błędów GBDT. Ponadto, prowadzone są badania nad tym, jak wprowadzić zaawansowane technologie, takie jak przetwarzanie języka naturalnego (BERT), uczenie się przez wzmacnianie (RL), mechanizmy uwagi (AM), sieci pamięci krótkoterminowej (LSTM), sieci uwagi graficznej (GAT) i destylację wiedzy (KD), aby uzupełnić niedobory pojedynczego modelu w ekstrakcji cech, dynamicznej adaptacji i efektywności rozumowania. Ostatecznie, celem jest zapewnienie precyzyjnego i uczciwego rozwiązania kalibracji oceny nauczania, które ma silne zdolności generalizacji dla dziedziny inteligentnej edukacji.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Projekt i optymalizacja algorytmu FairEduNet
Badanie łączy GAN i GBDT w celu stworzenia algorytmu FairEduNet, osiągając podwójne cele w postaci korekcji sprawiedliwości oraz korekcji dokładności, zamiast kompromisu wynikającego z jednostronnej optymalizacji. FairEduNet wykorzystuje dwukanałową architekturę współpracy: kanał główny GBDT odpowiada za ustrukturyzowane modelowanie błędów i precyzyjną korektę, podczas gdy pomocniczy kanał GAN koncentruje się na rozsprzęganiu atrybutów wrażliwych i dynamicznym dostosowywaniu sprawiedliwości. Architektura algorytmu FairEduNet, łącząca GAN i GBDT, przedstawiona jest na Rysunku 1.

figure-protocol-1
Rycina 1: Architektura algorytmu FairEduNet łącząca GAN i GBDT. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Jak pokazano na Ryc. 1, system FairEduNet najpierw gromadzi i wstępnie przetwarza dane oceniające z wielu źródeł. GBDT wykorzystuje wiele drzew decyzyjnych do iteracyjnego uczenia się wzorców błędów oceny, generuje wstępne wyniki kalibracji i przekazuje je do modułu GAN. GAN trenuje dyskryminator w celu poznania zależności między wstępnymi wynikami kalibracji a atrybutami wrażliwymi, podczas gdy generator dynamicznie dostosowuje parametry kalibracji. Poprzez wielokrotne rundy uczenia przeciwstawnego i weryfikację sprawiedliwości optymalizowane jest odchylenie związane z brakiem sprawiedliwości (fairness bias). Ostatecznie wyniki skalibrowane pod kątem sprawiedliwości są przekazywane z powrotem do modułu GBDT, który koryguje je pod kątem dokładności i sprawiedliwości, generując podstawę kalibracji oraz raport oceny nauczania. GBDT oblicza reszty zgodnie z równaniem (1).

figure-protocol-2    (1)

W Równaniu (1), figure-protocol-3 reprezentuje rezyduum i-tej próbki w t-tej iteracji, yi  reprezentuje wartość rzeczywistą, a figure-protocol-4 reprezentuje wartość przewidywaną w iteracji t-1. Proces adversariany GAN przedstawiono w Równaniu (2).

figure-protocol-5    (2)

W równaniu (2) x oznacza początkowy wynik kalibracji, z oznacza cechy atrybutów wrażliwych, Pdata(x) oznacza prawdziwy rozkład cech niewrażliwych, Pz(z) oznacza rozkład atrybutów wrażliwych, D oznacza dyskryminator, a G oznacza generator15. Początkowy wynik kalibracji GBDT przedstawiono w równaniu (3).

figure-protocol-6    (3)

W równaniu (3), figure-protocol-7 reprezentuje predykcję i-tej próbki przez początkowe drzewo decyzyjne, K reprezentuje całkowitą liczbę drzew decyzyjnych, γk reprezentuje wagę k-tego drzewa, a hk(xi) reprezentuje wynik predykcji k-tego drzewa dla i-tej próbki. Algorytm FairEduNet może zapewnić precyzyjną kalibrację i gwarancję sprawiedliwości dla danych oceny nauczania. Jednak podczas przetwarzania nieustrukturyzowanych danych oceny i adaptacji do dynamicznych scenariuszy, FairEduNet wykazuje słabą zdolność ekstrakcji cech dla cech nieustrukturyzowanych, co skutkuje błędem kalibracji. Ponadto wskaźniki sprawiedliwości i parametry kalibracji FairEduNet są ustawione statycznie, co ogranicza jego zdolność adaptacji do różnych scenariuszy nauczania i wpływa na ogólną jakość kalibracji. Połączenie dwukierunkowych reprezentacji kodera z transformatorów (BERT) i uczenia ze wzmocnieniem (RL), czyli algorytm BERT-RL, pozwala na dokładną ekstrakcję głębokich cech z nieustrukturyzowanego tekstu i dynamiczną adaptację parametrów scenariusza bez ręcznego ustawiania statycznych progów, co dodatkowo poprawia niezawodność wyników algorytmu w różnych scenariuszach16,17. Tradycyjne metody, takie jak TF-IDF, opierają się na częstotliwości słów, lecz brakuje im głębokiego rozumienia kontekstowego i nie potrafią rozróżnić konkretnych kierunków "sprawiedliwości" w różnych scenariuszach. Word2Vec generuje statyczne wektory słów, które z trudnością adaptują się do złożonych zmian kontekstowych i nie rozpoznają pośredniego uprzedzenia. BERT wykorzystuje wielowarstwowe mechanizmy self-attention do kodowania dwukierunkowego kontekstu, wychwytując zarówno jawne terminy stronnicze, jak i ukrytą logikę uprzedzeń. Tradycyjne podejścia wymagają ręcznie konstruowanych list słów stronniczych, zależą od subiektywnego doświadczenia i obejmują ograniczoną liczbę scenariuszy. Dzięki transferowi uczenia z modelu pre-trenowanego, BERT automatycznie uczy się głębokich cech semantycznych bez dużego nakładu pracy ręcznej, oferując silniejszą generalizację w rozpoznawaniu niejednoznacznych uprzedzeń. Co więcej, tradycyjne metody często tracą informacje przy długich tekstach, podczas gdy BERT obsługuje do 512 tokenów, zachowując relacje kontekstowe, dokładnie lokalizując cechy stronniczości i umożliwiając precyzyjną korektę sprawiedliwości. Proces działania BERT-RL przedstawiono na Rysunku 2.

figure-protocol-8
Rysunek 2: Schemat blokowy działania algorytmu BERT-RL. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Jak pokazano na Rysunku 2, BERT-RL najpierw standaryzuje nieustrukturyzowane dane z ocen tekstowych, a następnie wprowadza je do modelu BERT. BERT wykorzystuje koder Transformer do dwukierunkowego modelowania semantycznego w celu wyodrębnienia kluczowych cech i skonstruowania macierzy cech. Macierz cech jest następnie wprowadzana do modułu RL, który uczy się optymalnej strategii poprzez wielokrotne iteracje. Zoptymalizowana konfiguracja parametrów jest na koniec przekazywana do FairEduNet, co poprawia jego zdolność adaptacyjną. Obliczanie wag cech mechanizmu self-attention modelu BERT przedstawiono w równaniu (4).

figure-protocol-9   (4)

W równaniu (4) dk  oznacza wymiar wektora K. Funkcja nagrody wielokryterialnej RL została przedstawiona w równaniu (5).

figure-protocol-10   (5)

W równaniu (5) ω1, ω2 i ω3  reprezentują współczynniki wagowe, figure-protocol-11 reprezentuje błąd kalibracji, Dt  to odchylenie sprawiedliwości, Dtarget  to docelowe odchylenie sprawiedliwości, a Tt  to czas wykonania18. Niniejsze badanie łączy BERT-RL z FairEduNet, tworząc algorytm BERT-RL-FairEduNet, określany jako BFEN. BFEN zapewnia precyzyjną kalibrację i gwarancję sprawiedliwości danych oceny nauczania poprzez iterację cech GBDT i adversarialny trening GAN w czasie rzeczywistym, podczas gdy BERT-RL optymalizuje FairEduNet w przetwarzaniu danych nieustrukturyzowanych i dynamicznym dostosowywaniu do scenariuszy, eliminując słabości w ekstrakcji cech i ograniczenia statycznych parametrów. W badaniu wykorzystano model BERT-base-Chinese, a korpus rzeczywistych logów nauczania, tekstów z nagrań lekcji oraz dokumentów polityki edukacyjnej z Narodowej Platformy Inteligentnej Edukacji dla roku akademickiego 2024–2025, o wielkości słownika 21128, został poddany wstępnemu trenowaniu. Wymiar warstwy ukrytej modelu wynosi 768, przy 12 głowicach uwagi i 12 warstwach. Głębokość drzewa GBDT ustawiono na 8, liczba drzew wynosiła 200, a tempo uczenia 0,1. Cykl treningowy GAN obejmuje 150 rund, a dyskryminator wykorzystuje 3-warstwową sieć w pełni połączoną o rozmiarach 512, 256 i 1. Generator wykorzystuje 4-warstwową sieć w pełni połączoną o rozmiarach 1024, 512, 256 i 1. Liczba jednostek ukrytych w LSTM wynosi 128, a długość sekwencji 512. GAT posiada 2 warstwy i 4 głowice uwagi. Temperaturę destylacji wiedzy ustawiono na 3,0. Współczynniki wag nagrody RL wynoszą ω1 = 0,4, ω2 = 0,35 i ω3 = 0,25. Kryterium wyboru wag polegało na zbalansowaniu równowagi frontu Pareto optymalizacji wielokryterialnej z wymaganiami interpretowalności praktyk sprawiedliwości edukacyjnej. Eksperymenty przeprowadzono przy 50% podziale danych za pomocą walidacji krzyżowej i strojenia hiperparametrów. Proces BFEN w kalibracji oceny nauczania przedstawiono na Rysunku 3.

figure-protocol-12
Rysunek 3: Proces korekty algorytmu BFEN dla inteligentnej edukacji i oceny nauczania. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Jak pokazano na Rysunku 3, BFEN w pierwszej kolejności przeprowadza przetwarzanie wstępne danych z wieloźródłowej oceny nauczania. BERT optymalizuje zdolność ekstrakcji cech FairEduNet poprzez obliczanie semantycznego podobieństwa tekstu oraz wag głębokich cech w oparciu o okno semantyczne, wybierając istotne cechy w celu skonstruowania wysokowymiarowej macierzy cech semantycznych. RL wyznacza następnie wielokryterialną funkcję nagrody i oblicza gradienty adaptacyjności do scenariusza oraz regulacji parametrów, aby dalej optymalizować progi sprawiedliwości i parametry kalibracji. FairEduNet oblicza odchylenia między danymi oceny a modelami wzorców błędów, iteracyjnie aktualizuje wagi drzew decyzyjnych i dostosowuje strategie kalibracji, aż błędy ustabilizują się w obrębie zadanych progów. Końcowy wynik obejmuje model kalibracji błędów oraz raport weryfikacji sprawiedliwości. Model kalibracji jest stosowany do danych oceny nauczania, generując tabele porównawcze sprzed i po kalibracji, które są łączone z inteligentną biblioteką standardów sprawiedliwości edukacji w celu wyznaczenia docelowych parametrów kalibracji, co zapewnia naukową podstawę dla kalibracji oceny nauczania w inteligentnej edukacji. Biblioteka standardów ta obejmuje trzy wymiary: sprawiedliwość szans edukacyjnych, sprawiedliwość procesu oraz sprawiedliwość wyników i zawiera 12 kluczowych wskaźników. Wskaźniki te obejmują: równowagę w alokacji zasobów edukacyjnych między regionami, różnicę w pokryciu infrastrukturą cyfrową między szkołami miejskimi a wiejskimi, próg tolerancji dla opóźnionej odpowiedzi w diagnostyce sytuacji uczenia się (≤200 ms), tolerancję na brakujące dane w ocenie multimodalnej (≤3,5%), czułość detekcji stronniczości algorytmu (odchylenie AUC dla etykietowania płci/regionu/etapu ≤ 0,02), próg dywergencji KL dla rozkładu wyników przed i po korekcie (≤0,08), wynik interpretowalności sugestii interwencji nauczyciela (≥4,2/5,0), terminowość aktualizacji profilu ucznia (zrealizowana w ciągu T + 1 dni), współczynnik spójności uznawania osiągnięć międzyplatformowych (≥0,93), dokładność semantycznego dopasowania polityki edukacyjnej (wynik BERT ≥ 0,86) oraz kompletność generowania raportu weryfikacji sprawiedliwości (obejmującego atrybucję stronniczości, przedziały ufności i reprodukowalne migawki parametrów), a także wskaźnik przejścia walidacji dynamicznej adaptacji do scenariuszy obejmujący trzy typowe scenariusze: lekcje na żywo, zadania asynchroniczne oraz asystentów nauczania AI. Obliczanie podobieństwa cech semantycznych przedstawiono w Równaniu (6).

figure-protocol-13     (6)

W równaniu (6) fi  oznacza wartość i-tego wymiaru cechy semantycznej, gi oznacza wartość i-tego wymiaru cechy oceny istotności, a n  reprezentuje całkowitą liczbę wymiarów cech. Obliczenie parametru adaptacji scenariusza RL przedstawiono w równaniu (7).

figure-protocol-14    (7)

W równaniu (7), θt oznacza wartość parametru w t-tej iteracji, α oznacza szybkość uczenia, a figure-protocol-15 reprezentuje gradient parametru oparty na funkcji nagrody R(θt).

Konstrukcja modelu kalibracji oceny nauczania
Mimo że BFEN wykazuje pewne zalety w kalibracji oceny nauczania, wciąż boryka się z niską wydajnością integracji heterogenicznych danych oceny z wielu źródeł oraz niewystarczającą dynamiczną adaptacją sprawiedliwości w zastosowaniach praktycznych. Algorytm AM-LSTM, który łączy mechanizm uwagi (AM) i długo-krótkotrwałą pamięć (LSTM), przypisuje wagi kluczowym cechom wieloźródłowych danych oceny za pomocą AM i rejestruje dynamiczne wzorce zmian danych oceny w czasie, wykorzystując zdolność pamięci sekwencyjnej LSTM. Podejście to skutecznie poprawia wydajność integracji danych z wielu źródeł oraz uczenie dynamicznych cech19,20. Proces działania AM-LSTM przedstawiono na Rysunku 4.

figure-protocol-16
Rycina 4: Schemat blokowy działania AM-LSTM. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Jak pokazano na Rysunku 4, model AM-LSTM najpierw przetwarza wstępnie heterogeniczne dane z wielu źródeł dotyczące oceny nauczania, aby utworzyć zestandaryzowany zbiór danych. Moduł AM oblicza wagi uwagi dla cech pochodzących z różnych źródeł danych w celu wyboru istotnych cech i konstruuje ważoną macierz cech. Następnie ważona macierz cech jest wprowadzana do sieci LSTM, która wykorzystuje mechanizm bramkowania do uczenia się dynamicznych wzorców w czasie, przechwytując zależności między danymi oceny na różnych etapach i generując dynamiczne wektory cech. Na koniec dynamiczne wektory cech są łączone z ograniczeniami sprawiedliwości w celu wygenerowania pośrednich wyników kalibracji, które dostosowują się do integracji danych z wielu źródeł i scenariuszy dynamicznych, stanowiąc podstawę do późniejszej optymalizacji modelu. Obliczanie wag uwagi przedstawiono w Równaniu (8).

figure-protocol-17     (8)

W równaniu (8) an  oznacza alokację uwagi dla n-tej cechy, xn  oznacza podobieństwo, q  oznacza wektor zapytania, a softmax  oznacza funkcję aktywacji. Bramka zapominania LSTM jest wyrażona w równaniu (9).

figure-protocol-18    (9)

W równaniu (9) Wf  to waga bramki zapominania, bf  to obciążenie bramki zapominania, xt  to wejście w czasie t, ht-1  to zewnętrzna zmienna stanu w czasie t-1, a σ reprezentuje funkcję sigmoidalną21. Niniejsze badanie łączy AM-LSTM z BFEN w celu skonstruowania modelu kalibracji oceny nauczania AM-LSTM-BFEN, nazwanego FBFEN. W tym modelu AM-LSTM rozwiązuje ograniczenia BFEN w zakresie wydajności integracji heterogenicznych danych z wielu źródeł oraz dynamicznej ekstrakcji cech. Integruje on również ograniczenia sprawiedliwości w celu optymalizacji pośrednich wyników kalibracji, co pozwala BFEN na dalsze osiągnięcie precyzyjnej kalibracji i zapewnienie dynamicznej sprawiedliwości dla danych oceny nauczania. Proces działania FBFEN przedstawiono na Rysunku 5.

figure-protocol-19
Rycina 5: Proces działania modelu oceny i korekty nauczania FBFEN. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Jak pokazano na Rysunku 5, FBFEN najpierw przetwarza wstępnie oryginalne wieloźródłowe dane oceny nauczania i wprowadza ustandaryzowany zbiór danych do modułu AM-LSTM. AM oblicza wagi uwagi cech, podczas gdy LSTM uczy się wzorców dynamicznych, generując pośrednie wyniki kalibracji, które integrują informacje wieloźródłowe i cechy dynamiczne. Wyniki pośrednie są następnie wprowadzane do modułu BFEN. GBDT iteracyjnie uczy się wzorców błędów danych oceny na podstawie wyników pośrednich i zaprogramowanego modelu błędów, generując wstępne wyniki kalibracji. Jednocześnie GAN analizuje stronniczość wynikającą z atrybutów wrażliwych w wynikach wstępnych poprzez trening przeciwstawny między generatorem a dyskryminatorem, dynamicznie dostosowując parametry kalibracji w celu wyeliminowania stronniczości. W końcu zoptymalizowane przez GAN parametry kalibracji są przekazywane z powrotem do GBDT w celu aktualizacji wag drzew decyzyjnych i strategii kalibracji, co pozwala uzyskać wtórny wynik kalibracji zapewniający równowagę między precyzją a sprawiedliwością. Standaryzacja danych została przedstawiona w Równaniu (10).

figure-protocol-20    (10)

W równaniu (10), z' oznacza wartość zestandaryzowaną, z oznacza wartość oryginalną, a zmin  oraz zmax  reprezentują wartości minimalną i maksymalną. Końcowa funkcja celu generatora GAN jest przedstawiona w równaniu (11).

figure-protocol-21   (11)

W równaniu (11) N oznacza liczbę iteracji, λ reprezentuje współczynnik wagi straty, ωi oznacza współczynnik wagi i-tej iteracji, figure-protocol-22 reprezentuje funkcję straty adversarianej, a figure-protocol-23 reprezentuje binarną stratę entropii krzyżowej22.

Optymalizacja modelu kalibracji oceny nauczania FBFEN
Mimo że FBFEN wykazuje silną integrację danych z wielu źródeł oraz dynamiczne zapewnienie sprawiedliwości w kalibracji oceny nauczania, wciąż boryka się ze słabą korelacją cech oraz niską wydajnością trenowania i wnioskowania ze względu na złożoną strukturę modelu w skomplikowanych scenariuszach edukacyjnych. Algorytm GAT-KD, łączący sieć uwagi grafowej (Graph Attention Network, GAT) i destylację wiedzy (Knowledge Distillation, KD), dynamicznie konstruuje graf powiązań semantycznych między cechami za pomocą mechanizmu uwagi GAT, co wzmacnia wyrównanie semantyczne danych z wielu źródeł. KD kompresuje wiedzę ze złożonego modelu do lekkiej sieci, znacząco poprawiając wydajność wnioskowania przy jednoczesnym zachowaniu wydajności modelu23,24. Proces działania GAT-KD przedstawiono na Rysunku 6.

figure-protocol-24
Rycina 6: Schemat działania GAT-KD. Aby zobaczyć powiększoną wersję tej ryciny, kliknij tutaj.

Jak pokazano na Rysunku 6, GAT-KD konstruuje graf asocjacji semantycznych między cechami za pomocą modułu GAT, dynamicznie agreguje informacje o cechach sąsiedztwa z wykorzystaniem mechanizmu uwagi i wzmacnia reprezentację semantyczną cech lokalnych. Następnie KD wykorzystuje wyjściowe miękkie etykiety jako sygnały nadzoru, minimalizując stratę dywergencji między rozkładami wyjściowymi oraz stratę entropii krzyżowej między przewidywaniami a prawdziwymi etykietami, co pozwala na transfer wiedzy i kompresję modelu. Wynikiem końcowym jest lekki model kalibracji o wysokiej precyzji i wydajności. Obliczenia współczynnika uwagi GAT przedstawiono w Równaniu (12).

figure-protocol-25     (12)

W równaniu (12) figure-protocol-26 oraz figure-protocol-27 reprezentują wektory cech węzłów i j, W  reprezentuje wyuczalną macierz wag, a  reprezentuje wektor wag uwagi, figure-protocol-28 reprezentuje operację konkatenacji, a LeakyReLU  reprezentuje funkcję aktywacji25. Obliczenie funkcji straty KD przedstawiono w równaniu (13).

figure-protocol-29     (13)

W równaniu (13), KL oznacza stratę dywergencji, T2 oznacza bilans skalowania gradientu, pstudent oznacza prawdopodobieństwo miękkiej etykiety modelu lekkiego, a pteacher oznacza prawdopodobieństwo miękkiej etykiety modelu złożonego26. Dzięki połączeniu asocjacji cech wzmocnionej mechanizmem uwagi oraz lekkiego transferu wiedzy, GAT-KD skutecznie eliminuje stronniczość semantyczną cech i wysoką złożoność obliczeniową. Niniejsze badanie integruje GAT-KD z FBFEN w celu stworzenia modelu kalibracji oceny nauczania GAT-KD-FBFEN, nazwanego GFBFEN. GAT-KD optymalizuje niedoskonałości FBFEN w zakresie niepełnego przechwytywania korelacji cech wieloźródłowych oraz niskiej wydajności wnioskowania. Proces działania GFBFEN przedstawiono na Rysunku 7.

figure-protocol-30
Rycina 7: Proces działania modelu oceny i korekty nauczania GFBFEN. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Jak pokazano na Rysunku 7, GFBFEN standaryzuje wieloźródłowe dane oceny nauczania. GAT modeluje złożone relacje między cechami i dynamicznie oblicza wagi powiązań semantycznych między węzłami przy użyciu mechanizmów uwagi. KD kompresuje wiedzę ze złożonego modelu do lekkiej sieci, znacząco poprawiając wydajność wnioskowania przy zachowaniu precyzji. Moduł AM-LSTM przypisuje wagi istotności do cech wieloźródłowych i przechwytuje czasowe wzorce dynamiczne danych oceny, generując pośrednie wyniki kalibracji integrujące informacje z wielu źródeł. Wyniki te są wprowadzane do modułu BFEN w celu głębokiego przetwarzania. W szczególności BERT wyodrębnia cechy semantyczne z niestrukturalnego tekstu, RL dynamicznie optymalizuje progi sprawiedliwości i parametry kalibracji, GBDT iteracyjnie uczy się wzorców błędów w celu wstępnej kalibracji, a GAN eliminuje obciążenia spowodowane atrybutami wrażliwymi poprzez trening przeciwstawny. Mechanizm dynamicznej regulacji parametrów automatycznie kalibruje czułość odpowiedzi i wagi sprawiedliwości każdego modułu, wykrywając w czasie rzeczywistym zmiany czasowe i przesunięcia w rozkładzie grup w scenie nauczania, rozwiązując tym samym problem niewystarczającej adaptacyjności wynikającej ze statycznej konfiguracji parametrów oraz zapewniając, że model zachowuje odporność i sprawiedliwość na różnych etapach nauczania, w różnych grupach studentów i scenariuszach oceny. Typ oceny bezpośrednio wpływa na ziarnistość i cykl sprzężenia zwrotnego modelowania szeregów czasowych, podczas gdy ocena kształtująca podkreśla dynamiczny charakter procesu. Różnice między dyscyplinami determinują alokację cech pomiędzy modułami BERT i GBDT. Dlatego zastosowanie mechanizmu dynamicznej regulacji pozwala na skuteczną adaptację do różnych typów oceny i charakterystyki dyscyplinarnych. Ostatecznie, poprzez wielokrotne rundy sprzężenia zwrotnego parametrów i iteracyjną optymalizację, model generuje precyzyjne i sprawiedliwe wyniki kalibracji oceny nauczania. Funkcja optymalizacji dynamicznego ograniczenia sprawiedliwości jest przedstawiona w Równaniu (14).

figure-protocol-31   (14)

W równaniu (14), S oznacza zbiór atrybutów wrażliwych, figure-protocol-32 oznacza wynik kalibracji przewidywanych wyjść, figure-protocol-33 oznacza wariancję przewidywań w obrębie grup, γ oznacza parametry międzygrupowe, a figure-protocol-34 oznacza całkowitą wartość oczekiwaną. Adaptacyjne obliczanie wag fuzji cech z wielu źródeł przedstawiono w równaniu (15).

figure-protocol-35     (15)

W równaniu (15), wk oznacza wagę cechy k-tego źródła danych, β oznacza parametr wagi, Sim oznacza funkcję pomiaru podobieństwa cech, fk oznacza wektor cech wyekstrahowany z k-tego źródła danych, fglobal oznacza globalne centrum cech, a K oznacza całkowitą liczbę źródeł danych. W badaniu określono wagi atrybutów wrażliwych, obejmujących płeć, pochodzenie etniczne, region, status ekonomiczny rodziny oraz język ojczysty. Wagi zostały ustalone na podstawie wyników analizy korelacji. W badaniu wykorzystano współczynnik korelacji Pearsona oraz współczynnik korelacji rang Spearmana jako podwójne wskaźniki do wspólnej oceny, łącząc je z doświadczeniem ekspertów z dziedziny edukacji w celu kalibracji wag. Ostateczne ustalenie wag dla każdego atrybutu wrażliwego przyniosło wartości: 0,18 dla płci, 0,22 dla pochodzenia etnicznego, 0,25 dla regionu, 0,19 dla statusu ekonomicznego rodziny i 0,16 dla języka ojczystego. Płeć: tożsamość płciowa zgodnie z rejestracją prawną i samookreśleniem, binarna (mężczyzna/kobieta) z opcjami niebinarnymi; pole danych "gender". Pochodzenie etniczne: na podstawie krajowej identyfikacji etnicznej 56 grup, kompatybilne z grupami nieokreślonymi i transgranicznymi; pole danych "ethnicity". Region: podział administracyjny zameldowania lub miejsca stałego zamieszkania, obejmujący poziomy prowincjonalne, miejskie i powiatowe, z uwzględnieniem dualnej struktury miejsko-wiejskiej oraz populacji migrantów; pole danych "region". Status ekonomiczny rodziny: zgodnie z krajowymi standardami statystycznymi i wskaźnikami pomocy edukacyjnej, z zastosowaniem klasyfikacji pięciostopniowej; pole danych "economic_status". Język ojczysty: główny język nauczania i komunikacji rodzinnej podczas edukacji podstawowej, obejmujący język mandaryński, języki mniejszościowe, dialekty i języki obce, z wagą zależną od wieku nabycia i częstotliwości użycia; pole danych "mother_tongue."

Proces korekcji wykorzystał trzyetapowy mechanizm dynamicznego ważenia. W pierwszym etapie zaimplementowano wstępną identyfikację odchyleń w oparciu o macierz wag atrybutów wrażliwych, znakując punkty danych, które znacząco odbiegały od globalnego centrum cech w takich wymiarach jak płeć, pochodzenie etniczne i region. Drugi etap wprowadza ograniczenia kontekstu edukacyjnego, aby ponownie ocenić intensywność odchyleń w sposób uwzględniający kontekst. Trzeci etap weryfikuje stabilność korekcji za pomocą testów perturbacji kontrfaktycznych, systematycznie zastępując wartości atrybutów wrażliwych przy zachowaniu niezmienności cech niewrażliwych i sprawdzając, czy zmiana wyników oceny mieści się w progu ±±3.2%.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Analiza wydajności algorytmu BFEN
Wskaźniki oceniane w eksperymentach obejmowały następujące parametry:

Dokładność korekty oceny (ECA) określa proporcję elementów odchylonych, które zostały prawidłowo zidentyfikowane i poprawione przez model w ramach wyników oceny nauczania, odzwierciedlając tym samym ogólną skuteczność mechanizmu korekcyjnego. Wyższe wartości wskazują na lepszą dokładność korekty.

Wskaźnik odchylenia sprawiedliwości (FDR) mierzy wielkość rozbieżności wyników między grupami, których model nie zdołał wyeliminować w procesie kalibracji. Oblicza się go jako stosunek odchylenia standardowego każdego atrybutu wrażliwego (np. płci, regionu, pochodzenia etnicznego) w rozkładzie wyników do całkowitego odchylenia standardowego; niższe wartości oznaczają zminimalizowane wariancje międzygrupowe i bardziej solidną gwarancję sprawiedliwości.

Wskaźnik adaptacji do scenariusza (SAR) określa procent zadań korekcyjnych pomyślnie wykonanych przez model w heterogenicznych kontekstach instruktażowych (np. nauki przyrodnicze vs. humanistyczne, środowiska online vs. offline).

Stopień utrzymania sprawiedliwości (FMD) definiuje się jako jeden minus stosunek wariancji wskaźników sprawiedliwości pomiędzy grupami atrybutów wrażliwych po korekcji do wartości zaobserwowanej przed korekcją, co odzwierciedla zdolność systemu do zachowania strukturalnej sprawiedliwości podczas procesu kalibracji.

Wskaźnik rozpoznawania cech dyscyplinarnych (DFRR) oblicza proporcję próbek, w których cechy kluczowe zostały prawidłowo zidentyfikowane w danych oceniających każdą z dyscyplin, w stosunku do całkowitej wielkości próby oceniającej, co wykazuje zdolność modelu do rozróżniania i wychwytywania zmienności specyficznych dla danej dziedziny.

Wydajność fuzji danych wieloźródłowych (MDFE) odnosi się do przepustowości modelu podczas wyrównywania cech, alokacji wag i korekcji odchyleń w procesie łączenia heterogenicznych danych ewaluacyjnych z wielu źródeł. Ta kompleksowa metryka jest zdefiniowana jako iloczyn liczby przetwarzanych próbek oceny na sekundę (samples/sec) oraz wskaźnika zgodności spójności korekcji (przy poziomie ufności >95%), gdzie wyższe wartości oznaczają bardziej wydajny i stabilny proces fuzji.

Stabilność wyniku korekcji (CRS) wskazuje na spójność wyników kalibracji w wielu niezależnych uruchomieniach, określana jako odwrotność odchylenia standardowego odległości euklidesowej pomiędzy wynikami korekcji każdego uruchomienia przy identycznych danych wejściowych. Wyższe wartości oznaczają zwiększoną niezawodność systemu.

Czas pojedynczej korekty danych (SDCT) reprezentuje średnie opóźnienie obliczeniowe modelu niezbędne do zakończenia kalibracji pojedynczej próbki oceny, mierzone w milisekundach (ms); niższe wartości wskazują na lepszą zdolność do reakcji w czasie rzeczywistym.

Skorygowany błąd bezwzględny (CAE) określa średni błąd bezwzględny pomiędzy skalibrowanymi predykcjami a wartościami rzeczywistymi, reprezentując odchylenie resztkowe modelu w stosunku do pierwotnych, nieskalibrowanych danych. Niższe wartości oznaczają, że skalibrowane wyniki są bardziej zgodne z rzeczywistymi poziomami wydajności.

Skorygowany błąd względny (CRE) określa średni błąd bezwzględny pomiędzy wartościami przewidywanymi po kalibracji a wartościami rzeczywistymi, wyrażony jako procent wartości rzeczywistej, przy czym niższe wartości wskazują na wyższą względną precyzję kalibracji.

Wskaźnik dokładności korekcji (CAR) reprezentuje proporcję próbek, których błąd bezwzględny po kalibracji wynosi < 0,5 w stosunku do całkowitej liczby próbek, co wykazuje niezawodność modelu w spełnianiu określonych ograniczeń precyzji. Wysokie wartości potwierdzają empiryczną użyteczność i wiarygodność wyników.

Całkowita wartość straty (TL) reprezentuje kompleksową wartość celu optymalizacji, pochodzącą z ważonej sumy poszczególnych składników podstraty po zakończeniu zadania. W szczególności siedem wskaźników — DFRR, MDFE, CRS, SDCT, CAE, CRE i CAR — zostaje ustandaryzowanych poprzez normalizację Z-score i obciążonych wagami zgodnie z priorytetem operacyjnym zadań ewaluacyjnych. Przy wektorze wag [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1], siedem tych znormalizowanych wartości wskaźników jest agregowanych w celu obliczenia końcowej straty.

Dokładność grupowania cech ewaluacyjnych (EFCA) ocenia stopień zgodności między konfiguracjami grupowania nienadzorowanego wygenerowanymi przez model a kategoriami referencyjnymi zweryfikowanymi przez ekspertów z danej dziedziny.

Wydajność przetwarzania danych wysokowymiarowych (HDPE) określa liczbę próbek poddanych redukcji wymiarowości cech oraz korekcji odchyleń w jednostce czasu podczas obsługi wysokowymiarowych rzadkich wektorów zawierających ≥50 cech ewaluacyjnych. Mierzona w próbkach/sekundę, wyższe wartości odzwierciedlają większą zdolność do przetwarzania w czasie rzeczywistym złożonych, wielkoskalowych danych wejściowych z oceny.

Precyzja korekty sprawiedliwości (FCP) ocenia jednolitość efektów kalibracji w różnych kohortach studentów. Metryka ta jest kwantyfikowana poprzez obliczenie średniej z rozkładu odległości Kołmogorowa-Smirnowa dla skorygowanych błędów bezwzględnych w podgrupach cech wrażliwych; niższe wartości oznaczają bardziej zrównoważoną wydajność między grupami i silniejszą gwarancję sprawiedliwości.

Spójność korekcji między scenariuszami (CSCC) określa ilościowo przesunięcie rozkładu wyników kalibracji w trzech typowych scenariuszach — mianowicie: ocenie klasowej, ocenie praktycznej i testowaniu online — modelowane jako stosunek dystansu Wassersteina.

Aby zweryfikować wydajność proponowanego algorytmu kalibracji oceny nauczania BFEN, w badaniu porównano go z algorytmem PRF, łączącym analizę głównych składowych (PCA) i lasy losowe (RF); algorytmem EAB, łączącym ekstremalną maszynę uczącą (ELM) i adaptacyjne wzmacnianie (AdaBoost); oraz algorytmem DBLR, łączącym głęboką sieć przekonań (DBN) i regresję logistyczną (LR). Eksperymenty przeprowadzono na systemie wyposażonym w procesor Intel Core i9-13900HX i procesor graficzny NVIDIA RTX 4080, co zapewniło wysoką zdolność obliczeń równoległych i dużą pamięć wideo do efektywnego przeprowadzenia ekstrakcji cech oraz obliczeń kalibracyjnych dla wielkoskalowych danych dotyczących oceny nauczania. Systemem operacyjnym był Windows 11, a do programowania wykorzystano język Python 3.9. Algorytmy zaimplementowano przy użyciu biblioteki Scikit-learn, moduły uczenia głębokiego opracowano w ramach frameworka TensorFlow, a do wstępnego przetwarzania danych wykorzystano biblioteki Pandas i NumPy. Środowiskiem programistycznym był PyCharm Professional 2023.1, a do wizualizacji wyników kalibracji zastosowano bibliotekę Seaborn, aby ułatwić intuicyjne porównanie wydajności algorytmów. Aby zapewnić wiarygodność danych, w badaniu wykorzystano zbiór danych Global Education Monitoring Report1 oraz zbiór danych dotyczący wyników w nauce uczniów hiszpańskich szkół średnich2. Zbiór danych zawiera 12 486 rekordów, obejmujących multimodalne dane oceny nauczania, takie jak oceny nauczania kadry akademickiej, wyniki w nauce studentów, oceny nauczania wystawione przez studentów oraz opinie o kursach, obejmujące 137 cech wymiaru nauczania, w tym częstotliwość interakcji w klasie, terminowość informacji zwrotnych do zadań, spójność oceniania, inkluzywność językową oraz wrażliwość międzykulturową. Zmienną docelową jest ocena nauczania, która w niniejszym badaniu jest odwzorowana na wielowymiarową ważoną wartość złożoną, skalibrowaną przez ekspertów. Badanie integruje cztery typy źródeł informacji: oceny nauczania wystawione przez studentów, recenzje koleżeńskie, obserwacje lekcji przez przełożonych oraz przeglądy teczek dydaktycznych, z wagami odpowiednio 0,35, 0,25, 0,25 i 0,15. Zbiory treningowe i walidacyjne zostały podzielone chronologicznie z dwóch zbiorów danych. W badaniu wykorzystano dane z września 2024 r. jako zbiór treningowy oraz dane z okresu od października 2024 r. do czerwca 2025 r. jako zbiór walidacyjny, aby dostosować je do temporalnego przebiegu ocen edukacyjnych. Na etapie wstępnego przetwarzania zastosowano strategię specyficzną dla danej modalności: cechy strukturalne zestandaryzowano poprzez normalizację Z-score i poddano winsoryzacji wartości odstających, natomiast cechy tekstowe zakodowano za pomocą modelu BERT-base-chinese i zredukowano do 768 wymiarów. Zastosowano trening adversariany w celu zwiększenia odporności na niejawne przejawy stronniczości oraz złagodzenia dryftu semantycznego spowodowanego różnicami w tle kulturowym.

W celu przeprowadzenia badań nad treningiem i walidacją międzydomenową, model zostanie przeniesiony do czterech heterogenicznych scenariuszy nauczania: edukacji podstawowej K-12, edukacji zawodowej, edukacji ustawicznej oraz międzynarodowej edukacji języka chińskiego w celu walidacji przy zerowej lub niewielkiej liczbie próbek. W tych czterech scenariuszach badanie wprowadza terminy regularyzacji adaptacyjnej do domeny podczas trenowania algorytmu, aby ograniczyć spójność rozkładu cech modelu w różnych scenariuszach nauczania. W scenariuszach K-12 zaimplementowano lekki mechanizm maskowania uwzględniający składnię w celu eliminacji szumu w krótkich zdaniach. Aby rozwiązać problem wieloznaczności terminologii specjalistycznej w edukacji zawodowej, skonstruowano dynamiczny słownik dziedzinowy i zintegrowano go z grafem wiedzy programu nauczania. Zaprojektowano moduł uczenia porównawczego grup wiekowych, aby zniwelować międzypokoleniową lukę semantyczną w edukacji ustawicznej, dopasowując kotwice semantyczne dla ekspresji oceniających z różnych grup wiekowych w przestrzeni ukrytej. Aby rozwiązać problem ekspresji obciążonej kulturowo w międzynarodowej edukacji języka chińskiego, do dostrajania wykorzystano prompty porównawcze międzyjęzykowe, co zwiększyło odporność modelu na rozumienie nieliteralnych pojęć edukacyjnych. Przeprowadzono badania nad kalibracją ekspercką i testowaniem niezawodności ustrukturyzowanych pól w oryginalnych zapisach ocen, usuwając wpisy o niskiej niezawodności z współczynnikiem alfa Krippendorffa poniżej 0,75. W odniesieniu do tekstów ocen studenckich zastosowano podwójnie ślepą adnotację ręczną, w której 3 ekspertów pomiaru edukacyjnego niezależnie przeprowadziło etykietowanie typów odchyleń, osiągając spójność adnotacji na poziomie Cohen's k = 0,86. Na koniec wyniki adnotacji zostały poddane walidacji krzyżowej z zapisami obecności nadzoru oraz wnioskami z przeglądów dokumentacji dydaktycznej w celu wygenerowania ostatecznych etykiet kalibracyjnych.

Wybrane zestawy danych pochodziły z odrębnych populacji, systemów pomiarowych i środowisk edukacyjnych. Ten paradygmat walidacji międzydomenowej rygorystycznie przetestował odporność i granice generalizacji modelu w autentycznym ekosystemie edukacyjnym, zapobiegając złudzeniom oceny spowodowanym homogenizacją danych. Oba repozytoria zawierały znaczne ilości rekordów z ocen dydaktycznych, oferując bezpośrednią wartość referencyjną dla wdrożenia algorytmów inteligentnej edukacji uwzględniających sprawiedliwość. Oba zestawy danych zawierały obszerne dane z ocen dydaktycznych, dostarczając bezpośrednich wartości referencyjnych dla projektowania algorytmów inteligentnej edukacji uwzględniających sprawiedliwość oraz kalibracji ocen dydaktycznych. W ramach badania skalibrowano 1000 rekordów ocen dydaktycznych za pomocą czterech algorytmów i obliczono ich ECA oraz Fairness FDR. Wyniki przedstawiono na Rysunku 8.

figure-results-1
Rysunek 8: Porównanie wyników testów między ECA a FDR. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. Aby wyświetlić powiększoną wersję tego rysunku, kliknij tutaj.

Jak pokazano na Rysunku 8A, algorytm BFEN osiągnął początkowo ECA na poziomie 82,47% oraz FDR na poziomie 5,71% w zadaniu kalibracji oceny. Wraz ze wzrostem liczby skalibrowanych rekordów, ECA wzrosło do 98,75% i ustabilizowało się po skalibrowaniu 421 rekordów, natomiast FDR spadło do 2,87% i ustabilizowało się po skalibrowaniu 514 rekordów. Jak pokazano na Rysunku 8B, krzywa ECA algorytmu PRF stopniowo rosła, podczas gdy linia FDR powoli opadała. Na koniec zadania kalibracji wartość ECA wynosiła 92,30%, a wartość PDR 6,72%. Rysunek 8C wykazuje, że krzywa ECA algorytmu EAB gwałtownie rosła przed spłaszczeniem, podczas gdy trajektoria FDR wykazywała silne wahania na wczesnym etapie przed zbieżnością, kończąc z ECA na poziomie 84,64% i FDR na poziomie 8,93%. Jak przedstawiono na Rysunku 8D, algorytm DBLR wykazał powolną trajektorię wzrostową ECA połączoną z niewielkimi wahaniami oraz ograniczoną kompresją linii FDR, kończąc zadanie kalibracji z ECA wynoszącym 83,51% i FDR wynoszącym 8,42%. Te wyniki eksperymentalne potwierdzają, że algorytm BFEN znacząco przewyższa podejścia bazowe zarówno pod względem dokładności korekty oceny, jak i kontroli stronniczości sprawiedliwości. Taka wyższa zdolność do generalizacji przypisywana jest integracji modelu BERT w obrębie BFEN, który wydobywa głębokie cechy semantyczne z niestrukturyzowanego tekstu oceny, aby uchwycić ukryte przejawy stronniczości, podczas gdy moduł RL dynamicznie optymalizuje progi sprawiedliwości i parametry korekty za pomocą wielokryterialnej funkcji nagrody, aby odseparować atrybuty wrażliwe od końcowych wyników. Następnie w badaniu przetestowano SAR i FMD w przypadku oceny klasowej, egzaminów końcowych, oceny praktycznej oraz oceny online, oznaczając te cztery scenariusze jako A, B, C i D. Wyniki przedstawiono na Rysunku 9.

figure-results-2
Rycina 9: Porównanie wyników SAR i FMD w różnych scenariuszach. (A) Wyniki testu SAR. (B) Wyniki testu FMD. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Jak pokazano na Rysunku 9A, BFEN osiągnął SAR powyżej 98% we wszystkich scenariuszach nauczania, przy czym najwyższy SAR wyniósł 99,01% dla testów klasowych. SAR algorytmu porównawczego w różnych scenariuszach jest niższy niż w przypadku algorytmu BFEN, przy czym algorytm DBLR wykazał najniższy SAR spośród wszystkich algorytmów w scenariuszu oceny końcowej, osiągając wartość 70,23%. Jak pokazano na Rysunku 9B, FMD algorytmu BFEN jest nadal znacznie wyższy niż w przypadku algorytmu porównawczego w różnych scenariuszach nauczania, z wartościami FMD wynoszącymi odpowiednio 98,47%, 98,05%, 97,81% i 97,94% w poszczególnych scenariuszach. Wartości FMD dla algorytmu referencyjnego DBLR wynoszą odpowiednio 82,36%, 71,74%, 70,59% i 69,12%. Wartości FMD dla algorytmu EAB wynoszą odpowiednio 80,79%, 68,21%, 67,65% i 66,03%, natomiast FMD dla algorytmu PRF wynoszą odpowiednio 86,42%, 82,17%, 80,98% i 78,33%. Wyniki te dowiodły, że BFEN przewyższył algorytmy porównawcze dzięki iteracyjnemu uczeniu GBDT z wykorzystaniem wielu drzew decyzyjnych, co pozwoliło na dokładne uchwycenie wzorców błędów w różnych scenariuszach i zapewniło stabilne oraz sprawiedliwe wyniki kalibracji. W badaniu dodatkowo oceniono wskaźnik rozpoznawania cech dyscyplinarnych (DFRR) dla języka chińskiego, matematyki i języka angielskiego z wykorzystaniem czterech algorytmów. Wyniki przedstawiono na Rysunku 10.

figure-results-3
Rycina 10: Porównanie wyników testu DFRR w różnych dyscyplinach. (A) Zbiór treningowy. (B) Zbiór walidacyjny. Aby wyświetlić powiększoną wersję tej ryciny, kliknij tutaj.

Jak pokazano na Rysunku 10A, BFEN osiągnął DFRR na poziomie 99,23%, 98,94% i 99,13% dla języka chińskiego, matematyki i języka angielskiego w zbiorze treningowym. Rysunek 10B wskazuje, że BFEN osiągnął również wyższy DFRR w zbiorze walidacyjnym w porównaniu z innymi algorytmami. Konkretnie, DFRR algorytmu BFEN dla języka chińskiego wyniósł 98,41%, co jest wartością o 10,8% wyższą niż 87,61% dla DBLR; dla matematyki 97,54%, o 9,07% wyżej niż 88,47% dla PRF; a dla języka angielskiego 98,13%, o 13,34% wyżej niż 84,79% dla EAB. Wyniki te potwierdziły, że BFEN efektywnie dostosował się do kalibracji oceny dyscyplinarnej, łącząc głęboką analizę różnic semantycznych modelu BERT z personalizowanym uczeniem wzorców błędów za pomocą GBDT. Aby kompleksowo ocenić wydajność BFEN, w badaniu przeanalizowano MDFE, CRS i SDCT dla czterech algorytmów. Wyniki przedstawiono w Tabeli 1.

Zbiór danychAlgorytmMDFE (%)CRSSDCT (s)
TreningoweBFEN98.42 ± 0.28*&@0.975 ± 0.28*&@0.78 ± 0.04*&@
PRF83.85 ± 0.410.779 ± 0.361.32 ± 0.08
EAB85.91 ± 0.500.806 ± 0.401.15 ± 0.07
DBLR88.76 ± 0.470.753 ± 0.391.45 ± 0.08
WalidacyjneBFEN97.58 ± 0.25*&@0.968 ± 0.27*&@0.86 ± 0.03*&@
PRF81.62 ± 0.320.687 ± 0.501.51 ± 0.06
EAB84.37 ± 0.400.749 ± 0.421.28 ± 0.05
DBLR87.53 ± 0.300.728 ± 0.471.63 ± 0.07

Tabela 1: Porównanie wyników testów MDFE, CRS i SDCT. „*” oznacza istotną różnicę (p < 0,05) pomiędzy wynikami BFEN a PRF. „“&”” oznacza, że różnica między wynikami BFEN a EAB była istotna (p < 0,05). „@” oznacza, że różnica między wynikami BFEN a DBLR jest istotna (p < 0,05)

Tabela 1 wskazuje, że BFEN osiągnął wartość MDFE na poziomie 98,42% w zbiorze treningowym, co jest wynikiem o 14,57% wyższym niż 83,85% dla PRF, wartość CRS wynoszącą 0,975, co jest wynikiem o 0,222 wyższym niż 0,753 dla DBLR, oraz wartość SDCT wynoszącą 0,78 s, co jest wynikiem o 0,67 s niższym niż 1,45 s dla DBLR. W zbiorze walidacyjnym BFEN utrzymał wyższą wydajność, osiągając odpowiednio MDFE, CRS i SDCT na poziomie 97,58%, 0,968 oraz 0,86 s, przewyższając tym samym algorytmy porównawcze. Ogólnie rzecz biorąc, wyniki potwierdziły wyższą kompleksową wydajność BFEN w kalibracji oceny dydaktycznej.

Walidacja wydajności modelu kalibracji oceny nauczania GFBFEN
W oparciu o walidację wydajności BFEN, w badaniu dalej oceniono wydajność modelu kalibracji oceny nauczania GFBFEN zbudowanego na bazie BFEN i porównano go z modelami kalibracji stworzonymi przy użyciu algorytmów PRF, EAB oraz DBLR. Aby zapewnić spójne warunki testowe i porównywalność, jako zestaw treningowy wykorzystano zbiór danych z raportu z globalnego monitorowania edukacji, natomiast jako zestaw walidacyjny posłużył zbiór danych dotyczących wyników akademickich studentów. Cztery modele skalibrowały 500 rekordów oceny nauczania, a następnie obliczono dla nich wartości CAE i CRE. Wyniki przedstawiono na Rysunku 11.

figure-results-4
Rysunek 11: Porównanie wyników testów CAE i CRE. (A) Wyniki testów CAE. (B) Wyniki testów CRE. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

Jak pokazano na Rysunku 11A, GFBFEN osiągnął początkowo wartość CAE wynoszącą 0,1279. W miarę postępu kalibracji wartość CAE spadła do 0,0641 i ustabilizowała się po 104 rekordach. Modele porównawcze charakteryzowały się wyższą początkową i końcową wartością CAE niż GFBFEN, przy czym model EAB wykazał najwyższą początkową i końcową wartość CAE, wynoszącą odpowiednio 0,1858 i 0,1217. Rysunek 11B wskazał, że początkowa i końcowa wartość CRE modelu GFBFEN podczas zadania kalibracji pozostały niższe niż w modelach porównawczych, osiągając wartości odpowiednio 0,1137 i 0,0912. Wyniki te wykazały, że GFBFEN wykazał silną zdolność dopasowania, korzystając z mechanizmu uwagi GAT, który konstruował grafy korelacji semantycznej między cechami, zwiększał wyrównanie semantyczne danych oceniających z wielu źródeł i redukował nieefektywną kalibrację spowodowaną błędem cech. Następnie w badaniu oceniono CAR dla danych oceny uczniów, danych oceny nauczycieli, danych oceny szkoły oraz danych oceny online, oznaczonych odpowiednio jako I, II, III i IV. Wyniki przedstawiono na Rysunku 12.

figure-results-5
Rycina 12: Porównanie wyników CAR dla różnych zestawów danych ewaluacyjnych. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Jak pokazano na Rysunku 12A, GFBFEN osiągnął CAR na poziomie 99,34%, 98,93%, 99,01% i 99,12% dla danych oceniających uczniów, nauczycieli, szkoły i ocen online w zbiorze treningowym. W zbiorze walidacyjnym wartości CAR wynosiły odpowiednio 97,89%, 98,56%, 97,57% i 98,46%. Rysunek 12B–D wykazał, że modele porównawcze miały niższe wartości CAR zarówno w zbiorach treningowych, jak i walidacyjnych. Wśród nich model EAB wypadł najgorzej w zbiorze walidacyjnym, osiągając CAR wynoszący 76,31% dla danych nauczycieli i 78,29% dla danych online. Wyniki te potwierdziły, że GFBFEN znacząco przewyższył modele porównawcze. Następnie w ramach badania przetestowano TL w zadaniu kalibracji oceny nauczania, aby ocenić zdolność dopasowania oraz stabilność treningu. Wyniki przedstawiono na Rysunku 13.

figure-results-6
Rycina 13: Wyniki testów zdolności dopasowania modelu oraz stabilności treningu. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Jak pokazano na Rysunku 13A, GFBFEN miał początkowo wartość TL wynoszącą 0,1021 w zbiorze treningowym. Po 67 iteracjach TL spadło do 0,0725 i ustabilizowało się. W zbiorze walidacyjnym TL spadło z 0,1237 do 0,1018. Rysunek 13B–D wykazał, że końcowa wartość TL dla PRF w zbiorze treningowym wyniosła 0,0824, końcowe TL dla EAB w zbiorze walidacyjnym wyniosło 0,1178, a TL dla DBLR w obu zbiorach było niestabilne i znacznie wyższe niż w przypadku innych modeli. Wyniki te wykazały, że GFBFEN charakteryzuje się silną zdolnością dopasowania i stabilnością treningu, co jest zasługą transferu wiedzy opartego na KD, który pozwolił modelowi szybko nauczyć się efektywnych cech, przyspieszyć zbieżność funkcji straty i zapewnić generalizację w różnych zbiorach danych. Aby kompleksowo zweryfikować podstawową wydajność GFBFEN, w badaniu przetestowano EFCA, HDPE, FCP i CSCC dla czterech modeli. Wyniki przedstawiono na Rysunku 14.

figure-results-7
Rysunek 14: Kompleksowe wyniki testów wskaźnikowych dla zadań oceny i korekty nauczania. (A) wyniki testu GFBFEN. (B) wyniki testu PRF. (C) wyniki testu EAB. (D) wyniki testu DBLR. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Jak pokazano na Rysunku 14A–D, model GFBFEN osiągnął wartości EFCA wynoszące odpowiednio 99,35% i 98,76% w zbiorach treningowym i walidacyjnym. Wartości EFCA dla modelu PRF wyniosły odpowiednio 88,53% i 87,04%. W zbiorze walidacyjnym wartość EFCA modelu GFBFEN była o 6,59% wyższa niż w modelu EAB (92,17%) oraz o 11,72% wyższa niż w modelu DBLR (87,04%). Ponadto wskaźniki HDPE, FCP i CSCC również wykazują wyraźną przewagę: w zbiorze walidacyjnym HDPE modelu GFBFEN wyniosło 98,05%, FCP osiągnęło 97,93%, a CSCC wyniosło 0,968, co w każdym przypadku przewyższało wyniki modeli PRF, EAB i DBLR. Ogólnie rzecz biorąc, wyniki te potwierdziły wyższość ogólnej wydajności modelu GFBFEN, wykazując, że skoordynowana optymalizacja GAT-KD, AM-LSTM i BFEN skutecznie poprawiła dokładność, wydajność i sprawiedliwość kalibracji w ocenie nauczania.

W ramach badań stopniowo skonstruowano modele FairEduNet, BFEN, FBFEN oraz GFBFEN, przy czym końcowy model GFBFEN obejmuje takie komponenty jak FairEduNet, BERT-RL, AM-LSTM oraz GAT-KD. Aby zweryfikować niezależny wkład poszczególnych elementów, przeprowadzono eksperymenty ablacyjne, polegające na stopniowym usuwaniu każdego komponentu i ocenie jego wpływu na ogólną wydajność. Wskaźniki porównawcze obejmowały ECA, FDR, SAR oraz FMD. Wyniki wykazały, że dla samego komponentu FairEduNet wartość ECA wyniosła 87,32%, FDR 12,45%, SAR 89,67%, a FMD 11,89%. W przypadku kompletnego modelu GFBFEN wartość ECA osiągnęła 99,21%, FDR spadł dalej do 1,93%, SAR pozostał stabilny na poziomie 99,45%, a FMD został zoptymalizowany do 7,28%. Po usunięciu BERT-RL wskaźnik ECA spadł do 91,04%, wartość FDR wyniosła 6,23%, wartość SAR 92,33%, a FMD wzrósł do 7,85%. Ablacja AM-LSTM spowodowała zwiększenie fluktuacji SAR o 14,2%. Usunięcie GAT-KD doprowadziło do wzrostu FMD do 8,36%, co dowodzi, że jego mechanizm tłumienia propagacji błędu struktury grafu, sterowany poprzez destylację wiedzy, był znacząco skuteczny w łagodzeniu ukrytego błędu asocjacyjnego między populacjami.

Aby dodatkowo przetestować metody badawcze, w badaniu wprowadzono uznane wskaźniki standardów sprawiedliwości, a mianowicie Fairness Correction Benchmark (FCB), który obejmuje trzy typy sztywnych ograniczeń powszechnie uznawanych w scenariuszach edukacyjnych: (1) wartość bezwzględna różnicy średnich między grupami po korekcie wynosi ≤ 1,2 punktu (w oparciu o system procentowy); (2) stopień pokrycia skorygowanych przedziałów ufności dla każdej podgrupy atrybutów wrażliwych wynosi ≥ 95%; (3) w każdym pojedynczym scenariuszu wspólny obszar dopuszczalny FDR i SAR musi spełniać ograniczenie frontu Pareto (oznacza to, że nie można poprawić SAR bez pogorszenia FDR i na odwrót). W ocenie eksperymentalnej model GFBFEN porównano z głównymi modelami bazowymi, takimi jak EAB, PRF, DBLR oraz GBDT. Eksperyment przeprowadzono na 421 rzeczywistych danych oceniających zebranych z autentycznych scenariuszy nauczania, obejmujących trzy typowe scenariusze edukacyjne: ocenianie klasowe, ewaluację praktyczną oraz testowanie online. Wyniki przedstawiono w Tabeli 2.

AlgorytmWartość bezwzględna różnicy średnich wynikówWskaźnik nakładania się przedziałów ufności (%)Wskaźnik spełnienia wspólnego obszaru dopuszczalnego (%)Wynik kompleksowy
GFBFEN0.8798.310097.2
EBA1.5298.482.678.5
PRF1.6885.174.371.2
DBLR1.4587.979.875.6
GBDT1.3391.286.479.9

Tabela 2: Wyniki oceny wskaźników kryteriów sprawiedliwości oraz weryfikacja praktycznego zastosowania.

Jak pokazano w Tabeli 2, model GFBFEN osiągnął pełną zgodność ze wszystkimi czterema sztywnymi ograniczeniami FCB niezależnie, a jego wynik całkowity znacząco przewyższył pozostałe modele bazowe o 18,7 punktu, co potwierdza odporność proponowanego wieloetapowego paradygmatu korekcji kolaboratywnej. W szczególności, w kluczowym wskaźniku odzwierciedlającym zdolność do kompromisu między sprawiedliwością a efektywnością, wskaźnik pokrycia wspólnego obszaru dopuszczalnego osiągnął 100%, co wskazuje, że model posiada możliwości podejmowania decyzji optymalnych w sensie Pareto, które można wdrożyć w rzeczywistych scenariuszach edukacyjnych.

Sprawiedliwość w ocenie nauczania odnosi się do wykorzystania weryfikowalnych ograniczeń ilościowych jako punktu odniesienia, przy jednoczesnym poszanowaniu indywidualnych różnic oraz przepisów prawa oświatowego. Logika obliczeń i ustalanie progów wskaźników sprawiedliwości opierają się na teoretycznych ramach sprawiedliwości edukacyjnej oraz standardach weryfikacji danych empirycznych. Zostały one wspólnie przeanalizowane przez komitet ekspercki składający się z pięciu naukowców, aby zapewnić wysoki stopień spójności między rygorem teoretycznym a adaptacyjnością do praktyki edukacyjnej. Aby dodatkowo potwierdzić adaptacyjność modelu w ramach różnych standardów sprawiedliwości, w badaniu przeprowadzono dalszą walidację według wielu standardów. W szczególności do weryfikacji wybrano trzy standardy sprawiedliwości. Standard 1 to równowaga wskaźnika akceptacji między grupami w oparciu o Demographic Parity. Standard 2 to spójność międzygrupowa wskaźnika prawdziwie dodatnich i wskaźnika fałszywie dodatnich w oparciu o Equalized Odds. Standard 3 opiera się na Predictive Parity w celu kontrolowania błędów międzygrupowych w dokładności przewidywań. Stwierdzono, że GFBFEN konsekwentnie spełniał rygorystyczne wymagania ograniczeń we wszystkich trzech standardach. Odchylenie wskaźnika akceptacji grup w standardzie 1 wynosiło ≤1,2%, różnica międzygrupowa wskaźnika prawdziwie/fałszywie dodatnich w standardzie 2 wynosiła ≤0,85%, a odchylenie międzygrupowe dokładności przewidywań w standardzie 3 zostało utrzymane w granicach ±±0,6%. W przeciwieństwie do tego, inne modele wykazały przekroczenie ograniczeń o ≥3,7% w co najmniej jednym kryterium, co potwierdza kompatybilność uogólniającą GFBFEN dla wielowariantowych paradygmatów sprawiedliwości.

Dostępność danych:
Aby zapewnić wiarygodność danych, w badaniu wykorzystano zbiór danych Global Education Monitoring Report (https://www.education-progress.org/) oraz zbiór danych dotyczący wyników w nauce uczniów szkół średnich w Hiszpanii (https://archive.ics.uci.edu/dataset/320/student+performance). Zbiory treningowy i walidacyjny zostały podzielone chronologicznie z obu zestawów danych. W badaniu wykorzystano dane z września 2024 r. jako zbiór treningowy oraz dane od października 2024 r. do czerwca 2025 r. jako zbiór walidacyjny, co jest zgodne z czasowym przebiegiem ocen edukacyjnych.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Algorytm BFEN zaproponowany w niniejszym badaniu wykazał lepszą wydajność w eksperymentach porównawczych. Z perspektywy ECA i FDR znacznie przewyższał algorytmy PRF, EAB i DBLR. Podczas kalibacji 421 zapisów oceniających, BFEN zwiększył ECA do 98,75% i utrzymywał stabilność, podczas gdy FDR spadł do 2,87%. Ta wydajność wynikała z integracji BERT-RL do optymalizacji funkcji i dynamicznej adaptacji. BERT precyzyjnie wyodrębniał głębokie informacje o uprzedzeniach semantycznych z niesformatowanych tekstów oceniających, a RL dynamicznie dostosowywał progi uczciwości i parametry kalibracji za pomocą wielokrotnej funkcji nagrody, eliminując wpływ wrażliwych atrybutów na wyniki. Jest to podobne do pracy przeprowadzonej przez Valencia-Londoño i wsp., którzy za pomocą algorytmów sztucznej inteligencji zbudowali model inkluzji edukacyjnej dla dorosłych z różnymi zaburzeniami neuromuskularnymi. Chociaż zbudowany model inkluzji edukacyjnej został zweryfikowany pod kątem wykonalności w określonych grupach chorób neuromuskularnych, jego ograniczenia uczciwości obejmowały tylko jedną wymiar (równa reprezentacja grup diagnostycznych) i nie zostało ustanowione sztywne systemu ograniczeń na poziomie wielu grup i wielu celów27. W testach przeprowadzanych w różnych scenariuszach nauczania, BFEN osiągnął SAR 99,01% dla ocen klasowych i FMD 97,81% dla ocen praktycznych, co jest znacznie wyższe niż w modelach porównawczych. Ta zaleta wynikała z iteracyjnego uczenia się GBDT wzorców błędów w danych oceniających w wieloscenariuszowych danych, w połączeniu z biblioteką standardów uczciwości edukacji inteligentnej w celu dopasowania docelowych parametrów kalibracji, co skutecznie zmniejszyło efekt kalibracji i brak równowagi uczciwości spowodowany różnicami scenariuszy. W porównaniu z adaptacyjnym i interpretowalnym systemem oceny uczciwej sztucznej inteligencji zaproponowanym przez Kumar i wsp., który obejmuje pętle opinii ekspertów i moduły weryfikacji uczciwości międzyjęzykowej, choć wprowadza te funkcje, nie jest w stanie skutecznie modelować łańcuchów ukrytych uprzedzeń w tekstach oceniających w dziedzinie oceny edukacyjnej, która ma wysoką gęstość semantyczną i silną zależność od kontekstu28. To badanie jest głębiej zintegrowane pod względem sztywnego gwarantowania ograniczeń uczciwości i głębokiego skojarzenia modelowania semantycznego edukacji w porównaniu z literaturą28.

W praktycznych zadaniach inteligentnej oceny edukacyjnej, model GFBFEN zbudowany na podstawie BFEN wykazał również znaczne zalety. Dla 500 zapisów kalibracji, GFBFEN osiągnął końcowe CAE 0,0641 i CRE 0,0912. Jego CAR dla wielu typów danych oceniających przekroczył 97% zarówno w zestawach treningowych, jak i walidacyjnych. Ta wydajność wynikała z optymalizacji korelacji funkcji GAT-KD i przetwarzania lekkiego. GAT zbudował graficzne korelacje semantyczne między funkcjami w celu zmniejszenia wieloźródłowego błędu funkcji, podczas gdy transfer wiedzy KD zwiększył efektywność wnioskowania bez pogorszenia dokładności modelu, unikając opóźnień kalibracji spowodowanych złożonością modelu. W porównaniu z badaniami przeprowadzonymi przez Deho i wsp. nad wpływem dryfu zestawu danych na uczciwość modeli analizy uczenia, choć ich badanie koncentrowało się na mechanizmie wpływu dryfu danych na uczciwość, strategie korekcji opierały się na statycznym ponownym wagowaniu i kompensacji po fakcie, brakując zdolności do dynamicznego postrzegania i reagowania na rzeczywiste odchylenia semantyczne. Trudno było radzić sobie z ewolucją ukrytych uprzedzeń w ocenie edukacyjnej spowodowaną subiektywnymi wypowiedziami nauczycieli i różnicami w stylach językowych uczniów. Jednak to badanie, poprzez model GFBFEN, skutecznie postrzega i reaguje dynamicznie na semantyczne odchylenia w semantykach oceny, wychwytując ukryte tendencje wartościowe w komentarzach nauczycieli, odchylenia stylu językowego w tekstach odpowiedzi uczniów oraz dryf semantyczny w wyrażeniach oceniających między klasami/przedmiotami, osiągając przemianę paradygmatu od "statycznej kompensacji" do "dynamicznej kalibracji"29. W testach metryk rdzeniowych, GFBFEN osiągnął EFCA 99,35% i 98,76% w zestawach treningowych i walidacyjnych odpowiednio oraz FCP 98,52% i 97,93%, co jest znacznie wyższe niż modele porównawcze. Podobnie jak system egzaminów otwartych z automatycznym punktowaniem opartym na sztucznej inteligencji opracowany przez zespół Dimari A, choć osiągnął wysoki stopień spójności w ocenie otwartych odpowiedzi, jego korekta uczciwości opiera się tylko na wstępnie ustawioną wagą wymiarów oceniających i uprzedzonej bibliotece próbek adnotowanej przez ludzi, bez osadzania mechanizmu dynamicznej ewolucji semantycznej edukacji. Ta praca osiągnęła znaczące przełomy w mechanizmie dynamicznej ewolucji korekcji uczciwości i głębokiej modelizacji semantyki edukacji w porównaniu z wynikami badań zespołu Dimari A, szczególnie wykazując silną odporność i interpretowalność w radzeniu sobie z rzeczywistymi wyzwaniami, takimi jak dryf w orientacji wartościowej komentarzy nauczycieli, różnice pokoleniowe w stylach językowych uczniów i

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autor nie ma nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autor deklaruje, że nie ma konfliktu interesów.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Global Education Monitoring Report datasetUNESCOhttps://www.education-progress.org/Zestaw danych
NumPyNumPyhttps://numpy.org/Przechowywanie danych
PandasPandas, NumPyhttps://pandas.pydata.org/Przechowywanie danych
PyCharm Professional 2023.1PyCharm Wersja 2023.1Środowisko programistyczne
Python 3.9Python Wersja 3.9‌Język programowania
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/index.htmlUczenie maszynowe
SeabornSeabornhttps://seaborn.pydata.org/Wizualizacja
Spanish middle school student academic performance datasetUC Irvine Machine Learning Repositoryhttps://archive.ics.uci.edu/dataset/320/student+performanceZestaw danych
TensorFlowTensorFlowhttps://www.tensorflow.org/Uczenie głębokie
Windows 11MicrosoftWersja 11System operacyjny

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

In ynieriaWydanie 233Wydanie 233Warto pustaWydanieInteligentna edukacjaGeneratywna sie przeciwstawnaGradientne wzmacnianie drzew decyzyjnych

Powiązane artykuły