$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Analiza wydajności algorytmu BFEN
Wskazane wskaźniki oceniane w eksperymentach obejmowały:
Dokładność korekcji oceny (ECA) oznacza proporcję pozytywnie zaklasyfikowanych elementów odchylających się, poprawnie zidentyfikowanych i skorygowanych przez model w wynikach oceny nauczania, odzwierciedlając w ten sposób ogólną skuteczność mechanizmu korekcji. Wyższe wartości wskazują na lepszą dokładność korekcji.
Wskaźnik odchylenia uczciwości (FDR) mierzy wielkość różnic punktacji między grupami, które model nie eliminuje podczas procesu kalibracji. Jest obliczany jako stosunek odchylenia standardowego każdego wrażliwego atrybutu (np. płeć, region, pochodzenie etniczne) wewnątrz dystrybucji wyników do ogólnego odchylenia standardowego; niższe wartości sugerują zminimalizowane różnice między grupami i bardziej solidne zabezpieczenie uczciwości.
Wskaźnik przystosowania do scenariuszy (SAR) wskazuje procent zadań korekcyjnych pomyślnie wykonanych przez model w różnorodnych kontekstach dydaktycznych (np. nauki ścisłe vs. nauki humanistyczne, środowisko online vs. offline).
Stopień utrzymania uczciwości (FMD) jest definiowany jako jeden minus stosunek wariancji wskaźników uczciwości między grupami wrażliwymi po korekcji do tego obserwowanego przed korekcją, odzwierciedlając zdolność systemu do zachowania swojej strukturalnej uczciwości podczas procesu kalibracji.
Wskaźnik rozpoznawania cech dyscyplinarnych (DFRR) oblicza proporcję próbek, w których kluczowe cechy są poprawnie zidentyfikowane w danych oceny każdej dyscypliny względem całkowitej wielkości próbki oceny, demonstrując zdolność modelu do rozróżniania i uchwycenia zmian specyficznych dla danej domeny.
Efektywność fuzji danych z wielu źródeł (MDFE) odnosi się do wydajności przepływowej modelu podczas wyrównywania funkcji, alokacji wag i korekcji odchyleń podczas fuzji heterogenicznych danych oceny. Ta kompleksowa metryka jest definiowana jako iloczyn liczby przetworzonych próbek oceny na sekundę (próbki/sek) oraz stopnia zgodności spójności korekcji (na poziomie pewności >95%), gdzie wyższe wartości oznaczają bardziej wydajny i stabilny przepływ fuzji.
Stałość wyniku korekcji (CRS) wskazuje na spójność wyników kalibracji w wielu niezależnych uruchomieniach, liczona jako odwrotność odchylenia standardowego odległości euklidesowej między wynikami korekcji każdego uruchomienia przy identycznych wejściach. Wyższe wartości oznaczają lepszą niezawodność systemu.
Średni czas korekcji pojedynczej danej (SDCT) reprezentuje średnią opóźnienie obliczeniowe zużyte przez model na dokończenie kalibracji pojedynczej próbki oceny, mierzone w milisekundach (ms); niższe wartości wskazują na silniejszą zdolność reakcji w czasie rzeczywistym.
Poprawiona bezwzględna błąd (CAE) mierzy średni bezwzględny błąd pomiędzy skorygowanymi przewidywaniami a wartościami rzeczywistymi, reprezentując resztkowe odchylenie modelu względem oryginalnych nieskorygowanych danych. Niższe wartości sugerują, że poprawione wyjścia są bardziej zgodne z rzeczywistymi poziomem wydajności.
Poprawiona względna błąd (CRE) kwantyfikuje średni bezwzględny błąd pomiędzy skorygowanymi przewidywaniami a wartościami rzeczywistymi wyrażany jako procent wartości rzeczywistej, gdzie niższe wartości wskazują na wyższą względną precyzję kalibracji.
Wskaźnik dokładności korekcji (CAR) reprezentuje proporcję próbek, których absolutny błąd po kalibracji jest mniejszy niż 0,5 względem całkowitej wielkości próbki, demonstrując niezawodność modelu w spełnianiu wstępnie określonych ograniczeń precyzji. Wysokie wartości potwierdzają użyteczność empiryczną i wiarygodność wyników.
Całkowita wartość straty (TL) reprezentuje wartość obiektywnego celu optymalizacji uzyskiwaną z ważonej sumy poszczególnych warunków straty po zakończeniu zadania. Szczególnie, siedem wskaźników – DFRR, MDFE, CRS, SDCT, CAE, CRE i CAR – są standaryzowane za pomocą normalizacji Z i ważone według priorytetu operacyjnego zadań oceny. Przyjmując wektor wag [0,15, 0,12, 0,1, 0,08, 0,13, 0,12, 0,1], te siedem wartości normalizowanych wskaźników jest łącznie obliczanych do uzyskania ostatecznej straty.
Dokładność klastrowania cech oceny (EFCA) ocenia stopień dopasowania między konfiguracjami nienadzorowanych klastrów generowanych przez model a kategoriami rzeczywistymi potwierdzonymi przez ekspertów dziedziny.
Efektywność przetwarzania danych wielowymiarowych (HDPE) mierzy liczbę próbek poddanych redukcji wymiarowości funkcji i korekcji odchyleń na jednostkę czasu podczas przetwarzania wysokowymiarowych rozrzedzonych wektorów zawierających ≤50 funkcji oceny. Miarą jest liczba próbek na sekundę, gdzie wyższe wartości odzwierciedlają bardziej solidną zdolność do przetwarzania złożonych, dużych skalowych wejść oceny w czasie rzeczywistym.
<