$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
BFEN algoritma performans analizi
Deneylerde değerlendirilen göstergeler şunları içeriyordu:
Değerlendirme düzeltme doğruluğu (ECA), öğretim değerlendirme sonuçlarındaki model tarafından doğru şekilde tanımlanan ve düzeltilen sapma maddelerinin oranını ifade eder; böylece düzeltme mekanizmasının genel etkinliğini yansıtır. Daha yüksek değerler, üstün düzeltme doğruluğunu gösterir.
Adil sapma oranı (FDR), kalibrasyon sürecinde modelin ortadan kaldıramadığı gruplar arası puan farklılıklarının büyüklüğünü ölçür. Bu, her hassas özniteliğin (örneğin, cinsiyet, bölge, etnik köken) skor dağılımındaki standart sapmasının genel standart sapmaya oranı olarak hesaplanır; Daha düşük değerler, gruplar arası varyansların en aza indirildiğini ve daha sağlam bir adalet garantisini ifade eder.
Senaryo uyum oranı (SAR), modelin heterojen öğretim bağlamlarında (örneğin, fenler ve beşeri bilimler, çevrimiçi ve çevrimdışı ortamlar) başarıyla yürüttüğü düzeltme görevlerinin yüzdesini gösterir.
Adalet koruma derecesi (FMD), düzeltmeden sonra hassas özellik grupları arasındaki adalet göstergelerinin varyansının düzeltmeden önce gözlemlenenle oranı bir eksi olarak tanımlanır ve sistemin kalibrasyon sürecinde yapısal adaletini koruma yeteneğini yansıtır.
Disipliner özellik tanıma oranı (DFRR), her disiplinin değerlendirme verilerinde temel özelliklerin doğru şekilde tanımlandığı örnek oranını toplam değerlendirme örneklem büyüklüğüne göre hesaplar ve modelin alana özgü varyasyonları ayırt etme ve yakalama kapasitesini gösterir.
Çok kaynaklı veri füzyon verimliliği (MDFE), çok kaynaklı heterojen değerlendirme verilerinin birleştirilmesiyle modelin özellik hizalaması, ağırlık tahsisi ve sapma düzeltmesi sırasında verimliliğini ifade eder. Bu kapsamlı metrik, saniyede işlenen değerlendirme örneklerinin sayısı (örnek/saniye) ile düzeltme tutarlılığı uyum oranının (%>95 güven seviyesinde) çarpımı olarak tanımlanır; burada daha yüksek değerler daha verimli ve stabil bir füzyon boru hattını gösterir.
Düzeltme sonucu kararlılığı (CRS), birden fazla bağımsız çalışma arasında kalibrasyon çıktılarının tutarlılığını gösterir; bu, her bir girişin düzeltme çıktıları arasındaki Öklid mesafesinin standart sapmasının tersi ile nicelendirilir. Daha yüksek değerler, sistem güvenilirliğinin arttığını gösterir.
Tek veri düzeltme süresi (SDCT), modelin tek bir değerlendirme örneğinin kalibrasyonunu tamamlamak için tükettiği ortalama hesaplama gecikmesini temsil eder; bu süreç milisaniye (ms) cinsinden ölçülür; Daha düşük değerler daha güçlü bir gerçek zamanlı yanıt yeteneğini gösterir.
Düzeltilmiş mutlak hata (CAE), kalibre edilmiş tahminler ile temel doğruluk değerleri arasındaki ortalama mutlak hatayı ölçür ve modelin orijinal kalibrasyon edilmemiş verilere göre kalıntı sapmasını temsil eder. Daha düşük değerler, kalibre edilmiş çıktıların gerçek performans seviyelerine daha yakın olduğunu gösterir.
Düzeltilmiş göreli hata (CRE), kalibre edilmiş tahminler ile temel doğruluğun yüzdesi olarak ifade edilen temel gerçeklik değerleri arasındaki ortalama mutlak hatayı nicelikle nicelleştirir; düşük değerler ise daha yüksek göreli kalibrasyon hassasiyetini gösterir.
Düzeltme doğruluk oranı (CAR), kalibrasyon sonrası mutlak hataya sahip örneklerin toplam örnek boyutuna göre 0,5 < oranını temsil eder ve modelin önceden tanımlanmış hassasiyet kısıtlamalarını karşılamadaki güvenilirliğini gösterir. Yüksek değerler, çıktıların ampirik faydasını ve güvenilirliğini doğrular.
Toplam kayıp değeri (TL), görev tamamlandığında bireysel alt kayıp terimlerinin ağırlıklı toplamından elde edilen kapsamlı optimizasyon hedef değerini temsil eder. Özellikle, yedi metrik—DFRR, MDFE, CRS, SDCT, CAE, CRE ve CAR—Z-puanı normalizasyonu ile standartlaştırılır ve değerlendirme görevlerinin operasyonel önceliğine göre ağırlıklandırılır. Ağırlık vektörü [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1] verildiğinde, bu yedi normalleştirilmiş gösterge değeri nihai kayıp hesaplamak için toplanır.
Değerlendirme özellik kümeleme doğruluğu (EFCA), model tarafından üretilen denetimsiz kümeleme konfigürasyonları ile alan uzmanları tarafından doğrulanan yeraltı gerçeklik kategorileri arasındaki hizalanma derecesini değerlendirir.
Yüksek boyutlu veri işleme verimliliği (HDPE), ≥50 değerlendirme özelliği içeren yüksek boyutlu seyrek vektörlerle işlem yaparken birim zaman başına özellik boyutluluk azaltma ve sapma düzeltmesine maruz kalan örnek sayısını ölçür. Örneklem/saniye ile ölçülen daha yüksek değerler, karmaşık ve büyük ölçekli değerlendirme girdilerini gerçek zamanlı olarak işleme konusunda daha sağlam bir yeteneğe sahip olduğunu gösterir.
Adalet düzeltme hassasiyeti (FCP), farklı öğrenci grupları arasında kalibrasyon etkilerinin tekdüzeliğini değerlendirir. Bu metrik, hassas öznitelik alt grupları boyunca düzeltilmiş mutlak hatalar için Kolmogorov-Smirnov mesafesinin dağılımı ortalaması hesaplanarak nicelendirilir; Daha düşük değerler, daha dengeli bir gruplar arası performans ve daha güçlü bir adalet garantisi anlamına gelir.
Sahne çapraz düzeltme tutarlılığı (CSCC), kalibrasyon sonuçlarının dağılım ofsetini üç tipik senaryoda—yani sınıf değerlendirmesi, pratik değerlendirme ve çevrimiçi test—Wasserstein mesafe oranı olarak modellenerek niceliklerini sunar.
Önerilen BFEN öğretim değerlendirme kalibrasyon algoritmasının performansını doğrulamak için, çalışma, bunu PRF algoritması ile karşılaştırdı; bu algoritma ana bileşen analizi (PCA) ve rastgele orman (RF) birleştirdi; aşırı öğrenme makinesi (ELM) ve uyarlanabilir güçlendirmeyi (AdaBoost) birleştiren EAB algoritması; ve derin inanç ağı (DBN) ile lojistik regresyonu (LR) birleştiren DBLR algoritması. Deneyler, Intel Core i9-13900HX işlemci ve NVIDIA RTX 4080 GPU ile donatılmış bir sistemde çalıştı; yüksek paralel hesaplama kapasitesi ve büyük video belleği sağlayarak büyük ölçekli öğretim değerlendirme verileri için özellik çıkarma ve kalibrasyon hesaplamalarını verimli bir şekilde tamamladı. İşletim sistemi Windows 11'di ve programlama için Python 3.9 kullanılıyordu. Algoritmalar Scikit-learn kütüphanesi kullanılarak uygulandı, derin öğrenme modülleri TensorFlow çerçevesi üzerinden geliştirildi ve veri ön işleme için Pandas ve NumPy kütüphaneleri kullanıldı. Geliştirme ortamı PyCharm Professional 2023.1 kullandı ve algoritma performansının sezgisel karşılaştırmasını kolaylaştırmak için kalibrasyon sonuçlarının görselleştirilmesi için Seaborn uygulandı. Verilerin güvenilirliğini sağlamak için çalışma, Küresel Eğitim İzleme Raporuveri seti 1 ve İspanyol ortaokul öğrenci akademik performans veriseti 2'yi kullandı. Veri seti, üniversite öğretim öğretim değerlendirmeleri, öğrenci akademik performansı, öğrenci öğretim değerlendirmeleri ve ders geri bildirimi gibi çoklu modlu öğretim değerlendirme verilerini kapsayan 12.486 kayıt içerir; sınıf etkileşim sıklığı, ödev geri bildirimi zamanlılığı, puanlama tutarlılığı, dil kapsayıcılığı ve kültürlerarası duyarlılık gibi 137 öğretim boyutu özelliğini kapsar. Hedef değişken, bu çalışmada uzmanlar tarafından kalibre edilmiş çok boyutlu ağırlıklı bileşik değere eşlenen öğretim değerlendirme puanıdır. Araştırma, öğrenci öğretim değerlendirmeleri, akran değerlendirmeleri, denetleyici sınıf gözlemleri ve dersin dosyesi incelemeleri olmak üzere dört tür bilgi kaynağını entegre eder; ağırlıkları sırasıyla 0.35, 0.25, 0.25 ve 0.15'tir. Eğitim ve doğrulama setleri, iki veri setinden kronolojik sırayla ayrılır. Çalışma, eğitim seti olarak Eylül 2024 verilerini, eğitim değerlendirmelerinin zamansal ilerleyişiyle uyumlu olmak için Ekim 2024'ten Haziran 2025'e kadar olan verileri doğrulama seti olarak kullanmaktadır. Ön işleme aşamasında, modalite-spesifik bir strateji kullanılır; yapılandırılmış özellikler Z-skor normalizasyonu ile standartlaştırılır ve dışnamalar Winsorize edilirken, metin özellikleri BERT-base-chinese modeli kullanılarak kodlanır ve 768 boyuta indirgenmiştir. Karşıt eğitim, örtük önyargılı ifadelere karşı dayanıklılığı artırmak ve kültürel arka plan farklılıklarından kaynaklanan anlamsal sapmayı azaltmak için uygulanır.
Alanlararası eğitim ve doğrulama araştırmalarını sağlamak için model, sıfır veya az örnek doğrulama için dört heterojen öğretim senaryosuna aktarılacak: K-12 temel eğitimi, mesleki eğitim, sürekli eğitim ve uluslararası Çin eğitimi. Bu dört senaryoda, çalışma, algoritma eğitimi sırasında farklı öğretim senaryolarında modelin özellik dağılımının tutarlılığını sınırlamak için alan uyarlanabilir düzenleme terimleri tanıtmaktadır. K-12 senaryolarında kısa cümle gürültüsü için hafif bir sözdizimine duyarlı maske mekanizmasının gömülmesi; Mesleki eğitimde mesleki terminolojinin belirsizliğini gidermek için, müfredat taslağı bilgi grafiğiyle entegre edilen dinamik bir alan sözlüğü oluşturulur ve entegre edilir. Sürekli eğitimde nesiller arası anlamsal boşluğu ele almak için bir yaş grubu karşılaştırma öğrenme modülü tasarlayın; farklı yaş gruplarının değerlendirme ifadeleri için anlamsal çapları örtük alanda hizalandırın. Uluslararası Çin eğitiminde kültürel yük ifadesini ele almak için, kelimesi kelime dışı eğitim kavramlarını anlamanın sağlamlığını artırmak için ince ayar için diller arası karşılaştırma önerileri kullanılır. Orijinal değerlendirme kayıtlarında yapılandırılmış alanların uzman kalibrasyonu ve güvenilirlik testi üzerine araştırma, Krippendorff alfa katsayısı 0.75'in altında düşük güvenilirlikli girişlerin kaldırılmasıdır. Öğrenci değerlendirme metinlerinde çift kör manuel notasyon uygulandı; 3 eğitim ölçüm uzmanı bağımsız olarak sapma tipi etiketlemeyi tamamladı ve Cohen'in k = 0.86 tutarlılığını elde etti. Son olarak, açıklamalı sonuçlar denetim kayıtları ve öğretim dosyası inceleme sonuçlarıyla çapraz doğrulanarak nihai kalibrasyon etiketleri oluşturuldu.
Seçilen veri setleri farklı popülasyonlardan, ölçüm sistemlerinden ve eğitim geçmişlerinden oluştu. Bu alanlararası doğrulama paradigması, modelin sağlamlığını ve genelleme sınırlarını özgün bir eğitim ekosistemi içinde titizlikle test etti ve veri homojenleşmesinden kaynaklanan değerlendirme illüzyonlarını önledi. Her iki depoda da önemli miktarda öğretim değerlendirme kaydı bulunuyordu ve adaletin farkında akıllı eğitim algoritmalarının uygulanması için doğrudan referans değeri sunuyordu. Her iki veri seti de önemli öğretim değerlendirme verileri içermekteydi; bu veriler, adaletin farkında akıllı eğitim algoritmalarının tasarımı ve öğretim değerlendirme kalibrasyonu için doğrudan referans değerleri sağlıyordu. Çalışma, dört algoritma ile 1000 öğretim değerlendirme kaydını kalibre etti ve onların ECA ile Fairness FDR'sini hesapladı. Sonuçlar Şekil 8'de gösterilmiştir.

Şekil 8: ECA ile FDR arasındaki test sonuçlarının karşılaştırılması. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 8A'da gösterildiği üzere, BFEN değerlendirme kalibrasyon görevinde başlangıçta %82,47 ECA ve %5,71 FDR elde etmiştir. Kalibre edilmiş kayıtların sayısı arttıkça, ECA %98,75'e yükseldi ve 421 kaydı kalibre ettikten sonra istikrar sağladı, FDR ise %2,87'ye düştü ve 514 kaydı kalibre ettikten sonra istikrar sağladı. Şekil 8B'de gösterildiği gibi, PRF algoritmasının ECA eğrisi kademeli olarak arttı, FDR çizgisi ise yavaş yavaş azaldı. Kalibrasyon görevinin sonunda ECA değeri %92,30, PDR değeri ise %6,72 idi. Şekil 8C, EAB algoritmasının ECA eğrisinin düzleşmeden önce hızla yükseldiğini, FDR yörüngesinin ise yakınsamadan önce şiddetli erken evre dalgalanmaları gösterdiğini, ECA'nın %84,64 ve FDR'nin %8,93 olduğunu göstermektedir. Şekil 8D'de belirtildiği üzere, DBLR algoritması, FDR hattında marjinal dalgalanmalar ve sınırlı sıkıştırma ile birlikte yavaş yukarı yönlü ECA yörüngesi göstererek, kalibrasyon görevini %83,51 ECA ve FDR %8,42 ile tamamladı. Bu deneysel bulgular, BFEN algoritmasının hem değerlendirme düzeltme doğruluğu hem de adalet yanlılığı kontrolünde temel yaklaşımları önemli ölçüde geride bıraktığını doğrulamaktadır. Bu üstün genelleme yeteneği, BFEN içinde BERT'in entegrasyonuna bağlanır; BFEN, yapılandırılmamış değerlendirme metninden derin anlamsal özellikler çıkararak gizli önyargı ifadelerini yakalarken, RL modülü ise çok amaçlı ödül fonksiyonu aracılığıyla adalet eşiklerini ve düzeltme parametrelerini dinamik olarak optimize ederek hassas özellikleri nihai çıktılardan ayırır. Çalışma, SAR ve FMD'yi sınıf değerlendirmesi, final sınavları, pratik değerlendirme ve çevrimiçi değerlendirme için test etti ve dört senaryoyu A, B, C ve D olarak etiketledi. Sonuçlar Şekil 9'da gösterilmiştir.

Şekil 9: SAR ve FMD'nin karşılaştırılması farklı senaryolarda sonuç vermektedir. (A) SAR testi sonuçları. (B) FMD test sonuçları. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 9A'da gösterildiği gibi, BFEN tüm öğretim senaryolarında %98'in üzerinde SAR elde etmiş ve sınıf testlerinde en yüksek SAR %99,01 olmuştur. Farklı senaryolarda karşılaştırma algoritmasının SAR'ı, BFEN algoritmasından daha düşüktür; DBLR algoritması, nihai değerlendirme senaryosu için tüm algoritmalar arasında en düşük SAR'a sahip olup, %70,23'tür bir SAR'a sahiptir. Şekil 9B'de gösterildiği gibi, BFEN algoritmasının FMD'si farklı öğretim senaryolarında karşılaştırma algoritmasından hâlâ önemli ölçüde daha yüksektir; farklı senaryolarda FMD'ler sırasıyla %98,47, %98,05, %97,81 ve %97,94'dir. DBLR kıyaslama algoritmasının FMD'leri sırasıyla %82,36, %71,74, %70,59 ve %69,12'dir. EAB algoritmasının FMD'leri sırasıyla %80,79, %68,21, %67,65 ve %66,03'tür; PRF algoritmasının FMD'leri ise sırasıyla %86,42, %82,17, %80,98 ve %78,33'dür. Bu sonuçlar, BFEN'in GBDT'nin çoklu karar ağacı ile yinelemeli öğrenmesi sayesinde karşılaştırma algoritmalarını geride bıraktığını gösterdi; bu öğrenme, senaryolar arasında hata kalıplarını doğru yakalayabiliyor ve kararlı, adil kalibrasyon sonuçları sağladı. Çalışma, Çin, Matematik ve İngilizce için dört algoritmayı kullanarak disipliner özellik tanıma oranını (DFRR) daha da değerlendirdi. Sonuçlar Şekil 10'da gösterilmiştir.

Şekil 10: Farklı disiplinlerdeki DFRR test sonuçlarının karşılaştırılması. (A) Eğitim seti. (B) Doğrulama seti. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 10A'da gösterildiği gibi, BFEN eğitim setinde Çin, Matematik ve İngilizce için %99,23, %98,94 ve %99,13 DFRR elde etmiştir. Şekil 10B, BFEN'in doğrulama setinde diğer algoritmalara kıyasla daha yüksek DFRR elde ettiğini göstermiştir. Özellikle, BFEN'in Çin için DFRR'si %98,41'e ulaştı; bu, DBLR'nin %87,61'inden %10,8 daha yüksekti; Matematik için %97,54, PRF'nin %88,47'sinden %9,07; İngilizce için ise %98,13, EAB'nin %84,79'unun %13,34'ü daha yüksekti. Bu sonuçlar, BFEN'in BERT'in anlamsal farklılıkları derinlemesine yakalamasını GBDT'nin hata kalıplarını kişiselleştirilmiş öğrenme yöntemiyle birleştirerek disipliner değerlendirme kalibrasyonuna verimli bir şekilde uyum sağladığını doğruladı. BFEN performansını kapsamlı değerlendirmek için çalışma, dört algoritma için MDFE, CRS ve SDCT'yi değerlendirdi. Sonuçlar Tablo 1'de sunulmaktadır.
| Veri seti | Algoritma | MDFE (%) | CRS | SDCT (lar) |
| Eğitim | BFEN | 98.42 ± 0.28*&@ | 0.975 ± 0.28*&@ | 0.78 ± 0.04*&@ |
| PRF | 83.85 ± 0.41 | 0.779 ± 0.36 | 1.32 ± 0.08 |
| EAB | 85.91 ± 0.50 | 0.806 ± 0.40 | 1.15 ± 0.07 |
| DBLR | 88.76 ± 0.47 | 0.753 ± 0.39 | 1.45 ± 0.08 |
| Doğrulama | BFEN | 97.58 ± 0.25*&@ | 0.968 ± 0.27*&@ | 0.86 ± 0.03*&@ |
| PRF | 81.62 ± 0.32 | 0.687 ± 0.50 | 1.51 ± 0.06 |
| EAB | 84.37 ± 0.40 | 0.749 ± 0.42 | 1.28 ± 0.05 |
| DBLR | 87.53 ± 0.30 | 0.728 ± 0.47 | 1.63 ± 0.07 |
Tablo 1: MDFE, CRS ve SDCT test sonuçlarının karşılaştırılması. "*" BFEN ile PRF sonuçları arasında önemli bir farkı (p < 0.05) gösterir. "&" BFEN ile EAB sonuçları arasındaki farkın anlamlı olduğunu gösterir (p < 0.05). "@" BFEN ve DBLR sonuçları arasındaki farkın anlamlı olduğunu gösterir (p < 0.05)
Tablo 1 , BFEN'in eğitim setinde %98,42 MDFE elde ettiğini, bu PRF'nin 83,85'inden %14,57 yüksek, CRS'nin 0,975, DBLR'nin 0,753'ünden 0,222 yüksek ve SDCT'nin 0,78 s, yani DBLR'nin 1,45 saniyesinden 0,67 saniye daha az olduğunu göstermektedir. Doğrulama setinde BFEN, MDFE, CRS ve SDCT ile sırasıyla %97,58, 0,968 ve 0,86 saniye ile karşılaştırma algoritmalarını geride bırakarak üstün performans sergiledi. Genel olarak, sonuçlar BFEN'in değerlendirme kalibrasyonu öğretimindeki üstün kapsamlı performansını doğruladı.
GFBFEN öğretim değerlendirmesi kalibrasyon modeli performans doğrulaması
BFEN performans doğrulamasına dayanarak, çalışma BFEN üzerine inşa edilen GFBFEN öğretim değerlendirme kalibrasyon modelinin performansını daha da değerlendirdi ve PRF, EAB ve DBLR algoritmaları kullanılarak oluşturulan kalibrasyon modelleriyle karşılaştırdı. Tutarlı test koşulları ve karşılaştırılabilirliği sağlamak için, küresel eğitim izleme raporu veri seti eğitim seti olarak hizmet verirken, üniversite öğrencisi akademik performans veri seti doğrulama seti olarak hizmet vermiştir. Dört model, 500 öğretim değerlendirme kaydını kalibre etti ve CAE ile CRE'leri hesaplandı. Sonuçlar Şekil 11'de gösterilmiştir.

Şekil 11: CAE ve CRE test sonuçlarının karşılaştırılması. (A) CAE test sonuçları. (B) CRE testi sonuçları. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 11A'da gösterildiği gibi, GFBFEN başlangıçta 0.1279 CAE elde etmiştir. Kalibrasyon ilerledikçe, CAE 0.0641'e düştü ve 104 kayıt sonrası stabil oldu. Karşılaştırma modelleri GFBFEN'den daha yüksek başlangıç ve nihai CAE'ye sahipti; EAB ise sırasıyla 0.1858 ve 0.1217 ile en yüksek başlangıç ve nihai CAE'ye sahipti. Şekil 11B, kalibrasyon görevi sırasında GFBFEN'in ilk ve nihai CRE'sinin karşılaştırma modellerinden daha düşük kaldığını, sırasıyla 0.1137 ve 0.0912 değerleriyle gösterdiğini göstermiştir. Bu sonuçlar, GFBFEN'in güçlü uyum yeteneği sergilediğini, özellikler arasında anlamsal korelasyon grafikleri oluşturan GAT'ın dikkat mekanizmasından faydalandığını, çok kaynaklı değerlendirme verilerinin anlamsal hizalanmasını artırdığını ve özellik yanlılığından kaynaklanan etkisiz kalibrasyonu azalttığını gösterdi. Çalışma, ardından CAR'ı öğrenci değerlendirme verileri, öğretmen değerlendirme verileri, okul değerlendirme verileri ve I, II, III ve IV olarak etiketlenen çevrimiçi değerlendirme verileri açısından değerlendirdi. Sonuçlar Şekil 12'de gösterilmiştir.

Şekil 12: Farklı değerlendirme verilerinin CAR sonuçlarının karşılaştırılması. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 12A'da gösterildiği üzere, GFBFEN eğitim setinde öğrenci, öğretmen, okul ve çevrimiçi değerlendirme verilerinde %99,34, %98,93, %99,01 ve %99,12 CAR elde etmiştir. Doğrulama setinde CAR değerleri sırasıyla %97,89, %98,56, %97,57 ve %98,46 idi. Şekil 12B–D, karşılaştırma modellerinin hem eğitim hem de doğrulama setlerinde daha düşük CAR değerine sahip olduğunu göstermiştir. Bunlar arasında, EAB doğrulama setinde en kötü performans gösteren oldu; öğretmen verisi için CAR %76,31, çevrimiçi veriler için ise %78,29 oldu. Bu sonuçlar, GFBFEN'in karşılaştırma modellerinden önemli ölçüde daha iyi performans gösterdiğini doğruladı. Sonrasında, TL'yi öğretim değerlendirme kalibrasyon görevinde test ederek uyum yeteneği ve eğitim kararlılığını değerlendirdi. Sonuçlar Şekil 13'te gösterilmiştir.

Şekil 13: Model uyum yeteneği ve eğitim stabilitesi testi sonuçları. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 13A'da gösterildiği gibi, GFBFEN başlangıçta eğitim setinde 0.1021 TL'ye sahipti. 67 iterasyondan sonra TL 0.0725'e düştü ve stabilize oldu. Doğrulama setinde, TL 0.1237'den 0.1018'e düştü. Şekil 13B–D, PRF'nin eğitim setindeki son TL'sinin 0.0824, EAB'nin doğrulama setindeki son TL'sinin 0.1178 olduğunu ve DBLR'nin her iki sette TL'sinin kararsız ve diğer modellere göre önemli ölçüde daha yüksek olduğunu göstermiştir. Bu sonuçlar, GFBFEN'in güçlü uyum yeteneği ve eğitim kararlılığı sergilediğini, KD tabanlı bilgi transferinden faydalandığını gösterdi; bu da modelin etkili özellikleri hızlıca öğrenmesini, kayıp yakınmasını hızlandırmasını ve veri setleri arasında genelleştirmeyi sağlamasını sağladı. GFBFEN'in çekirdek performansını kapsamlı bir şekilde doğrulamak için çalışma, dört model için EFCA, HDPE, FCP ve CSCC'yi test etti. Sonuçlar Şekil 14'te gösterilmiştir.

Şekil 14: Öğretim değerlendirme ve düzeltme görevlerinin kapsamlı gösterge test sonuçları. (A) GFBFEN test sonuçları. (B) PRF test sonuçları. (C) EAB test sonuçları. (D) DBLR test sonuçları. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 14A–D'de gösterildiği gibi, GFBFEN modeli eğitim ve doğrulama setlerinde sırasıyla %99,35 ve %98,76 EFCA değerlerine sahiptir. PRF modelinin EFCA'sı sırasıyla %88,53 ve %87,04'tür. Doğrulama setinde, GFBFEN modelinin EFCA'sı EAB modelinden %6,59 daha yüksekti (%92,17), DBLR modelinden %11,72 daha yüksekti (%87,04). Ayrıca, HDPE, FCP ve CSCC göstergeleri de kapsamlı şekilde öndedir: doğrulama setinde GFBFEN modelinin HDPE'si %98,05'e, FCP'ye %97,93'e ulaştı ve CSCC %0,968'e ulaştı; bunların hepsi PRF, EAB ve DBLR modellerinden daha iyi performans gösterdi. Genel olarak, bu sonuçlar GFBFEN'in üstün kapsamlı performansını doğruladı ve modelin GAT-KD,-LSTM ve BFEN'in koordineli optimizasyonunun, kalibrasyon doğruluğunu, verimliliğini ve öğretim değerlendirmesinde adaleti etkili bir şekilde artırdığını gösterdi.
Araştırma zamanla FairEduNet, BFEN, FBFEN ve GFBFEN'i oluşturdu ve nihai GFBFEN FairEduNet, BERT-RL,-LSTM ve GAT-KD gibi bileşenleri içeriyordu. Bireysel bileşenlerin bağımsız katkısını doğrulamak için, araştırma ve tasarım ablasyon deneyleri yapılır; her bileşen kademeli olarak çıkarılır ve genel performans üzerindeki etkisi değerlendirilir. Karşılaştırmalı göstergeler arasında ECA, FDR, SAR ve FMD bulunur. Sonuçlar, FairEduNet bileşeninin ECA değerinin sadece %87,32, FDR'nin %12,45, SAR'ın %89,67 ve FMD'nin %11,89 olduğunu gösterdi. Tam GFBFEN modelinin ECA'sı %99,21'e ulaştı, FDR %1,93'e düştü, SAR %99,45'te stabil kaldı ve FMD %7,28'e optimize edildi. BERT-RL kaldırıldıktan sonra ECA %91,04'e düştü, FDR değeri %6,23, SAR değeri %92,33 ve FMD %7,85'e yükseldi. -LSTM'nin ablasyonu, SAR dalgalanmalarını %14,2 artırdı. GAT-KD'nin kaldırılması, FMD'nin %8,36'ya yükselmesine yol açtı ve bilgi damıtılması ile yönlendirilen grafik yapısı yanlımlığının yayılmasını bastırma mekanizması, popülasyonlar arasındaki örtük ilişki yanlılığını azaltmada önemli ölçüde etkili oldu.
Araştırma yöntemlerini daha da test etmek için, çalışma, eğitim senaryolarında yaygın olarak bilinen üç tür katı kısıtlamayı kapsayan Adalet Düzeltme Kıyıtı (FCB) gibi yerleşik adalet standart göstergelerini tanıttı: (1) Gruplar arasında düzeltme sonrası ortalama farkın mutlak değeri yüzde sistemine göre ≤ 1,2 puandır; (2) Her hassas özellik alt grubu için düzeltilmiş güven aralıklarının örtüşme oranı %95 ≥; (3) Herhangi bir tek senaryoda, FDR ve SAR'ın ortak uygulanabilir bölgesi Pareto sınır kısıtlamasını karşılamalıdır (yani, FDR bozulmadan SAR'ı iyileştirmek imkansızdır ve tam tersi). GFBFEN modeli, deneysel değerlendirmede EAB, PRF, DBLR ve GBDT gibi ana akım temel modellerle karşılaştırıldı. Deney, gerçek öğretim senaryolarından toplanan 421 gerçek değerlendirme verisi üzerinde gerçekleştirildi ve üç tipik eğitim senaryosunu kapsıyordu: sınıf değerlendirmesi, pratik değerlendirme ve çevrimiçi test. Sonuçlar Tablo 2'de gösterilmiştir.
| Algoritma | Ortalama puan farkının mutlak değeri | Güven aralığı örtüşme oranı (%) | Ortak uygulanabilir bölge memnuniyet oranı (%) | Kapsamlı puan |
| GFBFEN | 0.87 | 98.3 | 100 | 97.2 |
| EBA | 1.52 | 98.4 | 82.6 | 78.5 |
| PRF | 1.68 | 85.1 | 74.3 | 71.2 |
| DBLR | 1.45 | 87.9 | 79.8 | 75.6 |
| GBDT | 1.33 | 91.2 | 86.4 | 79.9 |
Tablo 2: Adalet kriterleri göstergelerinin değerlendirme sonuçları ve pratik uygulama doğrulaması.
Tablo 2'de gösterildiği gibi, GFBFEN dört FCB katı kısıtlamasına bağımsız olarak tam uyum sağladı ve kapsamlı puanı diğer temel modelleri +18,7 puan farkla önemli ölçüde geride bırakarak önerilen çok aşamalı işbirlikçi düzeltme paradigmasının sağlamlığını doğruladı. Özellikle, adalet-verimlilik dengesini yansıtan temel göstergede, ortak uygulanabilir bölge kapsama oranı %100'e ulaştı; bu da modelin gerçek eğitim senaryolarında Pareto-optimal karar alma yeteneklerine sahip olduğunu gösteriyor.
Öğretim değerlendirmesinde adalet, doğrulanabilir nicel kısıtlamaların bir ölçüt olarak kullanılması ve bireysel farklılıklara ve eğitim yasalarına saygı gösterilmesini ifade eder. Eşitlik göstergelerinin hesaplama mantığı ve eşik belirlemesi, eğitim eşitliği teorik çerçevesi ve ampirik veri doğrulama standartlarına dayanır. Teorik titizlik ile eğitim uygulamasına uyum sağlama konusunda yüksek düzeyde birlik sağlamak için beş akademisyenden oluşan bir uzman komitesi tarafından ortaklaşa incelenirler. Modelin farklı adalet standartları altında uyumlanabilirliğini daha da doğrulamak için, çalışma birden fazla standart altında ek doğrulama gerçekleştirdi. Özellikle, doğrulama için üç adalet standardı seçildi. Standart 1, Demografik Parite'ye dayalı gruplar arasındaki kabul oranı dengesidir. Standart 2, Eşit Olasılıklara dayalı gerçek pozitif oran ve yanlış pozitif oranının çapraz grup tutarlılığıdır. Standart 3, tahmin doğruluğunda gruplar arası önyargıyı kontrol etmek için Tahminci Eşitliğe dayanır. GFBFEN'in üç standart altında katı kısıtlama gereksinimlerini tutarlı şekilde karşıladığı bulundu. Standart 1 grup kabul oranı sapması ≤%1,2%, standart 2 doğru/yanlış pozitif oranı gruplar arası fark ≤0,85%, standart 3 tahmin doğruluğu gruplar arası sapma ±±0,6% içinde kontrol edilmektedir. Buna karşılık, diğer modeller en az bir kriter altında %3,7 ≥ kısıtlama atılımı gösterdi ve çok değişkenli adalet paradigmaları için GFBFEN'in genelleştirme uyumluluğunu doğruladı.
VERİ ERIŞILEBILIRLIĞI:
Veri güvenilirliğini sağlamak için çalışma, Küresel Eğitim İzleme Raporu veri seti (https://www.education-progress.org/) ve İspanyol ortaokul öğrenci akademik performans veri seti (https://archive.ics.uci.edu/dataset/320/student+performance) kullandı. Eğitim ve doğrulama setleri, iki veri setinden kronolojik sırayla ayrılır. Çalışma, eğitim seti olarak Eylül 2024'te, doğrulama seti olarak ise Ekim 2024'ten Haziran 2025'e kadar olan verileri kullanarak eğitim değerlendirmelerinin zamansal ilerleyişiyle uyumlu hale gelmektedir.