Research Article

FairEduNet Algoritma Tasarımı ve Öğretim Değerlendirme Kalibrasyonu Yükseköğretimde Eşitliği Dikkate Alıyor

DOI:

10.3791/70189

July 21st, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Araştırma, akıllı eğitimde öğretim, değerlendirme kalibrasyonu ve eğitimsel eşitlik için yeni bir yaklaşım sunmayı amaçlamaktadır. Deneysel sonuçlar, önerilen modelin karşılaştırmalı modelleri önemli ölçüde geride bıraktığını ve mevcut kalibrasyon yöntemlerinde kötü çok kaynaklı veri entegrasyonu ve adalet yanlılığı sorunlarını etkili bir şekilde ele aldığını göstermektedir.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Mevcut öğretim değerlendirme kalibrasyon yöntemleri, çoklu kaynaklı heterojen değerlendirme verilerini işlerken düşük entegrasyon verimliliği, farklı disiplinler ve öğretim senaryoları arasında yetersiz uyum sağlama ve sonuçlarda zayıf adalet garantileriyle önyargılar gibi zorluklarla karşı karşıyadır. Araştırma, öğretim değerlendirme verilerinin derin modellenmesi ve dinamik düzeltmesi için yorumlanabilir, aktarılabilir ve ölçeklenebilir bir adalet düzeltme çerçevesi oluşturmayı amaçlamaktadır. Bu sorunlar, akıllı eğitimde dengeli öğretimin temel gerekliliğini karşılamayı zorlaştırır. Bu çalışma, üretken bir düşman ağı ile gradyan artırıcı karar ağacını entegre eden adalet odaklı bir eğitim ağı algoritması önermektedir. Algoritma, bir adalet kalibrasyon mekanizması oluşturur ve çift yönlü kodlayıcı temsil modelini grafik dikkat ağı ile birleştirerek özellik çıkarımı ve dinamik uyum sağlar, çok kaynaklı veri işleme verimliliğini ve adalet kalibrasyon doğruluğunu artırır. Bu yaklaşım, öğretim değerlendirmelerinde hassas kalibrasyon ve adalet güvencesi sağlar. İndikator testinde, model doğrulama setinde kümeleme değerlendirme özelliklerinde %98,76, adalet düzeltmesinde %98,05 ve çapraz senaryo düzeltme tutarlılığında %0,968 doğruluk elde etti. Kayıp değeri testi görevinde, doğrulama setindeki öğretim değerlendirme düzeltme görevi sırasında modelin toplam kaybı 0.1237'den 0.1018'e düştü. İndikator testinde, model doğrulama setinde kümeleme değerlendirme özelliklerinde %98,76, adalet düzeltmesinde %98,05 ve çapraz senaryo düzeltme tutarlılığında %0,968 doğruluk elde etti. Deneysel sonuçlar, önerilen modelin karşılaştırmalı modelleri önemli ölçüde geride bıraktığını ve mevcut kalibrasyon yöntemlerinde kötü çok kaynaklı veri entegrasyonu ve adalet yanlılığı sorunlarını etkili bir şekilde ele aldığını göstermektedir. Ayrıca, teknoloji geliştiricileri için yenilikçi algoritmik çerçeveler ve eğitim yöneticileri için öğretim eşitliğini teşvik etmek amacıyla güvenilir teknik araçlar sağlar. Araştırma katkıları şunlardan oluşmaktadır: (i) çoklu kaynaklı veri ön işleme, dinamik adalet indeks doğrulaması ve açıklanabilirlik görselleştirmesi dahil olmak üzere üç temel modülün entegrasyonu; ve (ii) üretken karşıt ağların ve gradyan artırıcı ağaçların işbirlikçi optimizasyonuna dayalı bir adalet düzeltme paradigması önermek; bu paradigma, geleneksel tek model düzeltmenin sınırlamalarını aşarak sapma modellemesi ve düzeltme karar verme süreçlerinin ayrılmış öğrenilmesini mümkün kılar.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Öğretim değerlendirmesi ve kalibrasyonu, akıllı eğitimde öğretim kalitesinin sağlanmasının temelini oluşturur. Dinamik analiz, hata düzeltme ve sonuç kalibrasyonu sayesinde, öğretim iyileştirmesi ve kişiselleştirilmiş öğrenme için bir temel sağlarlar. Doğruluk ve adalet, akıllı eğitimin teknolojik önyargıları aşıp dengeli eğitim desteği sağlayıp sağlayamayacağını doğrudanetkiler 1,2. Ancak mevcut yöntemlerin birkaç eksikliği vardır: tek bir veri kaynağına dayanır, gerçek durumu görmezden gelir ve veri yanlılığı ile düzeltme yanlılığına yol açar. Dinamik bir adalet uyum mekanizmasının olmaması, disiplinlerin ve senaryoların adalet ihtiyaçlarını karşılamayızorlaştırır 3,4. Ayrıca, birden fazla kaynaktan gelen heterojen verilerle ilgilenirken adalet göstergelerinin eksikliği ve düzeltme stratejilerinde önyargı gibi sorunlar da vardır. Bu amaçla, akademisyenler tenis destekli öğretimin geliştirilmiş yoğun bir yörünge algoritmasına dayalı değerlendirmesi gibi birçok boyuttanaraştırmalar yürütmüştürler 5. Yin ve ark., analitik hiyerarşi sürecini ve bulanık bir sentez algoritmasını kullanarak çevrimiçi öğretimiizlemiştir 6. Chen, öğretim kalitesini artırmak için geliştirilmiş veri madenciliği algoritması kullanarak yaşlı yetişkinler için eğitim verilerinianaliz etti 7.

Bu çalışmalar ilerleme kaydetmiş olsa da, kalibrasyon sonucu yanlılığı ve kötü adalet koordinasyonu gibi sorunlar hâlâ devam etmektedir. Bu nedenle, aynı anda doğru öğretim değerlendirme kalibrasyonu ve dinamik adalet güvencesi sağlayan bir model oluşturmak, akıllı eğitimde bir araştırma odak noktası haline gelmiştir. Üretken karşıt ağ (GAN), üretici ile ayırıcı arasında gerçek zamanlı düşmanca eğitim yoluyla hassas özelliklerin sonuçlar üzerindeki örtük etkisini ortadan kaldırmak için uyarlanır; böylece çıktılar etikete dayalı önyargı yerine temel faktörlere görebelirlenir 8. GAN, değerlendirme verilerindeki grup önyargılarını yönetmede ve doğrusal olmayan adalet kısıtlamalarını modellemede avantajlar gösterir. Cheng ve ark. düşük çözünürlüklü görüntüleri ele almak için GAN tabanlı bir görüntü geliştirme algoritması önermiştir. Jeneratör, düşük çözünürlüklü girdilerden yüksek çözünürlüklü görüntüler üretirken, ayrımcılayıcı üretilen görüntüleri gerçek yüksek çözünürlüklü görüntülerden ayırt ediyordu. Düşman eğitimi, parametreleri optimize eder ve böylece jeneratör çıktısı gerçekgörüntülere yaklaşır 9. Kang ve ark. yenilenebilir enerji alanlarında çoklu modal veri işleme verimliliğini artırmak için çapraz modal bir GAN modeli önerdi. Üretici tek modal veri alır, ayrımcılayıcı gerçek multimodal veriden üretilen verileri ayırt eder ve düşman eğitimi modeli daha iyi verimlilikiçin optimize eder 10. Gradyan artırma karar ağacı (GBDT) algoritması, güçlü özellik yakalama yeteneğine sahip yapılandırılmış veri işleme için klasik bir algoritmadır. Birden fazla karar ağacını yinelemeli olarak entegre ederek, GBDT veri hata kalıplarını hassas bir şekilde öğrenir ve çok kaynaklı heterojen değerlendirme bilgisini işlemede ve doğrusal olmayan skor sapmalarını düzeltmedeavantajlar gösterir 11,12. Mizuno ve arkadaşları, yoğun yağış afetleri için GBDT tabanlı bir yol tahmin yöntemi önerdi; yol özelliklerini öğrenerek ve felaket yollarını gerçek zamanlı verilerle tahmin etmek, birden fazla karar ağacı aracılığıyla optimal tahminleriseçmek 13. Gao ve ark., reklam tıklama oranı tahmini için GBDT tabanlı görsel analiz yöntemi geliştirmiştir; görsel özellikler ile geçmiş tıklama verileri arasındaki ilişkiyi öğrenerek yeni reklamlar için tıklama oranlarını tahminetmektedir 14. Yukarıdaki zorluklara dayanarak, bu araştırma aşağıdaki temel bilimsel soruyu sistematik olarak yanıtlamayı amaçlıyor: Akıllı bir eğitim değerlendirme modeli, çoklu kaynaklı heterojen verileri verimli bir şekilde entegre edecek, farklı öğretim senaryolarına dinamik olarak uyum sağlayacak ve aynı anda kalibrasyon doğruluğunu ve sonuç adaletini sağlayacak şekilde nasıl oluşturulabilir? Bu soruyu yanıtlamak için, bu çalışma GAN'ın adalet kısıtlama mekanizmasının sinerjik etkisini ve GBDT'nin hassas hata kalibrasyon yeteneğini kullanmaktadır. Ayrıca, doğal dil işleme (BERT), pekiştirme öğrenme (RL), dikkat mekanizmaları (), uzun kısa süreli bellek ağları (LSTM), grafik dikkat ağları (GAT) ve bilgi damıtılması (KD) gibi gelişmiş teknolojilerin nasıl tanıtılabileceği üzerine araştırmalar yapılmaktadır; böylece tek bir modelin özellik çıkarımı, dinamik uyum ve akıl yürütme verimliliği gibi doğal sınırlamalarını telafi etmek için bu konuda araştırmalar yapılmaktadır. Sonuç olarak, amaç, hem hassas hem de adil ve akıllı eğitim alanında güçlü genelleme yeteneklerine sahip bir öğretim değerlendirme kalibrasyon çözümü sağlamaktır.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

FairEduNet algoritma tasarımı ve optimizasyonu
Çalışma, GAN ve GBDT'yi birleştirerek FairEduNet algoritmasını oluşturuyor ve tek yönlü optimizasyonun takas vermesi yerine adalet düzeltmesi ve doğruluk düzeltmesi gibi çift hedefe ulaşıyor. FairEduNet, çift kanallı işbirlikçi mimariyi benimser: GBDT omurga kanalı yapılandırılmış hata modellemesi ve hassas düzeltmeden sorumludurken, GAN yardımcı kanalı hassas özellikleri ayırmaya ve adaleti dinamik olarak ayarlamaya odaklanır. GAN ve GBDT'yi birleştiren FairEduNet algoritma mimarisi, Şekil 1'de gösterilmiştir.

figure-protocol-1
Şekil 1: GAN ve GBDT'yi birleştiren FairEduNet algoritma mimarisi. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 1'de gösterildiği gibi, FairEduNet önce çok kaynaklı değerlendirme verilerini toplar ve ön işler yapar. GBDT, değerlendirme hata desenlerini yinelemeli olarak öğrenmek için birden fazla karar ağacı kullanır, ilk kalibrasyon sonuçlarını çıkarır ve bunları GAN modülüne iletir. GAN, ayrımcıyı ilk kalibrasyon sonuçları ile hassas özellikler arasındaki ilişkiyi öğrenmesi için eğitir, üretici ise kalibrasyon parametrelerini dinamik olarak ayarlar. Birden fazla rakibi eğitim turu ve adalet doğrulaması sayesinde, adalet önyargısı optimize edilir. Son olarak, adalet kalibrasyonu yapılan sonuçlar GBDT modülüne geri aktarılır; modül doğruluk ve adalet için ayarlar yapar ve öğretim değerlendirme kalibrasyon temeli ile rapor çıkarır. GBDT, Denklem (1)'de gösterildiği gibi kalıntıları hesaplar.

figure-protocol-2(1)

Denklem (1)'de, figure-protocol-3 t-yinelemedeki i-inci örneklemin kalıntısını, yi gerçek değeri ve figure-protocol-4 t-1'in önerme değerini temsil eder. GAN karşıt süreci Denklem (2)'de gösterilmiştir.

figure-protocol-5(2)

Denklem (2)'de, x ilk kalibrasyon sonucunu, z hassas özellik özelliklerini, Pverisi(x)  hassas olmayan özelliklerin gerçek dağılımını, Pz(z) hassas özelliklerin dağılımını, D ayrımcıyı ve G üreteç15'i temsil eder. GBDT'nin ilk kalibrasyon çıktısı Denklem (3)'de gösterilmiştir.

figure-protocol-6(3)

Denklem (3)'de, figure-protocol-7 i-ci örneklemin ilk karar ağacı tarafından tahmin edilmesini, K toplam karar ağacı sayısını, γk k-th ağacının ağırlığını ve hk(xi) i için k-th ağacının tahmin çıktısını temsil eder-Örnek. FairEduNet algoritması, öğretim değerlendirme verileri için hassas kalibrasyon ve adalet güvencesi sağlayabilir. Ancak, yapılandırılmamış değerlendirme verilerini işlerken ve dinamik senaryolara uyum sağlarken, FairEduNet yapılandırılmamış özellikler için zayıf özellik çıkarma yeteneği sergilemekte bu da kalibrasyon yanlılığına yol açmaktadır. Ayrıca, FairEduNet'in adalet göstergeleri ve kalibrasyon parametreleri statik olarak ayarlanmıştır; bu da farklı öğretim senaryolarına uyum sağlamasını sınırlar ve genel kalibrasyon kalitesini etkiler. Transformatörlerden (BERT) alınan çiftyönlü kodlayıcı temsilleri ile pekiştirme öğrenme (RL) kombinasyonu, BERT-RL algoritması, yapılandırılmamış metinden derin özellikleri doğru şekilde çıkarabilir ve statik eşikleri manuel olarak belirlemeden senaryo parametrelerini dinamik olarak uyarlayabilir; böylece algoritma çıktılarının senaryolar arasında güvenilirliğini daha da artırır16,17. TF-IDF gibi geleneksel yöntemler kelime sıklığına dayanır ancak derin bağlamsal anlayışa sahip değildir ve farklı senaryolarda "adalet" yönlerini ayırt edemezler. Word2Vec, karmaşık bağlamsal değişikliklere uyum sağlamakta ve dolaylı önyargıyı tanımakta zorlanan statik kelime vektörleri üretir. BERT, çift yönlü bağlamı kodlamak için çok katmanlı öz-dikkat kullanır; hem açık önyargılı terimleri hem de örtük önyargılı mantığı yakalar. Geleneksel yaklaşımlar elle oluşturulmuş önyargılı kelime listeleri gerektirir, öznel deneyime dayanır ve sınırlı senaryoları kapsar. Önceden eğitilmiş model transfer öğrenimi sayesinde, BERT derin anlamsal özellikleri kapsamlı manuel çaba gerektirmeden otomatik olarak öğrenir ve belirsiz önyargıyı tanımada daha güçlü genelleme sunar. Ayrıca, geleneksel yöntemler uzun metinlerle genellikle bilgi kaybederken, BERT 512 token'a kadar destekler; bağlamsal ilişkileri korur, önyargı özelliklerini doğru konumlandırır ve ince taneli adalet düzeltmesini sağlar. BERT-RL'nin çalışma süreci Şekil 2'de gösterilmiştir.

figure-protocol-8
Şekil 2: BERT-RL algoritma işlem akış şeması. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 2'de gösterildiği gibi, BERT-RL önce yapılandırılmamış metin değerlendirme verilerini standartlaştırır ve bunu BERT modeline girer. BERT, çift yönlü anlamsal modelleme için bir Transformer kodlayıcı kullanır; temel özellikleri çıkarır ve bir özellik matrisi oluşturur. Özellik matrisi daha sonra RL modülüne girilir; modül birden fazla yinelemeyle optimal stratejiyi öğrenir. Optimize edilmiş parametre yapılandırması nihayet FairEduNet'e aktarılır ve uyum sağlar. BERT öz-dikkat özellik ağırlık hesaplaması Denklem (4)'te gösterilmiştir.

figure-protocol-9(4)

Denklem (4)'te, dk vektör K'nin boyutunu temsil eder. RL çok amaçlı ödül fonksiyonu, Denklem (5)'te ifade edilir.

figure-protocol-10(5)

Denklem (5)'te, ω1, ω2 ve ω3 ağırlık katsayılarını temsil eder, figure-protocol-11 kalibrasyon hatasını temsil eder, Dt adalet sapmasıdır, Dhedefi hedef adalet sapmasıdır ve Tt çalışmasüresi 18'dir. Bu çalışma, BERT-RL ile FairEduNet birleştirerek BFEN olarak adlandırılan BERT-RL-FairEduNet algoritmasını oluşturmaktadır. BFEN, GBDT özellik yinelemesi ve GAN gerçek zamanlı rakip eğitimi sayesinde öğretim değerlendirme verilerinin hassas kalibrasyonu ve adalet güvencesini sağlarken, BERT-RL FairEduNet'i yapılandırılmamış verileri işlemede ve senaryolara dinamik uyum sağlamada optimize eder; özellik çıkarma ve statik parametre sınırlamalarındaki zayıflıkları giderir. Çalışma, BERT-tabanlı-Çin modelini kullandı ve 2024-2025 akademik yılı için Ulusal Akıllı Eğitim Platformu'ndan gerçek öğretim günlükleri, sınıf kayıtlı metinler ve eğitim politikası belgelerini önceden eğitti; kelime dağarcığı büyüklüğü 21128'dir. Modelin gizli katman boyutu 768, 12 dikkat başlığı ve 12 katman içerir. GBDT ağacının derinliği 8 olarak ayarlanmış, ağaç sayısı 200 ve öğrenme oranı 0,1 olmuştur. GAN'ın eğitim döngüsü 150 mermidir ve ayrımcı, 512, 256 ve 1 boyutlarında tam bağlantılı 3 katmanlı bir ağ kullanır. Jeneratör, 1024, 512, 256 ve 1 boyutlarında 4 katmanlı, tam bağlantılı bir ağ kullanır. LSTM'deki gizli birim sayısı 128 ve dizis uzunluğu 512'dir. GAT'ın 2 katmanı ve 4 dikkat başlığı var. Bilgi damıtılması için sıcaklık 3.0 olarak ayarlanmıştır. RL ödül ağırlık katsayıları ω1 = 0.4, ω2 = 0.35 ve ω3 = 0.25. Ağırlık seçimi kriterleri, çok amaçlı optimizasyonun Pareto ön dengesini eğitim eşitliği uygulamalarının yorumlanabilirlik gereksinimleriyle dengelemektir. Deneyler, çapraz doğrulama ve hiperparametre ayarlama yoluyla %50 veri bölünmesiyle tamamlandı. Değerlendirme kalibrasyonu öğretmek için BFEN süreci Şekil 3'te gösterilmiştir.

figure-protocol-12
Şekil 3: Akıllı eğitim ve öğretim değerlendirmesi için BFEN algoritmasının düzeltme süreci. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 3'te gösterildiği gibi, BFEN önce çok kaynaklı öğretim değerlendirme verilerini ön işler. BERT, FairEduNet'in özellik çıkarma yeteneğini, bir anlamsal pencereye dayalı metin anlamsal benzerliği ve derin özellik ağırlıklarını hesaplayarak ve önemli özellikleri seçerek yüksek boyutlu anlamsal özellik matrisi oluşturarak optimize eder. RL daha sonra çok amaçlı bir ödül fonksiyonu belirler ve senaryo uyumlanabilirliği ile parametre ayarlama gradyanlarını hesaplayarak adalet eşiklerini ve kalibrasyon parametrelerini daha da optimize eder. FairEduNet, değerlendirme verileri ile hata deseni modelleri arasındaki sapmaları hesaplar, karar ağacı ağırlıklarını yinelemeli olarak günler ve hatalar önceden belirlenmiş eşikler içinde stabil olana kadar kalibrasyon stratejilerini ayarlar. Son çıktı, hata kalibrasyon modeli ve adalet doğrulama raporunu içerir. Kalibrasyon modeli, öğretim değerlendirme verilerine uygulanır; kalibrasyon öncesi ve sonrası karşılaştırma tabloları oluşturulur; bu tablolar, akıllı eğitim adalet standartı kütüphanesiyle birleştirilerek hedef kalibrasyon parametrelerini belirler; böylece akıllı eğitimde değerlendirme kalibrasyonu öğretim için bilimsel bir temel oluşturur. Bu standart kütüphane, eğitim fırsatı adaleti ve süreç adaleti ve sonuç adaleti olmak üzere üç boyutu kapsar ve 12 temel göstergeyi içerir. Bu göstergeler arasında bölgeler arasındaki eğitim kaynakları tahsisi dengesi, kentsel ve kırsal okullar arasındaki dijital altyapı kapsamındaki fark, öğrenme durumu teşhisine gecikmeli yanıt için tolerans eşiği (≤200 ms), çoklu modal değerlendirmede eksik verilere tolerans (≤3,5%), algoritma yanlılığı tespitinin hassasiyeti (cinsiyet/bölge/aşama etiketleme için AUC sapması ≤ 0,02) yer alır. düzeltme öncesi ve sonrası puan dağılımı için KL ayrışma eşiği (≤0.08), öğretmen müdahale önerilerinin yorumlanabilirlik puanı (≥4.2/5.0), öğrenci profili güncellemelerinin zamanında gerçekleşmesi (T + 1 gün içinde tamamlandı), platformlar arası kredi tanıma tutarlılık katsayısı (≥0.93), eğitim politikası anlamsal uyumunun doğruluğu (BERT puanı ≥ 0.86) ve adalet doğrulama raporu üretiminin tamlığı (önyargı attıfı dahil, güven aralıkları ve tekrarlanabilir parametre anlık görüntüleri) ile birlikte dinamik senaryo uyarlama doğrulama geçiş oranını da kapsıyor: canlı sınıf, asenkron ödevler ve yapay zeka öğretim asistanları. Anlamsal özellik benzerliği hesaplaması Denklem (6)'da gösterilmiştir.

figure-protocol-13(6)

Denklem (6)'da, fi  i. anlamsal özellik boyutunun değerini, gi i. önemli değerlendirme özellik boyutunun değerini, n ise toplam özellik boyutlarının sayısını temsil eder. RL senaryo uyarlama parametre hesaplaması Denklem (7)'de gösterilmiştir.

figure-protocol-14(7)

Denklem (7)'de, θt t-yinelenmesindeki parametre değerini, α öğrenme hızını ve figure-protocol-15 ödül fonksiyonu R(θt)'ye dayalı parametre gradyanını temsil eder.

Öğretim değerlendirme kalibrasyon modeli inşası
BFEN, değerlendirme kalibrasyonu öğretmesinde bazı avantajlar gösterse de, çok kaynaklı heterojen değerlendirme verileri için düşük entegrasyon verimliliği ve pratik uygulamalarda yetersiz dinamik adalet uyumu ile karşı karşıyadır. -LSTM algoritması, Dikkat Mekanizması () ve Uzun Kısa Süreli Hafıza (LSTM) birimlerini birleştirir, üzerinden çoklu kaynaklı değerlendirme verilerinin temel özelliklerine ağırlıklar atar ve LSTM'nin ardışık bellek yeteneğini kullanarak değerlendirme verilerinin zaman içindeki dinamik değişim kalıplarını yakalar. Bu yaklaşım, çok kaynaklı veri entegrasyonu verimliliğini ve dinamik özellik öğrenimini etkilibir şekilde artırır 19,20. -LSTM'nin çalışma süreci Şekil 4'te gösterilmiştir.

figure-protocol-16
Şekil 4:-LSTM operasyon akış şeması. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 4'te gösterildiği gibi,-LSTM önce çok kaynaklı heterojen öğretim değerlendirme verilerini önceden işleyerek standartlaştırılmış bir veri seti oluşturur. , önemli özellikleri seçmek için farklı veri kaynaklarından özellikler için dikkat ağırlıklarını hesaplar ve ağırlıklı bir özellik matrisi oluşturur. Ağırlıklı özellik matrisi daha sonra LSTM'ye girilir; LSTM, geçiş mekanizmasını kullanarak zaman içinde dinamik kalıpları öğrenir, farklı aşamalarda değerlendirme verileri arasındaki ilişkileri yakalar ve dinamik özellik vektörleri çıkarır. Son olarak, bu dinamik özellik vektörleri, adalet kısıtlamalarıyla birleştirilerek çoklu kaynaklı veri entegrasyonu ve dinamik senaryolara uyum sağlayan ara kalibrasyon sonuçları elde edilir ve sonraki model optimizasyonu için bir temel oluşturur. Dikkat ağırlık hesaplaması Denklem (8)'de gösterilmiştir.

figure-protocol-17(8)

Denklem (8)'de, n  n. özelliğin dikkat tahsisini, xn benzerliği, q sorgu vektörünü ve softmax aktivasyon fonksiyonunu temsil eder. LSTM unut kapısı Denklem (9)'da ifade edilir.

figure-protocol-18(9)

Denklem (9)'da, Wf unut kapı ağırlığı, bf unut kapı önyargısı, xt  t zamanındaki giriş, ht-1 zamanındaki harici durum değişkeni ve σ sigmoidfonksiyonu 21'i temsil eder. Bu çalışma,-LSTM ile BFEN'i birleştirerek-LSTM-BFEN öğretim değerlendirme kalibrasyon modeli olan FBFEN'i oluşturmaktadır. Bu modelde-LSTM, BFEN'in çok kaynaklı heterojen veri entegrasyonu verimliliği ve dinamik özellik çıkarma konusundaki sınırlamalarını ele alır. Ayrıca, orta kalibrasyon sonuçlarını optimize etmek için adalet kısıtlamalarını entegre eder ve BFEN'in öğretim değerlendirme verileri için hassas kalibrasyon ve dinamik adalet güvencesini daha da sağlamasını sağlar. FBFEN'in çalışma süreci Şekil 5'te gösterilmiştir.

figure-protocol-19
Şekil 5: FBFEN öğretim değerlendirme ve düzeltme modelinin çalışma süreci. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 5'te gösterildiği gibi, FBFEN önce orijinal çok kaynaklı öğretim değerlendirme verilerini ön işler ve standartlaştırılmış veri setini-LSTM modülüne girer. özellik ağırlıklarını hesaplarken, LSTM dinamik kalıpları öğrenerek çoklu kaynak bilgisi ve dinamik özellikleri entegre eden ara kalibrasyon sonuçları çıkarır. Ara sonuçlar daha sonra BFEN modülüne girilir. GBDT, ara sonuçlar ve ön ayarlanmış hata modeline dayalı olarak değerlendirme verilerindeki hata kalıplarını yinelemeli olarak öğrenir ve ön kalibrasyon sonuçlarını ortaya çıkarır. Bu arada, GAN, ön sonuçlarda hassas özelliklerden kaynaklanan adalet yanlılığını üretici ile ayrımcı arasında rakip eğitim yoluyla analiz eder ve kalibrasyon parametrelerini dinamik olarak ayarlayarak önyargıyı ortadan kaldırır. Son olarak, GAN optimize edilmiş kalibrasyon parametreleri GBDT'ye geri aktarılır ve karar ağacı ağırlıkları ile kalibrasyon stratejileri güncellenir ve hassasiyet ile adaleti dengeleyen ikincil bir kalibrasyon sonucu üretir. Veri standartlaştırması, Denklem (10)'da ifade edilir.

figure-protocol-20(10)

Denklem (10)'da z' standartlaştırılmış değeri, z orijinal değeri, zminimum ve zmax minimum ve maksimum değerleri temsil eder. GAN üretecinin nihai amaç fonksiyonu, Denklem (11)'de ifade edilir.

figure-protocol-21(11)

Denklem (11)'de, N yineleme sayısını, λ kayıp ağırlık faktörünü, ωi i-ci yinelemenin ağırlık faktörünü, figure-protocol-22 rakip kayıp fonksiyonunu ve figure-protocol-23 ikili çapraz entropikaybı 22'yi temsil eder.

FBFEN öğretim değerlendirme kalibrasyon modeli optimizasyonu
FBFEN, öğretim değerlendirme kalibrasyonunda güçlü çok kaynaklı veri entegrasyonu ve dinamik adalet güvencesi gösterse de, karmaşık eğitim senaryolarındaki karmaşık model yapısı nedeniyle zayıf özellik korelasyonu ve düşük eğitim ve çıkarım verimliliği ile karşı karşıyadır. Grafik Dikkat Ağı (GAT) ve Bilgi Damıtılması (KD) ile Bilgi Damıtılması (KD) birleşen GAT-KD algoritması, GAT'ın dikkat mekanizması aracılığıyla özellikler arasında anlamsal bir ilişkilendirme grafiği dinamik olarak inşa eder ve çok kaynaklı verilerin anlamsal hizalanmasını artırır. KD, karmaşık modelin bilgisini hafif bir ağa sıkıştırarak çıkarım verimliliğini önemli ölçüde artırırken model performansını23,24 korur. GAT-KD'nin çalışma süreci Şekil 6'da gösterilmiştir.

figure-protocol-24
Şekil 6: GAT-KD operasyon akış şeması. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 6'da gösterildiği gibi, GAT-KD GAT modülü aracılığıyla özellikler arasında anlamsal bir ilişkilendirme grafiği oluşturur, dikkat mekanizması kullanarak komşuluk özellik bilgilerini dinamik olarak toplar ve yerel özelliklerin anlamsal temsilini geliştirir. KD daha sonra çıkış yumuşak etiketlerini denetim sinyali olarak kullanır, çıktı dağılımları arasındaki divergens kaybını ve tahminleri ile gerçek etiketler arasındaki çapraz entropi kaybını en aza indirir, böylece bilgi transferi ve model sıkıştırmasını sağlar. Son çıktı, yüksek hassasiyet ve verimlilikle hafif bir kalibrasyon modelidir. GAT dikkat katsayısı hesaplaması Denklem (12)'de gösterilmiştir.

figure-protocol-25(12)

Denklem (12) figure-protocol-26 'de ve figure-protocol-27 i ile j düğümlerinin özellik vektörlerini temsil eder, W öğrenilebilir ağırlık matrisini, a dikkat ağırlık vektörünü, figure-protocol-28 birleştirme işlemini temsil eder ve LeakyReLU aktivasyonfonksiyonu 25'i temsil eder. KD kayıp fonksiyonu hesaplaması Denklem (13)'te gösterilmiştir.

figure-protocol-29(13)

Denklem (13)'de, KL divergens kaybını, T2 gradyan ölçekleme dengesini, pöğrenci hafif model için yumuşak etiket olasılığını ve pöğretmeni karmaşık model26'nın yumuşak etiket olasılığını temsil eder. Dikkat artırılmış özellik ilişkilendirmesi ve hafif bilgi transferini birleştirerek, GAT-KD özellik anlamsalını ve yüksek hesaplama karmaşıklığını etkili bir şekilde ele alır. Bu çalışma, GAT-KD'yi FBFEN'e entegre ederek GFBFEN olarak adlandırılan GAT-KD-FBFEN öğretim değerlendirme kalibrasyon modelini oluşturur. GAT-KD, FBFEN'in eksik çok kaynaklı özellik korelasyon yakalama ve düşük çıkarım verimliliği konusundaki eksikliklerini optimize eder. GFBFEN'in çalışma süreci Şekil 7'de gösterilmiştir.

figure-protocol-30
Şekil 7: GFBFEN öğretim değerlendirme ve düzeltme modeli işlem süreci. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 7'de gösterildiği gibi, GFBFEN çok kaynaklı öğretim değerlendirme verilerini standartlaştırır. GAT, özellikler arasındaki karmaşık ilişkileri modeller ve dikkat mekanizmaları kullanarak düğümler arasındaki anlamsal ilişki ağırlıklarını dinamik olarak hesaplar. KD, karmaşık modelin bilgisini hafif bir ağa sıkıştırarak çıkarım verimliliğini önemli ölçüde artırırken hassasiyeti korur. -LSTM modülü, çoklu kaynaklı özelliklere önem ağırlıkları atar ve değerlendirme verilerinin zamansal dinamik desenlerini yakalar, çoklu kaynaklı bilgiyi entegre eden ara kalibrasyon sonuçları çıkarır. Bu sonuçlar, derin işleme için BFEN modülüne girilir. Özellikle, BERT yapılandırılmamış metinden anlamsal özellikleri çıkarır, RL adalet eşiklerini ve kalibrasyon parametrelerini dinamik olarak optimize eder, GBDT ön kalibrasyon için hata kalıplarını yinelemeli olarak öğrenir ve GAN, karşı eğitim yoluyla hassas özelliklerden kaynaklanan önyargıları ortadan kaldırır. Dinamik parametre ayarlama mekanizması, her modülün yanıt hassasiyeti ve adalet ağırlıklarını otomatik olarak kalibre eder; öğretim sahnesinin zamansal değişikliklerini ve grup dağılımındaki değişimleri gerçek zamanlı algılarak, böylece statik parametre yapılandırmasından kaynaklanan yetersiz uyum sağlama sorununu çözer ve modelin farklı öğretim aşamalarında sağlamlık ve adaleti koruyabilmesini sağlar. öğrenci grupları ve değerlendirme senaryoları. Değerlendirme türü, zaman serisi modellemenin granülerliği ve geri bildirim döngüsünü doğrudan etkilerken, biçimlendirici değerlendirme sürecin dinamik doğasını vurgular. Disiplinlerdeki farklılıklar, BERT ve GBDT modülleri arasındaki özelliklerin dağılımı belirler. Bu nedenle, dinamik bir uyum mekanizmasının benimsenmesi, farklı değerlendirme türlerine ve disipliner özelliklere etkili şekilde uyum sağlayabilir. Son olarak, birden fazla parametre geri bildirimi ve yinelemeli optimizasyon turları yoluyla model, kesin ve adil öğretim değerlendirme kalibrasyon sonuçları üretir. Dinamik adalet kısıtlama optimizasyon fonksiyonu, Denklem (14)'te ifade edilir.

figure-protocol-31(14)

Denklem (14)'te S, hassas özellikler kümesini, figure-protocol-32 tahmin edilen çıktı kalibrasyon sonucunu, figure-protocol-33 gruplar içindeki tahminlerin varyansını, γ gruplar arası parametreleri ve figure-protocol-34 genel beklenen değeri temsil eder. Çok kaynaklı özellik füzyon ağırlıklarının uyarlanabilir hesaplaması Denklem (15)'te gösterilmiştir.

figure-protocol-35(15)

Denklem (15)'te, wk k-th veri kaynağının özellik ağırlığını, β ağırlık parametresini, Sim özellik benzerliği ölçüm fonksiyonunu, fk  k-th veri kaynağından çıkarılan özellik vektörünü, fglobal küresel özellik merkezini, K ise toplam veri kaynakları sayısını temsil eder. Çalışma, cinsiyet, etnik köken, bölge, aile ekonomik durumu ve ana dil geçmişi gibi hassas özelliklerin ağırlıklarını belirledi. Ağırlıklar, korelasyon analizi sonuçlarına dayanarak belirlenir. Çalışma, Pearson korelasyon katsayısı ve Spearman sıralama korelasyon katsayısını ortak değerlendirme için çift gösterge olarak kullandı ve ağırlık kalibrasyonu eğitimi alanında uzman deneyimiyle birleştirildi. Her hassas özellik için ağırlıkların nihai belirlenmesi, cinsiyet için 0,18, etnik köken için 0,22, bölge için 0,25, aile ekonomik durumu için 0,19 ve ana dil kökeni için 0,16 değerleri verdi. Cinsiyet: Yasal kayıt ve kendini tanımlama başına cinsiyet kimliği, ikili (erkek/kadın) ve non-binary seçeneklerle; veri alanı "cinsiyet". Etnik köken: 56 grubun ulusal etnik kimliğine dayanır, tanımlanamayan ve sınır ötesi gruplarla uyumludur; veri alanı "etnik köken". Bölge: Hane kaydının veya uzun süreli ikametgahın idari bölümü, il, belediye ve ilçe düzeylerini kapsayan, kentsel-kırsal çift yapı ve göçmen nüfusu dikkate alır; veri alanı "bölge". Aile ekonomik durumu: Ulusal istatistiksel standartlar ve eğitim yardımı göstergelerine göre, beş seviyeli bir sınıflandırma kullanılarak; veri alanı "economic_status". Ana dil geçmişi: Temel eğitim sırasında temel öğretim ve aile iletişimi dili, Mandarin, azınlık dilleri, lehçeler ve yabancı dilleri kapsa, edinim yaşı ve sıklığına göre ağırlıklandırılmıştır; veri alanı "mother_tongue."

Düzeltme süreci üç aşamalı dinamik ağırlıklandırma mekanizmasını benimsedi. İlk aşama, hassas özelliklerin ağırlık matrisine dayalı ilk sapma tanımlamasını uyguladı ve cinsiyet, etnik köken ve bölge gibi boyutlarda küresel özellik merkezinden önemli ölçüde sapan veri noktalarını işaretledi. İkinci aşama, sapma yoğunluğunu bağlam farkında bir şekilde yeniden nitelendirmek için eğitim bağlam kısıtlamaları getirir. Üçüncü aşama, karşı gerçekçi pertürbasyon testleriyle düzeltme kararlılığını doğrular; hassas özelliklerin değerlerini sistematik olarak değiştirirken, hassas olmayan özellikler değişmeden kalır ve değerlendirme puanlarındaki değişikliğin %3,2 ±± içinde olup olmadığını gözlemler.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

BFEN algoritma performans analizi
Deneylerde değerlendirilen göstergeler şunları içeriyordu:

Değerlendirme düzeltme doğruluğu (ECA), öğretim değerlendirme sonuçlarındaki model tarafından doğru şekilde tanımlanan ve düzeltilen sapma maddelerinin oranını ifade eder; böylece düzeltme mekanizmasının genel etkinliğini yansıtır. Daha yüksek değerler, üstün düzeltme doğruluğunu gösterir.

Adil sapma oranı (FDR), kalibrasyon sürecinde modelin ortadan kaldıramadığı gruplar arası puan farklılıklarının büyüklüğünü ölçür. Bu, her hassas özniteliğin (örneğin, cinsiyet, bölge, etnik köken) skor dağılımındaki standart sapmasının genel standart sapmaya oranı olarak hesaplanır; Daha düşük değerler, gruplar arası varyansların en aza indirildiğini ve daha sağlam bir adalet garantisini ifade eder.

Senaryo uyum oranı (SAR), modelin heterojen öğretim bağlamlarında (örneğin, fenler ve beşeri bilimler, çevrimiçi ve çevrimdışı ortamlar) başarıyla yürüttüğü düzeltme görevlerinin yüzdesini gösterir.

Adalet koruma derecesi (FMD), düzeltmeden sonra hassas özellik grupları arasındaki adalet göstergelerinin varyansının düzeltmeden önce gözlemlenenle oranı bir eksi olarak tanımlanır ve sistemin kalibrasyon sürecinde yapısal adaletini koruma yeteneğini yansıtır.

Disipliner özellik tanıma oranı (DFRR), her disiplinin değerlendirme verilerinde temel özelliklerin doğru şekilde tanımlandığı örnek oranını toplam değerlendirme örneklem büyüklüğüne göre hesaplar ve modelin alana özgü varyasyonları ayırt etme ve yakalama kapasitesini gösterir.

Çok kaynaklı veri füzyon verimliliği (MDFE), çok kaynaklı heterojen değerlendirme verilerinin birleştirilmesiyle modelin özellik hizalaması, ağırlık tahsisi ve sapma düzeltmesi sırasında verimliliğini ifade eder. Bu kapsamlı metrik, saniyede işlenen değerlendirme örneklerinin sayısı (örnek/saniye) ile düzeltme tutarlılığı uyum oranının (%>95 güven seviyesinde) çarpımı olarak tanımlanır; burada daha yüksek değerler daha verimli ve stabil bir füzyon boru hattını gösterir.

Düzeltme sonucu kararlılığı (CRS), birden fazla bağımsız çalışma arasında kalibrasyon çıktılarının tutarlılığını gösterir; bu, her bir girişin düzeltme çıktıları arasındaki Öklid mesafesinin standart sapmasının tersi ile nicelendirilir. Daha yüksek değerler, sistem güvenilirliğinin arttığını gösterir.

Tek veri düzeltme süresi (SDCT), modelin tek bir değerlendirme örneğinin kalibrasyonunu tamamlamak için tükettiği ortalama hesaplama gecikmesini temsil eder; bu süreç milisaniye (ms) cinsinden ölçülür; Daha düşük değerler daha güçlü bir gerçek zamanlı yanıt yeteneğini gösterir.

Düzeltilmiş mutlak hata (CAE), kalibre edilmiş tahminler ile temel doğruluk değerleri arasındaki ortalama mutlak hatayı ölçür ve modelin orijinal kalibrasyon edilmemiş verilere göre kalıntı sapmasını temsil eder. Daha düşük değerler, kalibre edilmiş çıktıların gerçek performans seviyelerine daha yakın olduğunu gösterir.

Düzeltilmiş göreli hata (CRE), kalibre edilmiş tahminler ile temel doğruluğun yüzdesi olarak ifade edilen temel gerçeklik değerleri arasındaki ortalama mutlak hatayı nicelikle nicelleştirir; düşük değerler ise daha yüksek göreli kalibrasyon hassasiyetini gösterir.

Düzeltme doğruluk oranı (CAR), kalibrasyon sonrası mutlak hataya sahip örneklerin toplam örnek boyutuna göre 0,5 < oranını temsil eder ve modelin önceden tanımlanmış hassasiyet kısıtlamalarını karşılamadaki güvenilirliğini gösterir. Yüksek değerler, çıktıların ampirik faydasını ve güvenilirliğini doğrular.

Toplam kayıp değeri (TL), görev tamamlandığında bireysel alt kayıp terimlerinin ağırlıklı toplamından elde edilen kapsamlı optimizasyon hedef değerini temsil eder. Özellikle, yedi metrik—DFRR, MDFE, CRS, SDCT, CAE, CRE ve CAR—Z-puanı normalizasyonu ile standartlaştırılır ve değerlendirme görevlerinin operasyonel önceliğine göre ağırlıklandırılır. Ağırlık vektörü [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1] verildiğinde, bu yedi normalleştirilmiş gösterge değeri nihai kayıp hesaplamak için toplanır.

Değerlendirme özellik kümeleme doğruluğu (EFCA), model tarafından üretilen denetimsiz kümeleme konfigürasyonları ile alan uzmanları tarafından doğrulanan yeraltı gerçeklik kategorileri arasındaki hizalanma derecesini değerlendirir.

Yüksek boyutlu veri işleme verimliliği (HDPE), ≥50 değerlendirme özelliği içeren yüksek boyutlu seyrek vektörlerle işlem yaparken birim zaman başına özellik boyutluluk azaltma ve sapma düzeltmesine maruz kalan örnek sayısını ölçür. Örneklem/saniye ile ölçülen daha yüksek değerler, karmaşık ve büyük ölçekli değerlendirme girdilerini gerçek zamanlı olarak işleme konusunda daha sağlam bir yeteneğe sahip olduğunu gösterir.

Adalet düzeltme hassasiyeti (FCP), farklı öğrenci grupları arasında kalibrasyon etkilerinin tekdüzeliğini değerlendirir. Bu metrik, hassas öznitelik alt grupları boyunca düzeltilmiş mutlak hatalar için Kolmogorov-Smirnov mesafesinin dağılımı ortalaması hesaplanarak nicelendirilir; Daha düşük değerler, daha dengeli bir gruplar arası performans ve daha güçlü bir adalet garantisi anlamına gelir.

Sahne çapraz düzeltme tutarlılığı (CSCC), kalibrasyon sonuçlarının dağılım ofsetini üç tipik senaryoda—yani sınıf değerlendirmesi, pratik değerlendirme ve çevrimiçi test—Wasserstein mesafe oranı olarak modellenerek niceliklerini sunar.

Önerilen BFEN öğretim değerlendirme kalibrasyon algoritmasının performansını doğrulamak için, çalışma, bunu PRF algoritması ile karşılaştırdı; bu algoritma ana bileşen analizi (PCA) ve rastgele orman (RF) birleştirdi; aşırı öğrenme makinesi (ELM) ve uyarlanabilir güçlendirmeyi (AdaBoost) birleştiren EAB algoritması; ve derin inanç ağı (DBN) ile lojistik regresyonu (LR) birleştiren DBLR algoritması. Deneyler, Intel Core i9-13900HX işlemci ve NVIDIA RTX 4080 GPU ile donatılmış bir sistemde çalıştı; yüksek paralel hesaplama kapasitesi ve büyük video belleği sağlayarak büyük ölçekli öğretim değerlendirme verileri için özellik çıkarma ve kalibrasyon hesaplamalarını verimli bir şekilde tamamladı. İşletim sistemi Windows 11'di ve programlama için Python 3.9 kullanılıyordu. Algoritmalar Scikit-learn kütüphanesi kullanılarak uygulandı, derin öğrenme modülleri TensorFlow çerçevesi üzerinden geliştirildi ve veri ön işleme için Pandas ve NumPy kütüphaneleri kullanıldı. Geliştirme ortamı PyCharm Professional 2023.1 kullandı ve algoritma performansının sezgisel karşılaştırmasını kolaylaştırmak için kalibrasyon sonuçlarının görselleştirilmesi için Seaborn uygulandı. Verilerin güvenilirliğini sağlamak için çalışma, Küresel Eğitim İzleme Raporuveri seti 1 ve İspanyol ortaokul öğrenci akademik performans veriseti 2'yi kullandı. Veri seti, üniversite öğretim öğretim değerlendirmeleri, öğrenci akademik performansı, öğrenci öğretim değerlendirmeleri ve ders geri bildirimi gibi çoklu modlu öğretim değerlendirme verilerini kapsayan 12.486 kayıt içerir; sınıf etkileşim sıklığı, ödev geri bildirimi zamanlılığı, puanlama tutarlılığı, dil kapsayıcılığı ve kültürlerarası duyarlılık gibi 137 öğretim boyutu özelliğini kapsar. Hedef değişken, bu çalışmada uzmanlar tarafından kalibre edilmiş çok boyutlu ağırlıklı bileşik değere eşlenen öğretim değerlendirme puanıdır. Araştırma, öğrenci öğretim değerlendirmeleri, akran değerlendirmeleri, denetleyici sınıf gözlemleri ve dersin dosyesi incelemeleri olmak üzere dört tür bilgi kaynağını entegre eder; ağırlıkları sırasıyla 0.35, 0.25, 0.25 ve 0.15'tir. Eğitim ve doğrulama setleri, iki veri setinden kronolojik sırayla ayrılır. Çalışma, eğitim seti olarak Eylül 2024 verilerini, eğitim değerlendirmelerinin zamansal ilerleyişiyle uyumlu olmak için Ekim 2024'ten Haziran 2025'e kadar olan verileri doğrulama seti olarak kullanmaktadır. Ön işleme aşamasında, modalite-spesifik bir strateji kullanılır; yapılandırılmış özellikler Z-skor normalizasyonu ile standartlaştırılır ve dışnamalar Winsorize edilirken, metin özellikleri BERT-base-chinese modeli kullanılarak kodlanır ve 768 boyuta indirgenmiştir. Karşıt eğitim, örtük önyargılı ifadelere karşı dayanıklılığı artırmak ve kültürel arka plan farklılıklarından kaynaklanan anlamsal sapmayı azaltmak için uygulanır.

Alanlararası eğitim ve doğrulama araştırmalarını sağlamak için model, sıfır veya az örnek doğrulama için dört heterojen öğretim senaryosuna aktarılacak: K-12 temel eğitimi, mesleki eğitim, sürekli eğitim ve uluslararası Çin eğitimi. Bu dört senaryoda, çalışma, algoritma eğitimi sırasında farklı öğretim senaryolarında modelin özellik dağılımının tutarlılığını sınırlamak için alan uyarlanabilir düzenleme terimleri tanıtmaktadır. K-12 senaryolarında kısa cümle gürültüsü için hafif bir sözdizimine duyarlı maske mekanizmasının gömülmesi; Mesleki eğitimde mesleki terminolojinin belirsizliğini gidermek için, müfredat taslağı bilgi grafiğiyle entegre edilen dinamik bir alan sözlüğü oluşturulur ve entegre edilir. Sürekli eğitimde nesiller arası anlamsal boşluğu ele almak için bir yaş grubu karşılaştırma öğrenme modülü tasarlayın; farklı yaş gruplarının değerlendirme ifadeleri için anlamsal çapları örtük alanda hizalandırın. Uluslararası Çin eğitiminde kültürel yük ifadesini ele almak için, kelimesi kelime dışı eğitim kavramlarını anlamanın sağlamlığını artırmak için ince ayar için diller arası karşılaştırma önerileri kullanılır. Orijinal değerlendirme kayıtlarında yapılandırılmış alanların uzman kalibrasyonu ve güvenilirlik testi üzerine araştırma, Krippendorff alfa katsayısı 0.75'in altında düşük güvenilirlikli girişlerin kaldırılmasıdır. Öğrenci değerlendirme metinlerinde çift kör manuel notasyon uygulandı; 3 eğitim ölçüm uzmanı bağımsız olarak sapma tipi etiketlemeyi tamamladı ve Cohen'in k = 0.86 tutarlılığını elde etti. Son olarak, açıklamalı sonuçlar denetim kayıtları ve öğretim dosyası inceleme sonuçlarıyla çapraz doğrulanarak nihai kalibrasyon etiketleri oluşturuldu.

Seçilen veri setleri farklı popülasyonlardan, ölçüm sistemlerinden ve eğitim geçmişlerinden oluştu. Bu alanlararası doğrulama paradigması, modelin sağlamlığını ve genelleme sınırlarını özgün bir eğitim ekosistemi içinde titizlikle test etti ve veri homojenleşmesinden kaynaklanan değerlendirme illüzyonlarını önledi. Her iki depoda da önemli miktarda öğretim değerlendirme kaydı bulunuyordu ve adaletin farkında akıllı eğitim algoritmalarının uygulanması için doğrudan referans değeri sunuyordu. Her iki veri seti de önemli öğretim değerlendirme verileri içermekteydi; bu veriler, adaletin farkında akıllı eğitim algoritmalarının tasarımı ve öğretim değerlendirme kalibrasyonu için doğrudan referans değerleri sağlıyordu. Çalışma, dört algoritma ile 1000 öğretim değerlendirme kaydını kalibre etti ve onların ECA ile Fairness FDR'sini hesapladı. Sonuçlar Şekil 8'de gösterilmiştir.

figure-results-1
Şekil 8: ECA ile FDR arasındaki test sonuçlarının karşılaştırılması. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 8A'da gösterildiği üzere, BFEN değerlendirme kalibrasyon görevinde başlangıçta %82,47 ECA ve %5,71 FDR elde etmiştir. Kalibre edilmiş kayıtların sayısı arttıkça, ECA %98,75'e yükseldi ve 421 kaydı kalibre ettikten sonra istikrar sağladı, FDR ise %2,87'ye düştü ve 514 kaydı kalibre ettikten sonra istikrar sağladı. Şekil 8B'de gösterildiği gibi, PRF algoritmasının ECA eğrisi kademeli olarak arttı, FDR çizgisi ise yavaş yavaş azaldı. Kalibrasyon görevinin sonunda ECA değeri %92,30, PDR değeri ise %6,72 idi. Şekil 8C, EAB algoritmasının ECA eğrisinin düzleşmeden önce hızla yükseldiğini, FDR yörüngesinin ise yakınsamadan önce şiddetli erken evre dalgalanmaları gösterdiğini, ECA'nın %84,64 ve FDR'nin %8,93 olduğunu göstermektedir. Şekil 8D'de belirtildiği üzere, DBLR algoritması, FDR hattında marjinal dalgalanmalar ve sınırlı sıkıştırma ile birlikte yavaş yukarı yönlü ECA yörüngesi göstererek, kalibrasyon görevini %83,51 ECA ve FDR %8,42 ile tamamladı. Bu deneysel bulgular, BFEN algoritmasının hem değerlendirme düzeltme doğruluğu hem de adalet yanlılığı kontrolünde temel yaklaşımları önemli ölçüde geride bıraktığını doğrulamaktadır. Bu üstün genelleme yeteneği, BFEN içinde BERT'in entegrasyonuna bağlanır; BFEN, yapılandırılmamış değerlendirme metninden derin anlamsal özellikler çıkararak gizli önyargı ifadelerini yakalarken, RL modülü ise çok amaçlı ödül fonksiyonu aracılığıyla adalet eşiklerini ve düzeltme parametrelerini dinamik olarak optimize ederek hassas özellikleri nihai çıktılardan ayırır. Çalışma, SAR ve FMD'yi sınıf değerlendirmesi, final sınavları, pratik değerlendirme ve çevrimiçi değerlendirme için test etti ve dört senaryoyu A, B, C ve D olarak etiketledi. Sonuçlar Şekil 9'da gösterilmiştir.

figure-results-2
Şekil 9: SAR ve FMD'nin karşılaştırılması farklı senaryolarda sonuç vermektedir. (A) SAR testi sonuçları. (B) FMD test sonuçları. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 9A'da gösterildiği gibi, BFEN tüm öğretim senaryolarında %98'in üzerinde SAR elde etmiş ve sınıf testlerinde en yüksek SAR %99,01 olmuştur. Farklı senaryolarda karşılaştırma algoritmasının SAR'ı, BFEN algoritmasından daha düşüktür; DBLR algoritması, nihai değerlendirme senaryosu için tüm algoritmalar arasında en düşük SAR'a sahip olup, %70,23'tür bir SAR'a sahiptir. Şekil 9B'de gösterildiği gibi, BFEN algoritmasının FMD'si farklı öğretim senaryolarında karşılaştırma algoritmasından hâlâ önemli ölçüde daha yüksektir; farklı senaryolarda FMD'ler sırasıyla %98,47, %98,05, %97,81 ve %97,94'dir. DBLR kıyaslama algoritmasının FMD'leri sırasıyla %82,36, %71,74, %70,59 ve %69,12'dir. EAB algoritmasının FMD'leri sırasıyla %80,79, %68,21, %67,65 ve %66,03'tür; PRF algoritmasının FMD'leri ise sırasıyla %86,42, %82,17, %80,98 ve %78,33'dür. Bu sonuçlar, BFEN'in GBDT'nin çoklu karar ağacı ile yinelemeli öğrenmesi sayesinde karşılaştırma algoritmalarını geride bıraktığını gösterdi; bu öğrenme, senaryolar arasında hata kalıplarını doğru yakalayabiliyor ve kararlı, adil kalibrasyon sonuçları sağladı. Çalışma, Çin, Matematik ve İngilizce için dört algoritmayı kullanarak disipliner özellik tanıma oranını (DFRR) daha da değerlendirdi. Sonuçlar Şekil 10'da gösterilmiştir.

figure-results-3
Şekil 10: Farklı disiplinlerdeki DFRR test sonuçlarının karşılaştırılması. (A) Eğitim seti. (B) Doğrulama seti. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 10A'da gösterildiği gibi, BFEN eğitim setinde Çin, Matematik ve İngilizce için %99,23, %98,94 ve %99,13 DFRR elde etmiştir. Şekil 10B, BFEN'in doğrulama setinde diğer algoritmalara kıyasla daha yüksek DFRR elde ettiğini göstermiştir. Özellikle, BFEN'in Çin için DFRR'si %98,41'e ulaştı; bu, DBLR'nin %87,61'inden %10,8 daha yüksekti; Matematik için %97,54, PRF'nin %88,47'sinden %9,07; İngilizce için ise %98,13, EAB'nin %84,79'unun %13,34'ü daha yüksekti. Bu sonuçlar, BFEN'in BERT'in anlamsal farklılıkları derinlemesine yakalamasını GBDT'nin hata kalıplarını kişiselleştirilmiş öğrenme yöntemiyle birleştirerek disipliner değerlendirme kalibrasyonuna verimli bir şekilde uyum sağladığını doğruladı. BFEN performansını kapsamlı değerlendirmek için çalışma, dört algoritma için MDFE, CRS ve SDCT'yi değerlendirdi. Sonuçlar Tablo 1'de sunulmaktadır.

Veri setiAlgoritmaMDFE (%)CRSSDCT (lar)
EğitimBFEN98.42 ± 0.28*&@0.975 ± 0.28*&@0.78 ± 0.04*&@
PRF83.85 ± 0.410.779 ± 0.361.32 ± 0.08
EAB85.91 ± 0.500.806 ± 0.401.15 ± 0.07
DBLR88.76 ± 0.470.753 ± 0.391.45 ± 0.08
DoğrulamaBFEN97.58 ± 0.25*&@0.968 ± 0.27*&@0.86 ± 0.03*&@
PRF81.62 ± 0.320.687 ± 0.501.51 ± 0.06
EAB84.37 ± 0.400.749 ± 0.421.28 ± 0.05
DBLR87.53 ± 0.300.728 ± 0.471.63 ± 0.07

Tablo 1: MDFE, CRS ve SDCT test sonuçlarının karşılaştırılması. "*" BFEN ile PRF sonuçları arasında önemli bir farkı (p < 0.05) gösterir. "&" BFEN ile EAB sonuçları arasındaki farkın anlamlı olduğunu gösterir (p < 0.05). "@" BFEN ve DBLR sonuçları arasındaki farkın anlamlı olduğunu gösterir (p < 0.05)

Tablo 1 , BFEN'in eğitim setinde %98,42 MDFE elde ettiğini, bu PRF'nin 83,85'inden %14,57 yüksek, CRS'nin 0,975, DBLR'nin 0,753'ünden 0,222 yüksek ve SDCT'nin 0,78 s, yani DBLR'nin 1,45 saniyesinden 0,67 saniye daha az olduğunu göstermektedir. Doğrulama setinde BFEN, MDFE, CRS ve SDCT ile sırasıyla %97,58, 0,968 ve 0,86 saniye ile karşılaştırma algoritmalarını geride bırakarak üstün performans sergiledi. Genel olarak, sonuçlar BFEN'in değerlendirme kalibrasyonu öğretimindeki üstün kapsamlı performansını doğruladı.

GFBFEN öğretim değerlendirmesi kalibrasyon modeli performans doğrulaması
BFEN performans doğrulamasına dayanarak, çalışma BFEN üzerine inşa edilen GFBFEN öğretim değerlendirme kalibrasyon modelinin performansını daha da değerlendirdi ve PRF, EAB ve DBLR algoritmaları kullanılarak oluşturulan kalibrasyon modelleriyle karşılaştırdı. Tutarlı test koşulları ve karşılaştırılabilirliği sağlamak için, küresel eğitim izleme raporu veri seti eğitim seti olarak hizmet verirken, üniversite öğrencisi akademik performans veri seti doğrulama seti olarak hizmet vermiştir. Dört model, 500 öğretim değerlendirme kaydını kalibre etti ve CAE ile CRE'leri hesaplandı. Sonuçlar Şekil 11'de gösterilmiştir.

figure-results-4
Şekil 11: CAE ve CRE test sonuçlarının karşılaştırılması. (A) CAE test sonuçları. (B) CRE testi sonuçları. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 11A'da gösterildiği gibi, GFBFEN başlangıçta 0.1279 CAE elde etmiştir. Kalibrasyon ilerledikçe, CAE 0.0641'e düştü ve 104 kayıt sonrası stabil oldu. Karşılaştırma modelleri GFBFEN'den daha yüksek başlangıç ve nihai CAE'ye sahipti; EAB ise sırasıyla 0.1858 ve 0.1217 ile en yüksek başlangıç ve nihai CAE'ye sahipti. Şekil 11B, kalibrasyon görevi sırasında GFBFEN'in ilk ve nihai CRE'sinin karşılaştırma modellerinden daha düşük kaldığını, sırasıyla 0.1137 ve 0.0912 değerleriyle gösterdiğini göstermiştir. Bu sonuçlar, GFBFEN'in güçlü uyum yeteneği sergilediğini, özellikler arasında anlamsal korelasyon grafikleri oluşturan GAT'ın dikkat mekanizmasından faydalandığını, çok kaynaklı değerlendirme verilerinin anlamsal hizalanmasını artırdığını ve özellik yanlılığından kaynaklanan etkisiz kalibrasyonu azalttığını gösterdi. Çalışma, ardından CAR'ı öğrenci değerlendirme verileri, öğretmen değerlendirme verileri, okul değerlendirme verileri ve I, II, III ve IV olarak etiketlenen çevrimiçi değerlendirme verileri açısından değerlendirdi. Sonuçlar Şekil 12'de gösterilmiştir.

figure-results-5
Şekil 12: Farklı değerlendirme verilerinin CAR sonuçlarının karşılaştırılması. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 12A'da gösterildiği üzere, GFBFEN eğitim setinde öğrenci, öğretmen, okul ve çevrimiçi değerlendirme verilerinde %99,34, %98,93, %99,01 ve %99,12 CAR elde etmiştir. Doğrulama setinde CAR değerleri sırasıyla %97,89, %98,56, %97,57 ve %98,46 idi. Şekil 12B–D, karşılaştırma modellerinin hem eğitim hem de doğrulama setlerinde daha düşük CAR değerine sahip olduğunu göstermiştir. Bunlar arasında, EAB doğrulama setinde en kötü performans gösteren oldu; öğretmen verisi için CAR %76,31, çevrimiçi veriler için ise %78,29 oldu. Bu sonuçlar, GFBFEN'in karşılaştırma modellerinden önemli ölçüde daha iyi performans gösterdiğini doğruladı. Sonrasında, TL'yi öğretim değerlendirme kalibrasyon görevinde test ederek uyum yeteneği ve eğitim kararlılığını değerlendirdi. Sonuçlar Şekil 13'te gösterilmiştir.

figure-results-6
Şekil 13: Model uyum yeteneği ve eğitim stabilitesi testi sonuçları. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 13A'da gösterildiği gibi, GFBFEN başlangıçta eğitim setinde 0.1021 TL'ye sahipti. 67 iterasyondan sonra TL 0.0725'e düştü ve stabilize oldu. Doğrulama setinde, TL 0.1237'den 0.1018'e düştü. Şekil 13B–D, PRF'nin eğitim setindeki son TL'sinin 0.0824, EAB'nin doğrulama setindeki son TL'sinin 0.1178 olduğunu ve DBLR'nin her iki sette TL'sinin kararsız ve diğer modellere göre önemli ölçüde daha yüksek olduğunu göstermiştir. Bu sonuçlar, GFBFEN'in güçlü uyum yeteneği ve eğitim kararlılığı sergilediğini, KD tabanlı bilgi transferinden faydalandığını gösterdi; bu da modelin etkili özellikleri hızlıca öğrenmesini, kayıp yakınmasını hızlandırmasını ve veri setleri arasında genelleştirmeyi sağlamasını sağladı. GFBFEN'in çekirdek performansını kapsamlı bir şekilde doğrulamak için çalışma, dört model için EFCA, HDPE, FCP ve CSCC'yi test etti. Sonuçlar Şekil 14'te gösterilmiştir.

figure-results-7
Şekil 14: Öğretim değerlendirme ve düzeltme görevlerinin kapsamlı gösterge test sonuçları. (A) GFBFEN test sonuçları. (B) PRF test sonuçları. (C) EAB test sonuçları. (D) DBLR test sonuçları. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 14A–D'de gösterildiği gibi, GFBFEN modeli eğitim ve doğrulama setlerinde sırasıyla %99,35 ve %98,76 EFCA değerlerine sahiptir. PRF modelinin EFCA'sı sırasıyla %88,53 ve %87,04'tür. Doğrulama setinde, GFBFEN modelinin EFCA'sı EAB modelinden %6,59 daha yüksekti (%92,17), DBLR modelinden %11,72 daha yüksekti (%87,04). Ayrıca, HDPE, FCP ve CSCC göstergeleri de kapsamlı şekilde öndedir: doğrulama setinde GFBFEN modelinin HDPE'si %98,05'e, FCP'ye %97,93'e ulaştı ve CSCC %0,968'e ulaştı; bunların hepsi PRF, EAB ve DBLR modellerinden daha iyi performans gösterdi. Genel olarak, bu sonuçlar GFBFEN'in üstün kapsamlı performansını doğruladı ve modelin GAT-KD,-LSTM ve BFEN'in koordineli optimizasyonunun, kalibrasyon doğruluğunu, verimliliğini ve öğretim değerlendirmesinde adaleti etkili bir şekilde artırdığını gösterdi.

Araştırma zamanla FairEduNet, BFEN, FBFEN ve GFBFEN'i oluşturdu ve nihai GFBFEN FairEduNet, BERT-RL,-LSTM ve GAT-KD gibi bileşenleri içeriyordu. Bireysel bileşenlerin bağımsız katkısını doğrulamak için, araştırma ve tasarım ablasyon deneyleri yapılır; her bileşen kademeli olarak çıkarılır ve genel performans üzerindeki etkisi değerlendirilir. Karşılaştırmalı göstergeler arasında ECA, FDR, SAR ve FMD bulunur. Sonuçlar, FairEduNet bileşeninin ECA değerinin sadece %87,32, FDR'nin %12,45, SAR'ın %89,67 ve FMD'nin %11,89 olduğunu gösterdi. Tam GFBFEN modelinin ECA'sı %99,21'e ulaştı, FDR %1,93'e düştü, SAR %99,45'te stabil kaldı ve FMD %7,28'e optimize edildi. BERT-RL kaldırıldıktan sonra ECA %91,04'e düştü, FDR değeri %6,23, SAR değeri %92,33 ve FMD %7,85'e yükseldi. -LSTM'nin ablasyonu, SAR dalgalanmalarını %14,2 artırdı. GAT-KD'nin kaldırılması, FMD'nin %8,36'ya yükselmesine yol açtı ve bilgi damıtılması ile yönlendirilen grafik yapısı yanlımlığının yayılmasını bastırma mekanizması, popülasyonlar arasındaki örtük ilişki yanlılığını azaltmada önemli ölçüde etkili oldu.

Araştırma yöntemlerini daha da test etmek için, çalışma, eğitim senaryolarında yaygın olarak bilinen üç tür katı kısıtlamayı kapsayan Adalet Düzeltme Kıyıtı (FCB) gibi yerleşik adalet standart göstergelerini tanıttı: (1) Gruplar arasında düzeltme sonrası ortalama farkın mutlak değeri yüzde sistemine göre ≤ 1,2 puandır; (2) Her hassas özellik alt grubu için düzeltilmiş güven aralıklarının örtüşme oranı %95 ≥; (3) Herhangi bir tek senaryoda, FDR ve SAR'ın ortak uygulanabilir bölgesi Pareto sınır kısıtlamasını karşılamalıdır (yani, FDR bozulmadan SAR'ı iyileştirmek imkansızdır ve tam tersi). GFBFEN modeli, deneysel değerlendirmede EAB, PRF, DBLR ve GBDT gibi ana akım temel modellerle karşılaştırıldı. Deney, gerçek öğretim senaryolarından toplanan 421 gerçek değerlendirme verisi üzerinde gerçekleştirildi ve üç tipik eğitim senaryosunu kapsıyordu: sınıf değerlendirmesi, pratik değerlendirme ve çevrimiçi test. Sonuçlar Tablo 2'de gösterilmiştir.

AlgoritmaOrtalama puan farkının mutlak değeriGüven aralığı örtüşme oranı (%)Ortak uygulanabilir bölge memnuniyet oranı (%)Kapsamlı puan
GFBFEN0.8798.310097.2
EBA1.5298.482.678.5
PRF1.6885.174.371.2
DBLR1.4587.979.875.6
GBDT1.3391.286.479.9

Tablo 2: Adalet kriterleri göstergelerinin değerlendirme sonuçları ve pratik uygulama doğrulaması.

Tablo 2'de gösterildiği gibi, GFBFEN dört FCB katı kısıtlamasına bağımsız olarak tam uyum sağladı ve kapsamlı puanı diğer temel modelleri +18,7 puan farkla önemli ölçüde geride bırakarak önerilen çok aşamalı işbirlikçi düzeltme paradigmasının sağlamlığını doğruladı. Özellikle, adalet-verimlilik dengesini yansıtan temel göstergede, ortak uygulanabilir bölge kapsama oranı %100'e ulaştı; bu da modelin gerçek eğitim senaryolarında Pareto-optimal karar alma yeteneklerine sahip olduğunu gösteriyor.

Öğretim değerlendirmesinde adalet, doğrulanabilir nicel kısıtlamaların bir ölçüt olarak kullanılması ve bireysel farklılıklara ve eğitim yasalarına saygı gösterilmesini ifade eder. Eşitlik göstergelerinin hesaplama mantığı ve eşik belirlemesi, eğitim eşitliği teorik çerçevesi ve ampirik veri doğrulama standartlarına dayanır. Teorik titizlik ile eğitim uygulamasına uyum sağlama konusunda yüksek düzeyde birlik sağlamak için beş akademisyenden oluşan bir uzman komitesi tarafından ortaklaşa incelenirler. Modelin farklı adalet standartları altında uyumlanabilirliğini daha da doğrulamak için, çalışma birden fazla standart altında ek doğrulama gerçekleştirdi. Özellikle, doğrulama için üç adalet standardı seçildi. Standart 1, Demografik Parite'ye dayalı gruplar arasındaki kabul oranı dengesidir. Standart 2, Eşit Olasılıklara dayalı gerçek pozitif oran ve yanlış pozitif oranının çapraz grup tutarlılığıdır. Standart 3, tahmin doğruluğunda gruplar arası önyargıyı kontrol etmek için Tahminci Eşitliğe dayanır. GFBFEN'in üç standart altında katı kısıtlama gereksinimlerini tutarlı şekilde karşıladığı bulundu. Standart 1 grup kabul oranı sapması ≤%1,2%, standart 2 doğru/yanlış pozitif oranı gruplar arası fark ≤0,85%, standart 3 tahmin doğruluğu gruplar arası sapma ±±0,6% içinde kontrol edilmektedir. Buna karşılık, diğer modeller en az bir kriter altında %3,7 ≥ kısıtlama atılımı gösterdi ve çok değişkenli adalet paradigmaları için GFBFEN'in genelleştirme uyumluluğunu doğruladı.

VERİ ERIŞILEBILIRLIĞI:
Veri güvenilirliğini sağlamak için çalışma, Küresel Eğitim İzleme Raporu veri seti (https://www.education-progress.org/) ve İspanyol ortaokul öğrenci akademik performans veri seti (https://archive.ics.uci.edu/dataset/320/student+performance) kullandı. Eğitim ve doğrulama setleri, iki veri setinden kronolojik sırayla ayrılır. Çalışma, eğitim seti olarak Eylül 2024'te, doğrulama seti olarak ise Ekim 2024'ten Haziran 2025'e kadar olan verileri kullanarak eğitim değerlendirmelerinin zamansal ilerleyişiyle uyumlu hale gelmektedir.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışmada önerilen BFEN algoritması, karşılaştırmalı deneylerde üstün performans göstermiştir. ECA ve FDR açısından bakıldığında, PRF, EAB ve DBLR algoritmalarını önemli ölçüde geride bıraktı. 421 değerlendirme kaydı kalibre edilirken, BFEN ECA'yı %98,75'e yükseltti ve istikrarı korurken, FDR %2,87'ye düştü. Bu performans, özellik optimizasyonu ve dinamik uyum için BERT-RL'nin entegrasyonundan kaynaklanmıştır. BERT, yapılandırılmamış değerlendirme metinlerinden derin anlamsal önyargı bilgisini hassas bir şekilde çıkardı ve RL, çok amaçlı ödül fonksiyonu aracılığıyla adalet eşiklerini ve kalibrasyon parametrelerini dinamik olarak ayarladı, böylece hassas özelliklerin sonuçlar üzerindeki etkisini ortadan kaldırdı. Bu, Valencia-Londoño ve arkadaşlarının çeşitli nöromüsküler bozuklukları olan yetişkinler için yapay zeka algoritmalarını kullanarak eğitimsel kapsayıcılık modeli oluşturan çalışmalarına benzer. Oluşturulmuş eğitimsel kapsayıcılık modeli, belirli nöromüsküler hastalık grupları içinde uygulanabilirliği doğrulanmış olsa da, adalet kısıtlamaları yalnızca tek bir boyutu (tanı gruplarının eşit temsili) kapsıyordu ve birden fazla grup ve çoklu hedef arasında katı bir kısıtlama sistemioluşturulmadı 27. Farklı öğretim senaryolarındaki testlerde, BFEN sınıf değerlendirmelerinde %99,01 SAR ve pratik değerlendirmelerde %97,81 FMD elde etmiştir; bu da karşılaştırma modellerinden önemli ölçüde daha yüksektir. Bu avantaj, GBDT'nin çoklu senaryolu değerlendirme verilerindeki hata kalıplarını yinelemeli öğrenmesinden ve akıllı eğitim adalet standartları kütüphanesiyle birleşerek hedef kalibrasyon parametrelerini eşleştirmesinden kaynaklanıyor; böylece senaryo farklılıklarından kaynaklanan kalibrasyon yanlılığını ve adalet dengesizliğini etkili bir şekilde azaltıyordu. Kumar ve ark. tarafından önerilen uyarlanabilir ve yorumlanabilir adil yapay zeka değerlendirme sistemiyle, insan uzmanı geri bildirim döngüleri ve diller arası adalet doğrulama modüllerini içeriyor, ancak bu özellikleri tanıtsa da, eğitim değerlendirme alanındaki değerlendirme metinlerindeki örtük önyargı zincirlerini etkili şekilde modelleyemiyor; çünkü eğitim alanındaki bu alan, yüksek anlamsal yoğunluk ve güçlü bağlam bağımlılığıvardır 28. Bu çalışma, adalet kısıtlamalarının katı garantisi ve eğitim anlamsal modellemesinin derin bir ilişkisi açısından literatüre kıyasla daha derin entegreedilmiştir 28.

Pratik akıllı eğitim değerlendirme görevlerinde, BFEN üzerine inşa edilen GFBFEN modeli de kayda değer avantajlar göstermiştir. 500 kalibrasyon kaydı için GFBFEN nihai CAE 0.0641 ve CRE 0.0912 olarak elde edilmiştir. Birden fazla değerlendirme verisi türü için CAR'ı hem eğitim hem de doğrulama setlerinde %97'yi aştı. Bu performans, GAT-KD'nin özellik korelasyon optimizasyonu ve hafif işlemesinden kaynaklanmıştır. GAT, çoklu kaynaklı veri özellik yanlılığını azaltmak için özellikler arasında anlamsal korelasyon grafikleri oluştururken, KD'nin bilgi aktarımı model doğruluğundan ödün vermeden çıkarım verimliliğini artırdı ve model karmaşıklığından kaynaklanan kalibrasyon gecikmelerini önledi. Deho ve ark. tarafından veri seti kaymasının öğrenme analiz modellerinin adaleti üzerindeki etkisi üzerine yapılan araştırmalarla karşılaştırıldığında, çalışmaları veri kaymasının adaletlilik üzerindeki etkisinin mekanizmasına odaklanmış olsa da, düzeltme stratejileri statik yeniden ağırlıklandırma ve olay sonrası tazminatı üzerine dayanıyordu; gerçek zamanlı anlamsal sapmaları dinamik olarak algılama ve yanıt verme yeteneği yoktu. Öğretmenlerin öznel ifadeleri ve öğrencilerin dil tarzlarındaki farklılıklar nedeniyle eğitim değerlendirmesinde örtük önyargıların evrimiyle başa çıkmak zordu. Ancak, bu çalışma GFBFEN modeli aracılığıyla değerlendirme anlamsalındaki anlamsal sapmaları etkili bir şekilde algılayıp dinamik olarak yanıt vererek, öğretmen yorumlarındaki örtük değer eğilimlerini, öğrencilerin yanıt metinlerindeki dil tarzı sapmalarını ve notlar/konular arasında değerlendirme ifadelerindeki anlamsal sapmaları yakalıyor ve "statik tazminat"tan "dinamik kalibrasyon"a paradigma değişimi sağlıyor. Çekirdek metrik testlerde, GFBFEN eğitim ve doğrulama setlerinde sırasıyla %99,35 ve %98,76 EFCA'yı, karşılaştırma modellerinden önemli ölçüde %98,52 ve %97,93 FCP elde etti. Dimari A ekibi tarafından geliştirilen yapay zekaya dayalı otomatik puanlama içeren açık uçlu sınav sistemine benzer şekilde, açık uçlu yanıtların puanlanmasında yüksek bir tutarlılık sağlamış olsa da, adalet düzeltmesi yalnızca puanlama boyutlarının önceden belirlenmiş ağırlığına ve insanlar tarafından notlanmış önyargılı örnek kütüphanesine dayanır; eğitici anlamsal dinamik evrim mekanizması eklemeden yapılır. Bu araştırma, Dimari A ekibinin araştırma sonuçlarına kıyasla adalet düzeltmesinin dinamik evrim mekanizması ve eğitim anlamsalının derin modellemesi konusunda önemli atılımlar sağladı; özellikle öğretmen yorumlarının değer odaklılığındaki kayma, öğrenci dil stillerindeki nesiller arasındaki farklılıklar gibi gerçek dünya zorluklarını ele almakta güçlü bir dayanıklılık ve yorumlanabilirlik gösterdi. ve disiplinlerarası değerlendirme ifadelerindeki belirsizlik30.

Bu çalışma üç açıdan katkıda bulundu. İlk olarak, BFEN algoritması BERT-RL'yi FairEduNet ile entegre ederek çok kaynaklı heterojen veriler için işleme verimliliğini ve çoklu senaryo uyum yeteneğini semantik özellik optimizasyonu ve dinamik parametre ayarlaması yoluyla artırdı. İkinci olarak, GAT-KD ve FBFEN tabanlı GFBFEN modeli, anlamsal korelasyon öğrenme ve hafif bilgi transferini tanıttı; karmaşık eğitim senaryolarında zayıf özellik korelasyonu ve düşük çıkarım verimliliği sorunlarını çözerek değerlendirme kalibrasyonunda pratikliği artırdı. Üçüncü olarak, modeller farklı konuları ve değerlendirme türlerini kalibre etmek için uygulandı, bu da hassas öğretim değerlendirmesi için teknik destek sağladı ve eğitim adaletini teşvik etti. Bu katkılar, akıllı eğitim değerlendirme kalibrasyonu için yeni bir yaklaşım ve karmaşık eğitim veri işlemede çoklu algoritma iş birliği için bir referans sundu.

Mevcut akıllı eğitim değerlendirme kalibrasyon yöntemleri uyum sağlama ve adaletten yoksundur. Bu çalışma, FairEduNet'e dayalı bir GFBFEN modeli önermekte, adalet kalibrasyonu için GAN ve GBDT kullanılıyor. BERT-RL yapılandırılmamış veri işlemeyi geliştirirken,-LSTM çoklu kaynaklı veri birleşimini geliştirir ve GAT-KD özellik korelasyonu ve hafifliği güçlendirir. Bu algoritmaların entegre edilmesiyle, model hassas kalibrasyon ve dinamik adalet sağlar. Testler, çok kaynaklı veri işleme ve senaryolar arası adalet kalibrasyonunun mükemmel olduğunu, hassasiyet ve adalet gereksinimlerini karşıladığını göstermektedir. Ancak, modelin özel eğitim gruplarında sınırlamaları vardır ve daha iyi genelleştirme gerektirir. Gelecekteki çalışmalar, çeşitli senaryolar için parametreleri optimize edecek ve adalet kısıtlamalarını ayarlayacak, böylece eğitim adaleti ve öğretim kalitesi desteklenecek.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarın açıklayacak hiçbir şeyi yok.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazar, çıkar çatışması olmadığını belirtir.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Global Education Monitoring Report datasetUNESCOhttps://www.education-progress.org/Veri Seti
NumPyNumPyhttps://numpy.org/Veri ön işleme
PandasPandas, NumPyhttps://pandas.pydata.org/Veri ön işleme
PyCharm Professional 2023.1PyCharm Sürüm 2023.1Geliştirme ortamı
Python 3.9Python Sürüm 3.9‌Programlama dili
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/index.htmlMakine Öğrenimi
SeabornSeabornhttps://seaborn.pydata.org/Görselleştirme
Spanish middle school student academic performance datasetUC Irvine Machine Learning Repositoryhttps://archive.ics.uci.edu/dataset/320/student+performanceVeri Seti
TensorFlowTensorFlowhttps://www.tensorflow.org/Derin Öğrenme
Windows 11MicrosoftSürüm 11İşletim Sistemi

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

EngineeringIntelligent educationFairEduNetTeaching assessment calibrationGenerative Adversarial NetworkGradient boosting decision tree

Related Articles