Research Article

تصميم خوارزميات FairEduNet ومعايرة تقييم التدريس مع مراعاة العدالة في التعليم العالي

DOI:

10.3791/70189

July 21st, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يهدف البحث إلى تقديم نهج جديد لمعايرة التقييم والتدريس والعدالة التعليمية في التعليم الذكي. تشير النتائج التجريبية إلى أن النموذج المقترح يتفوق بشكل كبير على النماذج المقارنة، مما يعالج بفعالية مشاكل ضعف تكامل البيانات متعددة المصادر وتحيز العدالة في طرق المعايرة الحالية.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تواجه طرق معايرة تقييم التدريس الحالية تحديات مثل انخفاض كفاءة التكامل عند معالجة بيانات التقييم متعددة المصادر وغير المتجانسة، وعدم القدرة على التكيف عبر التخصصات المختلفة وسيناريوهات التدريس، وتحيزات في النتائج ذات ضمانات العدالة الضعيفة. يهدف البحث إلى بناء إطار عمل قابل للتفسير والتحويل والتوسع لتصحيح العدالة للنمذجة العميقة والتصحيح الديناميكي لبيانات تقييم التدريس. تجعل هذه القضايا من الصعب تلبية المتطلبات الأساسية للتدريس المتوازن في التعليم الذكي. تقترح هذه الدراسة خوارزمية شبكة تعليمية تركز على العدالة تدمج شبكة خصومية توليدية وشجرة قرارات تعزز التدرج. تقوم الخوارزمية ببناء آلية معايرة العدالة وتجمع بين نموذج تمثيل المشفر ثنائي الاتجاه وشبكة انتباه الرسوم البيعية لتحسين استخراج الميزات والتكيف الديناميكي، مما يحسن كفاءة معالجة البيانات متعددة المصادر ودقة معايرة العدالة. يحقق هذا النهج معايرة دقيقة وضمان العدالة في تقييمات التدريس. في اختبار المؤشر، حقق النموذج دقة 98.76٪ في ميزات تقييم التجميع، و98.05٪ في تصحيح العدالة، و0.968 في اتساق التصحيح عبر السيناريوهات في مجموعة التحقق. في مهمة اختبار قيمة الفقد، انخفض إجمالي فقدان النموذج من 0.1237 إلى 0.1018 خلال مهمة تصحيح تقييم التدريس في مجموعة التحقق. في اختبار المؤشر، حقق النموذج دقة 98.76٪ في ميزات تقييم التجميع، و98.05٪ في تصحيح العدالة، و0.968 في اتساق التصحيح عبر السيناريوهات في مجموعة التحقق. تشير النتائج التجريبية إلى أن النموذج المقترح يتفوق بشكل كبير على النماذج المقارنة، مما يعالج بفعالية مشاكل ضعف تكامل البيانات متعددة المصادر وتحيز العدالة في طرق المعايرة الحالية. علاوة على ذلك، يوفر أطرا خوارزمية مبتكرة لمطوري التكنولوجيا وأدوات تقنية موثوقة للإداريين التعليميين لتعزيز العدالة في التدريس. تكمن مساهمات البحث في: (1) دمج ثلاث وحدات أساسية، بما في ذلك معالجة البيانات متعددة المصادر، التحقق من مؤشر العدالة الديناميكي، وتصور قابلية التفسير؛ و(2) اقتراح نموذج تصحيح العدالة قائم على تحسين الشبكات العدائية التوليدية وأشجار تعزيز التدرج، الذي يكسر قيود تصحيح النموذج الواحد التقليدي ويتيح التعلم المنفصل لنمذجة الانحراف واتخاذ قرارات التصحيح.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يشكل تقييم ومعايرة التدريس جوهر ضمان جودة التدريس في التعليم الذكي. من خلال التحليل الديناميكي، وتصحيح الأخطاء، ومعايرة النتائج، توفر أساسا لتحسين التدريس والتعلم الشخصي. دقتها وعدالتها تؤثر بشكل مباشر على ما إذا كان التعليم الذكي قادرا على اختراق التحيزات التكنولوجية وتوفير دعم تعليمي متوازن 1,2. ومع ذلك، فإن الطرق الحالية لها عدة عيوب: فهي تعتمد على مصدر بيانات واحد، وتتجاهل الوضع الفعلي، وتؤدي إلى تحيز البيانات وتحيز التصحيح. غياب آلية ديناميكية للتكيف مع العدالة يجعل من الصعب تلبية احتياجات العدالة للتخصصات والسيناريوهات3،4. بالإضافة إلى ذلك، هناك قضايا مثل نقص مؤشرات العدالة والتحيز في استراتيجيات التصحيح عند التعامل مع بيانات متباينة من مصادر متعددة. لهذا الغرض، أجرى العلماء أبحاثا من أبعاد متعددة، مثل تقييم التعليم بمساعدة التنس بناء على خوارزمية مسار كثيف محسنة5. استخدم يين وآخرون عملية التسلسل الهرمي التحليلي وخوارزمية التوليف الضبابي لمراقبة التدريس عبر الإنترنت6. حلل تشين البيانات التعليمية لكبار السن باستخدام خوارزمية تنقيب بيانات محسنة لتحسين جودة التدريس.7.

على الرغم من أن هذه الدراسات أحرزت تقدما، إلا أن قضايا مثل تحيز نتائج المعايرة وضعف تنسيق العدالة لا تزال قائمة. لذلك، أصبح بناء نموذج يوفر معايرة دقيقة لتقييم التدريس وضمان العدالة الديناميكية محور بحث في التعليم الذكي. تتكيف الشبكة العدائية التوليدية (GAN) للقضاء على التأثير الضمني للسمات الحساسة على النتائج من خلال التدريب العدائي في الوقت الحقيقي بين المولد والمميز، مما يضمن تحديد المخرجات بواسطة عوامل أساسية بدلا من التحيز الناتج عن التسمية8. يظهر GAN مزايا في التعامل مع تحيزات المجموعات في بيانات التقييم ونمذجة قيود العدالة غير الخطية. اقترح تشينغ وآخرون خوارزمية تحسين صورة تعتمد على GAN لمعالجة الصور منخفضة الدقة. كان المولد يخرج صورا عالية الدقة من مدخلات منخفضة الدقة، وكان المميز يميز الصور المولدة عن الصور الحقيقية عالية الدقة. التدريب الخصمي يحسن المعلمات بحيث يقترب مخرج المولد من الصور الحقيقية9. اقترح كانغ وآخرون نموذج GAN متعدد الوسائط لتحسين كفاءة معالجة البيانات متعددة الوسائط في مجالات الطاقة المتجددة. يستقبل المولد بيانات أحادية النمط، ويميز المميز البيانات المولدة عن البيانات متعددة الوسائط الحقيقية، ويحسن التدريب الخصمي النموذج لتحسين الكفاءة10. خوارزمية شجرة قرار تعزيز التدرج (GBDT) هي خوارزمية كلاسيكية لمعالجة البيانات المنظمة ذات قدرة قوية على التقاط الميزات. من خلال دمج أشجار قرارات متعددة بشكل تكراري، يتعلم GBDT بدقة أنماط أخطاء البيانات ويظهر مزايا في معالجة معلومات التقييم متعددة المصادر وغير المتجانسة وتصحيح الانحرافات غير الخطيةفي النقاط 11,12. اقترح ميزونو وآخرون طريقة للتنبؤ بالمسار المعتمدة على GBDT لكوارث الأمطار الغزيرة، وتعلم ميزات المسارات والتنبؤ بمسارات الكوارث باستخدام بيانات في الوقت الحقيقي، مع اختيار التنبؤات المثلى من خلال أشجار قرار متعددة13. طور جاو وآخرون طريقة تحليل بصري مبنية على GBDT لتوقع معدل النقر في الإعلان، حيث تعلموا العلاقة بين الميزات البصرية وبيانات النقرات التاريخية للتنبؤ بمعدلات النقر للإعلانات الجديدة14. استنادا إلى التحديات السابقة، يهدف هذا البحث إلى الإجابة بشكل منهجي على السؤال العلمي الأساسي التالي: كيف يمكن بناء نموذج تقييم تعليمي ذكي لدمج البيانات متعددة المصادر والمتجانسة بكفاءة، والتكيف ديناميكيا مع سيناريوهات التدريس المختلفة، وفي الوقت نفسه ضمان دقة المعايرة وعدالة النتائج. للإجابة على هذا السؤال، تستخدم هذه الدراسة التأثير التآزري لآلية قيد العدالة في GAN والقدرة الدقيقة على معايرة الأخطاء في GBDT. علاوة على ذلك، تجرى أبحاث حول كيفية إدخال تقنيات متقدمة مثل معالجة اللغة الطبيعية (BERT)، التعلم المعزز (RL)، آليات الانتباه (AM)، شبكات الذاكرة قصيرة المدى طويلة (LSTM)، شبكات الانتباه البيانية (GAT)، وتقطير المعرفة (KD)، لتعويض القيود الكامنة في نموذج واحد في استخراج الميزات، والتكيف الديناميكي، وكفاءة الاستدلال. في النهاية، الهدف هو توفير حل معايرة لتقييم التدريس دقيق وعادل، ويتمتع بقدرات تعميم قوية لمجال التعليم الذكي.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تصميم وتحسين خوارزميات FairEduNet
تجمع الدراسة بين GAN وGBDT لبناء خوارزمية FairEduNet، محققة هدفين مزدوجين هما تصحيح العدالة وتصحيح الدقة، بدلا من التنازل بين التحسين أحادي الاتجاه. تعتمد FairEduNet بنية تعاونية ثنائية القناة: قناة العمود الفقري ل GBDT مسؤولة عن نمذجة الأخطاء المنظمة والتصحيح الدقيق، بينما تركز قناة GAN المساعدة على فصل السمات الحساسة وضبط العدالة ديناميكيا. هيكلية خوارزمية FairEduNet، التي تجمع بين GAN وGBDT، موضحة في الشكل 1.

figure-protocol-1
الشكل 1: بنية خوارزمية FairEduNet التي تجمع بين GAN و GBDT. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 1، تقوم FairEduNet أولا بجمع ومعالجة بيانات التقييم متعددة المصادر. يستخدم GBDT عدة أشجار قرار لتعلم أنماط أخطاء التقييم بشكل تكراري، ويخرج نتائج المعايرة الأولية، ويمررها إلى وحدة GAN. يقوم GAN بتدريب المميز على تعلم العلاقة بين نتائج المعايرة الأولية والسمات الحساسة، بينما يقوم المولد بضبط معلمات المعايرة ديناميكيا. من خلال جولات متعددة من التدريب العدائي والتحقق من العدالة، يتم تحسين تحيز العدالة. وأخيرا، يتم إعادة النتائج المعايرة للعدالة إلى وحدة GBDT، التي تعدل الدقة والعدالة، وتصدر أساس معايرة التقييم التعليمي وتقريرها. يحسب GBDT البواقي كما هو موضح في المعادلة (1).

figure-protocol-2(1)

في المعادلة (1)، figure-protocol-3 تمثل بقايا العينة رقم i في التكرار رقم t، وyi تمثل القيمة الحقيقية، وتمثل figure-protocol-4 قيمة التنبؤ للتكرار t-1. يتم عرض عملية العداء في GAN في المعادلة (2).

figure-protocol-5(2)

في المعادلة (2)، يمثل x نتيجة المعايرة الأولية، وz يمثل ميزات السمات الحساسة، وPdata(x)  يمثل التوزيع الحقيقي للميزات غير الحساسة، وPz(z) يمثل توزيع السمات الحساسة، وD يمثل المميز، وG يمثل المولد15. يظهر الناتج الأولي للمعايرة ل GBDT في المعادلة (3).

figure-protocol-6(3)

في المعادلة (3)، figure-protocol-7 تمثل التنبؤ بالعينة رقم i بواسطة شجرة القرار الأولية، وK يمثل العدد الكلي لأشجار القرار، γk يمثل وزن شجرة k، وhk(xi) يمثل مخرجات التنبؤ لشجرة k للشجرة i-العينة. يمكن لخوارزمية FairEduNet توفير معايرة دقيقة وضمان العدالة لبيانات تقييم التدريس. ومع ذلك، عند معالجة بيانات التقييم غير المنظمة والتكيف مع السيناريوهات الديناميكية، تظهر FairEduNet قدرة ضعيفة على استخراج الميزات للميزات غير المهيكلة، مما يؤدي إلى تحيز المعايرة. بالإضافة إلى ذلك، مؤشرات العدالة ومعايير المعايرة في FairEduNet محددة بشكل ثابت، مما يحد من قدرته على التكيف مع سيناريوهات التدريس المختلفة ويؤثر على جودة المعايرة العامة. يمكن لمزيج تمثيلات المشفرات ثنائية الاتجاه من المحولات (BERT) والتعلم المعزز (RL)، وهو خوارزمية BERT-RL، استخراج ميزات عميقة بدقة من نص غير منظم وتكييف معلمات السيناريو ديناميكيا دون تعيين عتبات ثابتة يدويا، مما يحسن أكثر موثوقية مخرجات الخوارزميات عبر السيناريوهات16,17. تعتمد الطرق التقليدية مثل TF-IDF على تكرار الكلمات لكنها تفتقر إلى فهم سياقي عميق ولا تستطيع التمييز بين اتجاهات محددة من "العدالة" في سيناريوهات مختلفة. ينتج Word2Vec متجهات كلمات ثابتة، تكافح للتكيف مع التغيرات السياقية المعقدة وتتعرف على التحيز غير المباشر. يستخدم BERT الانتباه الذاتي متعدد الطبقات لترميز السياق ثنائي الاتجاه، حيث يلتقط كل من المصطلحات المتحيزة الصريحة والمنطق الضمني المتحيز. تتطلب الأساليب التقليدية قوائم كلمات تحيزية يدويا، وتعتمد على الخبرة الشخصية، وتغطي سيناريوهات محدودة. من خلال التعلم المدرب مسبقا على نقل النماذج، يتعلم BERT تلقائيا الميزات الدلالية العميقة دون جهد يدوي كبير، مما يوفر تعميما أقوى في التعرف على التحيز الغامض. علاوة على ذلك، غالبا ما تفقد الطرق التقليدية المعلومات مع النصوص الطويلة، بينما يدعم BERT حتى 512 رمزا، مما يحافظ على العلاقات السياقية، ويحدد بدقة ميزات التحيز، ويتيح تصحيحا دقيقا للعدالة. يتم عرض عملية تشغيل BERT-RL في الشكل 2.

figure-protocol-8
الشكل 2: مخطط تدفق لخوارزمية BERT-RHL. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 2، يقوم BERT-RL أولا بتوحيد بيانات تقييم النصوص غير المنظمة ويدخلها في نموذج BERT. يستخدم BERT مشفر محول للنمذجة الدلالية ثنائية الاتجاه لاستخراج الميزات الرئيسية وبناء مصفوفة الميزات. يتم إدخال مصفوفة الميزات في وحدة التعلم المنطقي، التي تتعلم الاستراتيجية المثلى من خلال تكرارات متعددة. يتم أخيرا إدخال تكوين المعلمات المحسن إلى FairEduNet، مما يحسن من قابليته للتكيف. يتم عرض حساب وزن ميزة الانتباه الذاتي بواسطة BERT في المعادلة (4).

figure-protocol-9(4)

في المعادلة (4)، يمثل dk بعد المتجه K. يتم التعبير عن دالة المكافأة متعددة الأهداف في التعلم المنطقي في المعادلة (5).

figure-protocol-10(5)

في المعادلة (5)، تمثل ω1، ω 2، وω3 معاملات الوزن، وتمثل figure-protocol-11 خطأ المعايرة، وDt هو انحراف العدالة، وDالهدف هو انحراف عدالة الهدف، وT t هو زمن التشغيل18. تجمع هذه الدراسة بين BERT-RL وFairEduNet لتشكيل خوارزمية BERT-RL-FairEduNet، المعروفة باسم BFEN. يحقق BFEN معايرة دقيقة وضمان عدالة لبيانات تقييم التعليم من خلال تكرار ميزات GBDT والتدريب التنافسي في الوقت الحقيقي على GAN، بينما يحسن BERT-RL FairEduNet في التعامل مع البيانات غير المنظمة والتكيف ديناميكيا مع السيناريوهات، مع معالجة نقاط ضعف في استخراج الميزات وقيود المعاملات الثابتة. استخدمت الدراسة نموذج BERT-base-China، ودربت مسبقا مجموعة سجلات التدريس الحقيقية، والنصوص المسجلة في الفصول الدراسية، ووثائق السياسات التعليمية من المنصة الوطنية للتعليم الذكي للعام الدراسي 2024 إلى 2025، بحجم مفردات 21128. البعد الطبقي المخفي للنموذج هو 768، مع 12 رأس انتباه و12 طبقة. تم تعيين عمق شجرة GBDT إلى 8، وعدد الأشجار 200، ومعدل التعلم 0.1. دورة تدريب GAN تتكون من 150 طلقة، ويستخدم المميز شبكة متصلة بالكامل مكونة من ثلاث طبقات بأحجام 512، 256، و1. يستخدم المولد شبكة متصلة بالكامل مكونة من أربع طبقات بأحجام 1024، 512، 256، و1. عدد الوحدات المخفية في LSTM هو 128، وطول التسلسل هو 512. GAT يحتوي على طبقتين وأربعة رؤوس انتباه. درجة حرارة تقطير المعرفة مضبوطة على 3.0. معاملات وزن المكافأة في RL ω1 = 0.4، ω2 = 0.35، و ω3 = 0.25. معايير اختيار الوزن تهدف إلى موازنة توازن باريتو الأمامي للتحسين متعدد الأهداف مع متطلبات قابلية التفسير في ممارسات العدالة التعليمية. تم إكمال التجارب باستخدام تقسيم بيانات بنسبة 50٪ عبر التحقق المتقاطع وضبط المعاملات الفائقة. يتم عرض عملية BFEN لمعايرة التقييم التعليمي في الشكل 3.

figure-protocol-12
الشكل 3: عملية تصحيح خوارزمية BFEN لتقييم التعليم الذكي والتعليم. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 3، يقوم BFEN أولا بمعالجة بيانات تقييم التدريس متعددة المصادر. يقوم BERT بتحسين قدرة FairEduNet على استخراج الميزات من خلال حساب التشابه الدلالي النصي وأوزان الميزات العميقة بناء على نافذة دلالية، واختيار الميزات المهمة لبناء مصفوفة سماطية عالية الأبعاد. ثم يحدد RL دالة مكافأة متعددة الأهداف ويحسب تدرجات التكيف مع السيناريوهات وتعديل المعلمات لتحسين عتبات العدالة ومعايير المعايرة. يحسب FairEduNet الانحرافات بين بيانات التقييم ونماذج أنماط الخطأ، ويقوم بتحديث أوزان شجرة القرار بشكل تكراري، ويعدل استراتيجيات المعايرة حتى تستقر الأخطاء ضمن عتبات محددة مسبقا. يشمل الناتج النهائي نموذج معايرة الخطأ وتقرير التحقق من العدالة. يتم تطبيق نموذج المعايرة على بيانات التقييم التعليمية، حيث ينتج جداول مقارنة قبل وبعد المعايرة، والتي تدمج مع مكتبة معيار عدالة التعليم الذكي لتحديد معايير المعايرة المستهدفة، مما يوفر أساسا علميا لمعايرة التقييم التدريسي في التعليم الذكي. تغطي هذه المكتبة القياسية ثلاثة أبعاد من عدالة الفرص التعليمية، وعدالة العمليات، وعدالة النتائج، وتشمل 12 مؤشرا أساسيا. تشمل هذه المؤشرات توازن تخصيص الموارد التعليمية بين المناطق، والفرق في تغطية البنية التحتية الرقمية بين المدارس الحضرية والريفية، وعتبة التسامح مع الاستجابة المتأخرة لتشخيص حالة التعلم (≤200 مللي ثانية)، وتحمل البيانات المفقودة في التقييم متعدد الوسائط (≤3.5٪)، وحساسية اكتشاف تحيز الخوارزمية (انحراف AUC لتصنيف الجنس/المنطقة/المرحلة ≤ 0.02)، عتبة التباعد في كينغز لتوزيع الدرجات قبل وبعد التصحيح (≤0.08)، ودرجة قابلية التفسير لاقتراحات تدخل المعلمين (≥4.2/5.0)، وتوقيت تحديثات ملفات الطالب (تم الانتهاء خلال T + 1 يوم)، ومعامل الاتساق للاعتراف بالاعتمادات عبر المنصات (≥0.93)، ودقة توافق دلالة سياسات التعليم (درجة BERT ≥ 0.86)، واكتمال تقرير التحقق من العدالة (بما في ذلك نسبة التحيز، فترات الثقة، ولقطات معلمات قابلة للتكرار)، بالإضافة إلى معدل نجاح التحقق من تكيف السيناريوهات الديناميكي الذي يغطي ثلاثة سيناريوهات نموذجية: الفصل الحي، الواجبات غير المتزامنة، ومساعدي التدريس بالذكاء الاصطناعي. يتم عرض حساب التشابه الدلالي للميزات في المعادلة (6).

figure-protocol-13(6)

في المعادلة (6)، fi تمثل قيمة البعد الدلالي i، gi تمثل قيمة البعد المهم للميزة التقييمية i، وn يمثل العدد الإجمالي لأبعاد الميزة. يتم عرض حساب معامل تكييف سيناريو التعلم المعزز في المعادلة (7).

figure-protocol-14(7)

في المعادلة (7)، تمثل θt قيمة المعلمة عند التكرار رقم t، وتمثل α معدل التعلم، وتمثل figure-protocol-15 تدرج المعلمات بناء على دالة المكافأة R(θt).

بناء نموذج معايرة التقييم التعليمي
على الرغم من أن BFEN يظهر بعض المزايا في معايرة التقييم التعليمية، إلا أنه لا يزال يواجه كفاءة تكامل منخفضة لبيانات التقييم متعددة المصادر وغير كاف في التكيف مع العدالة الديناميكية في التطبيقات العملية. خوارزمية AM-LSTM، التي تجمع بين آلية الانتباه (AM) والذاكرة طويلة المدى قصيرة المدى (LSTM)، تمنح أوزانا للميزات الرئيسية لبيانات التقييم متعددة المصادر عبر AM وتلتقط أنماط التغير الديناميكي لبيانات التقييم عبر الزمن باستخدام قدرة الذاكرة التسلسلية في LSTM. هذا النهج يحسن بشكل فعال كفاءة دمج البيانات متعددة المصادر والتعلم الديناميكي للميزات19,20. يتم عرض عملية تشغيل AM-LSTM في الشكل 4.

figure-protocol-16
الشكل 4: مخطط تدفق تشغيل AM-LSTM. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 4، تقوم AM-LSTM أولا بمعالجة بيانات تقييم التعليم متعددة المصادر وغير المتجانسة لتشكيل مجموعة بيانات موحدة. يحسب AM أوزان الانتباه للميزات من مصادر بيانات مختلفة لاختيار الميزات المهمة ويبني مصفوفة ميزات موزونة. يتم إدخال مصفوفة الميزات المرجحة في LSTM، الذي يستخدم آلية البوابات الخاصة به لتعلم الأنماط الديناميكية مع مرور الوقت، حيث يلتقط العلاقات بين بيانات التقييم في مراحل مختلفة ويخرج متجهات الميزات الديناميكية. أخيرا، يتم دمج هذه المتجهات الديناميكية مع قيود العدالة لتوليد نتائج معايرة وسيطة تتكيف مع تكامل البيانات متعددة المصادر والسيناريوهات الديناميكية، مما يوفر أساسا لتحسين النموذج لاحقا. يتم عرض حساب وزن الانتباه في المعادلة (8).

figure-protocol-17(8)

في المعادلة (8)، يمثلn تخصيص الانتباه للميزة رقم n، وxn يمثل التشابه، وq يمثل متجه الاستعلام، وsoftmax يمثل دالة التفعيل. يتم التعبير عن بوابة النسيان في LSTM في المعادلة (9).

figure-protocol-18(9)

في المعادلة (9)، Wf هو وزن بوابة النسيان، bf هو انحياز بوابة النسيان، xt هو المدخل في الزمن t، ht-1 هو متغير الحالة الخارجية عند الزمن t-1، و σ يمثل دالة السيجمويد21. تجمع هذه الدراسة بين AM-LSTM وBFEN لبناء نموذج معايرة التقييم التعليمي AM-LSTM-BFEN، المعروف باسم FBFEN. في هذا النموذج، يعالج AM-LSTM حدود BFEN في كفاءة تكامل البيانات متعددة المصادر واستخلاص الميزات الديناميكي. كما يدمج قيود العدالة لتحسين نتائج المعايرة الوسيطة، مما يمكن BFEN من تحقيق معايرة دقيقة وضمان عدالة ديناميكي لبيانات التقييم التعليمية. يتم عرض عملية تشغيل FBFEN في الشكل 5.

figure-protocol-19
الشكل 5: عملية تشغيل نموذج تقييم وتصحيح التعليم FBFEN. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 5، يقوم FBFEN أولا بمعالجة بيانات تقييم التعليم متعددة المصادر الأصلية ويدخل مجموعة البيانات الموحدة في وحدة AM-LSTM. يحسب AM أوزان انتباه الميزات، بينما يتعلم LSTM الأنماط الديناميكية، ويخرج نتائج معايرة متوسطة تدمج المعلومات متعددة المصادر والميزات الديناميكية. ثم تدخل النتائج الوسيطة في وحدة BFEN. يتعلم GBDT أنماط الخطأ في بيانات التقييم بشكل تكراري بناء على النتائج الوسيطة ونموذج الخطأ المحدد مسبقا، مما يخرج نتائج معايرة أولية. وفي الوقت نفسه، يحلل GAN تحيز العدالة الناتج عن السمات الحساسة في النتائج الأولية من خلال التدريب التنافسي بين المولد والمميز، مع تعديل معلمات المعايرة ديناميكيا لإزالة التحيز. وأخيرا، تعاد معلمات المعايرة المحسنة ل GAN إلى GBDT لتحديث أوزان شجرة القرار واستراتيجيات المعايرة، مما ينتج نتيجة معايرة ثانوية توازن بين الدقة والعدالة. يتم التعبير عن توحيد البيانات في المعادلة (10).

figure-protocol-20(10)

في المعادلة (10)، تمثل z' القيمة الموحدة، وz تمثل القيمة الأصلية، وzmin  وzmax تمثل القيم الدنيا والعظمى. يتم التعبير عن دالة الهدف النهائية لمولد GAN في المعادلة (11).

figure-protocol-21(11)

في المعادلة (11)، يمثل N عدد التكرارات، وλ عامل الوزن المفقود، وωi عامل الوزن للتكرار i، figure-protocol-22 ويمثل دالة الخسارة العدائية، ويمثل figure-protocol-23 فقدان الإنتروبيا العرضيةالثنائية 22.

تحسين نموذج معايرة التقييم التعليمي من FBFEN
على الرغم من أن FBFEN يظهر تكامل قويا للبيانات متعددة المصادر وضمان عدالة ديناميكية في معايرة تقييم التعليم، إلا أنه لا يزال يواجه ضعف في الارتباط بالميزات وكفاءة تدريب واستدلالات منخفضة بسبب بنية النماذج المعقدة في السيناريوهات التعليمية المعقدة. تقوم خوارزمية GAT-KD، التي تجمع بين شبكة انتباه الرسوم البيانية (GAT) وتقطير المعرفة (KD)، ببناء رسم بياني للارتباط الدلالي بين الميزات ديناميكيا من خلال آلية الانتباه في GAT، مما يعزز المحاذاة الدلالية للبيانات متعددة المصادر. يقوم KD بضغط معرفة النموذج المعقد إلى شبكة خفيفة الوزن، مما يحسن بشكل كبير كفاءة الاستدلال مع الحفاظ على أداء النموذج23,24. يتم عرض عملية تشغيل GAT-KD في الشكل 6.

figure-protocol-24
الشكل 6: مخطط تدفق التشغيل GAT-KD. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 6، يقوم GAT-KD بإنشاء رسم بياني للارتباط الدلالي بين الميزات من خلال وحدة GAT، ويجمع معلومات ميزات الجوار ديناميكيا باستخدام آلية الانتباه، ويعزز التمثيل الدلالي للميزات المحلية. تستخدم KD بعد ذلك تسميات الإخراج الناعمة كإشارات إشراف، مما يقلل من فقدان التباين بين توزيعات الإخراج وفقدان الإنتروبيا المتقاطع بين توقعاته والتسميات الحقيقية، محققا نقل المعرفة وضغط النموذج. الناتج النهائي هو نموذج معايرة خفيف الوزن بدقة وكفاءة عالية. يتم عرض حساب معامل الانتباه في GAT في المعادلة (12).

figure-protocol-25(12)

في المعادلة (12)، figure-protocol-26 وتمثل figure-protocol-27 متجهات الميزات للعقدتين i و j، تمثل W مصفوفة الوزن القابلة للتعلم، وa تمثل متجه وزن الانتباه، figure-protocol-28 وتمثل عملية الربط بين الركب، وتمثل LeakyReLU دالة التفعيل25. يتم عرض حساب دالة الخسارة ب KD في المعادلة (13).

figure-protocol-29(13)

في المعادلة (13)، تمثل KL فقدان التباعد، وT2 تمثل توازن التدرج، وpطالب تمثل احتمال التسمية الناعمة للنموذج الخفيف الخفيف، وpمعلم يمثل احتمال التسمية الناعمة للنموذجالمركب 26. من خلال الجمع بين ارتباط الميزات المعززة بالانتباه ونقل المعرفة الخفيف، يعالج GAT-KD بفعالية انحياز الخصائص الدلالي والتعقيد الحاسوبي العالي. تدمج هذه الدراسة GAT-KD في FBFEN لتشكيل نموذج معايرة تقييم التعليم GAT-KD-FBFEN، المعروف باسم GFBFEN. يحسن GAT-KD أوجه القصور في FBFEN في التقاط الارتباطات متعددة المصادر غير الكامل وكفاءة الاستدلال المنخفضة. يتم عرض عملية تشغيل GFBFEN في الشكل 7.

figure-protocol-30
الشكل 7: عملية تشغيل نموذج تقييم وتصحيح التعليم في GFBFEN. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 7، يقوم GFBFEN بتوحيد بيانات تقييم التدريس متعددة المصادر. يقوم GAT بنمذجة العلاقات المعقدة بين الميزات ويحسب ديناميكيا أوزان الارتباط الدلالي بين العقد باستخدام آليات الانتباه. يقوم KD بضغط معرفة النموذج المركب إلى شبكة خفيفة الوزن، مما يحسن بشكل كبير كفاءة الاستدلال مع الحفاظ على الدقة. تمنح وحدة AM-LSTM أوزان أهمية للميزات متعددة المصادر وتلتقط أنماط ديناميكية زمنية لبيانات التقييم، مما يخرج نتائج معايرة وسيطة تدمج معلومات متعددة المصادر. يتم إدخال هذه النتائج في وحدة BFEN للمعالجة العميقة. على وجه التحديد، يستخرج BERT الميزات الدلالية من النص غير المنظم، ويعزز التعلم المعزز بشكل ديناميكي عتبات العدالة ومعلمات المعايرة، ويتعلم GBDT أنماط الخطأ بشكل تكراري للمعايرة الأولية، ويقضي GAN على التحيزات الناتجة عن السمات الحساسة من خلال التدريب الخصمي. تقوم آلية تعديل المعلمات الديناميكية تلقائيا بمعايرة حساسية الاستجابة وأوزان العدالة لكل وحدة من خلال استشعار التغيرات الزمنية وتحولات توزيع المجموعات في مشهد التدريس في الوقت الحقيقي، مما يحل مشكلة عدم القدرة على التكيف الناجم عن تكوين المعلمات الثابتة، ويضمن أن النموذج يمكنه الحفاظ على المتانة والعدالة في مراحل التدريس المختلفة. مجموعات الطلاب، وسيناريوهات التقييم. يؤثر نوع التقييم بشكل مباشر على الدقة ودورة التغذية الراجعة لنمذجة السلاسل الزمنية، بينما يؤكد التقييم التكويني على الطبيعة الديناميكية للعملية. تحدد الفروقات في التخصصات توزيع الميزات بين وحدات BERT وGBDT. لذلك، يمكن لاعتماد آلية تعديل ديناميكية أن يتكيف بفعالية مع أنواع التقييم المختلفة وخصائص التخصص. وأخيرا، من خلال جولات متعددة من تغذية راجعة المعلمات والتحسين التكراري، ينتج النموذج نتائج معايرة دقيقة وعادلة لتقييم التدريس. يتم التعبير عن دالة تحسين قيود العدالة الديناميكية في المعادلة (14).

figure-protocol-31(14)

في المعادلة (14)، تمثل S مجموعة السمات الحساسة، وتمثل figure-protocol-32 نتيجة معايرة الناتج المتوقع، figure-protocol-33 وتمثل تباين التنبؤات داخل المجموعات، γ تمثل معلمات بين المجموعات، وتمثل figure-protocol-34 القيمة المتوقعة الكلية. الحساب التكيفي لأوزان اندماج الميزات متعددة المصادر موضح في المعادلة (15).

figure-protocol-35(15)

في المعادلة (15)، يمثل wk وزن ميزة مصدر البيانات k، β يمثل معامل الوزن، Sim يمثل دالة قياس تشابه الميزات، fk يمثل متجه الميزة المستخرج من مصدر البيانات k، f global يمثل مركز الميزة العالمي، وK يمثل العدد الإجمالي لمصادر البيانات. حددت الدراسة أوزان السمات الحساسة، بما في ذلك الجنس، والعرق، والمنطقة، والوضع الاقتصادي للأسرة، والخلفية اللغوية الأم. يتم تحديد الأوزان بناء على نتائج تحليل الارتباط. استخدمت الدراسة معامل الارتباط بيرسون ومعامل الارتباط الترتيبي لسبيرمان كمؤشرات مزدوجة للتقييم المشترك، إلى جانب الخبرة الخبيرة في مجال التعليم لمعايرة الوزن. أسفر التحديد النهائي للأوزان لكل سمة حساسة عن قيم 0.18 للجنس، 0.22 للعرق، 0.25 للمنطقة، 0.19 للوضع الاقتصادي الأسري، و0.16 للخلفية الأم. الجنس: الهوية الجندرية حسب التسجيل القانوني وتحديد الذات، ثنائية (ذكر/أنثى) مع خيارات غير ثنائية؛ حقل البيانات "الجنس". العرق: بناء على الهوية العرقية الوطنية ل 56 مجموعة، متوافقة مع المجموعات غير المحددة وعبر الحدود؛ حقل البيانات "العرق". المنطقة: التقسيم الإداري لتسجيل الأسرة أو الإقامة طويلة الأمد، يشمل المستويات الإقليمية والبلدية والمقاطعات، مع الأخذ في الاعتبار الهيكل المزدوج بين الحضر والريفي والسكان المهاجرين؛ حقل البيانات "المنطقة". الحالة الاقتصادية للأسرة: وفقا للمعايير الإحصائية الوطنية ومؤشرات المساعدة التعليمية، باستخدام تصنيف من خمسة مستويات؛ حقل البيانات "economic_status". خلفية اللغة الأم: لغة التعليم الأساسي ولغة التواصل الأسري خلال التعليم الأساسي، وتشمل الماندرين، ولغات الأقليات، واللهجات، واللغات الأجنبية، مع وزن حسب عمر الاكتساب وتكرار الاكتساب؛ حقل البيانات "mother_tongue."

اعتمدت عملية التصحيح آلية وزن ديناميكي ثلاثية المراحل. نفذت المرحلة الأولى تحديد الانحراف الأولي بناء على مصفوفة الوزن للسمات الحساسة، مع تحديد نقاط البيانات التي انحرفت بشكل كبير عن مركز الميزات العالمي في أبعاد مثل الجنس، والعرق، والمنطقة. تقدم المرحلة الثانية قيودا للسياق التعليمي لإعادة تأهيل شدة الانحراف بطريقة واعية للسياق. تتحقق المرحلة الثالثة من استقرار التصحيح من خلال اختبارات الاضطراب المضاد، حيث تستبدل بشكل منهجي قيم السمات الحساسة مع الحفاظ على الميزات غير الحساسة دون تغيير، وتلاحظ ما إذا كان التغير في درجات التقييم ضمن عتبة ±±3.2٪.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تحليل أداء خوارزمية BFEN
شملت المؤشرات التي تم تقييمها في التجارب ما يلي:

تشير دقة تصحيح التقييم (ECA) إلى نسبة العناصر الانحرافية التي تم تحديدها وتصحيحها بشكل صحيح بواسطة النموذج ضمن نتائج تقييم التدريس، مما يعكس الفعالية العامة لآلية التصحيح. تشير القيم الأعلى إلى دقة تصحيح أعلى.

يقيس معدل انحراف العدالة (FDR) حجم الفوارق في الدرجات بين المجموعات التي يفشل النموذج في القضاء عليها أثناء عملية المعايرة. يتم حسابها كنسبة الانحراف المعياري لكل سمة حساسة (مثل الجنس، المنطقة، العرق) ضمن توزيع الدرجات إلى الانحراف المعياري الكلي؛ تعني القيم الأقل تقليل التباين بين المجموعات وضمان عدالة أكثر قوة.

يشير معدل تكيف السيناريوهات (SAR) إلى نسبة المهام التصحيحية التي نفذها النموذج بنجاح عبر سياقات تعليمية متنوعة (مثل العلوم مقابل العلوم الإنسانية، والبيئات الإلكترونية مقابل البيئات غير المتصلة بالإنترنت).

درجة الحفاظ على العدالة (FMD) تعرف بأنها واحدة ناقص نسبة تباين مؤشرات العدالة بين مجموعات السمات الحساسة بعد التصحيح إلى تلك التي لوحظت قبل التصحيح، مما يعكس قدرة النظام على الحفاظ على عدالته الهيكلية أثناء عملية المعايرة.

يحسب معدل التعرف على الميزات التخصصية (DFRR) نسبة العينات التي تم فيها تحديد الميزات الأساسية بشكل صحيح ضمن بيانات تقييم كل تخصص مقارنة بحجم عينة التقييم الكلي، مما يدل على قدرة النموذج على تمييز والتقاط الاختلافات الخاصة بالمجال.

تشير كفاءة دمج البيانات متعددة المصادر (MDFE) إلى كفاءة النقل في النموذج أثناء محاذاة الميزات، وتخصيص الوزن، وتصحيح الانحراف عند دمج بيانات التقييم متعددة المصادر وغير المتجانسة. يعرف هذا المقياس الشامل بأنه حاصل ضرب عدد عينات التقييم المعالجة في الثانية (عينات/ثانية) ومعدل الامتثال لثبات التصحيح (عند >95٪ من مستوى الثقة)، حيث تشير القيم الأعلى إلى خط أنابيب اندماج أكثر كفاءة واستقرارا.

يشير استقرار نتيجة التصحيح (CRS) إلى اتساق مخرجات المعايرة عبر عدة جولات مستقلة، ويتم قياسه بعكس الانحراف المعياري للمسافة الإقليدية بين مخرجات التصحيح لكل جولة تحت مدخلات متطابقة. القيم الأعلى تدل على زيادة موثوقية النظام.

يمثل زمن تصحيح البيانات الواحد (SDCT) متوسط زمن التأخير الحسابي الذي يستهلكه النموذج لإكمال معايرة عينة تقييم واحدة، يقاس بالملي ثانية (ms); تشير القيم المنخفضة إلى قدرة استجابة أقوى في الوقت الحقيقي.

يقيس الخطأ المطلق المصحح (CAE) متوسط الخطأ المطلق بين التنبؤات المعايرة وقيم الحقيقة الأرضية، ويمثل الانحراف المتبقي للنموذج بالنسبة للبيانات الأصلية غير المعايرة. تشير القيم المنخفضة إلى أن المخرجات المعايرة تتماشى بشكل أوثق مع مستويات الأداء الحقيقية.

الخطأ النسبي المصحح (CRE) يقيس متوسط الخطأ المطلق بين التنبؤات المعايرة وقيم الحقيقة الأرضية المعبر عنها كنسبة مئوية من الحقيقة الأرضية، مع القيم الأدنى التي تشير إلى دقة معايرة نسبية أعلى.

يمثل معدل دقة التصحيح (CAR) نسبة العينات التي يكون خطأها المطلق بعد المعايرة < 0.5 بالنسبة لحجم العينة الكلي، مما يدل على موثوقية النموذج في تحقيق قيود الدقة المحددة مسبقا. القيم العالية تؤكد الفائدة التجريبية ومصداقية المخرجات.

تمثل قيمة الخسارة الكلية (TL) القيمة الشاملة لهدف التحسين المستمدة من الجمع المرجح لمصطلحات الخسارة الفرعية الفردية عند إكمال المهمة. على وجه التحديد، يتم توحيد سبعة مقاييس—DFRR، MDFE، CRS، SDCT، CAE، CRE، وCAR—من خلال تطبيع درجة Z ويتم وزنها وفقا لأولوية التشغيل لمهام التقييم. بالنظر إلى متجه الوزن [0.15، 0.12، 0.1، 0.08، 0.13، 0.12، 0.1]، يتم تجميع هذه القيم السبعة للمؤشرات الطبيعية لحساب الخسارة النهائية.

تقييم دقة تجميع الميزات (EFCA) يقيم درجة التوافق بين تكوينات التجميع غير المراقبة التي يولدها النموذج وفئات الحقيقة الأرضية التي تم التحقق منها من قبل خبراء المجال.

تقيس كفاءة معالجة البيانات عالية الأبعاد (HDPE) عدد العينات التي خضعت لتقليل أبعاد الميزات وتصحيح الانحراف لكل وحدة زمنية عند التعامل مع متجهات متفرقة عالية الأبعاد تحتوي على ≥50 ميزة تقييم. عند قياسها بالعينات/الثانية، تعكس القيم الأعلى قدرة أكثر قوة على معالجة مدخلات التقييم المعقدة وواسعة النطاق في الوقت الحقيقي.

تقيم دقة تصحيح العدالة (FCP) توحيد تأثيرات المعايرة عبر مجموعات الطلاب المتباينة. يتم قياس هذا المقياس عن طريق حساب متوسط توزيع مسافة كولموغوروف-سميرنوف للأخطاء المطلقة المصححة عبر المجموعات الفرعية للسمات الحساسة؛ القيم المنخفضة تعني أداء أكثر توازنا بين المجموعات وضمان عدالة أقوى.

يحدد اتساق التصحيح عبر المشاهد (CSCC) التوزيع التعويضي لنتائج المعايرة عبر ثلاثة سيناريوهات نموذجية—وهي التقييم الصفي، والتقييم العملي، والاختبار عبر الإنترنت—ويتم نمذجة نسبة مسافة واسرشتاين.

للتحقق من أداء خوارزمية معايرة تقييم التعليم المقترحة BFEN، قارنتها الدراسة بخوارزمية PRF التي جمعت بين تحليل المكونات الرئيسية (PCA) والغابة العشوائية (RF)؛ خوارزمية EAB، التي جمعت بين آلة التعلم المتطرف (ELM) والتعزيز التكيفي (AdaBoost)؛ وخوارزمية DBLR، التي جمعت بين شبكة المعتقدات العميقة (DBN) والانحدار اللوجستي (LR). أجريت التجارب على نظام مزود بمعالج Intel Core i9-13900HX ووحدة معالجة رسومات NVIDIA RTX 4080، مما وفر قدرة حوسبة متوازية عالية وذاكرة فيديو كبيرة لإكمال حسابات استخراج الميزات ومعايرتها بكفاءة لبيانات تقييم التعليم واسعة النطاق. كان نظام التشغيل هو ويندوز 11، وبايثون 3.9 كان يستخدم في البرمجة. تم تنفيذ الخوارزميات باستخدام مكتبة Scikit-learn، وتم تطوير وحدات التعلم العميق عبر إطار TensorFlow، وتم استخدام مكتبات Pandas وNumPy لمعالجة البيانات مسبقا. استخدمت بيئة التطوير PyCharm Professional 2023.1، وتم تطبيق Seaborn لعرض نتائج المعايرة لتسهيل المقارنة البديهية لأداء الخوارزميات. لضمان موثوقية البيانات، استخدمت الدراسة مجموعة بيانات تقرير مراقبة التعليم العالمي1 ومجموعة بيانات الأداء الأكاديمي لطلاب المرحلة الإعداديةالإسبانية 2. تحتوي مجموعة البيانات على 12,486 سجلا تغطي بيانات تقييم التدريس متعددة الوسائط مثل تقييمات تدريس أعضاء هيئة التدريس الجامعية، الأداء الأكاديمي للطلاب، تقييمات التدريس الطلاب، وتغذية راجعة المقررات، وتشمل 137 ميزة بعد تدريسي، بما في ذلك تكرار التفاعل في الصف، وسرعة تغذية راجعة الواجبات، وثبات الدرجات، وشمولية اللغة، والحساسية عبر الثقافات. المتغير المستهدف هو درجة تقييم التدريس، والتي يتم في هذه الدراسة تعيينها إلى قيمة مركبة متعددة الأبعاد موزونة يتم معايرتها من قبل الخبراء. تدمج الأبحاث أربعة أنواع من مصادر المعلومات: تقييمات تدريس الطلاب، مراجعات الأقران، الملاحظات الإشرافية في الفصول الدراسية، ومراجعات ملفات التدريس، بأوزان 0.35، 0.25، 0.25، و0.15 على التوالي. يتم تقسيم مجموعات التدريب والتحقق حسب الترتيب الزمني بين مجموعتي البيانات. تستخدم الدراسة بيانات من سبتمبر 2024 كمجموعة تدريب، وبيانات من أكتوبر 2024 إلى يونيو 2025 كمجموعة تحقق لتتوافق مع التقدم الزمني للتقييمات التعليمية. في مرحلة المعالجة المسبقة، يتم استخدام استراتيجية خاصة بالنمط، حيث يتم توحيد الميزات المنظمة عبر تطبيع درجة Z وتحويل القيم الشذية إلى Winsorized، بينما يتم ترميز الميزات النصية باستخدام نموذج BERT-صيني الأساسي ويتم تقليصها إلى 768 بعدا. يتم تطبيق التدريب العدائي لتعزيز الصلابة ضد تعبيرات التحيز الضمني والتخفيف من الانحراف الدلالي الناتج عن الاختلافات الثقافية في الخلفية.

لتحقيق تدريب وأبحاث التحقق عبر المجالات، سيتم نقل النموذج إلى أربعة سيناريوهات تدريسية متجانسة: التعليم الأساسي من الروضة حتى الصف الثاني عشر، التعليم المهني، التعليم المستمر، والتعليم الصيني الدولي مع التحقق من العينة صفر أو قليلة. في هذه السيناريوهات الأربعة، تقدم الدراسة مصطلحات تنظيم المجالات التكيفي أثناء تدريب الخوارزميات لتقييد اتساق توزيع الميزات للنموذج في سيناريوهات تدريسية مختلفة. تضمين آلية قناع خفيفة الواعية لبناء الجملة لضوضاء الجمل القصيرة في سيناريوهات K-12؛ لمعالجة غموض المصطلحات المهنية في التعليم المهني، يتم إنشاء قاموس مجال ديناميكي ودمجه مع مخطط معرفة المنهج الدراسي. صمم وحدة تعلم مقارنة الفئات العمرية لمعالجة الفجوة الدلالية بين الأجيال في التعليم المستمر، مواءمة الروابط الدلالية لتعبيرات تقييم الفئات العمرية المختلفة في الفضاء الكامن. لمعالجة التعبير الثقافي عن العبء الثقافي في التعليم الصيني الدولي، تستخدم محفزات المقارنة عبر اللغات لضبط دقيق لتعزيز متانة فهم المفاهيم التعليمية غير الحرفية. بحث في المعايرة واختبار الموثوقية الخبيرة للحقول المنظمة في سجلات التقييم الأصلية، مع إزالة الإدخالات منخفضة الموثوقية التي يكون معامل ألفا كريبندورف أقل من 0.75. تم تطبيق التعليق اليدوي مزدوج التعمية على نصوص تقييم الطلاب، حيث قام ثلاثة خبراء قياس تعليمي بإكمال تصنيف نوع الانحراف بشكل مستقل، محققين اتساق كوهين k = 0.86 في التعليقات. وأخيرا، تم التحقق من النتائج المشروحة مع سجلات حضور الإشراف واستنتاجات مراجعة ملفات التدريس لإنشاء تسميات المعايرة النهائية.

نشأت مجموعات البيانات المختارة من مجموعات سكانية مختلفة، وأنظمة قياس، وخلفيات تعليمية. اختبر هذا النموذج الكبير للتحقق عبر المجالات بشكل صارم مدى صلابة وحدود التعميم للنموذج ضمن نظام تعليمي أصيل، مما منع أوهام التقييم الناتجة عن توحيد البيانات. احتوى كلا المستودعين على كميات كبيرة من سجلات تقييم التدريس، مما يوفر قيمة مرجعية مباشرة لنشر خوارزميات التعليم الذكية الواعية للعدالة. احتوت كلتا المجموعتين على بيانات تقييم تعليمية كبيرة، مما يوفر قيما مرجعية مباشرة لتصميم خوارزميات التعليم الذكي الواعية للعدالة ومعايرة تقييم التدريس. قامت الدراسة بمعايرة 1000 سجل تقييم تعليمي باستخدام الخوارزميات الأربع وحسبت سجلات ECA وFDR الخاصة بها. تظهر النتائج في الشكل 8.

figure-results-1
الشكل 8: مقارنة نتائج الاختبارات بين ECA وFDR. (أ) BFEN. (ب) PRF. (ج) EAB. (D) DBLR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 8A، حقق BFEN في البداية ECA بنسبة 82.47٪ وFDR بنسبة 5.71٪ في مهمة معايرة التقييم. مع زيادة عدد السجلات المعايرة، ارتفع مؤشر ECA إلى 98.75٪ واستقر بعد معايرة 421 سجلة، بينما انخفض مؤشر FDR إلى 2.87٪ واستقر بعد معايرة 514 سجلة. كما هو موضح في الشكل 8B، زاد منحنى ECA لخوارزمية PRF تدريجيا، بينما انخفض خط FDR ببطء. في نهاية مهمة المعايرة، كانت قيمة ECA الخاصة بها 92.30٪، وقيمة PDR 6.72٪. يوضح الشكل 8C أن منحنى ECA لخوارزمية EAB ارتفع بسرعة قبل أن يتسطح، بينما أظهر مسار FDR تقلبات شديدة في المراحل المبكرة قبل التقارب، وانتهى ب ECA بنسبة 84.64٪ وFDR بنسبة 8.93٪. كما هو موضح في الشكل 8D، أظهرت خوارزمية DBLR مسارا تصاعديا بطئا في ECA مصحوبا بتقلبات هامشية وضغط محدود في خط FDR الخاص بها، منهية مهمة المعايرة بمعدل ECA بنسبة 83.51٪ وFDR بنسبة 8.42٪. تؤكد هذه النتائج التجريبية أن خوارزمية BFEN تتفوق بشكل كبير على الأساليب الأساسية في كل من دقة تصحيح التقييم والتحكم في تحيز العدالة. تعزى هذه القدرة المتفوقة على التعميم إلى دمج BERT داخل BFEN، الذي يستخرج ميزات دلالية عميقة من نص التقييم غير المنظم لالتقاط تعبيرات التحيز المخفي، بينما تقوم وحدة التعلم المعزز بتحسين عتبات العدالة ومعاملات التصحيح ديناميكيا عبر دالة مكافأة متعددة الأهداف لفصل السمات الحساسة عن المخرجات النهائية. ثم اختبرت الدراسة SAR وFMD في التقييم الصفي، والامتحانات النهائية، والتقييم العملي، والتقييم عبر الإنترنت، مع تصنيف السيناريوهات الأربعة ب وB وC وD. تظهر النتائج في الشكل 9.

figure-results-2
الشكل 9: مقارنة بين SAR وFMD تؤدي إلى سيناريوهات مختلفة. (أ) نتائج اختبار البحث والإنقاذ. (ب) نتائج اختبار FMD. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 9A، حقق BFEN معدل تقييم أعلى من 98٪ في جميع سيناريوهات التدريس، مع أعلى معدل تقييم إيجابي بلغ 99.01٪ في اختبارات الفصول الدراسية. معدل التقييم الذاتي لخوارزمية المقارنة في السيناريوهات المختلفة أقل من خوارزمية BFEN، والتي تحتوي على خوارزمية DBLR الأدنى لمعدل التقييم النهائي بين جميع الخوارزميات، بمعدل 70.23٪. كما هو موضح في الشكل 9B، لا يزال FMD في خوارزمية BFEN أعلى بشكل ملحوظ من خوارزمية المقارنة في سيناريوهات تعليمية مختلفة، مع معدلات FMD بلغت 98.47٪، 98.05٪، 97.81٪، و97.94٪ في سيناريوهات مختلفة على التوالي. القيم النقدية النقدية لخوارزمية DBLR المعيارية هي 82.36٪، 71.74٪، 70.59٪، و69.12٪ على التوالي. مستويات FMD في خوارزمية EAB هي 80.79٪، 68.21٪، 67.65٪، و66.03٪ على التوالي، بينما FMDs في خوارزمية PRF هي 86.42٪، 82.17٪، 80.98٪، و78.33٪ على التوالي. أظهرت هذه النتائج أن BFEN تفوق على خوارزميات المقارنة بفضل التعلم التكراري ل GBDT مع أشجار قرارات متعددة، والتي التقطت بدقة أنماط الخطأ عبر السيناريوهات وضمنت نتائج معايرة مستقرة وعادلة. كما قيمت الدراسة معدل التعرف على الميزات التخصصية (DFRR) للغة الصينية والرياضيات والإنجليزية باستخدام الخوارزميات الأربع. النتائج موضحة في الشكل 10.

figure-results-3
الشكل 10: مقارنة نتائج اختبارات DFRR في تخصصات مختلفة. (أ) مجموعة تدريب. (ب) مجموعة التحقق. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 10A، حقق BFEN نسبة DFRR بلغت 99.23٪، 98.94٪، و99.13٪ للصينية والرياضيات والإنجليزية في مجموعة التدريب. أظهر الشكل 10B أن BFEN حقق أيضا DFRR أعلى في مجموعة التحقق مقارنة بالخوارزميات الأخرى. على وجه التحديد، وصل مؤشر DFRR التابع لشركة BFEN للصين إلى 98.41٪، بزيادة 10.8٪ عن DBLR البالغ 87.61٪؛ أما الرياضيات، ف97.54٪، وأعلى بنسبة 9.07٪ من PRF البالغ 88.47٪؛ أما بالنسبة للإنجليزية، فهو 98.13٪، وهو أعلى بنسبة 13.34٪ من EAB البالغ 84.79٪. أكدت هذه النتائج أن BFEN تكيف بكفاءة مع معايرة التقييم التخصصي من خلال دمج التقاط BERT العميق للفروق الدلالية مع التعلم الشخصي لأنماط الخطأ من GBDT. لتقييم أداء BFEN بشكل شامل، قامت الدراسة بتقييم MDFE وCRS وSDCT للخوارزميات الأربع. تعرض النتائج في الجدول 1.

مجموعة البياناتالخوارزميةMDFE (٪)CRSSDCT (s)
التدريبBFEN98.42 ± 0.28*&@0.975 ± 0.28*&@0.78 ± 0.04*&@
PRF83.85 ± 0.410.779 ± 0.361.32 ± 0.08
EAB85.91 ± 0.500.806 ± 0.401.15 ± 0.07
DBLR88.76 ± 0.470.753 ± 0.391.45 ± 0.08
التحقق من الصحةBFEN97.58 ± 0.25*&@0.968 ± 0.27*&@0.86 ± 0.03*&@
PRF81.62 ± 0.320.687 ± 0.501.51 ± 0.06
EAB84.37 ± 0.400.749 ± 0.421.28 ± 0.05
DBLR87.53 ± 0.300.728 ± 0.471.63 ± 0.07

الجدول 1: مقارنة نتائج اختبارات MDFE وCRS وSDCT. يشير "*" إلى فرق كبير (p < 0.05) بين نتائج BFEN وPRF. تشير "&" إلى أن الفرق بين نتائج BFEN وEAB كان ذا دلالة كبيرة (p < 0.05). "@" يشير إلى أن الفرق بين نتائج BFEN وDBLR كبير (p < 0.05)

يشير الجدول 1 إلى أن BFEN حقق MDFE بنسبة 98.42٪ في مجموعة التدريب، وأعلى بنسبة 14.57٪ من نسبة PRF البالغة 83.85٪، ونسبة CRS بلغت 0.975، ونسبة تقييم تقييم 0.222 من 0.753 في DBLR، ونسبة SDCT بمقدار 0.78 ثانية، أي أقل ب0.67 ثانية من نسبة DBLR التي بلغت 1.45 ثانية. في مجموعة التحقق، حافظ BFEN على أداء متفوق، حيث تفوق MDFE وCRS وSDCT بنسبة 97.58٪، 0.968، و0.86 ثانية على التوالي على خوارزميات المقارنة. بشكل عام، أكدت النتائج الأداء الشامل المتفوق ل BFEN في معايرة التقييم التعليمي.

نموذج معايرة تقييم التعليم GFBFEN التحقق من الأداء
استنادا إلى التحقق من صحة أداء BFEN، قامت الدراسة بتقييم أداء نموذج معايرة تقييم التعليم GFBFEN المبني على BFEN وقارنته مع نماذج المعايرة المبنية باستخدام خوارزميات PRF وEAB وDBLR. لضمان ظروف اختبار متسقة وقابلية المقارنة، خدمت مجموعة بيانات تقرير مراقبة التعليم العالمية كمجموعة تدريب، بينما كانت مجموعة بيانات أداء الطلاب الأكاديميين الجامعية بمثابة مجموعة التحقق. قامت النماذج الأربعة بمعايرة 500 سجل تقييم تعليمي، وتم حساب CAE وCRE الخاصة بهم. تظهر النتائج في الشكل 11.

figure-results-4
الشكل 11: مقارنة نتائج اختبار CAE وCRE. (أ) نتائج اختبار CAE. (ب) نتائج اختبار CRE. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 11A، حقق GFBFEN في البداية معدل CAE يبلغ 0.1279. مع تقدم المعايرة، انخفض مؤشر CAE إلى 0.0641 واستقر بعد 104 أرقام قياسية. كانت نماذج المقارنة تحقق CAE أولية ونهائية أعلى من GFBFEN، حيث كان لدى EAB أعلى CAE ابتدائي ونهائي بقيمة 0.1858 و0.1217 على التوالي. أشار الشكل 11B إلى أن CRE الأولي والنهائي ل GFBFEN خلال مهمة المعايرة ظلا أقل من نماذج المقارنة، بقيم 0.1137 و0.0912 على التوالي. أظهرت هذه النتائج أن GFBFEN أظهر قدرة ملاءمة قوية، مستفيدا من آلية الانتباه في GAT، التي أنشأت رسوم بيانية دلالية للارتباط بين الميزات، وعززت المحاذاة الدلالية لبيانات التقييم متعددة المصادر، وقللت من المعايرة غير الفعالة الناتجة عن تحيز الميزات. ثم قيمت الدراسة CAR لبيانات تقييم الطلاب، وبيانات تقييم المعلمين، وبيانات تقييم المدارس، وبيانات التقييم عبر الإنترنت، الموسومة ب I وII وIII وIV. تظهر النتائج في الشكل 12.

figure-results-5
الشكل 12: مقارنة نتائج CAR لبيانات تقييم مختلفة. (أ) GFBFEN. (ب) PRF. (ج) EAB. (D) DBLR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 12A، حقق GFBFEN معدل CAR بنسبة 99.34٪، 98.93٪، 99.01٪، و99.12٪ لبيانات التقييم للطلاب والمعلمين والمدارس وعبر الإنترنت في مجموعة التدريب. في مجموعة التحقق، كانت قيم CAR 97.89٪، 98.56٪، 97.57٪، و98.46٪ على التوالي. أظهر الشكل 12B–D أن نماذج المقارنة كانت لديها CAR أقل في كل من مجموعات التدريب والتحقق. من بينهم، كان أداء EAB الأسوأ في مجموعة التحقق، حيث بلغت نسبة CAR 76.31٪ لبيانات المعلمين و78.29٪ للبيانات عبر الإنترنت. أكدت هذه النتائج أن GFBFEN تفوق بشكل ملحوظ على نماذج المقارنة. بعد ذلك، اختبرت الدراسة ال TL في مهمة معايرة تقييم التدريس لتقييم قدرة الملاءمة وثبات التدريب. تظهر النتائج في الشكل 13.

figure-results-6
الشكل 13: نتائج اختبار ملاءمة النموذج واستقرار التدريب. (أ) GFBFEN. (ب) PRF. (ج) EAB. (D) DBLR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 13A، كان لدى GFBFEN في البداية TL 0.1021 في مجموعة التدريب. بعد 67 تكرارا، انخفض TL إلى 0.0725 واستقر. في مجموعة التحقق، انخفض TL من 0.1237 إلى 0.1018. أشارت الشكل 13B–D إلى أن TL النهائي ل PRF في مجموعة التدريب كان 0.0824، وTL النهائي ل EAB في مجموعة التحقق كان 0.1178، وTL ل DBLR في كلتا المجموعتين كان غير مستقر وأعلى بكثير من النماذج الأخرى. أظهرت هذه النتائج أن GFBFEN أظهر قدرة قوية على التوافق واستقرار التدريب، مستفيدا من نقل المعرفة القائم على KD، مما سمح للنموذج بتعلم الميزات الفعالة بسرعة، وتسريع تقارب الفقدان، وضمان التعميم عبر مجموعات البيانات. للتحقق بشكل شامل من أداء GFBFEN الأساسية، اختبرت الدراسة EFCA وHDPE وFCP وCSCC للنماذج الأربعة. تظهر النتائج في الشكل 14.

figure-results-7
الشكل 14: نتائج اختبارات المؤشرات الشاملة لمهام التقييم والتصحيح التعليمية. (أ) نتائج اختبار GFBFEN. (ب) نتائج اختبار PRF. (ج) نتائج اختبار EAB. (D) نتائج اختبار DBLR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

كما هو موضح في الشكل 14A–D، فإن نموذج GFBFEN لديه قيم EFCA تبلغ 99.35٪ و98.76٪ في مجموعتي التدريب والتحقق على التوالي. نسبة EFCA لنموذج PRF هي 88.53٪ و87.04٪ على التوالي. في مجموعة التحقق، كان EFCA لنموذج GFBFEN أعلى بنسبة 6.59٪ من نموذج EAB عند 92.17٪، وأعلى بنسبة 11.72٪ من نموذج DBLR بنسبة 87.04٪. بالإضافة إلى ذلك، فإن مؤشرات HDPE وFCP وCSCC رائدة بشكل شامل: في مجموعة التحقق، وصل HDPE لنموذج GFBFEN إلى 98.05٪، ووصل FCP إلى 97.93٪، وCSCC إلى 0.968، وجميعها تفوقت على نماذج PRF وEAB وDBLR. بشكل عام، أكدت هذه النتائج الأداء الشامل المتفوق ل GFBFEN، مما أظهر أن التحسين المنسق للنموذج ل GAT-KD وAM-LSTM وBFEN حسن بشكل فعال دقة المعايرة والكفاءة والعدالة في التقييم التعليمي.

تم بناء البحث تدريجيا على FairEduNet وBFEN وFBFEN وGFBFEN، ويشمل النهائي GFBFEN مكونات مثل FairEduNet وBERT-RL وAM-LSTM وGAT-KD. للتحقق من المساهمة المستقلة للمكونات الفردية، تجرى تجارب بحثية وتصميم للاستئصال، مع إزالة كل مكون تدريجيا وتقييم تأثيره على الأداء العام. تشمل المؤشرات المقارنة ECA، FDR، SAR، وFMD. أظهرت النتائج أن قيمة ECA لمكون FairEduNet وحده كانت 87.32٪، وFDR كانت 12.45٪، وSAR 89.67٪، وFMD 11.89٪. بلغ ECA لنموذج GFBFEN الكامل 99.21٪، وانخفض FDR أكثر إلى 1.93٪، وظل SAR مستقرا عند 99.45٪، وتم تحسين FMD إلى 7.28٪. بعد إزالة BERT-RL، انخفض ECA إلى 91.04٪، وكانت قيمة FDR 6.23٪، وSAR 92.33٪، وارتفعت FMD إلى 7.85٪. زاد استئصال AM-LSTM من تقلبات SAR بنسبة 14.2٪. أدى إزالة GAT-KD إلى زيادة في اضطراب اللياقة القلاعية إلى 8.36٪، وكانت آلية قمع انتشار انحياز بنية الرسم البياني الموجهة بتقطير المعرفة فعالة بشكل ملحوظ في تخفيف التحيز الضمني بين السكان.

لاختبار طرق البحث بشكل أعمق، قدمت الدراسة مؤشرات معايير العدالة المعتمدة، وهي معيار تصحيح العدالة (FCB)، الذي يغطي ثلاثة أنواع من القيود الصارمة المعترف بها على نطاق واسع في السيناريوهات التعليمية: (1) القيمة المطلقة للفرق المتوسط بعد التصحيح بين المجموعات هي ≤ 1.2 نقطة (بناء على نظام النسب المئوية)؛ (2) معدل التداخل لفترات الثقة المصححة لكل مجموعة سمة حساسة هو ≥ 95٪؛ (3) في أي سيناريو واحد، يجب أن تلبي المنطقة المشتركة الممكنة لروزفلت وSAR قيد حدود باريتو (أي أنه من المستحيل تحسين SAR دون تدهور FDR، والعكس صحيح). تمت مقارنة نموذج GFBFEN مع نماذج الأساس السائدة مثل EAB وPRF وDBR وGBDT في التقييم التجريبي. أجريت التجربة على 421 بيانات تقييم حقيقية جمعت من سيناريوهات تدريس فعلية، تغطي ثلاثة سيناريوهات تعليمية نموذجية: التقييم الصفي، التقييم العملي، والاختبار عبر الإنترنت. تظهر النتائج في الجدول 2.

الخوارزميةالقيمة المطلقة لفرق متوسط الدرجاتمعدل تداخل فترة الثقة (٪)معدل رضا المناطق المشتركة الممكنة (٪)التقييم الشامل
GFBFEN0.8798.310097.2
EBA1.5298.482.678.5
PRF1.6885.174.371.2
DBLR1.4587.979.875.6
GBDT1.3391.286.479.9

الجدول 2: نتائج تقييم مؤشرات معايير العدالة والتحقق العملي من التطبيقات.

كما هو موضح في الجدول 2، حقق GFBFEN الامتثال الكامل لجميع القيود الصلبة الأربعة ل FCB بشكل مستقل، وتفوق درجته الشاملة بشكل كبير على النماذج الأساسية الأخرى بفارق +18.7 نقطة، مما يؤكد متانة نموذج التصحيح التعاوني متعدد المراحل المقترح. على وجه الخصوص، في المؤشر الأساسي الذي يعكس قدرة المقايضة بين العدالة والكفاءة، وصل معدل تغطية المنطقة الممكنة المشتركة إلى 100٪، مما يشير إلى أن النموذج يمتلك قدرات اتخاذ القرار المثلى القابلة للنشر في سيناريوهات تعليمية حقيقية.

تشير العدالة في تقييم التدريس إلى استخدام القيود الكمية القابلة للتحقق كمعيار مع احترام الفروق الفردية والقوانين التعليمية. تعتمد منطق الحساب وتحديد العتبة لمؤشرات العدالة على الإطار النظري للعدالة التعليمية ومعايير التحقق التجريبية من البيانات. يتم مراجعتها بشكل مشترك من قبل لجنة خبراء مكونة من خمسة علماء لضمان درجة عالية من الوحدة بين الصرامة النظرية وقابلية التكيف مع الممارسة التعليمية. ولتعزيز قابلية التكيف للنموذج تحت معايير العدالة المختلفة، أجرت الدراسة المزيد من التحقق بموجب معايير متعددة. تم اختيار ثلاثة معايير للعدالة للتحقق. المعيار 1 هو توازن معدلات القبول بين المجموعات بناء على التكافؤ الديموغرافي. المعيار 2 هو الاتساق بين المجموعات بين معدل الإيجابي الحقيقي والمعدل الإيجابي الكاذب بناء على احتمالات متساوية. المعيار 3 يعتمد على التماثل التنبؤي للتحكم في التحيز بين المجموعات في دقة التنبؤ. وجد أن GFBFEN استوفى باستمرار متطلبات القيود الصارمة بموجب المعايير الثلاثة. انحراف معدل قبول المجموعة القياسي 1 ≤1.2٪، معدل الإيجابي الحقيقي/خاطئ المعيار 2 بين الفرق بين المجموعات ≤0.85٪، دقة التنبؤ القياسية 3 انحراف بين المجموعات متحكم ±±0.6٪. على النقيض من ذلك، أظهرت النماذج الأخرى اختراقا في القيود بنسبة ≥3.7٪ تحت معيار واحد على الأقل، مما يؤكد توافق GFBFEN في التعميم لنماذج العدالة متعددة المتغيرات.

توفر البيانات:
لضمان موثوقية البيانات، استخدمت الدراسة مجموعة بيانات تقرير مراقبة التعليم العالمي (https://www.education-progress.org/) وبيانات الأداء الأكاديمي لطلاب المدارس الإعدادية الإسبانية (https://archive.ics.uci.edu/dataset/320/student+performance). يتم تقسيم مجموعات التدريب والتحقق حسب الترتيب الزمني بين مجموعتي البيانات. تستخدم الدراسة بيانات من سبتمبر 2024 كمجموعة تدريب ومن أكتوبر 2024 إلى يونيو 2025 كمجموعة تحقق، متوافقة مع التقدم الزمني للتقييمات التعليمية.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

أظهرت خوارزمية BFEN المقترحة في هذه الدراسة أداء متفوقا في التجارب المقارنة. من وجهة نظر ECA وFDR، تفوق بشكل كبير على خوارزميات PRF وEAB وDBLR. عند معايرة سجل تقييم 421، رفع BFEN ECA إلى 98.75٪ وحافظ على الاستقرار، بينما انخفض FDR إلى 2.87٪. نتج هذا الأداء عن دمج BERT-RL لتحسين الميزات والتكيف الديناميكي. استخرج BERT بدقة معلومات التحيز الدلالي العميق من نصوص التقييم غير المنظمة، وقام التعلم المعزز بضبط عتبات العدالة ومعلمات المعايرة ديناميكيا من خلال دالة مكافأة متعددة الأهداف، مما ألغى تأثير السمات الحساسة على النتائج. وهذا مشابه للعمل الذي أجراه فالنسيا-لوندوño وآخرون، الذين استخدموا خوارزميات الذكاء الاصطناعي لبناء نموذج إدماج تعليمي للبالغين الذين يعانون من اضطرابات عصبية عضلية مختلفة. على الرغم من التحقق من نموذج الشمول التعليمي المنشأ من حيث الجدوى ضمن مجموعات الأمراض العصبية العضلية المحددة، إلا أن قيود العدالة شملت بعدا واحدا فقط (تمثيل متساو للمجموعات التشخيصية)، ولم يتم تحديد نظام قيود صارم عبر مجموعات متعددة وأهداف متعددة27. في اختبارات عبر سيناريوهات تدريس مختلفة، حقق BFEN معدل تقييم نقدي بلغ 99.01٪ للتقييمات الصفية ومعدل FMD بلغ 97.81٪ للتقييمات العملية، وهو أعلى بكثير من نماذج المقارنة. نشأت هذه الميزة من التعلم التكراري لأنماط الأخطاء عبر بيانات تقييم سيناريوهات متعددة، إلى جانب مكتبة معايير العدالة الذكية للتعليم لمطابقة معايير المعايرة المستهدفة، مما يقلل بشكل فعال من تحيز المعايرة وعدم توازن العدالة الناتج عن اختلافات السيناريوهات. مقارنة بنظام تقييم الذكاء الاصطناعي العادل والتكيفي والقابل للتفسير الذي اقترحه كومار وآخرون، والذي يدمج حلقات تغذية راجعة الخبراء البشرية ووحدات التحقق من العدالة عبر اللغات، رغم أنه يقدم هذه الخصائص، إلا أنه يفشل في نمذجة سلاسل التحيز الضمني في نصوص التقييم في مجال التقييم التعليمي، الذي يتميز بكثافة دلالية عالية واعتماد قوي على السياق28. هذه الدراسة أكثر تكاملا من حيث الضمان الصارم لقيود العدالة والترابط العميق للنمذجة الدلالية التعليمية مقارنة بالأدبيات28.

في مهام تقييم التعليم الذكي العملي، أظهر نموذج GFBFEN المبني على BFEN أيضا مزايا ملحوظة. بالنسبة ل 500 سجل معايرة، حقق GFBFEN معدل CAE نهائي يبلغ 0.0641 وCRE بنسبة 0.0912. تجاوز CAR الخاص به لأنواع متعددة من بيانات التقييم 97٪ في كل من مجموعات التدريب والتحقق. نتج هذا الأداء عن تحسين ارتباط الميزات في GAT-KD ومعالجته الخفيفة. أنشأت GAT رسوم بيانية ارتباطية دلالية بين الميزات لتقليل تحيز ميزات البيانات متعددة المصادر، بينما عزز نقل المعرفة في KD كفاءة الاستدلال دون المساس بدقة النموذج، مما تجنب تأخيرات المعايرة الناتجة عن تعقيد النموذج. مقارنة بالأبحاث التي أجراها ديهو وآخرون حول تأثير انحراف مجموعات البيانات على عدالة نماذج تحليل التعلم، رغم تركيز دراستهم على آلية تأثير انحراف البيانات على العدالة، اعتمدت استراتيجيات التصحيح على إعادة الوزن الثابت والتعويض بعد الحدث، حيث افتقرت إلى القدرة على إدراك والاستجابة الديناميكية للانحرافات الدلالية في الوقت الحقيقي. كان من الصعب التعامل مع تطور التحيزات الضمنية في التقييم التعليمي الناتجة عن التعبيرات الذاتية للمعلمين واختلافات أساليب لغة الطلاب. ومع ذلك، فإن هذه الدراسة، من خلال نموذج GFBFEN، تدرك وتستجيب ديناميكيا للانحرافات الدلالية في دلالات التقييم، حيث تلتقط النزعات الضمنية للقيمة في تعليقات المعلمين، والانحرافات في أسلوب اللغة في نصوص استجابة الطلاب، والانحراف الدلالي في تعبيرات التقييم عبر الصفوف/المواد، محققة تحولا جذريا من "التعويض الثابت" إلى "المعايرة الديناميكية"29. في اختبار المقياس الأساسي، حقق GFBFEN معدل EFCA بنسبة 99.35٪ و98.76٪ في مجموعات التدريب والتحقق على التوالي، ونسبة FCP بنسبة 98.52٪ و97.93٪، أعلى بشكل ملحوظ من نماذج المقارنة. مماثل لنظام الامتحانات المفتوح مع التقييم التلقائي المعتمد على الذكاء الاصطناعي الذي طوره فريق ديماري A، رغم أنه حقق درجة عالية من الاتساق في تقييم الإجابات المفتوحة، إلا أن تصحيح العدالة يعتمد فقط على الوزن المحدد مسبقا لأبعاد التقييم ومكتبة العينات المتحيزة التي يلاحظها البشر، دون تضمين آلية تعليمية لتطور ديناميكي دلالي. لقد حقق هذا البحث اختراقات جوهرية في آلية التطور الديناميكي لتصحيح العدالة ونمذجة الدلالات التعليمية العميقة مقارنة بنتائج فريق ديماري أ، مع إظهار قوة قوية وقابلية للتفسير في مواجهة التحديات الواقعية مثل انحراف توجه القيم لتعليقات المعلمين، والفروق بين الأجيال في أساليب لغة الطلاب. والغموض في تعبيرات التقييم متعددة التخصصات30.

ساهمت هذه الدراسة في ثلاثة جوانب. أولا، دمجت خوارزمية BFEN BERT-RL مع FairEduNet، مما حسن كفاءة المعالجة والقدرة على التكيف في سيناريوهات متعددة للبيانات متعددة المصادر وغير المتجانسة من خلال تحسين الميزات الدلالية وتعديل المعلمات الديناميكية. ثانيا، قدم نموذج GFBFEN، المبني على GAT-KD وFBFEN، التعلم المرتبط الدلالي ونقل المعرفة الخفيف، مما حل مشاكل ضعف الارتباط السماتي وكفاءة الاستدلال المنخفضة في السيناريوهات التعليمية المعقدة، مما عزز العملية في معايرة التقييم. ثالثا، تم تطبيق النماذج لمعايرة المواد المختلفة وأنواع التقييم، مما يوفر الدعم الفني لتقييم التدريس الدقيق وتعزيز العدالة التعليمية. قدمت هذه المساهمات نهجا جديدا لمعايرة تقييم التعليم الذكي ومرجعا للتعاون المتعدد بين الخوارزميات في معالجة البيانات التعليمية المعقدة.

تفتقر طرق معايرة التقييم الذكي الحالية إلى التكيف والعدالة. تقترح هذه الدراسة نموذج GFBFEN بناء على FairEduNet، باستخدام GAN وGBDT لمعايرة العدالة. يعزز BERT-RL المعالجة غير المنظمة للبيانات، ويحسن AM-LSTM دمج البيانات متعدد المصادر، ويعزز GAT-KD الارتباط بالميزات وخفة الوزن. من خلال دمج هذه الخوارزميات، يحقق النموذج معايرة دقيقة وعدالة ديناميكية. تظهر الاختبارات معالجة بيانات متعددة المصادر ممتازة ومعايرة العدالة عبر السيناريوهات، تلبي متطلبات الدقة والعدالة. ومع ذلك، فإن النموذج لديه قيود مع مجموعات التعليم الخاص، ويحتاج إلى تعميم أفضل. سيعمل العمل المستقبلي على تحسين المعايير وتعديل قيود العدالة لسيناريوهات متنوعة، مما يدعم العدالة التعليمية وجودة التدريس.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المؤلف ليس لديه ما يكشفه.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصرح المؤلف بعدم وجود تضارب مصالح.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
مجموعة بيانات تقرير رصد التعليم العالمياليونسكوhttps://www.education-progress.org/مجموعة البيانات
NumPyNumPyhttps://numpy.org/معالجة البيانات المسبقة
PandasPandas, NumPyhttps://pandas.pydata.org/معالجة البيانات المسبقة
PyCharm Professional 2023.1PyCharm الإصدار 2023.1بيئة التطوير
Python 3.9Python الإصدار 3.9‌لغة البرمجة
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/index.htmlالتعلم الآلي
SeabornSeabornhttps://seaborn.pydata.org/التصور
مجموعة بيانات أداء طلاب المدارس المتوسطة في إسبانيامستودع تعلم الآلة بجامعة كاليفورنيا، إرفينhttps://archive.ics.uci.edu/dataset/320/student+performanceمجموعة البيانات
TensorFlowTensorFlowhttps://www.tensorflow.org/التعلم العميق
Windows 11مايكروسوفتالإصدار 11نظام التشغيل

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

EngineeringIntelligent educationFairEduNetTeaching assessment calibrationGenerative Adversarial NetworkGradient boosting decision tree

Related Articles