$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تحليل أداء خوارزمية BFEN
شملت المؤشرات التي تم تقييمها في التجارب ما يلي:
تشير دقة تصحيح التقييم (ECA) إلى نسبة العناصر الانحرافية التي تم تحديدها وتصحيحها بشكل صحيح بواسطة النموذج ضمن نتائج تقييم التدريس، مما يعكس الفعالية العامة لآلية التصحيح. تشير القيم الأعلى إلى دقة تصحيح أعلى.
يقيس معدل انحراف العدالة (FDR) حجم الفوارق في الدرجات بين المجموعات التي يفشل النموذج في القضاء عليها أثناء عملية المعايرة. يتم حسابها كنسبة الانحراف المعياري لكل سمة حساسة (مثل الجنس، المنطقة، العرق) ضمن توزيع الدرجات إلى الانحراف المعياري الكلي؛ تعني القيم الأقل تقليل التباين بين المجموعات وضمان عدالة أكثر قوة.
يشير معدل تكيف السيناريوهات (SAR) إلى نسبة المهام التصحيحية التي نفذها النموذج بنجاح عبر سياقات تعليمية متنوعة (مثل العلوم مقابل العلوم الإنسانية، والبيئات الإلكترونية مقابل البيئات غير المتصلة بالإنترنت).
درجة الحفاظ على العدالة (FMD) تعرف بأنها واحدة ناقص نسبة تباين مؤشرات العدالة بين مجموعات السمات الحساسة بعد التصحيح إلى تلك التي لوحظت قبل التصحيح، مما يعكس قدرة النظام على الحفاظ على عدالته الهيكلية أثناء عملية المعايرة.
يحسب معدل التعرف على الميزات التخصصية (DFRR) نسبة العينات التي تم فيها تحديد الميزات الأساسية بشكل صحيح ضمن بيانات تقييم كل تخصص مقارنة بحجم عينة التقييم الكلي، مما يدل على قدرة النموذج على تمييز والتقاط الاختلافات الخاصة بالمجال.
تشير كفاءة دمج البيانات متعددة المصادر (MDFE) إلى كفاءة النقل في النموذج أثناء محاذاة الميزات، وتخصيص الوزن، وتصحيح الانحراف عند دمج بيانات التقييم متعددة المصادر وغير المتجانسة. يعرف هذا المقياس الشامل بأنه حاصل ضرب عدد عينات التقييم المعالجة في الثانية (عينات/ثانية) ومعدل الامتثال لثبات التصحيح (عند >95٪ من مستوى الثقة)، حيث تشير القيم الأعلى إلى خط أنابيب اندماج أكثر كفاءة واستقرارا.
يشير استقرار نتيجة التصحيح (CRS) إلى اتساق مخرجات المعايرة عبر عدة جولات مستقلة، ويتم قياسه بعكس الانحراف المعياري للمسافة الإقليدية بين مخرجات التصحيح لكل جولة تحت مدخلات متطابقة. القيم الأعلى تدل على زيادة موثوقية النظام.
يمثل زمن تصحيح البيانات الواحد (SDCT) متوسط زمن التأخير الحسابي الذي يستهلكه النموذج لإكمال معايرة عينة تقييم واحدة، يقاس بالملي ثانية (ms); تشير القيم المنخفضة إلى قدرة استجابة أقوى في الوقت الحقيقي.
يقيس الخطأ المطلق المصحح (CAE) متوسط الخطأ المطلق بين التنبؤات المعايرة وقيم الحقيقة الأرضية، ويمثل الانحراف المتبقي للنموذج بالنسبة للبيانات الأصلية غير المعايرة. تشير القيم المنخفضة إلى أن المخرجات المعايرة تتماشى بشكل أوثق مع مستويات الأداء الحقيقية.
الخطأ النسبي المصحح (CRE) يقيس متوسط الخطأ المطلق بين التنبؤات المعايرة وقيم الحقيقة الأرضية المعبر عنها كنسبة مئوية من الحقيقة الأرضية، مع القيم الأدنى التي تشير إلى دقة معايرة نسبية أعلى.
يمثل معدل دقة التصحيح (CAR) نسبة العينات التي يكون خطأها المطلق بعد المعايرة < 0.5 بالنسبة لحجم العينة الكلي، مما يدل على موثوقية النموذج في تحقيق قيود الدقة المحددة مسبقا. القيم العالية تؤكد الفائدة التجريبية ومصداقية المخرجات.
تمثل قيمة الخسارة الكلية (TL) القيمة الشاملة لهدف التحسين المستمدة من الجمع المرجح لمصطلحات الخسارة الفرعية الفردية عند إكمال المهمة. على وجه التحديد، يتم توحيد سبعة مقاييس—DFRR، MDFE، CRS، SDCT، CAE، CRE، وCAR—من خلال تطبيع درجة Z ويتم وزنها وفقا لأولوية التشغيل لمهام التقييم. بالنظر إلى متجه الوزن [0.15، 0.12، 0.1، 0.08، 0.13، 0.12، 0.1]، يتم تجميع هذه القيم السبعة للمؤشرات الطبيعية لحساب الخسارة النهائية.
تقييم دقة تجميع الميزات (EFCA) يقيم درجة التوافق بين تكوينات التجميع غير المراقبة التي يولدها النموذج وفئات الحقيقة الأرضية التي تم التحقق منها من قبل خبراء المجال.
تقيس كفاءة معالجة البيانات عالية الأبعاد (HDPE) عدد العينات التي خضعت لتقليل أبعاد الميزات وتصحيح الانحراف لكل وحدة زمنية عند التعامل مع متجهات متفرقة عالية الأبعاد تحتوي على ≥50 ميزة تقييم. عند قياسها بالعينات/الثانية، تعكس القيم الأعلى قدرة أكثر قوة على معالجة مدخلات التقييم المعقدة وواسعة النطاق في الوقت الحقيقي.
تقيم دقة تصحيح العدالة (FCP) توحيد تأثيرات المعايرة عبر مجموعات الطلاب المتباينة. يتم قياس هذا المقياس عن طريق حساب متوسط توزيع مسافة كولموغوروف-سميرنوف للأخطاء المطلقة المصححة عبر المجموعات الفرعية للسمات الحساسة؛ القيم المنخفضة تعني أداء أكثر توازنا بين المجموعات وضمان عدالة أقوى.
يحدد اتساق التصحيح عبر المشاهد (CSCC) التوزيع التعويضي لنتائج المعايرة عبر ثلاثة سيناريوهات نموذجية—وهي التقييم الصفي، والتقييم العملي، والاختبار عبر الإنترنت—ويتم نمذجة نسبة مسافة واسرشتاين.
للتحقق من أداء خوارزمية معايرة تقييم التعليم المقترحة BFEN، قارنتها الدراسة بخوارزمية PRF التي جمعت بين تحليل المكونات الرئيسية (PCA) والغابة العشوائية (RF)؛ خوارزمية EAB، التي جمعت بين آلة التعلم المتطرف (ELM) والتعزيز التكيفي (AdaBoost)؛ وخوارزمية DBLR، التي جمعت بين شبكة المعتقدات العميقة (DBN) والانحدار اللوجستي (LR). أجريت التجارب على نظام مزود بمعالج Intel Core i9-13900HX ووحدة معالجة رسومات NVIDIA RTX 4080، مما وفر قدرة حوسبة متوازية عالية وذاكرة فيديو كبيرة لإكمال حسابات استخراج الميزات ومعايرتها بكفاءة لبيانات تقييم التعليم واسعة النطاق. كان نظام التشغيل هو ويندوز 11، وبايثون 3.9 كان يستخدم في البرمجة. تم تنفيذ الخوارزميات باستخدام مكتبة Scikit-learn، وتم تطوير وحدات التعلم العميق عبر إطار TensorFlow، وتم استخدام مكتبات Pandas وNumPy لمعالجة البيانات مسبقا. استخدمت بيئة التطوير PyCharm Professional 2023.1، وتم تطبيق Seaborn لعرض نتائج المعايرة لتسهيل المقارنة البديهية لأداء الخوارزميات. لضمان موثوقية البيانات، استخدمت الدراسة مجموعة بيانات تقرير مراقبة التعليم العالمي1 ومجموعة بيانات الأداء الأكاديمي لطلاب المرحلة الإعداديةالإسبانية 2. تحتوي مجموعة البيانات على 12,486 سجلا تغطي بيانات تقييم التدريس متعددة الوسائط مثل تقييمات تدريس أعضاء هيئة التدريس الجامعية، الأداء الأكاديمي للطلاب، تقييمات التدريس الطلاب، وتغذية راجعة المقررات، وتشمل 137 ميزة بعد تدريسي، بما في ذلك تكرار التفاعل في الصف، وسرعة تغذية راجعة الواجبات، وثبات الدرجات، وشمولية اللغة، والحساسية عبر الثقافات. المتغير المستهدف هو درجة تقييم التدريس، والتي يتم في هذه الدراسة تعيينها إلى قيمة مركبة متعددة الأبعاد موزونة يتم معايرتها من قبل الخبراء. تدمج الأبحاث أربعة أنواع من مصادر المعلومات: تقييمات تدريس الطلاب، مراجعات الأقران، الملاحظات الإشرافية في الفصول الدراسية، ومراجعات ملفات التدريس، بأوزان 0.35، 0.25، 0.25، و0.15 على التوالي. يتم تقسيم مجموعات التدريب والتحقق حسب الترتيب الزمني بين مجموعتي البيانات. تستخدم الدراسة بيانات من سبتمبر 2024 كمجموعة تدريب، وبيانات من أكتوبر 2024 إلى يونيو 2025 كمجموعة تحقق لتتوافق مع التقدم الزمني للتقييمات التعليمية. في مرحلة المعالجة المسبقة، يتم استخدام استراتيجية خاصة بالنمط، حيث يتم توحيد الميزات المنظمة عبر تطبيع درجة Z وتحويل القيم الشذية إلى Winsorized، بينما يتم ترميز الميزات النصية باستخدام نموذج BERT-صيني الأساسي ويتم تقليصها إلى 768 بعدا. يتم تطبيق التدريب العدائي لتعزيز الصلابة ضد تعبيرات التحيز الضمني والتخفيف من الانحراف الدلالي الناتج عن الاختلافات الثقافية في الخلفية.
لتحقيق تدريب وأبحاث التحقق عبر المجالات، سيتم نقل النموذج إلى أربعة سيناريوهات تدريسية متجانسة: التعليم الأساسي من الروضة حتى الصف الثاني عشر، التعليم المهني، التعليم المستمر، والتعليم الصيني الدولي مع التحقق من العينة صفر أو قليلة. في هذه السيناريوهات الأربعة، تقدم الدراسة مصطلحات تنظيم المجالات التكيفي أثناء تدريب الخوارزميات لتقييد اتساق توزيع الميزات للنموذج في سيناريوهات تدريسية مختلفة. تضمين آلية قناع خفيفة الواعية لبناء الجملة لضوضاء الجمل القصيرة في سيناريوهات K-12؛ لمعالجة غموض المصطلحات المهنية في التعليم المهني، يتم إنشاء قاموس مجال ديناميكي ودمجه مع مخطط معرفة المنهج الدراسي. صمم وحدة تعلم مقارنة الفئات العمرية لمعالجة الفجوة الدلالية بين الأجيال في التعليم المستمر، مواءمة الروابط الدلالية لتعبيرات تقييم الفئات العمرية المختلفة في الفضاء الكامن. لمعالجة التعبير الثقافي عن العبء الثقافي في التعليم الصيني الدولي، تستخدم محفزات المقارنة عبر اللغات لضبط دقيق لتعزيز متانة فهم المفاهيم التعليمية غير الحرفية. بحث في المعايرة واختبار الموثوقية الخبيرة للحقول المنظمة في سجلات التقييم الأصلية، مع إزالة الإدخالات منخفضة الموثوقية التي يكون معامل ألفا كريبندورف أقل من 0.75. تم تطبيق التعليق اليدوي مزدوج التعمية على نصوص تقييم الطلاب، حيث قام ثلاثة خبراء قياس تعليمي بإكمال تصنيف نوع الانحراف بشكل مستقل، محققين اتساق كوهين k = 0.86 في التعليقات. وأخيرا، تم التحقق من النتائج المشروحة مع سجلات حضور الإشراف واستنتاجات مراجعة ملفات التدريس لإنشاء تسميات المعايرة النهائية.
نشأت مجموعات البيانات المختارة من مجموعات سكانية مختلفة، وأنظمة قياس، وخلفيات تعليمية. اختبر هذا النموذج الكبير للتحقق عبر المجالات بشكل صارم مدى صلابة وحدود التعميم للنموذج ضمن نظام تعليمي أصيل، مما منع أوهام التقييم الناتجة عن توحيد البيانات. احتوى كلا المستودعين على كميات كبيرة من سجلات تقييم التدريس، مما يوفر قيمة مرجعية مباشرة لنشر خوارزميات التعليم الذكية الواعية للعدالة. احتوت كلتا المجموعتين على بيانات تقييم تعليمية كبيرة، مما يوفر قيما مرجعية مباشرة لتصميم خوارزميات التعليم الذكي الواعية للعدالة ومعايرة تقييم التدريس. قامت الدراسة بمعايرة 1000 سجل تقييم تعليمي باستخدام الخوارزميات الأربع وحسبت سجلات ECA وFDR الخاصة بها. تظهر النتائج في الشكل 8.

الشكل 8: مقارنة نتائج الاختبارات بين ECA وFDR. (أ) BFEN. (ب) PRF. (ج) EAB. (D) DBLR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
كما هو موضح في الشكل 8A، حقق BFEN في البداية ECA بنسبة 82.47٪ وFDR بنسبة 5.71٪ في مهمة معايرة التقييم. مع زيادة عدد السجلات المعايرة، ارتفع مؤشر ECA إلى 98.75٪ واستقر بعد معايرة 421 سجلة، بينما انخفض مؤشر FDR إلى 2.87٪ واستقر بعد معايرة 514 سجلة. كما هو موضح في الشكل 8B، زاد منحنى ECA لخوارزمية PRF تدريجيا، بينما انخفض خط FDR ببطء. في نهاية مهمة المعايرة، كانت قيمة ECA الخاصة بها 92.30٪، وقيمة PDR 6.72٪. يوضح الشكل 8C أن منحنى ECA لخوارزمية EAB ارتفع بسرعة قبل أن يتسطح، بينما أظهر مسار FDR تقلبات شديدة في المراحل المبكرة قبل التقارب، وانتهى ب ECA بنسبة 84.64٪ وFDR بنسبة 8.93٪. كما هو موضح في الشكل 8D، أظهرت خوارزمية DBLR مسارا تصاعديا بطئا في ECA مصحوبا بتقلبات هامشية وضغط محدود في خط FDR الخاص بها، منهية مهمة المعايرة بمعدل ECA بنسبة 83.51٪ وFDR بنسبة 8.42٪. تؤكد هذه النتائج التجريبية أن خوارزمية BFEN تتفوق بشكل كبير على الأساليب الأساسية في كل من دقة تصحيح التقييم والتحكم في تحيز العدالة. تعزى هذه القدرة المتفوقة على التعميم إلى دمج BERT داخل BFEN، الذي يستخرج ميزات دلالية عميقة من نص التقييم غير المنظم لالتقاط تعبيرات التحيز المخفي، بينما تقوم وحدة التعلم المعزز بتحسين عتبات العدالة ومعاملات التصحيح ديناميكيا عبر دالة مكافأة متعددة الأهداف لفصل السمات الحساسة عن المخرجات النهائية. ثم اختبرت الدراسة SAR وFMD في التقييم الصفي، والامتحانات النهائية، والتقييم العملي، والتقييم عبر الإنترنت، مع تصنيف السيناريوهات الأربعة ب وB وC وD. تظهر النتائج في الشكل 9.

الشكل 9: مقارنة بين SAR وFMD تؤدي إلى سيناريوهات مختلفة. (أ) نتائج اختبار البحث والإنقاذ. (ب) نتائج اختبار FMD. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
كما هو موضح في الشكل 9A، حقق BFEN معدل تقييم أعلى من 98٪ في جميع سيناريوهات التدريس، مع أعلى معدل تقييم إيجابي بلغ 99.01٪ في اختبارات الفصول الدراسية. معدل التقييم الذاتي لخوارزمية المقارنة في السيناريوهات المختلفة أقل من خوارزمية BFEN، والتي تحتوي على خوارزمية DBLR الأدنى لمعدل التقييم النهائي بين جميع الخوارزميات، بمعدل 70.23٪. كما هو موضح في الشكل 9B، لا يزال FMD في خوارزمية BFEN أعلى بشكل ملحوظ من خوارزمية المقارنة في سيناريوهات تعليمية مختلفة، مع معدلات FMD بلغت 98.47٪، 98.05٪، 97.81٪، و97.94٪ في سيناريوهات مختلفة على التوالي. القيم النقدية النقدية لخوارزمية DBLR المعيارية هي 82.36٪، 71.74٪، 70.59٪، و69.12٪ على التوالي. مستويات FMD في خوارزمية EAB هي 80.79٪، 68.21٪، 67.65٪، و66.03٪ على التوالي، بينما FMDs في خوارزمية PRF هي 86.42٪، 82.17٪، 80.98٪، و78.33٪ على التوالي. أظهرت هذه النتائج أن BFEN تفوق على خوارزميات المقارنة بفضل التعلم التكراري ل GBDT مع أشجار قرارات متعددة، والتي التقطت بدقة أنماط الخطأ عبر السيناريوهات وضمنت نتائج معايرة مستقرة وعادلة. كما قيمت الدراسة معدل التعرف على الميزات التخصصية (DFRR) للغة الصينية والرياضيات والإنجليزية باستخدام الخوارزميات الأربع. النتائج موضحة في الشكل 10.

الشكل 10: مقارنة نتائج اختبارات DFRR في تخصصات مختلفة. (أ) مجموعة تدريب. (ب) مجموعة التحقق. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
كما هو موضح في الشكل 10A، حقق BFEN نسبة DFRR بلغت 99.23٪، 98.94٪، و99.13٪ للصينية والرياضيات والإنجليزية في مجموعة التدريب. أظهر الشكل 10B أن BFEN حقق أيضا DFRR أعلى في مجموعة التحقق مقارنة بالخوارزميات الأخرى. على وجه التحديد، وصل مؤشر DFRR التابع لشركة BFEN للصين إلى 98.41٪، بزيادة 10.8٪ عن DBLR البالغ 87.61٪؛ أما الرياضيات، ف97.54٪، وأعلى بنسبة 9.07٪ من PRF البالغ 88.47٪؛ أما بالنسبة للإنجليزية، فهو 98.13٪، وهو أعلى بنسبة 13.34٪ من EAB البالغ 84.79٪. أكدت هذه النتائج أن BFEN تكيف بكفاءة مع معايرة التقييم التخصصي من خلال دمج التقاط BERT العميق للفروق الدلالية مع التعلم الشخصي لأنماط الخطأ من GBDT. لتقييم أداء BFEN بشكل شامل، قامت الدراسة بتقييم MDFE وCRS وSDCT للخوارزميات الأربع. تعرض النتائج في الجدول 1.
| مجموعة البيانات | الخوارزمية | MDFE (٪) | CRS | SDCT (s) |
| التدريب | BFEN | 98.42 ± 0.28*&@ | 0.975 ± 0.28*&@ | 0.78 ± 0.04*&@ |
| PRF | 83.85 ± 0.41 | 0.779 ± 0.36 | 1.32 ± 0.08 |
| EAB | 85.91 ± 0.50 | 0.806 ± 0.40 | 1.15 ± 0.07 |
| DBLR | 88.76 ± 0.47 | 0.753 ± 0.39 | 1.45 ± 0.08 |
| التحقق من الصحة | BFEN | 97.58 ± 0.25*&@ | 0.968 ± 0.27*&@ | 0.86 ± 0.03*&@ |
| PRF | 81.62 ± 0.32 | 0.687 ± 0.50 | 1.51 ± 0.06 |
| EAB | 84.37 ± 0.40 | 0.749 ± 0.42 | 1.28 ± 0.05 |
| DBLR | 87.53 ± 0.30 | 0.728 ± 0.47 | 1.63 ± 0.07 |
الجدول 1: مقارنة نتائج اختبارات MDFE وCRS وSDCT. يشير "*" إلى فرق كبير (p < 0.05) بين نتائج BFEN وPRF. تشير "&" إلى أن الفرق بين نتائج BFEN وEAB كان ذا دلالة كبيرة (p < 0.05). "@" يشير إلى أن الفرق بين نتائج BFEN وDBLR كبير (p < 0.05)
يشير الجدول 1 إلى أن BFEN حقق MDFE بنسبة 98.42٪ في مجموعة التدريب، وأعلى بنسبة 14.57٪ من نسبة PRF البالغة 83.85٪، ونسبة CRS بلغت 0.975، ونسبة تقييم تقييم 0.222 من 0.753 في DBLR، ونسبة SDCT بمقدار 0.78 ثانية، أي أقل ب0.67 ثانية من نسبة DBLR التي بلغت 1.45 ثانية. في مجموعة التحقق، حافظ BFEN على أداء متفوق، حيث تفوق MDFE وCRS وSDCT بنسبة 97.58٪، 0.968، و0.86 ثانية على التوالي على خوارزميات المقارنة. بشكل عام، أكدت النتائج الأداء الشامل المتفوق ل BFEN في معايرة التقييم التعليمي.
نموذج معايرة تقييم التعليم GFBFEN التحقق من الأداء
استنادا إلى التحقق من صحة أداء BFEN، قامت الدراسة بتقييم أداء نموذج معايرة تقييم التعليم GFBFEN المبني على BFEN وقارنته مع نماذج المعايرة المبنية باستخدام خوارزميات PRF وEAB وDBLR. لضمان ظروف اختبار متسقة وقابلية المقارنة، خدمت مجموعة بيانات تقرير مراقبة التعليم العالمية كمجموعة تدريب، بينما كانت مجموعة بيانات أداء الطلاب الأكاديميين الجامعية بمثابة مجموعة التحقق. قامت النماذج الأربعة بمعايرة 500 سجل تقييم تعليمي، وتم حساب CAE وCRE الخاصة بهم. تظهر النتائج في الشكل 11.

الشكل 11: مقارنة نتائج اختبار CAE وCRE. (أ) نتائج اختبار CAE. (ب) نتائج اختبار CRE. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
كما هو موضح في الشكل 11A، حقق GFBFEN في البداية معدل CAE يبلغ 0.1279. مع تقدم المعايرة، انخفض مؤشر CAE إلى 0.0641 واستقر بعد 104 أرقام قياسية. كانت نماذج المقارنة تحقق CAE أولية ونهائية أعلى من GFBFEN، حيث كان لدى EAB أعلى CAE ابتدائي ونهائي بقيمة 0.1858 و0.1217 على التوالي. أشار الشكل 11B إلى أن CRE الأولي والنهائي ل GFBFEN خلال مهمة المعايرة ظلا أقل من نماذج المقارنة، بقيم 0.1137 و0.0912 على التوالي. أظهرت هذه النتائج أن GFBFEN أظهر قدرة ملاءمة قوية، مستفيدا من آلية الانتباه في GAT، التي أنشأت رسوم بيانية دلالية للارتباط بين الميزات، وعززت المحاذاة الدلالية لبيانات التقييم متعددة المصادر، وقللت من المعايرة غير الفعالة الناتجة عن تحيز الميزات. ثم قيمت الدراسة CAR لبيانات تقييم الطلاب، وبيانات تقييم المعلمين، وبيانات تقييم المدارس، وبيانات التقييم عبر الإنترنت، الموسومة ب I وII وIII وIV. تظهر النتائج في الشكل 12.

الشكل 12: مقارنة نتائج CAR لبيانات تقييم مختلفة. (أ) GFBFEN. (ب) PRF. (ج) EAB. (D) DBLR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
كما هو موضح في الشكل 12A، حقق GFBFEN معدل CAR بنسبة 99.34٪، 98.93٪، 99.01٪، و99.12٪ لبيانات التقييم للطلاب والمعلمين والمدارس وعبر الإنترنت في مجموعة التدريب. في مجموعة التحقق، كانت قيم CAR 97.89٪، 98.56٪، 97.57٪، و98.46٪ على التوالي. أظهر الشكل 12B–D أن نماذج المقارنة كانت لديها CAR أقل في كل من مجموعات التدريب والتحقق. من بينهم، كان أداء EAB الأسوأ في مجموعة التحقق، حيث بلغت نسبة CAR 76.31٪ لبيانات المعلمين و78.29٪ للبيانات عبر الإنترنت. أكدت هذه النتائج أن GFBFEN تفوق بشكل ملحوظ على نماذج المقارنة. بعد ذلك، اختبرت الدراسة ال TL في مهمة معايرة تقييم التدريس لتقييم قدرة الملاءمة وثبات التدريب. تظهر النتائج في الشكل 13.

الشكل 13: نتائج اختبار ملاءمة النموذج واستقرار التدريب. (أ) GFBFEN. (ب) PRF. (ج) EAB. (D) DBLR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
كما هو موضح في الشكل 13A، كان لدى GFBFEN في البداية TL 0.1021 في مجموعة التدريب. بعد 67 تكرارا، انخفض TL إلى 0.0725 واستقر. في مجموعة التحقق، انخفض TL من 0.1237 إلى 0.1018. أشارت الشكل 13B–D إلى أن TL النهائي ل PRF في مجموعة التدريب كان 0.0824، وTL النهائي ل EAB في مجموعة التحقق كان 0.1178، وTL ل DBLR في كلتا المجموعتين كان غير مستقر وأعلى بكثير من النماذج الأخرى. أظهرت هذه النتائج أن GFBFEN أظهر قدرة قوية على التوافق واستقرار التدريب، مستفيدا من نقل المعرفة القائم على KD، مما سمح للنموذج بتعلم الميزات الفعالة بسرعة، وتسريع تقارب الفقدان، وضمان التعميم عبر مجموعات البيانات. للتحقق بشكل شامل من أداء GFBFEN الأساسية، اختبرت الدراسة EFCA وHDPE وFCP وCSCC للنماذج الأربعة. تظهر النتائج في الشكل 14.

الشكل 14: نتائج اختبارات المؤشرات الشاملة لمهام التقييم والتصحيح التعليمية. (أ) نتائج اختبار GFBFEN. (ب) نتائج اختبار PRF. (ج) نتائج اختبار EAB. (D) نتائج اختبار DBLR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
كما هو موضح في الشكل 14A–D، فإن نموذج GFBFEN لديه قيم EFCA تبلغ 99.35٪ و98.76٪ في مجموعتي التدريب والتحقق على التوالي. نسبة EFCA لنموذج PRF هي 88.53٪ و87.04٪ على التوالي. في مجموعة التحقق، كان EFCA لنموذج GFBFEN أعلى بنسبة 6.59٪ من نموذج EAB عند 92.17٪، وأعلى بنسبة 11.72٪ من نموذج DBLR بنسبة 87.04٪. بالإضافة إلى ذلك، فإن مؤشرات HDPE وFCP وCSCC رائدة بشكل شامل: في مجموعة التحقق، وصل HDPE لنموذج GFBFEN إلى 98.05٪، ووصل FCP إلى 97.93٪، وCSCC إلى 0.968، وجميعها تفوقت على نماذج PRF وEAB وDBLR. بشكل عام، أكدت هذه النتائج الأداء الشامل المتفوق ل GFBFEN، مما أظهر أن التحسين المنسق للنموذج ل GAT-KD وAM-LSTM وBFEN حسن بشكل فعال دقة المعايرة والكفاءة والعدالة في التقييم التعليمي.
تم بناء البحث تدريجيا على FairEduNet وBFEN وFBFEN وGFBFEN، ويشمل النهائي GFBFEN مكونات مثل FairEduNet وBERT-RL وAM-LSTM وGAT-KD. للتحقق من المساهمة المستقلة للمكونات الفردية، تجرى تجارب بحثية وتصميم للاستئصال، مع إزالة كل مكون تدريجيا وتقييم تأثيره على الأداء العام. تشمل المؤشرات المقارنة ECA، FDR، SAR، وFMD. أظهرت النتائج أن قيمة ECA لمكون FairEduNet وحده كانت 87.32٪، وFDR كانت 12.45٪، وSAR 89.67٪، وFMD 11.89٪. بلغ ECA لنموذج GFBFEN الكامل 99.21٪، وانخفض FDR أكثر إلى 1.93٪، وظل SAR مستقرا عند 99.45٪، وتم تحسين FMD إلى 7.28٪. بعد إزالة BERT-RL، انخفض ECA إلى 91.04٪، وكانت قيمة FDR 6.23٪، وSAR 92.33٪، وارتفعت FMD إلى 7.85٪. زاد استئصال AM-LSTM من تقلبات SAR بنسبة 14.2٪. أدى إزالة GAT-KD إلى زيادة في اضطراب اللياقة القلاعية إلى 8.36٪، وكانت آلية قمع انتشار انحياز بنية الرسم البياني الموجهة بتقطير المعرفة فعالة بشكل ملحوظ في تخفيف التحيز الضمني بين السكان.
لاختبار طرق البحث بشكل أعمق، قدمت الدراسة مؤشرات معايير العدالة المعتمدة، وهي معيار تصحيح العدالة (FCB)، الذي يغطي ثلاثة أنواع من القيود الصارمة المعترف بها على نطاق واسع في السيناريوهات التعليمية: (1) القيمة المطلقة للفرق المتوسط بعد التصحيح بين المجموعات هي ≤ 1.2 نقطة (بناء على نظام النسب المئوية)؛ (2) معدل التداخل لفترات الثقة المصححة لكل مجموعة سمة حساسة هو ≥ 95٪؛ (3) في أي سيناريو واحد، يجب أن تلبي المنطقة المشتركة الممكنة لروزفلت وSAR قيد حدود باريتو (أي أنه من المستحيل تحسين SAR دون تدهور FDR، والعكس صحيح). تمت مقارنة نموذج GFBFEN مع نماذج الأساس السائدة مثل EAB وPRF وDBR وGBDT في التقييم التجريبي. أجريت التجربة على 421 بيانات تقييم حقيقية جمعت من سيناريوهات تدريس فعلية، تغطي ثلاثة سيناريوهات تعليمية نموذجية: التقييم الصفي، التقييم العملي، والاختبار عبر الإنترنت. تظهر النتائج في الجدول 2.
| الخوارزمية | القيمة المطلقة لفرق متوسط الدرجات | معدل تداخل فترة الثقة (٪) | معدل رضا المناطق المشتركة الممكنة (٪) | التقييم الشامل |
| GFBFEN | 0.87 | 98.3 | 100 | 97.2 |
| EBA | 1.52 | 98.4 | 82.6 | 78.5 |
| PRF | 1.68 | 85.1 | 74.3 | 71.2 |
| DBLR | 1.45 | 87.9 | 79.8 | 75.6 |
| GBDT | 1.33 | 91.2 | 86.4 | 79.9 |
الجدول 2: نتائج تقييم مؤشرات معايير العدالة والتحقق العملي من التطبيقات.
كما هو موضح في الجدول 2، حقق GFBFEN الامتثال الكامل لجميع القيود الصلبة الأربعة ل FCB بشكل مستقل، وتفوق درجته الشاملة بشكل كبير على النماذج الأساسية الأخرى بفارق +18.7 نقطة، مما يؤكد متانة نموذج التصحيح التعاوني متعدد المراحل المقترح. على وجه الخصوص، في المؤشر الأساسي الذي يعكس قدرة المقايضة بين العدالة والكفاءة، وصل معدل تغطية المنطقة الممكنة المشتركة إلى 100٪، مما يشير إلى أن النموذج يمتلك قدرات اتخاذ القرار المثلى القابلة للنشر في سيناريوهات تعليمية حقيقية.
تشير العدالة في تقييم التدريس إلى استخدام القيود الكمية القابلة للتحقق كمعيار مع احترام الفروق الفردية والقوانين التعليمية. تعتمد منطق الحساب وتحديد العتبة لمؤشرات العدالة على الإطار النظري للعدالة التعليمية ومعايير التحقق التجريبية من البيانات. يتم مراجعتها بشكل مشترك من قبل لجنة خبراء مكونة من خمسة علماء لضمان درجة عالية من الوحدة بين الصرامة النظرية وقابلية التكيف مع الممارسة التعليمية. ولتعزيز قابلية التكيف للنموذج تحت معايير العدالة المختلفة، أجرت الدراسة المزيد من التحقق بموجب معايير متعددة. تم اختيار ثلاثة معايير للعدالة للتحقق. المعيار 1 هو توازن معدلات القبول بين المجموعات بناء على التكافؤ الديموغرافي. المعيار 2 هو الاتساق بين المجموعات بين معدل الإيجابي الحقيقي والمعدل الإيجابي الكاذب بناء على احتمالات متساوية. المعيار 3 يعتمد على التماثل التنبؤي للتحكم في التحيز بين المجموعات في دقة التنبؤ. وجد أن GFBFEN استوفى باستمرار متطلبات القيود الصارمة بموجب المعايير الثلاثة. انحراف معدل قبول المجموعة القياسي 1 ≤1.2٪، معدل الإيجابي الحقيقي/خاطئ المعيار 2 بين الفرق بين المجموعات ≤0.85٪، دقة التنبؤ القياسية 3 انحراف بين المجموعات متحكم ±±0.6٪. على النقيض من ذلك، أظهرت النماذج الأخرى اختراقا في القيود بنسبة ≥3.7٪ تحت معيار واحد على الأقل، مما يؤكد توافق GFBFEN في التعميم لنماذج العدالة متعددة المتغيرات.
توفر البيانات:
لضمان موثوقية البيانات، استخدمت الدراسة مجموعة بيانات تقرير مراقبة التعليم العالمي (https://www.education-progress.org/) وبيانات الأداء الأكاديمي لطلاب المدارس الإعدادية الإسبانية (https://archive.ics.uci.edu/dataset/320/student+performance). يتم تقسيم مجموعات التدريب والتحقق حسب الترتيب الزمني بين مجموعتي البيانات. تستخدم الدراسة بيانات من سبتمبر 2024 كمجموعة تدريب ومن أكتوبر 2024 إلى يونيو 2025 كمجموعة تحقق، متوافقة مع التقدم الزمني للتقييمات التعليمية.