Research Article

עיצוב אלגוריתמים של FairEduNet וכיוול הערכת הוראה בהתחשב בשוויון בהשכלה הגבוהה

DOI:

10.3791/70189

July 21st, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחקר שואף לספק גישה חדשה לכיול הערכה בהוראה, ולשוויון חינוכי בחינוך אינטליגנטי. תוצאות ניסוי מצביעות על כך שהמודל המוצע עולה משמעותית על מודלים השוואתיים, ומטפל ביעילות בבעיות של אינטגרציה לקויה של נתונים מרובי מקורות והטיית הוגנות בשיטות כיול קיימות.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

שיטות כיול הערכת הוראה הנוכחיות מתמודדות עם אתגרים כגון יעילות אינטגרציה נמוכה בעת עיבוד נתוני הערכה הטרוגניים מרובי מקורות, חוסר התאמה מספקת בין תחומים ותסרישי הוראה שונים, והטיות בתוצאות עם הבטחות הוגנות חלשות. מטרת המחקר היא לבנות מסגרת תיקון הוגנות ניתנת לפרשנות, העברה וניתנת להרחבה, למידול עמוק ותיקון דינמי של נתוני הערכת הוראה. בעיות אלו מקשות על עמידה בדרישה המרכזית של הוראה מאוזנת בחינוך אינטליגנטי. מחקר זה מציע אלגוריתם רשת חינוכית מוכוון הוגנות המשלב רשת עוינת גנרטיבית ועץ החלטות מחזק את הגרדיאנט. האלגוריתם בונה מנגנון כיול הוגנות ומשלב מודל ייצוג מקודד דו-כיווני עם רשת תשומת לב גרפית לאופטימיזציה של חילוץ תכונות וגמישות דינמית, ולשפר את יעילות עיבוד הנתונים במקורות מרובים ודיוק כיול ההגינות. גישה זו משיגה כיול מדויק והבטחת הוגנות בהערכות הוראה. במבחן האינדיקטור, המודל השיג דיוק של 98.76% בתכונות הערכת אשכולות, 98.05% בתיקון הוגנות, ו-0.968 בעקביות תיקון חוצה תרחישים בסט הוולידציה. במשימת בדיקת ערך האובדן, סך האובדן של המודל ירד מ-0.1237 ל-0.1018 במהלך משימת תיקון הערכת ההוראה בקבוצת האימות. במבחן האינדיקטור, המודל השיג דיוק של 98.76% בתכונות הערכת אשכולות, 98.05% בתיקון הוגנות, ו-0.968 בעקביות תיקון חוצה תרחישים בסט הוולידציה. תוצאות ניסוי מצביעות על כך שהמודל המוצע עולה משמעותית על מודלים השוואתיים, ומטפל ביעילות בבעיות של אינטגרציה לקויה של נתונים מרובי מקורות והטיית הוגנות בשיטות כיול קיימות. יתרה מזאת, היא מספקת מסגרות אלגוריתמיות חדשניות למפתחי טכנולוגיה וכלים טכניים אמינים למנהלי חינוך לקידום שוויון בהוראה. תרומות המחקר הן : (i) שילוב שלושה מודולים מרכזיים, כולל עיבוד נתונים מרובה מקורות, אימות מדד הוגנות דינמי, והדמיית הסבר; ו-(ii) הצעת פרדיגמת תיקון הוגנות המבוססת על אופטימיזציה שיתופית של רשתות יריבה גנרטיביות ועצי חיזוק גרדיאנט, שפורצת את מגבלות תיקון המודל היחיד המסורתי ומאפשרת למידה מנותקת של מידול סטייה וקבלת החלטות תיקון.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הערכת ההוראה וכיול מהווים את הליבה של הבטחת איכות ההוראה בחינוך אינטליגנטי. באמצעות ניתוח דינמי, תיקון שגיאות וכיול תוצאות, הם מספקים בסיס לשיפור הוראה ולמידה מותאמת אישית. הדיוק וההגינות שלהם משפיעים ישירות על השאלה האם חינוך חכם יכול לפרוץ הטיות טכנולוגיות ולספק תמיכה חינוכית מאוזנת 1,2. עם זאת, לשיטות קיימות יש מספר חסרונות: הן מסתמכות על מקור נתונים יחיד, מתעלמות מהמצב האמיתי, ומובילות להטיית נתונים והטיית תיקון. היעדר מנגנון דינמי להסתגל להוגנות מקשה על מענה לצרכי ההגינות של תחומים ותסריטים 3,4. בנוסף, קיימות בעיות כמו חוסר במדדי הוגנות והטיה באסטרטגיות תיקון כאשר מדובר בנתונים הטרוגניים ממקורות שונים. לשם כך, חוקרים ערכו מחקרים מממדים שונים, כגון הערכת הוראה בסיוע טניס בהתבסס על אלגוריתם מסלול צפוף משופר5. יין ואחרים השתמשו בתהליך ההיררכיה האנליטית ובאלגוריתם סינתזה מטושטשת כדי לנטר הוראה מקוונת6. צ'ן ניתח נתונים חינוכיים למבוגרים באמצעות אלגוריתם משופר לכריית נתונים לשיפור איכות ההוראה7.

למרות שמחקרים אלו התקדמו, נושאים כמו הטיית תוצאות כיול ותיאום הוגנות לקוי עדיין קיימים. לכן, בניית מודל שמספק בו זמנית כיול מדויק של הערכת הוראה והבטחת הוגנות דינמית הפכה למוקד מחקר בחינוך אינטליגנטי. רשת עוינת גנרטיבית (GAN) מתאימה את עצמה כדי לבטל את ההשפעה הסמויה של תכונות רגישות על התוצאות באמצעות אימון עוין בזמן אמת בין המפיק לדיסקרימינטור, ומבטיחה שהפלטים ייקבעו על ידי גורמים מרכזיים ולא על ידי הטיה המושרה על ידי תווית8. GAN מראה יתרונות בהתמודדות עם הטיות קבוצתיות בנתוני הערכה ובמידול מגבלות הוגנות לא ליניאריות. צ'נג ואחרים הציעו אלגוריתם לשיפור תמונה מבוסס GAN לטיפול בתמונות ברזולוציה נמוכה. הגנרטור הפיק תמונות ברזולוציה גבוהה מכניסות ברזולוציה נמוכה, והדיסקרימינטור הבחין בין התמונות שנוצרו לתמונות אמיתיות ברזולוציה גבוהה. אימון יריבים מייעל פרמטרים כך שהפלט של הגנרטור מתקרב לתמונות אמיתיות9. קאנג ואחרים הציעו מודל GAN רב-מודלי לשיפור יעילות עיבוד הנתונים הרב-מודליים בתחומי אנרגיה מתחדשת. הגנרטור מקבל נתונים חד-מודליים, המבחין מבדיל בין נתונים מובנים אמיתיים, ואימון יריבים מייעל את המודל לשיפור היעילות10. אלגוריתם עץ ההחלטות של הגברת הגרדיאנט (GBDT) הוא אלגוריתם קלאסי לעיבוד נתונים מובנה עם יכולת לכידת תכונות חזקה. על ידי אינטגרציה איטרטיבית של עצי החלטה מרובים, GBDT לומד בדיוק דפוסי שגיאת נתונים ומציג יתרונות בעיבוד מידע הערכה הטרוגני רב-מקורות ותיקון סטיות ציון לא ליניאריות11,12. Mizuno ואחרים הציעו שיטת חיזוי מסלול מבוססת GBDT לאסונות גשמים כבדים, למידת מאפייני מסלול וחיזוי מסלולי אסון באמצעות נתונים בזמן אמת, תוך בחירת תחזיות אופטימליות דרך עצי החלטה מרובים13. גאו ואחרים פיתחו שיטת ניתוח חזותי מבוססת GBDT לחיזוי שיעור הקליקים בפרסום, ולומדת את הקשר בין תכונות ויזואליות לנתוני קליקים היסטוריים כדי לחזות שיעורי קליקים לפרסומות חדשות14. בהתבסס על האתגרים הנ"ל, מחקר זה שואף לענות באופן שיטתי על השאלה המדעית המרכזית הבאה: כיצד ניתן לבנות מודל הערכה חינוכי חכם לשילוב יעיל של נתונים הטרוגניים מרובי מקורות, להסתגל דינמית לתרחישי הוראה שונים, ובו זמנית להבטיח דיוק כיול והגינות תוצאה. כדי לענות על שאלה זו, מחקר זה עושה שימוש באפקט הסינרגטי של מנגנון מגבלת ההגינות של GAN וביכולת כיול השגיאות המדויק של GBDT. יתרה מזאת, מתבצעת מחקרים כיצד להכניס טכנולוגיות מתקדמות, כגון עיבוד שפה טבעית (BERT), למידת חיזוק (RL), מנגנוני קשב (AM), רשתות זיכרון קצרות טווח (LSTM), רשתות קשב גרפיות (GAT) וזיקוק ידע (KD), כדי לפצות על המגבלות הטבועות במודל יחיד בחילוץ תכונות, התאמה דינמית ויעילות הסיקה. בסופו של דבר, המטרה היא לספק פתרון כיול הערכת הוראה שהוא מדויק והוגן, ובעל יכולות הכללה חזקות לתחום החינוך האינטליגנטי.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עיצוב ואופטימיזציה של אלגוריתמים של FairEduNet
המחקר משלב GAN ו-GBDT לבניית אלגוריתם FairEduNet, ומשיג את המטרות הכפולות של תיקון הוגנות ותיקון דיוק, במקום הפשרה של אופטימיזציה חד-כיוונית. FairEduNet מאמץ ארכיטקטורת שיתוף פעולה דו-ערוצי: ערוץ העמוד השדרה של GBDT אחראי על מידול שגיאות מובנה ותיקון מדויק, בעוד שערוץ העזר של GAN מתמקד בניתוק תכונות רגישות ובהתאמת ההגינות דינמית. ארכיטקטורת האלגוריתם FairEduNet, המשלבת GAN ו-GBDT, מוצגת באיור 1.

figure-protocol-1
איור 1: ארכיטקטורת האלגוריתמים FairEduNet המשלבת GAN ו-GBDT. אנא לחצו כאן לצפייה בגרסה גדולה יותר של איור זה.

כפי שמוצג באיור 1, FairEduNet אוספת ומעבדת מראש נתוני הערכה מרובי מקורות. GBDT משתמש בעצי החלטה מרובים כדי ללמוד באופן איטרטיבי דפוסי שגיאת הערכה, מפיק תוצאות כיול ראשוניות ומעביר אותן למודול GAN. GAN מאמן את המבחין ללמוד את הקשר בין תוצאות כיול ראשוניות לתכונות רגישות, בעוד שהגנרטור מתאים דינמית את פרמטרי הכיול. באמצעות סבבים מרובים של הכשרה עוינת ואימות הוגנות, הטיית הוגנות מיטבית. לבסוף, התוצאות המכוيلات לפי ההגינות מוזנות חזרה למודול GBDT, שמתאים דיוק והגינות, ומציג את בסיס כיול הערכת ההוראה ודוח. GBDT מחשב שאריות כפי שמוצג במשוואה (1).

figure-protocol-2(1)

במשוואה (1), figure-protocol-3 מייצגת את השארית של הדגימה ה-i באיטרציה ה-t, yi מייצג את הערך האמיתי, ומייצג figure-protocol-4 את ערך החיזוי של האיטרציה ה-t-1. תהליך ההתנגדות של GAN מוצג במשוואה (2).

figure-protocol-5(2)

במשוואה (2), x מייצג את תוצאת הכיול הראשונית, z מייצג תכונות רגישות, Pdata(x)  מייצג את ההתפלגות האמיתית של תכונות לא רגישות, Pz(z) מייצג את התפלגות התכונות הרגישות, D מייצג את המבחין, ו-G מייצג את המחולל15. פלט הכיול הראשוני של GBDT מוצג במשוואה (3).

figure-protocol-6(3)

במשוואה (3), figure-protocol-7 מייצג את החיזוי של הדגימה ה-i על ידי עץ ההחלטה ההתחלתי, K מייצג את סך כל עצי ההחלטה, γk מייצג את משקל עץ ה-k, ו-hk(xi) מייצג את תוצאת החיזוי של עץ ה-k עבור ה-i-הדגימה. אלגוריתם FairEduNet יכול לספק כיול מדויק והבטחת הוגנות לנתוני הערכת הוראה. עם זאת, בעת עיבוד נתוני הערכה לא מובנים והסתגלות לתרחישים דינמיים, FairEduNet מציגה יכולת חילוץ תכונות חלשה עבור תכונות לא מובנות, מה שמוביל להטיית כיול. בנוסף, מדדי ההגינות ופרמטרי הכיול של FairEduNet מוגדרים סטטית, מה שמגביל את ההתאמה שלו לתרחישי הוראה שונים ומשפיע על איכות הכיול הכוללת. השילוב של ייצוגים דו-כיווניים של מקודדים משנאים (BERT) ולמידת חיזוק (RL), אלגוריתם BERT-RL, יכול לחלץ במדויק תכונות עמוקות מטקסט לא מובנה ולהתאים דינמית את פרמטרי התרחיש מבלי להגדיר ספים סטטיים ידנית, ובכך לשפר עוד יותר את אמינות פלטי האלגוריתמים בתרחישים16,17. שיטות מסורתיות כמו TF-IDF מסתמכות על תדירות מילים אך חסרות הבנה הקשרית עמוקה ואינן יכולות להבחין בכיוונים מסוימים של "הגינות" בתרחישים שונים. Word2Vec מייצרת וקטורי מילים סטטיים, שמתקשים להסתגל לשינויים קונטקסטואליים מורכבים ולזהות הטיה עקיפה. BERT משתמש בתשומת לב עצמית רב-שכבתית לקידוד הקשר דו-כיווני, תוך לכידת מונחים מוטים מפורשים ולוגיקה מוטה סמויה. הגישות המסורתיות דורשות רשימות מילים מוטות ידניות, תלויות בניסיון סובייקטיבי, ומכסות תרחישים מוגבלים. באמצעות למידת העברת מודלים מאומנת מראש, BERT לומד אוטומטית תכונות סמנטיות עמוקות ללא מאמץ ידני נרחב, ומציע הכללה חזקה יותר בזיהוי הטיות עמומות. יתרה מזאת, שיטות מסורתיות לעיתים קרובות מאבדות מידע בטקסטים ארוכים, בעוד ש-BERT תומך עד 512 טוקנים, שומר על קשרים הקשריים, מאתר במדויק תכונות הטיה ומאפשר תיקון הגינות מדויק. תהליך הפעולה של BERT-RL מוצג באיור 2.

figure-protocol-8
איור 2: תרשים זרימה של אלגוריתם BERT-RAL. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

כפי שמוצג באיור 2, BERT-RL תחילה מאחד נתוני הערכת טקסט לא מובנים ומזין אותם למודל BERT. BERT משתמש במקודד טרנספורמר למידול סמנטי דו-כיווני לחילוץ תכונות מפתח ולבניית מטריצת תכונות. מטריצת התכונות מוזנת אז למודול ה-RL, שלומד את האסטרטגיה האופטימלית דרך איטרציות מרובות. תצורת הפרמטרים האופטימלית מוזנת סוף סוף ל-FairEduNet, מה שמשפר את ההתאמה שלו. חישוב משקל תכונת תשומת הלב העצמית של BERT מוצג במשוואה (4).

figure-protocol-9(4)

במשוואה (4), dk מייצג את הממד של וקטור K. פונקציית התגמול הרב-אובייקטיבית של RL מבוטאת במשוואה (5).

figure-protocol-10(5)

במשוואה (5), ω1, ω2 ו-ω3 מייצגים את מקדמי המשקל, figure-protocol-11 מייצגים שגיאת כיול, Dt הוא סטיית הוגנות, Dיעד הוא סטיית הגינות למטרה, ו-T t הוא זמן ריצה18. מחקר זה משלב את BERT-RL עם FairEduNet ליצירת אלגוריתם BERT-RL-FairEduNet, המכונה BFEN. BFEN משיג כיול מדויק והבטחת הוגנות בנתוני הערכה באמצעות איטרציה של תכונות GBDT ואימון יריבים בזמן אמת ב-GAN, בעוד BERT-RL מייעל את FairEduNet בטיפול בנתונים לא מובנים ובהסתגלות דינמית לתרחישים, תוך טיפול בחולשות בחילוץ תכונות ומגבלות פרמטרים סטטיים. המחקר השתמש במודל BERT-base-סינית, והכשיר מראש את גוף יומני ההוראה האמיתיים, טקסטים מוקלטים בכיתה ומסמכי מדיניות חינוכיים מהפלטפורמה הלאומית לחינוך חכם לשנת הלימודים 2024 עד 2025, עם גודל אוצר מילים של 21,128. ממד השכבה הנסתרת של המודל הוא 768, עם 12 ראשי תשומת לב ו-12 שכבות. עומק עץ ה-GBDT נקבע ל-8, מספר העצים היה 200, וקצב הלמידה היה 0.1. מחזור האימון של GAN הוא 150 כדורים, והדיסקרימינטור משתמש ברשת מחוברת בשלוש שכבות עם גדלים של 512, 256 ו-1. הגנרטור משתמש ברשת מחוברת במלואה בת 4 שכבות עם גדלים של 1024, 512, 256 ו-1. מספר היחידות הנסתרות ב-LSTM הוא 128, ואורך הרצף הוא 512. ל-GAT יש 2 שכבות ו-4 ראשי קשב. הטמפרטורה לזיקוק ידע מוגדרת ל-3.0. מקדמי משקל תגמול RL ω1 = 0.4, ω2 = 0.35, ו-ω3 = 0.25. קריטריוני בחירת המשקל נועדו לאזן בין שיווי המשקל הקדמי של פארטו של אופטימיזציה רב-מטרתית לבין דרישות הפרשנות של פרקטיקות שוויון חינוכי. הניסויים הושלמו באמצעות פיצול של 50% נתונים באמצעות אימות צולב וכיוונון היפרפרמטרים. תהליך ה-BFEN לכיול הערכת הוראה מוצג באיור 3.

figure-protocol-12
איור 3: תהליך התיקון של אלגוריתם BFEN לחינוך אינטליגנטי והערכת הוראה. אנא לחצו כאן לצפייה בגרסה רחבה יותר של איור זה.

כפי שמוצג באיור 3, BFEN מעבד תחילה נתוני הערכת הוראה מרובי מקורות. BERT מייעל את יכולת חילוץ התכונות של FairEduNet על ידי חישוב דמיון סמנטי בטקסט ומשקלים עמוקים של תכונות בהתבסס על חלון סמנטי, ובוחר תכונות חשובות לבניית מטריצת תכונות סמנטיות בממדים גבוהים. RL מגדיר לאחר מכן פונקציית תגמול רב-מטרית ומחשב את התאמת התרחיש וגרדיאנטים של התאמת פרמטרים כדי לייעל עוד יותר את ספי ההגינות ופרמטרי הכיול. FairEduNet מחשבת סטיות בין נתוני הערכה למודלים של דפוסי שגיאות, מעדכנת באופן איטרטיבי את משקלי עץ ההחלטות, ומכוונת אסטרטגיות כיול עד שהטעויות מתייצבות בתוך ספים מוגדרים מראש. הפלט הסופי כולל את מודל כיול השגיאות ואת דוח אימות ההגינות. מודל הכיול מיושם על נתוני הערכה בהוראה, ויוצר טבלאות השוואה לפני ואחרי הכיול, המשולבות עם ספריית תקן הוגנות בחינוך חכם לקביעת פרמטרי כיול יעד, ומספקים בסיס מדעי לכיול הערכה בהוראה בחינוך תבוני. ספרייה סטנדרטית זו מכסה שלושה ממדים של הוגנות הזדמנויות חינוכיות, הוגנות תהליכים, והוגנות בתוצאות, וכוללת 12 מדדים מרכזיים. מדדים אלה כוללים את האיזון בהקצאת המשאבים החינוכיים בין האזורים, ההבדל בכיסוי התשתיות הדיגיטליות בין בתי ספר עירוניים לכפריים, סף הסובלנות לתגובה מאוחרת לאבחון מצבי למידה (≤200 מילישניות), סובלנות לנתונים חסרים בהערכה רב-מודלית (≤3.5%), רגישות לזיהוי הטיית אלגוריתם (סטיית AUC לתיוג מגדר/אזור/שלב ≤ 0.02), סף הסטייה של KL להתפלגות הציונים לפני ואחרי תיקון (≤0.08), ציון הפרשנות של הצעות התערבות מורה (≥4.2/5.0), עדכניות עדכוני פרופיל התלמידים (הושלמו בתוך T + 1 יום), מקדם עקביות של זיהוי אשראי חוצה פלטפורמות (≥0.93), דיוק יישור סמנטי של מדיניות חינוך (ציון BERT ≥ 0.86), ושלמות יצירת דוח אימות הוגנות (כולל ייחוס הטיה, מרווחי ביטחון, וצילומי מצב של פרמטרים שחוזרים), וכן שיעור המעבר של אימות התאמת תרחישים דינמיים המכסה שלושה תרחישים טיפוסיים: כיתה חיה, מטלות אסינכרוניות ועוזרי הוראה בבינה מלאכותית. חישוב הדמיון של תכונה סמנטית מוצג במשוואה (6).

figure-protocol-13(6)

במשוואה (6), fi מייצג את ערך הממד הסמנטי i, gi מייצג את ערך ממד התכונה החשוב i, ו-n מייצג את סך כל מממדי התכונות. חישוב פרמטר ההתאמה לתרחיש RL מוצג במשוואה (7).

figure-protocol-14(7)

במשוואה (7), θt מייצג את ערך הפרמטר באיטרציה ה-t, α מייצג את קצב הלמידה, ומייצג figure-protocol-15 את גרדיאנט הפרמטרים המבוסס על פונקציית התגמול R(θt).

בניית מודל כיול הערכת הוראה
למרות ש-BFEN מראה יתרונות מסוימים בהוראת כיול הערכה, הוא עדיין מתמודד עם יעילות אינטגרציה נמוכה עבור נתוני הערכה הטרוגניים מרובי מקורות וחוסר התאמה דינמית להגינות ביישומים מעשיים. אלגוריתם AM-LSTM, המשלב מנגנון קשב (AM) וזיכרון קצר טווח ארוך (LSTM), מקצה משקלים לתכונות מרכזיות של נתוני הערכה מרובי מקורות דרך AM ולוכד את דפוסי השינוי הדינמי של נתוני ההערכה לאורך זמן באמצעות יכולת הזיכרון הסדרתי של LSTM. גישה זו משפרת ביעילות אינטגרציית נתונים מרובי מקורות ולמידת תכונות דינמית19,20. תהליך הפעולה של AM-LSTM מוצג באיור 4.

figure-protocol-16
איור 4: תרשים זרימה תפעולית AM-LSTM. אנא לחצו כאן לצפייה בגרסה גדולה יותר של איור זה.

כפי שמוצג באיור 4, AM-LSTM מעבד תחילה נתוני הערכה הוראתיים הטרוגניים מרובי מקורות ליצירת מערך נתונים סטנדרטי. AM מחשב משקלי תשומת לב לתכונות ממקורות נתונים שונים כדי לבחור תכונות חשובות ובונה מטריצת תכונות משוקללות. מטריצת התכונות המשוקללות מוזנת אז ל-LSTM, המשתמש במנגנון השער שלו כדי ללמוד דפוסים דינמיים לאורך זמן, לוכד קשרים בין נתוני הערכה בשלבים שונים ולהוציא וקטורי תכונות דינמיים. לבסוף, וקטורי התכונות הדינמיים הללו משולבים עם מגבלות הוגנות ליצירת תוצאות כיול ביניים שמתאימות לאינטגרציה של נתונים מרובי מקורות ולתרחישים דינמיים, ומספקות בסיס לאופטימיזציה של מודלים נוספים. חישוב משקל תשומת הלב מוצג במשוואה (8).

figure-protocol-17(8)

במשוואה (8), n מייצג את הקצאת תשומת הלב לתכונה ה-n, xn מייצג דמיון, q מייצג את וקטור השאילתה, ו-softmax מייצג את פונקציית ההפעלה. שער השכחה של LSTM מבוטא במשוואה (9).

figure-protocol-18(9)

במשוואה (9), Wf הוא משקל שער השכחה, bf הוא הטיית שער השכחה, xt הוא הקלט בזמן t, ht-1 הוא משתנה המצב החיצוני בזמן t-1, ו-σ מייצג את פונקציית הסיגמואיד21. מחקר זה משלב את AM-LSTM עם BFEN לבניית מודל כיול הערכת ההוראה AM-LSTM-BFEN, המכונה FBFEN. במודל זה, AM-LSTM מתמודד עם מגבלות BFEN ביעילות אינטגרציית נתונים הטרוגנית מרובת מקורות ובחילוץ תכונות דינמי. הוא גם משלב מגבלות הוגנות לאופטימיזציה של תוצאות כיול ביניים, ומאפשר ל-BFEN להשיג כיול מדויק נוסף והבטחת הוגנות דינמית לנתוני הערכה בהוראה. תהליך הפעולה של FBFEN מוצג באיור 5.

figure-protocol-19
איור 5: תהליך ההפעלה של מודל ההערכה והתיקון של FBFEN. אנא לחצו כאן לצפייה בגרסה רחבה יותר של איור זה.

כפי שמוצג באיור 5, FBFEN מעבד תחילה את נתוני ההערכה המקוריים של ההוראה מרובי המקורות ומזין את מערך הנתונים הסטנדרטי למודול AM-LSTM. AM מחשב משקלי קשב תכונה, בעוד LSTM לומד דפוסים דינמיים, ומפיק תוצאות כיול ביניים המשלבות מידע רב-מקורי ותכונות דינמיות. התוצאות הביניים מוזנות אז למודול BFEN. GBDT לומד באופן איטרטיבי את דפוסי השגיאה של נתוני ההערכה בהתבסס על תוצאות הביניים ומודל השגיאה המוגדר מראש, ומציג תוצאות כיול ראשוניות. במקביל, GAN מנתח הטיית ההגינות הנגרמת על ידי תכונות רגישות בתוצאות הראשוניות באמצעות אימון עוין בין הגנרטור לדיסקרימינטור, תוך התאמה דינמית של פרמטרי הכיול כדי לבטל הטיה. לבסוף, פרמטרי הכיול המותאמים ל-GAN מוזנים חזרה ל-GBDT כדי לעדכן את משקלי עץ ההחלטה ואסטרטגיות הכיול, מה שיוצר תוצאה משנית של כיול שמאזנת בין דיוק להגינות. תקנון נתונים מבוטא במשוואה (10).

figure-protocol-20(10)

במשוואה (10), z' מייצג את הערך הסטנדרטי, z מייצג את הערך המקורי, ו-zmin ו-z max מייצגים את הערכים המינימליים והמקסימליים . פונקציית המטרה הסופית של מחולל GAN מבוטאת במשוואה (11).

figure-protocol-21(11)

במשוואה (11), N מייצג את מספר האיטרציות, λ מייצג את גורם המשקל של האובדן, ωi מייצג את גורם המשקל של האיטרציה ה-i, figure-protocol-22 מייצג את פונקציית ההפסד האדרסרית, ומייצג figure-protocol-23 את אובדן האנטרופיה הבינארית22.

אופטימיזציה של מודל כיול הערכה בהוראה ב-FBFEN
למרות ש-FBFEN מדגים אינטגרציה חזקה של נתונים רב-מקוריים והבטחת הוגנות דינמית בכיול הערכת הוראה, היא עדיין מתמודדת עם מתאם מאפיינים חלש ויעילות אימון והסקה נמוכה בשל מבנה המודל המורכב בתרחישי חינוך מורכבים. אלגוריתם GAT-KD, המשלב רשת קשב גרפית (GAT) וזיקוק ידע (KD), בונה באופן דינמי גרף אסוציאציה סמנטי בין תכונות באמצעות מנגנון הקשב של GAT, ומגביר את היישור הסמנטי של נתונים מרובי מקורות. KD דוחס את הידע של המודל המורכב לרשת קלה משקל, ומשפר משמעותית את יעילות ההסקה תוך שמירה על ביצועי המודל23,24. תהליך הפעולה של GAT-KD מוצג באיור 6.

figure-protocol-24
איור 6: תרשים זרימה תפעולית של GAT-KD. אנא לחצו כאן לצפייה בגרסה גדולה יותר של איור זה.

כפי שמוצג באיור 6, GAT-KD בונה גרף אסוציאציה סמנטי בין תכונות דרך מודול GAT, מאגד באופן דינמי מידע על תכונות השכונה באמצעות מנגנון הקשב, ומחזק את הייצוג הסמנטי של תכונות מקומיות. KD משתמשת אז בתוויות הרכות של הפלט כאותות פיקוח, וממזערת אובדן דיברגנציה בין התפלגויות הפלט ואובדן אנטרופיה חוצה בין התחזיות לתוויות האמיתיות, ומשיגה העברת ידע ודחיסת מודלים. הפלט הסופי הוא דגם כיול קל משקל עם דיוק ויעילות גבוהים. חישוב מקדם הקשב של GAT מוצג במשוואה (12).

figure-protocol-25(12)

במשוואה (12), figure-protocol-26 ומייצג figure-protocol-27 את וקטורי התכונה של הצמתים i ו-j, W מייצג את מטריצת המשקל הניתנת ללמידה, a מייצג את וקטור משקל תשומת הלב, figure-protocol-28 מייצג את פעולת השרשור, ו-LeakyReLU מייצג את פונקציית ההפעלה25. חישוב פונקציית אובדן KD מוצג במשוואה (13).

figure-protocol-29(13)

במשוואה (13), KL מייצג את אובדן ההתבגרות, T2 מייצג את איזון הקנה מידה של הגרדיאנט, pתלמיד מייצג את הסתברות התווית הרכה של המודל הקל, ו-pteacher מייצג את הסתברות התווית הרכה של המודלהמרוכב 26. על ידי שילוב אסוציאציות תכונות משופרות קשב והעברת ידע קלה, GAT-KD מתמודד ביעילות עם הטיה סמנטית של תכונות ומורכבות חישובית גבוהה. מחקר זה משלב את GAT-KD ב-FBFEN ליצירת מודל כיושל הערכת ההוראה GAT-KD-FBFEN, המכונה GFBFEN. GAT-KD מייעל את החסרונות של FBFEN בלכידת מתאם תכונות מרובי מקורות לא שלמות וביעילות הסקה נמוכה. תהליך הפעולה של GFBFEN מוצג באיור 7.

figure-protocol-30
איור 7: תהליך הפעלת מודל ההערכה והתיקון של GFBFEN. אנא לחצו כאן כדי לצפות בגרסה רחבה יותר של איור זה.

כפי שמוצג באיור 7, GFBFEN מתקן נתוני הערכת הוראה רב-מקוריים. GAT מדמה יחסים מורכבים בין תכונות ומחשב דינמית משקלי אסוציאציה סמנטיים בין צמתים באמצעות מנגנוני קשב. KD דוחס את הידע של המודל המורכב לרשת קלה, ומשפר משמעותית את יעילות ההסקה תוך שמירה על דיוק. מודול AM-LSTM מקצה משקלים חשובים לתכונות רב-מקוריות ולוכד דפוסים דינמיים זמניים של נתוני הערכה, ומפיק תוצאות כיול ביניים המשלבים מידע רב-מקורי. תוצאות אלו מוקלטות למודול BFEN לעיבוד עמוק. באופן ספציפי, BERT מחלץ תכונות סמנטיות מטקסט לא מובנה, RL מייעל באופן דינמי את ספי ההגינות ופרמטרי הכיול, GBDT לומד באופן איטרטיבי דפוסי שגיאה לכיול ראשוני, ו-GAN מבטל הטיות הנגרמות מתכונות רגישות באמצעות אימון יריב. מנגנון התאמת הפרמטרים הדינמית מכוייל אוטומטית את רגישות התגובה ומשקלי ההגינות של כל מודול על ידי חישה של שינויים זמניים ושינויים בהתפלגות הקבוצתית של סצנת ההוראה בזמן אמת, ובכך פותר את בעיית חוסר ההתאמה הנגרמת על ידי תצורת פרמטרים סטטיים, ומבטיח שהמודל יוכל לשמור על עמידות והגינות בשלבי הוראה שונים. קבוצות תלמידים, ותסריחי הערכה. סוג ההערכה משפיע ישירות על הפירוט ומחזור המשוב של מידול סדרות הזמן, בעוד שההערכה המעצבת מדגישה את האופי הדינמי של התהליך. ההבדלים בין תחומים קובעים את חלוקת התכונות בין מודולי BERT ל-GBDT. לכן, אימוץ מנגנון התאמה דינמי יכול להסתגל ביעילות לסוגי הערכה ותכונות דיסציפלינריות שונות. לבסוף, באמצעות סבבים מרובים של משוב פרמטרים ואופטימיזציה איטרטיבית, המודל מפיק תוצאות כיול הערכה הוראה מדויקות והוגנות. פונקציית אופטימיזציית מגבלות ההגינות הדינמית מבוטאת במשוואה (14).

figure-protocol-31(14)

במשוואה (14), S מייצג את קבוצת התכונות הרגישות, figure-protocol-32 מייצג את תוצאת כיול התוצאה החזויה, figure-protocol-33 מייצג את השונות של התחזיות בתוך הקבוצות, γ מייצג פרמטרים בין קבוצות, ומייצג figure-protocol-34 את הערך הצפוי הכולל. החישוב האדפטיבי של משקלי מיזוג תכונות מרובי מקורות מוצג במשוואה (15).

figure-protocol-35(15)

במשוואה (15), wk מייצג את משקל התכונה של מקור הנתונים ה-k, β מייצג את פרמטר המשקל, Sim מייצג את פונקציית מדידת דמיון התכונות, fk מייצג את וקטור התכונה שמופק ממקור הנתונים k, f גלובלי מייצג את מרכז התכונות הגלובלי, ו-K מייצג את המספר הכולל של מקורות הנתונים. המחקר קבע את משקלי התכונות הרגישות, כולל מגדר, אתניות, אזור, מצב כלכלי משפחתי ורקע שפת אם. המשקלים נקבעים על בסיס תוצאות ניתוח המתאמים. המחקר השתמש במקדם המתאם של פירסון ובמקדם המתאם בדירוג ספירמן כמדדים כפולים להערכה משותפת, בשילוב עם ניסיון מקצועי בתחום החינוך לכיול משקל. הקביעה הסופית של המשקלים לכל תכונה רגישה הניבה ערכים של 0.18 למגדר, 0.22 לאתניות, 0.25 לאזור, 0.19 למצב כלכלי משפחתי ו-0.16 לרקע שפת אם. מגדר: זהות מגדרית לפי רישום חוקי וזיהוי עצמי, בינארי (זכר/נקבה) עם אפשרויות לא בינאריות; שדה הנתונים "מגדר". אתניות: מבוסס על זיהוי אתני לאומי של 56 קבוצות, תואם לקבוצות לא מזוהות וחוצות גבולות; שדה הנתונים "אתניות". אזור: חלוקה מנהלית של רישום משקי בית או מגורים ארוכי טווח, הכוללת רמות מחוזיות, עירוניות ומחוזיות, תוך התחשבות במבנה כפול עירוני-כפרי ואוכלוסיית מהגרים; שדה הנתונים "אזור". מצב כלכלי משפחתי: לפי תקנים סטטיסטיים לאומיים ומדדי סיוע חינוכי, באמצעות סיווג בן חמש רמות; שדה הנתונים "economic_status". רקע שפת אם: שפת הוראה ותקשורת משפחתית ראשונית במהלך החינוך הבסיסי, כולל מנדרינית, שפות מיעוטים, ניבים ושפות זרות, לפי גיל רכישה ותדירות; שדה הנתונים "mother_tongue."

תהליך התיקון אימץ מנגנון משקל דינמי בן שלושה שלבים. השלב הראשון יישם זיהוי סטייה ראשונית בהתבסס על מטריצת המשקל של תכונות רגישות, וסימן נקודות נתונים שסטיו משמעותית ממרכז התכונות הגלובלי בממדים כמו מגדר, אתניות ואזור. השלב השני מציג מגבלות הקשר חינוכיות כדי להגדיר מחדש את עוצמת הסטייה באופן מודע להקשר. השלב השלישי בודק את יציבות התיקון באמצעות בדיקות הפרעה נגד-עובדתיות, מחליף באופן שיטתי את ערכי התכונות הרגישות תוך שמירה על תכונות לא רגישות ללא שינוי, ובודק האם השינוי בציוני ההערכה נמצא בתוך סף ה-±±3.2%.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ניתוח ביצועי אלגוריתם BFEN
המדדים שנבדקו בניסויים כללו את הבאים:

דיוק תיקון הערכה (ECA) מציין את שיעור פריטי הסטייה שזוהו ותוקנו נכון על ידי המודל בתוצאות ההערכה ההוראתית, ובכך משקף את היעילות הכוללת של מנגנון התיקון. ערכים גבוהים יותר מצביעים על דיוק תיקון גבוה יותר.

שיעור סטיית הוגנות (FDR) מודד את גודל פערי הציונים בין קבוצות שהמודל נכשל בהסרת במהלך תהליך הכיול. הוא מחושב כיחס בין סטיית התקן של כל תכונה רגישה (למשל, מין, אזור, אתניות) בתוך התפלגות הניקוד לסטיית התקן הכוללת; ערכים נמוכים יותר מצביעים על מינימום שונות בין-קבוצתית והבטחת הוגנות חזקה יותר.

קצב התאמת תרחישים (SAR) מצביע על אחוז משימות התיקון שבוצעו בהצלחה על ידי המודל בהקשרים הוראה הטרוגניים (למשל, מדעים מול מדעי הרוח, סביבות מקוונות לעומת לא מקוונות).

דרגת שמירת הוגנות (FMD) מוגדרת כאחד פחות היחס בין שונות מדדי ההגינות בין קבוצות תכונות רגישות לאחר התיקון לבין זה שנצפה לפני התיקון, המשקף את יכולת המערכת לשמור על ההגינות המבנית שלה במהלך תהליך הכיול.

קצב זיהוי תכונות דיסציפלינריות (DFRR) מחשב את שיעור המדגמים שבהם תכונות ליבה מזוהות נכון בנתוני ההערכה של כל תחום ביחס לגודל המדגם הכולל של ההערכה, ומדגים את יכולת המודל להבחין וללכוד וריאציות ספציפיות לתחום.

יעילות מיזוג נתונים רב-מקורות (MDFE) מתייחסת ליעילות התפוקה של המודל במהלך יישור התכונות, הקצאת משקל ותיקון סטיות בעת מיזוג נתוני הערכה הטרוגניים מרובי מקורות. מדד מקיף זה מוגדר כמכפלה של מספר דגימות ההערכה המעובדות בשנייה (דגימות/שנייה) וקצב עמידה בעקביות התיקון (ברמת ביטחון >95%), כאשר ערכים גבוהים יותר מצביעים על צינור היתוך יעיל ויציב יותר.

יציבות תוצאת תיקון (CRS) מצביעה על עקביות של פלטי כיול במספר ריצות עצמאיות, המנודה על ידי ההפך של סטיית התקן של המרחק האוקלידי בין פלטי התיקון של כל ריצה תחת קלטים זהים. ערכים גבוהים יותר מצביעים על אמינות מערכתית מוגברת.

זמן תיקון נתונים בודד (SDCT) מייצג את ההשהיה החישובית הממוצעת שנצרכת על ידי המודל להשלמת כיול דגימת הערכה יחידה, הנמדדת במילישניות (ms); ערכים נמוכים יותר מעידים על יכולת תגובה בזמן אמת חזקה יותר.

שגיאה מוחלטת מתוקנת (CAE) מודדת את השגיאה המוחלטת הממוצעת בין התחזיות המכויילות לערכי אמת היסוד, ומייצגת את הסטייה השארית של המודל ביחס לנתונים המקוריים הלא מכוילים. ערכים נמוכים יותר מצביעים על כך שהפלטים המכוילים מתאימים יותר לרמות הביצועים האמיתיות.

שגיאת יחסית מתוקנת (CRE) מכמת את השגיאה האבסולוטית הממוצעת בין התחזיות המכוילים לערכי אמת הקרקע המובע כאחוז מהאמת הקרקעית, כאשר ערכים נמוכים יותר מצביעים על דיוק כיול יחסי גבוה יותר.

שיעור דיוק התיקון (CAR) מייצג את שיעור המדגמים שהשגיאה האבסולוטית שלהן לאחר הכיול היא < 0.5 יחסית לגודל המדגם הכולל, מה שמדגים את אמינות המודל בעמידה במגבלות דיוק מוגדרות מראש. ערכים גבוהים מחזקים את התועלת האמפירית והאמינות של התוצרים.

ערך ההפסד הכולל (TL) מייצג את ערך המטרה המקיף לאופטימיזציה הנגזר מהסכום המשוקלל של מונחי תת-הפסדים בודדים עם סיום המשימה. באופן ספציפי, שבעה מדדים—DFRR, MDFE, CRS, SDCT, CAE, CRE ו-CAR—מתוקנים באמצעות נורמליזציה של ציון Z ומשוקללים בהתאם לעדיפות התפעולית של משימות ההערכה. בהינתן וקטור המשקל [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1], שבעת ערכי האינדיקטור המנורמליים הללו מאוגדים לחישוב ההפסד הסופי.

דיוק אשכולות תכונות להערכה (EFCA) מעריך את מידת היישור בין תצורות האשכול הלא מפוקחות שנוצרות על ידי המודל לבין קטגוריות אמת קרקעית שאומתו על ידי מומחי תחום.

יעילות עיבוד נתונים מממד גבוה (HDPE) מודדת את מספר הדגימות שנחשפו להפחתת ממדי תכונות ותיקון סטיות ליחידת זמן בעת טיפול בווקטורים דלילים מממד גבוה המכילים ≥50 תכונות הערכה. כאשר נמדדים בדגימות לשנייה, ערכים גבוהים משקפים יכולת חזקה יותר לעבד קלטי הערכה מורכבים וגדולים בזמן אמת.

דיוק תיקון הוגנות (FCP) מעריך את האחידות של השפעות הכיול בין קבוצות סטודנטים שונות. מדד זה מכומת על ידי חישוב ממוצע ההתפלגות של מרחק קולמוגורוב-סמירנוב עבור השגיאות המוחלטות המתוקנות על פני תת-קבוצות התכונות הרגישות; ערכים נמוכים יותר מרמזים על ביצועים מאוזנים יותר בין קבוצות וביטחון הוגנות חזק יותר.

עקביות תיקון חוצה סצנות (CSCC) מכמת את ההזזה ההתפלגתית של תוצאות הכיול בשלושה תרחישים טיפוסיים—כלומר, הערכה בכיתה, הערכה מעשית ובדיקות מקוונות—המודגם כיחס מרחק ווסרשטיין.

כדי לאמת את ביצועי אלגוריתם כיול הערכת ההוראה המוצע של BFEN, המחקר השווה אותו לאלגוריתם PRF, ששילב ניתוח רכיבים עיקריים (PCA) ויער אקראי (RF); אלגוריתם EAB, ששילב מכונת למידה קיצונית (ELM) והגברה אדפטיבית (AdaBoost); ואלגוריתם DBLR, ששילב רשת אמונה עמוקה (DBN) ורגרסיה לוגיסטית (LR). הניסויים התנהלו על מערכת המצוידת במעבד Intel Core i9-13900HX וכרטיס מסך NVIDIA RTX 4080, מה שסיפק יכולת מחשוב מקבילית גבוהה וזיכרון וידאו גדול להשלמת חישובי חילוץ וכיול תכונות ביעילות עבור נתוני הערכה בקנה מידה גדול. מערכת ההפעלה הייתה Windows 11, ופייתון 3.9 שימשה לתכנות. האלגוריתמים יושמו באמצעות ספריית Scikit-learn, מודולי למידה עמוקה פותחו באמצעות מסגרת TensorFlow, וספריות Pandas ו-NumPy שימשו לעיבוד נתונים מוקדם. סביבת הפיתוח השתמשה ב-PyCharm Professional 2023.1, ו-Seaborn שימש להמחשת תוצאות כיול כדי להקל על השוואה אינטואיטיבית של ביצועי האלגוריתמים. כדי להבטיח את אמינות הנתונים, המחקר השתמש במאגר הנתונים של דוח ניטור החינוךהגלובלי 1 ובמאגר הנתונים של הישגים אקדמיים של תלמידי חטיבת ביניים ספרדית2. מאגר הנתונים מכיל 12,486 רשומות, המכסות נתוני הערכת הוראה רב-מודליים כגון הערכות הוראה של סגל אוניברסיטאי, הישגים אקדמיים של סטודנטים, הערכות הוראה סטודנטים ומשוב מהקורסים, הכוללים 137 מאפיינים של ממדי הוראה, כולל תדירות אינטראקציה בכיתה, זמן משוב למשימות, עקביות בניקוד, הכללת שפה ורגישות בין-תרבותית. המשתנה היעד הוא ציון הערכת ההוראה, שבמחקר זה ממופה לערך משולב משוקלל רב-ממדי שמכויל על ידי מומחים. המחקר משלב ארבעה סוגי מקורות מידע: הערכות הוראת סטודנטים, ביקורות עמיתים, תצפיות מפקחות בכיתה, וסקירות תיק הוראה, עם משקלים של 0.35, 0.25, 0.25 ו-0.15, בהתאמה. קבוצות האימון והאימות מחולקות לפי סדר כרונולוגי משני מערכי הנתונים. המחקר משתמש בנתונים מספטמבר 2024 כסט ההכשרה ובנתונים מאוקטובר 2024 עד יוני 2025 כסט אימות כדי להתאים להתקדמות הזמנית של ההערכות החינוכיות. בשלב העיבוד המוקדם, נעשה שימוש באסטרטגיה ייחודית למודליות, עם תכונות מובנות שמתקננות באמצעות נורמליזציה של ציון Z וחריגים מופרזים בווינזור, בעוד תכונות טקסטואליות מקודדות באמצעות מודל הסיני מבוסס BERT ומוקטנת ל-768 ממדים. הכשרה עוינת מיושמת לשיפור החוסן מול ביטויים של הטיה סמויה ולהפחתת סטייה סמנטית הנגרמת מהבדלים רקעיים תרבותיים.

כדי להשיג הכשרה חוצת תחומים ומחקר אימות, המודל יועבר לארבעה תרחישי הוראה הטרוגניים: חינוך בסיסי K-12, חינוך מקצועי, חינוך מתמשך וחינוך סיני בינלאומי לאפס או מעט מדגמים. בארבעת התרחישים הללו, המחקר מציג מונחי רגולריזציה אדפטיבית בתחום במהלך אימון אלגוריתמים כדי להגביל את עקביות התפלגות התכונות של המודל בתרחישי הוראה שונים. הטמעת מנגנון מסכה קל ומודע לתחביר לרעש משפטים קצרים בתרחישי K-12; כדי להתמודד עם עמימות המונחים המקצועיים בחינוך מקצועי, בנוי מילון תחום דינמי ומשולב עם גרף הידע של מתווה תוכנית הלימודים. עצב מודול למידה השוואת קבוצות גיל שיתמודד עם הפער הסמנטי הבין-דורי בהשכלה מתמשכת, תוך יישור עוגנים סמנטיים לביטויי הערכה של קבוצות גיל שונות במרחב הסמוי. כדי להתמודד עם ביטוי העומס התרבותי בחינוך הסיני הבינלאומי, נעשה שימוש בהנחיות השוואה בין-לשונית לשיפור ההבנה של מושגים חינוכיים לא-מילוליים. מחקר על כיול מומחים ובדיקות אמינות של שדות מובנים ברשומות הערכה מקוריות, תוך הסרת רשומות בעלות אמינות נמוכה עם מקדם אלפא של קריפנדורף מתחת ל-0.75. הערות ידניות כפולות עיוורות יושמה על טקסטי הערכה של תלמידים, כאשר 3 מומחי מדידה חינוכיים השלימו באופן עצמאי תיוג מסוג סטייה, והשיגו עקביות של כהן k = 0.86 בהערה. לבסוף, התוצאות המוערות הושוו עם רשומות נוכחות הפיקוח ומסקנות סקירת קבצי ההוראה כדי ליצור את תוויות הכיול הסופיות.

מערכי הנתונים שנבחרו הגיעו מאוכלוסיות שונות, מערכות מדידה ורקע חינוכי. פרדיגמת אימות חוצת תחומים זו בדקה בקפידה את החוסן וגבולות ההכללה של המודל בתוך מערכת חינוכית אותנטית, ומנעה אשליות הערכה הנגרמות מהומוגניזציה של הנתונים. שני המאגרים הכילו נפחים משמעותיים של רשומות הערכה להוראה, והציעו ערך ייחוס ישיר לפריסת אלגוריתמים אינטליגנטיים מודעי הוגנות. שני מערכי הנתונים כללו נתוני הערכת הוראה משמעותיים, שסיפקו ערכי ייחוס ישירים לעיצוב אלגוריתמים חכמים מודעי הוגנות ולכיול הערכת הוראה. המחקר כייל 1000 רשומות הערכת הוראה עם ארבעת האלגוריתמים וחישב את ה-ECA וה-Fairness FDR שלהם. התוצאות מוצגות באיור 8.

figure-results-1
איור 8: השוואת תוצאות בדיקות בין ECA ל-FDR. (א) BFEN. (ב) PRF. (ג) EAB. (ד) DBLR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

כפי שמוצג באיור 8A, BFEN השיג בתחילה ECA של 82.47% ו-FDR של 5.71% במשימת הכיול של ההערכה. ככל שמספר הרשומות המכוילים גדל, ה-ECA עלה ל-98.75% והתייצב לאחר כיול 421 רשומות, בעוד ש-FDR ירד ל-2.87% והתייצב לאחר כיול 514 רשומות. כפי שמוצג באיור 8B, עקומת ה-ECA של אלגוריתם PRF גדלה בהדרגה, בעוד שקו FDR ירד בהדרגה. בסיום משימת הכיול, ערך ה-ECA שלו היה 92.30%, וערך ה-PDR היה 6.72%. איור 8C מראה כי עקומת ה-ECA של אלגוריתם EAB עלתה במהירות לפני שהשטחה, בעוד שמסלול ה-FDR שלו הציג תנודות חמורות בשלבים מוקדמים לפני ההתכנסות, והסתיים ב-ECA של 84.64% ו-FDR של 8.93%. כפי שמתואר באיור 8D, אלגוריתם ה-DBLR הציג מסלול כלפי מעלה איטי של ECA מלווה בתנודות שוליות ודחיסה מוגבלת בקו ה-FDR שלו, וסיים את משימת הכיול עם ECA של 83.51% ו-FDR של 8.42%. ממצאים ניסיוניים אלו מאשרים כי אלגוריתם BFEN עולה משמעותית על הגישות הבסיסיות הן בדיוק תיקון הערכה והן בבקרת הטיית הוגנות. יכולת הכללה עדיפה זו מיוחסת לשילוב BERT בתוך BFEN, שמחלץ תכונות סמנטיות עמוקות מטקסט הערכה לא מובנה כדי ללכוד ביטויים של הטיה נסתרת, בעוד שמודול RL מייעל באופן דינמי את ספי ההגינות ופרמטרי התיקון באמצעות פונקציית תגמול רב-מטרתית להפרדת תכונות רגישות מהפלטים הסופיים. המחקר בדק לאחר מכן SAR ו-FMD להערכה בכיתה, מבחנים סופיים, הערכה מעשית והערכה מקוונת, תוך סימון ארבעת התרחישים כ-A, B, C ו-D. התוצאות מוצגות באיור 9.

figure-results-2
איור 9: השוואה בין SAR ל-FMD מביאה לתרחישים שונים. (א) תוצאות בדיקת חיפוש והצלה. (B) תוצאות בדיקת FMD. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

כפי שמוצג באיור 9A, BFEN השיגה SAR מעל 98% בכל תרחישי ההוראה, עם SAR הגבוה ביותר של 99.01% במבחני כיתה. ה-SAR של אלגוריתם ההשוואה בתרחישים שונים נמוך יותר מזה של אלגוריתם BFEN, כאשר אלגוריתם DBLR מחזיק ב-SAR הנמוך ביותר בתרחיש ההערכה הסופי מבין כל האלגוריתמים, עם SAR של 70.23%. כפי שמוצג באיור 9B, FMD של אלגוריתם BFEN עדיין גבוה משמעותית מזה של אלגוריתם ההשוואה בתרחישי הוראה שונים, עם FMDs של 98.47%, 98.05%, 97.81%, ו-97.94% בתרחישים שונים, בהתאמה. ה-FMDs של אלגוריתם הבנצ'מרק DBLR הם 82.36%, 71.74%, 70.59%, ו-69.12%, בהתאמה. ה-FMDs של אלגוריתם EAB הם 80.79%, 68.21%, 67.65% ו-66.03%, בהתאמה, בעוד שה-FMDs של אלגוריתם PRF הם 86.42%, 82.17%, 80.98% ו-78.33%, בהתאמה. תוצאות אלו הראו כי BFEN עקף את האלגוריתמים של השוואות בזכות למידה איטרטיבית של GBDT עם עצי החלטה מרובים, אשר תפסו במדויק דפוסי שגיאה בתרחישים שונים והבטיחו תוצאות כיול יציבות והוגנות. המחקר העריך בנוסף את שיעור זיהוי תכונות הדיסציפלינה (DFRR) בסינית, מתמטיקה ואנגלית באמצעות ארבעת האלגוריתמים. התוצאות מוצגות באיור 10.

figure-results-3
איור 10: השוואת תוצאות מבחני DFRR בתחומים שונים. (א) סט אימונים. (B) קבוצת אימות. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

כפי שמוצג באיור 10A, BFEN השיגה DFRR של 99.23%, 98.94% ו-99.13% בסינית, מתמטיקה ואנגלית במערך האימונים. איור 10B הצביע על כך ש-BFEN גם השיג DFRR גבוה יותר במערך האימות בהשוואה לאלגוריתמים אחרים. במיוחד, DFRR של BFEN לסין הגיע ל-98.41%, גבוה ב-10.8% מ-87.61% של DBLR; במתמטיקה, 97.54%, 9.07% גבוה מ-88.47% של PRF; ובאינגליש 98.13%, גבוה ב-13.34% לעומת 84.79% של EAB. תוצאות אלו אישרו כי BFEN הסתגל ביעילות לכיול הערכה דיסציפלינרית על ידי שילוב הלכידת ההבדלים הסמנטיים של BERT עם הלמידה האישית של דפוסי השגיאה של GBDT. כדי להעריך באופן מקיף את ביצועי BFEN, המחקר העריך MDFE, CRS ו-SDCT עבור ארבעת האלגוריתמים. התוצאות מוצגות בטבלה 1.

מערך נתוניםאלגוריתםMDFE (%)CRSSDCT (ים)
הכשרהBFEN98.42 ± 0.28*&@0.975 ± 0.28*&@0.78 ± 0.04*&@
PRF83.85 ± 0.410.779 ± 0.361.32 ± 0.08
EAB85.91 ± 0.500.806 ± 0.401.15 ± 0.07
DBLR88.76 ± 0.470.753 ± 0.391.45 ± 0.08
אימותBFEN97.58 ± 0.25*&@0.968 ± 0.27*&@0.86 ± 0.03*&@
PRF81.62 ± 0.320.687 ± 0.501.51 ± 0.06
EAB84.37 ± 0.400.749 ± 0.421.28 ± 0.05
DBLR87.53 ± 0.300.728 ± 0.471.63 ± 0.07

טבלה 1: השוואה בין תוצאות בדיקות MDFE, CRS ו-SDCT. "*" מציין הבדל משמעותי (p < 0.05) בין תוצאות BFEN ל-PRF. "&" מציין שההבדל בין תוצאות BFEN ל-EAB היה מובהק (p < 0.05). "@" מציין שההבדל בין תוצאות BFEN ל-DBLR משמעותי (p < 0.05)

טבלה 1 מציינת כי BFEN השיג MDFE של 98.42% בסט האימונים, גבוה ב-14.57% מ-83.85% של PRF, CRS של 0.975, 0.222 גבוה מ-0.753 של DBLR, ו-SDCT של 0.78 שניות, פחות ב-0.67 שניות מ-1.45 שניות של DBLR. במערך הוולידציה, BFEN שמרה על ביצועים טובים יותר, כאשר MDFE, CRS ו-SDCT של 97.58%, 0.968 ו-0.86 שניות בהתאמה, עולים על אלגוריתמים להשוואה בהתאמה. בסך הכול, התוצאות אישרו את הביצועים המקיפים והמעולים של BFEN בכיול הערכת הוראה.

מודל כיול הערכת הוראה GFBFEN לאימות ביצועים
בהתבסס על אימות הביצועים של BFEN, המחקר העריך את ביצועי מודל כיול הערכת ההוראה GFBFEN שנבנה על בסיס BFEN והשווה אותו למודלים של כיול שנבנו באמצעות אלגוריתמים PRF, EAB ו-DBLR. כדי להבטיח תנאי מבחן עקביים והשוואתיות, מאגר הנתונים של דוח ניטור החינוך הגלובלי שימש כמערך ההכשרה, בעוד שמאגר הביצועים האקדמיים של הסטודנטים שימש כמערך האימות. ארבעת המודלים כייללו 500 רשומות הערכה להוראה, ו-CAE ו-CRE שלהם חושבו. התוצאות מוצגות באיור 11.

figure-results-4
איור 11: השוואה בין תוצאות בדיקות CAE ל-CRE. (א) תוצאות בדיקות CAE. (ב) תוצאות בדיקת CRE. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

כפי שמוצג באיור 11A, GFBFEN השיג בתחילה CAE של 0.1279. ככל שהכיול התקדמה, ה-CAE ירד ל-0.0641 והתייצב לאחר 104 רשומות. מודלי ההשוואה הציגו CAE התחלתי וסופי גבוה יותר מ-GFBFEN, כאשר ל-EAB היו ה-CAE ההתחלתי והסופי הגבוהים ביותר של 0.1858 ו-0.1217, בהתאמה. איור 11B הצביע על כך שה-CRE ההתחלתי והסופי של GFBFEN במהלך משימת הכיול נותרו נמוכים יותר מהמודלים ההשוואתיים, עם ערכים של 0.1137 ו-0.0912, בהתאמה. תוצאות אלו הראו כי GFBFEN הפגין יכולת התאמה חזקה, תוך העלאת מנגנון הקשב של GAT, שבנה גרפים של קורלציה סמנטית בין התכונות, שיפור היישור הסמנטי של נתוני הערכה רב-מקוריות, והפחית כיול לא יעיל הנגרם מהטיית תכונות. המחקר העריך לאחר מכן את CAR עבור נתוני הערכה של תלמידים, נתוני הערכה של מורים, נתוני הערכה של בית ספר, ונתוני הערכה מקוונים, המסומנים כ-I, II, III ו-IV. התוצאות מוצגות באיור 12.

figure-results-5
איור 12: השוואת תוצאות CAR של נתוני הערכה שונים. (א) GFBFEN. (ב) PRF. (ג) EAB. (ד) DBLR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

כפי שמוצג באיור 12A, GFBFEN השיגה CAR של 99.34%, 98.93%, 99.01% ו-99.12% עבור נתוני הערכה לתלמידים, מורים, בתי ספר ונתונים מקוונים במערך ההכשרה. בערכת האימות, ערכי CAR היו 97.89%, 98.56%, 97.57% ו-98.46%, בהתאמה. איור 12B–D הראה כי מודלים השוואה הציגו CAR נמוך יותר הן בקבוצות אימון והן במערכות אימות. מתוכם, EAB ביצעה את התוצאות הגרועות ביותר בסט האימות, עם CAR של 76.31% לנתוני מורים ו-78.29% לנתונים מקוונים. תוצאות אלו אישרו כי GFBFEN ביצעה ביצועים טובים משמעותית מהמודלים ההשוואתיים. לאחר מכן, המחקר בדק את ה-TL במשימת כיול הערכת ההוראה כדי להעריך את יכולת ההתאמה ויציבות האימון. התוצאות מוצגות באיור 13.

figure-results-6
איור 13: יכולת התאמת דגם ותוצאות מבחני יציבות האימון. (A) GFBFEN. (ב) PRF. (ג) EAB. (ד) DBLR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

כפי שמוצג באיור 13A, ל-GFBFEN היה בתחילה TL של 0.1021 בערכת האימונים. לאחר 67 איטרציות, ה-TL ירד ל-0.0725 והתייצב. בקבוצת הוולידציה, TL ירד מ-0.1237 ל-0.1018. איור 13B–D הצביע על כך שה-TL הסופי של PRF בסט האימון היה 0.0824, ה-TL הסופי של EAB בסט האימות היה 0.1178, ו-TL של DBLR בשתי הקבוצות היה לא יציב וגבוה משמעותית ממודלים אחרים. תוצאות אלו הראו כי GFBFEN הפגין יכולת התאמה חזקה ויציבות אימון גבוהה, תוך העלאת העברת ידע מבוססת KD, שאפשרה למודל ללמוד במהירות תכונות אפקטיביות, להאיץ התכנסות אובדן ולהבטיח הכללה בין מערכי נתונים. כדי לאמת באופן מקיף את ביצועי הליבה של GFBFEN, המחקר בדק את EFCA, HDPE, FCP ו-CSCC עבור ארבעת המודלים. התוצאות מוצגות באיור 14.

figure-results-7
איור 14: תוצאות מבחני מדדים מקיפים של משימות הערכה ותיקון הוראה. (א) תוצאות בדיקת GFBFEN. (ב) תוצאות בדיקת PRF. (ג) תוצאות בדיקת EAB. (D) תוצאות בדיקת DBLR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

כפי שמוצג באיור 14A–D, למודל GFBFEN יש ערכי EFCA של 99.35% ו-98.76% במערכות האימון והוולידציה, בהתאמה. ה-EFCA של מודל PRF הוא 88.53% ו-87.04%, בהתאמה. בערכת הוולידציה, EFCA של מודל GFBFEN היה גבוה ב-6.59% מזה של מודל EAB עם 92.17%, ו-11.72% גבוה יותר מזה של מודל DBLR עם 87.04%. בנוסף, מדדי HDPE, FCP ו-CSCC שלה מובילים באופן מקיף: בקבוצת הוולידציה, HDPE של מודל GFBFEN הגיע ל-98.05%, ה-FCP הגיע ל-97.93%, וה-CSCC הגיע ל-0.968, כולם עקפו את מודלי PRF, EAB ו-DBLR. בסך הכול, תוצאות אלו אישרו את הביצועים המקיפים והמעולים של GFBFEN, והראו כי האופטימיזציה המתואמת של המודל ל-GAT-KD, AM-LSTM ו-BFEN שיפרה למעשה את דיוק הכיול, היעילות וההגינות בהערכת הוראה.

המחקר בנה בהדרגה את FairEduNet, BFEN, FBFEN ו-GFBFEN, וה-GFBFEN הסופי כולל רכיבים כמו FairEduNet, BERT-RL, AM-LSTM ו-GAT-KD. כדי לאמת את התרומה העצמאית של רכיבים בודדים, מתבצעים מחקר וניסויי אבלציה בעיצוב, תוך הסרה הדרגתית של כל רכיב והערכת השפעתו על הביצועים הכוללים. מדדים השוואתיים כוללים ECA, FDR, SAR ו-FMD. התוצאות הראו שערך ה-ECA של רכיב FairEduNet לבדו היה 87.32%, FDR היה 12.45%, SAR היה 89.67%, ו-FMD היה 11.89%. ה-ECA של דגם GFBFEN המלא הגיע ל-99.21%, ה-FDR ירד עוד יותר ל-1.93%, ה-SAR נשאר יציב ב-99.45%, וה-FMD אופטימלי ל-7.28%. לאחר הסרת BERT-RL, ECA ירד ל-91.04%, ערך FDR היה 6.23%, ערך SAR היה 92.33%, ו-FMD עלה ל-7.85%. האבלציה של AM-LSTM העלתה את תנודות ה-SAR ב-14.2%. הסרת GAT-KD הובילה לעלייה ב-FMD ל-8.36%, ומנגנון הדיכוי של הפצת הטיית מבנה הגרף בהנחיית זיקוק ידע היה יעיל משמעותית בהפחתת הטיית אסוציאציה סמויה בין אוכלוסיות.

כדי לבדוק את שיטות המחקר, המחקר הציג מדדי תקני הוגנות מוכרים, כלומר מדד תיקון הוגנות (FCB), המכסה שלושה סוגים של מגבלות נוקשות המוכרות בתרחישים חינוכיים: (1) הערך המוחלט של ההפרש הממוצע לאחר תיקון בין קבוצות הוא ≤ 1.2 נקודות (בהתבסס על מערכת האחוזים); (2) שיעור החפיפה של מרווחי הביטחון המתוקנים עבור כל תת-קבוצה רגישה הוא ≥-95%; (3) בכל תרחיש בודד, האזור המשותף של FDR ו-SAR חייב לעמוד במגבלת הגבול של פארטו (כלומר, אי אפשר לשפר SAR מבלי להידרדר FDR, ולהפך). מודל GFBFEN הושווה למודלים בסיסיים מרכזיים, כגון EAB, PRF, DBLR ו-GBDT, בהערכה הניסויית. הניסוי נערך על 421 נתוני הערכה אמיתיים שנאספו מתרחישי הוראה אמיתיים, וכיסו שלושה תרחישים חינוכיים טיפוסיים: הערכה בכיתה, הערכה מעשית ומבחנים מקוונים. התוצאות מוצגות בטבלה 2.

אלגוריתםהערך האבסולוטי של הפרש ממוצע הציוןשיעור חפיפת רווחי סמך (%)שיעור שביעות רצון אזורי אפשרי משותפת (%)ציון מקיף
GFBFEN0.8798.310097.2
EBA1.5298.482.678.5
PRF1.6885.174.371.2
DBLR1.4587.979.875.6
GBDT1.3391.286.479.9

טבלה 2: תוצאות הערכה של מדדי קריטריוני הוגנות ואימות יישום מעשי.

כפי שמוצג בטבלה 2, GFBFEN השיג עמידה מלאה בכל ארבעת מגבלות ה-FCB הקשיחות באופן עצמאי, והציון המקיף שלו עלה משמעותית על שאר מודלי הבסיס בהפרש של +18.7 נקודות, מה שמאשר את עמידות פרדיגמת התיקון השיתופית הרב-שלבית המוצעת. במיוחד, במדד הליבה המשקף את יכולת הפישר בין הוגנות ליעילות, שיעור הכיסוי האזורי המשותף הגיע ל-100%, מה שמעיד שלמודל יש יכולות קבלת החלטות אופטימליות לפרטו בתרחישי חינוך אמיתיים.

הוגנות בהערכת ההוראה מתייחסת לשימוש במגבלות כמותיות ניתנות לאימות כמדד תוך שמירה על הבדלים אישיים וחוקי חינוך. לוגיקת החישוב וקביעת הסף של מדדי שוויון מבוססים על המסגרת התיאורטית של שוויון חינוכי ותקני אימות נתונים אמפיריים. הם נבדקים במשותף על ידי ועדת מומחים המורכבת מחמישה חוקרים כדי להבטיח רמת אחדות גבוהה בין קפדנות תיאורטית ליכולת הסתגלות לפרקטיקה חינוכית. כדי לאמת עוד יותר את ההתאמה של המודל לסטנדרטים שונים של הוגנות, המחקר ביצע אימות נוסף תחת מספר סטנדרטים. באופן ספציפי, נבחרו שלושה תקני הוגנות לאימות. סטנדרט 1 הוא איזון שיעורי הקבלה בין קבוצות המבוסס על שוויון דמוגרפי. תקן 2 הוא העקביות בין קבוצות בין שיעור חיובי אמיתי לשיעור חיובי שגוי בהתבסס על סיכויים משווים. תקן 3 מבוסס על פריטי חיזוי לשליטה בהטיה בין קבוצות בדיוק התחזית. נמצא כי GFBFEN עומדת בעקביות בדרישות המגבלות הנוקשות תחת שלושת הסטנדרטים. סטיית שיעור קבלה קבוצתי סטנדרטי 1 ≤1.2%, הפרש בין קבוצות בין קבוצות בתקן 2 ≤0.85%, דיוק חיזוי תקן 3, סטייה בין-קבוצתית מבוקרת בטווח של ±±0.6%. לעומת זאת, המודלים האחרים הראו פריצת דרך באילוצים של ≥3.7% לפחות תחת קריטריון אחד, מה שאישר את תאימות ההכללה של GFBFEN לפרדיגמות הוגנות רב-משתניות.

זמינות נתונים:
כדי להבטיח את אמינות הנתונים, המחקר השתמש במאגר הנתונים Global Education Monitoring Report (https://www.education-progress.org/) ובמאגר נתוני הביצועים האקדמיים של תלמידי חטיבת ביניים ספרדית (https://archive.ics.uci.edu/dataset/320/student+performance). קבוצות האימון והאימות מחולקות לפי סדר כרונולוגי משני מערכי הנתונים. המחקר משתמש בנתונים מספטמבר 2024 כסט ההכשרה ומאוקטובר 2024 עד יוני 2025 כסט האימות, בהתאם להתקדמות הזמנית של ההערכות החינוכיות.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

אלגוריתם BFEN שהוצע במחקר זה הראה ביצועים מעולים בניסויים השוואתיים. מנקודת המבט של ECA ו-FDR, הוא הצטיין משמעותית על אלגוריתמי PRF, EAB ו-DBLR. בעת כיול 421 רשומות הערכה, BFEN העלה את ECA ל-98.75% ושמר על יציבות, בעוד FDR ירד ל-2.87%. ביצועים אלו נבעו משילוב BERT-RL לאופטימיזציה של תכונות והתאמה דינמית. BERT חילץ בדיוק מידע על הטיה סמנטית עמוקה מטקסטים של הערכה לא מובנית, ו-RL התאים דינמית את ספי ההוגנות ופרמטרי הכיול באמצעות פונקציית תגמול רב-אובייקטיבית, ובכך ביטל את השפעת התכונות הרגישות על התוצאות. זה דומה לעבודה שבוצעה על ידי ולנסיה-לונדוניו ואחרים, שהשתמשו באלגוריתמים של בינה מלאכותית לבניית מודל הכללה חינוכית למבוגרים עם הפרעות נוירומוסקולריות שונות. למרות שמודל ההכללה החינוכית שנבנה אושר כהיתכנות בקבוצות מחלות נוירומוסקולריות ספציפיות, מגבלות ההגינות שלו כיסו רק ממד אחד (ייצוג שווה של קבוצות אבחון), ולא נקבעה מערכת הגבלות נוקשה בין קבוצות מרובות ומטרות מרובות27. במבחנים בתרחישי הוראה שונים, BFEN השיגה SAR של 99.01% להערכות בכיתה ו-FMD של 97.81% בהערכות מעשיות, גבוה משמעותית מהמודלים ההשוואתיים. יתרון זה נבע מהלמידה האיטרטיבית של GBDT על דפוסי שגיאה בנתוני הערכה מרובי תרחישים, בשילוב עם ספריית תקני הוגנות החינוך החכם כדי להתאים את פרמטרי הכיול היעד, ובכך להפחית למעשה הטיית כיול וחוסר איזון בהגינות הנגרם מהבדלי תרחישים. בהשוואה למערכת הערכת בינה מלאכותית הוגנת אדפטיבית וניתנת לפרשנות שהציעו קומאר ואחרים, הכוללת לולאות משוב של מומחים אנושיים ומודולים לאימות הוגנות בין-שפה, למרות שהיא מציגה תכונות אלו, היא נכשלת במידול יעיל של שרשראות ההטיה המובלעת בטקסטי ההערכה בתחום ההערכה החינוכית, אשר בעל צפיפות סמנטית גבוהה ותלות חזקה בהקשר28. מחקר זה משולב עמוק יותר מבחינת ההבטחה הנוקשה של מגבלות הוגנות והקישור העמוק של מודלים סמנטיים חינוכיים לעומת הספרות28.

במשימות הערכה מעשיות של חינוך חכם, מודל GFBFEN שנבנה על בסיס BFEN הראה גם יתרונות משמעותיים. עבור 500 שיאי כיול, GFBFEN השיג CAE סופי של 0.0641 ו-CRE של 0.0912. ה-CAR שלה עבור מספר סוגי נתוני הערכה עלה על 97% הן במערכות הכשרה והן במערכות האישור. ביצועים אלו נבעו מאופטימיזציה של מתאם תכונות ועיבוד קל משקל של GAT-KD. GAT בנה גרפים של קורלציה סמנטית בין תכונות כדי להפחית הטיית תכונות בנתונים מרובי מקורות, בעוד שהעברת הידע של KD שיפרה את יעילות ההסקה מבלי לפגוע בדיוק המודל, ומנעה עיכובים בכיול הנגרמים ממורכבות המודל. בהשוואה למחקר שנערך על ידי דהו ואח' על השפעת סטיית מערך הנתונים על הוגנות מודלים של ניתוח למידה, אף שמחקרם התמקד במנגנון השפעת סטיית הנתונים על הוגנות, אסטרטגיות התיקון התבססו על משקל סטטי ופיצוי לאחר אירוע, ללא יכולת לתפוס ולהגיב באופן דינמי לסטיות הסמנטיות בזמן אמת. היה קשה להתמודד עם התפתחות ההטיות המובלעות בהערכת חינוך שנגרמו מביטויים סובייקטיביים של מורים והבדלים בסגנונות השפה של התלמידים. עם זאת, מחקר זה, באמצעות מודל GFBFEN, תופס ומגיב בצורה דינמית לסטיות סמנטיות בסמנטיקה של ההערכה, ותופס את הנטיות הערכיות המרומזות בהערות המורים, סטיות סגנון שפה בטקסטי התגובה של התלמידים, והסטה סמנטית בביטויי הערכה בין כיתות/מקצועות, ומשיג שינוי פרדיגמה מ"פיצוי סטטי" ל"כיול דינמי"29. בבדיקות מדד ליבה, GFBFEN השיג EFCA של 99.35% ו-98.76% במערכות אימון ואימות בהתאמה, ו-FCP של 98.52% ו-97.93%, גבוה משמעותית ממודלים השוואה. בדומה למערכת הבחינה הפתוחה עם ציונים אוטומטיים המבוססים על בינה מלאכותית שפותחה על ידי צוות דימארי A, למרות שהשיגה רמת עקביות גבוהה בציון תשובות פתוחות, תיקון ההגינות שלה מסתמך רק על משקל ממדי הניקוד שנקבע מראש ועל ספריית הדגימות המוטה שמסומנת על ידי בני אדם, מבלי להטמיע מנגנון אבולוציוני דינמי סמנטי חינוכי. מחקר זה השיג פריצות דרך משמעותיות במנגנון האבולוציה הדינמי של תיקון ההגינות ובמידול העמוק של סמנטיקה חינוכית בהשוואה לתוצאות המחקר של צוות דימארי A, במיוחד עם עמידות ויכולת פרשנות חזקה בהתמודדות עם אתגרים מהעולם האמיתי כגון סטייה בכיוון הערכי של הערות המורים, הבדלים בבין-דוריים בסגנונות השפה של התלמידים. והעמימות בביטויי הערכה בין-תחומית30.

מחקר זה תרם בשלושה היבטים. ראשית, אלגוריתם BFEN שילב את BERT-RL עם FairEduNet, ושיפר את יעילות העיבוד ואת ההסתגלות למספר תרחישים עבור נתונים הטרוגניים מרובי מקורות באמצעות אופטימיזציה סמנטית של תכונות והתאמת פרמטרים דינמיים. שנית, מודל GFBFEN, המבוסס על GAT-KD ו-FBFEN, הציג למידת קורלציה סמנטית והעברת ידע קלה, פותר בעיות של מתאם מאפיינים חלש ויעילות הסקה נמוכה בתרחישים חינוכיים מורכבים, ומשפר את הפרקטיות בכיול ההערכה. שלישית, המודלים יושמו לכיול נושאים וסוגי הערכה שונים, תוך מתן תמיכה טכנית להערכת הוראה מדויקת וקידום הוגנות חינוכית. תרומות אלו הציעו גישה חדשה לכיול הערכת חינוך חכם ונקודת ייחוס לשיתוף פעולה רב-אלגוריתמי בעיבוד נתונים חינוכיים מורכבים.

שיטות הכיול הנוכחיות להערכת חינוך חכם חסרות גמישות והוגנות. מחקר זה מציע מודל GFBFEN המבוסס על FairEduNet, המשתמש ב-GAN ו-GBDT לכיול הוגנות. BERT-RL משפר את עיבוד הנתונים הלא מובנה, AM-LSTM משפר מיזוג נתונים רב-מקורי, ו-GAT-KD מחזק את הקורלציה בין תכונות וקלות משקל. על ידי שילוב אלגוריתמים אלו, המודל משיג כיול מדויק והגינות דינמית. בדיקות מראות עיבוד נתונים רב-מקורי מצוין וכיול הוגנות חוצה תרחישים, תוך עמידה בדרישות דיוק והגינות. עם זאת, למודל יש מגבלות מול קבוצות חינוך מיוחד, ודורש הכללה משופרת. העבודה העתידית תמקסם את הפרמטרים ותתאים את מגבלות ההוגנות לתרחישים מגוונים, ותתמוך בהגינות חינוכית ובאיכות ההוראה.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחבר אין מה לחשוף.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחבר מצהיר שאין ניגוד עניינים.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Global Education Monitoring Report datasetUNESCOhttps://www.education-progress.org/Dataset
NumPyNumPyhttps://numpy.org/Data preprocessing
PandasPandas, NumPyhttps://pandas.pydata.org/Data preprocessing
PyCharm Professional 2023.1PyCharm Version 2023.1Development environment
Python 3.9Python Version 3.9‌Programming language
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/index.htmlMachine Learning
SeabornSeabornhttps://seaborn.pydata.org/Visualization
Spanish middle school student academic performance datasetUC Irvine Machine Learning Repositoryhttps://archive.ics.uci.edu/dataset/320/student+performanceDataset
TensorFlowTensorFlowhttps://www.tensorflow.org/Deep Learning
Windows 11MicrosoftVersion 11Operating System

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

EngineeringIntelligent educationFairEduNetTeaching assessment calibrationGenerative Adversarial NetworkGradient boosting decision tree

Related Articles