$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
ניתוח ביצועי אלגוריתם BFEN
המדדים שנבדקו בניסויים כללו את הבאים:
דיוק תיקון הערכה (ECA) מציין את שיעור פריטי הסטייה שזוהו ותוקנו נכון על ידי המודל בתוצאות ההערכה ההוראתית, ובכך משקף את היעילות הכוללת של מנגנון התיקון. ערכים גבוהים יותר מצביעים על דיוק תיקון גבוה יותר.
שיעור סטיית הוגנות (FDR) מודד את גודל פערי הציונים בין קבוצות שהמודל נכשל בהסרת במהלך תהליך הכיול. הוא מחושב כיחס בין סטיית התקן של כל תכונה רגישה (למשל, מין, אזור, אתניות) בתוך התפלגות הניקוד לסטיית התקן הכוללת; ערכים נמוכים יותר מצביעים על מינימום שונות בין-קבוצתית והבטחת הוגנות חזקה יותר.
קצב התאמת תרחישים (SAR) מצביע על אחוז משימות התיקון שבוצעו בהצלחה על ידי המודל בהקשרים הוראה הטרוגניים (למשל, מדעים מול מדעי הרוח, סביבות מקוונות לעומת לא מקוונות).
דרגת שמירת הוגנות (FMD) מוגדרת כאחד פחות היחס בין שונות מדדי ההגינות בין קבוצות תכונות רגישות לאחר התיקון לבין זה שנצפה לפני התיקון, המשקף את יכולת המערכת לשמור על ההגינות המבנית שלה במהלך תהליך הכיול.
קצב זיהוי תכונות דיסציפלינריות (DFRR) מחשב את שיעור המדגמים שבהם תכונות ליבה מזוהות נכון בנתוני ההערכה של כל תחום ביחס לגודל המדגם הכולל של ההערכה, ומדגים את יכולת המודל להבחין וללכוד וריאציות ספציפיות לתחום.
יעילות מיזוג נתונים רב-מקורות (MDFE) מתייחסת ליעילות התפוקה של המודל במהלך יישור התכונות, הקצאת משקל ותיקון סטיות בעת מיזוג נתוני הערכה הטרוגניים מרובי מקורות. מדד מקיף זה מוגדר כמכפלה של מספר דגימות ההערכה המעובדות בשנייה (דגימות/שנייה) וקצב עמידה בעקביות התיקון (ברמת ביטחון >95%), כאשר ערכים גבוהים יותר מצביעים על צינור היתוך יעיל ויציב יותר.
יציבות תוצאת תיקון (CRS) מצביעה על עקביות של פלטי כיול במספר ריצות עצמאיות, המנודה על ידי ההפך של סטיית התקן של המרחק האוקלידי בין פלטי התיקון של כל ריצה תחת קלטים זהים. ערכים גבוהים יותר מצביעים על אמינות מערכתית מוגברת.
זמן תיקון נתונים בודד (SDCT) מייצג את ההשהיה החישובית הממוצעת שנצרכת על ידי המודל להשלמת כיול דגימת הערכה יחידה, הנמדדת במילישניות (ms); ערכים נמוכים יותר מעידים על יכולת תגובה בזמן אמת חזקה יותר.
שגיאה מוחלטת מתוקנת (CAE) מודדת את השגיאה המוחלטת הממוצעת בין התחזיות המכויילות לערכי אמת היסוד, ומייצגת את הסטייה השארית של המודל ביחס לנתונים המקוריים הלא מכוילים. ערכים נמוכים יותר מצביעים על כך שהפלטים המכוילים מתאימים יותר לרמות הביצועים האמיתיות.
שגיאת יחסית מתוקנת (CRE) מכמת את השגיאה האבסולוטית הממוצעת בין התחזיות המכוילים לערכי אמת הקרקע המובע כאחוז מהאמת הקרקעית, כאשר ערכים נמוכים יותר מצביעים על דיוק כיול יחסי גבוה יותר.
שיעור דיוק התיקון (CAR) מייצג את שיעור המדגמים שהשגיאה האבסולוטית שלהן לאחר הכיול היא < 0.5 יחסית לגודל המדגם הכולל, מה שמדגים את אמינות המודל בעמידה במגבלות דיוק מוגדרות מראש. ערכים גבוהים מחזקים את התועלת האמפירית והאמינות של התוצרים.
ערך ההפסד הכולל (TL) מייצג את ערך המטרה המקיף לאופטימיזציה הנגזר מהסכום המשוקלל של מונחי תת-הפסדים בודדים עם סיום המשימה. באופן ספציפי, שבעה מדדים—DFRR, MDFE, CRS, SDCT, CAE, CRE ו-CAR—מתוקנים באמצעות נורמליזציה של ציון Z ומשוקללים בהתאם לעדיפות התפעולית של משימות ההערכה. בהינתן וקטור המשקל [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1], שבעת ערכי האינדיקטור המנורמליים הללו מאוגדים לחישוב ההפסד הסופי.
דיוק אשכולות תכונות להערכה (EFCA) מעריך את מידת היישור בין תצורות האשכול הלא מפוקחות שנוצרות על ידי המודל לבין קטגוריות אמת קרקעית שאומתו על ידי מומחי תחום.
יעילות עיבוד נתונים מממד גבוה (HDPE) מודדת את מספר הדגימות שנחשפו להפחתת ממדי תכונות ותיקון סטיות ליחידת זמן בעת טיפול בווקטורים דלילים מממד גבוה המכילים ≥50 תכונות הערכה. כאשר נמדדים בדגימות לשנייה, ערכים גבוהים משקפים יכולת חזקה יותר לעבד קלטי הערכה מורכבים וגדולים בזמן אמת.
דיוק תיקון הוגנות (FCP) מעריך את האחידות של השפעות הכיול בין קבוצות סטודנטים שונות. מדד זה מכומת על ידי חישוב ממוצע ההתפלגות של מרחק קולמוגורוב-סמירנוב עבור השגיאות המוחלטות המתוקנות על פני תת-קבוצות התכונות הרגישות; ערכים נמוכים יותר מרמזים על ביצועים מאוזנים יותר בין קבוצות וביטחון הוגנות חזק יותר.
עקביות תיקון חוצה סצנות (CSCC) מכמת את ההזזה ההתפלגתית של תוצאות הכיול בשלושה תרחישים טיפוסיים—כלומר, הערכה בכיתה, הערכה מעשית ובדיקות מקוונות—המודגם כיחס מרחק ווסרשטיין.
כדי לאמת את ביצועי אלגוריתם כיול הערכת ההוראה המוצע של BFEN, המחקר השווה אותו לאלגוריתם PRF, ששילב ניתוח רכיבים עיקריים (PCA) ויער אקראי (RF); אלגוריתם EAB, ששילב מכונת למידה קיצונית (ELM) והגברה אדפטיבית (AdaBoost); ואלגוריתם DBLR, ששילב רשת אמונה עמוקה (DBN) ורגרסיה לוגיסטית (LR). הניסויים התנהלו על מערכת המצוידת במעבד Intel Core i9-13900HX וכרטיס מסך NVIDIA RTX 4080, מה שסיפק יכולת מחשוב מקבילית גבוהה וזיכרון וידאו גדול להשלמת חישובי חילוץ וכיול תכונות ביעילות עבור נתוני הערכה בקנה מידה גדול. מערכת ההפעלה הייתה Windows 11, ופייתון 3.9 שימשה לתכנות. האלגוריתמים יושמו באמצעות ספריית Scikit-learn, מודולי למידה עמוקה פותחו באמצעות מסגרת TensorFlow, וספריות Pandas ו-NumPy שימשו לעיבוד נתונים מוקדם. סביבת הפיתוח השתמשה ב-PyCharm Professional 2023.1, ו-Seaborn שימש להמחשת תוצאות כיול כדי להקל על השוואה אינטואיטיבית של ביצועי האלגוריתמים. כדי להבטיח את אמינות הנתונים, המחקר השתמש במאגר הנתונים של דוח ניטור החינוךהגלובלי 1 ובמאגר הנתונים של הישגים אקדמיים של תלמידי חטיבת ביניים ספרדית2. מאגר הנתונים מכיל 12,486 רשומות, המכסות נתוני הערכת הוראה רב-מודליים כגון הערכות הוראה של סגל אוניברסיטאי, הישגים אקדמיים של סטודנטים, הערכות הוראה סטודנטים ומשוב מהקורסים, הכוללים 137 מאפיינים של ממדי הוראה, כולל תדירות אינטראקציה בכיתה, זמן משוב למשימות, עקביות בניקוד, הכללת שפה ורגישות בין-תרבותית. המשתנה היעד הוא ציון הערכת ההוראה, שבמחקר זה ממופה לערך משולב משוקלל רב-ממדי שמכויל על ידי מומחים. המחקר משלב ארבעה סוגי מקורות מידע: הערכות הוראת סטודנטים, ביקורות עמיתים, תצפיות מפקחות בכיתה, וסקירות תיק הוראה, עם משקלים של 0.35, 0.25, 0.25 ו-0.15, בהתאמה. קבוצות האימון והאימות מחולקות לפי סדר כרונולוגי משני מערכי הנתונים. המחקר משתמש בנתונים מספטמבר 2024 כסט ההכשרה ובנתונים מאוקטובר 2024 עד יוני 2025 כסט אימות כדי להתאים להתקדמות הזמנית של ההערכות החינוכיות. בשלב העיבוד המוקדם, נעשה שימוש באסטרטגיה ייחודית למודליות, עם תכונות מובנות שמתקננות באמצעות נורמליזציה של ציון Z וחריגים מופרזים בווינזור, בעוד תכונות טקסטואליות מקודדות באמצעות מודל הסיני מבוסס BERT ומוקטנת ל-768 ממדים. הכשרה עוינת מיושמת לשיפור החוסן מול ביטויים של הטיה סמויה ולהפחתת סטייה סמנטית הנגרמת מהבדלים רקעיים תרבותיים.
כדי להשיג הכשרה חוצת תחומים ומחקר אימות, המודל יועבר לארבעה תרחישי הוראה הטרוגניים: חינוך בסיסי K-12, חינוך מקצועי, חינוך מתמשך וחינוך סיני בינלאומי לאפס או מעט מדגמים. בארבעת התרחישים הללו, המחקר מציג מונחי רגולריזציה אדפטיבית בתחום במהלך אימון אלגוריתמים כדי להגביל את עקביות התפלגות התכונות של המודל בתרחישי הוראה שונים. הטמעת מנגנון מסכה קל ומודע לתחביר לרעש משפטים קצרים בתרחישי K-12; כדי להתמודד עם עמימות המונחים המקצועיים בחינוך מקצועי, בנוי מילון תחום דינמי ומשולב עם גרף הידע של מתווה תוכנית הלימודים. עצב מודול למידה השוואת קבוצות גיל שיתמודד עם הפער הסמנטי הבין-דורי בהשכלה מתמשכת, תוך יישור עוגנים סמנטיים לביטויי הערכה של קבוצות גיל שונות במרחב הסמוי. כדי להתמודד עם ביטוי העומס התרבותי בחינוך הסיני הבינלאומי, נעשה שימוש בהנחיות השוואה בין-לשונית לשיפור ההבנה של מושגים חינוכיים לא-מילוליים. מחקר על כיול מומחים ובדיקות אמינות של שדות מובנים ברשומות הערכה מקוריות, תוך הסרת רשומות בעלות אמינות נמוכה עם מקדם אלפא של קריפנדורף מתחת ל-0.75. הערות ידניות כפולות עיוורות יושמה על טקסטי הערכה של תלמידים, כאשר 3 מומחי מדידה חינוכיים השלימו באופן עצמאי תיוג מסוג סטייה, והשיגו עקביות של כהן k = 0.86 בהערה. לבסוף, התוצאות המוערות הושוו עם רשומות נוכחות הפיקוח ומסקנות סקירת קבצי ההוראה כדי ליצור את תוויות הכיול הסופיות.
מערכי הנתונים שנבחרו הגיעו מאוכלוסיות שונות, מערכות מדידה ורקע חינוכי. פרדיגמת אימות חוצת תחומים זו בדקה בקפידה את החוסן וגבולות ההכללה של המודל בתוך מערכת חינוכית אותנטית, ומנעה אשליות הערכה הנגרמות מהומוגניזציה של הנתונים. שני המאגרים הכילו נפחים משמעותיים של רשומות הערכה להוראה, והציעו ערך ייחוס ישיר לפריסת אלגוריתמים אינטליגנטיים מודעי הוגנות. שני מערכי הנתונים כללו נתוני הערכת הוראה משמעותיים, שסיפקו ערכי ייחוס ישירים לעיצוב אלגוריתמים חכמים מודעי הוגנות ולכיול הערכת הוראה. המחקר כייל 1000 רשומות הערכת הוראה עם ארבעת האלגוריתמים וחישב את ה-ECA וה-Fairness FDR שלהם. התוצאות מוצגות באיור 8.

איור 8: השוואת תוצאות בדיקות בין ECA ל-FDR. (א) BFEN. (ב) PRF. (ג) EAB. (ד) DBLR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
כפי שמוצג באיור 8A, BFEN השיג בתחילה ECA של 82.47% ו-FDR של 5.71% במשימת הכיול של ההערכה. ככל שמספר הרשומות המכוילים גדל, ה-ECA עלה ל-98.75% והתייצב לאחר כיול 421 רשומות, בעוד ש-FDR ירד ל-2.87% והתייצב לאחר כיול 514 רשומות. כפי שמוצג באיור 8B, עקומת ה-ECA של אלגוריתם PRF גדלה בהדרגה, בעוד שקו FDR ירד בהדרגה. בסיום משימת הכיול, ערך ה-ECA שלו היה 92.30%, וערך ה-PDR היה 6.72%. איור 8C מראה כי עקומת ה-ECA של אלגוריתם EAB עלתה במהירות לפני שהשטחה, בעוד שמסלול ה-FDR שלו הציג תנודות חמורות בשלבים מוקדמים לפני ההתכנסות, והסתיים ב-ECA של 84.64% ו-FDR של 8.93%. כפי שמתואר באיור 8D, אלגוריתם ה-DBLR הציג מסלול כלפי מעלה איטי של ECA מלווה בתנודות שוליות ודחיסה מוגבלת בקו ה-FDR שלו, וסיים את משימת הכיול עם ECA של 83.51% ו-FDR של 8.42%. ממצאים ניסיוניים אלו מאשרים כי אלגוריתם BFEN עולה משמעותית על הגישות הבסיסיות הן בדיוק תיקון הערכה והן בבקרת הטיית הוגנות. יכולת הכללה עדיפה זו מיוחסת לשילוב BERT בתוך BFEN, שמחלץ תכונות סמנטיות עמוקות מטקסט הערכה לא מובנה כדי ללכוד ביטויים של הטיה נסתרת, בעוד שמודול RL מייעל באופן דינמי את ספי ההגינות ופרמטרי התיקון באמצעות פונקציית תגמול רב-מטרתית להפרדת תכונות רגישות מהפלטים הסופיים. המחקר בדק לאחר מכן SAR ו-FMD להערכה בכיתה, מבחנים סופיים, הערכה מעשית והערכה מקוונת, תוך סימון ארבעת התרחישים כ-A, B, C ו-D. התוצאות מוצגות באיור 9.

איור 9: השוואה בין SAR ל-FMD מביאה לתרחישים שונים. (א) תוצאות בדיקת חיפוש והצלה. (B) תוצאות בדיקת FMD. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
כפי שמוצג באיור 9A, BFEN השיגה SAR מעל 98% בכל תרחישי ההוראה, עם SAR הגבוה ביותר של 99.01% במבחני כיתה. ה-SAR של אלגוריתם ההשוואה בתרחישים שונים נמוך יותר מזה של אלגוריתם BFEN, כאשר אלגוריתם DBLR מחזיק ב-SAR הנמוך ביותר בתרחיש ההערכה הסופי מבין כל האלגוריתמים, עם SAR של 70.23%. כפי שמוצג באיור 9B, FMD של אלגוריתם BFEN עדיין גבוה משמעותית מזה של אלגוריתם ההשוואה בתרחישי הוראה שונים, עם FMDs של 98.47%, 98.05%, 97.81%, ו-97.94% בתרחישים שונים, בהתאמה. ה-FMDs של אלגוריתם הבנצ'מרק DBLR הם 82.36%, 71.74%, 70.59%, ו-69.12%, בהתאמה. ה-FMDs של אלגוריתם EAB הם 80.79%, 68.21%, 67.65% ו-66.03%, בהתאמה, בעוד שה-FMDs של אלגוריתם PRF הם 86.42%, 82.17%, 80.98% ו-78.33%, בהתאמה. תוצאות אלו הראו כי BFEN עקף את האלגוריתמים של השוואות בזכות למידה איטרטיבית של GBDT עם עצי החלטה מרובים, אשר תפסו במדויק דפוסי שגיאה בתרחישים שונים והבטיחו תוצאות כיול יציבות והוגנות. המחקר העריך בנוסף את שיעור זיהוי תכונות הדיסציפלינה (DFRR) בסינית, מתמטיקה ואנגלית באמצעות ארבעת האלגוריתמים. התוצאות מוצגות באיור 10.

איור 10: השוואת תוצאות מבחני DFRR בתחומים שונים. (א) סט אימונים. (B) קבוצת אימות. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
כפי שמוצג באיור 10A, BFEN השיגה DFRR של 99.23%, 98.94% ו-99.13% בסינית, מתמטיקה ואנגלית במערך האימונים. איור 10B הצביע על כך ש-BFEN גם השיג DFRR גבוה יותר במערך האימות בהשוואה לאלגוריתמים אחרים. במיוחד, DFRR של BFEN לסין הגיע ל-98.41%, גבוה ב-10.8% מ-87.61% של DBLR; במתמטיקה, 97.54%, 9.07% גבוה מ-88.47% של PRF; ובאינגליש 98.13%, גבוה ב-13.34% לעומת 84.79% של EAB. תוצאות אלו אישרו כי BFEN הסתגל ביעילות לכיול הערכה דיסציפלינרית על ידי שילוב הלכידת ההבדלים הסמנטיים של BERT עם הלמידה האישית של דפוסי השגיאה של GBDT. כדי להעריך באופן מקיף את ביצועי BFEN, המחקר העריך MDFE, CRS ו-SDCT עבור ארבעת האלגוריתמים. התוצאות מוצגות בטבלה 1.
| מערך נתונים | אלגוריתם | MDFE (%) | CRS | SDCT (ים) |
| הכשרה | BFEN | 98.42 ± 0.28*&@ | 0.975 ± 0.28*&@ | 0.78 ± 0.04*&@ |
| PRF | 83.85 ± 0.41 | 0.779 ± 0.36 | 1.32 ± 0.08 |
| EAB | 85.91 ± 0.50 | 0.806 ± 0.40 | 1.15 ± 0.07 |
| DBLR | 88.76 ± 0.47 | 0.753 ± 0.39 | 1.45 ± 0.08 |
| אימות | BFEN | 97.58 ± 0.25*&@ | 0.968 ± 0.27*&@ | 0.86 ± 0.03*&@ |
| PRF | 81.62 ± 0.32 | 0.687 ± 0.50 | 1.51 ± 0.06 |
| EAB | 84.37 ± 0.40 | 0.749 ± 0.42 | 1.28 ± 0.05 |
| DBLR | 87.53 ± 0.30 | 0.728 ± 0.47 | 1.63 ± 0.07 |
טבלה 1: השוואה בין תוצאות בדיקות MDFE, CRS ו-SDCT. "*" מציין הבדל משמעותי (p < 0.05) בין תוצאות BFEN ל-PRF. "&" מציין שההבדל בין תוצאות BFEN ל-EAB היה מובהק (p < 0.05). "@" מציין שההבדל בין תוצאות BFEN ל-DBLR משמעותי (p < 0.05)
טבלה 1 מציינת כי BFEN השיג MDFE של 98.42% בסט האימונים, גבוה ב-14.57% מ-83.85% של PRF, CRS של 0.975, 0.222 גבוה מ-0.753 של DBLR, ו-SDCT של 0.78 שניות, פחות ב-0.67 שניות מ-1.45 שניות של DBLR. במערך הוולידציה, BFEN שמרה על ביצועים טובים יותר, כאשר MDFE, CRS ו-SDCT של 97.58%, 0.968 ו-0.86 שניות בהתאמה, עולים על אלגוריתמים להשוואה בהתאמה. בסך הכול, התוצאות אישרו את הביצועים המקיפים והמעולים של BFEN בכיול הערכת הוראה.
מודל כיול הערכת הוראה GFBFEN לאימות ביצועים
בהתבסס על אימות הביצועים של BFEN, המחקר העריך את ביצועי מודל כיול הערכת ההוראה GFBFEN שנבנה על בסיס BFEN והשווה אותו למודלים של כיול שנבנו באמצעות אלגוריתמים PRF, EAB ו-DBLR. כדי להבטיח תנאי מבחן עקביים והשוואתיות, מאגר הנתונים של דוח ניטור החינוך הגלובלי שימש כמערך ההכשרה, בעוד שמאגר הביצועים האקדמיים של הסטודנטים שימש כמערך האימות. ארבעת המודלים כייללו 500 רשומות הערכה להוראה, ו-CAE ו-CRE שלהם חושבו. התוצאות מוצגות באיור 11.

איור 11: השוואה בין תוצאות בדיקות CAE ל-CRE. (א) תוצאות בדיקות CAE. (ב) תוצאות בדיקת CRE. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
כפי שמוצג באיור 11A, GFBFEN השיג בתחילה CAE של 0.1279. ככל שהכיול התקדמה, ה-CAE ירד ל-0.0641 והתייצב לאחר 104 רשומות. מודלי ההשוואה הציגו CAE התחלתי וסופי גבוה יותר מ-GFBFEN, כאשר ל-EAB היו ה-CAE ההתחלתי והסופי הגבוהים ביותר של 0.1858 ו-0.1217, בהתאמה. איור 11B הצביע על כך שה-CRE ההתחלתי והסופי של GFBFEN במהלך משימת הכיול נותרו נמוכים יותר מהמודלים ההשוואתיים, עם ערכים של 0.1137 ו-0.0912, בהתאמה. תוצאות אלו הראו כי GFBFEN הפגין יכולת התאמה חזקה, תוך העלאת מנגנון הקשב של GAT, שבנה גרפים של קורלציה סמנטית בין התכונות, שיפור היישור הסמנטי של נתוני הערכה רב-מקוריות, והפחית כיול לא יעיל הנגרם מהטיית תכונות. המחקר העריך לאחר מכן את CAR עבור נתוני הערכה של תלמידים, נתוני הערכה של מורים, נתוני הערכה של בית ספר, ונתוני הערכה מקוונים, המסומנים כ-I, II, III ו-IV. התוצאות מוצגות באיור 12.

איור 12: השוואת תוצאות CAR של נתוני הערכה שונים. (א) GFBFEN. (ב) PRF. (ג) EAB. (ד) DBLR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
כפי שמוצג באיור 12A, GFBFEN השיגה CAR של 99.34%, 98.93%, 99.01% ו-99.12% עבור נתוני הערכה לתלמידים, מורים, בתי ספר ונתונים מקוונים במערך ההכשרה. בערכת האימות, ערכי CAR היו 97.89%, 98.56%, 97.57% ו-98.46%, בהתאמה. איור 12B–D הראה כי מודלים השוואה הציגו CAR נמוך יותר הן בקבוצות אימון והן במערכות אימות. מתוכם, EAB ביצעה את התוצאות הגרועות ביותר בסט האימות, עם CAR של 76.31% לנתוני מורים ו-78.29% לנתונים מקוונים. תוצאות אלו אישרו כי GFBFEN ביצעה ביצועים טובים משמעותית מהמודלים ההשוואתיים. לאחר מכן, המחקר בדק את ה-TL במשימת כיול הערכת ההוראה כדי להעריך את יכולת ההתאמה ויציבות האימון. התוצאות מוצגות באיור 13.

איור 13: יכולת התאמת דגם ותוצאות מבחני יציבות האימון. (A) GFBFEN. (ב) PRF. (ג) EAB. (ד) DBLR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
כפי שמוצג באיור 13A, ל-GFBFEN היה בתחילה TL של 0.1021 בערכת האימונים. לאחר 67 איטרציות, ה-TL ירד ל-0.0725 והתייצב. בקבוצת הוולידציה, TL ירד מ-0.1237 ל-0.1018. איור 13B–D הצביע על כך שה-TL הסופי של PRF בסט האימון היה 0.0824, ה-TL הסופי של EAB בסט האימות היה 0.1178, ו-TL של DBLR בשתי הקבוצות היה לא יציב וגבוה משמעותית ממודלים אחרים. תוצאות אלו הראו כי GFBFEN הפגין יכולת התאמה חזקה ויציבות אימון גבוהה, תוך העלאת העברת ידע מבוססת KD, שאפשרה למודל ללמוד במהירות תכונות אפקטיביות, להאיץ התכנסות אובדן ולהבטיח הכללה בין מערכי נתונים. כדי לאמת באופן מקיף את ביצועי הליבה של GFBFEN, המחקר בדק את EFCA, HDPE, FCP ו-CSCC עבור ארבעת המודלים. התוצאות מוצגות באיור 14.

איור 14: תוצאות מבחני מדדים מקיפים של משימות הערכה ותיקון הוראה. (א) תוצאות בדיקת GFBFEN. (ב) תוצאות בדיקת PRF. (ג) תוצאות בדיקת EAB. (D) תוצאות בדיקת DBLR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
כפי שמוצג באיור 14A–D, למודל GFBFEN יש ערכי EFCA של 99.35% ו-98.76% במערכות האימון והוולידציה, בהתאמה. ה-EFCA של מודל PRF הוא 88.53% ו-87.04%, בהתאמה. בערכת הוולידציה, EFCA של מודל GFBFEN היה גבוה ב-6.59% מזה של מודל EAB עם 92.17%, ו-11.72% גבוה יותר מזה של מודל DBLR עם 87.04%. בנוסף, מדדי HDPE, FCP ו-CSCC שלה מובילים באופן מקיף: בקבוצת הוולידציה, HDPE של מודל GFBFEN הגיע ל-98.05%, ה-FCP הגיע ל-97.93%, וה-CSCC הגיע ל-0.968, כולם עקפו את מודלי PRF, EAB ו-DBLR. בסך הכול, תוצאות אלו אישרו את הביצועים המקיפים והמעולים של GFBFEN, והראו כי האופטימיזציה המתואמת של המודל ל-GAT-KD, AM-LSTM ו-BFEN שיפרה למעשה את דיוק הכיול, היעילות וההגינות בהערכת הוראה.
המחקר בנה בהדרגה את FairEduNet, BFEN, FBFEN ו-GFBFEN, וה-GFBFEN הסופי כולל רכיבים כמו FairEduNet, BERT-RL, AM-LSTM ו-GAT-KD. כדי לאמת את התרומה העצמאית של רכיבים בודדים, מתבצעים מחקר וניסויי אבלציה בעיצוב, תוך הסרה הדרגתית של כל רכיב והערכת השפעתו על הביצועים הכוללים. מדדים השוואתיים כוללים ECA, FDR, SAR ו-FMD. התוצאות הראו שערך ה-ECA של רכיב FairEduNet לבדו היה 87.32%, FDR היה 12.45%, SAR היה 89.67%, ו-FMD היה 11.89%. ה-ECA של דגם GFBFEN המלא הגיע ל-99.21%, ה-FDR ירד עוד יותר ל-1.93%, ה-SAR נשאר יציב ב-99.45%, וה-FMD אופטימלי ל-7.28%. לאחר הסרת BERT-RL, ECA ירד ל-91.04%, ערך FDR היה 6.23%, ערך SAR היה 92.33%, ו-FMD עלה ל-7.85%. האבלציה של AM-LSTM העלתה את תנודות ה-SAR ב-14.2%. הסרת GAT-KD הובילה לעלייה ב-FMD ל-8.36%, ומנגנון הדיכוי של הפצת הטיית מבנה הגרף בהנחיית זיקוק ידע היה יעיל משמעותית בהפחתת הטיית אסוציאציה סמויה בין אוכלוסיות.
כדי לבדוק את שיטות המחקר, המחקר הציג מדדי תקני הוגנות מוכרים, כלומר מדד תיקון הוגנות (FCB), המכסה שלושה סוגים של מגבלות נוקשות המוכרות בתרחישים חינוכיים: (1) הערך המוחלט של ההפרש הממוצע לאחר תיקון בין קבוצות הוא ≤ 1.2 נקודות (בהתבסס על מערכת האחוזים); (2) שיעור החפיפה של מרווחי הביטחון המתוקנים עבור כל תת-קבוצה רגישה הוא ≥-95%; (3) בכל תרחיש בודד, האזור המשותף של FDR ו-SAR חייב לעמוד במגבלת הגבול של פארטו (כלומר, אי אפשר לשפר SAR מבלי להידרדר FDR, ולהפך). מודל GFBFEN הושווה למודלים בסיסיים מרכזיים, כגון EAB, PRF, DBLR ו-GBDT, בהערכה הניסויית. הניסוי נערך על 421 נתוני הערכה אמיתיים שנאספו מתרחישי הוראה אמיתיים, וכיסו שלושה תרחישים חינוכיים טיפוסיים: הערכה בכיתה, הערכה מעשית ומבחנים מקוונים. התוצאות מוצגות בטבלה 2.
| אלגוריתם | הערך האבסולוטי של הפרש ממוצע הציון | שיעור חפיפת רווחי סמך (%) | שיעור שביעות רצון אזורי אפשרי משותפת (%) | ציון מקיף |
| GFBFEN | 0.87 | 98.3 | 100 | 97.2 |
| EBA | 1.52 | 98.4 | 82.6 | 78.5 |
| PRF | 1.68 | 85.1 | 74.3 | 71.2 |
| DBLR | 1.45 | 87.9 | 79.8 | 75.6 |
| GBDT | 1.33 | 91.2 | 86.4 | 79.9 |
טבלה 2: תוצאות הערכה של מדדי קריטריוני הוגנות ואימות יישום מעשי.
כפי שמוצג בטבלה 2, GFBFEN השיג עמידה מלאה בכל ארבעת מגבלות ה-FCB הקשיחות באופן עצמאי, והציון המקיף שלו עלה משמעותית על שאר מודלי הבסיס בהפרש של +18.7 נקודות, מה שמאשר את עמידות פרדיגמת התיקון השיתופית הרב-שלבית המוצעת. במיוחד, במדד הליבה המשקף את יכולת הפישר בין הוגנות ליעילות, שיעור הכיסוי האזורי המשותף הגיע ל-100%, מה שמעיד שלמודל יש יכולות קבלת החלטות אופטימליות לפרטו בתרחישי חינוך אמיתיים.
הוגנות בהערכת ההוראה מתייחסת לשימוש במגבלות כמותיות ניתנות לאימות כמדד תוך שמירה על הבדלים אישיים וחוקי חינוך. לוגיקת החישוב וקביעת הסף של מדדי שוויון מבוססים על המסגרת התיאורטית של שוויון חינוכי ותקני אימות נתונים אמפיריים. הם נבדקים במשותף על ידי ועדת מומחים המורכבת מחמישה חוקרים כדי להבטיח רמת אחדות גבוהה בין קפדנות תיאורטית ליכולת הסתגלות לפרקטיקה חינוכית. כדי לאמת עוד יותר את ההתאמה של המודל לסטנדרטים שונים של הוגנות, המחקר ביצע אימות נוסף תחת מספר סטנדרטים. באופן ספציפי, נבחרו שלושה תקני הוגנות לאימות. סטנדרט 1 הוא איזון שיעורי הקבלה בין קבוצות המבוסס על שוויון דמוגרפי. תקן 2 הוא העקביות בין קבוצות בין שיעור חיובי אמיתי לשיעור חיובי שגוי בהתבסס על סיכויים משווים. תקן 3 מבוסס על פריטי חיזוי לשליטה בהטיה בין קבוצות בדיוק התחזית. נמצא כי GFBFEN עומדת בעקביות בדרישות המגבלות הנוקשות תחת שלושת הסטנדרטים. סטיית שיעור קבלה קבוצתי סטנדרטי 1 ≤1.2%, הפרש בין קבוצות בין קבוצות בתקן 2 ≤0.85%, דיוק חיזוי תקן 3, סטייה בין-קבוצתית מבוקרת בטווח של ±±0.6%. לעומת זאת, המודלים האחרים הראו פריצת דרך באילוצים של ≥3.7% לפחות תחת קריטריון אחד, מה שאישר את תאימות ההכללה של GFBFEN לפרדיגמות הוגנות רב-משתניות.
זמינות נתונים:
כדי להבטיח את אמינות הנתונים, המחקר השתמש במאגר הנתונים Global Education Monitoring Report (https://www.education-progress.org/) ובמאגר נתוני הביצועים האקדמיים של תלמידי חטיבת ביניים ספרדית (https://archive.ics.uci.edu/dataset/320/student+performance). קבוצות האימון והאימות מחולקות לפי סדר כרונולוגי משני מערכי הנתונים. המחקר משתמש בנתונים מספטמבר 2024 כסט ההכשרה ומאוקטובר 2024 עד יוני 2025 כסט האימות, בהתאם להתקדמות הזמנית של ההערכות החינוכיות.