מאמר מחקר

הסקה מטושטשת רב-פרספקטיבית וניתוח מבוסס XGBoost של התנהגות למידה מקוונת

DOI:

10.3791/69515

17 במרץ 2026

במאמר זה

הודעת תיקון

Important: There has been an erratum issued for this article. View Erratum Notice

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה עושה שימוש במודל חשיבה מטושטשת רב-פרספקטיבית ובאלגוריתם שיפור בשיפור בהגברת גרדיאנט קיצוני (XGBoost) (מותאם על ידי אלגוריתם אופטימיזציה משופר של זאב אפור) כדי לנתח התנהגות למידה מקוונת ולסווג רגשות תגובות של תלמידים, ולספק תמיכה להוראה מותאמת אישית ולהתערבות בזמן.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ההתפתחות הפוריחה של החינוך המקוון הפכה את הכיתות המקוונות לרכיב חשוב בתחום החינוך. ניתוח מעמיק של התנהגות הלמידה של תלמידים בהוראה מקוונת יכול לסייע למורים לייעל אסטרטגיות הוראה ולספק תמיכה לימודית מותאמת אישית לתלמידים. לכן, כדי לבצע ניתוח מעמיק של התנהגות הלמידה של התלמידים, מחקר זה אוסף נתונים מפלטפורמות הוראה מקוונות ומעבד אותם מראש. בהמשך, מחקר זה בונה מודל הסקה רב-פרספקטיבית מטושטש המכסה שלושה ממדים: תוכנית לימודים, אישית וכיתה, כדי לשקול באופן מקיף את ביצועי הלמידה של תלמידים מרמות שונות. מודל זה מעבד מידע לא ודאי בנתוני התנהגות למידה דרך קבוצות מעורפלות וכללים מעורפלים, ובכך משיג הערכה רב-ממדית של ביצועי הלמידה. אלגוריתם XGBoost משופר נועד לסווג את רגשות התגובה של התלמידים. האלגוריתם המשופר הזה מייעל את ההיפרפרמטרים של אלגוריתם XGBoost על ידי שיפור אלגוריתם האופטימיזציה של זאב אפור. האלגוריתם משפר את הדיוק של סיווג רגשות וחוקר לעומק את הנטיות הרגשיות והמשוב העמדה שמאחורי התנהגות הלמידה שלהם. התוצאות הראו שמבחינת תוכנית הלימודים, שיעור השלמת משימות הקורס 3 שבועות לפני המבחן היה למעשה מעל 45%, שזה היה גבוה בהרבה משיעור ההשלמה שלושה שבועות לאחר שחרור המשימה (שניהם פחות מ-18%). תוצאות אלו הראו שתלמידים נטו יותר להשלים משימות לפני המועד האחרון והיו להם דחיינות ברורה. הדיוק המרבי של אלגוריתם הסיווג המשופר היה 98.78%, שהיה גבוה ב-8.57%, 7.55%, 6.38% ו-6.01% מהמודל ההשוואה, וצריכת הזמן הממוצעת הייתה 58 מילישניות. שיעורי הזיכרון על רגשות שליליים, חיוביים וניטרליים היו 98.35%, 97.69% ו-98.02%. מודל המחקר יכול לנתח ביעילות את התנהגות הלמידה המקוונת של התלמידים ולאפשר זיהוי מוקדם של תלמידים בסיכון, מה שמקל על הוראה מותאמת אישית והתערבות מדויקת בחינוך מקוון.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השילוב העמוק של האינטרנט וטכנולוגיית החינוך גרם לחינוך המקוון לקפוץ מתוספת שולית לצורה מרכזית. עד סוף 2023, מספר הלומדים המקוונים הרשומים ברחבי העולם חצה את 1.2 מיליארד, וסין דורגה בעקביות ראשונה בעולם הן במספר הקורסים המקוונים הפתוחים ההמוניים (MOOCs) והן בלומדים 1,2. עם זאת, בעוד שהוראה מקוונת מביאה נוחות, היא גם חושפת אתגרים כמו תהליך הלמידה הלא ברור, הפרדה בין מורים לתלמידים בזמן ובמרחב, ומשוב רגולטורי מתעכב. קיים מתאם חיובי בין נתוני התנהגות למידה לבין הישגים אקדמיים. כיוון דינמי המבוסס על נתונים יכול להגדיל את שיעור סיום הקורסים ביותר מ-20% ולהפחית משמעותית את הסיכון לנשירה 3,4,5. לכן, ביצוע ניתוח התנהגות למידה (LBA) הוא קריטי. בנוגע לנושא זה, השיטות הנוכחיות כוללות סטטיסטיקה תיאורית, כריית כללי אסוציאציה וסיווג מסורתי של למידת מכונה6. חוקרים רבים חקרו נושא זה.

כדי לבצע LBA, לי יי ואחרים השתמשו בנתוני התנהגות למידה מפלטפורמות הוראה מקוונות באוניברסיטת הרווארד ובמכון הטכנולוגי של מסצ'וסטס לבניית רשת עצבית פולס (PNN) לחיזוי תוצאות למידה. הם ניתחו את הקשר בין התנהגות למידה לתוצאות. מודל חיזוי התנהגות הלמידה המקוונת המבוסס על PNN השיג דיוק של 99.80%7. זנג בי עיצב מודל יעיל להמחשת התנהגות למידת אנגלית מקוונת באמצעות ניתוח רצפים עם השהיה ושיטות כריית נתונים משולבות ואלגוריתם עץ הרוחב המינימלי. בנוסף, המחקר הקים פלטפורמת למידה חכמה מקוונת לשירותי בניית נתיב למידה קבוצתית (GLP). השיטה המתוכננת יכלה לבנות בהצלחה GLP8. ג'או מ ואחרים עיצבו זיכרון ארוך-טווח קצר (LSTM) דו-שכבתי כדי לחשוף בעיות פוטנציאליות בלמידה המקוונת של התלמידים. הם השתמשו במסגרת TensorFlow ובשפת פייתון, והשתמשו בנתונים מפלטפורמות מקוונות כמו Kaggle, edX והאוניברסיטה הפתוחה של בריטניה. רשת זו הציגה ביצועים טובים, עם דיוק מרבי של 83.4%9. לי פ' ואחרים אספו וניתחו נתוני התנהגות למידה מ-109 סטודנטים לתואר ראשון כדי להבין את מאפייני ההתנהגות הקבוצתית של לומדים מקוונים שונים. מחקר זה הציג ניתוח רכיבים עיקריים להפחתת ממדיות הנתונים והשתמש באשכול היררכי אגלומרטיבי כדי לסווג את הלומדים לקטגוריות שונות. מתוכן, 15 קבוצות היו מקובצות – והשיטה המוצעת הייתה בעלת דיוק אשכול טוב– 10.

לסיכום, המחקר הנוכחי על LBA מגוון מאוד ומשתמש במגוון רחב של שיטות. עם זאת, למחקרים ולשיטות אלו יש גם חסרונות מסוימים. לדוגמה, אין מספיק חקירה של מידע רגשי בטקסטים של סקירות סטודנטים, וסטטיסטיקות תיאוריות אינן יכולות לחשוף את מנגנוני האינטראקציה המורכבים שמאחורי התנהגויות. סיווג למידת מכונה מבוסס לעיתים קרובות על תכונות חד-ממדיות, שמפרידות בין מידע רב-ממדי של קורסים, יחידים וכיתות. כדי לבצע LBA טוב יותר, מחקר זה מעצב מודל חשיבה מטושטשת רב-פרספקטיבית (MPFR) ובונה מודל סיווג רגשות המבוסס על אלגוריתמים של Grey Wolf Optimization (IGWO) ו-eXtreme Gradient Boosting (XGBoost).

במחקרי LBA קיימים, למרות ש-LSTM מסוגל ללכוד את המתאם הזמני של התנהגויות למידה, יכולתו להתמודד עם נתוני התנהגות למידה מעורפלים ובלתי ודאיים חלשה. לרשת עצבית קונבולוציונית (CNN) יש יתרונות מסוימים בחילוץ תכונות טקסט, אך היא טובה יותר בלכידת תכונות מקומיות, וקשה לשלב מידע גלובלי רב-ממדי של קורסים, יחידים וכיתות. בהשוואה לשיטות למידה עמוקה כמו CNN ו-LSTM, מודל MPFR יכול ללכוד מידע לא ודאי בהתנהגות למידה באמצעות חשיבה מטושטשת. לדוגמה, "השתתפות מתונה" של הסטודנטים ו"שליטה בסיסית" במצבים מטושטשים מפצים על המגבלות של חילוץ תכונות מקומיות של CNN. IGWO-XGBoost מאזן בין דיוק ליעילות בסיווג הרגשות, ומפצה על סיווג רגשות LSTM הארוך והעיבוד המטושטש של CNN הסמנטי החלש. מחקר זה שואף לספק תמיכה מידעית תלת-ממדית להתערבות הוראה מקוונת על ידי שילוב תוצאות ניתוח התנהגות ורגש. החידוש במחקר טמון בבניית מודל MPFR המכסה שלושה ממדים: תוכנית לימודים, פרט אישי וכיתה. שיקול מקיף זה ממספר נקודות מבט יכול לשקף באופן מקיף וסטריאוסקופי את ביצועי הלמידה של התלמידים, ולהימנע ממידע חשוב שעלול להתעלם ממנה אחת. שיטה זו מציעה יכולת הרחבה טובה לפלטפורמות וניתן להתאים אותה לפלטפורמות למידה מקוונות מרכזיות כמו Chaoxing ו-MOOC, כלומר באמצעות ממשק עיבוד נתונים מאוחד ללא צורך בפונקציות פיתוח פלטפורמה נוספות. במקביל, שיטה זו הוגדרה ככלי ניתוח פשוט, ומחנכים צריכים רק להעלות את הנתונים הבסיסיים המיוצאים מהפלטפורמה כדי לייצר דוחות LBA אוטומטית ללא פעולות טכניות מורכבות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עיצוב שיטת LBA תוך התחשבות ב-MPFR ובפרספקטיבות רגשיות

נבנתה מערכת הערכה רב-פרספקטיבית לניתוח התנהגות הלמידה המקוונת של התלמידים (SOLB), ומודל MPFR עוצב. כדי לנתח את התחושות הסובייקטיביות של התלמידים בלמידה, מחקר זה מאמץ את אלגוריתם XGBoost ומעצב את אלגוריתם IGWO לאופטימיזציה של היפרפרמטרים לשיפור דיוק הסיווג.

בניית מודל MPFR עבור LBA

כדי לנתח את SOLB, מחקר זה מתחיל בעיקר משתי נקודות מבט כדי ליצור תוכנית ניתוח מלאה. ראשית, מבחינת ביצועי הלמידה, מחקר זה בוחן שלוש נקודות מבט: תכנית לימודים, אישי וכיתה, כדי ליצור את מודל MPFR. שנית, מבחינת ניתוח סנטימנטים של תגובות סטודנטים, מחקר זה מעצב אלגוריתם XGBoost משופר. באמצעות ניתוח ביצועי הלמידה ורגשות המשוב של התלמידים, מחקר זה יכול לנתח טוב יותר את SOLB. מבחינת פרטים טכניים ספציפיים של ניתוח ביצועי למידה, מחקר זה משתמש תחילה בנתונים מפלטפורמת למידה מקוונת ומעבד אותם מראש. שנית, מחקר זה בוחר מדדי הערכת ביצועי למידה מרכזיים מזוויות שונות כדי לבנות מערכת הערכה מקיפה. בהמשך, נבנה מודל MPFR תואם להערכת התנהגות למידה.

מחקר זה בוחר נתונים מפלטפורמת Superstar (מקור: https://www.chaoxing.com/). הוא מכיל מידע מממדים שונים, כגון פעילויות בכיתה והערכת ציונים, שיכולים לספק בסיס טוב ל-LBA הבאים. לאחר קבלת הנתונים, יש לעבד אותם מראש, בעיקר כולל מחיקת שדה לא רלוונטית, סינון נתונים ובדיקות שלמות נתונים. לדוגמה, בנתוני מורים, יש להסיר מידע לא רלוונטי כמו המספר והמחלקה אליה שייך הקורס. בהמשך, מחקר זה בונה את הנדסת התכונות של LBA בהתבסס על נתוני התנהגות הלמידה של פלטפורמת Superstar. אינדקס LBA לסטודנט מספק בסיס הנדסי תכונות למודל MPFR הבא, ותוכן האינדקס מוצג באיור 1.

figure-protocol-1
איור 1: מדדים ל-LBA לסטודנטים. התרשים מבהיר את שלושת הממדים המרכזיים (תוכנית לימודים, יחיד, כיתה) של LBA לתלמידים ואת מדדי ההערכה הספציפיים תחת כל ממד, ומספק תמיכה בתכונות למודל MPFR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

באיור 1, מדדי LBA של הסטודנטים מתמקדים בעיקר בשלוש נקודות מבט: קורס, יחיד וכיתה, עם דגש ברור על כל ממד, ומספק תמיכה מדויקת בתכונות לבניית מודלים של MPFR. ביניהם, מבחינת מדדי ממדי הקורס, מחקר זה בוחר את שיעור השלמת משימות הקורס, משך הלמידה ותדירות האינטראקציה בין הקורסים. הדאגה המרכזית של ממד זה היא איכות ההשלמה הכוללת של משימות הקורס וקצב הזמן של השתתפות בלמידה. לדוגמה, שיעור ההשלמה של משימות קורס משמש למעקב אחר ההבדל בשיעורי ההשלמה לפני ואחרי המועד האחרון; משך הלימוד משמש להבחנה בין מרווחי עצימות למידה שונים; תדירות האינטראקציה עם הקורס משמשת לסינון התנהגויות אינטראקטיביות אפקטיביות. ברמה האישית, התקדמות בלמידה אישית, איכות השלמת שיעורי בית וציוני מבחנים נבחרים כמדדי הערכה. ממד זה מתמקד במידת ההתאמה בין התקדמות בלמידה אישית לבין תוצאות שליטה בידע. דוגמאות לכך כוללות השוואת התקדמות בלמידה אישית עם תוכניות קורסים, הערכת הדיוק והיעילות של מטלות שהושלמו, וסיווג רמות שליטה בידע על בסיס ציוני המבחנים. בנוסף, מבחינת ממד הכיתה, המדדים שנבחרו כוללים ממוצע ציון בכיתה, פעילות אינטראקציה כיתתית ואווירת למידה בכיתה. ממד זה מתמקד בעיקר בהשפעת סביבת הלמידה הכוללת על התנהגות הפרט. לדוגמה, הציון הממוצע משמש לאיתור רמת הביצועים היחסית של הפרט בקבוצה; פעילות האינטראקציה הקבוצתית משמשת לשקף את מידת ההשתתפות הקולקטיבית; אווירת הלמידה משמשת לניתוח ההשפעה המניעה של סביבת הקבוצה על התנהגות הלמידה. כדי לנתח את התנהגות הלמידה של התלמידים, נבנה מודל הסקה מטושטש, ותכונות התנהגות הלמידה מתקבלות מזוויות שונות. הסקה מטושטשת היא שיטת הסקה המשתמשת בלוגיקה מטושטשת, המעבדת מידע לא מדויק או לא ודאי דרך קבוצות מעורפלות וכללים מטושטשים, ויש לה יתרונות של גמישות חזקה והבנה קלה11,12. הסקה מטושטשת, כמנגנון המחשוב המרכזי של מודלי MPFR, מיושמת לאחר הנדסת תכונות. התהליך העיקרי של הסקה מטושטשת מוצג באיור 2.

figure-protocol-2
איור 2: תרשים הזרימה הראשי של חשיבה מטושטשת. התרשים מציג את תהליך הליבה של חשיבה מטושטשת, כולל ארבעה שלבים מרכזיים: ערפול, בניית בסיס כללים מטושטש, הסקה מטושטשת, ומבהיר את הלוגיקה של מודל MPFR בטיפול בנתוני התנהגות למידה לא ודאיים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

היגיון מטושטש כולל בעיקר טשטוש, הקמת ספריית חוקים מטושטשים (FRL), הסקה מטושטשת והסרת טשטוש. ביניהם, הערפול דורש המרת נתוני קלט מדויקים לקבוצות מטושטשות וכוללת הגדרת פונקציות חברות. ה-FRL מכיל סדרה של כללים מטושטשים ומשמש בעיקר לתיאור הקשר בין קלט לפלט. בבניית בסיס הכללים המטושטש, המחקר מזמין שלושה פרופסורים חברים לטכנולוגיה חינוכית עם ניסיון הוראה של ≥ 8 שנים לפתח יחד 28 כללים, וקובע את הכללים הסופיים בשלושה סבבי איטרציה באמצעות "שיטת דלפי". לדוגמה, כלל 1: אם שיעור ההשלמה של משימת הקורס נמוך מ-30% וההתקדמות הלמידה של הפרט מאחרת בשבועיים → אז מצב בסיכון גבוה. הסקה מטושטשת היא תהליך של הסקת נתוני קלט מעורפלים הנבנים על FRL וקבלת תוצאות פלט מטושטשות. לבסוף, דה-בלור יהפוך את תוצאת הפלט המטושטשת לערך פלט מדויק. המחקר בוחר פונקציית חברות משולשת, שהיא פונקציה נפוצה במערכות לוגיקה מטושטשת, ויש לה יתרונות כמו גמישות חזקה ויעילות חישובית גבוהה. הביטוי של פונקציה μA(x) מוצג במשוואה (1).

figure-protocol-3 (1)

במשוואה (1), x הוא הערך הספציפי של הקלט. a, b ו-c הם שלושת הקודקודים של משולש. בהסרת טשטוש, מאמר זה משתמש בשיטת הצנטרואיד להמרת תוצאות הפלט. שיטת הסנטרואיד היא טכניקת טשטוש נפוצה בלוגיקה מטושטשת, שיש לה יתרונות כמו אינטואיטיביות חזקה, חישוב פשוט ויציבות13. הביטוי של שיטת הצנטרואיד מוצג במשוואה (2)14.

figure-protocol-4 (2)

במשוואה (2), f* הוא ערך הפלט לאחר דה-בלורינג, שהוא מרכז הקבוצה המטושטשת. μ(x) היא פונקציית החברות. figure-protocol-5 הוא הסכום המשוקלל של כל הנקודות בקבוצה מטושטשת. figure-protocol-6 הוא האינטגרל של פונקציית החברות על כל הערכים האפשריים של x. הרציונליות בשימוש בכללים ופונקציות חברות מוגדרים ידנית במודל MPFR משתקפת בשלושה היבטים. ראשית, הבטחת הסמכה מקצועית: מחוקקי הכללים הם שלושה פרופסורים חברים לטכנולוגיה חינוכית, והוסמכו על ידי "אנליסט התנהגות למידה מקוונת" של "מרכז המחקר לחינוך מקוון של משרד החינוך" כדי להבטיח שהכללים עומדים בחוקי החינוך וההוראה. שנית, יתרון יעילות: זמן ההסקה של כללים ידניים נמוך בהרבה מזה של שיטות מונחות נתונים, מה שהופך אותם למתאימים יותר לצרכי "הסקה בזמן אמת" של פלטפורמות חינוך מקוון וללא צורך בכמות גדולה של נתונים עם הערות, מה שמפחית עלויות איסוף נתונים15. שלישית, התאמה לדרישה המרכזית של "פרשנות" בתרחישי חינוך מקוון, כללים מוגדרים ידנית ופונקציות חברות משולשות (משוואה 1) יכולים להתאים ישירות לקוגניציה אינטואיטיבית בתרחישי הוראה. מחנכים אינם זקוקים לרקע טכני מורכב כדי להבין את הסיבה לכך שתלמיד נחשב בסיכון. שיטות מבוססות נתונים כמו מערכות נוירו-פאזיות יכולות לאופטימיזציה אוטומטית את הכללים. עם זאת, רוב הכללים שנוצרים הם ביטויים מתמטיים מורכבים, שקשה למחנכים לפרש, מה שמפחית את קבלת המודל בהתערבות בהוראה בפועל.

עיצוב מודל משופר לניתוח תחושת תגובות תלמידים עבור XGBoost

מודל MPFR שתוכנן יכול לנתח SOLB משלושה היבטים: מסלול, יחיד וכיתה. עם זאת, לניתוח נתונים התנהגותיים חיצוניים יש מגבלות בביטוי רגשות סובייקטיביים של התלמידים. לכן, כדי לנתח לעומק את התחושות הסובייקטיביות של התלמידים לגבי הלמידה, נאספים ומעובדים מראש נתונים נוספים מפלטפורמות למידה ב-MOOC המכילים מידע על תגובות תלמידים. בהמשך, XGBoost משמש לבניית מודל סיווג הרגשות. ה-IGWO נועד לייעל את הפרמטרים שלו לשיפור דיוק מודל הסיווג. השיפור ב-XGBoost משתקף באופטימיזציית הפרמטרים שלו דרך אלגוריתם IGWO. עיבוד נתונים מראש הוא שלב ראשון קריטי לפני בניית וניתוח המודלים. תהליך הקדם-עיבוד של הנתונים מוצג באיור 3.

figure-protocol-7
איור 3: תהליך העיבוד המוקדם של הנתונים. תהליך עיבוד הנתונים המוקדם בן תשעה שלבים כולל ניקוי טקסט, חלוקת מילים, הסרת מילות עצירה, חילוץ גזע וזיהוי מילים לפי רגשות, המספק נתונים איכותיים לניתוח התנהגות וסיווג רגשות לאחר מכן. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

שלבי קדם-עיבוד הנתונים הם כדלקמן: השלב הראשון הוא לבצע ניקוי טקסט כדי להסיר שדות לא רלוונטיים בנתוני פלטפורמת Chaoxing ולסנן דגימות לא תקפות. במקביל, שדות לא-טקסטואליים וביקורות קצרות מוסרים מנתוני הביקורת בפלטפורמת ה-MOOC. השלב השני הוא לבצע עיבוד סגמנטציה. ביניהם, תגובות סיניות משתמשות ב"מצב המדויק" של ג'ייבה לעיבוד סגמנטציה של מילים, בעוד שההערות באנגלית משתמשות בפונקציית סגמנטציה של ספריית NLTK לעיבוד. השלב השלישי הוא להסיר מילות עצירה נפוצות כמו ''de'', ''yes'', ''in'' וכו'. ביניהן, מילות העצירה הסיניות משתמשות ברשימת מילות העצירה של מכון הרבין לטכנולוגיה (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt). מילות עצירה נמחקות על ידי התאמת מילים. מילות עצירה באנגלית משתמשות ברשימת מילות העצירה האוניברסלית המובנית בספריית NLTK, שגם היא נמחקת באמצעות התאמת מילה-אחר-מילה. השלב הרביעי הוא להשתמש ב-stemmer של ספריית NLTK כדי לחלץ שורשים מהטקסט ולשחזר פעלים בנתוני האנגלית לצורת השורש שלהם. השלב החמישי הוא לזהות את המילים הרגשיות החיוביות והשליליות בתגובות בהתבסס על מילון הרגשות של CNKI, כדי לספק בסיס קדם-הערות לסיווג רגשי עתידי. השלב השישי הוא לבצע חילוץ תכונות. ביניהם, הנתונים המובנים בפלטפורמת צ'אושינג סטנדרטיים, בעוד שמדדי הסיווג מקודדים בנפרד. במקביל, נתוני ההערות הללו של פלטפורמת MOOC משתמשים במודל שפה מאומן מראש (Bidirectional Encoder Representation from Transformers, BERT) כדי לחלץ תכונות טקסט. היתרון המרכזי של מודל BERT בחילוץ תכונות טקסט הוא שהוא יכול ליצור וקטורי מילים מודעי הקשר באופן דינמי באמצעות ארכיטקטורת טרנספורמר דו-כיוונית עמוקה, ובכך להתמודד עם העמימות שמודלים מסורתיים של הטמעת מילים סטטית אינם מסוגלים להתמודד איתה. השלב השביעי הוא לטפל בבעיה של קטגוריות רגשות לא מאוזנות בנתוני התגובות. טכניקת דגימת המיעוט הסינתטי (SMOTE) משמשת לעיבודו. חמישה דגימות שכנים קרובות נבחרות לאינטרפולציה ליצירת דגימות מיעוט סינתטי, עם זרע אקראי קבוע של 42 כדי להבטיח שחזוריות של הניסוי. השלב השמיני הוא להוסיף הערות ולחלק את הנתונים. השלב התשיעי הוא למלא ערכים חסרים בנתוני הסופרסטאר ולהסיר חריגים. בעת ביצוע עיבוד איזון נתונים, SMOTE יוצר דגימות מורכבות חדשות על ידי אינטרפולציה בין דגימות מחלקות מיעוט, ובכך מגדיל את מספר דגמי מחלקות המיעוט והופך את התפלגות המחלקות של מערך הנתונים למאוזןיותר ב-16,17. הביטוי של SMOTE מוצג במשוואה (3).

Bmn = dm + rand(0,1) x (dmn - dm) (3)

במשוואה (3), Bmn הוא מדגם מחלקת מיעוט שנבנה באופן מלאכותי, dm הוא מדגם מחלקת המיעוט ה-i, ו-dmn הוא המדגם ה-n מבין השכנים הקרובים ביותר k של dm. רנד(0,1) הוא מספר אקראי בין 0 ל-1. XGBoost משפר את ביצועי החיזוי על ידי הוספת עצי חיזוי באופן איטרטיבי. יש לו יתרונות כמו דיוק גבוה, גמישות גבוהה וקלות שימוש18,19. השלבים של בנייה איטרטיבית של מודל עץ באמצעות XGBoost כוללים בעיקר: אתחול המודל, בנייה איטרטיבית של העץ, פונקציית המטרה ומונח הרגולריזציה. התפוקה figure-protocol-8 החזויה באיטרציה של t-th מוצגת במשוואה (4).

figure-protocol-9   (4)

במשוואה (4), figure-protocol-10 הוא ערך החיזוי של המודל לאחר ה-t - האיטרציה הראשונה, ft(h) היא פונקציית החיזוי של מודל העץ שנוספה באיטרציה ה-t, ו-h הוא וקטור תכונת הקלט. פונקציית המטרה למזעור XGBoost מוצגת במשוואה (5).

figure-protocol-11 (5)

במשוואה (5), i הוא מספר המדגם. I ו-J הם סך כל הדגימות והעצים, ו-j הוא מספר העצים. figure-protocol-12 היא פונקציית האובדן, ו-Gi היא התווית האמיתית של הדגימה ה-i. figure-protocol-13 הוא הערך החזוי של המודל עבור מדגם ה-i לאחר האיטרציה של T-th. Ω(ft) הוא מונח הרגולריזציה, ו-(ft) היא פונקציית החיזוי של עץ ה-j -. הביטוי הכללי Ω(f) לרגולריזציה מוצג במשוואה (6).

figure-protocol-14 (6)

במשוואה (6), γ משמעותו מקדם העונש עבור כמות צמתי העלה, λ הוא מקדם הרגולריזציה L2 למשקל צמתי העלה, ו-w הוא משקל צמתי העלה. עם זאת, הבחירה בהיפרפרמטרים של XGBoost משפיעה ישירות ומשמעותית על הביצועים. היפרפרמטרים נפוצים ב-XGBoost כוללים קצב למידה, עומק מרבי של העץ ופרמטרי רגולריזציה. עקב מרחב ההיפרפרמטרים הפוטנציאלי הגדול, התאמה ידנית של פרמטרים אלו אינה רק גוזלת זמן אלא גם קשה למצוא את שילוב הפרמטרים האופטימלי. לכן, מחקר זה מעצב את IGWO כך שימקסם את ההיפרפרמטרים של XGBoost. GWO מחפשת פתרונות מיטביים על ידי סימולציה של ההיררכיה החברתית ואסטרטגיות הציד של זאבים אפורים, עם יתרונות כמו פחות פרמטרים וגמישות חזקה20,21. ב-GWO, המיקום ההתחלתי של האוכלוסייה נוצר כפי שמוצג במשוואה (7).

figure-protocol-15(7)

במשוואה (7), Puv הוא מיקום הפרט ה-u בממד ה-v. figure-protocol-16 והם figure-protocol-17 הגבול העליון והתחתון של מרחב החיפוש V. רנד() הוא מספר אקראי בין [0,1]. עם זאת, אלגוריתם GWO עשוי להיתקל בבעיות כמו מהירות התכנסות איטית והיתקעות באופטימיות מקומיות בשלבים האמצעיים והמאוחרים יותר. משמעות הדבר היא שבשלב זה, GWO עשויה שלא להיות מסוגלת לחקור ביעילות את כל מרחב הפתרון, מה שמקשה על מציאת הפתרון האופטימלי הגלובלי. כדי להתמודד עם בעיה זו, מחקר זה משפר את GWO משני היבטים: הצגת מפת האוהל הכאוטית (TCM) ומקדם ההתכנסות הלא-ליניארי (NCF). TCM הוא מיפוי כאוטי פשוט שמבטיח שאזורי פתרון אופטימליים פוטנציאליים לא ייפספסו במהלך תהליך החיפוש ומונע חיפושים חוזרים באותו אזור22. לכן, באמצעות ה-TCM ניתן ליצור אוכלוסייה התחלתית אחידה ואקראית יותר, ולהגביר את יכולת האלגוריתם להתגבר על אופטימיות מקומיות. חישוב ה-TCM מוצג במשוואה (8).

figure-protocol-18 (8)

במשוואה (8), y הוא פרמטר הבקרה.  Rt ו-Rt+1 הם משתני מצב המערכת באיטרציות t-th ו-t+1. הנוסחה של NCF z מוצגת במשוואה (9).

figure-protocol-19(9)

במשוואה (9), zמקסימום הוא מקדם ההתכנסות המקסימלי ו-tמקסימום הוא מספר האיטרציות המקסימלי. שיטה לא ליניארית זו מאפשרת ל-GWO לשמור על גודל צעד גדול לחיפוש גלובלי בשלבים המוקדמים. בשלב האמצעי של החיפוש, מהירות ההתכנסות מואצת, בעוד שבשלב מאוחר יותר החיפוש המקומי מתבצע בשלבים קטנים יותר, מה שמאזן ביעילות את יכולות החיפוש הגלובלי והמקומי ומשפר את ביצועי האופטימיזציה. אלגוריתם IGWO משמש במיוחד לשלב אופטימיזציית ההיפרמטרים של מסווג סנטימנט XGBoost, והתהליך המרכזי שלו מוצג באיור 4.

figure-protocol-20
איור 4: התהליך המרכזי של IGWO. האיור מתאר את תהליך הביצוע של IGWO, כולל אתחול אוכלוסייה המבוסס על מיפוי כאוטי של אוהל, עדכון מיקום של גורמי התכנסות לא ליניאריים, וסינון אופטימלי של כל אחד, ומבהיר את ההיגיון לאופטימיזציה של היפרפרמטרים של XGBoost. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

באיור 4, תהליך IGWO כולל: אתחול האלגוריתם; שימוש ב-TCM לאתחול האוכלוסייה; חישוב ערך הכשירות ההתחלתי של כל פרט; שימוש ב-NCF לעדכון עמדות הזאב האפור; בחירת הפתרון עם הכושר הטוב ביותר כאדם האופטימלי החדש; ולהוציא את האדם האופטימלי. השילוב האופטימלי של היפרפרמטרים של XGBoost ניתן להוציא דרך IGWO. התהליך הכולל של סיווג סנטימנטים משלב עיבוד נתונים מוקדם, אופטימיזציה של IGWO, ומודל XGBoost הסופי. תהליך מודל הסיווג המבוסס על IGWO-XGBoost מוצג באיור 5.

figure-protocol-21
איור 5: תהליך מודל הסיווג המבוסס על IGWO-XGBoost. האיור מציג את התהליך המלא של מודל סיווג הסנטימנטים של IGWO-XGBoost, מקלט נתונים ועיבוד מוקדם ועד חלוקת מערכי נתונים, אופטימיזציה של היפרפרמטרים של IGWO, בניית מודל XGBoost ותוציא תוצאות סיווג, ומציג בבירור את שרשרת הפעולה של המודל. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

המודל המבוסס על IGWO-XGBoost כולל תהליכים כמו נתוני קלט, עיבוד מוקדם של נתונים, חלוקת מערכי נתונים, אופטימיזציה של היפרפרמטרים באלגוריתם IGWO, שילוב אופטימלי של היפרפרמטרים, בניית XGBoost המבוססת על שילוב היפרפרמטרים מיטבי, ופלט תוצאות סיווג. באמצעות מודל סיווג זה, ניתן לסווג רגשות בתגובות התלמידים, ובכך לקבל הבנה אינטואיטיבית יותר של התחושות הסובייקטיביות של התלמידים לגבי הלמידה. גרסאות התוכנה הספציפיות, זרעים אקראיים, מפרטי חומרה, מפרטים סביבתיים ומקורות מערך הנתונים ששימשו במחקר מוצגים בטבלה 1.

סוג הסטמודל ותוכן ספציפיים
תוכנה בסיסיתפייתון 3.9.7
ספריית הליבהXGBoost 1.7.5, Scikit-learn 1.2.2, Jieba 0.42.1, NLTK 3.8.1, Pandas 1.5.3, NumPy 1.24.3, Matplotlib 3.7.1, Imbalanced-learn 0.10.1
זרע אקראיהגדר את הזרע האקראי הגלובלי ל-42
מפרטי חומרה/סביבה1. מערכת הפעלה: Windows 10 Professional Edition (64 ביט, מספר גרסה 22H2)
2. מעבד: Intel Core i5-12600KF (בתדר ראשי של 3.7GHz ותדר האצה דינמי של 4.9GHz)
3. זיכרון: 64GB DDR4 (תדר 3200MHz, תומך בזיכרון עד 128GB)
4. אחסון: כונן SSD בנפח 1TB (Samsung 980 Pro, מהירות קריאה 7450MB/s)
5. כרטיס גרפי: NVIDIA GeForce RTX 3060 (זיכרון וידאו 12GB)
מקורות מערך נתונים ופרטי גישה1. מערך הנתונים של פלטפורמת סופרסטאר:
-אתר משאבים אחיד (URL): https://www.chaoxing.com/
-שיטת רכישה: יישום דרך פלטפורמת הנתונים הגדולים הפתוחה של Chaoxing Education (מסלול יישום: אתר רשמי → מרכז מפתחים → ממשק נתונים → למידה התנהגותי)
2. מאגר תגובות לפלטפורמת MOOC:
-כתובת מקור: https://www.icourse163.org/.cn
-שיטת רכישה: הגשת מועמדות דרך ערוץ "תמיכה במחקר נתונים" של פלטפורמת MOOC
סקריפטים או מודלים מותאמים אישית1. סקריפט קדם-עיבוד נתונים
2. סקריפט מודל MPFR
3. סקריפט מודל IGWO-XGBoost
 

טבלה 1: גרסאות תוכנה ספציפיות, זרעים אקראיים, מפרטי חומרה, מפרטים סביבתיים ומקורות מאגרי נתונים ששימשו במחקר. ספק רשימה מפורטת של סביבת התוכנה והחומרה הנדרשת, הגדרות זרע אקראיות, מקורות מאגרי נתונים וטווח חיפוש היפרמטרים של XGBoost למחקר כדי להבטיח שחזוריות וסטנדרטיזציה של הניסוי.

טבלה 1 מראה שהמחקר מאמץ את XGBoost 1.7.5 כמסגרת הליבה של מודל סיווג הסנטימנט ומציג את Scikit learn 1.2.2 לעיבוד נתונים מוקדם, חילוץ תכונות והערכת מודלים. בנוסף, המחקר מגדיר באופן אחיד את הזרע האקראי ל-42 כדי להבטיח שחזוריות של חלוקת נתונים, דגימת יתר של SMOTE, אופטימיזציה של היפרפרמטרים של IGWO ותוצאות אימון מודלים של IGWO-XGBoost. בנוסף, אלגוריתם IGWO קובע את מרחב החיפוש להיפרפרמטרים של XGBoost. טווח החיפוש לקצב הלמידה הוא [0.001, 0.3] בסולם הלוגריתמי, והעומק המרבי של העץ נבדק בקבוצת המספרים השלמים {3, 4,..., 15}. טווח האופטימיזציה של מונח רגולריזציה L2 הוא [0.1, 5.0], ויחס הדגימה של כל תת-קבוצה של תכונות עץ מותאם בטווח של [0.6, 1.0]. טווח הכוונון למשקל המינימלי של צמתים עלים הוא [1, 10].

מערך הנתונים וקוד העיבוד והניתוח הנלווה נוצרו ונותחו על ידי הצוות עצמו. הסקריפטים המרכזיים לעיבוד נתונים מוצג בטבלה 2.

ייבא פנדות כ-PD, ג'יבה, RE, נומפי כ-NP
מ-nltk.tokenize ייבוא word_tokenize; מ-nltk.stem import PorterStemmer
Def Clean (טקסט, L):
החזר re.sub(r"[^\u4e00-\u9fa5]" if l=="zh" else r"[^a-zA-Z]", " ", text).strip()
תהליך def (טקסט, l):
t = jieba.lcut(טקסט) אם l=="zh" אחרת word_tokenize(טקסט)
החזר " ".join([PorterStemmer().stem(w) אם l=="en" else w עבור w ב-t אם w לא ב-open("hit_stopwords.txt").read().split()])
דף מיין (C,M,L):
cx=pd.read_csv(c).query("משך למידת הקורס>=1 & results exam.notna()"); mc=pd.read_csv(m).query("comment text.str.len()>=5")
mc["t"]=mc["comment text"].apply(clean,args=("zh",)).apply(process,args=("zh",))
np.savez("out.npz",**{k:v for k,v in locals().items()})

טבלה 2: סקריפט ליבה לעיבוד נתונים מוקדם. הצג את המידע המרכזי של הסקריפט לעיבוד נתונים מוקדם, הבהיר את שלבי העיבוד המוקדמים המתאימים לסקריפט, וספק הפניות טכניות לשכפול שיטות מחקר.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

תוצאות LBA בהתמקדות בסיווג רב-פרספקטיבי וסנטימנט

כדי לאמת ביצועים, הסביבה הניסיונית מוגדרת ומערך הנתונים הניסיוני מתואר. בנוסף, מחקר זה בוחר את האלגוריתם ההשוואתי IGWO-XGBoost ומנתח ומאמת אותו באמצעות מדדים כמו דיוק, צריכת זמן וקצב זיכרון. בניתוח התוצאות, המחקר מחלק אותו לשני חלקים ברורים: תוצאות LBA באמצעות MPFR ואימות ביצועים של סיווג סנטימנטים באמצעות IGWO-XGBoost.

ניתוח התנהגות למידה באמצעות MPFR

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

לניתוח SOLB, מחקר זה עיצב מודלים של MPFR ו-IGWO-XGBoost והשתמש בנתונים מפלטפורמות הוראה מקוונות. בניסוי הייתה עקביות גבוהה בין דירוג מודל ההסקה לבין הציון בפועל, מה שמעיד על יעילות מודל ההסקה. כ-25% מהסטודנטים קיבלו זמן לימוד של 1-10 שעות בקורס. שיעור התלמידים עם שעות לימוד בין 11-20, 21-30, 31-40 שעות ומעל 41 שעות היה 30%, 20%, 15% ו-10%. דבר זה הצביע על כך שרוב התלמידים שמרו על אינטנסיביות למידה בינונית, בעוד אלו שעסקו בלמידה קצרה או ארוכת טווח מאוד היו במיעוט. היו הבדלים בתוצאות אופטי...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין אינטרסים פיננסיים או לא-פיננסיים רלוונטיים לחשוף.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
מודל שפה מאומן מראש על ידי BERTמחקר בגוגלhttps://github.com/google-research/bert
מילון רגשות CNKICNKIhttps://www.cnki.net/
פלטפורמת Chaoxing לומדת נתוני התנהגותחברת פיתוח טכנולוגיית המידע צ'אושינג בע"מhttps://www.chaoxing.com/
זיכרון מחשבספק חומרה אוניברסלי (ללא דגם ספציפי)
רשימת המונחים שהופסקו על ידי מכון הרבין לטכנולוגיהמכון הרבין לטכנולוגיהhttps://github.com/goto456/stopwords/blob/master/hit_s 
Intel Core i5-12600KF חברת אינטלBX8071512600KF
כלי סגמנטציה של מילים Jieba (מצב דיוק)קהילת קוד פתוח צד שלישיhttps://github.com/fxsjy/jieba.
נתוני ביקורת סטודנטים בפלטפורמת MOOCרשת קורס האהבהhttps://www.icourse163.org/
ספריית NLTKצוות הפיתוח של NLTKhttps://www.nltk.org/
שפת תכנות פייתוןקרן התוכנה של פייתוןhttps://www.python.org/
סקיקיט-לרן 1.2.2צוות הלמידה של סיקיטhttps://scikit-learn.org/stable/
פלטפורמת Smart Tree לומדת נתוני התנהגותרשת העצים החכמהhttps://www.zhihuishu.com/
טכנולוגיית SMOTEצוות פיתוח למידה לא מאוזןמשולב בספריית Imbalanced Learn, https://imbalanced-learn.org/stable/
מערכת ההפעלה Windows 10תאגיד מיקרוסופטhttps://www.microsoft.com/zh-cn/windows/windows-10
XGBoost 1.7.5צוות הפיתוח של XGBoosthttps://xgboost.readthedocs.io/

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cebi, A., Araujo, R. D., Brusilovsky, P. Do individual characteristics affect online learning behaviors? An analysis of learners sequential patterns. J Res Technol Educ. 55 (4), 663-683 (2023).
  2. Wang, Y. Affective state analysis during online learning based on learning behavior data. Tech Knowl Learn. 28 (3), 1063-1078 (2023).
  3. Wang, K., Zheng, K., Wang, Y. Construction and empirical research of a subjective-and-objective-analysis model of the online learning behavior. Soft Comput. 29 (6), 2971-2982 (2025).
  4. Yang, J. Accurate prediction and analysis of college students' performance from online learning behavior data. IEIE Trans Smart Process Comput. 12 (5), 404-411 (2023).
  5. Du, K., et al. Image-Based Intelligent Classroom Monitoring and Learning Behavior Analysis via Joint Object Detection and Semantic Segmentation. Traitement Signal. 42 (4), 2323-2332 (2025).
  6. Alqahtani, S. Leveraging techniques of epistemic network analysis to discover behaviors of student learning reflections in online learning environments. Eng Technol Appl Sci Res. 14 (3), 14191-14199 (2024).
  7. Li, Y., Wang, X., Chen, F., Zhao, B., Fu, Q. Online learning behavior analysis and prediction based on spiking neural networks. J Social Comput. 5 (2), 180-193 (2024).
  8. Zeng, B. Visual interactive mobile analysis of online English learning behavior based on lagged sequence analysis approach. Int J Interact Mob Technol. 18 (10), 34-47 (2024).
  9. Zhao, M., Zhang, Z. Prediction of online learning behavior in universities based on long short-term memory networks. J Comput Methods Sci Eng. 25 (1), 502-513 (2025).
  10. Li, F., et al. SPOC online video learning clustering analysis: Identifying learners' group behavior characteristics. Comput Appl Eng Educ. 31 (4), 1059-1077 (2023).
  11. Atenyi, J. M., Wang, C. J. Fractional fuzzy inference system design and implementation for temperature control. Iran J Fuzzy Syst. 22 (2), 171-186 (2025).
  12. Alves, K., Ballini, R., Eduardo, P. Financial series forecasting: A new fuzzy inference system for crisp values and interval-valued predictions. Comput Econ. 65 (6), 3673-3721 (2025).
  13. TuuSzabo, B., Koczy, L. T. A highly accurate Mamdani fuzzy inference system for tennis match predictions. Fuzzy Optim Decis Making. 24 (1), 99-127 (2025).
  14. Chen, Y., Li, C. Study on sensible beginning divided-search enhanced Karnik-Mendel algorithms for centroid type-reduction of general type-2 fuzzy logic systems. AIMS Math. 9 (5), 11851-11876 (2024).
  15. Fumanal-Idocin, J., Andreu-Perez, J., Cordon, O., Hagras, H., Bustince, H. ARTxAI: Explainable Artificial Intelligence Curates Deep Representation Learning for Artistic Images Using Fuzzy Techniques. IEEE Trans. Fuzzy Syst. 32 (4), 1915-1926 (2024).
  16. Duan, L., Paknejad, J., Kim, H. Employee attrition prediction with convolutional neural network and synthetic minority over-sampling technique. J Bus Analytics. 8 (1), 24-35 (2025).
  17. Luo, H., Zeng, X., Chen, Y. Research on text classification of coal mine safety hazards based on SMOTE+ENN. China Mining Mag. 34 (1), 116-125 (2025).
  18. Binbusayyis, A., Mohemmed, S. Stability prediction in smart grid using PSO optimized XGBoost algorithm with dynamic inertia weight updation. CMES - Comput Model Eng Sci. 142 (1), 909-931 (2025).
  19. Mosa, M. A. Optimizing text classification accuracy: a hybrid strategy incorporating enhanced NSGA-II and XGBoost techniques for feature selection. Prog Artif Intell. 14 (2), 275-299 (2025).
  20. Luo, S. An interior design method based on the coupling of I-GWO and self-updating neural network under the background of green interaction. Int J Sustain Dev. 28 (1), 43-57 (2025).
  21. Prabhakar, K., Jain, S. K., Padhy, P. K. Virtual inertia control of isolated microgrids using GWO-optimized modified IMC controller. Trans Inst Meas Control. 47 (4), 733-745 (2025).
  22. Lai, Y., Kang, L., Cao, W. A multi-objective particle swarm optimization using logistics-tent chaotic map with GOBL and non-inertial Lévy flight. J Comput (Taiwan). 36 (1), 59-74 (2025).
  23. Hasibur, R., Uddin, M. A., Ria, Z. F., Rahman, R. M. Optimizing BERT for Bengali Emotion Classification: Evaluating Knowledge Distillation, Pruning, and Quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  24. Liang, G., Jiang, C., Ping, Q., Jiang, X. Academic performance prediction associated with synchronous online interactive learning behaviors based on the machine learning approach Interact. Learn. Environ. 32 (6), 3092-3107 (2024).
  25. Mei, L. Model Construction of Higher Education Quality Assurance System Based on Fuzzy Neural Network. Informatica. 10 (10), 153-164 (2024).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תיקון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Formal Correction: Erratum: Multi-Perspective Fuzzy Reasoning and XGBoost-Based Analysis of Online Learning Behavior
Posted by JoVE Editors on 5/25/2026. Citeable Link.

This corrects the article 10.3791/69515

תגיות

XGBoost AlgorithmEmotion ClassificationLearning PerformanceGrey Wolf OptimizationPersonalized TeachingLearning Behavior AnalysisProcrastination BehaviorOnline Education

מאמרים קשורים