$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
עיצוב שיטת LBA תוך התחשבות ב-MPFR ובפרספקטיבות רגשיות
נבנתה מערכת הערכה רב-פרספקטיבית לניתוח התנהגות הלמידה המקוונת של התלמידים (SOLB), ומודל MPFR עוצב. כדי לנתח את התחושות הסובייקטיביות של התלמידים בלמידה, מחקר זה מאמץ את אלגוריתם XGBoost ומעצב את אלגוריתם IGWO לאופטימיזציה של היפרפרמטרים לשיפור דיוק הסיווג.
בניית מודל MPFR עבור LBA
כדי לנתח את SOLB, מחקר זה מתחיל בעיקר משתי נקודות מבט כדי ליצור תוכנית ניתוח מלאה. ראשית, מבחינת ביצועי הלמידה, מחקר זה בוחן שלוש נקודות מבט: תכנית לימודים, אישי וכיתה, כדי ליצור את מודל MPFR. שנית, מבחינת ניתוח סנטימנטים של תגובות סטודנטים, מחקר זה מעצב אלגוריתם XGBoost משופר. באמצעות ניתוח ביצועי הלמידה ורגשות המשוב של התלמידים, מחקר זה יכול לנתח טוב יותר את SOLB. מבחינת פרטים טכניים ספציפיים של ניתוח ביצועי למידה, מחקר זה משתמש תחילה בנתונים מפלטפורמת למידה מקוונת ומעבד אותם מראש. שנית, מחקר זה בוחר מדדי הערכת ביצועי למידה מרכזיים מזוויות שונות כדי לבנות מערכת הערכה מקיפה. בהמשך, נבנה מודל MPFR תואם להערכת התנהגות למידה.
מחקר זה בוחר נתונים מפלטפורמת Superstar (מקור: https://www.chaoxing.com/). הוא מכיל מידע מממדים שונים, כגון פעילויות בכיתה והערכת ציונים, שיכולים לספק בסיס טוב ל-LBA הבאים. לאחר קבלת הנתונים, יש לעבד אותם מראש, בעיקר כולל מחיקת שדה לא רלוונטית, סינון נתונים ובדיקות שלמות נתונים. לדוגמה, בנתוני מורים, יש להסיר מידע לא רלוונטי כמו המספר והמחלקה אליה שייך הקורס. בהמשך, מחקר זה בונה את הנדסת התכונות של LBA בהתבסס על נתוני התנהגות הלמידה של פלטפורמת Superstar. אינדקס LBA לסטודנט מספק בסיס הנדסי תכונות למודל MPFR הבא, ותוכן האינדקס מוצג באיור 1.

איור 1: מדדים ל-LBA לסטודנטים. התרשים מבהיר את שלושת הממדים המרכזיים (תוכנית לימודים, יחיד, כיתה) של LBA לתלמידים ואת מדדי ההערכה הספציפיים תחת כל ממד, ומספק תמיכה בתכונות למודל MPFR. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
באיור 1, מדדי LBA של הסטודנטים מתמקדים בעיקר בשלוש נקודות מבט: קורס, יחיד וכיתה, עם דגש ברור על כל ממד, ומספק תמיכה מדויקת בתכונות לבניית מודלים של MPFR. ביניהם, מבחינת מדדי ממדי הקורס, מחקר זה בוחר את שיעור השלמת משימות הקורס, משך הלמידה ותדירות האינטראקציה בין הקורסים. הדאגה המרכזית של ממד זה היא איכות ההשלמה הכוללת של משימות הקורס וקצב הזמן של השתתפות בלמידה. לדוגמה, שיעור ההשלמה של משימות קורס משמש למעקב אחר ההבדל בשיעורי ההשלמה לפני ואחרי המועד האחרון; משך הלימוד משמש להבחנה בין מרווחי עצימות למידה שונים; תדירות האינטראקציה עם הקורס משמשת לסינון התנהגויות אינטראקטיביות אפקטיביות. ברמה האישית, התקדמות בלמידה אישית, איכות השלמת שיעורי בית וציוני מבחנים נבחרים כמדדי הערכה. ממד זה מתמקד במידת ההתאמה בין התקדמות בלמידה אישית לבין תוצאות שליטה בידע. דוגמאות לכך כוללות השוואת התקדמות בלמידה אישית עם תוכניות קורסים, הערכת הדיוק והיעילות של מטלות שהושלמו, וסיווג רמות שליטה בידע על בסיס ציוני המבחנים. בנוסף, מבחינת ממד הכיתה, המדדים שנבחרו כוללים ממוצע ציון בכיתה, פעילות אינטראקציה כיתתית ואווירת למידה בכיתה. ממד זה מתמקד בעיקר בהשפעת סביבת הלמידה הכוללת על התנהגות הפרט. לדוגמה, הציון הממוצע משמש לאיתור רמת הביצועים היחסית של הפרט בקבוצה; פעילות האינטראקציה הקבוצתית משמשת לשקף את מידת ההשתתפות הקולקטיבית; אווירת הלמידה משמשת לניתוח ההשפעה המניעה של סביבת הקבוצה על התנהגות הלמידה. כדי לנתח את התנהגות הלמידה של התלמידים, נבנה מודל הסקה מטושטש, ותכונות התנהגות הלמידה מתקבלות מזוויות שונות. הסקה מטושטשת היא שיטת הסקה המשתמשת בלוגיקה מטושטשת, המעבדת מידע לא מדויק או לא ודאי דרך קבוצות מעורפלות וכללים מטושטשים, ויש לה יתרונות של גמישות חזקה והבנה קלה11,12. הסקה מטושטשת, כמנגנון המחשוב המרכזי של מודלי MPFR, מיושמת לאחר הנדסת תכונות. התהליך העיקרי של הסקה מטושטשת מוצג באיור 2.

איור 2: תרשים הזרימה הראשי של חשיבה מטושטשת. התרשים מציג את תהליך הליבה של חשיבה מטושטשת, כולל ארבעה שלבים מרכזיים: ערפול, בניית בסיס כללים מטושטש, הסקה מטושטשת, ומבהיר את הלוגיקה של מודל MPFR בטיפול בנתוני התנהגות למידה לא ודאיים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
היגיון מטושטש כולל בעיקר טשטוש, הקמת ספריית חוקים מטושטשים (FRL), הסקה מטושטשת והסרת טשטוש. ביניהם, הערפול דורש המרת נתוני קלט מדויקים לקבוצות מטושטשות וכוללת הגדרת פונקציות חברות. ה-FRL מכיל סדרה של כללים מטושטשים ומשמש בעיקר לתיאור הקשר בין קלט לפלט. בבניית בסיס הכללים המטושטש, המחקר מזמין שלושה פרופסורים חברים לטכנולוגיה חינוכית עם ניסיון הוראה של ≥ 8 שנים לפתח יחד 28 כללים, וקובע את הכללים הסופיים בשלושה סבבי איטרציה באמצעות "שיטת דלפי". לדוגמה, כלל 1: אם שיעור ההשלמה של משימת הקורס נמוך מ-30% וההתקדמות הלמידה של הפרט מאחרת בשבועיים → אז מצב בסיכון גבוה. הסקה מטושטשת היא תהליך של הסקת נתוני קלט מעורפלים הנבנים על FRL וקבלת תוצאות פלט מטושטשות. לבסוף, דה-בלור יהפוך את תוצאת הפלט המטושטשת לערך פלט מדויק. המחקר בוחר פונקציית חברות משולשת, שהיא פונקציה נפוצה במערכות לוגיקה מטושטשת, ויש לה יתרונות כמו גמישות חזקה ויעילות חישובית גבוהה. הביטוי של פונקציה μA(x) מוצג במשוואה (1).
(1)
במשוואה (1), x הוא הערך הספציפי של הקלט. a, b ו-c הם שלושת הקודקודים של משולש. בהסרת טשטוש, מאמר זה משתמש בשיטת הצנטרואיד להמרת תוצאות הפלט. שיטת הסנטרואיד היא טכניקת טשטוש נפוצה בלוגיקה מטושטשת, שיש לה יתרונות כמו אינטואיטיביות חזקה, חישוב פשוט ויציבות13. הביטוי של שיטת הצנטרואיד מוצג במשוואה (2)14.
(2)
במשוואה (2), f* הוא ערך הפלט לאחר דה-בלורינג, שהוא מרכז הקבוצה המטושטשת. μ(x) היא פונקציית החברות.
הוא הסכום המשוקלל של כל הנקודות בקבוצה מטושטשת.
הוא האינטגרל של פונקציית החברות על כל הערכים האפשריים של x. הרציונליות בשימוש בכללים ופונקציות חברות מוגדרים ידנית במודל MPFR משתקפת בשלושה היבטים. ראשית, הבטחת הסמכה מקצועית: מחוקקי הכללים הם שלושה פרופסורים חברים לטכנולוגיה חינוכית, והוסמכו על ידי "אנליסט התנהגות למידה מקוונת" של "מרכז המחקר לחינוך מקוון של משרד החינוך" כדי להבטיח שהכללים עומדים בחוקי החינוך וההוראה. שנית, יתרון יעילות: זמן ההסקה של כללים ידניים נמוך בהרבה מזה של שיטות מונחות נתונים, מה שהופך אותם למתאימים יותר לצרכי "הסקה בזמן אמת" של פלטפורמות חינוך מקוון וללא צורך בכמות גדולה של נתונים עם הערות, מה שמפחית עלויות איסוף נתונים15. שלישית, התאמה לדרישה המרכזית של "פרשנות" בתרחישי חינוך מקוון, כללים מוגדרים ידנית ופונקציות חברות משולשות (משוואה 1) יכולים להתאים ישירות לקוגניציה אינטואיטיבית בתרחישי הוראה. מחנכים אינם זקוקים לרקע טכני מורכב כדי להבין את הסיבה לכך שתלמיד נחשב בסיכון. שיטות מבוססות נתונים כמו מערכות נוירו-פאזיות יכולות לאופטימיזציה אוטומטית את הכללים. עם זאת, רוב הכללים שנוצרים הם ביטויים מתמטיים מורכבים, שקשה למחנכים לפרש, מה שמפחית את קבלת המודל בהתערבות בהוראה בפועל.
עיצוב מודל משופר לניתוח תחושת תגובות תלמידים עבור XGBoost
מודל MPFR שתוכנן יכול לנתח SOLB משלושה היבטים: מסלול, יחיד וכיתה. עם זאת, לניתוח נתונים התנהגותיים חיצוניים יש מגבלות בביטוי רגשות סובייקטיביים של התלמידים. לכן, כדי לנתח לעומק את התחושות הסובייקטיביות של התלמידים לגבי הלמידה, נאספים ומעובדים מראש נתונים נוספים מפלטפורמות למידה ב-MOOC המכילים מידע על תגובות תלמידים. בהמשך, XGBoost משמש לבניית מודל סיווג הרגשות. ה-IGWO נועד לייעל את הפרמטרים שלו לשיפור דיוק מודל הסיווג. השיפור ב-XGBoost משתקף באופטימיזציית הפרמטרים שלו דרך אלגוריתם IGWO. עיבוד נתונים מראש הוא שלב ראשון קריטי לפני בניית וניתוח המודלים. תהליך הקדם-עיבוד של הנתונים מוצג באיור 3.

איור 3: תהליך העיבוד המוקדם של הנתונים. תהליך עיבוד הנתונים המוקדם בן תשעה שלבים כולל ניקוי טקסט, חלוקת מילים, הסרת מילות עצירה, חילוץ גזע וזיהוי מילים לפי רגשות, המספק נתונים איכותיים לניתוח התנהגות וסיווג רגשות לאחר מכן. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
שלבי קדם-עיבוד הנתונים הם כדלקמן: השלב הראשון הוא לבצע ניקוי טקסט כדי להסיר שדות לא רלוונטיים בנתוני פלטפורמת Chaoxing ולסנן דגימות לא תקפות. במקביל, שדות לא-טקסטואליים וביקורות קצרות מוסרים מנתוני הביקורת בפלטפורמת ה-MOOC. השלב השני הוא לבצע עיבוד סגמנטציה. ביניהם, תגובות סיניות משתמשות ב"מצב המדויק" של ג'ייבה לעיבוד סגמנטציה של מילים, בעוד שההערות באנגלית משתמשות בפונקציית סגמנטציה של ספריית NLTK לעיבוד. השלב השלישי הוא להסיר מילות עצירה נפוצות כמו ''de'', ''yes'', ''in'' וכו'. ביניהן, מילות העצירה הסיניות משתמשות ברשימת מילות העצירה של מכון הרבין לטכנולוגיה (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt). מילות עצירה נמחקות על ידי התאמת מילים. מילות עצירה באנגלית משתמשות ברשימת מילות העצירה האוניברסלית המובנית בספריית NLTK, שגם היא נמחקת באמצעות התאמת מילה-אחר-מילה. השלב הרביעי הוא להשתמש ב-stemmer של ספריית NLTK כדי לחלץ שורשים מהטקסט ולשחזר פעלים בנתוני האנגלית לצורת השורש שלהם. השלב החמישי הוא לזהות את המילים הרגשיות החיוביות והשליליות בתגובות בהתבסס על מילון הרגשות של CNKI, כדי לספק בסיס קדם-הערות לסיווג רגשי עתידי. השלב השישי הוא לבצע חילוץ תכונות. ביניהם, הנתונים המובנים בפלטפורמת צ'אושינג סטנדרטיים, בעוד שמדדי הסיווג מקודדים בנפרד. במקביל, נתוני ההערות הללו של פלטפורמת MOOC משתמשים במודל שפה מאומן מראש (Bidirectional Encoder Representation from Transformers, BERT) כדי לחלץ תכונות טקסט. היתרון המרכזי של מודל BERT בחילוץ תכונות טקסט הוא שהוא יכול ליצור וקטורי מילים מודעי הקשר באופן דינמי באמצעות ארכיטקטורת טרנספורמר דו-כיוונית עמוקה, ובכך להתמודד עם העמימות שמודלים מסורתיים של הטמעת מילים סטטית אינם מסוגלים להתמודד איתה. השלב השביעי הוא לטפל בבעיה של קטגוריות רגשות לא מאוזנות בנתוני התגובות. טכניקת דגימת המיעוט הסינתטי (SMOTE) משמשת לעיבודו. חמישה דגימות שכנים קרובות נבחרות לאינטרפולציה ליצירת דגימות מיעוט סינתטי, עם זרע אקראי קבוע של 42 כדי להבטיח שחזוריות של הניסוי. השלב השמיני הוא להוסיף הערות ולחלק את הנתונים. השלב התשיעי הוא למלא ערכים חסרים בנתוני הסופרסטאר ולהסיר חריגים. בעת ביצוע עיבוד איזון נתונים, SMOTE יוצר דגימות מורכבות חדשות על ידי אינטרפולציה בין דגימות מחלקות מיעוט, ובכך מגדיל את מספר דגמי מחלקות המיעוט והופך את התפלגות המחלקות של מערך הנתונים למאוזןיותר ב-16,17. הביטוי של SMOTE מוצג במשוואה (3).
Bmn = dm + rand(0,1) x (dmn - dm) (3)
במשוואה (3), Bmn הוא מדגם מחלקת מיעוט שנבנה באופן מלאכותי, dm הוא מדגם מחלקת המיעוט ה-i, ו-dmn הוא המדגם ה-n מבין השכנים הקרובים ביותר k של dm. רנד(0,1) הוא מספר אקראי בין 0 ל-1. XGBoost משפר את ביצועי החיזוי על ידי הוספת עצי חיזוי באופן איטרטיבי. יש לו יתרונות כמו דיוק גבוה, גמישות גבוהה וקלות שימוש18,19. השלבים של בנייה איטרטיבית של מודל עץ באמצעות XGBoost כוללים בעיקר: אתחול המודל, בנייה איטרטיבית של העץ, פונקציית המטרה ומונח הרגולריזציה. התפוקה
החזויה באיטרציה של t-th מוצגת במשוואה (4).
(4)
במשוואה (4),
הוא ערך החיזוי של המודל לאחר ה-t - האיטרציה הראשונה, ft(h) היא פונקציית החיזוי של מודל העץ שנוספה באיטרציה ה-t, ו-h הוא וקטור תכונת הקלט. פונקציית המטרה למזעור XGBoost מוצגת במשוואה (5).
(5)
במשוואה (5), i הוא מספר המדגם. I ו-J הם סך כל הדגימות והעצים, ו-j הוא מספר העצים.
היא פונקציית האובדן, ו-Gi היא התווית האמיתית של הדגימה ה-i.
הוא הערך החזוי של המודל עבור מדגם ה-i לאחר האיטרציה של T-th. Ω(ft) הוא מונח הרגולריזציה, ו-(ft) היא פונקציית החיזוי של עץ ה-j -. הביטוי הכללי Ω(f) לרגולריזציה מוצג במשוואה (6).
(6)
במשוואה (6), γ משמעותו מקדם העונש עבור כמות צמתי העלה, λ הוא מקדם הרגולריזציה L2 למשקל צמתי העלה, ו-w הוא משקל צמתי העלה. עם זאת, הבחירה בהיפרפרמטרים של XGBoost משפיעה ישירות ומשמעותית על הביצועים. היפרפרמטרים נפוצים ב-XGBoost כוללים קצב למידה, עומק מרבי של העץ ופרמטרי רגולריזציה. עקב מרחב ההיפרפרמטרים הפוטנציאלי הגדול, התאמה ידנית של פרמטרים אלו אינה רק גוזלת זמן אלא גם קשה למצוא את שילוב הפרמטרים האופטימלי. לכן, מחקר זה מעצב את IGWO כך שימקסם את ההיפרפרמטרים של XGBoost. GWO מחפשת פתרונות מיטביים על ידי סימולציה של ההיררכיה החברתית ואסטרטגיות הציד של זאבים אפורים, עם יתרונות כמו פחות פרמטרים וגמישות חזקה20,21. ב-GWO, המיקום ההתחלתי של האוכלוסייה נוצר כפי שמוצג במשוואה (7).
(7)
במשוואה (7), Puv הוא מיקום הפרט ה-u בממד ה-v.
והם
הגבול העליון והתחתון של מרחב החיפוש V. רנד() הוא מספר אקראי בין [0,1]. עם זאת, אלגוריתם GWO עשוי להיתקל בבעיות כמו מהירות התכנסות איטית והיתקעות באופטימיות מקומיות בשלבים האמצעיים והמאוחרים יותר. משמעות הדבר היא שבשלב זה, GWO עשויה שלא להיות מסוגלת לחקור ביעילות את כל מרחב הפתרון, מה שמקשה על מציאת הפתרון האופטימלי הגלובלי. כדי להתמודד עם בעיה זו, מחקר זה משפר את GWO משני היבטים: הצגת מפת האוהל הכאוטית (TCM) ומקדם ההתכנסות הלא-ליניארי (NCF). TCM הוא מיפוי כאוטי פשוט שמבטיח שאזורי פתרון אופטימליים פוטנציאליים לא ייפספסו במהלך תהליך החיפוש ומונע חיפושים חוזרים באותו אזור22. לכן, באמצעות ה-TCM ניתן ליצור אוכלוסייה התחלתית אחידה ואקראית יותר, ולהגביר את יכולת האלגוריתם להתגבר על אופטימיות מקומיות. חישוב ה-TCM מוצג במשוואה (8).
(8)
במשוואה (8), y הוא פרמטר הבקרה. Rt ו-Rt+1 הם משתני מצב המערכת באיטרציות t-th ו-t+1. הנוסחה של NCF z מוצגת במשוואה (9).
(9)
במשוואה (9), zמקסימום הוא מקדם ההתכנסות המקסימלי ו-tמקסימום הוא מספר האיטרציות המקסימלי. שיטה לא ליניארית זו מאפשרת ל-GWO לשמור על גודל צעד גדול לחיפוש גלובלי בשלבים המוקדמים. בשלב האמצעי של החיפוש, מהירות ההתכנסות מואצת, בעוד שבשלב מאוחר יותר החיפוש המקומי מתבצע בשלבים קטנים יותר, מה שמאזן ביעילות את יכולות החיפוש הגלובלי והמקומי ומשפר את ביצועי האופטימיזציה. אלגוריתם IGWO משמש במיוחד לשלב אופטימיזציית ההיפרמטרים של מסווג סנטימנט XGBoost, והתהליך המרכזי שלו מוצג באיור 4.

איור 4: התהליך המרכזי של IGWO. האיור מתאר את תהליך הביצוע של IGWO, כולל אתחול אוכלוסייה המבוסס על מיפוי כאוטי של אוהל, עדכון מיקום של גורמי התכנסות לא ליניאריים, וסינון אופטימלי של כל אחד, ומבהיר את ההיגיון לאופטימיזציה של היפרפרמטרים של XGBoost. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
באיור 4, תהליך IGWO כולל: אתחול האלגוריתם; שימוש ב-TCM לאתחול האוכלוסייה; חישוב ערך הכשירות ההתחלתי של כל פרט; שימוש ב-NCF לעדכון עמדות הזאב האפור; בחירת הפתרון עם הכושר הטוב ביותר כאדם האופטימלי החדש; ולהוציא את האדם האופטימלי. השילוב האופטימלי של היפרפרמטרים של XGBoost ניתן להוציא דרך IGWO. התהליך הכולל של סיווג סנטימנטים משלב עיבוד נתונים מוקדם, אופטימיזציה של IGWO, ומודל XGBoost הסופי. תהליך מודל הסיווג המבוסס על IGWO-XGBoost מוצג באיור 5.

איור 5: תהליך מודל הסיווג המבוסס על IGWO-XGBoost. האיור מציג את התהליך המלא של מודל סיווג הסנטימנטים של IGWO-XGBoost, מקלט נתונים ועיבוד מוקדם ועד חלוקת מערכי נתונים, אופטימיזציה של היפרפרמטרים של IGWO, בניית מודל XGBoost ותוציא תוצאות סיווג, ומציג בבירור את שרשרת הפעולה של המודל. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
המודל המבוסס על IGWO-XGBoost כולל תהליכים כמו נתוני קלט, עיבוד מוקדם של נתונים, חלוקת מערכי נתונים, אופטימיזציה של היפרפרמטרים באלגוריתם IGWO, שילוב אופטימלי של היפרפרמטרים, בניית XGBoost המבוססת על שילוב היפרפרמטרים מיטבי, ופלט תוצאות סיווג. באמצעות מודל סיווג זה, ניתן לסווג רגשות בתגובות התלמידים, ובכך לקבל הבנה אינטואיטיבית יותר של התחושות הסובייקטיביות של התלמידים לגבי הלמידה. גרסאות התוכנה הספציפיות, זרעים אקראיים, מפרטי חומרה, מפרטים סביבתיים ומקורות מערך הנתונים ששימשו במחקר מוצגים בטבלה 1.
| סוג הסט | מודל ותוכן ספציפיים |
| תוכנה בסיסית | פייתון 3.9.7 |
| ספריית הליבה | XGBoost 1.7.5, Scikit-learn 1.2.2, Jieba 0.42.1, NLTK 3.8.1, Pandas 1.5.3, NumPy 1.24.3, Matplotlib 3.7.1, Imbalanced-learn 0.10.1 |
| זרע אקראי | הגדר את הזרע האקראי הגלובלי ל-42 |
| מפרטי חומרה/סביבה | 1. מערכת הפעלה: Windows 10 Professional Edition (64 ביט, מספר גרסה 22H2) |
| 2. מעבד: Intel Core i5-12600KF (בתדר ראשי של 3.7GHz ותדר האצה דינמי של 4.9GHz) |
| 3. זיכרון: 64GB DDR4 (תדר 3200MHz, תומך בזיכרון עד 128GB) |
| 4. אחסון: כונן SSD בנפח 1TB (Samsung 980 Pro, מהירות קריאה 7450MB/s) |
| 5. כרטיס גרפי: NVIDIA GeForce RTX 3060 (זיכרון וידאו 12GB) |
| מקורות מערך נתונים ופרטי גישה | 1. מערך הנתונים של פלטפורמת סופרסטאר: |
| -אתר משאבים אחיד (URL): https://www.chaoxing.com/ |
| -שיטת רכישה: יישום דרך פלטפורמת הנתונים הגדולים הפתוחה של Chaoxing Education (מסלול יישום: אתר רשמי → מרכז מפתחים → ממשק נתונים → למידה התנהגותי) |
| 2. מאגר תגובות לפלטפורמת MOOC: |
| -כתובת מקור: https://www.icourse163.org/.cn |
| -שיטת רכישה: הגשת מועמדות דרך ערוץ "תמיכה במחקר נתונים" של פלטפורמת MOOC |
| סקריפטים או מודלים מותאמים אישית | 1. סקריפט קדם-עיבוד נתונים |
| 2. סקריפט מודל MPFR |
3. סקריפט מודל IGWO-XGBoost
|
טבלה 1: גרסאות תוכנה ספציפיות, זרעים אקראיים, מפרטי חומרה, מפרטים סביבתיים ומקורות מאגרי נתונים ששימשו במחקר. ספק רשימה מפורטת של סביבת התוכנה והחומרה הנדרשת, הגדרות זרע אקראיות, מקורות מאגרי נתונים וטווח חיפוש היפרמטרים של XGBoost למחקר כדי להבטיח שחזוריות וסטנדרטיזציה של הניסוי.
טבלה 1 מראה שהמחקר מאמץ את XGBoost 1.7.5 כמסגרת הליבה של מודל סיווג הסנטימנט ומציג את Scikit learn 1.2.2 לעיבוד נתונים מוקדם, חילוץ תכונות והערכת מודלים. בנוסף, המחקר מגדיר באופן אחיד את הזרע האקראי ל-42 כדי להבטיח שחזוריות של חלוקת נתונים, דגימת יתר של SMOTE, אופטימיזציה של היפרפרמטרים של IGWO ותוצאות אימון מודלים של IGWO-XGBoost. בנוסף, אלגוריתם IGWO קובע את מרחב החיפוש להיפרפרמטרים של XGBoost. טווח החיפוש לקצב הלמידה הוא [0.001, 0.3] בסולם הלוגריתמי, והעומק המרבי של העץ נבדק בקבוצת המספרים השלמים {3, 4,..., 15}. טווח האופטימיזציה של מונח רגולריזציה L2 הוא [0.1, 5.0], ויחס הדגימה של כל תת-קבוצה של תכונות עץ מותאם בטווח של [0.6, 1.0]. טווח הכוונון למשקל המינימלי של צמתים עלים הוא [1, 10].
מערך הנתונים וקוד העיבוד והניתוח הנלווה נוצרו ונותחו על ידי הצוות עצמו. הסקריפטים המרכזיים לעיבוד נתונים מוצג בטבלה 2.
| ייבא פנדות כ-PD, ג'יבה, RE, נומפי כ-NP |
| מ-nltk.tokenize ייבוא word_tokenize; מ-nltk.stem import PorterStemmer |
| Def Clean (טקסט, L): |
| החזר re.sub(r"[^\u4e00-\u9fa5]" if l=="zh" else r"[^a-zA-Z]", " ", text).strip() |
| תהליך def (טקסט, l): |
| t = jieba.lcut(טקסט) אם l=="zh" אחרת word_tokenize(טקסט) |
| החזר " ".join([PorterStemmer().stem(w) אם l=="en" else w עבור w ב-t אם w לא ב-open("hit_stopwords.txt").read().split()]) |
| דף מיין (C,M,L): |
| cx=pd.read_csv(c).query("משך למידת הקורס>=1 & results exam.notna()"); mc=pd.read_csv(m).query("comment text.str.len()>=5") |
| mc["t"]=mc["comment text"].apply(clean,args=("zh",)).apply(process,args=("zh",)) |
| np.savez("out.npz",**{k:v for k,v in locals().items()}) |
טבלה 2: סקריפט ליבה לעיבוד נתונים מוקדם. הצג את המידע המרכזי של הסקריפט לעיבוד נתונים מוקדם, הבהיר את שלבי העיבוד המוקדמים המתאימים לסקריפט, וספק הפניות טכניות לשכפול שיטות מחקר.