מחקר זה בוחן את STEP-DWCF-R (תהליך מובנה, מדורג ומונע-ראיות למשוב תיקוני כתוב דינמי עם סוכן רובוטי AI) לשיפור ביצועי כתיבת IELTS באמצעות בינה מלאכותית רב-סבבית ותיקונים בתמיכת מורים.
מאמר שיטה
מחקר זה בוחן את STEP-DWCF-R (תהליך מובנה, מדורג ומונע-ראיות למשוב תיקוני כתוב דינמי עם סוכן רובוטי AI) לשיפור ביצועי כתיבת IELTS באמצעות בינה מלאכותית רב-סבבית ותיקונים בתמיכת מורים.
מערכות משוב כתיבה אוטומטיות נפוצות מאוד, אך רובן מספקות הערות סטטיות ומקוטעות שמספקות בסיס מוגבל לעריכה. מחקר זה מעריך את מסגרת STEP-DWCF-R (תהליך מובנה, מדורג ומונע-ראיות למשוב תיקוני כתוב דינמי עם סוכן רובוטי בינה מלאכותית), שבה משוב שנוצר על ידי בינה מלאכותית, המנוהל על ידי מורה, מועבר באמצעות סוכן בינה מלאכותית רובוטי במספר סבבים איטרטיביים במחזור משימה של שבוע. בניסוי קוואזי-ניסיוני בן שמונה שבועות, 32 לומדים EFL חולקו באקראי למשוב תיקוני כתוב מסורתי (סבב אחד לכל משימה) או ל-STEP-DWCF-R. שתי הקבוצות השלימו את חיבורי IELTS Task 2 בשלב הבסיסי ואחרי המבחן, אשר היו אנונימיים, אקראיים וקיבלו דירוגים על ידי שני מעריכים עצמאיים (ICC = 0.86–0.93). מודלים של השפעות מעורבות ליניאריות הראו כי קבוצת STEP-DWCF-R הציגה שיפורים משמעותיים יותר בציון הרצועה הכולל (Δ = 1.03 לעומת 0.31 רצועים) ובכל ארבעת הממדים האנליטיים, כאשר השיפור הגדול ביותר נצפה בקוהרנטיות ובקוהזיה. נתוני התהליך הצביעו על כך שלומדי STEP-DWCF-R השלימו בממוצע 2.26 סבבי תיקון לכל משימה, כאשר מספר השגיאות ירד באופן ליניארי בין סבבים. ממצאים אלו מצביעים על כך שמסגרת STEP-DWCF-R המשולבת, הכוללת משוב שנוצר על ידי בינה מלאכותית, פיקוח מורים והעברת סוכני בינה מלאכותית רובוטית איטרטיבית, קשורה לשיפור גדול יותר בכתיבת IELTS מאשר משוב סיבוב יחיד מסורתי, מה שמצביע על יישומים מעשיים למשוב דינמי משופר ב-AI בהקשרים של EFL.
משוב תיקוני כתוב (WCF) נשאר מרכזי בפדגוגיית כתיבה בשפה השנייה. הראיות מראות ש-WCF מקיף משפר את דיוק הלומדים לאורך זמן, וכאשר הוא מותאם לפרקטיקה בכיתה, יכול להתקיים לצד גישות ממוקדות האפשריות בהקשרים אותנטיים 1,2,3. מחקרים בכיתה עדכניים מראים שיפורים עמידים בדיוק ושטף מ-WCF מתמשך ומקיף. מחקר על תחום המשוב מזהיר שמורים צריכים למקד את הטפסים באופן אסטרטגי במקום לסמן הכל 4,5,6,7,8,9. במקביל, הערכת כתיבה אוטומטית (AWE) ומשוב תיקוני כתוב אוטומטי (AWCF) גדלו במהירות. הממצאים מעורבים: חלק מהמחקרים מראים שיפורים בהישגי המשימות ובטווח הדקדוק בתוכניות בסגנון AWCF או Criterion, בעוד אחרים אינם מוצאים יתרון משמעותי על פני משוב למורים בלבד או מציינים תיקונים מקומיים ושטחיים. כדי לשקף את ההטרוגניות הזו, אנו בכוונה משלשים בין מספר מחקרי AWCF במקום להסתמך על מקור אחד 10,11,12,13.
אמונות הלומדים לגבי מי נותן משוב גם הן חשובות: עבודה קוואזי-ניסיונית על מקור נתפס מצביעה על כך שביצועים ואמון יכולים להשתנות כאשר משוב זהה מוצג כ"מורה" לעומת "אוטומטי", מה שמדגיש את הצורך לקחת בחשבון את השפעות התפיסה בעיצובים של AWCF14,15. בהרחבת קו זה, מחקרים מתקדמים מציעים שרובוטים חינוכיים, בשל נוכחותם המגולמת, יכולים גם לשמש כספקי משוב, ולהשפיע על מעורבות ואמון הלומד בדרכים ייחודיות16.
קו מחקר משלים, משוב כתוב מתקן דינמי (DWCF), מדגיש מחזורי משוב תכופים, ניתנים לניהול ומקיפים עם קידוד ותיקון מהיר. ראיות ממספר סביבות מצביעות על כך ש-DWCF משפר באופן אמין את הדיוק (עם השפעות תדירות על השטף), אם כי התוצאות עשויות להשתנות לפי מטרות הקורס ואוכלוסיית הלומדים 17,18,19,20. לבסוף, מחקרים מוקדמים על משוב מתווך בינה מלאכותית גנרטיבית מדווחים על שוויון עם משוב מורים על תוצאות כתיבה ותועלת פוטנציאלית כאשר הם משולבים עם הנחיות מטלינגוויסטיות מפורשות, מה שמעודד שילוב קרוב יותר של משוב אנושי ובינה מלאכותית בהקשרים של שפה שנייה21,22.
כדי להתמודד עם אתגרים אלו, אנו מציעים את מסגרת STEP-DWCF-R (תהליך מובנה, מדורג ומבוסס ראיות למשוב תיקוני כתוב דינמי עם סוכן רובוטי AI), מערכת משוב חדשנית רב-שלבית של DWCF שנועדה לספק תמיכה בכתיבה מובנית, איטרטיבית ומבוססת תהליכים. המערכת שלנו מנצלת את הכוח החיזוי והגנרטיבי של מודלים גדולים (LLMs), באמצעות ממשק רובוטי של סוכני בינה מלאכותית וניהול מורים, כדי לחלק סוגיות כתיבה מורכבות לקטגוריות ניתנות לניהול, לספק משוב דרך סבבי אינטראקציה מרובים, ולהעריך את יעילותו באמצעות מדדים מבוססי תוצאות ותהליכים. על ידי הפיכת המשוב לתהליך מובנה ואינטראקטיבי, STEP-DWCF-R מקדם את התמיכה בכתיבה אוטומטית מתיקון שגיאות סטטי למערכת מרתקת, ממוחשפת וממוקדת למידה יותר.
התרומות שלנו מתמקדות בשלושה התקדמות. ראשית, אנו מציעים סכמת ייצוג משוב מובנית שמסווגת שגיאות (למשל, דקדוק, קוהרנטיות) כך שמשוב LLM המבוסס על ידי סוכני בינה מלאכותית רובוטי יהיה גם ניתן לפעולה וגם ניתן לפרשנות פדגוגית. שנית, אנו מציגים תהליך רב-שלבי איטרטיבי שמסדר משוב בין שפה, מבנה והיגיון במספר סבבים כדי להפחית עומס קוגניטיבי ולהעמיק את המעורבות. שלישית, אנו מרחיבים את ההערכה מעבר ל-post-scores לכלול מדדים מוכווני תהליך כמו הפחתת שגיאות ואימוץ משוב, ומציעים תמונה עשירה יותר של השפעת הלמידה. מסגרות WCF מייצגות את הניסיונות הראשונים לשיטתיות משוב מתקן כתוב בטכנולוגיה חינוכית. המערכות הללו, שמקורו בהערכת כתיבה אוטומטית (AWE) וניקוד אוטומטי למאמרים (AES), הדגישו זיהוי טעויות וציון מיומנות13,14. התרומה שלהם טמונה בקנה מידה: אלפי לומדים יכלו לקבל משוב ללא צוואר בקבוק של ציונים אנושיים. עם זאת, מסגרות אלו בדרך כלל סיפקו הערות סטטיות ומקוטעות, כגון בדיקות דקדוק, הצעות לקסיקליות או ציונים כלליים שהלומדים התקשו להפוך לתיקונים משמעותיים 23,24,25,26.
עם הזמן, מחקר WCF התפתח לכלול גישות מתווכות טכנולוגיות נוספות. מערכות חדשות אלו שאפו ללכוד היבטים רחבים יותר של הכתיבה באמצעות שיטות חישוביות13,21. בשנים האחרונות, היקף התרחב עוד יותר עם טכנולוגיות מגולמות, שבהן רובוטים חינוכיים החלו לפעול כספקי משוב בהקשרים של כתיבה או הדרכה. הנוכחות הפיזית שלהם והאפשרויות האינטראקטיביות שלהם מציגות דינמיקות חדשות של אמון, מעורבות ומוטיבציה של הלומדים. ובכל זאת, למרות ההתפתחויות הללו, הגישה הדומיננטית של WCF נותרה ממוקדת תוצאה 8,27: יצירת ציונים או הערות מבודדות באופן חד-פעמי. פדגוגית, כיוון זה אינו תואם את ההערכה המעצבת, שבה המשוב אמור לתמוך בתיקון בין הטיוטות ולתמוך במעורבות מטאקוגניטיבית 16,28,29,30,31. לכן, הגבול המושגי של WCF חושף פער מתמשך: המשוב מועבר, אך אינו מובנה או מסודר כדי להנחות תהליכי למידה.
בתגובה למגבלות אלו, חוקרים החלו לחקור גישות דינמיות יותר למשוב כתיבה. מחקרים מוקדמיים הדגישו את חשיבות מחזורי המשוב האיטרטיביים, שבהם הלומדים מתעדכנים מספר פעמים תחת הנחיות מגוונות17,32. הוצע גם סיווג שגיאות מובנה כדי לשפר את יכולת הפרשנות של המשוב וליישר אותו עם מטרות פדגוגיות33,34. מושג מסגרת DWCF מחזק את הכיוונים הללו על ידי הטמעת שלושה עקרונות עיצוב: סכימות שגיאה מפורשות, אספקה מדורגת ואיטרטיבית, ומדדי הערכה מונחי תהליכים19,35. במקום להציף את התלמידים בכמות גדולה של תיקונים בבת אחת, DWCF מפזרת את תשומת הלב בין שכבות הכתיבה—דיוק שטחי, קוהרנטיות מבנית ועומק טיעוני—לאורך סבביםעוקבים 17,33. ההערכה מתרחבת מעבר לציונים סופיים וכוללת מדדי תהליך כגון שיעורי הפחתת שגיאות, אימוץ משוב ועומק תיקונים 10,19,25. למרות ההבטחה שלו, היישומים המעשיים של DWCF נותרו דלים, ורוב המחקרים לא מצליחים ליישם אותו בקנה מידה גדול, מתווך טכנולוגי, 10,36,37. פער זה מדגיש את הצורך במסגרות שלא רק מעלות תיאוריות לגבי DWCF אלא גם מדגימות את היתכנותה בסביבות חינוכיות אמיתיות. איור 1 מציג את המסגרת התיאורטית הרחבה יותר של DWCF שהוצעה בספרות. התרשים מספק הסבר כללי לאופן שבו משוב מתקן כתוב דינמי עשוי לפעול ברמות שונות, כולל תוצאות מדודות (למשל, דיוק, קוהרנטיות) והן מבנים תיאורטיים אך לא מדודים במחקר הנוכחי (למשל, הפחתת חרדת כתיבה, שטף ומורכבות). הוא נכלל לצורך כיוון תיאורטי ולא כמודל ישיר של ניסוי זה. האלמנטים התואמים לתוצאות ולמדדי התהליך שנותחו כאן מצוינים באיור; מסלולים אחרים משמשים כמהמחיש ולא הוערכו במחקר זה.
הופעתם של מודלים גדולים גדולים ומערכות רב-מודליות מציעה דרך עוצמתית להפעיל את DWCF בהיקף רחב. מודלי שפה גדולים, עם יכולות ה-zero-shot ו-lu-shot שלהם, יכולים לייצר משוב רגיש להקשר ללא הדרכה ממוקדת במשימה21,22. ניסויים אחרונים מציעים את הפוטנציאל שלהם לסגמנטציה מכוונת, עידון מדורג ויצירת הסברים, התואמים באופן הדוק את עקרונות DWCF 13,37,38,39. מחקר משלים בשיתוף פעולה בין אדם לבינה מלאכותית הראה שלולאות איטרטיביות של מעורבות, התאמה ואימוץ סלקטיבי של משוב מבוסס בינה מלאכותית יכולים לשפר הן את איכות הקליטה והן את איכות הגרסה25,30. כאשר תהליכים אלו מתגלמים דרך רובוטים, האינטראקציה יכולה להפוך לרב-מודלית—המשלבת מחווה, קול ונוכחות—מה שעשוי לשפר עוד יותר את תפיסת הלומד והמוטיבציה40.
בהתבסס על אזור ההתפתחות הקרובה (ZPD)41, השערת הקלט42 ותאוריית רכישת המיומנויות43, אנו ממקמים את STEP-DWCF-R כבקר המקשר בין תמיכת הלומד, עיבוד קלט ופיתוח מיומנויות. באופן קונקרטי, פירוט מקושר לפי רובריקה, רשימות מאוחדות בזמן, ומחזורי AI–, אדם ורובוט מרובי סבבים של מורים פועלים בשכבת אינטגרציה שמתווכת תיקון ומניבה את נקודות הקצה הנצפות שנותחו כאן (IELTS Overall ו-TR/CC/LR/GRA; סבבים, קליטה, שגיאות מתמשכות, זמן). מבנים כמו הפחתת חרדת כתיבה הם תיאורטיים אך אינם נמדדים בניסוי זה.
פרוטוקול זה אושר על ידי ועדת האתיקה של בית הספר לחינוך יסודי, מכללת חינוך לגיל הרך שאנגראו. כל המשתתפים היו מבוגרים (≥18 שנים) וסיפקו הסכמה מדעת בכתב לפני המחקר.
1. עיצוב מחקר
הערה: בשל המגבלות של כיתת ה-EFL הזמינה (סך ההרשמה N = 32), המשתתפים חולקו באקראי לשתי קבוצות של 16 כל אחת. גודל המדגם הזה, אף שהוא צנוע, נקבע כמספיק לחקירת פיילוט בהתחשב בתכנון הקדם-פוסט בתוך הנבדקים ובגדלי אפקטים גדולים צפויים בהתבסס על מחקרי DWCF קודמים 17,18,19,20.
2. משימות כתיבה
3. תהליך עבודה עם משוב
4. מדידת תוצאה
5. מדידת תהליך
6. ניתוח נתונים
7. זמינות קוד
כל הקוד, הפקודות, סכימות JSON וקבצי מימוש לדוגמה הנדרשים לשחזור מערכת STEP-DWCF-R זמינים באופן פתוח ב-https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.
ניסויים וניתוחים
כל 32 הלומדים סיפקו נתוני בסיס. נתוני לאחר המבחן היו זמינים עבור 16 לומדים בכל קבוצה (WCF ו-STEP-DWCF-R; איור 2). ציר הזמן והמדדים של המחקר מוצגים באיור 3, ותהליך המשוב מקצה לקצה מוצג באיור 4. פרמטרי ההגדרה והיישום הניסיוניים של מערכת הבינה המלאכותית שלנו מוצגים בטבלה 1. הניתוחים התקיימו לפי התוכנית שנקבעה מראש עם כוונה לטיפול. תחילה אנו מעריכים שקילות בסיסית (טבלה 2), לאחר מכן מדווחים על התוצאה הראשונית (איור 5 וטבלה 3), ואחריהם תוצאות משניות (טבלה 4) עם בדיקות עמידות ואמינות.
שקילות בסיסית
בבסיס (שבוע 1), הקבוצות היו דומות תיאורית במשתנים מוגדרים מראש, כולל דמוגרפיה וביצועי כתיבת IELTS לפני כל משוב (טבלה 2). ציוני רכיבי IELTS בודדים מוקצים בצעדים של 0.5 רצועים, בעוד שהטבלה מדווחת על ממוצעים קבוצתיים. הממוצעים הכוללים של שבוע 1 (WCF = 5.625, STEP-DWCF-R = 5.500) מחושבים מאותם מערכים ששימשו ליצירת איור 5. איננו מבצעים בדיקות השערה בבסיס; כל אי-איזון שאריתי מטופל על ידי התכנון הקדם-פוסט ומונח זמן הקבוצה × במודל ההשפעות המעורבים, והשוואת פוסט-מבחן מותאמת לבסיס מדווחת בסעיף הפרוטוקול.
תוצאה ראשונית
איור 5 מסכם שינויים לפני הפוסט, בעוד שטבלאות 3 וטבלה 5 מדווחות על הערכות מודל והישגים לאחר המבחן. בהתחלה (שבוע 1), ממוצעי הקבוצה היו 5.625 עבור WCF ו-5.500 עבור STEP-DWCF-R, מה שהניב הפרש קבוצתי לא משמעותי של −0.125 (SE = 0.133, t = − .939, df = 29.90, p = .355, רווח בר-סמך 95% [−0.397, 0.147]). לכן, קו הבסיס בטבלה 3 מעריך את ממוצע שבוע 1 של WCF ב-5.625 עם רווח סמך של 95% [5.419, 5.831] (SE = 0.097, df = 15). משבוע 1 עד שבוע 8, WCF השתפר ב-0.3125 רצועותיה (SE = 0.128, t = 2.44, df = 15, p = 0.028, רווח בר-סמך 95% [0.039, 0.586]; השפעה סטנדרטית בתוך הקבוצה dz = 0.61). STEP-DWCF-R השתפר ב-1.0313 רצועות (SE = 0.140, t = 7.34, df = 15, p = 2.44 × 10−6, רווח בר-סמך 95% [0.732, 1.331]; dz = 1.84). הניגוד הליניארי של השפעות מעורבות באינטראקציה בין קבוצה × זמן — כלומר, ההפרש בהבדלים — היה 0.7188 רצועות (SE = 0.190, t = 3.78, df = 29.75, p = 0.0007, רווח בר-סמך 95% [0.330, 1.107]; טבלה 3), שמציינת עליות גדולות יותר תחת STEP-DWCF-R. לאחר המבחן (שבוע 8), הממוצעים השוליים המוערכים העדיפו את STEP-DWCF-R ב-0.5938 רצועות (מבחן וולש על ממוצע קבוצתי: SE = 0.115, t = 5.16, df = 29.74, p = 1.50 × 10−5, רווח בר-סמך 95% [0.359, 0.829]). בהתאם לכך, טבלת ההישגים (טבלה 5) מראה שבשבוע 8, 13% מלומדים WCF הגיעו ל-≥ כולל 6.5 ו-0% הגיעו ל-≥ 7.0 (ספירות 2/16 ו-0/16), בעוד ש-81% מהלומדים ב-STEP-DWCF-R הגיעו ≥ 6.5 ו-25% הגיעו ≥ 7.0 (ספירות 13/16 ו-4/16). טבלה 3 מדווחת על הערכות האפקט הקבוע המתאימות ואת אי-הוודאות שלהן.
תוצאות ברמת הממד
טבלה 4 מסכמת שינויים לפני הפוסט בארבעת ממדים של משימה 2. תגובת המשימה (TR) הראתה עלייה של Δ = 0.25 תחומים תחת WCF לעומת Δ = 0.95 תחת STEP-DWCF-R, מה שהניב ΔΔ = 0.70 עם רווח בר-סמך 95% [0.28, 1.12] ו-p מותאם על ידי הולם = 0.006. קוהרנטיות וקוהזיה (CC) הציגו את הניגוד הגדול ביותר: WCF Δ = 0.30, STEP-DWCF-R Δ = 1.15, ולכן ΔΔ = 0.85 (רווח בר-סמך 95% [0.44, 1.26], adj-p = 0.002). משאב לקסיקלי (LR) עקב אחרי אותו דפוס עם WCF Δ = 0.35 ו-STEP-DWCF-R Δ = 0.95, מה שנתן ΔΔ = 0.60 (רווח בר-סמך 95% [0.18, 1.02], adj-p = 0.012). טווח ודיוק דקדוקי (GRA) שופרו ב-Δ = 0.25 ב-WCF ו-Δ = 0.97 ב-STEP-DWCF-R; התוצאה ΔΔ = 0.72 נשאה רווח סמך של 95% של [0.31, 1.13] עם adj-p = 0.004. בכל ארבעת הממדים, ניגודי קבוצת×זמן העדיפו את STEP-DWCF-R לאחר התאמת הולם–בונפרוני.
ראיות תהליך
איור 6 ואיור 7 מציגים את תוצאות הליבה של התהליך. בשבועות 2–7, STEP-DWCF-R השלים בממוצע 2.26 סבבי תיקון לכל משימה (רווח ביטחון 95% [2.17, 2.35]; n = 96), בעוד ש-WCF היה 1.00 סבבים לכל המשימות (n = 96). ההפרש הממוצע היה 1.26 סבבים (רווח בר-סמך 95% [1.17, 1.35]); מבחן מאן–וויטני אישר הפרדה בין ההתפלגויות (U = 9216, z = 11.97, p < 10−30). בתוך STEP-DWCF-R, ממוצע מספר השגיאות ירד לפי סבב: 13.78 בסבב 1 (רווח בר-סמך 95% [13.02, 14.54]; n = 96), 8.94 בסבב 2 (רווח בר-סמך 95% [8.42, 9.46]; n = 96), ו-6.16 בסבב 3 (רווח בר-סמך 95% [5.20, 7.12]; n = 25). מגמה ליניארית שהותאמה לתצפיות לכל סבב העריכה ירידה של 4.14 שגיאות לכל סבב (רווח סמך 95% [3.51, 4.78] בעוצמה מוחלטת; עמ' < 10−12). מדדים של קליטת משוב וזמן ביצוע משימה אינם מקודדים באיור 6 ובאיור 7 ולכן מדווחים בטבלה 7.
אמינות ועמידות
ההסכם בין המערכים למאמרים בשבוע 1 ושבוע 8 היה טוב עד מצוין. שני מעריכים מיומנים דירגו את כל התסריטים באופן עצמאי והיו עיוורים לקבוצה ולזמן; באמצעות מדדים ממוצעים של מקדם קורלציה תוך-מחלקה (ICC[2,2]) על ממוצעי המערך, האמינות נעה בין 0.86 ל-0.93 בסך הכל, וארבעת הממדים, וכל מגבלות האמון הנמוכות של 95%, עלו על 0.80 (טבלה 6). בדיקות אבחון למודל ההשפעה המעורב הראשי הצביעו על שאריות נורמליות בקירוב ללא הטרוסדסטיות חומרית, ומודלים שהותאמו לסיכומי תהליכים ברמת המשימה הראו פיזור קרוב לאחד. ניתוחי רגישות שהתבססו על אותו מערך נתונים של שבוע 1/שבוע 8 הניבו מסקנות עקביות: רגרסיה ליניארית שהשוותה קבוצות לאחר המבחן תוך התאמת ציוני בסיס העריכה פער מותאם בין קבוצות של 0.575 רצועות בשבוע 8 (רווח סמך 95% [0.336, 0.814], p = 3.15 × 10−5), ומודל מעורב ספציפי למעריך שכלל אפקט אקראי עבור Rater והשתמש בציונים לא ממוצעים הניב הערכה של זמן קבוצתי × של 0.72 רצועות (רווח סמך 95% [0.33] 1.11], p = .0007), בהתאם לטבלה 3. התוצאות לא השתנו כאשר השתמשו בשגיאות תקן חזקות וכאשר הניתוחים הוגבלו למקרים שלמים, מה שחיזק את המסקנה ש-STEP-DWCF-R מניב רווחים גדולים יותר לפני הפוסט מאשר WCF.
ממצאים איכותיים
לצורך ניתוח איכותני, בחנו את עקבות התיקון של STEP-DWCF-R בכל שש המשימות ואת הרהורים כתובים בסוף הקורס מ-16 המשתתפים בקבוצת STEP-DWCF-R. שני מתכנתים קודדו באופן עצמאי את החומרים באמצעות מסגרת דדוקטיבית ממוקדת המבוססת על ארבע קטגוריות המשוב (דקדוק, אוצר מילים, ארגון, היגיון) ונימוקי קליטה. ההסכמה בין המתקודדים הייתה משמעותית עם קאפה של כהן של 0.78, והמחלוקות נפתרו בדיון.
הניתוח חשף חמישה נושאים מרכזיים: הקליטה עקבה אחרי דפוס מדורג, כאשר הלומדים פותרים מאפייני שטח לפני שהם מתייחסים לארגון ולהיגיון; פריטים ספציפיים לטווח המדיניות, המקושרים לרובריקה, היו יותר ניתנים לפעולה ואומצו לעיתים קרובות מאשר הצעות נרטיביות; השלמה בין בינה מלאכותית למורים עיצבה את העדיפויות, כאשר אותות חופפים מגבירים את המיקוד ומתן המורים פותרים קונפליקטים; היתרונות הגיעו לשיא מוקדם, עם שימוש חוזר בתבניות ארגון ודפוסים לקסיקליים שצוינו בהנחיות חדשות; והלומדים התאימו אסטרטגיות בין משימות. נושאים אלו מעצבים את הדינמיקה של התהליכים שנחקרת בחלק הראיות של התהליך. תועדו גם קליטת משוב, שגיאות מתמשכות ומדדי זמן ביצוע למשימה. סיכום של מדדי התהליך הנוספים מוצג בטבלה 7.
פירוש תוצאות מייצגות
ביחד, נתוני התוצאה והתהליך מצביעים על כך שמסגרת STEP-DWCF-R קשורה לשיפור גדול יותר בכתיבת IELTS מאשר משוב סיבוב אחד מסורתי. התוצאה הראשונית מראה הבדל בין קבוצות של 0.72 תחומים, כאשר קבוצת STEP-DWCF-R השתפרה ב-1.03 רצועות בסך הכל לעומת 0.31 רצועות בקבוצת WCF. יתרון זה היה עקבי בכל ארבעת הממדים האנליטיים, כאשר הניגוד הגדול ביותר בין קוהרנטיות ל-Cohesion היה 0.85 תחומי, מה שמרמז כי משוב מובנה, מקושר לרובריקה, רב-שלבי, תרם במיוחד לפיתוח הארגוני. עדויות לתהליך מצביעות על כך שמעורבות איטרטיבית היא הבסיס ליתרון זה. לומדי STEP-DWCF-R השלימו בממוצע 2.26 סבבי תיקון למשימה, וספירת השגיאות ירדה באופן ליניארי בכ-4.1 שגיאות בכל סבב. לדוגמה, מחזור זרימת עבודה מייצג כלל GPT-5 שיצר משוב JSON מובנה בארבע הקטגוריות, ואחריו פיקוח מורים לביטול חיוביים שגויים והגברת היכולת לפעול, ולאחר מכן העברה דרך ממשק סוכן הבינה המלאכותית הרובוטית לתיקון רב-סבבי של הלומדים. ממצאים אלו תומכים בהיתכנות וביעילות הפוטנציאלית של תהליך עבודה משולב רב-רכיבי, המשלב משוב שנוצר על ידי בינה מלאכותית, פיקוח מורים והעברת סוכני בינה מלאכותית רובוטית איטרטיבית, אך אין לפרש אותם כהוכחה לרכיב יחיד בנפרד. חוסר האיזון במינון של 2–3 סבבים לעומת סבב אחד וגודל המדגם הצנוע של 32 גורמים לכך שהרווחים שנצפו משקפים את ההשפעה המשולבת של הזדמנויות חוזרות מוגברות ומשוב מובנה. תוצאות אלו צריכות להיחשב כראיות פיילוט מבטיחות הממתינות לאישור בניסויים גדולים יותר, מבוקרים על ידי רכיבים.

איור 1. המסגרת התיאורטית של DWCF (משוב תיקוני כתוב דינמי). התרשים מספק נימוק רחב יותר לאופן שבו DWCF עשויה לפעול; הוא נכלל לצורך הכוונה ולא כמודל ישיר של ניסוי זה. האלמנטים התואמים לתוצאות ולמדדי התהליך שנותחו כאן מצוינים באיור; מסלולים אחרים הם ממחישים ולא הוערכו. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

איור 2. דיאגרמת זרימת CONSORT של המשתתפים. שלושים ושניים לומדים הוערכו לזכאות; אף אחד מהם לא הוצא. כל המשתתפים נתנו הסכמה ואז חולקו באקראי ביחס של 1:1 לקבוצת WCF (n = 16) או לקבוצת DWCF (n = 16). כל המשתתפים האקראי קיבלו את ההתערבות שהוקצתה; לא היו אבדות במעקב או בהפסקות, וכל 32 נכללו בניתוח הסופי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

איור 3. ציר זמן ומדדים לבד. הניסוי נמשך 8 שבועות: ב-W1, המשתתפים השלימו את משימת הבסיס של IELTS 2 וקיבלו ציונים; שישה משימות כתיבה שבועיות בוצעו מ-W2 עד W7 (משימה 1–משימה 6), עם משוב ייעודי לקבוצה (WCF או DWCF) ותיקונים לאחר כל משימה. מדדי תהליך, כולל סבבי תיקון, קליטת משוב, שיעור שגיאות מתמשכת וזמן ביצוע משימה, נרשמו עבור כל משימה במהלך W2–W7. ב-W8, בוצעה משימת IELTS 2 לאחר המבחן וקיבלה ציונים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

איור 4. תהליך משוב מקצה לקצה. הלומדים מייצרים טיוטה ראשונית מפוקחת, ואז מקבלים משוב ייעודי לקבוצה: WCF (סבב משוב אנושי אחד) או STEP-DWCF-R (משוב שנוצר על ידי בינה מלאכותית עם פיקוח מורה, המועבר באמצעות סוכני בינה מלאכותית רובוטיים, הכולל 2–3 סבבים איטרטיביים). הלומדים משלימים סבב תיקון בהתאם. התוצאה היא ציון תחום משימת IELTS 2; מדדי תהליך כוללים מספר סבבים, קליטת משוב (מאומצת/שונה/נדחתה), שיעור שגיאה מתמשכת, וזמן ביצוע המשימה. המערכת מתעדת מזהים ברמת פריט, קטגוריה/חומרה, מקור (בינה מלאכותית מול אדם מול רובוט), פעולות מודרציה ומצב קליטה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

איור 5. שינוי ברמת ה-IELTS הכללית משבוע 1 לשבוע 8 לפי קבוצה. הנקודות מציגות את ממוצעי הקבוצה המוערכת עם טווחי ביטחון של 95%, והמסלולים מצביעים על עלייה גדולה יותר תחת STEP-DWCF-R אנא לחצו כאן לצפייה בגרסה גדולה יותר של איור זה.

איור 6. סבבי תיקונים לכל משימה לפי קבוצה (שבועות 2–7). נקודות נתונים מייצגות סבבי תיקון משימות בודדים עבור קבוצות WCF (כחול) ו-STEP-DWCF-R (כתום). קווים אופקיים ופסי שגיאה מציינים ממוצעים קבוצתיים עם טווחי ביטחון של 95%. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

איור 7. ממוצע שגיאות בכל סבב בתוך STEP-DWCF-R עם CI של 95%. נקודות מציינות ממוצע ספירות שגיאות בכל סבב משוב (סבב 1, סיבוב 2, סיבוב 3), וקווים אנכיים מייצגים רווחי ביטחון של 95% (CI). אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
| רכיב | מפרט טכני |
| חומרה | מחשב עם Intel(R) Core(TM) דור 12 i7-12700H (2.30 GHz), 32GB RAM, כרטיס גרפי NVIDIA RTX 3080Ti (16GB) |
| מערכת הפעלה | Windows 11 |
| הצד האחורי | Flask~2.1 (Python~3.10) |
| קצה הלקוח | תבניות שרתי Jinja2 |
| מודלים של בינה מלאכותית | OpenAI GPT-5 API (ליצירת משוב), עיבוד פוסט-מבוסס סכימה |
| מתזמן משוב | בקר מותאם אישית שמנהל משוב רב-שלבי (3 מחזורים) |
| סכמת שגיאות | דקדוק, אוצר מילים, ארגון, היגיון |
| בקרת גרסאות | GitHub |
| כריתת עצים | רישום אוטומטי של הגשות, משוב ותיקונים לניתוח |
טבלה 1: פרמטרי ההגדרה והיישום הניסויים. מפרטים טכניים של מערכת המשוב של AI, כולל תצורת חומרה, מערכת הפעלה, מסגרות backend וfrontend, הגדרות מודלים של AI, מתזמן משוב, קטגוריות סכמת שגיאות, בקרת גרסאות ותשתית רישום.
| משתנה | WCF (n=16) | STEP-DWCF-R (n=16) |
| גיל (שנים), ממוצע (SD) | 20.9 (1.5) | 21.1 (1.6) |
| נקבה, n (%) | 9 (56%) | 8 (50%) |
| הכנה קודמת ל-IELTS (כן), n (%) | 7 (44%) | 6 (38%) |
| שנים של הכשרה קודמת בכתיבה | 3.1 (1.2) | 3.2 (1.1) |
| בסיס: IELTS כללי (להקה) | 5.625 (0.387) | 5.500 (0.365) |
| בייסליין TR (להקה) | 5.56 (0.50) | 5.50 (0.50) |
| Baseline CC (להקה) | 5.62 (0.49) | 5.53 (0.49) |
| Baseline LR (להקה) | 5.60 (0.46) | 5.52 (0.46) |
| Baseline GRA (להקה) | 5.56 (0.48) | 5.49 (0.45) |
טבלה 2: מאפייני בסיס של משתתפים לפי קבוצה (שבוע 1). משתנים דמוגרפיים וביצועי כתיבה לפני מבחן משימת IELTS (IELTS) עבור קבוצות WCF ו-STEP-DWCF-R. הערכים הם ממוצע (סטיית תקן) או n (%).
| אפקט קבוע | הערכה | SE | df | t | p | 95% CI |
| אינטרספט (WCF, שבוע~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| קבוצה (STEP-DWCF-R נגד WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| זמן (שבוע~8 לעומת שבוע~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| זמן × הקבוצה | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
טבלה 3: מודל השפעות מעורבות ליניאריות עבור רחום האיילטס הכולל מהשבוע 1/שבוע 8. הערכות אפקט קבוע, שגיאות תקן (SE), דרגות חופש (df), ערכי t, ערכי p, ורווחי סמך (CI) של 95% עבור אינטראקציה בזמן הקבוצה × ומונחי מודל.
| מימד | WCF Δ (להקות) | STEP-DWCF-R Δ (פסים) | ΔΔ (רווח בר-סמך 95%) | adj-p |
| תגובה למשימה (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| קוהרנטיות ולכידות (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| משאב לקסיקלי (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| טווח דקדוקי ודיוק (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
טבלה 4: תוצאות ברמת הממד (משימה 2): שינויים לפני–פוסט והבדלים בין קבוצות. שינויים טרום-פוסט (Δ) והבדל בהבדלים (ΔΔ) עם רווחי ביטחון של 95% (CIs) וערכי p מותאמים על ידי הולם עבור תגובת משימה (TR), קוהרנטיות וקוהזיה (CC), משאב לקסיקלי (LR) וטווח ודיוק דקדוקי (GRA).
| סף | WCF (%) | STEP-DWCF-R (%) |
| בסך הכל ≥ 6.5 | 13 | 81 |
| בסך הכל ≥ 7.0 | 0 | 25 |
טבלה 5: הישגים לאחר מבחן (שבוע 8). אחוז הלומדים בקבוצות WCF ו-STEP-DWCF-R שמגיעים לסף ציונים כללי של IELTS לפחות 6.5 ולפחות 7.0.
| תוצאה | ICC | 95% CI |
| בסך הכל | 0.91 | [0.86, 0.94] |
| תגובה למשימה (TR) | 0.88 | [0.82, 0.92] |
| קוהרנטיות ולכידות (CC) | 0.9 | [0.85, 0.94] |
| משאב לקסיקלי (LR) | 0.89 | [0.83, 0.93] |
| טווח דקדוקי ודיוק (GRA) | 0.87 | [0.80, 0.91] |
טבלה 6: אמינות בין מעריכים לתוצאות IELTS. שני מעריכים עיוורים על N = 64 חיבורים (שבוע 1 ושבוע 8 יחד). מדדים ממוצעים של מקדמי קורלציה תוך-מחלקה (ICC[2,2]) עם רווחי ביטחון של 95% (CIs) עבור ציוני כולל וממדים.
| מידה | קבוצת WCF | קבוצת STEP-DWCF-R |
| סבבי עריכה לכל משימה | 1 | 2.26 |
| קצב קליטת משוב (מאומץ או שונה, %) | 68.5 | 82.3 |
| שיעור שגיאות מתמשך לאחר הסבב האחרון (%) | 67.4 | 45.6 |
| זמן פיקוח על ידי המורה (מינימום לכל משימה) | 23.5 | 13.8 |
| זמן אספקת סוכני AI (מינימום למשימה) | — | 3.9 |
| זמן תיקון ללומד (מינימום למשימה) | 44.8 | 71.2 |
| סך כל הזמן על משוב + תיקון (מינימום/משימה) | 68.3 | 88.9 |
טבלה 7: ממוצעים על פני 96 משימות (6 משימות × 16 לומדים). שיעורי קליטה ושגיאות מתמשכות חושבו ברמת נקודת המשוב. מדדי זמן נרשמו באמצעות יומני מורים וחותמות זמן של מערכת. זמן המסירה של סוכני AI אינו רלוונטי לקבוצת WCF.
מחקר זה השווה בין STEP-DWCF-R, מסגרת משוב כתוב דינמי רב-רכיבי עם סוכן רובוטי בינה מלאכותית, לבין WCF בסיבוב אחד בקורס כתיבה של שמונה שבועות ב-IELTS. STEP-DWCF-R הניב עליות גדולות יותר לפני הפוסט בתחום הכולל ובין TR, CC, LR ו-GRA. לומדים תחת STEP-DWCF-R גם השלימו יותר סבבי תיקון והראו הפחתת שגיאות מהירה יותר, כאשר מודלים העריכו ירידה של כ-4.1 שגיאות בכל סבב. השיפור הגדול ביותר היה בקוהרנטיות ובלכידות (ΔΔ = 0.85), מה שמעיד שמשוב מובנה ומקושר לרובריקה מקדם ארגון ברמה גבוהה יותר כמו גם דיוק. ממצאים אלו תואמים למחקרים קודמים של DWCF שהראו שמשוב איטרטיבי ומקיף משפר את דיוק הכתיבה לאורך זמן 14,15,16,17.
תהליך העבודה של STEP-DWCF-R כולל שלושה שלבים קריטיים. ראשית, מערכת הבינה המלאכותית מייצרת משוב מפורט בארבע קטגוריות (דקדוק, אוצר מילים, ארגון, היגיון) באמצעות סכמת JSON מוגבלת ופרומפט מערכת סטנדרטי. שנית, המורה ממתן את התוצאה כדי להסיר חיוביים שגויים, להוסיף נושאים קריטיים שהוחמצו בהתאם לקריטריון של IELTS, להבטיח ניסוח מעשי ומעודד, ושומר על עקביות עם הסכמה בת ארבע הקטגוריות. שלב המודרציה הזה משמש כמנגנון מרכזי לפתרון תקלות, מתקן הזיות AI או סימון יתר שעלולים להעמיס על הלומדים. ראוי לציין כי זמן הפיקוח של המורה למשימה היה נמוך יותר ב-STEP-DWCF-R מאשר ב-WCF (13.8 דקות לעומת 23.5 דקות), משום שה-AI יצר את המשוב המובנה הראשוני והמורה רק ממתן אותו. שלישית, המשוב המוסדר מועבר דרך ממשק סוכן ה-AI הרובוטי המבוסס רשת, שמתעד אישורים והגשות חוזרות של הלומד לאורך מספר סבבים.
בהשוואה לגישות הקיימות, STEP-DWCF-R מתמודד עם מגבלות ברורות. ה-WCF הקונבנציונלי בסיבוב יחיד מוגבל על ידי זמן המדריך ומספק בדרך כלל הזדמנות מוגבלת לחזרה מתמשכת. כלי הערכת כתיבה אוטומטיים מציעים יכולת הרחבה אך לעיתים מספקים הערות סטטיות ומקוטעות שהלומדים מתקשים לתרגם לתיקוניםמשמעותיים 20,21,22. מחקרים מוקדמים של DWCF הראו את היעילות של מחזורי משוב מרובי סבבים, אך ההסתמכות שלהם על תיקונים שכתבו על ידי המדריך עוררה חששות לגבי היתכנות בכיתות גדולות 14,15,16,17. מחקרי משוב גנרטיביים עדכניים מדווחים על שוויון עם משוב מורים על תוצאות כתיבה, אך ללא פיקוח מובנה או אספקה איטרטיבית18,19. STEP-DWCF-R משלבת יכולת הרחבה של בינה מלאכותית עם פיקוח מורים והעברת סוכני בינה מלאכותית רובוטית איטרטיבית, ומשיגה עומס עבודה נמוך יותר למורים תוך הגברת תדירות החזרה.
אנו מכירים במספר מגבלות. גודל המדגם הקטן יחסית (N = 32) מגביל את ההכללה של הממצאים שלנו, ויש לראות את המחקר כחקירה פיילוטית. שני התנאים היו שונים במינון המשוב: קבוצת WCF קיבלה רק סבב משוב אחד לכל משימה, בעוד שקבוצת STEP-DWCF-R עברה 2–3 סבבים איטרטיביים. לכן, הביצועים המעולים של קבוצת STEP-DWCF-R משקפים את ההשפעות המשולבות של מחזורי תיקונים מרובים, משוב שנוצר על ידי בינה מלאכותית ומתן מורים, ולא את ההשפעה המבודדת של סוכן הבינה המלאכותית הרובוטית או אופן ההעברה שלו. סוכן הבינה המלאכותית הרובוטית הוא ממשק וירטואלי מבוסס רשת בלבד, ולכן לא ניתן להפריד את השפעותיו מאלו של המבנה האיטרטיבי עצמו. משוב אנושי רב-מודלי (למשל, דיבור בתוספת מחווה) לא נכלל כתנאי ביקורת, משום שאינו נוהג סטנדרטי בכיתות כתיבה מסורתית של אנגלית אנגלית (EFL) וידרוש פרדיגמה ניסויית נפרדת. מחקרים עתידיים צריכים לכלול קבוצות ביקורת מותאמות מינון (למשל, משוב ממורים רב-סבבים) כדי לפרק את המרכיבים הללו.
למרות מגבלות אלו, מסגרת STEP-DWCF-R מציעה כיוונים מעשיים להוראת כתיבה בסיוע בינה מלאכותית. הארכיטקטורה המודולרית שלה מאפשרת אינטגרציה במערכות ניהול למידה עבור קורסי EFL בקנה מידה גדול, והסכמה המובנית בת ארבע הקטגוריות יכולה להיות מותאמת לכתיבה אקדמית או לז'אנרים ספציפיים לתחום. גרסאות עתידיות עשויות לחקור אספקה רב-מודלית כדי לנצל את היתרונות התיאורטיים של מעורבות של סוכנים מגולמים, אם כי הפיילוט הנוכחי קובע את היתכנות שיתוף פעולה איטרטיבי מבוסס טקסט בין AI למורה. עם זאת, הדפוס העקבי בין מדדי תוצאה, מדדי תהליכים ואמינות חזקה בין המעריכים תומכים בהיתכנות וביעילות הפוטנציאלית של גישה רב-רכיבית זו בהקשרים דומים של EFL.
למחברים אין אינטרסים מתחרים.
עבודה זו מומנה על ידי מענק גישור של אוניברסיטת סיינס מלזיה, מספר פרויקט: R501-LR-RND003-0000001342-0000.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| Flask (Web Framework) | Pallets Projects | https://flask.palletsprojects.com | גרסה 2.1; המשמשת לממשק האינטרנט של סוכן AI רובוטי |
| API של GPT-5 | OpenAI | https://platform.openai.com | מודל gpt-5, temperature=0.7; לייצור משוב JSON מובנה |
| Jinja2 | Pallets Projects | https://jinja.palletsprojects.com | תבניות הנענות בשרת עבור ממשק האינטרנט |
| Python | קרן תוכנת Python | https://www.python.org | גרסה 3.10; סקריפטים עבור הבק-אנד |
| Windows 11 | Microsoft | https://www.microsoft.com/windows | מערכת הפעלה למערכת משוב AI |
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה