מאמר שיטה

מסגרת משוב כתוב מתקן דינמית המשלבת אספקת סוכני בינה מלאכותית לתמיכה במאמרים מובנית ואיטרטיבית

DOI:

10.3791/71992

24 ביולי 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה בוחן את STEP-DWCF-R (תהליך מובנה, מדורג ומונע-ראיות למשוב תיקוני כתוב דינמי עם סוכן רובוטי AI) לשיפור ביצועי כתיבת IELTS באמצעות בינה מלאכותית רב-סבבית ותיקונים בתמיכת מורים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מערכות משוב כתיבה אוטומטיות נפוצות מאוד, אך רובן מספקות הערות סטטיות ומקוטעות שמספקות בסיס מוגבל לעריכה. מחקר זה מעריך את מסגרת STEP-DWCF-R (תהליך מובנה, מדורג ומונע-ראיות למשוב תיקוני כתוב דינמי עם סוכן רובוטי בינה מלאכותית), שבה משוב שנוצר על ידי בינה מלאכותית, המנוהל על ידי מורה, מועבר באמצעות סוכן בינה מלאכותית רובוטי במספר סבבים איטרטיביים במחזור משימה של שבוע. בניסוי קוואזי-ניסיוני בן שמונה שבועות, 32 לומדים EFL חולקו באקראי למשוב תיקוני כתוב מסורתי (סבב אחד לכל משימה) או ל-STEP-DWCF-R. שתי הקבוצות השלימו את חיבורי IELTS Task 2 בשלב הבסיסי ואחרי המבחן, אשר היו אנונימיים, אקראיים וקיבלו דירוגים על ידי שני מעריכים עצמאיים (ICC = 0.86–0.93). מודלים של השפעות מעורבות ליניאריות הראו כי קבוצת STEP-DWCF-R הציגה שיפורים משמעותיים יותר בציון הרצועה הכולל (Δ = 1.03 לעומת 0.31 רצועים) ובכל ארבעת הממדים האנליטיים, כאשר השיפור הגדול ביותר נצפה בקוהרנטיות ובקוהזיה. נתוני התהליך הצביעו על כך שלומדי STEP-DWCF-R השלימו בממוצע 2.26 סבבי תיקון לכל משימה, כאשר מספר השגיאות ירד באופן ליניארי בין סבבים. ממצאים אלו מצביעים על כך שמסגרת STEP-DWCF-R המשולבת, הכוללת משוב שנוצר על ידי בינה מלאכותית, פיקוח מורים והעברת סוכני בינה מלאכותית רובוטית איטרטיבית, קשורה לשיפור גדול יותר בכתיבת IELTS מאשר משוב סיבוב יחיד מסורתי, מה שמצביע על יישומים מעשיים למשוב דינמי משופר ב-AI בהקשרים של EFL.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

משוב תיקוני כתוב (WCF) נשאר מרכזי בפדגוגיית כתיבה בשפה השנייה. הראיות מראות ש-WCF מקיף משפר את דיוק הלומדים לאורך זמן, וכאשר הוא מותאם לפרקטיקה בכיתה, יכול להתקיים לצד גישות ממוקדות האפשריות בהקשרים אותנטיים 1,2,3. מחקרים בכיתה עדכניים מראים שיפורים עמידים בדיוק ושטף מ-WCF מתמשך ומקיף. מחקר על תחום המשוב מזהיר שמורים צריכים למקד את הטפסים באופן אסטרטגי במקום לסמן הכל 4,5,6,7,8,9. במקביל, הערכת כתיבה אוטומטית (AWE) ומשוב תיקוני כתוב אוטומטי (AWCF) גדלו במהירות. הממצאים מעורבים: חלק מהמחקרים מראים שיפורים בהישגי המשימות ובטווח הדקדוק בתוכניות בסגנון AWCF או Criterion, בעוד אחרים אינם מוצאים יתרון משמעותי על פני משוב למורים בלבד או מציינים תיקונים מקומיים ושטחיים. כדי לשקף את ההטרוגניות הזו, אנו בכוונה משלשים בין מספר מחקרי AWCF במקום להסתמך על מקור אחד 10,11,12,13.

אמונות הלומדים לגבי מי נותן משוב גם הן חשובות: עבודה קוואזי-ניסיונית על מקור נתפס מצביעה על כך שביצועים ואמון יכולים להשתנות כאשר משוב זהה מוצג כ"מורה" לעומת "אוטומטי", מה שמדגיש את הצורך לקחת בחשבון את השפעות התפיסה בעיצובים של AWCF14,15. בהרחבת קו זה, מחקרים מתקדמים מציעים שרובוטים חינוכיים, בשל נוכחותם המגולמת, יכולים גם לשמש כספקי משוב, ולהשפיע על מעורבות ואמון הלומד בדרכים ייחודיות16.

קו מחקר משלים, משוב כתוב מתקן דינמי (DWCF), מדגיש מחזורי משוב תכופים, ניתנים לניהול ומקיפים עם קידוד ותיקון מהיר. ראיות ממספר סביבות מצביעות על כך ש-DWCF משפר באופן אמין את הדיוק (עם השפעות תדירות על השטף), אם כי התוצאות עשויות להשתנות לפי מטרות הקורס ואוכלוסיית הלומדים 17,18,19,20. לבסוף, מחקרים מוקדמים על משוב מתווך בינה מלאכותית גנרטיבית מדווחים על שוויון עם משוב מורים על תוצאות כתיבה ותועלת פוטנציאלית כאשר הם משולבים עם הנחיות מטלינגוויסטיות מפורשות, מה שמעודד שילוב קרוב יותר של משוב אנושי ובינה מלאכותית בהקשרים של שפה שנייה21,22.

כדי להתמודד עם אתגרים אלו, אנו מציעים את מסגרת STEP-DWCF-R (תהליך מובנה, מדורג ומבוסס ראיות למשוב תיקוני כתוב דינמי עם סוכן רובוטי AI), מערכת משוב חדשנית רב-שלבית של DWCF שנועדה לספק תמיכה בכתיבה מובנית, איטרטיבית ומבוססת תהליכים. המערכת שלנו מנצלת את הכוח החיזוי והגנרטיבי של מודלים גדולים (LLMs), באמצעות ממשק רובוטי של סוכני בינה מלאכותית וניהול מורים, כדי לחלק סוגיות כתיבה מורכבות לקטגוריות ניתנות לניהול, לספק משוב דרך סבבי אינטראקציה מרובים, ולהעריך את יעילותו באמצעות מדדים מבוססי תוצאות ותהליכים. על ידי הפיכת המשוב לתהליך מובנה ואינטראקטיבי, STEP-DWCF-R מקדם את התמיכה בכתיבה אוטומטית מתיקון שגיאות סטטי למערכת מרתקת, ממוחשפת וממוקדת למידה יותר.

התרומות שלנו מתמקדות בשלושה התקדמות. ראשית, אנו מציעים סכמת ייצוג משוב מובנית שמסווגת שגיאות (למשל, דקדוק, קוהרנטיות) כך שמשוב LLM המבוסס על ידי סוכני בינה מלאכותית רובוטי יהיה גם ניתן לפעולה וגם ניתן לפרשנות פדגוגית. שנית, אנו מציגים תהליך רב-שלבי איטרטיבי שמסדר משוב בין שפה, מבנה והיגיון במספר סבבים כדי להפחית עומס קוגניטיבי ולהעמיק את המעורבות. שלישית, אנו מרחיבים את ההערכה מעבר ל-post-scores לכלול מדדים מוכווני תהליך כמו הפחתת שגיאות ואימוץ משוב, ומציעים תמונה עשירה יותר של השפעת הלמידה. מסגרות WCF מייצגות את הניסיונות הראשונים לשיטתיות משוב מתקן כתוב בטכנולוגיה חינוכית. המערכות הללו, שמקורו בהערכת כתיבה אוטומטית (AWE) וניקוד אוטומטי למאמרים (AES), הדגישו זיהוי טעויות וציון מיומנות13,14. התרומה שלהם טמונה בקנה מידה: אלפי לומדים יכלו לקבל משוב ללא צוואר בקבוק של ציונים אנושיים. עם זאת, מסגרות אלו בדרך כלל סיפקו הערות סטטיות ומקוטעות, כגון בדיקות דקדוק, הצעות לקסיקליות או ציונים כלליים שהלומדים התקשו להפוך לתיקונים משמעותיים 23,24,25,26.

עם הזמן, מחקר WCF התפתח לכלול גישות מתווכות טכנולוגיות נוספות. מערכות חדשות אלו שאפו ללכוד היבטים רחבים יותר של הכתיבה באמצעות שיטות חישוביות13,21. בשנים האחרונות, היקף התרחב עוד יותר עם טכנולוגיות מגולמות, שבהן רובוטים חינוכיים החלו לפעול כספקי משוב בהקשרים של כתיבה או הדרכה. הנוכחות הפיזית שלהם והאפשרויות האינטראקטיביות שלהם מציגות דינמיקות חדשות של אמון, מעורבות ומוטיבציה של הלומדים. ובכל זאת, למרות ההתפתחויות הללו, הגישה הדומיננטית של WCF נותרה ממוקדת תוצאה 8,27: יצירת ציונים או הערות מבודדות באופן חד-פעמי. פדגוגית, כיוון זה אינו תואם את ההערכה המעצבת, שבה המשוב אמור לתמוך בתיקון בין הטיוטות ולתמוך במעורבות מטאקוגניטיבית 16,28,29,30,31. לכן, הגבול המושגי של WCF חושף פער מתמשך: המשוב מועבר, אך אינו מובנה או מסודר כדי להנחות תהליכי למידה.

בתגובה למגבלות אלו, חוקרים החלו לחקור גישות דינמיות יותר למשוב כתיבה. מחקרים מוקדמיים הדגישו את חשיבות מחזורי המשוב האיטרטיביים, שבהם הלומדים מתעדכנים מספר פעמים תחת הנחיות מגוונות17,32. הוצע גם סיווג שגיאות מובנה כדי לשפר את יכולת הפרשנות של המשוב וליישר אותו עם מטרות פדגוגיות33,34. מושג מסגרת DWCF מחזק את הכיוונים הללו על ידי הטמעת שלושה עקרונות עיצוב: סכימות שגיאה מפורשות, אספקה מדורגת ואיטרטיבית, ומדדי הערכה מונחי תהליכים19,35. במקום להציף את התלמידים בכמות גדולה של תיקונים בבת אחת, DWCF מפזרת את תשומת הלב בין שכבות הכתיבה—דיוק שטחי, קוהרנטיות מבנית ועומק טיעוני—לאורך סבביםעוקבים 17,33. ההערכה מתרחבת מעבר לציונים סופיים וכוללת מדדי תהליך כגון שיעורי הפחתת שגיאות, אימוץ משוב ועומק תיקונים 10,19,25. למרות ההבטחה שלו, היישומים המעשיים של DWCF נותרו דלים, ורוב המחקרים לא מצליחים ליישם אותו בקנה מידה גדול, מתווך טכנולוגי, 10,36,37. פער זה מדגיש את הצורך במסגרות שלא רק מעלות תיאוריות לגבי DWCF אלא גם מדגימות את היתכנותה בסביבות חינוכיות אמיתיות. איור 1 מציג את המסגרת התיאורטית הרחבה יותר של DWCF שהוצעה בספרות. התרשים מספק הסבר כללי לאופן שבו משוב מתקן כתוב דינמי עשוי לפעול ברמות שונות, כולל תוצאות מדודות (למשל, דיוק, קוהרנטיות) והן מבנים תיאורטיים אך לא מדודים במחקר הנוכחי (למשל, הפחתת חרדת כתיבה, שטף ומורכבות). הוא נכלל לצורך כיוון תיאורטי ולא כמודל ישיר של ניסוי זה. האלמנטים התואמים לתוצאות ולמדדי התהליך שנותחו כאן מצוינים באיור; מסלולים אחרים משמשים כמהמחיש ולא הוערכו במחקר זה.

הופעתם של מודלים גדולים גדולים ומערכות רב-מודליות מציעה דרך עוצמתית להפעיל את DWCF בהיקף רחב. מודלי שפה גדולים, עם יכולות ה-zero-shot ו-lu-shot שלהם, יכולים לייצר משוב רגיש להקשר ללא הדרכה ממוקדת במשימה21,22. ניסויים אחרונים מציעים את הפוטנציאל שלהם לסגמנטציה מכוונת, עידון מדורג ויצירת הסברים, התואמים באופן הדוק את עקרונות DWCF 13,37,38,39. מחקר משלים בשיתוף פעולה בין אדם לבינה מלאכותית הראה שלולאות איטרטיביות של מעורבות, התאמה ואימוץ סלקטיבי של משוב מבוסס בינה מלאכותית יכולים לשפר הן את איכות הקליטה והן את איכות הגרסה25,30. כאשר תהליכים אלו מתגלמים דרך רובוטים, האינטראקציה יכולה להפוך לרב-מודלית—המשלבת מחווה, קול ונוכחות—מה שעשוי לשפר עוד יותר את תפיסת הלומד והמוטיבציה40.

בהתבסס על אזור ההתפתחות הקרובה (ZPD)41, השערת הקלט42 ותאוריית רכישת המיומנויות43, אנו ממקמים את STEP-DWCF-R כבקר המקשר בין תמיכת הלומד, עיבוד קלט ופיתוח מיומנויות. באופן קונקרטי, פירוט מקושר לפי רובריקה, רשימות מאוחדות בזמן, ומחזורי AI–, אדם ורובוט מרובי סבבים של מורים פועלים בשכבת אינטגרציה שמתווכת תיקון ומניבה את נקודות הקצה הנצפות שנותחו כאן (IELTS Overall ו-TR/CC/LR/GRA; סבבים, קליטה, שגיאות מתמשכות, זמן). מבנים כמו הפחתת חרדת כתיבה הם תיאורטיים אך אינם נמדדים בניסוי זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה אושר על ידי ועדת האתיקה של בית הספר לחינוך יסודי, מכללת חינוך לגיל הרך שאנגראו. כל המשתתפים היו מבוגרים (≥18 שנים) וסיפקו הסכמה מדעת בכתב לפני המחקר.

1. עיצוב מחקר

הערה: בשל המגבלות של כיתת ה-EFL הזמינה (סך ההרשמה N = 32), המשתתפים חולקו באקראי לשתי קבוצות של 16 כל אחת. גודל המדגם הזה, אף שהוא צנוע, נקבע כמספיק לחקירת פיילוט בהתחשב בתכנון הקדם-פוסט בתוך הנבדקים ובגדלי אפקטים גדולים צפויים בהתבסס על מחקרי DWCF קודמים 17,18,19,20.

  1. חלק את המשתתפים לשתי קבוצות (n = 16 כל אחת) באמצעות אקראיות פשוטה. יצר את רצף ההקצאה באמצעות רשימת מספרים אקראית שנוצרה על ידי מחשב. הסתיר את ההקצאה מהמדריך עד להשלמת ההערכה הבסיסית.
  2. ודא ששתי הקבוצות נלמדות על ידי אותו מרצה, תוך שימוש באותם חומרים ושעות מגע זהים.
  3. למסור משוב באמצעות תיקון אנושי ישיר (WCF) או דרך זרימת העבודה STEP-DWCF-R, שבה מוצג משוב בינה מלאכותית ומורים באמצעות סוכן בינה מלאכותית רובוטי.

2. משימות כתיבה

  1. תנהל חיבור בסיסי למשימת IELTS 2 בשבוע 1 בתנאי מבחן (≥250 מילים, 40 דקות).
  2. בצע שישה משימות כתיבה שבועיות (שבועות 2–7). לכל משימה:
    1. ב-WCF, ספק סבב אחד של משוב אנושי על המאמר.
    2. ב-STEP-DWCF-R, יש לייצר משוב מבוסס בינה מלאכותית, לנהל אותו עם מורה אנושי, ולהנחות את סוכן הבינה המלאכותית הרובוטית להציג את המשוב באופן אינטראקטיבי ללומד.
    3. ב-STEP-DWCF-R, חזרו על מחזור המשוב STEP-DWCF-R במשך 2–3 סבבים עד להשלמת התיקון.
  3. הנהל חיבור לאחר מבחן IELTS משימה 2 בשבוע 8 באותם תנאי מבחן. עקבו אחרי אותו לוח שנה של שבוע לכל משימה בשתי הקבוצות. העבירו משוב על סבב 1 בתוך 24 שעות מהגשת הטיוטה ב-STEP-DWCF-R. דרוש מהלומדים לתקן ולהגיש מחדש בתוך 48 שעות. עקבו אחרי אותו לוח זמנים לסבבים הבאים והשלמו את כל המחזורים בתוך חלון השבוע.

3. תהליך עבודה עם משוב

  1. עבדו כל טיוטה של לומד באמצעות ממשק ה-API GPT-5 (מודל = "gpt-5", טמפרטורה = 0.7, max_output_tokens = 2048) כדי לייצר משוב מפורט בארבע קטגוריות קבועות: דקדוק, אוצר מילים, ארגון והסבה. הפקודה המדויקת של המערכת וסכמת הפלט של JSON מסופקות במאגר הקוד הפתוח (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, פונקציה build_prompt() ו-normalize_reasoning()).
  2. למתן את המשוב שנוצר על ידי הבינה המלאכותית לפי הקריטריונים הבאים: הסרת חיוביים שגויות או תגובות לא מדויקות; הוסף נושאים קריטיים שהוחמצו בהתאם לדרישות ה-IELTS; להבטיח שהתגובות יהיו מעשיות ומעודדות; ולשמור על עקביות עם הסכמה בת ארבע הקטגוריות. לוחם החלטות לניהול ידנית.
  3. שמרו את המשוב המוסדר בפורמט JSON והעלינו אותו לממשק סוכן ה-AI הרובוטי (אפליקציית רשת קלה של Flask).
  4. הצג משוב דרך ממשק האינטרנט. הצג טבלאות מובנות לכל קטגוריה (סיכום, בעיות וטיפים לתיאוריה). רשמו אישורי לומד ובקשות הבהרה דרך יומני המערכת. הנחו את הלומדים לתקן ולהגיש מחדש את הטיוטות שלהם. חזור על המחזור עד שלוש פעמים בכל משימה.
  5. אימות ופתרון תקלות.
    1. אמת יצירת משוב מוצלחת על ידי אישור שהפלט תקף ב-JSON, הכולל את כל ארבע הקטגוריות הנדרשות: דקדוק, אוצר מילים, ארגון והיגיון. אשר את השלמת ניהול המורים על ידי הבטחת הוסרת תוצאות חיוביות שגויות, נוספו בעיות חסרות, וקובץ ה-JSON המנוהל נשמר.
    2. העלה את קובץ ה-JSON המוסדר לממשק סוכן ה-AI הרובוטי המבוסס Flask דרך נקודת הקצה של ההעלאה. אשר העלאה מוצלחת דרך הודעת אישור הממשק והזנת יומן מסד הנתונים. רשמו הגשות חוזרות של לומד אוטומטית דרך יומני הגשת טפסים.
    3. עבד פלטים לא תואמים של בינה מלאכותית (למשל, JSON מעוות, קטגוריות חסרות או משוב לא מדויק) באמצעות הפונקציות ensure_json() ו-normalize_reasoning(). חדש את פלט ה-API עם פרמטרים מותאמים לפי הצורך. תקן ידנית את ה-JSON במהלך פיקוח המורים, במידת הצורך, כדי להבטיח שכל ארבע הקטגוריות נמצאות לפני ההעלאה.
      הערה: דוגמאות למשוב גולמי מבוסס בינה מלאכותית, גרסאות מנוהלות על ידי מורים, ופלט הממשק שנמסר זמינות במאגר (נתונים/תיקיות ומחברות/).

4. מדידת תוצאה

  1. הגדר את התוצאה העיקרית כשינוי בציון הכולל של ה-IELTS (שבוע 1 עד שבוע 8).
  2. הגדר תוצאות משניות כשינויים בתגובה למשימה, קוהרנטיות ולקוהזיה, משאב לקסיקלי, וטווח ודיוק דקדוקי.
  3. הקצה שני מעריכים עצמאיים עם ניסיון בניקוד IELTS משימה 2 להעריך את כל החיבורים. הסר שמות ומזהי קבוצות מכל החיבורים. סדר חיבורים אקראי ומערכים עיוורים למשימה קבוצתית ונקודת זמן. השתמש באותו פקודה של משימת IELTS 2 גם לשבוע הראשון וגם לשבוע 8 לאחר המבחן. לפתור מחלוקות דירוג של יותר מ-0.5 תחומים באמצעות דיון עד להשגת הסכמה. הערכת אמינות בין מדדים באמצעות מקדם הקורלציה התוך-קבוצה של מדדים ממוצעים (ICC[2,2]).

5. מדידת תהליך

  1. תעד את מספר סבבי העריכה לכל משימה.
  2. תיעוד קליטת משוב (מאומץ, מותאם, נדחה) על ידי לומדים.
  3. עקבו אחרי שגיאות מתמשכות בין מחזורים.
  4. רשמו את זמן המשוב של המורים, זמן ההגשה על ידי הרובוט, וזמן חזרה על הלומד.

6. ניתוח נתונים

  1. התאמת מודלים של השפעות מעורבות ליניאריות עם אינטראקציה בין קבוצה, זמן וקבוצה × זמן.
  2. החלו מודלים כלליים של השפעות מעורבות למדידות תהליכים.
  3. דווח על גודל אפקט, טווחי סמך של 95%, וערכי p מותאמים.
  4. לבצע בדיקות עמידות עם ANCOVA, מודלים ספציפיים למערכים ו-SEs עמידים.

7. זמינות קוד

כל הקוד, הפקודות, סכימות JSON וקבצי מימוש לדוגמה הנדרשים לשחזור מערכת STEP-DWCF-R זמינים באופן פתוח ב-https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ניסויים וניתוחים

כל 32 הלומדים סיפקו נתוני בסיס. נתוני לאחר המבחן היו זמינים עבור 16 לומדים בכל קבוצה (WCF ו-STEP-DWCF-R; איור 2). ציר הזמן והמדדים של המחקר מוצגים באיור 3, ותהליך המשוב מקצה לקצה מוצג באיור 4. פרמטרי ההגדרה והיישום הניסיוניים של מערכת הבינה המלאכותית שלנו מוצגים בטבלה 1. הניתוחים התקיימו לפי התוכנית שנקבעה מראש עם כוונה לטיפול. תחילה אנו מעריכים שקילות בסיסית (טבלה 2), לאחר מכן מדווחים על התוצאה הראשונית (איור 5 וטבלה 3), ואחריהם תוצאות משניות (טבלה 4) עם בדיקות עמידות ואמינות.

שקילות בסיסית

בבסיס (שבוע 1), הקבוצות היו דומות תיאורית במשתנים מוגדרים מראש, כולל דמוגרפיה וביצועי כתיבת IELTS לפני כל משוב (טבלה 2). ציוני רכיבי IELTS בודדים מוקצים בצעדים של 0.5 רצועים, בעוד שהטבלה מדווחת על ממוצעים קבוצתיים. הממוצעים הכוללים של שבוע 1 (WCF = 5.625, STEP-DWCF-R = 5.500) מחושבים מאותם מערכים ששימשו ליצירת איור 5. איננו מבצעים בדיקות השערה בבסיס; כל אי-איזון שאריתי מטופל על ידי התכנון הקדם-פוסט ומונח זמן הקבוצה × במודל ההשפעות המעורבים, והשוואת פוסט-מבחן מותאמת לבסיס מדווחת בסעיף הפרוטוקול.

תוצאה ראשונית

איור 5 מסכם שינויים לפני הפוסט, בעוד שטבלאות 3 וטבלה 5 מדווחות על הערכות מודל והישגים לאחר המבחן. בהתחלה (שבוע 1), ממוצעי הקבוצה היו 5.625 עבור WCF ו-5.500 עבור STEP-DWCF-R, מה שהניב הפרש קבוצתי לא משמעותי של −0.125 (SE = 0.133, t = − .939, df = 29.90, p = .355, רווח בר-סמך 95% [−0.397, 0.147]). לכן, קו הבסיס בטבלה 3 מעריך את ממוצע שבוע 1 של WCF ב-5.625 עם רווח סמך של 95% [5.419, 5.831] (SE = 0.097, df = 15). משבוע 1 עד שבוע 8, WCF השתפר ב-0.3125 רצועותיה (SE = 0.128, t = 2.44, df = 15, p = 0.028, רווח בר-סמך 95% [0.039, 0.586]; השפעה סטנדרטית בתוך הקבוצה dz = 0.61). STEP-DWCF-R השתפר ב-1.0313 רצועות (SE = 0.140, t = 7.34, df = 15, p = 2.44 × 10−6, רווח בר-סמך 95% [0.732, 1.331]; dz = 1.84). הניגוד הליניארי של השפעות מעורבות באינטראקציה בין קבוצה × זמן — כלומר, ההפרש בהבדלים — היה 0.7188 רצועות (SE = 0.190, t = 3.78, df = 29.75, p = 0.0007, רווח בר-סמך 95% [0.330, 1.107]; טבלה 3), שמציינת עליות גדולות יותר תחת STEP-DWCF-R. לאחר המבחן (שבוע 8), הממוצעים השוליים המוערכים העדיפו את STEP-DWCF-R ב-0.5938 רצועות (מבחן וולש על ממוצע קבוצתי: SE = 0.115, t = 5.16, df = 29.74, p = 1.50 × 10−5, רווח בר-סמך 95% [0.359, 0.829]). בהתאם לכך, טבלת ההישגים (טבלה 5) מראה שבשבוע 8, 13% מלומדים WCF הגיעו ל-≥ כולל 6.5 ו-0% הגיעו ל-≥ 7.0 (ספירות 2/16 ו-0/16), בעוד ש-81% מהלומדים ב-STEP-DWCF-R הגיעו ≥ 6.5 ו-25% הגיעו ≥ 7.0 (ספירות 13/16 ו-4/16). טבלה 3 מדווחת על הערכות האפקט הקבוע המתאימות ואת אי-הוודאות שלהן.

תוצאות ברמת הממד

טבלה 4 מסכמת שינויים לפני הפוסט בארבעת ממדים של משימה 2. תגובת המשימה (TR) הראתה עלייה של Δ = 0.25 תחומים תחת WCF לעומת Δ = 0.95 תחת STEP-DWCF-R, מה שהניב ΔΔ = 0.70 עם רווח בר-סמך 95% [0.28, 1.12] ו-p מותאם על ידי הולם = 0.006. קוהרנטיות וקוהזיה (CC) הציגו את הניגוד הגדול ביותר: WCF Δ = 0.30, STEP-DWCF-R Δ = 1.15, ולכן ΔΔ = 0.85 (רווח בר-סמך 95% [0.44, 1.26], adj-p = 0.002). משאב לקסיקלי (LR) עקב אחרי אותו דפוס עם WCF Δ = 0.35 ו-STEP-DWCF-R Δ = 0.95, מה שנתן ΔΔ = 0.60 (רווח בר-סמך 95% [0.18, 1.02], adj-p = 0.012). טווח ודיוק דקדוקי (GRA) שופרו ב-Δ = 0.25 ב-WCF ו-Δ = 0.97 ב-STEP-DWCF-R; התוצאה ΔΔ = 0.72 נשאה רווח סמך של 95% של [0.31, 1.13] עם adj-p = 0.004. בכל ארבעת הממדים, ניגודי קבוצת×זמן העדיפו את STEP-DWCF-R לאחר התאמת הולם–בונפרוני.

ראיות תהליך

איור 6 ואיור 7 מציגים את תוצאות הליבה של התהליך. בשבועות 2–7, STEP-DWCF-R השלים בממוצע 2.26 סבבי תיקון לכל משימה (רווח ביטחון 95% [2.17, 2.35]; n = 96), בעוד ש-WCF היה 1.00 סבבים לכל המשימות (n = 96). ההפרש הממוצע היה 1.26 סבבים (רווח בר-סמך 95% [1.17, 1.35]); מבחן מאן–וויטני אישר הפרדה בין ההתפלגויות (U = 9216, z = 11.97, p < 10−30). בתוך STEP-DWCF-R, ממוצע מספר השגיאות ירד לפי סבב: 13.78 בסבב 1 (רווח בר-סמך 95% [13.02, 14.54]; n = 96), 8.94 בסבב 2 (רווח בר-סמך 95% [8.42, 9.46]; n = 96), ו-6.16 בסבב 3 (רווח בר-סמך 95% [5.20, 7.12]; n = 25). מגמה ליניארית שהותאמה לתצפיות לכל סבב העריכה ירידה של 4.14 שגיאות לכל סבב (רווח סמך 95% [3.51, 4.78] בעוצמה מוחלטת; עמ' < 10−12). מדדים של קליטת משוב וזמן ביצוע משימה אינם מקודדים באיור 6 ובאיור 7 ולכן מדווחים בטבלה 7.

אמינות ועמידות

ההסכם בין המערכים למאמרים בשבוע 1 ושבוע 8 היה טוב עד מצוין. שני מעריכים מיומנים דירגו את כל התסריטים באופן עצמאי והיו עיוורים לקבוצה ולזמן; באמצעות מדדים ממוצעים של מקדם קורלציה תוך-מחלקה (ICC[2,2]) על ממוצעי המערך, האמינות נעה בין 0.86 ל-0.93 בסך הכל, וארבעת הממדים, וכל מגבלות האמון הנמוכות של 95%, עלו על 0.80 (טבלה 6). בדיקות אבחון למודל ההשפעה המעורב הראשי הצביעו על שאריות נורמליות בקירוב ללא הטרוסדסטיות חומרית, ומודלים שהותאמו לסיכומי תהליכים ברמת המשימה הראו פיזור קרוב לאחד. ניתוחי רגישות שהתבססו על אותו מערך נתונים של שבוע 1/שבוע 8 הניבו מסקנות עקביות: רגרסיה ליניארית שהשוותה קבוצות לאחר המבחן תוך התאמת ציוני בסיס העריכה פער מותאם בין קבוצות של 0.575 רצועות בשבוע 8 (רווח סמך 95% [0.336, 0.814], p = 3.15 × 10−5), ומודל מעורב ספציפי למעריך שכלל אפקט אקראי עבור Rater והשתמש בציונים לא ממוצעים הניב הערכה של זמן קבוצתי × של 0.72 רצועות (רווח סמך 95% [0.33] 1.11], p = .0007), בהתאם לטבלה 3. התוצאות לא השתנו כאשר השתמשו בשגיאות תקן חזקות וכאשר הניתוחים הוגבלו למקרים שלמים, מה שחיזק את המסקנה ש-STEP-DWCF-R מניב רווחים גדולים יותר לפני הפוסט מאשר WCF.

ממצאים איכותיים

לצורך ניתוח איכותני, בחנו את עקבות התיקון של STEP-DWCF-R בכל שש המשימות ואת הרהורים כתובים בסוף הקורס מ-16 המשתתפים בקבוצת STEP-DWCF-R. שני מתכנתים קודדו באופן עצמאי את החומרים באמצעות מסגרת דדוקטיבית ממוקדת המבוססת על ארבע קטגוריות המשוב (דקדוק, אוצר מילים, ארגון, היגיון) ונימוקי קליטה. ההסכמה בין המתקודדים הייתה משמעותית עם קאפה של כהן של 0.78, והמחלוקות נפתרו בדיון.

הניתוח חשף חמישה נושאים מרכזיים: הקליטה עקבה אחרי דפוס מדורג, כאשר הלומדים פותרים מאפייני שטח לפני שהם מתייחסים לארגון ולהיגיון; פריטים ספציפיים לטווח המדיניות, המקושרים לרובריקה, היו יותר ניתנים לפעולה ואומצו לעיתים קרובות מאשר הצעות נרטיביות; השלמה בין בינה מלאכותית למורים עיצבה את העדיפויות, כאשר אותות חופפים מגבירים את המיקוד ומתן המורים פותרים קונפליקטים; היתרונות הגיעו לשיא מוקדם, עם שימוש חוזר בתבניות ארגון ודפוסים לקסיקליים שצוינו בהנחיות חדשות; והלומדים התאימו אסטרטגיות בין משימות. נושאים אלו מעצבים את הדינמיקה של התהליכים שנחקרת בחלק הראיות של התהליך. תועדו גם קליטת משוב, שגיאות מתמשכות ומדדי זמן ביצוע למשימה. סיכום של מדדי התהליך הנוספים מוצג בטבלה 7.

פירוש תוצאות מייצגות

ביחד, נתוני התוצאה והתהליך מצביעים על כך שמסגרת STEP-DWCF-R קשורה לשיפור גדול יותר בכתיבת IELTS מאשר משוב סיבוב אחד מסורתי. התוצאה הראשונית מראה הבדל בין קבוצות של 0.72 תחומים, כאשר קבוצת STEP-DWCF-R השתפרה ב-1.03 רצועות בסך הכל לעומת 0.31 רצועות בקבוצת WCF. יתרון זה היה עקבי בכל ארבעת הממדים האנליטיים, כאשר הניגוד הגדול ביותר בין קוהרנטיות ל-Cohesion היה 0.85 תחומי, מה שמרמז כי משוב מובנה, מקושר לרובריקה, רב-שלבי, תרם במיוחד לפיתוח הארגוני. עדויות לתהליך מצביעות על כך שמעורבות איטרטיבית היא הבסיס ליתרון זה. לומדי STEP-DWCF-R השלימו בממוצע 2.26 סבבי תיקון למשימה, וספירת השגיאות ירדה באופן ליניארי בכ-4.1 שגיאות בכל סבב. לדוגמה, מחזור זרימת עבודה מייצג כלל GPT-5 שיצר משוב JSON מובנה בארבע הקטגוריות, ואחריו פיקוח מורים לביטול חיוביים שגויים והגברת היכולת לפעול, ולאחר מכן העברה דרך ממשק סוכן הבינה המלאכותית הרובוטית לתיקון רב-סבבי של הלומדים. ממצאים אלו תומכים בהיתכנות וביעילות הפוטנציאלית של תהליך עבודה משולב רב-רכיבי, המשלב משוב שנוצר על ידי בינה מלאכותית, פיקוח מורים והעברת סוכני בינה מלאכותית רובוטית איטרטיבית, אך אין לפרש אותם כהוכחה לרכיב יחיד בנפרד. חוסר האיזון במינון של 2–3 סבבים לעומת סבב אחד וגודל המדגם הצנוע של 32 גורמים לכך שהרווחים שנצפו משקפים את ההשפעה המשולבת של הזדמנויות חוזרות מוגברות ומשוב מובנה. תוצאות אלו צריכות להיחשב כראיות פיילוט מבטיחות הממתינות לאישור בניסויים גדולים יותר, מבוקרים על ידי רכיבים.

figure-results-1
איור 1. המסגרת התיאורטית של DWCF (משוב תיקוני כתוב דינמי). התרשים מספק נימוק רחב יותר לאופן שבו DWCF עשויה לפעול; הוא נכלל לצורך הכוונה ולא כמודל ישיר של ניסוי זה. האלמנטים התואמים לתוצאות ולמדדי התהליך שנותחו כאן מצוינים באיור; מסלולים אחרים הם ממחישים ולא הוערכו. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-2
איור 2. דיאגרמת זרימת CONSORT של המשתתפים. שלושים ושניים לומדים הוערכו לזכאות; אף אחד מהם לא הוצא. כל המשתתפים נתנו הסכמה ואז חולקו באקראי ביחס של 1:1 לקבוצת WCF (n = 16) או לקבוצת DWCF (n = 16). כל המשתתפים האקראי קיבלו את ההתערבות שהוקצתה; לא היו אבדות במעקב או בהפסקות, וכל 32 נכללו בניתוח הסופי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-3
איור 3. ציר זמן ומדדים לבד. הניסוי נמשך 8 שבועות: ב-W1, המשתתפים השלימו את משימת הבסיס של IELTS 2 וקיבלו ציונים; שישה משימות כתיבה שבועיות בוצעו מ-W2 עד W7 (משימה 1–משימה 6), עם משוב ייעודי לקבוצה (WCF או DWCF) ותיקונים לאחר כל משימה. מדדי תהליך, כולל סבבי תיקון, קליטת משוב, שיעור שגיאות מתמשכת וזמן ביצוע משימה, נרשמו עבור כל משימה במהלך W2–W7. ב-W8, בוצעה משימת IELTS 2 לאחר המבחן וקיבלה ציונים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-4
איור 4. תהליך משוב מקצה לקצה. הלומדים מייצרים טיוטה ראשונית מפוקחת, ואז מקבלים משוב ייעודי לקבוצה: WCF (סבב משוב אנושי אחד) או STEP-DWCF-R (משוב שנוצר על ידי בינה מלאכותית עם פיקוח מורה, המועבר באמצעות סוכני בינה מלאכותית רובוטיים, הכולל 2–3 סבבים איטרטיביים). הלומדים משלימים סבב תיקון בהתאם. התוצאה היא ציון תחום משימת IELTS 2; מדדי תהליך כוללים מספר סבבים, קליטת משוב (מאומצת/שונה/נדחתה), שיעור שגיאה מתמשכת, וזמן ביצוע המשימה. המערכת מתעדת מזהים ברמת פריט, קטגוריה/חומרה, מקור (בינה מלאכותית מול אדם מול רובוט), פעולות מודרציה ומצב קליטה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-5
איור 5. שינוי ברמת ה-IELTS הכללית משבוע 1 לשבוע 8 לפי קבוצה. הנקודות מציגות את ממוצעי הקבוצה המוערכת עם טווחי ביטחון של 95%, והמסלולים מצביעים על עלייה גדולה יותר תחת STEP-DWCF-R אנא לחצו כאן לצפייה בגרסה גדולה יותר של איור זה.

figure-results-6
איור 6. סבבי תיקונים לכל משימה לפי קבוצה (שבועות 2–7). נקודות נתונים מייצגות סבבי תיקון משימות בודדים עבור קבוצות WCF (כחול) ו-STEP-DWCF-R (כתום). קווים אופקיים ופסי שגיאה מציינים ממוצעים קבוצתיים עם טווחי ביטחון של 95%. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-7
איור 7. ממוצע שגיאות בכל סבב בתוך STEP-DWCF-R עם CI של 95%. נקודות מציינות ממוצע ספירות שגיאות בכל סבב משוב (סבב 1, סיבוב 2, סיבוב 3), וקווים אנכיים מייצגים רווחי ביטחון של 95% (CI). אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

רכיבמפרט טכני
חומרהמחשב עם Intel(R) Core(TM) דור 12 i7-12700H (2.30 GHz), 32GB RAM, כרטיס גרפי NVIDIA RTX 3080Ti (16GB)
מערכת הפעלהWindows 11
הצד האחוריFlask~2.1 (Python~3.10)
קצה הלקוחתבניות שרתי Jinja2
מודלים של בינה מלאכותיתOpenAI GPT-5 API (ליצירת משוב), עיבוד פוסט-מבוסס סכימה
מתזמן משובבקר מותאם אישית שמנהל משוב רב-שלבי (3 מחזורים)
סכמת שגיאותדקדוק, אוצר מילים, ארגון, היגיון
בקרת גרסאותGitHub
כריתת עציםרישום אוטומטי של הגשות, משוב ותיקונים לניתוח

טבלה 1: פרמטרי ההגדרה והיישום הניסויים. מפרטים טכניים של מערכת המשוב של AI, כולל תצורת חומרה, מערכת הפעלה, מסגרות backend וfrontend, הגדרות מודלים של AI, מתזמן משוב, קטגוריות סכמת שגיאות, בקרת גרסאות ותשתית רישום.

משתנהWCF (n=16)STEP-DWCF-R (n=16)
גיל (שנים), ממוצע (SD)20.9 (1.5)21.1 (1.6)
נקבה, n (%)9 (56%)8 (50%)
הכנה קודמת ל-IELTS (כן), n (%)7 (44%)6 (38%)
שנים של הכשרה קודמת בכתיבה3.1 (1.2)3.2 (1.1)
בסיס: IELTS כללי (להקה)5.625 (0.387)5.500 (0.365)
בייסליין TR (להקה)5.56 (0.50)5.50 (0.50)
Baseline CC (להקה)5.62 (0.49)5.53 (0.49)
Baseline LR (להקה)5.60 (0.46)5.52 (0.46)
Baseline GRA (להקה)5.56 (0.48)5.49 (0.45)

טבלה 2: מאפייני בסיס של משתתפים לפי קבוצה (שבוע 1). משתנים דמוגרפיים וביצועי כתיבה לפני מבחן משימת IELTS (IELTS) עבור קבוצות WCF ו-STEP-DWCF-R. הערכים הם ממוצע (סטיית תקן) או n (%).

אפקט קבועהערכהSEdftp95% CI
אינטרספט (WCF, שבוע~1)5.6250.0971558.1<.001[5.419, 5.831]
קבוצה (STEP-DWCF-R נגד WCF)-0.1250.13329.9-0.939.355[-0.397, 0.147]
זמן (שבוע~8 לעומת שבוע~1)0.31250.128152.44.028[0.039, 0.586]
זמן × הקבוצה0.71880.1929.753.78.0007[0.330, 1.107]

טבלה 3: מודל השפעות מעורבות ליניאריות עבור רחום האיילטס הכולל מהשבוע 1/שבוע 8. הערכות אפקט קבוע, שגיאות תקן (SE), דרגות חופש (df), ערכי t, ערכי p, ורווחי סמך (CI) של 95% עבור אינטראקציה בזמן הקבוצה × ומונחי מודל.

מימדWCF Δ (להקות)STEP-DWCF-R Δ (פסים)ΔΔ (רווח בר-סמך 95%)adj-p
תגובה למשימה (TR)0.250.950.70 (0.28, 1.12).006
קוהרנטיות ולכידות (CC)0.31.150.85 (0.44, 1.26).002
משאב לקסיקלי (LR)0.350.950.60 (0.18, 1.02).012
טווח דקדוקי ודיוק (GRA)0.250.970.72 (0.31, 1.13).004

טבלה 4: תוצאות ברמת הממד (משימה 2): שינויים לפני–פוסט והבדלים בין קבוצות. שינויים טרום-פוסט (Δ) והבדל בהבדלים (ΔΔ) עם רווחי ביטחון של 95% (CIs) וערכי p מותאמים על ידי הולם עבור תגובת משימה (TR), קוהרנטיות וקוהזיה (CC), משאב לקסיקלי (LR) וטווח ודיוק דקדוקי (GRA).

סףWCF (%)STEP-DWCF-R (%)
בסך הכל ≥ 6.51381
בסך הכל ≥ 7.0025

טבלה 5: הישגים לאחר מבחן (שבוע 8). אחוז הלומדים בקבוצות WCF ו-STEP-DWCF-R שמגיעים לסף ציונים כללי של IELTS לפחות 6.5 ולפחות 7.0.

תוצאהICC95% CI
בסך הכל0.91[0.86, 0.94]
תגובה למשימה (TR)0.88[0.82, 0.92]
קוהרנטיות ולכידות (CC)0.9[0.85, 0.94]
משאב לקסיקלי (LR)0.89[0.83, 0.93]
טווח דקדוקי ודיוק (GRA)0.87[0.80, 0.91]

טבלה 6: אמינות בין מעריכים לתוצאות IELTS. שני מעריכים עיוורים על N = 64 חיבורים (שבוע 1 ושבוע 8 יחד). מדדים ממוצעים של מקדמי קורלציה תוך-מחלקה (ICC[2,2]) עם רווחי ביטחון של 95% (CIs) עבור ציוני כולל וממדים.

מידהקבוצת WCFקבוצת STEP-DWCF-R
סבבי עריכה לכל משימה12.26
קצב קליטת משוב (מאומץ או שונה, %)68.582.3
שיעור שגיאות מתמשך לאחר הסבב האחרון (%)67.445.6
זמן פיקוח על ידי המורה (מינימום לכל משימה)23.513.8
זמן אספקת סוכני AI (מינימום למשימה)3.9
זמן תיקון ללומד (מינימום למשימה)44.871.2
סך כל הזמן על משוב + תיקון (מינימום/משימה)68.388.9

טבלה 7: ממוצעים על פני 96 משימות (6 משימות × 16 לומדים). שיעורי קליטה ושגיאות מתמשכות חושבו ברמת נקודת המשוב. מדדי זמן נרשמו באמצעות יומני מורים וחותמות זמן של מערכת. זמן המסירה של סוכני AI אינו רלוונטי לקבוצת WCF.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה השווה בין STEP-DWCF-R, מסגרת משוב כתוב דינמי רב-רכיבי עם סוכן רובוטי בינה מלאכותית, לבין WCF בסיבוב אחד בקורס כתיבה של שמונה שבועות ב-IELTS. STEP-DWCF-R הניב עליות גדולות יותר לפני הפוסט בתחום הכולל ובין TR, CC, LR ו-GRA. לומדים תחת STEP-DWCF-R גם השלימו יותר סבבי תיקון והראו הפחתת שגיאות מהירה יותר, כאשר מודלים העריכו ירידה של כ-4.1 שגיאות בכל סבב. השיפור הגדול ביותר היה בקוהרנטיות ובלכידות (ΔΔ = 0.85), מה שמעיד שמשוב מובנה ומקושר לרובריקה מקדם ארגון ברמה גבוהה יותר כמו גם דיוק. ממצאים אלו תואמים למחקרים קודמים של DWCF שהראו שמשוב איטרטיבי ומקיף משפר את דיוק הכתיבה לאורך זמן 14,15,16,17.

תהליך העבודה של STEP-DWCF-R כולל שלושה שלבים קריטיים. ראשית, מערכת הבינה המלאכותית מייצרת משוב מפורט בארבע קטגוריות (דקדוק, אוצר מילים, ארגון, היגיון) באמצעות סכמת JSON מוגבלת ופרומפט מערכת סטנדרטי. שנית, המורה ממתן את התוצאה כדי להסיר חיוביים שגויים, להוסיף נושאים קריטיים שהוחמצו בהתאם לקריטריון של IELTS, להבטיח ניסוח מעשי ומעודד, ושומר על עקביות עם הסכמה בת ארבע הקטגוריות. שלב המודרציה הזה משמש כמנגנון מרכזי לפתרון תקלות, מתקן הזיות AI או סימון יתר שעלולים להעמיס על הלומדים. ראוי לציין כי זמן הפיקוח של המורה למשימה היה נמוך יותר ב-STEP-DWCF-R מאשר ב-WCF (13.8 דקות לעומת 23.5 דקות), משום שה-AI יצר את המשוב המובנה הראשוני והמורה רק ממתן אותו. שלישית, המשוב המוסדר מועבר דרך ממשק סוכן ה-AI הרובוטי המבוסס רשת, שמתעד אישורים והגשות חוזרות של הלומד לאורך מספר סבבים.

בהשוואה לגישות הקיימות, STEP-DWCF-R מתמודד עם מגבלות ברורות. ה-WCF הקונבנציונלי בסיבוב יחיד מוגבל על ידי זמן המדריך ומספק בדרך כלל הזדמנות מוגבלת לחזרה מתמשכת. כלי הערכת כתיבה אוטומטיים מציעים יכולת הרחבה אך לעיתים מספקים הערות סטטיות ומקוטעות שהלומדים מתקשים לתרגם לתיקוניםמשמעותיים 20,21,22. מחקרים מוקדמים של DWCF הראו את היעילות של מחזורי משוב מרובי סבבים, אך ההסתמכות שלהם על תיקונים שכתבו על ידי המדריך עוררה חששות לגבי היתכנות בכיתות גדולות 14,15,16,17. מחקרי משוב גנרטיביים עדכניים מדווחים על שוויון עם משוב מורים על תוצאות כתיבה, אך ללא פיקוח מובנה או אספקה איטרטיבית18,19. STEP-DWCF-R משלבת יכולת הרחבה של בינה מלאכותית עם פיקוח מורים והעברת סוכני בינה מלאכותית רובוטית איטרטיבית, ומשיגה עומס עבודה נמוך יותר למורים תוך הגברת תדירות החזרה.

אנו מכירים במספר מגבלות. גודל המדגם הקטן יחסית (N = 32) מגביל את ההכללה של הממצאים שלנו, ויש לראות את המחקר כחקירה פיילוטית. שני התנאים היו שונים במינון המשוב: קבוצת WCF קיבלה רק סבב משוב אחד לכל משימה, בעוד שקבוצת STEP-DWCF-R עברה 2–3 סבבים איטרטיביים. לכן, הביצועים המעולים של קבוצת STEP-DWCF-R משקפים את ההשפעות המשולבות של מחזורי תיקונים מרובים, משוב שנוצר על ידי בינה מלאכותית ומתן מורים, ולא את ההשפעה המבודדת של סוכן הבינה המלאכותית הרובוטית או אופן ההעברה שלו. סוכן הבינה המלאכותית הרובוטית הוא ממשק וירטואלי מבוסס רשת בלבד, ולכן לא ניתן להפריד את השפעותיו מאלו של המבנה האיטרטיבי עצמו. משוב אנושי רב-מודלי (למשל, דיבור בתוספת מחווה) לא נכלל כתנאי ביקורת, משום שאינו נוהג סטנדרטי בכיתות כתיבה מסורתית של אנגלית אנגלית (EFL) וידרוש פרדיגמה ניסויית נפרדת. מחקרים עתידיים צריכים לכלול קבוצות ביקורת מותאמות מינון (למשל, משוב ממורים רב-סבבים) כדי לפרק את המרכיבים הללו.

למרות מגבלות אלו, מסגרת STEP-DWCF-R מציעה כיוונים מעשיים להוראת כתיבה בסיוע בינה מלאכותית. הארכיטקטורה המודולרית שלה מאפשרת אינטגרציה במערכות ניהול למידה עבור קורסי EFL בקנה מידה גדול, והסכמה המובנית בת ארבע הקטגוריות יכולה להיות מותאמת לכתיבה אקדמית או לז'אנרים ספציפיים לתחום. גרסאות עתידיות עשויות לחקור אספקה רב-מודלית כדי לנצל את היתרונות התיאורטיים של מעורבות של סוכנים מגולמים, אם כי הפיילוט הנוכחי קובע את היתכנות שיתוף פעולה איטרטיבי מבוסס טקסט בין AI למורה. עם זאת, הדפוס העקבי בין מדדי תוצאה, מדדי תהליכים ואמינות חזקה בין המעריכים תומכים בהיתכנות וביעילות הפוטנציאלית של גישה רב-רכיבית זו בהקשרים דומים של EFL.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין אינטרסים מתחרים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עבודה זו מומנה על ידי מענק גישור של אוניברסיטת סיינס מלזיה, מספר פרויקט: R501-LR-RND003-0000001342-0000.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comגרסה 2.1; המשמשת לממשק האינטרנט של סוכן AI רובוטי
API של GPT-5OpenAIhttps://platform.openai.comמודל gpt-5, temperature=0.7; לייצור משוב JSON מובנה
Jinja2Pallets Projectshttps://jinja.palletsprojects.comתבניות הנענות בשרת עבור ממשק האינטרנט
Pythonקרן תוכנת Pythonhttps://www.python.orgגרסה 3.10; סקריפטים עבור הבק-אנד
Windows 11Microsofthttps://www.microsoft.com/windowsמערכת הפעלה למערכת משוב AI

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

EngineeringEnglish writingwritten corrective feedback WCFdynamic written corrective feedback DWCFhuman AI collaborationfeedback uptakemixed effects models

מאמרים קשורים