הוראת תכנון ניסויים
מחקר זה השתמש בגרסת הקוד הפתוח הבסיסית של DeepSeek, תוך הסתמכות על ממשק ה-API הפתוח של הפלטפורמה עבור קריאות התוכנית. המערכה המלאה של חמישה טקסי תבנית להנחיה (prompt), ארבע רמות של רשומות דוגמה למשימות, תגי קטגוריות של הערות העברה וכללי מיפוי להתאמה בין תבניות שגיאות כתיבה נערכו בנספח המשלים. למערכת היו פרמטרי קריאה קבועים: מקדם טמפרטורה של 0.7, ואורך הפלט הוגבל באופן דינמי בהתבסס על סוג שאלת הכתיבה. המערכת פעלה בהקפדה לפי רצף קבוע של שחזור סמנטי > התאמה סגנונית > התאמה תרבותית, תוך ביצוע קריאות של שרשראות הנחיה מקננות. פלט המודל נבחר באופן ידני על ידי המדריך לצורך שימוש בטקסטים אפקטיביים בהוראה בכיתה.
במחקר זה הוזמנו שלושה מרצי כתיבה באנגלית במשרה מלאה ברמה אקדמית, בעלי ניסיון של למעלה מ-5 שנים, להשתתף בדירוג ידני. כל המדרגים עברו הכשרה סטנדרטית לפני הדירוג הרשמי, שכללה היכרות עם ממדי ההערכה, מערכת הניקוד של 5 נקודות, העברה תרבותית, תחביר, שיח ופרטי דירוג נוספים, והם השלימו כיול טרום-דירוג. כל החיבורים של הסטודנטים דורגו באופן עצמאי על ידי שני מרצים במודל דירוג סמיע וכפול (blind, double-blind). אם ההפרש בין ציוני שני המדרגים עלה על נקודה אחת (מתוך 5), מרצה בכיר שלישי פעל כבורר בדירוג, והממוצע של שני הציונים התקפים נקבע כציון הידני הסופי עבור אותה דגימה. שתי קבוצות של מדרגים היו מעורבות בשלב ההערכה למטרות מחקר שונות. שלושה מרצי כתיבה באנגלית במשרה מלאה באוניברסיטה עם ניסיון הוראה של למעלה מ-5 שנים ביצעו דירוג כפול וסמיע של כל דגימות הכתיבה של הסטודנטים בניסוי הפורמלי, ומרצה בכיר שלישי שימש כבורר כאשר פערים בדירוג עלו על נקודה אחת בסולם של 5 נקודות. לעומת זאת, חמישה מדרגים השתתפו במבחן מהימנות בין-שופטים באמצעות מקדם מתאם תוך-מחלקה (ICC), שנערך בנפרד כדי לאמת את העקביות של סטנדרטי ההערכה בין המעריכים. ההבדל במספר המדרגים נובע מדרישות תפקודיות שונות: שלושה מרצים מרכזיים הבטיחו את הדירוג המעשי של נתוני הניסוי, בעוד שפאנל מורחב של חמישה מדרגים סיפק ראיות חסונות יותר למהימנות של מערכת ההערכה כולה.
מורכבות תחבירית, ניקוד מבנה טקסט באמצעות BERT ודמיון סמנטי מדורגים כולם בטווח של 0–5 נקודות. המשקלות עבור כל ממד נקבעו בהתאם לתקני הוראה ומחקר של כתיבה בשפה זרה: תחביר 0.35, מבנה טקסט 0.35, ולוגיקה ותרבות 0.3. ערכי המשקלות התבססו על מערכות הערכה כמותיות מבוססות לכתיבה באותו תחום. מודול הניקוד האוטומטי של ה-AI כויל באמצעות ספים שהתבססו על 15 חיבורי מודל שסווגו מראש. הניקוד האנושי התבצע לפי סולם דירוג מאוחד של חמש נקודות. הניקוד הממוחשב והכיול האנושי שולבו לצורך אימות טרום-ניסויי לפני ההערכה הרשמית.
משימת ההוראה בוצעה סביב שלושה יעדי העברה ברמות שונות של "תחביר-מבנה-תרבות", עם שלושה סבבי אימון, שכל אחד מהם נמשך שבוע אחד. הסבב הראשון כלל שכתוב ברמת המשפט לשיפור הגיוון התחבירי ודיוק הביטוי; הסבב השני כלל בנייה מחדש של המבנה ברמת הפסקה לשיפור ארגון הפסקאות והקוהרנטיות הלוגית; הסבב השלישי כלל העברה ברמה התרבותית לחיזוק המודעות הפרגמטית הבין-תרבותית והסתגלות הביטוי. בהינתן מדידות חוזרות שנאספו מאותם משתתפים במבחן מקדים, בשלושה סבבי אימון עוקבים ובמבחן מסכם, נבחר ניתוח שונות למדידות חוזרות (RM-ANOVA) כגישה הסטטיסטית העיקרית לבחינת ההשפעות המרכזיות של הקבוצה (ניסוית לעומת ביקורת), השפעות מרכזיות של זמן הבדיקה, וכן אפקט האינטראקציה של קבוצה × זמן, אשר שיקף האם השינויים בציונים במהלך האימון היו שונים בין שתי הקבוצות. הנחת הספריות אומתה באמצעות מבחן Mauchly; תיקון Greenhouse–Geisser הוחל במקרה שהנחת הספריות הופרה. מבחני t למדגמים בלתי תלויים נשמרו אך ורק להשוואות זוגיות לאחר מכן (post-hoc) בין הקבוצות בנקודות זמן בודדות, בעוד שמתאם פירסון ו-Cohen’s d שימשו לבדיקת עקביות הניקוד וכימות גודל האפקט, בהתאמה.
כל הניתוחים הסטטיסטיים נקבעו מראש לפני איסוף הנתונים. מבחני t למדגמים בלתי תלויים (Independent-samples t-tests) אומצו כדי להשוות מדדי כתיבה לפני ואחרי ההתערבות בין שתי קבוצות, כאשר השערת האפס הראשית הניחה שאין הבדלים בין-קבוצתיים בביצועי העברת כישורי הכתיבה. ניתוח מתאם פירסון (Pearson correlation analysis) שימש לכימות הקשר הליניארי בין הניקוד האוטומטי של ה-AI לבין הדירוגים הידניים של המורה, וערך Cohen’s d חושב כגודל האפקט הסטנדרטי להשוואות בין-קבוצתיות. סף המובהקות נקבע על α = 0.05 עבור כל בדיקות ההשערות, ורווחי סמך של 95% חושבו לצד כל הסטטיסטיקות של המבחנים. תוכנת SPSS 26.0 שימשה לביצוע כל החישובים הסטטיסטיים. לא היו נתונים חסרים בציוני המבחנים של התלמידים ובמאגרי הנתונים של השאלונים, שכן כל המשתתפים השלימו את האימון המלא בן שלושת הסבבים ואת ההערכות הרלוונטיות; לפיכך, לא נדרש ביצוע השלמה (imputation) או מחיקת מקרים עבור ערכים חסרים.
בניית מערכת מדדי ההערכה
כדי להעריך באופן מקיף את ביצועי הסטודנטים באימון להעברת מיומנויות כתיבה באנגלית, מחקר זה בנה מערכת הערכה רב-ממדית שכיסתה את יעדי ההעברה בשלוש רמות של "תחביר-מבנה-תרבות", שילבה יכולת שפתית, תגובת מודל, משוב הוראתי והכרה עצמית, וקבעה שישה מדדים מרכזיים. ראשית, "מדד העברת הכתיבה" היה מדד הערכה מקיף שכיסה גיוון תחבירי, בהירות מבנית והסתגלות תרבותית, תוך שילוב של ניקוד אוטומטי של המערכת וניקוד ידני של המורה לצורך ניתוח כמותי. "ציון המורכבות התחבירית" עשה שימוש בטכנולוגיית עיבוד שפה טבעית כדי לחלץ מאפיינים כגון אורך משפט ממוצע, מספר רמות קינון של פסוקיות ותדירות השימוש בביטויי פועל, כדי להעריך את העושר והמורכבות של משפטי הסטודנטים. ניתוח "התאמה לסגנון אקדמי" בחן את שיעור השימוש בסביל ואת שיעור אוצר המילים הרשמי, בהתבסס על מודל NLP (עיבוד שפה טבעית), כדי לקבוע האם הטקסט עומד בנורמות הסגנוניות של כתיבה אקדמית באנגלית. בנוסף, המחקר הציג ממד הערכה סובייקטיבי, שאסף משוב על הקבלה והמעשיות של ההצעות שהופקו על ידי המודל באמצעות שאלונים למורים, כדי להעריך את ההשפעה הממשית של הוראה בסיוע בינה מלאכותית. "שינויים בציוני בדיקת המורים" שיקפו את השפעת ההוראה בסיוע בינה מלאכותית על שיפור איכות הכתיבה על ידי השוואת ציוני המורים על חיבורי הסטודנטים לפני ואחרי הניסוי. לבסוף, "הערכה עצמית של הסטודנט על יכולת ההעברה" השתמשה בטבלת קוגניציית העברה כדי להנחות את הסטודנטים להעריך עצמית את שליטתם במבנה, תחביר, תרבות וממדים אחרים, ובכך להגביר את המודעות המטא-קוגניטיבית ויכולות הרפלקסיה שלהם. התיאורים הספציפיים ומקורות הנתונים עבור כל מדד מוצגים בTable 3.
מדדים תחביריים וסגנוניים חושבו באופן אוטומטי באמצעות ניתוח תלויות (dependency parsing) וסיווג מבוסס BERT, כאשר הציונים הנורמליים נעים בין 0 ל-5; הערכה ידנית בוצעה במقياس של 5 נקודות. נוסחאות החישוב למורכבות תחבירית השתמשו בסך מספר המילים חלקי מספר הפסוקיות כמכנה המרכזי. מקור הנתונים הגולמיים: חיבורי כתיבה ממבחני קדם ומבחני סוף של כל 60 הסטודנטים שנרשמו.
תוצאות ניסיוניות וניתוח
כדי להציג באופן אינטואיטיבי את הבדלי הביצועים המקיפים של התלמידים בשלושת ממדי ההעברה הסינטקטית, ההעברה המבנית וההעברה התרבותית, איור 3 השווה את מדד העברת הכתיבה הממוצע של התלמידים בקבוצת הניסוי ובקבוצת הביקורת לפני הניסוי ואחריו: איור 3 הראה את ההבדל בציונים הממוצעים בין קבוצת הניסוי לקבוצת הביקורת בשלושת הממדים של העברה סינטקטית, העברה מבנית והעברה תרבותית. קבוצת הניסוי הראתה שיפור משמעותי ביכולת ההעברה בכל ממד לאחר הניסוי, והמעגל החיצוני של תרשים הרדאר גדול משמעותית מהמעגל הפנימי, מה שמעיד על כך שלשיטת אופטימיזציית ההוראה המבוססת על מודל DeepSeek יש השפעה חיובית בקידום פיתוח יכולת העברת הכתיבה באנגלית של התלמידים. לעומת זאת, מדדי יכולת ההעברה השונים של קבוצת הביקורת נותרו ללא שינוי יחסי לפני הניסוי ואחריו. השיפור הכולל היה מוגבל, מה שמעיד על כך שלשיטות הוראה מסורתיות או לכלים מסייעי AI שלא עברו אופטימיזציה של הוראות המערכת יש תפקיד מוגבל באימון העברה. היה קושי לגרום לגירוי יעיל של פוטנציאל הלמידה של התלמידים בהעברה שפתית רב-ממדית.
מדדי העברת הכתיבה הממוצעים של הקבוצה הניסויית בממדים של העברה תחבירית, העברה מבנית והעברה תרבותית לפני הניסוי היו 3.0, 2.9 ו-2.8, בהתאמה, ואלו עלו ל-4.3, 4.1 ו-4.5 לאחר הניסוי, עם עליות של 1.3, 1.2 ו-1.7, בהתאמה, מה שמעיד על כך שלשיטת ההוראה הייתה השפעת התערבות טובה ברמות העברה שונות. ציוני קבוצת הביקורת לפני הניסוי היו 3.0, 3.0 ו-2.9. לאחר הניסוי, הערכים עלו ל-3.4, 3.3 ו-3.2, בהתאמה, ערכים הנמוכים באופן משמעותי מאלו של הקבוצה הניסויית. ראוי לציין במיוחד כי בממד של העברה תרבותית, הקבוצה הניסויית הראתה את השיפור המשמעותי ביותר, עם עלייה מ-2.8 ל-4.5, כלומר עלייה של 1.7 נקודות, הגבוהה משמעותית מהעלייה של 0.3 נקודות בקבוצת הביקורת. תוצאה זו מצביעה על כך ששיטת ההוראה המוצעת ממלאת תפקיד משמעותי בסיוע לתלמידים לזהות ולהסתגל לנורמות הביטוי התרבותי באנגלית. הדבר בא לידי ביטוי לא רק בהתאמות של צורת השפה, אלא גם בשיפור המודעות הפרגמטית הבין-תרבותית של התלמידים ובעומק הבנתם את הרגלי הביטוי התרבותי של שפת היעד. העברת השפה באה לידי ביטוי בעיקר במורכבות תחבירית, התאמת סגנון השפה והיבטים נוספים. המחקר השתמש בטכנולוגיית NLP אוטומטית כדי לבצע ניתוח מעמיק של טקסטים שנכתבו על ידי התלמידים, חילץ מאפייני שפה מרכזיים, ושילב ציוני מורים כדי להעריך באופן שיטתי שינויים ביכולת העברת השפה של התלמידים לאורך שלושה סבבים של משימות.
מורכבות תחבירית וסגנון לשוני
מבחינת מורכבות תחבירית, המחקר תיעד את אורך המשפט הממוצע ואת מספר רמות קינון הפסוקיות של הטקסט שנוצר על ידי סטודנטים לאחר השלמת משימת הכתיבה הייעודית בכל סבב של משימות. שני מדדים אלו היו נפוצים למדית מורכבות הביטוי השפתי. הם שיקפו ביעילות את רמת ההתפתחות של הסטודנטים במגוון המשפטים וביכולת הארגון המבני, כפי שמוצג ב-איור 4.
במהלך האבולוציה האורכית של המורכבות התחבירית, קבוצת הניסוי הראתה מגמת עלייה ברורה בשלושת סבבי המשימות, מה שמעיד על קידום יעיל של אימון העברה (transfer training) ביכולתם של הסטודנטים לבטא את המבנה הלשוני שלהם. מבחינת אורך משפט ממוצע, קבוצת הניסוי עלתה מ-12.5 מילים במשימה 1 ל-16.1 מילים במשימה 3, עלייה של 3.6 מילים, שהייתה גבוהה משמעותית מהעלייה של קבוצת הביקורת שעמדה על 0.9 מילים בלבד באותה תקופה (מ-12.4 ל-13.3). באופן דומה, מהיבט המורכבות המבנית, שנמדדה לפי מספר שכבות קינון של פסוקיות, קבוצת הניסוי עלתה מ-1.8 שכבות ל-2.7 שכבות, בעוד שקבוצת הביקורת עלתה מ-1.7 ל-1.9 שכבות, עם עלייה איטית יחסית. כדי לוודא אם ההבדל במורכבות התחבירית בין שתי קבוצות הסטודנטים הוא מובהק סטטיסטית, המחקר השתמש במבחני t למדגמים בלתי תלויים כדי לנתח את אורך המשפט הממוצע ואת מספר רמות קינון הפסוקיות בשלושת שלבי המשימה. התוצאות הראו כי קיים הבדל מובהק בין קבוצת הניסוי לקבוצת הביקורת במונחים של אורך משפט ממוצע, t(58) = 4.23, p < 0.001, Cohen’s d = 0.98; כמו כן, היה הבדל מובהק במספר רמות קינון הפסוקיות, t(58) = 3.15, p = 0.002, Cohen’s d = 0.78. השוואה זו הראתה שאימון העברה שיטתי לא רק שיפר את יכולתם של הסטודנטים להבנות משפטים מורכבים, אלא גם חיזק את השליטה שלהם באסטרטגיות ארגון דקדוקיות. בפרט, במהלך השלב השלישי של המשימה, סטודנטים בקבוצת הניסוי הפגינו גמישות רבה יותר בשימוש בפסוקיות רב-שכבתיות ובמבני משפטים מורכבים. הדבר שיקף מעבר בולט בהעברה הלשונית שלהם מרמה "פונקציונלית" לרמה "אסטרטגית" יותר. נתיב האימון המכוון להעברה שיפר באופן רציף את מיומנויות ההעברה התחבירית של הסטודנטים, והתגבר ביעילות על המגבלות של כתיבת משפטים בודדים ועל דפוסי הביטוי הקבועים הנפוצים לעיתים קרובות בהוראה מסורתית. מבחינת התאמת סגנון השפה, המחקר חילץ את טקסטים הכתיבה של הסטודנטים לפני ואחרי הניסוי. נעשה שימוש במודל NLP כדי לקבוע את שיעור אוצר המילים הפורמלי ואת תדירות השימוש בסביל כאינדיקטורים מרכזיים להערכת התאמת סגנון השפה האקדמית. אינדיקטורים אלו שיקפו האם לסטודנטים יש את המודעות הלשונית ואת יכולת הביטוי כדי להסתגל לסגנון היעד בכתיבה באנגלית. התוצאות הרלוונטיות מוצגות באיור 5.
איור 5 מראה את השינויים בהתאמה לסגנון אקדמי של קבוצת הניסוי ושל קבוצת הביקורת לפני ואחרי המטלה, תוך התמקדות בעיקר בשני מדדי הליבה: שיעור אוצר המילים הפורמלי ותדירות השימוש בסביל. באופן כללי, לאחר השלמת אימון העברה המבוסס על מודל DeepSeek, יכולת ההסתגלות לסגנון אקדמי של קבוצת הניסוי השתפרה באופן משמעותי, מה שמעיד על יעילותה של שיטת הוראה זו בטיפוח המודעות של הסטודנטים לנורמות לשוניות ויכולתם להסתגל לסגנונות אקדמיים. בנוגע לשיעור אוצר המילים הפורמלי, בקבוצת הניסוי הוא עלה מ-0.42 לפני המטלה ל-0.56 אחריה, עלייה משמעותית יחסית. לעומת זאת, בקבוצת הביקורת חלה עלייה קלה בלבד, מ-0.43 ל-0.48, מה שמעיד על שיפור מוגבל. תוצאה זו הראתה כי לאחר קבלת הנחיית prompt שיטתית ומשוב מהמודל, הסטודנטים בקבוצת הניסוי נטו יותר להשתמש באוצר מילים פורמלי העומד בדרישות הסגנון האקדמי בתהליך הכתיבה, וסגנונם הלשוני התקרב בהדרגה לסטנדרטים של כתיבה אקדמית באנגלית. מבחינת תדירות השימוש בסביל, בקבוצת הניסוי חלה עלייה משמעותית מ-0.18 לפני המטלה ל-0.27 אחריה, המהווה עלייה של 0.09; לעומת זאת, בקבוצת הביקורת העלייה הייתה של 0.02 בלבד.
על מנת לוודא אם השינויים שלעיל הם מובהקים סטטיסטית, המחקר ביצע מבחן t למדגמים בלתי תלויים על הנתונים לפני המשימה ואחריה. התוצאות הראו כי בקבוצת הניסוי חל שיפור מובהק בשיעור אוצר המילים הפורמלי, t(58) = 3.89, p < 0.001, Cohen's d = 0.92; גם העלייה בתדירות השימוש בסביל הייתה מובהקת, t(58) = 4.56, p < 0.001, Cohen’s d = 1.05. הדבר העיד על כך שהסטודנטים בקבוצת הניסוי השיגו התקדמות משמעותית בהתאמת סגנון השפה, וכי התקדמות זו לא הייתה מקרית, אלא תוצאה של השפעה משולבת של הנחיית פרומפטים שיטתית ומשוב מודל.
אימות סטטיסטי
בנוסף, כדי לאמת עוד יותר את מהימנות התוכן שנוצר על ידי בינה מלאכותית (AI) בפרקטיקה ההוראתית, המחקר השווה גם את ציוני הממוצע של תוכן שנוצר על ידי AI לעומת תוכן שנוצר על ידי מורים תחת סוגי הנחיות (prompts) שונים. העקביות בין השניים הוערכה באמצעות חישוב מקדם המתאם של פירסון. תוצאות ההשוואה הרלוונטיות מוצגות ב טבלה 4. טבלה 4 מראה את העקביות בין התוכן שנוצר על ידי AI לבין ציוני המורים בחמישה סוגים של הנחיות מוכוונות העברה. מנקודת המבט של ציון הממוצע, ציון ה-AI היה נמוך מעט מציון המורה באופן כללי. עם זאת, הפער היה בטווח סביר ברוב סוגי המשימות, מה שמעיד על כך שלמודל DeepSeek יש יציבות גבוהה וערך רפרנסי בהערכת משימות העברה בכתיבה. תחת הנחיית העברה תחבירית, ציון המורה הממוצע היה 4.1 וציון ה-AI היה 4.0, עם הפרש של 0.1 בלבד ביניהם. בהנחיות העברה מבנית ולוגית, ציון ה-AI היה נמוך ב-0.1 נקודות בלבד מציון המורה, מה שמעיד על כך שהמודל יכול לדמות טוב יותר את קריטריוני ההערכה של המורה במשימות אלו, הכוללות רמה גבוהה של מבנה לשוני וכללים ברורים. לעומת זאת, סטיות הניקוד תחת הנחיות העברה תרבותית והעברת מרגש (register) בולטות יחסית, עם ציוני AI של 3.6 ו-3.7 בהתאמה, שהם נמוכים ב-0.2 מציוני המורים, מה שמשקף את העובדה של-AI עדיין היו מגבלות מסוימות בהתמודדות עם משימות בעלות סובייקטיביות גבוהה, כגון משמעויות סמנטיות ופרגמטיקה תרבותית. מהימנות בין מעריכים הוערכה באמצעות ICC (n = 5 מעריכים). ה-ICC הכללי עבור ניקוד ידני היה 0.86, וערכי ה-ICC עבור כל ממד נעו בין 0.82 ל-0.89, מה שמעיד על הסכמה מספקת בין המעריכים.
ניתוח נוסף של מקדם המתאם של פירסון העלה כי העקביות של הציונים תחת הנחיות שונות הייתה ברמה גבוהה, מה שמעיד על כך שציון ה-AI לא רק היה קרוב לשיפוט של המורה מבחינת הערך, אלא גם הפגין קשר ליניארי טוב במגמת הניקוד שלו. מבין אלו, מקדם העקביות של הנחיית ההעברה הסינטקטית היה הגבוה ביותר, 0.87, והנחיות ההעברה המבנית וההעברה הלוגית היו 0.83 ו-0.85, בהתאמה, מה שמעיד על כך שתוצאות ההערכה של ה-AI במונחים של מורכבות סינטקטית, ארגון פסקאות וקוהרנטיות לוגית עקביות מאוד עם שיפוט המורה. ייתכן שזה נובע מכך שלמשימות אלו יש יעדים ברורים ומאפייני שפה מדידים, אשר הקלו על זיהוי המודל ועל שיפוט יציב. מקדם המתאם של הנחיית ההעברה התחומית הוא 0.81. למרות ירידה קלה, הוא עדיין הפגין יכולת הערכה חזקה, מה שמעיד על כך של-AI יש דרגה מסוימת של שיפוט ברמת ההתאמה הסגנונית. עם זאת, מקדם העקביות של הנחיית ההעברה התרבותית היה רק 0.79, נמוך יותר מסוגים אחרים, אך עדיין בטווח מקובל.
על מנת לבחון את ישימותם של סוגים שונים של הנחיות (prompts) בפרקטיקה ההוראתית ואת מידת הקבלה שלהם על ידי מורים, תוכנן שאלון שביעות רצון מתגובות להנחיות. חמישה מורי אנגלית (שסומנו T1–T5) הוזמנו לדרג את הצעות היצירה של חמישה סוגי הנחיות באמצעות סולם של חמש רמות (מ"לא שביעות רצון גבוהה" ועד "שביעות רצון גבוהה מאוד"), כפי שמוצג ב-איור 6: ציוניהם של חמשת המורים על חמשת סוגי ההנחיות משתנים במידה מסוימת, אך באופן כללי רמת ההכרה הייתה גבוהה. מביניהם, ההנחיות ל"העברה תחבירית" (syntactic transfer) ו"העברה תרבותית" (cultural transfer) קיבלו את הציונים הגבוהים ביותר, עם ממוצע של 4.0, מה שמשקף פרקטיקה ויכולת הסתגלות חזקות בהוראה. לעומת זאת, ההנחיה ל"העברת רגיסטר" (register transfer) קיבלה ציונים נמוכים יחסית, עם ממוצע של 2.4 בלבד, וחלק מהמורים, כגון T4 ו-T5, נתנו את הציונים הנמוכים ביותר, מה שמעיד על כך שההכוונה ויכולת ההסתגלות שלה ביישומים הוראתיים עדיין דורשות שיפור.
ברמה האישית, נצפו הבדלים ברורים בנטיית הניקוד של המורים. הניקוד הכולל של T1 היה חיובי, מה שמעיד על דרגה גבוהה של קבלה של כתיבה בסיוע AI, בעוד שהניקודים של T5 היו נמוכים במספר ממדי פרומפט (Prompt), ובמיוחד ב"העברת רגיסטר" (register transfer) ו"העברת לוגיקה" (logic transfer). הבדל זה עשוי להיות קשור לניסיון ההוראה של המורים, להעדפת השפה או לרמת ההיכרות עם כלי AI, דבר המצביע על כך שעיצוב פרומפטים עתידי צריך לשקול מנגנוני התאמה אישיים כדי להגביר את הקבלה בקרב קבוצות מורים שונות. כדי לאמת עוד יותר את ההשפעה הממשית של הוראה בסיוע AI על שיפור איכות הכתיבה של התלמידים, המחקר השווה את השינויים בציונים הכוללים של קבוצת הניסוי וקבוצת הביקורת, כפי שהוערכו על ידי מורים, לפני ואחרי הניסוי. תוצאות ההשוואה מוצגות ב-איור 7.
כפי שמוצג ב-איור 7, הציונים הכוללים של קבוצת הניסוי ושל קבוצת הביקורת, כפי שהוערכו על ידי מורים לפני ואחרי הניסוי, הראו הבדלים משמעותיים. באופן כללי, לאחר התערבות הוראתית לאופטימיזציית ההוראה המבוססת על מודל DeepSeek, הציון הכולל של קבוצת הניסוי הראה מגמת עלייה משמעותית. לעומת זאת, השינוי בציון של קבוצת הביקורת היה מתון יחסית. ציון המורה הממוצע של קבוצת הניסוי לפני הניסוי היה 59.1 נקודות, והציון הממוצע לאחר הניסוי עלה באופן משמעותי ל-74.4 נקודות, המהווה עלייה של 15.3 נקודות. נתון זה מעיד על כך שלהוראה בסיוע בינה מלאכותית (AI) הייתה השפעה חיובית על איכות הכתיבה של התלמידים. מדיאגרמת הקופסה ניתן היה להבחין כי גם טווח ההתפלגות של ציוני קבוצת הניסוי התרחב. בפרט, קופסת הציונים לאחר הניסוי גבוהה משמעותית מזו שלפניו, וערכי המקסימום העליונים והמינימום התחתונים עלו, מה שמעיד על כך שהרמה הכללית של התלמידים השתפרה באופן משמעותי. לעומת זאת, השינויים בציונים של קבוצת הביקורת היו מוגבלים יחסית. לפני הניסוי, הציון הממוצע של קבוצת הביקורת היה 60.1 נקודות, ולאחר הניסוי הוא היה 64.9 נקודות, המהווה עלייה של 4.8 נקודות. עלייה זו הייתה נמוכה בהרבה מזו של קבוצת הניסוי, וקופסת הציונים של קבוצת הביקורת לא השתנתה הרבה לפני ואחרי הניסוי, מה שמעיד על כך שלשיטות הוראה מסורתיות או לכלים מבוססי AI שאינם אופטימליים יש השפעה מוגבלת על שיפור איכות הכתיבה.
בנוסף, מחקר זה השתמש בטבלת קוגניציה של העברה כדי להוביל את הסטודנטים דרך שלושה סבבים של הערכה עצמית על פיתוח יכולותיהם בהתאמה מבנית, טרנספורמציה של משפטים וביטוי תרבותי, בין היתר, כדי לשקף את מגמת השינוי במודעות המטא-קוגניטיבית של הסטודנטים ובשליטתם באסטרטגיות העברה. התוצאות מוצגות ב איור 8. על פי נתוני תרשים הרדאר של ההערכה העצמית של הסטודנטים ביכולת ההעברה המוצגים באיור 8, ההערכה העצמית של הסטודנטים בחמישה ממדים של העברה מבנית, העברה תחבירית, העברה תרבותית, העברת משלב (register) והעברה לוגית בשלושת סבבי המטלות הראתה מגמת עלייה מתמדת, מה שמעיד כי תחת התערבות הוראתית של אופטימיזציה של ההדרכה המבוססת על מודל DeepSeek, יכולתם של הסטודנטים להשתמש באסטרטגיות העברה השתפרה באופן משמעותי. בסבב המטלות הראשון, ציוני ההערכה העצמית של הסטודנטים היו נמוכים באופן כללי. מבין חמשת הממדים, "העברה מבנית" ו"העברה לוגית" קיבלו ציונים של 3.2 ו-3.0, בהתאמה, בעוד ש"העברה תרבותית" ו"העברת משלב" קיבלו ציונים של 2.5 ו-2.7, מה שמעיד על כך שהסטודנטים עדיין לא היו בשלים בזיהוי ובשימוש באסטרטגיות העברה. עד לסבב המטלות השני, הציונים של כל פריט השתפרו, כאשר "העברה מבנית" עלתה ל-3.8, "העברה תחבירית" ל-3.5, ו"העברה לוגית" ל-3.7. דבר זה הראה כי בהנחיית המורים ובסיוע של משוב מהמודל, הסטודנטים השתלטו בהדרגה על נקודות המפתח של פעולות העברה בסיסיות והחילו אותן לראשונה בכתיבה בפועל. בסבב המטלות השלישי, ציוני ההערכה העצמית של הסטודנטים עלו באופן משמעותי, כאשר "העברה מבנית" ו"העברה לוגית" הגיעו ל-4.5 ו-4.3, בהתאמה, ושאר הממדים התייצבו אף הם מעל 4.0 נקודות, מה שמעיד על ההשפעה המתמשכת של מספר סבבים של אימון בהעברה בשיפור השליטה של הסטודנטים בצורה הלשונית וביכולת בניית הטקסט. בשלב זה, הסטודנטים יצרו לולאה קוגניטיבית בסיסית סגורה בין הבנה, ביצוע ורפלקסיה של אסטרטגיות העברה. בנוסף למשוב מהמורים, המחקר הפץ גם שאלון סקר שביעות רצון לגבי פונקציית הכתיבה בסיוע בינה מלאכותית לכל הסטודנטים בקבוצת הניסוי, ונאספו בסך הכל 30 שאלונים תקפים. השאלון העריך את ביצועי הבינה המלאכותית בשלושה מודולים פונקציונליים: הצעות לשכתוב, אופטימיזציה מבנית ורמזים תרבותיים, ודרש מהסטודנטים לבחור אפשרויות בהתאם לחמישה רמות של סטנדרטים. התוצאות מוצגות בטבלה 5.
על פי תוצאות סקר שביעות הרצון של הסטודנטים מפונקציות הכתיבה בסיוע בינה מלאכותית (AI) המוצגות ב-טבלה 5, סטודנטים בקבוצת הניסוי נתנו באופן כללי הערות חיוביות על ביצועי ה-AI בשלושת המודולים הפונקציונליים של הצעות לשכתוב, אופטימיזציה מבנית והנחיות תרבותיות, מה שמעיד על סיכויי יישום טובים של מערכות כתיבה בסיוע AI לשיפור יעילות אימוני הכתיבה ואיכות התמיכה ההוראתית. באופן כללי, יותר מ-90% מהסטודנטים הביעו "שביעות רצון רבה" או "שביעות רצון" בשני הפריטים הפונקציונליים של "הצעות לשכתוב" ו"אופטימיזציה מבנית", כאשר "הצעות לשכתוב" זכתה לרמת השביעות הרצון הגבוהה ביותר, שהגיעה ל-91%, דבר המצביע על כך שהסטודנטים הכירו במידה רבה ביכולת של ה-AI בבנייה תחבירית מחדש ובליטוש שפתי. לשם השוואה, שביעות הרצון מפונקציית "הנחיות תרבותיות" הייתה נמוכה יחסית. עם זאת, היא הגיעה ל-83%, מה שמעיד על כך שלמרות של-AI יש מידה מסוימת של מורכבות וסובייקטיביות בהכוונת ביטויים בין-תרבותיים, תפקידו בסיוע לסטודנטים לזהות ולהתאים הפרעות תרבותיות של שפת האם עדיין זוהה על ידי רוב הסטודנטים. מבחינת חוסר שביעות רצון, אחוז הסטודנטים שבחרו ב"לא מרוצה" או "לא מרוצה כלל" בשלוש הפונקציות היה נמוך מ-5%, מה שמעיד על כך שלפונקציות בסיוע AI הייתה שמישות וקבלה טובה ברוב תרחישי היישום. ראוי לציין כי שיעור הסטודנטים שדירגו "ממוצע" בפריט "הנחיות תרבותיות" היה גבוה יחסית, מה שמרמז כי ה-AI הנוכחי עשוי שלא לענות באופן מלא על ציפיות הסטודנטים בעת התמודדות עם סוגיות של הסתגלות תרבותית, וכי עדיין קיים מקום לשיפור. ניתוח מקיף מגלה כי שיטת אופטימיזציית ההנחיות המבוססת על DeepSeek זכתה להכרה רחבה בקרב הסטודנטים, במיוחד עבור התמיכה בצורה השפתית.
ניתוח שונות למדידות חוזרות (RM-ANOVA)
ניתוח שונות עם מדידות חוזרות בשני גורמים (RM-ANOVA) בוצע כדי לבחון את ההשפעות של הקבוצה (גורם בין-נבדקים: קבוצת ניסוי לעומת קבוצת ביקורת) והזמן (גורם תוך-נבדקים: מבחן מקדים, משימה 1, משימה 2, משימה 3, מבחן מסכם), וכן את האינטראקציה ביניהם, על ביצועי העברת הכתיבה באנגלית של הסטודנטים. מבחן Mauchly העיד על הפרה של הנחת הספריות (p < 0.05), ולכן הוחל תיקון Greenhouse–Geisser כדי להתאים את דרגות החופש עבור השפעות תוך-נבדקים. כל הניתוחים התבססו על n = 30 משתתפים בכל קבוצה. התוצאות מוצגות בטבלה 6:
תוצאות ניתוח השונות (ANOVA) עם מדידות חוזרות ותיקון Greenhouse–Geisser הצביעו על השפעות עיקריות מובהקות של קבוצה, זמן, ואינטראקציית קבוצה × זמן בכל הממדים שנמדדו (p < 0.001). עבור מדד ההעברה הכללי (Overall Transfer Index), נצפתה השפעה מובהקת של קבוצה (F(1,58) = 76.32), לצד השפעה מובהקת של זמן (F(2.14,124.12) = 92.75) ואינטראקציה מובהקת של קבוצה × זמן (F(2.14,124.12) = 68.49), מה שמעיד על כך שהשינויים בביצועי ההעברה הכלליים לאורך זמן היו שונים באופן מובהק בין הקבוצות.
באופן דומה, העברה תחבירית (syntactic transfer) הראתה השפעות מובהקות של קבוצה (F(1,58) = 52.18), זמן (F(2.11,122.38) = 71.26), ואינטראקציה בין קבוצה לזמן (F(2.11,122.38) = 45.73), מה שמעיד על דפוסי התפתחות שונים ביכולת ההעברה התחבירית בין הקבוצות ובנקודות המדידה השונות. עבור העברה מבנית (Structural Transfer), זוהו גם השפעות מובהקות של קבוצה (F(1,58)=48.65), זמן (F(2.09,121.22) = 67.81), ואינטראקציה (F(2.09,121.22) = 41.36), המשקפות שיפורים עקביים עם מסלולי התפתחות התלויים בקבוצה. ראוי לציין כי העברה תרבותית (Cultural Transfer) הפגינה את ההשפעות החזקות ביותר, עם השפעת קבוצה מובהקת (F(1,58) = 81.44), השפעת זמן בולטת (F(2.07,119.96) = 98.52), ואינטראקציה חזקה בין קבוצה לזמן (F(2.07,119.96) = 79.27), מה שמרמז על דפוס הצמיחה המשמעותי והמובחן ביותר בממד זה. באופן כללי, כל המדדים מראים השפעות מובהקות סטטיסטית, מה שמאשר כי להתערבות הייתה השפעה יציבה ומובחנת על התפתחות ההעברה לאורך זמן.
זמינות נתונים:
כל הנתונים שהופקו או נותחו במהלך מחקר זה כלולים במאמר זה. נתוני ההערכה הגולמיים מסופקים ב- טבלה נלווית 1.

איור 1: שלבים לטרנספורמציה של מבנה המשפט. (A) אסטרטגיות לשילוב וחיזוק פעלים לשיפור מבנה המשפט. (B) טרנספורמציות חלופיות של הנושא, הכוללות שם פעולה (gerund), שם פועל (infinitive) ונושאים נומינליים. (C) שימוש בביטויים לא סופיים (non-finite phrases) להגברת הגיוון והתמציתיות של המשפט. (D) דוגמאות לגרסאות סופיות מלוטשות המדגימות סגנון אקדמי משופר וביטוי אנגלי בין-תרבותי. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 2: דיאגרמת עץ של התפתחות משימות. היא מציגה את המבנה הדרגתי של משימות העברה בארבע רמות, החל מרמת המשפט, הפסקה, השיח ועד לרמה התרבותית. אנא לחץ כאן כדי לצפות בגרסה מורחבת של איור זה.

איור 3: השוואה של יכולת העברת הכתיבה לפני ואחרי הניסוי. תרשים הרדאר מציג את ציוני המבחן המקדים והמבחן המסכם של הקבוצה הניסויית וקבוצת הביקורת בממדי העברה תחביריים, מבניים ותרבותיים. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 4: תרשים קווי של מגמת המורכבות התחבירית. מוצגים שינויים באורך המשפט הממוצע ובשכבות קינון של פסוקיות לאורך שלוש משימות אימון. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 5: התאמה לטרמינולוגיה אקדמית. איור זה מציג שינויים בשיעור אוצר המילים הרשמי ובתדירות השימוש בסביל לפני ואחרי ההתערבות. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

איור 6: מפת חום של שביעות רצון מתגובות להנחיות. כאן מסוכמים הדירוגים של חמישה סוגי תבניות הנחיה מהמורים המשתתפים. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 7: תרשים קופסה של שינויים בדירוגי המורים. תרשים הקופסה מדגים את ההתפלגות והשינויים הכוללים בציוני כתיבה שהוערכו על ידי מורים עבור שתי קבוצות לפני ואחרי הניסוי. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 8: תרשים רדאר של יכולת ההעברה כפי שהוערכה על ידי הסטודנטים. התרשים מציג את ציוני ההערכה העצמית של הסטודנטים בחמישה ממדי העברה לאורך שלושה סבבי אימון. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.
| נא להזין את טקסט המקור לתרגום. | תפעול למורה | סוג ההנחיה | תפעול סטודנטים | פלט | קריטריוני הערכה |
| טיוטות הכתיבה המקוריות של סטודנטים (משפטים/פסקאות/חיבורים) | 1. סמן את סוגי ההעברה ואת רמות המשימה
2. התאם את פרמטרי ההנחיה במידת הצורך | הנחיית העברה בודדת / שרשרת הנחיות מקוננת תלת-שלבית | 1. לימוד אסטרטגיות העברה 2. שכתוב טיוטות על בסיס משוב מ-AI 3. השלמת הערכה עצמית | טקסט שעבר עריכה על ידי בינה מלאכותית + טיוטה סופית שעברה עריכה על ידי סטודנט | מורכבות תחבירית, רציונליות מבנית, התאמה תרבותית, קוהרנטיות לוגית, סטנדרטיזציה של מרשם (סולם 0–5) |
טבלה 1: טבלת סיכום זרימת העבודה. טבלה זו מסכמת את זרימת העבודה התפעולית המלאה של ההדרכה להעברת כתיבה באנגלית בסיוע בינה מלאכותית (AI), ומכסה את חומרי הקלט, פעולות המורה והסטודנט, סוגי הפרומפטים, התוצרים הסופיים וקריטריוני ההערכה המתאימים.
| קטגוריית הפרויקט | תוכן עניינים |
| הבנת יעדי המשימה | אנא תאר בקצרה את מטרות ההגירה של סבב משימות הכתיבה הנוכחי, כגון התאמה מבנית, התאמה תרבותית והמרה לשונית. |
| אסטרטגיית ההגירה שנעשה בה שימוש | אנא רשום את אסטרטגיות ההגירה שאימצת (ניתן לבחור מספר אפשרויות): |
| התאמה מבנית |
| טרנספורמציה של משפטים |
| החלפת שפות |
| ביטוי תרבותי |
| חיזוק הקשר הלוגי |
| אחר: _______ |
| כתוב מחדש דוגמאות והוראות | בחרו 1–2 משפטים שנכתבו מחדש, הציגו את הגרסאות לפני ואחרי הכתיבה מחדש, והסבירו את הסיבות לשינויים ואת יעדי ההעברה הרצויים. |
| קשיים וספקות שעלו | תארו את כל האתגרים שנתקלתם בהם במהלך ההגירה או שאלות שהיו לכם לגבי ביטוי ספציפי. |
ציון הערכה עצמית
(מתוך 5 נקודות) | אנא דרג את שכתוב הטקסט שלך בהתבסס על שלושת ההיבטים הבאים: |
| • דיוק ביישום האסטרטגיה (5/) |
| • שטף טבעי של הביטוי (5/) |
| • התאמה תרבותית (/5) |
| מטרות לשיפור הכתיבה בעתיד | תאר בקצרה את יכולת ההעברה (transferability) שתרצה לחזק או למטב בסבב האימונים הבא |
טבלה 2: טבלת קוגניציית העברה. סולם דירוג של 1–5 (1 = ללא שליטה, 5 = שליטה מלאה) אומץ להערכה עצמית של סטודנטים לגבי אסטרטגיות העברת כתיבה.
| שם האינדיקטור | תיאור | מקור נתונים |
| מדד העברת כתיבה (0–5) | מדד כמותי המודד באופן מקיף את יכולת העברת השפה, המכסה שלושה רמות: תחביר, מבנה ותרבות. | דירוג אוטומטי על ידי המערכת + דירוג ידני על ידי מורים |
| מדד מורכבות תחבירית | כולל אורך משפט ממוצע, מספר השכבות של פסוקיות מוטמעות, עושר של ביטויי פועל וכדומה. | ניתוח אוטומטי באמצעות NLP |
| התאמה לסגנון אקדמי | האם הדבר תואם את סטנדרטי הכתיבה האקדמית באנגלית? | שיפוט של מודל עיבוד שפה טבעית |
| שביעות רצון מתגובת הפרומפט | קבלה והערכה מעשית של המלצות שהופקו על ידי מודל בקרב מורים | שאלון למורים |
| שינויים בדירוג של ביקורת מורה | השוואה בין ציוני המורים לפני ואחרי הניסוי כדי לשקף את השיפור באיכות הכתיבה | רישומי דירוג מורים |
| יכולת ההעברה של סטודנטים כפי שהוערכה על ידם | סטודנטים מעריכים עצמית את רמת השליטה שלהם בממדי העברה שונים | מלאו את טופס המודעות להגירה |
טבלה 3: סיכום של מדדי הערכה, תיאורים ומקורות נתונים. טבלה זו מבהירה את ההגדרות, שיטות המדידה ומקורות הנתונים המקוריים עבור כל מדד הערכה מרכזי במחקר זה.
| סוג הנחיה | דירוג ממוצע של מורים | ממוצע ציון בינה מלאכותית | מקדם המתאם של פירסון |
| העברה מבנית | 4 | 3.9 | 0.83 |
| העברה תחבירית | 4.1 | 4 | 0.87 |
| העברה תרבותית | 3.8 | 3.6 | 0.79 |
| העברת רגיסטרים | 3.9 | 3.7 | 0.81 |
| העברה לוגית | 4.2 | 4.1 | 0.85 |
טבלה 4: השוואת העקביות בין תכנים שנוצרו על ידי בינה מלאכותית לבין דירוגי מורים. התוצאות מדגימות את העקביות בין התכנים שנוצרו על ידי בינה מלאכותית לבין דירוגי המורים בסוגי פרומפטים שונים.
| פריטי תפקוד | שביעות רצון גבוהה מאוד | שביעות רצון | באופן כללי | לא מרוצה | לא מרוצה כלל |
| הצעה לשכתוב | 66% | 25% | 7% | 1.50% | 0.50% |
| אופטימיזציה מבנית | 60% | 30% | 7% | 2% | 1% |
| טיפים לתרבית | 55% | 28% | 12% | 3.50% | 1.50% |
טבלה 5: נתוני סקר על שביעות רצון סטודנטים מפונקציות מסייעות מבוססות AI. הנתונים מראים את התפלגות שביעות הרצון של הסטודנטים מפונקציות של שכתוב באמצעות AI, אופטימיזציה מבנית ופרומפטים תרבותיים.
| מדוד | קבוצת F(df) | זמן F(df)GG | קבוצה × זמן F(df)GG | p |
| מדד העברה כולל | 76.32 (1, 58) | 92.75 (2.14, 124.12) | 68.49 (2.14, 124.12) | <0.001 |
| העברה תחבירית | 52.18 (1, 58) | 71.26 (2.11, 122.38) | 45.73 (2.11, 122.38) | <0.001 |
| העברה מבנית | 48.65 (1, 58) | 67.81 (2.09, 121.22) | 41.36 (2.09, 121.22) | <0.001 |
| העברה תרבותית | 81.44 (1, 58) | 98.52 (2.07, 119.96) | 79.27 (2.07, 119.96) | <0.001 |
טבלה 6: סיכום תוצאות ANOVA למדידות חוזרות. הטבלה מציגה את תוצאות ANOVA דו-כיווני למדידות חוזרות עבור ביצועי העברת הכתיבה הכלליים ושלושת תתי-הממדים שלו, כולל השפעות עיקריות של קבוצה, זמן, והאינטראקציה בין קבוצה לזמן. קיצורים: GG = תיקון Greenhouse–Geisser.
טבלה נלווית 1: הערכת נתונים גולמיים. כוללת את הנתונים הגולמיים ששימשו בכל הניתוחים במחקר זה.אנא לחץ כאן להורדת קובץ זה.