تدريس تصميم التجارب
استخدمت هذه الدراسة الإصدار الأساسي مفتوح المصدر من DeepSeek، بالاعتماد على واجهة API المفتوحة للمنصة لإجراء استدعاءات البرنامج. وقد جُمعت المجموعة الكاملة المكونة من خمسة نصوص لقوالب التلقين، وأربعة مستويات من مدخلات أمثلة المهام، وعلامات فئات التعليق التوضيحي للنقل، وقواعد مطابقة قوالب أخطاء الكتابة في الملحق التكميلي. كان للنظام معاملات استدعاء ثابتة: معامل درجة حرارة قدره 0.7، مع تحديد طول النص المولد ديناميكيًا بناءً على نوع سؤال الكتابة. واتبع النظام بدقة تسلسلاً ثابتاً من إعادة البناء الدلالي > التعديل الأسلوبي > التكيف الثقافي، من خلال تنفيذ استدعاءات متسلسلة ومتداخلة للتلقين. وقد قام المعلم باختيار مخرجات النموذج يدويًا للحصول على نصوص فعالة للاستخدام في التدريس الصفي.
استعانت هذه الدراسة بثلاثة مدرسين بدوام كامل في كتابة اللغة الإنجليزية على المستوى الجامعي، لديهم خبرة تزيد عن 5 سنوات، للمشاركة في عملية التصحيح اليدوي. تلقى جميع المصححين تدريباً موحداً قبل بدء التصحيح الرسمي، حيث تعرفوا على أبعاد التقييم، ونظام التصحيح المكون من 5 نقاط، والنقل الثقافي، وبنية الجملة، والخطاب، وتفاصيل التصحيح الأخرى، كما أتموا عملية معايرة ما قبل التصحيح. تم تصحيح جميع مقالات الطلاب بشكل مستقل من قبل مدرسين اثنين بنمط تصحيح تعمية مزدوجة. وفي حال تجاوز الفرق بين درجات المصححين نقطة واحدة (من أصل 5 نقاط)، يقوم مدرس ثالث أقدم بالتحكيم في التصحيح، وتُعتمد متوسط الدرجتين الصحيحتين كدرجة يدوية نهائية لتلك العينة. شاركت مجموعتان من المقيمين في مرحلة التقييم لأغراض بحثية مختلفة؛ حيث قام ثلاثة مدرسين بدوام كامل في كتابة اللغة الإنجليزية الجامعية بخبرة تدريس تزيد عن 5 سنوات بإجراء تصحيح تعمية مزدوج لجميع عينات كتابة الطلاب في التجربة الرسمية، وعمل مدرس ثالث أقدم كمحكم عندما تتجاوز الفروقات في التصحيح نقطة واحدة على مقياس الـ 5 نقاط. وفي المقابل، شارك خمسة مقيمين في اختبار الموثوقية بين المقيمين باستخدام معامل الارتباط داخل الفئات (ICC)، والذي أُجري بشكل منفصل للتحقق من اتساق معايير التقييم بين المقيمين. ويعود الاختلاف في عدد المقيمين إلى متطلبات وظيفية متميزة: فقد ضمن المدرسون الثلاثة الأساسيون التصحيح العملي للبيانات التجريبية، بينما وفرت لجنة المقيمين الخمسة الموسعة أدلة أكثر قوة على موثوقية نظام التقييم بأكمله.
يتم تقدير التعقيد النحوي، ودرجة بنية النص باستخدام BERT، والتشابه الدلالي ضمن نطاق يتراوح من 0 إلى 5 نقاط. وقد تم تحديد أوزان كل بُعد وفقاً لمعايير تدريس وأبحاث كتابة اللغات الأجنبية: النحو 0.35، وبنية النص 0.35، والمنطق والثقافة 0.3. واستندت قيم الأوزان إلى أنظمة تقييم كمية ناضجة للكتابة في المجال ذاته. كما تمت معايرة وحدة التصحيح التلقائي بالذكاء الاصطناعي باستخدام عتبات مستمدة من 15 مقالاً نموذجياً مصنفة مسبقاً. أما التصحيح البشري فقد اتبع مقياس تقدير موحد من خمس نقاط. وقد تم دمج التصحيح الآلي والمعايرة البشرية لإجراء تحقق ما قبل التجربة قبل التقييم الرسمي.
نُفذت المهمة التعليمية بناءً على أهداف نقل معرفي ثلاثية المستويات تشمل "البنية النحوية-الهيكل-الثقافة"، وذلك عبر ثلاث جولات من التدريب استغرقت كل منها أسبوعاً واحداً. تضمنت الجولة الأولى إعادة صياغة على مستوى الجملة لتحسين التنوع النحوي ودقة التعبير؛ وشملت الجولة الثانية إعادة بناء هيكلية على مستوى الفقرة لتعزيز تنظيم الفقرات والترابط المنطقي؛ بينما ركزت الجولة الثالثة على النقل على المستوى الثقافي لتعزيز الوعي التداولي عبر الثقافات والقدرة على التكيف في التعبير. ونظراً لجمع قياسات متكررة من نفس المشاركين خلال الاختبار القبلي، وجولات التدريب الثلاث المتتالية، والاختبار البعدي، اعتُمد تحليل التباين للقياسات المتكررة (RM-ANOVA) كمنهج إحصائي أساسي لفحص التأثيرات الرئيسية للمجموعة (التجريبية مقابل الضابطة)، والتأثيرات الرئيسية لوقت الاختبار، بالإضافة إلى تأثير التفاعل بين المجموعة والوقت، والذي يعكس ما إذا كانت التغيرات في الدرجات عبر فترات التدريب قد اختلفت بين المجموعتين. تم التحقق من افتراض الكروية عبر اختبار Mauchly؛ وطُبق تصحيح Greenhouse–Geisser في حال انتهاك شرط الكروية. كما خُصصت اختبارات t للعينات المستقلة فقط للمقارنات الزوجية البعدية بين المجموعات في نقاط زمنية محددة، بينما استُخدم ارتباط Pearson ومعامل Cohen’s d لتقييم اتساق الدرجات وقياس حجم التأثير على التوالي.
تم تحديد جميع التحليلات الإحصائية مسبقاً قبل جمع البيانات. واعتُمِدت اختبارات t للعينات المستقلة لمقارنة مؤشرات الكتابة قبل وبعد التجربة بين مجموعتين، مع افتراض فرضية عدمية أساسية بعدم وجود فروق بين المجموعات في أداء نقل مهارات الكتابة. واستُخدِم تحليل ارتباط بيرسون لقياس الارتباط الخطي بين التصحيح التلقائي المعتمد على الذكاء الاصطناعي وتقييمات المعلمين اليدوية، كما حُسِب معامل Cohen’s d كحجم تأثير معياري للمقارنات بين المجموعات. وحُدِّد عتبة الدلالة عند α = 0.05 لجميع اختبارات الفرضيات، وحُسِبَت فترات ثقة 95% إلى جانب جميع الإحصائيات الاختبارية. واستُخدِم برنامج SPSS 26.0 لإجراء جميع الحسابات الإحصائية. ولم تكن هناك بيانات مفقودة في درجات اختبارات الطلاب ومجموعات بيانات الاستبيانات، حيث أتم جميع المشاركين التدريب الكامل المكون من ثلاث جولات والتقييمات ذات الصلة؛ وبناءً عليه، لم تكن هناك حاجة لإجراء أي تعويض أو حذف للحالات بسبب القيم المفقودة.
بناء نظام مؤشر التقييم
لتقييم أداء الطلاب بشكل شامل في التدريب على نقل مهارات الكتابة باللغة الإنجليزية، صممت هذه الدراسة نظام تقييم متعدد الأبعاد يغطي أهداف النقل على ثلاثة مستويات هي "البنية النحوية-الهيكل-الثقافة"، ودمج القدرة اللغوية، والاستجابة للنموذج، والتغذية الراجعة التدريسية، والإدراك الذاتي، كما وضعت ستة مؤشرات أساسية. أولاً، كان "مؤشر نقل الكتابة" مؤشراً تقييمياً شاملاً يغطي التنوع النحوي، ووضوح الهيكل، والتكيف الثقافي، حيث جمع بين التصحيح التلقائي للنظام والتصحيح اليدوي للمعلم لإجراء التحليل الكمي. واستخدم "درجة التعقيد النحوي" تقنية معالجة اللغات الطبيعية لاستخراج سمات مثل متوسط طول الجملة، وعدد مستويات تداخل الجمل، وتكرار استخدام العبارات الفعلية لتقييم ثراء وتعقيد جمل الطلاب. وفحص تحليل "مطابقة الأسلوب الأكاديمي" نسبة استخدام المبني للمجهول ونسبة المفردات الرسمية، استناداً إلى نموذج NLP (معالجة اللغات الطبيعية)، لتحديد مدى التزام النص بمعايير أسلوب الكتابة الأكاديمية الإنجليزية. بالإضافة إلى ذلك، أدخلت الدراسة بُعداً للتقييم الذاتي، حيث تم جمع ملاحظات حول قبول وعملية الاقتراحات التي يولدها النموذج من خلال استبيانات للمعلمين لتقييم التأثير الفعلي للتدريس المدعوم بالذكاء الاصطناعي. وعكست "التغيرات في درجات مراجعة المعلم" تأثير التدريس المدعوم بالذكاء الاصطناعي على تحسين جودة الكتابة من خلال مقارنة درجات المعلمين لمقالات الطلاب قبل التجربة وبعدها. وأخيراً، استخدم "التقييم الذاتي للطلاب لقدرة النقل" جدول إدراك النقل لتوجيه الطلاب في التقييم الذاتي لإتقانهم للهيكل، والنحو، والثقافة، والأبعاد الأخرى، مما عزز وعيهم بما وراء المعرفة وقدراتهم على التأمل. وتظهر الأوصاف المحددة ومصادر البيانات لكل مؤشر في الجدول 3.
تَمَّ حساب المؤشرات النحوية والأسلوبية تلقائيًا عبر تحليل التبعية والتصنيف القائم على نموذج BERT، حيث تراوحت الدرجات المُطبعة من 0 إلى 5؛ بينما اعتمد التقييم اليدوي مقياسًا مكونًا من 5 نقاط. واستخدمت صيغ حساب التعقيد النحوي إجمالي عدد الكلمات/عدد الجمل كقاسم أساسي. مصدر البيانات الخام: موضوعات الكتابة في الاختبارين القبلي والبعدي لجميع الطلاب الستين المسجلين.
النتائج التجريبية والتحليل
لعرض الفروق الشاملة في أداء الطلاب في الأبعاد الثلاثة المتمثلة في النقل النحوي، والنقل الهيكلي، والنقل الثقافي بشكل بديهي، قارن الشكل 3 متوسط مؤشر نقل الكتابة لدى الطلاب في المجموعة التجريبية والمجموعة الضابطة قبل التجربة وبعدها: أظهر الشكل 3 الفرق في متوسط الدرجات بين المجموعة التجريبية والمجموعة الضابطة في الأبعاد الثلاثة للنقل النحوي، والنقل الهيكلي، والنقل الثقافي. وأظهرت المجموعة التجريبية تحسناً ملحوظاً في قدرة النقل في كل بُعد بعد التجربة، وكانت الدائرة الخارجية للمخطط الراداري أكبر بكثير من الدائرة الداخلية، مما يشير إلى أن طريقة تحسين التعليمات المستندة إلى نموذج DeepSeek لها تأثير إيجابي في تعزيز تطوير قدرة الطلاب على نقل الكتابة باللغة الإنجليزية. وفي المقابل، ظلت مختلف مؤشرات قدرة النقل للمجموعة الضابطة دون تغيير نسبياً قبل التجربة وبعدها، وكان التحسن العام محدوداً، مما يشير إلى أن طرق التدريس التقليدية أو الأدوات المدعومة بالذكاء الاصطناعي التي لم يتم تحسين تعليمات نظامها لها دور محدود في تدريب النقل. لقد كان من الصعب تحفيز إمكانات التعلم لدى الطلاب بشكل فعال في النقل اللغوي متعدد الأبعاد.
كانت متوسطات مؤشرات النقل الكتابي للمجموعة التجريبية في أبعاد النقل النحوي، والنقل البنيوي، والنقل الثقافي قبل التجربة 3.0 و2.9 و2.8 على التوالي، والتي ارتفعت إلى 4.3 و4.1 و4.5 بعد التجربة، بزيادات قدرها 1.3 و1.2 و1.7 على التوالي، مما يشير إلى أن طريقة التدريس كان لها تأثير تدخلي جيد على مستويات النقل المختلفة. أما درجات المجموعة الضابطة قبل التجربة فقد كانت 3.0 و3.0 و2.9، وبعد التجربة ارتفعت القيم إلى 3.4 و3.3 و3.2 على التوالي، وهي أقل بكثير من درجات المجموعة التجريبية. ومن الجدير بالذكر بشكل خاص أنه في بُعد النقل الثقافي، أظهرت المجموعة التجريبية التحسن الأكثر ملحوظاً، حيث ارتفعت من 2.8 إلى 4.5، بزيادة قدرها 1.7 نقطة، وهي أعلى بكثير من زيادة المجموعة الضابطة التي بلغت 0.3 نقطة. وأشارت هذه النتيجة إلى أن طريقة التدريس المقترحة تلعب دوراً هاماً في مساعدة الطلاب على تحديد ومعايير التعبير الثقافي الإنجليزي والتكيف معها. ولم ينعكس ذلك في تعديلات شكل اللغة فحسب، بل انعكس أيضاً في تعزيز الوعي التداولي عبر الثقافات لدى الطلاب وعمق فهمهم لعادات التعبير الثقافي في اللغة الهدف. وقد انعكس النقل اللغوي بشكل أساسي في التعقيد النحوي، والتكيف مع أسلوب اللغة، وجوانب أخرى. واستخدمت الدراسة تقنية NLP المؤتمتة لإجراء تحليل متعمق لنصوص كتابات الطلاب، واستخراج السمات اللغوية الرئيسية، ودمج درجات المعلمين لتقييم التغيرات في قدرة الطلاب على النقل اللغوي بشكل منهجي عبر ثلاث جولات من المهام.
التعقيد النحوي والأسلوب اللغوي
من حيث التعقيد النحوي، سجلت الدراسة متوسط طول الجملة وعدد مستويات تداخل الجمل في النصوص التي أنتجها الطلاب بعد إكمال مهمة الكتابة المحددة في كل جولة من المهام. وقد استُخدم هذان المؤشران على نطاق واسع لقياس تعقيد التعبير اللغوي؛ حيث عكسا بفعالية مستوى تطور الطلاب في تنوع الجمل والقدرة على التنظيم الهيكلي، كما هو موضح في الشكل 4.
في التطور الطولي للتعقيد النحوي، أظهرت المجموعة التجريبية اتجاهاً تصاعدياً واضحاً عبر جولات المهام الثلاث، مما يعكس التعزيز الفعال لتدريب النقل على قدرة الطلاب في التعبير عن بنيتهم اللغوية. ومن منظور متوسط طول الجملة، ارتفعت المجموعة التجريبية من 12.5 كلمة في المهمة 1 إلى 16.1 كلمة في المهمة 3، وهو ما يمثل زيادة قدرها 3.6 كلمة، وكانت هذه الزيادة أعلى بكثير من زيادة المجموعة الضابطة التي بلغت 0.9 كلمة فقط في الفترة نفسها (من 12.4 إلى 13.3). وبالمثل، من منظور بُعد التعقيد البنيوي، والذي تم قياسه بعدد طبقات تداخل الجمل، ارتفعت المجموعة التجريبية من 1.8 طبقة إلى 2.7 طبقة، بينما ارتفعت المجموعة الضابطة من 1.7 إلى 1.9 طبقة، مع زيادة بطيئة نسبياً. وللتحقق بشكل أكبر مما إذا كان الفرق في التعقيد النحوي بين مجموعتي الطلاب ذا دلالة إحصائية، استخدمت الدراسة اختبارات t للعينات المستقلة لتحليل متوسط طول الجملة وعدد مستويات تداخل الجمل في المراحل الثلاث للمهمة. وأظهرت النتائج وجود فرق معنوي بين المجموعة التجريبية والمجموعة الضابطة من حيث متوسط طول الجملة، t(58) = 4.23, p < 0.001, Cohen’s d = 0.98؛ كما كان هناك فرق معنوي في عدد مستويات تداخل الجمل، t(58) = 3.15, p = 0.002, Cohen’s d = 0.78. وأظهرت هذه المقارنة أن تدريب النقل الممنهج لم يحسن قدرة الطلاب على بناء جمل معقدة فحسب، بل عزز أيضاً إتقانهم لاستراتيجيات التنظيم النحوي. وبوجه خاص، خلال المرحلة الثالثة من المهمة، أظهر الطلاب في المجموعة التجريبية مرونة أكبر في استخدام الجمل متعددة الطبقات وبنيات الجمل المعقدة. وقد عكس ذلك تحولاً ملحوظاً في نقلهم اللغوي من المستوى "الوظيفي" إلى مستوى أكثر "استراتيجية". وقد أدى مسار التدريب الموجه نحو النقل إلى تعزيز مهارات النقل النحوي لدى الطلاب باستمرار، مما ساهم في التغلب بفعالية على قيود كتابة الجمل المفردة وأنماط التعبير الثابتة التي غالباً ما تُلاحظ في التدريس التقليدي. وفيما يتعلق بالتكيف مع الأسلوب اللغوي، استخرجت الدراسة نصوص كتابات الطلاب قبل التجربة وبعدها، واستخدمت نموذج NLP لتحديد نسبة المفردات الرسمية وتكرار استخدام صيغة المبني للمجهول كمؤشرات أساسية لتقييم مطابقة أسلوب اللغة الأكاديمية. وعكست هذه المؤشرات ما إذا كان لدى الطلاب الوعي اللغوي والقدرة التعبيرية للتكيف مع الأسلوب المستهدف في الكتابة باللغة الإنجليزية. وتظهر النتائج ذات الصلة في الشكل 5.
يوضح الشكل 5 التغيرات في مطابقة الأسلوب الأكاديمي للمجموعة التجريبية والمجموعة الضابطة قبل المهمة وبعدها، مع التركيز بشكل أساسي على المؤشرين الجوهريين: نسبة المفردات الرسمية وتكرار استخدام صيغة المبني للمجهول. وبشكل عام، تحسنت قدرة المجموعة التجريبية على التكيف مع الأسلوب الأكاديمي بشكل ملحوظ بعد إتمام التدريب التحويلي القائم على نموذج DeepSeek، مما يثبت فعالية هذه الطريقة التدريسية في تنمية وعي الطلاب بالمعايير اللغوية وقدرتهم على التكيف مع الأساليب الأكاديمية. وفيما يتعلق بنسبة المفردات الرسمية، ارتفعت في المجموعة التجريبية من 0.42 قبل المهمة إلى 0.56 بعدها، وهي زيادة ملحوظة نسبيًا. وفي المقابل، زادت المجموعة الضابطة بشكل طفيف فقط، من 0.43 إلى 0.48، مما يشير إلى تحسن محدود. وأظهرت هذه النتيجة أنه بعد تلقي توجيهات منهجية في صياغة الأوامر (prompts) والتغذية الراجعة من النموذج، أصبح طلاب المجموعة التجريبية أكثر ميلًا لاستخدام مفردات رسمية تلبي متطلبات الأسلوب الأكاديمي أثناء عملية الكتابة، واقترب أسلوبهم اللغوي تدريجيًا من معايير الكتابة الأكاديمية باللغة الإنجليزية. أما من حيث تكرار استخدام صيغة المبني للمجهول، فقد ارتفعت في المجموعة التجريبية بشكل ملحوظ من 0.18 قبل المهمة إلى 0.27 بعدها، وهو ما يمثل زيادة قدرها 0.09؛ بينما زادت المجموعة الضابطة بمقدار 0.02 فقط.
للتحقق بشكل أكبر مما إذا كانت التغييرات المذكورة أعلاه ذات دلالة إحصائية، أجرت الدراسة اختبار t للعينات المستقلة على البيانات قبل المهمة وبعدها. وأظهرت النتائج أن المجموعة التجريبية حققت تحسناً ملحوظاً في نسبة المفردات الرسمية، t(58) = 3.89, p < 0.001, Cohen's d = 0.92؛ كما كانت الزيادة في تكرار استخدام صيغة المبني للمجهول ملحوظة أيضاً، t(58) = 4.56, p < 0.001, Cohen’s d = 1.05. وأظهر ذلك أن الطلاب في المجموعة التجريبية قد أحرزوا تقدماً جوهرياً في تكييف الأسلوب اللغوي، وأن هذا التقدم لم يكن عرضياً، بل كان نتيجة للتأثير المشترك للتوجيه المنهجي عبر المطالبات والتغذية الراجعة من النموذج.
التحقق الإحصائي
بالإضافة إلى ذلك، وللمزيد من التحقق من موثوقية المحتوى الذي يتم إنشاؤه بواسطة الذكاء الاصطناعي في الممارسة التدريسية، قارنت الدراسة أيضًا متوسط درجات المحتوى المُنشأ بواسطة الذكاء الاصطناعي والمحتوى المُنشأ بواسطة المعلم تحت أنواع مختلفة من المطالبات. وتم تقييم الاتساق بين الاثنين عن طريق حساب معامل ارتباط بيرسون. وتظهر نتائج المقارنة ذات الصلة في الجدول 4. يوضح الجدول 4 مدى اتساق المحتوى المُنشأ بواسطة الذكاء الاصطناعي مع درجات المعلمين في خمسة أنواع من المطالبات الموجهة نحو النقل. ومن منظور متوسط الدرجات، كانت درجة الذكاء الاصطناعي أقل قليلاً من درجة المعلم بشكل عام. ومع ذلك، كانت الفجوة ضمن نطاق معقول في معظم أنواع المهام، مما يشير إلى أن نموذج DeepSeek يتمتع باستقرار عالٍ وقيمة مرجعية في تقييم مهام نقل الكتابة. وتحت مطالبة النقل النحوي، كان متوسط درجة المعلم 4.1، بينما كانت درجة الذكاء الاصطناعي 4.0، بفارق 0.1 فقط بين الاثنين. وفي مطالبات النقل الهيكلي والمنطقي، كانت درجة الذكاء الاصطناعي أقل بـ 0.1 نقطة فقط من درجة المعلم، مما يشير إلى أن النموذج يمكنه محاكاة معايير تقييم المعلم بشكل أفضل في هذه المهام، التي تتضمن درجة عالية من البنية اللغوية وقواعد واضحة. وفي المقابل، كانت انحرافات تسجيل الدرجات تحت مطالبات النقل الثقافي ونقل السجل اللغوي واضحة نسبيًا، حيث بلغت درجات الذكاء الاصطناعي 3.6 و3.7 على التوالي، وهي أقل بـ 0.2 من درجات المعلمين، مما يعكس أن الذكاء الاصطناعي لا يزال يواجه قيودًا معينة عند التعامل مع المهام ذات الذاتية العالية، مثل الدلالات المعنوية والتداولية الثقافية. تم تقييم الموثوقية بين المقيمين عبر ICC (عدد المقيمين n = 5). وكان إجمالي ICC للتسجيل اليدوي 0.86، وتراوحت قيم ICC لكل بعد من 0.82 إلى 0.89، مما يشير إلى اتفاق مرضٍ بين المقيمين.
وكشف المزيد من تحليل معامل ارتباط بيرسون (Pearson correlation coefficient) أن اتساق الدرجات تحت مختلف المطالبات كان بمستوى عالٍ، مما يشير إلى أن درجة الذكاء الاصطناعي لم تكن قريبة من تقدير المعلم من حيث القيمة فحسب، بل أظهرت أيضاً علاقة خطية جيدة في اتجاه التقييم. ومن بين هذه المطالبات، كان معامل الاتساق لمطالبة النقل النحوي هو الأعلى حيث بلغ 0.87، بينما بلغ لمطالبتي النقل الهيكلي والنقل المنطقي 0.83 و 0.85 على التوالي، مما يشير إلى أن نتائج تقييم الذكاء الاصطناعي من حيث التعقيد النحوي، وتنظيم الفقرات، والتماسك المنطقي تتسق بدرجة كبيرة مع تقدير المعلم. وقد يعود ذلك إلى أن هذه المهام لها أهداف واضحة وسمات لغوية قابلة للقياس، مما سهل عملية التعرف من قبل النموذج وأدى إلى استقرار التقييم. أما معامل الارتباط لمطالبة النقل المجالي فهو 0.81، وبالرغم من انخفاضه قليلاً، إلا أنه لا يزال يظهر قدرة تقييم قوية، مما يشير إلى أن الذكاء الاصطناعي يمتلك درجة معينة من التقدير على مستوى التكيف الأسلوبي. ومع ذلك، كان معامل الاتساق لمطالبة النقل الثقافي 0.79 فقط، وهو أقل من الأنواع الأخرى، ولكنه لا يزال ضمن النطاق المقبول.
لفحص مدى قابلية تطبيق أنواع مختلفة من المطالبات في الممارسة التدريسية ودرجة قبول المعلمين لها، تم تصميم استبيان لمدى الرضا عن استجابة المطالبة. دُعي خمسة معلمين للغة الإنجليزية (مرقمين من T1 إلى T5) لتقييم مقترحات التوليد لخمسة أنواع من المطالبات باستخدام مقياس مكون من خمسة مستويات (من غير راضٍ تماماً إلى راضٍ تماماً)، كما هو موضح في الشكل 6: تباينت درجات المعلمين الخمسة حول أنواع المطالبات الخمسة إلى حد ما، ولكن التقدير العام كان مرتفعاً. ومن بينها، سجلت مطالبات "النقل النحوي" و"النقل الثقافي" أعلى الدرجات بمتوسط 4.0، مما يعكس عملية تطبيقية وقدرة عالية على التكيف في التدريس. وفي المقابل، كانت درجات مطالبة "نقل السجل اللغوي" منخفضة نسبياً، بمتوسط 2.4 فقط، وقد منح بعض المعلمين، مثل T4 وT5، أدنى الدرجات، مما يشير إلى أن توجيهاتها وقابليتها للتكيف في التطبيقات التدريسية لا تزال بحاجة إلى تحسين.
على المستوى الفردي، كانت هناك فروق واضحة في ميول المعلمين نحو وضع الدرجات؛ حيث كانت الدرجة الإجمالية للمعلم T1 إيجابية، مما يشير إلى درجة عالية من قبول الكتابة بمساعدة الذكاء الاصطناعي، بينما كانت درجات المعلم T5 منخفضة في أبعاد متعددة للمطالبات (Prompt)، لا سيما في "نقل السجل اللغوي" و"نقل المنطق". وقد يعود هذا الاختلاف إلى الخبرة التدريسية للمعلمين، أو تفضيلاتهم اللغوية، أو مدى إلمامهم بأدوات الذكاء الاصطناعي، مما يشير إلى أن تصميم المطالبات في المستقبل يحتاج إلى مراعاة آليات تكييف شخصية لتعزيز قبول المجموعات المختلفة من المعلمين. وللتحقق بشكل أكبر من التأثير الفعلي للتدريس بمساعدة الذكاء الاصطناعي في تحسين جودة كتابة الطلاب، قارنت الدراسة التغيرات في الدرجات الإجمالية للمجموعة التجريبية والمجموعة الضابطة، وفقاً لتقييم المعلمين، قبل التجربة وبعدها. وتظهر نتائج المقارنة في الشكل 7.
كما هو موضح في الشكل 7، أظهرت الدرجات الإجمالية للمجموعة التجريبية والمجموعة الضابطة، وفقاً لتقييم المعلمين قبل التجربة وبعدها، فروقاً ذات دلالة إحصائية. وبشكل عام، أظهرت الدرجة الإجمالية للمجموعة التجريبية اتجاهاً تصاعدياً ملحوظاً بعد التدخل التعليمي القائم على تحسين التعليمات المستند إلى نموذج DeepSeek. وفي المقابل، كان التغير في درجات المجموعة الضابطة طفيفاً نسبياً. حيث بلغ متوسط درجة المعلمين للمجموعة التجريبية قبل التجربة 59.1 نقطة، وارتفع المتوسط بعد التجربة بشكل ملحوظ ليصل إلى 74.4 نقطة، وهو ما يمثل زيادة قدرها 15.3 نقطة. ويشير ذلك إلى أن التدريس المدعوم بالذكاء الاصطناعي كان له تأثير إيجابي على جودة كتابة الطلاب. ومن خلال المخطط الصندوقي، لوحظ أيضاً توسع في نطاق توزيع درجات المجموعة التجريبية؛ وبشكل خاص، أصبح الصندوق الخاص بالدرجات بعد التجربة أعلى بكثير مما كان عليه قبلها، كما ارتفعت القيم القصوى العليا والدنيا السفلى، مما يشير إلى تحسن ملحوظ في المستوى العام للطلاب. في المقابل، كانت التغيرات في درجات المجموعة الضابطة محدودة نسبياً، حيث كان متوسط الدرجات قبل التجربة 60.1 نقطة، وأصبح بعد التجربة 64.9 نقطة، وهو ما يمثل زيادة قدرها 4.8 نقطة. وكانت هذه الزيادة أقل بكثير من زيادة المجموعة التجريبية، كما لم يتغير صندوق درجات المجموعة الضابطة كثيراً قبل التجربة وبعدها، مما يشير إلى أن طرق التدريس التقليدية أو أدوات الذكاء الاصطناعي غير المحسنة لها تأثير محدود في تحسين جودة الكتابة.
بالإضافة إلى ذلك، استخدمت هذه الدراسة جدول الإدراك الانتقالي لتوجيه الطلاب من خلال ثلاث جولات من التقييم الذاتي حول تطور قدراتهم في التعديل الهيكلي، وتحويل الجمل، والتعبير الثقافي، من بين مجالات أخرى، وذلك لعكس اتجاه التغير في الوعي الميتا-معرفي للطلاب وإتقانهم لاستراتيجيات النقل. تظهر النتائج في الشكل 8. وفقاً لبيانات المخطط الراداري للتقييم الذاتي للطلاب حول قدرة النقل الموضحة في الشكل 8، أظهر التقييم الذاتي للطلاب في الأبعاد الخمسة للنقل الهيكلي، والنقل النحوي، والنقل الثقافي، ونقل السجل اللغوي، والنقل المنطقي عبر جولات المهام الثلاث اتجاهاً تصاعدياً مستمراً، مما يشير إلى أنه في ظل التدخل التعليمي لتحسين التدريس القائم على نموذج DeepSeek، تحسنت قدرة الطلاب على استخدام استراتيجيات النقل بشكل ملحوظ. في الجولة الأولى من المهام، كانت درجات التقييم الذاتي للطلاب منخفضة بشكل عام؛ فمن بين الأبعاد الخمسة، سجل "النقل الهيكلي" و"النقل المنطقي" 3.2 و3.0 على التوالي، بينما سجل "النقل الثقافي" و"نقل السجل اللغوي" 2.5 و2.7، مما يشير إلى أن الطلاب كانوا لا يزالون غير ناضجين في تحديد واستخدام استراتيجيات النقل. وبحلول الجولة الثانية من المهام، تحسنت درجات كل بند، حيث ارتفع "النقل الهيكلي" إلى 3.8، و"النقل النحوي" إلى 3.5، و"النقل المنطقي" إلى 3.7. وأظهر ذلك أنه بتوجيه المعلمين ودعم ملاحظات النموذج، أتقن الطلاب تدريجياً النقاط الرئيسية لعمليات النقل الأساسية وبدأوا في تطبيقها أولياً في الكتابة الفعلية. وفي الجولة الثالثة من المهام، زادت درجات التقييم الذاتي للطلاب بشكل كبير، حيث وصل "النقل الهيكلي" و"النقل المنطقي" إلى 4.5 و4.3 على التوالي، كما استقرت الأبعاد الأخرى فوق 4.0 نقاط، مما يظهر التأثير المستمر لجولات متعددة من التدريب على النقل في تحسين قدرة الطلاب على التحكم في الشكل اللغوي وبناء النص. في هذه المرحلة، شكل الطلاب حلقة معرفية مغلقة أساسية بين الفهم والتنفيذ والتأمل في استراتيجيات النقل. وبالإضافة إلى ملاحظات المعلمين، وزعت الدراسة أيضاً استبياناً لقياس الرضا حول وظيفة الكتابة بمساعدة الذكاء الاصطناعي على جميع الطلاب في المجموعة التجريبية، وتم جمع ما مجموعه 30 استبياناً صالحاً. وقيم الاستبيان أداء الذكاء الاصطناعي في ثلاث وحدات وظيفية هي: مقترحات إعادة الصياغة، والتحسين الهيكلي، والإرشادات الثقافية، وتطلب من الطلاب اختيار الخيارات وفقاً لخمس مستويات من المعايير. تظهر النتائج في الجدول 5.
وفقاً لنتائج استطلاع رضا الطلاب حول وظائف الكتابة المدعومة بالذكاء الاصطناعي الموضحة في الجدول 5، أبدى الطلاب في المجموعة التجريبية عموماً تعليقات إيجابية حول أداء الذاء الاصطناعي في الوحدات الوظيفية الثلاث: مقترحات إعادة الصياغة، والتحسين الهيكلي، والموجهات الثقافية، مما يظهر آفاق التطبيق الجيدة لأنظمة الكتابة المدعومة بالذكاء الاصطناعي في تحسين كفاءة التدريب على الكتابة وجودة الدعم التعليمي. وبشكل عام، أعرب أكثر من 90% من الطلاب عن كونهم "راضين جداً" أو "راضين" في البندين الوظيفيين "مقترحات إعادة الصياغة" و"التحسين الهيكلي"، حيث سجلت "مقترحات إعادة الصياغة" أعلى نسبة رضا وصلت إلى 91%، مما يشير إلى تقدير الطلاب العالي لقدرة الذكاء الاصطناعي على إعادة البناء النحوي وصقل اللغة. وفي المقابل، كان الرضا عن وظيفة "الموجهات الثقافية" أقل نسبياً، ومع ذلك فقد وصل إلى 83%، مما يشير إلى أنه على الرغم من وجود تعقيد وذاتية معينة في الذكاء الاصطناعي عند توجيه التعبير العابر للثقافات، إلا أن دوره في مساعدة الطلاب على تحديد وتعديل التداخل الثقافي للغة الأم كان محل تقدير من معظم الطلاب. أما فيما يتعلق بعدم الرضا، فقد كانت نسبة الطلاب الذين اختاروا "غير راضٍ" أو "غير راضٍ تماماً" عبر الوظائف الثلاث أقل من 5%، مما يشير إلى أن الوظائف المدعومة بالذكاء الاصطناعي تتمتع بقابلية استخدام وقبول جيدين في معظم سيناريوهات التطبيق. ومن الجدير بالذكر أن نسبة الطلاب الذين قيموا "متوسط" في بند "الموجهات الثقافية" كانت مرتفعة نسبياً، مما يشير إلى أن الذكاء الاصطناعي الحالي قد لا يلبي توقعات الطلاب بشكل كامل عند التعامل مع قضايا التكيف الثقافي، وأنه لا يزال هناك مجال للتحسين. ويكشف التحليل الشامل أن طريقة تحسين التعليمات القائمة على DeepSeek قد نالت اعترافاً واسعاً من الطلاب، لا سيما في دعمها للشكل اللغوي.
تحليل التباين للقياسات المتكررة (RM-ANOVA)
أُجري تحليل تباين للقياسات المتكررة ثنائي الاتجاه (RM-ANOVA) لفحص تأثيرات المجموعة (عامل بين المجموعات: المجموعة التجريبية مقابل المجموعة الضابطة) والوقت (عامل داخل المجموعات: الاختبار القبلي، المهمة 1، المهمة 2، المهمة 3، الاختبار البعدي)، بالإضافة إلى التفاعل بينهما على أداء الطلاب في نقل مهارات الكتابة باللغة الإنجليزية. وأشار اختبار ماوكلي (Mauchly’s test) إلى انتهاك فرضية الكروية (p < 0.05)، لذا تم تطبيق تصحيح غرين هاوس-جايسر (Greenhouse–Geisser) لضبط درجات الحرية للتأثيرات داخل المجموعات. استندت جميع التحليلات إلى n = 30 مشاركاً في كل مجموعة. وتظهر النتائج في الجدول 6:
أشارت نتائج تحليل التباين للقياسات المتكررة (ANOVA) مع تصحيح Greenhouse–Geisser إلى وجود تأثيرات رئيسية ذات دلالة إحصائية للمجموعة، والزمن، والتفاعل بين المجموعة والزمن عبر جميع الأبعاد المقاسة (p < 0.001). وبالنسبة لمؤشر النقل الإجمالي، لوحظ تأثير معنوي للمجموعة (F(1,58) = 76.32)، إلى جانب تأثير معنوي للزمن (F(2.14,124.12) = 92.75) وتفاعل معنوي بين المجموعة والزمن (F(2.14,124.12) = 68.49)، مما يشير إلى أن التغيرات في أداء النقل الإجمالي بمرور الوقت اختلفت بشكل كبير بين المجموعات.
وبالمثل، أظهر النقل النحوي تأثيرات معنوية للمجموعة (F(1,58) = 52.18)، والزمن (F(2.11,122.38) = 71.26)، والتفاعل بين المجموعة والزمن (F(2.11,122.38) = 45.73)، مما يشير إلى وجود أنماط تطور متباينة في قدرة النقل النحوي عبر المجموعات ونقاط القياس. أما بالنسبة للنقل البنيوي، فقد تم تحديد تأثيرات معنوية للمجموعة (F(1,58)=48.65)، والزمن (F(2.09,121.22) = 67.81)، وتأثيرات التفاعل (F(2.09,121.22) = 41.36)، وهو ما يعكس تحسنات مستمرة بمسارات تعتمد على المجموعة. ومن الملاحظ أن النقل الثقافي أظهر أقوى التأثيرات، مع تأثير معنوي للمجموعة (F(1,58) = 81.44)، وتأثير واضح للزمن (F(2.07,119.96) = 98.52)، وتفاعل قوي بين المجموعة والزمن (F(2.07,119.96) = 79.27)، مما يشير إلى نمط النمو الأكثر جوهرية وتمايزاً في هذا البعد. وبشكل عام، تُظهر جميع المؤشرات تأثيرات ذات دلالة إحصائية، مما يؤكد أن التدخل قد أحدث تأثيراً مستقراً ومتمايزاً على تطور النقل بمرور الوقت.
توافر البيانات:
جميع البيانات التي تم إنتاجها أو تحليلها خلال هذه الدراسة مدرجة في هذا المقال. أما بيانات التقييم الأولية فقد تم توفيرها في الجدول التكميلي 1.

الشكل 1: خطوات تحويل بنية الجملة. (أ) استراتيجيات دمج وتقوية الأفعال لتحسين بنية الجملة. (ب) تحويلات بديلة للفاعل، بما في ذلك الفاعل بصيغة اسم الفاعل (gerund)، والمصدر (infinitive)، والفاعل الاسمي. (ج) استخدام العبارات غير المحدودة (non-finite phrases) لتعزيز تنوع الجمل وإيجازها. (د) أمثلة على النسخ النهائية المنقحة التي توضح تحسناً في الأسلوب الأكاديمي والتعبير الإنجليزي عبر الثقافات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: مخطط شجرة تطور المهام. يوضح البنية التصاعدية لمهام النقل ذات المستويات الأربعة، والتي تتدرج من مستوى الجملة، ثم الفقرة، ثم الخطاب، وصولاً إلى المستوى الثقافي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: مقارنة لقدرة نقل الكتابة قبل التجربة وبعدها. يوضح المخطط الراداري درجات الاختبار القبلي والبعدي للمجموعة التجريبية والمجموعة الضابطة في أبعاد النقل النحوي، والبنوي، والثقافي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: مخطط خطي لاتجاه التعقيد النحوي. يتم عرض التغيرات في متوسط طول الجملة وطبقات تداخل الجمل عبر ثلاث مهام تدريبية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: مطابقة المصطلحات الأكاديمية. يوضح هذا الشكل التباينات في نسبة المفردات الرسمية وتكرار استخدام صيغة المبني للمجهول قبل التدخل وبعده. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6: الخريطة الحرارية لمدى الرضا عن الاستجابة للمطالبات. يتم هنا تلخيص تقييمات خمسة أنواع من قوالب المطالبات المقدمة من المعلمين المشاركين. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 7: مخطط صندوقي للتغيرات في تقييمات المعلمين. يوضح المخطط الصندوقي توزيع والتغيرات الإجمالية لدرجات الكتابة التي قيمها المعلمون لمجموعتين قبل التجربة وبعدها. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 8: مخطط راداري لقدرة الطلاب على النقل وفقاً لتقييمهم الذاتي. يوضح المخطط درجات التقييم الذاتي للطلاب عبر خمسة أبعاد للنقل في ثلاث جولات تدريبية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| يرجى تقديم النص المصدر المراد ترجمته. | تشغيل المعلم | نوع المطالبة | تشغيل الطالب | المخرجات | معايير التقييم |
| مسودات الكتابة الأصلية للطلاب (جمل/فقرات/مقالات) | 1. تصنيف أنواع النقل ومستويات المهام
2. ضبط معاملات المطالبة إذا لزم الأمر | محفز نقل أحادي / سلسلة محفزات متداخلة ثلاثية المراحل | ١. تعلم استراتيجيات النقل ٢. مراجعة المسودات بناءً على ملاحظات الذكاء الاصطناعي ٣. إتمام التقييم الذاتي | النص المنقح بواسطة الذكاء الاصطناعي + المسودة النهائية المنقحة بواسطة الطالب | التعقيد النحوي، والعقلانية الهيكلية، والملاءمة الثقافية، والتماسك المنطقي، وتوحيد السجل اللغوي (مقياس 0-5) |
الجدول 1: جدول ملخص سير العمل. يلخص هذا الجدول سير العمل التشغيلي الكامل للتدريب الانتقالي على الكتابة باللغة الإنجليزية بمساعدة الذكاء الاصطناعي، بما يشمل المواد المدخلة، وعمليات المعلم والطالب، وأنواع المطالبات، والمخرجات النهائية ومعايير التقييم المقابلة لها.
| فئة المشروع | المحتويات |
| فهم أهداف المهمة | يرجى وصف أهداف النقل لهذه الجولة من مهام الكتابة بإيجاز، مثل التعديل الهيكلي، والتكيف الثقافي، والتحويل اللغوي. |
| استراتيجية الهجرة المستخدمة | يرجى ذكر استراتيجيات الهجرة التي اعتمدتها (يُسمح باختيار عدة خيارات): |
| التعديل الهيكلي |
| تحويل الجمل |
| تبديل اللغة |
| المظهر الثقافي |
| تعزيز الربط المنطقي |
| أخرى: _______ |
| إعادة كتابة الأمثلة والتعليمات | اختر جملة أو جملتين تمت إعادة صياغتهما، واعرض النسختين قبل وبعد إعادة الصياغة، مع توضيح أسباب التغييرات وأهداف النقل المرجوة. |
| الصعوبات والشكوك التي تمت مواجهتها | صف أي تحديات واجهتها أثناء عملية النقل أو أي تساؤلات كانت لديك بشأن تعبير محدد. |
درجة التقييم الذاتي
(من أصل 5 نقاط) | يرجى تقييم إعادة صياغتك للنص بناءً على الجوانب الثلاثة التالية: |
| • دقة تطبيق الاستراتيجية (/5) |
| • طلاقة التعبير الطبيعية (5/) |
| • الملاءمة الثقافية (/5) |
| أهداف تحسين الكتابة المستقبلية | صف بإيجاز قابلية النقل التي تود تعزيزها أو تحسينها في جولة التدريب القادمة |
الجدول 2: جدول انتقال المعرفة. تم اعتماد مقياس تقييم من 1 إلى 5 (1 = عدم الإتقان، 5 = الإتقان التام) لتقييم الطلاب الذاتي لاستراتيجيات انتقال مهارات الكتابة.
| اسم المؤشر | الوصف | مصدر البيانات |
| مؤشر نقل الكتابة (0-5) | مؤشر كمي يقيس قدرة نقل اللغة بشكل شامل، ويغطي ثلاثة مستويات: بناء الجملة، والبنية، والثقافة. | التصحيح التلقائي بواسطة النظام + التصحيح اليدوي بواسطة المعلمين |
| درجة التعقيد النحوي | بما في ذلك متوسط طول الجملة، وعدد تداخلات العبارات، وثراء العبارات الفعلية، وما إلى ذلك. | التحليل التلقائي بمعالجة اللغات الطبيعية (NLP) |
| المطابقة بالأسلوب الأكاديمي | هل يتوافق مع معايير الكتابة الأكاديمية باللغة الإنجليزية؟ | تقييم نموذج معالجة اللغات الطبيعية |
| الرضا عن الاستجابة للمطالبة | قبول المعلمين والتقييم العملي للمقترحات التي تولدها النماذج | استبيان المعلم |
| تغييرات درجات مراجعة المعلم | مقارنة درجات المعلمين قبل التجربة وبعدها لبيان التحسن في جودة الكتابة | سجلات تقييم المعلمين |
| قدرة الطلاب على نقل التعلم وفقاً لتقييمهم الذاتي | يقوم الطلاب بتقييم ذاتي لمدى إتقانهم لأبعاد النقل المختلفة | املأ نموذج التوعية بالهجرة |
الجدول 3: ملخص لمؤشرات التقييم والأوصاف ومصادر البيانات. يوضح هذا الجدول التعريفات وطرق القياس ومصادر البيانات الأصلية لكل مؤشر تقييم أساسي في هذه الدراسة.
| نوع المطالبة | متوسط تقييم المعلمين | متوسط درجة الذكاء الاصطناعي | معامل ارتباط بيرسون |
| النقل الهيكلي | 4 | 3.9 | 0.83 |
| النقل النحوي | 4.1 | 4 | 0.87 |
| النقل الثقافي | 3.8 | 3.6 | 0.79 |
| نقل السجلات | 3.9 | 3.7 | 0.81 |
| النقل المنطقي | 4.2 | 4.1 | 0.85 |
الجدول 4: مقارنة الاتساق بين المحتوى الذي تم إنشاؤه بواسطة الذكاء الاصطناعي وتقييمات المعلمين. تُظهر النتائج الاتساق بين المحتوى الذي أنشأه الذكاء الاصطناعي وتقييمات المعلمين عبر أنواع مختلفة من الأوامر (Prompts).
| عناصر الوظائف | راضٍ جداً | راضٍ | بشكل عام | غير راضٍ | غير راضٍ جداً |
| اقتراحات إعادة الصياغة | 66% | 25% | 7% | 1.50% | 0.50% |
| تحسين البنية | 60% | 30% | 7% | 2% | 1% |
| نصائح ثقافية | 55% | 28% | 12% | 3.50% | 1.50% |
الجدول 5: إحصائيات استقصائية حول رضا الطلاب عن الوظائف المدعومة بالذكاء الاصطناعي. توضح الإحصائيات توزيع رضا الطلاب عن وظائف إعادة الصياغة بالذكاء الاصطناعي، والتحسين الهيكلي، والمطالبات الثقافية.
| قياس | المجموعة F(df) | الزمن F(df)جي جي | المجموعة × الزمن (df)Fجي جي | p |
| مؤشر الانتقال الإجمالي | 76.32 (1, 58) | 92.75 (2.14, 124.12) | 68.49 (2.14, 124.12) | <0.001 |
| النقل النحوي | 52.18 (1, 58) | 71.26 (2.11, 122.38) | 45.73 (2.11, 122.38) | <0.001 |
| النقل الهيكلي | 48.65 (1, 58) | 67.81 (2.09, 121.22) | 41.36 (2.09, 121.22) | <0.001 |
| النقل الثقافي | 81.44 (1, 58) | 98.52 (2.07, 119.96) | 79.27 (2.07, 119.96) | <0.001 |
الجدول 6: ملخص نتائج تحليل التباين للقياسات المتكررة (ANOVA). يعرض هذا الجدول نتائج تحليل التباين ثنائي الاتجاه للقياسات المتكررة للأداء العام لنقل الكتابة وأبعاده الفرعية الثلاثة، بما في ذلك التأثيرات الرئيسية للمجموعة، والوقت، والتفاعل بين المجموعة والوقت. الاختصارات: GG = تصحيح Greenhouse–Geisser.
الجدول التكميلي 1: تقييم البيانات الخام. يتضمن البيانات الخام المستخدمة في جميع التحليلات في هذه الدراسة.يرجى النقر هنا لتحميل هذا الملف.