تقوم هذه الدراسة بمقارنة STEP-DWCF-R (عملية منظمة، متدرجة، مبنية على الأدلة للتغذية الراجعة الكتابية الديناميكية مع وكيل الذكاء الاصطناعي الآلي) لتحسين أداء كتابة IELTS من خلال الذكاء الاصطناعي متعدد الجولات ومراجعات مدعومة من المعلمين.
مقالة منهجية
تقوم هذه الدراسة بمقارنة STEP-DWCF-R (عملية منظمة، متدرجة، مبنية على الأدلة للتغذية الراجعة الكتابية الديناميكية مع وكيل الذكاء الاصطناعي الآلي) لتحسين أداء كتابة IELTS من خلال الذكاء الاصطناعي متعدد الجولات ومراجعات مدعومة من المعلمين.
أنظمة التغذية الراجعة الآلية للكتابة منتشرة، ومع ذلك معظمها يقدم تعليقات ثابتة ومجزأة توفر قاعدة محدودة للمراجعة. تقيم هذه الدراسة إطار عمل STEP-DWCF-R (عملية منظمة، طبقية، مدفوعة بالأدلة للتغذية الراجعة الكتابية التصحيحية الديناميكية مع وكيل الذكاء الاصطناعي الآلي)، حيث يتم تقديم التغذية الراجعة التي يولدها الذكاء الاصطناعي، التي يشرف عليها معلم، عبر وكيل ذكاء اصطناعي روبوتي عبر عدة جولات تكرارية خلال دورة مهمة مدتها أسبوع واحد. في تجربة شبه تجريبية استمرت ثمانية أسابيع، تم توزيع 32 متعلما من EFL عشوائيا إما إلى تغذية راجعة كتابية تصحيحية تقليدية (جولة واحدة لكل مهمة) أو STEP-DWCF-R. أكملت كلتا المجموعتين مقالات مهمة IELTS 2 في الأساس وما بعد الاختبار، والتي تم إخفاء هويتها، وعشوائية، وتقييمها من قبل مقيمين مستقلين (ICC = 0.86–0.93). أظهرت نماذج التأثيرات المختلطة الخطية أن مجموعة STEP-DWCF-R أظهرت مكاسب أكبر بشكل ملحوظ في الدرجة الإجمالية للنطاق (Δ = 1.03 مقابل 0.31 نطاق) وعبر جميع الأبعاد التحليلية الأربعة، مع أكبر تحسن لوحظ في التماسك والتماسك. أشارت بيانات العملية إلى أن متعلمي STEP-DWCF-R أكملوا في المتوسط 2.26 جولة مراجعة لكل مهمة، مع انخفاض خطي في عدد الأخطاء عبر الجولات. تشير هذه النتائج إلى أن إطار عمل STEP-DWCF-R المتكامل، الذي يشمل التغذية الراجعة التي تولدها الذكاء الاصطناعي، ومراقبة المعلمين، والتوصيل التكراري لوكيل الذكاء الاصطناعي الروبوتي، يرتبط بتحسن أكبر في كتابة IELTS مقارنة بالتغذية الراجعة التقليدية ذات الجولة الواحدة، مما يشير إلى تطبيقات عملية للتغذية الراجعة الديناميكية المعززة بالذكاء الاصطناعي في سياقات اللغة الإنجليزية كلغة أجنبية.
تظل التغذية الراجعة التحريرية التصحيحية (WCF) مركزية في بيداغوجية الكتابة للغة الثانية. تظهر الأدلة أن التنوع الشامل في الزراعة الشاملة يحسن دقة المتعلمين مع مرور الوقت، وعندما يتماشى مع الممارسة الصفية، يمكن أن يتعايش مع أساليب مركزة يمكن تطبيقها في سياقات أصيلة1،2،3. أظهرت الدراسات الحديثة في الفصول الدراسية مكاسب مستدامة في الدقة والطلاقة من وجود WCF مستمر وشامل. تشير الأبحاث حول نطاق التغذية الراجعة إلى أن المعلمين يجب أن يستهدفوا النماذج بشكل استراتيجي بدلا من وضع علامات على كل شيء4، 5، 6، 7، 8، 9. بالتوازي، نمت التقييمات الآلية للكتابة (AWE) والتغذية الراجعة التحريرية التحريرية الآلية (AWCF) بسرعة. النتائج متباينة: بعض الدراسات تظهر تحسنا في إنجاز المهام والنطاق النحوي مع برامج AWCF أو Criterion، بينما لم تجد أخرى ميزة كبيرة مقارنة بالملاحظات الموجهة فقط للمعلمين أو المراجعات المحلية السطحية إلى حد كبير. لعكس هذا التباين، نقوم عمدا بالتثليث عبر عدة دراسات AWCF بدلا من الاعتماد على مصدر واحد 10,11,12,13.
كما أن معتقدات المتعلمين حول من يقدم الملاحظات مهمة أيضا: فالعمل شبه التجريبي على المصدر المدرك يشير إلى أن الأداء والثقة يمكن أن يتغيرا عندما يتم تأطير التغذية الراجعة المتطابقة ك "معلم" مقابل "مؤتمتة"، مما يبرز الحاجة إلى مراعاة تأثيرات الإدراك في تصاميم AWCF14,15. وبتوسيع هذا الخط، تشير الدراسات الناشئة إلى أن الروبوتات التعليمية، بسبب وجودها المتجسد، يمكن أن تعمل أيضا كمقدمي تغذية راجعة، مما قد يؤثر على تفاعل المتعلمين وثقتهم بطرق مميزة16.
خط بحثي مكمل، وهو التغذية الراجعة الكتابية التصحيحية الديناميكية (DWCF)، يركز على دورات التغذية الراجعة المتكررة والقابلة للإدارة والشاملة مع الترميز والمراجعة السريعة. تشير الأدلة من عدة بيئات إلى أن DWCF يحسن الدقة بشكل موثوق (مع تأثيرات متكررة على الطلاقة)، رغم أن النتائج قد تختلف حسب أهداف المقرر وعدد المتعلمين17، 18، 19، 20. أخيرا، تشير الدراسات المبكرة حول التغذية الراجعة التي بوساطة الذكاء الاصطناعي التوليدي إلى تكافؤ مع ملاحظات المعلمين حول نتائج الكتابة والفوائد المحتملة عند اقترانها بتوجيهات لغوية معدنية صريحة، مما يحفز التكامل الأقرب بين التغذية الراجعة البشرية والذكاء الاصطناعي في سياقات اللغة الثانية21,22.
لمعالجة هذه التحديات، نقترح إطار عمل STEP-DWCF-R (عملية منظمة، طبقية، مبنية على الأدلة لتغذية راجعة تصحيحية كتابية ديناميكية مع وكيل ذكاء اصطناعي روبوتي)، وهو نظام تغذية راجعة متعدد المراحل مبتكر مصمم لتقديم دعم كتابة منظم، تكراري، وموجه نحو العمليات. يستفيد نظامنا من القوة التنبؤية والتوليدية لنماذج اللغة الكبيرة (LLMs)، من خلال تقديم النماذج التقنية من خلال واجهة وكيل الذكاء الاصطناعي الآلي ومراقبة المعلمين، لتقسيم قضايا الكتابة المعقدة إلى فئات يمكن إدارتها، وتقديم الملاحظات عبر جولات متعددة من التفاعل، وتقييم فعاليته باستخدام مقاييس قائمة على النتائج والعمليات. من خلال تحويل التغذية الراجعة إلى عملية منظمة وتفاعلية، يتقدم STEP-DWCF-R بدعم الكتابة الآلي من تصحيح الأخطاء الثابتة إلى نظام أكثر تفاعلا وتجسدا وتركيزا على التعلم.
تركز مساهماتنا على ثلاثة تقدمات متكاملة. أولا، نقترح مخطط تمثيل تغذية راجعة منظم يصنف الأخطاء (مثل القواعد النحوية، التماسك) بحيث تكون تغذية راجعة نماذج اللغة الكبيرة التي يقدمها وكلاء الذكاء الاصطناعي الروبوتية قابلة للتنفيذ وقابلة للتفسير التربويعي. ثانيا، نقدم عملية متعددة المراحل تكرارية تنظم التغذية الراجعة عبر اللغة والبنية والاستدلال عبر عدة جولات لتقليل الحمل المعرفي وتعميق التفاعل. ثالثا، نوسع التقييم إلى ما هو أبعد من الدرجات ليشمل مقاييس موجهة للعمليات مثل تقليل الأخطاء وتبني التغذية الراجعة، مما يوفر رؤية أعمق لتأثير التعلم. تمثل أطر WCF أولى المحاولات لتنظيم التغذية الراجعة الكتابية التصحيحية ضمن تكنولوجيا التعليم. نشأت هذه الأنظمة في تقييم الكتابة الآلي (AWE) وتقييم المقالات الآلي (AES)، وركزت على اكتشاف الأخطاء والكفاءة بدرجة13,14. تكمن مساهمتهم في قابلية التوسع: فقد يتمكن آلاف المتعلمين من تلقي التغذية الراجعة دون عنق الزجاجة الناتج عن التقييم البشري. ومع ذلك، كانت هذه الأطر عادة ما تقدم تعليقات ثابتة ومجزأة، مثل فحوصات القواعد، أو الاقتراحات المعجمية، أو الدرجات العامة التي واجه المتعلمون صعوبة في تحويلها إلى مراجعات ذات معنى23، 24، 25، 26.
مع مرور الوقت، تطورت أبحاث WCF لتشمل المزيد من الأساليب المعتمدة على التكنولوجيا. سعت هذه الأنظمة الحديثة إلى التقاط جوانب أوسع من الكتابة من خلال الاستفادة من طرق الحوسبة13,21. ومؤخرا، توسع النطاق أكثر مع التقنيات المجسدة، حيث بدأت الروبوتات التعليمية تعمل كمزودين للتغذية الراجعة في سياقات الكتابة أو التدريس. وجودهم الجسدي وإمكانياتهم التفاعلية يقدمون ديناميكيات جديدة من الثقة والتفاعل وتحفيز المتعلم. ومع ذلك، وعلى الرغم من هذه التطورات، ظل التوجه السائد ل WCF يركز على النتائج 8,27: إنتاج الدرجات أو التعليقات المعزولة بطريقة لمرة واحدة. من الناحية التربوية، هذا التوجه غير متوافق مع التقييم التكويني، حيث يجب أن تدعم التغذية الراجعة المراجعة عبر المسودات وتدعم التفاعل فوق المعرفي 16,28,29,30,31. وهكذا، يكشف الحد المفاهيمي ل WCF عن فجوة دائمة: يتم تقديم التغذية الراجعة، لكنها ليست منظمة أو مرتبة لتوجيه عمليات التعلم.
استجابة لهذه القيود، بدأ الباحثون في استكشاف أساليب أكثر ديناميكية لكتابة الملاحظات. أبرزت التحقيقات المبكرة أهمية دورات التغذية الراجعة التكرارية، حيث يراجع المتعلمون عدة مرات تحت توجيه مبني17,32. كما تم اقتراح تصنيف الأخطاء المنظمة لتحسين قابلية تفسير التغذية الراجعة ومواءمتها مع الأهداف التربوية33,34. مفهوم إطار DWCF يعزز هذه الاتجاهات من خلال تضمين ثلاثة مبادئ تصميم: مخططات الخطأ الصريحة، التسليم المرحلي والتكراري، ومقاييس التقييم الموجهة نحو العمليات19,35. بدلا من إغراق الطلاب بالكثير من التصحيحات دفعة واحدة، توزع DWCF الانتباه عبر طبقات الكتابة — الدقة السطحية، التماسك البنيوي، وعمق الجدل — عبر الجولاتالمتتالية 17، 33. يمتد التقييم إلى ما هو أبعد من الدرجات النهائية ليشمل مؤشرات العمليات مثل معدلات تقليل الأخطاء، واعتماد التغذية الراجعة، وعمق المراجعة 10,19,25. على الرغم من وعده، لا تزال التطبيقات العملية ل DWCF نادرة، ومعظم الدراسات لا تتوقف عن تطبيقه في سياقات واسعة النطاق بوساطة تقنية 10,36,37. تسلط هذه الفجوة الضوء على الحاجة إلى أطر لا تفترض DWCF فحسب، بل تظهر أيضا جدواها في البيئات التعليمية الواقعية. يوضح الشكل 1 الإطار النظري الأوسع ل DWCF المقترح في الأدبيات. يقدم الشكل مبررا عاما لكيفية عمل التغذية الراجعة التصحيحية المكتوبة الديناميكية على مستويات متعددة، بما في ذلك النتائج المقاسة (مثل الدقة، التماسك) والبنى النظرية ولكن غير المقاسة في الدراسة الحالية (مثل تقليل قلق الكتابة، والطلاقة، والتعقيد). تم تضمينها من أجل التوجه النظري وليس كنموذج مباشر لهذه التجربة. العناصر المقابلة للنتائج ومقاييس العمليات المحللة هنا موضحة في الشكل؛ مسارات أخرى توضح ولم يتم تقييمها في هذه الدراسة.
ظهور نماذج اللغة الكبيرة والأنظمة متعددة الوسائط يوفر وسيلة قوية لتشغيل DWCF على نطاق واسع. نماذج اللغة الكبيرة، بفضل قدراتها على اللقطة الصفرية والقليلة، يمكنها توليد تغذية راجعة حساسة للسياق دون الحاجة إلى تدريب خاص بالمهمة21,22. تشير التجارب الحديثة إلى إمكاناتها في التقسيم التوجيهي، والتحسين المسرحي، وتوليد التفسير، والتي تتماشى ارتباطا وثيقا بمبادئ DWCF 13,37,38,39. أظهرت الأبحاث التكميلية في التعاون بين الإنسان والذكاء الاصطناعي أن الحلقات التكرارية للتفاعل مع ملاحظات الذكاء الاصطناعي وتكييفها واعتمادها بشكل انتقائي يمكن أن تحسن جودة القبول والمراجعة25,30. عندما تتجسد هذه العمليات من خلال الروبوتات، يكون للتفاعل القدرة النظرية على أن يصبح متعدد الوسائط — يجمع بين الإيماءة والصوت والحضور — مما قد يعزز إدراك المتعلم ودافعه أكثر40.
مبنين على منطقة التطور القريب (ZPD)41، وفرضية المدخلات42، ونظرية اكتساب المهارات43، نضع STEP-DWCF-R كوحدة تحكم تربط دعم المتعلم، ومعالجة المدخلات، وتطوير المهارات. بشكل ملموس، تعمل التصنيفات المرتبطة بالمعايير، والقوائم المجمعة في الوقت المناسب، ودورات الذكاء الاصطناعي والبشر والروبوتات متعددة الجولات التي يراقبها المعلم في طبقة تكامل تتوسط المراجعة وتنتج نقاط النهاية القابلة للملاحظة التي تم تحليلها هنا (IELTS Overall و TR/CC/LR/GRA؛ الجولات، الاستيعاب، الأخطاء المستمرة، الوقت). تم نظرية بنى مثل تقليل قلق الكتابة لكنها لم تقاس في هذه التجربة.
تمت الموافقة على هذا البروتوكول من قبل لجنة الأخلاقيات في مدرسة التعليم الابتدائي في كلية شانغراو للتعليم لمرحلة ما قبل المدرسة. كان جميع المشاركين بالغين (≥18 سنة) وقدموا موافقة مستنيرة مكتوبة قبل الدراسة.
1. تصميم الدراسة
ملاحظة: بسبب قيود الفصل الدراسي المتاح للتعليم الإنجليزي كلغة أجنبية (إجمالي التسجيل N = 32)، تم تقسيم المشاركين عشوائيا إلى مجموعتين كل منهما 16 شخصا. تم تحديد حجم العينة هذا، رغم أنه متواضع، كافيا لإجراء تحقيق تجريبي نظرا لتصميم ما قبل الموضوع وتوقعات التأثيرات الكبيرة بناء على دراسات DWCF السابقة 17,18,19,20.
2. مهام الكتابة
3. سير عمل التغذية الراجعة
4. قياس النتائج
5. قياس العمليات
6. تحليل البيانات
7. توفر الكود
جميع الكود، والمحفزات، ومخططات JSON، وملفات التنفيذ النموذجية المطلوبة لإعادة إنتاج نظام STEP-DWCF-R متاحة علنا على https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.
التجارب والتحليل
قدم جميع المتعلمين ال32 بيانات أساسية. كانت بيانات ما بعد الاختبار متاحة ل 16 متعلما في كل مجموعة (WCF و STEP-DWCF-R؛ الشكل 2). يتم عرض الجدول الزمني للدراسة والمقاييس في الشكل 3، ويتم توضيح سير عمل التغذية الراجعة من البداية إلى النهاية في الشكل 4. تم عرض معايير إعداد التجارب والتنفيذ لنظام الذكاء الاصطناعي لدينا في الجدول 1. اتبعت التحليلات الخطة المحددة مسبقا مع نية العلاج. نقوم أولا بتقييم التكافؤ الأساسي (الجدول 2)، ثم نبلغ عن النتيجة الأساسية (الشكل 5 والجدول 3)، تليها النتائج الثانوية (الجدول 4) مع فحوصات المتانة والموثوقية.
التكافؤ الأساسي
في الأساس (الأسبوع الأول)، كانت المجموعات متشابهة وصفيا في المتغيرات المحددة مسبقا، بما في ذلك الديموغرافيا وأداء كتابة IELTS قبل أي تغذية راجعة (الجدول 2). يتم تعيين درجات المكونات الفردية في IELTS على شكل خطوات بحجم 0.5 نطاق، بينما الجدول يذكر المتوسطات الجماعية. يتم حساب المتوسطات العامة للأسبوع الأول (WCF = 5.625، STEP-DWCF-R = 5.500) من نفس المصفوفات المستخدمة لتوليد الشكل 5. لا نجري اختبارات الفرضيات في الوضع الأول؛ يتم معالجة أي خلل متبقي من خلال التصميم قبل البعد ومدة زمن المجموعة × في نموذج التأثيرات المختلطة، ويتم الإبلاغ عن مقارنة ما بعد الاختبار المعدلة للأساس في قسم البروتوكول.
النتيجة الأساسية
يلخص الشكل 5 التغييرات قبل ما بعد الاختبار، بينما يذكر الجدولان 3 والجدول 5 تقديرات النموذج والتحصيل بعد الاختبار. في الأساس (الأسبوع الأول)، كانت متوسطات المجموعة 5.625 ل WCF و5.500 ل STEP-DWCF-R، مما أدى إلى فرق مجموعة غير معنوي بمقدار −0.125 نطاق (SE = 0.133، t = − .939، df = 29.90، p = .355، فترة الثقة 95٪ [−0.397، 0.147]). لذا، يقدر خط الأساس في الجدول 3 متوسط الأسبوع الأول لصندوق المستهلك العالمي عند 5.625 مع فترة ثقة 95٪ [5.419، 5.831] (SE = 0.097، df = 15). من الأسبوع الأول إلى الأسبوع الثامن، تحسنت WCF بمقدار 0.3125 نطاقا (SE = 0.128، t = 2.44، df = 15، p = 0.028، فاصل الثقة 95٪ [0.039، 0.586]؛ تأثير التأثير القياسي داخل المجموعة dz = 0.61). تحسن STEP-DWCF-R بمقدار 1.0313 نطاقا (SE = 0.140، t = 7.34، df = 15، p = 2.44 × 10−6، فاصل الثقة 95٪ [0.732، 1.331]؛ dz = 1.84). كان التباين الخطي للتأثيرات المختلطة لتفاعل المجموعة × الزمن — أي الفرق في الفروقات — 0.7188 نطاقا (SE = 0.190، t = 3.78، df = 29.75، p = .0007، فاصل الثقة 95٪ [0.330، 1.107]؛ الجدول 3)، يشير إلى مكاسب أكبر تحت STEP-DWCF-R. في مرحلة ما بعد الاختبار (الأسبوع 8)، كانت المتوسطات الهامشية المقدرة تفضل STEP-DWCF-R بمقدار 0.5938 نطاقا (اختبار ويلش على متوسطات المجموعة: SE = 0.115، t = 5.16، df = 29.74، p = 1.50 × 10−5، فترة الثقة 95٪ [0.359، 0.829]). وبما يتوافق مع ذلك، يظهر جدول التحصيل (الجدول 5) أنه في الأسبوع الثامن، وصل 13٪ من متعلمي WCF إلى ≥ إجمالي 6.5 و0٪ وصلوا إلى ≥ 7.0 (العد 2/16 و0/16)، في حين وصل 81٪ من متعلمي STEP-DWCF-R إلى ≥ 6.5 و25٪ ≥ 7.0 (العد 13/16 و4/16). يعرض الجدول 3 تقديرات الأثر الثابت المقابلة وعدم اليقين فيها.
نتائج على مستوى الأبعاد
يلخص الجدول 4 التغييرات قبل وبعد المهمة عبر أبعاد المهمة 2 الأربعة. أظهر استجابة المهمة (TR) زيادة Δ = 0.25 نطاقا تحت WCF مقابل Δ = 0.95 تحت STEP-DWCF-R، مما أدى إلى ΔΔ = 0.70 مع فاصل ثقة 95٪ [0.28، 1.12] ونسبة p المعدلة في هولم = 0.006. أظهرت التماسك والتماسك (CC) أكبر تباين: WCF Δ = 0.30، STEP-DWCF-R Δ = 1.15، وبالتالي ΔΔ = 0.85 (فاصل الثقة 95٪ [0.44، 1.26]، adj-p = .002). اتبع المورد المعجمي (LR) نفس النمط مع WCF Δ = 0.35 و STEP-DWCF-R Δ = 0.95، مما أعطى ΔΔ = 0.60 (فاصل الثقة 95٪ [0.18، 1.02]، adj-p = 0.012). تم تحسين النطاق النحوي والدقة (GRA) بمقدار Δ = 0.25 في WCF و Δ = 0.97 في STEP-DWCF-R؛ النتيجة ΔΔ = 0.72 حملت فاصل ثقة بنسبة 95٪ [0.31، 1.13] مع adj-p = .004. عبر جميع الأبعاد الأربعة، كانت تباينات المجموعة×الزمن تفضل STEP-DWCF-R بعد تعديل هولم-بونفيروني.
أدلة العملية
توضح الشكلان 6 و7 نتائج العملية الأساسية. خلال الأسابيع 2–7، أكملت STEP-DWCF-R في المتوسط 2.26 جولة مراجعة لكل مهمة (فاصل الثقة 95٪ [2.17، 2.35]؛ n = 96)، بينما كان WCF 1.00 جولة لجميع المهام (n = 96). كان متوسط الفرق 1.26 طلقة (فترة الثقة 95٪ [1.17، 1.35]); أكد اختبار مان–ويتني فصل التوزيعات (U = 9216، z = 11.97، p < 10−30). ضمن STEP-DWCF-R، انخفض متوسط عدد الأخطاء حسب الجولة: 13.78 في الجولة الأولى (فاصل الثقة 95٪ [13.02، 14.54]؛ n = 96)، 8.94 في الجولة الثانية (فاصل الثقة 95٪ [8.42، 9.46]؛ n = 96)، و6.16 في الجولة الثالثة (فاصل الثقة 95٪ [5.20، 7.12]؛ n = 25). قدر اتجاه خطي تم تكييفه بالملاحظات لكل جولة انخفاضا قدره 4.14 خطأ في كل جولة (فاصل الثقة 95٪ [3.51، 4.78] في الحجم المطلق؛ ص < 10−12). مقاييس استقبال التغذية الراجعة ووقت تنفيذ المهمة غير مشفرة في الشكل 6 والشكل 7، وبالتالي يتم الإبلاغ عنها في الجدول 7.
الموثوقية والمتانة
كان الاتفاق بين المقيمين لمقالات الأسبوع الأول والأسبوع الثامن جيدا إلى ممتاز. قام مقيمان مدربان بتقييم جميع النصوص بشكل مستقل وكانا غير متوقعين عن المجموعة والوقت؛ باستخدام معامل الارتباط داخل الفئة بمتوسط المقاييس (ICC[2,2]) على متوسط المقيمين، تراوحت الموثوقية بين 0.86–0.93 عبر الأبعاد الإجمالية، وتجاوز الأبعاد الأربعة، وجميع الأبعاد المنخفضة 95٪ حدود الثقة 0.80 (الجدول 6). أشارت الفحوصات التشخيصية لنموذج التأثيرات المختلطة الأساسي إلى بقايا طبيعية تقريبا دون مرونة مادية متجانسة، وأظهرت النماذج المعدلة على ملخصات العمليات على مستوى المهمة تشتت قريب من واحد. أظهرت تحليلات الحساسية المبنية على نفس مجموعة بيانات الأسبوع 1/الأسبوع 8 استنتاجات متسقة: حيث قدرت الفرق المعدل بين المجموعات بعد الاختبار مع تعديل الدرجات الأساسية فرقا معدل بين المجموعات بمقدار 0.575 نطاقا في الأسبوع الثامن (فاصل الثقة 95٪ [0.336، 0.814]، p = 3.15 × 10−5)، ونموذج مختلط خاص بالمقيم تضمن تأثيرا عشوائيا للمقيم واستخدم درجات غير متوسطة أنتج تقديرا للمجموعة × الوقت بمقدار 0.72 نطاقا (فاصل الثقة 95٪ [0.33, 1.11]، p = .0007)، متوافقا مع الجدول 3. لم تتغير النتائج عند استخدام أخطاء معيارية قوية وعندما اقتصرت التحليلات على الحالات الكاملة، مما عزز الاستنتاج بأن STEP-DWCF-R يحقق مكاسب أكبر قبل الظهور مقارنة ب WCF.
النتائج النوعية
للتحليل النوعي، فحصنا مسارات مراجعة STEP-DWCF-R عبر جميع المهام الست وتأملات مكتوبة في نهاية الدورة من 16 مشاركا في مجموعة STEP-DWCF-R. قام مبرمجان بشكل مستقل بترميز المواد باستخدام إطار استنتاجي مركز يعتمد على الفئات الأربع للتغذية الراجعة (القواعد، المفردات، التنظيم، التفكير) ومبررات الاستيعاب. كان الاتفاق بين المبرمجين كبيرا مع كابا كوهين 0.78، وتم حل الخلافات من خلال النقاش.
كشف التحليل عن خمسة مواضيع رئيسية: اتباع نمط تدريجي، حيث يقوم المتعلمون بحل ميزات السطح قبل معالجة التنظيم والتفكير؛ كانت العناصر المرتبطة بالمعايير الخاصة بالنطاق القياسي أكثر قابلية للتنفيذ وغالبا ما تعتمد من الاقتراحات السردية؛ شكل التكامل بين الذكاء الاصطناعي والمعلمين الأولوية، مع إشارات متداخلة تزيد من التركيز وتحكم المعلمين في حل النزاعات؛ بلغت الفوائد ذروتها مبكرا، مع إعادة استخدام قوالب التنظيم والأنماط المعجمية التي تم تدوينها في المحفزات الجديدة؛ وقام المتعلمون بتكييف استراتيجيات عبر المهام. تشكل هذه المواضيع ديناميكيات العمليات التي يتم استكشافها في قسم أدلة العملية. كما تم تسجيل استقبال التغذية الراجعة، والأخطاء المستمرة، ومقاييس الوقت على تنفيذ المهمة. يتم عرض ملخص لهذه المؤشرات العملية الإضافية في الجدول 7.
تفسير النتائج التمثيلية
عند جمع بيانات النتائج والعملية معا، تشير إلى أن إطار عمل STEP-DWCF-R مرتبط بتحسن أكبر في كتابة IELTS مقارنة بالتغذية الراجعة التقليدية للجولة الواحدة. تظهر النتيجة الأساسية وجود فرق بين المجموعات في الفروق بمقدار 0.72 نطاق، مع تحسن مجموعة STEP-DWCF-R بمقدار 1.03 نطاقا إجماليا مقارنة ب 0.31 نطاقا في مجموعة WCF. كان هذا الميزة متسقا عبر جميع الأبعاد التحليلية الأربعة، مع أكبر تباين في التماسك والتماسك عند 0.85 نطاق، مما يشير إلى أن التغذية الراجعة المنظمة المرتبطة بالمعايير والمراحل متعددة المراحل كانت تدعم بشكل خاص تطوير المنظمة. تشير أدلة العملية أيضا إلى أن التفاعل التكراري هو أساس هذه الميزة. أكمل متعلمو STEP-DWCF-R في المتوسط 2.26 جولة مراجعة لكل مهمة، وانخفضت أعداد الأخطاء خطيا بحوالي 4.1 خطأ في كل جولة. على سبيل المثال، شملت دورة سير العمل التمثيلية GPT-5 توليد تغذية راجعة منظمة لJSON عبر الفئات الأربع، تليها إدارة المعلمين لإزالة الإيجابيات الكاذبة وتعزيز قابلية التنفيذ، ثم التسليم اللاحق عبر واجهة وكيل الذكاء الاصطناعي الروبوتية لمراجعة المتعلمين متعددة الجولات. تدعم هذه النتائج جدوى وفعالية سير العمل المتكامل متعدد المكونات الذي يجمع بين التغذية الراجعة التي تولدها الذكاء الاصطناعي، ومراقبة المعلمين، وتقديم وكيل الذكاء الاصطناعي الروبوتي التكراري، ولكن لا ينبغي تفسيرها كدليل على وجود مكون واحد بمعزل عن غيره. عدم توازن الجرعات بين 2–3 جولات مقابل جولة واحدة وحجم العينة المتواضع البالغ 32 يعني أن المكاسب الملحوظة تعكس التأثير المشترك لزيادة فرص المراجعة والتغذية الراجعة المنظمة. يجب اعتبار هذه النتائج أدلة تجريبية واعدة تنتظر تأكيدها في تجارب أكبر مكونات خاضعة للضبط.

الشكل 1. الإطار النظري ل DWCF (التغذية الراجعة الكتابية التصحيحية الديناميكية). يوفر الشكل مبررا أوسع لكيفية عمل DWCF؛ وقد أدرجت هذه التجربة لأغراض التوجيه وليس كنموذج مباشر لهذه التجربة. العناصر المقابلة للنتائج ومقاييس العمليات المحللة هنا موضحة في الشكل؛ مسارات أخرى توضيحية ولم يتم تقييمها. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2. مخطط تدفق CONSORT للمشاركين. تم تقييم اثنين وثلاثين متعلما من حيث الأهلية؛ لم يستثني أي منها. قدم جميع المشاركين موافقتهم ثم تم تقسيمهم عشوائيا بنسبة 1:1 إلى مجموعة WCF (n = 16) أو مجموعة DWCF (n = 16). جميع المشاركين العشوائيين تلقوا التدخل المخصص؛ لم تكن هناك خسائر بسبب المتابعة أو الإيقاف، وتم تضمين جميع ال 32 في التحليل النهائي. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3. دراسة الجدول الزمني والمقاييس. امتدت التجربة لمدة 8 أسابيع: في W1، أكمل المشاركون مهمة IELTS الأساسية 2 وتم تقييمهم؛ تم تنفيذ ست مهام كتابة أسبوعية من W2 إلى W7 (المهمة 1–المهمة 6)، مع تغذية راجعة خاصة بالمجموعة (WCF أو DWCF) ومراجعات بعد كل مهمة. تم تسجيل مقاييس العمليات، بما في ذلك جولات المراجعة، واستيعاب التغذية الراجعة، ومعدل الخطأ المستمر، ووقت تنفيذ المهمة، لكل مهمة خلال W2–W7. في W8، تم إجراء مهمة IELTS 2 بعد الاختبار وتم تقييمها. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4. سير عمل التغذية الراجعة من البداية إلى النهاية. ينتج المتعلمون مسودة أولية تحت مراقبة، ثم يتلقون تغذية راجعة خاصة بمجموعة: WCF (جولة تغذية راجعة بشرية واحدة) أو STEP-DWCF-R (تغذية راجعة مولدة بالذكاء الاصطناعي مع إشراف المعلمين، تقدم عبر وكلاء ذكاء اصطناعي روبوتيين، تتضمن 2–3 جولات تكرارية). يكمل المتعلمون جولات مراجعة وفقا لذلك. النتيجة هي درجة نطاقية مهمة IELTS 2؛ تشمل مقاييس العمليات عدد الجولات، واستقبال التغذية الراجعة (المعتمد/المعدل/المرفوض)، ومعدل الخطأ المستمر، ومدة تنفيذ المهمة. يقوم النظام بتسجيل معرفات على مستوى العناصر، والفئة/الشدة، والمصدر (الذكاء الاصطناعي مقابل الإنسان مقابل الروبوت)، وإجراءات الإشراف، وحالة الاستقبال. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5. التغير في نطاق IELTS بشكل عام من الأسبوع الأول إلى الأسبوع الثامن حسب المجموعة. تعطي النقاط المتوسطات المقدرة للمجموعة مع فترات ثقة 95٪، وتشير المسارات إلى زيادة أكبر تحت STEP-DWCF-R يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6. جولات المراجعة لكل مهمة حسب مجموعة (الأسابيع 2–7). تمثل نقاط البيانات جولات مراجعة المهام الفردية لمجموعتي WCF (الأزرق) وSTEP-DWCF-R (البرتقالي). تشير الخطوط الأفقية وأشرطة الخطأ إلى متوسطات المجموعة ذات فواصل ثقة 95٪. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 7. متوسط عدد الأخطاء لكل جولة ضمن STEP-DWCF-R مع 95٪ CI. تشير النقاط إلى متوسط عدد الأخطاء في كل جولة تغذية راجعة (الجولة 1، الجولة 2، الجولة 3)، والخطوط الرأسية تمثل فواصل ثقة 95٪ (CIs). يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
| المكون | المواصفات |
| الأجهزة | كمبيوتر مزود بمعالج Intel(R) Core(TM) i7-12700H من الجيل الثاني عشر (2.30 جيجاهرتز)، ذاكرة RAM بسعة 32 جيجابايت، بطاقة رسومات NVIDIA RTX 3080Ti (16GB) |
| نظام التشغيل | ويندوز 11 |
| الخلفية | Flask~2.1 (بايثون~3.10) |
| الواجهة الأمامية | قوالب جينجا2 التي يتم عرضها بواسطة الخادم |
| نماذج الذكاء الاصطناعي | واجهة برمجة تطبيقات OpenAI GPT-5 (لتوليد الملاحظات)، معالجة لاحقة قائمة على المخططات |
| جدولة الملاحظات | وحدة تحكم مخصصة تدير تغذية راجعة متعددة المراحل (3 دورات) |
| مخطط الخطأ | القواعد، المفردات، التنظيم، التفكير |
| التحكم في الإصدارات | GitHub |
| قطع الأشجار | تسجيل تلقائي للمشاركات، الملاحظات، والمراجعات للتحليل |
الجدول 1: إعدادات الإعداد التجريبي ومعايير التنفيذ. المواصفات الفنية لنظام تغذية راجعة الذكاء الاصطناعي، بما في ذلك تكوين الأجهزة، نظام التشغيل، أطر الواجهة الخلفية والأمامية، إعدادات نماذج الذكاء الاصطناعي، جدولة التغذية الراجعة، فئات مخطط الأخطاء، التحكم في الإصدارات، وبنية التسجيل.
| المتغير | WCF (عدد = 16) | STEP-DWCF-R (n=16) |
| العمر (سنوات)، المتوسط (SD) | 20.9 (1.5) | 21.1 (1.6) |
| أنثى، n (٪) | 9 (56%) | 8 (50%) |
| التحضير السابق لاختبار الآيلتس (نعم)، n (٪) | 7 (44%) | 6 (38%) |
| سنوات من التعليم السابق في الكتابة | 3.1 (1.2) | 3.2 (1.1) |
| اختبار الآيلتس الأساسي (الفرقة) | 5.625 (0.387) | 5.500 (0.365) |
| فرقة Baseline TR | 5.56 (0.50) | 5.50 (0.50) |
| فرقة Baseline CC | 5.62 (0.49) | 5.53 (0.49) |
| فرقة Baseline LR | 5.60 (0.46) | 5.52 (0.46) |
| فرقة BASELINE GRA | 5.56 (0.48) | 5.49 (0.45) |
الجدول 2: الخصائص الأساسية للمشاركين حسب المجموعة (الأسبوع 1). المتغيرات الديموغرافية واختبار ما قبل أداء الكتابة في نظام اختبار اللغة الإنجليزية الدولي (IELTS) للمهمة الثانية لمجموعات WCF وSTEP-DWCF-R. القيم هي المتوسط (الانحراف المعياري) أو n (٪).
| التأثير الثابت | التقدير | SE | دي إف | t | p | 95٪ CI |
| الاعتراض (WCF، الأسبوع~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| المجموعة (STEP-DWCF-R ضد WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| الوقت (الأسبوع~8 مقابل الأسبوع~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| وقت × المجموعة | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
الجدول 3: نموذج التأثيرات المختلطة الخطية لمستوى IELTS العام من درجات الأسبوع 1/الأسبوع 8. تقديرات التأثير الثابت، الأخطاء القياسية (SE)، درجات الحرية (df)، قيم t، قيم p، وفترات ثقة 95٪ (CIs) لتفاعل زمن المجموعة × ومصطلحات النموذج.
| البعد | WCF Δ (فرق) | STEP-DWCF-R Δ (الأشرطة) | ΔΔ (95٪ CI) | adj-p |
| استجابة المهام (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| التماسك والتماسك (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| المورد المعجمي (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| النطاق النحوي والدقة (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
الجدول 4: نتائج على مستوى الأبعاد (المهمة 2): التغييرات قبل وبعد التغييرات والفروقات بين المجموعات. التغيرات قبل البعد (Δ) والفرق في الفروقات (ΔΔ) مع فواصل ثقة 95٪ (CIs) وقيم p المعدلة بواسطة هولم لاستجابة المهمة (TR)، والتماسك والتماسك (CC)، والمورد المعجمي (LR)، والمدى والدقة النحوية (GRA).
| العتبة | WCF (٪) | STEP-DWCF-R (٪) |
| ≥ الإجمالي 6.5 | 13 | 81 |
| التقييم العام ≥ 7.0 | 0 | 25 |
الجدول 5: تحصيل الفرق بعد الاختبار (الأسبوع 8). نسبة المتعلمين في مجموعتي WCF وSTEP-DWCF-R الذين وصلوا إلى عتبات درجات المستوى العام في IELTS: لا تقل عن 6.5 و7.0.
| النتيجة | ICC | 95٪ CI |
| بشكل عام | 0.91 | [0.86, 0.94] |
| استجابة المهام (TR) | 0.88 | [0.82, 0.92] |
| التماسك والتماسك (CC) | 0.9 | [0.85, 0.94] |
| المورد المعجمي (LR) | 0.89 | [0.83, 0.93] |
| النطاق النحوي والدقة (GRA) | 0.87 | [0.80, 0.91] |
الجدول 6: موثوقية المقيمين لنتائج IELTS. اثنان من المقيمين الأعمى على N = 64 مقالا (الأسبوع الأول والأسبوع الثامن مجتمعين). معاملات الارتباط داخل الفئة المتوسطة (ICC[2,2]) مع فترات ثقة 95٪ (CIs) للدرجات الإجمالية والأبعاد.
| القياس | مجموعة WCF | مجموعة STEP-DWCF-R |
| جولات المراجعة لكل مهمة | 1 | 2.26 |
| معدل استقبال التغذية الراجعة (تم اعتماده أو تعديله، ٪) | 68.5 | 82.3 |
| معدل الخطأ المستمر بعد الجولة النهائية (٪) | 67.4 | 45.6 |
| وقت الرقابة على المعلم (الحد الأدنى لكل مهمة) | 23.5 | 13.8 |
| وقت تسليم وكيل الذكاء الاصطناعي (الحد الأدنى لكل مهمة) | — | 3.9 |
| وقت مراجعة المتعلم (الحد الأدنى لكل مهمة) | 44.8 | 71.2 |
| إجمالي الوقت على الملاحظات + المراجعة (الحد الأدنى لكل مهمة) | 68.3 | 88.9 |
الجدول 7: المتوسط عبر 96 مهمة (6 مهام × 16 متعلما). تم حساب معدلات الامتصاص والأخطاء المستمرة على مستوى نقاط التغذية الراجعة. تم تسجيل قياسات الوقت من خلال سجلات المعلمين وطوابع الأنظمة الزمنية المحددة. وقت تسليم وكيل الذكاء الاصطناعي غير مناسب لمجموعة WCF.
قارنت هذه الدراسة بين STEP-DWCF-R، وهو إطار تغذية راجعة تصحيحية كتابية ديناميكية متعددة المكونات مع وكيل ذكاء اصطناعي روبوتي، مع WCF في جولة واحدة خلال دورة كتابة IELTS استمرت ثمانية أسابيع. حقق STEP-DWCF-R مكاسب أكبر قبل وما بعد في النطاق الكلي وعبر TR وCC وLR وGRA. كما أكمل المتعلمون تحت STEP-DWCF-R المزيد من جولات المراجعة وأظهروا انخفاضا أسرع للأخطاء، حيث قدرت النماذج انخفاضا بحوالي 4.1 خطأ في كل جولة. أكبر تحسن كان في التماسك والتماسك (ΔΔ = 0.85)، مما يشير إلى أن التغذية الراجعة المنظمة المرتبطة بالمعايير تعزز التنظيم على مستوى أعلى بالإضافة إلى الدقة. تتوافق هذه النتائج مع أبحاث DWCF السابقة التي أظهرت أن التغذية الراجعة المتكررة والشاملة تحسن دقة الكتابة مع مرور الوقت14،15،16،17.
يتضمن سير عمل STEP-DWCF-R ثلاث خطوات حاسمة. أولا، يولد نظام الذكاء الاصطناعي تغذية راجعة مفصلة عبر أربع فئات (القواعد، المفردات، التنظيم، التفكير) باستخدام مخطط JSON مقيد وتوجيه نظام موحد. ثانيا، يقوم المعلم بتعديل النتائج لإزالة الإيجابيات الكاذبة، وإضافة المشكلات الحرجة المفقودة المتوافقة مع معايير IELTS، وضمان صياغة قابلة للتنفيذ ومشجعة، والحفاظ على الاتساق مع مخطط الفئات الأربع. تعد هذه الخطوة الإشراف آلية أساسية لحل المشكلة، حيث تصحح هلوسات الذكاء الاصطناعي أو التصحيح الزائد الذي قد يرهق المتعلمين. ومن الجدير بالذكر أن وقت الرقابة على المعلم لكل مهمة كان أقل في STEP-DWCF-R مقارنة ب WCF (13.8 دقيقة مقابل 23.5 دقيقة)، لأن الذكاء الاصطناعي يولد التغذية الراجعة المنظمة الأولية وكان المعلم يراقبها فقط. ثالثا، يتم تقديم الملاحظات الخاضعة للإشراف عبر واجهة وكيل الذكاء الاصطناعي الروبوتية عبر الويب، والتي تسجل شكر المتعلمين وإعادة تقديمهم عبر عدة جولات.
مقارنة بالأساليب الحالية، يعالج STEP-DWCF-R قيودا واضحة. يظل نظام WCF التقليدي ذو الجولة الواحدة مقيدا بوقت المدرب، ويوفر عادة فرصا محدودة للمراجعة المستمرة. توفر أدوات تقييم الكتابة الآلية قابلية للتوسع لكنها غالبا ما تقدم تعليقات ثابتة ومجزأة يصعب على المتعلمين ترجمتها إلى مراجعات ذات معنى20، 21، 22. أظهرت الدراسات المبكرة لنظام DWCF فعالية دورات التغذية الراجعة متعددة الجولات، ومع ذلك أثار اعتمادها على تصحيحات من تأليف المدربين مخاوف حول الجدوى في الفصول الكبيرة14، 15، 16، 17. أفادت دراسات حديثة للتغذية الراجعة التوليدية بالذكاء الاصطناعي عن تكافؤ مع ملاحظات المعلمين حول نتائج الكتابة، ولكن دون رقابة منظمة أو تقديم تكراري18,19. يجمع STEP-DWCF-R بين قابلية التوسع للذكاء الاصطناعي مع إشراف المعلمين وتقديم وكيل الذكاء الاصطناعي الآلي التكراري، محققا عبء عمل أقل للمعلمين مع زيادة تكرار المراجعة.
نحن نعترف بعدة قيود. حجم العينة الصغير نسبيا (N = 32) يحد من قابلية تعميم نتائجنا، ويجب اعتبار الدراسة تحقيقا تجريبيا. اختلفت الحالتان في جرعة التغذية الراجعة: تلقت مجموعة WCF جولة واحدة فقط من التغذية الراجعة لكل مهمة، بينما خضعت مجموعة STEP-DWCF-R لجولتين إلى ثلاث جولات تكرارية. لذلك، يعكس الأداء المتفوق لمجموعة STEP-DWCF-R التأثيرات المشتركة لدورات مراجعة متعددة، والتغذية الراجعة التي تولدها الذكاء الاصطناعي، ومراقبة المعلمين، بدلا من التأثير المعزول للوكيل الآلي الذكاء الاصطناعي أو طريقة تقديمه. الوكيل الآلي للذكاء الاصطناعي هو واجهة افتراضية بحتة قائمة على الويب، لذا لا يمكن فصل تأثيراته عن تأثيرات البنية التكرارية نفسها. لم يتم تضمين التغذية الراجعة البشرية متعددة الوسائط (مثل الكلام مع الإيماءة) كشرط تحكم لأنها ليست ممارسة قياسية في صفوف كتابة اللغة الإنجليزية كلغة أجنبية تقليدية وستتطلب نموذجا تجريبيا منفصلا. يجب أن تتضمن الدراسات المستقبلية مجموعات ضابطة مطابقة للجرعات (مثل تغذية راجعة المعلمين متعددة الجولات) لزيادة تفكيك هذه المكونات.
على الرغم من هذه القيود، يقدم إطار STEP-DWCF-R توجيهات عملية لتعليم الكتابة بمساعدة الذكاء الاصطناعي. تسمح بنيتها المعيارية التكاملية في أنظمة إدارة التعلم لدورات اللغة الإنجليزية كلغة أجنبية واسعة النطاق، ويمكن تكييف المخطط المنظم المكون من أربع فئات ليتناسب مع الكتابة الأكاديمية أو الأنواع الخاصة بالتخصصات. قد تستكشف الإصدارات المستقبلية التقديم متعدد الوسائط للاستفادة من فوائد التفاعل النظرية للوكلاء المتجسدين، رغم أن التجربة الحالية تؤكد جدوى التعاون النصي التكراري بين الذكاء الاصطناعي والمعلم. ومع ذلك، فإن النمط المتسق عبر مقاييس النتائج، ومؤشرات العمليات، والموثوقية القوية بين المقيمين تدعم جدوى وفعالية هذا النهج متعدد المكونات في سياقات EFL مماثلة.
لا توجد مصالح متنافسة بين المؤلفين.
تم تمويل هذا العمل من خلال منحة جسر من جامعة ساينس ماليزيا، رقم المشروع: R501-LR-RND003-0000001342-0000.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| Flask (Web Framework) | Pallets Projects | https://flask.palletsprojects.com | الإصدار 2.1؛ يُستخدم لواجهة الويب الخاصة بوكيل الذكاء الاصطناعي الآلي |
| API GPT-5 | OpenAI | https://platform.openai.com | نموذج gpt-5، درجة الحرارة=0.7؛ لتوليد ملاحظات JSON منظمة |
| Jinja2 | Pallets Projects | https://jinja.palletsprojects.com | قوالب التقديم على الخادم لواجهة الويب |
| Python | مؤسسة برمجيات Python | https://www.python.org | الإصدار 3.10؛ برمجة خلفية |
| Windows 11 | Microsoft | https://www.microsoft.com/windows | نظام تشغيل لنظام تغذية الذكاء الاصطناعي |
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن