مقالة بحثية

التحقيق في تأثير تقييم الكتابة الآلي من خلال الشبكة العصبية العميقة والتقييم الكتابي للمعلمين على أداء الكتابة الإنجليزية

DOI:

10.3791/69995

مايو 8, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم استخدام توفير الملاحظات على شكل ميزتين تعتمد على لغة اللغة الطبيعية عبر نظام الحاسوب وتغذية راجعة المعلم الكتابية لتحسين طلاقة الطلاب في الكتابة باللغة الإنجليزية ودقتها. أظهرت النتائج إيجابية بشأن الأول.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

حققت تقنيات تعلم اللغة بمساعدة الحاسوب أكبر الإنجازات في تعلم اللغات، خاصة في سياق الذكاء الاصطناعي (AI)، خلال السنوات القليلة الماضية. هناك تقنيات متنوعة، مثل التقييم الآلي للكتابة (AWE فيما بعد) وتقييم المقالات الآلي (AES)، التي تعتبر ركائز لتعلم اللغات، ليس فقط في تخصصات الحاسوب بل أيضا في التعليم. يمكن إجراء التقييم فقط على شكل درجات شاملة باستخدام تقنية AWE، التي كانت فعالة جدا في تعزيز تعلم اللغات، وبالتالي لا يمكنها تقديم ملاحظات مفصلة أو معمقة. لتوفير تغذية راجعة كتابية مفصلة حول عنصرين رئيسيين في اللغة (وهما: القواعد والطلاقة)، تم النظر في نظام تنفيذ بمساعدة الحاسوب يتضمن نماذج الشبكات العصبية، وطريقتين لمعالجة اللغة الطبيعية القائمة على الدلالة (NLP فيما بعد). ولهذا الغرض، تم تعيين 90 طالبا جامعيا باكستانيا كانوا متعلمي اللغة الثانية للإنجليزية (ESL) بشكل عشوائي إلى مجموعات الضابطة، وتعليقات المدربين، والمجموعات التجريبية. شمل التقييم بمساعدة الحاسوب شبكة عصبية. أظهرت نتائج اختبار المقارنة بين نموذج AWE الأساسي والمدربين الذين قاموا بالتقييم وجود ارتباط بين التغذية الراجعة بمساعدة الحاسوب التي استخدمت هذه الشبكات العصبية. تكمن تداعيات هذه النتائج في تدريس الكتابة في اللغة الإنجليزية كلغة ثانية، خاصة في الحالات التي تشكل فيها الدقة اللغوية والطلاقة تحديا.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تعالج التغذية الراجعة في الكتابة خصائص مختلفة للغة، مثل التنظيم، والقواعد، والطلاقة، والمحتوى، والآليات، مما يمكن المتعلمين من إعادة كتابة أو إنشاء نص مكتوبجديد 1,2,3. حاليا، كان معلمو الكتابة الإنجليزية من المستفيدين الرئيسيين بسبب التغيرات السريعة والتطورات في تعلم اللغة بمساعدة الحاسوب (CALL فيما يلي) وتقييم الكتابة بمساعدة الحاسوب على شكل AWE أو AES وتقييم المقالات المكتوبة4. بالإضافة إلى ذلك، يوفر التقييم الحاسوبي للكتابة الإنجليزية ملاحظات تشخيصية حول العناصر اللغوية مثل المحتوى، والقواعد، والمفردات، وغيرها، مما يوفر ردودا فردية وموضوعية في الوقت المناسب على نص الطلاب المكتوب. كما أن نظام AWE قادر على تقديم إجابات مكتوبة واضحة للطلاب لجعلهم يستوعبون المعرفة المكتسبة من خلال هذه الردود الكتابية ويزيد من القدرة الإدراكيةالستةمن الطلاب.

استندت الدراسة الحالية إلى بحث4، قدم مفهوم تعلم الكتابة الإنجليزية متعدد الاستراتيجيات قائم على الحاسوب مع منظور نظرية تغذية راجعة الكتابة الإنجليزية وعملية التقييم التحليلي في الاعتبار. شمل ذلك نماذج أخرى تعتمد على الدلالة في معالجة اللغة الطبيعية التي دمجت التعلم العميق في التغذية الراجعة المكتوبة لتقديم تقييمات متقنة للتغذية الراجعة المكتوبة. يتناول حدود تقنية AWE السابقة، التي تركز فقط على التقييم الشمولي وليس التحليلي المحدد. وبالتالي، يرتبط الأمر أكثر بالتقييم الدقيق والفوري مع درجات أقل وكلية لسلسلة من عناصر المؤشرات اللغوية لتحسين تعلم الكتابة الإنجليزية بين الطلاب. من بين مختلف خصائص اللغويات (أي المحتوى، التعقيدات، الصحة، الطلاقة)، ستفحص الدراسة الحالية فقط الطلاقة والجانب النحوي لمتعلمي اللغة الإنجليزية كلغة ثانية في باكستان. لهذا الغرض، تقترح الدراسة الحالية استراتيجية لتقنية معالجة اللغة الطبيعية تتضمن استخدام الشبكات العصبية مصحوبة بتقييم المعلمين.

في سياق تعلم اللغة الباكستانية، يواجه الطلاب الباكستانيون مشاكل في تعلم الكتابة الإنجليزية، رغم أن الطلاب يعتبرون دراسة اللغة الإنجليزية مادة إلزامية تبدأ من الصف الأول وتستمر حتى الصف الرابع عشر. هنا تأتي أهمية العديد من العوامل، مثل الدورات الخاطئة واستخدام الطرق القديمة لشرح القواعد. على مستوى الجامعة، عدد الطلاب الذين يطلب من المعلمين تدريسهم كبير نسبيا لأن الطلاب لديهم خلفيات متنوعة تشمل كليات ومدارس مختلفة. هذا يجبر المعلمين على قضاء معظم الوقت في تصحيح أخطاء كتابة الطلاب، وهذا يجعل عبء العمل كبيرا جدا. من ناحية أخرى، اعتبر الطلاب ملاحظات المعلمين المكتوبة أمرا مفروغا منه ولم يبذلوا جهدا للتعرف على الأخطاء وتصحيحها.8.

ذكرت دراسة أن الطلاقة تتأثر غالبا بحقيقة أن الطلاب يخشون ارتكاب الخطأ، مما يجعلها عائقا أمام الكتابة السلاسة، وبالتالي يفضلون تجنب ارتكاب الأخطاء بشكل متكرر أكثر على الانخراط في الأفكار. هناك تدخل أحيافي للغة الأردية مع الكتابة الإنجليزية، بالإضافة إلى عوامل سياقية أخرى. علاوة على ذلك، فإن اللغة الأردية هي اللغة الوطنية. نتيجة لهذه العوامل السياقية، يجد المعلمون صعوبة في تقديم تغذية راجعة دقيقة وفي الوقت المناسب ومتسقة لكل طالب كلما أنتج الطلاب مخرجا مكتوبا أو حرروا المخطوطات. وبالنظر إلى نظرية تقييم الكتابة، ستتمكن هذه الدراسة من اتباع الدراسة التي تستخدم استراتيجية تغذية راجعة آلية للكتابة الآلية أثناء مقارنة تقييم المعلم التقليدي، وتأخذ التقييم التحليلي بدلا من التقييم الشامل لضمان حصول الطلاب على تغذية راجعة فورية حول البعدين اللغويين المهمين (أي القواعد والطلاقة).

ظهرت منتجات صناعية مختلفة من AWE وAES، والتي تشمل Pigai.org، Bingo English، My Access، E-rater، I-write، Criterion، وغيرها. تتميز AES/AWE في مراحله المبكرة من التطوير بشكل رئيسي بنظام التعلم الآلي التقليدي القائم على نظرية بايز10، والانحدار الخطي11 ، وغيرها. حاليا، استفاد التطور الموسع للتعلم العميق، وخاصة تقنية الشبكات العصبية، بشكل ملحوظ مجال كتابة التغذية الراجعة، مثل الشبكات العصبية المتكررة أو RNN12، الذاكرة طويلة المدىقصيرة المدى 13، الشبكات العصبية الالتفاوية (CNN)14، نهج BERT15. كما استفادت AWE من استراتيجيات التدريب المسبق التي تم تطبيقها في بداية NLP16. أخذت العديد من الدراسات في الاعتبار حلولا مختلفة تركز على الشبكات العصبية، مثل توليد عينات عدائية لغرض التعلم، والتعلم من خلال المهام المتعددة17، والتعلم من خلال الإشرافالذاتي 18، وخوارزميات الرسومالبيانية 19. اقترح البعض تقنيات مختلفة لمعالجة مشكلة نقص بيانات التدريب لكتابة الملاحظات20. هناك أيضا نماذج للتسجيل تساهم في العديد من نماذج الشبكات العصبية21.

تصحيح الأخطاء النحوية (GEC لاحقا) هو طريقة مستقلة لمهام معالجة اللغة الطبيعية، ولديها القدرة على الكشف التلقائي وتصحيح أخطاء التأليف. يرتبط محتوى المهام في GEC بمحتوى الجوانب في AWE. تعتبر مهام AWE في الاعتبار تشخيص الأخطاء النحوية، والتي يجب تمييز معظمها بالشكل الصحيح. ومع ذلك، لم تول دراسات AWE اهتماما كبيرا لنموذج GEC، وفقط عدد قليل من الأبحاث دمجت نموذج GEC المبكر في تقنية AWE. في البداية، يختار البحث في GEC معظم الوقت N-gram22، ونموذج اللغة23 بما في ذلك BERT24 لتحديد وتصحيح الأخطاء النحوية. ومع ذلك، لم تستطع الحلول السابقة حل مشاكل مثل الفوضى وحذف المكونات بشكل كامل. حققت بنية الترميز-فك الترميز25 نفس النجاح في GEC من خلال معالجة المشكلات التي لم تستطع نماذج أخرى معالجتها سابقا. من المهم ملاحظة أن بنى GEC المتقدمة استخدمت نماذج متعددة لحل المشكلات، بما في ذلك النهج القائم على المحولات26.

أكدت دراسات أخرى فعالية AES مقارنة بالتقييمات البشرية عند تقييم كتابة المقالات27,28. أظهرت دراسة29 تأثير التقييم الآلي على طلاقة المتعلمين في اللغة الإنجليزية. أشارت النتائج إلى أن التقييم التلقائي كان له تأثير إيجابي على طلاقة الكتابة في اللغة الإنجليزية. على النقيض من ذلك،تتجاهل بعضالدراسات الأخرى معدل الكشف العالي عن الأخطاء من قبل AES مقارنة بالتقييمات البشرية. تسلط الدراسات الحديثة الضوء على تزايد فعالية الأدوات المدعومة بالذكاء الاصطناعي في تقييم الكتابة في تعليم اللغات. إحدى هذه الدراساترقم 31، أجرت مقارنة بين التقييم الآلي وردود فعل المدربين في سياق تعلم الطلاب الصينيين.

لقد تم الإبلاغ بنشاط عن الدور الثوري للأدوات المعتمدة على الذكاء الاصطناعي في الكتابة الأكاديمية في الأدبيات الحديثة. تسلط الأبحاث المتعلقة بتطبيق أدوات الكتابة المدعومة بالذكاء الاصطناعي كمكملات لتعليم الكتابة التقليدي في اللغة الإنجليزية كلغة أجنبية الضوء على الأهمية القصوى لتكافؤ الفرص والدعم الاستباقي من المعلمين في تنفيذ التكنولوجيا32 بنجاح. أشارت الدراسات التي بحثت في AWE، مثل Pigai، إلى وجود ارتباط قوي بين التغذية الراجعة تحت دعم الحواسيب وتعزيز كتابة اللغة الإنجليزية كلغة ثانية، والمراجعة، وقطع جديدة من الكتابة33. سلطت دراسة أخرى الضوء على فوائد المشفرات الذاتية التباينية (VAEs) التي تؤثر إيجابيا على جانب تدريب الكتابة الإنجليزية لدى المتعلمين وتحصل على ملاحظات على مستويات أعلى من التعلم العميق، مع تخصص في السمات اللغوية المختلفة34. أشارت دراسة أخرى إلى أن أنظمة AWE العصبية ستكون فعالة للاستخدام مع GEC المعتمد على معالجة اللغة الطبيعية، والذي يستخدم التعلم العميق لتقديم تقييم فوري35.

يعد تحسين أنظمة الوكلاء المتعددة خطوة مهمة في تطوير التقنيات التي تساعد في الكتابة. مثال على كونها متعددة الوكلاء، مساعد تحسين الكتابة الأكاديمية، أظهرت أكاديمي كرافت، المبنية على التعلم العميق، قدرات على الكتابة وتقديم الملاحظات التفصيلية، مما يسهل دعم الكتابة المعتمدة على الذكاء الاصطناعي للتعليم الإنجليزي كلغة أجنبية/اللغة الإنجليزية كلغة ثانية، وفقا لأنظمة تحليلية معقدة36. في الواقع، حددت دراسات تعلم اللغة القائمة على التكنولوجيا أيضا أنماطا ناشئة متنوعة مثل التعلم العميق، والتقييم التلقائي، والتغذية الراجعة الدلالية مع تحليل الأداء الذي أظهر ارتفاعا تدريجيا ومتسقا في دقة الكتابة، بالإضافة إلى تفاعل المتعلمين37.

أظهرت نماذج ترانسفورمر-LSTM ميلا إلى التقييم التلقائي والتغذية الراجعة التي تتم على الكتابة الإنجليزية. أخذت هذه البنى الهجينة الفهم السياقي للمحولات جنبا إلى جنب مع المعالجة التسلسلية لأنظمة LSTM، وخلصت إلى إظهار دقة محسنة فيما يتعلق بتصنيف القواعد والتماسك وتوفير تغذية راجعة أكثر دقة في جيل38. تشير نظرة معلمي اللغة الإنجليزية كلغة أجنبية على أدوات الكتابة بالذكاء الاصطناعي باستمرار إلى تحسينات ملموسة في تنظيم المحتوى وجودة الكتابة، مع التركيز على الدور الحاسم للمساعدة التربوية في تحفيزفائدة التكامل التكنولوجي. هناك دراسات أقل تقارن بين ملاحظات المدربين والتغذية الراجعة المدعومة من الحاسوب، مما يشير إلى نماذج تعلم عميق لاستكشاف تأثير الطلاقة والقواعد على كتابة اللغة الإنجليزية لدى المتعلمين في اللغة الإنجليزية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

جميع البرامج والأدوات المستخدمة في الدراسة مدرجة في جدول المواد.

معايير التقييم

التصنيف المعتمد في هذه الدراسة يعطي مجالين رئيسيين، وهما الطلاقة والدقة، اللذان يتضمنان جميع متطلبات التقييم الشامل للكتابة باللغة الإنجليزية كلغة أجنبية (EFL). تهدف هذه الأبعاد إلى قياس النقاط الرئيسية في جودة الكتابة التي تساعد في التواصل الفعال وإثبات مهارة اللغة. تقيس وحدة الطلاقة الطبيعية والتعبير والتماسك في الكتابة من خلال قياس سلاسة الأفكار وكذلك مدى جودة استخدام الكلمات وبنية الجمل. تستهدف وحدة الصوابية الدقة النحوية الدقيقة، والكفاءة الميكانيكية، والامتثال للمعايير الإنجليزية القياسية، ونظريا، تقيس وتحسب خطأ اللغة على عدة مستويات. (انظر الجدول 1)

تعريف المهمة

وفقا لشروط تقييم الكتابة الآلي للطلاب الذين يتعلمون اللغة الإنجليزية، تقترح الدراسة الحالية نموذجا جديدا لنظام تقييم كتابة اللغة الإنجليزية بمساعدة الحاسوب بمساعدة EG. مقارنة بالدراسات السابقة التي كانت محدودة بنطاق أنظمة تقييم الكتابة الآلية، سيساعد النظام المقترح في حل هذه القيود من خلال إدخال تقنيات التعلم العميق المبتكرة التي تتيح للمستخدمين مستوى من التحليل اللغوي، ونطاق التعديل، وتحليل التغذية الراجعة على مستوى النظام بناء على معالجة البيانات الواسعة. وبناء على اثنين من أهم مؤشري التركيب، وهما الطلاقة (مدى طبيعة العمل وتناسقه وتعبيره)، أو الدقة (مدى دقة كتابة النص المليء بالأخطاء النحوية والميكانيكية واللغوية بشكل صحيح)، مع المكونات المنفصلة للشبكات العصبية، يجب على نظام النموذج المزدوج إجراء عدد من التقييمات. بالإضافة إلى ذلك، يحدد الأخطاء على عدة مستويات لغوية، ويوصي بإجراءات تصحيحية، ويقدم ملاحظات في قائمة لتمكين المستخدمين من تحسين تعلم الطلاب للغة بطريقة منهجية. لوصف عملية حساب نظام التقييم التلقائي بمساعدة الحاسوب، نقترح النموذج الرياضي التالي في الصيغ (1)–(4) (انظر الجدول 2).

figure-protocol-1(1)

figure-protocol-2(2)

figure-protocol-3(3)

figure-protocol-4(4)

حيث: الدرجة النهائية = درجة تقييم الكتابة المركبة؛ w1 = الوزن المخصص لدرجة الطلاقة؛ w2 = الوزن المخصص لدرجة الصحة؛ Sf = درجة الطلاقة المعتمدة على BERT (تم تطبيعها إلى [0, 1]); Sc = درجة صحة الانحلال الأسي; λ = عقوبة الخطأ التي تتحكم بها ثابت التدهور؛ σ(x) = دالة تنشيط السينغمويد اللوجستية؛ نسبة الخطأ = نسبة الأخطاء إلى إجمالي الرموز في النص. يتم تطبيع درجات الطلاقة إلى [0, 1] بواسطة دالة السيجمويد اللوجستية σ(x) بينما تستخدم دالة التراجع الأسي في تقييم الصواطنة لفرض عقوبة مناسبة على تكرار الخطأ.

بنية النظام وتصميمها

تستخدم بنية النظام نظام نموذجين مع بنية معالجة متوازية، حيث يتم تحليل مقالات الإدخال بالتوازي عبر مسارات تقييم متوازية. وحدتا الطلاقة والدقة، بدورها، تعطيان درجات متتالية، والدرجة المركبة النهائية هي المتوسط المرجح للدرجتين الفرعيتين. تقدم وحدة الصوابية أيضا اقتراحا حول اكتشاف وتصحيح الأخطاء، بالإضافة إلى التقييم (انظر الشكل 1).

وحدة الطلاقة

يمكن تعريف طلاقة الكتابة بأنها طبيعة أو نمط استخدام اللغة فيما يتعلق بالاختيار الصحيح للمفردات، تنوع بنية الجمل، تعقيد النحو، التماسك، وغيرها. تلتقط نماذج تقييم الطلاقة الأفكار التي تنقل دون تلعثم أو إحراج، وتبدو قريبة من اتجاهات التواصل التقليدية التقليدية. يعتمد قياس الطلاقة التقليدي على المقاييس، مما يبرز مخاوف موثوقية المقيمين المشتركين. يتغلب النظام المقترح على هذا العيب لأنه يتضمن شبكة عصبية قائمة على BERT لتحفيز التماسك الدلالي والطبيعية اللغوية تلقائيا من خلال الفهم العميق للظرف. تم اتخاذ هذا القرار المعماري بالنظر إلى نقاط قوة BERT، التي ثبت فعاليتها في تحديد العلاقات السياقية والأنماط الدلالية الضرورية لقياس الطلاقة. يتم تغذية تسلسلات الإدخال إلى النظام وتمريرها عبر 12 طبقة محول مع تركيز ذاتي متعدد الرؤوس لتحديد التبعيات طويلة المدى والعلاقات السياقية (انظر الشكل 2).

آلية الانتباه ستكون كما يلي:

figure-protocol-5(5)

لتكن Q و K و V هي المصفوفات التي تمثل الاستعلام والمفتاح والقيمة على التوالي، وd و k هما أبعاد المتجهات الرئيسية. تضمين رمز CLS هو التضمين الملخص، الذي يسجل التماسك الدلالي الكلي لتسلسل الإدخال بأكمله.

حساب درجة الطلاقة هو كما يلي:

figure-protocol-6(6)

حيث hCLS هو تضمين رمز BERT [CLS]، وWreg هما b reg معلمات رأس الانحدار، و σ هي دالة تنشيط السيجمويد التي تطبيع الناتج إلى [0, 1].

وحدة الصحة

يركز تقييم الدقة على الدقة النحوية، والدقة الميكانيكية، والالتزام بالقواعد الإنجليزية القياسية. يتناول هذا البعد الجوانب التقنية للكتابة، بما في ذلك النحو، والصرف، وعلامات الترقيم، ودقة الإملاء. لا يقتصر مكون الصواب على تقييم عدد الأخطاء اللغوية، بل يفحص أيضا تأثيره على الجودة العامة للنص. على عكس تقييم الطلاقة الذي يركز على التماسك الدلالي والتدفق الطبيعي، تتطلب وحدة تقييم الصحة تحديد الأخطاء بدقة وتصحيحا منهجيا. تميز الوحدة بين أنواع الأخطاء المختلفة، وتقيم شدتها، وتوفر تصحيحات مستهدفة لدعم تحسين التعلم. يستخدم فقدان الصوابة نموذج FLAN-T5، الذي تم ضبطه بدقة لاكتشاف وتصحيح الأخطاء النحوية. يستند هذا الاختيار إلى قابلية تحويل النص إلى نص في T5 التي تسمح للنظام ليس فقط باكتشاف الأعطال، بل أيضا بعرض التصحيحات ذات الصلة داخل نظام واحد. النظام هو شكل مشفر-مفكك، ويتم تغذية النص على شكل هذا التحويل: (انظر الشكل 3)

figure-protocol-7(7)

ينتج عنصر المشفر تمثيلات حساسة للسياق لا تلتقط فقط الاتجاهات النحوية بل أيضا مناطق الفشل المحتملة:

figure-protocol-8(8)

بمساعدة توليد الاختلافات النحوية المناسبة للأخطاء التي تم تحديدها بشكل خاطئ، يقوم جهاز فك الترميز بتوليد تسلسلات مصححة:

figure-protocol-9(9)

هذا النوع من المعالجة ثنائية الاتجاه يمكن النظام من الوعي بسياقات الأخطاء، وكيفية تصحيح السياقات، بحيث تكون التلميحات متماسكة دلاليا، مع التركيز على أي تصحيح في القواعد.

قياس الخطأ وخوارزمية التقييم

قارن تقييم الدقة الكتابة الأصلية بالنسخة الصحيحة من الكتابة، مع الأخذ في الاعتبار الأخطاء اللغوية والشدة بناء على الموقع داخل النص والتداخل مع المعنى. تلتقط هذه الطريقة التمييز بين أنواع الأخطاء مقارنة بتأثيرها على فهم النص النصي. تم التأكيد على العلاقة بين تكرار الأخطاء وجودة النص الرديئة، بطريقة لوغاريتمية في نظام التقييم. خطوة أساسية في مقارنة الرموز بين النص الأصلي والنص المصحح هي درجتان من المقارنة تستند إلى تقنية محاذاة السلاسل النصية على مستوى بت. تشمل المرحلة الثانية تحديد وتصنيف أنواع الأخطاء بناء على بعض التصنيفات اللغوية المعروفة التي تميز بين الأخطاء النحوية (توافق الفاعل مع الفعل، اتساق الزمن، وموثوقية البنية النحوية)، والأخطاء الميكانيكية (الحروف الحروفية، علامات الترقيم، والإملاء)، وأخطاء الاستخدام (اختيار الكلمات، التعبير الاصطلاحي، وملاءمة السجلات). المرحلة الثالثة هي حساب نسبة الخطأ بناء على الطول الكلي للنص. تستغل الخطوة الرابعة خوارزمية تقييم الانحلال الأسي التي تحول نسب الأخطاء إلى درجات صحة قابلة للتفسير مباشرة لتقريب الاعتماد غير الجمعي وغير الخطي بين تكرار الأخطاء وجودة النص.

يبدأ المعالجة الرياضية لعملية قياس الأخطاء بحساب نسبة الأخطاء المثبتة، مما يوفر معدل تثبيت خطأ مطبع، مما يسمح بدوره بإجراء مقارنة عادلة لنصوص بأطوال مختلفة:

figure-protocol-10(10)

figure-protocol-11(11)

تم تحديد معامل معايرة 2.5 على أساس تجريبي من خلال التحقق الكامل من ذلك بأحكام الخبراء البشرية، بحيث يمكن لدالة التقييم تقديم نتائج تتماشى مع فهم الإنسان فيما يتعلق بانخفاض جودة النص مع زيادة تكرار الأخطاء. تعيين هذه القيمة بهذه الطريقة يضمن أن أي نص ذو معدل خطأ منخفض (Error_Ratio < 0.1) يحصل على درجة عالية من الدقة لأنه يتبع قواعد الإنجليزية القياسية بدقة، وأي نص ذو معدل خطأ متوسط (0.1 < Error_Ratio ≤ 0.3) له درجة صحة متوسطة تشير إلى وجود بعض المخاوف اللغوية التي ليست كارثية بشكل كامل. وأي نص ذو معدل خطأ مرتفع (Error_Ratio > 0.3) حصل على درجة منخفضة من الصحة بسبب وجود مخاوف لغوية حرجة تؤثر بشكل كبير على إمكانية الفهم.

تأخذ خوارزمية تقييم الصوابية لتقييم الصواب في الاعتبار بشكل منهجي جميع الأخطاء التي تم تحديدها وإصلاحها بواسطة النظام القائم على T5 كعناصر جزائية في حساب نسبة الخطأ النهائية. آلية الجزاء المستخدمة للأخطاء النحوية تمثل بالانخفاض الأسي في نمو نسبة الخطأ نحو القيم العالية، مما يعني أن جودة النص ضعيفة جدا، وتصبح 100 عندما تساوي نسبة الخطأ 0، مما يعني أنه لا توجد أخطاء على الإطلاق. وهو استخدام مثالي للمعايير الإنجليزية. تضمن هذه العلاقة الرياضية أن كود الصواب يقدم تمييزا كبيرا ضمن كامل طيف مستويات الكفاءة اللغوية ويستجيب للتقدمات الصغيرة المتعاقبة التي تشير إلى اكتسابات حقيقية.

مجموعات البيانات: مجموعة التدريب والتقييم

تعد بيانات التدريب ذات الجودة والنطاق الكافيين أمرا بالغ الأهمية لأداء نظام النماذج المزدوجة. استخدمت الدراسة الحالية مجموعة بيانات مصممة جيدا من النصوص التي كتبها الطلاب لتطوير وتقييم النموذج، والذي تم إنتاجه من خلال مهام كتابة مختلفة. تكونت العينة من 45 طالبا في الجامعات الباكستانية و45 طالبة في الجامعات الباكستانية بمتوسط أعمار 19 سنة، يدرسون 'اللغة الإنجليزية الوظيفية' كمادة إلزامية. كتب كل طالب ثمانية مقالات لمدة ثمانية أسابيع، بما في ذلك مقالات ما قبل الاختبار، ومقالات التدخل، ومناسبات ما بعد الاختبار. سمح للطلاب بإنتاج 400–450 كلمة لكل مهمة كتابة. توفر إحصائيات مجموعات البيانات الخصائص التالية:

70,500 كلمة

متوسط طول الجملة: 15.7 كلمة (SD = 3.2)

نطاق المفردات (نسبة النوع إلى الرمز): 0.64 (SD 0.08) كثافة الأخطاء النحوية: 2.3 في 100 كلمة (SD = 1.1)

مبرر وضمان جودة البيانات للبيانات المختارة

تم اختيار مجموعة البيانات بناء على بعض الاعتبارات المهمة التي سمحت بثراء وملاءمة العمل البحثي حول تقييم الكتابة الآلي. في البداية، تم اختيار طلاب الاقتصاد بسبب طبيعتهم، المشابهة لمتعلمي اللغة الإنجليزية كلغة أجنبية في التعليم العالي الباكستاني، مما أتاح عرض عينات كتابة أكثر أصالة تعكس الأوضاع الواقعية. ثانيا، تم بناء بيانات الدراسات التجريبية على تحديد النطاق الأقصى والأدنى للكلمات، 400–450 كلمة، إلى أن هذا النطاق معقد لغويا بما يكفي لتحليله بشكل موثوق بواسطة آلة، وظل في نفس الوقت بحجم قابل للإدارة من حيث التقييمات البشرية المتسقة. تم تقييم كل تركيبة من قبل ثلاثة معلمين مدربين في اللغة الإنجليزية (موثوقية بين المقيمين κ = 0.847، بعد الطلاقة، و0.823، بعد الدقة) على مقاييس موحدة من 10 نقاط للطلاقة وتقييم الدقة. كان تدريب المقيمين البشريين صارما ويعتمد على معايير تقييم مطورة فيما يتعلق بتقييمات كتابة IELTS وTOEFL. تتكون البيانات من مجموعة بيانات مشروحة من قبل الإنسان، يمكن استخدامها في تدريب والتحقق من صحة النماذج ليتم تدريبها على بيانات بشرية مشروحة.

إجراءات معالجة البيانات والتحقق منها

تمت معالجة مجموعة البيانات مسبقا بشكل منهجي وشملت تطبيع النص، وترميز النص باستخدام أداة BERT WordPiece، وإجراء فحوصات تحقق من الجودة. لم يتم تضمين أولئك الذين قدموا أعمالا غير مكتملة وأنتجوا نصوصا منسوخة لتحديد سلامة البيانات. تم تقسيم البيانات الأخيرة عشوائيا إلى تدريب (70٪، n = 189)، التحقق (15٪، n = 41)، ومجموعات الاختبار (15٪، n = 40) من خلال أخذ عينات طبقية لجعلها متوازنة عبر مستويات الكفاءة ونوع المهام. تحليل لغوي لمجموعة مرجعية كبيرة تحتوي على نصوص أكاديمية محررة بشكل احترافي، ومقالات من الصحف، ومقالات منشورة، وتنتج حوالي 50 مليون كلمة. يوفر هذا النموذج أنماط اللغة اللازمة لإجراء اختبارات الطلاقة ويساعد في إجراءات اكتشاف الأخطاء من خلال مقارنتها بالاستخدام القياسي. في مجموعة المراجع المرجعية، الخطوات قبل المعالجة المبدئية والفهرسة هي الترميز، وسم أجزاء الكلام، وتحليل النحو، والتسمية الدلالية لتسهيل الوصول الفعال أثناء التقييم في الوقت الحقيقي.

استراتيجية تدريب نموذج الطلاقة

يقترح نظام تحسين تسلسلي لتدريب البيانات على تحقيق الطلاقة. استخدم التدريب ميزات متطورة، بما في ذلك جدولة معدلات التعلم التكيفي، وحجم الدفعة التدريجي، وطرق تنظيم متقدمة تمنع الإفراط في التكييف مع تقدم التدريب، مما يحافظ على فعالية النموذج في تحديد الأنماط اللغوية التي تدل على طلاقة اللغة. معدل التعلم هو 5 × 10-4 مع جدول تلاشي خطي، مهيأ لضمان بقاء التقارب مستقرا ولا يتذبذب حول قيم المعلمات المثلى. يتم اختيار معدل التعلم هذا من خلال البحث الشبكي في [1 × 10-6، 1 × 10-4] مع كون 5 × 10-5 هو المعادلة الأنسب بين سرعة التقارب والاستقرار. سيتم تقييد التدريب الحقيقي بثلاث فترات فقط، وهو تكوين تم تحسينه بناء على الفوائد التجريبية من خلال تتبع فقدان التحقق لمنع الإفراط في التوافق دون منع تحديثات كافية للمعلمات لجعل التعلم فعالا. تم إجراء توقف مبكر للآليات مع صبر لفترتين ودلتا أدنى 0.001 لمنع التحلل.

يتم تنفيذ التحسين بواسطة محسن AdamW، مع خيارات مبسطة مثل β₁ = 0.9 (الزخم، الذي يتحكم في تراجع تقديرات العزم الأول بشكل أسي)، β₂ = 0.999 (تقدير العزم الثاني، الذي يتحكم في تراجع تقديرات العزم الثاني أسيا)، و ε = 1 × 10⁻8 (مصطلح الاستقرار العددي). تنظيم تناقص الوزن (λ = 0.01) يمنع نمو مقاييس المعلمات بشكل مفرط، مع اختيار هذه القيمة من خلال تحليل أداء التحقق عبر النطاق [0.001، 0.1]. المراقبة المعقدة قادرة على مراقبة مؤشرات مختلفة عبر التدريب لضمان أفضل أداء للنموذج وتجنب الإفراط في التركيب. تشمل إطار المراقبة ما يلي:

تتبع الخسارة: يتم تتبع فقدان التدريب والتحقق في كل حقبة، ويحدث التوقف المبكر تلقائيا عندما لا يتحسن فقدان التحقق خلال حقبتين متتاليتين.

مقاييس الأداء: تستخدم بيانات التحقق في حساب معاملات ارتباط بيرسون بين الدرجات المتوقعة والفعلية كل 100 خطوة تدريب.

استشعار التدرج: تتم مراقبة معايير التدرج لاكتشاف الانحدار المتلاشي والانفجاري، وعند معيار تدرج 1.0، يتم تطبيق قص التدرج.

جدولة معدل التعلم: يتم اكتشاف انخفاض معدل التعلم القائم على التحقق (العامل = 0.5) في حالة وجود أكثر من هضبة حقبة واحدة.

مرتبطة بالتنظيم: تم العثور على معدلات التسرب (0.1 لمرض BERT، 0.3 لرأس الانحدار) من خلال الاستئصال المنهجي. تستخدم عدة طرق تنظيم تعتمد على منع الإفراط في التركيب خلال عملية التدريب: (1) تنظيم الانسحاب باستخدام معدلات الانقطاع المحسنة لكل نوع من الطبقة في الشبكة، (2) تناقص الوزن كما هو موضح أعلاه، (3) التوقف المبكر الذي يحدده أداء التحقق، و(4) تعزيز البيانات بناء على إعادة صياغة 15 بالمئة من أمثلة التدريب باستخدام طرق الترجمة العكسية. تم حفظ نقاط التحقق للنموذج الأفضل أداء بعد كل حقبة، وتم اختيار النماذج الأعلى تقييما بناء على درجات الارتباط الصحيح. دالة الخسارة المستخدمة في جزء تقييم الطلاقة هي متوسط التربيع للخطأ (MSE)، وهو الدالة الهدف الرئيسية لمهمة الانحدار المتمثلة في التنبؤ بدرجات الطلاقة المستمرة. صياغة الخسارة رياضيا تعطى كما يلي:

figure-protocol-12(12)

N هو حجم العينة التدريبية الكلي، y_pred، i هو درجة الطلاقة المتوقعة للعينة i، و y_true i هي درجة الحقيقة الأرضية المقابلة كما قدمها مقيمون خبراء بشريون. هذا الخسارة مفيد جدا في تثبيط الخطأ التنبؤي الفعلي بشكل تربيعي بحيث تجذب الأخطاء الأكبر عقوبة أكبر، وتكون قابلة للاشتقاق أيضا. آلية جدولة معدلات التعلم متقدمة للغاية مع عملية ذات مرحلتين، وتبدأ بمرحلة تسخين خطية، تليها عملية تلاشي منهجية لإنشاء ميزات تقارب مثالية. يتم ذلك في مرحلة الإحماء، حيث يبدأ معدل التعلم من الصفر ويتغير تدريجيا إلى الحد الأقصى، وبعد ذلك يتم تحسين معلمات النموذج بالنسبة لمجموعة بيانات التدريب. التعبير الرياضي لمرحلة الإحماء هو:

figure-protocol-13(13)

بعد مرحلة الإحماء، يتم تقليل معدل التعلم بطريقة خطية منهجية لتجنب تجاوز قيم المعلمات المثلى، مما يؤدي إلى تقارب مستمر. رياضيا، تقرأ مرحلة التحلل كالتالي:

figure-protocol-14(14)

حيث t هي خطوة التدريب الحالية، وlr max هو الحد الأقصى لمعدل التعلم الذي تم تحقيقه أثناء الإحماء، والإحماء هو عدد الخطوات المخصصة لمرحلة الإحماء، والإجمالي هو إجمالي عدد خطوات التدريب عبر جميع العصور. تضمن إجراءات الجدولة المذكورة التعلم العنيف للنموذج في المستويات الأدنى والاستقرار على مستويات التقارب.

استراتيجية تدريب نموذج الصوابية

استند نموذج الصوابية إلى استراتيجية التعلم التحويلي باستخدام نموذج FLAN-T5 المدرب مسبقا للاستفادة من جميع المعرفة النحوية المتاحة حسب الحاجة. كان الهدف من ذلك النظر في الفهم العام للغة بالإضافة إلى المعلومات المحددة المتعلقة بالأخطاء التي يرتكبها متعلمي اللغة الإنجليزية كلغة ثانية. استخدمت طريقة التعلم التحويلي إلى نقطة التحقق pszemraj/flan-t5-large-grammar-synthesis كنموذج أساسي، مع عدة مزايا ملحوظة من حيث الدقة. نظرا لأن النموذج مدرب بالفعل ويمتلك قدرة عالية على فهم اللغة تم تدريبها في مجالات نصية مختلفة، فسوف يتكيف مع العديد من أساليب الكتابة ومواضيع الكتابة. على وجه الخصوص، تم إجراء ضبط دقيق خاص بالقواعد على مجموعات بيانات تصحيحية كبيرة تغطي أنواعا متعددة من الأخطاء النحوية كما هو الحال في الكتابة باللغة الثانية. علاوة على ذلك، تتكون نقطة التفتيش من أنظمة قوية لاكتشاف الأخطاء يتم اختبارها ضد أنواع الأخطاء المختلفة (أي الأخطاء الصرفية، والأخطاء النحوية، والدلالية)، مما يخلق معيارا مثاليا للمقارنة مع معايير اختبار التصحيح الفطري للدراسة.

تعكس عملية تكييف المجال التعديلات المنهجية على المعلمات التي لا تغير القدرات العامة لفهم اللغة للنموذج المدرب مسبقا، بل تقدم الميزات المحددة لحل مهمة تقييم الكتابة. هذه العملية من التكيف لها اشتقاق رياضي كما يلي:

figure-protocol-15(15)

هنا يمثل θالمدرب مسبقا معلمات النموذج المدرب مسبقا الذي يرمز للفهم العام للغة والمعرفة النحوية، ويمثلالمجال Δθ تحديثات المعلمات المحددة التي تم تعلمها من مهمة تقييم الكتابة المستهدفة. يتم حساب التحديثات الخاصة بالمجال من خلال تحسين قائم على التدرج على مجموعة البيانات المستهدفة، مما يضمن أن النموذج يطور حساسية خاصة بالمهمة لأنواع الأخطاء الشائعة في كتابة اللغة الإنجليزية كلغة أجنبية دون التأثير على قدراته اللغوية الأوسع.

تجارب مع المقارنات

لإثبات وظيفة معامل الارتباط المبكر، يقترح معامل بيرسون كقيمة رئيسية للقياس، والتي تحدد الصلة الخطية بين الدرجات الآلية وخبرة البشر. يتم إيجاد معامل الارتباط بواسطة الصيغة:

figure-protocol-16(16)

حيث تمثل xi الدرجات الآلية، وتمثل التقييمات البشرية، و figure-protocol-17 و figure-protocol-18 هما الوسيلان المعنيان. يتراوح معامل الارتباط بين −1 و1، مع القيم القريبة من 1 تشير إلى علاقة إيجابية قوية بين التقييم الآلي والتقييم البشري.

figure-protocol-19(17)

figure-protocol-20(18)

figure-protocol-21(19)

مقارنات النماذج الأساسية

لتقييم أداء EG وإثبات تفوقه على الطرق الحالية، تجرى مقارنات معمقة مع أساليب AWE الراسخة والأساليب التقليدية ذات المقياس الواحد. تعد هذه المقارنات الأساسية ضرورية للتحقق من القيمة المضافة لبنية EG وإثبات أن دمج الطلاقة وتقييم الدقة يوفر تحسينات قابلة للقياس مقارنة بالأساليب التي تركز على الأبعاد الفردية بشكل منفصل. يشمل اختيار النماذج الأساسية أربع فئات من التأثيرات الذهنية الذهنية، كل منها يعكس توجها مميزا نحو كيفية تقييم الكتابة. الأول يحتوي على نموذج واحد قائم على BERT لتقييم الطلاقة. تستخدم هذه النماذج هياكل المحولات لتقييم أنماط النصوص للسلاسة والتماسك. الفئة الثانية، المدرجة في المنهجيات اللغوية التقليدية، تركز على الأنظمة القائمة على القواعد لاكتشاف الأخطاء النحوية. لذا، ظل التركيز على الصحة، متجاهلا جوانب أخرى تتعلق بجودة الكتابة، مثل التماسك والمحتوى. الفئة الثالثة هي أنظمة AWE القائمة على الميزات، والتي تشمل مؤشرات التعقيد اللغوي — مثل طول الجمل المتغيرة، وتنويع المعجم، والتعقيد النحوي لتوليد درجات جودة عامة. الرابعة تأخذ الأنظمة الهجينة في الاعتبار من خلال دمج ميزات لغوية سطحية مختلفة، غالبا باستخدام طرق المجموعات أو المتوسطات المرجحة. هذه النماذج لا تصل إلى مستوى التعقيد المتكامل الذي تحققه البنى العصبية EG. يتم تقييم أداء النموذج الأساسي بثلاثة أبعاد رئيسية. الأول يقيس توافق الدرجات التي تولدها الأنظمة مع تقييمات الخبراء البشر المدربين (مدرسو اللغة الإنجليزية) باستخدام معايير موحدة. الثاني يحدد قابلية التعميم، ويحدد ما إذا كان الأداء يظل ثابتا عبر ثلاثة مقالات ذات مواضيع وتعقيد متنوعة. يعتمد البعد الثالث على الموثوقية التنبؤية، حيث يقيم دقة واستقرار التقييم من خلال أدوات إحصائية مثل متوسط الخطأ المطلق، والجذر المتوسط التربيعي، وتحليل فترات الثقة. تضع هذه الأبعاد مجتمعة إطارا قويا للمقارنة وتبرز تفوق أنظمة EG، خاصة في تحقيق دقة واستقرار أكبر من الأساليب التقليدية.

المجموعات التجريبية والضابطة

شملت هذه الدراسة 90 طالبا جامعيا في الاقتصاد كانوا يدرسون دورة لغة إنجليزية وظيفية في فصلين سليمين. تم جمع البيانات في ثلاث مناسبات: الاختبار التمهيدي، والتدخل، وبعد الاختبار لتتبع التقدم في دقة الكتابة والطلاقة مع مرور الوقت. تمت الموافقة على هذه الدراسة البشرية من قبل المجلس الاستشاري الإداري، جامعة كومساتس في إسلام آباد، حرم لاهور، باكستان. تعرض المشاركون لحالتين: التغذية الراجعة البشرية التقليدية والتغذية الراجعة المدعومة بالحاسوب. تكونت مجموعة الضابط من 45 طالبا، تلقوا الملاحظات الكتابية التقليدية من مدرس لغة إنجليزية مدرب. تلقى المشاركون ملاحظات مكتوبة حول مقالات الطلاب على شكل علامات شاملة، وتحديد الأخطاء، وتوصيات على شكل تعليقات من مدرس حول كيفية تحسين العمل. شملت المجموعة التجريبية، بدورها، 45 طالبا تلقوا نفس الطريقة في الصف، ومع ذلك تم تعزيز كتابة الطلاب بمساعدة تغذية راجعة آلية سريعة قدمها المهندس المساعد، والتي زودتهم بمعلومات التشخيص، سواء من حيث الطلاقة أو الدقة، خلال حوالي 30 ثانية من التقديم.

أجريت هذه الدراسة على مدى 8 أسابيع، حيث أجري اختبار تمهيدي (الأسبوع الأول) لتحديد الأداء الكتابي الأولي للمشاركين قبل أن يعطى الطلاب تدخلا. تم إعطاء المشاركين تغذية راجعة حاسوبية باستخدام علامات دلالية لغوية طبيعية في المجموعة التجريبية وتقييم المعلمين في مجموعة الضابطة لمدة ستة أسابيع. في النهاية، تم إجراء الاختبار التالي (في الأسبوع الثامن) لفهم الفرق بين مقاييس الدقة والطلاقة قبل وبعد الاختبار. للحصول على نتائج مماثلة في قابلية المقارنة، طلب من المشاركين القيام بمهام مماثلة كتابيا في كل فترة تقييم، مما يقلل من المتغيرات المحتملة المربكة لصعوبة المهمة ومدى إلمام المحتوى بالكتابة. لضمان توافق محفزات الكتابة مع مستوى الصعوبة، بالإضافة إلى تحديد صلاحية المحتوى، تم اختيار محفزات الكتابة بطريقة متناسقة. تم اختيار مواضيع المقالات بناء على أن الطلاب يغطيون مجالات محتوى مختلفة لمنع تأثير التدريب والملل من المشاركين من القيام بمهمة مماثلة على مدى فترة طويلة.

خلال مرحلة ما قبل الاختبار، طلب من المشاركين كتابة مقال من 400 إلى 450 كلمة والكتابة عن الأهداف الأكاديمية والمهنية. استند هذا الواجب الوصفي إلى التجربة الشخصية وتوقعات المستقبل، مما يوحي بالحاجة إلى تنظيم الكتابة، وتقديم أمثلة واضحة، وتقديم بيان منطقي للأهداف والدوافع الشخصية. كانت مهمة التدخل في الكتابة تعتمد على مواضيع مختلفة، مثل الكتابة عن الروتين اليومي للحياة، والهوايات، والسفر، واليوم الأول في الجامعة، وأيام الحياة التي لا تنسى، ولحظات الأصدقاء المقربين. كان موضوع ما بعد الاختبار مرتبطا بموضوع 'تأثير التكنولوجيا على التواصل'، وكان طول المقال المطلوب 400–450 كلمة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

صحة وموثوقية النهج الإحصائي

تم اختبار النظام على طرق إحصائية تكميلية مختلفة تقدم جميعها أدلة شاملة على تأثير EG على تطور الكتابة. هذه طريقة تحليلية متعددة الأوجه تعترف بأن التدخلات التعليمية تخضع لتحليل إحصائي معقد لا يمكن اختزاله إلى مجرد مقارنات بين المجموعات، بل إلى تحليل أنماط التغيير، وحجم التأثيرات، والارتباط بين استراتيجيات القياس المختلفة (الجدول 1، الجدول 3، والجدول 4).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تظهر نتائج التجارب عدة إنجازات مهمة. أولا، حقق نظام النموذج المزدوج ارتباطا قويا مع أحكام الخبراء البشرية (r = 0.923)، متفوقا بشكل كبير على الأساليب ذات النموذج الواحد وأنظمة AWE المعاصرة. ثانيا، كشفت دراسة التدخل المحكم عن تحسينات كبيرة في أداء طلاب اللغة الإنجليزية كلغة ثانية في الكتابة، حيث تجاوزت أحجام التأثير الكبيرة (d = 1.28) تلك التي وردت في الأدبيات الحديثة. ثالثا، أظهر النظام أداء متفوقا عبر مقاييس تقييم متعددة، بما في ذلك تقليل متوسط الخطأ المطلق (0.149) وتحسين الاتساق عبر مها...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا توجد تضارب في المصالح بين جميع المؤلفين.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

نشكر دعم جامعة كومساتس في إسلام آباد، حرم لاهور، وكلية اللغة الإنجليزية، في المساعدة على جمع البيانات من الطلاب.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
<القوي>البرمجيات / المكتبات المستخدمة في الدراسة
إطار التعلم العميقبايتورش1.13.1إطار عمل التعلم العميق لتنفيذ الشبكات العصبية
النماذج المدربة مسبقاترانسفورمرز (وجه العناق)4.21.3تحميل النماذج المدرب مسبقا، وتنفيذات نماذج BERT وT5
نموذج اللغةبيرت (تمثيلات الترميز ثنائي الاتجاه من المحولات)بيرت-بيس-أنكسدتقييم الطلاقة، تقييم التماسك الدلالي، الفهم السياقي
نموذج اللغةFLAN-T5 (شبكة لغوية مضبوطة بدقة T5)pszemraj/flan-t5-large-grammar-synthesisتصحيح الأخطاء النحوية، التحويل من النص إلى نص، اكتشاف الأخطاء
الحوسبة العدديةنومباي1.23.5الحسابات العددية، عمليات المصفوفة للدوال الرياضية
تحليل البياناتالباندا1.5.2معالجة البيانات، التحليل الإحصائي والمعالجة المسبقة
التعلم الآليسكيت-لرن1.1.3حساب المقاييس الإحصائية، تحليل الارتباط، مقاييس التقييم
التصورماتبلوتليب3.6.2تصور البيانات، مخططات تقدم التدريب، جداول الأداء
التصورسيبورن0.12.1تصور البيانات الإحصائية، خرائط الحرارة المرتبطة
مجموعة أدوات معالجة اللغة الطبيعيةNLTK (مجموعة أدوات اللغة الطبيعية)3.7معالجة النصوص المسبقة، الترميز، التحليل اللغوي
معالجة معالجة معالجة اللغة الطبيعيةسباسي3.4.4معالجة معالجة معالجة اللغة الطبيعية المتقدمة، وسم نقاط البيع (POS)، والتحليل النحوي
الترميزالرمزيون0.13.2ترميز سريع لترميز BERT وwordPiece وترميز T5
<برمجيات إحصائية وتحليلية قوية<> / قوية>
البرمجيات الإحصائيةبرنامج SPSS الإحصائيالإصدار 26.0التحليل الإحصائي، اختبارات t العينات المستقلة، تحليل التحليل العاطفي المبكر (ANOVA)، تحليل الارتباط
مجموعة بيانات التدريبمجموعة بيانات Kaggle ASAPنسخة 2012مرجع مجموعة التدريب (90٪ من نماذج AWE تستخدم هذه المجموعة من البيانات)
<مكتبات تحسين وتدريب STRONG>PYTHON
المحسنtorch.optim.AdamWبايتورش 1.13.1تحسين النموذج مع تنظيم تناقص الوزن (λ=0.01)، &بيتا؛ 1=0.9، β 2=0.999، ε=1× 10<الأجواء>-8< في السعرات>
الفقدان / التفعيلtorch.nn.functionبايتورش 1.13.1تنشيط السيغمويد، وظائف الفقدان، تنظيم الانسحاب
تحميل البياناتtorch.utils.data.DataLoaderبايتورش 1.13.1تكبير الدفعات التدريجي (4→ 16)، تحميل البيانات والتجميعات
الترميزترانسفورمرز. التوكنازر الآليترانسفورمرز 4.21.3ترميز BERT WordPiece، معالجة النص مسبقا
تحميل النماذجترانسفورمرز. أوتوموديلترانسفورمرز 4.21.3تحميل النماذج المدرب مسبقا لمعماريات BERT وT5
التحكم في التدرجtorch.nn.utils.clip_grad_norm_بايتورش 1.13.1قص التدرج (العتبة: 1.0) لاستقرار التدريب
جدولة LRtorch.optim.lr_schedulerبايتورش 1.13.1تعلم جدولة المعدلات باستخدام التلاشي الخطي والتسخين
المقاييسsklearn.metricsScikit-Learn 1.1.3ارتباط بيرسون، حساب MAE، RMSE للتقييم
<تنفيذ الشبكات العصبية القوية>بايثون
الفئة الأساسيةtorch.nn.moduleبايتورش 1.13.1الفئة الأساسية لهياكل الشبكات العصبية المخصصة (الطلاقة والعكسية) وحدات الصوابة)
الطبقات الخطيةtorch.nn.خطيبايتورش 1.13.1تنفيذ رأس الانحدار الخطي (768→ 512→ 256→ 128→ 1 عصبون)
التنظيمtorch.nn.Dropoutبايتورش 1.13.1تنظيم الانسحاب (0.1 ل BERT، 0.3 لرأس الانحدار)
التفعيلtorch.nn.functional.sigmoidبايتورش 1.13.1تنشيط السينومويد لتطبيع درجة الطلاقة [0,1]
التفعيلtorch.nn.functional.reluبايتورش 1.13.1تنشيط ReLU في طبقات الانحدار للتحويلات غير الخطية
المحولترانسفورمرز. بيرت موديلترانسفورمرز 4.21.312 طبقة محول مع تركيز ذاتي متعدد الرؤوس لتقييم الطلاقة
Seq2Seqترانسفورمرز. T5For
ConditionalGeneration
ترانسفورمرز 4.21.3بنية الترميز-فك الترميز لتصحيح الأخطاء النحوية
دالة الخسارةtorch.nn.MSELossبايتورش 1.13.1دالة فقدان الخطأ المتوسط التربيعي لتدريب الانحدار السلاسة
<مكتبات تقييم وقياسات STRONG>PYTHON
الارتباطscipy.stats.pearsonrSciPy 1.9.3معامل ارتباط بيرسون لاتفاق النموذج والإنسان
مقياس الخطأsklearn.metrics.mean_absolute_errorScikit-Learn 1.1.3حساب متوسط الخطأ المطلق (MAE) لدقة التنبؤ
مقياس الخطأsklearn.metrics.mean_squared_errorScikit-Learn 1.1.3جذر متوسط التربيع (RMSE) لتقييم مقدار الخطأ
اختبار إحصائيscipy.stats.ttest_indSciPy 1.9.3اختبار t للعينات المستقلة لاختبار الدلالة الإحصائية
مصفوفة الارتباطnumpy.corrcoefNumPy 1.23.5حساب مصفوفة الارتباط لموثوقية المقيم بين المقيمين
ارتباط البياناتباندا. DataFrame.corrالباندا 1.5.2تحليل ارتباط البيانات والتقارير الإحصائية
التصورmatplotlib.pyplotMatplotlib 3.6.2تصور الأداء، مخططات الارتباط، جداول تقدم التدريب
خريطة الحرارةseaborn.heatmapسيبورن 0.12.1تصور مصفوفة الارتباط وعرض البيانات الإحصائية
PYTHON ومكتبات معالجة النصوص ومعالجة معالجة اللغة الطبيعية
معالجة النصوصre (التعبيرات المنتظمة)بايثون 3.9+ المدمجمطابقة أنماط النص، تنظيف البيانات والمعالجة المسبقة
التعامل مع الإعداداتjsonبايثون 3.9+ المدمجمعالجة ملفات التكوين، تخزين معلمات النموذج
التسلسلالمخللبايثون 3.9+ المدمجتسلسل النماذج وحفظ/تحميل نقاط التحقق
تتبع التقدمTQDM4.64.1أشرطة التقدم لحلقات التدريب ومعالجة البيانات
قطع الأشجارقطع الأشجاربايثون 3.9+ المدمجتسجيل تقدم التدريب، تتبع الأخطاء، وتصحيح الأخطاء
قابلية التكرارعشوائيبايثون 3.9+ المدمجإعداد البذرة العشوائي للتجارب القابلة للتكرار
نظام الملفاتosبايثون 3.9+ المدمجعمليات نظام الملفات، إدارة مسار النموذج
تحليل CLIargparseبايثون 3.9+ المدمجتحليل وسيط سطر الأوامر لتكوينات التدريب
<قوية>تجارية / منصات المراقبة الهوائية (مصدر)
المنصة التجاريةPigai.orgمنصة AWE التجاريةتقييم كتابة اللغة الإنجليزية كلغة أجنبية صينية، أنظمة تغذية راجعة آلية
المنصة التجاريةبنغو إنجليزينظام AWE التجاريدعم تعلم اللغة الإنجليزية، تطوير مهارات الكتابة
المنصة التعليميةوصوليمنصة الكتابة التعليميةتقييم كتابة الطلاب وتقديم الملاحظات
محرك التسجيلالتقييم الإلكترونيمحرك التسجيل الآلي ل ETSتقييم مقال الاختبار الموحد، التقييم الشامل
أداة التقييمأنا-أكتبأداة تقييم الكتابةتقييم الكتابة الأكاديمية والتغذية الراجعة التشخيصية
خدمة التدريبالمعيارخدمة ممارسة الكتابة في ETSتطوير مهارات الكتابة والتغذية الراجعة الآلية
نموذج اللغة الذكاء الاصطناعيشات جي بي تينموذج اللغة المفتوح AIالتغذية الراجعة والتقييم الكتابي بمساعدة الذكاء الاصطناعي (المشار إليها في الأدبيات)
<القوي>هياكل التعلم العميق (المشار إليها في الأدب)
العمارةالشبكات العصبية المتكررة (RNN)كاي، 2019معالجة النصوص المتسلسلة وmdash; أنظمة التغذية الراجعة المكتوبة والتقييم الآلي
العمارةالذاكرة طويلة المدى قصيرة المدى (LSTM)جين وآخرون، 2018نمذجة التبعية طويلة المدى وmdash; تقييم المقالات الآلي وتحليل التسلسل
العمارةالشبكات العصبية الالفافية (CNN)دونغ وآخرون، 2017التعرف على الأنماط المحلية وmdash; تصنيف النصوص واستخراج الميزات لتسجيل النقاط
العمارةترانسفورمر-LSTM هجينشوان، 2025المعالجة السياقية والتسلسلية المشتركة — التسجيل التلقائي وتوليد التغذية الراجعة
العمارةالمشفرات الذاتية المتغيرة (VAEs)كومار وآخرون، 2024النمذجة التوليدية و mdash; تطوير مهارات الكتابة المعززة وتغذية راجعة شخصية
العمارةأنظمة الوكلاء المتعددةتومسون وآخرون، 2024معالجة الذكاء الاصطناعي التعاوني وmdash; مساعدة الكتابة المتقدمة (منصة AcademiCraft)
الآليةآليات الانتباهدونغ وآخرون، 2017التركيز على الذات والانتباه متعدد الرؤوس ومدش؛ تحسين أداء AES وفهم السياق
<قوية>تقنيات التعلم الآلي التقليدية (مرجعي)
المنهج الإحصائيمبرهنة بايزرودنر & ليانغ، 2002النهج التقليدي في التعلم الآلي وmdash؛ تطوير AES/AWE المبكر والتسجيل الاحتمالي
المنهج الإحصائيالانحدار الخطيفاندي وآخرون، 2015النمذجة الإحصائية وmdash; تقييم الكتابة القائمة على الميزات والتنبؤ بالنقاط
طريقة التعلمالتعلم بتفضيل الرتبتشين & هو، 2013منهجية قائمة على التصنيف وmdash; تقييم المقالات المقارنة ونمذجة التفضيلات
نموذج اللغةنماذج N-gramشيه وآخرون، 2015نمذجة اللغة الإحصائية وmdash; تصحيح الأخطاء النحوية والتعرف على الأنماط
العمارةبنية الترميز-فك الترميزGe وآخرون، 2018النمذجة من تسلسل إلى تسلسل — تصحيح الأخطاء النحوية وتحويل النص
<معايير وأطر تقييم قوية<> / قوية>
معيار التقييمتقييم كتابة IELTSتعديل معايير التسجيلمعايير التقييم الموحدة للطلاقة والدقة
معيار التقييمتقييم الكتابة في TOEFLمعايير الكتابة الأكاديميةتقييم الكفاءة والتقييم الموحد
المقياس الإحصائيحجم تأثير كوهين د0.2=صغير، 0.5=متوسط، 0.8=كبيرالتقييم العملي للدلالة لفعالية التدخل
مقياس الموثوقيةموثوقية بين المدرعين (κ)الطلاقة: 0.847 / الدقة: 0.823معامل كابا و mdash; اتساق المقيم البشري والتحقق من التوافق

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

مقالات ذات صلة