$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
يتم تلخيص عملية الموافقة الأخلاقية وتوظيف المشاركين، بما في ذلك إدارة المقالات، والتقييم المزدوج من قبل معيار ETS والخبراء، وتقييم إدراك المتعلم، والتحليل الإحصائي. تسلط الضوء على كيفية دمج الدقة والعدالة ونمذجة الإدراك المعتمدة على SEM في خط تحقق موحد من XAI. يتم توضيح إطار تقييم AWE المدفوع ب XAI في الشكل 1.
الإجراءات:
تضمنت العملية عدة خطوات. أولا، تم الحصول على موافقة لجنة التحقيقات الدولية، وتم جمع موافقة مستنيرة من جميع المشاركين. ثم تم تعريف المتغيرات المستقلة والتابعة والضابطة. تم تنفيذ مهام كتابة موحدة على مودل باستخدام ثلاثة مواضيع مقال محايدة، وجمعت عينات كتابة مع ضمان الالتزام بمتطلبات المقالة مثل عدد الكلمات، والوقت الزمني، والبنية. تم إجراء التقييم المزدوج باستخدام مخرجات معيار ETS مع تقييمات الخبراء البشرية. تم توزيع استبيانات إدراك المتعلم فور تقديم المقال. تم تنفيذ إجراءات فحص البيانات ومراقبة الجودة لمعالجة الشذوذات مثل الغش أو الردود غير الصالحة. كما تم تطبيق عتبات تحليل العدالة (ΔEO، اختبارات RMSE). وأخيرا، تم تخزين جميع البيانات المجهولة الهوية بشكل آمن على خوادم مشفرة وتحكم في الوصول.
الموافقة الأخلاقية والموافقة المستنيرة
حصلت هذه الدراسة على موافقة أخلاقية من مجلس المراجعة المؤسسية لمؤسسة المؤلفين. تم تنفيذ جميع الإجراءات وفقا لإعلان هلسنكي واللوائح المعمول بها. كان جميع المشاركين بالغين (≥18 سنة) وقدموا موافقة مستنيرة مكتوبة قبل المشاركة. تم إزالة العينات المكتوبة وإجابات الاستبيانات من المصدر وتخزينها على خوادم مشفرة وتحكم في الوصول؛ كان بإمكانهم الوصول فقط للمحققين المصرح لهم. كان المقيمون البشريون غير مبصرين عن اللغة الأم للمشاركين، ومستوى الكفاءة، والتركيبة السكانية. كانت المشاركة طوعية، مع حق الانسحاب في أي وقت، ولم تكن هناك أي خداع أو تدخلات حساسة. يمكن تقديم وثائق الموافقة الرسمية إلى المجلة عند الطلب.
تصميم متغير
تم تعريف ثلاث مجموعات من المتغيرات في الدراسة لتوجيه التحليل. يلخص الجدول 1 أنواع القياس والبيانات المستخدمة في طرق القياس لكل بناء ويوفر التعريفات التشغيلية الكاملة للمتغيرات المستقلة والتابعة والمتحكمة.
كانت دقة الذكاء الاصطناعي في التقييم أول متغير مستقل يتم تقييمه من حيث معامل الارتباط RMSE وبيرسون (r) بين مخرجات معيار ETS وتقييمات الخبراء. أسفرت المعايرة التي أجراها الخبراء عن تقييم ICC بلغ 0.91، مما أكد الموثوقية.
المتغير المستقل الثاني كان الخلفية اللغوية للمتعلمين، والتي قسمت إلى متحدثي أصليين وغير أصليين، وتم تقسيم المزيد إلى مجموعات صينية وإسبانية وعربية وغيرها. كان الطلاب الصينيون من بين الفئات المستهدفة لأن المؤشرات الأولية على التقليل المنهجي من التقدير لوحظت.
المتغير المستقل الثالث كان كفاءة الكتابة، والتي تم تصنيفها وفقا لمستويات CEFR من A2 إلى C1، كما تم تأكيدها من خلال الشهادات الرسمية واختبارات الكفاءة قبل الصف، كما تم توافقها مع معادلات IELTS. كان مشرف آخر تم تقديمه في نموذج الوساطة الذكاء الاصطناعي للعدالة يكتب كفاءة لاختبار ما إذا كانت الحساسية للعدالة تختلف بين مستويات الكفاءة.
كان إدراك العدالة ورضا المتعلم هما المتغيران التابعان. تم تقييم إدراك العدالة من خلال استبيان مكون من ثمانية بنود مصنف على مقياس ليكيرت المكون من سبع نقاط، والذي تضمن الاتساق الفردي وحيادية المجموعة (كرونباخس 87؛ CVI 92). تم تقييم رضا المتعلمين باستخدام ستة أسئلة ليكرت أشارت إلى الاستعداد للاستخدام والتحسن المدرك في المهارة (α = 0.85).
تم التحكم في المتغيرات من حيث العمر والجنس وخبرة الكتابة. تم تقسيم العمر إلى ثلاث مجموعات (18-22 سنة، 23-28 سنة، و≥29 سنة)، وتم تصنيف الجنس إلى ذكر وأنثى. تم تصنيف خبرة الكتابة إلى ثلاث مستويات من التكرار في السنة.
كتابة نصوص المهام
تم صياغة محفزات موحدة للمقالات الجدلية للحصول على بيانات كتابة لثلاثة مواضيع محايدة: تأثير العولمة على الثقافات المحلية، مزايا وتحديات التعليم عبر الإنترنت، والحدود الأخلاقية للذكاء الاصطناعي. كانت هذه المواضيع تهدف إلى تحقيق التوازن بين الصعوبة الإدراكية وسهولة الوصول من جهة، وتقليل فروق الأداء الناتجة عن المعرفة السابقة من جهة أخرى. يتم الإبلاغ عن توزيع المواضيع والإحصائيات الوصفية لطول المقال في الجدول 2.
كان من الضروري أن يكون كل مقال 250 كلمة ±10٪ ويكتب خلال 45 دقيقة على منصة تعتمد على مودل. تم حظر الأدوات المساعدة، وتم استبعاد التقديمات المتأخرة. اتبعت المقالات هيكلا موحدا من المقدمة، فقرتين من الحجة، والخاتمة. تم جمع 764 مقالة صالحة، بمتوسط طول 252.3 كلمة (SD = 8.7).
بيانات مقارنة النقاط
تم تقييم دقة تقييم AWE باستخدام إجراء مزدوج يجمع بين مخرجات معيار ETS وتقييمات الخبراء البشرية. تم استرجاع الدرجات من كريتيريون عبر واجهة برمجة التطبيقات المفتوحة. قام ثلاثة لغويين لديهم أكثر من عشر سنوات من الخبرة في التقييم بتقييم جميع المقالات بشكل مستقل. قبل التسجيل الرسمي، أكمل المقيمون ثلاث جلسات معايرة. أثناء المعايرة، وصلت موثوقية المقيمين بين المقيمين إلى ICC = 0.87؛ خلال التسجيل الرسمي، ارتفع تصنيف ICC إلى 0.91، مع تصنيفات ICC الخاصة بالأبعاد فوق 0.88. تم حل المقالات التي تحتوي على فروق في الدرجات تزيد عن نقطتين بشكل جماعي (18 حالة). يتم تلخيص سير عمل التقييم ونتائج الموثوقية في الجدول 3.
استبيان إدراك المتعلم
تم جمع تصورات المتعلمين حول ملاحظات الذكاء الاصطناعي من خلال استبيان مكون من 22 بندا استند إلى TAM وتم توسيعه ليشمل العدالة. احتوت الأداة على ثلاثة مجالات: إدراك العدالة (8 بنود)، الرضا (6 بنود)، وعوامل التعديل مثل الفهم والشفافية (8 بنود). أسفر التحقق من قبل خمسة خبراء عن مؤشر CVI بلغ 0.92، وأظهر الاختبار التجريبي مع 60 متعلما موثوقية إجمالية تبلغ α = 0.90. تم تقديم هيكل الاستبيان والمؤشرات النفسية في الجدول 4.
تم إجراء الاستبيانات في الدراسة الرئيسية مباشرة بعد تقديم المقالات، وكانت هناك متطلبات زمنية دنيا لتقليل الإكمال غير المدروس. من بين 764 استطلاعا تم إصدارها، كان 756 صالحا بعد فحوصات الجودة، وتم الحصول على معدل فعال 98.95.
جمع البيانات ومراقبة الجودة
تم تسجيل البيانات لمدة 8 أسابيع (مارس-أبريل 2024) على أربع مراحل: التجنيد والموافقة؛ كتابة المقالات؛ التقييم المزدوج وتوزيع الاستبيانات؛ وتجميع قاعدة البيانات. تمت مراجعة شهادات الكفاءة المبنية على أداء الكتابة قبل الصف من خلال الفحص المزدوج، واستبعدت هذه العملية 16 مشاركا. تم القضاء على أربع حالات محتملة للغش من خلال المراقبة الفورية، وتم تعديل ثلاث حالات مشبوهة في أداء الذكاء الاصطناعي (انحرافات لا تقل عن 8 نقاط) بعد تقييم يدوي. تم استبعاد ثمانية استبيانات غير صالحة بناء على فحوصات الاتساق العكسية.
تخزين البيانات وأخلاقيات
تم إخفاء هوية جميع البيانات وتخزينها باستخدام معرفات فريدة تتكون من اللغة الأم، ومستوى الإتقان، والرقم التسلسلي. تم تشفير النصوص والدرجات والاستبيانات وتخزينها على خوادم متوافقة مع ISO27001 مع وصول محدود. سيتم الاحتفاظ بالبيانات لمدة 3 سنوات قبل الحذف الدائم. تم الحصول على موافقة أخلاقية من لجنة المراجعة المؤسسية، وتم جمع موافقة مستنيرة مكتوبة من جميع المشاركين.