$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تصميم طريقة LBA مع الأخذ في الاعتبار ال MPFR والمنظورات العاطفية
تم إنشاء نظام تقييم متعدد المنظورات لتحليل سلوك التعلم عبر الإنترنت للطلاب (SOLB)، وتم تصميم نموذج MPFR. لتحليل مشاعر الطلاب الذاتية في التعلم بشكل أعمق، تعتمد هذه الدراسة خوارزمية XGBoost وصممت خوارزمية IGWO لتحسين المعاملات الفائقة لتحسين دقة التصنيف.
بناء نموذج MPFR ل LBA
لتحليل SOLB، تبدأ هذه الدراسة بشكل رئيسي من منظورين لتشكيل خطة تحليل كاملة. أولا، من حيث الأداء التعليمي، تأخذ هذه الدراسة في الاعتبار ثلاثة وجهات نظر: المنهج الدراسي، الفرد، والصف، لتشكيل نموذج MPFR. ثانيا، من حيث تحليل المشاعر لتعليقات الطلاب، تصمم هذه الدراسة خوارزمية XGBoost محسنة. من خلال تحليل أداء التعلم ومشاعر ردود فعل الطلاب، يمكن لهذه الدراسة تحليل SOLB بشكل أفضل. فيما يتعلق بالتفاصيل التقنية المحددة لتحليل أداء التعلم، تستخدم هذه الدراسة أولا بيانات من منصة تعلم عبر الإنترنت وتقوم بمعالجتها مسبقا. ثانيا، تختار هذه الدراسة مؤشرات تقييم أداء التعلم الأساسية من وجهات نظر مختلفة لبناء نظام تقييم شامل. بعد ذلك، يتم بناء نموذج MPFR المقابل لتقييم سلوك التعلم.
تختار هذه الدراسة بيانات من منصة سوبرستار (المصدر من: https://www.chaoxing.com/). يحتوي على معلومات من أبعاد متعددة، مثل الأنشطة الصفية وتقييم الصف، مما يمكن أن يوفر أساسا جيدا لاختبارات LBA لاحقة. بعد الحصول على البيانات، يجب معالجتها مسبقا، وتشمل بشكل رئيسي حذف الحقول غير المناسبة، وتصفية البيانات، وفحوصات سلامة البيانات. على سبيل المثال، في بيانات المعلمين، يجب إزالة معلومات غير ذات صلة مثل الرقم والقسم الذي تنتمي إليه المقررة. لاحقا، تقوم هذه الدراسة ببناء هندسة الميزات في LBA بناء على بيانات سلوك التعلم لمنصة سوبرستار. يوفر مؤشر LBA للطلاب أساسا هندسيا للميزات لنموذج MPFR اللاحق، ومحتوى هذا الفهرس موضح في الشكل 1.

الشكل 1: مؤشرات لتقييم LBA للطلاب. يوضح الشكل الأبعاد الأساسية الثلاثة (المنهج، الفرد، الصف) لاختبار LBA للطلاب ومؤشرات التقييم المحددة تحت كل بعد، مما يوفر دعما للميزات لنموذج MPFR. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
في الشكل 1، تدور مؤشرات LBA للطلاب بشكل رئيسي حول ثلاثة وجهات نظر: الدورة، الفردية، والصف، مع تركيز واضح على كل بعد، مما يوفر دعما دقيقا لبناء نماذج MPFR. من بينها، من حيث مؤشرات أبعاد الدورة، تختار هذه الدراسة معدل إكمال المهام الدراسية، ومدة تعلم الدورة، وتكرار التفاعل مع المقررات. الاهتمام الأساسي بهذا الجانب هو جودة إكمال مهام المقرر بشكل عام وسرعة المشاركة في التعلم. على سبيل المثال، يستخدم معدل إنجاز مهام المقرر لتتبع الفرق في معدلات الإنجاز قبل وبعد الموعد النهائي؛ تستخدم مدة دراسة الدورة لتمييز فترات شدة التعلم المختلفة؛ يستخدم تكرار تفاعل المسار لتصفية السلوكيات التفاعلية الفعالة. على المستوى الشخصي، يتم اختيار تقدم التعلم الشخصي، وجودة إكمال الواجبات المنزلية، ودرجات الامتحانات كمؤشرات تقييم. يركز هذا البعد على درجة التوافق بين تقدم التعلم الشخصي ونتائج إتقان المعرفة. تشمل الأمثلة مقارنة تقدم التعلم الشخصي مع خطط الدورة، وتقييم دقة وكفاءة الواجبات المنجزة، وتصنيف مستويات إتقان المعرفة بناء على نتائج الاختبارات. بالإضافة إلى ذلك، من حيث بعد الصف، تشمل المؤشرات المختارة متوسط درجات الصف، ونشاط التفاعل الصفي، وجو التعلم الصفي. يركز هذا البعد بشكل رئيسي على تأثير بيئة التعلم العامة على سلوك الفرد. على سبيل المثال، يستخدم متوسط الدرجة لتحديد المستوى النسبي لأداء الفرد في المجموعة؛ يستخدم نشاط التفاعل الجماعي ليعكس درجة المشاركة الجماعية؛ يستخدم جو التعلم لتحليل التأثير الدافع لبيئة المجموعة على سلوك التعلم. لتحليل سلوك التعلم لدى الطلاب، يتم بناء نموذج استدلال ضبابي، ويتم الحصول على خصائص سلوك التعلم من وجهات نظر مختلفة. الاستدلال الضبابي هو طريقة للاستدلال باستخدام المنطق الضبابي، تعالج المعلومات غير الدقيقة أو غير المؤكدة من خلال مجموعات ضبابية وقواعد ضبابية، وتتميز بمرونة قوية وفهم سهل11,12. يتم تطبيق الاستدلال الضبابي، كآلية الحوسبة الأساسية لنماذج MPFR، بعد هندسة الميزات. العملية الرئيسية للاستدلال الضبابي موضحة في الشكل 2.

الشكل 2: المخطط الرئيسي للاستدلال الضبابي. يوضح الشكل العملية الأساسية للاستدلال الضبابي، بما في ذلك أربع خطوات رئيسية: التشويه، وبناء قاعدة قواعد ضبابية، والتفكير الضبابي، وإزالة الضبابية، ويوضح منطق نموذج MPFR في التعامل مع بيانات سلوك التعلم غير المؤكدة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
الاستدلال الضبابي يتضمن بشكل رئيسي التشويه، وإنشاء مكتبة قواعد ضبابية (FRL)، والاستدلال الضبابي، وإزالة الضبابية. من بينها، يتطلب التشويش تحويل بيانات الإدخال الدقيقة إلى مجموعات ضبابية ويتضمن تعريف دوال العضوية. يحتوي FRL على سلسلة من القواعد الضبابية ويستخدم بشكل رئيسي لوصف العلاقة بين الإدخال والمخرجات. في بناء قاعدة القواعد الضبابية، تدعو الدراسة ثلاثة أساتذة مشاركين في تكنولوجيا التعليم لديهم خبرة تدريسية ≥ 8 سنوات لتطوير 28 قاعدة معا، وتحدد القواعد النهائية من خلال ثلاث جولات تكرار باستخدام "طريقة دلفي". على سبيل المثال، القاعدة 1: إذا كان معدل إكمال مهمة الدورة أقل من 30٪ وتقدم التعلم الفردي متأخر أسبوعين عن الجدول → حينها حالة عالية الخطورة. الاستدلال الضبابي هو عملية استنتاج بيانات الإدخال الضبابية المبنية على FRL والحصول على نتائج إخراج ضبابية. وأخيرا، إزالة التشويش ستحول نتيجة الإخراج الضبابية إلى قيمة إخراج دقيقة. تختار الدراسة دالة عضوية مثلثية، وهي دالة مستخدمة على نطاق واسع في أنظمة المنطق الضبابي، ولها مزايا مثل المرونة القوية والكفاءة الحاسوبية العالية. يظهر تعبير الدالة μA(x) في المعادلة (1).
(1)
في المعادلة (1)، x هي القيمة المحددة. a و b و c هي الرؤوس الثلاثة لمثلث. في إزالة التشويه، تستخدم هذه الورقة طريقة المركز المركزي لتحويل نتائج المخرجات. طريقة المركز المركزي هي تقنية إزالة الطمس الشائعة في المنطق الضبابي، وتتميز بمزايا مثل الحدس القوي، والحساب البسيط، والاستقرار13. يظهر تعبير طريقة المركز المركزي في المعادلة (2)14.
(2)
في المعادلة (2)، f* هي القيمة المخرجة بعد إزالة الضبابية، وهي مركز المجموعة الضبابية. μ(x) هي دالة العضوية.
هو المجموع المرجح لجميع النقاط في مجموعة ضبابية.
هو تكامل دالة العضوية على جميع القيم الممكنة ل x. تنعكس منطقية استخدام القواعد المعرفة يدويا ودوال العضوية في نموذج MPFR في ثلاثة جوانب. أولا، ضمان المؤهلات المتخصصة: صانعو القواعد هم ثلاثة أساتذة مشاركين في تكنولوجيا التعليم، وقد حصلوا على شهادة من "محلل سلوك التعلم عبر الإنترنت" في "مركز أبحاث التعليم عبر الإنترنت بوزارة التعليم" لضمان توافق القواعد مع قوانين التعليم والتدريس. ثانيا، ميزة الكفاءة: زمن الاستدلال للقواعد اليدوية أقل بكثير من زمن الطرق المعتمدة على البيانات، مما يجعلها أكثر ملاءمة لاحتياجات "الاستدلال في الوقت الحقيقي" لمنصات التعليم عبر الإنترنت ولا يتطلب كمية كبيرة من البيانات المشروحة، مما يقلل من تكاليف جمع البيانات15. ثالثا، التكيف مع المتطلبات الأساسية ل "قابلية التفسير" في سيناريوهات التعليم عبر الإنترنت، يمكن أن تتوافق القواعد المعرفة يدويا ووظائف العضوية المثلثية (المعادلة 1) مباشرة مع الإدراك الحدسي في سيناريوهات التدريس. لا يحتاج المعلمون إلى خلفية تقنية معقدة لفهم سبب اعتبار الطالب معرضا للخطر. يمكن للطرق المعتمدة على البيانات مثل الأنظمة العصبية الضبابية تحسين القواعد تلقائيا. ومع ذلك، فإن معظم القواعد المولدة هي تعبيرات رياضية معقدة، يصعب على المعلمين تفسيرها، مما يقلل من قبول النموذج في التدخل التعليمي الفعلي.
تصميم نموذج تحليل مشاعر تعليق الطلاب المحسن ل XGBoost
يمكن لنموذج MPFR المصمم تحليل SOLB من ثلاثة جوانب: المسار، الفرد، والصف. ومع ذلك، فإن تحليل البيانات السلوكية الخارجية له قيود في التعبير عن مشاعر الطلاب الذاتية. لذلك، لتحليل مشاعر الطلاب الذاتية تجاه التعلم بشكل أعمق، يتم جمع بيانات إضافية من منصات التعلم عبر الإنترنت التي تحتوي على معلومات تعليقات الطلاب ومعالجتها مسبقا. بعد ذلك، يستخدم XGBoost لبناء نموذج تصنيف المشاعر. تم تصميم IGWO لتحسين معاييره لتحسين دقة نموذج التصنيف. ينعكس تحسين XGBoost في تحسين المعلمات من خلال خوارزمية IGWO. تعد معالجة البيانات خطوة أولى حاسمة قبل بناء وتحليل النموذج. تظهر عملية معالجة البيانات مسبقا في الشكل 3.

الشكل 3: عملية معالجة البيانات مسبقا. تشمل عملية المعالجة المسبق للبيانات المكونة من تسع خطوات تنظيف النصوص، وتقسيم الكلمات، وإزالة الكلمات الثابتة، واستخراج الجذع، والتعرف على كلمات المشاعر، مما يوفر بيانات عالية الجودة لتحليل السلوك اللاحق وتصنيف المشاعر. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
خطوات معالجة البيانات المبدئية هي كما يلي: الخطوة الأولى هي إجراء تنظيف النصوص لإزالة الحقول غير ذات الصلة في بيانات منصة تشاوشينغ وتصفية العينات غير الصالحة. وفي الوقت نفسه، تزال الحقول غير النصية والمراجعات القصيرة من بيانات المراجعة على منصة MOOC. الخطوة الثانية هي إجراء معالجة التقسيم. من بينها، تستخدم التعليقات الصينية "الوضع الدقيق" لجيبا لمعالجة تقسيم الكلمات، بينما تستخدم التعليقات الإنجليزية وظيفة تقسيم الكلمات في مكتبة NLTK للمعالجة. الخطوة الثالثة هي إزالة كلمات التوقف الشائعة مثل ''de''، ''yes''، ''in''، وغيرها. من بينها، تستخدم كلمات التوقف الصينية قائمة الكلمات المؤقتة (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt) لمعهد هاربين للتكنولوجيا. يتم حذف كلمات التوقف عن طريق مطابقة الكلمات. تستخدم كلمات التوقف الإنجليزية قائمة كلمات التوقف العالمية المدمجة في مكتبة NLTK، والتي يتم حذفها أيضا من خلال المطابقة كلمة بكلمة. الخطوة الرابعة هي استخدام الجذر في مكتبة NLTK لاستخراج الجذور من النص واستعادة الأفعال في البيانات الإنجليزية إلى شكل الجذر الخاص بها. الخطوة الخامسة هي تحديد الكلمات العاطفية الإيجابية والسلبية في التعليقات بناء على قاموس CNKI العاطفي لتوفير أساس تمهيدي للتعليق لتصنيف عاطفي لاحق. الخطوة السادسة هي إجراء استخراج الميزات. من بينها، البيانات المنظمة في منصة تشاوشينغ موحدة، بينما يتم ترميز مؤشرات التصنيف بشكل منفصل. في الوقت نفسه، تستخدم هذه البيانات في منصة MOOC نموذج لغوي مدرب مسبقا (تمثيل الترميز ثنائي الاتجاه من Transformers، BERT) لاستخراج ميزات النص. الميزة الأساسية لنموذج BERT في استخراج ميزات النص هي أنه يمكنه توليد متجهات كلمات واعية للسياق ديناميكيا عبر بنية ترانسفورمر ثنائية الاتجاه عميقة، مما يعالج فعليا الغموض الذي لا تستطيع نماذج تضمين الكلمات الثابتة التقليدية التعامل معه. الخطوة السابعة هي معالجة مشكلة الفئات غير المتوازنة في فئات المشاعر في بيانات التعليقات. تستخدم تقنية أخذ العينات الزائدة للأقليات الاصطناعية (SMOTE) لمعالجتها. يتم اختيار خمس عينات من أقرب جيران للاستيفاء لتوليد عينات من فئة الأقليات الاصطناعية، مع بذرة عشوائية ثابتة من 42 لضمان قابلية تكرار التجربة. الخطوة الثامنة هي التعليق على البيانات وتقسيمها. الخطوة التاسعة هي ملء القيم المفقودة في بيانات السوبر ستار وإزالة القيم الشاذة. عند إجراء معالجة موازنة البيانات، ينشئ SMOTE عينات مركبة جديدة عن طريق الاستيفاء بين عينات فئة الأقليات، مما يزيد من عدد عينات فئة الأقليات ويجعل توزيع الفئات في مجموعة البيانات أكثر توازنا16,17. يظهر تعبير SMOTE في المعادلة (3).
Bmn = dm + rand(0,1) x (dmn - dm) (3)
في المعادلة (3)، Bmn هي عينة فئة أقلية مصطنعة البناء، وdm هي العينة من فئة الأقلية i، وdmn هي العينة nth بين k الجيران الأقرب ل dm . راند(0,1) هو رقم عشوائي بين 0 و1. يحسن XGBoost الأداء التنبؤي من خلال إضافة أشجار التنبؤ بشكل تكراري. له مزايا مثل الدقة العالية، والمرونة القوية، وسهولة الاستخدام18,19. تشمل خطوات البناء التكراري لنموذج شجرة باستخدام XGBoost بشكل رئيسي: تهيئة النموذج، البناء التكراري للشجرة، دالة الهدف، ومصطلح التنظيم. يظهر الناتج
المتوقع في التكرار t-th في المعادلة (4).
(4)
في المعادلة (4)،
هي قيمة توقع النموذج بعد التكرار t - التكرار الأول، وft(h) هي دالة التنبؤ لنموذج الشجرة المضافة في التكرار t، و h هو متجه ميزة الإدخال. دالة الهدف لتقليل XGBoost موضحة في المعادلة (5).
(5)
في المعادلة (5)، i هو رقم العينة. I و J هما العدد الإجمالي للعينات والأشجار، وj هو عدد الأشجار.
هي دالة الفقد، و gi هو التسمية الحقيقية للعينة i - الصفقة.
هي القيمة المتوقعة للنموذج للعينة i - بعد التكرار T-th. Ω(ft) هو مصطلح التنظيم، و(ft) هو دالة التنبؤ لشجرة j -th. التعبير العام Ω(f) للتنظيم موضح في المعادلة (6).
(6)
في المعادلة (6)، تعني γ معامل العقوبة لكمية عقد الأوراق، λ هو معامل تنظيم L2 لوزن عقد الأوراق، و w هو وزن عقد الأوراق. ومع ذلك، فإن اختيار معايير XGBoost الفائقة له تأثير مباشر ومهم على الأداء. تشمل المعاملات الفائقة الشائعة في XGBoost معدل التعلم، وأقصى عمق للشجرة، ومعاملات التنظيم. نظرا لمساحة المعاملات الفائقة المحتملة الكبيرة، فإن تعديل هذه المعلمات يدويا لا يستغرق وقتا طويلا فحسب، بل يصعب أيضا إيجاد تركيبة المعلمات المثلى. لذلك، تصمم هذه الدراسة IGWO لتحسين المعاملات الفائقة ل XGBoost. يبحث الهدف العالمي عن حلول مثلى من خلال محاكاة التسلسل الاجتماعي واستراتيجيات الصيد للذئاب الرمادية، مع مزايا مثل تقليل المعلمات والقدرة على التكيف القوي20,21. في GWO، يتم توليد الموقع الابتدائي للسكان كما هو موضح في المعادلة (7).
(7)
في المعادلة (7)، Puv هو موقع الفرد U في البعد الخامس.
و
هما الحدود العليا والدنيا لفضاء البحث V. RAND() هو رقم عشوائي بين [0,1]. ومع ذلك، قد تواجه خوارزمية GWO مشاكل مثل بطء سرعة التقارب والتوقف في المستويات المثلى المحلية في المراحل الوسطى واللاحقة. وهذا يعني أيضا أنه في هذه المرحلة، قد لا تتمكن GWO من استكشاف فضاء الحلول بأكمله بفعالية، مما يجعل من الصعب إيجاد الحل الأمثل عالميا. لمعالجة هذه المشكلة، تحسن هذه الدراسة GWO من جانبين، وهما تقديم خريطة الفوضى الخيمة (TCM) وعامل التقارب غير الخطي (NCF). TCM هو رسم خرائط فوضوي بسيط يضمن عدم تفويت مناطق الحلول المثلى المحتملة أثناء عملية البحث ويتجنب عمليات البحث المتكررة لنفس المنطقة22. لذلك، من خلال إدارة الطب الصيني التقليدي، يمكن توليد مجموعة أولية أكثر تجانسا وعشوائيا، ويمكن تعزيز قدرة الخوارزمية على تجاوز الحلول المثلى المحلية. يتم عرض حساب الرسم التقليدي الصيني في المعادلة (8).
(8)
في المعادلة (8)، y هو معامل التحكم. Rt و Rt+1 هما متغيرات حالة النظام في التكرارات t-th و t+1. الصيغة ل NCF z موضحة في المعادلة (9).
(9)
في المعادلة (9)، zmax هو أقصى عامل تقارب وtmax هو أقصى عدد من التكرارات. تسمح هذه الطريقة التناقص غير الخطي ل GWO بالحفاظ على حجم خطوة كبير للبحث العالمي في المراحل المبكرة. في المرحلة الوسطى من البحث، تتسارع سرعة التقارب، بينما في المرحلة اللاحقة، يتم إجراء البحث المحلي بخطوات أصغر، مما يوازن بشكل فعال بين قدرات البحث العالمية والمحلية ويعزز أداء التحسين. تستخدم خوارزمية IGWO تحديدا لمرحلة تحسين المعاملات الفائقة في مصنف عواطف XGBoost، وعمليتها الرئيسية موضحة في الشكل 4.

الشكل 4: العملية الرئيسية ل IGWO. يوضح الشكل عملية تنفيذ IGWO، بما في ذلك تهيئة السكان بناء على الرسم الفوضوي الخيمي، وتحديث مواقع عوامل التقارب غير الخطية، والفحص الأمثل للفرد، ويوضح منطق تحسين معلمات XGBoost الفائقة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
في الشكل 4، تشمل عملية IGWO: تهيئة الخوارزمية؛ واستخدام الطب الصيني التقليدي لتهيئة السكان؛ حساب قيمة اللياقة الأولية لكل فرد؛ استخدام NCF لتحديث مواقع الذئب الرمادي؛ اختيار الحل ذو اللياقة المثالية كأفضل فرد جديد؛ وتقديم الفرد الأمثل. يمكن إخراج التركيبة المثلى من معاملات XGBoost الفائقة عبر IGWO. تدمج العملية العامة لتصنيف المشاعر معالجة البيانات المسبقة، وتحسين IGWO، والنموذج النهائي ل XGBoost. يتم عرض عملية نموذج التصنيف المبنية على IGWO-XGBoost في الشكل 5.

الشكل 5: عملية نموذج التصنيف بناء على IGWO-XGBoost. يوضح الشكل العملية الكاملة لنموذج تصنيف المشاعر في IGWO-XGBoost، من إدخال البيانات والمعالجة المسبقة إلى تقسيم مجموعات البيانات، وتحسين المعلمات الفائقة IGWO، وبناء نموذج XGBoost، ومخرجات نتائج التصنيف، مع عرض سلسلة عمليات النموذج بوضوح. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
يشمل النموذج المبني على IGWO-XGBoost عمليات مثل بيانات الإدخال، والمعالجة المسبقة للبيانات، وتقسيم مجموعات البيانات، وتحسين خوارزمية IGWO الفائقة المعلمات، وتركيب المعلمات الفائقة الأمثل، وبناء XGBoost بناء على التركيبة المثلى للمعلمات الفائقة، وإخراج نتائج التصنيف. من خلال هذا النموذج التصنيفي، يمكن تصنيف المشاعر في تعليقات الطلاب، مما يحصل على فهم أكثر حدسية لمشاعر الطلاب الذاتية تجاه التعلم. تظهر الرسومات البرمجية المحددة، والبذور العشوائية، ومواصفات الأجهزة، والمواصفات البيئية، ومصادر مجموعات البيانات المستخدمة في الدراسة في الجدول 1.
| نوع المجموعة | النموذج والمحتوى المحدد |
| البرمجيات الأساسية | بايثون 3.9.7 |
| المكتبة الأساسية | XGBoost 1.7.5، Scikit-learn 1.2.2، Jieba 0.42.1، NLTK 3.8.1، Pandas 1.5.3، NumPy 1.24.3، Matplotlib 3.7.1، Imbalanced-Learn 0.10.1 |
| البذرة العشوائية | اضبط البذرة العشوائية العالمية إلى 42 |
| مواصفات العتاد/البيئة | 1. نظام التشغيل: إصدار ويندوز 10 بروفيشنال (64 بت، رقم الإصدار 22H2) |
| 2. المعالج: Intel Core i5-12600KF (بتردد رئيسي 3.7 جيجاهرتز وتردد تسريع ديناميكي 4.9 جيجاهرتز) |
| 3. الذاكرة: 64GB DDR4 (تردد 3200MHz، يدعم حتى 128GB من الذاكرة) |
| 4. التخزين: قرص SSD بسعة 1 تيرابايت (Samsung 980 Pro، سرعة قراءة 7450 ميجابايت/ثانية) |
| 5. بطاقة الرسوميات: NVIDIA GeForce RTX 3060 (ذاكرة فيديو 12GB) |
| مصادر مجموعة البيانات وتفاصيل الوصول | 1. مجموعة بيانات منصة سوبرستار: |
| -المصدر لتحديد موارد الوحدة (الرابط): https://www.chaoxing.com/ |
| - طريقة الاستحواذ: التطبيق من خلال منصة تشوشنغ التعليمية المفتوحة للبيانات الضخمة (مسار التطبيق: الموقع الرسمي للمنصة → مركز المطورين → واجهة البيانات → مجموعة بيانات سلوك التعلم) |
| 2. مجموعة بيانات تعليقات منصة MOOC: |
| -رابط المصدر: https://www.icourse163.org/.cn |
| - طريقة الاستحواذ: التقديم عبر قناة "دعم أبحاث البيانات" في منصة MOOC |
| السكريبتات أو النماذج المخصصة | 1. سكريبت معالجة البيانات المسبقة |
| 2. سكريبت نموذج MPFR |
3. سكريبت نموذج IGWO-XGBoost
|
الجدول 1: إصدارات برمجية محددة، بذور عشوائية، مواصفات الأجهزة، المواصفات البيئية، ومصادر مجموعات البيانات المستخدمة في البحث. قدم قائمة مفصلة ببيئة البرمجيات والأجهزة المطلوبة، وإعدادات البذرة العشوائية، ومصادر مجموعات البيانات، ونطاق البحث في معايير XGBoost الفائقة للدراسة لضمان قابلية تكرار وتوحيد التجربة.
يوضح الجدول 1 أن الدراسة تعتمد XGBoost 1.7.5 كإطار أساسي لنموذج تصنيف المشاعر وتقدم Scikit Learn 1.2.2 للمعالجة المسبقة للبيانات، واستخراج الميزات، وتقييم النموذج. بالإضافة إلى ذلك، تضبط الدراسة بشكل موحد البذرة العشوائية إلى 42 لضمان تكرار تقسيم البيانات، وأخذ عينات SMOTE، وتحسين المعلمات الفائقة IGWO، ونتائج تدريب نموذج IGWO-XGBoost. بالإضافة إلى ذلك، تحدد خوارزمية IGWO فضاء البحث عن معلمات XGBoost الفائقة. نطاق البحث عن معدل التعلم هو [0.001، 0.3] على المقياس اللوغاريتمي، ويتم البحث عن أقصى عمق للشجرة في مجموعة الأعداد الصحيحة {3، 4,..., 15}. نطاق تحسين مصطلح تنظيم اللغة الثانية هو [0.1، 5.0]، ونسبة العينة لكل مجموعة من خصائص الشجرة تحسن ضمن نطاق [0.6، 1.0]. نطاق الضبط لوزن العقد الورقية الأدنى هو [1، 10].
تم إنشاء وتحليل مجموعة البيانات وكود المعالجة المسبق والتحليل ذات الصلة من قبل الفريق نفسه. تظهر السكريبتات الأساسية للمعالجة المسبقة للبيانات في الجدول 2.
| استيراد الباندا ك PD، Jieba، Re، Numpy ك NP |
| من nltk.tokenize استيراد word_tokenize؛ من nltk.stem import PorterStemmer |
| Def Clean (نص، L): |
| إرجاع re.sub(r"[^\u4e00-\u9fa5]" if l=="zh" else r"[^a-zA-Z]", "", text).strip() |
| عملية تعريف (نص، L): |
| t = jieba.lcut(نص) إذا l=="zh" إلا word_tokenize(نص) |
| أعد " ".join([PorterStemmer().stem(w) إذا l=="en" else w ل w in t إذا لم يكن w في open("hit_stopwords.txt").read().split()]) |
| الدفاع الرئيسي (C, M, L): |
| cx=pd.read_csv(c).query("مدة تعلم المقررات>=1 & results exam.notna()"); mc=pd.read_csv(m).query("comment text.str.len()>=5") |
| mc["t"]=mc["comment text"].apply(clean,args=("zh",)).apply(process,args=("zh",)) |
| np.savez("out.npz",**{k:v for k,v in locals().items()}) |
الجدول 2: السكريبت الأساسي لمعالجة البيانات المسبقة. تقديم المعلومات الأساسية للسكريبت لمعالجة البيانات المسبقة، وتوضيح خطوات المعالجة المسبقة المقابلة للسكريبت، وتوفير مراجع تقنية لتكرار طرق البحث.