مقالة بحثية

تصنيف النصوص الإنجليزية الخفيفة مع التعلم العميق القائم على نظرية الأنظمة المعقدة

DOI:

10.3791/69344

يونيو 9, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقترح هذه الدراسة شبكة عصبية خفيفة الوزن مع التقطير الميتا والتعلم الفوقي لتحسين تصنيف النصوص الإنجليزية. يعزز التعميم في البيئات منخفضة البيانات وعبر المجالات مع تقليل التكلفة الحاسوبية والحفاظ على أداء عالي.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لقد أدت العولمة وتطور تكنولوجيا المعلومات إلى زيادة في بيانات النصوص الإنجليزية، وهناك حاجة ملحة لتصنيف فعال. لتحسين قدرة التعميم في تصنيف النصوص الإنجليزية في سيناريوهات العينات الصغيرة وعبر المجالات، ولتحقيق نماذج خفيفة الوزن، تجمع هذه الدراسة بين نظرية الأنظمة المعقدة والتعلم العميق لبناء نموذج شبكة عصبية رسم بياني يأخذ في الاعتبار بشكل كامل خصائص توزيع عينات النص. تقوم طريقة التقطير الفوقي ذات المستويين، المدمجة مع استراتيجيات التعلم الفوقي، بضبط معلمات نموذج المعلم ديناميكيا وتحسين عملية نقل المعرفة بالكامل. تظهر النتائج التجريبية أن أداء التصنيف للنموذج المقترح في مهام تصنيف النصوص قليلة اللقطة وعبر المجالات يتفوق بشكل ملحوظ على الشبكات العصبية التقليدية للرسوم البيانية والنماذج المقارنة السائدة الأخرى. من حيث الخففة، يحافظ ال SM الناتج عن آلية التقطير الفوقي ذات المرحلتين على مستوى عال جدا من الاحتفاظ بالأداء على مجموعات بيانات تصنيف النصوص متعددة المواضيع، مع تقليل الوقت الحسابي بشكل كبير. بالإضافة إلى ذلك، يمكن لهذه الطريقة الحفاظ على كفاءة عالية وأداء تصنيف مستقر في سيناريوهات معالجة النصوص الطويلة، وتقدم مزايا واضحة في الكفاءة الحاسوبية مقارنة بطرق التقطير التقليدية والطرق الأخرى المذكورة في الأدبيات. تعزز الطريقة المقترحة بشكل فعال أداء تصنيف النصوص الإنجليزية في سيناريوهات التطبيقات ذات العينة المنخفضة وعبر النطاقات، مع تقليل التكلفة الحاسوبية بشكل كبير، مما يوفر حلا تقنيا ممكنا وفعالا لتصنيف النصوص الإنجليزية في بيئات محدودة الموارد.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

أدى تسارع العولمة والتقدم في تكنولوجيا المعلومات إلى نمو هائل في بيانات النصوص باللغة الإنجليزية عبر مجالات مثل وسائل التواصل الاجتماعي، والبحوث الأكاديمية، والاتصال التجاري. أصبح تصنيف هذه النصوص بكفاءة لاسترجاع المعلومات، وتحليل المشاعر، وإدارة المحتوى، وغيرها من الوظائف مهمة مهمة في معالجة اللغة الطبيعية1. هدف تصنيف النصوص الإنجليزية (ETC) هو تصنيف النصوص إلى فئات محددة مسبقا بناء على محتواها الدلالي. ومع ذلك، فإن تعقيد اللغة الطبيعية، بما في ذلك غموضها، واعتمادها على السياق، وتنوع التعبير، يطرح العديد من التحديات لمهام تصنيف النصوص2. حاليا، أدى نمو تقنية التعلم العميق (DL) إلى خلق فرص جديدة لتصنيف النصوص. نماذج اللغة المدربة مسبقا الممثلة بتمثيلات الترميز ثنائي الاتجاه من المحولات (BERT) ونسخها يمكنها تعلم معلومات دلالية سياقية غنية من خلال التدريب المسبق على مجموعات كبيرة النطاق، مما يحسن بشكل كبير أداء تصنيف النصوص3. ومع ذلك، لا تزال طرق ETC الحالية تواجه قيدين رئيسيين: أولا، غالبا ما تركز على تحسين نموذج أو ميزة واحدة، متجاهلة الخصائص الجوهرية للغة كنظام معقد، مثل ديناميكيتها وسلوكها الناشئ، مما يؤدي إلى تعميم غير كاف في سيناريوهات منخفضة البيانات أو عبر المجالات؛ ثانيا، رغم الأداء القوي للنماذج المدربة مسبقا، فإن تكلفتها الحسابية العالية وعدد المعلمات الكبير تعيق بشكل كبير النشر العملي في البيئات ذات الموارد المحدودة 4,5. لمعالجة هذه القضايا، تقترح هذه الدراسة إطار تصنيف نصوص خفيف الوزن يدمج نظرية الأنظمة المعقدة (CST) وآلية التقطير الفوقي ذات المرحلتين (TSMDM).

في سياق هذه الدراسة، يشير CST إلى الإطار النظري الذي يعتبر اللغة الطبيعية نظاما معقدا نموذجيا مع تطور ديناميكي، وظهور دلالي، وتوزيع غير متجانس لتأثير العقد المعجمية. يستخدم لمحاكاة الدور السائد للمفردات الأساسية في الانتشار الدلالي والقانون الناشئ للدلالات العامة من الخصائص المعجمية المحلية، مما يعزز فهم النموذج العميق لدلالات النص وقابليته للتكيف مع سيناريوهات البيانات القليلة وعبر المجالات. مساهماته الأساسية هي كما يلي: نظريا، حسب علمنا، يتم إدخال CST بشكل منهجي في مهام تصنيف النصوص، محاكاة التطور الديناميكي والظهور الدلالي لأنظمة اللغة لتعزيز الفهم العميق للنموذج وقدرته على التكيف مع البيانات القليلة ومتعددة المجالات. من الناحية المنهجية، يتم تصميم شبكة عصبية بيانية (GNN) تحتوي على خصائص توزيع العينات. النموذج المبتكر المشترك ل TSMDM يختلف جوهريا عن تقطير المعرفة القياسي. يحقق التقطير القياسي للمعرفة نقل المعرفة باتجاه واحد من نموذج المعلم (TM) ذو المعاملات الثابتة إلى نموذج طالب خفيف الوزن (SM). يدمج التقطير الفوقي في هذه الدراسة استراتيجيات التعلم الفوقي على أساس التقطير، ويمكنه تعديل معلمات التقطير الديناميكي بناء على تغذية الفعل التعلمية للمدير الاستراتيجي. كما يضع التصميم ذو المرحلتين نموذج مساعد التدريس كطبقة مؤقتة وسيطة لتقليل فقدان المعلومات الناتج عن فجوات التعقيد المفرطة بين TM وSM، مما يحقق خفة وزن كبيرة للنموذج مع الحفاظ على دقة عالية، مما يوفر حلا تصنيفا فعالا للسيناريوهات التي تعاني من محدودية الموارد.

في مجال ETC، أجرى الباحثون استكشافا واسعا واقترحوا حلولا متنوعة تدمج ميزات ونماذج مختلفة لمعالجة التحديات التقنية في سيناريوهات مختلفة. صمم ر. تشانغ وآخرون نموذج دمج متعدد الميزات متعدد اللغات مدرب مسبقا (MP-MFFM) لمعالجة مشكلة عدم التقاط المعلومات البنيوية السياقية طويلة المدى في ETC باستخدام طرق التعلم العميق الحالية. جمعت هذه الطريقة بين BERT متعدد اللغات وBiLSTM وCNN النصي لاستخراج معلومات بنيوية دلالية وعالمية ومحلية عميقة ودمجها. حسنت هذه الطريقة الدقة والحساسية والدقة في ثلاث مجموعات بيانات، مما أكد فعاليتها6. اعتمد سي. مادهو وآخرون إطار عمل تعلم الرسوم البيانية الضبابية القائمة على ميزات اللهجات (DF-FGLF) لمعالجة احتياجات تصنيف النصوص للبيانات غير المنظمة ومنخفضة التعليقات في الشبكات الاجتماعية، بالإضافة إلى تأثير اختلافات اللهجات على التصنيف الدولي للإنجليزية. جمعوا بين ميزات تعلم الاختلاف الدلالي واللهجي لبناء رسم بياني ضبابي محسن. عندما كان هناك 10 عينات مشروحة فقط، تجاوزت قيمة F1 للتعرف على اللهجات وتصنيف النصوص 93٪ و80٪، وهو أفضل من الطرق المشابهة ومناسبة للتصنيف العملي7. أجرى ب. شناق وآخرون تجارب باستخدام مجموعات بيانات بالإنجليزية والعربية للتحقيق في تأثير طول n-gram على تصنيف النصوص في أنظمة الكتابة المختلفة وتأثير ميزات اللغة على طول n-gram الأمثل. كان أداء النسخة الإنجليزية من 2 جرام هو الأفضل (الدقة 0.482، التذكر 0.489، قيمة F1 = 0.472)، بينما كانت العربية 6 جرام هي الأفضل (قيمة F1 حوالي 0.85). أثرت صرفية اللغة والميزات النحوية بشكل كبير على أداء نماذج n-gram8. استخدم ن. س. لاجوتينا وآخرون متجه نصي مبني بناء على خصائص الببليومتري للحرف والمفردات وبنية الجملة لتحقيق تصنيف تلقائي للنصوص القصيرة الإنجليزية لتقييم تعلم الطلاب، مع تصنيفات تعلم آلي قياسية مثل SVM. كانت قيمة F1 لنموذج SVM في الإطار الأوروبي المشترك للمرجع للغات 67٪، وكانت قيمة F1 لنموذج أفضل BERT (الأساس البيرت) 69٪. كانت الأخطاء في الغالب في المستويات المجاورة، وكانت جودة التصنيف تعتمد على مجموعة9.

كما حقق تقطير المعرفة، كوسيلة فعالة لتحقيق تخفيف وزن النموذج، وتحسين أداء النماذج في سيناريوهات العينات الصغيرة، وتقليل التكاليف الحاسوبية، تقدما كبيرا في الأبحاث ذات الصلة. استكشفت أبحاث سابقة تطبيق استقطال المعرفة لمعالجة التحديات الرئيسية في معالجة اللغة الطبيعية، بما في ذلك: تعزيز أداء نماذج المعلمات الصغيرة في ظروف منخفضة التسمية، تحسين مهام تصنيف النصوص متعددة اللغات، ضغط النماذج الكبيرة المدربة مسبقا عبر استراتيجيات ضغط هجينة، وتقطير تمثيلات الجمل الفعالة لتضييق الفجوة في الأداء بين نماذج اللغة الكبيرة والصغيرة مع التكيف مع الأجهزة القيود10، 11، 12، 13. على الرغم من هذه التطورات، لا تزال طرق استقطال المعرفة الحالية تعاني من قيود حرجة ل ETC: فهي تفتقر إلى آليات تحسين ديناميكية لعملية نقل المعرفة، وغالبا ما تعاني من فقدان شديد للمعلومات عند التقطير بين النماذج الدقيقة والخفيفة الخفيفة، وتفشل في التكامل الفعال مع خصائص التوزيع الجوهرية لبيانات النص. تؤدي هذه العيوب إلى أداء تعميم غير مثالي في السيناريوهات القليلة وعبر المجالات. غالبا ما تكافح النماذج الخفيفة الوزن التي يتم الحصول عليها عبر هذه الطرق في تحقيق التوازن بين فعالية التصنيف والكفاءة الحسابية في البيئات التي تعاني من محدودية الموارد. هذه هي الفجوة الرئيسية التي تهدف الأبحاث في هذه الورقة إلى معالجتها.

تختبر هذه الدراسة الفرضية البحثية التالية: أولا، دمج CST في ETC يمكن أن يحاكي بشكل فعال التطور الديناميكي وخصائص الظهور الدلالي لأنظمة اللغة الطبيعية. يمكن لهذا التكامل النظري أن يعزز بشكل كبير قدرة النموذج على التعميم في السيناريوهات القليلة وعبر المجالات مقارنة بنماذج تصنيف النصوص التقليدية التي تتجاهل خصائص النظام المعقدة للغة. ثانيا، يمكن لنموذج GNN المصمم مع مراعاة صريحة لخصائص توزيع عينات النصوص أن يعوض عن قيود شبكات GNN التقليدية التي تركز فقط على النمذجة العلائقية على مستوى المشكلة، وتحقيق استخراج أعمق للمعلومات الدلالية العالمية والمحلية في النصوص الإنجليزية. ثالثا، يمكن ل TSMDM إلى جانب استراتيجيات التعلم الفوقي ونموذج مساعد التدريس تحقيق نقل معرفة فعال ومنخفض الفقدان من النماذج المعقدة إلى النماذج الخفيفة. يمكن أن يقلل ذلك بشكل كبير من التكلفة الحسابية للنموذج ومقياس المعلمات مع الحفاظ على أداء تصنيف عالي. بالإضافة إلى ذلك، يمكن للنموذج الخفيف المستخرج من هذه الآلية الحفاظ على أداء تصنيف مستقر وفعال في سيناريوهات معالجة النصوص الطويلة ذات البنى الدلالية المعقدة.

باختصار، حسنت الأبحاث ذات الصلة أداء تصنيف النصوص من خلال دمج الميزات المتعددة، وتعلم ميزات اللهجات، وتحسين n-gram، وميزات المقاييس الأسلوبية، كما حققت خفة النموذج من خلال استخلاص المعرفة. ومع ذلك، لا تزال الطرق الحالية تعاني من أوجه قصور في التقاط المعلومات لمسافات طويلة، وتعميم العينات الصغيرة، وتكييف النماذج المعقدة والبسيطة. لتقليل التكلفة الحسابية لنموذج ETC مع ضمان دقته، تبني هذه الدراسة نموذجا خفيف الوزن من خلال دمج CST وTSMDM لتعزيز قدرة النموذج على التعميم وكفاءته الحسابية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لتحسين قدرة التعميم في ETC في سيناريوهات العينات الصغيرة وعبر المجالات وتحقيق نموذج خفيف الوزن، تقترح هذه الدراسة إطار تصنيف نصوص يدمج CST وTSMDM. تظهر العملية العامة لهذا الإطار في الشكل 1.

figure-protocol-1
الشكل 1: تصور إطار تصنيف النصوص الإنجليزية الخفيف المكون من أربع مراحل يدمج CST وTSMDM. يتكون سير العمل من أربع مراحل. تقوم المرحلة 1 بتمثيل النص باستخدام تضمين ديناميكي قائم على BERT من النص الإنجليزي المدخل. تطبق المرحلة الثانية نمذجة الشبكات العصبية عبر الرسوم البيانية من خلال بناء رسم نصي وحساب علاقات على مستوى النسخة والتوزيع. تنمذج المرحلة الثالثة الظهور الدلالي من خلال إعادة بناء مركزية العقدة وإطار توليد النماذج الأولية متعددة المستويات للحصول على النموذج الأولي النهائي للفئة. تجري المرحلة الرابعة التقطير العنصري من مرحلتين، حيث يتم تدريب نموذج المعلم ونقل المعرفة عبر التقطير الفوقي لإنتاج نموذج الطالب النهائي. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

أولا، في مرحلة تمثيل النص والتضمين الديناميكي، يستخدم نموذج BERT لتضمين النص المدخل ديناميكيا والتقاط المعلومات الدلالية السياقية. المرحلة الثانية هي نمذجة GNN الواعية للتوزيع، والتي تأخذ في الاعتبار خصائص توزيع العينات، وتبني نموذج GNN، وتعزز تمثيل الميزات من خلال تفاعل المعلومات المزدوجة على مستوى المثيل ومستوى التوزيع. المرحلة الثالثة هي نمذجة الظهور الدلالي الموجهة بنظرية النظام الهجين، مقدمة إعادة بناء مركزية العقد وآلية توليد نماذج أولية ثلاثية المستويات لمحاكاة ديناميكيات وظهور نظام اللغة. وأخيرا، في المرحلة الرابعة، يتم تنفيذ عملية خفيفة الوزن من مستويين من التقطير الميتا. يتم تحسين عملية استقطال المعرفة من خلال نموذج المساعد واستراتيجية التعلم الفوقي لتحقيق ضغط وتسريع النماذج بكفاءة.

نموذج ETC بناء على خصائص التوزيع وCST
نظرة عامة على بنية النماذج
يستخدم نموذج تصنيف النصوص المقترح أولا جهاز BERT مدرب مسبقا لتنفيذ ترميز سياقي ديناميكي للنص المدخل، مما يولد تضمينات كلمات غنية دلاليا وتمثيلا عاما. بعد ذلك، يتم بناء رسم بياني للمثيل ورسم توزيع من هذه الميزات: حيث يلتقط رسم الحالة التشابه في العينات بشكل زوجي، بينما يشكل رسم التوزيع توزيع البيانات بشكل عام؛ يتيح تبادل المعلومات التكراري بين الرسومين البيانيين التعزيز التآزري للميزات الفردية والبنية العالمية. بعد ذلك، يتم دمج CST لتعزيز شبكة الرسوم البيانية بشكل عميق. يستخدم إعادة بناء مركزية العقد PageRank لقياس التأثير المعجمي، محاكاة الدور المهيمن للعناصر الأساسية في شبكات اللغة. هذه طريقة معتمدة على نطاق واسع لقياس التأثير العالمي للعقد في طوبولوجيات الشبكات المعقدة، وهي مناسبة جدا لالتقاط الانتشار الدلالي غير المتماثل للعقد المعجمية الأساسية في أنظمة اللغة. إطار عمل توليد النماذج الأولية المكون من ثلاثة مستويات "ميكرو-ميزو-ماكرو" يحاكي العملية الناشئة من الدلالات المحلية إلى تمثيلات الفئات الشاملة. وأخيرا، يتم تغذية تمثيلات الميزات المحسنة في مصنف لإنتاج احتمالات الفئة النهائية.

تفاعل الميزات مع GNN الواع بالتوزيع
لتحسين قدرة التعميم في ETC، والتقاط العلاقات الدلالية المعقدة بين النصوص وميزات توزيع العينة (SDFs) بشكل فعال، تبني هذه الدراسة نموذج ETC بناء على ميزات التوزيع وCST. يحقق هذا الكتاب التنقيب العميق للمعلومات العالمية والمحلية في النصوص من خلال دمج آليات مثل GNN والتضمين الديناميكي للنصوص. GNN هو نموذج DL مصمم خصيصا لمعالجة البيانات المهيكلة على شكل رسم بياني. المبدأ الأساسي هو استخدام آلية تمرير الرسائل (حيث تقوم كل عقدة في الرسم البياني بتجميع معلومات الميزات للعقد المجاورة) ودمجها مع حالتها الخاصة. من خلال جولات متعددة من التحديثات التكرارية، يتعلم تدريجيا تمثيلا عالي الأبعاد يشمل بنية الطوبولوجيا. تمكن هذه العملية العقد من التقاط البنية وتبعيات الميزات للجوار المحلي وحتى الرسم البياني العالمي. لتجاوز قيود نماذج التسلسل التقليدية في نمذجة التبعيات طويلة المدى والعلاقات العالمية، تستخدم هذه الدراسة GNN لالتقاط الارتباطات الدلالية المعقدة والعلاقات البنيوية بين العينات. نظرا لتركيز GNN على معلومات الارتباط المباشر بين العينات الفردية، فإنه يتجاهل خصائص التوزيع العامة لمجموعة العينات14، 15، 16. لذلك، تقترح هذه الدراسة نموذج GNN يأخذ في الاعتبار SDF. يقدم هذا النموذج تقنية BERT لتضمين النصوص الديناميكي ويجمعها مع شبكة نموذجية لحساب فروق الميزات في العينات. BERT هو نموذج لغوي مدرب مسبقا يعتمد على بنية ترانسفورمر. المبدأ الأساسي هو التقاط المعلومات الدلالية لكل كلمة في السياق من خلال مشفر ثنائي الاتجاه في الوقت نفسه، وتدريبها مسبقا على مجموعة كبيرة باستخدام مهمتين: "نموذج اللغة المقنع" و"توقع الجملة التالية". في نماذج اللغة المقنعة، يتم إخفاء بعض الكلمات في المدخل بشكل عشوائي، ويحتاج النموذج إلى التنبؤ بالكلمة الأصلية بناء على السياق. التنبؤ التالي يحدد ما إذا كانت الجملتان متتاليتين. بعد التدريب المسبق، يمكن ل BERT التكيف بسرعة مع مهام معالجة اللغة الطبيعية المختلفة من خلال الضبط الدقيق، مما يحسن الأداء بشكل كبير ويوفر تمثيلات ميزات عالية الجودة لبناء هياكل الرسوم البيانية لاحقا. الهيكل المحدد لنموذج ETC الذي تم إنشاؤه في هذه الدراسة موضح في الشكل 2.

figure-protocol-2
الشكل 2: التصميم المعماري لنموذج تصنيف النصوص الإنجليزية المدمج مع CST مع الأخذ في الاعتبار ميزات توزيع العينة. تظهر الهيئة التصميم المعماري لنموذج تصنيف النصوص الإنجليزية المدمج مع نظرية النظام العقدي (CST) مع مراعاة خصائص توزيع عينات النص. تدمج هذه البنية بين التضمين السياقي الديناميكي القائم على BERT، وشبكات الرسوم العصبية الواعية بالتوزيع (GNN)، وآليات تعزيز CST، وتحقق التنقيب العميق للمعلومات الدلالية العالمية والمحلية في النصوص الإنجليزية من خلال نمذجة تعاونية متعددة الوحدات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

في هذا النموذج، لمجموعة بيانات عامة، يولد النص الإنجليزي المدخل في نموذج BERT تسلسل رموز عبر رمزي. طريقة بناء التسلسل موضحة في المعادلة (1).

[CLS1،2,... an، [SEP] (1)

في المعادلة (1)، [CLS] هو علامة التصنيف الموجودة في بداية المتتالية. سيولد BERT حالة مخفية في الموقع الثابت ل [CLS] أثناء عملية التدريب. تستخدم هذه الحالة مباشرة للتمثيل الدلالي العالمي للنص بأكمله. 1،2,... يمثلn كلمة أو كلمة فرعية في النص. [SEP] هو فاصل يستخدم لتحديد نهاية الجملة. بعد معالجة بيرت للتسلسل أعلاه، يتم الحصول على ميزات كل رمز، مما يوفر معلومات سياقية منظمة للنموذج. بالنسبة لمجموعات البيانات الخاصة التي تحتوي على كيانات، إذا تم استخدام طرق بناء التسلسل التقليدية، فإن المعلومات الموضعية التي تحتوي عليها الكيانات ستفقد. لذلك، تقوم هذه الدراسة ببناء التسلسل باستخدام الطريقة الموضحة في المعادلة (2).

figure-protocol-3(2)

في المعادلة (2)، [E1]، [/E1]، [E2]، و [/E2] هي الرموز التي تحدد مواقع البداية والنهاية لكيانين. وبالمثل، بعد معالجة بيرت، ستحمل ميزات إخراج هذه الرموز معلومات دلالية للكيانات المقابلة، مما يستفيد بشكل أفضل من المعلومات المهمة لموقع الكيان. لاحقا، تستخدم هذه الدراسة نموذج GNN يأخذ SDF لتعزيز التوزيع وخصائص العينات في الحالات. هيكل النموذج موضح في الشكل 3.

figure-protocol-4
الشكل 3: بنية تفاعل الميزات ذات الرسم البياني المزدوج لنموذج الشبكة العصبية الواعية بالتوزيع البياني. يعرض الشكل بنية تفاعل الميزات الثنائية الرسم البياني لنموذج GNN الواع بالتوزيع لتصنيف النصوص الإنجليزية. تبني هذه البنية رسم بياني نقطي لترميز التشابه على مستوى النسخة ورسم توزيعي لترميز التشابه على مستوى التوزيع، ويحقق تحسين الميزات من خلال تفاعل المعلومات التكراري بين الرسومين البيانيين، مكملا دورة المعلومات عبر المستويات لميزات المثيل وميزات التوزيع. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

يحقق النموذج تحسين الميزات من خلال آلية تفاعل ذات مرحلتين. أولا، يقوم بتحليل ميزات التوزيع من ارتباطات عينات البيانات على مستوى المعرض، ثم يحسن خصائص النسخة ديناميكيا من خلال تبادل المعلومات على مستوى التوزيع. من خلال تعزيز ميزات العينات ومستويات التوزيع بشكل تكراري، يكمل في النهاية مهمة التصنيف. يستخدم النموذج تحديدا مخططات النقاط والرسوم البيانية للتوزيع لتحقيق تبادل المعلومات. تستخدم خريطة النقاط متجه ميزات عينة النص (المحدثة بآخر طبقتين من BERT) كعقدة، وتكميم فرق ميزة العينة لحساب وزن الحافة عبر شبكة ترميز مخصصة (طبقة سيجمويد واحدة + طبقتان تطبيع دفعيتين التفافي)، وتستخدم الحد الأدنى من التطبيع لتطبيع الفترة [0,1. يتم تعيين عتبة تشابه تجريبية مقدارها 0.2 للعتبة على الحواف، حيث يتم تقليم الحواف ذات الأوزان الأقل من هذا الحد لإزالة الارتباطات الضعيفة على مستوى المعرض. يأخذ رسم التوزيع البياني ميزات توزيع النص المدمج كعقد، مع حساب أوزان الحواف بناء على تشابه جيب تمام متجهات ميزات التوزيع ويتم تطبيعه عبر تطبيع L2 لضمان اتساق المتريات. يتم اعتماد عتبة حواف 0.15، وتزال الحواف التي تحمل أوزانا أقل من هذه القيمة، بينما يتم رسم أوزان الحواف الصالحة المتبقية وتوحيدها بواسطة بيرسيبترون متعدد الطبقات لتعزيز التمييز بين الارتباطات على مستوى التوزيع. تعرف هذه الدراسة رسما بيانيا figure-protocol-5 نقطيا لتكرار طبقة l، حيث تمثل العقدة figure-protocol-6 ميزات العينة وترمز الحافة figure-protocol-7 لتشابه مستوى النسخة. خريطة figure-protocol-8التوزيع ، تمثل العقدة figure-protocol-9 ميزات العينة، والحافة figure-protocol-10 تشفر تشابه مستوى التوزيع. بأخذ العجلة من ال من ال إلى ال +1 كمثال، يحسب حساب العلاقة على مستوى النسخة تشابه النقاط من خلال فروق الميزات، كما هو موضح في المعادلة (3).

figure-protocol-11 (3)

في المعادلة (3)، figure-protocol-12 و figure-protocol-13 هما أوزان الحواف بين العقدتين i و j خلال تكرارات l-th و l-1 من رسم النقاط النقطي، مما يعكس تشابه ميزات العينة. figure-protocol-14 هي شبكة ترميز تستخدم لتحويل اختلافات ميزات العقدة إلى مقاييس أوزان الحواف، تتكون من طبقة واحدة من السيجمويد وطبقتين من دوال تفعيل تطبيع دفعات الالتفاف. عندما figure-protocol-15 يكون و figure-protocol-16 التكرار l-1، يتم تحديث المتجهات الذاتية للعقدتين i و j بواسطة بيرت في الطبقتين الأخيرتين. بعد ذلك، يتم حساب خصائص التوزيع بناء على علاقات الحالات، كما هو موضح في المعادلة (4).

figure-protocol-17(4)

في المعادلة (4)، figure-protocol-18 هو المتجه الذاتي للعقدة i في رسم توزيع الطبقة l. MLP1 هو بيرسيبترون متعدد الطبقات يتكون من دوال التنشيط وطبقات متصلة بالكامل، يربط الميزات المركبة المتسلسلة بميزات توزيع جديدة. بعد ذلك، يتم حساب علاقة التوزيع بناء على خصائص التوزيع، ويتم حساب ميزات النسخة من علاقة التوزيع لإكمال حلقة المعلومات عبر المستويات.

آليات تعزيز الأنظمة المعقدة
لتحسين قدرة التعميم بشكل أكبر، تم تطبيق CST على النموذج أعلاه في هذه الدراسة. يتجلى التطور الديناميكي للأنظمة المعقدة من خلال التوزيع غير المتجانس لتأثير العقد. لمحاكاة الدور السائد للمفردات الأساسية في الانتشار الدلالي في أنظمة اللغة، تقدم هذه الدراسة مؤشر مركزية العقدة لإعادة بناء آلية انتشار المعلومات. يستخدم رسم النقاط Hp الذي تم إنشاؤه لكل مهمة سيناريو خوارزمية PageRank لقياس مركزية العقدة C(hi)، كما هو موضح في المعادلة (5)17.

figure-protocol-19(5)

في المعادلة (5)، α هو معامل التخميد، α = 0.85. N(hi) تمثل مجموعة العقد المجاورة، وL(hj) هي درجة العقدة. تستبدل المعادلة (5) عملية الانتشار المتسلسلة لتأثير المفردات في شبكات اللغة المحاكاة، مما يسمح للمفردات الأساسية (مثل الأفعال وكلمات الموضوع) بأن تكتسب مركزية أعلى. بعد ذلك، يتم اقتران مركزية العقدة بأوزان الحواف لضبط قوة انتشار المعلومات بين العقد بشكل ديناميكي. دالة الاقتران λij موضحة في المعادلة (6).

figure-protocol-20(6)

في المعادلة (6)، σ هي دالة تنشيط السيجمويد، وWT هو متجه الوزن القابل للتعلم، وb تعني مصطلح التحيز. يوازن الاقتران بين المركزية وأوزان الحواف بشكل ديناميكي العلاقات المحلية مع الأهمية العالمية، مما يعزز قدرة النموذج على التكيف مع التغيرات الديناميكية في المهام. يظهر ظهور CST في اللغة الإنجليزية حيث تجاوزت الدلالات العامة مجموع المفردات المحلية18. لاستخدام هذه الميزة في ETC، صممت هذه الدراسة إطار عمل توليد نماذج أولية ثلاثية المستويات لمحاكاة عملية الظهور من الميزات الدقيقة إلى الفئات الكلية، كما هو موضح في الشكل 4.

figure-protocol-21
الشكل 4: البناء التدريجي لإطار توليد النماذج الأولية ثلاثية المستويات للميكرو-ميزو-ماكرو لظهور الدلالة اللغوية. يوضح الشكل البناء خطوة بخطوة لإطار التوليد الأولي الثلاثي المستويات لنموذج الميكرو-ميزو-ماكرو لمحاكاة ظهور الدلالة اللغوية في تصنيف النصوص الإنجليزية. يبني الإطار تمثيلات الفئات النصية الهرمية من خلال تجميع الفئات الفرعية الدقيقة مع المتوسطات K، ودمج النموذج الأولي للفئة الفرعية المتوسطة بناء على وزن تشابه التوزيع، والتكامل غير الخطي الكبير عبر آلية الانتباه، محاكاة الخاصية الناشئة ل "الكل أكبر من مجموع أجزائه" في أنظمة اللغة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تقوم العملية أعلاه ببناء تمثيلات فئات نصية خطوة بخطوة من الميكرو إلى الماكرو لرفع قدرة النموذج على التعميم. على المستوى الدقيق، يتم توليد الفئات الفرعية K عن طريق تجميع تمثيلات تضمين العينات لكل فئة نصية. يستخدم المتوسطات K لتقسيم العينات داخل الفئة إلى مجموعات فرعية، ويحسب موقع مركز كل مجموعة فرعية كنموذج فرعيللفئة الفرعية 19. في المستوى الميزوسكوبي، يتم حساب تشابه توزيع كل نموذج أولي من الفئة الفرعية، ويتم توليد مصفوفة تشابه، ثم تعاد تجميع النماذج الأولية للفئة الفرعية بناء على أوزان التشابه لقياس الارتباط بين الفئات الفرعية. يتم عرض حساب وزن التشابه الفرعي معij في المعادلة (7).

figure-protocol-22 (7)

في المعادلة (7)، figure-protocol-23 يوجد تباعد جنسن شانون، المستخدم لقياس الفرق في التوزيع بين فئتين figure-protocol-24 فرعيتين و figure-protocol-2520. وأخيرا، يتم وزن ودمج النماذج الأولية للفئة الفرعية للحصول على مجموعة من تمثيلات توزيع الفئات. figure-protocol-26 على المستوى الكلي، يتم تعلم أوزان الأهمية لكل فئة فرعية من خلال آليات الانتباه، ويتم إدخال تحويلات غير خطية لمحاكاة عملية الظهور، مما ينتج عنه النموذج النهائي للفئة cالنهائي كما هو موضح في المعادلة (8).

figure-protocol-27(8)

في المعادلة (8)، تعني αk وزن الانتباه للفئة k. U تشير إلى مصفوفة وزن التحويل غير الخطي. يستخدم TANH(·) لتعزيز التمثيل غير الخطي ومحاكاة المجموع الكلي الأكبر من مجموع الأجزاء المميز للأنظمة العقدية. يلتقط كل مستوى التنوع داخل الفئات من خلال هيكل الفئة الفرعية، ويوزع تشابه توزيع الفرق لتقليل تأثير الفئات الفرعية المزعجة، ويركز ديناميكيا على الميزات التمييزية من خلال آليات الانتباه لتعزيز قدرة النموذج على التعميم. يتم دمج CST بشكل رئيسي مع GNN من خلال آليتين. الأول هو إدخال مركزية العقدة لإعادة بناء عملية نشر المعلومات ومحاكاة التوزيع غير المتجانس للتأثير المعجمي في نظام اللغة. يتم قياس مركزية العقدة من خلال خوارزمية PageRank ويتم ربطها ديناميكيا بأوزان الحواف، مما يمكن المفردات الأساسية من السيطرة في الانتشار الدلالي ويعزز قدرة النموذج على التكيف مع التغيرات الديناميكية للمهام. الثاني هو تصميم إطار توليد النماذج الأولية من ثلاثة مستويات، من تجميع الفئات الفرعية الدقيقة إلى دمج النماذج الأولية في الفئات الكبرى، لمحاكاة الخاصية الناشئة في نظام اللغة بأن "الكل أكبر من مجموع أجزائه". يحقق هذا الإطار التكامل الهرمي من السمات المحلية إلى الدلالات العالمية من خلال تشابه التوزيع، ووزن التوزيعة، وآليات الانتباه.

باختصار، يكمن الابتكار الأساسي في نموذج ETC المنشأ في دمج أفكار CST بعمق في إطار GNN. من خلال إعادة بناء آلية نشر المعلومات من خلال مركزية العقد، يحاكي النموذج الدور القيادي للعناصر الأساسية في نظام اللغة ويعزز قدرته على التكيف مع ديناميكيات المهام. من خلال إطار توليد النماذج الأولية ذات المستويات الثلاثية، يحقق النموذج عملية الظهور من السمات المحلية إلى الدلالات العالمية، مما يعزز قدرة النموذج على التقاط التنوع والسمات التمييزية داخل الفئة. تتجنب هذه الطريقة قيود شبكات GNN التقليدية التي تعتمد فقط على علاقات على مستوى المشكلة. من خلال التفاعل على مستوى التوزيع وخصائص النظام المعقدة، يوفر حلا جديدا لتحسين قدرة التعميم للنموذج في السيناريوهات القليلة وعبر المجالات.

تتوافق الخصائص الناشئة لتقنية CST مع إطار توليد نماذج أولية ثلاثية المستويات. في أنظمة اللغة، يظهر مبدأ "الكل أعظم من مجموع أجزائه" كقفزة دلالية من معاني الكلمات المحلية إلى فئات النص العامة. تحاكي هذه الدراسة هذه العملية من خلال آلية توليد النماذج الأولية ثلاثية المستويات "ميكرو-ميزو-ماكرو": على المستوى الجزئي، تجمع العينات لتشكيل نماذج أولية من الفئة الفرعية؛ على المستوى المتوسط، يتم وزن هذه النماذج الأولية ودمجمها بناء على التشابه التوزيعي؛ وعلى المستوى الكلي، يتم تصنيع النماذج الأولية للفئة النهائية بشكل غير خطي عبر آلية انتباه. على سبيل المثال، في تصنيف المشاعر، تمتزج الكلمات السلبية المتعددة مثل "مخيب للآمال"، "بطيء"، و"مكلف" بشكل غير خطي لتظهر كشعور عام قوي ل "التقييم السلبي". مركزية العقدة وتباين وجودها في CST تتماشى مع آلية نشر المعلومات القائمة على إعادة بناء مركزية العقدة. داخل شبكات اللغة، يكون تأثير الكلمات موزعا بشكل غير متساو، حيث تلعب الكلمات الأساسية (مثل الأفعال، المصطلحات الموضوعية) دورا رئيسيا في الانتشار الدلالي. تقوم هذه الدراسة بقياس مركزية العقد باستخدام خوارزمية PageRank وتقرنها ديناميكيا مع أوزان الحواف لضبط شدة توزيع المعلومات بين العقد. على سبيل المثال، في تصنيف الأخبار، يحظى مصطلح "انتخابات" بمركزية عالية في النصوص السياسية، مما يدفع العقد المجاورة مثل "التصويت" و"الحملة" إلى زيادة الوزن أثناء تجميع المعلومات، مما يعزز التمثيل الدلالي لذلك الموضوع. الطبيعة الديناميكية والتكيفية لتقنية CST تتوافق مع شبكات GNN الواعية بالتوزيع وآلية تجربة تعليمية ضمن التقطير الفوقي. تتطور أنظمة اللغة ديناميكيا وفقا للسياق ومتطلبات المهام. تلتقط النماذج التغيرات التوزيعية العامة في مجموعات البيانات من خلال شبكات GNN الواعية للتوزيع. في الوقت نفسه، يتم تقديم آلية تجربة تعليمية مدفوعة بالتعلم الفوقي في TSMDM، تسمح للنماذج بتعديل المعاملات ديناميكيا بناء على تغذية راجعة من SMs. على سبيل المثال، في تحليل المشاعر عبر المجالات، يمكن للنموذج تكييف أوزان الميزات بسرعة بناء على توزيع بيانات المجال المستهدف وتحسين معلمات TM أثناء التقطير الفوقي لتحسين كفاءة التكيف للمجالات الجديدة.

نموذج LTC المبني على TSMDM
خط أنابيب التقطير الفوقي ذو المرحلتين
لمعالجة تحديات التكلفة الحسابية العالية وصعوبات النشر في البيئات التي تعاني من محدودية الموارد، تم اقتراح نموذج تصنيف نصوص خفيف الوزن يعتمد على TSMDM. تنفذ هذه الطريقة الميتا-تقطير عملية التقطير بترتيب تسلسلي صارم مع مرحلتين مميزتين. تبدأ المرحلة الثانية فقط بعد إكمال وتقارب تدريب المرحلة الأولى: 1) مرحلة ضغط المعرفة من المعلم إلى مساعد التدريس (TA)، و2) مرحلة التقطير الخفيف من مساعد التدريس إلى الطالب المدمجة مع تكييف معلمات التعلم الفوقي. يحقق هذا النهج نقل المعرفة بكفاءة من آلة تأمل معقدة إلى إدارة معلومات خفيفة الوزن من خلال التقطير ذو المرحلتين، مع دمج آلية التعلم الفوقي لتحسين استراتيجية نقل المعرفة ديناميكيا خلال العملية21,22. يتم توضيح خط الأنابيب العام في الشكل 5.

figure-protocol-28
الشكل 5: تصميم خط الأنابيب لنموذج تصنيف النصوص خفيف الوزن مع آلية التقطير الفوقي ذات مرحلتين. يصمم الشكل خط أنابيب نموذج تصنيف النصوص خفيف الوزن باستخدام آلية التقطير الفوقي ذات المرحلتين (TSMDM). يتكون خط الأنابيب من نموذج المعلم (مصدر معرفة عالي التعقيد)، ونموذج مساعد تدريس (طبقة مخزن تعقيد متوسطة)، ونموذج طالب (نموذج هدف خفيف الوزن)، وينفذ نقل المعرفة بكفاءة عبر مرحلتين متسلسلتين: ضغط المعرفة من المعلم إلى مساعد المعلم، والتقطير الخفيف من مساعد التدريس إلى الطالب مدمجا مع التعلم الفوقي. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تتضمن الطريقة ثلاثة أدوار: TM، نموذج TA، وSM، مع تقسيم عملية التقطير إلى مرحلتين: تقطير المعلم-TA والتقطير TA-TU. في المرحلة الأولى من ضغط المعرفة بين المعلم والمساعد التدريسي، يتم ضغط المعرفة من ال TM أولا إلى نموذج TA متوسط التعقيد لتقليل فقدان المعلومات الناتج عن فجوات السعة المفرطة في التقطير المباشر. يعمل النموذج كمصدر معرفة، وينقل كل من احتمالات تصنيف المخرجات وميزات الطبقة المتوسطة إلى نموذج تحليل المعلومات. يتم تدريب نموذج TA من خلال محاذاة مخرجاته وتمثيلات الميزات مع مخرجات المعلم، باستخدام دالة فقدان مركبة تدمج فقدان التصنيف وفقدان محاذاة الميزات21. في المرحلة الثانية من التقطير الخفيف من TA إلى Student، والتي تطلق عند تقارب نموذج TA، يتم تقطير المعرفة من نموذج TA إلى SM الخفيفة النهائية. تستخدم هذه المرحلة أيضا إشرافا مزدوجا (سجلات التصنيف والميزات الوسيطة) وتتضمن آلية تعلم فوقي: حيث تجري الآلة "تجارب تعليمية" على المهام المساعدة لتقييم حالة تعلم الطالب وتضبط معاييره بشكل ديناميكي لتقديم إرشادات أكثر تكيفا واستهدافا. يكمل SM التدريب من خلال تقليل كل من التباين الناتج ومسافة الميزات بالنسبة لنموذج TA، مما يحقق تخفيلا كبيرا في المعلمات مع الحفاظ على أداء التصنيف إلى أقصى حد ممكن22.

التعلم الفوقي مع تجارب التدريس
في طرق تقطير المعرفة التقليدية، يوجه ال TM المدرب ال SM من خلال المشاركة في حساب الخسارة. ومع ذلك، فإن TMs الثابتة يصعب تقييمها لحالة التعلم الفعلية للمعلمات الثابتة، ولا يمكنها تحديد المساهمة المحددة لإرشاداتها في تحديث معلمات SM23,24. لذلك، تقدم هذه الدراسة أفكارا للتعلم الفوقي في عملية التقطير، مما يمكن الآلة من تعديل معاييره الخاصة بناء على تغذية الفعل التعلمية من SM. يتم عرض عملية التقطير في الشكل 6.

figure-protocol-29
الشكل 6: عملية تحسين المعامل التكرارية للتقطير الفوقي مع آلية التجربة التعليمية ( Teaching Experiment).يوضح الشكل عملية تحسين المعامل التكرارية من خلال التقطير الفوقي مع آلية التجربة التعليمية لنموذج تصنيف النصوص الإنجليزية بخفة الوزن. تولد العملية متعلما داخليا مؤقتا من نموذج الطالب، وتحدد فقدان تأثير التدريس من خلال أداء التدريب المحاكى للمتعلم الداخلي، وتمكن نموذج المعلم من تعديل معاييره الخاصة عبر الانتشار العكسي للفقدان، وبالتالي تحسين استراتيجية نقل المعرفة اللاحقة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

يقوم TM بتحسين المعلمات من خلال مهام التصنيف التقليدية خلال مرحلة التدريب الخاصة به، مما يؤدي إلى خسارة تصنيف أساسية LT تعكس أدائها الأصلي. بعد إكمال التدريب، يتم تكرار SM S لتوليد نسخة مؤقتة من S 1 الداخلي للمتعلم. يقوم ال TM بإجراء تجارب تعليمية على S1، ويتم قياس الخطأ الشامل في الأداء الذي أظهره S1 في هذا التدريب المحاكى كخسارة LQ. تستخدم هذه الإشارة كتغذية راجعة للجهاز التقني لتقييم فعالية التدريس. من خلال الانتشار العكسي ل L Q، يقوم ال TM بضبط معاييره الخاصة بنشاط ويحسن طريقة نقل المعرفة. بعد إكمال تحسين التعلم الفوقي، يقوم النموذج بإجراء تقطير المعرفة الرسمي على SM S الأصلي، ويستخدم أيضا فقدان L S للنموذج كتغذية راجعة لتعليم تقييم الفعالية لل TM. لتحقيق تخفيف وزن نموذج ETC، ستنظر هذه الدراسة في دمج نموذج SDF GNN كنموذج TM في عملية التجربة التعليمية، كما هو موضح في الشكل 7.

figure-protocol-30
الشكل 7: تدفق تحديث المعامل لآلية تجربة التدريس لتحسين نموذج المعلم في التقطير الفوقي. يوضح الشكل تدفق تحديث المعلمات لآلية تجربة التدريس لتحسين نموذج المعلم في عملية التقطير الفوقي. يحسب التدفق أولا الخسارة الناعمة بين توقع المتعلم الداخلي وتوقع نموذج المعلم باستخدام دالة متوسط مربع فقدان الخطأ، ويجمع بين الخسارة الناعمة وخطأ التسمية الصلبة لتشكيل خسارة التدريب الكلي، ويحدث معلمات نموذج المعلم من خلال الانتشار العكسي للخطأ الكلي المرجح لتحسين فعالية التدريس. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

بعد إكمال تدريب تقطير المعرفة، يحسب مدير اللعبة أولا الفرق بين النتائج المتوقعة لل TM والتسميات الحقيقية. بعد ذلك، تستخدم دالة فقدان MSE لقياس المسافة بين توقع SM ( S1 للمتعلم الداخلي) وتوقع TM. تستخدم هذه القيمة كقيمة المسافة كخسارة ناعمة25. الهدف النهائي للتدريب يتكون من مزيج موزون من خطأ العلامة الصلبة والخسارة الناعمة. من خلال الانتقال العكسي للخطأ الكلي المرجح، يتم تحديث معلمات التعديل الوزني، مما يحسن فعالية التدريس للخطأ. يتم عرض حساب معلمات المتعلم الداخلي S1 في المعادلة (9).

figure-protocol-31(9)

في المعادلة (9)، figure-protocol-32 و figure-protocol-33 هي معلمات المتعلم الداخلية ومعلماتها الأولية المتأثرة بمعامل TM γT. λ (معدل التعلم، λ = 0.005) يتحكم في حجم خطوة تحديث المعلمات للمتعلمين الداخليين (أي نسخ من SMs) أثناء التقطير الفوقي26. المعادلة (9) تحسب تدرجات الفقدان من خلال الانتشار العكسي، بينما تقوم λ بتحديث معلمات المتعلمين الداخليين. تعكس هذه الآلية خصائص التعلم لدى مديري المعلومات، مما يمكن المديرين من تلقي التغذية الراجعة وتعديل استراتيجيات تدريسهم، مما يعزز فعالية استقطاف المعرفة لاحقا. يتم عرض حساب الخسارة LS في التعلم الفوقي في المعادلة (10).

figure-protocol-34 (10)

في المعادلة (10)، B هي تسلسل عينة التعلم الفوقي.

تحسين نقل المعرفة باستخدام تصميم الخسارة ونموذج المساعد
لتعزيز فعالية استقطال المعرفة بشكل أكبر، تحقق هذه الدراسة الخسارة الكلية من خلال حساب فقدان التصنيف وفقدان الميزات. من بينها، يتبنى فقدان الميزة آلية استعادية، تستخدم مخرجات الميزات الضحلة والحالية في TM لتوجيه SM، كما هو معبر عنه في المعادلة (11).

figure-protocol-35(11)

في المعادلة (11)، I هي مجموعة مؤشرات طبقة الميزات. D هي دالة مسافة تؤخذ لحساب الفرق بين تمثيلين للميزة. و هي دوال تمثيل موضوعية في TM و SM، والتي تحولت مخرجات figure-protocol-36 الميزات و figure-protocol-37 للطبقتين i وj إلى مصفوفات انتباه.figure-protocol-38 figure-protocol-39 يجمع فقدان التصنيف بين فقدان الإنتروبيا المتقاطع بين مخرجات SM والتسمية الحقيقية، بالإضافة إلى MSE بين مخرجات النموذجين، كخسارة ناعمة27,28. في النهاية، يتم الحصول على الخسارة الكلية من خلال وزن الاثنين، مما يساعد المديرة على تلقي التوجيه بشكل أفضل من المدير. لتقليل فقدان الأداء أثناء عملية استقطال المعرفة، تضع هذه الدراسة نموذج مساعد التدريس بين نموذجين، كما هو موضح في الشكل 8.

figure-protocol-40
الشكل 8: تدفق معالجة استقطال المعرفة من مرحلتين مع نموذج مساعد التدريس كطبقة مؤقتة وسيطة. يوضح الشكل تدفق معالجة تقطير المعرفة ذو المرحلتين مع نموذج مساعد التدريس كطبقة المخزن الوسيطة. تدمج المرحلة الأولى فقدان الميزات وفقدان التصنيف لبناء خسارة التقطير الكلي، وتدرب نموذج مساعد التدريس على معرفة نموذج المعلم؛ تعتمد المرحلة الثانية نفس استراتيجية دمج الخسارة لتلخيص معرفة نموذج مساعد التدريس إلى نموذج الطالب، مما يقلل من فقدان المعلومات الناتج عن الفجوات المفرطة في التعقيد بين نموذج المعلم والطالب. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

بعد إكمال مرحلة التقطير الميتا، يخضع نموذج TA وTM لتقطير المعرفة التقليدي. خلال هذه العملية، يتم استخراج ميزات كلاهما بشكل متزامن ويتم حساب الخسارة المقابلة La . لاحقا، يتم دمج فقدان الميزة هذا مع خسارة التصنيف LM1 للنموذج لتشكيل دالة figure-protocol-41 فقدان التقطير في المرحلة الأولى، كما هو موضح في المعادلة (12).

figure-protocol-42(12)

في المعادلة (12)، β هو معامل الوزن المستخدم للتحكم في نسبة فقدان الخصائص وخسارة التصنيف في إجمالي الخسارة. figure-protocol-43 و figure-protocol-44 هي دوال تمثيل موضوعية في نموذج مساعد التدريس ونموذج TM، التي تحول مخرجات figure-protocol-45 الميزات وطبقات figure-protocol-46 i وj إلى مصفوفات انتباه. zT و zM هما مخرجات نموذج TM ونموذج المساعد. عملية التقطير من نموذج مساعد التدريس إلى المديرة هي نفسها العملية السابقة، التي تقلل من فقدان النموذج الطبي عبر عدة تكرارات لإكمال نقل المعرفة.

في الختام، تكمن المساهمة الأساسية ل TSMDM المقترحة في تحسين عملية نقل المعرفة عبر آلية التعلم الفوقي. مقارنة بالتقطير التقليدي، تكمن الميزة الأساسية لهذه الطريقة في قدرتها التعليمية الديناميكية: حيث يمكن للجهاز تعديل معاييره الخاصة من خلال آلية التجربة التعليمية بناء على تغذية الراجعة الفورية من المعالج، مما يوفر إرشادا أكثر استهدافا. وفي الوقت نفسه، يتم تقديم نموذج مساعد التدريس كطبقة تخزين مؤقت، مما يجسر فجوة التعقيد بين المعالجين والمساعدين المتخصصين ويقلل من فقدان المعلومات في نقل المعرفة. يتيح التصميم التعاوني لهذه "استراتيجية التدريس لتحسين التعلم الفوقي" و"التخزين المؤقت ذو المستويين لتقليل صعوبة النقل" للجهاز النهائي من تحقيق خفة كبيرة مع الحفاظ على المعرفة الأساسية المستخرجة من التحويل المعقد إلى أقصى حد.

توفر البيانات
مجموعات البيانات التي تم إنشاؤها أثناء الدراسة الحالية و/أو التي تم تحليلها خلال الدراسة الحالية مقدمة في الملف التكميلي 1.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

إعداد التجارب ومجموعة البيانات:
لتقييم أداء النموذج المقترح وكفاءته الخفيفة في مهام التصنيف عبر المجالات للعينات الصغيرة، تجرى تجارب على أربع مجموعات بيانات: FewRel (التصنيف العلائقي للعينات الصغيرة)، ARSC (تحليل المشاعر عبر المجالات)، رويترز-21578 (تصنيف الأخبار متعددة المواضيع)، وArXiv (ملخصات أكاديمية طويلة). يحتوي FewRel، وهو مجموعة بيانات تصنيف علائقية صغيرة الاستخدام على نطاق واسع من ويكيبيديا، على 100 فئة علاقات دلالية (مثل "مؤسسو الأعمال/الشركات" و"الموقع/رأس ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لتعزيز قدرة التعميم في ETC في سيناريوهات قليلة اللقاطات وعبر المجالات مع تقليل التكاليف الحاسوبية، تقترح هذه الدراسة إطار تصنيف نصوص خفيف الوزن يدمج CST مع TSMDM. يعالج دمج CST مع إطار TSMDM القيود الأساسية لطرق ETC الحالية (تعميم ضعيف للخطابات القليلة/عبر المجالات، وتكاليف حسابية عالية) من خلال دمج ديناميكيات النظام اللغوي والخصائص الدلالية الناشئة في تصميم النموذج وتمكين نقل المعرفة بكفاءة للضغط الخفيف. هذا التآزر في التصميم هو المفتاح لأداء النموذج المتفوق على الطرق التقليدية في البيئ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المؤلفون ليس لديهم ما يكشفون عنه.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المؤلفون ليس لديهم ما يعترفون به.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
وحدة المعالجة المركزية (CPU)بائعي الأجهزة التجارية (Intel، Dell، Lenovo)Intel i5-7300HQمواصفات الأجهزة
وحدة معالجة الرسومات (GPU)بائعي الأجهزة التجارية (NVIDIA، ASUS)NVIDIA GeForce RTX 3060، 12 GB VRAMمواصفات الأجهزة
ذاكرة الوصول العشوائي (RAM)بائعي الأجهزة التجارية16 GB DDR4مواصفات الأجهزة
محرك أقراص الحالة الصلبة (SSD)بائعي الأجهزة التجارية1 TB NVMe SSDمواصفات الأجهزة
نظام التشغيلموقع مايكروسوفت الرسميWindows 10 (64 بت)برامج النظام
Pythonموقع Python الرسمي (python.org)Python 3.8لغة البرمجة
PyTorchموقع PyTorch الرسمي (pytorch.org)PyTorch 1.11.0إطارات التعلم العميق والمكتبات الأساسية
CUDAموقع NVIDIA الرسميCUDA 11.3إطارات التعلم العميق والمكتبات الأساسية
Hugging Face TransformersHugging Face Hub (huggingface.co)الإصدار المستقر (مكيف مع Python 3.8/PyTorch 1.11.0)إطارات التعلم العميق والمكتبات الأساسية
NumPyPyPI (pypi.org)الإصدار المستقر (مكيف مع Python 3.8)مكتبات معالجة البيانات والإحصاء
PandasPyPI (pypi.org)الإصدار المستقر (مكيف مع Python 3.8)مكتبات معالجة البيانات والإحصاء
Scikit-learnPyPI (pypi.org)الإصدار المستقر (مكيف مع Python 3.8)مكتبات معالجة البيانات والإحصاء
SciPyPyPI (pypi.org)الإصدار المستقر (مكيف مع Python 3.8)مكتبات معالجة البيانات والإحصاء
MatplotlibPyPI (pypi.org)الإصدار المستقر (مكيف مع Python 3.8)مكتبة التصور
AdamWمدمج في PyTorchمدموج في PyTorch 1.11.0المحسّن
BERTHugging Face Hub (huggingface.co)BERT-base (bert-base-cased)النماذج المدربة مسبقًا
FewRelمستودع FewRel الرسمي (GitHub) / ويكيبيديا100 فئة علاقة دلالية، 700 جملة لكل فئة؛ تقسيم التدريب/المصادقة/الاختبار (5:2:3)المجموعات
ARSCمجموعات تحليل المشاعر عبر المجالات العامة (GitHub/ACL Anthology)23 فئة منتجات أمازون، 69 مهمة تحليل مشاعر ثنائية؛ تقسيم التدريب/المصادقة/الاختبار (4:2:3)المجموعات
Reuters-21578مستودع اليونيسف لتعليم الآلة / الأرشيف الرسمي لرويترز21,578 مقال أخبار، 90 فئة موضوعية؛ طريقة تقسيم ModApteالمجموعات
ArXivواجهة API العامة لـ ArXiv (arxiv.org)ملخصات أوراق علوم الكمبيوتر؛ تقسيم التدريب/المصادقة/الاختبار (7:2:1)المجموعات
TokenizerHugging Face Hub (huggingface.co)BERT-base-cased Tokenizerأدوات أساسية أخرى
Gitموقع Git الرسمي (git-scm.com)أحدث إصدار مستقرأدوات أساسية أخرى

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

مقالات ذات صلة