يناير 9, 2026
نقترح نهجا يعتمد على التعلم المعزز لتعديل النماذج اللغوية الكبيرة يستخدم مؤشر هلوسات إنتي (EHI) كإشارة مكافأة لتقليل الهلوسة على مستوى الكيان في تلخيص النصوص. تظهر التجارب على نصوص الاجتماعات أن هذه الطريقة تحسن من أمانة ودقة الكيانات.
تستخدم هذه الدراسة مؤشر هلوسات الكيانات كإشارة مكافأة لتقليل توليد الكيانات الخاطئة في النصوص الملخصة بالذكاء الاصطناعي. المعايير الحالية هي مقاييس خشنة، يستخدم هذا البروتوكول مكافآت الكيانات الدقيقة لتحسين الحقائق دون تسميات بشرية. للبدء، استخدم مجموعتين رئيسيتين، بما في ذلك مجموعة بيانات نسخ الحوار لنصوص الاجتماعات متعددة الأدوار ومعيار تلخيص أخبار XSum.
نظف كل مجموعة بيانات، وقم بتسطيح البيانات، وقسمها إلى مجموعات تدريب بنسبة 80٪، و10٪ تحقق، و10٪ اختبار. إجراء الترميز واستخراج الكيانات باستخدام نموذج NER القائم على المحولات D slim/NER القائم على BERT لضمان التأريض القوي. توليد ملخصات أولية في وضع الطلقة الصفرية باستخدام البحث الشعاعي بعرض أربعة لتقدير انتشار الهلوسة بشكل أساسي.
احسب مؤشر هلوسة الكيان كمقياس على مستوى الكيان خال من المرجع يصنف الكيانات إلى خمسة عوامل لقياس الوفاء. كافئ الاستخلاص والهلوسات الإيجابية وعاقب الهلوسات السلبية، والكائنات المفرطة التركيز، وفقدان التركيز. حدد دالة المكافأة لتكون متناسبة مع ولاء الكيانات وتعظيم المكافأة المتوقعة ل EHI عبر الملخصات المولدة.
تطبيق آلية تحديث النمط المعززة لتحسين معلمات النموذج نحو تعظيم ولاء الكيانات. استخدم تكييف الرتبة المنخفضة لتمكين ضبط دقيق فعال للمعاملات وتحديث محولات LoRA فقط مع الحفاظ على أوزان النموذج الأساسي مجمدة. ثم قم بتطبيق تحديثات تدرج السياسات لتشجيع نتائج مكافآت أعلى وإعادة توليد ملخصات لكل 500 تحديث لتحديث تقديرات المكافآت.
وأخيرا، قم بإنشاء ملخصات نهائية باستخدام النماذج المضبوطة بدقة ومقارنتها بنتائج الأساس. تقييم النماذج من حيث المعلومات باستخدام روج واحد، روج اثنان، وروج L، والطلاقة والاتساق الواقعي باستخدام قواعد التحليل المعلوماتي وCAGs. قلل ضبط EHI الدقيق من الهلوسات وحسن الحقائق عبر النماذج ومجموعات البيانات مع تحولات يمينية في EHI، كما أكدت توزيعات CC الحقائق زيادة في أمانة الكيانات والاتساق الواقعي، بينما بقيت درجات CAGS إلى حد كبير دون تغيير.
تم تقليل أنواع الهلوسة الضارة مثل السلبية، والتركيز الزائد، وفقدان التركيز في ميسترال بعد الضبط الدقيق، بينما تضاعف عامل الاستخلاص تقريبا. أظهر تحليل الارتباط أن EHI وCAGS لهما ارتباط ضعيف في Mistral وDistilBART، لكن Flan-T5 أظهر ارتباطا إيجابيا أقوى. يمكن للباحثين قياس ولاء الكيان ومعدلات الهلوسة في ملخصات باستخدام إشارة المكافأة الآلية EHI.
التحدي الأهم هو دقة NER، حيث يمكن أن تنتقل أخطاء الاستخراج إلى حسابات غير صحيحة للمكافأة أثناء التدريب. يمكن للدراسات المستقبلية دمج الحل المرجعي المشترك ومكافآت المعلومات لتحقيق توازن أفضل بين الأمانة والتغطية الملخصة.
اعرض النص الكامل واحصل على الوصول إلى آلاف الفيديوهات العلمية
تعرض هذه المقالة إطار عمل جديداً للضبط الدقيق القائم على المكافأة لنماذج اللغات الكبيرة (LLMs)، يهدف إلى تقليل الهلوسات على مستوى الكيانات في التلخيص التجريدي. ومن خلال الاستفادة من مؤشر هلوسة الكيانات (EHI) كمعيار توجيهي، يعمل هذا النهج على تعزيز الدقة الواقعية للملخصات المُنشأة دون التضحية بقدرتها الإخبارية أو قابليتها للتعميم.
تشكل الهلوسة على مستوى الكيانات في تلخيص النماذج اللغوية الكبيرة (LLM) مخاطرة كبيرة بسلامة البيانات واتخاذ القرار في مجال الأبحاث الصيدلانية الحيوية.&د. يتناول إطار الضبط الدقيق الموجه بمؤشر هلوسة الكيانات (EHI) هذا التحدي بشكل مباشر، مما يتيح استخراجاً أكثر موثوقية للرؤى الواقعية من المصادر النصية العلمية والتشغيلية. كما أن تعزيز الواقعية في التلخيص الآلي يدعم مستويات أعلى من الثقة التنبؤية ويقلل من المخاطر اللاحقة في مسارات العمل الموجهة بالمعرفة.
يدمج إطار الضبط الدقيق الموجه بـ EHI في طبقة المعلوماتية الخاصة بمسارات الاكتشاف والفحص والبحوث الانتقالية، مما يدعم استخراج الكيانات وتلخيصها بشكل قوي.