مقالة بحثية

التحقق التكيفي من الادعاءات الموجه بالاستدلال اللغوي الطبيعي مع نمذجة القرار الإحصائي للحد من الهلوسة ذات الكمون المنخفض في النماذج اللغوية الكبيرة

0 مشاهدات

DOI:

10.3791/72636

سبتمبر 3, 2026

في هذه المقالة

ملخص

تقدم هذه الدراسة إطار عمل خفيف الوزن للحد من الهلوسات في النماذج اللغوية الكبيرة من خلال التحقق على مستوى الادعاء وعتبة إحصائية تكيفية. ومن خلال التصحيح الانتقائي للادعاءات غير المدعومة باستخدام استدلال اللغة الطبيعية، يعمل هذا النهج على تحسين الدقة الواقعية مع الحفاظ على زمن استجابة منخفض وكفاءة عملية في النشر.

الملخص

تُظهر النماذج اللغوية الكبيرة (LLMs) ميلاً حرجاً لتوليد مخرجات غير صحيحة واقعياً ولكنها بليغة لغوياً - وهي ظاهرة تُعرف باسم الهلوسة (hallucination) - مما يشكل مخاطر جسيمة في التطبيقات التي تتطلب دقة عالية. إن استراتيجيات التخفيف الحالية، بما في ذلك التوليد المعزز بالاسترجاع (retrieval-augmented generation) وأخذ عينات الاتساق الذاتي (self-consistency sampling)، تؤدي إما إلى زيادة كبيرة في زمن استجابة الاستدلال أو تعتمد على بنية تحتية خارجية للمعرفة، مما يحد من قابليتها للتطبيق في عمليات النشر في الوقت الفعلي. تقترح هذه الورقة إطار عمل خفيف الوزن للتحقق من الادعاءات يتكون من خطوتين، حيث يقوم بتفكيك استجابات النماذج اللغوية الكبيرة إلى ادعاءات واقعية ذرية، ثم يتحقق بشكل مستقل من كل ادعاء مستخرج مقابل مرجع يتم توليده بشكل منفصل من خلال مطالبة استدعاء واقعية معزولة. وبالرغم من أن المولد والمحقق يتشاركان في نفس النموذج اللغوي الأساسي، إلا أن فصل توليد الاستجابة عن الاستدعاء الواقعي يقلل من التكييف المباشر للاستجابة ويخفف من انحياز التأكيد أثناء عملية التحقق، وذلك باستخدام الاستدلال اللغوي الطبيعي (Natural Language Inference)، مع تطبيق عتبة إحصائية تكيفية - مُعرفة بأنها τ = µ + kσ عبر توزيع درجات الثقة في الاستدلال اللغوي الطبيعي (NLI) - لتصحيح الادعاءات المتناقضة فقط بشكل انتقائي. وعلى عكس الطرق السابقة القائمة على الاستدلال اللغوي الطبيعي والتي تعتمد على حدود قرار ثابتة، فإن إطار العمل المقترح يكيف عتبة التحقق ديناميكياً وفقاً لتوزيع الثقة لكل استجابة، مما يظهر أداءً ثابتاً عبر المعايير المرجعية التي تم تقييمها دون الحاجة إلى إعادة تدريب النموذج. وبتقييمه على TruthfulQA و FEVER، خفّض إطار العمل معدل الهلوسة من 28% إلى 9% في TruthfulQA - وهو انخفاض نسبي قدره 67.9% - مع إضافة 160 ms فقط من زمن الاستجابة الإضافي مقارنة بالنموذج اللغوي الكبير الأساسي، متفوقاً بذلك على SelfCheckGPT و FActScore في دقة اكتشاف الهلوسة. وتشير هذه النتائج إلى أن إطار العمل يمكن أن يوفر توازناً ملائماً بين الموثوقية الواقعية وزمن استجابة الرد في المعايير المرجعية التي تم تقييمها، بينما لا تزال هناك حاجة إلى مزيد من التحقق عبر مجالات وإعدادات نشر مختلفة.

المقدمة

برزت النماذج اللغوية الكبيرة (LLMs) كمكونات أساسية في أنظمة الذكاء الاصطناعي الحديثة، حيث أظهرت قدرات ملحوظة عبر مجموعة واسعة من مهام اللغة الطبيعية، بما في ذلك توليد النصوص، والإجابة على الأسئلة، والتلخيص، والاستدلال المعقد1. وقد أدت قدرتها على إنتاج استجابات طليقة ومتماسكة سياقياً إلى تسريع اعتمادها في المجالات ذات التأثير العالي مثل دعم القرار السريري، والتحليل القانوني، وهندسة البرمجيات، والتكنولوجيا التعليمية2. ومع ذلك، ثمة قصور حاسم ومستمر يقوض موثوقيتها في هذه البيئات، وهو "الهلوسة" (hallucination)، حيث تولد النماذج استجابات طليقة لغوياً ولكنها غير صحيحة واقعياً، أو غير مدعومة بأدلة، أو مفبركة بالكامل 3. وتشير الدراسات التجريبية إلى أن معدلات الهلوسة تتراوح بين 15% وأكثر من 40% اعتماداً على المهمة والنموذج، مع ظهور تناقضات واقعية ملموسة حتى في الأنظمة الأكثر تطوراً مثل GPT-4 عند تقييمها في مجالات تخصصية2,3. ويفرض هذا القصور مخاطر جسيمة في التطبيقات التي تتطلب دقة فائقة، حيث يمكن أن تؤدي المخرجات الخاطئة إلى تضليل المعلومات، أو التشخيص الخاطئ، أو اتخاذ قرارات معيبة4. تنشأ الهلوسات بشكل أساسي من الطبيعة الاحتمالية لنمذجة اللغة؛ إذ تولد النماذج اللغوية الكبيرة الرموز (tokens) عن طريق التنبؤ بالتكملات المرجحة إحصائياً لتسلسلات المدخلات بدلاً من استرجاع المعرفة الواقعية الموثقة أو الاستدلال من خلالها5. ونتيجة لذلك، قد تتضمن المخرجات المولدة ادعاءات تبدو مقنعة ولكنها غير دقيقة، أو تدرج تأكيدات غير مدعومة، أو تخلط بين مفاهيم مرتبطة دلالياً ولكنها متميزة واقعياً6.

تعالج استراتيجيات التخفيف الحالية هذه المشكلة من خلال عدة نماذج، ولكل منها قيود ملحوظة. حيث يعمل التوليد المعزز بالاسترداد (RAG) على تقليل الهلوسة من خلال ربط الاستجابات بمستندات مستردة خارجيًا، ولكنه يتسبب في زيادة كبيرة في زمن الاستجابة، ويتطلب الوصول إلى قواعد معرفية يتم تحديثها باستمرار، ويظل عرضة لفشل الاسترداد في المجالات المتخصصة أو ذات الموارد المحدودة7,8,9.

على الرغم من أن مولد الاستجابة ومولد المراجع يتم إنشاؤهما باستخدام نموذج GPT-3.5 Turbo الأساسي نفسه، إلا أنهما يعملان وفق أهداف تحفيزية وسياقات تنفيذ مختلفة. حيث يقوم مولد الاستجابة بإنتاج إجابة غير مقيدة على استعلام المستخدم، بينما يقوم مولد المراجع بمهمة استرجاع حقائق معزولة دون الوصول إلى الاستجابة التي تم إنشاؤها مسبقاً. ويقلل هذا الفصل من تأثيرات تكييف الاستجابة المباشرة ويحد من انحياز التأكيد أثناء التحقق من الادعاءات. وبناءً على ذلك، يتعامل الإطار مع المرجع الذي تم إنشاؤه على أنه مستقل إجرائياً وليس مستقلاً إحصائياً.

استكشفت الأبحاث الحديثة أيضًا استراتيجيات فك تشفير خفيفة الوزن لتقليل الهلوسة في توليد النصوص دون الاعتماد على الاسترجاع الخارجي أو التحقق المتكرر. ومن النهج الممثلة في هذا الصدد "فك التشفير عن طريق تباين الطبقات" (DoLA)، والذي يحسن الواقعية من خلال مباينة التمثيلات من طبقات المحول (transformer) المتوسطة والنهائية أثناء عملية فك التشفير. وبخلاف أطر التحقق ما بعد التوليد، تتدخل هذه الأساليب مباشرة أثناء توليد الرموز (tokens)، وبالتالي فإنها تحسن مرحلة مختلفة من عملية توليد اللغة. وتظهر هذه الاستراتيجيات التكاملية أن التخفيف من الهلوسة يمكن تحقيقه إما أثناء فك التشفير أو من خلال التحقق ما بعد التوليد، حيث يقدم كل نهج مقايضات متميزة من حيث العبء الحسابي، وتعقيد التنفيذ، والموثوقية الواقعية.

تعمل طرق الاتساق الذاتي على تحسين الموثوقية الواقعية من خلال أخذ عينات من استجابات متعددة واختيار المخرج الأكثر تكراراً أو تماسكاً، ومع ذلك، فإن تكلفتها الحسابية تزداد خطياً مع عدد العينات، مما يجعلها غير مناسبة لعمليات النشر الحساسة لوقت الاستجابة8. أما نهج التحسين التكراري، الذي يقوم بمراجعة المخرجات بشكل متكرر من خلال حلقات التغذية الراجعة الذاتية، فيقلل معدلات الخطأ تدريجياً ولكنه يطيل وقت الاستنتاج بشكل كبير مع كل تمريرة إضافية9. وتقدم طرق التحقق القائمة على الاستلزام الطبيعي للغة (NLI) بديلاً أكثر استهدافاً من خلال تقييم الاستلزام الدلالي بين الادعاءات المولدة والنصوص المرجعية، إلا أن التنفيذات الحالية تعتمد على عتبات قرار ثابتة تفشل في التكيف عبر توزيعات الثقة المختلفة، أو المجالات، أو سلوكيات النماذج10,11. وبشكل جماعي، فإن هذه النهج إما تفرض عبئاً حسابياً غير مقبول، أو تعتمد على بنية تحتية خارجية، أو تفتقر إلى القدرة على التكيف المطلوبة للنشر العام. تتوفر مقارنة للخصائص الرئيسية لنهج التحقق من الهلوسة هذه في الجدول التكميلي 1.

تقترح هذه الورقة إطار عمل خفيف الوزن للتحقق من الادعاءات يتكون من خطوتين، صُمم لتقليل الهلوسة في مخرجات النماذج اللغوية الكبيرة (LLM) مع الحفاظ على زمن استجابة منخفض. في الخطوة الأولى، يقوم النموذج اللغوي الكبير بتوليد استجابة أولية، يتم بعد ذلك تفكيكها إلى ادعاءات واقعية ذرية. وفي الخطوة الثانية، يتم التحقق من كل ادعاء باستخدام الاستدلال اللغوي الطبيعي (NLI) مقابل مرجع واقعي تم توليده بشكل منفصل من خلال عملية استدلال معزولة لا تصل إلى الاستجابة المولدة الأصلية، ويتحكم عتبة ثقة مستمدة إحصائياً في قرار القبول أو التصحيح على مستوى الادعاء. وتتمثل المساهمات الرئيسية لهذا العمل فيما يلي: (1) خط معالجة للتحقق على مستوى الادعاء يتكون من خطوتين يفصل بين توليد الاستجابة والتحقق الواقعي، مما يتيح تقييماً مستقلاً ومستهدفاً لكل ادعاء ذري دون الحاجة إلى استرجاع خارجي أو إعادة توليد الاستجابة بالكامل؛ (2) آلية تكيفية لوضع العتبات الإحصائية تعتمد على توزيع درجات الثقة في الاستدلال اللغوي الطبيعي (τ = µ + kσ)، والتي تحدد ديناميكياً حدود القبول والتصحيح بدلاً من الاعتماد على قواعد قرار ثابتة، مما يحسن المتانة عبر توزيعات الثقة المتغيرة؛ (3) استراتيجية تصحيح انتقائية تقصر إعادة التوليد على الادعاءات المصنفة على أنها متناقضة فقط، مما يقلل بشكل كبير من الأعباء الحسابية مقارنةً بنهج إعادة أخذ العينات للاستجابة الكاملة أو طرق التحسين التكرارية؛ (4) تقييم تجريبي على معيار قياسي يركز على الهلوسة يوضح أن إطار العمل المقترح يقلل معدلات الهلوسة من 28% إلى 9% مع الحفاظ على زمن استجابة ضمن حدود النشر العملي.

البروتوكول

لم تتضمن هذه الدراسة مشاركين بشريين، أو حيوانات، أو عينات بيولوجية، أو بيانات مرضى. وبناءً على ذلك، لم تكن هناك حاجة لموافقة أخلاقية مؤسسية أو موافقة مستنيرة.

نظرة عامة على تصميم الدراسة

تم تنفيذ إطار عمل للتحقق من صحة البيانات يتكون من مرحلتين لتحسين الموثوقية الواقعية لمخرجات النماذج اللغوية الكبيرة (LLM). تضمنت الإجراءات توليد الاستجابة، واستخراج الادعاءات، وبناء المراجع المنعزلة (Isolated Reference Construction)، والتحقق القائم على الاستدلال باللغة الطبيعية (NLI)، واتخاذ القرار الإحصائي التكيفي، والتصحيح الانتقائي، وتجميع الاستجابة النهائية. وقد تم تقييم إطار العمل باستخدام مجموعات بيانات TruthfulQA وFEVER المرجعية.

سير العمل العام

استعلام المستخدم → توليد الاستجابة الأولية → استخراج الادعاءات → توليد المراجع المستقلة → التحقق من الاستدلال اللغوي الطبيعي → حساب العتبة الإحصائية → تصحيح الادعاء → الاستجابة النهائية الموثقة. يوضح الشكل [X] سير العمل العام لإطار التحقق التكيفي من الادعاءات في الشكل 1.

تجهيز مجموعة البيانات

تم تنزيل مجموعة بيانات TruthfulQA12، التي تحتوي على 817 سؤالاً موجهاً نحو الحقائق، وتجهيزها للتقييم. تتكون مجموعة بيانات FEVER13 من 185,445 ادعاءً مشروحاً ومصنفاً كـ "مدعوم" (Supported)، أو "مفند" (Refuted)، أو "معلومات غير كافية" (Not Enough Information)؛ وقد استُخدم في التقييم بيانات التطوير المصنفة التي تتضمن حقول الادعاء، والأدلة، وتصنيف الحقيقة الأرضية. تم تقييم كل ادعاء مقابل الأدلة المقدمة له، مع الاحتفاظ بتصنيف FEVER الأصلي كمرجع للتحقق. تم الحصول على مجموعة بيانات FEVER، التي تحتوي على أزواج من الادعاءات والأدلة للتحقق من الحقائق، ومعالجتها أولياً. كما حُوّلت الأسئلة والادعاءات المدخلة إلى تنسيق نصي موحد، وتمت إزالة الإدخالات المكررة والعينات غير المكتملة قبل البدء بالتجارب. قُسمت مجموعة TruthfulQA إلى مجموعات فرعية للتحقق والاختبار؛ حيث استُخدم ما يقرب من 20% من عينات TruthfulQA (164 سؤالاً) لضبط العتبة، بينما خُصصت الـ 653 سؤالاً المتبقية لتقييم الأداء. وبالنسبة لـ FEVER، استُخدمت الادعاءات الواردة في المرجع القياسي مباشرة كوحدات تحقق، ولم تخضع لإجراءات توليد الاستجابة واستخراج الادعاءات المطبقة على TruthfulQA. وتلخص Table 1 خصائص مجموعات البيانات المرجعية المستخدمة في تطوير الإطار والتقييم.

توليد الاستجابة الأولية

تم إرسال كل استعلام إلى نموذج اللغة الأساسي. وأُنتجت الاستجابات باستخدام أخذ العينات النووي (nucleus sampling) بدرجة حرارة 0.7 وقيمة top-p تبلغ 0.9. كما تم تحديد الحد الأقصى لطول المخرجات بـ 256 رمزاً (tokens). وخُزنت الاستجابات الناتجة دون أي معالجة لاحقة أو تعديل يدوي، ثم حُوِّل النص الناتج مباشرة إلى مرحلة استخراج الادعاءات.

استخراج الادعاءات

تم تفكيك كل استجابة تم إنشاؤها إلى بيانات حقيقية يمكن التحقق منها بشكل مستقل. واستُخدم موجه تفكيك مهيكل لتحديد الادعاءات الذرية. كما فُصلت البيانات المركبة إلى وحدات حقيقية صغرى. وتمت إزالة الآراء الشخصية، والتعبيرات الأسلوبية، والحشوات الحوارية. وخُزّن كل ادعاء مستخلص كوحدة تحقق مستقلة.

مثال:

الاستجابة الأصلية:

"كانت ماري كوري عالمة فيزياء وكيمياء ولدت في بولندا، وأجرت أبحاثاً رائدة في مجال النشاط الإشعاعي."

الادعاءات المستخلصة: (1) ولدت ماري كوري في بولندا؛ (2) كانت ماري كوري عالمة في الفيزياء والكيمياء؛ (3) أجرت ماري كوري أبحاثاً حول النشاط الإشعاعي.

بناء المرجع المعزول:

تم إنشاء مرجع حقيقي مستقل لكل ادعاء مستخلص. وتلقى نموذج التحقق استعلام المستخدم الأصلي فقط، حيث تم تقييد الوصول إلى الاستجابة الأصلية التي تم إنشاؤها لتجنب انحياز التأكيد. كما استُخدم محفز استرجاع الحقائق لتشجيع الاستجابات الموجزة والقائمة على الأدلة. وتم تخزين المراجع التي تم إنشاؤها لغرض التحقق اللاحق.

التحقق من الاستدلال باللغة الطبيعية

تم تقديم كل زوج من (الادعاء-المرجع) إلى نموذج استدلال لغوي طبيعي (NLI) مُدرب مسبقاً. قام نموذج NLI بتصنيف العلاقة إلى: استتباع (Entailment)، أو حياد (Neutral)، أو تناقض (Contradiction). تم تسجيل احتمالات الثقة لجميع الفئات الثلاث. كما تم تعيين درجة تحقق موقعة: قيمة موجبة للاستتباع، وصفر للحياد، أو قيمة سالبة للتناقض. جُمعت كافة درجات التحقق من أجل حساب العتبة.

حساب العتبة الإحصائية التكيفية

تتفاوت درجة الثقة في التحقق التي ينتجها نموذج NLI بشكل كبير عبر الاستجابات المختلفة، وذلك لأن الاستعلامات المتنوعة تولد أعداداً مختلفة من الادعاءات، ومستويات متفاوتة من التعقيد الدلالي، وتوزيعات مختلفة لدرجات الثقة. ويفترض استخدام عتبة عالمية ثابتة أن جميع الاستجابات تتبع ملف ثقة مماثلاً، وهو أمر نادراً ما يتم ملاحظته في الممارسة العملية. ولمعالجة هذا التباين، يقوم الإطار المقترح بتقدير حد القرار بشكل فردي لكل استجابة باستخدام المتوسط والانحراف المعياري لدرجات التحقق الخاصة بها. ويعكس المتوسط مستوى الثقة العام للاستجابة، بينما يجسد الانحراف المعياري تشتت قيم الثقة بين الادعاءات المستخرجة. وتسمح هذه الصيغة التكيفية لمعيار القبول بالتوافق مع حالة عدم اليقين الخاصة بكل استجابة بدلاً من الاعتماد على عتبة واحدة لجميع المدخلات.

تم حساب المتوسط (µ) والانحراف المعياري (σ) لجميع درجات التحقق الموقعة.

تم حساب عتبة القرار التكيفية على النحو التالي:

figure-protocol-1

حيث تمثل τ العتبة التكيفية، ويدل µ على متوسط درجة التحقق، ويدل σ على الانحراف المعياري، بينما يمثل k معامل الحساسية.

تم تعيين القيمة الأولية لمعامل الحساسية عند 0.7. وقد قُبلت الادعاءات المصنفة كاستلزام (Entailment) والتي كانت درجاتها أكبر من أو تساوي +τ. أما الادعاءات المصنفة كتناقض (Contradiction) والتي كانت درجاتها أقل من أو تساوي −τ فقد تم تحديدها للتصحيح. بينما احتُفظ بالادعاءات التي وقعت درجاتها ضمن الفترة (−τ, +τ) كادعاءات محايدة.

تصحيح انتقائي للمطالبات

تم إرسال الادعاء للتصحيح فقط عندما صنف نموذج NLI الزوج المكون من (الادعاء-المرجع) على أنه تناقض (Contradiction)، واستوفى سجل التحقق الموقّع المقابل له معيار العتبة التكيفية si ≤ -τ. وبذلك، تم تحديد قرار التصحيح بشكل مشترك من خلال تسمية فئة NLI والعتبة الإحصائية الخاصة بالاستجابة. أما الادعاءات التي صُنفت على أنها استلزام (Entailment) مع si ≥ τ فقد تم قبولها، بينما عوملت الادعاءات التي وقعت ضمن الفاصل -τ < si < τ على أنها محايدة واحتُفظ بها دون تصحيح. وقد ضمن هذا المعيار المشترك تطبيق التصحيح فقط على الادعاءات التي أظهرت تناقضاً دلالياً وأدلة تحقق سلبية قوية بما يكفي.

إعادة بناء الاستجابة

تم ترتيب الادعاءات المقبولة والمصححة وفق تسلسلها الأصلي. كما تم استعادة حدود الجمل للحفاظ على سهولة القراءة. وطُبقت تعديلات نحوية طفيفة عند الضرورة. ثم خُزنت المخرجات المجمعة كاستجابة نهائية مُحققة.

تقييم الأداء

تم تقييم إطار العمل باستخدام أربعة مقاييس: (1) الدقة: نسبة الاستجابات التي ظلت صحيحة واقعياً بعد التحقق؛ (2) مقياس F1: المتوسط التوافقي لدقة واسترجاع الكشف عن الهلوسة؛ (3) زمن استجابة النظام: إجمالي وقت المعالجة من تقديم الاستعلام حتى توليد الاستجابة المتحقق منها؛ (4) معدل الهلوسة

figure-protocol-2

تم تسجيل زمن الاستجابة كمتوسط وقت التنفيذ عبر قياسات متكررة. ونظراً لعدم الاحتفاظ بقيم زمن الاستجابة الفردية لكل دورة تشغيل، لم يتم حساب الانحرافات المعيارية وفترات الثقة.

تقييم الصحة الخاص بالمعيار المرجعي

بالنسبة لـ TruthfulQA، تمت مقارنة الاستجابة النهائية الموثقة مع مراجع الإجابات المعتمدة بشرياً في المعيار المرجعي وقوائم الإجابات الخاطئة. وتُعتبر الاستجابة صحيحة عندما تكون ادعاءاتها الواقعية متوافقة مع معلومات الإجابة المقبولة ولا تحتوي على محتوى يتوافق مع أنماط الاستجابة الخاطئة المحددة. أما بالنسبة لـ FEVER، فقد تم تقييم كل ادعاء في المخرج النهائي مقابل الأدلة المرتبطة به وتعليقات FEVER الأصلية؛ حيث عوملت الادعاءات المدعومة (Supported) على أنها موثقة واقعياً، بينما حُسبت الادعاءات المفندة (Refuted) على أنها خاطئة. أما حالات عدم كفاية المعلومات (Not Enough Information)، فقد تم الإبقاء عليها كحالات غير محددة بدلاً من اعتبارها أدلة واقعية إيجابية. ثم جُمعت القرارات المتخذة على مستوى الادعاءات عبر كل معيار مرجعي لحساب الدقة (Accuracy) ومعدل الهلوسة (Hallucination Rate) المُبلغ عنهما.

البيئة التجريبية

تم تنفيذ إطار العمل باستخدام لغة Python 3.9. وأُجريت عمليات معالجة البيانات باستخدام مكتبات التحليل العددي والجدولي. وعمل نموذج NLI في وضع الاستدلال دون إجراء ضبط دقيق إضافي. نُفذت التجارب على محطة عمل مجهزة بمعالج Intel Core i5، وذاكرة وصول عشوائي بسعة 16 GB، ونظام تشغيل بمعمارية 64-bit. وأُجريت جميع التقييمات باستخدام إعداد استدلال أحادي المرور لضمان التشغيل بزمن انتقال منخفض. كما أُجريت جميع التجارب باستخدام تكوينات برمجية وعتادية متطابقة لضمان اتساق التقييم عبر مجموعات البيانات وطرق المرجعية.

النتيجة المتوقعة

تم تصميم هذا البروتوكول لإصدار قرارات تحقق على مستوى الادعاء من خلال تحديد الادعاءات التي قد تفتقر إلى الدعم، وتوجيه الادعاءات المتناقضة بشدة بشكل انتقائي للتصحيح. والمخرج المتوقع هو استجابة مُحققة مع تقليل التناقضات الواقعية والحد من الأعباء الإضافية لمعالجة البيانات، وذلك رهناً بالأداء الملحوظ أثناء التقييم التجريبي.

النتائج

توليد الاستجابة الأولية

قام نموذج اللغة الأساسي بتوليد إجابات طليقة وذات صلة بالسياق للأسئلة الواردة في كلتا مجموعتي بيانات القياس. ومع ذلك، كشف الفحص التفصيلي عن وجود عبارات غير مدعومة وغير دقيقة واقعياً في العديد من الاستجابات. ففي مجموعة بيانات TruthfulQA، أظهر النظام الأساسي معدل هلوسة بلغ 28%، بينما لوحظ معدل هلوسة بنسبة 26% في مجموعة بيانات FEVER. وقد أكدت هذه النتائج أن التوليد المباشر للغة وحده غير كافٍ للتطبيقات التي تتطلب موثوقية واقعية عالية، وحددت الحالة الأساسية التي قورنت بها جميع إجراءات التحقق اللاحقة.

استخراج الادعاءات

نجحت إجراءات استخراج الادعاءات في تفكيك الاستجابات المُولَّدة إلى وحدات حقائق يمكن التحقق منها بشكل مستقل. وقد احتوت الاستجابات الواردة من TruthfulQA على متوسط 3.2 ادعاءً ذرياً، بينما تكونت عينات FEVER عموماً من ادعاء واحد. وقد عزل عملية التفكيك التأكيدات الواقعية دون إدخال معلومات إضافية، مما سمح بتقييم كل عبارة على حدة. وقد دعمت هذه الملاحظة الفرضية القائلة بأن التحقق على مستوى الادعاء يوفر دقة أكبر من تقييم الاستجابات الكاملة كوحدة واحدة.

بناء المرجع المستقل

تم إنشاء مراجع مستقلة لكل ادعاء مستخرج باستخدام عملية استدلال منفصلة مشروطة فقط بالاستعلام الأصلي. وفرت المراجع المُنشأة أوصافاً واقعية موجزة كانت متمايزة بما يكفي عن الاستجابات الأصلية لتكون بمثابة مصادر تحقق مستقلة. كما عُزلت عملية إنشاء المراجع عن الاستجابة الأولية لتجنب ربط المرجع الواقعي مباشرة بمخرجات النموذج السابقة. وكان الهدف من هذا الفصل هو تقليل انحياز التأكيد المحتمل وتوفير أساس منضبط للتحقق اللاحق على مستوى الادعاء؛ ولا تقوم الدراسة بقياس مدى هذا التأثير بشكل مستقل. وقد دعمت عملية الإنشاء الناجحة للمراجع المستقلة مبدأ التصميم المقترح المتمثل في فصل استرجاع المعرفة عن إنشاء الاستجابة.

التحقق من الاستنتاج باللغة الطبيعية

صنفت مرحلة التحقق باستخدام الاستنتاج اللغوي الطبيعي (NLI) أزواج الادعاء والمرجع بفعالية إلى فئات الاستلزام، والتناقض، والحياد. وقد حصلت الادعاءات المتناقضة باستمرار على درجات تحقق سلبية، بينما حصلت الادعاءات المدعومة حقائقيًا على درجات إيجابية. وخصصت التصنيفات المحايدة للادعاءات التي لم تتوفر لها أدلة داعمة كافية. وقد أظهر هذا السلوك أن الاستنتاج الدلالي يمكنه تحديد البيانات الحقائقية غير المدعومة بشكل موثوق، ووفر الأدلة المطلوبة للتصحيح الموجه. ومقارنة باستراتيجية التحقق من الاتساق البسيطة، خفض التحقق عبر NLI معدل الهلوسة من 20% إلى 15%، مما يشير إلى تحسن في قدرة الكشف.

العتبة الإحصائية التكيفية

أدى تطبيق العتبة الإحصائية التكيفية إلى تحسين أداء التحقق بشكل أكبر من خلال ضبط حدود القرار ديناميكياً بناءً على توزيع درجات الثقة لكل استجابة. وقد أظهر تحليل حساسية العتبة أن الأداء تحسن مع زيادة معامل العتبة من 0.3 إلى 0.7. وعند قيمة حساسية تبلغ 0.7، حقق إطار العمل دقة وصلت إلى 0.87 مع خفض الهلوسات إلى 9% (الشكل 2). تتوفر نتائج تحليل الحساسية الكاملة للقيم التي تم تقييمها لـ k في الجدول التكميلي 2. ولم تؤدِ زيادة العتبة بعد هذه النقطة إلا إلى مكاسب طفيفة في الدقة مع زيادة زمن الاستجابة. وقد دعمت هذه الملاحظات الفرضية القائلة بأن العتبات التكيفية أكثر فعالية من حدود القرار الثابتة في التعامل مع توزيعات الثقة المتغيرة عبر الاستجابات.

تعكس العتبة التكيفية أيضاً تباين درجات الثقة ضمن كل استجابة. فمن شأن الاستجابات التي تحتوي على درجات تحقق متسقة للغاية أن تُنتج انحرافاً معيارياً أصغر، مما يؤدي إلى حدود قرار أكثر انتقائية. وفي المقابل، فإن الاستجابات التي تتضمن ادعاءات ذات قيم ثقة غير متجانسة تعطي انحرافاً معيارياً أكبر، مما يؤدي إلى منطقة قبول أوسع ويقلل من التصحيحات غير الضرورية للادعاءات غير المؤكدة. ورغم أن هذا السلوك التكيفي لا يمكنه القضاء على كل نتيجة إيجابية كاذبة أو سلبية كاذبة، إلا أنه يتيح لحدود القرار الاستجابة لخصائص عدم اليقين في كل استجابة بدلاً من تطبيق معيار موحد على جميع المدخلات.

التصحيح الانتقائي للمطالبات وتجميع الاستجابة

تم تقديم الادعاءات التي صُنفت على أنها متناقضة فقط للتصحيح، بينما تم الإبقاء على الادعاءات المدعومة والمحايدة دون تغيير. وقد قللت استراتيجية التصحيح الانتقائية هذه من عمليات إعادة التوليد غير الضرورية وحافظت على البنية الأصلية للاستجابة. وبعد عملية التصحيح وإعادة بناء الاستجابة، انخفض معدل الهلوسة في TruthfulQA من 28% إلى 9%، وهو ما يمثل انخفاضاً نسبياً قدره 67.9%. كما لوحظت تحسينات مماثلة في FEVER، حيث انخفضت الهلوسات من 26% إلى 10%. وتُعرض مقارنات الدقة ومعدل الهلوسة عبر التكوينات التي تم تقييمها في الشكلان 3 و 4، على التوالي.

تقييم الأداء

أظهر التقييم المقارن أن الإطار المقترح حقق أعلى أداء إجمالي من بين جميع الطرق المختبرة. ففي مجموعة بيانات TruthfulQA، حقق الإطار دقة بلغت 0.87 ودرجة F1 بلغت 0.85، متفوقاً بذلك على كل من التحقق القائم على العتبة الثابتة والنهج القائمة على الاتساق الذاتي (الجدول 2، الشكلان 3 و4). وفي مجموعة بيانات FEVER، حقق الإطار دقة بلغت 0.89 ودرجة F1 بلغت 0.87 (الجدول 3، الشكلان 3 و4). كما تم فحص المساهمة التزايدية لمكونات الإطار من خلال تحليل الاستئصال الموضح في الجدول 4. وأكدت هذه التحسينات أن الجمع بين التحقق على مستوى الادعاء واتخاذ القرار الإحصائي التكيفي قد عزز الموثوقية الواقعية عبر مجموعات بيانات متعددة. وتتم مقارنة دقة الكشف عن الهلوسة لكل من SelfCheckGPT وFActScore والإطار المقترح في الشكل 5.

تحليل فترة الكمون

حافظ مسار التحقق الكامل على انخفاض التكاليف الحسابية الإضافية. حيث ارتفع متوسط وقت الاستجابة من 820 ms للنموذج المرجعي إلى 980 ms للإطار العملي الكامل، مما يمثل زيادة طفيفة فقط في وقت المعالجة (الجدول 5). وقد شكل توليد الاستجابة الجزء الأكبر من إجمالي زمن التأخير، بينما ساهمت مراحل التحقق والتصحيح بقدر ضئيل نسبيًا من التكاليف الإضافية. ويرد تفصيل وقت المعالجة على مستوى المرحلة في الجدول التكميلي 3. ومقارنة بأنظمة التحقق القائمة على الاسترجاع، والتي تطلبت حوالي 1600 ms لكل استعلام، حقق الإطار المقترح زمن تأخير أقل بكثير مع الحفاظ على دقة واقعية مماثلة. ودعمت هذه النتائج الفرضية القائلة بأن الحد من الهلوسة يمكن تحقيقه دون التضحية بقابلية الاستخدام في الوقت الفعلي.

نظراً لأن توليد الاستجابات يعتمد على نموذج لغوي قائم على السحابة، فإن قياسات زمن الاستجابة الفردية تخضع للتقلبات الناتجة عن ظروف الشبكة وجدولة الخادم، بدلاً من الاعتماد على وقت تنفيذ محدد. لذا، استُخدمت قياسات متكررة للحصول على قيم متوسطة ممثلة، مما يقلل من تأثير تباين التنفيذ العابر مع الحفاظ على المقارنات النسبية بين الطرق التي تم تقييمها. يتم تقديم قيم زمن الاستجابة كمتوسط لأوقات التنفيذ عبر جولات تجريبية متكررة. ولم يتم الاحتفاظ بقيم زمن الاستجابة الفردية لكل جولة؛ وبالتالي، لم يكن من الممكن إجراء حسابات لاحقة للتباين، أو فترات الثقة، أو غيرها من مقاييس التباين. وبناءً على ذلك، تم عرض قيم زمن الاستجابة ومقارنة السرعة والدقة في الشكل 6 كتقديرات نقطية بدون أشرطة خطأ.

وفي الختام، أظهرت النتائج أن الجمع بين استخراج الادعاءات، وتوليد المراجع المستقلة، والتحقق باستخدام استدلال اللغة الطبيعية (Natural Language Inference)، والعتبة الإحصائية التكيفية، والتصحيح الانتقائي، قد أدى إلى تحسين الموثوقية الواقعية لمخرجات النماذج اللغوية الكبيرة. وقد خفض هذا الإطار معدل الهلوسة من 28% إلى 9% في مجموعة بيانات TruthfulQA، ومن 26% إلى 10% في مجموعة بيانات FEVER. وتشير النتائج إلى أن التحقق التكيفي على مستوى الادعاء قد حسن مقاييس الموثوقية الواقعية مع الحد من زمن استجابة إضافي في ظل الظروف التي تم تقييمها

توافر البيانات

إن مجموعات البيانات التي تم تحليلها في هذه الدراسة متاحة للعموم من خلال مصادرها الرسمية المخصصة. وتوفر المخطوطة معلومات مجموعات البيانات، وتكوينات النماذج، والتفاصيل المنهجية اللازمة لدعم تكرار التحليلات الموضحة. كما تتوفر بيانات التقييم المعالجة والنتائج التكميلية التي تم استخراجها خلال الدراسة في الملفات التكميلية.

figure-results-1
الشكل 1: سير عمل إطار التحقق التكيفي من الادعاءات. يتم تفكيك الاستجابة الأولية التي يولدها النموذج اللغوي الكبير (LLM) إلى ادعاءات واقعية، يتبع ذلك توليد مراجع مستقلة، والتحقق بناءً على الاستدلال اللغوي الطبيعي (NLI)، وتسجيل درجات الثقة، وتحديد العتبات الإحصائية. يتم الاحتفاظ بالادعاءات التي تستوفي معيار القبول، بينما تخضع الادعاءات التي تستوفي معيار التصحيح لتصحيح مستهدف قبل تجميع الاستجابة النهائية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-2
الشكل 2: تأثير معامل الحساسية (k) على دقة التحقق. الدقة في TruthfulQA و FEVER عند قيم k تبلغ 0.3 و 0.5 و 0.7 و 1.0. زادت الدقة مع زيادة k في كلتا مجموعتي البيانات، وتم اختيار k = 0.7 للتقييم الأساسي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-3
الشكل 3: مقارنة الدقة عبر طرق التحقق المختلفة. دقة النموذج اللغوي الكبير (LLM) المرجعي، والتحقق القائم على الاستدلال اللغوي الطبيعي (NLI)، وإطار التحقق التكيفي المقترح على مجموعتي بيانات TruthfulQA و FEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-4
الشكل 4: مقارنة معدل الهلوسة عبر طرق التحقق المختلفة. معدلات الهلوسة لنموذج LLM المرجعي، والتحقق القائم على NLI، والإطار المقترح على مجموعتي بيانات TruthfulQA وFEVER. خفّض الإطار المقترح المعدل من 28% إلى 9% في TruthfulQA ومن 26% إلى 10% في FEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-5
الشكل 5: دقة الكشف عن الهلوسة عبر الطرق المختلفة. دقة الكشف لـ SelfCheckGPT و FActScore والإطار المقترح على TruthfulQA و FEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-6
الشكل 6: المقايضة بين زمن الاستجابة والدقة عبر طرق التحقق المختلفة. العلاقة بين زمن استجابة النظام والدقة للطرق التي تم تقييمها على مجموعتي بيانات TruthfulQA و FEVER، مما يوضح المقايضة بين الأداء وزمن الاستجابة المرتبطة بإطار العمل المقترح والنهج المقارنة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

مجموعة البياناتالعينات المستخدمةالنطاقاتمتوسط طول الاستجابة (وحدات رمزية)معدل الهلوسة المرجعي للنماذج اللغوية الكبيرة
TruthfulQA817٣٨ (العلوم، التاريخ، القانون، إلخ.)4228%
الحُمَّى1,000ادعاءات واقعية عامة1826%

الجدول 1: خصائص مجموعة بيانات القياس. ملخص لمجموعتي بيانات TruthfulQA وFEVER المستخدمتين في تطوير الإطار وتقييمه، بما في ذلك أعداد العينات، ودقة خط الأساس، ومعدل الهلوسة عند خط الأساس، ومتوسط الادعاءات لكل عينة.

الطريقةالدقة (Accuracy)الإحكام (Precision)الاستدعاء (Recall)مقياس F1نسبة الهلوسة %
النموذج اللغوي الكبير المرجعي (استنتاج واحد)0.720.710.690.728%
التحقق القائم على NLI (عتبة ثابتة)0.820.8150.7850.815%
SelfCheckGPT0.760.7550.7250.7422%
FActScore0.850.84250.81750.8311%
الإطار المقترح (عتبة إحصائية)0.870.860.840.859%

الجدول 2: مقارنة الأداء على TruthfulQA. الدقة (Accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1، ومعدل الهلوسة للنموذج اللغوي الكبير (LLM) المرجعي، وSelfCheckGPT، وFActScore، والتحقق بنظام NLI، والإطار المقترح.

الطريقةالدقة (Accuracy)الإحكام (Precision)الاستدعاء (Recall)مقياس F1نسبة الهلوسة %
SelfCheckGPT0.78
FActScore0.87
نموذج اللغة الكبير المرجعي (Baseline LLM†)0.740.730.710.7226%
التحقق القائم على الاستدلال اللغوي الطبيعي (عتبة ثابتة)0.830.82250.79750.8114%
الإطار المقترح (عتبة إحصائية)0.890.87750.86250.8710%

الجدول 3: مقارنة الأداء على FEVER.الدقة (Accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1، ومعدل الهلوسة للنموذج اللغوي الكبير (LLM) المرجعي، وSelfCheckGPT، وFActScore، والتحقق عبر الاستدلال الطبيعي (NLI verification)، والإطار المقترح.

الإعداداتالدقةالدقةالاستدعاءF1 (مضاف)معدل الهلوسة
نموذج لغوي مرجعي0.720.710.690.728%
الخط المرجعي + الفحص الثانوي (بدون الاستدلال الطبيعي)0.780.77250.74750.76*20%
الخط المرجعي + التحقق القائم على الاستدلال اللغوي الطبيعي (عتبة ثابتة)0.820.8150.7850.815%
خط الأساس + وحدة القرار الإحصائي (كاملة)0.870.860.840.859%

الجدول 4: تحليل الاستئصال لمكونات إطار العمل. التغيرات في الدقة، ودرجة F1، ومعدل الهلوسة بعد الدمج المتسلسل للتحقق الثانوي، والتحقق من الاستدلال الطبيعي (NLI)، والعتبة الإحصائية التكيفية.

الطريقةمتوسط وقت الاستجابة (ملي ثانية)
نموذج لغوي كبير مرجعي (توليد واحد)820
آلية التحقق الذاتي910
إطار إحصائي مقترح980
التحقق المعزز بالاسترجاع (RAG)1600

الجدول 5: زمن استجابة التحقق عبر طرق التحقق المختلفة. متوسط وقت الاستجابة وزمن الاستجابة الإضافي بالنسبة لنموذج LLM المرجعي لكل من التحقق الذاتي (Self-Validation)، والإطار المقترح، والتحقق المعزز بالاسترجاع.

الجدول التكميلي 1: مقارنة بين منهجيات التحقق من الهلوسة. مقارنة بين الإطار المقترح والمنهجيات الحالية من حيث الاسترجاع الخارجي، والتحقق على مستوى الادعاء، والعتبة التكيفية، والمعالجة الفعالة من حيث زمن الاستجابة.يرجى النقر هنا لتحميل هذا الملف.

الجدول التكميلي 2: تحليل الحساسية لمعلمة العتبة (k). تم الحصول على الدقة (Accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1، ومعدل الهلوسة عند قيم معلمة العتبة 0.3 و0.5 و0.7 و1.0. استُخدمت القيمة k = 0.7 للتقييم الأساسي.يرجى النقر هنا لتنزيل هذا الملف.

الجدول التكميلي 3: وقت المعالجة عبر مراحل مسار التحقق. متوسط وقت التنفيذ ونسبة المساهمة لكل من توليد الاستجابة الأولية، وتفكيك الادعاء، وتوليد المراجع، واستدلال NLI، والتصحيح الانتقائي في إجمالي وقت الاستجابة.يرجى النقر هنا لتنزيل هذا الملف.

الجدول التكميلي 4: توزيع الأخطاء التي تم تحديدها أثناء التحقق. عدد ونسبة السلبيات الكاذبة، والإيجابيات الكاذبة، وأخطاء التصحيح، إلى جانب فئات الهلوسة الأساسية المرتبطة بكل نوع من أنواع الأخطاء.يرجى النقر هنا لتنزيل هذا الملف.

المناقشة

أدى الإطار المقترح إلى تحسين أداء التحقق من الحقائق مع تجنب أخذ العينات المتكرر والاسترجاع الخارجي. وفي اختبار TruthfulQA، انخفض معدل الهلوسة من 28% لنموذج LLM المرجعي إلى 9% باستخدام الإطار الكامل، بينما ارتفعت الدقة من 0.72 إلى 0.87. أما في اختبار FEVER، فقد انخفض معدل الهلوسة من 26% إلى 10%، مع زيادة الدقة من 0.74 إلى 0.89. ويجب تفسير هذه المقارنات ضمن الإعدادات التجريبية والتنفيذات المستخدمة في هذه الدراسة بدلاً من اعتبارها دليلاً على تفوق مطلق عبر جميع ظروف النشر. يقوم الإطار بإجراء عملية تحقق على مستوى الادعاء بعد التوليد باستخدام مرجع حقائقي معزول وتصحيح انتقائي، مما يوفر توازناً بين التأسيس على المعرفة الخارجية، والاستدلال المتكرر، والتحقق خفيف الوزن بعد التوليد. ويستخدم كل من مولد الاستجابة ومولد المراجع نفس نموذج GPT-3.5 Turbo الأساسي، لكنهما يعملان وفق أهداف تحفيزية مختلفة وسياقات تنفيذ معزولة. حيث يتلقى مولد المراجع الاستعلام الأصلي فقط ولا يمكنه الوصول إلى الاستجابة التي تم توليدها مسبقاً. وبالتالي، فإن عمليتي التوليد مستقلتان إجرائياً وليس إحصائياً، وقد تحتفظان بانحيازات حقائقية مترابطة ناتجة عن النموذج المشترك الذي تم تدريبه مسبقاً.

المقارنة مع المناهج الحالية

يطبق خط الأساس لـ NLI ذو العتبة الثابتة عتبة ثقة قدرها 0.7 بناءً على أعمال سابقة في التحقق من الواقعية المستند إلى NLI14. ويمثل SelfCheckGPT15 نهجاً للكشف عن الهلوسة بدون موارد، حيث يقوم بتوليد عينات عشوائية متعددة ويستخدم NLI لتحديد الادعاءات غير المتسقة. أما FActScore16 فيقوم بتفكيك الاستجابات المولدة إلى حقائق ذرية والتحقق منها مقابل مراجع مسترجعة من مصدر معرفي قائم على ويكيبيديا. في المقابل، ينفذ الإطار المقترح عملية تحقق على مستوى الادعاء دون الحاجة إلى تكرار توليد الاستجابة الكاملة أو الاسترجاع الخارجي.

تعد طريقة DoLA نهجاً تكميلياً خفيف الوزن يعزز التوليد الواقعي للمعلومات من خلال مضاهاة احتمالات الرموز (token probabilities) المستمدة من طبقات مختلفة من المحول (transformer) أثناء عملية الاستنتاج. لم يتم إدراج مقارنة تجريبية مباشرة لأن DoLA تعدل عملية توليد الرموز، بينما يقوم الإطار المقترح بإجراء تحقق على مستوى الادعاء بعد عملية التوليد وتصحيح انتقائي. يتطلب تنفيذ DoLA الوصول إلى التمثيلات الداخلية لطبقات المحول، وهي تمثيلات لا تتيحها واجهة برمجة تطبيقات GPT-3.5 Turbo المستخدمة في هذه الدراسة. ويؤدي غياب الاسترجاع الخارجي إلى تقليل الاعتماد على عمليات الاسترجاع ومتطلبات المعالجة المرتبطة بها، ولكنه يحد أيضاً من عملية التحقق لتقتصر على المعرفة المتاحة في النماذج الأساسية. وبناءً على ذلك، تظل الادعاءات المختلقة بالكامل أو الادعاءات المتخصصة التي تقع خارج نطاق تغطية معرفة أداة التحقق صعبة التصحيح.

العتبة الإحصائية التكيفية والتصحيح الانتقائي

يتم اشتقاق العتبة التكيفية من توزيع درجات الثقة التجريبية، وهي تتحكم في المقايضة بين استدعاء اكتشاف الهلوسة ودقة التصحيح. وقد قيم تحليل الحساسية قيم 0.3 و 0.5 و 0.7 و 1.0 على جزء تحقق مستبعد من مجموعة بيانات TruthfulQA. وقد وفرت القيمة k = 0.7 المقايضة الأكثر توازناً بين الحد من الهلوسة والكفاءة الحسابية للمقاييس المرجعية التي تم تقييمها.

قد تختلف العتبة المثلى باختلاف مجالات التطبيق لأن توزيع درجات الثقة في الاستدلال اللغوي الطبيعي (NLI) يعتمد على طبيعة المحتوى المولد. ولذلك، عند التطبيق في مجال جديد، يمكن استخدام مجموعة تحقق تعكس التطبيق المستهدف لتقييم القيم المرشحة واختيار قيمة توازن بين أداء التحقق من الحقائق، ومعدل التصحيح، وزمن استجابة المعالجة. وبما أن تحسين العتبة يتضمن معلمة قياسية واحدة بدلاً من إعادة تدريب النماذج، فإن عملية التكيف لا تتطلب تعديل النماذج الأساسية.

يقصر التصحيح الانتقائي عملية إعادة التوليد على الادعاءات المصنفة كـ "تناقض" والتي تستوفي معيار العتبة الإحصائية. وهذا يتجنب المعالجة المتكررة للادعاءات التي لا تستوفي معيار التصحيح، ويميز هذا الإطار عن مناهج إعادة أخذ العينات للاستجابة الكاملة ومناهج التحسين التكراري.

المفاضلة بين زمن الاستجابة والأداء

حقق الإطار المقترح متوسط زمن استجابة قدره 980 ms مقارنة بـ 820 ms للنموذج اللغوي الكبير (LLM) المرجعي و1600 ms للتحقق المعزز بالاسترجاع. وأظهر التحليل على مستوى المراحل أن توليد الاستجابة الأولية استحوذ على 83.7% من إجمالي زمن التأخير، بينما ساهم استدلال الاستلزام الطبيعي اللغوي (NLI) بنسبة 3.9%، وساهم التصحيح الانتقائي بنسبة أقل من 1% في المتوسط. تم تسجيل قيم زمن التأخير كمتوسط أزمنة التنفيذ عبر جولات تجريبية مكررة. لم يتم الاحتفاظ بقيم زمن التأخير الفردية لكل جولة؛ وبناءً عليه، تعذر إجراء حسابات لاحقة للتباين، أو فترات الثقة، أو غيرها من مقاييس التباين. وعليه، عُرضت قيم زمن التأخير ومقارنة السرعة والدقة كتقديرات نقطية دون أشرطة خطأ. تعكس قيم زمن التأخير المذكورة البيئة التجريبية المستخدمة في هذه الدراسة وقد تختلف باختلاف ظروف النشر، لا سيما عند استخدام واجهات برمجة تطبيقات (APIs) للنماذج اللغوية القائمة على السحابة. كما يمكن أن يؤثر زمن تأخير الشبكة، وعبء عمل الخادم، وتوافر الخدمة بشكل مستقل على أزمنة الاستجابة المطلقة، بغض النظر عن إطار التحقق المقترح.

تحليل الخطأ

صُنفت الادعاءات التي تم التعامل معها بشكل غير صحيح في مجموعة بيانات اختبار TruthfulQA على أنها سلبية كاذبة، أو إيجابية كاذبة، أو أخطاء تصحيح. وقد لُخص توزيع هذه الأخطاء وفئاتها الرئيسية في الجدول التكميلي 4. شكلت السلبيات الكاذبة 52.6% من إجمالي الأخطاء، وارتبطت بشكل أساسي بالهلوسات الزمنية والاستبدالات الوقائعية الدقيقة. قد يتم التغاضي عن الأخطاء الزمنية عندما يتشارك المدقق في تاريخ قطع التدريب الخاص بالنموذج الأساسي، بينما قد تحصل الاستبدالات الوقائعية الدقيقة على درجات NLI في النطاق المحايد بدلاً من التناقض.

شكلت الإيجابيات الكاذبة 35.9% من الأخطاء، وظهرت بشكل أساسي في الحقائق غير الشائعة، أو عالية التخصص، أو التي تم إثباتها حديثاً والتي تقع خارج نطاق تغطية المعرفة عالية الثقة لنموذج التحقق. وقد أنتجت هذه الحالات درجات استلزام ضعيفة في استنتاج اللغة الطبيعية (NLI) رغم أن الادعاءات كانت صحيحة واقعياً. أما أخطاء التصحيح فقد شكلت 11.5% من إجمالي الأخطاء، وحدثت عند تحديد اختلاقات كاملة، ولكن عملية التصحيح أنتجت عبارة غير دقيقة أخرى بسبب عدم كفاية تغطية معرفة نموذج التحقق.

تشير هذه النتائج إلى أن الأخطاء المتبقية تنشأ من كل من تمييز NLI وتغطية معرفة المُتحقق، خاصة فيما يتعلق بعدم الدقة الزمنية، والاستبدالات الحقيقية الطفيفة، والحقائق غير الشائعة، والافتراءات الكاملة.

التحليل الإحصائي

انخفض معدل الهلوسة من 15% عند استخدام التحقق من الاستلزام الطبيعي (NLI) ذو العتبة الثابتة إلى 9% باستخدام الإطار الإحصائي المقترح، بينما خفض الإطار الكامل المعدل من 28% للنموذج المرجعي إلى 9% في TruthfulQA. تم رصد هذه الاختلافات كتغيرات وصفية في الأداء، ولا يتم ادعاء وجود دلالة إحصائية رسمية لأن التقييم الحالي لا يتضمن نتائج الاختبارات الإحصائية وتقديرات حجم التأثير المطلوبة لدعم مثل هذا الاستنتاج17,18.

المحددات

يرتبط أداء التحقق من إطار العمل بقدرات نموذج NLI الأساسي. فقد يواجه نموذج DeBERTa-v3-large صعوبة في المقارنات العددية الدقيقة، والاستدلال الزمني، والادعاءات التي تتطلب استدلالاً متعدد الخطوات عبر حقائق متعددة. كما ارتبطت محدوديات نموذج NLI بظهور نتائج سلبية خاطئة تتضمن استبدالات واقعية طفيفة، وقد تؤدي نقاط الضعف المنهجية في نموذج NLI إلى التأثير سلباً على قرارات التحقق.

يستخدم كل من مولد الاستجابة ومولد المراجع نفس نموذج GPT-3.5 Turbo الأساسي. ورغم أن أهداف التلقين المختلفة وسياقات التنفيذ المنعزلة توفر استقلالاً إجرائياً، إلا أن العمليتين ليستا مستقلتين إحصائياً وقد تحتفظان بانحيازات واقعية مترابطة ناتجة عن النموذج المشترك الذي خضع للتدريب المسبق.

يمثل الاقتران بين المُقوِّم والمُحقِّق قيداً إضافياً؛ حيث يستخدم التقييم النهائي للهلوسة نموذج NLI ذاته الذي يتحقق من الادعاءات ضمن خط العمل المقترح. وقد يؤدي ذلك إلى حدوث توافق بين المُحقِّق والمُقوِّم، مما يؤثر على التحسن المقاس. ولذلك، ينبغي تفسير النتائج المسجلة على أنها أداء ضمن إجراء تقييم محدد يعتمد على NLI، بدلاً من اعتبارها دليلاً مستقلاً تماماً على الحد من الهلوسة. ومن شأن إجراء تقييم بشري مستقل أو استخدام نموذج تقييم تم تطويره بشكل منفصل أن يوفر تحققاً أقوى.

تم تقييم مرحلة تفكيك الادعاءات بناءً على مساهمتها في عملية التحقق الشاملة (من الطرف إلى الطرف) فقط، ولم يتم تقييمها بشكل مستقل مقابل حدود الادعاءات التي حددها البشر. وبناءً على ذلك، لا تقدم الدراسة تقديراً كمياً منفصلاً لدقة التفكيك أو مدى انتشار الخطأ الناتج عنها في عمليات التحقق اللاحقة.

اقتصر التقييم على TruthfulQA وFEVER وعلى المحتوى باللغة الإنجليزية. ولذلك، فإن الأداء الملحوظ لا يثبت إمكانية التعميم على المجالات المتخصصة، أو الإعدادات متعددة اللغات، أو التوليد طويل الصيغة. وقد تختلف القيمة المثلى لـ k أيضاً عبر مجالات التطبيق لأن توزيعات درجات الثقة في NLI تعتمد على طبيعة المحتوى المولد. وبناءً على ذلك، يتطلب الأمر إجراء معايرة خاصة بالمجال وتقييم أوسع قبل تعميم هذه النتائج خارج نطاق الظروف التي تم تقييمها في هذه الدراسة.

أخيرًا، تُعد قياسات زمن الاستجابة (latency) خاصة بالتكوين التجريبي وقد تختلف باختلاف بيئات التنفيذ. ونظرًا لعدم الاحتفاظ بقياسات زمن الاستجابة الفردية لكل عملية تشغيل، لم يكن من الممكن تقدير التباين وفترات الثقة بشكل لاحق (post hoc). لذا، يجب أن تحتفظ التقييمات المستقبلية بالقياسات الفردية وأن تتضمن توصيفًا إحصائيًا أوسع لزمن الاستجابة عبر بيئات التنفيذ المختلفة.

العمل المستقبلي

يجب أن تتطرق الدراسات المستقبلية إلى القيود الرئيسية التي تم تحديدها في الإطار الحالي. هناك حاجة إلى معايرة عتبة واعية بالمجال لأن القيمة الثابتة (k = 0.7) التي تم اختيارها باستخدام TruthfulQA قد لا تكون مثالية للمجالات المتخصصة التي تتميز بتوزيعات مختلفة لدرجات الثقة في الاستدلال الطبيعي للغة (NLI). ويمكن استخدام بيانات تحقق خاصة بالمجال لمعايرة العتبة، وتطبيق عقوبات غير متماثلة لأخطاء السلبيات الكاذبة والإيجابيات الكاذبة عند الضرورة19.

يجب أن يتضمن التحسين في تفكيك الادعاءات تقييماً مستقلاً باستخدام حدود ادعاءات محددة بشرياً لقياس مدى الاكتمال والصحة وانتشار الخطأ في المراحل اللاحقة. ويمكن لنماذج التفكيك المضبوطة بدقة ومقاييس الثقة في التفكيك أن تقلل بشكل أكبر من الأخطاء الناجمة عن الادعاءات المقسمة بشكل ضعيف. كما ينبغي أن تشمل التقييمات المقارنة المستقبلية منهجيات خفيفة تعتمد على فك التشفير مثل DoLA ضمن بروتوكول تجريبي موحد.

قد يساعد التعزيز بالاسترجاع خفيف الوزن في معالجة حالات الفبركة الكاملة، والتي تظل صعبة عندما يفتقر المُحقق إلى المعرفة الواقعية الكافية. ومن شأن توفير خيار استرجاع احتياطي مستهدف للمطالبات المتناقضة ذات الثقة المنخفضة أن يقدم دعماً واقعياً خارجياً دون الحاجة إلى الاسترجاع لكل مطالبة20.

كما يتطلب الأمر توسيعاً ليشمل لغات متعددة لأن التقييم الحالي يقتصر على معايير القياس باللغة الإنجليزية3. وينبغي أن تعمل الدراسات المستقبلية على تقييم نماذج الاستدلال اللغوي الطبيعي (NLI) متعددة اللغات، ومطالبات تفكيك الادعاءات وتصحيحها الخاصة بكل لغة، وذلك ضمن معايير قياس الهلوسة متعددة اللغات.

الخلاصة

قدمت هذه الدراسة إطار عمل للتحقق من الادعاءات يتكون من خطوتين، يجمع بين تفكيك الادعاءات إلى وحدات ذرية، وتوليد مراجع واقعية عبر مطالبات منفصلة، والتحقق باستخدام الاستدلال اللغوي الطبيعي (NLI)، والعتبة الإحصائية التكيفية، والتصحيح الانتقائي. وفي اختبار TruthfulQA، خفض إطار العمل معدل الهلوسة من 28% إلى 9%، مع زيادة متوسط زمن الاستجابة بمقدار 160 ms مقارنة بنموذج اللغة الكبير (LLM) المرجعي. أما في اختبار FEVER، فقد انخفض معدل الهلوسة من 26% إلى 10%.

حقق الإطار المقترح أداءً تنافسياً في التحقق من الحقائق دون الحاجة إلى أخذ عينات متكررة من الاستجابة الكاملة أو الاسترجاع الخارجي. وقد ساهمت العتبة التكيفية والتصحيح الانتقائي في الأداء الملحوظ مع الحد من الأعباء الإضافية في المعالجة. ومع ذلك، تقتصر هذه النتائج على المعايير المرجعية والظروف التجريبية التي تم تقييمها، وتظل خاضعة للاعتماد على نموذج NLI، والاقتران بين المقيم والمحقق، وعدم اليقين في تفكيك الادعاءات، ومعايرة العتبة الخاصة بكل مجال، وتباين زمن الاستجابة. لذا، يتطلب الأمر إجراء تقييم أوسع ومستقل ومتعدد اللغات وخاص بكل مجال قبل تعميم هذه النتائج على نطاقات نشر أوسع.

الإفصاحات

ليس لدى المؤلفين أي تضارب في المصالح للإفصاح عنه.

شكر وتقدير

يود المؤلفون الإعراب عن خالص امتنانهم لمؤسستهم لتوفير البيئة الأكاديمية والموارد الحسابية اللازمة لإجراء هذا البحث. كما يقر المؤلفون بفضل مطوري ومسؤولي مجموعات بيانات القياس المرجعية المتاحة للعموم والمستخدمة في هذه الدراسة، والتي مكنت من إجراء تقييم شامل للإطار المقترح. ويمتد التقدير إلى الزملاء والمراجعين على ملاحظاتهم البناءة التي ساعدت في تحسين جودة ووضوح هذا العمل. كما يشكر المؤلفون مجتمع أبحاث المصادر المفتوحة لتوفير المكتبات البرمجية والأدوات التي سهلت إجراء التجارب وتحليل البيانات وتصور النتائج؛ حيث ساهمت جهودهم المستمرة بشكل كبير في دفع عجلة الأبحاث في مجال معالجة اللغات الطبيعية والذكاء الاصطناعي الموثوق. ويصرح المؤلفون بعدم تلقي أي دعم مالي خارجي أو تمويل لهذا البحث.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
مجموعة بيانات FEVER المرجعيةمهمة FEVER المشتركة (Thorne et al.)https://fever.ai/dataset/fever.htmlمجموعة بيانات للتحقق من الحقائق متاحة للعموم وتتكون من أزواج (ادعاء-دليل) مستخدمة لأغراض التقييم
GPT-3.5 Turbo (نموذج لغوي كبير B10+2:12:12OpenAIمعرف النموذج: gpt-3.5-turbo; https://developers.openai.com/api/docs/models/gpt-3.5-turboاستُخدم كمولد للاستجابات ومولد مراجع مستقل، وتم الوصول إليه عبر واجهة برمجة تطبيقات OpenAI API
NumPyمطورو NumPy (مفتوح المصدر)https://numpy.org/مكتبة حسابات عددية استُخدمت لإجراء الحسابات الإحصائية، بما في ذلك المتوسط والانحراف المعياري لدرجات التحقق من الاستدلال اللغوي الطبيعي NLI
Openai (مكتبة عميل واجهة برمجة تطبيقات Python)OpenAIhttps://github.com/openai/openai-pythonمكتبة عميل بلغة Python استُخدمت لإرسال المطالبات واسترداد الإكمالات من GPT-3.5 Turbo
pandasفريق تطوير pandas (مفتوح المصدر)https://pandas.pydata.org/مكتبة لتحليل البيانات الجدولية استُخدمت في المعالجة المسبقة لمجموعة البيانات ومعالجة النتائج
نموذج تصنيف الاستدلال اللغوي الطبيعي (NLI) مسبق التدريبمركز نماذج Hugging Face (نموذج مبني على بنية DeBERTa-v3-large من Microsoft)MoritzLaurer/DeBERTa-v3-large-mnli-fever-anli-ling-wanliاستُخدم في وضع الاستدلال، دون ضبط دقيق، لتصنيف كل زوج (ادعاء-مرجع) كاستلزام أو محايد أو تناقض
Pythonمؤسسة برمجيات Pythonالإصدار 3.9; https://www.python.org/downloads/release/python-390/لغة البرمجة الأساسية المستخدمة لتنفيذ إطار عمل التحقق
SciPyمطورو SciPy (مفتوح المصدر)https://scipy.org/مكتبة حوسبة علمية استُخدمت لدعم التحليل الإحصائي للنتائج التجريبية
Transformers (مكتبة Hugging Face Transformers)Hugging Facehttps://github.com/huggingface/transformersمكتبة Python استُخدمت لتحميل وتشغيل نموذج NLI مسبق التدريب
مجموعة بيانات TruthfulQA المرجعيةأصدرها في الأصل Lin وHilton وEvanshttps://github.com/sylinrl/TruthfulQAمرجع متاح للعموم يضم 817 سؤالاً موجهاً نحو الحقائق استُخدم لضبط العتبة والتقييم
جهاز كمبيوتر محطة عملغير محدد في المخطوطة (يرجى تأكيد الشركة المصنعة/الطراز)معالج Intel Core i5; ذاكرة وصول عشوائي 16 GB RAM; نظام تشغيل 64-bitالأجهزة المستخدمة لتنفيذ جميع التجارب تحت تكوينات متطابقة
ملاحظة: تم فحص جميع الروابط المدرجة أعلاه والتأكد من أنها نشطة حتى تاريخ هذا الجدول. 

المراجع

  1. Dai Z, et al. Promptagator: Few-shot dense retrieval from 8 examples [conference presentation]. Presented at: The Eleventh International Conference on Learning Representations; 2022. [https://iclr.cc/virtual/2023/poster/10937]
  2. Achiam J, et al. GPT-4 technical report. arXiv. 2023;arXiv:2303.08774. [https://arxiv.org/abs/2303.08774]
  3. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):1-38.
  4. Bender EM, McMillan-Major A, Shmitchell S, Gebru T. On the dangers of stochastic parrots: Can language models be too big? [conference presentation]. Presented at: 2021 ACM Conference on Fairness, Accountability, and Transparency; 2021. [https://dl.acm.org/doi/10.1145/3442188.3445922]
  5. Devlin J, et al. BERT: Pre-training of deep bidirectional transformers for language understanding [conference presentation]. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2019. [https://arxiv.org/abs/1810.04805]
  6. Maynez J, Narayan S, Bohnet B, McDonald R. On faithfulness and factuality in abstractive summarization [conference presentation]. Presented at: 58th Annual Meeting of the Association for Computational Linguistics; 2020. [https://arxiv.org/abs/2005.00661]
  7. Brown T, et al. Language models are few-shot learners. Adv Neural Inf Process Syst. 2020;33:1877-901.
  8. Guu K, et al. Retrieval augmented language model pre-training [conference presentation]. Presented at: International Conference on Machine Learning; 2020. [https://arxiv.org/abs/2002.08909]
  9. Izacard G, Grave E. Leveraging passage retrieval with generative models for open domain question answering [conference presentation]. Presented at: 16th Conference of the European Chapter of the Association for Computational Linguistics; 2021. [https://arxiv.org/abs/2007.01282]
  10. Bowman SR, Angeli G, Potts C, Manning CD. A large annotated corpus for learning natural language inference [conference presentation]. Presented at: 2015 Conference on Empirical Methods in Natural Language Processing; 2015. [https://arxiv.org/abs/1508.05326]
  11. Platt J. Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods. Adv Large Margin Classif. 1999;10(3):61-74.
  12. Lin S, Hilton J, Evans O. Truthfulqa: Measuring how models mimic human falsehoods. InProceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) 2022 May (pp. 3214-3252).
  13. Thorne J, Vlachos A, Christodoulopoulos C, Mittal A. FEVER: A large-scale dataset for fact extraction and verification [conference presentation]. Presented at: 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2018. [https://aclanthology.org/N18-1074/]
  14. Williams A, Nangia N, Bowman SR. A broad-coverage challenge corpus for sentence understanding through inference. arXiv. 2017;arXiv:1704.05426.
  15. Manakul P, Liusie A, Gales M. SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models [conference presentation]. Presented at: 2023 Conference on Empirical Methods in Natural Language Processing; 2023.
  16. Min S, et al. FActScore: Fine-grained atomic evaluation of factual precision in long-form text generation. arXiv. 2023;arXiv:2305.14251.
  17. Cohen J. Statistical power analysis for the behavioral sciences. Routledge; New York; 2013.
  18. Kadavath S, et al. Language models (mostly) know what they know. arXiv. 2022;arXiv:2207.05221.
  19. Hendrycks D, et al. Aligning AI with shared human values. arXiv. 2020;arXiv:2008.02275.
  20. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-74.

إعادة الطباعة والأذونات

الوسوم

TruthfulQA SelfCheckGPT
الفيديو قريباً