توليد الاستجابة الأولية
قام نموذج اللغة الأساسي بتوليد إجابات طليقة وذات صلة بالسياق للأسئلة الواردة في كلتا مجموعتي بيانات القياس. ومع ذلك، كشف الفحص التفصيلي عن وجود عبارات غير مدعومة وغير دقيقة واقعياً في العديد من الاستجابات. ففي مجموعة بيانات TruthfulQA، أظهر النظام الأساسي معدل هلوسة بلغ 28%، بينما لوحظ معدل هلوسة بنسبة 26% في مجموعة بيانات FEVER. وقد أكدت هذه النتائج أن التوليد المباشر للغة وحده غير كافٍ للتطبيقات التي تتطلب موثوقية واقعية عالية، وحددت الحالة الأساسية التي قورنت بها جميع إجراءات التحقق اللاحقة.
استخراج الادعاءات
نجحت إجراءات استخراج الادعاءات في تفكيك الاستجابات المُولَّدة إلى وحدات حقائق يمكن التحقق منها بشكل مستقل. وقد احتوت الاستجابات الواردة من TruthfulQA على متوسط 3.2 ادعاءً ذرياً، بينما تكونت عينات FEVER عموماً من ادعاء واحد. وقد عزل عملية التفكيك التأكيدات الواقعية دون إدخال معلومات إضافية، مما سمح بتقييم كل عبارة على حدة. وقد دعمت هذه الملاحظة الفرضية القائلة بأن التحقق على مستوى الادعاء يوفر دقة أكبر من تقييم الاستجابات الكاملة كوحدة واحدة.
بناء المرجع المستقل
تم إنشاء مراجع مستقلة لكل ادعاء مستخرج باستخدام عملية استدلال منفصلة مشروطة فقط بالاستعلام الأصلي. وفرت المراجع المُنشأة أوصافاً واقعية موجزة كانت متمايزة بما يكفي عن الاستجابات الأصلية لتكون بمثابة مصادر تحقق مستقلة. كما عُزلت عملية إنشاء المراجع عن الاستجابة الأولية لتجنب ربط المرجع الواقعي مباشرة بمخرجات النموذج السابقة. وكان الهدف من هذا الفصل هو تقليل انحياز التأكيد المحتمل وتوفير أساس منضبط للتحقق اللاحق على مستوى الادعاء؛ ولا تقوم الدراسة بقياس مدى هذا التأثير بشكل مستقل. وقد دعمت عملية الإنشاء الناجحة للمراجع المستقلة مبدأ التصميم المقترح المتمثل في فصل استرجاع المعرفة عن إنشاء الاستجابة.
التحقق من الاستنتاج باللغة الطبيعية
صنفت مرحلة التحقق باستخدام الاستنتاج اللغوي الطبيعي (NLI) أزواج الادعاء والمرجع بفعالية إلى فئات الاستلزام، والتناقض، والحياد. وقد حصلت الادعاءات المتناقضة باستمرار على درجات تحقق سلبية، بينما حصلت الادعاءات المدعومة حقائقيًا على درجات إيجابية. وخصصت التصنيفات المحايدة للادعاءات التي لم تتوفر لها أدلة داعمة كافية. وقد أظهر هذا السلوك أن الاستنتاج الدلالي يمكنه تحديد البيانات الحقائقية غير المدعومة بشكل موثوق، ووفر الأدلة المطلوبة للتصحيح الموجه. ومقارنة باستراتيجية التحقق من الاتساق البسيطة، خفض التحقق عبر NLI معدل الهلوسة من 20% إلى 15%، مما يشير إلى تحسن في قدرة الكشف.
العتبة الإحصائية التكيفية
أدى تطبيق العتبة الإحصائية التكيفية إلى تحسين أداء التحقق بشكل أكبر من خلال ضبط حدود القرار ديناميكياً بناءً على توزيع درجات الثقة لكل استجابة. وقد أظهر تحليل حساسية العتبة أن الأداء تحسن مع زيادة معامل العتبة من 0.3 إلى 0.7. وعند قيمة حساسية تبلغ 0.7، حقق إطار العمل دقة وصلت إلى 0.87 مع خفض الهلوسات إلى 9% (الشكل 2). تتوفر نتائج تحليل الحساسية الكاملة للقيم التي تم تقييمها لـ k في الجدول التكميلي 2. ولم تؤدِ زيادة العتبة بعد هذه النقطة إلا إلى مكاسب طفيفة في الدقة مع زيادة زمن الاستجابة. وقد دعمت هذه الملاحظات الفرضية القائلة بأن العتبات التكيفية أكثر فعالية من حدود القرار الثابتة في التعامل مع توزيعات الثقة المتغيرة عبر الاستجابات.
تعكس العتبة التكيفية أيضاً تباين درجات الثقة ضمن كل استجابة. فمن شأن الاستجابات التي تحتوي على درجات تحقق متسقة للغاية أن تُنتج انحرافاً معيارياً أصغر، مما يؤدي إلى حدود قرار أكثر انتقائية. وفي المقابل، فإن الاستجابات التي تتضمن ادعاءات ذات قيم ثقة غير متجانسة تعطي انحرافاً معيارياً أكبر، مما يؤدي إلى منطقة قبول أوسع ويقلل من التصحيحات غير الضرورية للادعاءات غير المؤكدة. ورغم أن هذا السلوك التكيفي لا يمكنه القضاء على كل نتيجة إيجابية كاذبة أو سلبية كاذبة، إلا أنه يتيح لحدود القرار الاستجابة لخصائص عدم اليقين في كل استجابة بدلاً من تطبيق معيار موحد على جميع المدخلات.
التصحيح الانتقائي للمطالبات وتجميع الاستجابة
تم تقديم الادعاءات التي صُنفت على أنها متناقضة فقط للتصحيح، بينما تم الإبقاء على الادعاءات المدعومة والمحايدة دون تغيير. وقد قللت استراتيجية التصحيح الانتقائية هذه من عمليات إعادة التوليد غير الضرورية وحافظت على البنية الأصلية للاستجابة. وبعد عملية التصحيح وإعادة بناء الاستجابة، انخفض معدل الهلوسة في TruthfulQA من 28% إلى 9%، وهو ما يمثل انخفاضاً نسبياً قدره 67.9%. كما لوحظت تحسينات مماثلة في FEVER، حيث انخفضت الهلوسات من 26% إلى 10%. وتُعرض مقارنات الدقة ومعدل الهلوسة عبر التكوينات التي تم تقييمها في الشكلان 3 و 4، على التوالي.
تقييم الأداء
أظهر التقييم المقارن أن الإطار المقترح حقق أعلى أداء إجمالي من بين جميع الطرق المختبرة. ففي مجموعة بيانات TruthfulQA، حقق الإطار دقة بلغت 0.87 ودرجة F1 بلغت 0.85، متفوقاً بذلك على كل من التحقق القائم على العتبة الثابتة والنهج القائمة على الاتساق الذاتي (الجدول 2، الشكلان 3 و4). وفي مجموعة بيانات FEVER، حقق الإطار دقة بلغت 0.89 ودرجة F1 بلغت 0.87 (الجدول 3، الشكلان 3 و4). كما تم فحص المساهمة التزايدية لمكونات الإطار من خلال تحليل الاستئصال الموضح في الجدول 4. وأكدت هذه التحسينات أن الجمع بين التحقق على مستوى الادعاء واتخاذ القرار الإحصائي التكيفي قد عزز الموثوقية الواقعية عبر مجموعات بيانات متعددة. وتتم مقارنة دقة الكشف عن الهلوسة لكل من SelfCheckGPT وFActScore والإطار المقترح في الشكل 5.
تحليل فترة الكمون
حافظ مسار التحقق الكامل على انخفاض التكاليف الحسابية الإضافية. حيث ارتفع متوسط وقت الاستجابة من 820 ms للنموذج المرجعي إلى 980 ms للإطار العملي الكامل، مما يمثل زيادة طفيفة فقط في وقت المعالجة (الجدول 5). وقد شكل توليد الاستجابة الجزء الأكبر من إجمالي زمن التأخير، بينما ساهمت مراحل التحقق والتصحيح بقدر ضئيل نسبيًا من التكاليف الإضافية. ويرد تفصيل وقت المعالجة على مستوى المرحلة في الجدول التكميلي 3. ومقارنة بأنظمة التحقق القائمة على الاسترجاع، والتي تطلبت حوالي 1600 ms لكل استعلام، حقق الإطار المقترح زمن تأخير أقل بكثير مع الحفاظ على دقة واقعية مماثلة. ودعمت هذه النتائج الفرضية القائلة بأن الحد من الهلوسة يمكن تحقيقه دون التضحية بقابلية الاستخدام في الوقت الفعلي.
نظراً لأن توليد الاستجابات يعتمد على نموذج لغوي قائم على السحابة، فإن قياسات زمن الاستجابة الفردية تخضع للتقلبات الناتجة عن ظروف الشبكة وجدولة الخادم، بدلاً من الاعتماد على وقت تنفيذ محدد. لذا، استُخدمت قياسات متكررة للحصول على قيم متوسطة ممثلة، مما يقلل من تأثير تباين التنفيذ العابر مع الحفاظ على المقارنات النسبية بين الطرق التي تم تقييمها. يتم تقديم قيم زمن الاستجابة كمتوسط لأوقات التنفيذ عبر جولات تجريبية متكررة. ولم يتم الاحتفاظ بقيم زمن الاستجابة الفردية لكل جولة؛ وبالتالي، لم يكن من الممكن إجراء حسابات لاحقة للتباين، أو فترات الثقة، أو غيرها من مقاييس التباين. وبناءً على ذلك، تم عرض قيم زمن الاستجابة ومقارنة السرعة والدقة في الشكل 6 كتقديرات نقطية بدون أشرطة خطأ.
وفي الختام، أظهرت النتائج أن الجمع بين استخراج الادعاءات، وتوليد المراجع المستقلة، والتحقق باستخدام استدلال اللغة الطبيعية (Natural Language Inference)، والعتبة الإحصائية التكيفية، والتصحيح الانتقائي، قد أدى إلى تحسين الموثوقية الواقعية لمخرجات النماذج اللغوية الكبيرة. وقد خفض هذا الإطار معدل الهلوسة من 28% إلى 9% في مجموعة بيانات TruthfulQA، ومن 26% إلى 10% في مجموعة بيانات FEVER. وتشير النتائج إلى أن التحقق التكيفي على مستوى الادعاء قد حسن مقاييس الموثوقية الواقعية مع الحد من زمن استجابة إضافي في ظل الظروف التي تم تقييمها
توافر البيانات
إن مجموعات البيانات التي تم تحليلها في هذه الدراسة متاحة للعموم من خلال مصادرها الرسمية المخصصة. وتوفر المخطوطة معلومات مجموعات البيانات، وتكوينات النماذج، والتفاصيل المنهجية اللازمة لدعم تكرار التحليلات الموضحة. كما تتوفر بيانات التقييم المعالجة والنتائج التكميلية التي تم استخراجها خلال الدراسة في الملفات التكميلية.

الشكل 1: سير عمل إطار التحقق التكيفي من الادعاءات. يتم تفكيك الاستجابة الأولية التي يولدها النموذج اللغوي الكبير (LLM) إلى ادعاءات واقعية، يتبع ذلك توليد مراجع مستقلة، والتحقق بناءً على الاستدلال اللغوي الطبيعي (NLI)، وتسجيل درجات الثقة، وتحديد العتبات الإحصائية. يتم الاحتفاظ بالادعاءات التي تستوفي معيار القبول، بينما تخضع الادعاءات التي تستوفي معيار التصحيح لتصحيح مستهدف قبل تجميع الاستجابة النهائية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: تأثير معامل الحساسية (k) على دقة التحقق. الدقة في TruthfulQA و FEVER عند قيم k تبلغ 0.3 و 0.5 و 0.7 و 1.0. زادت الدقة مع زيادة k في كلتا مجموعتي البيانات، وتم اختيار k = 0.7 للتقييم الأساسي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: مقارنة الدقة عبر طرق التحقق المختلفة. دقة النموذج اللغوي الكبير (LLM) المرجعي، والتحقق القائم على الاستدلال اللغوي الطبيعي (NLI)، وإطار التحقق التكيفي المقترح على مجموعتي بيانات TruthfulQA و FEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: مقارنة معدل الهلوسة عبر طرق التحقق المختلفة. معدلات الهلوسة لنموذج LLM المرجعي، والتحقق القائم على NLI، والإطار المقترح على مجموعتي بيانات TruthfulQA وFEVER. خفّض الإطار المقترح المعدل من 28% إلى 9% في TruthfulQA ومن 26% إلى 10% في FEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: دقة الكشف عن الهلوسة عبر الطرق المختلفة. دقة الكشف لـ SelfCheckGPT و FActScore والإطار المقترح على TruthfulQA و FEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6: المقايضة بين زمن الاستجابة والدقة عبر طرق التحقق المختلفة. العلاقة بين زمن استجابة النظام والدقة للطرق التي تم تقييمها على مجموعتي بيانات TruthfulQA و FEVER، مما يوضح المقايضة بين الأداء وزمن الاستجابة المرتبطة بإطار العمل المقترح والنهج المقارنة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| مجموعة البيانات | العينات المستخدمة | النطاقات | متوسط طول الاستجابة (وحدات رمزية) | معدل الهلوسة المرجعي للنماذج اللغوية الكبيرة |
| TruthfulQA | 817 | ٣٨ (العلوم، التاريخ، القانون، إلخ.) | 42 | 28% |
| الحُمَّى | 1,000 | ادعاءات واقعية عامة | 18 | 26% |
الجدول 1: خصائص مجموعة بيانات القياس. ملخص لمجموعتي بيانات TruthfulQA وFEVER المستخدمتين في تطوير الإطار وتقييمه، بما في ذلك أعداد العينات، ودقة خط الأساس، ومعدل الهلوسة عند خط الأساس، ومتوسط الادعاءات لكل عينة.
| الطريقة | الدقة (Accuracy) | الإحكام (Precision) | الاستدعاء (Recall) | مقياس F1 | نسبة الهلوسة % |
| النموذج اللغوي الكبير المرجعي (استنتاج واحد) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| التحقق القائم على NLI (عتبة ثابتة) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| الإطار المقترح (عتبة إحصائية) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
الجدول 2: مقارنة الأداء على TruthfulQA. الدقة (Accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1، ومعدل الهلوسة للنموذج اللغوي الكبير (LLM) المرجعي، وSelfCheckGPT، وFActScore، والتحقق بنظام NLI، والإطار المقترح.
| الطريقة | الدقة (Accuracy) | الإحكام (Precision) | الاستدعاء (Recall) | مقياس F1 | نسبة الهلوسة % |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| نموذج اللغة الكبير المرجعي (Baseline LLM†) | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| التحقق القائم على الاستدلال اللغوي الطبيعي (عتبة ثابتة) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| الإطار المقترح (عتبة إحصائية) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
الجدول 3: مقارنة الأداء على FEVER.الدقة (Accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1، ومعدل الهلوسة للنموذج اللغوي الكبير (LLM) المرجعي، وSelfCheckGPT، وFActScore، والتحقق عبر الاستدلال الطبيعي (NLI verification)، والإطار المقترح.
| الإعدادات | الدقة | الدقة | الاستدعاء | F1 (مضاف) | معدل الهلوسة |
| نموذج لغوي مرجعي | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| الخط المرجعي + الفحص الثانوي (بدون الاستدلال الطبيعي) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| الخط المرجعي + التحقق القائم على الاستدلال اللغوي الطبيعي (عتبة ثابتة) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| خط الأساس + وحدة القرار الإحصائي (كاملة) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
الجدول 4: تحليل الاستئصال لمكونات إطار العمل. التغيرات في الدقة، ودرجة F1، ومعدل الهلوسة بعد الدمج المتسلسل للتحقق الثانوي، والتحقق من الاستدلال الطبيعي (NLI)، والعتبة الإحصائية التكيفية.
| الطريقة | متوسط وقت الاستجابة (ملي ثانية) |
| نموذج لغوي كبير مرجعي (توليد واحد) | 820 |
| آلية التحقق الذاتي | 910 |
| إطار إحصائي مقترح | 980 |
| التحقق المعزز بالاسترجاع (RAG) | 1600 |
الجدول 5: زمن استجابة التحقق عبر طرق التحقق المختلفة. متوسط وقت الاستجابة وزمن الاستجابة الإضافي بالنسبة لنموذج LLM المرجعي لكل من التحقق الذاتي (Self-Validation)، والإطار المقترح، والتحقق المعزز بالاسترجاع.
الجدول التكميلي 1: مقارنة بين منهجيات التحقق من الهلوسة. مقارنة بين الإطار المقترح والمنهجيات الحالية من حيث الاسترجاع الخارجي، والتحقق على مستوى الادعاء، والعتبة التكيفية، والمعالجة الفعالة من حيث زمن الاستجابة.يرجى النقر هنا لتحميل هذا الملف.
الجدول التكميلي 2: تحليل الحساسية لمعلمة العتبة (k). تم الحصول على الدقة (Accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1، ومعدل الهلوسة عند قيم معلمة العتبة 0.3 و0.5 و0.7 و1.0. استُخدمت القيمة k = 0.7 للتقييم الأساسي.يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 3: وقت المعالجة عبر مراحل مسار التحقق. متوسط وقت التنفيذ ونسبة المساهمة لكل من توليد الاستجابة الأولية، وتفكيك الادعاء، وتوليد المراجع، واستدلال NLI، والتصحيح الانتقائي في إجمالي وقت الاستجابة.يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 4: توزيع الأخطاء التي تم تحديدها أثناء التحقق. عدد ونسبة السلبيات الكاذبة، والإيجابيات الكاذبة، وأخطاء التصحيح، إلى جانب فئات الهلوسة الأساسية المرتبطة بكل نوع من أنواع الأخطاء.يرجى النقر هنا لتنزيل هذا الملف.