توليد الاستجابة الأولية
قام نموذج اللغة الأساسي بتوليد إجابات سلسة وذات صلة سياقية للأسئلة الواردة من كلتا مجموعتي بيانات القياس. ومع ذلك، كشف الفحص التفصيلي عن وجود تصريحات غير مدعومة وغير دقيقة واقعياً في العديد من الاستجابات. ففي مجموعة بيانات TruthfulQA، أظهر النظام الأساسي معدل هلوسة بلغ 28%، بينما لوحظ معدل هلوسة بنسبة 26% في مجموعة بيانات FEVER. وأكدت هذه النتائج أن توليد اللغة المباشر وحده لم يكن كافياً للتطبيقات التي تتطلب موثوقية واقعية عالية، كما حددت الحالة المرجعية التي تمت مقارنة جميع إجراءات التحقق اللاحقة بها.
استخراج الادعاءات
نجحت إجراءات استخراج الادعاءات في تفكيك الاستجابات المولدة إلى وحدات حقيقية يمكن التحقق منها بشكل مستقل. وقد احتوت الاستجابات المستمدة من TruthfulQA على متوسط قدره 3.2 من الادعاءات الذرية، بينما تألفت عينات FEVER عموماً من ادعاء واحد. وقد عزل عملية التفكيك التأكيدات الحقيقية دون إدخال معلومات إضافية، مما أتاح تقييم كل عبارة على حدة. وقد دعمت هذه الملاحظة الفرضية القائلة بأن التحقق على مستوى الادعاء يوفر دقة أكبر من تقييم الاستجابات الكاملة كوحدة واحدة.
بناء مرجعي مستقل
تم إنشاء مراجع مستقلة لكل ادعاء مُستخرج باستخدام عملية استدلال منفصلة مشروطة فقط بالاستعلام الأصلي. وقد قدمت المراجع التي تم إنشاؤها أوصافاً واقعية موجزة كانت متميزة بما يكفي عن الاستجابات الأصلية لتعمل كمصادر تحقق مستقلة. كما عُزلت عملية إنشاء المراجع عن الاستجابة الأولية لتجنب ربط المرجع الواقعي بشكل مباشر بالمخرجات السابقة للنموذج. وكان الهدف من هذا الفصل هو تقليل انحياز التأكيد المحتمل وتوفير أساس مضبوط للتحقق اللاحق على مستوى الادعاء؛ علماً بأن الدراسة لا تقيس بشكل مستقل مدى تأثير هذا الإجراء. وقد دعم النجاح في إنشاء مراجع مستقلة مبدأ التصميم المقترح المتمثل في فصل استرجاع المعرفة عن إنشاء الاستجابة.
التحقق من الاستدلال باللغة الطبيعية
صنفت مرحلة التحقق باستخدام استدلال اللغة الطبيعية (NLI) أزواج الادعاءات-المراجع بفعالية إلى فئات الاستلزام، والتناقض، والحياد. وتلقت الادعاءات المتناقضة باستمرار درجات تحقق سلبية، بينما حصلت الادعاءات المدعومة حقائقيًا على درجات إيجابية. أما التصنيفات المحايدة فقد خُصصت للادعاءات التي لم تتوفر لها أدلة داعمة كافية. وقد أظهر هذا السلوك أن الاستدلال الدلالي يمكنه تحديد البيانات الحقائقية غير المدعومة بشكل موثوق، ووفر الأدلة المطلوبة للتصحيح المستهدف. ومقارنة باستراتيجية بسيطة للتحقق من الاتساق، خفض التحقق عبر NLI معدل الهلوسة من 20% إلى 15%، مما يشير إلى تحسن في قدرة الكشف.
العتبة الإحصائية التكيفية
أدى تطبيق العتبة الإحصائية التكيفية إلى تحسين أداء التحقق بشكل أكبر من خلال الضبط الديناميكي لحدود اتخاذ القرار بناءً على توزيع درجة الثقة لكل استجابة. وأظهر تحليل حساسية العتبة أن الأداء تحسن مع زيادة معامل العتبة من 0.3 إلى 0.7. وعند قيمة حساسية قدرها 0.7، حقق الإطار دقة بلغت 0.87 مع تقليل الهلوسة إلى 9% (الشكل 2). تتوفر نتائج تحليل الحساسية الكاملة لقيم k التي تم تقييمها في الجدول التكميلي 2أدى رفع العتبة إلى ما بعد هذه النقطة إلى تحقيق مكاسب طفيفة فقط في الدقة، مع زيادة في زمن الاستجابة. وقد دعمت هذه الملاحظات الفرضية القائلة بأن العتبات التكيفية أكثر فعالية من حدود القرار الثابتة في التعامل مع توزيعات الثقة المتغيرة عبر الاستجابات.
كما تعكس العتبة التكيفية تباين درجات الثقة ضمن كل استجابة. فالاستجابات التي تتسم بدرجات تحقق متسقة للغاية تنتج انحرافًا معياريًا أصغر، مما يؤدي إلى حد قرار أكثر انتقائية. وفي المقابل، فإن الاستجابات التي تحتوي على ادعاءات ذات قيم ثقة غير متجانسة تعطي انحرافًا معياريًا أكبر، مما يؤدي إلى منطقة قبول أوسع ويقلل من التصحيحات غير الضرورية للادعاءات غير المؤكدة. وعلى الرغم من أن هذا السلوك التكيفي لا يمكنه القضاء على كل نتيجة إيجابية كاذبة أو سلبية كاذبة، إلا أنه يسمح لحد القرار بالاستجابة لخصائص عدم اليقين في كل استجابة بدلاً من تطبيق معيار موحد على جميع المدخلات.
تصحيح المطالبات الانتقائي وتجميع الاستجابة
تم تقديم الادعاءات التي صُنفت على أنها متناقضة فقط للتصحيح، بينما بقيت الادعاءات المدعومة والمحايدة دون تغيير. وقد قللت استراتيجية التصحيح الانتقائية هذه من عمليات إعادة التوليد غير الضرورية وحافظت على البنية الأصلية للاستجابة. وبعد التصحيح وإعادة بناء الاستجابة، انخفض معدل الهلوسة في TruthfulQA من 28% إلى 9%، وهو ما يمثل انخفاضاً نسبياً قدره 67.9%. كما لوحظت تحسينات مماثلة في FEVER، حيث انخفضت الهلوسات من 26% إلى 10%. وتُعرض مقارنات الدقة ومعدل الهلوسة عبر التكوينات التي تم تقييمها في الشكلان 3 و4، على الترتيب.
تقييم الأداء
أظهر التقييم المقارن أن الإطار المقترح حقق أعلى أداء إجمالي من بين جميع الطرق التي تم اختبارها. ففي TruthfulQA، حقق الإطار دقة بلغت 0.87 ودرجة F1 بلغت 0.85، متفوقاً بذلك على كل من التحقق القائم على العتبة الثابتة والنهج القائمة على الاتساق الذاتي (الجدول 2، الشكلين 3 و 4). وفي FEVER، حقق الإطار دقة بلغت 0.89 ودرجة F1 بلغت 0.87 (الجدول 3، الشكلين 3 و 4). وقد تم فحص المساهمة التزايدية لمكونات الإطار من خلال تحليل الاستئصال الموضح في الجدول 4. وأكدت هذه التحسينات أن دمج التحقق على مستوى الادعاء مع اتخاذ القرار الإحصائي التكيفي قد عزز الموثوقية الواقعية عبر مجموعات بيانات متعددة. وتتم مقارنة دقة اكتشاف الهلوسة لكل من SelfCheckGPT و FActScore والإطار المقترح في الشكل 5.
تحليل فترة الكمون
حافظ مسار التحقق الكامل على عبء حسابي منخفض. فقد ارتفع متوسط وقت الاستجابة من 820 ms للنموذج المرجعي إلى 980 ms للإطار العملي الكامل، مما يمثل زيادة طفيفة فقط في وقت المعالجة (الجدول 5). وقد استحوذ توليد الاستجابة على معظم زمن التأخير الإجمالي، بينما ساهمت مرحلتا التحقق والتصحيح بقدر ضئيل نسبيًا من العبء الإضافي. ويرد تفصيل وقت المعالجة على مستوى كل مرحلة في الجدول التكميلي 3. وبالمقارنة مع أنظمة التحقق القائمة على الاسترجاع، والتي تطلبت حوالي 1600 ms لكل استعلام، حقق الإطار المقترح زمن تأخير أقل بكثير مع الحفاظ على دقة واقعية مماثلة. ودعمت هذه النتائج الفرضية القائلة بأن الحد من الهلوسة يمكن تحقيقه دون التضحية بقابلية الاستخدام في الوقت الفعلي.
نظراً لأن توليد الاستجابة يعتمد على نموذج لغوي قائم على السحابة، فإن قياسات زمن الاستجابة الفردية عرضة للتقلبات بسبب ظروف الشبكة وجدولة الخادم، بدلاً من أن تكون مرتبطة بزمن تنفيذ محدد. لذا، استُخدمت القياسات المتكررة للحصول على قيم متوسطة ممثلة، مما يقلل من تأثير تباين التنفيذ العابر مع الحفاظ على المقارنات النسبية بين الطرق التي تم تقييمها. يتم تقديم قيم زمن الاستجابة كمتوسط أزمنة التنفيذ عبر جولات تجريبية متكررة. ولم يتم الاحتفاظ بقيم زمن الاستجابة الفردية لكل جولة؛ وبالتالي، تعذر إجراء حسابات لاحقة للتباين أو فترات الثقة أو غيرها من مقاييس التباين. وبناءً على ذلك، تم عرض قيم زمن الاستجابة ومقارنة السرعة والدقة في الشكل 6 كتقديرات نقطية بدون أشرطة خطأ.
وفي الختام، أظهرت النتائج أن الجمع بين استخراج الادعاءات، وتوليد المراجع المستقلة، والتحقق عبر استدلال اللغة الطبيعية، وعتبة إحصائية تكيفية، والتصحيح الانتقائي قد أدى إلى تحسين الموثوقية الواقعية لمخرجات النماذج اللغوية الكبيرة. وقد خفض هذا الإطار معدل الهلوسة من 28% إلى 9% في TruthfulQA ومن 26% إلى 10% في FEVER. وتشير النتائج إلى أن التحقق التكيفي على مستوى الادعاء قد حسن مقاييس الموثوقية الواقعية مع الحد من زيادة زمن استجابة النظام في ظل الظروف التي تم تقييمها
توفر البيانات
إن مجموعات البيانات التي تم تحليلها في هذه الدراسة متاحة للعموم من خلال مصادرها الرسمية المختصة. وتقدم المخطوطة معلومات مجموعة البيانات، وتكوينات النماذج، والتفاصيل المنهجية اللازمة لدعم تكرار التحليلات الموصوفة. كما تتوفر بيانات التقييم المعالجة والنتائج الإضافية التي تم إنتاجها أثناء الدراسة في الملفات التكميلية.

الشكل 1: سير عمل إطار التحقق التكيفي من الادعاءات. يتم تفكيك الاستجابة الأولية التي يولدها نموذج اللغة الكبير (LLM) إلى ادعاءات واقعية، يتبع ذلك توليد مراجع مستقلة، والتحقق بناءً على الاستدلال اللغوي الطبيعي (NLI)، وتسجيل الثقة، وتحديد العتبات الإحصائية. يتم الاحتفاظ بالادعاءات التي تستوفي معيار القبول، بينما تخضع الادعاءات التي تستوفي معيار التصحيح لتصحيح مستهدف قبل تجميع الاستجابة النهائية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: تأثير معامل الحساسية (k) على دقة التحقق. الدقة في TruthfulQA و FEVER عند قيم k البالغة 0.3 و 0.5 و 0.7 و 1.0. زادت الدقة مع زيادة k في كلتا مجموعتي البيانات، وتم اختيار k = 0.7 للتقييم الأساسي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: مقارنة الدقة عبر طرق التحقق. دقة نموذج LLM المرجعي، والتحقق القائم على NLI، وإطار التحقق التكيفي المقترح على TruthfulQA و FEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: مقارنة معدل الهلوسة عبر طرق التحقق. معدلات الهلوسة لنموذج LLM المرجعي (baseline)، والتحقق القائم على NLI، والإطار المقترح في TruthfulQA و FEVER. قلل الإطار المقترح المعدل من 28% إلى 9% في TruthfulQA ومن 26% إلى 10% في FEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: دقة اكتشاف الهلوسة عبر الطرق المختلفة. دقة الاكتشاف لـ SelfCheckGPT وFActScore والإطار المقترح على مجموعات بيانات TruthfulQA وFEVER. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6: المقايضة بين وقت الاستجابة والدقة عبر طرق التحقق. العلاقة بين زمن وصول الاستجابة والدقة للطرق التي تم تقييمها في TruthfulQA و FEVER، مما يوضح المقايضة بين الأداء وزمن الوصول المرتبطة بالإطار المقترح وطرق المقارنة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| مجموعة البيانات | العينات المستخدمة | المجالات | متوسط طول الاستجابة (tokens) | معدل هلوسة النموذج اللغوي الكبير (Baseline LLM) |
| TruthfulQA | 817 | 38 (العلوم، والتاريخ، والقانون، وغيرها) | 42 | 28% |
| FEVER | 1,000 | الادعاءات الواقعية العامة | 18 | 26% |
الجدول 1: خصائص مجموعة بيانات المعيار. ملخص لمجموعات بيانات TruthfulQA و FEVER المستخدمة في تطوير الإطار وتقييمه، بما في ذلك أعداد العينات، والدقة المرجعية، ومعدل الهلوسة المرجعي، ومتوسط الادعاءات لكل عينة.
| الطريقة | الدقة | الدقة | الاسترجاع | مقياس F1 (F1 Score) | نسبة الهلوسة % |
| نموذج اللغة الكبير المرجعي (استنتاج واحد) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| التحقق القائم على الاستنتاج اللغوي الطبيعي (عتبة ثابتة) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| الإطار المقترح (العتبة الإحصائية) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
الجدول 2: مقارنة الأداء على TruthfulQA.الدقة (Accuracy)، والضبط (precision)، والاسترجاع (recall)، ومقياس F1، ومعدل الهلوسة للنموذج اللغوي الكبير المرجعي (baseline LLM)، وSelfCheckGPT، وFActScore، والتحقق باستخدام NLI، والإطار المقترح.
| الطريقة | الدقة | ضبط الدقة | الاستدعاء | مقياس F1 | نسبة الهلوسة % |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Baseline LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| التحقق القائم على الاستدلال الطبيعي (NLI) (عتبة ثابتة) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| الإطار المقترح (عتبة إحصائية) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
الجدول 3: مقارنة الأداء على FEVER. الدقة (Accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1، ومعدل الهلوسة للنموذج اللغوي الكبير (LLM) المرجعي، وSelfCheckGPT، وFActScore، والتحقق عبر الاستدلال الطبيعي (NLI)، والإطار المقترح.
| الإعدادات | الدقة | الدقة | الاستدعاء | F1 (مضاف) | معدل الهلوسة |
| نموذج اللغة المرجعي | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| الخط الأساسي + الفحص الثانوي (بدون الاستدلال الطبيعي اللغوي) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| الخط الأساسي + التحقق القائم على الاستدلال اللغوي الطبيعي (عتبة ثابتة) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| الخط المرجعي + وحدة القرار الإحصائي (كاملة) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
الجدول 4: تحليل الاستئصال لمكونات إطار العمل. التغيرات في الدقة، ومقياس F1، ومعدل الهلوسة بعد الإدراج المتسلسل للتحقق الثانوي، والتحقق من الاستلزام الطبيعي (NLI)، والعتبة الإحصائية التكيفية.
| الطريقة | متوسط وقت الاستجابة (ملي ثانية) |
| النموذج اللغوي الكبير الأساسي (توليد واحد) | 820 |
| آلية التحقق الذاتي | 910 |
| إطار إحصائي مقترح | 980 |
| التحقق المعزز بالاسترجاع (RAG) | 1600 |
الجدول 5: زمن استجابة التحقق عبر طرق التحقق المختلفة. متوسط وقت الاستجابة وزمن التأخير الإضافي بالنسبة لنموذج اللغة الكبير (LLM) المرجعي لكل من التحقق الذاتي (Self-Validation)، والإطار المقترح، والتحقق المعزز بالاسترجاع.
الجدول التكميلي 1: مقارنة بين مناهج التحقق من الهلوسة. مقارنة بين الإطار المقترح والطرق الحالية من حيث الاسترجاع الخارجي، والتحقق على مستوى الادعاء، والعتبة التكيفية، والمعالجة الفعالة من حيث زمن الاستجابة.يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 2: تحليل الحساسية لمعلمة العتبة (k). تم الحصول على الدقة (Accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1، ومعدل الهلوسة عند قيم معلمة العتبة 0.3، و0.5، و0.7، و1.0. تم استخدام قيمة k = 0.7 للتقييم الأساسي.يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 3: وقت المعالجة عبر مراحل مسار التحقق. متوسط وقت التنفيذ ونسبة المساهمة في إجمالي وقت الاستجابة لكل من توليد الاستجابة الأولية، وتفكيك الادعاءات، وتوليد المراجع، واستدلال الاستدلال اللغوي الطبيعي (NLI)، والتصحيح الانتقائي.يرجى النقر هنا لتحميل هذا الملف.
الجدول التكميلي 4: توزيع الأخطاء التي تم تحديدها أثناء التحقق. عدد ونسبة السلبيات الكاذبة، والإيجابيات الكاذبة، وأخطاء التصحيح، إلى جانب فئات الهلوسة الأساسية المرتبطة بكل نوع من أنواع الأخطاء.يرجى النقر هنا لتحميل هذا الملف.