יצירת תגובה ראשונית
מודל השפה הבסיסי ייצר תשובות שוטפות ורלוונטיות מבחינה הקשרית עבור שאלות משני מאגרי נתוני הבנצ'מרק. עם זאת, בדיקה מפורטת חשפה הצהרות לא נתמכות ולא מדויקות עובדתית במספר תשובות. במאגר הנתונים TruthfulQA, המערכת הבסיסית הראתה שיעור הזיות של 28%, בעוד ששיעור הזיות של 26% נצפה במאגר הנתונים FEVER. ממצאים אלו אישרו כי יצירת שפה ישירה לבדה אינה מספיקה עבור יישומים הדורשים אמינות עובדתית גבוהה, וביססו את מצב הבסיס שביחס אליו הושוו כל הליכי האימות הבאים.
חילוץ טענות
הליך חילוץ הטענות פירק בהצלחה את התגובות שנוצרו ליחידות עובדתיות שניתן לאמת באופן עצמאי. תגובות מ-TruthfulQA הכילו בממוצע 3.2 טענות אטומיות, בעוד שדגימות מ-FEVER consisted umumnya מטענה אחת בלבד. תהליך הפירוק בידל טענות עובדתיות מבלי להוסיף מידע נוסף, מה שאיפשר להעריך כל הצהרה בנפרד. תצפית זו תמכה בהשערה שאימות ברמת הטענה מספק דיוק רב יותר מאשר הערכה של תגובות שלמות כיחידה אחת.
בניית רפרנס עצמאי
הפניות עצמאיות הופקו עבור כל טענה שחולצה באמצעות תהליך הסקת מסקנות נפרד, שהותנה אך ורק בשאילתה המקורית. ההפניות שהופקו סיפקו תיאורים עובדתיים תמציתיים שהיו שונים מספיק מהתגובות המקוריות כדי לשמש כמקורות אימות עצמאיים. תהליך הפקת ההפניות הופרד מהתגובה הראשונית כדי למנוע התניה ישירה של ההפניה העובדתית על פלט קודם של המודל. הפרדה זו נועדה להפחית הטיות אישור פוטנציאליות ולספק בסיס מבוקר לאימות הבא ברמת הטענה; המחקר אינו מכמת באופן עצמאי את היקפו של אפקט זה. ההפקה המוצלחת של הפניות עצמאיות תמכה בעקרון התכנון המוצע של הפרדת שליפת הידע מיצירת התגובה.
אימות הסקה בשפה טבעית
שלב אימות ה-NLI סיווג ביעילות זוגות של טענה-מקור לקטגוריות של גרירה (entailment), סתירה וניטרליות. טענות סותרות קיבלו בעקביות ציוני אימות שליליים, בעוד שטענות נתמכות עובדתית קיבלו ציונים חיוביים. סיווגים ניטרליים הוקצו לטענות שעבורן לא היה זמין מספיק ראיות תומכות. התנהגות זו הוכיחה כי הסקה סמנטית יכולה לזהות באופן מהימן הצהרות עובדתיות לא נתמכות, וסיפקה את הראיות הנדרשות לתיקון ממוקד. בהשוואה לאסטרטגיה פשוטה של בדיקת עקביות, אימות NLI הפחית את שיעור ההזיות (hallucinations) מ-20% ל-15%, דבר המעיד על יכולת זיהוי משופרת.
סף סטטיסטי אדפטיבי
יישום של סף סטטיסטי אדפטיבי שיפר עוד יותר את ביצועי האימות על ידי התאמה דינמית של גבולות ההחלטה בהתבסס על התפלגות מדד הביטחון של כל תגובה. ניתוח רגישות של הסף הדגים כי הביצועים השתפרו ככל שפרמטר הסף עלה מ-0.3 ל-0.7. בערך רגישות של 0.7, המסגרת השיגה דיוק של 0.87 תוך הפחתת ההזיות ל-9% (איור 2). תוצאות ניתוח הרגישות המלאות עבור ערכי k שנבחנו מופיעות ב-טבלה נספחת 2. הגדלת הסף מעבר לנקודה זו הניבה שיפורים מינוריים בלבד בדיוק, בעוד שהיא הגבירה את השיהוי (latency). תצפיות אלו תמכו בהיפותזה שספים אדפטיביים יעילים יותר מגבולות החלטה קבועים לטיפול בהתפלגויות ביטחון משתנות בין תגובות שונות.
הסף האדפטיבי משקף גם את השונות של מדדי הביטחון בתוך כל תגובה. תגובות עם ציוני אימות עקביים מאוד מניבות סטיית תקן קטנה יותר, מה שמוביל לגבול החלטה סלקטיבי יותר. לעומת זאת, תגובות המכילות טענות עם ערכי ביטחון הטרוגניים מניבות סטיית תקן גדולה יותר, מה שמוביל לאזור קבלה רחב יותר ומפחית תיקונים מיותרים עבור טענות לא ודאיות. אף על פי שהתנהגות אדפטיבית זו אינה יכולה לבטל כל תוצאה חיובית שגויה (false positive) או שלילית שגויה (false negative), היא מאפשרת לגבול ההחלטה להגיב למאפייני האי-ודאות של כל תגובה במקום להחיל קריטריון אחיד על כל הקלטים.
תיקון סלקטיבי של תביעות והרכבת תגובה
רק טענות שזוהו כסותרות הוגשו לתיקון, בעוד שטענות נתמכות וניטרליות נשמרו ללא שינוי. אסטרטגיית תיקון סלקטיבית זו צמצמה רגנרציה מיותרת ושימרה את המבנה המקורי של התגובה. בעקבות התיקון ושחזור התגובה, שיעור ההזיות ב-TruthfulQA ירד מ-28% ל-9%, מה שמהווה הפחתה יחסית של 67.9%. שיפורים דומים נצפו ב-FEVER, שם שיעור ההזיות ירד מ-26% ל-10%. השוואות של הדיוק ושיעור ההזיות בין התצורות שנבחנו מוצגות ב- איורים 3 ו-4בהתאמה.
הערכת ביצועים
הערכה השוואתית הראתה כי המסגרת המוצעת השיגה את הביצועים הכוללים הגבוהים ביותר מבין כל השיטות שנבדקו. ב-TruthfulQA, המסגרת השיגה דיוק של 0.87 וציון F1 של 0.85, ובכך עלתה בביצועיה הן על אימות מבוסס סף קבוע והן על גישות מבוססות עקביות עצמית (טבלה 2, איורים 3 ו-4). ב-FEVER, המסגרת השיגה דיוק של 0.89 וציון F1 של 0.87 (טבלה 3, איורים 3 ו-4). התרומה ההדרגתית של רכיבי המסגרת נבחנת באמצעות ניתוח הבלבציה (ablation analysis) המוצג בטבלה 4. שיפורים אלו אישרו כי שילוב של אימות ברמת הטענה עם קבלת החלטות סטטיסטית אדפטיבית שיפר את המהימנות העובדתית על פני מספר מאגרי נתונים. דיוק זיהוי ההזיות (hallucination-detection) עבור SelfCheckGPT, FActScore והמסגרת המוצעת מושווה באיור 5.
ניתוח זמן השהיה
צינור האימות המלא שמר על תקורה חישובית נמוכה. זמן התגובה הממוצע עלה מ-820 ms עבור מודל הבסיס ל-980 ms עבור המסגרת המלאה, מה שמהווה עלייה מתונה בלבד בזמן העיבוד (Table 5). יצירת התגובה הייתה אחראית למרבית השהיית הסך הכל, בעוד ששלבי האימות והתיקון תרמו תקורה נוספת מועטה יחסית. פירוט זמן העיבוד ברמת השלב מופיע ב-Supplementary Table 3. בהשוואה למערכות אימות מבוססות אחזור, שדרשו כ-1600 ms לכל שאילתה, המסגרת המוצעת השיגה השהיה נמוכה משמעותית תוך שמירה על דיוק עובדתי דומה. ממצאים אלו תמכו בהשערה שניתן להשיג הפחתה בהזיות ללא פגיעה בישימות בזמן אמת.
מאחר שיצירת התגובה נסמכת על מודל שפה מבוסס ענן, מדידות השהיה (latency) בודדות נתונות לתנודות עקב תנאי רשת ותזמון בצד השרת, ולא לזמן ביצוע דטרמיניסטי. לכן, נעשה שימוש במדידות חוזרות כדי לקבל ערכי ממוצע מייצגים, ובכך הופחת השפעתה של שונות זמנית בביצוע תוך שימור ההשוואות היחסיות בין השיטות שנבחנו. ערכי השהיה מדווחים כזמני ביצוע ממוצעים על פני הרצות ניסיוניות חוזרות. ערכי השהיה בודדים לכל הרצה לא נשמרו; לפיכך, לא היה ניתן לבצע חישוב post hoc של שונות, רווחי סמך או מדדי שונות אחרים. בהתאם לכך, ערכי השהיה וההשוואה בין מהירות לדיוק ב-איור 6 מוצגים כהערכות נקודתיות ללא פסי שגיאה.
לסיכום, התוצאות הדגימו כי שילוב של חילוץ טענות, יצירת מקורות עצמאית, אימות באמצעות הסקת מסקנות בשפה טבעית (Natural Language Inference), סף סטטיסטי אדפטיבי ותיקון סלקטיבי שיפרו את המהימנות העובדתית של פלטי מודלי שפה גדולים. המסגרת הפחיתה את שיעור ההזיות מ-28% ל-9% ב-TruthfulQA ומ-26% ל-10% ב-FEVER. התוצאות מעידות כי אימות אדפטיבי ברמת הטענה שיפר את מדדי המהימנות העובדתית תוך הגבלת השהיית התגובה הנוספת תחת התנאים שנבחנו
זמינות נתונים
מערכי הנתונים שנותחו במחקר זה זמינים לציבור דרך המקורות הרשמיים שלהם. כתב היד מספק את המידע על מערכי הנתונים, את תצורות המודלים ואת הפרטים המתודולוגיים הדרושים לתמיכה בשחזור של הניתוחים המתוארים. נתוני הערכה מעובדים ותוצאות משלימות שהופקו במהלך המחקר מופיעים בקבצים המשלימים.

איור 1: זרימת העבודה של מסגרת אימות הטענות האדפטיבית. תגובה ראשונית שנוצרה על ידי LLM מפורקת לטענות עובדתיות, ולאחריה ביצוע יצירת מקורות עצמאית, אימות מבוסס NLI, ניקוד ביטחון וסף סטטיסטי. טענות העומדות בקריטריון הקבלה נשמרות, בעוד שטענות העומדות בקריטריון התיקון עוברות תיקון ממוקד לפני הרכבת התגובה הסופית. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 2: השפעת פרמטר הרגישות (k) על דיוק האימות. דיוק ב-TruthfulQA וב-FEVER עבור ערכי k של 0.3, 0.5, 0.7 ו-1.0. הדיוק עלה עם עליית k בשני מאגרי הנתונים, כאשר k = 0.7 נבחר להערכה הראשית. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 3: השוואת דיוק בין שיטות אימות שונות. דיוק של ה-LLM בשיטת הבסיס, אימות מבוסס NLI ומסגרת האימות האדפטיבית המוצעת על TruthfulQA ו-FEVER. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 4: השוואת שיעורי הזיות בין שיטות אימות שונות. שיעורי הזיות עבור ה-LLM בסיסי (baseline), אימות מבוסס NLI, והמסגרת המוצעת ב-TruthfulQA וב-FEVER. המסגרת המוצעת הפחיתה את השיעור מ-28% ל-9% ב-TruthfulQA ומ-26% ל-10% ב-FEVER. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 5: דיוק זיהוי הזיות בשיטות שונות. דיוק הזיהוי של SelfCheckGPT, FActScore והמסגרת המוצעת במאגרי הנתונים TruthfulQA ו-FEVER. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 6: הפשרה בין זמן התגובה לדיוק בשיטות אימות שונות. הקשר בין השהיית התגובה לבין הדיוק עבור השיטות שנבחנו ב-TruthfulQA וב-FEVER, המדגים את הפשרת הביצועים-שהייה הקשורה למסגרת המוצעת ולגישות ההשוואה. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.
| סט נתונים | דגימות שנעשה בהן שימוש | תחומים | אורך תגובה ממוצע (tokens) | שיעור הזיות של מודל שפה גדול (LLM) בנקודת הייחוס |
| TruthfulQA | 817 | 38 (מדע, היסטוריה, משפט וכו') | 42 | 28% |
| FEVER | 1,000 | טענות עובדתיות כלליות | 18 | 26% |
טבלה 1: מאפייני מערך הנתונים הייחוס. סיכום של מערכי הנתונים TruthfulQA ו-FEVER ששימשו לפיתוח ולהערכה של המסגרת, כולל מספר הדגימות, דיוק הבסיס, שיעור ההזיות בבסיס ומספר הטענות הממוצע לדגימה.
| שיטה | דיוק | דיוק | הסמקה (Recall) | מדד F1 | % הזיות |
| מודל שפה גדול (LLM) בסיסי (הסקה בודדת) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| אימות מבוסס NLI (סף קבוע) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| מסגרת מוצעת (סף סטטיסטי) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
טבלה 2: השוואת ביצועים ב-TruthfulQA. דיוק (Accuracy), רגישות (Precision), כושר זיהוי (Recall), מדד F1 ושיעור הזיות עבור ה-LLM הבסיסי, SelfCheckGPT, FActScore, אימות NLI והמסגרת המוצעת.
| שיטה | דיוק (Accuracy) | דיוק (Precision) | רגישות (Recall) | מדד F1 | % הזיות (Hallucination) |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Baseline LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| אימות מבוסס NLI (סף קבוע) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| המסגרת המוצעת (סף סטטיסטי) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
טבלה 3: השוואת ביצועים ב-FEVER. דיוק (Accuracy), רמת דיוק (precision), רגישות (recall), מדד F1 ושיעור הזיות עבור מודל ה-LLM הבסיסי, SelfCheckGPT, FActScore, אימות NLI והמסגרת המוצעת.
| תצורה | דיוק | דיוק | הסליקה (Recall) | F1 (נוסף) | שיעור הזיות |
| מודל שפה בסיסי | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| קו בסיס + בדיקה משנית (ללא NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| קו בסיס + אימות מבוסס NLI (סף קבוע) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| קו הבסיס + מודול לקבלת החלטות סטטיסטיות (מלא) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
טבלה 4: ניתוח אבלציה (Ablation analysis) של רכיבי התשתית. שינויים בדיוק, במדד F1 ובשיעור ההזיות בעקבות שילוב רצפי של אימות משני, אימות NLI וסף סטטיסטי אדפטיבי.
| שיטה | זמן תגובה ממוצע (ms) |
| מודל שפה גדול (LLM) בסיסי (יצירה בודדת) | 820 |
| מנגנון אימות עצמי | 910 |
| מסגרת סטטיסטית מוצעת | 980 |
| אימות מוגבר באחזור (RAG) | 1600 |
טבלה 5: השהיית תגובה בין שיטות אימות שונות. זמן תגובה ממוצע והשהיה נוספת ביחס ל-LLM הבסיס עבור Self-Validation, המסגרת המוצעת, ואימות מוגבר באמצעות אחזור (retrieval-augmented verification).
טבלה נלווית 1: השוואה בין גישות לאימות הזיות. השוואה בין המסגרת המוצעת לשיטות קיימות במונחים של שליפה חיצונית, אימות ברמת הטענה, סף אדפטיבי ועיבוד יעיל מבחינת השהיה.אנא לחצו כאן להורדת קובץ זה.
טבלה נלווית 2: ניתוח רגישות של פרמטר הסף (k). דיוק (Accuracy), דיוק חזרתי (precision), רגישות (recall), מדד F1 ושיעור הזיות (hallucination rate) התקבלו בערכי פרמטר סף של 0.3, 0.5, 0.7 ו-1.0. ערך של k = 0.7 שימש להערכה הראשית.אנא לחצו כאן להורדת קובץ זה.
טבלה נלווית 3: זמן עיבוד בשלבים השונים של צינור האימות. זמן ביצוע ממוצע ואחוז התרומה של יצירת תגובה ראשונית, פירוק טענות, יצירת מקורות ייחוס, הסקת NLI ותיקון סלקטיבי לזמן התגובה הכולל.אנא לחץ כאן להורדת קובץ זה.
טבלה נלווית 4: התפלגות השגיאות שזוהו במהלך האימות. מספר ואחוז השליליים השגויים, החיוביים השגויים ושגיאות התיקון, יחד עם קטגוריות ההזיות העיקריות הקשורות לכל סוג שגיאה.אנא לחץ כאן להורדת קובץ זה.