יצירת תגובה ראשונית
מודל השפה הבסיסי ייצר תשובות רהוטות ורלוונטיות מבחינה הקשרית לשאלות משני מאגרי נתוני הבנצ'מרק. עם זאת, בדיקה מפורטת חשפה הצהרות לא מבוססות ולא מדויקות עובדתית במספר תגובות. במערך הנתונים TruthfulQA, המערכת הבסיסית הראתה שיעור הזיות של 28%, בעוד שבמערך הנתונים FEVER נצפה שיעור הזיות של 26%. ממצאים אלו אישרו כי יצירת שפה ישירה בלבד אינה מספיקה ליישומים הדורשים אמינות עובדתית גבוהה, והגדירו את מצב הבסיס שביחס אליו הושוו כל הליכי האימות הבאים.
חילוץ טענות
תהליך חילוץ הטענות פירק בהצלחה את התגובות שהופקו ליחידות עובדתיות הניתנות לאימות באופן עצמאי. תגובות מ-TruthfulQA הכילו בממוצע 3.2 טענות אטומיות, בעוד שדגימות מ-FEVER consisted generally מטענה אחת בלבד. תהליך הפירוק בידל טענות עובדתיות מבלי להוסיף מידע נוסף, מה שאפשר להעריך כל הצהרה בנפרד. תצפית זו תמכה בהיפותזה כי אימות ברמת הטענה מספק דיוק גבוה יותר מאשר הערכת תגובות שלמות כיחידה אחת.
בנייה עצמאית של רפרנס
מקורות סימוכין עצמאיים הופקו עבור כל טענה שהוצאה באמצעות תהליך הסקה נפרד, שהתנהל בהתבסס על השאילתה המקורית בלבד. המקורות שהופקו סיפקו תיאורים עובדתיים תמציתיים שהיו שונים דיו מהתגובות המקוריות כדי לשמש כמקורי אימות עצמאיים. תהליך הפקת המקורות היה מבודד מהתגובה הראשונית כדי למנוע התניה ישירה של הסימוכין העובדתיים על פלט קודם של המודל. הפרדה זו נועדה להפחית הטיות אישור פוטנציאליות ולספק בסיס מבוקר לאימות עוקב ברמת הטענה; המחקר אינו מכמת באופן עצמאי את היקף השפעה זו. ההפקה המוצלחת של מקורות סימוכין עצמאיים תמכה בעקרון העיצוב המוצע של הפרדת שליפת הידע מיצירת התגובה.
אימות הסקת מסקנות בשפה טבעית
שלב האימות של ה-NLI סיווג ביעילות זוגות של טענה-מקור לקטגוריות של גרירה (entailment), סתירה וניטרליות. טענות סותרות קיבלו באופן עקבי ציוני אימות שליליים, בעוד שטענות נתמכות עובדתית קיבלו ציונים חיוביים. סיווגים ניטרליים הוקצו לטענות שעבורן לא היה זמין מספיק ראיות תמיכה. התנהגות זו הוכיחה כי הסקה סמנטית יכולה לזהות באופן מהימן הצהרות עובדתיות שאינן נתמכות, וסיפקה את הראיות הנדרשות לתיקון ממוקד. בהשוואה לאסטרטגיה פשוטה של בדיקת עקביות, אימות ה-NLI הפחית את שיעור ההזיות (hallucination rate) מ-20% ל-15%, מה שמעיד על יכולת זיהוי משופרת.
סף סטטיסטי אדפטיבי
היישום של סף סטטיסטי אדפטיבי שיפר עוד יותר את ביצועי האימות על ידי התאמה דינמית של גבולות ההחלטה בהתבסס על התפלגות מדד הביטחון של כל תגובה. ניתוח רגישות הסף הראה כי הביצועים השתפרו ככל שפרמטר הסף עלה מ-0.3 ל-0.7. בערך רגישות של 0.7, המסגרת השיגה דיוק של 0.87 תוך הפחתת ההזיות ל-9% (איור 2). תוצאות ניתוח הרגישות המלאות עבור ערכי k שנבדקו מופיעות ב-טבלה נלווית 2. העלאת הסף מעבר לנקודה זו הניבה שיפורים מינוריים בלבד בדיוק, בעוד שהשהיית התגובה גברה. תצפיות אלו תמכו בהשערה שספים אדפטיביים יעילים יותר מגבולות החלטה קבועים לטיפול בהתפלגויות ביטחון משתנות בין תגובות שונות.
הסף האדפטיבי משקף גם את השונות של מדדי הביטחון בתוך כל תגובה. תגובות עם מדדי אימות עקביים מאוד מייצרות סטיית תקן קטנה יותר, מה שמוביל לגבול החלטה סלקטיבי יותר. לעומת זאת, תגובות המכילות טענות עם ערכי ביטחון הטרוגניים מניבות סטיית תקן גדולה יותר, מה שמוביל לאזור קבלה רחב יותר ומפחית תיקונים מיותרים עבור טענות לא ודאיות. אף על פי שהתנהגות אדפטיבית זו אינה יכולה להעלים כל תוצאה חיובית כוזבת או שלילית כוזבת, היא מאפשרת לגבול ההחלטה להגיב למאפייני האי-ודאות של כל תגובה במקום להחיל קריטריון אחיד על כל הקלטים.
תיקון סלקטיבי של טענות והרכבת תגובה
רק טענות שזוהו כסותרות הוגשו לתיקון, בעוד שטענות נתמכות ונטרליות נשמרו ללא שינוי. אסטרטגיית תיקון סלקטיבית זו צמצמה רגנרציה מיותרת ושימרה את המבנה המקורי של התגובה. לאחר התיקון ושחזור התגובה, שיעור ההזיות (hallucination rate) במערך TruthfulQA ירד מ-28% ל-9%, מה שמהווה הפחתה יחסית של 67.9%. שיפורים דומים נצפו ב-FEVER, שם ירדו ההזיות מ-26% ל-10%. השוואות של הדיוק ושיעור ההזיות בין התצורות שנבחנו מוצגות ב- איורים 3 ו-4בהתאמה.
הערכת ביצועים
הערכה השוואתית הראתה כי המסגרת המוצעת השיגה את הביצועים הכוללים הגבוהים ביותר מבין כל השיטות שנבדקו. ב-TruthfulQA, המסגרת השיגה דיוק של 0.87 וציון F1 של 0.85, תוך עקיפה הן של אימות עם סף קבוע והן של גישות המבוססות על עקביות עצמית (Table 2, Figures 3 and 4). ב-FEVER, המסגרת השיגה דיוק של 0.89 וציון F1 של 0.87 (Table 3, Figures 3 and 4). התרומה המצטברת של רכיבי המסגרת נבחנת באמצעות ניתוח האבלציה המוצג ב-Table 4. שיפורים אלו אישרו כי שילוב של אימות ברמת הטענה עם קבלת החלטות סטטיסטית אדפטיבית שיפר את המהימנות העובדתית על פני מספר מערכי נתונים. דיוק זיהוי הזיות עבור SelfCheckGPT, FActScore והמסגרת המוצעת מושווה ב-Figure 5.
ניתוח זמן השהיה
צינור האימות המלא שמר על תקורה חישובית נמוכה. זמן התגובה הממוצע עלה מ-820 מילי-שניות עבור מודל הבסיס ל-980 מילי-שניות עבור המסגרת המלאה, מה שמייצג רק עלייה צנועה בזמן העיבוד (טבלה 5יצירת התגובה היוותה את מרבית השיהוי הכולל, בעוד ששלבי האימות והתיקון תרמו מעט מאוד תקורה נוספת. פירוט זמני העיבוד ברמת השלב מוצג ב- טבלה נלווית 3בהשוואה למערכות אימות מבוססות שליפה, שדרשו כ-1600 מילי-שניות לכל שאילתה, המסגרת המוצעת השיגה השהיה נמוכה באופן משמעותי תוך שמירה על דיוק עובדתי דומה. ממצאים אלו תמכו בהשערה שניתן להשיג הפחתה של הזיות (hallucinations) מבלי להתפשר על שמישות בזמן אמת.
מכיוון שיצירת התגובה מסתמכת על מודל שפה מבוסס ענן, מדידות השהיה (latency) בודדות כפופות לתנודות הנובעות מתנאי הרשת ומשיבוץ בצד השרת, ולא לזמן ביצוע דטרמיניסטי. לפיכך, נעשה שימוש במדידות חוזרות כדי לקבל ערכי ממוצע מייצגים, ובכך הופחתת השפעתה של שונות ביצוע חולפת תוך שמירה על השוואות יחסיות בין השיטות שנבחנו. ערכי השהיה מדווחים כזמני ביצוע ממוצעים על פני הרצות ניסוי חוזרות. ערכי השהיה בודדים לכל הרצה לא נשמרו; לפיכך, חישוב בדיעבד (post hoc) של שונות, רווחי סמך או מדדי שונות אחרים לא היה אפשרי. בהתאם לכך, ערכי השהיה וההשוואה בין מהירות לדיוק ב-איור 6 מוצגים כהערכות נקודתיות ללא פסי שגיאה.
לסיכום, התוצאות הוכיחו כי שילוב של חילוץ טענות, יצירת מקורות ייחוס עצמאיים, אימות באמצעות הסקה בשפה טבעית (Natural Language Inference), סף סטטיסטי אדפטיבי ותיקון סלקטיבי שיפר את האמינות העובדתית של פלטי מודלי שפה גדולים. המסגרת הפחיתה את שיעור ההזיות מ-28% ל-9% ב-TruthfulQA ומ-26% ל-10% ב-FEVER. התוצאות מעידות כי אימות אדפטיבי ברמת הטענה שיפר את מדדי האמינות העובדתית, תוך הגבלה של השהיית התגובה הנוספת תחת התנאים שנבדקו
זמינות נתונים
מערכי הנתונים שנותחו במחקר זה זמינים לציבור דרך המקורות הרשמיים שלהם. כתב היד מספק את המידע על מערכי הנתונים, את הגדרות המודלים ואת הפרטים המתודולוגיים הדרושים כדי לאפשר שחזור של הניתוחים המתוארים. נתוני הערכה מעובדים ותוצאות משלימות שהופקו במהלך המחקר מופיעים בקובצי ההשלמה.

איור 1: זרימת העבודה של מסגרת אימות הטענות האדפטיבית. תגובה ראשונית שנוצרה על ידי LLM מפורקת לטענות עובדתיות, ולאחר מכן מתבצעו יצירת מקורות עצמאית, אימות מבוסס NLI, דירוג ביטחון וסינון באמצעות סף סטטיסטי. טענות העומדות בקריטריון הקבלה נשמרות, בעוד שטענות העומדות בקריטריון התיקון עוברות תיקון ממוקד לפני הרכבת התגובה הסופית. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 2: השפעת פרמטר הרגישות (k) על דיוק האימות. דיוק ב-TruthfulQA וב-FEVER עבור ערכי k של 0.3, 0.5, 0.7 ו-1.0. הדיוק עלה עם הגדלת k בשני המאגרי נתונים, כאשר k = 0.7 נבחר להערכה הראשית. אנא לחצו כאן להצגת גרסה גדולה יותר של איור זה.

איור 3: השוואת דיוק בין שיטות אימות שונות. דיוק של מודל השפה הגדול (LLM) הבסיסי, אימות מבוסס NLI, ומסגרת האימות האדפטיבית המוצעת על גבי TruthfulQA ו-FEVER. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 4: השוואת שיעור הזיות בין שיטות אימות שונות. שיעורי הזיות עבור ה-LLM הבסיסי, אימות מבוסס NLI והמסגרה המוצעת ב-TruthfulQA וב-FEVER. המסגרה המוצעת הפחיתה את השיעור מ-28% ל-9% ב-TruthfulQA ומ-26% ל-10% ב-FEVER. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 5: דיוק זיהוי הזיות בין שיטות שונות. דיוק הזיהוי של SelfCheckGPT, FActScore והמסגרת המוצעת ב-TruthfulQA וב-FEVER. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 6: פשרה בין זמן תגובה לדיוק בשיטות אימות שונות. הקשר בין השהיית התגובה לדיוק עבור השיטות שנבחנו ב-TruthfulQA וב-FEVER, הממחיש את הפשרה בין הביצועים להשהיה הקשורה למסגרת המוצעת ולגישות ההשוואה. אנא לחצו כאן להצגת גרסה גדולה יותר של איור זה.
| סט של נתונים | דגימות שנעשה בהן שימוש | תחומים | אורך תגובה ממוצע (אסימונים) | שיעור הזיות בסיסי של מודלי שפה גדולים (LLM) |
| TruthfulQA | 817 | 38 (מדע, היסטוריה, משפט וכו') | 42 | 28% |
| חום | 1,000 | טענות עובדתיות כלליות | 18 | 26% |
טבלה 1: מאפייני מערך הנתונים הייחוס. סיכום של מערכי הנתונים TruthfulQA ו-FEVER ששימשו לפיתוח ולהערכה של המסגרת, כולל מספר הדגימות, דיוק הבסיס, שיעור הזיות הבסיס ומספר טענות ממוצע לדגימה.
| שיטה | דיוק (Accuracy) | דיוק (Precision) | רגישות (Recall) | ציון F1 | % הזיות (Hallucination) |
| LLM בסיסי (הסקה בודדת) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| אימות מבוסס NLI (סף קבוע) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| המסגרה המוצעת (סף סטטיסטי) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
טבלה 2: השוואת ביצועים ב-TruthfulQA. דיוק (Accuracy), רגישות (precision), כושר השבה (recall), מדד F1 ושיעור הזיות עבור ה-LLM הבסיסי, SelfCheckGPT, FActScore, אימות NLI והמסגרת המוצעת.
| שיטה | דיוק (Accuracy) | דיוק (Precision) | רגישות (Recall) | מדד F1 | % הזיות (Hallucination) |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Baseline LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| אימות מבוסס NLI (סף קבוע) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| המסגרת המוצעת (סף סטטיסטי) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
טבלה 3: השוואת ביצועים ב-FEVER. דיוק (Accuracy), דיוק חזוי (precision), רגישות (recall), מדד F1 ושיעור הזיות עבור ה-LLM הבסיסי, SelfCheckGPT, FActScore, אימות NLI והמסגרה המוצעת.
| תצורה | דיוק | דיוק | רהיקה (Recall) | F1 (נוסף) | שיעור הזיות |
| מודל שפה בסיסי | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| קו בסיס + בדיקה משנית (ללא NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| קווי בסיס + אימות מבוסס NLI (סף קבוע) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| בסיס + מודול החלטה סטטיסטי (מלא) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
טבלה 4: ניתוח השפעת רכיבי התשתית (Ablation analysis). שינויים בדיוק, במדד F1 ובשיעור ההזיות בעקבות שילוב רצוף של אימות משני, אימות NLI וסף סטטיסטי אדפטיבי.
| שיטה | זמן תגובה ממוצע (ms) |
| LLM בסיסי (יצירה בודדת) | 820 |
| מנגנון תיקוף עצמי | 910 |
| המסגרת הסטטיסטית המוצעת | 980 |
| אימות מוגבר באחזור (RAG) | 1600 |
טבלה 5: השהיית תגובה בין שיטות האימות השונות. זמן תגובה ממוצע והשהיה נוספת ביחס ל-LLM הבסיסי עבור Self-Validation, המסגרת המוצעת, ואימות מוגבר באמצעות אחזור (retrieval-augmented verification).
טבלה משלימה 1: השוואה בין גישות לאימות הזיות. השוואה בין המסגרת המוצעת לשיטות קיימות במונחים של שליפה חיצונית, אימות ברמת הטענה, סף סתגלני ועיבוד יעיל מבחינת השהייה.אנא לחץ כאן כדי להוריד קובץ זה.
טבלה משלימה 2: ניתוח רגישות של פרמטר הסף (k). מדדי הדיוק (Accuracy), הדיוק (Precision), recall, ציון F1 ושיעור ההזיות (hallucination rate) התקבלו עבור ערכי פרמטר הסף 0.3, 0.5, 0.7 ו-1.0. ערך של k = 0.7 שימש להערכה הראשונית.אנא לחצו כאן להורדת קובץ זה.
טבלה משלימה 3: זמן עיבוד לאורך שלבי צינור האימות. זמן ביצוע ממוצע ואחוז התרומה של יצירת תגובה ראשונית, פירוק טענות, יצירת הפניות, הסקת NLI ותיקון סלקטיבי לזמן התגובה הכולל.אנא לחצו כאן להורדת קובץ זה.
טבלה משלימה 4: התפלגות השגיאות שזוהו במהלך האימות. מספר ואחוז השליליים השקריים, החיוביים השקריים ושגיאות התיקון, יחד עם קטגוריות ההזיות העיקריות הקשורות לכל סוג שגיאה.אנא לחצו כאן להורדת קובץ זה.