Research Article

כיוונון מדויק של מודלים גדולים של שפה באמצעות אינדקס הזיות של ישויות לסיכום טקסט

DOI:

10.3791/68962

January 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

אנו מציעים גישה מדויקת מבוססת חיזוק-למידה עבור מודלים לשוניים גדולים, המשתמשת במדד ההזיה של אנטי (EHI) כאות תגמול להפחתת הזיות ברמת הישות בסיכום טקסט. ניסויים על תמלולי פגישות מראים ששיטה זו משפרת את נאמנות ודיוק הישויות.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

התקדמות אחרונה במודלים לשוניים גדולים (LLMs) הובילה לשיפורים ניכרים באיכות הסיכום המופשט. עם זאת, הזיות – במיוחד הזיות ברמת ישות שבהן מוצגות ישויות שאינן קיימות או לא נכונות – נותרת אתגר קריטי. בעבודה זו, אנו מציעים מסגרת כוונון עדין מונעת תגמול למודלים של סיכום באמצעות מדד הזיות ישות (EHI) כמדד מנחה. המתודולוגיה כאן מתחילה ביצירת סיכומים ראשוניים ממודלים מאומנים מראש כמו Flan-T5, DistilBART ו-Mistral (או LLM פופולרי אחר) על מערכי נתונים מובנים של תמלול, XSUM. אנו מחשבים EHI על ידי חילוץ ישויות עם שם הן מסיכומים שנוצרו והן ממקורות זהב, הערכת דיוק וענישה על ישויות מזויפות. תהליך הכוונון המדויק מונחה על ידי למידה מחזקת, כאשר EHI משמש כאות התגמול. אנו מאמצים מנגנון עדכון בסגנון REINFORCE כדי לאופטימיזציה את מודל הסיכום לקראת מקסום נאמנות הישויות. ניסויים מראים שמודלים שמכוונים בעדינות עם EHI משיגים שיעורי הזיה נמוכים יותר מבלי לפגוע במידע אינפורמטיבי. יתרה מזאת, אנו מראים שמודלים מונחי EHI מכלילים טוב יותר במשימות סיכום מחוץ לתחום, מה שמרמז על עמידות מוגברת. הגישה כאן מציעה כיוון מעשי לשיפור העובדות בסיכום, תוך הדגשת התפקיד הקריטי של ייצוג ישות מדויק.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מודלים של סיכום מופשט, המופעלים על ידי מודלים לשוניים גדולים (LLMs), השיגו תוצאות מרשימות בתחומים שונים. עם זאת, אתגר מתמשך נותר הזיות, שבה סיכומים שנוצרים כוללים מידע שגוי או מזויף שאינו מבוסס על קלט המקור 1,2. ביישומים בעלי סיכון גבוה כמו סיכום פגישות, דיווח רפואי או תיעוד פיננסי, הזיות, במיוחד עם ישויות שמות, עלולות לערער משמעותית את האמינות והתועלת3.

R esearchersערכו הערכה אנושית רחבת היקף ומצאו שסיכומים יוצרים לעיתים קרובות הזיות – תוכן שאינו מגובה במסמך המקור – ושההזיות הללו מתואמות עם חזרה ואי-קוהרנטיות1. מחקר נוסף הראה שמודלים עם מופשטות גבוהה יותר נוטים להיות פחות נאמנים; המחקר שלהם דיווח שפלטים עם יותר הפשטה היו בעלי דיוק עובדתי נמוך יותר ומשפטים לא נאמניםיותר. 2. מדד FRANK דיווח שכ-30% מהסיכומים מכילים סתירות עובדתיות, ומחקר פופולרי נוסף ציין שיעורי טעויות דומים, וטען שרמות גבוהות של הזיות הופכות את הסיכומים לכמעט חסרי תועלת 1,2. הזיות יכולות להיות מסווגות כפנימיות (סותרות את המקור) או חיצוניות (לא ניתנות לאימות מהמקור). מדריך על הזיות בסיכום מופשט מסביר שהזיות פנימיות מתרחשות כאשר תוכן שנוצר סותר את הקלט (למשל, דיווח שגוי על חיסון מאושר כנדחה), בעוד שהזיות חיצוניות מוסיפות עובדות בלתי ניתנות לאימות, כמו טענה לניסויים קליניים לחיסון שאינם מוזכרים4. הוא גם דיווח כי מסכמים מתקדמים מייצרים תוכן הזייתי בכ-25% מהתוצרים שלהם כאשר הם מוערכים עם ROUGE, BLEU ו-METEOR, ומזהיר כי הזיות עלולות להיות מזיקות בתחומים כמו בריאות, חוק או סייבר.

מדדים מסורתיים של n-גרם (ROUGE5, BLEU, METEOR) מתואמים בצורה לקויה עם שיפוטי העובדות האנושיים, מה שהוביל לפיתוח מדדים מבוססי ייחוס וללא רפרנס6. מדדים מבוססי QA כמו FEQA ו-QuestEval מעריכים סיכומים על ידי שאלה האם זוגות שאלה-תשובות שמקורם בסיכום ניתנים למענה באמצעות טקסט המקור. FEQA מתואמת יותר עם שיפוטים אנושיים ומראה שסיכומים מופשטים יותר נוטים להיות פחות נאמנים, בעוד ש-QuestEval משפרת משמעותית את הקורלציה עם שיפוטים אנושיים בעקביות, קוהרנטיות, שטף ורלוונטיות. QAFactEval משפר גישה זו על ידי בחירת תשובות במונחי שם עצם ויצירת שאלות לפני התשובה; אסטרטגיה זו משפרת את הקורלציה עם הערכות אנושיות לפי מדד SummaC. מדדי חילוץ מידע (IE) מייצגים ידע כזוגות של נושא-יחסי-אובייקט, אך הם פגיעים לשגיאות בתהליך החילוץ. מדדי הסקה בשפה טבעית (NLI) — כגון FactCC ו-SummaC — מסווגים משפטי סיכום כפי שנכללו או סותרו על ידי המקור4. FactCC משתמש בנתונים מפוקחים בצורה חלשה כדי לאמן מסווג שמזהה עקביות עובדתית ומדגיש מרחקים לא עקביים2. SummaC מיישם מודלים של NLI בפירוט המתאים ומניב הערכות עובדתיות חזקות, אך מדד FRANK מציין שמדדים אלו עדיין מתייחסים לעובדות כבינארית וחסרים מסגרת מאוחדת 1,7,8. מממדי הערכה אנושית המוצעים על ידי חוקרים: שטף, קוהרנטיות, רלוונטיות ועקביות מאומצים באופן נרחב.9. מחקר הערכה נוסף מדגיש כי עקביות היא הממד האובייקטיבי ביותר כי הוא פשוט בודק האם הסיכום נובע מהמקור; הוא מציין שעד 92% מסיכומי XSum מכילים טעויות נאמנות 9,10. עם זאת, הערכה אנושית גוזלת זמן ויקרה, ולכן מדדים אוטומטיים חיוניים להערכה ניתנת להרחבה8. מדדים עכשוויים לעיתים קרובות מאגדים הזיות פנימיות וחיצוניות לציון אחד, מה שמקשה על אבחון טעות4.

מכיוון שאימון בסבירות מקסימלית אינו מייעל ישירות את איכות הסיכום, למידת חיזוק (RL) יושמה לשיפור הרלוונטיות והעובדות. פסונורו ובנסל הציגו מסגרת למידה אמיתית רב-תגמולית המשלבת תגמולי בולטות (ROUGE) ותגמולי תועלת והדגימה ביצועים מתקדמים11. RL שימש לסיכום חילוץ באמצעות אלגוריתם REINFORCE; המודל שלהם ממקסם את ציוני ROUGE ומניב סיכומים אינפורמטיביים יותר מאשר גישות מבוססות מסווגים, כפי שמודגם בהערכות שאלות ותשובות אנושיות12. מודלים מרובי משימות משלבים גם יצירת שאלות ויצירת השלכות כדי להבטיח כיסוי וקוהרנטיות12. סקר מקיף משנת 2024 על סיכום מופשט מדגיש את העקביות העובדתית כאתגר יסודי ומעודד את ה-RL לעודד סיכום אמיתי. הסקר מציע לתגמל סיכומים עקביים עובדתיים ולשלב מקורות ידע חיצוניים ושליטה בתכונות לשיפור הדיוק13. RL ממשוב אנושי (RLHF) מרחיב את הרעיון הזה על ידי אימון מודל תגמול על העדפות אנושיות וכיוונון מדויק של המסכם כדי למקסם את התגמול הנלמד9. למידה מחזקת משוב אנושי (RLHF) צברה תאוצה בהתאמת פלטי המודל לתכונות רצויות, כגון עובדות ועזרה 4,14. בעוד ש-RL ו-RLHF מרובי תגמולים מיישרים מודלים עם תפיסות אנושיות של נאמנות, הם מסתמכים על מדדים גסים כמו ROUGE או עובדות בינאריות. לעומת זאת, העבודה המפורטת כאן מציעה שימוש באינדקס הזיה מדויק ברמת הישות כתגמול, שהוא אמפירי וזול חישובית ללא משוב אנושי.

למרות מדדים רבים, מספר מגבלות קיימות. מדדי N-גרם מתעלמים מנכונות סמנטית, מדדים מבוססי QA ומבוססי IE מפיצים שגיאות ממודלים של יצירת וחילוץ שאלות, ומדדי NLI מפחיתים את העובדות להחלטות תוצאה בינארית 1,4,6. בעבודת המחקר הודגש כי מדדים מבוססי מודל קיימים מתקשים לזהות הזיות בפירוט מדויק, משום שהן פועלות ברמת המשפט או המסמך ואינן יכולות לבודד ישויות ספציפיות הגורמות לשגיאות4. הערכות אנושיות נשארות הסטנדרט הזהב אך יקרות וסובייקטיביות15. יתרה מזאת, מדדים קיימים אינם מבחינים בין הזיות פנימיות לחיצוניות או לוכדים את המיקוד העודף והתחתון של היחסים1. מודלים גדולים של שפה עלולים להזות כי הם חוזים טקסט על בסיס סבירות סטטיסטית ולא על בסיס אימות עובדתי. מודלים מייצרים תוצרים בטוחים אך שגויים בשל מגבלות בנתוני האימון, יצירת הסתברות והיעדר בדיקת עובדות, וביטחון יתר והטיות עלולים לגרום להם להציג מידע שגוי בוודאות גבוהה; המדריך תומך ביצירת שליפה מוגברת וזיכרון ארוך טווח למודלים של קרקע בנתוניםחיצוניים 15. עם זאת, טכניקות אלו מתמקדות במשימות מבוססות שחזור; סיכום עדיין דורש מדדים שמזהים ומענישים ישויות הזיות. עבודות קודמות הכירו בחשיבות ההערכה ברמת הישות לעובדתיות. מדדים כמו FEQA ו-QuestEval מנסים להעריך עקביות עובדתית באמצעות טכניקות תשובה לשאלות16,17. עם זאת, שיטות אלו דורשות לעיתים סיכומי ייחוס או מערכות QA חיצוניות, מה שמגביל את יכולת ההרחבה. העבודה שלנו בונה על קו זה באמצעות מדד הזיות הישויות (EHI), מדד אמפירי קל המתמקד במיוחד בנאמנות לישות עם שם, על ידי סיווג הישויות לחמישה סוגי גורמי הזיה כפי שמוצג באיור 1.

הראיות מצביעות על כך שההזיה נפוצה, מדדי ההערכה אינם מושלמים, וטכניקות למידת חיזוק אמיתית חסרות תגמולים מדויקים. מחקרים אנושיים מראים שמודלים של סיכום הזיות בחלק משמעותי מהמקרים, לעיתים מחליפים ישויות או מזייפים פרטים9. מדדים קיימים מדגישים חפיפה בין n-gram או מתייחסים לעובדות כבינארית, ושיטות RL הנוכחיות מייעלות אותות ROUGE או אותות עובדות גסות. קיים פער במדדים ברמת ישות שמודדים מתי סיכום מזכיר ישויות שאינן קיימות במקור (הזיה שלילית), משמיט ישויות מפתח (הזיית מיקוד אובדן), ותסריטים נוספים. שיטת הכוונון המוצעת על מדד הזיות הישות (EHI) ממלאת את הפער הזה על ידי כימות הזיות ברמת הישות ומתן תגמול מובנה ללמידה בחיזוק. על ידי שילוב EHI ב-RLHF, אנו שואפים לכוונן מודלים לשוניים גדולים כדי למזער הזיות ברמת הישות וליצור סיכומים שהם גם שוטפים וגם נאמנים לעובדות.

בעבודה זו, אנו מציעים גישה חדשנית לכיוונון עדין שמנצלת את מדד הזיות הישות (EHI) כאות תגמול להפחתת הזיות ברמת הישות. EHI מכמת את נכונות ויסוד הישויות על ידי השוואת ישויות שהופקו מפלטי המודל לאלו שנמצאות במסמך הקלט, ומאפשר הפחתת התלות בהפניות18. השיטה המתוארת כאן מטה את המודל להפקת סיכומים נאמנים יותר לישות מבלי לדרוש הערות עובדתיות אנושיות.

לסיכום, מודלים של תגמול מודעים לעובדות שימשו לכיוון מדויקשל 19,20. בניגוד לגישות קודמות שהסתמכו על תגמולי עובדות גסות או מאגרי נתונים מסומנים על ידי אדם, אנו מציעים כיוונון עדין באמצעות EHI כאות תגמול ישיר ואוטומטי, ובכך לקדם סיכום מבוסס ישות ללא פיקוח נוסף. התרומות החדשות של מחקר זה הן כדלקמן: (i) המחקר מציג מסגרת כיוונון מדויק מונחית EHI המשפרת את נאמנות הישויות בסיכום מופשט, (ii) המחקר מציג צינור למידה מחוזק בקנה מידה שאינו תלוי במאגרי עובדות מסומנים על ידי בני אדם, (iii) המחקר מדגים שיפורים אמפיריים בציוני EHI במאגרי נתונים של תמלול מפגשים, מאגר חדשות XSUM וביצוע ניתוח איכותני להדגשת הפחתות בהזיות, (iv) המחקר משתף יישום מבוסס Colab שניתן לשכפול כדי להקל על מחקר נוסף על סיכום מודע להזיות21.

מחקר זה מעריך את ההשערה שאופטימיזציה של מודלים לשוניים עם תגמולים ממוקדי ישויות מדויקים כמו EHI מספקת מסלול יעיל לשיפור הנאמנות והאמינות במשימות סיכום עם חישוב מינימלי. הגישה תורמת לפיתוח תחום הכוונון היעיל מבחינת פרמטרים לסיכום מדויק על ידי: (i) הפגנת יעילות הן בארכיטקטורות מקודד-מפענח (DistilBART, FlanT5) והן בארכיטקטורות מפענח בלבד (Mistral), (ii) מתן מסגרת שניתן להתאים לסוגי מודלים, תחומים וקני מידה שונים, ו-(iii) הצעת יעילות חישובית בהשוואה להכשרה מלאה.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מטרת מחקר זה היא לכוונן מודל שפה (LM) ליצירת סיכומים עם הזיות ישויות מופחתתות. הזיות מתרחשות כאשר מודל "מפיק בביטחון פלט שגוי או לא רלוונטי" משום שהוא מייצר טקסט לפי סבירות סטטיסטית ולא אימות עובדתי. זה מושג על ידי עיצוב פונקציית תגמול המבוססת על מדד הזיות הישות (EHI) ויישום למידת חיזוק כדי למקסם אותה.

ניסוח בעיות
בהינתן מסמך קלט Xi, המטרה היא ליצור סיכום Yi כך שהישויות המוזכרות ב-Yi יהיו מעוגנים ב-Xi. הדרכה מסורתית להסתברות מקסימלית אינה ממקסמת במפורש עקביות עובדתית. שיטות אימון אלו אינן מענישות הכללת ישויות מזויפות. לכן, מוצגת אסטרטגיית כיוונון עדין מונעת תגמול, שבה התגמול פרופורציונלי לנאמנות הישות, הנמדדת באמצעות EHI.

מערך נתונים ושיטה
משתמשים בשני קורפוסים: ראשית, מאגר נתונים לתמלול דיאלוג הכולל תמלילי פגישות רב-תוריות וסיכומי זהב מופשטים, ושנית, מדד סיכום חדשות XSUM22,23. כל מאגר נתונים נוקה, שטח וחולק ל-80% מחיצות train, 10% אימות ו-10% מחיצות בדיקה. הדיאלוגים עשירים בשפה בלתי פורמלית ובכינויי גוף, בעוד ש-XSUM מכיל מאמרי חדשות תמציתיים; השילוב מאפשר לנו להעריך הכללה בתוך הדומיין ומחוץ לתחום.

חילוץ הישויות מתבצע הן במסמכי מקור והן בסיכומים לחישוב מדד הזיית הישות (EHI). במהלך הכיוונון המדויק, מחקר זה משתמש אך ורק בחלוקת ההכשרה, בעוד שציוני EHI של אימות מנוטרים כדי לבחור את נקודת הביקורת הטובה ביותר. הערכות סופיות מדווחות על סט הבדיקה המוחזק, שנשאר אפס צילום לפני ואחרי הכוונון העדין של המודלים.

לסיכום, ראשית, התמלילים מאורגנים בפורמט שטוח ומחלקים את הנתונים. המודל המאומן מראש מייצר סיכומים בסיסיים. שנית, EHI מחושב באמצעות NER מבוסס שנאים וחמשת גורמי ההזיה. במהלך כיוונון עדין, המודל מתעדכן עם פרס EHI דרך מתאמי LoRa. לבסוף, סיכומים נוצרים באמצעות המודל המכוון ומוערכים באמצעות EHI, Entity F1 ומדדים נוספים (איור 2). כל הניסויים ניתנים לשכפול דרך קבצי הקוד והקונפיגורציה שסופקו. איור 3 מציג את זרימת התהליך שלעד-שלבית להכנת מערכי נתונים, סיכום בסיסי, חישוב EHI, כיוונון עדין והערכה.

סיכום קו בסיס
נבחרים שלושה מודלים גדולים גדולים מאומנים מראש, וסיכומי הבסיס שלהם נלכדים: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO), ו-DistilBART 24,25,26. כל מודל הופעל במצב זילום אפס כדי להפיק סיכום ראשוני (Yi) לכל מסמך קלט (xi). חיפוש קרן עם רוחב קרן של 4 ועונש אורך של 1.0 שימש לעידוד סיכומים שוטפים אך תמציתיים. סיכומי הבסיס הללו שימשו להערכת שכיחות ההזיות וסיפקו נקודות התחלה לכיוונון עדין.

חילוץ ישויות וחישוב EHI
חישוב מדויק של מדד הזיות הישות (EHI) דורש NR חזק. בתחילה, ספייסי שימשה לפעולות NER. מובן שמודלים מבוססי טרנספורמרים של NER מדויקים יותר, אך ספייסי הייתה הבחירה הראשונית מהסיבות הבאות: (1) מודלים מבוססי טרנספורמר NER עצמם הוכיחו כהזיות מאשר ספייסי. (2) היותה ספייסי סטטיסטית מביאה יעילות חישובית מבחינת עלות היישום וזמן הביצוע. (3) זה גם עוזר לנו להוכיח ש-EHI חזק בהפחתת הזיות גם עם מודל NER חלש יותר. עם זאת, בהתחשב בכך שהניסויים נעשים על מערכי נתונים מבוססים ומודל en_core_web_sm של spaCy שביר בתמלולים המדוברים13. ספייסי מוחלף במודל NER מבוסס שנאי (dslim/bert-base-NER), שהוא מודל BERT שמכוון היטב על מאגר הנתונים CoNLL-2003. מערכות NER מבוססות BERT הוכחו כעולות על מודלים של spaCy במשימות ספציפיות לתחום – לדוגמה, מודל Aviation-BERT-NER הגיע ל-F1 של 94.78% תוך זיהוי 17 ישויות, לעומת 93.73% ב-NER המרחבי שזיהה שבע ישויות27. מודל BERT NER הוגדר באמצעות Hugging Face Transformers28 וביצע התאמת רישוי לא רגיש לאות. כדי ללכוד כינויים ושינויים בצורת פני השטח, שיטה זו יישמה גם כללים פשוטים שממפים את "מר סמית" ו"סמית' לאותה צורה קנונית; עם זאת, רזולוציה קו-רפרנס מלאה נותרה עבודה עתידית. ניתוח השוואתי של מודלי NER על מדגם של 200 רשומות ממאגר הנתונים של XSUM ניתן להסיק מטבלה 1.

מדד הזיית הישות (EHI) מחושב כך:

figure-protocol-1

כאשר PH, EF, OF, NH, LF מייצגים ציונים התואמים להזיה חיובית (PH), גורם חילוץ (EF), הזיה שלילית (NH), ישויות ממוקדות יתר (OF) ואבוד מיקוד (LF), בהתאמה, עבור מאמר i.

פרטים על גורמי הזיה:

הזיה חיובית (PH): מדדים של ישויות חדשות שהוצגו נכונים עובדתית ומועילים.

מקדם חילוץ (EF): מודד ישויות שהופקו במדויק ממסמך הקלט אל תוך הסיכום.

הזיה שלילית (NH): לוכד ישויות הזיות שהן לא נכונות או לא מחוברות לקלט.

מרוכז יתר (OF): מעניש סיכומים שמתמקדים יתר על המידה בתת-קבוצה צרה של ישויות, וחסרים גיוון.

פוקוס אבוד (LF): מעניש סיכומים שמשמיטים ישויות חשובות המופיעות בקלט.

חישוב הגורמים לעיל מפורט באיור 4 עם חישוב לדוגמה לצורך המחשה. לדוגמה של ישויות מסמכי קלט (I): "John", AI", ישות סיכום ייחוס (R):"John", AI" ישויות סיכום שנוצרו (G):"John"," AI", טכנולוגיה". ערכים גבוהים יותר של EHI מצביעים על נאמנות טובה יותר של ישויות, ומתגמלים סיכומים שהם גם אקסטרקטיביים וגם הזיים חיוביים (מציגים ישויות שימושיות אך נאמנות), תוך ענישה של ישות20 שאינה מעורקת, מופרזת או חסרה. גורמים אלה נורמל לפי מספר הישויות שזוהו כדי להפיק ציון EHI בין 0 ל-1. אימות EHI נוטר במהלך ההכשרה לבחירת נקודת הביקורת הטובה ביותר. PH ו-EF מתגמלים ישויות חדשות מועילות וחילוץ נכון, בעוד ש-OF, NH ו-LF מענישים חזרה, זיוף והשמטה. ציון מושלם של 1.0 משמעותו שכל הישויות בסיכום הן מקורקעות או הזיות מועילה, בעוד שציון 0 מציין שאין ישות בשם בסיכום שמופיעה במקור.

הליך כיוונון מדויק עם RL
תצורת ההיפרפרמטרים המפורטת לכיוון עדין מסופקת בנפרד בטבלה 2, טבלה 3 וטבלה 4, המתארות סוגי אופטימייזרים, קצבי למידה, גדלי אצווה, מפרטי חומרה ופרטי תצורה נוספים עבור Mistral-7B, DistilBart ו-Flan-T5, בהתאמה. המטרה כאן היא לכוונן את פרמטרי המודל θ על ידי מקסום התגמול הצפוי של מדד הזיות ישות (EHI) על סיכומים שנוצרו. באופן פורמלי, עבור מסמך קלט Xi, סיכום שנוצר Yi, ופרמטרי המודל θ , מטרת התגמול הצפויה מוגדרת כך:

figure-protocol-2(2)

כאשר EHI (y, x) מציין את מדד הזיית הישות המחושב בין הסיכום שנוצר Yi לבין הקלט Xi.

בהתאם לאלגוריתם REINFORCE25, הגרדיאנט של מטרה זו מוערך כך:

figure-protocol-3(3)

בפועל, נלקחו סיכומים מהמודלים, חושבו ציוני EHI תואמים, ועדכוני גרדיאנטים במדיניות יושמו לעידוד תפוקות עם תגמול גבוה יותר. כדי לאפשר כיוונון עדין יעיל מבחינת פרמטרים, מחקר זה השתמש ב-Low-Rank Adaptation (LoRA). רק מתאמי LoRA עודכנו בעוד משקלי הדגם הבסיסי נותרו קפואים. כוונון מדויק בוצע על GPU מדגם A100 עם קצב למידה נמוך (למשל, 5 × 10-6), גודל אצווה של 4 וצבירת גרדיאנטים לאורך 8 שלבים עם אדם אופטימייזר29. סיכומים נוצרו מחדש כל 500 עדכונים לרענון הערכות התגמול, וההכשרה נמשכה עד שאימות EHI התכנס. קו הבסיס של REINFORCE הוגדר לממוצע הריץ של התגמולים האחרונים כדי להפחית שונות. בנוסף ל-EHI, ישות F12, ציוני ROUGE-1/2/L נרשמו כדי לעקוב אחר איכות כללית. סיכומים נוצרים מחדש מעת לעת כדי לשקף שיפורים במודל במהלך כיוונון עדין.

מדדי הערכה
התוצרים הוערכו באמצעות מדדי אינפורמטיביות כמו Rouge-1, Rouge-25. מדד שטף כמו Rouge LCS5. מדד חפיפת ישויות Entity F1, ומדדי הזיה כמו EHI, FactCC ו-QAGS 2,6,18,30. FactCC משתמש במסווג המאומן על נתוני סתירות סינתטיות כדי לתייג משפטים כמוכנעים או סותרים על ידי המקור. ה-factCC נותן שני ציונים; התווים נלכדו כאשר התווית תקפה. מצד שני, QAGS משתמש בשיטת שאלות ותשובות שרצה על מודל שפה גדול. דגם קל T5 קטן שימש ליצירת שאלות בטקסט31. Roberta_base_Squad2 שימש ליצירת תשובות מעל טקסטפלט 32. מודלים אלו נבחרו בשל עלות החישוב הנוחה שלהם לביצוע.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הניסויים כאן מתמקדים בראיות כמותיות להשפעה של כיוונון עדין מונחה EHI בהפחתת הזיות ברמת הישות על פני ארכיטקטורות מודלים ומאגרי נתונים מרובים. התוצאות מראות שיפורים עקביים במדדי הזיה תוך שמירה על עקביות עובדתית ושימור יכולת תשובות לשאלות.

ביצועי מערכי נתונים
ביצועי מאגר דיאלוג:
טבלה 5 מציגה את התוצאות להפחתת הזיות במאגר הדיאלוג הרב-תורתי. כיוונון מדויק מונחה EHI השיג שיפורים משמעותיים הן במודלים Mistral ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מדדים מבוססי QA (למשל, FEQA/QuestEval/QAFactEval) ומדדים מבוססי NLI (למשל, FactCC/SummaC) דורשים רכיבי QA/Entailment עזריים ולעיתים מספקים שיפוטים ברמת המשפט. לעומת זאת, EHI הוא ציון קל משקל, ללא רפרנס, ברמת ישות ש-(i) מכוון ישירות למצב הכשל הראשי שאנו רואים – הזיית ישויות; (ii) אינו תלוי במודלים ומהיר לחישוב; ו-(iii) משמש כפרס צפוף לכיוון מדויק ב-RL. אמפירית, EHI משלים את מדדי QA/NLI על ידי זיהוי אילו ישויות מובילות לשגיאות עובדתיות, ומאפשר שיפורים ממוקדים מבלי להוסיף קווי איכות כבדים א...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין מה לחשוף.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Colab NVIDIA A100 GPUNVIDIAN/AGoogle Colaboratory Pro
DistilBART (Encoder–Decoder)Hugging Facehttps://huggingface.co/sshleifer/distilbart-cnn-12-6
dslim/bert-base-NERHugging Face (dslim)https://huggingface.co/dslim/bert-base-NERFine-tuned BERT base for English NER
Evaluation Models  QAGS (QA-based)Salesforce ResearchN/AFactuality classifier
Evaluation Models (Factuality) FactCCGoogle ResearchN/AFactuality classifier
Flan-T5 (Encoder–Decoder)Googlehttps://huggingface.co/docs/transformers/main/en/model_doc/flan-t5open-source, text-to-text, large language model
Hugging Face TransformersHugging Face, Inc.https://huggingface.co/docs/transformers/indexModel loading & fine-tuning
Nous-Hermes-2-Mistral-7B-DPOMistralhttps://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPO7 billion parameter Language model
Programming Language
Python 3.10 (Colab runtime)
Python Software FoundationVersion 3.10Core implementation
StreamlitOpen Source https://streamlit.io/Factuality classifier
XLSUM datasetBUEThttps://github.com/csebuetnlp/xl-sum
XSUM datasetUniversity of Edinburghhttps://github.com/EdinburghNLP/XSum

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Maynez, J., Narayan, S., Bohnet, B., McDonald, R. On faithfulness and factuality in abstractive summarization. Proc Annu Meet Assoc Comput Linguist. 2020, 173-173 (2020).
  2. FEQA: A question answering evaluation framework for faithfulness assessment in abstractive summarization. Durmus, E., He, H., Diab, M. Proc Conf Empir Methods Nat Lang Process, , 454-454 (2020).
  3. A short summary of automatic summarization. NLG Blog. , Andong. https://andongluis.github.io/nlg-blog/Summarization-post/ (2018).
  4. Understanding factuality in abstractive summarization. Pagnoni, A., Padmakumar, V., May, J. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2021, 4812-4829 (2021).
  5. Lin, C. Y. ROUGE: A package for automatic evaluation of summaries. Workshop Text Summarization Branches Out. 2004, 74-81 (2004).
  6. Evaluating the factual consistency of abstractive text summarization. Kryściński, W., McCann, B., Xiong, C., Socher, R. Proc Conf Empir Methods Nat Lang Process, 2020, 750-750 (2020).
  7. Goyal, T., Durmus, E., Cardie, C. Fact checking summarization with self supervised and few shot learning. Proc Annu Meet Assoc Comput Linguist. 2022, 564-579 (2022).
  8. QuestEval: Summarization asks for fact-based evaluation. Scialom, T., Dray, P. A., Lamprier, S., Piwowarski, B., Staiano, J., Wang, A., Gallinari, P. Proc Conf Empir Methods Nat Lang Process, 2021, 6594-6604 (2021).
  9. Mukesh, K. Hallucinations in abstractive summarization. Medium. , https://medium.com/@mukesh.kr/hallucinations-in-abstractive-summarization-b5904bc1c5c5 (2023).
  10. Factual error correction for abstractive summarization models. Cao, M., Dong, Y., Wu, J., Cheung, J. C. K. Proc Conf Empir Methods Nat Lang Process, 2020, 6251-6258 (2020).
  11. Yan, E. Evaluation & hallucination detection for abstractive summaries. , https://eugeneyan.com/writing/abstractive-summarization-evaluation/ (2021).
  12. Uekawa, A. Evaluation metrics for summarization. , https://dev.to/akuer/evaluation-metrics-for-summarization-1d7f (2023).
  13. Honnibal, M., Montani, I. spaCy 2: Natural language understanding with Bloom embeddings convolutional neural networks and incremental parsing. Zenodo. , (2017).
  14. Reinforcement learning from human feedback: Aligning large language models. , At https://neptune.ai/blog/reinforcement-learning-from-human-feedback (2023).
  15. Shakil, H., Farooq, A., Kalita, J. Abstractive text summarization: State of the art, challenges, and improvements. Neurocomputing. 603, 128255-128255 (2024).
  16. AI, Z. Reducing LLM hallucinations: A developer's guide. GetZep. , https://www.getzep.com/ai-agents/reducing-llm-hallucinations/ (2025).
  17. Ouyang, L., et al. Training language models to follow instructions with human feedback. Adv Neural Inf Process Syst. 2022, 27730-27744 (2022).
  18. Entity hallucination index in abstractive summarization-A metric. Praveenkumar, K., Balbantaray, R. C., Vittala, K. P. Proc Int Conf Commun Circuits Syst, 2023, 1-5 (2023).
  19. Multi-reward reinforced summarization with saliency and entailment. Pasunuru, R., Bansal, M. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2018, 646-653 (2018).
  20. Williams, R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn. 8 (3-4), 229-256 (1992).
  21. Katwe NLP. EHI_XLSUM_XSUM_Finetuning. , GitHub. https://github.com/katweNLP/EHI_XLSUM_XSUM_Finetuning (2025).
  22. ELITR minuting corpus: A novel dataset for automatic minuting from multi-party meetings in English and Czech. Nedoluzhko, A., Singh, M., Hledíková, M., Ghosal, T., Bojar, O. Proc Int Conf Lang Resour Eval (LREC), 2022, 2623-2632 (2022).
  23. Don't give me the details, just the summary! Topic aware convolutional neural networks for extreme summarization. Narayan, S., Cohen, S. B., Lapata, M. Proc Conf Empir Methods Nat Lang Process, 2018, 1797-1807 (2018).
  24. Lewis, M., et al. Denoising sequence to sequence pre training for natural language generation, translation, and comprehension. Proc Annu Meet Assoc Comput Linguist. 2020, 7871-7880 (2020).
  25. Chung, H. W., et al. Scaling instruction fine-tuned language models. J Mach Learn Res. 25 (1), 1-53 (2024).
  26. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  27. Chandra, C., Ojima, Y., Bendarkar, M. V., Mavris, D. N. Aviation BERT NER: Named entity recognition for aviation safety reports. Aerospace. 11 (11), 890-890 (2024).
  28. Lim, D. S. bert-base-NER. , https://huggingface.co/dslim/bert-base-NER (2021).
  29. Adam: A method for stochastic optimization. Kingma, D. P., Ba, J. Int Conf Learn Represent, , (2015).
  30. QAGS: Evaluating question answering and generation for summarization. Wang, A., Cho, K. Proc Conf Empir Methods Nat Lang Process, 2020, 390-402 (2020).
  31. Patil, S. valhalla/t5-small-qg-hl. , https://huggingface.co/valhalla/t5-small-qg-hl (2020).
  32. deepset/roberta-base-squad2. , Deepset GmbH. https://huggingface.co/deepset/roberta-base-squad2 (2020).
  33. Factually consistent summarization via reinforcement learning with textual entailment feedback. Roit, P., et al. Proc Annu Meet Assoc Comput Linguist, 2023, 8027-8044 (2023).
  34. Hallucination diversity aware active learning for text summarization. Xia, Y., et al. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2024, 3885-3900 (2024).
  35. Wei, Z., et al. TruthRL: Incentivizing truthful large language models via reinforcement learning. arXiv. , (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsEntity HallucinationText SummarizationEntity Hallucination IndexAbstractive SummarizationReinforcement LearningNamed Entity ExtractionModel Fine TuningSummarization RobustnessFactuality Improvement

Related Articles