Research Article

Тонкая настройка больших языковых моделей с использованием индекса галлюцинации сущностей для суммирования текста

DOI:

10.3791/68962

January 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы предлагаем подход к тонкой настройке на основе подкрепления обучения для больших языковых моделей, который использует индекс галлюцинации Enti (EHI) в качестве сигнала вознаграждения для снижения галлюцинаций на уровне сущности при суммировании текста. Эксперименты с стенограммами встреч показывают, что этот метод повышает достоверность и точность сущности.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Недавние достижения в крупных языковых моделях (LLM) привели к заметным улучшениям качества абстрактного суммирования. Однако галлюцинации — особенно галлюцинации на уровне сущности, когда вводятся несуществующие или неправильные сущности — остаются серьёзной проблемой. В этой работе мы предлагаем модель суммаризации, основанную на вознаграждениях, используя индекс галлюцинации сущностей (EHI) в качестве руководящей метрики. Методология здесь начинается с генерации начальных резюме из предварительно обученных моделей, таких как Flan-T5, DistilBART и Mistral (или другой популярной LLM) на структурированных наборах транскриптов (XSUM). Мы вычисляем EHI, извлекая именованные сущности как из сгенерированных сводок, так и из золотых ссылок, оценивая точность и наказывая сфабрикованные сущности. Процесс тонкой настройки управляется обучением с подкреплением, где EHI служит сигналом вознаграждения. Мы применяем механизм обновления в стиле REINFORCE для оптимизации модели суммаризации с целью максимизации достоверности сущности. Эксперименты показывают, что модели, тонко настроенные с помощью EHI, достигают более низких галлюцинаций без ущерба информативности. Кроме того, мы показываем, что модели, управляемые EHI, лучше обобщают задачи суммирования вне области, что указывает на повышенную устойчивость. Подход здесь предлагает практическое направление для улучшения фактичности в резюме, подчёркивая критическую роль точного представления сущности.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Абстрактные модели суммаризации, основанные на больших языковых моделях (LLM), добились впечатляющих результатов в различных областях. Однако постоянной проблемой остаётся галлюцинация, когда сгенерированные резюме содержат неверную или сфабрикованную информацию, не основанную на входных данныхисточника 1,2. В приложениях с высокими ставками, таких как резюме собраний, медицинская отчётность или финансовая документация, галлюцинации, особенно связанные с названными организациями, могут значительно подорвать надёжность иполезность 3.

Исследователи Rпровели масштабную оценку на людях и обнаружили, что обобщающие часто создают галлюцинации — контент, не подтверждённый исходным документом — и что эти галлюцинации коррелируют с повторением инесогласованностью 1. Другое исследование показало, что модели с более высокой абстрактностью, как правило, менее точны; Их исследование показало, что результаты с большей абстракцией имели более низкую фактическую точность и больше неточныхпредложений 2. Бенчмарк FRANK показал, что примерно 30% резюме содержат фактические несоответствия, а другое популярное исследование отметило схожие показатели ошибок, утверждая, что высокие уровни галлюцинаций делают резюме практическибесполезными 1,2. Галлюцинации можно классифицировать как внутренние (противоречащие источнику) или внешние (не проверяемые по источнику). Учебник по галлюцинациям в абстрактном резюме объясняет, что внутренние галлюцинации возникают, когда сгенерированный контент противоречит данным (например, ошибочное сообщение о одобренной вакцине как отвергнутой), а внешние галлюцинации добавляют непроверяемые факты, например, утверждение клинических испытаний вакцины, которые неупоминаются 4. Также сообщалось, что современные обобщающие материалы производят галлюцинационный контент примерно в 25% своих результатов при оценке с помощью ROUGE, BLEU и METEOR, и предупреждается, что галлюцинации могут быть опасны в таких сферах, как здравоохранение, право или кибербезопасность.

Традиционные n-граммовые метрики (ROUGE5, BLEU, METEOR) плохо коррелируют с человеческими суждениями фактологии, что побудило разработку референсных и безссылочныхметрик 6. Метрики на основе качества, такие как FEQA и QuestEval, оценивают резюме, спрашивая, можно ли ответить на пары вопрос-ответ, полученные из резюме, с помощью исходного текста. FEQA более сильно коррелирует с человеческими суждениями и показывает, что более абстрактные резюме обычно менее достоверны, тогда как QuestEval значительно улучшает корреляцию с человеческими суждениями по вопросам согласованности, связности, беглости и релевантности. QAFactEval уточняет этот подход, выбирая ответы по существительным и генерируя вопросы перед ответами; эта стратегия улучшает корреляцию с человеческими оценками на бенчмарке SummaC. Метрики извлечения информации (IE) представляют знания в виде кортежей субъекта-отношения-объекта, но они уязвимы к ошибкам в процессе извлечения. Метрики вывода на естественном языке (NLI) — такие как FactCC и SummaC — классифицируют краткие предложения как вытекающие или противоречивыеисточнику 4. FactCC использует слабо контролируемые данные для обучения классификатора, который обнаруживает фактическую согласованность и выделяет несогласованныепромежутки 2. SummaC применяет модели NLI с соответствующей детализацией и даёт сильные оценки фактологии, однако бенчмарк FRANK отмечает, что эти метрики по-прежнему рассматривают фактологию как бинарную и не имеют единой структуры 1,7,8. Измерения человеческой оценки, предлагаемые исследователями, беглость, согласованность, релевантность и согласованность, широкоприменяются 9. Другое оценочное исследование подчёркивает, что согласованность является самым объективным измерением, поскольку она просто проверяет, является ли сводка выведена источником; в ней отмечается, что до 92% резюме XSum содержат ошибкиверности 9,10. Однако оценка на людях занимает много времени и дорого, поэтому автоматические метрики необходимы для масштабируемойоценки 8. Текущие метрики часто объединяют внутренние и внешние галлюцинации в одну оценку, что затрудняет диагностикуошибки 4.

Поскольку обучение с максимальной вероятностью напрямую не оптимизирует качество резюме, для повышения релевантности и фактичности применяется обучение с подкреплением (RL). Pasunuru и Bansal представили многофункциональный RL-фреймворк, сочетающий значительность (ROUGE) и награды за последствие, и продемонстрировали передовые показателипроизводительности 11. RL применялся для экстракционного суммирования с использованием алгоритма REINFORCE; их модель максимизирует баллы ROUGE и даёт более информативные резюме, чем подходы на основе классификаторов, что показано в человеческих оценках с ответами навопросы 12. Многозадачные модели дополнительно включают генерацию вопросов и генерацию последствий для обеспечения охват исогласованности 12. Всесторонний опрос 2024 года по абстрактному резюме выделяет фактическую согласованность как фундаментальную проблему и призывает RL поощрять правдивое резюме. Опрос предлагает поощрять фактически последовательные резюме и включать внешние источники знаний и контроль атрибутов для повышенияточности 13. RL из человеческой обратной связи (RLHF) расширяет эту идею, обучая модель вознаграждения на основе человеческих предпочтений и тонко настраивая суматора для максимизации этой освоеннойнаграды 9. Обучение с подкреплением на основе человеческой обратной связи (RLHF) получило популярность для согласования результатов модели с желаемыми качествами, такими как фактичность и полезность 4,14. Хотя многофункциональные RL и RLHF соответствуют человеческим представлениям о достоверности, они опираются на грубые метрики, такие как ROUGE или бинарная фактуальность. В отличие от этого, описанная здесь работа предлагает использовать тонко обработанный индекс галлюцинаций на уровне сущности в качестве награды, что является эмпирическим и менее затратным без человеческой обратной связи.

Несмотря на многочисленные показатели, сохраняются некоторые ограничения. N-граммовые метрики игнорируют семантическую корректность, метрики, основанные на QA и IE, распространяют ошибки из моделей генерации и извлечения вопросов, а метрики NLI сводят фактологию к бинарным решениям 1,4,6. В исследовательской работе было подчеркнуто, что существующие модельные метрики испытывают трудности с выявлением галлюцинаций с мелкой детализацией, поскольку они работают на уровне предложения или документа и не могут выделить конкретные объекты, вызывающиеошибки 4. Оценка человека остаётся золотым стандартом, но дорогостоящая исубъективная. Кроме того, существующие метрики не различают внутренние и внешние галлюцинации и не отражают чрезмерную и недостаточное фокусирование отношений1. Крупные языковые модели могут галлюцинировать, потому что предсказывают текст на основе статистической вероятности, а не фактической проверки. Модели генерируют уверенные, но некорректные результаты из-за ограничений в обучающих данных, вероятностной генерации и отсутствия проверки фактов, а чрезмерная уверенность и предвзятость могут привести к тому, что они с высокой уверенностью соглашают ложную информацию; Руководство рекомендует генерацию с расширением поиска и долгосрочную память на наземные модели во внешнихданных 15. Однако эти методы сосредоточены на задачах, основанных на поиске; Для обобщения всё равно нужны метрики, которые идентифицируют и наказывают галлюцинированные сущности. Предыдущие исследования признавали важность оценки на уровне организации для достоверности фактов. Метрики, такие как FEQA и QuestEval, пытаются оценить фактическую согласованность с помощью техник ответа на вопросы16,17. Однако эти методы часто требуют сводок по ссылкам или внешних систем контроля качества, что ограничивает масштабируемость. Наша работа развивает эту линию, используя Индекс галлюцинации сущностей (EHI) — лёгкую эмпирическую метрику, сосредоточенную конкретно на верности именованных сущностей, классифицируя их на пять типов факторов галлюцинаций, как показано на рисунке 1.

Данные указывают на то, что галлюцинации распространены, метрики оценки несовершенны, а методы RL не дают тонко прописанных вознаграждений. Исследования на людях показывают, что модели суммаризации галлюцинируют в значительной части случаев, часто меняя сущности или выдумываядетали 9. Существующие метрики либо подчёркивают n-граммовое перекрытие, либо рассматривают фактологию как бинарную, а текущие методы RL оптимизируют сигналы ROUGE или грубые фактологические сигналы. Существует пробел в метриках на уровне сущности, которые измеряют, когда в резюме упоминаются сущности, отсутствующие в источнике (негативная галлюцинация), опускаются ключевые сущности (галлюцинация утраченного фокуса) и другие сценарии. Предлагаемый метод тонкой настройки по индексу галлюцинации сущности (EHI) заполняет этот пробел, количественно оценивая галлюцинации на уровне сущности и предоставляя структурированное вознаграждение за обучение с подкреплением. Интегрируя EHI в RLHF, мы стремимся тонко настроить большие языковые модели, минимизировать галлюцинации на уровне сущности и создавать резюме, которые будут одновременно свободными и фактически точными.

В этой работе мы предлагаем новый подход к тонкой настройке, который использует индекс галлюцинаций сущности (EHI) в качестве сигнала вознаграждения для снижения галлюцинаций на уровне сущности. EHI количественно оценивает корректность и основание сущностей, сравнивая извлеченные сущности из выходных данных модели с теми, что присутствуют в входном документе, что позволяет снизить зависимость отссылок 18. Описанный здесь метод склоняет модель к созданию более достоверных сущностям резюме без необходимости человеческих аннотаций к фактологии.

В итоге, модели вознаграждения с учётом фактологии были использованы для тонкой настройки19,20. В отличие от предыдущих подходов, основанных на грубых наградах за фактологию или наборах данных, маркированных человеком, мы предлагаем тонкую настройку с использованием EHI как прямого автоматического сигнала вознаграждения, тем самым способствуя суммаризации на основе сущности без дополнительного надзора. Новые вклады этого исследования следующие: (i) введена система тонкой настройки, управляемая EHI, которая повышает достоверность сущности в абстрактном суммарировании, (ii) исследование представляет масштабируемый конвейер обучения с подкреплением, не зависящий от набора фактических данных, помеченных человеком, (iii) исследование демонстрирует эмпирические улучшения баллов EHI в наборах транскриптов собраний, набора новостей XSUM и проведение качественного анализа для выявления снижения галлюцинаций, (iv) исследование использует воспроизводимую реализацию на базе Colab для облегчения дальнейших исследований обобщения с учетомгаллюцинаций 21.

В данном исследовании оценивается гипотеза о том, что оптимизация языковых моделей с использованием тонко ориентированных на сущности вознаграждений, таких как EHI, обеспечивает эффективный путь повышения точности и надёжности в задачах суммаризации с минимальными вычислениями. Этот подход способствует развитию параметрически эффективной тонкой настройки для достоверности в резюме, пяс: (i) демонстрируя эффективность как в архитектурах энкодер-декодера (DistilBART, FlanT5), так и только с декодером (Mistral), (ii) предоставляя рамки, адаптируемые к различным типам моделей, доменам и масштабам, и (iii) обеспечивая вычислительную эффективность по сравнению с полным переобучением.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Цель данного исследования — тонко настроить языковую модель (LM) для генерации резюме с уменьшенной галлюцинацией сущности. Галлюцинации возникают, когда модель «уверенно производит неправильный или нерелевантный результат», потому что она генерирует текст на основе статистической вероятности, а не фактической проверки. Это достигается путём проектирования функции вознаграждения на основе Индекса галлюцинации сущности (EHI) и применения обучения с подкреплением для её максимизации.

Формулировка задачи
Имея вводный документ Xi, цель — сгенерировать сводку Yi так, чтобы сущности, упомянутые в Yi , были основаны на Xi. Традиционное обучение с максимальной вероятностью явно не оптимизирует фактическую согласованность. Эти методы обучения не наказывают включение сфабрикованных сущностей. Поэтому внедряется стратегия тонкой настройки, основанная на вознаграждении, при которой вознаграждение пропорционально верности сущности, измеряемая с помощью EHI.

Набор данных и метод
Используются два корпуса: во-первых, набор транскрипций диалогов, включающий многоповоротные стенограммы собраний и абстрактные золотые резюме, а во-вторых, бенчмарк обзора новостейXSUM 22,23. Каждый набор данных очищался, выравнивался и делился на 80% обучающих, 10% валидационных и 10% тестовых разделов. Диалоги богаты неформальным языком и местоимениями, тогда как XSUM содержит краткие новостные статьи; Эта комбинация позволяет нам оценивать как обобщение внутри области, так и вне области.

Извлечение сущностей выполняется как в исходных документах, так и в резюме для вычисления индекса галлюцинации сущности (EHI). Во время тонкой настройки в этом исследовании используется исключительно раздел обучения, а валидационные баллы EHI отслеживаются для выбора оптимальной контрольной точки. Окончательные оценки представлены на оставшейся тестовой комплекте, которая остаётся безрезультатной до и после тонкой настройки моделей.

В итоге, сначала транскрипты организованы в плоский формат и разделяются данные. Предварительно обученная модель генерирует исходные сводки. Во-вторых, EHI вычисляется с помощью трансформаторного NER и пяти галлюцинационных факторов. Во время тонкой настройки модель обновляется с бонусом EHI с помощью адаптеров LoRa. Наконец, сводки формируются с использованием тонкой модели и оцениваются с использованием EHI, Entity F1 и других метрик (см. рисунок 2). Все эксперименты воспроизводимы через предоставленные кодовые и конфигурационные файлы. Рисунок 3 показывает пошаговый процесс для подготовки наборов данных, базового суммирования, вычисления EHI, тонкой настройки и оценки.

Базовое резюме
Выбираются три предварительно обученных LLM, а их базовые резюме фиксируются: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) и DistilBART 24,25,26. Каждая модель запускалась в режиме zero-shot для получения начального резюме (Yi) для каждого входного документа (xi). Был использован поиск пучка с шириной пучка 4 и штрафом по длине 1,0 для стимулирования плавных, но лаконичных резюме. Эти базовые обзоры служили для оценки распространённости галлюцинаций и служили отправными точками для точной настройки.

Извлечение сущностей и вычисление EHI
Точное расчёт индекса галлюцинаций сущности (EHI) требует надёжного NER. Изначально Spacy использовался для операций NER. Считается, что модели NER, основанные на трансформаторах, более точны, но первоначальным выбором была Spacy по следующим причинам: (1) Сами модели NER, основанные на трансформаторах, доказали свою галлюцинацию, чем Spacy. (2) Спейс, будучи статистическим, обеспечивает вычислительную эффективность с точки зрения затрат реализации и времени выполнения. (3) Это также помогает доказать, что EHI устойчив в снижении галлюцинаций даже при более слабой модели NER. Однако, учитывая, что эксперименты проводятся на устоявшихся наборах данных, а модель spaCy en_core_web_sm хрупка на разговорныхтранскриптах 13. Spacy заменяется на трансформаторную модель NER (dslim/bert-base-NER), которая является моделлю BERT, доработанной в наборе данных CoNLL-2003. Системы NER на базе BERT показали, что превосходят spaCy модели в задачах, специфичных для области — например, модель Aviation-BERT-NER достигла F1 94,78% при выявлении 17 объектов по сравнению с 93,73% для spaCy NER, где распозналисемь сущностей 27. Модель BERT NER была сконфигурирована с помощью Hugging Face Transformers28 и выполняла нечувствительное к регистру сопоставление. Для отображения местоимений и вариаций поверхностной формы этот метод дополнительно применял простые правила, сопоставляющие «мистер Смит» и «Смит» в одну и ту же каноническую форму; Однако полное разрешение соссылки остаётся будущей работой. Сравнительный анализ моделей NER на выборке из 200 записей из набора XSUM можно сделать вывод из Таблицы 1.

Индекс галлюцинаций субъекта (EHI) рассчитывается следующим образом:

figure-protocol-1

где PH, EF, OF, NH, LF представляют показатели, соответствующие положительным галлюцинациям (PH), фактору экстрактивности (EF), отрицательной галлюцинации (NH), сверхфокусированным сущностям (OF) и потерянному фокусу (LF) соответственно, для статьи i.

Детали факторов галлюцинаций:

Положительная галлюцинация (PH): Показатели новых сущностей, которые являются фактически корректными и полезными.

Коэффициент экстрактивности (EF): Измеряет сущности, точно извлеченные из входного документа в резюме.

Отрицательная галлюцинация (NH): Фиксирует галлюцинированные сущности, которые неверны или не закреплены на входных данных.

Чрезмерно сфокусированные (OF): Наказывает резюме, чрезмерно сосредоточенные на узкой части сущностей, лишая разнообразия.

Потерянный фокус (LF): Наказывает резюме, в которых опускаются важные сущности, присутствующие в входных данных.

Вычисление вышеуказанных факторов подробно описано на рисунке 4 с примером вычисления для иллюстрации. Рассмотрим пример сущностей вводных документов (I): «Джон», ИИ», конференция «Сводка сущностей (R): «Джон», ИИ» Генерированные сводные сущности (G):«Джон», «ИИ», «технология». Более высокие значения EHI указывают на лучшую верность сущности, вознаграждая резюме, которые одновременно являются экстрактивными и положительно галлюцинированными (вводя полезные, но верные сущности), а необоснованные, чрезмерные или отсутствующие сущностинаказывают 20. Эти факторы нормализовались по общему числу обнаруженных объектов для получения EHI-оценки от 0 до 1. Валидация EHI отслеживалась во время обучения для выбора лучшей контрольной точки. PH и EF вознаграждают полезные новые объекты и правильную экстракцию, тогда как OF, NH и LF наказывают повторение, вымышление и пропуск. Идеальный балл 1.0 означает, что все объекты в резюме приземлены или являются положительно галлюцинированными, а балл 0 указывает на то, что в источнике нет ни одного названного объекта.

Процедура тонкой настройки с RL
Детальная конфигурация гиперпараметров для тонкой настройки приведена отдельно в таблице 2, 3 и 4, где представлены типы оптимизаторов, скорость обучения, размеры пакетов, аппаратные характеристики и другие детали конфигурации для Mistral-7B, DistilBart и Flan-T5 соответственно. Цель здесь — тонко настроить параметры модели θ , максимизируя ожидаемую награду по индексу галлюцинации сущности (EHI) по сгенерированным резюме. Формально, для входного документа Xi, сгенерированного резюме Yi и параметров модели θ ожидаемая цель вознаграждения определяется следующим образом:

figure-protocol-2(2)

где EHI (y, x) обозначает индекс галлюцинации сущности, вычисляемый между сгенерированным сводом Yi и входным Xi.

Следуя алгоритмуREINFORCE 25, градиент этой цели оценивается следующим образом:

figure-protocol-3(3)

На практике из моделей были отобраны сводки, рассчитаны соответствующие показатели EHI и применялись обновления градиентов политики для стимулирования результатов с более высоким вознаграждением. Для обеспечения параметрически эффективной настройки в этом исследовании использовалась адаптация низкого ранга (LoRA). Обновлены были только адаптеры LoRA, а базовый вес модели оставался замороженным. Тонкая настройка проводилась на GPU A100 с небольшой скоростью обучения (например, 5 × 10-6), размером партии 4 и накоплением градиентов за 8 шагов с помощью оптимизатораАдама 29. Резюме генерировались каждые 500 обновлений для обновления оценок вознаграждений, а обучение продолжалось до конвергенции валидационного EHI. Базовый уровень REINFORCE был установлен на уровне текущего среднего по недавним наградам для снижения дисперсии. Помимо EHI, EntityF1 2 и ROUGE-1/2/L регистрировались для контроля общего качества. Резюме периодически перерабатываются для отражения улучшений модели при тонкой настройке.

Метрики оценки
Результаты оценивались с использованием метрик информативности, таких как Rouge-1, Rouge-25. Метрика беглости, как в RougeLCS 5. Метрика пересечения субъектов F1 и галлюцинационные метрики, такие как EHI, FactCC иQAGS 2,6,18,30. FactCC использует классификатор, обученный на данных синтетических противоречий, чтобы маркировать предложения как подразумеваемые или противоречивые источником. Факт CC даёт две оценки; баллы были зафиксированы там, где метка была ВАЛИДНОЙ. С другой стороны, QAGS использует метод вопросов и ответов, который работает на LLM. Лёгкая модель T5 small использовалась для генерации вопросов потексту 31. Roberta_base_Squad2 использовался для генерации ответов по выходномутексту 32. Эти модели были выбраны из-за удобства вычислительной стоимости выполнения.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эксперименты здесь сосредоточены на количественных доказательствах влияния тонкой настройки, управляемой EHI, на уменьшение галлюцинаций на уровне сущностей в различных архитектурах моделей и наборах данных. Результаты демонстрируют стабильные улучшения показателей галлюцинаций при сохранении фактической последовательности и способности отвечать на вопросы.

Производительность наборов данных
Производительность набора данных по диало...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Метрики на основе качества качества (например, FEQA/QuestEval/QAFactEval) и метрики на основе NLI (например, FactCC/SummaC) требуют вспомогательных компонентов контроля качества/последствий и часто предоставляют суждения на уровне предложений. В отличие от этого, EHI — это лёгкий, без ссылок, уровень сущности, который (i) напрямую направлен на основной режим отказа, который мы наблюдаем — галлюцинации сущности; (ii) не зависит от модели и быстро вычисляется; и (iii) служит плотным вознаг...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ни одного.

Access restricted. Please log in or start a trial to view this content.

Materials

```html

List of materials used in this article
NameCompanyCatalog NumberComments
Colab NVIDIA A100 GPUNVIDIAN/AGoogle Colaboratory Pro
DistilBART (Encoder–Decoder)Hugging Facehttps://huggingface.co/sshleifer/distilbart-cnn-12-6
dslim/bert-base-NERHugging Face (dslim)https://huggingface.co/dslim/bert-base-NERFine-tuned BERT base for English NER
Evaluation Models  QAGS (QA-based)Salesforce ResearchN/AFactuality classifier
Evaluation Models (Factuality) FactCCGoogle ResearchN/AFactuality classifier
Flan-T5 (Encoder–Decoder)Googlehttps://huggingface.co/docs/transformers/main/en/model_doc/flan-t5open-source, text-to-text, large language model
Hugging Face TransformersHugging Face, Inc.https://huggingface.co/docs/transformers/indexModel loading & fine-tuning
Nous-Hermes-2-Mistral-7B-DPOMistralhttps://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPO7 billion parameter Language model
Programming Language
Python 3.10 (Colab runtime)
Python Software FoundationVersion 3.10Core implementation
StreamlitOpen Source https://streamlit.io/Factuality classifier
XLSUM datasetBUEThttps://github.com/csebuetnlp/xl-sum
XSUM datasetUniversity of Edinburghhttps://github.com/EdinburghNLP/XSum
```

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Maynez, J., Narayan, S., Bohnet, B., McDonald, R. On faithfulness and factuality in abstractive summarization. Proc Annu Meet Assoc Comput Linguist. 2020, 173-173 (2020).
  2. FEQA: A question answering evaluation framework for faithfulness assessment in abstractive summarization. Durmus, E., He, H., Diab, M. Proc Conf Empir Methods Nat Lang Process, , 454-454 (2020).
  3. A short summary of automatic summarization. NLG Blog. , Andong. https://andongluis.github.io/nlg-blog/Summarization-post/ (2018).
  4. Understanding factuality in abstractive summarization. Pagnoni, A., Padmakumar, V., May, J. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2021, 4812-4829 (2021).
  5. Lin, C. Y. ROUGE: A package for automatic evaluation of summaries. Workshop Text Summarization Branches Out. 2004, 74-81 (2004).
  6. Evaluating the factual consistency of abstractive text summarization. Kryściński, W., McCann, B., Xiong, C., Socher, R. Proc Conf Empir Methods Nat Lang Process, 2020, 750-750 (2020).
  7. Goyal, T., Durmus, E., Cardie, C. Fact checking summarization with self supervised and few shot learning. Proc Annu Meet Assoc Comput Linguist. 2022, 564-579 (2022).
  8. QuestEval: Summarization asks for fact-based evaluation. Scialom, T., Dray, P. A., Lamprier, S., Piwowarski, B., Staiano, J., Wang, A., Gallinari, P. Proc Conf Empir Methods Nat Lang Process, 2021, 6594-6604 (2021).
  9. Mukesh, K. Hallucinations in abstractive summarization. Medium. , https://medium.com/@mukesh.kr/hallucinations-in-abstractive-summarization-b5904bc1c5c5 (2023).
  10. Factual error correction for abstractive summarization models. Cao, M., Dong, Y., Wu, J., Cheung, J. C. K. Proc Conf Empir Methods Nat Lang Process, 2020, 6251-6258 (2020).
  11. Yan, E. Evaluation & hallucination detection for abstractive summaries. , https://eugeneyan.com/writing/abstractive-summarization-evaluation/ (2021).
  12. Uekawa, A. Evaluation metrics for summarization. , https://dev.to/akuer/evaluation-metrics-for-summarization-1d7f (2023).
  13. Honnibal, M., Montani, I. spaCy 2: Natural language understanding with Bloom embeddings convolutional neural networks and incremental parsing. Zenodo. , (2017).
  14. Reinforcement learning from human feedback: Aligning large language models. , At https://neptune.ai/blog/reinforcement-learning-from-human-feedback (2023).
  15. Shakil, H., Farooq, A., Kalita, J. Abstractive text summarization: State of the art, challenges, and improvements. Neurocomputing. 603, 128255-128255 (2024).
  16. AI, Z. Reducing LLM hallucinations: A developer's guide. GetZep. , https://www.getzep.com/ai-agents/reducing-llm-hallucinations/ (2025).
  17. Ouyang, L., et al. Training language models to follow instructions with human feedback. Adv Neural Inf Process Syst. 2022, 27730-27744 (2022).
  18. Entity hallucination index in abstractive summarization-A metric. Praveenkumar, K., Balbantaray, R. C., Vittala, K. P. Proc Int Conf Commun Circuits Syst, 2023, 1-5 (2023).
  19. Multi-reward reinforced summarization with saliency and entailment. Pasunuru, R., Bansal, M. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2018, 646-653 (2018).
  20. Williams, R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn. 8 (3-4), 229-256 (1992).
  21. Katwe NLP. EHI_XLSUM_XSUM_Finetuning. , GitHub. https://github.com/katweNLP/EHI_XLSUM_XSUM_Finetuning (2025).
  22. ELITR minuting corpus: A novel dataset for automatic minuting from multi-party meetings in English and Czech. Nedoluzhko, A., Singh, M., Hledíková, M., Ghosal, T., Bojar, O. Proc Int Conf Lang Resour Eval (LREC), 2022, 2623-2632 (2022).
  23. Don't give me the details, just the summary! Topic aware convolutional neural networks for extreme summarization. Narayan, S., Cohen, S. B., Lapata, M. Proc Conf Empir Methods Nat Lang Process, 2018, 1797-1807 (2018).
  24. Lewis, M., et al. Denoising sequence to sequence pre training for natural language generation, translation, and comprehension. Proc Annu Meet Assoc Comput Linguist. 2020, 7871-7880 (2020).
  25. Chung, H. W., et al. Scaling instruction fine-tuned language models. J Mach Learn Res. 25 (1), 1-53 (2024).
  26. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  27. Chandra, C., Ojima, Y., Bendarkar, M. V., Mavris, D. N. Aviation BERT NER: Named entity recognition for aviation safety reports. Aerospace. 11 (11), 890-890 (2024).
  28. Lim, D. S. bert-base-NER. , https://huggingface.co/dslim/bert-base-NER (2021).
  29. Adam: A method for stochastic optimization. Kingma, D. P., Ba, J. Int Conf Learn Represent, , (2015).
  30. QAGS: Evaluating question answering and generation for summarization. Wang, A., Cho, K. Proc Conf Empir Methods Nat Lang Process, 2020, 390-402 (2020).
  31. Patil, S. valhalla/t5-small-qg-hl. , https://huggingface.co/valhalla/t5-small-qg-hl (2020).
  32. deepset/roberta-base-squad2. , Deepset GmbH. https://huggingface.co/deepset/roberta-base-squad2 (2020).
  33. Factually consistent summarization via reinforcement learning with textual entailment feedback. Roit, P., et al. Proc Annu Meet Assoc Comput Linguist, 2023, 8027-8044 (2023).
  34. Hallucination diversity aware active learning for text summarization. Xia, Y., et al. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2024, 3885-3900 (2024).
  35. Wei, Z., et al. TruthRL: Incentivizing truthful large language models via reinforcement learning. arXiv. , (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsEntity HallucinationText SummarizationEntity Hallucination IndexAbstractive SummarizationReinforcement LearningNamed Entity ExtractionModel Fine TuningSummarization RobustnessFactuality Improvement

Related Articles