$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Цель данного исследования — тонко настроить языковую модель (LM) для генерации резюме с уменьшенной галлюцинацией сущности. Галлюцинации возникают, когда модель «уверенно производит неправильный или нерелевантный результат», потому что она генерирует текст на основе статистической вероятности, а не фактической проверки. Это достигается путём проектирования функции вознаграждения на основе Индекса галлюцинации сущности (EHI) и применения обучения с подкреплением для её максимизации.
Формулировка задачи
Имея вводный документ Xi, цель — сгенерировать сводку Yi так, чтобы сущности, упомянутые в Yi , были основаны на Xi. Традиционное обучение с максимальной вероятностью явно не оптимизирует фактическую согласованность. Эти методы обучения не наказывают включение сфабрикованных сущностей. Поэтому внедряется стратегия тонкой настройки, основанная на вознаграждении, при которой вознаграждение пропорционально верности сущности, измеряемая с помощью EHI.
Набор данных и метод
Используются два корпуса: во-первых, набор транскрипций диалогов, включающий многоповоротные стенограммы собраний и абстрактные золотые резюме, а во-вторых, бенчмарк обзора новостейXSUM 22,23. Каждый набор данных очищался, выравнивался и делился на 80% обучающих, 10% валидационных и 10% тестовых разделов. Диалоги богаты неформальным языком и местоимениями, тогда как XSUM содержит краткие новостные статьи; Эта комбинация позволяет нам оценивать как обобщение внутри области, так и вне области.
Извлечение сущностей выполняется как в исходных документах, так и в резюме для вычисления индекса галлюцинации сущности (EHI). Во время тонкой настройки в этом исследовании используется исключительно раздел обучения, а валидационные баллы EHI отслеживаются для выбора оптимальной контрольной точки. Окончательные оценки представлены на оставшейся тестовой комплекте, которая остаётся безрезультатной до и после тонкой настройки моделей.
В итоге, сначала транскрипты организованы в плоский формат и разделяются данные. Предварительно обученная модель генерирует исходные сводки. Во-вторых, EHI вычисляется с помощью трансформаторного NER и пяти галлюцинационных факторов. Во время тонкой настройки модель обновляется с бонусом EHI с помощью адаптеров LoRa. Наконец, сводки формируются с использованием тонкой модели и оцениваются с использованием EHI, Entity F1 и других метрик (см. рисунок 2). Все эксперименты воспроизводимы через предоставленные кодовые и конфигурационные файлы. Рисунок 3 показывает пошаговый процесс для подготовки наборов данных, базового суммирования, вычисления EHI, тонкой настройки и оценки.
Базовое резюме
Выбираются три предварительно обученных LLM, а их базовые резюме фиксируются: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) и DistilBART 24,25,26. Каждая модель запускалась в режиме zero-shot для получения начального резюме (Yi) для каждого входного документа (xi). Был использован поиск пучка с шириной пучка 4 и штрафом по длине 1,0 для стимулирования плавных, но лаконичных резюме. Эти базовые обзоры служили для оценки распространённости галлюцинаций и служили отправными точками для точной настройки.
Извлечение сущностей и вычисление EHI
Точное расчёт индекса галлюцинаций сущности (EHI) требует надёжного NER. Изначально Spacy использовался для операций NER. Считается, что модели NER, основанные на трансформаторах, более точны, но первоначальным выбором была Spacy по следующим причинам: (1) Сами модели NER, основанные на трансформаторах, доказали свою галлюцинацию, чем Spacy. (2) Спейс, будучи статистическим, обеспечивает вычислительную эффективность с точки зрения затрат реализации и времени выполнения. (3) Это также помогает доказать, что EHI устойчив в снижении галлюцинаций даже при более слабой модели NER. Однако, учитывая, что эксперименты проводятся на устоявшихся наборах данных, а модель spaCy en_core_web_sm хрупка на разговорныхтранскриптах 13. Spacy заменяется на трансформаторную модель NER (dslim/bert-base-NER), которая является моделлю BERT, доработанной в наборе данных CoNLL-2003. Системы NER на базе BERT показали, что превосходят spaCy модели в задачах, специфичных для области — например, модель Aviation-BERT-NER достигла F1 94,78% при выявлении 17 объектов по сравнению с 93,73% для spaCy NER, где распозналисемь сущностей 27. Модель BERT NER была сконфигурирована с помощью Hugging Face Transformers28 и выполняла нечувствительное к регистру сопоставление. Для отображения местоимений и вариаций поверхностной формы этот метод дополнительно применял простые правила, сопоставляющие «мистер Смит» и «Смит» в одну и ту же каноническую форму; Однако полное разрешение соссылки остаётся будущей работой. Сравнительный анализ моделей NER на выборке из 200 записей из набора XSUM можно сделать вывод из Таблицы 1.
Индекс галлюцинаций субъекта (EHI) рассчитывается следующим образом:

где PH, EF, OF, NH, LF представляют показатели, соответствующие положительным галлюцинациям (PH), фактору экстрактивности (EF), отрицательной галлюцинации (NH), сверхфокусированным сущностям (OF) и потерянному фокусу (LF) соответственно, для статьи i.
Детали факторов галлюцинаций:
Положительная галлюцинация (PH): Показатели новых сущностей, которые являются фактически корректными и полезными.
Коэффициент экстрактивности (EF): Измеряет сущности, точно извлеченные из входного документа в резюме.
Отрицательная галлюцинация (NH): Фиксирует галлюцинированные сущности, которые неверны или не закреплены на входных данных.
Чрезмерно сфокусированные (OF): Наказывает резюме, чрезмерно сосредоточенные на узкой части сущностей, лишая разнообразия.
Потерянный фокус (LF): Наказывает резюме, в которых опускаются важные сущности, присутствующие в входных данных.
Вычисление вышеуказанных факторов подробно описано на рисунке 4 с примером вычисления для иллюстрации. Рассмотрим пример сущностей вводных документов (I): «Джон», ИИ», конференция «Сводка сущностей (R): «Джон», ИИ» Генерированные сводные сущности (G):«Джон», «ИИ», «технология». Более высокие значения EHI указывают на лучшую верность сущности, вознаграждая резюме, которые одновременно являются экстрактивными и положительно галлюцинированными (вводя полезные, но верные сущности), а необоснованные, чрезмерные или отсутствующие сущностинаказывают 20. Эти факторы нормализовались по общему числу обнаруженных объектов для получения EHI-оценки от 0 до 1. Валидация EHI отслеживалась во время обучения для выбора лучшей контрольной точки. PH и EF вознаграждают полезные новые объекты и правильную экстракцию, тогда как OF, NH и LF наказывают повторение, вымышление и пропуск. Идеальный балл 1.0 означает, что все объекты в резюме приземлены или являются положительно галлюцинированными, а балл 0 указывает на то, что в источнике нет ни одного названного объекта.
Процедура тонкой настройки с RL
Детальная конфигурация гиперпараметров для тонкой настройки приведена отдельно в таблице 2, 3 и 4, где представлены типы оптимизаторов, скорость обучения, размеры пакетов, аппаратные характеристики и другие детали конфигурации для Mistral-7B, DistilBart и Flan-T5 соответственно. Цель здесь — тонко настроить параметры модели θ , максимизируя ожидаемую награду по индексу галлюцинации сущности (EHI) по сгенерированным резюме. Формально, для входного документа Xi, сгенерированного резюме Yi и параметров модели θ ожидаемая цель вознаграждения определяется следующим образом:
(2)
где EHI (y, x) обозначает индекс галлюцинации сущности, вычисляемый между сгенерированным сводом Yi и входным Xi.
Следуя алгоритмуREINFORCE 25, градиент этой цели оценивается следующим образом:
(3)
На практике из моделей были отобраны сводки, рассчитаны соответствующие показатели EHI и применялись обновления градиентов политики для стимулирования результатов с более высоким вознаграждением. Для обеспечения параметрически эффективной настройки в этом исследовании использовалась адаптация низкого ранга (LoRA). Обновлены были только адаптеры LoRA, а базовый вес модели оставался замороженным. Тонкая настройка проводилась на GPU A100 с небольшой скоростью обучения (например, 5 × 10-6), размером партии 4 и накоплением градиентов за 8 шагов с помощью оптимизатораАдама 29. Резюме генерировались каждые 500 обновлений для обновления оценок вознаграждений, а обучение продолжалось до конвергенции валидационного EHI. Базовый уровень REINFORCE был установлен на уровне текущего среднего по недавним наградам для снижения дисперсии. Помимо EHI, EntityF1 2 и ROUGE-1/2/L регистрировались для контроля общего качества. Резюме периодически перерабатываются для отражения улучшений модели при тонкой настройке.
Метрики оценки
Результаты оценивались с использованием метрик информативности, таких как Rouge-1, Rouge-25. Метрика беглости, как в RougeLCS 5. Метрика пересечения субъектов F1 и галлюцинационные метрики, такие как EHI, FactCC иQAGS 2,6,18,30. FactCC использует классификатор, обученный на данных синтетических противоречий, чтобы маркировать предложения как подразумеваемые или противоречивые источником. Факт CC даёт две оценки; баллы были зафиксированы там, где метка была ВАЛИДНОЙ. С другой стороны, QAGS использует метод вопросов и ответов, который работает на LLM. Лёгкая модель T5 small использовалась для генерации вопросов потексту 31. Roberta_base_Squad2 использовался для генерации ответов по выходномутексту 32. Эти модели были выбраны из-за удобства вычислительной стоимости выполнения.