9 января 2026 г.
Мы предлагаем подход к тонкой настройке на основе подкрепления обучения для больших языковых моделей, который использует индекс галлюцинации Enti (EHI) в качестве сигнала вознаграждения для снижения галлюцинаций на уровне сущности при суммировании текста. Эксперименты с стенограммами встреч показывают, что этот метод повышает достоверность и точность сущности.
В этом исследовании используется индекс галлюцинаций сущности как сигнал вознаграждения для снижения неправильной генерации сущностей в тексте, обобщённом с помощью ИИ. Текущие метрики — это два основных показателя: этот протокол использует детализированные вознаграждения сущностей для повышения достоверности без человеческих меток. Для начала используйте два основных корпуса, включая набор данных транскрипции диалогов с многоповоротными стенограммами собраний и бенчмарк резюме XSum News.
Очистите каждый набор данных, выравните данные и разделите их на наборы с обучением, 10% валидацией и 10% тестированием. Выполнить токенизацию и извлечение сущностей с использованием трансформаторной модели NER D slim/BERT для обеспечения надёжного заземления. Генерируйте начальные сводки в режиме нулевых выстрелов с помощью поиска по лучу шириной четыре для оценки базовой распространённости галлюцинаций.
Вычислите индекс галлюцинации сущности как метрику уровня сущности без ссылки, которая классифицирует сущности на пять факторов для количественной оценки достоверности. Поощряйте экстрактивность и позитивные галлюцинации, а также наказывайте негативные галлюцинации, чрезмерно сосредоточенные сущности и потерянную концентрацию. Определите функцию вознаграждения как пропорциональную верности субъекта и максимизируйте ожидаемую вознаграждение EHI по сгенерированным резюме.
Примените усиленный механизм обновления стиля для оптимизации параметров модели с целью максимизации достоверности сущности. Используйте адаптацию низкого ранга для эффективной настройки параметров и обновляйте только адаптеры LoRA, при этом сохраняя замороженность базовых весов модели. Затем применяйте обновления градиентов политики, чтобы стимулировать более высокие результаты вознаграждения и генерируйте сводки для каждых 500 обновлений для обновления оценок вознаграждений.
Наконец, сгенерируйте окончательные резюме с помощью тонко настроенных моделей и сравните их с исходными результатами. Оценивайте модели на информативность с помощью Rouge one, Rouge 2 и Rouge L, беглости и фактической согласованности с использованием фактов CC и CAG. Тонкая настройка EHI снижала галлюцинации и улучшала фактичность между моделями и наборами данных с правыми сдвигами EHI, а распределение по фактам CC подтверждало повышение достоверности сущностей и фактической согласованности, в то время как показатели CAGS остались в основном без изменений.
Вредные галлюцинации — негатив, перефокус и потеря фокуса — были уменьшены в Мистрале после тонкой настройки, а фактор экстрактивности почти удвоился. Корреляционный анализ показал, что EHI и CAGS имеют слабую корреляцию в Mistral и DistilBART, тогда как Flan-T5 показал более сильную положительную корреляцию. Исследователи могут измерять точность на уровне сущности и показатели галлюцинаций в резюме с помощью автоматизированного сигнала вознаграждения EHI.
Самая серьёзная проблема — это точность NER, поскольку ошибки извлечения могут привести к неправильным расчётам вознаграждения во время тренировки. Будущие исследования могут интегрировать разрешение совместных рекомендаций и награды за информативность, чтобы лучше сбалансировать верность с обзорным освещением.
Просмотрите полный транскрипт и получите доступ к тысячам научных видео
В данной статье представлена новая платформа тонкой настройки больших языковых моделей (LLM) на основе системы вознаграждения, предназначенная для снижения уровня галлюцинаций на уровне сущностей при абстрактном реферировании. Благодаря использованию индекса галлюцинаций сущностей (Entity Hallucination Index, EHI) в качестве направляющей метрики, данный подход повышает фактическую точность генерируемых резюме без ущерба для их информативности или обобщающей способности.
Галлюцинации на уровне сущностей при суммаризации с использованием больших языковых моделей (LLM) представляют значительный риск для целостности данных и принятия решений в биофармацевтических исследованиях и разработках (R&D). Фреймворк тонкой настройки на основе индекса галлюцинаций сущностей (Entity Hallucination Index, EHI) напрямую решает эту проблему, обеспечивая более надежное извлечение фактических данных из научных и операционных текстовых источников. Повышение фактической точности автоматической суммаризации способствует росту прогностической уверенности и снижает последующие риски в конвейерах обработки знаний.
Структура тонкой настройки под руководством EHI интегрируется в информационный уровень процессов поиска, скрининга и трансляционных исследований, обеспечивая надежное извлечение сущностей и суммаризацию.