Исследовательская статья

Адаптивная верификация утверждений на основе NLI со статистическим моделированием принятия решений для снижения уровня галлюцинаций в больших языковых моделях с малой задержкой

0 просмотров

DOI:

10.3791/72636

3 сентября 2026 г.

В этой статье

Краткое содержание

В данном исследовании представлена легковесная архитектура для уменьшения галлюцинаций в больших языковых моделях посредством верификации на уровне утверждений и адаптивного статистического порога. Благодаря выборочному исправлению необоснованных утверждений с помощью логического вывода на естественном языке (Natural Language Inference), данный подход повышает фактическую точность при сохранении низкой задержки ответа и практической эффективности развертывания.

Аннотация

Большие языковые модели (LLM) демонстрируют критическую тенденцию к созданию фактически неверных, но лингвистически связных ответов — явление, называемое галлюцинацией, которое создает серьезные риски в областях, требующих высокой точности. Существующие стратегии минимизации этого эффекта, включая генерацию с дополнением поиском (RAG) и сэмплирование с самосогласованностью, либо приводят к значительному увеличению задержки вывода, либо зависят от внешней инфраструктуры знаний, что ограничивает их применение в системах реального времени. В данной работе предлагается легковесная двухэтапная структура верификации утверждений, которая разделяет ответы LLM на атомарные фактические утверждения и независимо проверяет каждое извлеченное утверждение по отдельно сгенерированному эталону, полученному с помощью изолированного промпта на воспроизведение фактов. Несмотря на то, что генератор и верификатор используют одну и ту же базовую языковую модель, отделение генерации ответа от воспроизведения фактов снижает прямое обусловливание ответа и минимизирует предвзятость подтверждения при верификации с использованием логического вывода на естественном языке (NLI). Для выборочного исправления только опровергнутых утверждений применяется адаптивный статистический порог, определяемый как τ = µ + kσ по распределению показателей уверенности NLI. В отличие от предыдущих методов на основе NLI, опирающихся на фиксированные границы принятия решений, предлагаемая структура динамически адаптирует порог верификации к распределению уверенности для каждого конкретного ответа, демонстрируя стабильную эффективность на оцениваемых бенчмарках без необходимости переобучения модели. При тестировании на TruthfulQA и FEVER структура снизила уровень галлюцинаций на TruthfulQA с 28% до 9% — относительное снижение на 67,9%, при этом дополнительная задержка составила всего 160 ms по сравнению с базовой LLM, а точность обнаружения галлюцинаций оказалась выше, чем у SelfCheckGPT и FActScore. Эти результаты показывают, что предлагаемая структура обеспечивает оптимальный баланс между фактической надежностью и временем отклика на исследуемых бенчмарках, хотя для окончательных выводов требуется дальнейшая валидация в различных предметных областях и условиях развертывания.

Введение

Большие языковые модели (LLM) стали основополагающими компонентами современных систем искусственного интеллекта, демонстрируя выдающиеся способности в широком спектре задач по обработке естественного языка, включая генерацию текста, ответы на вопросы, реферирование и сложное логическое рассуждение1. Их способность создавать беглые и контекстуально связные ответы ускорила их внедрение в таких высокозначимых областях, как поддержка принятия клинических решений, юридический анализ, программная инженерия и образовательные технологии2. Однако существует критическое и стойкое ограничение, которое подрывает их надежность в этих условиях: галлюцинации, при которых модели генерируют лингвистически правильные, но фактически неверные, необоснованные или полностью выдуманные ответы 3. Эмпирические исследования показывают, что частота галлюцинаций варьируется от 15% до более чем 40% в зависимости от задачи и модели, при этом даже современные системы, такие как GPT-4, демонстрируют заметные фактические несоответствия при специализированной оценке в конкретных областях2,3. Это ограничение создает серьезные риски в приложениях, требующих высокой точности, где ошибочные результаты могут привести к дезинформации, неправильной диагностике или принятию ошибочных решений4. Галлюцинации фундаментально возникают из-за вероятностной природы языкового моделирования: LLM генерируют токены, предсказывая статистически вероятные продолжения входных последовательностей, а не извлекая или анализируя проверенные фактические знания5. Как следствие, сгенерированные результаты могут содержать правдоподобно звучащие, но неточные утверждения, вводить необоснованные тезисы или смешивать семантически связанные, но фактически разные понятия6.

Существующие стратегии смягчения этой проблемы основаны на нескольких парадигмах, каждая из которых имеет существенные ограничения. Генерация с дополненной выборкой (RAG) снижает вероятность галлюцинаций, основывая ответы на внешних извлеченных документах, однако вносит значительные задержки в работу, требует доступа к поддерживаемым базам знаний и остается уязвимой к ошибкам поиска в специализированных областях или областях с ограниченными ресурсами7,8,9.

Хотя генератор ответов и генератор ссылок инициализируются с использованием одной и той же базовой модели GPT-3.5 Turbo, они работают в рамках разных целей промптинга и контекстов исполнения. Генератор ответов формирует неограниченный ответ на запрос пользователя, в то время как генератор ссылок выполняет изолированную задачу по воспроизведению фактов без доступа к ранее сгенерированному ответу. Такое разделение снижает эффекты прямого влияния ответа и ограничивает предвзятость подтверждения при проверке утверждений. Таким образом, в данной архитектуре сгенерированная ссылка рассматривается как процедурно независимая, а не статистически независимая.

В недавних исследованиях также изучались легковесные стратегии декодирования для уменьшения галлюцинаций при генерации текста без использования внешнего поиска или повторной верификации. Одним из репрезентативных подходов является декодирование путем контрастирования слоев (Decoding by Contrasting Layers, DoLA), которое повышает фактическую точность за счет сопоставления представлений из промежуточных и финальных слоев трансформера в процессе декодирования. В отличие от систем верификации после генерации, такие методы воздействуют непосредственно на процесс генерации токенов и, следовательно, оптимизируют другой этап процесса генерации языка. Эти взаимодополняющие стратегии показывают, что снижение галлюцинаций может быть достигнуто либо во время декодирования, либо посредством постгенерационной верификации, при этом каждый подход предлагает свои компромиссы в отношении вычислительных затрат, сложности реализации и фактической надежности.

Методы самосогласованности повышают фактическую достоверность путем выборки нескольких ответов и выбора наиболее часто встречающегося или связного результата, однако их вычислительная стоимость линейно растет с увеличением количества выборок, что делает их непригодными для развертывания в системах, чувствительных к задержкам8. Подходы к итеративному уточнению, которые неоднократно пересматривают результаты через циклы самоотзыва, постепенно снижают частоту ошибок, но существенно увеличивают время вывода с каждым дополнительным проходом9. Методы верификации на основе NLI представляют собой более целенаправленную альтернативу, оценивая семантическое следование между сгенерированными утверждениями и эталонными текстами, однако существующие реализации опираются на фиксированные пороги принятия решений, которые не адаптируются к различным распределениям уверенности, доменам или поведению моделей10,11. В совокупности эти подходы либо создают неприемлемые вычислительные затраты, либо зависят от внешней инфраструктуры, либо лишены адаптивности, необходимой для generalized deployment. Сравнение основных характеристик этих подходов к верификации галлюцинаций представлено в Дополнительной таблице 1.

В данной работе предлагается облегченный двухэтапный фреймворк верификации утверждений, предназначенный для снижения частоты галлюцинаций в ответах LLM при сохранении низкой задержки отклика. На первом этапе LLM генерирует первичный ответ, который затем разлагается на атомарные фактические утверждения. На втором этапе каждое утверждение проверяется с помощью логического вывода на естественном языке (NLI) путем сопоставления с отдельно сгенерированным фактическим эталоном, полученным в ходе изолированного цикла рассуждений без доступа к первоначальному ответу; при этом решение о принятии или исправлении на уровне утверждения определяется статистически выведенным порогом уверенности. Основной вклад данной работы заключается в следующем: (1) разработка двухэтапного конвейера верификации на уровне утверждений, который отделяет генерацию ответа от фактической валидации, что позволяет проводить независимую и целенаправленную оценку каждого атомарного утверждения без необходимости внешнего поиска или полной регенерации ответа; (2) внедрение механизма адаптивного статистического порога, основанного на распределении показателей уверенности NLI (τ = µ + kσ), который динамически определяет границы принятия и исправления вместо использования фиксированных правил принятия решений, что повышает робастность при различных распределениях уверенности; (3) разработка стратегии селективной коррекции, которая ограничивает регенерацию только теми утверждениями, которые классифицированы как противоречивые, что существенно снижает вычислительные затраты по сравнению с методами полного пересэмплирования ответа или итеративного уточнения; (4) проведение эмпирической оценки на бенчмарке, ориентированном на выявление галлюцинаций, которая демонстрирует, что предлагаемый фреймворк снижает уровень галлюцинаций с 28% до 9%, сохраняя при этом задержку ответа в пределах допустимых норм для практического развертывания.

Протокол

Данное исследование не предусматривало участия людей, животных, использования биологических образцов или данных пациентов. Таким образом, одобрение институционального этического комитета и информированное согласие не требовались.

Обзор дизайна исследования

Для повышения фактической достоверности ответов больших языковых моделей (LLM) была внедрена двухэтапная система верификации. Процедура включала в себя генерацию ответа, извлечение утверждений, построение изолированных ссылок, верификацию на основе логического вывода на естественном языке (NLI), адаптивное статистическое принятие решений, селективную коррекцию и окончательную сборку ответа. Эффективность системы оценивалась с использованием наборов данных TruthfulQA и FEVER.

Общий рабочий процесс

Запрос пользователя → Генерация первоначального ответа → Извлечение утверждений → Независимая генерация ссылок → NLI-верификация → Вычисление статистического порога → Коррекция утверждений → Окончательный проверенный ответ. Общий рабочий процесс адаптивной системы верификации утверждений проиллюстрирован на Рисунке 1.

Подготовка набора данных

Набор данных TruthfulQA12, содержащий 817 вопросов, ориентированных на факты, был загружен и подготовлен для оценки. Набор данных FEVER13 состоит из 185 445 аннотированных утверждений, помеченных как «Подтверждено» (Supported), «Опровергнуто» (Refuted) или «Недостаточно информации» (Not Enough Information); для оценки использовались размеченные данные для разработки с полями утверждения, доказательства и эталонной метки. Каждое утверждение оценивалось на основе предоставленных доказательств, при этом исходная метка FEVER сохранялась в качестве эталонного результата для проверки. Набор данных FEVER, содержащий пары «утверждение-доказательство» для проверки фактов, был получен и предварительно обработан. Входные вопросы и утверждения были преобразованы в стандартизированный текстовый формат. Перед проведением экспериментов были удалены дубликаты и неполные образцы. TruthfulQA был разделен на валидационную и тестовую подвыборки. Примерно 20% образцов TruthfulQA (164 вопроса) использовались для настройки порога, а остальные 653 вопроса были зарезервированы для оценки производительности. Для FEVER утверждения, предоставленные в бенчмарке, использовались непосредственно в качестве единиц проверки и не проходили процедуру генерации ответа и извлечения утверждений, применявшуюся к TruthfulQA. Характеристики наборов данных бенчмарков, использованных для разработки и оценки структуры, обобщены в Таблице 1.

Первичная генерация ответа

Каждый запрос был направлен в базовую языковую модель. Ответы генерировались с использованием ядерного сэмплирования (nucleus sampling) при температуре 0,7 и значении top-p 0,9. Максимальная длина выходного текста была ограничена 256 токенами. Сгенерированные ответы сохранялись без какой-либо постобработки или ручной правки. Сгенерированный текст направлялся непосредственно на этап извлечения утверждений.

Извлечение утверждений

Каждый сгенерированный ответ был разложен на независимо проверяемые фактологические утверждения. Для выявления атомарных утверждений использовался структурированный запрос на декомпозицию. Составные высказывания были разделены на минимальные фактологические единицы. Субъективные мнения, стилистические выражения и разговорные слова-паразиты были удалены. Каждое извлеченное утверждение было сохранено как отдельная единица верификации.

Пример:

Исходный ответ:

"Мария Кюри была физиком и химиком польского происхождения, которая проводила новаторские исследования в области радиоактивности."

Извлеченные утверждения: (1) Мария Кюри родилась в Польше; (2) Мария Кюри была физиком и химиком; (3) Мария Кюри проводила исследования в области радиоактивности.

Конструирование изолированного референса:

Для каждого извлеченного утверждения была создана независимая фактическая ссылка. Модель-верификатор получала только исходный запрос пользователя. Доступ к первоначальному сгенерированному ответу был ограничен во избежание систематической ошибки подтверждения. Для стимулирования кратких, основанных на доказательствах ответов использовался промпт фактического воспроизведения. Сгенерированные ссылки были сохранены для последующей проверки.

Верификация логического вывода на естественном языке

Каждая пара «утверждение-ссылка» была подана в предварительно обученную модель NLI. Модель NLI классифицировала связь как: следование (Entailment), нейтральность (Neutral) или противоречие (Contradiction). Были зафиксированы вероятности достоверности для всех трех классов. Присваивался знаковый показатель верификации: положительное значение для следования, ноль для нейтральности или отрицательное значение для противоречия. Все показатели верификации были собраны для расчета порога.

Адаптивное вычисление статистического порога

Доверительная вероятность верификации, выдаваемая моделью NLI, существенно варьируется между разными ответами, поскольку различные запросы порождают разное количество утверждений, имеют разный уровень семантической сложности и разное распределение показателей уверенности. Фиксированный глобальный порог предполагает, что все ответы обладают схожим профилем уверенности, что на практике встречается редко. Чтобы учесть эту изменчивость, предлагаемая структура оценивает границу принятия решения индивидуально для каждого ответа, используя среднее значение и стандартное отклонение его показателей верификации. Среднее значение отражает общий уровень уверенности в ответе, в то время как стандартное отклонение характеризует разброс значений уверенности среди извлеченных утверждений. Такая адаптивная формулировка позволяет критерию приемлемости подстраиваться под неопределенность конкретного ответа, а не полагаться на единый порог для всех входных данных.

Были рассчитаны среднее значение (µ) и стандартное отклонение (σ) всех подписанных баллов верификации.

Адаптивный порог принятия решения рассчитывали следующим образом:

figure-protocol-1

где τ представляет собой адаптивный порог, µ обозначает средний балл верификации, σ обозначает стандартное отклонение, а k представляет собой параметр чувствительности.

Параметр чувствительности был инициализирован на уровне 0.7. Утверждения, классифицированные как «Следование» (Entailment) с показателями больше или равными +τ, были приняты. Утверждения, классифицированные как «Противоречие» (Contradiction) с показателями меньше или равными −τ, были отмечены для исправления. Утверждения с показателями в интервале (−τ, +τ) были оставлены как нейтральные.

Селективная коррекция формулы изобретения

Утверждение направлялось на исправление только в том случае, если модель NLI классифицировала пару «утверждение-ссылка» как Противоречие (Contradiction), а соответствующий знаковый показатель верификации удовлетворял критерию адаптивного порога si ≤ -τ. Таким образом, решение об исправлении определялось совместно меткой класса NLI и статистическим порогом, специфичным для ответа. Утверждения, классифицированные как Следующее (Entailment) с si ≥ τ, принимались, тогда как утверждения, попадающие в интервал -τ < si < τ, рассматривались как нейтральные и сохранялись без исправлений. Этот комбинированный критерий гарантировал, что исправление применялось только к тем утверждениям, которые демонстрировали одновременно семантическое противоречие и достаточно сильные отрицательные доказательства верификации.

Реконструкция ответа

Принятые и исправленные утверждения были расположены в их исходной последовательности. Для обеспечения удобочитаемости были восстановлены границы предложений. При необходимости вносились незначительные грамматические правки. Скомпонованный результат был сохранен в качестве окончательного проверенного ответа.

Оценка эффективности

Эффективность системы оценивали с помощью четырех показателей: (1) точность (Accuracy): доля ответов, которые остались фактически верными после верификации; (2) F1-мера (F1 Score): гармоническое среднее точности и полноты обнаружения галлюцинаций; (3) задержка ответа (Response Latency): общее время обработки от подачи запроса до генерации проверенного ответа; (4) уровень галлюцинаций (Hallucination Rate)

figure-protocol-2

Задержка была представлена как среднее время выполнения по результатам повторных измерений. Поскольку значения задержки для каждого отдельного запуска не сохранялись, стандартные отклонения и доверительные интервалы не рассчитывались.

Оценка корректности с учетом специфики бенчмарка

Для TruthfulQA окончательный проверенный ответ сравнивали с эталонными ответами, подтвержденными людьми, и списками неправильных ответов данного бенчмарка. Ответ считался правильным, если его фактические утверждения соответствовали принятой информации об ответе и не содержали контента, соответствующего выявленным паттернам неправильных ответов. Для FEVER каждое утверждение в окончательном результате оценивалось на основе соответствующего ему доказательства и исходной аннотации FEVER; утверждения со статусом Supported (Подтверждено) считались фактически проверенными, тогда как утверждения со статусом Refuted (Опровергнуто) считались неправильными. Случаи Not Enough Information (Недостаточно информации) оставались неопределенными и не рассматривались как положительные фактические доказательства. Полученные решения на уровне отдельных утверждений агрегировались по каждому бенчмарку для расчета сообщаемых показателей точности (Accuracy) и частоты галлюцинаций (Hallucination Rate).

Экспериментальная среда

Фреймворк был реализован с использованием Python 3.9. Операции по обработке данных выполнялись с помощью библиотек для численного и табличного анализа. Модель NLI работала в режиме вывода (inference mode) без дополнительного дообучения. Эксперименты проводились на рабочей станции, оснащенной процессором Intel Core i5, 16 GB оперативной памяти и 64-битной операционной системой. Все оценки проводились с использованием однопроходного режима вывода для обеспечения низкой задержки работы. Все эксперименты выполнялись с использованием идентичных аппаратных и программных конфигураций для обеспечения согласованности оценки различных наборов данных и базовых методов.

Ожидаемый результат

Данный протокол разработан для принятия решений о верификации на уровне отдельных утверждений путем выявления потенциально необоснованных тезисов и выборочного направления строго опровергаемых утверждений на исправление. Ожидаемым результатом является верифицированный ответ с сокращенным количеством фактических несоответствий и ограниченными дополнительными затратами на обработку, в зависимости от показателей, наблюдаемых в ходе экспериментальной оценки.

Результаты

Первичная генерация ответа

Базовая языковая модель генерировала беглые и контекстуально релевантные ответы на вопросы из обоих эталонных наборов данных. Однако детальный анализ выявил необоснованные и фактически неточные утверждения в нескольких ответах. На наборе данных TruthfulQA уровень галлюцинаций базовой системы составил 28%, в то время как на наборе данных FEVER наблюдался уровень галлюцинаций 26%. Эти результаты подтвердили, что одной прямой генерации языка недостаточно для приложений, требующих высокой фактической достоверности, и определили базовое состояние, с которым сравнивались все последующие процедуры верификации.

Извлечение утверждений

Процедура извлечения утверждений позволила успешно разбить сгенерированные ответы на независимо проверяемые фактологические единицы. Ответы из TruthfulQA содержали в среднем 3,2 атомарных утверждения, в то время как образцы FEVER, как правило, состояли из одного утверждения. Процесс декомпозиции позволил изолировать фактологические утверждения без внесения дополнительной информации, что обеспечило возможность отдельной оценки каждого высказывания. Данное наблюдение подтвердило гипотезу о том, что проверка на уровне отдельных утверждений обеспечивает более высокую точность, чем оценка ответов целиком как единого целого.

Независимое построение референса

Для каждого извлеченного утверждения были созданы независимые эталоны с использованием отдельного процесса рассуждения, основанного исключительно на исходном запросе. Сгенерированные эталоны содержали краткие фактические описания, которые были достаточно отличны от исходных ответов, чтобы служить независимыми источниками проверки. Процесс создания эталонов был изолирован от формирования первоначального ответа, чтобы избежать прямого влияния предыдущего вывода модели на фактический эталон. Такое разделение было направлено на снижение возможной предвзятости подтверждения и создание контролируемой основы для последующей проверки на уровне отдельных утверждений; в исследовании степень этого эффекта количественно не оценивалась. Успешное создание независимых эталонов подтвердило предложенный принцип проектирования, заключающийся в разделении процесса извлечения знаний и генерации ответа.

Верификация логического вывода на естественном языке

Этап верификации с помощью NLI эффективно классифицировал пары «утверждение-ссылка» по категориям: следование (entailment), противоречие (contradiction) и нейтральность (neutral). Противоречивые утверждения последовательно получали отрицательные баллы верификации, в то время как фактически подтвержденные утверждения получали положительные баллы. Нейтральная классификация присваивалась утверждениям, для которых было недостаточно подтверждающих доказательств. Такое поведение продемонстрировало, что семантический вывод может надежно идентифицировать неподтвержденные фактические высказывания и обеспечить доказательства, необходимые для точечного исправления. По сравнению с простой стратегией проверки согласованности, верификация NLI снизила частоту галлюцинаций с 20% до 15%, что указывает на улучшение способности обнаружения ошибок.

Адаптивное статистическое пороговое преобразование

Применение адаптивного статистического порога позволило дополнительно повысить эффективность верификации за счет динамической корректировки границ принятия решения на основе распределения показателей достоверности каждого ответа. Анализ чувствительности порога показал, что производительность улучшалась при увеличении параметра порога с 0.3 до 0.7. При значении чувствительности 0.7 система достигла точности 0.87, при этом уровень галлюцинаций снизился до 9% (Рисунок 2). Полные результаты анализа чувствительности для оцениваемых значений k представлены в Дополнительной таблице 2. Дальнейшее увеличение порога приводило лишь к незначительному росту точности при одновременном увеличении задержки. Эти наблюдения подтвердили гипотезу о том, что адаптивные пороги более эффективны, чем фиксированные границы принятия решения, при работе с различными распределениями достоверности в ответах.

Адаптивный порог также отражает вариативность показателей достоверности в каждом ответе. Ответы с высокосогласованными показателями верификации дают меньшее стандартное отклонение, что приводит к более селективной границе принятия решения. Напротив, ответы, содержащие утверждения с неоднородными значениями достоверности, дают большее стандартное отклонение, что расширяет область принятия и сокращает количество излишних исправлений для неопределенных утверждений. Хотя такое адаптивное поведение не может полностью устранить все ложноположительные или ложноотрицательные результаты, оно позволяет границе принятия решения реагировать на характеристики неопределенности каждого конкретного ответа вместо применения единого критерия ко всем входным данным.

Селективная коррекция формулы изобретения и сбор ответа

Для исправления были отправлены только те утверждения, которые были определены как противоречивые, в то время как подтвержденные и нейтральные утверждения остались без изменений. Такая стратегия выборочного исправления позволила минимизировать ненужную регенерацию и сохранить исходную структуру ответа. После исправления и реконструкции ответа уровень галлюцинаций в TruthfulQA снизился с 28% до 9%, что соответствует относительному сокращению на 67,9%. Аналогичные улучшения наблюдались в FEVER, где уровень галлюцинаций снизился с 26% до 10%. Сравнение точности и частоты галлюцинаций для оцениваемых конфигураций представлены на рисунках 3 и 4 соответственно.

Оценка эффективности

Сравнительная оценка показала, что предложенная структура обеспечила наивысшую общую эффективность среди всех протестированных методов. На наборе данных TruthfulQA структура достигла точности 0,87 и показателя F1 0,85, превзойдя как верификацию с фиксированным порогом, так и подходы, основанные на самосогласованности (Таблица 2, Рисунки 3 и 4). На FEVER структура достигла точности 0,89 и показателя F1 0,87 (Таблица 3, Рисунки 3 и 4). Поэтапный вклад компонентов структуры исследован с помощью абляционного анализа, представленного в Таблице 4. Эти улучшения подтвердили, что сочетание верификации на уровне утверждений с адаптивным статистическим принятием решений повысило фактическую достоверность на нескольких наборах данных. Сравнение точности обнаружения галлюцинаций для SelfCheckGPT, FActScore и предложенной структуры приведено на Рисунке 5.

Анализ латентного периода

Полный конвейер верификации сохранял низкие вычислительные затраты. Среднее время отклика увеличилось с 820 ms для базовой модели до 980 ms для полной структуры, что представляет собой лишь незначительное увеличение времени обработки (Таблица 5). Генерация ответа составила большую часть общей задержки, в то время как этапы верификации и коррекции внесли относительно небольшой дополнительный вклад в накладные расходы. Распределение времени обработки по этапам приведено в Дополнительной таблице 3. По сравнению с системами верификации на основе поиска, которым требовалось примерно 1600 ms на запрос, предлагаемая структура обеспечила существенно более низкую задержку при сохранении сопоставимой фактической точности. Эти результаты подтвердили гипотезу о том, что снижение количества галлюцинаций может быть достигнуто без ущерба для возможности использования системы в режиме реального времени.

Поскольку генерация ответов опирается на облачную языковую модель, отдельные измерения задержки подвержены колебаниям, обусловленным сетевыми условиями и серверным планированием, а не детерминированным временем выполнения. Поэтому для получения репрезентативных средних значений использовались повторные измерения, что позволило снизить влияние кратковременной вариабельности выполнения при сохранении возможности относительного сравнения оцениваемых методов. Значения задержки представлены как среднее время выполнения по результатам повторных экспериментальных прогонов. Индивидуальные значения задержки для каждого прогона не сохранялись, в связи с чем апостериорный расчет дисперсии, доверительных интервалов или других показателей вариабельности был невозможен. Соответственно, значения задержки и сравнение скорости и точности на Рисунке 6 представлены в виде точечных оценок без планок погрешностей.

В заключение, результаты показали, что сочетание извлечения утверждений, независимой генерации ссылок, проверки с помощью логического вывода на естественном языке (Natural Language Inference), адаптивного статистического порога и селективной коррекции повысило фактическую достоверность ответов больших языковых моделей. Данная структура позволила снизить частоту галлюцинаций с 28% до 9% в TruthfulQA и с 26% до 10% в FEVER. Результаты указывают на то, что адаптивная проверка на уровне отдельных утверждений улучшила показатели фактической достоверности при ограничении дополнительной задержки ответа в исследуемых условиях

Доступность данных

Наборы данных, проанализированные в данном исследовании, общедоступны через соответствующие официальные источники. В рукописи приведена информация о наборах данных, конфигурации моделей и методологические подробности, необходимые для воспроизведения описанного анализа. Обработанные оценочные данные и дополнительные результаты, полученные в ходе исследования, представлены в Дополнительных файлах.

figure-results-1
Рисунок 1: Схема работы адаптивной системы верификации утверждений. Первоначальный ответ, сгенерированный LLM, разбивается на фактические утверждения, после чего следуют независимая генерация ссылок, верификация на основе NLI, оценка достоверности и статистическое пороговое разделение. Утверждения, соответствующие критерию принятия, сохраняются, в то время как утверждения, соответствующие критерию исправления, проходят целевую корректировку перед окончательной сборкой ответа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-2
Рисунок 2: Влияние параметра чувствительности (k) на точность верификации. Точность на TruthfulQA и FEVER при значениях k, равных 0.3, 0.5, 0.7 и 1.0. Точность росла с увеличением k на обоих наборах данных; для основной оценки было выбрано значение k = 0.7. Нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

figure-results-3
Рисунок 3: Сравнение точности различных методов верификации. Точность базовой LLM, верификации на основе NLI и предложенного адаптивного фреймворка верификации на наборах данных TruthfulQA и FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-4
Рисунок 4: Сравнение частоты галлюцинаций при использовании различных методов верификации. Частота галлюцинаций для базовой LLM, верификации на основе NLI и предлагаемой структуры на наборах данных TruthfulQA и FEVER. Предлагаемая структура снизила частоту галлюцинаций с 28% до 9% на TruthfulQA и с 26% до 10% на FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-5
Рисунок 5: Точность обнаружения галлюцинаций при использовании различных методов. Точность обнаружения SelfCheckGPT, FActScore и предлагаемой структуры на наборах данных TruthfulQA и FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

figure-results-6
Рисунок 6: Компромисс между временем отклика и точностью для различных методов верификации. Зависимость между задержкой отклика и точностью для оцениваемых методов на наборах данных TruthfulQA и FEVER, иллюстрирующая компромисс между производительностью и задержкой, характерный для предлагаемого фреймворка и сравниваемых подходов. Нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Набор данныхИспользованные образцыОбластиСредняя длина ответа (токенов)Базовая частота галлюцинаций LLM
TruthfulQA81738 (наука, история, право и т. д.)4228%
FEVER1,000Общие фактические утверждения1826%

Таблица 1: Характеристики эталонного набора данных. Сводные данные по наборам данных TruthfulQA и FEVER, использованным для разработки и оценки системы, включая количество образцов, базовую точность, базовый уровень галлюцинаций и среднее количество утверждений на образец.

МетодТочностьТочностьПолнота (Recall)F1-мера% галлюцинаций
Базовая LLM (одиночный вывод)0.720.710.690.728%
Верификация на основе NLI (фиксированный порог)0.820.8150.7850.815%
SelfCheckGPT0.760.7550.7250.7422%
FActScore0.850.84250.81750.8311%
Предлагаемая структура (статистический порог)0.870.860.840.859%

Таблица 2: Сравнение производительности на TruthfulQA. Точность, прецизионность, полнота, F1-мера и частота галлюцинаций для базовой LLM, SelfCheckGPT, FActScore, верификации NLI и предлагаемой структуры.

МетодТочностьТочностьПолнотаF1-мера% галлюцинаций
SelfCheckGPT0.78
FActScore0.87
Базовая большая языковая модель (LLM)†0.740.730.710.7226%
Верификация на основе NLI (фиксированный порог)0.830.82250.79750.8114%
Предлагаемая структура (статистический порог)0.890.87750.86250.8710%

Таблица 3: Сравнение эффективности на наборе данных FEVER. Точность (Accuracy), прецизионность (precision), полнота (recall), F1-мера и уровень галлюцинаций для базовой LLM, SelfCheckGPT, FActScore, верификации NLI и предлагаемого фреймворка.

КонфигурацияТочность (Accuracy)Прецизионность (Precision)Полнота (Recall)F1 (добавлено)Частота галлюцинаций
Базовая языковая модель0.720.710.690.728%
Базовая модель + вторичная проверка (без NLI)0.780.77250.74750.76*20%
Базовая модель + верификация на основе NLI (фиксированный порог)0.820.8150.7850.815%
Базовая модель + модуль статистического принятия решений (полный)0.870.860.840.859%

Таблица 4: Абляционный анализ компонентов структуры.Изменения точности, показателя F1 и частоты галлюцинаций после последовательного включения вторичной валидации, NLI-верификации и адаптивного статистического порога.

МетодСреднее время реакции (мс)
Базовая LLM (одиночная генерация)820
Механизм самовалидации910
Предлагаемая статистическая модель980
Верификация с применением дополненной генерации (RAG)1600

Таблица 5: Задержка отклика при различных методах верификации. Среднее время отклика и дополнительная задержка относительно базовой LLM для Self-Validation (предложенная архитектура) и верификации с использованием дополненного поиска (retrieval-augmented verification).

Дополнительная таблица 1: Сравнение подходов к верификации галлюцинаций. Сравнение предлагаемой структуры с существующими методами с точки зрения внешнего поиска, верификации на уровне утверждений, адаптивного порога и эффективности обработки с точки зрения задержки.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 2: Анализ чувствительности порогового параметра (k). Точность (accuracy), прецизионность (precision), полнота (recall), F1-мера и частота галлюцинаций были определены при значениях порогового параметра 0.3, 0.5, 0.7 и 1.0. Для основной оценки использовалось значение k = 0.7.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 3: Время обработки на различных этапах конвейера верификации. Среднее время выполнения и процентный вклад генерации первоначального ответа, декомпозиции утверждений, генерации ссылок, NLI-вывода и селективной коррекции в общее время отклика.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 4: Распределение ошибок, выявленных в ходе верификации. Количество и процент ложноотрицательных, ложноположительных результатов и ошибок исправления, а также основные категории галлюцинаций, связанные с каждым типом ошибки.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Предложенная архитектура позволила повысить эффективность проверки фактов, избежав при этом повторной выборки и внешнего поиска. В тесте TruthfulQA уровень галлюцинаций снизился с 28% для базовой LLM до 9% при использовании полной архитектуры, в то время как точность увеличилась с 0,72 до 0,87. В тесте FEVER уровень галлюцинаций снизился с 26% до 10%, а точность выросла с 0,74 до 0,89. Данные сравнения следует интерпретировать в рамках экспериментальных настроек и реализаций, использованных в этом исследовании, а не как доказательство универсального превосходства во всех условиях развертывания. Архитектура осуществляет верификацию утверждений на уровне отдельных тезисов после генерации, используя изолированный фактический эталон и селективную коррекцию, что обеспечивает компромисс между опорой на внешние знания, повторным выводом и легковесной верификацией после генерации. Генераторы ответа и эталона используют одну и ту же базовую модель GPT-3.5 Turbo, но работают с разными целями промптинга и в изолированных контекстах исполнения. Генератор эталона получает только исходный запрос и не имеет доступа к ранее сгенерированному ответу. Таким образом, два процесса генерации являются процедурно, а не статистически независимыми и могут сохранять коррелированные фактические искажения, обусловленные общей предобученной моделью.

Сравнение с существующими подходами

Базовый метод NLI с фиксированным порогом применяет порог достоверности 0,7, основанный на предыдущих работах по проверке фактической точности с помощью NLI14. SelfCheckGPT15 представляет собой подход к обнаружению галлюцинаций без использования дополнительных ресурсов, который генерирует несколько стохастических выборок и использует NLI для выявления противоречивых утверждений. FActScore16 разделяет сгенерированные ответы на атомарные факты и проверяет их по извлеченным ссылкам из источника знаний на базе Wikipedia. В отличие от них, предлагаемая архитектура выполняет верификацию на уровне отдельных утверждений без повторной генерации полных ответов или внешнего поиска.

DoLA представляет собой дополнительный облегченный подход, который улучшает генерацию фактов путем сопоставления вероятностей токенов, полученных из различных слоев трансформера во время вывода. Прямое экспериментальное сравнение не проводилось, поскольку DoLA модифицирует процесс генерации токенов, в то время как предлагаемая архитектура осуществляет верификацию утверждений на уровне заявок после генерации и их селективную корректировку. Внедрение DoLA потребовало бы доступа к внутренним представлениям слоев трансформера, которые не предоставляются API GPT-3.5 Turbo, использованным в данном исследовании. Отсутствие внешнего поиска снижает зависимость от поиска и связанные с этим требования к обработке, но также ограничивает верификацию знаниями, доступными базовым моделям. Следовательно, полные вымыслы или специализированные утверждения, выходящие за рамки области знаний верификатора, по-прежнему трудно поддаются исправлению.

Адаптивное статистическое пороговое разделение и селективная коррекция

Адаптивный порог выводится из эмпирического распределения показателей достоверности и регулирует баланс между полнотой обнаружения галлюцинаций и точностью исправления. Анализ чувствительности проводился для значений 0,3, 0,5, 0,7 и 1,0 на отдельной валидационной выборке TruthfulQA. Значение k = 0,7 обеспечило наиболее сбалансированный компромисс между сокращением количества галлюцинаций и вычислительной эффективностью для оцениваемых бенчмарков.

Оптимальный порог может варьироваться в зависимости от области применения, поскольку распределение показателей уверенности NLI зависит от характера генерируемого контента. Таким образом, при применении в новой области может быть использован валидационный набор, отражающий целевое приложение, для оценки возможных значений и выбора значения, которое обеспечит баланс между эффективностью проверки фактов, частотой исправлений и задержкой обработки. Поскольку оптимизация порога предполагает изменение одного скалярного параметра, а не переобучение моделей, адаптация не требует модификации самих базовых моделей.

Селективная корректировка ограничивает регенерацию только теми утверждениями, которые классифицированы как «Противоречие» и удовлетворяют критерию статистического порога. Это позволяет избежать повторной обработки утверждений, не соответствующих критерию корректировки, и отличает данную структуру от подходов с перевыборкой полных ответов и итеративным уточнением.

Компромисс между задержкой и производительностью

Предложенная структура обеспечила среднее время отклика 980 ms по сравнению с 820 ms для базовой LLM и 1600 ms для верификации с дополнением поиском. Анализ на уровне этапов показал, что на генерацию первоначального ответа пришлось 83,7% общей задержки, в то время как вывод NLI составил 3,9%, а селективная коррекция — в среднем менее 1%. Значения задержки представлены как среднее время выполнения в ходе повторных экспериментальных запусков. Индивидуальные значения задержки для каждого запуска не сохранялись, поэтому апостериорный расчет дисперсии, доверительных интервалов или других показателей вариативности был невозможен. Соответственно, значения задержки и сравнение скорости и точности представлены в виде точечных оценок без планок погрешностей. Сообщаемые значения задержки отражают экспериментальную среду, использованную в данном исследовании, и могут варьироваться при различных условиях развертывания, особенно при использовании облачных API языковых моделей. Сетевая задержка, нагрузка на сервер и доступность сервиса могут независимо влиять на абсолютное время отклика, независимо от предложенной структуры верификации.

Анализ ошибок

Утверждения, которые были неверно обработаны в тестовом наборе данных TruthfulQA, были классифицированы как ложноотрицательные результаты, ложноположительные результаты или ошибки исправления. Распределение и основные категории этих ошибок обобщены в Дополнительной таблице 4. Ложноотрицательные результаты составили 52,6% всех ошибок и были в основном связаны с временными галлюцинациями и незначительными фактическими заменами. Временные ошибки могут быть пропущены, если верификатор имеет тот же порог даты обучения, что и базовая модель, в то время как незначительные фактические замены могут получить баллы NLI в диапазоне Neutral, а не Contradiction.

Ложноположительные результаты составили 35,9% ошибок и возникали преимущественно для редких, узкоспециализированных или недавно установленных фактов, выходящих за пределы области высокодостоверных знаний модели-верификатора. В таких случаях наблюдались низкие показатели логического вывода (NLI entailment), несмотря на фактическую правильность утверждений. Ошибки коррекции составили 11,5% всех ошибок; они возникали в ситуациях, когда выявлялись полные вымыслы, но в процессе коррекции создавалось другое недостоверное утверждение из-за недостаточного охвата знаний верификатором.

Эти результаты показывают, что остаточные ошибки возникают как из-за дискриминации NLI, так и из-за охвата знаний верификатора, особенно в случае временной неточности, тонких фактических замен, редких фактов и полных выдумок.

Статистический анализ

Частота галлюцинаций снизилась с 15% при верификации NLI с фиксированным порогом до 9% при использовании предлагаемой статистической модели, в то время как полный фреймворк снизил этот показатель с 28% для базовой модели до 9% на наборе данных TruthfulQA. Эти различия представлены как описательные изменения производительности; утверждения о формальной статистической значимости не приводятся, поскольку текущая оценка не включает результаты статистических тестов и оценки величины эффекта, необходимые для подтверждения такого вывода17,18.

Ограничения

Эффективность проверки в рамках данной структуры ограничена возможностями лежащей в ее основе модели NLI. DeBERTa-v3-large может испытывать трудности с детальным сравнением числовых данных, временными рассуждениями и утверждениями, требующими многошагового вывода на основе нескольких фактов. Ограничения модели NLI также были связаны с ложноотрицательными результатами при незначительных фактических заменах; кроме того, систематические недостатки модели NLI могут распространяться на решения по верификации.

Генераторы ответов и ссылок используют одну и ту же базовую модель GPT-3.5 Turbo. Хотя различные цели промптинга и изолированные контексты выполнения обеспечивают процедурную независимость, эти два процесса не являются статистически независимыми и могут сохранять коррелированные фактические искажения, присущие их общей предобученной модели.

Дополнительным ограничением является взаимосвязь между оценщиком и верификатором. Для окончательной оценки галлюцинаций используется та же модель NLI, которая верифицирует утверждения в рамках предлагаемого конвейера. Это может привести к согласованию между верификатором и оценщиком и повлиять на измеренные показатели улучшения. Следовательно, представленные результаты следует интерпретировать как производительность в рамках определенной процедуры оценки на основе NLI, а не как полностью независимое доказательство сокращения галлюцинаций. Более надежную валидацию обеспечила бы независимая экспертная оценка человеком или отдельно разработанная модель оценки.

Этап декомпозиции утверждений оценивался исключительно с точки зрения его вклада в сквозную верификацию и не проходил независимой проверки на соответствие границам утверждений, аннотированным человеком. Следовательно, в исследовании не приводится отдельная количественная оценка точности декомпозиции или ее индивидуального влияния на распространение ошибок при последующей верификации.

Оценка была ограничена наборами данных TruthfulQA и FEVER, а также контентом на английском языке. Таким образом, наблюдаемые результаты не подтверждают возможность обобщения для специализированных областей, многоязычных условий или генерации длинных текстов. Оптимальное значение k также может варьироваться в зависимости от области применения, поскольку распределение показателей достоверности NLI зависит от характера генерируемого контента. Следовательно, перед распространением полученных результатов за пределы условий, рассмотренных в данном исследовании, необходима специфическая для конкретной области калибровка и более широкая оценка.

Наконец, показатели задержки специфичны для конкретной экспериментальной конфигурации и могут варьироваться в зависимости от среды выполнения. Поскольку индивидуальные измерения задержки для каждого запуска не сохранялись, оценка вариабельности и доверительных интервалов post hoc оказалась невозможной. В будущих исследованиях следует сохранять индивидуальные измерения и проводить более широкую статистическую характеристику задержки в различных средах выполнения.

Дальнейшие исследования

В будущих исследованиях следует устранить основные ограничения, выявленные в рамках данной работы. Необходима калибровка порога с учетом специфики области, так как фиксированное значение (k = 0.7), выбранное с помощью TruthfulQA, может быть неоптимальным для специализированных областей с иным распределением показателей достоверности NLI. Для калибровки порога могут быть использованы данные валидации, специфичные для конкретной области, и, при необходимости, применены асимметричные штрафы за ложноотрицательные и ложноположительные ошибки19.

Улучшенная декомпозиция утверждений должна включать независимую оценку с использованием границ утверждений, размеченных человеком, для количественного определения полноты, правильности и распространения последующих ошибок. Дообученные модели декомпозиции и меры уверенности в декомпозиции могли бы дополнительно сократить количество ошибок, возникающих из-за плохо сегментированных утверждений. Будущие сравнительные оценки также должны включать легковесные подходы на основе декодирования, такие как DoLA, в рамках единого экспериментального протокола.

Легковесное расширение за счет поиска (retrieval augmentation) может помочь в решении проблемы полных вымыслов, которые трудно устранить, когда верификатору не хватает фактических знаний. Целевой резервный поиск для утверждений с низким уровнем уверенности, которые были опровергнуты, мог бы обеспечить внешнюю фактическую поддержку без необходимости выполнять поиск для каждого утверждения20.

Также требуется многоязычное расширение, поскольку текущая оценка ограничена англоязычными бенчмарками3. В будущих исследованиях следует оценить многоязычные модели NLI, а также специфичные для каждого языка промпты для декомпозиции и исправления утверждений на многоязычных бенчмарках галлюцинаций.

Заключение

В данном исследовании представлена двухэтапная система верификации утверждений, сочетающая декомпозицию атомарных утверждений, генерацию фактологических ссылок с использованием отдельных промптов, проверку методом NLI, адаптивное статистическое пороговое разделение и селективную коррекцию. На наборе данных TruthfulQA данная система позволила снизить уровень галлюцинаций с 28% до 9%, при этом средняя задержка увеличилась на 160 ms по сравнению с базовой LLM. На наборе данных FEVER уровень галлюцинаций снизился с 26% до 10%.

Предложенная структура обеспечила конкурентоспособную эффективность при проверке фактической точности без необходимости повторного сэмплирования полных ответов или внешнего поиска. Адаптивное пороговое разделение и селективная коррекция способствовали достижению наблюдаемых показателей, ограничивая при этом дополнительные вычислительные затраты. Тем не менее, полученные результаты ограничены оцененными бенчмарками и экспериментальными условиями, а также зависят от используемой NLI-модели, связки «оценщик–верификатор», неопределенности при декомпозиции утверждений, калибровки порогов для конкретных областей и вариативности задержки. Таким образом, требуется более широкая, независимая, предметно-ориентированная и многоязычная оценка перед распространением данных выводов на более широкие сценарии развертывания.

Раскрытие информации

Авторы заявляют об отсутствии конфликта интересов.

Благодарности

Авторы выражают искреннюю благодарность своему учреждению за предоставление академической среды и вычислительных ресурсов, необходимых для проведения данного исследования. Авторы также благодарят разработчиков и администраторов общедоступных эталонных наборов данных, использованных в этой работе, что позволило провести комплексную оценку предлагаемой структуры. Благодарность выражается коллегам и рецензентам за их конструктивные замечания, которые помогли повысить качество и ясность данной работы. Кроме того, авторы признательны сообществу исследователей открытого исходного кода за предоставление программных библиотек и инструментов, которые облегчили проведение экспериментов, анализ данных и визуализацию результатов. Их постоянные усилия значительно продвинули исследования в области обработки естественного языка и надежного искусственного интеллекта. Авторы заявляют, что для данного исследования не привлекалось внешнее финансовоеสนับสนุน или финансирование.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
набор данных для бенчмаркинга FEVERОбщая задача FEVER (Thorne et al.)https://fever.ai/dataset/fever.htmlОбщедоступный набор данных для проверки фактов, состоящий из пар «утверждение — доказательство» и используемый для оценки
GPT-3.5 Turbo (большая языковая модель B10+2:12:12)OpenAIИдентификатор модели: gpt-3.5-turbo; https://developers.openai.com/api/docs/models/gpt-3.5-turboИспользовался как в качестве генератора ответов, так и в качестве независимого генератора эталонных данных, доступ к которому осуществлялся через OpenAI API
NumPyРазработчики NumPy (открытый исходный код)https://numpy.org/Библиотека для численных вычислений, используемая для статистических расчетов, включая среднее значение и стандартное отклонение показателей верификации NLI
Openai (клиентская библиотека Python API)OpenAIhttps://github.com/openai/openai-pythonБиблиотека клиента Python, используемая для отправки промптов и получения ответов от GPT-3.5 Turbo
pandasкоманда разработчиков pandas (открытое ПО)https://pandas.pydata.org/Библиотека анализа табличных данных, используемая для предобработки наборов данных и обработки результатов
Предобученная модель классификации для логического вывода на естественном языке (NLI)Хаб моделей Hugging Face (модель, построенная на архитектуре DeBERTa-v3-large от Microsoft)MoritzLaurer/DeBERTa-v3-large-mnli-fever-anli-ling-wanliИспользуется в режиме логического вывода, без дополнительного обучения, для классификации каждой пары «утверждение — ссылка» как следствия, нейтрального отношения или противоречия
PythonPython Software FoundationВерсия 3.9; https://www.python.org/downloads/release/python-390/Основной язык программирования, использованный для реализации платформы верификации
SciPyРазработчики SciPy (открытое программное обеспечение)https://scipy.org/Библиотека для научных вычислений, используемая для статистического анализа результатов экспериментов
Трансформеры (библиотека Hugging Face Transformers)Hugging Facehttps://github.com/huggingface/transformersБиблиотека Python, используемая для загрузки и запуска предобученной модели NLI
контрольный набор данных TruthfulQAПервоначально опубликовано Лином, Хилтоном и Эвансомhttps://github.com/sylinrl/TruthfulQAОбщедоступный контрольный набор из 817 ориентированных на факты вопросов, используемый для настройки порога и оценки
Рабочая станцияНе указано в рукописи (пожалуйста, подтвердите производителя/модель)процессор Intel Core i5; 16 ГБ оперативной памяти; 64-разрядная операционная системаОборудование, использованное для проведения всех экспериментов при идентичных конфигурациях
Примечание: все вышеперечисленные URL-адреса были проверены и подтверждены как активные на дату составления данной таблицы. 

Ссылки

  1. Dai Z, et al. Promptagator: Few-shot dense retrieval from 8 examples [conference presentation]. Presented at: The Eleventh International Conference on Learning Representations; 2022. [https://iclr.cc/virtual/2023/poster/10937]
  2. Achiam J, et al. GPT-4 technical report. arXiv. 2023;arXiv:2303.08774. [https://arxiv.org/abs/2303.08774]
  3. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):1-38.
  4. Bender EM, McMillan-Major A, Shmitchell S, Gebru T. On the dangers of stochastic parrots: Can language models be too big? [conference presentation]. Presented at: 2021 ACM Conference on Fairness, Accountability, and Transparency; 2021. [https://dl.acm.org/doi/10.1145/3442188.3445922]
  5. Devlin J, et al. BERT: Pre-training of deep bidirectional transformers for language understanding [conference presentation]. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2019. [https://arxiv.org/abs/1810.04805]
  6. Maynez J, Narayan S, Bohnet B, McDonald R. On faithfulness and factuality in abstractive summarization [conference presentation]. Presented at: 58th Annual Meeting of the Association for Computational Linguistics; 2020. [https://arxiv.org/abs/2005.00661]
  7. Brown T, et al. Language models are few-shot learners. Adv Neural Inf Process Syst. 2020;33:1877-901.
  8. Guu K, et al. Retrieval augmented language model pre-training [conference presentation]. Presented at: International Conference on Machine Learning; 2020. [https://arxiv.org/abs/2002.08909]
  9. Izacard G, Grave E. Leveraging passage retrieval with generative models for open domain question answering [conference presentation]. Presented at: 16th Conference of the European Chapter of the Association for Computational Linguistics; 2021. [https://arxiv.org/abs/2007.01282]
  10. Bowman SR, Angeli G, Potts C, Manning CD. A large annotated corpus for learning natural language inference [conference presentation]. Presented at: 2015 Conference on Empirical Methods in Natural Language Processing; 2015. [https://arxiv.org/abs/1508.05326]
  11. Platt J. Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods. Adv Large Margin Classif. 1999;10(3):61-74.
  12. Lin S, Hilton J, Evans O. Truthfulqa: Measuring how models mimic human falsehoods. InProceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) 2022 May (pp. 3214-3252).
  13. Thorne J, Vlachos A, Christodoulopoulos C, Mittal A. FEVER: A large-scale dataset for fact extraction and verification [conference presentation]. Presented at: 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2018. [https://aclanthology.org/N18-1074/]
  14. Williams A, Nangia N, Bowman SR. A broad-coverage challenge corpus for sentence understanding through inference. arXiv. 2017;arXiv:1704.05426.
  15. Manakul P, Liusie A, Gales M. SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models [conference presentation]. Presented at: 2023 Conference on Empirical Methods in Natural Language Processing; 2023.
  16. Min S, et al. FActScore: Fine-grained atomic evaluation of factual precision in long-form text generation. arXiv. 2023;arXiv:2305.14251.
  17. Cohen J. Statistical power analysis for the behavioral sciences. Routledge; New York; 2013.
  18. Kadavath S, et al. Language models (mostly) know what they know. arXiv. 2022;arXiv:2207.05221.
  19. Hendrycks D, et al. Aligning AI with shared human values. arXiv. 2020;arXiv:2008.02275.
  20. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-74.

Перепечатки и разрешения

Теги

TruthfulQASelfCheckGPT
Видео скоро будет доступно