Исследовательская статья

Адаптивная верификация утверждений на основе NLI со статистическим моделированием принятия решений для снижения уровня галлюцинаций в больших языковых моделях с малой задержкой

81 просмотров

⸱

DOI:

10.3791/72636

⸱

3 сентября 2026 г.

В этой статье

Краткое содержание

В данном исследовании представлена легковесная архитектура для уменьшения галлюцинаций в больших языковых моделях посредством верификации на уровне утверждений и адаптивного статистического порога. Благодаря выборочному исправлению необоснованных утверждений с помощью логического вывода на естественном языке (Natural Language Inference), данный подход повышает фактическую точность при сохранении низкой задержки ответа и практической эффективности развертывания.

Аннотация

Большие языковые модели (LLM) демонстрируют критическую тенденцию к созданию фактически неверных, но лингвистически связных ответов — явление, называемое галлюцинацией, которое создает серьезные риски в областях, требующих высокой точности. Существующие стратегии минимизации этого эффекта, включая генерацию с дополнением поиском (RAG) и сэмплирование с самосогласованностью, либо приводят к значительному увеличению задержки вывода, либо зависят от внешней инфраструктуры знаний, что ограничивает их применение в системах реального времени. В данной работе предлагается легковесная двухэтапная структура верификации утверждений, которая разделяет ответы LLM на атомарные фактические утверждения и независимо проверяет каждое извлеченное утверждение по отдельно сгенерированному эталону, полученному с помощью изолированного промпта на воспроизведение фактов. Несмотря на то, что генератор и верификатор используют одну и ту же базовую языковую модель, отделение генерации ответа от воспроизведения фактов снижает прямое обусловливание ответа и минимизирует предвзятость подтверждения при верификации с использованием логического вывода на естественном языке (NLI). Для выборочного исправления только опровергнутых утверждений применяется адаптивный статистический порог, определяемый как τ = µ + kσ по распределению показателей уверенности NLI. В отличие от предыдущих методов на основе NLI, опирающихся на фиксированные границы принятия решений, предлагаемая структура динамически адаптирует порог верификации к распределению уверенности для каждого конкретного ответа, демонстрируя стабильную эффективность на оцениваемых бенчмарках без необходимости переобучения модели. При тестировании на TruthfulQA и FEVER структура снизила уровень галлюцинаций на TruthfulQA с 28% до 9% — относительное снижение на 67,9%, при этом дополнительная задержка составила всего 160 ms по сравнению с базовой LLM, а точность обнаружения галлюцинаций оказалась выше, чем у SelfCheckGPT и FActScore. Эти результаты показывают, что предлагаемая структура обеспечивает оптимальный баланс между фактической надежностью и временем отклика на исследуемых бенчмарках, хотя для окончательных выводов требуется дальнейшая валидация в различных предметных областях и условиях развертывания.

Введение

Большие языковые модели (LLM) стали основополагающими компонентами современных систем искусственного интеллекта, демонстрируя выдающиеся способности в широком спектре задач по обработке естественного языка, включая генерацию текста, ответы на вопросы, реферирование и сложное логическое рассуждение1. Их способность создавать беглые и контекстуально связные ответы ускорила их внедрение в таких высокозначимых областях, как поддержка принятия клинических решений, юридический анализ, программная инженерия и образовательные технологии2. Однако существует критическое и стойкое ограничение, которое подрывает их надежность в этих условиях: галлюцинации, при которых модели генерируют лингвистически правильные, но фактически неверные, необоснованные или полностью выдуманные ответы 3. Эмпирические исследования показывают, что частота галлюцинаций варьируется от 15% до более чем 40% в зависимости от задачи и модели, при этом даже современные системы, такие как GPT-4, демонстрируют заметные фактические несоответствия при специализированной оценке в конкретных областях2,3. Это ограничение создает серьезные риски в приложениях, требующих высокой точности, где ошибочные результаты могут привести к дезинформации, неправильной диагностике или принятию ошибочных решений4. Галлюцинации фундаментально возникают из-за вероятностной природы языкового моделирования: LLM генерируют токены, предсказывая статистически вероятные продолжения входных последовательностей, а не извлекая или анализируя проверенные фактические знания5. Как следствие, сгенерированные результаты могут содержать правдоподобно звучащие, но неточные утверждения, вводить необоснованные тезисы или смешивать семантически связанные, но фактически разные понятия6.

Существующие стратегии смягчения этой проблемы основаны на нескольких парадигмах, каждая из которых имеет существенные ограничения. Генерация с дополненной выборкой (RAG) снижает вероятность галлюцинаций, основывая ответы на внешних извлеченных документах, однако вносит значительные задержки в работу, требует доступа к поддерживаемым базам знаний и остается уязвимой к ошибкам поиска в специализированных областях или областях с ограниченными ресурсами7,8,9.

Хотя генератор ответов и генератор ссылок инициализируются с использованием одной и той же базовой модели GPT-3.5 Turbo, они работают в рамках разных целей промптинга и контекстов исполнения. Генератор ответов формирует неограниченный ответ на запрос пользователя, в то время как генератор ссылок выполняет изолированную задачу по воспроизведению фактов без доступа к ранее сгенерированному ответу. Такое разделение снижает эффекты прямого влияния ответа и ограничивает предвзятость подтверждения при проверке утверждений. Таким образом, в данной архитектуре сгенерированная ссылка рассматривается как процедурно независимая, а не статистически независимая.

В недавних исследованиях также изучались легковесные стратегии декодирования для уменьшения галлюцинаций при генерации текста без использования внешнего поиска или повторной верификации. Одним из репрезентативных подходов является декодирование путем контрастирования слоев (Decoding by Contrasting Layers, DoLA), которое повышает фактическую точность за счет сопоставления представлений из промежуточных и финальных слоев трансформера в процессе декодирования. В отличие от систем верификации после генерации, такие методы воздействуют непосредственно на процесс генерации токенов и, следовательно, оптимизируют другой этап процесса генерации языка. Эти взаимодополняющие стратегии показывают, что снижение галлюцинаций может быть достигнуто либо во время декодирования, либо посредством постгенерационной верификации, при этом каждый подход предлагает свои компромиссы в отношении вычислительных затрат, сложности реализации и фактической надежности.

Методы самосогласованности повышают фактическую достоверность путем выборки нескольких ответов и выбора наиболее часто встречающегося или связного результата, однако их вычислительная стоимость линейно растет с увеличением количества выборок, что делает их непригодными для развертывания в системах, чувствительных к задержкам8. Подходы к итеративному уточнению, которые неоднократно пересматривают результаты через циклы самоотзыва, постепенно снижают частоту ошибок, но существенно увеличивают время вывода с каждым дополнительным проходом9. Методы верификации на основе NLI представляют собой более целенаправленную альтернативу, оценивая семантическое следование между сгенерированными утверждениями и эталонными текстами, однако существующие реализации опираются на фиксированные пороги принятия решений, которые не адаптируются к различным распределениям уверенности, доменам или поведению моделей10,11. В совокупности эти подходы либо создают неприемлемые вычислительные затраты, либо зависят от внешней инфраструктуры, либо лишены адаптивности, необходимой для generalized deployment. Сравнение основных характеристик этих подходов к верификации галлюцинаций представлено в Дополнительной таблице 1.

В данной работе предлагается облегченный двухэтапный фреймворк верификации утверждений, предназначенный для снижения частоты галлюцинаций в ответах LLM при сохранении низкой задержки отклика. На первом этапе LLM генерирует первичный ответ, который затем разлагается на атомарные фактические утверждения. На втором этапе каждое утверждение проверяется с помощью логического вывода на естественном языке (NLI) путем сопоставления с отдельно сгенерированным фактическим эталоном, полученным в ходе изолированного цикла рассуждений без доступа к первоначальному ответу; при этом решение о принятии или исправлении на уровне утверждения определяется статистически выведенным порогом уверенности. Основной вклад данной работы заключается в следующем: (1) разработка двухэтапного конвейера верификации на уровне утверждений, который отделяет генерацию ответа от фактической валидации, что позволяет проводить независимую и целенаправленную оценку каждого атомарного утверждения без необходимости внешнего поиска или полной регенерации ответа; (2) внедрение механизма адаптивного статистического порога, основанного на распределении показателей уверенности NLI (τ = µ + kσ), который динамически определяет границы принятия и исправления вместо использования фиксированных правил принятия решений, что повышает робастность при различных распределениях уверенности; (3) разработка стратегии селективной коррекции, которая ограничивает регенерацию только теми утверждениями, которые классифицированы как противоречивые, что существенно снижает вычислительные затраты по сравнению с методами полного пересэмплирования ответа или итеративного уточнения; (4) проведение эмпирической оценки на бенчмарке, ориентированном на выявление галлюцинаций, которая демонстрирует, что предлагаемый фреймворк снижает уровень галлюцинаций с 28% до 9%, сохраняя при этом задержку ответа в пределах допустимых норм для практического развертывания.

Протокол

В данном исследовании не принимали участия люди, не использовались животные, биологические образцы или данные пациентов. Таким образом, одобрение институционального этического комитета и информированное согласие не требовались.

Обзор дизайна исследования

Для повышения фактической достоверности ответов больших языковых моделей (LLM) была внедрена двухэтапная система верификации. Процедура включала генерацию ответа, извлечение утверждений, построение изолированных ссылок, верификацию на основе логического вывода на естественном языке (NLI), адаптивное статистическое принятие решений, селективную коррекцию и окончательную сборку ответа. Эффективность системы была оценена с использованием наборов данных TruthfulQA и FEVER.

Общая схема рабочего процесса

Запрос пользователя → Генерация первоначального ответа → Извлечение утверждений → Независимая генерация ссылок → NLI-верификация → Вычисление статистического порога → Коррекция утверждений → Итоговый верифицированный ответ. Общий рабочий процесс адаптивной системы верификации утверждений проиллюстрирован на Рисунке 1.

Подготовка набора данных

Набор данных TruthfulQA12, содержащий 817 ориентированных на факты вопросов, был загружен и подготовлен для оценки. Набор данных FEVER13 состоит из 185 445 аннотированных утверждений, помеченных как «Подтверждено» (Supported), «Опровергнуто» (Refuted) или «Недостаточно информации» (Not Enough Information); при оценке использовались размеченные данные разработки с полями утверждения, доказательства и эталонной метки. Каждое утверждение оценивалось на основе предоставленных доказательств, в то время как исходная метка FEVER сохранялась в качестве контрольного результата для верификации. Набор данных FEVER, содержащий пары «утверждение-доказательство» для проверки фактов, был получен и предварительно обработан. Входные вопросы и утверждения были преобразованы в стандартизированный текстовый формат. Перед проведением экспериментов были удалены дубликаты и неполные образцы. TruthfulQA был разделен на подмножества для валидации и тестирования. Примерно 20% образцов TruthfulQA (164 вопроса) использовались для настройки порога, а остальные 653 вопроса были зарезервированы для оценки производительности. Для FEVER утверждения, предоставленные в бенчмарке, использовались непосредственно в качестве единиц верификации и не подвергались процедуре генерации ответа и извлечения утверждений, применявшейся к TruthfulQA. Характеристики наборов данных бенчмарков, использованных для разработки и оценки системы, обобщены в Таблице 1.

Первичная генерация ответа

Каждый запрос был отправлен в базовую языковую модель. Ответы генерировались с использованием ядерного семплирования (nucleus sampling) при температуре 0,7 и значении top-p 0,9. Максимальная длина вывода была ограничена 256 токенами. Сгенерированные ответы сохранялись без какой-либо последующей обработки или ручного изменения. Сгенерированный текст направлялся непосредственно на этап извлечения утверждений.

Извлечение утверждений

Каждый сгенерированный ответ был разложен на независимо проверяемые фактические утверждения. Для выявления атомарных утверждений использовался структурированный запрос на декомпозицию. Составные утверждения были разделены на минимальные фактические единицы. Субъективные мнения, стилистические выражения и разговорные слова-филлеры были удалены. Каждое извлеченное утверждение было сохранено как отдельная единица верификации.

Пример:

Исходный ответ:

«Мария Кюри была физиком и химиком польского происхождения, которая провела новаторские исследования в области радиоактивности».

Извлеченные утверждения: (1) Мария Кюри родилась в Польше; (2) Мария Кюри была физиком и химиком; (3) Мария Кюри проводила исследования в области радиоактивности.

Создание изолированного референсного контроля:

Для каждого извлеченного утверждения была создана независимая фактическая ссылка. Модель-верификатор получала только исходный запрос пользователя. Доступ к первоначально сгенерированному ответу был ограничен во избежание предвзятости подтверждения. Для стимулирования кратких, основанных на доказательствах ответов использовался промпт на фактическое воспроизведение. Сгенерированные ссылки были сохранены для последующей проверки.

Верификация логического вывода на естественном языке

Каждая пара «утверждение — ссылка» была передана в предварительно обученную модель NLI (естественного логического вывода). Модель NLI классифицировала связь как: следствие (Entailment), нейтральную (Neutral) или противоречие (Contradiction). Были зафиксированы вероятности достоверности для всех трех классов. Каждому утверждению был присвоен знаковый показатель верификации: положительное значение для следствия, ноль для нейтральной связи или отрицательное значение для противоречия. Все показатели верификации были собраны для расчета порогового значения.

Адаптивное вычисление статистического порога

Доверительный интервал верификации, создаваемый моделью NLI, существенно варьируется в зависимости от ответов, поскольку разные запросы генерируют различное количество утверждений, разный уровень семантической сложности и разные распределения уверенности. Фиксированный глобальный порог предполагает, что все ответы имеют схожий профиль уверенности, что на практике встречается редко. Чтобы учесть эту вариативность, предлагаемая структура оценивает границу принятия решения индивидуально для каждого ответа, используя среднее значение и стандартное отклонение его показателей верификации. Среднее значение отражает общий уровень уверенности в ответе, в то время как стандартное отклонение характеризует разброс значений уверенности среди извлеченных утверждений. Такая адаптивная формулировка позволяет критерию принятия подстраиваться под неопределенность конкретного ответа, а не полагаться на единый порог для всех входных данных.

Были рассчитаны среднее значение (µ) и стандартное отклонение (σ) всех знаковых показателей верификации.

Адаптивный порог принятия решения рассчитывали следующим образом:

Статическое равновесие; формула τ=μ+kσ; уравнение, понятие физики.

где τ представляет собой адаптивный порог, µ обозначает средний балл верификации, σ обозначает стандартное отклонение, а k представляет собой параметр чувствительности.

Параметр чувствительности был инициализирован на значении 0.7. Утверждения, классифицированные как «Следование» (Entailment) с показателями больше или равными +τ, были приняты. Утверждения, классифицированные как «Противоречие» (Contradiction) с показателями меньше или равными −τ, были отмечены для исправления. Утверждения с показателями в интервале (−τ, +τ) были оставлены как нейтральные.

Селективная коррекция пунктов формулы

Утверждение направлялось на исправление только в том случае, если модель NLI классифицировала пару «утверждение — ссылка» как противоречие (Contradiction) и соответствующий ей знаковый балл верификации удовлетворял критерию адаптивного порога si ≤ -τ. Таким образом, решение о корректировке совместно определялось меткой класса NLI и специфическим для конкретного ответа статистическим порогом. Утверждения, классифицированные как «Следование» (Entailment) со значением si были приняты, тогда как утверждения, попадающие в интервал -τ < si < Значения τ рассматривались как нейтральные и сохранялись без корректировки. Данный комбинированный критерий гарантировал, что корректировка применялась только к тем утверждениям, которые демонстрировали как семантическое противоречие, так и достаточно веские доказательства отрицательной верификации.

Реконструкция ответа

Принятые и исправленные утверждения были расположены в их исходной последовательности. Границы предложений были восстановлены для обеспечения читабельности. При необходимости были внесены незначительные грамматические правки. Сформированный результат был сохранен в качестве окончательного проверенного ответа.

Оценка эффективности

Эффективность системы оценивалась по четырем показателям: (1) Точность (Accuracy): доля ответов, которые остались фактически верными после верификации; (2) F1-мера (F1 Score): гармоническое среднее точности (precision) и полноты (recall) обнаружения галлюцинаций; (3) Задержка ответа (Response Latency): общее время обработки от момента подачи запроса до генерации верифицированного ответа; (4) Частота галлюцинаций (Hallucination Rate)

Формула частоты галлюцинаций, \( H(R) = \frac{\text{Number of hallucinated claims}}{\text{Total claims}} \times 100 \).

Задержка была представлена как среднее время выполнения по результатам повторных измерений. Поскольку значения задержки для каждого отдельного запуска не сохранялись, стандартные отклонения и доверительные интервалы не рассчитывались.

Оценка корректности с учетом специфики бенчмарка

Для TruthfulQA окончательный проверенный ответ сравнивали с эталонными ответами, подтвержденными людьми, и списками неправильных ответов. Ответ считался правильным, если содержащиеся в нем фактические утверждения соответствовали принятой информации об ответе и не содержали контента, соответствующего выявленным паттернам неправильных ответов. Для FEVER каждое утверждение в конечном результате оценивалось на основе соответствующего доказательства и исходной аннотации FEVER; утверждения со статусом Supported (подтверждено) считались фактически проверенными, а утверждения со статусом Refuted (опровергнуто) — неправильными. Случаи Not Enough Information (недостаточно информации) оставались неопределенными и не рассматривались как положительные фактические доказательства. Полученные решения на уровне отдельных утверждений объединялись по каждому бенчмарку для расчета сообщаемых показателей точности (Accuracy) и частоты галлюцинаций (Hallucination Rate).

Экспериментальная среда

Программный каркас был реализован с использованием Python 3.9. Операции обработки данных выполнялись с помощью библиотек для численного и табличного анализа. Модель NLI работала в режиме вывода без дополнительного дообучения. Эксперименты проводились на рабочей станции, оснащенной процессором Intel Core i5, 16 GB ОЗУ и 64-разрядной операционной системой. Все оценки проводились в режиме однопроходного вывода для обеспечения работы с низкой задержкой. Все эксперименты выполнялись с использованием идентичных аппаратных и программных конфигураций для обеспечения согласованности оценки различных наборов данных и базовых методов.

Ожидаемый результат

Данный протокол предназначен для принятия решений о верификации на уровне отдельных утверждений путем выявления потенциально необоснованных тезисов и выборочного направления на исправление тех утверждений, которые содержат явные противоречия. Ожидаемым результатом является верифицированный ответ с сокращением фактических несоответствий и ограниченными дополнительными затратами на обработку, в зависимости от показателей, полученных в ходе экспериментальной оценки.

Результаты

Генерация первоначального ответа

Базовая языковая модель генерировала беглые и контекстуально релевантные ответы на вопросы из обоих наборов эталонных данных. Однако детальный анализ выявил необоснованные и фактически неточные утверждения в ряде ответов. На наборе данных TruthfulQA уровень галлюцинаций базовой системы составил 28%, в то время как на наборе данных FEVER наблюдался уровень галлюцинаций 26%. Эти результаты подтвердили, что одной прямой генерации языка недостаточно для приложений, требующих высокой фактической достоверности, и определили базовое состояние, с которым сравнивались все последующие процедуры верификации.

Извлечение утверждений

Процедура извлечения утверждений успешно разложила сгенерированные ответы на независимо проверяемые фактические единицы. Ответы из TruthfulQA содержали в среднем 3,2 атомарных утверждения, в то время как образцы FEVER, как правило, состояли из одного утверждения. Процесс декомпозиции изолировал фактические утверждения без введения дополнительной информации, что позволило оценивать каждое высказывание по отдельности. Это наблюдение подтвердило гипотезу о том, что верификация на уровне отдельных утверждений обеспечивает более высокую точность, чем оценка ответов целиком как единого целого.

Независимое конструирование референса

Для каждого извлеченного утверждения были созданы независимые проверочные данные с использованием отдельного процесса рассуждения, основанного исключительно на исходном запросе. Созданные эталоны содержали краткие фактические описания, которые были достаточно отличны от исходных ответов, чтобы служить независимыми источниками проверки. Процесс генерации проверочных данных был изолирован от формирования первоначального ответа, чтобы избежать прямого влияния предыдущего вывода модели на содержание фактического эталона. Такое разделение было направлено на снижение возможного подтверждающего смещения и создание контролируемой основы для последующей верификации на уровне отдельных утверждений; в данном исследовании степень этого эффекта количественно не оценивалась. Успешная генерация независимых проверочных данных подтвердила предложенный принцип проектирования, заключающийся в отделении процесса воспроизведения знаний от процесса генерации ответа.

Верификация логического вывода на естественном языке

Этап верификации с помощью NLI эффективно классифицировал пары «утверждение-ссылка» по категориям: следование (entailment), противоречие (contradiction) и нейтральность (neutral). Противоречивые утверждения последовательно получали отрицательные баллы верификации, в то время как фактически подтвержденные утверждения получали положительные баллы. Нейтральная классификация присваивалась утверждениям, для которых было недостаточно подтверждающих доказательств. Такое поведение показало, что семантический вывод может надежно выявлять необоснованные фактические утверждения и предоставлять доказательства, необходимые для целенаправленного исправления. По сравнению с простой стратегией проверки согласованности, верификация NLI снизила уровень галлюцинаций с 20% до 15%, что свидетельствует об улучшении способности обнаружения.

Адаптивное статистическое порогатирование

Применение адаптивного статистического порога позволило дополнительно улучшить эффективность верификации за счет динамической корректировки решающих границ на основе распределения показателей уверенности для каждого ответа. Анализ чувствительности порога показал, что эффективность возрастала при увеличении параметра порога от 0,3 до 0,7. При значении чувствительности 0,7 фреймворк достиг точности 0,87, при этом уровень галлюцинаций снизился до 9% (Рисунок 2). Полные результаты анализа чувствительности для оцениваемых значений k представлены в Дополнительной таблице 2. Дальнейшее увеличение порога приводило лишь к незначительному приросту точности при одновременном увеличении задержки. Эти наблюдения подтвердили гипотезу о том, что адаптивные пороги более эффективны, чем фиксированные решающие границы, для обработки различных распределений уверенности в ответах.

Адаптивный порог также отражает вариативность показателей достоверности внутри каждого ответа. Ответы с высокосогласованными показателями верификации дают меньшее стандартное отклонение, что приводит к более селективной решающей границе. Напротив, ответы, содержащие утверждения с неоднородными значениями достоверности, дают большее стандартное отклонение, что ведет к расширению области принятия и сокращению излишних корректировок для неопределенных утверждений. Хотя такое адаптивное поведение не может устранить каждое ложноположительное или ложноотрицательное срабатывание, оно позволяет решающей границе реагировать на характеристики неопределенности каждого конкретного ответа вместо применения единого критерия ко всем входным данным.

Селективная коррекция формулы изобретения и сборка ответа

Для исправления были отправлены только те утверждения, которые были идентифицированы как противоречивые, в то время как подтвержденные и нейтральные утверждения остались без изменений. Такая стратегия селективного исправления позволила минимизировать излишнюю регенерацию и сохранить исходную структуру ответа. После исправления и реконструкции ответа уровень галлюцинаций в TruthfulQA снизился с 28% до 9%, что соответствует относительному сокращению на 67,9%. Аналогичные улучшения наблюдались в FEVER, где уровень галлюцинаций снизился с 26% до 10%. Сравнение точности и уровня галлюцинаций для оцениваемых конфигураций представлено на рисунках 3 и 4 соответственно.

Оценка эффективности

Сравнительная оценка показала, что предложенная структура обеспечила самые высокие общие показатели производительности среди всех протестированных методов. На наборе TruthfulQA структура достигла точности 0,87 и значения F1-меры 0,85, превзойдя как верификацию с фиксированным порогом, так и подходы на основе самосогласованности (Таблица 2, Рисунки 3 и 4). На наборе FEVER структура достигла точности 0,89 и значения F1-меры 0,87 (Таблица 3, Рисунки 3 и 4). Инкрементальный вклад компонентов структуры исследован с помощью абляционного анализа, представленного в Таблице 4. Эти улучшения подтвердили, что сочетание верификации на уровне утверждений с адаптивным статистическим принятием решений повысило фактическую надежность в нескольких наборах данных. Сравнение точности обнаружения галлюцинаций для SelfCheckGPT, FActScore и предложенной структуры представлено на Рисунке 5.

Анализ латентности

Полный конвейер верификации обеспечил низкие вычислительные затраты. Среднее время отклика увеличилось с 820 ms для базовой модели до 980 ms для полной структуры, что представляет собой лишь незначительное увеличение времени обработки (Таблица 5). Генерация ответа составила большую часть общей задержки, в то время как этапы верификации и коррекции внесли относительно небольшой дополнительный вклад в накладные расходы. Распределение времени обработки по этапам приведено в Дополнительной таблице 3. По сравнению с системами верификации на основе поиска, которые требовали примерно 1600 ms на один запрос, предложенная структура обеспечила существенно меньшую задержку при сохранении сопоставимой фактической точности. Эти результаты подтвердили гипотезу о том, что снижение количества галлюцинаций может быть достигнуто без ущерба для возможности использования системы в режиме реального времени.

Поскольку генерация ответов основана на облачной языковой модели, отдельные измерения задержки подвержены колебаниям из-за сетевых условий и серверного планирования, а не определенному времени выполнения. Поэтому для получения репрезентативных средних значений использовались повторные измерения, что позволило снизить влияние кратковременной вариативности выполнения, сохранив при этом возможность относительного сравнения оцениваемых методов. Значения задержки представлены как среднее время выполнения по нескольким повторным экспериментальным запускам. Индивидуальные значения задержки для каждого запуска не сохранялись, вследствие чего апостериорный расчет дисперсии, доверительных интервалов или других показателей вариативности был невозможен. Соответственно, значения задержки и сравнение скорости и точности на Рисунке 6 представлены в виде точечных оценок без планок погрешностей.

В заключение, результаты продемонстрировали, что сочетание извлечения утверждений, независимой генерации ссылок, верификации с помощью логического вывода на естественном языке (Natural Language Inference), адаптивного статистического порога и селективной коррекции повысило фактическую достоверность ответов больших языковых моделей. Данный подход позволил снизить уровень галлюцинаций с 28% до 9% в TruthfulQA и с 26% до 10% в FEVER. Результаты показывают, что адаптивная верификация на уровне утверждений улучшила показатели фактической достоверности, при этом ограничив дополнительную задержку отклика в исследуемых условиях

Доступность данных

Наборы данных, проанализированные в данном исследовании, доступны в открытом доступе через соответствующие официальные источники. В рукописи представлена информация о наборах данных, конфигурациях моделей и методологические подробности, необходимые для воспроизведения описанного анализа. Обработанные оценочные данные и дополнительные результаты, полученные в ходе исследования, представлены в дополнительных файлах.

Схема проверки утверждений с помощью ИИ; NLI, статистическая оценка, пути принятия решений, диаграмма процесса.
Рисунок 1: Рабочий процесс адаптивной системы проверки утверждений. Первоначальный ответ, сгенерированный LLM, разбивается на отдельные фактические утверждения, после чего следует независимая генерация ссылок, верификация на основе NLI, оценка достоверности и статистическое пороговое разделение. Утверждения, соответствующие критерию принятия, сохраняются, в то время как утверждения, соответствующие критерию исправления, подвергаются целевой корректировке перед окончательной сборкой ответа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

График сравнения точности в зависимости от порога для наборов данных TruthfulQA и FEVER; результаты анализа данных.
Рисунок 2: Влияние параметра чувствительности (k) на точность верификации.Точность для TruthfulQA и FEVER при значениях k, равных 0.3, 0.5, 0.7 и 1.0. Точность увеличивалась с ростом k для обоих наборов данных; для основной оценки было выбрано значение k = 0.7. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Столбчатая диаграмма, сравнивающая точность в TruthfulQA и FEVER для базового метода, метода NLI и предлагаемого метода.
Рисунок 3: Сравнение точности различных методов верификации. Точность базовой LLM, верификации на основе NLI и предлагаемой адаптивной структуры верификации на наборах данных TruthfulQA и FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Столбчатая диаграмма, сравнивающая частоту галлюцинаций для TruthfulQA и FEVER с использованием различных методов: Baseline, NLI и предлагаемого метода.
Рисунок 4: Сравнение частоты галлюцинаций в зависимости от метода верификации. Частота галлюцинаций для базовой LLM, верификации на основе NLI и предлагаемого фреймворка на наборах данных TruthfulQA и FEVER. Предлагаемый фреймворк снизил этот показатель с 28% до 9% для TruthfulQA и с 26% до 10% для FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Столбчатая диаграмма, сравнивающая точность обнаружения галлюцинаций в различных моделях; наборы данных TruthfulQA и FEVER.
Рисунок 5: Точность обнаружения галлюцинаций для различных методов. Точность обнаружения SelfCheckGPT, FActScore и предлагаемого фреймворка на наборах данных TruthfulQA и FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

График, сравнивающий точность и время отклика в мс для наборов данных TruthfulQA и FEVER.
Рисунок 6: Компромисс между временем отклика и точностью для различных методов верификации. Зависимость между временем задержки отклика и точностью для оцениваемых методов на TruthfulQA и FEVER, иллюстрирующая компромисс между производительностью и задержкой, связанный с предлагаемым фреймворком и сравнительными подходами. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Набор данныхИспользуемые образцыОбласти примененияСредняя длина ответа (токенов)Базовый уровень галлюцинаций LLM
TruthfulQA81738 (наука, история, право и т. д.)4228%
ЛИХОРАДКА1,000Общие фактические утверждения1826%

Таблица 1: Характеристики эталонного набора данных. Сводные данные по наборам данных TruthfulQA и FEVER, использованным для разработки и оценки фреймворка, включая количество образцов, базовую точность, базовый уровень галлюцинаций и среднее количество утверждений на образец.

МетодТочность (Accuracy)Прецизионность (Precision)Полнота (Recall)F1-мера% галлюцинаций
Базовая LLM (одиночный вывод)0.720.710.690.728%
Верификация на основе NLI (фиксированный порог)0.820.8150.7850.815%
SelfCheckGPT0.760.7550.7250.7422%
FActScore0.850.84250.81750.8311%
Предложенный фреймворк (статистический порог)0.870.860.840.859%

Таблица 2: Сравнение эффективности на наборе данных TruthfulQA. Точность (accuracy), прецизионность (precision), полнота (recall), F1-мера и частота галлюцинаций для базовой LLM, SelfCheckGPT, FActScore, верификации NLI и предлагаемой структуры.

МетодТочность (Accuracy)Прецизионность (Precision)Полнота (Recall)F1-мера% галлюцинаций
SelfCheckGPT0.78————
FActScore0.87————
Базовая LLM†0.740.730.710.7226%
Верификация на основе NLI (фиксированный порог)0.830.82250.79750.8114%
Предложенная платформа (статистический порог)0.890.87750.86250.8710%

Таблица 3: Сравнение эффективности на наборе данных FEVER. Точность, прецизионность, полнота, F1-мера и уровень галлюцинаций для базовой LLM, SelfCheckGPT, FActScore, верификации NLI и предлагаемой структуры.

КонфигурацияТочностьТочностьПолнота (Recall)F1 (добавлено)Частота галлюцинаций
Базовая языковая модель0.720.710.690.728%
Базовый уровень + вторичная проверка (без NLI)0.780.77250.74750.76*20%
Базовый уровень + верификация на основе NLI (фиксированный порог)0.820.8150.7850.815%
Базовая линия + модуль принятия статистических решений (полный)0.870.860.840.859%

Таблица 4: Абляционный анализ компонентов структуры. Изменения точности, F1-меры и частоты галлюцинаций после последовательного включения вторичной валидации, верификации NLI и адаптивного статистического порога.

МетодСреднее время реакции (мс)
Базовая LLM (одиночная генерация)820
Механизм самовалидации910
Предлагаемая статистическая модель980
Верификация с дополненной генерацией (RAG)1600

Таблица 5: Задержка отклика при различных методах верификации. Среднее время отклика и дополнительная задержка относительно базовой LLM для Self-Validation (предложенная структура) и верификации с использованием дополненного поиска.

Дополнительная таблица 1: Сравнение подходов к верификации галлюцинаций. Сравнение предлагаемой структуры с существующими методами по параметрам внешнего поиска, верификации на уровне утверждений, адаптивного порога и эффективности обработки с точки зрения задержки.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 2: Анализ чувствительности параметра порога (k). Точность (accuracy), прецизионность (precision), полнота (recall), F1-мера и уровень галлюцинаций были получены при значениях параметра порога 0,3, 0,5, 0,7 и 1,0. Для основной оценки использовалось значение k = 0,7.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 3: Время обработки на этапах конвейера верификации. Среднее время выполнения и процентный вклад генерации первичного ответа, декомпозиции утверждений, генерации ссылок, NLI-вывода и селективной коррекции в общее время ответа.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 4: Распределение ошибок, выявленных в ходе верификации. Количество и процент ложноотрицательных, ложноположительных результатов и ошибок исправления, а также основные категории галлюцинаций, связанные с каждым типом ошибки.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Предложенная архитектура позволила повысить эффективность проверки фактов, избежав при этом повторной выборки и внешнего поиска. В тесте TruthfulQA уровень галлюцинаций снизился с 28% для базовой LLM до 9% при использовании полной архитектуры, в то время как точность увеличилась с 0,72 до 0,87. В тесте FEVER уровень галлюцинаций снизился с 26% до 10%, а точность выросла с 0,74 до 0,89. Данные сравнения следует интерпретировать в рамках экспериментальных настроек и реализаций, использованных в этом исследовании, а не как доказательство универсального превосходства во всех условиях развертывания. Архитектура осуществляет верификацию утверждений на уровне отдельных тезисов после генерации, используя изолированный фактический эталон и селективную коррекцию, что обеспечивает компромисс между опорой на внешние знания, повторным выводом и легковесной верификацией после генерации. Генераторы ответа и эталона используют одну и ту же базовую модель GPT-3.5 Turbo, но работают с разными целями промптинга и в изолированных контекстах исполнения. Генератор эталона получает только исходный запрос и не имеет доступа к ранее сгенерированному ответу. Таким образом, два процесса генерации являются процедурно, а не статистически независимыми и могут сохранять коррелированные фактические искажения, обусловленные общей предобученной моделью.

Сравнение с существующими подходами

Базовый метод NLI с фиксированным порогом применяет порог достоверности 0,7, основанный на предыдущих работах по проверке фактической точности с помощью NLI14. SelfCheckGPT15 представляет собой подход к обнаружению галлюцинаций без использования дополнительных ресурсов, который генерирует несколько стохастических выборок и использует NLI для выявления противоречивых утверждений. FActScore16 разделяет сгенерированные ответы на атомарные факты и проверяет их по извлеченным ссылкам из источника знаний на базе Wikipedia. В отличие от них, предлагаемая архитектура выполняет верификацию на уровне отдельных утверждений без повторной генерации полных ответов или внешнего поиска.

DoLA представляет собой дополнительный облегченный подход, который улучшает генерацию фактов путем сопоставления вероятностей токенов, полученных из различных слоев трансформера во время вывода. Прямое экспериментальное сравнение не проводилось, поскольку DoLA модифицирует процесс генерации токенов, в то время как предлагаемая архитектура осуществляет верификацию утверждений на уровне заявок после генерации и их селективную корректировку. Внедрение DoLA потребовало бы доступа к внутренним представлениям слоев трансформера, которые не предоставляются API GPT-3.5 Turbo, использованным в данном исследовании. Отсутствие внешнего поиска снижает зависимость от поиска и связанные с этим требования к обработке, но также ограничивает верификацию знаниями, доступными базовым моделям. Следовательно, полные вымыслы или специализированные утверждения, выходящие за рамки области знаний верификатора, по-прежнему трудно поддаются исправлению.

Адаптивное статистическое пороговое разделение и селективная коррекция

Адаптивный порог выводится из эмпирического распределения показателей достоверности и регулирует баланс между полнотой обнаружения галлюцинаций и точностью исправления. Анализ чувствительности проводился для значений 0,3, 0,5, 0,7 и 1,0 на отдельной валидационной выборке TruthfulQA. Значение k = 0,7 обеспечило наиболее сбалансированный компромисс между сокращением количества галлюцинаций и вычислительной эффективностью для оцениваемых бенчмарков.

Оптимальный порог может варьироваться в зависимости от области применения, поскольку распределение показателей уверенности NLI зависит от характера генерируемого контента. Таким образом, при применении в новой области может быть использован валидационный набор, отражающий целевое приложение, для оценки возможных значений и выбора значения, которое обеспечит баланс между эффективностью проверки фактов, частотой исправлений и задержкой обработки. Поскольку оптимизация порога предполагает изменение одного скалярного параметра, а не переобучение моделей, адаптация не требует модификации самих базовых моделей.

Селективная корректировка ограничивает регенерацию только теми утверждениями, которые классифицированы как «Противоречие» и удовлетворяют критерию статистического порога. Это позволяет избежать повторной обработки утверждений, не соответствующих критерию корректировки, и отличает данную структуру от подходов с перевыборкой полных ответов и итеративным уточнением.

Компромисс между задержкой и производительностью

Предложенная структура обеспечила среднее время отклика 980 ms по сравнению с 820 ms для базовой LLM и 1600 ms для верификации с дополнением поиском. Анализ на уровне этапов показал, что на генерацию первоначального ответа пришлось 83,7% общей задержки, в то время как вывод NLI составил 3,9%, а селективная коррекция — в среднем менее 1%. Значения задержки представлены как среднее время выполнения в ходе повторных экспериментальных запусков. Индивидуальные значения задержки для каждого запуска не сохранялись, поэтому апостериорный расчет дисперсии, доверительных интервалов или других показателей вариативности был невозможен. Соответственно, значения задержки и сравнение скорости и точности представлены в виде точечных оценок без планок погрешностей. Сообщаемые значения задержки отражают экспериментальную среду, использованную в данном исследовании, и могут варьироваться при различных условиях развертывания, особенно при использовании облачных API языковых моделей. Сетевая задержка, нагрузка на сервер и доступность сервиса могут независимо влиять на абсолютное время отклика, независимо от предложенной структуры верификации.

Анализ ошибок

Утверждения, которые были неверно обработаны в тестовом наборе данных TruthfulQA, были классифицированы как ложноотрицательные результаты, ложноположительные результаты или ошибки исправления. Распределение и основные категории этих ошибок обобщены в Дополнительной таблице 4. Ложноотрицательные результаты составили 52,6% всех ошибок и были в основном связаны с временными галлюцинациями и незначительными фактическими заменами. Временные ошибки могут быть пропущены, если верификатор имеет тот же порог даты обучения, что и базовая модель, в то время как незначительные фактические замены могут получить баллы NLI в диапазоне Neutral, а не Contradiction.

Ложноположительные результаты составили 35,9% ошибок и возникали преимущественно для редких, узкоспециализированных или недавно установленных фактов, выходящих за пределы области высокодостоверных знаний модели-верификатора. В таких случаях наблюдались низкие показатели логического вывода (NLI entailment), несмотря на фактическую правильность утверждений. Ошибки коррекции составили 11,5% всех ошибок; они возникали в ситуациях, когда выявлялись полные вымыслы, но в процессе коррекции создавалось другое недостоверное утверждение из-за недостаточного охвата знаний верификатором.

Эти результаты показывают, что остаточные ошибки возникают как из-за дискриминации NLI, так и из-за охвата знаний верификатора, особенно в случае временной неточности, тонких фактических замен, редких фактов и полных выдумок.

Статистический анализ

Частота галлюцинаций снизилась с 15% при верификации NLI с фиксированным порогом до 9% при использовании предлагаемой статистической модели, в то время как полный фреймворк снизил этот показатель с 28% для базовой модели до 9% на наборе данных TruthfulQA. Эти различия представлены как описательные изменения производительности; утверждения о формальной статистической значимости не приводятся, поскольку текущая оценка не включает результаты статистических тестов и оценки величины эффекта, необходимые для подтверждения такого вывода17,18.

Ограничения

Эффективность проверки в рамках данной структуры ограничена возможностями лежащей в ее основе модели NLI. DeBERTa-v3-large может испытывать трудности с детальным сравнением числовых данных, временными рассуждениями и утверждениями, требующими многошагового вывода на основе нескольких фактов. Ограничения модели NLI также были связаны с ложноотрицательными результатами при незначительных фактических заменах; кроме того, систематические недостатки модели NLI могут распространяться на решения по верификации.

Генераторы ответов и ссылок используют одну и ту же базовую модель GPT-3.5 Turbo. Хотя различные цели промптинга и изолированные контексты выполнения обеспечивают процедурную независимость, эти два процесса не являются статистически независимыми и могут сохранять коррелированные фактические искажения, присущие их общей предобученной модели.

Дополнительным ограничением является взаимосвязь между оценщиком и верификатором. Для окончательной оценки галлюцинаций используется та же модель NLI, которая верифицирует утверждения в рамках предлагаемого конвейера. Это может привести к согласованию между верификатором и оценщиком и повлиять на измеренные показатели улучшения. Следовательно, представленные результаты следует интерпретировать как производительность в рамках определенной процедуры оценки на основе NLI, а не как полностью независимое доказательство сокращения галлюцинаций. Более надежную валидацию обеспечила бы независимая экспертная оценка человеком или отдельно разработанная модель оценки.

Этап декомпозиции утверждений оценивался исключительно с точки зрения его вклада в сквозную верификацию и не проходил независимой проверки на соответствие границам утверждений, аннотированным человеком. Следовательно, в исследовании не приводится отдельная количественная оценка точности декомпозиции или ее индивидуального влияния на распространение ошибок при последующей верификации.

Оценка была ограничена наборами данных TruthfulQA и FEVER, а также контентом на английском языке. Таким образом, наблюдаемые результаты не подтверждают возможность обобщения для специализированных областей, многоязычных условий или генерации длинных текстов. Оптимальное значение k также может варьироваться в зависимости от области применения, поскольку распределение показателей достоверности NLI зависит от характера генерируемого контента. Следовательно, перед распространением полученных результатов за пределы условий, рассмотренных в данном исследовании, необходима специфическая для конкретной области калибровка и более широкая оценка.

Наконец, показатели задержки специфичны для конкретной экспериментальной конфигурации и могут варьироваться в зависимости от среды выполнения. Поскольку индивидуальные измерения задержки для каждого запуска не сохранялись, оценка вариабельности и доверительных интервалов post hoc оказалась невозможной. В будущих исследованиях следует сохранять индивидуальные измерения и проводить более широкую статистическую характеристику задержки в различных средах выполнения.

Дальнейшие исследования

В будущих исследованиях следует устранить основные ограничения, выявленные в рамках данной работы. Необходима калибровка порога с учетом специфики области, так как фиксированное значение (k = 0.7), выбранное с помощью TruthfulQA, может быть неоптимальным для специализированных областей с иным распределением показателей достоверности NLI. Для калибровки порога могут быть использованы данные валидации, специфичные для конкретной области, и, при необходимости, применены асимметричные штрафы за ложноотрицательные и ложноположительные ошибки19.

Улучшенная декомпозиция утверждений должна включать независимую оценку с использованием границ утверждений, размеченных человеком, для количественного определения полноты, правильности и распространения последующих ошибок. Дообученные модели декомпозиции и меры уверенности в декомпозиции могли бы дополнительно сократить количество ошибок, возникающих из-за плохо сегментированных утверждений. Будущие сравнительные оценки также должны включать легковесные подходы на основе декодирования, такие как DoLA, в рамках единого экспериментального протокола.

Легковесное расширение за счет поиска (retrieval augmentation) может помочь в решении проблемы полных вымыслов, которые трудно устранить, когда верификатору не хватает фактических знаний. Целевой резервный поиск для утверждений с низким уровнем уверенности, которые были опровергнуты, мог бы обеспечить внешнюю фактическую поддержку без необходимости выполнять поиск для каждого утверждения20.

Также требуется многоязычное расширение, поскольку текущая оценка ограничена англоязычными бенчмарками3. В будущих исследованиях следует оценить многоязычные модели NLI, а также специфичные для каждого языка промпты для декомпозиции и исправления утверждений на многоязычных бенчмарках галлюцинаций.

Заключение

В данном исследовании представлена двухэтапная система верификации утверждений, сочетающая декомпозицию атомарных утверждений, генерацию фактологических ссылок с использованием отдельных промптов, проверку методом NLI, адаптивное статистическое пороговое разделение и селективную коррекцию. На наборе данных TruthfulQA данная система позволила снизить уровень галлюцинаций с 28% до 9%, при этом средняя задержка увеличилась на 160 ms по сравнению с базовой LLM. На наборе данных FEVER уровень галлюцинаций снизился с 26% до 10%.

Предложенная структура обеспечила конкурентоспособную эффективность при проверке фактической точности без необходимости повторного сэмплирования полных ответов или внешнего поиска. Адаптивное пороговое разделение и селективная коррекция способствовали достижению наблюдаемых показателей, ограничивая при этом дополнительные вычислительные затраты. Тем не менее, полученные результаты ограничены оцененными бенчмарками и экспериментальными условиями, а также зависят от используемой NLI-модели, связки «оценщик–верификатор», неопределенности при декомпозиции утверждений, калибровки порогов для конкретных областей и вариативности задержки. Таким образом, требуется более широкая, независимая, предметно-ориентированная и многоязычная оценка перед распространением данных выводов на более широкие сценарии развертывания.

Раскрытие информации

Авторы заявляют об отсутствии конфликта интересов.

Благодарности

Авторы выражают искреннюю благодарность своему учреждению за предоставление академической среды и вычислительных ресурсов, необходимых для проведения данного исследования. Авторы также благодарят разработчиков и администраторов общедоступных эталонных наборов данных, использованных в этой работе, что позволило провести комплексную оценку предлагаемой структуры. Благодарность выражается коллегам и рецензентам за их конструктивные замечания, которые помогли повысить качество и ясность данной работы. Кроме того, авторы признательны сообществу исследователей открытого исходного кода за предоставление программных библиотек и инструментов, которые облегчили проведение экспериментов, анализ данных и визуализацию результатов. Их постоянные усилия значительно продвинули исследования в области обработки естественного языка и надежного искусственного интеллекта. Авторы заявляют, что для данного исследования не привлекалось внешнее финансовоеสนับสนุน или финансирование.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
набор данных для бенчмаркинга FEVERОбщая задача FEVER (Thorne et al.)https://fever.ai/dataset/fever.htmlОбщедоступный набор данных для проверки фактов, состоящий из пар «утверждение — доказательство» и используемый для оценки
GPT-3.5 Turbo (большая языковая модель B10+2:12:12)OpenAIИдентификатор модели: gpt-3.5-turbo; https://developers.openai.com/api/docs/models/gpt-3.5-turboИспользовался как в качестве генератора ответов, так и в качестве независимого генератора эталонных данных, доступ к которому осуществлялся через OpenAI API
NumPyРазработчики NumPy (открытый исходный код)https://numpy.org/Библиотека для численных вычислений, используемая для статистических расчетов, включая среднее значение и стандартное отклонение показателей верификации NLI
Openai (клиентская библиотека Python API)OpenAIhttps://github.com/openai/openai-pythonБиблиотека клиента Python, используемая для отправки промптов и получения ответов от GPT-3.5 Turbo
pandasкоманда разработчиков pandas (открытое ПО)https://pandas.pydata.org/Библиотека анализа табличных данных, используемая для предобработки наборов данных и обработки результатов
Предобученная модель классификации для логического вывода на естественном языке (NLI)Хаб моделей Hugging Face (модель, построенная на архитектуре DeBERTa-v3-large от Microsoft)MoritzLaurer/DeBERTa-v3-large-mnli-fever-anli-ling-wanliИспользуется в режиме логического вывода, без дополнительного обучения, для классификации каждой пары «утверждение — ссылка» как следствия, нейтрального отношения или противоречия
PythonPython Software FoundationВерсия 3.9; https://www.python.org/downloads/release/python-390/Основной язык программирования, использованный для реализации платформы верификации
SciPyРазработчики SciPy (открытое программное обеспечение)https://scipy.org/Библиотека для научных вычислений, используемая для статистического анализа результатов экспериментов
Трансформеры (библиотека Hugging Face Transformers)Hugging Facehttps://github.com/huggingface/transformersБиблиотека Python, используемая для загрузки и запуска предобученной модели NLI
контрольный набор данных TruthfulQAПервоначально опубликовано Лином, Хилтоном и Эвансомhttps://github.com/sylinrl/TruthfulQAОбщедоступный контрольный набор из 817 ориентированных на факты вопросов, используемый для настройки порога и оценки
Рабочая станцияНе указано в рукописи (пожалуйста, подтвердите производителя/модель)процессор Intel Core i5; 16 ГБ оперативной памяти; 64-разрядная операционная системаОборудование, использованное для проведения всех экспериментов при идентичных конфигурациях
Примечание: все вышеперечисленные URL-адреса были проверены и подтверждены как активные на дату составления данной таблицы. 

Ссылки

  1. Dai Z, et al. Promptagator: Few-shot dense retrieval from 8 examples [conference presentation]. Presented at: The Eleventh International Conference on Learning Representations; 2022. [https://iclr.cc/virtual/2023/poster/10937]
  2. Achiam J, et al. GPT-4 technical report. arXiv. 2023;arXiv:2303.08774. [https://arxiv.org/abs/2303.08774]
  3. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):1-38.
  4. Bender EM, McMillan-Major A, Shmitchell S, Gebru T. On the dangers of stochastic parrots: Can language models be too big? [conference presentation]. Presented at: 2021 ACM Conference on Fairness, Accountability, and Transparency; 2021. [https://dl.acm.org/doi/10.1145/3442188.3445922]
  5. Devlin J, et al. BERT: Pre-training of deep bidirectional transformers for language understanding [conference presentation]. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2019. [https://arxiv.org/abs/1810.04805]
  6. Maynez J, Narayan S, Bohnet B, McDonald R. On faithfulness and factuality in abstractive summarization [conference presentation]. Presented at: 58th Annual Meeting of the Association for Computational Linguistics; 2020. [https://arxiv.org/abs/2005.00661]
  7. Brown T, et al. Language models are few-shot learners. Adv Neural Inf Process Syst. 2020;33:1877-901.
  8. Guu K, et al. Retrieval augmented language model pre-training [conference presentation]. Presented at: International Conference on Machine Learning; 2020. [https://arxiv.org/abs/2002.08909]
  9. Izacard G, Grave E. Leveraging passage retrieval with generative models for open domain question answering [conference presentation]. Presented at: 16th Conference of the European Chapter of the Association for Computational Linguistics; 2021. [https://arxiv.org/abs/2007.01282]
  10. Bowman SR, Angeli G, Potts C, Manning CD. A large annotated corpus for learning natural language inference [conference presentation]. Presented at: 2015 Conference on Empirical Methods in Natural Language Processing; 2015. [https://arxiv.org/abs/1508.05326]
  11. Platt J. Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods. Adv Large Margin Classif. 1999;10(3):61-74.
  12. Lin S, Hilton J, Evans O. Truthfulqa: Measuring how models mimic human falsehoods. InProceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) 2022 May (pp. 3214-3252).
  13. Thorne J, Vlachos A, Christodoulopoulos C, Mittal A. FEVER: A large-scale dataset for fact extraction and verification [conference presentation]. Presented at: 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2018. [https://aclanthology.org/N18-1074/]
  14. Williams A, Nangia N, Bowman SR. A broad-coverage challenge corpus for sentence understanding through inference. arXiv. 2017;arXiv:1704.05426.
  15. Manakul P, Liusie A, Gales M. SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models [conference presentation]. Presented at: 2023 Conference on Empirical Methods in Natural Language Processing; 2023.
  16. Min S, et al. FActScore: Fine-grained atomic evaluation of factual precision in long-form text generation. arXiv. 2023;arXiv:2305.14251.
  17. Cohen J. Statistical power analysis for the behavioral sciences. Routledge; New York; 2013.
  18. Kadavath S, et al. Language models (mostly) know what they know. arXiv. 2022;arXiv:2207.05221.
  19. Hendrycks D, et al. Aligning AI with shared human values. arXiv. 2020;arXiv:2008.02275.
  20. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-74.

Перепечатки и разрешения

Теги

логический вывод на естественном языкефактический отзывадаптивный порогверификация с низкой задержкойбенчмарк TruthfulQASelfCheckGPT

Эта статья была опубликована

Видео скоро будет доступно