Первичная генерация ответа
Базовая языковая модель генерировала беглые и контекстуально релевантные ответы на вопросы из обоих эталонных наборов данных. Однако детальный анализ выявил необоснованные и фактически неточные утверждения в нескольких ответах. На наборе данных TruthfulQA уровень галлюцинаций базовой системы составил 28%, в то время как на наборе данных FEVER наблюдался уровень галлюцинаций 26%. Эти результаты подтвердили, что одной прямой генерации языка недостаточно для приложений, требующих высокой фактической достоверности, и определили базовое состояние, с которым сравнивались все последующие процедуры верификации.
Извлечение утверждений
Процедура извлечения утверждений позволила успешно разбить сгенерированные ответы на независимо проверяемые фактологические единицы. Ответы из TruthfulQA содержали в среднем 3,2 атомарных утверждения, в то время как образцы FEVER, как правило, состояли из одного утверждения. Процесс декомпозиции позволил изолировать фактологические утверждения без внесения дополнительной информации, что обеспечило возможность отдельной оценки каждого высказывания. Данное наблюдение подтвердило гипотезу о том, что проверка на уровне отдельных утверждений обеспечивает более высокую точность, чем оценка ответов целиком как единого целого.
Независимое построение референса
Для каждого извлеченного утверждения были созданы независимые эталоны с использованием отдельного процесса рассуждения, основанного исключительно на исходном запросе. Сгенерированные эталоны содержали краткие фактические описания, которые были достаточно отличны от исходных ответов, чтобы служить независимыми источниками проверки. Процесс создания эталонов был изолирован от формирования первоначального ответа, чтобы избежать прямого влияния предыдущего вывода модели на фактический эталон. Такое разделение было направлено на снижение возможной предвзятости подтверждения и создание контролируемой основы для последующей проверки на уровне отдельных утверждений; в исследовании степень этого эффекта количественно не оценивалась. Успешное создание независимых эталонов подтвердило предложенный принцип проектирования, заключающийся в разделении процесса извлечения знаний и генерации ответа.
Верификация логического вывода на естественном языке
Этап верификации с помощью NLI эффективно классифицировал пары «утверждение-ссылка» по категориям: следование (entailment), противоречие (contradiction) и нейтральность (neutral). Противоречивые утверждения последовательно получали отрицательные баллы верификации, в то время как фактически подтвержденные утверждения получали положительные баллы. Нейтральная классификация присваивалась утверждениям, для которых было недостаточно подтверждающих доказательств. Такое поведение продемонстрировало, что семантический вывод может надежно идентифицировать неподтвержденные фактические высказывания и обеспечить доказательства, необходимые для точечного исправления. По сравнению с простой стратегией проверки согласованности, верификация NLI снизила частоту галлюцинаций с 20% до 15%, что указывает на улучшение способности обнаружения ошибок.
Адаптивное статистическое пороговое преобразование
Применение адаптивного статистического порога позволило дополнительно повысить эффективность верификации за счет динамической корректировки границ принятия решения на основе распределения показателей достоверности каждого ответа. Анализ чувствительности порога показал, что производительность улучшалась при увеличении параметра порога с 0.3 до 0.7. При значении чувствительности 0.7 система достигла точности 0.87, при этом уровень галлюцинаций снизился до 9% (Рисунок 2). Полные результаты анализа чувствительности для оцениваемых значений k представлены в Дополнительной таблице 2. Дальнейшее увеличение порога приводило лишь к незначительному росту точности при одновременном увеличении задержки. Эти наблюдения подтвердили гипотезу о том, что адаптивные пороги более эффективны, чем фиксированные границы принятия решения, при работе с различными распределениями достоверности в ответах.
Адаптивный порог также отражает вариативность показателей достоверности в каждом ответе. Ответы с высокосогласованными показателями верификации дают меньшее стандартное отклонение, что приводит к более селективной границе принятия решения. Напротив, ответы, содержащие утверждения с неоднородными значениями достоверности, дают большее стандартное отклонение, что расширяет область принятия и сокращает количество излишних исправлений для неопределенных утверждений. Хотя такое адаптивное поведение не может полностью устранить все ложноположительные или ложноотрицательные результаты, оно позволяет границе принятия решения реагировать на характеристики неопределенности каждого конкретного ответа вместо применения единого критерия ко всем входным данным.
Селективная коррекция формулы изобретения и сбор ответа
Для исправления были отправлены только те утверждения, которые были определены как противоречивые, в то время как подтвержденные и нейтральные утверждения остались без изменений. Такая стратегия выборочного исправления позволила минимизировать ненужную регенерацию и сохранить исходную структуру ответа. После исправления и реконструкции ответа уровень галлюцинаций в TruthfulQA снизился с 28% до 9%, что соответствует относительному сокращению на 67,9%. Аналогичные улучшения наблюдались в FEVER, где уровень галлюцинаций снизился с 26% до 10%. Сравнение точности и частоты галлюцинаций для оцениваемых конфигураций представлены на рисунках 3 и 4 соответственно.
Оценка эффективности
Сравнительная оценка показала, что предложенная структура обеспечила наивысшую общую эффективность среди всех протестированных методов. На наборе данных TruthfulQA структура достигла точности 0,87 и показателя F1 0,85, превзойдя как верификацию с фиксированным порогом, так и подходы, основанные на самосогласованности (Таблица 2, Рисунки 3 и 4). На FEVER структура достигла точности 0,89 и показателя F1 0,87 (Таблица 3, Рисунки 3 и 4). Поэтапный вклад компонентов структуры исследован с помощью абляционного анализа, представленного в Таблице 4. Эти улучшения подтвердили, что сочетание верификации на уровне утверждений с адаптивным статистическим принятием решений повысило фактическую достоверность на нескольких наборах данных. Сравнение точности обнаружения галлюцинаций для SelfCheckGPT, FActScore и предложенной структуры приведено на Рисунке 5.
Анализ латентного периода
Полный конвейер верификации сохранял низкие вычислительные затраты. Среднее время отклика увеличилось с 820 ms для базовой модели до 980 ms для полной структуры, что представляет собой лишь незначительное увеличение времени обработки (Таблица 5). Генерация ответа составила большую часть общей задержки, в то время как этапы верификации и коррекции внесли относительно небольшой дополнительный вклад в накладные расходы. Распределение времени обработки по этапам приведено в Дополнительной таблице 3. По сравнению с системами верификации на основе поиска, которым требовалось примерно 1600 ms на запрос, предлагаемая структура обеспечила существенно более низкую задержку при сохранении сопоставимой фактической точности. Эти результаты подтвердили гипотезу о том, что снижение количества галлюцинаций может быть достигнуто без ущерба для возможности использования системы в режиме реального времени.
Поскольку генерация ответов опирается на облачную языковую модель, отдельные измерения задержки подвержены колебаниям, обусловленным сетевыми условиями и серверным планированием, а не детерминированным временем выполнения. Поэтому для получения репрезентативных средних значений использовались повторные измерения, что позволило снизить влияние кратковременной вариабельности выполнения при сохранении возможности относительного сравнения оцениваемых методов. Значения задержки представлены как среднее время выполнения по результатам повторных экспериментальных прогонов. Индивидуальные значения задержки для каждого прогона не сохранялись, в связи с чем апостериорный расчет дисперсии, доверительных интервалов или других показателей вариабельности был невозможен. Соответственно, значения задержки и сравнение скорости и точности на Рисунке 6 представлены в виде точечных оценок без планок погрешностей.
В заключение, результаты показали, что сочетание извлечения утверждений, независимой генерации ссылок, проверки с помощью логического вывода на естественном языке (Natural Language Inference), адаптивного статистического порога и селективной коррекции повысило фактическую достоверность ответов больших языковых моделей. Данная структура позволила снизить частоту галлюцинаций с 28% до 9% в TruthfulQA и с 26% до 10% в FEVER. Результаты указывают на то, что адаптивная проверка на уровне отдельных утверждений улучшила показатели фактической достоверности при ограничении дополнительной задержки ответа в исследуемых условиях
Доступность данных
Наборы данных, проанализированные в данном исследовании, общедоступны через соответствующие официальные источники. В рукописи приведена информация о наборах данных, конфигурации моделей и методологические подробности, необходимые для воспроизведения описанного анализа. Обработанные оценочные данные и дополнительные результаты, полученные в ходе исследования, представлены в Дополнительных файлах.

Рисунок 1: Схема работы адаптивной системы верификации утверждений. Первоначальный ответ, сгенерированный LLM, разбивается на фактические утверждения, после чего следуют независимая генерация ссылок, верификация на основе NLI, оценка достоверности и статистическое пороговое разделение. Утверждения, соответствующие критерию принятия, сохраняются, в то время как утверждения, соответствующие критерию исправления, проходят целевую корректировку перед окончательной сборкой ответа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Влияние параметра чувствительности (k) на точность верификации. Точность на TruthfulQA и FEVER при значениях k, равных 0.3, 0.5, 0.7 и 1.0. Точность росла с увеличением k на обоих наборах данных; для основной оценки было выбрано значение k = 0.7. Нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 3: Сравнение точности различных методов верификации. Точность базовой LLM, верификации на основе NLI и предложенного адаптивного фреймворка верификации на наборах данных TruthfulQA и FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Сравнение частоты галлюцинаций при использовании различных методов верификации. Частота галлюцинаций для базовой LLM, верификации на основе NLI и предлагаемой структуры на наборах данных TruthfulQA и FEVER. Предлагаемая структура снизила частоту галлюцинаций с 28% до 9% на TruthfulQA и с 26% до 10% на FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Точность обнаружения галлюцинаций при использовании различных методов. Точность обнаружения SelfCheckGPT, FActScore и предлагаемой структуры на наборах данных TruthfulQA и FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 6: Компромисс между временем отклика и точностью для различных методов верификации. Зависимость между задержкой отклика и точностью для оцениваемых методов на наборах данных TruthfulQA и FEVER, иллюстрирующая компромисс между производительностью и задержкой, характерный для предлагаемого фреймворка и сравниваемых подходов. Нажмите здесь, чтобы просмотреть этот рисунок в большем размере.
| Набор данных | Использованные образцы | Области | Средняя длина ответа (токенов) | Базовая частота галлюцинаций LLM |
| TruthfulQA | 817 | 38 (наука, история, право и т. д.) | 42 | 28% |
| FEVER | 1,000 | Общие фактические утверждения | 18 | 26% |
Таблица 1: Характеристики эталонного набора данных. Сводные данные по наборам данных TruthfulQA и FEVER, использованным для разработки и оценки системы, включая количество образцов, базовую точность, базовый уровень галлюцинаций и среднее количество утверждений на образец.
| Метод | Точность | Точность | Полнота (Recall) | F1-мера | % галлюцинаций |
| Базовая LLM (одиночный вывод) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Верификация на основе NLI (фиксированный порог) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Предлагаемая структура (статистический порог) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Таблица 2: Сравнение производительности на TruthfulQA. Точность, прецизионность, полнота, F1-мера и частота галлюцинаций для базовой LLM, SelfCheckGPT, FActScore, верификации NLI и предлагаемой структуры.
| Метод | Точность | Точность | Полнота | F1-мера | % галлюцинаций |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Базовая большая языковая модель (LLM)† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| Верификация на основе NLI (фиксированный порог) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Предлагаемая структура (статистический порог) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Таблица 3: Сравнение эффективности на наборе данных FEVER. Точность (Accuracy), прецизионность (precision), полнота (recall), F1-мера и уровень галлюцинаций для базовой LLM, SelfCheckGPT, FActScore, верификации NLI и предлагаемого фреймворка.
| Конфигурация | Точность (Accuracy) | Прецизионность (Precision) | Полнота (Recall) | F1 (добавлено) | Частота галлюцинаций |
| Базовая языковая модель | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Базовая модель + вторичная проверка (без NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Базовая модель + верификация на основе NLI (фиксированный порог) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Базовая модель + модуль статистического принятия решений (полный) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Таблица 4: Абляционный анализ компонентов структуры.Изменения точности, показателя F1 и частоты галлюцинаций после последовательного включения вторичной валидации, NLI-верификации и адаптивного статистического порога.
| Метод | Среднее время реакции (мс) |
| Базовая LLM (одиночная генерация) | 820 |
| Механизм самовалидации | 910 |
| Предлагаемая статистическая модель | 980 |
| Верификация с применением дополненной генерации (RAG) | 1600 |
Таблица 5: Задержка отклика при различных методах верификации. Среднее время отклика и дополнительная задержка относительно базовой LLM для Self-Validation (предложенная архитектура) и верификации с использованием дополненного поиска (retrieval-augmented verification).
Дополнительная таблица 1: Сравнение подходов к верификации галлюцинаций. Сравнение предлагаемой структуры с существующими методами с точки зрения внешнего поиска, верификации на уровне утверждений, адаптивного порога и эффективности обработки с точки зрения задержки.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 2: Анализ чувствительности порогового параметра (k). Точность (accuracy), прецизионность (precision), полнота (recall), F1-мера и частота галлюцинаций были определены при значениях порогового параметра 0.3, 0.5, 0.7 и 1.0. Для основной оценки использовалось значение k = 0.7.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 3: Время обработки на различных этапах конвейера верификации. Среднее время выполнения и процентный вклад генерации первоначального ответа, декомпозиции утверждений, генерации ссылок, NLI-вывода и селективной коррекции в общее время отклика.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 4: Распределение ошибок, выявленных в ходе верификации. Количество и процент ложноотрицательных, ложноположительных результатов и ошибок исправления, а также основные категории галлюцинаций, связанные с каждым типом ошибки.Пожалуйста, нажмите здесь, чтобы скачать этот файл.