Генерация первоначального ответа
Базовая языковая модель генерировала беглые и контекстуально релевантные ответы на вопросы из обоих наборов эталонных данных. Однако детальный анализ выявил необоснованные и фактически неточные утверждения в ряде ответов. На наборе данных TruthfulQA уровень галлюцинаций базовой системы составил 28%, в то время как на наборе данных FEVER наблюдался уровень галлюцинаций 26%. Эти результаты подтвердили, что одной прямой генерации языка недостаточно для приложений, требующих высокой фактической достоверности, и определили базовое состояние, с которым сравнивались все последующие процедуры верификации.
Извлечение утверждений
Процедура извлечения утверждений успешно разложила сгенерированные ответы на независимо проверяемые фактические единицы. Ответы из TruthfulQA содержали в среднем 3,2 атомарных утверждения, в то время как образцы FEVER, как правило, состояли из одного утверждения. Процесс декомпозиции изолировал фактические утверждения без введения дополнительной информации, что позволило оценивать каждое высказывание по отдельности. Это наблюдение подтвердило гипотезу о том, что верификация на уровне отдельных утверждений обеспечивает более высокую точность, чем оценка ответов целиком как единого целого.
Независимое конструирование референса
Для каждого извлеченного утверждения были созданы независимые проверочные данные с использованием отдельного процесса рассуждения, основанного исключительно на исходном запросе. Созданные эталоны содержали краткие фактические описания, которые были достаточно отличны от исходных ответов, чтобы служить независимыми источниками проверки. Процесс генерации проверочных данных был изолирован от формирования первоначального ответа, чтобы избежать прямого влияния предыдущего вывода модели на содержание фактического эталона. Такое разделение было направлено на снижение возможного подтверждающего смещения и создание контролируемой основы для последующей верификации на уровне отдельных утверждений; в данном исследовании степень этого эффекта количественно не оценивалась. Успешная генерация независимых проверочных данных подтвердила предложенный принцип проектирования, заключающийся в отделении процесса воспроизведения знаний от процесса генерации ответа.
Верификация логического вывода на естественном языке
Этап верификации с помощью NLI эффективно классифицировал пары «утверждение-ссылка» по категориям: следование (entailment), противоречие (contradiction) и нейтральность (neutral). Противоречивые утверждения последовательно получали отрицательные баллы верификации, в то время как фактически подтвержденные утверждения получали положительные баллы. Нейтральная классификация присваивалась утверждениям, для которых было недостаточно подтверждающих доказательств. Такое поведение показало, что семантический вывод может надежно выявлять необоснованные фактические утверждения и предоставлять доказательства, необходимые для целенаправленного исправления. По сравнению с простой стратегией проверки согласованности, верификация NLI снизила уровень галлюцинаций с 20% до 15%, что свидетельствует об улучшении способности обнаружения.
Адаптивное статистическое порогатирование
Применение адаптивного статистического порога позволило дополнительно улучшить эффективность верификации за счет динамической корректировки решающих границ на основе распределения показателей уверенности для каждого ответа. Анализ чувствительности порога показал, что эффективность возрастала при увеличении параметра порога от 0,3 до 0,7. При значении чувствительности 0,7 фреймворк достиг точности 0,87, при этом уровень галлюцинаций снизился до 9% (Рисунок 2). Полные результаты анализа чувствительности для оцениваемых значений k представлены в Дополнительной таблице 2. Дальнейшее увеличение порога приводило лишь к незначительному приросту точности при одновременном увеличении задержки. Эти наблюдения подтвердили гипотезу о том, что адаптивные пороги более эффективны, чем фиксированные решающие границы, для обработки различных распределений уверенности в ответах.
Адаптивный порог также отражает вариативность показателей достоверности внутри каждого ответа. Ответы с высокосогласованными показателями верификации дают меньшее стандартное отклонение, что приводит к более селективной решающей границе. Напротив, ответы, содержащие утверждения с неоднородными значениями достоверности, дают большее стандартное отклонение, что ведет к расширению области принятия и сокращению излишних корректировок для неопределенных утверждений. Хотя такое адаптивное поведение не может устранить каждое ложноположительное или ложноотрицательное срабатывание, оно позволяет решающей границе реагировать на характеристики неопределенности каждого конкретного ответа вместо применения единого критерия ко всем входным данным.
Селективная коррекция формулы изобретения и сборка ответа
Для исправления были отправлены только те утверждения, которые были идентифицированы как противоречивые, в то время как подтвержденные и нейтральные утверждения остались без изменений. Такая стратегия селективного исправления позволила минимизировать излишнюю регенерацию и сохранить исходную структуру ответа. После исправления и реконструкции ответа уровень галлюцинаций в TruthfulQA снизился с 28% до 9%, что соответствует относительному сокращению на 67,9%. Аналогичные улучшения наблюдались в FEVER, где уровень галлюцинаций снизился с 26% до 10%. Сравнение точности и уровня галлюцинаций для оцениваемых конфигураций представлено на рисунках 3 и 4 соответственно.
Оценка эффективности
Сравнительная оценка показала, что предложенная структура обеспечила самые высокие общие показатели производительности среди всех протестированных методов. На наборе TruthfulQA структура достигла точности 0,87 и значения F1-меры 0,85, превзойдя как верификацию с фиксированным порогом, так и подходы на основе самосогласованности (Таблица 2, Рисунки 3 и 4). На наборе FEVER структура достигла точности 0,89 и значения F1-меры 0,87 (Таблица 3, Рисунки 3 и 4). Инкрементальный вклад компонентов структуры исследован с помощью абляционного анализа, представленного в Таблице 4. Эти улучшения подтвердили, что сочетание верификации на уровне утверждений с адаптивным статистическим принятием решений повысило фактическую надежность в нескольких наборах данных. Сравнение точности обнаружения галлюцинаций для SelfCheckGPT, FActScore и предложенной структуры представлено на Рисунке 5.
Анализ латентности
Полный конвейер верификации обеспечил низкие вычислительные затраты. Среднее время отклика увеличилось с 820 ms для базовой модели до 980 ms для полной структуры, что представляет собой лишь незначительное увеличение времени обработки (Таблица 5). Генерация ответа составила большую часть общей задержки, в то время как этапы верификации и коррекции внесли относительно небольшой дополнительный вклад в накладные расходы. Распределение времени обработки по этапам приведено в Дополнительной таблице 3. По сравнению с системами верификации на основе поиска, которые требовали примерно 1600 ms на один запрос, предложенная структура обеспечила существенно меньшую задержку при сохранении сопоставимой фактической точности. Эти результаты подтвердили гипотезу о том, что снижение количества галлюцинаций может быть достигнуто без ущерба для возможности использования системы в режиме реального времени.
Поскольку генерация ответов основана на облачной языковой модели, отдельные измерения задержки подвержены колебаниям из-за сетевых условий и серверного планирования, а не определенному времени выполнения. Поэтому для получения репрезентативных средних значений использовались повторные измерения, что позволило снизить влияние кратковременной вариативности выполнения, сохранив при этом возможность относительного сравнения оцениваемых методов. Значения задержки представлены как среднее время выполнения по нескольким повторным экспериментальным запускам. Индивидуальные значения задержки для каждого запуска не сохранялись, вследствие чего апостериорный расчет дисперсии, доверительных интервалов или других показателей вариативности был невозможен. Соответственно, значения задержки и сравнение скорости и точности на Рисунке 6 представлены в виде точечных оценок без планок погрешностей.
В заключение, результаты продемонстрировали, что сочетание извлечения утверждений, независимой генерации ссылок, верификации с помощью логического вывода на естественном языке (Natural Language Inference), адаптивного статистического порога и селективной коррекции повысило фактическую достоверность ответов больших языковых моделей. Данный подход позволил снизить уровень галлюцинаций с 28% до 9% в TruthfulQA и с 26% до 10% в FEVER. Результаты показывают, что адаптивная верификация на уровне утверждений улучшила показатели фактической достоверности, при этом ограничив дополнительную задержку отклика в исследуемых условиях
Доступность данных
Наборы данных, проанализированные в данном исследовании, доступны в открытом доступе через соответствующие официальные источники. В рукописи представлена информация о наборах данных, конфигурациях моделей и методологические подробности, необходимые для воспроизведения описанного анализа. Обработанные оценочные данные и дополнительные результаты, полученные в ходе исследования, представлены в дополнительных файлах.

Рисунок 1: Рабочий процесс адаптивной системы проверки утверждений. Первоначальный ответ, сгенерированный LLM, разбивается на отдельные фактические утверждения, после чего следует независимая генерация ссылок, верификация на основе NLI, оценка достоверности и статистическое пороговое разделение. Утверждения, соответствующие критерию принятия, сохраняются, в то время как утверждения, соответствующие критерию исправления, подвергаются целевой корректировке перед окончательной сборкой ответа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Влияние параметра чувствительности (k) на точность верификации.Точность для TruthfulQA и FEVER при значениях k, равных 0.3, 0.5, 0.7 и 1.0. Точность увеличивалась с ростом k для обоих наборов данных; для основной оценки было выбрано значение k = 0.7. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Сравнение точности различных методов верификации. Точность базовой LLM, верификации на основе NLI и предлагаемой адаптивной структуры верификации на наборах данных TruthfulQA и FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Сравнение частоты галлюцинаций в зависимости от метода верификации. Частота галлюцинаций для базовой LLM, верификации на основе NLI и предлагаемого фреймворка на наборах данных TruthfulQA и FEVER. Предлагаемый фреймворк снизил этот показатель с 28% до 9% для TruthfulQA и с 26% до 10% для FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Точность обнаружения галлюцинаций для различных методов. Точность обнаружения SelfCheckGPT, FActScore и предлагаемого фреймворка на наборах данных TruthfulQA и FEVER. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Компромисс между временем отклика и точностью для различных методов верификации. Зависимость между временем задержки отклика и точностью для оцениваемых методов на TruthfulQA и FEVER, иллюстрирующая компромисс между производительностью и задержкой, связанный с предлагаемым фреймворком и сравнительными подходами. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
| Набор данных | Используемые образцы | Области применения | Средняя длина ответа (токенов) | Базовый уровень галлюцинаций LLM |
| TruthfulQA | 817 | 38 (наука, история, право и т. д.) | 42 | 28% |
| ЛИХОРАДКА | 1,000 | Общие фактические утверждения | 18 | 26% |
Таблица 1: Характеристики эталонного набора данных. Сводные данные по наборам данных TruthfulQA и FEVER, использованным для разработки и оценки фреймворка, включая количество образцов, базовую точность, базовый уровень галлюцинаций и среднее количество утверждений на образец.
| Метод | Точность (Accuracy) | Прецизионность (Precision) | Полнота (Recall) | F1-мера | % галлюцинаций |
| Базовая LLM (одиночный вывод) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Верификация на основе NLI (фиксированный порог) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Предложенный фреймворк (статистический порог) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Таблица 2: Сравнение эффективности на наборе данных TruthfulQA. Точность (accuracy), прецизионность (precision), полнота (recall), F1-мера и частота галлюцинаций для базовой LLM, SelfCheckGPT, FActScore, верификации NLI и предлагаемой структуры.
| Метод | Точность (Accuracy) | Прецизионность (Precision) | Полнота (Recall) | F1-мера | % галлюцинаций |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Базовая LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| Верификация на основе NLI (фиксированный порог) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Предложенная платформа (статистический порог) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Таблица 3: Сравнение эффективности на наборе данных FEVER. Точность, прецизионность, полнота, F1-мера и уровень галлюцинаций для базовой LLM, SelfCheckGPT, FActScore, верификации NLI и предлагаемой структуры.
| Конфигурация | Точность | Точность | Полнота (Recall) | F1 (добавлено) | Частота галлюцинаций |
| Базовая языковая модель | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Базовый уровень + вторичная проверка (без NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Базовый уровень + верификация на основе NLI (фиксированный порог) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Базовая линия + модуль принятия статистических решений (полный) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Таблица 4: Абляционный анализ компонентов структуры. Изменения точности, F1-меры и частоты галлюцинаций после последовательного включения вторичной валидации, верификации NLI и адаптивного статистического порога.
| Метод | Среднее время реакции (мс) |
| Базовая LLM (одиночная генерация) | 820 |
| Механизм самовалидации | 910 |
| Предлагаемая статистическая модель | 980 |
| Верификация с дополненной генерацией (RAG) | 1600 |
Таблица 5: Задержка отклика при различных методах верификации. Среднее время отклика и дополнительная задержка относительно базовой LLM для Self-Validation (предложенная структура) и верификации с использованием дополненного поиска.
Дополнительная таблица 1: Сравнение подходов к верификации галлюцинаций. Сравнение предлагаемой структуры с существующими методами по параметрам внешнего поиска, верификации на уровне утверждений, адаптивного порога и эффективности обработки с точки зрения задержки.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 2: Анализ чувствительности параметра порога (k). Точность (accuracy), прецизионность (precision), полнота (recall), F1-мера и уровень галлюцинаций были получены при значениях параметра порога 0,3, 0,5, 0,7 и 1,0. Для основной оценки использовалось значение k = 0,7.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 3: Время обработки на этапах конвейера верификации. Среднее время выполнения и процентный вклад генерации первичного ответа, декомпозиции утверждений, генерации ссылок, NLI-вывода и селективной коррекции в общее время ответа.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 4: Распределение ошибок, выявленных в ходе верификации. Количество и процент ложноотрицательных, ложноположительных результатов и ошибок исправления, а также основные категории галлюцинаций, связанные с каждым типом ошибки.Пожалуйста, нажмите здесь, чтобы скачать этот файл.