研究文章

基于统计决策建模的自适应NLI驱动型声明验证方法用于降低大语言模型中的低延迟幻觉

0 次观看

DOI:

10.3791/72636

2026年9月3日

 ,  ,  ,  , 

通讯作者: Biswajeet Dash <dashbiswajeet420@gmail.com>

本文内容

摘要

本研究提出了一种轻量级框架,通过命题级别验证和自适应统计阈值法来减少大语言模型中的幻觉现象。该方法利用自然语言推理选择性地修正缺乏支持的命题,在保持较低响应延迟和高效实际部署的同时,提升了事实准确性。

摘要

大语言模型(LLMs)表现出一种关键倾向,即生成在语言上流畅但事实错误的输出——这一现象被称为“幻觉”——在对精度要求较高的应用中带来了严重风险。现有的缓解策略,包括检索增强生成和自一致性采样,要么引入了显著的推理延迟,要么依赖外部知识基础设施,限制了其在实时部署中的适用性。本文提出一种轻量级的两步声明验证框架,该框架将大语言模型的响应分解为原子性事实声明,并针对通过独立的事实回忆提示单独生成的参考内容,对每个提取出的声明进行独立验证。尽管生成器与验证器共享相同的基础语言模型,但将响应生成与事实回忆分离,减少了对直接响应的条件依赖,并在验证过程中通过自然语言推理(NLI)减轻了确认偏倚,同时应用一种自适应统计阈值——定义为 NLI 置信度分布上的 τ = µ + kσ——仅对被反驳的声明进行选择性修正。与依赖固定决策边界的先前基于 NLI 的方法不同,所提出的框架能够根据每条响应的置信度分布动态调整其验证阈值,在无需重新训练模型的情况下,在多个评估基准上表现出一致的性能。在 TruthfulQA 和 FEVER 上的评估结果显示,该框架将 TruthfulQA 上的幻觉率从 28% 降低至 9%,实现了 67.9% 的相对降幅,且相较于基线大语言模型仅增加 160 毫秒的额外延迟,在幻觉检测准确率方面优于 SelfCheckGPT 和 FActScore。这些结果表明,该框架在所评估的基准上能够在事实可靠性与响应延迟之间实现良好的平衡,但仍需在不同领域和部署场景中进一步验证。

引言

大型语言模型(LLMs)已成为现代人工智能系统的基础组成部分,在多种自然语言任务中展现出卓越的能力,包括文本生成、问答、摘要生成以及复杂推理1它们生成流畅且上下文连贯回答的能力,已加速了在临床决策支持、法律分析、软件工程和教育技术等高影响力领域的应用。2然而,一个关键且持续存在的局限性削弱了这些模型在上述场景中的可靠性:幻觉现象,即模型生成的语言流畅但事实错误、缺乏依据或完全虚构的回应3。实证研究报道的幻觉发生率因任务和模型而异,范围从15%到超过40%,即便是GPT-4等最先进的系统,在特定领域评估下也表现出可测量的事实不一致现象。2,3这一局限性在对精度要求较高的应用中构成了严重风险,错误的输出可能导致信息误导、误诊或决策失误4幻觉现象从根本上源于语言模型的概率特性——大语言模型通过预测输入序列在统计学上可能的后续标记来生成内容,而非通过检索或推理经过验证的事实知识。5因此,生成的输出可能包含看似合理但不准确的陈述、引入缺乏依据的断言,或混淆语义相关但事实不同的概念。6.

现有的缓解策略通过多种范式来解决这一问题,但每种方法都有明显的局限性。检索增强生成(Retrieval-Augmented Generation, RAG)通过将响应基于外部检索到的文档来减少幻觉现象,但会引入显著的延迟开销,需要访问维护良好的知识库,并且在专业领域或资源匮乏的领域中仍容易受到检索失败的影响7,8,9

尽管响应生成器和参考生成器使用相同的底层 GPT-3.5 Turbo 模型实例化,但二者在不同的提示目标和执行上下文中运行。响应生成器针对用户查询生成无约束的答复,而参考生成器则执行独立的事实回忆任务,无法访问先前生成的响应。这种分离减少了对响应的直接条件依赖效应,并在声明验证过程中限制了确认偏倚。因此,该框架将生成的参考视为程序上独立,而非统计上独立。

近期研究还探索了轻量级解码策略,以在不依赖外部检索或重复验证的情况下减少文本生成中的幻觉现象。一种代表性方法是层间对比解码(Decoding by Contrasting Layers, DoLA),该方法通过在解码过程中对比Transformer模型中间层与最终层的表征来提升生成内容的事实性。与生成后验证框架不同,此类方法直接干预令牌生成过程,因而优化了语言生成流程中的不同阶段。这些互补性策略表明,幻觉缓解既可在解码阶段实现,也可通过生成后验证完成,每种方法在计算开销、实现复杂度和事实可靠性方面各有不同的权衡。

自洽性方法通过采样多个响应并选择最频繁或最连贯的输出来提高事实可靠性,但其计算成本随采样数量线性增长,因此不适用于对延迟敏感的部署场景8。迭代优化方法通过自我反馈循环反复修订输出,可逐步降低错误率,但每次额外的迭代都会显著延长推理时间9。基于自然语言推理(NLI)的验证方法通过评估生成陈述与参考文本之间的语义蕴含关系,提供了一种更具针对性的替代方案,但现有实现依赖固定的决策阈值,无法适应不同置信度分布、领域或模型行为的变化10,11。总体而言,这些方法要么带来不可接受的计算开销,要么依赖外部基础设施,要么缺乏通用部署所需的适应性。这些幻觉验证方法的主要特征比较见补充表1

本文提出了一种轻量级的两步式声明验证框架,旨在减少大语言模型(LLM)输出中的幻觉现象,同时保持较低的响应延迟。第一步中,LLM生成初始响应,并将其分解为若干原子性事实声明;第二步中,利用自然语言推理(NLI)对每个声明进行验证,所依据的事实参考文本通过一次独立的推理过程生成,该过程不访问原始生成的响应内容,且声明层级的接受或修正决策由统计推导出的置信度阈值控制。本研究的主要贡献如下:(1)提出一种两步式、声明级别的验证流程,将响应生成与事实验证解耦,从而能够在无需外部检索或完整响应重生成的前提下,独立且有针对性地评估每一个原子性声明;(2)设计一种基于NLI置信度得分分布的自适应统计阈值机制(τ = µ + kσ),通过动态确定接受与修正边界,而非依赖固定决策规则,提升了在不同置信度分布下的鲁棒性;(3)采用一种选择性修正策略,仅对被分类为矛盾的声明进行重生成,相较于全响应重采样或迭代优化方法,显著降低了计算开销;(4)在聚焦幻觉问题的基准数据集上进行了实证评估,结果表明,所提出的框架将幻觉率从28%降低至9%,同时将响应延迟维持在实际部署可接受的范围内。

方案

本研究未涉及人类受试者、动物、生物样本或患者数据,因此无需机构伦理审批和知情同意。

研究设计概述

采用两阶段验证框架以提高大语言模型(LLM)输出的事实可靠性。该流程包括响应生成、主张提取、孤立参考构建、基于自然语言推理(NLI)的验证、自适应统计决策、选择性修正以及最终响应组装。该框架通过TruthfulQA和FEVER基准数据集进行了评估。

整体工作流程

用户查询 → 初始响应生成 → 声明提取 → 独立参考文献生成 → 自然语言推理验证 → 统计阈值计算 → 声明修正 → 最终验证响应。自适应声明验证框架的整体工作流程如图1所示。

数据集准备

TruthfulQA 数据集12包含 817 个以事实为导向的问题,已下载并准备用于评估。 FEVER 数据集13包含 185,445 条经过标注的声明,标签为“支持”、“反驳”或“信息不足”;评估使用了带有声明、证据和真实标签字段的标注开发数据。每条声明均根据其提供的证据进行评估,同时保留原始 FEVER 标签作为验证的参考结果 包含事实验证声明-证据对的 FEVER 数据集已被获取并进行预处理。输入的问题和声明被转换为标准化的文本格式。在实验前,删除了重复条目和不完整的样本。TruthfulQA 被划分为验证和测试子集。大约 20% 的 TruthfulQA 样本(164 个问题)用于阈值调优,其余 653 个问题保留用于性能评估。对于 FEVER 数据集,直接使用基准提供的声明作为验证单元,未进行 TruthfulQA 所需的回答生成和声明提取流程。用于框架开发与评估的基准数据集特征总结于表 1中。

初始反应生成

每个查询均提交至基础语言模型。响应通过核采样(nucleus sampling)生成,温度设为0.7,top-p设为0.9。最大输出长度限制为256个token。生成的响应在未经过任何后处理或人工修改的情况下被存储,并直接转发至声明提取阶段。

声明提取

将每个生成的回复分解为可独立验证的事实陈述。采用结构化分解提示来识别原子性声明。复合陈述被拆分为最小的事实单元。主观观点、修辞表达和对话填充内容被剔除。每个提取出的声明均作为独立的验证单元进行存储。

示例:

原始回复:

“玛丽·居里是一位出生于波兰的物理学家和化学家,她对放射性进行了开创性研究。”

提取的声明:(1)Marie Curie 出生于波兰;(2)Marie Curie 是一位物理学家和化学家;(3)Marie Curie 开展了关于放射性的研究。

独立参照构建:

针对每个提取出的声明,均生成一个独立的事实参考文献。验证模型仅接收原始用户查询,无法访问原始生成的响应,以避免确认偏倚。采用事实召回提示语,以促使生成简洁且基于证据的回答。所生成的参考文献被保存下来,用于后续验证。

自然语言推理验证

每个声明-参考文献对均被提交至一个预训练的自然语言推理(NLI)模型。该NLI模型将关系分类为:蕴含(Entailment)、中性(Neutral)或矛盾(Contradiction)。记录了所有三个类别的置信概率。分配了一个带符号的验证分数:蕴含关系对应正值,中性关系对应零值,矛盾关系对应负值。收集所有验证分数用于阈值计算。

自适应统计阈值计算

NLI 模型生成的验证置信度在不同回答之间存在显著差异,因为不同的查询会产生不同数量的主张、语义复杂程度以及置信度分布。固定的全局阈值假设所有回答具有相似的置信度分布,而这种情况在实际中很少出现。为了适应这种变异性,所提出的框架利用每个回答的验证得分的均值和标准差,分别估计其决策边界。均值反映了该回答的整体置信水平,而标准差则刻画了所提取主张之间置信度值的离散程度。这种自适应的设定使得接受标准能够根据每个回答特有的不确定性进行调整,而非对所有输入依赖单一的阈值。

计算了所有带符号验证分数的平均值(µ)和标准差(σ)。

自适应决策阈值的计算公式如下:

figure-protocol-1

其中,τ 表示自适应阈值,µ 表示验证得分的均值,σ 表示标准差,k 表示灵敏度参数。

敏感性参数的初始值设为 0.7。分类为“蕴含”且得分大于或等于 +τ 的声明被接受;分类为“矛盾”且得分小于或等于 −τ 的声明被标记为需要修正;得分为区间 (−τ, +τ) 内的声明则保留为中性。

选择性权利要求更正

仅当NLI模型将声明-参考文献对分类为“矛盾”(Contradiction),且其对应的带符号验证分数满足自适应阈值条件si ≤ -τ时,该声明才会被提交进行更正。因此,更正决策由NLI分类标签和响应特异性的统计阈值共同决定。被分类为“蕴含”(Entailment)且si ≥ τ的声明被接受;而落在区间-τ < si < τ内的声明被视为中性,予以保留且不作更正。这一联合判据确保了仅对同时表现出语义矛盾和足够强的负向验证证据的声明实施更正。

反应重建

已接受并修正的陈述按其原始顺序排列。恢复了句子边界以保持可读性。必要时进行了轻微的语法调整。组装后的输出被保存为最终的验证响应。

性能评估

该框架通过以下四个指标进行评估:(1)准确率:验证后仍保持事实正确的回答所占的比例;(2)F1 分数:幻觉检测精确率与召回率的调和平均值;(3)响应延迟:从提交查询到生成已验证响应的总处理时间;(4)幻觉率

figure-protocol-2

延迟报告为多次测量的平均执行时间。由于未保留每次运行的个体延迟值,因此未计算标准差和置信区间。

特定基准的正确性评估

对于 TruthfulQA,将最终验证后的回答与基准中人工验证的答案参考以及错误答案列表进行比较。当回答中的事实主张与公认答案信息一致,且不包含与已识别的错误回答模式相对应的内容时,该回答被视为正确。对于 FEVER,针对最终输出中的每个声明,均根据其相关证据和原始 FEVER 标注进行评估;被标记为“支持”的声明视为事实正确,而被标记为“反驳”的声明则视为错误。标注为“信息不足”的情况被保留为不确定结果,而不作为正面事实证据处理。最终,将每个基准测试中的声明级别判断结果进行汇总,以计算报告的准确率和幻觉率。

实验环境

该框架使用 Python 3.9 实现。数据处理操作通过数值计算和表格分析库完成。自然语言推理(NLI)模型以推理模式运行,未进行额外的微调。实验在配备 Intel Core i5 处理器、16 GB 内存和 64 位操作系统的计算机工作站上执行。所有评估均采用单次前向推理设置,以确保低延迟运行。所有实验均在相同的硬件和软件配置下进行,以保证在不同数据集和基线方法之间的评估一致性。

预期结果

该方案旨在通过识别可能缺乏支持的声明,并有选择性地将明显矛盾的声明转发以进行修正,从而生成针对每个声明的验证结论。预期输出为经过验证的回复,其事实不一致性减少,且额外处理开销有限,具体效果以实验评估中观察到的性能为准。

结果

初始反应生成

基线语言模型针对两个基准数据集中的问题生成了流畅且上下文相关的回答。然而,详细分析发现,部分回答中存在缺乏依据和事实错误的陈述。在TruthfulQA数据集中,基线系统的幻觉率为28%,而在FEVER数据集中观察到的幻觉率为26%。这些结果证实,仅依靠直接语言生成对于需要高事实可靠性的应用而言是不足的,并确立了后续所有验证程序所比较的基线条件。

声明提取

声明提取过程成功地将生成的响应分解为可独立验证的事实单元。TruthfulQA 中的响应平均包含 3.2 个原子级声明,而 FEVER 样本通常仅包含单个声明。该分解过程在不引入额外信息的情况下分离出事实陈述,使得每条陈述均可被单独评估。这一观察结果支持了如下假设:在声明层级进行验证比将整个响应作为单一单元进行评估具有更高的精确度。

独立参考构建

针对每个提取出的声明,使用仅基于原始查询的独立推理过程生成了相应的参考文献。所生成的参考文献提供了简洁的事实性描述,其内容与原始回答足够不同,可作为独立的验证来源。参考文献的生成过程与初始回答相互隔离,以避免事实参考直接依赖于模型先前的输出。这种分离旨在减少潜在的确认偏倚,并为后续的声明级别验证提供受控基础;但本研究未对这一效应的程度进行独立量化。独立参考文献的成功生成支持了将知识回忆与回答生成相分离的 proposed 设计原则。

自然语言推理验证

NLI 验证阶段有效地将声明-参考文献对分类为蕴含、矛盾和中性三类。存在矛盾的声明 consistently 获得负向验证评分,而事实支持的声明则获得正向评分。对于缺乏足够支持证据的声明,则被赋予中性分类。该结果表明,语义推理能够可靠地识别出缺乏支持的事实性陈述,并为针对性纠正提供了所需证据。与简单的连贯性检查策略相比,NLI 验证将幻觉率从 20% 降低至 15%,显示出更强的检测能力。

自适应统计阈值法

采用自适应统计阈值方法通过根据每个回答的置信度得分分布动态调整决策边界,进一步提升了验证性能。阈值敏感性分析表明,当阈值参数从0.3增加到0.7时,性能得到改善。在敏感度值为0.7时,该框架实现了0.87的准确率,同时将幻觉率降低至9%(图2)。针对所评估的k值,完整的敏感性分析结果见补充表2。将阈值进一步提高仅带来准确率的微小提升,但会增加延迟。这些观察结果支持了如下假设:相较于固定决策边界,自适应阈值在应对不同回答间变化的置信度分布时更为有效。

自适应阈值还反映了每个回答内部置信度分数的变异性。验证分数高度一致的回答会产生较小的标准差,从而形成更具选择性的决策边界。相比之下,包含置信度值异质性较高的声明的回答会产生较大的标准差,导致更宽泛的接受区域,减少对不确定性声明的不必要修正。尽管这种自适应行为无法完全消除所有假阳性或假阴性结果,但它能够使决策边界响应每个回答的不确定性特征,而非对所有输入采用统一的判断标准。

选择性权利要求修正与答复文件组装

仅将被识别为矛盾的陈述提交修正,而已获支持和中立的陈述则保持不变。这种选择性修正策略最大限度地减少了不必要的重新生成,并保留了响应的原始结构。在完成修正与响应重构后,TruthfulQA 上的幻觉率从 28% 下降至 9%,相对降低了 67.9%。在 FEVER 数据集上也观察到类似的改进,幻觉率从 26% 降至 10%。各评估配置下的准确率与幻觉率对比分别如图 3 和图 4所示。

性能评估

比较评估结果表明,该框架在所有测试方法中实现了最高的整体性能。在TruthfulQA数据集上,该框架的准确率达到0.87,F1分数达到0.85,优于固定阈值验证方法和基于自洽性的方法(表2,图3和图4)。在FEVER数据集上,该框架的准确率为0.89,F1分数为0.87(表3,图3和图4)。通过表4所示的消融分析,考察了框架各组件的增量贡献。这些改进证实,将声明级别验证与自适应统计决策相结合,能够在多个数据集上提升事实可靠性。SelfCheckGPT、FActScore与所提出框架在幻觉检测准确率方面的对比结果见图5

潜伏期分析

完整的验证流程保持了较低的计算开销。平均响应时间从基线模型的820 ms增加到完整框架的980 ms,仅表现为处理时间的轻微增加。表5)。响应生成占总延迟的大部分,而验证和修正阶段引入的额外开销相对较小。各阶段处理时间的细分情况如下所示 补充表 3与基于检索的验证系统(每次查询约需1600毫秒)相比,所提出的框架在保持相当的事实准确率的同时,显著降低了延迟。这些结果支持了以下假设:可在不牺牲实时可用性的前提下实现幻觉减少。

由于响应生成依赖于基于云的语言模型,个体延迟测量值会因网络状况和服务器端调度而产生波动,而非确定性的执行时间。因此,通过多次测量获得具有代表性的平均值,以降低瞬态执行变异性的干扰,同时保留所评估方法之间的相对比较。延迟值报告为多次实验运行的平均执行时间。未保留每次运行的单独延迟值;因此,无法进行事后计算方差、置信区间或其他变异性指标。因此,图6中的延迟值及速度-准确性比较以点估计形式呈现,不包含误差条。

综上所述,结果表明,结合声明提取、独立参考生成、自然语言推理验证、自适应统计阈值设定以及选择性修正,能够提高大语言模型输出的事实可靠性。该框架在 TruthfulQA 上将幻觉率从 28% 降低至 9%,在 FEVER 上从 26% 降低至 10%。结果表明,在所评估的条件下,自适应声明级别验证在提升事实可靠性指标的同时,将额外的响应延迟控制在可接受范围内。

数据可用性

本研究中分析的数据集均可通过其各自的官方来源公开获取。论文提供了支持重复所述分析所需的数据集信息、模型配置和方法学细节。研究期间生成的已处理评估数据和补充结果详见补充文件。

figure-results-1
图1:自适应声明验证框架的工作流程。 初始由大语言模型生成的回答被分解为多个事实性声明,随后进行独立的参考文献生成、基于自然语言推理(NLI)的验证、置信度评分和统计阈值判断。满足接受标准的声明被保留,而满足修正标准的声明则在最终回答组装前进行针对性修正。请点击此处查看该图的放大版本。

figure-results-2
图2:敏感性参数(k)对验证准确率的影响。在 k 值分别为 0.3、0.5、0.7 和 1.0 时,TruthfulQA 和 FEVER 数据集上的准确率。两个数据集上的准确率均随 k 增大而提高,最终选择 k = 0.7 用于主要评估。请点击此处查看该图的放大版本。

figure-results-3
图3:不同验证方法的准确性比较。 基线大语言模型、基于自然语言推理(NLI)的验证方法以及本文提出的自适应验证框架在 TruthfulQA 和 FEVER 数据集上的准确性表现。请点击此处查看该图的放大版本。

figure-results-4
图4:不同验证方法间的幻觉率比较。 基线大语言模型、基于自然语言推理(NLI)的验证方法以及所提出框架在TruthfulQA和FEVER数据集上的幻觉率。所提出的框架将TruthfulQA上的幻觉率从28%降低至9%,在FEVER上从26%降低至10%。请点击此处查看该图的放大版本。

figure-results-5
图5:不同方法的幻觉检测准确率。 SelfCheckGPT、FActScore 及本文提出框架在 TruthfulQA 和 FEVER 数据集上的检测准确率。请点击此处查看该图的放大版本。

figure-results-6
图6:不同验证方法在响应时间与准确率之间的权衡。 TruthfulQA 和 FEVER 数据集上各评估方法的响应延迟与准确率之间的关系,展示了所提出框架及对比方法在性能与延迟之间的权衡。 请点击此处查看该图的高清版本。

数据集使用的样本数领域平均响应长度(token)基线大语言模型幻觉率
TruthfulQA81738(科学、历史、法律等)4228%
FEVER1,000一般事实性陈述1826%

表1:基准数据集特征。 用于框架开发与评估的TruthfulQA和FEVER数据集的汇总信息,包括样本数量、基线准确率、基线幻觉率以及每个样本的平均声明数。

方法准确率精确率召回率F1 分数幻觉率 %
基线大语言模型(单次推理)0.720.710.690.728%
基于自然语言推理的验证(固定阈值)0.820.8150.7850.815%
SelfCheckGPT0.760.7550.7250.7422%
FActScore0.850.84250.81750.8311%
本文提出的框架(统计阈值)0.870.860.840.859%

表2:TruthfulQA上的性能比较。 基线大语言模型、SelfCheckGPT、FActScore、NLI验证方法以及所提出框架的准确率、精确率、召回率、F1分数和幻觉率。

方法准确率精确率召回率F1 分数幻觉百分比
SelfCheckGPT0.78
FActScore0.87
Baseline LLM†0.740.730.710.7226%
NLI-Based Verification (Fixed Threshold)0.830.82250.79750.8114%
Proposed Framework (Statistical Threshold)0.890.87750.86250.8710%

表3:在FEVER数据集上的性能比较。 基线大语言模型、SelfCheckGPT、FActScore、NLI验证方法以及所提出框架的准确率、精确率、召回率、F1分数和幻觉率。

配置准确率精确率召回率F1 分数(新增)幻觉率
基线语言模型0.720.710.690.728%
基线 + 次级校验(不含 NLI)0.780.77250.74750.76*20%
基线 + 基于 NLI 的验证(固定阈值)0.820.8150.7850.815%
基线 + 统计决策模块(完整版)0.870.860.840.859%

表4:框架组件的消融分析。 逐步引入二次验证、自然语言推理验证和自适应统计阈值化后,准确率、F1分数和幻觉率的变化情况。

方法平均响应时间 (ms)
基线大语言模型(单次生成)820
自验证机制910
提出的统计框架980
检索增强验证(RAG)1600

表5:不同验证方法的响应延迟。 自验证、所提出的框架以及检索增强验证相对于基线大语言模型的平均响应时间及额外延迟。

补充表 1:幻觉验证方法的比较。 本框架与现有方法在外部检索、声明级别验证、自适应阈值设定以及低延迟高效处理方面的比较。请点击此处下载该文件。

补充表 2:阈值参数(k)的敏感性分析。 在阈值参数分别为 0.3、0.5、0.7 和 1.0 时,获得了准确率、精确率、召回率、F1 分数以及幻觉率。主要评估采用的 k 值为 0.7。请点击此处下载该文件。

补充表 3:验证流程各阶段的处理时间。 初始响应生成、声明分解、参考文献生成、自然语言推理(NLI)推断及选择性修正各阶段的平均执行时间及其对总响应时间的贡献百分比。请点击此处下载该文件。

补充表 4:验证过程中发现的错误分布。 假阴性、假阳性和校正错误的数量及百分比,以及每种错误类型相关的主要幻觉类别。请点击此处下载该文件。

讨论

该框架在避免重复采样和外部检索的同时,提升了事实验证性能。在 TruthfulQA 数据集上,幻觉率从基线大语言模型的 28% 下降至完整框架的 9%,准确率则从 0.72 提升至 0.87。在 FEVER 数据集上,幻觉率从 26% 降至 10%,准确率从 0.74 提高到 0.89。这些比较结果应结合本研究中所采用的实验设置与实现方式来理解,而非作为该框架在所有部署条件下普遍优越的证据。该框架通过独立的事实参考和选择性修正,执行生成后的声明级别验证,在外部知识关联、重复推理与轻量级生成后验证之间实现了权衡。响应生成器与参考生成器均基于相同的底层 GPT-3.5 Turbo 模型,但在不同的提示目标和隔离的执行环境中运行。参考生成器仅接收原始查询,无法访问先前生成的响应。因此,这两个生成过程在程序上是相互独立的,但在统计上并非完全独立,可能保留源自其共享预训练模型的相关事实性偏差。

与现有方法的比较

基于先前关于基于自然语言推理(NLI)的事实性检查的研究,固定阈值NLI基线方法采用0.7的置信度阈值14 SelfCheckGPT15代表一种零资源幻觉检测方法,通过生成多个随机样本并利用NLI识别不一致的陈述。FActScore16将生成的回答分解为原子事实,并基于维基百科知识源检索到的参考信息对其进行验证。相比之下,所提出的框架在无需重复生成完整回答或外部检索的情况下,实现陈述级别的验证。

DoLA 是一种轻量级的补充方法,通过在推理过程中对比不同 Transformer 层生成的 token 概率来增强事实生成。本文未包含与 DoLA 的直接实验比较,因为 DoLA 修改了 token 生成过程,而本文提出的方法则执行生成后的声明级别验证与选择性修正。实现 DoLA 需要访问内部 Transformer 层的表征,但本研究中使用的 GPT-3.5 Turbo API 并未提供此类访问权限。缺乏外部检索虽然降低了对检索的依赖及相关处理需求,但也限制了验证范围,仅限于底层模型所掌握的知识。因此,对于超出验证器知识覆盖范围的完全虚构内容或专业性声明,仍然难以纠正。

自适应统计阈值法与选择性校正

自适应阈值源自经验置信度评分分布,用于控制幻觉检测的召回率与校正精度之间的权衡。敏感性分析在独立保留的 TruthfulQA 验证集上评估了 0.3、0.5、0.7 和 1.0 等取值。当 k = 0.7 时,在所评估的基准测试中,幻觉抑制效果与计算效率之间达到了最平衡的权衡。

最佳阈值可能因应用领域的不同而有所变化,因为自然语言推理(NLI)置信度得分的分布取决于所生成内容的性质。在将方法应用于新领域时,因此可以使用反映目标应用场景的验证集来评估候选阈值,并选择一个在事实验证性能、修正率和处理延迟之间取得平衡的值。由于阈值优化仅涉及单个标量参数,而无需重新训练模型,因此该适应过程不需要修改底层模型。

选择性校正将再生范围限制在被分类为“矛盾”且满足统计阈值标准的声明上。这避免了对不符合校正标准的声明进行重复处理,并使该框架区别于全响应重采样和迭代优化方法。

延迟与性能之间的权衡

该框架的平均响应时间为980毫秒,相比之下,基线大语言模型为820毫秒,检索增强验证为1600毫秒。阶段级分析显示,初始响应生成占总延迟的83.7%,而自然语言推理(NLI)推断占3.9%,选择性修正平均贡献不足1%。延迟值报告为多次实验运行的平均执行时间。单次运行的延迟值未被保留,因此无法进行事后计算方差、置信区间或其他变异性指标。因此,延迟值及速度-准确性比较以无误差条的点估计形式呈现。所报告的延迟值反映了本研究中使用的实验环境,在不同部署条件下可能会有所变化,特别是在使用基于云的语言模型API时。网络延迟、服务器负载和服务可用性均可独立影响绝对响应时间,无论所提出的验证框架如何。

误差分析

在 TruthfulQA 测试集中被错误处理的声明被归类为假阴性、假阳性或修正错误。这些错误的分布情况及主要类别汇总于补充表 4中。假阴性占所有错误的 52.6%,主要与时间性幻觉和细微的事实替换有关。当验证器与基础模型具有相同的训练截止时间时,可能会遗漏时间性错误;而细微的事实替换可能获得中性(Neutral)而非矛盾(Contradiction)的自然语言推断(NLI)得分。

假阳性占错误总数的35.9%,主要出现在验证器模型高置信度知识覆盖范围之外的不常见、高度特异或近期确立的事实中。尽管这些陈述在事实上是正确的,但其自然语言推理(NLI)蕴含得分较弱。纠正错误占所有错误的11.5%,发生在识别出完全捏造的内容时,但由于验证器知识覆盖不足,纠正过程本身又生成了另一个不准确的陈述。

这些发现表明,残余误差源于非线性干扰(NLI)判别和验证器知识覆盖范围两方面,尤其体现在时间不准确、细微的事实替换、不常见的事实以及完全虚构的内容上。

统计学分析

使用固定阈值的自然语言推理验证时,幻觉率从15%下降到使用所提出统计框架的9%,而完整框架在TruthfulQA上的幻觉率则从基线的28%降低至9%。这些差异被报告为描述性性能变化,由于当前评估未包含支持此类推断所需的统计检验结果和效应量估计,因此未声称具有正式的统计显著性17,18

局限性

该框架的验证性能受限于底层自然语言推理(NLI)模型的能力。DeBERTa-v3-large 模型在细粒度的数值比较、时间推理以及需要跨多个事实进行多跳推理的声明方面可能存在困难。NLI 模型的局限性还可能导致涉及细微事实替换的假阴性结果,且 NLI 模型中的系统性弱点可能会传递至验证决策中。

响应生成器和参考生成器使用相同的底层 GPT-3.5 Turbo 模型。尽管不同的提示目标和独立的执行上下文提供了程序上的独立性,但这两个过程在统计上并不独立,可能保留其共享的预训练模型中的相关事实偏差。

评估器与验证器的耦合构成了另一项局限性。最终的幻觉评估使用了与在所提出流程中验证声明相同的自然语言推理(NLI)模型。这可能导致验证器与评估器之间产生一致性,从而影响所测得的改进效果。因此,报告的结果应被理解为在定义的基于NLI的评估程序下的性能表现,而非幻觉减少的完全独立证据。独立的人工评估或独立开发的评估模型将提供更强有力的验证。

声明分解阶段仅针对其对端到端验证的贡献进行了评估,而未与人工标注的声明边界进行独立比对。因此,该研究未提供关于分解准确性的单独定量估计,也未单独分析其对下游验证过程的误差传播情况。

评估仅限于TruthfulQA和FEVER数据集,且仅针对英文内容。因此,所观察到的性能并不能证明该方法可推广至专业领域、多语言环境或长文本生成任务。由于自然语言推断(NLI)置信度得分的分布情况取决于生成内容的性质,最优的k值在不同应用领域中也可能有所不同。因此,在将本研究结果推广到当前评估条件之外的应用场景之前,需要进行针对特定领域的校准以及更广泛的评估。

最后,延迟测量结果特定于实验配置,可能因执行环境的不同而有所差异。由于未保留每次运行的单独延迟测量数据,无法在事后估计变异性及置信区间。未来的评估应保留单次测量数据,并对不同执行环境下的延迟进行更广泛的统计表征。

未来工作

未来的研究应解决当前框架中发现的主要局限性。需要针对特定领域进行阈值校准,因为使用TruthfulQA选定的固定值(k = 0.7)可能不适用于具有不同自然语言推断(NLI)置信度得分分布的专业领域。可利用特定领域的验证数据来校准阈值,并在必要时对假阴性和假阳性错误施加非对称惩罚19

改进的声明分解应包含使用人工标注声明边界的独立评估,以量化其完整性、正确性以及下游错误传播情况。经过微调的分解模型和分解置信度度量可进一步减少因声明分割不当而产生的错误。未来的比较评估还应在统一的实验协议下纳入基于轻量级解码的方法,例如 DoLA。

轻量级检索增强可能有助于解决完全虚构的问题,当验证者缺乏足够事实知识时,这一问题仍然难以处理。针对低置信度且相互矛盾的声明,采用有针对性的检索回退机制,可以在无需对每个声明都进行检索的情况下,提供外部事实支持20

还需要一个多语言扩展,因为当前的评估仅限于英语基准测试3。未来的研究应在多语言幻觉基准测试上评估多语言自然语言推理模型以及针对特定语言的声明分解与修正提示。

结论

本研究提出了一种两步式声明验证框架,该框架结合了原子声明分解、分别提示生成的事实参考、自然语言推理(NLI)验证、自适应统计阈值设定以及选择性修正。在TruthfulQA数据集上,该框架将幻觉率从28%降低至9%,相较于基线大语言模型(LLM),平均延迟仅增加160毫秒。在FEVER数据集上,幻觉率从26%下降至10%。

该框架在事实验证任务中取得了具有竞争力的性能,且无需重复进行完整响应采样或依赖外部检索。自适应阈值设定与选择性修正机制在限制额外处理开销的同时,有助于实现所观察到的性能提升。然而,研究结果仅限于所评估的基准数据集和实验条件,仍受限于自然语言推理模型的依赖性、评估器与验证器的耦合关系、声明分解的不确定性、领域特定的阈值校准以及延迟波动等因素。因此,在将研究成果推广至更广泛的应用场景之前,尚需开展更全面、独立、面向特定领域及多语言环境的评估。

披露

作者声明无利益冲突。

致谢

作者谨向其所在机构致以诚挚感谢,感谢提供了开展本研究所必需的学术环境和计算资源。作者同时感谢本研究中所使用的公开基准数据集的开发者与维护者,这些数据集使得对所提出框架的全面评估成为可能。作者感谢同事和审稿人提出的建设性意见,这些意见有助于提升本研究的质量与表述清晰度。作者还感谢开源研究社区提供了促进实验、数据分析和结果可视化的软件库与工具。社区成员的持续努力极大地推动了自然语言处理与可信人工智能领域的研究进展。作者声明,本研究未接受任何外部财政支持或资助。

材料

本文使用的材料清单
姓名公司目录编号评论
FEVER 基准数据集FEVER 共享任务(Thorne 等)https://fever.ai/dataset/fever.html公开可用的事实验证数据集,包含声明-证据对,用于评估
GPT-3.5 Turbo(大型语言模型 B10+2:12:12)OpenAI模型 ID:gpt-3.5-turbo;https://developers.openai.com/api/docs/models/gpt-3.5-turbo既用作响应生成器,也用作独立的参考生成器,通过 OpenAI API 访问
NumPyNumPy 开发者(开源)https://numpy.org/用于统计计算的数值计算库,包括 NLI 验证得分的均值和标准差计算
Openai(Python API 客户端库)OpenAIhttps://github.com/openai/openai-pythonPython 客户端库,用于向 GPT-3.5 Turbo 提交提示并获取生成结果
pandaspandas 开发团队(开源)https://pandas.pydata.org/用于表格数据处理的库,用于数据集预处理和结果处理
预训练自然语言推理(NLI)分类模型Hugging Face 模型中心(基于微软 DeBERTa-v3-large 架构构建的模型)MoritzLaurer/DeBERTa-v3-large-mnli-fever-anli-ling-wanli以推理模式使用,未经微调,用于将每个声明-参考对分类为蕴含、中立或矛盾
PythonPython 软件基金会版本 3.9;https://www.python.org/downloads/release/python-390/用于实现验证框架的核心编程语言
SciPySciPy 开发者(开源)https://scipy.org/科学计算库,用于支持实验结果的统计分析
Transformers(Hugging Face Transformers 库)Hugging Facehttps://github.com/huggingface/transformersPython 库,用于加载和运行预训练的 NLI 模型
TruthfulQA 基准数据集由 Lin、Hilton 和 Evans 首次发布https://github.com/sylinrl/TruthfulQA公开可用的基准数据集,包含 817 个面向事实的问题,用于阈值调优和评估
工作站计算机文稿中未指明(请确认制造商/型号)Intel Core i5 处理器;16 GB 内存;64 位操作系统用于在相同配置下执行所有实验的硬件设备
注:上述所有 URL 均已在本表格发布日期前核实为有效链接。 

参考文献

  1. Dai Z, et al. Promptagator: Few-shot dense retrieval from 8 examples [conference presentation]. Presented at: The Eleventh International Conference on Learning Representations; 2022. [https://iclr.cc/virtual/2023/poster/10937]
  2. Achiam J, et al. GPT-4 technical report. arXiv. 2023;arXiv:2303.08774. [https://arxiv.org/abs/2303.08774]
  3. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):1-38.
  4. Bender EM, McMillan-Major A, Shmitchell S, Gebru T. On the dangers of stochastic parrots: Can language models be too big? [conference presentation]. Presented at: 2021 ACM Conference on Fairness, Accountability, and Transparency; 2021. [https://dl.acm.org/doi/10.1145/3442188.3445922]
  5. Devlin J, et al. BERT: Pre-training of deep bidirectional transformers for language understanding [conference presentation]. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2019. [https://arxiv.org/abs/1810.04805]
  6. Maynez J, Narayan S, Bohnet B, McDonald R. On faithfulness and factuality in abstractive summarization [conference presentation]. Presented at: 58th Annual Meeting of the Association for Computational Linguistics; 2020. [https://arxiv.org/abs/2005.00661]
  7. Brown T, et al. Language models are few-shot learners. Adv Neural Inf Process Syst. 2020;33:1877-901.
  8. Guu K, et al. Retrieval augmented language model pre-training [conference presentation]. Presented at: International Conference on Machine Learning; 2020. [https://arxiv.org/abs/2002.08909]
  9. Izacard G, Grave E. Leveraging passage retrieval with generative models for open domain question answering [conference presentation]. Presented at: 16th Conference of the European Chapter of the Association for Computational Linguistics; 2021. [https://arxiv.org/abs/2007.01282]
  10. Bowman SR, Angeli G, Potts C, Manning CD. A large annotated corpus for learning natural language inference [conference presentation]. Presented at: 2015 Conference on Empirical Methods in Natural Language Processing; 2015. [https://arxiv.org/abs/1508.05326]
  11. Platt J. Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods. Adv Large Margin Classif. 1999;10(3):61-74.
  12. Lin S, Hilton J, Evans O. Truthfulqa: Measuring how models mimic human falsehoods. InProceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) 2022 May (pp. 3214-3252).
  13. Thorne J, Vlachos A, Christodoulopoulos C, Mittal A. FEVER: A large-scale dataset for fact extraction and verification [conference presentation]. Presented at: 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2018. [https://aclanthology.org/N18-1074/]
  14. Williams A, Nangia N, Bowman SR. A broad-coverage challenge corpus for sentence understanding through inference. arXiv. 2017;arXiv:1704.05426.
  15. Manakul P, Liusie A, Gales M. SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models [conference presentation]. Presented at: 2023 Conference on Empirical Methods in Natural Language Processing; 2023.
  16. Min S, et al. FActScore: Fine-grained atomic evaluation of factual precision in long-form text generation. arXiv. 2023;arXiv:2305.14251.
  17. Cohen J. Statistical power analysis for the behavioral sciences. Routledge; New York; 2013.
  18. Kadavath S, et al. Language models (mostly) know what they know. arXiv. 2022;arXiv:2207.05221.
  19. Hendrycks D, et al. Aligning AI with shared human values. arXiv. 2020;arXiv:2008.02275.
  20. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-74.

重印与许可

标签

TruthfulQA SelfCheckGPT
视频即将推出