我们提出了一种基于强化学习的微调方法,用于大型语言模型,利用恩蒂幻觉指数(EHI)作为奖励信号,以减少文本摘要中的实体级幻觉。会议记录的实验表明,这种方法提高了实体的忠实性和准确性。
研究文章
我们提出了一种基于强化学习的微调方法,用于大型语言模型,利用恩蒂幻觉指数(EHI)作为奖励信号,以减少文本摘要中的实体级幻觉。会议记录的实验表明,这种方法提高了实体的忠实性和准确性。
大型语言模型(LLMs)的最新进展显著提升了抽象摘要的质量。然而,幻觉——尤其是实体层面的幻觉,即引入不存在或错误的实体——仍是一个关键挑战。本研究提出以实体幻觉指数(EHI)为指导指标的奖励驱动微调总结模型框架。该方法论从结构化转录本数据集XSUM上从预训练模型如Flan-T5、DistilBART和Mistral(或其他流行LLM)生成初始摘要开始。我们通过从生成的摘要和黄金引用中提取命名实体,评估精度,并惩罚虚构实体来计算EHI。微调过程由强化学习引导,EHI作为奖励信号。我们采用类似REINFORCE的更新机制,以优化总结模型,以最大化实体忠实度。实验表明,经过EHI精细调优的模型在不影响信息量的前提下,能实现更低的幻觉率。此外,我们表明EHI引导模型在域外总结任务中泛化效果更好,显示出更强的鲁棒性。这里的方法为提升总结中的事实性提供了实用方向,强调了准确实体表示的关键作用。
由大型语言模型(LLMs)驱动的抽象总结模型在多个领域取得了令人印象深刻的成果。然而,持续存在的挑战是幻觉,即生成的摘要包含不基于源输入的错误或捏造信息 1,2。在会议摘要、医疗报告或财务文件等高风险应用中,尤其是涉及指定实体的幻觉,可能显著削弱可信度和效用。
R检索者进行了大规模的人类评估,发现摘要器经常产生幻觉——这些内容并未得到原始文档的支持——并且这些幻觉与重复和不连贯性相关1.另一项研究显示,抽象度更高的模型往往更不忠实;他们的研究报告指出,抽象度更高的输出事实准确性较低,句子不忠实度也更高。FRANK基准报告显示,大约30%的摘要存在事实不一致,另一项流行研究也指出类似的错误率,认为高幻觉水平使摘要几乎无用 1,2。幻觉可以分为内在的(与来源相矛盾)和外在的(无法从来源验证)。关于抽象总结中幻觉的教程解释说,内在幻觉发生在生成内容与输入内容相矛盾时(例如,错误报告已批准的疫苗被拒绝),而外在幻觉则添加无法验证的事实,例如声称有未被提及的疫苗临床试验 4.报告还报告称,最先进的摘要器在使用ROUGE、BLEU和METEOR评估时,约有25%的输出会产生幻觉内容,并提醒幻觉在健康、法律或网络安全等领域可能有害。
传统的n-gram指标(如ROUGE5、BLEU、METEOR)与人类对事实性的判断相关性较差,促使基于引用和无引用的指标的发展6.基于质量保证的指标如FEQA和QuestEval通过询问总结中得出的问题-答案对是否可以用源文本来评估摘要。FEQA与人类判断的相关性更强,且显示更抽象的总结往往不够忠实,而QuestEval则在一致性、连贯性、流畅性和相关性方面显著提升了与人类判断的相关性。QAFactEval通过选择名词短语答案并在回答前生成问题来完善这一方法;该策略提升了与人类评估在SummaC基准上的相关性。信息提取(IE)度量将知识表示为主语-关系-宾语元组,但它们在提取过程中容易出现错误。自然语言推理(NLI)指标——如FactCC和SummaC——将摘要句子归类为源词的含义或矛盾。FactCC使用弱监督数据训练一个分类器,能够检测事实一致性并突出显示不一致的跨度2.SummaC以适当的粒度应用NLI模型,并得出强有力的事实性估计,但FRANK基准指出,这些指标仍将事实性视为二元对立,缺乏统一框架1,7,8。研究人员提出的人类评估维度如流畅性、连贯性、相关性和一致性被广泛采用。另一项评估研究强调,一致性是最客观的维度,因为它仅仅检查摘要是否由来源所包含;它指出,多达92%的XSum摘要包含忠实度错误。然而,人工评估耗时且成本高昂,因此自动指标对于可扩展评估至关重要8.当前指标常将内在性和外在幻觉合并为单一评分,阻碍错误诊断4.
由于最大似然训练并不能直接优化摘要质量,强化学习(RL)被应用以提升相关性和事实性。Pasunuru 和 Bansal 提出了一个结合显著性(ROUGE)和内涵奖励的多奖励强化学习框架,展示了最先进的性能11。强化学习被应用于REINFORCE算法的提取总结;其模型最大化ROUGE分数,并比基于分类器的方法产生更多信息的总结,这一点由人类问答评估所证明12。多任务模型还包括问题生成和内涵生成,以确保覆盖性和连贯性12.一项关于抽象总结的2024年综合调查强调事实一致性是根本挑战,并主张强化学习鼓励真实的总结。调查建议奖励事实一致的总结,并结合外部知识来源和属性控制以提升准确性13。人类反馈强化学习(RLHF)通过训练基于人类偏好的奖励模型并微调摘要器以最大化所学奖励,扩展了这一理念。来自人类反馈的强化学习(RLHF)在将模型输出与期望品质(如事实性和帮助性)对齐方面获得了广泛关注 4,14。虽然多奖励强化学习和快速逻辑分析使模型与人类的忠实度概念相匹配,但它们依赖粗略指标如ROUGE或二元事实性。相比之下,本文详细的工作建议使用细粒度的实体级幻觉指数作为奖励,这种奖励是经验性的,且计算成本更低,无需人工反馈。
尽管有众多指标,但仍存在若干限制。N-gram指标忽略语义正确性,基于QA和基于IE的指标会从问题生成和提取模型中传播错误,NLI指标则将事实性降低到二元后涵决策1、4、6。研究中强调,现有基于模型的指标难以在细致程度上识别幻觉,因为它们作用于句子或文档层面,无法单独识别导致错误的具体实体4.人体评估仍是黄金标准,但成本高昂且主观性强15。此外,现有指标未能区分内在幻觉与外在幻觉,也未能捕捉关系的过度关注与不足。1.大型语言模型可能产生幻觉,因为它们基于统计似然度而非事实验证来预测文本。由于训练数据的限制、概率生成和缺乏事实核查,模型会产生自信但不正确的输出,过度自信和偏见可能导致它们以较高确定性地陈述错误信息;该指南倡导通过外部数据中的基层模型进行检索增强生成和长期记忆15。然而,这些技术侧重于基于检索的任务;总结仍然需要识别并惩罚幻觉实体的指标。以往的研究已认识到实体层面评估对事实性的重要性。像FEQA和QuestEval这样的指标试图用问答技术评估事实一致性(16,17)。然而,这些方法通常需要参考摘要或外部质量保证系统,限制了可扩展性。我们的工作基于此,采用实体幻觉指数(EHI),这是一个轻量级的实证指标,专注于具体的实体忠诚度,通过将实体分为五种幻觉因子类型,如图1所示。
证据表明,幻觉普遍存在,评估指标不完美,强化学习技术缺乏细致的奖励。人类研究表明,总结模型在相当大比例的情况下会出现幻觉,常常交换实体或捏造细节9。现有指标要么强调n-gram重叠,要么将事实性视为二元,当前的强化学习方法则优化ROUGE或粗略事实性信号。实体层面的指标存在空白,用于衡量摘要中提及源中不存在的实体(负面幻觉)、遗漏关键实体(失去焦点幻觉)及其他情景的情况。提出的针对实体幻觉指数(EHI)的微调方法,通过在实体层面量化幻觉并为强化学习提供结构化奖励,填补了这一空白。通过将EHI整合进RLHF,我们旨在微调大型语言模型,以减少实体层面的幻觉,并生成既流利又忠实的摘要。
在本研究中,我们提出了一种新颖的微调方法,利用实体幻觉指数(EHI)作为奖励信号,在实体层面减少幻觉。EHI通过比较模型输出中提取的实体与输入文档中的实体,量化实体的正确性和基础性,从而减少对参考文献的依赖 18。此处描述的方法使模型倾向于产生更忠实实体的摘要,而无需人工事实性注释。
总之,事实意识的奖励模型已被用于微调19,20。与以往依赖粗略事实性奖励或人工标记数据集的方法不同,我们提出利用EHI作为直接、自动的奖励信号进行微调,从而促进基于实体的总结,无需额外监督。本研究的新颖贡献如下:(i) 引入了EHI引导的微调框架,提升了抽象总结中的实体忠实性,(ii) 提供了不依赖人工标注事实数据集的可扩展强化学习流程,(iii) 研究展示了会议记录数据集、XSUM新闻数据集中EHI分数的实证提升,并进行定性分析以突出幻觉的减少, (iv)本研究共享了基于Colab的可重复实现,以促进对幻觉感知总结的进一步研究21。
本研究评估了这样一个假设:通过优化如EHI等细粒度实体导向奖励的语言模型,能够有效提升摘要任务的忠实性和可靠性,从而减少计算。该方法促进了参数高效精细调以实现总结忠实性的领域,其特点是:(i) 展示编码-解码器(DistilBART、FlanT5)和仅解码器(Mistral)架构的有效性,(ii) 提供可适应不同模型类型、域和尺度的框架,以及 (iii) 相较于完全重新训练的计算效率。
访问受限。请登录或开始试用以查看此内容。
本研究的目标是微调语言模型(LM),以生成具有减少实体幻觉的摘要。幻觉发生在模型“自信地产生错误或无关输出”,因为它根据统计似然而非事实验证生成文本时。这通过基于实体幻觉指数(EHI)设计奖励函数并应用强化学习以最大化其效果来实现。
问题表述
给定输入文档X i,目标是生成一个摘要 Yi ,使得 Yi 中提到的实体基于 Xi 。传统的最大似然训练并不明确优化事实一致性。这些训练方法并不惩罚包含虚构实体。因此,引入了一种以奖励为驱动的微调策略,其中奖励与实体忠诚度成正比,并以EHI进行衡量。
数据集与方法
使用两种语料库:首先是多回合会议记录和抽象黄金摘要的对话转录数据集,其次是XSUM新闻摘要基准22,23。每个数据集都被清理、平整,并分为80%训练区、10%验证区和10%测试区。对话中充满了非正式语言和代词,而XSUM则包含简洁的新闻报道;这种组合使我们能够评估域内和域外推广。
实体提取既对源文档也对摘要进行,用于计算实体幻觉指数(EHI)。在微调阶段,本研究仅使用训练分段,同时监控验证EHI分数以选择最佳检查点。最终评估报告基于保留测试集,该测试集在模型微调前后均为零测。
总之,首先,转录记录被组织成扁平格式并分割数据。预训练模型生成基线摘要。其次,EHI是利用基于变压器的NER和五个幻觉因子计算的。在微调过程中,模型通过LoRa适配器更新EHI奖励。最后,使用微调模型生成摘要,并利用EHI、实体F1及其他指标进行评估(见图2)。所有实验均可通过提供的代码和配置文件重复进行。 图3 展示了数据集准备、基线总结、EHI计算、微调和评估的逐步流程。
基线总结
选择三个预训练的大型语言模型,并捕获其基线摘要:Flan-T5、Mistral(Nous-Hermes-2-Mistral-7B-DPO)和DistilBART24、25、26。每个模型都以零样本模式运行,为每个输入文档(xi)生成初始摘要(Yi)。采用波束搜索,波束宽度为4,长度惩罚为1.0,以鼓励流畅而简洁的总结。这些基线总结用于估算幻觉的流行率,并为微调提供起点。
实体提取与EHI计算
准确计算实体幻觉指数(EHI)需要强大的NER。最初,Spacy 用于 NER 的行动。众所周知,基于变压器的NER模型更为准确,但Spacy是最初的选择,原因如下:(1)基于Transformer的NER模型本身已被证明比Spacy更会产生幻觉。(2)统计空间性带来了实现成本和执行时间的计算效率。(3)它还帮助我们证明,即使NER模型较弱,EHI在减少幻觉方面依然稳健。然而,鉴于实验是在已建立的数据集上进行的,而 spaCy 的en_core_web_sm模型在口语转录本上较为脆弱。Spacy被基于变压器的NER模型(dslim/bert-base-NER)取代,该模型在CoNLL-2003数据集上进行了微调。基于BERT的NER系统已被证明在特定领域任务中优于spaCy模型——例如,航空BERT-NER模型在识别17个实体时达到了94.78%的F1,而spaCy NER识别了7个实体,F1为94.78%,而spaCy NER识别了7个实体,27。BERT NER模型通过Hugging FaceTransformers 28 配置,并执行大小写不相关匹配。为了捕捉代词和表层形式变化,该方法还应用了简单的规则,将“Mr. Smith”和“Smith”映射到同一典范形式;然而,完全共指解析仍是未来的研究成果。对来自XSUM数据集200条记录的NER模型进行比较分析可从 表1推断。
实体幻觉指数(EHI)的计算公式如下:

其中PH、EF、OF、NH、LF分别代表第1条中对应的正向幻觉(PH)、提取性因子(EF)、负性幻觉(NH)、过度聚焦实体(OF)和注意力丧失(LF)的分数。
幻觉因素的详细信息:
阳性幻觉(PH): 新引入实体的事实正确且有益的衡量标准。
开采性系数(EF): 衡量从输入文档中准确提取到摘要中的实体。
负面幻觉(NH): 捕捉错误或不符合输入的幻觉实体。
过度专注(OF): 惩罚那些过于关注狭窄实体子集、缺乏多样性的总结。
注意力迷失(LF): 惩罚遗漏输入中重要实体的摘要。
上述因子的计算详见 图4 ,并附有示例计算以供说明。以输入文档实体(I)为例:“John”,AI“,会议,参考摘要实体(R):”John“,AI”生成摘要实体(G):“John”,AI“,technology”。EHI值越高,表示实体忠实度越高,奖励既提取性又积极幻觉的总结(引入有用但忠实的实体),而惩罚无依据、过度或缺失的实体20。这些因素通过检测到的实体总数进行归一化,得出EHI分数在0到1之间。培训期间对EHI验证进行了监测,以选择最佳检查点。PH和EF奖励有益的新实体和正确的提取,而OF、NH和LF则惩罚重复、制造和遗漏。满分1.0表示摘要中的所有实体均有根基或产生了有益的幻觉,而0分则表示摘要中没有任何具体实体出现在源中。
精细——强化学习的调优过程
微调的详细超参数配置分别在表2、表3和表4中单独提供,分别描绘了Mistral-7B、DistilBart和Flan-T5的优化器类型、学习率、批次大小、硬件规格及其他配置细节。这里的目标是通过最大化生成摘要中预期的实体幻觉指数(EHI)奖励,微调模型参数θ。形式上,对于输入文档X i、生成的摘要 Yi 和模型参数 θ,期望奖励目标定义为:
(2)
其中EHI (y, x) 表示在生成的摘要Y i 与输入 Xi 之间计算的实体幻觉指数。
按照REINFORCE算法25,该目标的梯度估计为:
(3)
实际上,从模型中抽取摘要,计算对应的EHI分数,并应用政策梯度更新以鼓励更高回报的输出。为了实现参数效率的微调,本研究采用了低秩适应(LoRA)。只有LoRA适配器进行了更新,基础型号的重量保持冻结。微调在A100 GPU上进行,学习率较低(例如5× 10-6),批次大小为4,并采用Adamoptimizer 29实现8步梯度累积。总结每500次更新重新生成以刷新奖励估计,训练持续进行直到验证EHI趋同。REINFORCE基线设置为近期奖励的平均值以减少差异。除了EHI外,还记录了F12实体ROUGE-1/2/L评分以监测整体质量。摘要会定期重新生成,以反映模型在微调过程中的改进。
评估指标
输出采用信息量指标如Rouge-1、Rouge-25进行评估。流利度指标,比如Rouge LCS5。实体重叠指标实体F1,以及幻觉指标如EHI、FactCC和QAGS2、6、18、30。FactCC使用基于合成矛盾数据训练的分类器,将句子标记为源的蕴含或矛盾句子。factCC给出了两个评分;当标签有效时,分数被捕获。另一方面,QAGS采用在LLM上运行的问答方法。用于生成文本31题的轻型T5小型模型。Roberta_base_Squad2用于生成输出文本32的答案。这些模型因其执行时计算成本的便利性而被选中。
访问受限。请登录或开始试用以查看此内容。
这里的实验聚焦于定量证据,证明EHI引导的微调在减少多模型架构和数据集中实体层面幻觉方面的影响。结果显示,幻觉指标在保持事实一致性和问答能力的同时持续改善。
数据集性能
对话数据集性能:
表5 展示了多回合对话数据集中幻觉减少的结果。EHI引导的微调为Mistral和DistilBART模型带来了显著改进:
Mistral的EHI得分相对提升了57.8%,从0.346升至0.546,而DistilBART则相对提升了61.5%,从0.317升至0.512。两个模型的事实一致性提升一致,FactCC分别提升了36.6%和64.4%。关于问答表现,QAGS结果呈现混合模式:Mistral略有下降5.7%,DistilBART保持稳定表现,略有提升3.3%,Flan-T5则显著提升20.8%。这表明减少幻觉的方法保留或增强了大多数模型的问答能力。
访问受限。请登录或开始试用以查看此内容。
基于质量保证的指标(如FEQA/QuestEval/QAFactEval)和基于非线性分析的指标(如FactCC/SummaC)需要辅助的质量保证/含涵成分,且通常提供句子层级的判断。相比之下,EHI是一个轻量级、无参考、实体级评分,(i)直接针对我们观察到的主要失效模式——实体幻觉;(ii) 与模型无关且计算速度快;(iii) 作为强化学习微调的密集奖励。从经验角度看,EHI通过精准定位导致事实错误的实体,补充了质量保证/自然信息指标,从而实现有针对性的改进,而无需增加繁重的质量保证或责任流程。
强化学习框架通过使用实体幻觉指数(EHI)作为高密度奖励信号,直接优化实体忠实度18。该指标量化了生成摘要中命名实体的存在、正确性和基础,并按类型和严重程度对幻觉进行分类。在微调过程中,基线摘要会使用EHI进行评分,并强化模型以最大化该指标,将生成调谐为实体忠实输出,而无需依赖人工注释。与句子级别的质量保证(QA)或含涵评分不同,EHI轻量级、无引用且模型无关,支持实体层面...
访问受限。请登录或开始试用以查看此内容。
作者没有什么可透露的。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Colab NVIDIA A100 GPU | NVIDIA | N/A | Google Colaboratory Pro |
| DistilBART (Encoder–Decoder) | Hugging Face | https://huggingface.co/sshleifer/distilbart-cnn-12-6 | |
| dslim/bert-base-NER | Hugging Face (dslim) | https://huggingface.co/dslim/bert-base-NER | 精调的英语命名实体识别BERT基础模型 |
| Evaluation Models QAGS (QA-based) | Salesforce Research | N/A | 事实性分类器 |
| Evaluation Models (Factuality) FactCC | Google Research | N/A | 事实性分类器 |
| Flan-T5 (Encoder–Decoder) | https://huggingface.co/docs/transformers/main/en/model_doc/flan-t5 | 开源、文本到文本的大型语言模型 | |
| Hugging Face Transformers | Hugging Face, Inc. | https://huggingface.co/docs/transformers/index | 模型加载&精调 |
| Nous-Hermes-2-Mistral-7B-DPO | Mistral | https://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPO | 70亿参数语言模型 |
| Programming Language Python 3.10 (Colab runtime) | Python Software Foundation | 版本3.10 | 核心实现 |
| Streamlit | 开源 | https://streamlit.io/ | 事实性分类器 |
| XLSUM dataset | BUET | https://github.com/csebuetnlp/xl-sum | |
| XSUM dataset | 爱丁堡大学 | https://github.com/EdinburghNLP/XSum |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可