需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

通过微调与提示优化提升临床人工智能应用中大语言模型的公平性

475 次观看

DOI:

10.3791/69132

2026年1月2日

本文内容

摘要

医疗领域专用的大语言模型面临伦理和技术挑战,因为它们与其他大语言模型一样,会反映其训练数据中固有的偏见。本方案通过在三个开源模型上使用不同形式的提示语,验证了对四种类型偏见(性别、种族、职业、宗教)的抑制效果。

摘要

大语言模型(LLMs)正越来越多地应用于医疗护理等敏感领域,这带来了多重技术和伦理挑战。最直接的问题包括这些模型中固有的偏见,因为它们是在可能反映社会偏见的大型数据集上进行训练的。此类偏见可能导致输出结果不公平、缺乏普适性,甚至造成伤害,从而使其在现实世界中无法用于临床实践,并且不符合伦理和监管要求。我们考察了在四个关键类别(性别、种族、职业和宗教)中,当对经过微调的模型使用提示时,偏见抑制的效果如何。我们手动整理了一个多样化的推理数据集,并创建了十二种提示变体——其中六种为去偏提示——以测试三种开源大语言模型(Llama2-7B、Mistral-7B 和 Dolly-7B)的输出。使用一种偏见评分指标来评估输出结果的公平性和可解释性,分数越低表示公平性和可解释性越好。我们还注意到,去偏提示能够减少偏见,而对模型进行微调的效果更佳。研究结果强调了及时采取行动、提升模型鲁棒性以及持续进行伦理审查的重要性,以确保大语言模型在现实场景(如医学影像和电子健康记录(EHR)管理)中的可信与公平部署。

引言

大语言模型作为支持多种任务的工具,已产生巨大反响,包括决策支持1,2、文本生成3、文本翻译4、客户情感分析5、问答系统6以及临床报告生成7。近年来,已出现多起应用大语言模型生成内容而对社会弱势个体或群体造成伤害的案例8,9,10。此类陈词滥调式回应的主要原因在于,这些模型所训练的数据集本身包含与种族、性别、社会经济阶层等因素相关的社会偏见。然而,在医疗人工智能系统中,所谓"偏见"与"公平性"的含义可能是主观的,且依赖于具体情境。研究人员已投入大量努力以减轻大语言模型中的社会偏见11,12;然而,仍需进一步改进。研究者已提出多种偏见缓解策略,这些策略可按干预阶段分为预处理、处理中、后处理,或其组合形式,适用于多种不同的应用场景。本方案结合了全部三种策....

访问受限。请登录或开始试用以查看此内容。

方案

所有实验均在 Google Colab 平台(配备 40 GB RAM 的 A100)上进行。为开展实验,从 Hugging Face 获取了 Llama2-7B、Mistral-7B 和 Dolly-7B 的 API 密钥(模型卡片)。

该方案分为三个部分。首先,构建一个数据集,作为评估大语言模型(LLM)中社会偏见的基础。然后设计十二种不同的提示变体,参考Kamruzzaman和Kim38的研究方法,用于探究大语言模型生成推论中是否存在社会偏见。接着,在一组关于种族、宗教、性别和职业的无偏见句子数据集上对大语言模型进行微调,并使用相同的提示再次探测模型,以研究微调对生成推论的影响。所提出的框架如图2所示。

数据集的构建
该框架使用两个数据集。其中一个用于推断,另一个用于对大语言模型(LLM)进行微调。本研究对 StereoSet16 进行修改,构建了一个新数据集 NeutralSet,作为生成推断的基础。大语言模型使用 StereoSet 对四种偏见类型进行预测:种族、宗教、性别和职业。StereoSet 包含两个子数据集:句内数据集和句间数据集。NeutralSet 的一个示例如 表 1....

访问受限。请登录或开始试用以查看此内容。

结果

利用公式1中定义的偏倚评分,我们系统地回答了研究问题,并在四个社会维度上评估了大语言模型(LLM)中的社会偏倚。观察到的偏倚评分在统计学上的显著降低,为所提出的针对高风险任务中LLM偏倚缓解协议提供了实证验证。为了评估NeutralSet(即经过精心筛选的推理数据集)的有效性,我们使用基线标准提示对全部三种原始LLM在StereoSet和NeutralSet上进行查询,并计算平均偏倚评分。如图3所示,NeutralSet相对于StereoSet的偏倚评分降低了7.8分。为回答研究问题的第二部分,我们再次使用六种基本提示技术对全部三种原始LLM进行查询,并计算平均偏倚评分,结果如图4所示。研究结果表明,HP2提示表现最佳,相较于基线标准提示,其偏倚评分降低了4.7分。第二优的提示技术是System 2提示,使偏倚评分降低了3.9%。总体而言,所有提示技术均有助于降低社会偏倚,唯独思维链(CoT)提示例外,其偏倚评分反而上升了1.3分。

接下来,我们进行方差分析(AN.......

访问受限。请登录或开始试用以查看此内容。

讨论

在本研究中,我们提出了一种可扩展的协议,用于减少大语言模型(LLM)中的社会偏见,该协议基于 Llama2-7B13、Mistral-7B14 和 Dolly-7B15。该方法结合了 HP2 提示工程、去偏见提示修改和针对性微调,旨在针对性别、种族、职业和宗教这四大社会维度,持续降低 LLM 生成内容中的偏见。在使用基础提示和去偏见提示对原始模型进行评估时,我们发现许多去偏见提示方法显著优于基础提示。如表6所示,HP2+去偏见方法相较于最佳基线取得了最显著的改进(平均差异 = 8.13,p = 0.001),其次是 System2+去偏见(平均差异 = 6.13,p = 0.001)、System1+去偏见(平均差异 = 4.62,p = 0.004)、CoT+去偏见(平均差异 = 4.72,p = 0.004)以及 Standard+去偏见(平均差异 = 4.55,p = 0.004)。此外,如表7所示,使用基础提示的微调模型.......

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

材料

本文使用的材料清单
姓名公司目录编号评论
Google ColabGooglehttps://colab.research.google.com/用于运行实验 
Mendeley DesktopMendeleyhttps://www.mendeley.com/用于管理引文和参考文献。

参考文献

  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

本文已发表

视频即将推出