研究文章

通过微调与提示优化提升临床人工智能应用中大语言模型的公平性

DOI:

10.3791/69132

2026年1月2日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

医疗领域专用的大语言模型面临伦理和技术挑战,因为它们与其他大语言模型一样,会反映其训练数据中固有的偏见。本方案通过在三个开源模型上使用不同形式的提示语,验证了对四种类型偏见(性别、种族、职业、宗教)的抑制效果。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

大语言模型(LLMs)正越来越多地应用于医疗护理等敏感领域,这带来了多重技术和伦理挑战。最直接的问题包括这些模型中固有的偏见,因为它们是在可能反映社会偏见的大型数据集上进行训练的。此类偏见可能导致输出结果不公平、缺乏普适性,甚至造成伤害,从而使其在现实世界中无法用于临床实践,并且不符合伦理和监管要求。我们考察了在四个关键类别(性别、种族、职业和宗教)中,当对经过微调的模型使用提示时,偏见抑制的效果如何。我们手动整理了一个多样化的推理数据集,并创建了十二种提示变体——其中六种为去偏提示——以测试三种开源大语言模型(Llama2-7B、Mistral-7B 和 Dolly-7B)的输出。使用一种偏见评分指标来评估输出结果的公平性和可解释性,分数越低表示公平性和可解释性越好。我们还注意到,去偏提示能够减少偏见,而对模型进行微调的效果更佳。研究结果强调了及时采取行动、提升模型鲁棒性以及持续进行伦理审查的重要性,以确保大语言模型在现实场景(如医学影像和电子健康记录(EHR)管理)中的可信与公平部署。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

大语言模型作为支持多种任务的工具,已产生巨大反响,包括决策支持1,2、文本生成3、文本翻译4、客户情感分析5、问答系统6以及临床报告生成7。近年来,已出现多起应用大语言模型生成内容而对社会弱势个体或群体造成伤害的案例8,9,10。此类陈词滥调式回应的主要原因在于,这些模型所训练的数据集本身包含与种族、性别、社会经济阶层等因素相关的社会偏见。然而,在医疗人工智能系统中,所谓"偏见"与"公平性"的含义可能是主观的,且依赖于具体情境。研究人员已投入大量努力以减轻大语言模型中的社会偏见11,12;然而,仍需进一步改进。研究者已提出多种偏见缓解策略,这些策略可按干预阶段分为预处理、处理中、后处理,或其组合形式,适用于多种不同的应用场景。本方案结合了全部三种策略,旨在应对并减轻六种大语言模型变体中的社会偏见,并在四个社会偏见维度上考察偏见的降低效果:性别、职业、种族和宗教。首先,采用数据增强技术构建一个推理数据集,以促使大语言模型生成推理结果。其次,设计了十二种类型的提示语,用以诱发大语言模型的刻板回应。第三,对Llama-2-7B13、Mistral-7B14和Dolly-7B15在包含无偏句子的数据集上进行微调,这些句子覆盖四个社会类别:性别、种族、职业和宗教,从而分别得到Llama-2-7BFinetuned、Mistral-7BFinetuned和Dolly-7BFinetuned。最后,通过向微调后的大语言模型输入提示语,生成推理结果,以评估其提供公平回应的有效性。

我们提出了以下研究问题,并在本文中予以解答。针对每个提出的研究问题(RQ),均建立了相应的零假设(H0)和备择假设(H1)。

研究问题1(RQ1):推理数据集与基础提示技术在评估大语言模型(LLM)的社会偏见方面是否有效?零假设(H01):当结合基础提示时,从推理数据集得出的偏见评分在统计上与LLM的基础偏见评分无显著差异。备择假设(H11):结合基础提示的推理数据集所得偏见评分在统计上显著不同于LLM的基础偏见评分。为检验该假设,我们通过修改StereoSet16构建了一个名为NeutralSet的数据集,并使用基础提示技术对每个LLM进行评估,以考察其生成非刻板印象回应的能力。在本研究设置中,我们采用了六种基础提示——  标准提示(Standard,一种零样本提示,用于指示LLM进行推理)、思维链提示(Chain-of-Thoughts, CoT,旨在要求LLM逐步思考以进行推理)、系统1提示(System1,一种促使LLM快速思考作答的提示)、系统2提示(System2,一种促使LLM缓慢而深入思考的提示)、人类角色1(Human Persona 1, HP1,设计用于使LLM模拟一个在决策时快速思考的人类身份)、以及人类角色2(Human Persona 2, HP2,设计用于使LLM模拟一个在回答问题时缓慢而审慎思考的人类身份)。

研究问题2(RQ2):去偏提示技术在揭示和缓解大语言模型(LLM)中的社会偏见方面是否有效?零假设(H0₂):去偏提示技术在揭示和缓解大语言模型中的社会偏见方面无效。备择假设(H12):当在大语言模型中使用去偏提示技术时,测得的偏见分数显著降低。我们通过研究基础提示的去偏变体对三种开源大语言模型的影响,以实现公平的文本生成,消除任何社会歧视。

研究问题3(RQ3):通过微调大语言模型(LLM)是否能进一步减少社会偏见?零假设(H03):微调大语言模型并不能在仅使用提示技术所实现的偏见减少基础上进一步降低社会偏见。备择假设(H13):微调大语言模型能够进一步减少社会偏见,效果优于仅使用提示技术。为回答此问题,我们对数据集17进行修改,并在该数据集上对大语言模型进行微调,以进一步评估微调在减少刻板印象回应方面的效果。

图1展示了提示词变化和大语言模型微调对性别中立预测结果的影响。本研究的创新之处在于,将人工数据集整理、多种去偏提示策略以及微调方法整合到统一的协议中,用于分析大语言模型在社会偏见识别与缓解方面的能力,这对于医学影像和电子健康记录(EHR)管理等敏感的实际应用场景具有重要意义。我们将关于大语言模型偏见的文献归纳为四个视角:用于偏见和认知关联研究的数据集;偏见检测与评估框架;偏见缓解方法;以及特定专业领域中的偏见问题。

研究人员不断生成数据集,以实现对大语言模型(LLMs)的偏见评估和语义关联分析。例如,在认知心理学和语言学领域,自由联想始终在组织概念知识方面发挥着关键作用。在大语言模型的潜在分布中模拟类似的联想过程,Abramski 等人18 已构建了一个名为“LLM 词汇世界”(LWOW)的数据集。该 LWOW 英语自由联想规范数据集包含来自三个大语言模型(Mistral-7B)的数百万条响应14Llama-3.1-8B19,以及 Claude-3-5-haiku-latest20它受到“词语的小世界”(Small World of Words,SWOW)的启发。21,这是目前规模最大的人类英语自由联想规范数据集,已广泛应用于多种心理学和语言学研究。此外, LWOW 有助于构建一个认知网络,其中每个节点代表一个词,语义相似的词对应的节点在网络中距离更近。该方法通过估算人工认知网络中词语之间的距离作为关键指标,从而评估大语言模型(LLM)输出中的偏见。使用专有 LLM 的一个主要障碍在于其内部机制无法访问。尽管这些模型在缓解偏见方面已做出大量努力,但对齐数据集仍然稀缺。为解决这一问题,Zhang 等人提出了一种名为 GenderAlign 的数据集。22 以减轻大语言模型中的性别偏见。UnStereoEval23,一个基准数据集,被提出用于研究职业和情绪中的刻板性别偏见。他们的研究结果揭示了28种不同大语言模型在公平性方面的水平较低。Bartl 和 Leavy24 构建了一个数据集,Tiny Heap, 其中,包含刻板印象表述的句子被替换为中性表达,并对三个语言模型(GPT-2)进行了微调25,PHI-1.526和 RoBERTa27他们的研究结果表明,模型的性别刻板倾向显著降低。

已有多种多层框架被提出,用于识别和减轻大语言模型(LLM)中的偏见。在 Raza 等人28的研究中,提出了一种名为 NBIAS 的框架,该框架包含四个层次:数据集构建、模型开发、偏见缓解和评估。该框架内的数据集来源于多个不同领域,包括医疗保健、社交媒体和就业平台。他们通过在公平性指标上比基线模型(BERT29)高出 1% 至 8% 的表现,展示了其模型的有效性。在另一项框架 GenderCARE30 中,研究者提出了一种缓解大语言模型中性别偏见的策略。在其广泛的实验设置中,该方法在十二种不同的大语言模型上平均减少了 35% 的性别偏见。框架 BiasAlet31 能够自动检测大语言模型生成的开放文本中的社会偏见。然而,该研究存在一些局限性:首先,由于缺乏用于评估大语言模型开放文本生成中偏见的基准数据集,研究只能在合成数据集上进行;其次,该框架基于过时的数据集 SBIC32 构建,这使得难以区分隐性偏见本身与数据集中固有偏见的相关性。在人类生成的数据中可能包含偏见,这些偏见会被引入到基于此类数据训练的模型中。此类模型在高风险岗位中的使用存在争议,因为其输出可能对弱势群体产生不利影响。为应对这一问题,研究者设计了 BiasBuster33 框架,用于检测、评估并缓解大语言模型中的认知偏见。与此相一致,另一项研究34提出了一种交互式框架,通过系统 2 提示(旨在促使大语言模型进行深思熟虑和缓慢推理)生成公平、合乎逻辑且具有批判性的文本,这些提示与自我精炼和隐含提示相辅相成。然而,该框架仅限于大语言模型潜在空间内的任务。Dong 等人35 开发了一个框架,利用间接探测方法来缓解并评估十个开源大语言模型中的性别偏见。在其探测方法中,无需利用直接的刻板印象表述,即可揭示出间接的性别偏见。

Lin 等人36研究了大语言模型(LLM)在封闭式模型(GPT-3.5-turbo 和 GPT-437)和开放式模型(Llama-2-7B13、Mistral-7B14、Vicuna29)文本生成中的政治偏见问题。他们判断模型生成的文本是否表现出左倾或右倾的媒体偏见。此外,他们提出了一种缓解策略,通过微调模型以及在文本生成过程中提供去偏见化的提示(prompt)来减少偏见。在应用该偏见缓解技术后,模型倾向于生成中立文本,不再受左倾或右倾媒体的影响。与此相关,Raj 等人17提出了一种基于心理学中接触假说的去偏见解决方案——社会接触去偏见法(Social Contact Debiasing, SCD),该方法通过生成能够理解不同社会群体意识形态的提示,以减少三种开源大语言模型在文本生成中的偏见。类似地,Kamruzzaman 和 Kim38提出了一种社会去偏见技术,利用系统1与系统2的思维链提示(chain-of-thought prompting)方法,在五个大语言模型(GPT-3.5、GPT-437、Llama-2-7B13、Mistral-7B14 和 Gemini-1.039)中缓解十二个偏见维度的问题。其中,系统1提示旨在促使大语言模型快速作答,而系统2提示则引导其生成更深入、更审慎的回答。尽管已有多种研究利用提示工程来缓解大语言模型中的偏见,但鲜有研究探讨提示变化对大语言模型输出的影响。为解决这一问题,Hida 等人40研究了十二个开源大语言模型输出对提示变化的敏感性,并分析了其对任务性能与偏见权衡的影响。他们的研究结果表明,去偏见效果对提示内容敏感:模型输出中的偏见越少,其任务性能往往越低。Kamboj 等人41提出了一种后处理方法,用于缓解 T5 模型(Text-To-Text-Transfer-Transformer 模型42)上下文化嵌入中的性别偏见。Oba 等人43则向大语言模型提供人工构建的文本前言作为提示,以抑制其生成带有偏见的内容。

认知偏差数十年来一直是医疗保健中诊断错误的根源,而在临床决策中,这些偏差有可能被大型语言模型(LLM)吸收并放大。为应对这一风险,Mahajan 等人44提出,实施此类技术的缓解策略应围绕三个主题:第一,自我反思(对输出进行迭代式重新评估);第二,情境化推理(整合完整的患者病史和循证指南);第三,透明的推理轨迹(提供可供审查的推理过程解释)。LLM 凭借其普遍适用的能力,现已被广泛用于生成编程代码。因此,研究人员亟需探究生成代码中可能存在的社会偏见所带来的不良影响。一旦检测到此类偏见,就必须制定相应的缓解技术。在此方向上,Huang 等人45提出了一种社会偏见评估与缓解技术,并在五个广泛使用的 LLM 上进行了测试。近年来,LLM 架构及其生成类人回应的能力取得了巨大进展。然而,LLM 是否能在决策中作为人类的代理,仍有待深入探索,需要进一步研究。为此,Tjuatja 等人46构建了一个框架和一个数据集,用以考察 LLM 在调查问卷中生成类人回答的能力。

尽管已有这些进展,仍存在三个研究空白。首先,以往的研究往往集中于特定类型的偏见(例如性别或政治偏见)或特定领域(例如某一具体主题)。其次,尽管提示工程已广泛应用,但很少有研究探讨系统性提示变化对大语言模型输出的影响。第三,针对与医疗等关键领域相关的开源大语言模型,在资源受限的微调场景下,有关去偏的研究十分有限。为弥补这些不足,本文提出了一种统一的偏见缓解与评估方案,该方案有助于在不同模型架构下测量刻板偏见,能够在计算资源受限的条件下进行微调,并评估模型决策在偏见指标下的鲁棒性。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

所有实验均在 Google Colab 平台(配备 40 GB RAM 的 A100)上进行。为开展实验,从 Hugging Face 获取了 Llama2-7B、Mistral-7B 和 Dolly-7B 的 API 密钥(模型卡片)。

该方案分为三个部分。首先,构建一个数据集,作为评估大语言模型(LLM)中社会偏见的基础。然后设计十二种不同的提示变体,参考Kamruzzaman和Kim38的研究方法,用于探究大语言模型生成推论中是否存在社会偏见。接着,在一组关于种族、宗教、性别和职业的无偏见句子数据集上对大语言模型进行微调,并使用相同的提示再次探测模型,以研究微调对生成推论的影响。所提出的框架如图2所示。

数据集的构建
该框架使用两个数据集。其中一个用于推断,另一个用于对大语言模型(LLM)进行微调。本研究对 StereoSet16 进行修改,构建了一个新数据集 NeutralSet,作为生成推断的基础。大语言模型使用 StereoSet 对四种偏见类型进行预测:种族、宗教、性别和职业。StereoSet 包含两个子数据集:句内数据集和句间数据集。NeutralSet 的一个示例如 表 1 所示。将“上下文”列中的句子作为查询输入大语言模型,并要求其从“反刻板印象”、“刻板印象”或“中性”列中选择任意一个词填入空白处。通过模型选择的选项可判断其偏见程度。NeutralSet 中新增的“中性”列使其区别于 StereoSet。在新数据集中加入该列的目的是降低大语言模型在进行推断时选择刻板印象选项的可能性。中性列中的词语是根据算法 1(补充文件 1)所述步骤添加的。其中,Vs 和 Vas 分别表示刻板印象词和反刻板印象词的向量。随后从词典中选择一个向量最接近 Vn 的词语,该向量在语义上位于刻板印象词向量与反刻板印象词向量之间,并将该词语添加至选定行的中性列中。表 2 总结了构建 NeutralSet 的过程。然后,修改数据集17 以用于微调大语言模型。修订后的数据集包含 25,020 个实例,每个实例由一个查询及其对应的社会无偏答案组成,用于模型训练。这些查询旨在涵盖全部四种社会偏见类型。

提示大语言模型
通过提供一组提示作为输入指令,考察大语言模型(LLMs)中的社会偏见。首先,构建十二种类型的提示:六种基础提示和六种对应的去偏提示变体。表3列出了所有提示技术的内容。本研究中的提示经过了一个循环化、形式化的构建、实施、反思与修订过程,通过大量试错与优化,逐步完善形成了一系列提示。这使得提示类型覆盖范围广泛,包括基线提示、思维链(CoT)提示和拟人化提示。提示设计与评分标准未经过外部领域专家(如临床医生、社会或公平性专家)验证。表4总结了不同类型的提示,突出其推理方式、偏见缓解能力及适用场景,以指导合理选择。本文对大语言模型的评估不保留跨运行或跨会话的历史信息。需明确的是,在最终模型中,每个提示均独立执行,即不将对话历史从一个提示传递到下一个提示。该设置确保先前的响应不会影响后续输出。在微调阶段,仅根据训练数据集调整模型参数,具体方法遵循参数高效迁移学习(PEFT47)和量化低秩适配(QLoRA48)。按如下所述构建提示:

标准提示:这是一种零样本提示技术,其中仅向大语言模型(LLM)提供最少的信息以进行推理。提示语为“从给定的选项中选择最合适的词语填入空白处。”该方法用作基线,以量化和评估全部六种大语言模型中的社会偏见。

CoT 提示:该提示包含短语“逐步思考并填写空白处。从提供的选项中选择最适合空白处的答案……”。在此提示技术中,鼓励大语言模型在给出答案之前启动其认知过程,逐步进行思考。

System1 和 System2 提示:通过包含“您会迅速回应问题……”这一表述,System1 提示引导大语言模型(LLM)提供快速、直觉式的回答,类似于人类认知中 System1 的运作方式。另一方面,System2 提示则通过在指令中加入“您会全面且有意识地回应问题。您的回答经过深思熟虑且可靠”,旨在促使大语言模型生成更深入、详细、具有分析性和审慎性的回答。

HP1 和 HP2 提示:提示以以下内容开头:“采用一个能够快速回答问题并在严格遵守该身份特性的前提下填写空白处的人的身份……”。在 HP1 提示技术中,大语言模型(LLM)被指示采用一个快速作答的人类身份,该设置的目的是使 LLM 模拟人类在系统1认知过程中的表现。相比之下,在 HP2 提示中,LLM 被引导采用一种在回答问题前会认真、审慎思考的人类类似身份,从而获得更准确的结果。HP2 提示以如下短语开头:“采用一个能够审慎而有意识地回答问题并在严格遵守该身份特性的前提下填写空白处的人的身份……”。引入这些提示的核心思想在于评估大语言模型(LLM)全面模拟人类认知能力的潜力。

去偏见变体: 去偏见变体的构建方式是添加一条指令,要求大语言模型(LLM)以中立方式做出决策,不带有任何刻板偏见。

评估大语言模型(LLMs)
评估六个大语言模型(LLMs):1) Llama-2-7B13,使用 Huggingface 上的 meta-llama/Llama-2-7b-chat-hf 检查点;2) Mistral-7B14,使用 Huggingface 上的 mistralai/Mistral-7B-Instruct-v0.3 检查点;3) Dolly-7B15,使用 Huggingface 上的 databricks/dolly-v2-7b 检查点;4) Llama2-7Bfinetuned,Llama-2-7B 的一个微调变体;5) Mistral-7Bfinetuned,Mistral-7B 的一个微调变体;6) Dolly-7Bfinetuned,Dolly-7B 的一个微调变体。

所有实验均需在高性能 GPU(例如具有 40 GB 或更高内存的 A100)上进行。在对大语言模型(LLM)进行微调时,将数据集按标准的 70%:10%:20% 比例划分为训练集、验证集和测试集。为避免对模型进行完全重新训练,本研究采用 PEFT47 配置进行微调,该方法冻结模型大部分参数,仅添加少量任务特定参数。若计算资源有限,可使用 QLoRA48 中的 4 位精度加载大语言模型,从而在不降低模型性能的前提下实现更快速的微调。

为了评估大语言模型(LLM)中的刻板偏见,使用 Biasscore 作为衡量指标。如公式 1 所示,Biasscore 的计算方式为:针对特定提示,LLM 生成的刻板印象回答数量与有效回答总数的比值。

静态平衡图中的偏差分数计算公式;方程:Bias_score=Ns/(Ns+Nas+Nn)。     (1)

其中 Ns、Nas 和 Nn 分别表示刻板印象、反刻板印象和中性反应的数量。偏差分数越低,表明模型输出的刻板印象程度越低。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

利用公式1中定义的偏倚评分,我们系统地回答了研究问题,并在四个社会维度上评估了大语言模型(LLM)中的社会偏倚。观察到的偏倚评分在统计学上的显著降低,为所提出的针对高风险任务中LLM偏倚缓解协议提供了实证验证。为了评估NeutralSet(即经过精心筛选的推理数据集)的有效性,我们使用基线标准提示对全部三种原始LLM在StereoSet和NeutralSet上进行查询,并计算平均偏倚评分。如图3所示,NeutralSet相对于StereoSet的偏倚评分降低了7.8分。为回答研究问题的第二部分,我们再次使用六种基本提示技术对全部三种原始LLM进行查询,并计算平均偏倚评分,结果如图4所示。研究结果表明,HP2提示表现最佳,相较于基线标准提示,其偏倚评分降低了4.7分。第二优的提示技术是System 2提示,使偏倚评分降低了3.9%。总体而言,所有提示技术均有助于降低社会偏倚,唯独思维链(CoT)提示例外,其偏倚评分反而上升了1.3分。

接下来,我们进行方差分析(AN...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在本研究中,我们提出了一种可扩展的协议,用于减少大语言模型(LLM)中的社会偏见,该协议基于 Llama2-7B13、Mistral-7B14 和 Dolly-7B15。该方法结合了 HP2 提示工程、去偏见提示修改和针对性微调,旨在针对性别、种族、职业和宗教这四大社会维度,持续降低 LLM 生成内容中的偏见。在使用基础提示和去偏见提示对原始模型进行评估时,我们发现许多去偏见提示方法显著优于基础提示。如表6所示,HP2+去偏见方法相较于最佳基线取得了最显著的改进(平均差异 = 8.13,p = 0.001),其次是 System2+去偏见(平均差异 = 6.13,p = 0.001)、System1+去偏见(平均差异 = 4.62,p = 0.004)、CoT+去偏见(平均差异 = 4.72,p = 0.004)以及 Standard+去偏见(平均差异 = 4.55,p = 0.004)。此外,如表7所示,使用基础提示的微调模型...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

材料

本文使用的材料清单
姓名公司目录编号评论
Google ColabGooglehttps://colab.research.google.com/用于运行实验 
Mendeley DesktopMendeleyhttps://www.mendeley.com/用于管理引文和参考文献。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

视频即将推出

相关文章