研究文章

少样本与零样本生物医学命名实体识别:一种基于提示学习与大语言模型增强BioBERT的流程

DOI:

10.3791/69390

2026年3月31日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了一种在资源有限情况下,利用 BioBERT、基于提示的学习方法及大语言模型进行生物医学命名实体识别的实验方案。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

生物医学命名实体识别(NER)在从临床文本和生物医学文献中提取有价值信息方面发挥着关键作用。传统的深度学习模型,包括 BioBERT、ClinicalBERT 和 RoBERTa,在 NER 任务中已展现出显著改进;然而,这些模型在低资源生物医学术语、领域适应性挑战以及对未见实体的泛化能力方面仍存在困难。为解决这些局限性,本研究提出一种混合框架,结合 BioBERT、基于提示的学习(prompt-based learning)和大语言模型(LLMs),以增强生物医学 NER 中的少样本(few-shot)和零样本(zero-shot)学习能力。所提出的模型有效利用了预训练 Transformer 模型中的上下文知识,在保持高准确率的同时,降低了对大规模标注数据集的依赖。在多个生物医学基准数据集上经过广泛实验评估后,该方法表现出持续优异的性能。具体而言,其准确率达到 89.8%,精确率为 88.7%,召回率为 90.5%,F1 分数为 0.895,优于基线方法,证明其在生物医学文本挖掘任务中的有效性。与其他方法相比,提示工程(prompt engineering)使模型能更好地适应生物医学文本特有的语言特征。此外,通过大语言模型(LLM)的增强,NER 性能得到显著提升,能够捕捉复杂的语义和语法细节。这些结果表明,少样本与零样本学习在生物医学文本挖掘中具有显著成效,为实现更高效的自动化临床数据分析和更智能的决策支持系统奠定了基础。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

生物医学文献、电子健康记录(EHR)和临床试验数据的激增,迫切需要智能且稳健的生物医学命名实体识别(BioNER)系统。BioNER 是自然语言处理(NLP)中的一项专门任务,旨在识别非结构化生物医学文本中的实体,例如疾病、基因、蛋白质、药物和化学物质1。能够准确提取这些实体,对于诸多后续应用至关重要,例如挖掘生物医学知识、发现新药、辅助临床决策,甚至自动分类大量研究论文2

尽管基于深度学习的模型(如BioBERTClinicalBERTBlueBERT)已取得显著进展,但大多数现有的监督式生物医学命名实体识别(BioNER)方法仍严重依赖大规模标注数据集。这种对大量标注数据的依赖限制了模型在应用于新颖或此前未见过的生物医学文本时的泛化能力3。传统的BioNER模型仅为了微调就需要海量标注数据,这在数据稀缺的领域成为实际难题,例如罕见病、药物基因组学,或以非英语发表的生物医学研究4。此外,人工标注这些生物医学文本耗时、昂贵,且通常需要领域内的真正专家5。因此,开发少样本(few-shot)和零样本(zero-shot)BioNER模型....

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 实验步骤

  1. 数据预处理与模型微调
    数据来自 PubMed、BioASQ、MedQA 和 MMLU,经过文本归一化、分词(WordPiece/BPE)、停用词去除和 IOB 标注等预处理。针对生物医学领域对 BioBERT 进行了基于掩码语言建模(MLM)和令牌分类头的微调,并与 LoRA 等基于适配器的方法进行了比较。
  2. 实施基于提示的少样本与零样本学习
    对于零样本学习:使用大语言模型(GPT-4、GPT-3.5、T5),结合自然语言提示(例如:“从以下文本中提取生物医学实体:[输入句子]。需识别的实体类型包括疾病、药物、基因和化学物质。请列出每个实体及其类型”)及指令微调。每种实体类型使用5至20个标注样本,结合模式利用训练(Pattern-Exploiting Training, PET)与前缀微调(Prefix-Tuning)。
  3. 整合大语言模型并建立混合框架
    上下文嵌入融合与多阶段命名实体识别预测(BioBERT 检测 + GPT-4 精炼)得以实现。该框架采用两阶段、顺序式微调方法(非端到端)以控制计算复杂度。首先,在现有的少样本数据上对 BioBERT 进行微调;其次,将冻结的 BioBERT 模型与大语言模型(LLM)组件进行集成 通过 融合层,该层使用相同数据进行训练。因此,采用两阶段微调策略将其整合:
    第1阶段——基于监督学习的BioBERT命名实体识别微调<....

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在源自PubMed摘要、临床记录和生物医学问答语料库的多样化生物医学数据集上,对少样本(Few-Shot)和零样本(Zero-Shot)生物医学命名实体识别(NER)模型进行了评估。该模型与已建立的模型(包括BioBERT、ClinicalBERT、RoBERTa、PhenoBERT29、GPT-3.5和GPT-4)进行了性能比较分析。所提出的模型取得了89.8%的总体准确率,精确率为88.7%,召回率为90.5%,F1分数为0.895。该性能显著优于ClinicalBERT(准确率85.0%,F1分数0.86)和GPT-4(准确率86.1%,F1分数0.86),性能提升主要归因于基于提示的学习(prompt-based learning)与本体驱动的实体链接(ontology-driven entity linking)相结合,从而增强了模型处理新型生物医学实体的能力。

该模型在低数据场景下表现出卓越的能力。在零样本设置中,其准确率达到43.4%,显著优于BioBERT(31.1%)和GPT-3.5(35.2%),表明即使在缺乏任务.......

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

相互矛盾的结果、意外的发现以及与其他研究的差异
尽管所提出模型表现出更优的性能,但在与现有研究进行比较时仍出现了一些矛盾的结果。基于 BioBERT 的模型在生物医学命名实体识别(NER)任务中传统上表现出较强的性能,这在此前关于生物医学 NER 系统的综述和比较研究中已有报道4,10。尽管基于 Transformer 的架构在医疗健康领域的自然语言处理任务中始终能够实现高准确率3,12,但最近研究表明,将基于提示的学习(prompt-based learning)与大语言模型(LLMs)相结合,可提升少样本生物医学学习的效果。在本研究中,基于提示的集成方法获得了更高的召回率,但由于对模糊医学术语较为敏感,偶尔导致过度预测,这一局限性也在零样本与少样本医学人工智能研究中被讨论过。

先前使用临床领域BERT.......

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

材料

本文使用的材料清单
姓名公司目录编号评论
核心模型BioBERT-base (v1.1)Hugging Face: monologg/biobert-v1.1
深度学习框架PyTorch 2.3.1https://pytorch.org/
GPU 硬件NVIDIA A100 (40GB VRAM)NVIDIA
大语言模型(LLM)GPT-4OpenAI API
操作系统windowsMicrosoft
参数高效微调LoRA (通过 PEFT 库 0.6.2)https://github.com/huggingface/peft
编程语言Python 3.9.18Python Software Foundation
零样本基线大语言模型GPT-3.5-TurboOpenAI API

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, P., Wang, J., Luo, L., Lin, H., Yang, Z. Learning to explain is a good biomedical few-shot learner. Bioinformatics. 40 (10), 589(2024).
  2. Moscato, V., Postiglione, M., Sperlí, G. Few-shot named entity recognition: definition, taxonomy and research direct....

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章