Onderzoeksartikel

Few-shot en zero-shot biomedische benoemde entiteitsherkenning: een procedure om BioBERT te verbeteren met prompt-based learning en grote taalmodellen

DOI:

10.3791/69390

31 maart 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit artikel presenteert een protocol voor biomedische herkenning van benoemde entiteiten met behulp van BioBERT, prompt-based learning en grote taalmodellen voor scenario's met weinig hulpbronnen.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Biomedische Named Entity Recognition (NER) speelt een cruciale rol bij het verkrijgen van waardevolle informatie uit klinische teksten en biomedische literatuur. Traditionele deep learning-modellen, waaronder BioBERT, ClinicalBERT en RoBERTa, hebben aanzienlijke verbeteringen aangetoond in NER-taken; Toch worstelen ze nog steeds met biomedische termen met weinig hulpbronnen, uitdagingen bij domeinaanpassing en generalisatie van onzichtbare entiteiten. Om deze beperkingen aan te pakken, introduceert deze studie een hybride kader dat BioBERT, prompt-based learning en Large Language Models (LLM's) combineert om de leermogelijkheden voor few-shot en zero-shot in biomedische NER te verbeteren. Het voorgestelde model maakt effectief gebruik van contextuele kennis van vooraf getrainde transformatoren, waardoor de afhankelijkheid van uitgebreide gelabelde datasets wordt verminderd en een hoge nauwkeurigheid behouden blijft. Na uitgebreide experimentele evaluatie over meerdere biomedische benchmarkdatasets toont de voorgestelde aanpak consequent sterke prestaties. Specifiek behaalt het 89,8% nauwkeurigheid, 88,7% precisie, 90,5% recall en een F1-score van 0,895, waarmee het de baseline-methoden overtreft en de effectiviteit voor biomedische tekstmining-taken aantoont. In vergelijking met andere methoden helpt prompt engineering het model zich veel beter aan te passen aan de unieke taal van biomedische teksten. Bovendien geeft boosten met een groot taalmodel (LLM) de NER-prestaties een flinke boost door lastige semantische en grammaticale details op te pikken. Deze bevindingen tonen de effectiviteit van few-shot en zero-shot leren in biomedische tekstmining aan, wat de weg vrijmaakt voor betere geautomatiseerde klinische data-analyse en slimmer besluitvormingssystemen.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De explosie van biomedische literatuur, elektronische patiëntendossiers (EPD's) en klinische proefgegevens vereist echt slimme, robuuste Biomedical Named Entity Recognition (BioNER)-systemen. BioNER is een gespecialiseerde taak in Natural Language Processing (NLP) die tot doel heeft entiteiten zoals ziekten, genen, eiwitten, geneesmiddelen en chemicaliën te identificeren in ongestructureerde biomedische tekst1. Het nauwkeurig kunnen onderscheiden van deze entiteiten is super belangrijk voor allerlei andere toepassingen, zoals het verzamelen van biomedische kennis, het vinden van nieuwe medicijnen, het ondersteunen van artsen bij klinische beslissingen, of zelfs automatisch door stapels onderzoeksartikelengaan 2.

Hoewel er aanzienlijke vooruitgang is geboekt in deep learning-gebaseerde modellen – zoals BioBERT, ClinicalBERT en BlueBBERT – blijven de meeste bestaande benaderingen van supervised biomedical named entity recognition (BioNER) sterk afhankelijk zijn van grootschalige geannoteerde datasets. Deze sterke afhankelijkheid van uitgebreide gelabelde data beperkt hun generalisatievermogen wanneer toegepast op nieuwe of eerder ongeziene biomedische teksten3. De klassieke BioNER-modellen hebben enorm veel geannoteerde data nodig om ze fijn af te stellen, wat een echte hoofdpijn wordt in gebieden waar er gewoon niet genoeg data is, denk aan zeldzame ziekten, farmacogenomica of biomedisch onderzoek dat in andere talen dan Engels4 wordt gepubliceerd. Bovendien is het handmatig taggen van al deze biomedische tekst traag, duur en vereist meestal echte experts op het vakgebied5. Daarom is het ontwikkelen van few-shot en zero-shot BioNER-modellen zo belangrijk: het zou de behoefte aan gelabelde data aanzienlijk kunnen verminderen, terwijl modellen goed werken over een breed scala aan biomedische inhoud6.

Few-shot learning (FSL) stelt modellen in staat om concurrerende entiteitsherkenningsprestaties te bereiken met slechts een klein deel van de gelabelde data, doorgaans tussen 1% en 10% van de volledige trainingsdataset, waardoor het bijzonder waardevol is voor biomedische domeinen met weinig middelen7. Zero-shot learning (ZSL) gaat nog verder, door een model entiteiten te laten herkennen die het nog nooit eerder heeft gezien, simpelweg door gebruik te maken van de kracht van grote, vooraf getrainde taalmodellen (LLM's), zonder extra trainingsdatate hoeven 8. De laatste tijd hebben vooruitgang in LLM's zoals GPT-4, LLaMA en Falcon sterke zero-shot prestaties getoond bij algemene NER-taken, maar hun gebruik in echte biomedische teksten blijft grotendeels onontgonnen terrein. Dat komt omdat de taal in de biomedische zaken zo gespecialiseerden ingewikkeld is.

Dit onderzoek heeft als doel die kloof te dichten door BioBERT-finetuning, few-shot learning, zero-shot LLM-inferentie en prompt-based learning samen te brengen, allemaal met als doel de lat voor BioNER in biomedische omgevingen met weinig middelen te verhogen.

Om een idee te geven van wat er al beschikbaar is: (1) BioBERT is een versie van BERT die is aangepast aan PubMed-abstracts en full-text artikelen, dus het is beter geschikt voor biomedische inhoud10. (2) ClinicalBERT is een BERT-variant die op EPD's is getraind, dus speciaal afgestemd op het begrijpen van klinische notities en doktersrapporten11. (3) BlueBERT is een ander biomedisch NLP-model, getraind op zowel PubMed- als MIMIC-III-datasets, en is geoptimaliseerd voor het herkennen van medische zaken in text12. (4) PubMedBERT is een transformermodel dat uitsluitend op PubMed-data is getraind, wat helpt om echt die unieke patronen en terminologie in biomedische schrijfstijl op te pikken13.

Hoewel deze modellen state-of-the-art prestaties behalen op BioNER-benchmarks, beperkt hun afhankelijkheid van grote, gelabelde datasets en gecontroleerde fine-tuning hun aanpassingsvermogen aan nieuwe biomedische domeinen14. Bovendien verzwakken domeinverschuivingen tussen wetenschappelijke biomedische literatuur (bijv. PubMed-abstracts) en klinische notities (bijv. i2b2 2010-dataset) de prestaties van begeleide BioNER-systemenverder 15.

De belangrijkste beperkingen in het huidige BioNER-onderzoek zijn: Afhankelijkheid van geannoteerde data: Bestaande transformer-gebaseerde modellen vereisen uitgebreide gelabelde datasets, die schaars zijn in gespecialiseerde biomedische domeinen16. Gebrek aan generalisatie naar Onzichtbare Entiteiten: Huidige modellen hebben moeite om zeldzame of nieuwe biomedische termen te herkennen die niet voorkomen in de trainingsdata17. Beperkte verkenning van Few-Shot en Zero-Shot Learning: Het meeste onderzoek richt zich op volledig begeleid leren, met minimale onderzoeken naar low-data paradigma's voor BioNER18. Inefficiënte aanpassing van LLM's: Hoewel LLM's zoals GPT-4 en LLaMA sterke zero-shot prestaties laten zien in algemene NLP, blijft hun toepassing op biomedische NER onderbelicht vanwege terminologische complexiteit en het ontbreken van domeinspecifieke prompts19.

Om deze hiaten aan te pakken, onderzoekt deze studie de volgende kernonderzoeksvragen: Hoe kan few-shot learning de prestaties van BioBERT in biomedische NER verbeteren met minimale gelabelde data? Kan zero-shot inferentie met LLM's biomedische entiteiten nauwkeurig herkennen zonder domeinspecifieke fine-tuning? Hoe kan prompt-gebaseerd leren de zero-shot prestaties verbeteren bij biomedische NER-taken? Wat is de optimale hybride aanpak die BioBERT- en LLM-gegenereerde pseudolabels combineert om BioNER te verbeteren in omgevingen met weinig hulpbronnen? Hoe beïnvloedt adversarial training de robuustheid van few-shot en zero-shot BioNER-modellen?

Het doel van dit onderzoek is het ontwikkelen van een nieuw, adaptief biomedisch NER-kader dat gebruikmaakt van few-shot en zero-shot learning om de uitdagingen van de schaarste aan gelabelde data aan te pakken. De studie heeft als doel de generalisatiemogelijkheden van BioBERT en LLM's te verbeteren door prompt engineering-technieken, contrastief leren en adversariale training te verkennen.

Het onderzoek is gestructureerd rond de volgende doelstellingen: (1) Het ontwikkelen van een leerpijplijn voor biomedische NER door BioBERT fijn af te stemmen op beperkte geannoteerde data. (2) Evaluatie van zero-shot LLM's (bijv. GPT-4, LLaMA, Falcon) voor biomedische NER met behulp van domeinspecifieke promptengineering. (3) Het creëren van een hybride benadering die BioBERT-fine-tuning integreert met door LLM gegenereerde pseudolabels voor verbeterde entiteitsherkenning in biomedische datasets met weinig bron. (4) Het uitvoeren van een vergelijkende analyse van few-shot versus zero-shot leren met standaard biomedische benchmarks (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) Het implementeren van adversarial training (FGSM, PGD) om de robuustheid van modellen te verbeteren tegen ruisachtige biomedische tekstvariaties.

Deze studie draagt bij aan het vakgebied van biomedische NLP en entiteitsherkenning door few-shot en zero-shot BioNER-strategieën te introduceren om labelschaarste in biomedische datasets aan te pakken en te demonstreren hoe LLM's kunnen worden ingezet voor zero-shot biomedische NER via geoptimaliseerde prompt engineering. Voorstel van een hybride framework dat BioBERT-finetuning en door LLM gegenereerde synthetische annotaties combineert voor betere generalisatie. Het evalueren van de impact van adversarial training op BioNER-modellen om de robuustheid tegen domeinverplaatsingen te verbeteren. Een vergelijkende benchmark van BioNER-prestaties bieden over supervised, few-shot en zero-shot paradigma's.

Literatuuroverzicht
Sivarajkumar en Wang20 ontwikkelden HealthPrompt, een Zero-Shot Learning (ZSL) framework voor klinische NLP dat het gebrek aan geannoteerde klinische datasets aanpakt. In plaats van een vooraf getraind taalmodel (PLM) fijn af te stemmen, maakten ze gebruik van prompt-based learning, waarbij taakdefinities worden aangepast met behulp van gestructureerde sjablonen. Hun evaluatie van zes PLM's, waaronder BioBERT en ClinicalBERT, op de MIMIC-III dataset toonde aan dat ClinicalBERT de beste nauwkeurigheid (85%) en F1-score (86%) behaalde voor klinische tekstclassificatie. Deze studie toont aan dat prompt-gebaseerd zero-shot learning (ZSL) kan bijhouden met begeleide modellen in klinische natuurlijke taalverwerking (NLP), zonder dat er trainingsdata nodig is.

Keming Lu en team21 ontwikkelden BIODLM, een nieuwe benadering om discriminatieve taalmodellen (DLM's) voor het biomedische domein te verfijnen via prompt-gebaseerde continue pretraining. Hun belangrijkste doel was om de prestaties op zowel few-shot als zero-shot taken in de biomedische sector te verbeteren door gebruik te maken van slimme prompt tuning en de Replaced Token Detection (RTD)-methode. Om het te laten werken, spelen ze met de woordenschat, mengen bewust domeinspecifieke termen door elkaar en gebruiken PubMedBERT als generator tijdens de pretraining. De resultaten zijn solide: BIODLM versloeg zelfs de gebruikelijke CLS-gebaseerde fine-tuning, met een macrogemiddelde nauwkeurigheid van 50,2% onder volledige supervisie en 43,4% in zero-shot modus.

Zonghai Yao en collega's22 kozen een andere benadering, met de focus op promptgeneratie die rekening houdt met contextvariatie. Hun doel was om de vreemde vooroordelen die kunnen ontstaan tijdens prompt-based probing te verminderen en de BioLAMA-evaluatie transparanter en interpreteerbaarder te maken. Met andere woorden, ze proberen ervoor te zorgen dat deze taalmodellen ons antwoorden geven die logisch zijn en niet alleen slim geformuleerde prompts oppikken.

Ze introduceerden een evaluatiemetriek op basis van rangverandering (UCM: Understand–Confuse–Misunderstand) in plaats van traditionele Top-k nauwkeurigheid om PLM's te beoordelen op biomedische entiteitsherkenning. Experimenten op 12 PLM's, waaronder BioBERT-, ClinicalBERT- en RoBERTa-gebaseerde modellen, toonden verbeterde BioLAMA-prestaties voor groot-N-M relaties en zeldzame biomedische entiteiten. BioBERT behaalde een Accuracy@1 van 40,7% en een UCM Understandability van 32,8%, beter dan traditionele Top-k metrics.

Yeh et al.23 onderzochten prompting voor biomedische relatie-extractie met behulp van de ChemProt-dataset om domeinspecifieke finetuning van few-shot en full-data te verbeteren. Ze ontwierpen promptgebaseerde sjablonen die score-metrics zoals frequentie, specificiteit en gelijkenis bevatten om de selectie van labelwoorden te optimaliseren. Met behulp van BioMed-RoBERTa-base behaalde hun methode een F1-score van 90,09, waarmee ze SciFive-Large met 1,14 F1 overtroffen en reguliere fine-tuning met 14,21 F1 overtrof. Dit bevestigt dat prompt-based learning de prestaties van biomedische NER-vaardigheden verbetert met minder trainingsvoorbeelden.

Susanti en Holsmoelle 24 bestudeerden NLP-gebaseerde verificatie van causale grafen, waarbij ze fijn afgestemde taalmodellen en promptgebaseerde LLM's vergeleken. Ze trainden BioBERT- en GPT-modellen voor begeleide causale relatieclassificatie en evalueerden zero-shot en few-shot prompt-gebaseerde LLM's. Resultaten van biomedische en open-domein datasets toonden aan dat fijn afgestemde modellen beter presteerden dan LLM-prompts en tot 20,5% hogere F1-scores behaalden. De studie benadrukt de noodzaak van geavanceerde prompting en dataset-specifieke afstemming om de nauwkeurigheid van causale relatie-extractie te verbeteren.

Chen et al.25 stelden een kennisgestuurde instance-generatie en prompt-contrastief leren kader voor voor few-shot BioNER. Hun aanpak maakt gebruik van domeinkennisgrafieken om diverse biomedische entiteiten te genereren en maakt gebruik van contrastief leren op basis van vragenprompts om de entiteitsherkenning te verbeteren door wederzijdse informatie tussen query-antwoordparen te meten. Geëvalueerd op fbenchmark-datasets (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE) behaalde hun model een verbetering tot 7,1% in de F1-score ten opzichte van state-of-the-art modellen in 20-shot scenario's. Hun code is openbaar beschikbaar op: https://github.com/cpmss521/KGPC.

Chen et al.26stelden ook een prompt-learning benadering voor voor biomedische claimdetectie door tekstclassificatie om te zetten in een gemaskerde taalmodellering (MLM)-taak. Met behulp van BERT, RoBERTa en T5 met harde en gemengde templates verbeterden ze de nauwkeurigheid van claimvoorspellingen. Op de BioClaim-dataset behaalde hun T5-model met gemengde templates een verbetering van 5,3% in de F1-score ten opzichte van eerdere modellen, waarmee het verschil tussen pretraining en fine-tuning in PLM's met behulp van gemasked token-voorspelling werd aangepakt.

Ryan Shea Ying Cong Tan et al.27 beoordeelden LLM's op inferentie van kanker en ziekterespons op basis van radiologierapporten met behulp van transformatormodellen, Bi-LSTM, CNN en klassieke ML. Hun methode omvatte data-augmentatie (zinspermutatie en consistentieverlies) en prompt-gebaseerde fine-tuning. De GatorTron-transformator behaalde de beste nauwkeurigheid: 0,8916 op de testset en 0,8976 na augmentatie. Prompt-gebaseerde fine-tuning maakte effectieve prestaties mogelijk met slechts 500 gelabelde rapporten.

Hu et al.28 evalueerden GPT-3.5 en GPT-4 voor klinische NER, waarbij de prestaties verbeterden via een vierdelig promptingraamwerk: baseline prompts, richtlijngebaseerde prompts, foutgebaseerde instructies en few-shot samples. Op de MTSamples- en VAERS-datasets verbeterden GPT-3.5 en GPT-4 hun ontspannen F1-scores van respectievelijk 0,634/0,804 en 0,301/0,593 naar respectievelijk 0,794/0,861 en 0,676/0,736. Hoewel ze nog steeds achter BioClinicalBERT liggen (F1: 0,901 op MTSamples, 0,802 op VAERS), tonen deze resultaten de groeiende effectiviteit van LLM's in klinische NER met juiste promptingstrategieën.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Procedure

  1. Datapreprocessing en modelfijnafstelling
    De gegevens werden vooraf verwerkt van PubMed, BioASQ, MedQA en MMLU met behulp van tekstnormalisatie, tokenisatie (WordPiece/BPE), stopwoordverwijdering en IOB-annotatie. Voerde domeinspecifieke finetuning uit van BioBERT met behulp van Masked Language Modeling (MLM) en een tokenclassificatiekop. Vergeleken met adaptergebaseerde methoden zoals LoRA.
  2. Implementatie van PROMPT-BASED Few-Shot en Zero-Shot learning
    Voor zero-shot leren: Gebruik LLM's (GPT-4, GPT-3.5, T5) met natuurlijke taalprompts (bijv. "Extraheren van biomedische entiteiten uit de volgende tekst: [Invoerzin"). De entiteiten die geïdentificeerd moeten worden zijn ziekten, medicijnen, genen en chemicaliën. Vermeld elke entiteit en het type daarvan.") en instructiestemming. Gebruikte 5–20 gelabelde voorbeelden per entiteitstype met Pattern-Exploiting Training (PET) en Prefix-Tuning.
  3. Integratie van LLM's en het opzetten van een hybride kader
    Contextuele inbeddingen Fusie en Multi-Stage NER Prediction (BioBERT-detectie + GPT-4 verfijning) werden uitgevoerd. Dit raamwerk gebruikte een tweefasige, sequentiële fine-tuningbenadering (niet end-to-end) om de computationele complexiteit te beheren. Ten eerste werd BioBERT fijn afgesteld op de beschikbare gegevens van een paar schoten. Ten tweede werd dit bevroren BioBERT-model geïntegreerd met de LLM-component via de fusielaag, die op dezelfde data was getraind. Daarom werd het geïntegreerd met een tweefasige fin-tuningstrategie:
    Fase 1 – Gecontroleerde BioBERT-fine-tuning voor NER.
    Fase 2 – Prompt-gebaseerde aanpassing via GPT-4-uitgangen.
    figure-protocol-1
    waarbij α een geleerde coëfficiënt is, en Wp de projectiematrix is.
    Een gewogen ensemblestem (WBioBERT=0,45, WGPT4=0,35, WClinicalBERT=0,20) werd toegepast op samenvoegingsvoorspellingen.
    De gewichten voor elk model (W_BioBERT=0,45, W_Hybrid=0,35, W_ClinicalBERT=0,20) werden geoptimaliseerd op een vastgehouden validatieset met behulp van een rasterzoekopdracht om de micro F1-score te maximaliseren. Dit weegschema weerspiegelt de relatieve bijdragen van elk model: de fijn afgestemde BioBERT levert het sterkste domeinspecifieke signaal, het hybride model voegt generalisatie toe, en ClinicalBERT biedt complementaire klinische context.
  4. Toepassing van verfijning en ontologiekoppeling
    GPT-4 werd gebruikt voor ontologie-geleide verfijning, waarbij correcties werden geaccepteerd wanneer de cosinusgelijkenis met ontologie-embeddings ≥ 0,8 was (alleen correcties met > 0,8 zijn al genoemd). De entiteiten werden gekoppeld aan UMLS-, MeSH- en HPO-databases voor synoniemresolutie.
  5. Het systeem inzetten met geoptimaliseerde inferentie
    Adaptieve betrouwbaarheidsdrempel werd geïmplementeerd per entiteitsklasse: TCC + βσC (β=0,5).
    Een belangrijk onderdeel van de inferentiepijplijn is de adaptieve betrouwbaarheidsdrempel, die dynamisch precisie en oproep tussen entiteitstypen in balans brengt. In plaats van een statische drempel te gebruiken, berekende het adaptieve mechanisme een klasse-specifieke drempel TC op basis van de empirische betrouwbaarheidsverdeling van voorspellingen:
    figure-protocol-2
    waarbij μC en σC het gemiddelde en de standaarddeviatie van betrouwbaarheidsscores voor entiteitsklasse C vertegenwoordigen, en β een afstembare schaalfactor is (empirisch ingesteld op 0,5). Zeldzame biomedische entiteitstypen (bijv. zeldzame ziekten) vertonen doorgaans een hoge variatie in betrouwbaarheidsscores. De adaptieve drempel zorgde ervoor dat deze behouden bleven wanneer σC groot is, waardoor overfiltering van zeldzame entiteiten werd voorkomen. Omgekeerd wordt de drempel voor frequente entiteiten aangescherpt om vals-positieven te verminderen.
    Het systeem werd ingezet met behulp van een Flask-gebaseerde interface met Multi-GPU processing (PyTorch DDP) en 8-bits kwantisatie voor realtime inferentie.

2. Omgevingsopstelling

  1. Datasets
    Het raamwerk werd getest op de standaard biomedische NER-datasets om een eerlijke vergelijking te maken. De volgende datasets werden gebruikt, met hun officiële splitsingen behouden.
    BC5CDR: Voor herkenning van chemische en ziekte-entiteiten.
    NCBI Disease: Focused to Disease vermeldt.
    i2b2 2010: Voor klinische conceptherkenning in elektronische patiëntendossiers (EPD's).
  2. Evaluatie
    Om statistische robuustheid te waarborgen, voerden we 5 onafhankelijke runs uit voor elk enkelvoudig experiment (K=5,10,15) met verschillende willekeurige seeds voor datasteekproeven en gewichtinitiatie. De nauwkeurigheid, precisie, terugroep en F1-score werden over deze runs gerapporteerd. Zero-shot resultaten, deterministisch, werden gerapporteerd uit één enkele run.
    Om de haalbaarheid te evalueren van het inzetten van het voorgestelde Few-Shot en Zero-Shot Biomedical NER-systeem in realtime biomedische omgevingen, werd een gedetailleerde analyse van computationele efficiëntie en resourceprofilering uitgevoerd. De profilering werd uitgevoerd op een NVIDIA A100 GPU (40 GB VRAM) met CUDA 12.1 en PyTorch 2.3.1, waarbij mixed-precision (FP16) inferentie werd gebruikt om snelheid en geheugenefficiëntie in balans te brengen.
  3. Basismodellen
    BioBERT (Fin-tuned): Het BioBERT-v1.1 basismodel10werd volledig gecontroleerd afgesteld op de volledige trainingsdata van elke benchmark.
    ClinicalBERT & RoBERTa-base: Fin-tuned als domeinspecifieke en algemene domeinbaselines.
    GPT-3.5 & GPT-4 (Zero-Shot): Getest zoals beschreven in stap 3.3, zonder taakspecifieke fine-tuning.
    HealthPrompt20: Het huidige, state-of-the-art prompt-gebaseerde zero-shot klinisch NER-model.
    Voor volledige reproduceerbaarheid worden de kernsoftwarebibliotheken, modelcontrolepunten en hardwaredetails die in deze studie worden gebruikt, vermeld in de Materiaaltabel. Dit omvat specifieke versies van sleutelcomponenten, zoals de BioBERT-modelvariant, LLM, deep learning-framework en computationele omgeving.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De evaluatie van het Few-Shot en Zero-Shot Biomedical Named Entity Recognition (NER)-model werd uitgevoerd op basis van een diverse biomedische dataset afkomstig uit PubMed-abstracts, klinische notities en biomedische vraag-antwoordcorpora. Er werd een vergelijkende prestatieanalyse uitgevoerd met gevestigde modellen, waaronder BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5 en GPT-4. Het voorgestelde model behaalde een superieure algehele nauwkeurigheid van ...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tegenstrijdige resultaten, onverwachte bevindingen en discrepanties met ander onderzoek
Ondanks de superieure prestaties van het voorgestelde model, kwamen er bepaalde tegenstrijdige resultaten naar voren in vergelijking met bestaande studies. BioBERT-gebaseerde modellen hebben traditioneel sterke prestaties aangetoond in biomedische Named Entity Recognition (NER), zoals gerapporteerd in eerdere enquêtes en vergelijkende studies van biomedische NER-systemen

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben niets te onthullen.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
KernmodelBioBERT-base (v1.1)Hugging Face: monologg/biobert-v1.1
Deep Learning FrameworkPyTorch 2.3.1https://pytorch.org/
GPU HardwareNVIDIA A100 (40GB VRAM)NVIDIA
Large Language Model (LLM)GPT-4OpenAI API
BesturingssysteemwindowsMicrosoft
Parameter-Efficient TuningLoRA (via PEFT library 0.6.2)https://github.com/huggingface/peft
ProgrammeertaalPython 3.9.18Python Software Foundation
Zero-Shot Baseline LLMGPT-3.5-TurboOpenAI API

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, P., Wang, J., Luo, L., Lin, H., Yang, Z. Learning to explain is a good biomedical few-shot learner. Bioinformatics. 40 (10), 589(2024).
  2. Moscato, V., Postiglione, M., Sperlí, G. Few-shot named entity recognition: definition, taxonomy and research directions. ACM Trans Intell Syst Technol. 14 (5), 1-46 (2023).
  3. Nerella, S., et al. Transformers in healthcare: A survey. arXiv. , (2023).
  4. Song, B., Li, F., Liu, Y., Zeng, X. Deep learning methods for biomedical named entity recognition: A survey and qualitative comparison. Briefings Bioinform. 22 (6), bbab282(2021).
  5. Badawi, M., Abushanab, M., Bhat, S., Maier, A. Review of zero-shot and few-shot AI algorithms in the medical domain. arXiv. , (2024).
  6. Jin, M., Sang-Min, C., Gun-Woo, K. Comcare: A collaborative ensemble framework for context-aware medical named entity recognition and relation extraction. Electronics Basel. 14 (2), 328(2025).
  7. Ge, Y., Guo, Y., Das, S., Al-Garadi, M. A., Sarker, A. Few-shot learning for medical text: a review of advances, trends, and opportunities. J Biomed Inform. 144, 104458(2023).
  8. Picco, G., et al. Description boosting for zero-shot entity and relation classification. arXiv. , (2024).
  9. Khan, W., et al. A comprehensive survey of foundation models in medicine. IEEE Rev Biomed Eng. 18, 1-25 (2025).
  10. Ngo, Q. H., Kechadi, T., Le-Khac, N. A. Domain specific entity recognition with semantic-based deep learning approach. IEEE Access. 9, 152892-152902 (2021).
  11. Li, M., Zhang, R. How far is language model from 100% few-shot named entity recognition in medical domain. arXiv. , (2023).
  12. Nerella, S., et al. Transformers and large language models in healthcare: A review. Artif Intell Med. 148, 102900(2024).
  13. Rodríguez, H. Natural language technologies in the biomedical domain. Governing Asia. 93, 1-15 (2022).
  14. Mobasher, G. Welt: Weighted loss trainer for biomedical joint entity and relation extraction. [PhD thesis]. , https://www.mathinf.uni-heidelberg.de/en/thesis-defenses/welt-weighted-loss-trainer-for-biomedical-joint-entity-and-relation-extraction-2025-01-23 (2025).
  15. Giorgi, J. A study on the application of natural language processing methods to scientific text. [PhD thesis]. , University of Toronto. Canada. https://utoronto.scholaris.ca/items/0b02984d-5b6f-4287-9461-5afde0ec6c4e (2024).
  16. Amin, S. Learning entity and relation representation for low-resource medical language processing. [PhD thesis]. , https://publikationen.sulb.uni-saarland.de/bitstream/20.500.11880/38051/1/PhD_final_Amin.pdf (2024).
  17. Almudaifer, A. I. Entity information extraction and normalization from scientific and clinical texts. [PhD thesis]. , https://digitalcommons.library.uab.edu/etd-collection/3906/ (2024).
  18. One-shot biomedical named entity recognition via knowledge-inspired large language model. Bian, J., Zheng, J., Zhang, Y., Zhou, H., Zhu, S. Proc ACM Int Conf Bioinform Comput Biol Health Inform, , 1-10 (2024).
  19. Alotaibi, A., Nadeem, F., Hamdy, M. Weakly supervised deep learning for Arabic tweet sentiment analysis on education reforms: leveraging pre-trained models and LLMs with Snorkel. IEEE Access. 13, 1-15 (2025).
  20. Sivarajkumar, S., Wang, Y. HealthPrompt: A zero-shot learning paradigm for clinical natural language processing. AMIA Annu Symp Proc. , 972-981 (2023).
  21. Prompt discriminative language models for domain adaptation. Lu, K., et al. Proc Clin Nat Lang Process Workshop, , 247-258 (2023).
  22. Yao, Z., Cao, Y., Yang, Z., Yu, H. Context variance evaluation of pretrained language models for prompt-based biomedical knowledge probing. AMIA Jt Summits Transl Sci Proc. 2023, 592-601 (2023).
  23. Yeh, H. S., Lavergne, T., Zweigenbaum, P. Decorate the examples: a simple method of prompt design for biomedical relation extraction. arXiv. , (2022).
  24. Susanti, Y., Holsmoelle, N. Prompt-based vs fine-tuned LLMs toward causal graph verification. arXiv. , (2024).
  25. Chen, P., Wang, J., Lin, H., Zhao, D., Yang, Z. Few-shot biomedical named entity recognition via knowledge-guided instance generation and prompt contrastive learning. Bioinformatics. 39 (8), 496-504 (2023).
  26. Improving biomedical claim detection using prompt learning approaches. Chen, T., Stefanidis, A., Jiang, Z., Su, J. IEEE Int Conf Pattern Recognit Mach Learn, , 369-376 (2023).
  27. Tan, R. S. Y. C., et al. Inferring cancer disease response from radiology reports using large language models with data augmentation and prompting. J Am Med Inform Assoc. 30 (10), 1657-1664 (2023).
  28. Hu, Y., et al. Improving large language models for clinical named entity recognition via prompt engineering. J Am Med Inform Assoc. 31 (9), 1812-1820 (2024).
  29. Yang, J., et al. Enhancing phenotype recognition in clinical notes using large language models: PhenoBCBERT and PhenoGPT. Patterns NY. 5 (1), 100891(2024).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Few Shot LearningZero Shot Learningbiomedische NERklinische tekstminingdomeinadaptatieprompt engineering

Gerelateerde artikelen