Dit artikel presenteert een protocol voor biomedische herkenning van benoemde entiteiten met behulp van BioBERT, prompt-based learning en grote taalmodellen voor scenario's met weinig hulpbronnen.
Onderzoeksartikel
Dit artikel presenteert een protocol voor biomedische herkenning van benoemde entiteiten met behulp van BioBERT, prompt-based learning en grote taalmodellen voor scenario's met weinig hulpbronnen.
Biomedische Named Entity Recognition (NER) speelt een cruciale rol bij het verkrijgen van waardevolle informatie uit klinische teksten en biomedische literatuur. Traditionele deep learning-modellen, waaronder BioBERT, ClinicalBERT en RoBERTa, hebben aanzienlijke verbeteringen aangetoond in NER-taken; Toch worstelen ze nog steeds met biomedische termen met weinig hulpbronnen, uitdagingen bij domeinaanpassing en generalisatie van onzichtbare entiteiten. Om deze beperkingen aan te pakken, introduceert deze studie een hybride kader dat BioBERT, prompt-based learning en Large Language Models (LLM's) combineert om de leermogelijkheden voor few-shot en zero-shot in biomedische NER te verbeteren. Het voorgestelde model maakt effectief gebruik van contextuele kennis van vooraf getrainde transformatoren, waardoor de afhankelijkheid van uitgebreide gelabelde datasets wordt verminderd en een hoge nauwkeurigheid behouden blijft. Na uitgebreide experimentele evaluatie over meerdere biomedische benchmarkdatasets toont de voorgestelde aanpak consequent sterke prestaties. Specifiek behaalt het 89,8% nauwkeurigheid, 88,7% precisie, 90,5% recall en een F1-score van 0,895, waarmee het de baseline-methoden overtreft en de effectiviteit voor biomedische tekstmining-taken aantoont. In vergelijking met andere methoden helpt prompt engineering het model zich veel beter aan te passen aan de unieke taal van biomedische teksten. Bovendien geeft boosten met een groot taalmodel (LLM) de NER-prestaties een flinke boost door lastige semantische en grammaticale details op te pikken. Deze bevindingen tonen de effectiviteit van few-shot en zero-shot leren in biomedische tekstmining aan, wat de weg vrijmaakt voor betere geautomatiseerde klinische data-analyse en slimmer besluitvormingssystemen.
De explosie van biomedische literatuur, elektronische patiëntendossiers (EPD's) en klinische proefgegevens vereist echt slimme, robuuste Biomedical Named Entity Recognition (BioNER)-systemen. BioNER is een gespecialiseerde taak in Natural Language Processing (NLP) die tot doel heeft entiteiten zoals ziekten, genen, eiwitten, geneesmiddelen en chemicaliën te identificeren in ongestructureerde biomedische tekst1. Het nauwkeurig kunnen onderscheiden van deze entiteiten is super belangrijk voor allerlei andere toepassingen, zoals het verzamelen van biomedische kennis, het vinden van nieuwe medicijnen, het ondersteunen van artsen bij klinische beslissingen, of zelfs automatisch door stapels onderzoeksartikelengaan 2.
Hoewel er aanzienlijke vooruitgang is geboekt in deep learning-gebaseerde modellen – zoals BioBERT, ClinicalBERT en BlueBBERT – blijven de meeste bestaande benaderingen van supervised biomedical named entity recognition (BioNER) sterk afhankelijk zijn van grootschalige geannoteerde datasets. Deze sterke afhankelijkheid van uitgebreide gelabelde data beperkt hun generalisatievermogen wanneer toegepast op nieuwe of eerder ongeziene biomedische teksten3. De klassieke BioNER-modellen hebben enorm veel geannoteerde data nodig om ze fijn af te stellen, wat een echte hoofdpijn wordt in gebieden waar er gewoon niet genoeg data is, denk aan zeldzame ziekten, farmacogenomica of biomedisch onderzoek dat in andere talen dan Engels4 wordt gepubliceerd. Bovendien is het handmatig taggen van al deze biomedische tekst traag, duur en vereist meestal echte experts op het vakgebied5. Daarom is het ontwikkelen van few-shot en zero-shot BioNER-modellen zo belangrijk: het zou de behoefte aan gelabelde data aanzienlijk kunnen verminderen, terwijl modellen goed werken over een breed scala aan biomedische inhoud6.
Few-shot learning (FSL) stelt modellen in staat om concurrerende entiteitsherkenningsprestaties te bereiken met slechts een klein deel van de gelabelde data, doorgaans tussen 1% en 10% van de volledige trainingsdataset, waardoor het bijzonder waardevol is voor biomedische domeinen met weinig middelen7. Zero-shot learning (ZSL) gaat nog verder, door een model entiteiten te laten herkennen die het nog nooit eerder heeft gezien, simpelweg door gebruik te maken van de kracht van grote, vooraf getrainde taalmodellen (LLM's), zonder extra trainingsdatate hoeven 8. De laatste tijd hebben vooruitgang in LLM's zoals GPT-4, LLaMA en Falcon sterke zero-shot prestaties getoond bij algemene NER-taken, maar hun gebruik in echte biomedische teksten blijft grotendeels onontgonnen terrein. Dat komt omdat de taal in de biomedische zaken zo gespecialiseerden ingewikkeld is.
Dit onderzoek heeft als doel die kloof te dichten door BioBERT-finetuning, few-shot learning, zero-shot LLM-inferentie en prompt-based learning samen te brengen, allemaal met als doel de lat voor BioNER in biomedische omgevingen met weinig middelen te verhogen.
Om een idee te geven van wat er al beschikbaar is: (1) BioBERT is een versie van BERT die is aangepast aan PubMed-abstracts en full-text artikelen, dus het is beter geschikt voor biomedische inhoud10. (2) ClinicalBERT is een BERT-variant die op EPD's is getraind, dus speciaal afgestemd op het begrijpen van klinische notities en doktersrapporten11. (3) BlueBERT is een ander biomedisch NLP-model, getraind op zowel PubMed- als MIMIC-III-datasets, en is geoptimaliseerd voor het herkennen van medische zaken in text12. (4) PubMedBERT is een transformermodel dat uitsluitend op PubMed-data is getraind, wat helpt om echt die unieke patronen en terminologie in biomedische schrijfstijl op te pikken13.
Hoewel deze modellen state-of-the-art prestaties behalen op BioNER-benchmarks, beperkt hun afhankelijkheid van grote, gelabelde datasets en gecontroleerde fine-tuning hun aanpassingsvermogen aan nieuwe biomedische domeinen14. Bovendien verzwakken domeinverschuivingen tussen wetenschappelijke biomedische literatuur (bijv. PubMed-abstracts) en klinische notities (bijv. i2b2 2010-dataset) de prestaties van begeleide BioNER-systemenverder 15.
De belangrijkste beperkingen in het huidige BioNER-onderzoek zijn: Afhankelijkheid van geannoteerde data: Bestaande transformer-gebaseerde modellen vereisen uitgebreide gelabelde datasets, die schaars zijn in gespecialiseerde biomedische domeinen16. Gebrek aan generalisatie naar Onzichtbare Entiteiten: Huidige modellen hebben moeite om zeldzame of nieuwe biomedische termen te herkennen die niet voorkomen in de trainingsdata17. Beperkte verkenning van Few-Shot en Zero-Shot Learning: Het meeste onderzoek richt zich op volledig begeleid leren, met minimale onderzoeken naar low-data paradigma's voor BioNER18. Inefficiënte aanpassing van LLM's: Hoewel LLM's zoals GPT-4 en LLaMA sterke zero-shot prestaties laten zien in algemene NLP, blijft hun toepassing op biomedische NER onderbelicht vanwege terminologische complexiteit en het ontbreken van domeinspecifieke prompts19.
Om deze hiaten aan te pakken, onderzoekt deze studie de volgende kernonderzoeksvragen: Hoe kan few-shot learning de prestaties van BioBERT in biomedische NER verbeteren met minimale gelabelde data? Kan zero-shot inferentie met LLM's biomedische entiteiten nauwkeurig herkennen zonder domeinspecifieke fine-tuning? Hoe kan prompt-gebaseerd leren de zero-shot prestaties verbeteren bij biomedische NER-taken? Wat is de optimale hybride aanpak die BioBERT- en LLM-gegenereerde pseudolabels combineert om BioNER te verbeteren in omgevingen met weinig hulpbronnen? Hoe beïnvloedt adversarial training de robuustheid van few-shot en zero-shot BioNER-modellen?
Het doel van dit onderzoek is het ontwikkelen van een nieuw, adaptief biomedisch NER-kader dat gebruikmaakt van few-shot en zero-shot learning om de uitdagingen van de schaarste aan gelabelde data aan te pakken. De studie heeft als doel de generalisatiemogelijkheden van BioBERT en LLM's te verbeteren door prompt engineering-technieken, contrastief leren en adversariale training te verkennen.
Het onderzoek is gestructureerd rond de volgende doelstellingen: (1) Het ontwikkelen van een leerpijplijn voor biomedische NER door BioBERT fijn af te stemmen op beperkte geannoteerde data. (2) Evaluatie van zero-shot LLM's (bijv. GPT-4, LLaMA, Falcon) voor biomedische NER met behulp van domeinspecifieke promptengineering. (3) Het creëren van een hybride benadering die BioBERT-fine-tuning integreert met door LLM gegenereerde pseudolabels voor verbeterde entiteitsherkenning in biomedische datasets met weinig bron. (4) Het uitvoeren van een vergelijkende analyse van few-shot versus zero-shot leren met standaard biomedische benchmarks (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) Het implementeren van adversarial training (FGSM, PGD) om de robuustheid van modellen te verbeteren tegen ruisachtige biomedische tekstvariaties.
Deze studie draagt bij aan het vakgebied van biomedische NLP en entiteitsherkenning door few-shot en zero-shot BioNER-strategieën te introduceren om labelschaarste in biomedische datasets aan te pakken en te demonstreren hoe LLM's kunnen worden ingezet voor zero-shot biomedische NER via geoptimaliseerde prompt engineering. Voorstel van een hybride framework dat BioBERT-finetuning en door LLM gegenereerde synthetische annotaties combineert voor betere generalisatie. Het evalueren van de impact van adversarial training op BioNER-modellen om de robuustheid tegen domeinverplaatsingen te verbeteren. Een vergelijkende benchmark van BioNER-prestaties bieden over supervised, few-shot en zero-shot paradigma's.
Literatuuroverzicht
Sivarajkumar en Wang20 ontwikkelden HealthPrompt, een Zero-Shot Learning (ZSL) framework voor klinische NLP dat het gebrek aan geannoteerde klinische datasets aanpakt. In plaats van een vooraf getraind taalmodel (PLM) fijn af te stemmen, maakten ze gebruik van prompt-based learning, waarbij taakdefinities worden aangepast met behulp van gestructureerde sjablonen. Hun evaluatie van zes PLM's, waaronder BioBERT en ClinicalBERT, op de MIMIC-III dataset toonde aan dat ClinicalBERT de beste nauwkeurigheid (85%) en F1-score (86%) behaalde voor klinische tekstclassificatie. Deze studie toont aan dat prompt-gebaseerd zero-shot learning (ZSL) kan bijhouden met begeleide modellen in klinische natuurlijke taalverwerking (NLP), zonder dat er trainingsdata nodig is.
Keming Lu en team21 ontwikkelden BIODLM, een nieuwe benadering om discriminatieve taalmodellen (DLM's) voor het biomedische domein te verfijnen via prompt-gebaseerde continue pretraining. Hun belangrijkste doel was om de prestaties op zowel few-shot als zero-shot taken in de biomedische sector te verbeteren door gebruik te maken van slimme prompt tuning en de Replaced Token Detection (RTD)-methode. Om het te laten werken, spelen ze met de woordenschat, mengen bewust domeinspecifieke termen door elkaar en gebruiken PubMedBERT als generator tijdens de pretraining. De resultaten zijn solide: BIODLM versloeg zelfs de gebruikelijke CLS-gebaseerde fine-tuning, met een macrogemiddelde nauwkeurigheid van 50,2% onder volledige supervisie en 43,4% in zero-shot modus.
Zonghai Yao en collega's22 kozen een andere benadering, met de focus op promptgeneratie die rekening houdt met contextvariatie. Hun doel was om de vreemde vooroordelen die kunnen ontstaan tijdens prompt-based probing te verminderen en de BioLAMA-evaluatie transparanter en interpreteerbaarder te maken. Met andere woorden, ze proberen ervoor te zorgen dat deze taalmodellen ons antwoorden geven die logisch zijn en niet alleen slim geformuleerde prompts oppikken.
Ze introduceerden een evaluatiemetriek op basis van rangverandering (UCM: Understand–Confuse–Misunderstand) in plaats van traditionele Top-k nauwkeurigheid om PLM's te beoordelen op biomedische entiteitsherkenning. Experimenten op 12 PLM's, waaronder BioBERT-, ClinicalBERT- en RoBERTa-gebaseerde modellen, toonden verbeterde BioLAMA-prestaties voor groot-N-M relaties en zeldzame biomedische entiteiten. BioBERT behaalde een Accuracy@1 van 40,7% en een UCM Understandability van 32,8%, beter dan traditionele Top-k metrics.
Yeh et al.23 onderzochten prompting voor biomedische relatie-extractie met behulp van de ChemProt-dataset om domeinspecifieke finetuning van few-shot en full-data te verbeteren. Ze ontwierpen promptgebaseerde sjablonen die score-metrics zoals frequentie, specificiteit en gelijkenis bevatten om de selectie van labelwoorden te optimaliseren. Met behulp van BioMed-RoBERTa-base behaalde hun methode een F1-score van 90,09, waarmee ze SciFive-Large met 1,14 F1 overtroffen en reguliere fine-tuning met 14,21 F1 overtrof. Dit bevestigt dat prompt-based learning de prestaties van biomedische NER-vaardigheden verbetert met minder trainingsvoorbeelden.
Susanti en Holsmoelle 24 bestudeerden NLP-gebaseerde verificatie van causale grafen, waarbij ze fijn afgestemde taalmodellen en promptgebaseerde LLM's vergeleken. Ze trainden BioBERT- en GPT-modellen voor begeleide causale relatieclassificatie en evalueerden zero-shot en few-shot prompt-gebaseerde LLM's. Resultaten van biomedische en open-domein datasets toonden aan dat fijn afgestemde modellen beter presteerden dan LLM-prompts en tot 20,5% hogere F1-scores behaalden. De studie benadrukt de noodzaak van geavanceerde prompting en dataset-specifieke afstemming om de nauwkeurigheid van causale relatie-extractie te verbeteren.
Chen et al.25 stelden een kennisgestuurde instance-generatie en prompt-contrastief leren kader voor voor few-shot BioNER. Hun aanpak maakt gebruik van domeinkennisgrafieken om diverse biomedische entiteiten te genereren en maakt gebruik van contrastief leren op basis van vragenprompts om de entiteitsherkenning te verbeteren door wederzijdse informatie tussen query-antwoordparen te meten. Geëvalueerd op fbenchmark-datasets (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE) behaalde hun model een verbetering tot 7,1% in de F1-score ten opzichte van state-of-the-art modellen in 20-shot scenario's. Hun code is openbaar beschikbaar op: https://github.com/cpmss521/KGPC.
Chen et al.26stelden ook een prompt-learning benadering voor voor biomedische claimdetectie door tekstclassificatie om te zetten in een gemaskerde taalmodellering (MLM)-taak. Met behulp van BERT, RoBERTa en T5 met harde en gemengde templates verbeterden ze de nauwkeurigheid van claimvoorspellingen. Op de BioClaim-dataset behaalde hun T5-model met gemengde templates een verbetering van 5,3% in de F1-score ten opzichte van eerdere modellen, waarmee het verschil tussen pretraining en fine-tuning in PLM's met behulp van gemasked token-voorspelling werd aangepakt.
Ryan Shea Ying Cong Tan et al.27 beoordeelden LLM's op inferentie van kanker en ziekterespons op basis van radiologierapporten met behulp van transformatormodellen, Bi-LSTM, CNN en klassieke ML. Hun methode omvatte data-augmentatie (zinspermutatie en consistentieverlies) en prompt-gebaseerde fine-tuning. De GatorTron-transformator behaalde de beste nauwkeurigheid: 0,8916 op de testset en 0,8976 na augmentatie. Prompt-gebaseerde fine-tuning maakte effectieve prestaties mogelijk met slechts 500 gelabelde rapporten.
Hu et al.28 evalueerden GPT-3.5 en GPT-4 voor klinische NER, waarbij de prestaties verbeterden via een vierdelig promptingraamwerk: baseline prompts, richtlijngebaseerde prompts, foutgebaseerde instructies en few-shot samples. Op de MTSamples- en VAERS-datasets verbeterden GPT-3.5 en GPT-4 hun ontspannen F1-scores van respectievelijk 0,634/0,804 en 0,301/0,593 naar respectievelijk 0,794/0,861 en 0,676/0,736. Hoewel ze nog steeds achter BioClinicalBERT liggen (F1: 0,901 op MTSamples, 0,802 op VAERS), tonen deze resultaten de groeiende effectiviteit van LLM's in klinische NER met juiste promptingstrategieën.
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
1. Procedure


2. Omgevingsopstelling
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
De evaluatie van het Few-Shot en Zero-Shot Biomedical Named Entity Recognition (NER)-model werd uitgevoerd op basis van een diverse biomedische dataset afkomstig uit PubMed-abstracts, klinische notities en biomedische vraag-antwoordcorpora. Er werd een vergelijkende prestatieanalyse uitgevoerd met gevestigde modellen, waaronder BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5 en GPT-4. Het voorgestelde model behaalde een superieure algehele nauwkeurigheid van ...
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
Tegenstrijdige resultaten, onverwachte bevindingen en discrepanties met ander onderzoek
Ondanks de superieure prestaties van het voorgestelde model, kwamen er bepaalde tegenstrijdige resultaten naar voren in vergelijking met bestaande studies. BioBERT-gebaseerde modellen hebben traditioneel sterke prestaties aangetoond in biomedische Named Entity Recognition (NER), zoals gerapporteerd in eerdere enquêtes en vergelijkende studies van biomedische NER-systemen
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
De auteurs hebben niets te onthullen.
| Naam | Bedrijf | Catalogusnummer | Opmerkingen |
|---|---|---|---|
| Kernmodel | BioBERT-base (v1.1) | Hugging Face: monologg/biobert-v1.1 | |
| Deep Learning Framework | PyTorch 2.3.1 | https://pytorch.org/ | |
| GPU Hardware | NVIDIA A100 (40GB VRAM) | NVIDIA | |
| Large Language Model (LLM) | GPT-4 | OpenAI API | |
| Besturingssysteem | windows | Microsoft | |
| Parameter-Efficient Tuning | LoRA (via PEFT library 0.6.2) | https://github.com/huggingface/peft | |
| Programmeertaal | Python 3.9.18 | Python Software Foundation | |
| Zero-Shot Baseline LLM | GPT-3.5-Turbo | OpenAI API |
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken
Toestemming aanvragen