Niniejszy artykuł przedstawia protokół do biomedycznego rozpoznawania nazwanych bytów z wykorzystaniem BioBERT, uczenia opartego na promptach oraz dużych modeli językowych dla scenariuszy o niskich zasobach.
Artykuł badawczy
Niniejszy artykuł przedstawia protokół do biomedycznego rozpoznawania nazwanych bytów z wykorzystaniem BioBERT, uczenia opartego na promptach oraz dużych modeli językowych dla scenariuszy o niskich zasobach.
Biomedyczne rozpoznawanie nazwanych bytów (NER) odgrywa kluczową rolę w wydobywania cennych informacji z tekstów klinicznych i literatury biomedycznej. Tradycyjne modele głębokiego uczenia, w tym BioBERT, ClinicalBERT i RoBERTa, wykazały znaczącą poprawę w zadaniach NER; jednak nadal borykają się z niewielkimi zasobami terminów biomedycznych, wyzwaniami adaptacyjnymi domen oraz niewidoczną generalizacją bytów. Aby rozwiązać te ograniczenia, badanie wprowadza hybrydowy framework łączący BioBERT, uczenie oparte na promptach oraz duże modele językowe (LLM), aby poprawić zdolności uczenia się w systemie niewielu i zerowych w biomedycznych NER. Proponowany model skutecznie wykorzystuje kontekstową wiedzę z wcześniej wytrenowanych transformerów, zmniejszając zależność od rozbudowanych oznakowanych zbiorów danych, jednocześnie zachowując wysoką dokładność. Po szeroko zakrojonej ocenie eksperymentalnej na wielu biomedycznych zestawach benchmarkowych proponowane podejście wykazuje konsekwentnie wysoką wydajność. Konkretnie, osiąga dokładność 89,8%, precyzję 88,7%, 90,5% zapamiętywania oraz wynik F1 na poziomie 0,895, przewyższając metody bazowe i wykazując skuteczność w zadaniach eksploracji tekstu biomedycznego. W porównaniu z innymi metodami, inżynieria promptów pomaga modelowi znacznie lepiej dostosować się do unikalnego języka tekstów biomedycznych. Dodatkowo, boosting za pomocą dużego modelu językowego (LLM) znacząco podnosi wydajność NER, wychwytując trudne szczegóły semantyczne i gramatyczne. Wyniki te pokazują skuteczność uczenia z małymi i zerowymi strzałami w eksploracji tekstów biomedycznych, torując drogę do lepszej zautomatyzowanej analizy danych klinicznych i inteligentniejszych systemów wsparcia decyzji.
Eksplozja literatury biomedycznej, elektronicznych dokumentacji medycznych (EHR) i danych z badań klinicznych naprawdę wymaga inteligentnych, solidnych systemów Biomedical Named Entity Recognition (BioNER). BioNER to specjalistyczne zadanie w przetwarzaniu języka naturalnego (NLP), którego celem jest identyfikacja takich obiektów jak choroby, geny, białka, leki i chemikalia w nieustrukturyzowanym tekście biomedycznym1. Umiejętność precyzyjnego wyróżnienia tych jednostek jest niezwykle ważna w wielu innych zastosowaniach, takich jak eksploracja wiedzy biomedycznej, znajdowanie nowych leków, wspieranie lekarzy w podejmowaniu decyzji klinicznych, a nawet automatyczne sortowanie stosów artykułów naukowych2.
Chociaż osiągnięto znaczące postępy w modelach opartych na głębokim uczeniu — takich jak BioBERT, ClinicalBERT i BlueBERT — większość istniejących nadzorowanych metod biomedycznego rozpoznawania nazw (BioNER) nadal w dużej mierze opiera się na dużych anotowanych zbiorach danych. To silne uzależnienie od rozległych danych oznaczonych ogranicza ich zdolność do uogólniania w odniesieniu do nowych lub wcześniej nieznanych tekstów biomedycznych3. Klasyczne modele BioNER potrzebują mnóstwa adnotowanych danych, aby je dopracowywać, co staje się prawdziwym problemem w obszarach, gdzie po prostu brakuje danych, na przykład na przykład choroby rzadkie, farmakogenomikę czy badania biomedyczne publikowane w językach innych niż angielski4. Dodatkowo, ręczne tagowanie całego tego tekstu biomedycznego jest powolne, kosztowne i zwykle wymaga prawdziwych ekspertóww tej dziedzinie. Dlatego tworzenie modeli BioNER z małymi i zerowymi strzałami jest tak ważne: mogłoby znacząco zmniejszyć potrzebę danych oznaczonych, jednocześnie zapewniając, że modele będą działać dobrze w szerokim zakresie treści biomedycznych6.
Uczenie typu Few-shot (FSL) pozwala modelom osiągać konkurencyjną wydajność rozpoznawania podmiotów, wykorzystując jedynie niewielką część oznaczonych danych, zazwyczaj od 1% do 10% pełnego zbioru danych treningowych, co czyni je szczególnie cennym dla niskozasobowych domen biomedycznych7. Zero-shot learning (ZSL) idzie jeszcze dalej, pozwalając modelowi rozpoznawać byty, których nigdy wcześniej nie widział, po prostu poprzez wykorzystanie mocy dużych, wcześniej wytrenowanych modeli językowych (LLM), bez potrzeby dodatkowych danych treningowych8. Ostatnio postępy w LLM, takich jak GPT-4, LLaMA i Falcon, wykazały silną wydajność zero-shot w ogólnych zadaniach NER, ale ich zastosowanie w rzeczywistych tekstach biomedycznych pozostaje w dużej mierze nieznanym terytorium. Wynika to z faktu, że język w biomedycznych dziedzinach jest po prostu tak wyspecjalizowany i skomplikowany9.
Celem tych badań jest zmniejszenie tej luki poprzez połączenie dopracowywania BioBERT, uczenia z niewieloma ujęciami, wnioskowania LLM bez strzałów oraz uczenia opartego na promptach, wszystko to w celu podniesienia poprzeczki dla BioNER w środowiskach biomedycznych o ograniczonych zasobach.
Aby dać wyobrażenie o tym, co już jest dostępne: (1) BioBERT to wersja BERT przetrenowana na streszczeniach PubMed i pełnotekstowych artykułach, więc lepiej nadaje się do treści biomedycznej10. (2) ClinicalBERT to wariant BERT wytrenowany na EHR, więc jest specjalnie dostosowany do sensowania notatek klinicznych i raportów lekarzy11. (3) BlueBERT to kolejny biomedyczny model NLP, wytrenowany zarówno na zbiorach danych PubMed, jak i MIMIC-III, i jest zoptymalizowany do rozpoznawania informacji medycznych w tekście12. (4) PubMedBERT to model transformatora trenowany wyłącznie na danych PubMed, co pomaga mu naprawdę wychwycić unikalne wzorce i terminologię spotykaną w tekstach biomedycznych13.
Chociaż modele te osiągają najnowocześniejsze wyniki w benchmarkach BioNER, ich poleganie na dużych, oznakowanych zbiorach danych i nadzorowanym dostrojeniu ogranicza ich zdolność do adaptacji do nowych dziedzin biomedycznych14. Ponadto zmiany domenowe między literaturą naukową biomedyczną (np. streszczenia PubMed) a notatkami klinicznymi (np. i2b2 2010 dataset) dodatkowo pogarszają wydajność nadzorowanych systemów BioNER15.
Główne ograniczenia obecnych badań BioNER obejmują: Zależność od danych adnotowanych: Istniejące modele oparte na transformatorach wymagają rozbudowanych, oznakowanych zbiorów danych, które są rzadkie w wyspecjalizowanych dziedzinach biomedycznych16. Brak uogólnienia na niewidzialne byty: Obecne modele mają trudności z rozpoznawaniem rzadkich lub nowych terminów biomedycznych, których nie ma w danych treningowych17. Ograniczone badania uczenia się z małymi i zerowymi strzałami: Większość badań koncentruje się na w pełni nadzorowanym uczeniu, z minimalnym badaniem paradygmatów o niskiej liczbie danych dla BioNER18. Nieefektywna adaptacja LLM: Chociaż LLM takie jak GPT-4 i LLaMA wykazują silne zero-shot wyniki w ogólnym NLP, ich zastosowanie w biomedycznych NER pozostaje niedostatecznie zbadane ze względu na złożoność terminologiczną i brak specyficznych dla dziedziny promptów19.
Aby uzupełnić te luki, niniejsze badanie analizuje następujące kluczowe pytania badawcze: Jak uczenie z małymi ujęciami może poprawić wydajność BioBERT w biomedycznych NER przy minimalnych danych oznakowanych? Czy wnioskowanie zero-shot z wykorzystaniem LLM może dokładnie rozpoznawać byty biomedyczne bez precyzyjnego dostrojenia specyficznego dla danej dziedziny? Jak uczenie oparte na promptach może poprawić wydajność zero-shot w zadaniach biomedycznych NER? Jakie jest optymalne hybrydowe podejście łączące pseudo-etykiety generowane przez BioBERT i LLM w celu poprawy BioNER w warunkach o ograniczonych zasobach? Jak trening adwersarny wpływa na odporność modeli BioNER z małymi i zerowymi strzałami?
Celem tych badań jest opracowanie nowatorskiego, adaptacyjnego biomedycznego frameworka NER, który wykorzystuje uczenie z małymi i zerowymi strzałami do rozwiązania wyzwań związanych z niedoborem danych oznakowanych. Celem badania jest zwiększenie możliwości uogólniania BioBERT i LLM poprzez eksplorację technik prompt engineering, uczenia kontrastowego oraz treningu przeciwstawnego.
Badania opierają się na następujących celach: (1) Opracowanie pipeline'u uczenia się kilku shotów dla biomedycznego NER poprzez dostrojenie BioBERT na ograniczonych danych adnotowanych. (2) Ocena zero-shot LLM (np. GPT-4, LLaMA, Falcon) dla biomedycznego NER z wykorzystaniem specyficznej domeny prompt engineering. (3) Stworzenie hybrydowego podejścia integrującego fine-tuning BioBERT z pseudo-etykietami generowanymi przez LLM w celu lepszego rozpoznawania encji w niskozasobowych zbiorach danych biomedycznych. (4) Przeprowadzenie analizy porównawczo uczenia z małymi shotami vs. zero-shot z wykorzystaniem standardowych benchmarków biomedycznych (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) Wdrożenie treningów adwersarialnych (FGSM, PGD) w celu zwiększenia odporności modelu na zakłócające wariacje tekstu biomedycznego.
Badanie to przyczynia się do rozwoju biomedycznego NLP i rozpoznawania entycji, wprowadzając strategie BioNER z niewieloma i zerowymi strzałami w celu zwalczania niedoboru etykiet w zbiorach danych biomedycznych oraz pokazując, jak LLM mogą być wykorzystywane do zero-shot biomedycznego NER poprzez optymalizację inżynierii promptów. Proponowanie hybrydowego frameworku łączącego fine-tuning BioBERT i syntetyczne adnotacje generowane przez LLM dla lepszej generalizacji. Ocena wpływu treningu adwersarnego na modele BioNER w celu poprawy odporności na zmiany domen. Dostarczanie porównawczego benchmarku wydajności BioNER w paradygmatach nadzorowanych, nieskończonych i zero-shot.
Przegląd literatury
Sivarajkumar i Wang,lat 20, opracowali HealthPrompt, ramy Zero-Shot Learning (ZSL) dla klinicznego NLP, które rozwiązują problem braku anotowanych zbiorów danych klinicznych. Zamiast dopracowywać wstępnie wytrenowany model językowy (PLM), zastosowali uczenie oparte na promptach, gdzie definicje zadań są dostosowywane do ustrukturyzowanych szablonów. Ich ocena sześciu PLM, w tym BioBERT i ClinicalBERT, na zbiorze danych MIMIC-III wykazała, że ClinicalBERT osiągnął najlepszą dokładność (85%) i wynik F1 (86%) w klasyfikacji tekstów klinicznych. Badanie to pokazuje, że uczenie zero-shot oparte na promptach (ZSL) może nadążyć za modelami nadzorowanymi w klinicznym przetwarzaniu języka naturalnego (NLP), bez potrzeby stosowania danych treningowych.
Keming Lu i zespół21 opracowali BIODLM, nowe podejście do precyzyjnego dopracowywania modeli językowych dyskryminacyjnych (DLM) dla dziedziny biomedycznej poprzez ciągłe pretraining oparte na promptach. Ich głównym celem było poprawa wydajności zarówno w zadaniach z niewieloma strzałami, jak i zerowymi strzałami w biomedycynie poprzez sprytne strojenie promptów oraz metodę wykrywania zastąpionych tokenów (RTD). Aby to działało, eksperymentują ze słownictwem, celowo mieszając terminy domenowe i używają PubMedBERT jako generatora podczas pretraining. Wyniki są solidne: BIODLM faktycznie pokonał typowe precyzyjne dostrajanie oparte na CLS, osiągając średnią dokładność makro na poziomie 50,2% przy pełnym nadzorze i 43,4% w trybie zero-shot.
Zonghai Yao iwspółpracownicy z 22 lat przyjęli inne podejście, skupiając się na generowaniu promptów, które uwzględniają zmienność kontekstu. Ich celem było zmniejszenie dziwnych uprzedzeń, które mogą pojawić się podczas badania opartego na promptach, oraz uczynienie oceny BioLAMA bardziej przejrzystą i łatwą do zrozumienia. Innymi słowy, starają się zapewnić, że te modele językowe dają nam odpowiedzi o sensie, a nie tylko wychwytują sprytnie sformułowane prompty.
Wprowadzili metrykę oceny opartą na zmianie rangi (UCM: Understand–Confuse–Misunderstand) zamiast tradycyjnej dokładności Top-k do oceny PLM w rozpoznawaniu podmiotów biomedycznych. Eksperymenty na 12 PLM, w tym modele oparte na BioBERT, ClinicalBERT i RoBERTa, wykazały poprawę wydajności BioLAMA dla relacji dużych-N-M oraz rzadkich jednostek biomedycznych. BioBERT osiągnął Accuracy@1 40,7% oraz zrozumiałość UCM na poziomie 32,8%, przewyższając tradycyjne metryki Top-k.
Yeh i in.23 badali prompting do ekstrakcji relacji biomedycznych z wykorzystaniem zbioru danych ChemProt w celu usprawnienia precyzyjnego dostrojenia danych specyficznych dla dan, w zależności od domeny. Zaprojektowali szablony oparte na promptach, które uwzględniają metryki punktacji, takie jak częstotliwość, specyficzność i podobieństwo, aby zoptymalizować wybór słów etykietowych. Korzystając z BioMed-RoBERTa-base, ich metoda osiągnęła wynik F1 na poziomie 90,09, przewyższając SciFive-Large o 1,14 F1 i przewyższając regularne dostrojenie o 14,21 F1. Potwierdza to, że uczenie oparte na promptach poprawia wydajność biomedycznego NER przy mniejszej liczbie przykładów treningowych.
Susanti i Holsmoelle 24 badali weryfikację grafów przyczynowych opartą na NLP, porównując precyzyjnie dostrojone modele językowe i LLM oparte na promptach. Trenowali modele BioBERT i GPT do nadzorowanej klasyfikacji zależności przyczynowych oraz oceniali LLM oparte na promptach o zerowym i niewielu strzałach. Wyniki na biomedycznych i otwartych zbiorach danych wykazały, że precyzyjnie dostrojone modele przewyższały prompty LLM, osiągając nawet o 20,5% wyższe wyniki F1. Badanie podkreśla potrzebę zaawansowanego promptingu i dostrajania specyficznego dla zbioru danych, aby poprawić dokładność wyciągania relacji przyczynowych.
Chen i in.25 zaproponowali ramy generowania instancji sterowanych wiedzą oraz uczenia kontrastowego prompt-prompt dla BioNER z małymi ujęciami. Ich podejście wykorzystuje grafy wiedzy domenowej do generowania różnorodnych bytów biomedycznych oraz stosuje kontrastywne uczenie oparte na pytaniach do lepszego rozpoznawania encji poprzez pomiar wzajemnej informacji między parami zapytania–odpowiedź. Oceniany na zbiorach danych fbenchmark (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE), ich model osiągnął do 7,1% poprawę wyniku F1 w porównaniu z najnowocześniejszymi modelami w scenariuszach 20-shot. Ich kod jest publicznie dostępny pod adresem: https://github.com/cpmss521/KGPC.
Chen i in.26zaproponowali również podejście do szybkiego uczenia do wykrywania roszczeń biomedycznych poprzez przekształcenie klasyfikacji tekstu w zadanie modelowania języka maskowanego (MLM). Korzystając z BERT, RoBERTa i T5 z twardymi i mieszanymi szablonami, poprawili dokładność przewidywania roszczeń. Na zbiorze danych BioClaim ich model T5 z mieszanymi szablonami osiągnął 5,3% poprawę wyniku F1 w porównaniu z wcześniejszymi modelami, niszcząc lukę między pretrenowaniem a precyzyjnym dostrojeniem w PLM z wykorzystaniem przewidywania maskowanych tokenów.
Ryan Shea Ying Cong Tan i in.27 oceniali LLM pod kątem wnioskowania odpowiedzi na choroby nowotworowe na podstawie raportów radiologicznych, wykorzystując modele transformatorowe, Bi-LSTM, CNN i klasyczne ML. Ich metoda obejmowała augmentację danych (permutację zdań i utratę spójności) oraz precyzyjne dostrajanie na podstawie promptów. Transformator GatorTron osiągnął najlepszą dokładność: 0,8916 na zestawie testowym i 0,8976 po augmentacji. Precyzyjne dostrajanie oparte na promptach umożliwiło efektywną wydajność przy zaledwie 500 oznaczonych raportach.
Hu i in.28 ocenili GPT-3.5 i GPT-4 dla klinicznego NER, poprawiając wydajność za pomocą czteroczęściowego systemu promptingowego: podstawowe prompty, prompty oparte na wytycznych, instrukcje oparte na błędach oraz próbki z kilkoma ujęciami. Na zbiorach danych MTSamples i VAERS GPT-3.5 i GPT-4 poprawiły swoje zrelaksowane wyniki F1 z 0.634/0.804 i 0.301/0.593 do odpowiednio 0.794/0.861 i 0.676/0.736. Choć wciąż pozostają w tyle za BioClinicalBERT (F1: 0.901 na MTSamples, 0.802 na VAERS), wyniki te pokazują rosnącą skuteczność LLM w klinicznym NER przy odpowiednich strategiach podpowiedzi.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
1. Procedura


2. Ustawienia środowiskowe
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Ocena modelu Few-Shot i Zero-Shot Biomedical Named Entity Recognition (NER) została przeprowadzona na różnorodnym zbiorze danych biomedycznych opartym na abstraktach PubMed, notatkach klinicznych oraz korpusach odpowiedzi na pytania biomedyczne. Przeprowadzono porównawczą analizę wydajności z uznanymi modelami, w tym BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5 i GPT-4. Proponowany model osiągnął wyższą ogólną dokładność 89,8%, z precyzją 88,7%, przypomnieniem 90,5% oraz wynikiem F1 0,895....
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Sprzeczne wyniki, nieoczekiwane odkrycia i rozbieżności w porównaniu z innymi badaniami
Pomimo lepszej wydajności proponowanego modelu, pojawiły się pewne sprzeczne wyniki w porównaniu z istniejącymi badaniami. Modele oparte na BioBERT tradycyjnie wykazywały silne wyniki w biomedycznym rozpoznawaniu nazwanych jednostek (NER), co było opisane w poprzednich badaniach i badaniach porównawczych systemów biomedycznych NER 4,10. Podczas gdy archit...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Autorzy nie mają nic do ujawnienia.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Model rdzeniowy | BioBERT-base (wersja 1.1) | Przytulająca twarz: monolog/biobert-v1.1 | |
| Ramy Deep Learning | PyTorch 2.3.1 | https://pytorch.org/ | |
| Sprzęt GPU | NVIDIA A100 (40GB VRAM) | NVIDIA | |
| Duży model językowy (LLM) | GPT-4 | OpenAI API | |
| System operacyjny | Okna | Microsoft | |
| Strojenie efektywne parametrycznie | LoRA (za pośrednictwem biblioteki PEFT 0.6.2) | https://github.com/huggingface/peft | |
| Język programowania | Python 3.9.18 | Python Software Foundation | |
| LLM z zerowym strzałem bazowym | GPT-3.5-Turbo | OpenAI API |
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE
Poproś o pozwolenie