Artykuł badawczy

Rozpoznawanie imionych jednostek w biomedycynie z elementami Few-shot i zero-shot: procedura ulepszania BioBERT poprzez uczenie się oparte na promptach i duże modele językowe

DOI:

10.3791/69390

31 marca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy artykuł przedstawia protokół do biomedycznego rozpoznawania nazwanych bytów z wykorzystaniem BioBERT, uczenia opartego na promptach oraz dużych modeli językowych dla scenariuszy o niskich zasobach.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Biomedyczne rozpoznawanie nazwanych bytów (NER) odgrywa kluczową rolę w wydobywania cennych informacji z tekstów klinicznych i literatury biomedycznej. Tradycyjne modele głębokiego uczenia, w tym BioBERT, ClinicalBERT i RoBERTa, wykazały znaczącą poprawę w zadaniach NER; jednak nadal borykają się z niewielkimi zasobami terminów biomedycznych, wyzwaniami adaptacyjnymi domen oraz niewidoczną generalizacją bytów. Aby rozwiązać te ograniczenia, badanie wprowadza hybrydowy framework łączący BioBERT, uczenie oparte na promptach oraz duże modele językowe (LLM), aby poprawić zdolności uczenia się w systemie niewielu i zerowych w biomedycznych NER. Proponowany model skutecznie wykorzystuje kontekstową wiedzę z wcześniej wytrenowanych transformerów, zmniejszając zależność od rozbudowanych oznakowanych zbiorów danych, jednocześnie zachowując wysoką dokładność. Po szeroko zakrojonej ocenie eksperymentalnej na wielu biomedycznych zestawach benchmarkowych proponowane podejście wykazuje konsekwentnie wysoką wydajność. Konkretnie, osiąga dokładność 89,8%, precyzję 88,7%, 90,5% zapamiętywania oraz wynik F1 na poziomie 0,895, przewyższając metody bazowe i wykazując skuteczność w zadaniach eksploracji tekstu biomedycznego. W porównaniu z innymi metodami, inżynieria promptów pomaga modelowi znacznie lepiej dostosować się do unikalnego języka tekstów biomedycznych. Dodatkowo, boosting za pomocą dużego modelu językowego (LLM) znacząco podnosi wydajność NER, wychwytując trudne szczegóły semantyczne i gramatyczne. Wyniki te pokazują skuteczność uczenia z małymi i zerowymi strzałami w eksploracji tekstów biomedycznych, torując drogę do lepszej zautomatyzowanej analizy danych klinicznych i inteligentniejszych systemów wsparcia decyzji.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Eksplozja literatury biomedycznej, elektronicznych dokumentacji medycznych (EHR) i danych z badań klinicznych naprawdę wymaga inteligentnych, solidnych systemów Biomedical Named Entity Recognition (BioNER). BioNER to specjalistyczne zadanie w przetwarzaniu języka naturalnego (NLP), którego celem jest identyfikacja takich obiektów jak choroby, geny, białka, leki i chemikalia w nieustrukturyzowanym tekście biomedycznym1. Umiejętność precyzyjnego wyróżnienia tych jednostek jest niezwykle ważna w wielu innych zastosowaniach, takich jak eksploracja wiedzy biomedycznej, znajdowanie nowych leków, wspieranie lekarzy w podejmowaniu decyzji klinicznych, a nawet automatyczne sortowanie stosów artykułów naukowych2.

Chociaż osiągnięto znaczące postępy w modelach opartych na głębokim uczeniu — takich jak BioBERT, ClinicalBERT i BlueBERT — większość istniejących nadzorowanych metod biomedycznego rozpoznawania nazw (BioNER) nadal w dużej mierze opiera się na dużych anotowanych zbiorach danych. To silne uzależnienie od rozległych danych oznaczonych ogranicza ich zdolność do uogólniania w odniesieniu do nowych lub wcześniej nieznanych tekstów biomedycznych3. Klasyczne modele BioNER potrzebują mnóstwa adnotowanych danych, aby je dopracowywać, co staje się prawdziwym problemem w obszarach, gdzie po prostu brakuje danych, na przykład na przykład choroby rzadkie, farmakogenomikę czy badania biomedyczne publikowane w językach innych niż angielski4. Dodatkowo, ręczne tagowanie całego tego tekstu biomedycznego jest powolne, kosztowne i zwykle wymaga prawdziwych ekspertóww tej dziedzinie. Dlatego tworzenie modeli BioNER z małymi i zerowymi strzałami jest tak ważne: mogłoby znacząco zmniejszyć potrzebę danych oznaczonych, jednocześnie zapewniając, że modele będą działać dobrze w szerokim zakresie treści biomedycznych6.

Uczenie typu Few-shot (FSL) pozwala modelom osiągać konkurencyjną wydajność rozpoznawania podmiotów, wykorzystując jedynie niewielką część oznaczonych danych, zazwyczaj od 1% do 10% pełnego zbioru danych treningowych, co czyni je szczególnie cennym dla niskozasobowych domen biomedycznych7. Zero-shot learning (ZSL) idzie jeszcze dalej, pozwalając modelowi rozpoznawać byty, których nigdy wcześniej nie widział, po prostu poprzez wykorzystanie mocy dużych, wcześniej wytrenowanych modeli językowych (LLM), bez potrzeby dodatkowych danych treningowych8. Ostatnio postępy w LLM, takich jak GPT-4, LLaMA i Falcon, wykazały silną wydajność zero-shot w ogólnych zadaniach NER, ale ich zastosowanie w rzeczywistych tekstach biomedycznych pozostaje w dużej mierze nieznanym terytorium. Wynika to z faktu, że język w biomedycznych dziedzinach jest po prostu tak wyspecjalizowany i skomplikowany9.

Celem tych badań jest zmniejszenie tej luki poprzez połączenie dopracowywania BioBERT, uczenia z niewieloma ujęciami, wnioskowania LLM bez strzałów oraz uczenia opartego na promptach, wszystko to w celu podniesienia poprzeczki dla BioNER w środowiskach biomedycznych o ograniczonych zasobach.

Aby dać wyobrażenie o tym, co już jest dostępne: (1) BioBERT to wersja BERT przetrenowana na streszczeniach PubMed i pełnotekstowych artykułach, więc lepiej nadaje się do treści biomedycznej10. (2) ClinicalBERT to wariant BERT wytrenowany na EHR, więc jest specjalnie dostosowany do sensowania notatek klinicznych i raportów lekarzy11. (3) BlueBERT to kolejny biomedyczny model NLP, wytrenowany zarówno na zbiorach danych PubMed, jak i MIMIC-III, i jest zoptymalizowany do rozpoznawania informacji medycznych w tekście12. (4) PubMedBERT to model transformatora trenowany wyłącznie na danych PubMed, co pomaga mu naprawdę wychwycić unikalne wzorce i terminologię spotykaną w tekstach biomedycznych13.

Chociaż modele te osiągają najnowocześniejsze wyniki w benchmarkach BioNER, ich poleganie na dużych, oznakowanych zbiorach danych i nadzorowanym dostrojeniu ogranicza ich zdolność do adaptacji do nowych dziedzin biomedycznych14. Ponadto zmiany domenowe między literaturą naukową biomedyczną (np. streszczenia PubMed) a notatkami klinicznymi (np. i2b2 2010 dataset) dodatkowo pogarszają wydajność nadzorowanych systemów BioNER15.

Główne ograniczenia obecnych badań BioNER obejmują: Zależność od danych adnotowanych: Istniejące modele oparte na transformatorach wymagają rozbudowanych, oznakowanych zbiorów danych, które są rzadkie w wyspecjalizowanych dziedzinach biomedycznych16. Brak uogólnienia na niewidzialne byty: Obecne modele mają trudności z rozpoznawaniem rzadkich lub nowych terminów biomedycznych, których nie ma w danych treningowych17. Ograniczone badania uczenia się z małymi i zerowymi strzałami: Większość badań koncentruje się na w pełni nadzorowanym uczeniu, z minimalnym badaniem paradygmatów o niskiej liczbie danych dla BioNER18. Nieefektywna adaptacja LLM: Chociaż LLM takie jak GPT-4 i LLaMA wykazują silne zero-shot wyniki w ogólnym NLP, ich zastosowanie w biomedycznych NER pozostaje niedostatecznie zbadane ze względu na złożoność terminologiczną i brak specyficznych dla dziedziny promptów19.

Aby uzupełnić te luki, niniejsze badanie analizuje następujące kluczowe pytania badawcze: Jak uczenie z małymi ujęciami może poprawić wydajność BioBERT w biomedycznych NER przy minimalnych danych oznakowanych? Czy wnioskowanie zero-shot z wykorzystaniem LLM może dokładnie rozpoznawać byty biomedyczne bez precyzyjnego dostrojenia specyficznego dla danej dziedziny? Jak uczenie oparte na promptach może poprawić wydajność zero-shot w zadaniach biomedycznych NER? Jakie jest optymalne hybrydowe podejście łączące pseudo-etykiety generowane przez BioBERT i LLM w celu poprawy BioNER w warunkach o ograniczonych zasobach? Jak trening adwersarny wpływa na odporność modeli BioNER z małymi i zerowymi strzałami?

Celem tych badań jest opracowanie nowatorskiego, adaptacyjnego biomedycznego frameworka NER, który wykorzystuje uczenie z małymi i zerowymi strzałami do rozwiązania wyzwań związanych z niedoborem danych oznakowanych. Celem badania jest zwiększenie możliwości uogólniania BioBERT i LLM poprzez eksplorację technik prompt engineering, uczenia kontrastowego oraz treningu przeciwstawnego.

Badania opierają się na następujących celach: (1) Opracowanie pipeline'u uczenia się kilku shotów dla biomedycznego NER poprzez dostrojenie BioBERT na ograniczonych danych adnotowanych. (2) Ocena zero-shot LLM (np. GPT-4, LLaMA, Falcon) dla biomedycznego NER z wykorzystaniem specyficznej domeny prompt engineering. (3) Stworzenie hybrydowego podejścia integrującego fine-tuning BioBERT z pseudo-etykietami generowanymi przez LLM w celu lepszego rozpoznawania encji w niskozasobowych zbiorach danych biomedycznych. (4) Przeprowadzenie analizy porównawczo uczenia z małymi shotami vs. zero-shot z wykorzystaniem standardowych benchmarków biomedycznych (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) Wdrożenie treningów adwersarialnych (FGSM, PGD) w celu zwiększenia odporności modelu na zakłócające wariacje tekstu biomedycznego.

Badanie to przyczynia się do rozwoju biomedycznego NLP i rozpoznawania entycji, wprowadzając strategie BioNER z niewieloma i zerowymi strzałami w celu zwalczania niedoboru etykiet w zbiorach danych biomedycznych oraz pokazując, jak LLM mogą być wykorzystywane do zero-shot biomedycznego NER poprzez optymalizację inżynierii promptów. Proponowanie hybrydowego frameworku łączącego fine-tuning BioBERT i syntetyczne adnotacje generowane przez LLM dla lepszej generalizacji. Ocena wpływu treningu adwersarnego na modele BioNER w celu poprawy odporności na zmiany domen. Dostarczanie porównawczego benchmarku wydajności BioNER w paradygmatach nadzorowanych, nieskończonych i zero-shot.

Przegląd literatury
Sivarajkumar i Wang,lat 20, opracowali HealthPrompt, ramy Zero-Shot Learning (ZSL) dla klinicznego NLP, które rozwiązują problem braku anotowanych zbiorów danych klinicznych. Zamiast dopracowywać wstępnie wytrenowany model językowy (PLM), zastosowali uczenie oparte na promptach, gdzie definicje zadań są dostosowywane do ustrukturyzowanych szablonów. Ich ocena sześciu PLM, w tym BioBERT i ClinicalBERT, na zbiorze danych MIMIC-III wykazała, że ClinicalBERT osiągnął najlepszą dokładność (85%) i wynik F1 (86%) w klasyfikacji tekstów klinicznych. Badanie to pokazuje, że uczenie zero-shot oparte na promptach (ZSL) może nadążyć za modelami nadzorowanymi w klinicznym przetwarzaniu języka naturalnego (NLP), bez potrzeby stosowania danych treningowych.

Keming Lu i zespół21 opracowali BIODLM, nowe podejście do precyzyjnego dopracowywania modeli językowych dyskryminacyjnych (DLM) dla dziedziny biomedycznej poprzez ciągłe pretraining oparte na promptach. Ich głównym celem było poprawa wydajności zarówno w zadaniach z niewieloma strzałami, jak i zerowymi strzałami w biomedycynie poprzez sprytne strojenie promptów oraz metodę wykrywania zastąpionych tokenów (RTD). Aby to działało, eksperymentują ze słownictwem, celowo mieszając terminy domenowe i używają PubMedBERT jako generatora podczas pretraining. Wyniki są solidne: BIODLM faktycznie pokonał typowe precyzyjne dostrajanie oparte na CLS, osiągając średnią dokładność makro na poziomie 50,2% przy pełnym nadzorze i 43,4% w trybie zero-shot.

Zonghai Yao iwspółpracownicy z 22 lat przyjęli inne podejście, skupiając się na generowaniu promptów, które uwzględniają zmienność kontekstu. Ich celem było zmniejszenie dziwnych uprzedzeń, które mogą pojawić się podczas badania opartego na promptach, oraz uczynienie oceny BioLAMA bardziej przejrzystą i łatwą do zrozumienia. Innymi słowy, starają się zapewnić, że te modele językowe dają nam odpowiedzi o sensie, a nie tylko wychwytują sprytnie sformułowane prompty.

Wprowadzili metrykę oceny opartą na zmianie rangi (UCM: Understand–Confuse–Misunderstand) zamiast tradycyjnej dokładności Top-k do oceny PLM w rozpoznawaniu podmiotów biomedycznych. Eksperymenty na 12 PLM, w tym modele oparte na BioBERT, ClinicalBERT i RoBERTa, wykazały poprawę wydajności BioLAMA dla relacji dużych-N-M oraz rzadkich jednostek biomedycznych. BioBERT osiągnął Accuracy@1 40,7% oraz zrozumiałość UCM na poziomie 32,8%, przewyższając tradycyjne metryki Top-k.

Yeh i in.23 badali prompting do ekstrakcji relacji biomedycznych z wykorzystaniem zbioru danych ChemProt w celu usprawnienia precyzyjnego dostrojenia danych specyficznych dla dan, w zależności od domeny. Zaprojektowali szablony oparte na promptach, które uwzględniają metryki punktacji, takie jak częstotliwość, specyficzność i podobieństwo, aby zoptymalizować wybór słów etykietowych. Korzystając z BioMed-RoBERTa-base, ich metoda osiągnęła wynik F1 na poziomie 90,09, przewyższając SciFive-Large o 1,14 F1 i przewyższając regularne dostrojenie o 14,21 F1. Potwierdza to, że uczenie oparte na promptach poprawia wydajność biomedycznego NER przy mniejszej liczbie przykładów treningowych.

Susanti i Holsmoelle 24 badali weryfikację grafów przyczynowych opartą na NLP, porównując precyzyjnie dostrojone modele językowe i LLM oparte na promptach. Trenowali modele BioBERT i GPT do nadzorowanej klasyfikacji zależności przyczynowych oraz oceniali LLM oparte na promptach o zerowym i niewielu strzałach. Wyniki na biomedycznych i otwartych zbiorach danych wykazały, że precyzyjnie dostrojone modele przewyższały prompty LLM, osiągając nawet o 20,5% wyższe wyniki F1. Badanie podkreśla potrzebę zaawansowanego promptingu i dostrajania specyficznego dla zbioru danych, aby poprawić dokładność wyciągania relacji przyczynowych.

Chen i in.25 zaproponowali ramy generowania instancji sterowanych wiedzą oraz uczenia kontrastowego prompt-prompt dla BioNER z małymi ujęciami. Ich podejście wykorzystuje grafy wiedzy domenowej do generowania różnorodnych bytów biomedycznych oraz stosuje kontrastywne uczenie oparte na pytaniach do lepszego rozpoznawania encji poprzez pomiar wzajemnej informacji między parami zapytania–odpowiedź. Oceniany na zbiorach danych fbenchmark (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE), ich model osiągnął do 7,1% poprawę wyniku F1 w porównaniu z najnowocześniejszymi modelami w scenariuszach 20-shot. Ich kod jest publicznie dostępny pod adresem: https://github.com/cpmss521/KGPC.

Chen i in.26zaproponowali również podejście do szybkiego uczenia do wykrywania roszczeń biomedycznych poprzez przekształcenie klasyfikacji tekstu w zadanie modelowania języka maskowanego (MLM). Korzystając z BERT, RoBERTa i T5 z twardymi i mieszanymi szablonami, poprawili dokładność przewidywania roszczeń. Na zbiorze danych BioClaim ich model T5 z mieszanymi szablonami osiągnął 5,3% poprawę wyniku F1 w porównaniu z wcześniejszymi modelami, niszcząc lukę między pretrenowaniem a precyzyjnym dostrojeniem w PLM z wykorzystaniem przewidywania maskowanych tokenów.

Ryan Shea Ying Cong Tan i in.27 oceniali LLM pod kątem wnioskowania odpowiedzi na choroby nowotworowe na podstawie raportów radiologicznych, wykorzystując modele transformatorowe, Bi-LSTM, CNN i klasyczne ML. Ich metoda obejmowała augmentację danych (permutację zdań i utratę spójności) oraz precyzyjne dostrajanie na podstawie promptów. Transformator GatorTron osiągnął najlepszą dokładność: 0,8916 na zestawie testowym i 0,8976 po augmentacji. Precyzyjne dostrajanie oparte na promptach umożliwiło efektywną wydajność przy zaledwie 500 oznaczonych raportach.

Hu i in.28 ocenili GPT-3.5 i GPT-4 dla klinicznego NER, poprawiając wydajność za pomocą czteroczęściowego systemu promptingowego: podstawowe prompty, prompty oparte na wytycznych, instrukcje oparte na błędach oraz próbki z kilkoma ujęciami. Na zbiorach danych MTSamples i VAERS GPT-3.5 i GPT-4 poprawiły swoje zrelaksowane wyniki F1 z 0.634/0.804 i 0.301/0.593 do odpowiednio 0.794/0.861 i 0.676/0.736. Choć wciąż pozostają w tyle za BioClinicalBERT (F1: 0.901 na MTSamples, 0.802 na VAERS), wyniki te pokazują rosnącą skuteczność LLM w klinicznym NER przy odpowiednich strategiach podpowiedzi.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Procedura

  1. Wstępne przetwarzanie danych i precyzyjne dostrojenie modeli
    Dane zostały wstępnie przetworzone z PubMed, BioASQ, MedQA i MMLU z wykorzystaniem normalizacji tekstu, tokenizacji (WordPiece/BPE), usunięcia słów stopowych oraz adnotacji IOB. Przeprowadzono precyzyjne dostrojenie BioBERT specyficzne dla danej dziedziny za pomocą Masked Language Modeling (MLM) oraz głowicy klasyfikacji tokenów. W porównaniu z metodami opartymi na adapterach, takimi jak LoRA.
  2. Wdrażanie uczenia FEW-Shot i Zero-Shot opartego na PROMPTACH
    Dla uczenia bez strzałów: Używałem LLM (GPT-4, GPT-3.5, T5) z promptami języka naturalnego (np. "Wyodrębnij biomedyczne podmioty z następującego tekstu: [Zdanie wejściowe]. Jednostki do identyfikacji to choroby, leki, geny i chemikalia. Lista każdej jednostki i jej typu.") oraz strojenie instrukcji. Użyto 5–20 oznaczonych przykładów na typ jednostki z Pattern-Exploiting Training (PET) i Prefiks-Tuning.
  3. Integracja LLM-ów i ustanowienie hybrydowego frameworka
    Wykonano fuzję osadzeń kontekstowych oraz wieloetapową predykcję NER (detekcję BioBERT + udoskonalenie GPT-4). Ramy te wykorzystywały dwustopniowe, sekwencyjne podejście do precyzyjnego dostrajania (nie end-to-end) do zarządzania złożonością obliczeniową. Po pierwsze, BioBERT został dopracowany na dostępnych danych z kilku strzałów. Po drugie, ten zamrożony model BioBERT został zintegrowany z komponentem LLM za pomocą warstwy fuzji, która była trenowana na tych samych danych. W związku z tym został włączony przy użyciu dwustopniowej strategii precyzyjnego dostrajania:
    Etap 1 – Nadzorowane dopracowywanie BioBERT dla NER.
    Etap 2 – Adaptacja oparta na promptach za pomocą wyjść GPT-4.
    figure-protocol-1
    gdzie α to współczynnik wyuczony, a Wp to macierz projekcji.
    Do prognoz łączenia zastosowano ważony głos zespołowy (WBioBERT=0,45, WGPT4=0,35, WClinicalBERT=0,20).
    Wagi dla każdego modelu (W_BioBERT=0,45, W_Hybrid=0,35, W_ClinicalBERT=0,20) zostały zoptymalizowane na wydzielonym zbiorze walidacyjnym za pomocą wyszukiwania siatkowego, aby zmaksymalizować mikro F1-score. Ten schemat ważenia odzwierciedla względny wkład każdego modelu: precyzyjnie dostrojony BioBERT dostarcza najsilniejszy sygnał specyficzny dla dziedziny, model hybrydowy dodaje uogólnienie, a ClinicalBERT oferuje komplementarny kontekst kliniczny.
  4. Zastosowanie udoskonalania i łączenia ontologii
    GPT-4 był używany do doprecyzowania sterowanego ontologią, akceptując korekty, gdy podobieństwo cosinusowe do osadzeń ontologii wynosiło ≥ 0,8 (wspomniane są już tylko poprawki z > 0,8). Podmioty te były powiązane z bazami danych UMLS, MeSH i HPO w celu rozdzielczości synonimów.
  5. Wdrażanie systemu z optymalizacją wnioskowania
    Adaptacyjne progowanie ufności zostało zaimplementowane dla każdej klasy jednostki: TCC + βσC (β=0,5).
    Kluczowym elementem potoku wnioskowania jest adaptacyjny próg ufności, który dynamicznie równoważy precyzję i przypomnienie między typami encji. Zamiast używać statycznego progu, mechanizm adaptacyjny obliczał próg TC specyficzny dla klasy na podstawie empirycznego rozkładu ufności przewidywań:
    figure-protocol-2
    gdzieμ C i σC reprezentują średnią i odchylenie standardowe wyników ufności dla klasy encji C, a β jest czynnikiem skalującym do regulacji (empirycznie ustawionym na 0,5). Rzadkie typy bytów biomedycznych (np. choroby rzadkie) wykazują wysoką wariancję w wynikach ufności. Próg adaptacyjny zapewniał, że są one zatrzymywane przy dużym σC, zapobiegając nadmiernemu filtrowaniu rzadkich obiektów. Natomiast dla częstych jednostek próg jest zaostrzany, aby zmniejszyć liczbę fałszywych alarmów.
    System był wdrażany za pomocą interfejsu opartego na Flask z przetwarzaniem wieloGPU (PyTorch DDP) oraz 8-bitową kwantyzacją do wnioskowania w czasie rzeczywistym.

2. Ustawienia środowiskowe

  1. Zbiory danych
    Ramy zostały przetestowane na standardowych biomedycznych zbiorach danych NER, aby dokonać rzetelnego porównania. Zastosowano następujące zbiory danych, zachowając ich oficjalne podziały.
    BC5CDR: Dla rozpoznawania podmiotów chemicznych i chorób.
    Wzmianki o chorobach NCBI: Skupione na chorobach.
    i2b2 2010: Za rozpoznawanie koncepcji klinicznych w elektronicznej dokumentacji medycznej (EHR).
  2. Ocena
    Aby zapewnić odporność statystyczną, przeprowadziliśmy 5 niezależnych przebiegów dla każdego eksperymentu z kilkoma strzałami (K=5,10,15) z różnymi losowymi zasiewami do pobierania danych i inicjalizacji wagi. Dokładność, precyzja, przypomnienie oraz wynik F1 były raportowane w tych przebiegach. Wyniki zero-shot, będące deterministycznymi, zostały zgłoszone z pojedynczego przebiegu.
    Aby ocenić wykonalność wdrożenia proponowanego systemu FEW-Shot i Zero-Shot Biomedical NER w środowiskach biomedycznych czasu rzeczywistego, przeprowadzono szczegółową analizę efektywności obliczeniowej i profilowania zasobów. Profilowanie przeprowadzono na GPU NVIDIA A100 (40 GB VRAM) z CUDA 12.1 i PyTorch 2.3.1, wykorzystując wnioskowanie mieszanej precyzji (FP16) w celu zrównoważenia szybkości i efektywności pamięci.
  3. Modele bazowe
    BioBERT (Fine-tuned): Podstawowy model10BioBERT-v1.1 został w pełni nadzorowany i dostrojony na wszystkich danych treningowych każdego benchmarku.
    Kliniczny BERT i RoBERTa-base: Precyzyjnie dostrojony jako bazowe dane specyficzne dla dziedziny i ogólnej domeny.
    GPT-3.5 i GPT-4 (Zero-Shot): Testowane zgodnie z krokiem 3.3, bez precyzyjnego dostrojenia specyficznego dla zadania.
    HealthPrompt20: Obecny, nowoczesny, oparty na promptach kliniczny model NER bez zastrzyków.
    Dla pełnej powtarzalności, podstawowe biblioteki oprogramowania, punkty kontrolne modelu oraz szczegóły sprzętowe użyte w tym badaniu są wymienione w Tabeli Materiałów. Obejmuje to konkretne wersje kluczowych komponentów, takie jak wariant modelu BioBERT, LLM, ramy głębokiego uczenia oraz środowisko obliczeniowe.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ocena modelu Few-Shot i Zero-Shot Biomedical Named Entity Recognition (NER) została przeprowadzona na różnorodnym zbiorze danych biomedycznych opartym na abstraktach PubMed, notatkach klinicznych oraz korpusach odpowiedzi na pytania biomedyczne. Przeprowadzono porównawczą analizę wydajności z uznanymi modelami, w tym BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5 i GPT-4. Proponowany model osiągnął wyższą ogólną dokładność 89,8%, z precyzją 88,7%, przypomnieniem 90,5% oraz wynikiem F1 0,895....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sprzeczne wyniki, nieoczekiwane odkrycia i rozbieżności w porównaniu z innymi badaniami
Pomimo lepszej wydajności proponowanego modelu, pojawiły się pewne sprzeczne wyniki w porównaniu z istniejącymi badaniami. Modele oparte na BioBERT tradycyjnie wykazywały silne wyniki w biomedycznym rozpoznawaniu nazwanych jednostek (NER), co było opisane w poprzednich badaniach i badaniach porównawczych systemów biomedycznych NER 4,10. Podczas gdy archit...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Model rdzeniowyBioBERT-base (wersja 1.1)Przytulająca twarz:  monolog/biobert-v1.1
Ramy Deep LearningPyTorch 2.3.1https://pytorch.org/
Sprzęt GPUNVIDIA A100 (40GB VRAM)NVIDIA
Duży model językowy (LLM)GPT-4OpenAI API
System operacyjnyOknaMicrosoft
Strojenie efektywne parametrycznieLoRA (za pośrednictwem biblioteki PEFT 0.6.2)https://github.com/huggingface/peft
Język programowaniaPython 3.9.18Python Software Foundation
LLM z zerowym strzałem bazowymGPT-3.5-TurboOpenAI API

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, P., Wang, J., Luo, L., Lin, H., Yang, Z. Learning to explain is a good biomedical few-shot learner. Bioinformatics. 40 (10), 589(2024).
  2. Moscato, V., Postiglione, M., Sperlí, G. Few-shot named entity recognition: definition, taxonomy and research directions. ACM Trans Intell Syst Technol. 14 (5), 1-46 (2023).
  3. Nerella, S., et al. Transformers in healthcare: A survey. arXiv. , (2023).
  4. Song, B., Li, F., Liu, Y., Zeng, X. Deep learning methods for biomedical named entity recognition: A survey and qualitative comparison. Briefings Bioinform. 22 (6), bbab282(2021).
  5. Badawi, M., Abushanab, M., Bhat, S., Maier, A. Review of zero-shot and few-shot AI algorithms in the medical domain. arXiv. , (2024).
  6. Jin, M., Sang-Min, C., Gun-Woo, K. Comcare: A collaborative ensemble framework for context-aware medical named entity recognition and relation extraction. Electronics Basel. 14 (2), 328(2025).
  7. Ge, Y., Guo, Y., Das, S., Al-Garadi, M. A., Sarker, A. Few-shot learning for medical text: a review of advances, trends, and opportunities. J Biomed Inform. 144, 104458(2023).
  8. Picco, G., et al. Description boosting for zero-shot entity and relation classification. arXiv. , (2024).
  9. Khan, W., et al. A comprehensive survey of foundation models in medicine. IEEE Rev Biomed Eng. 18, 1-25 (2025).
  10. Ngo, Q. H., Kechadi, T., Le-Khac, N. A. Domain specific entity recognition with semantic-based deep learning approach. IEEE Access. 9, 152892-152902 (2021).
  11. Li, M., Zhang, R. How far is language model from 100% few-shot named entity recognition in medical domain. arXiv. , (2023).
  12. Nerella, S., et al. Transformers and large language models in healthcare: A review. Artif Intell Med. 148, 102900(2024).
  13. Rodríguez, H. Natural language technologies in the biomedical domain. Governing Asia. 93, 1-15 (2022).
  14. Mobasher, G. Welt: Weighted loss trainer for biomedical joint entity and relation extraction. [PhD thesis]. , https://www.mathinf.uni-heidelberg.de/en/thesis-defenses/welt-weighted-loss-trainer-for-biomedical-joint-entity-and-relation-extraction-2025-01-23 (2025).
  15. Giorgi, J. A study on the application of natural language processing methods to scientific text. [PhD thesis]. , University of Toronto. Canada. https://utoronto.scholaris.ca/items/0b02984d-5b6f-4287-9461-5afde0ec6c4e (2024).
  16. Amin, S. Learning entity and relation representation for low-resource medical language processing. [PhD thesis]. , https://publikationen.sulb.uni-saarland.de/bitstream/20.500.11880/38051/1/PhD_final_Amin.pdf (2024).
  17. Almudaifer, A. I. Entity information extraction and normalization from scientific and clinical texts. [PhD thesis]. , https://digitalcommons.library.uab.edu/etd-collection/3906/ (2024).
  18. One-shot biomedical named entity recognition via knowledge-inspired large language model. Bian, J., Zheng, J., Zhang, Y., Zhou, H., Zhu, S. Proc ACM Int Conf Bioinform Comput Biol Health Inform, , 1-10 (2024).
  19. Alotaibi, A., Nadeem, F., Hamdy, M. Weakly supervised deep learning for Arabic tweet sentiment analysis on education reforms: leveraging pre-trained models and LLMs with Snorkel. IEEE Access. 13, 1-15 (2025).
  20. Sivarajkumar, S., Wang, Y. HealthPrompt: A zero-shot learning paradigm for clinical natural language processing. AMIA Annu Symp Proc. , 972-981 (2023).
  21. Prompt discriminative language models for domain adaptation. Lu, K., et al. Proc Clin Nat Lang Process Workshop, , 247-258 (2023).
  22. Yao, Z., Cao, Y., Yang, Z., Yu, H. Context variance evaluation of pretrained language models for prompt-based biomedical knowledge probing. AMIA Jt Summits Transl Sci Proc. 2023, 592-601 (2023).
  23. Yeh, H. S., Lavergne, T., Zweigenbaum, P. Decorate the examples: a simple method of prompt design for biomedical relation extraction. arXiv. , (2022).
  24. Susanti, Y., Holsmoelle, N. Prompt-based vs fine-tuned LLMs toward causal graph verification. arXiv. , (2024).
  25. Chen, P., Wang, J., Lin, H., Zhao, D., Yang, Z. Few-shot biomedical named entity recognition via knowledge-guided instance generation and prompt contrastive learning. Bioinformatics. 39 (8), 496-504 (2023).
  26. Improving biomedical claim detection using prompt learning approaches. Chen, T., Stefanidis, A., Jiang, Z., Su, J. IEEE Int Conf Pattern Recognit Mach Learn, , 369-376 (2023).
  27. Tan, R. S. Y. C., et al. Inferring cancer disease response from radiology reports using large language models with data augmentation and prompting. J Am Med Inform Assoc. 30 (10), 1657-1664 (2023).
  28. Hu, Y., et al. Improving large language models for clinical named entity recognition via prompt engineering. J Am Med Inform Assoc. 31 (9), 1812-1820 (2024).
  29. Yang, J., et al. Enhancing phenotype recognition in clinical notes using large language models: PhenoBCBERT and PhenoGPT. Patterns NY. 5 (1), 100891(2024).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

uczenie z kilku przyk ad w few shot learninguczenie zerowe zero shot learningbiomedyczne rozpoznawanie jednostek nazwanych NEReksploracja tekst w klinicznychadaptacja dziedzinowain ynieria prompt w

Powiązane artykuły