연구 논문

프루샷 및 제로샷 생의학 명명 엔터티 인식: 프롬프트 기반 학습과 대규모 언어 모델로 BioBERT를 강화하는 절차

DOI:

10.3791/69390

2026년 3월 31일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 글은 BioBERT, 프롬프트 기반 학습, 그리고 저자원 시나리오를 위한 대형 언어 모델을 활용한 생의학 이름 엔터티 인식 프로토콜을 제시합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

생의학 명명 엔터티 인식(NER)은 임상 텍스트와 생의학 문헌에서 귀중한 정보를 추출하는 데 중요한 역할을 합니다. BioBERT, ClinicalBERT, RoBERTa를 포함한 전통적인 딥러닝 모델은 NER 작업에서 상당한 개선을 보여주었습니다; 하지만 여전히 자원이 부족한 생의학 용어, 도메인 적응 문제, 보이지 않는 개체의 일반화 등으로 어려움을 겪고 있습니다. 이러한 한계를 해결하기 위해 본 연구는 BioBERT, 프롬프트 기반 학습, 대형 언어 모델(LLM)을 결합한 하이브리드 프레임워크를 도입하여 생의학 NER에서 소샷 및 제로샷 학습 능력을 강화합니다. 제안된 모델은 사전 학습된 트랜스포머에서 얻은 맥락적 지식을 효과적으로 활용하여 광범위한 라벨링 데이터셋에 대한 의존도를 줄이면서도 높은 정확도를 유지합니다. 여러 생의학 벤치마크 데이터셋에 대한 광범위한 실험 평가 후, 제안된 접근법은 일관되게 강력한 성능을 입증했습니다. 구체적으로, 89.8%의 정확도, 88.7%의 정밀도, 90.5%의 기억 발생률, 그리고 0.895의 F1 점수를 달성하여 기본 방법을 능가하며 생의학 텍스트 마이닝 작업에 효과적임을 입증했습니다. 다른 방법과 비교했을 때, 프롬프트 엔지니어링은 모델이 생의학 텍스트의 독특한 언어에 훨씬 더 잘 적응하도록 돕습니다. 게다가 대형 언어 모델(LLM)을 활용하면 까다로운 의미론적·문법적 세부사항을 포착해 NER 성능을 크게 향상시킵니다. 이 결과들은 생의학 텍스트 마이닝에서 소샷 및 제로샷 학습의 효능을 입증하며, 더 나은 자동화된 임상 데이터 분석과 더 똑똑한 의사결정 지원 시스템의 길을 열었습니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

생의학 문헌, 전자 건강 기록(EHR), 임상 시험 데이터의 폭발적인 증가는 스마트하고 견고한 생의학 명칭 기관 인식(BioNER) 시스템이 정말로 필요합니다. BioNER은 비구조화된 생의학 텍스트1에서 질병, 유전자, 단백질, 약물, 화학물질과 같은 존재를 식별하는 것을 목표로 하는 자연어 처리(NLP) 분야의 전문 과제입니다. 이런 존재들을 정확히 구별하는 능력은 생의학 지식을 채굴하거나, 신약 개발, 임상 의사 의사 결정 지원, 연구 논문 더미를 자동으로 분류하는 등 여러 다른 용도에서 매우중요합니다.

BioBERT, ClinicalBERT, BlueBERT와 같은 딥러닝 기반 모델에서 상당한 진전이 이루어졌음에도 불구하고, 대부분의 기존의 감독형 생의학 이름 엔터티 인식(BioNER) 접근법은 여전히 대규모 주석 데이터셋에 크게 의존하고 있습니다. 광범위한 라벨링 데이터에 대한 이러한 강한 의존은 새롭거나 이전에 못한 생의학 텍스트에 적용할 때 일반화 능력을 제한합니다. 고전적인 BioNER 모델은 미세 조정을 위해 엄청난 주석이 달린 데이터가 필요해서, 희귀질환, 약물유전체학, 영어 외 언어로 출판된 생의학 연구 등 데이터가 부족한 분야에서는 정말 골칫거리가 됩니다. 게다가 이 생의학 텍스트를 수동으로 태그하는 것은 느리고 비용이 많이 들며, 보통 현장 전문가가 필요합니다. 그래서 소수 및 제로샷 BioNER 모델 개발이 매우 중요합니다: 라벨링 데이터의 필요성을 크게 줄이면서 모델이 다양한 생의학 콘텐츠에서 잘 작동하도록 할 수 있기 때문입니다.

프루샷 학습(FSL)은 전체 학습 데이터셋의 1%에서 10% 사이의 라벨링 데이터만으로도 경쟁력 있는 엔터티 인식 성능을 달성할 수 있게 해주며, 특히 저자원 생의학 분야에 매우유용합니다. 제로샷 러닝(ZSL)은 한 걸음 더 나아가, 모델이 이전에 본 적 없는 개체를 인식할 수 있게 해줍니다. 이는 대규모 사전 학습 언어 모델(LLM)의 힘을 활용해 추가적인 학습 데이터 없이도 가능합니다. 최근 GPT-4, LLaMA, Falcon과 같은 LLM의 발전은 일반 NER 작업에서 강력한 제로샷 성능을 보여주었지만, 실제 생의학 교재에서의 활용은 여전히 미지의 영역입니다. 그 이유는 생의학 분야의 언어가 너무 전문적이고 복잡하기때문입니다.

이 연구는 BioBERT 미세 조정, 소샷 학습, 제로 샷 LLM 추론, 그리고 프롬프트 기반 학습을 결합하여 저자원 생의학 환경에서 BioNER의 기준을 높이는 것을 목표로 합니다.

이미 나와 있는 내용을 설명하자면: (1) BioBERT는 PubMed 초록과 전체 텍스트 기사로 재학습된 BERT 버전으로, 생의학 콘텐츠에 더 적합하다10. (2) ClinicalBERT는 EHR을 기반으로 훈련된 BERT 변형으로, 임상 기록과 의사 보고서를 이해하도록 특별히 조정되어 있습니다11. (3) BlueBERT는 PubMed와 MIMIC-III 데이터셋 모두에서 학습된 또 다른 생의학 NLP 모델로, 텍스트12에서 의료 관련 내용을 인식하도록 최적화되어 있습니다. (4) PubMedBERT는 PubMed 데이터만을 기반으로 학습된 트랜스포머 모델로, 생의학 글쓰기에서 발견되는 독특한 패턴과 용어를 효과적으로 포착할 수 있게 도와줍니다.

이 모델들은 BioNER 벤치마크에서 최첨단 성능을 보이지만, 대규모 라벨링 데이터셋과 감독 하에 따른 미세 조정에 의존하기 때문에 새로운 생의학 영역에 대한 적응성이 제한됩니다. 더불어, 과학적 생의학 문헌(예: PubMed 초록)과 임상 노트(예: i2b2 2010 데이터셋) 간의 도메인 이동은 감독 기반 BioNER 시스템의 성능을 더욱 저하시킵니다15.

현재 BioNER 연구의 주요 한계는 다음과 같습니다: 주석 데이터 의존성: 기존 트랜스포머 기반 모델은 광범위한 라벨링 데이터셋이 필요하며, 이는 전문 생의학 영역에서는 드물다16. 보이지 않는 개체에 대한 일반화 부족: 현재 모델은 훈련 데이터에 없는 희귀하거나 새로운 생의학 용어를 인식하는 데 어려움을 겪고 있습니다17. 퓨샷 및 제로샷 학습에 대한 제한적 탐구: 대부분의 연구는 완전 지도 학습에 초점을 맞추며, BioNER18의 저데이터 패러다임에 대한 조사는 최소한입니다. LLM의 비효율적인 적응: GPT-4와 LLaMA와 같은 LLM은 일반 NLP에서 강력한 제로샷 성능을 보이지만, 용어적 복잡성과 도메인별 프롬프트 부족으로 인해 생의학 NER에 대한 적용은 아직 탐구되지 않았습니다19.

이러한 격차를 해소하기 위해 본 연구는 다음과 같은 핵심 연구 질문을 탐구합니다: 적은 표지된 데이터로 소수 샷 학습이 어떻게 BioBERT의 생의학 NER적 성능을 향상시킬 수 있을까요? LLM을 이용한 제로 샷 추론이 도메인별 미세 조정 없이도 생의학 실체를 정확히 인식할 수 있을까요? 프롬프트 기반 학습이 생의학 NER 과제에서 제로샷 성능을 어떻게 향상시킬 수 있을까요? BioBERT와 LLM이 생성한 의사 라벨을 결합한 최적의 하이브리드 접근법은 무엇인가, 저자원 환경에서 BioNER을 개선하는 데 있을까요? 적대적 훈련이 소수 및 제로 샷 BioNER 모델의 견고성에 어떤 영향을 미치나요?

이 연구의 목적은 적은 표지된 데이터의 부족으로 인한 문제를 해결하기 위해 소샷 및 제로 샷 학습을 활용하는 새롭고 적응형 생의학 NER 프레임워크를 개발하는 것입니다. 이 연구는 즉시 공학 기법, 대조 학습, 대립 훈련을 탐구함으로써 BioBERT와 LLM의 일반화 능력을 향상시키는 것을 목표로 합니다.

연구는 다음과 같은 목표를 중심으로 구성됩니다: (1) 제한된 주석 데이터를 기반으로 BioBERT를 미세 조정하여 생의학 NER용 몇 번의 학습 파이프라인을 개발합니다. (2) 도메인 특화 프롬프트 엔지니어링을 사용하여 생의학 NER용 제로 샷 LLM(예: GPT-4, LLaMA, Falcon) 평가. (3) BioBERT 미세 조정과 LLM이 생성한 의사 라벨을 통합하여 저자원 생의학 데이터셋에서 엔터티 인식을 향상시키는 하이브리드 접근법 창출. (4) 소수 발사와 표준 생의학 벤치마크를 이용한 제로샷 학습(MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) 잡음이 많은 생의학 텍스트 변형에 대한 모델의 견고성을 높이기 위해 대립 훈련(FGSM, PGD) 구현.

본 연구는 생의학 NLP 및 엔터티 인식 분야에 기여하며, 적음례 및 제로샷 BioNER 전략을 도입하여 생의학 데이터셋의 라벨 희소성 문제를 해결하고, 최적화된 프롬프트 엔지니어링 을 통해 제로 샷 생의학 NER에 LLM을 활용하는 방법을 시연합니다. BioBERT 미세 조정과 LLM이 생성한 합성 주석을 결합한 하이브리드 프레임워크를 제안하여 더 나은 일반화를 제공합니다. 도메인 이동에 대한 견고성을 향상시키기 위한 대립적 훈련이 BioNER 모델에 미치는 영향 평가. 감독 하에 있는, 소수 샷, 제로 샷 패러다임 전반에 걸쳐 BioNER 성능 비교 벤치마크를 제공합니다.

문헌 조사
Sivarajkumar와Wang 20 은 임상 NLP용 제로샷 학습(ZSL) 프레임워크인 HealthPrompt를 개발하여 주석이 달린 임상 데이터셋 부족을 해결했습니다. 사전 학습 언어 모델(PLM)을 미세 조정하는 대신, 구조화된 템플릿을 사용해 작업 정의를 조정하는 프롬프트 기반 학습을 사용했습니다. BioBERT와 ClinicalBERT를 포함한 6개의 PLM을 MIMIC-III 데이터셋에서 평가한 결과, ClinicalBERT가 임상 텍스트 분류에서 가장 높은 정확도(85%)와 F1 점수(86%)를 달성했습니다. 이 연구는 프롬프트 기반 제로샷 학습(ZSL)이 임상 자연어 처리(NLP)에서 지도 모델과 훈련 데이터 없이도 보조할 수 있음을 보여줍니다.

Keming Lu와21 팀은 생의학 분야를 위한 구별 언어 모델(DLM)을 프롬프트 기반 지속적 사전 학습 을 통해 미세 조정하는 새로운 접근법인 BIODLM을 개발했습니다. 그들의 주요 목표는 영리한 프롬프트 튜닝과 대체 토큰 탐지(RTD) 방법을 활용하여 생의학에서 소수 샷과 제로 샷 모두에서 성능을 향상시키는 것이었습니다. 이를 위해 어휘를 변형하고, 일부러 도메인별 용어를 섞어 사용하며, 사전 학습 과정에서 PubMedBERT를 생성기로 사용합니다. 결과는 견고합니다: BIODLM은 일반적인 CLS 기반 미세 조정을 능가하며, 전면 감독 시 매크로 평균 정확도 50.2%, 제로 샷 모드에서는 43.4%를 기록했습니다.

Zonghai Yao와 동료22 는 맥락 변동을 고려한 프롬프트 생성에 초점을 맞춘 다른 접근법을 취했습니다. 그들의 목표는 프롬프트 기반 탐색 과정에서 발생할 수 있는 이상한 편향을 줄이고 BioLAMA 평가를 보다 투명하고 해석 가능하게 만드는 것이었습니다. 즉, 이 언어 모델들이 단순히 교묘하게 표현된 질문만 파악하지 않고 의미 있는 답변을 제공하도록 노력하는 것입니다.

그들은 전통적인 Top-k 정확도 대신 순위 변경 기반 평가 지표(UCM: 이해–혼란–오해)를 도입하여 생의학 엔티티 인식에 대한 PLM을 평가했습니다. BioBERT, ClinicalBERT, RoBERTa 기반 모델을 포함한 12개의 PLM에 대한 실험은 대N-M 관계와 희귀 생의학 실체에서 BioLAMA 성능이 향상되었음을 보여주었습니다. BioBERT는 40.7%의 Accuracy@1과 32.8%의 UCM 이해도를 달성하여 전통적인 Top-k 지표를 능가했습니다.

Yeh 등.23 은 ChemProt 데이터셋을 활용해 생의학 관계 추출을 위한 프롬프팅을 연구하여 도메인별 소수 샷 및 전체 데이터 미세 조정을 강화하였습니다. 그들은 빈도, 구체성, 유사성 등 점수 지표를 통합한 프롬프트 기반 템플릿을 설계하여 라벨 단어 선택을 최적화했습니다. BioMed-RoBERTa-base를 사용한 이 방법은 90.09의 F1 점수를 달성했으며, 이는 SciFive-Large보다 1.14 F1 앞서고 일반 미세 조정보다 14.21 F1 더 우수한 성과를 냈습니다. 이는 프롬프트 기반 학습이 적은 교육 예제로 생의학 NER 성과를 향상시킨다는 것을 확인시켜 줍니다.

Susanti와 Holsmoelle 24 는 NLP 기반 인과 그래프 검증을 연구하며, 미세 조정된 언어 모델과 프롬프트 기반 LLM을 비교했습니다. 그들은 BioBERT와 GPT 모델을 교육하여 감독 인과 관계 분류를 수행했고, 제로샷 및 소샷 프롬프트 기반 LLM을 평가했습니다. 생의학 및 오픈 도메인 데이터셋 결과는 미세 조정 모델이 LLM 프롬프트보다 더 뛰어난 성능을 보여 최대 20.5% 더 높은 F1 점수를 달성했습니다. 이 연구는 인과 관계 추출의 정확도를 높이기 위해 고급 프롬프트 및 데이터셋별 튜닝의 필요성을 강조합니다.

Chen 등은 소수 샷 BioNER에 대한 지식 기반 인스턴스 생성 및 prompt-contrastive learning 프레임워크를 제안했습니다 . 이들의 접근법은 도메인 지식 그래프를 활용해 다양한 생의학 실체를 생성하고, 질문-질문 기반 대조 학습을 활용하여 쿼리-답변 쌍 간의 상호 정보를 측정하여 엔터티 인식을 향상시킵니다. fbenchmark 데이터셋(NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE)에서 평가된 결과, 20회 발사 시나리오에서 최첨단 모델에 비해 최대 7.1%의 F1 점수 향상을 달성했습니다. 그들의 코드는 다음 https://github.com/cpmss521/KGPC 에서 공개되어 있습니다.

Chen 등은 또한 텍스트분류를 마스크드 언어 모델링(MLM) 과제로 전환하여 생의학적 청구 탐지를 위한 즉흥 학습 접근법을 제안했습니다. BERT, RoBERTa, T5를 하드 템플릿과 혼합 템플릿으로 사용하여 청구 예측 정확도를 향상시켰습니다. BioClaim 데이터셋에서 혼합 템플릿을 사용한 T5 모델은 이전 모델에 비해 5.3%의 F1 점수 향상을 달성했으며, 마스크 토큰 예측을 사용한 PLM의 사전 학습과 미세 조정 간의 격차를 해소했습니다.

Ryan Shea Ying Cong Tan 등은 트랜스포머 모델, Bi-LSTM, CNN, 고전 ML을 사용하여 방사선 보고서에서 암 질환 반응 추론을 위한 LLM을 평가했습니다. 이들의 방법에는 데이터 증강(문장 순열과 일관성 손실)과 프롬프트 기반의 미세 조정이 포함되었습니다. GatorTron 변압기는 테스트 세트에서 0.8916, 증강 후 0.8976의 정확도를 기록했습니다. 프롬프트 기반의 미세 조정은 500개 라벨이 붙은 보고서로도 효과적인 성능을 가능하게 했습니다.

Hu 등은 임상 NER을 위해 GPT-3.5와 GPT-4를 평가했으며 , 기본 프롬프트, 가이드라인 기반 프롬프트, 오류 기반 지시, 소수 샷 샘플의 4단계 프롬프트 프레임워크 를 통해 성능을 향상시켰습니다. MTSamples와 VAERS 데이터셋에서 GPT-3.5와 GPT-4는 각각 0.634/0.804와 0.301/0.593에서 0.794/0.861과 0.676/0.736으로 개선했습니다. 아직 BioClinicalBERT(F1: MTSamples 0.901, VAERS 0.802)에 뒤처져 있지만, 이 결과들은 적절한 프롬팅 전략을 통해 임상 NER에서 LLM의 효과가 증가하고 있음을 보여줍니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 절차

  1. 데이터 전처리 및 모델 미세 조정
    데이터는 PubMed, BioASQ, MedQA, MMLU에서 텍스트 정규화, 토큰화(WordPiece/BPE), 스톱워드 제거, IOB 주석을 통해 사전 처리되었습니다. 마스크드 언어 모델링(MLM)과 토큰 분류 헤드를 사용하여 BioBERT의 도메인별 미세 조정을 수행했습니다. LoRA와 같은 어댑터 기반 방법과 비교하면
  2. 프롬프트 기반 프루샷 및 제로 샷 학습 구현
    제로 샷 학습을 위해: 자연어 프롬프트(예: "다음 텍스트에서 생의학적 실체를 추출하라: [입력 문장])를 사용한 LLM(GPT-4, GPT-3.5, T5). 식별해야 할 대상은 질병, 약물, 유전자, 화학물질입니다. 각 기관과 그 유형을 나열하세요.") 그리고 명령어 튜닝. 엔터티 유형별로 5–20개의 라벨이 붙은 예제를 패턴 익스플로이팅 훈련(PET)과 접두사 조정으로 사용했습니다.
  3. LLM 통합 및 하이브리드 프레임워크 구축
    맥락 내베딩, 융합 및 다단계 NER 예측(BioBERT 탐지 + GPT-4 정제)이 수행되었습니다. 이 프레임워크는 2단계 순차적 미세 조정 방식을 사용하여 계산 복잡도를 관리했습니다(종단 투 엔드가 아님). 먼저, BioBERT는 사용 가능한 소수 발사 데이터를 바탕으로 미세 조정되었습니다. 둘째, 이 동결된 BioBERT 모델은 동일한 데이터를 기반으로 학습된 융합 계층 을 통해 LLM 구성 요소와 통합되었습니다. 따라서 2단계 미세 조정 전략을 사용하여 통합되었습니다:
    1단계 – NER을 위한 감독 하에 BioBERT 미세 조정.
    2단계 – GPT-4 출력 을 통한 프롬프트 기반 적응.
    figure-protocol-1
    여기서 α는 학습된 계수이고, Wp는 투영 행렬이다.
    가중 집단 투표(WBioBERT=0.45, WGPT4=0.35, WClinicalBERT=0.20)가 합병 예측에 적용되었습니다.
    각 모델의 가중치(W_BioBERT=0.45, W_Hybrid=0.35, W_ClinicalBERT=0.20)는 격자 탐색을 이용한 검증 세트에서 마이크로 F1 점수를 극대화하기 위해 최적화되었습니다. 이 가중치 체계는 각 모델의 상대적 기여도를 반영합니다: 미세 조정된 BioBERT는 가장 강한 도메인 특이적 신호를 제공하고, 하이브리드 모델은 일반화를 추가하며, ClinicalBERT는 보완적인 임상 맥락을 제공합니다.
  4. 정제와 온톨로지 링크 적용
    GPT-4는 온톨로지 유도 정제에 사용되었으며, 온톨로지 임베딩과의 코사인 유사도가 ≥ 0.8일 때 수정을 수용했습니다(> 0.8 보정만 이미 언급됨). 이 엔터티들은 동의어 해석을 위해 UMLS, MeSH, HPO 데이터베이스와 연동되었습니다.
  5. 최적화된 추론으로 시스템 배포
    적응적 신뢰 임계값은 엔티티 클래스별로 구현되었습니다: TC = μC + βσC (β=0.5).
    추론 파이프라인의 핵심 요소 중 하나는 적응적 신뢰 임계값으로, 이는 엔터티 유형 간에 정밀도와 회상성을 동적으로 균형 있게 조정합니다. 정적 임계값을 사용하는 대신, 적응 메커니즘은 예측의 경험적 신뢰분포를 기반으로 클래스별 임계값 TC를 계산했습니다:
    figure-protocol-2
    여기서 μC 와 σC 는 C군 단위의 신뢰 점수 평균과 표준편차를 나타내며, β는 경험적으로 0.5로 설정된 조정 가능한 스케일링 계수입니다. 드문 생의학 기관 유형(예: 희귀질환)은 신뢰 점수에서 높은 분산을 보이는 경향이 있습니다. 적응 임계값은 σC가 클 때 이러한 값들이 유지되도록 보장하여 희귀 개체의 과도한 필터링을 방지했습니다. 반대로 빈번한 개체의 경우, 임계값은 오탐을 줄이기 위해 더 강화됩니다.
    이 시스템은 Flask 기반 인터페이스와 다중 GPU 처리(PyTorch DDP)와 실시간 추론을 위한 8비트 양자화를 사용하여 배포되었습니다.

2. 환경 설정

  1. 데이터셋
    이 프레임워크는 공정한 비교를 위해 표준 생의학 NER 데이터셋에서 테스트되었습니다. 다음 데이터셋이 사용되었으며, 공식 분할 데이터는 보존되어 있습니다.
    BC5CDR: 화학 및 질병 기관 인정을 위해.
    NCBI 질병: 질병 언급에 집중합니다.
    i2b2 2010: 전자 건강 기록(EHR)에서 임상 개념 인식을 위해.
  2. 평가
    통계적 견고성을 보장하기 위해, 우리는 각 몇 번의 샷 실험(K=5,10,15)마다 서로 다른 무작위 시드를 사용하여 데이터 샘플링과 가중치 초기화를 위해 5번의 독립 실행을 수행했습니다. 정확도, 리콜, F1 점수가 이 주행 전반에 걸쳐 보고되었습니다. 제로 샷 결과는 결정론적이었기 때문에 단일 런에서 보고되었습니다.
    제안된 퓨샷 및 제로샷 생의학 NER 시스템을 실시간 생의학 환경에서 배치하는 타당성을 평가하기 위해, 상세한 계산 효율성 및 자원 프로파일링 분석이 수행되었습니다. 프로파일링은 CUDA 12.1과 PyTorch 2.3.1이 탑재된 NVIDIA A100 GPU(40GB VRAM)에서 속도와 메모리 효율을 균형 있게 맞추기 위해 혼합정밀도(FP16) 추론을 사용했습니다.
  3. 기본 모델
    BioBERT (미세 조정): BioBERT-v1.1 기본 모델10은 각 벤치마크의 전체 학습 데이터에 대해 완전 감독 방식으로 미세 조정되었습니다.
    ClinicalBERT 및 RoBERTa 기반: 도메인 특이적 및 일반 도메인 기준선으로 미세 조정됨.
    GPT-3.5 및 GPT-4 (제로샷): 3.3단계에서 설명한 대로 테스트되었으며, 작업별 미세 조정 없이 진행되었습니다.
    HealthPrompt20: 현재 최첨단 프롬프트 기반 임상 제로샷 NER 모델입니다.
    완전한 재현성을 위해 본 연구에서 사용된 핵심 소프트웨어 라이브러리, 모델 체크포인트 및 하드웨어 세부 사항은 재료표에 나열되어 있습니다. 여기에는 BioBERT 모델 변형, LLM, 딥러닝 프레임워크, 계산 환경과 같은 핵심 구성 요소의 특정 버전이 포함됩니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Few-Shot 및 Zero-Shot 생의학 명명 엔터티 인식(NER) 모델의 평가는 PubMed 초록, 임상 노트, 생의학 질문 답변 말뭉치에서 파생된 다양한 생의학 데이터셋을 기반으로 수행되었습니다. BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5, GPT-4 등 기존 모델과 비교 성능 분석을 수행하였습니다. 제안된 모델은 전체 정확도 89.8%, 정확도 88.7%, 리콜율 90.5%, F1 점수 0.895를 달성했습니다. 이 성능은 ClinicalBERT(85.0% 정확도, 0.86 F1)와 GPT-4(86.1% 정확도, 0.86 F1)에 비해 크게 향상된 수치로, 주로 프롬프트 기반 학습과 온톨로지 기반 엔터티 링크의 결합 덕분으로, 모델이 새로운 생의학 엔터티를 처리할 수 있는 능력을 향상시켰기 때문입니다.

이 모델은 저데...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

상충되는 결과, 예상치 못한 발견, 그리고 다른 연구들과의 불균형
제안된 모델의 우수한 성능에도 불구하고, 기존 연구와 비교할 때 상반된 결과가 나타났습니다. BioBERT 기반 모델은 전통적으로 생의학 명명 엔터티 인식(NER)에서 강력한 성능을 보여왔으며, 이는 이전 설문조사 및 생의학 NER 시스템의 비교 연구에서 보고되었습니다 4,10. 트랜스포머 기반 아키텍처가 의료 NLP작업 3,12에서 꾸준히 높은 정확도를 달성하는 반면, 프롬프트 기반 학습과 대형 언어 모델(LLM)을 통합하는 것은 최근에 소수 발사적 생의학 학습을 향상시키는 것으로 나타났습니다. 본 연구에서는 프롬프트 기반 통합이 더 높은 회상력을 가져왔으나,...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 공개할 것이 없습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
핵심 모델BioBERT-base (v1.1)포옹하는 얼굴:  모노로그/바이오버트-v1.1
딥러닝 프레임워크파이토치 2.3.1https://pytorch.org/
GPU 하드웨어NVIDIA A100 (40GB VRAM)엔비디아
대형 언어 모델(LLM)GPT-4OpenAI API
운영 체제창문마이크로소프트
매개변수 효율 튜닝LoRA (PEFT 라이브러리 0.6.2 제공)https://github.com/huggingface/peft
프로그래밍 언어파이썬 3.9.18파이썬 소프트웨어 재단
제로 샷 베이스라인 LLMGPT-3.5-터보OpenAI API

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, P., Wang, J., Luo, L., Lin, H., Yang, Z. Learning to explain is a good biomedical few-shot learner. Bioinformatics. 40 (10), 589(2024).
  2. Moscato, V., Postiglione, M., Sperlí, G. Few-shot named entity recognition: definition, taxonomy and research directions. ACM Trans Intell Syst Technol. 14 (5), 1-46 (2023).
  3. Nerella, S., et al. Transformers in healthcare: A survey. arXiv. , (2023).
  4. Song, B., Li, F., Liu, Y., Zeng, X. Deep learning methods for biomedical named entity recognition: A survey and qualitative comparison. Briefings Bioinform. 22 (6), bbab282(2021).
  5. Badawi, M., Abushanab, M., Bhat, S., Maier, A. Review of zero-shot and few-shot AI algorithms in the medical domain. arXiv. , (2024).
  6. Jin, M., Sang-Min, C., Gun-Woo, K. Comcare: A collaborative ensemble framework for context-aware medical named entity recognition and relation extraction. Electronics Basel. 14 (2), 328(2025).
  7. Ge, Y., Guo, Y., Das, S., Al-Garadi, M. A., Sarker, A. Few-shot learning for medical text: a review of advances, trends, and opportunities. J Biomed Inform. 144, 104458(2023).
  8. Picco, G., et al. Description boosting for zero-shot entity and relation classification. arXiv. , (2024).
  9. Khan, W., et al. A comprehensive survey of foundation models in medicine. IEEE Rev Biomed Eng. 18, 1-25 (2025).
  10. Ngo, Q. H., Kechadi, T., Le-Khac, N. A. Domain specific entity recognition with semantic-based deep learning approach. IEEE Access. 9, 152892-152902 (2021).
  11. Li, M., Zhang, R. How far is language model from 100% few-shot named entity recognition in medical domain. arXiv. , (2023).
  12. Nerella, S., et al. Transformers and large language models in healthcare: A review. Artif Intell Med. 148, 102900(2024).
  13. Rodríguez, H. Natural language technologies in the biomedical domain. Governing Asia. 93, 1-15 (2022).
  14. Mobasher, G. Welt: Weighted loss trainer for biomedical joint entity and relation extraction. [PhD thesis]. , https://www.mathinf.uni-heidelberg.de/en/thesis-defenses/welt-weighted-loss-trainer-for-biomedical-joint-entity-and-relation-extraction-2025-01-23 (2025).
  15. Giorgi, J. A study on the application of natural language processing methods to scientific text. [PhD thesis]. , University of Toronto. Canada. https://utoronto.scholaris.ca/items/0b02984d-5b6f-4287-9461-5afde0ec6c4e (2024).
  16. Amin, S. Learning entity and relation representation for low-resource medical language processing. [PhD thesis]. , https://publikationen.sulb.uni-saarland.de/bitstream/20.500.11880/38051/1/PhD_final_Amin.pdf (2024).
  17. Almudaifer, A. I. Entity information extraction and normalization from scientific and clinical texts. [PhD thesis]. , https://digitalcommons.library.uab.edu/etd-collection/3906/ (2024).
  18. One-shot biomedical named entity recognition via knowledge-inspired large language model. Bian, J., Zheng, J., Zhang, Y., Zhou, H., Zhu, S. Proc ACM Int Conf Bioinform Comput Biol Health Inform, , 1-10 (2024).
  19. Alotaibi, A., Nadeem, F., Hamdy, M. Weakly supervised deep learning for Arabic tweet sentiment analysis on education reforms: leveraging pre-trained models and LLMs with Snorkel. IEEE Access. 13, 1-15 (2025).
  20. Sivarajkumar, S., Wang, Y. HealthPrompt: A zero-shot learning paradigm for clinical natural language processing. AMIA Annu Symp Proc. , 972-981 (2023).
  21. Prompt discriminative language models for domain adaptation. Lu, K., et al. Proc Clin Nat Lang Process Workshop, , 247-258 (2023).
  22. Yao, Z., Cao, Y., Yang, Z., Yu, H. Context variance evaluation of pretrained language models for prompt-based biomedical knowledge probing. AMIA Jt Summits Transl Sci Proc. 2023, 592-601 (2023).
  23. Yeh, H. S., Lavergne, T., Zweigenbaum, P. Decorate the examples: a simple method of prompt design for biomedical relation extraction. arXiv. , (2022).
  24. Susanti, Y., Holsmoelle, N. Prompt-based vs fine-tuned LLMs toward causal graph verification. arXiv. , (2024).
  25. Chen, P., Wang, J., Lin, H., Zhao, D., Yang, Z. Few-shot biomedical named entity recognition via knowledge-guided instance generation and prompt contrastive learning. Bioinformatics. 39 (8), 496-504 (2023).
  26. Improving biomedical claim detection using prompt learning approaches. Chen, T., Stefanidis, A., Jiang, Z., Su, J. IEEE Int Conf Pattern Recognit Mach Learn, , 369-376 (2023).
  27. Tan, R. S. Y. C., et al. Inferring cancer disease response from radiology reports using large language models with data augmentation and prompting. J Am Med Inform Assoc. 30 (10), 1657-1664 (2023).
  28. Hu, Y., et al. Improving large language models for clinical named entity recognition via prompt engineering. J Am Med Inform Assoc. 31 (9), 1812-1820 (2024).
  29. Yang, J., et al. Enhancing phenotype recognition in clinical notes using large language models: PhenoBCBERT and PhenoGPT. Patterns NY. 5 (1), 100891(2024).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

관련 논문