이 글은 BioBERT, 프롬프트 기반 학습, 그리고 저자원 시나리오를 위한 대형 언어 모델을 활용한 생의학 이름 엔터티 인식 프로토콜을 제시합니다.
연구 논문
이 글은 BioBERT, 프롬프트 기반 학습, 그리고 저자원 시나리오를 위한 대형 언어 모델을 활용한 생의학 이름 엔터티 인식 프로토콜을 제시합니다.
생의학 명명 엔터티 인식(NER)은 임상 텍스트와 생의학 문헌에서 귀중한 정보를 추출하는 데 중요한 역할을 합니다. BioBERT, ClinicalBERT, RoBERTa를 포함한 전통적인 딥러닝 모델은 NER 작업에서 상당한 개선을 보여주었습니다; 하지만 여전히 자원이 부족한 생의학 용어, 도메인 적응 문제, 보이지 않는 개체의 일반화 등으로 어려움을 겪고 있습니다. 이러한 한계를 해결하기 위해 본 연구는 BioBERT, 프롬프트 기반 학습, 대형 언어 모델(LLM)을 결합한 하이브리드 프레임워크를 도입하여 생의학 NER에서 소샷 및 제로샷 학습 능력을 강화합니다. 제안된 모델은 사전 학습된 트랜스포머에서 얻은 맥락적 지식을 효과적으로 활용하여 광범위한 라벨링 데이터셋에 대한 의존도를 줄이면서도 높은 정확도를 유지합니다. 여러 생의학 벤치마크 데이터셋에 대한 광범위한 실험 평가 후, 제안된 접근법은 일관되게 강력한 성능을 입증했습니다. 구체적으로, 89.8%의 정확도, 88.7%의 정밀도, 90.5%의 기억 발생률, 그리고 0.895의 F1 점수를 달성하여 기본 방법을 능가하며 생의학 텍스트 마이닝 작업에 효과적임을 입증했습니다. 다른 방법과 비교했을 때, 프롬프트 엔지니어링은 모델이 생의학 텍스트의 독특한 언어에 훨씬 더 잘 적응하도록 돕습니다. 게다가 대형 언어 모델(LLM)을 활용하면 까다로운 의미론적·문법적 세부사항을 포착해 NER 성능을 크게 향상시킵니다. 이 결과들은 생의학 텍스트 마이닝에서 소샷 및 제로샷 학습의 효능을 입증하며, 더 나은 자동화된 임상 데이터 분석과 더 똑똑한 의사결정 지원 시스템의 길을 열었습니다.
생의학 문헌, 전자 건강 기록(EHR), 임상 시험 데이터의 폭발적인 증가는 스마트하고 견고한 생의학 명칭 기관 인식(BioNER) 시스템이 정말로 필요합니다. BioNER은 비구조화된 생의학 텍스트1에서 질병, 유전자, 단백질, 약물, 화학물질과 같은 존재를 식별하는 것을 목표로 하는 자연어 처리(NLP) 분야의 전문 과제입니다. 이런 존재들을 정확히 구별하는 능력은 생의학 지식을 채굴하거나, 신약 개발, 임상 의사 의사 결정 지원, 연구 논문 더미를 자동으로 분류하는 등 여러 다른 용도에서 매우중요합니다.
BioBERT, ClinicalBERT, BlueBERT와 같은 딥러닝 기반 모델에서 상당한 진전이 이루어졌음에도 불구하고, 대부분의 기존의 감독형 생의학 이름 엔터티 인식(BioNER) 접근법은 여전히 대규모 주석 데이터셋에 크게 의존하고 있습니다. 광범위한 라벨링 데이터에 대한 이러한 강한 의존은 새롭거나 이전에 못한 생의학 텍스트에 적용할 때 일반화 능력을 제한합니다. 고전적인 BioNER 모델은 미세 조정을 위해 엄청난 주석이 달린 데이터가 필요해서, 희귀질환, 약물유전체학, 영어 외 언어로 출판된 생의학 연구 등 데이터가 부족한 분야에서는 정말 골칫거리가 됩니다. 게다가 이 생의학 텍스트를 수동으로 태그하는 것은 느리고 비용이 많이 들며, 보통 현장 전문가가 필요합니다. 그래서 소수 및 제로샷 BioNER 모델 개발이 매우 중요합니다: 라벨링 데이터의 필요성을 크게 줄이면서 모델이 다양한 생의학 콘텐츠에서 잘 작동하도록 할 수 있기 때문입니다.
프루샷 학습(FSL)은 전체 학습 데이터셋의 1%에서 10% 사이의 라벨링 데이터만으로도 경쟁력 있는 엔터티 인식 성능을 달성할 수 있게 해주며, 특히 저자원 생의학 분야에 매우유용합니다. 제로샷 러닝(ZSL)은 한 걸음 더 나아가, 모델이 이전에 본 적 없는 개체를 인식할 수 있게 해줍니다. 이는 대규모 사전 학습 언어 모델(LLM)의 힘을 활용해 추가적인 학습 데이터 없이도 가능합니다. 최근 GPT-4, LLaMA, Falcon과 같은 LLM의 발전은 일반 NER 작업에서 강력한 제로샷 성능을 보여주었지만, 실제 생의학 교재에서의 활용은 여전히 미지의 영역입니다. 그 이유는 생의학 분야의 언어가 너무 전문적이고 복잡하기때문입니다.
이 연구는 BioBERT 미세 조정, 소샷 학습, 제로 샷 LLM 추론, 그리고 프롬프트 기반 학습을 결합하여 저자원 생의학 환경에서 BioNER의 기준을 높이는 것을 목표로 합니다.
이미 나와 있는 내용을 설명하자면: (1) BioBERT는 PubMed 초록과 전체 텍스트 기사로 재학습된 BERT 버전으로, 생의학 콘텐츠에 더 적합하다10. (2) ClinicalBERT는 EHR을 기반으로 훈련된 BERT 변형으로, 임상 기록과 의사 보고서를 이해하도록 특별히 조정되어 있습니다11. (3) BlueBERT는 PubMed와 MIMIC-III 데이터셋 모두에서 학습된 또 다른 생의학 NLP 모델로, 텍스트12에서 의료 관련 내용을 인식하도록 최적화되어 있습니다. (4) PubMedBERT는 PubMed 데이터만을 기반으로 학습된 트랜스포머 모델로, 생의학 글쓰기에서 발견되는 독특한 패턴과 용어를 효과적으로 포착할 수 있게 도와줍니다.
이 모델들은 BioNER 벤치마크에서 최첨단 성능을 보이지만, 대규모 라벨링 데이터셋과 감독 하에 따른 미세 조정에 의존하기 때문에 새로운 생의학 영역에 대한 적응성이 제한됩니다. 더불어, 과학적 생의학 문헌(예: PubMed 초록)과 임상 노트(예: i2b2 2010 데이터셋) 간의 도메인 이동은 감독 기반 BioNER 시스템의 성능을 더욱 저하시킵니다15.
현재 BioNER 연구의 주요 한계는 다음과 같습니다: 주석 데이터 의존성: 기존 트랜스포머 기반 모델은 광범위한 라벨링 데이터셋이 필요하며, 이는 전문 생의학 영역에서는 드물다16. 보이지 않는 개체에 대한 일반화 부족: 현재 모델은 훈련 데이터에 없는 희귀하거나 새로운 생의학 용어를 인식하는 데 어려움을 겪고 있습니다17. 퓨샷 및 제로샷 학습에 대한 제한적 탐구: 대부분의 연구는 완전 지도 학습에 초점을 맞추며, BioNER18의 저데이터 패러다임에 대한 조사는 최소한입니다. LLM의 비효율적인 적응: GPT-4와 LLaMA와 같은 LLM은 일반 NLP에서 강력한 제로샷 성능을 보이지만, 용어적 복잡성과 도메인별 프롬프트 부족으로 인해 생의학 NER에 대한 적용은 아직 탐구되지 않았습니다19.
이러한 격차를 해소하기 위해 본 연구는 다음과 같은 핵심 연구 질문을 탐구합니다: 적은 표지된 데이터로 소수 샷 학습이 어떻게 BioBERT의 생의학 NER적 성능을 향상시킬 수 있을까요? LLM을 이용한 제로 샷 추론이 도메인별 미세 조정 없이도 생의학 실체를 정확히 인식할 수 있을까요? 프롬프트 기반 학습이 생의학 NER 과제에서 제로샷 성능을 어떻게 향상시킬 수 있을까요? BioBERT와 LLM이 생성한 의사 라벨을 결합한 최적의 하이브리드 접근법은 무엇인가, 저자원 환경에서 BioNER을 개선하는 데 있을까요? 적대적 훈련이 소수 및 제로 샷 BioNER 모델의 견고성에 어떤 영향을 미치나요?
이 연구의 목적은 적은 표지된 데이터의 부족으로 인한 문제를 해결하기 위해 소샷 및 제로 샷 학습을 활용하는 새롭고 적응형 생의학 NER 프레임워크를 개발하는 것입니다. 이 연구는 즉시 공학 기법, 대조 학습, 대립 훈련을 탐구함으로써 BioBERT와 LLM의 일반화 능력을 향상시키는 것을 목표로 합니다.
연구는 다음과 같은 목표를 중심으로 구성됩니다: (1) 제한된 주석 데이터를 기반으로 BioBERT를 미세 조정하여 생의학 NER용 몇 번의 학습 파이프라인을 개발합니다. (2) 도메인 특화 프롬프트 엔지니어링을 사용하여 생의학 NER용 제로 샷 LLM(예: GPT-4, LLaMA, Falcon) 평가. (3) BioBERT 미세 조정과 LLM이 생성한 의사 라벨을 통합하여 저자원 생의학 데이터셋에서 엔터티 인식을 향상시키는 하이브리드 접근법 창출. (4) 소수 발사와 표준 생의학 벤치마크를 이용한 제로샷 학습(MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) 잡음이 많은 생의학 텍스트 변형에 대한 모델의 견고성을 높이기 위해 대립 훈련(FGSM, PGD) 구현.
본 연구는 생의학 NLP 및 엔터티 인식 분야에 기여하며, 적음례 및 제로샷 BioNER 전략을 도입하여 생의학 데이터셋의 라벨 희소성 문제를 해결하고, 최적화된 프롬프트 엔지니어링 을 통해 제로 샷 생의학 NER에 LLM을 활용하는 방법을 시연합니다. BioBERT 미세 조정과 LLM이 생성한 합성 주석을 결합한 하이브리드 프레임워크를 제안하여 더 나은 일반화를 제공합니다. 도메인 이동에 대한 견고성을 향상시키기 위한 대립적 훈련이 BioNER 모델에 미치는 영향 평가. 감독 하에 있는, 소수 샷, 제로 샷 패러다임 전반에 걸쳐 BioNER 성능 비교 벤치마크를 제공합니다.
문헌 조사
Sivarajkumar와Wang 20 은 임상 NLP용 제로샷 학습(ZSL) 프레임워크인 HealthPrompt를 개발하여 주석이 달린 임상 데이터셋 부족을 해결했습니다. 사전 학습 언어 모델(PLM)을 미세 조정하는 대신, 구조화된 템플릿을 사용해 작업 정의를 조정하는 프롬프트 기반 학습을 사용했습니다. BioBERT와 ClinicalBERT를 포함한 6개의 PLM을 MIMIC-III 데이터셋에서 평가한 결과, ClinicalBERT가 임상 텍스트 분류에서 가장 높은 정확도(85%)와 F1 점수(86%)를 달성했습니다. 이 연구는 프롬프트 기반 제로샷 학습(ZSL)이 임상 자연어 처리(NLP)에서 지도 모델과 훈련 데이터 없이도 보조할 수 있음을 보여줍니다.
Keming Lu와21 팀은 생의학 분야를 위한 구별 언어 모델(DLM)을 프롬프트 기반 지속적 사전 학습 을 통해 미세 조정하는 새로운 접근법인 BIODLM을 개발했습니다. 그들의 주요 목표는 영리한 프롬프트 튜닝과 대체 토큰 탐지(RTD) 방법을 활용하여 생의학에서 소수 샷과 제로 샷 모두에서 성능을 향상시키는 것이었습니다. 이를 위해 어휘를 변형하고, 일부러 도메인별 용어를 섞어 사용하며, 사전 학습 과정에서 PubMedBERT를 생성기로 사용합니다. 결과는 견고합니다: BIODLM은 일반적인 CLS 기반 미세 조정을 능가하며, 전면 감독 시 매크로 평균 정확도 50.2%, 제로 샷 모드에서는 43.4%를 기록했습니다.
Zonghai Yao와 동료22 는 맥락 변동을 고려한 프롬프트 생성에 초점을 맞춘 다른 접근법을 취했습니다. 그들의 목표는 프롬프트 기반 탐색 과정에서 발생할 수 있는 이상한 편향을 줄이고 BioLAMA 평가를 보다 투명하고 해석 가능하게 만드는 것이었습니다. 즉, 이 언어 모델들이 단순히 교묘하게 표현된 질문만 파악하지 않고 의미 있는 답변을 제공하도록 노력하는 것입니다.
그들은 전통적인 Top-k 정확도 대신 순위 변경 기반 평가 지표(UCM: 이해–혼란–오해)를 도입하여 생의학 엔티티 인식에 대한 PLM을 평가했습니다. BioBERT, ClinicalBERT, RoBERTa 기반 모델을 포함한 12개의 PLM에 대한 실험은 대N-M 관계와 희귀 생의학 실체에서 BioLAMA 성능이 향상되었음을 보여주었습니다. BioBERT는 40.7%의 Accuracy@1과 32.8%의 UCM 이해도를 달성하여 전통적인 Top-k 지표를 능가했습니다.
Yeh 등.23 은 ChemProt 데이터셋을 활용해 생의학 관계 추출을 위한 프롬프팅을 연구하여 도메인별 소수 샷 및 전체 데이터 미세 조정을 강화하였습니다. 그들은 빈도, 구체성, 유사성 등 점수 지표를 통합한 프롬프트 기반 템플릿을 설계하여 라벨 단어 선택을 최적화했습니다. BioMed-RoBERTa-base를 사용한 이 방법은 90.09의 F1 점수를 달성했으며, 이는 SciFive-Large보다 1.14 F1 앞서고 일반 미세 조정보다 14.21 F1 더 우수한 성과를 냈습니다. 이는 프롬프트 기반 학습이 적은 교육 예제로 생의학 NER 성과를 향상시킨다는 것을 확인시켜 줍니다.
Susanti와 Holsmoelle 24 는 NLP 기반 인과 그래프 검증을 연구하며, 미세 조정된 언어 모델과 프롬프트 기반 LLM을 비교했습니다. 그들은 BioBERT와 GPT 모델을 교육하여 감독 인과 관계 분류를 수행했고, 제로샷 및 소샷 프롬프트 기반 LLM을 평가했습니다. 생의학 및 오픈 도메인 데이터셋 결과는 미세 조정 모델이 LLM 프롬프트보다 더 뛰어난 성능을 보여 최대 20.5% 더 높은 F1 점수를 달성했습니다. 이 연구는 인과 관계 추출의 정확도를 높이기 위해 고급 프롬프트 및 데이터셋별 튜닝의 필요성을 강조합니다.
Chen 등은 소수 샷 BioNER에 대한 지식 기반 인스턴스 생성 및 prompt-contrastive learning 프레임워크를 제안했습니다 . 이들의 접근법은 도메인 지식 그래프를 활용해 다양한 생의학 실체를 생성하고, 질문-질문 기반 대조 학습을 활용하여 쿼리-답변 쌍 간의 상호 정보를 측정하여 엔터티 인식을 향상시킵니다. fbenchmark 데이터셋(NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE)에서 평가된 결과, 20회 발사 시나리오에서 최첨단 모델에 비해 최대 7.1%의 F1 점수 향상을 달성했습니다. 그들의 코드는 다음 https://github.com/cpmss521/KGPC 에서 공개되어 있습니다.
Chen 등은 또한 텍스트분류를 마스크드 언어 모델링(MLM) 과제로 전환하여 생의학적 청구 탐지를 위한 즉흥 학습 접근법을 제안했습니다. BERT, RoBERTa, T5를 하드 템플릿과 혼합 템플릿으로 사용하여 청구 예측 정확도를 향상시켰습니다. BioClaim 데이터셋에서 혼합 템플릿을 사용한 T5 모델은 이전 모델에 비해 5.3%의 F1 점수 향상을 달성했으며, 마스크 토큰 예측을 사용한 PLM의 사전 학습과 미세 조정 간의 격차를 해소했습니다.
Ryan Shea Ying Cong Tan 등은 트랜스포머 모델, Bi-LSTM, CNN, 고전 ML을 사용하여 방사선 보고서에서 암 질환 반응 추론을 위한 LLM을 평가했습니다. 이들의 방법에는 데이터 증강(문장 순열과 일관성 손실)과 프롬프트 기반의 미세 조정이 포함되었습니다. GatorTron 변압기는 테스트 세트에서 0.8916, 증강 후 0.8976의 정확도를 기록했습니다. 프롬프트 기반의 미세 조정은 500개 라벨이 붙은 보고서로도 효과적인 성능을 가능하게 했습니다.
Hu 등은 임상 NER을 위해 GPT-3.5와 GPT-4를 평가했으며 , 기본 프롬프트, 가이드라인 기반 프롬프트, 오류 기반 지시, 소수 샷 샘플의 4단계 프롬프트 프레임워크 를 통해 성능을 향상시켰습니다. MTSamples와 VAERS 데이터셋에서 GPT-3.5와 GPT-4는 각각 0.634/0.804와 0.301/0.593에서 0.794/0.861과 0.676/0.736으로 개선했습니다. 아직 BioClinicalBERT(F1: MTSamples 0.901, VAERS 0.802)에 뒤처져 있지만, 이 결과들은 적절한 프롬팅 전략을 통해 임상 NER에서 LLM의 효과가 증가하고 있음을 보여줍니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
1. 절차


2. 환경 설정
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
Few-Shot 및 Zero-Shot 생의학 명명 엔터티 인식(NER) 모델의 평가는 PubMed 초록, 임상 노트, 생의학 질문 답변 말뭉치에서 파생된 다양한 생의학 데이터셋을 기반으로 수행되었습니다. BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5, GPT-4 등 기존 모델과 비교 성능 분석을 수행하였습니다. 제안된 모델은 전체 정확도 89.8%, 정확도 88.7%, 리콜율 90.5%, F1 점수 0.895를 달성했습니다. 이 성능은 ClinicalBERT(85.0% 정확도, 0.86 F1)와 GPT-4(86.1% 정확도, 0.86 F1)에 비해 크게 향상된 수치로, 주로 프롬프트 기반 학습과 온톨로지 기반 엔터티 링크의 결합 덕분으로, 모델이 새로운 생의학 엔터티를 처리할 수 있는 능력을 향상시켰기 때문입니다.
이 모델은 저데...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
상충되는 결과, 예상치 못한 발견, 그리고 다른 연구들과의 불균형
제안된 모델의 우수한 성능에도 불구하고, 기존 연구와 비교할 때 상반된 결과가 나타났습니다. BioBERT 기반 모델은 전통적으로 생의학 명명 엔터티 인식(NER)에서 강력한 성능을 보여왔으며, 이는 이전 설문조사 및 생의학 NER 시스템의 비교 연구에서 보고되었습니다 4,10. 트랜스포머 기반 아키텍처가 의료 NLP작업 3,12에서 꾸준히 높은 정확도를 달성하는 반면, 프롬프트 기반 학습과 대형 언어 모델(LLM)을 통합하는 것은 최근에 소수 발사적 생의학 학습을 향상시키는 것으로 나타났습니다. 본 연구에서는 프롬프트 기반 통합이 더 높은 회상력을 가져왔으나,...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 공개할 것이 없습니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 핵심 모델 | BioBERT-base (v1.1) | 포옹하는 얼굴: 모노로그/바이오버트-v1.1 | |
| 딥러닝 프레임워크 | 파이토치 2.3.1 | https://pytorch.org/ | |
| GPU 하드웨어 | NVIDIA A100 (40GB VRAM) | 엔비디아 | |
| 대형 언어 모델(LLM) | GPT-4 | OpenAI API | |
| 운영 체제 | 창문 | 마이크로소프트 | |
| 매개변수 효율 튜닝 | LoRA (PEFT 라이브러리 0.6.2 제공) | https://github.com/huggingface/peft | |
| 프로그래밍 언어 | 파이썬 3.9.18 | 파이썬 소프트웨어 재단 | |
| 제로 샷 베이스라인 LLM | GPT-3.5-터보 | OpenAI API |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청