本記事では、BioBERT、プロンプトベース学習、低リソースシナリオ向けの大規模言語モデルを用いた生物医学命名エンティティ認識のプロトコルを提示します。
研究記事
本記事では、BioBERT、プロンプトベース学習、低リソースシナリオ向けの大規模言語モデルを用いた生物医学命名エンティティ認識のプロトコルを提示します。
生物医学的命名エンティティ認識(NER)は、臨床文献や生物医学文献から貴重な情報を抽出する上で重要な役割を果たします。BioBERT、ClinicalBERT、RoBERTaなどの従来の深層学習モデルは、NERタスクにおいて大幅な改善を示してきました。しかしながら、彼らは依然として資源の少ない生物医学用語、ドメイン適応の課題、そして見えない存在の一般化に苦労しています。これらの制約に対処するため、本研究ではBioBERT、プロンプトベース学習、大規模言語モデル(LLM)を組み合わせたハイブリッドフレームワークを導入し、生物医学NERにおける少ショットおよびゼロショット学習能力を強化します。提案されたモデルは、事前学習済みトランスフォーマーからの文脈知識を効果的に活用し、広範なラベル付きデータセットへの依存を減らしつつ、高い精度を維持しています。複数の生物医学ベンチマークデータセットにわたる広範な実験評価の結果、提案されたアプローチは一貫して高い性能を示しています。具体的には、89.8%の精度、88.7%の精度、90.5%の想起率、そしてF1スコア0.895を達成し、ベースライン手法を上回る性能を示し、生物医学テキストマイニングタスクにおいてその効果を示しています。他の手法と比べて、プロンプトエンジニアリングはモデルが生物医学テキストの独自の言語にはるかによく適応するのに役立ちます。さらに、大規模言語モデル(LLM)による強化は、難しい意味や文法の細部を拾い上げ、NERのパフォーマンスを大幅に向上させます。これらの発見は、生物医学テキストマイニングにおける少ショット学習およびゼロショット学習の有効性を示し、より自動化された臨床データ分析とよりスマートな意思決定支援システムの道を切り開いています。
生物医学文献、電子カルテ(EHR)、臨床試験データの爆発的な増加には、スマートで堅牢な生物医学命名エンティティ認識(BioNER)システムが必要です。BioNERは、自然言語処理(NLP)における専門的なタスクであり、非構造化生物医学テキスト1において、疾患、遺伝子、タンパク質、薬剤、化学物質などの存在を特定することを目的としています。これらの存在を正確に見分けられることは、生物医学知識の掘り下げ、新薬の発見、医師の臨床判断支援、さらには大量の研究論文を自動的に仕分けすることなど、多くの他の用途において非常に重要です。
BioBERT、ClinicalBERT、BlueBERTなどの深層学習ベースのモデルでは大きな進歩が見られましたが、既存のほとんどの教師あり生体医学命名エンティティ認識(BioNER)手法は依然として大規模な注釈付きデータセットに大きく依存しています。この広範なラベル付きデータへの強い依存は、新規またはこれまでに見られなかった生物医学テキストに適用した場合の一般化能力を制限しています。3.従来のBioNERモデルは微調整のために大量の注釈付きデータが必要で、希少疾患、ファーマリコゲノミクス、英語以外の言語で発表されている生物医学研究など、データが不足している分野では本当に頭痛の種になります。さらに、これらすべての生物医学テキストを手動でタグ付けするのは遅く、費用もかかり、通常はその分野の専門家が必要です5。だからこそ、少ショットおよびゼロショットのBioNERモデルの開発が非常に重要であり、ラベル付きデータの必要性を大幅に減らしつつ、幅広い生物医学コンテンツでモデルが良好に機能することを保証できる6。
フューショット学習(FSL)は、ラベル付きデータのごく一部、通常は全トレーニングデータセットの1%から10%の間でモデルが競争力のあるエンティティ認識性能を達成することを可能にします。これは、資源の少ない生物医学分野に特に価値があります。ゼロショット学習(ZSL)はさらに進み、モデルがこれまで見たことのないエンティティを、大規模な事前学習済み言語モデル(LLM)の力を活用するだけで、追加の訓練データを必要とせずに認識できるようにします。近年、GPT-4、LLaMA、FalconなどのLLMの進歩により、一般的なNERタスクで強力なゼロショット性能が示されていますが、実際の生物医学テキストでの利用はまだほとんど未踏の領域です。それは生物医学の言語が非常に専門的で複雑だからです。
本研究は、BioBERTのファインチューニング、少ショット学習、ゼロショットLLM推論、プロンプトベース学習を統合し、資源の少ない生物医学環境におけるBioNERの基準を引き上げることを目指しています。
既に存在しているもののイメージを挙げると、(1) BioBERTはPubMedの要旨や全文記事に再学習されたバージョンなので、生物医学コンテンツにより適しています。(2) ClinicalBERTはEHRを基盤としたBERTのバリアントであり、臨床ノートや医師の報告書の意味を理解するために特別に調整されています。(3) BlueBERTは別の生物医学NLPモデルで、PubMedとMIMIC-IIIの両方のデータセットで訓練され、テキスト12の医療関連認識に最適化されています。(4) PubMedBERTはPubMedのデータのみで訓練されたトランスフォーマーモデルであり、生物医学ライティング13に見られる独特のパターンや用語をしっかりと捉えるのに役立ちます。
これらのモデルはBioNERベンチマークで最先端の性能を達成していますが、大規模でラベル付きデータセットや教師ありの微調整に依存しているため、新たな生物医学領域への適応性が制限されています14。さらに、科学的生医学文献(例:PubMedの要旨)と臨床ノート(例:i2b2 2010データセット)間のドメインシフトは、監督付きBioNERシステムの性能をさらに低下させます15。
現在のBioNER研究の主な制約は以下の通りです:注釈付きデータへの依存:既存のトランスフォーマーベースのモデルは広範なラベル付きデータセットを必要とし、専門的な生体医学分野では希少です16。見えない存在への一般化の欠如:現在のモデルは、訓練データに存在しない希少または新規の生物医学用語を認識するのに苦労しています17。フーショットおよびゼロショット学習の限定的探求:ほとんどの研究は完全教師あり学習に焦点を当てており、BioNER18の低データパラダイムの調査は最小限です。LLMの非効率的な適応:GPT-4やLLaMAのようなLLMは一般的なNLPで強いゼロショット性能を示しますが、用語の複雑さやドメイン固有のプロンプトの欠如により、生物医学NERへの応用は依然として十分に探求されていません。
これらのギャップを補うため、本研究は以下の主要な研究課題を探ります。最小限のラベル付きデータで、少ショット学習はバイオメディカルNERにおけるBioBERTのパフォーマンスをどのように向上させるのか?LLMを用いたゼロショット推論は、ドメイン特有のファインチューニングなしにバイオメディカルエンティティを正確に認識できるのか?プロンプトベースの学習は、生物医学NERタスクにおけるゼロショットのパフォーマンスをどのように向上させるのでしょうか?BioNERを低資源環境で改善するために、BioBERTとLLM生成の擬似ラベルを組み合わせる最適なハイブリッドアプローチとは何でしょうか?対抗的訓練は、少ショットおよびゼロショットのBioNERモデルの堅牢性にどのような影響を与えるのでしょうか?
本研究の目的は、少数ショットおよびゼロショット学習を活用し、ラベル付きデータの不足という課題に対応する新規かつ適応型の生物医学NERフレームワークを開発することです。本研究は、プロンプト工学技術、対照的学習、対抗的トレーニングを探ることで、BioBERTおよびLLMの一般化能力を高めることを目的としています。
研究は以下の目的を中心に構成されています:(1) 限られた注釈付きデータ上でBioBERTを微調整することで、生物医学NERのための数ショット学習パイプラインを開発すること。(2) ドメイン固有のプロンプトエンジニアリングを用いて、生物医学NER向けのゼロショットLLM(例:GPT-4、LLaMA、Falcon)を評価すること。(3) BioBERTのファインチューニングとLLM生成の擬似ラベルを統合し、低資源の生物医学データセットにおけるエンティティ認識の向上を実現するハイブリッドアプローチの作成。(4) 少ショット と標準的な生物医学ベンチマークを用いたゼロショット学習(MedMentions、BC5CDR、i2b2 2010、PharmaCoNER、BioASQ)。(5) ノイズの多い生物医学テキストのバリエーションに対するモデルの堅牢性を高めるために、対抗的トレーニング(FGSM、PGD)を実装すること。
本研究は、バイオメディカルNLPおよびエンティティ認識の分野に貢献し、バイオメディカルデータセットにおけるラベル不足に対処するために少ショットおよびゼロショットのBioNER戦略を導入し、最適化されたプロンプトエンジニアリング を通じて ゼロショットバイオメディカルNERにLLMを活用する方法を示しました。より良い一般化のために、BioBERTのファインチューニングとLLM生成の合成注釈を組み合わせたハイブリッドフレームワークを提案します。ドメインシフトに対する堅牢性向上のための敵対的訓練がBioNERモデルに与える影響の評価。監督付き、少ショット、ゼロショットの各パラダイムにおけるBioNER性能の比較ベンチマークを提供します。
文献調査
SivarajkumarとWang20 は、注釈付き臨床データセットの不足に対応するゼロショット学習(ZSL)フレームワーク「HealthPrompt」を開発しました。事前学習済み言語モデル(PLM)を微調整する代わりに、構造化されたテンプレートを使ってタスク定義を調整するプロンプトベースの学習を採用しました。MIMIC-IIIデータセット上でBioBERTおよびClinicalBERTを含む6つのPLMを評価したところ、ClinicalBERTが臨床テキスト分類において最高の正確率(85%)とF1スコア(86%)を達成しました。本研究は、プロンプトベースのゼロショット学習(ZSL)が、臨床自然言語処理(NLP)における教師ありモデルに追いつくことができ、訓練データを必要としないことを示しています。
ケミン・ルーとチーム21 は、プロンプトベースの継続的な事前訓練 を通じて 、生物医学分野向けの識別言語モデル(DLM)を微調整する新しいアプローチであるBIODLMを開発しました。彼らの主な目標は、巧妙なプロンプトチューニングと置き換えトークン検出(RTD)手法を活用し、バイオメディシンにおける少ショットおよびゼロショットの両方の課題でのパフォーマンスを向上させることでした。うまく機能させるために、用語をいじり、ドメイン固有の用語を意図的に混同し、プレトレーニング中にPubMedBERTをジェネレーターとして使います。結果は堅実で、BIODLMは通常のCLSベースのファインチューニングを上回り、フルスーパービジョン下でマクロ平均精度50.2%、ゼロショットモードで43.4%を記録しました。
姚宗海らは異なるアプローチを取り、 文脈のばらつきを考慮したプロンプト生成に焦点を当てました。彼らの目標は、プロンプトベースのプロービング中に生じる奇妙なバイアスを減らし、BioLAMA評価をより透明で解釈しやすくすることでした。つまり、これらの言語モデルが意味のある答えを出してくるようにし、単に巧妙に作られたプロンプトを拾うのではなく、
彼らは、従来のTop-k精度の代わりに、PLMの生物医学的事業体認識を評価するために、ランク変化に基づく評価指標(UCM: Understand–Confuse–Misunderstand)を導入しました。BioBERT、ClinicalBERT、RoBERTaベースのモデルを含む12のPLMを用いた実験では、大N-M関係および希少な生物医学的実体においてBioLAMA性能の向上が示されました。BioBERTはAccuracy@1 40.7%、UCM理解度32.8%を達成し、従来のTop-k指標を上回る成果を上げました。
Yehらは、ChemProtデータセットを用いて生物医学関係抽出のためのプロンプトを調査し 、ドメイン特異的な少数ショットおよびフルデータの微調整を強化しました。彼らは頻度、具体性、類似度などのスコア指標を取り入れ、ラベルの単語選択を最適化するプロンプトベースのテンプレートを設計しました。BioMed-RoBERTaベースを用いて、彼らの手法はF1スコア90.09を達成し、SciFive-Largeを1.14 F1上回り、通常のファインチューニングを14.21 F1上回る成果を上げました。これにより、プロンプトベースの学習がより少ないトレーニング例で生物医学NERのパフォーマンスを向上させることが確認されています。
SusantiとHolsmoelle 24 は、NLPに基づく因果グラフ検証を研究し、ファインチューニングされた言語モデルとプロンプトベースのLLMを比較しました。彼らはBioBERTおよびGPTモデルを教師ありの因果関係分類のために訓練し、ゼロショットおよび少数ショットプロンプトベースのLLMを評価しました。生物医学およびオープンドメインデータセットの結果では、ファインチューニングされたモデルがLLMプロンプトを上回り、最大20.5%高いF1スコアを達成することが明らかになりました。この研究は、因果関係抽出の精度を向上させるために高度なプロンプトングとデータセット固有のチューニングの必要性を強調しています。
Chen ら25 は、少ショット BioNER に対して知識主導型インスタンス生成およびプロンプト対照学習フレームワークを提案しました。彼らのアプローチは、ドメイン知識グラフを活用して多様な生物医学的実体を生成し、質問プロンプトを用いた対照的学習を用いて、クエリと回答のペア間の相互情報を測定することで実体認識を強化しています。fベンチマークデータセット(NCBI、BC5CDR-Disease、BioNLP11EPI、BioNLP13GE)で評価されたところ、20回のショットシナリオで最先端モデルに比べて最大7.1%のF1スコア向上を達成しました。彼らのコードは以下の場所で公開されています:https://github.com/cpmss521/KGPC。
Chenらはまた、テキスト分類をマスクされた言語モデリング(MLM)タスクに変換することで、生物医学的請求検出のためのプロンプトラーニングアプローチも提案しました。BERT、RoBERTa、T5をハードテンプレートと混合テンプレートで使用し、請求予測の精度を向上させました。BioClaimデータセットでは、混合テンプレートを用いたT5モデルが従来のモデルに比べて5.3%のF1スコア向上を達成し、マスクドトークン予測を用いたPLMの事前学習とファインチューニングのギャップを埋めました。
Ryan Shea Ying Cong Tanらは、トランスモデル、Bi-LSTM、CNN、古典的機器学習を用いて放射線報告からがん疾患応答推論のためのLLMを評価しました。彼らの手法にはデータ拡張(文の置換や一貫性の喪失)やプロンプトベースのファインチューニングが含まれていました。GatorTronトランスは最高の精度を達成し、テストセットでは0.8916、増強後は0.8976でした。プロンプトベースのファインチューニングにより、500件程度のラベル付きレポートで効果的なパフォーマンスが可能になりました。
Huら28 は、臨床NERのGPT-3.5およびGPT-4を評価し、ベースラインプロンプト、ガイドラインベースプロンプト、誤り指示、少ショットサンプルの4要素プロンプト フレームワークを通じて パフォーマンスを向上させました。MTSamplesおよびVAERSデータセットでは、GPT-3.5とGPT-4はそれぞれリラックス後のF1スコアを0.634/0.804および0.301/0.593から0.794/0.861および0.676/0.736に改善しました。BioClinicalBERT(F1:MTSamplesで0.901、VAERSで0.802)にはまだ遅れをとっていますが、これらの結果は適切なプロンプティング戦略を用いることで臨床NERにおけるLLMの効果が高まっていることを示しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
1. 手続き


2. 環境設定
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
フーショットおよびゼロショットの生物医学命名エンティティ認識(NER)モデルの評価は、PubMedの要旨、臨床ノート、生物医学質問応答コーパスから得られた多様な生物医学データセットを用いて行われました。BioBERT、ClinicalBERT、RoBERTa、PhenoBERT29、GPT-3.5、GPT-4などの確立モデルとの比較性能分析が実施されました。提案されたモデルは全体的に89.8%の優れた精度、88.7%の精度、90.5%のリコール率、F1スコア0.895を達成しました。この性能はClinicalBERT(85.0%の精度、0.86 F1)やGPT-4(86.1%の精度、0.86 F1)に比べて大幅な向上を示しており、主にプロンプトベースの学習とオントロジー駆動型エンティティ連携の組み合わせによるもので、モデルが新規バイオメディカルエンティティの処理能力を高めています。
このモデルは、低データシナリオにおいて卓越した能力を示しました。ゼロショット設定では4...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
相反する結果、予想外の発見、他の研究との不一致
提案されたモデルの優れた性能にもかかわらず、既存の研究と比較すると矛盾する結果がいくつか出てきました。BioBERTベースのモデルは、従来の生体医学用命名エンティティ認識(NER)で高い性能を示しており、これは過去の調査や比較研究で報告されています。トランスフォーマーベースのアーキテクチャは医療NLPタスクで一貫して高い精度を達成していますが、プロンプトベース学習と大規模言語モデル(LLM)を統合することで、近年は少発射の生物医学学習を向上させることが示されています。本研究では、プロンプトベースの統合により高いリコール率が見られましたが、曖昧な医療用語への感受性から過剰予測が生じることがあり、これはゼロショットおよび少数ショットの医療AI研究でも議論さ...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは何も明かすことはありません。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| コアモデル | BioBERT-base(v1.1) | ハグングフェイス: モノローグ/biobert-v1.1 | |
| ディープラーニングフレームワーク | PyTorch 2.3.1 | https://pytorch.org/ | |
| GPUハードウェア | NVIDIA A100(40GB VRAM) | NVIDIA | |
| 大規模言語モデル(LLM) | GPT-4 | OpenAI API | |
| オペレーティングシステム | 窓 | マイクロソフト | |
| パラメータ効率調整 | LoRA(PEFTライブラリ0.6.2経由) | https://github.com/huggingface/peft | |
| プログラミング言語 | Python 3.9.18 | Pythonソフトウェア財団 | |
| ゼロショットベースラインLLM | GPT-3.5-ターボ | OpenAI API |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト