Este artigo apresenta um protocolo para reconhecimento biomédico de entidades nomeadas usando BioBERT, aprendizado baseado em prompts e grandes modelos de linguagem para cenários de poucos recursos.
Artigo de investigação
Este artigo apresenta um protocolo para reconhecimento biomédico de entidades nomeadas usando BioBERT, aprendizado baseado em prompts e grandes modelos de linguagem para cenários de poucos recursos.
O Reconhecimento Biomédico de Entidades Nomeadas (NER) desempenha um papel crucial na extração de informações valiosas de textos clínicos e literatura biomédica. Modelos tradicionais de deep learning, incluindo BioBERT, ClinicalBERT e RoBERTa, demonstraram melhorias substanciais nas tarefas do NER; No entanto, ainda têm dificuldades com termos biomédicos de baixo recurso, desafios de adaptação ao domínio e generalização de entidades invisíveis. Para abordar essas limitações, este estudo introduz um framework híbrido que combina BioBERT, aprendizagem baseada em prompts e Grandes Modelos de Linguagem (LLMs) para aprimorar as capacidades de aprendizado de poucos e zero-disparos no NER biomédico. O modelo proposto aproveita efetivamente o conhecimento contextual de transformadores pré-treinados, reduzindo a dependência de conjuntos de dados rotulados extensos, mantendo alta precisão. Após extensa avaliação experimental em múltiplos conjuntos de dados de referência biomédica, a abordagem proposta demonstra desempenho consistentemente forte. Especificamente, alcança 89,8% de precisão, 88,7% de precisão, 90,5% de recordação e um escore F1 de 0,895, superando métodos básicos e demonstrando sua eficácia em tarefas de mineração de texto biomédico. Comparado a outros métodos, a engenharia de prompts ajuda o modelo a se adaptar muito melhor à linguagem única dos textos biomédicos. Além disso, o boost com um grande modelo de linguagem (LLM) dá um grande impulso ao desempenho do NER ao captar detalhes semânticos e gramaticais complicados. Esses achados demonstram a eficácia do aprendizado de poucos e zero-tiros na mineração de textos biomédicos, abrindo caminho para uma melhor análise automatizada de dados clínicos e sistemas de apoio à decisão mais inteligentes.
A explosão de literatura biomédica, prontuários eletrônicos de saúde (EHRs) e dados de ensaios clínicos realmente precisa de sistemas inteligentes e robustos de Reconhecimento Biomédico de Entidades Nomeadas (BioNER). O BioNER é uma tarefa especializada em Processamento de Linguagem Natural (PLN) que visa identificar entidades como doenças, genes, proteínas, medicamentos e substâncias químicas em texto biomédico nãoestruturado 1. Ser capaz de identificar essas entidades com precisão é super importante para vários outros usos, como minerar conhecimento biomédico, encontrar novos medicamentos, apoiar médicos em decisões clínicas ou até mesmo organizar automaticamente pilhas de artigos de pesquisa2.
Embora avanços significativos tenham sido alcançados em modelos baseados em deep learning — como BioBERT, ClinicalBERT e BlueBERT — a maioria das abordagens biomédicas supervisionadas de reconhecimento de entidades nomeadas (BioNER) continuam a depender fortemente de conjuntos de dados anotados em grande escala. Essa forte dependência de dados rotulados extensos limita sua capacidade de generalização quando aplicada a textos biomédicos novos ou até entãoinéditos 3. Os modelos clássicos do BioNER precisam de muitos dados anotados só para serem refinados, o que se torna um verdadeiro problema em áreas onde simplesmente não há dados suficientes, pense em doenças raras, farmacogenômica ou pesquisas biomédicas publicadas em idiomas diferentes doinglês 4. Além disso, marcar manualmente todo esse texto biomédico é lento, caro e geralmente exige especialistas reais naárea 5. É por isso que desenvolver modelos BioNER com poucos e zero-disparos é tão importante: isso pode reduzir significativamente a necessidade de dados rotulados, garantindo que os modelos funcionem bem em uma ampla gama de conteúdosbiomédicos 6.
O aprendizado com poucos tiros (FSL) permite que modelos alcancem desempenho competitivo de reconhecimento de entidades usando apenas uma pequena fração dos dados rotulados, tipicamente entre 1% e 10% do conjunto completo de treinamento, tornando-o particularmente valioso para domínios biomédicos de baixo recurso7. O aprendizado zero-shot (ZSL) vai ainda mais longe, permitindo que um modelo reconheça entidades que nunca sequer viu antes, apenas aproveitando o poder de grandes modelos de linguagem pré-treinados (LLMs), sem precisar de dados extrasde treinamento 8. Recentemente, avanços em LLMs como GPT-4, LLaMA e Falcon demonstraram forte desempenho zero-shot em tarefas gerais do NER, mas seu uso em textos biomédicos reais ainda é em grande parte território desconhecido. Isso porque a linguagem em biomedicina é tão especializada ecomplicada 9.
Esta pesquisa visa fechar essa lacuna reunindo o ajuste fino do BioBERT, o aprendizado em poucos disparos, a inferência de LLM zero-shot e o aprendizado baseado em prompts, tudo com o objetivo de elevar o padrão do BioNER em ambientes biomédicos de baixo recurso.
Para dar uma ideia do que já existe: (1) BioBERT é uma versão do BERT que foi recapacitada com resumos do PubMed e artigos em texto completo, então é mais adequada para conteúdobiomédico 10. (2) ClinicalBERT é uma variante do BERT treinada em EHRs, então é especialmente ajustado para entender anotações clínicas e laudosmédicos 11. (3) BlueBERT é outro modelo biomédico de PLN, treinado tanto com conjuntos de dados PubMed quanto MIMIC-III, e é otimizado para reconhecer questões médicas notexto 12. (4) O PubMedBERT é um modelo transformer treinado apenas com dados do PubMed, o que o ajuda a captar esses padrões e terminologia únicos encontrados na redaçãobiomédica 13.
Embora esses modelos alcancem desempenho de ponta em benchmarks BioNER, sua dependência de grandes conjuntos de dados rotulados e ajuste fino supervisionado limita sua adaptabilidade a novos domíniosbiomédicos 14. Além disso, mudanças de domínio entre literatura biomédica científica (por exemplo, resumos do PubMed) e anotações clínicas (por exemplo, conjunto de dados i2b2 2010) degradam ainda mais o desempenho dos sistemas BioNERsupervisionados 15.
As principais limitações nas pesquisas atuais do BioNER incluem: Dependência de Dados Anotados: Modelos existentes baseados em transformadores exigem conjuntos de dados rotulados extensos, que são escassos em domínios biomédicosespecializados 16. Falta de Generalização para Entidades Invisíveis: Modelos atuais têm dificuldade em reconhecer termos biomédicos raros ou novos que não estão presentes nos dados de treinamento17. Exploração Limitada de Aprendizagem Pouca e Zero-Disparada: A maior parte das pesquisas foca em aprendizagem totalmente supervisionada, com investigação mínima em paradigmas de baixa data para o BioNER18. Adaptação Ineficiente de LLMs: Embora LLMs como GPT-4 e LLaMA apresentem forte desempenho zero-shot em NLP geral, sua aplicação ao NER biomédico continua subexplorada devido à complexidade terminológica e à falta de prompts específicos de domínio19.
Para suprir essas lacunas, este estudo explora as seguintes perguntas-chave de pesquisa: Como a aprendizagem com poucos disparos pode melhorar o desempenho do BioBERT no NER biomédico com dados rotulados mínimos? A inferência zero-shot usando LLMs pode reconhecer com precisão entidades biomédicas sem ajuste fino específico de domínio? Como o aprendizado baseado em prompts pode melhorar o desempenho zero-shot em tarefas biomédicas de NER? Qual é a abordagem híbrida ideal que combina BioBERT e pseudo-rótulos gerados por LLM para melhorar o BioNER em ambientes de poucos recursos? Como o treinamento adversarial impacta a robustez dos modelos BioNER com poucos disparos e zero?
O objetivo desta pesquisa é desenvolver uma nova estrutura biomédica adaptativa para NER que aproveite o aprendizado com poucos disparos e zero-tiros para enfrentar os desafios causados pela escassez de dados rotulados. O estudo visa aprimorar as capacidades de generalização do BioBERT e dos LLMs explorando técnicas de engenharia rápida, aprendizado contrastivo e treinamento adversarial.
A pesquisa é estruturada em torno dos seguintes objetivos: (1) Desenvolver um pipeline de aprendizado de poucos tiros para NER biomédico, ajustando o BioBERT com dados anotados limitados. (2) Avaliação de LLMs zero-shot (por exemplo, GPT-4, LLaMA, Falcon) para NER biomédico usando engenharia de prompts específica de domínio. (3) Criar uma abordagem híbrida que integre o ajuste fino do BioBERT com pseudo-rótulos gerados por LLM para melhorar o reconhecimento de entidades em conjuntos de dados biomédicos de baixo recurso. (4) Conduzir uma análise comparativa de poucos tiros vs. aprendizado zero-shot usando benchmarks biomédicos padrão (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) Implementação de treinamento adversarial (FGSM, PGD) para aumentar a robustez do modelo contra variações ruidosas de texto biomédico.
Este estudo contribui para o campo do PLN biomédico e reconhecimento de entidades ao introduzir estratégias BioNER de poucos e zero-disparos para lidar com a escassez de rótulos em conjuntos de dados biomédicos e demonstrar como LLMs podem ser aproveitados para NER biomédico zero-shot por meio de engenharia otimizada de prompts. Propondo um framework híbrido que combina ajuste fino BioBERT e anotações sintéticas geradas por LLM para melhor generalização. Avaliação do impacto do treinamento adversarial nos modelos BioNER para melhorar a robustez contra mudanças de domínio. Fornecendo um parâmetro comparativo do desempenho do BioNER entre os paradigmas supervisionado, pouca e zero-shot.
Revisão bibliográfica
Sivarajkumar eWang 20 desenvolveram o HealthPrompt, um framework de Zero-Shot Learning (ZSL) para PLN clínico que resolve a falta de conjuntos de dados clínicos anotados. Em vez de ajustar um modelo de linguagem pré-treinado (PLM), eles empregaram aprendizado baseado em prompts, onde as definições de tarefas são ajustadas usando modelos estruturados. A avaliação de seis PLMs, incluindo BioBERT e ClinicalBERT, no conjunto de dados MIMIC-III mostrou que o ClinicalBERT alcançou a melhor precisão (85%) e o escore F1 (86%) para classificação de texto clínico. Este estudo mostra que a aprendizagem zero-shot baseada em prompts (ZSL) pode acompanhar modelos supervisionados no processamento clínico de linguagem natural (PLN), sem exigir dados de treinamento.
Keming Lu e suaequipe 21 desenvolveram o BIODLM, uma nova abordagem para ajustar modelos de linguagem discriminativa (DLMs) para o domínio biomédico por meio de pré-treinamento contínuo baseado em prompts. O principal objetivo deles era melhorar o desempenho tanto em tarefas de poucos disparos quanto em tarefas de zero disparos na biomedicina, utilizando ajustes inteligentes de prompt e o método de Detecção de Tokens Substituídos (RTD). Para fazer funcionar, eles brincam com o vocabulário, misturando deliberadamente termos específicos de cada domínio e usam o PubMedBERT como gerador durante o pré-treinamento. Os resultados são sólidos: o BIODLM na verdade superou o ajuste fino usual baseado em CLS, alcançando uma precisão macromédia de 50,2% com supervisão total e 43,4% no modo zero-shot.
Zonghai Yao ecolegas 22 adotaram uma abordagem diferente, focando na geração de prompts que leva em conta a variação do contexto. O objetivo deles era reduzir os vieses estranhos que podem surgir durante a sondagem baseada em prompts e tornar a avaliação do BioLAMA mais transparente e interpretável. Em outras palavras, eles estão tentando garantir que esses modelos de linguagem nos dêem respostas que façam sentido e não apenas captem prompts bem formulados.
Eles introduziram uma métrica de avaliação baseada em mudança de ranking (UCM: Entender–Confuse–Entender) em vez da precisão tradicional Top-k para avaliar PLMs no reconhecimento biomédico de entidades. Experimentos em 12 PLMs, incluindo modelos baseados em BioBERT, ClinicalBERT e RoBERTa, mostraram desempenho aprimorado do BioLAMA para relações grande-N-M e entidades biomédicas raras. O BioBERT alcançou um Accuracy@1 de 40,7% e a Compreensão UCM de 32,8%, superando as métricas tradicionais do Top-k.
Yeh et al.23 investigaram o incentivo para extração de relações biomédicas usando o conjunto de dados ChemProt para aprimorar o ajuste fino específico de poucos disparos e dados completos por domínio. Eles projetaram modelos baseados em prompts que incorporam métricas de pontuação como frequência, especificidade e similaridade para otimizar a seleção das palavras do rótulo. Usando a BioMed-RoBERTa-base, seu método alcançou uma pontuação F1 de 90,09, superando o SciFive-Large em 1,14 F1 e superando o ajuste fino regular em 14,21 F1. Isso confirma que o aprendizado baseado em prompts melhora o desempenho do NER biomédico com menos exemplos de treinamento.
Susanti e Holsmoelle 24 estudaram a verificação baseada em PLN de grafos causais, comparando modelos de linguagem finamente ajustados e LLMs baseados em prompts. Eles treinaram modelos BioBERT e GPT para classificação supervisionada de relações causais e avaliaram LLMs baseados em prompts zero-shot e few-shot. Resultados em conjuntos de dados biomédicos e de domínio aberto revelaram que modelos finamente ajustados superaram os prompts de LLM, alcançando até 20,5% mais escores F1. O estudo destaca a necessidade de prompting avançado e ajuste específico de conjunto de dados para melhorar a precisão da extração de relações causais.
Chen et al.25 propuseram uma estrutura de geração de instâncias guiada pelo conhecimento e aprendizagem contrastiva prompt-contrastiva para o BioNER de poucos disparos. Sua abordagem utiliza grafos de conhecimento de domínio para gerar diversas entidades biomédicas e emprega aprendizado contrastivo baseado em pergunta-prompt para aprimorar o reconhecimento de entidades medindo informações mútuas entre pares consulta–resposta. Avaliados em conjuntos de dados fbenchmark (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE), seu modelo alcançou até 7,1% de melhora na pontuação F1 em relação a modelos de última geração em cenários de 20 injeções. O código deles está disponível publicamente em: https://github.com/cpmss521/KGPC.
Chen et al.26também propuseram uma abordagem de aprendizado prompt para a detecção de afirmações biomédicas, transformando a classificação de texto em uma tarefa de modelagem de linguagem mascarada (MLM). Usando BERT, RoBERTa e T5 com templates rígidos e mistos, eles melhoraram a precisão das previsões de reivindicações. No conjunto de dados BioClaim, o modelo T5 deles com modelos mistos alcançou uma melhora de 5,3% na pontuação F1 em relação aos modelos anteriores, abordando a diferença entre pré-treinamento e ajuste fino em PLMs usando a previsão de tokens mascarados.
Ryan Shea Ying Cong Tan et al.27 avaliaram LLMs para inferência de resposta a doenças cancerígenas a partir de relatórios radiológicos usando modelos transformer, Bi-LSTM, CNN e ML clássico. O método deles incluiu aumento de dados (permutação de frases e perda de consistência) e ajuste fino baseado em prompts. O transformador GatorTron alcançou a melhor precisão: 0,8916 no conjunto de teste e 0,8976 após aumentação. O ajuste fino baseado em prompts permitia desempenho efetivo com apenas 500 relatórios rotulados.
Hu et al.28 avaliaram o GPT-3.5 e o GPT-4 para NER clínico, aprimorando o desempenho por meio de uma estrutura de prompting em quatro partes: prompts base, prompts baseados em diretrizes, instruções baseadas em erros e amostras de poucos shots. Nos conjuntos de dados MTSamples e VAERS, GPT-3.5 e GPT-4 melhoraram seus escores relaxados de F1 de 0,634/0,804 e 0,301/0,593 para 0,794/0,861 e 0,676/0,736, respectivamente. Embora ainda estejam atrás do BioClinicalBERT (F1: 0,901 em MTSamples, 0,802 em VAERS), esses resultados mostram a crescente eficácia dos LLMs na NER clínica com estratégias adequadas de incentivo.
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
1. Procedimento


2. Configuração ambiental
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
A avaliação do modelo de Reconhecimento Biomédico de Entidades Nomeadas (NER) (Few-Shot e Zero-Shot) foi conduzida em um conjunto de dados biomédico diversificado derivado de resumos do PubMed, anotações clínicas e corpus de perguntas e respostas biomédicas. Foi realizada uma análise comparativa de desempenho com modelos estabelecidos, incluindo BioBERT, ClinicalBERT, RoBERTa,PhenoBERT 29, GPT-3.5 e GPT-4. O modelo proposto alcançou uma precisão geral superior de ...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Resultados conflitantes, achados inesperados e discrepâncias em relação a outras pesquisas
Apesar do desempenho superior do modelo proposto, certos resultados conflitantes surgiram em comparação com estudos existentes. Modelos baseados em BioBERT tradicionalmente demonstraram forte desempenho em Reconhecimento de Entidades Nomeadas (NER) biomédicas, conforme relatado em pesquisas anteriores e estudos comparativos de sistemas biomédicosNER ...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Os autores não têm nada a revelar.
| Nome | Empresa | Número de catálogo | Comentários |
|---|---|---|---|
| Modelo Núcleo | BioBERT-base (v1.1) | Rosto de Abraço: monologg/biobert-v1.1 | |
| Estrutura de Aprendizado Profundo | PyTorch 2.3.1 | https://pytorch.org/ | |
| GPU Hardware | NVIDIA A100 (40GB VRAM) | NVIDIA | |
| Modelo de Linguagem Grande (LLM) | GPT-4 | OpenAI API | |
| Sistema Operacional | Janelas | Microsoft | |
| Afinação eficiente em parâmetros | LoRA (via biblioteca PEFT 0.6.2) | https://github.com/huggingface/peft | |
| Linguagem de Programação | Python 3.9.18 | Fundação de Software Python | |
| LLM de Base de Zero Tiro | GPT-3.5-Turbo | OpenAI API |
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE
Solicitar permissão