Este artículo presenta un protocolo para el reconocimiento biomédico de entidades nombradas utilizando BioBERT, aprendizaje basado en prompts y grandes modelos de lenguaje para escenarios de pocos recursos.
Artículo de investigación
Este artículo presenta un protocolo para el reconocimiento biomédico de entidades nombradas utilizando BioBERT, aprendizaje basado en prompts y grandes modelos de lenguaje para escenarios de pocos recursos.
El Reconocimiento Biomédico de Entidades Nombradas (NER) desempeña un papel crucial en la extracción de información valiosa de textos clínicos y literatura biomédica. Los modelos tradicionales de aprendizaje profundo, incluyendo BioBERT, ClinicalBERT y RoBERTa, han demostrado mejoras sustanciales en las tareas de NER; sin embargo, aún luchan con términos biomédicos de pocos recursos, desafíos de adaptación de dominios y generalización de entidades invisibles. Para abordar estas limitaciones, este estudio introduce un marco híbrido que combina BioBERT, aprendizaje basado en prompts y Grandes Modelos de Lenguaje (LLMs) para mejorar las capacidades de aprendizaje de pocas y cero disparos en el NER biomédico. El modelo propuesto aprovecha eficazmente el conocimiento contextual de transformadores preentrenados, reduciendo la dependencia de conjuntos de datos etiquetados extensos y manteniendo una alta precisión. Tras una extensa evaluación experimental en múltiples conjuntos de datos de referencia biomédica, el enfoque propuesto demuestra un rendimiento consistentemente sólido. Concretamente, alcanza un 89,8% de precisión, un 88,7% de precisión, un 90,5% de recuerdo y una puntuación F1 de 0,895, superando a los métodos base y demostrando su eficacia para tareas de minería de texto biomédico. En comparación con otros métodos, la ingeniería de prompts ayuda al modelo a adaptarse mucho mejor al lenguaje único de los textos biomédicos. Además, el aumento con un modelo de lenguaje grande (LLM) da un impulso serio al rendimiento de NER al captar detalles semánticos y gramaticales complicados. Estos hallazgos demuestran la eficacia del aprendizaje con pocos disparos y cero disparos en la minería de textos biomédicas, allanando el camino para un mejor análisis automatizado de datos clínicos y sistemas de apoyo a la decisión más inteligentes.
La explosión de literatura biomédica, historiales médicos electrónicos (EHR) y datos de ensayos clínicos realmente necesita sistemas inteligentes y robustos de Reconocimiento de Entidades Biomédicas Nombradas (BioNER). BioNER es una tarea especializada en Procesamiento del Lenguaje Natural (PLN) que tiene como objetivo identificar entidades como enfermedades, genes, proteínas, fármacos y sustancias químicas en el texto biomédicono estructurado 1. Poder identificar estas entidades con precisión es muy importante para muchos otros usos, como extraer conocimiento biomédico, encontrar nuevos medicamentos, apoyar a los médicos con decisiones clínicas o incluso clasificar automáticamente montones de artículosde investigación 2.
Aunque se han logrado avances significativos en modelos basados en aprendizaje profundo —como BioBERT, ClinicalBERT y BlueBERT— la mayoría de los enfoques biomédicos supervisados de reconocimiento de entidades nombradas (BioNER) existentes continúan dependiendo en gran medida de conjuntos de datos anotados a gran escala. Esta fuerte dependencia de datos etiquetados extensos limita su capacidad de generalización cuando se aplican a textos biomédicos novedosos oinéditos 3. Los modelos clásicos de BioNER necesitan muchísimos datos anotados solo para ajustarlos, lo que se convierte en un verdadero dolor de cabeza en áreas donde no hay suficientes datos, como enfermedades raras, farmacogenómica o investigaciones biomédicas publicadas en idiomas distintos alinglés 4. Además, etiquetar manualmente todo este texto biomédico es lento, caro y normalmente requiere expertos reales enel campo 5. Por eso es tan importante desarrollar modelos BioNER de pocos disparos y disparos cero: podría reducir significativamente la necesidad de datos etiquetados y asegurar que los modelos funcionen bien en una amplia gama de contenidosbiomédicos 6.
El aprendizaje de pocas capturas (FSL) permite a los modelos lograr un rendimiento competitivo en reconocimiento de entidades utilizando solo una pequeña fracción de los datos etiquetados, típicamente entre el 1% y el 10% del conjunto completo de datos de entrenamiento, lo que lo hace especialmente valioso para dominios biomédicos de pocosrecursos 7. El aprendizaje de disparo cero (ZSL) va aún más allá, permitiendo que un modelo reconozca entidades que nunca había visto antes, simplemente aprovechando la potencia de grandes modelos de lenguaje preentrenados (LLMs), sin necesidad de datos de entrenamientoadicionales 8. Últimamente, los avances en LLMs como GPT-4, LLaMA y Falcon han demostrado un fuerte rendimiento en disparo cero en tareas generales de NER, pero su uso en textos biomédicos reales sigue siendo en gran medida territorio desconocido de la historia. Eso es porque el lenguaje en biomedicina es tan especializado y complicado9.
Esta investigación pretende cerrar esa brecha combinando el ajuste fino de BioBERT, el aprendizaje en pocas disparos, la inferencia LLM de cero disparo y el aprendizaje basado en prompts, todo ello con el objetivo de elevar el listón de BioNER en entornos biomédicos de pocos recursos.
Para dar una idea de lo que ya existe: (1) BioBERT es una versión de BERT que ha sido reentrenada con resúmenes de PubMed y artículos completos, por lo que es más adecuada para contenidobiomédico 10. (2) ClinicalBERT es una variante de BERT entrenada en EHR, por lo que está especialmente ajustada para entender notas clínicas e informesmédicos 11. (3) BlueBERT es otro modelo biomédico de PLN, entrenado tanto con conjuntos de datos PubMed como MIMIC-III, y está optimizado para reconocer temas médicos en el texto12. (4) PubMedBERT es un modelo transformer entrenado únicamente con datos de PubMed, lo que le ayuda a captar realmente esos patrones y terminología únicos que se encuentran en la redacciónbiomédica 13.
Aunque estos modelos alcanzan un rendimiento de última generación en los benchmarks de BioNER, su dependencia de grandes conjuntos de datos etiquetados y de ajustes finos supervisados limita su adaptabilidad a nuevos dominiosbiomédicos 14. Además, los cambios de dominio entre la literatura biomédica científica (por ejemplo, resúmenes de PubMed) y las notas clínicas (por ejemplo, el conjunto de datos i2b2 2010) degradan aún más el rendimiento de los sistemas BioNERsupervisados 15.
Las principales limitaciones en la investigación actual de BioNER incluyen: Dependencia de datos anotados: Los modelos existentes basados en transformadores requieren conjuntos de datos etiquetados extensos, que son escasos en dominios biomédicosespecializados 16. Falta de generalización a entidades invisibles: Los modelos actuales tienen dificultades para reconocer términos biomédicos raros o novedosos que no están presentes en los datos deentrenamiento 17. Exploración limitada del aprendizaje de pocos y cero disparos: La mayoría de la investigación se centra en el aprendizaje totalmente supervisado, con una investigación mínima sobre paradigmas de pocos datos para BioNER18. Adaptación ineficiente de los LLMs: Aunque los LLM como GPT-4 y LLaMA muestran un fuerte rendimiento de disparo cero en el PLN general, su aplicación a la NER biomédica sigue siendo poco explorada debido a la complejidad terminológica y la falta de prompts específicos de dominio19.
Para abordar estas carencias, este estudio explora las siguientes preguntas clave de investigación: ¿Cómo puede el aprendizaje con pocas disparaciones mejorar el rendimiento de BioBERT en NER biomédico con datos etiquetados mínimos? ¿Puede la inferencia zero-shot usando LLMs reconocer con precisión entidades biomédicas sin ajuste fino específico de dominio? ¿Cómo puede el aprendizaje basado en prompts mejorar el rendimiento sin disparo en tareas biomédicas de NER? ¿Cuál es el enfoque híbrido óptimo que combina BioBERT y pseudoetiquetas generadas por LLM para mejorar BioNER en entornos con pocos recursos? ¿Cómo afecta el entrenamiento adversarial a la robustez de los modelos BioNER de pocos disparos y de disparo cero?
El propósito de esta investigación es desarrollar un marco biomédico adaptativo de NER novedoso que aproveche el aprendizaje de pocas disparos y cero disparos para abordar los desafíos que plantea la escasez de datos etiquetados. El estudio pretende mejorar las capacidades de generalización de BioBERT y LLMs explorando técnicas de ingeniería rápida, aprendizaje contrastivo y entrenamiento adversarial.
La investigación está estructurada en torno a los siguientes objetivos: (1) Desarrollar una cadena de aprendizaje de pocas disparos para la NER biomédica ajustando BioBERT con datos anotados limitados. (2) Evaluación de LLMs de disparo cero (por ejemplo, GPT-4, LLaMA, Falcon) para NER biomédica utilizando ingeniería de prompts específica de dominio. (3) Crear un enfoque híbrido que integre el ajuste fino de BioBERT con pseudoetiquetas generadas por LLM para mejorar el reconocimiento de entidades en conjuntos de datos biomédicos de pocos recursos. (4) Realizar un análisis comparativo de pocas balas vs. aprendizaje sin disparo usando benchmarks biomédicos estándar (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) Implementación de entrenamiento adversarial (FGSM, PGD) para mejorar la robustez del modelo frente a variaciones ruidosas de texto biomédico.
Este estudio contribuye al campo del PLN biomédico y el reconocimiento de entidades al introducir estrategias BioNER de pocas y cero disparos para abordar la escasez de etiquetas en conjuntos de datos biomédicos y demostrar cómo los LLMs pueden aprovecharse para la NER biomédica de disparo cero mediante ingeniería optimizada de prompts. Propone un marco híbrido que combina el ajuste fino de BioBERT y anotaciones sintéticas generadas por LLM para una mejor generalización. Evaluación del impacto del entrenamiento adversarial en los modelos BioNER para mejorar la robustez frente a cambios de dominio. Proporcionando un punto de referencia comparativo del rendimiento de BioNER entre paradigmas supervisado, de pocos disparos y de disparo cero.
Revisión bibliográfica
Sivarajkumar yWang 20 desarrollaron HealthPrompt, un marco de Aprendizaje Cero Disparo (ZSL) para PLN clínico que aborda la falta de conjuntos de datos clínicos anotados. En lugar de afinar un modelo de lenguaje preentrenado (PLM), emplearon aprendizaje basado en prompts, donde las definiciones de tareas se ajustan mediante plantillas estructuradas. Su evaluación de seis PLMs, incluyendo BioBERT y ClinicalBERT, en el conjunto de datos MIMIC-III mostró que ClinicalBERT alcanzó la mejor precisión (85%) y la mejor puntuación F1 (86%) para la clasificación de texto clínico. Este estudio muestra que el aprendizaje cero de disparo basado en prompts (ZSL) puede seguir el ritmo de los modelos supervisados en el procesamiento clínico del lenguaje natural (PLN), sin requerir datos de entrenamiento.
Keming Lu y el equipo21 desarrollaron BIODLM, un nuevo enfoque para afinar modelos de lenguaje discriminativo (DLM) para el ámbito biomédico mediante preentrenamiento continuo basado en prompts. Su objetivo principal era mejorar el rendimiento tanto en tareas de pocos disparos como en tareas de disparo cero en biomedicina aprovechando un ajuste inteligente de prompts y el método de Detección de Tokens Reemplazados (RTD). Para que funcione, juegan con el vocabulario, mezclando deliberadamente términos específicos de cada dominio y usan PubMedBERT como generador durante el preentrenamiento. Los resultados son sólidos: BIODLM superó el ajuste fino habitual basado en CLS, logrando una precisión macro-media del 50,2% con supervisión total y del 43,4% en modo cero disparos.
Zonghai Yao ysus colegas 22 adoptaron un enfoque diferente, centrándose en la generación de prompts que tenga en cuenta la variación del contexto. Su objetivo era reducir los extraños sesgos que pueden surgir durante la sondeación basada en prompts y hacer que la evaluación BioLAMA fuera más transparente e interpretable. En otras palabras, intentan asegurarse de que estos modelos de lenguaje nos den respuestas que tengan sentido y no se limiten a captar prompts bien redactados.
Introdujeron una métrica de evaluación basada en el cambio de rango (UCM: Entender–Confundir–Malentender) en lugar de la precisión tradicional de Top-k para evaluar PLMs en reconocimiento de entidades biomédicas. Experimentos con 12 PLMs, incluyendo modelos basados en BioBERT, ClinicalBERT y RoBERTa, mostraron un mejor rendimiento de BioLAMA para relaciones grandes-N-M y entidades biomédicas raras. BioBERT logró un Accuracy@1 del 40,7% y UCM Comprehensability del 32,8%, superando las métricas tradicionales de Top-k.
Yeh et al.23 investigaron la incitación para la extracción de relaciones biomédicas utilizando el conjunto de datos ChemProt para mejorar el ajuste fino específico de pocas fotos y datos completos por dominio. Diseñaron plantillas basadas en indicaciones que incorporan métricas de puntuación como frecuencia, especificidad y similitud para optimizar la selección de palabras de etiquetas. Utilizando BioMed-RoBERTa-base, su método logró una puntuación F1 de 90,09, superando a SciFive-Large en 1,14 F1 y superando el ajuste fino regular en 14,21 F1. Esto confirma que el aprendizaje basado en prompts mejora el rendimiento de la NER biomédica con menos ejemplos de entrenamiento.
Susanti y Holsmoelle 24 estudiaron la verificación basada en PLN de grafos causales, comparando modelos de lenguaje ajustados y LLMs basados en prompts. Entrenaron modelos BioBERT y GPT para la clasificación supervisada de relaciones causales y evaluaron LLMs basados en prompts de disparo cero y pocos disparos. Los resultados en conjuntos de datos biomédicos y de dominio abierto revelaron que los modelos ajustados superaron a los indicaciones LLM, logrando hasta un 20,5% más altos en puntuaciones F1. El estudio destaca la necesidad de prompting avanzado y ajustes específicos de conjunto de datos para mejorar la precisión de la extracción de relaciones causales.
Chen et al.25 propusieron un marco de generación de instancias guiado por conocimiento y aprendizaje contrastivo prompt-contrastivo para BioNER de pocos disparos. Su enfoque aprovecha grafos de conocimiento de dominio para generar entidades biomédicas diversas y emplea un aprendizaje contrastivo basado en pregunta y prompt para mejorar el reconocimiento de entidades midiendo información mutua entre pares consulta-respuesta. Evaluado con conjuntos de datos fbenchmark (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE), su modelo logró una mejora de hasta un 7,1% en la puntuación F1 respecto a los modelos más avanzados en escenarios de 20 inyecciones. Su código está disponible públicamente en: https://github.com/cpmss521/KGPC.
Chen et al.26también propusieron un enfoque de aprendizaje rápido para la detección de afirmaciones biomédicas transformando la clasificación de texto en una tarea de modelado de lenguaje enmascarado (MLM). Utilizando BERT, RoBERTa y T5 con plantillas duras y mixtas, mejoraron la precisión de las predicciones de afirmaciones. En el conjunto de datos BioClaim, su modelo T5 con plantillas mixtas logró una mejora del 5,3% en la puntuación F1 respecto a modelos anteriores, abordando la brecha entre el preentrenamiento y el ajuste fino en PLMs mediante la predicción de tokens enmascarados.
Ryan Shea Ying Cong Tan et al.27 evaluaron LLMs para la inferencia de respuesta a enfermedades cancerosas a partir de informes radiológicos utilizando modelos transformer, Bi-LSTM, CNN y ML clásico. Su método incluía aumento de datos (permutación de oraciones y pérdida de consistencia) y ajuste fino basado en prompts. El transformador GatorTron alcanzó la mejor precisión: 0,8916 en el conjunto de pruebas y 0,8976 tras la ampliación. El ajuste fino basado en prompts permitía un rendimiento efectivo con tan solo 500 informes etiquetados.
Hu et al.28 evaluaron GPT-3.5 y GPT-4 para la NER clínica, mejorando el rendimiento mediante un marco de cuatro partes de indicaciones: indicaciones de referencia, indicaciones basadas en guías, instrucciones basadas en errores y pocas muestras de disparos. En los conjuntos de datos MTSamples y VAERS, GPT-3.5 y GPT-4 mejoraron sus puntuaciones F1 relajadas de 0,634/0,804 y 0,301/0,593 a 0,794/0,861 y 0,676/0,736, respectivamente. Aunque siguen por detrás de BioClinicalBERT (F1: 0,901 en MTSamples, 0,802 en VAERS), estos resultados muestran la creciente eficacia de los LLMs en NER clínico con estrategias adecuadas de incentivo.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
1. Procedimiento


2. Configuración ambiental
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
La evaluación del modelo de Reconocimiento Biomédico de Entidades Nombradas (NER) de Pocos Tiros y Cero Disparos se realizó sobre un conjunto de datos biomédico diverso derivado de resúmenes de PubMed, notas clínicas y corpus biomédicos de preguntas y respuestas. Se realizó un análisis comparativo de rendimiento con modelos establecidos, incluyendo BioBERT, ClinicalBERT, RoBERTa,PhenoBERT 29, GPT-3.5 y GPT-4. El modelo propuesto logró una precisión global superior...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Resultados contradictorios, hallazgos inesperados y discrepancias con otras investigaciones
A pesar del mejor rendimiento del modelo propuesto, surgieron ciertos resultados contradictorios en comparación con los estudios existentes. Los modelos basados en BioBERT han demostrado tradicionalmente un fuerte rendimiento en el Reconocimiento de Entidades Nombradas (NER) biomédicas, como se informó en encuestas previas y estudios comparativos de sistemas biomédicos NER
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Los autores no tienen nada que revelar.
| Nombre | Empresa | Número de catálogo | Comentarios |
|---|---|---|---|
| Modelo Núcleo | BioBERT-base (v1.1) | Cara de abrazo: monologg/biobert-v1.1 | |
| Marco de Aprendizaje Profundo | PyTorch 2.3.1 | https://pytorch.org/ | |
| GPU Hardware | NVIDIA A100 (40GB VRAM) | NVIDIA | |
| Modelo de Lenguaje Grande (LLM) | GPT-4 | OpenAI API | |
| Sistema operativo | Ventanas | Microsoft | |
| Afinación eficiente en parámetros | LoRA (vía biblioteca PEFT 0.6.2) | https://github.com/huggingface/peft | |
| Lenguaje de programación | Python 3.9.18 | Fundación de Software Python | |
| LLM de Línea Base de Cero Disparos | GPT-3.5-Turbo | OpenAI API |
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE
Solicitar permiso