В этой статье представлен протокол распознавания биомедицинских именованных сущностей с использованием BioBERT, обучения на основе подсказок и больших языковых моделей для сценариев с ограниченными ресурсами.
Исследовательская статья
В этой статье представлен протокол распознавания биомедицинских именованных сущностей с использованием BioBERT, обучения на основе подсказок и больших языковых моделей для сценариев с ограниченными ресурсами.
Биомедицинское распознавание именованных сущностей (NER) играет ключевую роль в извлечении ценной информации из клинических текстов и биомедицинской литературы. Традиционные модели глубокого обучения, включая BioBERT, ClinicalBERT и RoBERTa, показали значительные улучшения в задачах NER; однако они всё ещё сталкиваются с трудностями с малоресурсными биомедицинскими терминами, проблемами адаптации доменов и обобщением невидимых сущностей. Для устранения этих ограничений в этом исследовании введён гибридный фреймворк, объединяющий BioBERT, обучение на основе подсказок и большие языковые модели (LLM) для расширения возможностей обучения с малым и нулёвым уровнем в биомедицинских NER. Предлагаемая модель эффективно использует контекстные знания от предварительно обученных трансформаторов, снижая зависимость от обширных маркированных наборов данных при сохранении высокой точности. После обширной экспериментальной оценки на нескольких биомедицинских эталонных наборах данных предложенный подход демонстрирует стабильно высокие показатели. В частности, он достигает точности 89,8%, точности 88,7%, отзыва 90,5% и оценки F1 0,895, превосходя базовые методы и демонстрируя свою эффективность для биомедицинских задач по анализу текста. По сравнению с другими методами, инженерия подсказок помогает модели гораздо лучше адаптироваться к уникальному языку биомедицинских текстов. Кроме того, бустинг с помощью большой языковой модели (LLM) значительно повышает производительность NER, улавливая сложные семантические и грамматические детали. Эти результаты демонстрируют эффективность обучения с малым и нулёвым способом в биомедицинском текстовом майнинге, прокладывая путь к более эффективному автоматизированному анализу клинических данных и более умным системам поддержки принятия решений.
Взрыв биомедицинской литературы, электронных медицинских карт (EHR) и данных клинических испытаний действительно требует умных, надёжных систем распознавания биомедицинских именованных сущностей (BioNER). BioNER — это специализированная задача в области обработки естественного языка (NLP), направленная на выявление таких сущностей, как болезни, гены, белки, лекарства и химические вещества в неструктурированном биомедицинскомтексте 1. Умение точно выделять эти объекты крайне важно для множества других задач, например, для изучения биомедицинских знаний, поиска новых лекарств, поддержки врачей в клинических решениях или даже автоматического сортирования гор научных работ. 2.
Хотя значительные достижения были достигнуты в моделях на основе глубокого обучения — таких как BioBERT, ClinicalBERT и BlueBERT — большинство существующих подходов к распознаванию контролируемых биомедицинских именованных сущностей (BioNER) по-прежнему в значительной степени опираются на крупномасштабные аннотированные наборы данных. Эта сильная зависимость от обширных маркированных данных ограничивает их способность к обобщению при применении к новым или ранее не публиковавшимся биомедицинскимтекстам 3. Классические модели BioNER требуют огромного количества аннотированных данных для их точной настройки, что становится настоящей головной болью в областях, где данных просто недостаточно — например, редкие заболевания, фармакогеномика или биомедицинские исследования, опубликованные на языках, отличных отанглийского. Кроме того, ручное тегирование всего этого биомедицинского текста — это медленно, дорого и обычно требует настоящих экспертовв этой области. Вот почему разработка моделей BioNER с несколькими и нулевыми выстрелами так важна: это могло бы значительно снизить потребность в маркированных данных и обеспечить эффективную работу моделей в широком спектребиомедицинского контента 6.
Few-shot learning (FSL) позволяет моделям достигать конкурентоспособных показателей распознавания сущностей, используя лишь небольшую долю маркированных данных, обычно от 1% до 10% от полного учебного набора данных, что делает его особенно ценным для малоресурсных биомедицинскихобластей 7. Zero-shot learning (ZSL) идёт ещё дальше, позволяя модели распознавать сущности, которых она раньше даже не видела, просто используя возможности крупных, предварительно обученных языковых моделей (LLM), без необходимости дополнительных обучающихданных 8. В последнее время достижения в LLM, таких как GPT-4, LLaMA и Falcon, показали высокую эффективность zero-shot при выполнении общих задач NER, но их использование в реальных биомедицинских текстах остаётся в основном неизведанной территорией. Это потому, что язык в биомедицине настолько специализирован и сложный,9.
Цель этого исследования — сократить этот разрыв, объединив тонкую настройку BioBERT, обучение с несколькими выстрелами, нулевое вывод LLM и обучение на основе подсказок, всё это с целью повышения планки BioNER в биомедицинских условиях с ограниченными ресурсами.
Чтобы дать представление о том, что уже существует: (1) BioBERT — это версия BERT, переобученная на аннотациях PubMed и полнотекстовых статьях, поэтому она лучше подходит для биомедицинскогоконтента 10. (2) ClinicalBERT — это вариант BERT, обученный на ЭМК, поэтому он специально настроен для понимания клинических заметок и отчётовврачей 11. (3) BlueBERT — это ещё одна биомедицинская модель НЛП, обученная на наборах данных PubMed и MIMIC-III, оптимизированная для распознавания медицинских данных втексте 12. (4) PubMedBERT — это трансформерная модель, обученная только на данных PubMed, что помогает ей действительно распознавать уникальные закономерности и терминологию, встречающиеся в биомедицинскомписьме 13.
Хотя эти модели достигают передовых результатов по бенчмаркам BioNER, их зависимость от крупных, маркированных наборов данных и контролируемой тонкой настройки ограничивает их адаптацию к новым биомедицинскимобластям 14. Кроме того, переходы между научной биомедицинской литературой (например, аннотации PubMed) и клиническими заметками (например, набор данных i2b2 2010) дополнительно ухудшают производительность контролируемых системBioNER 15.
Основные ограничения текущих исследований BioNER включают: Зависимость от аннотированных данных: существующие модели на основе трансформаторов требуют обширных маркированных наборов данных, которые редки в специализированныхбиомедицинских областях 16. Отсутствие обобщения на невидимые сущности: Современные модели испытывают трудности с распознаванием редких или новых биомедицинских терминов, отсутствующих в обучающихданных 17. Ограниченное исследование обучения с минимальным уровнем и нулевой выстрелом: Большинство исследований сосредоточены на полностью контролируемом обучении, с минимальным изучением парадигм с низким уровнем данных дляBioNER 18. Неэффективная адаптация LLM: Хотя такие LLM, как GPT-4 и LLaMA, демонстрируют сильную нулевую эффективность в целом NLP, их применение в биомедицинском NER остаётся недостаточно изученным из-за терминологической сложности и отсутствия специфических для предметныхзаданий 19.
Чтобы устранить эти пробелы, в исследовании рассматриваются следующие ключевые исследовательские вопросы: Как обучение с минимальными выстрелами может улучшить результаты BioBERT в биомедицинском NER при минимальном маркировании данных? Может ли нулевое выведение с использованием LLM точно распознавать биомедицинские объекты без специфической для каждой области тонкой настройки? Как обучение на основе подсказок может повысить результаты zero shot в биомедицинских задачах NER? Какой оптимальный гибридный подход, сочетающий псевдо-метки, генерируемые BioBERT и LLM, для улучшения BioNER в условиях с ограниченными ресурсами? Как состязательная подготовка влияет на надёжность моделей BioNER с небольшим количеством и нулевой выстрелом?
Цель этого исследования — разработать новую адаптивную биомедицинскую рамку NER, которая использует обучение с минимальным и нулявым способом для решения проблем, связанных с дефицитом маркированных данных. Цель исследования — усилить возможности генерализации BioBERT и LLM, изучая методы быстрой инженерии, контрастивное обучение и состязательную подготовку.
Исследование строится вокруг следующих целей: (1) Разработка несколькократного учебного конвейера для биомедицинского NER путём тонкой настройки BioBERT на ограниченных аннотированных данных. (2) Оценка нулевых LLM (например, GPT-4, LLaMA, Falcon) для биомедицинского NER с использованием специализированной инженерии подсказок. (3) Создание гибридного подхода, интегрирующего тонкую настройку BioBERT с псевдо-метками, генерируемыми LLM, для улучшения распознавания сущностей в малоресурсных биомедицинских наборах данных. (4) Проведение сравнительного анализа нескольких выстрелов и нулевое обучение с использованием стандартных биомедицинских ориентиров (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) Внедрение состязательного обучения (FGSM, PGD) для повышения устойчивости модели к шумным вариациям биомедицинского текста.
Это исследование вносит вклад в область биомедицинского НЛП и распознавания сущностей, внедряя стратегии BioNER с минимальными и нулевыми дозами для решения проблемы дефицита меток в биомедицинских наборах данных и демонстрируя, как LLM можно использовать для нулевого биомедицинского NER с помощью оптимизированной инженерии подсказок. Предлагаю гибридную структуру, сочетающую тонкую настройку BioBERT и синтетические аннотации, генерируемые LLM, для лучшего обобщения. Оценка влияния состязательного тренировки на модели BioNER для повышения устойчивости к смещению доменов. Предоставляя сравнительный ориентир эффективности BioNER по контролируемым, маловыстрелным и нулевым выстрелам.
Обзор литературы
Сивараджкумар иВанг 20 разработали HealthPrompt — фреймворк Zero-Shot Learning (ZSL) для клинической НЛП, который решает проблему отсутствия аннотированных клинических наборов данных. Вместо тонкой настройки предварительно обученной языковой модели (PLM) они применяли обучение на основе подсказок, где определения задач настраиваются с помощью структурированных шаблонов. Их оценка шести PLM, включая BioBERT и ClinicalBERT, на базе данных MIMIC-III показала, что ClinicalBERT достиг наилучшей точности (85%) и F1-балла (86%) для классификации клинического текста. Это исследование показывает, что обучение с нулевой дозой на основе подсказок (ZSL) может поддерживать контролируемые модели в клинической обработке естественного языка (NLP), не требуя обучающих данных.
Кеминг Лу и команда21 разработали BIODLM — новый подход к тонкой настройке дискриминативных языковых моделей (DLM) для биомедицинской области с помощью непрерывного предварительного обучения на основе подсказок. Их основной целью было повысить производительность как в малоразборочных, так и в нулевых задачах в биомедицине, используя хитрую настройку подсказок и метод обнаружения заменённых токенов (RTD). Чтобы это работало, они экспериментируют с лексикой, намеренно смешивая термины, специфичные для конкретной области, и используют PubMedBERT как генератор во время предварительного обучения. Результаты хорошие: BIODLM действительно превзошёл обычную тонкую настройку на базе CLS, получив макросреднюю точность 50,2% при полном контроле и 43,4% в режиме нуля выстрела.
Цзунхай Яо иколлеги 22 выбрали другой подход, сосредоточившись на генерации подсказок, учитывающих различия в контексте. Их цель заключалась в том, чтобы уменьшить странные предвзятости, которые могут возникать при заданиях на основе подсказок, и сделать оценку BioLAMA-более прозрачной и интерпретируемой. Другими словами, они стараются убедиться, что эти языковые модели давали нам логичные ответы, а не просто улавливались на умно сформулированные подсказки.
Они ввели метрику оценки, основанную на изменении ранга (UCM: Understand–Confuse–Misunderstand) вместо традиционной точности Top-k, для оценки PLM по распознаванию биомедицинских объектов. Эксперименты на 12 PLM, включая модели на базе BioBERT, ClinicalBERT и RoBERTa, показали улучшение эффективности BioLAMA для крупных N-M соотношений и редких биомедицинских объектов. BioBERT достиг Accuracy@1 40,7% и UCM Understandability 32,8%, превзойдя традиционные показатели Top-K.
Yeh и др.23 исследовали подсказки для экстракции биомедицинских отношений с использованием набора данных ChemProt для улучшения тонкой настройки мало- и полных данных, специфичных для домена. Они разработали шаблоны на основе подсказок, которые включают показатели оценки, такие как частота, конкретика и сходство, чтобы оптимизировать выбор слов для меток. Используя базу BioMed-RoBERTa, их метод получил результат F1 90,09, превзойдя SciFive-Large на 1,14 F1 и превзойдя обычную тонкую настройку на 14,21 F1. Это подтверждает, что обучение на основе подсказок улучшает результаты биомедицинского NER при меньшем числе примеров обучения.
Сусанти и Холсмоэль 24 изучали верификацию причинных графов на основе НЛП, сравнивая тонко настроенные языковые модели и LLM на основе подсказок. Они обучали модели BioBERT и GPT для классификации под надзором причинно-следственных отношений и оценивали LLM на основе подсказок с нулевой и малочастотной подсказкой. Результаты по биомедицинским и открытым наборам данных показали, что тонко настроенные модели превосходили подсказки LLM, достигая до 20,5% более высоких результатов F1. Исследование подчёркивает необходимость продвинутой подсказки и настройки, специфичной для набора данных, для повышения точности извлечения причинных связей.
Чен и др.25 предложили фреймворк генерации экземпляров на основе знания и контрастного обучения для малоэффективного BioNER. Их подход использует графы доменных знаний для генерации разнообразных биомедицинских объектов и применяет контрастное обучение на основе вопросов для улучшения распознавания сущностей путём измерения взаимной информации между парами запрос–ответ. Оценённая на основе fbenchmark-наборов данных (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE), их модель достигла до 7,1% улучшения F1 по сравнению с современными моделями в 20-инъекционных случаях. Их код доступен публично по адресу: https://github.com/cpmss521/KGPC.
Чен и др.26также предложили подход к обучению подсказок для обнаружения биомедицинских заявлений, преобразуя классификацию текста в задачу моделирования маскированного языка (MLM). Используя BERT, RoBERTa и T5 с жёсткими и смешанными шаблонами, они повысили точность прогнозирования претензий. В наборе данных BioClaim их модель T5 с смешанными шаблонами достигла улучшения результата F1 на 5,3% по сравнению с предыдущими моделями, что позволило устранить разрыв между предобучением и тонкой настройкой в PLM с использованием прогнозирования с использованием маскированных токенов.
Райан Ши, Ин Конг Тан и др.27 оценивали LLM на предмет вывода реакции на онкологические заболевания на основе радиологических отчётов с использованием моделей трансформаторов, Bi-LSTM, CNN и классического ML. Их метод включал дополнение данных (перестановку предложений и потерю согласованности) и тонкую настройку на основе подсказок. Трансформатор GatorTron достиг наилучшей точности: 0,8916 на тестовом наборе и 0,8976 после увеличения. Тонкая настройка на основе подсказок обеспечивала эффективную работу с всего 500 отчётами с маркировкой.
Ху и др.28 оценивали GPT-3.5 и GPT-4 для клинического NER, повышая результаты с помощью четырёхкомпонентной системы подсказок: базовые подсказки, рекомендации на основе рекомендаций, инструкции на основе ошибок и образцы с небольшим числом инъекций. В наборах данных MTSamples и VAERS GPT-3.5 и GPT-4 улучшили свои расслабленные результаты F1 с 0.634/0.804 и 0.301/0.593 до 0.794/0.861 и 0.676/0.736 соответственно. Хотя результаты всё ещё отстают от BioClinicalBERT (F1: 0.901 на MTSamples, 0.802 по VAERS), эти результаты показывают растущую эффективность LLM в клиническом NER при правильных стратегиях подсказки.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
1. Процедура


2. Настройка окружающей среды
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Оценка моделей распознавания биомедицинских именованных сущностей (NER) с минимальным выстрелом и нулевой выстрелом была проведена на основе разнообразного биомедицинского набора данных, основанных на аннотациях PubMed, клинических заметок и корпусах вопросов с биомедицинскими вопросами. Был проведён сравнительный анализ эффективности с устоявшимися моделями, включая BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5 и GPT-4. Предлагаемая модель показала превосх...
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Противоречивые результаты, неожиданные результаты и расхождения с другими исследованиями
Несмотря на превосходящие результаты предлагаемой модели, появились некоторые противоречивые результаты по сравнению с существующими исследованиями. Модели на базе BioBERT традиционно демонстрировали высокие результаты в биомедицинском распознавании именованных сущностей (NER), как отмечалось в предыдущих опросах и сравнительных исследованиях биомедицинских систем NER
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Авторам нечего раскрывать.
Ни одного.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
| Имя | Компания | Каталожный номер | Комментарии |
|---|---|---|---|
| Основная модель | BioBERT-основа (v1.1) | Обнимающее лицо: Монолог/Биоберт-v1.1 | |
| Фреймворк глубокого обучения | PyTorch 2.3.1 | https://pytorch.org/ | |
| Аппаратное обеспечение GPU | NVIDIA A100 (40GB VRAM) | NVIDIA | |
| Большая языковая модель (LLM) | GPT-4 | OpenAI API | |
| Операционная система | Окна | Microsoft | |
| Параметрически эффективная настройка | LoRA (через библиотеку PEFT 0.6.2) | https://github.com/huggingface/peft | |
| Язык программирования | Python 3.9.18 | Фонд программного обеспечения Python | |
| Zero-Shot Baseline LLM | GPT-3.5-Turbo | OpenAI API |
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE
Запросить разрешение