Клинические случаи (КЦДЗ) являются основные средства обмена, замечания и идеи в медицине. Они служат как основной механизм коммуникации и образования для врачей и студентов-медиков. Исторически КЦДЗ также предоставили счетов возникающих заболеваний, их лечения и их генетическим стола1,2,и3,4. Например первый лечения человека бешенство Луи Пастер в 18855,6 и первое применение пенициллина в пациентов,7 были оба сообщили через КЦДЗ. Начиная с апреля 2018, были опубликованы более 1,87 миллионов КЦДЗ с более половины миллиона в течение последнего десятилетия; журналы продолжают предоставлять новые места для этих докладов8. Хотя уникальные по форме и содержанию, КЦДЗ содержат текстовые данные, которые в основном неструктурированных, содержат широкий словарный запас и касаются взаимосвязанных явлений, ограничивая их использования в качестве ресурса структурированной. Требуются значительные усилия для извлекать подробные метаданные (например, «данные о данных», или в данном случае, описания содержимого документа) от КЦДЗ и установить их как данные обнаружимым, доступной, совместимых и многоразовые (ярмарка)9 ресурсов.
Здесь мы описываем процесс для извлечения текста и числовых значений для стандартизации описания конкретных биомедицинских концепций в опубликованных КЦДЗ. Эта методология включает шаблон метаданных для руководства заметки; Смотрите Рисунок 1 обзор этого процесса. Применение процесса аннотации к большой коллекции отчетов (например, несколько тысяч определенного типа болезни презентации) позволяет Ассамблее управляемой и структурированного набора аннотированный клинических текстов, достижение machine-readable Документация и биомедицинских явления встроенные в каждой клинической картины. Хотя форматы данных, таких как предоставляемые HL7 (например., версии 3 стандарта обмена сообщениями10 или быстро здравоохранения ресурсов совместимости [FHIR]11), LOINC12и пересмотр 10 международной статистической Классификация болезней и связанных с ними проблем со здоровьем (МКБ-10)13 обеспечивают стандартов для описания и обмена клинических наблюдений, они не поимка текст, окружающих эти данные, они не предназначены для. Результаты нашей методологии лучше всего использовать для реализации структуры на КЦДЗ и облегчения последующего анализа, нормализации через контролируемые словари и систем кодирования (например., МКБ-10), и/или преобразования в форматы клинических данных, перечисленных выше .
Добыча ресурсов КЦДЗ является активной области работы в рамках биомедицинских и клинических информатики. Хотя предыдущие предложения стандартизировать структуру дело отчеты (например., используя HL7 v2.514 или стандартизированной терминологии фенотип15) заслуживают похвалы, вполне вероятно, что КЦДЗ будет продолжать следить за целый ряд различных естественный язык форм и документов макеты, как они имеют большую часть прошлого века. В идеальных условиях авторы новых отчетов следуйте уход Руководство16 чтобы убедиться, что они являются всеобъемлющими. Подходы, чувствительных к естественного языка и его отношение к медицинской концепции, поэтому может быть наиболее эффективным в работе с новым и архивированных отчетов. Ресурсы, такие как ремесло17 и те производства информатики для интеграции биологии и курирование18 прикроватная (i2b2) поддерживать подходы, обработки естественного языка (NLP) пока не специально сосредоточиться на КЦДЗ или клинических повествования. Аналогично медицинские инструменты НЛП такие cTAKES19 и зажим20 были разработаны, но как правило определить конкретные слова или фразы (то есть, подразделений) в документы, вместо того, чтобы общие концепции, обычно описывается в КЦДЗ.
Мы разработали стандартизированных метаданных шаблон для функции, обычно включаемых в КЦДЗ. Этот шаблон определяет возможности наложить структуры на КЦДЗ — важным прекурсором для углубленного сравнения содержимого документа-еще не обеспечивает достаточную гибкость, чтобы удерживать семантического контекста. Хотя мы разработали формат, связанный с этим шаблоном, подходящими для ручной аннотации и вычислений с помощью текста, мы обеспечили, что это особенно легко использовать для ручного комментаторы. Наш подход заметно отличается от более сложных (и, следовательно, менее сразу понятно неподготовленным исследователей) рамки как FHIR21. Следующий протокол описывает изолировать функции документов, соответствующий типу данных каждого шаблона с одним набором значений, соответствующих этим в одной CCR.
Типы данных в шаблоне являются те самые описательные КЦДЗ и медицинских документов, ориентированных на пациента в целом. Аннотации этих функций способствует находимости, доступность, совместимости и повторное использование CCR текста, главным образом путем предоставления в ее структуре. Типы данных, в четыре общие категории: идентификации документа и аннотации, судебный отчет идентификации (например, свойства документа уровня), медицинское содержание концепции (главным образом концепции уровня свойства) и подтверждения (т.е. особенности предоставления доказательств финансирования). В этом процессе аннотации каждый документ включает в себя полный текст CCR, минуя любой материал содержимое документа, независимых дела (например, экспериментальные протоколы). КЦДЗ, как правило, меньше, чем 1000 слов каждая; один корпус идеально быть проиндексирован же библиографическая база данных и находиться в том же письменного языка.
Продуктом подход, описанный здесь, при применении к CCR корпус, является структурированный набор аннотированных клинических текста. Хотя эта методика может быть выполнена полностью вручную и была разработана чтобы быть выполнены специалистами домена без опыта информатики, он дополняет подходы обработки естественного языка, указанного выше и предоставляет данные, подходящие для Вычислительный анализ. Такой анализ может представлять интерес для аудитории исследователей, помимо тех, которые часто читают КЦДЗ, включая:
- тех, кто занимается презентации болезни, их ключевых симптоматология, обычные диагностические подходы и процедуры
- те, кто пожелает сравнить результаты клинических испытаний с события, описанные в рамках клинических литературы, потенциально содержащих дополнительные замечания и большей статистической мощности.
- Биоинформатика, биомедицинской информатики и компьютерной науки исследователей, которые требуют медицинские язык структурированных наборов данных или высокого уровня понимания медицинских историй из
- Исследователи политики правительства, упором на как клинические испытания могут лучше отражать как диагностики и лечения, как это происходит в действительности
Обеспечение соблюдения структуры на КЦДЗ может поддерживать многочисленные последующие усилия, чтобы лучше понять язык медицинских и биомедицинских явлений.