方法文章

一种用于临床病例报告的元数据提取方法,以实现对生物医学概念的深入理解

15.9K 次观看

DOI:

10.3791/58392

2018年9月20日

本文内容

摘要

我们提出了一种从临床病例报告中提取描述生物医学概念文本的方案及相应的元数据模板。通过该方案生成的结构化文本数据可用于对数千份临床叙述进行深度分析。

摘要

临床病例报告(CCRs)是医学领域分享观察结果和见解的重要方式。这类文档的形式各不相同,内容涵盖多种新颖的疾病表现和治疗方法的描述。迄今为止,CCRs 中的文本数据大多为非结构化形式,需要大量人力和计算资源才能将其转化为可用于深入分析的有效数据。在本方案中,我们描述了识别 CCRs 中常见特定生物医学概念对应元数据的方法。我们提供了一个元数据模板,用以指导文档标注,并认识到对 CCRs 施加结构化可结合人工与自动化手段共同实现。本文提出的方法适用于从大规模文献语料库(例如,数千份 CCRs)中组织与概念相关的文本,也可轻松调整以支持更聚焦的任务或少量报告的处理。所生成的结构化文本数据包含足够的语义上下文,可支持多种后续文本分析工作流程:通过荟萃分析确定如何最大化 CCR 的细节信息、开展罕见病的流行病学研究,以及构建医学语言模型等任务,均可借助结构化文本数据而变得更加可行和易于管理。

引言

临床病例报告(CCRs)是医学领域分享观察结果和见解的基本方式。这些报告为临床医生和医学生提供了基础的交流与教育机制。历史上,临床病例报告还曾记录新兴疾病的发现、治疗方法及其遗传背景1,2,3,4。例如,路易·巴斯德(Louis Pasteur)于1885年首次治疗人类狂犬病5,6,以及青霉素在患者中的首次应用7,均通过临床病例报告发表。截至2018年4月,已有超过187万篇临床病例报告发表,其中过去十年内发表的超过50万篇;期刊仍在持续为这类报告提供新的发表平台8。尽管临床病例报告在形式和内容上具有独特性,但其所包含的文本数据大多为非结构化,词汇量庞大,且涉及相互关联的现象,限制了其作为结构化资源的利用。要从临床病例报告中提取详细的元数据( "关于数据的数据",在本语境下指对文档内容的描述),并将其建立为可发现、可访问、可互操作和可重用(FAIR)9的数据资源,需要投入大量努力。

本文描述了一种从已发表的临床病例报告(CCR)中提取文本和数值的方法,旨在标准化特定生物医学概念的描述。该方法包括一个用于指导标注工作的元数据模板;此流程的总体概述见图1。将该标注流程应用于大量报告(例如,数千份特定类型的疾病表现报告),可汇总形成一组结构清晰、易于管理的标注临床文本集合,从而实现对每份临床报告中嵌入的机器可读文档和生物医学现象的提取。尽管HL7提供的数据格式(例如,消息传递标准第3版10或快速医疗互操作性资源[FHIR]11)、LOINC12以及《国际疾病与相关健康问题统计分类》第10版(ICD-10)13为临床观察结果的描述与交换提供了标准,但这些标准并未涵盖围绕这些数据的原始文本内容,也并非为此目的而设计。本方法所得结果最适合用于在CCR中强加结构化格式,并促进后续分析、通过受控词汇表和编码系统(例如,ICD-10)进行规范化处理,和/或转换为上述临床数据格式。

在生物医学和临床信息学领域,临床病例报告(CCR)的挖掘是一个活跃的研究方向。尽管此前已有一些标准化病例报告结构的提议(例如,采用HL7 v2.514或标准化表型术语15),这些努力值得肯定,但可以预见的是,临床病例报告仍将继续沿用多种不同的自然语言形式和文档格式,正如过去一个世纪以来的情况一样。在理想情况下,新的病例报告作者会遵循CARE指南16,以确保报告内容全面。因此,能够同时敏感地处理自然语言及其与医学概念之间关系的方法,可能在处理新发表和存档的病例报告时最为有效。诸如CRAFT17以及由“整合生物学与临床信息学”(i2b2)项目18生成的资源等,虽可支持自然语言处理(NLP)方法的发展,但并未专门针对临床病例报告或临床叙述内容。类似地,已开发的医学自然语言处理工具如cTAKES19和CLAMP20,通常仅用于识别文档中的特定词语或短语(实体),而非临床病例报告中常见的广泛医学概念。

我们设计了一个标准化的元数据模板,用于整合临床对照报告(CCR)中常见的特征。该模板定义了用于构建 CCR 结构的特征——这是对文档内容进行深入比较的基本前提,同时保留了足够的灵活性以维持语义上下文。尽管我们设计的此模板格式适用于人工标注和计算机辅助文本挖掘,但我们特别注重使其对人工标注者而言易于使用。我们的方法明显不同于更为复杂的框架(因此对未经训练的研究人员而言不够直观),例如 FHIR21。以下方案描述了如何提取与每个模板数据类型相对应的文档特征,其中一组值对应于单份 CCR 中的内容。

模板中的数据类型通常是用于描述临床病例报告(CCRs)及以患者为中心的医疗文档中最具有代表性的类型。对这些特征进行标注,主要通过赋予文本结构化特征,从而提升CCRs文本的可发现性、可访问性、互操作性和可重用性。这些数据类型分为四大类别:文档与标注标识、病例报告标识即, 文档级属性)、医学内容概念(主要是概念级属性)以及致谢(即, 提供资助证据的特征)。在此标注过程中,每份文档包含一份完整文本的CCR,省略与该案例无关的任何文档内容材料例如, 实验方案)。每篇CCR通常少于1000词;理想情况下,同一语料库应由同一书目数据库索引,且使用同一种书面语言。

将此处所述方法应用于临床对照报告(CCR)语料库时,所得结果为一组结构化的带注释临床文本。尽管该方法可完全由人工执行,且专为无需任何信息学背景的领域专家设计,但它亦可与上述自然语言处理方法相辅相成,提供适用于计算分析的数据。此类分析可能不仅对经常阅读CCR的研究人员具有意义,也对以下领域的科研人员具有参考价值:

  • 关注疾病表现、其关键症状学、常规诊断方法及治疗方案的人员
  • 希望将临床试验结果与临床文献中描述的事件进行比较的研究者,可能由此提供额外观察结果并增强统计效力
  • 需要结构化医学语言数据集或对医学叙述进行高层次理解的生物信息学、生物医学信息学和计算机科学研究人员
  • 专注于临床试验如何最好地反映现实中诊断与治疗情况的政府政策研究人员

对CCR施加结构有助于进一步理解医学语言和生物医学现象的多项后续研究。

方案

1. 文档与注释识别

注意:本类别中的数值可支持注释过程。

  1. 使用注释模板,为该元数据集提供一个特定的标识符, 例如, 案例123。项目中的标识符格式应保持一致(例如, 案例001 通过 病例500).
  2. 指定阅读并注释文档的日期。为保持一致性和可读性,使用类似“Jan 10 2018”的格式。

2. 病例报告识别

注意:本类别中的数值提供文档级别的特征,有助于提升文档的可发现性。

  1. 所有注释中的各个字段格式应保持一致,例如,所有条目中的独立数值均应使用分号分隔,且分号后不加空格。格式应与原始文档中使用的格式相同,与MEDLINE等书目数据库中使用的格式一致。
  2. 提供该文档的标题。
  3. 按原文顺序提供文档所有作者的姓名。所有姓名格式应标准化,统一为姓氏在前、后跟一个或多个名字首字母的形式,例如,Jane B. Park 应写作 Park JB。不包含头衔。多位作者之间用分号分隔,不加其他标点符号,例如 John A. Smith, Jane B. Park 应写作 Smith JA;Park JB
  4. 提供该文档的出版年份。
  5. 提供该文档发表期刊的完整名称。美国国家医学图书馆目录(NLM Catalog)提供了受控的期刊名称列表(https://www.ncbi.nlm.nih.gov/nlmcatalog)
  6. 根据文档中注明的信息,提供作者所属机构的地址。内容可包括院系、地理位置和邮政地址详情。
    1. 若提供了多个地址(例如,作者所属单位不同),仅需注明通讯作者的信息。若无法确定通讯作者,则使用第一作者的地址信息,或不填写机构信息。若通讯作者有多个单位,应同时列出,并用分号分隔。
  7. 根据文档标题部分注明的信息,提供该文档的通讯作者,格式应与“作者”数据类型所用格式一致。
  8. 提供文档标识符(例如,PMID)。
  9. 尽可能提供数字对象标识符(DOI),且该标识符应能通过 https://www.doi.org/ 解析为文档的URL,而非指向PubMed Central页面。
  10. 如可获取,提供指向文档全文的稳定URL为提高可访问性,可指向PubMed Central版本。
  11. 提供文档所用语言。若文档有多种语言版本,应同时列出,以分号分隔。

3. 医学内容

注意:本类别中的数值用于标识文档级、概念级和文本级特征,旨在提升文档的可访问性、互操作性与可重用性。这些特征提供了观察文档内容之间概念和语义相似性的方法,重点关注生物医学主题和事件。本节大多数类别可包含多个文本陈述,每个陈述应使用分号隔开。

  1. 在每个字段中包含上下文细节(例如, “母亲在50岁时患有乳腺癌”),而不是仅提供受控词汇表中的术语(例如, 而非仅“乳腺癌”)。每个观察结果之外无需包含过多细节。
  2. 省略常见重复的词语和短语(例如, 代词、“patient”一词以及“complained of”或“presented with”等短语。尽管多位标注者之间可能存在主观性差异,但通过为每份文档分配多名标注者以及在数据收集后进行自动标准化处理,可降低此类差异。计算后处理方法将根据后续分析需求而有所不同,此处不作详细讨论。
  3. 在注释模板中提供以下信息。
    1. 提供文档中(通常位于页眉)标识出的关键词;各术语间以分号分隔,因为术语本身可能包含其他标点符号。
    2. 提供人口统计学信息,具体包括描述患者背景的任何文字内容,如性别、年龄、种族或国籍。
    3. 提供临床叙述中提及的地理区域,但不包括具体机构地址。不应包含解剖部位或身体结构,但可包括患者居住或曾前往的任何地理区域。
    4. 提供生活方式相关数值,包括任何描述患者日常活动或行为的文字说明,这些活动或行为与其整体健康状况相关。实践中,通常涉及吸烟或饮酒习惯,但也可能包括日光暴露、饮食情况或特定类型体力活动的频率。
    5. 提供与家族史相关的病史信息。包括描述兄弟姐妹、父母及其他家庭成员的临床观察结果和经历事件的任何文字记录。内容应涵盖遗传性疾病以及阴性观察结果。即, 家族史中无相关病史 一种疾病.
    6. 提供与社会史相关的信息,包括人口统计学或生活方式中未涵盖的有关患者背景的文本描述。这些类别之间可能存在内容重叠。所述内容可包括职业史和社会习惯。
    7. 提供与患者既往病史和手术史相关的各项信息。包括描述临床表现开始之前发生的任何医学观察、治疗或其他事件的文本内容。如有记录,应涵盖产科病史以及健康状况良好的时期。
    8. 指定以下16种疾病系统类别中的一项或多项。请注意,这些值为分类选项,而非自由文本。这些类别并非详尽无遗,但应能反映临床表现中所述事件及所诊断疾病所涉及的大多数系统。
      1. 根据《国际疾病分类第十次修订本》(ICD-10)编码系统所使用的分类类别进行归类。参见 表1 有关疾病系统分类及相应 ICD-10 编码范围的列表。
    9. 提供所有体征和症状的详细信息. 包括在初次就诊时描述的任何体征或症状的医学观察记录,如其发病时间、持续时间、严重程度及是否缓解(若已提供)。不要包含结局中描述的症状。如果症状从病史延续至初次就诊,这些信息可能与其他类型有重叠。
    10. 提供任何共病情况的详细信息。包括在初次临床就诊时存在的、描述特定疾病的术语或短语。这些内容可能与病史中的信息存在部分重叠,但“共病”不应包含与“诊断”中相同的术语。
    11. 提供所有诊断技术与操作的详细信息。包括用于诊断目的的医学操作名称,如检查、检验和影像学检查,以及这些检查实施时的具体条件和相关解剖部位例如, 上肢静脉超声。排除检测结果。
    12. 提供诊断的详细信息。包括任何描述疾病诊断的文字陈述,即使最终诊断存在不确定性。
    13. 提供所有实验室检测值和检查结果。包括诊断试验的名称、检测值以及检测时的具体条件。这将涉及与“诊断技术与操作”数据类型中所用术语的重叠。需包含数值型和定性结果。例如, 血常规在正常范围内)是可接受的. 若未提供诊断试验的名称,应使用描述结果的术语(例如, 白细胞减少症),但这些也应包含在体征和症状中。
    14. 提供病理学详细信息。包括描述病理学和组织学研究结果的任何文字说明,涵盖大体病理学、免疫学和显微镜检查研究。所用术语可能与诊断技术与操作(步骤 3.11)中的术语有所重叠。 例如, 通过活检等操作获取样本的步骤。
    15. 提供所有药理学治疗方案。包括治疗过程中所用药物治疗的任何文字描述,涵盖诸如 抗生素 或特定药物名称. 同时,应描述药物治疗停止的时间和方式。
    16. 提供所有干预性操作。包括治疗过程中所采用的治疗性操作的文字描述,如侵入性操作、医疗器械植入以及为促进其他治疗而实施的操作。必要时,还需说明持续进行的治疗性操作何时以及如何终止。
    17. 提供患者的结局。包括报告中所述临床过程结束时描述患者健康状况的所有文字说明,以及任何随访检查结果。
    18. 图像数量;图示数量;视频或动画数量;表格数量
      1. 以如下方式区分图像与图示:图像包括临床诊断产生的各类影像,如照片、显微图像、心电图节律图像及其他诊断成像结果;而图示则指其余所有图像,通常包括数据图表和示意图。
    19. 提供与其他CCR的关系证据。此字段可包括标识符(例如, 该数据集中引用本报告或被本报告引用的其他文献的PMID(PubMed唯一标识码)。
    20. 提供与临床试验关联的证据。此字段可包括引用本CCR的临床试验的标识符。请使用以NCT开头的ClinicalTrials.gov标识符或其他稳定标识符来标明试验。
    21. 包含与本文档对应的数据库交叉链接,包括标识符,最好以数据库名称和稳定URL的形式提供。

4. 致谢

说明:本类别中的数值用于标识文档级别的特征,但在不同出版物之间结构一致性较差。它们提供了有关支持临床研究(CCR)及相关工作的资助机构的详细信息。本类别还包括一篇文章所引用的参考文献总数字段:旨在提供一个粗略的指标,用以衡量该文档与其他任何类型的生物医学文献之间在概念上的关联程度。在本部分的四种数据类型中,请提供以下内容。

  1. 注明支持本工作的所有资金来源、相应的项目负责人(PI)以及相关的资助编号。第一项“资金来源”应包含为本工作提供财务支持的所有机构名称。
    1. 各机构之间用分号和空格分隔,例如National Institutes of Health/National Cancer InstituteDOESmith-Park Foundation
    2. 对于下一项“资助编号”,请注明随资助提供的任何编号或具体名称,并在适当时注明资助获得者(以姓名首字母缩写形式置于括号内),例如R01HL123123 (JP)NS12312 (JP, JS)research training fellowship(JS)。作者可明确声明无相关信息(例如,“未获得资助”);在此类情况下,将作者提供的文本作为“资金来源”项的值。否则,该项应填写“NA”。
  2. 根据作者声明注明披露信息/利益冲突,例如JP为DrugCo公司提供咨询。作者可明确声明无相关信息(例如,“未声明利益冲突”);在此类情况下,将作者提供的文本作为“披露/利益冲突”项的值。否则,同上,该项应填写“NA”。
  3. 注明本文档所引用的参考文献总数(不包括补充材料中提供的参考文献)。此字段中不得包含参考文献正文内容。

结果

注释过程的一个示例如图2所示。本案例22描述了由细菌病原体Burkholderia thailandensis引起感染的表现。作为参考,本CCR的相关部分内容以纯文本格式提供在补充文件1中;本报告中还呈现了一些研究结果,供对比参考。在实际操作中,将HTML或PDF格式的报告转换为纯文本格式,可能有助于提高元数据提取的效率和便捷性。

提供了两组已完成的 CCR 元数据注释示例 表 2第一个示例为模拟数据,用于说明每个值的理想格式,而第二个示例则包含从已发表的关于罕见病肠病性肢端皮炎的临床病例报告(CCR)中提取的实际数值。23.

figure-results-1
图1. 病例报告标注的工作流程。 本文所述方案提供了一种用于识别临床病例报告中常见文本特征的方法。该过程需要构建一个文档语料库。将标注过程的结果汇总为单个文件后,即可识别出与病例报告中医学概念及其描述相关的文本特征。请点击此处查看该图的放大版本。

figure-results-2
图2. 临床病例报告中特定概念文本的识别。 从一份病例报告的文本开始,人工标注者可逐段阅读文档,识别出与元数据模板中每个组成部分相对应的文本片段。识别特征以蓝色高亮显示。对应医学概念的文本以红色标出,并标注其类型;第三列中所有高亮文本均属于病理学(Pathology)类型。请点击此处查看该图的放大版本。

类别描述ICD-10 章节ICD-10 编码范围
cancer任何类型的癌症或恶性肿瘤。IIC00-D49
nervous脑、脊髓或神经系统的任何疾病。VIG00-G99
cardiovascular心脏或血管系统的任何疾病。不包括血液系统疾病。IXI00-I99
musculoskeletal and rheumatic肌肉、骨骼系统、关节和结缔组织的任何疾病。XIIIM00-M99
digestive胃肠道及消化器官的任何疾病,包括肝脏和胰腺。XIK00-K95
obstetrical and gynecological与妊娠、分娩、女性生殖系统或乳房相关的任何疾病。XIV; XVO00-O9A; N60-N98
infectious由感染性微生物引起的任何疾病。IA00-B99
respiratory肺部和呼吸道的任何疾病。XJ00-J99
hematologic血液、骨髓、淋巴结或脾脏的任何疾病。IIID50-D89
kidney and urologic肾脏或膀胱的任何疾病,包括输尿管;以及男性生殖器官的任何疾病,包括前列腺。XIVN00-N53; N99
endocrine内分泌腺的任何疾病,以及代谢紊乱。IVE00-E89
oral and maxillofacial涉及口腔、颌骨、头部、面部或颈部的任何病症。XI; XIIIK00-K14; M26-M27
eye涉及眼睛的任何病症,包括失明。VIIH00-H59
otorhinolaryngologic耳、鼻和/或喉的任何病症。VIIIH60-H95; J30-J39
skin皮肤的任何疾病。XIIL00-L99
rare专用于罕见病报告的特殊类别,定义为在美国影响少于20万人的疾病(参见 https://rarediseases.info.nih.gov/diseases)NANA

表1. 文档标注的疾病分类。 此处列出的分类将用于文档元数据模板中的“疾病系统”数据类型。由于每种疾病表现可能涉及多个器官系统或病因,因此单个临床病例报告可能对应多个分类。这些分类主要参照《国际疾病分类第十次修订本》(ICD-10)编码系统中用于区分各章节的分类方式:文中提供了相应的ICD-10章节及编码范围。某些分类(如口腔与颌面疾病)对应ICD-10系统的多个部分。

数据类型示例 #1示例 #2 (Cameron 和 McClain 1986)
文档与注释标识
内部编号CCR005CCR2000
注释日期2018年3月2日2018年3月1日
病例报告标识
标题一例心内膜炎病例。肠病性肢端皮炎的眼部组织病理学。
作者Grant AB;Chang CDCameron JD;McClain CJ
年份20171986
期刊World Journal of Medicine and Case ReportsBritish Journal of Ophthalmology
机构美国马萨诸塞州波士顿市第一综合医院医学部心脏病学分部明尼苏达大学医学院眼科系,明尼苏达州明尼阿波利斯市,邮编55455
通讯作者Grant ABCameron JD
PMID255555553756122
DOI10.1011/wjmcr.2017.11.001NA
链接https://www.ncbi.nlm.nih.gov/pmc/articles/PMC9555555/https://www.ncbi.nlm.nih.gov/pmc/articles/PMC1040795/
语言英语英语
医学内容
关键词布鲁氏菌病;心内膜炎;二尖瓣NA
人口统计学37岁男性男性儿童
地理区域佛罗里达州;巴西里约热内卢NA
生活方式吸烟;偶尔饮酒NA
家族史父母近亲结婚的五个孩子中的第三个;弟弟患有慢性湿疹NA
社会史建筑工人NA
既往病史(内科/外科)有疲劳病史足月妊娠,无并发症,出生体重8磅9盎司(3884 g);出生后1个月前健康状况良好,之后出现面部水疱样皮疹;皮疹扩散至眼周、鼻部及口周皮肤;腹部和四肢也出现皮肤病变;伴有腹泻及生长发育迟缓;当时皮肤活检显示典型的肠病性肢端皮炎角化不全;随后六年间间断接受广谱抗生素、母乳及二碘羟喹治疗,部分缓解;出现全秃、间歇性肢端皮炎及间歇性腹泻,体重增长不理想;8月龄时出现中枢神经系统受累所致的痉挛;11月龄时发生数次心肺骤停;声带协调障碍;行气管切开术;18月龄时患儿出现搜寻性眼球震颤,伴有双侧视神经萎缩、视网膜血管轻度变细,以及精神运动发育迟缓表现;双侧角结膜炎;皮肤皮疹;3岁时再次行皮肤活检,仍显示典型的肠病性肢端皮炎角化不全;严重皮肤皮疹及腹泻;可见双侧角膜前部明显混浊,但在5岁时复查时已完全消退;频繁感染,包括中耳炎、尿路感染及皮肤感染
疾病系统心血管系统;感染性疾病消化系统;皮肤;眼部;罕见病
体征与症状前一周出现心悸和呼吸困难;就诊时表现为嗜睡、头痛和寒战严重睑结膜炎及双侧角膜前部血管化;严重皮肤皮疹及腹泻;革兰氏阴性菌败血症;典型的肠病性肢端皮炎皮肤病变,胸腺组织缺失,视神经、视交叉及视束显著退变,小脑广泛退变
合并症高血压;高脂血症NA
诊断技术与操作体格检查;心电图;血培养眼部检查;尸体解剖
诊断布鲁氏菌性心内膜炎肠病性肢端皮炎
实验室指标C反应蛋白升高(9 mg/dl);碱性磷酸酶(250 u/l)NA
病理学从血液样本中培养出马耳他布鲁氏菌(Brucella melitensis)双眼外观相似;角膜上皮在整个角膜表面变薄,仅剩1至3层扁平的鳞状上皮细胞;上皮细胞极性完全丧失。仅在右眼角膜周边可识别出鲍曼膜;左眼角膜未见鲍曼膜。双眼均未见变性性或炎症性胬肉;睫状体的环形肌和斜肌广泛萎缩;晶状体囊上皮部分向后迁移,并出现早期皮质变性改变;后极部视网膜色素上皮广泛退变;视网膜附着良好,整体显示轻度自溶改变;后极部部分保留视杆和视锥细胞外节结构,但赤道部前方这些结构完全丧失;双眼神经节细胞层和神经纤维层广泛缺失;视盘及邻近视神经几乎完全萎缩
药物治疗静脉注射庆大霉素 240 mg/日NA
介入治疗人工瓣膜置换术NA
患者结局评估恢复顺利;已出院回家1971年死亡(7岁)
诊断成像/录像记录2;1;0;17;0;0;0
与其他病例报告的关系555555523430849
与临床试验的关系NCT05555123NA
数据库交叉链接MedlinePlus 健康信息: https://medlineplus.gov/ency/article/000597.htmHighWire - PDF: http://bjo.bmj.com/cgi/pmidlookup?view=long&pmid=3756122; Europe PubMed Central: http://europepmc.org/abstract/MED/3756122; Genetic Alliance: http://www.diseaseinfosearch.org/result/143
致谢
资助来源美国国立卫生研究院/国家心肺血液研究所明尼苏达州狮子会;防盲研究基金会;退伍军人事务部;明尼苏达州酒精及其他药物滥用项目办公室
资助编号R01HL123123(授予 AG)NA
披露/利益冲突Grant 博士为 DrugCo 公司的付费代言人。NA
参考文献数量427

表2. 临床病例报告的标准化元数据模板及示例注释。 此处展示了一组临床病例报告中常见的特征,这些特征有助于对其进行概念层级的注释。该模板分为三个主要部分:识别信息、医学内容和致谢,以标明每类病例报告特征的目的及其附加价值。本表包含两组示例注释,一组来自虚构的病例报告,另一组源自关于肠病性肢端皮炎(acrodermatitis enteropathica)病例报告的注释23

补充文件 1. 一份临床病例报告的文本(Chang et al. 2017)。请点击此处下载该文件。

讨论

实施标准化的CCR元数据模板可使其内容更具FAIR性(可发现、可访问、可互操作、可重用),扩大其受众范围,并拓展其应用领域。沿袭CCR在医学传播中作为教学工具的传统用途,医疗卫生培训人员(例如, 医学生、实习医生和进修医生)以及生物医学研究人员可能会发现,经过总结的病例报告内容有助于更快地理解信息。然而,CCR(结构化临床病例报告)在元数据标准化方面最大的优势在于,对这些数据进行索引能够将原本孤立的观察结果转化为可解释的模式。本文提供的方案可作为处理CCR工作流程的第一步,无论该流程旨在进行流行病学分析、上市后药物或治疗监测,还是对发病机制或治疗效果进行更广泛的调查。CCR中识别出的结构化特征可为专注于疾病表现和治疗的研究人员提供有价值的资源,尤其适用于罕见病研究。临床研究人员可利用既往治疗方案的数据,分析记录的症状或副作用,以及在既往护理标准下的改善程度。这些数据还可能推动对新疗法的更广泛分析,分析依据包括疗效、缺乏不良反应或毒性,或药物在性别、年龄组或遗传背景方面的靶向差异。

结构化元数据所带来的优势同样适用于设计用于解析或建模医学语言的计算工作流程。结构化的临床对照报告(CCR)特征还可为报告撰写者提供证据,表明其在哪些方面可提供更易于机器读取(在某些情况下也更易于人类理解)的内容。CCR 之间的差异可能源于未明确提供的观察结果。 例如, 患者的准确年龄可能未被明确指出。同样,如果临床医生认为某些检查或其结果无关紧要,则可能不会提及这些检测。通过提供深度分析所必需的信息缺失示例,对临床对照报告(CCRs)实施结构化可凸显潜在的改进空间。从更广泛的角度来看,医疗文档中结构化文本数据的进一步普及将支持自然语言处理(NLP)在医疗健康领域利用大数据开展学习与研究24,25.

披露

作者无任何利益冲突需要披露。

致谢

本工作部分得到了美国国家心肺血液研究所:R35 HL135772(资助对象:P. Ping);美国国家普通医学科学研究所:U54 GM114833(资助对象:P. Ping、K. Watson 和 W. Wang);美国国家生物医学影像与生物工程研究所:T32 EB016640(资助对象:A. Bui);Hoag基金会和S. Setty博士的捐赠;以及加州大学洛杉矶分校T.C. Laubisch基金(资助对象:P. Ping)的支持。

材料

本文使用的材料清单
姓名公司目录编号评论
临床病例报告数据库n/an/a可通过 PubMed 获取病例报告的全文(例如,使用检索式 "Case Reports"[Filter]),也可通过其他引文数据库(如 Europe PMC,https://europepmc.org/)或直接通过出版商获取。

参考文献

  1. Ban, T. A. The role of serendipity in drug discovery. Dialogues in Clinical Neuroscience. 8 (3), 335-344 (2006).
  2. Cabán-Martinez, A. J., García-Beltrán, W. F. Advancing medicine one research note at a time: the educational value in clinical case reports. BMC Research Notes. 5 (1), 293(2012).
  3. Vandenbroucke, J. P. In Defense of Case Reports and Case Series. Annals of Internal Medicine. 134 (4), 330(2001).
  4. Bayoumi, A. M. The storied case report. Canadian Medical Association Journal. 171 (6), 569-570 (2004).
  5. Pasteur, L. Méthode pour prévenir la rage après morsure. Comptes rendus de l'Académie des Sciences. 101, 765-774 (1885).
  6. Pearce, J. Louis Pasteur and Rabies: a brief note. Journal of Neurology, Neurosurgery & Psychiatry. 73 (1), 82-82 (2002).
  7. Keefer, C. S., Blake, F. G., Marshall, E. K. J., Lockwood, J. S., Wood, W. B. J. PENICILLIN IN THE TREATMENT OF INFECTIONS. Journal of the American Medical Association. 122 (18), 1217(1943).
  8. Akers, K. G. New journals for publishing medical case reports. Journal of the Medical Library Association JMLA. 104 (2), 146-149 (2016).
  9. Wilkinson, M. D., et al. The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data. 3, 160018(2016).
  10. Beeler, G. W. HL7 Version 3-An object-oriented methodology for collaborative standards development. International Journal of Medical Informatics. 48 (1-3), 151-161 (1998).
  11. HL7 FHIR Release 3 (STU; v3.0.1-11917). , Available from: http://hl7.org/implement/standards/fhir/ (2018).
  12. McDonald, C. J. LOINC, a Universal Standard for Identifying Laboratory Observations: A 5-Year Update. Clinical Chemistry. 49 (4), 624-633 (2003).
  13. CDC/National Center for Health Statistics ICD-10-CM Official Guidelines for Coding and Reporting. , Available from: https://www.cdc.gov/nchs/data/icd/10cmguidelines_fy2018_final.pdf (2017).
  14. Rajeev, D., et al. Development of an electronic public health case report using HL7 v2.5 to meet public health needs. Journal of the American Medical Informatics Association. 17 (1), 34-41 (2010).
  15. Biesecker, L. Mapping phenotypes to language: a proposal to organize and standardize the clinical descriptions of malformations. Clinical Genetics. 68 (4), 320-326 (2005).
  16. Riley, D. S., et al. CARE guidelines for case reports: explanation and elaboration document. Journal of Clinical Epidemiology. 89, 218-235 (2017).
  17. Cohen, K. B., et al. Coreference annotation and resolution in the Colorado Richly Annotated Full Text (CRAFT) corpus of biomedical journal articles. BMC Bioinformatics. 18 (1), 372(2017).
  18. Sun, W., Rumshisky, A., Uzuner, O. Evaluating temporal relations in clinical text: 2012 i2b2 Challenge. Journal of the American Medical Informatics Association. 20 (5), 806-813 (2013).
  19. Savova, G. K., et al. Mayo clinical Text Analysis and Knowledge Extraction System (cTAKES): architecture, component evaluation and applications. Journal of the American Medical Informatics Association. 17 (5), 507-513 (2010).
  20. Soysal, E., et al. CLAMP - a toolkit for efficiently building customized clinical natural language processing pipelines. Journal of the American Medical Informatics Association. 25 (3), 331-336 (2018).
  21. Bender, D., Sartipi, K. HL7 FHIR: An Agile and RESTful approach to healthcare information exchange. Proceedings of the 26th IEEE International Symposium on Computer-Based Medical Systems. , 326-331 (2013).
  22. Chang, K., et al. Human Infection with Burkholderia thailandensis, China, 2013. Emerging Infectious Diseases. 23 (8), 1416-1418 (2013).
  23. Cameron, J. D., McClain, C. J. Ocular histopathology of acrodermatitis enteropathica. British Journal of Ophthalmology. 70 (9), 662-667 (1986).
  24. Maddox, T. M., Matheny, M. A. Natural Language Processing and the Promise of Big Data. Circulation: Cardiovascular Quality and Outcomes. 8 (5), 463-465 (2015).
  25. Kreimeyer, K., et al. Natural language processing systems for capturing and standardizing unstructured clinical information: A systematic review. Journal of Biomedical Informatics. 73, 14-29 (2017).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

FAIR

相关文章