1. 大学临床研究方案:
- 为本项目制定了两项大学研究方案。第一项方案允许前瞻性采集来自肺癌、食管癌、类癌肿瘤、胸腺瘤和间皮瘤患者的组织样本。该方案还允许采集患者的血液及其他体液,用于生物标志物研究。根据此方案,研究人员可通过病历摘录的方式获取这些样本来源患者的临床信息,并将样本和临床数据存储于受保护的数据库中。
- 第二项方案与第一项类似,但允许研究人员获取患者在癌症诊断和治疗过程中先前已储存的组织及其他样本。凡已在芝加哥大学同意接受手术并签署本方案的患者均有资格参与。
2. 临床数据收集方案:
- 在芝加哥大学医学中心接受上述恶性肿瘤治疗的患者被纳入本研究方案。
- 符合条件的患者由其主治肿瘤科医生确定,并由接受过两项方案培训的临床团队成员获取知情同意。
- 获得知情同意后,由临床支持团队成员通过病历摘录获取患者的病史信息,并将其录入数据库。
3. 标本采集方案:
组织样本
- 通过活检或手术从患者常规临床诊疗中获取的已知或疑似恶性病变组织被纳入本方案。未额外采集超出患者诊断所需范围的组织。
- 在切除用于制备永久切片的样本后,将剩余组织置于冰上。
- 组织采集技术人员将剩余样本置于冰上并运送至病理科。
- 根据标准操作程序,对剩余组织进行称重、测量、转移至储存容器、标记并做好完整记录。
- 标本长期储存在病理科的 -80°C 冰箱中。
- 为获取已接受胸部恶性肿瘤手术患者的组织样本,参考了合作外科医生和放射肿瘤科医生维护的患者名单,以此确定目标患者。若获得知情同意,可从病理科调取其肿瘤组织样本。
血液样本
- 在临床指征采血过程中,本方案还允许额外采集2至6管血液,包括一管5 mL绿色头盖(肝素)试管、一管10 mL紫色头盖试管(EDTA用于种系DNA)和一管10 mL红色头盖(血清)试管。
- 在不同时间点最多采集六份样本,并记录每次采血的日期。
- 血液样本以2000 rpm离心10分钟。
- 将血浆和血清成分分装至冻存管中,每份1 mL。
- 为收集白细胞,取界面层/红细胞组分上层1–2 mL,加入1–2 mL细胞保存液(MEM EBS培养基 + 10%胎牛血清 + 5% DMSO)重悬。
- 所有样本在异丙醇冷冻盒中于-70°C至-80°C缓慢冷冻16–24小时,随后转移至-70°C至-80°C的储存箱中。
- 所有样本均由实验技术人员贴上带有条形码的唯一标识符,并在样本采集表中进行相应记录。
其他体液:
- 未用于临床用途的体液可按照本方案进行收集和保存。痰液样本被收集后送检进行细胞学分析。在转运过程中,痰液样本需置于冰上并在4°C条件下保存。
- 随后将痰液样本转移至15 mL Falcon离心管中,在1400 rpm条件下离心10分钟。
- 将上清液分装至6 mL冻存管中,每份4 mL。冻存管置于超低温冰箱、干冰或异丙醇冷冻盒中,逐步冷冻至-70°C至-80°C。16至24小时后,将样本转移至-70°C至-80°C的长期储存箱中。
- 所有样本均由实验技术人员使用条形码唯一标识进行标记,并在样本采集表中进行相应记录。
4. 构建信息学基础设施:
- 在评估了多个数据库管理程序后,基于其可操作性以及链接相关数据集的能力,选择了 Microsoft Access 作为胸科肿瘤学项目数据库计划的临床和实验室数据存储程序。
- 召集了一支由临床医生、基础科学研究人员、生物统计学家和生物信息学专家组成的团队,以确定数据库中需要采集的感兴趣变量。
- 该团队根据胸科肿瘤学研究人员的需求,并参照美国国家癌症研究所(National Cancer Institute)关于通用数据元素(Common Data Elements, CDEs)所设定的标准,确定了与患者人口统计学、癌症特征、流行病学因素以及样本注释相关的数据元素。
- 团队制定了一套编码方案,以使数据可用于科研分析。在可能的情况下,使用数值型变量对数据进行编码,以减少数据库中自由文本的输入量。
- 根据相关信息的不同方面,将感兴趣的变量分配至 Microsoft Access 中的七个不同数据表中进行采集。
5. 设计每个表格的内容:
- 建立了七个主表:1)患者表,2)样本数据表,3)组织芯片(TMA)表,4)DNA样本表,5)胸部肿瘤学会议表,6)细胞系表,以及第7)C. elegans 表。
- 患者表是数据库中唯一用于存储患者临床相关信息的表格,包括患者的癌症情况、临床病程、危险因素及其预后(图1)。该设计的目的是限制数据库内的数据冗余。
- 样本数据表用于连接病理标本与其对应的患者来源。每个样本均分配一个样本病理编号,该编号与患者的病历号相关联。每位患者可提供多个标本,因此该表还包括标本采集日期及标本类型信息:初发肿瘤、复发肿瘤或尸检标本。
- 截至目前,TMA表已用于记录63种不同蛋白质的蛋白表达数据。通过使用抗体对蛋白质进行定位,TMA可用于表征差异表达蛋白在肿瘤组织与非肿瘤组织中的分布情况(图2)。蛋白表达水平由病理学家根据染色强度和阳性染色百分比评估,以0、1、2或3分表示。
在评估染色百分比时,0分表示无染色,1分表示染色比例小于11%,2分表示染色比例小于50%,3分表示染色比例大于50%。在评估染色强度时,评分也基于相对染色量,采用0至3分的评分标准。在某些情况下,免疫组化(IHC)切片还会通过高分辨率扫描,并由自动细胞成像系统(ACIS)成像软件定量分析染色强度,与病理学家评分并行进行。然而,无论采用哪种方法,评分越高均表示蛋白表达水平越高。
此外,TMA表还标注了TMA打孔位置,以供后续参考。同时,数据库中还包括组织来源(肿瘤、正常组织、淋巴结、转移组织)、样本内的位置(中心、边缘)、癌症组织学类型以及病历号,以便将这些信息与患者表关联。
- DNA样本表列出了实验室中保存的所有DNA样本。DNA样本通过患者的病历号与其来源患者相关联。该表记录了样本的基本信息,以描述其来源,包括肿瘤部位和组织学类型。该表的目的是描述已通过聚合酶链式反应(PCR)、标准DNA测序和突变分析等方法在样本中鉴定出的遗传变异。
该表还记录了氨基酸改变、核苷酸改变、纯合性、同义性以及发生突变的基因等变量。已研究的基因示例包括Paxillin、cCbl、EGFR、p53、KRAS、cMet和EphB4。表中还列出了鉴定这些突变的研究人员。
- 数据库中的第五个表是胸部肿瘤学会议表。胸部肿瘤学会议是每周一次的会议,由内科肿瘤学家、胸外科医生、病理学家、放射科医生、放疗肿瘤学家及其他胸部肿瘤临床团队成员参加,共同制定协调一致的患者治疗方案。该表的目的是记录在会议中作为标准诊疗一部分被讨论的患者。该表还记录了每位患者可用的病理标本信息。
- 第六个表是细胞系表。该表在数据库中为独立存在的表格,不与其他任何表格关联。它描述了实验室为研究目的所使用的细胞系。该表记录了细胞系DNA中突变的氨基酸改变、核苷酸改变、纯合性、同义性以及突变位置。
- 第七个表是C. elegans 表,同样为独立存在的表格。该表列出了同源的受体酪氨酸激酶,并包含“针刺评分”(needle score),用于衡量其与人类蛋白的相似程度。
6. 建立表之间的关系:
- 每个表都被分配一个主键,作为表中每条记录的唯一标识符。根据定义,唯一标识符的值不能重复。例如,在“患者”表中,主键是病历号(MRN),因为一个病历号只能对应一位唯一的个体。在“样本数据”表中,主键是样本病理编号(SP编号)。由于组织微阵列(TMA)表和DNA样本表原本没有唯一标识符,因此为它们分别建立了虚拟编号作为主键。随后,TMA表和DNA表分别通过MRN和SP编号与其它表关联。这确保了每个TMA打孔样本和每份DNA样本均可追溯至对应的样本信息以及供体患者的临床信息。
- 在Microsoft Access中,各个表通过其主键相互关联,从而建立逻辑关系(图3)。这些关系对于生成从多个表中提取数据的查询至关重要。
7. 查询:
- 在 Microsoft Access 中执行相关数据集的查询相对简单。可通过选择“创建”选项卡下的“查询设计选项”来设计查询。
- 选择并显示包含感兴趣字段的表。
- 从相关表中选择变量,并可根据研究者的特定条件对变量进行筛选(图 4)。
- 然后运行该查询,结果将以电子表格形式列出所需的字段。
8. 导出数据:
- 生成查询后,即可导出数据。尽管大多数研究人员倾向于将数据导出为 Microsoft Excel 电子表格格式,但也可通过“外部数据”选项卡下的导出菜单将数据导出至其他多种程序。可使用相应的文件扩展名保存数据。
- 当数据被导出用于统计分析时,导出内容将包含一组预设的变量,以便进行综合分析以控制协变量。
9. 导入数据:
- 导入数据时,导入数据的格式必须与 Access 表格的格式完全匹配。待导入表格中的关注变量必须与 Access 表格中的字段名称完全相同,拼写必须完全一致,且在 Access 表格中无空格的位置不得存在空格。
- 当两个表格的结构达成一致后,用户即可使用追加查询或更新查询将数据导入 Access。追加查询允许用户向 Access 数据库中添加新的数据行。例如,若获得了数据库中尚不存在的患者信息,则可使用追加查询添加这些患者。然而,若现有患者或样本的数据需要修改,则必须对这些条目执行更新查询。
10. 更新数据库:
- 数据库项目成员在确保数据库保持最新方面具有明确的职责分工。一名全职员工负责定期根据临床中已签署知情同意书的患者信息,向数据库中录入和更新临床数据。
- 另一名全职员工担任数据管理员,负责在实验室数据可获取时及时收集,并通过更新或追加查询将这些信息输入数据库。
- 接受过方案培训的研究助理负责每六个月对数据库进行一次系统性更新,以获取最新的可用数据。这对于生命状态和末次随访日期等字段尤为重要,因为这些字段直接影响基于数据开展的生存分析结果。
11. 数据库访问:
- 该数据库仅对符合 HIPAA 要求且在 IRB 协议涵盖范围内的人员开放。访问权限进一步限制为接受过 Microsoft Access 培训并直接负责数据更新或修改的人员。
- 对数据库有贡献的研究人员可向数据管理员申请获取数据库中的信息,但不得直接访问数据。
- 数据管理员在生成导出查询时,通过移除病历号和患者姓名等变量,向申请者提供去标识化的信息。
12. 代表性结果:
研究人员可能希望了解Paxillin蛋白在非小细胞肺癌中过表达的临床意义。由于该研究人员已在数据库中生成了大量关于Paxillin的组织微阵列(TMA)数据,数据管理员批准其访问临床信息的请求,以便将实验室数据与临床数据进行关联分析。数据管理员运行一个查询,将“患者表”和“TMA表”合并。来自“患者表”的关注变量包括患者的出生日期、种族、癌症组织学类型、癌症分期、诊断日期、生存状态、死亡日期以及末次随访日期。利用这些变量(如诊断时年龄和癌症分期),可对重要的混杂因素进行校正和控制。来自“TMA表”的信息则可提供肿瘤类型和蛋白表达水平等关键数据。
由于这两个表格通过病历号相互关联,因此分析结果中包含了其肿瘤组织已进行Paxillin表达研究的患者信息。可根据需要对结果进行筛选,仅显示非小细胞肺癌患者的数据,并可根据研究人员的具体需求进一步细化结果。
这些结果可导出供生物统计学家进行原始数据分析,然后将结果共享给研究人员。
项目主页:数据库模板和标准操作程序可从以下网址获取:
http://www.ibridgenetwork.org/uctech/salgia-thoracic-oncology-access-template
许可: 可免费用于学术和非营利用途。
非学术用户使用限制:商业用户需获得许可。有关商业用途的问题,请联系芝加哥大学技术与知识产权办公室(UChicagoTech),电话 (773) 702-1692,或访问 www.tech.uchicago.edu

图1. 显示Access数据库中患者表部分数据的截图。

图 2. 组织微阵列(TMA)示意图2

图3. 截图显示在Access数据库中各表之间建立的关系。表通过主键相互关联。

图 4. 针对Paxillin突变、TMA结果和临床变量的示例查询。