需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

用于高效管理组织工程中中等规模、低通量多维数据的数据库

5.9K 次观看

DOI:

10.3791/60038

2019年11月22日

本文内容

摘要

许多研究人员生成的是“中等规模”、低通量且多维的数据,这类数据使用数据库管理比使用电子表格更为高效。本文对数据库的基本概念进行概述,包括多维数据的可视化、关系型数据库结构中表的关联、半自动化数据流程的映射,以及如何利用数据库揭示数据的内在含义。

摘要

科学的进步依赖于日益复杂的数据集,但常用的电子表格程序已无法满足这些信息在规模和复杂性上的增长需求。尽管数据库管理系统有潜力解决这些问题,但其应用目前仍局限于商业和信息学领域。然而,许多研究实验室已经产生了“中等规模”、低速、多维的数据,若采用类似的系统将大受裨益。本文提供了数据库工作原理的概念性概述,并阐述了其在组织工程应用中的优势。以携带层粘连蛋白A/C突变个体的结构成纤维细胞数据为例,说明了特定实验背景下的具体应用场景。示例包括多维数据的可视化、关系型数据库结构中表格的关联、将半自动化的数据流程映射为将原始数据转换为结构化格式的过程,以及解释查询语句的基本语法。通过对数据的分析结果,绘制了多种排列方式的图表,并展示了在细胞排列环境中,阳性对照组——早衰症(Hutchinson-Gilford progeria,一种广为人知的层粘连蛋白病)与其他所有实验组之间细胞组织结构的显著差异。与电子表格相比,数据库方法在时间效率上优势显著,一旦建立后使用简便,可即时访问原始文件位置,并提高了数据的严谨性。鉴于美国国立卫生研究院(NIH)对实验严谨性的强调,由于数据库在高效组织复杂数据方面的强大能力,未来许多科学领域很可能会将其作为常规实践广泛采用。

引言

在当今科学技术迅猛发展的时代,处理大量数据已成为各个学科研究中不可或缺的重要环节。计算生物学和基因组学等新兴领域的兴起,凸显了主动利用技术的重要性。由于摩尔定律以及技术进步带来的持续发展,这一趋势必将延续下去1,2。然而,随之而来的一个后果是所产生的数据量日益增长,已超出以往可行组织方法的处理能力。尽管大多数学术实验室具备处理复杂数据集所需的计算资源,但许多研究团队缺乏构建适应不断变化需求的定制化系统所必需的技术专长3。掌握管理和更新此类数据集的技能,对于实现高效的工作流程和科研产出仍然至关重要。弥合数据与专业技术之间的鸿沟,对于高效地处理、重新更新和分析各种复杂的多维度数据具有重要意义。

在处理大规模数据集时,可扩展性是一个至关重要的考虑因素。例如,大数据是一个蓬勃发展的研究领域,其核心是通过对具有海量规模、高度异质性和高速生成特征的数据(如音频和视频)进行处理,揭示新的科学见解4,5。该领域必须依赖自动化的组织与分析方法,才能有效应对数据洪流。然而,大数据中使用的许多技术术语并未被明确定义,容易造成混淆;例如,“高通量”数据通常指每天新增数百万条记录,而“低通量”数据可能每天仅有数百条记录,这在学术实验室环境中较为常见。尽管利用大数据仍有望带来诸多令人振奋的发现,但大多数学术实验室在解决自身科学问题时,并不需要如此大规模、高算力和复杂的方法5。尽管科学数据随时间推移而日益复杂是毋庸置疑的事实6,但许多科研人员仍在使用无法满足其不断增长的数据需求的组织方法。例如,虽然电子表格程序因其便捷性而被广泛用于组织科学数据,但从长远来看,其存在不可扩展、易出错且效率低下的问题7,8。相比之下,数据库则是解决该问题的有效方案,因其具备良好的可扩展性、成本相对低廉,且易于用于管理持续进行项目中的多样化数据集。

在考虑数据组织方案时,人们通常会立即关注成本、可访问性以及培训和使用所需的时间投入。数据库程序在商业环境中广泛应用,相较于支持大数据系统所需的经费,这些程序更为经济,其价格通常相对低廉甚至免费。事实上,目前存在多种商业和开源软件可用于创建和维护数据库,例如 Oracle Database、MySQL 和 Microsoft(MS)Access9。许多研究人员会感到鼓舞的是,多个 MS Office 学术套件中已包含 MS Access,从而进一步降低了成本考量。此外,几乎所有开发人员都在线提供了详尽的文档,同时还有大量免费的在线资源,例如 Codecademy、W3Schools 和 SQLBolt,可帮助研究人员理解并使用结构化查询语言(SQL)10,11,12。与任何编程语言一样,掌握数据库的使用和 SQL 编程需要一定时间,但凭借丰富的可用资源,学习过程清晰明了,投入的努力完全值得。

数据库可作为提升数据可访问性和聚合便捷性的强大工具,但需明确哪些数据最能从更严格的组织管理中获益。多维性是指测量数据可被分组的条件数量,当管理大量不同条件时,数据库的作用最为显著13。相反,低维度信息使用电子表格程序处理最为简便;例如,一个包含年份及每年对应数值的数据集仅有一种可能的分组方式(即按年份对测量值进行分组)。临床环境产生的高维数据若要有效维护,则需要大量人工组织,这一过程繁琐且易出错,已超出电子表格程序的处理能力13。非关系型(NoSQL)数据库也在多种场景中发挥作用,主要用于数据无法良好地以行和列形式组织的情况14。除常为开源外,此类组织模式还包括图形关联、时间序列数据或基于文档的数据。NoSQL 在可扩展性方面优于 SQL,但无法执行复杂查询,因此在需要数据一致性、标准化以及较少大规模数据变更的场景中,关系型数据库更具优势15。数据库最擅长将数据高效地分组并重新更新为科研环境中常需的多种结构形式13,16

因此,本研究的主要目的是向科学界介绍数据库作为可扩展的数据管理系统在处理“中等规模”、低速数据方面的潜力,并通过患者来源的细胞系实验的具体实例提供一个通用模板。其他类似应用包括河床的地理空间数据、纵向临床研究中的问卷调查,以及微生物在培养基中的生长条件17,18,19。本研究强调了构建数据库时常见的考虑因素及其用途,特别是结合数据管道以将原始数据转换为结构化格式的必要性。文中提供了数据库接口和使用SQL进行数据库编程的基础知识,并通过示例加以说明,使读者能够掌握构建基本框架所需的知识。最后,通过一个实验数据集的示例,展示了数据库如何以多种方式便捷而高效地整合多维度数据。这些信息提供了背景说明、评述和模板,旨在帮助同行科学家在其自身实验需求中实施数据库系统。

为了在科研实验室环境中创建一个可扩展的数据库,过去三年中收集了使用人成纤维细胞的实验数据。本实验方案的主要目的是介绍如何组织计算机软件,使用户能够以最经济且高效的方式汇总、更新和管理数据,但同时也提供了相关的实验方法以供参考。

实验装置
样品制备的实验方案此前已有描述20,21,此处简要介绍。通过旋涂法将聚二甲基硅氧烷(PDMS)与固化剂按10:1比例混合物涂覆于矩形玻璃盖玻片上制备基底,随后包被0.05 mg/mL纤连蛋白,包被方式为无序(各向同性)或微图案化排列的20 µm宽线条(线条间距5 µm)。成纤维细胞在第7代(阳性对照使用第16代)以最佳密度接种至盖玻片上,并在培养基中培养48小时,期间于24小时更换培养基。随后使用4%多聚甲醛(PFA)溶液和0.0005%非离子型表面活性剂固定细胞,接着对盖玻片进行免疫荧光染色,分别标记细胞核(4',6'-二脒基-2-苯基吲哚[DAPI])、肌动蛋白(Alexa Fluor 488鬼笔环肽)和纤连蛋白(兔抗人纤连蛋白多克隆抗体)。再使用二抗(Alexa Fluor 750标记的山羊抗兔IgG抗体)对纤连蛋白进行染色,并在所有盖玻片上加装防荧光淬灭封片剂。最后用指甲油将盖玻片密封于显微镜载玻片上,静置24小时使其完全干燥。

荧光图像的获取方法如前所述20,使用倒置电动显微镜上配备的40倍油浸物镜和数字电荷耦合器件(CCD)相机进行采集。每个盖玻片在40倍放大倍数下随机选取10个视野成像,对应分辨率为6.22像素/µm。通过自行编写的代码对图像中描述细胞核、肌动蛋白纤维和纤连蛋白的不同变量进行量化,并自动将相应数值以及结构和几何参数保存至数据文件中。

细胞系
所有样本数据细胞系的更详细文档可参见先前发表的文献20。简要描述如下:本数据收集已获得加州大学欧文分校机构审查委员会(IRB # 2014-1253)的批准,并按照其要求进行了知情同意。人类成纤维细胞取自携带不同类型的核纤层蛋白A/C(LMNA)基因突变的三个家族:携带LMNA剪接位点杂合突变(c.357-2A>G)22的家族A;携带LMNA无义突变(c.736 C>T, pQ246X)位于外显子423的家族B;以及携带LMNA错义突变(c.1003C>T, pR335W)位于外显子624的家族C。此外,还从每个家族中其他未携带突变的亲属个体中收集了成纤维细胞作为相关的突变阴性对照,称为“对照组”(Controls);另有成纤维细胞购自无血缘关系的突变阴性个体,称为“供体”(Donors)。作为阳性对照,购买并培养了来自一名早衰症(Hutchinson-Gilford progeria, HGPS)患者的成纤维细胞,该细胞来源于一名携带LMNA G608G点突变25的8岁女性患者的皮肤活检组织。本研究共检测并使用了来自22名个体的成纤维细胞数据。

数据类型
成纤维细胞数据分为两类:细胞核变量(即异常核百分比、核面积、核偏心率)20,或源自取向序参量(OOP)21,26,27 的结构变量(即肌动蛋白OOP、纤连蛋白OOP、细胞核OOP)。该参数等于所有取向矢量平均序张量的最大特征值,其详细定义见先前发表的研究26,28。这些数值被汇总为多种可能的构象,例如按年龄、性别、疾病状态、特定症状的存在与否等分类的数值。这些变量的使用示例可在结果部分找到。

示例代码和文件
基于上述数据的示例代码和其他文件可随本文下载,其名称和类型汇总于表1中。

访问受限。请登录或开始试用以查看此内容。

方案

注意:本方案所用软件版本请参见材料表

1. 评估数据是否适合采用数据库组织方案

  1. 下载示例代码和数据库(参见补充编码文件,其内容总结于表1)。
  2. 使用图1评估感兴趣的数据集是否为“多维”数据。
    注意:图1为示例数据集提供的多维数据库的图形化表示。
  3. 如果数据可以像示例一样以“多维”形式可视化,并且能够将特定的实验结果与任一维度(即条件)相关联,从而加深对现有数据的科学理解,则继续构建关系型数据库。

2. 组织数据库结构

注意:关系型数据库以表格形式存储信息。表格以行和列的模式进行组织,类似于电子表格,可用于链接数据库内的标识信息。

  1. 整理数据文件,确保每个文件具有经过周密考虑的唯一名称。良好的文件命名规范以及合理的文件夹-子文件夹结构,若实施得当,可在不影响手动访问文件可读性的前提下,实现数据库的广泛可扩展性。例如,以统一格式添加日期文件,如 "20XX-YY-ZZ",并根据元数据命名子文件夹。
  2. 在设计数据库结构时,绘制不同表中各字段之间的关联关系。通过将单个表内的不同字段(即表中的列)相互关联,从而处理多维数据。
  3. 创建说明文档(readme),描述在步骤2.2中建立的数据库结构及字段间关系。一旦不同表之间的条目被链接,所有相关联的信息即与该条目关联,可用于调用复杂查询,以筛选出所需信息。
    注意:说明文档是提供项目补充信息和数据库结构信息的常用方法,可在不向结构中添加非统一数据的前提下实现信息共享。
  4. 完成步骤2.1−2.3后,最终结果应类似于本示例:个体的不同特征(图2A)与这些个体相关的实验数据(图2B)相互关联。同样地,通过将模式类型列(图2C)和数据类型列(图2D)与主数据值表中的对应条目关联,解释了各种简写符号(图2B)。
  5. 确定在长期数据收集中需要记录的所有关键数据点以及辅助性数据点。
    注意:如前所述,使用数据库相较于电子表格程序的一个关键优势是可扩展性:可在任意时刻轻松添加额外数据点,且计算结果(如平均值)会立即更新以反映新添加的数据点。
    1. 在开始之前,明确创建独立数据点所需的必要信息。保持原始数据不变,避免对其进行修改或覆盖保存,以便能够随时重新分析数据。
      注意:以本示例(图2)为例,“标识符”(Designator)对应个体、“模式类型”(Pattern type)、“盖玻片编号”(Coverslip #)和“变量类型”(Variable type)均为确保关联数值唯一性的关键字段。
    2. 如有需要,可添加其他有助于分析但非关键的信息,例如“盖玻片总数”(Total # of Coverslips),用于表示实验重复次数,并帮助判断本示例中是否存在缺失的数据点。

3. 建立并组织流程

  1. 确定所有可能产生数据的各种实验和数据分析方法,以及每种数据类型的常规数据存储实践。使用 GitHub 等开源版本控制软件,以确保必要的数据一致性与版本控制,同时尽量减少用户的操作负担。
  2. 如有可能,建立统一的数据命名和存储流程,以实现自动化数据处理流程。
    注意:在本示例中,所有输出均采用一致的命名方式,因此在选定文件后,创建一个查找特定属性的数据流程非常直接。如果无法实现统一命名,则需要手动填充数据库中的表格,此做法不推荐。
  3. 使用任意便捷的编程语言为数据库生成新的数据条目。
    1. 在独立文件中创建小型“辅助”表格(见表1中的文件#8−#10),以指导数据的自动化选择。这些文件作为流程运行的可选模板,易于编辑。
    2. 为生成数据流程的新条目(图3D),编写程序代码(LocationPointer.m,见表1中的文件#1),使其将辅助表格作为用户可选的输入(见表1中的文件#8−#10)。
    3. 随后,通过将新条目与先前条目合并,生成一份新的文件位置电子表格(图3E)。编写代码以自动完成此步骤,如 LocationPointerCompile.m 所示(见表1中的文件#2)。
    4. 之后,检查合并后的电子表格中是否存在重复项,并自动删除。编写代码以自动完成此步骤,如 LocationPointer_Remove_Duplicates.m 所示(见表1中的文件#3)。
    5. 此外,检查电子表格中的错误,并向用户提示错误原因及位置(图3F)。编写代码以自动完成此步骤,如 BadPointerCheck.m 所示(见表1中的文件#4)。或者,编写一段代码,在一步内检查已汇总的数据库并识别重复项,如 LocationPointer_Check.m 所示(见表1中的文件#5)。
    6. 编写代码,允许用户手动删除错误条目,同时不破坏数据库的完整性,如 Manual_Pointer_Removal.m 所示(见表1中的文件#6)。
    7. 然后利用文件位置生成一份数据值电子表格(图3G,见表1中的文件#12),并生成最新条目列表,以便用于定位文件或与未来条目合并(图3H)。编写代码以自动完成此步骤,如 Database_Generate.m 所示(见表1中的文件#7)。
  4. 仔细核查该流程是否通过采用严格的命名规范、自动化文件整合代码和自动化错误检查(如前所述)提升了实验的严谨性。

4. 创建数据库和查询

注意:如果表在数据库中存储信息,那么查询就是根据特定条件向数据库请求信息的操作。创建数据库有两种方法:从空白文档开始或从现有文件开始。图4 展示了一个使用 SQL 语法的查询示例,该查询旨在利用 图2 所示的数据库关系来运行。

  1. 方法1:从头开始创建数据库和查询
    1. 创建一个空白的数据库文档。
    2. 通过选择外部数据 | 文本文件导入 | 选择文件(文件#8−#10)| 分隔符 | 第一行包含标题,逗号分隔 | 保留默认设置 | 选择自己的主键(细胞系文件#8使用Designator,数据类型文件#9使用Variable Name,模式类型文件#10使用Pat Name)| 保留默认设置 | 完成,来加载辅助表(表1中的文件#8−#10)。
    3. 通过选择外部数据 | 文本文件导入 | 选择文件(文件#12)| 分隔符 | 第一行包含标题,逗号分隔 | 保留默认设置 | 让Access添加主键 | 导入到表:DataValues | 完成,来加载数据值表(表1中的文件#12)。
    4. 通过选择数据库工具 | 关系 | 将所有表拖入面板 | 编辑关系 | 创建新关系 | 将DataValue字段与辅助表的Designator字段匹配 | 连接类型3,来建立表间关系。
    5. 选择创建 | 查询设计
    6. 选择或拖动所有相关表进入上方窗口。本示例中包括“细胞系”、“数据值”、“数据类型”和“模式类型”。这些关系应基于之前设计的关系自动建立。
    7. 填写查询列以获得所需结果,例如:
      1. 点击显示 | 总计
      2. 填写第一列(表:DataValues,字段:DataVar,总计:分组依据,条件:"Act_OOP"),第二列(表:DataValues,字段:PatVar,总计:分组依据,条件:"Lines"),以及第三列(表:Cell_Lines,字段:Designator,总计:分组依据,排序:升序)。
      3. 填写第四列(表:DataValues,字段:Parameter,总计:平均值),第五列(表:DataValues,字段:Parameter,总计:标准差),以及第六列(表:DataValues,字段:Parameter,总计:计数)。
    8. 运行查询。
  2. 或者,使用提供的示例数据库作为参考基础。打开之前下载的数据库文件Database_Queries.accdb(表1中的文件#13),将其作为模板,用感兴趣的数据替换现有表。

5. 将输出的表格移至统计软件中进行显著性分析

  1. 对于本示例实验数据,采用单因素方差分析(ANOVA),并使用Tukey检验进行不同条件间的均值比较。
    注:p 值小于 0.05(p < 0.05)被视为具有统计学显著性。

访问受限。请登录或开始试用以查看此内容。

结果

数据的多维性
在本文提供的示例数据集中,如方法部分所述,受试者被分为三组携带导致心脏病的LMNA突变的家族成员(“患者”)、相关的非突变阴性对照(“对照”)、无关联的非突变阴性对照(“供体”),以及一名作为阳性对照的Hutchinson-Gilford早衰综合征(HGPS)个体20。由于对照组和供体组均不携带LMNA突变,其结果可进一步合并为一个总体的阴性对照(N.C.)组。每位受试者的细胞系均根据其所属的条件组标注了“突变状态”(图1 — 深蓝色轴)。在每次实验中,均将来自受试者的成纤维细胞培养在无序排列(各向同性)或微图案化(条带状)的纤连蛋白基质上,从而形成“图案类型”这一实验条件(图1 — 橙色轴)。细胞经固定、免疫染色和成像后,记录“盖玻片编号”,因为使用同一位个体的细胞会进行多次实验(即技术重复)(图1 — 浅绿色轴)。随后...

访问受限。请登录或开始试用以查看此内容。

讨论

实验方案的技术讨论
在考虑使用数据库时,第一步是评估数据是否能够从这种组织方式中受益。

下一个关键步骤是创建一个自动化代码,该代码只需用户输入最少的信息即可生成表格数据结构。在示例中,用户输入了数据类型的类别(细胞核或结构测量)、细胞系的受试者标识符以及所选文件的数量。随后,用户选择相关文件(表2,第1列),系统会自动创建行条目,并填入文件中包含的所有变量(表2,第2列)。此外,代码必须具备足够的灵活性:如果需要添加新的实验条目,用户可选择继续循环;否则,文件将被保存,循环结束。在本步骤中所述的添加新条目、检查错误以及从文件路径组装电子表格等基本功能,对于建立高效的数据处理流程均至关重要。

必须注意,在创建数据流程时使用文件路径可提高实验的严谨性。具体而言,提供一份列出所有数据值对应文件路径的电子表格,可使用户将任意数据点追溯至采集原始数据的研究人员的实验记录本。在处理数百至数万个数据点时,更高的透明度和可访问性在...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

本研究由美国国立卫生研究院国家心肺血液研究所资助,项目编号 R01 HL129008。作者特别感谢参与本研究的LMNA基因突变家族成员。我们还要感谢 Linda McCarthy 在细胞培养及实验室空间管理方面的协助,感谢 Nasam Chokr 参与细胞成像及细胞核数据分析,感谢 Michael A. Grosberg 在建立初始的 Microsoft Access 数据库过程中提供的有益建议,并解答了其他技术问题。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
4',6'-二脒基-2-苯基吲哚(DAPI)Life Technologies, Carlsbad, CA
Alexa Fluor 488 鬼笔环肽Life Technologies, Carlsbad, CA
Alexa Fluor 750 山羊抗兔抗体Life Technologies, Carlsbad, CA
数字CCD相机ORCAR2 C10600-10BHamamatsu Photonics, Shizuoka Prefecture, Japan
纤连蛋白Corning, Corning, NY
IX-83倒置电动显微镜Olympus America, Center Valley, PA
Matlab R2018bMathworks, Natick, MA
MS AccessMicrosoft, Redmond, WA
多聚甲醛(PFA)Fisher Scientific Company, Hanover Park, IL
多克隆兔抗人纤连蛋白抗体Sigma Aldrich Inc., Saint Louis, MO
聚二甲基硅氧烷(PDMS)Ellsworth Adhesives, Germantown, WI
Prolong Gold 抗荧光淬灭封片剂Life Technologies, Carlsbad, CA
矩形玻璃盖玻片Fisher Scientific Company, Hanover Park, IL
Triton-XSigma Aldrich Inc., Saint Louis, MO

参考文献

  1. Cavin, R. K., Lugli, P., Zhirnov, V. V. Science and engineering beyond Moore's law. Proceedings of the IEEE. 100, Special Centennial Issue 1720-1749 (2012).
  2. Mast, F. D., Ratushny, A. V., Aitchison, J. D. Systems cell biology. The Journal of Cell Biology. 206 (6), 695-706 (2014).
  3. Barone, L., Williams, J., Micklos, D. Unmet needs for analyzing biological big data: A survey of 704 NSF principal investigators. PLoS Computational Biology. 13 (10), 1005755(2017).
  4. Gandomi, A., Haider, M. Beyond the hype: Big data concepts, methods, and analytics. International Journal of Information Management. 35 (2), 137-144 (2015).
  5. Siddiqa, A., et al. A survey of big data management: Taxonomy and state-of-the-art. Journal of Network and Computer Applications. 71, 151-166 (2016).
  6. Anderson, C. The End of Theory: The Data Deluge Makes the Scientific Method Obsolete. Wired Magazine. , (2008).
  7. Broman, K. W., Woo, K. H. Data Organization in Spreadsheets. The American Statistician. 72 (1), 2-10 (2018).
  8. Lee, H., et al. How I do it: a practical database management system to assist clinical research teams with data collection, organization, and reporting. Academic Radiology. 22 (4), 527-533 (2015).
  9. Bassil, Y. A comparative study on the performance of the Top DBMS systems. Journal of Computer Science & Research. 1 (1), 20-31 (2012).
  10. Learn SQL - Codeacademy. , Available from: https://www.codecademy.com/learn/learn-sql (2018).
  11. SQL Tutorial - w3schools.com. , Available from: https://www.w3schools.com/sql (2018).
  12. Introduction to SQL - SQLBolt. , Available from: https://sqlbolt.com (2018).
  13. Pedersen, T. B., Jensen, C. S. Multidimensional database technology. Computer. 34 (12), 40-46 (2001).
  14. Győrödi, C., Gyorodi, R., Sotoc, R. A Comparative Study of Relational and Non-Relational Database Models in a Web- Based Application. International Journal of Advanced Computer Science and Applications. 6 (11), 78-83 (2015).
  15. Nayak, A., Poriya, A., Poojary, D. Type of NOSQL databases and its comparison with relational databases. International Journal of Applied Information Systems. 5 (4), 16-19 (2013).
  16. Lei, C., Feng, D., Wei, C., Ai-xin, Z., Zhen-hu, C. The application of multidimensional data analysis in the EIA database of electric industry. Procedia Environmental Sciences. 10, 1210-1215 (2011).
  17. Soranno, P. A., et al. Building a multi-scaled geospatial temporal ecology database from disparate data sources: fostering open science and data reuse. GigaScience. 4, 28(2015).
  18. Edwards, P. Questionnaires in clinical trials: guidelines for optimal design and administration. Trials. 11, 2(2010).
  19. Richards, M. A., et al. MediaDB: A Database of Microbial Growth Conditions in Defined Media. PLoS ONE. 9 (8), 103548(2014).
  20. Core, J. Q., et al. Age of heart disease presentation and dysmorphic nuclei in patients with LMNA mutations. PLoS ONE. 12 (11), 0188256(2017).
  21. Drew, N. K., Johnsen, N. E., Core, J. Q., Grosberg, A. Multiscale Characterization of Engineered Cardiac Tissue Architecture. Journal of Biomechanical Engineering. 138 (11), 111003(2016).
  22. Zaragoza, M. V., et al. Exome Sequencing Identifies a Novel LMNA Splice-Site Mutation and Multigenic Heterozygosity of Potential Modifiers in a Family with Sick Sinus Syndrome, Dilated Cardiomyopathy, and Sudden Cardiac Death. PLoS ONE. 11 (5), 0155421(2016).
  23. Zaragoza, M., Nguyen, C., Widyastuti, H., McCarthy, L., Grosberg, A. Dupuytren's and Ledderhose Diseases in a Family with LMNA-Related Cardiomyopathy and a Novel Variant in the ASTE1 Gene. Cells. 6 (4), 40(2017).
  24. Zaragoza, M. V., Hakim, S. A., Hoang, V., Elliott, A. M. Heart-hand syndrome IV: a second family with LMNA-related cardiomyopathy and brachydactyly. Clinical Genetics. 91 (3), 499-500 (2017).
  25. Eriksson, M., et al. Recurrent de novo point mutations in lamin A cause Hutchinson-Gilford progeria syndrome. Nature. 423 (6937), 293-298 (2003).
  26. Drew, N. K., Eagleson, M. A., Baldo, D. B., Parker, K. K., Grosberg, A. Metrics for Assessing Cytoskeletal Orientational Correlations and Consistency. PLoS Computational Biology. 11 (4), 1004190(2015).
  27. Hamley, I. W. Introduction to Soft Matter: Synthetic and Biological Self-Assembling Materials. , John Wiley & Sons. Hoboken, NJ. (2013).
  28. Grosberg, A., Alford, P. W., McCain, M. L., Parker, K. K. Ensembles of engineered cardiac tissues for physiological and pharmacological study: Heart on a chip. Lab Chip. 11 (24), 4165-4173 (2011).
  29. Hey, T., Trefethen, A. The Data Deluge: An e-Science Perspective. Grid Computing: Making the Global Infrastructure a Reality. Berman, F., Fox, G., Hey, A. J. G. , John Wiley & Sons. Hoboken, NJ. Ch. 36 (2003).
  30. Wardle, M., Sadler, M. How to set up a clinical database. Practical Neurology. 16 (1), 70-74 (2016).
  31. Kerr, W. T., Lau, E. P., Owens, G. E., Trefler, A. The future of medical diagnostics: large digitized databases. The Yale Journal of Biology and Medicine. 85 (3), 363(2012).
  32. Laulederkind, S. J., et al. The Rat Genome Database curation tool suite: a set of optimized software tools enabling efficient acquisition, organization, and presentation of biological data. Database. 2011, (2011).
  33. Harris, P. A., et al. Research electronic data capture (REDCap)--a metadata-driven methodology and workflow process for providing translational research informatics support. Journal of Biomedical Informatics. 42 (2), 377-381 (2009).
  34. Panko, R. R. What we know about spreadsheet errors. Journal of Organizational and End User Computing (JOEUC). 10 (2), 15-21 (1998).
  35. Ziemann, M., Eren, Y., El-Osta, A. Gene name errors are widespread in the scientific literature. Genome Biology. 17 (1), 177(2016).
  36. Enhancing Reproducibility through Rigor and Transparency. NIH. , Available from: https://grants.nih.gov/reproducibility/index.htm (2018).
  37. Hofseth, L. J. Getting rigorous with scientific rigor. Carcinogenesis. 39 (1), 21-25 (2017).
  38. SQL Training and Tutorials - Lynda.com. , Available from: https://www.lynda.com/SQL-training-tutorials/446-0.html (2018).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

数据库管理关系型数据库数据管道查询设计文件命名版本控制数据可视化统计分析