需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

使用基因集富集分析确定转化研究中合适动物模型的方案

16.8K 次观看

⸱

DOI:

10.3791/55768

⸱

2017年8月16日

本文内容

摘要

我们提供了一种标准化的转录组数据基因集富集分析方案,用于确定适用于转化研究的理想小鼠模型。
该方案可用于DNA微阵列和RNA测序数据,若有相应数据,亦可进一步扩展至其他组学数据。

摘要

最近的研究通过传统基因对基因比较技术,将人类疾病的转录组数据集与小鼠模型的数据集进行对比,得出了关于动物模型在转化研究中相关性的相互矛盾的结论。不同基因表达分析之间存在差异的一个主要原因是差异表达基因的任意筛选。此外,跨物种和跨平台的单个基因比较常受到技术变异的限制,导致对人类与动物模型数据之间一致或不一致性的误判。因此,亟需标准化的系统性数据分析方法。为了克服主观的基因筛选和低效的基因对基因比较,我们近期证明了基因集富集分析(GSEA)具有避免这些问题的潜力。基于此,我们开发了一套使用GSEA的标准化操作流程,用于区分适用于或不适用于转化研究的动物模型。该流程不适用于预测如何设计新的模型系统-先验方法,因为它需要已有的实验组学数据。然而,本方案描述了如何以标准化的方式解读已有数据,从而选择最合适的动物模型,避免不必要的动物实验和误导性的转化研究。

引言

动物模型因其在遗传学、解剖学和生理学方面与人类具有相似性,被广泛用于研究人类疾病。此外,动物模型通常作为临床治疗的门槛,在转化医学研究的成功中发挥着巨大影响。谨慎选择最合适的动物模型可减少误导性动物实验的数量。近年来,动物模型在转化研究中的相关性引发了争议,特别是对人类炎症性疾病及其相应小鼠模型所获得的相同数据集进行分析时,得出了相互矛盾的结论1,2。这一讨论揭示了在分析组学数据时存在一个根本性问题:需要建立标准化的系统性数据分析方法,以减少基因选择的偏倚,并提高跨物种比较的稳健性3。

传统上,转录组学数据(及其他组学数据)的分析是在单基因水平上进行的,通常包括基于严格截断参数的初始基因筛选步骤(例如,倍数变化 >2.0,p 值 <0.05)。然而,初始截断参数的设定往往具有主观性、随意性,且缺乏生物学依据,甚至可能导致相反的结论1,2。此外,初始基因筛选通常将分析局限于少数显著上调或下调的基因,因此敏感性不足,无法纳入大多数表达差异较小的基因。

随着21世纪初基因组学时代的兴起以及对生物通路和生物学背景的深入了解,人们开发出了一些替代性的统计学方法,以克服单基因水平分析的局限性。基因集富集分析(Gene set enrichment analysis, GSEA)4 是转录组学数据分析中广泛接受的方法之一,其利用预先定义的基因分组(例如,信号通路、染色体上的邻近位置等)。GSEA首先将所有检测到的未经筛选的基因映射到目标基因集(例如,通路)中,而不论这些基因在表达水平上的个体变化情况。因此,该方法也包含了那些表达变化幅度中等、在单基因水平分析中容易被遗漏的基因。随后,通过运行累计统计法(running sum statistics)来评估基因集内表达变化的累积效应。

尽管GSEA及相关集合富集方法在医学研究中被广泛使用,但在分析复杂的组学数据时,这些方法并非显而易见地被纳入考虑。本文介绍了一种将人类样本的组学数据与小鼠模型数据进行比较的实验方案,旨在为转化医学研究筛选出最合适的动物模型。我们以一系列用于模拟人类炎症性疾病的小鼠模型为例,展示了该方案的适用性。然而,这一分析流程并不局限于人-鼠之间的比较,也可适用于其他研究问题。

访问受限。请登录或开始试用以查看此内容。

方案

1. GSEA 软件和分子特征数据库的下载

  1. 前往 GSEA Broad 研究所官方网站(http://software.broadinstitute.org/gsea/index.jsp)注册,以获取 GSEA 软件工具和分子特征数据库(MSigDB)的使用权限。
  2. 下载 javaGSEA 桌面应用程序或其他替代软件选项(例如,R 脚本)
    注意:所有选项均采用完全相同的算法。GSEA 软件可免费供学术界和工业界个人用于内部研究。
  3. 有关 GSEA 软件的更多详细信息,请访问其文档网站(http://software.broadinstitute.org/cancer/software/gsea/wiki/index.php/Main_Page)和 GSEA 用户指南(http://software.broadinstitute.org/gsea/doc/GSEAUserGuideFrame.html)。
  4. 从 GSEA 网站下载分子特征数据库(MSigDB),以获取单个基因集集合。
    注意:MSigDB 是一组带注释的基因集,可用于 GSEA 软件或其他用途。基因集可根据信号通路、基因本体术语、顺式调控元件、实验特征等进行分类。MSigDB 中的基因始终以其官方 HUGO(人类基因组组织)基因符号命名。在比较特定人类疾病与不同小鼠模型之间的通路调控时,建议下载 所有经典通路、基因符号 文件(c2.cp.v5.2.symbols.gmt)。该文件包含由 KEGG 注释并归类到信号通路中的基因集 5,6,Reactome 7,8 和 BioCarta 9字符串“v5.2”表示该集合的版本信息。请确保下载文件的最新版本。MSigDB 可免费供学术界和工业界个人用于内部研究目的。如果在分析过程中提供网络连接,则无需下载 MSigDB,此时可直接在 GSEA 用户界面中选择该数据库。
  5. 从GSEA网站下载DNA芯片(阵列)注释文件,以将阵列特异性的探针标识符转换为通用的HUGO基因符号(例如, Mouse430_2.chip).
    注意:如果在分析过程中提供互联网连接,则无需下载DNA芯片注释文件,此时可直接在GSEA用户界面中选择相应的DNA芯片注释。本方案也可用于RNA测序数据。在此情况下,无需下载注释文件,而应使用GSEA preranked工具分析基因表达数据(见步骤4.12)。

2. 下载人类疾病及其相应动物模型的实验基因表达数据

  1. 确定所选人类疾病的实验性基因表达(转录组学)研究例如,脓毒症患者来源的白细胞基因表达谱,GSE9960)。
  2. 同样,搜索几种应与人类研究进行比较的动物模型(例如小鼠注射后分离的血细胞基因表达谱 金黄色葡萄球菌(S. aureus), GSE20524)。在此步骤中,利用已有知识对可能适用于模拟人类情况的动物模型进行预筛选。
  3. 为此,请参考文献和数据库,例如基因表达综合数据库(Gene Expression Omnibus, GEO) 10 或 ArrayExpress 11 下载感兴趣的标准化转录组数据,并将数据保存为文本文件至本地硬盘。对于 GEO 数据库,建议下载以制表符分隔的系列矩阵文本文件。同时记录该研究使用的平台(芯片类型),因为此信息在将芯片特异性的探针标识符转换为通用的 HUGO 基因符号时是必需的。
    注意:由于转录组数据集通常包含数百兆字节,需确保存储数据的内存充足。

3. 数据处理与格式化

  1. 在将实验基因表达数据导入GSEA软件工具之前,需考虑所需的数据结构。针对每项研究,手动创建两种不同的文件:1)基因表达数据文件,包含不同基因和样本的测量值;2)表型文件,包含用于对各样本进行分组的样本标签例如,分配至治疗组)。
    如需更多详细信息和数据结构选项,请访问 GSEA 数据格式页面(http://software.broadinstitute.org/cancer/software/gsea/wiki/index.php/Data_formats)。
    注意:通常,所有形式的转录组学数据均适用于本方案,包括DNA微阵列实验、RNA-seq或ChIP-seq研究。若使用DNA微阵列实验,基因表达数据文件应包含每个基因的阵列特异性探针标识符或HUGO基因符号(探针标识符将在分析过程中转换为HUGO基因符号,参见步骤1.5和4.10)。若使用RNA-seq或ChIP-seq数据,则应使用手动计算的基因表达数据组间统计量(如组均值比),而非单个样本数据。这些组间统计量应随后使用GSEA preranked工具进行分析(参见步骤4.12)。在导入GSEA软件前,基因表达数据需按常规进行标准化处理。标准化方法的类型(例如,四分位数或三次样条)通常由研究人员自行决定。
  2. 基因表达数据文件:使用制表符分隔的文本文件(*.txt)格式来描述表达数据集,如图所示 图1A。另请参见支持的示例文件 GSE20524_expression.txt
    注意:基因表达数据文件包含以下基因的表达值 全部 可检测基因(或探针),包括那些可能无差异表达的基因。因此,该文件通常包含数千个基因,其组织形式如图所示 图1A第一行包含标签名称(例如,基因符号或探针ID),后接数据集中每个样本的标识符(例如,样品1,样品2 等等。)。文件的其余部分包含数据集中每个基因和每个样本的表达值。GSEA 软件工具会计算组间统计量例如,组平均比值或信噪比),因此建议包含每个单独样本的数据。或者,也可以使用外部计算的基因表达数据的组水平指标(参见 图1B).
  3. 表型文件:创建一个单独的文件,用于定义和标注由个体样本组成的各组,如图所示 图2使用空格或制表符分隔字段。将其保存为 CLS(C++ 类定义)文件格式。另请参见支持的示例文件 GSE20524_pheno_感染.cls
    注意:第一行包含样本总数以及组数(图2)。样本数量应与基因表达数据文件相对应(见3.2),而组数则取决于研究设计。第一行的第三个字段始终为“1”。
    CLS 文件的第二行包含每个组的名称。该行应以井号(#)开头,其后跟一个空格图2).
    第三行包含每个样本的组标签。组标签可以是任意数字或文本。仅标签的顺序决定每个样本与组的对应关系:第一个出现的标签对应第二行的第一个组,第二个不重复的标签对应第二个组,依此类推。请确保同一组中的每个样本在此处具有相同的标签,且标签总数与第一行中指定的样本数量一致。最后,将文件保存为制表符分隔的文本文件(*.txt),并手动将文件扩展名更改为(*.cls)。
  4. (可选)基因集数据库文件:定义自定义基因集。使用以制表符分隔的 GMT(基因矩阵转置)文件格式来表示基因集,如图所示 图3另请参见支持的示例文件 Gene_sets_炎症_BIOCARTA_KEGG_REACTOME.gmt
    注意:定义自定义基因集可能非常有用,例如可将基因集富集分析限定于某些特别关注的通路例如,用于脓毒症研究中的免疫学信号通路,或用于从头定义自定义基因集(例如,用于比较研究中的激活和抑制基因)。该文件的组织方式如图所示 图3. 在 GMT 格式中,每一行代表一个基因集(图3)。每个基因集由名称、描述以及该基因集所包含的基因组成。第一列为唯一的基因集名称,第二列可选择性地包含基因集的描述信息,后续各列包含相应基因集中基因的名称(即官方 HUGO 基因符号)。最后,将文件保存为制表符分隔的文本文件(*.txt),并手动将文件扩展名更改为(*.gmt)。

4. 执行 GSEA

  1. 打开 GSEA 软件工具(参见 1.2)。
  2. 点击 加载数据 主窗口左侧的按钮(图 4A)。将打开一个新标签页用于导入所需的数据文件(图4B)。在新标签页中浏览基因表达数据文件(*.txt)(参见3.2)、表型文件(*.cls)(参见3.3),以及可选的自定义基因集文件(*.gmt)(图 4B).
    1. 如果 GSEA 无法连接互联网,请加载已下载的 MSigDB(*.gmt)文件(例如, c2.cp.v5.2.symbols.gmt 对于通路,参见1.4)以及DNA芯片(阵列)注释文件(*.chip)(例如, Mouse430_2.chip,参见 1.5)。成功导入的数据将显示在“加载数据 部分图 4C).
      注意:每项基因表达研究必须单独使用 GSEA 进行分析。两项研究之间的比较(例如 人类疾病与小鼠模型的比较将在第5步进行。
  3. 点击“运行 GSEA 主窗口左侧的按钮。点击后将打开一个新标签页,用于设置分析参数(图4D)。该标签页分为三个部分: 必填字段,基础字段 和 高级领域.
  4. 在 必填字段, 首先选择 表达数据集 步骤 4.2 中加载的图 4D).
  5. 选择 基因集数据库,无论是从已连接的网站还是从手动导入的基因集文件(图 4D).
  6. 编辑 表型标签 选择需要相互比较的样本组(例如, S. aureus 治疗 与 健康对照)(图 4D).
  7. 将数据集折叠为基因符号 (=是) 以将表达数据集中的探针标识符转换为基因集数据库中使用的官方 HUGO 基因符号。选择 错误,如果表达数据集已包含 HUGO 基因符号(图 4D).
  8. 设置 排列组合的数量 默认设置为 1,000(图 4D).
    注意:数量较大时,计算时间将显著增加。
  9. 更换 置换类型 设为“基因集”,因为仅当每种表型的样本数超过七个时,才建议使用表型置换方法(图 4D).
  10. 最后,选择用于生成基因表达数据的芯片平台,可从已连接的网站或手动导入的DNA芯片(阵列)注释文件中选取图 4D).
    注意:仅当上传的表达数据集中使用探针标识符时,此步骤才必要。
  11. 在 基础领域 至少编辑 分析名称 和 将结果保存到此文件夹 部分以再次找到结果文件(图 4D)。此外,还可以更改其他统计参数。有关参数及其详细信息,请参见 高级领域 如需了解该部分内容,请访问GSEA用户指南(http://software.broadinstitute.org/gsea/doc/GSEAUserGuideFrame.html)。
  12. (可选):若基因表达数据的组水平统计量为外部计算(例如,组平均比值)时,需使用 GSEA 预排序工具。分析将基于一个简单的基因列表进行,该列表中的基因已分配预先计算的组度量值,用于对基因进行排序。加载替代的基因表达文件后,转到主导航栏并点击 工具/GseaPreranked同样,将打开一个新标签页以设置分析参数(图4E).
    注意:对于没有个体样本特异性基因表达数据的研究,建议使用 GSEA preranked 工具。当数据经过特殊的统计或标准化处理,得到的是组均值而非个体样本数据时,即适用于此情况。对于 RNA 测序数据,也推荐使用 GSEA preranked 工具。请对 RNA 测序表达数据进行标准化处理,并计算各样本的组别统计指标(例如,即倍数变化的对数值),可用于根据基因表达水平对其进行排序。
  13. 点击“运行 窗口右下角的按钮。
    注意:分析所需时间可能长达数分钟,具体取决于计算机运算速度。请在窗口左下角的 GSEA 报告部分关注分析进度。分析完成后,GSEA 报告部分将显示“success”状态。
  14. 点击成功完成的分析 GSEA 报告 部分以打开分析结果。
    注意:一个新的导航菜单将在浏览器窗口中打开,汇总所有结果和参数设置图5)。导航菜单的上方两个部分包含针对已定义组别的基因集富集分析结果(例如,在金黄色葡萄球菌处理样本或健康对照样本中的富集结果)。这两个部分的第一行显示了统计结果的汇总。在后续解释中,假发现率(FDR)低于25%的显著富集基因集被视为富集基因集。有关分析结果解释的更多详细信息,请参见GSEA用户指南(http://software.broadinstitute.org/gsea/doc/GSEAUserGuideFrame.html)。
  15. 点击 详细的富集结果(Excel 格式) 将分析结果导出至电子表格(图6A)。导出 详细的富集结果以 Excel 格式呈现 两种表型分别进行(图5) 并将结果数据合并到一个电子表格文件中。为了后续比较多个研究的基因表达数据,至少应保留基因集名称(A列)、其标准化富集评分(NES)(F列)及其FDR(错误发现率)值(H列)。图6B).
    注意:该电子表格文件包含每个分析基因集的大量数据,包括基因集名称(A列)、基因集大小(即在基因表达数据中检测到的基因数量,D列)、标准化富集评分(NES,用于定量衡量富集的方向和程度,F列)、名义 p 值(未校正,G列)以及FDR值(经多重假设检验校正,H列)。有关结果解读的更多细节,请参考GSEA用户指南(http://software.broadinstitute.org/gsea/doc/GSEAUserGuideFrame.html)。
  16. 对第二个研究重复进行基因集富集分析(步骤 4.1 至 4.15)例如,金黄色葡萄球菌 GSE9960)以及所有需相互比较的后续研究。应纳入尽可能多的人类临床研究和不同的小鼠模型,以确定适用于转化研究问题的最佳小鼠模型。

5. 比较GSEA结果

  1. 为确定最适动物模型以模拟人类情况,将所有研究的GSEA结果相互比较。利用富集分数(NES)和FDR值对通路(基因集)进行分类:将NES > 1且FDR < 0.05的通路判定为激活状态,将NES < −1且FDR < 0.05的通路判定为抑制状态。 >0,FDR <25%),受抑制(NES <0,FDR <25%)或两者均无(FDR >25%)。对于每两项研究的比较,统计由3×3列联表所示的通路调控九种可能组合的出现次数图7A).
  2. 通过计算阳性预测值(ppv)和阴性预测值(npv)来评估两项研究之间的相关性,其定义为在两项研究中表现出相同调控方向(激活或抑制)的通路所占的比例。
    1. 根据以下公式(1)和(2)计算ppv和npv:
      (1) figure-protocol-1
      (2) figure-protocol-2
      注意:由于重叠可能纯属偶然,因此阳性预测值(ppv)和阴性预测值(npv)必须进一步与随机预期值进行比较。该方法可用于估计从一项研究中获得的信息量,以预测另一项研究中的效应。例如,若两个模型中的调控过程彼此独立(仅因偶然而出现重叠),且在第一个模型中有10%的通路被上调,则对第二个模型的ppv也应为10%,即无额外信息增益。相反,若两个模型之间存在共同的调控机制,则ppv(和npv)将显著高于随机预期值。例如,利用小鼠金黄色葡萄球菌注射模型(GSE20524)预测人类脓毒症期间基因表达变化(GSE9960)时,ppv为43%(6/(6+8+0)),npv为61%(11/(0+7+11))。换言之,在小鼠金黄色葡萄球菌注射模型(GSE20524)中被激活的通路中有43%在人类脓毒症(GSE9960)中同样被激活;类似地,在该小鼠模型中被抑制的通路中有61%在人类脓毒症中也受到抑制。图7B)。ppv 和 npv 也可用于相反的组合情况(即从研究 1 预测研究 2)。
  3. 要计算偶然情况下的重叠,请参考 3x3 列联表(图7)并根据以下公式(3)和(4)计算ppvchance和npvchance:
    (3) figure-protocol-3
    (4) figure-protocol-4
    注意:例如,根据小鼠 S. aureus 注射模型(GSE20524)的结果预测人类脓毒症期间的基因表达变化(GSE9960)时,ppvchance 为 13%(8/64),npvchance 为 22%(14/64)。
  4. 通过从 ppv 减去 ppvchance 来计算 ppv 相对于随机概率的增益。npv 同理计算:
    (5) figure-protocol-5
    (6) figure-protocol-6
    注意:例如,在预测人类脓毒症(GSE9960)中的基因表达变化时,基于小鼠金黄色葡萄球菌注射模型(GSE20524)效应的结果显示,ppv 和 npv 相较随机水平的变化分别为 +30%(43% - 13%)和 +39%(61% - 22%)。
  5. 通过平均 ppvgain 和 npvgain,计算从研究2关于研究1所能获得的信息增益:
    (7) figure-protocol-7
  6. 使用第5.1步中定义的一对研究(study1.pathway,study2.pathway)的列联表,通过卡方检验计算p值。
    将列联表的数据存储在矩阵 X 中。进行卡方检验, 例如,通过使用 R 函数 卡方检验.
    注意:例如,将选定的人类脓毒症研究(GSE9960)与小鼠模型进行比较 S. aureus 注射模型(GSE20524)在炎症通路调控方面显示出具有统计学意义的重叠:
    > chisq.test(X, simulate.p.value=F)$p.value
    3.82e-07

6. 确定最佳动物模型

  1. 比较所选分析研究之间所有组合的 GSEA 结果。
    注意:还建议将(相似的)人类研究相互比较,以及将不同的动物研究相互比较。此类比较有助于了解临床研究(或疾病)在种内以及不同动物模型之间的变异情况。预期临床研究应显示出可接受的重叠性以及显著的信息增益;否则,这些临床研究可能过于异质,难以找到能够模拟人类情况的动物模型。在此情况下,建议仅纳入彼此相似的人类研究,用于识别合适的动物模型。
  2. 根据信息增益(步骤 5.5)对所有组合进行排序。当比较多个数据集时,可使用矩阵,并通过彩色热图或其他类似方式可视化结果(图8)。
  3. 选择信息增益最高的动物模型。为评估信息增益的显著性,还需结合卡方检验结果(步骤 5.6)进行判断。
    注意:只有当信息增益显著且卡方检验的 p 值低于显著性水平时,才可认为该动物模型是合适的。用户自定义的阈值通常取决于多个因素:1)研究前对动物模型结果向人类外推的可行性认知(例如生理相似性),2)假定成功后对人类带来的预期获益,3)该动物实验的实际可操作性,以及 4)实验动物可能遭受的疼痛、痛苦或伤害程度。

访问受限。请登录或开始试用以查看此内容。

结果

本文展示了GSEA工作流程及示例数据的截图。图1显示了包含目标转录组数据的基因表达数据文件。每个研究都需要一个描述性表型文件,如图2所示。注释的基因集(例如,通路)在基因集数据库文件中定义(图3)。图4展示了使用GSEA软件工具的逐步操作流程。图5提供了一份示例结果报告。详细的GSEA富集分析结果汇总于图6。为了比较不同的基因表达研究,特别是人与小鼠研究之间的比较,需要使用列联表(图7)。为了可视化分析结果,图8展示了人和小鼠研究之间通路比较的相关性矩阵。

访问受限。请登录或开始试用以查看此内容。

讨论

动物模型长期以来被用于研究疾病机制以及开发新的治疗策略。然而,由于一些临床试验的失败,人们对动物模型的预测性开始产生质疑12。此外,针对如何分析和解释临床前试验中产生的大规模组学数据,也出现了争议性讨论:对同一数据集采用不同的数据分析方法,得出了截然相反的结论1,2。因此,迫切需要更可靠的生物信息学技术来系统分析复杂的组学数据,以确定特定人类疾病的最优动物模型。采用目前最合适的模型不仅有助于提升转化医学研究的质量,还能通过避免与人类情况不相关的动物实验,进一步促进动物福利。

本文所述方案提供了一种标准化方法,用于系统比较不同物种的组学数据,旨在为特定人类疾病确定最佳动物模型和治疗方案。通过采用基因集富集分析(GSEA)而非单基因分析,该方案避免了与主观设定基因表达阈值及基因筛选相关的各种问题。聚焦于特定通路还可针对性地探讨所研究疾病或状况的(病理)生理过程。例如,炎症)。当然,GSEA结果的准确性取决...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在任何竞争性财务利益。

致谢

本工作由德国联邦风险评估研究所(BfR)资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
ExcelMicrosoft Corporation

参考文献

  1. Seok, J., et al. Genomic responses in mouse models poorly mimic human inflammatory diseases. Proc Natl Acad Sci U S A. 110 (9), 3507-3512 (2013).
  2. Takao, K., Miyakawa, T. Genomic responses in mouse models greatly mimic human inflammatory diseases. Proc Natl Acad Sci U S A. 112 (4), 1167-1172 (2015).
  3. Weidner, C., Steinfath, M., Opitz, E., Oelgeschläger, M., Schönfelder, G. Defining the optimal animal model for translational research using gene set enrichment analysis. EMBO Mol Med. 8 (8), 831-838 (2016).
  4. Subramanian, A., et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 102 (43), 15545-15550 (2005).
  5. Kanehisa, M., Sato, Y., Kawashima, M., Furumichi, M., Tanabe, M. KEGG as a reference resource for gene and protein annotation. Nucleic Acids Res. 44 (D1), D457-D462 (2016).
  6. Kanehisa, M., Goto, S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 28 (1), 27-30 (2000).
  7. Fabregat, A., et al. The Reactome pathway Knowledgebase. Nucleic Acids Res. 44 (D1), D481-D487 (2016).
  8. Croft, D., et al. The Reactome pathway knowledgebase. Nucleic Acids Res. 42 (Database issue), D472-D477 (2014).
  9. Nishimura, D. BioCarta. Biotech Software & Internet Report. 2 (3), 117-120 (2001).
  10. Edgar, R., Domrachev, M., Lash, A. E. Gene Expression Omnibus: NCBI gene expression and hybridization array data repository. Nucleic Acids Res. 30 (1), 207-210 (2002).
  11. Kolesnikov, N., et al. ArrayExpress update--simplifying data submissions. Nucleic Acids Res. 43 (Database issue), D1113-D1116 (2015).
  12. Cohen, J., et al. Sepsis: a roadmap for future research. Lancet Infect Dis. 15 (5), 581-614 (2015).
  13. Spinelli, L., Carpentier, S., Montanana Sanchis, F., Dalod, M., Vu Manh, T. P. BubbleGUM: automatic extraction of phenotype molecular signatures and comprehensive visualization of multiple Gene Set Enrichment Analyses. BMC Genomics. 16 (1), 814(2015).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

动物模型选择GSEA 软件工具分子特征数据库标准化富集评分FDR 值列联表分析信息增益通路调控比较