2017年8月16日
我们提供一个标准化的协议用于基因集的浓缩转录组数据分析,找出理想的小鼠模型的转化研究。
该协议可以用 DNA 微阵列和 RNA 测序数据,并且可以进一步扩展到其他组学数据如果数据可用。
该程序的总体目标是确定适合转化研究问题的动物模型。这种方法可以帮助回答转化研究中的一个关键问题,即如何为我想研究的特定人类疾病选择合适的动物模型?该技术的主要优点是可以在动物模型和人类疾病研究之间比较全基因组数据。
因此,这种方法避免了与单基因比较相关的偏见解释。虽然这种方法提供了对小鼠模型对炎症性疾病的适用性的见解,但它也可以应用于其他疾病模型。GSEA 有助于研究基因表达研究的政策调节。
每个动物模型和疾病研究的输出是进一步比较的基础。从软件和数据下载开始此过程,然后按照文本协议中的说明进行数据处理和格式化。然后打开 GSEA 软件工具。
单击主窗口左侧的 Load Data 按钮。将打开一个新选项卡,用于导入所需的数据文件。在新选项卡中,浏览到基因表达数据文件和表型文件。
如果 GSEA 无法连接到互联网,还要加载下载的分子特征数据库文件和 DNA 芯片注释文件。成功导入的数据将显示在 load data (加载数据) 部分中。单击主窗口左侧的 Run GSEA 按钮。
将打开一个新选项卡,以便设置分析参数。该选项卡细分为三个部分:必填字段、基本字段和高级字段。在必填字段中,首先选择表达式数据集。
然后从连接的网站或手动导入的基因集文件中选择基因集数据库。编辑表型标签以选择应该相互比较的样本组。例如,疾病组与健康对照组。
接下来,选择 collapse dataset to gene symbols equals true,以便将表达数据集中的探针标识符转换为基因集数据库中使用的官方 Hugo 基因符号。如果表达式数据集已包含 Hugo 基因符号,请选择 false。将排列数设置为默认设置 1, 000。
将排列类型更改为基因集,因为仅当每个表型中有 7 个以上的样本时,才建议进行表型排列。最后,从连接的网站或手动导入的 DNA 芯片注释文件中选择用于生成基因表达数据的芯片平台。在基本字段中,编辑分析名称和 save results in this folder 部分。
此外,还可以更改其他统计参数。有关参数和高级字段部分的更多详细信息,请转到 GSEA 用户指南。如果应用了基因表达数据的外部计算组指标,请使用 GSEA 预排名工具。
该分析是根据预先分配给预先计算的组指标的简单基因列表进行的,这些指标用于对基因进行排名。加载替代基因表达文件后,转到主导航栏并单击 Tools(工具)、GseaPreranked。同样,将打开一个新选项卡,用于设置分析参数。
接下来,点击 运行 窗口右下角的按钮。单击 GSEA 报告部分中的成功分析以打开分析结果。接下来,单击 Excel 格式的详细富集结果,将分析结果导出到电子表格。
分别导出两种表型的结果。在 Excel 中,将结果数据联接到一个电子表格文件中。为了随后比较几项研究的基因表达数据,至少保持基因集的名称、其标准化富集分数和 FDR 值。
对第二项研究和所有要相互比较的进一步研究重复基因集富集分析。包括尽可能多的人类临床研究和不同的小鼠模型,以确定转化研究问题的最佳小鼠模型。为了确定模拟人类情况的最佳动物模型,请将所有研究的 GSEA 结果相互比较。
使用富集分数和 FDR 值将通路分类为激活、抑制或两者都不。对于要比较的许多研究,建议使用 R 脚本。对于两项研究的每次比较,计算由 3 x 3 列联表指示的九种可能的途径调节组合的实现次数。
通过计算阳性预测值和阴性预测值来评估两项研究之间的相关性,根据定义,阴性预测值是在两项研究中显示相同调节的途径部分。此外,估计预期仅凭偶然性相关的通路部分,由 ppv 机会和 npv 机会表示。然后计算 information 的增益。
所有计算都可以使用电子表格程序完成,但建议使用 R 函数。使用一对研究的列联表通过卡方检验计算 P 值,例如,通过使用 R 函数、卡方检验或电子表格程序。将列联表的数据存储在矩阵 X 中接下来,比较选择用于分析的所有研究组合的 GSEA 结果。
按信息增益对所有组合进行排序。对于多个数据集的比较,请使用矩阵并使用彩色热图可视化结果。选择信息增益最高的动物模型。
为了评估信息增益的显著性,还要考虑卡方检验。此处演示了人类和小鼠研究之间通路比较的相关矩阵。通路调控的重叠表现为可以从一项研究中获得的信息增益,以预测另一项研究中的效果。
蓝色表示数据之间的相关性较低,红色表示数据之间的高度相关性。人类数据集与小鼠数据集的比较揭示了与人类研究高度相关的小鼠模型亚组。因此,这些小鼠模型最适合模拟人类的情况。
相比之下,研究 7、8 和 9 与人类疾病研究没有相关性。一旦掌握,如果执行得当,这项技术可以在几天内完成。这取决于数据量和数据可用性。
在尝试此过程时,请务必记住,结果的有效性取决于所选数据的质量和相关性。看完这个视频,你应该对如何根据转录本数据为特定的人类疾病选择合适的动物模型有一个很好的了解。
查看完整文字稿并访问数千部科学视频
本文介绍了一种用于转录组数据基因集富集分析(GSEA)的标准化协议,用于识别适合用于转化研究的小鼠模型。该方法比较了动物模型和人类疾病研究之间的全基因组数据,为各种疾病的模型选择提供了洞见。
Selecting appropriate animal models remains a critical challenge in translational research, where model misalignment contributes to late-stage attrition. This protocol enables systematic evaluation of murine models using transcriptomic concordance with human disease data, reducing reliance on subjective gene filtering. By providing a standardized GSEA-based framework, it supports predictive confidence in model selection and informs go/no-go decisions early in discovery.
The method fits within the discovery continuum from target validation to preclinical model selection, enabling transcriptomic data to guide animal model choice before significant investment in screening or efficacy studies.