方法文章

利用SCOPE识别共表达基因中的潜在调控基序

DOI:

10.3791/2703

2011年5月31日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了一种直接且稳健的方法,用于识别共调控基因中潜在的调控基序。SCOPE 无需任何用户参数,即可返回代表调控信号的优良候选基序。此类调控信号的识别有助于理解潜在的生物学机制。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

SCOPE 是一种集成式基序查找工具,它并行使用三种组分算法,通过基序的过表达及位置偏好来识别潜在的调控基序1。每种组分算法均被优化用于发现不同类型的基序。通过整合这三种方法的优势,SCOPE 的性能优于任何单一算法,即使在存在噪声数据的情况下亦表现出色1。在本文中,我们利用 SCOPE 的网络版本2来分析参与端粒维持的基因。SCOPE 已被整合到至少另外两种基序查找程序中3,4,并已在其他研究中得到应用5-8

构成 SCOPE 的三种算法分别是 BEAM9(用于发现非简并性序列基序,如 ACCGGT)、PRISM10(用于发现简并性序列基序,如 ASCGWT)和 SPACER11(用于发现较长的双元基序,如 ACCnnnnnnnnGGT)。这三种算法均经过优化,可高效识别各自对应的基序类型,共同使 SCOPE 具有极佳的性能。

在完成基因集分析并鉴定出候选基序后,SCOPE 可以搜索其他含有该基序的基因,将这些基因加入原始基因集后可提高基序评分。这一过程可通过基序的过表达或位置偏好实现。在使用已通过生物学验证的部分基因集(包含转录因子结合位点)进行测试时,SCOPE 能够识别出大部分同样受该转录因子调控的其余基因。

SCOPE 的输出结果以表格和图形化基序图的形式展示候选基序、其显著性及其他相关信息。常见问题解答和视频教程可在 SCOPE 网站获取,该网站还提供“示例搜索”按钮,允许用户进行试运行。

SCOPE 具有非常友好的用户界面,使初学者无需成为基序查找生物信息学领域的专家,即可充分利用该算法的强大功能。SCOPE 的输入可以是基因列表或 FASTA 序列,这些数据可通过浏览器文本框输入,或从文件中读取。SCOPE 的输出包含所有已识别基序的列表,以及其得分、出现次数、包含该基序的基因比例和用于识别基序的算法。对于每个基序,结果详情包括基序的一致性序列表示、序列标志图(sequence logo)、位置权重矩阵,以及每个基序出现位置的具体实例列表(标明确切位置和“链”信息)。结果将在浏览器窗口中返回,也可选择通过电子邮件发送。先前的研究论文已对 SCOPE 算法进行了详细描述1,2,9-11

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 准备一份您认为受共同调控、可用于 SCOPE 分析的基因名称列表。

将列表保存为文本文件,或复制到剪贴板,以便在第3步中粘贴到SCOPE中。文件中每行应包含一个基因名称,且不包含其他附加信息。或者,您也可以将列表准备为包含待分析实际序列的FASTA文件。

2. 启动您的网络浏览器并连接至网址:http://genie.dartmouth.edu/SCOPE/

3. 输入 SCOPE 进行分析所需的信息。

SCOPE 的初始页面如图1所示。本步骤中将介绍不同的部分。

  1. 使用“物种”下拉菜单选择您将要分析的物种。选择正确的物种非常重要,因为SCOPE会参考基因组来计算其分析的任何候选基序出现的背景频率。
  2. 使用“上游序列”单选按钮选择“基因间区”或“固定长度”。选择“基因间区”将分析当前基因与其上游相邻基因之间的全部序列,这意味着每个基因的上游序列长度可能不同。选择“固定长度”则会精确分析当前基因起始位置上游指定数量的核苷酸。在此情况下,SCOPE将对每个基因使用相同长度的上游序列进行分析,即使该区域延伸至前一个基因内部(或未延伸)。通常建议选择800个核苷酸作为长度,但最佳长度可能因物种而异。
  3. 接下来,通过将基因列表粘贴到基因列表文本框中,或点击“选择文件”按钮来选择您之前创建的包含基因列表的文件,以指定SCOPE需要分析的基因集。您也可以将FASTA序列文件直接粘贴到同一文本框中。
  4. 页面的下一部分包含一个名为“在基因组中搜索其他含有发现基序的基因?”的复选框。启用此选项会显著增加分析时间,因为SCOPE必须评估基因组中的每一个其他基因。然而,该功能在识别可能与初始基因集共调控的其他候选基因时非常有用。由于SCOPE分析通常较快,建议在初次分析时关闭此选项。如结果部分所述,您可随时从结果页面重新启用该选项以重新运行分析。
  5. “结果必须包含”部分可用于输入您希望SCOPE在分析中包含的特定基序。如果您正在寻找某个已知的特定基序,可使用此功能。
  6. 页面的最后一部分可用于输入您的电子邮件地址以及与本次分析相关的备注信息。如果填写了这些内容,SCOPE将在分析完成后发送一封电子邮件,其中包含指向结果网页的链接,并附带两个文件。一个是纯文本文件,以人类可读格式包含所有分析结果;另一个是XML文件,以计算机可读格式包含SCOPE发现的全部结果。如果您希望对结果进行进一步分析,XML文件将非常有用。这两个文件在发送前均会被压缩为ZIP格式。
  7. 在本演示中,我们将使用相同的信息开始分析。您只需点击“示例搜索”按钮即可自动填充必要的信息。请现在点击该按钮。系统将自动填入三个基因,并为其他字段设置合适的选项,请保持这些设置不变。这三个基因均参与Saccharomyces cerevisiae的端粒维持。填写好的表单如图2所示。请按下页面底部的“运行SCOPE”按钮以启动分析。

4. 典型结果:

分析的主要结果如图3所示。页面顶部包含一个表格,列出了SCOPE发现的基序信息。第一列列出了所发现的基序,旁边的小彩色方块作为下方图形化基序图的图例。通过单击彩色方块(或方块所在位置),可以切换任意特定基序的显示或隐藏。此功能非常有助于隐藏高度重复的基序显示,以免影响对出现频率较低的基序模式的观察。

其他数据列包括“计数”(该基序在整个基因集合中出现的次数)、“显著性值”(该基序显著性的指标)、“覆盖度”(包含至少一个该基序实例的提交基因所占的百分比)以及“算法”(用于检测该基序的三种组分算法中的哪一种)。

点击列出的任一基序,用户将跳转至该基序的详细信息页面。图4展示了青色基序(atgnnnnttg)的结果详情。在此页面中,该基序以三种形式呈现:序列标志图(sequence logo)、位置权重矩阵(position weight matrix),以及包含所有基序实例及其位置、链方向和对应基因的列表。

在页面稍下方,显示了关于搜索其他含有此基序基因结果的更多详细信息。可以看出,在本例中,共有1344个其他基因含有该基序,且当这些基因被加入原始基因集后,均能进一步改善Sig值。点击“将选中基因添加至搜索”按钮,将返回SCOPE设置页面,这些基因会被添加至原始基因集中,且参数将保持先前设置不变。本例中,共有10个额外基因被添加至原始的3个基因中。

图5显示了包含该基序额外基因的分析结果。原始的三个基因位于结果的底部(小写形式)。观察这些额外基因上游区域的基序模式可以明显看出它们具有相似性。事实上,这些基因中的许多都与端粒维持有关,与原始的三个基因相同。还需注意的是,原始基序现在是该基因集合中得分最高的基序。

另一组 SCOPE 结果如图 6 所示。在本例中,这组基因是参与酿酒酵母(Saccharomyces cerevisiae)核糖体生物合成的基因。这些基因实际上并不属于核糖体的一部分,而是负责核糖体的组装,其中包括多种修饰酶。图中明显可见,红色和绿色的模体形成了一种可靠的模式,很可能参与调控该基因集合的表达。我们正在更深入地研究这种“模块”模式,相关结果将在后续出版物中报道。

SCOPE 程序界面;DNA 模体搜索工具;基因调控元件鉴定;输入选项。
图 1。SCOPE 主输入页面。该页面用于输入待分析的基因,并设定物种以及待分析的上游区域长度。用户可选择通过电子邮件接收结果,或限定搜索特定的模体。还提供视频帮助功能。

用于识别调控DNA基序的SCOPE网络工具界面;基因组序列输入选项。
图2.SCOPE主输入页面,已填入执行搜索的参数值。这些参数是点击“示例搜索”按钮后生成的结果。在此示例中,已勾选“查找其他含有SCOPE识别出的基序的基因”复选框。此选项的计算耗时较长(需检测基因组中的每个基因),但可提供有价值的生物学见解。

SCOPE 结果:模体分析图表;序列数量、显著性、覆盖率、算法;生物信息学。
图 3.SCOPE 主要结果页面。该页面汇总了 SCOPE 搜索的结果。页面列出了所有高分模体,并通过颜色编码的模体图谱显示所鉴定模体在分析基因集中的位置。单击某个模体旁的彩色方框,可切换该模体在模体图谱中的显示状态。此外,还提供模体的显著性评分(Sig 值)、包含该模体的基因比例(覆盖率)以及用于发现该模体的算法。

一致性序列分析、序列标识图、PWM 表格、序列位置;DNA 结合研究。
显示基因出现次数、链位置及显著性值变化的模体分析表格。
图 4。当在主结果页面中点击某一特定模体时,将显示此结果详情页面。该页面展示了该模体的详细信息。序列标识图、位置权重矩阵(PWM)和一致性序列分别以不同方式对页面上列出的模体实例进行总结。由于在原始搜索设置中已勾选“查找额外基因”选项,因此本页面还提供了基因组中包含该模体的其他基因的相关信息。通过此页面,还可以启动另一次 SCOPE 分析运行,并将本页面识别出的额外基因纳入分析。

Motif analysis results; sequence consensus table, algorithms, motif distribution diagram.
图5该图展示了在图4所示的“atgnnnnttg”基序中寻找额外基因的结果。原始的三个基因以小写字母显示在基序图底部,新增的基因以大写字母显示。这些基因上游区域的基序呈现出明显的规律性。同时请注意,所指定的基序在算法中标注为“LOOKUP”,因为这是其被识别的方式。实际上,该基序与5th SPACER 在本分析中发现的基序

DNA基序分析结果图表;共有序列展示;SCOPE软件算法比较。
图6。酿酒酵母(Saccharomyces cerevisiae)中参与核糖体生物合成的基因的SCOPE输出结果。注意模块的保守模式,其中包含“aaawtttbh”(红色)和“abctcatcd”(绿色)两种基序,二者相隔约10–30个核苷酸,并位于基因转录起始位点上游100–200个核苷酸处。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

SCOPE 为研究人员提供了一种强大的工具,可用于识别共表达基因集合中潜在的调控基序。用户无需像使用其他许多基序搜索平台那样,预先猜测基序的长度或出现次数,因为这些参数在基序被识别之前本质上是未知的。该工具的界面非常简洁,无论是输入序列或基因名称,还是查看输出结果,操作均十分便捷。

SCOPE 输出结果提供了所鉴定出的所有基序的详细信息,采用三种不同的基序表示方式。每个基因中基序的每一条实例均列出了其位置和“链”信息。以基序图谱形式呈现的图形化结果,提供了一种易于理解的可视化展示,可直观地观察所存在的基序模式。

SCOPE 对数据中的噪声具有很强的鲁棒性。通常,这种噪声表现为起始基因集合中包含了一些实际上可能与其他基因并不同步调控的额外基因。这种情况在从微阵列实验中获得共表达基因时经常出现。有时实验本身存在噪声,或者在微阵列实验所使用的实验条件下,可能激活了多个不同的转录因子。这些不同的转录因子在DNA上很可能具有不同的靶位点。即使在无关基因数量达到真实基因4倍的情况下(噪声与信号比为4:1),SCOPE 在预测位点方面的准确性仍能保持在50%1

尽管 SCOPE 包含超过 200 万个基因名称的同义词,但它有时仍无法识别某些基因名称。我们正在持续更新同义词列表,但有时会发现不同的同义词指向同一个基因。在这种情况下,由于存在歧义,我们不会将这些同义词纳入数据库。如果您的基因名称未被 SCOPE 识别,建议您参考该基因组对应的特异性网站,以查找可用于 SCOPE 的替代基因名称。SCOPE 为每个物种提供了适当的基因名称示例。

SCOPE 目前包含 72 个物种,并且不断有新物种被添加进来。该网站提供视频帮助以及常见问题解答。学术用户可通过向 RHG 发送邮件免费获取源代码。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

未声明任何利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究得到了美国国家科学基金会向 RHG 提供的资助(项目编号:DBI-0445967)。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. A novel ensemble learning method for de novo computational identification of DNA binding sites. BMC Bioinformatics. 8, 249-249 (2007).">Chakravarty, A., Carlson, J. M., Khetani, R. S., Gross, R. H. A novel ensemble learning method for de novo computational identification of DNA binding sites. BMC Bioinformatics. 8, 249-249 (2007).
  2. SCOPE: a web server for practical de novo motif discovery. Nucleic Acids Res. 35, 259-264 (2007).">Carlson, J. M., Chakravarty, A., DeZiel, C. E., Gross, R. H. SCOPE: a web server for practical de novo motif discovery. Nucleic Acids Res. 35, 259-264 (2007).
  3. MOTIFATOR: detection and characterization of regulatory motifs using prokaryote transcriptome data. Bioinformatics. 25, 550-551 (2009).">Blom, E. J., Roerdink, J. B., Kuipers, O. P., Hijum, S. A. van MOTIFATOR: detection and characterization of regulatory motifs using prokaryote transcriptome data. Bioinformatics. 25, 550-551 (2009).
  4. DISCLOSE : DISsection of CLusters Obtained by SEries of transcriptome data using functional annotations and putative transcription factor binding sites. BMC Bioinformatics. 9, 535-535 (2008).">Blom, E. J. DISCLOSE : DISsection of CLusters Obtained by SEries of transcriptome data using functional annotations and putative transcription factor binding sites. BMC Bioinformatics. 9, 535-535 (2008).
  5. Three subclasses of a Drosophila insulator show distinct and cell type-specific genomic distributions. Genes Dev. 23, 1338-1350 (2009).">Bushey, A. M., Ramos, E., Corces, V. G. Three subclasses of a Drosophila insulator show distinct and cell type-specific genomic distributions. Genes Dev. 23, 1338-1350 (2009).
  6. Identification of the Candida albicans Cap1p regulon. Eukaryot Cell. 8, 806-820 (2009).">Znaidi, S. Identification of the Candida albicans Cap1p regulon. Eukaryot Cell. 8, 806-820 (2009).
  7. RegAnalyst: a web interface for the analysis of regulatory motifs, networks and pathways. Nucleic Acids Res. 37, W193-W201 (2009).">Sharma, D., Mohanty, D., Surolia, A. RegAnalyst: a web interface for the analysis of regulatory motifs, networks and pathways. Nucleic Acids Res. 37, W193-W201 (2009).
  8. Genomewide location analysis of Candida albicans Upc2p, a regulator of sterol metabolism and azole drug resistance. Eukaryot Cell. 7, 836-847 (2008).">Znaidi, S. Genomewide location analysis of Candida albicans Upc2p, a regulator of sterol metabolism and azole drug resistance. Eukaryot Cell. 7, 836-847 (2008).
  9. A beam search algorithm for the identification of cis-regulatory elements in groups of genes. J Comput Biol. 13, 686-701 (2006).">Carlson, J., Chakravarty, A., Gross, R. B. E. A. M. A beam search algorithm for the identification of cis-regulatory elements in groups of genes. J Comput Biol. 13, 686-701 (2006).
  10. Bounded search for de novo identification of degenerate cis-regulatory elements. BMC Bioinformatics. 7, 254-254 (2006).">Carlson, J., Chakravarty, A., Khetani, R., Gross, R. Bounded search for de novo identification of degenerate cis-regulatory elements. BMC Bioinformatics. 7, 254-254 (2006).
  11. SPACER: identification of cis-regulatory elements with non-contiguous critical residues. Bioinformatics. 23, 1029-1031 (2007).">Chakravarty, A., Carlson, J. M., Khetani, R. S., DeZiel, C. E., Gross, R. H. SPACER: identification of cis-regulatory elements with non-contiguous critical residues. Bioinformatics. 23, 1029-1031 (2007).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

SCOPE

相关文章