本文介绍了一种直接且稳健的方法,用于识别共调控基因中潜在的调控基序。SCOPE 无需任何用户参数,即可返回代表调控信号的优良候选基序。此类调控信号的识别有助于理解潜在的生物学机制。
方法文章
本文介绍了一种直接且稳健的方法,用于识别共调控基因中潜在的调控基序。SCOPE 无需任何用户参数,即可返回代表调控信号的优良候选基序。此类调控信号的识别有助于理解潜在的生物学机制。
SCOPE 是一种集成式基序查找工具,它并行使用三种组分算法,通过基序的过表达及位置偏好来识别潜在的调控基序1。每种组分算法均被优化用于发现不同类型的基序。通过整合这三种方法的优势,SCOPE 的性能优于任何单一算法,即使在存在噪声数据的情况下亦表现出色1。在本文中,我们利用 SCOPE 的网络版本2来分析参与端粒维持的基因。SCOPE 已被整合到至少另外两种基序查找程序中3,4,并已在其他研究中得到应用5-8。
构成 SCOPE 的三种算法分别是 BEAM9(用于发现非简并性序列基序,如 ACCGGT)、PRISM10(用于发现简并性序列基序,如 ASCGWT)和 SPACER11(用于发现较长的双元基序,如 ACCnnnnnnnnGGT)。这三种算法均经过优化,可高效识别各自对应的基序类型,共同使 SCOPE 具有极佳的性能。
在完成基因集分析并鉴定出候选基序后,SCOPE 可以搜索其他含有该基序的基因,将这些基因加入原始基因集后可提高基序评分。这一过程可通过基序的过表达或位置偏好实现。在使用已通过生物学验证的部分基因集(包含转录因子结合位点)进行测试时,SCOPE 能够识别出大部分同样受该转录因子调控的其余基因。
SCOPE 的输出结果以表格和图形化基序图的形式展示候选基序、其显著性及其他相关信息。常见问题解答和视频教程可在 SCOPE 网站获取,该网站还提供“示例搜索”按钮,允许用户进行试运行。
SCOPE 具有非常友好的用户界面,使初学者无需成为基序查找生物信息学领域的专家,即可充分利用该算法的强大功能。SCOPE 的输入可以是基因列表或 FASTA 序列,这些数据可通过浏览器文本框输入,或从文件中读取。SCOPE 的输出包含所有已识别基序的列表,以及其得分、出现次数、包含该基序的基因比例和用于识别基序的算法。对于每个基序,结果详情包括基序的一致性序列表示、序列标志图(sequence logo)、位置权重矩阵,以及每个基序出现位置的具体实例列表(标明确切位置和“链”信息)。结果将在浏览器窗口中返回,也可选择通过电子邮件发送。先前的研究论文已对 SCOPE 算法进行了详细描述1,2,9-11。
1. 准备一份您认为受共同调控、可用于 SCOPE 分析的基因名称列表。
将列表保存为文本文件,或复制到剪贴板,以便在第3步中粘贴到SCOPE中。文件中每行应包含一个基因名称,且不包含其他附加信息。或者,您也可以将列表准备为包含待分析实际序列的FASTA文件。
2. 启动您的网络浏览器并连接至网址:http://genie.dartmouth.edu/SCOPE/
3. 输入 SCOPE 进行分析所需的信息。
SCOPE 的初始页面如图1所示。本步骤中将介绍不同的部分。
4. 典型结果:
分析的主要结果如图3所示。页面顶部包含一个表格,列出了SCOPE发现的基序信息。第一列列出了所发现的基序,旁边的小彩色方块作为下方图形化基序图的图例。通过单击彩色方块(或方块所在位置),可以切换任意特定基序的显示或隐藏。此功能非常有助于隐藏高度重复的基序显示,以免影响对出现频率较低的基序模式的观察。
其他数据列包括“计数”(该基序在整个基因集合中出现的次数)、“显著性值”(该基序显著性的指标)、“覆盖度”(包含至少一个该基序实例的提交基因所占的百分比)以及“算法”(用于检测该基序的三种组分算法中的哪一种)。
点击列出的任一基序,用户将跳转至该基序的详细信息页面。图4展示了青色基序(atgnnnnttg)的结果详情。在此页面中,该基序以三种形式呈现:序列标志图(sequence logo)、位置权重矩阵(position weight matrix),以及包含所有基序实例及其位置、链方向和对应基因的列表。
在页面稍下方,显示了关于搜索其他含有此基序基因结果的更多详细信息。可以看出,在本例中,共有1344个其他基因含有该基序,且当这些基因被加入原始基因集后,均能进一步改善Sig值。点击“将选中基因添加至搜索”按钮,将返回SCOPE设置页面,这些基因会被添加至原始基因集中,且参数将保持先前设置不变。本例中,共有10个额外基因被添加至原始的3个基因中。
图5显示了包含该基序额外基因的分析结果。原始的三个基因位于结果的底部(小写形式)。观察这些额外基因上游区域的基序模式可以明显看出它们具有相似性。事实上,这些基因中的许多都与端粒维持有关,与原始的三个基因相同。还需注意的是,原始基序现在是该基因集合中得分最高的基序。
另一组 SCOPE 结果如图 6 所示。在本例中,这组基因是参与酿酒酵母(Saccharomyces cerevisiae)核糖体生物合成的基因。这些基因实际上并不属于核糖体的一部分,而是负责核糖体的组装,其中包括多种修饰酶。图中明显可见,红色和绿色的模体形成了一种可靠的模式,很可能参与调控该基因集合的表达。我们正在更深入地研究这种“模块”模式,相关结果将在后续出版物中报道。

图 1。SCOPE 主输入页面。该页面用于输入待分析的基因,并设定物种以及待分析的上游区域长度。用户可选择通过电子邮件接收结果,或限定搜索特定的模体。还提供视频帮助功能。

图2.SCOPE主输入页面,已填入执行搜索的参数值。这些参数是点击“示例搜索”按钮后生成的结果。在此示例中,已勾选“查找其他含有SCOPE识别出的基序的基因”复选框。此选项的计算耗时较长(需检测基因组中的每个基因),但可提供有价值的生物学见解。

图 3.SCOPE 主要结果页面。该页面汇总了 SCOPE 搜索的结果。页面列出了所有高分模体,并通过颜色编码的模体图谱显示所鉴定模体在分析基因集中的位置。单击某个模体旁的彩色方框,可切换该模体在模体图谱中的显示状态。此外,还提供模体的显著性评分(Sig 值)、包含该模体的基因比例(覆盖率)以及用于发现该模体的算法。


图 4。当在主结果页面中点击某一特定模体时,将显示此结果详情页面。该页面展示了该模体的详细信息。序列标识图、位置权重矩阵(PWM)和一致性序列分别以不同方式对页面上列出的模体实例进行总结。由于在原始搜索设置中已勾选“查找额外基因”选项,因此本页面还提供了基因组中包含该模体的其他基因的相关信息。通过此页面,还可以启动另一次 SCOPE 分析运行,并将本页面识别出的额外基因纳入分析。

图5该图展示了在图4所示的“atgnnnnttg”基序中寻找额外基因的结果。原始的三个基因以小写字母显示在基序图底部,新增的基因以大写字母显示。这些基因上游区域的基序呈现出明显的规律性。同时请注意,所指定的基序在算法中标注为“LOOKUP”,因为这是其被识别的方式。实际上,该基序与5th SPACER 在本分析中发现的基序

图6。酿酒酵母(Saccharomyces cerevisiae)中参与核糖体生物合成的基因的SCOPE输出结果。注意模块的保守模式,其中包含“aaawtttbh”(红色)和“abctcatcd”(绿色)两种基序,二者相隔约10–30个核苷酸,并位于基因转录起始位点上游100–200个核苷酸处。
SCOPE 为研究人员提供了一种强大的工具,可用于识别共表达基因集合中潜在的调控基序。用户无需像使用其他许多基序搜索平台那样,预先猜测基序的长度或出现次数,因为这些参数在基序被识别之前本质上是未知的。该工具的界面非常简洁,无论是输入序列或基因名称,还是查看输出结果,操作均十分便捷。
SCOPE 输出结果提供了所鉴定出的所有基序的详细信息,采用三种不同的基序表示方式。每个基因中基序的每一条实例均列出了其位置和“链”信息。以基序图谱形式呈现的图形化结果,提供了一种易于理解的可视化展示,可直观地观察所存在的基序模式。
SCOPE 对数据中的噪声具有很强的鲁棒性。通常,这种噪声表现为起始基因集合中包含了一些实际上可能与其他基因并不同步调控的额外基因。这种情况在从微阵列实验中获得共表达基因时经常出现。有时实验本身存在噪声,或者在微阵列实验所使用的实验条件下,可能激活了多个不同的转录因子。这些不同的转录因子在DNA上很可能具有不同的靶位点。即使在无关基因数量达到真实基因4倍的情况下(噪声与信号比为4:1),SCOPE 在预测位点方面的准确性仍能保持在50%1。
尽管 SCOPE 包含超过 200 万个基因名称的同义词,但它有时仍无法识别某些基因名称。我们正在持续更新同义词列表,但有时会发现不同的同义词指向同一个基因。在这种情况下,由于存在歧义,我们不会将这些同义词纳入数据库。如果您的基因名称未被 SCOPE 识别,建议您参考该基因组对应的特异性网站,以查找可用于 SCOPE 的替代基因名称。SCOPE 为每个物种提供了适当的基因名称示例。
SCOPE 目前包含 72 个物种,并且不断有新物种被添加进来。该网站提供视频帮助以及常见问题解答。学术用户可通过向 RHG 发送邮件免费获取源代码。
未声明任何利益冲突。
本研究得到了美国国家科学基金会向 RHG 提供的资助(项目编号:DBI-0445967)。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可