方法文章

基因组MRI——用于研究基因组DNA内序列模式的公共资源

11.9K 次观看

DOI:

10.3791/2663

2011年5月9日

本文内容

摘要

我们提供一个用于基因组序列分析的公共计算网站。该网站能够检测具有不同非随机核苷酸组成的DNA序列模式。此资源还可生成具有多种复杂程度的随机化序列。

摘要

在复杂的真核生物中,非编码基因组区域(包括基因间区、内含子以及外显子的非翻译区段)的核苷酸组成具有高度非随机性,呈现出复杂的序列模式镶嵌结构。这些模式包括所谓的中程不均一性(Mid-Range Inhomogeneity, MRI)区域——长度为30至10000个核苷酸、富含特定碱基或碱基组合的序列(例如富含(G+T)、富含嘌呤等)。MRI区域与非B型DNA等异常DNA结构相关,这些结构常参与基因表达调控、重组及其他遗传过程(Fedorova & Fedorov 2010)。此外,MRI区域内部存在强烈的突变固定偏倚,即倾向于淘汰会降低其序列不均一性的突变,这一现象进一步支持了这些基因组序列的功能性和重要性(Prakash et al. 2009)。

本文介绍了一种可免费获取的互联网资源——Genomic MRI 程序包,该程序包专为基因组序列的计算分析而设计,旨在发现并表征其中存在的多种 MRI 模式(Bechtel et al. 2008)。该程序包还能够生成具有不同特性和与天然输入 DNA 序列不同程度相似性的随机序列。该资源的主要目标是促进对大片段非编码 DNA 区域的分析,这些区域目前仍鲜有研究,亟待深入探索与认知。

方案

本文中使用的所有程序均采用 perl 编写,所有网页均采用 PHP 创建。

1. 起始点:

打开在线基因组 MRI 软件包的主页,网址为 http://mco321125.meduohio.edu/~jbechtel/gmri/。该网络资源在“帮助(使用方法/README)”链接中提供了关于程序的说明和解释,而所有关于Genomic MRI及类似算法的已发表资料则列在“相关资源链接”中。

2. 输入序列的准备与上传。

创建一个包含FASTA格式序列的文件以启动GMRI分析会话。该格式中的每条核苷酸序列都应以一个以“>”字符开头的单行作为前导,该行用于表示序列的标识符,并在同一行中后接对该序列的简短描述。用于GMRI分析的核苷酸序列也可包含R、Y、N、X等字符。然而,程序不会处理非A、T、C、G的字符,这些字符将被跳过。已对重复元件进行“屏蔽”(即用“N”替代)的序列也可作为输入使用。请注意,序列字符不区分大小写。

  1. Genomic MRI 首页上点击“开始或恢复”按钮以启动 GMRI 会话。系统将引导用户进入可上传核苷酸序列的页面。
  2. 通过“选择文件”按钮,将您以 FASTA 格式排列的序列复制粘贴,或从本地计算机上传包含序列的文件。
  3. 点击“使用此文件启动新会话”按钮。输入窗口上方应会出现一条确认消息,提示“您的序列已成功上传”,同时您将获得一个字母数字组合的“GMRI 标识符”[网站称之为“会话标签”],用于在首次使用后的两周内检索和继续该会话(例如 b16yMj)。

注意:此后输入的序列将称为“userfile”。

3. 获取输入序列的寡核苷酸频率分布(可选)。

点击顶部行的“SRI Analyzer”标签,以获取输入序列集合中所有寡核苷酸频率的分布情况。缩写 SRI 代表短程非均一性(short-range inhomogeneity)。此时,用户可指定用于计算频率的寡核苷酸最大长度(从 2 到 9 个核苷酸,默认为 6 nt)。通过点击“Maximum oligomer size”下拉列表中的相应选项完成选择。然后按下“Analyze File”按钮以启动计算。输入序列组成的粗略表示将立即以表格形式显示在网页中部,并可下载为“userfile.comp.tbl”。该表格仅显示输入序列中最丰富和最稀有的寡核苷酸。

所有可能的寡核苷酸的完整频率表将生成为一个名为“userfile.comp”的文件,可通过“下载组成文件”链接获取。

注意:SRI 分析仪对所有重叠的寡核苷酸序列进行整体计数。

4. 生成与输入序列具有相同寡核苷酸组成的随机序列(可选)。

(执行本任务需完成方案第3步)。

  1. 点击顶部一行的“SRI Generator”标签,打开一个可生成随机序列的新网页。在该网页上,使用列表框选择要生成的随机序列样本数量。每个样本文件将包含与“userfile”中输入序列相同数量和长度的随机序列。此外,如果某条输入序列包含非 A、T、C 或 G 的字符,则随机序列中在相同位置将保留“N”。
  2. 选择用于在随机序列中近似核苷酸频率的最长寡核苷酸长度。可通过点击屏幕中央表格中对应的单选按钮来选择所需的寡聚体层级(例如,“4-mers”表示四碱基寡核苷酸)。需注意的是,生成的随机序列不仅在所选寡聚体层级上具有近似的频率,还将在较短的寡聚体层级上保持与输入序列一致的相应频率。由于采用马尔可夫模型方法生成随机序列,输入序列与随机序列之间的寡核苷酸频率可能存在微小波动。
  3. 点击“Generate File”按钮启动程序。如果输入序列较大,生成随机序列可能需要几分钟时间,因此用户应等待页面底部出现蓝色的“Download”链接。生成的随机序列集将保存为形如“userfile.randX_Y”的文件,其中 X 为随机序列集的编号,Y 为选定的寡聚体层级(例如,“userfile_rand2_4”)。

5. 输入序列与随机序列的中程不均匀性(MRI)分析。

  1. 点击“MRI 分析仪选项卡(顶行),打开一个新网页,分析序列核苷酸组成中中程非均一性。
  2. 从“待分析文件列表框(可在此处选择输入序列或生成的随机序列集)。
  3. 选择 内容类型 通过提供的列表框选择要分析的MRI内容。(共有七个选项:G+C;G+A;G+T;A;G;C;或T。)
  4. 选择用于通过以下方式检测富含内容和缺乏内容序列的窗口长度 窗口大小 列表框(默认值为50个核苷酸;有效范围为30至1000)
  5. 选择 上限阈值较低阈值 对于富含内容和贫含内容的区域。这些阈值可通过当前窗口中特定核苷酸的确切数量来定义(使用 按数量 列表框中的选项)或通过该窗口中这些核苷酸所占百分比(使用 按百分比 选项
  6. 在完成全部五个选择后(例如:序列为“用户文件;内容 = GC窗口大小 = 50;上阈值 = 35下限阈值 = 15),通过按下启动程序 分析文件 按钮。程序将连续扫描所选输入中的所有序列。每一步骤中,程序获取当前序列中长度等于指定窗口大小的片段,并计算所选核苷酸内容的数量或百分比是否高于上限阈值或低于下限阈值。若该窗口不符合任一条件,则选择下一个重叠窗口(移动一个核苷酸)进行相同分析。当发现某一窗口的序列满足富集或贫乏组分的阈值要求时,程序将该窗口的序列保存至输出文件,并在图形输出中生成一个峰值。随后,程序跳转至下一个非重叠相邻窗口,并继续扫描过程,直至序列末端。
  7. 程序完成后,输出文件的链接(文件名为“用户文件_GC_50_35..15“上述示例)出现,并在网页中部显示结果的图形化表示(见图1)。在此图形显示中,所有来自输入序列的 用户文件 连接成一个字符串,并作为X轴上的一条水平黑线显示,下方标注长度(单位为千碱基,kb)。输入序列中所有富含内容的区域标记为蓝色“向上”尖峰,内容贫乏区域标记为红色“向下”尖峰。富含内容和内容贫乏窗口的总数在图例中以括号标出(分别为32和19)。该图用于展示MRI区域的相对丰度及其排列情况。同时,具体细节在输出文件中呈现(见图3)。在此文件中,所有符合富含内容或内容贫乏标准的核苷酸序列片段及其坐标,均按照其在输入文件中的连续位置以列表形式提供给用户。
  8. 在完成所选序列的MRI分析后,用户可通过更改参数和/或输入文件,在同一网页中启动新的分析流程。例如,若要使用相同的MRI参数重新检查先前生成的随机样本#1,用户只需更改 待分析文件选项并选择“用户文件_rand1_4 文件,然后按 分析文件 再次点击按钮,新文件和图形显示将替换旧文件。每次“会话标签”(GMRI 标识符)下的所有检查结果和图像将在最后一次操作后保留两周。为永久保存结果/图像,用户应选择“下载文件选项卡(第一行),根据需要下载整个会话或单个文件。
  9. 通过这种方法 MRI 分析仪 用户可学习的网页
    • (G+C) 丰富区和 (A+T) 丰富区
    • 嘌呤(A+G)富集区和嘧啶(C+T)富集区
    • 富含酮基(G+T)和氨基(A+C)的区域
    • 富含A区段与贫A区段
    • 富含G区域和贫G区域
    • 富含T区域和贫T区域
    • 富含C区域和贫C区域
  10. 最新发布 基因组 MRI 提供了一种研究富含嘌呤(R)/嘧啶(Y)交替模式区域的新选项,这些模式可能形成Z-DNA构象。目前,该选项可通过“链接”获取Z-DNA“其工作原理与其他前述MRI区域相同。用户应为扫描窗口中(RY+YR)重叠二核苷酸的数量设定上下限阈值。程序将生成相似的图形输出,以及富含和贫乏交替嘌呤与嘧啶的DNA片段文件。推测的Z-DNA区域必须高度富集交替的R/Y碱基(参见综述F&F 2011

6. Genomic MRI 软件包中的其他程序(可选)。

基因组 MRI 资源还提供了两种高级选项,用于生成特定的随机序列。这些选项可通过“MRI 发生器“和”CDS 生成器顶部一行的标签。

  1. MRI 生成器可生成与输入文件具有相同寡核苷酸组成的随机序列(类似于SRI 生成器)。此外,生成的随机序列还能模拟用户指定的特定 MRI 模式。在该网页中,用户应从下拉列表中选择一个需要模拟的特定 MRI 模式。该下拉列表包含当前会话中由MRI 分析器检测过的所有模式(例如“userfile_GC_50_35..15”)。使用此选项生成的随机序列将与所选输入文件具有相同的寡核苷酸组成,同时也会具有与“userfile_GC_50_35..15”中相同的 GC 富集区和 GC 贫乏区模式。
  2. CDS 生成器用于蛋白质编码序列的随机化。它保留了由用户指定输入文件所编码的相同氨基酸序列。此外,程序还保留了用户所选输入表格中指定的相同密码子及双密码子偏好性。在线版的CDS 生成器也接受蛋白质序列作为输入。该程序的其他所有功能仅可通过从 Genomic MRI 主网页下载的独立 Perl 脚本提供。

7. 代表性结果

本方案允许用户研究核苷酸序列的组成非均一性。重要的是,它还支持生成多种随机序列,这些随机序列的寡核苷酸组成近似于输入序列。通常,复杂真核生物的基因组序列在组成上并非均一,而是表现为富含特定核苷酸的序列片段所构成的复杂镶嵌结构(例如,富含嘌呤、(G+T) 富集、(A+T) 富集等)。这些中等尺度(30–1000 bp)的模式可通过MRI analyzer的图形输出进行可视化,其中选定的富集片段显示为上方的蓝色尖峰,而贫乏片段则显示为下方的红色尖峰(见图1和图2)。通常情况下,天然序列中任意富集或贫乏区域的数量(图1)远高于具有相同寡核苷酸组成的相应随机序列中的同类区域数量(图2)。这些在核苷酸组成上具有中等尺度非均一性的序列片段可能引起用户关注,可通过Genomic MRI输出文件获取,用于进一步分析。

GC含量分析图;窗口位置与含量百分比;DNA序列检测。
图1. 第5.7步中MRI分析仪图形输出的一个示例。结果基于44个人类内含子样本获得。蓝色条形表示这些内含子中GC富集区域的位置。红色条形表示GC贫乏(或AT富集)的MRI区域。y轴显示了给定含量类型的上下阈值。

GC含量分布、示意图、DNA序列分析、窗口位置、遗传学研究。
图2.MRI analyzer 对随机序列 "userfile.rand1_4" 的输出结果。
使用SRI生成器程序在随机生成的序列中对MRI进行图示化表示。

显示GC含量分析的MRI组成文件;富含主链和互补链的区域,带注释的示意图。
图3.来自MRI analyzer的一个文本输出文件开头示例。
程序检测到的所有富含内容和贫乏内容的序列均显示在最后一列(第四列)中。它们的相对位置以窗口数量来衡量,显示在第一列中。第二列和第三列分别为富含内容区域和贫乏内容区域的标识符。

讨论

在中等尺度(30–1000 个核苷酸)上核苷酸组成不均的区域在复杂真核生物基因组中广泛存在,可出现在任何位置(基因间区、内含子、外显子的非翻译区、重复元件等)。这些区域常与异常的DNA构象相关。例如,富含嘌呤/嘧啶的序列倾向于形成DNA三链结构(H-DNA);嘌呤/嘧啶交替排列的序列与Z-DNA构象相关;(G+C) 富集区在B-DNA中表现出结构异常,并可能易于发生骨架断裂;(A+T) 富集区可能形成一种特殊结构——DNA解旋元件;等等(Fedorov 与 Fedorova,2010 年综述)。其中一些中等尺度的模式(如 (G+T) 富集区)研究甚少,仍有待深入探索和确认。我们 Genomic MRI 网络资源的主要目标是帮助用户识别这些MRI区域,以便进一步开展实验分析并探索其潜在功能。对MRI区域的认识可被整合并用于改进新一代基因预测程序(Shepard,2010),从而推动我们对基因组功能与特性的理解。

致谢

我们感谢 Samuel Shepard、Peter Bazeley 和 John David Bell 对 Genomic MRI 网页的管理。本工作得到了美国国家科学基金会职业奖“内含子细胞功能研究”[资助号 MCB-0643542] 的支持。

材料

本文使用的材料清单
姓名公司目录编号评论
配备互联网的计算机
用于分析的核苷酸序列文件

参考文献

  1. Bechtel, J. M., Wittenschlaeger, T., Dwyer, T., Song, J., Arunachalam, S., Ramakrishnan, S. K., Shepard, S., Fedorov, A. Genomic mid-range inhomogeneity correlates with an abundance of RNA secondary structures. BMC Genomics. 9, 284-284 (2008).
  2. Prakash, A., Shepard, S., Mileyeva-Biebesheimer, O., He, J., Hart, B., Chen, M., Amarachiniha, S., Bechtel, J., Fedorov, A. Molecular forces shaping human genomic sequence at mid-range scales. BMC Genomics. 10, 513-513 (2009).
  3. Fedorov, A., Fedorova, L. Chapter 3: An Intricate Mosaic of Genomic Patterns at Mid-range Scale. Advances in Genomic Sequence Analysis and Pattern Discovery. , 65-91 (2010).
  4. Shepard, S. S. Chapter 4: Binary-abstracted Markov models and their application to sequence classificatio. The characterization and utilization of middle-range sequence patterns within human genome [dissertation]. , The University of Toledo. 57-157 (2010).

重印与许可

标签

SRI SRI MRI GC DNA