我们提供一个用于基因组序列分析的公共计算网站。该网站能够检测具有不同非随机核苷酸组成的DNA序列模式。此资源还可生成具有多种复杂程度的随机化序列。
我们提供一个用于基因组序列分析的公共计算网站。该网站能够检测具有不同非随机核苷酸组成的DNA序列模式。此资源还可生成具有多种复杂程度的随机化序列。
在复杂的真核生物中,非编码基因组区域(包括基因间区、内含子以及外显子的非翻译区段)的核苷酸组成具有高度非随机性,呈现出复杂的序列模式镶嵌结构。这些模式包括所谓的中程不均一性(Mid-Range Inhomogeneity, MRI)区域——长度为30至10000个核苷酸、富含特定碱基或碱基组合的序列(例如富含(G+T)、富含嘌呤等)。MRI区域与非B型DNA等异常DNA结构相关,这些结构常参与基因表达调控、重组及其他遗传过程(Fedorova & Fedorov 2010)。此外,MRI区域内部存在强烈的突变固定偏倚,即倾向于淘汰会降低其序列不均一性的突变,这一现象进一步支持了这些基因组序列的功能性和重要性(Prakash et al. 2009)。
本文介绍了一种可免费获取的互联网资源——Genomic MRI 程序包,该程序包专为基因组序列的计算分析而设计,旨在发现并表征其中存在的多种 MRI 模式(Bechtel et al. 2008)。该程序包还能够生成具有不同特性和与天然输入 DNA 序列不同程度相似性的随机序列。该资源的主要目标是促进对大片段非编码 DNA 区域的分析,这些区域目前仍鲜有研究,亟待深入探索与认知。
本文中使用的所有程序均采用 perl 编写,所有网页均采用 PHP 创建。
1. 起始点:
打开在线基因组 MRI 软件包的主页,网址为 http://mco321125.meduohio.edu/~jbechtel/gmri/。该网络资源在“帮助(使用方法/README)”链接中提供了关于程序的说明和解释,而所有关于Genomic MRI及类似算法的已发表资料则列在“相关资源链接”中。
2. 输入序列的准备与上传。
创建一个包含FASTA格式序列的文件以启动GMRI分析会话。该格式中的每条核苷酸序列都应以一个以“>”字符开头的单行作为前导,该行用于表示序列的标识符,并在同一行中后接对该序列的简短描述。用于GMRI分析的核苷酸序列也可包含R、Y、N、X等字符。然而,程序不会处理非A、T、C、G的字符,这些字符将被跳过。已对重复元件进行“屏蔽”(即用“N”替代)的序列也可作为输入使用。请注意,序列字符不区分大小写。
注意:此后输入的序列将称为“userfile”。
3. 获取输入序列的寡核苷酸频率分布(可选)。
点击顶部行的“SRI Analyzer”标签,以获取输入序列集合中所有寡核苷酸频率的分布情况。缩写 SRI 代表短程非均一性(short-range inhomogeneity)。此时,用户可指定用于计算频率的寡核苷酸最大长度(从 2 到 9 个核苷酸,默认为 6 nt)。通过点击“Maximum oligomer size”下拉列表中的相应选项完成选择。然后按下“Analyze File”按钮以启动计算。输入序列组成的粗略表示将立即以表格形式显示在网页中部,并可下载为“userfile.comp.tbl”。该表格仅显示输入序列中最丰富和最稀有的寡核苷酸。
所有可能的寡核苷酸的完整频率表将生成为一个名为“userfile.comp”的文件,可通过“下载组成文件”链接获取。
注意:SRI 分析仪对所有重叠的寡核苷酸序列进行整体计数。
4. 生成与输入序列具有相同寡核苷酸组成的随机序列(可选)。
(执行本任务需完成方案第3步)。
5. 输入序列与随机序列的中程不均匀性(MRI)分析。
6. Genomic MRI 软件包中的其他程序(可选)。
的 基因组 MRI 资源还提供了两种高级选项,用于生成特定的随机序列。这些选项可通过“MRI 发生器“和”CDS 生成器顶部一行的标签。
7. 代表性结果
本方案允许用户研究核苷酸序列的组成非均一性。重要的是,它还支持生成多种随机序列,这些随机序列的寡核苷酸组成近似于输入序列。通常,复杂真核生物的基因组序列在组成上并非均一,而是表现为富含特定核苷酸的序列片段所构成的复杂镶嵌结构(例如,富含嘌呤、(G+T) 富集、(A+T) 富集等)。这些中等尺度(30–1000 bp)的模式可通过MRI analyzer的图形输出进行可视化,其中选定的富集片段显示为上方的蓝色尖峰,而贫乏片段则显示为下方的红色尖峰(见图1和图2)。通常情况下,天然序列中任意富集或贫乏区域的数量(图1)远高于具有相同寡核苷酸组成的相应随机序列中的同类区域数量(图2)。这些在核苷酸组成上具有中等尺度非均一性的序列片段可能引起用户关注,可通过Genomic MRI输出文件获取,用于进一步分析。

图1. 第5.7步中MRI分析仪图形输出的一个示例。结果基于44个人类内含子样本获得。蓝色条形表示这些内含子中GC富集区域的位置。红色条形表示GC贫乏(或AT富集)的MRI区域。y轴显示了给定含量类型的上下阈值。

图2.MRI analyzer 对随机序列 "userfile.rand1_4" 的输出结果。
使用SRI生成器程序在随机生成的序列中对MRI进行图示化表示。

图3.来自MRI analyzer的一个文本输出文件开头示例。
程序检测到的所有富含内容和贫乏内容的序列均显示在最后一列(第四列)中。它们的相对位置以窗口数量来衡量,显示在第一列中。第二列和第三列分别为富含内容区域和贫乏内容区域的标识符。
在中等尺度(30–1000 个核苷酸)上核苷酸组成不均的区域在复杂真核生物基因组中广泛存在,可出现在任何位置(基因间区、内含子、外显子的非翻译区、重复元件等)。这些区域常与异常的DNA构象相关。例如,富含嘌呤/嘧啶的序列倾向于形成DNA三链结构(H-DNA);嘌呤/嘧啶交替排列的序列与Z-DNA构象相关;(G+C) 富集区在B-DNA中表现出结构异常,并可能易于发生骨架断裂;(A+T) 富集区可能形成一种特殊结构——DNA解旋元件;等等(Fedorov 与 Fedorova,2010 年综述)。其中一些中等尺度的模式(如 (G+T) 富集区)研究甚少,仍有待深入探索和确认。我们 Genomic MRI 网络资源的主要目标是帮助用户识别这些MRI区域,以便进一步开展实验分析并探索其潜在功能。对MRI区域的认识可被整合并用于改进新一代基因预测程序(Shepard,2010),从而推动我们对基因组功能与特性的理解。
我们感谢 Samuel Shepard、Peter Bazeley 和 John David Bell 对 Genomic MRI 网页的管理。本工作得到了美国国家科学基金会职业奖“内含子细胞功能研究”[资助号 MCB-0643542] 的支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 配备互联网的计算机 | |||
| 用于分析的核苷酸序列文件 |