2011年5月9日
我们目前的基因组序列的分析计算公共网站。它可以检测出各种非随机核苷酸组成的DNA序列模式。这种资源也产生不同层次的复杂的随机序列。
该程序的总体目标是探索中等范围、非随机性,也称为用户指定基因组序列的同质性。这是通过首先检查输入序列的寡核苷酸组成并生成包含该序列的寡核苷酸的频率表来实现的。此目标是通过调用 SRI Analyzer 程序来实现的。
第二步是生成与输入序列具有完全相同寡核苷酸组成的随机序列。这是通过调用 SRI 生成器程序来实现的。该程序的第三步是在输入序列和随机序列中查找被特定核苷酸或核苷酸组合(例如 GC 或 ag)显著富集的片段。
这个目标是通过 MRI Analyzer 程序实现的。该过程的最后一步是下载包含程序检测到的所有 MRI 区域序列的文件。最终,可以获得的结果表明,多细胞咏叹调的大多数基因组区域被包含针对四个核苷酸中的每一个核苷酸或其任何组合检测到的碱基组成极端值的片段显着富集。
这些在均质区域与不寻常的 DNA 确认和/或特定的 DNA 特性有关。这种方法可以帮助回答基因组学领域的关键问题,例如在非编码序列的大片区域(包括基因间区域或入口)中寻找潜在的功能性 DNA 元件。虽然这种方法可以提供对哺乳动物基因组的见解,但它也可以应用于其他生物,如无脊椎动物、植物、真菌和细菌。
在 www.bioinfo.utoledo 打开在线基因组同质性中程或 G GM I 包的主页。edu/gri/网络资源。此外,还在帮助作方法自述文件链接中提供了有关程序的详细信息。
虽然所有关于基因组 MRI 和类似算法的已发表材料都列在相关资源链接的链接中,但创建一个具有更快格式化序列的文件以启动 A-G-M-R-I 分析会话。更快的格式化序列以 carrot 或大于符号开头,后跟唯一标识符或名称以及以下行中的序列。基因组 MRI 将仅处理 TG 和 C 核苷酸,但允许使用其他字符输入。
使用 PKD one 基因的序列文件。要演示会话,请按 start (开始) 按钮。这将打开一个新网页,该网页提供了在提供的窗口中复制和粘贴输入序列的选项,或者如果文件很大。
要上传它,请单击 选择文件 按钮上传文件。浏览到所需的文件。然后单击 Start this session with this file 按钮确认文件已成功上传显示在页面顶部。下面。
此消息是当前会话的标识符,在本例中为 C eight EP oh six。要分析输入序列的短程同质性,请单击 analyze short range in homogeneity 按钮。该程序将打开一个新页面,该页面专为执行 SRI Analyzer 程序而设计。
在这里,我们需要选择要检查的寡核苷酸的最大长度。由于我们的中等大小的输入序列大约有 50, 000 个核苷酸,因此我们选择前核苷酸作为寡核苷酸的最高长度,将计算其频率。最后,我们需要立即按下 analyze file 按钮。
该程序计算输入序列中所选长度和较小长度的所有寡核苷酸的频率。要查看所有寡核苷酸的频率,请单击链接下载组成文件。此文件名为 user file。
com 表示具有三列的表。第一列指定寡核苷酸。第二个表示它们的相对频率,第三个表示输入序列中出现的寡核苷酸数量。
要生成与输入文件具有相同寡核苷酸组成的随机序列,请单击 SRI 生成器选项卡。在新页面上,选择要生成的随机序列的样本数。这些样本中的每一个都将包含与用户文件中的输入序列数量和长度相同的随机序列。
在此示例中,用户文件是 PKD one 基因的序列。接下来,通过选择 formers 的单选按钮来选择寡核苷酸的最长长度,其频率将在随机序列中近似,它代表四个碱基寡核苷酸。接下来,为要生成的随机序列的样本数量选择 2。
最后,通过单击数十万个核苷酸的输入序列的生成文件按钮启动程序。生成随机序列可能需要几分钟时间。因此,请等待此页面底部出现蓝色下载链接。
要分析输入和随机序列的同质性中的中等范围,请单击 MRI 分析器选项卡。在新页面上,从 file to analyze 列表框中选择要分析的序列。然后从七种内容类型的列表中选择 GC 内容。
GC 含量代表 G 加 C 成分。的 window size 字段允许选择窗口的长度,以便检查内容丰富和不良序列。保持默认窗口大小 50 个核苷酸。
最后,分别选择内容丰富和内容贫乏区域的上限和下限阈值。这些阈值可以通过当前窗口中特定核苷酸的数量或窗口中这些核苷酸的百分比来定义。在这种情况下,让我们最初选择随机值 60% 作为阈值上限,选择 30% 作为阈值下限。
接下来,按下 analyze file 按钮 在此之后,将出现指向输出文件的链接,并显示结果的图形表示。输入序列中所有内容丰富的区域都标记为蓝色的向上峰值,内容贫乏的区域标记为红色向下的峰值。该图显示,显示 GC 富区域(富含 GC 的区域)的蓝色峰值太多,而显示 GC 差区域的红色峰值要少得多。
这意味着所选参数不是最佳参数。对于下一次迭代,请使用 75%upper 阈值和 32%lower 阈值。再次,通过单击"分析文件"按钮启动 MRI 分析器。
新图表显示,即使对于新的更严格的参数,也有数百个蓝色尖峰。因此,将阈值上限提高到 80% 并重复计算。新图显示,62 个富含 GC 的区域的 GC 含量大于或等于 80%,28 个 GC 贫区域 GC 含量低于 32%接下来,将输入文件的结果与与 PKD 基因具有相同寡核苷酸组成的两个随机序列进行比较。
为此,请使用文件分析列表框将序列从 PKD 一个基因更改为随机基因,同时保持相同的参数用于 GC 丰富和 GC 差区域。随机序列 1 新生成的图形显示表明,该随机序列只有一个 GC 贫区和 31 个 GC 富区。另一个随机序列可能会在内容丰富和内容贫乏区域的数量上呈现一些波动,但趋势应该是相同的。
PKD 一个基因的随机序列少了几倍。富含 GC 的区域比 GC 贫的区域少 10 倍以上。下一个演示使用另一种类型的 MRI 内容。
在同一个 pkg 中,该基因的一个人类基因内含子包含几个与 DN aex 结构相关的富含嘌呤的区域。在 MRI 分析仪网页中,将 DNA 内容切换到代表嘌呤的 ag 核苷酸。保持窗口大小等于 50 个基数,将阈值上限更改为 80%,将阈值下限更改为 10%,然后按 analyze file 按钮调用程序。
显示的图表显示,该基因有 6 个 ag 丰富的区域(由蓝色垂直尖峰表示)和 14 个 ag 贫区(由红色尖峰表示)。然后将 PKD 一个基因获得的这些结果与与研究基因具有相同寡核苷酸组成的随机序列的数据进行比较,首先切换到随机序列,例如数字 2,并保持与上一个测试相同的参数。这个随机序列的图表显示,它只包含一个富含 AG 的区域,不包含 AG 贫乏的区域。
会话期间生成的所有数据都保存在特殊文件中,可通过每个网页右上角的 download files 选项卡访问这些文件。打开此链接后,下载输入序列以及所有生成的随机序列。在此文件列表下方,有一个指向 SRI 分析仪程序生成的寡核苷酸频率表的链接。
然后是指向 MRI 分析仪程序在会话期间生成的所有结果的链接。例如,单击文件 user a 文件 RAND one four AGCO 50 32 14,表示为随机序列获得的结果。第一名参数如下,ag 含量 50 个核苷酸长窗口,阈值上限为 32 个核苷酸,下限阈值为 14 个核苷酸。
在此文件中,所有符合内容丰富或较差标准的核苷酸序列片段及其坐标都根据它们在输入序列中的连续位置以列表形式提供。观看此视频后,您应该对如何浏览基因组 MRI(计算资源)有很好的了解。
本文介绍了一个用于分析基因组序列的计算网络资源,专注于检测非随机核苷酸组成。该工具生成具有相似寡核苷酸组成的随机序列,有助于探索基因组的不均匀性。
Genomic MRI provides a computational approach to detect non-random nucleotide patterns in non-coding DNA, supporting target validation by identifying regulatory elements with potential functional significance. This enables mechanistic de-risking in early discovery by linking sequence inhomogeneity to biological processes such as gene expression and recombination. The resource enhances predictive confidence in lead identification by prioritizing genomic regions with extreme base composition for downstream assay development.
The method integrates into the discovery continuum from target validation through lead identification to preclinical work by providing quantitative outputs on sequence enrichment that inform biological de-risking decisions.