本实验方案的目的是结合计算研究与实验研究,寻找那些难以从共纯化序列中分离出来的新型序列,这些序列可能仅有部分被知晓。
方法文章
本实验方案的目的是结合计算研究与实验研究,寻找那些难以从共纯化序列中分离出来的新型序列,这些序列可能仅有部分被知晓。
在需要鉴定嵌入于较大基因组背景中的基因、蛋白质或一般区域序列的任何研究中,均可使用减法基因组学。减法基因组学使研究人员能够通过全面测序并去除已知遗传元件(参考序列,R),从而分离出目标序列(T)。该方法可用于鉴定线粒体、叶绿体、病毒或生殖系限制性染色体等新序列,尤其适用于T难以从R中轻易分离的情况。该方法从完整的基因组数据(R + T)出发,利用基本局部比对搜索工具(BLAST)比对参考序列或多个参考序列,以去除匹配的已知序列(R),从而保留目标序列(T)。为了使减法效果最佳,R应为相对完整的草图,且不包含T。由于减法后剩余的序列需通过定量聚合酶链式反应(qPCR)进行验证,因此R无需完全完整,方法仍可有效运行。本文将计算步骤与实验步骤结合为一个可重复迭代的循环过程,依次去除多个参考序列,并逐步优化对T的搜索。减法基因组学的优势在于,即使在物理纯化困难、不可能或成本高昂的情况下,也能鉴定出完全新颖的目标序列。该方法的局限性在于难以找到合适的减法参考序列,以及获取用于qPCR检测的T阳性与阴性样本。我们在此描述了该方法在鉴定斑胸草雀生殖系限制性染色体上首个基因中的具体应用。在此案例中,计算过滤过程涉及三个参考序列(R),在三个循环中依次去除:一个不完整的基因组组装、原始基因组数据和转录组数据。
该方法的目的是从基因组背景或参考序列(R)中鉴定出新的靶标(T)基因组序列,该序列可以是DNA或RNA(图1)。当靶标序列无法通过物理手段分离,或分离成本较高时,此方法尤为适用。目前仅有少数生物具有可用于消减分析的完整基因组,因此本方法的关键创新之处在于将计算分析与实验操作相结合,形成一个循环流程,使研究人员能够在参考基因组不完整或仅为非模式生物的草图基因组时,仍能有效分离出目标序列。每个循环结束后,通过qPCR检测判断是否需要进一步进行消减。经验证的候选T序列在已知T阳性样本中的qPCR检测信号应具有统计学意义地更强。
该方法已被应用于发现不存在宿主同源物的新型细菌药物靶点1,2,3,4,以及从受感染宿主中鉴定新型病毒5,6。除了可用于鉴定目标序列T外,该方法还可提升参考基因组R的完整性:我们近期利用该方法从斑胸草雀参考基因组中鉴定出936个缺失基因,并发现了一个位于生殖系特异性染色体(T)上的新基因7。当目标序列T与已知序列高度分歧,或其身份尚不明确时(例如斑胸草雀的生殖系限制性染色体7),减法基因组学尤其具有价值。
由于无需事先对T进行阳性鉴定,减法基因组学的一个关键优势在于其无偏性。在最近的一项研究中,Readhead 等人探讨了阿尔茨海默病与四种脑区中病毒丰度之间的关系。在病毒鉴定过程中,Readhead 等人构建了一个包含515种病毒的数据库8,这严重限制了该研究可识别的病毒种类。减法基因组学本可用于比较健康个体与阿尔茨海默病患者的基因组,以分离出可能与该疾病相关的新型病毒,而无需依赖这些病毒与已知病原体的相似性。目前已知有263种可感染人类的病毒,但据估计,尚有约167万种未发现的病毒物种存在,其中63.1万至82.7万种可能具有感染人类的潜力9。
新病毒的分离是减法基因组学特别有效的研究领域,但某些研究可能无需如此严格的方法。例如,一些鉴定新病毒的研究采用了无偏倚的高通量测序,随后进行逆转录及BLASTx分析病毒序列5 或富集病毒核酸以提取并反转录病毒序列6. 尽管这些研究采用了 从头合成 测序与组装过程中未使用减法法,因为目标序列已通过BLAST得到明确鉴定。若病毒为完全新型且与其他病毒无关联或亲缘关系极远,则减法基因组学将是一种有效的技术。减法基因组学的优势在于能够获得全新的序列。若宿主生物的基因组已知,可将其序列扣除,从而保留所有病毒序列。例如,在我们已发表的研究中,尽管并非最初目的,但仍通过减法基因组学从斑胸草雀中分离出一条 novel 病毒序列7.
减法基因组学在细菌疫苗靶点的鉴定中也显示出重要价值,其研究动力源于抗生素耐药性的显著上升1,2,3,4。为了最大限度降低自身免疫反应的风险,研究人员通过剔除在人类宿主中具有同源蛋白的候选分子,缩小潜在疫苗靶点的范围。一项针对Corynebacterium pseudotuberculosis的研究,通过将多种细菌基因组与脊椎动物宿主基因组进行比对并剔除共有序列,确保可能的药物靶点不会影响宿主蛋白,从而避免不良反应1。此类研究的基本工作流程包括:下载细菌的蛋白质组数据,确定关键蛋白,去除冗余蛋白,利用BLASTp筛选必需蛋白,并通过与宿主蛋白质组进行BLASTp比对,剔除任何在宿主中存在同源物的蛋白1,2,3,4。在此背景下,减法基因组学可确保所开发的疫苗在宿主体内不会产生脱靶效应1,2,3,4。
我们利用减法基因组学鉴定了生殖系限制性染色体(GRC)(本例中为T染色体)上的首个蛋白质编码基因,该染色体存在于两性的生殖系中,但不存在于体细胞组织中10。在本研究之前,关于GRC的唯一已知基因组信息是一个重复区域11。我们对成年斑胸草雀卵巢和睾丸组织(R+T)的RNA进行了从头组装(de novo assembly)。通过比对已发表的体细胞(肌肉)基因组序列(R1)12、其原始(Sanger)测序读段数据(R2)以及体细胞(脑组织)转录组(R3)13,计算剔除了共有序列。三个参考数据集的依次使用是基于每个循环第5步qPCR检测结果(图2A)所提示的,表明需要进一步过滤。所发现的α-SNAP基因通过DNA和RNA的qPCR、克隆及测序得到了验证。我们的示例表明,该方法具有灵活性:不依赖于核酸类型(DNA与RNA)的匹配,且减法过程可使用由组装序列或原始读段构成的参考数据集(R)。
访问受限。请登录或开始试用以查看此内容。
1. 从头 组装起始序列
注意:任何下一代测序(NGS)数据均可使用,只要能够基于这些数据生成组装结果即可。合适的输入数据包括已组装成 fasta 文件的 Illumina、PacBio 或 Oxford Nanopore 测序读段。为具体说明,本节描述的是我们针对斑胸草雀研究所完成的基于 Illumina 的转录组组装7;但需注意,不同项目的具体细节会有所差异。在本示例项目中,原始数据来自 MiSeq 平台,每个样本大约获得 1000 万条成对读段。
2. 将组装序列与参考序列进行BLAST比对
注意:当参考序列是组装序列或长读长序列(如 Sanger 测序结果)时,使用此步骤;如果参考序列由原始 Illumina 测序读段组成,请参见下方步骤 3,以将读段比对至查询序列。所有 BLAST 步骤均使用版本 2.2.29+ 完成,但这些命令应在任何较新的 BLAST 版本上均可正常运行。
3. 将测序读段比对到基因组组装结果
注意:如果参考数据集由原始基因组测序读段组成,而非组装后的序列或桑格测序序列,则可使用本方法;在此情况下,请使用 BLAST(步骤 2.1)。
4. 使用 Python 脚本去除任何匹配序列
注意:提供的脚本适用于 Python 2.7。
5. 为剩余序列设计引物
注意:此时已获得一个包含候选 T 序列的 fasta 文件。本部分描述通过 qPCR 实验验证这些序列是来源于 T,还是来源于此前未知的 R 区域。如果在步骤 4 的扣除过程中移除了所有序列,则可能是因为初始组装未能包含 T,或者扣除条件可能过于严格。
6. qPCR 验证剩余序列
注意:此步骤需要使用在步骤5中已验证的引物和建立的PCR条件。
7. 使用新的参考样本进一步筛选数据。
注意:如果第6步已验证了从T中鉴定出的序列,则在此结束循环(图2A)。然而,多种因素可能促使继续该循环,例如当文件中仍存在大量R序列,或在第6步中未通过qPCR验证任何候选T序列时。
访问受限。请登录或开始试用以查看此内容。
运行BLAST后,输出文件将包含查询序列中与数据库匹配的序列列表。经过Python减法分析后,将获得一批不匹配的序列,并通过qPCR进行验证。相关结果及后续步骤如下所述。
阴性结果。在将序列比对到参考序列后,可能出现两种阴性结果。一种情况是没有比对结果,意味着该总序列与参考序列之间没有任何相似序列。这可能是由于为测序样本选择了错误的参考序列所致。另一种可能是起始组装中不存在独特序列(所有序列均被扣除),因此无法找到目标序列对应的基因。请核查参考序列的来源,并确保其并非来自与查询组装相同的组织。
经过计算过滤后,qPCR 可能产生阴性结果,示例见图 3A、3B、C,其中在不同鸟类组织间的检测结果无差异。图 A...
访问受限。请登录或开始试用以查看此内容。
尽管减法基因组学功能强大,但它并非一种千篇一律的方法,需要在多个关键步骤中进行定制化处理,并仔细选择参考序列和测试样本。如果查询组装的质量较差,过滤步骤可能仅能分离出组装过程中的假象。因此,使用适合特定项目的验证方案对从头(de novo)组装结果进行充分验证至关重要。对于RNA-seq数据,Trinity网站提供了相关指南18;而对于DNA数据,则可使用如REAPR23之类的工具。使用BLAST时另一个关键步骤是选择合适的e值,这将决定减法过程是宽松还是严格。然而,该方法中存在一个反向逻辑:与参考序列的匹配越严格,实际上意味着减法越不严格,因为未匹配的序列不会被去除。因此,为了实现更严格的减法,应在BLAST中使用更大的(即更宽松的)e值。本方案最后的关键步骤是参考序列的选择。为了达到最高效率,参考序列应尽可能完整;但其并不需要完美,因为qPCR检测可以确认剩余序列来源于T还是R,并判断是否需要进一步过滤。在实施该方案过程中,可引入新的参考序列以进一步缩小待验证基因的范围。我们注意到,有时匹配方法可能会发生变化:在最后一次...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
作者感谢 Michelle Biederman、Alyssa Pedersen 和 Colin J. Saldanha 在斑胸草雀基因组项目不同阶段提供的帮助。我们还感谢 Evgeny Bisk 在计算集群系统管理方面的支持,以及美国国立卫生研究院(NIH)提供的资助 1K22CA184297(资助对象:J.R.B.)和 NIH NS 042767(资助对象:C.J.S.)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Accustart II Taq DNA 聚合酶 | Quanta Bio | 95141 | |
| BLAST(局部序列比对搜索工具) | https://github.com/trinityrnaseq/trinityrnaseq/wiki/Transcriptome-Assembly-Quality-Assessment | ||
| Bowtie 2 | https://www.python.org/download/releases/2.7/ | ||
| BWA-MEM v. 0.7.12 | https://github.com/BenLangmead/bowtie2 | ||
| Geneious | https://blast.ncbi.nlm.nih.gov/Blast.cgi | ||
| PEAR v. 0.9.6 | http://www.mybiosoftware.com/reptile-1-1-short-read-error-correction.html | ||
| 个人计算机 | Biomatters | http://www.geneious.com/ | |
| PowerSYBR qPCR 混合液 | ThermoFisher | 4367659 | |
| Python v. 2.7 | https://sco.h-its.org/exelixis/web/software/pear/ | ||
| Reptile v.1.1 | https://alurulab.cc.gatech.edu/reptile | ||
| Stratagene Mx3005P | Agilent Technologies | 401456 | |
| TransDecoder v. 3.0.1 | https://sourceforge.net/projects/bio-bwa/files/ | ||
| Trinity v. 2.4.0 | https://github.com/TransDecoder/TransDecoder/wiki |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可