对经酵母双杂交阳性相互作用筛选的酵母群体进行深度测序,可能获得大量关于相互作用配体蛋白的信息。本文介绍了特定生物信息学工具及定制更新软件的操作方法,用于分析此类筛选所产生的序列数据。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
对经酵母双杂交阳性相互作用筛选的酵母群体进行深度测序,可能获得大量关于相互作用配体蛋白的信息。本文介绍了特定生物信息学工具及定制更新软件的操作方法,用于分析此类筛选所产生的序列数据。
我们已将酵母双杂交实验改造为利用高通量短读长DNA测序,在单次筛选中同时发现数十种瞬时和稳定的蛋白质相互作用。所获得的序列数据不仅能够追踪在阳性酵母双杂交相互作用筛选过程中富集的基因群体,还能提供足以介导相互作用的蛋白质相关亚结构域的详细信息。本文介绍了一整套独立的软件程序,使非生物信息学专业人员也能完成批处理酵母双杂交实验中DNA序列fastq文件的所有生物信息学和统计分析步骤。这些软件涵盖的处理步骤包括:1)比对并计数对应于酵母双杂交猎物文库中每个候选蛋白质的序列读段;2)评估富集谱型的统计分析程序;以及3)用于分析编码目标相互作用蛋白的富集质粒在编码区内的翻译阅读框及其位置的工具。
发现蛋白质相互作用的一种方法是酵母双杂交(Y2H)实验,该方法利用经过基因工程改造的酵母细胞,这些细胞仅在目标蛋白质与相互作用伴侣蛋白的片段发生结合时才能生长。1现在可以通过大规模并行高通量测序技术来检测多个酵母双杂交相互作用。已有多种实验体系被报道。2,3,4,5 包括我们开发的一种方法,其中在选择性条件下进行分批培养,以筛选含有能够产生阳性酵母双杂交相互作用质粒的酵母群体6我们开发的工作流程称为DEEPN(用于蛋白质网络评估的动态富集),该方法利用相同的猎物文库来鉴定差异相互作用组,从而识别与某一特定蛋白质(或结构域)相互作用的蛋白质 与另一种蛋白质或构象不同的突变结构域。该工作流程中的关键步骤之一是对DNA测序数据进行恰当的处理与分析。通过在酵母双杂交(Y2H)相互作用筛选前后分别统计每个基因的测序读段数,可以获取部分信息,其方式类似于RNA-seq实验。然而,从这些数据集中还可提取更为深入的信息,包括特定蛋白质中能够产生Y2H相互作用的功能亚结构域信息。此外,尽管DEEPN方法具有重要价值,但分析大量样本重复既繁琐又昂贵。通过采用专为DEEPN数据集开发的统计模型,可在重复次数有限的情况下有效缓解这一问题6为了使DNA测序数据集的处理与分析对不具备生物信息学专业知识的研究人员而言更加可靠、完整、稳健且易于操作,我们开发了一套涵盖全部分析步骤的软件程序。
这一套可在台式计算机上独立运行的软件程序包括 MAPster、DEEPN 和 Stat_Maker。MAPster 是一个图形用户界面,可将每个待比对的 fastq 文件通过 HISAT2 程序7比对至基因组,生成标准的 .sam 文件,供后续分析使用。DEEPN 包含多个模块:其“Gene Count”模块可对特定基因对应的测序读段进行分配与计数,类似于 RNA-seq 类型的定量分析;“Junction_Make”模块可提取 Gal4 转录结构域与猎物序列之间连接区域的序列,并汇总这些连接位点的位置信息,以便通过比较表格和图形进行检查;“Blast_Query”模块则便于对 Gal4 连接序列进行便捷的查看、定量与比较。Stat_Maker 可对每个基因的读段富集数据进行统计学评估,从而帮助优先筛选出可能的酵母双杂交(Y2H)阳性结果。本文将介绍如何使用这些软件程序,以完成对 DEEPN 酵母双杂交实验所得 DNA 测序数据的完整分析。DEEPN 提供适用于 PC、Mac 和 Linux 系统的版本。其他程序如比对工具 MAPster 及 DEEPN 的统计模块 Stat_Maker 依赖于 Unix 环境下的子程序,因此仅可在 Mac 和 Linux 系统上运行。
访问受限。请登录或开始试用以查看此内容。
1. 映射 Fastq 文件
注意:DEEPN 软件以及许多生物信息学程序使用 DNA 序列数据,其中每条序列读段均已映射至参考 DNA 中的位置。可用于此目的的映射程序有多种,包括此处使用的基于 HISTAT2 程序的 MAPster 界面,该界面可生成后续步骤中使用的 .sam 文件。
2. 使用 DEEPN 软件进行生物信息学处理
注意:DEEPN 软件目前针对包含小鼠 cDNA 序列、人类 cDNA 序列或 S. cerevisiae 基因组 DNA 序列的猎物文库进行了编译。DEEPN 支持标准的 .sam 文件格式,可接受包含已比对和未比对读段的 SAM(.sam)文件,也可接受分别包含未比对和已比对读段的独立文件。
3. 通过 DEEPN 鉴定候选基因的验证
注意:DEEPN 和 Stat_Maker 的目的是鉴定能够产生阳性酵母双杂交(Y2H)相互作用的候选基因。验证此类 Y2H 相互作用可通过传统的二元 Y2H 方法进行,即将目标诱饵质粒与空的 Gal4 激活结构域“猎物”质粒配对,同时与携带目标基因/cDNA 片段的猎物质粒配对。由于在经过 Y2H 筛选的酵母群体所提取的混合 DNA 中无法直接分离出目标质粒,因此难以通过实验手段直接获取。然而,可以通过计算方法重建产生 Y2H 相互作用的基因/cDNA 片段序列,设计针对该片段 5' 和 3' 末端的引物,并从酵母群体提取的 DNA 中扩增该片段。本节描述如何确定候选猎物片段的 5' 和 3' 末端。
访问受限。请登录或开始试用以查看此内容。
fastq 数据比对:第一步
在包括 DEEPN 在内的几乎所有高通量测序(NGS)应用中,初始输出均为一组短序列读段文件,必须通过比对将其定位到基因组、转录组或其他参考 DNA8。近年来开发的 HISAT2 比对程序采用了先进的索引算法,显著提高了比对速度7,9。HISAT2 可在台式计算机上高效运行,通常可在数分钟内完成一个典型规模读段文件的比对。这使得我们能够将 HISAT2 集成到一个名为 MAPster 的图形用户界面中,实现 fastq 文件的本地比对,使用户无需依赖通常需通过命令行操作的远程高性能计算集群(图 1)。MAPster 的重要功能包括为 RNA-seq 和全基因组比对实验预设参数、支持多个任务排队,以及为高级用户和定制化应用提供对全套可调 HISAT2 参数的访问。为展示 MAPst...
访问受限。请登录或开始试用以查看此内容。
本文介绍的软件套件可用于对 DEEPN 实验产生的高通量 DNA 测序数据进行完整的处理与分析。首先使用的程序是 MAPster,该程序读取标准 fastq 文件中的 DNA 序列读段,并将其定位映射到参考 DNA 上,以便后续由多种生物信息学程序(包括 DEEPN 软件)进行分析。MAPster 界面具有实用的功能,例如可批量排队多个任务、合并输入文件、便捷命名输出文件,再结合其底层控制的 HISAT2 程序7的高速性能,使其成为适用于 DEEPN 以外多种应用场景的易用型映射工具。MAPster 可访问 HISAT2 程序中的多个参数,适用于除 DEEPN 之外的其他类型数据分析。其中部分功能包括为 RNA-seq 和全基因组映射实验预设的参数,以及为高级用户和定制化应用提供的全套易于调节的 HISAT2 参数选项。例如,RNA-seq 按钮会添加有助于转录本组装的格式设置;CRISPR 按钮则会阻止与参考 DNA 的反向互补链比对,这适用于由向导 RNA 序列构建的参考 DNA 文件。可选参数分布在四个标签页下,分别为"输入、比对、打分和输出"。“输入”选项包括更改输...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露
本工作由美国国立卫生研究院(NIH R21 EB021870-01A1)和美国国家科学基金会研究项目基金(1517110)资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Mapster | https://github.com/emptyewer/MAPster/releases | ||
| DEEPN 软件 | https://github.com/emptyewer/DEEPN/releases | ||
| Statmaker | https://github.com/emptyewer/DEEPN/releases | ||
| 最低计算机系统要求 | Apple | Mac Intel Core i5 或更高配置 | |
| - | 4 Gb RAM 或更高 | ||
| - | 500 Gb 磁盘空间或更大 | ||
| - | OS 10.10 或更高版本 | ||
| Dell | Intel i5-7400 或更高配置 | ||
| - | 4 Gb RAM 或更高 | ||
| - | 500 Gb 磁盘空间或更大 | ||
| - | Windows 7 或更高版本 |
访问受限。请登录或开始试用以查看此内容。