需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

批量酵母双杂交筛选序列数据的生物信息学分析

6.9K 次观看

⸱

DOI:

10.3791/57802

⸱

2018年6月28日

本文内容

摘要

对经酵母双杂交阳性相互作用筛选的酵母群体进行深度测序,可能获得大量关于相互作用配体蛋白的信息。本文介绍了特定生物信息学工具及定制更新软件的操作方法,用于分析此类筛选所产生的序列数据。

摘要

我们已将酵母双杂交实验改造为利用高通量短读长DNA测序,在单次筛选中同时发现数十种瞬时和稳定的蛋白质相互作用。所获得的序列数据不仅能够追踪在阳性酵母双杂交相互作用筛选过程中富集的基因群体,还能提供足以介导相互作用的蛋白质相关亚结构域的详细信息。本文介绍了一整套独立的软件程序,使非生物信息学专业人员也能完成批处理酵母双杂交实验中DNA序列fastq文件的所有生物信息学和统计分析步骤。这些软件涵盖的处理步骤包括:1)比对并计数对应于酵母双杂交猎物文库中每个候选蛋白质的序列读段;2)评估富集谱型的统计分析程序;以及3)用于分析编码目标相互作用蛋白的富集质粒在编码区内的翻译阅读框及其位置的工具。

引言

发现蛋白质相互作用的一种方法是酵母双杂交(Y2H)实验,该方法利用经过基因工程改造的酵母细胞,这些细胞仅在目标蛋白质与相互作用伴侣蛋白的片段发生结合时才能生长。1现在可以通过大规模并行高通量测序技术来检测多个酵母双杂交相互作用。已有多种实验体系被报道。2,3,4,5 包括我们开发的一种方法,其中在选择性条件下进行分批培养,以筛选含有能够产生阳性酵母双杂交相互作用质粒的酵母群体6我们开发的工作流程称为DEEPN(用于蛋白质网络评估的动态富集),该方法利用相同的猎物文库来鉴定差异相互作用组,从而识别与某一特定蛋白质(或结构域)相互作用的蛋白质 与另一种蛋白质或构象不同的突变结构域。该工作流程中的关键步骤之一是对DNA测序数据进行恰当的处理与分析。通过在酵母双杂交(Y2H)相互作用筛选前后分别统计每个基因的测序读段数,可以获取部分信息,其方式类似于RNA-seq实验。然而,从这些数据集中还可提取更为深入的信息,包括特定蛋白质中能够产生Y2H相互作用的功能亚结构域信息。此外,尽管DEEPN方法具有重要价值,但分析大量样本重复既繁琐又昂贵。通过采用专为DEEPN数据集开发的统计模型,可在重复次数有限的情况下有效缓解这一问题6为了使DNA测序数据集的处理与分析对不具备生物信息学专业知识的研究人员而言更加可靠、完整、稳健且易于操作,我们开发了一套涵盖全部分析步骤的软件程序。

这一套可在台式计算机上独立运行的软件程序包括 MAPster、DEEPN 和 Stat_Maker。MAPster 是一个图形用户界面,可将每个待比对的 fastq 文件通过 HISAT2 程序7比对至基因组,生成标准的 .sam 文件,供后续分析使用。DEEPN 包含多个模块:其“Gene Count”模块可对特定基因对应的测序读段进行分配与计数,类似于 RNA-seq 类型的定量分析;“Junction_Make”模块可提取 Gal4 转录结构域与猎物序列之间连接区域的序列,并汇总这些连接位点的位置信息,以便通过比较表格和图形进行检查;“Blast_Query”模块则便于对 Gal4 连接序列进行便捷的查看、定量与比较。Stat_Maker 可对每个基因的读段富集数据进行统计学评估,从而帮助优先筛选出可能的酵母双杂交(Y2H)阳性结果。本文将介绍如何使用这些软件程序,以完成对 DEEPN 酵母双杂交实验所得 DNA 测序数据的完整分析。DEEPN 提供适用于 PC、Mac 和 Linux 系统的版本。其他程序如比对工具 MAPster 及 DEEPN 的统计模块 Stat_Maker 依赖于 Unix 环境下的子程序,因此仅可在 Mac 和 Linux 系统上运行。

访问受限。请登录或开始试用以查看此内容。

方案

1. 映射 Fastq 文件

注意:DEEPN 软件以及许多生物信息学程序使用 DNA 序列数据,其中每条序列读段均已映射至参考 DNA 中的位置。可用于此目的的映射程序有多种,包括此处使用的基于 HISTAT2 程序的 MAPster 界面,该界面可生成后续步骤中使用的 .sam 文件。

  1. 将测序数据比对至正确版本的基因组。对于来源于小鼠的酵母双杂交文库,使用 UCSC mm10 基因组;对于使用人类基因的文库,使用 UCSC hg38 参考基因组;对于 Saccharomyces cerevisiae 基因,使用 UCSC SacCer3 参考基因组。
  2. 安装 MAPster。
    1. 下载并安装 MAPster 软件。可通过网页浏览器在以下地址获取该软件:https://github.com/emptyewer/MAPster/releases。HISAT2 在基于 Unix 的系统(如 Apple Macintosh)上运行。因此,MAPster 程序仅能在 Apple Macintosh 和 Linux 等兼容系统上运行。
      注意:Apple Mac 系统要求为:OSX 10.10+,>4 Gb 内存,>500 Gb 磁盘空间,以及用于下载参考基因组的网络连接。如果所在机构的企业安全协议限制管理员权限,用户可能需要咨询机构的 IT 人员。
  3. 通过 "主界面"选项卡(图 1)输入所需文件和参数。选择适当的 "成对"按钮,以成对或非成对方式输入文件,默认文件格式为 FASTQ。
    1. 对于 DEEPN 分析,将 "成对"选项设置为 "关闭",以单端读取格式运行。
    2. 只需通过拖放操作,将文件导入 MAPster 的相应窗口即可。
    3. 选择与酵母双杂交文库猎物插入片段来源相对应的参考 DNA/基因组来源。多个模式生物的索引基因组列于 "基因组"框中,可从约翰斯·霍普金斯大学计算生物学中心自动下载。参考基因组将被本地存储以供后续使用。
    4. 在 "线程"框中指定用于比对程序的计算机进程数,因为 HISAT2 支持多线程。MAPster 将自动检测计算机并建议可用的最大处理器数量作为默认值。
    5. 指定输出文件名。该文件名将在整个 DEEPN 分析流程中使用,因此建议使用简短且具有描述性、不含空格或特殊字符的名称。使用 "打开输出目录"按钮指定用于输出比对后文件的文件夹。
    6. 在选择适当的文件和参数后,使用 "添加到队列"按钮将比对任务加入任务队列。主窗口中的文件名可被删除,并替换为对应新样本的文件,随后在提供相应输出文件名后可将其添加至队列。
    7. 在所有任务均加入任务队列后,点击 "运行队列"按钮。
      注意:一旦比对任务被加入队列,选择该任务将在 "任务参数"窗口中显示参数设置,并在 "任务命令"窗口中显示包含所有参数的命令行语句。输出选项包括是否保留未能比对上的读段,以及指定每条读段允许的最大主比对数量。MAPster 的默认输出文件格式为 SAM 格式(例如 '.sam' 文件),其中将包含该样本指定 fastq 文件中的所有序列读段,包括成功比对(已比对)和未成功比对(未比对)至指定基因组的读段。

2. 使用 DEEPN 软件进行生物信息学处理

注意:DEEPN 软件目前针对包含小鼠 cDNA 序列、人类 cDNA 序列或 S. cerevisiae 基因组 DNA 序列的猎物文库进行了编译。DEEPN 支持标准的 .sam 文件格式,可接受包含已比对和未比对读段的 SAM(.sam)文件,也可接受分别包含未比对和已比对读段的独立文件。

  1. 下载 DEEPN 软件并进行安装。可通过网络浏览器在以下地址获取该软件:https://github.com/emptyewer/DEEPN/releases。请选择与计算平台匹配的版本并下载。安装时,打开所下载的安装包。
    注意:DEEPN 提供适用于 PC、Mac 和 Linux 系统的版本。Mac 和 PC 系统应具备 >500 Gb 的硬盘空间和 >4 Gb 的内存。
  2. 启动 DEEPN 软件。在主窗口(图 2)中,从顶部选择框中选择相应的猎物文库信息。点击 "工作文件夹"按钮,导航至目标文件夹/目录以指定处理文件的存储位置。如有需要,可创建新的文件夹/目录。选定 "工作文件夹"后,DEEPN 将自动创建三个子文件夹,分别为 unmapped_sam_files、mapped_sam_files 和 sam_files。
    1. 若使用包含已比对和未比对 reads 的 .sam 文件(例如使用 MAPster 程序默认设置生成的文件),请将其放入 'sam_files' 文件夹中。否则,请根据情况将 .sam 文件分别放入 unmapped_sam_files 和 mapped_sam_files 文件夹中。
  3. 点击 "基因计数+连接点生成"按钮以启动处理流程。
    注意:处理将首先启动“基因计数”模块,该模块利用比对位置信息统计每个基因对应的 reads 数量。随后,“连接点生成”模块将从 reads 中提取连接序列(即直接位于 Gal4-激活域下游的融合序列),并通过 Blast 算法进行识别。此过程将生成如 图 3 所示的完整文件夹结构。处理时间取决于序列数据文件的大小、数量以及所用计算机的处理速度。对于约 2.5 亿条 reads 的实验数据集,典型处理时间为 12–30 小时。“基因计数”和“连接点生成”两个步骤也可分别通过点击 "基因计数"按钮或 "连接点生成"按钮独立运行。
  4. 下载并安装 Stat_Maker(https://github.com/emptyewer/DEEPN/releases)。这是一个专为 DEEPN 数据集设计的统计分析软件包,目前仅支持 Unix 系统的 Mac 平台。
    1. 启动 Stat_Maker,点击 "验证安装"按钮(图 4)。首次运行时,Stat_Maker 将自动从互联网下载并安装 R、JAGS 和 Bioconductor。当检测到 R、JAGS 和 Bioconductor 已安装后,Stat_Maker 将被激活并允许用户进一步输入操作。
    2. 点击 "选择文件夹"按钮,导航至 DEEPN 处理过的主工作文件夹。Stat_Maker 将自动查找并在窗口中列出可用于统计分析的文件。
    3. 将上方文件列表窗口中的相应文件拖放至下方各向量和诱饵数据集以及不同生长条件(非筛选条件 His+ 培养基 和筛选条件 His- 培养基)对应的文件窗口中。重要的是,Stat_Maker 要求为空载体单独设置重复数据集,非筛选群体和筛选群体各需两个样本,以评估实验内部的变异性。
    4. 点击 "运行"按钮。计算时间根据计算机速度不同,通常在 5–15 分钟之间。
  5. 查看 Stat_Maker 的输出结果,这些结果将被保存在主工作文件夹内一个名为 "Stat_Maker Results"的新子文件夹中。
    注意:结果以 CSV(逗号分隔值)文件形式提供,可在常用电子表格程序中打开。Stat_Maker 将对在筛选条件下相对于空载体 pTEF-GBD 更可能被差异富集的基因进行排序(图 5)。此外,还统计了每个数据集中基因插入位于开放阅读框上游、下游或内部的比例,以及该基因是否处于正确的翻译阅读框中。值得注意的是,DEEPN 常常会捕获到诱饵与某些 cDNA 片段之间的强酵母双杂交相互作用,而这些片段可能不在相应蛋白的正确阅读框内,或位于开放阅读框的下游区域。通过综合分析 Stat_Maker 的输出结果,可有效识别并剔除此类无关的假阳性结果。
  6. 如需查看每个潜在候选基因的数据,请打开 DEEPN 软件,选择相应的猎物文库信息,并通过 "工作文件夹"选择正确的处理文件夹。
    1. 点击 "Blast 查询"按钮,将加载一个新窗口(图 6)。在顶部文本框中输入目标基因名称或 GenBank NM 编号以选择感兴趣的候选基因。这些基因名称与 StatMaker 输出文件中列出的名称一致。按下回车键后,系统将开始检索目标基因。
    2. 使用 "选择数据集"菜单选择用于分析的数据集。通常包括仅含载体和诱饵样本在非筛选条件下的数据,以及诱饵样本在筛选条件下的数据。首次加载数据集可能需要数秒时间,但后续对相同数据集查询不同基因时速度将显著加快。Blast_Query 将显示目标序列上的融合位点及其丰度,结果可通过 "结果"标签以表格形式展示,或通过 "图示"标签以图形形式展示。点击右上角的 "保存为 .csv"按钮,可将结果导出为 .csv 文件。

3. 通过 DEEPN 鉴定候选基因的验证

注意:DEEPN 和 Stat_Maker 的目的是鉴定能够产生阳性酵母双杂交(Y2H)相互作用的候选基因。验证此类 Y2H 相互作用可通过传统的二元 Y2H 方法进行,即将目标诱饵质粒与空的 Gal4 激活结构域“猎物”质粒配对,同时与携带目标基因/cDNA 片段的猎物质粒配对。由于在经过 Y2H 筛选的酵母群体所提取的混合 DNA 中无法直接分离出目标质粒,因此难以通过实验手段直接获取。然而,可以通过计算方法重建产生 Y2H 相互作用的基因/cDNA 片段序列,设计针对该片段 5' 和 3' 末端的引物,并从酵母群体提取的 DNA 中扩增该片段。本节描述如何确定候选猎物片段的 5' 和 3' 末端。

  1. 打开 DEEPN 软件,选择参数"Select Parameter"以及对应项目的 工作文件夹"Select Work Folder"。点击"Blast Query"按钮,启动 Blast_Query 模块。
  2. 在顶部文本框中输入目标基因名称或其 GenBank "NM"编号。从下拉菜单中选择与目标诱饵酵母群体相对应的数据集,以在“结果”选项卡下检索连接位点位置表。默认情况下,Blast_Query 将根据数据库中发现的连接总数(以每百万计,ppm)对不同位置按其在数据集中的丰度进行排序。
    1. 查找丰度最高且"位于开放阅读框内(In ORF)"和"处于正确读码框中(In Frame)"的位置。该位置值对应于顶部文本框中输入的 NCBI 参考序列('NM' 编号)的核苷酸位置。该序列可从 GenBank(https://www.ncbi.nlm.nih.gov/nuccore/)获取,或直接从 Blast_Query 窗口下方文本框中复制。
      注:示例见图6中间面板。在中心数据集中,“结果”显示最丰富的连接为:“位置”:867;“连接数”:20033.821;“查询起始”:1;CDS:位于开放阅读框内;“读码框”:处于正确读码框中。GenBank NCBI 参考序列 NM_019648 的第 867 位核苷酸即为猎物片段的起始位置。
  3. 如果“查询起始”为 1,则设计引物 5' 端时应包含对应于该位置编号的核苷酸,并从该位置向下游延伸 25 个核苷酸(图7)。如果“查询起始”大于 1,表明 Gal4 激活域与目标猎物序列之间存在额外核苷酸,因此引物应根据“查询起始”值进一步向下游设计。
  4. 在 DEEPN 窗口中,点击"Read Depth"按钮,位于"Analyze Data"下方。打开 Read Depth 窗口后,在顶部文本框中输入 NCBI 参考序列(NM)编号或基因名称。使用下拉菜单选择包含目标富集基因的相关数据集。利用左侧表格和右侧图形显示,确定数据中对应于目标基因的读段数量(图7B)。
  5. 设计一个 3' 端引物,用于捕获 Read Depth 计算出的基因片段序列。如果读段丰度超出开放阅读框和终止密码子,则设计引物时应包含终止密码子及其上游邻近区域。如果基因序列未延伸至终止密码子之后,则使用结果表查找可检测到的最远 3' 区域,并将该位置作为引物设计的最远 3' 端位置。
    注:Read Depth 程序以区间扫描方式寻找与指定基因/cDNA 匹配的序列,有助于预测样本中该基因最丰富猎物片段的 5' 和 3' 端位置。沿序列长度方向的读段深度波动属正常现象,如图7所示。若读段深度明显超过终止密码子,表明猎物片段已延伸至终止密码子之外,因此 3' 引物可直接对应终止密码子周围区域。
  6. 对每个基因进行 50 µL 的 PCR 反应。每项反应包含 25 pmol 的正向和反向引物(与猎物文库质粒匹配,参见材料表)、25 µL 高保真 2x PCR 主混合液、5 µg DNA 样品,并加水至总体积 50 µL。
    1. 扩增反应进行 25 个循环,每个循环包括:72 °C 延伸 3 分钟,55 °C 退火 30 秒,98 °C 变性 10 秒。循环前先在 98 °C 变性 30 秒,循环结束后在 72 °C 延伸 5 分钟。

访问受限。请登录或开始试用以查看此内容。

结果

fastq 数据比对:第一步
在包括 DEEPN 在内的几乎所有高通量测序(NGS)应用中,初始输出均为一组短序列读段文件,必须通过比对将其定位到基因组、转录组或其他参考 DNA8。近年来开发的 HISAT2 比对程序采用了先进的索引算法,显著提高了比对速度7,9。HISAT2 可在台式计算机上高效运行,通常可在数分钟内完成一个典型规模读段文件的比对。这使得我们能够将 HISAT2 集成到一个名为 MAPster 的图形用户界面中,实现 fastq 文件的本地比对,使用户无需依赖通常需通过命令行操作的远程高性能计算集群(图 1)。MAPster 的重要功能包括为 RNA-seq 和全基因组比对实验预设参数、支持多个任务排队,以及为高级用户和定制化应用提供对全套可调 HISAT2 参数的访问。为展示 MAPst...

访问受限。请登录或开始试用以查看此内容。

讨论

本文介绍的软件套件可用于对 DEEPN 实验产生的高通量 DNA 测序数据进行完整的处理与分析。首先使用的程序是 MAPster,该程序读取标准 fastq 文件中的 DNA 序列读段,并将其定位映射到参考 DNA 上,以便后续由多种生物信息学程序(包括 DEEPN 软件)进行分析。MAPster 界面具有实用的功能,例如可批量排队多个任务、合并输入文件、便捷命名输出文件,再结合其底层控制的 HISAT2 程序7的高速性能,使其成为适用于 DEEPN 以外多种应用场景的易用型映射工具。MAPster 可访问 HISAT2 程序中的多个参数,适用于除 DEEPN 之外的其他类型数据分析。其中部分功能包括为 RNA-seq 和全基因组映射实验预设的参数,以及为高级用户和定制化应用提供的全套易于调节的 HISAT2 参数选项。例如,RNA-seq 按钮会添加有助于转录本组装的格式设置;CRISPR 按钮则会阻止与参考 DNA 的反向互补链比对,这适用于由向导 RNA 序列构建的参考 DNA 文件。可选参数分布在四个标签页下,分别为"输入、比对、打分和输出"。“输入”选项包括更改输...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露

致谢

本工作由美国国立卫生研究院(NIH R21 EB021870-01A1)和美国国家科学基金会研究项目基金(1517110)资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Mapsterhttps://github.com/emptyewer/MAPster/releases
DEEPN 软件https://github.com/emptyewer/DEEPN/releases
Statmakerhttps://github.com/emptyewer/DEEPN/releases
最低计算机系统要求AppleMac Intel Core i5 或更高配置
-4 Gb RAM 或更高
-500 Gb 磁盘空间或更大
-OS 10.10 或更高版本
DellIntel i5-7400 或更高配置
-4 Gb RAM 或更高
-500 Gb 磁盘空间或更大
-Windows 7 或更高版本

参考文献

  1. Fields, S., Song, O. A novel genetic system to detect protein-protein interactions. Nature. 340 (6230), 245-246 (1989).
  2. Rajagopala, S. V. Mapping the Protein-Protein Interactome Networks Using Yeast Two-Hybrid Screens. Advances in Experimental Medicine and Biology. 883, 187-214 (2015).
  3. Weimann, M., et al. A Y2H-seq approach defines the human protein methyltransferase interactome. Nature Methods. 10 (4), 339-342 (2013).
  4. Yachie, N., et al. Pooled-matrix protein interaction screens using Barcode Fusion Genetics. Molecular Systems Biology. 12 (4), 863(2016).
  5. Trigg, S. A., et al. CrY2H-seq: a massively multiplexed assay for deep-coverage interactome mapping. Nature Methods. , (2017).
  6. Pashkova, N., et al. DEEPN as an Approach for Batch Processing of Yeast 2-Hybrid Interactions. Cell Reports. 17 (1), 303-315 (2016).
  7. Kim, D., Langmead, B., Salzberg, S. L. HISAT: a fast spliced aligner with low memory requirements. Nature Methods. 12 (4), 357-360 (2015).
  8. Reinert, K., Langmead, B., Weese, D., Evers, D. J. Alignment of Next-Generation Sequencing Reads. Annual Review of Genomics and Human Genetics. 16, 133-151 (2015).
  9. Pertea, M., Kim, D., Pertea, G. M., Leek, J. T., Salzberg, S. L. Transcript-level expression analysis of RNA-seq experiments with HISAT, StringTie and Ballgown. Nature Protocols. 11 (9), 1650-1667 (2016).
  10. Conesa, A., et al. A survey of best practices for RNA-seq data analysis. Genome Biology. 17, 13(2016).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

酵母双杂交序列数据分析MAPster 软件DEEPN 分析Stat Maker 程序蛋白质相互作用网络生物信息学处理高通量筛选基因富集谱型分析翻译框分析