需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

葡萄树ATL E3泛素连接酶基因家族的全基因组鉴定与表达荟萃分析的综合工作流程

10K 次观看

DOI:

10.3791/56626

2017年12月22日

* These authors contributed equally

本文内容

摘要

本文描述了在葡萄中鉴定和表征基因家族的方法,该方法应用于拟南芥酵母毒性(Arabidopsis Tóxicos in Levadura,ATL)E3泛素连接酶家族。

摘要

基因家族的分类与命名可显著促进对编码蛋白多样性的描述,并基于多个特征(如序列基序的存在、特定翻译后修饰位点以及家族成员在不同条件下的表达谱)预测家族功能。本文描述了一种用于基因家族表征的详细实验方案。此处,该方法应用于葡萄中Arabidopsis Tóxicos in Levadura(ATL)E3泛素连接酶家族的表征。该方法包括全基因组范围内鉴定家族成员,分析基因定位、结构与复制事件,保守蛋白基序分析,蛋白亚细胞定位与磷酸化位点预测,以及在不同数据集中对家族成员进行基因表达谱分析。此流程可根据实验目的进一步扩展,适用于任何具有基因组数据的植物物种中的任意基因家族,为功能研究筛选出有价值的候选基因,并为植物适应环境的分子机制提供见解。

引言

在过去十年中,葡萄基因组学的研究取得了大量进展。葡萄是一种具有重要经济价值的作物,已成为研究果实发育以及木本植物对生物和非生物胁迫响应的模式植物。在此背景下,2007年发布的Vitis vinifera cv. PN40024基因组序列1及其2011年的更新版本2,推动了"组学"规模数据的快速积累,并促进了高通量研究的蓬勃发展。基于已发表的序列数据,现在可以对特定基因家族(通常由具有保守基序、结构和/或功能相似性以及进化关系的蛋白质组成)进行系统分析,以揭示其分子功能、进化历程以及基因表达模式。这些分析有助于理解基因家族如何在全基因组水平上调控生理过程。

植物生命周期的许多方面受到泛素介导的关键蛋白降解的调控,这一过程需要精确调控蛋白质的周转,以确保正常的细胞活动。泛素介导的降解过程中的重要组分是E3泛素连接酶,它们通过招募特定底物赋予系统灵活性3。因此,E3连接酶构成一个庞大的基因家族,在Arabidopsis thaliana基因组中预测约有1,400个编码E3泛素连接酶的基因4,每个E3泛素连接酶负责特定靶蛋白的泛素化。尽管底物特异性的泛素化在植物细胞调控中具有重要意义,但关于泛素化通路如何被调控以及靶蛋白的识别,目前仅在少数情况下有所了解。解析这种特异性和调控机制首先依赖于系统中各个组分的鉴定与表征,尤其是E3连接酶。在泛素连接酶中,ATL亚家族的特征是在A. thaliana中鉴定出91个成员,均含有RING-H2指结构域5,6,其中部分成员在防御反应和激素响应中发挥功能7

定义一个新基因家族成员的首要关键步骤是精确界定该家族的特征,例如共有基序、关键结构域以及蛋白质序列特征。事实上,基于BLAST分析可靠地检索出所有基因家族成员需要某些必需的序列特征,特别是负责蛋白质功能或活性的蛋白质结构域,这些可作为蛋白质的特征性标志。这一过程可通过先前对其他植物物种中相同基因家族的表征来实现,也可通过分析不同植物物种中假定属于同一家族的多个基因,以鉴定其共有序列。随后,可根据国际联盟为特定植物物种确立的通用规则对家族成员进行逐一命名。例如,在葡萄中,该流程需遵循葡萄基因注释超级命名委员会(sNCGGa)的建议,即构建包含V. viniferaA. thaliana基因家族成员的系统发育树,从而基于核苷酸序列进行基因注释8

家族成员的染色体定位及基因重复事件分析有助于揭示全基因组重复或串联重复基因的存在。此类信息对于解析基因的潜在功能具有重要意义,因为它可能揭示功能冗余,或表明其他不同情形,例如i.e.,功能丧失(non-functionalization)、新功能化(neo-functionalization)或亚功能化(sub-functionalization)9。其中,新功能化与亚功能化是产生遗传新颖性的重要事件,为植物适应不断变化的环境提供了新的细胞组分10。特别是在葡萄基因组的进化过程中,祖先基因的重复及新基因的产生十分频繁,而通过邻近重复和串联重复产生的新基因更有可能获得新的功能11

解析基因家族功能的另一个关键因素是转录组谱。公共数据库提供了海量的转录组数据,可加以利用,通过大规模分析为基因家族成员分配假定功能。 计算机模拟 表达分析。事实上,某些基因在特定植物器官中的特异性表达,或在应对特定胁迫时的表达模式,可为相应蛋白质在特定条件下的潜在功能提供线索,并支持关于重复基因可能发生亚功能化以应对不同挑战的假说。为此,需考虑多个数据集:这些数据可以是已有的基因表达矩阵,例如葡萄器官及发育阶段的全基因组转录图谱12,或者可以自行构建 特设的 通过获取特定植物物种在特定胁迫条件下的转录组数据集来实现。此外,可采用一种简单方法,利用两个矩阵进行分析:其中一个矩阵包含序列间的成对相似性数据,另一个矩阵包含基因间的成对共表达系数,从而评估基因家族中序列相似性与表达模式之间的关系。

本研究旨在提供一种全局性方法,通过定义基因结构、保守的蛋白质基序、染色体位置、基因重复事件以及表达模式,同时预测蛋白质的亚细胞定位和磷酸化位点,从而对植物中的基因家族进行系统而全面的表征。本文将这一综合性方法应用于葡萄中ATL E3泛素连接酶家族的鉴定与分析。鉴于ATL亚家族成员在调控关键细胞过程中的日益凸显的作用7,本研究有助于筛选出适合开展功能研究的重点候选基因,并最终揭示这一重要作物适应环境的分子机制。

访问受限。请登录或开始试用以查看此内容。

方案

1. 鉴定候选 ATL 基因家族成员

  1. PSI-BLAST 网络版
    1. 打开 BLAST 网页13 并点击蛋白质BLAST部分。
    2. 在 "输入查询序列" 在字段中输入将用作探针以鉴定其他家族成员的蛋白的氨基酸序列(此处为 VIT_05s0077g01970)。
      注意:应使用具有良好代表性的蛋白(即呈现该家族所有重要特征的蛋白)。
    3. 在田间 "选择搜索集合",选择 "参考蛋白" 数据库(refseq_protein)和目标生物(V. vinifera - taxid:29760)
    4. 在田间 "程序选择",选择 PSI-BLAST 算法,然后点击 BLAST 按钮以运行分析。
      注意:单击下方的 "算法参数" 可以调整一些高级参数(最大目标序列数、评分矩阵、PSI-BLAST 阈值, 等等。).
    5. 第一轮 BLAST 检索出所有与查询序列具有显著匹配的序列(e 值高于选定阈值——默认为 0.005;本实验中为 0.001)。通过点击复选框,取消选择明显不属于待研究家族的所有条目 "选择 PSI-BLAST" 柱并点击BLAST按钮运行第二次PSI-BLAST迭代,操作同步骤1.1.4。
    6. 新鉴定出的序列以黄色高亮显示。取消选择明显错误的检索结果,并按照步骤1.1.5所述展开进一步迭代。
    7. 继续迭代,直至算法未发现任何相关条目或达到收敛(即未发现新条目)。下载候选基因家族成员列表以进行后续分析。对每次迭代中检索到的匹配结果进行人工目视检查,以避免假阳性结果的出现。
  2. PSI-BLAST 独立版本
    1. 单击以下载BLAST的独立版本 "下载 BLAST" BLAST 主页上的按钮13.
      注意:独立运行的BLAST软件是前述网页版工具的命令行版本。它能够针对自定义的本地或远程数据库执行PSI-BLAST搜索,此外还支持使用预定义的位置特异性评分矩阵(PSSM)进行搜索。

2. 对 PSI-BLAST 鉴定的家族成员进行人工审阅

  1. 多序列比对
    1. 收集先前鉴定的氨基酸序列,将其保存为 FASTA 格式文件,并上传至 MEGA 软件中14 继续进行多序列比对。
    2. 打开 MEGA 软件,点击 "比对" 按钮,点击 "编辑/构建比对",点击 "创建新的比对",点击 "蛋白质".
    3. 点击 "编辑" 从比对菜单中 "从文件插入序列"浏览之前创建的FASTA文件,并确认上传所有已调查的序列。
    4. 点击 "比对" 从比对菜单中 "使用 MUSCLE 进行比对". 使用默认参数,点击 "计算" 按钮,并等待多序列比对完成。
    5. 目视检查多序列比对结果,以排除错误预测的家族成员。定义 ATL 家族成员的关键特征是其保守的 CxxC(13x)PxCxHxxHxxCxxxW(7x)CxxCW 模体,特别是第三个半胱氨酸前的脯氨酸残基的存在。
  2. 特定 LOGO 的分析
    1. 将基因家族成员的最终列表(96条葡萄序列符合ATL的认定标准)提交至多重期望最大化基序发现工具(MEME)15 用于定义该家族中的保守基序。
    2. 从 MEME 主页点击 "MEME" 按钮,并完成 "数据提交表" 并提供有关目标基因家族的特定信息。
    3. 使用 MEME 分析确认葡萄 ATL 家族成员中两个预期基序的存在, RING-H2 和 GLD 基序
  3. 或者,使用生物信息学软件套件同时执行步骤 2.1 和 2.2(参见 材料表).
    1. 上传FASTA文件(参见步骤2.1.1)至该分析平台。选择 "文件" 从菜单中,然后 "导入" 并点击 "从文件". 浏览 FASTA 文件并点击 "开放".
    2. 选中列表中所有已导入的序列,然后点击 "比对/组装" 工具栏中的按钮,然后单击 "多序列成对比对"选择 "肌肉排列" 并点击 "好的" 使用默认参数启动比对。
    3. 要查看比对结果的序列标识(LOGO),请点击 "图表" → "选项" 并选择 "序列标识图".

3. 蛋白质物理参数与结构域分析

  1. 由于被调查家族成员的各种物理参数的定义对于全面描述该基因家族至关重要,因此需将家族成员列表提交至特定的网络工具进行分析。
    1. 对于等电点(pI)和分子量(kDa),使用 ExPASy 网站上的 ProtParam 工具16,并采用默认参数。
    2. 对于蛋白质亚细胞定位,使用多种工具以获得更可靠的预测结果,例如 ngLOC v1.017(默认设置)、targetP v1.118(默认设置)以及 protein prowler subcellular localization v1.219(概率阈值设为 0.5)。对于磷酸化位点的预测,使用 MUsite v1.0 网络工具20,并采用默认参数。
  2. 进一步分析家族成员中是否存在其他蛋白质结构域。
    1. 打开 Pfam 数据库网页21,选择“Sequence search”工具,将蛋白质序列提交至查询框中,然后点击“Go”以运行分析。
      注:每条蛋白质序列需单独分析。默认设置下的 e 值为 1.0,可用于区分显著性与非显著性匹配结果。
    2. 访问丹麦生物序列分析中心的 TMHMM Server22,以检测潜在的跨膜区域。可将所有蛋白质序列同时粘贴至查询框中(或上传一个包含所有蛋白质序列的 FASTA 格式文本文件),然后点击“Submit”以运行分析。
    3. 针对 TMHMM 分析结果中未预测到跨膜结构域的蛋白质(见步骤 3.2.2),使用 ProtScale 工具识别潜在的疏水区域。打开 ProtScale 网页23,将每条蛋白质序列分别粘贴至查询框中,并选择“Hphob. / Kyte & Doolittle”作为氨基酸疏水性标度,点击“Submit”以运行分析。

4. 染色体分布、重复事件及外显子-内含子结构

  1. 根据葡萄基因组CRIBI生物技术中心网站提供的信息,将ATL家族成员定位到染色体上24.
    1. 浏览 PhenoGram 网站主页25. 写下 "输入文件" 以制表符分隔的文本文件形式,包含待定位到染色体上的基因的特定特征,具体需遵循所提供的文件汇编详尽指南和示例,按照指定路径进行操作 "表型图" → "文档" → "选项" → "输入文件".
    2. 撰写 "基因家族分类与命名" 工作的基因组。选择要绘制的基因组。对于软件中未内置的基因组,例如葡萄基因组,选择 "其他" 在下拉菜单中。根据提供的指南和示例编写基因组文件,并按照路径 "表型图" → "文档" → "选项" → "基因组",并上传。
    3. 使用默认参数 "表型间距", "表型颜色", "图像格式",或在相应菜单中选择其他选项,然后单击 "绘图" 以获得基因在染色体上的可视化图谱。
  2. 使用 MCScanX 软件定义基因家族成员的复制状态26.
    1. 在运行命令行的本地计算机上下载并解压 MCscanX 的副本 1补充文件 1)。进入 MCscanX 文件夹,并通过运行命令行 2 创建所需的可执行文件(补充文件 1).
      注意:由于 chdir 函数存在问题,在某些 64 位 Linux 机器上安装 MCscanX 可能会失败。如果在执行 make 命令时返回与此函数相关的错误消息,则需修改第 3 行命令补充文件 1)应运行,且该命令 "制作" 之后应尝试进行。
    2. 下载 V. vinifera 蛋白质及使用命令行运行第4条的注释文件补充文件 1).
      注意:需要解压葡萄基因组注释文件,并通过运行第5条命令行将各条染色体的信息合并为一个单独的文件补充文件 1).
    3. 运行一个 "全对全" 使用 blastp 进行搜索 V. vinifera 将蛋白文件同时作为查询序列和目标序列。
    4. 使用可搜索的 blast 数据库 V. vinifera 蛋白文件运行命令行 6 (补充文件 1)。使用 blastp 搜索进行 V. vinifera 以蛋白质文件作为查询,针对之前通过运行第7条命令行创建的数据库进行比对补充文件 1).
    5. 将注释文件转换为适用于 MCScanX 的格式。运行命令行 8(补充文件 1)下载自定义 Perl 脚本 parseMSCanXgff.pl。通过运行命令行 9 执行分析补充文件 1).
      注意:将生成一个名为 vitis.gff 的文件,其中包含基因坐标的以下格式:
      sp# 基因 起始位置 终止位置
      其中 "sp" 是物种的双字母代码(Vv 代表葡萄)而 "#" 是支架的名称。请注意,所提供的自定义 Perl 脚本适用于大多数转换,但由于可用注释文件中提供的信息具有多样性,在某些特定情况下可能需要对代码进行修改。
    6. 运行命令行 10 启动 MCScanX补充文件 1).
      注意: "葡萄属" 是注释文件和BLAST输出文件的前缀。这是软件运行的强制性要求。
    7. 分析 MCScanX 结果。MCScanX 生成一个文本文件 "葡萄基因组共线性分析",其中包含共线性区块。该文件可用任意文本编辑器查看(参见示例输出1 补充文件 1).
      注意:A "mcscaxOutput.html" 生成一个目录,其中包含针对每条参考染色体的共线性区块多序列比对的 HTML 文件。这些文件可通过网页浏览器查看。
    8. 根据染色体上的相对位置对同源基因进行分类,运行命令行 11补充文件 1).
      注意:旁系同源基因分类在 补充表 II生成的输出文件 "葡萄基因类型" 包含所有来源信息,采用简单的制表符分隔格式。
    9. 进行富集分析,以评估该基因家族是否主要通过运行第12条命令行所指定的特定机制起源补充文件 1).
      注意:文件 "葡萄基因类型" 在步骤 4.2.8 中生成,而文件 "基因家族文件" 表示一个单行文本文件,其中包含该家族的名称(例如,ATL基因)后跟该家族所有基因的位点名称,以制表符分隔。所采用的富集分析统计检验方法为Fisher精确检验,且 p不同来源的值存储在文件中 "outputFile.txt".
  3. 使用交互式生命之树(Interactive Tree Of Life, iTOL)可视化基因的外显子-内含子结构27一种用于展示、注释和管理系统发育树的在线工具。
    1. 上传系统发育树 "上传" 在iTOL网站的相应部分。该进化树根据下文第5节构建。针对每个基因家族成员,从葡萄藤基因组V1注释(上述CRIBI网站)中获取基因结构预测信息。计算各候选外显子、内含子及非翻译区(UTRs)的长度(以bp为单位)。
    2. 使用 "蛋白质结构域" 用于外显子-内含子模式图形可视化的数据集。根据指定路径中的说明,编写一个包含计算长度的纯文本文件 "帮助" → "帮助页面" → "数据集类型" → "蛋白质结构域" 在 iTOL 网站上27使用 "蛋白质结构域" 数据集,该 "矩形(RE)" 以及 "矩形间隙(GP)" 方框和线条分别代表外显子和非翻译区。

5. 系统发育分析与命名法

  1. 通过构建高质量的系统发育树并定义基因家族命名法,分析 ATL 家族成员之间的关系。
    1. 对于葡萄基因家族,遵循葡萄超级命名委员会制定的规则8.
    2. 检索 A. thaliana 用于葡萄基因命名参考所需的ATL序列8,来自 UniProt 数据库28 .
    3. 编写一个FASTA文件,包含所有葡萄的核苷酸序列 A. thaliana 用于系统发育分析的基因家族成员。核苷酸序列能够提供家族成员间最大程度的变异信息(相较于蛋白质序列)。
  2. 系统发育树
    注意:Phylogeny.fr 的使用 29 建议采用该流程以获得高质量的系统发育树,但并非强制要求。
    1. 浏览 Phylogeny.fr 主页29,并选择 "系统发育分析" 流程
      注意: "一键" 在大多数情况下均适用,但如有需要,也可选择特定的高级设置("高级")或完全自定义的分析("A la Carte";参见步骤 5.2.5。
    2. 撰写 "分析名称",上传之前创建的 FASTA 文件(步骤 5.2.1),然后单击 "提交" 运行分析。
    3. 或者,如果上述步骤(5.2.1、5.2.2)出现错误提示,则需单独完成系统发育分析套件流程中的每一步,具体如下。
      1. 来自 MUSCLE 软件主页30,将FASTA文件上传至 "步骤 1",选择 "Pearson/FASTA" 作为 "输出格式" 在 "步骤 2",然后单击 "提交" 在 "步骤 3" 用于比对查询序列。
      2. 点击 "下载比对文件" 并保存为FASTA文件以用于后续步骤。
      3. 使用 Gblocks Server 工具处理比对后的 FASTA 文件,以去除比对质量较差的位点31. 上传比对的FASTA文件,选择 "DNA" 作为 "序列类型" 并选择最适合该分析的严格性选项(例如,对于葡萄ATL基因家族,选择所提供的全部三个选项 "较宽松的选择标准" 由于序列差异较大)。点击 "获取片段" 以运行分析。
      4. 点击 "比对结果" 在输出页面底部将结果另存为新的FASTA文件。
      5. 从 Phylogeny.fr 主页29,选择 "定制化服务" 作为 "系统发育分析" 流程。然后,取消选择 "多序列比对" 和 "序列比对编辑". 点击 "创建工作流程",上传经Gblocks处理的FASTA文件(步骤5.2.5.4),选择 "自举法程序" 默认参数下 "设置",然后点击 "提交" 运行分析。
    4. 折叠支持率较低的分支(,自展值 < 70%) 通过点击 "折叠分支" 在 "选择并执行操作" 部分并以 Newick 格式下载最终结果,以供进一步分析。
  3. 根据系统发育关系分配基因名称。
    1. 使用上述(第4.3节)引用的iTOL工具套件上传系统发育树,以评估树结构的可靠性。
    2. 为每个家族成员手动分配一个基因名称。对于一对一的直系同源基因,分配相同的 拟南芥-样名称(例如AtATL3 → VviATL3)。区分源自单个 拟南芥 使用数字或字母标记与拟南芥基因具有相同系统发育距离的同源基因,若拟南芥基因编号以数字结尾,则使用字母例如,AtATL23 → VviATL23a, VviATL23b
    3. 对于一对一或多对多的直系同源基因,分配一个新的基因名称,该名称由 拟南芥-样名称(此处, "ATL")配以一个高于现有编号的数字 V. vinifera 拟南芥 (例如VviATL83
    4. 从系统发育树的顶端到底端,完成新定义家族的命名。

6. 葡萄器官与发育时期表达谱分析

  1. 生成包含基因家族成员表达数据的工作数据矩阵。
    1. 从 ResearchGate 平台发布的链接下载V. vinifera cv. Corvina 基因表达图谱数据矩阵32。该文件包含后续步骤中使用的 RMA 标准化表达值。
    2. 从图谱数据矩阵中提取每个家族基因的表达值,并编写一个“工作数据矩阵”,其表头行与图谱数据矩阵相同。将“工作数据矩阵”保存为制表符分隔的文本文件。
  2. 使用 Multi Experiment Viewer (MeV) 软件进行层次化双聚类分析。
    1. 下载并安装 MeV 软件33
    2. 按照路径“文件”→“加载数据”→“浏览”上传“工作数据矩阵”(步骤 6.1.2),选择该文本文件。若未提供自动注释,则选择“单色芯片阵列”并取消勾选“加载注释”。在表达表格预览中选择最左上角的表达值,然后点击“加载”按钮。
    3. 对数据进行调整:应用 Log2 转换(“调整数据”→“对数转换”→“Log2 转换”)和基因/行标准化(“调整数据”→“基因/行调整”→“基因/行中位数中心化”)。设置合适的颜色标度范围(“显示”→“设置颜色标度限制”)。
    4. 按照路径“分析”→“聚类”→“HCL”执行层次聚类分析。在“排序优化”字段中选择“优化基因叶序”和“优化样本叶序”,在“距离矩阵选择”字段中选择“Pearson 相关性”,在“连接方法选择”字段中选择“平均连接聚类”,然后点击“确定”运行分析。
    5. 在窗口左侧面板的“分析结果”→“HCL”菜单中查看结果。通过点击“文件”菜单中的“保存图像”导出热图。

7. 生物和非生物胁迫响应中的表达谱分析

  1. 使用相关出版物和研究中获得的GSE登录号,重复步骤6.1,这些研究涉及葡萄对生物和非生物胁迫的响应。例如,提供感染真菌病原体的葡萄果实转录组谱的实验 灰葡萄孢菌 使用 NimbleGen 葡萄全基因组微阵列的数据可通过 GSE 编号 GSE52586 浏览。重复步骤 6.1.1 和 6.1.2。
  2. 搜索 NCBI 序列读取档案库34 SRA/BioProject 编号为(例如,SRP055458 或 PRJNA275778 用于 "葡萄花遮荫" 实验)并下载所有相关的原始序列读段。来自大量不同研究的 RNA-seq 数据集均采用统一的分析流程进行处理,以确保一致性。
    1. 简要而言,使用 Trimmomatic 对原始序列 FASTQ 读段(单端和双端)进行修剪和质量过滤35使用 AVGQUAL 和 MINLEN 筛选参数分别为 20 和 40,其余参数采用默认设置。
    2. 索引12X葡萄参考基因组1 使用 Bowtie236. 下载12X葡萄参考基因组(例如, bowtie2-build)在运行之前 bowtie2 命令
    3. 使用 htseq-count 获取计数矩阵表37 使用葡萄藤V1基因模型注释(GFF/GTF)文件。
  3. 在 R 中进行差异基因表达(重新)分析38 使用 limma39 RMA标准化矩阵和DESeq2的软件包40 分别用于从步骤 7.1.1 和 7.2.1 获得的计数矩阵表格的文库。
    1. 执行标准操作 "两组" 比较, "处理"/"对照")。确保设计矩阵/分组的 "对照组" 和 "处理" 条件已明确说明。
      注意:一项典型的微阵列差异表达分析设计(GSE52586),用于比较感染了EL-33的浆果 灰葡萄孢菌 与同发育阶段的对照(健康)浆果相比 limma 运行命令行 13 的结果如图所示 补充文件 1典型的RNA-seq差异表达分析设计(SRP055458或PRJNA275778),用于比较遮荫处理下花(落冠后7天)与对照组的差异 DESeq2 运行命令行 14 的结果如图所示 补充文件 1.
    2. 获取每个比较组中差异表达基因(DEG)的列表, limma,使用这些功能 lmFit(),随后 eBayes(),然后通过 顶部表格功能,而 DESeq2,使用 DESeqDataSetFromMatrix(), DESeq(),以及 结果() 功能。以下是应遵循的典型工作流程。
      1. 对于微阵列差异表达分析,请参见命令行 15(补充文件 1)。对于RNA-seq差异表达分析,请参见命令行16(补充文件 1)。对所有其他对比组,重复上述步骤,并采用相应合适的设计方案(参见步骤 7.3.1 中的示例)
  4. 从生成的差异表达基因(DEG)列表中,提取所有不对应于 ATL V1 登录号的行,并保留包含 log2 Fold Change(处理组/对照组)的列 > |0.5| 并调整 p-值(FDR) < 0.05,并据此将它们合并到一个矩阵表中,以确定某项研究属于哪一类 "非生物" 或 "生物/病原体互作" 文库
  5. 使用 R 中的 libraries 构建分层聚类热图(非生物与生物数据集) gplots.
    注意:调用 heatmap.2 该函数利用相应的矩阵表格构建热图及行聚类树。附加参数使用 细胞注释 功能有助于区分差异表达(log2FC > 0.5,FDR < 0.05)的ATL基因用*符号标注。在R中运行第17行命令,执行典型的工作流程。补充文件 1)或者,重复步骤 6.2.2 至 6.2.5,使用 MeV 软件构建热图。

8. 旁系同源序列分歧与基因共表达关系的分析

  1. 构建包含成对相似性的矩阵。相似性矩阵的元素是从成对蛋白质比对中计算得到的序列相似性值。
    1. 使用 EMBOSS needle 网络服务器41,采用默认设置进行成对序列比对,并以文本文件格式保存。打开输出的文本文件,删除所有注释行以及行列名称,生成一个名为“similarityTable.txt”的文件。
      注:该表中每一行对应一个 ATL 基因,列出在每一对比对中计算得到的相似性值。行与列中位点的顺序相同,因此生成的矩阵相对于对角线呈对称。
  2. 通过计算皮尔逊相关系数构建共表达数据矩阵。以下步骤需要使用 R 和 perl 模块 PDL。
    1. 在终端中运行命令行 18(补充文件 1),下载 96 个 ATL 基因的表达值。使用一个自定义 perl 脚本进行共表达分析,该脚本可通过运行命令行 19(补充文件 1)下载。该脚本将如先前报道的方法,计算 ATL 位点对之间的皮尔逊相关系数。
    2. 运行命令行 20(补充文件 1)启动脚本,并按照输出提示操作。该脚本将生成一个输出文件(即“coexpressionTable.txt”),其中包含一个共表达矩阵,其位点名称的排列顺序与步骤 8.1 中获得的矩阵一致(此顺序对于后续进行 Mantel 检验至关重要,请参见下文)。
  3. 对步骤 8.1 和 8.2 中获得的数据矩阵进行 Mantel 检验。进入 R 环境(在终端中运行命令“R”),使用以下命令加载 ade4 程序包:library(ade4)
    1. 通过加载两个数据矩阵并运行命令行 21(补充文件 1)执行 Mantel 检验,其中“nrep”表示置换次数。该检验通过计算这两个矩阵元素之间的相关性,对矩阵进行多次置换,再重复计算相同的检验统计量。
      注:所有获得的检验统计量值用于构建该统计量的参考分布,进而用于计算 p 值以判断显著性。置换次数决定了 p 值估算的精确程度。

访问受限。请登录或开始试用以查看此内容。

结果

VIT_05s0077g01970 基因,被鉴定为最相似于 A. thaliana ATL2 (At3g16720) 通过 BLASTp 搜索,被用作探针以分析葡萄基因组中的 ATL 家族成员V. vinifera cv Pinot Noir PN40024)。经过数个循环后,PSI-BLAST 分析收敛,获得一组属于葡萄 ATL 基因家族的候选基因列表(图1A)。通过目视检查分析中鉴定出的所有条目的MUSCLE比对结果,评估每个候选蛋白是否含有典型的RING-H2结构域。图1B)。根据原始ATL定义,只有包含正确间距的保守氨基酸、两个组氨酸残基以及位于第三个半胱氨酸之前的脯氨酸残基的基因,才被视为ATL基因。 拟南芥5共有96个葡萄基因满足要求,被选作进一步表征。对每个ATL家族成员进行分析,以确定其基因及其编码蛋白的特异性特征。 ...

访问受限。请登录或开始试用以查看此内容。

讨论

在基因组时代,许多基因家族已在多个植物物种中得到深入表征。这些信息为功能研究奠定了基础,并为进一步探究家族中不同成员的作用提供了框架。在此背景下,还需要建立一种命名系统,能够唯一地标识家族中的每个成员,避免因不同研究团队独立为不同基因赋予名称而可能产生的重复和混淆。

经过慎重考虑,葡萄科学界同意根据与拟南芥(Arabidopsis)基因的相似性,将葡萄基因归入相应基因家族,并制定了一系列规则,用于描述葡萄中新基因家族的命名,其基本流程始于葡萄与拟南芥家族成员之间的核苷酸序列系统发育比较8。因此,只有在拟南芥中已正确注释并命名的基因,方可用于葡萄基因家族的命名。本文所述鉴定拟南芥中葡萄ATL同源基因的方法,正是为了满足葡萄基因家族正确命名的要求而进行的。然而,对于其他植物物种,也可考虑采用替代性方法。例如,可通过双向BLAST比对(BBH)推断同源关系,即两个物种中彼此之间序列相似性最高(比对得分最高)、且高于各自与其他任何基因相似性的基因对被定义为同源基因44<...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

本研究工作由维罗纳大学在2014年联合项目(葡萄中ATL基因家族的表征及其在抵抗霜霉菌Plasmopara viticola中的作用)框架内资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
个人计算机
基本局部比对搜索工具(BLAST)https://blast.ncbi.nlm.nih.gov/Blast.cgi
分子进化遗传学分析软件(MEGA)http://www.megasoftware.net/
基于基序的序列分析工具(MEME)http://meme-suite.org/
GeneiousBiomatters Limitedhttp://www.geneious.com/
ProtParam 工具http://web.expasy.org/protparam/
ngLOChttp://genome.unmc.edu/ngLOC/index.html
TargetP v1.1 服务器http://www.cbs.dtu.dk/services/TargetP/
Protein Prowlerhttp://bioinf.scmb.uq.edu.au:8080/pprowler_webapp_1-2/
MUsitehttp://musite.sourceforge.net/
Pfamhttp://pfam.xfam.org/
TMHMM 服务器 v. 2.0http://www.cbs.dtu.dk/services/TMHMM/
ProtScalehttp://web.expasy.org/protscale/
葡萄基因组数据库(CRIBI)http://genomes.cribi.unipd.it/grape/
PhenoGramhttp://visualization.ritchielab.psu.edu/phenograms/plot
MCScanXhttp://chibba.pgml.uga.edu/mcscan2/
交互式生命之树(iTOL)http://itol.embl.de/
UniProthttp://www.uniprot.org/
Phylogeny.frhttp://www.phylogeny.fr/index.cgi
MUSCLEhttp://www.ebi.ac.uk/Tools/msa/muscle/
Gblocks 服务器http://molevol.cmima.csic.es/castresana/Gblocks_server.html
Vitis vinifera cv. Corvina 基因表达图谱数据矩阵https://www.researchgate.net/publication/273383414_54sample_
datamatrix_geneIDs_Fasoli2012
多实验查看器(MeV)http://mev.tm4.org/#/welcome
序列读取归档库(SRA)https://www.ncbi.nlm.nih.gov/sra
Rhttps://www.r-project.org/
EMBOSS Needle(EMBL-EBI)http://www.ebi.ac.uk/Tools/psa/emboss_needle/

参考文献

  1. Jaillon, O., et al. The grapevine genome sequence suggests ancestral hexaploidization in major angiosperm phyla. Nature. 449 (7161), 463-467 (2007).
  2. Adam-Blondon, A. -F., et al. Genetics, Genomics, and Breeding of Grapes. , Science Publishers. 211-234 (2011).
  3. Chen, L., Hellmann, H. Plant E3 Ligases: Flexible Enzymes in a Sessile World. Mol. Plant. 6 (5), 1388-1404 (2013).
  4. Vierstra, R. D. The ubiquitin-26S proteasome system at the nexus of plant biology. Nat. Rev. Mol. Cell Biol. 10 (6), 385-397 (2009).
  5. Serrano, M., Parra, S., Alcaraz, L. D., Guzmán, P. The ATL Gene Family from Arabidopsis thaliana and Oryza sativa Comprises a Large Number of Putative Ubiquitin Ligases of the RING-H2 Type. J. Mol. Evol. 62 (4), 434-445 (2006).
  6. Aguilar-Hernández, V., Aguilar-Henonin, L., Guzmán, P. Diversity in the Architecture of ATLs, a Family of Plant Ubiquitin-Ligases, Leads to Recognition and Targeting of Substrates in Different Cellular Environments. PLoS One. 6 (8), e23934(2011).
  7. Guzmán, P. The prolific ATL family of RING-H2 ubiquitin ligases. Plant Signal Behav. 7 (8), 1014-1021 (2012).
  8. Grimplet, J., et al. The grapevine gene nomenclature system. BMC Genomics. 15, 1077(2014).
  9. Prince, V. E., Pickett, F. B. Splitting pairs: the diverging fates of duplicated genes. Nat. Rev. Genet. 3 (11), 827-837 (2002).
  10. Magadum, S., Nerjee, U., Murugan, P., Gangapur, D., Ravikesavan, R. Gene duplication as a major force in evolution. J. Gen. 92 (1), 155-161 (2013).
  11. Wang, N. Patterns of Gene Duplication and Their Contribution to Expansion of Gene Families in Grapevine. Plant Mol. Biol. Rep. 31 (4), 852-861 (2013).
  12. Fasoli, M. The Grapevine Expression Atlas Reveals a Deep Transcriptome Shift Driving the Entire Plant into a Maturation Program. Plant Cell. 24 (9), 3489-3505 (2012).
  13. BLAST. BLAST2.6.0. , Available from: https://blast.ncbi.nlm.nih.gov/Blast.cgi (2016).
  14. MEGA. MEGA7.0.25 build 7170412. , Available from: http://www.megasoftware.net/ (2017).
  15. MEME. MEME Suite Version 4.11.4. , Available from: http://meme-suite.org/ (2017).
  16. ProtParam. ExPASy Server. , Available from: http://web.expasy.org/protparam/ (2005).
  17. ngLOC v1.0. , Available from: http://genome.unmc.edu/ngLOC/index.html (2007).
  18. TargetP v1.1 Server. , Available from: http://www.cbs.dtu.dk/services/TargetP/ (2000).
  19. Prowler v1.2. , Available from: http://bioinf.scmb.uq.edu.au:8080/pprowler_webapp_1-2/ (2005).
  20. MuSite v1.0. , Available from: http://musite.sourceforge.net/ (2010).
  21. Pfam. Pfam version 31.0. , Available from: http://pfam.xfam.org/ (2016).
  22. TMHMM v2.0c. , Available from: http://www.cbs.dtu.dk/services/TMHMM/ (2007).
  23. ExPASy. ProtScale. , Available from: http://web.expasy.org/protscale/ (2005).
  24. CRIBI. Grape genome database. , Available from: http://genomes.cribi.unipd.it/grape/ (2012).
  25. PhenoGram. , Available from: http://visualization.ritchielab.psu.edu/phenograms/plot (2012).
  26. ScanX v0.8. , Available from: http://chibba.pgml.uga.edu/mcscan2/ (2013).
  27. Interactive Tree Of Life (iTOL). Version3.5.3. , Available from: http://itol.embl.de/ (2016).
  28. UniProt. , Available from: http://www.uniprot.org/ (2016).
  29. Phylogeny.fr. , Available from: http://www.phylogeny.fr/index.cgi (2008).
  30. MUSCLE. , Available from: http://www.ebi.ac.uk/Tools/msa/muscle/ (2017).
  31. Gblocks Server. Version 0.91b. , Available from: http://molevol.cmima.csic.es/castresana/Gblocks_server.html (2002).
  32. Vitis vinifera cv. Corvina gene expression Atlas. , Available from: https://www.researchgate.net/publication/273383414_54sample_datamatrix_geneIDs_Fasoli2012 (2015).
  33. Multiple Experiment Viewer (MeV). Version 4.8.1. , Available from: http://mev.tm4.org/ (2017).
  34. Sequence Read Archive (SRA). , Available from: https://www.ncbi.nlm.nih.gov/sra (2017).
  35. Bolger, A. M., Lohse, M., Usadel, B. Trimmomatic: a flexible trimmer for Illumina sequence data. Bioinformatics. 30 (15), 2114-2120 (2014).
  36. Langmead, B., Salzberg, S. L. Fast gapped-read alignment with Bowtie 2. Nat Meth. 9 (4), 357-359 (2012).
  37. Anders, S., Pyl, P. T., Huber, W. HTSeq-a Python framework to work with high-throughput sequencing data. Bioinformatics. 31 (2), 166-169 (2015).
  38. R. Version 3.4.1. , Available from: https://www.r-project.org/ (2017).
  39. Ritchie, M. E. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 43 (7), e47(2015).
  40. Love, M. I., Huber, W., Anders, S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biology. 15 (12), 550(2014).
  41. EMBL-EBI. EMBOSS Needle. , Available from: http://www.ebi.ac.uk/Tools/psa/emboss_needle/ (2017).
  42. Ariani, P. Genome-wide characterisation and expression profile of the grapevine ATL ubiquitin ligase family reveal biotic and abiotic stress-responsive and development-related members. Sci. Rep. 6, 38260(2016).
  43. Vitulo, N., et al. A deep survey of alternative splicing in grape reveals changes in the splicing machinery related to tissue, stress condition and genotype. BMC Plant Biol. 14 (1), 99(2014).
  44. Overbeek, R., Fonstein, M., D'Souza, M., Pusch, G. D., Maltsev, N. The use of gene clusters to infer functional coupling. Proc. Natl. Acad. Sci. USA. 96 (6), 2896-2901 (1999).
  45. Dalquen, D. A., Dessimoz, C. Bidirectional Best Hits Miss Many Orthologs in Duplication-Rich Clades such as Plants and Animals. Genome Biol. Evol. 5 (10), 1800-1806 (2013).
  46. Remm, M., Storm, C. E. V., Sonnhammer, E. L. L. Automatic clustering of orthologs and in-paralogs from pairwise species comparisons1. J. Mol. Biol. 314 (5), 1041-1052 (2001).
  47. Kaduk, M., Sonnhammer, E. Improved orthology inference with Hieranoid 2. Bioinformatics. 33 (8), (2017).
  48. Cramer, G. R., et al. Transcriptomic analysis of the late stages of grapevine (Vitis vinifera cv. Cabernet Sauvignon) berry ripening reveals significant induction of ethylene signaling and flavor pathways in the skin. BMC Plant Biol. 14, 370(2014).
  49. Juretic, N., Hoen, D. R., Huynh, M. L., Harrison, P. M., Bureau, T. E. The evolutionary fate of MULE-mediated duplications of host gene fragments in rice. Genome Res. 15 (9), 1292-1297 (2005).
  50. Filichkin, S. A. Genome-wide mapping of alternative splicing in Arabidopsis thaliana. Genome Res. 20 (1), 45-58 (2010).
  51. Quesada, V., Macknight, R., Dean, C., Simpson, G. G. Autoregulation of FCA pre-mRNA processing controls Arabidopsis flowering time. EMBO J. 22 (12), 3142-3152 (2003).
  52. Wong, D. C. J., Gutierrez, R. L., Gambetta, G. A., Castellarin, S. D. Genome-wide analysis of cis-regulatory element structure and discovery of motif-driven gene co-expression networks in grapevine. DNA Res. 24 (3), 311-326 (2017).
  53. Wong, D. C. J., Matus, J. T. Constructing Integrated Networks for Identifying New Secondary Metabolic Pathway Regulators in Grapevine: Recent Applications and Future Opportunities. Front. Plant Sci. 8, 505(2017).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

基因家族表征系统发育树构建蛋白质基序分析基因表达谱分析PSI-BLAST分析MUSCLE比对层级双聚类分析葡萄基因组