2017年12月22日
本文介绍了一个基因家族的鉴定和描述的程序, 适用于在 Levadura 的家庭的葡萄Tóxicos 的拟南芥(ATL) E3 泛素酶。
该程序的总体目标是以整体方法对植物中的基因家族进行详尽的表征,包括基因结构的定义、相关的蛋白质基序、染色体位置、基因重复和表达模式。这种方法可以帮助回答科中植物分类中的关键问题,例如科成员的世界基因组鉴定,他们的转录学通过基因表达分析提供了这一点。整个程序的主要优点是提供了详尽的实验步骤列表,以实现完整的基因家族表征。
该程序可应用于有遗传数据的任何植物物种的任何基因家族。此外,这种方法为确定功能研究的有趣候选者提供了有价值的信息。演示整个过程的是我实验室的 Pietro Ariani。
打开 Blast 网页,然后单击 protein blast 部分。在 enter query sequence 字段中,输入将用作探针以识别其他家族成员的蛋白质的氨基酸序列。使用具有该家族特征的所有重要特征的蛋白质。
接下来,在字段中选择 search set(搜索集),选择参考蛋白质数据库和感兴趣的生物体。现在,在现场程序选择中,选择 PSI-BLAST 算法。如果需要,请单击 算法参数 以调整高级参数,例如最大目标序列和评分矩阵。
E 值是阈值,对于此搜索,该值从 005 降低到 001。单击 BLAST 按钮运行分析。从显示与查询相对匹配的所有序列中,取消选择明显不属于该系列的条目。
通过单击 select for PSI-BLAST 列中的勾号来执行此作。然后,通过单击 go 按钮运行第二次 PSI-BLAST 迭代。所有新识别的序列都将以黄色突出显示。
同样,取消选择不属于该系列的点击。继续此过程,直到算法找不到任何相关条目或达到收敛。清除所有假阳性后,将氨基酸序列收集到 FASTA 格式的文件中,并将文件上传到生物信息学软件套件中。
接下来,在列表中选择所有导入的序列,然后单击工具栏中的 align/assemble 按钮。然后单击 pairwise multiple alignment 并选择 MUSCLE alignment 和 OK。现在将使用默认值进行对齐。现在可视化比对的序列标志,并目视检查基因以搜索假阳性。
文本协议中描述了蛋白质物理参数和结构域、染色体分布、重复和外显子内含子组织的进一步分析。接下来,通过构建高质量的系统发育树和定义家系命名法来分析 ATL 家族成员之间的关系。首先,从 UmoProt 数据库中检索阿拉伯采用 systeliana ATL 序列,作为葡萄藤基因命名法的参考,以供参考。
然后制作一个 FASTA 文件,包括葡萄藤和拟南芥基因家族成员的所有核苷酸序列,用于系统发育分析。现在浏览 phylogeny France 主页并选择系统发育分析管道。在大多数情况下,一键式作是合适的,但如果需要,可以使用高级选项选择特定的高级设置,甚至可以使用点菜选项选择完全自定义的分析。
接下来,输入分析的名称并上传 FASTA 文件。然后单击 submit 以运行分析。如果此过程导致错误消息,请单独完成系统发育套件管道的每个步骤。
首先,转到 MUSCLE 软件主页并上传 FASTA 文件。选择 Pearson FASTA 作为输出格式并提交。接下来,下载 FASTA 格式的文件并消除任何对齐不良的位置。
打开 G 块服务器工具,上传比对 FASTA 文件,选择 DNA 作为序列类型,然后选择最适合分析的严格性。对于葡萄藤 ATL 基因家族比对,选择所有三个选项,因为序列差异大,因此选择不太严格的选择。然后单击 get blocks (获取块) 以运行分析。
要保存结果,请单击输出页面底部的结果对齐方式,然后创建一个新的 FASTA 文件。G 块消除了 DNA 发散区域中的不良对齐位置或刺激比对,使其更适合系统发育分析。对于此步骤,为列严格性选择简单的参数对于确保它们是这三者的责任至关重要。
为了完成树,我们转到 Phylogeny France 主页。在那里,选择 a la carte 管道并取消选择以下选项:multiple alignment 和 alignment curation。接下来,单击 create workflow(创建工作流程),上传 G 块精选的 FASTA 文件,选择引导程序,并使用默认参数和设置。
最后,单击 submit 以运行分析。这样就完成了分步过程。现在系统发育树已经制作完成,折叠 bootstrap 值小于 70% 的支撑不佳的分支,然后以 Newick 格式下载最终结果以进行进一步分析。
文本协议提供了根据系统发育分配基因名称的说明。对于此协议,制作一个点击的、行的、文本格式的文件,其中包含从基因表达库中获取的 arma 标准化表达值。在相同的模式行下组织每个家族基因的值。
接下来,使用 Multi-experiment Viewer 软件执行分层双聚类分析。首先,上传工作数据矩阵并选择文本文件。选择 single-color array 并在未提供自动注释时从 load annotation 中删除勾号。
选择表达式表预览的最左上角的表达式值,然后单击 load 按钮。接下来,调整数据,应用 Log2 转换和基因/行标准化。然后设置适当的缩放限制。
现在计算分层聚类。在 ordering optimization 字段中,选择 optimize gene leaf order 和 optimize sample leaf order。接下来,在 linkage method selection 字段中,选择 average linkage clustering,然后在距离矩阵选择 字段中选择 Pearson correlation。
然后单击 OK 运行分析。在窗口的左侧面板中查看结果,然后单击文件菜单中的保存图像导出热图。根据 BLAST-P 搜索,与拟南芥 ATL2 最相似的基因用于调查葡萄藤基因组中的 ATL 家族成员。
PSI BLAST 分析在几个周期后收敛,提供了基因家族中推定的基因列表。通过目视检查肌肉对齐来评估每个候选者经典环 H2 结构域的存在。这将搜索范围缩小到 96 个葡萄藤基因。
对已鉴定的基因进行系统发育分析,将它们与拟南芥 ATL 基因家族进行比较,用于命名。96 个葡萄藤 ATL 中有 13 个获得了作为拟南芥 ATL 基因直系同源物的特定标识符。使用分层双聚类分析将鉴定的基因映射到葡萄藤全球基因表达图谱,表明所有 96 个基因都至少在一个组织中表达,并且可以识别出 5 个表达簇。
采用类似的方法来研究这些基因响应生物胁迫的表达。ATL 基因家族直接参与响应病原体感染,62 个基因在至少两种情况下显示出显着调节。看完这个视频,你应该对如何处理用于表征基因家族的软件有了很好的了解。
在尝试此过程时,重要的是要仔细定义给定基因家族的特征以及用于全基因组家族成员鉴定的相应探针。按照这个程序,可以通过基于基因家族命名法归属所需物种以外的一些物种制作额外的系统发育树来研究基因家族进化和 P30 功能。
查看完整文字稿并访问数千部科学视频
本文描述了一种用于葡萄藤基因家族识别和特征分析的程序,特别关注阿拉伯芥毒素在酵母中(ATL)E3泛素连接酶。该方法旨在全面理解基因结构、蛋白质基序、染色体位置、基因重复和表达模式。
Genome-wide identification and meta-analysis of gene families, such as ATL E3 ubiquitin ligases in grapevine, enable systematic target validation and mechanistic de-risking in plant biotechnology pipelines. This workflow supports predictive confidence in functional genomics, informing candidate prioritization for trait engineering and stress adaptation studies. The approach is broadly applicable to any plant species with genomic data, enhancing portfolio decision-making in agricultural R&D.
This workflow integrates from early discovery through lead identification and preclinical trait validation in plant biotechnology pipelines.