结合基因组学、共表达基因分析以及通过代谢途径鉴定靶向化合物,可实现基因功能注释。
结合基因组学、共表达基因分析以及通过代谢途径鉴定靶向化合物,可实现基因功能注释。
随着已完成全基因组测序的模式植物种类不断增加,以及基因敲除突变体、野生种质资源和高级育种群体等生物资源的日益丰富,基因功能注释的负担日益加重。本实验方案提供了一种结合共表达基因分析、代谢组学和生物信息学手段进行植物基因功能注释的方法(图1)。该方法基于利用已知功能的靶基因,识别可能参与特定代谢过程的未注释基因,并通过代谢组学技术鉴定相应的靶向代谢物。尽管正向遗传学和反向遗传学所构建的群体在应用中均存在挑战,本文仍提出了针对这两类群体的数据应用策略。此外,该方法还可用于表征在特定组织、植物种类或胁迫处理条件下出现的未知代谢峰,从而鉴定新的或特异性的次生代谢物,这目前是深入理解植物代谢途径的重要研究方向。
1. 样品制备
2. 代谢物谱分析的提取
3. 基于液相色谱-质谱的代谢物分析
4. 数据分析
5. 代谢通路预测
6. 准备拟南芥同源基因ID的基因列表
7. 共表达基因分析
8. 整合全部信息以预测新通路
9. 利用生物资源进行基因鉴定的实验
10. 代表性结果
本方案中所述的整合分析流程具有多种可能性,具体取决于实验目的以及生物学与分析方法的组合选择。实验步骤的选择和实验设计应根据目标通路、化合物及植物种类进行合理确定。本方案所描述的整合策略主要聚焦于植物基因功能的注释以及利用多种生物资源和数据资源高效发现新的基因功能。预期结果仅在具备充分证据支持时才能得出明确的预测结论。这一事实表明,如果组合分析无法提供足够的证据,则不应启动实验。因此,在任何情况下,额外的预实验(例如通过RT-PCR进行靶向基因表达谱分析)均可支持对基因功能的预测。预测的准确性与正确性与组合方式中定性差异的显著程度及变异组合的数量呈正相关。此外,只有基于对代谢通路的准确预测,才能获得优良的候选基因和有效的研究结果。峰的注释应结合多种方法进行,例如文献调研、参照植物提取物比对、MSn分析、器官特异性分析以及突变体分析13。

图1. 通过整合方法进行基因注释的实验流程概述。 在某些情况下,研究项目始于在特定条件或组织中检测到一种新峰,并希望了解其在代谢过程中的作用。在其他情况下,项目的目的则是基因鉴定或发现关键调控因子,例如转录因子。实验设计应基于能够显示目标代谢通路中代谢物水平存在明显差异的数据集,通过采集来自不同器官的多种组织样本,或对不同生长条件下的植物、或经受胁迫处理的植物进行代谢物谱型分析。突变体植物、转基因植物以及含有数量性状位点(QTL)的育种材料也均适合作为这些研究的遗传材料。对新代谢通路的预测应谨慎进行,需结合准确的峰注释以及多种代谢表型数据的整合分析,例如根据目标通路相关基因表达数据所获得的器官特异性及胁迫响应信息。最后一步应进行代谢物与转录本的谱型分析,当这些数据与先前结果相结合时,将最终 计算机模拟 网络资源分析与基因表达的体外表征 通过 异源表达,有助于确认候选基因并阐明其在代谢通路中的功能与位置。缩写:QTL,数量性状位点。

图2. 峰标注的组合方法工作流程。 通过标准化合物进行峰鉴定与标注的流程,包括野生型与敲除突变体的比较,以及参照数据库中纯净化合物质谱数据对目标峰进行多维质谱分析12。缩写:DB,数据库;KO,敲除;1-D,一维;2-D,二维;NMR,核磁共振;IR,红外;MSn,多级质谱。

图3. 花青素合成通路共调控网络分析示例。 基于 ATTEDII 第3版数据集8,2,使用 PRIMe 平台(http://prime.psc.riken.jp/?action=coexpression_index)进行共表达分析,并利用 Pajek 程序(http://vlado.fmf.uni-lj.si/pub/networks/pajek/)构建网络图。网络连接基于正相关关系(r<0.5)建立。红色节点:12个花青素合成相关的酶基因(At5g13930,CHS,TT4,查尔酮合酶;At3g55120,CHI,TT5,查尔酮异构酶;At3g51240,F3H,TT6,黄烷酮3-羟化酶;At5g07990,F3'H,TT7,类黄酮3'-羟化酶;At5g17050,Fd3GT,UGT78D2,类黄酮3-O-葡萄糖基转移酶;At5g17220,AtGSTF12,TT19;At5g42800,DFR,TT3,二氢类黄酮还原酶;At4g22880,ANS/LDOX,TT18,花青素合酶;At4g14090,A5GT,花青素5-O-葡萄糖基转移酶;At5g54060,A3G2"XT,推测的花青素3-O-葡萄糖苷2"-O-木糖基转移酶;At3g29590,A5GMaT,花青素5-O-葡萄糖苷6'''-O-丙二酰转移酶;At1g03940,A3GCouT,花青素3-O-葡萄糖苷6"-O-p-香豆酰转移酶)以及两个调控花青素合成的转录因子(At1g56650,PAP1;At1g66390,PAP2),以上共14个基因用于候选基因的搜索。通过“集合交集”方法,以相关系数 r>0.50 为阈值,对所有查询基因(即上述14个花青素生物合成基因)进行检索,获得候选基因。随后,利用 PRIMe 数据库,通过“集合互连”方法(r>0.50)重构包含相关候选基因(68个基因)和查询基因(14个基因)的共表达网络。从 PRIMe 数据库导出的“.net”格式文件被用于在 Pajek 软件中绘制网络图。蓝色节点表示与花青素合成基因具有相关性的候选基因。
| 物种 | 主要次生代谢产物 |
| Arabidopsis thaliana | 芥子油苷、黄酮醇、花青素、芥子酰衍生物 |
| Populus trichocarpa | 黄酮醇、花青素、水杨酸衍生物 |
| Vitis vinifera | 黄酮醇、花青素、单宁、芪类化合物 |
| Solanum lycopersicum | 黄酮醇、花青素、糖苷生物碱、氯原酸相关化合物 |
| Nicotiana tabacum | 黄酮醇、花青素、烟酰胺、氯原酸相关化合物、酰基糖 |
| Oryza sativa | 糖基化黄酮、花青素、甾醇衍生物 |
| Zea may | 糖基化黄酮、花青素、苯并恶嗪酮、甾醇衍生物 |
| Medicago truncatula | 异黄酮、花青素、皂苷 |
| Lotus japonica | 异黄酮、黄酮醇、花青素、皂苷 |
表 I. 模式植物物种中的主要次生代谢产物。
| 共表达数据库 | 网址 |
| 植物跨物种 | |
| COP | http://webs2.kazusa.or.jp/kagiana/cop0911/ |
| PlaNet | http://aranet.mpimp-golm.mpg.de/ |
| 植物物种 | |
| ATEED-II | http://atted.jp/ |
| BAR | http://142.150.214.117/welcome.htm |
| COP | http://webs2.kazusa.or.jp/kagiana/cop |
| GeneCAT | http://genecat.mpg.de/ |
| 拟南芥 | |
| ACT | http://www.arabidopsis.leeds.ac.uk/act/coexpanalyser |
| AthCoR@CSB.DB | http://csbdb.mpimp-golm.mpg.de/csbdb/dbcor/ath.html |
| CressExpress | http://cressexpress.org/ |
| PRIMe | http://prime.psc.riken.jp/?action=coexpression_index |
| Oryza sativa | |
| RiceArrayNet | http://arraynet.mju.ac.kr/arraynet/ |
| 水稻阵列数据库 | http://www.ricearray.org/coexpression/coexpression.shtml |
表 II. 用于in silico 共表达分析的可用基因表达数据库。
由于转录组学和代谢组学技术已应用多年,利用代谢组学辅助基因注释的数据整合过程通常始于鉴定代表未知代谢物的新峰。这一事实引出了下一阶段,即评估代谢物峰的定量变异,或评估被认为负责其生物合成的候选新基因。然而,本方案中描述的策略存在三个主要问题:i)峰注释困难,ii)通路预测复杂,iii)基因信息的分辨率及基因表达数据的质量。针对第一个问题,应通过标准化合物共洗脱或结合多种方法进行峰注释,这些方法包括MSn分析、参考提取物、突变体分析、代谢物数据库检索以及文献调研(图2,12)。对于第二个问题,通路预测只能在正确完成峰注释的基础上实现。然而,组织特异性的代谢物谱分析也可辅助峰注释,因为代谢物的积累应与相关基因的表达相一致。因此,不同组织和生长条件下的联合代谢谱分析有助于解决这一问题。第三个问题即基因信息的分辨率,取决于测序数据的发展程度。对于尚未完成基因组测序的模式植物,利用其他模式植物中的直系同源基因进行共表达分析是有效的。氨基酸序列的详细比对及系统发育树分析有助于将模式生物的研究结果拓展至其他物种。
该实验方案适用于所有代谢过程。在中间代谢和次级代谢的分析中效率最高,这些代谢过程已被充分表征为受到强烈的转录调控1,5,11,16。在一些实例中,共表达分析已成功应用于硫同化、β-氧化相关基因、支链氨基酸降解、叶绿素降解以及赖氨酸分解代谢3、细胞壁代谢10,7以及光信号级联反应14。通过整合基因组学、代谢组学和生物信息学进行基因功能注释,不仅有助于鉴定生物合成基因和转录因子的直接调控因子,也有助于理解生理过程和响应机制(参见示例图3.14)。
为了将该方法从模式植物拓展到作物物种,对不同植物物种进行代谢比较是研究某些普遍代谢途径的有力手段。例如,若在不同植物物种中检测到相同的化合物,并且在这些植物物种中发现了某些直系同源基因,则利用直系同源基因进行跨物种共表达分析可为您的预测提供有力支持。该方法可用于拟南芥、杨树、苜蓿,以及大麦、水稻、小麦和大豆等重要作物,通过植物物种间的共表达分析实现(6,PlaNet:http://aranet.mpimp-golm.mpg.de/;9,COP:http://webs2.kazusa.or.jp/kagiana/cop0911/;参见示例15)。
未声明任何利益冲突。
感谢理化学研究所生命医科学研究中心(RIKEN PSC)的Kazuki Saito教授和马克斯·普朗克分子植物生理研究所(MPIMP)的Bjoern Usadel博士提供的有益讨论。TT由亚历山大·冯·洪堡基金会的奖学金资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 质谱级超纯水 | BIOSOLVE | 23214102 | |
| 乙腈(ACN),质谱级 | BIOSOLVE | 01204102 | |
| 甲醇(MeOH),质谱级 | BIOSOLVE | 13684102 | |
| 液相色谱用甲酸(HCOOH),质谱级 | BIOSOLVE | 06914131 | |
| 标准化合物 | EXTRASYNTHESE | ||
| 线性离子阱(IT)电喷雾电离质谱系统 FINNIGAN-LTQ | Thermo Fisher Scientific, Inc. | ||
| HPLC 系统 Surveyor | Thermo Fisher Scientific, Inc. | ||
| 分析柱 Luna C18(2),直径 2.0 mm,长度 150 mm,孔径 100 Å,球形颗粒,粒径 3 mm | Phenomenex | 00F-4251-B0 | |
| Xcalibur 软件 | Thermo Fisher Scientific, Inc. |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可