方法文章

通过整合基因组学、代谢组学与生物信息学注释植物基因功能

23.3K 次观看

DOI:

10.3791/3487

2012年6月17日

本文内容

摘要

结合基因组学、共表达基因分析以及通过代谢途径鉴定靶向化合物,可实现基因功能注释。

摘要

随着已完成全基因组测序的模式植物种类不断增加,以及基因敲除突变体、野生种质资源和高级育种群体等生物资源的日益丰富,基因功能注释的负担日益加重。本实验方案提供了一种结合共表达基因分析、代谢组学和生物信息学手段进行植物基因功能注释的方法(图1)。该方法基于利用已知功能的靶基因,识别可能参与特定代谢过程的未注释基因,并通过代谢组学技术鉴定相应的靶向代谢物。尽管正向遗传学和反向遗传学所构建的群体在应用中均存在挑战,本文仍提出了针对这两类群体的数据应用策略。此外,该方法还可用于表征在特定组织、植物种类或胁迫处理条件下出现的未知代谢峰,从而鉴定新的或特异性的次生代谢物,这目前是深入理解植物代谢途径的重要研究方向。

方案

1. 样品制备

  1. 采集植物材料后立即进行冷冻。
  2. 将冷冻的植物材料使用混合研磨仪(或研钵)研磨成粉末,并分装至Falcon管或Eppendorf管中,于-80 °C保存。

2. 代谢物谱分析的提取

  1. 将冷冻的植物材料分装至2 ml Eppendorf管中。
  2. 每毫克冷冻植物材料的鲜重加入5 μl提取缓冲液。
  3. 加入一个金属(或氧化锆)研磨珠,使用混匀研磨仪在25 l s-1条件下对冷冻粉末进行2分钟的匀浆处理。
  4. 以12,000 rpm离心10分钟。
  5. 将上清液转移至NANOSEP离心过滤器中。
  6. 以4,000 rpm离心2分钟。
  7. 将上清液转移至新的Eppendorf管中,于-20 °C保存直至使用。

3. 基于液相色谱-质谱的代谢物分析

  1. 安装高效液相色谱仪,并检查色谱柱温箱和样品托盘的温度。
  2. 设置质谱条件,并检查真空状态和加热毛细管的工作情况。
  3. 对质谱检测器进行 m/z 校准。
  4. 将 50 μl 提取物转移至玻璃小瓶,用于液相色谱-质谱分析。
  5. 向液相色谱-质谱系统注入 5 μl 提取物。

4. 数据分析

  1. 配置 Xcalibur 或 Metalign 4,并选择待处理的数据分析。
  2. 根据表 I中的化合物类别,整理目标检测峰的表格。
  3. 通过标准化合物的共洗脱来鉴定峰。
  4. 利用 MS2 分析、文献调研及代谢物数据库检索对检测到的峰进行注释(图 212,13)。

5. 代谢通路预测

  1. 利用检测到的化合物构建可能的代谢通路。基于检测化合物的化学结构,通过预测代谢通路上连接的酶促功能来推测通路,此过程应以峰注释为基础13。生物合成步骤的构建需依赖精确的峰注释。但在此阶段,确定详细的化学结构(例如糖基部分)并非必需,因为通过质谱分析鉴定糖基类型及加合位置极为困难。糖基类型(如己糖苷或戊糖苷)的确定可在项目最后一步通过糖供体的酶学分析来完成。通常情况下,通路预测的构建应基于小分子作为大分子中间体的原则,脱水反应等少数情况除外。掌握常见分子质量差值列表有助于通路预测,例如 -H 与 -OH 基团之间的质量差为 16 m/z(氧化),-OH 与 -OMe 之间的质量差为 14 m/z(碳原子,甲基化),己糖(糖基化)的质量差为 162 m/z(分子量减去 H2O)。结合组织特异性的相关性分析来确定修饰类型,有助于代谢通路的预测。通用代谢通路数据库,如 KEGG 数据库(http://www.genome.jp/kegg/)和 PlantCyc(http://plantcyc.org/),对目标代谢通路的预测非常有效。

6. 准备拟南芥同源基因ID的基因列表

  1. 从基因组数据库下载基因 ID 列表。
  2. 若目标植物不是拟南芥,则添加该同源基因对应的拟南芥基因 ID。
  3. 准备一份目标通路中的基因列表。拟南芥通路注释数据及基因家族数据可在 TAIR 网站获取(http://www.arabidopsis.org/)。若已准备拟南芥同源基因列表,可进一步进行整合。

7. 共表达基因分析

  1. 使用准备好的基因ID列表,通过检测目标通路中已知基因对的相关性(表 II),测试并选择最适合的数据库。若目标植物中无可用的共表达数据库或基因表达数据库,应使用拟南芥共表达数据库,并辅以拟南芥直系同源基因列表。对于大麦、水稻、杨树、小麦、苜蓿和大豆,可直接利用相应植物物种的共表达分析(表 II)。
  2. 基于目标通路中已知基因之间的相互关系,构建目标共表达网络的框架。
  3. 添加相关候选基因(r<0.4~0.90,其相关系数值范围接近目标通路中已知基因间连接的相关系数),并检查这些基因在其预测基因家族中的功能注释,以评估其在网络连接中的作用,从而筛选最优候选基因(图 3)。相关系数阈值应根据网络结构及候选基因的密度进行适当调整。
  4. 列出可被进一步缩小范围、可能特异参与目标通路的基因列表。
  5. 检测候选基因在不同器官特异性及胁迫响应中的基因表达模式。

8. 整合所有信息以预测新通路

  1. 将已知功能且已用于共表达分析查询的基因添加到预测的代谢通路中。
  2. 检查该通路中尚未明确的功能部分,例如未表征的酶促反应步骤、转运蛋白和转录因子。
  3. 为这些缺失的未表征步骤预测最合适的基因注释。
  4. 结合代谢物谱分析结果与基于预测通路的 in silico 基因表达候选基因数据。
  5. 根据基因功能将候选基因排列在预测的代谢通路上,例如乙酰转移酶对应乙酰化代谢物,糖基转移酶对应糖苷,P450 对应氧化化合物。对于P450和糖基转移酶等较大的基因家族,氨基酸序列的系统发育树分析具有重要参考价值。
  6. 验证候选基因的代谢物积累与基因表达水平在组织特异性或胁迫响应方面的一致性。
  7. 检查与其他代谢途径的关联,以确定底物供给及相关胁迫响应基因的连接情况。

9. 利用生物资源进行基因鉴定的实验

  1. 检查可用于辅助实验的生物资源,以促进候选基因的鉴定。
  2. 利用生物资源(如基因敲除突变体文库和全长cDNA文库)开展基因功能鉴定实验。针对预测中最有可能的候选基因,必须进行基因功能鉴定实验,包括过表达植株和基因敲除突变体的构建、酶活性测定以及启动子结合实验。由于重组蛋白制备和用于转化的基因克隆耗时较长,建议在利用基因敲除突变体确认代谢物谱后再进行重组蛋白性质表征实验及过表达植株的制备。

10. 代表性结果

本方案中所述的整合分析流程具有多种可能性,具体取决于特定的实验目的以及生物学与分析方法的组合选择。应根据目标通路、化合物及植物种类,合理选择实验步骤与实验设计。本方案所描述的整合策略聚焦于植物基因功能的注释以及利用多种生物与数据资源高效地发现新基因功能。预期结果有望提供具有结论性预测的案例。这一事实表明,如果组合分析无法提供充分的证据,则不应启动实验。因此,在任何情况下,开展额外的预实验(例如通过RT-PCR进行靶向基因表达谱分析)可为基因功能的预测提供支持。预测的准确性与正确性与组合分析中所呈现的定性差异及变异数量呈正相关。此外,只有基于对通路的准确预测,才能获得优良的候选基因和有效的研究结果。峰注释应通过多种方法结合进行,例如文献调研、参照植物提取物比对、MSn分析、器官特异性分析以及突变体分析13

基因功能分析流程图:共表达、代谢物谱型分析、通路预测
图1. 通过整合方法进行基因注释的实验流程概览。 在某些情况下,研究项目始于在特定条件或组织中检测到一种新峰,并希望了解其在代谢过程中的作用。在其他情况下,项目的目的可能是基因鉴定或发现关键调控因子(如转录因子)。实验设计应基于能够显示目标代谢通路中代谢物水平显著差异的数据集,利用来自不同器官的多种组织样本,以及不同生长条件下的植物或经受胁迫处理的植物,并对材料进行代谢物谱型分析。突变体、转基因植物以及含有数量性状位点(QTL)的育种材料也均适用于此类研究。预测新通路时应谨慎进行,需结合准确的峰注释,并整合不同类型的代谢型数据,例如器官特异性及对胁迫响应的数据,并依据目标通路相关基因的表达信息进行综合分析。最后一步应进行代谢物与转录谱型分析,当这些数据相互结合时,最终将 计算机模拟 网络资源分析与基因表达的体外表征 通过 异源表达,有助于确认候选基因并阐明其在代谢通路中的功能与位置。缩写:QTL,数量性状位点。

代谢组学分析示意图;峰检测/注释/鉴定过程,基因表达关联。
图 2. 峰注释组合方法的工作流程。 通过标准化合物进行峰鉴定与注释的流程,结合野生型与基因敲除突变体的比较,以及目标峰的多维质谱分析,并参考数据库中纯化合物的质谱数据12。缩写:DB,数据库;KO,基因敲除;1-D,一维;2-D,二维;NMR,核磁共振;IR,红外;MSn,多级质谱。

基因调控网络图;花青素和黄酮醇基因簇;遗传相互作用的可视化。
图3. 花青素通路共调控网络分析示例。 基于 ATTEDII 第3版数据集8,2,使用 PRIMe 平台(http://prime.psc.riken.jp/?action=coexpression_index)进行共表达分析,并利用 Pajek 程序(http://vlado.fmf.uni-lj.si/pub/networks/pajek/)绘制网络图。网络连接基于正相关关系(r<0.5)构建。红色节点:12个花青素合成相关的酶基因(At5g13930,CHS,TT4,查尔酮合酶;At3g55120,CHI,TT5,查尔酮异构酶;At3g51240,F3H,TT6,黄烷酮3-羟化酶;At5g07990,F3'H,TT7,黄酮类3'-羟化酶;At5g17050,Fd3GT,UGT78D2,黄酮类3-O-葡萄糖基转移酶;At5g17220,AtGSTF12TT19;At5g42800,DFR,TT3,二氢黄酮醇还原酶;At4g22880,ANS/LDOX,TT18,花青素合酶;At4g14090,A5GT,花青素5-O-葡萄糖基转移酶;At5g54060,A3G2"XT,推测的花青素3-O-葡萄糖苷2"-O-木糖基转移酶;At3g29590,A5GMaT,花青素5-O-葡萄糖苷6'''-O-丙二酰基转移酶;At1g03940,A3GCouT,花青素3-O-葡萄糖苷6"-O-p-香豆酰基转移酶)以及两个调控花青素合成的转录因子(At1g56650,PAP1;At1g66390,PAP2),以上共14个基因作为查询基因用于筛选候选基因。通过“集合交集”搜索方法,在所有查询基因(14个花青素生物合成基因)中设定相关系数阈值 r>0.50,筛选出候选基因。进一步采用“集合互连”搜索方法(r>0.50)基于 PRIMe 数据库重建共表达网络,该网络包含68个与花青素基因相关的候选基因和14个查询基因。网络图的输入文件由 PRIMe 数据库生成的“.net”格式文件提供,使用 Pajek 软件绘制网络图。蓝色节点表示与花青素基因具有相关性的候选基因。

物种主要次生代谢产物
Arabidopsis thaliana芥子油苷、黄酮醇、花青素、芥子酰衍生物
Populus trichocarpa黄酮醇、花青素、水杨酸衍生物
Vitis vinifera黄酮醇、花青素、单宁、芪类化合物
Solanum lycopersicum黄酮醇、花青素、糖苷生物碱、氯原酸相关化合物
Nicotiana tabacum黄酮醇、花青素、烟酰胺、氯原酸相关化合物、酰基糖
Oryza sativa糖基化黄酮、花青素、甾醇衍生物
Zea may糖基化黄酮、花青素、苯并噁嗪酮、甾醇衍生物
Medicago truncatula异黄酮、花青素、皂苷
Lotus japonica异黄酮、黄酮醇、花青素、皂苷

表 I. 模式植物物种中的主要次生代谢产物。

共表达数据库网址
跨物种植物 
COPhttp://webs2.kazusa.or.jp/kagiana/cop0911/
PlaNethttp://aranet.mpimp-golm.mpg.de/
植物物种 
ATEED-IIhttp://atted.jp/
BARhttp://142.150.214.117/welcome.htm
COPhttp://webs2.kazusa.or.jp/kagiana/cop
GeneCAThttp://genecat.mpg.de/
拟南芥 
ACThttp://www.arabidopsis.leeds.ac.uk/act/coexpanalyser
AthCoR@CSB.DBhttp://csbdb.mpimp-golm.mpg.de/csbdb/dbcor/ath.html
CressExpresshttp://cressexpress.org/
PRIMehttp://prime.psc.riken.jp/?action=coexpression_index
Oryza sativa  
RiceArrayNethttp://arraynet.mju.ac.kr/arraynet/
Rice Array Databasehttp://www.ricearray.org/coexpression/coexpression.shtml

表 II. 可用于in silico 共表达分析的基因表达数据库。

讨论

由于转录组学和代谢组学技术已应用多年,利用代谢组学辅助基因注释的数据整合过程通常始于鉴定代表未知代谢物的新峰。这一事实引出了下一阶段,即评估代谢物峰的定量变异,或评估被认为负责其生物合成的候选新基因。然而,本方案中描述的策略存在三个主要问题:i)峰注释困难,ii)通路预测复杂,iii)基因信息的分辨率及基因表达数据的质量。针对第一个问题,应通过标准化合物共洗脱或结合多种方法进行峰注释,这些方法包括MSn分析、参考提取物、突变体分析、代谢物数据库检索以及文献调研(图212)。对于第二个问题,通路预测只能在正确完成峰注释的基础上实现。然而,组织特异性的代谢物谱分析也可辅助峰注释,因为代谢物的积累应与相关基因的表达相一致。因此,不同组织和生长条件下的联合代谢谱分析有助于解决这一问题。第三个问题即基因信息的分辨率,取决于测序数据的发展程度。对于尚未完成基因组测序的模式植物,利用其他模式植物中的直系同源基因进行共表达分析是有效的。氨基酸序列的详细比对及系统发育树分析有助于将模式生物的研究结果拓展至其他物种。

该实验方案适用于所有代谢过程。在中间代谢和次级代谢的分析中效率最高,这些代谢过程已被充分表征为受到强烈的转录调控1,5,11,16。在一些实例中,共表达分析已成功应用于硫同化、β-氧化相关基因、支链氨基酸降解、叶绿素降解以及赖氨酸分解代谢3、细胞壁代谢10,7以及光信号级联反应14。通过整合基因组学、代谢组学和生物信息学进行基因功能注释,不仅有助于鉴定生物合成基因和转录因子的直接调控因子,也有助于理解生理过程和响应机制(参见示例图3.14)。

为了将该方法从模式植物拓展到作物物种,对不同植物物种进行代谢比较是研究某些普遍代谢途径的有力手段。例如,若在不同植物物种中检测到相同的化合物,并且在这些植物物种中发现了某些直系同源基因,则利用直系同源基因进行跨物种共表达分析可为您的预测提供有力支持。该方法可用于拟南芥、杨树、苜蓿,以及大麦、水稻、小麦和大豆等重要作物,通过植物物种间的共表达分析实现(6,PlaNet:http://aranet.mpimp-golm.mpg.de/9,COP:http://webs2.kazusa.or.jp/kagiana/cop0911/;参见示例15)。

披露

未声明任何利益冲突。

致谢

感谢理化学研究所生命医科学研究中心(RIKEN PSC)的Kazuki Saito教授和马克斯·普朗克分子植物生理研究所(MPIMP)的Bjoern Usadel博士提供的有益讨论。TT由亚历山大·冯·洪堡基金会的奖学金资助。

材料

本文使用的材料清单
姓名公司目录编号评论
质谱级超纯水BIOSOLVE23214102
乙腈(ACN),质谱级BIOSOLVE01204102
甲醇(MeOH),质谱级BIOSOLVE13684102
液相色谱用甲酸(HCOOH),质谱级BIOSOLVE06914131
标准化合物EXTRASYNTHESE
线性离子阱(IT)电喷雾电离质谱系统 FINNIGAN-LTQThermo Fisher Scientific, Inc.
HPLC 系统 SurveyorThermo Fisher Scientific, Inc.
分析柱 Luna C18(2),直径 2.0 mm,长度 150 mm,孔径 100 Å,球形颗粒,粒径 3 mmPhenomenex00F-4251-B0
Xcalibur 软件Thermo Fisher Scientific, Inc.

参考文献

  1. Aharoni, A., Keizer, L. C. P., Bouwmeester, H. J., Sun, Z. K., Alvarez-Huerta, M., Verhoeven, H. A., Blaas, J., van Houwelingen, A., De Vos, R. C. H., van der Voet, H. SAAT gene involved in strawberry flavor biogenesis by use of DNA microarrays. Plant Cell. 12, 647-661 (2000).
  2. Akiyama, K., Chikayama, E., Yuasa, H., Shimada, Y., Tohge, T., Shinozaki, K., Hirai, M. Y., Sakurai, T., Kikuchi, J., Saito, K. PRIMe: a Web site that assembles tools for metabolomics and transcriptomics. In Silico Biol. 8, 339-345 (2008).
  3. Araujo, W. L., Ishizaki, K., Nunes-Nesi, A., Larson, T. R., Tohge, T., Krahnert, I., Witt, S., Obata, T., Schauer, N., Graham, I. A., Leaver, C. J., Fernie, A. R. Identification of the 2-Hydroxyglutarate and Isovaleryl-CoA Dehydrogenases as Alternative Electron Donors Linking Lysine Catabolism to the Electron Transport Chain of Arabidopsis Mitochondria. Plant Cell. 22, 1549-1563 (2010).
  4. De Vos, R. C. H., Moco, S., Lommen, A., Keurentjes, J. J. B., Bino, R. J., Hall, R. D. Untargeted large-scale plant metabolomics using liquid chromatography coupled to mass spectrometry. Nat. Protoc. 2, (2007).
  5. Hirai, M. Y., Sugiyama, K., Sawada, Y., Tohge, T., Obayashi, T., Suzuki, A., Araki, R., Sakurai, N., Suzuki, H., Aoki, K., Goda, H., Nishizawa, O. I., Shibata, D., Saito, K. Omics-based identification of Arabidopsis Myb transcription factors regulating aliphatic glucosinolate biosynthesis. Proceedings of the National Academy of Sciences of the United States of America. 104, 6478-6483 (2007).
  6. Mutwil, M., Klie, S., Tohge, T., Giorgi, F. M., Wilkins, O., Campbell, M. M., Fernie, A. R., Usadel, B., Nikoloski, Z., Persson, S. PlaNet: Combined Sequence and Expression Comparisons across Plant Networks Derived from Seven Species. Plant Cell. 23, 895-910 (2011).
  7. Mutwil, M., Ruprecht, C., Giorgi, F. M., Bringmann, M., Usadel, B., Persson, S. Transcriptional Wiring of Cell Wall-Related Genes in Arabidopsis. Molecular Plant. 2, 1015-1024 (2009).
  8. Obayashi, T., Kinoshita, K., Nakai, K., Shibaoka, M., Hayashi, S., Saeki, M., Shibata, D., Saito, K., Ohta, H. ATTED-II: a database of co-expressed genes and cis elements for identifying co-regulated gene groups in Arabidopsis. Nucleic Acids Research. 35, D863-D869 (2007).
  9. Ogata, Y., Suzuki, H., Sakurai, N., Shibata, D. CoP: a database for characterizing co-expressed gene modules with biological information in plants. Bioinformatics. 26, 1267-1268 (2010).
  10. Persson, S., Wei, H. R., Milne, J., Page, G. P., Somerville, C. R. Identification of genes required for cellulose synthesis by regression analysis of public microarray data sets. Proceedings of the National Academy of Sciences of the United States of America. 102, 8633-8638 (2005).
  11. Tohge, T., Yonekura-Sakakibara, K., Niida, R., Watanabe-Takahashi, A., Saito, K. Phytochemical genomics in Arabidopsis thaliana: A case study for functional identification of flavonoid biosynthesis genes. Pure and Applied Chemistry. 79, 811-823 (2007).
  12. Tohge, T., Fernie, A. R. Web-based resources for mass-spectrometry-based metabolomics: A user's guide. Phytochemistry. 70, 450-456 (2009).
  13. Tohge, T., Fernie, A. R. Combining genetic diversity, informatics and metabolomics to facilitate annotation of plant gene function. Nature Protocols. 5, 1210-1227 (2010).
  14. Tohge, T., Kusano, M., Fukushima, A., Saito, K., Fernie, A. R. Transcriptional and metabolic programs following exposure of plants to UV-B irradiation. Plant Signal Behav. 6, Forthcoming (2011).
  15. Tohge, T., Ramos, M. S., Nunes-Nesi, A., Mutwil, M., Giavalisco, P., Steinhauser, D., Schellenberg, M., Willmitzer, L., Persson, S., Martinoia, E., Fernie, A. R. Towards the storage metabolome: profiling the barley vacuole. Plant Physiol. , (2011).
  16. Yonekura-Sakakibara, K., Tohge, T., Matsuda, F., Nakabayashi, R., Takayama, H., Niida, R., Watanabe-Takahashi, A., Inoue, E., Saito, K. Comprehensive flavonol profiling and transcriptome coexpression analysis leading to decoding gene-metabolite correlations in Arabidopsis. Plant Cell. 20, 2160-2176 (2008).

重印与许可

标签

基因注释共表达分析代谢物分析代谢通路植物代谢组学基因敲除突变体高效液相色谱分析质谱分析直系同源基因鉴定通路预测