方法文章

通过整合基因组学、代谢组学与生物信息学注释植物基因功能

23.3K 次观看

DOI:

10.3791/3487

2012年6月17日

本文内容

摘要

结合基因组学、共表达基因分析以及通过代谢途径鉴定靶向化合物,可实现基因功能注释。

摘要

随着已完成全基因组测序的模式植物种类不断增加,以及基因敲除突变体、野生种质资源和高级育种群体等生物资源的日益丰富,基因功能注释的负担日益加重。本实验方案提供了一种结合共表达基因分析、代谢组学和生物信息学手段进行植物基因功能注释的方法(图1)。该方法基于利用已知功能的靶基因,识别可能参与特定代谢过程的未注释基因,并通过代谢组学技术鉴定相应的靶向代谢物。尽管正向遗传学和反向遗传学所构建的群体在应用中均存在挑战,本文仍提出了针对这两类群体的数据应用策略。此外,该方法还可用于表征在特定组织、植物种类或胁迫处理条件下出现的未知代谢峰,从而鉴定新的或特异性的次生代谢物,这目前是深入理解植物代谢途径的重要研究方向。

方案

1. 样品制备

  1. 采集植物材料后立即进行冷冻。
  2. 将冷冻的植物材料使用混合球磨机(或研钵)研磨成粉末,并分装至Falcon管或Eppendorf管中,于-80 °C保存。

2. 代谢物谱分析的提取

  1. 将冷冻的植物材料分装至2 ml Eppendorf离心管中。
  2. 根据冷冻植物材料的鲜重,每毫克加入5 μl提取缓冲液。
  3. 加入一个金属(或氧化锆)研磨珠,使用混合研磨仪在25 l s-1条件下均质化冷冻粉末2分钟。
  4. 在12,000 rpm下离心10分钟。
  5. 将上清液转移至NANOSEP离心过滤器中。
  6. 在4,000 rpm下离心2分钟。
  7. 将上清液转移至新的Eppendorf离心管中,于-20 °C保存备用。

3. 基于液相色谱-质谱的代谢物分析

  1. 设置高效液相色谱仪,并检查色谱柱温箱和样品托盘的温度。
  2. 设置质谱条件,并检查真空状态和加热毛细管的工作情况。
  3. 对质谱检测器进行 m/z 校准。
  4. 将 50 μl 提取物转移至玻璃小瓶,用于液相色谱-质谱分析。
  5. 向液相色谱-质谱系统中注入 5 μl 提取物。

4. 数据分析

  1. 配置 Xcalibur 或 Metalign 4,并选择待处理的数据分析。
  2. 根据表 I中的化合物类别,整理出感兴趣检测峰的表格。
  3. 通过标准化合物的共洗脱来鉴定峰。
  4. 利用 MS2 分析、文献调研和代谢物数据库检索对检测到的峰进行注释(图 212,13)。

5. 代谢通路预测

  1. 利用检测到的化合物构建可能的代谢通路。基于检测化合物的化学结构,通过预测代谢通路上的连接酶功能,对通路进行峰注释预测。 13应以精确的峰标注来进行生物合成步骤的构建。然而,在此步骤中确定详细的化学结构(例如糖基部分)并非必需,因为通过质谱分析难以准确鉴定糖基类型及其加合位置。糖基类型(如己糖苷和戊糖苷)的确定将在项目最后一步通过糖供体的酶学分析来完成。通常情况下,通路预测的构建应基于小分子作为大分子中间体的原则,仅在少数情况下(如脱水反应)例外。原子分子量列表,例如16 m/z 对于-H与-OH基团(氧化)之间的差异,14 m/z (碳原子)用于区分 -OH 与 -OMe(甲基化)以及 162 m/z (MW-H2O)用于己糖(糖基化)的预测具有帮助作用。通过组织特异性的相关性分析来确定修饰类型,有助于代谢通路的预测。通用代谢通路数据库,例如 KEGG 数据库(http://www.genome.jp/kegg/)和 PlantCyc(http://plantcyc.org/),对预测您感兴趣的代谢通路非常有效。

6. 准备拟南芥同源基因ID的基因列表

  1. 从基因组数据库下载基因ID列表。
  2. 如果目标植物不是拟南芥,则添加该同源基因对应的拟南芥基因ID。
  3. 准备您所关注通路中的基因列表。拟南芥的通路注释数据和基因家族数据可在TAIR网站获取(http://www.arabidopsis.org/)。如果您已准备了拟南芥同源基因列表,则可随后将其合并。

7. 共表达基因分析

  1. 使用准备好的基因 ID 列表,通过检查目标通路中已知基因对的相关性(表 II),测试并选择最适合的数据库。如果目标植物中没有可用的共表达数据库或基因表达数据库,应使用拟南芥共表达数据库,并结合拟南芥直系同源基因列表进行分析。对于大麦、水稻、杨树、小麦、苜蓿和大豆,可直接使用相应植物物种的共表达分析(表 II)。
  2. 根据目标通路中已知基因之间的连接关系,构建目标共表达网络的基本框架。
  3. 添加具有相关性的候选基因(r<0.4~0.90,其相关系数值接近目标通路中已知基因间连接的相关系数范围),并检查这些候选基因在其预测基因家族中的注释信息,将其连接至该网络,以筛选最优候选基因(图 3)。相关系数阈值应根据网络结构及候选基因的密度进行适当调整。
  4. 列出可被进一步缩小范围、可能特异性参与目标通路的基因列表。
  5. 分析候选基因在不同器官中的特异性表达及其对各种胁迫响应的表达模式。

8. 整合全部信息以预测新通路

  1. 将已用于共表达分析查询的、特征明确的基因添加到预测的代谢通路中。
  2. 检查该通路中尚未明确的功能部分,例如功能未知的酶促步骤、转运蛋白和转录因子。
  3. 预测这些缺失且未表征步骤中最合适的基因注释。
  4. 结合代谢物谱分析结果与基于预测通路的in silico基因表达候选基因数据。
  5. 根据基因功能将候选基因排列在预测的代谢通路上,例如乙酰转移酶对应乙酰化代谢物,糖基转移酶对应糖苷,P450对应氧化化合物。对于P450和糖基转移酶等较大的基因家族,氨基酸序列的系统发育树分析具有重要参考价值。
  6. 验证候选基因的代谢物积累模式与其基因表达水平在组织特异性或胁迫响应方面的一致性。
  7. 检查该通路与其他代谢途径的关联,以确认底物供给及相关胁迫响应基因的连接情况。

9. 利用生物资源进行基因鉴定的实验

  1. 检查可用于辅助实验的生物资源,以促进候选基因的鉴定。
  2. 利用生物资源(如基因敲除突变体文库和全长cDNA文库)开展基因功能鉴定实验。针对预测中最有可能的候选基因,必须进行过表达植株和基因敲除突变体的构建、酶活性测定以及启动子结合实验,以实现基因功能的验证。重组蛋白实验用于表征蛋白特性,以及构建过表达植株,建议在利用基因敲除突变体确认代谢物谱型之后再进行,因为重组蛋白制备和用于转化的基因克隆耗时较长。

10. 代表性结果

本方案中所述的整合分析流程具有多种可能性,具体取决于实验目的以及生物学与分析方法的组合选择。实验步骤的选择和实验设计应根据目标通路、化合物及植物种类进行合理确定。本方案所描述的整合策略主要聚焦于植物基因功能的注释以及利用多种生物资源和数据资源高效发现新的基因功能。预期结果仅在具备充分证据支持时才能得出明确的预测结论。这一事实表明,如果组合分析无法提供足够的证据,则不应启动实验。因此,在任何情况下,额外的预实验(例如通过RT-PCR进行靶向基因表达谱分析)均可支持对基因功能的预测。预测的准确性与正确性与组合方式中定性差异的显著程度及变异组合的数量呈正相关。此外,只有基于对代谢通路的准确预测,才能获得优良的候选基因和有效的研究结果。峰的注释应结合多种方法进行,例如文献调研、参照植物提取物比对、MSn分析、器官特异性分析以及突变体分析13

figure-protocol-1
图1. 通过整合方法进行基因注释的实验流程概述。 在某些情况下,研究项目始于在特定条件或组织中检测到一种新峰,并希望了解其在代谢过程中的作用。在其他情况下,项目的目的则是基因鉴定或发现关键调控因子,例如转录因子。实验设计应基于能够显示目标代谢通路中代谢物水平存在明显差异的数据集,通过采集来自不同器官的多种组织样本,或对不同生长条件下的植物、或经受胁迫处理的植物进行代谢物谱型分析。突变体植物、转基因植物以及含有数量性状位点(QTL)的育种材料也均适合作为这些研究的遗传材料。对新代谢通路的预测应谨慎进行,需结合准确的峰注释以及多种代谢表型数据的整合分析,例如根据目标通路相关基因表达数据所获得的器官特异性及胁迫响应信息。最后一步应进行代谢物与转录本的谱型分析,当这些数据与先前结果相结合时,将最终 计算机模拟 网络资源分析与基因表达的体外表征 通过 异源表达,有助于确认候选基因并阐明其在代谢通路中的功能与位置。缩写:QTL,数量性状位点。

figure-protocol-2
图2. 峰标注的组合方法工作流程。 通过标准化合物进行峰鉴定与标注的流程,包括野生型与敲除突变体的比较,以及参照数据库中纯净化合物质谱数据对目标峰进行多维质谱分析12。缩写:DB,数据库;KO,敲除;1-D,一维;2-D,二维;NMR,核磁共振;IR,红外;MSn,多级质谱。

figure-protocol-3
图3. 花青素合成通路共调控网络分析示例。 基于 ATTEDII 第3版数据集8,2,使用 PRIMe 平台(http://prime.psc.riken.jp/?action=coexpression_index)进行共表达分析,并利用 Pajek 程序(http://vlado.fmf.uni-lj.si/pub/networks/pajek/)构建网络图。网络连接基于正相关关系(r<0.5)建立。红色节点:12个花青素合成相关的酶基因(At5g13930,CHS,TT4,查尔酮合酶;At3g55120,CHI,TT5,查尔酮异构酶;At3g51240,F3H,TT6,黄烷酮3-羟化酶;At5g07990,F3'H,TT7,类黄酮3'-羟化酶;At5g17050,Fd3GT,UGT78D2,类黄酮3-O-葡萄糖基转移酶;At5g17220,AtGSTF12TT19;At5g42800,DFR,TT3,二氢类黄酮还原酶;At4g22880,ANS/LDOX,TT18,花青素合酶;At4g14090,A5GT,花青素5-O-葡萄糖基转移酶;At5g54060,A3G2"XT,推测的花青素3-O-葡萄糖苷2"-O-木糖基转移酶;At3g29590,A5GMaT,花青素5-O-葡萄糖苷6'''-O-丙二酰转移酶;At1g03940,A3GCouT,花青素3-O-葡萄糖苷6"-O-p-香豆酰转移酶)以及两个调控花青素合成的转录因子(At1g56650,PAP1;At1g66390,PAP2),以上共14个基因用于候选基因的搜索。通过“集合交集”方法,以相关系数 r>0.50 为阈值,对所有查询基因(即上述14个花青素生物合成基因)进行检索,获得候选基因。随后,利用 PRIMe 数据库,通过“集合互连”方法(r>0.50)重构包含相关候选基因(68个基因)和查询基因(14个基因)的共表达网络。从 PRIMe 数据库导出的“.net”格式文件被用于在 Pajek 软件中绘制网络图。蓝色节点表示与花青素合成基因具有相关性的候选基因。

物种主要次生代谢产物
Arabidopsis thaliana芥子油苷、黄酮醇、花青素、芥子酰衍生物
Populus trichocarpa黄酮醇、花青素、水杨酸衍生物
Vitis vinifera黄酮醇、花青素、单宁、芪类化合物
Solanum lycopersicum黄酮醇、花青素、糖苷生物碱、氯原酸相关化合物
Nicotiana tabacum黄酮醇、花青素、烟酰胺、氯原酸相关化合物、酰基糖
Oryza sativa糖基化黄酮、花青素、甾醇衍生物
Zea may糖基化黄酮、花青素、苯并恶嗪酮、甾醇衍生物
Medicago truncatula异黄酮、花青素、皂苷
Lotus japonica异黄酮、黄酮醇、花青素、皂苷

表 I. 模式植物物种中的主要次生代谢产物。

共表达数据库网址
植物跨物种 
COPhttp://webs2.kazusa.or.jp/kagiana/cop0911/
PlaNethttp://aranet.mpimp-golm.mpg.de/
植物物种 
ATEED-IIhttp://atted.jp/
BARhttp://142.150.214.117/welcome.htm
COPhttp://webs2.kazusa.or.jp/kagiana/cop
GeneCAThttp://genecat.mpg.de/
拟南芥 
ACThttp://www.arabidopsis.leeds.ac.uk/act/coexpanalyser
AthCoR@CSB.DBhttp://csbdb.mpimp-golm.mpg.de/csbdb/dbcor/ath.html
CressExpresshttp://cressexpress.org/
PRIMehttp://prime.psc.riken.jp/?action=coexpression_index
Oryza sativa  
RiceArrayNethttp://arraynet.mju.ac.kr/arraynet/
水稻阵列数据库http://www.ricearray.org/coexpression/coexpression.shtml

表 II. 用于in silico 共表达分析的可用基因表达数据库。

讨论

由于转录组学和代谢组学技术已应用多年,利用代谢组学辅助基因注释的数据整合过程通常始于鉴定代表未知代谢物的新峰。这一事实引出了下一阶段,即评估代谢物峰的定量变异,或评估被认为负责其生物合成的候选新基因。然而,本方案中描述的策略存在三个主要问题:i)峰注释困难,ii)通路预测复杂,iii)基因信息的分辨率及基因表达数据的质量。针对第一个问题,应通过标准化合物共洗脱或结合多种方法进行峰注释,这些方法包括MSn分析、参考提取物、突变体分析、代谢物数据库检索以及文献调研(图212)。对于第二个问题,通路预测只能在正确完成峰注释的基础上实现。然而,组织特异性的代谢物谱分析也可辅助峰注释,因为代谢物的积累应与相关基因的表达相一致。因此,不同组织和生长条件下的联合代谢谱分析有助于解决这一问题。第三个问题即基因信息的分辨率,取决于测序数据的发展程度。对于尚未完成基因组测序的模式植物,利用其他模式植物中的直系同源基因进行共表达分析是有效的。氨基酸序列的详细比对及系统发育树分析有助于将模式生物的研究结果拓展至其他物种。

该实验方案适用于所有代谢过程。在中间代谢和次级代谢的分析中效率最高,这些代谢过程已被充分表征为受到强烈的转录调控1,5,11,16。在一些实例中,共表达分析已成功应用于硫同化、β-氧化相关基因、支链氨基酸降解、叶绿素降解以及赖氨酸分解代谢3、细胞壁代谢10,7以及光信号级联反应14。通过整合基因组学、代谢组学和生物信息学进行基因功能注释,不仅有助于鉴定生物合成基因和转录因子的直接调控因子,也有助于理解生理过程和响应机制(参见示例图3.14)。

为了将该方法从模式植物拓展到作物物种,对不同植物物种进行代谢比较是研究某些普遍代谢途径的有力手段。例如,若在不同植物物种中检测到相同的化合物,并且在这些植物物种中发现了某些直系同源基因,则利用直系同源基因进行跨物种共表达分析可为您的预测提供有力支持。该方法可用于拟南芥、杨树、苜蓿,以及大麦、水稻、小麦和大豆等重要作物,通过植物物种间的共表达分析实现(6,PlaNet:http://aranet.mpimp-golm.mpg.de/9,COP:http://webs2.kazusa.or.jp/kagiana/cop0911/;参见示例15)。

披露

未声明任何利益冲突。

致谢

感谢理化学研究所生命医科学研究中心(RIKEN PSC)的Kazuki Saito教授和马克斯·普朗克分子植物生理研究所(MPIMP)的Bjoern Usadel博士提供的有益讨论。TT由亚历山大·冯·洪堡基金会的奖学金资助。

材料

本文使用的材料清单
姓名公司目录编号评论
质谱级超纯水BIOSOLVE23214102
乙腈(ACN),质谱级BIOSOLVE01204102
甲醇(MeOH),质谱级BIOSOLVE13684102
液相色谱用甲酸(HCOOH),质谱级BIOSOLVE06914131
标准化合物EXTRASYNTHESE
线性离子阱(IT)电喷雾电离质谱系统 FINNIGAN-LTQThermo Fisher Scientific, Inc.
HPLC 系统 SurveyorThermo Fisher Scientific, Inc.
分析柱 Luna C18(2),直径 2.0 mm,长度 150 mm,孔径 100 Å,球形颗粒,粒径 3 mmPhenomenex00F-4251-B0
Xcalibur 软件Thermo Fisher Scientific, Inc.

参考文献

  1. Aharoni, A., Keizer, L. C. P., Bouwmeester, H. J., Sun, Z. K., Alvarez-Huerta, M., Verhoeven, H. A., Blaas, J., van Houwelingen, A., De Vos, R. C. H., van der Voet, H. SAAT gene involved in strawberry flavor biogenesis by use of DNA microarrays. Plant Cell. 12, 647-661 (2000).
  2. Akiyama, K., Chikayama, E., Yuasa, H., Shimada, Y., Tohge, T., Shinozaki, K., Hirai, M. Y., Sakurai, T., Kikuchi, J., Saito, K. PRIMe: a Web site that assembles tools for metabolomics and transcriptomics. In Silico Biol. 8, 339-345 (2008).
  3. Araujo, W. L., Ishizaki, K., Nunes-Nesi, A., Larson, T. R., Tohge, T., Krahnert, I., Witt, S., Obata, T., Schauer, N., Graham, I. A., Leaver, C. J., Fernie, A. R. Identification of the 2-Hydroxyglutarate and Isovaleryl-CoA Dehydrogenases as Alternative Electron Donors Linking Lysine Catabolism to the Electron Transport Chain of Arabidopsis Mitochondria. Plant Cell. 22, 1549-1563 (2010).
  4. De Vos, R. C. H., Moco, S., Lommen, A., Keurentjes, J. J. B., Bino, R. J., Hall, R. D. Untargeted large-scale plant metabolomics using liquid chromatography coupled to mass spectrometry. Nat. Protoc. 2, (2007).
  5. Hirai, M. Y., Sugiyama, K., Sawada, Y., Tohge, T., Obayashi, T., Suzuki, A., Araki, R., Sakurai, N., Suzuki, H., Aoki, K., Goda, H., Nishizawa, O. I., Shibata, D., Saito, K. Omics-based identification of Arabidopsis Myb transcription factors regulating aliphatic glucosinolate biosynthesis. Proceedings of the National Academy of Sciences of the United States of America. 104, 6478-6483 (2007).
  6. Mutwil, M., Klie, S., Tohge, T., Giorgi, F. M., Wilkins, O., Campbell, M. M., Fernie, A. R., Usadel, B., Nikoloski, Z., Persson, S. PlaNet: Combined Sequence and Expression Comparisons across Plant Networks Derived from Seven Species. Plant Cell. 23, 895-910 (2011).
  7. Mutwil, M., Ruprecht, C., Giorgi, F. M., Bringmann, M., Usadel, B., Persson, S. Transcriptional Wiring of Cell Wall-Related Genes in Arabidopsis. Molecular Plant. 2, 1015-1024 (2009).
  8. Obayashi, T., Kinoshita, K., Nakai, K., Shibaoka, M., Hayashi, S., Saeki, M., Shibata, D., Saito, K., Ohta, H. ATTED-II: a database of co-expressed genes and cis elements for identifying co-regulated gene groups in Arabidopsis. Nucleic Acids Research. 35, D863-D869 (2007).
  9. Ogata, Y., Suzuki, H., Sakurai, N., Shibata, D. CoP: a database for characterizing co-expressed gene modules with biological information in plants. Bioinformatics. 26, 1267-1268 (2010).
  10. Persson, S., Wei, H. R., Milne, J., Page, G. P., Somerville, C. R. Identification of genes required for cellulose synthesis by regression analysis of public microarray data sets. Proceedings of the National Academy of Sciences of the United States of America. 102, 8633-8638 (2005).
  11. Tohge, T., Yonekura-Sakakibara, K., Niida, R., Watanabe-Takahashi, A., Saito, K. Phytochemical genomics in Arabidopsis thaliana: A case study for functional identification of flavonoid biosynthesis genes. Pure and Applied Chemistry. 79, 811-823 (2007).
  12. Tohge, T., Fernie, A. R. Web-based resources for mass-spectrometry-based metabolomics: A user's guide. Phytochemistry. 70, 450-456 (2009).
  13. Tohge, T., Fernie, A. R. Combining genetic diversity, informatics and metabolomics to facilitate annotation of plant gene function. Nature Protocols. 5, 1210-1227 (2010).
  14. Tohge, T., Kusano, M., Fukushima, A., Saito, K., Fernie, A. R. Transcriptional and metabolic programs following exposure of plants to UV-B irradiation. Plant Signal Behav. 6, Forthcoming (2011).
  15. Tohge, T., Ramos, M. S., Nunes-Nesi, A., Mutwil, M., Giavalisco, P., Steinhauser, D., Schellenberg, M., Willmitzer, L., Persson, S., Martinoia, E., Fernie, A. R. Towards the storage metabolome: profiling the barley vacuole. Plant Physiol. , (2011).
  16. Yonekura-Sakakibara, K., Tohge, T., Matsuda, F., Nakabayashi, R., Takayama, H., Niida, R., Watanabe-Takahashi, A., Inoue, E., Saito, K. Comprehensive flavonol profiling and transcriptome coexpression analysis leading to decoding gene-metabolite correlations in Arabidopsis. Plant Cell. 20, 2160-2176 (2008).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章