方法文章

大规模多组学全基因组关联研究(Mo-GWAS):样本制备与标准化操作指南

4.8K 次观看

DOI:

10.3791/62732

2021年7月27日

本文内容

摘要

在本实验方案中,我们介绍了一种优化的工作流程,该流程结合了高效且快速的大量样本制备方法。此外,我们还提供了逐步操作指南,以减少分析变异,实现对代谢组全基因组关联研究的高通量评估。

摘要

气相色谱-质谱联用(GC-MS)和液相色谱-质谱联用(LC-MS)是代谢组学中广泛采用的技术,可用于检测和定量数十万种代谢物特征。然而,将这些技术应用于大量样本时,会面临更为复杂的相互作用,尤其是在全基因组关联研究(GWAS)中。本实验方案描述了一种优化的代谢分析工作流程,结合了高效快速的样品前处理方法,适用于豆科作物物种的大规模样本分析。该提取方法在原有基础上略有改进,最初是为动植物组织分析而开发,基于甲基叔丁基醚:甲醇溶剂体系进行提取,以实现极性代谢物和脂类代谢物的同时捕获。此外,我们还提供了逐步操作指南,以减少分析过程中的技术变异,这对于在GWAS中实现高通量代谢变异评估至关重要。

引言

大规模"组学"方法已实现对复杂生物系统的分析1,2,3 ,并进一步加深了对基因型与相应表型之间关联的理解4。利用超高效液相色谱-质谱法(UHPLC-MS)和气相色谱-质谱法(GC-MS)进行代谢组学研究,能够检测到大量代谢物特征,其中仅部分在一定程度上得到了注释,导致未知代谢物占比较高。通过将大规模代谢组学与多样化群体中潜在的基因型变异相结合,可探索复杂的相互作用5。然而,处理大样本集不可避免地伴随分析变异,从而扭曲后续分析中对代谢变异的评估。具体而言,导致分析变异的主要问题源于仪器性能及随时间推移产生的仪器漂移6。批次间变异的整合具有挑战性,尤其在分析大规模结构化植物群体时更为突出。已有多种归一化方法被提出以校正非生物学变异,例如使用内标、外标以及同位素标记内标来校正分析误差,但每种方法本身均存在已知的问题和局限性7,8,9,10

除了分析过程中的变异外,提取方案的选择通常还取决于具体的分析方法。最终目标是通过采用基于相分离的提取方法,减少材料和人力成本,并避免为多种分析流程使用同一样本的多个等分试样。此类方法最初使用氯仿:甲醇/水溶剂体系来分离极性化合物和疏水性化合物11

本方案描述了一种用于豆科物种中极性代谢物和脂质分析的快速高通量多组学平台流程。此外,该方案还展示了如何对这些数据集进行分析变异校正和归一化处理,并在整合基因型信息后,通过全基因组关联分析(GWAS)检测代谢物数量性状位点(QTL)。

方案

1. 实验设计与植物培养

注意:应根据实验假设设置实验,例如,使用大规模全基因组关联研究(GWAS)群体可降低对多个重复的需求,因为统计检验将基于所有单个 SNP 的单倍型而非材料编号进行。相比之下,在其他实验方法中,多个重复则是必不可少的。准备实验时必须考虑以下几点。

  1. 根据实验假设,纳入足够的生物学重复。
  2. 以区组方式对生物学重复进行随机化,以减少栽培过程中局部环境带来的偏差,例如在温室或田间条件下。
  3. 确保植物在生长期间得到适当维护。对植物进行均一化处理,以减少偏差。

2. 生物植物材料的制备

  1. 采样准备
    1. 标记含有两个直径5 mm和两个直径8 mm金属珠的采样管(20 mL),用于组织匀浆。向杜瓦瓶中加入液氮。
      注意:植物应处于营养生长期,以便采集新鲜的叶片和根组织。
  2. 通过液氮速冻法采集生物样品。应尽可能快速完成采样,以避免长时间采样过程中昼夜节律振荡对代谢的影响12,13。将采集的新鲜叶片和根组织储存于-80 °C,用于后续处理。
    注意:从切割叶片到液氮速冻的时间不应超过数秒,因为叶片切割后,由于机械损伤会激活生物过程,从而改变代谢谱型。对于根组织,在液氮速冻前应先用水清洗根部并去除表面多余水分,可用纸巾吸干。干燥种子可在室温下保存,无需液氮冷冻。
  3. 使用组织研磨仪研磨组织。
    1. 将试管架在液氮中预冷数分钟,以确保研磨过程中保持低温。
    2. 从-80 °C冰箱取出样品后,立即放入装有液氮的杜瓦瓶中运输。
    3. 研磨组织以获得均一的粉末;设置频率为25 Hz,持续1分钟,若组织未充分研磨,可于液氮中再次冷冻后重复研磨。
  4. 对于干燥种子的研磨,将种子放入研磨罐中,并加入一个直径为15 mm的金属珠。研磨频率和时间同步骤2.3.3所述。
    注意:若无组织研磨仪,可使用洁净且预冷的研钵和研杵进行研磨。
  5. 预先冷却已标记的2 mL安全锁扣微量离心管。使用分析天平称取50 mg新鲜植物材料(误差范围±5 mg),并预先冷却用于转移植物材料的工具。确保植物材料在称量过程中始终保持冷冻状态。
    注意:新鲜植物材料不宜在室温下暴露过久,因为温度升高会激活生物过程,从而改变代谢谱型14
  6. 通过混合各待测样品的一部分制备额外的质量控制(QC)样品,并将混合后的植物材料称取50 mg(误差范围±5 mg)至预冷的2 mL安全锁扣微量离心管中。
    注意:建议每60个样品至少制备3个QC样品。QC样品对于后续的数据校正、归一化及分析至关重要。

3. 提取试剂

  1. 新鲜组织,例如叶片和根
    注意:样品提取基于先前描述的方案15本方案已根据当前需求进行了修改,例如适用于多种组织、不同的内标物以及大规模实验。此外,下文提及的所有体积和仪器设置均已针对本实验室的分析单元进行了调整。方案使用者应根据其分析单元和生物样本,结合测试样本的结果对这些参数进行相应调整。
    1. 提取混合液1(EM1):甲基 叔丁基甲基叔丁基醚(MTBE)/甲醇(MeOH)(3:1 v/v)
      1. 配制体积比为3:1的MTBE/MeOH混合液。取100 mL提取溶剂时,将75 mL MTBE与25 mL MeOH混合于洁净的玻璃瓶中。
        注意:溶剂应在通风橱中使用适当的防护设备小心操作。
      2. 加入45 µL 1,2-二十七烷酰基-sn-甘油-3-磷酰胆碱(1 mg/mL,溶于氯仿)作为基于UHPLC-MS的脂质分析内标,400 µL核糖醇(1 mg/mL,溶于水)作为基于GC-MS分析的内标,以及125 µL异牡荆素(1 mg/mL,溶于甲醇/水(1:1 v/v))用于基于UHPLC-MS的代谢物分析。
        注意:根据分析需求,添加内标物是进行分析后归一化的必要步骤。由于每个样品需要1 mL的EM1,应根据实验样品数量配制储备液,并在整个实验中使用同一批次的储备液。EM1必须在-20 °C下保存。需确认所选内标物在目标物种中不存在,并且不与其他化合物发生色谱峰重叠。可使用多种内标物;本方案中内标物的选择基于前期在菜豆提取物中的测试结果。16.
    2. 提取液2(EM2):水/甲醇(MeOH)(3:1 v/v)
      1. 对于100 mL EM2溶液,将75 mL双蒸水和25 mL甲醇加入洁净的玻璃瓶中。
      2. 每份样品加入 500 µL EM2,并根据实验样品数量配制足够量的储备液,供整个实验使用。将 EM2 储存于 4 °C。
  2. 干燥种子
    1. 提取混合液3(EM3)甲醇(MeOH)/水(7:3 v/v)
      1. 对于100 mL的EM3溶液,将70 mL甲醇和30 mL双蒸水加入洁净的玻璃瓶中。每个样品准备1 mL EM3溶液。
      2. 加入400 µL核糖醇(1 mg/mL水溶液)作为基于GC-MS分析的内标,以及125 µL异牡荆素(1 mg/mL甲醇/水(1:1 v/v)溶液)作为基于UHPLC-MS的代谢物分析内标。
        注意:根据实验样本量配制储备液,并在整个实验过程中使用。将EM3储存于4 °C。

4. 样品提取

  1. 新鲜组织,例如叶片和根
    1. 为每个样品准备三个 1.5 mL 安全锁微型离心管。将 EM1 保存在 -20 °C 的液体冷却系统中。将新鲜样品从 -80 °C 冰箱转移至干冰或液氮中进行运输。向每份 50 mg 的样品中加入 1 mL 预冷的 EM1,并短暂涡旋混匀,然后置于冰上。
    2. 在 4 °C 条件下,将样品置于旋转摇床中以 800 × g 振荡孵育 10 分钟。
    3. 将样品置于冰浴冷却的超声仪中进行超声处理 10 分钟。
    4. 使用多通道移液器加入 500 µL 的 EM2,以避免加样体积的差异。
    5. 短暂涡旋混匀样品,使提取液充分混合,随后在 4 °C 条件下以 11,200 × g 离心 5 分钟。
    6. 待相分离完成后,将上层含脂质相的 500 µL 转移至预先标记的 1.5 mL 安全锁微型离心管中。弃去剩余的上层相。
      注意:转移时需小心操作,因为该上层相具有较高的蒸气压,容易从移液器中泄漏。
    7. 分别将下层极性代谢物相的 150 µL 和中等极性代谢物相的 300 µL 转移至两个用于 GC-MS 和 UHPLC-MS 分析的 1.5 mL 安全锁微型离心管中。
    8. 使用真空浓缩仪在不加热的条件下使溶剂蒸发,从而浓缩所有提取组分,并在 -80 °C 下保存。
  2. 干燥种子
    1. 为每个样品准备两个 1.5 mL 安全锁微型离心管。将 EM3 置于冰上。在每份样品中放入一颗直径为 5 mm 的金属珠。
    2. 向每份 50 mg 的样品中加入 1 mL 的 EM3,并在 25 Hz 条件下均质化处理 2–3 分钟,然后置于冰上。
    3. 将样品置于冰浴冷却的超声仪中进行超声处理 10 分钟。
    4. 短暂涡旋混匀样品,随后在 4 °C 条件下以 11,200 × g 离心 5 分钟。
    5. 分别将上清液的 150 µL 和 300 µL 转移至两个用于 GC-MS 和 UHPLC-MS 分析的 1.5 mL 安全锁微型离心管中。
    6. 使用真空浓缩仪在不加热的条件下使溶剂蒸发,从而浓缩所有提取组分,并在 -80 °C 下保存。
      注意:根据经验,建议用户对干燥种子中的中等极性代谢物及衍生化代谢物分析执行步骤 4.2;对干燥种子的脂质分析则执行步骤 4.1。

5. 使用超高效液相色谱-质谱法分析脂质

  1. 将干燥的脂质组分重新悬浮于 250 µL 乙腈:异丙醇(7:3,体积比)中。
  2. 对脂质相进行 5 分钟超声处理,然后在 11,200 × g 条件下离心 1 分钟。
  3. 将 90 µL 上清液转移至玻璃样品瓶中用于液相色谱-质谱分析(LC-MS)。
  4. 取 2 µL 提取物注入液相色谱-质谱仪(LC-MS)中。
  5. 在 60 °C 下使用反相 C8 色谱柱进行脂质分离,流动相流速为 400 µL/min,并按照 表 1 所示逐步改变流动相 A 和 B 的比例。在正离子化模式下采集质谱数据,质荷比(m/z)范围为 150–1,500。
  6. 在每天的分析批次中加入多个质控(QC)样品和一个空白样品,以校正分析过程中的变异;样品应按顺序分块随机化排列。

6. 使用超高效液相色谱-质谱法分析极性和中等极性代谢物

  1. 用180 µL超高效液相色谱级甲醇:水(1:1 v/v)重新悬浮干燥的极性相。
  2. 将极性相超声处理2分钟,然后在11,200 × g 下离心1分钟。
  3. 将90 µL上清液转移至玻璃小瓶中用于液相色谱-质谱分析(LC-MS)。
  4. 将3 µL提取物注入液相色谱-质谱仪中。
  5. 在40 °C条件下使用反相C18 柱进行代谢物分离,流动相流速为400 µL/min,并按照表1所示逐步改变流动相A和B的比例。在全扫描模式下采集质量范围为100–1,500 m/z的质谱数据,并采用40 keV高能碰撞解离(HCD)诱导的全离子碎片化(AIF)模式获取碎片谱图。
    注意:两种电离模式均需使用。但由于在处理大量样品时存在仪器通量限制,建议先以测试样品在两种电离模式下运行,以确定优先采用的电离模式。
  6. 在每日分析批次中加入多个质控(QC)样品及一个空白样品,以校正分析过程中的变异;样品应按区块随机化顺序依次排列。
  7. 以数据依赖方式对混合质控样品在负离子和正离子两种电离模式下进行MS2 分析。所得质谱数据将在后续步骤(8.5)中用于代谢物注释。

7. 使用气相色谱-质谱法分析衍生化代谢物17,18

注意:衍生化代谢物的分析基于先前描述的方案17。所有衍生化试剂均需在通风橱中操作。确保 N-甲基-N-(三甲基硅基)三氟乙酰胺(MSTFA)不与水和湿气接触。

  1. 衍生化试剂 1 (DR1)
    1. 将甲氧胺盐酸盐溶解于吡啶中,配制成浓度为 30 mg/mL 的 DR1 溶液。每个样品使用 40 µL DR1。根据样品数量配制储备液,并在室温下保存。
  2. 衍生化试剂 2 (DR2)
    1. 将 MSTFA 与脂肪酸甲酯(FAMEs)混合,每 1 mL MSTFA 中加入 20 µL FAMEs。每个样品使用 70 µL DR2。根据样品数量配制储备液。MSTFA 储存于 4 °C,FAMEs 储存于 -20 °C。
      注:FAMEs 包括辛酸甲酯(methylcaprylate)、壬酸甲酯(methyl pelargonate)、癸酸甲酯(methylcaprate)、月桂酸甲酯(methyllaurate)、十四烷酸甲酯(methylmyristate)、棕榈酸甲酯(methylpalmitate)、硬脂酸甲酯(methylstearate)、二十烷酸甲酯(methyleicosanoate)、二十二烷酸甲酯(methyldocosanoate)、二十四烷酸甲酯(lignoceric acid methyl ester)、二十六烷酸甲酯(methylhexacosanoate)、二十八烷酸甲酯(methyloctacosanoate)和三十烷酸甲酯(triacontanoic acid methylester),这些物质溶解于 CHCl3 中,液体或固体标准品的浓度分别为 0.8 µL/mL 或 0.4 mg/mL。
  3. 使用真空浓缩仪将极性相中的沉淀物(储存于 -80 °C)重新干燥 30 分钟,以避免储存过程中残留的 H2O 对后续衍生化所用溶剂产生干扰。
  4. 加入 40 µL DR1。
  5. 使用旋转摇床在 37 °C 下以 950 × g 振荡样品 2 小时,随后短暂离心使液体沉降至管底。
  6. 加入 70 µL DR2。
  7. 再次使用旋转摇床在 37 °C 下以 950 × g 振荡 30 分钟。
  8. 在转移 90 µL 至玻璃进样瓶进行 GC-MS 分析前,于室温下短暂离心。
  9. 根据代谢物浓度,以 1 µL 进样量采用不分流模式进样,氦气载气流速保持恒定为 2 mL/min。进样口温度设定为 230 °C,使用 30-m MDN-35 毛细管柱。
    注:其他参数(如温度梯度)详见表 1。质谱扫描范围设定为 70–600 m/z,每分钟扫描 20 次。建议包含分流模式,以便对可能超载的化合物进行准确定量,从而在必要时节省提取物重新衍生化的成本与时间。
  10. 每天的分析批次中应包含多个质控(QC)样品及一个空白样品,以校正分析过程中的变异。样品应按区块随机化,以连续顺序排列。

8. 色谱图处理与化合物注释

  1. 通过设定强度阈值来过滤化学噪声。在处理色谱图时,包含所有质控(QC)样本。
    注意:对于大规模数据,噪声过滤对于减少计算时间和处理资源至关重要。
  2. 通过定义保留时间偏移窗口对色谱图进行对齐。检查每一批次的色谱图,以评估批内和批间变异。
  3. 根据峰形(例如,用于半峰全宽(FWHM)计算的峰高和峰宽)进行峰检测。
  4. 对同位素峰进行聚类,以减少冗余信号,并过滤掉单峰信号。
    注意:有关色谱图处理所用软件的详细信息,请参见材料表。文中提供了使用多种免费软件工具(如 MS-DIAL、MetAlign、MzMine 和 Xcalibur19,20,21)处理色谱图的深入方案。
  5. 使用混合质控(QC)样本的 ddMS2 数据进行化合物注释。通过确定单同位素质量,并观察常见的中性丢失、已知带电苷元以及不同类型的裂解方式(如均裂或异裂16,22),评估分子结构。
  6. 在报告代谢物数据时,遵循 Fernie 等人 201123 中所述的建议。
    注意:可采用不同的计算代谢组学方法来分析代谢组学数据24,25,26

9. 大规模代谢组学数据集的标准化

  1. 检查内标物的分布情况,并通过校正单个或多个内标物的响应值进行归一化处理。
  2. 根据准确的样品质量校正色谱图中获得的峰强度,即将峰强度除以步骤2.5中分取的匀浆样品质量。
  3. 校正多批次系列中出现的信号强度漂移。使用R语言进行基于质控样本的校正方法,例如局部加权散点平滑法(LOESS)27 。
    注意:已有多种工具和软件包可用于解决在整批样品采集过程中质谱性能漂移的问题28,29
  4. 通过数据转换确保性状呈正态分布,例如在进行全基因组关联分析(GWAS)时,使用R软件包MASS中的boxcox()函数进行Box-Cox转换30 。
  5. 进行数据缩放处理,例如Pareto缩放,以便在多变量分析中合理地赋予低丰度化合物适当的权重31
    注意:如有可能,应进行回收率实验,以避免基质效应,例如离子抑制效应14

10. 全基因组关联研究(GWAS)32

  1. 从测序数据中检测单核苷酸多态性(SNP)或结构变异(SV) 数据33,34.
  2. 按次要等位基因频率(MAF)筛选基因型数据 < 5% 及缺失率 >使用Tassel避免低频偏差的10%35.
  3. 使用 R 软件包计算各标准化特征在实验重复中的最佳线性无偏预测值(BLUPs),以消除由环境因素(随机效应)引起的偏差 Ime436.
  4. 使用每个特征的BLUP值分别进行GWAS分析 rMVP R 中的包37.
    注意:每个代谢组学特征在此被视为独立的表型。
  5. 进行全基因组关联分析(GWAS)时,应使用主成分分析(PCA)以及亲缘关系(identity by state, IBS)或vanRaden方法校正群体结构,以最小化混杂效应。此外,可考虑采用混合线性模型(mixed linear model, MLM)或多基因座混合模型(multi-locus mixed model, MLMM),因为混合模型同时包含固定效应和随机效应。

11. QTL 检测

  1. 结合曼哈顿图,检查显示显著关联的单核苷酸多态性(SNP),进行连锁不平衡(LD)分析以确定潜在的遗传区域。使用 R 软件包 LD heatmap 或 Tassel 5 进行 LD 计算。
  2. 通过比较单倍型间性状水平的统计学变化,评估相关 SNP 对性状效应大小的影响,以识别潜在的因果 SNP,例如导致蛋白质编码序列中氨基酸改变的 SNP,这可能解释表型变异。
    注意:SNP-性状关联并不一定代表因果关系,因此确定基因组区域至关重要。通过特征注释进行化合物身份鉴定,可极大帮助在特定基因组区域内筛选候选基因。我们建议将与特定化合物相关的所有检测到的数量性状位点(QTL)整合到一个多效性图谱中,以突出关键遗传区域38,如图4所示。 对于候选基因的验证,可采用多种方法(见讨论部分)。

结果

成功的代谢组学全基因组关联研究(GWAS)实验应从合理的实验设计开始,随后进行样品采集、提取、数据获取和处理,如图1所示。在本方案中,采用MTBE方法15提取并分析了属于多个化合物类别的数百种代谢物。色谱分离效果在很大程度上依赖于所用色谱柱的性质以及洗脱缓冲液的组成。图2展示了质控(QC)样品的色谱图,反映了该分析系统中一些主要脂质类别化合物的洗脱模式。各平台所用的梯度洗脱程序见表1。本研究高度重视大规模实验中系统性误差的处理。大规模代谢组学研究本身容易引入系统性误差。为说明这一点,我们分析了多个常见菜豆物种的脂质组数据。补充表1提供了使用材料表中列出的软件对色谱图进行处理后获得的原始脂质组数据。遵循本方案使我们能够避免处理组学数据时的诸多关键问题,尤其是在处理大样本集时。归一化流程可准确校正批次间的分析误差,如图3所示。尽管增加QC样本的数量可提高归一化的效力,但由于成本和时间限制,这并不总是可行的。在进行非靶向代谢特征的高通量代谢组学GWAS时,必须恰当地展示更多的性状-标记关联。一种整合多个GWAS结果的多效性图谱38可用于突出显示与多个性状相关的基因组区域(图4)。

代谢组学工作流程图,GWAS,样品处理,PCA分析,数据归一化,QTL检测。
图1:基于代谢组学的植物全基因组关联分析(GWAS)流程图。左侧面板展示了从实验设计到QTL检测的多个步骤。右侧面板展示了多个图表,用于支持左侧面板中提到的各个步骤。从右上角开始,(1) 显示了适用于液相色谱-质谱联用(LC-MS)分析的推荐样品序列,(2) 显示了主成分分析(PCA)在归一化前后的得分图,以及一个代表性特征在处理前后的分布情况,其中红色表示质控(QC)样品的信号强度,(3) 显示了具有显著关联的曼哈顿图,并基于此生成了连锁不平衡(LD)和单倍型分布图。缩写:GWAS = 全基因组关联研究;QTL = 数量性状位点;PCA = 主成分分析;QC = 质量控制;LD = 连锁不平衡;MS = 质谱;LC-MS = 液相色谱-质谱联用;GC-MS = 气相色谱-质谱联用;LOESS = 局部加权散点平滑法;MLM/MLMM = 混合线性模型/多基因座混合模型。请点击此处查看该图的放大版本。

色谱实验;显示保留时间与峰强度的图表,脂质分析结果。
图 2:色谱图处理。来自不同批次的两个质控(QC)色谱图(基峰;脂质数据)展示了混合QC样品中某些脂质类别的批次间差异。图中标识了四种主要脂质类别及其在本实验室LC-MS系统中的相应洗脱时间窗口。色谱图由MzMine21导出。缩写:QC = 质量控制;LC-MS = 液相色谱-质谱联用。请点击此处查看此图的放大版本。

用于样本聚类比较的脂质PCA及批次loess标准化数据分析图。
图3:系统误差校正。脂质组学数据在系统误差校正前(左,原始数据)和校正后(右,批次loess)的主成分分析(PCA)。下图展示了在分析变异校正前(左)和校正后(右),特征(Cluster_00005)在样本(n=650)和批次(n=10)中的分布情况。缩写:PCA = 主成分分析;QC = 质量控制;LOESS = 局部加权散点图平滑法。请点击此处查看该图的放大版本。

显示植物基因组中基因分布的系统发育树图,放射状布局,遗传分析。
图 4:展示综合 GWAS 结果的多效性图谱。 多效性图谱突显了与多个性状相关的全基因组区域。外圈上的数字表示对应的染色体。每个环代表一个独立的性状及其显著相关的 SNPs。颜色代表不同的化合物类别(灰色 = 化合物类别 1;绿色 = 化合物类别 2;紫色 = 化合物类别 3;黄色 = 化合物类别 4)。当不同化合物类别与同一基因组区域存在关联时,相关基因会被高亮显示。内部的灰色圆圈表示与特定基因组位置相关的所有显著 SNPs 的总和。本图所示的关联关系仅为示意而人为生成。缩写:GWAS = 全基因组关联分析;SNPs = 单核苷酸多态性。请点击此处查看此图的放大版本。

脂质的UHPLC-MS检测条件
时间 [min]流动相A到B [%]*信息
0 - 1.0045% A流动相A:水中含1% 1M NH4-乙酸盐、0.1%乙酸(UHPLC级)
1.00 - 4.00lg 45% - 25% A流动相B:乙腈/2-丙醇(7:3)中含1% 1M NH4-乙酸盐、0.1%乙酸(UHPLC级)
4.00 - 12.00lg 25% - 11% A流速: 400 µL/min
12.00 - 15.00lg 11% - 0% A进样体积: 2 µL
15.00 - 19.50cw 0% A
19.50-19.510% - 45% A
19.51-24.00eq 45%
极性和中等极性代谢物的UHPLC-MS/MS检测条件
时间 [min]流动相A和B [%]*信息
0 - 1.0099% A流动相A:水中含0.1%甲酸(UHPLC级)
1.00 - 11.00lg 99% -60% A流动相B:乙腈中含0.1%甲酸(UHPLC级)
11.00 - 13.00lg 60% - 30% A流速: 400 µL/min
13.00 - 15.00lg 30% - 1% A进样体积: 3 µL
15.00 - 16.00cw 1% A
16.00 - 17.00lg 1% - 99% A
17.00 - 20.00eq 99% A
衍生化代谢物的GC-MS检测条件
时间 [min]温度 [°C]信息
0 - 2.0085载气: 氦气
2.00 - 18.66lg 80 - 330流速: 2 mL/min
18.66 - 24.66cw 330温度梯度: 15 °C/min
24.66快速降温进样体积: 1 µL

表1:各分析平台的梯度设置7缩写:lg = 线性梯度;cw = 柱清洗;eq = 平衡;UHPLC-MS = 超高效液相色谱-质谱联用;UHPLC-MS/MS = 超高效液相色谱-串联质谱;GC-MS = 气相色谱-质谱联用。* = 百分比数值对应流动相A;剩余百分比对应流动相B。

补充表 1:脂质组学原始数据。 显示每个样本中所检测到的各个簇的峰强度。请点击此处下载该表格。

讨论

气相色谱-质谱联用(GC-MS)和液相色谱-质谱联用(LC-MS)是广泛用于分析多种代谢物类别复杂混合物的工具。使用这些工具处理大规模数据集时,不可避免地会引入非生物学变异,例如分析过程中的技术变异,从而干扰结果解读并引入偏差。本方案介绍了一种稳健且高通量的提取流程,适用于全面的代谢组学分析。 通过分析消除非生物来源的变异,并开展大规模研究 "组学" 研究。本方案中使用的体积和浓度已根据不同豆科植物物种及不同组织进行了调整。然而,这些 参数可稍作调整,并适用于其他植物物种的大规模代谢样品分析。

先前15 描述的基于MTBE的提取方法可用于分析衍生化代谢物、中等极性代谢物以及脂质。该方法还可拓展用于蛋白质和植物激素的提取39,但这些内容超出了本实验方案的范围。其他提取方法依赖于二氯甲烷:乙醇混合液40,41。在这些提取方法中,MTBE:甲醇提取法相较于现有的基于氯仿的提取方法更具优势,且危险性更低42 ,并且不会在极性相与脂质相之间形成作为中间相的蛋白质沉淀。此外,MTBE方法已在多项研究中用于多种生物样品的处理43,44,45

本方案讨论了在操作过程中可能导致潜在差异的几个关键步骤 大量样本, 例如,在收获期间12,13提取14,以及随机化46此外,本方案中尚未讨论一些其他必须考虑的问题,以确保获得高质量的代谢组学数据,例如基质效应和离子抑制。14.

基于质控(QC)的归一化方法的功效在本质上依赖于每批中QC样本的数量。如前所述,尽管增加QC样本数量可提高方法功效,但在这些分析系统中,QC样本的批内变异相对于批间变异而言相对较小,如图3所示。总体而言,还存在其他基于QC的归一化方法,例如使用随机森林消除系统误差(SERRF),该方法已被证明优于大多数其他归一化方法,如分批比率法、基于多个内标最优选择的归一化(NOMIS)以及概率商归一化(PQN)47。然而,SERRF依赖于每批中多个QC样本(例如每十个样本中插入一个QC样本),这在处理大量样本时并不可行。与其它数据驱动或基于内标的方法相比,基于QC的归一化主要优势在于能够在容纳非期望技术变异的同时保留关键的生物学变异28。读者可参考这篇关于变异处理的综述28

全基因组关联分析(GWAS)中的一个主要问题是假阳性率较高,这主要是由于因果位点与非因果位点之间的连锁所致48,49。其次,保守的统计学校正方法(如Bonferroni校正和FDR校正)是基于独立检验的数量进行校正的,但由于邻近SNP之间存在连锁,GWAS中检测的SNP数量并不等于独立检验的数量50,51 因此,实际的独立检验数量通常更低。另一种降低统计学显著性阈值保守性的方法是,基于特定基因组区域内连锁衰减的特征,减少用于GWAS分析的SNP数量52。本实验方案中描述的整合GWAS的高通量代谢组学平台具有广泛的应用前景。特别是,该平台将有助于通过调控代谢物/脂质组分以达到工业和营养学所需的水平,从而推动作物育种的改良。总体而言,代谢组学在过去几十年作物驯化过程中,对大量代谢物的遗传结构及代谢多样性提供了深入见解,显示出代谢组学辅助育种的巨大潜力53。在QTL下游验证方面,分子生物学方法包括构建CRISPR/Cas9突变系54、T-DNA插入系55、稳定和/或瞬时过表达系56、病毒诱导的基因沉默(VIGS)、ex vivo代谢组学方法57 ,以及传统的构建F2杂交群体和在不同群体中进行交叉验证的方法。

通过如上所述对分析变异进行必要的校正,除全基因组关联分析(GWAS)外,还可开展多种整合分析方法,例如代谢物-代谢物、代谢物-脂质相关性分析,与表型组数据的相关性分析以揭示更复杂的性状,和/或共表达分析以进一步解析生物系统的生物学基础58

披露

作者声明无利益冲突。

致谢

M.B. 受 IMPRS-PMPG“初级代谢与植物生长”项目支持。A.R.F. 和 S.A. 感谢欧盟“地平线2020”研究与创新计划的资助,项目 PlantaSYST(FPA 编号 664620 下的 SGA-CSA 编号 739582)以及项目 INCREASE(资助协议编号 862862)。

材料

本文使用的材料清单
姓名公司目录编号评论
试剂与标准品
1,2-二十七碳酰基-sn-甘油-3-磷酰胆碱(17:0 PC)Avanti Polar Lipids850360P脂质内标
氯仿Supleco67-66-3FAME溶剂
异牡荆素Sigma Aldrich38953-85-4代谢物内标
木蜡酸甲酯Sigma Aldrich2442-49-1FAME
甲醇(MeOH)Biosolve Chemicals13684102超高效液相色谱-质谱级
甲氧胺盐酸盐Sigma Aldrich593-56-6代谢物衍生化
月桂酸甲酯Sigma Aldrich111-82-0FAME
肉豆蔻酸甲酯Sigma Aldrich124-10-7FAME
棕榈酸甲酯Sigma Aldrich112-39-0FAME
硬脂酸甲酯Sigma Aldrich112-61-8FAME
甲基叔丁基醚(MTBE)Biosolve Chemicals13890602高效液相色谱级
癸酸甲酯Sigma Aldrich110-42-9FAME
辛酸甲酯Sigma Aldrich111-11-5FAME
二十二烷酸甲酯Sigma Aldrich929-77-1FAME
二十烷酸甲酯Sigma Aldrich1120-28-1FAME
二十六烷酸甲酯Sigma Aldrich5802-82-4FAME
二十八烷酸甲酯Sigma Aldrich55682-92-3FAME
壬酸甲酯Sigma Aldrich1731-84-6FAME
N-甲基-N-(三甲基硅基)三氟乙酰胺(MSTFA)Macherey-Nagel24589-78-4代谢物衍生化
吡啶Supleco110-86-1代谢物衍生化
核糖醇Supleco22566-17-2衍生化代谢物内标
三十烷酸甲酯TCI Chemicals629-83-4FAME
Biosolve Chemicals23214102超高效液相色谱-质谱级
仪器设备
1.5 mL 安全锁微型离心管Eppendorf3120086
2 mL 安全锁微型离心管Eppendorf3120094
天平Sartorius Corporation14 557 572
DB-35ms, 30 m, 0.25 mm, 0.25 µmAglient123-3832衍生化代谢物分析
气相色谱-质谱系统Leco Pegasus HT TOF-MS (LECO Corporation)衍生化代谢物分析
研磨珠,不锈钢OPS DIAGNOSTICSGBSS 196-2500-10
质谱系统Exactive, 轨道阱型质谱仪(Exactive, Thermo Fisher Scientific)脂质分析
质谱系统Q Exactive Focus(Q Exactive™ Focus 混合四极杆-轨道阱™
质谱仪,Thermo Fisher Scientific)
代谢物分析
制冷型微型离心机Eppendorf, 型号 5427R22620701
反相(RP)桥接乙基杂化(BEH)C8色谱柱
(100 mm × 2.1 mm,含1.7 μm 直径颗粒)
Waters186002878脂质分析
反相高强硅胶(HSS)T3色谱柱
(100 mm × 2.1 mm,含1.8 μm 直径颗粒)
Waters186003539代谢物分析
振荡器Eppendorf Thermomixer 54362050-100-05
超声波破碎仪USC 300 TH142-0084
组织研磨混合仪Retsch, Mixer Mill MM 30020.746.0001
超高效液相色谱系统Waters Acquity UPLC system (Waters)
真空浓缩仪Scan Speed Maxi Vac Alpha Evaporators7.008.500.002
涡旋混合器Vortex-Genie 2, 型号 G560SI-0236
软件
MetAlign色谱图处理
MzMine色谱图处理
R 软件包 "data.table"
R 软件包 "fujiplot"多效性图谱
R 软件包 "genetics"
R 软件包 "Ime4"BLUPs 计算
R 软件包 "LDheatmap"连锁不平衡图
R 软件包 "MASS"数据转换
R 软件包 "rMVP"全基因组关联分析
R 版本 4.0.4
RefinerMS色谱图处理
RefinerMS GenedataExpressionist色谱图处理
Tassel 5基因型筛选
XcaliburThermo Fisher ScientificOPTON-30965色谱图处理

参考文献

  1. Doerr, A. Global metabolomics. Nature Methods. 14 (1), 32(2017).
  2. Fessenden, M. Metabolomics: Small molecules, single cells. Nature. 540 (7631), 153-155 (2016).
  3. Oliver, S. G., Winson, M. K., Kell, D. B., Baganz, F. Systematic functional analysis of the yeast genome. Trends in Biotechnology. 16 (9), 373-378 (1998).
  4. Fiehn, O. Metabolomics-the link between genotypes and phenotypes. Plant Molecular Biology. 48 (1), 155-171 (2002).
  5. Wu, S., et al. Mapping the Arabidopsis metabolic landscape by untargeted metabolomics at different environmental conditions. Molecular Plant. 11 (1), 118-134 (2018).
  6. Sysi-Aho, M., Katajamaa, M., Yetukuri, L., Orešič, M. Normalization method for metabolomics data using optimal selection of multiple internal standards. BMC Bioinformatics. 8 (1), 93(2007).
  7. Chen, M., Rao, R. S. P., Zhang, Y., Zhong, C. X., Thelen, J. J. A modified data normalization method for GC-MS-based metabolomics to minimize batch variation. SpringerPlus. 3 (1), 439(2014).
  8. Dunn, W. B., et al. Metabolic profiling of serum using Ultra Performance Liquid Chromatography and the LTQ-Orbitrap mass spectrometry system. Journal of Chromatography B. 871 (2), 288-298 (2008).
  9. Fiehn, O., et al. Metabolite profiling for plant functional genomics. Nature Biotechnology. 18 (11), 1157-1161 (2000).
  10. vander Kloet, F. M., Bobeldijk, I., Verheij, E. R., Jellema, R. H. Analytical error reduction using single point calibration for accurate and precise metabolomic phenotyping. Journal of Proteome Research. 8 (11), 5132-5141 (2009).
  11. Folch, J., Lees, M., Stanley, G. H. S. A simple method for the isolation and purification of total lipides from animal tissues. Journal of Biological Chemistry. 226 (1), 497-509 (1957).
  12. Fukushima, A., et al. Impact of clock-associated Arabidopsis pseudo-response regulators in metabolic coordination. Proceedings of the National Academy of Sciences of the United States of America. 106 (17), 7251-7256 (2009).
  13. Kerwin, R. E., et al. Network quantitative trait loci mapping of circadian clock outputs identifies metabolic pathway-to-clock linkages in Arabidopsis. The Plant Cell. 23 (2), 471-485 (2011).
  14. Tohge, T., et al. From models to crop species: Caveats and solutions for translational metabolomics. Frontiers in Plant Sciences. 2, 61(2011).
  15. Salem, M., Bernach, M., Bajdzienko, K., Giavalisco, P. A simple fractionated extraction method for the comprehensive analysis of metabolites, lipids, and proteins from a single sample. Journal of Visualized Experiments:JoVE. (124), e55802(2017).
  16. Tohge, T., Fernie, A. R. Combining genetic diversity, informatics and metabolomics to facilitate annotation of plant gene function. Nature Protocols. 5 (6), 1210-1227 (2010).
  17. Lisec, J., Schauer, N., Kopka, J., Willmitzer, L., Fernie, A. R. Gas chromatography mass spectrometry-based metabolite profiling in plants. Nature Protocols. 1 (1), 387-396 (2006).
  18. Osorio, S., Do, P. T., Fernie, A. R. Plant Metabolomics: Methods and Protocols. Hardy, N. W., Hall, R. D. , Humana Press. 101-109 (2012).
  19. De Vos, R. C. H., et al. Untargeted large-scale plant metabolomics using liquid chromatography coupled to mass spectrometry. Nature Protocols. 2 (4), 778-791 (2007).
  20. Perez de Souza,, Alseekh, L., Naake, S., Fernie, T., A, Mass spectrometry-based untargeted plant metabolomics. Current Protocols in Plant Biology. 4 (4), 20100(2019).
  21. Pluskal, T., Castillo, S., Villar-Briones, A., Orešič, M. MZmine 2: Modular framework for processing, visualizing, and analyzing mass spectrometry-based molecular profile data. BMC Bioinformatics. 11 (1), 395(2010).
  22. Watson, J. T., Sparkman, D. O. Electron Ionization. Introduction to mass spectrometry: Instrumentation, applications and strategies for data interpretation. , John Wiley & Sons, Ltd. 315(2007).
  23. Fernie, A. R., et al. Recommendations for reporting metabolite data. The Plant Cell. 23 (7), 2477(2011).
  24. Treutler, H., et al. Discovering regulated metabolite families in untargeted metabolomics studies. Analytical Chemistry. 88 (16), 8082-8090 (2016).
  25. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nature Biotechnology. 34 (8), 828-837 (2016).
  26. Naake, T., Fernie, A. R. MetNet: Metabolite network prediction from high-resolution mass spectrometry data in R aiding metabolite annotation. Analytical Chemistry. 91 (3), 1768-1772 (2019).
  27. Chambers, J. M. Statistical models in S. , CRC Press, Inc. (1991).
  28. Misra, B. B. Data normalization strategies in metabolomics: Current challenges, approaches, and tools. European Journal of Mass Spectrometry. 26 (3), 165-174 (2020).
  29. Livera, A. M. D., et al. Statistical methods for handling unwanted variation in metabolomics data. Analytical Chemistry. 87 (7), 3606-3615 (2015).
  30. Sakia, R. M. The Box-Cox transformation technique: a review. 41 (2), 169-178 (1992).
  31. vanden Berg, R. A., Hoefsloot, H. C. J., Westerhuis, J. A., Smilde, A. K., vander Werf, M. J. Centering, scaling, and transformations: improving the biological information content of metabolomics data. BMC Genomics. 7, 142(2006).
  32. Marees, A. T., et al. A tutorial on conducting genome-wide association studies: Quality control and statistical analysis. International Journal of Methods in Psychiatric Research. 27 (2), 1608(2018).
  33. Torkamaneh, D., Laroche, J., Bastien, M., Abed, A., Belzile, F. Fast-GBS: a new pipeline for the efficient and highly accurate calling of SNPs from genotyping-by-sequencing data. BMC Bioinformatics. 18 (1), 5(2017).
  34. Zhao, S., Agafonov, O., Azab, A., Stokowy, T., Hovig, E. Accuracy and efficiency of germline variant calling pipelines for human genome data. Scientific Reports. 10 (1), 20222(2020).
  35. Bradbury, P. J., et al. TASSEL: software for association mapping of complex traits in diverse samples. Bioinformatics. 23 (19), 2633-2635 (2007).
  36. Bates, D., Mächler, M., Bolker, B., Walker, S. Fitting linear mixed-effects models using lme4. Journal of Statistical Software. 67 (1), (2015).
  37. Yin, L., et al. rMVP: A memory-efficient, visualization-enhanced, and parallel-accelerated tool for genome-wide association study. Genomics, Proteomics & Bioinformatics. , (2021).
  38. Kanai, M., et al. Genetic analysis of quantitative traits in the Japanese population links cell types to complex human diseases. Nature Genetics. 50 (3), 390-400 (2018).
  39. Salem, M. A., et al. An improved extraction method enables the comprehensive analysis of lipids, proteins, metabolites and phytohormones from a single sample of leaf tissue under water-deficit stress. Plant Journal: for Cell and Molecular Biology. 103 (4), 1614-1632 (2020).
  40. Balcke, G. U., et al. Multi-omics of tomato glandular trichomes reveals distinct features of central carbon metabolism supporting high productivity of specialized metabolites. The Plant Cell. 29 (5), 960-983 (2017).
  41. Leonova, T., et al. Does protein glycation impact on the drought-related changes in metabolism and nutritional properties of mature pea (Pisum sativum L.) seeds. International Journal of Molecular Sciences. 21 (2), 567(2020).
  42. Alfonsi, K., et al. chemistry tools to influence a medicinal chemistry and research chemistry based organisation. Green Chemistry. 10 (1), 31-36 (2008).
  43. Bozek, K., et al. Organization and evolution of brain lipidome revealed by large-scale analysis of human, chimpanzee, macaque, and mouse tissues. Neuron. 85 (4), 695-702 (2015).
  44. Delgado, R., Muñoz, Y., Peña-Cortés, H., Giavalisco, P., Bacigalupo, J. Diacylglycerol activates the light-dependent channel TRP in the photosensitive microvilli of Drosophila melanogaster photoreceptors. The Journal of Neuroscience. 34 (19), 6679(2014).
  45. Sharma, D. K., et al. UPLC-MS analysis of Chlamydomonas reinhardtii and Scenedesmus obliquus lipid extracts and their possible metabolic roles. Journal of Applied Phycology. 27 (3), 1149-1159 (2015).
  46. Dunn, W. B., Wilson, I. D., Nicholls, A. W., Broadhurst, D. The importance of experimental design and QC samples in large-scale and MS-driven untargeted metabolomic studies of humans. Bioanalysis. 4 (18), 2249-2264 (2012).
  47. Fan, S., et al. Systematic error removal using random forest for normalizing large-scale untargeted lipidomics data. Analytical Chemistry. 91 (5), 3590-3596 (2019).
  48. Larsson, S. J., Lipka, A. E., Buckler, E. S. Lessons from Dwarf8 on the strengths and weaknesses of structured association mapping. PLOS Genetics. 9 (2), 1003246(2013).
  49. Platt, A., Vilhjálmsson, B. J., Nordborg, M. Conditions under which genome-wide association studies will be positively misleading. Genetics. 186 (3), 1045-1052 (2010).
  50. Nyholt, D. R. A simple correction for multiple testing for single-nucleotide polymorphisms in linkage disequilibrium with each other. American Journal of Human Genetics. 74 (4), 765-769 (2004).
  51. Teo, Y. Y. Common statistical issues in genome-wide association studies: a review on power, data quality control, genotype calling and population structure. Current Opinion in Lipidology. 19 (2), 133-143 (2008).
  52. Privé, F., Aschard, H., Ziyatdinov, A., Blum, M. G. B. Efficient analysis of large-scale genome-wide data with two R packages: bigstatsr and bigsnpr. Bioinformatics. 34 (16), 2781-2787 (2018).
  53. Alseekh, S., et al. Domestication of crop metabolomes: desired and unintended consequences. Trends in Plant Science. 26 (6), 650-661 (2021).
  54. Yano, K., et al. GWAS with principal component analysis identifies a gene comprehensively controlling rice architecture. Proceedings of the National Academy of Sciences of the United States of America. 116 (42), 21262(2019).
  55. Wu, S., et al. Mapping the Arabidopsis metabolic landscape by untargeted metabolomics at different environmental conditions. Molecular Plant. 11 (1), 118-134 (2018).
  56. Ye, J., et al. An InDel in the promoter of Al-ACTIVATED MALATE TRANSPORTER9 selected during tomato domestication determines fruit malate contents and aluminum tolerance. The Plant Cell. 29 (9), 2249-2268 (2017).
  57. Zhang, W., et al. Genome assembly of wild tea tree DASZ reveals pedigree and selection history of tea varieties. Nature Communications. 11 (1), 3719(2020).
  58. Tohge, T., Fernie, A. R. Annotation of plant gene function via combined genomics, metabolomics and informatics. Journal of Visualized Experiments: JoVE. (64), e3487(2012).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章