GC-MS et LC-MS sont des outils largement utilisés pour profiler des mélanges complexes de diverses classes de métabolites. La manipulation de grands ensembles de données à l’aide de ces outils est intrinsèquement associée à une variation non biologique, p. ex. une variation analytique, qui interfère et biaise l’interprétation des résultats. Ce protocole présente un pipeline d’extraction robuste et à haut débit pour un profilage métabolique complet afin d’éliminer la variation d’origine non biologique et de mener des études « omiques » à grande échelle. Les volumes et les concentrations utilisés dans ce protocole ont été ajustés pour tenir compte des espèces de légumineuses dans différents tissus. Cependant, ces paramètres peuvent être légèrement modifiés et utilisés pour des échantillons métaboliques à grande échelle provenant d’autres espèces végétales.
Les15 extractions à base de MTBE décrites précédemment peuvent être utilisées pour analyser les métabolites dérivés, les métabolites semi-polaires et les lipides. Cela peut être étendu pour les extractions de protéines et d’hormones végétales39, qui étaient hors du champ d’application de ce protocole. D’autres protocoles d’extraction reposent sur des mélanges dichlorométhane:éthanol40,41. Parmi ces protocoles d’extraction, le protocole d’extraction MTBE:méthanol offre une alternative favorable et moins dangereuse aux protocoles d’extraction existants à base de chloroforme42 et n’aboutit pas à une pastille de protéine comme interphase entre les phases polaire et lipidique. En outre, les méthodes MTBE ont déjà été utilisées dans plusieurs études pour divers échantillons biologiques 43,44,45.
Ce protocole traite de plusieurs étapes cruciales qui pourraient entraîner des variations potentielles lors de la manipulation d’un grand nombre d’échantillons, par exemple lors de la récolte12,13, de l’extraction14, ainsi que de la randomisation46. De plus, il y a d’autres questions qui n’ont pas été abordées dans ce protocole et qui doivent être prises en compte pour assurer des données métabolomiques de haute qualité, par exemple l’effet de matrice et la suppression des ions14.
La puissance des méthodes de normalisation basées sur le CQ dépend intrinsèquement du nombre d’échantillons de CQ dans chaque lot. Comme mentionné précédemment, bien que l’augmentation du nombre augmenterait la puissance, la variation intra-lot des QC est relativement marginale par rapport à la variation inter-lots dans ces systèmes analytiques, comme illustré à la figure 3. Dans l’ensemble, il existe d’autres méthodes de normalisation basées sur le CQ, telles que l’élimination des erreurs systémiques à l’aide de la forêt aléatoire (SERRF), qui se sont avérées surpassant la plupart des autres méthodes de normalisation telles que le ratio par lots, la normalisation à l’aide d’une sélection optimale de plusieurs étalons internes (NOMIS) et la normalisation probabiliste du quotient (PQN)47 . Cependant, SERRF s’appuie sur plusieurs échantillons de CQ dans chaque lot, par exemple, un échantillon sur dix, ce qui n’est pas réalisable lors de la manipulation d’un grand nombre d’échantillons. Le principal avantage de la normalisation basée sur le CQ par rapport à d’autres méthodes basées sur des données ou des normes internes est qu’elle conserve la variation biologique essentielle tout en tenant compte de la variation technique indésirable28. Les lecteurs peuvent se référer à cette revue sur le traitement de la variation28.
L’un des principaux problèmes dans GWAS est le taux de faux positifs, qui provient principalement du lien entre les sites causaux et non causaux48,49. Deuxièmement, les approches de correction statistique conservatrices, par exemple Bonferroni et FDR, corrigent le nombre de tests indépendants, qui n’est pas égal au nombre de SNP analysés dans GWAS en raison du lien entre les SNP proches50,51 Par conséquent, le nombre réel de tests indépendants est souvent plus faible. Une autre façon de réduire le seuil statistique conservateur serait de réduire le nombre de SNP testés utilisés pour les GWAS en fonction de la désintégration des liens sur des régions génomiques définies52. La plate-forme métabolomique à haut débit intégrée à GWAS décrite dans ce protocole a un large éventail d’applications. En particulier, il facilitera l’amélioration de la sélection des cultures en modifiant la composition métabolite/lipidique pour les niveaux souhaités industriellement et nutritionnellement. Dans l’ensemble, la métabolomique a fourni un aperçu approfondi de l’architecture génétique d’une pléthore de métabolites et de la diversification métabolique qui s’est produite lors de la domestication des cultures au cours des dernières décennies, indiquant le vaste potentiel de la sélection associée à la métabolomique53. Les approches de biologie moléculaire pour la validation QTL en aval comprennent la génération de lignées mutantes CRISPR/Cas954, de lignées d’insertion d’ADN-T55, de lignes de surexpression stables et/ou transitoires56, de VIGS, d’approches métabolomiques ex vivo 57 à côté de l’approche conventionnelle pour générer des populations croisées F2 ainsi que la validation croisée dans différentes populations.
En effectuant la correction nécessaire pour les variations analytiques décrites ci-dessus, plusieurs approches intégrées peuvent être effectuées en plus des GWAS, telles que l’analyse de corrélation métabolite-métabolite, métabolite-lipide, l’analyse de corrélation aux données phénomiques pour faire la lumière sur des traits plus complexes et / ou l’analyse de co-expression pour démêler davantage la base des systèmes biologiques58.