Połączenie genomiki, analizy koekspresji genów oraz identyfikacji związków docelowych poprzez metabolizm umożliwia funkcjonalną adnotację genów.
Artykuł metodologiczny
Połączenie genomiki, analizy koekspresji genów oraz identyfikacji związków docelowych poprzez metabolizm umożliwia funkcjonalną adnotację genów.
Biorąc pod uwagę stale rosnącą liczbę gatunków roślin modelowych, dla których dostępne są kompletne sekwencje genomów, oraz obfitość zasobów biologicznych, takich jak mutanty z nokautem genów, akcesje dzikie i zaawansowane populacje hodowlane, rośnie obciążenie związane z funkcjonalną adnotacją genów. W niniejszym protokole przedstawiono adnotację funkcji genów roślin za pomocą połączonej analizy koekspresji genów, metabolomiki i informatyki (Rycina 1). Podejście to opiera się na teorii wykorzystania genów docelowych o znanej funkcji w celu identyfikacji nieadnotowanych genów, które prawdopodobnie biorą udział w określonym procesie metabolicznym, wraz z identyfikacją związków docelowych za pomocą metabolomiki. Przedstawiono strategie stosowania tych informacji w populacjach generowanych zarówno przez podejścia genetyki w przód (forward genetics), jak i genetyki wstecznej (reverse genetics), mimo że żadna z nich nie jest wolna od trudności. W konsekwencji podejście to może być również wykorzystane do charakterystyki nieznanych pików reprezentujących nowe lub specyficzne metabolity wtórne w ograniczonych tkankach, gatunkach roślin lub przy określonym traktowaniu stresowym, co obecnie stanowi istotne wyzwanie w zrozumieniu metabolizmu roślin.
1. Przygotowanie próbek
2. Ekstrakcja do profilowania metabolomitów
3. Profilowanie metabolitów metodą LC-MS
4. Analiza danych
5. Przewidywanie ścieżki metabolicznej
6. Przygotowanie listy genów z identyfikatorami genów ortologicznych Arabidopsis
7. Analiza genów współwyrażanych
8. Integracja wszystkich informacji w celu przewidywania nowych szlaków
9. Eksperymenty służące identyfikacji genów z wykorzystaniem zasobów biologicznych
10. Reprezentatywne wyniki
Procedura zintegrowanej analizy opisana w niniejszym protokole oferuje wiele możliwości, w zależności od określonego celu eksperymentalnego oraz wyboru kombinacji biologicznych i analitycznych. Dobór procedur i projekt eksperymentu powinny zostać przeprowadzone odpowiednio na podstawie docelowego szlaku, związków oraz gatunku rośliny. Strategia integracji opisana w tym protokole koncentruje się na adnotacji funkcji genów roślin oraz odkrywaniu nowych funkcji genów przy efektywnym wykorzystaniu kilku zasobów bio- i danych. Oczekiwany rezultat ma zapewnić jednoznaczna i rozstrzygającą predykcję. Fakt ten wskazuje, że jeśli profile kombinacji nie dostarczą wystarczających dowodów, eksperyment nie powinien być rozpoczynany. Z tego powodu w każdym przypadku dodatkowe eksperymenty wstępne, takie jak ukierunkowane profilowanie ekspresji genów za pomocą RT-PCR, mogą wesprzeć predykcję funkcji genu. Dokładność i poprawność predykcji korelują dodatnio z różnicą jakościową oraz liczbą wariantów kombinacji. Ponadto dobre kandydatury i wiarygodne wyniki mogą wynikać jedynie z dokładnej predykcji szlaków. Adnotacja szczytowa powinna być przeprowadzona poprzez kombinację kilku podejść, na przykład przegląd literatury, referencyjny ekstrakt roślinny, analiza MSn, specyficzność narządowa oraz analiza mutantów 13.

Rysunek 1. Przegląd przebiegu eksperymentu adnotacji genów z wykorzystaniem podejścia kombinowanego. W niektórych przypadkach projekty rozpoczynają się od odkrycia nowego piku, który jest wykrywany w szczególnych warunkach lub tkankach, oraz chęci zrozumienia jego roli w metabolizmie. W innych przypadkach celem projektu jest identyfikacja genu lub odkrycie kluczowych czynników regulacyjnych, takich jak czynniki transkrypcyjne. Projektowanie eksperymentu powinno opierać się na zestawie danych wykazującym wyraźne różnice w poziomach metabolitów w analizowanej ścieżce, z wykorzystaniem szerokiego zakresu próbek tkanek z różnych organów, roślin o zróżnicowanym wzroście lub roślin poddanych warunkom stresowym, oraz poddaniu materiału profilowaniu metabolitów. Rośliny mutanty i transgeniczne, a także materiał hodowlany zawierający QTL, stanowią również odpowiedni materiał genetyczny do tych badań. Przewidywanie nowych ścieżek powinno być przeprowadzane ostrożnie, z dokładną adnotacją piku i podejściem kombinowanym z różnymi typami metabolotypów, takimi jak specyfika organów i reakcje na stres, zgodnie z danymi dotyczącymi ekspresji genów w analizowanej ścieżce. W ostatnim kroku należy przeprowadzić profilowanie metabolitów i transkryptów, co w połączeniu z analizą in silico zasobów internetowych oraz charakterystyką ekspresji genów via ekspresji heterologicznej in vitro, doprowadzi ostatecznie do potwierdzenia kandydata genowego oraz wyjaśnienia jego funkcji i pozycji w ścieżce metabolicznej. Skróty: QTL, Quantitative Trait Loci.

Rycina 2. Schemat kombinowanego podejścia do adnotacji piku. Procedura identyfikacji i adnotacji piku za pomocą związku wzorcowego, porównanie typu dzikiego i mutantów z nokautem, wielowymiarowa spektrometria mas piku docelowego w odniesieniu do widm masowych czystych związków z baz danych 12. Skróty: DB, baza danych; KO, nokaut; 1-D, jednowymiarowy; 2-D, dwuwymiarowy; NMR, magnetyczny rezonans jądrowy; IR, podczerwień; MSn, wielokrotna spektrometria mas.

Rycina 3. Przykład analizy sieci koregulacji szlaku antrocyjanów. Analizy koekspresji przeprowadzono przy użyciu PRIMe (http://prime.psc.riken.jp/?action=coexpression_index) w oparciu o zestaw danych ATTEDII w wersji 3 8,2 przy użyciu programu Pajek (http://vlado.fmf.uni-lj.si/pub/networks/pajek/). Do tworzenia połączeń w sieci wykorzystano korelacje dodatnie (r<0,5). Czerwone węzły: dwanaście genów enzymatycznych szlaku antrocyjanów (At5g13930, CHS, TT4, syntaza chalkonu; At3g55120, CHI, TT5, izomeraza chalkonu; At3g51240, F3H, TT6, flawanonowa 3-hydroksylaza; At5g07990, F3'H, TT7, flawonoidowa 3'-hydroksylaza; At5g17050, Fd3GT, UGT78D2, flawonoidowa 3-O-glukozylotransferaza; At5g17220, AtGSTF12, TT19; At5g42800, DFR, TT3, reduktaza dihydroflawonolu; At4g22880, ANS/LDOX, TT18, syntetaza antrocyjanidyn; At4g14090, A5GT, antrocyjanowa 5-O-glukozylotransferaza; At5g54060, A3G2"XT, domniemana antrocyjanowa 3-O-glukozydowa 2"-O-ksylozylotransferaza; At3g29590, A5GMaT, antrocyjanowa 5-O-glukozydowa 6'''-O-malonylotransferaza; At1g03940, A3GCouT, antrocyjanowa 3-O-glukozydowa 6"-O-p-kumaroylotransferaza) oraz dwa czynniki transkrypcyjne odpowiedzialne za produkcję antrocyjanów (At1g56650, PAP1; At1g66390, PAP2) zostały użyte do wyszukiwania genów kandydackich. Geny kandydackie zidentyfikowano poprzez wyszukiwanie „przecięcia zbiorów” przy wartości progowej współczynnika r>0,50, zapytując o przecięcie zbiorów wszystkich analizowanych genów (czternaście genów biosyntezy antrocyjanów). Sieć koekspresji, obejmująca skorelowane geny kandydackie (68 genów) oraz geny zapytania (14 genów), została zrekonstruowana poprzez wyszukiwanie „połączeń zbiorów” przy r>0,50 z wykorzystaniem bazy danych PRIMe. Pliki wyjściowe sformatowane jako pliki '.net' z bazy danych PRIMe oraz sieci zostały wykreślone przy użyciu oprogramowania Pajek. Niebieskie węzły oznaczają geny kandydackie, które wykazały korelację z genami antrocyjanów.
| gatunek | Główny metabolit wtórny |
| Arabidopsis thaliana | Glukozynolan, flawonol, antocyjan, pochodna sinapoilowa |
| Populus trichocarpa | Flawonol, antocyjan, pochodna salicylanu |
| Vitis vinifera | Flawonol, antocyjan, tanina, stilben |
| Solanum lycopersicum | Flawonol, antocyjan, glikoalkaloid, związki pochodne chlorogenianu, |
| Nicotiana tabacum | Flawonol, antocyjan, nikotynamid, związki pochodne chlorogenianu, cukier acylowany |
| Oryza sativa | Glikoflawona, antocyjan, pochodne steroli |
| Zea may | Glikoflawona, antocyjan, benzoksazinon, pochodne steroli |
| Medicago truncatula | Izoflawona, antocyjan, saponina, |
| Lotus japonica | Izoflawona, flawonol, antocyjan, saponina, |
Tabela I. Główne metabolity wtórne u modelowych gatunków roślin.
| Baza danych koekspresji | Adres |
| Międzygatunkowe bazy roślinne | |
| COP | http://webs2.kazusa.or.jp/kagiana/cop0911/ |
| PlaNet | http://aranet.mpimp-golm.mpg.de/ |
| Gatunki roślin | |
| ATEED-II | http://atted.jp/ |
| BAR | http://142.150.214.117/welcome.htm |
| COP | http://webs2.kazusa.or.jp/kagiana/cop |
| GeneCAT | http://genecat.mpg.de/ |
| Arabidopsis | |
| ACT | http://www.arabidopsis.leeds.ac.uk/act/coexpanalyser |
| AthCoR@CSB.DB | http://csbdb.mpimp-golm.mpg.de/csbdb/dbcor/ath.html |
| CressExpress | http://cressexpress.org/ |
| PRIMe | http://prime.psc.riken.jp/?action=coexpression_index |
| Oryza sativa | |
| RiceArrayNet | http://arraynet.mju.ac.kr/arraynet/ |
| Baza danych Rice Array | http://www.ricearray.org/coexpression/coexpression.shtml |
Tabela II. Dostępna baza danych ekspresji genów do analizy koekspresji in silico.
Biorąc pod uwagę, że technologie transkryptomiczne i metabolomiczne są stosowane od kilku lat, proces integracji danych w celu adnotacji genów wspomaganej metabolomiką zazwyczaj rozpoczyna się od identyfikacji nowego piku reprezentującego nieznany metabolit. Fakt ten prowadzi do następnego etapu, którym jest ocena wariancji ilościowej pików metabolitów lub nowych genów kandydackich, które uznaje się za odpowiedzialne za ich biosyntezę. Strategia opisana w niniejszym protokole napotyka jednak trzy główne problemy: i) trudność w adnotacji pików, ii) złożoność przewidywania szlaków, iii) rozdzielczość informacji o genach oraz jakość danych o ekspresji genów. Aby rozwiązać pierwszy problem, adnotację pików należy przeprowadzić poprzez współelucję związków wzorcowych lub podejście kombinatoryczne z wykorzystaniem informacji z analizy MSn, ekstraktów referencyjnych, analizy mutantów, wyszukiwania w bazach danych metabolitów oraz przeglądu literatury (Rysunek 2, 12). W odniesieniu do drugiego problemu, przewidywanie szlaków jest możliwe jedynie po prawidłowej adnotacji pików. Niemniej jednak profilowanie metabolitów w zależności od specyfiki tkankowej może również wspierać adnotację pików, ponieważ akumulacja metabolitów powinna być skorelowana z ekspresją powiązanych genów. Dlatego połączenie profili z różnych tkanek i warunków wzrostu może być pomocne w rozwiązaniu tego drugiego problemu. Trzeci problem dotyczący rozdzielczości informacji o genach zależy od postępów w sekwencjonowaniu danych. W przypadku rośliny modelowej, której sekwencja genomu nie została ukończona, przydatna jest analiza koekspresji z wykorzystaniem genów ortologicznych u innych roślin modelowych. Szczegółowe porównanie dopasowania oraz analiza drzew filogenetycznych sekwencji aminokwasów mogą pomóc w powiązaniu organizmów modelowych z innymi gatunkami.
Niniejszy protokół jest odpowiedni dla wszystkich szlaków metabolicznych. Jest on najskuteczniejszy w analizie metabolizmu pośredniego i wtórnego, w których udowodniono występowanie silnej kontroli transkrypcyjnej 1,5,11,16. W niektórych przykładach analiza koekspresji została pomyślnie przeprowadzona w odniesieniu do asymilacji siarki, genów β-oksydacji, degradacji rozgałęzionych aminokwasów, rozkładu chlorofilu i katabolizmu lizyny 3, metabolizmu ściany komórkowej 10,7 oraz kaskady sygnalizacji świetlnej 14. Adnotacja funkcji genów poprzez połączenie genomiki, metabolomiki i informatyki służy nie tylko do identyfikacji genów biosyntetycznych i bezpośrednich regulatorów w postaci czynników transkrypcyjnych, ale także do zrozumienia procesów fizjologicznych i odpowiedzi organizmu (patrz przykład na Rysunku 3. 14).
Aby rozszerzyć tę metodę z roślin modelowych na gatunki uprawne, potężnym podejściem w badaniu ogólnego metabolizmu jest porównywanie metaboliczne między różnymi gatunkami roślin. Na przykład, jeśli ten sam związek zostanie wykryty u różnych gatunków roślin i zostaną zidentyfikowane w nich geny ortologiczne, analiza koekspresji międzygatunkowej z wykorzystaniem genów ortologicznych może dostarczyć silnych dowodów na poparcie postawionej hipotezy. Podejście to można zastosować w przypadku Arabidopsis, topoli, lucerny oraz ważnych roślin uprawnych, takich jak jęczmień, ryż, pszenica i soja, przeprowadzając analizę koekspresji gatunków roślin (6, PlaNet: http://aranet.mpimp-golm.mpg.de/,; 9, COP: http://webs2.kazusa.or.jp/kagiana/cop0911/; patrz przykład, 15).
Nie zadeklarowano żadnych konfliktów interesów.
Dziękujemy prof. Kazuki Saito z RIKEN PSC oraz dr. Bjoern Usadel z MPIMP za pomocne dyskusje. TT jest wspierany stypendium z fundacji Alexandra von Humboldta.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Woda destylowana klasy ULC/MS | BIOSOLVE | 23214102 | |
| Acetonitryl (ACN) klasy ULC/MS | BIOSOLVE | 01204102 | |
| Metanol (MeOH) klasy ULC/MS | BIOSOLVE | 13684102 | |
| Kwas mrawkowy (HCOOH) klasy ULC/MS do chromatografii cieczowej | BIOSOLVE | 06914131 | |
| Związki wzorcowe | EXTRASYNTHESE | ||
| System liniowej pułapki jonowej (IT) ESI-MS FINNIGAN-LTQ | Thermo Fisher Scientific, Inc. | ||
| System HPLC Surveyor | Thermo Fisher Scientific, Inc. | ||
| Kolumna analityczna Luna C18(2), średnica 2,0 mm, długość 150 mm, wielkość porów 100 Å i sferyczne cząstki 3 mm | Phenomenex | 00F-4251-B0 | |
| Oprogramowanie Xcalibur | Thermo Fisher Scientific, Inc. |
Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE
Poproś o pozwolenie