Połączenie genomiki, analizy koekspresji genów oraz identyfikacji związków docelowych poprzez metabolizm umożliwia funkcjonalną adnotację genów.
Artykuł metodologiczny
Połączenie genomiki, analizy koekspresji genów oraz identyfikacji związków docelowych poprzez metabolizm umożliwia funkcjonalną adnotację genów.
Biorąc pod uwagę stale rosnącą liczbę gatunków roślin modelowych, dla których dostępne są kompletne sekwencje genomów, oraz obfitość zasobów biologicznych, takich jak mutanty z nokautem genów, akcesje dzikie i zaawansowane populacje hodowlane, rośnie obciążenie związane z funkcjonalną adnotacją genów. W niniejszym protokole przedstawiono adnotację funkcji genów roślin za pomocą połączonej analizy koekspresji genów, metabolomiki i informatyki (Rycina 1). Podejście to opiera się na teorii wykorzystania genów docelowych o znanej funkcji w celu identyfikacji nieadnotowanych genów, które prawdopodobnie biorą udział w określonym procesie metabolicznym, wraz z identyfikacją związków docelowych za pomocą metabolomiki. Przedstawiono strategie stosowania tych informacji w populacjach generowanych zarówno przez podejścia genetyki w przód (forward genetics), jak i genetyki wstecznej (reverse genetics), mimo że żadna z nich nie jest wolna od trudności. W konsekwencji podejście to może być również wykorzystane do charakterystyki nieznanych pików reprezentujących nowe lub specyficzne metabolity wtórne w ograniczonych tkankach, gatunkach roślin lub przy określonym traktowaniu stresowym, co obecnie stanowi istotne wyzwanie w zrozumieniu metabolizmu roślin.
1. Przygotowanie próbek
2. Ekstrakcja do profilowania metabolitów
3. Profilowanie metabolitów metodą LC-MS
4. Analiza danych
5. Przewidywanie ścieżki metabolicznej
6. Przygotowanie listy genów z identyfikatorami genów ortologicznych Arabidopsis
7. Analiza genów współwyrażanych
8. Integracja wszystkich informacji w celu przewidywania nowych szlaków
9. Eksperymenty w celu identyfikacji genów z wykorzystaniem biozasobów
10. Reprezentatywne wyniki
Procedura analizy zintegrowanej opisana w niniejszym protokole oferuje wiele możliwości w zależności od określonego celu eksperymentalnego oraz wyboru kombinacji biologicznych i analitycznych. Dobór procedur i projekt eksperymentalny powinny zostać przeprowadzone odpowiednio na podstawie docelowego szlaku, związków oraz gatunku rośliny. Strategia integracji opisana w tym protokole koncentruje się na adnotacji funkcji genów roślin oraz odkrywaniu nowych funkcji genów przy efektywnym wykorzystaniu kilku zasobów biologicznych i danych. Oczekiwany rezultat obiecuje dostarczenie jedynie w przypadku jednoznacznej predykcji. Fakt ten wskazuje, że jeśli profile kombinacji nie dostarczą wystarczających dowodów, eksperyment nie powinien zostać rozpoczęty. Z tego powodu w każdym przypadku dodatkowe eksperymenty wstępne, takie jak ukierunkowane profilowanie ekspresji genów za pomocą RT-PCR, mogą wesprzeć predykcję funkcji genu. Dokładność i poprawność predykcji korelują dodatnio z różnicami jakościowymi oraz liczbą wariantów kombinacji. Ponadto odpowiedni kandydaci i wiarygodne wyniki mogą wynikać jedynie z dokładnej predykcji szlaków. Adnotacja piku powinna być przeprowadzana poprzez kombinację kilku podejść, na przykład przegląd literatury, referencyjny ekstrakt roślinny, analizę MSn, specyficzność organową oraz analizę mutantów 13.

Rysunek 1. Przegląd przebiegu eksperymentalnego adnotacji genów z zastosowaniem podejścia kombinowanego. W niektórych przypadkach projekty rozpoczynają się od odkrycia nowego piku wykrywanego w specyficznych warunkach lub tkankach oraz chęci zrozumienia jego roli w metabolizmie. W innych sytuacjach celem projektu jest identyfikacja genu lub odkrycie kluczowych czynników regulacyjnych, takich jak czynniki transkrypcyjne. Projekt eksperymentu powinien zostać zaplanowany w oparciu o zestaw danych wykazujący wyraźne różnice w poziomach metabolitów w docelowym szlaku, z wykorzystaniem szerokiego zakresu próbek tkanek z różnych organów, roślin o zróżnicowanym wzroście lub roślin narażonych na warunki stresowe, oraz poddaniem materiału profilowaniu metabolitów. Rośliny mutantowe i transgeniczne, a także materiał hodowlany zawierający QTL, stanowią również odpowiedni materiał genetyczny do tych badań. Przewidywanie nowych szlaków powinno być przeprowadzane ostrożnie, przy dokładnej adnotacji piku i zastosowaniu podejścia kombinowanego z różnymi typami metabolotypów, takimi jak specyfika organów i odpowiedzi na stres, zgodnie z danymi ekspresji genów w analizowanym szlaku. W ostatnim kroku należy przeprowadzić profilowanie metabolitów i transkryptów, co w połączeniu z analizą in silico zasobów sieciowych oraz charakterystyką ekspresji genów via ekspresja heterologiczna in vitro, doprowadzi ostatecznie do potwierdzenia genu kandydata oraz wyjaśnienia jego funkcji i pozycji w szlaku metabolicznym. Skróty: QTL, loci cech ilościowych.

Rysunek 2. Schemat kombinowanego podejścia do adnotacji pików. Procedura identyfikacji i adnotacji pików z wykorzystaniem związku wzorcowego, porównanie typu dzikiego i mutantów z nokautem, wielowymiarowa spektrometria mas piku docelowego w odniesieniu do widm mas czystych związków z baz danych 12. Skróty: DB, baza danych; KO, nokaut; 1-D, jednowymiarowy; 2-D, dwuwymiarowy; NMR, magnetyczny rezonans jądrowy; IR, podczerwień; MSn, wielostopniowa spektrometria mas.

Rysunek 3. Przykład analizy sieci koregulacji szlaku biosyntezy antocyjanów. Analizy koekspresji przeprowadzono za pomocą PRIMe (http://prime.psc.riken.jp/?action=coexpression_index) w oparciu o zestaw danych ATTEDII wersja 3 8,2 z wykorzystaniem programu Pajek (http://vlado.fmf.uni-lj.si/pub/networks/pajek/). Do tworzenia połączeń w sieci wykorzystano korelacje dodatnie (r<0.5). Czerwone węzły: dwanaście genów enzymatycznych szlaku antocyjanów (At5g13930, CHS, TT4, syntaza chalkonu; At3g55120, CHI, TT5, izomeraza chalkonu; At3g51240, F3H, TT6, flawanonowa 3-hydroksylaza; At5g07990, F3'H, TT7, flawonoidowa 3'-hydroksylaza; At5g17050, Fd3GT, UGT78D2, flawonoidowa 3-O-glukozylotransferaza; At5g17220, AtGSTF12, TT19; At5g42800, DFR, TT3, reduktaza dihydroflawonolu; At4g22880, ANS/LDOX, TT18, syntaza antocyjanidyn; At4g14090, A5GT, antocyjanowa 5-O-glukozylotransferaza; At5g54060, A3G2"XT, domniemana antocyjanowa 3-O-glukozydowa 2"-O-ksylozylotransferaza; At3g29590, A5GMaT, antocyjanowa 5-O-glukozydowa 6'''-O-malonylotransferaza; At1g03940, A3GCouT, antocyjanowa 3-O-glukozydowa 6"-O-p-kumarojlotransferaza) oraz dwa czynniki transkrypcyjne odpowiedzialne za produkcję antocyjanów (At1g56650, PAP1; At1g66390, PAP2) zostały wykorzystane do wyszukiwania genów kandydatów. Geny kandydaty zidentyfikowano poprzez wyszukiwanie metodą „iloczynu zbiorów” (intersection of sets) z wartością progową współczynnika r>0.50, zapytaniem o iloczyn zbiorów wszystkich analizowanych genów (czternaście genów biosyntezy antocyjanów). Sieć koekspresji, obejmująca skorelowane geny kandydaty (68 genów) oraz geny analizowane (14 genów), została zrekonstruowana poprzez wyszukiwanie metodą „połączeń zbiorów” (interconnection of sets) przy r>0.50 z wykorzystaniem bazy danych PRIMe. Pliki wyjściowe sformatowane jako pliki „.net” z bazy PRIMe oraz sieci zostały wykreślone za pomocą oprogramowania Pajek. Niebieski węzeł oznacza geny kandydaty, które wykazały korelację z genami antocyjanów.
| gatunki | Główny metabolit wtórny |
| Arabidopsis thaliana | Glukozynolan, flawonol, antocyjan, pochodna sinapoilowa |
| Populus trichocarpa | Flawonol, antocyjan, pochodna salicylanu |
| Vitis vinifera | Flawonol, antocyjan, tanina, stilben |
| Solanum lycopersicum | flawonol, antocyjan, glikoalkaloid, związki pochodne kwasu chlorogenowego, |
| Nicotiana tabacum | flawonol, antocyjan, nikotynamid, związki pochodne kwasu chlorogenowego, cukier acylowany |
| Oryza sativa | glikoflawona, antocyjan, pochodne steroli |
| Zea mays | glikoflawona, antocyjan, benzoksazinon, pochodne steroli |
| Medicago truncatula | izoflawona, antocyjan, saponina, |
| Lotus japonica | izoflawona, flawonol, antocyjan, saponina, |
Tabela I. Główne metabolity wtórne u modelowych gatunków roślin.
| Baza danych koekspresji | Adres |
| Międzygatunkowe bazy roślin | |
| COP | http://webs2.kazusa.or.jp/kagiana/cop0911/ |
| PlaNet | http://aranet.mpimp-golm.mpg.de/ |
| Gatunki roślin | |
| ATEED-II | http://atted.jp/ |
| BAR | http://142.150.214.117/welcome.htm |
| COP | http://webs2.kazusa.or.jp/kagiana/cop |
| GeneCAT | http://genecat.mpg.de/ |
| Arabidopsis | |
| ACT | http://www.arabidopsis.leeds.ac.uk/act/coexpanalyser |
| AthCoR@CSB.DB | http://csbdb.mpimp-golm.mpg.de/csbdb/dbcor/ath.html |
| CressExpress | http://cressexpress.org/ |
| PRIMe | http://prime.psc.riken.jp/?action=coexpression_index |
| Oryza sativa | |
| RiceArrayNet | http://arraynet.mju.ac.kr/arraynet/ |
| Rice Array Database | http://www.ricearray.org/coexpression/coexpression.shtml |
Tabela II. Dostępna baza danych ekspresji genów do analizy koekspresji in silico.
Biorąc pod uwagę, że technologie transkryptomiczne i metabolomiczne są stosowane od kilku lat, proces integracji danych w celu adnotacji genów wspomaganej metabolomiką zazwyczaj rozpoczyna się od identyfikacji nowego piku reprezentującego nieznany metabolit. Fakt ten prowadzi do następnego etapu, którym jest ocena wariancji ilościowej pików metabolitów lub nowych genów kandydackich, które uznaje się za odpowiedzialne za ich biosyntezę. Strategia opisana w niniejszym protokole napotyka jednak trzy główne problemy: i) trudność w adnotacji pików, ii) złożoność przewidywania szlaków, iii) rozdzielczość informacji o genach oraz jakość danych o ekspresji genów. Aby rozwiązać pierwszy problem, adnotację pików należy przeprowadzić poprzez współelucję związków wzorcowych lub podejście kombinatoryczne z wykorzystaniem informacji z analizy MSn, ekstraktów referencyjnych, analizy mutantów, wyszukiwania w bazach danych metabolitów oraz przeglądu literatury (Rysunek 2, 12). W odniesieniu do drugiego problemu, przewidywanie szlaków jest możliwe jedynie po prawidłowej adnotacji pików. Niemniej jednak profilowanie metabolitów w zależności od specyfiki tkankowej może również wspierać adnotację pików, ponieważ akumulacja metabolitów powinna być skorelowana z ekspresją powiązanych genów. Dlatego połączenie profili z różnych tkanek i warunków wzrostu może być pomocne w rozwiązaniu tego drugiego problemu. Trzeci problem dotyczący rozdzielczości informacji o genach zależy od postępów w sekwencjonowaniu danych. W przypadku rośliny modelowej, której sekwencja genomu nie została ukończona, przydatna jest analiza koekspresji z wykorzystaniem genów ortologicznych u innych roślin modelowych. Szczegółowe porównanie dopasowania oraz analiza drzew filogenetycznych sekwencji aminokwasów mogą pomóc w powiązaniu organizmów modelowych z innymi gatunkami.
Niniejszy protokół jest odpowiedni dla wszystkich szlaków metabolicznych. Jest on najskuteczniejszy w analizie metabolizmu pośredniego i wtórnego, w których udowodniono występowanie silnej kontroli transkrypcyjnej 1,5,11,16. W niektórych przykładach analiza koekspresji została pomyślnie przeprowadzona w odniesieniu do asymilacji siarki, genów β-oksydacji, degradacji rozgałęzionych aminokwasów, rozkładu chlorofilu i katabolizmu lizyny 3, metabolizmu ściany komórkowej 10,7 oraz kaskady sygnalizacji świetlnej 14. Adnotacja funkcji genów poprzez połączenie genomiki, metabolomiki i informatyki służy nie tylko do identyfikacji genów biosyntetycznych i bezpośrednich regulatorów w postaci czynników transkrypcyjnych, ale także do zrozumienia procesów fizjologicznych i odpowiedzi organizmu (patrz przykład na Rysunku 3. 14).
Aby rozszerzyć tę metodę z roślin modelowych na gatunki uprawne, potężnym podejściem w badaniu ogólnego metabolizmu jest porównywanie metaboliczne między różnymi gatunkami roślin. Na przykład, jeśli ten sam związek zostanie wykryty u różnych gatunków roślin i zostaną zidentyfikowane w nich geny ortologiczne, analiza koekspresji międzygatunkowej z wykorzystaniem genów ortologicznych może dostarczyć silnych dowodów na poparcie postawionej hipotezy. Podejście to można zastosować w przypadku Arabidopsis, topoli, lucerny oraz ważnych roślin uprawnych, takich jak jęczmień, ryż, pszenica i soja, przeprowadzając analizę koekspresji gatunków roślin (6, PlaNet: http://aranet.mpimp-golm.mpg.de/,; 9, COP: http://webs2.kazusa.or.jp/kagiana/cop0911/; patrz przykład, 15).
Nie zadeklarowano żadnych konfliktów interesów.
Dziękujemy prof. Kazuki Saito z RIKEN PSC oraz dr. Bjoern Usadel z MPIMP za pomocne dyskusje. TT jest wspierany stypendium z fundacji Alexandra von Humboldta.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Woda destylowana klasy ULC/MS | BIOSOLVE | 23214102 | |
| Acetonitryl (ACN) klasy ULC/MS | BIOSOLVE | 01204102 | |
| Metanol (MeOH) klasy ULC/MS | BIOSOLVE | 13684102 | |
| Kwas mrawkowy (HCOOH) klasy ULC/MS do chromatografii cieczowej | BIOSOLVE | 06914131 | |
| Związki wzorcowe | EXTRASYNTHESE | ||
| System liniowej pułapki jonowej (IT) ESI-MS FINNIGAN-LTQ | Thermo Fisher Scientific, Inc. | ||
| System HPLC Surveyor | Thermo Fisher Scientific, Inc. | ||
| Kolumna analityczna Luna C18(2), średnica 2,0 mm, długość 150 mm, wielkość porów 100 Å i sferyczne cząstki 3 mm | Phenomenex | 00F-4251-B0 | |
| Oprogramowanie Xcalibur | Thermo Fisher Scientific, Inc. |