Artykuł metodologiczny

Wykorzystanie SCOPE do identyfikacji potencjalnych motywów regulacyjnych w genach współregulowanych

10.8K wyświetleń

DOI:

10.3791/2703

31 maja 2011

W tym artykule

Podsumowanie

Przedstawiono prostą i niezawodną metodę identyfikacji potencjalnych motywów regulacyjnych w genach współregulowanych. SCOPE nie wymaga żadnych parametrów użytkownika i zwraca motywy, które stanowią doskonałych kandydatów na sygnały regulacyjne. Identyfikacja takich sygnałów regulacyjnych pomaga w zrozumieniu mechanizmów biologicznych leżących u podstaw tych procesów.

Streszczenie

SCOPE to zestaw algorytmów do wyszukiwania motywów, który wykorzystuje trzy równoległe algorytmy składowe w celu identyfikacji potencjalnych motywów regulacyjnych na podstawie nadreprezentacji oraz preferencji pozycji motywu1. Każdy z algorytmów składowych jest zoptymalizowany pod kątem wyszukiwania innego rodzaju motywu. Dzięki zastosowaniu najlepszych rozwiązań z tych trzech podejść, SCOPE wykazuje wyższą skuteczność niż jakikolwiek pojedynczy algorytm, nawet w przypadku danych zaszumionych1. W niniejszym artykule wykorzystujemy wersję internetową SCOPE2 do analizy genów zaangażowanych w utrzymanie telomerów. SCOPE został włączony do co najmniej dwóch innych programów do wyszukiwania motywów3,4 i był stosowany w innych badaniach5-8.

Trzy algorytmy wchodzące w skład SCOPE to BEAM9, który wyszukuje motywy niedegenerowane (ACCGGT), PRISM10, który wyszukuje motywy degenerowane (ASCGWT), oraz SPACER11, służący do wyszukiwania dłuższych motywów dwudzielnych (ACCnnnnnnnnGGT). Te trzy algorytmy zostały zoptymalizowane pod kątem wyszukiwania odpowiadających im typów motywów. Wspólnie pozwalają one SCOPE na osiągnięcie bardzo wysokiej wydajności.

Po przeanalizowaniu zestawu genów i zidentyfikowaniu potencjalnych motywów, program SCOPE może wyszukać inne geny zawierające dany motyw, których dodanie do pierwotnego zestawu zwiększy wynik motywu (motif score). Może to wynikać z nadreprezentacji lub preferencji dotyczących pozycji motywu. Pracując na częściowych zestawach genów z biologicznie zweryfikowanymi miejscami wiązania czynników transkrypcyjnych, SCOPE był w stanie zidentyfikować większość pozostałych genów regulowanych przez dany czynnik transkrypcyjny.

Wyniki z programu SCOPE prezentują potencjalne motywy, ich istotność oraz inne informacje w formie tabeli i graficznej mapy motywów. Na stronie internetowej SCOPE dostępne są najczęściej zadawane pytania (FAQ) oraz samouczki wideo, a także przycisk „Sample Search”, który umożliwia użytkownikowi przeprowadzenie próbnego wyszukiwania.

Scope posiada bardzo przyjazny interfejs użytkownika, który umożliwia początkującym użytkownikom wykorzystanie pełnych możliwości algorytmu bez konieczności zostawania ekspertem w dziedzinie bioinformatyki wyszukiwania motywów. Jako dane wejściowe SCOPE może przyjmować listę genów lub sekwencje FASTA. Mogą one zostać wprowadzone w polach tekstowych przeglądarki lub wczytane z pliku. Wyniki z SCOPE zawierają listę wszystkich zidentyfikowanych motywów wraz z ich wynikami (scores), liczbą wystąpień, frakcją genów zawierających dany motyw oraz informacją o algorytmie użytym do jego identyfikacji. Dla każdego motywu szczegóły wyników obejmują reprezentację konsensusową motywu, logo sekwencyjne, macierz wag pozycji (position weight matrix) oraz listę instancji dla każdego wystąpienia motywu (z podaniem dokładnych pozycji i „nici”). Wyniki są wyświetlane w oknie przeglądarki, a opcjonalnie przesyłane również pocztą elektroniczną. Wcześniejsze publikacje szczegółowo opisują algorytmy SCOPE1,2,9-11.

Protokół

1. Przygotuj listę nazw genów, które w Twojej ocenie podlegają współregulacji, w celu przeprowadzenia analizy za pomocą programu SCOPE.

Zapisz listę jako plik tekstowy lub skopiuj ją do schowka, aby wkleić ją do SCOPE w kroku 3. Plik powinien zawierać jedną nazwę genu w każdej linii, bez żadnych dodatkowych informacji. Alternatywnie można przygotować listę w formacie pliku FASTA zawierającego sekwencje do analizy.

2. Uruchom przeglądarkę internetową i przejdź pod adres URL: http://genie.dartmouth.edu/SCOPE/

3. Wprowadź informacje niezbędne do przeprowadzenia analizy przez program SCOPE.

Początkowa strona SCOPE została przedstawiona na Rysunku 1. W tym kroku omówiono poszczególne sekcje.

  1. Użyj menu rozwijanego „Species”, aby wybrać gatunek, który będziesz badać. Wybór właściwego gatunku jest istotny, ponieważ program SCOPE odwołuje się do genomu w celu obliczenia częstotliwości tła występowania każdego badanego motywu kandydującego.
  2. Użyj przycisków opcji „upstream sequence”, aby wybrać sekwencję międzygenową (intergenic) lub o stałej długości (fixed length). Opcja międzygenowa przeanalizuje całą sekwencję między badanym genem a poprzednim (powyżej) genem. Oznacza to, że dla każdego genu zostaną użyte różne długości sekwencji upstream. Wybranie stałej długości spowoduje analizę dokładnie określonej liczby nukleotydów powyżej początku bieżącego genu. W tym przypadku SCOPE zbada tę samą długość sekwencji upstream dla każdego genu, nawet jeśli rozciąga się ona na poprzedni gen (lub nie). Zazwyczaj najlepszą długością do wyboru jest 800 nts, ale może się to różnić w zależności od gatunku.
  3. Następnie wskaż programowi SCOPE, jaki zestaw genów ma przeanalizować, wklejając listę genów do pola tekstowego listy genów lub naciskając przycisk „choose file”, aby wybrać plik zawierający wcześniej utworzoną listę genów. Możesz również wkleić plik sekwencji FASTA do tego samego pola tekstowego.
  4. Kolejna sekcja strony zawiera pole wyboru „Examine genome for other genes containing found motif(s)?”. Ta opcja może znacznie wydłużyć czas analizy, ponieważ SCOPE musi ocenić każdy inny gen w genomie. Może to być jednak bardzo przydatne w identyfikacji innych genów, które są dobrymi kandydatami do współregulacji z genami z początkowego zestawu. Ponieważ analizy SCOPE są stosunkowo szybkie, zaleca się pozostawienie tej opcji wyłączonej w początkowej analizie. Można ją zawsze włączyć na stronie wyników, aby ponownie uruchomić analizę, jak wyjaśniono w sekcji wyników.
  5. Sekcję „Results must include” można wykorzystać do wpisania motywu, który ma zostać uwzględniony przez SCOPE w analizie. Może to być przydatne, jeśli szukasz konkretnego motywu.
  6. Ostatnią sekcję na stronie można wykorzystać do wpisania adresu e-mail oraz komentarza, który zostanie zapisany wraz z analizą. Jeśli te dane zostaną uzupełnione, SCOPE wyśle wiadomość e-mail z linkiem powrotnym do strony internetowej zawierającej wyniki, a także dwa załączniki. Pierwszym jest plik tekstowy zawierający wszystkie wyniki analizy w formacie czytelnym dla człowieka. Drugi załącznik zawiera plik XML z każdym wynikiem znalezionym przez SCOPE w formacie czytelnym dla komputera. Plik XML jest bardzo przydatny, jeśli chcesz przeprowadzić dodatkową analizę wyników. Oba pliki są kompresowane w formacie „zip” przed wysłaniem w wiadomości e-mail.
  7. W tym pokazie zaczniemy od tych samych informacji. Można to łatwo osiągnąć, naciskając przycisk „Sample Search”, który uzupełni niezbędne dane. Naciśnij ten przycisk teraz. Zostaną wprowadzone trzy geny, a dla pozostałych pól zostaną dokonane odpowiednie wybory. Pozostaw je w takim ustawieniu. Te trzy geny biorą udział w utrzymaniu telomerów u Saccharomyces cerevisiae. Uzupełniony formularz przedstawiono na Rysunku 2. Naciśnij przycisk „Run SCOPE” na dole strony, aby rozpocząć analizę.

4. Reprezentatywne wyniki:

Główne wyniki analizy przedstawiono na Rysunku 3. W górnej części strony znajduje się tabela z informacjami o motywach wykrytych przez SCOPE. Pierwsza kolumna zawiera listę znalezionych motywów, a małe kolorowe kwadraty służą jako legenda dla przedstawionej poniżej graficznej mapy motywów. Wyświetlanie dowolnego motywu można włączyć lub wyłączyć, klikając w kolorowe pole (lub w miejsce, w którym powinno się ono znajdować). Może to być bardzo przydatne w celu ukrycia motywów występujących bardzo często, co mogłoby utrudnić dostrzeżenie rzadszych wzorców motywów.

Pozostałe kolumny danych to Count (liczba wystąpień danego motywu w całym zbiorze genów), Sig value (wskaźnik istotności tego motywu), Coverage (procent przesłanych genów zawierających co najmniej jedną instancję tego motywu) oraz Algorithm (informacja o tym, który z trzech algorytmów składowych został użyty do wykrycia motywu).

Kliknięcie dowolnego z wymienionych motywów przeniesie użytkownika na stronę zawierającą szczegółowe informacje na temat tego motywu. Szczegóły wyników dla motywu cyjanowego (atgnnnnttg) przedstawiono na Rysunku 4. Na tej stronie motyw jest reprezentowany na trzy sposoby: jako logo sekwencji, macierz wag pozycyjnych (position weight matrix) oraz lista wszystkich wystąpień motywu wraz z ich pozycjami, nićmi i genami.

Nieco niżej na stronie znajdują się dodatkowe szczegóły dotyczące wyników poszukiwań innych genów zawierających ten motyw. Jak widać, w tym przypadku znaleziono 1344 inne geny zawierające ten motyw, z których każdy w rzeczywistości poprawił wartość Sig po dodaniu do pierwotnego zestawu genów. Kliknięcie przycisku „Add checked genes to search” spowoduje powrót do strony konfiguracji SCOPE z tymi genami dodanymi do pierwotnego zestawu genów i parametrami ustawionymi tak, jak wcześniej. W tym przypadku do pierwotnych trzech genów dodano 10 dodatkowych genów.

Rysunek 5 przedstawia wyniki analizy uwzględniającej dodatkowe geny dla tego motywu. Trzy oryginalne geny znajdują się na dole wyników (zapisane małymi literami). Analiza wzorca motywów w regionie upstream tych dodatkowych genów wyraźnie pokazuje, że są one podobne. W rzeczywistości wiele z tych genów, podobnie jak trzy pierwotne geny, bierze udział w utrzymaniu telomerów. Należy również zauważyć, że oryginalny motyw jest obecnie motywem o najwyższej punktacji w tym zbiorze.

Kolejny zestaw wyników SCOPE przedstawiono na rysunku 6. W tym przypadku zestaw genów obejmuje te, które biorą udział w biogenezie rybosomów u Saccharomyces cerevisiae. Geny te nie są właściwie częścią rybosomu, lecz odpowiadają za montaż rybosomów i obejmują szereg enzymów modyfikujących. Z rysunku jasno wynika, że motywy czerwone i zielone tworzą wiarygodny wzorzec, który prawdopodobnie bierze udział w regulacji genów z tego zestawu. Badamy ten wzorzec „modułów” bardziej szczegółowo i przedstawimy wyniki w późniejszej publikacji.

Interfejs oprogramowania SCOPE do wyszukiwania motywów DNA; wyświetla opcje wejściowe dla analizy sekwencji genomicznej.
Rysunek 1. Główna strona wejściowa SCOPE. Strona ta służy do wprowadzania genów do analizy oraz do zdefiniowania gatunku i długości badanego regionu powyżej miejsca startu transkrypcji. Opcjonalnie użytkownik może poprosić o przesłanie wyników pocztą elektroniczną lub ograniczyć wyszukiwanie do określonego motywu. Dostępna jest również pomoc w formie wideo.

Interfejs narzędzia SCOPE do identyfikacji regulatorowych motywów DNA; konfiguracja analizy bioinformatycznej.
Rycina 2. Główna strona wejściowa SCOPE z uzupełnionymi wartościami do przeprowadzenia wyszukiwania. Parametry te są wynikiem naciśnięcia przycisku „Sample Search”. W tym przypadku zaznaczone jest pole wyboru służące do znalezienia innych genów zawierających motywy znalezione przez SCOPE. Ta opcja wymaga dłuższego czasu obliczeń (konieczne jest zbadanie każdego genu w genomie), ale może dostarczyć interesujących informacji.

Wyniki analizy motywów SCOPE na wykresie; konsensus sekwencji, istotność i porównanie algorytmów.
Rysunek 3. Główna strona wyników SCOPE. Strona ta podsumowuje wyniki wyszukiwania w programie SCOPE. Przedstawiona jest lista wszystkich motywów o wysokich wynikach, a kolorowa mapa motywów pokazuje położenie zidentyfikowanych motywów w analizowanym zestawie genów. Kliknięcie w kolorowy kwadrat obok motywu przełącza wyświetlanie tego motywu na mapie. Oprócz wyniku istotności (wartość Sig) podano również ułamek genów zawierających dany motyw (pokrycie) oraz algorytm użyty do znalezienia tego motywu.

Schemat analizy sekwencji konsensusowej; tabela PWM, logo sekwencji, mapowanie pozycji dla badania DNA.
Tabela danych mapowania genów; wyniki analizy motywów DNA; identyfikacja genów, występowanie, istotność.
Rycina 4. Ta strona szczegółów wyników wyświetla się po kliknięciu konkretnego motywu na głównej stronie wyników. Przedstawia ona szczegóły poszczególnego motywu. Logo sekwencji, macierz wag pozycji (PWM) oraz sekwencja konsensusowa stanowią różne rodzaje podsumowania listy instancji motywu, która również znajduje się na stronie. Ponieważ w oryginalnych ustawieniach wyszukiwania zaznaczono opcję „find extra genes”, na stronie znajdują się również informacje o innych genach w genomie, które zawierają ten motyw. Z tej strony można również uruchomić kolejną analizę SCOPE, uwzględniając dodatkowe geny zidentyfikowane na tej stronie.

Równowaga statyczna; ΣFx=0; Tabela danych i wykres motywów sekwencji; Wyniki analizy bioinformatycznej.
Rysunek 5. Na tym rysunku przedstawiono wyniki wyszukiwania dodatkowych genów dla motywu „atgnnnnttg” pokazanego na Rysunku 4. Trzy pierwotne geny zapisano małymi literami na dole mapy motywów. Dodatkowe geny przedstawiono wielkimi literami. W regionach upstream tych genów widoczny jest wyraźny wzorzec motywów. Należy również zauważyć, że dla określonego motywu algorytm jest wskazany jako „LOOKUP”, ponieważ w ten sposób został on zidentyfikowany. W rzeczywistości odpowiada on 5temu motywowi znalezionemu przez SPACER w tej analizie.

Wykres odkrywania motywów i dane; wyniki analizy sekwencji; porównanie wyników algorytmu SCOPE.
Rycina 6. Wyniki SCOPE dla genów zaangażowanych w biogenezę rybosomów u Saccharomyces cerevisiae. Zwróć uwagę na konserwowany wzór modułów składających się z motywów 'aaawtttbh' (czerwony) i 'abctcatcd' (zielony), oddzielonych od siebie o około 10-30 nts i występujących 100-200 nukleotydów powyżej miejsca startu transkrypcji danego genu.

Dyskusja

SCOPE dostarcza badaczowi potężnego narzędzia do identyfikacji potencjalnych motywów regulacyjnych w zestawach genów regulowanych koordynacyjnie. Użytkownik nie musi zgadywać rozmiaru motywu ani liczby jego wystąpień, co jest wymagane w wielu innych serwisach do wyszukiwania motywów. Parametry te są w zasadzie nieznane do momentu zidentyfikowania motywu. Interfejs jest bardzo prosty zarówno w zakresie wprowadzania sekwencji lub nazw genów, jak i przeglądania wyników.

Wyniki programu SCOPE dostarczają szczegółowych informacji o wszystkich zidentyfikowanych motywach, wykorzystując trzy różne sposoby ich reprezentacji. Każna instancja motywu we wszystkich genach jest wymieniona wraz z informacją o pozycji i „nici”. Wyniki graficzne w formie map motywów zapewniają przejrzystą wizualizację, która jest łatwa do zrozumienia i stanowi intuicyjny sposób dostrzegania wzorców w występujących motywach.

SCOPE wykazuje bardzo wysoką odporność na obecność szumów w danych. Zazwyczaj przyjmują one formę dodatkowych genów w zestawie początkowym, które w rzeczywistości mogą nie być współregulowane z pozostałymi genami. Często zdarza się to w przypadku rozpoczęcia analizy od genów wykazujących koekspresję w eksperymentach z zastosowaniem mikromacierzy. Czasami eksperyment jest obarczony szumem lub w warunkach eksperymentalnych wykorzystanych w badaniu z mikromacierzami może dojść do aktywacji kilku czynników transkrypcyjnych. Różne czynniki transkrypcyjne będą prawdopodobnie posiadały różne miejsca docelowe w DNA. Nawet przy czterokrotnej liczbie genów obcych (stosunek szumu do sygnału 4:1), SCOPE wciąż zachowuje 50% dokładności w przewidywaniu miejsc1.

Mimo że SCOPE zawiera ponad 2 miliony synonimów nazw genów, zdarza się, że nie identyfikuje niektórych z nich. Nieustannie aktualizujemy nasze listy synonimów, jednak czasami okazuje się, że różne synonimy odnoszą się do tego samego genu. W takich przypadkach nie wprowadzamy tych synonimów ze względu na dwuznaczność. Jeśli nazwa genu nie zostanie odnaleziona przez SCOPE, zaleca się skorzystanie z witryny specyficznej dla danego genomu w celu znalezienia alternatywnej nazwy genu do wykorzystania w SCOPE. Przykłady odpowiednich nazw genów dla poszczególnych gatunków są udostępnione w SCOPE.

SCOPE zawiera obecnie 72 gatunki, a nowe gatunki są stale dodawane. Strona internetowa zawiera pomoc w formie wideo oraz sekcję najczęściej zadawanych pytań (FAQ). Kod źródłowy jest bezpłatnie dostępny dla użytkowników akademickich po przesłaniu zapytania do RHG.

Oświadczenia

Brak zadeklarowanych konfliktów interesów.

Podziękowania

Badanie to zostało sfinansowane z grantu przyznanego RHG przez National Science Foundation, DBI-0445967.

Bibliografia

  1. Chakravarty, A., Carlson, J. M., Khetani, R. S., Gross, R. H. A novel ensemble learning method for de novo computational identification of DNA binding sites. BMC Bioinformatics. 8, 249-249 (2007).
  2. Carlson, J. M., Chakravarty, A., DeZiel, C. E., Gross, R. H. SCOPE: a web server for practical de novo motif discovery. Nucleic Acids Res. 35, 259-264 (2007).
  3. Blom, E. J., Roerdink, J. B., Kuipers, O. P., Hijum, S. A. van MOTIFATOR: detection and characterization of regulatory motifs using prokaryote transcriptome data. Bioinformatics. 25, 550-551 (2009).
  4. Blom, E. J. DISCLOSE : DISsection of CLusters Obtained by SEries of transcriptome data using functional annotations and putative transcription factor binding sites. BMC Bioinformatics. 9, 535-535 (2008).
  5. Bushey, A. M., Ramos, E., Corces, V. G. Three subclasses of a Drosophila insulator show distinct and cell type-specific genomic distributions. Genes Dev. 23, 1338-1350 (2009).
  6. Znaidi, S. Identification of the Candida albicans Cap1p regulon. Eukaryot Cell. 8, 806-820 (2009).
  7. Sharma, D., Mohanty, D., Surolia, A. RegAnalyst: a web interface for the analysis of regulatory motifs, networks and pathways. Nucleic Acids Res. 37, W193-W201 (2009).
  8. Znaidi, S. Genomewide location analysis of Candida albicans Upc2p, a regulator of sterol metabolism and azole drug resistance. Eukaryot Cell. 7, 836-847 (2008).
  9. Carlson, J., Chakravarty, A., Gross, R. B. E. A. M. A beam search algorithm for the identification of cis-regulatory elements in groups of genes. J Comput Biol. 13, 686-701 (2006).
  10. Carlson, J., Chakravarty, A., Khetani, R., Gross, R. Bounded search for de novo identification of degenerate cis-regulatory elements. BMC Bioinformatics. 7, 254-254 (2006).
  11. Chakravarty, A., Carlson, J. M., Khetani, R. S., DeZiel, C. E., Gross, R. H. SPACER: identification of cis-regulatory elements with non-contiguous critical residues. Bioinformatics. 23, 1029-1031 (2007).

Przedruki i uprawnienia

Tagi

Identyfikacja motywów regulacyjnychalgorytm SCOPEwyszukiwanie motywówanaliza zestawów genówutrzymanie telomerówpodejście ansamblowenadreprezentacja motywówmacierz wag pozycyjnychlogo sekwencjikoregulacja genów