Artykuł metodologiczny

Wykorzystanie SCOPE do identyfikacji potencjalnych motywów regulacyjnych w genach współregulowanych

DOI:

10.3791/2703

31 maja 2011

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przedstawiono prostą i solidną metodę identyfikacji potencjalnych motywów regulacyjnych w genach współregulowanych. SCOPE nie wymaga żadnych parametrów użytkownika i zwraca motywy, które są doskonałymi kandydatami na sygnały regulacyjne. Identyfikacja takich sygnałów regulacyjnych pomaga zrozumieć biologię leżącą u ich podstaw.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

SCOPE to wyszukiwarka motywów zespołowych, która wykorzystuje trzy algorytmy składowe równolegle do identyfikacji potencjalnych motywów regulacyjnych poprzez nadreprezentację i preferencję pozycji motywu1. Każdy algorytm komponentu jest zoptymalizowany pod kątem znalezienia innego rodzaju motywu. Wykorzystując najlepsze z tych trzech podejść, SCOPE działa lepiej niż jakikolwiek pojedynczy algorytm, nawet w obecności zaszumionych danych1. W tym artykule wykorzystujemy internetową wersję SCOPE2 do zbadania genów zaangażowanych w utrzymanie telomerów. SCOPE został włączony do co najmniej dwóch innych programów do wyszukiwania motywów3,4 i był używany w innych badaniach5-8.

Trzy algorytmy składające się na SCOPE to BEAM9, który znajduje motywy niezdegenerowane (ACCGGT), PRISM10, który znajduje motywy zdegenerowane (ASCGWT) i SPACER11, który znajduje dłuższe motywy dwudzielne (ACCnnnnnnnnGGT). Te trzy algorytmy zostały zoptymalizowane pod kątem znalezienia odpowiadającego im typu motywu. Razem pozwalają one SCOPE działać wyjątkowo dobrze.

Po przeanalizowaniu zestawu genów i zidentyfikowaniu motywów kandydujących, SCOPE może szukać innych genów zawierających ten motyw, które po dodaniu do oryginalnego zestawu poprawią wynik motywu. Może się to zdarzyć poprzez nadreprezentację lub preferencję pozycji motywu. Pracując z częściowymi zestawami genów, które mają biologicznie zweryfikowane miejsca wiązania czynnika transkrypcyjnego, zespół projektu SCOPE był w stanie zidentyfikować większość pozostałych genów również regulowanych przez dany czynnik transkrypcyjny.

Dane wyjściowe z SCOPE pokazują motywy kandydujące, ich znaczenie i inne informacje zarówno w formie tabeli, jak i graficznej mapy motywów. Najczęściej zadawane pytania i filmy instruktażowe są dostępne na stronie internetowej SCOPE, która zawiera również przycisk "Sample Search", który umożliwia użytkownikowi wykonanie próbnego uruchomienia.

Scope posiada bardzo przyjazny interfejs użytkownika, który umożliwia początkującym użytkownikom dostęp do pełnej mocy algorytmu bez konieczności zostania ekspertem w dziedzinie bioinformatyki wyszukiwania motywów. Jako dane wejściowe SCOPE może przyjąć listę genów lub sekwencje FASTA. Można je wprowadzić w polach tekstowych przeglądarki lub odczytać z pliku. Dane wyjściowe z SCOPE zawierają listę wszystkich zidentyfikowanych motywów wraz z ich punktacją, liczbą wystąpień, frakcją genów zawierających motyw oraz algorytmem użytym do identyfikacji motywu. Dla każdego motywu szczegóły wyniku obejmują uzgodnioną reprezentację motywu, logo sekwencji, macierz wagi pozycji oraz listę wystąpień dla każdego wystąpienia motywu (z dokładnymi pozycjami i wskazaniem "pasma"). Wyniki są zwracane w oknie przeglądarki, a także opcjonalnie pocztą elektroniczną. Poprzednie artykuły szczegółowo opisują algorytmy SCOPE1,2,9-11.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Przygotuj listę nazw dla genów, które Twoim zdaniem są współregulowane do analizy przez SCOPE.

Zapisz listę jako plik tekstowy lub skopiuj ją do schowka, aby wkleić ją do SCOPE w kroku 3. Plik powinien zawierać jedną nazwę genu w każdym wierszu, bez żadnych dodatkowych informacji. Alternatywnie można przygotować listę jako plik FASTA zawierający rzeczywiste sekwencje do analizy.

2. Uruchom przeglądarkę internetową i połącz się z adresem URL: http://genie.dartmouth.edu/SCOPE/

3. Wprowadź informacje, które SCOPE potrzebuje do przeprowadzenia analizy.

Początkowa strona SCOPE jest pokazana na rysunku 1. W tym kroku omówiono różne sekcje.

  1. Użyj menu kontekstowego "Gatunek", aby wybrać gatunek, który będziesz badać. Ważne jest, aby wybrać właściwy gatunek, ponieważ SCOPE odwołuje się do genomu w celu obliczenia częstotliwości występowania tła dla każdego badanego motywu kandydującego.
  2. Użyj przycisków radiowych "sekwencja upstream", aby wybrać między genami lub stałą długość. Intergenic przeanalizuje całą sekwencję między genem, na który patrzysz, a poprzednim (nadrzędnym) genem. Oznacza to, że dla każdego genu zostaną użyte różne długości początkowe. Wybór stałej długości będzie dotyczył dokładnie takiej liczby nukleotydów przed początkiem obecnego genu. W takim przypadku SCOPE zbada tę samą długość sekwencji poprzedzającej dla każdego genu, nawet jeśli rozciąga się ona na poprzedni gen (lub nie). Zazwyczaj 800 nts to najlepsza długość do wyboru, ale może się to różnić w zależności od gatunku.
  3. Następnie powiedz SCOPE, jaki zestaw genów chcesz przeanalizować, wklejając listę genów w polu tekstowym listy genów lub naciskając przycisk "wybierz plik", aby wybrać plik zawierający listę genów, które utworzyłeś wcześniej. Alternatywnie możesz wkleić plik sekwencji FASTA w tym samym polu tekstowym.
  4. Następna sekcja strony zawiera pole wyboru "Zbadaj genom pod kątem innych genów zawierających znalezione motywy?" Ta opcja może wydłużyć czas analizy, ponieważ SCOPE musi ocenić każdy inny gen w genomie. Może to być jednak bardzo przydatne w identyfikacji innych genów, które są dobrymi kandydatami do współregulacji z genami w początkowym zestawie genów. Ponieważ analizy SCOPE są stosunkowo szybkie, zaleca się pominięcie tej kwestii w początkowej analizie. Zawsze można ją włączyć na stronie wyników, aby ponownie uruchomić analizę, jak wyjaśniono w sekcji wyników.
  5. Sekcja "Wyniki muszą zawierać" może być użyta do wprowadzenia motywu, który ma zostać uwzględniony w analizie przez SCOPE. Możesz to zrobić, jeśli szukasz konkretnego motywu.
  6. W ostatniej sekcji na stronie można wprowadzić swój adres e-mail oraz komentarz, który zostanie zapisany wraz z analizą. Jeśli ten wpis zostanie wypełniony, SCOPE wyśle wiadomość e-mail z linkiem do strony internetowej zawierającej wyniki, a także będzie zawierać dwa załączniki. Jednym z nich jest zwykły plik tekstowy, który zawiera wszystkie wyniki analizy w formacie czytelnym dla człowieka. Drugi załącznik zawiera plik XML, który zawiera wszystkie wyniki znalezione przez SCOPE w formacie czytelnym dla komputera. Jeśli chcesz przeprowadzić dodatkową analizę wyników, plik XML jest bardzo przydatny. Oba pliki są "spakowane" przed wysłaniem wraz z wiadomością e-mail.
  7. W tym pokazie zaczniemy od tych samych informacji. Można to łatwo osiągnąć, naciskając przycisk "Wyszukiwanie próbki", który wypełni niezbędne informacje. Naciśnij teraz ten przycisk. Zostaną dla Ciebie wprowadzone trzy geny i dokonane zostaną odpowiednie wybory dla pozostałych pól. Pozostaw je tak, jak są ustawione. Te trzy geny są zaangażowane w utrzymanie telomerów u Saccharomyces cerevisiae. Wypełniony formularz pokazano na rysunku 2. Naciśnij przycisk 'Uruchom ZAKRES' u dołu strony, aby rozpocząć analizę.

4. Reprezentatywne wyniki:

Główne wyniki analizy są pokazane na rysunku 3. Na górze strony znajduje się tabela z informacjami o motywach, które zostały odnalezione przez SCOPE. Pierwsza kolumna zawiera listę motywów, które zostały znalezione, a małe kolorowe kwadraty służą jako legenda do graficznej mapy motywów pokazanej poniżej. Wyświetlanie dowolnego motywu można włączać i wyłączać, klikając kolorowe pole (lub miejsce, w którym znajduje się kolorowe pole). Może to być bardzo przydatne, aby ukryć wyświetlanie często powtarzających się motywów, które mogą utrudniać dostrzeżenie mniej rozpowszechnionych wzorów motywów.

Inne kolumny danych to Liczba (liczba wystąpień tego motywu w całym zestawie genów), wartość Sig (wskazanie znaczenia tego motywu), Pokrycie (procent przesłanych genów, które zawierają co najmniej jedną instancję tego motywu) i Algorytm (który z trzech algorytmów składowych został użyty do wykrycia motywu).

Kliknięcie na którykolwiek z wymienionych motywów przeniesie użytkownika na stronę zawierającą szczegółowe informacje o tym motywie. Szczegółowe wyniki przedstawiono dla motywu cyjanu (atgnnnnttg) na rysunku 4. Na tej stronie motyw jest reprezentowany na trzy sposoby: logo sekwencji, macierz wagi pozycji oraz lista wszystkich instancji motywu wraz z ich pozycjami, pasmami i genami.

Nieco dalej na stronie znajdują się dodatkowe szczegóły dotyczące wyników poszukiwania innych genów zawierających ten motyw. Jak widać, w tym przypadku istniały 1344 inne geny zawierające ten motyw, z których wszystkie faktycznie poprawiły wartość Sig po dodaniu do oryginalnego zestawu genów. Naciśnięcie przycisku "Dodaj zaznaczone geny do wyszukiwania" spowoduje powrót do strony konfiguracji SCOPE z tymi genami dodanymi do oryginalnego zestawu genów i parametrami ustawionymi tak, jak wcześniej. W tym przypadku do oryginalnych trzech dodaje się 10 dodatkowych genów.

Rysunek 5 pokazuje wyniki analizy zawierającej dodatkowe geny dla tego motywu. Oryginalne trzy geny znajdują się na dole wyników (małymi literami). Przyjrzenie się wzorowi motywów w górnym obszarze tych dodatkowych genów wyraźnie pokazuje, że są one podobne. W rzeczywistości wiele z tych genów jest zaangażowanych w utrzymanie telomerów, podobnie jak oryginalne trzy geny. Zauważ również, że oryginalny motyw jest teraz motywem z najwyższą liczbą punktów w tym zestawie.

Kolejny zestaw wyników SCOPE jest pokazany na rysunku 6. W tym przypadku zestaw genów to te, które biorą udział w biogenezie rybosomów u Saccharomyces cerevisiae. Geny te nie są w rzeczywistości częścią rybosomu, ale są odpowiedzialne za składanie rybosomów i obejmują szereg enzymów modyfikujących. Na rysunku widać wyraźnie, że motywy czerwony i zielony tworzą niezawodny wzór, który prawdopodobnie bierze udział w regulacji genów w tym zestawie. Badamy ten wzorzec "modułów" bardziej szczegółowo i omówimy go w późniejszej publikacji.

figure-protocol-1
Rysunek 1. Główna strona wejściowa SCOPE. Ta strona służy do wprowadzania genów, które mają być analizowane, oraz do definiowania gatunków i długości regionu górnego, który ma być badany. Opcjonalnie użytkownik może poprosić o wyniki przez e-mail lub ograniczyć wyszukiwanie do dowolnego określonego motywu. Dostępna jest również pomoc wideo.

figure-protocol-2
Rysunek 2. Główna strona wejściowa SCOPE z wartościami wypełnionymi w celu przeprowadzenia wyszukiwania. Parametry te są wynikiem naciśnięcia przycisku "Sample Search". W takim przypadku zaznaczone jest pole wyboru umożliwiające znalezienie innych genów zawierających motywy znalezione przez SCOPE. Obliczenia tej opcji trwają dłużej (każdy gen w genomie musi zostać zbadany), ale może dostarczyć interesujących informacji.

figure-protocol-3
Rysunek 3. Główna strona wyników SCOPE. Na tej stronie znajdują się podsumowanie wyników wyszukiwania SCOPE. Dostarczana jest lista wszystkich wysoko punktowanych motywów, a mapa motywów oznaczona kolorami pokazuje położenie zidentyfikowanych motywów w zestawie analizowanych genów. Kliknięcie kolorowego pola obok motywu spowoduje włączenie lub wyłączenie wyświetlania tego motywu na mapie motywów. Oprócz oceny istotności (wartości Sig) podawana jest również frakcja genów zawierających motyw (pokrycie) oraz algorytm użyty do znalezienia tego motywu.

figure-protocol-4
figure-protocol-5
Rysunek 4. Ta strona ze szczegółowymi informacjami o wynikach jest wyświetlana po kliknięciu określonego motywu na głównej stronie wyników. Pokazuje szczegóły poszczególnych motywów. Logo sekwencji, macierz wagi pozycji i sekwencja konsensusu reprezentują inny rodzaj podsumowania listy instancji motywu, które również znajdują się na stronie. Ponieważ opcja "znajdź dodatkowe geny" została zaznaczona w pierwotnym układzie wyszukiwania, na tej stronie znajdują się również informacje o wszelkich innych genach w genomie, które zawierają ten motyw. Z poziomu tej strony możliwe jest również rozpoczęcie kolejnego cyklu SCOPE z uwzględnieniem dodatkowych genów zidentyfikowanych na tej stronie.

figure-protocol-6
Rysunek 5. Rysunek ten przedstawia wyniki poszukiwania dodatkowych genów dla motywu "atgnnnnttg" pokazanego na rysunku 4. Oryginalne trzy geny są pisane małymi literami na dole mapy motywów. Dodatkowe geny są pokazane wielkimi literami. Istnieje wyraźny wzorzec motywów w górnych regionach tych genów. Zauważ również, że określony motyw pokazuje algorytm jako "LOOKUP", ponieważ w ten sposób został zidentyfikowany. W rzeczywistości pasuje do5-tego motywu znalezionego przez SPACER w tej analizie.

figure-protocol-7
Rysunek 6. Wyniki badania SCOPE dla genów zaangażowanych w biogenezę rybosomów u Saccharomyces cerevisiae. Zwróć uwagę na konserwatywny wzór modułów składających się z motywów "aaawtttbh" (czerwony) i "abctcatcd" (zielony) oddzielonych od siebie o około 10-30 nts i obecnych w 100-200 nukleotydach przed rozpoczęciem transkrypcji genu.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Projekt SCOPE dostarcza naukowcom potężnego narzędzia do identyfikacji potencjalnych motywów regulacyjnych w zestawach genów regulowanych koordynacyjnie. Użytkownik nie musi zgadywać wielkości motywu ani liczby wystąpień motywu, jak wymaga tego wiele innych miejsc do wyszukiwania motywów. Parametry te są w zasadzie niepoznawalne, dopóki motyw nie zostanie zidentyfikowany. Interfejs jest bardzo prosty zarówno do wprowadzania sekwencji lub nazw genów, jak i do przeglądania danych wyjściowych.

Dane wyjściowe SCOPE dostarczają szczegółowych informacji o wszystkich zidentyfikowanych motywach, przy użyciu trzech różnych sposobów reprezentacji motywów. Każdy przypadek motywu we wszystkich genach jest wymieniony z informacją o pozycji i "nici". Wyniki graficzne w postaci map motywów zapewniają wizualny wyświetlacz, który jest łatwy do zrozumienia i zapewnia intuicyjny sposób dostrzegania wzorców w obecnych motywach.

SCOPE jest bardzo odporny na obecność szumów w danych. Zazwyczaj przybiera to formę dodatkowych genów obecnych w zestawie wyjściowym, które mogą nie być w rzeczywistości współregulowane z resztą genów. Dzieje się tak często, gdy zaczynasz od genów, które ulegają koekspresji w eksperymentach z mikromacierzami. Czasami eksperyment jest hałaśliwy lub może istnieć kilka czynników transkrypcyjnych aktywowanych w warunkach eksperymentalnych użytych w eksperymencie z mikromacierzą. Te różne czynniki transkrypcyjne będą prawdopodobnie miały różne miejsca docelowe w DNA. Nawet w obecności 4-krotnie obcych genów (stosunek szumu do sygnału wynosi 4:1), SCOPE nadal zachowuje 50% swojej dokładności w przewidywaniu miejsc1.

Chociaż SCOPE zawiera ponad 2 miliony synonimów nazw genów, czasami nie identyfikuje nazw niektórych genów. Stale aktualizujemy nasze listy synonimów, ale czasami okazuje się, że różne synonimy odnoszą się do tego samego genu. W takich przypadkach nie uwzględniamy synonimów ze względu na niejednoznaczność. jeśli masz nazwę genu, która nie została znaleziona przez SCOPE, zaleca się odwołanie się do miejsca specyficznego dla genomu w celu znalezienia alternatywnej nazwy genu do użycia w SCOPE. Przykłady odpowiednich nazw genów dla każdego gatunku są dostarczane przez SCOPE.

SCOPE zawiera obecnie 72 gatunki, a nowe gatunki są cały czas dodawane. Strona internetowa zawiera pomoc wideo oraz często zadawane pytania. Kod źródłowy jest swobodnie dostępny dla użytkowników akademickich po zapisie do RHG.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nie stwierdzono konfliktu interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Te badania były wspierane przez grant dla RHG od National Science Foundation, DBI-0445967.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chakravarty, A., Carlson, J. M., Khetani, R. S., Gross, R. H. A novel ensemble learning method for de novo computational identification of DNA binding sites. BMC Bioinformatics. 8, 249-249 (2007).
  2. Carlson, J. M., Chakravarty, A., DeZiel, C. E., Gross, R. H. SCOPE: a web server for practical de novo motif discovery. Nucleic Acids Res. 35, 259-264 (2007).
  3. Blom, E. J., Roerdink, J. B., Kuipers, O. P., Hijum, S. A. van MOTIFATOR: detection and characterization of regulatory motifs using prokaryote transcriptome data. Bioinformatics. 25, 550-551 (2009).
  4. Blom, E. J. DISCLOSE : DISsection of CLusters Obtained by SEries of transcriptome data using functional annotations and putative transcription factor binding sites. BMC Bioinformatics. 9, 535-535 (2008).
  5. Bushey, A. M., Ramos, E., Corces, V. G. Three subclasses of a Drosophila insulator show distinct and cell type-specific genomic distributions. Genes Dev. 23, 1338-1350 (2009).
  6. Znaidi, S. Identification of the Candida albicans Cap1p regulon. Eukaryot Cell. 8, 806-820 (2009).
  7. Sharma, D., Mohanty, D., Surolia, A. RegAnalyst: a web interface for the analysis of regulatory motifs, networks and pathways. Nucleic Acids Res. 37, W193-W201 (2009).
  8. Znaidi, S. Genomewide location analysis of Candida albicans Upc2p, a regulator of sterol metabolism and azole drug resistance. Eukaryot Cell. 7, 836-847 (2008).
  9. Carlson, J., Chakravarty, A., Gross, R. B. E. A. M. A beam search algorithm for the identification of cis-regulatory elements in groups of genes. J Comput Biol. 13, 686-701 (2006).
  10. Carlson, J., Chakravarty, A., Khetani, R., Gross, R. Bounded search for de novo identification of degenerate cis-regulatory elements. BMC Bioinformatics. 7, 254-254 (2006).
  11. Chakravarty, A., Carlson, J. M., Khetani, R. S., DeZiel, C. E., Gross, R. H. SPACER: identification of cis-regulatory elements with non-contiguous critical residues. Bioinformatics. 23, 1029-1031 (2007).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Identyfikacja motyw w regulacyjnychalgorytm SCOPEwyszukiwanie motyw wanaliza zestaw w gen wutrzymywanie telomer wpodej cie ansamblowenadreprezentacja motyw wmacierz wag pozycyjnychlogo sekwencjiwsp regulacja gen w

Powiązane artykuły