Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

Analiza transkryptomiczna C. elegans powiedział: Dane sekwencjonowania RNA za pośrednictwem pakietu Tuxedo Suite w projekcie Galaxy

16.8K wyświetleń

DOI:

10.3791/55473

8 kwietnia 2017

W tym artykule

Podsumowanie

Galaxy i DAVID stały się popularnymi narzędziami, które pozwalają badaczom bez wykształcenia bioinformatycznego analizować i interpretować dane RNA-Seq. Opisujemy protokół dla badaczy C. elegans do przeprowadzania eksperymentów RNA-Seq, uzyskiwania dostępu i przetwarzania zestawu danych za pomocą Galaxy oraz uzyskiwania znaczących informacji biologicznych z list genów za pomocą DAVID.

Streszczenie

Technologie sekwencjonowania nowej generacji (NGS) zrewolucjonizowały charakter badań biologicznych. Spośród nich sekwencjonowanie RNA (RNA-Seq) stało się potężnym narzędziem do analizy ekspresji genów i mapowania transkryptomu. Jednak obsługa zestawów danych RNA-Seq wymaga wyrafinowanej wiedzy obliczeniowej i stanowi nieodłączne wyzwanie dla badaczy biologii. To wąskie gardło zostało złagodzone przez projekt Galaxy o otwartym dostępie, który umożliwia użytkownikom bez umiejętności bioinformatycznych analizowanie danych sekwencyjnych RNA, a także przez Database for Annotation, Visualization, and Integrated Discovery (DAVID), pakiet do analizy terminów Gene Ontology (GO), który pomaga uzyskać znaczenie biologiczne z dużych zbiorów danych. Jednak dla początkujących użytkowników i amatorów bioinformatyki samodzielna nauka i zapoznanie się z tymi platformami może być czasochłonne i zniechęcające. Opisujemy prosty przepływ pracy, który pomoże badaczom C. elegans wyizolować RNA robaka, przeprowadzić eksperyment RNA-Seq i przeanalizować dane za pomocą platform Galaxy i DAVID. Protokół ten zawiera instrukcje krok po kroku dotyczące korzystania z różnych modułów Galaxy w celu uzyskania dostępu do surowych danych NGS, kontroli jakości, dopasowania i różnicowej analizy ekspresji genów, prowadząc użytkownika za pomocą parametrów na każdym kroku w celu wygenerowania listy genów, która może być badana pod kątem wzbogacenia klas genów lub procesów biologicznych za pomocą DAVID. Ogólnie rzecz biorąc, spodziewamy się, że ten artykuł dostarczy informacji badaczom C. elegans podejmującym po raz pierwszy eksperymenty z sekwencją RNA, a także częstym użytkownikom przeprowadzającym niewielką liczbę próbek.

Wprowadzenie

Pierwsze sekwencjonowanie genomu ludzkiego, przeprowadzone przy użyciu metody sekwencjonowania dideoksynukleotydowego Freda Sangera, trwało 10 lat i kosztowało szacunkowo 3 miliardy USD1,2. Jednak w nieco ponad dekadę od swojego powstania technologia sekwencjonowania następnej generacji (Next-Generation Sequencing, NGS) umożliwiła zsekwencjonowanie całego ludzkiego genomu w ciągu dwóch tygodni za kwotę 1 000 USD. Nowe instrumenty NGS, które pozwalają na coraz szybsze gromadzenie danych sekwencyjnych z niesamowitą wydajnością, wraz z gwałtownym spadkiem kosztów, rewolucjonizują współczesną biologię w niebywały sposób, ponieważ projekty sekwencjonowania genomu stają się powszechne. Ponadto rozwój ten zdynamizował postępy w wielu innych obszarach, takich jak analiza ekspresji genów za pomocą sekwencjonowania RNA (RNA-Seq), badanie epigenetycznych modyfikacji w całym genomie, oddziaływania białko-DNA oraz badanie różnorodności mikrobiologicznej u gospodarzy ludzkich. W szczególności RNA-Seq oparty na NGS umożliwił kompleksową identyfikację i mapowanie transkryptomów z wysoką dokładnością i czułością, zastępując technologię mikromacierzy jako preferowaną metodę profilowania ekspresji. Choć technologia mikromacierzy była szeroko stosowana, jej ograniczeniem jest zależność od istniejących macierzy z znanymi informacjami genomicznymi oraz inne wady, takie jak hybrydyzacja krzyżowa i ograniczony zakres zmian ekspresji, które można wiarygodnie zmierzyć. Z drugiej strony RNA-seq może być wykorzystywany do wykrywania transkryptów znanych i nieznanych, generując przy tym niski szum tła dzięki jednoznacznemu mapowaniu DNA. RNA-Seq, wraz z licznymi narzędziami genetycznymi oferowanymi przez organizmy modelowe, takie jak drożdże, muszki, nicienie, ryby i myszy, stał się fundamentem wielu ważnych, niedawnych odkryć biomedycznych. Niemniej jednak nadal istnieją znaczące wyzwania, które sprawiają, że NGS pozostaje niedostępny dla szerszej społeczności naukowej, w tym ograniczenia w zakresie przechowywania, przetwarzania, a przede wszystkim sensownej analizy bioinformatycznej dużych wolumenów danych sekwencyjnych.

Szybki postęp w technologiach sekwencjonowania oraz wykładniczy przyrost danych stworzyły ogromne zapotrzebowanie na platformy obliczeniowe, które umożliwiłyby badaczom dostęp do tych informacji, ich analizę i zrozumienie. Wczesne systemy były w dużym stopniu uzależnione od znajomości programowania, natomiast przeglądarki genomów, takie jak NCBI, które pozwalały osobom niebędącym programistami na dostęp do danych i ich wizualizację, nie umożliwiały przeprowadzania zaawansowanych analiz. Webowa platforma o otwartym dostępie, Galaxy (https://galaxyproject.org/), wypełniła tę lukę i okazała się wartościowym narzędziem (pipeline), które umożliwia badaczom przetwarzanie danych NGS oraz wykonywanie szerokiego spektrum bioinformatycznych analiz o różnym stopniu złożoności. Galaxy zostało początkowo utworzone i jest utrzymywane przez laboratoria Antona Nekrutenko (Penn State University) oraz Jamesa Taylora (Johns Hopkins University)3. Galaxy oferuje szeroki zakres zadań obliczeniowych, co czyni go kompleksowym rozwiązaniem dla niezliczonych potrzeb bioinformatycznych, w tym wszystkich etapów badania RNA-Seq. Pozwala użytkownikom na przetwarzanie danych zarówno na własnych serwerach, jak i lokalnie na ich maszynach. Dane i przepływy pracy (workflows) mogą być reprodukowane i udostępniane. Stałe wsparcie zapewniają tutoriale online, sekcja pomocy oraz strona wiki (https://wiki.galaxyproject.org/Support) dedykowana projektowi Galaxy. Jednak dla nowych użytkowników, szczególnie tych bez przeszkolenia z zakresu bioinformatyki, obsługa platformy może wydawać się przytłaczająca, a proces samodzielnej nauki i zapoznawania się z narzędziem może być czasochłonny. Ponadto, badany system biologiczny oraz specyfika eksperymentu i zastosowanych metod wpływają na decyzje analityczne na kilku etapach, co bez odpowiednich instrukcji może być trudne do opanowania.

Ogólny schemat pracy RNA-Seq w Galaxy składa się z przesyłania danych i kontroli jakości, po których następuje analiza z wykorzystaniem pakietu Tuxedo Suite4,5,6,7,8,9, który stanowi zbiór różnych narzędzi niezbędnych na poszczególnych etapach analizy danych RNA-Seq10,11,12,13,14. Typowy eksperyment RNA-Seq składa się z części eksperymentalnej (przygotowanie próbek, izolacja mRNA i przygotowanie biblioteki cDNA), sekwencjonowania NGS oraz bioinformatycznej analizy danych. Przegląd tych sekcji oraz etapów zawartych w potoku Galaxy przedstawiono na Rysunku 1.

figure-introduction-1
Rysunek 1: Przegląd procesu RNA-Seq. Ilustracja etapów eksperymentalnych i obliczeniowych zaangażowanych w eksperyment RNA-Seq w celu porównania profili ekspresji genów dwóch szczepów nicieni (A i B, odpowiednio pomarańczowe i zielone linie oraz strzałki). Wykorzystane moduły Galaxy przedstawiono w ramkach, a odpowiadający im etap w naszym protokole zaznaczono na czerwono. Wyniki poszczególnych operacji zapisano na szaro, a formaty plików wyświetlono na niebiesko. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Pierwszym narzędziem w pakiecie Tuxedo Suite jest program do wyrównywania sekwencji o nazwie 'Tophat'. Rozbija on odczyty wejściowe NGS na mniejsze fragmenty, a następnie mapuje je do genomu referencyjnego. Ten dwuetapowy proces zapewnia uwzględnienie i zmapowanie odczytów obejmujących regiony intronowe, których wyrównanie mogłoby zostać w inny sposób zakłócone lub pominięte. Zwiększa to pokrycie i ułatwia identyfikację nowych miejsc splicingowych. Wynik działania Tophat jest raportowany w dwóch plikach: pliku BED (zawierającym informacje o miejscach splicingowych, w tym lokalizację genomiczną) oraz pliku BAM (z detalami mapowania każdego odczytu). Następnie plik BAM jest wyrównywany do genomu referencyjnego w celu oszacowania obfitości poszczególnych transkryptów w każdej próbce przy użyciu kolejnego narzędzia z pakietu Tuxedo Suite o nazwie 'Cufflinks'. Cufflinks działa poprzez skanowanie wyrównania w celu raportowania pełnowymiarowych fragmentów transkryptów lub „transfragów”, które obejmują wszystkie możliwe warianty splicingu w danych wejściowych dla każdego genu. Na tej podstawie generuje on „transkryptom” (zespół wszystkich transkryptów wygenerowanych na gen dla każdego genu) dla każdej sekwencjonowanej próbki. Zespoły Cufflinks są następnie łączone lub scalane wraz z genomem referencyjnym, aby stworzyć jeden plik adnotacji do późniejszej analizy różnicowej przy użyciu następnego narzędzia, 'Cuffmerge'. Na koniec narzędzie 'Cuffdiff' mierzy różnicową ekspresję genów między próbkami, porównując wyniki TopHat dla każdej z próbek z końcowym plikiem wynikowym Cuffmerge (Rycina 1). Cufflinks wykorzystuje wartości FPKM/RPKM (Fragments/Reads Per Kilobase of transcript per Million mapped reads) do raportowania obfitości transkryptów. Wartości te odzwierciedlają normalizację surowych danych NGS pod kątem głębokości (średnia liczba odczytów z próbki, które wyrównują się do genomu referencyjnego) oraz długości genu (geny mają różną długość, więc liczby muszą być znormalizowane względem długości genu, aby móc porównywać poziomy między genami). FPKM i RPKM są w zasadzie takie same, przy czym RPKM jest stosowany w RNA-Seq z odczytem z jednego końca (single-end), gdzie każdy odczyt odpowiada pojedynczemu fragmentowi, natomiast FPKM jest stosowany w RNA-Seq z odczytem z obu końców (paired-end), ponieważ uwzględnia fakt, że dwa odczyty mogą odpowiadać temu samemu fragmentowi. Ostatecznym wynikiem tych analiz jest lista genów wykazujących różnicową ekspresję między badanymi warunkami i/lub szczepami.

Po pomyślnym zakończeniu pracy w systemie Galaxy i wygenerowaniu „listy genów”, kolejnym logicznym krokiem jest przeprowadzenie dalszych analiz bioinformatycznych w celu wyciągnięcia istotnych wniosków z zestawów danych. W celu zaspokojenia tej potrzeby powstało wiele pakietów oprogramowania, w tym ogólnodostępne narzędzia obliczeniowe oparte na przeglądarce internetowej, takie jak DAVID (Database for Annotation, Visualization and Integrated discovery).15Narzędzie DAVID ułatwia przypisywanie znaczenia biologicznego obszernym listom genów pochodzącym z badań wysokoprzepustowych poprzez porównywanie przesłanej listy genów z zintegrowaną bazą wiedzy biologicznej i ujawnianie powiązanych z tą listą adnotacji biologicznych. Następnie przeprowadzana jest analiza wzbogacenia (Enrichment Analysis), t. j., testy służące do identyfikacji, czy dany proces biologiczny lub klasa genów jest reprezentowana w liście (lub listach) genów w stopniu nadmiernym i statystycznie istotnym. Stało się ono popularnym wyborem dzięki połączeniu szerokiej, zintegrowanej bazy wiedzy oraz potężnych algorytmów analitycznych, które umożliwiają badaczom wykrywanie motywów biologicznych wzbogaconych w „listach genów” pochodzących z analiz genomicznych10,16Dodatkowe zalety obejmują możliwość przetwarzania list genów stworzonych na dowolnej platformie sekwencjonowania oraz bardzo przyjazny dla użytkownika interfejs.

Nicień Caenorhabditis elegans jest genetycznym systemem modelowym, znanym z wielu zalet, takich jak niewielkie rozmiary, przezroczyste ciało, prosty plan budowy, łatwość hodowli oraz duża podatność na analizy genetyczne i molekularne. Nicienie posiadają niewielki, prosty i dobrze zinterpretowany genom, który obejmuje do 40% genów konserwowanych o znanych homologach ludzkich17. Rzeczywiście, C. elegans był pierwszym metazoą, którego genom został całkowicie zsekwencjonowany18, i jednym z pierwszych gatunków, w których zastosowano metodę RNA-Seq do mapowania transkryptomu organizmu19,20. Wczesne badania nad nicieniami obejmowały eksperymenty z różnymi metodami wysokoprzepustowego wychwytu RNA, przygotowania bibliotek i sekwencjonowania, a także potoki bioinformatyczne, które przyczyniły się do rozwoju tej technologii21,22. W ostatnich latach eksperymenty oparte na RNA-Seq u nicieni stały się powszechne. Jednak dla tradycyjnych biologów zajmujących się nicieniami wyzwania związane z analizą obliczeniową danych RNA-Seq pozostają główną przeszkodą w szerszym i lepszym wykorzystaniu tej techniki.

W niniejszym artykule opisujemy protokół wykorzystania platformy Galaxy do analizy wysokoprzepustowych danych RNA-Seq uzyskanych z C. elegans. Dla wielu nowych oraz małoskalowych użytkowników najbardziej efektywnym kosztowo i najprostszym sposobem przeprowadzenia eksperymentu RNA-Seq jest izolacja RNA w laboratorium i skorzystanie z komercyjnego (lub wewnętrznego) ośrodka NGS w celu przygotowania bibliotek cDNA do sekwencjonowania oraz samego sekwencjonowania NGS. W związku z tym szczegółowo opisaliśmy najpierw etapy izolacji, kwantyfikacji i oceny jakości próbek RNA C. elegans do analizy RNA-Seq. Następnie przedstawiamy instrukcje krok po kroku dotyczące korzystania z interfejsu Galaxy do analizy danych NGS, zaczynając od testów kontroli jakości po sekwencjonowaniu, a następnie wyrównywania, składania i różnicowej kwantyfikacji ekspresji genów. Dodatkowo zawarliśmy wytyczne dotyczące weryfikacji list genów uzyskanych z Galaxy w celu przeprowadzenia badań wzbogacenia biologicznego przy użyciu bazy DAVID. Jako ostatni krok w schemacie postępowania przedstawiamy instrukcje przesyłania danych RNA-Seq na publiczne serwery, takie jak Sequence Read Archive (SRA) w bazie NCBI (http://www.ncbi.nlm.nih.gov/sra), aby udostępnić je bezpłatnie społeczności naukowej. W ogólnym ujęciu przewidujemy, że artykuł ten dostarczy kompleksowych i wystarczających informacji biologom badającym nicienie, którzy po raz pierwszy przeprowadzają eksperymenty RNA-Seq, a także użytkownikom regularnie analizującym niewielką liczbę próbek.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

1. Izolacja RNA

  1. Środki ostrożności
    1. Przetrzyj całą powierzchnię roboczą, instrumenty oraz pipety, używając dostępnego w handlu sprayu do usuwania RNaz, aby wyeliminować obecne RNazy.
    2. Przez cały czas należy nosić rękawiczki, regularnie wymieniając je na nowe podczas poszczególnych etapów protokołu.
    3. Należy używać wyłącznie końcówek z filtrem i przechowywać wszystkie próbki w lodzie tak długo, jak to możliwe, aby uniknąć degradacji RNA.
      UWAGA: Aby uzyskać optymalne dane z platform NGS, kluczowe jest rozpoczęcie pracy z wysokiej jakości RNA. Metody izolacji i przygotowania RNA różnią się w zależności od pochodzenia próbki, metody sekwencjonowania oraz preferencji badacza. W tym celu można zastosować kilka dostępnych komercyjnie zestawów lub wyizolować RNA, stosując standardową metodę ekstrakcji fenolowo-chloroformowej. Niezależnie od wybranej metodologii, w celu zminimalizowania kontaminacji i uzyskania czystych próbek RNA, przez cały proces należy przestrzegać wymienionych powyżej środków ostrożności.
  2. Pozyskiwanie nicieni
    1. Synchronizacja populacji nicieni poprzez traktowanie hipochlorytem (wybielanie)23 aby uzyskać od 1000 do 1500 osobników w tym samym wieku C. elegans dorosłe nicienie na szczep.
    2. Zmyj nicienie z szalek, używając buforu M9, a następnie wiruj w wirówce stołowej z prędkością 325 x g przez 30 s. Odessaj bufor M9, pozostawiając osad z nicieni. Powtórz ten krok co najmniej trzy razy, aby wyeliminować zanieczyszczenia bakteryjne.
    3. Do osadu z nicieni dodać ~ 500 µL buforu do lizy (w przypadku korzystania z komercyjnego zestawu) lub Trizolu (monofazowego roztworu fenolu i izotiocyjanianu guanidyny; jeśli przeprowadzana jest ekstrakcja fenol-chloroformowa opisana w punkcie 1.3.3) w celu rozbicia tkanek nicieni, dezaktywacji RNaz i stabilizacji kwasów nukleinowych.
      UWAGA: Protokół można w tym miejscu przerwać, zamrażając próbki błyskawicznie w ciekłym azocie, a następnie przechowując je w temperaturze -80 °C.
  3. Izolacja RNA
    1. Próbki nicieni poddać sonikacji przy amplitudzie 45% w cyklach 20 s. „WŁ.” i 40 s. „WYŁ.” (8–12 cykli na szczep). Próbki przez cały czas przechowywać w lodzie.
      UWAGA: Należy upewnić się, że sonda sonikatora jest zanurzona w buforze i utrzymywana na stałym poziomie przez cały czas trwania procesu. Należy unikać spieniania próbki oraz dokładnie oczyszczać sondę pomiędzy kolejnymi próbkami. Cykle sonikacji mogą się różnić w zależności od rodzaju zastosowanego sonikatora. Zaleca się, aby przed rozpoczęciem eksperymentu zoptymalizować warunki sonikacji na próbce testowej.
    2. W przypadku użycia dostępnego komercyjnie zestawu, należy przeprowadzić izolację RNA zgodnie z zalecanym protokołem. W przypadku izolacji RNA metodą fenolowo-chloroformową, należy wykonać następujące kroki.
    3. Wiruj sonikowane próbki z prędkością 16 000 x g przez 10 min. w temperaturze 4° C.
    4. Przenieś nadsącz do 1,5 ml mikroprobówki wolnej od RNaz i dodaj 100 µL chloroformu (1/5th objętość odczynnika do izolacji RNA/DNA).
      Ostrzeżenie: Chloroform jest toksyczny. Aby zminimalizować ekspozycję i uniknąć wdychania oparów, podczas pracy z tą substancją należy korzystać z dygestorium.
    5. Próbki należy dokładnie wymieszać w wirówce typu vortex przez 30–60 s, a następnie pozostawić w temperaturze pokojowej na 3 min.
    6. Wiruj w wirowarce przy 11 750 x g przez 15 min w temperaturze 4 °CPrzenieś tylko górną warstwę wodną do nowej, wolnej od RNaz probówki do wirówki, uważając, aby nie odessać białej warstwy przejściowej zawierającej DNA. Powtórz kroki od 1.3.4 do 1.3.6.
    7. Dodaj 250 µL (70% objętości fazy wodnej lub 1/2 objętości odczynnika do izolacji RNA/DNA) 2-propanolu i odwróć probówkę, aby wymieszać zawartość. Pozostaw probówki w temperaturze pokojowej na 10 min lub pozostaw na noc w temperaturze -80 °C.
    8. Wirować próbki z przyspieszeniem 11 750 x g przez 10 min w temperaturze 4 °CBardzo ostrożnie odlej nadsącz, pozostawiając kilka µL na dnie probówki, aby nie naruszyć osadu.
    9. Przemyć osad za pomocą 500 µL 75% etanolu (przygotowanego z wody wolnej od RNaz), a następnie wirować przy 16 000 x g przez 5 min w temp. 4 °C.
    10. Usunąć jak najwięcej supernatantu, uważając, aby nie naruszyć osadu. Osad suszyć na powietrzu w dygestorium przez kilka minut.
    11. Dodaj 30 µL wody wolnej od RNaz i pomóc w rozpuszczeniu osadu RNA poprzez ogrzewanie przez 10 min w temperaturze 60 °C.
    12. Ocena jakości i ilości RNA za pomocą bioanalizatora.
      UWAGA: Bioanalyzer generuje RND Iintegralność Nliczba (RIN) jako miara jakości RNA. Rekomendowany próg dla próbek do RNA-Seq to RIN wynoszący co najmniej 8 (im wyższa wartość, tym lepiej). Ilość i jakość RNA można sprawdzić również spektrofotometrycznie, jednak powinno temu towarzyszyć wizualna ocena integralności RNA. W tym celu należy poddać próbki elektroforezie na żelu agarozowym o stężeniu 1,2%, na czas wystarczający do uzyskania odpowiedniego rozdzielenia prążków rybosomalnego RNA 28S i 18S. Obecność dwóch wyraźnych prążków (1,75 kb dla 18S rRNA i 3,5 kb dla 28S rRNA w przypadku C. elegans) jest akceptowalnym miernikiem jakości RNA.
    13. Użyj ~100 ng/µL RNA do wysłania do dostawcy/zakładu NGS w celu przygotowania bibliotek do sekwencjonowania.
      UWAGA: Próbki RNA powinny zostać wysłane do dostawcy usług sekwencjonowania w suchym lodzie. Większość dostawców przeprowadza niezależny test kontroli jakości RNA przed przygotowaniem biblioteki.

2. Analiza danych RNA-Seq

  1. Pobieranie surowych danych sekwencjonowania
    1. Pobierz skompresowane surowe dane sekwencjonowania fastq zakodowane w formacie fastq.gz od dostawcy NGS, korzystając z "protokołu przesyłania plików" (ftp).

figure-protocol-1
Rycina 2: Układ panelu interfejsu użytkownika Galaxy i kluczowe funkcje RNA-Seq. Kluczowe elementy strony zostały rozwinięte i wyróżnione. (A) wyróżnia funkcję „Analyze data” w nagłówku strony internetowej, służącą do uzyskania dostępu do Analysis Home View. (B) to „Progress bar” (pasek postępu), który wskazuje ilość miejsca na serwerze Galaxy wykorzystanego przez operację. (C) to sekcja „Tools” (narzędzia), w której wymieniono wszystkie narzędzia, które można uruchomić w interfejsie Galaxy. (D) pokazuje sekcję narzędzi „NGS: RNA Analysis” używaną do analizy RNA-Seq. (E) przedstawia panel „History” (historia), w którym wymieniono wszystkie pliki wygenerowane za pomocą Galaxy. (F) pokazuje przykład okna dialogowego, które otwiera się po kliknięciu dowolnego pliku w sekcji History. W obrębie (F) niebieska ramka wyróżnia ikony, które można wykorzystać do podglądu, edycji atrybutów lub usuwania zestawu danych, fioletowa ramka wyróżnia ikony służące do edycji tagów lub adnotacji zestawu danych, a czerwona ramka wskazuje ikony służące do pobierania danych, wyświetlania szczegółów wykonanego zadania lub ponownego uruchomienia operacji. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

  1. Pierwsze kroki z Galaxy
    UWAGA: Program Galaxy może być uruchamiany na bezpłatnym serwerze publicznym za pomocą platformy internetowej zapewniającej dostęp do chmury i ograniczoną bezpłatną przestrzeń dyskową. Można go również pobrać i uruchomić lokalnie na komputerze użytkownika lub klastrach obliczeniowych hostowanych przez instytucje, jednak przetwarzanie lokalne może być ograniczone przez limity przechowywania danych oraz wydajność obliczeniową maszyn użytkownika. Szczegółowe informacje na temat pobierania i instalacji są dostępne pod adresem https://wiki.galaxyproject.org/Admin/GetGalaxy # Instalacja Galaxy Galaxy jest rozwijany jako system open-source i jest dostępny dla każdego. Można go zainstalować na własnym komputerze lub serwerze, aby umożliwić dostęp sobie lub innym użytkownikom. Istnieje kilka sposobów instalacji Galaxy, zależnie od dostępnych zasobów sprzętowych oraz poziomu doświadczenia w administracji systemami Linux. ## Wybór metody instalacji Wybór odpowiedniej metody instalacji zależy od przeznaczenia instancji Galaxy: * **Do nauki i testów (lokalnie):** Jeśli chcesz po prostu przetestować Galaxy na swoim laptopie lub komputerze stacjonarnym, najszybszą metodą jest użycie Docker. * **Dla małych grup badawczych:** Jeśli posiadasz dedykowany serwer lub maszynę wirtualną, zalecamy instalację za pomocą narzędzia `galaxy-setup-script` lub Docker. * **Dla dużych centrów danych i instytucji:** W przypadku dużych klastrów obliczeniowych z zaawansowanymi systemami zarządzania zasobami, zaleca się instalację z poziomu kodu źródłowego, aby umożliwić pełną optymalizację i integrację. ## Opcje instalacji ### 1. Docker (Zalecane dla większości użytkowników) Docker pozwala na uruchomienie Galaxy w odizolowanym kontenerze, co eliminuje problemy z zależnościami systemowymi. Jest to najszybsza metoda wdrożenia. * **Zalety:** Szybka konfiguracja, łatwe aktualizacje, spójność środowiska. * **Wymagania:** Zainstalowany Docker i Docker Compose. ### 2. Skrypt instalacyjny (`galaxy-setup-script`) Jest to zautomatyzowany skrypt, który prowadzi użytkownika przez proces instalacji na systemach opartych na Ubuntu. * **Zalety:** Automatyzacja instalacji zależności, prostsza konfiguracja niż w przypadku instalacji ręcznej. * **Wymagania:** Czysta instalacja systemu Ubuntu. ### 3. Instalacja z kodu źródłowego (Manualna) Ta metoda polega na pobraniu kodu z repozytorium Git i ręcznej konfiguracji środowiska. * **Zalety:** Pełna kontrola nad każdym aspektem systemu, możliwość modyfikacji kodu, optymalizacja pod konkretny sprzęt. * **Wymagania:** Zaawansowana znajomość administracji systemem Linux, Pythona oraz zarządzania środowiskami wirtualnymi (np. conda). ## Kroki po instalacji Po pomyślnej instalacji należy przejść do następujących kroków: 1. **Konfiguracja Galaxy:** Edycja pliku `galaxy.yml` w celu ustawzenia nazw, portów i ścieżek do danych. 2. **Zarządzanie użytkownikami:** Utworzenie kont administratora i konfiguracja uwierzytelniania (np. LDAP, Google OAuth). 3. **Instalacja narzędzi:** Dodawanie niezbędnych narzędzi bioinformatycznych i bibliotek poprzez Galaxy Tool Shed. 4. **Konfiguracja dostępu zewnętrznego:** Ustawienie serwera proxy (np. Nginx lub Apache) oraz certyfikatów SSL (HTTPS). ## Wsparcie i dokumentacja W przypadku problemów z instalacją zachęcamy do korzystania z następujących zasobów: * **Wiki Galaxy:** Szczegółowe instrukcje krok po kroku. * **Lista dyskusyjna Admin:** Miejsce wymiany doświadczeń między administratorami Galaxy. * **GitHub Issues:** Zgłaszanie błędów i śledzenie rozwoju wersji.W niniejszym protokole opisujemy sposób korzystania z potoku przetwarzania Galaxy za pośrednictwem przeglądarki internetowej.
    1. Po pobraniu i zapisaniu danych NGS na komputerze użytkownika należy uzyskać dostęp do platformy Galaxy pod adresem https://usegalaxy.org/.
    2. Zarejestruj konto użytkownika, klikając w Użytkownik w nagłówku strony zaloguj się i rozpocznij od zapoznania się z panelem interfejsu użytkownika.
      UWAGA: Początkującym użytkownikom zaleca się korzystanie z Zacznij tutaj samouczek udostępniony na stronie głównej w celu zapoznania się z podstawową konfiguracją programu Galaxy (# Galaxy 101-1 Galaxy jest platformą do analizy danych biologicznych, która umożliwia naukowcom z różnych dziedzin łatwy dostęp do zaawansowanych narzędzi analizy danych oraz umożliwia im budowanie powtarzalnych przepływów pracy (workflows). Galaxy jest dostępne jako usługa w chmurze, co oznacza, że nie jest wymagana instalacja lokalna, a dostęp do niego odbywa się za pośrednictwem przeglądarki internetowej. ## Główne cechy Galaxy * **Dostępność narzędzi:** Galaxy integruje setki popularnych narzędzi bioinformatycznych w jednym interfejsie. * **Zarządzanie danymi:** Użytkownicy mogą przesyłać własne zestawy danych lub korzystać z publicznie dostępnych zbiorów. * **Powtarzalność:** Każda wykonana operacja jest rejestrowana w historii, co pozwala na dokładne odtworzenie analizy. * **Przepływy pracy (Workflows):** Możliwość łączenia wielu narzędzi w sekwencje, które można wielokrotnie uruchamiać na różnych zestawach danych. * **Brak konieczności programowania:** Większość narzędzi jest obsługiwana za pomocą graficznego interfejsu użytkownika, co eliminuje potrzebę pisania skryptów w linii komend. ## Interfejs użytkownika Interfejs Galaxy jest podzielony na kilka głównych sekcji: 1. **Panel Historii (History Panel):** Znajduje się po prawej stronie i zawiera wszystkie przesłane pliki oraz wyniki generowane przez narzędzia. 2. **Panel Narzędzi (Tool Panel):** Znajduje się po lewej stronie i zawiera listę wszystkich dostępnych narzędzi, pogrupowanych według kategorii. 3. **Panel Centralny:** Służy do wyświetlania formularzy narzędzi, wyników analiz oraz edytora przepływów pracy. ## Podstawowy proces pracy w Galaxy Typowy cykl pracy w Galaxy obejmuje następujące kroki: 1. **Import danych:** Przesłanie pliku z komputera lokalnego, pobranie danych z zewnętrznego adresu URL lub wybór danych z publicznego repozytorium. 2. **Wybór narzędzia:** Wyszukanie i wybranie odpowiedniego narzędzia z panelu narzędzi. 3. **Konfiguracja parametrów:** Ustawienie niezbędnych parametrów wejściowych w formularzu narzędzia. 4. **Uruchomienie analizy:** Po kliknięciu przycisku „Execute”, zadanie zostaje dodane do kolejki i przetworzone na serwerze. 5. **Analiza wyników:** Wynik pojawia się w panelu historii, gdzie można go podejrzeć, pobrać lub użyć jako wejście do kolejnego narzędzia.).
    3. Kliknij w Analiza danych (Rycina 2A) w panelu nagłówka, aby uzyskać dostęp do Widok strony głównej analizy który jest również ekranem startowym w Galaxy.
      UWAGA: Nagłówek zawiera również inne linki, których szczegóły można wyświetlić, najeżdżając na nie kursorem myszy. W prawym górnym rogu nagłówka znajduje się pasek postępu monitorujący przestrzeń wykorzystaną do zadań (Rycina 2B).
    4. Kliknij w 'NGS: analiza RNAzadanie w Menu narzędzi na lewym panelu (Rycina 2C) aby uzyskać dostęp do wszystkich narzędzi wymaganych do analizy danych RNA-seq.
      UWAGA: Te Menu narzędzi kataloguje wszystkie operacje oferowane przez Galaxy. Menu to jest podzielone według zadań; kliknięcie dowolnego z nich otwiera listę wszystkich narzędzi niezbędnych do wykonania danego zadania.
    5. Utwórz nową historię analiz, klikając ikonę koła zębatego u góry obszaru „Historiapanel po prawej stronie (Rysunek 2E). Wybierz 'Utwórz noweopcję z menu rozwijanego. Nadaj temuHistoriaodpowiednia nazwa służąca do identyfikacji analizy.
      UWAGA: Panel „History” (Historia) wyświetla wszystkie pliki przesłane do analizy, a także wszystkie pliki wynikowe generowane podczas wykonywania zadań w systemie Galaxy. Kliknięcie nazwy pliku w tym panelu otwiera okno dialogowe ze szczegółowymi informacjami na temat wykonanego zadania oraz fragmentem zbioru danych (Rycina 2F)Ikony w tym polu umożliwiają użytkownikowiwidok', 'edytuj atrybutylubusuńzbiór danych (Rycina 2F, zaznaczone na niebiesko). Ponadto użytkownik może równieżedytujtagi zestawu danych lub adnotacja (Rycina 2F, zaznaczony na fioletowo), 'pobierzdane,wyświetl szczegółyzadania,ponowne uruchomieniezadanie lub nawetwizualizowaćzbiór danych z tego okna dialogowego (Rycina 2F, zaznaczone na czerwono).
    6. Kliknij „Prześlij plik funkcja w ramachPobierz dane w „Menu narzędziaby przesłać surowe dane fastq pliki
      UWAGA: Kliknięcie tego lub dowolnego innego narzędzia otwiera krótki opis operacji oraz sam test w środkowej części ekranu Interfejs analizy panel. Panel ten łączy ze sobą Narzędzia z lewego panelu i z Pliki wejściowe z prawej stronyHistoriapanel (Rysunek 2E). Tutaj pliki wejściowe z 'Historiazostają wybrane i zdefiniowane pozostałe parametry w celu uruchomienia danego zadania. Powstały w wyniku każdego testu zestaw danych wyjściowych jest zapisywany z powrotem wHistoria'. Dołączone do testu w ramach „Interfejs analizy" panel zawiera objaśnienia wszystkich parametrów dostępnych do uruchomienia danego narzędzia wraz ze szczegółową listą wszystkich plików wyjściowych generowanych przez to narzędzie.
    7. Po otwarciu zadania w Interfejs analizy, kliknij „Wybierz plik lokalnylubWybierz plik FTP (szybsza wysyłka), przejdź do folderu zawierającego pliki z sekwencjonowaniem i wybierz odpowiedni zestaw danych do przesłania.
    8. Zezwól systemowi Galaxy naAutowykrywanietyp przesłanego pliku (ustawienie domyślne). WybierzC. elegansw menu rozwijanym dla genomu.
    9. Kliknij „Startw celu rozpoczęcia przesyłania danych. Po przesłaniu plik zostanie zapisany wHistoriapanel i można go stamtąd otworzyć.
    10. Jeśli dla jednej próbki zostanie wygenerowanych wiele plików z danymi sekwencyjnymi, należy je połączyć za pomocą funkcji 'Łączyć (konkatenować)narzędzia. Aby to zrobić, otwórzManipulacja tekstem opcja w Menu Narzędzia.
    11. Kliknij w Łączyć w ciąg narzędzia, wybierz z rozwijanego pola na środku pliki, które należy połączyć zInterfejs analizy i kliknij 'Wykonaj.
      UWAGA: Pliki wyjściowe generowane przy użyciu tego zadania są tworzone w fastq format. Program do mapowania ma limit 16 000 000 sekwencji na fastq pliku, a po osiągnięciu tego limitu nowy fastq plik jest generowany dla pozostałych sekwencji. Łączyć w łańcuch w takich przypadkach niezbędne jest narzędzie do łączenia zestawów danych.
    12. Konwertuj przesłany fastq sformatuj pliki zgodnie z wymaganiami fastqsanger format dla analizy RNA-Seq w programie Galaxy z wykorzystaniem „narzędzie do obróbki plików fastq narzędzie znajdujące się w zakładce „NGS: Kontrola jakości i manipulacjasekcji (patrz plik uzupełniający).
    13. Wybierz odpowiedni fastq zbiór danych w sekcji „Plik do opracowania opcję i uruchom narzędzie, korzystając z parametrów domyślnych.
      UWAGA: Pliki wyjściowe generowane w ramach tego zadania są tworzone w formacie fastqsanger.
  2. fastqsanger Testy kontroli jakości danych
    1. Sprawdź jakość przesłanych materiałów fastqsanger odczyty za pomocą „FastQC narzędzie znajdujące się w sekcji „NGS: kontrola jakości i manipulacjaw menu „Narzędzia”.
    2. Wybierz przygotowane zwierzęta fastqsanger plik danych z menu rozwijanego dla 'Dane z krótkich odczytów z bieżącej biblioteki i uruchom narzędzie, korzystając z parametrów domyślnych.
      UWAGA: Należy zwrócić szczególną uwagę na jakość odczytów oraz obecność sekwencji adapterów. Adaptery są zazwyczaj usuwane w ramach przetwarzania danych po sekwencjonowaniu RNA-Seq przez dostawców usług NGS, jednak w niektórych przypadkach mogą pozostać w danych. Wyjaśnienie standardów jakości znajduje się w http://www.bioinformatics.babraham.ac.uk/projects/fastqc/.
    3. Skonsultuj się z dostawcą NGS i, jeśli obecne są adaptery, usuń je za pomocą narzędzia 'Klip narzędzie z „NGS: kontrola jakości i manipulacja menu zadań
      UWAGA: Pliki wyjściowe generowane za pomocą tego zadania są tworzone w surowym formacie txt, a także w html które można otworzyć w dowolnej przeglądarce internetowej.
  3. Analiza danych z wykorzystaniem pakietu Tuxedo Suite
    1. TopHat
      1. Pobierz najnowszą wersję C. elegans genom referencyjny fasta i gtf pliki w formacie Gene Transfer Format (GTF) z Prześlij plik jak opisano powyżej w punkcie 2.2.6.
      2. Otwórz NGS: Analiza RNA sekcji i kliknij w 'TopHat narzędzie do mapowania odczytów sekwencjonowania do pobranego genomu referencyjnego.
      3. Wybierz odpowiednią odpowiedź z menu rozwijanego do pytania „Czy są to dane typu single-end czy paired-end?”
      4. Wybierz odpowiedni fastq plik
      5. Wybierz „Wykorzystanie genomu historycznego” w następnym menu rozwijanym wybierz genom referencyjny pobrany w kroku 2.4.1.1.
      6. Dla pozostałych parametrów wybierz opcję „Default”, a następnie kliknij „Wykonaj.
        UWAGA: Wśród plików wyjściowych generowanych za pomocą tego zadania, 'Zaakceptowane trafieniaPlik ten jest wykorzystywany w kolejnych etapach.
    2. Cufflinks i Cuffmerge
      1. Wybierz Cufflinks narzędzie w „NGS: analiza RNA sekcja służąca do składania transkryptów, szacowania ich obfitości oraz testowania różnicowej ekspresji.
      2. W pierwszym menu rozwijanym wybierz zmapowany 'Zaakceptowane trafienia (format BAM)plik uzyskany z TopHat analiza
      3. W drugim menu rozwijanym ustaw adnotację referencyjną na gtf plik pobrany w kroku 2.4.1.1.
      4. Wybierz „Tak” dla „Przeprowadź korekcję obciążenia opcję i uruchom zadanie, korzystając z ustawień domyślnych dla wszystkich pozostałych parametrów.
        UWAGA: Wśród plików wyjściowych generowanych za pomocą tego zadania, 'Zaakceptowane transkrypcje plik jest wykorzystywany w kolejnych etapach.
      5. Otwórz Cuffmerge narzędzie w „NGS: Analiza RNA aby połączyć „Złożone transkryptywygenerowano dla wszystkich próbek RNA-Seq.
        UWAGA: Pierwsze pole w narzędziu wypełnia się automatycznie i wymienia wszystkie gtf pliki wygenerowane przez Cufflinks.
      6. Wybierz Złożone transkrypty plik zawierający wszystkie badane szczepy/warunki, w tym powtórzenia biologiczne tego samego szczepu/warunku (patrz sekcja dyskusja w odniesieniu do powtórzeń biologicznych).
      7. Wybierz „Tak” dla „Użyj adnotacji referencyjnej i wybrać gtf plik pobrany w kroku 2.4.1.1.
      8. W poniższym polu ponownie wybierz „Tak” dla opcji „Wykorzystanie danych sekwencyjnychopcję i wybierz cały genom fasta plik pobrany w kroku 2.4.1.1.
      9. Pozostawiając pozostałe parametry w ustawieniach domyślnych, kliknij „Execute”.
        UWAGA: Program Cuffmerge generuje jeden plik wyjściowy w formacie gtf.
    3. Cuffdiff
      1. Przejdź do sekcji „Cuffdiffnarzędzie w 'NGS: Analiza RNA sekcji. W „Transkrypcje menu, wybierz połączony plik wynikowy z Cuffmerge.
      2. Oznacz warunki 1 i 2 nazwami dwóch szczepów/warunków.
        UWAGA: Cuffdiff można przeprowadzać porównania między więcej niż dwoma szczepami lub warunkami, a także eksperymenty z analizą przebiegu czasowego. Wystarczy użyć opcji „Dodaj nowe warunki możliwość dodawania kolejnych szczepów/warunków w razie potrzeby.
      3. Dla każdego szczepu/warunku, w sekcji „Powtórzenia wybierz poszczególneZaakceptowane trafienia pliki wyjściowe z TopHat odpowiadające różnym replikatom biologicznym danego szczepu/warunku. Przytrzymaj klawisz „cmd' klawisz, w przypadku korzystania z komputera Macintosh, oraz 'kontrolny klawisz, w przypadku korzystania z komputera PC, aby zaznaczyć wiele plików.
      4. Pozostałe opcje pozostaw jako parametry domyślne. Kliknij Wykonaj do wykonania zadania.
        UWAGA: Cuffdiff generuje liczne pliki wyjściowe w formacie tabelarycznym jako końcowy wynik analizy RNA-Seq. Obejmują one pliki z wartościami FPKM dla transkryptów, genów (połączone wartości FPKM transkryptów o tej samej tożsamości genowej), transkryptów pierwotnych oraz sekwencji kodujących. Wszystkie wygenerowane pliki danych można przeglądać w dowolnej aplikacji arkusza kalkulacyjnego; zawierają one podobne atrybuty, takie jak nazwa genu, locus, krotność zmiany (w skali log2) oraz dane statystyczne dotyczące porównań między szczepami/warunkami, w tym wartości p oraz wartości q. Dane w tych plikach można sortować na podstawie istotności statystycznej różnic lub krotności zmiany ekspresji genów (wielkości i kierunku zmiany, np. w przypadku genów up- lub down-regulowanych) oraz modyfikować zgodnie z wymaganiami użytkownika. Jeśli konieczna jest konwersja między różnymi identyfikatorami genów (np., ID genu w bazie WormBase kontra numer kosmidu), narzędzia dostępne w Biomart (http://www.biomart.org/można wykorzystać.

3. Analiza terminów Gene Ontology (GO) przy użyciu oprogramowania DAVID

  1. Przejdź do serwisu DAVID ze strony https://david.ncifcrf.gov/. Kliknij 'Start Analysis' w nagłówku strony. W sekcji 'Step 1' skopiuj i wklej listę genów uzyskaną z programu Galaxy do pola A. W sekcji 'Step 2' wybierz 'Wormbase Gene ID' jako identyfikator dla wprowadzonych genów.
    UWAGA: DAVID rozpoznaje większość publicznie dostępnych kategorii adnotacji, dlatego można używać również innych identyfikatorów genów (takich jak Entrez gene ID lub symbol genu).
  2. W sekcji 'Step 3' wybierz 'Gene List' (geny do analizy) w polu 'List Type', a następnie kliknij ikonę 'Submit List'.
    UWAGA: Otworzy się 'Analysis Wizard', który wyświetli listę wszystkich hiperłączy do narzędzi DAVID, które można uruchomić dla przesłanej listy genów (Rycina 3). Kliknij te linki, aby uzyskać dostęp do odpowiednich modułów zgodnie z potrzebami użytkownika. Aby zidentyfikować narzędzia odpowiednie dla danego zadania, kliknij link 'Which DAVID tools to use?' na stronie 'Analysis Wizard'. W dowolnym momencie analizy kliknij link 'Start Analysis' w nagłówku, aby powrócić do strony głównej 'Analysis Wizard'.

figure-protocol-2
Rysunek 3: Układ strony internetowej Analysis Wizard w programie DAVID oraz przykłady wyników operacji. Interfejs użytkownika 'Analysis Wizard' wymienia narzędzia służące do analizy przesłanej listy genów pod kątem wzbogacenia w oparciu o różne parametry. Kliknięcie tych narzędzi powoduje wyświetlenie przeanalizowanych danych na nowej stronie internetowej. Przykłady raportów tabelarycznych generowanych przez funkcje 'Gene Functional Classification', 'Functional Annotation Chart' oraz 'Functional Annotation Clustering' przedstawiono jako wstawki (strzałki). Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

  1. Narzędzie do adnotacji funkcjonalnej 1: Grupowanie adnotacji funkcjonalnych (Functional Annotation Clustering)
    1. Kliknij moduł 'Functional Annotation Clustering', aby przejść do strony podsumowania. Zachowaj domyślne kategorie adnotacji i kliknij 'Functional Annotation Clustering', aby wygenerować klastry podobnych terminów adnotacji uszeregowanych według wyniku wzbogacenia (enrichment score).
    2. Kliknij hiperłącze z nazwą każdego terminu, aby przeczytać szczegółowe informacje na jego temat, oraz 'RT' (related terms), aby wyświetlić inne podobne terminy powiązane z daną kategorią.
    3. Kliknij fioletowy pasek, aby wyświetlić listę genów powiązanych z danym terminem, oraz czerwoną literę „G”, aby wyświetlić wszystkie geny powiązane ze wszystkimi terminami w obrębie klastra.
    4. Kliknij zieloną ikonę, aby zobaczyć dwuwymiarowy widok wszystkich genów i terminów w klastrze.
      UWAGA: Trzy ostatnie kolumny zawierają wyniki analityczne i statystyczne dla każdego terminu. Wyniki dla tej oraz wszystkich pozostałych analiz można pobrać w formacie .txt, klikając łącze 'Download File'.
  2. Narzędzie do adnotacji funkcjonalnej 2: Wykres adnotacji funkcjonalnych (Functional Annotation Chart)
    1. Wróć do strony podsumowania i kliknij 'Functional Annotation Chart', aby zidentyfikować istotnie nadreprezentowane terminy biologiczne (np. aktywność czynnika transkrypcyjnego lub aktywność kinazy) powiązane z listą genów.
    2. Kliknij nazwę terminu, aby uzyskać bardziej szczegółowe informacje, oraz 'RT' (related terms), aby wyświetlić inne powiązane terminy.
    3. Kliknij fioletowy pasek, aby wyświetlić wszystkie powiązane geny dla odpowiedniej, pojedynczej kategorii.
      UWAGA: Dwie ostatnie kolumny zawierają wyniki testów statystycznych dla każdej kategorii.
  3. Narzędzie do adnotacji funkcjonalnej 3: Tabela adnotacji funkcjonalnych (Functional Annotation Table)
    1. Wróć do strony podsumowania i kliknij 'Functional Annotation Table', aby zobaczyć listę wszystkich adnotacji powiązanych z genami na liście, bez przeprowadzania obliczeń statystycznych.
      UWAGA: Narzędzie to może być przydatne do analizy listy gen po genie lub do badania konkretnych, szczególnie interesujących genów.
  4. Narzędzie do funkcjonalnej klasyfikacji genów (Gene Functional Classification Tool)
    1. Wróć do 'Analysis Wizard' i kliknij moduł 'Gene Functional Classification', aby podzielić wprowadzoną listę genów na funkcjonalnie powiązane grupy genów uszeregowane według ich „wyniku wzbogacenia” (Enrichment Score), który jest miarą całkowitego wzbogacenia danej grupy genów na liście.
    2. Kliknij nazwę terminu, aby uzyskać bardziej szczegółowe informacje, oraz 'RG', aby wyświetlić geny funkcjonalnie powiązane z daną grupą genów.
    3. Kliknij czerwoną literę „T” (term reports), aby wyświetlić powiązane aspekty biologiczne, oraz zieloną ikonę, aby zobaczyć dwuwymiarowy widok wszystkich genów i terminów.
  5. Przeglądarka zbiorcza nazw genów (Gene-name Batch Viewer)
    1. Wróć do 'Analysis Wizard' i kliknij 'Gene-name Batch Viewer', aby przetłumaczyć identyfikatory genów Wormbase (Wormbase Gene IDs) na odpowiadające im nazwy genów (WBGene00022855 = tcer-1).
    2. Kliknij nazwę genu, aby uzyskać więcej specyficznych informacji o genie.
    3. Kliknij łącze 'RG' (related genes) obok każdego genu, aby wyświetlić geny przewidywane jako funkcjonalnie powiązane z analizowanym genem.

4. Przesyłanie surowych danych (RAW Data) do bazy NCBI Sequence Read Archive (SRA)

  1. Przejdź do strony SRA za pomocą łącza Sign in to NCBI' lub zarejestruj nowe konto.
  2. Kliknij 'Bioproject'.
  3. Kliknij 'Submission' w sekcji 'Using Bioproject' po lewej stronie.
  4. Wybierz opcję 'New Submission'. Zaktualizuj dane osoby przesyłającej. Przejdź przez pozostałe siedem kart, uzupełniając szczegóły eksperymentu oraz przesyłanych danych. Po zakończeniu kliknij 'Submit'.
    UWAGA: W piątej karcie 'Biosample' pozostaw puste pole 'Biosample'.
  5. Odśwież wynikową stronę, klikając łącze 'My Submissions'. Przesłane dane zostaną wyświetlone wraz z przypisanym numerem zgłoszenia, krótkim opisem i statusem przesyłania.
  6. Kliknij 'Biosample' na górze tej strony w polu 'start a new submission' i utwórz 'new submission'. Prześlij oddzielne zgłoszenia dla każdej próbki.
  7. Podobnie jak w przypadku 'Bioproject' w punkcie 4.4, zaktualizuj dane osoby przesyłającej i przejdź przez pozostałe karty, uzupełniając szczegóły w każdej z nich. Po zakończeniu sprawdź dane i kliknij 'Submit'.
  8. Przejdź pod adres http://www.ncbi.nlm.nih.gov/sra, aby utworzyć końcowe zgłoszenie do Sequence Read Archive (SRA).
  9. Kliknij 'Login to SRA' w sekcji 'Getting Started'.
  10. Na następnej stronie kliknij łącze 'NCBI PDA'. Otworzy się łącze 'Update Preferences'. Wypełnij formularz i kliknij 'Save Preferences'.
  11. Na wynikowej stronie kliknij łącze 'Create New Submission'. Wprowadź odpowiednią nazwę w polu 'Alias' i kliknij 'Save'. Zostanie utworzona tabela z identyfikatorem zgłoszenia i innymi szczegółami.
  12. Kliknij 'New Experiment' i zarejestruj co najmniej jedną unikalną bibliotekę sekwencjonowania dla każdego 'BioSample'.
  13. Wskaż i powiąż wcześniej utworzone identyfikatory zgłoszeń 'BioProject' oraz 'BioSample'. Zostanie utworzony 'New Experiment'.
  14. Po utworzeniu eksperymentu SRA kliknij 'New Run' na dole strony i zidentyfikuj pliki danych, które muszą zostać z nim powiązane.
  15. Oblicz sumę kontrolną MD5 dla każdego pliku danych. Aby zrobić to w terminalu MacIntosh, przejdź do Applications/Utilities/Terminal. W terminalu wpisz 'md5' (bez cudzysłowu), a następnie spację. Przeciągnij i upuść z Findera do terminala pliki, które mają zostać przesłane, i naciśnij 'Enter'.
  16. Terminal zwróci alfanumeryczną sumę MD5. Wprowadź ją w procesie przesyłania plików. Użyj nazwy użytkownika i hasła dostarczonego przez system, aby przesłać pliki za pomocą protokołu FTP.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

U C. elegans eliminacja komórek macierzystych linii płciowej (GSCs) wydłuża czas życia, zwiększa odporność na stres i podnosi poziom tłuszczu w organizmie24,28. Utrata GSCs, wywołana ablacją laserową lub mutacjami takimi jak glp-1, prowadzi do wydłużenia czasu życia poprzez aktywację sieci czynników transkrypcyjnych29. Jednym z takich czynników jest TCER-1, który koduje homolog u nicieni l...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Znaczenie platformy sekwencjonowania galaktyk we współczesnej biologii

Projekt Galaxy odegrał kluczową rolę w pomaganiu biologom bez wykształcenia bioinformatycznego w szybkim i wydajnym przetwarzaniu i analizowaniu danych sekwencjonowania o wysokiej przepustowości. Ta publicznie dostępna platforma, niegdyś uważana za herkulesowe zadanie, sprawiła, że uruchamianie złożonych algorytmów bioinformatycznych w celu analizy danych NGS jest prostym, niezawodnym i łatwym procesem. Oprócz szerokiej gamy n...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy nie mają nic do ujawnienia.

Podziękowania

Autorzy chcieliby wyrazić swoją wdzięczność laboratoriom, grupom i osobom, które rozwinęły Galaxy i DAVID, a tym samym uczyniły NGS szeroko dostępnym dla społeczności naukowej. Dziękujemy za pomoc i rady udzielone przez kolegów z Uniwersytetu w Pittsburghu podczas naszego szkolenia z bioinformatyki. Praca ta była wspierana przez nagrodę Ellison Medical Foundation New Scholar in Aging (AG-NS-0879-12) oraz grant z National Institutes of Health (R01AG051659) dla AG.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
RNaza w sprayu Fisher Scientific21-402-178
Trizol Ambion15596026
SonicatorSonics Vibra Cell VCX130
 Chloroform Eppendorf5415C
 Sigma Aldrich288306
2-propanol Fisher ScientificA416P-4
EtanolDecon Labs2705HC
Woda wolna od RNaz Fisher ScientificBP561-1
 AgilentG2940CA
Mac/PC
Wirówka Bioanalizator

Bibliografia

  1. Venter, J. C., et al. The sequence of the human genome. Science. 291 (5507), 1304-1351 (2001).
  2. Lander, E. S., et al. Initial sequencing and analysis of the human genome. Nature. 409 (6822), 860-921 (2001).
  3. Afgan, E., et al. The Galaxy platform for accessible, reproducible and collaborative biomedical analyses: 2016 update. Nucleic Acids Res. 44 (W1), W3-W10 (2016).
  4. Trapnell, C., Pachter, L., Salzberg, S. L. TopHat: discovering splice junctions with RNA-Seq. Bioinformatics. 25 (9), 1105-1111 (2009).
  5. Trapnell, C., et al. Transcript assembly and quantification by RNA-Seq reveals unannotated transcripts and isoform switching during cell differentiation. Nat Biotechnol. 28 (5), 511-515 (2010).
  6. Roberts, A., Trapnell, C., Donaghey, J., Rinn, J. L., Pachter, L. Improving RNA-Seq expression estimates by correcting for fragment bias. Genome Biol. 12 (3), R22(2011).
  7. Roberts, A., Pimentel, H., Trapnell, C., Pachter, L. Identification of novel transcripts in annotated genomes using RNA-Seq. Bioinformatics. 27 (17), 2325-2329 (2011).
  8. Trapnell, C., et al. Differential gene and transcript expression analysis of RNA-seq experiments with TopHat and Cufflinks. Nat Protoc. 7 (3), 562-578 (2012).
  9. Trapnell, C., et al. Differential analysis of gene regulation at transcript resolution with RNA-seq. Nat Biotechnol. 31 (1), 46-53 (2013).
  10. Huang da, W., Sherman, B. T., Lempicki, R. A. Systematic and integrative analysis of large gene lists using DAVID bioinformatics resources. Nat Protoc. 4 (1), 44-57 (2009).
  11. Giardine, B., et al. Galaxy: a platform for interactive large-scale genome analysis. Genome Res. 15 (10), 1451-1455 (2005).
  12. Han, Y., Gao, S., Muegge, K., Zhang, W., Zhou, B. Advanced Applications of RNA Sequencing and Challenges. Bioinform Biol Insights. 9 (1), 29-46 (2015).
  13. Mardis, E. R. Next-generation sequencing platforms. Annu Rev Anal Chem (Palo Alto Calif). 6, 287-303 (2013).
  14. Yang, I. S., Kim, S. Analysis of Whole Transcriptome Sequencing Data: Workflow and Software. Genomics Inform. 13 (4), 119-125 (2015).
  15. Khatri, P., Draghici, S. Ontological analysis of gene expression data: current tools, limitations, and open problems. Bioinformatics. 21 (18), 3587-3595 (2005).
  16. Huang da, W., Sherman, B. T., Lempicki, R. A. Bioinformatics enrichment tools: paths toward the comprehensive functional analysis of large gene lists. Nucleic Acids Res. 37 (1), 1-13 (2009).
  17. Shaye, D. D., Greenwald, I. OrthoList: a compendium of C. elegans genes with human orthologs. PLoS One. 6 (5), e20085(2011).
  18. Consortium, C. eS. Genome sequence of the nematode C. elegans: a platform for investigating biology. Science. 282 (5396), 2012-2018 (1998).
  19. Agarwal, A., et al. Comparison and calibration of transcriptome data from RNA-Seq and tiling arrays. BMC Genomics. 11, 383(2010).
  20. Mortazavi, A., et al. Scaffolding a Caenorhabditis nematode genome with RNA-seq. Genome Res. 20 (12), 1740-1747 (2010).
  21. Bohnert, R., Ratsch, G. rQuant.web: a tool for RNA-Seq-based transcript quantitation. Nucleic Acids Res. 38, Web Server issue W348-W351 (2010).
  22. Lamm, A. T., Stadler, M. R., Zhang, H., Gent, J. I., Fire, A. Z. Multimodal RNA-seq using single-strand, double-strand, and CircLigase-based capture yields a refined and extended description of the C. elegans transcriptome. Genome Res. 21 (2), 265-275 (2011).
  23. Amrit, F. R., Ratnappan, R., Keith, S. A., Ghazi, A. The C. elegans lifespan assay toolkit. Methods. 68 (3), 465-475 (2014).
  24. Hsin, H., Kenyon, C. Signals from the reproductive system regulate the lifespan of C. elegans. Nature. 399 (6734), 362-366 (1999).
  25. Alper, S., et al. The Caenorhabditis elegans germ line regulates distinct signaling pathways to control lifespan and innate immunity. J Biol Chem. 285 (3), 1822-1828 (2010).
  26. Steinbaugh, M. J., et al. Lipid-mediated regulation of SKN-1/Nrf in response to germ cell absence. Elife. 4, (2015).
  27. Lapierre, L. R., Gelino, S., Melendez, A., Hansen, M. Autophagy and lipid metabolism coordinately modulate life span in germline-less. C. elegans. Curr Biol. 21 (18), 1507-1514 (2011).
  28. Rourke, E. J., Soukas, A. A., Carr, C. E., Ruvkun, G. C. elegans major fats are stored in vesicles distinct from lysosome-related organelles. Cell Metab. 10 (5), 430-435 (2009).
  29. Ghazi, A. Transcriptional networks that mediate signals from reproductive tissues to influence lifespan. Genesis. 51 (1), 1-15 (2013).
  30. Ghazi, A., Henis-Korenblit, S., Kenyon, C. A transcription elongation factor that links signals from the reproductive system to lifespan extension in Caenorhabditis elegans. PLoS Genet. 5 (9), e1000639(2009).
  31. Amrit, F. R., et al. DAF-16 and TCER-1 Facilitate Adaptation to Germline Loss by Restoring Lipid Homeostasis and Repressing Reproductive Physiology in C. elegans. PLoS Genet. 12 (2), e1005788(2016).
  32. Wang, M. C., O'Rourke, E. J., Ruvkun, G. Fat metabolism links germline stem cells and longevity in C. elegans. Science. 322 (5903), 957-960 (2008).
  33. McCormick, M., Chen, K., Ramaswamy, P., Kenyon, C. New genes that extend Caenorhabditis elegans' lifespan in response to reproductive signals. Aging Cell. 11 (2), 192-202 (2012).
  34. Kartashov, A. V., Barski, A. BioWardrobe: an integrated platform for analysis of epigenomics and transcriptomics data. Genome Biol. 16, 158(2015).
  35. Goncalves, A., Tikhonov, A., Brazma, A., Kapushesky, M. A pipeline for RNA-seq data processing and quality assessment. Bioinformatics. 27 (6), 867-869 (2011).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Analiza RNA Seqprzep yw pracy projektu Galaxyadnotacja funkcjonalna DAVIDanaliza danych NGSr nicowa ekspresja gen wmapowanie transkryptomuanaliza ontologii gen wkontrole jako cinarz dzie Cufflinks