Method Article

Analiza transkryptomiczna C. elegans powiedział: Dane sekwencjonowania RNA za pośrednictwem pakietu Tuxedo Suite w projekcie Galaxy

DOI:

10.3791/55473

April 8th, 2017

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Galaxy i DAVID stały się popularnymi narzędziami, które pozwalają badaczom bez wykształcenia bioinformatycznego analizować i interpretować dane RNA-Seq. Opisujemy protokół dla badaczy C. elegans do przeprowadzania eksperymentów RNA-Seq, uzyskiwania dostępu i przetwarzania zestawu danych za pomocą Galaxy oraz uzyskiwania znaczących informacji biologicznych z list genów za pomocą DAVID.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Technologie sekwencjonowania nowej generacji (NGS) zrewolucjonizowały charakter badań biologicznych. Spośród nich sekwencjonowanie RNA (RNA-Seq) stało się potężnym narzędziem do analizy ekspresji genów i mapowania transkryptomu. Jednak obsługa zestawów danych RNA-Seq wymaga wyrafinowanej wiedzy obliczeniowej i stanowi nieodłączne wyzwanie dla badaczy biologii. To wąskie gardło zostało złagodzone przez projekt Galaxy o otwartym dostępie, który umożliwia użytkownikom bez umiejętności bioinformatycznych analizowanie danych sekwencyjnych RNA, a także przez Database for Annotation, Visualization, and Integrated Discovery (DAVID), pakiet do analizy terminów Gene Ontology (GO), który pomaga uzyskać znaczenie biologiczne z dużych zbiorów danych. Jednak dla początkujących użytkowników i amatorów bioinformatyki samodzielna nauka i zapoznanie się z tymi platformami może być czasochłonne i zniechęcające. Opisujemy prosty przepływ pracy, który pomoże badaczom C. elegans wyizolować RNA robaka, przeprowadzić eksperyment RNA-Seq i przeanalizować dane za pomocą platform Galaxy i DAVID. Protokół ten zawiera instrukcje krok po kroku dotyczące korzystania z różnych modułów Galaxy w celu uzyskania dostępu do surowych danych NGS, kontroli jakości, dopasowania i różnicowej analizy ekspresji genów, prowadząc użytkownika za pomocą parametrów na każdym kroku w celu wygenerowania listy genów, która może być badana pod kątem wzbogacenia klas genów lub procesów biologicznych za pomocą DAVID. Ogólnie rzecz biorąc, spodziewamy się, że ten artykuł dostarczy informacji badaczom C. elegans podejmującym po raz pierwszy eksperymenty z sekwencją RNA, a także częstym użytkownikom przeprowadzającym niewielką liczbę próbek.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pierwsze sekwencjonowanie ludzkiego genomu, przeprowadzone przy użyciu metody sekwencjonowania dideoksynukleotydów Freda Sangera, zajęło 10 lat i kosztowało szacunkowo 3 miliardy dolarów1,2. Jednak w ciągu nieco ponad dekady od powstania technologia sekwencjonowania nowej generacji (NGS) umożliwiła sekwencjonowanie całego ludzkiego genomu w ciągu dwóch tygodni i za 1000 USD. Nowe instrumenty NGS, które pozwalają na coraz szybsze gromadzenie danych sekwencjonowania z niewiarygodną wydajnością, wraz z gwałtownym obniżeniem kosztów, rewolucjonizują współczesną biologię w niewyobrażalny sposób, ponieważ projekty sekwencjonowania genomu szybko stają się powszechne. Ponadto osiągnięcia te przyspieszyły postęp w wielu innych obszarach, takich jak analiza ekspresji genów poprzez sekwencjonowanie RNA (RNA-Seq), badanie modyfikacji epigenetycznych całego genomu, interakcje DNA-białko oraz badania przesiewowe pod kątem różnorodności mikrobiologicznej u ludzkich gospodarzy. W szczególności sekwencjonowanie RNA oparte na NGS umożliwiło kompleksową identyfikację i mapowanie transkryptomów z dokładnością i czułością, a także zastąpiło technologię mikromacierzy jako metodę z wyboru do profilowania ekspresji. Chociaż technologia mikromacierzy jest szeroko stosowana, jest ograniczona przez zależność od wcześniej istniejących macierzy ze znanymi informacjami genomicznymi oraz inne wady, takie jak hybrydyzacja krzyżowa i ograniczony zakres zmian ekspresji, które można wiarygodnie zmierzyć. Z drugiej strony sekwencja RNA może być używana do wykrywania zarówno znanych, jak i nieznanych transkryptów, przy jednoczesnym wytwarzaniu niskiego szumu tła ze względu na jednoznaczny charakter mapowania DNA. RNA-Seq, wraz z licznymi narzędziami genetycznymi oferowanymi przez organizmy modelowe, takie jak drożdże, muchy, robaki, ryby i myszy, posłużyły jako podstawa wielu ważnych ostatnich odkryć biomedycznych. Pozostają jednak poważne wyzwania, które sprawiają, że NGS jest niedostępny dla szerszej społeczności naukowej, w tym ograniczenia w przechowywaniu, przetwarzaniu, a przede wszystkim w sensownej analizie bioinformatycznej dużych ilości danych sekwencjonowania.

Szybki postęp w technologiach sekwencjonowania i wykładnicza akumulacja danych stworzyły ogromne zapotrzebowanie na platformy obliczeniowe, które pozwolą badaczom na dostęp, analizę i zrozumienie tych informacji. Wczesne systemy były silnie uzależnione od wiedzy z zakresu programowania komputerowego, podczas gdy przeglądarki genomu, takie jak NCBI, które umożliwiały osobom niebędącym programistami dostęp do danych i ich wizualizację, nie pozwalały na wyrafinowane analizy. Internetowa platforma o otwartym dostępie, Galaxy (https://galaxyproject.org/), wypełniła tę lukę i okazała się cennym potokiem, który umożliwia naukowcom przetwarzanie danych NGS i wykonywanie szeregu prostych i złożonych analiz bioinformatycznych. Galaxy został założony i jest utrzymywany przez laboratoria Antona Nekrutenko (Penn State University) i Jamesa Taylora (Johns Hopkins University)3. Galaxy oferuje szeroki zakres zadań obliczeniowych, co czyni go "punktem kompleksowej obsługi" dla niezliczonych potrzeb bioinformatycznych, w tym wszystkich etapów związanych z badaniem RNA-Seq. Pozwala użytkownikom na przetwarzanie danych zarówno na swoich serwerach, jak i lokalnie na własnych maszynach. Dane i przepływy pracy mogą być powielane i udostępniane. Samouczki online, sekcja pomocy i strona wiki (https://wiki.galaxyproject.org/Support) poświęcone Projektowi Galaxy zapewniają stałe wsparcie. Jednak dla początkujących użytkowników, zwłaszcza tych bez wykształcenia bioinformatycznego, proces ten może wydawać się zniechęcający, a proces samodzielnej nauki i zaznajamiania się z nim może być czasochłonny. Ponadto badany system biologiczny oraz specyfika eksperymentu i zastosowane metody wpływają na decyzje analityczne na kilku etapach, a te mogą być trudne do nawigacji bez instrukcji.

Ogólny przepływ pracy RNA-Seq Galaxy składa się z przesyłania danych i kontroli jakości, a następnie analizy za pomocą Tuxedo Suite4,5,6,7,8,9, który jest zbiorem różnych narzędzi wymaganych do różnych etapów analizy danych RNA-Seq10,11,12,13,14. Typowy eksperyment RNA-Seq składa się z części eksperymentalnej (przygotowanie próbki, izolacja mRNA i przygotowanie biblioteki cDNA), NGS i analizy danych bioinformatycznych. Przegląd tych sekcji oraz kroków związanych z rurociągiem Galaxy pokazano na rysunku 1.

figure-introduction-1
Rysunek 1: Omówienie przepływu pracy sekwencjonowania RNA. Ilustracja etapów eksperymentalnych i obliczeniowych związanych z eksperymentem RNA-Seq w celu porównania profili ekspresji genów dwóch szczepów robaków (A i B, odpowiednio pomarańczowe i zielone linie oraz strzałki). Różne wykorzystane moduły Galaxy są pokazane w ramkach z odpowiadającym im krokiem w naszym protokole zaznaczonym na czerwono. Dane wyjściowe różnych operacji są zapisywane w kolorze szarym, a formaty plików są wyświetlane na niebiesko. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Pierwszym narzędziem w pakiecie Tuxedo jest program do wyrównywania o nazwie 'Tophat'. Rozkłada dane wejściowe NGS na mniejsze fragmenty, a następnie mapuje je do genomu referencyjnego. Ten dwuetapowy proces zapewnia, że odczyty obejmujące regiony introniczne, których wyrównanie mogłoby zostać w inny sposób zakłócone lub pominięte, są uwzględniane i mapowane. Zwiększa to zasięg i ułatwia identyfikację nowych połączeń spawów. Dane wyjściowe Tophat są raportowane jako dwa pliki, plik BED (z informacjami o połączeniach splicingowych, które obejmują lokalizację genomu) i plik BAM (ze szczegółami mapowania każdego odczytu). Następnie plik BAM jest dopasowywany do genomu referencyjnego w celu oszacowania obfitości poszczególnych transkryptów w każdej próbce za pomocą kolejnego narzędzia w pakiecie Tuxedo o nazwie "Spinki do mankietów". Spinki do mankietów działają poprzez skanowanie wyrównania w celu zgłoszenia pełnowymiarowych fragmentów transkryptu lub "transfragów", które obejmują wszystkie możliwe warianty splicingu w danych wejściowych dla każdego genu. Na tej podstawie generuje "transkryptom" (zestaw wszystkich transkryptów wygenerowanych na gen dla każdego genu) dla każdej sekwencjonowanej próbki. Te zespoły spinek do mankietów są następnie zwijane lub łączone razem z genomem referencyjnym w celu utworzenia pojedynczego pliku adnotacji do dalszej analizy różnicowej za pomocą następnego narzędzia, "Cuffmerge". Na koniec narzędzie "Cuffdiff" mierzy różnicową ekspresję genów między próbkami, porównując dane wyjściowe TopHat każdej z próbek z końcowym plikiem wyjściowym Cuffmerge (rysunek 1). Spinki do mankietów wykorzystują wartości FPKM/RPKM (Fragments/Reads Per Kilobase of transcript per Million mappped reads) do raportowania obfitości transkrypcji. Wartości te odzwierciedlają normalizację surowych danych NGS pod kątem głębokości (średnia liczba odczytów z próbki, które są zgodne z genomem referencyjnym) i długości genów (geny mają różne długości, więc liczby muszą być znormalizowane dla długości genu, aby porównać poziomy między genami). FPKM i RPKM są zasadniczo takie same, przy czym RPKM jest używany do sekwencji RNA-Seq z jednym końcem, gdzie każdy odczyt odpowiada pojedynczemu fragmentowi, podczas gdy FPKM jest używany do sekwencjonowania RNA-Seq z parowanym końcem, ponieważ uwzględnia fakt, że dwa odczyty mogą odpowiadać temu samemu fragmentowi. Ostatecznym wynikiem tych analiz jest lista genów o zróżnicowanej ekspresji w badanych warunkach i/lub szczepach.

Po udanym uruchomieniu Galaxy i wygenerowaniu 'listy genów', następny logiczny krok wymaga więcej analiz bioinformatycznych, aby wydedukować znaczącą wiedzę z zestawów danych. Powstało wiele pakietów oprogramowania, które zaspokajają tę potrzebę, w tym publicznie dostępne pakiety obliczeniowe oparte na sieci Web, takie jak DAVID (Database for Annotation, Visualization and Integrated Discovery)15. DAVID ułatwia przypisywanie znaczenia biologicznego dużym listom genów z badań wysokoprzepustowych, porównując przesłaną listę genów ze zintegrowaną bazą wiedzy biologicznej i ujawniając adnotacje biologiczne związane z listą genów. Następnie przeprowadzana jest analiza wzbogacenia, tj. testy mające na celu określenie, czy jakikolwiek proces biologiczny lub klasa genów jest nadreprezentowana na liście genów w statystycznie istotny sposób. Stał się popularnym wyborem ze względu na połączenie szerokiej, zintegrowanej bazy wiedzy i potężnych algorytmów analitycznych, które umożliwiają naukowcom wykrywanie tematów biologicznych wzbogaconych w "listach genów" pochodzących z genomiki10,16. Dodatkowe zalety to możliwość przetwarzania list genów utworzonych na dowolnej platformie sekwencjonowania oraz bardzo przyjazny dla użytkownika interfejs.

Nicień Caenorhabditis elegans to model genetyczny, dobrze znany ze swoich wielu zalet, takich jak mały rozmiar, przezroczyste ciało, prosty plan ciała, łatwość hodowli i duża podatność na genetyczne i molekularne rozwarstwienie. Robaki mają mały, prosty i dobrze opisany genom, który zawiera do 40% konserwatywnych genów ze znanymi ludzkimi homologami17. Rzeczywiście, C. elegans był pierwszym metazoanem, którego genom został całkowicie zsekwencjonowany18, i jednym z pierwszych gatunków, w których RNA-Seq został użyty do mapowania transkryptomu organizmu19,20. Wczesne badania nad robakami obejmowały eksperymentowanie z różnymi metodami wysokoprzepustowego wychwytywania RNA, przygotowywania bibliotek i sekwencjonowania, a także potokami bioinformatycznymi, które przyczyniły się do rozwoju technologii21,22. W ostatnich latach powszechne stało się eksperymentowanie na robakach oparte na RNA-Seq. Jednak dla tradycyjnych biologów zajmujących się robakami wyzwania związane z analizą obliczeniową danych RNA-Seq pozostają główną przeszkodą w szerszym i lepszym wykorzystaniu tej techniki.

W tym artykule opisujemy protokół korzystania z platformy Galaxy do analizy wysokoprzepustowych danych RNA-Seq generowanych przez C. elegans. Dla wielu początkujących i małych użytkowników najbardziej opłacalnym i najprostszym sposobem przeprowadzenia eksperymentu RNA-Seq jest wyizolowanie RNA w laboratorium i wykorzystanie komercyjnego (lub wewnętrznego) obiektu NGS do przygotowania bibliotek sekwencjonowania cDNA i samego NGS. W związku z tym najpierw szczegółowo opisaliśmy etapy związane z izolacją, kwantyfikacją i oceną jakości próbek RNA C. elegans pod kątem sekwencji RNA. Następnie przedstawiamy instrukcje krok po kroku dotyczące korzystania z interfejsu Galaxy do analizy danych NGS, zaczynając od testów do kontroli jakości po sekwencjonowaniu, a następnie dostosowania, złożenia i różnicowej kwantyfikacji ekspresji genów. Ponadto dołączyliśmy wskazówki, jak przeanalizować listy genów wynikające z Galaxy pod kątem badań nad wzbogaceniem biologicznym przy użyciu DAVID. Ostatnim krokiem w procesie pracy jest instrukcja przesyłania danych RNA-Seq na serwery publiczne, takie jak Sequence Read Archive () na NCBI (http://www.ncbi.nlm.nih.gov/), aby udostępnić je społeczności naukowej. Ogólnie rzecz biorąc, przewidujemy, że ten artykuł dostarczy wyczerpujących i wystarczających informacji biologom zajmującym się robakami podejmującym po raz pierwszy eksperymenty z sekwencjonowaniem RNA, a także częstym użytkownikom korzystającym z niewielkiej liczby próbek.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Izolacja RNA

  1. Środki ostrożności
    1. Przetrzyj całą powierzchnię roboczą, instrumenty i pipety za pomocą dostępnego w handlu sprayu RNazy, aby wyeliminować wszelkie obecne RNazy.
    2. Przez cały czas noś rękawiczki, regularnie wymieniając je na nowe podczas różnych etapów protokołu.
    3. Używaj tylko końcówek filtrujących i utrzymuj wszystkie próbki na lodzie tak długo, jak to możliwe, aby uniknąć degradacji RNA.
      UWAGA: Aby uzyskać najlepsze dane z platform NGS, bardzo ważne jest, aby zacząć od wysokiej jakości RNA. Metody izolacji i przygotowania RNA różnią się w zależności od pochodzenia próbki, metody sekwencjonowania i preferencji badacza. W tym celu można użyć kilku dostępnych na rynku zestawów lub RNA można również wyizolować przy użyciu standardowej metody ekstrakcji fenolowo-chloroformowej RNA. W przypadku każdej z tych metodologii należy przestrzegać wymienionych powyżej środków ostrożności w całym procesie, aby zminimalizować zanieczyszczenie i uzyskać nieskazitelne próbki RNA.
  2. Zbieranie robaków
    1. Zsynchronizuj populację robaków za pomocą wybielania podchlorynem23, aby uzyskać 1,000-1,500 dorosłych robaków C. elegans w tym samym wieku na szczep.
    2. Zmyj robaki z płytek za pomocą roztworu buforowego M9 i wiruj z prędkością 325 x g na wirówce stołowej przez 30 s. Odessać bufor M9, pozostawiając osad robaków. Powtórz ten krok co najmniej trzy razy, aby wyeliminować przenoszenie bakterii.
    3. Do osadu robaka dodać ~ 500 μl buforu do lizy (w przypadku korzystania z zestawu komercyjnego) lub Trizolu (jednofazowy roztwór izotiocyjanianu fenolu i guanidyny; jeśli przeprowadza się ekstrakcję fenolu i chloroformu opisaną w ppkt 1.3.3) w celu rozbicia tkanek robaków, dezaktywacji RNaz i ustabilizowania kwasów nukleinowych.
      UWAGA: W tym miejscu można wstrzymać działanie protokołu poprzez błyskawiczne zamrożenie próbek w ciekłym azocie, a następnie przechowywanie w temperaturze -80 °C.
  3. Izolacja RNA
    1. Sonizować próbki robaków o amplitudzie 45% w cyklach 20 s. "ON" i 40 s. "OFF" (8-12 cykli na szczep). Próbki należy zawsze przechowywać na lodzie.
      UWAGA: Upewnij się, że sonda sonikatora jest zanurzona w buforze i jest utrzymywana na stałym poziomie przez cały czas. Unikaj spieniania próbki i dokładnie wyczyść sondę pomiędzy próbkami. Cykle sonikacji mogą się różnić w zależności od rodzaju użytego sonikatora. Zaleca się, aby warunki sonikacji zostały najpierw zoptymalizowane na próbce testowej przed rozpoczęciem eksperymentu.
    2. Jeśli używasz dostępnego na rynku zestawu, kontynuuj izolację RNA zgodnie z zalecanym protokołem. W przypadku izolacji RNA metodą chloroformu fenolowego należy wykonać następujące czynności.
    3. Odwirować próbki poddane sonikacji przy 16 000 x g przez 10 minut w temperaturze 4°C.
    4. Przenieść supernatant do 1,5 ml probówki do mikrofugi bez RNaz i dodać 100 μl chloroformu (1/5 objętości odczynnika do izolacji RNA/DNA).
      Uwaga: Chloroform jest toksyczny. Aby zminimalizować narażenie i uniknąć wdychania, podczas obchodzenia się z tą substancją należy pracować w kapturze chemicznym.
    5. Próbki należy dokładnie wirować przez 30 - 60 s. i pozostawić próbki w temperaturze pokojowej na 3 minuty.
    6. Wirować przy 11 750 x g przez 15 minut w temperaturze 4 °C. Przenieść tylko górną warstwę wodną do nowej probówki do mikrofugi wolnej od RNaz, uważając, aby nie zassać białego granicy faz zawierającej DNA. Powtórz kroki od 1.3.4 do 1.3.6.
    7. Dodać 250 μl (70% fazy wodnej lub 1/2 objętości odczynnika do izolacji RNA/DNA) 2-propanolu i odwrócić probówkę do wymieszania. Pozostaw probówki w temperaturze pokojowej na 10 minut lub pozostaw na noc w temperaturze -80 °C.
    8. Odwirować próbki o masie 11 750 x g przez 10 minut w temperaturze 4 °C. Zdekantować supernatant bardzo ostrożnie, pozostawiając kilka μl na dnie probówki, aby osad nie został naruszony.
    9. Umyj granulat 500 μl 75% etanolu (wyprodukowanego z wody wolnej od RNaz) i odwiruj w temperaturze 16 000 x g przez 5 minut w temperaturze 4 °C.
    10. Usunąć jak najwięcej supernatantu, nie naruszając osadu. Suszyć pellet na powietrzu w kapturze przez kilka minut.
    11. Dodać 30 μl wody wolnej od RNaz i pomóc w rozpuszczeniu osadu RNA, ogrzewając go przez 10 minut w temperaturze 60 °C.
    12. Sprawdź jakość i ilość RNA za pomocą bioanalizatora.
      UWAGA: Bioanalizator generuje RNA Integrity Number (RIN) jako miarę jakości RNA. RIN wynoszący co najmniej 8 jest zalecanym progiem dla próbek RNA-Seq (im wyższy, tym lepiej). Ilość i jakość RNA można również sprawdzić spektrofotometrycznie, ale należy również przeprowadzić wizualną ocenę integralności RNA. Aby to zrobić, należy umieścić próbki na 1,2% żelu agarozowym wystarczająco długo, aby uzyskać odpowiednią separację prążków rybosomalnego RNA 28s i 18s. Obecność dwóch odrębnych prążków (1,75 kb dla 18s rRNA i 3,5 kb dla 28s rRNA w przypadku C. elegans) jest akceptowalną miarą jakości RNA.
    13. Użyj ~100 ng/μL RNA, aby wysłać do dostawcy/zakładu NGS w celu przygotowania bibliotek sekwencjonowania.
      UWAGA: Próbki RNA należy wysyłać na suchym lodzie do dostawcy usług sekwencjonowania. Większość dostawców przeprowadza niezależny test kontroli jakości RNA przed przygotowaniem biblioteki.

2. Analiza danych sekwencyjnych RNA

  1. Pobieranie surowych danych sekwencjonowania
    1. Pobierz skompresowane surowe dane sekwencjonowania fastq zakodowane w formacie fastq.gz od dostawcy NGS za pomocą "protokołu przesyłania plików" (ftp).

figure-protocol-1
Rysunek 2: Układ panelu interfejsu użytkownika Galaxy i kluczowe funkcje sekwencji RNA. Kluczowe funkcje strony są rozwinięte i wyróżnione. (A) podświetla funkcję "Analizuj dane" w nagłówku strony internetowej używanej do uzyskiwania dostępu do widoku głównego analizy. (B) to "pasek postępu", który wskazuje miejsce na serwerze Galaxy wykorzystane przez operację. (C) to "Sekcja narzędzi", która zawiera listę wszystkich narzędzi, które można uruchomić w interfejsie Galaxy. (D) pokazuje sekcję narzędzia "NGS: Analiza RNA" używanego do analizy RNA-Seq. (E) przedstawia panel "Historia", który zawiera listę wszystkich plików wygenerowanych za pomocą Galaxy. (F) pokazuje przykład okna dialogowego, które otwiera się po kliknięciu dowolnego pliku w sekcji Historia. W obrębie (F) niebieskie pole podświetla ikony, których można użyć do przeglądania, edytowania atrybutów lub usuwania zestawu danych, fioletowe pole podświetla ikony, których można użyć do "edycji" tagów zestawu danych lub adnotacji, a czerwone pole wskazuje ikony do pobrania danych, wyświetlenia szczegółów wykonanego zadania lub ponownego uruchomienia operacji. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

  1. Pierwsze kroki z Galaxy
    UWAGA: Galaxy można uruchomić na darmowym serwerze publicznym przy użyciu platformy internetowej zapewniającej dostęp do chmury i bezpłatną ograniczoną pamięć masową. Może być również pobierany i uruchamiany lokalnie na komputerze użytkownika lub w klastrach obliczeniowych hostowanych przez instytucje, ale przetwarzanie lokalne może być ograniczone przez limity przechowywania danych i ograniczenia mocy obliczeniowej komputerów użytkowników. Szczegółowe informacje na temat pobierania i instalacji można uzyskać pod adresem https://wiki.galaxyproject.org/Admin/GetGalaxy. W tym protokole opisujemy wykorzystanie potoku Galaxy przez Internet.
    1. Po pobraniu i zapisaniu danych NGS na komputerze użytkownika, uzyskaj dostęp do Galaxy pod adresem https://usegalaxy.org/.
    2. Zarejestruj konto użytkownika, klikając "Użytkownik" w nagłówku strony, zaloguj się i zacznij od zapoznania się z panelem interfejsu użytkownika.
      UWAGA: Zaleca się, aby użytkownicy po raz pierwszy skorzystali z samouczka "Rozpocznij tutaj" znajdującego się na stronie głównej, aby zapoznać się z podstawową konfiguracją Galaxy (https://github.com/nekrut/galaxy/wiki/Galaxy101-1).
    3. Kliknij "Analizuj dane" (Rysunek 2A) w panelu nagłówka, aby uzyskać dostęp do "Widoku głównego analizy", który jest również ekranem startowym w Galaxy.
      UWAGA: W nagłówku znajdują się również inne linki, których szczegóły można zobaczyć po najechaniu na nie wskaźnikiem myszy. W prawym górnym rogu nagłówka znajduje się pasek postępu, który monitoruje miejsce wykorzystane na zadania (Rysunek 2B).
    4. Kliknij zadanie "NGS: Analiza RNA" w "Menu narzędzi" w lewym panelu (Rysunek 2C), aby uzyskać dostęp do wszystkich narzędzi wymaganych do analizy danych sekwencyjnych RNA.
      UWAGA: "Menu Narzędzia" kataloguje wszystkie operacje oferowane przez Galaxy. To menu jest podzielone na podstawie zadań, a kliknięcie dowolnego z nich otworzy listę wszystkich narzędzi potrzebnych do wykonania tego zadania.
    5. Utwórz nową historię analizy, klikając ikonę koła zębatego w górnej części panelu "Historia" po prawej stronie (Rysunek 2E). Wybierz opcję "Utwórz nowy" z menu podręcznego. Nadaj tej 'Historii' odpowiednią nazwę, aby zidentyfikować analizę.
      UWAGA: Panel "Historia" pokazuje wszystkie pliki przesłane do analizy, a także wszystkie pliki wyjściowe, które są generowane przez uruchamianie zadań w Galaxy. Kliknięcie nazwy pliku w tym panelu powoduje otwarcie okna dialogowego ze szczegółowymi informacjami o wykonanym zadaniu oraz fragmentem zestawu danych (Rysunek 2F). Ikony w tym polu umożliwiają użytkownikowi "przeglądanie", "edytowanie atrybutów" lub "usuwanie" zestawu danych (rysunek 2F, wyróżniony na niebiesko). Ponadto użytkownik może również "edytować" znaczniki zestawu danych lub adnotacje (rysunek 2F, podświetlony na fioletowo), "pobrać" dane, "wyświetlić szczegóły" zadania, "ponownie uruchomić" zadanie, a nawet "zwizualizować" zestaw danych z tego okna dialogowego (rysunek 2F, podświetlony na czerwono).
    6. Kliknij funkcję "Prześlij plik" w sekcji "Pobierz dane" w "Menu narzędzi", aby przesłać surowe pliki fastq.
      UWAGA: Kliknięcie na to lub jakiekolwiek inne narzędzie otwiera krótki opis operacji i samego testu w środkowym panelu "Interfejs analizy". Ten panel łączy ze sobą "Narzędzia" z lewego panelu i "Pliki wejściowe" z prawego panelu "Historia" (Rysunek 2E). W tym miejscu wybierane są pliki wejściowe z 'Historii' oraz definiowane są inne parametry do uruchomienia danego zadania. Wynikowy zestaw danych wyjściowych z każdego testu jest zapisywany z powrotem w "Historii". Do testu w panelu "Interfejs analizy" dołączone są wyjaśnienia wszystkich parametrów dostępnych do uruchomienia danego narzędzia wraz ze szczegółową listą wszystkich plików wyjściowych generowanych przez narzędzie.
    7. Po otwarciu zadania w "Interfejsie analizy" kliknij "Wybierz plik lokalny" lub "Wybierz plik FTP" (szybsze przesyłanie), przejdź do folderu zawierającego pliki sekwencjonowania i wybierz odpowiedni zestaw danych do przesłania.
    8. Zezwól Galaxy na "automatyczne wykrywanie" typu przesłanego pliku (ustawienie domyślne). Wybierz "C. elegans" z menu rozwijanego dla genomu.
    9. Kliknij "Start", aby rozpocząć przesyłanie danych. Po przesłaniu pliku zostanie on zapisany w panelu "Historia" i będzie można uzyskać stamtąd do niego dostęp.
    10. Jeśli dla jednej próbki tworzonych jest wiele plików danych sekwencjonowania, połącz je za pomocą narzędzia "Concatenate". Aby to zrobić, otwórz opcję "Manipulacja tekstem" w "Menu narzędzi".
    11. Kliknij narzędzie "Łącz", wybierz pliki, które chcesz połączyć, z listy rozwijanej w środku "Interfejsu analizy" i kliknij "Wykonaj".
      UWAGA: Pliki wyjściowe utworzone za pomocą tego zadania są generowane w formacie fastq. Program mapujący ma limit 16 000 000 sekwencji na plik fastq, a gdy ten limit zostanie osiągnięty, generowany jest nowy plik fastq dla pozostałych sekwencji. W takich przypadkach narzędzie "Concatenate" jest potrzebne do łączenia zestawów danych.
    12. Przekonwertuj przesłane pliki w formacie fastq na wymagany format fastqsanger do analizy Galaxy RNA-Seq za pomocą narzędzia "fastq groomer" znajdującego się w sekcji "NGS: QC i manipulacja" (patrz plik uzupełniający).
    13. Wybierz odpowiedni zestaw danych fastq w opcji "File to Groom" i uruchom narzędzie przy użyciu parametrów domyślnych.
      UWAGA: Pliki wyjściowe utworzone za pomocą tego zadania są generowane w formacie fastqsanger.
  2. Testy kontroli jakości danych fastqsanger
    1. Sprawdź jakość przesłanych odczytów fastqsanger za pomocą narzędzia "FastQC" znajdującego się w sekcji "NGS: QC i manipulacja" w menu "Narzędzia".
    2. Wybierz przygotowany plik danych fastqsanger z menu rozwijanego "Krótkie dane odczytu z bieżącej biblioteki" i uruchom narzędzie przy użyciu parametrów domyślnych.
      UWAGA: Zwróć szczególną uwagę na jakość odczytów i obecność jakichkolwiek sekwencji adaptera. Adaptery są zwykle usuwane w ramach przetwarzania danych po RNA-Seq przez dostawców NGS, ale w niektórych przypadkach mogą zostać pozostawione. Aby dowiedzieć się, czym są standardy jakości, przejdź do http://www.bioinformatics.babraham.ac.uk/projects/fastqc/.
    3. Skontaktuj się z dostawcą NGS i jeśli adaptery są obecne, przytnij je za pomocą narzędzia "Clip" z menu zadań "NGS: QC and manipulation".
      UWAGA: Pliki wyjściowe utworzone za pomocą tego zadania są generowane w formacie raw txt, a także w formacie html, który można otworzyć w dowolnej przeglądarce internetowej.
  3. Analiza danych za pomocą Tuxedo Suite
    1. Cylinder na głowie
      1. Pobierz najnowszą wersję plików C. elegans reference genome fasta i gtf (Gene Transfer Format) z Upload file', jak opisano powyżej w 2.2.6.
      2. Otwórz sekcję "NGS: Analiza RNA" i kliknij narzędzie "TopHat", aby zmapować odczyty sekwencjonowania do pobranego genomu referencyjnego.
      3. Wybierz odpowiednią odpowiedź z menu rozwijanego na pytanie "Czy są to dane jedno- czy parzyste?".
      4. Wybierz odpowiedni plik fastq.
      5. W następnym menu rozwijanym wybierz opcję "Użyj genomu z historii" i wybierz genom referencyjny pobrany w kroku 2.4.1.1.
      6. Wybierz "Domyślne" dla pozostałych parametrów i kliknij "Wykonaj".
        UWAGA: Spośród plików wyjściowych utworzonych za pomocą tego zadania plik "Zaakceptowane trafienia" jest używany do kolejnych kroków.
    2. spinki do mankietów i spinki do mankietów
      1. Wybierz narzędzie "Spinki do mankietów" w sekcji "NGS: Analiza RNA", aby zebrać transkrypty, oszacować ich obfitość i przetestować ekspresję różnicową.
      2. Z pierwszego menu rozwijanego wybierz zmapowany plik "Zaakceptowane trafienia (format BAM)" uzyskany z analizy TopHat.
      3. W drugim menu rozwijanym ustaw adnotację odniesienia do pliku gtf pobranego w kroku 2.4.1.1.
      4. Wybierz "Tak" dla opcji "Wykonaj korekcję odchylenia" i uruchom zadanie przy użyciu ustawień domyślnych dla wszystkich innych parametrów.
        UWAGA: Spośród plików wyjściowych utworzonych za pomocą tego zadania plik "Zaakceptowane transkrypcje" jest używany do kolejnych kroków.
      5. Otwórz narzędzie "Cuffmerge" w "NGS: Analiza RNA", aby scalić "Zmontowane transkrypty" utworzone dla wszystkich próbek RNA-Seq.
        UWAGA: Pierwsze pole w narzędziu wypełnia się automatycznie i wyświetla listę wszystkich plików gtf utworzonych przez spinki do mankietów.
      6. Wybierz plik "Zmontowane transkrypty" dla wszystkich badanych szczepów/schorzeń, w tym replik biologicznych tego samego szczepu/stanu (patrz dyskusja na temat kontrprób biologicznych).
      7. Wybierz "Tak" dla opcji "Użyj adnotacji referencyjnej" i wybierz plik gtf pobrany w kroku 2.4.1.1.
      8. W poniższym polu ponownie wybierz "Tak" dla opcji "Użyj danych sekwencji" i wybierz cały genom fastplik pobrany w kroku 2.4.1.1.
      9. Zachowując inne parametry jako domyślne, kliknij "Wykonaj".
        UWAGA: Cuffmerge generuje pojedynczy plik wyjściowy gtf.
    3. Różnica mankietów
      1. Przejdź do narzędzia "Cuffdiff" w sekcji "NGS: Analiza RNA". W menu "Transkrypcje" wybierz scalony plik wyjściowy z Cuffmerge.
      2. Oznacz warunki 1 i 2 dwiema nazwami szczepów/warunków.
        UWAGA: Cuffdiff może przeprowadzać porównania między więcej niż dwoma szczepami lub warunkami, a także eksperymenty w czasie. Po prostu użyj opcji "Dodaj nowe warunki", aby dodać każdy nowy szczep/warunek, zgodnie z potrzebami.
      3. Dla każdego szczepu/warunku, w sekcji "Repliki" wybierz indywidualne pliki wyjściowe "Zaakceptowane trafienia" z TopHat, które odpowiadają różnym powtórzeniom biologicznym tego szczepu/stanu. Przytrzymaj "cmd", jeśli używasz komputera Macintosh, i "ctrl", jeśli używasz komputera, aby wybrać wiele plików.
      4. Pozostaw wszystkie inne opcje jako parametry domyślne. Kliknij "Wykonaj", aby uruchomić zadanie.
        UWAGA: Cuffdiff generuje wiele plików wyjściowych w formacie tabelarycznym jako końcowy odczyt analizy RNA-Seq. Należą do nich pliki ze śledzeniem FPKM dla transkryptów, genów (łącznych wartości FPKM transkryptów mających wspólną tożsamość genu), pierwotnych transkryptów i sekwencji kodujących. Wszystkie wygenerowane pliki danych można przeglądać w dowolnej aplikacji arkusza kalkulacyjnego i zawierają podobne atrybuty, takie jak nazwa genu, locus, zmiana krotności (w skali log2), a także dane statystyczne dotyczące porównań między szczepami/warunkami, w tym wartość p i wartości q. Dane w tych plikach można sortować na podstawie istotności statystycznej różnic lub krotnych zmian w ekspresji genów (wielkość i kierunek zmian, jak w genach regulowanych w górę lub w dół) i manipulować nimi zgodnie z wymaganiami użytkowników. Jeśli potrzebna jest konwersja między różnymi identyfikatorami genów (np. identyfikator genu Wormbase vs. liczba kosmidowa), można skorzystać z narzędzi dostępnych na Biomart (http://www.biomart.org/).

3. Analiza terminologiczna ontologii genów (GO) przy użyciu DAVID

  1. Uzyskaj dostęp do DAVID ze strony internetowej https://david.ncifcrf.gov/. Kliknij "Rozpocznij analizę" w nagłówku strony internetowej. W 'Kroku 1' skopiuj i wklej listę genów uzyskanych z Galaxy do pola A. W 'Kroku 2' wybierz 'Wormbase Gene ID' jako identyfikator genów wejściowych.
    UWAGA: DAVID rozpoznaje większość publicznie dostępnych kategorii adnotacji, więc można również użyć innych identyfikatorów genów (takich jak identyfikator genu Entrez lub symbol genu).
  2. W "Kroku 3" wybierz "Lista genów" (geny do analizy) w sekcji "Typ listy", a następnie kliknij ikonę "Prześlij listę".
    UWAGA: Otworzy się "Kreator analizy", aby wyświetlić listę wszystkich hiperłączonych narzędzi DAVID, które można uruchomić na przesłanej liście genów (Rysunek 3). Kliknij te linki, aby uzyskać dostęp do odpowiednich modułów zgodnie z wymaganiami użytkownika. Aby zidentyfikować narzędzia odpowiednie dla danego zadania, kliknij "Jakich narzędzi DAVID użyć?' na stronie "Kreator analizy". Kliknij link "Rozpocznij analizę" w nagłówku, aby powrócić do strony głównej "Kreatora analizy" w dowolnym momencie analizy.

figure-protocol-2
Rysunek 3: Układ strony internetowej Kreatora Analizy DAVID i przykłady wyników operacji. Internetowy interfejs użytkownika "Kreator analizy" zawiera listę narzędzi używanych do analizy przesłanej listy genów w celu wzbogacenia w oparciu o różne parametry. Kliknięcie na te narzędzia powoduje wyświetlenie przeanalizowanych danych na nowej stronie internetowej. Przykłady raportów tabelarycznych wygenerowanych na podstawie "Klasyfikacji funkcjonalnej genów", "Wykresu adnotacji funkcjonalnych" i "Grupowania adnotacji funkcjonalnych" są pokazane jako wstawki (strzałki). Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

  1. Narzędzie adnotacji funkcjonalnej 1: Grupowanie adnotacji funkcjonalnych
    1. Kliknij moduł "Grupowanie adnotacji funkcjonalnych", aby przejść do strony podsumowania. Zachowaj domyślne kategorie adnotacji i kliknij "Funkcjonalne grupowanie adnotacji", aby wygenerować klastry podobnych terminów adnotacji uszeregowane według ich wyniku wzbogacenia.
    2. Kliknij nazwę każdego terminu z hiperłączem, aby przeczytać szczegółowe informacje na jego temat, oraz "RT" (terminy pokrewne), aby wyświetlić listę innych podobnych terminów związanych z daną kategorią.
    3. Kliknij fioletowy pasek, aby wyświetlić listę genów powiązanych z terminem, a czerwony "G", aby wyświetlić listę wszystkich genów powiązanych ze wszystkimi terminami w klastrze.
    4. Kliknij na zieloną ikonę, aby zobaczyć dwuwymiarowy widok wszystkich genów i terminów w klastrze.
      UWAGA: Ostatnie trzy kolumny zawierają listę wyników analitycznych i statystycznych dla każdego terminu. Wyniki dla tej i wszystkich innych analiz można pobrać w formacie .txt, klikając link "Pobierz plik".
  2. Narzędzie adnotacji funkcjonalnej 2: Wykres adnotacji funkcjonalnych
    1. Wróć do strony podsumowania i kliknij "Wykres adnotacji funkcjonalnej", aby zidentyfikować znacznie nadreprezentowane terminy biologiczne (np. aktywność czynnika transkrypcyjnego lub aktywność kinazy) związane z listą genów.
    2. Kliknij nazwę terminu, aby uzyskać bardziej szczegółowe informacje i "RT" (terminy pokrewne), aby wyświetlić listę innych powiązanych terminów.
    3. Kliknij na fioletowy pasek, aby wyświetlić listę wszystkich powiązanych genów odpowiedniej kategorii.
      UWAGA: Dwie ostatnie kolumny zawierają wyniki testów statystycznych dla każdej kategorii.
  3. Narzędzie adnotacji funkcjonalnej 3: Tabela adnotacji funkcjonalnych
    1. Wróć do strony podsumowania i kliknij "Tabela adnotacji funkcjonalnych", aby zobaczyć listę wszystkich adnotacji związanych z genami na liście bez żadnych obliczeń statystycznych.
      UWAGA: To narzędzie może być przydatne do analizy listy genów po genach lub do przyjrzenia się konkretnym, bardzo interesującym genom.
  4. Narzędzie do klasyfikacji funkcjonalnej genów
    1. Wróć do "Kreatora analizy" i kliknij moduł "Klasyfikacja funkcjonalna genów", aby posegregować listę genów wejściowych na funkcjonalnie powiązane grupy genów uszeregowane zgodnie z ich "Wynikiem wzbogacenia", miarą ogólnego wzbogacenia grupy genów na liście.
    2. Kliknij nazwę terminu, aby uzyskać bardziej szczegółowe informacje i "RG", aby ujawnić funkcjonalnie powiązane geny grupy genów
    3. Kliknij na czerwoną literę "T" (raporty o terminach), aby wyświetlić listę powiązanych biologii, oraz na zieloną ikonę, aby zobaczyć dwuwymiarowy widok wszystkich genów i terminów.
  5. Przeglądarka wsadowa o nazwie genowej
    1. Wróć do "Kreatora analizy" i kliknij "Przeglądarka wsadowa nazw genów", aby przetłumaczyć "Identyfikatory genów bazy robaków" na odpowiadające im nazwy genów. (WBGene00022855 = tcer-1).
    2. Kliknij nazwę genu, aby uzyskać więcej informacji o genie.
    3. Kliknij link "RG" (powiązane geny) obok każdego genu, aby wyświetlić geny, które zgodnie z przewidywaniami są funkcjonalnie związane z genem będącym przedmiotem zainteresowania.

4. Przesyłanie danych RAW do archiwum odczytu sekwencji NCBI ()

  1. Wejdź na stronę pod linkiem Zaloguj się do NCBI lub zarejestruj nowe konto.
  2. Kliknij na "Bioprojekt".
  3. Kliknij "Zgłoszenie" pod nagłówkiem "Korzystanie z Bioprojektu" po lewej stronie.
  4. Wybierz opcję "Nowe zgłoszenie". Zaktualizuj dane osoby przesyłającej. Kontynuuj przeglądanie pozostałych siedmiu kart, wypełniając szczegóły eksperymentu i przesyłanych danych. Kliknij "Prześlij" po zakończeniu.
    UWAGA: W piątej zakładce "Biopróbka" pozostaw puste miejsce na "Biopróbkę".
  5. Odśwież wynikową stronę, klikając link "Moje zgłoszenia". Przesłane dane zostaną wymienione z przypisanym numerem zgłoszenia, krótkim opisem i statusem przesłania.
  6. Kliknij "Biosample" u góry tej strony, w polu "rozpocznij nowe zgłoszenie" i utwórz "nowe zgłoszenie". Dla każdej próbki należy przedłożyć osobne zgłoszenia.
  7. Podobnie jak w przypadku "Bioprojektu" w 4.4, zaktualizuj dane osoby przesyłającej i kontynuuj przez pozostałe zakładki, wypełniając szczegóły każdej zakładki. Po zakończeniu przeglądu i kliknij "Prześlij".
  8. Przejdź do http://www.ncbi.nlm.nih.gov/, aby utworzyć ostateczną wersję zgłoszenia 'Sequence Read Archive ()'.
  9. Kliknij "Zaloguj się do" w sekcji "Pierwsze kroki".
  10. Na następnej stronie kliknij link "NCBI PDA". Otworzy się link "Aktualizuj preferencje". Wypełnij formularz i kliknij "Zapisz preferencje".
  11. Na wyświetlonej stronie kliknij link "Utwórz nowe zgłoszenie". Wprowadź odpowiednią nazwę w polu "Alias" i kliknij "Zapisz". Zostanie utworzona tabela z identyfikatorem zgłoszenia i innymi szczegółami.
  12. Kliknij na "Nowy eksperyment" i zarejestruj co najmniej jedną unikalną bibliotekę sekwencjonowania dla każdej "BioSample".
  13. Oznacz i połącz wcześniej utworzone identyfikatory zgłoszeń "BioProject" i "BioSample". Zostanie utworzony "Nowy eksperyment".
  14. Kliknij "Nowy przebieg" u dołu strony po przeprowadzeniu eksperymentu i zidentyfikuj pliki danych, które należy z nim połączyć.
  15. Obliczanie sumy MD5 każdego pliku danych. Aby to zrobić na terminalu MacIntosh, przejdź do Aplikacje/Narzędzia/Terminal. W terminalu wpisz "md5" (bez cudzysłowów), a następnie spację. Przeciągnij i upuść pliki, które należy przesłać do terminala z wyszukiwarki i kliknij "Enter".
  16. Terminal zwróci alfanumeryczną sumę MD5. Wprowadź ten element w ramach procesu przesyłania pliku. Użyj nazwy użytkownika i hasła dostarczonych przez system, aby przesłać pliki za pomocą FTP.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

U C. elegans eliminacja komórek macierzystych linii zarodkowej (GSC) wydłuża życie, zwiększa odporność na stres i podnosi poziom tkanki tłuszczowej24,28. Utrata GSC, spowodowana albo przez ablację laserową, albo przez mutacje, takie jak glp-1, powoduje wydłużenie życia poprzez aktywację sieci czynników transkrypcyjnych29. Jeden z takich czynników, TCER-1, koduje homolog robaka ludzkiego cz...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Znaczenie platformy sekwencjonowania galaktyk we współczesnej biologii

Projekt Galaxy odegrał kluczową rolę w pomaganiu biologom bez wykształcenia bioinformatycznego w szybkim i wydajnym przetwarzaniu i analizowaniu danych sekwencjonowania o wysokiej przepustowości. Ta publicznie dostępna platforma, niegdyś uważana za herkulesowe zadanie, sprawiła, że uruchamianie złożonych algorytmów bioinformatycznych w celu analizy danych NGS jest prostym, niezawodnym i łatwym procesem. Oprócz szerokiej gamy n...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy chcieliby wyrazić swoją wdzięczność laboratoriom, grupom i osobom, które rozwinęły Galaxy i DAVID, a tym samym uczyniły NGS szeroko dostępnym dla społeczności naukowej. Dziękujemy za pomoc i rady udzielone przez kolegów z Uniwersytetu w Pittsburghu podczas naszego szkolenia z bioinformatyki. Praca ta była wspierana przez nagrodę Ellison Medical Foundation New Scholar in Aging (AG-NS-0879-12) oraz grant z National Institutes of Health (R01AG051659) dla AG.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
RNaza w sprayu Fisher Scientific21-402-178
Trizol Ambion15596026
SonicatorSonics Vibra Cell VCX130
 Chloroform Eppendorf5415C
 Sigma Aldrich288306
2-propanol Fisher ScientificA416P-4
EtanolDecon Labs2705HC
Woda wolna od RNaz Fisher ScientificBP561-1
 AgilentG2940CA
Mac/PC
Wirówka Bioanalizator

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Venter, J. C., et al. The sequence of the human genome. Science. 291 (5507), 1304-1351 (2001).
  2. Lander, E. S., et al. Initial sequencing and analysis of the human genome. Nature. 409 (6822), 860-921 (2001).
  3. Afgan, E., et al. The Galaxy platform for accessible, reproducible and collaborative biomedical analyses: 2016 update. Nucleic Acids Res. 44 (W1), W3-W10 (2016).
  4. Trapnell, C., Pachter, L., Salzberg, S. L. TopHat: discovering splice junctions with RNA-Seq. Bioinformatics. 25 (9), 1105-1111 (2009).
  5. Trapnell, C., et al. Transcript assembly and quantification by RNA-Seq reveals unannotated transcripts and isoform switching during cell differentiation. Nat Biotechnol. 28 (5), 511-515 (2010).
  6. Roberts, A., Trapnell, C., Donaghey, J., Rinn, J. L., Pachter, L. Improving RNA-Seq expression estimates by correcting for fragment bias. Genome Biol. 12 (3), R22(2011).
  7. Roberts, A., Pimentel, H., Trapnell, C., Pachter, L. Identification of novel transcripts in annotated genomes using RNA-Seq. Bioinformatics. 27 (17), 2325-2329 (2011).
  8. Trapnell, C., et al. Differential gene and transcript expression analysis of RNA-seq experiments with TopHat and Cufflinks. Nat Protoc. 7 (3), 562-578 (2012).
  9. Trapnell, C., et al. Differential analysis of gene regulation at transcript resolution with RNA-seq. Nat Biotechnol. 31 (1), 46-53 (2013).
  10. Huang da, W., Sherman, B. T., Lempicki, R. A. Systematic and integrative analysis of large gene lists using DAVID bioinformatics resources. Nat Protoc. 4 (1), 44-57 (2009).
  11. Giardine, B., et al. Galaxy: a platform for interactive large-scale genome analysis. Genome Res. 15 (10), 1451-1455 (2005).
  12. Han, Y., Gao, S., Muegge, K., Zhang, W., Zhou, B. Advanced Applications of RNA Sequencing and Challenges. Bioinform Biol Insights. 9 (1), 29-46 (2015).
  13. Mardis, E. R. Next-generation sequencing platforms. Annu Rev Anal Chem (Palo Alto Calif). 6, 287-303 (2013).
  14. Yang, I. S., Kim, S. Analysis of Whole Transcriptome Sequencing Data: Workflow and Software. Genomics Inform. 13 (4), 119-125 (2015).
  15. Khatri, P., Draghici, S. Ontological analysis of gene expression data: current tools, limitations, and open problems. Bioinformatics. 21 (18), 3587-3595 (2005).
  16. Huang da, W., Sherman, B. T., Lempicki, R. A. Bioinformatics enrichment tools: paths toward the comprehensive functional analysis of large gene lists. Nucleic Acids Res. 37 (1), 1-13 (2009).
  17. Shaye, D. D., Greenwald, I. OrthoList: a compendium of C. elegans genes with human orthologs. PLoS One. 6 (5), e20085(2011).
  18. Consortium, C. eS. Genome sequence of the nematode C. elegans: a platform for investigating biology. Science. 282 (5396), 2012-2018 (1998).
  19. Agarwal, A., et al. Comparison and calibration of transcriptome data from RNA-Seq and tiling arrays. BMC Genomics. 11, 383(2010).
  20. Mortazavi, A., et al. Scaffolding a Caenorhabditis nematode genome with RNA-seq. Genome Res. 20 (12), 1740-1747 (2010).
  21. Bohnert, R., Ratsch, G. rQuant.web: a tool for RNA-Seq-based transcript quantitation. Nucleic Acids Res. 38, Web Server issue W348-W351 (2010).
  22. Lamm, A. T., Stadler, M. R., Zhang, H., Gent, J. I., Fire, A. Z. Multimodal RNA-seq using single-strand, double-strand, and CircLigase-based capture yields a refined and extended description of the C. elegans transcriptome. Genome Res. 21 (2), 265-275 (2011).
  23. Amrit, F. R., Ratnappan, R., Keith, S. A., Ghazi, A. The C. elegans lifespan assay toolkit. Methods. 68 (3), 465-475 (2014).
  24. Hsin, H., Kenyon, C. Signals from the reproductive system regulate the lifespan of C. elegans. Nature. 399 (6734), 362-366 (1999).
  25. Alper, S., et al. The Caenorhabditis elegans germ line regulates distinct signaling pathways to control lifespan and innate immunity. J Biol Chem. 285 (3), 1822-1828 (2010).
  26. Steinbaugh, M. J., et al. Lipid-mediated regulation of SKN-1/Nrf in response to germ cell absence. Elife. 4, (2015).
  27. Lapierre, L. R., Gelino, S., Melendez, A., Hansen, M. Autophagy and lipid metabolism coordinately modulate life span in germline-less. C. elegans. Curr Biol. 21 (18), 1507-1514 (2011).
  28. Rourke, E. J., Soukas, A. A., Carr, C. E., Ruvkun, G. C. elegans major fats are stored in vesicles distinct from lysosome-related organelles. Cell Metab. 10 (5), 430-435 (2009).
  29. Ghazi, A. Transcriptional networks that mediate signals from reproductive tissues to influence lifespan. Genesis. 51 (1), 1-15 (2013).
  30. Ghazi, A., Henis-Korenblit, S., Kenyon, C. A transcription elongation factor that links signals from the reproductive system to lifespan extension in Caenorhabditis elegans. PLoS Genet. 5 (9), e1000639(2009).
  31. Amrit, F. R., et al. DAF-16 and TCER-1 Facilitate Adaptation to Germline Loss by Restoring Lipid Homeostasis and Repressing Reproductive Physiology in C. elegans. PLoS Genet. 12 (2), e1005788(2016).
  32. Wang, M. C., O'Rourke, E. J., Ruvkun, G. Fat metabolism links germline stem cells and longevity in C. elegans. Science. 322 (5903), 957-960 (2008).
  33. McCormick, M., Chen, K., Ramaswamy, P., Kenyon, C. New genes that extend Caenorhabditis elegans' lifespan in response to reproductive signals. Aging Cell. 11 (2), 192-202 (2012).
  34. Kartashov, A. V., Barski, A. BioWardrobe: an integrated platform for analysis of epigenomics and transcriptomics data. Genome Biol. 16, 158(2015).
  35. Goncalves, A., Tikhonov, A., Brazma, A., Kapushesky, M. A pipeline for RNA-seq data processing and quality assessment. Bioinformatics. 27 (6), 867-869 (2011).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

C elegans RNA SequencingRNA Seq AnalysisGalaxy Project WorkflowDAVID Functional AnnotationNGS Data AnalysisDifferential Gene ExpressionTranscriptome MappingGene Ontology AnalysisQuality Control ChecksCufflinks Tool

Related Articles