Artykuł metodologiczny

Wykorzystanie zasobów CyVerse do transkryptomiki porównawczej de novo organizmów nieobjętych modelem

DOI:

10.3791/55009

9 maja 2017

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół przedstawia porównawczy proces tworzenia transkryptomu i adnotacji de novo dla początkujących bioinformatyków. Przepływ pracy jest dostępny bezpłatnie całkowicie za pośrednictwem CyVerse i połączony przez magazyn danych. Używany jest wiersz poleceń i graficzne interfejsy użytkownika, ale cały potrzebny kod jest dostępny do skopiowania i wklejenia.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten przepływ pracy pozwala początkującym badaczom na wykorzystanie zaawansowanych zasobów obliczeniowych, takich jak chmura obliczeniowa, do przeprowadzenia transkryptomiki porównawczej parami. Służy również jako elementarz dla biologów do rozwijania umiejętności obliczeniowych analityków danych, np. wykonywania poleceń bash, wizualizacji i zarządzania dużymi zbiorami danych. Cały kod wiersza poleceń i dalsze wyjaśnienia każdego polecenia lub kroku można znaleźć na wiki (https://wiki.cyverse.org/wiki/x/dgGtAQ). Platformy Discovery Environment i Atmosphere są połączone ze sobą za pośrednictwem CyVerse Data Store. W związku z tym, po przesłaniu początkowych surowych danych sekwencjonowania, nie ma już potrzeby przesyłania dużych plików danych przez połączenie internetowe, co minimalizuje czas potrzebny na przeprowadzenie analiz. Protokół ten ma na celu analizę tylko dwóch eksperymentalnych metod leczenia lub stanów. Różnicowa analiza ekspresji genów jest przeprowadzana poprzez porównania parami i nie będzie odpowiednia do testowania wielu czynników. Ten przepływ pracy jest również zaprojektowany tak, aby był ręczny, a nie zautomatyzowany. Każdy krok musi zostać wykonany i zbadany przez użytkownika, co zapewnia lepsze zrozumienie danych i wyników analitycznych, a tym samym lepsze wyniki dla użytkownika. Po zakończeniu, protokół ten pozwoli uzyskać transkryptom (transkryptomy) złożony de novo dla organizmów niedostatecznie obsługiwanych (niemodelowych) bez konieczności mapowania do wcześniej złożonych genomów referencyjnych (które zwykle nie są dostępne w organizmach niedostatecznie obsługiwanych). Te transkryptomy de novo są dalej wykorzystywane w analizie różnicowej ekspresji genów parami w celu zbadania genów różniących się między dwoma warunkami eksperymentalnymi. Geny o zróżnicowanej ekspresji są następnie funkcjonalnie opisywane, aby zrozumieć genetyczną reakcję organizmów na warunki eksperymentalne. Ogólnie rzecz biorąc, dane pochodzące z tego protokołu są wykorzystywane do testowania hipotez dotyczących reakcji biologicznych organizmów o niedostatecznym zasięgu.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Homo sapiens i kilka kluczowych modelowych gatunków zwierząt, takich jak Drosophila melanogaster, Mus musculus i Danio rerio, reprezentują większość obecnych i przeszłych prac genomiki funkcjonalnej. Jednak szybko spadające koszty technologii sekwencjonowania o wysokiej przepustowości stwarzają możliwości dla genomiki funkcjonalnej w modelach (a.k.a. "zaniedbane" lub "niedostatecznie obsługiwane") gatunki zwierząt1. Jest to ważna zmiana w genomice, ponieważ organizmy niemodelowe często reprezentują gatunki istotne z ekonomicznego punktu widzenia (np. ostrygi, krewetki, kraby) i oferują możliwości badania nowych fenotypów i systemów biologicznych wykraczających poza zakres występujących u gatunków modelowych.

Chociaż organizmy o niedostatecznym zasięgu stanowią atrakcyjną okazję do badania unikalnych systemów biologicznych, przed badaczami stoi kilka wyzwań, szczególnie podczas analizy bioinformatycznej. Niektóre z tych wyzwań są nieodłącznie związane z przetwarzaniem dużych zbiorów danych, podczas gdy inne wynikają z braku zasobów genetycznych dostępnych dla badaczy pracujących nad organizmami o niedostatecznym dostępie, takich jak genom referencyjny, ontologie specyficzne dla organizmu itp. Wyzwania związane z izolacją i sekwencjonowaniem kwasów nukleinowych są często rutynowe w porównaniu z wyzwaniami związanymi z analizą danych, a zatem analizy bioinformatyczne na ogół okazują się być najbardziej niedocenianym kosztem projektów sekwencjonowania2. Na przykład podstawowa analiza bioinformatyczna sekwencjonowania nowej generacji może składać się z następujących kroków: wysokiej jakości filtrowania i przycinania surowych odczytów sekwencjonowania, składania krótkich odczytów w większe ciągłe części oraz adnotacji i/lub porównań z innymi systemami w celu uzyskania zrozumienia biologii. Choć wydaje się prosty, ten przykładowy przepływ pracy wymaga specjalistycznej wiedzy i zasobów obliczeniowych wykraczających poza zakres komputera laboratoryjnego, co stawia go poza zasięgiem wielu naukowców badających organizmy niemodelowe.

Wrodzone wyzwania mogą być oparte na infrastrukturze lub wiedzy. Klasycznym wyzwaniem infrastrukturalnym jest dostęp do odpowiednich zasobów obliczeniowych. Na przykład zestaw i adnotacje opierają się na algorytmach intensywnie korzystających z obliczeń, które wymagają wydajnych komputerów lub klastrów komputerowych, mających dużą ilość pamięci RAM (256 GB-1 TB) i kilka procesorów/rdzeni do działania. Niestety, wielu badaczy albo nie ma dostępu do takich zasobów obliczeniowych, albo nie posiada wiedzy potrzebnej do interakcji z tymi systemami. Inni badacze mogą mieć dostęp do klastrów obliczeniowych o wysokiej wydajności za pośrednictwem swoich uniwersytetów lub instytucji, ale dostęp do tych zasobów może być ograniczony i czasami powoduje naliczanie opłat za godzinę obliczeniową, tj. liczbę procesorów CPU pomnożoną przez liczbę "godzin zegarowych" czasu rzeczywistego, które te procesory działają. Wykorzystanie systemu infrastruktury cybernetycznej finansowanego przez amerykańską Narodową Fundację Nauki, takiego jak CyVerse3, który zapewnia bezpłatny dostęp do zasobów obliczeniowych naukowcom w Stanach Zjednoczonych i na całym świecie, może pomóc w złagodzeniu wyzwań związanych z infrastrukturą, jak zostanie to zademonstrowane tutaj.

Przykładem typowego wyzwania opartego na wiedzy jest zrozumienie oprogramowania potrzebnego do kompletnych analiz. Aby skutecznie przeprowadzić projekt oparty na sekwencjonowaniu, naukowcy muszą być zaznajomieni z niezliczonymi narzędziami programowymi, które zostały opracowane do analiz bioinformatycznych. Nauka każdego pakietu jest trudna sama w sobie, ale pogarsza ją fakt, że pakiety są stale aktualizowane, ponownie wydawane, łączone w nowe przepływy pracy, a czasami są ograniczane do użytku na nowych licencjach. Ponadto powiązanie danych wejściowych i wyjściowych tych narzędzi czasami wymaga przekształcenia typów danych w celu zapewnienia ich zgodności, co powoduje dodanie kolejnego narzędzia do przepływu pracy. Wreszcie, trudno jest również określić, który pakiet oprogramowania jest "najlepszy" do analizy, a często identyfikacja najlepszego oprogramowania dla określonych warunków eksperymentalnych jest kwestią subtelnych różnic. W niektórych przypadkach dostępne są przydatne recenzje oprogramowania, ale ze względu na ciągłe wydawanie nowych aktualizacji i opcji oprogramowania szybko stają się one nieaktualne.

Dla badaczy badających organizmy o niedostatecznym zasięgu, te wrodzone wyzwania są dodatkiem do wyzwań związanych z analizą danych w nowym organizmie. Te niedostatecznie obsługiwane wyzwania specyficzne dla organizmu najlepiej ilustruje się podczas adnotacji genów. Na przykład organizmy o niedostatecznym zasięgu często nie mają blisko spokrewnionego organizmu modelowego, który można by racjonalnie wykorzystać do identyfikacji ortologii i funkcji genów (np. bezkręgowce morskie i Drosophila). Wiele narzędzi bioinformatycznych wymaga również "szkolenia" w zakresie identyfikacji motywów strukturalnych, które można wykorzystać do identyfikacji funkcji genów. Jednak dane treningowe są zwykle dostępne tylko dla organizmów modelowych, a trenowanie ukrytych modeli Markowa (HMM) jest poza kompetencjami biologów, a nawet wielu bioinformatyków. Wreszcie, nawet jeśli adnotacje można przeprowadzić przy użyciu danych z organizmów modelowych, niektóre ontologie genetyczne związane z organizmami modelowymi nie mają sensu, gdy weźmie się pod uwagę biologię i historię naturalną organizmu zaniedbanego (np. transfer informacji od Drosophila do krewetek).

W świetle tych wyzwań, zasoby bioinformatyczne muszą być rozwijane z myślą o badaczach przeprowadzających analizy de novo na organizmach o niedostatecznym dostępie. Najbliższe kilka lat projektów sekwencjonowania genomiki funkcjonalnej pomoże wypełnić lukę między organizmami modelowymi a organizmami niedostatecznie obsługiwanymi (https://genome10k.soe.ucsc.edu/), ale istnieje wiele narzędzi, które będą musiały zostać opracowane, aby sprostać wyzwaniom omówionym powyżej. CyVerse zajmuje się tworzeniem ekosystemów interoperacyjności poprzez łączenie istniejącej infrastruktury cybernetycznej i aplikacji innych firm w celu dostarczania zarządzania danymi, narzędzi do analizy bioinformatycznej i wizualizacji danych naukowcom zajmującym się naukami przyrodniczymi. Interoperacyjność pomaga płynnie przechodzić między aplikacjami i platformami bioinformatycznymi, zapewniając skalowalne zasoby obliczeniowe oraz ograniczając konwersje formatów plików i ilość danych przesyłanych między platformami. CyVerse oferuje kilka platform, w tym Discovery Environment (DE4, Atmosphere5 oraz Data Store3. DE jest oparty na sieci Web i zawiera wiele popularnych narzędzi analitycznych bioinformatycznych przekonwertowanych na przyjazne dla użytkownika formaty typu "wskaż i kliknij" (zwanych "aplikacjami") i jest graficznym interfejsem użytkownika (GUI) dla magazynu danych, w którym przechowywane są duże zestawy danych (tj. odczyty sekwencjonowania surowego, złożone genomy) i zarządzane nimi. Atmosphere to usługa przetwarzania w chmurze, która oferuje naukowcom większą elastyczność w korzystaniu z zasobów obliczeniowych maszyn wirtualnych, które mają preinstalowaną szeroką gamę narzędzi bioinformatycznych. Obie te platformy są połączone z magazynem danych i mogą być używane razem do tworzenia przepływów pracy, takich jak opisany tutaj. Niniejszy raport koncentruje się na składaniu transkryptomu de novo i przepływach pracy związanych z różnicową analizą ekspresji genów, a także omawia niektóre najlepsze praktyki związane z opracowywaniem i przeprowadzaniem analiz bioinformatycznych. Wyjaśnienie szerszej misji CyVerse (http://www.cyverse.org/about) oraz szczegółowe opisy platformy (http://www.cyverse.org/learning-center) są publicznie dostępne. Wszystkie analizy opisane w niniejszym dokumencie korzystają z Discovery Environment4 (DE) oraz Atmosphere5 i są prezentowane w taki sposób, aby były dostępne dla badaczy na wszystkich poziomach obliczeniowych. Przepływy pracy DE i obrazy Atmosphere mogą być przywoływane bezpośrednio za pomocą adresów URL, aby zapewnić długoterminowe pochodzenie, możliwość ponownego użycia i odtwarzalność.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

UWAGA: Ogólny protokół został ponumerowany według folderów, które zostaną utworzone i nazwane w kroku 1.2 (Rysunek 1 i 2). Protokół ten stanowi standardową porównawczą analizę transkryptomu de novo, a każdy z opisanych tutaj kroków może nie być konieczny dla wszystkich badaczy. Ten przepływ pracy jest dokładnie udokumentowany na towarzyszącej wiki samouczka, która zawiera również wszystkie dodatkowe pliki i linki do dokumentów interesujących programistówinnych firm dla każdego pakietu analitycznego (Tabela 1). Linki do tych materiałów zostaną zamieszczone w całym protokole, aby zapewnić łatwy dostęp do tych informacji. Najlepsze praktyki to notatki dostarczane użytkownikom jako sugestie dotyczące najlepszego sposobu wykonywania zadań lub do rozważenia przez użytkowników, które będą przekazywane za pośrednictwem notatek w protokole. Folder z przykładowymi danymi wejściowymi i wynikami analitycznymi jest publicznie dostępny dla użytkowników i jest zorganizowany zgodnie z sugestiami w protokole (montaż i analiza transkryptomu de novo.

1. Konfiguracja projektu, przesyłanie surowych odczytów sekwencjonowania i ocena odczytów za pomocą FastQC

  1. Uzyskaj dostęp do atmosfery i środowiska odkrywania.
    1. Poproś o bezpłatne konto CyVerse, przechodząc do strony rejestracji (np. person@institution.edu).
    2. Wypełnij wymagane informacje i prześlij.
    3. Przejdź do głównej strony internetowej (http://www.cyverse.org/) i wybierz "Zaloguj się" na górnym pasku narzędzi. Wybierz "Cyverse Login" i zaloguj się przy użyciu swoich danych uwierzytelniających CyVerse.
    4. Przejdź do zakładki Aplikacje i usługi i poproś o dostęp do Atmosphere. Dostęp do środowiska odnajdywania jest przyznawany automatycznie.
  2. Skonfiguruj projekt i przenieś dane do magazynu danych.
    1. Zaloguj się do środowiska odnajdywania (https://de.iplantcollaborative.org/de). Wybierz kartę "Dane", aby wyświetlić menu zawierające wszystkie foldery w magazynie danych.
    2. Utwórz główny folder projektu, w którym będą przechowywane wszystkie dane skojarzone z projektem. Znajdź pasek narzędzi w górnej części okna danych i wybierz Plik | Nowy folder. Nie używaj spacji ani znaków specjalnych w nazwach folderów ani żadnych nazw plików wejściowych/wyjściowych, np. "!@#()[]{}:;$%^&*." Zamiast tego używaj podkreśleń lub myślników, np. "_" lub "-" tam, gdzie to konieczne.
    3. Utwórz pięć folderów w głównym folderze projektu, aby uporządkować analizy (Rysunek 1) Nazwij foldery w następujący sposób, bez przecinków i cudzysłowów: "1_Raw_Sequence", "2_High_Quality_Sequence", "3_Assembly", "4_Differential_Expression", "5_Annotated_Assembly". Podfoldery zostaną umieszczone w każdym z tych głównych folderów projektu (Rysunek 2).

figure-protocol-1
Rysunek 1: Ogólny przegląd organizacji folderów projektu oraz przepływu pracy tworzenia i analizy transkryptomu de novo. Użytkownicy przekażą nieprzetworzone odczyty sekwencjonowania do głównego folderu projektu w magazynie danych, a następnie umieszczą wyniki z każdego kroku w oddzielnych folderach. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-protocol-2
Rysunek 2: Szczegółowy przegląd procesu składania i analizy transkryptomu de novo, który odbywa się w cyberinfrastrukturze CyVerse. Cały proces składania i analizy zostanie ukończony w pięciu krokach, z których każdy otrzyma swój własny folder (pogrubione, ponumerowane ikony folderów). Każdy z pięciu numerowanych folderów kroków przepływu pracy posiada podfoldery zawierające dane wyjściowe z analiz bioinformatycznych (ikony folderów). Dane wejściowe do analizy pochodzą z jednego podfolderu, a następnie są przenoszone do innego folderu za pośrednictwem danych wyjściowych programu analitycznego (prostokąty). Końcowe dane z pierwszych trzech kroków są porównywane i przygotowywane do publikacji. Ostatecznie ten schemat daje główny folder projektu, który ma stopniową analizę, aby współpracownicy i/lub recenzenci manuskryptów mogli szybko zrozumieć przepływ pracy i powtórzyć go przy użyciu każdego pliku, jeśli to konieczne. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

  1. Prześlij nieprzetworzone pliki sekwencji FASTQ do folderu "1_Raw_Sequence" do podfolderu o nazwie "A_Raw_Reads", korzystając z jednej z trzech poniższych metod.
    1. Użyj funkcji prostego przesyłania magazynu danych, aby przejść do paska narzędzi okna danych, klikając przycisk danych na głównym pulpicie DE i wybierz opcję Prześlij | Proste przesyłanie z komputera. Wybierz przycisk Przeglądaj, aby przejść do nieprzetworzonych plików sekwencjonowania FASTQ na komputerze lokalnym. Ta metoda jest odpowiednia tylko dla plików o rozmiarze poniżej 2 GB.
    2. Wybierz przycisk Przekaż u dołu ekranu, aby przesłać przekazane urządzenie. W prawym górnym rogu DE w ikonie dzwonka zostanie zarejestrowane powiadomienie, że przesłane przesłanie zostało przesłane. Po zakończeniu przesyłania zostanie zarejestrowane kolejne powiadomienie.
    3. Alternatywnie użyj Cyberduck do przesyłania większych plików (https://wiki.cyverse.org/wiki/x/pYcVAQ). Zainstaluj Cyberduck, a następnie uruchom go jako program na pulpicie komputera lokalnego.
    4. Na koniec pobierz iCommand i zainstaluj na komputerze lokalnym zgodnie z instrukcjami (https://wiki.cyverse.org/wiki/display/DS/Using+iCommands).
  2. Oceń przekazane, nieprzetworzone odczyty sekwencjonowania przy użyciu aplikacji FastQC w Niemczech.
    1. Wybierz przycisk "Aplikacje" na głównym pulpicie DE, aby otworzyć okno zawierające wszystkie aplikacje analityczne dostępne w DE.
    2. Wyszukaj i otwórz okno narzędzia FastQC na pasku narzędzi wyszukiwania w górnej części okna. Otwórz wersję wieloplikową, jeśli istnieje więcej niż jeden plik FASTQ. Wybierz punkt menu Plik | Nowy folder, aby utworzyć folder o nazwie "B_FastQC_Raw_Reads" i wybierz ten folder jako folder wyjściowy.
    3. Załaduj pliki odczytu FASTQ do okna narzędzi o nazwie "Wybierz dane wejściowe" i wybierz "Uruchom analizę".
    4. Otwórz plik .html lub .pdf, aby wyświetlić wyniki po zakończeniu analizy. FastQC przeprowadza kilka analiz, które testują różne aspekty odczytywanych plików (rysunek 3).

2. Przycinanie i jakość filtrują surowe odczyty, aby uzyskać sekwencję wysokiej jakości

Uwaga: Użyj aplikacji Trimmomatic lub aplikacji Sickle.

  1. Wyszukaj programowalną aplikację Trimmomatic w DE i otwórz ją jak poprzednio.
    1. Prześlij folder z surowymi plikami odczytu FASTQ do sekcji "Ustawienia".
    2. Wybierz, czy pliki sekwencjonowania są jedno- czy sparowane.
    3. Użyj standardowego pliku kontrolnego dostarczonego po wybraniu przycisku Przeglądaj i wklejeniu /iplant/home/shared/Trinity_transdecoder_trinotate_databases w polu "Wyświetlanie:". Wybierz plik o nazwie Trimmomaticv0.33_control_file i uruchom analizę. Plik można pobrać, edytować ustawienia, a następnie przesłać do drugiego folderu projektu, aby utworzyć niestandardowy skrypt przycinania.
    4. Opcjonalnie: Jeśli analiza FastQC zidentyfikowała sekwencje adapterów, użyj ustawienia ILLUMINACLIP, aby przyciąć adaptery Illumina. Wybierz odpowiedni plik adaptera w folderze /iplant/home/shared/Trinity_transdecoder_trinotate_databases jak wyżej.
  2. Wysokiej jakości sekwencja przycinania jest odczytywana za pomocą sierpa.
    1. Wyszukaj i otwórz aplikację Sickle w DE. Wybierz przycięte odczyty FASTQ jako odczyty wejściowe i zmień nazwy plików wyjściowych. Uwzględnij ustawienia jakości w opcjach. Typowe ustawienia to format jakości: illumina, sanger, solexa; Próg jakości: 20; Minimalna długość: 50 lat.
    2. Przenieś wszystkie dane wyjściowe do przyciętego i przefiltrowanego folderu (2_High_Quality_Sequence).
  3. Oceń końcowe odczyty za pomocą FastQC i porównaj z poprzednimi raportami FastQC. Wybierz plik .html, aby wyświetlić stronę internetową ze wszystkimi wynikami. Wybierz folder z plikami obrazów (.png), które są dostarczane w danych wyjściowych, jeśli nie można ich wyświetlić.

3. Montaż transkryptomu de novo przy użyciu Trinity w atmosferze

  1. Otwórz najnowszą wersję instancji Atmosphere, przechodząc do strony wiki (https://wiki.cyverse.org/wiki/x/dgGtAQ). Wybierz łącze do najnowszej wersji obrazu Trinity and Trinotate. Możesz też wyszukać "Trinotate" w narzędziu do wyszukiwania obrazów Atmosphere (https://atmo.iplantcollaborative.org/application/images), aby wyświetlić wszystkie wersje obrazów Trinity i Trinotate.
    1. Wybierz przycisk "Zaloguj się, aby uruchomić", a następnie nazwij instancję Atmosphere.
    2. Wybierz rozmiar instancji "średni3" (procesor: 4, pamięć: 32 GB) lub "duży3" (procesor: 8, pamięć: 64 GB). Uruchom instancję i poczekaj, aż zostanie skompilowana. W niektórych rzadkich przypadkach CyVerse przechodzi konserwację w celu aktualizacji platform. Istniejące instancje są dostępne podczas tych aktualizacji, ale tworzenie nowych instancji może nie być możliwe. Odwiedź stronę CyVerse Status, aby zobaczyć aktualny stan dowolnej platformy ( http://status.cyverse.org/ ).
  2. Otwórz instancję, gdy będzie gotowa, klikając nazwę, a następnie wybierając "Pulpit zdalny" u dołu menu po prawej stronie. Zezwól na przeglądarkę Java i VNC, jeśli zostaniesz o to poproszony. Wybierz przycisk "Połącz" w oknie przeglądarki VNC, a następnie wybierz "Kontynuuj".
    1. Zaloguj się, aby otworzyć osobne okno, które będzie nową instancją przetwarzania w chmurze.
    2. Przenieś przycięte i/lub przefiltrowane pliki odczytu FASTQ do instancji, korzystając z jednej z trzech metod opisanych w krokach 1.3.1 - 1.3.4. Użyj przeglądarki internetowej, aby uzyskać dostęp do DE i pobrać pliki tak jak wcześniej na komputerze lokalnym. Można też użyć poleceń iCommand zainstalowanych na tych obrazach, aby szybko przesyłać duże zestawy danych.
  3. Uruchamianie Trinity w celu składania wysokiej jakości odczytów.
    1. Skonfiguruj folder analizy w instancji Atmosphere. Użyj skryptu dostępnego w DE (/iplant/home/shared/Trinity_transdecoder_trinotate_databases) lub skopiuj i wklej polecenia ze strony wiki (https://wiki.cyverse.org/wiki/x/dgGtAQ). Wyjaśnienie wszystkich poleceń można znaleźć na stronie wiki.
    2. Po ustanowieniu folderu analizy i baz danych Trinotate uruchom asembler Trinity, korzystając z poleceń z góry. Istnieje kilka plików wyjściowych, ale najważniejszym jest końcowy plik asemblera zatytułowany "Trinity.fasta". Zmień nazwę tego pliku FASTA tak, aby był unikalny dla organizmu i traktowania zmontowanych odczytów przed przeniesieniem go do Magazynu danych (folder 3_Assembly), aby zminimalizować potencjalne zamieszanie.
      UWAGA: Dane wyjściowe zliczają tabele do różnicowej analizy ekspresji genów w folderze (4_Differential_Expression).
  4. Oceń zestaw za pomocą rnaQUAST (Rysunek 4).
    1. Przenieś pliki wyjściowe Trinity do folderu "3_Assembly" w DE i oznacz folder "A_Trinity_de_novo_assembly". Nadaj każdemu transkryptomowi, który został zmontowany, podfolder w folderze "A_Trinity_de_novo_assembly" z unikalnymi nazwami, w tym naukową nazwą organizmów i zabiegami związanymi z każdym transkryptomem. Utwórz kolejny podfolder o nazwie "B_rnaQUAST_Output" w folderze "3_Assembly".
    2. Otwórz aplikację zatytułowaną "rnaQUAST 1.2.0 (denovo based)" i nazwij analizę, a następnie wybierz "B_rnaQUAST_Output" jako folder wyjściowy.
      1. Dodaj plik(i) FASTA zestawu de novo do sekcji "Wprowadzanie danych". W sekcji "Wyjście danych" wpisz unikatową nazwę zestawu de novo. Spowoduje to utworzenie folderu z plikami wyjściowymi rnaQUAST w folderze "B_rnaQUAST_Output".
    3. Wybierz dodatkowe opcje w sekcjach "GenemarkS-T Gene Prediction", "BUSCO" i "Parameters".
      1. Wybierz prokariota w sekcji "GenemarkS-T Gene Prediction", jeśli organizm nie jest eukariotyczny.
      2. Uruchom BUSCO, aby wybrać przycisk przeglądania i skopiuj ścieżkę iplant/home/shared/iplantcollaborative/example_data/BUSCO.sample.data do pola "Przeglądanie:" i naciśnij enter. Wybierz najbardziej szczegółowy folder BUSCO, który jest dostępny dla organizmu.
        UWAGA: BUSCO oceni montaż genów rdzeniowych specyficznych dla linii i wyprowadzi, jaki procent genów rdzeniowych zostanie znaleziony. Istnieją foldery ogólne, np. eukariont, oraz bardziej szczegółowe linie, np. stawonogi.
  5. Wyszukaj ciąg "Transcript decoder" (dekoder transkrypcji) i uruchom Transdecoder w pliku wyjściowym FASTA zestawu de novo Trinity w środowisku odnajdywania.
  6. Przenieś wyjściowy plik .pep do folderu zestawu de novo (3_Assembly) w celu użycia w kroku 5 Adnotacja.

4. Wyrażenie różniczkowe parami przy użyciu DESeq2 w DE

  1. Otwórz aplikację DESeq2 w Niemczech zgodnie z wcześniejszym opisem. Nazwij analizę i wybierz folder wyjściowy jako 4_Differential_Expression.
  2. W sekcji "Dane wejściowe" wybierz plik tabeli counts z przebiegu zestawu Trinity i kolumnę, w której można znaleźć nazwy contig w tej tabeli zlicza.
  3. Wprowadź nagłówki kolumn z pliku tabeli danych zliczań, aby określić, które kolumny są porównywane. Umieść przecinki między każdym z warunków. Nie dołączaj pierwszego nagłówka kolumny, który zawiera nazwy kontigów.
  4. W przypadku powtórzeń powtórzyć tę samą nazwę (np. Leczenie1rep1, Leczenie1rep2, Leczenie1rep3 zmieni się w Leczenie1, Leczenie1, Leczenie1). W drugim wierszu podaj nazwy dwóch warunków, które mają być porównywane (np. Leczenie1, Leczenie2). Dopasuj nazwy nagłówków kolumn podane w pierwszym wierszu.
    UWAGA: Te nagłówki kolumn muszą być alfanumeryczne i nie mogą zawierać żadnych znaków specjalnych.

5. Adnotacja za pomocą Trinotate

  1. Uruchom każdą część Trinotate w instancji przetwarzania w chmurze Atmosphere. Uwaga: Polecenia Bash są dostarczane w pliku txt, który można skopiować, wkleić, a następnie zmodyfikować przed uruchomieniem na DE (/iplant/home/shared/Trinity_transdecoder_trinotate_databases) lub na stronie wiki (https://wiki.cyverse.org/wiki/x/dgGtAQ). W przypadku opisywania wielu zespołów, należy dodawać adnotacje do każdego zestawu pojedynczo, a następnie przesyłać ukończone pliki adnotacji z powrotem do folderu "5_Annotation", z których każdy ma unikatowy folder odpowiadający nazwie zespołu.
    1. Uruchom polecenie bash, aby przeszukać transkrypcje Trinity. Zmień liczbę wątków, aby dopasować liczbę procesorów CPU do instancji, np. średni ma 4 procesory, a duży ma 8 procesorów. Zapoznaj się z krokiem 3.1.2, aby uzyskać więcej informacji. Zmień polecenie Trinity.fasta tak, aby było zgodne z nazwą pliku FASTA zestawu.
      UWAGA: Wyszukiwanie w BLAST+ zajmie najwięcej czasu. Może minąć kilka dni, zanim zostanie ukończony. Aktywność komputera w chmurze można sprawdzić w programie Atmosphere bez konieczności uruchamiania przeglądarki VNC Viewer.
    2. Uruchom polecenie bash w celu wyszukania białek przewidywanych przez Transdekoder. Tak jak poprzednio, zmień numer wątku i nazwę pliku, aby odpowiadały warunkom w 5.2.1.
    3. Uruchom polecenie bash dla HMMER i zmień liczbę wątków jak powyżej.
    4. W razie potrzeby uruchom polecenie bash dla signalP i tmHMM. SignalP przewiduje peptydy sygnałowe, a tmHMM przewiduje transbłonowe motywy białkowe.
  2. Wczytywanie wyników do bazy danych SQLite
    1. Po wykonaniu wszystkich powyższych analiz uruchom polecenie bash, aby załadować pliki wyjściowe do końcowej bazy danych adnotacji SQLite. Usuń wszystkie polecenia dla analiz, które nie zostały uruchomione.
    2. Eksportuj bazę danych SQLite do pliku .xls w celu wyświetlenia w popularnych przeglądarkach tabel.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Po utworzeniu plików organizacji projektu (Rysunek 1 i 2), pierwszym zadaniem w tym przepływie pracy jest ocena surowych plików sekwencjonowania, a następnie ich oczyszczenie poprzez przycinanie i filtrowanie jakości. FastQC wygeneruje czytelne dla człowieka statystyki podsumowujące dotyczące wyników jakości i długości sekwencji z formatu pliku FASTQ. Dane FastQC są następnie porównywane przed i po przycinaniu, aby ocenić, czy końcowe odczyty są wysokiej jakości i czy w związku z tym nadają się do montażu. "Jakość sekwencji podstawowej" pokazuje średnią jakość odczytów dla każdej pary zasad sekwencjonowania. Najlepiej jest mieć wynik jakości phred powyżej 20-28, na który wskazują kolory na figurach FastQC. "Wynik jakości na sekwencję" określa, czy może być konieczne filtrowanie jakości odczytów. Jeśli zbyt wiele odczytów ma średni wynik poniżej 20-25, może być konieczne filtrowanie na podstawie średniej jakości odczytu. "Zawartość sekwencji na zasadę" powinna wykazywać równomierny rozkład we wszystkich czterech zasadach nukleotydowych. Jeśli wykazano odchylenie w zawartości nukleotydów, może być konieczne przycinanie końcówek. "Zawartość GC na bazę powinna być również równa we wszystkich pozycjach. W przypadku chybotania może być konieczne przycięcie odczytów, jak w 1.4.4.3. "Zawartość GC na sekwencję" powinna być rozkładem normalnym. Produkty adaptacji lub reakcji łańcuchowej polimerazy (PCR) mogą zanieczyszczać bibliotekę sekwencjonowania i zniekształcać rozkład normalny. W takim przypadku może być konieczne przycinanie adaptera. "Rozkład długości sekwencji" podaje średnie długości wszystkich odczytów. Odczyty mniejsze niż 35-45 par zasad są zwykle odfiltrowywane. "Poziomy duplikacji sekwencji" pokazują, ile razy sekwencja danego odczytu jest widziana w bibliotece. Wysoce zduplikowana sekwencja odczytu i liczba są podane w sekcji "Nadreprezentowane sekwencje". FastQC próbuje również zidentyfikować, czy zduplikowane odczyty są sekwencją adaptera, czy innymi znanymi sekwencjami powiązanymi z platformami sekwencjonowania. Etykieta "Brak trafienia" oznacza, że sekwencja powinna być dalej badana przy użyciu NCBI BLAST6 w celu określenia, czy jest to sekwencja istotna biologicznie, czy też powinna zostać usunięta. DE ma również kilka dostępnych wersji BLAST. Aplikacja DE BLASTn jest dostępna pod adresem: https://de.iplantcollaborative.org/de/?type=apps&app-id=6f94cc92-6d28-45c6-aef1-036be697671d.

Po prześwietleniu surowego sekwencjonowania w celu uzyskania wysokiej jakości odczytów, odczyty muszą zostać złożone w celu utworzenia ciągłych sekwencji (kontigów). Krótko mówiąc, zestawy są tworzone przez wyrównanie wszystkich krótkich odczytów sekwencji w celu znalezienia podobnych sekwencji. Obszary o podobnej sekwencji większe niż określona długość są uważane za tę samą sekwencję, ponieważ prawdopodobieństwo losowo występującej podobnej sekwencji o określonej długości jest bliskie zeru. Trinity wyśle pliki dziennika, pliki fasta dla każdego kroku w procesie montażu. Jednak najważniejszym wyjściem jest końcowy plik asemblera zawierający kontigi, który jest oznaczony jako "Trinity.fasta" i znajduje się w głównym folderze. Ten plik zawiera wszystkie zmontowane kontigi i sam w sobie nie jest praktycznie "czytelny dla człowieka". Dlatego narzędzie rnaQUAST może być użyte do bardziej szczegółowego zrozumienia złożenia. Narzędzie rnaQUAST wyświetli liczby, które pozwolą użytkownikom porównać zespoły w celu określenia, które są najbardziej kompletne (ilustracja 4). Dodatkowe informacje o każdej figurze z rnaQUAST można znaleźć na wiki (https://wiki.cyverse.org/wiki/x/fwuEAQ). Jeśli uruchomiono BUSCO7, szczególnie interesujący jest plik specificity.txt, który pokazuje liczbę kompletnych i częściowych genów BUSCO oraz liczbę przewidywań genów GeneMarkS-T w zestawie. Geny BUSCO to wyselekcjonowane zestawy genów wspólnych dla danej grupy organizmów. Można je wykorzystać do oceny, jak dobrze zespół wychwytuje zestawy genów, które powinny być obecne w danym typie organizmu, który opiera się na kladach filogenetycznych. Samodzielna aplikacja BUSCO jest również dostępna w Niemczech (https://de.iplantcollaborative.org/de/?type=apps&app-id=112b8a52-efd8-11e5-a15c-277125fcb1b1).

Różnicowa analiza ekspresji genów identyfikuje transkrypty, które mają różne wzorce ekspresji w różnych terapiach na podstawie prostych obliczeń na złożone tabele transkrypcji. Algorytm DESeq2 wykorzystuje uogólniony model liniowy (GLM) do określania zmienności na podstawie znormalizowanej średniej. Preferowane są eksperymenty z powtórzeniami, aby można było znormalizować techniczną zmienność wynikającą z sekwencjonowania za pomocą algorytmu DESeq2. Analiza DESeq2 DEG daje dane liczbowe i plik raportu .html, który zawiera wszystkie dane wyjściowe i opis. Alternatywnie zamiast DESeq2 można użyć EdgeR, a ten sam raport .html zostanie wygenerowany z wizualizacjami EdgeR. Naukowcy mogą chcieć uruchomić zarówno DESeq2, jak i EdgeR, aby znaleźć geny o zróżnicowanej ekspresji zidentyfikowane przez oba algorytmy dla danego eksperymentu. Trinotate utworzy plik .xls wyjściowej, który można otworzyć w dowolnym programie do obsługi arkuszy kalkulacyjnych. Pliki DEG .txt i plik .xls adnotacji mogą być analizowane i wizualizowane w wielu aplikacjach podrzędnych, które istnieją poza platformą CyVerse.

figure-results-1
Rysunek 3: FastQC zgłasza odczyty sekwencjonowania nieprzetworzonego, odczyty przycięte oraz końcowe odczyty przycięte i przefiltrowane. Systematyczne porównywanie odczytów sekwencjonowania po każdym kroku przetwarzania wstępnego. Do składania transkryptomów de novo niezbędne są odczyty wysokiej jakości. FastQC może pomóc naukowcom w zrozumieniu początkowej jakości danych sekwencjonowania i śledzeniu, jak wydajnie odczyty zostały wstępnie przetworzone. Wyniki z FastQC będą zależeć od sekwencjonowanych organizmów i próbek, ale jednolitość wszystkich próbek, które będą porównywane dalej, jest głównym celem odczytów wstępnego przetwarzania. Film instruktażowy i dokumentacja są dostępne od autorów i programistów FastQC. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-2
Rysunek 4: Raporty rnaQUAST z trzech oddzielnych zespołów. rnaQUAST może być używany do porównywania wielu zestawów odczytu przy użyciu tego samego asemblera lub wielu asemblerów używających tych samych początkowych odczytów. rnaQUAST wykorzystuje BUSCO do generowania zbiorczych statystyk dotyczących zespołów w oparciu o znane geny rdzeniowe obecne w kladach taksonomicznych. Liczba niezgodności na transkrypt i liczba transkryptów pasujących do genów kanonicznych, dopasowana frakcja, zapewniają wgląd w dokładność asemblerów. Ostatnie cztery przedstawione tutaj wykresy cząstkowe dostarczają zbiorczych danych statystycznych dotyczących długości kontigów i izoform oraz pokrycia oczekiwanych izoform. NAx reprezentuje procent (x) kontigów o długości większej niż długość (bp) na osi y. Frakcja złożona to najdłuższy pojedynczy złożony transkrypt podzielony przez jego długość. Frakcja pokryta to procent kompletnie złożonych transkryptów/izoform zgodnie z oczekiwaniami podstawowych genów prokariotycznych lub eukariotycznych z BUSCO. Dostępny jest opis wszystkich wykresów generowanych przez rnaQUAST (https://wiki.cyverse.org/wiki/x/fwuEAQ). Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

powiedział: powiedział: powiedział: powiedział: powiedział:
Nazwa aplikacjiPlatforma CyVerseDokumentacja stron trzecichDokumentacja CyVerseSzacowany czas wykonywania dla przykładowego zestawu danychLink do aplikacji
Szybka kontrola jakościdehttp://www.bioinformatics.
babraham.ac.uk/projects/fastqc/ https://www.youtube.com/watch?v=bz93ReOv87Y
https://wiki.cyverse.org/wiki/pages/viewpage.action?pageId=9316768Czas trwania: 15 minhttps://de.iplantcollaborative.
org/de/?type=apps&app-id=112b9aa8-c4a7-11e5-8209-
5f3310948295
Trimmomatic v0.33dehttps://github.com/timflutre/trimmomatichttps://wiki.cyverse.org/wiki/display/DEapps/Trimmomatic-programmable-0.33Czas trwania: 30 minhttps://de.iplantcollaborative.
org/de/?type=apps&app-id=9c2a30dc-028d-
11E6-A915-AB4311791E69
sierpdehttps://github.com/najoshi/sicklehttps://wiki.cyverse.org/wiki/display/DEapps/Sickle-quality-based-trimmingCzas trwania: 30 minhttps://de.iplantcollaborative.
org/de/?type=apps&app-id=68b278f8-d4d6-414d-9a64-b685a7714f7c
Trinityatmosferahttps://github.com/trinityrnaseq/trinityrnaseq/wikihttps://pods.iplantcollaborative.
org/wiki/display/atmman/Trinity+-+Trinotate+Atmosfera+Obraz
1 tydzieńhttps://atmo.iplantcollaborative.
org/aplikacja/obrazy/1261
dehttps://wiki.cyverse.org/wiki/display/DEapps/Trinity-64GB-2.1.12-5 dnihttps://wiki.cyverse.org/wiki/display/DEapps/Trinity-64GB-2.1.1
rnaQUAST v1.2.0DE, Atmosferahttp://spades.bioinf.spbau.ru/rnaquast/release1.2.0/manual.htmlhttps://pods.iplantcollaborative.
org/wiki/display/TUT/rnaQUAST+1.2.0+(denovo+based)+using+DE
Czas trwania: 30 minhttps://de.iplantcollaborative.
org/de/?type=apps&app-id=980dd11a-1666-
11E6-9122-930
ba8f23352
Transdekoderdehttps://transdecoder.github.iohttps://wiki.cyverse.org/wiki/display/DEapps/Transcript+decoder+2.02-3 godzinyhttps://de.iplantcollaborative.
org/de/?type=apps&app-id=5a0ba87e-b0fa-4994-92a2-
0d48ee881179
Certyfikat DESeq2dehttps://bioconductor.org/packages/release/bioc/html/DESeq2.htmlhttps://pods.iplantcollaborative.
org/wiki/pages/viewpage.action?pageId=28115142
2-3 godzinyhttps://de.iplantcollaborative.
org/de/?type=apps&app-id=9574e87c-4f90-
11E6-A594-008
Zobacz materiał CFA5AE621
Krawędź Rdehttps://bioconductor.org/packages/release/bioc/vignettes/edgeR/inst/doc/edgeR.pdfhttps://wiki.cyverse.org/wiki/pages/viewpage.action?pageId=281151442-3 godzinyhttps://de.iplantcollaborative.
org/de/?type=apps&app-id=4a08ceda-54fe-
11E6-862F-008
Zobacz materiał CFA5AE621
Trójnotacjaatmosferahttps://trinotate.github.io/https://pods.iplantcollaborative.
org/wiki/display/atmman/Trinity+-+Trinotate+Atmosfera+Obraz
1 tydzieńhttps://atmo.iplantcollaborative.
org/aplikacja/obrazy/1261

Tabela 1: Programy analityczne, platformy, na których są dostępne, oraz dodatkowe zasoby dostępne dla przepływów pracy w kolejności według pierwszego wystąpienia. Wszystkie wersje pakietów są aktualne na kwiecień 2016 r.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W protokole znajduje się pięć krytycznych kroków, z których każdy utworzy swój własny oddzielny folder w głównym folderze projektu (rysunki 1 i 2). Wszystkie podstawowe surowe dane sekwencjonowania są nienaruszalne: powinny być przesłane i przechowywane w pierwszym folderze oznaczonym jako "1_Raw_Sequence" i nie powinny być w żaden sposób zmieniane. Dane można przesłać na jeden z trzech sposobów. Interfejs DE może być używany do bezpośredniego przesyłania plików. Jest to najłatwiejszy sposób przesyłania danych, ale również jego transfer zajmie najwięcej czasu. Cyberduck ma interfejs graficzny i umożliwia użytkownikom przeciąganie i upuszczanie plików w celu przesłania do DE. iCommands to narzędzie wiersza poleceń, którego można używać do przesyłania danych do i z magazynu danych, tworzenia katalogów i zarządzania zestawami danych, a także jest prawdopodobnie najszybszym sposobem przesyłania plików danych. Wszystkie dane w Magazynie Danych mogą być udostępniane innym użytkownikom CyVerse (https://wiki.cyverse.org/wiki/display/DEmanual/Sharing+Data+Files+and+Folders+Via+the+Discovery+Environment), upubliczniane za pośrednictwem wygenerowanego adresu URL ( https://wiki.cyverse.org/wiki/display/DEmanual/Sharing+Data+Files+Via+Public+Links) lub mogą być hostowane jako publicznie i anonimowo (bez nazwy użytkownika) dostępne dane społeczności ( http://data.iplantcollaborative.org; http://mirrors.cyverse.org). Wewnątrz tego folderu odczyty nieprzetworzonej sekwencji są analizowane za pomocą FastQC (http://www.bioinformatics.bbsrc.ac.uk/projects/fastqc/) w celu oceny, jak przycinać i filtrować odczyty w celu wygenerowania odczytów o wysokiej jakości. Po przycięciu i filtrowaniu jakości przydatne jest porównanie danych wyjściowych FastQC w celu określenia, czy jakość odczytu uległa zmianie, w celu ustalenia, czy uległa poprawie, bez utraty informacji (Rysunek 3). Należy pamiętać, że oś x FastQC nie jest liniowa, ale raczej jest podzielona na grupy dla wielu wykresów wyjściowych, co może prowadzić do błędnej interpretacji wyników. Przycięte i przefiltrowane odczyty są następnie wykorzystywane do składania transkryptomów de novo przy użyciu instancji przetwarzania w chmurze Atmosphere. Ten komputer w chmurze korzysta z lokalnego ekranu, klawiatury i myszy, ale ma zainstalowane własne oprogramowanie (Trinity i Trinotate) oraz sprzęt. Uruchamianie programów w instancji komputera w chmurze nie wpłynie w żaden sposób na komputer lokalny. Montaż de novo i dalsza adnotacja będą najprawdopodobniej dwoma najdłużej działającymi krokami w tym procesie pracy. W związku z tym są one wykonywane w programie Atmosphere, aby uniknąć typowych problemów z komputerem współdzielonych w laboratorium, które mogłyby zakłócić analizę, takich jak przerwy w dostawie prądu, ponowne uruchomienie po automatycznych aktualizacjach późno w nocy lub awarie spowodowane przez innych użytkowników. Adnotacja trójdzielna używa BLAST+8, HMMER9, tmHMM10 i PFAM11. Końcowym wynikiem adnotacji jest baza danych SQLite i plik .xls. Wyniki mogą być używane poza CyVerse na platformach analizy podrzędnej, takich jak KEGG12,13.

Ten przepływ pracy jest gotowy do użycia w DE i Atmosphere. Eliminuje to konieczność poświęcania czasu na instalowanie, konfigurowanie i rozwiązywanie problemów z każdym pakietem analitycznym oraz wszystkimi zależnościami wymaganymi przez każde narzędzie. Usprawnia to analizy badaczy, minimalizuje marnotrawstwo wysiłku i obniża barierę wejścia dla wielu naukowców. Ten przepływ pracy w szczególności składa się z odczytów jedno- lub sparowanych końców z platformy sekwencjonowania Illumina, ale w DE i Atmosphere istnieje wiele narzędzi do obsługi innych rodzajów technologii sekwencjonowania. Narzędzia w tym przepływie pracy można łatwo zastąpić odpowiednim alternatywnym narzędziem do obsługi dowolnego rodzaju przychodzącej technologii sekwencjonowania. Dotyczy to również nowych wersji narzędzi analitycznych lub zupełnie nowych narzędzi.

Ten przepływ pracy został specjalnie zaprojektowany do składania, porównywania i opisywania tylko kilku transkryptomów jednocześnie. Dlatego użytkownicy mogą uznać za czasochłonne składanie wielu transkryptomów do porównawczej genetyki populacyjnej. Potoki analiz będą dostępne dla użytkowników genetyki populacyjnej w najbliższej przyszłości, a link do potoku można znaleźć na stronie wiki ( https://wiki.cyverse.org/wiki/x/dgGtAQ). Etap różnicowej analizy ekspresji genów może obsłużyć kontrpróby, ale jest to porównanie parami i nie pozwoli dokładnie ocenić wielu czynników (np. warunków, które zmieniają się w czasie, więcej niż dwóch terapii). W przypadku organizmów z genomami referencyjnymi istnieją zautomatyzowane przepływy pracy (np. TRAPLINE14). Podczas gdy zautomatyzowane przepływy pracy są najłatwiejsze w użyciu dla nowicjuszy, zgromadzenia de novo wymagają oceny i rozważenia każdego kroku opisanego tutaj. Ponadto użytkownicy są zobowiązani do korzystania ze zautomatyzowanych rurociągów w miarę ich konstruowania, a zatem z natury nie są elastyczni, aby sprostać zmieniającym się wymaganiom użytkowników.

Ponieważ większość tego protokołu odbywa się przez Internet, użytkownicy mogą napotkać problemy z ustawieniami przeglądarki. Po pierwsze, programy blokujące wyskakujące okienka mogą w ogóle uniemożliwiać otwieranie okien lub mogą uniemożliwiać otwieranie okien, dopóki nie zostanie udzielone pozwolenie CyVerse w przeglądarce. Atmosphere używa VNC do uzyskiwania dostępu do zdalnych pulpitów, ale może być używane inne oprogramowanie. Cały ten protokół został przeprowadzony w Firefoksie w wersji 45.0.2 i powinien działać ze wszystkimi popularnymi przeglądarkami internetowymi, ale mogą pojawić się pewne niespójności. Przepływ pracy będzie aktualizowany w miarę wydawania nowych wersji przez Trinity ( https://github.com/trinityrnaseq/trinityrnaseq/wiki). Najnowsze wersje i aktualne informacje na temat przepływu pracy można znaleźć na stronie samouczka wiki (Tabela 1, https://wiki.cyverse.org/wiki/x/dgGtAQ). Użytkownicy mogą kontaktować się bezpośrednio z pomocą techniczną lub zadawać pytania na stronie Ask CyVerse (ask.cyverse.org/), aby rozwiązać wszelkie problemy z przepływem pracy.

W DE istnieje kilka aplikacji, które wykonują każdy krok tego protokołu. Na przykład użytkownicy mogą chcieć uruchomić Scythe ( https://github.com/najoshi/sickle) zamiast Trimmomatic15 do przycinania odczytu lub uruchomić EdgeR16 zamiast DESeq17,18. Chociaż wykracza to poza zakres tego manuskryptu, aplikacje DE mogą być kopiowane, edytowane i wydawane przez użytkowników ( https://wiki.cyverse.org/wiki/display/DEmanual/Creating,+Copying,+and+Editing+DE+Apps) lub nowe aplikacje mogą być dodawane przez użytkowników (https://wiki.cyverse.org/wiki/display/DEmanual/Dockerizing+Your+Tools+for+the+CyVerse+Discovery+Environment). Obrazy Atmosphere mogą być również modyfikowane i przekształcane w celu tworzenia nowych lub zmodyfikowanych przepływów pracy, które bardziej szczegółowo odpowiadają potrzebom użytkowników (https://wiki.cyverse.org/wiki/x/TwHX). Ta praca służy jako wprowadzenie do wykorzystania wiersza poleceń do przenoszenia danych i wykonywania analiz. Użytkownicy mogą rozważyć wykorzystanie bardziej zaawansowanych zasobów wiersza poleceń, takich jak interfejsy programowania aplikacji (API) CyVerse (http://www.cyverse.org/science-apis) lub projektowanie własnych aplikacji DE, które wymagają wiedzy na temat tego, jak narzędzie analityczne jest uruchamiane w wierszu poleceń ( https://wiki.cyverse.org/wiki/display/DEmanual/Creating+a+New+App+Interface).

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy chcieliby podziękować za finansowanie z grantu USDA-NIFA 2013-00984, grantu NSF IOS - 1339156, IOS - 1444490, oraz CyVerse (NSF: DBI - 1265383).

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Trimmomatic v0.33USADELLAB.orghttps://github.com/timflutre/trimmomatichttps://de.iplantcollaborative.org/de/?type=apps&app-id=9c2a30dc-028d-11e6-a915-ab4311791e69
SierpJoshi i Fasshttps://github.com/najoshi/sicklehttps://de.iplantcollaborative.org/de/?type=apps&app-id=68b278f8-d4d6-414d-9a64-b685a7714f7c
TrinityBroad Institute i Uniwersytet Hebrajski w Jerozolimiehttps://github.com/trinityrnaseq/trinityrnaseq/wikihttps://atmo.iplantcollaborative.org/application/images/1261
rnaQUAST v1.2.0Laboratorium Biologii Algorytmicznej, Petersburski Uniwersytet Akademicki Rosyjskiej Akademii Naukhttp://spades.bioinf.spbau.ru/rnaquast/release1.2.0/manual.htmlhttps://de.iplantcollaborative.org
/de/?type=aplikacje& app-
id=980dd11a-1666-11e6-9122-
930ba8f23352
TransdecoderBroad Institute and Commonwealth Scientific and Industrial Research Organisationhttps://transdecoder.github.iohttps://de.iplantcollaborative.org/de/?type=apps&app-id=5a0ba87e-b0fa-4994-92a2-0d48ee881179
EdgeR, Robinson et al. 2010.https://bioconductor.org/packages/release/bioc/vignettes/edgeR/inst/doc/edgeR.pdfhttps://de.iplantcollaborative.org/de/?type=apps&app-id=5aa9e294-6f95-42f9-98e9-c9c96b44f499
TrinotateBroad Institute i Uniwersytet Hebrajski w Jerozolimiehttps://trinotate.github.io/https://atmo.iplantcollaborative.org/application/images/1261

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Hasselmann, M., Ferretti, L., Zayed, A. Beyond fruit-flies: population genomic advances in non-Drosophila arthropods. Brief. Funct. Genomics. 14 (6), 424-431 (2015).
  2. Scholz, M. B., Lo, C. -C., Chain, P. S. Next generation sequencing and bioinformatic bottlenecks: the current state of metagenomic data analysis. Anal. Biotech. 23 (1), 9-15 (2012).
  3. Merchant, N., et al. The iPlant Collaborative: Cyberinfrastructure for Enabling Data to Discovery for the Life Sciences. PLoS Biol. 14 (1), e1002342(2016).
  4. Oliver, S. L., Lenards, A. J., Barthelson, R. A., Merchant, N., McKay, S. J. Using the iPlant collaborative discovery environment. Cur. Protoc. Bioinformatics. , 1-22 (2013).
  5. Skidmore, E., Kim, S., Kuchimanchi, S., Singaram, S., Merchant, N., Stanzione, D. iPlant atmosphere: a gateway to cloud infrastructure for the plant sciences. Proc. 2011 ACM. , 59-64 (2011).
  6. Altschul, S. F., Gish, W., Miller, W., Myers, E. W., Lipman, D. J. Basic local alignment search tool. J. Mol. Bio. 215 (3), 403-410 (1990).
  7. Simão, F. A., Waterhouse, R. M., Ioannidis, P., Kriventseva, E. V., Zdobnov, E. M. BUSCO: assessing genome assembly and annotation completeness with single-copy orthologs. Bioinformatics. , (2015).
  8. Camacho, C., et al. BLAST+: architecture and applications. BMC Bioinformatics. 10, 421(2009).
  9. Eddy, S. R. Profile hidden Markov models. Bioinformatics. 14 (9), 755-763 (1998).
  10. Krogh, A., Larsson, B., von Heijne, G., Sonnhammer, E. L. Predicting transmembrane protein topology with a hidden markov model: application to complete genomes. J. Mol. Biol. 305 (3), 567-580 (2001).
  11. Finn, R. D., Coggill, P., et al. The Pfam protein families database: towards a more sustainable future. Nucleic Acids Res. 44 (D1), D279-D285 (2016).
  12. Kanehisa, M., Sato, Y., Kawashima, M., Furumichi, M., Tanabe, M. KEGG as a reference resource for gene and protein annotation. Nucleic Acids Res. 44 (D1), D457-D462 (2016).
  13. Kanehisa, M., Goto, S. KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Res. 28 (1), 27-30 (2000).
  14. Wolfien, M., et al. TRAPLINE: a standardized and automated pipeline for RNA sequencing data analysis, evaluation and annotation. BMC Bioinformatics. 17, 21(2016).
  15. Bolger, A. M., Lohse, M., Usadel, B. Trimmomatic: a flexible trimmer for Illumina sequence data. Bioinformatics. 30 (15), 2114-2120 (2014).
  16. Robinson, M. D., McCarthy, D. J., Smyth, G. K. edgeR: a Bioconductor package for differential expression analysis of digital gene expression data. Bioinformatics. 26 (1), 139-140 (2010).
  17. Anders, S. Analysing RNA-Seq data with the DESeq package. Mol. Biol. 43 (4), 1-17 (2010).
  18. Love, M. I., Huber, W., Anders, S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Bio. 15 (12), 1-21 (2014).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Transkryptomika de novoplatforma Atmosphererodowisko Discoveryanaliza RNA Seqsk adanie Trinityr nicowa ekspresja gen wnarz dzie FastQC

Powiązane artykuły