Artykuł metodologiczny

Potok bioinformatyczny do badania ewolucji molekularnej i ekspresji genów przy użyciu sekwencji RNA

DOI:

10.3791/61633

28 maja 2021

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Celem tego protokołu jest zbadanie ewolucji i ekspresji genów kandydujących przy użyciu danych sekwencjonowania RNA.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Destylacja i raportowanie dużych zbiorów danych, takich jak dane dotyczące całego genomu lub transkryptomu, jest często trudnym zadaniem. Jednym ze sposobów na rozbicie wyników jest skupienie się na jednej lub więcej rodzinach genów, które są istotne dla organizmu i badania. W tym protokole przedstawiamy bioinformatyczne kroki w celu wygenerowania filogenezy i ilościowego określenia ekspresji genów będących przedmiotem zainteresowania. Drzewa filogenetyczne mogą dać wgląd w to, jak geny ewoluują w obrębie gatunków i między gatunkami, a także ujawnić ortologię. Wyniki te można poprawić, wykorzystując dane sekwencyjne RNA w celu porównania ekspresji tych genów u różnych osób lub tkanek. Badania nad ewolucją i ekspresją molekularną mogą ujawnić tryby ewolucji i zachowania funkcji genów między gatunkami. Charakterystyka rodziny genów może służyć jako punkt wyjścia do przyszłych badań i może podkreślić ważną rodzinę genów w nowym genomie lub artykule transkryptomowym.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Postępy w technologiach sekwencjonowania ułatwiły sekwencjonowanie genomów i transkryptomów organizmów niemodelowych. Oprócz zwiększonej wykonalności sekwencjonowania DNA i RNA z wielu organizmów, publicznie dostępnych jest wiele danych do badania interesujących genów. Celem tego protokołu jest zapewnienie bioinformatycznych kroków w celu zbadania ewolucji molekularnej i ekspresji genów, które mogą odgrywać ważną rolę w organizmie będącym przedmiotem zainteresowania.

Badanie ewolucji genu lub rodziny genów może dostarczyć wglądu w ewolucję systemów biologicznych. Członkowie rodziny genów są zazwyczaj określani poprzez identyfikację konserwatywnych motywów lub homologicznych sekwencji genów. Ewolucja rodziny genów była wcześniej badana przy użyciu genomów z odległych spokrewnionych organizmów modelowych1. Ograniczeniem tego podejścia jest to, że nie jest jasne, w jaki sposób te rodziny genów ewoluują u blisko spokrewnionych gatunków i jaka jest rola różnych środowiskowych presji selekcyjnych. W tym protokole uwzględniamy poszukiwanie homologów u blisko spokrewnionych gatunków. Generując filogenezę na poziomie gromady, możemy zauważyć trendy w ewolucji rodziny genów, takie jak konserwatywne geny lub duplikacje specyficzne dla linii. Na tym poziomie możemy również zbadać, czy geny są ortologiami czy paralogami. Chociaż wiele homologów prawdopodobnie działa podobnie do siebie, niekoniecznie tak jest2. Włączenie drzew filogenetycznych do tych badań jest ważne dla ustalenia, czy te homologiczne geny są ortologiami, czy nie. U eukariontów wiele ortologów zachowuje podobne funkcje w komórce, o czym świadczy zdolność białek ssaków do przywracania funkcji ortologów drożdży3. Istnieją jednak przypadki, w których gen nieortologiczny pełni funkcję scharakteryzowaną4.

Drzewa filogenetyczne zaczynają wyznaczać relacje między genami i gatunkami, ale funkcja nie może być przypisana wyłącznie na podstawie powiązań genetycznych. Badania ekspresji genów w połączeniu z adnotacjami funkcjonalnymi i analizą wzbogacenia zapewniają silne wsparcie dla funkcji genów. Przypadki, w których ekspresję genów można określić ilościowo i porównać między osobami lub typami tkanek, mogą bardziej świadczyć o potencjalnej funkcji. Poniższy protokół jest zgodny z metodami stosowanymi w badaniu genów opsyny w Hydra vulgaris7, ale można je zastosować do dowolnego gatunku i dowolnej rodziny genów. Wyniki takich badań stanowią podstawę do dalszych badań nad funkcją genów i sieciami genów w organizmach niemodelowych. Na przykład, badanie filogenezy opsyn, które są białkami inicjującymi kaskadę fototransdukcji, daje kontekst ewolucji oczu i detekcji światła8,9,10,11. W tym przypadku organizmy niemodelowe, zwłaszcza podstawowe gatunki zwierząt, takie jak parzydełka lub ctenofory, mogą wyjaśnić ochronę lub zmiany w kaskadzie fototransdukcji i widzeniu w kladach12,13,14. Podobnie, określenie filogenezy, ekspresji i sieci innych rodzin genów poinformuje nas o mechanizmach molekularnych leżących u podstaw adaptacji.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół jest zgodny z wytycznymi UC Irvine dotyczącymi opieki nad zwierzętami.

1. Przygotowanie biblioteki sekwencyjnej RNA

  1. Wyizoluj RNA przy użyciu następujących metod.
    1. Zbierz próbki. Jeśli RNA ma być ekstrahowane w późniejszym czasie, błyskawicznie zamroź próbkę lub umieść ją w roztworze do przechowywania RNA15 (Tabela materiałów).
    2. Poddaj organizmowi eutanazji i poddaj go sekcji, aby oddzielić interesujące go tkanki.
    3. Ekstrahować całkowity RNA za pomocą zestawu do ekstrakcji i oczyszczać RNA za pomocą zestawu do oczyszczania RNA (tabela materiałów)
      UWAGA: Istnieją protokoły i zestawy, które mogą działać lepiej dla różnych gatunków i typów tkanek16,17. Wyodrębniliśmy RNA z różnych tkanek ciała motyla18 i galaretowatego Hydra19 (zobacz dyskusję).
    4. Zmierzyć stężenie i jakość RNA w każdej próbce (tabela materiałów). Do konstruowania bibliotek cDNA należy używać próbek o liczbie integralności RNA (RIN) wyższej niż 8, najlepiej bliższej 920.
  2. Skonstruuj bibliotekę i sekwencję cDNA w następujący sposób.
    1. Zbuduj biblioteki cDNA zgodnie z instrukcją przygotowania biblioteki (patrz dyskusja).
    2. Określ stężenie i jakość cDNA (tabela materiałów).
    3. Multipleksuj biblioteki i sekwencjonuj je.

2. Dostęp do klastra komputerowego

UWAGA: Analiza sekwencyjna RNA wymaga manipulacji dużymi plikami i najlepiej jest ją przeprowadzić na klastrze komputerowym (Tabela materiałów).

  1. Zaloguj się do konta klastra komputerów za pomocą polecenia ssh username@clusterlocation w oknie terminala (Mac) lub aplikacji PuTTY (Windows).

3. Uzyskiwanie odczytów sekwencyjnych RNA

  1. Uzyskać odczyty sekwencji RNA z urządzenia do sekwencjonowania lub, w przypadku danych wygenerowanych w publikacji, z repozytorium danych, w którym zostały zdeponowane (ppkt 3.2 lub 3.3).
  2. Aby pobrać dane z repozytoriów, takich jak ArrayExpress, wykonaj następujące czynności:
    1. Przeszukaj witrynę, korzystając z numeru dostępu.
    2. Znajdź link, aby pobrać dane, a następnie kliknij lewym przyciskiem myszy i wybierz Kopiuj link.
    3. W oknie terminalu wpisz wget i wybierz opcję Wklej łącze, aby skopiować dane do katalogu w celu analizy.
  3. Aby pobrać dane NCBI Short Read Archive (), wykonaj następujące alternatywne kroki:
    1. Na terminalu pobierz Toolkit v. 2.8.1 za pomocą wget.
      UWAGA: Pobieranie i instalowanie programów w klastrze komputerowym może wymagać dostępu administratora klastra komputerowego, jeśli instalacja nie powiedzie się, skontaktuj się z administratorem klastra komputerowego.
    2. Zakończ instalację programu, wpisując tar -xvf $TARGZFILE.
    3. Wyszukaj w NCBI numer dostępu dla próbek, które chcesz pobrać, powinien on mieć format SRRXXXXXX.
    4. Uzyskaj dane sekwencji RNA, wpisując [lokalizacja sratoolkit]/bin/prefetch SRRXXXXXX w oknie terminala.
    5. W przypadku plików sparowanych końców wpisz [lokalizacja sratoolkit]/bin/fastq-dump --split-files SRRXXXXXX, aby uzyskać dwa pliki fastq (SRRXXXXXX_1.FASTQ i SRRXXXXXX_2.FASTQ).
      UWAGA: Aby wykonać montaż Trinity de novo, użyj polecenia [lokalizacja sratoolkit]/bin/fastq-dump --defline-seq '@$sn[_$rn]/$ri' --split-files SRRXXXXXX

4. Adaptery przycinania i odczyty niskiej jakości (opcjonalnie)

  1. Zainstaluj lub załaduj Trimmomatic21 v. 0.35 do klastra obliczeniowego.
  2. W katalogu, w którym znajdują się pliki danych sekwencyjnych RNA, wpisz polecenie, które zawiera lokalizację pliku jar trimmomatic, wejściowe pliki FASTQ, wyjściowe pliki FASTQ oraz opcjonalne parametry, takie jak długość i jakość odczytu.
    UWAGA: Polecenie będzie się różnić w zależności od surowej i pożądanej jakości oraz długości odczytów. Do odczytów Illumina 43 bp ze starterami Nextera użyliśmy: java -jar /data/apps/trimmomatic/0.35/trimmomatic-0.35.jar PE $READ 1. FASTQ $READ 2. FASTQ paired_READ1. FASTQ unpaired_READ1. FASTQ paired_READ2. FASTQ unpaired_READ2. FASTQ ILLUMINACLIP:adapters.fa:2:30:10 PROWADZENIE:20 TRAILING:20 SLIDINGWINDOW:4:17 MINLEN:30.

5. Pobierz zestaw referencyjny

  1. Wyszukaj w Google, EnsemblGenomes i NCBI Genomes and Nucleotide TSA (Transcriptome Shotgun Assembly) genom referencyjny lub złożony transkryptom dla interesującego gatunku (Rysunek 1).
    UWAGA: Jeśli genom referencyjny lub transkryptom są niedostępne lub są niskiej jakości, przejdź do KROKU 6, aby wygenerować zestaw de novo.
  2. Jeśli istnieje genom referencyjny lub złożony transkryptom, pobierz go jako plik fasta do miejsca, w którym zostanie przeprowadzona analiza, wykonując poniższe czynności.
    1. Znajdź link, aby pobrać genom, kliknij lewym przyciskiem myszy i skopiuj link.
    2. W oknie terminala wpisz wget i wklej adres linku. Jeśli to możliwe, skopiuj również plik GTF i plik FASTA białka dla genomu referencyjnego.

6. Wygeneruj zestaw de novo (Alternatywa dla kroku 5)

  1. Połącz pliki fastq RNA-seq READ1 i READ2 dla wszystkich próbek, wpisując cat *READ1. FASTQ > $all_READ1. FASTQ i kot *READ2. FASTQ > all_READ2. FASTQ w oknie terminala.
  2. Zainstaluj lub załaduj Trinity22 v.2.8.5 do klastra obliczeniowego.
  3. Generuj i składaj, wpisując w terminalu: Trinity --seqType fq --max_memory 20G --left $all_READ1. FASTQ --right $all_READ2. SZYBKIQ.

7. Mapa odczytuje genom (7.1) lub transkryptom de novo (7.2)

  1. Mapa odczytuje genom referencyjny przy użyciu STAR23 v. 2.6.0c i RSEM24 v. 1.3.0.
    1. Zainstaluj lub załaduj programy STAR v. 2.6.0c. i RSEM v. 1.3.0 do klastra obliczeniowego.
    2. Indeksuj genom, wpisując rsem-prepare-reference --gtf $GENOME. GTF --star -p 16 $GENOME. FASTA $OUTPUT.
    3. Mapuj odczyty i obliczaj wyrażenie dla każdej próbki, wpisując rsem-calculate-expression -p 16 --star --paired-end $READ 1. FASTQ $READ 2. FASTQ $INDEX $OUTPUT.
    4. Zmień nazwę pliku wyników na opisową przy użyciu mv RSEM.genes.results $sample.genes.results.
    5. Wygeneruj macierz wszystkich zliczeń, wpisując rsem-generate-data-matrix *[genes/isoforms.results] > $OUTPUT.
  2. Mapuj sekwencję RNA do montażu Trinity de novo za pomocą RSEM i muszki.
    1. Zainstaluj lub załaduj Trinity22 v.2.8.5, Bowtie25 v. 1.0.0 i RSEM v. 1.3.0.
    2. Mapuj odczyty i obliczaj wyrażenie dla każdej próbki, wpisując [trinity_location]/align_and_estimate_abundance.pl --prep-reference --transcripts $TRINITY. FASTA --seqType fq --left $READ 1. FASTQ - prawy $READ 2. FASTQ --est_method RSEM --aln_method muszka --trinity_mode --output_dir $OUTPUT.
    3. Zmień nazwę pliku wyników na opisową przy użyciu mv RSEM.genes.results $sample.genes.results.
    4. Wygeneruj macierz wszystkich zliczeń, wpisując [trinity_location]/abundance_estimates_to_matrix.pl --est_method RSEM *[geny/izoformy].wyniki

8. Zidentyfikuj interesujące geny

UWAGA: Następujące kroki można wykonać za pomocą plików FASTA z nukleotydami lub białkami, ale działają najlepiej i są prostsze w przypadku sekwencji białek. Wyszukiwanie BLAST przy użyciu białka do białka z większym prawdopodobieństwem da wyniki podczas wyszukiwania między różnymi gatunkami.

  1. Aby uzyskać genom referencyjny, użyj pliku FASTA białka z kroku 5.2.2 lub zobacz Materiały uzupełniające, aby wygenerować niestandardową cechę genu GTF.
  2. Aby uzyskać transkryptom de novo, wygeneruj białko FASTA za pomocą TransDecoder.
    1. Zainstaluj lub załaduj TransDecoder v. 5.5.0 na komputerze cluser.
    2. Znajdź najdłuższą otwartą ramkę odczytu i przewidywaną sekwencję peptydów, wpisując [Transdecoder location]/TransDecoder.LongOrfs -t $TRINITY. Fasta.
  3. Przeszukaj NCBI Genbank w poszukiwaniu homologów u blisko spokrewnionych gatunków.
    1. Otwórz okno przeglądarki internetowej i przejdź do https://www.ncbi.nlm.nih.gov/genbank/.
    2. Na pasku wyszukiwania wpisz nazwę interesującego nas genu oraz nazwę blisko spokrewnionych gatunków, które zostały zsekwencjonowane lub rodzaju lub gromady. Po lewej stronie paska wyszukiwania wybierz białko, a następnie kliknij szukaj.
    3. Wyodrębnij sekwencje, klikając przycisk Wyślij do, a następnie wybierz opcję Plik. W obszarze Format wybierz opcję FASTA, a następnie kliknij przycisk Create File (Utwórz plik).
    4. Przenieś plik FASTA z homologami do klastra komputerowego, wpisując scp $FASTA username@clusterlocation:/$DIR w oknie terminala lokalnego lub użyj FileZilla do przesyłania plików do i z komputera i klastra.
  4. Wyszukaj geny kandydujące za pomocą BLAST+26.
    1. Zainstaluj lub załaduj BLAST+ v. 2.8.1 do klastra komputerowego.
    2. W klastrze komputerowym utwórz bazę danych BLAST z białka FASTA poddanego transkryptomowi transkryptomu, wpisując [lokalizacja BLAST+]/makeblastdb -in $PEP. FASTA -dbtype prot -out $OUTPUT
    3. WYSADZAJ homologiczne sekwencje genów z NCBI do bazy danych gatunków będących przedmiotem zainteresowania, wpisując [BLAST+ lokalizacja]/blastp -db $DATABASE -query $FASTA -evalue 1e-10 -outfmt 6 -max_target_seqs 1 -out $OUTPUT.
    4. Wyświetl plik wyjściowy za pomocą polecenia more. Skopiuj unikalne identyfikatory genów z interesujących gatunków do nowego pliku tekstowego.
    5. Wyodrębnij sekwencje genów kandydujących, wpisując perl -ne 'if(/^>(\S+)/){$c=$i{$1}}$c?print:chomp;$i{$_}=1 if @ARGV' $gene_id.txt $PEP. FASTA > $OUTPUT.
  5. Potwierdź adnotację genu za pomocą odwrotnego BLAST.
    1. W przeglądarce internetowej przejdź do https://blast.ncbi.nlm.nih.gov/Blast.cgi.
    2. Wybierz tblastn, a następnie wklej proponowane sekwencje, wybierz bazę danych Nienadmiarowe sekwencje białek i kliknij BLAST.
  6. Zidentyfikuj dodatkowe geny, adnotując wszystkie geny w genomie lub transkryptomie za pomocą terminów ontologii genów (GO) (patrz dyskusja).
    1. Przenieś białko FASTA do komputera lokalnego.
    2. Pobierz i zainstaluj Blast2GO27,28,29 v. 5.2 na komputerze lokalnym.
    3. Otwórz Blast2GO, kliknij Plik, przejdź do Załaduj, przejdź do Ładuj sekwencje, kliknij Załaduj plik Fasta (fasta). Wybierz plik FASTA i kliknij przycisk Załaduj.
    4. Kliknij Blast, wybierz NCBI Blast i kliknij Dalej. Edytuj parametry lub kliknij przycisk Dalej, edytuj parametry i kliknij przycisk Uruchom, aby znaleźć najbardziej podobny opis genu.
    5. Kliknij pozycję Mapowanie, a następnie kliknij pozycję Uruchom, aby wyszukać podobne białka w adnotacjach Gene Ontology.
    6. Następnie kliknij interpro, wybierz EMBL-EBI InterPro i kliknij Dalej. Edytuj parametry lub kliknij przycisk Dalej, a następnie kliknij przycisk Uruchom, aby wyszukać sygnatury znanych rodzin genów i domen.
    7. Wyeksportuj adnotacje, klikając pozycję Plik, wybierz opcję Eksportuj, a następnie kliknij pozycję Eksportuj tabelę. Kliknij przycisk Przeglądaj, nazwij plik, kliknij przycisk Zapisz, kliknij przycisk Eksportuj.
    8. Przeszukaj tabelę adnotacji pod kątem interesujących Cię terminów GO, aby zidentyfikować dodatkowe geny kandydujące. Wyodrębnij sekwencje z pliku FASTA (KROK 8.4.5)

9. Drzewa filogenetyczne

  1. Pobierz i zainstaluj MEGA30 v. 7.0.26 na swoim komputerze lokalnym.
  2. Otwórz MEGA, kliknij Wyrównaj, kliknij Edytuj/Zbuduj wyrównanie, wybierz Utwórz nowe wyrównanie, kliknij OK, wybierz Białko.
  3. Gdy otworzy się okno wyrównania, kliknij Edytuj, kliknij Wstaw sekwencje z pliku i wybierz FASTA z sekwencjami białek genów kandydujących i prawdopodobnymi homologami.
  4. Zaznacz wszystkie sekwencje. Znajdź symbol ramienia i najedź na niego kursorem. Powinno być napisane Align sequences using MUSCLE31 algorithm. Kliknij symbol ramienia, a następnie kliknij przycisk Wyrównaj białko, aby wyrównać sekwencje. Edytuj parametry lub kliknij przycisk OK, aby wyrównać przy użyciu parametrów domyślnych.
  5. Sprawdź wzrokowo i wprowadź wszelkie zmiany ręczne, a następnie Zapisz i zamknij okno wyrównania.
  6. W oknie głównym MEGA kliknij na Modele, kliknij Znajdź najlepsze modele DNA/białka (ML), wybierz plik wyrównania i wybierz odpowiednie parametry, takie jak: Analiza: Wybór modelu (ML), Drzewo do użycia: Automatyczne (drzewo łączące sąsiadów), Metoda statystyczna: Maksymalne prawdopodobieństwo, Typ podstawienia: Aminokwas, Leczenie luk/brakujących danych: Użyj wszystkich lokalizacji, Filtr lokalizacji oddziału: Brak.
  7. Po ustaleniu najlepszego modelu dla danych przejdź do głównego okna MEGA. Kliknij Filogeneza i kliknij Drzewo maksymalnego prawdopodobieństwa konstrukcji/testu, a następnie wybierz wyrównanie, jeśli to konieczne. Wybierz odpowiednie parametry dla drzewa: Metoda statystyczna: Maksymalne prawdopodobieństwo, Test filogenezy: metoda Bootstrap z 100 powtórzeniami, typ podstawienia: aminokwas, model: LG z częstotliwościami. (+F), współczynniki między lokalizacjami: rozkład gamma (G) z 5 dyskretnymi kategoriami gamma, leczenie luk/brakujących danych: użyj wszystkich miejsc, metoda heurystyczna ML: Nearest-Neighbor-Interchange (NNI).

10. Wizualizacja ekspresji genów za pomocą TPM

  1. W przypadku Trinity w klastrze komputerowym przejdź do katalogu, w którym abundance_estimates_to_matrix.pl został uruchomiony, a jednym z danych wyjściowych powinna być matrix. TPM.not_cross_norm. Przenieś ten plik na komputer lokalny.
    UWAGA: Patrz Materiały uzupełniające dotyczące normalizacji próbek krzyżowych.
  2. W przypadku modułów TPM z analizy genomu wykonaj poniższe czynności.
    1. W klastrze komputerów przejdź do lokalizacji instalacji programu RSEM. Skopiuj rsem-generate-data-matrix, wpisując scp rsem-generate-data-matrix rsem-generate-TPM-matrix. Użyj nano, aby edytować nowy plik i zmień "mój $offsite = 4" z 4 na 5 dla TPM, powinno teraz być "mój $offsite = 5".
  3. Przejdź do katalogu, w którym znajdują się pliki wyjściowe programu RSEM .genes.results, a teraz użyj > $OUTPUT rsem-generate-TPM-matrix *[genes/isoforms.results] w celu wygenerowania macierzy modułu TPM. Przenieś wyniki na komputer lokalny.
  4. Wizualizuj wyniki w ggplot2.
    1. Pobierz program R w wersji 4.0.0 i RStudio w wersji 1.2.1335 na komputer lokalny.
    2. Otwórz program RStudio po prawej stronie ekranu, przejdź do karty Pakiety i kliknij przycisk Zainstaluj. Wpisz ggplot2 i kliknij zainstaluj.
    3. W oknie skryptu języka R odczytaj tabelę modułu TPM, wpisując data<-read.table("$tpm.txt",header = T)
    4. W przypadku wykresów słupkowych podobnych do Rysunek 4 wpisz coś podobnego do: p<- ggplot() + geom_bar(aes(y=TPM, x=Symbol, fill=Tkanka), data=data, stat="tożsamość")
      fill<-c("#d7191c","#fdae61", "#ffffbf", "#abd9e9", "#2c7bb6")
      p<-p+scale_fill_manual(wartości=wypełnienie)
      p + motyw(oś.tekst.x = element_text(kąt = 90))

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Powyższe metody są podsumowane w Rysunek 1 i zostały zastosowane do zestawu danych tkanek Hydra vulgaris. H. vulgaris to słodkowodny bezkręgowiec należący do gromady Cnidaria, która obejmuje również koralowce, meduzy i ukwiały. H. vulgaris może rozmnażać się bezpłciowo przez pączkowanie i może regenerować głowę i stopę po przecięciu na pół. W tym badaniu naszym celem było zbadanie ewolucji i ekspresji genów opsyny w Hydra7....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Celem tego protokołu jest przedstawienie zarysu kroków charakteryzowania rodziny genów przy użyciu danych sekwencyjnych RNA. Udowodniono, że metody te działają w przypadku różnych gatunków i zestawów danych 4,34,35. Utworzony tutaj rurociąg został uproszczony i powinien być na tyle łatwy, że może go śledzić nowicjusz w bioinformatyce. Znaczenie protokołu polega na tym, że przedstawia on wszystkie kroki i programy niezbędne do uk...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dziękujemy Adrianie Briscoe, Gilowi Smithowi, Rabiegowi Muradowi i Aline G. Rangel za rady i wskazówki dotyczące włączenia niektórych z tych kroków do naszego przepływu pracy. Jesteśmy również wdzięczni Katherine Williams, Elisabeth Rebboah i Natashy Picciani za komentarze do rękopisu. Praca ta była częściowo wspierana przez stypendium badawcze Fundacji George'a E. Hewitta na rzecz Medycyny dla A.M.M.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Zestaw Bioanalyzer-DNAAgilent5067-4626mokre materiały laboratoryjne
Zestaw bioanalizatora RNAAgilent5067-1513mokre materiały laboratoryjne
BLAST+ v. 2.8.1Na klastrze komputerowym*
https://ftp.ncbi.nlm.nih.gov/blast/executables/blast+/LATEST/
Blast2GO (na Twoim komputerze)Na komputerze lokalnym
https://www.blast2go.com/b2g-register-basic
boost v. 1.57.0On computer cluster
Bowtie v. 1.0.0On computer cluster
https://sourceforge.net/projects/bowtie-bio/files/bowtie/1.3.0/
Computing cluster (wysoce zalecane)UWAGA: Analizy danych genomowych najlepiej wykonywać w klastrze obliczeniowym o wysokiej wydajności, ponieważ pliki są bardzo duże.
Spinki do mankietów v. 2.2.1Na klastrze komputerowym
edgeR v. 3.26.8 (w R)W Rstudio
https://bioconductor.org/packages/release/bioc/html/edgeR.html
gcc v. 6.4.0Na klastrze komputerowym
Java v. 11.0.2Na klastrze komputerowym
MEGA7 (na twoim komputerze)Na komputerze lokalnym
https://www.megasoftware.net
MEGAX v. 0.1Na komputerze lokalnym
https://www.megasoftware.net
Zestaw NucleoSpin RNA IIMacherey-Nagel740955.5Mokre materiały laboratoryjne
Perl 5.30.3Na klastrze komputerowym
pythonNa klastrze komputerowym
Qubit 2.0 FluorometrThermoFisherQ32866mokre materiały laboratoryjne
R v.4.0.0Na klastrze komputerowym
https://cran.r-project.org/src/base/R-4/
RNAlaterThermoFisherAM7021mokre materiały laboratoryjne
RNeasy kitQiagen74104mokre materiały laboratoryjne
RSEM v. 1.3.0Oprogramowanie komputerowe
https://deweylab.github.io/RSEM/
RStudio v. 1.2.1335On local computer
https://rstudio.com/products/rstudio/download/#download
Samtools v. 1.3Computer software
Toolkit v. 2.8.1On computer cluster
https://github.com/ncbi/-tools/wiki/01.-Downloading--Toolkit
STAR v. 2.6.0cOn computer cluster
https://github.com/alexdobin/STAR
StringTie v. 1.3.4dOn computer cluster
https://ccb.jhu.edu/software/stringtie/
Transdecoder v. 5.5.0On computer cluster
https://github.com/TransDecoder/TransDecoder/releases
Trimmomatic v. 0.35On computer cluster
http://www.usadellab.org/cms/?page=trimmomatic
Trinity v.2.8.5Na klastrze komputerowym
https://github.com/trinityrnaseq/trinityrnaseq/releases
TRIzolThermoFisher15596018mokrych materiałach laboratoryjnych
Zestaw do przygotowania biblioteki RNA TruSeq v2IlluminaRS-122-2001mokre materiały laboratoryjne
TURBO bez DNAThermoFisherAM1907mokre materiały laboratoryjne
*Pobieranie i instalacja w klastrze komputerowym może wymagać dostępu do konta root. Skontaktuj się z administratorem sieci.
Zestaw

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Lespinet, O., Wolf, Y. I., Koonin, E. V., Aravind, L. The role of lineage-specific gene family expansion in the evolution of eukaryotes. Genome Research. 12 (7), 1048-1059 (2002).
  2. Gabaldón, T., Koonin, E. V. Functional and evolutionary implications of gene orthology. Nature Reviews Genetics. 14 (5), 360-366 (2013).
  3. Dolinski, K., Botstein, D. Orthology and Functional Conservation in Eukaryotes. Annual Review of Genetics. 41 (1), (2007).
  4. Macias-Muñoz, A., McCulloch, K. J., Briscoe, A. D. Copy number variation and expression analysis reveals a non-orthologous pinta gene family member involved in butterfly vision. Genome Biology and Evolution. 9 (12), 3398-3412 (2017).
  5. Cannon, S. B., Mitra, A., Baumgarten, A., Young, N. D., May, G. The roles of segmental and tandem gene duplication in the evolution of large gene families in Arabidopsis thaliana. BMC plant biology. 4, 10(2004).
  6. Eastman, S. D., Chen, T. H. P., Falk, M. M., Mendelson, T. C., Iovine, M. K. Phylogenetic analysis of three complete gap junction gene families reveals lineage-specific duplications and highly supported gene classes. Genomics. 87 (2), 265-274 (2006).
  7. Macias-Munõz, A., Murad, R., Mortazavi, A. Molecular evolution and expression of opsin genes in Hydra vulgaris. BMC Genomics. 20 (1), 1-19 (2019).
  8. Hisatomi, O., Tokunaga, F. Molecular evolution of proteins involved in vertebrate phototransduction. Comparative Biochemistry and Physiology - B Biochemistry and Molecular Biology. 133 (4), 509-522 (2002).
  9. Arendt, D. Evolution of eyes and photoreceptor cell types. International Journal of Developmental Biology. 47, 563-571 (2003).
  10. Shichida, Y., Matsuyama, T. Evolution of opsins and phototransduction. Philosophical Transactions of the Royal Society B: Biological Sciences. 364 (1531), 2881-2895 (2009).
  11. Porter, M. L., et al. Shedding new light on opsin evolution. Proceedings of the Royal Society B: Biological Sciences. 279 (1726), 3-14 (2012).
  12. Plachetzki, D. C., Degnan, B. M., Oakley, T. H. The origins of novel protein interactions during animal opsin evolution. PLoS ONE. 2 (10), 1054(2007).
  13. Ramirez, M. D., et al. The last common ancestor of most bilaterian animals possessed at least nine opsins. Genome Biology and Evolution. 8 (12), 3640-3652 (2016).
  14. Schnitzler, C. E., et al. Genomic organization, evolution, and expression of photoprotein and opsin genes in Mnemiopsis leidyi: a new view of ctenophore photocytes. BMC Biology. 10, 107(2012).
  15. Pedersen, K. B., Williams, A., Watt, J., Ronis, M. J. Improved method for isolating high-quality RNA from mouse bone with RNAlater at room temperature. Bone Reports. 11, 100211(2019).
  16. Ridgeway, J. A., Timm, A. E., Fallon, A. Comparison of RNA isolation methods from insect larvae. Journal of Insect Science. 14 (1), 4-8 (2014).
  17. Scholes, A. N., Lewis, J. A. Comparison of RNA isolation methods on RNA-Seq: Implications for differential expression and meta-Analyses. BMC Genomics. 21 (1), 1-9 (2020).
  18. Briscoe, A. D., et al. Female behaviour drives expression and evolution of gustatory receptors in butterflies. PLoS genetics. 9 (7), 1003620(2013).
  19. Murad, R., Macias-Muñoz, A., Wong, A., Ma, X., Mortazavi, A. Integrative analysis of Hydra head regeneration reveals activation of distal enhancer-like elements. bioRxiv. , 544049(2019).
  20. Gallego Romero, I., Pai, A. A., Tung, J., Gilad, Y. Impact of RNA degradation on measurements of gene expression. BMC Biology. 12, 42(2014).
  21. Bolger, A. M., Lohse, M., Usadel, B. Trimmomatic: a flexible trimmer for Illumina sequence data. Bioinformatics. 30 (15), 2114-2120 (2014).
  22. Trinity. RNA-Seq De novo Assembly Using Trinity. , 1-7 (2014).
  23. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29, 15-21 (2013).
  24. Li, B., Dewey, C. N. RSEM: accurate transcript quantification from RNA-Seq data with or without a reference genome. BMC bioinformatics. 12, 323(2011).
  25. Langmead, B., Trapnell, C., Pop, M., Salzberg, S. L. Ultrafast and memory-efficient alignment of short DNA sequences to the human genome. Genome biology. 10, 25(2009).
  26. Camacho, C., et al. BLAST+: architecture and applications. BMC Bioinformatics. 10, 421(2009).
  27. Conesa, A., Götz, S. Blast2GO: A comprehensive suite for functional analysis in plant genomics. International Journal of Plant Genomics. 619832, (2008).
  28. Conesa, A., et al. Blast2GO: A universal tool for annotation, visualization and analysis in functional genomics research. Bioinformatics. 21 (18), 3674-3676 (2005).
  29. Götz, S., et al. High-throughput functional annotation and data mining with the Blast2GO suite. Nucleic Acids Research. 36 (10), 3420-3435 (2008).
  30. Kumar, S., Stecher, G., Tamura, K. MEGA7: Molecular Evolutionary Genetics Analysis version 7.0 for bigger datasets. Molecular biology and evolution. 33 (7), 1870-1874 (2016).
  31. Edgar, R. C. MUSCLE: Multiple sequence alignment with high accuracy and high throughput. Nucleic Acids Research. 32 (5), 1792-1797 (2004).
  32. Taddei-Ferretti, C., Musio, C., Santillo, S., Cotugno, A. The photobiology of Hydra's periodic activity. Hydrobiologia. 530, 129-134 (2004).
  33. Chapman, J. A., et al. The dynamic genome of Hydra. Nature. 464 (7288), 592-596 (2010).
  34. Macias-Muñoz, A., Rangel Olguin, A. G., Briscoe, A. D. Evolution of phototransduction genes in Lepidoptera. Genome Biology and Evolution. 11 (8), 2107-2124 (2019).
  35. Macias-Munõz, A., Murad, R., Mortazavi, A. Molecular evolution and expression of opsin genes in Hydra vulgaris. BMC Genomics. 20 (1), (2019).
  36. Picelli, S., et al. Full-length RNA-seq from single cells using Smart-seq2. Nature Protocols. 9 (1), 171-181 (2014).
  37. Tavares, L., Alves, P. M., Ferreira, R. B., Santos, C. N. Comparison of different methods for DNA-free RNA isolation from SK-N-MC neuroblastoma. BMC research notes. 4, 3(2011).
  38. Johnson, M. T. J., et al. Evaluating Methods for Isolating Total RNA and Predicting the Success of Sequencing Phylogenetically Diverse Plant Transcriptomes. PLoS ONE. 7 (11), (2012).
  39. Zhao, S., Zhang, Y., Gamini, R., Zhang, B., Von Schack, D. Evaluation of two main RNA-seq approaches for gene quantification in clinical RNA sequencing: PolyA+ selection versus rRNA depletion. Scientific Reports. 8 (1), 1-12 (2018).
  40. Zhao, S., et al. Comparison of stranded and non-stranded RNA-seq transcriptome profiling and investigation of gene overlap. BMC Genomics. 16 (1), 1-14 (2015).
  41. Corley, S. M., MacKenzie, K. L., Beverdam, A., Roddam, L. F., Wilkins, M. R. Differentially expressed genes from RNA-Seq and functional enrichment results are affected by the choice of single-end versus paired-end reads and stranded versus non-stranded protocols. BMC Genomics. 18 (1), 1-13 (2017).
  42. Haas, B. J., et al. De novo transcript sequence reconstruction from RNA-seq using the Trinity platform for reference generation and analysis. Nature Protocols. 8 (8), 1494-1512 (2013).
  43. Pertea, M., et al. StringTie enables improved reconstruction of a transcriptome from RNA-seq reads. Nature biotechnology. 33 (3), 290-295 (2015).
  44. Bray, N. L., Pimentel, H., Melsted, P., Pachter, L. Near-optimal probabilistic RNA-seq quantification. Nature Biotechnology. 34 (5), 525-527 (2016).
  45. Patro, R., Duggal, G., Love, M. I., Irizarry, R. A., Kingsford, C. Salmon provides fast and bias-aware quantification of transcript expression. Nature Methods. 14 (4), 417-419 (2017).
  46. Araujo, F. A., Barh, D., Silva, A., Guimarães, L., Thiago, R. OPEN GO FEAT a rapid web-based functional annotation tool for genomic and transcriptomic data. , 8-11 (2018).
  47. Huerta-Cepas, J., et al. Fast genome-wide functional annotation through orthology assignment by eggNOG-mapper. Molecular Biology and Evolution. 34 (8), 2115-2122 (2017).
  48. Huerta-Cepas, J., et al. EggNOG 5.0: A hierarchical, functionally and phylogenetically annotated orthology resource based on 5090 organisms and 2502 viruses. Nucleic Acids Research. 47, 309-314 (2019).
  49. Törönen, P., Medlar, A., Holm, L. PANNZER2: A rapid functional annotation web server. Nucleic Acids Research. 46, 84-88 (2018).
  50. Robinson, M., Mccarthy, D., Chen, Y., Smyth, G. K. edgeR differential expression analysis of digital gene expression data User's Guide. , (2013).
  51. Huang, D. W., Sherman, B. T., Lempicki, R. A. Systematic and integrative analysis of large gene lists using DAVID bioinformatics resources. Nature Protocols. 4 (1), 44-57 (2009).
  52. Huang, D. W., Sherman, B. T., Lempicki, R. A. Bioinformatics enrichment tools: Paths toward the comprehensive functional analysis of large gene lists. Nucleic Acids Research. 37 (1), 1-13 (2009).
  53. Letunic, I., Bork, P. Interactive tree of life (iTOL) v3: an online tool for the display and annotation of phylogenetic and other trees. Nucleic acids research. 44, 242-245 (2016).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Analiza RNA seqdrzewo filogenetycznegeny opsynekspresja r nicowawyszukiwanie BLASTdopasowanie w programie MEGAanaliza edgeR

Powiązane artykuły