Celem tego protokołu jest zbadanie ewolucji i ekspresji genów kandydujących przy użyciu danych sekwencjonowania RNA.
Artykuł metodologiczny
Celem tego protokołu jest zbadanie ewolucji i ekspresji genów kandydujących przy użyciu danych sekwencjonowania RNA.
Destylacja i raportowanie dużych zbiorów danych, takich jak dane dotyczące całego genomu lub transkryptomu, jest często trudnym zadaniem. Jednym ze sposobów na rozbicie wyników jest skupienie się na jednej lub więcej rodzinach genów, które są istotne dla organizmu i badania. W tym protokole przedstawiamy bioinformatyczne kroki w celu wygenerowania filogenezy i ilościowego określenia ekspresji genów będących przedmiotem zainteresowania. Drzewa filogenetyczne mogą dać wgląd w to, jak geny ewoluują w obrębie gatunków i między gatunkami, a także ujawnić ortologię. Wyniki te można poprawić, wykorzystując dane sekwencyjne RNA w celu porównania ekspresji tych genów u różnych osób lub tkanek. Badania nad ewolucją i ekspresją molekularną mogą ujawnić tryby ewolucji i zachowania funkcji genów między gatunkami. Charakterystyka rodziny genów może służyć jako punkt wyjścia do przyszłych badań i może podkreślić ważną rodzinę genów w nowym genomie lub artykule transkryptomowym.
Postępy w technologiach sekwencjonowania ułatwiły sekwencjonowanie genomów i transkryptomów organizmów niemodelowych. Oprócz zwiększonej wykonalności sekwencjonowania DNA i RNA z wielu organizmów, publicznie dostępnych jest wiele danych do badania interesujących genów. Celem tego protokołu jest zapewnienie bioinformatycznych kroków w celu zbadania ewolucji molekularnej i ekspresji genów, które mogą odgrywać ważną rolę w organizmie będącym przedmiotem zainteresowania.
Badanie ewolucji genu lub rodziny genów może dostarczyć wglądu w ewolucję systemów biologicznych. Członkowie rodziny genów są zazwyczaj określani poprzez identyfikację konserwatywnych motywów lub homologicznych sekwencji genów. Ewolucja rodziny genów była wcześniej badana przy użyciu genomów z odległych spokrewnionych organizmów modelowych1. Ograniczeniem tego podejścia jest to, że nie jest jasne, w jaki sposób te rodziny genów ewoluują u blisko spokrewnionych gatunków i jaka jest rola różnych środowiskowych presji selekcyjnych. W tym protokole uwzględniamy poszukiwanie homologów u blisko spokrewnionych gatunków. Generując filogenezę na poziomie gromady, możemy zauważyć trendy w ewolucji rodziny genów, takie jak konserwatywne geny lub duplikacje specyficzne dla linii. Na tym poziomie możemy również zbadać, czy geny są ortologiami czy paralogami. Chociaż wiele homologów prawdopodobnie działa podobnie do siebie, niekoniecznie tak jest2. Włączenie drzew filogenetycznych do tych badań jest ważne dla ustalenia, czy te homologiczne geny są ortologiami, czy nie. U eukariontów wiele ortologów zachowuje podobne funkcje w komórce, o czym świadczy zdolność białek ssaków do przywracania funkcji ortologów drożdży3. Istnieją jednak przypadki, w których gen nieortologiczny pełni funkcję scharakteryzowaną4.
Drzewa filogenetyczne zaczynają wyznaczać relacje między genami i gatunkami, ale funkcja nie może być przypisana wyłącznie na podstawie powiązań genetycznych. Badania ekspresji genów w połączeniu z adnotacjami funkcjonalnymi i analizą wzbogacenia zapewniają silne wsparcie dla funkcji genów. Przypadki, w których ekspresję genów można określić ilościowo i porównać między osobami lub typami tkanek, mogą bardziej świadczyć o potencjalnej funkcji. Poniższy protokół jest zgodny z metodami stosowanymi w badaniu genów opsyny w Hydra vulgaris7, ale można je zastosować do dowolnego gatunku i dowolnej rodziny genów. Wyniki takich badań stanowią podstawę do dalszych badań nad funkcją genów i sieciami genów w organizmach niemodelowych. Na przykład, badanie filogenezy opsyn, które są białkami inicjującymi kaskadę fototransdukcji, daje kontekst ewolucji oczu i detekcji światła8,9,10,11. W tym przypadku organizmy niemodelowe, zwłaszcza podstawowe gatunki zwierząt, takie jak parzydełka lub ctenofory, mogą wyjaśnić ochronę lub zmiany w kaskadzie fototransdukcji i widzeniu w kladach12,13,14. Podobnie, określenie filogenezy, ekspresji i sieci innych rodzin genów poinformuje nas o mechanizmach molekularnych leżących u podstaw adaptacji.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Ten protokół jest zgodny z wytycznymi UC Irvine dotyczącymi opieki nad zwierzętami.
1. Przygotowanie biblioteki sekwencyjnej RNA
2. Dostęp do klastra komputerowego
UWAGA: Analiza sekwencyjna RNA wymaga manipulacji dużymi plikami i najlepiej jest ją przeprowadzić na klastrze komputerowym (Tabela materiałów).
3. Uzyskiwanie odczytów sekwencyjnych RNA
4. Adaptery przycinania i odczyty niskiej jakości (opcjonalnie)
5. Pobierz zestaw referencyjny
6. Wygeneruj zestaw de novo (Alternatywa dla kroku 5)
7. Mapa odczytuje genom (7.1) lub transkryptom de novo (7.2)
8. Zidentyfikuj interesujące geny
UWAGA: Następujące kroki można wykonać za pomocą plików FASTA z nukleotydami lub białkami, ale działają najlepiej i są prostsze w przypadku sekwencji białek. Wyszukiwanie BLAST przy użyciu białka do białka z większym prawdopodobieństwem da wyniki podczas wyszukiwania między różnymi gatunkami.
9. Drzewa filogenetyczne
10. Wizualizacja ekspresji genów za pomocą TPM
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Powyższe metody są podsumowane w Rysunek 1 i zostały zastosowane do zestawu danych tkanek Hydra vulgaris. H. vulgaris to słodkowodny bezkręgowiec należący do gromady Cnidaria, która obejmuje również koralowce, meduzy i ukwiały. H. vulgaris może rozmnażać się bezpłciowo przez pączkowanie i może regenerować głowę i stopę po przecięciu na pół. W tym badaniu naszym celem było zbadanie ewolucji i ekspresji genów opsyny w Hydra7....
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Celem tego protokołu jest przedstawienie zarysu kroków charakteryzowania rodziny genów przy użyciu danych sekwencyjnych RNA. Udowodniono, że metody te działają w przypadku różnych gatunków i zestawów danych 4,34,35. Utworzony tutaj rurociąg został uproszczony i powinien być na tyle łatwy, że może go śledzić nowicjusz w bioinformatyce. Znaczenie protokołu polega na tym, że przedstawia on wszystkie kroki i programy niezbędne do uk...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Autorzy nie mają nic do ujawnienia.
Dziękujemy Adrianie Briscoe, Gilowi Smithowi, Rabiegowi Muradowi i Aline G. Rangel za rady i wskazówki dotyczące włączenia niektórych z tych kroków do naszego przepływu pracy. Jesteśmy również wdzięczni Katherine Williams, Elisabeth Rebboah i Natashy Picciani za komentarze do rękopisu. Praca ta była częściowo wspierana przez stypendium badawcze Fundacji George'a E. Hewitta na rzecz Medycyny dla A.M.M.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Zestaw Bioanalyzer-DNA | Agilent | 5067-4626 | mokre materiały laboratoryjne |
| Zestaw bioanalizatora RNA | Agilent | 5067-1513 | mokre materiały laboratoryjne |
| BLAST+ v. 2.8.1 | Na klastrze komputerowym* https://ftp.ncbi.nlm.nih.gov/blast/executables/blast+/LATEST/ | ||
| Blast2GO (na Twoim komputerze) | Na komputerze lokalnym https://www.blast2go.com/b2g-register-basic | ||
| boost v. 1.57.0 | On computer cluster | ||
| Bowtie v. 1.0.0 | On computer cluster https://sourceforge.net/projects/bowtie-bio/files/bowtie/1.3.0/ | ||
| Computing cluster (wysoce zalecane) | UWAGA: Analizy danych genomowych najlepiej wykonywać w klastrze obliczeniowym o wysokiej wydajności, ponieważ pliki są bardzo duże. | ||
| Spinki do mankietów v. 2.2.1 | Na klastrze komputerowym | ||
| edgeR v. 3.26.8 (w R) | W Rstudio https://bioconductor.org/packages/release/bioc/html/edgeR.html | ||
| gcc v. 6.4.0 | Na klastrze komputerowym | ||
| Java v. 11.0.2 | Na klastrze komputerowym | ||
| MEGA7 (na twoim komputerze) | Na komputerze lokalnym https://www.megasoftware.net | ||
| MEGAX v. 0.1 | Na komputerze lokalnym https://www.megasoftware.net | ||
| Zestaw NucleoSpin RNA II | Macherey-Nagel | 740955.5 | Mokre materiały laboratoryjne |
| Perl 5.30.3 | Na klastrze komputerowym | ||
| python | Na klastrze komputerowym | ||
| Qubit 2.0 Fluorometr | ThermoFisher | Q32866 | mokre materiały laboratoryjne |
| R v.4.0.0 | Na klastrze komputerowym https://cran.r-project.org/src/base/R-4/ | ||
| RNAlater | ThermoFisher | AM7021 | mokre materiały laboratoryjne |
| RNeasy kit | Qiagen | 74104 | mokre materiały laboratoryjne |
| RSEM v. 1.3.0 | Oprogramowanie komputerowe https://deweylab.github.io/RSEM/ | ||
| RStudio v. 1.2.1335 | On local computer https://rstudio.com/products/rstudio/download/#download | ||
| Samtools v. 1.3 | Computer software | ||
| Toolkit v. 2.8.1 | On computer cluster https://github.com/ncbi/-tools/wiki/01.-Downloading--Toolkit | ||
| STAR v. 2.6.0c | On computer cluster https://github.com/alexdobin/STAR | ||
| StringTie v. 1.3.4d | On computer cluster https://ccb.jhu.edu/software/stringtie/ | ||
| Transdecoder v. 5.5.0 | On computer cluster https://github.com/TransDecoder/TransDecoder/releases | ||
| Trimmomatic v. 0.35 | On computer cluster http://www.usadellab.org/cms/?page=trimmomatic | ||
| Trinity v.2.8.5 | Na klastrze komputerowym https://github.com/trinityrnaseq/trinityrnaseq/releases | ||
| TRIzol | ThermoFisher | 15596018 | mokrych materiałach laboratoryjnych |
| Zestaw do przygotowania biblioteki RNA TruSeq v2 | Illumina | RS-122-2001 | mokre materiały laboratoryjne |
| TURBO bez DNA | ThermoFisher | AM1907 | mokre materiały laboratoryjne |
| *Pobieranie i instalacja w klastrze komputerowym może wymagać dostępu do konta root. Skontaktuj się z administratorem sieci. |
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE
Poproś o pozwolenie