Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

mirMachine: punkt kompleksowej obsługi adnotacji miRNA roślin

2.4K wyświetleń

DOI:

10.3791/62430

1 maja 2021

W tym artykule

Podsumowanie

Prezentujemy nowy i w pełni zautomatyzowany potok miRNA, mirMachine, który 1) może dokładniej identyfikować znane i nowe miRNA oraz 2) jest w pełni zautomatyzowany i swobodnie dostępny. Użytkownicy mogą teraz wykonać krótki skrypt przesyłania, aby uruchomić w pełni zautomatyzowany potok mirMachine.

Streszczenie

Spośród różnych typów niekodujących RNA, mikroRNA (miRNA) były prawdopodobnie w centrum uwagi w ciągu ostatniej dekady. Jako potranskrypcyjne regulatory ekspresji genów, miRNA odgrywają kluczową rolę w różnych szlakach komórkowych, w tym zarówno w rozwoju, jak i odpowiedzi na stres a/biotyczny, taki jak susza i choroby. Posiadanie wysokiej jakości referencyjnych sekwencji genomu umożliwiło identyfikację i adnotację miRNA u kilku gatunków roślin, w przypadku których sekwencje miRNA są wysoce konserwatywne. Ponieważ obliczeniowe procesy identyfikacji i adnotacji miRNA są w większości procesami podatnymi na błędy, przewidywania oparte na homologii zwiększają dokładność przewidywania. W ciągu ostatniej dekady opracowaliśmy i udoskonaliliśmy potok adnotacji miRNA, SUmir, który od tego czasu jest używany w kilku genomach roślinnych.

To badanie przedstawia w pełni zautomatyzowany, nowy potok miRNA, mirMachine (miRNA Machine), poprzez (i) dodanie dodatkowego kroku filtrowania do przewidywań struktury drugorzędowej, (ii) uczynienie go w pełni zautomatyzowanym, oraz (iii) wprowadzenie nowych opcji do przewidywania znanych miRNA na podstawie homologii lub nowych miRNA opartych na odczytach sekwencjonowania małych RNA przy użyciu poprzedniego potoku. Nowy rurociąg miRNA, mirMachine, został przetestowany przy użyciu The Arabidopsis Information Resource, TAIR10, wydania genomu Arabidopsis i genomu referencyjnego pszenicy v2 Międzynarodowego Koncjum Sekwencjonowania Genomu Pszenicy (IWGSC).

Wprowadzenie

Postępy w technologiach sekwencjonowania nowej generacji poszerzyły zrozumienie struktur RNA i elementów regulatorowych, ujawniając funkcjonalnie ważne niekodujące RNA (ncRNA). Wśród różnych typów ncRNA, mikroRNA (miRNA) stanowią podstawową klasę regulatorową małych RNA o długości od 19 do 24 nukleotydów w roślinach1,2. Od czasu odkrycia pierwszego miRNA u nicienia Caenorhabditis elegans3, obecność i funkcje miRNA były szeroko badane również w genomach zwierzęcych i roślinnych4,5,6. miRNA działają poprzez celowanie w mRNA w celu rozszczepienia lub represji translacyjnej7. Zgromadzone dowody wykazały również, że miRNA są zaangażowane w szeroki zakres procesów biologicznych w roślinach, w tym we wzroście i rozwoju8, autobiogenezie9 oraz kilku biotycznych i abiotycznych reakcjach na stres10.

U roślin miRNA są początkowo przetwarzane z długich pierwotnych transkryptów zwanych pri-miRNAs11. Te pri-miRNA generowane przez polimerazę RNA II wewnątrz jądra są długimi transkryptami tworzącymi niedoskonałą strukturę składania12. Pri-miRNA przechodzą później proces rozszczepienia w celu wytworzenia endogennych jednoniciowych (ss) prekursorów spinki do włosów miRNA, zwanych pre-miRNAs11. Pre-miRNA tworzy strukturę podobną do spinki do włosów, w której pojedyncza nić składa się w strukturę dwuniciową, aby wyciąć dupleks miRNA (miRNA/miRNA*)13. Białko podobne do dicera przecina obie nici dupleksu miRNA/miRNA*, pozostawiając 2-nukleotydowe 3'-zwisające14,15. Duplex miRNA jest metylowany wewnątrz jądra, co chroni koniec 3' miRNA przed degradacją i aktywnością urydylacyjną16,17. Helikaza rozwija metylowany dupleks miRNA po eksporcie i wystawia dojrzałe miRNA na działanie indukowanego RNA kompleksu wyciszającego (RISC) w klasie cytozolu18. Jedna nić dupleksu to dojrzałe miRNA włączone do RISC , podczas gdy druga nić, miRNA *, jest zdegradowana. Kompleks miRNA-RISC wiąże się z sekwencją docelową, prowadząc do degradacji mRNA w przypadku pełnej komplementarności lub represji translacyjnej w przypadku częściowej komplementarności13.

Na podstawie cech ekspresji i biogenezy, opisano wytyczne dotyczące adnotacji miRNA15,19. Mając zdefiniowane wytyczne, Lucas i Budak opracowali potok SUmir w celu przeprowadzenia opartej na homologii identyfikacji miRNA in silico w roślinach9. Pipeline SUmir składał się z dwóch skryptów: SUmirFind i SUmirFold. SUmirFind przeprowadza wyszukiwanie podobieństw w znanych zestawach danych miRNA za pomocą narzędzia National Center for Biotechnology Information (NCBI) Basic Local Alignment Search (BLAST) ze zmodyfikowanymi parametrami, aby uwzględnić trafienia z tylko 2 lub mniej niezgodnościami i uniknąć stronniczości w kierunku krótszych trafień (blastn-short-ungapped -kara -1 -nagroda 1). SUmirFold ocenia drugorzędową strukturę przypuszczalnych sekwencji miRNA z wyników BLAST20 przy użyciu UNAfold21. SUmirFold odróżnia miRNA od małych interferujących RNA poprzez identyfikację cech charakterystycznych struktury spinki do włosów. Ponadto odróżnia miRNA od innych ssRNA, takich jak tRNA i rRNA, parametrami, minimalnym wskaźnikiem energii krotności > 0,67 i zawartością GC 24-71%. Ten potok został niedawno zaktualizowany poprzez dodanie dwóch dodatkowych kroków w celu (i) zwiększenia czułości, (ii) zwiększenia dokładności adnotacji oraz (iii) zapewnienia genomowej dystrybucji przewidywanych genów miRNA22. Biorąc pod uwagę wysoką konserwację sekwencji miRNA roślin23, ten potok został pierwotnie zaprojektowany do przewidywania miRNA opartego na homologii. Nowe miRNA nie mogły być jednak dokładnie zidentyfikowane za pomocą tej analizy bioinformatycznej, ponieważ w dużej mierze opierała się ona na zachowaniu sekwencji miRNA między blisko spokrewnionymi gatunkami.

Ten artykuł przedstawia nowy i w pełni zautomatyzowany potok miRNA, mirMachine, który 1) może dokładniej identyfikować znane i nowe miRNA (na przykład, teraz wykorzystuje nowe prognozy miRNA oparte na sRNA-seq, jak również identyfikację miRNA opartą na homologii) i 2) jest w pełni zautomatyzowany i swobodnie dostępny. Wyniki obejmowały również rozkłady genomowe przewidywanych miRNA. mirMachine został przetestowany zarówno pod kątem przewidywań opartych na homologii, jak i sekwencjonowaniu sRNA w genomach pszenicy i rzodkiewnika. Chociaż początkowo wydany jako wolne oprogramowanie, UNAfold stał się oprogramowaniem komercyjnym w ostatniej dekadzie. Dzięki tej aktualizacji narzędzie do przewidywania struktury wtórnej zostało zmienione z UNAfold na RNAfold, dzięki czemu mirMachine może być swobodnie dostępny. Użytkownicy mogą teraz wykonać krótki skrypt przesyłania, aby uruchomić w pełni zautomatyzowany potok mirMachine (przykłady znajdują się na stronie https://github.com/hbusra/mirMachine.git).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

1. Zależności oprogramowania i instalacja

  1. Zainstaluj zależności oprogramowania z witryny głównej lub przy użyciu narzędzia conda.
    1. Pobierz i zainstaluj Perla, jeśli nie jest jeszcze zainstalowany, z jego strony głównej (https://www.perl.org/get.html).
      UWAGA: Reprezentowane wyniki zostały przewidziane przy użyciu Perla v5.32.0.
    2. Pobierz Blast+, program wyrównujący, ze swojej strony domowej (https://www.ncbi.nlm.nih.gov/books/NBK279671/) jako plik wykonywalny i jako kod źródłowy.
      UWAGA: Reprezentowane wyniki zostały przewidziane przy użyciu BLAST 2.6.0+.
    3. Zainstaluj prekompilowany pakiet RNAfold z https://www.tbi.univie.ac.at/RNA/.
    4. Alternatywnie zainstaluj te oprogramowanie za pomocą następującej konfiguracji: i) conda install -c bioconda blast; ii) conda install -c bioconda viennarna.

2. Konfiguracja i testowanie mirMachine

  1. Pobierz najnowszą wersję skryptów mirMachine i skryptu przesyłania mirMachine z usługi GitHub https://github.com/hbusra/mirMachine.git, a następnie ustaw ścieżkę skryptów w PATH.
  2. Skorzystaj z danych testowych udostępnionych na GitHubie, aby upewnić się, że mirMachine wraz ze wszystkimi jego zależnościami został poprawnie pobrany.
  3. Uruchom mirMachine na danych testowych pokazanych poniżej.
    bash mirMachine_submit.sh -f iwgsc_v2_chr5A.fasta -i mature_high_conf_v22_1.fa.filtered.fasta -n 10
    UWAGA: Ustaw opcję -n na 10, ponieważ dane testowe zawierają tylko jeden chromosom genomu pszenicy. Domyślnie opcja -n jest ustawiona na 20.
  4. Kontroluj pliki wyjściowe hairpins.tbl.out.tbl dla przewidywanych dojrzałych miRNA, ich przewidywanych prekursorów i ich lokalizacji na chromosomach.
  5. Sprawdź pliki dziennika pod kątem danych wyjściowych i ostrzeżeń programu.

3. Identyfikacja miRNA na podstawie homologii

  1. Uruchom mirMachine za pomocą skryptu bash pokazanego poniżej:
    bash mirMachine_submit.sh -f plik_$genome -i plik_$input -m $mismatches -n $number_trafień
  2. Sprawdź przewidywane miRNA. Znajdź plik wyjściowy o nazwie $input_file.results.tbl.hairpins.tbl.out.tbl dla przewidywanych miRNA. Znajdź plik wyjściowy o nazwie $input_file.results.tbl.hairpins.fsa dla sekwencji pre-miRNA FASTA. Znajdź plik wyjściowy o nazwie $input_file.results.tbl.hairpins.log dla pliku dziennika spinki do włosów.

4. Identyfikacja nowego miRNA

  1. Wstępnie przetwórz pliki sRNA-seq FASTQ do odpowiedniego formatu FASTA. W razie potrzeby przytnij adaptery. Nie przycinaj odczytów o niskiej jakości; zamiast tego usuń je. Usuń odczyty zawierające N. Przekonwertuj plik FASTQ na plik FASTA ($input_plik).
  2. Uruchom mirMachine za pomocą skryptu bash pokazanego poniżej.
    bash mirMachine_submit.sh -f plik_$genome -i plik_$input -n $number_z_trafień -sRNAseq -lmax $lmax -lmin $lmin -rpm $rpm
    UWAGA: $mismatches została ustawiona na 0 dla prognoz opartych na sekwencji sRNA.
  3. Sprawdź przewidywane miRNA. Znajdź plik wyjściowy o nazwie $input_file.results.tbl.hairpins.tbl.out.tbl dla przewidywanych miRNA. Znajdź plik wyjściowy o nazwie $input_file.results.tbl.hairpins.fsa dla sekwencji pre-miRNA FASTA. Znajdź plik wyjściowy o nazwie $input_file.results.tbl.hairpins.log dla pliku dziennika spinki do włosów.

5. Zaawansowane parametry

UWAGA: Wartości domyślne są zdefiniowane dla wszystkich parametrów z wyjątkiem pliku genomu i pliku wejściowego miRNA.

  1. Ustaw opcję -db na bazę danych blast, aby pominąć bazę danych odwołania do budynku w potoku.
  2. Ustaw opcję -m na dozwoloną liczbę niezgodności.
    UWAGA: Domyślnie opcja -m była ustawiona na 1 dla przewidywań opartych na homologii i 0 dla przewidywań opartych na sekwencjach sRNA.
  3. Ustawia -n na liczbę trafień do wyeliminowania po wyrównaniu (domyślnie 20). Zmień to w zależności od gatunku.
  4. Użyj -long , aby ocenić struktury drugorzędne dla listy podejrzanych.
  5. Użyj -s, aby aktywować nowe przewidywanie miRNA na podstawie danych sekwencyjnych sRNA.
  6. Ustaw opcję -lmax na maksymalną długość odczytów sekwencyjnych sRNA, które mają być uwzględnione w badaniu przesiewowym.
  7. Ustaw opcję -lmax na minimalną długość odczytów sekwencji sRNA, które mają być uwzględnione w badaniu przesiewowym.
  8. Użyj opcji -rpm, aby ustawić próg odczytów na milion (RPM).
    UWAGA: W przypadku zaawansowanych parametrów, takich jak długość pri-miRNA/pre-miRNA, doświadczeni użytkownicy są zachęcani do modyfikowania skryptów dla swoich interesujących ich badań. Dodatkowo, jeśli użytkownicy zamierzają pominąć niektóre kroki lub wolą używać zmodyfikowanych danych wyjściowych, skrypt przesyłania można zmodyfikować, po prostu dodając # na początku wierszy, aby pominąć te wiersze.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Opisany powyżej rurociąg analityczny miRNA, mirMachine, został zastosowany do danych testowych w celu szybkiej oceny wydajności tego narzędzia. Przesiewowo analizowano wyłącznie roślinne miRNA o wysokim stopniu wiarygodności, zdeponowane w bazie miRBase v22.1, w odniesieniu do chromosomu 5A genomu referencyjnego pszenicy IWGSC RefSeq v224. Narzędzie mirMachine_find zwróciło 312 trafień dla nieredundantnej listy 189 miRNA o wysokim stopniu wiarygodności, przy dopuszczalnym maksymalnie 1 niedopasowa...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Nasz rurociąg miRNA, SUmir, był używany do identyfikacji wielu roślinnych miRNA w ciągu ostatniej dekady. W tym miejscu opracowaliśmy nowy, w pełni zautomatyzowany i ogólnodostępny potok identyfikacji i adnotacji miRNA, mirMachine. Co więcej, wiele rurociągów identyfikacji miRNA, w tym między innymi poprzedni rurociąg, było zależnych od oprogramowania UNAfold21, które z czasem stało się oprogramowaniem komercyjnym, chociaż kiedyś było swobodnie dostępne. Ta nowa i w pełni zautomatyzowana maszyna m...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
https://www.ncbi.nlm.nih.gov/books/NBK279671/Blast+
https://github.com/hbusra/mirMachine.gitmirSkryptzgłoszeniowy maszyny
https://www.perl.org/get.htmlPerl
https://www.tbi.univie.ac.at/RNA/RNAfold
Arabidopsis TAIR10
Triticum aestivum (pszenica, IWGSC RefSeq v2)

Bibliografia

  1. Voinnet, O. Origin, biogenesis, and activity of plant microRNAs. Cell. 136 (4), 669-687 (2009).
  2. Budak, H., Akpinar, B. A. Plant miRNAs: biogenesis, organization and origins. Functional & Integrative Genomics. 15 (5), 523-531 (2015).
  3. Lee, R. C., Feinbaum, R. L., Ambros, V. The C. elegans heterochronic gene lin-4 encodes small RNAs with antisense complementarity to lin-14. Cell. 75 (5), 843-854 (1993).
  4. Zhang, L., et al. Exogenous plant MIR168a specifically targets mammalian LDLRAP1: evidence of cross-kingdom regulation by microRNA. Cell Research. 22 (1), 107-126 (2012).
  5. Pang, K. C., Frith, M. C., Mattick, J. S. Rapid evolution of noncoding RNAs: Lack of conservation does not mean lack of function. Trends in Genetics. 22 (1), 1-5 (2006).
  6. Guleria, P., Mahajan, M., Bhardwaj, J., Yadav, S. K. Plant small RNAs: biogenesis, mode of action and their roles in abiotic stresses. Genomics, Proteomics and Bioinformatics. 9 (6), 183-199 (2011).
  7. Jones-Rhoades, M. W., Bartel, D. P., Bartel, B. MicroRNAs and their regulatory roles in plants. Annual Review of Plant Biology. 57, 19-53 (2006).
  8. Singh, A., et al. Plant small RNAs: advancement in the understanding of biogenesis and role in plant development. Planta. 248 (3), 545-558 (2018).
  9. Lucas, S. J., Budak, H. Sorting the wheat from the chaff: identifying miRNAs in genomic survey sequences of Triticum aestivum chromosome 1AL. PloS One. 7 (7), 40859(2012).
  10. Li, S., Castillo-González, C., Yu, B., Zhang, X. The functions of plant small RNAs in development and in stress responses. Plant Journal. 90 (4), 654-670 (2017).
  11. Lee, Y., Jeon, K., Lee, J. T., Kim, S., Kim, V. N. MicroRNA maturation: Stepwise processing and subcellular localization. EMBO Journal. 21 (17), 4663-4670 (2002).
  12. Lee, Y., et al. MicroRNA genes are transcribed by RNA polymerase II. EMBO Journal. 23 (2), 4051-4060 (2004).
  13. Bartel, D. P. MicroRNAs: Genomics, biogenesis, mechanism, and function. Cell. 116 (2), 281-297 (2004).
  14. Lee, Y., et al. The nuclear RNase III Drosha initiates microRNA processing. Nature. 425 (6956), 415-419 (2003).
  15. Meyers, B. C., et al. Criteria for annotation of plant microRNAs. Plant Cell. 20 (12), 3186-3190 (2008).
  16. Sanei, M., Chen, X. Mechanisms of microRNA turnover. Current Opinion in Plant Biology. 27, 199-206 (2015).
  17. Li, J., Yang, Z., Yu, B., Liu, J., Chen, X. Methylation protects miRNAs and siRNAs from a 3′-end uridylation activity in Arabidopsis. Current Biology. 15 (16), 1501-1507 (2005).
  18. Rogers, K., Chen, X. Biogenesis, turnover, and mode of action of plant microRNAs. Plant Cell. 25 (7), 2383-2399 (2013).
  19. Axtell, M. J., Meyers, B. C. Revisiting criteria for plant microRNA annotation in the Era of big data. Plant Cell. 30 (2), 272-284 (2018).
  20. Camacho, C., et al. BLAST+: architecture and applications. BMC Bioinformatics. 10 (1), 421(2009).
  21. Markham, N. R. N., Zuker, M. UNAFold: Software for nucleic acid folding and hybridization. Methods in Molecular Biology. 453, 3-31 (2008).
  22. Alptekin, B., Akpinar, B. A., Budak, H. A comprehensive prescription for plant miRNA identification. Frontiers in Plant Science. 7, 2058(2017).
  23. Zhang, B., Pan, X., Cannon, C. H., Cobb, G. P., Anderson, T. A. Conservation and divergence of plant microRNA genes. Plant Journal. 46 (2), 243-259 (2006).
  24. Appels, R., et al. Shifting the limits in wheat research and breeding using a fully annotated reference genome. Science. 361 (6403), 7191(2018).
  25. Wang, Y., Kuang, Z., Li, L., Yang, X. A bioinformatics pipeline to accurately and efficiently analyze the microRNA transcriptomes in plants. Journal of Visualized Experiments: JoVE. (155), e59864(2020).
  26. Kozomara, A., Griffiths-Jones, S. MiRBase: Annotating high confidence microRNAs using deep sequencing data. Nucleic Acids Research. 42, 68-73 (2014).
  27. Lorenz, R., et al. ViennaRNA Package 2.0. Algorithms for Molecular Biology. 6 (1), 26(2011).
  28. Wicker, T., et al. Impact of transposable elements on genome structure and evolution in bread wheat. Genome Biology. 19 (1), 103(2018).
  29. Flavell, R. B., Bennett, M. D., Smith, J. B., Smith, D. B. Genome size and the proportion of repeated nucleotide sequence DNA in plants. Biochemical Genetics. 12 (4), 257-269 (1974).
  30. Wicker, T., et al. The repetitive landscape of the 5100 Mbp barley genome. Mobile DNA. 8, 22(2017).
  31. Yang, Q., Ye, Q. A., Liu, Y. Mechanism of siRNA production from repetitive DNA. Genes and Development. 29 (5), 526-537 (2015).
  32. Lam, J. K. W., Chow, M. Y. T., Zhang, Y., Leung, S. W. S. siRNA versus miRNA as therapeutics for gene silencing. Molecular Therapy. Nucleic Acids. 4 (9), 252(2015).
  33. Bartel, B. MicroRNAs directing siRNA biogenesis. Nature Structural and Molecular Biology. 12 (7), 569-571 (2005).
  34. Meng, Y., Shao, C., Wang, H., Chen, M. Are all the miRBase-registered microRNAs true? A structure- and expression-based re-examination in plants. RNA Biology. 9 (3), 249-253 (2012).
  35. Berezikov, E., et al. Evolutionary flux of canonical microRNAs and mirtrons in Drosophila. Nature Genetics. 42 (1), author reply 9-10 6-9 (2010).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Predykcja mikroRNApredykcja oparta na homologiisekwencjonowanie ma ych RNApotok analizy miRNAmiRNA w skali ca ego genomupredykcja struktury drugorz dowejidentyfikacja miRNAgenom Arabidopsisgenom pszenicy