Postępy w technologiach sekwencjonowania nowej generacji poszerzyły zrozumienie struktur RNA i elementów regulatorowych, ujawniając funkcjonalnie ważne niekodujące RNA (ncRNA). Wśród różnych typów ncRNA, mikroRNA (miRNA) stanowią podstawową klasę regulatorową małych RNA o długości od 19 do 24 nukleotydów w roślinach1,2. Od czasu odkrycia pierwszego miRNA u nicienia Caenorhabditis elegans3, obecność i funkcje miRNA były szeroko badane również w genomach zwierzęcych i roślinnych4,5,6. miRNA działają poprzez celowanie w mRNA w celu rozszczepienia lub represji translacyjnej7. Zgromadzone dowody wykazały również, że miRNA są zaangażowane w szeroki zakres procesów biologicznych w roślinach, w tym we wzroście i rozwoju8, autobiogenezie9 oraz kilku biotycznych i abiotycznych reakcjach na stres10.
U roślin miRNA są początkowo przetwarzane z długich pierwotnych transkryptów zwanych pri-miRNAs11. Te pri-miRNA generowane przez polimerazę RNA II wewnątrz jądra są długimi transkryptami tworzącymi niedoskonałą strukturę składania12. Pri-miRNA przechodzą później proces rozszczepienia w celu wytworzenia endogennych jednoniciowych (ss) prekursorów spinki do włosów miRNA, zwanych pre-miRNAs11. Pre-miRNA tworzy strukturę podobną do spinki do włosów, w której pojedyncza nić składa się w strukturę dwuniciową, aby wyciąć dupleks miRNA (miRNA/miRNA*)13. Białko podobne do dicera przecina obie nici dupleksu miRNA/miRNA*, pozostawiając 2-nukleotydowe 3'-zwisające14,15. Duplex miRNA jest metylowany wewnątrz jądra, co chroni koniec 3' miRNA przed degradacją i aktywnością urydylacyjną16,17. Helikaza rozwija metylowany dupleks miRNA po eksporcie i wystawia dojrzałe miRNA na działanie indukowanego RNA kompleksu wyciszającego (RISC) w klasie cytozolu18. Jedna nić dupleksu to dojrzałe miRNA włączone do RISC , podczas gdy druga nić, miRNA *, jest zdegradowana. Kompleks miRNA-RISC wiąże się z sekwencją docelową, prowadząc do degradacji mRNA w przypadku pełnej komplementarności lub represji translacyjnej w przypadku częściowej komplementarności13.
Na podstawie cech ekspresji i biogenezy, opisano wytyczne dotyczące adnotacji miRNA15,19. Mając zdefiniowane wytyczne, Lucas i Budak opracowali potok SUmir w celu przeprowadzenia opartej na homologii identyfikacji miRNA in silico w roślinach9. Pipeline SUmir składał się z dwóch skryptów: SUmirFind i SUmirFold. SUmirFind przeprowadza wyszukiwanie podobieństw w znanych zestawach danych miRNA za pomocą narzędzia National Center for Biotechnology Information (NCBI) Basic Local Alignment Search (BLAST) ze zmodyfikowanymi parametrami, aby uwzględnić trafienia z tylko 2 lub mniej niezgodnościami i uniknąć stronniczości w kierunku krótszych trafień (blastn-short-ungapped -kara -1 -nagroda 1). SUmirFold ocenia drugorzędową strukturę przypuszczalnych sekwencji miRNA z wyników BLAST20 przy użyciu UNAfold21. SUmirFold odróżnia miRNA od małych interferujących RNA poprzez identyfikację cech charakterystycznych struktury spinki do włosów. Ponadto odróżnia miRNA od innych ssRNA, takich jak tRNA i rRNA, parametrami, minimalnym wskaźnikiem energii krotności > 0,67 i zawartością GC 24-71%. Ten potok został niedawno zaktualizowany poprzez dodanie dwóch dodatkowych kroków w celu (i) zwiększenia czułości, (ii) zwiększenia dokładności adnotacji oraz (iii) zapewnienia genomowej dystrybucji przewidywanych genów miRNA22. Biorąc pod uwagę wysoką konserwację sekwencji miRNA roślin23, ten potok został pierwotnie zaprojektowany do przewidywania miRNA opartego na homologii. Nowe miRNA nie mogły być jednak dokładnie zidentyfikowane za pomocą tej analizy bioinformatycznej, ponieważ w dużej mierze opierała się ona na zachowaniu sekwencji miRNA między blisko spokrewnionymi gatunkami.
Ten artykuł przedstawia nowy i w pełni zautomatyzowany potok miRNA, mirMachine, który 1) może dokładniej identyfikować znane i nowe miRNA (na przykład, teraz wykorzystuje nowe prognozy miRNA oparte na sRNA-seq, jak również identyfikację miRNA opartą na homologii) i 2) jest w pełni zautomatyzowany i swobodnie dostępny. Wyniki obejmowały również rozkłady genomowe przewidywanych miRNA. mirMachine został przetestowany zarówno pod kątem przewidywań opartych na homologii, jak i sekwencjonowaniu sRNA w genomach pszenicy i rzodkiewnika. Chociaż początkowo wydany jako wolne oprogramowanie, UNAfold stał się oprogramowaniem komercyjnym w ostatniej dekadzie. Dzięki tej aktualizacji narzędzie do przewidywania struktury wtórnej zostało zmienione z UNAfold na RNAfold, dzięki czemu mirMachine może być swobodnie dostępny. Użytkownicy mogą teraz wykonać krótki skrypt przesyłania, aby uruchomić w pełni zautomatyzowany potok mirMachine (przykłady znajdują się na stronie https://github.com/hbusra/mirMachine.git).