$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
MikroRNA (miRNA) to krótkie, niekodujące cząsteczki RNA, które znacząco wpływają na ekspresję genów, działając w fazie potranskrypcyjnej1. Zazwyczaj działają poprzez wiązanie się z komplementarnymi sekwencjami w nieulegających translacji regionach 3' (UTR) docelowych informacyjnych RNA (mRNA), co prowadzi do degradacji mRNA lub represji translacyjnej1. W ciągu ostatnich dwóch dekad miRNA są coraz częściej uznawane za centralne regulatory różnych procesów biologicznych, w tym proliferacji komórek, różnicowania, apoptozy, odpowiedzi immunologicznych i rozwoju narządów2. Co więcej, rozregulowanie ekspresji miRNA jest związane z patogenezą wielu chorób, takich jak nowotwory, choroby układu krążenia, zaburzenia neurologiczne i choroby nerek3. Odkrycia te podkreślają potencjał miRNA nie tylko jako celów terapeutycznych, ale także jako minimalnie inwazyjnych biomarkerów w diagnostyce klinicznej.
Wraz z pojawieniem się technologii sekwencjonowania nowej generacji (NGS) badanie miRNA wkroczyło w nową erę. W przeciwieństwie do metod opartych na mikromacierzach, które są ograniczone do znanych miRNA, sekwencjonowanie miRNA (miRNA-Seq) umożliwia kompleksowe, wysokoprzepustowe i bezstronne profilowanie zarówno znanych, jak i nowych miRNA w różnych typach próbek i warunkach4. miRNA-Seq zapewnia doskonałą czułość, dokładność i zakres dynamiki, co czyni go preferowaną metodą badania wzorców ekspresji miRNA i odkrywania mechanizmów regulacyjnych w warunkach fizjologicznych i patologicznych5. Jednak analiza danych miRNA-Seq wiąże się ze szczególnymi wyzwaniami obliczeniowymi, w tym obsługą krótkich długości odczytu, usuwaniem sekwencji adapterów, rozróżnianiem blisko spokrewnionych członków rodziny miRNA i zarządzaniem wysoką nadmiarowością w liczbie odczytów6. Cechy te wymagają starannie zaprojektowanego i ustandaryzowanego przepływu pracy analitycznej.
Chociaż do analizy danych miRNA-Seq opracowano różne potoki i narzędzia programowe, wiele z nich opiera się na graficznych interfejsach użytkownika lub stałych przepływach pracy, które ograniczają elastyczność i odtwarzalność7. W przeciwieństwie do tego, środowisko programistyczne R zapewnia potężną i konfigurowalną platformę do analizy bioinformatycznej8. R oferuje bogaty ekosystem pakietów do modelowania statystycznego, wizualizacji danych i integracji z biologicznymi bazami danych. Dzięki temu użytkownicy mogą przeprowadzać kompleksowe i powtarzalne analizy w sposób przejrzysty i oparty na skryptach. Co więcej, modułowy charakter przepływów pracy języka R pozwala badaczom dostosować każdy krok do konkretnych wymagań eksperymentalnych, od wstępnego przetwarzania surowych danych po interpretację funkcjonalną.
W tym protokole przedstawiamy zweryfikowany i kompletny przepływ pracy analizy miRNA-Seq zaimplementowany w całości w R, w celu zapewnienia powtarzalnego i adaptowalnego przez użytkownika rozwiązania dla badaczy pracujących z danymi dotyczącymi ekspresji miRNA. Przepływ pracy rozpoczyna się od kontroli jakości i przycinania adapterów surowych odczytów sekwencjonowania, a następnie dopasowywania do genomu referencyjnego lub znanych sekwencji miRNA. Kolejne kroki obejmują kwantyfikację liczby odczytów, normalizację, różnicową analizę ekspresji, przewidywanie docelowych genów, wzbogacanie funkcjonalne i wizualizację sieci. Przepływ pracy obejmuje kilka powszechnie używanych i dobrze utrzymywanych pakietów języka R, zapewniając zarówno niezawodność, jak i zgodność z przyszłymi aktualizacjami i rozszerzeniami.
Jedną z głównych zalet tego protokołu jest jego zdolność do wyjścia poza zróżnicowane wyniki ekspresji i zapewnienia znaczącej interpretacji biologicznej. Dzięki integracji wyselekcjonowanych baz danych zwalidowanych i przewidywanych interakcji miRNA-mRNA, przepływ pracy umożliwia użytkownikom identyfikację biologicznie istotnych genów docelowych. Cele te można następnie poddać ontologii genów i analizom wzbogacania szlaków w celu odkrycia dotkniętych procesów biologicznych i szlaków molekularnych. W ostatnim etapie sieci interakcji miRNA-mRNA można wizualizować za pomocą zewnętrznych narzędzi, takich jak Cytoscape9, zapewniając wgląd w krajobraz regulacyjny i identyfikując kluczowe miRNA o potencjalnym znaczeniu funkcjonalnym.
Metoda ta została z powodzeniem zastosowana w kontekstach badań klinicznych, w tym w badaniach nad chorobami nerek, w których krążące miRNA służą jako obiecujące biomarkery do diagnozowania i rokowania10. Jednak modułowa i elastyczna konstrukcja przepływu pracy sprawia, że nadaje się on do szerokiego zakresu zastosowań, w tym modelowania chorób, badań odpowiedzi na leki, biologii rozwojowej i genomiki porównawczej. Badacze mogą łatwo dostosować przepływ pracy, aby uwzględnić adnotacje specyficzne dla gatunku, warunki eksperymentalne lub dodatkowe warstwy danych omicznych.
Oferując rozwiązanie oparte na skryptach typu open source, ten potok skoncentrowany na języku R rozwiązuje kilka głównych ograniczeń związanych z istniejącymi narzędziami miRNA-Seq, w tym ograniczoną personalizację, zależność od nieprzezroczystych interfejsów graficznych, brak wsparcia dla organizmów niemodelowych, słabą odtwarzalność z powodu braku kontroli wersji oraz trudności w integracji z ramami analizy statystycznej i funkcjonalnej. Umożliwia pełną kontrolę nad parametrami przetwarzania danych, zachęca do odtwarzalności dzięki kodowi sterowanemu wersją i promuje przejrzystość w badaniach bioinformatycznych. Ponieważ znaczenie miRNA w kontekście biologii systemowej i medycyny translacyjnej stale rośnie, dostęp do wiarygodnych i elastycznych ram analizy staje się coraz bardziej istotny.