$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
MicroRNA's (miRNA's) zijn korte niet-coderende RNA-moleculen die de genexpressie aanzienlijk beïnvloeden door in te werken in de post-transcriptionele fase1. Ze functioneren doorgaans door te binden aan complementaire sequenties in de 3' niet-getransleerde regio's (UTR's) van doelboodschapper-RNA's (mRNA's), wat leidt tot mRNA-degradatie of translationele onderdrukking1. In de afgelopen twee decennia zijn miRNA's steeds meer erkend als centrale regulatoren van verschillende biologische processen, waaronder celproliferatie, differentiatie, apoptose, immuunresponsen en orgaanontwikkeling2. Bovendien is ontregeling van miRNA-expressie betrokken bij de pathogenese van tal van ziekten, zoals kanker, hart- en vaatziekten, neurologische aandoeningen en nieraandoeningen3. Deze bevindingen benadrukken het potentieel van miRNA's, niet alleen als therapeutische doelen, maar ook als minimaal invasieve biomarkers in klinische diagnostiek.
Met de komst van next-generation sequencing (NGS) -technologieën is de studie van miRNA's een nieuw tijdperk ingegaan. In tegenstelling tot op microarray gebaseerde methoden die beperkt zijn tot bekende miRNA's, maakt miRNA-sequencing (miRNA-Seq) uitgebreide, high-throughput en onbevooroordeelde profilering mogelijk van zowel bekende als nieuwe miRNA's in verschillende monstertypes en omstandigheden4. miRNA-Seq biedt superieure gevoeligheid, nauwkeurigheid en dynamisch bereik, waardoor het een voorkeursmethode is voor het onderzoeken van miRNA-expressiepatronen en het ontdekken van regulerende mechanismen in fysiologische en pathologische omgevingen5. De analyse van miRNA-Seq-gegevens brengt echter specifieke computationele uitdagingen met zich mee, waaronder het omgaan met korte leeslengtes, het verwijderen van adaptersequenties, het maken van onderscheid tussen nauw verwante miRNA-familieleden en het beheren van hoge redundantie in het aantal gelezenlezen 6. Deze kenmerken vereisen een zorgvuldig ontworpen en gestandaardiseerde analytische workflow.
Hoewel er verschillende pijplijnen en softwaretools zijn ontwikkeld voor miRNA-Seq-gegevensanalyse, vertrouwen veel daarvan op grafische gebruikersinterfaces of vaste workflows die de flexibiliteit en reproduceerbaarheid beperken7. De R-programmeeromgeving biedt daarentegen een krachtig en aanpasbaar platform voor bio-informaticaanalyse8. R biedt een rijk ecosysteem van pakketten voor statistische modellering, datavisualisatie en integratie met biologische databases. Dit stelt gebruikers in staat om uitgebreide en reproduceerbare analyses uit te voeren op een transparante en op scripts gebaseerde manier. Bovendien stelt het modulaire karakter van R-workflows onderzoekers in staat om elke stap aan te passen aan specifieke experimentele vereisten, van voorverwerking van onbewerkte gegevens tot functionele interpretatie.
In dit protocol presenteren we een geverifieerde en volledige miRNA-Seq-analyseworkflow die volledig in R is geïmplementeerd, met als doel een reproduceerbare en door de gebruiker aanpasbare oplossing te bieden voor onderzoekers die werken met miRNA-expressiegegevens. De workflow begint met kwaliteitscontrole en het bijsnijden van adapters van onbewerkte sequencing-lezingen, gevolgd door uitlijning met een referentiegenoom of bekende miRNA-sequenties. Daaropvolgende stappen omvatten kwantificering van het aantal gelezen bestanden, normalisatie, differentiële expressieanalyse, voorspelling van doelgenen, functionele verrijking en netwerkvisualisatie. De workflow omvat verschillende veelgebruikte en goed onderhouden R-pakketten, waardoor zowel de betrouwbaarheid als de compatibiliteit met toekomstige updates en uitbreidingen worden gegarandeerd.
Een van de belangrijkste sterke punten van dit protocol ligt in het vermogen om verder te gaan dan differentiële expressieresultaten en een zinvolle biologische interpretatie te bieden. Door samengestelde databases van gevalideerde en voorspelde miRNA-mRNA-interacties te integreren, stelt de workflow gebruikers in staat om biologisch relevante doelgenen te identificeren. Deze doelen kunnen vervolgens worden onderworpen aan genontologie en routeverrijkingsanalyses om aangetaste biologische processen en moleculaire routes aan het licht te brengen. In de laatste stap kunnen miRNA-mRNA-interactienetwerken worden gevisualiseerd met behulp van externe tools zoals Cytoscape9, waardoor inzicht wordt verkregen in het regelgevingslandschap en belangrijke hub-miRNA's met potentieel functioneel belang worden geïdentificeerd.
Deze methode is met succes toegepast in klinische onderzoekscontexten, waaronder studies naar nierziekte, waarbij circulerende miRNA's dienen als veelbelovende biomarkers voor diagnose en prognose10. Het modulaire en flexibele ontwerp van de workflow maakt het echter geschikt voor een breed scala aan toepassingen, waaronder ziektemodellering, onderzoek naar geneesmiddelrespons, ontwikkelingsbiologie en vergelijkende genomica. Onderzoekers kunnen de workflow eenvoudig aanpassen aan soortspecifieke annotaties, experimentele omstandigheden of extra lagen omics-gegevens.
Door een open-source, op scripts gebaseerde oplossing aan te bieden, pakt deze R-gecentreerde pijplijn een aantal van de belangrijkste beperkingen aan die verband houden met bestaande miRNA-Seq-tools, waaronder beperkte aanpassing, afhankelijkheid van niet-transparante grafische interfaces, gebrek aan ondersteuning voor niet-modelorganismen, slechte reproduceerbaarheid door de afwezigheid van versiebeheer en moeilijkheid bij integratie met downstream statistische en functionele analysekaders. Het maakt volledige controle over de parameters van de gegevensverwerking mogelijk, stimuleert de reproduceerbaarheid door middel van versiegecontroleerde code en bevordert de transparantie in bio-informaticaonderzoek. Naarmate het belang van miRNA's blijft groeien in de context van systeembiologie en translationele geneeskunde, wordt toegang tot een betrouwbaar en aanpasbaar analysekader steeds belangrijker.