$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
MicroRNAs (miRNAs) sind kurze nicht-kodierende RNA-Moleküle, die die Genexpression signifikant beeinflussen, indem sie im posttranskriptionellen Stadium1 wirken. Sie funktionieren in der Regel, indem sie an komplementäre Sequenzen in den 3'-untranslatierten Regionen (UTRs) von Ziel-Boten-RNAs (mRNAs) binden, was zu einem mRNA-Abbau oder einer translationalen Repression führt1. In den letzten zwei Jahrzehnten wurden miRNAs zunehmend als zentrale Regulatoren verschiedener biologischer Prozesse anerkannt, darunter Zellproliferation, Differenzierung, Apoptose, Immunantworten und Organentwicklung2. Darüber hinaus wurde eine Dysregulation der miRNA-Expression mit der Pathogenese zahlreicher Krankheiten wie Krebs, Herz-Kreislauf-Erkrankungen, neurologischen Störungen und Nierenerkrankungen in Verbindung gebracht3. Diese Ergebnisse unterstreichen das Potenzial von miRNAs nicht nur als therapeutische Ziele, sondern auch als minimal-invasive Biomarker in der klinischen Diagnostik.
Mit dem Aufkommen von Next-Generation-Sequencing-Technologien (NGS) ist die Erforschung von miRNAs in eine neue Ära eingetreten. Im Gegensatz zu Microarray-basierten Methoden, die auf bekannte miRNAs beschränkt sind, ermöglicht die miRNA-Sequenzierung (miRNA-Seq) ein umfassendes, hochwirksames und unvoreingenommenes Profiling sowohl bekannter als auch neuer miRNAs über verschiedene Probentypen und -bedingungen hinweg4. miRNA-Seq bietet eine überlegene Empfindlichkeit, Genauigkeit und einen überragenden Dynamikbereich, was es zu einer bevorzugten Methode zur Untersuchung von miRNA-Expressionsmustern und zur Entdeckung von Regulationsmechanismen in physiologischen und pathologischen Umgebungen macht5. Die Analyse von miRNA-Seq-Daten stellt jedoch besondere rechnerische Herausforderungen dar, darunter der Umgang mit kurzen Leselängen, die Entfernung von Adaptersequenzen, die Unterscheidung zwischen eng verwandten miRNA-Familienmitgliedern und die Verwaltung einer hohen Redundanz bei den Lesezahlen6. Diese Eigenschaften erfordern einen sorgfältig konzipierten und standardisierten analytischen Arbeitsablauf.
Obwohl verschiedene Pipelines und Softwaretools für die miRNA-Seq-Datenanalyse entwickelt wurden, verlassen sich viele von ihnen auf grafische Benutzeroberflächen oder feste Arbeitsabläufe, die die Flexibilität und Reproduzierbarkeit einschränken7. Im Gegensatz dazu bietet die Programmierumgebung R eine leistungsstarke und anpassbare Plattform für die bioinformatische Analyse8. R bietet ein umfangreiches Ökosystem von Paketen für statistische Modellierung, Datenvisualisierung und Integration in biologische Datenbanken. Dies ermöglicht es den Anwendern, umfassende und reproduzierbare Analysen transparent und skriptbasiert durchzuführen. Darüber hinaus ermöglicht der modulare Aufbau von R-Workflows den Forschern, jeden Schritt an spezifische experimentelle Anforderungen anzupassen, von der Rohdatenvorverarbeitung bis zur funktionalen Interpretation.
In diesem Protokoll stellen wir einen verifizierten und vollständigen miRNA-Seq-Analyse-Workflow vor, der vollständig in R implementiert ist, mit dem Ziel, Forschern, die mit miRNA-Expressionsdaten arbeiten, eine reproduzierbare und vom Benutzer anpassbare Lösung zu bieten. Der Arbeitsablauf beginnt mit der Qualitätskontrolle und dem Adaptertrimmen von Rohsequenzierungs-Reads, gefolgt von der Ausrichtung auf ein Referenzgenom oder bekannte miRNA-Sequenzen. Zu den nachfolgenden Schritten gehören die Quantifizierung der Lesezahlen, die Normalisierung, die differentielle Expressionsanalyse, die Vorhersage des Zielgens, die funktionelle Anreicherung und die Netzwerkvisualisierung. Der Workflow umfasst mehrere weit verbreitete und gut gepflegte R-Pakete, die sowohl die Zuverlässigkeit als auch die Kompatibilität mit zukünftigen Updates und Erweiterungen gewährleisten.
Eine der Hauptstärken dieses Protokolls liegt in seiner Fähigkeit, über differentielle Expressionsergebnisse hinauszugehen und eine aussagekräftige biologische Interpretation zu liefern. Durch die Integration kuratierter Datenbanken mit validierten und vorhergesagten miRNA-mRNA-Interaktionen ermöglicht der Workflow den Nutzern, biologisch relevante Zielgene zu identifizieren. Diese Ziele können dann einer Genontologie und Signalanreicherungsanalysen unterzogen werden, um betroffene biologische Prozesse und molekulare Signalwege aufzudecken. Im letzten Schritt können miRNA-mRNA-Interaktionsnetzwerke mit externen Tools wie Cytoscape9 visualisiert werden, um Einblicke in die regulatorische Landschaft zu erhalten und wichtige Hub-miRNAs mit potenzieller funktioneller Bedeutung zu identifizieren.
Diese Methode wurde erfolgreich in der klinischen Forschung eingesetzt, unter anderem in Studien zu Nierenerkrankungen, bei denen zirkulierende miRNAs als vielversprechende Biomarker für Diagnose und Prognose dienen10. Durch das modulare und flexible Design des Workflows eignet er sich jedoch für eine Vielzahl von Anwendungen, darunter Krankheitsmodellierung, Studien zum Ansprechen auf Medikamente, Entwicklungsbiologie und vergleichende Genomik. Forscher können den Arbeitsablauf leicht anpassen, um artspezifische Annotationen, Versuchsbedingungen oder zusätzliche Schichten von Omics-Daten aufzunehmen.
Durch das Angebot einer skriptbasierten Open-Source-Lösung behebt diese R-zentrierte Pipeline mehrere der größten Einschränkungen, die mit bestehenden miRNA-Seq-Tools verbunden sind, darunter begrenzte Anpassungsmöglichkeiten, Abhängigkeit von intransparenten grafischen Oberflächen, mangelnde Unterstützung für Nicht-Modellorganismen, schlechte Reproduzierbarkeit aufgrund fehlender Versionskontrolle und Schwierigkeiten bei der Integration mit nachgelagerten statistischen und funktionalen Analyse-Frameworks. Es ermöglicht die volle Kontrolle über die Parameter der Datenverarbeitung, fördert die Reproduzierbarkeit durch versionskontrollierten Code und fördert die Transparenz in der bioinformatischen Forschung. Da die Bedeutung von miRNAs im Kontext der Systembiologie und der translationalen Medizin weiter zunimmt, wird der Zugang zu einem zuverlässigen und anpassungsfähigen Analyserahmen immer wichtiger.