$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Los microARN (miARN) son moléculas cortas de ARN no codificantes que influyen significativamente en la expresión génica al actuar en la etapa postranscripcional1. Por lo general, funcionan uniéndose a secuencias complementarias en las regiones no traducidas (UTR) 3' de los ARN mensajeros diana (ARNm), lo que lleva a la degradación del ARNm o a la represión traduccional1. En las últimas dos décadas, los miARN han sido cada vez más reconocidos como reguladores centrales de varios procesos biológicos, incluida la proliferación celular, la diferenciación, la apoptosis, las respuestas inmunes y el desarrollo de órganos2. Además, la desregulación de la expresión de miARN se ha implicado en la patogénesis de numerosas enfermedades, como el cáncer, las enfermedades cardiovasculares, los trastornos neurológicos y la enfermedad renal3. Estos hallazgos resaltan el potencial de los miARN no solo como objetivos terapéuticos, sino también como biomarcadores mínimamente invasivos en el diagnóstico clínico.
Con el advenimiento de las tecnologías de secuenciación de próxima generación (NGS), el estudio de los miARN ha entrado en una nueva era. A diferencia de los métodos basados en microarrays que se limitan a los miARN conocidos, la secuenciación de miARN (miRNA-Seq) permite un perfil completo, de alto rendimiento e imparcial de miARN conocidos y nuevos en diferentes tipos y condiciones de muestra4. miRNA-Seq proporciona una sensibilidad, precisión y rango dinámico superiores, lo que lo convierte en un método preferido para investigar patrones de expresión de miARN y descubrir mecanismos reguladores en entornos fisiológicos y patológicos5. Sin embargo, el análisis de los datos de miRNA-Seq presenta desafíos computacionales específicos, incluido el manejo de longitudes de lectura cortas, la eliminación de secuencias adaptadoras, la distinción entre miembros de la familia de miRNA estrechamente relacionados y la gestión de una alta redundancia en los recuentos de lectura6. Estas características requieren un flujo de trabajo analítico cuidadosamente diseñado y estandarizado.
Aunque se han desarrollado varias canalizaciones y herramientas de software para el análisis de datos de miRNA-Seq, muchas de ellas se basan en interfaces gráficas de usuario o flujos de trabajo fijos que limitan la flexibilidad y la reproducibilidad7. Por el contrario, el entorno de programación R proporciona una plataforma potente y personalizable para el análisis bioinformático8. R ofrece un rico ecosistema de paquetes para modelado estadístico, visualización de datos e integración con bases de datos biológicas. Esto permite a los usuarios realizar análisis completos y reproducibles de forma transparente y basada en scripts. Además, la naturaleza modular de los flujos de trabajo de R permite a los investigadores adaptar cada paso de acuerdo con los requisitos experimentales específicos, desde el preprocesamiento de datos sin procesar hasta la interpretación funcional.
En este protocolo, presentamos un flujo de trabajo de análisis miRNA-Seq verificado y completo implementado completamente en R, con el objetivo de proporcionar una solución reproducible y adaptable al usuario para los investigadores que trabajan con datos de expresión de miRNA. El flujo de trabajo comienza con el control de calidad y el recorte del adaptador de las lecturas de secuenciación sin procesar, seguido de la alineación con un genoma de referencia o secuencias de miARN conocidas. Los pasos posteriores incluyen la cuantificación de los recuentos de lecturas, la normalización, el análisis de expresión diferencial, la predicción del gen diana, el enriquecimiento funcional y la visualización de la red. El flujo de trabajo incorpora varios paquetes de R ampliamente utilizados y bien mantenidos, lo que garantiza tanto la confiabilidad como la compatibilidad con futuras actualizaciones y extensiones.
Una de las fortalezas centrales de este protocolo radica en su capacidad para ir más allá de los resultados de expresión diferencial y proporcionar una interpretación biológica significativa. Al integrar bases de datos seleccionadas de interacciones miARN-ARNm validadas y predichas, el flujo de trabajo permite a los usuarios identificar genes diana biológicamente relevantes. Estos objetivos pueden someterse a análisis de ontología genética y enriquecimiento de vías para descubrir los procesos biológicos y las vías moleculares afectados. En el paso final, las redes de interacción miARN-ARNm se pueden visualizar utilizando herramientas externas como Cytoscape9, lo que proporciona información sobre el panorama regulatorio e identifica miARN centrales clave con importancia funcional potencial.
Este método se ha aplicado con éxito en contextos de investigación clínica, incluidos estudios sobre enfermedad renal, donde los miRNAs circulantes sirven como biomarcadores prometedores para el diagnóstico y pronóstico10. Sin embargo, el diseño modular y flexible del flujo de trabajo lo hace adecuado para una amplia gama de aplicaciones, incluido el modelado de enfermedades, los estudios de respuesta a fármacos, la biología del desarrollo y la genómica comparativa. Los investigadores pueden adaptar fácilmente el flujo de trabajo para acomodar anotaciones específicas de especies, condiciones experimentales o capas adicionales de datos ómicos.
Al ofrecer una solución de código abierto basada en scripts, esta canalización centrada en R aborda varias de las principales limitaciones asociadas con las herramientas miRNA-Seq existentes, incluida la personalización limitada, la dependencia de interfaces gráficas no transparentes, la falta de soporte para organismos no modelo, la reproducibilidad deficiente debido a la ausencia de control de versiones y la dificultad para integrarse con marcos de análisis estadísticos y funcionales posteriores. Permite un control total sobre los parámetros de procesamiento de datos, fomenta la reproducibilidad a través de código controlado por versiones y promueve la transparencia en la investigación bioinformática. A medida que la importancia de los miARN continúa creciendo en el contexto de la biología de sistemas y la medicina traslacional, tener acceso a un marco de análisis confiable y adaptable se vuelve cada vez más esencial.