Los bucles R son estructuras de ácido nucleico tricatenario que se forman principalmente durante la transcripción tras la hibridación de la transcripción de ARN naciente con la cadena de ADN molde. Esto da como resultado la formación de un híbrido ARN:ADN y provoca el desplazamiento de la hebra de ADN no molde en un estado de bucle monocatenario. La reconstitución bioquímica 1,2,3,4 y el modelado matemático5, en combinación con otras mediciones biofísicas 6,7, han establecido que es más probable que ocurran bucles R en regiones que exhiben características favorables específicas. Por ejemplo, las regiones que muestran una asimetría de hebra en la distribución de guaninas (G) y citosinas (C) de modo que el ARN es rico en G, una propiedad llamada sesgo positivo de GC, se ven favorecidas para formar bucles R cuando se transcriben debido a la mayor estabilidad termodinámica del híbrido ADN:ARN en comparación con el dúplex de ADN8. Las regiones que han desarrollado un sesgo positivo de GC, como las primeras porciones de muchos genes eucariotas 4,9,10,11, son propensas a formar bucles R in vitro e in vivo 3,4,12. La tensión superhelicoidal negativa del ADN también favorece en gran medida la formación de estructuras13,14 porque los bucles R absorben eficientemente dichas tensiones topológicas y devuelven la fibra de ADN circundante a un estado relajado favorable 5,15.
Históricamente, se consideraba que las estructuras de bucle R eran el resultado de entrelazamientos raros y espontáneos de ARN con ADN durante la transcripción. Sin embargo, el desarrollo de la inmunoprecipitación ADN:ARN (DRIP) junto con la secuenciación de ADN de alto rendimiento (DRIP-seq) permitió el primer mapeo de todo el genoma de los R-loops y reveló que esas estructuras son mucho más prevalentes de lo esperado en las células humanas 4,16. Los bucles R ocurren en decenas de miles de puntos calientes genéticos conservados y transcritos en los genomas de los mamíferos, con una predilección por las islas CpG sesgadas por GC que se superponen al primer intrón de genes y las regiones terminales denumerosos genes. En general, los bucles R ocupan colectivamente entre el 3% y el 5% del genoma de las células humanas, lo que coincide con las mediciones en otros organismos, como levaduras, plantas, moscas y ratones 18,19,20,21,22.
El análisis de los puntos calientes formadores de bucle R en células humanas reveló que tales regiones se asocian con firmas específicas de cromatina23. Los bucles R, en general, se encuentran en regiones con menor ocupación de nucleosomas y mayor densidad de ARN polimerasa. En los promotores, los bucles R se asocian con un mayor reclutamiento de dos modificaciones de histonas depositadas cotranscripcionalmente, H3K4me1 y H3K36me317. En los extremos de los genes, los bucles R se asocian con genes estrechamente dispuestos que experimentan una terminación de transcripción eficiente17, lo que concuerda con observaciones previas24. También se demostró que los R-loops participan en el inicio de la replicación del ADN en los orígenes de replicación de los genomas de bacteriófagos, plásmidos, mitocondriales y levaduras 25,26,27,28,29,30,31. Además, el 76% de los promotores de islas CpG humanos propensos a los bucles R funcionan como orígenes de replicación constitutivos tempranos 32,33,34,35, lo que refuerza aún más las conexiones entre los bucles R y los orígenes de replicación. En conjunto, estos estudios sugieren que los bucles R representan un nuevo tipo de señal biológica que puede desencadenar salidas biológicas específicas de una manera dependiente del contexto23.
Al principio, se demostró que se formaban bucles R en las secuencias de cambio de clase durante el proceso de recombinación de interruptores de clase de inmunoglobulinas 3,36,37. Se cree que estos bucles R programados inician la recombinación de cambios de clase mediante la introducción de roturas de ADN bicatenario38. Desde entonces, la formación dañina de R-loops, generalmente entendida como el resultado de una formación excesiva de R-loops, se ha relacionado con la inestabilidad genómica y procesos como la hiperrecombinación, las colisiones transcripción-replicación, la replicación y el estrés transcripcional (para revisión 39,40,41,42,43). Como consecuencia, el mapeo mejorado de las estructuras del bucle R representa un desafío emocionante y esencial para descifrar mejor la distribución y la función de estas estructuras en la salud y la enfermedad.
La inmunoprecipitación ADN:ARN (DRIP) se basa en la alta afinidad del anticuerpo monoclonal S9.6 para los híbridos ADN:ARN44. DRIP-seq permite un perfil robusto de todo el genoma de la formación de bucles R 4,45. Si bien es útil, esta técnica sufre de una resolución limitada debido al hecho de que se utilizan enzimas de restricción para lograr una fragmentación suave del ADN. Además, DRIP-seq no proporciona información sobre la direccionalidad de la formación de R-loop. Aquí, reportamos una variante de DRIP-seq que permite el mapeo de R-loops a alta resolución de una manera específica para cada cadena. Este método se basa en la sonicación para fragmentar el genoma antes de la inmunoprecipitación y, por lo tanto, el método se denomina sDRIP-seq (inmunoprecipitación de ADN por ARN en sonicación junto con secuenciación de alto rendimiento) (Figura 1). El uso de la sonicación permite una mayor resolución y limita los sesgos de fragmentación ligados a enzimas de restricción observados en los enfoques de DRIP-seq46. sDRIP-seq produce mapas de bucle R que concuerdan fuertemente con los resultados tanto de DRIP-seq como del método DRIPc-seq de alta resolución descrito anteriormente, en el que las bibliotecas de secuenciación se construyen a partir de las hebras de ARN de estructuras de bucle R inmunoprecipitadas45.
Frente a una gran cantidad de métodos para elegir, los usuarios pueden preguntarse qué enfoque particular basado en DRIP es preferible para sus necesidades. Te ofrecemos los siguientes consejos. DRIP-seq, a pesar de sus limitaciones, es técnicamente más fácil y es el más robusto (rendimientos más altos) de los tres métodos discutidos aquí; Por lo tanto, sigue siendo ampliamente útil. Se han publicado numerosos conjuntos de datos DRIP-seq, que proporcionan un punto de comparación útil para nuevos conjuntos de datos. Por último, la canalización de análisis bioinformático es más sencilla ya que los datos no están varados. Se recomienda que los nuevos usuarios comiencen a perfeccionar sus habilidades de mapeo de bucle R con DRIP, seguido de la reacción en cadena de la polimerasa cuantitativa (qPCR) y DRIP-seq. sDRIP-seq representa un grado ligeramente mayor de dificultad técnica: los rendimientos se reducen ligeramente debido a la sonicación (comentada más adelante) y el proceso de la biblioteca de secuenciación es ligeramente más complejo. Sin embargo, la ganancia de varado y mayor resolución es invaluable. Se observa que sDRIP-seq capturará tanto híbridos de ARN:ADN de dos cadenas como bucles R de tres cadenas. Debido a los pasos de construcción de la biblioteca, DRIP-seq no capturará híbridos de ARN:ADN de dos cadenas. DRIPc-seq es el más exigente técnicamente y requiere una mayor cantidad de materiales de partida. A cambio, ofrece la mayor resolución y varado. Debido a que las bibliotecas de secuenciación se construyen a partir de la fracción de ARN de R-loops o híbridos, DRIPc-seq puede sufrir una posible contaminación por ARN, especialmente porque S9.6 posee afinidad residual por dsRNA 19,47,48. sDRIP-seq permite el mapeo de alta resolución específico de la cadena sin preocuparse por la contaminación del ARN, ya que las bibliotecas de secuenciación se derivan de las cadenas de ADN. En general, estos tres métodos siguen siendo útiles y presentan diferentes grados de complejidad y advertencias ligeramente diferentes. Los tres, sin embargo, producen conjuntos de datos altamente congruentes48 y son altamente sensibles al pretratamiento de RNasa H, lo que representa un control esencial para garantizar la especificidad de la señal45,49. Se observa que, dada la selección de tamaño impuesta a las bibliotecas de secuenciación, se excluirán los híbridos pequeños (estimados <75 pb), como los que se forman transitoriamente alrededor de los sitios de cebado de replicación del ADN de hebras rezagadas (cebadores de Okazaki). Del mismo modo, dado que todos los métodos de goteo implican la fragmentación del ADN,se perderán los bucles R inestables que requieren un superenrollamiento negativo del ADN para su estabilidad. Por lo tanto, los enfoques de DRIP pueden subestimar las cargas de los bucles R, especialmente para los bucles R cortos e inestables que pueden capturarse mejor utilizando enfoques in vivo 45,48. Se observa que los bucles R también se pueden perfilar de manera independiente de S9.6 con cobertura profunda, alta resolución y de manera específica de la cadena en moléculas individuales de ADN después del tratamiento con bisulfito de sodio12. Además, se han empleado estrategias que utilizan una enzima RNasa H1 catalíticamente inactiva para mapear los bucles R nativos in vivo, destacando los bucles R cortos e inestables que se forman principalmente en los promotores en pausa 50,51,52.