$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Se han desarrollado métodos de secuenciación basados en espectrometría de masas (MS), incluida la MS de arriba hacia abajo y la MS en tándem 1,2,3,4, para la secuenciación directa de ARN. Sin embargo, las técnicas de fragmentación in situ para generar eficazmente escaleras de ARN de alta calidad en espectrómetros de masas actualmente no se pueden aplicar a la secuenciación de novo 5,6. Además, no es muy trivial analizar los datos tradicionales de MS unidimensional (1D) para la secuenciación de novo de incluso una secuencia de ARN purificado, y sería aún más difícil para la secuenciación de MS de muestras de ARN mixto 7,8. Por lo tanto, se ha desarrollado un método de secuenciación de ARN basado en cromatografía líquida (LC)-MS bidimensional (2D), que incorpora la producción de escaleras de tiempo de retención de masa (tR) 2D para reemplazar las escaleras de masa 1D, lo que facilita mucho la identificación de los componentes de la escalera necesarios para la secuenciación de novo de ARN8. Sin embargo, el método de secuenciación de ARN 2D LC-MS se limita principalmente a ARN corto sintético purificado, ya que no puede leer una secuencia completa basándose únicamente en una sola escalera, sino que debe basarse en dos escaleras adyacentes coexistentes (escaleras de 5' y 3')8. Más específicamente, este enfoque requiere lecturas bidireccionales de extremos emparejados para leer nucleobases terminales en la región de baja masa8. La complejidad añadida de la lectura de los extremos emparejados hace que este método sea insostenible para la secuenciación de mezclas de ARN porque se genera confusión sobre qué fragmento de escalera pertenece a qué escalera para las muestras desconocidas.
Para superar las barreras mencionadas anteriormente en los enfoques de secuenciación de ARN basados en MS y ampliar dichas aplicaciones en la secuenciación directa de ARN, se deben abordar dos cuestiones: 1) cómo generar una escalera de masa de alta calidad que se pueda utilizar para leer una secuencia completa, desde el primer nucleótido hasta el último en una cadena de ARN, y 2) cómo identificar eficazmente cada escalera de ARN/masa en un conjunto de datos complejos de MS. Junto con la degradación ácida bien controlada, hemos desarrollado un nuevo método de secuenciación mediante la introducción de una estrategia de etiquetado final hidrofóbico (HELS) en la técnica de secuenciación basada en MS, y abordamos con éxito estos dos problemas mediante la adición de una etiqueta hidrofóbica en el extremo 5' y/o 3' de los ARN que se van a secuenciar9. Este método crea una escalera de secuencia "ideal" a partir de ARN: cada fragmento de escalera deriva de la escisión de ARN específica del sitio exclusivamente en cada enlace fosfodiéster, y la diferencia de masa entre dos fragmentos de escalera adyacentes es la masa exacta del nucleótido o la modificación del nucleótido en esa posición 8,9,10. Esto es posible porque incluimos una etapa de hidrólisis ácida altamente controlada, que fragmenta el ARN, en promedio, una vez por molécula, antes de que se inyecte en el instrumento. Como resultado, cada producto de fragmento de degradación se detecta en el espectrómetro de masas y todos los fragmentos juntos forman una escalera de secuenciación 8,9,10. Esta nueva estrategia permite la lectura completa de una secuencia de ARN de una sola escalera de una cadena de ARN sin la lectura de extremos emparejados de la otra escalera del ARN y, además, permite la secuenciación de MS de mezclas de ARN con múltiples hebras diferentes que contienen modificaciones combinatorias de nucleótidos9. Al agregar una etiqueta en el extremo 5' y/o 3' del ARN, los fragmentos de escalera marcados muestran un retraso significativo de tR, lo que puede ayudar a distinguir las dos escaleras de masa entre sí y también de la región ruidosa de baja masa. El desplazamiento de masa-tR causado por la adición de la etiqueta hidrofóbica facilita la identificación de la escalera de masa y simplifica el análisis de datos para la generación de secuencias. Además, la adición de la etiqueta hidrofóbica puede ayudar a identificar la base terminal en la hebra al evitar que su fragmento de escalera correspondiente esté en la regiónR de baja masa y baja ruido debido al aumento de masa e hidrofobicidad causado por la etiqueta, lo que permite la identificación de la secuencia completa de un ARN a partir de una sola escalera; No se requieren lecturas de extremo emparejado. Como resultado, hemos demostrado previamente la secuenciación exitosa de una mezcla compleja de hasta 12 hebras distintas de ARN sin el uso de ningún algoritmo de secuenciación avanzado9, lo que abre la puerta a la secuenciación MS de novo de ARN que contiene nucleótidos canónicos y modificados y lo hace más factible para la secuenciación de muestras de ARN mixtas y más complejas. De hecho, utilizando 2D-HELS MS Seq, incluso hemos secuenciado con éxito una población mixta de muestras de ARNt10 y estamos ampliando activamente su aplicación a otras muestras de ARN complejas.
Para facilitar que 2D-HELS MS Seq secuencie directamente una gama más amplia de muestras de ARN, aquí nos centraremos en los aspectos técnicos de este enfoque de secuenciación y cubriremos todos los pasos esenciales necesarios al aplicar la técnica hacia la secuenciación directa de muestras de ARN. Se utilizarán ejemplos específicos para ilustrar la técnica de secuenciación, incluidas secuencias sintéticas de ARN único, mezclas de múltiples secuencias de ARN distintas y ARN modificados que contienen nucleótidos canónicos y modificados, como pseudouridina (ψ) y 5-metilcitosina (m5C). Dado que todos los ARN contienen enlaces fosfodiéster, cualquier tipo de ARN puede ser hidrolizado con ácido para generar una escalera de secuencia ideal para 2D-HELS MS Seq en condiciones óptimas 8,9. Sin embargo, la detección de todos los fragmentos de escalera de un ARN dado depende del instrumento. En una LC-MS estándar de alta resolución (40K), la cantidad mínima de carga para secuenciar una muestra de ARN corto purificada (<35 nt) es de 100 pmol por ejecución. Sin embargo, se requiere más material (hasta 400 pmol por muestra de ARN) cuando se deben realizar experimentos adicionales (por ejemplo, para distinguir modificaciones de bases isoméricas que comparten masas idénticas). El protocolo utilizado en la secuenciación del modelo de ARN sintético modificado también será aplicable a la secuenciación de muestras de ARN más amplias, incluidas las muestras de ARN biológico con modificaciones de bases desconocidas. Sin embargo, se requiere una cantidad de muestra aún mayor, como 1000 pmol para secuenciar el ARNt (~76 nt) utilizando un instrumento LC-MS estándar, para secuenciar el ARNt completo con todas las modificaciones, y se debe desarrollar un algoritmo avanzado para su secuenciación de novo 10.