$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Des méthodes de séquençage basées sur la spectrométrie de masse (MS), y compris la MS descendante et la MSen tandem 1,2,3,4, ont été développées pour le séquençage direct de l’ARN. Cependant, les techniques de fragmentation in situ permettant de générer efficacement des échelles d’ARN de haute qualité dans les spectromètres de masse ne peuvent actuellement pas être appliquées au séquençage de novo 5,6. De plus, il n’est pas très trivial d’analyser les données MS unidimensionnelles (1D) traditionnelles pour le séquençage de novo d’une seule séquence d’ARN purifié, et ce serait encore plus difficile pour le séquençage MS d’échantillons d’ARN mixtes 7,8. Par conséquent, une méthode de séquençage de l’ARN bidimensionnelle (2D) basée sur la chromatographie liquide (LC)-MS a été développée, intégrant la production d’échelles de temps de rétention de masse (tR) 2D pour remplacer les échelles de masse 1D, ce qui facilite grandement l’identification des composants de l’échelle nécessaires au séquençage de novo des ARN8. Cependant, la méthode de séquençage de l’ARN basée sur la LC-MS 2D est principalement limitée à l’ARN court synthétique purifié, car elle ne peut pas lire une séquence complète uniquement sur la base d’une seule échelle, mais doit s’appuyer sur deux échelles adjacentes coexistantes (échelles 5' et 3')8. Plus précisément, cette approche nécessite des lectures bidirectionnelles à extrémités appariées pour la lecture des nucléobases terminales dans la région de faible masse8. La complexité supplémentaire de la lecture des extrémités appariées fait que cette méthode est intenable pour le séquençage des mélanges d’ARN, car la confusion est soulevée quant à savoir quel fragment d’échelle appartient à quelle échelle pour les échantillons inconnus.
Pour surmonter les obstacles mentionnés ci-dessus dans les approches de séquençage de l’ARN basées sur la SEP et pour élargir ces applications au séquençage direct de l’ARN, deux questions doivent être abordées : 1) comment générer une échelle de masse de haute qualité qui peut être utilisée pour lire une séquence complète, du premier nucléotide au dernier dans un brin d’ARN, et 2) comment identifier efficacement chaque échelle ARN/masse dans un ensemble de données MS complexe. Parallèlement à une dégradation acide bien contrôlée, nous avons développé une nouvelle méthode de séquençage en introduisant une stratégie de marquage hydrophobe (HELS) dans la technique de séquençage basée sur la MS, et nous avons résolu avec succès ces deux problèmes en ajoutant un marqueur hydrophobe à l’extrémité 5' et/ou 3' des ARN à séquencer9. Cette méthode crée une échelle de séquence « idéale » à partir de l’ARN : chaque fragment d’échelle dérive d’un clivage d’ARN spécifique au site exclusivement au niveau de chaque liaison phosphodiester, et la différence de masse entre deux fragments d’échelle adjacents est la masse exacte du nucléotide ou de la modification du nucléotide à cette position 8,9,10. Cela est possible parce que nous incluons une étape d’hydrolyse acide hautement contrôlée, qui fragmente l’ARN, en moyenne, une fois par molécule, avant qu’il ne soit injecté dans l’instrument. En conséquence, chaque produit de fragment de dégradation est détecté sur le spectromètre de masse et tous les fragments forment ensemble une échelle de séquençage 8,9,10. Cette nouvelle stratégie permet une lecture complète d’une séquence d’ARN à partir d’une seule échelle d’un brin d’ARN sans lecture d’extrémité appariée de l’autre échelle de l’ARN, et permet en outre le séquençage par MS de mélanges d’ARN avec plusieurs brins différents contenant des modifications nucléotidiques combinatoires9. En ajoutant une étiquette à l’extrémité 5' et/ou 3' de l’ARN, les fragments d’échelle marqués présentent un retard significatif de tR, ce qui peut aider à distinguer les deux échelles de masse l’une de l’autre et aussi de la région bruyante de faible masse. Le décalage mass-tR provoqué par l’ajout de l’étiquette hydrophobe facilite l’identification de l’échelle de masse et simplifie l’analyse des données pour la génération de séquences. De plus, l’ajout de l’étiquette hydrophobe peut aider à identifier la base terminale dans le brin en empêchant son fragment d’échelle correspondant d’être dans la région bruyante de faible masseR en raison de l’augmentation de la masse et de l’hydrophobie causée par l’étiquette, permettant ainsi l’identification de la séquence complète d’un ARN à partir d’une seule échelle ; Aucune lecture d’extrémité appariée n’est requise. En conséquence, nous avons déjà démontré le séquençage réussi d’un mélange complexe de jusqu’à 12 brins d’ARN distincts sans l’utilisation d’un algorithme de séquençage avancé9, ce qui ouvre la porte au séquençage MS de novo d’ARN contenant à la fois des nucléotides canoniques et modifiés et rend plus réalisable le séquençage d’échantillons d’ARN mixtes et plus complexes. En fait, en utilisant 2D-HELS MS Seq, nous avons même réussi à séquencer une population mixte d’échantillons d’ARNt10 et nous étendons activement son application à d’autres échantillons d’ARN complexes.
Pour faciliter le séquençage direct d’un plus large éventail d’échantillons d’ARN par 2D-HELS MS Seq, nous nous concentrerons ici sur les aspects techniques de cette approche de séquençage et couvrirons toutes les étapes essentielles nécessaires lors de l’application de la technique au séquençage direct d’échantillons d’ARN. Des exemples spécifiques seront utilisés pour illustrer la technique de séquençage, y compris des séquences d’ARN uniques synthétiques, des mélanges de plusieurs séquences d’ARN distinctes et des ARN modifiés contenant à la fois des nucléotides canoniques et modifiés tels que la pseudouridine (ψ) et la 5-méthylcytosine (m5C). Étant donné que les ARN contiennent tous des liaisons phosphodiester, tout type d’ARN peut être hydrolysé à l’acide pour générer une échelle de séquence idéale pour le séquençage 2D-HELS MS Seq dans des conditions optimales 8,9. Cependant, la détection de tous les fragments d’échelle d’un ARN donné dépend de l’instrument. Sur un LC-MS haute résolution standard (40K), la quantité de charge minimale pour le séquençage d’un échantillon d’ARN court purifié (<35 nt) est de 100 pmol par passage. Cependant, il faut plus de matériel (jusqu’à 400 pmol par échantillon d’ARN) lorsque des expériences supplémentaires doivent être menées (p. ex., pour distinguer les modifications de bases isomères qui partagent des masses identiques). Le protocole utilisé pour le séquençage du modèle d’ARN modifiés synthétiques sera également applicable au séquençage d’échantillons d’ARN plus larges, y compris des échantillons d’ARN biologiques avec des modifications de base inconnues. Cependant, une quantité d’échantillon encore plus importante, telle que 1000 pmol pour le séquençage de l’ARNt (~76 nt) à l’aide d’un instrument LC-MS standard, est nécessaire pour séquencer l’ARNt complet avec toutes les modifications, et un algorithme avancé doit être développé pour son séquençage de novo 10.