$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Per il sequenziamento diretto dell'RNA sono stati sviluppati metodi di sequenziamento basati sulla spettrometria di massa (MS), tra cui MS top-down e MS 1,2,3,4 in tandem. Tuttavia, le tecniche di frammentazione in situ per generare efficacemente scale di RNA di alta qualità negli spettrometri di massa attualmente non possono essere applicate al sequenziamento de novo 5,6. Inoltre, non è molto banale analizzare i tradizionali dati MS unidimensionali (1D) per il sequenziamento de novo anche di una sola sequenza di RNA purificata, e sarebbe ancora più impegnativo per il sequenziamento MS di campioni di RNA misti 7,8. Pertanto, è stato sviluppato un metodo di sequenziamento dell'RNA basato su cromatografia liquida (LC)-MS bidimensionale (2D), che incorpora la produzione di scale 2D per il tempo di ritenzione di massa (tR) per sostituire le scale di massa 1D, rendendo molto più facile l'identificazione dei componenti della scala necessari per il sequenziamento de novo degli RNA8. Tuttavia, il metodo di sequenziamento dell'RNA basato su LC-MS 2D è principalmente limitato all'RNA corto sintetico purificato, in quanto non è in grado di leggere una sequenza completa basata esclusivamente su una singola scala, ma deve basarsi su due scale adiacenti coesistenti (scale da 5' e 3')8. Più specificamente, questo approccio richiede letture bidirezionali di estremità accoppiate per la lettura di basi nucleotiche terminali nella regione di bassa massa8. L'aggiunta complessità della lettura paired-end fa sì che questo metodo sia insostenibile per il sequenziamento di miscele di RNA perché si crea confusione su quale frammento di ladder appartenga a quale ladder per i campioni sconosciuti.
Per superare le barriere sopra menzionate negli approcci di sequenziamento dell'RNA basati sulla SM e per ampliare tali applicazioni nel sequenziamento diretto dell'RNA, devono essere affrontate due questioni: 1) come generare una scala di massa di alta qualità che possa essere utilizzata per leggere una sequenza completa, dal primo nucleotide all'ultimo in un filamento di RNA, e 2) come identificare efficacemente ogni scala RNA/massa in un complesso set di dati MS. Insieme a una degradazione acida ben controllata, abbiamo sviluppato un nuovo metodo di sequenziamento introducendo una strategia di marcatura idrofobica (HELS) nella tecnica di sequenziamento basata su MS e abbiamo affrontato con successo questi due problemi aggiungendo un tag idrofobico all'estremità 5' e/o 3' degli RNA da sequenziare9. Questo metodo crea una scala di sequenza "ideale" dall'RNA: ogni frammento di scala deriva dalla scissione dell'RNA sito-specifica esclusivamente in corrispondenza di ogni legame fosfodiestere e la differenza di massa tra due frammenti di scala adiacenti è la massa esatta del nucleotide o della modifica nucleotidica in quella posizione 8,9,10. Questo è possibile perché includiamo una fase di idrolisi acida altamente controllata, che frammenta l'RNA, in media, una volta per molecola, prima di essere iniettato nello strumento. Di conseguenza, ogni prodotto del frammento di degradazione viene rilevato sullo spettrometro di massa e tutti i frammenti insieme formano una scala di sequenziamento 8,9,10. Questa nuova strategia consente la lettura completa di una sequenza di RNA da una singola scala di un filamento di RNA senza la lettura di estremità accoppiate dall'altra scala dell'RNA e consente inoltre il sequenziamento MS di miscele di RNA con più filamenti diversi che contengono modificazioni nucleotidiche combinatorie9. Aggiungendo un tag all'estremità 5' e/o 3' dell'RNA, i frammenti di scala marcati mostrano un ritardo significativo di tR, che può aiutare a distinguere le due scale di massa l'una dall'altra e anche dalla regione rumorosa di bassa massa. Lo spostamento di massa-tR causato dall'aggiunta del tag idrofobico facilita l'identificazione della scala di massa e semplifica l'analisi dei dati per la generazione della sequenza. Inoltre, l'aggiunta del tag idrofobico può aiutare a identificare la base terminale nel filamento impedendo che il suo corrispondente frammento di scala si trovi nella rumorosa regioneR a bassa massa-t a causa dell'aumento di massa e idrofobicità causato dal tag, consentendo così l'identificazione della sequenza completa di un RNA da una singola scala; Non sono necessarie letture paired-end. Di conseguenza, abbiamo precedentemente dimostrato il successo del sequenziamento di una miscela complessa di un massimo di 12 filamenti distinti di RNA senza l'uso di alcun algoritmo di sequenziamento avanzato9, che apre la porta al sequenziamento de novo MS di RNA contenente sia nucleotidi canonici che modificati e lo rende più fattibile per il sequenziamento di campioni di RNA misti e più complessi. Infatti, utilizzando 2D-HELS MS Seq, abbiamo persino sequenziato con successo una popolazione mista di campioni di tRNA10 e stiamo espandendo attivamente la sua applicazione ad altri campioni di RNA complessi.
Per facilitare il sequenziamento diretto di una gamma più ampia di campioni di RNA da parte di 2D-HELS MS, qui ci concentreremo sugli aspetti tecnici di questo approccio di sequenziamento e tratteremo tutti i passaggi essenziali necessari per l'applicazione della tecnica verso il sequenziamento diretto di campioni di RNA. Esempi specifici saranno utilizzati per illustrare la tecnica di sequenziamento, tra cui sequenze sintetiche di RNA singole, miscele di più sequenze di RNA distinte e RNA modificati contenenti sia nucleotidi canonici che modificati come la pseudouridina (ψ) e la 5-metilcitosina (m5C). Poiché tutti gli RNA contengono legami fosfodiestere, qualsiasi tipo di RNA può essere idrolizzato in acido per generare una scala di sequenza ideale per 2D-HELS MS Seq in condizioni ottimali 8,9. Tuttavia, il rilevamento di tutti i frammenti ladder di un dato RNA dipende dallo strumento. Su una LC-MS standard ad alta risoluzione (40K), la quantità minima di carico per il sequenziamento di un campione di RNA corto purificato (<35 nt) è di 100 pmol per corsa. Tuttavia, è necessario più materiale (fino a 400 pmol per campione di RNA) quando devono essere condotti ulteriori esperimenti (ad esempio, per distinguere le modifiche delle basi isomeriche che condividono masse identiche). Il protocollo utilizzato nel sequenziamento del modello di RNA modificato sintetico sarà applicabile anche al sequenziamento di campioni di RNA più ampi, compresi i campioni di RNA biologici con modifiche di base sconosciute. Tuttavia, è necessaria una quantità di campione ancora maggiore, come 1000 pmol per il sequenziamento del tRNA (~76 nt) utilizzando uno strumento LC-MS standard, per sequenziare il tRNA completo con tutte le modifiche, e deve essere sviluppato un algoritmo avanzato per il suo sequenziamento de novo 10.