$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Métodos de sequenciamento baseados em espectrometria de massa (MS), incluindo MS de cima para baixo e MS em tandem 1,2,3,4, foram desenvolvidos para sequenciamento direto de RNA. No entanto, técnicas de fragmentação in situ para gerar efetivamente escadas de RNA de alta qualidade em espectrômetros de massa atualmente não podem ser aplicadas ao sequenciamento de novo 5,6. Além disso, não é muito trivial analisar os dados tradicionais de MS unidimensional (1D) para sequenciamento de novo de até mesmo uma sequência de RNA purificada, e seria ainda mais desafiador para o sequenciamento de MS de amostras mistas de RNA 7,8. Portanto, um método de sequenciamento de RNA baseado em cromatografia líquida (LC)-MS bidimensional (2D) foi desenvolvido, incorporando a produção de escadas de tempo de retenção de massa 2D (tR) para substituir as escadas de massa 1D, tornando muito mais fácil identificar os componentes da escada necessários para o sequenciamento de novo de RNAs8. No entanto, o método de sequenciamento de RNA baseado em LC-MS 2D é limitado principalmente ao RNA curto sintético purificado, pois não pode ler uma sequência completa baseada apenas em uma única escada, mas deve contar com duas escadas adjacentes coexistentes (escadas de 5' e 3')8. Mais especificamente, essa abordagem requer leituras bidirecionais de extremidade emparelhada para leitura de nucleobases terminais na região de baixa massa8. A complexidade adicional da leitura de extremidade emparelhada resulta neste método sendo insustentável para o sequenciamento de misturas de RNA porque a confusão é levantada sobre qual fragmento de escada pertence a qual escada para as amostras desconhecidas.
Para superar as barreiras acima mencionadas nas abordagens de sequenciamento de RNA baseadas em MS e ampliar essas aplicações no sequenciamento direto de RNA, duas questões devem ser abordadas: 1) como gerar uma escada de massa de alta qualidade que possa ser usada para ler uma sequência completa, do primeiro nucleotídeo ao último em uma fita de RNA, e 2) como identificar efetivamente cada escada de RNA/massa em um conjunto de dados complexo de MS. Juntamente com a degradação ácida bem controlada, desenvolvemos um novo método de sequenciamento introduzindo uma estratégia de marcação final hidrofóbica (HELS) na técnica de sequenciamento baseada em MS e abordamos com sucesso esses dois problemas adicionando uma etiqueta hidrofóbica nas extremidades 5 '- e / ou 3' dos RNAs a serem sequenciados9. Este método cria uma escada de sequência "ideal" a partir do RNA - cada fragmento de escada deriva da clivagem de RNA específica do local exclusivamente em cada ligação fosfodiéster, e a diferença de massa entre dois fragmentos de escada adjacentes é a massa exata do nucleotídeo ou modificação de nucleotídeo nessa posição 8,9,10. Isso é possível porque incluímos uma etapa de hidrólise ácida altamente controlada, que fragmenta o RNA, em média, uma vez por molécula, antes de ser injetado no instrumento. Como resultado, cada produto de fragmento de degradação é detectado no espectrômetro de massa e todos os fragmentos juntos formam uma escada de sequenciamento 8,9,10. Essa nova estratégia permite a leitura completa de uma sequência de RNA a partir de uma única escada de uma fita de RNA sem leitura de extremidade emparelhada da outra escada do RNA e, adicionalmente, permite o sequenciamento MS de misturas de RNA com várias fitas diferentes que contêm modificações combinatórias de nucleotídeos9. Ao adicionar uma etiqueta na extremidade 5 '- e / ou 3' do RNA, os fragmentos de escada marcados exibem um atraso significativo de tR, o que pode ajudar a distinguir as duas escadas de massa uma da outra e também da região ruidosa de baixa massa. O deslocamento de massat R causado pela adição da etiqueta hidrofóbica facilita a identificação da escada de massa e simplifica a análise de dados para geração de sequências. Além disso, a adição da etiqueta hidrofóbica pode ajudar a identificar a base terminal na fita, evitando que seu fragmento de escada correspondente esteja na regiãoR de baixa massa e ruído devido ao aumento de massa e hidrofobicidade causado pela marcação, permitindo assim a identificação da sequência completa de um RNA a partir de uma única escada; Não são necessárias leituras de extremidade emparelhada. Como resultado, demonstramos anteriormente o sequenciamento bem-sucedido de uma mistura complexa de até 12 fitas distintas de RNA sem o uso de nenhum algoritmo de sequenciamento avançado9, o que abre a porta para o sequenciamento de novo MS de RNA contendo nucleotídeos canônicos e modificados e torna mais viável o sequenciamento de amostras de RNA mistas e mais complexas. De fato, usando 2D-HELS MS Seq, sequenciamos com sucesso uma população mista de amostras de tRNA10 e estamos expandindo ativamente sua aplicação para outras amostras complexas de RNA.
Para facilitar o sequenciamento 2D-HELS MS Seq para sequenciar diretamente uma gama mais ampla de amostras de RNA, aqui nos concentraremos nos aspectos técnicos dessa abordagem de sequenciamento e cobriremos todas as etapas essenciais necessárias ao aplicar a técnica para o sequenciamento direto de amostras de RNA. Exemplos específicos serão usados para ilustrar a técnica de sequenciamento, incluindo sequências sintéticas de RNA único, misturas de várias sequências de RNA distintas e RNAs modificados contendo nucleotídeos canônicos e modificados, como pseudouridina (ψ) e 5-metilcitosina (m5C). Como todos os RNAs contêm ligações fosfodiéster, qualquer tipo de RNA pode ser hidrolisado com ácido para gerar uma escada de sequência ideal para 2D-HELS MS Seq em condições ideais 8,9. No entanto, a detecção de todos os fragmentos de escada de um determinado RNA depende do instrumento. Em um LC-MS padrão de alta resolução (40K), a quantidade mínima de carga para sequenciar uma amostra de RNA curto purificado (<35 nt) é de 100 pmol por corrida. No entanto, mais material é necessário (até 400 pmol por amostra de RNA) quando experimentos adicionais devem ser conduzidos (por exemplo, para distinguir modificações de bases isoméricas que compartilham massas idênticas). O protocolo usado no sequenciamento do modelo de RNAs modificados sintéticos também será aplicável ao sequenciamento de amostras de RNA mais amplas, incluindo amostras de RNA biológico com modificações de base desconhecidas. No entanto, uma quantidade de amostra ainda maior, como 1000 pmol para sequenciamento de tRNA (~ 76 nt) usando um instrumento LC-MS padrão, é necessária para sequenciar o tRNA completo com todas as modificações, e um algoritmo avançado deve ser desenvolvido para seu sequenciamento de novo 10.