November 7th, 2025
Este protocolo permite o controle de qualidade inicial para experimentos de RNA-seq para biólogos de laboratório úmido com experiência limitada em bioinformática.
Desenvolvemos ferramentas inovadoras de bioinformática para simplificar, automatizar e integrar a análise de dados de experimentos de alta produtividade. Utilizamos sequenciamento de alta produtividade, softwares avançados de bioinformática e uma infraestrutura computacional poderosa para possibilitar análises biológicas sistemáticas. Para começar, instale todos os pacotes R necessários usando o gerenciador de pacotes bioconductor.
Crie uma pasta fonte para organizar os arquivos de entrada da análise. Adicione a sequência genômica de referência no formato FASTA como ReferenceGenome. FÁ para esta pasta.
Adicione o arquivo de anotação do modelo gênico chamado ReferenceAnnotation. GTF para a mesma pasta. Opcionalmente, inclua a anotação do gene RRNA como um arquivo GTF chamado ReferenceRRNA.gtf.
Coloque todas as leituras de sequenciamento como arquivos FASTQ comprimidos na pasta chamada Reads. Certifique-se de que cada arquivo siga o formato de nomeação. Depois, defina os parâmetros de análise de acordo com o método de sequenciamento utilizado.
Para mapear a qualidade da sequência, use o pacote Rsubread para construir um índice do genoma de referência a partir do arquivo FASTA do genoma. Para cada amostra, use a função alinhar para iterar e alinhar as leituras de sequenciamento ao genoma de referência. Armazene os arquivos de alinhamento resultantes na pasta de saída no formato bam.
Agora use a função de contagens de características para contar leituras mapeadas para cada gene. Os arquivos de anotação devem estar no formato GTF. Certifique-se de que apenas as leituras com uma única correspondência ao genoma sejam contadas.
Conte as leituras que mapeiam para genes RRNA usando a função de contagem de características com o arquivo GTF do gene RRNA. Permita que leituras multimapeadas sejam incluídas nessa contagem. Recupere as estatísticas de atribuição de leitura geradas pela função de contagem de características para cada amostra.
Essas estatísticas incluem o número de leituras categorizadas como atribuídas, não mapeadas, multi-mapeadas e outras. Colete as estatísticas para as atribuições de genes RRNA separadamente. Depois, gerar gráficos de barras, visualizando as estatísticas de mapeamento de leitura das etapas anteriores.
Agrupe genes com base no número de leituras atribuídas a eles. Plote os resultados da classificação como um gráfico de barras. O exemplo S2R1 mostrou um número baixo de leituras tanto antes quanto depois do corte.
A contagem de leituras cortadas da amostra S2R2 foi visivelmente reduzida em comparação com sua contagem bruta, indicando a remoção de leituras de baixa qualidade durante o corte. O mapeamento identificou problemas nas tarefas de leitura. A amostra S2R3 apresentou um alto número de leituras multimapeadas e uma quantidade elevada de leituras de RNA ribossomal.
Uma grande fração das leituras na amostra S2R4 não correspondeu ao genoma de referência, sugerindo contaminação com sequências de um organismo não alvo. As amostras S2R1 a S2R4 mostraram menos genes com mais de 100 leituras atribuídas. No mapa de calor de correlação, a amostra S2R5 agrupou-se com as réplicas da amostra S1 e a amostra S1R5 agrupou-se com as réplicas da amostra S2, indicando um provável erro de rotulagem de replicação.
Abordamos a falta de controle de qualidade para RNA-Seq, garantindo uma avaliação confiável dos dados antes da análise posterior da expressão gênica. Nossa ferramenta integra múltiplos textos de qualidade, oferecendo avaliação de RNA-Seq acessível, automatizada e reprodutível para biólogos. Nossa ferramenta permite explorar como a qualidade do RNA-Seq influencia a interpretação biológica, abrindo caminho para transcriptômicas transparentes e reprodutíveis.
Este protocolo permite o controle de qualidade inicial para experimentos de RNA-seq para biólogos de laboratório com experiência limitada em bioinformática. Ele integra ferramentas automatizadas para análise biológica sistemática, garantindo uma avaliação confiável dos dados antes da análise de expressão gênica.
Robust quality control in bulk RNA-seq experiments is essential for ensuring data integrity and reproducibility across discovery and translational research pipelines. The Rup pipeline provides a standardized, accessible framework for early detection of sequencing and sample quality issues, directly impacting the reliability of downstream gene expression analyses. By enabling wet-lab biologists to systematically assess data usability, Rup strengthens predictive confidence and supports risk-adjusted decision-making in biopharma R&D portfolios.
Rup integrates at the interface of data generation and downstream analysis, bridging early discovery, screening, and translational research stages.