É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de método

Um protocolo reproduzível baseado em seurat para análise de sequenciamento de RNA de célula única em células T CD4+ mononucleares do sangue periférico durante a reinfecção da malária

106 visualizações

DOI:

10.3791/70858

31 de julho de 2026

Neste artigo

Resumo

Aqui, apresentamos um protocolo reprodutível baseado em Seurat para a análise de dados de sequenciamento de RNA unicelular provenientes de células mononucleares CD4⁺ do sangue periférico, a fim de caracterizar a heterogeneidade transcricional e os programas imunológicos funcionais durante a reinfecção por malária. Esse protocolo permite a identificação, comparação e interpretação biológica consistente dos estados dinâmicos das células T CD4⁺ e das respostas imunes entre condições.

Resumo

Aqui, apresentamos um protocolo reprodutível baseado em Seurat para analisar dados de sequenciamento de RNA de célula T CD4⁺ em células T em PBMC em pontos de tempo de reinfecção por malária. Este protocolo demonstra um fluxo de trabalho reprodutível baseado em Seurat para analisar dados de scRNA-seq CD4⁺ de células T CD4⁺ PBMC em pontos de tempo de reinfecção por malária, usando conjuntos de dados públicos representativos para demonstrar sua aplicação: um conjunto de dados específico de células T CD4⁺ TCR-transgênico (GSE233703) e um conjunto de dados policlonal CD4⁺ de células T comparando pontos de tempo associados à reinfecção (GSE233713; D27₍₃₎ versus D30). O fluxo de trabalho inclui pré-processamento padronizado, integração, clusterização e análises transcriptômicas downstream dentro de uma estrutura computacional unificada. O método permite o cálculo sistemático dos escores de módulos para programas imunes e CD4⁺ de células T predefinidas, identificação de genes marcadores específicos de cluster, análise de expressão diferencial resolvida por pontos de tempo e enriquecimento da Ontologia Genética a jusante e das vias KEGG. A aplicação desse fluxo de trabalho identifica estados funcionais distintos das células T CD4⁺ e revela mudanças transcricionais dinâmicas ao longo dos tempos de reinfecção por malária. O protocolo gera resultados padronizados de visualização e tabulados, além de fornecer orientações práticas sobre seleção de parâmetros e solução de problemas, facilitando análises consistentes e reprodutíveis de conjuntos de dados de scRNA-seq de células T CD4⁺ em malária e contextos imunológicos relacionados. Esse protocolo permite análises reprodutíveis e biologicamente interpretáveis das respostas imunes e pode ser aplicado a conjuntos de dados semelhantes de células únicas em pesquisas imunológicas.

Introdução

A malária continua sendo um grande fardo global de saúde, com infecções repetidas moldando a imunidade do hospedeiro de maneiras complexas e incompletamentecompreendidas 1. As células T CD4⁺ desempenham um papel central nas respostas imunes antimaláricas ao coordenar a produção de citocinas efetoras, apoiar a ajuda das células B e regular ainflamação 2,3. Durante a reinfecção por malária, as células T CD4⁺ passam por reprogramação transcricional dinâmica, refletindo mudanças entre estados efetor, regulatório, de memória, proliferativo e exausto que influenciam tanto o controle parasitária quanto aimunopatologia 4,5. Resolver com precisão essa heterogeneidade é essencial para entender a proteção imunológica, a disfunção imunológica e a durabilidade da imunidade adquirida naturalmente ou induzida por vacina contra a infecção por Plasmodium. Aqui, apresentamos um protocolo reprodutível baseado em Seurat para analisar dados de scRNA-seq de células T CD4⁺ em pontos de tempo de reinfecção por malária.

O sequenciamento de RNA unicelular (scRNA-seq) permite a caracterização em alta resolução da heterogeneidade imune e identificou subconjuntos de células T CD4⁺ responsivas a parasitas, programas de exaustão e redes regulatórias na malária 6,7,8,9. No entanto, a variabilidade analítica no controle de qualidade, normalização, agrupamento e integração pode limitar a reprodutibilidade e complicar comparações de estudoscruzados 10,11. No entanto, falta um fluxo de trabalho padronizado e biologicamente guiado, especificamente otimizado para analisar a dinâmica das células T CD4⁺ durante a reinfecção por malária.

Estruturas computacionais existentes para análise scRNA-seq, incluindo Seurat e Scanpy, fornecem conjuntos abrangentes de ferramentas para pré-processamento, clustering e interpretação a jusante de dados de célulaúnica 12,13,14. Seurat, implementado em R, oferece fluxos de trabalho fortemente integrados para normalização, integração de dados e visualização, incluindo abordagens estabilizadoras de variância, como SCTransform, que melhoram a detecção de sinais em conjuntos de dados imunesheterogêneos 13. O Scanpy, implementado em Python, oferece soluções escaláveis otimizadas para grandes conjuntos de dados e uso eficiente da memória, tornando-o particularmente adequado para análises de alta taxa ou baseadas emnuvem 12,14. Apesar desses avanços, ainda existe a necessidade de fluxos de trabalho padronizados e reproduzíveis que abordem explicitamente questões biológicas em contextos de infecção, mantendo transparência, adaptabilidade e consistência entre os conjuntos de dados. O protocolo atual aborda essa lacuna combinando a robustez do pré-processamento baseado em Seurat com uma interpretação biológica estruturada, adaptada às respostas das células T CD4⁺ durante a reinfecção da malária. Comparado aos fluxos de trabalho de uso geral existentes, este protocolo enfatiza a reprodutibilidade, seleção de parâmetros biologicamente informada e análise consistente entre pontos de tempo, adaptada a modelos de infecção.

Uma característica chave deste protocolo é sua ênfase na reprodutibilidade e usabilidade prática. Os limiares de controle de qualidade não são fixos, mas são derivados usando abordagens adaptativas aos dados baseadas no desvio absoluto mediano, permitindo que limiares para complexidade de transcrição, profundidade de sequenciamento e conteúdo mitocondrial escalem com distribuições específicas de cada conjunto. Esse design torna o fluxo de trabalho aplicável a conjuntos de dados de tamanhos variados, normalmente variando de vários milhares a dezenas de milhares de células, e em uma ampla gama de profundidades de sequenciamento comumente encontradas em experimentos de scRNA-seq baseados em gotas. As orientações incorporadas ao fluxo de trabalho apoiam a seleção adequada de parâmetros para redução de dimensionalidade, resolução de clustering e integração, garantindo que as análises permaneçam biologicamente significativas e tecnicamente robustas. No entanto, o fluxo de trabalho depende da qualidade dos dados e da profundidade do sequenciamento, podendo exigir ajustes para conjuntos de dados com efeitos extremos de escarabidão ou lote.

Este protocolo é projetado para usuários intermediários a avançados com familiaridade básica em análise R e célula única, permanecendo acessível a iniciantes motivados por meio de sua implementação estruturada, passo a passo e saídas totalmente reprodutíveis. O fluxo de trabalho gera tabelas e figuras padronizadas em cada etapa, incluindo resumos de controle de qualidade, resultados de clustering, resultados de expressões diferenciais e análises de enriquecimento, facilitando assim a transparência, validação e reutilização em contextos colaborativos ou de múltiplos estudos. Esse protocolo é particularmente adequado para estudos que investigam a heterogeneidade imunológica entre pontos de tempo ou condições em pesquisas de infecção e imunologia.

O método oferece um fluxo de trabalho reprodutível e completo baseado em Seurat para análise de scRNA-seq de células T CD4⁺ em pontos de tempo de reinfecção por malária. Ele integra controle de qualidade adaptativo, estabilização de variância, redução dimensional, agrupamento e integração multiamostra quandoapropriado 13,15. Para melhorar a interpretabilidade biológica, o fluxo de trabalho incorpora a pontuação dos módulos de genes imunes e CD4⁺ do subconjunto de células T para quantificar programas funcionais incluindo Th1, Tfh, Tr1, Treg, memória central, memória efetor, proliferação, citotoxicidade e exaustão 16,17,18. Identificação complementar de marcadores de cluster, análise de expressão diferencial por pontos de tempo e enriquecimento de vias usando bases de dados Gene Ontology e KEGG estão incluídas para apoiar anotações robustas e comparação dos estados das célulasT 19,20. Embora demonstrado usando conjuntos de dados públicos de Plasmodium scRNA-seq, esse protocolo é amplamente aplicável a outros modelos de reinfecção por malária e perturbações imunológicas onde é necessária análise reprodutível e interpretável de células T CD4⁺. No geral, esse protocolo fornece uma estrutura reprodutível e biologicamente interpretável para análise de células individuais das respostas das células T CD4⁺, apoiando uma investigação robusta da dinâmica imune na malária e sistemas relacionados.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Declaração de ética:

Todos os dados utilizados neste estudo foram obtidos a partir de conjuntos de dados públicos (GSE233703 e GSE233713). Os estudos originais estavam em conformidade com diretrizes institucionais e éticas para experimentação animal. Este estudo envolveu análise secundária de bioinformática de conjuntos de dados de sequenciamento de RNA de célula única disponíveis publicamente e desidentificados, obtidos do repositório Gene Expression Omnibus (GEO) (GSE233703 e GSE233713). Nenhum novo participante humano, amostras clínicas ou informações identificáveis de pacientes foram envolvidas neste estudo. De acordo com as diretrizes institucionais e nacionais para pesquisas envolvendo conjuntos de dados anonimizados publicamente disponíveis, não eram necessárias aprovações éticas adicionais nem consentimento informado para esta análise bioinformática. Os estudos originais associados a esses conjuntos de dados foram conduzidos de acordo com os padrões éticos institucionais relevantes e as diretrizes aplicáveis para pesquisa biomédica.

1. Fluxo de trabalho de análise de scRNA-seq CD4⁺ baseado em seurat reproduzível em seurat para GSE233703 e GSE233713

NOTA: Este fluxo de trabalho é fornecido como Arquivo Suplementar S1. Consulte também um esquema que oferece uma visão geral de todo o fluxo de trabalho (Figura 1).

  1. Defina o escopo e os usuários pretendidos antes de iniciar o protocolo
  2. Defina os usuários pretendidos
    1. Use este protocolo se o usuário tiver familiaridade intermediária a avançada com análise de sequenciamento de RNA de célula única (scRNA-seq).
    2. Aplique esse fluxo de trabalho a conjuntos de dados de células T CD4⁺ do baço murino gerados no formato matricial do estilo 10x. Use a estrutura por etapas e as saídas esperadas para verificar cada etapa antes de prosseguir.
      NOTA: Garanta práticas adequadas de tratamento de dados e armazenamento seguro ao trabalhar com grandes conjuntos de dados de sequenciamento.
  3. Defina scRNA-seq
    1. Trate o sequenciamento de RNA de célula única (scRNA-seq) como um método transcriptômico²¹ que quantifica a expressão gênica em células individuais.
    2. Use scRNA-seq para identificar estados celulares discretos, populações de transição e programas imunológicos heterogêneos dentro de tecidos complexos.
  4. Preparar os requisitos de software e pacotes
  5. Instale o software central
    1. Instale o R 4.2 ou posterior.
    2. Abra a interface do RStudio. Defina o diretório de trabalho usando setwd().
    3. Execute scripts sequencialmente usando a função source(). Registre as versões exatas do R, RStudio e do sistema operacional nas notas do projeto.
  6. Instalar pacotes R
    1. Instale os pacotes CRAN necessários: Seurat, Matrix, tidyverse, patchwork, pheatmap, RColorBrewer, cluster, glmGamPoi e ggplot2.
    2. Instale os pacotes Bioconductor necessários: clusterProfiler, org. Mm.eg.db, enrichplot e DESeq2.
    3. Instale pacotes opcionais somente se necessário: DoubletFinder para remoção de doublets e monocle3 para análise de trajetória. Carregue todos os pacotes necessários no início da sessão de análise.
  7. Versões em discos
    1. Salve as informações de pacotes e sessões ao final do fluxo de trabalho usando sessionInfo() ou uma função equivalente.
    2. Relate explicitamente os componentes-chave de análise no manuscrito, incluindo a versão R, versão Seurat, versão DESeq2 e versão clusterProfer.
  8. Execute comandos de instalação de exemplo mencionados no arquivo suplementar 2
  9. Confirme os requisitos de hardware e armazenamento
  10. Confirme os recursos mínimos
    1. Use uma estação de trabalho com pelo menos 16 GB de RAM, 4 núcleos de CPU e 20 GB de espaço livre em disco para análise rotineira de conjuntos de dados contendo de vários milhares a dezenas de milhares de células.
  11. Confirme os recursos recomendados
    1. Use 32 GB de RAM ou mais para análises integradas, plotagem repetida ou detecção opcional de duplos.
    2. Aumente future.globals.maxSize se objetos grandes ou conjuntos de dados integrados produzirem erros relacionados à memória.
    3. Aplicar exemplo de configuração de memória
  12. Execute os seguintes comandos para definir as opções de memória mencionadas no arquivo suplementar 2

2. Criar a estrutura do projeto

  1. Crie o diretório raiz do projeto
    1. Crie um diretório de projetos para a análise.
    2. Crie subdiretórios chamados data/, script/ e results_spleen_cd4/.
  2. Uso da estrutura padronizada de saída
    1. Certifique-se de que o fluxo de trabalho escreva a saída nos seguintes diretórios:
      results_spleen_cd4/GSE233703/fig/
      results_spleen_cd4/GSE233703/mesas/
      results_spleen_cd4/GSE233703/RDS/
      results_spleen_cd4/GSE233713/fig/
      results_spleen_cd4/GSE233713/mesas/
      results_spleen_cd4/GSE233713/rds/
      results_spleen_cd4/post_markers/
  3. Use nomes consistentes de arquivos
    1. Renomeie os arquivos de entrada GEO para corresponder aos caminhos esperados pelo script.
    2. Use os seguintes nomes exatos de arquivos:
      data/GSE233703_matrix.mtx.gz
      data/GSE233703_genes.tsv.gz
      data/GSE233703_barcodes.tsv.gz
      data/GSE233713_d27_3_matrix.mtx.gz
      dados/GSE233713_d27_3_features.tsv.gz
      data/GSE233713_d27_3_barcodes.tsv.gz
      data/GSE233713_d30_matrix.mtx.gz
      data/GSE233713_d30_features.tsv.gz
      data/GSE233713_d30_barcodes.tsv.gz
    3. Nomeie os arquivos de metadados opcionais da seguinte forma:
      data/GSE233703_cell_metadata.csv
      data/GSE233713_cell_metadata.csv
  4. Confirmar os requisitos de metadados
    1. Confirme que cada arquivo de metadados contém uma coluna de código de barras. Adicione colunas opcionais como exemplo, ponto de tempo e replique quando disponível.
    2. Use correspondências exatas de códigos de barras entre metadados e matrizes de contagem.
      Atenção: Confirme que existem trios de matrizes e arquivos de metadados nos caminhos esperados antes de iniciar a importação.

3. Importar matrizes de contagem e validar a integridade da entrada

  1. Leia matrizes no estilo 10x
    1. Leia cada arquivo matrix.mtx.gz como uma matriz esparsa.
    2. Leia o arquivo de características (ou genes) correspondente e o arquivo de código de barras como tabelas delimitadas por tabulação.
    3. Atribua símbolos de genes às linhas da matriz usando a segunda coluna do arquivo de features quando disponível. Impor símbolos genéticos únicos usando make.unique().
    4. Atribua identificadores de código de barras às colunas da matriz.'
  2. Executar a função de importação de exemplo
    1. Execute o código mencionado no Arquivo Suplementar 2, para importar a matriz e atribuir identificadores.
  3. Validar a integridade da matriz
    1. Verifique se o número de linhas da matriz é igual ao número de características. Verifique se o número de colunas matriciais é igual ao número de códigos de barras.
    2. Pare o fluxo de trabalho se for detectado algum descompasso.
      NOTA: Se forem detectadas incompatibilidades, verifique a integridade do arquivo e assegure o alinhamento correto dos arquivos de características e códigos de barras antes de executar novamente a etapa.
      Checkpoint: Prossiga somente se as contagens de linhas corresponderem a recursos e as contagens de colunas corresponderem a códigos de barras.

4. Definir painéis de marcadores e módulos

  1. Defina painéis de células T CD4⁺ relevantes para malária
    1. Defina painéis gênicos nomeados para: Th1, Tfh, Tr1, Treg, Tcm, Tem, Exaustão, Proliferação, Citotóxico, Activation_early, Interferon_response, Immune_regulation
    2. Armazene esses painéis em uma lista R nomeada para pontuação de módulos a jusante.
  2. Execute o código R mencionado no Arquivo Suplementar 2 para definir painéis de genes.
  3. Defina genes de validação de marcadores
    1. Defina um painel de validação separado contendo genes marcadores canônicos como Foxp3, Bcl6, Cxcr5, Il21, Ifng, Ctla4, Pdcd1, Lag3, Tbx21, Tcf7 e Lef1.

5. Criar objetos Seurat e calcular métricas de controle de qualidade

  1. Inicializar objetos Seurat
    1. Crie um objeto Seurat para cada conjunto de dados usando min.cells = 3 e min.features = 0. Não imponha cortes arbitrários de recursos na importação.
    2. Adicione metadados de conjuntos de dados, amostras e pontos de tempo. Muna metadados opcionais usando correspondência de código de barras.
  2. Execute exemplo de inicialização de objeto Seurat
    1. Execute o código R mencionado no arquivo suplementar 2 para criar um objeto Seurat e atribuir metadados.
  3. Calcular métricas de controle de qualidade
    1. Calcule a fração do transcrito mitocondrial usando o prefixo murino ^mt-.
    2. Quantifique as seguintes métricas
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. Execute o código de exemplo mencionado no arquivo suplementar 2.
  5. Visualize o controle de qualidade pré-filtro
    1. Gere gráficos de violino para nFeature_RNA, nCount_RNA e percent.mt. Gerar gráficos de dispersão de características para nCount_RNA versus nFeature_RNA e nCount_RNA versus percent.mt.
    2. Salve figuras pré-filtro usando nomes padronizados como QC_pre_filter_AllCells_vln.png e QC_pre_filter_AllCells_scatter.png.
      Atenção: Espere distribuições amplas de pré-filtro com caudas de baixa qualidade e possíveis outliers de alta contagem.

6. Derivar limiares adaptativos de QC e filtrar células de baixa qualidade

  1. Derivar limiares específicos de cada conjunto de dados
    1. Transformada logarítmica nFeature_RNA + 1 e nCount_RNA + 1. Calcule a mediana e a mediana do desvio absoluto (MAD) para ambas as variáveis transformadas.
    2. Defina os seguintes limiar:
      min_features = 10^(mediana - 3 × MAD) - 1
      max_features = 10^(mediana + 3 × MAD) - 1
      min_counts = 10^(mediana - 3 × MAD) - 1
      max_counts = 10^(mediana + 3 × MAD) – 1
    3. Defina o limiar mitocondrial como o 95º percentil de percent.mt mais 3 × DMA, restrito entre 5% e 20%.
    4. Certifique-se de que dataset_id, sample_id e out_dir estejam corretamente especificados antes de executar a função.
      qc_thr <- derive_qc_thresholds(seu, dataset_id = "GSE233703", sample_id = "AllCells", out_dir = "results_spleen_cd4/GSE233703")
  2. Aplicar filtragem
    1. Reter células que atendam a todos os critérios adaptativos:
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. Execute o código de exemplo mencionado no arquivo suplementar 2.
  3. Salvar as saídas de filtragem
    1. Salve QC_thresholds_*.csv e cell_counts_summary_*.csv.
      PONTO DE PAUSA: Salve as saídas intermediárias e retome a análise desta etapa, se necessário.
    2. Gerar e salvar os diagramas de violino e scatter de controle de qualidade pós-filtro.
      Checkpoint: Espere distribuições pós-filtro mais apertadas, remoção de células de baixa complexidade e redução de outliers extremos.

7. Normalizar dados e realizar PCA

  1. Normalizar e estabilizar por variância
    1. Normalize o ensaio de RNA antes da marcação do ciclo celular. Execute a pontuação do ciclo celular se ativada. Use SCTransform() para estabilização de variância.
    2. Regresse o conteúdo mitocondrial apenas se for biologicamente justificado e explicitamente habilitado.
    3. Regresse as pontuações do ciclo celular apenas se necessário para o desenho do estudo.
  2. Execute normalização de exemplos conforme mencionado no arquivo suplementar 2.
  3. Defina valores de parâmetros
    1. Use n_variable_features = 3000.
    2. Use dims_max_for_pca = 50.
    3. Declare esses valores explicitamente no manuscrito.
  4. Execute PCA e selecione os componentes principais
    1. Rodar PCA no ensaio normalizado. Confirme a execução bem-sucedida da PCA inspecionando a variância explicada e as cargas de componentes principais.
    2. Calcule a variância explicada por cada componente principal.
  5. Selecione os PCs usando os três critérios:
    1. Manter os PCs explicando pelo menos 1% de variância,
    2. Garanta que a variação acumulada atinja aproximadamente 80 %,
    3. Limite a seleção final entre 10 e 40 PCs.
    4. Salve PCA_variance_table_*.csv, PCA_selection_rationale_*.csv e PCA_Elbow_*.png.
  6. Executar exemplo de PCA
    1. Exemplo mencionado no arquivo suplementar 2.
      Checkpoint: Espere um gráfico de cotovelo com uma diminuição visível no ganho de variância marginal após o corte selecionado.

8. Construir vizinhanças, selecionar resolução e agrupar células

  1. Estrutura de grafo de construção
    1. Construa um grafo compartilhado de vizinhos mais próximos usando os PCs selecionados.
    2. Execute um cluster inicial de baixa resolução se a detecção de doublet exigir etiquetas de cluster.
  2. Opcionalmente, remova os doublets
    1. Execute o DoubletFinder apenas se estiver instalado e compatível.
      NOTA: Realize a detecção de duplos apenas para conjuntos de dados com alta contagem de células onde se esperam artefatos de múltiplos.
    2. Recalcular a normalização e a ACP após a remoção do doublet.
  3. Selecione resolução de clustering
    1. Avaliar as resoluções 0.2, 0.4, 0.6, 0.8, 1.0 e 1.2.8.3.2
    2. Calcule a largura média da silhueta para cada resolução testada. Selecione a resolução com a maior pontuação de silhueta entre as soluções com pelo menos dois clusters.
    3. Salve resolution_sweep_*.csv, resolution_selection_rationale_*.csv e resolution_sweep_*.png.
  4. Execute seleção de resolução de exemplos executando o código mencionado no arquivo suplementar 2
  5. Rodar UMAP e clustering final.
    1. Execute o UMAP usando os PCs selecionados.
    2. Reconstrua o grafo do vizinho mais próximo. Agrupe células usando a resolução selecionada.
    3. Salve os gráficos UMAP rotulados por cluster e agrupados por amostra ou ponto de tempo. Execute o código a seguir mencionado no arquivo suplementar 2.
      Atenção: Espere separação estável em clusters e estrutura UMAP interpretável consistente com estados imunes principais.

9. Realizar integração baseada em SCT para GSE233713

  1. Prepare objetos separados
    1. Crie objetos Seurat separados para D27_3 e D30.
    2. Aplique controle de qualidade e filtragem independentemente a cada amostra. Normalize cada amostra separadamente com SCTransform().
  2. Justificar a integração
    1. Use integração baseada em SCT para reduzir diferenças técnicas entre pontos de tempo, preservando a estrutura biológica compartilhada.
    2. Não presuma que a integração é automaticamente benéfica. Valide explicitamente.
  3. Integrar amostras
    1. Selecione os recursos de integração usando o SelectIntegrationFeatures(). Prepare objetos com PrepSCTIntegration().
    2. Encontre âncoras com FindIntegrationAnchors(normalization.method = "SCT"). Integrar conjuntos de dados com IntegrateData(normalization.method = "SCT").
  4. Execute integração de exemplo mencionada no arquivo suplementar 2
  5. Validar a integração
    1. Gerar gráficos UMAP pré-integração e pós-integração agrupados por ponto de tempo. Interprete a melhoria na mistura de células entre pontos de tempo como evidência de integração bem-sucedida.
    2. Calcule a mistura de vizinhos antes e depois da integração. Calcule a composição do cluster por ponto de tempo e gere gráficos de composição empilhados.
    3. Salve as seguintes saídas:
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      Atenção: Espere redução da segregação por pontos de tempo após a integração, maior mistura de vizinhos e contribuição múltipla para a maioria dos aglomerados sem perda completa de estrutura biologicamente significativa.

10. Anotar clusters e validar a estrutura dos marcadores

  1. Pontuar módulos relevantes para malária
    1. Execute o AddModuleScore() para os painéis pré-definidos de células T CD4⁺ da malária.
    2. Salve os meios e rankings de módulos em nível de cluster.
  2. Executar exemplos de pontuação de módulos mencionada no arquivo suplementar 2
  3. Atribuir rótulos de cluster previstos
    1. Atribua o módulo mais bem classificado a cada cluster como o rótulo previsto.
    2. Salve:
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. Validar clusters com marcadores canônicos
    1. Execute DotPlots e FeaturePlots de validação de marcadores usando o painel de marcadores canônicos.
    2. Salve:
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      Atenção: Espere expressão concordante de múltiplos genes canônicos por estado funcional, não sinais isolados de um único gene.

11. Identificar marcadores e realizar expressões diferenciais.

  1. Encontre marcadores de agrupamento
    1. Execute FindAllMarkers() usando apenas marcadores positivos.
    2. Salve markers_all_clusters_*.csv.
  2. Execute o código mencionado no arquivo suplementar para executar a identificação do marcador de exemplo
  3. Use expressão diferencial consciente de replicações quando disponível
    1. Verifique se metadados de réplica válidos estão disponíveis. Se houver réplicas disponíveis, agregue as contagens por réplica e condição e execute pseudobulk DE com DESeq2.
    2. Salve DE_pseudobulk_*.
  4. Use expressão diferencial exploratória em nível celular quando as réplicas estão ausentes
    1. Se os metadados replicados estiverem ausentes ou insuficientes, execute DE de célula única como análise exploratória.
    2. Salve DE_WARNING_* para documentar o status exploratório. Salve os resultados exploratórios como DE_exploratory_celllevel_*.
  5. Gerar saídas globais diferenciais de expressões
    1. Crie gráficos de vulcão para resultados de DE e salve Volcano_*.
    2. Salve resultados significativos de DE como tabelas filtradas.
  6. Gerar saídas de enriquecimento funcional
    1. Execute o enriquecimento do Processo Biológico GO e economize GO_BP_*. Execute o enriquecimento KEGG e salve KEGG_*.
    2. Rode o GSEA usando fold-changes ranqueados log2 e salve GSEA_GO_*. Salve os gráficos de barras e pontos correspondentes.
  7. Gerar saídas diferenciais específicas de cluster
    1. Rodar DE dentro de cada cluster entre os pontos de tempo.
    2. Salve DE_cluster_* e DE_cluster_specific_combined_*.
  8. Gerar saídas diferenciais de expressão focadas no sistema imunitário
    1. Extrair os resultados da DE para genes imunes selecionados como Ifng, Cxcl10, Ctla4, Il10, Foxp3, Bcl6, Cxcr5, Pdcd1, Lag3, Havcr2, Il21 e Tbx21.
    2. Salve DE_immune_focus_*.
    3. Gerar e salvar as seguintes saídas:
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      Atenção: espere coerência entre DE global, saídas de enriquecimento, DE específico de cluster e assinaturas focadas em imuno.

12. Salvar os resultados finais e arquivar a sessão

  1. Salvar objetos Seurat
    1. Salve os objetos finais do Seurat em formato .rds para cada conjunto de dados.
  2. Salvar informações da sessão
    1. Escreva sessionInfo() em um arquivo de texto no diretório de saída.
  3. Execute o código mencionado no Arquivo Suplementar 2 para executar a exportação de sessão de exemplo
  4. Verificar a completude da saída
    1. Confirme se as figuras/, tabelas/ e rds/diretórios esperados contêm os arquivos correspondentes.
    2. Arquivar scripts, informações de sessão e saídas juntos.
      Atenção: Não prossiga com a escrita de relatórios até que resumos de QC, saídas PCA, saídas de seleção de resolução, diagnósticos de integração, arquivos de anotação de módulos, saídas DE e arquivos de enriquecimento estejam todos presentes e internamente consistentes.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Qualidade do sequenciamento e controle de qualidade em nível celular (células T TCR-transgênicas CD4⁺ específicas de antígenos (reativas a PcAS) (GSE233703))

As distribuições de QC pré-filtro (Figura 2A) apresentaram complexidade heterogênea de transcritos, com a maioria das células apresentando contagens moderadas de genes e UMI, e um subconjunto menor apresentando perfis de outliers de alta contagem consistentes...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Este estudo apresenta um fluxo de trabalho padronizado e reprodutível baseado em Seurat para analisar a dinâmica transcricional das células T CD4⁺ durante a reinfecção da malária. O protocolo integra controle de qualidade adaptativo, normalização, redução de dimensionalidade, agrupamento, integração de conjuntos de dados, validação de marcadores, pontuação de módulos e análise de expressões diferenciais dentro de um arcabouço computacional unificado. Juntos, essas etapas analíticas permi...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores não têm nada a revelar.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Name of Material / EquipmentCompany / SourceCatalog NumberComments / Description
10x Genomics–formatted count matricesNCBI GEON/AMatrix Market files (matrix.mtx, features.tsv, barcodes.tsv)
clusterProfiler (R package)BioconductorN/ARRID:SCR_016884; Functional enrichment analysis (GO, KEGG)
enrichplot (R package)BioconductorN/ARRID:SCR_017030; Visualization of enrichment analysis results
GEO Dataset GSE233703NCBI Gene Expression OmnibusGSE233703PcAS-specific TCR-transgenic CD4+ T-cell scRNA-seq dataset
GEO Dataset GSE233713NCBI Gene Expression OmnibusGSE233713Polyclonal CD4+ T-cell scRNA-seq dataset (D273 vs D30)
GitHub (optional)GitHub Inc.N/ARRID:SCR_002630; Version control and reproducibility (optional)
glmGamPoi (R package)BioconductorN/ARRID:SCR_021001; Accelerated SCTransform model fitting
Matrix (R package)CRANN/ARRID:SCR_008389; Sparse matrix handling for scRNA-seq data
Operating systemMicrosoft / Apple / LinuxN/AWindows 10+, macOS, or Linux supported
org.Mm.eg.db (R package)BioconductorN/ARRID:SCR_002643; Mouse gene annotation database
patchwork (R package)CRANN/ARRID:SCR_018787; Multi-panel figure assembly
PDF viewerAnyN/AViewing QC plots, UMAPs, and heatmaps
Personal computer or workstationAnyN/AMinimum 16–32 GB RAM recommended for integration
pheatmap (R package)CRANN/ARRID:SCR_016418; Heatmap visualization of gene expression
R Statistical Software (version ≥ 4.2)R Foundation for Statistical ComputingN/ARRID:SCR_001905; Core computational environment
RStudio DesktopPosit SoftwareN/ARRID:SCR_000432; Integrated development environment for R
Seurat (R package, v4 or later)Satija LabN/ARRID:SCR_016341; Single-cell RNA-seq analysis
tidyverse (R package suite)CRANN/ARRID:SCR_019186; Data manipulation and visualization

Referências

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

Imunologia e InfecçãoEdição 233Edição 233Valor VazioEdiçãoscRNA-seqPBMCIntegração ômicaPontuação de módulo imune

Este artigo foi publicado

Vídeo em breve