Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de método

Un protocolo reproducible basado en seurat para el análisis de secuenciación de ARN unicelular de células T CD4+ mononucleares en sangre periférica durante la reinfección por malaria

106 visualizaciones

DOI:

10.3791/70858

31 de julio de 2026

En este artículo

Resumen

Aquí presentamos un protocolo reproducible basado en Seurat para el análisis de datos de secuenciación de ARN unicelular procedente de células mononucleares CD4⁺ T de sangre periférica, con el fin de caracterizar la heterogeneidad transcripcional y los programas inmunitarios funcionales durante la reinfección por malaria. Este protocolo permite la identificación, comparación e interpretación biológica consistente de los estados dinámicos de las células T CD4⁺ y de las respuestas inmunitarias en distintas condiciones.

Resumen

Aquí presentamos un protocolo reproducible basado en Seurat para analizar los datos de secuenciación de ARN unicelular de células T CD4⁺ PBMC a lo largo de los tiempos de reinfección por malaria. Este protocolo demuestra un flujo de trabajo reproducible basado en Seurat para analizar datos de SCRNA-seq de células C CD4⁺ de PBMC a través de puntos temporales de reinfección por malaria, utilizando conjuntos de datos públicos representativos para demostrar su aplicación: un conjunto de datos específico de células T CD4⁺ transgénicas de Plasmodium (GSE233703) y un conjunto de datos policlonal de células T CD4⁺ que compara puntos temporales asociados a la reinfección (GSE233713; D27₍₃₎ frente a D30). El flujo de trabajo incluye preprocesamiento estandarizado, integración, agrupamiento y análisis transcriptómicos posteriores dentro de un marco computacional unificado. El método permite el cálculo sistemático de puntuaciones de módulos para programas predefinidos de células T inmunes y CD4⁺, la identificación de genes marcadores específicos de conglomerados, el análisis de expresión diferencial resuelto en puntos temporales y el enriquecimiento posterior de la Ontología Génica y la vía KEGG. La aplicación de este flujo de trabajo identifica estados funcionales distintos de las células T CD4⁺ y revela cambios transcripcionales dinámicos a lo largo de los momentos de reinfección por malaria. El protocolo genera resultados de visualización estandarizados y resultados tabulados, y proporciona orientación práctica sobre la selección de parámetros y la resolución de problemas, facilitando un análisis consistente y reproducible de conjuntos de datos de SCRNA-seq de células T CD4⁺ en contextos inmunológicos relacionados con la malaria. Este protocolo permite un análisis reproducible e interpretable biológicamente de las respuestas inmunitarias y puede aplicarse a conjuntos de datos similares de células únicas en investigación inmunológica.

Introducción

La malaria sigue siendo una gran carga sanitaria global, con infecciones repetidas que moldean la inmunidad del huésped de formas complejas y pococomprendidas 1. Las células T CD4⁺ desempeñan un papel central en las respuestas inmunitarias antipalúdicas al coordinar la producción de citocinas efectoras, apoyar la ayuda de las células B y regular lainflamación 2,3. Durante la reinfección por malaria, las células T CD4⁺ sufren una reprogramación transcripcional dinámica, reflejando cambios entre estados efectores, reguladores, de memoria, proliferativos y exhaustos que influyen tanto en el control parasitario como en la inmunopatología 4,5. Resolver con precisión esta heterogeneidad es esencial para comprender la protección inmunitaria, la disfunción inmunitaria y la durabilidad de la inmunidad adquirida de forma natural o inducida por vacunas frente a la infección por Plasmodium. Aquí presentamos un protocolo reproducible basado en Seurat para analizar los datos de SCRNA-seq de células T CD4⁺ a través de los momentos de reinfección por malaria.

La secuenciación de ARN unicelular (scRNA-seq) permite la caracterización de alta resolución de la heterogeneidad inmune y ha identificado subconjuntos de células T CD4⁺ sensibles a parásitos, programas de agotamiento y redes regulatorias enla malaria 6,7,8,9. Sin embargo, la variabilidad analítica en el control de calidad, normalización, agrupamiento e integración puede limitar la reproducibilidad y complicar las comparaciones de estudioscruzados 10,11. Sin embargo, falta un flujo de trabajo estandarizado y guiado biológicamente optimizado específicamente para analizar la dinámica de las células T CD4⁺ durante la reinfección por malaria.

Los marcos computacionales existentes para el análisis scRNA-seq, incluyendo Seurat y Scanpy, proporcionan conjuntos completos de herramientas para el preprocesamiento, el agrupamiento y la interpretación posterior de datos de célulaúnica 12,13,14. Seurat, implementado en R, ofrece flujos de trabajo estrechamente integrados para normalización, integración de datos y visualización, incluyendo enfoques estabilizadores de varianzas como SCTransform que mejoran la detección de señales en conjuntos de datos inmunitariosheterogéneos 13. Scanpy, implementado en Python, ofrece soluciones escalables optimizadas para grandes conjuntos de datos y un uso eficiente de la memoria, lo que lo hace especialmente adecuado para análisis de alto rendimiento o en la nube12,14. A pesar de estos avances, sigue existiendo la necesidad de flujos de trabajo estandarizados y reproducibles que aborden explícitamente las cuestiones biológicas en entornos de infección, manteniendo al mismo tiempo la transparencia, adaptabilidad y coherencia entre los conjuntos de datos. El protocolo actual aborda esta brecha combinando la robustez del preprocesamiento basado en Seurat con una interpretación biológica estructurada adaptada a las respuestas de células T CD4⁺ durante la reinfección por malaria. En comparación con los flujos de trabajo generales existentes, este protocolo enfatiza la reproducibilidad, la selección de parámetros biológicamente informada y un análisis consistente entre puntos temporales adaptado a modelos de infección.

Una característica clave de este protocolo es su énfasis en la reproducibilidad y la usabilidad práctica. Los umbrales de control de calidad no son fijos, sino que se derivan mediante enfoques adaptativos a los datos basados en la desviación absoluta mediana, permitiendo que los umbrales de complejidad de transcripciones, profundidad de secuenciación y contenido mitocondrial escalen con distribuciones específicas de cada conjunto. Este diseño hace que el flujo de trabajo sea aplicable a conjuntos de datos de tamaños variables, que suelen ir desde varios miles hasta decenas de miles de células, y a lo largo de una amplia gama de profundidades de secuenciación comúnmente encontradas en experimentos de scRNA-seq basados en gotas. La guía integrada en el flujo de trabajo permite la selección adecuada de parámetros para la reducción de dimensionalidad, resolución de agrupamiento e integración, asegurando que los análisis sigan siendo biológicamente significativos y técnicamente robustos. No obstante, el flujo de trabajo depende de la calidad de los datos y la profundidad de secuenciación, y puede requerir ajustes para conjuntos de datos con efectos de escasez extrema o por lotes.

Este protocolo está diseñado para usuarios intermedios a avanzados con conocimientos básicos de R y análisis de célula única, manteniéndose accesible para principiantes motivados gracias a su implementación estructurada, escalonada y salidas totalmente reproducibles. El flujo de trabajo genera tablas y figuras estandarizadas en cada etapa, incluyendo resúmenes de control de calidad, agrupación de resultados, resultados de expresiones diferenciales y análisis de enriquecimiento, facilitando así la transparencia, validación y reutilización en contextos colaborativos o de varios estudios. Este protocolo es especialmente adecuado para estudios que investigan la heterogeneidad inmunitaria a través de puntos temporales o condiciones en la investigación de infecciones e inmunología.

El método proporciona un flujo de trabajo reproducible y de extremo a extremo basado en Seurat para el análisis de SCRNA-seq de células T CD4⁺ a través de los puntos temporales de reinfección por malaria. Integra control de calidad adaptativo, estabilización de varianzas, reducción dimensional, agrupamiento y integración multi-muestra cuando es apropiado13,15. Para mejorar la interpretabilidad biológica, el flujo de trabajo incorpora la puntuación de módulos génicos del subconjunto de células T y inmunológicos CD4⁺ para cuantificar programas funcionales como Th1, Tfh, Tr1, Treg, memoria central, memoria efectora, proliferación, citotoxicidad y agotamiento 16,17,18. Se incluyen la identificación complementaria de marcadores de conglomerados, el análisis de expresión diferencial en puntos temporales y el enriquecimiento de vías utilizando bases de datos Gene Ontology y KEGG para apoyar la anotación y comparación robusta de estados de célulasT 19,20. Aunque se ha demostrado utilizando conjuntos de datos de Plasmodium scRNA-seq disponibles públicamente, este protocolo es ampliamente aplicable a otros modelos de reinfección por malaria y perturbaciones inmunológicas donde se requiere un análisis reproducible e interpretable de células T CD4⁺. En conjunto, este protocolo proporciona un marco reproducible y biológicamente interpretable para el análisis unicelular de las respuestas de células T CD4⁺, apoyando una investigación sólida de la dinámica inmunitaria en la malaria y sistemas relacionados.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Declaración ética:

Todos los datos utilizados en este estudio se obtuvieron de conjuntos de datos públicos (GSE233703 y GSE233713). Los estudios originales cumplían con las directrices institucionales y éticas para la experimentación con animales. Este estudio implicó análisis bioinformático secundario de conjuntos de datos de secuenciación de ARN unicelular disponibles y desidentificados obtenidos del repositorio Gene Expression Omnibus (GEO) (GSE233703 y GSE233713). No participaron nuevos participantes humanos, muestras clínicas ni información identificable del paciente en este estudio. Según las directrices institucionales y nacionales para la investigación que involucre conjuntos de datos anonimizados disponibles públicamente, no se requería aprobación ética adicional ni consentimiento informado para este análisis bioinformático. Los estudios originales asociados a estos conjuntos de datos se llevaron a cabo conforme a los estándares éticos institucionales relevantes y las directrices aplicables para la investigación biomédica.

1. Flujo de trabajo de análisis de células CD4⁺ de células T basadas en seurat reproducibles para GSE233703 y GSE233713

NOTA: Este flujo de trabajo se proporciona como Archivo Suplementario S1. También consulta un esquema que ofrece una visión general de todo el flujo de trabajo (Figura 1).

  1. Define el alcance y los usuarios previstos antes de comenzar el protocolo
  2. Definir los usuarios previstos
    1. Utilice este protocolo si el usuario tiene familiaridad intermedia a avanzada con el análisis de secuenciación de ARN de célula única (scRNA-seq).
    2. Aplica este flujo de trabajo a conjuntos de datos de células T CD4⁺ del bazo murino generados en formato matricial de estilo 10x. Utiliza la estructura paso a paso y las salidas esperadas para verificar cada etapa antes de continuar.
      NOTA: Asegurar prácticas adecuadas de manejo de datos y almacenamiento seguro al trabajar con grandes conjuntos de datos de secuenciación.
  3. Definir scRNA-seq
    1. Trate la secuenciación de ARN unicelular (scRNA-seq) como un método transcriptómico²¹ que cuantifica la expresión génica en células individuales.
    2. Utiliza scRNA-seq para identificar estados celulares discretos, poblaciones de transición y programas inmunitarios heterogéneos dentro de tejidos complejos.
  4. Preparar los requisitos del software y del paquete
  5. Instalar el software central
    1. Instala R 4.2 o posterior.
    2. Abre la interfaz de RStudio. Configura el directorio de trabajo usando setwd().
    3. Ejecuta los scripts secuencialmente usando la función source(). Registra las versiones exactas de R, RStudio y el sistema operativo en las notas del proyecto.
  6. Instalar paquetes R
    1. Instala los paquetes necesarios de CRAN: Seurat, Matrix, tidyverse, patchwork, pheatmap, RColorBrewer, cluster, glmGamPoi y ggplot2.
    2. Instala los paquetes Bioconductor necesarios: clusterProfiler, org. Mm.eg.db, enrichplot y DESeq2.
    3. Instala paquetes opcionales solo si es necesario: DoubletFinder para la eliminación de dobles y Monocle3 para análisis de trayectorias. Carga todos los paquetes necesarios al inicio de la sesión de análisis.
  7. Versiones de disco
    1. Guarda la información de paquetes y sesiones al final del flujo de trabajo usando sessionInfo() o una función equivalente.
    2. Informa explícitamente de los componentes clave de análisis en el manuscrito, incluyendo la versión R, la versión de Seurat, la versión DESeq2 y la versión clusterProfer.
  8. Ejecutar comandos de instalación de ejemplo mencionados en el archivo suplementario 2
  9. Confirmar los requisitos de hardware y almacenamiento
  10. Confirma los recursos mínimos
    1. Utiliza una estación de trabajo con al menos 16 GB de RAM, 4 núcleos de CPU y 20 GB de espacio libre en disco para el análisis rutinario de conjuntos de datos que contienen entre varios miles y decenas de miles de celdas.
  11. Confirma los recursos recomendados
    1. Utiliza 32 GB de RAM o más para análisis integrados, gráficos repetidos o detección opcional de dobles.
    2. Aumenta future.globals.maxSize si objetos grandes o conjuntos de datos integrados producen errores relacionados con la memoria.
    3. Aplicar ejemplo de configuración de memoria
  12. Ejecuta los siguientes comandos para establecer las opciones de memoria mencionadas en el archivo suplementario 2

2. Crear la estructura del proyecto

  1. Crea el directorio raíz del proyecto
    1. Crea un directorio de proyectos para el análisis.
    2. Crea subdirectorios llamados data/, scripts/ y results_spleen_cd4/.
  2. Uso de una estructura de salida estandarizada
    1. Asegúrate de que el flujo de trabajo escriba la salida en los siguientes directorios:
      results_spleen_cd4/GSE233703/fig/
      results_spleen_cd4/GSE233703/mesas/
      results_spleen_cd4/GSE233703/RDS/
      results_spleen_cd4/GSE233713/fig/
      results_spleen_cd4/GSE233713/mesas/
      results_spleen_cd4/GSE233713/RDS/
      results_spleen_cd4/post_markers/
  3. Utiliza nombres de archivo consistentes
    1. Renombra los archivos de entrada GEO para que coincidan con las rutas esperadas por el script.
    2. Utiliza los siguientes nombres exactos de archivo:
      datos/GSE233703_matrix.mtx.gz
      datos/GSE233703_genes.tsv.gz
      datos/GSE233703_barcodes.tsv.gz
      datos/GSE233713_d27_3_matrix.mtx.gz
      datos/GSE233713_d27_3_features.tsv.gz
      datos/GSE233713_d27_3_barcodes.tsv.gz
      datos/GSE233713_d30_matrix.mtx.gz
      datos/GSE233713_d30_features.tsv.gz
      datos/GSE233713_d30_barcodes.tsv.gz
    3. Nombra los archivos de metadatos opcionales de la siguiente manera:
      datos/GSE233703_cell_metadata.csv
      datos/GSE233713_cell_metadata.csv
  4. Confirmar los requisitos de metadatos
    1. Confirma que cada archivo de metadatos contiene una columna de código de barras. Añade columnas opcionales como sample, timepoint y replica cuando esté disponible.
    2. Utiliza coincidencias exactas de códigos de barras entre metadatos y matrices de conteo.
      Precaución: Confirma que existen tripletes de matrices y archivos de metadatos en las rutas esperadas antes de iniciar la importación.

3. Importar matrices de recuento y validar la integridad de la entrada

  1. Leer matrices al estilo 10x
    1. Lee cada archivo matrix.mtx.gz como una matriz dispersa.
    2. Lee el archivo de características (o genes) correspondiente y el archivo de código de barras como tablas delimitadas por tabulaciones.
    3. Asigna símbolos génicos a las filas de matrices usando la segunda columna del archivo de características cuando esté disponible. Imponer símbolos génicos únicos usando make.unique().
    4. Asignar identificadores de código de barras a las columnas de la matriz.'
  2. Ejecutar la función de importación de ejemplo
    1. Ejecuta el código mencionado en el archivo suplementario 2, para importar la matriz y asignar identificadores.
  3. Validar la integridad de la matriz
    1. Verifica que el número de filas de la matriz sea igual al número de características. Verifica que el número de columnas de la matriz sea igual al número de códigos de barras.
    2. Detén el flujo de trabajo si detecta algún desajuste.
      NOTA: Si se detectan desajustes, verifique la integridad del archivo y asegúrese de asegúrate de la correcta alineación de los archivos de características y códigos de barras antes de volver a ejecutar el paso.
      Punto de control: Avanzar solo si los conteos de filas coinciden con características y los conteos de columnas coinciden con códigos de barras.

4. Definir paneles de marcadores y módulos

  1. Definir los paneles de células T CD4⁺ relevantes para la malaria
    1. Define paneles génicos con nombre para: Th1, Tfh, Tr1, Treg, Tcm, Tem, Agotamiento, Proliferación, citotóxico, Activation_early, Interferon_response, Immune_regulation
    2. Guarda estos paneles en una lista R con nombre para la puntuación posterior de módulos.
  2. Ejecuta el código R mencionado en el archivo suplementario 2 para definir paneles génicos.
  3. Definir genes de validación de marcadores
    1. Defina un panel de validación separado que contenga genes marcadores canónicos como Foxp3, Bcl6, Cxcr5, Il21, Ifng, Ctla4, Pdcd1, Lag3, Tbx21, Tcf7 y Lef1.

5. Crear objetos Seurat y calcular métricas de control de calidad

  1. Inicializar objetos Seurat
    1. Crea un objeto Seurat para cada conjunto de datos usando min.cells = 3 y min.features = 0. No impongas cortes arbitrarios de funcionalidades en la importación.
    2. Añade metadatos de conjuntos de datos, muestras y puntos de tiempo. Fusiona metadatos opcionales usando la coincidencia de códigos de barras.
  2. Ejecutar ejemplo de inicialización de objetos Seurat
    1. Ejecuta el código R mencionado en el archivo suplementario 2 para crear un objeto Seurat y asignar metadatos.
  3. Calcular métricas de control de calidad
    1. Calcula la fracción de transcrito mitocondrial usando el prefijo murino ^mt-.
    2. Cuantifique las siguientes métricas
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. Ejecuta el código de ejemplo mencionado en el archivo suplementario 2.
  5. Visualizar el control de calidad previo al filtro
    1. Genera diagramas de violín para nFeature_RNA, nCount_RNA y percent.mt. Genera diagramas de dispersión de características para nCount_RNA frente a nFeature_RNA y nCount_RNA frente a percent.mt.
    2. Guarda las figuras pre-filtro usando nombres estandarizados como QC_pre_filter_AllCells_vln.png y QC_pre_filter_AllCells_scatter.png.
      Precaución: Espera distribuciones prefiltradas amplias con colas de baja calidad y posibles valores atípicos de alto recuento.

6. Derivar umbrales adaptativos de control de calidad y filtrar celdas de baja calidad

  1. Derivar umbrales específicos de cada conjunto de datos
    1. Transformada logarítmica nFeature_RNA + 1 y nCount_RNA + 1. Calcular la desviación absoluta mediana y la mediana (MAD) para ambas variables transformadas.
    2. Defina los siguientes umbrales:
      min_features = 10^(mediana - 3 × MAD) - 1
      max_features = 10^(mediana + 3 × MAD) - 1
      min_counts = 10^(mediana - 3 × MAD) - 1
      max_counts = 10^(mediana + 3 × MAD) – 1
    3. Defina el umbral mitocondrial como el percentil 95 de percent.mt más 3 × DMA, restringido entre el 5 % y el 20 %.
    4. Asegúrate de que dataset_id, sample_id y out_dir estén correctamente especificados antes de ejecutar la función.
      qc_thr <- derive_qc_thresholds(seu, dataset_id = "GSE233703", sample_id = "AllCells", out_dir = "results_spleen_cd4/GSE233703")
  2. Aplicar filtrado
    1. Retener células que cumplan todos los criterios adaptativos:
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. Ejecuta el código de ejemplo mencionado en el archivo suplementario 2.
  3. Guardar las salidas de filtrado
    1. Guarda QC_thresholds_*.csv y cell_counts_summary_*.csv.
      PUNTO DE PAUSA: Guarda los resultados intermedios y reanuda el análisis de este paso si es necesario.
    2. Genera y guarda diagramas de violín y dispersión de control de calidad post-filtro.
      Punto de control: Espera distribuciones postfiltros más ajustadas, eliminación de celdas de baja complejidad y reducción de valores extremos.

7. Normalizar datos y realizar PCA

  1. Normalizar y estabilizar varianza
    1. Normaliza el ensayo de ARN antes de la puntuación del ciclo celular. Ejecuta la puntuación del ciclo celular si está activada. Usa SCTransform() para estabilizar la varianza.
    2. Solo regresa el contenido mitocondrial si está biológicamente justificado y explícitamente habilitado.
    3. Regresa las puntuaciones del ciclo celular solo si es necesario para el diseño del estudio.
  2. Ejecuta la normalización de ejemplos como se menciona en el archivo suplementario 2.
  3. Definir valores de parámetros
    1. Usa n_variable_features = 3000.
    2. Usa dims_max_for_pca = 50.
    3. Indica estos valores explícitamente en el manuscrito.
  4. Ejecuta PCA y selecciona componentes principales
    1. Haz PCA en el ensayo normalizado. Confirma la ejecución correcta de la PCA inspeccionando las variaciones explicadas y las cargas de componentes principales.
    2. Calcular la varianza explicada por cada componente principal.
  5. Selecciona los PCs usando los tres criterios:
    1. Conservar a los PJ que expliquen al menos un 1% de varianza,
    2. Asegurarse de que la variación acumulada alcance aproximadamente el 80 %,
    3. Limita la selección final entre 10 y 40 personajes.
    4. Guarda PCA_variance_table_*.csv, PCA_selection_rationale_*.csv y PCA_Elbow_*.png.
  6. Ejecutar ejemplo de PCA
    1. Ejemplo mencionado en el archivo suplementario 2.
      Punto de control: Espera un gráfico de codo con una disminución visible en la ganancia de varianza marginal tras el corte seleccionado.

8. Construir vecindarios, seleccionar resolución y agrupar celdas

  1. Estructura de grafo de construcción
    1. Construye un grafo compartido de vecinos más cercanos usando los PCs seleccionados.
    2. Ejecuta un clúster inicial de baja resolución si la detección de dobles requiere etiquetas de clúster.
  2. Opcionalmente, quitar los dobletes
    1. Ejecuta DoubletFinder solo si está instalado y es compatible.
      NOTA: Realizar detección de dobles solo para conjuntos de datos con un alto número de células donde se esperan artefactos de multiplet.
    2. Recalcular la normalización y la ACP tras la eliminación del doblete.
  3. Seleccionar resolución de clustering
    1. Evaluar las resoluciones 0.2, 0.4, 0.6, 0.8, 1.0 y 1.2.8.3.2
    2. Calcula el ancho medio de silueta para cada resolución probada. Selecciona la resolución con la puntuación de silueta más alta entre las soluciones con al menos dos clústeres.
    3. Guarda resolution_sweep_*.csv, resolution_selection_rationale_*.csv y resolution_sweep_*.png.
  4. Ejecuta la selección de resolución de ejemplo ejecutando el código mencionado en el archivo suplementario 2
  5. Ejecuta UMAP y el agrupamiento final.
    1. Ejecuta UMAP usando los PCs seleccionados.
    2. Reconstruye el grafo del vecino más cercano. Agrupa celdas usando la resolución seleccionada.
    3. Guarda los gráficos UMAP etiquetados por clúster y agrupados por muestra o punto temporal. Ejecuta el siguiente código mencionado en el archivo suplementario 2.
      Precaución: Espere una separación estable en racimos y una estructura UMAP interpretable compatible con estados inmunitarios mayores.

9. Realizar integración basada en SCT para GSE233713

  1. Prepara objetos separados
    1. Crea objetos Seurat separados para D27_3 y D30.
    2. Aplica control de calidad y filtrado de forma independiente a cada muestra. Normaliza cada muestra por separado con SCTransform().
  2. Justificar la integración
    1. Utilizar integración basada en SCT para reducir diferencias técnicas entre puntos temporales preservando la estructura biológica compartida.
    2. No asumas que la integración es automáticamente beneficiosa. Valida la información explícitamente.
  3. Integrar muestras
    1. Selecciona las funciones de integración usando SelectIntegrationFeatures(). Preparar objetos con PrepSCTIntegration().
    2. Encontrar anclajes con FindIntegrationAnchors(normalization.method = "SCT"). Integrar conjuntos de datos con IntegrateData(normalization.method = "SCT").
  4. Ejecutar ejemplos de integración mencionados en el archivo suplementario 2
  5. Validar la integración
    1. Genera gráficos UMAP pre-integración y post-integración agrupados por punto temporal. Interpreta la mejora de la mezcla de células entre puntos temporales como evidencia de integración exitosa.
    2. Calcula la mezcla de vecinos antes y después de la integración. Calcula la composición de los grupos por punto temporal y genera gráficos de composición apilados.
    3. Guarda las siguientes salidas:
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      Precaución: Espera una reducción de la segregación por puntos temporales tras la integración, un aumento de la mezcla de vecinos y una contribución multi-puntos temporales a la mayoría de los cúmulos sin perder completamente la estructura biológicamente significativa.

10. Anotar clústeres y validar la estructura de los marcadores

  1. Puntuar módulos relacionados con la malaria
    1. Ejecuta AddModuleScore() para los paneles predefinidos de células T CD4⁺ de malaria.
    2. Guarda los medios y rangos de módulos a nivel de clúster.
  2. Ejecutar la puntuación de módulos de ejemplo mencionada en el archivo suplementario 2
  3. Asignar etiquetas de clúster predichas
    1. Asigna el módulo mejor clasificado a cada clúster como etiqueta predicha.
    2. Guardar:
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. Validar los clústeres con marcadores canónicos
    1. Ejecuta DotPlots y FeaturePlots de validación de marcadores usando el panel de marcadores canónicos.
    2. Guardar:
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      Precaución: Espera la expresión concordante de múltiples genes canónicos por estado funcional, no señales aisladas de un solo gen.

11. Identificar marcadores y realizar expresiones diferenciales.

  1. Encontrar marcadores de grupo
    1. Ejecuta FindAllMarkers() usando solo marcadores positivos.
    2. Guarda markers_all_clusters_*.csv.
  2. Ejecuta el código mencionado en el archivo suplementario para ejecutar la identificación de marcadores de ejemplo
  3. Utiliza expresión diferencial consciente de réplicas cuando esté disponible
    1. Comprueba si hay metadatos réplicados válidos disponibles. Si hay réplicas disponibles, agrega el conteo por réplica y condición y ejecuta pseudobulk DE con DESeq2.
    2. Guarda DE_pseudobulk_*.
  4. Utiliza expresión diferencial exploratoria a nivel celular cuando falten réplicas
    1. Si los metadatos replicados están ausentes o son insuficientes, ejecuta DE de célula única como análisis exploratorio.
    2. Guarda DE_WARNING_* para documentar el estado exploratorio. Guarda los resultados exploratorios como DE_exploratory_celllevel_*.
  5. Generar salidas globales de expresión diferencial
    1. Crea gráficos de volcán para resultados de DE y guarda Volcano_*.
    2. Guarda los resultados significativos de los ED como tablas filtradas.
  6. Generar salidas de enriquecimiento funcional
    1. Ejecuta el enriquecimiento de procesos biológicos de GO y ahorra GO_BP_*. Ejecuta el enriquecimiento KEGG y guarda KEGG_*.
    2. Ejecuta GSEA usando los fold-changes de log2 clasificados y guarda GSEA_GO_*. Guarda los diagramas de barras y puntos correspondientes.
  7. Generar salidas diferenciales específicas de clúster
    1. Ejecuta DE dentro de cada clúster entre puntos temporales.
    2. Guarda DE_cluster_* y DE_cluster_specific_combined_*.
  8. Generar salidas diferenciales de expresión enfocadas en el sistema inmunitario
    1. Extrae resultados de DE para genes inmunitarios seleccionados como Ifng, Cxcl10, Ctla4, Il10, Foxp3, Bcl6, Cxcr5, Pdcd1, Lag3, Havcr2, Il21 y Tbx21.
    2. Guarda DE_immune_focus_*.
    3. Genera y guarda las siguientes salidas:
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      Precaución: Espera coherencia entre el DE global, los resultados de enriquecimiento, el DE específico del clúster y las firmas centradas en el sistema inmunológico.

12. Guardar los resultados finales y archivar la sesión

  1. Guardar objetos Seurat
    1. Guarda los objetos finales de Seurat en formato .rds para cada conjunto de datos.
  2. Guardar información de la sesión
    1. Escribe sessionInfo() en un archivo de texto en el directorio de salida.
  3. Ejecuta el código mencionado en el archivo suplementario 2 para ejecutar la exportación de sesión de ejemplo
  4. Verificar la completitud de la salida
    1. Confirma que los fichas/, tablas/ y rds/directorios esperados contienen los archivos correspondientes.
    2. Archiva scripts, información de sesión y salidas juntos.
      Precaución: No continúes con la escritura de informes hasta que los resúmenes de control de calidad, salidas PCA, salidas de selección de resolución, diagnósticos de integración, archivos de anotación de módulos, salidas de DE y archivos de enriquecimiento estén presentes y sean internamente consistentes.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Calidad de secuenciación y control de calidad a nivel celular (células T CD4⁺ transgénicas TCR-transgénicas específicas de antígenos (reactivas a PcAS) (GSE233703))

Las distribuciones de control de calidad previas al filtro (Figura 2A) mostraron una complejidad heterogénea de los transcritos, con la mayoría de las células mostrando un recuento moderado de genes y UMI, y un subconjunto más pequeño mostrando perfile...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este estudio presenta un flujo de trabajo estandarizado y reproducible basado en Seurat para analizar la dinámica transcripcional de las células T CD4⁺ durante la reinfección por malaria. El protocolo integra control de calidad adaptativo, normalización, reducción de dimensionalidad, agrupación, integración de conjuntos de datos, validación de marcadores, puntuación de módulos y análisis de expresiones diferenciales dentro de un marco computacional unificado. En conjunto, estos pasos ana...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen nada que revelar.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Nombre del Material / EquipoCompañía / FuenteNúmero de CatálogoComentarios / Descripción
Matrices de conteo formateadas de 10x Genomics–NCBI GEON/AArchivos Matrix Market (matrix.mtx, features.tsv, barcodes.tsv)
clusterProfiler (paquete R)BioconductorN/ARRID:SCR_016884; Análisis de enriquecimiento funcional (GO, KEGG)
enrichplot (paquete R)BioconductorN/ARRID:SCR_017030; Visualización de resultados de análisis de enriquecimiento
Conjunto de Datos GEO GSE233703NCBI Gene Expression OmnibusGSE233703Conjunto de datos scRNA-seq de células T CD4+ transgénicas específicas de TCR de PcAS
Conjunto de Datos GEO GSE233713NCBI Gene Expression OmnibusGSE233713Conjunto de datos scRNA-seq de células T CD4+ policlonales (D273 vs D30)
GitHub (opcional)GitHub Inc.N/ARRID:SCR_002630; Control de versiones y reproducibilidad (opcional)
glmGamPoi (paquete R)BioconductorN/ARRID:SCR_021001; Ajuste acelerado del modelo SCTransform
Matrix (paquete R)CRANN/ARRID:SCR_008389; Manejo de matrices dispersas para datos scRNA-seq
Sistema operativoMicrosoft / Apple / LinuxN/ASe admiten Windows 10+, macOS o Linux
org.Mm.eg.db (paquete R)BioconductorN/ARRID:SCR_002643; Base de datos de anotación de genes de ratón
patchwork (paquete R)CRANN/ARRID:SCR_018787; Ensamblaje de figuras de múltiples paneles
Visor de PDFCualquieraN/AVisualización de gráficos de control de calidad, UMAPs y mapas de calor
Computadora personal o estación de trabajoCualquieraN/ASe recomienda un mínimo de 16–32 GB de RAM para la integración
pheatmap (paquete R)CRANN/ARRID:SCR_016418; Visualización de mapas de calor de expresión génica
Software Estadístico R (versión ≥ 4.2)Fundación R para Computación EstadísticaN/ARRID:SCR_001905; Entorno computacional central
RStudio DesktopPosit SoftwareN/ARRID:SCR_000432; Entorno de desarrollo integrado para R
Seurat (paquete R, v4 o posterior)Satija LabN/ARRID:SCR_016341; Análisis de scRNA-seq
tidyverse (paquete de suite R)CRANN/ARRID:SCR_019186; Manipulación y visualización de datos

Referencias

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Inmunología e InfecciónNúmero 233Número 233Valor vacíoNúmeroscRNA-seqPBMCIntegración ómicaPuntuación de módulos inmunitarios

Este artículo ha sido publicado

Video próximamente