$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este flujo de trabajo fue diseñado para guiar el procesamiento de muestras humanas IMAT congeladas para obtener perfiles de expresión génica con una resolución de un solo núcleo, lo que permite la identificación del tipo de célula. Aquí se presenta una muestra representativa de IMAT de un participante en el estudio SOMMA.
El primer paso de cualquier análisis de los datos de snRNA-seq es evaluar la calidad de los datos para identificar los núcleos de mala calidad, que potencialmente deberían eliminarse del conjunto de datos. Es importante destacar que los pasos de filtrado y los umbrales deben determinarse para el tipo específico de muestra y conjunto de datos que tiene a mano, ya que las métricas comúnmente evaluadas pueden diferir entre tejidos y tipos de células22,23. La Figura 4A proporciona imágenes de algunas de las métricas clave utilizadas para evaluar la calidad de los datos de snRNA-seq generados. El número de genes detectados por núcleo depende de la profundidad de secuenciación y del tipo de célula, pero se esperaría que estuviera por encima de 200 para núcleos de buena calidad18,23. Se encontró que los datos generados utilizando este protocolo están dentro del rango esperado con una mediana de 1134 genes por núcleo, de un total de 4662 núcleos.
Se evalúa el porcentaje de lecturas mitocondriales, ya que un alto grado de contaminación mitocondrial puede surgir de núcleos dañados o ARN ambiental que se adhiere a los núcleos, lo que indica núcleos de mala calidad. En el conjunto de datos aquí presentado, se encontró una mediana del porcentaje de lectura mitocondrial de 2,65, que está muy por debajo del umbral del 5%-20% comúnmente utilizado en la literatura 24,25,26. El porcentaje de lecturas ribosómicas difiere según los tipos de células y los tejidos. Sin embargo, dado que grandes proporciones de genes ribosómicos pueden influir en la agrupación de los datos, se recomienda comprobar el porcentaje de lectura ribosómica y, potencialmente, eliminar los genes ribosómicos o los núcleos con altos niveles de genes ribosómicos del conjunto de datos antes de agruparlos. Los datos generados con este protocolo mostraron un bajo nivel de lecturas ribosómicas con una mediana del 2,46% y un máximo del 16,5%, por lo que no filtramos en función de esta métrica. Por último, se calculó una puntuación de complejidad celular basada en el número log(10) de genes detectados dividido por el número log(10) de lecturas detectadas. Se espera que los núcleos de buena calidad estén por encima de 0,8 y se obtuvo una mediana de 0,92 en la muestra utilizada en este estudio. Sobre la base de estas métricas de control de calidad, se puede decidir qué núcleos filtrar del conjunto de datos. Para el análisis, elegimos filtrar los núcleos con menos de 200 o más de 10.000 genes por núcleo, más del 10% de lecturas mitocondriales y una puntuación de complejidad inferior a 0,8.
Después de la evaluación inicial de la calidad y el paso de filtrado, se puede generar un UMAP para visualizar la agrupación de los núcleos. El agrupamiento se realizó con base en los 2000 genes más variables mediante la transformación de SCT. Los pasos iniciales de agrupamiento se pueden utilizar para verificar si alguna de las características de QC se agrupa, por ejemplo, núcleos con lecturas mitocondriales altas. Además, la información de agrupación es necesaria para algunos métodos de detección de dobletes, incluido DoubletFinder20, que se utilizó en este protocolo. Se utilizó DoubletFinder con una tasa de multiplicación esperada establecida en 4,8%, según lo sugerido por los proveedores de la plataforma basada en gotas. Después de la eliminación del doblete, se estimó el nivel de contaminación ambiental del ARN, que es particularmente común en las preparaciones de un solo núcleo, ya que el ARN se libera del citoplasma tras la lisis celular y se dispensa en las perlas de gel en emulsión (GEM) y se amplifica en los siguientes pasos de preparación de la biblioteca. Por lo tanto, se han desarrollado varias herramientas para corregir el problema inherente de la contaminación ambiental por ARN (ver Tabla 3). Utilizamos el paquete R decontX21, en el que la matriz de fondo en bruto (incluyendo solo gotas vacías) se utiliza para ajustar la matriz de expresión génica, mejorando la firma de expresión génica real.
El agrupamiento y la capacidad de detectar tipos de células poco abundantes dependen del número de núcleos. Este estudio detectó todos los tipos celulares principales esperados en IMAT (Figura 4B) de un total de 3817 núcleos después del filtrado de control de calidad, la eliminación de dobletes y el ajuste del ARN ambiental. Estos incluían células madre, progenitores fibroadipogénicos (FAP) y adipocitos maduros, así como pericitos, células musculares lisas, células inmunitarias, células progenitoras musculares y mionúcleos procedentes de la contaminación de células musculares esqueléticas.
En general, hemos demostrado que este protocolo produce datos de núcleo único de alta resolución que permiten la detección de la anotación del tipo de célula, importante para desentrañar la biología y los orígenes celulares de IMAT.

Figura 4: Evaluación de la calidad, agrupamiento y anotación del tipo de célula de los datos de secuenciación. (A) Gráficos de violín de métricas esenciales para la evaluación de la muestra y el rendimiento de la secuenciación, incluido el número de genes detectados por núcleo, el porcentaje de lecturas mitocondriales, el porcentaje de lecturas ribosómicas y la complejidad celular medida como el número log(10) de genes detectados dividido por el número log(10) de lecturas detectadas. Los valores medianos de cada métrica se indican en cuadros cerrados. Número total de núcleos: 4662. (B) UMAP que muestra la agrupación de núcleos individuales y el diagrama de puntos correspondiente que muestra la expresión génica relativa de los genes marcadores de tipo celular para cada grupo después del filtrado. Número de núcleos: 3817. Haga clic aquí para ver una versión más grande de esta figura.
Archivo complementario 1: El código para el control de calidad y el análisis de agrupamiento. Haga clic aquí para descargar este archivo.