$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este fluxo de trabalho foi projetado para orientar o processamento de amostras IMAT humanas congeladas para obter perfis de expressão gênica em resolução de núcleo único, permitindo a identificação do tipo de célula. Aqui, uma amostra representativa do IMAT de um participante do estudo SOMMA é apresentada.
O primeiro passo de qualquer análise de dados de snRNA-seq é avaliar a qualidade dos dados para identificar núcleos de baixa qualidade, que devem ser potencialmente removidos do conjunto de dados. É importante ressaltar que as etapas e limites de filtragem devem ser determinados para o tipo específico de amostra e conjunto de dados que você tem em mãos, pois as métricas comumente avaliadas podem diferir entre tecidos e tipos de células22,23. A Figura 4A fornece imagens de algumas das principais métricas usadas para avaliar a qualidade dos dados snRNA-seq gerados. O número de genes detectados por núcleo depende da profundidade do sequenciamento e do tipo de célula, mas espera-se que esteja acima de 200 para núcleos de boa qualidade 18,23. Verificou-se que os dados gerados usando este protocolo estão dentro da faixa esperada com uma mediana de 1134 genes por núcleo, de um total de 4662 núcleos.
A porcentagem de leituras mitocondriais é avaliada, uma vez que um alto grau de contaminação mitocondrial pode surgir de núcleos danificados ou RNA ambiente ligado aos núcleos, indicando núcleos de baixa qualidade. No conjunto de dados aqui apresentado, foi encontrada uma porcentagem mediana de leitura mitocondrial de 2,65, bem abaixo do limite de 5% a 20% comumente usado na literatura 24,25,26. A porcentagem de leituras ribossômicas difere entre os tipos de células e tecidos. No entanto, como grandes proporções de genes ribossômicos podem influenciar o agrupamento dos dados, recomenda-se verificar a porcentagem de leitura ribossômica e potencialmente remover genes ribossômicos ou núcleos com altos níveis de genes ribossômicos do conjunto de dados antes do agrupamento. Os dados gerados com este protocolo mostraram um baixo nível de leituras ribossômicas com mediana de 2,46% e máxima de 16,5% e, portanto, não filtramos com base nessa métrica. Por fim, uma pontuação de complexidade celular foi calculada com base no número log(10) de genes detectados dividido pelo número log(10) de leituras detectadas. Espera-se que os núcleos de boa qualidade estejam acima de 0,8, e uma mediana de 0,92 foi obtida na amostra utilizada neste estudo. Com base nessas métricas de CQ, pode-se decidir quais núcleos filtrar do conjunto de dados. Para análise, optamos por filtrar núcleos com menos de 200 ou mais de 10.000 genes por núcleo, mais de 10% de leituras mitocondriais e uma pontuação de complexidade abaixo de 0,8.
Após a avaliação inicial da qualidade e a etapa de filtragem, um UMAP pode ser gerado para visualizar o agrupamento dos núcleos. O agrupamento foi realizado com base nos 2000 genes mais variáveis usando a transformação SCT. As etapas iniciais de agrupamento podem ser usadas para verificar se algum dos recursos de CQ se agrupa, por exemplo, núcleos com altas leituras mitocondriais. Além disso, as informações de agrupamento são necessárias para alguns métodos de detecção de duplet, incluindo o DoubletFinder20, que foi usado neste protocolo. O DoubletFinder foi usado com uma taxa de multiplicação esperada definida para 4,8%, conforme sugerido pelos provedores da plataforma baseada em gotículas. Após a remoção do duplo, o nível de contaminação do RNA ambiente foi estimado, o que é particularmente comum em preparações de núcleos únicos, pois o RNA é liberado do citoplasma após a lise celular e é dispensado nas esferas de gel em emulsão (GEMs) e amplificado nas etapas de preparação da biblioteca a seguir. Assim, várias ferramentas foram desenvolvidas para corrigir o problema inerente da contaminação do RNA ambiente (ver Tabela 3). Usamos o pacote R decontX21, no qual a matriz de fundo bruta (incluindo apenas gotículas vazias) é usada para ajustar a matriz de expressão gênica, aumentando a assinatura real da expressão gênica.
O agrupamento e a capacidade de detectar tipos de células pouco abundantes dependem do número de núcleos. Este estudo detectou todos os principais tipos de células esperados no IMAT (Figura 4B) de um total de 3817 núcleos após filtragem de CQ, remoção de dupleto e ajuste de RNA ambiente. Estes incluíram células-tronco, progenitores fibroadipogênicos (FAPs) e adipócitos maduros, bem como pericitos, células musculares lisas, células imunes, células progenitoras musculares e mionúcleos da contaminação de células musculares esqueléticas.
No geral, demonstramos que este protocolo produz dados de núcleos únicos de alta resolução, permitindo a detecção de anotações de tipo de célula importantes para desvendar a biologia e as origens celulares do IMAT.

Figura 4: Avaliação de qualidade, agrupamento e anotação do tipo de célula dos dados de sequenciamento. (A) Gráficos de violino de métricas essenciais para avaliação da amostra e desempenho de sequenciamento, incluindo o número de genes detectados por núcleo, porcentagem de leituras mitocondriais, porcentagem de leituras ribossômicas e complexidade celular medida como o número log(10) de genes detectados dividido pelo número log(10) de leituras detectadas. Os valores medianos para cada métrica são fornecidos em caixas fechadas. Número total de núcleos: 4662. (B) UMAP exibindo agrupamento de núcleos individuais e DotPlot correspondente mostrando a expressão gênica relativa de genes marcadores de tipo de célula para cada cluster após a filtragem. Número de núcleos: 3817. Clique aqui para ver uma versão maior desta figura.
Arquivo Suplementar 1: O código para análise de CQ e clustering. Clique aqui para baixar este arquivo.