Artigo de método

Avaliação abrangente de ferramentas de imputação de genótipo para dados de sequenciamento de genoma completo de ultra baixa profundidade

DOI:

10.3791/68879

12 de dezembro de 2025

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Três ferramentas de imputação — STITCH, QUILT2 e GLIMPSE2 — foram comparadas em diferentes profundidades de sequenciamento e tamanhos de amostra, utilizando painéis de referência CKB e EAS. Os resultados fornecem uma estrutura prática para selecionar estratégias de imputação adequadas em dados de sequenciamento de ultra baixa profundidade, facilitando estudos genômicos populacionais em larga escala e traços complexos.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O sequenciamento de ultra-baixa profundidade (ULDS) é uma estratégia econômica para estudos genômicos em larga escala, mas sua utilidade depende da imputação precisa de genótipos. Este estudo avalia três ferramentas de imputação — STITCH, QUILT2 e GLIMPSE2 — em diferentes profundidades de sequenciamento e tamanhos de amostras, utilizando os painéis de referência do China Kadoorie Biobank (CKB) e do The 1000 Genomes Project (1KGP) do Leste Asiático (EAS). São demonstradas divergências críticas de desempenho: Sensibilidade ao tamanho da amostra: A precisão do STITCH melhorou significativamente com amostras maiores, enquanto o QUILT2 e GLIMPSE2 mostraram dependência mínima do tamanho da amostra. Otimização do painel de referência: O CKB específico da população aumentou significativamente a precisão para QUILT2 e GLIMPSE2 mas teve um impacto negligenciável no STITCH, que depende da inferência interna de haplótipos. Limiares de profundidade: Todas as ferramentas alcançaram precisão robusta em profundidades moderadas de sequenciamento (≥ 0,5x), mas o STITCH teve desempenho drasticamente inferior em profundidades ultra-baixas (≤ 0,1x). GLIMPSE2 com CKB entregou a maior precisão geral, enquanto o QUILT2 equilibrou precisão e eficiência computacional. Para dados de testes pré-natais não invasivos (NIPT), GLIMPSE2+CKB manteve precisão suficiente para análises posteriores. É proposto um quadro de decisão, priorizando painéis de correspondência populacional e ferramentas adaptadas em profundidade, oferecendo diretrizes práticas para otimizar o ULDS-WGS em diversos contextos de pesquisa. Esses insights conectam avanços metodológicos com a implementação prática, permitindo uma escalabilidade econômica dos estudos genômicos sem comprometer a qualidade dos dados.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O sequenciamento de ultra baixa profundidade (ULDS), definido como cobertura de sequenciamento abaixo de 1x, ganhou força devido ao seu baixo custo, ampla cobertura genômica e compatibilidade com diversos tipos de amostras. Já demonstrou valor clínico em aplicações como testes pré-natais não invasivos (NIPT)1, monitoramentodo câncer 2 e detecção de variação do número de cópias cromossômicas(CNV) 3,4. Além do diagnóstico clínico, a diminuição do custo do sequenciamento e os rápidos avanços em bioinformática permitiram que o ULDS desempenhe um papel crescente na genômica populacional e na pesquisa de características complexas. Ao combinar dados ULDS com painéis de referência de haplótipos em escala populacional, a imputação de genótipo possibilita a recuperação de informações variantes genômicas em nível individual. Como resultado, o ULDS emergiu como uma alternativa econômica aos tradicionais arranjos de polimorfismo de nucleotídeo único (SNP) e ao sequenciamento completo do genoma (WGS) de alta profundidade5, especialmente em estudos de grande escala como estudos de associação genômica ampla (GWAS) e análises de estrutura populacional.

Pesquisas anteriores demonstraram a viabilidade de realizar diversos estudos genéticos usando dados de sequenciamento NIPT, incluindo chamada de variantes, reconstrução do histórico populacional, inferência de padrões de infecção viral eGWAS 6.

Apesar dessas vantagens, a natureza extremamente escassa dos dados ULDS apresenta desafios únicos. No nível variante, muitos sítios são totalmente não observados ou representados por apenas um único alelo por indivíduo, levando a qualidade insuficiente dos dados para análises posteriores. A imputação de genótipos é, portanto, essencial, aproveitando a estrutura dos haplótipos de grandes painéis de referência (por exemplo, 1000Genomas 7 ou recursos específicos da população) para inferir estatisticamente genótipos ausentes ou incertos. Trabalhos anteriores mostraram que a imputação a partir de dados NIPT pode alcançar alta precisão e manter um poder estatístico robusto no GWAS para identificar variantes associadas acaracterísticas 8. Usando o algoritmo STITCH9 , dados NIPT (profundidade média ~0,15x) em uma coorte de 20.900 gestantes chinesas foram imputados com sucesso, levando à identificação de loci associados à gravidez. Os genótipos imputados apresentaram forte concordância com dados WGS de alta profundidade nos resultados GWAS (Pearson R² > 0,8)10.

O sucesso das análises baseadas em ULDS depende criticamente da precisão da imputação, que é influenciada pela profundidade do sequenciamento, qualidade do painel de referência e correspondência populacional, desempenho do algoritmo de imputação, tamanho da amostra e espectro de frequênciaalelada 11. Entre eles, a escolha do painel de referência é um dos principais determinantes da precisão da imputação. Painéis comumente utilizados incluem recursos representativos globalmente, como o Projeto 1000 Genomas (1KGP)7, TOPMed12 e o Consórcio de Referência de Haplotipos (HRC)13, além de painéis cada vez mais disponíveis para população ou região, como o Singapore 10.000 Genomas (SG10K)14, o China Kadoorie Biobank (CKB)15. Outro fator chave no desempenho da imputação é a escolha do algoritmo. Diversas ferramentas foram desenvolvidas para acomodar os desafios únicos do sequenciamento de baixa profundidade, avançando significativamente o uso prático da imputação em pesquisas genéticas em larga escala. Embora métodos de imputação como Beagle (v5+)16, Minimac417 e IMPUTE511 sejam amplamente usados para dados de array SNP e WGS de profundidade média a alta, eles frequentemente têm desempenho subótimo em ambientes ULDS. Mais recentemente, ferramentas especializadas foram desenvolvidas para enfrentar esses desafios. O STITCH9 infere haplótipos diretamente a partir de leituras de sequenciamento de baixa profundidade, tornando-o particularmente adequado para grandes coortes homogêneas. O QUILT218 emprega uma biblioteca de haplótipos comprimidos e um modelo de verosimilhança localizada, permitindo imputação eficiente com painéis de referência massivos e oferecendo aplicações únicas em genômica pré-natal. GLIMPSE219, uma extensão do framework original GLIMPSE, oferece melhorias adicionais tanto na precisão quanto na eficiência computacional.

Embora essas ferramentas representem avanços significativos, seu desempenho relativo sob diferentes desenhos experimentais (por exemplo, profundidade de sequenciamento, tamanho da coorte e escolha do painel de referência) não foi avaliado sistematicamente, deixando os pesquisadores sem orientações claras sobre a escolha da estratégia mais adequada. Para preencher essa lacuna, três ferramentas de imputação ULDS amplamente utilizadas — STITCH, QUILT2 e GLIMPSE2 — foram sistematicamente comparadas sob múltiplas profundidades de sequenciamento e tamanhos de amostras. Seu desempenho foi avaliado usando dois painéis de referência do Leste Asiático altamente relevantes para populações chinesas. Os achados indicam que a imputação ULDS é geralmente confiável em profundidades de sequenciamento ≥0,5x, enquanto profundidades <0,1x exigem coortes substancialmente maiores para alcançar uma precisão aceitável. A seleção do painel de referência deve ser adaptada ao contexto do estudo, com painéis de correspondência populacional, como o CKB, melhorando a precisão da imputação. Além disso, essas abordagens são diretamente aplicáveis a dados de ultra baixa profundidade gerados em estudos populacionais em grande escala e no NIPT. Este estudo, assim, estabelece uma estrutura prática para a seleção de ferramentas em pesquisas baseadas em ULDS, fornecendo orientações metodológicas para futuras aplicações em genética populacional e análises complexas de características.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos os participantes forneceram consentimento informado por escrito antes da participação. O estudo envolvendo dados de WGS de alto nível foi revisado e aprovado pelo Conselho de Revisão Institucional do BGI (BGI-IRB 23058-T2), e a aprovação para a coleta de recursos genéticos humanos foi obtida da Administração de Recursos Genéticos Humanos da China ([2023] CJ0262). O estudo envolvendo dados ULDS do NIPT foi aprovado pelo Conselho de Revisão Institucional do Hospital Infantil de Wuhan (2021R062) e pelo Conselho de Revisão Institucional do BGI (BGI-IRB 21088), com aprovação adicional da Administração de Recursos Genéticos Humanos da China ([2021] CJ2002).

NOTA: Este estudo incluiu dois tipos de dados do WGS. O primeiro tipo consistiu em dados WGS de alta profundidade (30xx) obtidos a partir de amostras de sangue de 500 indivíduos recrutados de uma coorte populacional natural em Shenzhen. Esses dados foram usados para construir um conjunto de dados de verdade de alta qualidade e para avaliações subsequentes de redução de amostragem e precisão. O segundo tipo compreendia dados do ULDS derivados do NIPT de 10.000 gestantes da região de Wuhan.

1. Dados de sequenciamento do genoma completo de alta profundidade

  1. Colete 500 amostras de sangue periférico (5 mL cada) de uma coorte da população geral após consentimento informado. Armazene amostras em tubos EDTA e transporte-as a 2-8 °C.
  2. Centrifuge o sangue a 1.600 x g por 10 minutos a 4 °C para separar plasma e camada buffy. Colete cuidadosamente a camada bege e armazene-a a -80 °C até a extração de DNA.
  3. Extraia DNA genômico do buffy coat usando um kit baseado em contas magnéticas seguindo as instruções do fabricante.
  4. Quantifique a concentração de DNA usando um ensaio fluorométrico e avalie a integridade do DNA por eletroforese em gel de agarose. Selecione amostras com rendimento total de DNA ≥1 μg, concentração ≥12,5 ng/μL e comprimento do fragmento >20 kb sem degradação visível para preparação em biblioteca.
  5. Corte de 80 a 200 ng de DNA genômico de alta qualidade para um tamanho médio de 350-400 pb por ultrasons.
  6. Realizar reparo final a 20 °C por 30 minutos, ligação do adaptador a 20 °C por 15 minutos e circularização a 37 °C por 30 minutos para construir bibliotecas livres de PCR. Gerar nanobolas de DNA (DNBs) usando amplificação por círculo rolante (RCA). Bibliotecas de extremidades pareadas de sequência (PE100, comprimento de leitura 100 bp) em uma plataforma DNBSEQ com profundidade-alvo de ~30x (média de 100 Gb por amostra). Armazene as leituras de sequenciamento bruto no formato FASTQ para análise posterior.
    NOTA: Manusear todas as amostras de origem humana sob condições laboratoriais BSL-2. Evite ciclos repetidos de congelamento e descongelamento para evitar a degradação do DNA. Descartar materiais derivados do sangue como resíduos bio-perigosos; Descarte reagentes químicos seguindo as diretrizes institucionais de resíduos perigosos.

2. Dados NIPT de profundidade ultrabaixa (~0,1x WGS)

  1. Colete 10.000 amostras de sangue materno (5 mL cada) para testes pré-natais não invasivos de rotina (NIPT). Utilizar tubos EDTA e transportar a 2-8 °C; processe o plasma em até 8 horas após a coleta.
  2. Para tubos de DNA circulante estabilizados (tubos K ou tubos G), transporte a 6-35 °C usando transportadores controlados de temperatura e processe em até 96 horas seguindo os procedimentos operacionais padrão do fabricante.
  3. Centrifuge o sangue a 1.600 x g por 10 minutos a 4 °C para separar o plasma. Colete cuidadosamente a camada superior de plasma sem perturbar a camada buffy ou o pellet celular usando uma pipeta e transfira para um novo tubo. Centrifuge novamente o plasma recuperado a 16.000 x g por 10 minutos a 4 °C para remover quaisquer células residuais ou detritos. Transfira cuidadosamente o supernadante clarificado (plasma livre de células) para um tubo fresco para extração de DNA.
  4. Extraia DNA circulante livre de células (cfDNA) do plasma usando um kit de extração de ácidos nucleicos. Realizar reparo final a 20 °C por 30 minutos, ligação do adaptador a 20 °C por 15 minutos e amplificação por PCR (12 ciclos, desnaturação a 98 °C 10 s, recozimento a 60 °C 30 s, extensão a 72 °C 30 s).
  5. Purifique produtos de PCR e circule bibliotecas a 37 °C por 30 minutos. Gerar DNBs via RCA. Bibliotecas de sequência de extremidade única (SE35, comprimento de leitura 35 bp) em uma plataforma BGISEQ-500. Armazene dados brutos de sequenciamento no formato FASTQ.
    NOTA: Manusear amostras de plasma como material potencialmente infeccioso sob condições de BSL-2. Minimize os ciclos de congelamento-descongelamento para reduzir a degradação do cfDNA. Descarte resíduos de plasma e consumíveis plásticos como materiais bio-perigosos.

3. Pipeline de pré-processamento de dados

  1. Para avaliar sistematicamente o desempenho das ferramentas de imputação de genótipo sob diferentes profundidades de sequenciamento, realizar um fluxo de trabalho padronizado de pré-processamento tanto nos dados originais de alta profundidade do WGS (30x) quanto nos dados NIPT de profundidade ultra-baixa (<0,1x), incluindo amostragem simulada, controle de qualidade, alinhamento de leituras, remoção de duplicados e recalibração da pontuação de qualidade base (BQSR).
    NOTA: Os passos a partir deste ponto até a avaliação da precisão da imputação constituem o Protocolo Principal (Figura 1) deste estudo. O código específico pode ser encontrado no Arquivo Suplementar 1.
  2. Amostragem reduzida
    1. Gerar uma série de conjuntos de dados reduzidos a partir das amostras originais de sequenciamento de 30x de alta profundidade. Empregue duas estratégias para imitar realisticamente as características de sequenciamento dos dados do NIPT, conforme descrito abaixo.
    2. Subamostragem aleatória: Use seqtk v1.5 (https://github.com/lh3/seqtk) com uma semente aleatória fixa de 100 para criar quatro níveis de dados de baixa profundidade (0,05x, 0,1x, 0,5x e 1,0x).
    3. Simulação de estrutura de leitura semelhante ao NIPT: Manter apenas a primeira leitura (R1) de cada leitura de extremidade pareada e truncar todas as leituras retidas para 35 bp com seqtk trimfq -L 35, consistente com a natureza típica de leitura curta e de ponta única do sequenciamento NIPT de profundidade ultra-baixa.
  3. Controle de qualidade
    1. Processe todos os arquivos FASTQ brutos com fastp v0.23.420. Use os seguintes parâmetros: --qualified_quality_phred=5 (limiar de qualidade de base), --unqualified_percent_limit=50 (porcentagem máxima de bases de baixa qualidade permitidas), --n_base_limit=10 (máximo de N bases por leitura) e remoção de adaptadores personalizados com --adapter_sequence=AAGTCGGAGGCCAAGCGTCTTAG
      GAAGACAA (R1) e --adapter_sequence_r2=AAGTCGGATCGTAGCC
      ATGTCGTTCTGTGAG
      CCAAGGAGTTG (R2).
    2. Desative o corte de cauda do Poly-G (--disable_trim_poly_g) e gere relatórios em formatos JSON e HTML para cada amostra.
  4. Alinhamento e remoção de duplicados
    1. Alinhe leituras de alta qualidade ao genoma de referência humano GRCh38 (hg38)21 usando BWA v0.7.16a-r118122.
    2. Realize o alinhamento com o algoritmo ALN (-e 10 -t 4 -i 5 -q 0), seguido por samse para alinhamento de extremidade única com informações do grupo de leitura.
    3. Converta os arquivos SAM resultantes para BAM, ordene (samtools sort -@ 8) e remova duplicatas usando SAMtools v1.323 (samtools rmdup). Indexe todos os arquivos BAM.
  5. Recalibração da pontuação de qualidade base (BQSR)
    1. Execute BQSR usando GATK v4.0.4.024. Treine o modelo de recalibração em três conjuntos de dados variantes de alta confiança: dbSNP build 14625, Mills e 1000G goldstandard indels 21, e o arquivo de indels conhecidos do GATK resourcebundle 24 para GRCh38. Os arquivos bundle usados referem-se ao exemplo oficial do GATK (https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json). No total, baixe três arquivos e seus respectivos arquivos de índice.
    2. Execute o BaseRecalibrator seguido do ApplyBQSR para gerar arquivos BAM recalibrados. Indexe todos os BAMs usando SAMtools v1.3.
      NOTA: Todos os conjuntos de dados simulados passaram por passos idênticos de pré-processamento — amostragem descendente, controle de qualidade, alinhamento, remoção de duplicados e BQSR — para garantir consistência e comparabilidade nas avaliações subsequentes de desempenho da imputação.

4. Imputação de genótipo

  1. Preparação de dados
    1. Configuração de conjunto de dados de imputação: Construa múltiplos conjuntos de dados de avaliação para comparar sistematicamente as ferramentas de imputação de genótipos em diferentes profundidades e tamanhos de amostra, conforme descrito abaixo. Um total de nove combinações são formadas com base nos diferentes tamanhos de amostra e profundidades de sequenciamento mencionados acima. Os arquivos de entrada consistem nos dados de sequenciamento das listas de arquivos BAM (bamlist.txt) para os nove subconjuntos mencionados acima após controle de qualidade, armazenados nos arquivos bamlist.txt correspondentes. Outros arquivos de entrada incluem o genoma de referência humano (GRCh3821) e o mapa genético do Projeto 1000Genomas 7.
      1. Dados WGS de alta profundidade reduzidos: Selecione aleatoriamente dois subconjuntos (200 e 500 amostras) de 500 indivíduos sequenciados a 30x de profundidade. Reduza cada subconjunto para quatro profundidades (1x, 0,5x, 0,1x e 0,05x) para gerar oito condições experimentais.
      2. Conjunto de dados ULDS baseado em NIPT: Combine 10.000 amostras NIPT de profundidade ultra-baixa (profundidade média é 0,102x, Figura 2) com 50 amostras de alta profundidade amostradas para 0,1x.
    2. Especificação da região de análise: Restringa todas as análises à região do cromossomo 1 chr1:150.500.000-160.500.000 (10 Mb), com um buffer de 500 kb para imputação, garantindo comparabilidade direta entre ferramentas.
    3. Seleção do painel de referência: Use dois painéis de referência (Tabela 1): o painel CKB, construído a partir de dados populacionais chineses, e o painel 1KGP-EAS, derivado do subconjunto do Leste Asiático do Projeto 1000 Genomas.
      NOTA: O painel de referênciaCKB 15 foi construído usando dados de sequenciamento do genoma completo de alta profundidade (~15x) de 9.964 adultos chineses no Biobanco China Kadoorie, um grande estudo de coorte prospectivo. Essas amostras são derivadas de uma população natural com viés fenotípico mínimo, ancestralidade Han homogênea e estrutura populacional consistente, tornando-as particularmente adequadas para imputação de genótipos em coortes chinesas. Yu et al. 15 demonstraram que, em um GWAS de fenótipo real para altura, a imputação usando o painel CKB triplicou o número de SNPs detectados e dobrou o número de variantes significativas em todo o genoma. O Projeto 1000 Genomas (1KGP)7,26, a referência genômica mais amplamente utilizada, inclui 585 indivíduos em seu subconjunto Fase 3 do Leste Asiático (EAS). Este subconjunto abrange cinco populações do Leste Asiático, que possuem uma profundidade de sequenciamento de aproximadamente 30x, incluindo Han chineses em Pequim (CHB), Han do Sul (CHS), Dai chineses em Xishuangbanna (CDX), Kinh em Ho Chi Minh City, Vietnã (KHV), e japoneses em Tóquio (JPT).
  2. Ferramentas de imputação
    1. Avalie três algoritmos de imputação, escolhidos por suas estratégias de modelagem distintas e aplicabilidade a dados de sequenciamento de ultra-baixa profundidade (ULDS).
      1. STITCH: STITCH (v1.6.6) é um algoritmo de imputação baseado em haplótipos sem referência, que pode opcionalmente incorporar haplótipos de referência externos. Inclua listas BAM, genoma de referência humano (GRCh38) como arquivos de entrada. Prepare arquivos de painel de referência (hap/legend/pos) ao realizar imputação baseada em referência. Inclua os seguintes parâmetros-chave: método=diploide, buffer=500 kb, K=10 haplótipos ancestrais e nGen=4x tamanho de amostra/K (conforme recomendado na documentação do STITCH). Gerar arquivos de saída contendo dosagens por genótipo SNP para todos os indivíduos.
        NOTA: De acordo com a documentação oficial da STITCH, K é o número de haplótipos ancestrais no modelo. Um K maior melhora a precisão da imputação para amostras maiores e coberturas maiores, mas também aumenta o tempo de computação, e a precisão pode diminuir com cobertura menor.
      2. QUILT2: QUILT2 aplica uma abordagem guiada por referência bayesiana otimizada para dados ULDS. Realize a preparação do painel de referência usando o script prepare_reference fornecido, especificando o mapa genético e as coordenadas da região. Execute o modo diploide de imputação com o mesmo tamanho de buffer (500 kb) e configuração nGen do STITCH para garantir comparabilidade.
      3. GLIMPSE2: GLIMPSE2 é uma ferramenta de imputação orientada por referência baseada em HMM, projetada para conjuntos de dados de sequenciamento em grande escala e de muito baixa profundidade. Executar imputação com GLIMPSE2_phase_static, especificando a lista de entrada BAM, painel VCF de referência humana, mapa genético, região de entrada = chr1:150.000.000-161.000.000, região de saída = chr1:150.500.000-160.500.000 (para manter um buffer de 500 kb). O arquivo de lista BAM inserido aqui precisa conter duas colunas: uma é o caminho BAM, e a segunda coluna é o nome de exemplo. Se a segunda coluna não for inserida, cada nome de arquivo BAM será usado como nome de exemplo no arquivo VCF de saída.

5. Avaliação da acuatidão da imputação

  1. Definição do conjunto de verdade
    1. Selecione 50 indivíduos sequenciados com profundidade 30x como o conjunto de dados de verdade. Inclua essas amostras nas condições experimentais de redução de amostragem para garantir comparabilidade.
    2. Realize chamadas variantes para o conjunto de verdade usando o seguinte pipeline: SOAPnuke27 para QC, BWA para alinhamento, Picard para marcação duplicada, GATK v4.0.4.0 BQSR e HaplotypeCaller para chamadas variantes, DPGT (https://github.com/BGI-flexlab/DPGT) para chamadas conjuntas e BCFtools v1.1123 para filtragem de qualidade variante.
    3. Manter apenas variantes PASS de alta confiança para gerar um arquivo VCF de benchmark. Restringa a avaliação para chr1:150.500.000-160.500.000, consistente com os conjuntos de dados imputados.
  2. Harmonização e filtragem de dados
    1. Processar arquivos VCF imputados de todas as ferramentas usando PLINK2.028. Extraia os dados de dosagem e converta para o formato pgen.
    2. Aplique controle de qualidade em nível SNP com os seguintes filtros: frequência de alelos menores (MAF) ≥ 0,05 (--MAF 0,05), valor p do equilíbrio Hardy-Weinberg (HWE) ≥ 1e-6 (--hwe 1e-6), apenas SNPs bialelizados (--max-alelos 2).
    3. Exporte variantes passando QC para formato traw para comparação posterior.
  3. Métricas de precisão
    1. Compare as dosagens imputadas com as dosagens fundamentadas para cada SNP. Calcule os coeficientes de correlação (R) de Pearson em base SNP a SNP, mantenha apenas os locais comuns a ambos os conjuntos de dados e calcule a média dos coeficientes quadráticos de correlação (R²) em todos os SNPs avaliados para quantificar a precisão geral da imputação para cada condição.
    2. Use essa métrica de precisão para capturar a concordância das estimativas de dosagem do genótipo entre genótipos imputados e verdadeiros.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Impacto do tamanho da amostra na precisão da imputação
Aumentar o tamanho da amostra de N = 200 para N = 500 melhorou a precisão da imputação do STITCH, especialmente sob condições de baixa cobertura. Por exemplo, com o painel de referência CKB em cobertura 1x, o STITCH alcançou um R2> de 0,916 (N=500) em comparação com 0,882 (N=200), representando um aumento de 3,4% (Figura 3; Arquivo Suplementar 2).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo avaliou sistematicamente o desempenho de três ferramentas amplamente utilizadas de imputação de genótipos para ULDS, com o WGS de alta profundidade servindo como padrão ouro. Uma força metodológica chave está na adoção de um pipeline unificado de pré-processamento — que abrange alinhamento, controle de qualidade e recalibração da pontuação de qualidade base — que minimize os efeitos em lote e garanta comparabilidade entre ferramentas e condições. Ao reduzir amostras profundam...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram não haver interesses concorrentes.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo foi apoiado pelo Shenzhen Medical Research Fund (B2404004), Programa Nacional de Pesquisa e Desenvolvimento Chave da China (2023YFC2605400, 2022YFC2502402), Programa de Ciência e Tecnologia de Shenzhen (SYSPG20241211173852024), Projeto Aberto de Pesquisa no Laboratório Estatal Chave de Homeostase e Remodelação Vascular (Universidade de Pequim) (2025-SKLVHR-013) e Programa de Pesquisa e Desenvolvimento de Área-Chave da Província de Guangdong (2023B0303040001).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Dados
10.000 amostras de baixa profundidade do NIPTEste artigoDados de sequenciamento genômico completo de ultra baixa profundidade usados como benchmark de imputação.
500 amostras WGS de alta profundidadeEste artigo30 e vezes; WGS de alta profundidade usado como padrão-ouro/conjunto de verdade.
Painel de Referência
Painel de referência 1KGP-EASProjeto 1000 Genomas (Leste Asiático)Subconjunto do 1KGP para imputação específica de ascendência do Leste Asiático.
Painel de referência CKBChina Kadoorie BiobankPainel personalizado específico para a população para imputação de genótipo.
Software e algoritmos
BCFtools v1.11GitHub (samtools/bcftools)Usado para mesclar e ordenar resultados em nível cromossômico e filtrar variantes.
BQSR do conjunto de ferramentas GATK 4.0.4.0Instituto BroadUsado para recalibração da pontuação de qualidade base (BQSR).
BWA-MEM .7.16a-r1181Heng Li / GitHubPara alinhar leituras brutas com GRCh38.
DPGT (Ferramenta de Genética Distribuída de Populações)BGIUma ferramenta distribuída de análise genética populacional que permitiu a chamada conjunta em milhões de amostras do WGS. Disponível em [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)
fastp.0.23.4Código aberto (Chen et al., 2018)Para controle de qualidade e ajuste de adaptadores.
GLIMPSE2Universidade de OxfordFaseamento rápido do genótipo e imputação para WGS de baixa cobertura
Código Original para análisesEste artigoArquivo Suplementar 1 Código original para análises
Kit de ferramentas PicardInstituto BroadUsado para marcar duplicados e conversão de formatos de arquivo.
Plink 2.0C. Chang, S. Purcell / Instituto BroadPara conversão de formato genótipo e análise de associação.
Python 3.8Fundação de Software PythonUsado para script, automação e análise de dados.
QUILT2Instituto de Big Data de OxfordImputação baseada em HMM usando painéis de referência externos
R 4.1.3A Fundação RUsado para rodar STITCH, QUILT2 e plotar/estatísticas.
SAMtools v1.3GitHub (samtools/samtools)Para manipular arquivos SAM/BAM.
Seqtk-1.5GitHub (lh3/seqtk)Toolkit para processar sequências nos formatos FASTA/Q. Disponível em [GitHub - lh3/seqtk](https://github.com/lh3/seqtk)
SOAPnukeBGIPara controle de qualidade e filtragem de dados NGS.
STITCH v1.6.6Universidade de OxfordFerramenta de imputação otimizada para sequenciamento de cobertura ultra-baixa
TabixGitHub (samtools/tabix)Usado para indexação e consulta de arquivos VCF com bgzip.
Outros Materiais
Arquivos do pacote GATKGATKDisponível em [https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json]
Mapa Genético para 1000G (GRCh38)Projeto Oxford / 1000 GenomasNecessário para ferramentas de fase/imputação
GRCh38Consórcio de Referência GenomáticaUsado para alinhamento de leitura e chamada de variantes

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Sequenciamento de Profundidade Ultra BaixaOtimiza o de Pain is de Refer nciaPain is Espec ficos de Popula oSensibilidade do Tamanho da AmostraTeste Pr Natal N o InvasivoLimiares de Profundidade de SequenciamentoEfici ncia Computacional

Artigos relacionados