Artículo de método

Evaluación integral de herramientas de imputación de genotipos para datos de secuenciación de genoma integral de ultra baja profundidad

DOI:

10.3791/68879

12 de diciembre de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se evaluaron tres herramientas de imputación —STITCH, QUILT2 y GLIMPSE2— en diferentes profundidades de secuenciación y tamaños de muestra, utilizando paneles de referencia CKB y EAS. Los resultados proporcionan un marco práctico para seleccionar estrategias de imputación adecuadas en datos de secuenciación de ultra baja profundidad, facilitando estudios genómicos poblacionales y de rasgos complejos a gran escala.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La secuenciación de ultra baja profundidad (ULDS) es una estrategia rentable para estudios genómicos a gran escala, pero su utilidad depende de una imputación precisa del genotipo. Este estudio evalúa tres herramientas de imputación —STITCH, QUILT2 y GLIMPSE2— con diferentes profundidades de secuenciación y tamaños de muestra, utilizando los paneles de referencia del China Kadoorie Biobank (CKB) y The 1000 Genomes Project (1KGP) del Este de Asia (EAS). Se demuestran divergencias críticas en el rendimiento: Sensibilidad al tamaño de la muestra: La precisión de STITCH mejoró notablemente con muestras más grandes, mientras que QUILT2 y GLIMPSE2 mostraron una dependencia mínima del tamaño de la muestra. Optimización del panel de referencia: El CKB específico de la población mejoró significativamente la precisión para QUILT2 y GLIMPSE2 pero tuvo un impacto insignificante en STITCH, que depende de la inferencia interna de haplotipos. Umbrales de profundidad: Todas las herramientas lograron una precisión robusta a profundidades moderadas de secuenciación (≥ 0,5x), pero STITCH rindió drásticamente inferior a profundidades ultrabajas (≤ 0,1x). GLIMPSE2 con CKB ofrecía la mayor precisión global, mientras que QUILT2 equilibraba precisión y eficiencia computacional. Para los datos de pruebas prenatales no invasivas (NIPT), GLIMPSE2+CKB mantuvo una precisión suficiente para análisis posteriores. Se propone un marco de decisión que prioriza paneles emparejados por población y herramientas adaptadas en profundidad, ofreciendo directrices prácticas para optimizar ULDS-WGS en entornos de investigación diversos. Estos conocimientos conectan los avances metodológicos con la implementación práctica, permitiendo una escala rentable de los estudios genómicos sin comprometer la calidad de los datos.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La secuenciación de ultra baja profundidad (ULDS), definida como cobertura de secuenciación inferior a 1x, ha ganado popularidad debido a su bajo coste, amplia cobertura genómica y compatibilidad con diversos tipos de muestras. Ya ha demostrado valor clínico en aplicaciones como la prueba prenatal no invasiva (NIPT)1, el seguimientodel cáncer 2 y la detección de variaciones en el número de copias cromosómicas(CNV) 3,4. Más allá del diagnóstico clínico, la disminución del coste de secuenciación y los rápidos avances en bioinformática han permitido que ULDS desempeñe un papel creciente en la genómica poblacional y la investigación de rasgos complejos. Al combinar datos ULDS con paneles de referencia de haplotipos a escala poblacional, la imputación de genotipos permite la recuperación de información variante a nivel individual de toda el genoma. Como resultado, ULDS ha surgido como una alternativa rentable a los arreglos tradicionales de polimorfismo de nucleótido único (SNP) y a la secuenciación de genoma completo en profundidad (WGS)5, especialmente en estudios a gran escala como los estudios de asociación genómica a nivel genómico (GWAS) y análisis de estructuras poblacionales.

Investigaciones previas han demostrado la viabilidad de realizar diversos estudios genéticos utilizando datos de secuenciación NIPT, incluyendo la llamada de variantes, la reconstrucción de la historia poblacional, la inferencia de patrones de infección viral y GWAS6.

A pesar de estas ventajas, la naturaleza extremadamente escasa de los datos ULDS presenta desafíos únicos. A nivel de variante, muchos sitios no se observan en absoluto o están representados por un solo alelo por individuo, lo que conduce a una calidad de datos insuficiente para análisis posteriores. Por tanto, la imputación de genotipos es esencial, aprovechando la estructura de los haplotipos de grandes paneles de referencia (por ejemplo, 1000Genomas 7 o recursos específicos de población) para inferir estadísticamente genotipos ausentes o inciertos. Trabajos previos han demostrado que la imputación a partir de datos NIPT puede alcanzar alta precisión y mantener un poder estadístico robusto en GWAS para identificar variantes asociadas arasgos 8. Utilizando el algoritmo STITCH9 , se imputaron con éxito los datos NIPT (profundidad media ~0,15x) en una cohorte de 20.900 mujeres embarazadas chinas, lo que llevó a la identificación de loci asociados al embarazo. Los genotipos imputados mostraron una fuerte concordancia con los datos de WGS de alta profundidad en los resultados GWAS (Pearson R² > 0,8)10.

El éxito de los análisis basados en ULDS depende críticamente de la precisión de la imputación, que está influida por la profundidad de secuenciación, la calidad del panel de referencia y la coincidencia poblacional, el rendimiento del algoritmo de imputación, el tamaño de la muestra y el espectro de frecuenciasalélicas 11. Entre ellos, la elección del panel de referencia es un factor clave para determinar la precisión de la imputación. Los paneles comúnmente utilizados incluyen recursos representativos a nivel global como el Proyecto 1000 Genomas (1KGP)7, TOPMed12 y el Consorcio de Referencia Haplotípica (HRC)13, así como paneles cada vez más disponibles específicos de población o región, como Singapore 10,000 Genomas (SG10K)14, el Biobanco China Kadoorie (CKB)15. Otro factor clave en el rendimiento de la imputación es la elección del algoritmo. Se han desarrollado varias herramientas para adaptarse a los desafíos únicos de la secuenciación de baja profundidad, avanzando significativamente en el uso práctico de la imputación en la investigación genética a gran escala. Aunque métodos de imputación como Beagle (v5+)16, Minimac417 y IMPUTE511 se utilizan ampliamente para datos de array SNP y WGS de profundidad media a alta, a menudo funcionan de forma subóptima en entornos ULDS. Más recientemente, se han desarrollado herramientas especializadas para abordar estos desafíos. STITCH9 infiere haplotipos directamente a partir de lecturas de secuenciación de baja profundidad, lo que lo hace especialmente adecuado para grandes cohortes homogéneas. QUILT218 emplea una biblioteca de haplotipos comprimidos y un modelo de verosimilitud localizada, lo que permite una imputación eficiente con paneles de referencia masivos y ofrece aplicaciones únicas en genómica prenatal. GLIMPSE219, una extensión del marco original de GLIMPSE, ofrece mejoras adicionales tanto en precisión como en eficiencia computacional.

Aunque estas herramientas representan avances importantes, su rendimiento relativo bajo diferentes diseños experimentales (por ejemplo, profundidad de secuenciación, tamaño de cohorte y elección del panel de referencia) no ha sido evaluado sistemáticamente, dejando a los investigadores sin una orientación clara para seleccionar la estrategia más adecuada. Para cerrar esta brecha, tres herramientas de imputación ULDS ampliamente utilizadas —STITCH, QUILT2 y GLIMPSE2— fueron evaluadas sistemáticamente bajo múltiples profundidades de secuenciación y tamaños de muestra. Su desempeño fue evaluado utilizando dos paneles de referencia de Asia Oriental altamente relevantes para las poblaciones chinas. Los hallazgos indican que la imputación ULDS es generalmente fiable a profundidades de secuenciación ≥0,5x, mientras que las profundidades <0,1x requieren cohortes sustancialmente mayores para lograr una precisión aceptable. La selección del panel de referencia debe adaptarse al contexto del estudio, con paneles emparejados por población como CKB que mejoran la precisión de la imputación. Además, estos enfoques son directamente aplicables a datos de ultra baja profundidad generados en estudios poblacionales a gran escala y en el NIPT. Este estudio establece así un marco práctico para la selección de herramientas en la investigación basada en ULDS, proporcionando orientación metodológica para futuras aplicaciones en genética poblacional y análisis complejos de rasgos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos los participantes proporcionaron su consentimiento informado por escrito antes de participar. El estudio, que involucró datos de alto nivel de WGS, fue revisado y aprobado por la Junta de Revisión Institucional del BGI (BGI-IRB 23058-T2), y se obtuvo la aprobación para la recopilación de recursos genéticos humanos de la Administración de Recursos Genéticos Humanos de China ([2023] CJ0262). El estudio que incluyó datos ULDS del NIPT fue aprobado por la Junta de Revisión Institucional del Hospital Infantil de Wuhan (2021R062) y la Junta de Revisión Institucional BGI (BGI-IRB 21088), con aprobación adicional de la Administración de Recursos Genéticos Humanos de China ([2021] CJ2002).

NOTA: Este estudio incluyó dos tipos de datos WGS. El primer tipo consistió en datos de WGS de gran profundidad (30xx) obtenidos de muestras de sangre de 500 individuos reclutados de una cohorte poblacional natural en Shenzhen. Estos datos se utilizaron para construir un conjunto de datos de verificación de terreno de alta calidad y para posteriores evaluaciones de reducción de muestras y precisión. El segundo tipo comprendía datos ULDS derivados del NIPT de 10.000 mujeres embarazadas de la zona de Wuhan.

1. Datos de secuenciación del genoma completo de alta profundidad

  1. Recoger 500 muestras de sangre periférica (5 mL cada una) de una cohorte de población general tras consentimiento informado. Almacena muestras en tubos EDTA y transpóltalas a 2-8 °C.
  2. Centrifugar la sangre a 1.600 x g durante 10 minutos a 4 °C para separar plasma y capa buffy. Recoge cuidadosamente el pelaje crema y guárdalo a -80 °C hasta la extracción de ADN.
  3. Extrae ADN genómico de la capa buffy usando un kit basado en perlas magnéticas siguiendo las instrucciones del fabricante.
  4. Cuantificar la concentración de ADN mediante un ensayo fluorométrico y evaluar la integridad del ADN mediante electroforesis en gel de agarosa. Selecciona muestras con un rendimiento total de ADN ≥1 μg, concentración ≥12,5 ng/μL y longitud del fragmento >20 kb sin degradación visible para la preparación en biblioteca.
  5. Cizalla entre 80 y 200 ng de ADN genómico de alta calidad hasta un tamaño medio de 350-400 pb mediante ultrasonicación.
  6. Realizar reparaciones finales a 20 °C durante 30 minutos, ligación de adaptadores a 20 °C durante 15 minutos y circularización a 37 °C durante 30 minutos para construir bibliotecas libres de PCR. Genera nanobolas de ADN (DNBs) usando amplificación por círculo rodante (RCA). Bibliotecas de extremos emparejados de secuencia (PE100, longitud de lectura 100 bp) en una plataforma DNBSEQ a una profundidad objetivo de ~30x (media 100 Gb por muestra). Almacena las lecturas de secuenciación en bruto en formato FASTQ para análisis posteriores.
    NOTA: Manipular todas las muestras de origen humano bajo condiciones de laboratorio BSL-2. Evita ciclos repetidos de congelación y descongelación para evitar la degradación del ADN. Eliminar materiales derivados de la sangre como residuos biopeligrosos; Eliminar los reactivos químicos siguiendo las directrices institucionales sobre residuos peligrosos.

2. Datos NIPT de profundidad ultra baja (~0,1x WGS)

  1. Recoger 10.000 muestras de sangre materna (5 mL cada una) para pruebas prenatales no invasivas rutinarias (NIPT). Utilizar tubos EDTA y transportar a 2-8 °C; procesar plasma en un plazo de 8 horas desde la recogida.
  2. Para tubos de ADN circulante estabilizados (tubos K o tubos G), transportar a 6-35 °C utilizando portadores controlados por temperatura y procesar en un plazo de 96 horas siguiendo los procedimientos operativos estándar del fabricante.
  3. Centrifugar la sangre a 1.600 x g durante 10 minutos a 4 °C para separar el plasma. Recoge cuidadosamente la capa superior de plasma sin alterar la capa buffy o el pellet celular usando una pipeta y transfiere a un tubo nuevo. Centrifugar el plasma recuperado de nuevo a 16.000 x g durante 10 minutos a 4 °C para eliminar cualquier celda residual o residuo. Transfiere cuidadosamente el sobrenadante clarificado (plasma libre de células) a un tubo fresco para la extracción de ADN.
  4. Extrae ADN libre de células circulantes (cfDNA) del plasma utilizando un kit de extracción de ácidos nucleicos. Realizar reparación final a 20 °C durante 30 minutos, ligación del adaptador a 20 °C durante 15 minutos y amplificación por PCR (12 ciclos, desnaturalización a 98 °C 10 s, recocido a 60 °C 30 s, extensión 72 °C 30 s).
  5. Purifica los productos de PCR y circulariza las bibliotecas a 37 °C durante 30 minutos. Genera DNBs a través de RCA. Bibliotecas de secuencia de extremo único (SE35, longitud de lectura 35 pb) en una plataforma BGISEQ-500. Almacena los datos de secuenciación en bruto en formato FASTQ.
    NOTA: Manipular muestras de plasma como material potencialmente infeccioso bajo condiciones de BSL-2. Minimizar los ciclos de congelación y deshielo para reducir la degradación del cfDNA. Eliminar residuos de plasma y consumibles plásticos como material biopeligroso.

3. Pipeline de preprocesamiento de datos

  1. Para evaluar sistemáticamente el rendimiento de las herramientas de imputación de genotipos bajo diferentes profundidades de secuenciación, se realiza un flujo de trabajo estandarizado de preprocesamiento tanto en los datos originales de alta profundidad de WGS (30x) como en los datos NIPT de ultra baja profundidad (<0,1x), incluyendo simulación de reducción de muestreo, control de calidad, alineación de lecturas, eliminación de duplicados y recalibración de puntuaciones de calidad base (BQSR).
    NOTA: Los pasos desde este punto hasta la evaluación de la precisión de la imputación constituyen el Protocolo Principal (Figura 1) de este estudio. El código específico se puede encontrar en el Archivo Suplementario 1.
  2. Muestreo reducido
    1. Genera una serie de conjuntos de datos con muestreo reducido a partir de las muestras originales de secuenciación de 30x de alta profundidad. Emplear dos estrategias para imitar de forma realista las características de secuenciación de los datos del NIPT como se describe a continuación.
    2. Submuestreo aleatorio: Usa seqtk v1.5 (https://github.com/lh3/seqtk) con una semilla aleatoria fija de 100 para crear cuatro niveles de datos de baja profundidad (0,05x, 0,1x, 0,5x y 1,0x).
    3. Simulación de estructura de lectura tipo NIPT: Conservar solo la primera lectura (R1) de cada lectura de extremo emparejado y truncar todas las lecturas retenidas a 35 bp con seqtk trimfq -L 35, consistente con la naturaleza típica de lectura corta y de extremo único de la secuenciación NIPT de ultra baja profundidad.
  3. Control de calidad
    1. Procesa todos los archivos FASTQ en bruto con fastp v0.23.420. Utiliza los siguientes parámetros: --qualified_quality_phred=5 (umbral de calidad de base), --unqualified_percent_limit=50 (porcentaje máximo de bases de baja calidad permitidas), --n_base_limit=10 (máximo de N bases por lectura), y eliminación de adaptadores personalizados con --adapter_sequence=AAGTCGGAGGCCAAGCGTCTTAG
      GAAGACAA (R1) y --adapter_sequence_r2=AAGTCGGATCGTAGCC
      ATGTCGTTCTGTGAG
      CCAAGGAGTTG (R2).
    2. Desactiva el recorte de cola Poly-G (--disable_trim_poly_g) y genera informes en formatos JSON y HTML para cada muestra.
  4. Alineación y eliminación de duplicados
    1. Alinear lecturas de alta calidad con el genoma de referencia humano GRCh38 (hg38)21 usando BWA v0.7.16a-r118122.
    2. Realiza el alineamiento con el algoritmo ALN (-e 10 -t 4 -i 5 -q 0), seguido de samse para alineación de extremo único con información del grupo de lectura.
    3. Convierte los archivos SAM resultantes a BAM, ordenados (samtools sort -@ 8), y elimina duplicados usando SAMtools v1.323 (samtools rmdup). Indexa todos los archivos BAM.
  5. Recalibración de la puntuación de calidad base (BQSR)
    1. Realiza BQSR usando GATK v4.0.4.024. Entrena el modelo de recalibración con tres conjuntos de datos variantes de alta confianza: dbSNP build 14625, Mills y 1000G goldstandard indels 21, y el archivo de indels conocidos del paquete de recursosGATK 24 para GRCh38. Los archivos de paquetes utilizados hacen referencia al ejemplo oficial de GATK (https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json). En total, descarga tres archivos y sus correspondientes archivos índice.
    2. Ejecuta BaseRecalibrator seguido de ApplyBQSR para generar archivos BAM recalibrados. Indexa todos los BAM usando SAMtools v1.3.
      NOTA: Todos los conjuntos de datos simulados pasaron por pasos idénticos de preprocesamiento: muestreo descendente, control de calidad, alineación, eliminación de duplicados y BQSR, para garantizar la consistencia y comparabilidad en las evaluaciones posteriores de desempeño de la imputación.

4. Imputación de genotipos

  1. Preparación de datos
    1. Configuración de conjuntos de datos de imputación: Construir múltiples conjuntos de datos de evaluación para comparar sistemáticamente las herramientas de imputación de genotipos en diferentes profundidades y tamaños de muestra, como se describe a continuación. Se forman un total de nueve combinaciones basadas en los diferentes tamaños de muestra y profundidades de secuenciación mencionados anteriormente. Los archivos de entrada consisten en los datos de secuenciación de las listas de archivos BAM (bamlist.txt) para los nueve subconjuntos mencionados después del control de calidad, almacenados en los archivos bamlist.txt correspondientes. Otros archivos de entrada incluyen el genoma de referencia humano (GRCh3821) y el mapa genético del Proyecto 1000Genomas 7.
      1. Datos WGS de alta profundidad remuestreados: Seleccionar aleatoriamente dos subconjuntos (200 y 500 muestras) de 500 individuos secuenciados a 30x de profundidad. Reducir cada subconjunto a cuatro profundidades (1x, 0,5x, 0,1x y 0,05x) para generar ocho condiciones experimentales.
      2. Conjunto de datos ULDS basado en NIPT: Combina 10.000 muestras NIPT de ultra baja profundidad (profundidad media es 0,102x, Figura 2) con 50 muestras de alta profundidad reducidas a 0,1x.
    2. Especificación de la región de análisis: Restringir todos los análisis a la región del cromosoma 1 chr1:150,500,000-160,500,000 (10 Mb), con un buffer de 500 kb para la imputación, para garantizar la comparabilidad directa entre herramientas.
    3. Selección del panel de referencia: Utilice dos paneles de referencia (Tabla 1): el panel CKB, construido a partir de datos de población china, y el panel 1KGP-EAS, derivado del subconjunto de Asia Oriental del Proyecto 1000 Genomas.
      NOTA: El panel de referenciaCKB 15 se construyó utilizando datos de secuenciación del genoma completo de alta profundidad (~15x) de 9.964 adultos chinos en el Biobanco de China Kadoorie, un gran estudio prospectivo de cohortes. Estas muestras se derivan de una población natural con sesgo fenotípico mínimo, ascendencia han china homogénea y estructura poblacional consistente, lo que las hace especialmente adecuadas para la imputación de genotipos en cohortes chinas. Yu et al. 15 demostraron que, en un GWAS de fenotipo real para la altura, la imputación usando el panel CKB triplicaba el número de SNPs detectados y duplicaba el número de variantes significativas a nivel genómico. El Proyecto 1000 Genomas (1KGP)7,26, la referencia genómica más utilizada, incluye a 585 individuos en su subconjunto de Fase 3 de Asia Oriental (EAS). Este subconjunto abarca cinco poblaciones de Asia Oriental, que tienen una profundidad de secuenciación de aproximadamente 30x, incluyendo a los chinos han en Pekín (CHB), los chinos Han del sur (CHS), los Dai chinos en Xishuangbanna (CDX), los Kinh en Ciudad Ho Chi Minh, Vietnam (KHV), y los japoneses en Tokio (JPT).
  2. Herramientas de imputación
    1. Evalúa tres algoritmos de imputación, elegidos por sus estrategias de modelado distintas y su aplicabilidad a datos de secuenciación de ultra baja profundidad (ULDS).
      1. STITCH: STITCH (v1.6.6) es un algoritmo de imputación basado en haplotipos sin referencias que puede incorporar opcionalmente haplotipos de referencia externos. Incluye listas BAM, genoma de referencia humano (GRCh38) como archivos de entrada. Prepara los archivos del panel de referencia (hap/legend/pos) al realizar imputaciones basadas en referencias. Incluye los siguientes parámetros clave: método=diploide, búfer=500 kb, K=10 haplotipos ancestrales y nGen=4x tamaño de muestra/K (según se recomienda en la documentación de STITCH). Genera archivos de salida que contengan dosis de genotipo por SNP para todos los individuos.
        NOTA: Según la documentación oficial de STITCH, K es el número de haplotipos ancestrales en el modelo. Un K mayor mejora la precisión de la imputación para muestras más grandes y coberturas más altas, pero también aumenta el tiempo de cálculo, y la precisión puede disminuir con una cobertura menor.
      2. QUILT2: QUILT2 aplica un enfoque bayesiano guiado por referencia optimizado para datos ULDS. Realizar la preparación del panel de referencia utilizando el guion de prepare_reference proporcionado, especificando el mapa genético y las coordenadas de la región. Ejecuta el modo diploide de imputación con el mismo tamaño de búfer (500 kb) y configuración nGen que STITCH para asegurar la comparabilidad.
      3. GLIMPSE2: GLIMPSE2 es una herramienta de imputación basada en HMM y basada en referencias, diseñada para conjuntos de datos de secuenciación a gran escala y de muy poca profundidad. Ejecutar la imputación con GLIMPSE2_phase_static, especificando la lista BAM de entrada, panel VCF de referencia humana, mapa genético, región de entrada = chr1:150.000.000-161.000.000, región de salida = chr1:150.500.000-160.500.000 (para mantener un buffer de 500 kb). El archivo de lista BAM introducido aquí debe contener dos columnas: una es la ruta BAM y la segunda columna es el nombre de ejemplo. Si no se introduce la segunda columna, cada nombre de archivo BAM se usará como nombre de muestra en el archivo VCF de salida.

5. Evaluación de la precisión de la imputación

  1. Definición del conjunto de verdad
    1. Selecciona 50 individuos secuenciados a 30 veces la profundidad como el conjunto de datos de verdad sobre el terreno. Incluir estas muestras en las condiciones experimentales de reducción de muestreo para asegurar la comparabilidad.
    2. Realizar llamadas variantes para el conjunto de verdad usando la siguiente pipeline: SOAPnuke27 para QC, BWA para alineación, Picard para marcado duplicado, GATK v4.0.4.0 BQSR y HaplotypeCaller para llamadas variantes, DPGT (https://github.com/BGI-flexlab/DPGT) para llamadas conjuntas y BCFtools v1.1123 para filtrado de calidad variante.
    3. Conservar solo variantes PASS de alta confianza para generar un archivo VCF de referencia. Restringir la evaluación a chr1:150.500.000-160.500.000, consistente con los conjuntos de datos imputados.
  2. Armonización y filtrado de datos
    1. Procesar archivos VCF imputados desde todas las herramientas usando PLINK2.028. Extrae los datos de dosificación y convértelos a formato pgen.
    2. Aplicar control de calidad a nivel SNP con los siguientes filtros: frecuencia alelada menor (MAF) ≥ 0,05 (--MAF 0,05), valor p de equilibrio Hardy-Weinberg (HWE) ≥ 1e-6 (--hwe 1e-6), solo SNPs bialelis (--max-alelos 2).
    3. Variantes de exportación que pasan QC a formato traw para comparaciones posteriores.
  3. Métricas de precisión
    1. Compara las dosis imputadas con las dosis basadas para cada SNP. Calcular los coeficientes de correlación (R) de Pearson en base SNP por SNP, conservar solo los sitios comunes a ambos conjuntos de datos y calcular la media de los coeficientes de correlación al cuadrado (R²) entre todos los SNP evaluados para cuantificar la precisión global de la imputación para cada condición.
    2. Utiliza esta métrica de precisión para captar la concordancia de las estimaciones de dosis de genotipos entre los genotipos imputados y los verdaderos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Impacto del tamaño de la muestra en la precisión de la imputación
Aumentar el tamaño de la muestra de N = 200 a N = 500 mejoró la precisión de la imputación de STITCH, especialmente bajo condiciones de baja cobertura. Por ejemplo, con el panel de referencia CKB en cobertura 1x, STITCH logró un R2> de 0,916 (N=500) frente a 0,882 (N=200), lo que representa un aumento del 3,4 % (Figura 3; Archivo suplemen...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio evaluó sistemáticamente el rendimiento de tres herramientas ampliamente utilizadas para la imputación de genotipos para ULDS, siendo WGS de gran profundidad el estándar de oro. Una fortaleza metodológica clave radica en la adopción de una cadena unificada de preprocesamiento —que abarca alineación, control de calidad y recalibración de puntuaciones de calidad base— que minimice los efectos por lotes y garantice la comparabilidad entre herramientas y condiciones. Al reducir e...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no declaran intereses en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio fue apoyado por el Fondo de Investigación Médica de Shenzhen (B2404004), el Programa Nacional Clave de Investigación y Desarrollo de China (2023YFC2605400, 2022YFC2502402), el Programa de Ciencia y Tecnología de Shenzhen (SYSPG20241211173852024), el Proyecto de Investigación Abierto en el Laboratorio Clave Estatal de Homeostasis y Remodelación Vascular (Universidad de Pekín) (2025-SKLVHR-013) y el Programa de Investigación y Desarrollo de Áreas Clave de la Provincia de Guangdong (2023B0303040001).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
datos
10.000 muestras NIPT de baja profundidadEste periódicoDatos de secuenciación del genoma completo de ultra baja profundidad usados como referencia de imputación.
500 muestras WGS de alta profundidadEste periódico30 y más veces; WGS de alta profundidad usado como estándar de oro/conjunto de verdad.
Panel de Referencia
Panel de referencia 1KGP-EASProyecto 1000 Genomas (Asia Oriental)Subconjunto de 1KGP para imputación específica de ascendencia asiática oriental.
Panel de referencia CKBBiobanco China KadooriePanel personalizado específico de población para la imputación de genotipos.
software y algoritmos
BCFtools v1.11GitHub (samtools/bcftools)Se utiliza para fusionar y ordenar resultados a nivel cromosómico y filtrar variantes.
BQSR del conjunto de herramientas GATK 4.0.4.0Instituto BroadUtilizado para la recalibración de puntuaciones de calidad base (BQSR).
BWA-MEM .7.16a-r1181Heng Li / GitHubPara alinear lecturas en bruto con GRCh38.
DPGT (Herramienta de Genética de Poblaciones Distribuida)BGIUna herramienta distribuida de análisis genético de poblaciones que permitió la llamada conjunta de millones de muestras de WGS. Disponible en [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)
fastp.0.23.4Código abierto (Chen et al., 2018)Para control de calidad y recorte de adaptadores.
GLIMPSE2Universidad de OxfordFaseación rápida de genotipos e imputación para WGS de baja cobertura
Código original para análisisEste periódicoArchivo suplementario 1 Código original para análisis
Kit de herramientas PicardInstituto BroadSe utiliza para marcar duplicados y convertir formatos de archivo.
Plink 2.0C. Chang, S. Purcell / Instituto BroadPara conversión de formatos de genotipo y análisis de asociaciones.
Python 3.8Fundación de Software PythonSe utiliza para scripting, automatización y análisis de datos.
QUILT2Instituto de Big Data de OxfordImputación basada en HMM utilizando paneles de referencia externos
R 4.1.3La Fundación RSe usa para ejecutar STITCH, QUILT2 y graficar/estadísticas.
SAMtools v1.3GitHub (samtools/samtools)Para manipular archivos SAM/BAM.
Seqtk-1.5GitHub (lh3/seqtk)Kit de herramientas para procesar secuencias en formatos FASTA/Q. Disponible en [GitHub - lh3/seqtk](https://github.com/lh3/seqtk)
SOAPnukeBGIPara control de calidad y filtrado de datos NGS.
STITCH v1.6.6Universidad de OxfordHerramienta de imputación optimizada para la secuenciación de cobertura ultra baja
TabixGitHub (samtools/tabix)Se utiliza para indexar y consultar archivos VCF con bgzip.
Otros materiales
Archivos de paquete GATKGATKDisponible en [https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json]
Mapa genético para 1000G (GRCh38)Oxford / Proyecto 1000 GenomasRequerida para herramientas de fase/imputación
GRCh38Consorcio de Referencia GenomáticaUtilizado para alineación de lecturas y llamadas a variantes

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Secuenciaci n de profundidad ultrabajaoptimizaci n del panel de referenciapaneles espec ficos de poblaci nsensibilidad al tama o de la muestrapruebas prenatales no invasivasumbrales de profundidad de secuenciaci neficiencia computacional

Artículos relacionados