$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La secuenciación de ultra baja profundidad (ULDS), definida como cobertura de secuenciación inferior a 1x, ha ganado popularidad debido a su bajo coste, amplia cobertura genómica y compatibilidad con diversos tipos de muestras. Ya ha demostrado valor clínico en aplicaciones como la prueba prenatal no invasiva (NIPT)1, el seguimientodel cáncer 2 y la detección de variaciones en el número de copias cromosómicas(CNV) 3,4. Más allá del diagnóstico clínico, la disminución del coste de secuenciación y los rápidos avances en bioinformática han permitido que ULDS desempeñe un papel creciente en la genómica poblacional y la investigación de rasgos complejos. Al combinar datos ULDS con paneles de referencia de haplotipos a escala poblacional, la imputación de genotipos permite la recuperación de información variante a nivel individual de toda el genoma. Como resultado, ULDS ha surgido como una alternativa rentable a los arreglos tradicionales de polimorfismo de nucleótido único (SNP) y a la secuenciación de genoma completo en profundidad (WGS)5, especialmente en estudios a gran escala como los estudios de asociación genómica a nivel genómico (GWAS) y análisis de estructuras poblacionales.
Investigaciones previas han demostrado la viabilidad de realizar diversos estudios genéticos utilizando datos de secuenciación NIPT, incluyendo la llamada de variantes, la reconstrucción de la historia poblacional, la inferencia de patrones de infección viral y GWAS6.
A pesar de estas ventajas, la naturaleza extremadamente escasa de los datos ULDS presenta desafíos únicos. A nivel de variante, muchos sitios no se observan en absoluto o están representados por un solo alelo por individuo, lo que conduce a una calidad de datos insuficiente para análisis posteriores. Por tanto, la imputación de genotipos es esencial, aprovechando la estructura de los haplotipos de grandes paneles de referencia (por ejemplo, 1000Genomas 7 o recursos específicos de población) para inferir estadísticamente genotipos ausentes o inciertos. Trabajos previos han demostrado que la imputación a partir de datos NIPT puede alcanzar alta precisión y mantener un poder estadístico robusto en GWAS para identificar variantes asociadas arasgos 8. Utilizando el algoritmo STITCH9 , se imputaron con éxito los datos NIPT (profundidad media ~0,15x) en una cohorte de 20.900 mujeres embarazadas chinas, lo que llevó a la identificación de loci asociados al embarazo. Los genotipos imputados mostraron una fuerte concordancia con los datos de WGS de alta profundidad en los resultados GWAS (Pearson R² > 0,8)10.
El éxito de los análisis basados en ULDS depende críticamente de la precisión de la imputación, que está influida por la profundidad de secuenciación, la calidad del panel de referencia y la coincidencia poblacional, el rendimiento del algoritmo de imputación, el tamaño de la muestra y el espectro de frecuenciasalélicas 11. Entre ellos, la elección del panel de referencia es un factor clave para determinar la precisión de la imputación. Los paneles comúnmente utilizados incluyen recursos representativos a nivel global como el Proyecto 1000 Genomas (1KGP)7, TOPMed12 y el Consorcio de Referencia Haplotípica (HRC)13, así como paneles cada vez más disponibles específicos de población o región, como Singapore 10,000 Genomas (SG10K)14, el Biobanco China Kadoorie (CKB)15. Otro factor clave en el rendimiento de la imputación es la elección del algoritmo. Se han desarrollado varias herramientas para adaptarse a los desafíos únicos de la secuenciación de baja profundidad, avanzando significativamente en el uso práctico de la imputación en la investigación genética a gran escala. Aunque métodos de imputación como Beagle (v5+)16, Minimac417 y IMPUTE511 se utilizan ampliamente para datos de array SNP y WGS de profundidad media a alta, a menudo funcionan de forma subóptima en entornos ULDS. Más recientemente, se han desarrollado herramientas especializadas para abordar estos desafíos. STITCH9 infiere haplotipos directamente a partir de lecturas de secuenciación de baja profundidad, lo que lo hace especialmente adecuado para grandes cohortes homogéneas. QUILT218 emplea una biblioteca de haplotipos comprimidos y un modelo de verosimilitud localizada, lo que permite una imputación eficiente con paneles de referencia masivos y ofrece aplicaciones únicas en genómica prenatal. GLIMPSE219, una extensión del marco original de GLIMPSE, ofrece mejoras adicionales tanto en precisión como en eficiencia computacional.
Aunque estas herramientas representan avances importantes, su rendimiento relativo bajo diferentes diseños experimentales (por ejemplo, profundidad de secuenciación, tamaño de cohorte y elección del panel de referencia) no ha sido evaluado sistemáticamente, dejando a los investigadores sin una orientación clara para seleccionar la estrategia más adecuada. Para cerrar esta brecha, tres herramientas de imputación ULDS ampliamente utilizadas —STITCH, QUILT2 y GLIMPSE2— fueron evaluadas sistemáticamente bajo múltiples profundidades de secuenciación y tamaños de muestra. Su desempeño fue evaluado utilizando dos paneles de referencia de Asia Oriental altamente relevantes para las poblaciones chinas. Los hallazgos indican que la imputación ULDS es generalmente fiable a profundidades de secuenciación ≥0,5x, mientras que las profundidades <0,1x requieren cohortes sustancialmente mayores para lograr una precisión aceptable. La selección del panel de referencia debe adaptarse al contexto del estudio, con paneles emparejados por población como CKB que mejoran la precisión de la imputación. Además, estos enfoques son directamente aplicables a datos de ultra baja profundidad generados en estudios poblacionales a gran escala y en el NIPT. Este estudio establece así un marco práctico para la selección de herramientas en la investigación basada en ULDS, proporcionando orientación metodológica para futuras aplicaciones en genética poblacional y análisis complejos de rasgos.