Articolo metodologico

Valutazione completa degli strumenti di imputazione dei genotipi per dati di sequenziamento a ultra-bassa profondità dell'intero genoma

DOI:

10.3791/68879

12 dicembre 2025

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tre strumenti di imputazione - STITCH, QUILT2 e GLIMPSE2 - sono stati valutati su diverse profondità di sequenziamento e dimensioni di campione, utilizzando pannelli di riferimento CKB ed EAS. I risultati forniscono un quadro pratico per selezionare strategie di imputazione appropriate nei dati di sequenziamento a ultra-bassa profondità, facilitando studi genomici di popolazione su larga scala e tratti complessi.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il sequenziamento a ultra-bassa profondità (ULDS) è una strategia economicamente efficace per studi genomici su larga scala, ma la sua utilità dipende dall'imputazione accurata del genotipo. Questo studio valuta tre strumenti di imputazione — STITCH, QUILT2 e GLIMPSE2 — su diverse profondità di sequenziamento e dimensioni di campione, utilizzando i panel di riferimento China Kadoorie Biobank (CKB) e The 1000 Genomes Project (1KGP) dell'Asia orientale (EAS). Vengono dimostrate divergenze critiche nelle prestazioni: Sensibilità alla dimensione del campione: la precisione di STITCH è migliorata notevolmente con campioni più grandi, mentre QUILT2 e GLIMPSE2 mostravano una dipendenza minima dalla dimensione del campione. Ottimizzazione del pannello di riferimento: Il CKB specifico per popolazione ha significativamente migliorato l'accuratezza per QUILT2 e GLIMPSE2 ma ha avuto un impatto trascurabile su STITCH, che si basa sull'inferenza interna degli aplotipi. Soglie di profondità: Tutti gli strumenti hanno raggiunto una precisione robusta a profondità di sequenziamento moderate (≥ 0,5x), ma STITCH ha ottenuto risultati drasticamente inferiori a profondità ultra-basse (≤ 0,1x). GLIMPSE2 con CKB ha garantito la massima accuratezza complessiva, mentre QUILT2 ha bilanciato precisione ed efficienza computazionale. Per i dati di test prenatali non invasivi (NIPT), GLIMPSE2+CKB ha mantenuto una precisione sufficiente per le analisi a valle. Viene proposto un quadro decisionale, che dà priorità a panel abbinati alla popolazione e a strumenti adattati in profondità, offrendo linee guida pratiche per ottimizzare ULDS-WGS in contesti di ricerca diversi. Queste intuizioni collegano i progressi metodologici con l'implementazione pratica, permettendo una scalabilità economica degli studi genomici senza compromettere la qualità dei dati.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il sequenziamento a ultra-bassa profondità (ULDS), definito come copertura di sequenziamento inferiore a 1x, ha guadagnato terreno grazie al suo basso costo, ampia copertura genomica e compatibilità con diversi tipi di campioni. Ha già dimostrato valore clinico in applicazioni come il test prenatale non invasivo (NIPT)1, il monitoraggiodel cancro 2 e la rilevazione della variazione del numero di copie cromosomiche (CNV) 3,4. Oltre alla diagnostica clinica, la diminuzione dei costi del sequenziamento e i rapidi progressi nella bioinformatica hanno permesso alle ULDS di svolgere un ruolo crescente nella genomica delle popolazioni e nella ricerca sui tratti complessi. Combinando i dati ULDS con i pannelli di riferimento degli aplotipi a scala di popolazione, l'imputazione dei genotipi consente il recupero di informazioni varianti a livello individuale a livello individuale di varianti genomiche. Di conseguenza, ULDS è emerso come un'alternativa economicamente efficace agli array tradizionali di polimorfismo a nucleotide singolo (SNP) e al sequenziamento a grande profondità dell'intero genoma (WGS)5, in particolare in studi su larga scala come gli studi di associazione genomica a livello genomico (GWAS) e le analisi della struttura della popolazione.

Ricerche precedenti hanno dimostrato la fattibilità di condurre vari studi genetici utilizzando dati di sequenziamento NIPT, inclusi chiamate varianti, ricostruzione della storia popolazionale, inferenza dei pattern di infezione virale e GWAS6.

Nonostante questi vantaggi, la natura estremamente scarsa dei dati ULDS presenta sfide uniche. A livello variante, molti siti sono completamente non osservati o rappresentati da un solo allele per individuo, portando a una qualità dei dati insufficiente per le analisi a valle. L'imputazione dei genotipi è quindi essenziale, sfruttando la struttura degli aplotipi provenienti da grandi panel di riferimento (ad esempio, 1000 Genomes7 o risorse specifiche per popolazione) per dedurre statisticamente genotipi mancanti o incerti. Lavori precedenti hanno dimostrato che l'imputazione a partire dai dati NIPT può raggiungere un'elevata accuratezza e mantenere un robusto potere statistico nel GWAS per identificare varianti associate atratti 8. Utilizzando l'algoritmo STITCH9 , i dati NIPT (profondità media ~0,15x) in una coorte di 20.900 donne incinte cinesi sono stati imputati con successo, portando all'identificazione di loci associati alla gravidanza. I genotipi imputati hanno mostrato una forte concordanza con i dati WGS ad alta profondità nei risultati GWAS (Pearson R² > 0,8)10.

Il successo delle analisi basate su ULDS dipende criticamente dall'accuratezza dell'imputazione, influenzata dalla profondità del sequenziamento, dalla qualità del pannello di riferimento e dal corrispondenza della popolazione, dalle prestazioni dell'algoritmo di imputazione, dalla dimensione del campione e dallo spettro delle frequenzealleliche 11. Tra questi, la scelta del pannello di riferimento è un fattore determinante importante dell'accuratezza dell'imputazione. I panel comunemente utilizzati includono risorse rappresentative a livello globale come il 1000 Genomes Project (1KGP)7, TOPMed12 e l'Haplotype Reference Consortium (HRC)13, oltre a panel sempre più disponibili per popolazione o regione come Singapore 10,000 Genomes (SG10K)14, la China Kadoorie Biobank (CKB)15. Un altro fattore chiave nelle prestazioni dell'imputazione è la scelta dell'algoritmo. Sono stati sviluppati diversi strumenti per affrontare le sfide uniche del sequenziamento a bassa profondità, promuovendo significativamente l'uso pratico dell'imputazione nella ricerca genetica su larga scala. Sebbene metodi di imputazione come Beagle (v5+)16, Minimac417 e IMPUTE511 siano ampiamente utilizzati per array SNP e dati WGS a profondità media-alta, spesso funzionano in modo subottimale in contesti ULDS. Più recentemente, sono stati sviluppati strumenti specializzati per affrontare queste sfide. STITCH9 deduce aplotipi direttamente da letture di sequenziamento a bassa profondità, rendendolo particolarmente adatto per grandi coorti omogenee. QUILT218 impiega una libreria di aplotipi compressi e un modello di verosimiglianza localizzata, consentendo un'imputazione efficiente con vasti panel di riferimento e offrendo applicazioni uniche nella genomica prenatale. GLIMPSE219, un'estensione del framework originale GLIMPSE, offre ulteriori miglioramenti sia nella precisione che nell'efficienza computazionale.

Sebbene questi strumenti rappresentino grandi progressi, la loro prestazione relativa sotto diversi disegni sperimentali (ad esempio, profondità di sequenziamento, dimensione della coorte e scelta del panel di riferimento) non è stata valutata sistematicamente, lasciando i ricercatori senza una guida chiara sulla scelta della strategia più appropriata. Per colmare questo divario, tre strumenti di imputazione ULDS ampiamente utilizzati — STITCH, QUILT2 e GLIMPSE2 — sono stati sistematicamente benchmarkati su molteplici profondità di sequenziamento e dimensioni di campione. Le loro prestazioni sono state valutate utilizzando due panel di riferimento dell'Asia orientale altamente rilevanti per le popolazioni cinesi. I risultati indicano che l'imputazione ULDS è generalmente affidabile a profondità di sequenziamento ≥0,5x, mentre profondità <0,1x richiedono coorti sostanzialmente più grandi per ottenere un'accuratezza accettabile. La selezione dei panelli di riferimento dovrebbe essere adattata al contesto dello studio, con panel abbinati alla popolazione come CKB che migliorano l'accuratezza dell'imputazione. Inoltre, questi approcci sono direttamente applicabili a dati a bassissima profondità generati in studi di popolazione su larga scala e nel NIPT. Questo studio stabilisce quindi un quadro pratico per la selezione degli strumenti nella ricerca basata su ULDS, fornendo indicazioni metodologiche per applicazioni future nella genetica delle popolazioni e nelle analisi di tratti complessi.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tutti i partecipanti hanno fornito un consenso informato scritto prima della partecipazione. Lo studio che ha coinvolto dati WGS ad alto livello di approfondimento è stato esaminato e approvato dal BGI Institutional Review Board (BGI-IRB 23058-T2), e l'approvazione per la raccolta delle risorse genetiche umane è stata ottenuta dall'Amministrazione delle Risorse Genetiche Umane della Cina ([2023] CJ0262). Lo studio che ha coinvolto i dati ULDS del NIPT è stato approvato dal Consiglio di Revisione Istituzionale dell'Ospedale Pediatrico di Wuhan (2021R062) e dal Consiglio di Revisione Istituzionale BGI (BGI-IRB 21088), con un'ulteriore approvazione dall'Amministrazione delle Risorse Genetiche Umane della Cina ([2021] CJ2002).

NOTA: Questo studio ha incluso due tipi di dati WGS. Il primo tipo consisteva in dati WGS ad alta profondità (30xx) ottenuti da campioni di sangue di 500 individui reclutati da una coorte di popolazione naturale a Shenzhen. Questi dati sono stati utilizzati per costruire un dataset di verità sul terreno di alta qualità e per successive valutazioni di precisione e di ridimensionamento. Il secondo tipo comprendeva dati ULDS derivati dal NIPT di 10.000 donne in gravidanza dell'area di Wuhan.

1. Dati di sequenziamento del genoma completo ad alta profondità

  1. Raccogliere 500 campioni di sangue periferico (5 mL ciascuno) da una coorte della popolazione generale dopo il consenso informato. Conservare i campioni in tubi EDTA e trasportarli a 2-8 °C.
  2. Centrifugare il sangue a 1.600 x g per 10 minuti a 4 °C per separare plasma e rivestimento buffy. Raccogli con cura il mantello color buffy e conservalo a -80 °C fino all'estrazione del DNA.
  3. Estrarre il DNA genomico da buffy coat utilizzando un kit a perla magnetica seguendo le istruzioni del produttore.
  4. Quantificare la concentrazione di DNA tramite un test fluorometrico e valutare l'integrità del DNA tramite elettroforesi su gel di agarosio. Selezionare campioni con reso totale di DNA ≥1 μg, concentrazione ≥12,5 ng/μL e lunghezza del frammento >20 kb senza degradazione visibile per la preparazione della libreria.
  5. Taglia 80-200 ng di DNA genomico di alta qualità a una dimensione media di 350-400 bp tramite ultrasonicazione.
  6. Eseguire la riparazione terminale a 20 °C per 30 minuti, la ligatura degli adattatori a 20 °C per 15 minuti e la circolarizzazione a 37 °C per 30 minuti per costruire librerie senza PCR. Genera nanosfere di DNA (DNB) utilizzando l'amplificazione a cerchio rotante (RCA). Librerie a fine accoppiata di sequenze (PE100, lunghezza di lettura 100 bp) su una piattaforma DNBSEQ fino a una profondità target di ~30x (media 100 Gb per campione). Memorizza le letture grezze di sequenziamento in formato FASTQ per l'analisi a valle.
    NOTA: Maneggiare tutti i campioni di origine umana in condizioni di laboratorio BSL-2. Evitare cicli ripetuti di congelamento-disgelo per prevenire la degradazione del DNA. Smaltire materiali derivati dal sangue come rifiuti biopericolosi; Smaltimento dei reagenti chimici seguendo le linee guida istituzionali sui rifiuti pericolosi.

2. Dati NIPT a profondità ultra-bassa (~0,1x WGS)

  1. Raccogliere 10.000 campioni di sangue materno (5 mL ciascuno) per i test prenatali non invasivi di routine (NIPT). Utilizzare tubi EDTA e trasportare a 2-8 °C; Processare il plasma entro 8 ore dalla raccolta.
  2. Per tubi di DNA circolante stabilizzati (tubi K o G-tube), trasportare a 6-35 °C utilizzando portatori a temperatura controllata e processare entro 96 ore seguendo le procedure operative standard del produttore.
  3. Centrifugare il sangue a 1.600 x g per 10 minuti a 4 °C per separare il plasma. Raccogli con cura lo strato superiore di plasma senza disturbare il buffy coat o il pellet cellulare usando una pipetta e trasferiscilo in un nuovo tubo. Centrifugare nuovamente il plasma recuperato a 16.000 x g per 10 minuti a 4 °C per rimuovere eventuali cellule residue o detriti. Trasferire con cura il supernatant chiarificato (plasma senza cellule) in un tubo fresco per l'estrazione del DNA.
  4. Estrae DNA cellulare libero circolante (cfDNA) dal plasma utilizzando un kit di estrazione di acidi nucleici. Eseguire la riparazione terminale a 20 °C per 30 minuti, la legazione dell'adattatore a 20 °C per 15 minuti e l'amplificazione PCR (12 cicli, denaturazione a 98 °C 10 s, ricottura a 60 °C 30 s, estensione 72 °C 30 s).
  5. Purifica i prodotti PCR e circolari librerie a 37 °C per 30 minuti. Genera DNB tramite RCA. Librerie a singola estremità di sequenza (SE35, lunghezza di lettura 35 bp) su una piattaforma BGISEQ-500. Memorizza i dati grezzi di sequenziamento in formato FASTQ.
    NOTA: Maneggiare campioni di plasma come materiale potenzialmente infettivo in condizioni BSL-2. Minimizzare i cicli di congelamento-disgelo per ridurre la degradazione del cfDNA. Smaltire i rifiuti di plasma e i materiali di consumo in plastica come materiali biopericolosi.

3. Pipeline di preprocessing dati

  1. Per valutare sistematicamente le prestazioni degli strumenti di imputazione del genotipo a profondità di sequenziamento variabili, si effettua un flusso di lavoro standardizzato di preprocessing sia sui dati WGS originali ad alta profondità (30x) sia sui dati NIPT a profondità ultra-bassa (<0,1x), includendo il downsampling simulato, il controllo qualità, l'allineamento delle letture, la rimozione dei duplicati e la ricalibrazione del punteggio di qualità base (BQSR).
    NOTA: I passaggi da questo punto fino alla valutazione dell'accuratezza dell'imputazione costituiscono il Protocollo Principale (Figura 1) di questo studio. Il codice specifico si trova nel File Supplementare 1.
  2. Downsampling
    1. Genera una serie di dataset ridimensionati dai campioni originali di sequenziamento ad alta profondità 30x. Impiegare due strategie per imitare realisticamente le caratteristiche di sequenziamento dei dati NIPT come descritto di seguito.
    2. Sottocampionamento casuale: Usa seqtk v1.5 (https://github.com/lh3/seqtk) con un seed casuale fisso di 100 per creare quattro livelli di dati a bassa profondità (0,05x, 0,1x, 0,5x e 1,0x).
    3. Simulazione della struttura di lettura simile al NIPT: Mantenere solo la prima lettura (R1) di ogni lettura a estremità accoppiata e troncare tutte le letture trattenute a 35 bp con seqtk trimfq -L 35, coerente con la tipica lettura a un'estrema estremità e lettura corta del sequenziamento NIPT a profondità ultra-bassa.
  3. Controllo qualità
    1. Elabora tutti i file grezzi FASTQ con fastp v0.23.420. Usa i seguenti parametri: --qualified_quality_phred=5 (soglia di qualità delle basi), --unqualified_percent_limit=50 (percentuale massima di basi di bassa qualità consentite), --n_base_limit=10 (massimo N basi per lettura), e rimozione di adattatori personalizzati con --adapter_sequence=AAGTCGGAGGCCAAGCGTCTTAG
      GAAGACAA (R1) e --adapter_sequence_r2=AAGTCGGATCGTAGCC
      ATGTCGTTCTGTGAG
      CCAAGGAGTTG (R2).
    2. Disabilita il tail cutting di Poly-G (--disable_trim_poly_g) e genera report sia in formato JSON che HTML per ogni campione.
  4. Allineamento e rimozione dei duplicati
    1. Allinea le letture di alta qualità al genoma di riferimento umano GRCh38 (hg38)21 usando BWA v0.7.16a-r118122.
    2. Esegui l'allineamento con l'algoritmo ALN (-e 10 -t 4 -i 5 -q 0), seguito da samse per l'allineamento a estremità singola con le informazioni del gruppo di lettura.
    3. Converti i file SAM risultanti in BAM, ordinati (samtools sort -@ 8) e rimuovi i duplicati usando SAMtools v1.323 (samtools rmdup). Indicizza tutti i file BAM.
  5. Ricalibrazione del punteggio di qualità base (BQSR)
    1. Esegui BQSR usando GATK v4.0.4.024. Addestrare il modello di ricalibrazione su tre dataset varianti ad alta fiducia: build 14625 di dbSNP, Mills e 1000G gold standardindels 21, e il file di indel conosciuti del bundle di risorseGATK 24 per GRCh38. I file bundle utilizzati fanno riferimento all'esempio ufficiale GATK (https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json). In totale, scarica tre file e i relativi file indice.
    2. Esegui BaseRecalibrator seguito da ApplyBQSR per generare file BAM ricalibrati. Indicizza tutti i BAM usando SAMtools v1.3.
      NOTA: Tutti i dataset simulati hanno subito passaggi identici di preprocessing - downsampling, controllo qualità, allineamento, rimozione di duplicati e BQSR - per garantire coerenza e comparabilità nelle successive valutazioni delle prestazioni di imputazione.

4. Imputazione del genotipo

  1. Preparazione dei dati
    1. Configurazione dei dataset di imputazione: Costruire molteplici dataset di valutazione per confrontare sistematicamente gli strumenti di imputazione dei genotipi su diverse profondità e dimensioni dei campioni come descritto di seguito. In totale si formano nove combinazioni basate sulle diverse dimensioni del campione e profondità di sequenziamento menzionate sopra. I file di input consistono nelle liste di file BAM (bamlist.txt) di sequenziamento per i nove sottoinsiemi sopra menzionati dopo il controllo qualità, memorizzati in corrispondenti file bamlist.txt. Altri file di input includono il genoma di riferimento umano (GRCh3821) e la mappa genetica del Progetto 1000Genomes 7.
      1. Ricampionamento dei dati WGS ad alta profondità: selezionare casualmente due sottoinsiemi (200 e 500 campioni) da 500 individui sequenziati a 30 volte la profondità. Campionare ogni sottoinsieme a quattro profondità (1x, 0,5x, 0,1x e 0,05x) per generare otto condizioni sperimentali.
      2. Dataset ULDS basato su NIPT: Combinare 10.000 campioni NIPT a profondità ultra-bassa (profondità media 0,102x, Figura 2) con 50 campioni ad alta profondità ridimensionati a 0,1x.
    2. Specifica della regione di analisi: Limitare tutte le analisi alla regione del cromosoma 1 chr1:150,500,000-160,500,000 (10 Mb), con un buffer da 500 kb per l'imputazione, per garantire la comparabilità diretta tra gli strumenti.
    3. Selezione del pannello di riferimento: Utilizzare due pannelli di riferimento (Tabella 1): il pannello CKB, costruito da dati sulla popolazione cinese, e il pannello 1KGP-EAS, derivato dal sottoinsieme dell'Asia orientale del Progetto 1000 Genomi.
      NOTA: Il pannello di riferimentoCKB 15 è stato costruito utilizzando dati di sequenziamento del genoma intero ad alta profondità (~15x) provenienti da 9.964 adulti cinesi della China Kadoorie Biobank, un grande studio di coorte prospettico. Questi campioni derivano da una popolazione naturale con bias fenotipico minimo, ascendenza omogenea cinese Han e una struttura popolazionale coerente, rendendoli particolarmente adatti all'imputazione di genotipi in coorti cinesi. Yu et al. 15 hanno dimostrato che, in un GWAS a fenotipo reale per l'altezza, l'imputazione tramite il pannello CKB triplicava il numero di SNP rilevati e raddoppiava il numero di varianti significative a livello genomico. Il Progetto 1000 Genomi (1KGP)7,26, il riferimento genomico più comunemente utilizzato, include 585 individui nel suo sottoinsieme della Fase 3 dell'Asia orientale (EAS). Questo sottoinsieme copre cinque popolazioni dell'Asia orientale, che hanno una profondità di sequenza di circa 30x, tra cui i cinesi Han a Pechino (CHB), i Han cinesi meridionali (CHS), i Dai cinesi a Xishuangbanna (CDX), i Kinh a Ho Chi Minh City, Vietnam (KHV) e i giapponesi a Tokyo (JPT).
  2. Strumenti di imputazione
    1. Valuta tre algoritmi di imputazione, scelti per le loro strategie di modellazione distinte e per l'applicabilità ai dati di sequenziamento ultra-low-depth (ULDS).
      1. STITCH: STITCH (v1.6.6) è un algoritmo di imputazione basato su aplotipi senza riferimenti che può opzionalmente incorporare aplotipi di riferimento esterni. Includere liste BAM, genoma di riferimento umano (GRCh38) come file di input. Prepara i file del pannello di riferimento (hap/legend/pos) quando si effettua l'imputazione basata sui riferimenti. Includere i seguenti parametri chiave: metodo=diploide, buffer=500 kb, K=10 aplotipi ancestrali e nGen=4x dimensione del campione/K (come raccomandato nella documentazione STITCH). Genera file di output contenenti dosaggi di genotipo per ogni SNP per tutti gli individui.
        NOTA: Secondo la documentazione ufficiale STITCH, K è il numero di aplotipi ancestrali nel modello. Un K maggiore migliora l'accuratezza dell'imputazione per campioni più grandi e coperture più elevate, ma aumenta anche i tempi di calcolo, e la precisione può diminuire con una copertura più bassa.
      2. QUILT2: QUILT2 applica un approccio bayesiano guidato dal riferimento ottimizzato per i dati ULDS. Eseguire la preparazione del pannello di riferimento utilizzando lo script prepare_reference fornito, specificando la mappa genetica e le coordinate della regione. Esegui la modalità diploide di imputazione con la stessa dimensione del buffer (500 kb) e impostazione nGen di STITCH per garantire la comparabilità.
      3. GLIMPSE2: GLIMPSE2 è uno strumento di imputazione basato su HMM e guidato da reference, progettato per dataset di sequenziamento su larga scala e a bassissima profondità. Eseguire l'imputazione con GLIMPSE2_phase_static, specificando la lista BAM di input, il pannello VCF di riferimento umano, la mappa genetica, la regione di input = chr1:150.000.000-161.000.000, la regione di output = chr1:150.500.000-160.500.000 (per mantenere un buffer da 500 kb). Il file di lista BAM inserito qui deve contenere due colonne: una è il percorso BAM, e la seconda è il nome di esempio. Se la seconda colonna non viene inserita, ogni nome di file BAM verrà usato come nome di esempio nel file VCF di uscita.

5. Valutazione dell'accuratezza dell'imputazione

  1. Definizione dell'insieme di verità
    1. Seleziona 50 individui sequenziati a 30 volte la profondità come dataset di accuratezza sul terreno. Includere questi campioni nelle condizioni sperimentali di downsampling per garantire la comparabilità.
    2. Eseguire chiamate variant per il set di verità utilizzando la seguente pipeline:SOAPnuke 27 per QC, BWA per l'allineamento, Picard per la marcatura duplicata, GATK v4.0.4.0 BQSR e HaplotypeCaller per chiamate varianti, DPGT (https://github.com/BGI-flexlab/DPGT) per chiamate congiunte, e BCFtools v1.1123 per il filtraggio di qualità variante.
    3. Mantenere solo varianti PASS ad alta fiducia per generare un file VCF di benchmark. Limitare la valutazione a chr1:150.500.000-160.500.000, coerente con i dataset imputati.
  2. Armonizzazione e filtraggio dei dati
    1. Processa i file VCF imputati da tutti gli strumenti usando PLINK2.028. Estrai i dati di dosaggio e converti in formato pgen.
    2. Applicare il controllo qualità a livello SNP con i seguenti filtri: frequenza allelica minore (MAF) ≥ 0,05 (--MAF 0,05), valore p di equilibrio Hardy-Weinberg (HWE) ≥ 1e-6 (--hwe 1e-6), solo SNP biallelici (--max-alleli 2).
    3. Varianti di esportazione che passano il QC al formato traw per il confronto a valle.
  3. Metriche di accuratezza
    1. Confronta le dosi imputate con quelle reali per ogni SNP. Calcolare i coefficienti di correlazione di Pearson (R) su base SNP per SNP, mantenere solo siti comuni a entrambi i dataset e calcolare la media dei coefficienti di correlazione quadratica (R²) su tutti gli SNP valutati per quantificare l'accuratezza complessiva dell'imputazione per ciascuna condizione.
    2. Utilizzare questa metrica di accuratezza per catturare la concordanza delle stime del dosaggio dei genotipi tra i genotipi imputati e quelli veri.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Impatto della dimensione del campione sull'accuratezza dell'imputazione
Aumentare la dimensione del campione da N = 200 a N = 500 ha migliorato l'accuratezza dell'imputazione di STITCH, specialmente in condizioni di copertura bassa. Ad esempio, con il pannello di riferimento CKB a copertura 1x, STITCH ha raggiunto un R2> di 0,916 (N=500) rispetto a 0,882 (N=200), che rappresenta un aumento del 3,4% (Figura 3

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio ha valutato sistematicamente le prestazioni di tre strumenti di imputazione del genotipo ampiamente utilizzati per ULDS, con WGS ad alta profondità che funge da standard d'oro. Un punto di forza metodologico chiave risiede nell'adozione di una pipeline di preprocessing unificata — che comprende allineamento, controllo qualità e ricalibrazione del punteggio di qualità di base — che minimizzi gli effetti batch e garantisce la comparabilità tra strumenti e condizioni. Attraver...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi in conflitto.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio è stato finanziato dal Shenzhen Medical Research Fund (B2404004), dal National Key Research and Development Program della Cina (2023YFC2605400, 2022YFC2502402), dal Shenzhen Science and Technology Program (SYSPG20241211173852024), dal Progetto di Ricerca Aperto presso il Laboratorio Chiave Statale di Omeostasi e Ristrutturazione Vascolare (Università di Pechino) (2025-SKLVHR-013) e dal Key-Area Research and Development Program della Provincia del Guangdong (2023B0303040001).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
dati
10.000 campioni NIPT a bassa profonditàQuesto articoloDati di sequenziamento del genoma completo a profondità ultra-bassa utilizzati come benchmark di imputazione.
500 campioni WGS ad alta profonditàQuesto articolo30 e volte; WGS ad alta profondità usato come standard d'oro/set di verità di qualità.
Panel di Riferimento
Pannello di riferimento 1KGP-EASProgetto 1000 Genomi (Asia orientale)Sottoinsieme di 1KGP per l'imputazione specifica per ascendenza asiatica orientale.
Pannello di riferimento CKBBanca Biobancaria Kadoorie CinesePanel personalizzato specifico per popolazione per l'imputazione dei genotipi.
Software e algoritmi
BCFtools v1.11GitHub (samtools/bcftools)Utilizzato per unire e ordinare i risultati a livello cromosomico e filtrare varianti.
BQSR dell'arsenale GATK 4.0.4.0Broad InstituteUtilizzato per la ricalibrazione del punteggio di qualità di base (BQSR).
BWA-MEM .7.16a-r1181Heng Li / GitHubPer allineare le letture grezze a GRCh38.
DPGT (Strumento di Genetica delle Popolazioni Distribuite)BGIUno strumento distribuito di analisi genetica delle popolazioni che ha permesso la chiamata congiunta su milioni di campioni WGS. Disponibile su [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)
fastp.0.23.4Open-source (Chen et al., 2018)Per il controllo qualità e il taglio degli adattatori.
GLIMPSE2Università di OxfordRapida fase e imputazione del genotipo per WGS a bassa copertura
Codice originale per le analisiQuesto articoloFile Supplementare 1 Codice originale per le analisi
Kit degli attrezzi PicardBroad InstituteUtilizzato per la segnalazione di duplicati e la conversione di formati di file.
Plink 2.0C. Chang, S. Purcell / Broad InstitutePer la conversione del formato del genotipo e l'analisi delle associazioni.
Python 3.8Python Software FoundationUtilizzato per scripting, automazione e analisi dei dati.
QUILT2Istituto Big Data di OxfordImputazione basata su HMM utilizzando pannelli di riferimento esterni
R 4.1.3La Fondazione RUsato per eseguire STITCH, QUILT2 e grafici/statistiche.
SAMtools v1.3GitHub (samtools/samtools)Per manipolare file SAM/BAM.
Seqtk-1.5GitHub (lh3/seqtk)Toolkit per l'elaborazione di sequenze nei formati FASTA/Q. Disponibile su [GitHub - lh3/seqtk](https://github.com/lh3/seqtk)
SOAPnukeBGIPer il controllo qualità e il filtraggio dei dati NGS.
STITCH v1.6.6Università di OxfordStrumento di imputazione ottimizzato per il sequenziamento a copertura ultra-bassa
TabixGitHub (samtools/tabix)Utilizzato per indicizzare e interrogare file VCF bgzip.
Altri Materiali
Fascicoli GATKGATKDisponibile su [https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json]
Mappa genetica per 1000G (GRCh38)Oxford / Progetto 1000 GenomiRichiesto per strumenti di fase/imputazione
GRCh38Consorzio di Riferimento GenomicoUtilizzato per l'allineamento delle letture e per la chiamata di varianti

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Ultra Low Depth SequencingReference Panel OptimizationPopulation Specific PanelsSample Size SensitivityNon Invasive Prenatal TestingSequencing Depth ThresholdsComputational Efficiency

Articoli correlati