Yöntem makalesi

Ultra Düşük Derinlikli Tüm Genom Dizileme Verileri için Genotip Atama Araçlarının Kapsamlı Değerlendirmesi

DOI:

10.3791/68879

12 Aralık 2025

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Üç emputasyon aracı—STITCH, QUILT2 ve GLIMPSE2—farklı dizileme derinlikleri ve örnek boyutlarında CKB ve EAS referans panelleri kullanılarak kıyaslanmıştır. Sonuçlar, ultra düşük derinlikli dizileme verilerinde uygun emputasyon stratejileri için pratik bir çerçeve sunarak büyük ölçekli popülasyon genomik ve karmaşık özellik çalışmalarını kolaylaştırmaktadır.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ultra düşük derinlikli dizileme (ULDS), büyük ölçekli genomik çalışmalar için maliyet etkin bir stratejidir, ancak faydası doğru genotip atama üzerine kuruludur. Bu çalışma, Çin Kadoorie Biyobankası (CKB) ve 1000 Genomlar Projesi (1KGP) Doğu Asya (EAS) referans panellerini kullanarak farklı dizileme derinlikleri ve örnek boyutlarında üç imputasyon aracını — STITCH, QUILT2 ve GLIMPSE2 — değerlendirmektedir. Kritik performans farklılıkları gösterilmiştir: Örneklem boyutu hassasiyeti: STITCH'in doğruluğu daha büyük örneklerle belirgin şekilde artmışken, QUILT2 ve GLIMPSE2 örneklem büyüklüğüne minimum bağımlılık göstermiştir. Referans paneli optimizasyonu: Popülasyona özgü CKB, QUILT2 ve GLIMPSE2 için doğruluğu önemli ölçüde artırdı ancak iç haplotip çıkarımına dayanan STITCH üzerinde önemsiz bir etkisi oldu. Derinlik eşikleri: Tüm aletler orta derinliklerde (0,5 kat ≥ sağlam doğruluk elde etti, ancak STITCH ultra düşük derinliklerde (≤ 0,1x) oldukça düşük performans gösterdi. CKB ile GLIMPSE2 en yüksek genel doğruluğu sağlarken, QUILT2 hassasiyet ve hesaplama verimliliğini dengeledi. İnvaziv olmayan prenatal test (NIPT) verileri için GLIMPSE2+CKB, sonraki analizler için yeterli doğruluk sağladı. Nüfusa göre eşleştirilmiş paneller ve derinlik uyumlu araçlar önceliklendirilen bir karar çerçevesi önerilmektedir; bu da çeşitli araştırma ortamlarında ULDS-WGS'nin optimize edilmesi için uygulanabilir yönergeler sunar. Bu içgörüler, metodolojik gelişmeleri pratik uygulamayla birleştirir ve genomik çalışmaların veri kalitesinden ödün vermeden maliyet etkin ölçeklendirilmesini sağlar.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ultra düşük derinlikli dizileme (ULDS), 1x altındaki dizileme kapsamı olarak tanımlanır ve düşük maliyeti, geniş genom kapsamı ve çeşitli örnek tipleriyle uyumluluğu sayesinde popülerlik kazanmıştır. Zaten invaziv olmayan prenatal test (NIPT)1, kanser izleme2 ve kromozom kopya sayı varyasyonu (CNV)tespiti 3,4 gibi uygulamalarda klinik değer göstermiştir. Klinik tanıların ötesinde, dizelemenin azalan maliyeti ve biyoinformatikteki hızlı ilerlemeler, ULDS'nin popülasyon genomiğinde ve karmaşık özellik araştırmalarında giderek artan bir rol oynamasını sağlamıştır. ULDS verilerini popülasyon ölçeğindeki haplotip referans panelleriyle birleştirerek, genotip imputasyonu genom genelinde varyant bilgisinin bireysel düzeyde geri kazanılmasını sağlar. Sonuç olarak, ULDS, özellikle genom çapında ilişki çalışmaları (GWAS) ve popülasyon yapısı analizleri gibi büyük ölçekli çalışmalarda, geleneksel tek nükleotid polimorfizm (SNP) dizilerine ve yüksek derinlikli tüm genom dizileme (WGS)5 için maliyet etkin bir alternatif olarak ortaya çıkmıştır.

Önceki araştırmalar, varyant çağrısı, popülasyon geçmişi rekonstrüksiyonu, viral enfeksiyon desenleri çıkarımı ve GWAS6 dahil olmak üzere NIPT dizileme verileriyle çeşitli genetik çalışmaların yapılmasının mümkün olduğunu göstermiştir.

Bu avantajlara rağmen, ULDS verilerinin son derece az olması benzersiz zorluklar yaratmaktadır. Varyant düzeyinde, birçok alan tamamen gözlemlenmez veya birey başına sadece tek bir allel ile temsil edilir, bu da aşağı akış analizleri için yeterli veri kalitesine yol açar. Bu nedenle genotip atama gereklidir; büyük referans panellerinden (örneğin, 1000 Genom7 veya popülasyona özgü kaynaklar) haplotip yapısı kullanılarak eksik veya belirsiz genotipler istatistiksel olarak çıkarılabilir. Önceki çalışmalar, NIPT verilerinden yapılan emputasyonun GWAS'ta yüksek doğruluk sağlayabileceğini ve özellikle ilişkili varyantları tanımlamada sağlam istatistiksel gücükoruyabileceğini göstermiştir 8. STITCH9 algoritması kullanılarak, 20.900 Çinli hamile kadının ortalama derinliği olan NIPT verileri (ortalama derinlik ~0.15x) başarıyla hesablanarak gebelikle ilişkili lokusların tanımlanmasına yol açtı. Atfedilen genotipler, GWAS sonuçlarındaki yüksek derinlikli WGS verileriyle güçlü uyum gösterdi (Pearson R² > 0.8)10.

ULDS tabanlı analizlerin başarısı, sıralama derinliği, referans paneli kalitesi ve popülasyon uyumu, emput algoritması performansı, örneklem büyüklüğü ve allel frekansspektrumu 11 ile etkilenen imputasyon doğruluğuna kritik derecede bağlıdır. Bunlar arasında, referans panelinin seçimi, atleme doğruluğunun önemli belirleyicisidir. Yaygın kullanılan paneller arasında 1000 Genom Projesi (1KGP)7, TOPMed12 ve Haplotype Referans Konsorsiyumu (HRC)13 gibi küresel temsilci kaynaklar ile Singapur 10.000 Genomları (SG10K)14, Çin Kadoorie Biyobankası (CKB)15 gibi giderek daha erişilebilir nüfus veya bölgeye özgü paneller yer alır. Ödeme performansında bir diğer önemli faktör algoritma seçimidir. Düşük derinlikli dizileme gibi benzersiz zorlukları karşılamak için çeşitli araçlar geliştirilmiştir ve büyük ölçekli genetik araştırmalarda emputasyonun pratik kullanımını önemli ölçüde ilerletmiştir. Beagle (v5+)16, Minimac417 ve IMPUTE511 gibi emputasyon yöntemleri SNP dizisi ve orta-yüksek derinlikte WGS verileri için yaygın olarak kullanılırken, ULDS ayarlarında genellikle optimal olmayan performans gösterirler. Son zamanlarda, bu zorlukları ele almak için özel araçlar geliştirilmiştir. STITCH9 , haplotipleri doğrudan düşük derinlikli dizileme okumalarından çıkarır ve bu da onu özellikle büyük homojen kohortlar için uygun kılar. QUILT218 , sıkıştırılmış haplotip kütüphanesi ve lokalize olasılık modeli kullanır; böylece devasa referans panelleriyle verimli bir hesap verim sağlar ve prenatal genomikte benzersiz uygulamalar sunar. GLIMPSE219, orijinal GLIMPSE çerçevesinin bir uzantısı olarak, hem doğruluk hem de hesaplama verimliliğinde ek iyileştirmeler sağlar.

Bu araçlar büyük ilerlemeler olsa da, farklı deneysel tasarımlarda (örneğin, sıralama derinliği, kohort büyüklüğü ve referans paneli seçimi) göreceli performansları sistematik olarak değerlendirilmemiştir ve araştırmacılar en uygun stratejiyi seçme konusunda net rehberlik almamıştır. Bu boşluğu kapatmak için, yaygın olarak kullanılan üç ULDS emputasyon aracı — STITCH, QUILT2 ve GLIMPSE2 — birden fazla dizileme derinliği ve örneklem boyutları altında sistematik olarak kıyaslandı. Performansları, Çin nüfuslarıyla son derece ilgili iki Doğu Asya referans paneli kullanılarak değerlendirildi. Bulgular, ULDS hesablamasının genellikle dizileme derinliklerinde ≥0,5x güvenilir, <0,1x derinliklerde ise kabul edilebilir doğruluk için oldukça daha büyük kohortlar gerektirdiğini göstermektedir. Referans paneli seçimi, çalışma bağlamına göre uyarlanmalı ve CKB gibi popülasyon uyumlu paneller emputasyon doğruluğunu artırmalıdır. Ayrıca, bu yaklaşımlar büyük ölçekli popülasyon çalışmaları ve NIPT ile oluşturulan ultra düşük derinlikli verilere doğrudan uygulanabilir. Bu çalışma, ULDS tabanlı araştırmalarda araç seçimi için pratik bir çerçeve oluşturur ve popülasyon genetiğinde ve karmaşık özellik analizlerinde gelecekteki uygulamalar için metodolojik rehberlik sağlar.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tüm katılımcılar katılımdan önce yazılı bilgilendirilmiş onay sundu. Yüksek derinlikli WGS verilerini içeren çalışma, BGI Kurumsal İnceleme Kurulu (BGI-IRB 23058-T2) tarafından incelenip onaylandı ve insan genetik kaynaklarının toplanması için Çin İnsan Genetik Kaynakları İdaresi'nden onay alındı ([2023] CJ0262). NIPT'den alınan ULDS verilerini içeren çalışma, Wuhan Çocuk Hastanesi Kurumsal İnceleme Kurulu (2021R062) ve BGI Kurumsal İnceleme Kurulu (BGI-IRB 21088) tarafından onaylanmış, ayrıca Çin İnsan Genetik Kaynakları İdaresi'nden ([2021] CJ2002) ek onay almıştır.

NOT: Bu çalışma, iki tür WGS verisini içermiştir. İlk tip, Shenzhen'deki doğal popülasyon kohortundan alınan 500 bireyin kan örneklerinden elde edilen yüksek derinlikli WGS verilerinden (30xx) oluşuyordu. Bu veriler, yüksek kaliteli bir gerçek veri seti oluşturmak ve ardından aşağı örnekleme ile doğruluk değerlendirmeleri için kullanıldı. İkinci tip, Wuhan bölgesinden 10.000 hamile kadının NIPT'sinden alınan ULDS verilerini içeriyordu.

1. Yüksek derinlikli tüm genom dizileme verileri

  1. Bilgilendirilmiş onay alındıktan sonra genel popülasyon grubundan (her biri 5 mL) 500 periferik kan örneği alın. Örnekleri EDTA tüplerinde depolayın ve 2-8 °C'de taşıyın.
  2. Kanı 1.600 x g sıcaklığında 10 dakika boyunca 4 °C'de santrifüj ederek plazma ve buffy paltoyu ayırın. Buffy tüyünü dikkatlice topla ve DNA çıkarımı yapılana kadar -80 °C'de sakla.
  3. Üreticinin talimatlarına uygun olarak manyetik boncuk tabanlı bir kit kullanarak buffy coat'tan genomik DNA çıkarın.
  4. DNA konsantrasyonu florometrik testle nicelendirilin ve agaroz jel elektroforezi ile DNA bütünlüğünü değerlendirin. Toplam DNA verimi ≥1 μg, konsantrasyon ≥12,5 ng/μL ve parça uzunluğu >20 kb görünür bozulma olmadan kütüphane hazırlığı için seçilin.
  5. Ultrasonik ile 80-200 ng yüksek kaliteli genomik DNA keserek ortalama 350-400 bp boyutuna ulaşır.
  6. PCR'siz kütüphaneler oluşturmak için 20 °C'de 30 dakika boyunca son onarım, 15 dakika boyunca 20 °C'de adaptör ligasyonu ve 30 dakika boyunca 37 °C'de dairesel işlem yapılarak PCR'siz kütüphaneler oluşturulur. Yuvarlanan daire amplifikasyonu (RCA) kullanarak DNA nanotopları (DNB) üretin. DNBSEQ platformunda dizis eşleştirilmiş uç kütüphaneleri (PE100, okuma uzunluğu 100 bp) ~30x hedef derinliğe (örnek başına ortalama 100 Gb) ulaştırın. Ham dizileme okumalarını FASTQ formatında depolayın, böylece sonraki analiz yapın.
    NOT: Tüm insan kaynaklı örnekleri BSL-2 laboratuvar koşullarında ele alın. DNA bozulmasını önlemek için tekrar eden donma-erime döngülerinden kaçının. Kan kaynaklı maddeleri biyotehlike atık olarak bertaraf etmek; Kimyasal reaktifleri kurumsal tehlikeli atık yönergelerine uygun olarak bertaraf etmek.

2. Ultra düşük derinlikte NIPT veri (~0.1x WGS)

  1. Rutin invaziv olmayan prenatal test (NIPT) için 10.000 anne kan örneği (her biri 5 mL) alın. EDTA tüpleri kullanın ve 2-8 °C'de taşıma; Plazmayı toplandıktan sonra 8 saat içinde işliyor.
  2. Stabilize dolaşan DNA tüpleri (K-tüpleri veya G-tüpleri) için, sıcaklık kontrollü taşıyıcılar kullanılarak 6-35 °C sıcaklıkta taşınır ve üreticinin standart çalışma prosedürlerini takip ederek 96 saat içinde işlem yapılır.
  3. Plazmayı ayırmak için 1.600 x g hassasiyetinde 10 dakika boyunca 4 °C'de kanı santrifüj yapın. Üst plazma tabakasını pipet kullanarak buffy kaplamayı veya hücre pelletini rahatsız etmeden dikkatlice toplayın ve yeni bir tüpe aktarın. Geri kazanılan plazmayı tekrar 16.000 x g sıcaklığında 4 °C'de 10 dakika boyunca santrifüjlenerek kalan hücreleri veya kalıntıları çıkardı. Şeffaflaştırılmış süpernatantı (hücresiz plazma) dikkatlice yeni bir tüpe aktararak DNA çıkarımı yapılabilir.
  4. Nükleik asit çıkarma kiti kullanarak plazmadan dolaşımda olan hücresiz DNA (cfDNA) çıkarmak. 20 °C'de 30 dakika boyunca son onarım, 15 dakika boyunca 20 °C'de adaptör ligasyonu ve PCR amplifikasyonu (12 döngü, 98 °C denatürasyon 10 saniye, 60 °C tavlama 30 saniye, 72 °C uzatma 30 saniye) uygulanır.
  5. PCR ürünlerini arındırın ve kütüphaneleri 37 °C'de 30 dakika boyunca dairesel hale getirin. RCA üzerinden DNB'ler üretin. Tek uçlu kütüphaneleri (SE35, okuma uzunluğu 35 bp) BGISEQ-500 platformunda diziliyor. Ham dizileme verilerini FASTQ formatında depolayın.
    NOT: BSL-2 koşullarında plazma örneklerini potansiyel olarak bulaşıcı madde olarak ele alın. Donma-erime döngülerini en aza indirerek cfDNA bozulmasını azaltın. Plazma atıkları ve plastik sarf malzemelerini biyolojik zararlı malzeme olarak bertaraf et.

3. Veri ön işleme boru hattı

  1. Genotip uyum araçlarının performansını değişken dizileme derinliklerinde sistematik olarak değerlendirmek için, hem orijinal yüksek derinlikli WGS verileri (30x) hem de ultra düşük derinlikli NIPT verileri (<0.1x) üzerinde simüle edilmiş aşağı sümükleme, kalite kontrolü, okuma hizası, tekrarların çıkarılması ve temel kalite puanı yeniden kalibrasyonu (BQSR) dahil olmak üzere standartlaştırılmış bir ön işleme iş akışı gerçekleştirin.
    NOT: Bu noktadan itibaren ödün doğruluk değerlendirmesine kadar olan adımlar, bu çalışmanın Ana Protokolünü (Şekil 1) oluşturur. Özel kod Ek Dosya 1'de bulunabilir.
  2. Aşağı örnekler
    1. Orijinal 30x yüksek derinlikli dizileme örneklerinden bir dizi aşağı sample'lı veri seti oluşturun. Aşağıda açıklandığı gibi NIPT verilerinin dizileme özelliklerini gerçekçi şekilde taklit etmek için iki strateji kullanın.
    2. Rastgele alt örnekleme: Seqtk v1.5 (https://github.com/lh3/seqtk) ile sabit rastgele 100 tohum kullanarak dört düşük derinlikli veri seviyesi (0.05x, 0.1x, 0.5x ve 1.0x) oluşturulur.
    3. NIPT benzeri okuma yapısı simülasyonu: Her çift uçlu okumanın yalnızca ilk okumasını (R1) tutun ve tüm tutulan okumaları sıralı 35 bp'ye kadar kesin ve seqtk trimfq -L 35 ile kısaltın; bu, ultra düşük derinlikli NIPT dizilemesinin tipik tek uçlu, kısa okuma doğasına uygundur.
  3. Kalite kontrolü
    1. Tüm ham FASTQ dosyalarını fastp v0.23.420 ile işle. Aşağıdaki parametreleri kullanın: --qualified_quality_phred=5 (temel kalite eşiği), --unqualified_percent_limit=50 (izin verilen düşük kaliteli tabanların maksimum yüzdesi), --n_base_limit=10 (okuma başına maksimum N taban) ve --adapter_sequence=AAGTCGGAGGCCAAGCGTCTCTTAG ile özel adaptör çıkarma
      GAAGACAA (R1) ve --adapter_sequence_r2=AAGTCGGATCGTAGCC
      ATGTCGTTCTGTGAG
      CCAAGGAGTTG (R2).
    2. Poly-G kuyruk kesme (--disable_trim_poly_g) devre dışı bırakın ve her örnek için hem JSON hem de HTML formatlarında raporlar oluşturun.
  4. Hizalama ve tekrarların kaldırılması
    1. Yüksek kaliteli okumaları insan referans genomu GRCh38 (hg38)21 ile BWA v0.7.16a-r118122 kullanarak hizalamak.
    2. Hizalama aln algoritması ile (-e 10 -t 4 -i 5 -q 0) gerçekleştirilir, ardından okuma grubu bilgisiyle tek uçlu hizalama için samse yapılır.
    3. Ortaya çıkan SAM dosyalarını BAM'a dönüştürün, sıralayın (samtools sıralaması -@ 8) ve SAMtools v1.323 (samtools rmdup) ile tekrarları kaldırın. Tüm BAM dosyalarını indeksleyin.
  5. Temel kalite puanı yeniden kalibrasyonu (BQSR)
    1. BQSR ile GATK v4.0.4.024 ile gerçekleştirin. Yeniden kalibrasyon modelini üç yüksek güvenli varyant veri seti üzerinde eğitin: dbSNP build 14625, Mills ve 1000G altın standardıindels 21 ve GATK kaynakpaketi 24 bilinen indels dosyası için GRCh38. Kullanılan paket dosyaları GATK resmi örneğine (https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json) atıfta bulunur. Toplamda üç dosya ve onlara karşılık gelen indeks dosyalarını indirin.
    2. BaseRecalibrator'ı çalıştırın, ardından ApplyBQSR'yi çalıştırarak yeniden kalibre edilmiş BAM dosyaları oluşturun. SAMtools v1.3 kullanarak tüm BAM'leri indeksleyin.
      NOT: Tüm simüle edilen veri setleri, sonraki ödümleme performans değerlendirmelerinde tutarlılık ve karşılaştırılabilirliği sağlamak için aynı ön işleme aşamalarından geçti: stepsdowns, kalite kontrol, hizalama, tekrarların kaldırılması ve BQSR.

4. Genotip atama

  1. Veri hazırlama
    1. Atama veri seti kurulumu: Aşağıda açıklandığı gibi farklı derinlikler ve örneklem boyutları arasında genotip emputasyon araçlarını sistematik olarak kıyaslamak için birden fazla değerlendirme veri seti oluşturun. Yukarıda bahsedilen farklı örneklem boyutları ve dizileme derinliklerine göre toplam dokuz kombinasyon oluşturulur. Giriş dosyaları, kalite kontrolünden sonra yukarıda bahsedilen dokuz alt küme için BAM dosya listeleri (bamlist.txt) sıralama verilerinden oluşur ve karşılık gelen bamlist.txt dosyada saklanır. Diğer giriş dosyaları arasında insan referans genomu (GRCh3821) ve 1000 Genomes Project7'den genetik harita bulunmaktadır.
      1. Aşağı derinlikli WGS verileri: 30x derinlikte sıralanmış 500 bireyden iki alt küme (200 ve 500 örnek) rastgele seçilir. Her alt kümeyi dört derinliğe (1x, 0.5x, 0.1x ve 0.05x) indirerek sekiz deneysel koşul oluşturulur.
      2. NIPT tabanlı ULDS veri seti: 10.000 ultra düşük derinlikli NIPT örneğini (ortalama derinlik 0.102x, Şekil 2) 50 yüksek derinlikli örnekle 0.1x'e indirilmiş şekilde birleştirin.
    2. Analiz bölgesi spesifikasyonu: Tüm analizleri kromozom 1 bölgesi chr1:150,500,000-160,500,000 (10 Mb) ile sınırlayın, 500 kb tampon ile araçlar arasında doğrudan karşılaştırılabilirliği sağlar.
    3. Referans paneli seçimi: İki referans paneli kullanın (Tablo 1): Çin nüfus verilerinden oluşturulan CKB paneli ve 1000 Genom Projesi'nin Doğu Asya alt kümesinden türetilen 1KGP-EAS paneli.
      NOT: CKB referanspaneli 15, büyük bir prospektif kohort çalışması olan China Kadoorie Biobank'ta 9.964 Çinli yetişkinin yüksek derinlikli (~15x) tam genom dizileme verileri kullanılarak oluşturulmuştur. Bu örnekler, minimum fenotipik yanlışlık, homojen Han Çinli kökenli ve tutarlı popülasyon yapısına sahip doğal bir popülasyondan türetilmiştir; bu da onları Çin kohortlarında genotip atama için özellikle uygundur. Yu ve ark. 15, gerçek fenotipli bir boy GWAS'ta, CKB paneli kullanılarak yapılan hesablamanın tespit edilen SNP sayısını üç katına çıkardığını ve genom genelinde anlamlı varyantların sayısını iki katına çıkardığını göstermiştir. En yaygın kullanılan genomik referans olan 1000 Genom Projesi (1KGP)7,26, Doğu Asya (EAS) Faz 3 alt kümesinde 585 bireyi içermektedir. Bu alt küme, yaklaşık 30 kat dizileme derinliğine sahip beş Doğu Asya nüfusunu kapsar; bunlar arasında Pekin'deki Han Çinlileri (CHB), Güney Han Çinlileri (CHS), Xishuangbanna'daki Çinli Dai (CDX), Vietnam'daki Ho Chi Minh Şehri'ndeki Kinh (KHV) ve Tokyo'daki Japonlar (JPT) bulunur.
  2. Atama araçları
    1. Farklı modelleme stratejileri ve ultra düşük derinlikli dizileme (ULDS) verilerine uygulanabilirliği nedeniyle seçilen üç imputasyon algoritmasını değerlendirin.
      1. STITCH: STITCH (v1.6.6), isteğe bağlı olarak harici referans haplotipleri de dahil edebilen, referanssız haplotip tabanlı bir emputasyon algoritmasıdır. BAM listeleri, insan referans genomu (GRCh38) giriş dosyaları olarak dahil edin. Referans tabanlı emputasyon yaparken referans panel dosyalarını (hap/legend/pos) hazırlayın. Aşağıdaki temel parametreleri ekleyin: method=diploid, buffer=500 kb, K=10 ata haplotipleri ve nGen=4x örnek büyüklüğü/K (STITCH dokümantasyonunda önerildiği gibi). Tüm bireyler için SNP genotipi başına dozajları içeren çıktı dosyaları oluşturun.
        NOT: STITCH resmi dokümantasyonuna göre, K modeldeki ata-baba haplotiplerin sayısıdır. Daha büyük K, daha büyük örnekler ve daha yüksek kapsamalar için emputasyon doğruluğunu artırır, ancak aynı zamanda hesaplama süresini artırır ve daha düşük kapsama ile doğruluk düşebilir.
      2. QUILT2: QUILT2, ULDS verileri için optimize edilmiş Bayes referans rehberli bir yaklaşım uygular. Verilen prepare_reference senaryosunu kullanarak referans paneli hazırlamayı gerçekleştirin, genetik haritayı ve bölge koordinatlarını belirtin. Karşılaştırılabilirliği sağlamak için STITCH ile aynı tampon boyutu (500 kb) ve nGen ayarıyla imputation diploid modunu çalıştırın.
      3. GLIMPSE2: GLIMPSE2, büyük ölçekli ve çok düşük derinlikli dizileme veri setleri için tasarlanmış HMM tabanlı referans odaklı bir emputasyon aracıdır. GLIMPSE2_phase_static ile imputasyon yürütü, giriş BAM listesini, insan referans VCF panelini, genetik haritayı, giriş bölgesini = chr1:150,000,000-161,000,000, çıkış bölgesi = chr1:150,500,000-160,500,000 (500 kb tampon sağlamak için) belirtin. Buraya girilen BAM liste dosyasının iki sütun içermesi gerekir: biri BAM yolu, ikincisi ise örnek adı. İkinci sütun girilmezse, her BAM dosya adı çıktı VCF dosyasında örnek adı olarak kullanılır.

5. Tümleştirme doğruluk değerlendirmesi

  1. Doğruluk kümesi tanımı
    1. Yeraltı gerçeklik veri seti olarak 30 kat derinlikte dizilen 50 kişiyi seçin. Bu örnekleri karşılaştırılabilirliği sağlamak için deneysel aşağı örnekleme koşullarına dahil edin.
    2. Doğruluk kümesi için varyant çağrısını aşağıdaki boru hattını kullanarak gerçekleştirin: QC için SOAPnuke27 , hizalama için BWA, tekrarlayıcı işaretleme için Picard, varyant çağrısı için GATK v4.0.4.0 BQSR ve HaplotypeCaller, ortak çağrı için DPGT (https://github.com/BGI-flexlab/DPGT) ve varyant kalite filtreleme için BCFtools v1.1123 .
    3. Bir kıyaslama VCF dosyası oluşturmak için yalnızca yüksek güvenliğe sahip PASS varyantlarını kullanın. Değerlendirmeyi, atletilen veri setleriyle uyumlu olarak chr1:150,500,000-160,500,000 arasında sınırlayın.
  2. Veri uyumlaştırması ve filtreleme
    1. Tüm araçlardan VCF dosyalarını PLINK2.028 ile işleyin. Dozaj verilerini çıkarıp PGEN formatına dönüştürün.
    2. SNP seviyesinde kalite kontrolünü aşağıdaki filtrelerle uygulayın: Minör allel frekansı (MAF) ≥ 0.05 (--maf 0.05), Hardy-Weinberg dengesi (HWE) p-değeri ≥ 1e-6 (--hwe 1e-6), sadece biallel SNP'ler (--max-alleller 2).
    3. Aşağı akış karşılaştırması için QC'yi traw formatına geçiren ihracat varyantları.
  3. Doğruluk metrikleri
    1. Her SNP için atandırılan dozajları gerçek dozajlarla karşılaştırın. Pearson korelasyon katsayılarını (R) SNP-sn-SNP bazında hesaplayın, her iki veri setinde ortak olan siteleri koruyun ve her bir koşul için genel emputasyon doğruluğunu nicelikle ölçmek için tüm değerlendirilen SNP'ler arasında kare korelasyon katsayılarının (R²) ortalamasını hesaplayın.
    2. Bu doğruluk metriğini, atleten ve gerçek genotipler arasındaki genotip dozaj tahminlerinin uyumunu yakalamak için kullanın.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Örneklem büyüklüğünün ödünç doğruluğu üzerindeki etkisi
Örneklem büyüklüğünün N = 200'den N = 500'e yükseltilmesi, özellikle düşük kapsama koşullarında STITCH'in emputasyon doğruluğunu artırdı. Örneğin, CKB referans paneli 1x kapsama alanındayken STITCH 0.882 (N=200) ile karşılaştırıldığındaR 2> 0.916 (N=500) ile %3.4 artış elde etti (Şekil 3; Ek Dosya 2). Benzer şekilde, 0,5x kapsama alanında,...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, ULDS için yaygın olarak kullanılan üç genotip imputasyon aracının performansını sistematik olarak değerlendirdi ve yüksek derinlikli WGS altın standart olarak hizmet verdi. Temel metodolojik güçlerden biri, parti etkilerini en aza indiren ve araçlar ile koşullar arasında karşılaştırılabilirliği sağlayan birleşik bir ön işleme boru hattının benimsenmesinde yatıyor — hizalama, kalite kontrolü ve temel kalite puanı yeniden kalibrasyonunu kapsar. Derin dizilenmiş örnekleri aşağı ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar rekabet eden çıkarlar belirtmemektedir.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, Shenzhen Tıbbi Araştırma Fonu (B2404004), Çin Ulusal Ana Araştırma ve Geliştirme Programı (2023YFC2605400, 2022YFC2502402), Shenzhen Bilim ve Teknoloji Programı (SYSPG20241211173852024), Devlet Anahtar Damar Homeostaz ve Yenileme Laboratuvarı (Pekin Üniversitesi) Açık Araştırma Projesi (2025-SKLVHR-013) ve Guangdong Eyaleti Anahtar Alan Araştırma ve Geliştirme Programı (2023B0303040001) tarafından desteklenmiştir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Veri
10.000 NIPT düşük derinlikli örnekBu makaleUltra düşük derinlikli tüm genom dizileme verileri, emputasyon kıyaslaması için kullanılır.
500 yüksek derinlikli WGS örneğiBu makale30& kez; yüksek derinlikli WGS altın standard/doğruluk seti olarak kullanılmıştır.
Referans Paneli
1KGP-EAS referans paneli1000 Genom Projesi (Doğu Asya)Doğu Asya kökenine özgü atama için 1KGP'nin alt kümesi.
CKB referans paneliChina Kadoorie BiobankasıGenotip atama için özel popülasyona özgü panel.
yazılım ve algoritmalar
BCFtools v1.11GitHub (samtools/bcftools)Kromozom düzeyindeki sonuçları birleştirmek ve sıralamak ve varyantları filtrelemek için kullanılır.
GATK 4.0.4.0 araç setinin BQSR'siBroad EnstitüsüTemel kalite puan yeniden kalibrasyonu (BQSR) için kullanılır.
BWA-MEM .7.16a-r1181Heng Li / GitHubHam okumaları GRCh38'e hizalamak için.
DPGT (Dağıtılmış Popülasyon Genetiği Aracı)BGIMilyonlarca WGS örneğinin ortak çağrısını mümkün kılan dağıtık popülasyon genetiği analiz aracı. [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT) adresinde mevcuttur
fastp.0.23.4Açık kaynak (Chen ve ark., 2018)Kalite kontrolü ve adaptör kesme için.
GLIMPSE2Oxford ÜniversitesiDüşük kapsama alanına sahip WGS için hızlı genotip faz belirleme ve emputasyon
Analizler için Orijinal KodBu makaleEk Dosya 1 Analizler için Orijinal Kod
Picard araç setiBroad EnstitüsüKopyaları işaretlemek ve dosya formatı dönüşümü için kullanılır.
Plink 2.0C. Chang, S. Purcell / Broad EnstitüsüGenotip formatı dönüşümü ve ilişkilendirme analizi için.
Python 3.8Python Yazılım VakfıScript oluşturma, otomasyon ve veri analizi için kullanılır.
QUILT2Oxford Büyük Veri EnstitüsüHarici referans panelleri kullanılarak HMM tabanlı emputasyon
R 4.1.3R VakfıSTITCH, QUILT2 ve çizim/istatistik için kullanılıyor.
SAMtools v1.3GitHub (samtools/samtools)SAM/BAM dosyalarını manipüle etmek için.
Seqtk-1.5GitHub (lh3/seqtk)FASTA/Q formatlarında dizileri işlemek için araç seti. [GitHub - lh3/seqtk](https://github.com/lh3/seqtk) adresinde mevcuttur
SOAPnukeBGINGS veri kalite kontrolü ve filtreleme için.
STITCH v1.6.6Oxford ÜniversitesiUltra düşük kapsama dizileme için optimize edilmiş emputasyon aracı
TabixGitHub (samtools/tabix)Bgzip edilmiş VCF dosyalarını indekslemek ve sorgulamak için kullanılır.
Diğer Malzemeler
GATK paket dosyalarıGATK[https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json] adresinden erişilebilir
1000G için Genetik Harita (GRCh38)Oxford / 1000 Genom ProjesiFazlama/Varma Araçları için Gerekli
GRCh38Genom Referans KonsorsiyumuOkuma hizalanması ve varyant çağrısı için kullanılır

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Ultra Low Depth SequencingReference Panel OptimizationPopulation Specific PanelsSample Size SensitivityNon Invasive Prenatal TestingSequencing Depth ThresholdsComputational Efficiency

İlgili makaleler