方法文章

超低深度全基因组测序数据基因型补值工具的综合评估

DOI:

10.3791/68879

2025年12月12日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

三种补值工具——STITCH、QUILT2和GLIMPSE2——在不同测序深度和样本量下进行了基准测试,使用CKB和EAS参考面板。结果为在超低深度测序数据中选择合适的补值策略提供了实用框架,便于大规模群体基因组和复杂性状研究。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

超低深度测序(ULDS)是一种经济高效的大规模基因组研究策略,但其实用性依赖于准确的基因型补值。本研究利用中国嘉道理生物样本库(CKB)和1KGP(1KGP)东亚(EAS)参考面板,评估了三种补补工具——STITCH、QUILT2和GLIMPSE2,采用不同测序深度和样本量。关键性能差异被证明:样本量敏感性:样本量增加时,STITCH的准确性显著提升,而QUILT2和GLIMPSE2对样本量的依赖性极小。参考面板优化:群体特异性CKB显著提高了QUILT2和GLIMPSE2的准确性,但对依赖内部单倍型推断的STITCH影响微乎其微。深度阈值:所有工具在中等测序深度(≥ 0.5倍)下均实现了稳健的精度,但STITCH在超低深度(≤ 0.1倍)下表现明显逊色。GLIMPSE2 CKB实现了最高的整体精度,而QUILT2则在精度和计算效率之间取得了平衡。对于非侵入性产前检测(NIPT)数据,GLIMPSE2+CKB保持了足够准确的后期分析精度。提出了一个决策框架,优先考虑人群匹配面板和深度适配工具,提供可作的指导方针,帮助在不同研究环境中优化ULDS-WGS。这些洞见将方法论的进步与实际应用相结合,使基因组研究能够在不影响数据质量的前提下实现经济高效的规模化。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

超低深度测序(ULDS),定义为测序覆盖率低于1倍倍,因其低成本、广泛的基因组覆盖以及对多种样本类型的兼容性而受到广泛认可。它已在非侵入性产前检测(NIPT)1、癌症监测2以及染色体拷贝数变异(CNV)检测等应用中展现出临床价值3,4。除了临床诊断,测序成本的下降和生物信息学的快速进步使ULDS在群体基因组学和复杂性状研究中发挥了越来越重要的作用。通过结合ULDS数据与群体尺度单倍型参考面板,基因型补补能够在个体层面恢复全基因组变异信息。因此,ULDS已成为传统单核苷酸多态性(SNP)阵列和深度全基因组测序(WGS)5的一种成本效益高的替代方案,尤其是在全基因组关联研究(GWAS)和种群结构分析等大规模研究中。

以往研究已证明利用NIPT测序数据进行各种遗传学研究的可行性,包括变异呼叫、群体历史重建、病毒感染模式推断和GWAS6

尽管有这些优势,ULDS数据极其稀疏,带来了独特的挑战。在变异层面,许多位点完全未被观察,或每个个体仅有一个等位基因,导致数据质量不足,难以进行后续分析。因此,基因型补缺至关重要,利用大型参考面板(如1000个基因组7或群体 特定资源)的单倍型结构,统计学上推断缺失或不确定的基因型。以往研究表明,来自NIPT数据的补值在GWAS中能够实现高准确率,并保持稳健的统计能力,用于识别性状相关变异8。利用STITCH9 算法,成功推估了20,900名中国孕妇队列中的NIPT数据(平均深度~0.15倍),从而识别出与妊娠相关的基因座。推算的基因型与GWAS结果中的WGS深度数据高度一致(Pearson R² > 0.8)10

基于ULDS的分析成功关键在于补补准确性,而补补准确性受测序深度、参考面板质量和群体匹配、补补算法性能、样本量和等位基因频谱11的影响。其中,参考面板的选择是推算准确性的重要决定因素。常用面板包括具有全球代表性的资源,如1000基因组计划(1KGP)7、TOPMed12和单倍型参考联盟(HRC)13,以及日益普及的群体或地区特定面板,如新加坡10,000基因组(SG10K)14、中国嘉道理生物样本库(CKB)15.补值性能的另一个关键因素是算法的选择。为应对低深度测序的独特挑战,已开发出多种工具,显著推动了填补在大规模遗传研究中的实际应用。虽然像Beagle (v5+)16、Minimac417和IMPUTE511 这样的补补方法在SNP阵列和中高深度WGS数据中被广泛使用,但在ULDS设置下它们的表现往往不理想。近年来,专门的工具被开发出来以应对这些挑战。STITCH9 直接通过低深度测序读段推断单倍型,因此特别适用于大型同质队列。QUILT218 采用压缩单倍型库和局部似然模型,实现高效补值,拥有庞大的参考面板,并在产前基因组学中具有独特应用。GLIMPSE219是原始GLIMPSE框架的扩展,在准确性和计算效率方面均有进一步提升。

尽管这些工具代表了重大进展,但它们在不同实验设计(如测序深度、队列规模和参考面板选择)下的相对表现尚未被系统评估,导致研究人员缺乏明确的指导来选择最合适的策略。为弥合这一差距,三种广泛使用的ULDS补值工具——STITCH、QUILT2和GLIMPSE2——在多种测序深度和样本量下进行了系统性基准测试。他们的表现通过两个与中国人群高度相关的东亚参考面板进行了评估。研究结果表明,ULDS补值在测序深度≥0.5倍时通常可靠,而深度<0.1倍则需要更大队列才能达到可接受的精度。参考面板的选择应根据研究情境进行调整,如CKB等群体匹配面板以提高补值准确性。此外,这些方法直接适用于大规模人群研究和NIPT中产生的超低深度数据。因此,本研究为基于ULDS的研究工具选择建立了实用框架,为未来在群体遗传学和复杂性状分析中的应用提供了方法学指导。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

所有参与者在参与前均提供了书面知情同意。涉及WGS深度数据的研究经华大研究所机构审查委员会(BGI-IRB 23058-T2)审核批准,并获得中国人类遗传资源管理局([2023] CJ0262)批准采集人类遗传资源。涉及NIPTULDS数据的研究已获得武汉儿童医院机构审查委员会(2021R062)和华大投资机构审查委员会(BGI-IRB 21088)批准,同时获得中国人类遗传资源管理局([2021] CJ2002)的额外批准。

注意:本研究包含两种类型的WGS数据。第一类是从深圳自然人群队列中招募的500名个体血液样本中获得的深入WGS数据(30xx)。这些数据被用于构建高质量的真实数据集,并用于后续的下采样和准确性评估。第二类是ULDS数据,来源于武汉地区1万名孕妇的NIPT检测。

1. 深入全基因组测序数据

  1. 在知情同意后,从一般人群队列采集500份外周血样(每份5毫升)。将样本储存在EDTA管中,并在2-8°C下运输。
  2. 在1600 x g 下离心血液,4°C下10分钟分离血浆和Buffy涂层。小心收集淡黄褐色的毛皮,并在-80°C下储存,直到提取DNA。
  3. 按照制造商说明,使用磁珠套装从浅棕色毛皮中提取基因组DNA。
  4. 使用荧光测定定量DNA浓度,并通过琼脂糖凝胶电泳评估DNA完整性。选择总DNA产率≥1 μg,浓度≥12.5 ng/μL,片段长度>20 kb且无明显降解的样本,用于文库制备。
  5. 通过超声波剪切80-200 ng高质量基因组DNA至平均350-400碱基对。
  6. 在20°C下进行末端修复30分钟,20°C连接15分钟,37°C圆化30分钟,构建无PCR文库。利用滚动圆扩增(RCA)生成DNA纳米球(DNB)。序列配对端文库(PE100,读长100碱基对)在DNBSQ平台上,目标深度为~30倍(平均每个样本100 Gb)。将原始测序读段以FASTQ格式存储以便下游分析。
    注意:所有人类样本应在BSL-2实验室条件下处理。避免反复的冻融循环,以防止DNA降解。将血液来源的物质作为生物危害废弃物处置;化学试剂应按照机构危险废物指南处理。

2. 超低深度NIPT数据(~0.1倍WGS)

  1. 采集10,000份孕产妇血样(每份5毫升),用于常规非侵入性产前检测(NIPT)。使用EDTA管,并在2-8°C下运输;采集后8小时内处理血浆。
  2. 对于稳定循环DNA管(K管或G管),使用温控载体在6-35°C下运输,并按照制造商的标准作程序在96小时内完成加工。
  3. 在1600 x g 下离心,4°C下离心10分钟以分离血浆。用移液器小心收集上层血浆层,不扰动淡黄褐色外套或细胞沉淀,然后转移到新的管子中。再次以16,000 x g 离心,4°C离心10分钟,去除残留细胞或碎片。小心地将澄清后的上清液(游离血浆)转移到新鲜的管子中提取DNA。
  4. 使用核酸提取试剂盒从血浆中提取循环游细胞DNA(cfDNA)。在20°C下进行端修复30分钟,适配器连接在20°C进行15分钟,并进行PCR扩增(12个周期,98°C变性10秒,60°C退火30秒,72°C延展30秒)。
  5. 纯化PCR产物并在37°C下循环30分钟。通过RCA生成DNB。BGISEQ-500平台上的序列单端库(SE35,读长35 bp)。以FASTQ格式存储原始测序数据。
    注意:在BSL-2条件下,将血浆样本视为潜在感染物质处理。减少冻融循环以减少CFDNA降解。将等离子废弃物和塑料消耗品作为生物危害物质处置。

3. 数据预处理流水线

  1. 为了系统评估基因型补值工具在不同测序深度下的表现,需对原始高深度WGS数据(30倍)和超低深度NIPT数据(<0.1倍)进行标准化预处理流程,包括模拟下采样、质量控制、读段比对、重复消除和基础质量评分重新校准(BQSR)。
    注意:从此点到补值准确性评估的步骤构成了本研究的主要协议(见图1)。具体代码可在 补充文件1中找到。
  2. 降采样
    1. 从原始30倍高深度测序样本生成一系列下采样数据集。采用两种策略,真实模拟NIPT数据的测序特征,如下所述。
    2. 随机子采样:使用seqtk v1.5(https://github.com/lh3/seqtk),随机种子固定为100,生成四级低深度数据(0.05x、0.1x、0.5x和1.0x)。
    3. 类NIPT读序结构模拟:仅保留每个配对端读段的首次读段(R1),并以seqtk trimfq -L 35截断所有保留读段至35个基对,符合超低深度NIPT测序的典型单端短读本特性。
  3. 质量管理
    1. 使用fastp v0.23.420处理所有原始FASTQ文件。使用以下参数:--qualified_quality_phred=5(基质质量阈值),--unqualified_percent_limit=50(允许使用低质量基的最大百分比),--n_base_limit=10(每次读取最多N个基),以及自定义适配器移除,含 --adapter_sequence=AAGTCGGAGGCCAAGGGTCTTAG
      GAAGACAA (R1) 和 --adapter_sequence_r2=AAGTCGGATCGTAGCC
      ATGTCGTTCTGTGTGAG
      CCAAGGAGTTG (R2)。
    2. 禁用Poly-G尾部裁剪(--disable_trim_poly_g),并为每个样本生成JSON和HTML格式的报告。
  4. 对齐与重复消除
    1. 使用BWA v0.7.16a-r118122,将高质量读段比对至人类参考基因组GRCh38 (hg38)21
    2. 先用aln算法(-e 10 -t 4 -i 5 -q 0)进行比对,然后用samse进行单端比对并获取读组信息。
    3. 将生成的 SAM 文件转换为 BAM,排序(samtools sort -@ 8),并使用 SAMtools v1.323 (samtools rmdup)删除重复文件。索引所有BAM文件。
  5. 基础质量评分重新校准(BQSR)
    1. 使用 GATK v4.0.4.024 执行 BQSR。在三个高置信变体数据集上训练重新校准模型:dbSNP build 14625、Mills 和 1000G 金标准 indels21,以及 GRCh38 的 GATK 资源包24 已知 indels 文件。所用的捆绑文件参考了GATK官方示例(https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json)。总共下载三个文件及其对应的索引文件。
    2. 运行BaseRecalibrator,然后应用BQSR生成重新校准的BAM文件。使用 SAMtools v1.3 索引所有 BAM。
      注意:所有模拟数据集均经过相同的预处理——降采样、质量控制、比对、重复消除和BQSR——以确保后续补值性能评估的一致性和可比性。

4. 基因型补缺

  1. 数据准备
    1. 补补数据集设置:构建多个评估数据集,系统地对不同深度和样本量的基因型补补工具进行基准测试,具体如下所述。根据上述不同的样本量和测序深度,总共形成了九种组合。输入文件由上述九个子集的测序数据BAM文件列表(bamlist.txt)组成,这些文件存储在相应的bamlist.txt文件中。其他输入文件包括人类参考基因组(GRCh3821)和1000基因组计划7的遗传图谱。
      1. 下采样高深度WGS数据:从500个个体中随机选择两个子集(200个和500个样本),测序为30倍深度。将每个子集下采样到四个深度(1x、0.5x、0.1x和0.05x),生成八个实验条件。
      2. 基于NIPT的ULDS数据集:将1万个超低深度NIPT样本(平均深度为0.102倍, 见图2)与50个下采样至0.1倍的高深度样本结合起来。
    2. 分析区规范:所有分析限制在染色体1区chr1:150,500,000-160,500,000(10 Mb),并设有500 kb缓冲区用于补值,以确保工具间的直接可比性。
    3. 参考面板选择:使用两个参考面板(见表1):基于中国种群数据构建的CKB面板,以及源自1000基因组计划东亚子集的1KGP-EAS面板。
      注:CKB参考面板15基于中国嘉道理生物库中9,964名中国成年人的深度(~15倍)全基因组测序数据构建,这是一项大型前瞻性队列研究。这些样本来自一个表型偏差极小、汉族血统同质且种群结构一致的自然种群,因此特别适合在中国队列中进行基因型推断。Yu等人15证明,在真实表型身高的GWAS中,利用CKB面板进行补值使检测到的SNP数量增加了三倍,全基因组显著变异数量翻倍。1000基因组计划(1KGP)7,26,是最广泛使用的基因组参考,包含585个个体,属于其东亚(EAS)第三阶段亚集。该子集涵盖了五个东亚人群,测序深度约为30倍,包括北京汉族(CHB)、南汉族(CHS)、西双版纳的中国傣族(CDX)、越南胡志明市的京族(KHV)以及东京的日本族(JPT)。
  2. 补偿工具
    1. 评估三种补补算法,因其独特的建模策略和对超低深度测序(ULDS)数据的适用性而被选中。
      1. STITCH:STITCH(v1.6.6)是一种基于无参考单倍型的补补算法,可以选择性地整合外部参考单倍型。包含BAM列表、人类参考基因组(GRCh38)作为输入文件。在执行基于引用的补值时,准备参考面板文件(hap/legend/pos)。包含以下关键参数:方法=二倍体,缓冲区=500 kb,K=10个祖先单倍型,以及nGen=4倍样本量/K(符合STITCH文档推荐)。生成包含所有个体每个SNP基因型剂量的输出文件。
        注意:根据STITCH官方文档,K是模型中祖先单倍型的数量。更大的 K 能提高样本量更大和更高覆盖率的补值准确率,但也会增加计算时间,且覆盖率越低,准确率可能下降。
      2. QUILT2:QUILT2采用贝叶斯参考引导方法,针对ULDS数据进行了优化。使用提供的prepare_reference脚本进行参考面板准备,指定遗传图谱和区域坐标。运行与STITCH相同的缓冲区大小(500 kb)和nGen设置的补补二倍体模式,以确保可比性。
      3. GLIMPSE2:GLIMPSE2 是一款基于人用模型的引用驱动补补工具,专为大规模且极低深度的测序数据集设计。使用GLIMPSE2_phase_static执行补值,指定输入BAM列表、人类参考VCF面板、遗传图谱,输入区域=chr1:150,000,000-161,000,000,输出区域=chr1:150,500,000-160,500,000(以维持500 kb缓冲区)。这里输入的BAM列表文件需要包含两列:一列是BAM路径,另一列是样本名称。如果未输入第二列,每个 BAM 文件名将作为输出 VCF 文件中的样本名使用。

5. 补值准确性评估

  1. 真值集定义
    1. 选择50个个体,以30倍深度测序作为实地数据集。将这些样本纳入实验降采样条件下,以确保可比性。
    2. 使用以水线执行变体调用以获取真值集:SOAPnuke27 用于QC,BWA用于比对,Picard用于重复标记,GATK v4.0.4.0 BQSR和HaplotypeCaller用于变体调用,DPGT(https://github.com/BGI-flexlab/DPGT)用于联合调用,BCFtools v1.1123 用于变体质量过滤。
    3. 仅保留高置信度的PASS变体以生成基准VCF文件。将评估限制在chr1:150,500,000-160,500,000之间,与推算数据集一致。
  2. 数据协调与过滤
    1. 使用PLINK2.028处理所有工具的代入VCF文件。提取剂量数据并转换为pgen格式。
    2. 使用以下滤镜进行SNP级质量控制:次等位基因频率(MAF)≥0.05(--maf 0.05),哈迪-温伯格平衡(HWE)p值≥1e-6(--hwe 1e-6),仅双等位基因SNP(--最大等位基因2)。
    3. 导出变体通过质检转为Tray格式以便下游比较。
  3. 准确度指标
    1. 将推算剂量与每个SNP的真实剂量进行比较。逐SNP计算皮尔逊相关系数(R),仅保留两数据集共有的点,并计算所有评估SNP的相关系数平方均值(R²),以量化每种条件的整体补值准确率。
    2. 利用该准确度指标捕捉推算基因型与真实基因型之间基因型剂量估计的一致性。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

样本量对补值准确性的影响
将样本量从N=200增加到N=500,提高了STITCH的补补准确性,尤其是在低覆盖条件下。例如,在CKB参考面板覆盖1倍时,STITCH的R2>为0.916(N=500),而为0.882(N=200),提升了3.4% 见图3;补充档案2)。 同样,在0.5倍覆盖率下,其准确率从0.800升至0.868(ΔR2>=8.5%)。相比之下,QUILT2和GLIMPSE2对样本量变异的敏感性极小,R2>波动在所有测试条件下均小于0.5%。例如,QUILT2在CKB面板下保持稳定性能,覆盖率为1倍(R2>N=200时为0.970,N=500时为0.971)。这表明STITCH更适合更大样本量,这与其基于隐马尔可夫模型(HMM)的单倍型推断框架一致。

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究系统评估了三种广泛使用的ULD基因型补值工具的性能,其中深度WGS为金标准。一个关键方法优势在于采用统一的预处理流程——涵盖比对、质量控制和基础质量评分重新校准——以最小化批次效应并确保工具和条件间的可比性。通过对深度测序样本进行下采样,在受控设置下模拟超低深度数据,从而为基准测试提供了客观框架。将分析限制在1号染色体上定义的10 Mb基因组间隔内,确保了计算可行性,同时保持了足够的变异密度。对STITCH、QUILT2和GLIMPSE2的比较评估揭示了各类补算策略的明显优缺点。

测序深度和样本量对估算准确性产生了可预测的影响。准确率急剧下降至深度~0.1倍以下,反映出信息不足,无法可靠地从稀疏的读取数据中恢复单倍型。更大的样本量通过改进对总体单倍型结构的推断来缓解这一限制,这与理论预期一致,即样本越多就能提升补补性能29。结果表明,至少0.5倍的深度对于常见变异体保持可接受的准确性,即使在样本量较小的情况下,而低于0.1倍的深度则需要显著更大的队列才能达到相当...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明没有利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究得到了深圳医学科研基金(B2404004)、中国国家重点研发计划(2023YFC2605400,2022YFC2502402)、深圳科技项目(SYSPG20241211173852024)、国家血管稳态与重塑实验室开放研究项目(2025-SKLVHR-013)和广东省重点区域研发计划(2023B0303040001)的支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Data
10,000个NIPT低深度样本这篇论文用于补值基准的超低深度全基因组测序数据。
500个高深度WGS样本这篇论文30多次;高深度的WGS作为黄金标准/真相设定。
参考面板
1KGP-EAS参考面板1000基因组计划(东亚)1KGP中用于东亚血统特定猜测的子集。
CKB参考面板中国卡多里生物库定制的人群特异性基因型补补面板。
<强力学派>软件与算法
BCFtools v1.11GitHub (samtools/bcftools)用于合并和排序染色体级结果,以及过滤变异。
GATK 4.0.4.0工具集的BQSR布罗德学院用于基础质量评分重新校准(BQSR)。
BWA-MEM .7.16a-r1181Heng Li / GitHub用于将原始读段与GRCh38对齐。
DPGT(分布式群体遗传学工具)华大工业一个分布式群体遗传分析工具,能够联合调用数百万WGS样本。可访问 [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)
fastp.0.23.4开源(Chen 等,2018)用于质量控制和适配器修剪。
GLIMPSE2牛津大学低覆盖率WGS的快速基因型分位与补值
分析原始代码这篇论文补充文件 1 分析原始代码
皮卡尔工具包布罗德学院用于标记重复和文件格式转换。
Plink 2.0C. Chang、S. Purcell / Broad 研究所用于基因型格式转换和关联分析。
Python 3.8Python 软件基础用于脚本编写、自动化和数据分析。
拼布2牛津大数据研究所基于HMM的外部参考面板补补
R 4.1.3R基金会用于运行STITCH、QUILT2以及绘制/统计。
SAMtools v1.3GitHub (samtools/samtools)用于作SAM/BAM文件。
Seqtk-1.5GitHub (lh3/seqtk)用于处理FASTA/Q格式序列的工具包。可于 [GitHub - lh3/seqtk](https://github.com/lh3/seqtk) 获取
SOAPnuke华大工业用于NGS数据质量控制和过滤。
STITCH v1.6.6牛津大学为超低覆盖测序优化的补补工具
塔比克斯GitHub (samtools/tabix)用于索引和查询 bgzip 的 VCF 文件。
<强>其他材料
GATK 捆绑包文件GATK可于[https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json] 获取
1000G(GRCh38)遗传图谱牛津/1000基因组计划相位/补值工具的必备
GRCh38基因组参考联盟用于读取比对和变体调用

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章