三种补值工具——STITCH、QUILT2和GLIMPSE2——在不同测序深度和样本量下进行了基准测试,使用CKB和EAS参考面板。结果为在超低深度测序数据中选择合适的补值策略提供了实用框架,便于大规模群体基因组和复杂性状研究。
方法文章
三种补值工具——STITCH、QUILT2和GLIMPSE2——在不同测序深度和样本量下进行了基准测试,使用CKB和EAS参考面板。结果为在超低深度测序数据中选择合适的补值策略提供了实用框架,便于大规模群体基因组和复杂性状研究。
超低深度测序(ULDS)是一种经济高效的大规模基因组研究策略,但其实用性依赖于准确的基因型补值。本研究利用中国嘉道理生物样本库(CKB)和1KGP(1KGP)东亚(EAS)参考面板,评估了三种补补工具——STITCH、QUILT2和GLIMPSE2,采用不同测序深度和样本量。关键性能差异被证明:样本量敏感性:样本量增加时,STITCH的准确性显著提升,而QUILT2和GLIMPSE2对样本量的依赖性极小。参考面板优化:群体特异性CKB显著提高了QUILT2和GLIMPSE2的准确性,但对依赖内部单倍型推断的STITCH影响微乎其微。深度阈值:所有工具在中等测序深度(≥ 0.5倍)下均实现了稳健的精度,但STITCH在超低深度(≤ 0.1倍)下表现明显逊色。GLIMPSE2 CKB实现了最高的整体精度,而QUILT2则在精度和计算效率之间取得了平衡。对于非侵入性产前检测(NIPT)数据,GLIMPSE2+CKB保持了足够准确的后期分析精度。提出了一个决策框架,优先考虑人群匹配面板和深度适配工具,提供可作的指导方针,帮助在不同研究环境中优化ULDS-WGS。这些洞见将方法论的进步与实际应用相结合,使基因组研究能够在不影响数据质量的前提下实现经济高效的规模化。
超低深度测序(ULDS),定义为测序覆盖率低于1倍倍,因其低成本、广泛的基因组覆盖以及对多种样本类型的兼容性而受到广泛认可。它已在非侵入性产前检测(NIPT)1、癌症监测2以及染色体拷贝数变异(CNV)检测等应用中展现出临床价值3,4。除了临床诊断,测序成本的下降和生物信息学的快速进步使ULDS在群体基因组学和复杂性状研究中发挥了越来越重要的作用。通过结合ULDS数据与群体尺度单倍型参考面板,基因型补补能够在个体层面恢复全基因组变异信息。因此,ULDS已成为传统单核苷酸多态性(SNP)阵列和深度全基因组测序(WGS)5的一种成本效益高的替代方案,尤其是在全基因组关联研究(GWAS)和种群结构分析等大规模研究中。
以往研究已证明利用NIPT测序数据进行各种遗传学研究的可行性,包括变异呼叫、群体历史重建、病毒感染模式推断和GWAS6。
尽管有这些优势,ULDS数据极其稀疏,带来了独特的挑战。在变异层面,许多位点完全未被观察,或每个个体仅有一个等位基因,导致数据质量不足,难以进行后续分析。因此,基因型补缺至关重要,利用大型参考面板(如1000个基因组7或群体 特定资源)的单倍型结构,统计学上推断缺失或不确定的基因型。以往研究表明,来自NIPT数据的补值在GWAS中能够实现高准确率,并保持稳健的统计能力,用于识别性状相关变异8。利用STITCH9 算法,成功推估了20,900名中国孕妇队列中的NIPT数据(平均深度~0.15倍),从而识别出与妊娠相关的基因座。推算的基因型与GWAS结果中的WGS深度数据高度一致(Pearson R² > 0.8)10。
基于ULDS的分析成功关键在于补补准确性,而补补准确性受测序深度、参考面板质量和群体匹配、补补算法性能、样本量和等位基因频谱11的影响。其中,参考面板的选择是推算准确性的重要决定因素。常用面板包括具有全球代表性的资源,如1000基因组计划(1KGP)7、TOPMed12和单倍型参考联盟(HRC)13,以及日益普及的群体或地区特定面板,如新加坡10,000基因组(SG10K)14、中国嘉道理生物样本库(CKB)15.补值性能的另一个关键因素是算法的选择。为应对低深度测序的独特挑战,已开发出多种工具,显著推动了填补在大规模遗传研究中的实际应用。虽然像Beagle (v5+)16、Minimac417和IMPUTE511 这样的补补方法在SNP阵列和中高深度WGS数据中被广泛使用,但在ULDS设置下它们的表现往往不理想。近年来,专门的工具被开发出来以应对这些挑战。STITCH9 直接通过低深度测序读段推断单倍型,因此特别适用于大型同质队列。QUILT218 采用压缩单倍型库和局部似然模型,实现高效补值,拥有庞大的参考面板,并在产前基因组学中具有独特应用。GLIMPSE219是原始GLIMPSE框架的扩展,在准确性和计算效率方面均有进一步提升。
尽管这些工具代表了重大进展,但它们在不同实验设计(如测序深度、队列规模和参考面板选择)下的相对表现尚未被系统评估,导致研究人员缺乏明确的指导来选择最合适的策略。为弥合这一差距,三种广泛使用的ULDS补值工具——STITCH、QUILT2和GLIMPSE2——在多种测序深度和样本量下进行了系统性基准测试。他们的表现通过两个与中国人群高度相关的东亚参考面板进行了评估。研究结果表明,ULDS补值在测序深度≥0.5倍时通常可靠,而深度<0.1倍则需要更大队列才能达到可接受的精度。参考面板的选择应根据研究情境进行调整,如CKB等群体匹配面板以提高补值准确性。此外,这些方法直接适用于大规模人群研究和NIPT中产生的超低深度数据。因此,本研究为基于ULDS的研究工具选择建立了实用框架,为未来在群体遗传学和复杂性状分析中的应用提供了方法学指导。
访问受限。请登录或开始试用以查看此内容。
所有参与者在参与前均提供了书面知情同意。涉及WGS深度数据的研究经华大研究所机构审查委员会(BGI-IRB 23058-T2)审核批准,并获得中国人类遗传资源管理局([2023] CJ0262)批准采集人类遗传资源。涉及NIPTULDS数据的研究已获得武汉儿童医院机构审查委员会(2021R062)和华大投资机构审查委员会(BGI-IRB 21088)批准,同时获得中国人类遗传资源管理局([2021] CJ2002)的额外批准。
注意:本研究包含两种类型的WGS数据。第一类是从深圳自然人群队列中招募的500名个体血液样本中获得的深入WGS数据(30xx)。这些数据被用于构建高质量的真实数据集,并用于后续的下采样和准确性评估。第二类是ULDS数据,来源于武汉地区1万名孕妇的NIPT检测。
1. 深入全基因组测序数据
2. 超低深度NIPT数据(~0.1倍WGS)
3. 数据预处理流水线
4. 基因型补缺
5. 补值准确性评估
访问受限。请登录或开始试用以查看此内容。
样本量对补值准确性的影响
将样本量从N=200增加到N=500,提高了STITCH的补补准确性,尤其是在低覆盖条件下。例如,在CKB参考面板覆盖1倍时,STITCH的R2>为0.916(N=500),而为0.882(N=200),提升了3.4% (见图3;补充档案2)。 同样,在0.5倍覆盖率下,其准确率从0.800升至0.868(ΔR2>=8.5%)。相比之下,QUILT2和GLIMPSE2对样本量变异的敏感性极小,R2>波动在所有测试条件下均小于0.5%。例如,QUILT2在CKB面板下保持稳定性能,覆盖率为1倍(R2>N=200时为0.970,N=500时为0.971)。这表明STITCH更适合更大样本量,这与其基于隐马尔可夫模型(HMM)的单倍型推断框架一致。
访问受限。请登录或开始试用以查看此内容。
本研究系统评估了三种广泛使用的ULD基因型补值工具的性能,其中深度WGS为金标准。一个关键方法优势在于采用统一的预处理流程——涵盖比对、质量控制和基础质量评分重新校准——以最小化批次效应并确保工具和条件间的可比性。通过对深度测序样本进行下采样,在受控设置下模拟超低深度数据,从而为基准测试提供了客观框架。将分析限制在1号染色体上定义的10 Mb基因组间隔内,确保了计算可行性,同时保持了足够的变异密度。对STITCH、QUILT2和GLIMPSE2的比较评估揭示了各类补算策略的明显优缺点。
测序深度和样本量对估算准确性产生了可预测的影响。准确率急剧下降至深度~0.1倍以下,反映出信息不足,无法可靠地从稀疏的读取数据中恢复单倍型。更大的样本量通过改进对总体单倍型结构的推断来缓解这一限制,这与理论预期一致,即样本越多就能提升补补性能29。结果表明,至少0.5倍的深度对于常见变异体保持可接受的准确性,即使在样本量较小的情况下,而低于0.1倍的深度则需要显著更大的队列才能达到相当...
访问受限。请登录或开始试用以查看此内容。
作者声明没有利益冲突。
本研究得到了深圳医学科研基金(B2404004)、中国国家重点研发计划(2023YFC2605400,2022YFC2502402)、深圳科技项目(SYSPG20241211173852024)、国家血管稳态与重塑实验室开放研究项目(2025-SKLVHR-013)和广东省重点区域研发计划(2023B0303040001)的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Data | |||
| 10,000个NIPT低深度样本 | 这篇论文 | 用于补值基准的超低深度全基因组测序数据。 | |
| 500个高深度WGS样本 | 这篇论文 | 30多次;高深度的WGS作为黄金标准/真相设定。 | |
| 参考面板 | |||
| 1KGP-EAS参考面板 | 1000基因组计划(东亚) | 1KGP中用于东亚血统特定猜测的子集。 | |
| CKB参考面板 | 中国卡多里生物库 | 定制的人群特异性基因型补补面板。 | |
| <强力学派>软件与算法 | |||
| BCFtools v1.11 | GitHub (samtools/bcftools) | 用于合并和排序染色体级结果,以及过滤变异。 | |
| GATK 4.0.4.0工具集的BQSR | 布罗德学院 | 用于基础质量评分重新校准(BQSR)。 | |
| BWA-MEM .7.16a-r1181 | Heng Li / GitHub | 用于将原始读段与GRCh38对齐。 | |
| DPGT(分布式群体遗传学工具) | 华大工业 | 一个分布式群体遗传分析工具,能够联合调用数百万WGS样本。可访问 [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT) | |
| fastp.0.23.4 | 开源(Chen 等,2018) | 用于质量控制和适配器修剪。 | |
| GLIMPSE2 | 牛津大学 | 低覆盖率WGS的快速基因型分位与补值 | |
| 分析原始代码 | 这篇论文 | 补充文件 1 分析原始代码 | |
| 皮卡尔工具包 | 布罗德学院 | 用于标记重复和文件格式转换。 | |
| Plink 2.0 | C. Chang、S. Purcell / Broad 研究所 | 用于基因型格式转换和关联分析。 | |
| Python 3.8 | Python 软件基础 | 用于脚本编写、自动化和数据分析。 | |
| 拼布2 | 牛津大数据研究所 | 基于HMM的外部参考面板补补 | |
| R 4.1.3 | R基金会 | 用于运行STITCH、QUILT2以及绘制/统计。 | |
| SAMtools v1.3 | GitHub (samtools/samtools) | 用于作SAM/BAM文件。 | |
| Seqtk-1.5 | GitHub (lh3/seqtk) | 用于处理FASTA/Q格式序列的工具包。可于 [GitHub - lh3/seqtk](https://github.com/lh3/seqtk) 获取 | |
| SOAPnuke | 华大工业 | 用于NGS数据质量控制和过滤。 | |
| STITCH v1.6.6 | 牛津大学 | 为超低覆盖测序优化的补补工具 | |
| 塔比克斯 | GitHub (samtools/tabix) | 用于索引和查询 bgzip 的 VCF 文件。 | |
| <强>其他材料 | |||
| GATK 捆绑包文件 | GATK | 可于[https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json] 获取 | |
| 1000G(GRCh38)遗传图谱 | 牛津/1000基因组计划 | 相位/补值工具的必备 | |
| GRCh38 | 基因组参考联盟 | 用于读取比对和变体调用 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可