STITCH, QUILT2, GLIMPSE2 세 가지 보정 도구가 CKB와 EAS 참조 패널을 사용하여 다양한 시퀀싱 깊이와 샘플 크기에서 벤치마킹되었습니다. 이 결과는 초저심도 시퀀싱 데이터에서 적절한 인보 전략을 선택하는 실용적인 틀을 제공하여 대규모 집단 유전체 및 복잡한 형질 연구를 용이하게 합니다.
방법 논문
STITCH, QUILT2, GLIMPSE2 세 가지 보정 도구가 CKB와 EAS 참조 패널을 사용하여 다양한 시퀀싱 깊이와 샘플 크기에서 벤치마킹되었습니다. 이 결과는 초저심도 시퀀싱 데이터에서 적절한 인보 전략을 선택하는 실용적인 틀을 제공하여 대규모 집단 유전체 및 복잡한 형질 연구를 용이하게 합니다.
초저심도 시퀀싱(ULDS)은 대규모 유전체 연구에 비용 효율적인 전략이지만, 그 유용성은 정확한 유전자형 보철에 달려 있습니다. 본 연구는 중국 카도리 바이오뱅크(CKB)와 1000 게놈 프로젝트(1KGP) 동아시아(EAS) 참조 패널을 사용하여 다양한 시퀀싱 깊이와 샘플 크기에 대해 STITCH, QUILT2, GLIMPSE2 세 가지 보완 도구를 평가합니다. 중요한 성능 차이가 입증되었습니다: 표본 크기 민감도: STITCH의 정확도는 표본이 클수록 현저히 향상되었고, QUILT2와 GLIMPSE2는 표본 크기에 대한 의존성이 거의 없음을 보였습니다. 참고 패널 최적화: 집단별 CKB는 QUILT2와 GLIMPSE2의 정확도를 크게 높였으나, 내부 하플로타입 추론에 의존하는 STITCH에는 거의 영향을 미치지 못했습니다. 깊이 임계값: 모든 도구는 중간 정도의 시퀀싱 깊이(≥ 0.5배)에서 견고한 정확도를 달성했으나, STITCH는 초저 깊이(≤ 0.1배)에서 크게 저조한 성능을 보였습니다. CKB와 함께한 GLIMPSE2 전체 정확도가 가장 높았고, QUILT2는 정밀도와 계산 효율성의 균형을 이루었습니다. 비침습적 산전 검사(NIPT) 데이터의 경우, GLIMPSE2+CKB는 후속 분석에 충분한 정확도를 유지했습니다. 인구 매칭 패널과 깊이 적응 도구를 우선시하는 의사결정 프레임워크가 제안되어, 다양한 연구 환경에서 ULDS-WGS를 최적화하기 위한 실행 가능한 지침을 제공합니다. 이러한 통찰은 방법론적 발전과 실용적 구현을 연결하여, 데이터 품질을 저해하지 않으면서 비용 효율적인 유전체 연구의 확장을 가능하게 합니다.
초저심도 시퀀싱(ULDS)은 1배 미만의 시퀀싱 범위를 의미하며, 저렴한 비용, 광범위한 유전체 커버리지, 다양한 샘플 유형과의 호환성 덕분에 인기를 얻고 있습니다. 이미 비침습적 산전 검사(NIPT)1, 암 모니터링2, 염색체 복사수 변이(CNV) 검출 등 임상적 가치를 입증했습니다 3,4. 임상 진단을 넘어, 시퀀싱 비용 감소와 생물정보학의 급속한 발전으로 ULDS는 집단 유전체학과 복잡한 형질 연구에서 점점 더 중요한 역할을 하게 되었습니다. ULDS 데이터와 인구 규모 하플로타입 참조 패널을 결합함으로써, 유전자형 보철은 개별 수준에서 유전체 전반 변이 정보를 복원할 수 있게 합니다. 그 결과, ULDS는 전통적인 단일 염기다형성(SNP) 배열과 심도 전유전체 시퀀싱(WGS)5에 대한 비용 효율적인 대안으로 부상했으며, 특히 전유전체 연관 연구(GWAS) 및 집단 구조 분석과 같은 대규모 연구에서 그렇습니다.
이전 연구들은 변이 호출, 집단 역사 재구성, 바이러스 감염 패턴 추론, GWAS6 등 NIPT 시퀀싱 데이터를 활용한 다양한 유전 연구의 실현 가능성을 입증했습니다.
이러한 장점에도 불구하고, ULDS 데이터의 극도로 희박한 특성은 독특한 도전 과제를 야기합니다. 변이 수준에서는 많은 부위가 완전히 관찰되지 않거나 개인당 단일 대립유전자만으로 표현되어 하위 분석에 필요한 데이터 품질이 부족합니다. 따라서 유전자 보강은 필수적이며, 대규모 참고 패널(예: 1000 Genomes7 또는 집단 특화 자원)의 하플로타입 구조를 활용하여 누락되거나 불확실한 유전자형을 통계적으로 추론합니다. 이전 연구들은 NIPT 데이터에서의 보강이 GWAS에서 형질 관련 변이를 식별하는 데 있어 높은 정확도와 강력한 통계적 역량을 유지할 수 있음을 보여주었습니다8. STITCH9 알고리즘을 사용하여 20,900명의 중국 임산부 코호트에서 NIPT 데이터(평균 깊이 ~0.15x)를 성공적으로 추정하여 임신 관련 유대를 확인했습니다. 추정된 유전자형은 GWAS 결과에서 심층 WGS 데이터와 강한 일치를 보였다(Pearson R² > 0.8)10.
ULDS 기반 분석의 성공은 삽입 정확도에 결정적으로 달려 있으며, 이는 시퀀싱 깊이, 참조 패널 품질 및 모집단 일치, 보정 알고리즘 성능, 표본 크기, 대립유전자주파수 스펙트럼에 의해 영향을 받습니다. 이 중 참조 패널의 선택은 임명률의 주요 결정 요인입니다. 일반적으로 사용되는 패널에는 1000 게놈 프로젝트(1KGP)7, TOPMed12, 하플로타입 참조 컨소시엄(HRC)13과 같은 전 세계적으로 대표적인 자료뿐만 아니라, 싱가포르 10,000 게놈(SG10K)14, 중국 카도리 바이오뱅크(CKB)15와 같은 점점 더 널리 보급되는 인구 또는 지역별 패널이 포함됩니다.. 인보 성능의 또 다른 핵심 요소는 알고리즘 선택입니다. 저심도 시퀀싱의 독특한 도전을 해결하기 위해 여러 도구가 개발되어 대규모 유전학 연구에서 인보정의 실용적 활용이 크게 발전했습니다. Beagle (v5+)16, Minimac417, IMPUTE511 과 같은 인피테이션 방식은 SNP 배열 및 중고층 WGS 데이터에 널리 사용되지만, ULDS 환경에서는 종종 최적이 아닌 성능을 보입니다. 최근에는 이러한 문제를 해결하기 위한 전문 도구들이 개발되었습니다. STITCH9 는 저심도 시퀀싱 리드를 통해 하플로타입을 직접 추론하므로, 특히 대규모 동질한 코호트에 적합합니다. QUILT218 은 압축된 하플로타입 라이브러리와 국소화된 가능도 모델을 사용하여 대규모 참조 패널로 효율적인 보충을 가능하게 하고 산전 유전체학에서 독특한 응용을 제공합니다. GLIMPSE219는 원래 GLIMPSE 프레임워크의 확장으로, 정확도와 계산 효율성 모두에서 추가적인 개선을 제공합니다.
이 도구들은 중대한 진보를 의미하지만, 서로 다른 실험 설계(예: 시퀀싱 깊이, 코호트 규모, 참조 패널 선택)에서의 상대적 성능은 체계적으로 평가되지 않아 연구자들이 가장 적합한 전략을 선택하는 데 명확한 지침을 제공하지 못하고 있습니다. 이 격차를 메우기 위해 널리 사용되는 세 가지 ULDS 인출 도구인 STITCH, QUILT2, GLIMPSE2가 여러 시퀀싱 깊이와 샘플 크기에서 체계적으로 벤치마킹되었습니다. 이들의 성과는 중국 인구와 매우 관련 있는 두 개의 동아시아 참조 패널을 사용하여 평가되었습니다. 연구 결과는 ULDS 보강은 일반적으로 ≥0.5배 깊이에서 신뢰할 만한 반면, 0.1배 깊이<에서는 허용 가능한 정확도를 달성하기 위해 훨씬 더 큰 코호트가 필요하다는 것을 보여줍니다. 참고 패널 선정은 연구 맥락에 맞게 조정되어야 하며, CKB와 같은 인구 매칭 패널은 인가의 정확성을 향상시킵니다. 더불어, 이러한 접근법은 대규모 인구 연구와 NIPT에서 생성된 초저심도 데이터에 직접 적용할 수 있습니다. 따라서 본 연구는 ULDS 기반 연구에서 도구 선택을 위한 실질적인 틀을 마련하고, 향후 집단 유전학 및 복잡한 형질 분석에 적용할 방법론적 지침을 제공합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
모든 참가자는 참여 전에 서면 동의서를 제공했습니다. 심층 WGS 데이터를 포함한 연구는 BGI 기관심의위원회(BGI-IRB 23058-T2)의 검토 및 승인을 받았으며, 중국 인적유전자원관리청([2023] CJ0262)으로부터 인적 유전자원 수집 승인을 받았습니다. NIPT에서 ULDS 데이터를 이용한 연구는 우한 소아병원 기관심사위원회(2021R062)와 BGI 기관심사위원회(BGI-IRB 21088)의 승인을 받았으며, 중국 인유전자원관리국([2021] CJ2002)의 추가 승인을 받았습니다.
참고: 이 연구에는 두 가지 유형의 WGS 데이터가 포함되었습니다. 첫 번째 유형은 선전의 자연 집단 코호트에서 모집된 500명의 혈액 샘플에서 얻은 심층 WGS 데이터(30xx)로 구성되었습니다. 이 데이터는 고품질 현장 진실 데이터셋을 구축하고 이후 다운샘플링 및 정확도 평가에 사용되었습니다. 두 번째 유형은 우한 지역 10,000명의 임산부를 대상으로 한 NIPT에서 도출된 ULDS 데이터였습니다.
1. 심층 전체 유전체 시퀀싱 데이터
2. 초저심도 NIPT 데이터 (~0.1배 WGS)
3. 데이터 전처리 파이프라인
4. 유전자 보강
5. 인보 정확도 평가
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
표본 크기가 보충 정확도에 미치는 영향
표본 크기를 N = 200에서 N = 500으로 늘리면 특히 저보장 조건에서 STITCH의 보철 정확도가 향상되었습니다. 예를 들어, CKB 참조 패널을 1x 범위로 설정했을 때, STITCH는 R2> 0.916(N=500)을 달성했으며, 이는 0.882(N=200)보다 낮아 3.4% 증가한 수치입니다 (그림 3; 보조 파일 2). 마찬가지로, 0.5배 적용 범위에서는 정확도가 0.800에서 0.868로 상승했습니다(ΔR2> = 8.5%). 반면, QUILT2와 GLIMPSE2는 표본 크기 변동에 대한 민감도가 거의 없었으며, 모든 시험 조건에서 R2> 변동률이 0.5% 미만이었습니다. 예를 들어, QUILT2는 1x 커버리...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 ULDS에 대해 널리 사용되는 세 가지 유전자형 보철 도구의 성능을 체계적으로 평가했으며, 고심도 WGS가 골드 스탠다드로 평가되었습니다. 주요 방법론적 강점은 정렬, 품질 관리, 기본 품질 점수 재보정을 포함하는 통합 전처리 파이프라인 채택에 있으며, 이는 배치 효과를 최소화하고 도구 및 조건 간 비교 가능성을 보장합니다. 심층 시퀀싱된 샘플을 다운샘플링하여 초저심도 데이터를 제어된 환경에서 시뮬레이션하여 벤치마킹을 위한 객관적 틀을 제공했습니다. 1번 염색체에서 정의된 10 Mb 유전체 구간으로 분석을 제한함으로써 충분한 변이 밀도를 유지하면서 계산 가능성을 보장했습니다. STITCH, QUILT2, GLIMPSE2의 비교 평가는 보철 전략 간에 뚜렷한 강점과 약점이 있음을 보여줍니다.
시퀀싱 깊이와 표본 크기는 보석 정확도에 예측 가능한 영향을 미쳤습니다. 정확도는 깊이 ~0.1배 이하로 급격히 감소했으...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 상충하는 이해관계가 없다고 선언한다.
이 연구는 선전 의학 연구 기금(B2404004), 중국 국가 중점연구개발 프로그램(2023YFC2605400, 2022YFC2502402), 선전 과학기술기구(SYSPG20241211173852024), 국가 혈관 항상성 및 재형성 핵심 연구소 공개 연구 프로젝트(베이징대학교)(2025-SKLVHR-013), 광둥성 중점연구개발 프로그램(2023B0303040001)의 지원을 받았습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Data | |||
| 10,000개의 NIPT 저심도 샘플 | 이 종이 | 보정 벤치마크에 사용되는 초저심도 전체 유전체 시퀀싱 데이터. | |
| 500개의 고심도 WGS 샘플 | 이 종이 | 30번, 고밀도 WGS는 골드 스탠다드이자 진실의 집합으로 사용되었습니다. | |
| <스트롱>참고 패널 | |||
| 1KGP-EAS 참조 패널 | 1000 게놈 프로젝트 (동아시아) | 동아시아 혈통 특이적 추정을 위한 1KGP의 하위 집합. | |
| CKB 참조 패널 | 차이나 카도리 바이오뱅크 | 유전자형 보철을 위한 맞춤형 인구 특화 패널. | |
| 소프트웨어와 알고리즘 | |||
| BCFtools v1.11 | GitHub (samtools/bcftools) | 염색체 수준의 결과를 병합하고 분류하며, 변이체를 필터링하는 데 사용됩니다. | |
| GATK 4.0.4.0 툴셋의 BQSR | 브로드 연구소 | 기본 품질 점수 재보정(BQSR)에 사용됩니다. | |
| BWA-MEM .7.16a-r1181 | 헹 리 / GitHub | 원시 리드를 GRCh38에 정렬하는 용도입니다. | |
| DPGT (분산 집단 유전학 도구) | BGI | 수백만 개의 WGS 샘플에 대한 공동 호출을 가능하게 한 분산 집단 유전학 분석 도구입니다. [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)에서 이용 가능합니다. | |
| fastp.0.23.4 | 오픈 소스 (Chen 외, 2018) | 품질 관리와 어댑터 트리밍을 위해서요. | |
| GLIMPSE2 | 옥스퍼드 대학교 | 저보장 WGS에 대한 빠른 유전자형 위상 및 보정 | |
| 분석 원본 코드 | 이 종이 | Supplementary File 1 분석을 위한 원본 코드 | |
| 피카드 툴킷 | 브로드 연구소 | 중복 표시 및 파일 형식 변환에 사용됩니다. | |
| 플링크 2.0 | C. 창, S. 퍼셀 / 브로드 연구소 | 유전자형 형식 변환 및 연관성 분석에 관해서입니다. | |
| 파이썬 3.8 | 파이썬 소프트웨어 재단 | 스크립팅, 자동화, 데이터 분석에 사용됩니다. | |
| 퀼트2 | 옥스퍼드 빅데이터 연구소 | 외부 참조 패널을 이용한 HMM 기반 보철 | |
| R 4.1.3 | R 재단 | STITCH, QUILT2 실행, 플롯/통계 작성에 사용됩니다. | |
| SAMtools v1.3 | GitHub (samtools/samtools) | SAM/BAM 파일 조작을 위해서입니다. | |
| Seqtk-1.5 | GitHub (lh3/seqtk) | FASTA/Q 형식의 시퀀스 처리를 위한 툴킷. [GitHub - lh3/seqtk](https://github.com/lh3/seqtk)에서 이용 가능 | |
| SOAPnuke | BGI | NGS 데이터 품질 관리 및 필터링을 위해서입니다. | |
| 스티치 v1.6.6 | 옥스퍼드 대학교 | 초저범위 시퀀싱에 최적화된 보완 도구 | |
| 타빅스 | GitHub (samtools/tabix) | bgzipped VCF 파일의 인덱싱 및 쿼리에 사용됩니다. | |
| <강>기타 재료 | |||
| GATK 번들 파일 | GATK | [https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json]에서 이용 가능 | |
| 1000G 유전 지도 (GRCh38) | 옥스퍼드 / 1000 게놈 프로젝트 | 위상/인보 도구에 필수 | |
| GRCh38 | 게놈 참조 컨소시엄 | 읽기 정렬 및 변형 호출에 사용됩니다 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청