방법 논문

초저심도 전체 유전체 시퀀싱 데이터를 위한 유전자형 보정 도구의 종합 평가

DOI:

10.3791/68879

2025년 12월 12일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

STITCH, QUILT2, GLIMPSE2 세 가지 보정 도구가 CKB와 EAS 참조 패널을 사용하여 다양한 시퀀싱 깊이와 샘플 크기에서 벤치마킹되었습니다. 이 결과는 초저심도 시퀀싱 데이터에서 적절한 인보 전략을 선택하는 실용적인 틀을 제공하여 대규모 집단 유전체 및 복잡한 형질 연구를 용이하게 합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

초저심도 시퀀싱(ULDS)은 대규모 유전체 연구에 비용 효율적인 전략이지만, 그 유용성은 정확한 유전자형 보철에 달려 있습니다. 본 연구는 중국 카도리 바이오뱅크(CKB)와 1000 게놈 프로젝트(1KGP) 동아시아(EAS) 참조 패널을 사용하여 다양한 시퀀싱 깊이와 샘플 크기에 대해 STITCH, QUILT2, GLIMPSE2 세 가지 보완 도구를 평가합니다. 중요한 성능 차이가 입증되었습니다: 표본 크기 민감도: STITCH의 정확도는 표본이 클수록 현저히 향상되었고, QUILT2와 GLIMPSE2는 표본 크기에 대한 의존성이 거의 없음을 보였습니다. 참고 패널 최적화: 집단별 CKB는 QUILT2와 GLIMPSE2의 정확도를 크게 높였으나, 내부 하플로타입 추론에 의존하는 STITCH에는 거의 영향을 미치지 못했습니다. 깊이 임계값: 모든 도구는 중간 정도의 시퀀싱 깊이(≥ 0.5배)에서 견고한 정확도를 달성했으나, STITCH는 초저 깊이(≤ 0.1배)에서 크게 저조한 성능을 보였습니다. CKB와 함께한 GLIMPSE2 전체 정확도가 가장 높았고, QUILT2는 정밀도와 계산 효율성의 균형을 이루었습니다. 비침습적 산전 검사(NIPT) 데이터의 경우, GLIMPSE2+CKB는 후속 분석에 충분한 정확도를 유지했습니다. 인구 매칭 패널과 깊이 적응 도구를 우선시하는 의사결정 프레임워크가 제안되어, 다양한 연구 환경에서 ULDS-WGS를 최적화하기 위한 실행 가능한 지침을 제공합니다. 이러한 통찰은 방법론적 발전과 실용적 구현을 연결하여, 데이터 품질을 저해하지 않으면서 비용 효율적인 유전체 연구의 확장을 가능하게 합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

초저심도 시퀀싱(ULDS)은 1배 미만의 시퀀싱 범위를 의미하며, 저렴한 비용, 광범위한 유전체 커버리지, 다양한 샘플 유형과의 호환성 덕분에 인기를 얻고 있습니다. 이미 비침습적 산전 검사(NIPT)1, 암 모니터링2, 염색체 복사수 변이(CNV) 검출 등 임상적 가치를 입증했습니다 3,4. 임상 진단을 넘어, 시퀀싱 비용 감소와 생물정보학의 급속한 발전으로 ULDS는 집단 유전체학과 복잡한 형질 연구에서 점점 더 중요한 역할을 하게 되었습니다. ULDS 데이터와 인구 규모 하플로타입 참조 패널을 결합함으로써, 유전자형 보철은 개별 수준에서 유전체 전반 변이 정보를 복원할 수 있게 합니다. 그 결과, ULDS는 전통적인 단일 염기다형성(SNP) 배열과 심도 전유전체 시퀀싱(WGS)5에 대한 비용 효율적인 대안으로 부상했으며, 특히 전유전체 연관 연구(GWAS) 및 집단 구조 분석과 같은 대규모 연구에서 그렇습니다.

이전 연구들은 변이 호출, 집단 역사 재구성, 바이러스 감염 패턴 추론, GWAS6 등 NIPT 시퀀싱 데이터를 활용한 다양한 유전 연구의 실현 가능성을 입증했습니다.

이러한 장점에도 불구하고, ULDS 데이터의 극도로 희박한 특성은 독특한 도전 과제를 야기합니다. 변이 수준에서는 많은 부위가 완전히 관찰되지 않거나 개인당 단일 대립유전자만으로 표현되어 하위 분석에 필요한 데이터 품질이 부족합니다. 따라서 유전자 보강은 필수적이며, 대규모 참고 패널(예: 1000 Genomes7 또는 집단 특화 자원)의 하플로타입 구조를 활용하여 누락되거나 불확실한 유전자형을 통계적으로 추론합니다. 이전 연구들은 NIPT 데이터에서의 보강이 GWAS에서 형질 관련 변이를 식별하는 데 있어 높은 정확도와 강력한 통계적 역량을 유지할 수 있음을 보여주었습니다8. STITCH9 알고리즘을 사용하여 20,900명의 중국 임산부 코호트에서 NIPT 데이터(평균 깊이 ~0.15x)를 성공적으로 추정하여 임신 관련 유대를 확인했습니다. 추정된 유전자형은 GWAS 결과에서 심층 WGS 데이터와 강한 일치를 보였다(Pearson R² > 0.8)10.

ULDS 기반 분석의 성공은 삽입 정확도에 결정적으로 달려 있으며, 이는 시퀀싱 깊이, 참조 패널 품질 및 모집단 일치, 보정 알고리즘 성능, 표본 크기, 대립유전자주파수 스펙트럼에 의해 영향을 받습니다. 이 중 참조 패널의 선택은 임명률의 주요 결정 요인입니다. 일반적으로 사용되는 패널에는 1000 게놈 프로젝트(1KGP)7, TOPMed12, 하플로타입 참조 컨소시엄(HRC)13과 같은 전 세계적으로 대표적인 자료뿐만 아니라, 싱가포르 10,000 게놈(SG10K)14, 중국 카도리 바이오뱅크(CKB)15와 같은 점점 더 널리 보급되는 인구 또는 지역별 패널이 포함됩니다.. 인보 성능의 또 다른 핵심 요소는 알고리즘 선택입니다. 저심도 시퀀싱의 독특한 도전을 해결하기 위해 여러 도구가 개발되어 대규모 유전학 연구에서 인보정의 실용적 활용이 크게 발전했습니다. Beagle (v5+)16, Minimac417, IMPUTE511 과 같은 인피테이션 방식은 SNP 배열 및 중고층 WGS 데이터에 널리 사용되지만, ULDS 환경에서는 종종 최적이 아닌 성능을 보입니다. 최근에는 이러한 문제를 해결하기 위한 전문 도구들이 개발되었습니다. STITCH9 는 저심도 시퀀싱 리드를 통해 하플로타입을 직접 추론하므로, 특히 대규모 동질한 코호트에 적합합니다. QUILT218 은 압축된 하플로타입 라이브러리와 국소화된 가능도 모델을 사용하여 대규모 참조 패널로 효율적인 보충을 가능하게 하고 산전 유전체학에서 독특한 응용을 제공합니다. GLIMPSE219는 원래 GLIMPSE 프레임워크의 확장으로, 정확도와 계산 효율성 모두에서 추가적인 개선을 제공합니다.

이 도구들은 중대한 진보를 의미하지만, 서로 다른 실험 설계(예: 시퀀싱 깊이, 코호트 규모, 참조 패널 선택)에서의 상대적 성능은 체계적으로 평가되지 않아 연구자들이 가장 적합한 전략을 선택하는 데 명확한 지침을 제공하지 못하고 있습니다. 이 격차를 메우기 위해 널리 사용되는 세 가지 ULDS 인출 도구인 STITCH, QUILT2, GLIMPSE2가 여러 시퀀싱 깊이와 샘플 크기에서 체계적으로 벤치마킹되었습니다. 이들의 성과는 중국 인구와 매우 관련 있는 두 개의 동아시아 참조 패널을 사용하여 평가되었습니다. 연구 결과는 ULDS 보강은 일반적으로 ≥0.5배 깊이에서 신뢰할 만한 반면, 0.1배 깊이<에서는 허용 가능한 정확도를 달성하기 위해 훨씬 더 큰 코호트가 필요하다는 것을 보여줍니다. 참고 패널 선정은 연구 맥락에 맞게 조정되어야 하며, CKB와 같은 인구 매칭 패널은 인가의 정확성을 향상시킵니다. 더불어, 이러한 접근법은 대규모 인구 연구와 NIPT에서 생성된 초저심도 데이터에 직접 적용할 수 있습니다. 따라서 본 연구는 ULDS 기반 연구에서 도구 선택을 위한 실질적인 틀을 마련하고, 향후 집단 유전학 및 복잡한 형질 분석에 적용할 방법론적 지침을 제공합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

모든 참가자는 참여 전에 서면 동의서를 제공했습니다. 심층 WGS 데이터를 포함한 연구는 BGI 기관심의위원회(BGI-IRB 23058-T2)의 검토 및 승인을 받았으며, 중국 인적유전자원관리청([2023] CJ0262)으로부터 인적 유전자원 수집 승인을 받았습니다. NIPT에서 ULDS 데이터를 이용한 연구는 우한 소아병원 기관심사위원회(2021R062)와 BGI 기관심사위원회(BGI-IRB 21088)의 승인을 받았으며, 중국 인유전자원관리국([2021] CJ2002)의 추가 승인을 받았습니다.

참고: 이 연구에는 두 가지 유형의 WGS 데이터가 포함되었습니다. 첫 번째 유형은 선전의 자연 집단 코호트에서 모집된 500명의 혈액 샘플에서 얻은 심층 WGS 데이터(30xx)로 구성되었습니다. 이 데이터는 고품질 현장 진실 데이터셋을 구축하고 이후 다운샘플링 및 정확도 평가에 사용되었습니다. 두 번째 유형은 우한 지역 10,000명의 임산부를 대상으로 한 NIPT에서 도출된 ULDS 데이터였습니다.

1. 심층 전체 유전체 시퀀싱 데이터

  1. 일반 인구 코호트에서 500개의 말초 혈액 샘플(각 5mL)을 사전 동의 후 채취합니다. 샘플은 EDTA 튜브에 보관하고 2-8 °C에서 운반합니다.
  2. 혈장과 버피 코팅을 분리하기 위해 1,600 x g 에서 10분간 4°C에서 원심분리 혈액을 사용합니다. 버피 코트를 조심스럽게 모아 -80°C에서 보관하다가 DNA 추출을 하세요.
  3. 제조사의 지침에 따라 자기 구슬 기반 키트를 사용해 버피 코트에서 유전체 DNA를 추출하세요.
  4. 형광측정법을 이용해 DNA 농도를 정량하고, 아가로스 겔 전기영동을 통해 DNA 무결성을 평가합니다. 전체 DNA 수율이 ≥1 μg, 농도≥12.5 ng/μL, 조각 길이가 >20 kb, 눈에 띄는 분해가 없는 샘플을 선택하여 라이브러리 준비를 수행합니다.
  5. 80-200 ng의 고품질 유전체 DNA를 초음파 검사로 평균 350-400 bp 크기로 절단합니다.
  6. 20 °C에서 30분간 엔드 복구, 20 °C에서 어댑터 연결(15분), 37 °C에서 30분간 원형화를 수행하여 PCR 없는 라이브러리를 구축합니다. 롤링 서클 증폭(RCA)을 이용해 DNA 나노볼(DNB)을 생성합니다. DNBSEQ 플랫폼에서 목표 깊이 ~30배(샘플당 평균 100 Gb)로 시퀀스 쌍결 라이브러리(PE100, 읽기 길이 100 bp)를 제공합니다. 원시 시퀀싱 리드는 FASTQ 형식으로 저장하여 후속 분석을 수행합니다.
    참고: 모든 인간 유래 샘플은 BSL-2 실험실 조건 하에서 처리하십시오. DNA 분해를 막기 위해 반복되는 냉동-해동 과정을 피하세요. 혈액 유래 물질을 생물학적 폐기물로 폐기; 화학 시약은 기관 유해 폐기물 지침을 따라 폐기해야 합니다.

2. 초저심도 NIPT 데이터 (~0.1배 WGS)

  1. 정기적인 비침습적 산전 검사(NIPT)를 위해 10,000개의 산모 혈액 샘플(각각 5mL)을 채취하세요. EDTA 튜브를 사용하여 2-8 °C에서 운반; 수거 후 8시간 이내에 플라즈마를 처리하세요.
  2. 안정화 순환 DNA 튜브(K-튜브 또는 G-튜브)의 경우, 온도 조절 운반체를 사용해 6-35°C에서 운송하며, 제조사의 표준 작업 절차에 따라 96시간 이내에 공정을 진행합니다.
  3. 혈장을 분리하기 위해 1,600 x g 에서 10분간 4°C에서 혈액을 원심분리합니다. 피펫을 사용해 버피 코트나 세포 펠릿을 손상시키지 않고 상부 혈장층을 조심스럽게 수집하여 새 튜브로 옮기세요. 회수된 혈장을 다시 16,000 x g 에서 4 °C에서 10분간 원심분리하여 잔류 세포나 이물질을 제거합니다. 정화된 상정액(세포 없는 혈장)을 조심스럽게 신선한 튜브로 옮겨 DNA 추출을 합니다.
  4. 핵산 추출 키트를 사용해 혈장에서 순환 세포 자유 DNA(cfDNA)를 추출합니다. 20°C에서 30분간 엔드 리페셔닝, 20 °C에서 어댑터 연결을 15분, PCR 증폭(12사이클, 98 °C 변성 10초, 60 °C 어닐링 30초, 72 °C 확장 30초)을 수행합니다.
  5. PCR 제품을 정제하고 라이브러리를 37°C에서 30분간 원형화합니다. RCA를 통해 DNB를 생성하세요. BGISEQ-500 플랫폼에서 단일 엔드 라이브러리 시퀀스(SE35, 읽기 길이 35 bp)를 사용했습니다. 원시 시퀀싱 데이터를 FASTQ 형식으로 저장하세요.
    참고: 혈장 샘플은 BSL-2 조건 하에서 감염 가능성이 있는 물질로 취급해야 합니다. cfDNA 분해를 줄이기 위해 동결-해동 주기를 최소화하세요. 혈장 폐기물과 플라스틱 소모품은 생물학적 위험 물질로 폐기하세요.

3. 데이터 전처리 파이프라인

  1. 유전자형 보철 도구의 성능을 체계적으로 평가하기 위해, 원래의 고심도 WGS 데이터(30배)와 초저심도 NIPT 데이터(<0.1x)에 대해 표준화된 전처리 워크플로우를 수행하며, 시뮬레이션된 다운샘플링, 품질 관리, 리드 정렬, 중복 제거, 기본 품질 점수 재보정(BQSR)을 포함합니다.
    참고: 이 지점에서 인피테이션 정확도 평가까지의 단계가 본 연구의 주요 프로토콜(그림 1)을 구성합니다. 구체적인 코드는 보충 파일 1에서 확인할 수 있습니다.
  2. 다운샘플링
    1. 원래 30배 고심도 시퀀싱 샘플에서 일련의 다운샘플링 데이터셋을 생성합니다. 아래에서 설명한 NIPT 데이터의 시퀀싱 특성을 현실적으로 모방하기 위해 두 가지 전략을 사용하세요.
    2. 무작위 서브샘플링: 고정된 무작위 시드인 100의 seqtk v1.5 (https://github.com/lh3/seqtk)를 사용하여 4단계의 저심도 데이터(0.05x, 0.1x, 0.5x, 1.0x)를 생성합니다.
    3. NIPT와 유사한 리드 구조 시뮬레이션: 각 쌍 엔드 리드의 첫 번째 리드(R1)만 유지하고, seqtk trimfq -L 35로 모든 보존된 리드를 35 bp로 절단합니다. 이는 초저심도 NIPT 시퀀싱의 전형적인 단일 끝, 단독 특성과 일치합니다.
  3. 품질 관리
    1. fastp v0.23.420으로 모든 원시 FASTQ 파일을 처리하세요. 다음 매개변수를 사용하세요: --qualified_quality_phred=5 (기본 품질 임계값), --unqualified_percent_limit=50 (저품질 베이스 허용 최대 비율), --n_base_limit=10 (읽기당 최대 N개 베이스), 그리고 --adapter_sequence=AAGTCGGAGGCCAAGGGTCTTAG와 함께 맞춤 어댑터 제거
      GAAGACAA (R1) 및 --adapter_sequence_r2=AAGTCGGATCGTAGCC
      ATGTCGTTCTGTGTGAG
      CCAAGGAGTTG (R2).
    2. Poly-G 꼬리 트리밍(--disable_trim_poly_g)을 비활성화하고, 각 샘플별로 JSON과 HTML 형식의 보고서를 생성하세요.
  4. 정렬 및 중복 제거
    1. BWA v0.7.16a-r118122를 사용하여 고품질의 리드를 인간 참조 유전체 GRCh38 (hg38)21에 정렬합니다.
    2. aln 알고리즘(-e 10 -t 4 -i 5 -q 0)으로 정렬을 수행한 후 읽기 그룹 정보를 이용한 단일 종단 정렬을 위해 SAMSE를 수행합니다.
    3. 생성된 SAM 파일을 BAM으로 변환하고, 정렬(samtools sort -@ 8)로 변환하며, SAMtools v1.323 (samtools rmdup)을 사용해 중복 파일을 제거하세요. 모든 BAM 파일을 인덱싱하세요.
  5. 기본 품질 점수 재보정(BQSR)
    1. GATK v4.0.4.024를 사용하여 BQSR을 수행하세요. 재보정 모델을 세 가지 고신뢰 변이 데이터셋으로 학습시키세요: dbSNP 빌드 14625, Mills 및 1000G 골드 스탠다드 indel21, 그리고 GRCh38에 대한 GATK 리소스번들 24 알려진 indels 파일. 사용된 번들 파일은 GATK 공식 예제(https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json)를 참조합니다. 총 세 개의 파일과 그에 대응하는 인덱스 파일을 다운로드하세요.
    2. BaseRecalibrator를 실행한 후 ApplyBQSR을 실행하여 재보정된 BAM 파일을 생성합니다. SAMtools v1.3을 사용해 모든 BAM을 인덱싱하세요.
      참고: 모든 시뮬레이션 데이터셋은 동일한 전처리(스텝 다운샘플링, 품질 관리, 정렬, 중복 제거, BQSR)를 거쳐 후속 보석 성능 평가에서 일관성과 비교 가능성을 보장했습니다.

4. 유전자 보강

  1. 데이터 준비
    1. 보정 데이터셋 설정: 아래에 설명된 대로 다양한 깊이와 표본 크기에서 체계적으로 유전자형 보철 도구를 벤치마킹하기 위해 여러 평가 데이터셋을 구성합니다. 위에서 언급한 다양한 샘플 크기와 시퀀싱 깊이에 따라 총 9가지 조합이 형성됩니다. 입력 파일은 품질 관리를 거친 후 위에서 언급한 9개 하위 집합의 시퀀싱 데이터 BAM 파일 목록(bamlist.txt)으로 구성되며, 해당 bamlist.txt 파일에 저장됩니다. 기타 입력 파일로는 인간 참조 게놈(GRCh3821)과 1000 게놈 프로젝트7의 유전 지도가 있습니다.
      1. 다운샘플링된 고심도 WGS 데이터: 30배 깊이에서 시퀀싱된 500개 개체 중 무작위로 두 개의 하위 집합(200개 및 500개 샘플)을 선택합니다. 각 하위 집합을 네 가지 깊이(1x, 0.5x, 0.1x, 0.05x)로 다운샘플링하여 여덟 가지 실험 조건을 생성합니다.
      2. NIPT 기반 ULDS 데이터셋: 초저심도 NIPT 샘플 10,000개(평균 깊이 0.102배, 그림 2)와 50개의 고심도 샘플을 0.1배로 다운샘플링한 것을 결합합니다.
    2. 분석 영역 명세: 모든 분석을 1번 염색체 영역 chr1:150,500,000-160,500,000(10 Mb)로 제한하고, 보정을 위한 500 kb 버퍼를 두어 도구 간 직접적인 비교 가능성을 보장합니다.
    3. 참고 패널 선정: 두 개의 참조 패널(표 1)을 사용하라: 중국 인구 데이터를 기반으로 한 CKB 패널과 1000 게놈 프로젝트의 동아시아 하위 집합에서 파생된 1KGP-EAS 패널.
      참고: CKB 참고 패널15는 중국 카두리 바이오뱅크의 9,964명의 중국 성인을 대상으로 한 고심도(~15배) 전체 유전체 시퀀싱 데이터를 사용하여 구성되었으며, 이는 대규모 전향적 코호트 연구입니다. 이 샘플들은 표현형 편향이 최소화되고 한족 혈통이 동질적이며 일관된 개체군 구조를 가진 자연 집단에서 유래하여 중국 코호트에서 유전자형 추정에 특히 적합합니다. Yu 등은 실제 표현형 GWAS에서 CKB 패널을 이용한 보강이 검출되는 SNP 수를 3배로 늘리고 유전체 전체 유의한 변이의 수를 두 배로 늘렸음을 입증했습니다. 가장 널리 사용되는 유전체 참조인 1000 게놈 프로젝트 (1KGP)7,26은 동아시아(EAS) 3상 하위 집합에 585명의 개체를 포함하고 있습니다. 이 하위 집합은 약 30배 깊이를 가진 동아시아 5개 집단을 포함하며, 여기에는 베이징의 한족(CHB), 남한족(CHS), 시솽반나의 중국 다이족(CDX), 베트남 호치민시의 킨족(KHV), 도쿄의 일본족(JPT)이 포함됩니다.
  2. 보완 도구
    1. 서로 다른 모델링 전략과 초저심도 시퀀싱(ULDS) 데이터에 적용할 수 있는 세 가지 보정 알고리즘을 평가합니다.
      1. STITCH: STITCH(v1.6.6)는 참조가 없는 하플로타입 기반 보충 알고리즘으로, 선택적으로 외부 참조 하플로타입을 통합할 수 있습니다. BAM 목록, 인간 참조 게놈(GRCh38)을 입력 파일로 포함하세요. 참조 기반 보철을 수행할 때는 참조 패널 파일(hap/legend/pos)을 준비하세요. 다음 주요 매개변수를 포함하세요: method=이배체, buffer=500 kb, K=10개의 조상 하플로타입, nGen=4x 표본 크기/K(STITCH 문서에서 권장됨). 모든 개인의 SNP 유전자형 복용량을 포함한 출력 파일을 생성합니다.
        참고: STITCH 공식 문서에 따르면, K는 모델 내 조상 하플로타입 수입니다. K가 클수록 더 큰 표본과 더 높은 커버리지에서 보충 정확도가 향상되지만, 계산 시간이 늘어나고 커버리지가 낮을수록 정확도가 떨어질 수 있습니다.
      2. QUILT2: QUILT2는 ULDS 데이터에 최적화된 베이지안 참조 가이드 방식을 적용합니다. 제공된 prepare_reference 스크립트를 사용하여 유전 지도와 지역 좌표를 지정하여 참조 패널 준비를 수행합니다. 비교 가능성을 보장하기 위해 STITCH와 동일한 버퍼 크기(500 kb)와 nGen 설정으로 치유 이배체 모드를 실행하세요.
      3. GLIMPSE2: GLIMPSE2은 HMM 기반의 참조 기반 인가측정 도구로, 대규모이자 매우 낮은 깊이의 시퀀싱 데이터셋을 위해 설계되었습니다. 입력 BAM 리스트, 인간 참조 VCF 패널, 유전 지도, 입력 영역 = chr1:150,000,000-161,000,000, 출력 영역 = chr1:150,500,000-160,500,000 (500 kb 버퍼 유지) 임GLIMPSE2_phase_static페어를 실행합니다. 여기에 입력되는 BAM 리스트 파일은 두 개의 열을 포함해야 합니다: 하나는 BAM 경로이고 두 번째 열은 샘플 이름입니다. 두 번째 열이 입력되지 않으면, 각 BAM 파일 이름이 출력 VCF 파일의 샘플 이름으로 사용됩니다.

5. 인보 정확도 평가

  1. 진리 집합 정의
    1. 30배 깊이에서 시퀀싱된 50마리를 현장 진실 데이터셋으로 선정합니다. 비교 가능성을 보장하기 위해 이 샘플들을 실험적 다운샘플링 조건에 포함시키세요.
    2. 진리 집합에 대한 변형 호출은 다음 파이프라인을 사용하여 수행합니다: QC용 SOAPnuke27 , 정렬용 BWA, 중복 표시용 Picard, 변형 호출용 GATK v4.0.4.0 BQSR과 HaplotypeCaller, 공동 호출용 DPGT(https://github.com/BGI-flexlab/DPGT), 변형 품질 필터링용 BCFtools v1.1123 .
    3. 벤치마크 VCF 파일을 생성하기 위해 신뢰도가 높은 PASS 변형만 유지합니다. 평가를 추정된 데이터셋과 일치하는 chr1:150,500,000-160,500,000으로 제한하세요.
  2. 데이터 조화 및 필터링
    1. PLINK2.028을 사용하여 모든 도구에서 인핀트된 VCF 파일을 처리합니다. 복용량 데이터를 추출해서 pgen 형식으로 변환하세요.
    2. 다음 필터로 SNP 수준의 품질 관리를 적용하세요: 마이너 대립유전자 주파수(MAF) ≥ 0.05 (--maf 0.05), 하디-와인버그 평형(HWE) p-값 ≥ 1e-6 (--hwe 1e-6), 이대립유전자 SNP 전용(--최대 대립유전자 2).
    3. 품질 관리에서 트로우 형식으로 변환하여 하위 비교를 위한 내보내기 변형.
  3. 정확도 지표
    1. 각 SNP의 추정 용량과 실제 실제 용량을 비교해 보세요. SNP별로 피어슨 상관계수(R)를 계산하고, 두 데이터셋에 공통된 위치만 유지하며, 모든 평가된 SNP에 걸친 제곱상관계수 평균(R²)을 계산하여 각 조건별 전체 보석 정확도를 정량화합니다.
    2. 이 정확도 지표를 사용하여 추정된 유전자형 용량 추정치와 실제 유전자형 간의 일치를 포착합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

표본 크기가 보충 정확도에 미치는 영향
표본 크기를 N = 200에서 N = 500으로 늘리면 특히 저보장 조건에서 STITCH의 보철 정확도가 향상되었습니다. 예를 들어, CKB 참조 패널을 1x 범위로 설정했을 때, STITCH는 R2> 0.916(N=500)을 달성했으며, 이는 0.882(N=200)보다 낮아 3.4% 증가한 수치입니다 (그림 3; 보조 파일 2). 마찬가지로, 0.5배 적용 범위에서는 정확도가 0.800에서 0.868로 상승했습니다(ΔR2> = 8.5%). 반면, QUILT2와 GLIMPSE2는 표본 크기 변동에 대한 민감도가 거의 없었으며, 모든 시험 조건에서 R2> 변동률이 0.5% 미만이었습니다. 예를 들어, QUILT2는 1x 커버리...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 ULDS에 대해 널리 사용되는 세 가지 유전자형 보철 도구의 성능을 체계적으로 평가했으며, 고심도 WGS가 골드 스탠다드로 평가되었습니다. 주요 방법론적 강점은 정렬, 품질 관리, 기본 품질 점수 재보정을 포함하는 통합 전처리 파이프라인 채택에 있으며, 이는 배치 효과를 최소화하고 도구 및 조건 간 비교 가능성을 보장합니다. 심층 시퀀싱된 샘플을 다운샘플링하여 초저심도 데이터를 제어된 환경에서 시뮬레이션하여 벤치마킹을 위한 객관적 틀을 제공했습니다. 1번 염색체에서 정의된 10 Mb 유전체 구간으로 분석을 제한함으로써 충분한 변이 밀도를 유지하면서 계산 가능성을 보장했습니다. STITCH, QUILT2, GLIMPSE2의 비교 평가는 보철 전략 간에 뚜렷한 강점과 약점이 있음을 보여줍니다.

시퀀싱 깊이와 표본 크기는 보석 정확도에 예측 가능한 영향을 미쳤습니다. 정확도는 깊이 ~0.1배 이하로 급격히 감소했으...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 상충하는 이해관계가 없다고 선언한다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 선전 의학 연구 기금(B2404004), 중국 국가 중점연구개발 프로그램(2023YFC2605400, 2022YFC2502402), 선전 과학기술기구(SYSPG20241211173852024), 국가 혈관 항상성 및 재형성 핵심 연구소 공개 연구 프로젝트(베이징대학교)(2025-SKLVHR-013), 광둥성 중점연구개발 프로그램(2023B0303040001)의 지원을 받았습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
Data
10,000개의 NIPT 저심도 샘플이 종이보정 벤치마크에 사용되는 초저심도 전체 유전체 시퀀싱 데이터.
500개의 고심도 WGS 샘플이 종이30번, 고밀도 WGS는 골드 스탠다드이자 진실의 집합으로 사용되었습니다.
<스트롱>참고 패널
1KGP-EAS 참조 패널1000 게놈 프로젝트 (동아시아)동아시아 혈통 특이적 추정을 위한 1KGP의 하위 집합.
CKB 참조 패널차이나 카도리 바이오뱅크유전자형 보철을 위한 맞춤형 인구 특화 패널.
소프트웨어와 알고리즘
BCFtools v1.11GitHub (samtools/bcftools)염색체 수준의 결과를 병합하고 분류하며, 변이체를 필터링하는 데 사용됩니다.
GATK 4.0.4.0 툴셋의 BQSR브로드 연구소기본 품질 점수 재보정(BQSR)에 사용됩니다.
BWA-MEM .7.16a-r1181헹 리 / GitHub원시 리드를 GRCh38에 정렬하는 용도입니다.
DPGT (분산 집단 유전학 도구)BGI수백만 개의 WGS 샘플에 대한 공동 호출을 가능하게 한 분산 집단 유전학 분석 도구입니다. [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)에서 이용 가능합니다.
fastp.0.23.4오픈 소스 (Chen 외, 2018)품질 관리와 어댑터 트리밍을 위해서요.
GLIMPSE2옥스퍼드 대학교저보장 WGS에 대한 빠른 유전자형 위상 및 보정
분석 원본 코드이 종이Supplementary File 1 분석을 위한 원본 코드
피카드 툴킷브로드 연구소중복 표시 및 파일 형식 변환에 사용됩니다.
플링크 2.0C. 창, S. 퍼셀 / 브로드 연구소유전자형 형식 변환 및 연관성 분석에 관해서입니다.
파이썬 3.8파이썬 소프트웨어 재단스크립팅, 자동화, 데이터 분석에 사용됩니다.
퀼트2옥스퍼드 빅데이터 연구소외부 참조 패널을 이용한 HMM 기반 보철
R 4.1.3R 재단STITCH, QUILT2 실행, 플롯/통계 작성에 사용됩니다.
SAMtools v1.3GitHub (samtools/samtools)SAM/BAM 파일 조작을 위해서입니다.
Seqtk-1.5GitHub (lh3/seqtk)FASTA/Q 형식의 시퀀스 처리를 위한 툴킷. [GitHub - lh3/seqtk](https://github.com/lh3/seqtk)에서 이용 가능
SOAPnukeBGINGS 데이터 품질 관리 및 필터링을 위해서입니다.
스티치 v1.6.6옥스퍼드 대학교초저범위 시퀀싱에 최적화된 보완 도구
타빅스GitHub (samtools/tabix)bgzipped VCF 파일의 인덱싱 및 쿼리에 사용됩니다.
<강>기타 재료
GATK 번들 파일GATK[https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json]에서 이용 가능
1000G 유전 지도 (GRCh38)옥스퍼드 / 1000 게놈 프로젝트위상/인보 도구에 필수
GRCh38게놈 참조 컨소시엄읽기 정렬 및 변형 호출에 사용됩니다

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

관련 논문