June 23rd, 2012
풀링된 유전자 시퀀싱은 큰 무리에서 복잡한 phenotypes와 관련된 희귀한 변종을 탐지하기위한 빠르고 비용 효율적인 전략이다. 여기 가시가 소프트웨어 패키지를 사용하여 32 암 관련 유전자의 풀링, 차세대 시퀀싱의 전산 분석을 설명합니다. 이 방식은 확장성, 그리고 관심의 표현형에 적용됩니다.
이 절차의 전반적인 목표는 드문 기능적 변이가 우세한 개체 집단 내에서 유전자를 식별하는 것입니다. 이것은 먼저 DNA 샘플 모집단을 풀링하여 수행됩니다. 두 번째 단계는 차세대 염기서열분석 라이브러리를 만들고 염기서열분석을 수행하는 것입니다.
그 다음에는 참조 시퀀스에 대한 읽기를 정렬하고 오류 모델을 만듭니다. 마지막 단계는 스플린터 알고리즘을 사용한 컴퓨터 분석입니다. 궁극적으로, 풀링된 차세대 염기서열분석(Next generation sequencing)의 파편분석(splinter analysis)은 희귀한 기능적 변이가 우세한 집단 내 유전자를 보여주기 위해 사용되며, 이를 입증합니다.
오늘은 제 멘토이자 공동 연구자인 롭 미트라(Rob Mitra)의 연구실에 재학 중인 프란체스코 빌라니아(Francesco Vilania)와 제 연구실의 대학원생인 엔리케 라모스(Enrique Ramos)가 함께할 예정입니다. 단일 개별 유전자형과 같은 기존 방법에 비해 이 기술의 주요 장점은 사전 정보 없이 DNA 분자의 혼합 집단에서 매우 정확하게 희귀한 염기서열 변이를 검출할 수 있다는 것입니다. 이 방법은 대규모 코호트 연구에서 희귀 변이를 유발하는 새로운 질병의 빈도를 결정하는 방법과 같은 유전학 및 유전체학 분야의 주요 질문에 답하는 데 도움이 될 수 있습니다.
모든 파편 실험에는 최적의 정확도를 얻기 위해 음성 및 양성 대조군이 있어야 하며, PFU 초고충실도를 사용하여 PCR 반응 혼합물을 준비합니다. DNA 중합효소. 음성 대조군은 복제된 벡터 백본과 같이 유전적 변이가 없는 것으로 알려진 모든 DNA 염기서열에서 얻은 PCR 산물입니다.
여기서, M13 MP 18 벡터로부터의 1,934 염기쌍 앰플리콘이 사용된다. 양성 대조군은 전체 모집단에 존재하는 이전에 검증된 염기서열 변이체의 모든 세트일 수 있습니다. 이 데이터를 사용할 수 없는 경우, 이 실험실은 이 표에 나열된 대로 PGMT easy vector로 클로닝된 엔지니어링된 염기서열 혼합물로부터 PCR 산물당 331 염기로 구성된 인공 양성 대조군을 설계했습니다.
이러한 염기서열은 환자 풀 내에서 실제 변이의 다양한 작은 대립유전자 빈도를 모방하기 위해 결합됩니다. 이 비디오와 함께 제공되는 서면 프로토콜에서 논의된 바와 같이 샘플의 PCR 증폭 후, Kyogen KAYAK 퀵 컬럼 정제를 사용하여 과잉 프라이머의 각 PCR 산물을 세척하거나 대규모 세척을 위해 진공 매니폴드가 있는 96웰 필터 플레이트를 세척합니다. 정제가 완료되면 표준 기술을 사용하여 각 PCR 산물을 정량화합니다.
모든 PCR 산물과 대조군을 분자 수로 정규화된 풀로 결합할 준비를 합니다. 농도에 의한 풀링(pooling)은 더 큰 제품보다 작은 앰플리콘이 과대 대표되는 결과를 초래할 것입니다. 대신, 앰플리콘당 정규화된 수의 분자를 풀링합니다.
피펫팅 중 정확도를 유지할 수 있을 만큼 충분히 큰 임의의 숫자를 선택하십시오. PCR 산물과 대조군을 당깁니다. PCR 산물의 결찰은 작은 PCR 신청자의 단편화가 표현을 그들의 끝으로 편향시킬 가능성이 높기 때문에 필요합니다.
이러한 이유로 우리는 단편화되기 전에 풀 PCR 산물을 큰 단점으로 접합합니다. 프로토콜에 나열된 대로 T 4 Ligase, T 4 PNK 및 PEG를 사용하여 평활 말단 결찰을 위한 혼합물을 준비합니다. 섭씨 22도에서 17시간 동안 반응을 배양합니다.
그 후 섭씨 65도에서 20분 동안 배양하고 섭씨 4도에서 유지합니다. 50나노그램의 샘플을 어로즈 겔에 로드하여 접합을 확인합니다. 성공적인 결찰은 레인에 고분자량 밴드가 존재하는 결과를 낳습니다.
Qiagen PB Buffer에서 샘플을 10:1로 희석하여 점성을 낮추는 무작위 초음파 처리 전략을 통해 DNA 단편화를 준비합니다. 그런 다음 24개의 샘플 다이애건 노드 바이오 파열을 사용하여 PCR 산물의 큰 원추를 조각화하고 분당 40초 켜기 및 20초 끄기로 25분 동안 고출력으로 초음파 처리합니다. 어그로 겔(agro gel)에서 DNA 단편화(DNA fragmentation)의 결과를 확인하고 본문에 설명된 대로 발광 염기서열분석(illuminous sequencing)을 진행한다.
염기서열분석을 시작하려면 alignment를 읽습니다. 원시 염기서열분석을 변환하거나, 파일을 스카프 형식으로 읽거나, 압축할 수 있습니다. 압축은 선택 사항입니다.
관련 정보를 잃지 않고 후속 분석 단계를 위한 시간과 공간을 절약할 수 있습니다. 포함된 정렬 도구를 사용하여 원시 읽기를 주석이 달린 더 빠른 참조 시퀀스에 정렬합니다. 대상 영역에만 PCR 반응과 양성 및 음성 대조군이 포함됩니다.
입력 형식은 스카프 형식이거나 압축되어야 합니다. 다음으로, 텍스트에 설명된 대로 파일 태그 지정을 수행합니다. 각 실행은 각 실행에 대한 오류를 모델링하기 위한 정확한 변형 호출을 위해 특성화하기 위해 고유한 시퀀싱 오류 프로필을 생성합니다.
시퀀스 변동에 대해 배포된 것으로 알려진 내부 제어는 정렬된 태그가 지정된 파일로부터 각 풀 샘플 라이브러리에 포함되어 있습니다. 네거티브 제어 참조 시퀀스와 함께 포함된 도구를 사용하여 오류 모델 파일을 생성하면 모든 네거티브 제어 시퀀스를 사용하거나 5개의 프라임 및 3개의 프라임 끝으로 지정할 때 하위 집합만 사용할 수 있습니다. 고유 읽기 및 의사 수는 항상 적용되어야 합니다.
이 도구는 0, 1 또는 2로 끝나는 출력 파일 이름 매개 변수로 명명된 세 개의 파일을 생성합니다. 이러한 파일은 splinter를 사용한 변형 호출에 대해 각각 0, 1차 및 2차 오류 모델에 해당합니다. 2차 오류 모델은 항상 실행 오류율 프로필의 시각화에 사용해야 합니다.
오류 모델 그래프를 플롯하는 데 사용되는 Pearl 스크립트를 사용하여 0차 오류 모델 파일에 PDF 오류 플롯을 생성할 수 있습니다. 플롯 파일은 실행별 오류 추세를 나타내며 분석을 위한 최대 읽기 기반 수를 추론하는 데 사용할 수 있습니다. 다음 섹션에서는 오류 모델을 사용하여 정렬된 파일에서 splinter를 실행하여 희귀한 염기서열 변형을 감지하는 방법을 보여줍니다.
해석의 첫 번째 단계는 참조 시퀀스와 오류 모델을 사용하여 정렬된 파일에서 분할을 실행하는 것입니다. 단일 판독 베이스는 결함이 발견된 경우 분석에서 제외될 수 있습니다. P-값 컷오프는 변형 호출 분석이 얼마나 엄격한지를 나타냅니다.
최소 컷오프 마이너스 1.301이 좋은 시작입니다. pool size 옵션은 실제 풀에 있는 단일 대립유전자보다 작은 대립유전자 빈도로 전위 분산을 제거하여 알고리즘 신호를 잡음 구별에 최적화합니다. 풀 크기 옵션은 실험에서 분석된 실제 대립유전자 수보다 큰 가장 가까운 값으로 설정해야 합니다.
더 낮은 주파수에서 호출된 분산은 잡음으로 무시됩니다. 모든 매개 변수와 파일 이름을 입력 한 후 splinter를 실행하십시오. 이 파일은 변형의 변형 유형의 위치에 대한 설명과 함께 샘플 전체에서 통계적으로 유의한 모든 조회를 반환합니다.
DNA 가닥당 P-값, 변이체의 빈도 및 DNA 가닥당 총 적용 범위. 목록 바이알은 splinter에서 샘플 전체의 적용 범위를 정규화하는 데 사용됩니다. 첫 번째 필드는 관심 증폭을 나타내고, 두 번째 필드는 돌연변이가 존재하는 위치를 나타냅니다.
N은 염기서열의 나머지 부분에 돌연변이가 없음을 나타냅니다. 정규화, 양성 대조군의 분석은 특정 실행에 대한 민감도와 특이도를 최대화하는 데 중요합니다. 이는 마이너스 1.301의 초기 컷오프가 모든 거짓 긍정을 제거하기에 충분하지 않을 가능성이 높기 때문에 중요합니다.
모든 스플린터 분석에는 호출된 각 변형에 대한 실제 P-값이 표시되며, 이는 우선 순위를 예측할 수 없습니다. 그러나 알려진 참 양성 기본 위치에 대해 초기 출력에 표시된 가장 덜 엄격한 P-값을 사용하여 전체 분석을 반복할 수 있습니다. 이렇게 하면 모든 참 긍정을 유지하면서 전부는 아니더라도 대부분의 거짓 긍정을 제외하는 데 도움이 되며, 이는 일반적으로 참 긍정에 비해 훨씬 덜 중요한 P 값을 갖습니다.
이 프로세스를 자동화하기 위해 컷오프 테스터 스크립트를 사용할 수 있습니다. 컷오프 테스터 스크립트에는 스플린터 출력 파일과 정규화에 사용되는 탭으로 구분된 파일 형식의 포지티브 제어 적중 목록이 필요합니다. 결과 출력은 점진적으로 최적 컷오프에 도달하는 컷오프 목록이 됩니다.
마지막 줄은 실행에 대한 가장 최적의 컷오프를 나타내므로 데이터 분석에 사용할 수 있습니다. 최적의 결과는 1의 민감도와 특이도를 달성하는 것입니다. 그러나 도달하지 못한 경우 통합된 판독 베이스의 수를 변경하여 스플린터 분석을 최적화할 수 있습니다.
최종 컷오프는 컷오프 컷 스크립트를 사용하여 데이터에 적용할 수 있으며, 이 스크립트는 최적 컷오프 아래의 히트에서 스플린터 출력 파일을 필터링합니다. 이 단계에서는 샘플에 있는 캡처 및 indel을 포함하는 최종 스플린터 출력 파일을 생성합니다. 삽입에 대한 출력은 대체 또는 삭제에 대한 출력과 약간 다릅니다.
풀링된 샘플의 단일 대립유전자에 대한 커버리지 함수로서의 정확도는 이 유형의 플롯에서 시각화됩니다. 정확도는 곡선 아래 면적이 수신기 연산자 곡선의 UC로 축약된 것으로 추정되며 범위는 0.5의 무작위 정확도에서 1.0의 완벽한 정확도까지입니다. 이 예에서 UC는 200, 501, 000개의 대립유전자 풀에서 단일 돌연변이 대립유전자를 검출하기 위한 대립유전자당 커버리지 함수로 표시됩니다.
여기서 UC는 삽입, 삭제 및 대체에 대한 합계의 함수로 플롯됩니다. 이 오차 플롯은 주어진 위치에서 잘못된 기저가 통합될 확률을 보여줍니다. 오류 프로파일은 염기서열분석 판독의 3개 프라임 엔드로 향하는 추세가 증가하는 낮은 오류율을 보여줍니다.
현저하게 다른 참조 뉴클레오티드는 다른 오류 확률을 나타냅니다. 이 플롯은 대립유전자당 25배 이상의 커버리지를 가진 위치에 대한 대립유전자 빈도를 추정할 때 쪼개짐의 정확도를 보여줍니다. 스플린터(splinter)에 의해 추정된 풀링된 DNA 대립유전자 빈도와 게놈 광역 연관 연구(genome wide association studies) 또는 GWAS 결과에 의해 측정된 대립유전자 수를 비교합니다.
매우 높은 상관 관계에서 974명의 개체군을 추출하여 염기서열 분석을 위해 20킬로베이스 이상을 목표로 삼았습니다. Splinter는 희귀 변이체를 검출하기 위해 적용되었습니다. 표준 프로토콜에 따라 각 개인은 이전에 태그가 지정된 변이체와 새로운 변이체의 유전형 분석 간에 GWAS에 의해 수행된 유전형 분석을 가졌습니다.
풀링된 샘플에서 호출된 것은 훌륭했습니다. 3개의 변이체 중 2개는 집단에서 드물었고 염기서열분석 결과에서 denovo라고 불렸으며, 개별 파이로 염기서열분석, 경미한 대립유전자 빈도 또는 파이로 염기서열분석과 당겨진 염기서열분석 사이의 수학 일치가 우수했습니다. 합동 표본에서 희귀 분산을 찾는 작업을 마치면 많은 사람들이 식별된 분산의 기능적 결과가 무엇인지 알고 싶어합니다.
따라서 분산에 대한 주석은 개발 후 프로세스의 다음 단계가 됩니다. 이 기술은 DNA 염기서열분석 분야의 연구자들이 대규모 인구 연구에서 희귀 변이체를 특성화하기 위해 빠르고 비용 효율적인 방식으로 희귀 변이를 연구할 수 있는 길을 열었습니다. 이 비디오를 시청한 후에는 스플린터를 사용하여 풀, DNA 샘플에서 희귀 염기서열 변이를 감지하는 방법을 잘 이해하게 될 것입니다.
풀링된 DNA 시퀀싱은 대규모 인구에서 복합 형질과 연관된 희귀 유전 변이를 식별하는 효율적인 방법입니다. 이 기사에서는 SPLINTER 소프트웨어 패키지를 사용하여 32개의 암 관련 유전자의 풀링된 시퀀싱 데이터의 계산 분석을 자세히 설명합니다.
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.