2018년 4월 4일
타겟된 다음-세대 시퀀싱 질병 연구 및 임상 진단에서 점점 인기 끌고있다는 시간 및 비용 효율적인 접근 이다. 여기에 설명 된 프로토콜 시퀀싱에 필요한 복잡 한 워크플로 및 질병을 유전 이체를 식별 하는 데 사용 하는 생물 정보학 과정을 제공 합니다.
표적 차세대 염기서열분석의 전반적인 목표는 특히 관심 있는 게놈 영역에 초점을 맞춰 다양한 체질 질환의 유전적 결정 요인을 밝히는 것입니다. 이 방법은 특히 이전에 알려진 유전적 연관성이 있는 경우 질병의 유전적 이데올로기에 관한 주요 질문에 답하는 데 도움이 될 수 있습니다. 이 기술은 매우 효율적입니다.
단기간에 수백만 건의 판독을 생성하고, 상대적으로 저렴한 비용으로 판독을 얻을 수 있으며, 특히 다른 차세대 염기서열분석 접근 방식과 비교할 때 상대적으로 낮은 계산 부담이 있습니다. 이 기술의 의미는 표현형적이고 유전적으로 이질적이지만 많은 관련 유전적 좌위가 있는 신경퇴행성 질환의 진단으로 확장됩니다. 이 방법은 특히 신경퇴행성 질환을 대상으로 하지만, 이전에 확인된 관심 게놈 영역이 있는 다양한 다른 체질 질환에도 적용할 수 있습니다.
일반적으로 이 방법을 처음 접하는 개인은 최종 희귀 변이 분석에 필요한 생물정보학 처리가 계산 집약적이고 많은 오류 원인을 생성할 수 있기 때문에 어려움을 겪을 것입니다. 이 절차에서 인간의 혈액 샘플을 3, 4 밀리리터 EDTA K2 튜브에 수집하여 총 약 12 밀리리터를 제공합니다. 혈액 샘플을 중력의 750배에서 20분 동안 원심분리합니다.
이렇게 하면 각 샘플이 혈장의 상부기, 백혈구의 얇은 중간기, 적혈구의 하부기로 분획됩니다. 일회용 이송 피펫을 사용하여 혈액 샘플의 상단에서 혈장을 피펫으로 제거합니다. 여러 개의 500마이크로리터 분취액에 분주하고 향후 생화학 분석을 위해 섭씨 영하 80도에서 보관하십시오.
제조업체의 지침에 따라 혈액 추출 키트로 혈액 샘플에서 DNA를 추출합니다. 추출된 DNA는 차세대 염기서열분석을 위한 염기서열분석 라이브러리를 준비하는 데 사용됩니다. 시퀀싱 실행이 완료되면 컴퓨터에서 탐색 패널에서 실행을 선택하여 클라우드 기반 컴퓨팅 환경 내에서 파일을 찾습니다.
적절한 시퀀싱 실행을 선택하여 실행 요약 페이지로 이동합니다. 다운로드를 선택하여 클라우드에서 데이터를 가져옵니다. 나타나는 대화 상자에서 다운로드할 파일 형식으로 FASTQ 파일을 선택하고 다운로드를 클릭합니다.
클라우드 기반 컴퓨팅 환경의 Run Summary(실행 요약) 페이지에서 Charts(차트)로 이동하여 컴퓨팅 환경에서 생성된 다양한 수치를 사용하여 시퀀싱 실행의 품질을 분석합니다. Run Charts(실행 차트) 페이지에서 Data By Cycle(주기별 데이터)이라는 레이블이 지정된 Figure를 찾고, Chart(차트)에서 Intensity(강도)를 선택하고, Channel(채널)에서 All Channels(모든 채널)를 선택하여 신호 강도 플롯을 생성합니다. Run Navigation(실행 탐색) 패널에서 Indexing QC(인덱싱 QC) 탭을 선택하여 페이지 오른쪽에 있는 Indexing Quality Control 히스토그램을 찾습니다.
클라우드 기반 컴퓨팅 환경의 Run Summary(실행 요약) 페이지에서 Run(실행) 탐색 패널 내의 Metrics(메트릭스)를 클릭하여 품질 메트릭으로 이동합니다. Density kelvin per millimeter squared(밀리미터 제곱당 켈빈)에서 염기서열분석 실행의 클러스터 밀도가 사용 중인 농축 키트에서 권장하는 범위 내에 있는지 확인합니다. 이 경우 1, 200에서 1, 400 켈빈 / 밀리미터 제곱
.Q30보다 크거나 같은 총 백분율에서 값이 시퀀싱 판독의 품질을 반영하는 85% 이상인지 확인합니다. 정렬됨에서 값이 염기서열분석 실행에 포함된 양성 대조군의 백분율과 유사한지 확인합니다. 예를 들어, 1%양수 제어가 사용된 경우 예상되는 정렬 백분율은 약 1에서 5%이며 소수점 몇 자리 내의 변형이 허용됩니다.
FASTQ 염기서열분석 판독값을 데이터 처리 소프트웨어로 가져와서 이 프로세스를 시작합니다. 탐색 영역 내에서 마우스 오른쪽 버튼을 클릭하고 New Folder를 선택합니다. 수행된 시퀀싱 실행에 대한 명확성을 위해 폴더 이름을 지정합니다.
맨 위에 있는 도구 모음에서 가져오기를 선택하고 드롭다운 목록에서 시퀀싱이 수행된 플랫폼을 선택합니다. ONDRISeq의 목적을 위해 Ilumina가 선택됩니다. 대화 상자에서 처리 중인 시퀀싱 실행에서 FASTQ 파일을 찾아 선택합니다.
대화 상자의 General(일반) 옵션에서 Paired reads if sequencing used paired end chemistry(쌍을 이룬 말단 화학을 사용한 경우 Paired reads) 옆의 상자를 클릭합니다. 대화 상자의 Paired read information(페어링된 읽기 정보)에서 정방향 읽기 FASTQ 파일이 파일 목록에서 역방향 읽기보다 먼저 표시되는 경우 Paired-end(페어링 종료)를 선택합니다. Paired read 최소 거리를 1로, 최대 거리를 1000으로 설정합니다.
대화 상자의 Ilumina 옵션에서 Remove failed reads(실패한 읽기 제거)를 선택합니다. Quality score(품질 점수) 드롭다운 목록에서 염기서열분석에 사용된 NGS 파이프라인을 선택합니다. 대화 상자 아래쪽에서 다음을 선택합니다.
Save(저장) 및 Create subfolders per batch unit(배치 단위당 하위 폴더 생성)을 선택합니다. 대화 상자 아래쪽에서 다음을 선택합니다. 이전에 만든 폴더를 선택합니다.
여기에서 FASTQ 파일을 가져옵니다. 대화 상자 아래쪽에서 마침을 선택하고 FASTQ 파일을 가져올 때까지 기다립니다. 프로세스 탭을 클릭하여 파일 가져오기의 상태를 확인합니다.
다음으로, 제조업체의 지침에 따라 재시퀀싱 및 변형 호출을 수행할 수 있도록 소프트웨어 내의 워크플로를 설계합니다. 재시퀀싱 및 변형 호출 워크플로를 디자인하는 것은 이 절차에서 가장 어려운 부분입니다. 우리 팀은 모범 사례를 조사하고 시행착오를 통해 우리의 요구에 맞는 가장 강력한 워크플로를 고안했습니다.
사용자 지정 생물정보학 워크플로우를 통해 가져온 FASTQ 염기서열분석 읽기 파일을 실행하려면 먼저 소프트웨어의 도구 상자에서 워크플로우를 식별하고 두 번 클릭합니다. 나타나는 대화 상자에서 탐색 영역 내에서 가져온 FASTQ 파일의 폴더를 찾습니다. 탐색 영역 내에서 모든 폴더를 선택하여 강조 표시한 다음 Batch 옆의 상자를 클릭합니다.
오른쪽 방향 화살표를 사용하여 파일을 선택한 요소로 이동합니다. 대화 상자 아래쪽에서 다음을 클릭합니다. 대화 상자 내에서 배치 개요를 검토하여 올바른 FASTQ 파일이 선택되었는지 확인한 후 다음을 클릭합니다.
대화 상자 내에서 워크플로의 단계를 검토하여 워크플로를 디자인할 때 올바른 파일과 내보내기 위치가 선택되었는지 확인합니다. 이러한 단계에는 참조 시퀀스에 대한 읽기 매핑, 중복된 매핑된 읽기 제거, 대상 지역에 대한 통계 만들기, BAM 파일 내보내기, 탭으로 구분된 텍스트 내보내기, 겹침을 기반으로 필터링 및 VCF 파일 내보내기가 포함됩니다. 대화 상자의 마지막 단계인 Result handling(결과 처리)에서 Save in input folder(입력 폴더에 저장) 옵션을 선택합니다.
대화 상자 아래쪽에서 마침을 클릭합니다. 마지막 단계는 텍스트 프로토콜에 설명된 대로 각 샘플의 VCF 파일에 대해 변형 주석을 수행하는 것입니다. 이 비디오에서 시연된 방법론은 ONDRI에 등록된 개인의 참가자 DNA 샘플 528명에 적용되었습니다.
샘플은 ONDRISeq 패널에서 실행당 24개 샘플씩 22회 실행되었습니다. 전반적으로, 염기서열분석 데이터는 평균 78회의 표본 커버리지로 고품질인 것으로 확인되었습니다. 평균 95.6%의 판독이 참조 시퀀스와 일치했으며 모든 ONDRISeq 실행에는 90% 이상의 판독이 매핑되었습니다.
매핑된 판독값 중 92.0%와 Q30 이상의 Phred 점수. 이 표적 NGS 워크플로우의 유용성을 입증하기 위해 파킨슨병 환자인 68세 남성의 예를 제시하여 N 오버 아웃풋이 감소된 것을 보여줍니다. 주석이 달린 분산은 빨간색 상자로 표시된 것처럼 임상적으로 중요할 가능성이 가장 높은 변수를 식별하기 위해 선별됩니다.
이 절차를 수행할 때 염기서열분석 플랫폼, 사용된 농축 키트 및 연구 요구 사항에 맞게 단계를 적절하게 제공하는 것을 기억하는 것이 중요합니다. 개발 후 이 기술은 유전학 분야의 연구자들이 전체 엑솜 및 전체 게놈 데이터보다 저렴하면서도 고품질의 지역별 데이터를 얻을 수 있는 길을 열었습니다.
표적 차세대 염기서열 분석(Targeted next-generation sequencing)은 특히 신경퇴행성 질환과 같은 질병과 관련된 유전적 변이를 식별하는 데 비용 효율적인 방법입니다. 본 프로토콜에서는 염기서열 분석 및 이에 수반되는 생물정보학 공정에 대한 워크플로우를 설명합니다.
강력한 생물정보학 파이프라인을 갖춘 표적 차세대 염기서열 분석(NGS)을 통해 선천성 및 신경퇴행성 질환의 알려진 유전적 결정 요인을 정밀하게 조사할 수 있습니다. 이러한 접근 방식은 신뢰도 높은 변이 식별을 가능하게 하여, 자원 배분을 최적화하는 동시에 조기 발견 및 중개 연구를 지원합니다. 이러한 효율성과 확장성은 실행 가능한 유전적 통찰력을 추구하는 포트폴리오 기반 R&D 조직에 전략적 자산이 됩니다.
본 표적 NGS 및 생물정보학 워크플로우는 초기 발견부터 중개 연구까지를 통합하여, 변이 식별에서 기능적 검증까지의 가교 역할을 합니다.