2014년 2월 5일
여기에서 우리는 뉴클레오티드 또는 아미노산 서열 데이터 세트에서 안정적인 계통 발생을 생성하기위한 단계별 파이프 라인을 설명합니다. 이 가이드는 연구자 또는 계통 발생 학적 분석에 새로운 학생 서비스를 제공하는 것을 목표로하고있다.
이 논문의 전반적인 목표는 DNA 또는 단백질 서열로부터 신뢰할 수 있는 계통수를 재구성하는 것입니다. 이는 먼저 NCBI의 blast 프로그램을 사용하여 유사한 서열을 식별함으로써 수행됩니다. 두 번째 단계는 유사한 서열들을 정렬하는 것입니다.
다음으로, 정렬 데이터를 바탕으로 최적의 진화 모델을 결정합니다. 마지막 단계는 정렬된 서열로부터 계통발생학적 관계를 추론하는 것입니다. 궁극적으로, 이러한 단계별 파이프라인을 통해 사용자가 서열 데이터로부터 신뢰할 수 있는 계통수를 도출하는 과정을 보여줍니다.
이 방법은 새로운 서열의 정체성과 기능을 추론함으로써 다양한 분야의 핵심적인 질문에 답하는 데 도움이 될 수 있습니다. 기본 국소 정렬 검색 도구(basic local alignment search tool) 또는 blast의 온라인 버전을 사용하려면 국립생물정보센터(National Center for Biotechnology Information) 또는 NCBI의 Blast 웹 서버로 이동하십시오. 적절한 blast 프로그램을 클릭하십시오.
여기에 표시된 것과 같이 FASTA 형식의 텍스트 서열을 쿼리 상자에 입력하십시오. 검색에 사용할 적절한 blast 프로그램을 클릭한 다음 blast를 클릭하십시오. 출력 결과는 기본적으로 HTML 형식으로 제공되며, 입력한 텍스트 서열과 가장 유사한 서열들이 표시됩니다.
다음 섹션에서는 Windows 및 Mac에서 로컬 blast 실행 파일을 사용하는 방법을 다룹니다. 사용자는 Mac용 Blast Local 실행 파일 섹션으로 건너뛸 수 있습니다. Windows 컴퓨터에서 blast 명령줄 프로그램을 실행하려면 NCBI blast 웹사이트에서 적절한 Windows 실행 파일을 다운로드하십시오.
Blast 프로그램을 설치한 후, 다음과 같이 PC 환경 변수를 설정하십시오. PC의 시작 버튼을 클릭하고 내 컴퓨터를 마우스 오른쪽 버튼으로 클릭합니다. 그런 다음 속성을 클릭하십시오. 새 창에서 고급 시스템 설정으로 들어간 후, 새로 나타나는 팝업 창의 고급 탭에서 환경 변수 버튼을 클릭하십시오.
그런 다음 사용자 섹션의 사용자 변수에서 'new' 버튼을 클릭합니다. 새 팝업 창에 변수 이름 'path'와 여기에 표시된 변수 값을 추가합니다. 다음으로, NCBI 웹사이트에서 매일 업데이트되는 사전 포맷팅된 blast 데이터베이스 또는 특정 생물체의 게놈을 다운로드하십시오.
그런 다음 시작 버튼을 클릭하고 검색창에 CMD를 입력하여 MS DOS 프롬프트를 연 뒤, NCBI blast 폴더로 이동합니다. 여기에 표시된 Make blast DB 명령어를 사용하여 데이터베이스를 생성합니다. DB 폴더에 FASTA 형식의 단백질 텍스트 서열을 삽입하여 test라는 이름의 쿼리 단백질 서열을 생성합니다.
그 다음, 테스트 단백질과 가장 유사한 서열을 식별하기 위해 blast P 쿼리 명령어를 통해 데이터베이스를 조회합니다. 다음 섹션에서는 Mac 사용자를 위해 이 정보를 반복하여 설명합니다. Windows 사용자는 다섯 번째 섹션인 다중 서열 정렬 생성 단계로 건너뛰어도 좋습니다.
Mac에서 blast 명령줄 프로그램을 실행하려면, N-C-B-I-F-T-P 사이트에 원격으로 접속하여 적절한 MAC 실행 파일을 다운로드하십시오. 이를 위해 Finder를 열고 terminal을 검색한 뒤, 터미널 창에 N-C-B-I-F-T-P 사이트의 FTP 주소를 입력하십시오. 이름과 비밀번호로 anonymous를 입력한 다음, CD blast/executables/latest를 입력하십시오.
LS를 입력하여 실행 가능한 파일 목록을 확인하고, 다음 명령어를 입력하여 시스템 요구 사항에 맞는 최신 버전을 다운로드하십시오. 이제 다운로드한 파일의 압축을 해제하십시오. 그런 다음, 쉘이 해당 디렉토리를 검색할 수 있도록 blast 실행 파일의 바이너리 위치를 경로(path)에 추가하십시오.
명령어를 검색할 때, NCBI 웹사이트에서 미리 포맷팅된 blast 데이터베이스나 게놈을 다운로드하십시오. CD genomes를 입력하여 게놈 디렉토리를 검색하십시오. 그 다음, 관심 있는 게놈이나 서열을 다음과 같이 다운로드하고, quit를 입력하여 FTP 사이트에서 나가십시오.
다음으로, Make Blast DB 명령어를 입력하여 데이터베이스를 생성합니다. FASTA 형식의 쿼리 서열을 bin 폴더에 삽입하고, blast P 쿼리 명령으로 데이터베이스를 조회하여 테스트 서열 데이터와 가장 유사한 서열을 찾습니다. 흔히 사용되는 다중 서열 정렬(multiple sequence alignment, MSA) 프로그램 중 하나는 tea coffee입니다. tea coffee 사이트의 쿼리 상자에 FASTA 형식의 서열 데이터를 입력하면, 출력 결과에 유사한 잔기들이 색상 코드로 표시됩니다.
또 다른 일반적으로 사용되는 MSA 프로그램은 Clustal MSA이며, 다양한 운영 체제용 명령줄 버전인 CLUSTAL W 또는 그래픽 버전인 CLUSTAL X로 다운로드할 수 있습니다. 다음으로, 파일 탭을 선택하여 서식 지정된 서열 텍스트 형태로 데이터를 Clustal 프로그램에 로드합니다. 그런 다음 서열 로드(load sequences) 버튼을 클릭합니다.
이제 align 탭으로 전환하고 do complete alignment 버튼을 클릭하여 진화의 최적 적합 모델에 맞춰 서열을 정렬하십시오. protest 프로그램을 다운로드하십시오. protest 다운로드가 완료되면 protest를 더블 클릭하십시오.
Protest가 실행되면, 정렬 상자의 파일 선택을 클릭하여 서열 데이터를 불러옵니다. 그런 다음 시작을 클릭하여 프로그램을 실행합니다. 실행이 완료되면, 프로그램은 서열 추론 기준에 따라 최적의 모델을 제시합니다.
Phi ML을 다운로드하고 실행한 후, 파일 이름과 PY를 입력하여 lip 형식의 서열 파일을 입력 서열로 로드하십시오. 그런 다음 y를 입력하여 프로그램을 실행하십시오. MrBayes 웹사이트에서 베이지안 추론 프로그램을 다운로드한 후, 실행 파일을 클릭하여 프로그램을 시작하십시오. 이어서 execute 파일이름.NEX를 입력하여 Nexus 형식의 서열 데이터를 프로그램으로 읽어 들이십시오.
다음으로, 진화 모델을 설정하고 실행할 세대 수를 선택합니다. mc mc 명령어로 분석을 실행한 후, sum T 명령어를 사용하여 트리를 요약하고 계통수를 확인합니다. 트리 뷰어 프로그램을 다운로드하십시오.
마지막으로, 더 나은 정렬, 유사성 예측 또는 계통수를 제공하기 위한 새로운 소프트웨어가 지속적으로 출시되고 있습니다. 본 영상의 개요에서는 대중적인 프로그램들을 다루었으나, 시청자께서 추가적인 옵션들을 탐색해 보실 것을 권장합니다. blast 알고리즘은 서열 유사성의 짧은 구간을 검색하는 로컬 정렬을 수행합니다.
알고리즘이 쿼리 서열로부터 가능한 모든 구간을 검색하고 이 서열들을 최대한 확장한 후, 정렬을 조립합니다. 각 쿼리 서열 쌍에 대해, e 값은 일치 항목의 통계적 유의성을 나타냅니다. E 값이 낮을수록 히트의 유의성이 더 높습니다.
예를 들어, E value가 0.05인 서열 정렬은 이러한 일치가 단순히 우연히 발생했을 가능성이 100번 중 5번임을 의미합니다. BIT score는 특정 점수 행렬을 사용하여 정렬의 품질이 얼마나 좋은지를 나타냅니다. BIT score가 높을수록 정렬의 품질이 더 좋음을 의미합니다.
다중 서열 정렬(multiple sequence alignment, MSA)은 아미노산, DNA 또는 RNA로 구성된 세 개 이상의 일차 서열을 정렬하는 것입니다. 여기에 표시된 T-Coffee MSA 결과물은 유사한 잔기들을 색상으로 구분하여 보여줍니다. 아미노산 정렬의 예시로 ClusterX를 사용하여 정렬한 6개 단백질 서열의 샘플 정렬 결과가 여기에 제시되어 있습니다.
protest 프로그램은 아미노산 치환의 최적 적합 모델을 결정하는 데 사용됩니다. 데이터 내에서 이 프로그램은 분석 중인 모델들을 나열하며, 프로그램 완료 후 최적 적합 모델을 표시합니다. Phi ML은 뉴클레오타이드 또는 아미노산 서열 정렬로부터 최대 우도 계통수를 추정합니다. 이 프로그램은 트리 토폴로지 공간을 탐색하기 위한 다양한 옵션과 결합된 다수의 치환 모델을 포함하고 있습니다.
Mr.Bayes는 여러 진화 모델에 걸쳐 베이지안 CMC 추론을 사용하여 계통발생학적 관계를 재구성합니다. 프로그램이 실행되면 여기에서 보는 바와 같이 특정 간격으로 진행 상황을 확인할 수 있습니다. 계통수가 생성되면 토폴로지를 시각화해야 합니다.
이 그림에서 트리 뷰 창은 fly.Base의 단백질 샘플 트리를 보여줍니다. 트리 뷰에는 사용자가 가지를 이동하고 트리를 재배치할 수 있는 트리 편집기가 포함되어 있습니다. 이 절차를 수행할 때, 각 프로그램의 사용자 가이드를 철저히 읽는 것이 중요합니다.
본 프로토콜은 이러한 프로그램들이 어떻게 작동하는지 독자에게 소개하는 실용적인 시작점을 제공합니다. 하지만 독자께서 각 프로그램과 관련된 다양한 설정값들을 직접 조작해 보며 익숙해지시기를 권장합니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
본 논문은 DNA 또는 단백질 서열로부터 신뢰할 수 있는 계통수를 재구성하기 위한 단계별 파이프라인을 제시합니다. 이 내용은 계통 분석을 처음 접하는 연구자와 학생들을 위해 설계되었습니다.
계통발생학적 분석은 새로운 서열의 기능적 정체성과 진화적 관계를 추론함으로써, 초기 발굴 단계에서의 타겟 검증과 메커니즘적 리스크 감소를 가능하게 합니다. 이 파이프라인은 생물학적 맥락을 명확히 하고 타겟 가설 검증의 모호성을 줄여 리드 물질 식별의 예측 신뢰도를 높여줍니다. 또한 서열 데이터에서 기능적 주석으로 이어지는 중개적 교량 역할을 하여, 포트폴리오 우선순위 결정과 리스크가 조정된 개발 추진 결정에 정보를 제공합니다.
이 방법은 타겟 식별부터 리드 최적화까지의 발굴 연속체에 통합되어, 진화적 관계에 기반한 가설 검증, 생물학적 리스크 감소 및 예측 모델링을 가능하게 합니다.