2014년 2월 5일
여기에서 우리는 뉴클레오티드 또는 아미노산 서열 데이터 세트에서 안정적인 계통 발생을 생성하기위한 단계별 파이프 라인을 설명합니다. 이 가이드는 연구자 또는 계통 발생 학적 분석에 새로운 학생 서비스를 제공하는 것을 목표로하고있다.
이 기사의 전반적인 목표는 DNA 또는 단백질 염기서열로부터 신뢰할 수 있는 계통발생 나무를 재구성하는 것입니다. 이는 먼저 NCBI에서 폭발 프로그램을 사용하여 유사한 염기서열을 식별함으로써 수행됩니다. 두 번째 단계는 유사한 시퀀스를 정렬하는 것입니다.
다음으로, 정렬에서 가장 적합한 진화 모델이 결정됩니다. 마지막 단계는 정렬된 염기서열에서 계통발생학적 관계를 추론하는 것입니다. 궁극적으로 단계별 파이프라인은 사용자가 염기서열 데이터에서 신뢰할 수 있는 계통발생으로 이동하는 방법을 보여주는 데 사용됩니다.
이 방법은 새로운 염기서열에 대한 정체성과 기능을 추론하여 다양한 분야의 핵심 질문에 답하는 데 도움이 될 수 있습니다. 기본 로컬 정렬 검색 도구 또는 폭발의 온라인 버전을 사용하려면 National Center for Biotechnology Information 또는 NNC B의 Blast 웹 서버로 이동합니다. 적절한 폭발 프로그램을 클릭하십시오.
여기에 표시된 것과 같은 FASTA 형식의 텍스트 시퀀스를 쿼리 상자에 입력합니다. 검색에 사용할 적절한 blast 프로그램을 클릭한 다음 blast를 클릭합니다. 출력은 기본적으로 HTML 형식이며 입력 텍스트 시퀀스와 가장 유사한 시퀀스를 표시합니다.
다음 섹션에서는 Windows Mac에서 로컬 Blast 실행 파일을 사용하는 방법에 대해 설명합니다. 사용자는 Mac용 Blast Local 실행 파일 x라는 다음 섹션으로 건너뛸 수 있습니다. Windows 컴퓨터에서 blast 명령줄 프로그램을 실행하려면 NCBI blast 웹 사이트에서 적절한 Windows 실행 파일을 다운로드합니다.
Blast 프로그램을 설치한 후 다음과 같이 PC 환경 변수를 구성하고 PC 시작 버튼을 클릭한 다음 컴퓨터를 마우스 오른쪽 버튼으로 클릭합니다. 그런 다음 속성을 클릭합니다. 새 창에서 고급 시스템 설정을 선택하고 새 팝업의 고급 탭에서 환경 변수 버튼을 클릭합니다.
그런 다음 user variables for user 섹션에서 new 버튼을 클릭합니다. 새 팝업에서 변수 이름 path와 여기에 표시된 변수 값을 추가합니다. 다음으로, NCBI 웹 사이트 또는 특정 유기체에 대한 게놈에서 매일 업데이트되는 사전 포맷된 blast 데이터베이스를 다운로드합니다.
그런 다음 시작을 클릭하고 검색 창에 CMD를 입력하여 MS DOS 프롬프트를 열고 NCBI blast 폴더로 변경합니다. 여기에 표시된 Make blast DB 명령을 사용하여 데이터베이스를 만듭니다. FASTA 형식의 단백질 텍스트 시퀀스를 DB 폴더에 삽입하여 test라는 쿼리 단백질 시퀀스를 만듭니다.
그런 다음 테스트 단백질과 가장 유사한 염기서열을 식별하려면 blast P 쿼리 명령을 통해 데이터베이스를 조사합니다. 다음 섹션에서는 Mac 사용자를 위해 이 정보를 반복합니다. Windows 사용자는 섹션 5로 건너뛰어 여러 시퀀스 정렬을 생성할 수 있습니다.
Mac에서 blast 명령줄 프로그램을 실행하려면 N-C-B-I-F-T-P 사이트에 원격으로 액세스하여 적절한 MAC 실행 파일을 다운로드합니다. 이렇게 하려면 파인더를 열고 터미널 창에서 터미널을 검색하려면 N-C-B-I-F-T-P 사이트의 FTP 주소를 입력합니다. 이름 및 암호에 anonymous를 입력한 다음 CD blast slash executables slash latest를 입력합니다.
LS를 입력하여 실행 파일을 나열하고 다음을 입력하여 시스템 요구 사항과 일치하는 최신 버전을 다운로드합니다. 이제 다운로드한 파일의 압축을 풉니다. 이제 blast 실행 파일의 바이너리 위치를 경로에 추가하여 쉘이 이 디렉토리를 검색할 수 있도록 합니다.
명령을 찾을 때 NCBI 웹 사이트에서 미리 포맷된 blast 데이터베이스 또는 게놈을 다운로드합니다. CD genomes를 입력하여 게놈 디렉토리를 검색합니다. 그런 다음 다음과 같이 관심 있는 게놈 또는 염기서열을 다운로드한 다음 quit를 입력하여 FTP 사이트를 종료합니다.
그런 다음 Make Blast DB 명령을 입력하여 데이터베이스를 만듭니다. FASTA 형식의 쿼리 시퀀스를 bin 폴더에 삽입하고 blast P 쿼리 명령으로 데이터베이스를 조사하여 일반적으로 사용되는 다중 시퀀스 정렬 또는 MSA 프로그램 중 테스트 시퀀스 데이터와 가장 유사한 시퀀스를 찾습니다. 차 커피 사이트의 쿼리 상자에 fasta 형식의 시퀀스 데이터를 입력한 후 출력은 색상 코딩에 의해 유사한 잔류물을 나타냅니다.
일반적으로 사용되는 또 다른 MSA 프로그램은 클러스터 MSA로, 다양한 운영 체제용 명령줄 버전, CLUSTERAL W 또는 그래픽 버전 CLUSTERAL X로 다운로드할 수 있습니다. 다음으로, 파일 탭을 선택하여 서식이 지정된 시퀀스 텍스트만큼 빠르게 데이터를 클러스터 프로그램에 로드합니다. 그런 다음 load sequences 버튼을 클릭합니다.
이제 align 탭으로 전환하고 do complete alignment 버튼을 클릭하여 가장 적합한 진화 모델을 위해 시퀀스를 정렬합니다. 시위 프로그램을 다운로드하세요. protest가 다운로드되면 protest를 두 번 클릭합니다.
항의가 시작되면 정렬 상자에서 파일 선택을 클릭하여 시퀀스 데이터를 로드합니다. 그런 다음 시작을 클릭하여 프로그램을 실행합니다. 실행을 완료한 후 프로그램은 시퀀스를 추론하기 위한 기준에 따라 최상의 모델을 나타냅니다.
Phi ML을 다운로드하고 실행한 후 파일 이름과 PY를 입력하여 입력 시퀀스를 파일 립 형식의 시퀀스로 로드합니다. 그런 다음 y를 입력하여 프로그램을 시작합니다. Mr Bays 웹 사이트에서 베이지안 추론 프로그램을 다운로드한 후 실행 파일을 클릭하여 프로그램을 시작합니다. 그런 다음 execute file name dot NEX를 입력하여 Nexus 형식의 시퀀스 데이터를 프로그램으로 읽습니다.
다음으로, 진화 모델을 설정하고 실행할 세대 수를 선택합니다. mc mc 명령으로 분석을 실행한 후 sum T 명령을 사용하여 트리를 요약하여 계통 발생 트리를 확인합니다. 트리 뷰 프로그램을 다운로드합니다.
마지막으로, 더 나은 정렬, 유사성 예측 또는 계통 발생 트리를 제공하는 것을 목표로 하는 새로운 소프트웨어가 지속적으로 출시되고 있습니다. 이 비디오의 개요에서는 인기 있는 프로그램을 다루었지만 시청자는 추가 옵션을 탐색하는 것이 좋습니다. blast 알고리즘은 시퀀스 유사성의 짧은 스트레치를 검색하는 로컬 정렬을 수행합니다.
알고리즘이 쿼리 시퀀스에서 가능한 모든 스트레치를 조회하고 이러한 시퀀스를 최대로 확장한 후 정렬을 어셈블합니다. 각 쿼리 시퀀스 쌍에 대해 e 값은 일치에 대한 통계적 유의성을 나타냅니다. E 값이 낮을수록 적중률이 커집니다.
예를 들어, E 값이 0.05인 시퀀스 정렬은 이 일치가 우연히 발생할 확률이 100분의 5임을 의미합니다. BIT 점수는 특정 점수 매기기 매트릭스를 사용하여 정렬이 얼마나 좋은지 나타내는 표시를 제공합니다. BIT 점수가 높을수록 정렬이 더 좋아집니다.
다중 염기서열 정렬(multiple sequence alignment, MSA)은 아미노산, DNA 또는 RNA로 구성된 3개 이상의 1차 염기서열의 염기서열 정렬입니다. 여기에 보이는 MSA 차 커피의 출력은 유사한 잔류 물을 색상으로 구분합니다. 클러스터 X를 사용하여 정렬된 6개의 단백질 염기서열의 샘플 정렬이 아미노산 정렬에 대해 여기에 나와 있습니다.
프로그램 항의는 아미노산 대체품의 최적 적합 모델 선택을 결정하는 데 사용됩니다. 데이터 내에서 프로그램은 분석 중인 모델을 나열하고 프로그램 완료 후 가장 적합한 모델을 표시하며, Phi ML은 뉴클레오티드 또는 아미노산 서열의 정렬에서 최대 가능성 계통 발생을 추정합니다. 트리 토폴로지 공간을 검색하기 위해 다양한 옵션에 결합된 많은 수의 대체 모델을 통합합니다.
Mr.Bayes는 계통발생학적 관계를 재구성하기 위해 여러 진화 모델에서 베이지안 CMC 추론을 활용합니다. 프로그램이 실행되면 다음과 같이 특정 간격으로 진행 상황을 볼 수 있습니다. 계통 발생 나무가 생성되면 토폴로지를 시각화해야 합니다.
이 그림에서 트리 보기 창에는 파리의 단백질 샘플 트리가 표시됩니다. 기지. 트리 뷰에는 사용자가 분기를 이동하고 트리의 경로를 변경할 수 있는 트리 편집기가 포함되어 있습니다. 이 절차를 시도하는 동안 각 프로그램의 사용자 가이드를 철저히 읽어야 한다는 것을 기억하는 것이 중요합니다.
이 프로토콜은 독자에게 이러한 프로그램의 작동 방식을 소개하는 실용적인 시작점을 제공합니다. 그러나 독자가 각 프로그램과 관련된 많은 설정을 가지고 놀고 익숙해지도록 권장합니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
이 기사는 DNA 또는 단백질 서열로부터 신뢰할 수 있는 계통수를 재구성하기 위한 단계별 파이프라인을 제시합니다. 이는 계통발생 분석을 처음 접하는 연구자와 학생을 위해 설계되었습니다.
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.