2011년 11월 3일
I - TASSER 파이프라인을 사용하여 단백질의 구조와 기능 특성화 기반 컴퓨터에 대한 지침이 설명되어 있습니다. 쿼리 단백질 시퀀스에서 시작, 3D 모델은 여러 스레딩 정렬을 사용하여 생성 및 구조 조립 시뮬레이션을 반복하고 있습니다. 기능성 inferences는 이후 알려진 구조와 기능을 가진 단백질 일치를 기반으로 그려져있다.
이 절차의 목적은 아미노산 서열로부터 단백질 분자의 3차원 구조와 생물학적 기능을 계산적으로 예측하는 것입니다. 이는 먼저 머신러닝을 통해 단백질의 2차 구조를 예측함으로써 수행됩니다. 이후 서열과 예측된 2차 구조를 PDB 라이브러리의 기해결 구조들과 대조하여 최적의 구조 템플릿을 식별합니다.
이 절차를 스레딩(threading)이라고 합니다. 스레딩 절차 이후, IT AER 프로그램은 서열 템플릿 정렬을 기반으로 템플릿을 단편으로 분할하고, 세 번째 단계에서 이 단편들을 다시 조립하여 전체 길이의 모델로 만듭니다. 완전한 원자 모델은 수소 결합 네트워크를 최적화하고 입체적 겹침(steric overlaps)을 제거하기 위한 원자 수준의 정밀화를 통해 구축됩니다.
절차의 마지막 단계는 예측 구조를 기능 라이브러리에 있는 알려진 기능의 단백질과 매칭하여 단백질의 생물학적 기능을 확인하는 것입니다. 기존의 구조 모델링 방법과 비교하여 ITER의 주요 장점은 고유한 구조 조각 조립 방식을 통해 스레딩 정렬(threading alignment)을 천연 상태(native state)에 더 가깝게 지속적으로 유도할 수 있다는 점입니다. 이러한 고품질 구조 모델은 정확한 구조 기반 기능 주석의 기초가 되며, 과학계에서 ITER의 활용을 촉진합니다.
본 연구실은 단백질 서열을 iter에 제출할 수 있는 웹사이트를 제공하고 있습니다. 이 웹사이트는 전 세계 사용자가 ITER 시뮬레이션을 관리하고 실행하는 컴퓨터 클러스터 인터페이스에 등록할 수 있도록 하는 넥서스 역할을 합니다. 하나의 ITER 시뮬레이션 작업은 십여 개의 작은 하위 시뮬레이션으로 구성됩니다.
이러한 시뮬레이션을 단일 프로세서 코어가 장착된 단일 컴퓨터에서 실행할 경우 100시간 이상이 소요될 수 있습니다. Zang 연구실의 컴퓨터 클러스터는 이러한 하위 시뮬레이션들을 수백 대의 컴퓨터에 분산하여 처리하며, 2,000개 이상의 시뮬레이션을 실행할 수 있는 능력을 갖추고 있습니다. 당사의 컴퓨터 클러스터를 통해 매일 수백 건의 I taster 시뮬레이션을 완료할 수 있습니다.
이러한 용량에도 불구하고, 온라인 IT AER 사용자들의 대기 시간을 최소화하고 시스템을 최적화하기 위해 많은 작업이 이루어져야 합니다. 구조 및 기능 모델링 실험을 시작하려면 IT AER 웹페이지에 로그인하십시오. 여기에서 논의되는 모든 관련 웹페이지의 URL 주소는 서면 프로토콜에서 확인할 수 있습니다.
아미노산 서열을 제공된 양식에 복사하여 붙여넣거나, 찾아보기 버튼을 클릭하여 서열을 직접 업로드하십시오. 작업 이름과 이메일 주소를 입력하십시오. 사용자는 선택적으로 잔기 간 접촉 또는 거리 구속 조건을 지정할 수 있습니다.
구조 모델링 과정에서 템플릿을 추가하거나 일부 템플릿 단백질을 제외하십시오. 서열을 제출하려면 run it taser 버튼을 클릭하십시오. IT taser 큐 페이지를 방문하여 제출된 작업의 상태를 확인하십시오.
검색 탭을 클릭하고 작업 ID 번호 또는 쿼리 서열을 사용하여 제출된 작업을 검색하십시오. 구조 및 기능 모델링이 완료되면, 예측된 구조의 이미지와 웹 링크가 포함된 알림 이메일이 제공된 이메일 주소로 전송됩니다. 이 링크를 클릭하여 결과를 확인하고 다운로드하십시오.
알파 헬릭스는 H, 베타 스트랜드는 S, 코일은 C로 표시되는 2차 구조 예측 결과를 검토하여 구조 분석을 시작하십시오. 또한 각 잔기에 대한 예측 신뢰도 점수를 고려하십시오. 단백질의 코어 영역을 추정하기 위해 규칙적인 2차 구조 예측이 길게 나타나는 영역을 찾으십시오.
단백질의 구조적 분류는 이차 구조 요소의 분포를 기반으로 분석할 수도 있습니다. 매몰된 영역과 용매에 노출된 영역을 확인하려면 예측된 용매 접근성을 확인하십시오. 쿼리 값의 예측 용매 접근성은 매몰된 잔기의 경우 0점에서 노출된 잔기의 경우 9점까지의 범위로 나타납니다.
대부분 매몰된 잔기로 구성된 영역은 단백질의 코어 영역을 정의하는 데 사용할 수 있으며, 용매에 노출되고 친수성인 잔기가 있는 영역은 잠재적인 수화 또는 기능적 부위입니다. 쿼리 단백질의 예측된 3차 구조를 보려면 왼쪽에 표시된 대화형 JMO Applet으로 스크롤하십시오. 애플릿을 클릭하여 표시된 구조의 모양을 변경할 수 있습니다.
특정 영역을 확대하고, 예측 모델에서 특정 잔기 유형을 선택하거나 잔기 간 거리를 계산하십시오. 구조 모델링의 신뢰도 점수를 분석하여 예측된 구조의 품질을 추정하십시오. Csco 값은 일반적으로 -5에서 2 사이의 범위이며, 점수가 높을수록 모델의 품질이 더 좋음을 나타냅니다.
첫 번째 모델의 추정 TM score 및 RMSD는 모델 1의 추정 정확도로 표시됩니다. csco에 관한 자세한 내용 링크를 클릭하십시오. 모든 모델의 csco 클러스터 크기와 클러스터 밀도를 분석하려면, low mets 스레딩 프로그램으로 식별된 쿼리 단백질의 상위 10개 스레딩 템플릿을 분석하십시오.
결과 페이지를 아래로 스크롤하여 정규화된 Z-score를 확인하고 스레딩 정렬(threading alignment)의 품질을 분석합니다. 정규화된 csco 값이 1보다 크면 신뢰할 수 있는 정렬임을 나타내며, 쿼리 단백질과 동일한 폴드(fold)를 가졌을 가능성이 매우 높습니다. 스레딩 정렬 영역 및 전체 체인의 서열 동일성(sequence identity)을 검토하여 쿼리 단백질과 템플릿 단백질 사이의 상동성을 평가합니다.
높은 서열 동일성은 쿼리 단백질과 템플릿 단백질 간의 진화적 연관성을 나타내는 지표입니다. 색상으로 표시된 스레딩 정렬 잔기를 확인하여 쿼리와 템플릿 단백질에서 보존된 잔기 또는 모티프를 시각적으로 식별하십시오. 전체 체인 정렬과 비교하여 스레딩 정렬 영역에서 서열 동일성이 더 높다는 것은 쿼리에 보존된 구조적 모티프 또는 도메인이 존재함을 나타냅니다. 정렬 상태를 검토하여 스레딩 정렬의 커버리지를 평가하십시오.
최상위 정렬의 커버리지가 낮아 쿼리 단백질의 매우 작은 영역에만 국한되거나 쿼리 서열의 긴 세그먼트에서 누락된 경우, 이는 쿼리 단백질이 두 개 이상의 도메인을 포함하고 있음을 나타냅니다. 이 경우, 서열을 분할하여 각 도메인을 개별적으로 모델링하는 것이 권장됩니다. 결과 페이지의 다음 표를 통해 구조 정렬 프로그램인 TM align으로 식별된 첫 번째 예측 모델의 상위 10가지 구조 유사체를 확인하십시오.
TM score가 0.5보다 크면 검출된 유사체와 모델의 토폴로지가 유사함을 나타내며, 이를 통해 쿼리 단백질의 구조적 클래스 또는 단백질 가족을 결정할 수 있습니다. TM score가 0.3 미만인 경우는 무작위적인 구조 유사성을 의미합니다. 모델과 구조적 유사체에서 공간적 모티프의 보존성을 평가하기 위해 구조적으로 정렬된 영역의 서열 동일성과 RMSD를 분석하십시오.
정렬에서 색상이 표시되고 정렬된 잔기 쌍을 시각적으로 검사하여 구조적으로 보존된 잔기와 모티프를 식별하십시오. 예측된 EC 번호 표를 통해 쿼리 단백질의 상위 5개 잠재적 효소 OG를 확인하십시오. 이러한 템플릿을 사용한 EC 번호 예측의 신뢰 수준은 벤치마킹 분석에 기반한 EC 점수로 표시됩니다.
쿼리 단백질과 템플릿 단백질 사이의 기능적 유사성은 1.1보다 큰 EC 점수를 통해 신뢰성 있게 해석할 수 있습니다. 다음으로, 쿼리 단백질과 유사한 폴드를 가진 템플릿들 사이의 기능적 합의 여부를 확인하십시오. 여러 템플릿이 동일한 EC 번호를 가지고 있고 EC 점수가 1.1보다 크다면, 예측의 신뢰 수준은 매우 높습니다.
하지만 EC 점수가 높더라도 확인된 히트들 간의 합의가 부족한 경우 예측의 신뢰도가 떨어지며, 사용자는 유전자 온톨로지(gene ontology)를 참고하는 것이 권장됩니다. 용어 예측(Term predictions) 뷰에서는 유전자 온톨로지 용어가 주석으로 달린 PDB 라이브러리 내 쿼리 단백질의 상위 10개 상동물을 확인하기 위해 예측된 유전자 온톨로지 용어 표를 살펴봅니다. 각 단백질은 일반적으로 분자 기능, 생물학적 과정 및 세포 내 위치를 설명하는 여러 유전자 온톨로지 용어와 연관되어 있습니다. 각 용어를 클릭하면 amigo 웹사이트로 이동하여 정의와 계통을 분석할 수 있습니다.
쿼리 단백질과 템플릿 단백질 간의 기능적 유사성을 확인하려면 기능적 상동성 점수(functional homology score) 열을 분석하십시오. 이를 통해 해당 단백질들로부터 기능적 주석을 전이할 때의 신뢰 수준 또한 추정할 수 있습니다. 템플릿 간의 기능적 일치 여부를 분석하려면 유전자 온톨로지(gene ontology) 용어의 합의 예측(consensus prediction) 표를 확인하십시오.
이 일반 함수들은 쿼리 단백질의 유전자 온톨로지(gene ontology) 용어를 예측하고, geo 용어 예측의 신뢰 수준을 평가하는 데 사용됩니다. 마지막으로, 페이지 하단으로 스크롤하여 쿼리 단백질에 대해 예측된 상위 10개의 리간드 결합 부위 예측 결과를 확인하십시오. 예측된 결합 부위는 공통 결합 포켓을 공유하는 예측 리간드 컨포메이션의 수를 기준으로 순위가 매겨집니다. 가장 적합하게 식별된 결합 부위는 이미 JM OL 앱에 표시되어 있습니다.
라디오 버튼을 클릭하여 다른 예측 결과를 분석하고 리간드 상호작용 잔기를 시각화하십시오. BS 점수는 모델과 템플릿 결합 부위 간의 국소적 유사성을 나타냅니다. BS 점수가 1.1보다 크면 예측된 결합 부위 근처의 서열 및 구조적 유사성이 높음을 의미합니다.
템플릿의 알려진 결합 부위와 비교한 모델에서, IT는 다른 유용한 기능으로 연결되는 링크를 포함하는 메인 웹페이지입니다. 포럼 기능은 사용자가 온라인 계정을 생성하여 구조 모델링에 관한 도움을 받거나 결과 해석에 대해 다른 ITER 사용자들에게 도움을 요청할 수 있게 합니다. 다운로드 기능은 사용자가 iter 및 관련 패키지를 다운로드하여 컴퓨터에 설치할 수 있도록 합니다.
이는 모델링 실험 수행에 필요한 시간을 단축하는 데 도움이 됩니다. 큐 기능을 통해 IT a Q 페이지에서 제출된 모든 작업의 상태를 확인할 수 있습니다. 또한 사용자는 완료된 작업에 대해 모델링된 구조의 이미지를 시각적으로 검토할 수 있습니다.
이 페이지에는 CSCO 예상 TM 점수와 첫 번째 모델의 예상 RMSD, 제출 날짜가 표시되어 있으며, 여기에는 fastest 서식 쿼리 서열, 예측된 2차 구조, 관련 신뢰도 점수 및 잔기의 예측 용매 접근성이 표시된 IT AER 결과 페이지의 발췌본이 나타나 있습니다. 분석된 핵심 영역과 쿼리의 잠재적 수화 부위는 각각 청록색과 빨간색 직사각형으로 강조 표시되어 있습니다. 여기에는 쿼리 단백질에 대한 3차 구조 예측 결과가 표시되어 있습니다.
예측 모델은 대화형 JML 앱 아울렛에 표시되어 사용자가 분자의 표시 방식을 변경할 수 있습니다. 모델은 다운로드 링크를 클릭하여 다운로드할 수 있으며, 모델의 품질을 추정하기 위한 신뢰도 점수는 csco로 보고됩니다. Loomis threading 프로그램에 의해 식별된 상위 10개 스레딩 템플릿과 정렬을 보여주는 itta A 결과 페이지의 예시가 제시되어 있습니다.
스레딩 정렬의 품질은 정규화된 Z-score를 기반으로 평가하며, 1보다 큰 값은 신뢰할 수 있는 정렬임을 나타냅니다. 템플릿의 정렬된 잔기 중 쿼리 잔기와 동일한 잔기는 색상으로 강조 표시되어 보존된 잔기 또는 모티프의 존재를 나타냅니다. 반대로, 대부분의 상위 템플릿에서 정렬이 이루어지지 않은 것은 쿼리 단백질에 다중 도메인이 존재함을 나타내며, 정렬되지 않은 잔기는 도메인 링커 영역에 해당합니다.
이 표는 TM aligned Structural alignment 프로그램을 통해 확인된 상위 10개의 구조적 유사체와 구조 정렬 결과를 보여줍니다. 유사체의 순위는 구조 정렬의 TM score를 기준으로 결정되었습니다. TM score가 0.5보다 크면 비교된 두 구조가 유사한 토폴로지를 가지고 있음을 나타냅니다.
TM 점수가 0.3 미만인 경우는 두 무작위 구조 간의 유사성을 의미합니다. 구조적으로 정렬된 잔기 쌍은 아미노산 특성에 따라 색상으로 표시되며, 정렬되지 않은 영역은 대시(-)로 표시됩니다. 다음은 PDB 라이브러리에서 쿼리 단백질의 동일 효소 호몰로그가 식별된 ITR 결과 페이지의 예시입니다.
EC 번호 예측의 신뢰 수준은 EC 점수를 기반으로 분석하며, EC 점수가 1.1보다 크면 쿼리 단백질과 템플릿 단백질 간의 기능적 유사성을 나타냅니다. 쿼리 단백질의 유전자 온톨로지 용어 예측 표에는 유전자 온톨로지 템플릿 라이브러리 내에서 기능적 상동성 점수를 기준으로 순위가 매겨진 쿼리 단백질의 기능적 상동체가 포함됩니다. 이러한 상위 점수 히트들로부터 공통적인 기능적 특징을 도출하여 쿼리 단백질에 대한 최종 유전자 온톨로지 용어 예측을 생성합니다.
예측된 유전자 온톨로지(gene ontology) 용어의 품질은 geo score를 기반으로 추정하며, 0.5보다 큰 geo score는 신뢰할 수 있는 예측임을 나타냅니다. 여기 예시로 cofactor 알고리즘을 사용하여 상위 10개의 단백질 리간드 결합 부위 예측을 보여주는 IT AZA 결과 페이지가 제시되어 있습니다. 예측된 결합 부위의 순위는 공통 결합 포켓을 공유하는 예측 리간드 컨포메이션(confirmation)의 수를 기준으로 합니다. 쿼리에서 BS score는 예측된 결합 부위와 템플릿 결합 부위 사이의 국소 서열 및 구조 유사성을 측정하는 지표이며, 결합 부위 포켓의 보존성을 분석하는 데 유용합니다.
ISER는 단백질 구조 및 기능 예측을 위한 가장 효율적인 알고리즘 중 하나이지만, 이것이 컴퓨터 알고리즘에 의한 예측일 뿐이라는 점을 기억하는 것이 중요합니다. 예를 들어, 잔기 접촉 결합 정보와 같은 실험 데이터나 기능적 통찰력은 예측 정확도를 높이는 데 매우 유용할 것입니다. IT AER 서버는 이에 대한 증가하는 관심을 반영하여, 모델링 과정 중에 이러한 정보를 포함할 수 있는 포털을 제공합니다.
Zang 연구실에서는 비상업적 연구를 위해 IT AER 소프트웨어를 무료로 공개하였습니다. 저희는 IT AER과 eye taster를 지속적으로 개선하고 개발하고 있으며, 이러한 공개를 통해 Zang 연구실 외부에서도 대규모로 응용되어 과학계의 추가적인 연구에 기여하고 이를 촉진할 수 있기를 기대합니다.
본 논문은 아미노산 서열로부터 단백질의 3D 구조와 기능을 예측하는 I-TASSER 파이프라인에 대해 설명합니다. 이 과정은 알려진 단백질 구조를 기반으로 하는 스레딩, 조각 조립 및 기능 추론 단계를 포함합니다.
계산적 단백질 구조 및 기능 예측은 실험적으로 특성이 규명되지 않은 단백질에 대한 기전적 통찰을 제공함으로써 초기 신약 개발 단계에서 타겟의 리스크를 완화할 수 있게 합니다. I-TASSER 파이프라인은 가설 검증과 기능적 주석 달기를 지원하여, 타겟 선정 및 리드 화합물 발굴 워크플로의 예측 신뢰도를 높여줍니다. 이러한 접근 방식은 처리량이 낮은 실험 방법으로의 의존도를 낮추고 바이오 제약 R&D의 타겟 검증 속도를 가속화합니다.
I-TASSER 방법은 각 단계의 의사결정에 필요한 구조적 및 기능적 통찰력을 제공함으로써 타겟 식별부터 리드 최적화에 이르는 신약 발견 연속 과정에 통합됩니다.