2011년 5월 9일
우리는 게놈 시퀀스의 분석을 위해 공용 전산 웹 사이트를 제시한다. 그것은 여러 가지가 아닌 임의의 염기 조성과 함께 DNA 시퀀스 패턴을 감지합니다. 이 리소스는 복잡 다양한 수준 무작위 시퀀스를 생성합니다.
본 절차의 전반적인 목표는 사용자가 지정한 게놈 서열의 비무작위성, 즉 불균질성(in homogeneity)이라 불리는 중간 범위의 특성을 탐색하는 것입니다. 이는 먼저 입력 서열의 올리고뉴클레오타이드 조성을 분석하고, 해당 서열을 구성하는 올리고뉴클레오타이드의 빈도표를 생성함으로써 수행됩니다. 이러한 목표는 SRI Analyzer 프로그램을 호출하여 달성할 수 있습니다.
두 번째 단계는 입력 서열과 완전히 동일한 올리고뉴클레오타이드 조성을 가진 무작위 서열을 생성하는 것입니다. 이는 SRI 생성 프로그램(SRI generator program)을 호출하여 수행합니다. 절차의 세 번째 단계는 입력 서열 및 무작위 서열 내에서 특정 뉴클레오타이드 또는 뉴클레오타이드 조합(예: GC 또는 ag)이 유의하게 농축된 세그먼트를 찾는 것입니다.
이 목표는 MRI Analyzer 프로그램을 통해 달성됩니다. 절차의 마지막 단계는 프로그램에 의해 검출된 모든 MRI 영역의 서열이 포함된 파일들을 다운로드하는 것입니다. 결과적으로, 다세포 영역의 대다수 게놈 영역이 네 가지 뉴클레오타이드 각각 또는 그 조합에 대해 검출된 염기 조성 극값을 포함하는 세그먼트들에 의해 유의미하게 농축되어 있음을 보여주는 결과를 얻을 수 있습니다.
이러한 균질한 영역들은 특이한 DNA 구조 및 또는 특정한 DNA 특성과 관련이 있습니다. 이 방법은 유전자 간 영역이나 인트론을 포함한 방대한 비부호화 서열 영역 내에서 잠재적으로 기능적인 DNA 요소를 찾는 것과 같이, 게놈학 분야의 핵심적인 질문들에 답하는 데 도움이 될 수 있습니다. 이 방법은 포유류 게놈에 대한 통찰을 제공할 뿐만 아니라 무척추동물, 식물, 균류 및 박테리아와 같은 다른 생물체에도 적용될 수 있습니다.
www.bioinfo.utoledo.edu/gri/ 웹 리소스에서 온라인 genomic mid-range in homogeneity 또는 G GM I 패키지의 홈페이지를 엽니다. 또한 help 및 Readme 링크에서 프로그램에 대한 상세 정보를 제공합니다.
유전체 MRI 및 유사 알고리즘에 관한 모든 출판 자료는 관련 리소스 링크에 나열되어 있으므로, A-G-M-R-I 분석 세션을 시작하기 위해 빠르게 포맷팅된 시퀀스 파일을 생성하십시오. 빠르게 포맷팅된 시퀀스는 캐럿 또는 꺽쇠괄호(>) 기호로 시작하며, 그 뒤에 고유 식별자 또는 이름이 오고 다음 줄에 시퀀스가 이어집니다. 다른 문자 입력은 허용되지만, 유전체 MRI에서는 T, G, C 뉴클레오타이드만 처리됩니다.
PKD1 유전자의 서열 파일이 사용됩니다. 세션을 시작하려면 시작 버튼을 누르십시오. 그러면 새 웹페이지가 열리며, 제공된 창에 입력 서열을 복사하여 붙여넣거나 파일의 크기가 큰 경우 파일을 업로드할 수 있는 옵션이 제공됩니다.
업로드하려면 파일 선택 버튼을 클릭하여 파일을 업로드하십시오. 원하는 파일을 찾아 선택합니다. 그런 다음 이 파일로 세션 시작 버튼을 클릭하십시오. 파일이 성공적으로 업로드되었다는 확인 메시지가 페이지 상단에 표시됩니다. 아래를 참조하십시오.
이 메시지는 현재 세션의 식별자로, 이 경우에는 C eight EP oh six입니다. 입력 서열의 단거리 불균질성(short range inhomogeneity)을 분석하려면 analyze short range in homogeneity 버튼을 클릭하십시오. 그러면 SRI Analyzer 프로그램 실행을 위해 특별히 설계된 새 페이지가 열립니다.
여기서 분석할 올리고뉴클레오타이드의 최대 길이를 선택해야 합니다. 입력 서열의 크기가 약 50,000 nucleotides로 중간 규모이므로, 빈도를 계산할 올리고뉴클레오타이드의 최대 길이로 k-mer를 선택합니다. 마지막으로, 즉시 analyze file 버튼을 눌러야 합니다.
본 프로그램은 입력 서열 내에서 선택한 길이 및 그보다 짧은 모든 올리고뉴클레오타이드의 빈도를 계산합니다. 모든 올리고뉴클레오타이드의 빈도를 확인하시려면 composition file 다운로드 링크를 클릭하십시오. 이 파일의 이름은 user file입니다.
com은 세 개의 열로 구성된 표를 나타냅니다. 첫 번째 열은 올리고뉴클레오타이드를 지정하고, 두 번째 열은 상대적 빈도를 나타내며, 세 번째 열은 입력 서열 내의 올리고뉴클레오타이드 발생 횟수를 나타냅니다.
입력 파일과 동일한 올리고뉴클레오타이드 조성을 가진 무작위 서열을 생성하려면 SRI generator 탭을 클릭하십시오. 새 페이지에서 생성할 무작위 서열 샘플의 수를 선택하십시오. 각 샘플에는 사용자 파일에 입력된 서열과 동일한 개수 및 길이의 무작위 서열이 포함됩니다.
이 예시에서 사용자 파일은 PKD1 유전자의 서열입니다. 다음으로, 4개 염기 올리고뉴클레오타이드를 의미하는 formers 라디오 버튼을 선택하여, 무작위 서열에서 빈도가 근사치로 계산될 올리고뉴클레오타이드의 최대 길이를 선택하십시오. 그다음, 생성할 무작위 서열 샘플 수로 2를 선택하십시오.
마지막으로, 수십만 개의 뉴클레오타이드 입력 서열에 대해 파일 생성 버튼을 클릭하여 프로그램을 시작하십시오. 무작위 서열을 생성하는 데 몇 분 정도 걸릴 수 있습니다. 따라서 이 페이지 하단에 파란색 다운로드 링크가 나타날 때까지 기다리십시오.
입력 시퀀스 및 무작위 시퀀스의 중간 범위 균질성(mid-range homogeneity)을 분석하려면 MRI analyzer 탭을 클릭하십시오. 새 페이지의 분석 대상 파일(file to analyze) 목록 상자에서 분석할 시퀀스를 선택하십시오. 그런 다음 7가지 콘텐츠 유형 목록에서 GC content를 선택하십시오.
GC 함량은 G와 C의 조성 비율을 의미합니다. 윈도우 크기(window size) 필드에서는 함량이 높은 서열과 낮은 서열을 분석할 윈도우의 길이를 선택할 수 있습니다. 기본 윈도우 크기인 50 nucleotides를 유지하십시오.
마지막으로, 함량이 풍부한 영역과 함량이 부족한 영역에 대한 상한 및 하한 임계값을 각각 선택합니다. 이러한 임계값은 현재 윈도우 내 특정 뉴클레오타이드의 수 또는 윈도우 내 해당 뉴클레오타이드의 백분율로 정의할 수 있습니다. 여기서는 우선 상한 임계값은 60%, 하한 임계값은 30%의 임의 값을 선택해 보겠습니다.
다음으로 파일 분석(analyze file) 버튼을 누릅니다. 그러면 출력 파일로 연결되는 링크가 나타나고 결과의 그래픽 표현이 표시됩니다. 입력 서열을 따라 모든 함량이 높은 영역은 파란색 상향 스파이크로, 함량이 낮은 영역은 빨간색 하향 스파이크로 표시됩니다. 그래프를 통해 GC 함량이 높은 영역을 나타내는 파란색 스파이크가 너무 많고, GC 함량이 낮은 영역을 나타내는 빨간색 스파이크는 훨씬 적음을 알 수 있습니다.
이는 선택한 매개변수가 최적이 아님을 의미합니다. 다음 반복 단계에서는 상한 임계값 75%와 하한 임계값 32%를 사용하십시오. 다시 파일 분석(analyze file) 버튼을 클릭하여 MRI 분석기를 시작하십시오.
새로운 그래프를 통해 훨씬 더 엄격해진 새로운 매개변수에서도 수백 개의 파란색 스파이크가 나타남을 알 수 있습니다. 따라서 상한 임계값을 80%로 높이고 계산을 반복하십시오. 새로운 그래프에서는 GC 함량이 80% 이상인 GC 풍부 지역이 62개, GC 함량이 32% 미만인 GC 빈약 지역이 28개로 나타납니다. 다음으로, 입력 파일의 결과를 PKD1 유전자와 동일한 올리고뉴클레오티드 조성을 가진 두 개의 무작위 서열 결과와 비교하십시오.
이를 위해, GC rich 및 GC poor 영역에 대한 동일한 매개변수를 유지한 채, 'file to analyze' 목록 상자를 사용하여 서열을 PKD 1 유전자에서 무작위 서열로 변경하십시오. 무작위 서열 1번에 대해 새롭게 생성된 그래픽 디스플레이를 보면, 이 무작위 서열은 단 하나의 GC poor 영역과 31개의 GC rich 영역만을 가지고 있음을 알 수 있습니다. 다른 무작위 서열의 경우 함량이 높은 영역과 낮은 영역의 수에 어느 정도 변동이 있을 수 있으나, 전반적인 경향은 동일하게 나타나야 합니다.
PKD 1 유전자의 무작위 서열은 수 배 더 적습니다. GC 풍부 지역은 GC 빈약 지역보다 10배 이상 더 적습니다. 다음 시연에서는 다른 유형의 MRI 콘텐츠를 사용합니다.
동일한 pkg 내의 특정 인간 유전자 인트론에는 DNA ex 구조와 관련된 여러 퓨린 풍부 영역이 포함되어 있습니다. MRI 분석기 웹페이지에서 DNA 콘텐츠를 퓨린을 나타내는 ag 뉴클레오타이드로 전환하십시오. 윈도우 크기는 50 bases로 유지하고, 상한 임계값은 80%, 하한 임계값은 10%로 변경하십시오. 그런 다음 analyze file 버튼을 눌러 프로그램을 실행하십시오.
표시된 그래프는 이 유전자에 파란색 수직 스파이크로 표시된 6개의 AG 풍부 영역과 빨간색 스파이크로 표시된 14개의 AG 빈약 영역이 있음을 보여줍니다. 그다음, PKD1 유전자에 대해 얻은 이 결과들을 연구 대상 유전자와 동일한 올리고뉴클레오타이드 조성을 가진 무작위 서열의 데이터와 비교하십시오. 먼저 예를 들어 2번과 같은 무작위 서열로 전환하고, 이전 테스트와 동일한 파라미터를 유지하십시오. 이 무작위 서열의 그래프를 보면 단 하나의 AG 풍부 영역만 포함하고 있으며, AG 빈약 영역은 없음을 알 수 있습니다.
세션 동안 생성된 모든 데이터는 각 웹페이지의 우측 상단에 있는 파일 다운로드 탭을 통해 액세스할 수 있는 특수 파일에 저장됩니다. 이 링크를 연 후, 입력 서열과 생성된 모든 무작위 서열을 다운로드하십시오. 이 파일 목록 아래에는 SRI 분석 프로그램에 의해 생성된 올리고뉴클레오타이드 빈도 표로 연결되는 링크가 있습니다.
그 다음으로 세션 동안 MRI 분석 프로그램에 의해 생성된 모든 결과로 연결되는 링크가 있습니다. 예를 들어, 무작위 서열에 대해 얻은 결과를 나타내는 파일 RAND one four AGCO 50 32 14를 클릭하십시오. 이 파일은 AG 함량 50%, 뉴클레오타이드 윈도우 길이 32개, 하한 임계값 14 뉴클레오타이드라는 파라미터를 가진 1번 결과입니다.
이 파일에서는 콘텐츠 풍부 또는 빈약 기준과 일치하는 모든 뉴클레오타이드 서열 세그먼트와 그 좌표가 입력 서열을 따른 연속적인 위치에 따라 목록으로 제공됩니다. 이 영상을 시청하고 나면 계산 리소스인 genomic MRI를 탐색하는 방법을 충분히 이해하게 될 것입니다.
본 논문은 비무작위 뉴클레오타이드 조성을 검출하는 데 중점을 둔 게놈 서열 분석용 계산 웹 리소스를 소개합니다. 이 도구는 유사한 올리고뉴클레오타이드 조성을 가진 무작위 서열을 생성하여 게놈의 불균질성을 탐색하는 것을 용이하게 합니다.
Genomic MRI는 비코딩 DNA 내의 비임의적 뉴클레오타이드 패턴을 검출하는 계산적 접근 방식을 제공하며, 잠재적인 기능적 중요성을 가진 조절 요소를 식별함으로써 타겟 검증을 지원합니다. 이를 통해 서열의 불균질성을 유전자 발현 및 재조합과 같은 생물학적 프로세스와 연결함으로써 초기 발굴 단계에서의 메커니즘적 리스크 감소(de-risking)가 가능해집니다. 본 리소스는 염기 조성이 극단적인 게놈 영역에 우선순위를 두어 후속 분석법 개발을 진행함으로써 선도 물질 식별의 예측 신뢰도를 높여줍니다.
본 방법은 서열 농축에 대한 정량적 결과물을 제공하여 생물학적 리스크 감소 결정을 돕으로써, 타겟 검증부터 리드 화합물 발굴 및 전임상 단계에 이르는 신약 개발 연속 과정에 통합됩니다.