May 9th, 2011
우리는 게놈 시퀀스의 분석을 위해 공용 전산 웹 사이트를 제시한다. 그것은 여러 가지가 아닌 임의의 염기 조성과 함께 DNA 시퀀스 패턴을 감지합니다. 이 리소스는 복잡 다양한 수준 무작위 시퀀스를 생성합니다.
이 절차의 전반적인 목표는 사용자가 지정한 게놈 염기서열의 동질성이라고도 하는 중간 범위의 비무작위성을 탐색하는 것입니다. 이는 먼저 입력 서열의 올리고뉴클레오티드 조성을 검사하고 서열을 포함하는 올리고뉴클레오티드의 빈도표를 생성함으로써 달성됩니다. 이 목표는 SRI 분석기 프로그램을 호출하여 달성할 수 있습니다.
두 번째 단계는 입력 염기서열과 정확히 동일한 올리고뉴클레오티드 조성을 갖는 무작위 염기서열을 생성하는 것입니다. 이는 SRI 생성기 프로그램을 호출하여 수행됩니다. 절차의 세 번째 단계는 입력 및 무작위 서열 내에서 특정 뉴클레오티드 또는 뉴클레오티드 조합(예: GC 또는 ag)에 의해 크게 농축된 세그먼트를 찾는 것입니다.
이 목표는 MRI 분석기 프로그램을 통해 달성됩니다. 절차의 마지막 단계는 프로그램에서 감지한 모든 MRI 영역의 시퀀스가 포함된 파일을 다운로드하는 것입니다. 궁극적으로, 다세포 arias의 게놈 영역 대다수가 4개의 뉴클레오티드 또는 그 조합 중 하나에서 검출된 염기 조성 극단을 포함하는 세그먼트에 의해 상당히 풍부하다는 것을 보여주는 결과를 얻을 수 있습니다.
동질적인 영역에서의 이러한 특성은 특이한 DNA 확인 및/또는 특정 DNA 특성과 관련이 있습니다. 이 방법은 유전자 간 영역 또는 입구를 포함하여 비코딩 염기서열의 광대한 영역에서 잠재적으로 기능할 수 있는 DNA 요소를 찾는 것과 같은 유전체학 분야의 주요 질문에 답하는 데 도움이 될 수 있습니다. 이 방법은 포유류 게놈에 대한 통찰력을 제공할 수 있지만 무척추 동물, 식물, 곰팡이 및 박테리아와 같은 다른 유기체에도 적용할 수 있습니다.
www.bioinfo.utoledo에서 온라인 게놈 미드레인지 또는 G GM I 패키지의 홈페이지를 엽니다. edu/gri/웹 리소스. 또한 Readme 도움말 링크에서 프로그램에 대한 자세한 정보를 제공합니다.
게놈 MRI 및 유사한 알고리즘에 대해 발표된 모든 자료는 관련 리소스 링크에 나열되어 있지만, 더 빠른 형식의 염기서열로 파일을 생성하여 A-G-M-R-I 분석 세션을 시작할 수 있습니다. 더 빠른 형식의 시퀀스는 당근 또는 보다 큼 기호로 시작하고 그 뒤에 고유 식별자 또는 이름과 시퀀스가 다음 줄에 옵니다. TG 및 C 뉴클레오티드만 게놈 MRI에 의해 처리되지만 다른 문자 입력은 허용됩니다.
PKD one 유전자에 대한 염기서열 파일이 사용됩니다. 세션을 시연하려면 시작 버튼을 누르십시오. 그러면 제공된 창에서 입력 시퀀스를 복사하여 붙여넣을 수 있는 옵션을 제공하는 새 웹 페이지가 열리거나 파일이 큰 경우 사용할 수 있습니다.
업로드하려면 파일 선택 버튼을 클릭하여 파일을 업로드합니다. 원하는 파일을 찾습니다. 그런 다음 start this session with this file 버튼을 클릭하면 파일이 성공적으로 업로드되었다는 확인 메시지가 페이지 맨 위에 표시됩니다. 아래.
이 메시지는 현재 세션의 식별자이며, 이 경우 C eight EP oh six입니다. 입력 시퀀스의 단거리 동질성을 분석하려면 analyze short range in homogeneity 버튼을 클릭합니다. 이 프로그램은 SRI 분석기 프로그램의 실행을 위해 특별히 설계된 새 페이지를 엽니다.
여기서 검사할 올리고 뉴클레오티드의 최대 길이를 선택해야 합니다. 중간 크기의 우리의 입력 순서가 대략 50, 000의 뉴클레오티드이기 때문에, 우리는 빈도가 계산될 oligonucleotides의 가장 긴 길이로 formers를 선정한다. 마지막으로 파일 분석 버튼을 즉시 눌러야 합니다.
프로그램은 입력 시퀀스 내에서 선택한 길이와 더 작은 길이의 모든 올리고뉴클레오티드의 주파수를 계산합니다. 모든 올리고뉴클레오티드의 빈도를 보려면 구성 파일 다운로드 링크를 클릭하십시오. 이 파일의 이름은 사용자 파일입니다.
COM은 세 개의 열이 있는 테이블을 나타냅니다. 첫 번째 열은 올리고뉴클레오티드를 지정합니다. 두 번째는 상대 빈도를 나타내고, 세 번째는 입력 서열 내에서 올리고뉴클레오티드 발생 횟수를 나타냅니다.
입력 파일과 동일한 올리고뉴클레오티드 조성을 가진 무작위 염기서열을 생성하려면 SRI 생성기 탭을 클릭합니다. 새 페이지에서 생성할 무작위 시퀀스의 샘플 수를 선택합니다. 이러한 각 샘플에는 사용자 파일의 입력 시퀀스와 동일한 수와 길이의 임의 시퀀스가 포함됩니다.
이 예에서 사용자 파일은 PKD one 유전자의 서열입니다. 다음으로, 4개의 염기 올리고뉴클레오티드를 나타내는 전자에 대한 라디오 버튼을 선택하여 무작위 시퀀스에서 빈도가 근사화될 올리고뉴클레오티드의 가장 긴 길이를 선택합니다. 다음으로, 생성할 무작위 염기서열의 표본 수에 대해 2를 선택합니다.
마지막으로, 수십만 개의 뉴클레오티드의 입력 염기서열에 대한 파일 생성 버튼을 클릭하여 프로그램을 시작합니다. 무작위 시퀀스를 생성하는 데 몇 분 정도 걸릴 수 있습니다. 따라서 이 페이지 하단에 파란색 다운로드 링크가 나타날 때까지 기다리십시오.
입력 및 무작위 염기서열의 동질성에서 중간 범위를 분석하려면 MRI 분석기 탭을 클릭하십시오. 새 페이지의 분석할 파일 목록 상자에서 분석할 시퀀스를 선택합니다. 그런 다음 7가지 콘텐츠 형식 목록에서 GC 콘텐츠를 선택합니다.
GC 함량은 G 플러스 C 조성을 나타냅니다. 창 크기 필드를 사용하면 콘텐츠가 풍부한 시퀀스와 부족한 시퀀스를 검사할 창의 길이를 선택할 수 있습니다. 기본 윈도우 크기인 50 nucleotides를 유지합니다.
마지막으로, Content Rich 및 Content Poor Region(콘텐츠 부족 지역)에 대한 상한 및 하한 임계값을 각각 선택합니다. 이러한 임계값은 현재 창에 있는 특정 뉴클레오티드의 수 또는 창에 있는 이러한 뉴클레오티드의 백분율에 의해 정의될 수 있습니다. 이 경우 처음에 상한 임계값으로 60%, 하위 임계값으로 30%의 임의의 값을 선택하겠습니다.
그런 다음 파일 분석 버튼을 누릅니다.그런 다음 출력 파일에 대한 링크가 나타나고 결과의 그래픽 표현이 표시됩니다. 입력 시퀀스를 따라 모든 콘텐츠가 풍부한 영역은 파란색 상향 스파이크로 표시되고 콘텐츠 부족 영역은 빨간색 하향 스파이크로 표시됩니다. 그래프는 GC가 풍부한 영역을 표시하는 파란색 스파이크가 너무 많고 GC가 부족한 영역을 표시하는 빨간색 스파이크가 훨씬 적다는 것을 보여줍니다.
이는 선택한 매개변수가 최적이 아님을 의미합니다. 다음 반복의 경우 75% 상한 임계값과 32% 하한 임계값을 사용합니다. 다시 파일 분석 버튼을 클릭하여 MRI 분석기를 시작합니다.
새로운 그래프는 훨씬 더 엄격한 새로운 매개변수에 대해서도 수백 개의 파란색 스파이크가 있음을 보여줍니다. 따라서 상한 임계값을 80%로 늘리고 계산을 반복합니다. 새로운 그래프는 62개의 GC 풍부 영역이 80% 이상의 GC 함량을 가지고 있고 28개의 GC 부족 영역이 GC 함량이 32% 미만임을 보여줍니다.다음으로, 입력 파일에 대한 결과를 PKD one 유전자와 동일한 올리고뉴클레오티드 조성을 가진 두 개의 무작위 서열과 비교합니다.
이렇게 하려면 GC rich 및 GC poor region에 대해 동일한 매개변수를 유지하면서 파일을 사용하여 목록 상자를 분석하는 파일을 사용하여 PKD one 유전자에서 임의의 유전자로 염기서열을 변경합니다. 무작위 염기서열 번호 1에 대해 새로 생성된 그래픽 디스플레이는 이 무작위 염기서열에 단 하나의 GC 불량 영역과 31개의 GC 풍부 영역만 있음을 보여줍니다. 또 다른 무작위 시퀀스는 콘텐츠 풍부 및 콘텐츠 부족 영역의 수에 약간의 변동을 나타낼 수 있지만 추세는 동일해야 합니다.
PKD 한 유전자에 대한 무작위 서열은 몇 배 더 적습니다. GC가 풍부한 지역은 GC가 부족한 지역보다 10배 이상 적습니다. 다음 데모에서는 다른 유형의 MRI 콘텐츠를 사용합니다.
동일한 pkg에서 이 유전자의 한 인간 유전자 인트론은 DN aex 구조와 관련된 여러 퓨린이 풍부한 영역을 포함합니다. MRI 분석기 웹 페이지에서 DNA 함량을 퓨린을 나타내는 ag 뉴클레오티드로 전환합니다. 창 크기를 50 base와 동일하게 유지하고 상한 임계 값을 80 %로, 하한 임계 값을 10 %로 변경 한 다음 파일 분석 버튼을 눌러 프로그램을 호출하십시오.
표시된 그래프는 이 유전자가 파란색 수직 스파이크로 표시된 6개의 ag rich 영역과 빨간색 스파이크로 표시된 14개의 ag poor 영역을 가지고 있음을 보여줍니다. 그런 다음 PKD one 유전자에 대해 얻은 이러한 결과를 언더스터디 유전자와 동일한 올리고뉴클레오티드 조성을 가진 무작위 서열의 데이터와 비교하고, 먼저 무작위 서열(예: 2번)로 전환하고, 이전 테스트에서와 동일한 매개변수를 유지합니다. 이 무작위 시퀀스에 대한 그래프는 하나의 농업 풍부 영역만 포함하고 AG 부족 영역은 없음을 보여줍니다.
세션 중에 생성된 모든 데이터는 각 웹 페이지의 오른쪽 상단 모서리에 있는 파일 다운로드 탭을 통해 액세스할 수 있는 특수 파일에 저장됩니다. 이 링크를 연 후 입력 시퀀스와 생성된 모든 무작위 시퀀스를 다운로드합니다. 이 파일 목록 아래에는 SRI 분석기 프로그램에서 생성된 올리고뉴클레오티드 빈도표에 대한 링크가 있습니다.
그런 다음 세션 중에 MRI 분석기 프로그램에서 생성된 모든 결과에 대한 링크가 있습니다. 예를 들어, 파일 사용자 파일 RAND one four AGCO 50 32 14를 클릭하면 무작위 시퀀스에 대해 얻은 결과를 나타낼 수 있습니다. 다음 매개변수에서 1번, ag 함량 50 뉴클레오티드 긴 창, 상한 임계값, 32 뉴클레오티드 및 하한 임계값 14 뉴클레오티드.
이 파일에서 콘텐츠가 풍부하거나 부족한 기준과 일치하는 모든 뉴클레오티드 서열 세그먼트 및 해당 좌표는 입력 서열을 따라 연속된 위치에 따라 목록으로 사용할 수 있습니다. 이 비디오를 시청한 후에는 계산 리소스인 게놈 MRI를 탐색하는 방법을 잘 이해하게 될 것입니다.
이 기사는 게놈 서열 분석을 위해 설계된 컴퓨테이셔널 웹 리소스를 제시하며, 비임의적 뉴클레오티드 조성을 탐지하는 데 중점을 둡니다. 이 도구는 유사한 올리고뉴클레오티드 조성을 가진 임의 서열을 생성하여 게놈 비균질성의 탐색을 용이하게 합니다.
Genomic MRI provides a computational approach to detect non-random nucleotide patterns in non-coding DNA, supporting target validation by identifying regulatory elements with potential functional significance. This enables mechanistic de-risking in early discovery by linking sequence inhomogeneity to biological processes such as gene expression and recombination. The resource enhances predictive confidence in lead identification by prioritizing genomic regions with extreme base composition for downstream assay development.
The method integrates into the discovery continuum from target validation through lead identification to preclinical work by providing quantitative outputs on sequence enrichment that inform biological de-risking decisions.