2017년 10월 8일
DNA 시퀀스 데이터와는 달리 epigenomic 데이터 쉽게 텍스트 기반 검색을 복종 하지는. 업그레이드 된 버전의 GeNemo, 웹 기반 생물 정보학 도구를 사용 하 여 유사성 백과 사전의 DNA 요소를 포함 하 여 사용할 수 있는 온라인 데이터베이스를 비교 하는 epigenomic 데이터에 대 한 패턴 기반 검색을 수행 하는 절차는 여기에 제시 된 사용자의 데이터입니다.
이 영상의 전반적인 목표는 후성유전학 연구 분야의 연구자들이 GeNemo 프로그램을 사용하여 서로 다른 후성유전적 표지 및 서로 다른 세포 유형 간의 유사 영역을 얻는 방법을 보여주는 것입니다. 이 프로그램을 개발한 목적은 연구자들이 자신의 세포 기능 데이터를 Encode 및 Mousington과 같은 방대한 기지의 공공 데이터베이스와 비교할 수 있도록 하는 것이었습니다. 키워드를 통한 일반적인 연구 방식의 정보 검색이 가능합니다.
귀하의 세포가 3가지 K4 프라이머화 또는 다른 특정 곡선을 보이는 시점이라고 가정해 보겠습니다. 이러한 분석 방법들이 유용하지만, GeNemo는 데이터 설명의 유사성보다는 실제 데이터 내에서 추가 정보를 검색할 수도 있습니다. 예를 들어, 어떤 종류의 후성유전학적 변형이나 세포 수와 관련이 있을지 사전 지식이 거의 또는 전혀 없는 새로운 DNA 결합 단백질을 보유하고 있다고 가정해 보십시오.
GeNemo는 여전히 잠재적인 표적을 좁히는 데 도움을 줄 수 있습니다. GeNemo는 수학 기호 및 그리스 문자를 포함한 다양한 형식의 파일을 읽을 수 있으며, 서로 다른 패턴 매칭 방법을 사용합니다. 또한 유사도 점수를 기반으로 적합하지 않은 영역을 해결하고 데이터 내보내기 옵션을 제공합니다. 이제 GeNemo 검색을 수행하는 방법을 보여드리겠습니다.
GeNemo를 사용하려면 자체 데이터 파일과 BED 또는 big wig 형식이 필요하며, 이는 UCSC genome browser와 같은 일반적인 생물정보학 도구를 사용하여 실험 원시 데이터로부터 변환할 수 있습니다. 먼저, GeNemo.org에 접속하십시오. 메인 페이지에서 상세 설정 옵션이 포함된 검색창을 확인할 수 있습니다.
데이터를 비교할 종을 선택하십시오. 본 튜토리얼에서는 homosapiens를 참조 종으로 사용합니다. 그런 다음, GeNemo에 업로드할 파일을 선택하십시오.
이 파일은 온라인에 게시하거나 로컬 드라이브에 저장할 수 있습니다. 데이터가 온라인에 있는 경우 해당 URL을 이 상자에 복사하여 붙여넣으십시오. 또는 아래 버튼을 클릭하여 로컬 데이터 파일을 업로드하십시오.
본 튜토리얼에서는 샘플 파일을 사용합니다. 경우에 따라 검색 완료까지 오랜 시간이 걸릴 수 있습니다. 대기하기를 원하지 않으시면 이 상자에 이메일 주소를 입력해 주십시오.
검색이 완료되면 결과 링크가 포함된 이메일을 받게 됩니다. BED 형식의 데이터를 직접 제공하는 경우, 표시 목적으로만 사용되는 bigWig 파일을 업로드할 수 있는 별도의 URL이 있습니다. 또한 이 상자에 검색 범위를 지정할 수도 있습니다.
검색 범위를 지정하려면 염색체 번호와 염기쌍 범위를 모두 지정해야 합니다. 다음의 두 입력 방식은 동일하게 인식됩니다. Chromosome1:1-1000000. 또는 문장 부호를 공백으로 대체하는 BED 파일 형식을 사용할 수 있습니다.
Chromosome1 1 1000000. 이제 데이터 선택 버튼을 클릭하여 검색할 트랙 유형을 선택하십시오. 각 데이터 샘플 옆의 체크 박스를 클릭하여 해당 샘플을 대상으로 검색할 수 있으며, 필터 기능도 제공됩니다.
필터 기능은 여러 트랙을 동시에 선택할 때 유용합니다. 여기에서 필터링할 카테고리를 선택할 수 있으며, 탭 하단의 버튼들을 사용할 수 있습니다. 처음 세 개의 버튼은 그 기능이 매우 직관적입니다.
필터는 선택한 카테고리에 속하지 않는 모든 트랙의 체크를 해제합니다. 일종의 AND 게이트와 유사하게 작동합니다. 반면에, 제외는 선택한 카테고리의 체크를 해제합니다.
NOT 게이트와 같습니다. 준비가 되면 검색 버튼을 클릭하여 검색을 시작하십시오. 검색할 트랙이 많거나 검색 범위를 좁게 지정하지 않은 경우, 검색에 시간이 걸릴 수 있습니다.
결과 상자에서는 지정한 트랙 서열 중 하나 이상의 서열에서 데이터 파일과 검색 종이 유사한 게놈의 다양한 섹션을 확인할 수 있습니다. BED 파일 다운로드(download BED file)를 클릭하여 일치하는 영역 목록이 포함된 파일을 다운로드할 수 있습니다. 각 상자의 보기(show) 버튼을 클릭하여 일치하는 섹션을 시각화하십시오.
디스플레이 섹션에서 사용자 데이터 파일 트랙과 그에 매칭되는 트랙 또는 트랙들을 확인할 수 있습니다. 염기쌍 라벨이 표시된 상단 바를 슬라이드하여 상류(upstream) 또는 하류(downstream)로 이동할 수 있습니다. 이 예시에서 볼 수 있듯이, 여기서 산 모양으로 솟은 부분은 두 트랙 간의 유사성을 나타냅니다.
이 영상을 시청하고 나면 GeNemo를 사용하여 서로 다른 후성유전학적 마커 간의 유사 영역을 얻는 방법에 대해 충분히 이해하게 될 것입니다. GeNemo 검색 결과에는 관심 데이터와 특정 게놈 위치에서 유사한 패턴을 보이는 다양한 조직 유형의 전사 인자 발견, DNA methylation, 염색질 접근성 또는 기타 유형의 신호와 같은 후성유전학적 마커가 포함됩니다. 이를 통해 해당 DNA 결합 단백질이 특정 전사 인자, 조절 요소와 상호작용하거나 염색질 구조 등과 관련이 있는지 확인할 수 있습니다.
귀하의 데이터 세트와 가장 높은 유사성을 보이는 조직 유형을 추가로 확인할 수 있으며, 이는 관심 단백질의 발달 기능에 적용될 수 있습니다. 이러한 광범위한 검색을 통해 GeNemo는 비교적 짧은 시간 내에 잠정적인 영역, 마커 또는 세포 유형을 반환할 수 있습니다. 이러한 결과로부터 향후 실험을 도출하기 위해 관심 가능 지역을 좁히는 것이 가능하며, 예를 들어 해당 단백질에 적합한 세포주를 선택하거나, 특정 전사 인자와의 상호작용을 테스트하거나, Co IP, 3C, 4C, 5C 또는 HiC를 통한 후성유전적 수정을 분석하는 등의 실험을 설계할 수 있습니다.
이 튜토리얼이 도움이 되었기를 바라며, 저희는 GeNemo를 개선하기 위해 지속적으로 노력하고 있습니다. 이를 위해 어떠한 피드백도 환영합니다.
본 논문은 후성유전체 데이터의 패턴 기반 검색을 위해 설계된 웹 기반 생물정보학 도구인 GeNemo 사용법에 대한 튜토리얼을 제공합니다. 연구자는 자신의 데이터를 광범위한 공공 데이터베이스와 비교하여 서로 다른 후성유전적 표지 및 세포 유형 간의 유사 영역을 식별할 수 있습니다.
GeNemo는 기존의 텍스트 기반 도구에는 없는 기능인 공공 기능 유전체 데이터셋 전반에 걸친 패턴 기반 검색을 가능하게 함으로써 후성유전체 데이터 분석의 결정적인 공백을 메웁니다. 이는 질환 관련 세포 유형 및 발달 단계와 연관된 후성유전적 시그니처를 식별함으로써, 초기 발굴 단계에서의 타겟 검증과 기전적 리스크 감소를 지원합니다. 이 도구는 후성유전 조절제 및 염색질 관련 단백질에 대한 가설 생성 시 예측 신뢰도를 높여줍니다.
GeNemo는 가설 생성부터 리드 화합물 발굴에 이르는 발견 연속체에 부합하며, 타겟 선정 및 어세이 개발의 기초가 되는 후성유전학 데이터 해석을 가능하게 합니다.