April 8th, 2017
갤럭시 다윗은 생물 정보학 교육을받지 않은 상태에서 연구자들은 분석하고 RNA-SEQ 데이터를 해석 할 수 있도록 인기있는 도구로 등장했다. C. elegans의 연구원들은 RNA-SEQ 실험, 액세스를 수행 갤럭시를 사용하여 데이터 집합을 처리하고 DAVID를 사용하여 유전자 목록에서 의미있는 생물학적 정보를 얻을 수 있도록 우리는 프로토콜을 설명합니다.
이 프로토콜의 전반적인 목표는 생물정보학 전문 지식이 없는 C.elegans 연구원이 오픈 액세스 플랫폼 Galaxy를 사용하여 RNA 염기서열 분석 실험을 수행하고 데이터를 분석할 수 있도록 돕는 것입니다. 이 방법은 예쁜꼬마선충의 표현형 뒤에 있는 전사체 서명에 대한 통찰력을 제공하기 위해 복잡한 고농도 염기서열분석 데이터를 분석하는 데 도움이 될 수 있습니다. 이 기술의 주요 장점은 사전 생물정보학 교육을 받지 않은 과학자들이 원시 염기서열분석 데이터를 분석하고 관련 유전자 온톨로지 용어와 함께 차등적으로 발현된 유전자 목록을 생성할 수 있다는 것입니다.
이 방법은 특히 예쁜꼬마선충 염기서열분석 데이터의 뉘앙스에 맞춰져 있지만, 게놈의 주요 전사 변화를 검사해야 하는 다른 유기체 및 생물학적 맥락에도 적용할 수 있습니다. 이 비디오는 Galaxy 파이프라인의 웹 기반 사용을 다룹니다. 가능한 경우 작업 흐름을 로컬로 실행합니다.
위키 페이지의 지침에 따라 Galaxy를 다운로드하여 설치합니다. Galaxy 홈페이지에 제공된 여기에서 시작 튜토리얼을 활용한 후 이 비디오를 따르십시오. 사용자가 Galaxy 사용자 인터페이스와 작업 흐름에 사용되는 도구에 익숙해지고 방향을 잡는 것이 중요합니다.
시작하려면 헤더 패널에서 데이터 분석을 클릭하여 분석 홈 보기에 액세스합니다. 오른쪽 상단의 진행률 표시줄은 디스크 공간이 얼마나 사용되었는지 모니터링합니다. 그런 다음 왼쪽 패널의 도구 메뉴에 액세스하고 NGS RNA 분석을 클릭합니다.
이는 RNA 염기서열 데이터 분석에 필요한 모든 도구를 사용할 수 있는 옵션을 제공합니다. 이제 새 분석 기록을 시작합니다. 오른쪽의 기록 패널로 이동합니다.
톱니바퀴 아이콘을 클릭하고 팝업 메뉴에서 새로 만들기 옵션을 선택합니다. 그런 다음 기록 아래에 이름을 제공하여 분석을 식별합니다. 계속하려면 도구 메뉴로 이동하여 데이터 가져오기에서 파일 업로드 기능을 클릭하여 원시 빠른 대기열 파일을 업로드합니다.
분석 인터페이스에서 작업이 열리면 로컬 파일 선택을 클릭하거나 FTP 파일을 선택하여 적절한 시퀀스 데이터로 이동하여 선택합니다. 기본적으로 Galaxy는 파일 형식을 자동으로 감지합니다. 그런 다음 풀다운 메뉴에서 유기체를 선택하며, 이 경우 C.elegans입니다.
그런 다음 시작을 클릭하여 데이터 업로드를 시작합니다. 파일이 업로드되면 데이터를 선택하고 액세스할 수 있는 기록 패널에 작업이 저장됩니다. 이제 NGS QC 및 조작 메뉴에 액세스하고, 빠른 대기열 그루머를 선택하고, file to groom에서 파일을 선택하여 빠른 대기열 형식에서 빠른 대기열 형식으로 파일을 한 번에 하나씩 변환합니다.
적절한 입력 빠른 같음 점수 유형을 선택하고 기본 매개 변수를 사용하여 도구를 실행합니다. 이제 데이터 파일을 분석할 수 있습니다. 프로토콜 전체에서 사용되는 파일 형식과 테스트 매개변수에 특히 주의하십시오.
이 지식은 실패한 테스트 및 기타 문제를 해결하는 데 유용합니다. 진행하기 전에 품질 관리 테스트를 사용할 수 있습니다. 실행에 대한 자세한 내용은 텍스트 프로토콜에 제공됩니다.
파일을 분석할 준비가 되면 먼저 NGS RNA 분석 섹션을 연 다음 top hat 도구를 클릭하여 염기서열분석 데이터를 매핑합니다. 드롭다운 메뉴에서 이 데이터가 단일 또는 쌍을 이룬 최종 데이터입니까? 그런 다음 적절한 빠른 대기열 파일을 선택합니다.
다음 드롭다운 메뉴에서 Use a built in genome(내장 게놈 사용)을 선택하고 참조 C.elegans 게놈 데이터를 선택합니다. 다른 모든 매개 변수 옵션에 대해 default를 선택하고 execute를 클릭합니다. 데이터 세트에서 전사체의 상대적 풍부도를 추정하려면 NGS RNA 분석 섹션에서 커프 링크 도구를 선택하고 첫 번째 드롭다운 메뉴에서 Top Hat 분석에서 얻은 매핑된 허용 히트 bam 형식 파일을 선택합니다.
두 번째 드롭다운 메뉴에서 현재 게놈 데이터가 포함된 GTF 파일에 대한 참조 주석을 설정합니다. 편향 보정 수행 옵션이 표시되면 예를 선택하고 기본 설정을 사용하여 작업을 실행합니다. 다음으로, NGS RNA 분석 메뉴에서 커프 병합 도구를 열어 모든 RNA 염기서열 샘플에 대해 생성된 조립된 전사체를 병합합니다.
도구의 첫 번째 상자는 이전 단계에서 커프 링크를 사용하여 생성된 모든 GTF 파일을 로드합니다. 이제 동일한 균주 조건의 생물학적 복제를 포함하여 테스트된 각 균주 또는 조건에 대해 조립된 전사체 파일을 선택합니다. 사용자 참조 주석에 대해 예를 선택하고 참조 게놈 데이터 파일을 선택합니다.
다음으로, 시퀀스 데이터 사용 옵션에 대해 예를 선택합니다. 이렇게 하면 적절한 참조 게놈을 자동으로 감지하고 선택할 수 있습니다. 다른 모든 매개변수는 기본 설정으로 두고 실행을 클릭합니다.
단일 GTF 파일이 생성됩니다. 여러 균주 또는 상태를 비교하려면 NGS RNA 분석 섹션으로 돌아가서 커프 div 도구를 선택합니다. 그런 다음 cuff div 도구의 transcripts 메뉴에서 cuff merge에서 병합된 출력 파일을 선택합니다.
그런 다음 두 조건에 대한 레이블을 입력합니다. 각 조건에 대해 replicates(복제)로 이동하여 해당 조건의 다른 생물학적 복제에 해당하는 top hat에서 허용되는 개별 적중 출력 파일을 선택합니다. 여러 파일을 동시에 선택하려면 Command 또는 Control 키를 누르고 있습니다.
파일을 선택한 후 기본 매개 변수 설정을 사용하고 실행을 클릭하여 작업을 실행합니다. history 패널에서 생성된 gene differential testing 상자에 있는 저장 아이콘을 클릭하여 differentially expressed data를 다운로드합니다. 시작하려면 웹 사이트에서 David에 액세스하십시오.
웹 페이지의 헤더에서 start analysis(분석 시작)를 선택합니다. 은하에서 얻은 유전자 목록을 상자 A에 복사하고 이 예에서는 유전자 식별자를 웜 기본 유전자 ID로 선택합니다. 그런 다음 질문 3의 목록 유형에서 유전자 목록을 선택하고 제출 목록 아이콘을 클릭합니다. 이제 David 작업을 선택할 수 있는 분석 마법사 홈페이지가 열립니다.
이 비디오 세그먼트에서는 이러한 옵션 중 몇 가지에 대해 설명합니다. 먼저 Functional annotation clustering(기능 주석 클러스터링)을 선택하여 요약 페이지로 이동합니다. 주석 범주를 기본 설정으로 두고 Functional annotation clustering(기능 주석 클러스터링)을 클릭합니다.
이 옵션은 보강 점수에 따라 순위가 매겨진 유사한 주석 용어의 클러스터를 생성합니다. 이제 분석 마법사로 돌아가서 기능 주석 차트 옵션을 선택하여 유전자 목록과 관련하여 상당히 과대 대표된 생물학적 용어를 식별합니다. 유용한 David 기능은 기능 주석 테이블을 만드는 옵션입니다.
이것은 통계적 계산을 보여주지 않고 유전자와 관련된 모든 주석을 나열합니다. 이는 유전자별 유전자 분석 및 관심 있는 특정 유전자를 찾는 데 유용할 수 있습니다. 검토할 수 있는 또 다른 유용한 David 도구는 유전자 기능 분류입니다.
이 옵션은 유전자를 농축 점수에 따라 순위가 매겨진 기능적으로 관련된 그룹 목록으로 분리합니다. 기술된 프로토콜은 생식선 손실 후 tcer-1에 의해 발현이 조절되는 유전자를 확인하는 데 사용되었습니다. 수명이 긴 생식계열 목록 GLP-1 돌연변이체의 전사체를 당사의 생식주에 나열되지만 수명 연장을 나타내지 않는 TCER-1 GLP-1 이중 돌연변이체와 비교했습니다.
염기서열에 대한 품질 검사에서 낮은 품질의 판독, 48 - 49%GC 함량 및 51 염기쌍의 일정한 염기서열 판독 길이가 발견되지 않았습니다. 샘플의 게놈 범위는 7배에서 11배 사이로 추정되었습니다. Galaxy는 각 균주의 두 복제에서 얻은 NGS 데이터를 조합하고 차등 분석을 수행하여 게놈 와이드 발현 프로파일을 강조하는 유전자 목록을 생성할
수 있도록 했습니다.전체적으로 835개의 유전자가 0.05의 P 값 컷오프를 사용하여 두 균주 간에 다르게 발현되었습니다. 상향 조절된 유전자에 대한 기능적 주석 분석은 높은 농축 점수를 가진 4개의 주석 클러스터를 밝혀냈습니다. 가장 높은 수치는 사이토크롬 P450 및 생체이물 반응 유전자이며, 그 다음은 지질 변형에 관여하는 유전자입니다.
하향 규제 대상의 기능적 주석 클러스터링은 또한 다양한 주석 클러스터를 식별했습니다. 여기에는 세포골격 기능, 성장, 생식 및 노화에 대한 긍정적인 조절을 위해 풍부한 클러스터가 포함되었습니다. Galaxy 파이프라인은 광범위한 생물학 분야의 연구자들이 대규모 유전자 발현 변화를 빠르고 효율적으로 분석할 수 있는 길을 열었습니다.
이 비디오를 시청한 후에는 RNA 탐색 실험을 수행하고 Galaxy 파이프라인을 사용하여 원시 하이 스루 풋 염기서열 분석 데이터를 분석할 수 있어야 합니다. 또한 David 플랫폼을 사용하여 Galaxy 데이터에서 생물학적으로 관련된 정보를 추출할 수 있어야 합니다.
View the full transcript and gain access to thousands of scientific videos
이 프로토콜은 C.elegans 연구자들이 Galaxy 플랫폼을 사용하여 RNA 시퀀싱 실험을 수행하고 데이터를 분석하도록 지원합니다. 이를 통해 생물정보학 교육을 받지 않은 사람들도 복잡한 시퀀싱 데이터를 효과적으로 해석할 수 있게 합니다.
Accessible transcriptomic analysis platforms like Galaxy enable discovery teams to interrogate gene expression changes without requiring deep bioinformatics expertise, accelerating early-stage target validation and mechanistic de-risking. By streamlining RNA-Seq data processing and functional annotation, this workflow supports rapid hypothesis testing and portfolio triage in model systems such as C. elegans. The approach enhances reproducibility and scalability for both novice and experienced R&D teams handling small-scale transcriptomic studies.
This workflow positions RNA-Seq analysis from raw data through differential expression and functional annotation within the early discovery to preclinical continuum, supporting both target validation and mechanistic studies.