이 프로토콜은 사용자가 CUT&RUN 염기서열분석 데이터의 초기 분석 및 검증을 완료할 수 있도록 하는 입문용 CUT&RUN 분석 파이프라인을 통해 생물정보학 초보자를 안내합니다. 여기에 설명된 분석 단계를 다운스트림 피크 주석과 함께 완료하면 사용자는 크로마틴 조절에 대한 기계론적 통찰력을 얻을 수 있습니다.
방법 논문
이 프로토콜은 사용자가 CUT&RUN 염기서열분석 데이터의 초기 분석 및 검증을 완료할 수 있도록 하는 입문용 CUT&RUN 분석 파이프라인을 통해 생물정보학 초보자를 안내합니다. 여기에 설명된 분석 단계를 다운스트림 피크 주석과 함께 완료하면 사용자는 크로마틴 조절에 대한 기계론적 통찰력을 얻을 수 있습니다.
CUT&RUN 기법은 게놈 전반에서 단백질-DNA 상호 작용의 검출을 용이하게 합니다. CUT&RUN의 일반적인 응용 분야에는 히스톤 꼬리 변형의 변화를 프로파일링하거나 전사 인자 크로마틴 점유를 매핑하는 것이 포함됩니다. CUT&RUN의 광범위한 채택은 부분적으로 기존 ChIP-seq에 비해 낮은 세포 입력 요구 사항, 더 낮은 염기서열 분석 깊이 요구 사항, 항체 에피토프를 마스킹하는 가교 결합제의 부족으로 인한 배경 신호 감소로 인한 민감도 증가 등의 기술적 이점에 의해 주도됩니다. CUT&RUN의 광범위한 채택은 Henikoff 실험실의 관대한 시약 공유와 초보자를 위한 채택을 가속화하기 위한 상용 키트 개발을 통해 달성되었습니다. CUT&RUN의 기술 채택이 증가함에 따라 CUT&RUN 염기서열분석 분석 및 검증은 주로 습식 실험실 팀에서 완전히 채택할 수 있도록 극복해야 하는 중요한 병목 현상이 되고 있습니다. CUT&RUN 분석은 일반적으로 염기서열분석 깊이, 판독 품질 및 잠재적 바이어스를 평가하기 위해 원시 염기서열분석 판독에 대한 품질 관리 검사로 시작됩니다. 그런 다음 판독을 참조 게놈 염기서열 어셈블리에 정렬하고, 이후 여러 생물정보학 도구를 사용하여 단백질 농축의 게놈 영역에 주석을 달고, 데이터 해석 가능성을 확인하고, 생물학적 결론을 도출합니다. CUT&RUN 데이터 분석을 지원하기 위해 여러 인실리코(in silico ) 분석 파이프라인이 개발되었지만, 복잡한 다중 모듈 구조와 여러 프로그래밍 언어의 사용으로 인해 여러 프로그래밍 언어에 익숙하지 않을 수 있지만 CUT&RUN 분석 절차를 이해하고 분석 파이프라인을 사용자 정의하려는 생물정보학 초보자에게는 플랫폼이 어렵습니다. 여기에서는 모든 수준의 생물정보학 경험이 있는 사용자를 위해 설계된 단일 언어 단계별 CUT&RUN 분석 파이프라인 프로토콜을 제공합니다. 이 프로토콜에는 염기서열분석 데이터가 생물학적 해석에 적합한지 검증하기 위한 중요한 품질 검사를 완료하는 것이 포함됩니다. 이 기사에서 제공하는 소개 프로토콜을 따르면 다운스트림 피크 주석과 함께 사용자가 자신의 CUT&RUN 데이터 세트에서 생물학적 통찰력을 얻을 수 있을 것으로 기대합니다.
단백질과 게놈 DNA 간의 상호 작용을 측정하는 능력은 염색질 조절의 생물학을 이해하는 데 필수적입니다. 주어진 단백질에 대한 염색질 점유율을 측정하는 효과적인 분석은 적어도 두 가지 핵심 정보, 즉 i) 게놈 국소화 및 ii) 주어진 게놈 영역에서의 단백질 풍부도를 제공합니다. 크로마틴에서 관심 있는 단백질의 모집 및 국소화 변화를 추적하면 단백질의 직접적인 표적 위치를 밝히고 전사 조절, DNA 복구 또는 DNA 복제와 같은 크로마틴 기반 생물학적 과정에서 해당 단백질의 기계론적 역할을 밝힐 수 있습니다. 오늘날 단백질-DNA 상호 작용을 프로파일링하는 데 사용할 수 있는 기술을 통해 연구자들은 전례 없는 해상도로 조절을 탐구할 수 있습니다. 이러한 기술적 진보는 Henikoff 실험실의 CUT&RUN(Cleavage Under Targets and Release Using Nuclease) 개발을 포함한 새로운 염색질 프로파일링 기술의 도입을 통해 가능해졌습니다. CUT&RUN은 기존 크로마틴 면역침전(ChIP)에 비해 세포 입력 요구 사항이 낮고, 염기서열 분석 깊이 요구 사항이 낮으며, 항체 에피토프를 마스킹하는 가교 작용제의 부족으로 인한 배경 신호 감소로 감도가 높아지는 등 여러 가지 기술적 이점을 제공합니다. 염색질 조절을 연구하기 위해 이 기법을 채택하려면 기법의 기본 원리에 대한 철저한 이해와 CUT&RUN 데이터를 분석, 검증 및 해석하는 방법에 대한 이해가 필요합니다.
CUT&RUN 절차는 마그네틱 비드에 접합된 Concanavalin A에 세포를 결합하는 것으로 시작하여 절차 전반에 걸쳐 낮은 세포 수를 조작할 수 있습니다. 분리된 세포는 관심 단백질을 표적으로 하는 항체의 도입을 용이하게 하기 위해 중성 세제를 사용하여 투과화됩니다. 그런 다음 미세구균 뉴클레아제(MNase)를 효소에 연결된 단백질 A 또는 단백질 A/G 태그를 사용하여 결합된 항체에 모집합니다. 칼슘은 효소 활동을 시작하기 위해 도입됩니다. MNase 분해는 단일 뉴클레오솜 DNA-단백질 복합체를 생성합니다. 그런 다음 칼슘을 킬레이트화하여 분해 반응을 종료하고, MNase 분해에서 짧은 DNA 단편을 핵에서 방출한 다음 DNA 정제, 라이브러리 준비 및 고처리량 염기서열분석1 을 거칩니다(그림 1).
게놈 전반에 걸쳐 단백질 점유율을 매핑하고 정량화하는 인실리코(in silico) 접근법은 이러한 DNA-단백질 상호 작용을 강화하는 데 사용되는 습식 실험실 접근법과 병행하여 개발되었습니다. 풍부한 신호(피크) 영역을 식별하는 것은 생물정보학 분석에서 가장 중요한 단계 중 하나입니다. 초기 ChIP-seq 분석 방법은 MACS2 및 SICER3과 같은 알고리즘을 사용했으며, 이는 실제 단백질-DNA 결합 부위를 배경 잡음과 구별하기 위해 통계 모델을 사용했습니다. 그러나 CUT&RUN 데이터의 낮은 배경 노이즈와 높은 해상도로 인해 ChIP-seq 분석에 사용되는 일부 피크 호출 프로그램은 CUT&RUN 분석4에 적합하지 않습니다. 이 과제는 CUT&RUN 데이터 분석에 더 적합한 새로운 도구의 필요성을 강조합니다. SEACR4는 ChIP-seq 분석에 일반적으로 사용되는 도구와 관련된 제한 사항을 극복하면서 CUT&RUN 데이터에서 피크 호출을 가능하게 하기 위해 최근에 개발된 도구 중 하나입니다.
CUT&RUN 염기서열분석 데이터의 생물학적 해석은 분석 파이프라인의 피크 호출 다운스트림 출력에서 도출됩니다. CUT&RUN 데이터에서 호출된 피크의 잠재적인 생물학적 관련성을 예측하기 위해 여러 기능 주석 프로그램을 구현할 수 있습니다. 예를 들어, 유전자 온톨로지(Gene Ontology, GO) 프로젝트는 관심 유전자 5,6,7에 대한 잘 정립된 기능적 식별을 제공한다. 다양한 소프트웨어 도구 및 리소스를 통해 GO 분석을 용이하게 하여 CUT&RUN 피크 8,9,10,11,12,13,14 사이에 풍부한 유전자 및 유전자 세트를 밝힐 수 있습니다. 또한 Deeptools15, IGV(Integrative genomics viewer)16 및 UCSC GenomeBrowser 17과 같은 시각화 소프트웨어를 사용하면 게놈 전체의 관심 영역에서 신호 분포 및 패턴을 시각화할 수 있습니다.
CUT&RUN 데이터에서 생물학적 해석을 도출할 수 있는 능력은 데이터 품질의 검증에 크게 좌우됩니다. 검증해야 할 중요한 구성 요소에는 i) CUT&RUN 라이브러리 염기서열분석 품질, ii) 복제 유사성, iii) 피크 중심에서의 신호 분포 평가가 포함됩니다. 세 가지 구성 요소 모두의 검증을 완료하는 것은 CUT&RUN 라이브러리 샘플 및 다운스트림 분석 결과의 신뢰성을 보장하는 데 매우 중요합니다. 따라서 생물정보학 초보자 및 습식 실험실 연구원이 표준 CUT&RUN 분석 파이프라인의 일부로 이러한 검증 단계를 수행할 수 있도록 입문용 CUT&RUN 분석 가이드를 수립하는 것이 중요합니다.
습식 실험실 CUT&RUN 실험의 개발과 함께 CUT&RUNTools 2.018,19, nf-core/cutandrun20 및 CnRAP21과 같은 다양한 인실리코 CUT&RUN 분석 파이프라인이 개발되어 CUT&RUN 데이터 분석을 지원합니다. 이러한 도구는 단일 셀 및 대량 CUT&RUN 및 CUT&Tag 데이터 세트를 분석하는 강력한 접근 방식을 제공합니다. 그러나 상대적으로 복잡한 모듈식 프로그램 구조와 이러한 분석 파이프라인을 수행하기 위해 여러 프로그래밍 언어에 대한 친숙함이 필요하기 때문에 CUT&RUN 분석 단계를 철저히 이해하고 자체 파이프라인을 사용자 정의하려는 생물정보학 초보자의 채택을 방해할 수 있습니다. 이 장벽을 우회하려면 간단한 단일 프로그래밍 언어를 사용하여 인코딩된 간단한 단계별 스크립트로 제공되는 새로운 입문용 CUT&RUN 분석 파이프라인이 필요합니다.
이 기사에서는 신규 및 초보 사용자가 CUT&RUN 염기서열분석 분석을 수행할 수 있도록 자세한 설명과 함께 지원되는 단계별 스크립트를 제공하는 간단한 단일 언어 CUT&RUN 분석 파이프라인 프로토콜에 대해 설명합니다. 이 파이프라인에 사용된 프로그램은 원래 개발자 그룹에서 공개적으로 사용할 수 있습니다. 이 프로토콜에 설명된 주요 단계에는 판독 정렬, 피크 호출, 기능 분석, 그리고 가장 중요하게는 생물학적 해석에 대한 데이터 적합성과 신뢰성을 결정하기 위해 시료 품질을 평가하는 검증 단계가 포함됩니다(그림 2). 또한 이 파이프라인은 사용자에게 공개적으로 사용 가능한 CUT&RUN 데이터 세트와 비교하여 분석 결과를 상호 참조할 수 있는 기회를 제공합니다. 궁극적으로 이 CUT&RUN 분석 파이프라인 프로토콜은 생물정보학 분석 초보자와 습식 실험실 연구원을 위한 입문 가이드 및 참조 역할을 합니다.
참고: CUT&RUN fastq 파일에 대한 정보 files GSE126612 표 1에서 확인할 수 있습니다. 이 연구에 사용된 소프트웨어 응용 프로그램과 관련된 정보는 자료 표에 나열되어 있습니다.
1. Github 페이지에서 Easy-Shells_CUTnRUN 파이프라인 다운로드
2. Easy Shells CUTnRUN에 필요한 프로그램 설치
3. SRA(Sequence Read Archive)에서 공개적으로 사용 가능한 CUT&RUN 데이터 세트 다운로드
4. raw sequencing 파일에 대한 초기 품질 검사
5. 원시 염기서열분석 파일에 대한 품질 및 어댑터 트리밍
6. 실제 및 스파이크인 대조군 샘플에 대한 참조 게놈에 대한 bowtie2 인덱스 다운로드
7. 트리밍된 CUT&RUN 염기서열분석 판독을 참조 게놈에 매핑
8. 매핑된 읽기 쌍 파일 정렬 및 필터링
9. 매핑된 읽기 쌍을 단편 BEDPE, BED 및 원시 readcounts bedGraph 파일로 변환
10. 원시 readcounts bedGraph 파일을 정규화된 bedGraph 및 bigWig 파일로 변환






11. 프래그먼트 크기 분포 검증
12. MACS2, MACS3 및 SEACR을 사용하여 피크 호출
13. 피크 베드 파일이라는 파일 만들기
14. Pearson 상관 관계와 주성분(PC) 분석을 사용하여 반복실험 간의 유사성을 검증합니다.
15. Venn 다이어그램을 사용하여 반복실험, 피크 호출 방법 및 옵션 간의 유사성 검증
16. 히트맵과 평균 플롯을 분석하여 호출된 피크를 시각화합니다.
Quality and adapter trimming은 높은 sequencing 품질로 판독을 유지합니다.
High-throughput sequencing 기법은 read에서 염기서열 'mutations'와 같은 염기서열분석 오류를 발생시키기 쉽습니다. 또한, 시퀀싱 어댑터 이량체는 라이브러리 준비 중 어댑터 제거가 불량하기 때문에 시퀀싱 데이터 세트에서 강화될 수 있습니다. 판독 돌연변이, 적절한 매핑에 필요한 것보다 짧은 판독 생성, 어댑터 이량체 강화와 같은 과도한 염기서열분석 오류는 판독 매핑 시간을 증가시키고 다운스트림 생물정보학 분석 결과를 왜곡하는 위양성 매핑 판독을 생성할 수 있습니다. 따라서 다운스트림 분석 및 해석을 위해 고품질 판독을 유지하기 위해 품질 필터링 및 어댑터 트리밍이 필요합니다.
분석을 위한 고품질 판독을 유지하기 위해 이 CUT&RUN 분석 파이프라인(그림 2)은 FastQC26 및 Trim Galore27을 사용합니다. "Script_03_fastQC.sh" 셸 스크립트는 작업 디렉토리 내의 모든 fastq 파일에 대해 FastQC를 실행합니다. GSE126612(SRR8581589)의 공개적으로 사용 가능한 CTCF CUT&RUN 데이터 세트를 사용한 이 단계의 결과(그림 3)는 점수 기반이 낮은 일부 읽기(그림 3A,C)와 이론적 추정과 실제 읽기 간의 일부 시퀀스당 GC 콘텐츠 분포 불일치(그림 3E)를 식별합니다.
Trim Galore를 실행하기 위해 "Script_04_trimming.sh" 스크립트를 실행하면 낮은 품질의 점수 기준(그림 3A에서 20 미만)과 트리밍 전(그림 3B-D)에서 분명한 낮은 평균 시퀀스 품질이 있는 읽기가 성공적으로 제거됩니다. 또한 "Script_04_trimming.sh"는 염기서열 플롯에 대한 '사전 트리밍(pre-trimming)' GC 분포에 표시된 55~60%의 평균 GC 함량 농축을 성공적으로 제거합니다(그림 3E,F). 이러한 결과는 이 CUT&RUN 분석 파이프라인이 고품질 판독을 필터링하여 참조 게놈에 대한 빠르고 정확한 판독 매핑을 용이하게 한다는 것을 보여줍니다.
삽입 크기 분포는 피크 호출 결과에 대한 추정치를 제공할 수 있습니다.
CUT&RUN에서 MNase를 사용하기 때문에(그림 1) 매핑된 CUT&RUN 판독은 인서트 크기 분포 플롯 내에서 모노(~200bp) 및 디뉴클레오솜(~350bp) DNA 절편 크기 피크를 나타낼 것으로 예상됩니다(그림 4). 일부 표적에 대한 검출 문제로 인해 짧은 삽입물(< 100bp)이 발생할 수 있습니다(그림 4C). 높은 수준의 짧은 읽기는 신뢰도가 높은 피크 호출에 사용할 수 있는 읽기 수를 줄여 피크 수를 줄이고 다운스트림 분석에 영향을 미칩니다. 이 CUT&RUN 분석 파이프라인에서 "Script_10_insert-size-analysis.sh"는 "picard.jar CollectInsertSizeMetrics" 기능을 작동하여 인서트 크기 분포 분석을 수행하고 히스토그램을 시각화 출력으로 내보냅니다(그림 2). 출력 플롯(그림 4A-C)에서 x축은 인서트 크기 범위를 나타내고, y축의 왼쪽과 채워진 히스토그램은 x축의 값이 있는 인서트 수를 나타내고, y축의 오른쪽은 인서트 크기가 x축의 값보다 크거나 같은 인서트의 누적 분율을 표시하고 점선은 인서트 크기를 x축의 값보다 큽니다. 따라서 히스토그램의 고점과 교차하는 점선의 기울기가 가장 극적으로 변하는 X축의 위치는 모두 샘플의 주요 인서트 크기를 식별합니다. 관심 참조 게놈(인간, hg19)에 매핑된 판독 중 H3K27Ac(활성 히스톤 마크) 샘플 단편은 가장 높은 단핵체 크기와 검출 가능한 이핵체 크기 피크를 가진 예상 CUT&RUN 삽입 크기 분포를 나타냅니다(그림 4B). CTCF 샘플 단편은 100~200bp 단편 길이 영역에서 추가 그룹을 보여주었습니다(그림 4A). 전체적으로 CUT&RUN 분석 파이프라인은 참조 게놈에 대한 판독을 매핑한 후 삽입 크기 분포 분석을 수행할 수 있는 사용하기 쉬운 셸 스크립트를 제공합니다. 이러한 분석은 다운스트림 분석 전에 피크 호출의 효율성을 추정할 때 중요합니다.
Easy Shells CUTnRUN 분석 파이프라인은 신뢰할 수 있는 판독 횟수를 생성하기 위한 필터링 및 정규화 옵션을 제공합니다.
CUT&RUN 분석의 중요한 점 중 하나는 초기 매핑 출력에서 문제가 있는 읽기 쌍을 필터링하고 필터링된 매핑된 읽기 수를 사용자 분석의 목표/요구 사항을 충족할 수 있는 특정 정규화 계산 방법으로 정규화하여 적절한 매핑된 읽기 쌍을 얻는 것입니다. 이 연구에서 논의된 CUT&RUN 분석 파이프라인에는 비표준 염색체, 공개적으로 주석이 달린 블랙리스트 영역(23) 및 TA가 "Script_06_bowtie2-mapping.sh"를 사용하여 bowtie2에 의해 매핑된 읽기 쌍에서 영역18,22를 반복하는 읽기 쌍을 제거하는 "Script_07_filter-sort-bam.sh" 스크립트가 포함되어 있습니다. 이러한 여과는 다운스트림 분석에서 위양성, 이상치 스파이크 신호 및 피크라고 할 수 있는 판독 쌍을 제거하는 데 필요합니다(그림 5, 노란색 상자 영역).
여과 외에도 올바른 정규화 방법을 적용하는 것은 샘플 간의 신호 차이를 정확하게 시각화하는 데 중요한 요소입니다. 따라서 CUT&RUN 분석 파이프라인에는 공개적으로 검증된 두 가지 정규화 방법인 SFRC(Scaled Fractional Readcout)22 및 SRPMC(Spike-in normalized Reads Per Million mapped reads)24,25를 제공하는 "Script_09_normalization_SFRC.sh" 및 "Script_09_normalization_SRPMC.sh" 스크립트가 포함되어 있습니다(그림 5A-D). SFRC는 공식에 대조군(예: IgG) 또는 스파이크인 검체를 포함하지 않기 때문에 대조군 검체를 포함하지 않거나 게놈 전체 스케일 차이 없이 국소 영역에서만 신호 차이를 보일 것으로 예상되는 검체에 대해 SFRC 정규화를 사용할 수 있습니다. CUT&RUN 분석 파이프라인(그림 5A-D, 빨간색 트랙)에 의해 처리된 SFRC 정규화 샘플은 GEO에서 공개적으로 사용 가능한 매핑된 읽기(그림 5A-D, 검은색 트랙)와 동일한 신호 분포 패턴을 생성하며, 이는 이 파이프라인이 게시 결과를 재현할 수 있음을 시사합니다.
SRPMC 방법은 대조군 샘플과 스파이크인 샘플을 모두 포함하고 샘플 간의 전역 신호 차이를 보여줄 것으로 예상되는 샘플을 정규화하는 데 유용합니다(그림 5A-D, 녹색 트랙). 하나의 H3K27Ac 샘플(SRR8581599)은 다른 복제(237, 175 및 161)보다 훨씬 더 높은 "(실제 CUT&RUN 읽기)/(스파이크 인 읽기)" 비율(샘플 RPS; 997)을 나타내기 때문에 상대 H3K27Ac 신호는 SFRC 및 SRPMC 정규화 샘플의 반복 간에 다르게 나타납니다(그림 5A-D; H3K27Ac는 모든 트랙에서 비교됨). RNAPII-S5P 샘플은 IgG 대조군(259)보다 상대적으로 낮은 샘플 RPS(1.7, 0.8, 2.1)를 나타내므로 RNAPII-S5P 샘플은 SRPMC 정규화 후 IgG 대조군보다 낮은 신호를 나타냅니다(그림 5A-D; RNAPII-S5P는 모든 트랙에서 비교됨). 따라서 여기에서 논의된 CUT&RUN 분석 파이프라인은 IgG 대조군 및 스파이크인 대조군 판독 모두에 비해 실험 시료에서 충분한 판독이 있는 시료에 대해서만 SRPMC 방법을 사용할 것을 권장합니다.
벤 다이어그램 비교는 더 나은 피크 호출 방법 및 옵션을 선택하기 위한 아이디어를 제공할 수 있습니다.
다중 피크 콜링 프로그램을 통해 게놈 전반에 걸쳐 상당히 농축된 단백질 점유를 식별할 수 있습니다. 이러한 CUT&RUN 분석에 채용된 프로그램으로는 MACS 계열 프로그램2와 SEACR4가 현재까지 주요 방법으로 꼽힌다. 그러나 특히 생물정보학 초보자의 경우 주어진 CUT&RUN 프로젝트에 가장 적합한 피크 호출 방법과 옵션을 식별하는 것이 어려울 수 있습니다. 따라서 CUT&RUN 분석 파이프라인에는 벤 다이어그램 분석 단계가 포함되어 있어 사용자가 다양한 피크 호출 옵션(Script_17_intervene-options)과 피크 호출 프로그램(Script_19_intervene_methods.sh) 간의 피크 호출 결과의 유사성과 차이점을 비교할 수 있습니다(그림 6A-H).
피크 호출 단계에서 IgG 제어 옵션을 사용하거나 사용하지 않고 호출되는 병합된 CTCF, H3K27ac 및 RNAPII-S5P 피크를 비교한 결과, MACS2 및 MACS3는 IgG 제어 옵션을 사용하여 더 많은 피크를 호출했지만(그림 6A), SEACR은 엄격한 옵션과 완화된 옵션 모두에서 IgG 제어 옵션 없이 더 많은 피크를 호출했습니다(그림 6B-D). 따라서 CUT&RUN 분석 파이프라인은 (1) MACS2 및 MACS3에 대해 IgG 제어 옵션을 적용하고, (2) 실험용 CUT&RUN 샘플과 IgG 제어 샘플에 대해 개별적으로 피크를 호출한 다음, 나중에 SEACR 피크 호출자에 대해 IgG 피크를 필터링할 것을 제안합니다. MACS2와 MACS3 사이에서, MACS3는 약간 더 많은 피크를 호출했습니다(그림 6A).
또한, IgG 제어 옵션을 사용하여 MACS2 및 MACS3에 의해 호출된 피크와 IgG 제어 옵션이 없는 SEACR을 비교한 결과, strict 옵션으로 호출된 SEACR 피크가 relaxed 옵션으로 호출된 SEACR 피크보다 MACS 2 및 MACS3 피크와 더 많이 겹치는 것으로 나타났습니다(그림 6E, F). 따라서 CUT&RUN 분석 파이프라인 출력은 엄격한 옵션이 MACS 피크 호출과 SEACR 일관성을 극대화한다는 것을 시사합니다. 마지막으로, SEACR에 의해 호출된 피크의 겹침을 원시 판독 수 CUT&RUN bedGraph 파일에 대한 정규화와 정규화 없는 정규화 판독 수 CUT&RUN bedGraph 파일에 대한 비교 벤 다이어그램은 엄격한 옵션을 사용하는 SEACR에 대한 SFRC 및 SRPMC 방법 간에 차이가 없음을 보여줍니다. SFRC 피크는 완화된 옵션을 사용하는 SEACR에 대한 SRPMC 피크보다 훨씬 더 높은 피크 수를 나타내며 정규화된 옵션 피크(그림 6의 'norm')와 더 잘 겹칩니다(그림 6G,H).
반복실험과 표본 간의 통계적 비교
여러 반복실험에서 정확한 결론을 도출하려면 반복실험 유사성을 평가해야 합니다. 여기에 사용된 CUT&RUN 분석 파이프라인은 Deeptools215 기반 통계적 상관 계수 계산, 히트맵 클러스터링 및 주성분 분석(PCA)을 사용하여 유효한 다운스트림 분석에 적합한 샘플 및 반복을 쉽게 식별할 수 있습니다. Pearson 상관 계수 기반 히트맵 클러스터링은 CTCF, H3K27Ac 및 RNAPII-S5P에 대한 반복 횟수 간에 통계적으로 유의한 상관 관계를 보여주었습니다(그림 7A-C). 그러나 PCA는 CTCF(SRR8581590) 및 H3K27Ac(SRR8581608)의 한 샘플이 피크 영역이라고 하는 모든 CTCF, H3K27Ac 및 RNAPII-S5P에서 다른 복제물(그림 7D)과 상대적으로 멀리 떨어져 있음을 보여주었습니다.
반복횟수 간 피크를 비교하기 위한 벤 다이어그램에 따르면, CTCF(SRR8581590) 피크는 세 가지 피크 호출자 결과 모두에서 다른 반복실험과의 중복이 가장 적었고(그림 7E-G), H3K27Ac(SRR8581608) 피크는 SEACR 피크 호출 결과에서 다른 반복실험과의 중복이 가장 적었습니다(그림 7F). H3K27Ac(SRR8581608) 피크는 MACS2 및 MACS3 피크 호출 결과에서 다른 반복과 최소 중복을 나타내지 않았으며(그림 7F), 이는 PCA의 반복실험 간 거리가 이상치 샘플을 정의하기에 충분하지 않다는 것을 시사할 수 있습니다. 따라서 CUT&RUN 해석 파이프라인은 이상치 반복실험을 '히트맵 군집화 그룹에서 낮은 Pearson 상관 계수를 보이고, 다른 반복실험과의 PCA 플롯에서 장거리, 반복실험 간에 가장 낮은 피크 중첩을 보이는 샘플'로 정의할 것을 제안합니다.
피크 콜링은 CUT&RUN 데이터의 시각화 및 해석을 용이하게 합니다.
이 연구에서 자세히 설명된 CUT&RUN 분석 파이프라인은 공개적으로 사용 가능한 두 가지 유형의 피크 호출자, 즉 MACS 제품군과 SEACR을 사용합니다. 호출된 피크의 시각화를 최적화하기 위해 이 파이프라인은 히트맵 및 메타플롯 분석을 위한 피크 센터로 가장 높은 신호 빈을 선택합니다. MACS3 및 SEACR 피크 호출자에 의해 호출된 모든 CTCF, H3K27Ac 및 RNAPII-S5P 피크는 전체 피크 영역의 중심(그림 8A-F, '전체' 플롯)보다 가장 높은 신호 빈의 중심에서 더 선명한 피크 분포 패턴을 보여주었습니다(그림 8A-F, '집중' 플롯). SFRC 정규화를 사용하여 Easy Shells CUTnRUN 분석 파이프라인(그림 8 A-F, 'SFRC' 플롯)으로 처리된 CUT&RUN 샘플은 분석 파이프라인에 의해 호출된 피크에서 GEO(그림 8A-F, '공개' 플롯)에서 원시 매핑된 읽기 쌍을 공개적으로 사용할 수 있는 SFRC 정규화 샘플과 유사한 신호 분포 패턴을 나타냅니다. 따라서 CUT&RUN 해석 파이프라인은 출판 결과를 성공적으로 재현할 수 있습니다.

그림 1: CUT&RUN 실험 절차의 개략도. CUT&RUN은 게놈 전체에서 단백질-DNA 상호 작용을 검출하는 효소 기반 접근 방식입니다. CUT&RUN 절차는 세포(또는 분리된 핵)를 자기 비드에 접합된 Concanavalin A에 결합하는 것으로 시작하여 절차 전반에 걸쳐 낮은 세포 수의 분리 및 조작을 가능하게 합니다. 분리된 세포는 관심 단백질을 표적으로 하는 항체의 도입을 용이하게 하기 위해 중성 세제를 사용하여 투과화됩니다. 그런 다음 단백질 A 또는 단백질 A/G 태그에 연결된 미세구균 뉴클레아제(MNase)를 투과화된 세포에 도입합니다. pA-MNase(또는 pAG-MNase)는 Protein A 또는 Protein A/G tag를 사용하여 결합된 항체에 모집됩니다. MNase가 표적 부위에 국한되면 칼슘 도입을 통해 뉴클레아제가 잠시 활성화되어 표적 단백질 주변의 DNA를 소화합니다. MNase 분해는 단일 뉴클레오솜 DNA-단백질 복합체를 생성합니다. 그 후 칼슘을 킬레이트화하여 분해 반응을 종료하고, MNase 분해에서 얻은 짧은 DNA 단편을 37°C에서 짧은 배양에 의해 핵에서 방출한 다음 DNA 정제, 라이브러리 준비 및 고처리량 염기서열분석1을 거칩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 2: Easy-Shell CUT&RUN 해석 파이프라인의 개략도. Easy-Shell CUT&RUN 분석 파이프라인은 (1) 원시 읽기 파일의 품질 관리 및 매핑(왼쪽, 자주색), (2) 매핑된 읽기 및 판독 횟수 및 피크 호출의 정규화(가운데, 녹색), (3) 매핑된 읽기 및 호출된 피크 검증(오른쪽, 분홍색)의 세 가지 주요 섹션으로 설계되었습니다. 각 단계에서 해당 셸 스크립트 번호, 간략한 설명 및 해당 단계에서 사용된 프로그램 도구(괄호 안)가 제공됩니다. 원목 화살표는 단계 사이의 직접 흐름을 보여줍니다. 이 CUT&RUN 분석 파이프라인은 제어 판독 유무에 관계없이 사용자의 요구를 충족할 수 있는 두 가지 읽기 정규화 방법, 다운스트림 분석을 위한 적절한 복제를 식별하기 위한 다층 검증 프로세스, 잘 집중된 히트맵 및 메타플롯 출력 생성을 위한 집중 피크 식별을 제공합니다. 이 분석 파이프라인은 생물정보학 초보자가 스크립트 자체를 읽고 편집하여 기본적인 CUT&RUN 데이터 분석을 배우고 연습할 수 있는 기회를 제공하기 위해 사용하기 쉬운 셸 스크립트로 단계별로 작성되었습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3: 품질 트리밍 전과 후의 품질 검사 결과 비교. FastQC에서 선택한 품질 검사 보고서 출력은 SRR8581589(GSM3609748, CTCF)에서 읽기를 사용하여 품질 트리밍 효과를 표시합니다. 표시된 결과는 다음과 같습니다: (A) 트리밍 전 베이스에 대한 품질 점수. (B) A) 트리밍 후와 동일한 판독값. (C) 트리밍 전 모든 시퀀스에 대한 품질 점수 분포. (D) C) 트리밍 후와 동일한 판독값. (E) 트리밍 전 모든 염기서열에 대한 GC 분포. (F) E) 트리밍 후와 동일한 판독값. 염기서열분석 판독(A, B) 및 최소 평균 염기서열 품질(C, D) 내 각 위치의 최소 품질 점수는 품질 트리밍 후에 증가합니다. 또한, 이 단계는 염기 불일치 비율이 높은 판독 쌍을 제거함으로써 판독(E, F)에서 염기당 이론적 GC 수 분포와 실제 GC 수 간의 차이를 줄일 수 있습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 4: 인서트 크기 분포 분석. (A) CTCF, (B) H3K27Ac 및 (C) 세린 5 인산화 RNA 중합효소 II(RNAPII-S5P)에 대한 삽입 크기 히스토그램. 히스토그램은 샘플 간 삽입 크기 분포의 상대적 차이를 표시합니다. 히스토그램의 파선은 삽입 크기가 x축의 값보다 크거나 같은 읽기의 누적 비율을 나타냅니다. N: 여과 후 시료당 일치하게 매핑된 Unique read의 수입니다. FR: 프래그먼트. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 5: CUT&RUN 샘플의 가로 개요. 추가 여과 없이 SFRC(Scaled Fractional Count)로 정규화된 공개적으로 사용 가능한 CUT&RUN 매핑된 읽기(블랙 트랙), SFRC 정규화(빨간색 트랙) 및 '네거티브 컨트롤(SRPMC; 녹색 트랙)에서 Spike-in normalized Reads Per Million 매핑된 읽기당 스파이크-인 정규화 읽기'가 (A) 히스톤 유전자 클러스터 영역에 표시됩니다. 및 (BD) 모든 MACS2, MACS3 및 SEACR 피크 호출자에 의해 호출되는 CTCF, H3K27Ac 및 RNAPII-S5P 피크가 있는 다른 세 영역. 노란색 상자는 Easy Shells CUTnRUN 분석 파이프라인의 여과 단계에서 필터링된 스파이크 신호의 위치를 강조 표시합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 6: 서로 다른 peak callers가 호출하는 peak와 peak 호출 옵션을 비교하는 벤 다이어그램. (A) 피크 호출 중 IgG 입력 옵션이 있는 경우와 없는 MACS2와 MACS3에 의해 호출된 피크 간의 비교. (B-D) IgG 입력 옵션, '엄격한' 및 '완화된' 옵션을 사용하거나 사용하지 않고, 원시 읽기 쌍 파일(B)을 사용하는 정규화 옵션과 SFRC 정규화 readcounts 파일(C) 또는 SRPMC 정규화된 readcounts 파일(D)을 사용하는 정규화 옵션을 사용하여 SEACR에서 호출한 피크 간의 비교. (E,F) MACS2, IgG 입력 옵션이 있는 MACS3 및 엄격한(E) 또는 완화된(F) 옵션이 있는 SEACR에 의해 호출되는 피크 간의 비교. (지,H) IgG 입력 옵션이 없는 SEACR과 엄격한(G) 또는 완화된(H) 옵션을 사용하여 호출하는 피크 간의 비교. w/ IgG: IgG 입력 옵션으로 호출되는 피크. w/o IgG: IgG 입력 옵션 없이 호출된 피크. norm: 정규화 옵션으로 호출되는 피크. non: 정규화 옵션 없이 호출된 피크. SFRC: 'SFRC(Scaled Fractional Count)' 방법으로 정규화된 readcounts 파일에 의해 호출되는 피크입니다. SRPMC: 'Spike-in normalized Reads Per Million mapped reads in the negative Control (SRPMC) method'에 의해 정규화된 readcounts 파일에 의해 호출된 피크입니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 7: Pearson 상관 관계, 주성분 분석 및 벤 다이어그램을 통해 반복실험 간의 유사성을 검증합니다. (A-C) Pearson 상관 계수 값을 사용한 히트맵 클러스터링은 MACS2(A), MACS3(B) 및 SEACR(C)에 의해 호출되는 피크에서 반복실험 간의 유사성 정도를 표시합니다.). Pearson 상관 계수는 -1과 1 사이의 값입니다. 절대 Pearson 상관 계수 값이 클수록 두 변수 간의 상관 관계가 더 강함을 나타내고, 양수 Pearson 상관 계수 값은 두 변수가 같은 방향으로 이동하는 양의 상관 관계를 나타냅니다. 따라서 유사성이 더 높은 표본은 히트맵 클러스터링에서 더 가까운 가계도와 더 높은 Pearson 계수 값을 나타냅니다. (D) 주성분 분석(PCA)은 MACS2(왼쪽), MACS3(중앙) 및 SEACR(오른쪽)에 의해 호출되는 모든 CTCF, H3K27Ac 및 RNAPII-S5P 피크 영역에서 복제와 샘플 간의 유사도를 표시합니다. 유사성이 더 높은 샘플은 PCA 플롯에서 서로 더 가깝게 배치됩니다. (E-G) MACS2 (E), MACS3 (F) 및 SEACR(G)에 의해 각 반복실험에서 발견되는 피크를 비교하기 위한 벤 다이어그램 분석. Easy-Shell CUT&RUN 분석 파이프라인은 다운스트림 분석을 위해 호출된 피크를 병합하는 데 적합할 수 있는 높은 유사성을 가진 반복을 식별하기 위해 세 가지 방법을 모두 적용할 것을 제안했습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 8: 피크에서의 신호 분포에 대한 히트맵 및 메타플롯 시각화. 히트맵과 메타플롯은 서로 다른 피크 호출자를 사용하여 호출되는 피크 중심 주변의 농축 분포를 표시합니다. (ᅡ,ᄂ) MACS3(A) 및 SEACR(B)에 의해 하나의 반복(SRR8581589)에서 호출되는 CTCF CUT&RUN 피크. (씨,디) H3K27Ac CUT&RUN 피크는 MACS3(C) 및 SEACR(D)을 사용하여 하나의 반복(SRR8581607)에서 호출됩니다. (E,F) MACS3(E) 및 SEACR(F)에 의해 하나의 반복(SRR8581589)에서 호출되는 RNAPII CUT&RUN 피크. 공개적으로 사용 가능한 매핑된 읽기 쌍( 그림 8의 'Public')과 Easy Shells CUTnRUN 분석 파이프라인( 그림 8의 'SFRC')에 의해 매핑된 단편은 'SFRC(Scaled Fractional Count)' 정규화 후에 비교됩니다. 피크는 IgG 입력 옵션( 그림 8의 'MACS3 w/ IgG')을 사용하는 MACS3 및 IgG 입력이 없고 정규화 옵션 없이 SEACR에 의해 호출되며, SFRC 정규화 readcounts 파일을 사용하여 엄격한 모드( 그림 8의 'SEACR w/o IgG non SFRC strictent')를 사용합니다. 호출된 피크의 좌표 파일의 두 가지 버전이 준비됩니다: 호출된 피크의 시작부터 끝까지( 그림 8의 '전체') 및 호출된 피크 내에서 가장 높은 신호를 가진 bin의 위치(MACS3의 정상은 피크라고 함; 'focused'( 그림 8)입니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
표 1: GSE126612의 CUT&RUN fastq 파일에 대한 정보. GSE126612에 포함되어 있고 Easy Shells CUTnRUN 분석 파이프라인의 예시 데이터셋으로 선택된 모든 원시 읽기 CUT&RUN fastq 파일이 표로 나열되어 있습니다. '파일 이름' 열은 원시 CUT&RUN이 읽는 fastq 파일의 이름을 보여주며, 'Script_02_download-fastq.sh'를 실행한 후 '~/Desktop/GSE126612/fastq'에 표시됩니다. 'md5sum'은 'Script_02_download-fastq.sh'를 실행하여 데이터셋을 다운로드한 후 파일의 무결성을 확인하는 데 사용할 수 있는 예제 데이터셋에 대한 MD5(Message-Digest Algorithm 5)를 공유합니다. 마지막 열은 각 샘플당 CUT&RUN의 목표를 설명합니다. 이 표를 다운로드하려면 여기를 클릭하십시오.
염색질에 대한 단백질 점유율을 매핑하는 능력은 염색질 생물학 분야에서 기계론적 연구를 수행하는 데 기본입니다. 실험실에서 크로마틴을 프로파일링하기 위해 새로운 습식 실험실 기술을 채택함에 따라 이러한 습식 실험실 실험의 염기서열 분석 데이터를 분석하는 능력은 습식 실험실 과학자들에게 일반적인 병목 현상이 되고 있습니다. 따라서 생물정보학 초보자가 분석 병목 현상을 극복하고 자신의 CUT&RUN 염기서열분석 데이터에 대한 분석 및 품질 관리 검사를 시작할 수 있도록 하는 입문용 단계별 프로토콜을 설명합니다.
이 CUT&RUN 분석 프로토콜은 선의의 신호를 정량화하기 위한 몇 가지 단계의 적용을 설명합니다. 원시 읽기 데이터에서 품질이 낮은 읽기 및 어댑터 시퀀스를 제거하는 것은 첫 번째 품질 관리 단계 중 하나이며 정확한 분석 결과를 얻기 위한 가장 중요한 단계 중 하나입니다. 따라서 이 분석 파이프라인에는 Trim-galore 프로그램27을 사용하여 적용하기 쉬운 품질 및 어댑터 트리밍 단계가 포함됩니다. 이 프로세스의 중요성으로 인해 이 분석 파이프라인에는 트리밍 프로세스(5.5단계) 전(4.3단계)과 후(5.3단계)의 결과 품질을 비교하는 단계가 포함되어 있습니다. 품질 및 어댑터 트리밍 외에도 이 분석 파이프라인은 GC 함량 편향 및 위양성 스파이크/콜드 피크를 유발할 수 있는 비표준 염색체 판독, TA 반복 영역 및 블랙리스트 영역을 제거합니다. 이러한 여과 단계는 생물정보학 초보자가 CUT&RUN 데이터 분석을 위한 중요한 품질 관리 단계를 이해할 수 있도록 적절한 입문 파이프라인을 제공합니다.
여과 단계 후 이 CUT&RUN 분석 파이프라인은 다운스트림 피크 호출 및 시각화를 위한 입력 파일을 생성하기 위해 'SFRC(scaled fractional readcount)22' 및 'SRPMC(Spike-in normalized Reads Per Million mapped reads)24,25의 두 가지 정규화 옵션을 제공합니다. CUT&RUN 데이터 세트가 샘플 간의 게놈 전체 신호 차이 없이 로컬 차이만 나타낼 것으로 예상되는 경우 스케일링된 분수 판독 수(카운트 비율 x 참조 gnome 크기)가 다운스트림 분석에 충분할 수 있습니다. 그러나 CUT&RUN 샘플 간에 글로벌 스케일 신호 차이가 존재할 가능성이 있는 경우 사용자는 스파이크인과 샘플(실험 CUT&RUN 및 네거티브 대조군 샘플 모두) 간의 판독 비율을 고려하고 네거티브 제어 판독에 대한 백만당 판독(RPM) 정규화를 고려하여 서로 다른 샘플 간에 네거티브 제어 판독을 비교할 수 있도록 할 수 있습니다. SRPMC는 정규화된 네거티브 제어 읽기에 상대적인 정규화된 읽기를 제공하기 때문에 이 접근 방식은 네거티브 제어 신호를 최소화하여 서로 다른 배치 및 그룹에서 생성된 데이터 세트 간의 비교를 가능하게 합니다.
CUT&RUN 시료 피크 콜링의 중요한 요소는 부분적으로 IgG 시료를 포함하여 인실리코(in silico ) 분석 중에 위양성 CUT&RUN 피크를 제거하는 것입니다. 특히 이 분석 파이프라인은 서로 다른 피크 호출자에 대한 피크 호출 접근 방식을 제공하여 피크라는 거짓 긍정 CUT&RUN을 폐기합니다. MACS2/3 피크 호출자의 경우, 당사의 분석 파이프라인은 피크 호출 중에 IgG 모의 읽기를 입력 샘플로 적용합니다. SEACR의 경우, 이 분석 파이프라인은 먼저 실험 샘플과 음성 대조군 샘플에 대한 피크를 독립적으로 호출한 다음, 실험 샘플의 피크 호출 중에 음성 대조군이 제공되면 SEACR이 대부분의 피크를 '잃을' 수 있으므로 실험 샘플과 음성 대조군 샘플 사이에 겹치는 피크를 제거할 것을 권장합니다. 선별된 피크는 서로 다른 피크 호출자와 반복실험 간에 유사한 유사성을 나타냅니다(그림 5). 전체적으로 저품질 염색체, 비표준 염색체, 블랙리스트 영역 및 TA 반복 판독, 어댑터 염기서열 트리밍, 스파이크인 DNA 정규화 및 peak calling 단계 중 negative control의 적절한 처리를 통해 사용자에게 다운스트림 분석에 적합한 적절한 판독 횟수 파일을 제공합니다. 고품질의 정규화된 읽기 파일과 선별된 콜드 피크를 통해 사용자는 반복실험 간의 유사성을 비교하고 매우 깨끗한 배경 신호로 히트맵 및 메타플롯을 생성하여 효과적인 피크 호출을 검증할 수 있습니다.
고품질 판독을 통한 피크 호출은 CUT&RUN 데이터에서 생물학적 해석을 도출하기 시작하는 것을 의미합니다. 이 프로토콜은 가장 높은 신호 또는 통계적으로 가장 중요한 신호 위치를 피크 센터로 지정하여 히트맵 및 메타플롯에서 집중된 피크 신호를 얻는 방법을 설명합니다. 일부 피크 호출 방식은 중심 위치에서 가장 높은 신호 또는 통계적으로 가장 유의한 신호를 선택하지 않습니다. 따라서 각 피크의 중심을 가장 높은 신호 또는 통계적으로 가장 유의한 신호 위치로 재정의하는 것은 플롯의 중심에 잘 초점이 맞춰진 신호를 갖는 시각적 데이터 출력을 생성하는 중요한 단계입니다. 원래 호출된 피크의 베드 파일은 이 프로토콜에 설명된 단계를 완료한 후 다음 단계로 피크 주석 및 기능 관련성 분석을 수행하기 위해 유지됩니다.
이 CUT&RUN 분석 파이프라인에는 필요한 프로그램 설치를 설명하는 단계가 포함되어 있지만, 생물정보학 초보자는 분석 도구를 설치하는 데 어려움을 겪을 수 있습니다. 따라서 프로그램 설치에 대한 보다 자세한 단계별 설명을 제공하고 사용자가 자신의 시스템에 프로그램을 설치하는 동안 사용자를 지원하기 위한 커뮤니케이션을 용이하게 하기 위해 관련 Github 문제 페이지가 설정되었습니다. 이 기사에서 설명한 프로토콜을 넘어 CUT&RUN 분석 파이프라인의 다음 단계에는 피크 주석, 서로 다른 유형의 호출된 피크 간 중복 식별, 호출된 피크에 대한 기능적 주석이 포함됩니다. 이 프로토콜에 설명된 품질 관리 단계 및 피크 콜링을 완료하고 다운스트림 피크 주석을 사용하면 사용자는 CUT&RUN 데이터에서 생물학적 의미를 도출할 수 있습니다.
이 CUT&RUN 해석 파이프라인은 벌크 CUT&RUN 해석에 대한 일반적인 입문용 단계별 지침을 제공하기 위해 구축되었습니다. 이 파이프라인에는 몇 가지 제한 사항이 있습니다. 첫째, 이 분석 파이프라인은 블랙리스트 영역("고신호 아티팩트 영역" 및 "아티팩트 반복 영역" 및 TA 반복 영역 포함)에 대한 읽기를 필터링하여 GC 함량 변동 기반 효과를 처리하려고 시도하지만, 이 접근 방식은 게놈에 고유한 GC 함량을 가질 수 있는 일부 유기체에는 충분하지 않을 수 있습니다. 따라서 사용자가 GC 콘텐츠 기반 편향이 우려되는 경우 매핑된 읽기를 수정하기 위한 다른 단계를 추가하는 것이 좋습니다. 생물정보학 초보자의 경우 Deeptools의 'computeGCBias' 및 'correctGCBias'가 이 목표를 위한 옵션이 될 수 있습니다. 둘째, 이 분석 파이프라인은 동일한 파일 내에서 일부 크로마틴 관련 단백질의 실제 판독일 수 있는 일반 삽입 크기(100 bp-1 kb)와 작은 삽입 크기 읽기(< 100 bp)를 모두 처리합니다. 이 분석 파이프라인은 셸 스크립트로 작성되므로 사용자는 매핑된 읽기 베드 파일 생성 단계에서 일반 프래그먼트 크기 읽기와 별도로 짧은 삽입 크기 읽기를 가져오도록 "Script_08_bam-to-BEDPE-BED-bedGraph.sh"를 수정할 수 있습니다. 그 후, 짧은 인서트 크기 읽기 베드 파일은 다운사이징 효과를 최소화하기 위해 일반 인서트 크기 매핑 읽기와 독립적으로 정규화될 수 있습니다. 셋째, 분석 파이프라인의 복잡성을 줄이기 위해 Easy Shells CUTnRUN에는 CUT&RUN 샘플의 시퀀싱 깊이와 일치하는 다운 샘플링 단계가 포함되어 있지 않습니다. 그러나 사용자는 samtools view28 또는 PositionBasedDownsampleSam(Picard)29를 사용하여 bam 파일을 필터링한 후 다운 샘플 단계를 적용할 수 있습니다.
이 프로토콜의 모든 분석 단계는 생물정보학 초보자가 스크립트를 검토하여 CUT&RUN 분석의 기초를 배울 수 있도록 쉘 스크립트로 작성되었습니다. 사용자는 터미널에서 각 쉘 스크립트를 순차적으로 실행하여 생물정보학 분석을 단계별로 연습할 수 있을 것으로 기대합니다. 또한 이 CUT&RUN 분석 파이프라인에서 제공되는 셸 스크립트의 단순성을 통해 사용자는 이러한 스크립트를 수정하고 사용자 정의하여 이 분석 파이프라인을 자신의 CUT&RUN 데이터에 적용할 수 있습니다. 궁극적으로 이 CUT&RUN 분석 파이프라인은 CUT&RUN 데이터 분석 프로세스의 일반적인 병목 현상을 줄여 습식 실험실 연구원과 생물정보학 초보자가 자신의 CUT&RUN 염기서열분석 데이터에서 생물학적 결론을 도출할 수 있도록 지원할 수 있을 것으로 기대합니다.
저자는 공개하지 않음을 선언합니다.
모든 일러스트 피규어는 BioRender.com 로 만들어졌습니다. CAI는 난소암 연구 연합(Ovarian Cancer Research Alliance)의 조기 경력 연구자상(Early Career Investigator Award), 포벡 재단 액셀러레이터 보조금(Forbeck Foundation Accelerator Grant), 미네소타 난소암 연합(Minnestoa Ovarian Cancer Alliance)의 국가 조기 발견 연구상(National Early Detection Research Award)을 통해 제공된 지원을 인정합니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| bedGraphToBigWig | ENCODE | https://hgdownload.soe.ucsc.edu/admin/exe/ | 읽기 카운트를 압축하고 변환하는 소프트웨어 bedGraph를 bigWig |
| bedtools-2.31.1 | The Quinlan Lab @ the U. of Utah | https://bedtools.readthedocs.io/en/latest/index.html | bam/bed/bedGraph 파일을 처리하는 소프트웨어 |
| bowtie2 2.5.4 | 존스 홉킨스 대학교 | https://bowtie-bio.sourceforge.net/bowtie2/index.shtml | 나비 넥타이 인덱스를 구축하고 정렬을 수행하는 소프트웨어 |
| CollectInsertSizeMetrics (Picard) | 크기 분포 분석을 수행하는 Broad | Institute | https://github.com/broadinstitute/picard |
| Cutadapt | NBIS | https://cutadapt.readthedocs.io/en/stable/index.html | 어댑터 트리밍 |
| 을 수행하는 소프트웨어Deeptoolsv3.5.1 | Max Planck Institute | https://deeptools.readthedocs.io/en/develop/index.html | Pearson 계수 상관 분석, 주성분 분석 및 히트맵/평균 플롯 분석을 수행하는 소프트웨어 |
| FastQC 버전 0.12.0 | Babraham Bioinformatics | https://github.com/s-andrews/FastQC | fastq 파일의 품질을 확인하는 소프트웨어 |
| Intervenev0.6.1 | 컴퓨터 생물학 및 유전자 조절 - Mathelier 그룹 | https://intervene.readthedocs.io/en/latest/index.html | 피크 파일을 사용하여 벤 다이어그램 분석을 수행하는 소프트웨어 |
| MACSv2.2.9.1 | Chan Zuckerberg 이니셔티브 | https://github.com/macs3-project/MACS/tree/macs_v2 | 피크를 호출하는 소프트웨어 |
| MACSv3.0.2 | Chan Zuckerberg 이니셔티브 | https://github.com/macs3-project/MACS/tree/master | 피크를 호출하는 소프트웨어 |
| Samtools-1.21 | Wellcome Sanger Institute | https://github.com/samtools/samtools | Software는 sam/bam 파일을 처리합니다 |
| SEACRv1.3 | Howard Hughes Medial Institute | https://github.com/FredHutch/SEACR | 소프트웨어는 피크를 호출합니다 |
| SRA Toolkit 릴리스 3.1.1 | NCBI | https://github.com/ncbi/sra-tools | 에서 SRR을 다운로드합니다 |
| Babraham Bioinformatics | https://github.com/FelixKrueger/TrimGalore | 품질 및 atapter 트리밍을 수행하는 소프트웨어 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청