방법 논문

진균 병원체에서 향상된 ChIP-seq 및 전사체 분석을 위한 도구로서의 피크 호출 알고리즘(WonderPeaks 및 PeakStream)

DOI:

10.3791/68301

2025년 8월 8일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 보고서에서는 RNA-seq 및 ChIP-seq 데이터를 분석하기 위한 새로운 계산 도구인 WonderPeaks를 소개합니다. 이 도구는 시퀀싱 데이터의 피크(판독 파일)를 성공적으로 식별하여 RNA-seq에서 번역되지 않은 영역 경계의 특성화를 가능하게 하고 ChIP-seq에서 염색질 농축을 검출하여 진균 병원체 연구에 귀중한 통찰력을 제공합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

전사체학 및 전사 조절자 활성을 통해 유전자 발현의 변화를 특성화하는 것은 진균 병인과 관련된 다양한 반응을 이해하기 위한 근본적인 접근 방식이 되었습니다. 이 논문은 진균 병원체, 특히 제한된 게놈 주석이 있는 비모델의 전사 조절 연구에서 주요 문제를 해결하기 위해 설계된 두 가지 계산 도구를 소개합니다. 먼저, 차세대 시퀀싱(NGS) 실험에서 매핑된 게놈 데이터의 1차 도함수를 활용하여 염색질 면역침전 후 시퀀싱(ChIP-seq)에서 풍부한 피크를 식별하는 새로운 피크 호출 알고리즘인 WonderPeaks를 제시합니다. 둘째, 폴리(A) 프라이밍 라이브러리 준비를 사용하여 생성된 전사체 데이터에서 3' 번역되지 않은 영역(UTR)에 주석을 달기 위한 WonderPeaks의 확장인 PeakStream을 소개합니다. 이러한 도구는 함께 엔드투엔드 데이터 분석 파이프라인을 제공하여 곰팡이의 전사 조절을 연구하는 연구자에게 사용자 친화적인 솔루션을 제공합니다. 우리는 진균 병원균인 칸디다 알비칸스(Candida albicans)의 데이터로 그 효과를 입증하고, ChIP-seq 데이터에서 검증된 피크를 성공적으로 식별하고, 동일한 조건에서 총 RNA 시퀀싱 데이터와의 비교를 통해 검증된 UTR에 주석을 달았습니다. 또한 현재의 최첨단 방법과 비교하여 ChIP-seq 데이터에 대한 WonderPeaks의 한계에 대해 논의하고 향후 개선 방향을 제안합니다. 궁극적으로 이 연구는 병원성 진균 및 광범위한 게놈 연구에서의 잠재적 응용과 즉각적인 관련성을 갖춘 전사 조절을 연구하기 위한 실용적인 지침과 강력한 리소스를 제공합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

곰팡이 병원체는 최근 몇 년 동안 감염이 증가하면서 새로운 글로벌 건강 문제입니다1. 이러한 병원체 중 다수는 높은 항진균제 내성을 나타내며 상당한 사망률과 관련이 있습니다2. 그러나 모델 진균 유기체에 비해 많은 병원성 진균은 여전히 제대로 특성화되지 않아 병원성 메커니즘에 대한 추가 연구의 필요성이 강조됩니다. ChIP-Seq(ChRomatin Immunoprecipitation Sequencing) 및 RNA-Sequencing(RNA-Seq)과 같은 차세대 염기서열분석(NGS) 기술은 진균 병원성의 기초가 되는 유전자 발현의 분자 메커니즘을 밝히는 데 중요한 역할을 합니다.

NGS 데이터에서 파생된 통찰력의 품질은 원시 데이터 분석에 사용되는 소프트웨어의 정확성에 크게 좌우됩니다. NGS 데이터 분석의 주요 과제 중 하나는 농축된 NGS 판독 영역을 정확하게 식별하는 피크 호출로, 이는 다양한 라이브러리 준비 및 시퀀싱 기술로 인해 특히 복잡하여 보편적인 솔루션을 비실용적으로 만듭니다. 최신 버전인 MACS3를 포함한 MACS 알고리즘3은 ChIP-seq 데이터 세트 분석을 위한 황금 표준으로 널리 알려져 있습니다. 그러나 MACS는 최소 피크 길이 및 최대 갭과 같은 사용자 정의 매개변수에 의존하며, 이는 보편적으로 적용되지 않을 수 있으며 분석 전에 결정하기 어려운 경우가 많습니다. 특히 최신 MACS3 릴리스에는 사용자가 최대 통화 전에 매개변수를 추정할 수 있는 컷오프 분석 기능이 포함되어 있습니다. 성능 향상을 위해 사용자는 염색질 구조 또는 복제 수 변이로 인해 편향을 유발하는 것으로 알려진 "블랙리스트에 있는" 게놈 영역 목록을 제공할 수도 있습니다. MACS는 ChIP-seq 데이터에 가장 일반적으로 사용되고 신뢰할 수 있는 피크 호출 도구로 남아 있지만, 특히 고도로 맞춤화된 매개변수 설정이 필요한 경우에는 사용할 수 있는 대체 알고리즘이 거의 없습니다.

RNA-Seq는 조직 배양 또는 마우스 감염 모델 4,5,6,7과 같은 생체 내 성장 동안 병원성 진균의 유전자 발현 반응을 연구하기 위한 귀중한 기술입니다. 이러한 조건에서 정확한 차등 발현 분석을 위해서는 높은 시퀀싱 깊이가 필요하며, 이는 비용과 자원을 엄청나게 많이 사용할 수 있습니다 8,9. cDNA 생성을 위해 mRNA의 폴리(A)-테일에 어닐링하도록 설계된 프라이머를 사용하는 폴리-아데닐화(poly(A))-프라이밍 시퀀싱(3'RNA-Seq)과 같은 라이브러리 준비 방법은 유전자 발현 분석에 필요한 시퀀싱 깊이를 줄이는 데 도움이 될 수 있습니다10. 그러나 이 접근법은 고품질 게놈 주석, 특히 폴리(A) 프라이밍 이벤트의 피크가 일반적으로 위치하는 3' 번역되지 않은 영역(UTR)에 의존합니다11. 연구가 부족한 많은 진균 병원체의 게놈 주석에는 UTR 주석이 없어 이러한 유기체에서 3'RNA-Seq를 사용하기 어렵습니다. 또한, 단일 유전자에 대한 UTR 길이는 다양한 성장 조건 및 세포 유형에 걸쳐 동적일 수 있습니다12,13. UTR을 식별하고 주석을 달기 위해 많은 새로운 분석 도구가 개발되었지만, 이들 중 다수는 유전자 조직이 곰팡이의 유전자 구성과 크게 다른 포유류 데이터 세트용으로 설계되었거나 단일 세포 또는 역방향 mRNA 시퀀싱과 같은 독립적인 시퀀싱 실험의 데이터를 필요로 하여 전사체 분석을 수행하려는 연구자의 시간과 비용을 증가시킬 수 있습니다12, 14,15.

이 백서에서는 NGS 데이터 세트에서 피크를 동적으로 호출하는 데 사용할 수 있는 1차 도함수의 원리에 따라 설계된 새로운 피크 호출 소프트웨어인 WonderPeaks를 제시합니다(그림 1). WonderPeaks 는 커버리지 신호의 1차 도함수를 계산하고 이 값(피크의 기울기)을 사용하여 잠재적 피크를 정의하여 피크를 식별합니다. 알고리즘은 1차 도함수가 사용자가 제공하거나 데이터로 추론한 기울기 임계값(증가 신호를 나타냄) 이상의 국소 최대값을 나타내는 인스턴스를 검색하고, 그 다음에 동일한 임계값을 초과하는 국소 최소값(감소 신호를 나타냄)을 나타내어 데이터 세트의 모든 후보 피크를 감지합니다. ChIP-seq 응용 분야의 경우 WonderPeaks는 테스트 샘플과 대조 샘플 간의 모든 후보 피크를 비교하여 고유하게 농축된 피크를 식별합니다. WonderPeaks 를 이전에 발표된 진균 병원체 칸디다 알비칸스16의 전사 인자의 ChIP-seq 데이터 세트에 적용함으로써 우리는 원래 연구에서 강조된 주요 유전자의 업스트림 피크를 성공적으로 식별하는 능력을 입증하는 동시에 이 응용 프로그램에서 알고리즘의 현재 한계에 대해서도 논의했습니다.

또한 WonderPeaks를 활용하여 3'RNA-Seq 데이터 세트의 피크를 식별하는 소프트웨어 도구인 PeakStream을 소개합니다. 3'RNA-Seq 라이브러리는 폴리(A) 프라이밍을 통해 생성된 판독이 유전자의 코딩 서열(CDS)의 정지 코돈을 넘어 확장되는 경우가 많기 때문에 정확한 3' UTR 주석에 의존하므로 코딩 영역에만 초점을 맞춘 표준 주석을 사용할 때 계산되지 않습니다. PeakStream 분석 파이프라인은 유전자 코딩 서열(CDS) 영역의 다운스트림 영역에 초점을 맞춰 3' RNA-Seq 데이터를 사용하여 새로운 게놈 주석을 생성하도록 설계되었습니다. PeakStream은 이러한 피크를 유전자에 할당하여 다운스트림 판독 계수 프로그램에 사용할 새로운 게놈 주석을 생성합니다. 우리는 PeakStream을 사용하면 다운스트림 폴리(A) 생성 피크를 3'RNA-Seq C. albicans 데이터 세트의 적절한 유전자에 정확하게 식별하고 할당할 수 있음을 보여줍니다. PeakStream은 또한 현재 유전자 주석과 연관될 가능성이 없는 피크에 주석을 달아 가능한 새로운 전사체의 발견을 용이하게 합니다. PeakStreamWonderPeaks는 함께 차세대 시퀀싱(NGS) 데이터 세트에서 피크 검출을 위한 강력한 사용자 친화적인 도구 모음을 나타냅니다.

figure-introduction-1
그림 1: WonderPeaks 및 PeakStream의 피크 호출 개요 그림. 왼쪽: 1차 도함수를 사용한 피크 호출. 오른쪽 상단: WonderPeaks를 사용한 ChIP-Seq 데이터 세트에 대한 피크 호출. 오른쪽 하단: PeakStream을 사용한 RNA-Seq 데이터 세트에 대한 피크 호출. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 설치(완료되면 건너뛰기)

  1. 필수 구성 요소
    1. Anaconda 또는 Minconda를 설치하여 전처리(섹션 5) 및 WonderPeaks(섹션 6 또는 섹션 7)를 실행하기 위한 요구 사항을 로드합니다.
      참고: Anaconda에 대한 사용자 가이드는 참조16을 참조하십시오.
    2. Python: Python을 Anaconda 또는 Miniconda 내에 설치합니다.
    3. Jupyter Notebooks를 설치하여 이 메서드의 모든 기능을 실행합니다.
      참고: Jupyter Notebook에 대한 초보자 사용자 가이드는 참조17에서 찾을 수 있습니다.
      주의: 곰팡이 게놈(≤100Mbp)의 경우 최소 20개의 코어, 8GB RAM 및 30GB의 사용 가능한 디스크 공간이 있는 컴퓨팅 환경을 보장합니다.
  2. 전처리 기능을 설치합니다.
    1. 터미널에서 conda create -n WP_preprocessing
    2. 터미널에서 conda activate WP_preprocessing
    3. 터미널에서 conda env update --file environment.yml --name
      참고: environment.yml 는 모든 패키지 종속성을 포함하는 파일이며 https://github.com/mgarber21/WonderPeaks_preprocessing.git 에서 다운로드해야 합니다.
    4. 터미널에서 pip install WonderPeaks-preprocessing을 실행합니다.
    5. 터미널에서 conda deactivate WP_preprocessing 실행합니다.
  3. WonderPeaks 기능 설치:
    1. 터미널에서 conda create -n WonderPeaks를 실행합니다.
    2. 터미널에서 다음을 실행합니다. conda WonderPeaks 활성화
    3. 터미널에서 conda env update --file environment.yml --name 를 실행합니다.
      참고: environment.yml 는 모든 패키지 종속성이 포함된 파일이며 https://github.com/mgarber21/WonderPeaks.git 에서 다운로드해야 합니다.
    4. 터미널에서 pip install WonderPeaks를 실행합니다.
    5. 터미널에서 다음을 실행합니다. conda 비활성화 WonderPeaks
      참고: 1.2 및 1.3 단계는 다음을 수행합니다. 전처리(섹션 5) 및 WonderPeaks(섹션 6 및 7)를 위한 전용 Conda 환경을 생성 하여 다른 소프트웨어와의 충돌을 방지하기 위해 종속성을 격리합니다. 환경을 활성화 하여 WP_preprocessing 또는 WonderPeaks 관련 기능을 설치하고 실행하도록 설정합니다. 데이터 전처리에 필요한 소프트웨어 종속성과 도구를 설치 합니다. 실수로 수정하는 것을 방지하고 시스템 리소스를 확보하기 위해 사용하지 않을 때 환경을 비활성화 합니다.
  4. WonderPeaks GitHub 리포지토리에서 Jupyter Notebook 및 템플릿을 다운로드합니다. 원시 데이터가 포함된 운영 체제에 WonderPeaks 다운로드를 업로드합니다(디렉토리는 섹션 2에 생성됨).
    참고: Jupyter Notebook에는 전처리, WonderPeaks 및 PeakStream 워크플로를 실행하는 데 필요한 미리 작성된 스크립트와 템플릿이 포함되어 있습니다. 원시 데이터와 동일한 시스템에 업로드하면 경로와 디렉터리가 올바르게 정렬됩니다.

2. 데이터 디렉터리 만들기

참고: WonderPeaks 및 PeakStream 워크플로우를 사용하려면 모든 데이터(원시 및 처리됨)가 동일한 디렉토리에 저장되어야 합니다. 이 단계에서는 이 새 디렉터리({data_directory} = /path/to/your/data)를 만드는 방법과 실험적 원시 데이터(처리되지 않은 시퀀싱 읽기)를 raw_data라는 이 디렉터리 내의 폴더로 이동하는 방법을 설명합니다.

  1. 데이터 디렉터리를 만듭니다.
    1. 터미널에서 mkdir {data_directory} (예: mkdir /path/to/your/data)를 실행합니다.
  2. 처리되지 않은 시퀀싱 읽기를 위한 원시 데이터 하위 디렉터리를 만듭니다.
    1. 터미널에서 mkdir {data_directory}/raw_data (예: mkdir /path/to/your/data /raw_data)를 실행합니다.
  3. 처리되지 않은 시퀀싱 읽기를 원시 데이터 디렉터리로 이동합니다.
    1. 터미널에서 mv {current_path_to_raw_data}/*fastq* {data_directory}/raw_data (예: mv current/data/path/*fastq* /path/to/your/data /raw_data

3. 사용자 입력 파일(NGS_user_input.csv) 생성

참고: 입력 파일은 전처리 및 WonderPeaks 실행을 위한 사용자 생성 구성을 지정합니다.

  1. WonderPeaks GitHub 리포지토리에서 템플릿 NGS_user_inputs.csv 다운로드합니다.
  2. NGS_user_inputs.csv에서 필드를 업데이트합니다. 다음과 같이 필드를 업데이트합니다.
    데이터 디렉토리: /path/to/your/data
    게놈 디렉토리: /path/to/your/genome
    게놈 패스타: genome.fasta
    게놈 주석: genome_annotation.gtf(게놈 주석의 파일 이름을 GTF 형식으로 제공)
  3. 업데이트된 NGS_user_inputs.csv 섹션 2에서 만든 데이터 디렉토리에 저장합니다.
    주의: 파일 이름을 변경하지 마십시오. WonderPeaks는 이름이 NGS_user_input.csv인 경우에만 이 파일을 인식합니다.

4. 메타데이터 파일 생성(NGS_user_metadata.csv)

참고: 메타데이터 파일은 실험과 관련된 모든 정보를 저장하는 데 사용됩니다. 실험 조건을 설명하기 위해 추가 열을 추가할 수 있지만 후속 단계에는 영향을 주지 않습니다.

  1. WonderPeaks GitHub 리포지토리에서 템플릿 NGS_user_metadata.csv 를 다운로드합니다.
  2. NGS_user_metadata.csv의 필드 업데이트 필드는 다음과 같습니다.
    1. 파일: 파일 이름에 공백이 없고, 파일 핸들(예: fastq, fastq.gz)이 포함되어 있으며, 절대 경로가 포함되어 있지 않은지 확인합니다.
    2. bedgraph: 이 필드를 TRUE 또는 FALSE로 설정하여 파일을 PeakStream에 포함할지 여부를 지정합니다.
      1. PeakStream 분석에서 파일을 합리적으로 제외할 수 있는 경우 베드그래프 필드를 FALSE로 설정합니다. 예를 들어, RNAseq 실험에서 돌연변이 또는 샘플 간의 UTR 차이가 예상되지 않는 기타 경우에 대해 bedgraph 매개변수 bedgraph=FALSE를 설정합니다. 그러나 RNAseq 실험의 모든 대조군 파일ChIPseq 실험의 모든 파일에 대해 베드그래프 필드를 TRUE로 설정해야 합니다.
    3. designfactor
      1. designfactor1: 실험 설계와 관련된 설계 요소(예: 치료 또는 sample_type)를 지정합니다.
      2. designfactor2: 실험 설계와 관련된 두 번째 설계 요인(예: 변형 또는 에피토프)을 지정합니다. RNAseq 실험의 경우 일반적인 설계 요인으로 처리 변형을 포함합니다. 치료 열에는 적용된 처리(예: 대조군, 약물1)가 나열되고 균주 열에는 균주 정보(예: 야생형, 돌연변이)가 나열됩니다. ChIPseq 실험의 경우 sample_type 에피토프 를 일반적인 설계 요소로 포함합니다. sample_type 열에는 단백질이 태그가 지정되었는지 또는 태그가 지정되지 않았는지 여부가 나열되고 에피토프 열에는 사용된 에피토프 의 이름이 나열됩니다.
        참고: designfactors 는 실험 설계와 관련된 속성입니다.
        WonderPeaks는 태그가 지정되지 않은 컨트롤 또는 기준선으로 입력 컨트롤과 호환됩니다.
      3. 설계 요인 열에 고유한 반복 횟수가 포함 되지 않는지 확인합니다(예: sample_type: [tagged_1, tagged_2, untagged_control _1, untagged_control _2]sample_type가 아닌 [: [tagged, tagged, untagged_control, untagged_control]). 고유한 복제 번호를 제공하면 실행 중에 오류가 발생합니다.
      4. 설계 요소 이름에 공백 대신 밑줄(_)을 사용해야 합니다.
      5. ChIPseq 애플리케이션의 경우, 메타데이터 파일의 sample_type (또는 사용자 정의 이름) 열에 단어 태그 제어가 포함된 용어가 포함되어 있는지 확인하십시오.
        참고: 예를 들어 유효한 항목에는 태그가 지정되고 untagged_control이 포함될 수 있습니다. 이러한 용어 없이 sample_type 열을 제공하면 실행 중에 오류가 발생합니다.
        주의: ChIP 적용의 경우 사용자는 두 가지 설계 요소를 지정해야 합니다.
      6. 관련 NGS_user_inputs.csv 행에 설계 요소를 추가합니다. 설계 요인에 사용되는 열 이름이 세미콜론으로 구분된 문자열(예: treatment; 긴장 또는 sample_type; 에피토프).
        주의: NGS_user_inputs.csv의 설계 요소는 NGS_user_metadata.csv 열과 정확히 일치해야 합니다. 일치하지 않는 실행은 실행 중에 오류가 발생합니다(그림 2, 보충 표 S1 및 보충 표 S2).

figure-protocol-1
그림 2: 예제 NGS_user_input.csv 및 NGS_user_metadata.csv. NGS_user_input.csv(위쪽 패널) 및 NGS_user_metadata.csv(아래쪽 패널)의 예로, 분홍색 또는 파란색 텍스트와 화살표로 designfactor 열과 designfactor 열 간의 일치를 강조 표시합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

5. NGS 데이터 전처리

참고: 사용자 지정 전처리를 사용하는 경우 섹션 5 또는 섹션 6으로 건너뜁니다.

  1. NGS 전처리 Jupyter Notebook(NGS_Preprocessing.ipynb)을 엽니다.
  2. Notebook 인터페이스 WP_preprocessing 오른쪽 위 모서리에 있는 환경(1.2단계에서 생성됨)을 활성화합니다.
  3. Shift 키를 누른 상태에서 Enter(Shift+Enter)를 눌러 첫 번째 셀을 실행합니다.
  4. Jupyter Notebook의 두 번째 셀에서 Directory = "path/to/your/data"를 설정하여 디렉터리 경로를 업데이트합니다. 여기서 path/to/your/data/ 섹션 2에서 만든 디렉터리입니다.
  5. 정렬 파일을 생성합니다. 전처리 기능은 FastP18을 사용하여 트리밍을 수행합니다. FastQC19MultiQC20을 사용한 품질 관리; STAR21을 사용한 정렬. 출력 정렬 파일은 데이터 디렉토리 내의 startout이라는 하위 디렉토리(예: path/to/your/data/starout)에 저장됩니다. samtools 뷰22를 사용하여 필터링(optional)하면 NGS_user_inputs.csv에 지정된 임계값 이상의 읽기만 유지하도록 정렬 파일을 필터링합니다.
    참고: 이러한 함수는 한 번에 데이터 세트의 단일 읽기(예: R1)만 처리합니다. 사용자는 NGS_user_inputs.csv에서 FastP STAR에 대한 실행 옵션을 지정할 수 있습니다(예: FastP: adapter_sequence(선택 사항). STAR: genomeDir, genomeFastaFiles, sjdbGTFfil)을 사용합니다.
  6. Shift + Enter를 사용하여 두 번째 셀에서 전처리 함수를 실행합니다.
    참고: 두 번째 셀의 작업을 완료하는 데 몇 시간이 걸릴 수 있습니다. 실행이 중단되면 5.3-5.6단계를 반복하여 실행을 다시 시작합니다. 이전 단계의 진행 상황은 덮어쓰지 않으며 프로세스는 중단된 부분부터 계속됩니다.
  7. BamCoverage23을 사용하여 맞춤 적용 범위의 추적 파일을 생성합니다(5.7.1 및 5.7.2 단계 참조).
    참고: ChIPseq의 경우 WonderPeaks에는 정방향 및 역방향 읽기 모두에 대한 커버리지가 포함된 단일 베드그래프 파일이 필요합니다. Poly(A) 프라이밍이 있는 RNAseq의 경우 PeakStream에는 두 개의 베드그래프 파일이 필요한데, 하나는 순방향 읽기(_fwd.bedgraph)용이고 다른 하나는 역방향 읽기용(_rev.bedgraph)용입니다. 정방향 및 역방향 읽기는 BamCoverage23 내의 filterRNAstrand 매개 변수를 사용하여 생성됩니다.
    1. 다음 매개변수를 사용하여 ChIPseq: outfilfeformat="bedgraph", strand=None, binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      참고: 출력: 정방향 및 역방향 읽기 모두에 대한 커버리지를 포함하는 단일 베드그래프 파일을 생성합니다. 출력은 /path/to/your/data/bedgraphout 에 저장됩니다(그림 3).
      1. Shift + Enter를 사용하여 세 번째 셀에서 BamCoverage 함수를 실행합니다.
    2. 다음 매개변수를 사용하여 RNAseq: outfilfeformat="bedgraph", strand="forward" 또는 "reverse", binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      주의: 스트랜드를 정방향 또는 역방향으로 설정하여 함수를 두 번 실행하여 양방향으로 읽기를 위한 파일을 생성해야 합니다.
      참고: 출력: 두 개의 베드그래프 파일을 생성합니다: 하나는 정방향 읽기(_fwd.bedgraph)용이고 다른 하나는 역방향 읽기용(_rev.bedgraph)입니다. 출력은 /path/to/your/data/ bedgraphout에 저장됩니다(그림 3).
      1. Shift + Enter를 사용하여 세 번째 셀에서 BamCoverage 함수를 실행합니다.

figure-protocol-2
그림 3: WonderPeaks의 파일 구성. bedgrapghout/normalizeUsingCPM 디렉토리에 있는 베드그래프 파일이 있는 데이터 폴더의 스크린샷입니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

6. ChIPseq용 WonderPeaks

  1. 사전 확인
    1. 파일 핸들이 .bedgraph 인 모든 베드그래프 파일이 bedgraphout 이라는 데이터 디렉토리 내의 하위 디렉토리에 있는지 확인합니다(그림 3).
    2. user_inputs 파일(NGS_user_inputs.csv)(그림 2)의 designfactors가 메타데이터 파일(NGS_user_metadata.csv)의 열과 일치하고 designfactor 열의 행이 고유하지 않은지 확인합니다(4.2.4단계의 주의 참조).
  2. NGS 전처리 Jupyter Notebook(WP4ChIP.ipynb)을 엽니다.
  3. 노트북 인터페이스의 오른쪽 상단 모서리에 있는 WonderPeaks (1.3단계에서 생성된 환경)를 활성화합니다.
  4. 중단점까지 Shift+Enter를 사용하여 셀을 실행하여 피크 호출을 실행합니다. 완료되면 처리된 데이터의 기록이 저장되고 WonderPeaks라는 데이터 디렉토리 내의 하위 디렉토리에 저장됩니다
    1. WOnder_init.csv 찾으십시오: 모든 원시 커버리지와 1차 도함수 계산 결과의 연결.
    2. 참고 WOnder_unfiltered_peaks.csv: 1차 도함수를 기반으로 호출된 필터링되지 않은 모든 피크의 연결.
    3. 관찰 bedgraph_summary.csv: 각 파일과 염색체를 그룹화한 후 점수 통계를 요약한 것입니다.
  5. 실행 매개변수를 정의합니다.
    1. 마크다운 중단점 아래의 1번째 셀을 실행합니다.
      참고: 지정된 설계 요인 으로 분리된 원시 데이터를 표시하는 플롯과 설계 요인을 보여주는 테이블이 나타납니다. 표와 플롯을 사용하여 후속 단계에서 값을 결정합니다(그림 4).
    2. 다음 셀에서 score_cut, fold_change designfactor 에 대한 값을 지정합니다(그림 4).
      1. score_cut 는 출력에서 피크를 고려할지 여부를 결정하는 데 사용되는 임계값입니다. score_cut을 결정하려면 플롯을 관찰하고 태그가 지정된 데이터의 중앙값에 가까운 값을 선택합니다(해시된 선, 그림 4 참조). 이 값을 다음과 같이 입력합니다: score_cut= 값.
      2. fold_change 피크가 실제 것으로 간주되는지 여부를 결정하는 데 사용되는 태그됨:태그되지 않은 비율 점수의 임계값입니다. fold_change을 결정하려면 플롯을 관찰하고 태그가 지정되지 않은 데이터와 태그가 지정된 데이터의 중앙값 비율보다 높은 값을 선택합니다. 이 값을 다음과 같이 입력합니다: fold_change= 값.
      3. designfactor_value 실험 설계의 일부로 지정됩니다. 가능한 설계 요소는 인쇄된 표에 빨간색 으로 나열되어 있습니다. 설계 계수를 결정하려면 빨간색으로 나열된 값 중 하나를 선택합니다. 따옴표 사이에 designfactor_value ="{ value}"와 같이 이 값을 입력합니다.
  6. Shift + Enter를 사용하여 다음 셀을 실행하여 피크 필터링 및 매핑을 실행합니다. 데이터 및 요약 플롯은 WonderPeaks라는 데이터 디렉터리 내의 하위 디렉터리에 저장됩니다.
    1. {designfactor_value}_taggedVuntagged.csv 관찰: 태그가 지정된 샘플과 태그가 지정되지 않은 각 샘플에 대한 열이 있는 모든 겹치는 피크의 피벗 테이블입니다.
    2. 참고 {designfactor_value}_all_tagged_peaks.csv: 사용자 매개변수를 기반으로 한 모든 실제 피크의 요약 테이블(6.5단계).
    3. {designfactor_value}_peaks2gtf.csv 관찰: 사용자 매개변수(단계 6.5)를 기반으로 사용자 지정 주석 파일의 유전자에 대한 실제 피크의 매핑.
  7. 선택사항: 6.5-6.6단계를 다시 실행하여 6.5단계의 매개변수를 전환하십시오. 동일한 designfactor_value 사용하는 경우 6.6단계에서 설명한 대로 생성된 파일을 덮어씁니다.

figure-protocol-3
그림 4: WonderPeaks for ChIP-seq의 designfactor_value 및 사용자 지정 임계값을 강조하는 스크린샷. 표시된 테이블에서 가능한 designfactor_value 옵션을 강조 표시하고 다음 셀에서 designfactor_value 구현하는 방법을 강조하는 WonderPeaks jupyter Notebook의 스크린샷입니다. 위쪽 검은색 화살표는 가능한 designfactor_value 항목을 표시하는 테이블을 가리킵니다. Op 값은 동그라미로 표시되어 옵션 셀(하단 검은색 화살표)에서 designfactor_value에 대해 선택한 사용자 입력으로 표시됩니다. 그래프에서 실선과 점선은 불투명 세포 실험에서 각각 태그가 지정된 샘플과 태그가 지정되지 않은 샘플에 대한 대략적인 중앙값 피크 점수를 나타냅니다. 이러한 중앙값은 score_cut(태그가 지정된 중앙값) 및 fold_change(태그가 지정된 중앙값과 태그가 지정되지 않은 중앙값의 비율) 매개변수를 정의하는 데 사용됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

7. 3'RNAseq용 PeakStream

  1. 사전 확인:
    1. 모든 bedgraph 파일이 bedgraphout 이라는 데이터 디렉터리 내의 하위 디렉터리에 있는지 확인합니다(그림 2).
    2. 개방형 NGS 전처리 Jupyter Notebook(PeakStream.ipynb)
    3. 노트북 인터페이스의 오른쪽 상단 모서리에 있는 WonderPeaks (1.3단계에서 생성된 환경)를 활성화합니다.
  2. 중단점까지 Shift+Enter 를 사용하여 셀을 실행하여 피크 호출 및 피크 매핑을 실행합니다. 완료되면 예측된 3' UTR 및 FeatureCounts24 읽기 카운트 파일이 있는 새 주석 파일이 저장되고 PeakStream 이라는 데이터 디렉토리 내의 하위 디렉토리에 저장됩니다(그림 5).
    참고: 기본적으로 출력 파일에는 단백질 코딩 바이오타입에 대한 주석만 포함되지만 바이오타입 옵션을 사용하여 전환할 수 있습니다.

figure-protocol-4
그림 5: PeakStream의 파일 구성. bedgrapghout 디렉토리에 있는 bedgraph 파일이 있는 데이터 폴더의 스크린샷입니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

원더픽스
ChIP-seq 실험을 수행한 후 연구자들은 일반적으로 MACS3와 같은 피크 호출자를 사용하여 에피토프 태그가 지정된 DNA 결합 단백질로 풍부한 게놈 영역을 식별합니다. 우리는 위에서 설명한 방법을 사용하여 피크를 식별하도록 설계된 사용자 친화적인 피크 호출기로 WonderPeaks를 개발했습니다.

WonderPeaks는 먼저 커버리지의 1차 도함수를 계산하여 피크를 식별하고 이 값(피크의 기울기)을 사용하여 잠재적 피크를 정의합니다. 그런 다음 1차 도함수가 사용자가 제공한 기울기 임계값(증가 점수를 나타냄)을 초과하는 로컬 최대값을 표시한 다음 동일한 임계값을 초과하는 로컬 최소값(감소 점수를 나타냄)을 나타내는 인스턴스를 검색합니다. 각 피크의 중심은 1차 도함수의 국부 최소값과 최대값 사이의 중간점으로 계산됩니다. 그런 다음 피크가 서로 120bp 이내에서 발생하는 경우 샘플 전체에...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

차세대 염기서열 분석(NGS) 기술은 진균 병원체의 유전자 조절 및 발현에 대한 비교할 수 없는 통찰력을 제공합니다. 따라서 계산 도구는 실험에서 생성된 모든 데이터를 캡처하는 포괄적이어야 하며 일반 사용자, 특히 벤치 과학자가 액세스할 수 있어야 합니다. 이 보고서에서는 ChIP-seq 및 RNA-seq 워크플로우에서 곰팡이 병원체 연구자의 이러한 요구 사항을 해결하는 두 가지 도구인 WonderPeaks와 PeakStream을 소개했습니다.

WonderPeaks는 ChIP-seq 실험에서 피크 호출을 위한 사용자 친화적인 워크플로입니다. 널리 사용되는 MACS와 비교할 때 WonderPeaks는 고농축 샘플(불투명 세포 유형의 Wor4) 및 저농축 샘플(백혈구 유형의 Wor4)에서 MACS에 의해 검출된 피크를 성공적으로 식별하고 MACS로 식별되지 않은 새로운 피크를 식별했습니다. 1차 도함수를 기반으로 하는 Wo...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자는 선언할 이해 상충이 없습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 작업은 NIH(National Institutes of Health) 보조금 RO1AI175080 및 R01GM037049(Alexander D. Johnson)과 NIH T32 교육 보조금 Award T32 AI 60537-20(HG)의 지원을 받았습니다. 유용한 토론과 조언을 해주신 Alexander Johnson, Matthew Lohse, Jenny Zhang 및 Brian Wang에게 감사드립니다. 또한 피드백을 주신 Carol Gross' Lab 회원들에게도 감사드립니다. 기술 지원을 해주신 Ananda Mendoza에게 감사드립니다. 시퀀싱은 UCSF PBBR, RRP IMIA 및 NIH 1S10OD028511-01 보조금의 지원을 받아 UCSF CAT에서 수행되었습니다. 코드 문제 해결 및 원고 편집에 대한 제안 제공을 지원하기 위해 OpenAI의 ChatGPT를 사용하는 것을 인정합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
CORALL Total RNA-seq V1 키트Lexogen095습식 실험실 재료 
사상균 riboPOOLsiTOOLsdp-P096-6습식 실험실 재료 
고감도 RNA ScreenTapeAgilent5067-5579습식 실험실 재료 
고감도 RNA ScreenTape 사다리애질런트5067-5581습식 실험실 재료 
고감도 RNA ScreenTape 샘플 버퍼애질런트5067-5580습식 실험실 재료 
WonderPeaks에 대한 종속성 목록https://github.com/mgarber21/WonderPeaks/blob/main/environment.yml https://github.com/mgarber21/WonderPeaks_preprocessing/blob/main/environment.yml
WonderPeaks_preprocessing
Monarch Spin RNA Cleanup KiNEBT2040L식 실험실 자료 
pygenometracks (3.9)
QuantSeq 3′ mRNA-Seq FWD 라이브러리 준비 키트 V1Lexogen015습식 실험실 재료 
Qubit RNA 고감도(HS) 분석 키트InvitrogenQ32852습식 실험실 재료 
RNA 클린 & Concentrator-5Zymo ResearchR1016습식 실험실 재료 
TURBO DNA 프리 키트ThermoFisherAM1907습식 실험실 재료 
원더픽스(0.1.14)
WonderPeaks_preprocessing(0.2.3)
에 대한 종속성 목록 습

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. fungal priority pathogens list to guide research, development and public health action. , WHO. https://www.who.int/publications/i/item/9789240060241 (2022).
  2. Fisher, M. C., Denning, D. W. The WHO fungal priority pathogens list as a game-changer. Nat Rev Microbiol. 21 (4), 211-212 (2023).
  3. Gaspar, J. M. Improved peak-calling with MACS2. bioRxiv. 496521, (2018).
  4. Muñoz, J. F., et al. Coordinated host-pathogen transcriptional dynamics revealed using sorted subpopulations and single macrophages infected with Candida albicans. Nat Commun. 10 (1), 1607(2019).
  5. Miramón, P., Pountain, A. W., Lorenz, M. C. Candida auris-macrophage cellular interactions and transcriptional response. Infect Immun. 91 (11), e0027423(2023).
  6. Lindemann-Perez, E., Rodríguez, D. L., Pérez, J. C. An approach to analyze spatiotemporal patterns of gene expression at single-cell resolution in Candida albicans-infected mouse tongues. mSphere. 9 (9), e0028224(2024).
  7. Mo, X., et al. In vivo RNA sequencing reveals a crucial role of Fus3-Kss1 MAPK pathway in Candida glabrata pathogenicity. mSphere. 9 (11), e0071524(2024).
  8. Haas, B. J., Chin, M., Nusbaum, C., Birren, B. W., Livny, J. How deep is deep enough for RNA-Seq profiling of bacterial transcriptomes. BMC Genomics. 13, 734(2012).
  9. Zaheer, R., et al. Impact of sequencing depth on the characterization of the microbiome and resistome. Sci Rep. 8 (1), 5890(2018).
  10. Xiong, Y., et al. A comparison of mRNA sequencing with random primed and 3′-directed libraries. Sci Rep. 7 (1), 14626(2017).
  11. Ma, F., et al. A comparison between whole transcript and 3' RNA sequencing methods using Kapa and Lexogen library preparation methods. BMC Genomics. 20, 9(2019).
  12. Fansler, M. M., Mitschka, S., Mayr, C. Quantifying 3′UTR length from scRNA-seq data reveals changes independent of gene expression. Nat Commun. 15 (1), 4050(2024).
  13. Tuch, B. B., et al. The transcriptomes of two heritable cell types illuminate the circuit governing their differentiation. PLoS Genet. 6, e1001070(2010).
  14. Shenker, S., Miura, P., Sanfilippo, P., Lai, E. C. IsoSCM: improved and alternative 3′ UTR annotation using multiple change-point inference. RNA. 21 (1), 14-27 (2015).
  15. Haese-Hill, W., Crouch, K., Otto, T. D. peaks2utr: a robust Python tool for the annotation of 3′ UTRs. Bioinformatics. 39 (3), btad112(2023).
  16. Anaconda - Getting started. , https://docs.anaconda.com/anaconda/getting-started/ (2025).
  17. Pryke, B. Jupyter Notebook tutorial. , https://www.dataquest.io/blog/jupyter-notebook-tutorial/ (2025).
  18. Chen, S., Zhou, Y., Chen, Y., Gu, J. fastp: an ultra-fast all-in-one FASTQ preprocessor. Bioinformatics. 34 (17), i884-i890 (2018).
  19. Andrews, S. FastQC: a quality control tool for high throughput sequence data. , https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  20. Ewels, P., Magnusson, M., Lundin, S., Käller, M. MultiQC: summarize analysis results for multiple tools and samples in a single report. Bioinformatics. 32 (19), 3047-3048 (2016).
  21. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  22. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), giab008(2021).
  23. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  24. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  25. Lohse, M. B., Johnson, A. D. Identification and characterization of Wor4, a new transcriptional regulator of white-opaque switching. G3 (Bethesda). 6 (3), 721-729 (2016).
  26. Nagalakshmi, U., et al. The transcriptional landscape of the yeast genome defined by RNA sequencing. Science. 320 (5881), 1344-1349 (2008).
  27. Diaz, A., Park, K., Lim, D. A., Song, J. S. Normalization, bias correction, and peak calling for ChIP-seq. Stat Appl Genet Mol Biol. 11 (3), Article 9(2012).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

ChIP SeqWonderPeaksPeakStream3 UTRCandida Albicans
동영상 곧 제공

관련 논문