방법 논문

보정된 차동 RNA 편집 스캐너를 이용한 RNA 편집 부위의 고정밀 검출

DOI:

10.3791/71148

2026년 6월 23일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 보정된 차분 RNA 편집 스캐너(CADRES)를 사용하며, 이는 DNA–RNA 관절 변이 호출, 신호 최적화 재보정, 복제 인지 통계 모델링을 통합하여 차등 RNA 편집 부위를 고정밀도로 식별하는 계산 워크플로우입니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

RNA 편집의 정확한 구분은 기술적으로 여전히 어렵습니다. 왜냐하면 진짜 전사 후 변이와 유전체 변이, 시퀀싱 인공물과 구별해야 하기 때문입니다. 이 어려움은 특히 APOBEC 효소에 의해 촉매되는 사이티딘-우리딘 편집에서 두드러지는데, DNA와 RNA 변화가 혼합되어 진정한 편집 신호가 가려집니다. 보정 차별RNA 편집 스캐너(CADRES)는 통합된 DNA–RNA 변이 조사와 진짜 편집 서명의 표적 보존을 통해 이러한 한계를 해결하기 위한 구조화된 계산 프레임워크를 제공합니다. 이 프로토콜은 데이터 준비, 공동 RNA 변이 호출, 신호 보존 염기 품질 재보정, 아티팩트 필터링, 실험 조건 간 RNA 편집의 차등 평가를 포함한 CADRES 워크플로우를 제시합니다. CADRES는 생물학적 복제와 함께 쌍 RNA-seq 및 전체 게놈 또는 전엑솜 서열 분석을 지원합니다.  동중합자 제거와 PBLAT 기반 파라로그 스크리닝을 포함한 다단계 필터링 전략은 저주파 편집 이벤트를 보존하면서 거짓 양성을 체계적으로 줄입니다. 보정과 복제 인지 모델링을 결합함으로써 CADRES는 RNA 편집 분석의 정밀도와 재현성을 높여 다양한 생물학적 맥락에서 편집 역학을 탐구할 수 있게 합니다. 기존 방법과 비교할 때, CADRES는 특히 APOBEC 매개 C-to-U 사건에서 RNA 편집 검출의 정밀도를 향상시키도록 설계되었습니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

RNA 편집은 DNA 서열을 변경하지 않고 RNA 전사체 내에서 부위 특이적 뉴클레오타이드 치환을 가능하게 하는 전사 후 조절의 동적 계층을 형성합니다. 다세포동물에서는 ADAR 효소에 의해 매개되는 아데노신-이노신(A>I) 탈아미네이션이 우세하며, 전사체 다양화, mRNA 안정성, 선천 면역 조절 및 신경 기능에 기여합니다1,2. 사이티딘-우리딘(C>U)(이하 생물학적 맥락에서는 "C>U"; APOBEC 계열에 의해 촉매되는 "C>T")) 탈아미네이션은 이러한 경로와 함께 작용하며, 지질 대사, 바이러스 제한, 돌연변이 유발, 면역 및 암 생물학에서 신흥 조절 역할에 관여하는 것으로 여겨집니다 3,4,5,6,7. 최근 연구는 APOBEC1, APOBEC3A, APOBEC3B(A3B) 등 여러 APOBEC 효소가 생리학적 및 병리학적 맥 3,4,7,8,9,10에서 RNA 편집을 촉매한다는 것을 입증했습니다. APOBEC3 효소는 또한 DNA 편집을 유도하여 RNA 편집과 유전체 변이 8,10,11,12 사이의 구분을 복잡하게 만드는 중첩된 돌연변이 서명을 생성합니다.

차세대 시퀀싱은 잠재적인 RNA 편집 부위의 전사체 전체 식별을 가능하게 했지만, 진정한 편집과 게놈 SNV 또는 기술적 노이즈를 구분하는 것은 여전히 어렵습니다. A>I와 C>U 이벤트는 cDNA 라이브러리에서 A>G 및 C>T 치환으로 나타나며, 미스프라이밍, 중합효소 오류, 매핑 인공물, 맥락 특이적 발현 변화로 인해 혼란될 수 있습니다. REDIportal13과 같은 공공 자원은 수백만 개의 A>I 사이트를 목록화하는 반면, C>U의 주석은 생물학적 및 분석적 제약을 반영하여 여전히 드물다. 따라서 C>U 편집의 신뢰성 있는 식별, 특히 조건에 따른 변화는 여전히 충족되지 않은 분석 과제로 남아 있습니다.

여기서 제시된 방법인 보정 차별 RNA 편집 스캐너(CADRES)의 궁극적인 목표는 RNA의 차별 변이체(DVR)를 정확히 식별하는 것입니다. 이는 두 가지 이상의 정의된 조건 사이에서 편집 깊이가 통계적으로 유의미하게 변하는 편집 부위를 말합니다14. 이 프로토콜을 개발하면서 우리는 두 가지 지속적인 장애물을 해결하고자 했습니다. 첫째, 진짜 RNA 편집은 DNA 암호화된 변이와 구별되어야 합니다. 둘째, 편집 차이는 생물학적으로 복제된 RNA-seq 데이터셋 전반에 걸쳐 통계적으로 견고한 방식으로 정량화되어야 합니다. CADRES의 핵심 혁신은 결합 DNA/RNA 변이 호출을 염기질 점수 재교정(BQSR) 중 RNA 변이체에 대한 보정된 처리와 통합한 데 있습니다. 이 '부스트 재보정' 전략은 BQSR 중 새로 발견된 RNA 편집 부위를 보존하여, 저주파 편집 15,16,17의 감도를 흔히 저하시키는 체계적인 품질 저하를 방지합니다. 이 접근법은 불완전한 RNA 편집 데이터베이스에만 의존하는 파이프라인에 비해 거짓 음성을 줄이고 특이성을 향상시킵니다.

CADRES는 RNA 편집 분석의 서로 다른 측면을 다루는 다양한 방법들의 영역 안에 위치해 있습니다. RNA 단독 변종 세트에서 나온 SNPiR18 및 RVboost19 필터 아티팩트; VaDiR20은 DNA–RNA 비교를 포함하지만 복제 구조를 모델링하지는 않습니다; rMATS-DVR21은 GLMM 기반 차별 검사를 수행하지만 전적으로 RNA-seq에 의존합니다; JACUSA/JACUSA222,23은 복제 인지 감지를 지원하지만 공동 DNA-RNA 조사 또는 재보정 전략은 포함하지 않습니다. CADRES는 복제 인지 통계 모델링, 공동 DNA/RNA 변이 호출, 그리고 새로운 편집 부위를 위한 재보정을 통합하여, APOBEC 활성10, 11, 12와 연관된 C>U 이벤트를 포함한 조건 의존적 RNA 편집을 감지하는 데 최적화된 단일 워크플로우를 제공합니다.

이러한 맥락에서 사용자는 실험 시스템이 다음 기준을 충족할 때 CADRES가 적합하다고 판단할 수 있습니다. 첫째, 동일한 샘플에서 쌍으로 RNA-seq와 전체 게놈 또는 전체 엑솜 시퀀싱이 가능하여, RNA 유도 사건과 DNA 암호화 변이체를 엄격하게 분할할 수 있습니다. 둘째, 생물학적 문제는 효소 유도, 환경 스트레스, 발달 단계, 질병 상태 등 조건에 따른 RNA 편집 변화에 관한 것으로, 복제 간 대립유전자 특이적 깊이를 통계적으로 모델링하는 것이 필수적입니다. 셋째, 연구자는 C>U 편집 검출에서 RNA 이벤트와 APOBEC 유도 DNA 돌연변이 유발을 구분하는 데 필수적인 특성 향상을 추구합니다. CADRES는 APOBEC 활성이 RNA와 DNA 편집을 모두 유도하는 시스템에서 특히 유용하며, 유도성 A3B 모델10, 11, 12에서 입증된 바와 기존 RNA 단독 방법이 SNV 또는 반복 서열 인공물로 인해 위양성률이 과장되는 경우에 유용합니다.

CADRES는 여러 실용적인 장점을 제공합니다. 이 변이체의 공동 DNA/RNA 변이 호출은 SNV 기반 위양성을 줄여줍니다. 부스트 재보정은 참조 데이터베이스에 없는 새로운 사건을 포함한 진정한 편집 신호를 보존합니다. rMATS 기반 GLMM은 반복 간 차분 편집 분석을 위한 통계적 원칙적 프레임워크를 제공합니다. 이러한 특징들은 실험 및 질병 환경에서 동적 RNA 편집을 연구할 수 있는 보정된 고정밀 플랫폼을 제공합니다. 이전 연구14에서는 CADRES가 실리코 시뮬레이션 데이터셋과 실제 유도 가능한 A3B 세포 모델을 사용해 확립된 RNA 편집 검출 방법과 엄격히 비교되었습니다. 인실리코 평가에서 CADRES는 반복 수치에서 0.85–0.95의 정밀도 점수와 0.92–0.98의 정확도 점수를 꾸준히 달성했습니다. 전체 CADRES 워크플로우는 그림 1에 나와 있습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 CADRES 프레임워크를 사용하여 C>U RNA 편집 이벤트를 식별하기 위한 순수 계산 생물정보학 워크플로우를 설명합니다. 모든 단계는 리눅스 환경에서 명령줄을 사용하여 수행됩니다. 공개된 시퀀싱 데이터셋만 사용되며, 인간이나 척추동물 대상은 포함하지 않습니다.

1. 환경 설정 및 소프트웨어 설치

참고: CADRES 워크플로우의 최소 계산 요구사항은 다음과 같습니다: CPU ≥ 8코어(권장 16코어), RAM ≥ 32GB(전체 유전체 데이터셋에 64GB 권장), 디스크 공간≥ 100GB.

  1. 리눅스 운영체제가 사용 가능한지 확인하세요. 터미널 창을 열고 현재 사용자 환경에서 설치 권한이 있는지 확인하세요.
  2. 시스템에 아직 없으면 Conda 패키지 관리자를 설치하세요. 공식 웹사이트에서 최소 Conda 배포용 설치 프로그램을 다운로드하세요. 화면 안내에 따라 설치 스크립트를 실행하세요.
  3. 다음 명령어를 입력하여 Conda가 활성화되어 있는지 확인하고, 해당 명령어가 유효한 버전 번호를 출력하는지 확인하세요.
    $ 콘다 --버전
  4. CADRES 워크플로우를 위한 작업 디렉터리를 만드세요. 다음 방법으로 이 디렉토리에 접속하세요:
    $ CD /path/to/working_directory
  5. CADRES 소스 코드를 다운로드하려면 다음을 실행하세요:
    $ git clone --branch v1.0.0 https://github.com/junsun-hash/CADRES
  6. 복제된 디렉터리에 다음 다음 단계를 실행하여 입력하세요:
    $ cd cadres.
  7. CADRES 저장소에 제공된 environment.yml 파일을 사용하여 전용 Conda 환경을 만듭니다. 다음 명령을 실행하고 설치 과정이 중단 없이 완료되도록 하세요.
    $ conda env create -f environment.yml
  8. 다음 명령어를 입력하여 새로 생성된 환경을 활성화하세요. 터미널 프롬프트에 환경이 활성화되었는지 확인해 보세요.
    $ conda activate cadres
  9. 필요한 명령줄 도구가 올바르게 설치되었는지 확인하세요. 아래 각 명령을 실행하고 오류 메시지가 아닌 버전 번호를 반환하는지 확인하세요:
    $ 파이썬 --버전
    $ Samtools --버전
    $ 가트크 --도와줘
    $ 침대 도구 -- 버전
    $ 플라트

    참고: CADRES 환경에 포함된 정확한 도구 세트는 environment.yml 파일 업데이트에 따라 약간 다를 수 있습니다. 도구가 누락된 경우, 환경을 재생성하거나 필요에 따라 의존성 목록을 업데이트하세요.
  10. 충분한 디스크 공간이 있는지 확인하세요. 참조 게놈, 정렬 인덱스, 중간 BAM 파일을 위한 최소 100GB 이상의 여유 공간이 있는지 다음을 입력하여 확인하세요:
    $ df -h
  11. 모든 작업 디렉터리, 출력, 임시 디렉터리에서 쓰기 권한이 가능한지 테스트 파일을 생성하여 확인합니다:
    $ 터치 test_file.txt
  12. 그 후 다음 입력을 통해 파일을 삭제하세요:
    $ RM test_file.txt

2. 데이터 준비

참고: 이 프로토콜에서 사용된 대표적인 데이터셋은 다음과 같습니다: 독시사이클린 유도 가능한 A3B–GFP를 가진 HEK293T 세포; WGS 33×; 가닥 특이적 쌍말단 RNA-seq(2×150 bp, ≥60 M 리드/샘플); n = 각 조건당 3개의 생물학적 복제(DMSO vs. 독시사이클린 72시간). 전체 데이터: SRA PRJNA1211186. chr22 시연 하위 집합은 CADRES 저장소에 제공됩니다.

카드레스는 다음을 요구합니다: (i) WGS (≥33×) 또는 WES (≥33×); (ii) 가닥 특이적 쌍말단 RNA-seq(샘플당 ≥ 6천만 번의 리드); (iii) 각각 ≥2개의 생물학적 복제를 포함한 두 가지 실험 조건.

  1. 참조 유전체와 주석을 준비하세요.
    1. Ensembl 또는 유사한 저장소에서 참조 게놈(FASTA)과 GTF 주석 파일을 다운로드하세요. 권장되는 참조 유전체는 Ensembl GRCh38 1차 조립체: https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/ 이며, 권장되는 GTF 주석은 GENCODE 릴리스 45입니다:
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/.
    2. 참고 FASTA를 색인하세요:
      $ 샘툴스 페이덱스 FASTA_FILE.fa
      염색체 명명 규칙(예: "chr1" 대 "1")이 모든 참고 자료에서 일관성을 유지하도록 하세요.
  2. 시퀀싱 데이터를 확보하세요.
    1. 깊이 ≥33×의 DNA-seq FASTQ 파일(WGS 또는 WES)을 얻으세요.
    2. 두 가지 생물학적 조건과 그룹당 최소 두 번의 생물학적 복제를 포함해 샘플당 ≥ 6천만 번의 리드를 가진 가닥 특이적 쌍말 RNA-seq FASTQ 파일을 얻습니다.
  3. BWA-MEM을 사용해 DNA 시퀀싱 리드를 정렬합니다.
    1. BWA 지수 구축하기:
      $ BWA 지수 Homo_sapiens. GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. 정렬 및 BAM으로 변환하기:
      $ bwa mem -R '@RG\tID:ID\tPL:platform\tLB:library\tSM:sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz | Samtools View -b > wgs.bam
  4. STAR를 사용해 RNA 시퀀싱 리드를 정렬하세요.
    1. STAR 유전체 지수 생성:
      $ STAR --runMode genome생성 \
      --게놈패스타파일 Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index \
      --sjdbGTF파일 Homo_sapiens. GRCh38.gtf
    2. 정렬 RNA 읽기
      $ 스타 \
      --genomeDir STAR_index \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTF파일 Homo_sapiens. GRCh38.gtf \
      --아웃SAM타입 BAM 정렬 미 \
      --아웃 SAMmapq고유 60 \
      --outFileNamePrefix pass1_

      참고: 이로 인해 주석이 달린 접합 및 새로운 접합 파일이 모두 포함된 스플라이스 접합 파일(pass1_SJ.out.tab)이 생성됩니다.
    3. 새로운 접합부를 포함해 STAR 게놈 인덱스를 재생성합니다:
      $ 고양이 pass1_SJ.아웃.탭 > SJ_all.tab
      $ STAR --runMode genome생성 \
      --게놈패스타파일 Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index_2pass \
      --sjdbGTF파일 Homo_sapiens. GRCh38.gtf \
      --sjdbFileChrStartEnd SJ_all.tab
    4. 업데이트된 인덱스를 사용하여 두 번째 패스 정렬을 수행합니다:
      $ 스타 \
      --genomeDir STAR_index_2pass \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTF파일 Homo_sapiens. GRCh38.gtf \
      --아웃SAMtype BAM 정렬 정렬 \
      --아웃 SAMmapq고유 60 \
      --outFileNamePrefix output_name
  5. 보조 참고 자료를 준비하세요.
    1. (추천) dbSNP VCF 획득
      NCBI FTP 서버에서 인간용 GRCh38 dbSNP VCF(예: dbSNP 빌드 150)를 다운로드하세요:
      https://ftp.ncbi.nih.gov/snp/latest_release/VCF/ 다운로드한 파일(예: dbsnp_150.vcf.gz)을 작업 디렉터리에 넣으세요.
      참고: dbSNP의 RNA 유래 항목(molType="cDNA")은 진정한 RNA 편집 부위를 가릴 수 있습니다. 다음과 같은 방법으로 제외하세요:
      $ bcftools view -i 'INFO/molType!="cDNA"' dbsnp.vcf.gz -Oz -o dbsnp_no_cDNA.vcf.gz
    2. (추천) dbSNP VCF 정렬
      참조 게놈과 GATK와 호환되도록 VCF를 정렬하세요:
      $ 가트 SortVcf \
      -dbsnp_150.vcf.gz \
      -오 dbsnp_150.sorted.vcf.gz \

      --시퀀스 사전 Homo_sapiens. GRCh38.dict
    3. (추천) 정렬된 dbSNP VCF를 인덱싱합니다
      정렬된 dbSNP VCF에 대한 인덱스 생성:
      $ gatk IndexFeatureFile -I dbsnp_150.sorted.vcf.gz
      참고: 일치하는 참고 사전이 필요합니다. 파일이 Homo_sapiens 경우. GRCh38.dict가 누락되어 있으니, 다음과 같이 생성하세요:
      $ gatk CreateSequenceDictionary \
      -Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      -오 Homo_sapiens. GRCh38.dna.primary_assembly.dict
    4. (추천) gnomAD 생식선 VCF 획득
      GRCh38 gnomAD 생식군주 변이 사이트 VCF를 다음 다음 곳에서 다운로드하세요: https://gnomad.broadinstitute.org/downloads 파이프라인에 적합한 게놈 VCF를 사용하세요(예: gnomad.genomes.vX.X.sites.vcf.gz).
    5. (추천) gnomAD VCF 정렬하기
      호환성을 보장하기 위해 동일한 참조 사전을 사용해 gnomAD VCF를 정렬하세요:
      $ 가트 SortVcf \
      -gnomad.vcf.gz \
      -오 gnomad.sorted.vcf.gz \
      --시퀀스 사전 Homo_sapiens. GRCh38.dict
    6. (추천) 정렬된 gnomAD VCF를 인덱스
      정렬된 gnomAD VCF에 대한 인덱스를 생성합니다:
      $ gatk IndexFeatureFile -I gnomad.sorted.vcf.gz
      참고: SortVcf를 실행하기 전에 염색체 명명(예: "chr1" 대 "1")이 참조 FASTA와 일치하는지 확인하세요.
  6. 알려진 RNA 편집 참조를 확보하세요.
    참고: CADRES에 적합한 호환 REDIportal 참조 파일(rediportal.txt)은 CADRES 저장소 내에서 큐레이션되어 있으며, 다음 곳에서 직접 다운로드할 수 있습니다:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0. 이 파일은 3단계에서 알려진 편집 이벤트에 주석을 달기 위해 사용됩니다.
  7. RefGene 형식으로 유전자 주석을 준비하세요. RefGene 주석(예: UCSC의 refGene.txt.gz)을 다운로드하세요. 필요하다면 감압하여 염색체 이름이 참조 게놈에 있는 것과 일치하는지 확인하세요.
    참고: CADRES 저장소 내에서 선별된 예제가 있으며, 다음 곳에서 직접 다운로드할 수 있습니다:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0

3. CADRES 분석 워크플로우 실행

참고: 섹션 3은 CADRES Conda 환경이 활성화된 상태에서 리눅스 터미널에서 실행됩니다.

  1. 보정 및 부스트 재보정
    참고: 1단계는 BAM 파일을 표준화하고 Boost 재보정을 수행합니다. 이는 dbSNP, gnomAD, 그리고 진짜 편집 신호를 보존하기 위한 예비 RNA 편집 후보 세트를 포함하는 향상된 BQSR입니다. 모든 RNA BAM 파일을 공백으로 구분하여 나열하세요. 출력: 재보정된 BAM(접미사: _recalibration.bam) 및 Boost 후보 사이트.
    1. 3.1단계 실행:
      $ 파이썬 pipeline_step1_calibration.py \
      --rna_bams /path/to/rna_sample1.bam /path/to/rna_sample2.bam ... \
      --dna_bam /path/to/wgs_normal.bam \
      --게놈 /path/to/hg38.fa \
      --known_snv /경로/dbsnp.sorted.vcf.gz \
      --output_dir ./출력/step1_calibration \
      --접두사 project_demo

      참고: 부스트 후보는 예비 조인트 DNA-RNA Mutect2 호출(--max-events-in-region 4, PASS 필터만; 추가 AF/품질 임계값 없음)에서 구성됩니다. 동종중합자와 반복 필터링은 3.2단계에서 다룹니다.
  2. 변형 호출, 오염 추정 및 필터링
    참고: 3.2단계는 오염 추정(gnomAD를 통해)과 함께 공동 DNA-RNA 변이 호출을 수행한 후, 동중합자 맥락과 PBLAT 재정렬로 후보를 필터링합니다. 출력: {접두사}.final.vcf.
    1. 3.2단계를 실행하려면:
      $ 파이썬 pipeline_step2_variant_calling.py \
      --rna_bams ./output/step1_calibration/rna_sample1_split_recalibration.bam ... \
      --dna_bam ./output/step1_calibration/DNA_processed_recalibration.bam \
      --게놈 /path/to/hg38.fa \
      --노마드 /경로/gnomad.sorted.vcf.gz \
      --output_dir ./출력/step2_variant_calling \
      --접두사 project_demo

      참고: 이 단계는 모든 샘플에서 높은 신뢰도를 가진 RNA-DNA 차이를 나타내는 최종적이고 엄격하게 필터링된 변이 호출 집합(project_demo.final.vcf)을 생성합니다. 주요 매개변수: Mutect2 --min-medin-base 품질 12, --max-events-in region 4; PBLAT 민베이스콸 5; 모두 파이프라인 스크립트에서 미리 설정되어 있습니다.
  3. 통계적 검정과 기능 주석
    참고: 3.3단계는 rMATS에서 변형된 GLMM(Benjamini-Hochberg FDR 보정)을 사용하여 차등 RNA 편집을 정량화하며, 각 부위에 유전자 영역, 유전자 심볼, 알려진 편집 상태를 주석합니다. 출력: {prefix}_Result.txt (P-값과 FDR이 있는 DVR).
    PBLAT 재정렬 필터는 여러 유전체 유전체 좌위에 매핑되는 후보자를 제거하여 반복 영역에서 특이성을 향상시킵니다. 내부 THREAD_COUNT은 pipeline_step2_variant_calling.py의 --threads 플래그로 제어됩니다.
    1. 3.3단계 실행:
      $ 파이썬 pipeline_step3_statistical_test.py \
      --group1_rna_bams ./output/step1_calibration/control_rep1.bam ... \
      --group2_rna_bams ./output/step1_calibration/treated_rep1.bam ... \
      --final_vcf ./output/step2_variant_calling/project_demo.final.vcf \
      --게놈 /path/to/hg38.fa \
      --known_snv /경로/dbsnp.sorted.vcf.gz \
      --known_editing /경로/rediportal.txt \
      --gene_anno /경로/refGene.txt \
      --output_dir ./출력/step3_statistical_test \
      --라벨 대조 처리됨

      참고: 주요 매개변수: samtools mpileup -q 30 (최소 매핑 품질), -Q 17 (최소 기본 품질); rMATS-GLMM 우도비 검정(Δψ 컷오프 = 0.0001), 이항 로짓 연관성(복제 인식 다변량 정규 페널티(rho = 0.9); 벤자미니-호흐버그 FDR 정정; 모두 파이프라인 스크립트에서 미리 설정되어 있습니다
      세 가지 파이프라인 단계 모두 --threads 플래그를 통한 다중 스레드 실행을 지원합니다(기본값: 단계당 4개). 2단계도 --contamination_threads(기본값: 2)를 추가로 받아들입니다.

4. 결과 검사 및 시각화

  1. CADRES 워크플로우가 완료된 후에는 출력 디렉터리로 이동하세요. 주요 결과 파일인 {prefix}_Result.txt에는 RNA(DVR)에서 검출된 모든 차별 변이(Diffial Variants)가 나열되어 있으며, 여기에는 유전체 좌표, 대립유전자, 복제 수준 대립유전자 수, 편집 분획, 그룹 간 차이 및 관련 통계 지표(P값 및 FDR) 등이 포함됩니다. 유전자 수준 주석(유전자 기호, 영역, 가닥, 변이유형, 알려진 SNP/편집 상태)도 포함됩니다. 동반된 요약 파일 {prefix}_Result_summary.txt는 각 치환 유형의 개수와 이를 SNP DVR, 알려진 RNA 편집 DVR, 그리고 새로운 DVR로 분류합니다.
  2. (선택 사항) 후기 분석 스크립트를 실행하여 표준 시각화를 생성하세요. R 세션을 열고 다음을 입력합니다:
    R 콘솔:
    출처("Post-analysis.R")
    스크립트 Post-analysis.R은 https://github.com/junsun-hash/CADRES/ 에 포함되어 있습니다.
  3. 파일 선택 대화상자가 나타납니다; {prefix}_Result.txt를 선택하세요. 이 스크립트는 여섯 개의 PNG 도형을 생성합니다.
    참고: 파일 선택 대화상자는 데스크톱 R 세션을 필요로 합니다. 헤드리스 서버에서는 input_file 변수(Post-analysis.R의 10번째 라인)를 직접 편집하고 Rscript Post-analysis.R을 실행하세요.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

현실적인 실험 조건에서 CADRES 평가를 위해 293T 세포에서 유도성 APOBEC3B(A3B) 시스템을 사용했습니다. A3B-GFP를 발현하는 독시사이클린 반응성 렌티바이러스 구성체가 293T 세포에 도입되었고, 푸로마이신과 함께 안정적인 통합체를 선택하였다. 독시사이클린을 72시간 유도하면 강력한 A3B-GFP 발현이 이루어졌으며, 이는 GFP 형광과 A3B mRNA 수치 증가로 확인되었습니다. 일치하는 유도 및 비유도 샘플은 균일한 DNA 및 RNA 추출, 라이브러리 준비 및 시퀀싱을 거쳐, 관찰된 RNA-DNA 차이가 기술적 잡음이 아닌 진정한 A3B 의존적 편집을 반영하는지 확인하였습니다. 전체 원시 데이터셋은 SRA accession PRJNA1211186에서 제공되며, 시연 및 테스트 목적으로 CADRES GitHub 저장소(https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0)에서 염색체 22 구간(ch...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

여기서 제시된 CADRES 워크플로우는 특히 APOBEC 효소에 의해 촉매되는 C>U 탈아미네이션을 고특이도로 감지하기 위한 보정되고 내부적으로 일관된 전략을 제공합니다. 프로토콜 내 여러 단계가 정확성에 매우 중요합니다. 일치된 유전체 및 전사체 시퀀싱은 진짜 RNA 편집과 기저 DNA 다형성을 구분하는 데 필수적이며, 부스트 재보정 절차는 진짜 RNA 변이가 기초 품질 점수 재보정 시 잘못 처벌받는 것을 방지합니다. 동등하게 중요한 것은 동등분합자 런이나 다중 매핑 리드에서 발생하는 거짓 양성 호출을 줄이고, 가닥 분해 대립유전자 깊이 측정을 사용하는 서열 조성 및 매핑 필터입니다. 차분 편집의 신뢰성 있는 식별은 rMATS 일반화 선형 혼합 모델 내에서 복제 구조의 적절한 정의에 의존합니다.

CADRES는 종단 간 파이프라인으로 설계되었지만, 여러 구성 요소를 실제 제약 조건에 맞게 조정할 수 있습니다. 포괄적인 ...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S., Z.D., C.Z.는 현재 치료용 생물의제의 상업적 개발에 종사하는 상하이 생물제품 연구소의 직원입니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 상하이 과학기술위원회(23S11901100)의 지원을 받았습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
BCFtoolsSamtools 프로젝트N/A버전 1.21. 변이 호출 및 VCF 조작. URL: https://github.com/samtools/bcftools
BedtoolsQuinlan 랩N/A버전 2.31.1. 게놈 산술 연산. URL: https://github.com/arq5x/bedtools2
BiopythonBiopython 프로젝트N/A버전 1.85. 분자 생물학용 Python 도구. URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/A버전 0.7.18. DNA-seq 정렬. URL: https://github.com/lh3/bwa
CADRES 소스 코드GitHub (junsun-hash/CADRES)N/A버전 1.0.0. CADRES 파이프라인 스크립트. URL: https://github.com/junsun-hash/CADRES
Conda 또는 MinicondaAnaconda Inc.N/A버전 23.1. 패키지 및 환경 관리자. URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/A빌드 155. 공통 생식선 변이 데이터베이스. URL: https://ftp.ncbi.nih.gov/snp/
GATK4Broad InstituteN/A버전 4.3.0.0. 게놈 분석 툴킷. URL: https://github.com/broadinstitute/gatk
Git소프트웨어 자유 재단N/A버전 2.39. 버전 관리 시스템. URL: https://git-scm.com
gnomAD GRCh38 VCFBroad InstituteN/A버전 3.1. 인구 대립유전자 빈도. URL: https://gnomad.broadinstitute.org
GTF 주석 파일EnsemblN/A릴리스 109. GRCh38의 유전자 주석. URL: https://www.ensembl.org
Human reference genome GRCh38Ensembl/UCSCN/A릴리스 109. 참조 게놈 어셈블리. URL: https://www.ensembl.org 또는 https://hgdownload.soe.ucsc.edu
Linux 워크스테이션 또는 서버다양한N/AUbuntu 20.04. x86_64 아키텍처 필요. URL: https://ubuntu.com
pblatUCSC Genome BrowserN/A버전 2.5.1. 병렬 BLAT 재정렬. URL: https://github.com/ucscGenomeBrowser/kent
PicardBroad InstituteN/A버전 2.20.8. NGS 데이터 조작. URL: https://github.com/broadinstitute/picard
PythonPython 소프트웨어 재단N/A버전 3.9.19. 프로그래밍 언어. URL: https://www.python.org
RR 재단N/A버전 4.5.2. 통계 컴퓨팅. URL: https://www.r-project.org
R 패키지: forcatsCRANN/A버전 1.0.0. 요인 조작. URL: https://cran.r-project.org/package=forcats
R 패키지: ggplot2CRANN/A버전 4.0.1. 데이터 시각화. URL: https://cran.r-project.org/package=ggplot2
R 패키지: ggrepelCRANN/A버전 0.9.5. 텍스트 레이블 반발. URL: https://cran.r-project.org/package=ggrepel
R 패키지: lme4CRANN/A버전 1.1.35. 선형 혼합 효과 모델. URL: https://cran.r-project.org/package=lme4
R 패키지: readrCRANN/A버전 2.1.5. 빠른 파일 읽기. URL: https://cran.r-project.org/package=readr
R 패키지: stringrCRANN/A버전 1.6.0. 문자열 조작. URL: https://cran.r-project.org/package=stringr
REDIportal 참조볼로냐 대학교N/A버전 2.0. A-to-I RNA 편집 사이트 데이터베이스. URL: http://srv00.recas.ba.infn.it/atlas/
RefGene 주석UCSC Table BrowserN/A릴리스 109. 유전자 구조 주석. URL: https://genome.ucsc.edu/cgi-bin/hgTables
SamtoolsSamtools 프로젝트N/A버전 1.21. BAM 파일 조작. URL: https://github.com/samtools/samtools
STAR alignerGitHub (alexdobin/STAR)N/A버전 2.7.11b. RNA-seq 정렬. URL: https://github.com/alexdobin/STAR

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

RNAAPOBECC to URNARNA Seq

관련 논문