이 프로토콜은 보정된 차분 RNA 편집 스캐너(CADRES)를 사용하며, 이는 DNA–RNA 관절 변이 호출, 신호 최적화 재보정, 복제 인지 통계 모델링을 통합하여 차등 RNA 편집 부위를 고정밀도로 식별하는 계산 워크플로우입니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
이 프로토콜은 보정된 차분 RNA 편집 스캐너(CADRES)를 사용하며, 이는 DNA–RNA 관절 변이 호출, 신호 최적화 재보정, 복제 인지 통계 모델링을 통합하여 차등 RNA 편집 부위를 고정밀도로 식별하는 계산 워크플로우입니다.
RNA 편집의 정확한 구분은 기술적으로 여전히 어렵습니다. 왜냐하면 진짜 전사 후 변이와 유전체 변이, 시퀀싱 인공물과 구별해야 하기 때문입니다. 이 어려움은 특히 APOBEC 효소에 의해 촉매되는 사이티딘-우리딘 편집에서 두드러지는데, DNA와 RNA 변화가 혼합되어 진정한 편집 신호가 가려집니다. 보정 차별RNA 편집 스캐너(CADRES)는 통합된 DNA–RNA 변이 조사와 진짜 편집 서명의 표적 보존을 통해 이러한 한계를 해결하기 위한 구조화된 계산 프레임워크를 제공합니다. 이 프로토콜은 데이터 준비, 공동 RNA 변이 호출, 신호 보존 염기 품질 재보정, 아티팩트 필터링, 실험 조건 간 RNA 편집의 차등 평가를 포함한 CADRES 워크플로우를 제시합니다. CADRES는 생물학적 복제와 함께 쌍 RNA-seq 및 전체 게놈 또는 전엑솜 서열 분석을 지원합니다. 동중합자 제거와 PBLAT 기반 파라로그 스크리닝을 포함한 다단계 필터링 전략은 저주파 편집 이벤트를 보존하면서 거짓 양성을 체계적으로 줄입니다. 보정과 복제 인지 모델링을 결합함으로써 CADRES는 RNA 편집 분석의 정밀도와 재현성을 높여 다양한 생물학적 맥락에서 편집 역학을 탐구할 수 있게 합니다. 기존 방법과 비교할 때, CADRES는 특히 APOBEC 매개 C-to-U 사건에서 RNA 편집 검출의 정밀도를 향상시키도록 설계되었습니다.
RNA 편집은 DNA 서열을 변경하지 않고 RNA 전사체 내에서 부위 특이적 뉴클레오타이드 치환을 가능하게 하는 전사 후 조절의 동적 계층을 형성합니다. 다세포동물에서는 ADAR 효소에 의해 매개되는 아데노신-이노신(A>I) 탈아미네이션이 우세하며, 전사체 다양화, mRNA 안정성, 선천 면역 조절 및 신경 기능에 기여합니다1,2. 사이티딘-우리딘(C>U)(이하 생물학적 맥락에서는 "C>U"; APOBEC 계열에 의해 촉매되는 "C>T")) 탈아미네이션은 이러한 경로와 함께 작용하며, 지질 대사, 바이러스 제한, 돌연변이 유발, 면역 및 암 생물학에서 신흥 조절 역할에 관여하는 것으로 여겨집니다 3,4,5,6,7. 최근 연구는 APOBEC1, APOBEC3A, APOBEC3B(A3B) 등 여러 APOBEC 효소가 생리학적 및 병리학적 맥 락 3,4,7,8,9,10에서 RNA 편집을 촉매한다는 것을 입증했습니다. APOBEC3 효소는 또한 DNA 편집을 유도하여 RNA 편집과 유전체 변이 8,10,11,12 사이의 구분을 복잡하게 만드는 중첩된 돌연변이 서명을 생성합니다.
차세대 시퀀싱은 잠재적인 RNA 편집 부위의 전사체 전체 식별을 가능하게 했지만, 진정한 편집과 게놈 SNV 또는 기술적 노이즈를 구분하는 것은 여전히 어렵습니다. A>I와 C>U 이벤트는 cDNA 라이브러리에서 A>G 및 C>T 치환으로 나타나며, 미스프라이밍, 중합효소 오류, 매핑 인공물, 맥락 특이적 발현 변화로 인해 혼란될 수 있습니다. REDIportal13과 같은 공공 자원은 수백만 개의 A>I 사이트를 목록화하는 반면, C>U의 주석은 생물학적 및 분석적 제약을 반영하여 여전히 드물다. 따라서 C>U 편집의 신뢰성 있는 식별, 특히 조건에 따른 변화는 여전히 충족되지 않은 분석 과제로 남아 있습니다.
여기서 제시된 방법인 보정 차별 RNA 편집 스캐너(CADRES)의 궁극적인 목표는 RNA의 차별 변이체(DVR)를 정확히 식별하는 것입니다. 이는 두 가지 이상의 정의된 조건 사이에서 편집 깊이가 통계적으로 유의미하게 변하는 편집 부위를 말합니다14. 이 프로토콜을 개발하면서 우리는 두 가지 지속적인 장애물을 해결하고자 했습니다. 첫째, 진짜 RNA 편집은 DNA 암호화된 변이와 구별되어야 합니다. 둘째, 편집 차이는 생물학적으로 복제된 RNA-seq 데이터셋 전반에 걸쳐 통계적으로 견고한 방식으로 정량화되어야 합니다. CADRES의 핵심 혁신은 결합 DNA/RNA 변이 호출을 염기질 점수 재교정(BQSR) 중 RNA 변이체에 대한 보정된 처리와 통합한 데 있습니다. 이 '부스트 재보정' 전략은 BQSR 중 새로 발견된 RNA 편집 부위를 보존하여, 저주파 편집 15,16,17의 감도를 흔히 저하시키는 체계적인 품질 저하를 방지합니다. 이 접근법은 불완전한 RNA 편집 데이터베이스에만 의존하는 파이프라인에 비해 거짓 음성을 줄이고 특이성을 향상시킵니다.
CADRES는 RNA 편집 분석의 서로 다른 측면을 다루는 다양한 방법들의 영역 안에 위치해 있습니다. RNA 단독 변종 세트에서 나온 SNPiR18 및 RVboost19 필터 아티팩트; VaDiR20은 DNA–RNA 비교를 포함하지만 복제 구조를 모델링하지는 않습니다; rMATS-DVR21은 GLMM 기반 차별 검사를 수행하지만 전적으로 RNA-seq에 의존합니다; JACUSA/JACUSA222,23은 복제 인지 감지를 지원하지만 공동 DNA-RNA 조사 또는 재보정 전략은 포함하지 않습니다. CADRES는 복제 인지 통계 모델링, 공동 DNA/RNA 변이 호출, 그리고 새로운 편집 부위를 위한 재보정을 통합하여, APOBEC 활성10, 11, 12와 연관된 C>U 이벤트를 포함한 조건 의존적 RNA 편집을 감지하는 데 최적화된 단일 워크플로우를 제공합니다.
이러한 맥락에서 사용자는 실험 시스템이 다음 기준을 충족할 때 CADRES가 적합하다고 판단할 수 있습니다. 첫째, 동일한 샘플에서 쌍으로 RNA-seq와 전체 게놈 또는 전체 엑솜 시퀀싱이 가능하여, RNA 유도 사건과 DNA 암호화 변이체를 엄격하게 분할할 수 있습니다. 둘째, 생물학적 문제는 효소 유도, 환경 스트레스, 발달 단계, 질병 상태 등 조건에 따른 RNA 편집 변화에 관한 것으로, 복제 간 대립유전자 특이적 깊이를 통계적으로 모델링하는 것이 필수적입니다. 셋째, 연구자는 C>U 편집 검출에서 RNA 이벤트와 APOBEC 유도 DNA 돌연변이 유발을 구분하는 데 필수적인 특성 향상을 추구합니다. CADRES는 APOBEC 활성이 RNA와 DNA 편집을 모두 유도하는 시스템에서 특히 유용하며, 유도성 A3B 모델10, 11, 12에서 입증된 바와 기존 RNA 단독 방법이 SNV 또는 반복 서열 인공물로 인해 위양성률이 과장되는 경우에 유용합니다.
CADRES는 여러 실용적인 장점을 제공합니다. 이 변이체의 공동 DNA/RNA 변이 호출은 SNV 기반 위양성을 줄여줍니다. 부스트 재보정은 참조 데이터베이스에 없는 새로운 사건을 포함한 진정한 편집 신호를 보존합니다. rMATS 기반 GLMM은 반복 간 차분 편집 분석을 위한 통계적 원칙적 프레임워크를 제공합니다. 이러한 특징들은 실험 및 질병 환경에서 동적 RNA 편집을 연구할 수 있는 보정된 고정밀 플랫폼을 제공합니다. 이전 연구14에서는 CADRES가 실리코 시뮬레이션 데이터셋과 실제 유도 가능한 A3B 세포 모델을 사용해 확립된 RNA 편집 검출 방법과 엄격히 비교되었습니다. 인실리코 평가에서 CADRES는 반복 수치에서 0.85–0.95의 정밀도 점수와 0.92–0.98의 정확도 점수를 꾸준히 달성했습니다. 전체 CADRES 워크플로우는 그림 1에 나와 있습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 프로토콜은 CADRES 프레임워크를 사용하여 C>U RNA 편집 이벤트를 식별하기 위한 순수 계산 생물정보학 워크플로우를 설명합니다. 모든 단계는 리눅스 환경에서 명령줄을 사용하여 수행됩니다. 공개된 시퀀싱 데이터셋만 사용되며, 인간이나 척추동물 대상은 포함하지 않습니다.
1. 환경 설정 및 소프트웨어 설치
참고: CADRES 워크플로우의 최소 계산 요구사항은 다음과 같습니다: CPU ≥ 8코어(권장 16코어), RAM ≥ 32GB(전체 유전체 데이터셋에 64GB 권장), 디스크 공간≥ 100GB.
2. 데이터 준비
참고: 이 프로토콜에서 사용된 대표적인 데이터셋은 다음과 같습니다: 독시사이클린 유도 가능한 A3B–GFP를 가진 HEK293T 세포; WGS 33×; 가닥 특이적 쌍말단 RNA-seq(2×150 bp, ≥60 M 리드/샘플); n = 각 조건당 3개의 생물학적 복제(DMSO vs. 독시사이클린 72시간). 전체 데이터: SRA PRJNA1211186. chr22 시연 하위 집합은 CADRES 저장소에 제공됩니다.
카드레스는 다음을 요구합니다: (i) WGS (≥33×) 또는 WES (≥33×); (ii) 가닥 특이적 쌍말단 RNA-seq(샘플당 ≥ 6천만 번의 리드); (iii) 각각 ≥2개의 생물학적 복제를 포함한 두 가지 실험 조건.
3. CADRES 분석 워크플로우 실행
참고: 섹션 3은 CADRES Conda 환경이 활성화된 상태에서 리눅스 터미널에서 실행됩니다.
4. 결과 검사 및 시각화
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
현실적인 실험 조건에서 CADRES 평가를 위해 293T 세포에서 유도성 APOBEC3B(A3B) 시스템을 사용했습니다. A3B-GFP를 발현하는 독시사이클린 반응성 렌티바이러스 구성체가 293T 세포에 도입되었고, 푸로마이신과 함께 안정적인 통합체를 선택하였다. 독시사이클린을 72시간 유도하면 강력한 A3B-GFP 발현이 이루어졌으며, 이는 GFP 형광과 A3B mRNA 수치 증가로 확인되었습니다. 일치하는 유도 및 비유도 샘플은 균일한 DNA 및 RNA 추출, 라이브러리 준비 및 시퀀싱을 거쳐, 관찰된 RNA-DNA 차이가 기술적 잡음이 아닌 진정한 A3B 의존적 편집을 반영하는지 확인하였습니다. 전체 원시 데이터셋은 SRA accession PRJNA1211186에서 제공되며, 시연 및 테스트 목적으로 CADRES GitHub 저장소(https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0)에서 염색체 22 구간(ch...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
여기서 제시된 CADRES 워크플로우는 특히 APOBEC 효소에 의해 촉매되는 C>U 탈아미네이션을 고특이도로 감지하기 위한 보정되고 내부적으로 일관된 전략을 제공합니다. 프로토콜 내 여러 단계가 정확성에 매우 중요합니다. 일치된 유전체 및 전사체 시퀀싱은 진짜 RNA 편집과 기저 DNA 다형성을 구분하는 데 필수적이며, 부스트 재보정 절차는 진짜 RNA 변이가 기초 품질 점수 재보정 시 잘못 처벌받는 것을 방지합니다. 동등하게 중요한 것은 동등분합자 런이나 다중 매핑 리드에서 발생하는 거짓 양성 호출을 줄이고, 가닥 분해 대립유전자 깊이 측정을 사용하는 서열 조성 및 매핑 필터입니다. 차분 편집의 신뢰성 있는 식별은 rMATS 일반화 선형 혼합 모델 내에서 복제 구조의 적절한 정의에 의존합니다.
CADRES는 종단 간 파이프라인으로 설계되었지만, 여러 구성 요소를 실제 제약 조건에 맞게 조정할 수 있습니다. 포괄적인 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
J.S., Z.D., C.Z.는 현재 치료용 생물의제의 상업적 개발에 종사하는 상하이 생물제품 연구소의 직원입니다.
이 연구는 상하이 과학기술위원회(23S11901100)의 지원을 받았습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| BCFtools | Samtools 프로젝트 | N/A | 버전 1.21. 변이 호출 및 VCF 조작. URL: https://github.com/samtools/bcftools |
| Bedtools | Quinlan 랩 | N/A | 버전 2.31.1. 게놈 산술 연산. URL: https://github.com/arq5x/bedtools2 |
| Biopython | Biopython 프로젝트 | N/A | 버전 1.85. 분자 생물학용 Python 도구. URL: https://www.biopython.org |
| BWA-MEM | GitHub (lh3/bwa) | N/A | 버전 0.7.18. DNA-seq 정렬. URL: https://github.com/lh3/bwa |
| CADRES 소스 코드 | GitHub (junsun-hash/CADRES) | N/A | 버전 1.0.0. CADRES 파이프라인 스크립트. URL: https://github.com/junsun-hash/CADRES |
| Conda 또는 Miniconda | Anaconda Inc. | N/A | 버전 23.1. 패키지 및 환경 관리자. URL: https://docs.conda.io/en/latest/miniconda.html |
| dbSNP GRCh38 VCF | NCBI | N/A | 빌드 155. 공통 생식선 변이 데이터베이스. URL: https://ftp.ncbi.nih.gov/snp/ |
| GATK4 | Broad Institute | N/A | 버전 4.3.0.0. 게놈 분석 툴킷. URL: https://github.com/broadinstitute/gatk |
| Git | 소프트웨어 자유 재단 | N/A | 버전 2.39. 버전 관리 시스템. URL: https://git-scm.com |
| gnomAD GRCh38 VCF | Broad Institute | N/A | 버전 3.1. 인구 대립유전자 빈도. URL: https://gnomad.broadinstitute.org |
| GTF 주석 파일 | Ensembl | N/A | 릴리스 109. GRCh38의 유전자 주석. URL: https://www.ensembl.org |
| Human reference genome GRCh38 | Ensembl/UCSC | N/A | 릴리스 109. 참조 게놈 어셈블리. URL: https://www.ensembl.org 또는 https://hgdownload.soe.ucsc.edu |
| Linux 워크스테이션 또는 서버 | 다양한 | N/A | Ubuntu 20.04. x86_64 아키텍처 필요. URL: https://ubuntu.com |
| pblat | UCSC Genome Browser | N/A | 버전 2.5.1. 병렬 BLAT 재정렬. URL: https://github.com/ucscGenomeBrowser/kent |
| Picard | Broad Institute | N/A | 버전 2.20.8. NGS 데이터 조작. URL: https://github.com/broadinstitute/picard |
| Python | Python 소프트웨어 재단 | N/A | 버전 3.9.19. 프로그래밍 언어. URL: https://www.python.org |
| R | R 재단 | N/A | 버전 4.5.2. 통계 컴퓨팅. URL: https://www.r-project.org |
| R 패키지: forcats | CRAN | N/A | 버전 1.0.0. 요인 조작. URL: https://cran.r-project.org/package=forcats |
| R 패키지: ggplot2 | CRAN | N/A | 버전 4.0.1. 데이터 시각화. URL: https://cran.r-project.org/package=ggplot2 |
| R 패키지: ggrepel | CRAN | N/A | 버전 0.9.5. 텍스트 레이블 반발. URL: https://cran.r-project.org/package=ggrepel |
| R 패키지: lme4 | CRAN | N/A | 버전 1.1.35. 선형 혼합 효과 모델. URL: https://cran.r-project.org/package=lme4 |
| R 패키지: readr | CRAN | N/A | 버전 2.1.5. 빠른 파일 읽기. URL: https://cran.r-project.org/package=readr |
| R 패키지: stringr | CRAN | N/A | 버전 1.6.0. 문자열 조작. URL: https://cran.r-project.org/package=stringr |
| REDIportal 참조 | 볼로냐 대학교 | N/A | 버전 2.0. A-to-I RNA 편집 사이트 데이터베이스. URL: http://srv00.recas.ba.infn.it/atlas/ |
| RefGene 주석 | UCSC Table Browser | N/A | 릴리스 109. 유전자 구조 주석. URL: https://genome.ucsc.edu/cgi-bin/hgTables |
| Samtools | Samtools 프로젝트 | N/A | 버전 1.21. BAM 파일 조작. URL: https://github.com/samtools/samtools |
| STAR aligner | GitHub (alexdobin/STAR) | N/A | 버전 2.7.11b. RNA-seq 정렬. URL: https://github.com/alexdobin/STAR |