本方案描述了校准型差异RNA编辑扫描仪(CADRES)的使用方法,这是一种计算流程,通过整合DNA-RNA联合变异检测、信号优化重校准以及考虑重复实验的统计建模,以高精度识别差异RNA编辑位点。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本方案描述了校准型差异RNA编辑扫描仪(CADRES)的使用方法,这是一种计算流程,通过整合DNA-RNA联合变异检测、信号优化重校准以及考虑重复实验的统计建模,以高精度识别差异RNA编辑位点。
准确界定RNA编辑在技术上仍然具有挑战性,因为必须将真实的转录后修饰与基因组变异及测序假象区分开来。这一困难在APOBEC酶催化的胞苷向尿苷(C-to-U)编辑中尤为显著,其中DNA与RNA的混合变化掩盖了真实的编辑信号。校准型差异RNA编辑扫描器(Calibrated Differential RNA Editing Scanner, CADRES)提供了一种结构化的计算框架,通过整合DNA–RNA变异分析和对真实编辑特征的靶向保留,以克服这些局限性。本方案介绍了CADRES的工作流程,包括数据准备、联合RNA变异检测、信号保留型碱基质量重校准、假象过滤,以及在不同实验条件下对RNA编辑进行差异分析。CADRES支持配对的RNA-seq与全基因组或全外显子组测序,并要求具备生物学重复。 该方法采用多阶段过滤策略,包括同聚物区域去除和基于PBLAT的旁系同源筛选,系统性地减少假阳性结果,同时保留低频编辑事件。通过将校准步骤与考虑重复样本的建模方法相结合,CADRES提高了RNA编辑分析的精确性和可重复性,从而能够探究多种生物学背景下编辑动态的变化。与现有方法相比,CADRES旨在提升RNA编辑检测的准确性,尤其适用于APOBEC介导的C-to-U编辑事件。
RNA编辑构成了转录后调控的一个动态层次,能够在不改变DNA序列的情况下实现RNA转录本中特定位点的核苷酸替换。在后生动物中,由ADAR酶介导的腺苷向肌苷(A>I)脱氨是主要形式,参与转录本多样化、mRNA稳定性维持、先天免疫调节以及神经功能1,2。由APOBEC家族成员催化的胞苷向尿苷(C>U) (在生物学语境中下文简称为"C>U";在测序语境中称为"C>T")脱氨作用与这些通路并行存在,参与脂质代谢、病毒限制、诱变过程,并在免疫和癌症生物学中发挥新兴的调控作用3,4,5,6,7。近期研究表明,多种APOBEC酶(包括APOBEC1、APOBEC3A和APOBEC3B(A3B))在生理和病理条件下均可催化RNA编辑3,4,7,8,9,10。APOBEC3酶还可诱导DNA编辑,产生与RNA编辑重叠的突变特征,从而增加了区分RNA编辑与基因组变异的难度8,10,11,12。
新一代测序技术已实现转录组范围内潜在RNA编辑位点的鉴定,但区分真实的编辑事件与基因组SNV或技术噪声仍然具有挑战性。A>I和C>U事件在cDNA文库中表现为A>G和C>T的替换,可能因引物错配、聚合酶错误、比对假象以及特定序列背景下的表达变化而产生干扰。公共数据库如REDIportal13已收录数百万个A>I编辑位点,而C>U的注释仍较为稀少,这反映了生物学和分析方法上的双重限制。因此,可靠地鉴定C>U编辑——尤其是不同条件下发生的编辑变化——仍是一个尚未满足的分析需求。
本文所介绍方法——校准差异性RNA编辑扫描仪(Calibrated Differential RNA Editing Scanner, CADRES)的总体目标,是精确定位差异性RNA变异位点(Differential Variants on RNA, DVRs):即在两个或多个特定条件下,编辑深度发生统计学显著变化的RNA编辑位点。14在开发本方案时,我们力求解决两个长期存在的障碍。第一, 真正有效的 RNA编辑必须与DNA编码的变异区分开来。其次,需要在生物学重复的RNA-seq数据集之间以统计稳健的方式量化编辑差异。CADRES的核心创新在于将DNA/RNA联合变异检测与在碱基质量评分重校准(BQSR)过程中对RNA变异的校准化处理相结合。这种“增强重校准”策略在BQSR过程中保留新发现的RNA编辑位点,从而防止对低频编辑位点因系统性质量降级而导致的检测灵敏度下降。15,16,17该方法相较于仅依赖不完整RNA编辑数据库的分析流程,可减少假阴性结果并提高特异性。
CADRES 位于一系列针对 RNA 编辑分析不同方面的研究方法之中。SNPiR18 和 RVboost19 可从仅基于 RNA 的变异集合中过滤人工假象;VaDiR20 引入了 DNA–RNA 比对分析,但未对重复实验结构进行建模;rMATS-DVR21 采用基于广义线性混合模型(GLMM)的差异检验方法,但完全依赖 RNA-seq 数据;而 JACUSA/JACUSA222,23 支持考虑重复实验的检测,却未整合联合 DNA–RNA 分析或校准优化策略。CADRES 将考虑重复实验的统计建模、联合 DNA/RNA 变异检测以及富集新发编辑位点的再校准策略统一起来,提供了一套优化的单一流程,用于检测依赖于特定条件的 RNA 编辑事件——包括与 APOBEC 活性相关的 C>U 事件10,11,12。
在此背景下,当实验体系满足以下条件时,用户可考虑采用 CADRES。首先,已有来自相同样本的配对 RNA 测序与全基因组或全外显子组测序数据,从而能够严格区分源自 RNA 的编辑事件与 DNA 编码的变异。其次,所研究的生物学问题涉及不同条件下 RNA 编辑的变化——例如酶的诱导、环境应激、发育阶段或疾病状态——此时对重复样本中等位基因特异性测序深度进行统计建模至关重要。第三,研究者希望提高 C>U 编辑检测的特异性,而准确区分 RNA 编辑事件与 APOBEC 驱动的 DNA 突变尤为关键。CADRES 在 APOBEC 活性同时引发 RNA 与 DNA 编辑的体系中尤其具有价值,如可诱导 A3B 模型中所示10,11,12,而在这些体系中,传统的仅依赖 RNA 的方法由于受到混淆性单核苷酸变异(SNVs)或重复序列干扰等因素影响,假阳性率显著升高。
CADRES 具有多项实用优势。其联合的 DNA/RNA 变异检测可减少由单核苷酸变异(SNV)驱动的假阳性结果。Boost 重校准能够保留真实的编辑信号,包括参考数据库中不存在的新颖编辑事件。基于 rMATS 的广义线性混合模型(GLMM)为跨重复样本的差异编辑分析提供了具有统计学依据的分析框架。这些特性共同构建了一个经过校准、高精度的平台,可用于在实验和疾病背景下研究动态 RNA 编辑。在我们之前的研究14中,CADRES 通过计算机模拟数据集和真实世界的可诱导 A3B 细胞模型,与现有的 RNA 编辑检测方法进行了严格基准测试。在计算机模拟评估中,CADRES 在不同重复数下始终实现了 0.85–0.95 的精确度得分和 0.92–0.98 的准确度得分。整体 CADRES 工作流程如图 1所示。
访问受限。请登录或开始试用以查看此内容。
本方案描述了一种完全基于计算的生物信息学工作流程,用于利用CADRES框架鉴定C>U RNA编辑事件。所有步骤均在Linux环境中通过命令行执行。仅使用公开可用的测序数据集,不涉及人类或脊椎动物受试者。
1. 环境设置与软件安装
注意:CADRES 工作流程的最低计算要求如下:CPU ≥ 8 核(推荐 16 核),RAM ≥ 32 GB(全基因组数据集推荐 64 GB),磁盘空间 ≥ 100 GB。
2. 数据准备
注意:本方案中使用的代表性数据集包括:含有强力霉素诱导型 A3B–GFP 的 HEK293T 细胞;33× 深度的全基因组测序(WGS);链特异性双端 RNA 测序(2×150 bp,每样本 ≥6000 万条读长);每种条件(DMSO 与强力霉素处理 72 小时)设置 n = 3 个生物学重复。完整数据:SRA PRJNA1211186。chr22 的演示子集已提供在 CADRES 数据库中。
CADRES 需要满足以下条件:(i) 全基因组测序(WGS,≥33×)或全外显子组测序(WES,≥33×);(ii) 链特异性的双端 RNA-seq(每个样本 ≥6000 万条 reads);(iii) 至少两个实验条件,每个条件包含 ≥2 个生物学重复。
CADRES 分析工作流程的执行
注意:第 3 节需在激活 CADRES Conda 环境的 Linux 终端中执行。
4. 结果检查与可视化
访问受限。请登录或开始试用以查看此内容。
为了在接近真实的实验条件下评估CADRES,我们在293T细胞中使用了可诱导的APOBEC3B(A3B)系统。将表达A3B-GFP的多西环素响应型慢病毒载体导入293T细胞,并用嘌呤霉素筛选获得稳定整合的细胞克隆。经多西环素诱导72小时后,A3B-GFP表达显著增强,GFP荧光信号及A3B mRNA水平升高均证实了这一点。随后,对经诱导与未诱导的配对样本进行统一的DNA和RNA提取、文库构建及测序,以确保所观察到的RNA-DNA差异反映的是真正的A3B依赖性编辑事件,而非技术性噪声。完整的原始数据集已存入SRA数据库,编号为PRJNA1211186;为便于演示和测试,部分22号染色体区域(chr22:28,000–30,000 kb)的数据子集也已上传至CADRES的GitHub代码仓库(https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0)。
运行后,CADRES 会生成包含 DVR 坐标、编辑分数、P 值和 FDR 的 {prefix}_Result.txt 文件。预期输出包括:(i) DVR 计数与生物学编辑活性一...
访问受限。请登录或开始试用以查看此内容。
本文介绍的CADRES工作流程提供了一种经过校准且内部一致的策略,可高特异性地检测差异性RNA编辑事件,尤其是由APOBEC酶催化的C>U脱氨反应。该方案中的多个步骤对其准确性至关重要。匹配的基因组和转录组测序对于区分真实的RNA编辑与潜在的DNA多态性必不可少,而提升重校准步骤则可防止在碱基质量分数重校准过程中错误地惩罚真实的RNA变异。同样重要的是序列组成和比对过滤步骤,它们可减少因同聚物重复序列或多向比对读段引起的假阳性结果,以及使用链特异性的等位基因深度测量方法。对差异编辑事件的可靠识别还依赖于在rMATS广义线性混合模型中正确设定重复结构。
尽管CADRES被设计为端到端的分析流程,但其多个组件可根据实际限制进行调整。在无法获得全面基因组数据的情况下,可使用高深度外显子组测序替代全基因组测序,但需注意浅层或亚克隆突变可能仍无法充分解析。对于具有高度重复转录本或存在广泛成簇编辑的生物体系的研究人员,可能需要对变异检测参数进行适度调整,或采用更严格的比对过滤条件。常见问题排查通常包括验证链注释的正确性、确保用于重校准的已知位点列表构建无误,以及确认所有重复样本中的测序...
访问受限。请登录或开始试用以查看此内容。
J.S.、Z.D. 和 C.Z. 是上海生物制品研究所的员工,该机构目前正从事治疗性生物制剂的商业化开发。
本研究由上海市科学技术委员会(23S11901100)资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| BCFtools | Samtools project | N/A | 版本 1.21。用于变异检测和 VCF 文件操作。URL: https://github.com/samtools/bcftools |
| Bedtools | Quinlan 实验室 | N/A | 版本 2.31.1。基因组算术操作工具。URL: https://github.com/arq5x/bedtools2 |
| Biopython | Biopython 项目 | N/A | 版本 1.85。用于分子生物学的 Python 工具。URL: https://www.biopython.org |
| BWA-MEM | GitHub (lh3/bwa) | N/A | 版本 0.7.18。用于 DNA-seq 比对。URL: https://github.com/lh3/bwa |
| CADRES 源代码 | GitHub (junsun-hash/CADRES) | N/A | 版本 1.0.0。CADRES 分析流程脚本。URL: https://github.com/junsun-hash/CADRES |
| Conda 或 Miniconda | Anaconda 公司 | N/A | 版本 23.1。软件包与环境管理工具。URL: https://docs.conda.io/en/latest/miniconda.html |
| dbSNP GRCh38 VCF | NCBI | N/A | 构建版本 155。常见种系变异数据库。URL: https://ftp.ncbi.nih.gov/snp/ |
| GATK4 | Broad 研究所 | N/A | 版本 4.3.0.0。基因组分析工具包。URL: https://github.com/broadinstitute/gatk |
| Git | 软件自由保护协会 | N/A | 版本 2.39。版本控制系统。URL: https://git-scm.com |
| gnomAD GRCh38 VCF | Broad 研究所 | N/A | 版本 3.1。群体等位基因频率数据库。URL: https://gnomad.broadinstitute.org |
| GTF 注释文件 | Ensembl | N/A | 发布版本 109。GRCh38 基因组的基因注释。URL: https://www.ensembl.org |
| 人类参考基因组 GRCh38 | Ensembl/UCSC | N/A | 发布版本 109。参考基因组组装。URL: https://www.ensembl.org 或 https://hgdownload.soe.ucsc.edu |
| Linux 工作站或服务器 | 多个供应商 | N/A | Ubuntu 20.04。需 x86_64 架构。URL: https://ubuntu.com |
| pblat | UCSC 基因组浏览器 | N/A | 版本 2.5.1。并行 BLAT 重比对工具。URL: https://github.com/ucscGenomeBrowser/kent |
| Picard | Broad 研究所 | N/A | 版本 2.20.8。NGS 数据处理工具。URL: https://github.com/broadinstitute/picard |
| Python | Python 软件基金会 | N/A | 版本 3.9.19。编程语言。URL: https://www.python.org |
| R | R 基金会 | N/A | 版本 4.5.2。统计计算环境。URL: https://www.r-project.org |
| R 包:forcats | CRAN | N/A | 版本 1.0.0。因子变量操作工具。URL: https://cran.r-project.org/package=forcats |
| R 包:ggplot2 | CRAN | N/A | 版本 4.0.1。数据可视化工具。URL: https://cran.r-project.org/package=ggplot2 |
| R 包:ggrepel | CRAN | N/A | 版本 0.9.5。文本标签避让工具。URL: https://cran.r-project.org/package=ggrepel |
| R 包:lme4 | CRAN | N/A | 版本 1.1.35。线性混合效应模型工具。URL: https://cran.r-project.org/package=lme4 |
| R 包:readr | CRAN | N/A | 版本 2.1.5。快速文件读取工具。URL: https://cran.r-project.org/package=readr |
| R 包:stringr | CRAN | N/A | 版本 1.6.0。字符串操作工具。URL: https://cran.r-project.org/package=stringr |
| REDIportal 参考数据库 | 博洛尼亚大学 | N/A | 版本 2.0。A-to-I RNA 编辑位点数据库。URL: http://srv00.recas.ba.infn.it/atlas/ |
| RefGene 注释 | UCSC Table Browser | N/A | 发布版本 109。基因结构注释。URL: https://genome.ucsc.edu/cgi-bin/hgTables |
| Samtools | Samtools 项目 | N/A | 版本 1.21。BAM 文件操作工具。URL: https://github.com/samtools/samtools |
| STAR 比对工具 | GitHub (alexdobin/STAR) | N/A | 版本 2.7.11b。用于 RNA-seq 比对。URL: https://github.com/alexdobin/STAR |