方法文章

使用校准差分RNA编辑扫描仪高精度检测RNA编辑位点

DOI:

10.3791/71148

2026年6月23日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议描述了校准差分RNA编辑扫描器(CADRES)的使用,这是一种计算流程,集成了DNA–RNA联合变异调用、信号优化的重新校准和复制感知的统计建模,以高精度识别差分RNA编辑位点。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

准确描述RNA编辑仍具技术挑战,因为必须将真正的转录后改变与基因组变异和测序伪影区分开来。这种困难在由APOBEC酶催化的胞苷转尿苷编辑中尤为明显,其中DNA和RNA的混合变化会遮蔽真实的编辑信号。校准差分RNA编辑扫描仪(CADRES)通过集成DNA–RNA变异查询和有针对性的真实编辑签名保存,提供了结构化的计算框架,以应对这些局限性。该协议介绍了CADRES的工作流程,包括数据准备、联合RNA变体调用、保持信号的碱基质量重新校准、伪影过滤以及不同实验条件下对RNA编辑的差别评估。CADRES支持配对RNA测序和全基因组或全外显子测序,并进行生物复制。 多阶段过滤策略,包括均聚物去除和基于PBLAT的并源筛查,系统地减少假阳性,同时保持低频编辑事件。通过结合校准与复制感知建模,CADRES 提高了 RNA 编辑分析的精度和可重复性,使得在不同生物环境中的编辑动态得以探究。与既有方法相比,CADRES 旨在提高 RNA 编辑检测的精度,特别是针对 APOBEC 介导的 C-to-U 事件。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

RNA编辑构成了转录后调控的动态层,使RNA转录本中能够实现特定位点的核苷酸替换,而不改变底层DNA序列。在多细胞动物中,由ADAR酶介导的腺苷转肌苷(A>I)脱氨是主要形式,有助于转录本多样化、mRNA稳定性、先天免疫调节和神经元功能1,2。胞苷转尿苷(C>U)(以下在生物学语境下称为“C>U”;在测序语境中称为“C>T”)脱氨,由APOBEC家族成员催化,与这些通路并行,涉及脂质代谢、病毒限制、诱变以及免疫和癌症生物学中新兴的调控作用 3,4,5,6,7最新研究表明,包括APOBEC1、APOBEC3A和APOBEC3B(A3B)在内的多种APOBEC酶,能够在生理和病理情境下催化RNA编辑(3,4,7,8,9,10)。APOBEC3酶还诱导DNA编辑,产生重叠的突变特征,使RNA编辑与基因组变异8,10,11,12的区分变得复杂。

下一代测序技术使得全转录组范围内潜在的RNA编辑位点识别成为可能,但区分真正的编辑与基因组SNV或技术噪声仍然困难。A>I和C>U事件在cDNA文库中以A>G和C>T取代的形式出现,可能因误引、聚合酶错误、定位伪影以及特定情境表达变化而扰。公共资源如REDIportal13,记录了数百万个A>I站点,而C>U注释则稀少,反映了生物学和分析上的限制。因此,可靠识别C>U编辑——尤其是跨条件变化——仍是一个未被满足的分析需求。

本文提出的方法——校准差分RNA编辑扫描仪(CADRES)——的总体目标是精确识别RNA上的差异变异(DVR):即在两个或多个定义条件下编辑深度发生统计显著变化的编辑位点14。在制定该协议时,我们试图解决两个长期存在的障碍。首先,必须将真正的RNA编辑与DNA编码的变异区分开来。其次,编辑差异必须在生物复制的RNA-seq数据集中以统计稳健的方式量化。CADRES 的核心创新在于将联合 DNA/RNA 变体呼叫与基于碱基质量评分再校准(BQSR)期间的 RNA 变体校准处理相结合。这种“增强再校准”策略在BQSR期间保留了新发现的RNA编辑位点,从而防止系统性质量下降,从而降低低频编辑的灵敏度15,16,17。这种方法减少了假阴性,并提升了特异性,相较于仅依赖不完整RNA编辑数据库的管道。

CADRES处于一系列针对RNA编辑分析不同方面的方法体系中。仅RNA变异组的SNPiR18和RVboost19滤镜伪影;VaDiR20 包含 DNA–RNA 比较,但不建模复制结构;rMATS-DVR21 执行基于 GLMM 的差分检测,但完全依赖 RNA-seq;JACUSA/JACUSA222,23支持复制感知检测,但不包含联合DNA–RNA询问或重新校准策略。CADRES 统一了可复制的统计建模、联合 DNA/RNA 变体调用以及针对新生编辑位点的再校准,提供了单一工作流程,优化检测条件依赖的 RNA 编辑——包括与 APOBEC活性 101112 相关的 C>U 事件。

在此背景下,当其实验系统满足以下条件时,用户可能认为CADRES是合适的。首先,可以从同一样本中进行配对的RNA测序和全基因组或全外显子测序,从而实现RNA衍生事件与DNA编码变异的严格划分。其次,生物学问题涉及RNA编辑在不同条件下的变化——如酶诱导、环境压力、发育阶段或疾病状态——在这些条件下,复制体间等位基因特异深度的统计建模至关重要。第三,研究者希望在C>U编辑检测中提高特异性,因为区分RNA事件与APOBEC驱动的DNA诱变至关重要。CADRES 在 APOBEC 活性诱导 RNA 和 DNA 编辑的系统中尤为重要,如诱导A3B 模型 101112 所示,且传统仅 RNA 方法因混杂 SNV 或重复序列伪影导致假阳性率过高。

CADRES具有多项实际优势。其联合的DNA/RNA变异呼叫减少了SNV驱动的假阳性。增压重新校准保留了真实的编辑信号,包括参考数据库中缺失的新事件。rMATS 衍生的 GLMM 提供了一个统计原则性的框架,用于跨复制的差分编辑分析。这些特性共同构成了一个经过校准、高精度的平台,用于研究实验和疾病环境下的动态RNA编辑。在我们之前的研究14中,CADRES通过计算机模拟数据集和现实世界诱导A3B细胞模型,严格与既有的RNA编辑检测方法进行基准测试。在计算机模拟评估中,CADRES 在重复数据中稳定取得 0.85–0.95 的精度和 0.92–0.98 的准确率。CADRES 的整体工作流程如 图 1 所示。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议描述了一种纯计算生物信息学工作流程,用于利用CADRES框架识别C>U RNA编辑事件。所有步骤均通过命令行在Linux环境中完成。仅使用公开的测序数据集,不涉及人类或脊椎动物受试者。

1. 环境设置与软件安装

注意:CADRES 工作流程的最低计算需求如下:CPU ≥ 8 核(建议 16 核)、32 GB 内存≥32 GB(全基因组数据集建议 64 GB)、磁盘空间≥ 100 GB。

  1. 确认有Linux操作系统可用。打开终端窗口,确保当前用户环境中有安装权限。
  2. 如果系统上还没有Conda包管理器,可以安装它。可从其官方网站下载最小版Conda发行版安装包。按照屏幕上的指示执行安装脚本。
  3. 通过输入以下命令确认Conda是否激活,并确保该命令打印的版本号有效。
    $ conda ——版本
  4. 为CADRES工作流程创建一个工作目录。请使用以下方式进入该目录:
    $ CD /path/to/working_directory
  5. 通过执行以下方式下载CADRES源代码:
    $ git clone --branch v1.0.0 https://github.com/junsun-hash/CADRES
  6. 通过运行以下程序进入克隆目录:
    $ cd cadres(卡德雷斯)
  7. 使用CADRES仓库中提供的environment.yml文件创建专用的Conda环境。执行以下命令,让安装过程顺利完成。
    $ conda env create -f environment.yml
  8. 通过输入以下命令激活新创建的环境。通过检查终端提示符是否显示环境名称,确认环境已被激活。
    $ conda 启动CADRES
  9. 确认所需的命令行工具已正确安装。执行以下每个命令,确认它们返回的是版本号而非错误信息:
    $ Python --version
    $ samtools --版本
    $ gatk ——救命
    $ 床上工具——版本
    $ 布拉特

    注意:CADRES 环境中包含的工具集可能会根据 environment.yml 文件的更新有所不同。如果缺少工具,请根据需要重建环境或更新依赖列表。
  10. 确保磁盘空间充足。通过输入以下方式确认至少有100 GB的空闲空间用于参考基因组、比对索引和中间BAM文件:
    $ df -h
  11. 通过创建一个测试文件,确认所有工作目录、输出目录和临时目录都支持写权限:
    $ 触碰test_file.txt
  12. 之后请输入以下方式删除该文件:
    $ RM test_file.txt

2. 数据准备

注:本协议所用的代表性数据集包括:HEK293T个含有多西环素诱导A3B–GFP细胞;WGS排名第33×;链特异性对端RNA测序(2×150碱基对,≥60 M读段/样本);n = 每种病症3次生物复制(DMSO与多西环素72小时)。完整数据:SRA PRJNA1211186。CDRES 仓库中提供了 chr22 演示子集。

CADRES 要求:(i) WGS(≥33×)或 WES(≥33×);(ii) 链特异性、成对末端RNA测序(每个样本≥6000万次读段);(iii)两种实验条件,每个有≥2个生物复制体。

  1. 准备参考基因组和注释。
    1. 可从Ensembl或类似仓库下载参考基因组(FASTA)和GTF注释文件。推荐的参考基因组为Ensembl GRCh38初级组装:https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/,推荐的GTF注释为GENCODE版本45:
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/。
    2. 索引参考FASTA:
      $ Samtools faidx FASTA_FILE.fa
      确保染色体命名规范(例如,“chr1”与“1”)在所有参考材料中保持一致。
  2. 获取测序数据。
    1. 获取深度为≥33×的DNA测序FASTQ文件(WGS或WES)。
    2. 获取链特异性、成对端RNA测序FASTQ文件,每个样本有≥6000万次读取,涵盖两种生物条件,且每组至少有两次生物复制。
  3. 使用BWA-MEM比对DNA测序读段。
    1. 建立BWA指数:
      $ BWA指数Homo_sapiens。GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. 对齐并转换为BAM:
      $ bwa mem -R '@RG\tID:ID\tPL:platform\tLB:library\tSM:sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz |SamTools View -b > wgs.bam
  4. 用STAR比对RNA测序读段。
    1. 生成STAR基因组索引:
      $ STAR --runMode genomeGenerate \
      ——基因组FastaFiles Homo_sapiens。GRCh38.dna.primary_assembly.fa \
      ——基因组导演STAR_index \
      --sjdbGTFfile Homo_sapiens。GRCh38.gtf
    2. 比对RNA读段
      $ 星 \
      ——基因组导演STAR_index \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens。GRCh38.gtf \
      --出SAM类型 BAM 未排序 \
      --出SAMmapq唯一60 \
      --outFileNamePrefix pass1_

      注意:这会产生一个拼接连接文件(pass1_SJ.out.tab),包含注释和新颖连接。
    3. 重新生成STAR基因组索引,纳入新连接点:
      $ 猫 pass1_SJ.out.tab > SJ_all.tab
      $ STAR --runMode genomeGenerate \
      ——基因组FastaFiles Homo_sapiens。GRCh38.dna.primary_assembly.fa \
      ——基因组导演STAR_index_2pass \
      --sjdbGTFfile Homo_sapiens。GRCh38.gtf \
      --sjdbFileChrStartEnd SJ_all.tab
    4. 使用更新后的索引进行第二遍对齐:
      $ 星 \
      ——基因组导演STAR_index_2pass \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens。GRCh38.gtf \
      --出SAM类型 BAM 排序坐标 \
      --出SAMmapq唯一60 \
      --outFileNamePrefix output_name
  5. 准备辅助参考资源。
    1. (推荐阅读)获取dbSNP VCF
      从NCBI FTP服务器下载人类GRCh38 dbSNP VCF(例如dbSNP build 150):
      https://ftp.ncbi.nih.gov/snp/latest_release/VCF/ 将下载的文件(例如,dbsnp_150.vcf.gz)放入工作目录。
      注意:dbSNP中的RNA衍生条目(molType=“cDNA”)可能会掩盖真实的RNA编辑位点。排除它们的方法包括:
      $ bcftools view -i 'INFO/molType!=“cDNA”' dbsnp.vcf.gz -Oz -o dbsnp_no_cDNA.vcf.gz
    2. (推荐阅读)排序dbSNP VCF
      将VCF排序,使其与参考基因组和GATK兼容:
      $ gatk SortVcf \
      -我dbsnp_150.vcf.gz\
      -哦dbsnp_150.sorted.vcf.gz \

      ——序列字典Homo_sapiens。GRCh38.dict
    3. (推荐阅读)索引已排序的dbSNP VCF
      为已排序的 dbSNP VCF 创建一个索引:
      $ gatk IndexFeatureFile -I dbsnp_150.sorted.vcf.gz
      注意:需要匹配的参考词典。如果文件Homo_sapiens。缺少 GRCh38.dict,生成方式如下:
      $ gatk CreateSequenceDictionary \
      ——R·Homo_sapiens。GRCh38.dna.primary_assembly.fa \
      ——哦Homo_sapiens。GRCh38.dna.primary_assembly.dict
    4. (推荐阅读)获取gnomAD生殖系VCF
      从以下网站下载GRCh38 gnomAD生殖系变异位点VCF:https://gnomad.broadinstitute.org/downloads 使用适合该管线的基因组VCF(例如,gnomad.genomes.vX.X.sites.vcf.gz)。
    5. (推荐阅读)排序gnomAD VCF
      使用相同的参考字典对 gnomAD VCF 进行排序以确保兼容性:
      $ gatk SortVcf \
      -我gnomad.vcf.gz \
      -哦gnomad.sorted.vcf.gz\
      ——序列字典Homo_sapiens。GRCh38.dict
    6. (推荐阅读)索引已排序的 gnomAD VCF
      为已排序的 gnomAD VCF 创建一个索引:
      $ gatk IndexFeatureFile -I gnomad.sorted.vcf.gz
      注意:在运行SortVcf前,请确保染色体命名(例如“chr1”与“1”)与参考FASTA一致。
  6. 获取已知的RNA编辑参考。
    注意:适用于 CADRES 的兼容 REDIportal 参考文件(rediportal.txt)在 CADRES 仓库中整理,可直接从以下平台下载:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0。该文件用于注释步骤3中已知的编辑事件。
  7. 准备RefGene格式的基因注释。下载RefGene注释(例如UCSC的refGene.txt.gz)。必要时减压,确保染色体名称与参考基因组中的染色体命名相符。
    注意:适合CADRES的示例已在CADRES仓库中整理,可直接从以下平台下载:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0

3. CADRES 分析工作流程的执行

注意:第3节在Linux终端中执行,且已激活CADRES Conda环境。

  1. 校准与增压重新校准
    注意:第一步标准化BAM文件并进行Boost重新校准——这是一种增强型BQSR,结合dbSNP、gnomAD及一组初步RNA编辑候选物,以保留真实的编辑信号。列出所有RNA BAM文件,中间有空格分隔。输出:重新校准的BAM(后缀:_recalibration.bam)和Boost候选点。
    1. 执行步骤3.1:
      $ Python pipeline_step1_calibration.py \
      --rna_bams /path/to/rna_sample1.bam /path/to/rna_sample2.bam ... \
      --dna_bam /path/to/wgs_normal.bam \
      --基因组 /path/to/hg38.fa \
      --known_snv /path/to/dbsnp.sorted.vcf.gz \
      --output_dir ./output/step1_calibration \
      ——前缀project_demo

      注意:增强候选物由初步的联合DNA-RNA Mutect2呼叫构建(区域4最大事件,仅PASS滤波器;无额外AF/质量阈值)。均聚物和重复过滤在第3.2步中进行。
  2. 变体呼叫、污染估计与过滤
    注意:第3.2步执行联合DNA-RNA变异呼叫并通过gnomAD进行污染估计,然后通过自聚物环境和PBLAT重新比对筛选候选物。输出:{前缀}.final.vcf。
    1. 执行步骤3.2:
      $ Python 的 pipeline_step2_variant_calling.py \
      --rna_bams ./output/step1_calibration/rna_sample1_split_recalibration.bam ... \
      --dna_bam ./output/step1_calibration/DNA_processed_recalibration.bam \
      --基因组 /path/to/hg38.fa \
      --游牧者 /路径/去/gnomad.sorted.vcf.gz \
      --output_dir ./output/step2_variant_calling \
      ——前缀project_demo

      注意:这一步产生最终严格过滤的变异呼叫集(project_demo.final.vcf),代表所有样本中高置信度的RNA-DNA差异。关键参数:Mutect2 --最小-中位-碱基质量12,--max-events-in region 4;PBLAT 小基数 5;所有设备均在管道脚本中预先配置。
  3. 统计检验与函数注释
    注意:第3.3步使用改编自rMATS的GLMM(Benjamini-Hochberg FDR修正)定量差异RNA编辑,并对每个位点标注基因区域、基因符号及已知编辑状态。输出:{前缀}_Result.txt(带有P值和FDR的DVR)。
    PBLAT重比对滤波器去除了映射到多个基因组位点的候选者,增强了重复区域的特异性。其内部THREAD_COUNT由pipeline_step2_variant_calling.py中的 --threads 标志控制。
    1. 执行步骤3.3:
      $ Python pipeline_step3_statistical_test.py \
      --group1_rna_bams ./output/step1_calibration/control_rep1.bam ... \
      --group2_rna_bams ./output/step1_calibration/treated_rep1.bam ... \
      --final_vcf ./output/step2_variant_calling/project_demo.final.vcf \
      --基因组 /path/to/hg38.fa \
      --known_snv /path/to/dbsnp.sorted.vcf.gz \
      --known_editing /path/to/rediportal.txt \
      --gene_anno /path/to/refGene.txt \
      --output_dir ./output/step3_statistical_test \
      ——标签 控制处理

      注意:关键参数:samtools mpileup -q 30(最小映射质量),-Q 17(最低基础质量);rMATS-GLMM似然比检验,Δψ截断率=0.0001,二项logit关联,具有重复感知的多元正态惩罚(rho = 0.9);本杰米尼-霍赫伯格·罗斯福更正;所有这些都已在管道脚本中预先配置好
      所有三个流水线步骤都支持通过 --threads 标志进行多线程执行(默认:每步 4 个)。第二步还接受 --contamination_threads(默认:2)。

4. 结果检查与可视化

  1. CADRES 工作流程完成后,导航到输出目录。主要结果文件{前缀}_Result.txt列出了所有检测到的RNA差异变异(DVR),包括基因组坐标、等位基因、复制级等位基因计数、编辑分数、组间差异及相关统计指标(P值和FDR)。还包括基因级注释(基因符号、区域、链、变异类型、已知SNP/编辑状态)。配套的摘要文件{前缀}_Result_summary.txt提供了每种替换类型的计数及其分类,包括SNP DVR、已知的RNA编辑DVR和新型DVR。
  2. (可选)通过运行后期分析脚本生成标准可视化。打开R会话并输入:
    R主机:
    来源(“Post-analysis.R”)
    脚本 Post-analysis.R 包含在 https://github.com/junsun-hash/CADRES/。
  3. 会出现文件选择对话框;选择{前缀}_Result.txt。该脚本产生六个巴布亚新几内亚手办。
    注意:文件选择对话框需要桌面R会话。在无头服务器上,直接编辑input_file变量(Post-analysis.R 的第 10 行),并运行 Rscript Post-analysis.R。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

为了在现实实验条件下评估CADRES,我们使用了293T细胞中的诱导APOBEC3B(A3B)系统。一种表达A3B-GFP的多西环素响应型慢病毒构建体被引入293T细胞,并与普罗霉素选中稳定整合物。多西环素诱导72小时后,A3B-GFP表达强劲,GFP荧光和A3B mRNA水平升高得到证实。匹配诱导和非诱导样本随后对DNA和RNA进行均匀提取、文库制备和测序,以确保观察到的RNA-DNA差异反映的是真实依赖A3B的编辑,而非技术噪声。完整的原始数据集可在SRA注册PRJNA1211186中提供,并在CADRES GitHub仓库(https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0)中提供了染色体22段(chr22:28,000–30,000 kb)子集,供演示和测试使用。

执行后,CADRES 生成 {前缀}_Result.txt包含 DVR 坐标,编辑分数、P 值和 FDR。预期输出显示:(i) 与生物编辑活动一致的DVR计数;(ii)过滤漏斗逐渐减...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

这里介绍的CADRES工作流程提供了一种校准且内部一致的策略,用于检测具有高特异性的差异RNA编辑事件,特别是由APOBEC酶催化的C>U脱氨。协议中的几个步骤对其准确性至关重要。匹配的基因组和转录组测序对于区分真实的RNA编辑与潜在的DNA多态性至关重要,而增强再校准程序则防止真实RNA变异在基础质量评分重校时被错误惩罚。同样重要的是序列组成和定位滤波器,以减少因同聚物运行或多重定位读段产生的假阳性呼叫,以及使用链分离等位基因深度测量。差分编辑的可靠识别还依赖于rMATS广义线性混合模型中复制结构的正确定义。

尽管CADRES设计为端到端流水线,但若干组件仍可根据实际限制进行调整。在无法生成全面基因组数据的情况下,高深度外显子测序可以替代全基因组测序,但需要注意的是浅层或亚克隆突变可能仍未被充分解析。处理高度重复转录本或表现出广泛聚类编辑的生物系统的用户,可能需要适度调整变异呼叫参数或更严格的比对过滤器。排查通常包括验证链注释、确保已知位置列表的正确构建以进行重新校准,以及确认所有复制序列的测序深度是否足够。

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S.、Z.D.和C.Z.均为上海生物制品研究院员工,该机构目前从事治疗性生物制剂的商业开发。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究由上海科技委员会资助(23S11901100)。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
BCFtoolsSamtools项目N/A版本 1.21。变异调用和VCF操作。URL: https://github.com/samtools/bcftools
BedtoolsQuinlan实验室N/A版本 2.31.1。基因组算术操作。URL: https://github.com/arq5x/bedtools2
BiopythonBiopython项目N/A版本 1.85。分子生物学的Python工具。URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/A版本 0.7.18。DNA序列比对。URL: https://github.com/lh3/bwa
CADRES源代码GitHub (junsun-hash/CADRES)N/A版本 1.0.0。CADRES管道脚本。URL: https://github.com/junsun-hash/CADRES
Conda或MinicondaAnaconda Inc.N/A版本 23.1。包和环境管理器。URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/A版本 155。常见的生殖细胞变异数据库。URL: https://ftp.ncbi.nih.gov/snp/
GATK4Broad InstituteN/A版本 4.3.0.0。基因组分析工具包。URL: https://github.com/broadinstitute/gatk
GitSoftware Freedom ConservancyN/A版本 2.39。版本控制系统。URL: https://git-scm.com
gnomAD GRCh38 VCFBroad InstituteN/A版本 3.1。人口等位基因频率。URL: https://gnomad.broadinstitute.org
GTF注释文件EnsemblN/A版本 109。GRCh38的基因注释。URL: https://www.ensembl.org
人类参考基因组GRCh38Ensembl/UCSCN/A版本 109。参考基因组组装。URL: https://www.ensembl.org 或 https://hgdownload.soe.ucsc.edu
Linux工作站或服务器多种N/AUbuntu 20.04。需要x86_64架构。URL: https://ubuntu.com
pblatUCSC基因组浏览器N/A版本 2.5.1。并行BLAT重对齐。URL: https://github.com/ucscGenomeBrowser/kent
PicardBroad InstituteN/A版本 2.20.8。NGS数据操作。URL: https://github.com/broadinstitute/picard
PythonPython软件基金会N/A版本 3.9.19。编程语言。URL: https://www.python.org
RR基金会N/A版本 4.5.2。统计计算。URL: https://www.r-project.org
R包: forcatsCRANN/A版本 1.0.0。因子操作。URL: https://cran.r-project.org/package=forcats
R包: ggplot2CRANN/A版本 4.0.1。数据可视化。URL: https://cran.r-project.org/package=ggplot2
R包: ggrepelCRANN/A版本 0.9.5。文本标签排斥。URL: https://cran.r-project.org/package=ggrepel
R包: lme4CRANN/A版本 1.1.35。线性混合效应模型。URL: https://cran.r-project.org/package=lme4
R包: readrCRANN/A版本 2.1.5。快速文件读取。URL: https://cran.r-project.org/package=readr
R包: stringrCRANN/A版本 1.6.0。字符串操作。URL: https://cran.r-project.org/package=stringr
REDIportal参考博洛尼亚大学N/A版本 2.0。A-to-I RNA编辑位点数据库。URL: http://srv00.recas.ba.infn.it/atlas/
RefGene注释UCSC表浏览器N/A版本 109。基因结构注释。URL: https://genome.ucsc.edu/cgi-bin/hgTables
SamtoolsSamtools项目N/A版本 1.21。BAM文件操作。URL: https://github.com/samtools/samtools
STAR对齐器GitHub (alexdobin/STAR)N/A版本 2.7.11b。RNA-seq对齐。URL: https://github.com/alexdobin/STAR

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

RNA APOBEC C to U RNA RNA

相关文章