该方案提供了使用二甲基硫酸酯对RNA进行修饰以开展突变谱分析实验的操作指导。内容包括 体外 和 体内 采用两种不同的文库构建方法进行检测。
方法文章
该方案提供了使用二甲基硫酸酯对RNA进行修饰以开展突变谱分析实验的操作指导。内容包括 体外 和 体内 采用两种不同的文库构建方法进行检测。
RNA结构在几乎所有生物学过程中的作用日益凸显,尤其是在过去十年中。然而,传统的RNA结构解析方法,如RNA晶体学或冷冻电镜(cryo-EM),已难以跟上该领域快速发展的步伐,也无法满足高通量分析的需求。基于测序的二甲基硫酸酯突变谱分析(DMS MaPseq)是一种通过检测碱基对DMS的反应活性来推断RNA结构的测序方法。当腺苷的N1位氮原子和胞嘧啶的N3位氮原子处于未配对状态时,DMS会对其沃森-克里克(Watson-Crick)面进行甲基化修饰。使用耐热的II型内含子逆转录酶(TGIRT-III)对经修饰的RNA进行逆转录,可使甲基化碱基在cDNA中以突变形式被引入。对所得cDNA进行测序并将其比对至参考转录本后,各碱基的相对突变率即可反映该碱基的配对状态 "状态" 作为成对或未成对。尽管DMS反应性具有较高的信噪比 体外 并且在细胞中,该方法对操作步骤中的偏差较为敏感。为减少此类偏差,本文提供了一种在细胞内使用DMS进行RNA处理的方案以及 体外 转录的RNA
自从发现RNA具有结构1,2和催化3功能以来,RNA在众多生物过程中所起的重要作用及其调控功能逐渐被揭示。事实上,RNA结构对基因调控的影响正受到越来越多的关注4。与蛋白质类似,RNA具有一级、二级和三级结构,分别指核苷酸序列、碱基配对相互作用的二维图谱以及这些碱基配对结构的三维折叠。尽管确定三级结构对于理解依赖RNA过程的确切机制至关重要,但二级结构同样能提供大量关于RNA功能的信息,并且是进一步形成三维结构的基础5。
然而,利用传统方法确定RNA结构一直存在内在挑战。对于蛋白质而言,X射线晶体学、核磁共振(NMR)和冷冻电子显微镜(cryo-EM)已能够解析其多样的结构模体,使得仅从序列即可进行结构预测6,但这些方法在RNA研究中应用有限。事实上,RNA是具有高度灵活性的分子,其结构单元(核苷酸)相比氨基酸具有更强的构象和旋转自由度。此外,RNA的碱基配对相互作用也比氨基酸残基之间的相互作用更加动态且多样化。因此,经典方法仅成功应用于结构明确、高度紧凑的较小RNA分子7。
确定RNA结构的另一种方法是通过化学探针结合下一代测序技术(NGS)。该策略可提供有关RNA序列中每个碱基结合状态(即其二级结构)的信息。简而言之,RNA分子中未参与碱基配对的碱基会被小分子化学试剂选择性修饰。利用特异的逆转录酶(RTs)对这些RNA进行逆转录,可将修饰信息以突变形式整合到互补DNA(cDNA)中。随后通过聚合酶链式反应(PCR)扩增这些cDNA分子并进行测序。为了获取目标RNA各碱基处于结合或未结合状态的“"状态"”信息,需计算每个碱基位点的突变频率,并将这些数据作为约束条件输入结构预测软件8。基于相邻碱基对规则9和最小自由能计算10,该软件生成最符合实验数据的RNA结构模型11,12。
DMS-MaPseq 使用 DMS,后者可甲基化腺苷的 N1 氮原子 N3 氮气中 以高度特异性的方式在沃森-克里克面作用于胞嘧啶13使用耐热II组内含子逆转录酶(TGIRT-III)进行逆转录可产生前所未有的高信噪比突变谱,甚至能够解析由两种或多种不同构象重叠产生的突变谱14,15此外,DMS能够穿透细胞膜和完整组织,使得在生理环境条件下进行检测成为可能。然而,获得高质量数据具有挑战性,因为操作步骤中的差异可能影响实验结果。因此,我们提供了一个详细的方案,涵盖两方面 体外 以及细胞内 DMS-MaPseq 技术,以减少偏差,并帮助初学者克服该方法可能遇到的困难。特别是在近期 SARS-CoV-2 大流行的背景下,高质量的 RNA 病毒数据是研究基因表达和寻找潜在治疗方法的重要工具。
注意:有关本方案中使用的所有材料、软件、试剂、仪器和细胞的详细信息,请参见材料表。
1. 基因特异性 体外 DMS-MaP

图1:针对大尺寸DMS处理片段的RT-PCR实验设计。 在对修饰RNA进行反转录时,引物结合区域上的修饰不会被记录。因此,当片段长度超过400–500 bp时,需要设计在引物区域重叠的片段,如此处所示。片段长度取决于测序需求。使用双端150个循环测序时,片段长度不应超过300 bp。缩写:RT-PCR = 逆转录聚合酶链式反应;DMS = 二甲基硫酸酯。请点击此处查看此图的放大版本。
2. 利用病毒感染细胞进行全基因组 DMS-MaP 分析
注意:在细胞中,DMS 处理也可与上述基因特异性扩增方法联合使用。全基因组文库需要极深的测序深度才能实现对单个基因的完全覆盖。然而,如果提取后病毒 RNA 在去核糖体 RNA 中占显著比例,则全基因组测序是合适的选择。此外,其他富集方法也可与全基因组文库构建方法结合使用。
注意:视频方案中出于演示目的使用了未感染的细胞。
3. 测序数据分析
注意:要利用 DMS-MaP 测序数据构建 RNA 二级结构模型,必须对生成的 .fastq 文件进行多个不同步骤的处理。这些步骤可使用
基因特异性 体外 DMS-MaP
为研究SARS2的5'非翻译区(5'UTR),合成了病毒前300个碱基对的gBlock序列,并设计了三对引物。其中包括用于扩增该片段的两对引物(“FW” & “RV” 通过 PCR,以及一个用于连接T7启动子的序列(“FW-T7”)。这些序列可见于 表1.
| 名称 | 序列 (5’->3’) |
| FW | ATTAAAGGTTTATACCTTCCCAGGTAAC |
| RV | GCAAACTGAGTTGGACGTGT |
| FW-T7 | TAATACGACTCACTATAGG ATTAAAGGTTTATACCTTCCCAGGTAAC |
表1:SARS-CoV2 5'UTR的DMS-MaP RT-PCR引物序列 此处需要 FW-T7 和 RV 来生成 DNA 模板 体外 转录过程中,RV用于逆转录,FW-RV引物对用于后续cDNA的PCR扩增。正向引物(FW)结合于SARS-CoV2基因组的起始位置,反向引物(RV)结合于目标区域下游紧邻的序列。缩写:DMS-MaP = 二甲基硫酸盐结合测序的突变谱分析;RT-PCR = 逆转录聚合酶链式反应;SARS-CoV2 = 严重急性呼吸综合征冠状病毒2;UTR = 非翻译区;RV = 反向引物;FW = 正向引物。
为了从gBlock片段生成RNA,根据图2A所示方案,使用PCR预混液通过重叠PCR连接T7聚合酶启动子序列。从延长后的片段出发,利用T7转录试剂盒生成RNA。随后使用DNase消化DNA模板,并通过RNA纯化与浓缩柱分离RNA。
质量控制的 体外 转录结果通过将RNA产物与单链RNA标记物一起在1%琼脂糖凝胶上电泳分析。由于仅观察到一条条带, 体外 DMS 探针法和 RT-PCR 实验已进行(参见 图2B).
为了验证PCR反应的成功,使用dsDNA Ladder在2%琼脂糖凝胶上对样品进行电泳。加接索引序列后,同一凝胶上条带应比原来高约150 bp,以计入索引引物的长度。

图2: 体外 DNA模板的转录 (A为了 体外 将不含固有RNA聚合酶启动子的DNA模板进行转录时,必须首先通过重叠PCR将启动子序列连接至模板。该过程使用一条上游引物(正向引物),其序列包含TAATACGACTCACTATAGG(以T7 RNA聚合酶为例),该序列位于与目标片段重叠的起始碱基上游。此处下划线标示的碱基代表聚合酶的转录起始位点。一旦启动子序列连接至双链DNA片段,即可被T7 RNA聚合酶转录。需要特别注意的是,该聚合酶以与上述启动子序列互补的链(蓝色)作为模板,从而生成与启动子序列下游紧邻区域序列相同(红色)的RNA。B1% 琼脂糖凝胶,含 ssRNA Ladder(第1泳道)以及 体外 300 nt 处的转录 RNA 产物(泳道 2)。(C2% 琼脂糖凝胶电泳图,第1道为GeneRuler 1 kb Plus Ladder,第2道为RT-PCR后在300 bp处的PCR产物,第3道为文库构建后在470 bp处的加接头片段。缩写:RT-PCR = 逆转录聚合酶链式反应;DMS = 二甲基硫酸酯;nt = 核苷酸;dsDNA = 双链DNA;ssRNA = 单链RNA。 请点击此处以查看此图的放大版本。
全基因组 体内 使用病毒感染细胞进行 DMS-MaP
在DMS处理之前,HCT-8细胞已感染OC43。感染后4天(dpi)观察到细胞病变效应(CPE)(如图所示) 图3A),这些细胞经过处理后提取RNA并进行了核糖体RNA去除。将总RNA在琼脂糖凝胶上电泳时,可见两条明亮条带,分别对应核糖体的40S和60S亚基,二者约占总RNA质量的95%(参见 图 3B)。当RNA提取失败或发生降解(例如,因多次冻融循环)时,RNA降解产物会在凝胶底部可见(参见 图3C,第二泳道)。此外,rRNA 耗尽后,两条明亮的条带消失,仅留下泳道中的弥散条带(见 图3C,第三条带)。最后,在文库构建完成后,各样本的片段大小分布不同,在最终的PAGE凝胶上呈现为弥散条带。根据计划用于分析这些文库的150 × 150双端测序方案,切取200核苷酸(nt)至500 nt之间的条带。最重要的是,位于约150 nt处的接头二聚体已被分离去除(见 图3D).

图3:检查点 体内 病毒感染细胞中的 DMS-MaP。 (A) 病毒感染的HCT-8细胞在4 dpi时的光学显微镜图像。为了从总RNA中获得尽可能高的病毒RNA产量,同时尽量减少细胞死亡带来的不利影响,应在出现细胞病变效应(CPE)时或甚至更早时加入DMS,如图所示。B) 含六份总RNA样品(每份1 µg)的1%琼脂糖凝胶。每条泳道中均可见两条明亮条带,分别对应40S和60S亚基,因为核糖体RNA约占总RNA的95%。注意:细胞内DMS处理会导致部分RNA断裂和条带拖尾,但两条rRNA条带仍应可见。修饰后的轻度断裂是可以接受的,因为在活细胞中进行DMS孵育时,携带甲基化标记的信息已被生成并反映了RNA的结构状态。C1% 琼脂糖凝胶电泳图,泳道1为GeneRuler 1 kb plus DNA标记物,泳道2为在−80 °C保存6个月的总RNA,泳道3为去核糖体RNA。当RNA长期储存并经历多次冻融循环后,RNA开始降解,可能不适用于探针实验。此外,总RNA经去核糖体处理后,代表核糖体40S和60S亚基的两条明亮条带变淡,残留RNA的弥散条带开始显现。DGeneRuler 1 kb plus DNA 标记物(第1道)和全基因组RNA文库样本的PAGE凝胶电泳图。应根据测序需求切取凝胶中的目标片段。对于双端测序(从两端各进行150个循环),应切取300 bp至500 bp之间的片段。需将接头二聚体(在170 bp处迁移)分离去除。缩写:DMS-MaP = 二甲基硫酸盐结合测序的突变谱分析;dpi = 感染后天数;CPE = 细胞病变效应。 请点击此处查看此图的放大版本。
测序完成后,将 .fastq 文件与一个 .fasta 参考序列文件一起提交至 DREEM 网络服务器(http://rnadreem.org/)进行分析。服务器生成的输出结果包括由 fastqc(https://www.bioinformatics.babraham.ac.uk/projects/fastqc/)和 TrimGalore(https://www.bioinformatics.babraham.ac.uk/projects/trim_galore/)产生的质控文件,以及包含群体平均突变频率的其他输出文件。除了一张以交互式 .html 格式展示突变频率的图表(见图 4A)、每个碱基的原始反应性数据的 .csv 文件和一个可被多种 RNA 结构预测软件读取的 struct_constraint.txt 文件外,还包括一个 bitvector.txt 文件,用于记录每条测序读段的突变情况。基于这些数据,将 .fasta 文件和 struct_constraint.txt 文件提交至 RNAfold 网络服务器(http://rna.tbi.univie.ac.at/cgi-bin/RNAWebSuite/RNAfold.cgi),以计算群体平均结构。该服务器利用 ViennaRNA 软件,基于最小自由能原理生成结构预测结果,预测结构可在线查看,也可下载为 ct 或 Vienna 格式。为了构建 RNA 结构模型,将上述可下载的文件提交至 VARNA 软件(https://varna.lri.fr/,见图 4B)。最后,可使用 DREEM 的稳定版本(https://codeocean.com/capsule/6175523/tree/v1)分析 bitvector.txt 文件,以搜索替代性的 RNA 构象。为了利用 DREEM 获得高质量的结构模型,建议每个碱基的测序深度达到 10,000 条读段;而对于聚类分析,每个碱基可能需要高达 100,000 条读段。整个工作流程的概览见图 4C。

图 4:SARS-CoV2 5'非翻译区(5'UTR)化学探针实验获得的代表性数据。(A)SARS-CoV2 基因组前 300 个碱基的反应性图谱,按碱基着色(A:红色,C:蓝色,U:绿色,G:黄色)。原始反应性值通过绝对突变频率除以测序深度计算得出。具有开放构象的碱基反应性值较高;参与碱基配对的碱基反应性值较低。U 和 G 不被 DMS 修饰,其低反应性值源于聚合酶的错配错误。预测由 DREEM 网络服务器完成。(B)基于反应性值使用 VARNA 预测的 SARS-CoV2 5'UTR 结构模型。高反应性值的碱基以红色表示;低反应性值的碱基以白色表示。(C)DMS-MaP 分析的工作流程,起始于测序获得的 .fastq 文件。可使用 fastqc 进行质量控制;利用 TrimGalore 去除接头序列后,使用 Bowtie2 将序列比对至参考序列。从获得的 .bam 文件中,DREEM 统计每条读段中的突变,生成突变图谱或 .bitvector.txt 文件。这些文件以位置依赖的方式报告每条读段的突变情况,据此可构建群体平均反应性图谱。此外,也可使用 DREEM 对 bitvector 进行聚类,以寻找 RNA 的替代构象。最后,使用软件(例如 VARNA)对获得的结构模型进行可视化展示。缩写:DMS-MaP = 使用二甲基硫酸盐的突变谱型测序;SARS-CoV2 = 严重急性呼吸综合征冠状病毒 2。 请点击此处查看该图的放大版本。
本方案描述了如何检测RNA 体外 并利用DMS突变谱分析实验在细胞中进行检测。此外,本文还提供了制备Illumina测序文库以生成基因特异性数据及分析所得.fastq文件的操作指南。同时,也可采用全基因组文库策略。然而,基因特异性的RT-PCR能够产生质量最高且最可靠的数据。因此,在不同样本之间进行比较时,必须确保各样本采用相同的测序策略制备,因为文库构建过程可能引入一定偏差。实验可重复性应始终通过设置重复样本来评估。
若干注意事项
RNA 是一种不稳定的分子,容易因温度升高以及核糖核酸酶(RNases)的作用而降解。因此,建议采取特殊措施——使用个人防护装备(PPE)、无RNase的耗材以及RNase抑制剂。最重要的是,应尽可能将RNA保持在冰上。这一点尤其适用于甲基化RNA,因其对高温更为敏感。
必须确认目标RNA结构对DMS浓度和缓冲条件不敏感。在pH 7–7.5条件下,100 mM Tris、100 mM MOPS和100 mM HEPES等缓冲液可产生较强的信号,但可能不足以在反应过程中维持pH稳定21。由于DMS在水中会发生水解并降低pH,因此在修饰反应中使用强缓冲体系对于维持中性pH至关重要。已有研究表明,添加Bicine有助于将pH维持在微碱性状态21,但会导致鸟苷(G)和尿苷(U)的DMS修饰水平较低;这些数据可能具有信息价值,但由于其信号强度远低于腺苷(A)和胞苷(C),需单独分析,本实验方案中不再进一步讨论。
在基因特异性的 RT-PCR 中,修饰后的 RNA 被逆转录为 DNA,并通过 PCR 扩增成片段。尽管 RNA 的长度在理论上可以不受限制,但这些 PCR 片段的长度不应超过 400–500 个碱基对(bp),以避免逆转录反应过程中产生偏差。理想情况下,片段长度应处于测序读长范围之内(例如,若采用 150 × 150 循环的双端测序程序,则单一片段长度不应超过 300 bp)。当使用循环数较少的测序程序时,可使用 dsDNase 对 PCR 产物进行片段化处理。此外,由于引物序列内部不包含任何结构信息,因此当被检测的 RNA 包含 >1 个片段时,这些片段必须相互重叠。逆转录反应中可包含针对不同片段的多个逆转录引物(最多可使用 10 种不同的逆转录引物)。根据序列的不同,将逆转录引物混合使用可能会降低逆转录效率,但通常仍能获得良好效果。每个 PCR 反应应单独进行。
使用DMS探测RNA时,实验条件具有额外的重要性,因为许多RNA在热力学上不稳定,并会根据温度等环境因素改变其构象。为避免出现异常,应尽可能保持实验条件恒定,反应时间也应保持一致。只要维持基本条件——缓冲能力以及单价离子(Na)和二价离子(Mg)的存在——以确保RNA正确折叠,缓冲体系在一定程度上可以互换17,20,22,23 。24
关于修饰RNA的文库构建,必须考虑多个方面。首先,如前所述,修饰RNA比未修饰的RNA更不稳定,这意味着可能需要优化片段化时间以获得最佳的片段大小分布。此外,某些RNA文库构建试剂盒以及许多其他RNA测序方法在逆转录过程中使用随机引物,这可能导致参考序列的覆盖度降低,尤其是在基因的3'端,最终导致覆盖深度不足。如果某个区域的覆盖度过低,则可能需要在结构预测中剔除这些碱基。除了RT-PCR和全基因组RNA测序试剂盒外,还可采用其他文库构建方法。当使用小片段RNA或需要避免引物区域探针信息丢失时,采用将3'和/或5'接头连接至RNA的实验方案具有优势。
最后,对化学探针实验结果的分析必须始终谨慎解读。目前尚无任何软件能够仅根据序列就以高准确度预测任意RNA的二级结构。尽管化学探针数据的引入可显著提高预测准确性,但对较长的RNA(>500 nt)构建可靠的结构模型仍然具有挑战性。这些模型应通过其他方法和/或定点突变实验进一步验证。RNA结构预测软件通常以最大化碱基配对数量为目标,因此对开放构象施加了显著惩罚,这可能无法准确反映RNA的真实折叠状态5。因此,所获得的结构模型应通过量化其与原始化学探针数据的一致性(例如使用AUROC指标)以及技术重复之间的一致性(例如使用mFMI指标)来进行评估,正如Lan等人的研究所示20。
理想情况下,应采用不同系统中的多个实验来验证所获得的结构模型,以加强研究假设。这些实验可包括体外(in vitro)和细胞内(in-cell)方法、补偿性突变,以及使用不同的细胞系和物种。此外,原始反应活性数据往往与结构预测同样重要,甚至更具信息量,因为它们记录了RNA折叠集合体的"真实状态"快照。因此,原始反应活性数据非常适合用于比较不同条件之间的结构变化,且具有很高的信息价值。重要的是,通过化学探针数据约束并结合计算预测所得到的最低自由能结构,仅应作为构建完整结构模型的初步假设。
作者声明无任何利益冲突。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 1 Kb Plus DNA Ladder | 10787018 | Thermo | |
| 2-巯基乙醇 | M6250-250ML | Sigma | |
| 酸性酚:氯仿,pH 4.5 | AM9720 | Thermo | |
| Advantage PCR | 639206 | Takara | |
| CloneAmp HiFi PCR Premix | 639298 | Takara | |
| DMS | D186309 | Sigma | |
| dNTPs,每种10 mM | U151B | Promega | |
| E-Gel EX 琼脂糖凝胶,2% | G402022 | Thermo | 预制琼脂糖凝胶 |
| 乙醇(200度) | E7023-4X4L | Sigma | |
| Falcon 管,15 mL,50 mL | |||
| GlycoBlue | 共沉淀剂 | ||
| HCT-8 细胞 | ATCC #CCL-244 | ||
| Invitrogen MgCl2 (1 M) | AM9530G | fisherscientific | |
| 异丙醇 | 278475 | Sigma | |
| Megascript T7 转录试剂盒 | AM1334 | Thermo | |
| NanoDrop 分光光度计 | |||
| Novex TBE 凝胶,8%,10孔 | EC6215BOX | Thermo | |
| OC43 | ATCC #VR-1558 | ||
| RiboRuler 低分子量 RNA Ladder | SM1831 | Thermo | |
| RNase H | M0297L | NEB | |
| 二甲胂酸钠,0.4 M,pH 7.2 | 102090-964 | VWR | |
| 氢氧化钠溶液 | S8263-150ML | Sigma | |
| SuperScript II 逆转录酶(用于FSB和DTT) | 18064014 | Thermo | |
| TGIRT-III 酶 | TGIRT50 | Ingex | |
| Oligo Clean & Concentrator 试剂盒 | D4060 | Genesee | |
| RNA Clean & Concentrator 试剂盒为RNA纯化试剂盒 | R1016 | Genesee | |
| TRIzol 试剂 | 15596018 | Thermo | RNA提取试剂 |
| 水(用于RNA实验)(DEPC处理,无DNase、RNase,分子生物学级) | BP561-1 | fisherscientific | |
| xGen 广谱RNA文库构建试剂盒,16次反应 | 10009865 | IDT | |
| Zymo RNA纯化与浓缩柱 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可