需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

逆转录病毒整合位点的扩增、下一代测序与基因组DNA定位

17.6K 次观看

DOI:

10.3791/53840

2016年3月22日

本文内容

摘要

我们描述了一种从感染细胞的基因组DNA中扩增逆转录病毒整合位点、对扩增的病毒-宿主连接区域进行测序,并将这些序列比对至参考基因组的实验方案。此外,我们还介绍了利用BEDTools量化整合位点在不同基因组注释区域相对分布的技术。

摘要

逆转录病毒在局部和全局尺度上均表现出特征性的整合偏好。本文详细介绍了一种实验方案:(1)利用连接介导的PCR(LM-PCR)扩增结合高通量测序(NGS)技术,构建多样化的逆转录病毒整合位点文库;(2)使用BEDTools比对每个病毒-宿主连接位点的基因组位置;(3)对数据进行统计学分析。从感染细胞中提取基因组DNA后,通过限制性内切酶消化或超声处理将其片段化。经过适当的DNA末端修复后,将双链接头连接至DNA末端,并使用与病毒长末端重复序列(LTR)及连接接头DNA互补的引物进行半巢式PCR扩增。PCR引物携带NGS过程中DNA簇生成所需的序列,因此无需额外进行接头连接。在进行NGS之前,需进行质量控制(QC),以评估DNA片段大小分布及接头DNA的连接情况。对测序输出文件筛选含有LTR的读段,并去除定义LTR和接头的序列。将修剪后的宿主细胞序列使用BLAT比对至参考基因组,并筛选与参考基因组中唯一位置具有至少97%序列一致性的结果。对唯一的整合位点进一步分析其邻近核苷酸(nt)序列以及相对于各类基因组特征的分布情况。采用本方案,可在三天内从基因组DNA构建出复杂度高的整合位点文库。因此,从易感细胞的外源性病毒感染到整合位点分析的完整流程可在约一至两周内完成。该技术的近期应用包括对HIV感染患者整合位点的纵向分析。

引言

病毒DNA(vDNA)整合到宿主细胞基因组中是逆转录病毒生命周期中的关键步骤。该过程由病毒编码的整合酶(IN)完成,此酶通过两种不同的催化反应,最终形成稳定插入的前病毒1。IN亚基结合由逆转录生成的线性vDNA末端,形成一种高级结构的整合体(intasome),其中vDNA末端通过IN多聚体相互连接并稳定2-4。IN在保守的5'-CA-3'序列下游对vDNA的3'端进行切割,这一过程称为3'-加工,使每个vDNA末端暴露出带有活性羟基的凹陷3'端5-8。随后,整合体作为包含多种宿主与病毒蛋白的大分子复合物——前整合复合物(preintegration complex, PIC)的一部分被转运至细胞核内9-11。当整合体接触到细胞内的靶DNA(tDNA)后,IN利用vDNA 3'端的羟基,以交错方式切割tDNA的上下两条链,并通过链转移反应将vDNA的3'端与tDNA的5'磷酸基团共价连接12,13

逆转录病毒在局部和全局尺度上均表现出整合位点偏好性。在局部,共识整合位点包含弱保守的回文结构tDNA序列,这些序列从vDNA插入位点上下游约5至10个碱基对(bp)范围内延伸14,15。在全局层面,逆转录病毒靶向特定的染色质注释区域16。目前已知有七种不同的逆转录病毒属——α至ε、lenti(慢病毒属)和spuma(泡沫病毒属)。其中,包括HIV-1在内的慢病毒倾向于在活跃转录基因的基因体内部进行整合17,而γ-逆转录病毒则优先整合至转录起始位点(TSSs)和活跃增强子区域18-20。与此形成鲜明对比的是,泡沫病毒强烈偏向于整合到异染色质区域,例如基因贫乏的核纤层相关结构域21。局部tDNA碱基偏好性在很大程度上由整合酶(IN)与tDNA之间特定的核蛋白相互作用网络所决定13,22,23。对于慢病毒和γ-逆转录病毒而言,其相对于基因组注释的整合位点选择在很大程度上受IN与相应宿主细胞因子之间相互作用的调控24-27。已有研究证实,改变IN与tDNA相互作用网络的具体特征13,22,23,28,以及破坏或重新设计IN与宿主因子之间的相互作用25-27,29-32,分别是实现局部和全局水平上重定向整合的有效策略。

用于鉴定逆转录病毒整合位点的DNA测序技术在过去几十年中取得了巨大进展。在早期研究中,研究人员通过繁琐的纯化和手动克隆技术,每次研究仅能获得少数几个独特的整合位点33,34。随着利用LM-PCR扩增LTR-宿主DNA连接区域,并结合将单个整合位点定位至人和小鼠草图基因组的能力,该领域发生了变革,从外源性体外培养细胞感染中回收的整合位点数量增加至数百到数千个17,18。近年来,LM-PCR与高通量测序(NGS)技术的结合使文库深度急剧提升。具体而言,焦磷酸测序可获得数万个独特的整合位点30,35-38,而利用DNA簇生成技术进行测序的文库则可产生数百万条独特的序列19-21,39。本文描述了一种优化的LM-PCR实验方案,用于通过DNA簇生成NGS技术扩增并测序逆转录病毒整合位点。该方法将必需的接头序列直接整合到PCR引物中,从而使其直接引入扩增后的DNA分子,因此无需在测序前额外进行接头连接步骤40。同时,本文也概述了生物信息学分析流程,从原始测序数据中解析LTR-宿主DNA连接区域,到将唯一的整合位点映射至相关的基因组特征。根据该领域先前方法学方案所确立的惯例36,38,41-43,可开发定制脚本来辅助完成生物信息学流程中的特定步骤。本实验方案的有效性和灵敏度通过代表性数据加以展示:对感染复数(MOI)约为1.0的体外培养细胞中的HIV-1整合位点进行扩增、测序和定位,并将该DNA样本以5倍梯度逐步稀释至未感染细胞DNA中,最大稀释比例达到1:15,625,相当于MOI约为6.4 × 10-5

访问受限。请登录或开始试用以查看此内容。

方案

1. 生成病毒毒株

注意:本方案湿实验部分的流程图如图所示 图1病毒储存液的制备及其对组织培养细胞的感染细节通常适用于不同类型的逆转录病毒。在某些实验中,靶细胞可能不表达内源性病毒受体;在此类情况下,可构建携带异源病毒包膜糖蛋白的假型逆转录病毒颗粒, 例如 水疱性口炎病毒(VSV-G)的G糖蛋白将被用于感染 44,45.

注意:操作 HIV-1 时应采取预防措施。尽管各机构的具体指南可能有所不同,但所有基于病毒的操作均应在专用的、仅限操作人员使用的生物安全柜(通常称为组织培养罩)中进行。操作过程中必须始终穿戴适当的个人防护装备,包括面部防护、鞋套、双层手套和全身防护服。所有病毒相关实验产生的液体废物应使用漂白剂(终浓度 10%)灭活,所有废物(包括固体废物)在丢弃前均需高压灭菌处理。

  1. 转染前一天,将 3.3 × 106 个 HEK293T 细胞接种于五块 100 mm 培养皿中,每皿加入 10 ml 添加了 10%(v/v)胎牛血清和 1%(v/v)青霉素/链霉素(10,000 U/ml 储液)的杜尔贝科改良伊格尔培养基(DMEM)。
    注意:此后所述的添加物培养基简称 DMEM-FPS。
  2. 次日,使用市售转染试剂或磷酸钙法,将细胞转染携带全长逆转录病毒分子克隆的 10 µg 质粒,或 9 µg 包膜缺失的单周期载体与 1 µg VSV-G 表达质粒。
    1. 将细胞置于 37 °C、含 5% CO2 的湿润化细胞培养箱中孵育(此后统称为"组织培养箱")。约 48 小时后,使用刻度移液管收集含病毒的细胞培养上清,并通过重力流经 0.45 µm 滤器过滤。
    2. 在 4 °C 条件下以 200,000 × g 超速离心 1 小时浓缩病毒。将病毒沉淀重悬于含 20 U DNase 的 500 µl DMEM-FPS 中,37 °C 孵育 1 小时。
      注意:DNase 处理步骤有助于通过降解转染过程中残留的大部分质粒 DNA,减少非目标质粒序列的回收。
  3. 按照制造商说明书,使用 HIV-1 p24 抗原捕获试剂盒测定 p24 浓度46
    注意:病毒浓度也可通过逆转录酶活性检测47,48进行测定。此外,可通过测定感染复数(MOI)来评估功能性病毒的水平。对于表达荧光报告基因(如增强型绿色荧光蛋白)的病毒,最便捷的方法是采用荧光激活细胞分选技术。当使用可能无法支持优化细胞系同等感染水平的原代细胞时,MOI 测定尤为有用。

2. 用病毒转染细胞

  1. 在6孔板中每孔接种3.0 × 105个HEK293T细胞,加入2.5 ml DMEM-FPS培养基,于组织培养孵箱中过夜孵育。
    注意:本方案所获得的独特整合位点数量与感染时使用的细胞数量及活性病毒量成正比。
  2. 在组织培养孵箱中,用终浓度为500 ng/ml p24的病毒液,以500 µl新鲜DMEM-FPS进行感染,持续2小时,随后每孔加入2 ml预热至37 °C的DMEM-FPS,继续孵育。
  3. 感染后48小时,吸除培养基,用2 ml磷酸盐缓冲液(PBS)洗涤细胞。每孔加入0.5 ml预热至37 °C的胰蛋白酶-EDTA溶液,数秒后在显微镜下观察细胞是否脱落。
  4. 加入2 ml预热的DMEM-FPS,用刻度移液管轻轻吹打约10次以重悬细胞。将细胞悬液转移至含有18 ml预热DMEM-FPS的75 cm2组织培养瓶中,在组织培养孵箱中继续培养。
  5. 自感染开始至少五天后,吸除培养基,用5 ml PBS洗涤细胞,加入2 ml预热的胰蛋白酶-EDTA,再用5 ml预热的DMEM-FPS吹打重悬细胞。室温下以2,500 × g离心5分钟,弃去上清液。
    注意:尽管在这些条件下整合过程在感染后约48小时达到平台期49,50,但额外的3天培养时间对于充分稀释由细胞内DNA重组或病毒介导的自整合产生的未整合DNA分子浓度是必要的。
  6. 使用市售试剂盒(例如,参见51)从细胞沉淀中提取基因组DNA。用200 µl 10 mM Tris-HCl(pH 8.5)从提供的离子交换柱中洗脱DNA。
    注意:应在感染后48小时(步骤2.3)保留一部分细胞用于感染性检测,以确保在进行高通量测序(NGS)前病毒成功感染。

3. 通过超声处理或限制性酶切对基因组DNA进行片段化

注意:超声处理以几乎与序列无关的方式片段化基因组DNA,因此在测序预期回收率较低的样本时,是首选的片段化方法(例如,感染的患者细胞或在相对较低的MOI下启动的感染)。此外,超声处理能够区分特定整合位点序列的PCR重复序列与同一位置的独立整合事件,这对于区分感染患者中含前病毒细胞的克隆扩增至关重要(见下文步骤11)。 39,52-54.
注意:应在上游长末端重复序列(LTR)的紧邻下游对DNA进行切割,以减少线性扩增介导的PCR(LM-PCR)过程中病毒内部序列的扩增。位于上游U5序列下游43 bp处的限制性内切酶BglII,其产生的DNA末端无法与MseI酶切末端进行后续连接,但该酶适用于多种HIV-1毒株。图1B)。在通过超声处理制备DNA时,应在接头连接后使用内部切割限制性酶(参见 图1C-E 以及下文的步骤4.3。

  1. 进行超声处理时,将10 µg基因组DNA溶于无核酸酶的水中,调整终体积至120 µl。采用以下参数进行超声处理,使DNA平均断裂片段大小为500 bp(重复两轮:占空比:5%;强度:3;每脉冲循环数:200;时间:80秒)。
  2. 使用PCR纯化试剂盒纯化超声处理后的DNA。利用DNA末端修复试剂盒修复DNA末端,并使用PCR纯化试剂盒纯化修复后的DNA。使用Klenow exo-酶对DNA进行A尾修饰,并使用PCR纯化试剂盒纯化加A尾的DNA。有关试剂盒使用的更多细节,请参见51,52
  3. 进行限制性内切酶消化时,在100 µl反应体系中加入10 µg基因组DNA及厂商提供的缓冲液,加入能产生5'-TA突出末端的多种酶(每种酶100 U)的混合物,并加入一种不兼容的酶(如BglII),后者可切割上游病毒LTR区域下游的位点,37 °C过夜消化。次日使用PCR纯化试剂盒纯化DNA。
    注意:所用限制性内切酶均不应在病毒DNA末端约30 bp的末端区域内切割,该区域将由LM-PCR扩增。本方案特异性扩增HIV-1 DNA的U5末端。

4. 退火连接子寡核苷酸并将之连接至片段化的基因组DNA

注意:制备一种含有与上述DNA片段相容的突出端的不对称连接子(本方案中所用寡核苷酸序列见Table 1)。用于超声处理DNA的连接子必须包含相容的T-3'突出端,而用于MseI酶切DNA的连接子则必须包含相容的5'-TA突出端(Figure 1)。短链连接子还必须包含一种不可延伸的化学修饰,例如3'-氨基,以将后续扩增反应限制在目标DNA方向。
注意:当平行制备多个不同的整合位点文库和/或在同一测序运行中对独特样本进行多重分析时,建议为每个样本使用独特的连接子,以限制PCR过程中样本间交叉污染的可能性。这还意味着在半巢式PCR(如下所述)过程中需为每个样本使用独特的连接子引物。可通过打乱Table 1中列出的连接子寡核苷酸序列来设计独特的连接子链和连接子引物,同时保持总体相似的%GC含量以及适用的突出端位置。

  1. 将短链和长链连接子链在35 µl含10 mM Tris-HCl(pH 8.0)和0.1 mM EDTA的溶液中退火(每种寡核苷酸终浓度为10 µM),先加热至90 °C,再以每分钟降低1 °C的速率缓慢冷却至室温。
  2. 每个基因组DNA样本至少准备四个平行的连接反应,每个反应体系为50 µl,包含1.5 µM连接接头、1 µg片段化DNA和800 U T4 DNA连接酶。在12 °C下过夜连接。次日使用PCR纯化试剂盒进行纯化。
  3. 对于通过超声处理制备的样品,使用100 U能够切割上游LTR下游区域的限制性内切酶对纯化的连接反应产物进行消化例如,BglII 用于 HIV-1)在制造商推荐条件下过夜消化。使用 PCR 纯化试剂盒纯化 DNA。

5. 通过半巢式 PCR 扩增病毒 LTR-宿主基因组 DNA 连接区

注意:为了确保文库多样性,每个样本在两轮 PCR 中应制备至少 4–8 个平行 PCR 反应,具体数量取决于回收连接反应产物的 DNA 浓度。DNA 模板浓度应通过分光光度法进行定量。本方案中,第一轮和第二轮 PCR 均使用巢式 LTR 特异性引物,但两轮均使用相同的接头特异性引物(表 1)。第二轮 LTR 特异性引物和接头特异性引物均编码用于 DNA 簇生成以及测序引物结合位点的接头序列。巢式 LTR 特异性引物还编码一个 6 个核苷酸(nt)的索引序列,该序列可在不同引物之间变化,以便在同一测序运行中对多个文库进行多重分析。

  1. 按照表2中列出的每管成分准备第一轮PCR反应。
    注意:连接子特异性引物含有22个核苷酸与连接子互补,熔解温度为53 °C,GC含量为45%,其3'端位于不同连接子长链3'末端上游15-16 bp处(表1)。第一轮27 nt的LTR引物熔解温度为59 °C,GC含量为48%,其3'端位于HIV-1 U5末端上游34 bp处。第二轮26 nt LTR引物中与HIV-1 LTR互补区域的熔解温度为60 °C,GC含量为50%,其3'端位于病毒U5末端上游18 bp处。如果用户设计序列不同的PCR引物(包括用于其他逆转录病毒的引物),建议引物的寡核苷酸熔解温度和GC含量应模拟这些参数21
  2. 按照以下热循环仪参数运行第一轮PCR:1个循环:94 °C 2分钟;30个循环:94 °C 15秒,55 °C 30秒,68 °C 45秒;1个循环:68 °C 10分钟。
  3. 合并反应产物,并使用PCR纯化试剂盒进行纯化。按照表3中每管成分准备第二轮PCR反应。使用第5.2步所述的热循环仪参数进行第二轮PCR扩增。合并反应产物,并按照制造商说明书,使用商用PCR纯化试剂盒纯化DNA。
    注意:已有多种推荐的索引序列可用于DNA簇集的高通量测序(NGS)71

6. 进行质控和高通量测序(通常由测序机构完成)

  1. (质控检测 #1)使用荧光计确认第 5.3 步文库 DNA 的浓度55。简言之,将标准品和实验样品制备于 200 µl 无核酸酶水中,终体积为 200 µl。涡旋振荡管子 2–3 秒,在室温下孵育 2 分钟,然后在荧光计中读取样品。
    注意:样品中应至少含有 2 nM 的文库 DNA 浓度,且体积不少于 15 µl。
  2. (质控检测 #2)使用基于胶带的检测方法确认 DNA 片段大小分布56
    注意:理想的分布表现为一个相对宽泛的 DNA 峰,峰值长度集中在约 500 bp。如果存在大量大于 1 kb 的片段,则建议引入片段大小选择步骤,以去除较长的 DNA 物种,这些长片段会在簇生成过程中阻碍桥式扩增。相反,如果在 100 至 200 bp 范围内出现明显的峰,则可能在 PCR 过程中形成了引物二聚体。此时应优化实验流程,以尽量减少引物二聚体的形成。
  3. (质控检测 #3)通过定量 PCR 确认适配子已正确插入 DNA 文库中57
  4. 根据制造商的应用文献进行高通量测序(NGS)。加入 10%(w/w)的 ΦX174 DNA 作为内参 spike-in,可使测序运行中的碱基组成更加均衡,从而优化实时质量指标。
    注意:整合位点测序实验通常采用单端 150 bp(SE150)或双端 150 bp(PE150)测序模式。PE150 特别适用于捕获每条 DNA 分子上的连接子连接位点(e.g.,在分析整合位点以寻找宿主细胞克隆扩增证据时)。

7. 使用自定义的 Python 或 PERL 脚本解析包含 LTR 的测序数据,去除 LTR 和连接序列,并使用 BLAT 比对至参考基因组

  1. 扫描 FASTA 文件以查找包含 LTR 的序列读段,将 LTR 和连接序列从宿主基因组 DNA 序列中截取出来,并将这些序列导出至一个新的 FASTA 文件。使用 BLAT58 将截取后的读段分别比对到参考基因组(例如 人类基因组版本 hg19 或 GRCh38)和病毒基因组,输出整合位点坐标至一个独立的 .txt 文件,比对参数设置如下:
    stepSize = 6,minIdentity = 97,maxIntron = 0
  2. 解析 BLAT 输出的 .txt 文件,去除自整合事件( LTR 末端整合至 HIV-1 病毒基因组内部区域的证据)以及其他比对到 HIV-1 基因组的序列,并生成一个独立的输出 .txt 文件,其中所有重复的整合位点已被合并为单一、唯一的坐标匹配结果。

8. 创建包含整合位点周围15个核苷酸区间的.bed文件,将这些文件转换为FASTA格式,并构建序列logo以展示整合位点周围碱基偏好性

  1. 创建列出每个整合位点碱基区间的 .bed 文件。建议至少包含 15 个碱基(5 个上游和 10 个下游)以用于生成序列 logo。使用 BEDTools59 中的 fastaFromBed 功能及以下命令,从这些 .bed 文件生成 FASTA 文件:
    fastaFromBed -fi /directory/to/reference/genome/ -name -s -bed 15_base_pair_file.bed -fo output_file.fasta
    注意:在整合过程中,病毒保守的 5'-CA-3' 二核苷酸会连接到宿主 DNA 上,验证长末端重复序列(LTR)末端与细胞 DNA 的连接是识别真实整合位点的重要初步筛选步骤。我们还进一步从该宿主 DNA 序列群体生成序列 logo,以验证实验结果。由于逆转录病毒在其整合位点周围表现出特征性的碱基偏好14,15,因此序列 logo 可用于确认所定位的基因组位点是通过整合酶(IN)介导的整合产生,而非其他重组机制(如非同源性末端连接)所致60,61
  2. 使用 WebLogo 3(http://weblogo.threeplusone.com/create.cgi)从 FASTA 文件生成序列 logo。点击“Choose File”上传 FASTA 文件,并使用以下设置:输出格式为 PDF(矢量);Logo 尺寸为 large;第一位置编号为 -5;Logo 范围为 -5 到 5;Y 轴刻度为 0.1;Y 轴刻度间隔为 0.5;配色方案为 classic(NA)。

9. 创建中心碱基对 .bed 文件,检测样本交叉污染,并绘制相对于相关基因组特征的唯一整合位点分布图

  1. 由于逆转录病毒的整合以交错方式发生在tDNA链上,需调整整合位点的精确坐标,以反映靶位点重复序列中心碱基对的位置,从而正确绘制整合位点相对于基因组特征的分布图。
    1. 因此,对于像 HIV-1 这类具有 5 bp 重复的病毒,应创建一个 .bed 文件,将整合位点中心的碱基位置相对于正链整合位点向下游偏移 2 个碱基,相对于负链整合位点向上游偏移 2 个碱基。
  2. 为检测样本间的交叉污染,使用 BEDTools 计算不同文库间共有的整合位点数量 相交 用于对两个不同样本的中心 bp .bed 文件进行交集操作,并执行以下命令:
    bedtools intersect -a central_basepair_1.bed -b central_basepair_2.bed -f 1.00 -r -s > 重叠1v2.txt
  3. 使用以下命令统计输出文件 overlap1v2.txt 中的行数,以量化两个文库之间共有位点的精确数量:
    wc -l overlap1v2.txt
  4. 从 UCSC 基因组注释数据库下载用于整合位点定位的参考基因组版本对应的 RefSeq 注释 .bed 文件例如 http://hgdownload.cse.ucsc.edu/goldenPath/hg38/database 62.
    1. 使用 BEDTools 计算位于 RefSeq 基因内的整合位点数量 相交 将为样本生成的中心碱基对 .bed 文件与 RefSeq .bed 文件进行交集分析,命令如下:
      bedtools intersect -a central_basepair_1.bed -b RefSeq_hg38.bed -u > RefSeq_sample1.bed
  5. 使用以下命令统计输出文件 RefSeq_sample1.bed 中的行数,以精确量化落入 RefSeq 基因中的位点数量:
    wc -l RefSeq_sample1.bed
  6. 重复步骤 9.3 和 9.4,以将整合位点比对到任何其他感兴趣的、具有可用区间 .bed 文件的注释。按照步骤 9.4 的指引,从 UCSC 基因组注释数据库下载目标参考基因组最新版本的 CpG 岛注释 .bed 文件。
    1. 使用 BEDTools 计算位于 CpG 岛特定距离范围内(本示例中为 5 kb 窗口)的整合位点数量 功能并执行此命令:
      bedtools window –w 2500 central_basepair_1.bed -b CpG_hg38.bed -u > CpG_sample1.bed
  7. 使用以下命令统计输出文件 CpG_sample1.bed 中的行数,以量化位于 CpG 岛上下游 2.5 kb 范围内的位点精确数量:
    wc -l CpG_sample1.bed
  8. 重复步骤 9.6 和 9.7,用于绘制靠近转录起始位点(TSS)的整合位点图谱。生成 RefSeq.bed 文件的一个替代版本,其中映射到多个基因的基因组坐标已调整为仅反映该位置存在的单个基因,以防止高估整合位点周围区域的基因密度。使用 BEDTools 计算每个整合位点周围 1 Mb 区域内的基因密度 功能并执行此命令:
    bedtools window -w 500000 central_basepair_1.bed -b RefSeq_hg38_NonRedundant.bed -u > GeneDensity_sample1.bed
  9. 按照以下命令计算数据集中所有整合位点的平均基因密度:
    awk '(sum+=$7) END {print}' "平均值 = ",sum/NR)' GeneDensity_sample1.bed

10. 使用双尾费舍尔精确检验和双尾威尔科xon秩和检验在样本间统计比较整合位点分布 R

注意:比较RefSeq基因内或CpG岛或转录起始位点(TSS)窗口内的整合位点比例时,使用Fisher精确检验;而比较整合位点周围基因密度分布时,则使用Wilcoxon秩和检验。R 程序可在 http://www.r-project.org/ 获取。
双侧Fisher精确检验:

  1. 根据第9.4步和第9.7步中指示计算得到的数值,在 R 中为每次比较创建矩阵,矩阵内容为观测到的发生次数(位于注释区域内或围绕注释的窗口内的整合位点)与其余位点的数量。使用以下命令执行:
    (annotation_of_interest <- matrix(c(SampleA#in, SampleA#remaining, SampleB#in, SampleB#remaining),nrow=2,dimnames=list(c('Center', 'Remainder'),c('SampleA', 'SampleB'))))
  2. 使用以下命令通过双尾Fisher精确检验计算该比较的 P 值:
    fisher.test(annotation_of_interest, alternative = 'two.sided')$p.value
    双尾Wilcoxon秩和检验:
  3. 创建一个以制表符分隔的 .txt 文件,其中每一列的首单元格为样本名称,其下为该文库中所有整合位点的基因密度值(来自第9.9步生成的 .bed 文件)。使用以下命令并导航至正确的文件目录,将该制表符分隔的 .txt 文件导入 R
    FILENAME <- as.data.frame(read.delim(file.choose(), header=T,check.names=FALSE, fill=TRUE,sep='\t'))
  4. 使用以下命令通过双尾Wilcoxon秩和检验计算该比较的 P 值:
    wilcox.test(FILENAME$SampleA,FILENAME$SampleB,alternative ='two.sided', paired = F, exact = T)$p.value
    注意:RP 值的计算仅能精确到某一极低的下限,低于该限值时程序将返回零。对于差异极大的样本,若 R 输出 P = 0,则应将 P 值估计为 <2.2 × 10-308

11. 检查原始测序数据中整合病毒DNA细胞克隆扩增的证据

注意:在参考基因组中完全相同的核苷酸位置发生多个整合事件的可能性虽小但存在。此外,由于文库构建过程中使用了PCR,和/或在DNA提取前发生了细胞复制,单个整合事件可能在测序数据中以冗余形式出现。近期对HIV感染患者基因组DNA的分析通过鉴定含有相同整合位点的DNA序列中独特的超声打断位点/接头连接位点(这些位点只能在PCR前产生)来区分上述情况52-54。目前尚存争议的问题是,存在于克隆扩增细胞中的前病毒是否对潜伏病毒储库有贡献,因此在研究人类患者整合位点时,特别值得关注的是对其扩增水平进行表征。

  1. 与步骤 8.1 中列出的流程类似,生成 .bed 文件,列出从每个唯一整合位点下游延伸的碱基区间,在本例中为下游 25 个核苷酸(此处无需上游碱基)。使用 BEDTools 中的 fastaFromBed 功能,按照以下命令从这些 .bed 文件生成 FASTA 文件:
    fastaFromBed -fi /directory/to/reference/genome/ -name -s -bed 25_base_pair_file.bed -fo output_file.fasta
    注意:为了提高每次搜索的特异性,建议为克隆扩增分析从每个整合位点下游至少提取 25 个核苷酸。
  2. 最好使用自定义脚本,在原始序列数据的 FASTA 文件中搜索所有与每个唯一整合位点下游 25 个核苷酸完全匹配的序列字符串,并将这些序列存入新文件中。从原始字符串中切除 LTR 和连接子序列。通过将读段转换为反向互补序列、切除 LTR 和连接子序列,然后在两个读段至少共享 20 个重叠核苷酸时将 read2 字符串与其对应的 read1 配对,从而合并成对末端(PE)测序读段。
  3. 扫描每个整合位点区块的连接子连接位点。如果连接子连接位点相距 ≥3 bp,则将该整合归类为 "克隆扩增"。
    注意:已有文献描述了不合并测序读段的克隆扩增分析方案52
    注意:超声处理在基因组完全相同的位置造成断裂会导致克隆扩增程度被低估,已有研究描述了校正由此产生的实验偏差的方法63,64

访问受限。请登录或开始试用以查看此内容。

结果

表4列出了一个代表性实验的结果,用以说明NGS在从感染细胞培养物中回收整合位点时的灵敏度。实验中使用未感染的细胞DNA对感染样本的基因组DNA进行系列稀释,该感染样本中平均每细胞含有一个整合事件40。稀释过程以5倍为梯度,最高稀释至1:15,625。随后,对该滴定系列中的基因组DNA通过超声处理或使用限制性内切酶MseI和BglII进行消化,再进行片段化,接着进行LM-PCR。根据上述方案,计算出唯一整合位点的数量,以及映射到选定基因组注释区域附近的位点数量。数据分析显示,从理论上仅有1/15,625细胞被感染的细胞所构建的文库中,仍可回收数十个唯一的整合位点(约为纯基因组DNA回收数量的1-2%)。

在分析整合位点数据集时,必须将数据与一组匹配的随机基因组位点进行比较,该组位点称为匹配随机对照(matched random control, MRC)。由于代表性实验结果分别通过限制性酶切或超声处...

访问受限。请登录或开始试用以查看此内容。

讨论

本文描述了一种从初始病毒感染步骤到基因组整合位点分布图谱绘制的逆转录病毒整合位点分析方案。该方案适用于任何逆转录病毒及可感染的细胞类型。此外,该检测流程具有较高的灵敏度,能够从相当于以感染复数(MOI)为 6.4 × 10-5 启动感染所获得的基因组 DNA 系列稀释样本中,回收到足够数量的唯一整合位点。这种高灵敏度使得该方案在应用于病毒载量较低的感染者样本时尤为有用,因为在这些样本中仅有少数细胞含有整合的前病毒。与本领域先前的方法学文献一致36,38,41-43,本方案中生物信息学部分的多个步骤将受益于开发定制化脚本以处理大规模序列数据文件。尽管本方案中采用的序列比对工具为 BLAT58,但用户可能会发现 Bowtie67(http://bowtie-bio.sourceforge.net/index.shtml)是一个合适的替代选择。

最近报道了一种用于确定莫洛尼鼠白血病病毒(MoMLV)整合位点的替代性生物信息学分析流程19。该流程的优势在于已被开发为公开可用的独立软...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

我们感谢同事 Stephen Hughes 和 Henry Levin 提供的关键建议,这些建议对于在 Engelman 实验室建立用于逆转录病毒整合位点测序的下一代测序(NGS)方案至关重要。本研究工作由美国国立卫生研究院基金 AI039394 和 AI052014(资助 A.N.E.)以及 AI060354(哈佛大学艾滋病研究中心)资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
DMEMGibco11965-084适用于HEK293T细胞的标准细胞培养基
胎牛血清赛默飞世尔科技SH 30088.03不同批次的血清可能需要预先筛选,以获得最佳的病毒产量
青霉素/链霉素康宁30-002-Cl添加至DMEM的抗生素
磷酸盐缓冲液Mediatech21-040-CV用于洗涤细胞
胰蛋白酶EDTA康宁25-053-CI用于从组织培养板上解离贴壁细胞
PolyJetSignaGen LaboratoriesSL100688DNA转染试剂
0.45 µm 滤光片赛默飞世尔科技09-740-35B用于过滤含有病毒颗粒的细胞培养基
Turbo DNaseAmbionAM2239用于降解病毒储备液中的残留质粒DNA
HIV-1 p24抗原捕获检测ABL公司5447用于定量病毒生产的产量
DNeasy 血液 & 组织试剂盒Qiagen69506用于从细胞中纯化基因组DNA
超声波破碎仪CovarisS2使用该型号超声波破碎仪进行两轮处理,工作周期为5%,强度为3,每脉冲周期数为200,时间为80秒
无核酸酶水GeneMateG-3250-125建议使用市售水以降低样品交叉污染的可能性
QIAQuick PCR 纯化试剂盒Qiagen28106用于文库构建过程中纯化 DNA
End-It DNA末端修复试剂盒EpicentreER81050用于修复经超声处理的DNA样本的DNA末端
Klenow片段(3'-5'外切酶)–)New England Biolabs (NEB)M0212S与 dATP 一起用于对修复后的 DNA 片段进行 A 尾修饰
dATP赛默飞世尔科技R0141脱氧腺苷三磷酸
MseINEBR0525L基因组DNA切割用限制性内切酶
BglIINEBR0144L限制性内切酶抑制上游HIV-1 U5序列的扩增
T4 DNA连接酶NEBM0202L/6218用于共价连接相容性DNA末端的酶
DNA寡核苷酸Integrated DNA Technologies定制让公司对寡核苷酸进行纯化。DNA 的纯化采用 HPLC 纯化即可 <30 个核苷酸;长链 DNA 采用聚丙烯酰胺凝胶电泳纯化 
Advantage 2 聚合酶混合液Clontech639202含PCR用DNA聚合酶的商用混合液
dNTPs(100 mM 溶液)赛默飞世尔科技R0181在冰上用无菌水将四种化学物质稀释,使其每种dNTP的中间工作浓度均为2.5 mM
NanoDrop赛默飞世尔科技NanoDrop 2000用于测定DNA浓度的分光光度计
Qubit 荧光仪Life TechnologiesQubit® 3.0用于确认整合位点文库DNA浓度的荧光计
2200 TapeStation 系统安捷伦G2964AA基于胶带的检测法以确认整合位点文库DNA片段大小分布
MiSeqIlluminaSY-410-1003用于NGS

参考文献

  1. Craigie, R., Bushman, F. D. HIV DNA integration. Cold Spring Harb. Perspect. Med. 2, a006890(2012).
  2. Li, M., Mizuuchi, M., Burke, T. R. J., Craigie, R. Retroviral DNA integration: reaction pathway and critical intermediates. EMBO J. 25, 1295-1304 (2006).
  3. Hare, S., Gupta, S. S., Valkov, E., Engelman, A., Cherepanov, P. Retroviral intasome assembly and inhibition of DNA strand transfer. Nature. 464, 232-236 (2010).
  4. Hare, S., Maertens, G. N., Cherepanov, P. 3'-processing and strand transfer catalysed by retroviral integrase in crystallo. EMBO J. 31, 3020-3028 (2012).
  5. Fujiwara, T., Mizuuchi, K. Retroviral DNA integration: structure of an integration intermediate. Cell. 54, 497-504 (1988).
  6. Roth, M. J., Schwartzberg, P. L., Goff, S. P. Structure of the termini of DNA intermediates in the integration of retroviral DNA: dependence on IN function and terminal DNA sequence. Cell. 58, 47-54 (1989).
  7. Brown, P. O., Bowerman, B., Varmus, H. E., Bishop, J. M. Retroviral integration: structure of the initial covalent product and its precursor, and a role for the viral IN protein. Proc. Natl. Acad. Sci. USA. 86, 2525-2529 (1989).
  8. Pauza, C. D. Two bases are deleted from the termini of HIV-1 linear DNA during integrative recombination. Virology. 179, 886-889 (1990).
  9. Bowerman, B., Brown, P. O., Bishop, J. M., Varmus, H. E. A nucleoprotein complex mediates the integration of retroviral DNA. Genes Dev. 3, 469-478 (1989).
  10. Bukrinsky, M. I., et al. Active nuclear import of human immunodeficiency virus type 1 preintegration complexes. Proc. Natl. Acad. Sci. USA. 89, 6580-6584 (1992).
  11. Miller, M. D., Farnet, C. M., Bushman, F. D. Human immunodeficiency virus type 1 preintegration complexes: studies of organization and composition. J. Virol. 71, 5382-5390 (1997).
  12. Engelman, A., Mizuuchi, K., Craigie, R. HIV-1 DNA integration: mechanism of viral DNA cleavage and DNA strand transfer. Cell. 67, 1211-1221 (1991).
  13. Maertens, G. N., Hare, S., Cherepanov, P. The mechanism of retroviral integration from X-ray structures of its key intermediates. Nature. 468, 326-329 (2010).
  14. Holman, A. G., Coffin, J. M. Symmetrical base preferences surrounding HIV-1, avian sarcoma/leukosis virus, and murine leukemia virus integration sites. Proc. Natl. Acad. Sci. USA. 102, 6103-6107 (2005).
  15. Wu, X., Li, Y., Crise, B., Burgess, S. M., Munroe, D. J. Weak palindromic consensus sequences are a common feature found at the integration target sites of many retroviruses. J. Virol. 79, 5211-5214 (2005).
  16. Kvaratskhelia, M., Sharma, A., Larue, R. C., Serrao, E., Engelman, A. Molecular mechanisms of retroviral integration site selection. Nucleic Acids Res. 42, 10209-10225 (2014).
  17. Schroder, A. R., et al. HIV-1 integration in the human genome favors active genes and local hotspots. Cell. 110, 521-529 (2002).
  18. Wu, X., Li, Y., Crise, B., Burgess, S. M. Transcription start regions in the human genome are favored targets for MLV integration. Science. 300, 1749-1751 (2003).
  19. LaFave, M. C., et al. MLV integration site selection is driven by strong enhancers and active promoters. Nucleic Acids Res. 42, 4257-4269 (2014).
  20. De Ravin, S. S., et al. Enhancers are major targets for murine leukemia virus vector integration. J. Virol. 88, 4504-4513 (2014).
  21. Maskell, D. P., et al. Structural basis for retroviral integration into nucleosomes. Nature. 523, 366-369 (2015).
  22. Serrao, E., et al. Integrase residues that determine nucleotide preferences at sites of HIV-1 integration: implications for the mechanism of target DNA binding. Nucleic Acids Res. 42, 5164-5176 (2014).
  23. Aiyer, S., et al. Structural and sequencing analysis of local target DNA recognition by MLV integrase. Nucleic Acids Res. 43, 5647-5663 (2015).
  24. Ciuffi, A., et al. A role for LEDGF/p75 in targeting HIV DNA integration. Nat. Med. 11, 1287-1289 (2005).
  25. Sharma, A., et al. BET proteins promote efficient murine leukemia virus integration at transcription start sites. Proc. Natl. Acad. Sci. USA. 110, 12036-12041 (2013).
  26. Gupta, S. S., et al. Bromo- and extraterminal domain chromatin regulators serve as cofactors for murine leukemia virus integration. J. Virol. 87, 12721-12736 (2013).
  27. De Rijck, J., et al. The BET family of proteins targets moloney murine leukemia virus integration near transcription start sites. Cell Rep. 5, 886-894 (2013).
  28. Demeulemeester, J., et al. HIV-1 integrase variants retarget viral integration and are associated with disease progression in a chronic infection cohort. Cell Host Microbe. 16, 651-662 (2014).
  29. Meehan, A. M., et al. LEDGF/p75 proteins with alternative chromatin tethers are functional HIV-1 cofactors. PLoS Pathog. 5, e1000522(2009).
  30. Ferris, A. L., et al. Lens epithelium-derived growth factor fusion proteins redirect HIV-1 DNA integration. Proc. Natl. Acad. Sci. USA. 107, 3135-3140 (2010).
  31. Gijsbers, R., et al. LEDGF hybrids efficiently retarget lentiviral integration into heterochromatin. Mol. Ther. 18, 552-560 (2010).
  32. Aiyer, S., et al. Altering murine leukemia virus integration through disruption of the integrase and BET protein family interaction. Nucleic Acids Res. 42, 5917-5928 (2014).
  33. Jahner, D., Jaenisch, R. Integration of Moloney leukaemia virus into the germ line of mice: correlation between site of integration and virus activation. Nature. 287, 456-458 (1980).
  34. Stevens, S. W., Griffith, J. D. Human immunodeficiency virus type 1 may preferentially integrate into chromatin occupied by L1Hs repetitive elements. Proc. Natl. Acad. Sci. USA. 91, 5557-5561 (1994).
  35. Wang, G. P., Ciuffi, A., Leipzig, J., Berry, C. C., Bushman, F. D. HIV integration site selection: analysis by massively parallel pyrosequencing reveals association with epigenetic modifications. Genome Res. 17, 1186-1194 (2007).
  36. Wang, G. P., et al. DNA bar coding and pyrosequencing to analyze adverse events in therapeutic gene transfer. Nucleic Acids Res. 36, e49(2008).
  37. Roth, S. L., Malani, N., Bushman, F. D. Gammaretroviral integration into nucleosomal target DNA in vivo. J. Virol. 85, 7393-7401 (2011).
  38. Ciuffi, A., Barr, S. D. Identification of HIV integration sites in infected host genomic DNA. Methods. 53, 39-46 (2011).
  39. Gillet, N. A., et al. The host genomic environment of the provirus determines the abundance of HTLV-1-infected T-cell clones. Blood. 117, 3113-3122 (2011).
  40. Matreyek, K. A., et al. Host and viral determinants for MxB restriction of HIV-1 infection. Retrovirology. 11, 90(2014).
  41. Ciuffi, A., et al. Methods for integration site distribution analyses in animal cell genomes. Methods. 47, 261-268 (2009).
  42. Brady, T., et al. A method to sequence and quantify DNA integration for monitoring outcome in gene therapy. Nucleic Acids Res. 39, e72(2011).
  43. Beard, B. C., Adair, J. E., Trobridge, G. D., Kiem, H. P. High-throughput genomic mapping of vector integration sites in gene therapy studies. Methods Mol. Biol. 1185, 321-344 (2014).
  44. Page, K. A., Landau, N. R., Littman, D. R. Construction and use of a human immunodeficiency virus vector for analysis of virus infectivity. J. Virol. 64, 5270-5276 (1990).
  45. Emi, N., Friedmann, T., Yee, J. K. Pseudotype formation of murine leukemia virus with the G protein of vesicular stomatitis virus. J. Virol. 65, 1202-1207 (1991).
  46. Wehrly, K., Chesebro, B. p24 antigen capture assay for quantification of human immunodeficiency virus using readily available inexpensive reagents. Methods. 12, 288-293 (1997).
  47. Goff, S., Traktman, P., Baltimore, D. Isolation and properties of Moloney murine leukemia virus mutants: use of a rapid assay for release of virion reverse transcriptase. J. Virol. 38, 239-248 (1981).
  48. Willey, R. L., et al. In vitro mutagenesis identifies a region within the envelope gene of the human immunodeficiency virus that is critical for infectivity. J. Virol. 62, 139-147 (1988).
  49. Butler, S. L., Hansen, M. S., Bushman, F. D. A quantitative assay for HIV DNA integration in vivo. Nat. Med. 7, 631-634 (2001).
  50. Brussel, A., Sonigo, P. Analysis of early human immunodeficiency virus type 1 DNA synthesis by use of a new sensitive assay for quantifying integrated provirus. J. Virol. 77, 10119-10124 (2003).
  51. Serrao, E., Ballandras-Colas, A., Cherepanov, P., Maertens, G. N., Engelman, A. N. Key determinants of target DNA recognition by retroviral intasomes. Retrovirology. 12, 39(2015).
  52. Maldarelli, F., et al. HIV latency. Specific HIV integration sites are linked to clonal expansion and persistence of infected cells. Science. 345, 179-183 (2014).
  53. Wagner, T. A., et al. HIV latency. Proliferation of cells with HIV integrated into cancer genes contributes to persistent infection. Science. 345, 570-573 (2014).
  54. Cohn, L. B., et al. HIV-1 integration landscape during latent and active infection. Cell. 160, 420-432 (2015).
  55. Li, X., Ben-Dov, I. Z., Mauro, M., Williams, Z. Lowering the quantification limit of the QubitTM RNA HS assay using RNA spike-in. BMC Mol. Biol. 16, 9(2015).
  56. Padmanaban, A., Walker, D. M. Analysis of high molecular weight genomic DNA using the Agilent 2200 TapeStation and genomic DNA ScreenTape. Publication number 5991-1797EN Agilent Technologies. , Agilent Technologies, Inc. Santa Clara, CA. (2013).
  57. Kapa library quantification technical guide version v1.14. , KapaBiosystems. Boston, MA. (2014).
  58. Kent, W. J. BLAT--the BLAST-like alignment tool. Genome Res. 12, 656-664 (2002).
  59. Quinlan, A. R., Hall, I. M. BEDTools: a flexible suite of utilities for comparing genomic features. Bioinformatics. 26, 841-842 (2010).
  60. Gaur, M., Leavitt, A. D. Mutations in the human immunodeficiency virus type 1 integrase D,D(35)E motif do not eliminate provirus formation. J. Virol. 72, 4678-4685 (1998).
  61. Varadarajan, J., McWilliams, M. J., Hughes, S. H. Treatment with suboptimal doses of raltegravir leads to aberrant HIV-1 integrations. Proc. Natl. Acad. Sci. USA. 110, 14747-14752 (2013).
  62. Kent, W. J., et al. The human genome browser at UCSC. Genome Res. 12, 996-1006 (2002).
  63. Berry, C. C., et al. Estimating abundances of retroviral insertion sites from DNA fragment length data. Bioinformatics. 28, 755-762 (2012).
  64. Firouzi, S., et al. Development and validation of a new high-throughput method to investigate the clonality of HTLV-1-infected cells based on provirus integration sites. Genomic Med. 6, 46(2014).
  65. Mitchell, R. S., et al. Retroviral DNA integration: ASLV, HIV, and MLV show distinct target site preferences. PLoS Biol. 2, E234(2004).
  66. Schneider, T. D., Stormo, G. D., Gold, L., Ehrenfeucht, A. Information content of binding sites on nucleotide sequences. J. Mol. Biol. 188, 415-431 (1986).
  67. Langmead, B. Chapter 11, Unit 11. 17, Aligning sort sequencing reads with Bowtie. Curr. Protoc. Bioinformatics. , (2010).
  68. LaFave, M. C., Varshney, G. K., Burgess, S. M. GeIST: a pipeline for mapping integrated DNA elements. Bioinformatics. 31, 3219-3221 (2015).
  69. Hocum, J. D., et al. VISA - Vector Integration Site Analysis server: a web-based server to rapidly identify retroviral integration sites from next-generation sequencing. BMC Bioinformatics. 16, 212(2015).
  70. Gabriel, R., et al. Comprehensive genomic access to vector integration in clinical gene therapy. Nat. Med. 15, 1431-1436 (2009).
  71. TruSeq Library Prep Pooling Guide. Guidelines for pooling TruSeq libraries for Illumina sequencing systems that require balanced index combinations. , Source: https://support.illumina.com/downloads/truseq-library-prep-pooling-guide-15042173.html (2015).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

连接介导的PCR限制性内切酶消化超声波片段化DNA末端修复半巢式PCRBLAT基因组比对BEDTools分析