可以从识别部分简并序列的酶出发,开发出具有新序列特异性的限制性内切酶。本文提供了我们成功用于改变NlaIV酶序列特异性的详细实验方案。该方案的关键要素包括转录/翻译反应的体外区室化,以及具有新序列特异性的变体筛选。
可以从识别部分简并序列的酶出发,开发出具有新序列特异性的限制性内切酶。本文提供了我们成功用于改变NlaIV酶序列特异性的详细实验方案。该方案的关键要素包括转录/翻译反应的体外区室化,以及具有新序列特异性的变体筛选。
限制性内切酶(REase)特异性改造极为困难。本文描述了一种多步骤方案,有助于获得比亲本酶特异性更强的REase变体。该方案需要构建一个表达选择盒(ESC)文库,用于产生REase的变体,理想情况下在可能影响DNA结合的位点引入变异。ESC的一侧包含所需限制性酶切位点序列及生物素标签,另一侧包含非期望活性的限制性酶切位点以及引物退火位点。ESC在油包水乳液中进行转录和翻译,实验条件确保每个液滴中包含多个DNA分子的可能性极低。因此,每个ESC分子中的DNA仅受到其所编码表达的酶的作用。具有所需特异性的REase变体会切除生物素标签,但不会切除引物退火位点。乳液破乳后,对DNA分子进行生物素下拉富集,仅保留上清液中的DNA分子。此步骤确保仅保留未丧失所需活性的变体对应的ESC。随后对这些DNA分子进行第一轮PCR扩增。非期望序列的切割会移除其中一个引物的结合位点,因此PCR仅扩增来自无非期望活性液滴的ESC。接着进行第二轮PCR,以重新引入所需特异性的限制性酶切位点和生物素标签,从而使选择步骤可重复进行。所筛选出的开放阅读框可在细菌细胞中过表达,这些细胞同时表达亲本REase对应的甲基转移酶,因为新进化出的REase仅靶向甲基转移酶靶位点的一个子集。
对于II类限制性内切酶(REases),序列特异性工程改造极具挑战性。在这类核酸内切酶中,序列识别与催化作用紧密关联,这很可能是一种进化上的保护机制,用以防止产生比其对应的甲基转移酶具有更广特异性的核酸内切酶,从而避免对宿主DNA造成损伤。在细胞中通过定向进化获得新的特异性时,还需额外保护宿主DNA免受新构建的核酸内切酶活性的影响,这进一步增加了实验难度。因此,目前已报道的REase工程改造成功案例极少,且所有这些研究均利用了特定酶的独特性质1,2,3,4,5,6,7。
本文提供了一种详细的特异性改造方案,可用于构建比亲本酶特异性更严格的核酸内切酶变体,该方案基于我们成功改造NlaIV核酸内切酶的经验8。对于具有任意识别序列的此类酶,均可在识别序列侧翼区域引入额外的特异性。对于识别部分简并序列的亲本酶(例如识别GGNNCC靶序列的NlaIV),还可以在识别序列内部引入额外的特异性。由于新增特异性通常需要蛋白质与DNA之间形成新的相互作用,因此新识别的碱基应位于亲本核酸内切酶在DNA上的结合区域(footprint)之内。原则上,可针对任何期望的识别序列特化模式设计筛选策略。然而,大多数识别回文或近回文靶序列的限制性内切酶均为功能性二聚体,仅识别回文序列的一半位点。因此,若新特异性破坏了蛋白质-核酸相互作用的对称性,则此类筛选策略很可能无法奏效。以二聚体NlaIV为例,理论上可将GGNNCC序列特化为GGATCC,但将其特异性进一步限定为GGAACC则预期更为困难。我们的方案包含阳性筛选和阴性筛选两个部分。
当同时采用负向筛选以去除能够切割除优选的较窄特异性序列以外所有序列的酶时,该过程效率更高。例如,可将针对GGATCC的筛选与针对GGBVCC的反向筛选相结合(其中B代表除A以外的任何碱基,V代表除T以外的任何碱基)。当部分可能的目标序列未被覆盖时,筛选实验的结果取决于正向和负向筛选的效果。在我们对NlaIV的研究中,我们进行了针对GGATCC的筛选,并对GGSSCC(其中S为G或C)进行反向筛选,最终获得的特异性可描述为GGWWCC(其中W为A或T),忽略对称性破坏的目标序列,这表明在此特定情况下,负向筛选比正向筛选更为重要。
我们的方法始于构建表达选择盒(ESC)。ESC由多个区段组成。在内部核心区段中,包含在T7启动子控制下的限制性内切酶(REase)开放阅读框(ORF)的不同变体。该ESC的核心区段中不能含有任何与所设计的REase对应的识别位点。核心区段两侧分别夹有野生型REase的两个对应识别位点:一个是非期望活性的切割位点(反向选择序列,本例中为GGSSCC),另一个是期望活性的切割位点(选择序列,本例中为GGATCC)。ESC制备的最后一步是通过PCR在5'端靠近期望活性位点处引入生物素,并生成多种反向选择序列(本例中为GGSSCC)。选择策略依赖于在体外转录/翻译/选择流程之后,使用精心设计的引物对ESC进行再扩增(图1A)。ESC文库在体外以水包油乳液形式进行区室化的转录与翻译9,10,11。在每个液滴内,所表达酶的特异性会影响ESC的状态(图1B,步骤I)。在本描述的结构中,翻译出的蛋白所具有的期望切割活性会移除DNA上的生物素标签,但不会影响另一端带有反向选择序列的ESC末端。当乳液破裂后,通过链霉亲和素亲和沉降去除带有生物素的片段,仅保留来自具有期望活性液滴的片段(图1B,步骤II)。此步骤可去除无活性的REase变体。沉降后的上清组分随后通过PCR进行扩增。第一轮PCR使用引物F2和R1(图1A,B,步骤III)。引物F2结合于反向选择序列与分子末端之间的ESC区段。因此,对于表达出能够切割反向选择序列的变体的ESC,其F2与R1的结合位点会被分割至两个不同的DNA分子中,从而无法扩增,进而从文库中被剔除。引物R1结合于选择位点与ESC核心之间,因此不受选择位点切割状态的影响,并可恢复期望活性的切割位点(GGATCC)。随后通过第二轮PCR(使用引物F1和R2)完成循环,该步骤在5'端靠近选择位点处重新添加生物素,并在ESC另一端附近的反向选择位点处恢复设计的变异(图1B,步骤IV)。所得的DNA混合物即可用于下一轮选择。
筛选方案的成功在很大程度上取决于对新的、更严格的目标识别序列的恰当选择,以及对诱变策略的精心设计和有效实施。由于在限制性内切酶(REase)已有的微弱偏好基础上进行优化远比克服这些偏好更容易,因此我们建议首先开展对其已有偏好的动力学研究。诱变设计必须谨慎的原因在于,本方案所能处理的突变体文库规模有限(单次实验最多处理109个克隆)。因此,仅能在少数几个位点有效检测全部20种可能的氨基酸替换(见讨论部分)。采用随机诱变方法(如作为替代方案提供的易错PCR,EP-PCR)将导致对现有复杂性的严重取样不足。如果有关于可能参与DNA相互作用的氨基酸位点(或甚至位于对应序列中可变核苷酸附近区域的位点)的任何信息可用,则应充分利用这些信息,以选择少数几个位点进行寡核苷酸引导的饱和诱变(方案步骤1.6–3.10)。
1. 胚胎干细胞的制备
2. 诱变引物的分割与混合合成
注意: 此步骤仅用于需要在多个位点进行亚饱和突变的项目。需要使用具有多个合成柱的合成仪。根据突变频率,分配用于合成随机化 NNS 密码子三联体和野生型密码子三联体的合成柱。例如,如果有七个等体积的合成柱可用,并且在特定位点期望的突变率为 0.3,则在约 0.3 × 7(即两个)柱中加入随机化 NNS 密码子,在约 0.7 × 7(即五个)柱中加入野生型密码子(图 3)。
3. 构建突变文库
注意:使用第1.6步中的重组质粒。
4. 进行区室化的体外转录-翻译反应
5. 文库的持续处理与筛选
6. 筛选具有改变序列特异性的变异体
本方案仅是一种通过减少(但不完全消除)两类不需要的酶——无活性的酶和保持原有野生型序列特异性的内切核酸酶——来提高目标工程化限制性内切酶(REase)变体出现频率的工具。另一方面,由于改变限制性内切酶特异性极为困难,因此在一次仅筛选24个克隆的实验中,若能发现一个其切割模式与野生型酶不同的变体,即应视为成功。在我们的实验中,最佳筛选结果可鉴定出高达20%的有前景变体(图8A)。
阳性结果在很大程度上依赖于文库的质量(即突变频率较低且分布随机)以及对生物素化文库成员的有效捕获(步骤 3.6–3.7)。这两个问题均可被检测。应在筛选前通过测序尽可能多的克隆(>15 个)或通过高通量测序对文库进行直接测序(步骤 3.10,表 3)来检查文库质量。如果大多数被选中的克隆均无活性,则明确表明链霉亲和素捕获筛选失败。在经历多次筛选循环的文库中也会观察到类似现象,因为此类文库很可能被那些逃逸了链霉亲和素捕获筛选步骤的无活性变体所主导(图 8B)。因此,建议在每次筛选循环后进行筛选,并进一步手动挑选有前景的变体进行开发,而不是依赖于连续的筛选迭代。

图1:基于NlaIV工程化改造的新型序列特异性体外筛选。(A)表达/筛选盒(ESC)的结构包含两种限制性内切酶(REase)识别位点:1)靠近右端的筛选序列(GGATCC)和2)靠近左端的反向筛选序列(GGSSCC),以及T7p和T7t——分别为T7启动子和T7终止子。引物结合位点如图下方所示。野生型和筛选获得的NlaIV变体的切割位点分别用红色和绿色三角形表示。(B)筛选循环步骤:I)将体外转录-翻译-切割反应混合物与ESC文库进行乳化;II)所有生物素标记的DNA通过链霉亲和素包被的磁性颗粒被捕获并去除,从而消除编码无活性变体的DNA;III)编码具有野生型活性的REase(即能够切割GGSSCC序列)的ESC因该序列被切割而使正向和反向引物结合位点分离,无法进行扩增,从而被剔除;IV)通过在右端重新添加生物素,并在左端重新引入反向筛选序列的变异,生成下一轮筛选的输入文库。转载自Czapinska等8,经Elsevier许可授权。请点击此处查看该图的放大版本。

图2:ESC的制备。 来源于表达载体中原有构建体的片段,该载体包含在T7启动子控制下的NlaIV ORF,经修饰后适用于表达/筛选。在NlaIV ORF下游的NlaIV位点被去除,并在NlaIV ORF中引入了用于定点诱变的唯一酶切位点(SalI、EcoRI和Eco52I),这些突变为同义突变。最终构建体通过引入两个侧翼NlaIV位点的引物进行扩增:左侧为反向筛选序列(GGSSCC),右侧为筛选序列(GGATCC)。反向引物还引入了生物素。用于构建突变型ECS的引物以蓝色箭头表示,并在下方标注(见表1B,C)。请点击此处查看本图的放大版本。

图3:分割与混合合成示意图。 本示例涉及MutB引物的合成,其中在四个位点以0.8的频率引入了NNS序列(另见表3)。请注意,化学合成是从3'到5'方向进行的,但所有序列均以标准的5'-3'方向表示(即在本图中从右向左进行)。突变位点上的野生型序列以绿色显示,而NNS诱变序列以红色显示。用于后续在ESC中引入突变的SalI识别位点以下划线标出。混合与分割步骤的位置(步骤2和4)已标明。请点击此处查看该图的放大版本。

图 4:在寡核苷酸靶向诱变中利用独特的限制性酶切位点。 以构建文库 A-C 的示例(见步骤 3.1–3.7)展示引入突变的策略。经 Elsevier 授权转载自 Czapinska 等8。 请点击此处查看此图的放大版本。

图5:体外转录-翻译系统中的内切核酸酶切割。(A)在最佳限制性内切酶缓冲液中对测试底物的切割:1)底物,含单个NlaIV识别位点的612 bp PCR产物;2)切割产物,分别为355 bp和257 bp。(B)在体外转录-翻译反应(含0.5 µg ESC)中的切割:1–2)不含底物的15 µL体外转录-翻译反应等分试样(第2行:反应中添加1.5 mM MgCl2);3–4)含1 µg测试底物的15 µL体外转录-翻译反应等分试样(第4行:反应中添加1.5 mM MgCl2)。S-DNA分子量标记物(pBR322经MspI消化)。样品在6%非变性PAGE中电泳分离。DNA用溴化乙锭染色。请点击此处查看该图的放大版本。

图6:筛选循环中第一轮PCR的产物。 参见图1B,步骤III;实验方案步骤5.10。第1组和第2组为两个不同文库的等分试样,均以三份上样。S-DNA大小标准(经HindIII和EcoRI消化的lambda DNA)。箭头指示全长ESC(1,050 bp)的位置。请点击此处查看该图的放大版本。

图7:NlaIV 变体经纯化后用于小规模进一步筛选。 参见步骤 6.3.11。每条泳道含有 10 µL 不同变体的等分试样。S-蛋白质分子量标准。NaIV 限制性内切酶亚基的分子质量为 29.9 kDa。 请点击此处查看该图的放大版本。

图8:NlaIV变体在序列特异性改变方面的筛选示例。 参见步骤6.4.2。(A) 成功筛选,具有较高频率的有前景变体。S = DNA分子量标记物,经HindIII和EcoRI酶切的λDNA;野生型(wt)= 经野生型NlaIV酶切的λDNA;λ = λDNA底物,未被酶切;其他列 = 活性极低的变体。变体标注如下:! = 产生与野生型酶不同的酶切图谱的有前景变体;? = 可能具有改变的序列偏好的变体。(B) 筛选失败,大多数变体无活性,且有一个变体显示出明显未改变的酶切图谱。请点击此处查看该图的放大版本。

图9:通过连接进行的替代筛选。 此替代方法可用于所有产生黏性末端的限制性内切酶(REases)。此处我们展示了一个针对MwoI酶的筛选方案示例(未发表)。I) 选定序列(位于ESC的右端),其中红色显示为定义的残基,蓝色显示为对应序列的选定变异;括号中为位于ESC左端的反向筛选序列;II) MwoI切割产物;III) 体外转录/翻译终止后,对产物进行纯化,并使用过量接头进行连接反应。只有在选定序列处被切割的产物才能参与连接,因此无活性的变异体被消除,无需进行下拉步骤。反向筛选序列中的切割产物(位于ESC左端,图中未显示)无法参与此连接反应,因为接头突出端与反向筛选序列不互补;IV) 选择性PCR采用与主方案相同的策略,使用F1引物(结合位点远离反向筛选位点)以消除具有野生型简并序列特异性的变异体,而无活性变异体则通过选择性反向引物被消除,该引物无法结合未切割(因而未被接头连接修饰)的右端。在下一个循环中,可使用与前一步骤切割产物相同的接头(即,图III中的“已切割盒式结构”)以及合适的选择性反向引物重复该过程。请点击此处查看此图的放大版本。
表1:NlaIV基因工程中使用的引物。 注释中提到的限制性酶切位点序列已加下划线。小写字母表示在DNA模板中没有互补序列的区域。请点击此处查看该表格(右键单击可下载)。
表2:本实验方案中使用的PCR反应条件。 Tm = 引物熔解温度(若引物的Tm不同,应使用较低的Tm值)。请点击此处查看该表格(右键单击可下载)。
表3:采用分割混合策略合成的两条诱变引物的质量检测结果。 发生诱变的密码子以 [XXX] 标注。下标数字表示编码氨基酸的位置。改编自 Czapinska 等人8,经 Elsevier 许可。 请点击此处查看该表格(右键点击可下载)。
表4:EP-PCR结果。 通过ECS的22个克隆序列分析得出的主要参数。请点击此处查看该表格(右键点击可下载)。
本文所述筛选方案已用于测试NlaIV8,这是一种二聚体PD-(D/E)XK折叠结构的限制性内切酶,可识别具有中央NN碱基的回文靶位点,并在NN碱基之间催化产生平末端切割。选择NlaIV的原因在于,其在NN碱基之间发生切割表明,在复合物中这些碱基靠近蛋白质。原则上,该方案可适用于任何序列特异性的限制性内切酶,无论其为单体或二聚体、属于任何折叠类型,且无论其催化双链断裂产生何种交错末端,也不论催化结构域与特异性识别结构域是否重合(如NlaIV示例)或分离(例如FokI)。此外,该方案原则上不仅可用于获得具有更窄特异性的新酶,还可用于消除星号活性(star activity),或构建高保真内切酶。然而,上述应用尚未经过全面验证。特别是,靶向消除星号活性可能较为复杂,因为相同的氨基酸残基可能同时参与对期望靶标和非期望靶标碱基的结合。本方案中描述的体外步骤不仅限于筛选特异性更窄的变体,也可用于筛选其他类型的特异性改变。然而,对于特异性发生改变的内切酶变体,存在一个问题:如果其底物谱包含亲本内切酶无法切割的新靶标,则通常难以有效保护细胞免受该酶活性带来的有害影响。相比之下,若内切酶的特异性仅被缩小,则其靶标为野生型靶标的子集,因此已有的对应甲基转移酶应能提供完全保护。
本实验方案在多个方面不同于传统的定向进化方案。开放阅读框的多样性仅在实验开始时生成一次,而非在每一轮迭代中都进行。此外,该多样性是通过分组混合合成(split-and-mix synthesis)产生,而不是通过错误倾向PCR(EP-PCR)实现。对于本研究中所采用的密码子NNS替换方式,六个位点的组合数为(4 × 4 × 2)6 ≈ 1.07 × 109。因此,在1.7 fmoles的ESC中,平均每个特定变异体仅出现一次。通过使用Glen Research公司提供的含有20种三核苷酸前体的混合物进行合成,或将分组混合寡核苷酸合成策略用于突变频率较低的位点,可将该能力扩展至七个位点。如果可能,建议将变异范围限制在六个位点以内。显然,这种靶向诱变需要对限制性内切酶(REase)中参与底物结合的区域至少具备一定的先验知识。与EP-PCR相比,分组混合合成策略在产生多样性方面具有明显优势。在对NlaIV ESC进行EP-PCR时,我们曾在同一次反应中同时获得未发生改变的野生型序列以及携带八个突变的序列(表4)。EP-PCR构建的文库中含有大量应避免的克隆,包括野生型序列、多重突变、移码突变和无义突变,以及发生在不太可能影响序列特异性位点上的突变。
我们的方案与许多其他定向进化方案的不同之处在于包含两个连续的选择步骤。阳性选择确保保留所需活性,否则生物素标签不会被去除,编码序列可通过下拉法去除。从技术上讲,如果在期望的切割位点附近(而非其他位置)存在合适的切割位点,则偶然出现新的、不重叠的特异性(例如GCATGC)也可能导致生物素标签被切断。然而,这种情况极不可能发生。阴性选择则用于去除编码仍保留非期望活性酶的开放阅读框。此步骤并非绝对必需,因为该方案仍可富集那些能够切割选择序列但无法在ESC其他位置切割的变体,从而使其不适合PCR扩增。然而,选择效率预计会较低,因为具有原始序列特异性的酶不会被清除,从而会优于那些特异性已改变但酶活性有所下降的有前景变体。请注意,在群体水平上,期望和非期望的靶序列均可为简并序列,但并非必须如此。在NlaIV示例中,反靶序列为简并序列,而靶序列为非简并序列。即使在群体水平上存在简并性,在单个液滴中仅存在一个(非简并的)靶序列或反靶序列。在我们的方案中,靶序列和反靶序列在每轮选择步骤中都会被重新引入。因此,只有编码能够切割所有可能靶序列、同时不能切割任何反靶序列的酶的开放阅读框,才能在多轮选择中存活下来。需要注意的是,由于在每轮迭代中都必须重新引入反选择靶序列,因此强制进行两次连续的PCR。第一次PCR使用与反靶序列外部区域退火的引物,从而使反靶序列的切割能够阻断PCR反应。第二次PCR则需要一个跨越反靶序列的引物,并重新引入反靶序列,以确保在多轮选择过程中,每个开放阅读框均被测试针对所有反靶序列变体的耐受性。
对于产生黏性末端的酶,可采用一种基于先前报道的REase ORF分离方法的替代方案10。在我们的实验中使用的通过生物素捕获去除无活性变异体的步骤,在该替代方案中被替换为连接带有特定序列的兼容性接头,该序列在选择性PCR中作为引物结合位点(图9)。只有那些产生具有目标特异性的酶的ESC才能形成可连接的末端,从而被筛选出来。所设计的反向选择序列的黏性末端序列必须确保其无法与接头发生连接反应。通过在选择性PCR中交替使用两种不同的接头以及相应的两种不同的反向引物,可轻松实现筛选过程的迭代。
即使采用新的实验方案,在体外构建具有新特异性的酶仍然极具挑战性。对于典型的II型限制性内切酶(REases),其序列特异性与内切核酸酶活性依赖于相同的蛋白质区域,因此在改变其中一个特性的同时不影响另一个特性十分困难。若采用一种综合考虑酶的作用位点、尊重蛋白质- DNA 相互作用对称性,并基于预先存在的酶学偏好的策略,则更有可能获得成功;这种酶学偏好应通过生化实验事先确定,正如NlaIV的例子中所进行的那样8。
作者无任何利益冲突需要披露。
本工作得到了科学与高等教育部资助(MB:0295/B/PO1/2008/34,KS:N301 100 31/3043)、波兰国家科学中心(NCN)资助(MB:UMO-2011/02/A/NZ1/00052、UMO-2014/13/B/NZ1/03991 和 UMO-2014/14/M/NZ5/00558)以及KS获得的EMBO短期奖学金(ATSF 277.00-05)的支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 1000Å CPG 载体(dA、dT、dC、dG) | Biosset | 45-1000-050 | 也可使用其他供应商的产品 |
| ASM-800 DNA/RNA 合成仪 | Biosset | 800-001-000 | |
| GeneJET 凝胶回收试剂盒 | Thermo Scientific | K0691 | 可使用任何其他同类试剂盒 |
| Glen-Pak DNA 纯化柱 | Glen Research | 60-5200 | |
| HIS-Select 镍亲和凝胶 | Sigma | P6611 | |
| pET 28a 载体 | 可使用任何在克隆位点上游含有 T7 启动子的其他载体替代 | ||
| Phusion 高保真 DNA 聚合酶 | Thermo Scientific | F530S | 可使用其他高保真且高效延伸的嗜热聚合酶替代 |
| 多孔钢箔 | Biosset | 40-063 | |
| Rapid Translation System RTS 100, E.coli HY 试剂盒 | Roche | 3 186 148 | |
| 限制性内切酶 | Thermo Scientific | 显然也可使用其他供应商的酶 | |
| 链霉亲和素磁珠 | New England Biolabs | S1420S | 也可使用其他供应商的产品。我们已成功测试过 Sigma 的磁珠 |
| 合成试剂,包括亚磷酰胺 | Carl Roth | 也可使用其他供应商的产品 | |
| 合成柱(不同规格) | Biosset | ||
| T4 DNA 连接酶 | Thermo Scientific | EL0011 | 可使用任何其他连接酶 |