本方案提供了一种通过自动化辅助的基因文库构建与评估,对基因编码的生物传感器进行系统性全局优化的方法。该方法结合实验设计(design-of-experiment)策略,以简化实验流程,并实现对基因元件的选择,从而将生物传感器调节至特定的设计目标。
方法文章
本方案提供了一种通过自动化辅助的基因文库构建与评估,对基因编码的生物传感器进行系统性全局优化的方法。该方法结合实验设计(design-of-experiment)策略,以简化实验流程,并实现对基因元件的选择,从而将生物传感器调节至特定的设计目标。
基因编码的生物传感器是用于高通量信息处理的强大工具,能够将环境或化学输入信号转化为多种输出信号。这使得在广泛的生物技术应用中实现基因表达的动态感知、直接控制和精细调控成为可能,包括酶的优化、菌株开发以及微生物过程控制。为了使其适应特定用途,可通过调整生物传感器回路组分的化学计量比(例如转运蛋白、输入模块和输出模块),和/或调节相关的宿主-生物传感器分子间相互作用(例如DNA-蛋白质、蛋白质-蛋白质相互作用)来优化生物传感器的性能。然而,此处可能存在的大量生物传感器组合形成了复杂的组合设计空间,因此需要仔细优化筛选策略,以鉴定出能够实现期望表型性能的配置。这种复杂性还因生物传感器的性能特征(例如可调性)而进一步加剧,这些特征需要在单克隆筛选条件下进行效应物滴定分析。因此,探索多样化序列和实验空间的需求使得部分采样方法特别适用于此目的。支撑该工作流程的是实验设计(Design of Experiment, DoE)算法,这类算法能够高效地基于统计学方法对这一组合式实验设计空间进行结构化映射和部分采样。
本文报道了一种结合高通量自动化与计算方法的综合策略,可高效采样基于变构转录因子的生物传感器的设计空间,从而获得具有数字式和模拟式剂量响应曲线的不同构型。该实验方案首先构建启动子和核糖体结合位点文库,并通过自动化手段进行筛选。这些文库及其相应的表达数据被转化为结构化的无量纲输入,从而实现对整个实验设计空间的计算映射。随后采用实验设计(DoE)算法进行部分采样,并结合高通量自动化平台进行效应物滴定分析。该工作流程为未来生物传感器系统和基因线路的开发与优化提供了一个通用框架,为合成生物学领域提供了一套调控工具包。
调控基因表达的能力是所有生命形式中的一项基本功能,可实现对内部和外部影响因素(从化学效应物到生物物理刺激)的动态、实时响应1。自然界中存在的大量转录调控系统,在合成生物学推动的代谢工程和生物技术研究的增强与加速方面具有巨大潜力。在原核生物中,细胞内的大部分调控是通过单组分调控机制实现的,该机制由变构转录因子(aTFs)与多种小分子效应物相互作用所驱动2。aTFs通常包含一个效应物结合域(EBD)和一个DNA结合域(DBD),当其与特定的小分子效应物结合时,会作为分子开关发挥作用,改变其DBD对基因组启动子区域中特定DNA操纵序列的亲和力,从而导致转录的激活或抑制3。这一看似简单的机制衍生出了多种多样的调控策略,从抑制/去抑制系统到能够检测并响应大量小分子效应物或环境刺激的激活因子,种类繁多4。因此,合成生物学利用这种多样性构建了可遗传编码的生物传感器,能够将多种输入信号耦合为定制化的输出,例如荧光报告蛋白的产生以及对合成通路的调控。在生物技术工作流程中应用此类系统,可实现对细胞内代谢物浓度的实时监测、通路的动态调控,以及提供简便的读出方式,有助于开发更高效的代谢通路、菌株和生物工艺过程5,6,7,8。
从根本上讲,生物传感器的特性可通过多个参数来表征,包括特异性、工作范围、动态范围、灵敏度和斜率,其中生物传感器的剂量-响应曲线通过输出信号随配体浓度变化的关系来描述这些参数(图1)9,10,11,12。希尔方程可用于拟合生物传感器的性能特征,为上述各项参数提供半经验性依据,从而在表征生物传感器系统的同时,也为评估实现应用导向目标所需的系统优化工作提供支持。特异性可定义为一种效应分子所诱导的信号输出相对于其他一系列潜在效应分子所诱导信号输出的相对差异,通常在aTF的效应物结合结构域(EBD)水平上进行调控。工作范围是指生物传感器能够感知的配体浓度区间,决定了该传感器可响应的浓度范围。相比之下,动态范围描述的是最高可测激活状态(ON)与非激活状态(OFF)之间的比值,是确保生物传感器能够可靠报告高于背景自发荧光水平的效应物浓度的重要参数10。效应分子的灵敏度则以引发特定输出信号所需的浓度来表示,通常用效应物的半最大有效浓度(EC50)进行测量13。最后,曲线的斜率由aTF在其启动子区操作子位点上的协同性(nH)决定,从而导致更接近数字式或模拟式的响应输出特征。协同性的产生源于配体结合后的aTF之间发生蛋白质-蛋白质相互作用,形成多聚体复合物,增强其对操作子位点的亲和力,进而在配体浓度达到饱和时引起电路响应性的急剧上升,呈现出更趋数字化的响应特征14。
生物传感器的剂量响应特性会显著影响其应用的适用性,通常是决定任何概念性应用能否成功的关键因素。不同系统的生物传感器性能差异巨大,其工作范围通常在 0.1 nM–10 mM 之间。13,而动态范围可达1.4至2000倍15此外,尽管已报道的aTF效应化合物种类广泛(代谢产物、氨基酸、金属、抗生素、群体感应等)11然而,现有生物传感器并非无所不包,当文献中尚未存在适用于特定效应分子的生物传感器时,便给研究人员带来挑战。合成生物学的发展使得生物传感器的理性设计成为可能,从而能够调节效应分子的作用范围及其剂量-响应特性,使之更贴近具体应用的研究目标,并已分别被用于解决上述两方面的问题。16,17. 工程学的两个关键领域是可靶向的 通过 合成生物学,生物传感器的启动子区域以及人工转录因子(aTF)本身,在转录和蛋白质水平上介导其作用效果。本研究方法重点关注通过改造生物传感器的遗传元件以调节启动子水平性能的策略,包括对核糖体结合位点(RBS)、操纵位点以及-35和-10区(六碱基盒)的工程化改造,从而优化灵敏度、工作范围和动态范围。图1或者,通过分析生物传感器的效应物结合域,并对参与效应物协调的残基进行突变(利用序列同源性或/和结构生物学方法),可调节其对相应效应物的响应,从而改变该生物传感器的选择性和灵敏度18,19,20 或将其完全转变为一种非同源的效应分子16,17,21此类优化工作可引导生物传感器面向特定应用,这些应用通常包括代谢调控器(反馈回路、控制电路)、初筛工具(酶或菌株发现)、次筛工具(酶变体筛选、代谢工程)以及转运蛋白生物挖掘。22,23,24一个例子是利用对粘康酸响应的转录因子CatM,并结合人工设计的启动子序列,以提升系统的动态响应范围和操作范围。该系统与荧光激活细胞分选技术联用,在实验室适应性进化后,根据GFP荧光强度筛选出粘康酸产量最高的菌株。25.
尽管上述工程策略的成功显而易见,但合成生物学家可用于调节生物传感器的调控元件之间存在的相互依赖性,可能使设计过程复杂化,并延长生物传感器的开发周期,这可能会使部分研究人员不愿将其引入自身的工作流程中。如图1所示,试图通过修改六碱基盒(hexboxes)来调节生物传感器以实现特定目标时,可能会无意中削弱其他参数,这种相互依赖性是生物传感器工程中公认的一项挑战12。常见的生物传感器调节方法包括理性设计和定向进化工程:前者依赖于对系统结构和机制特征的先验知识(a priori understanding),将实验聚焦于成功概率较高的组分;而后者则依赖于随机诱变与自然进化,并结合高通量筛选,以挑选出具有优化特性的变异体26,27,28,29,30。尽管这些方法有效,但两者均存在某些局限性:例如,靶向工程因其专注于特定的结构或功能元件,往往对整个实验空间的探索有限,可能忽略别构效应或次要影响30。非靶向文库构建与筛选虽然在无需前期大量设计工作(即文库设计与构建)的情况下,适合以无引导方式优化设计,但仍需倾向于产生有益突变。若缺乏此类偏向性,则预计会有更大比例的突变是有害的,从而需要更多的筛选工作31。因此,能够综合考虑生物传感器各组成部分(如aTF、RBS、操纵位点和六碱基盒)的直接效应,以及这些组分之间如何相互作用以影响生物传感器参数的整体性策略,极具吸引力。
结构化多变量实验与统计建模方法已被广泛应用于过程工程工作流程中,旨在通过尽可能少的实验次数来探索多维实验空间。这种结合实验与建模的方法称为实验设计(Design of Experiments, DoE),其关键优势在于使研究人员能够在无需进行大量实验的前提下,针对预设目标优化复杂的多变量过程。 先验的 知识23,30尽管实验设计(DoE)通常用于优化连续变量,因其在结构化实验探索中更为便捷,但也已被应用于遗传水平上代谢途径的优化31,32,33这包括一个初步筛选步骤,其中选择被认为对期望结果最重要的因素,随后进行优化步骤,调整所选因素以获得期望的输出,在本例中即优化特定的生物传感器参数,以扩大其应用范围。关键的是,该技术可与自动化液体处理平台联用,将筛选通量提高至可处理中等规模的103 - 104 基于数据驱动的方法对生物传感器性能进行全局优化23下文介绍了一种基于实验设计(DoE)驱动的生物传感器优化方法,结合液体处理机器人技术,以简化文库构建、筛选及数据采集流程,实现对生物传感器灵敏度的全局优化。
1. RBS/启动子元件设计
2. 零件文库的构建与验证
3. 零件文库克隆筛选——自动化
4. 数据处理/转换与差异排序




5. 确定性筛选设计生成/实验设计
6. 重复步骤2——设计并构建由实验设计(DoE)指导的遗传设计方案
7. 筛选与数据合理性分析
最初,必须选择可能影响生物传感器功能的模块进行变异;这包括转运蛋白的调控,其可影响配体的胞内浓度,从而影响生物传感器的输出,同时也包括aTF自身以及荧光报告基因或输出基因的相对转录和翻译水平图1). 图2 展示了一种基于实验设计(DoE)的生物传感器优化实验开发中的典型工作流程;该流程始于将调控元件组织为可独立操作的不同模块 通过 通过序列水平的改变,特别是在操纵子位点、六碱基盒或核糖体结合位点(RBS)处,实现合成生物学的调控图2A)。因此,实验设计(DoE)工作流程的下一步是对序列位点进行随机化,以生成变异体文库(图2B). 必须仔细考虑随机化的程度,因为筛选的菌落数量应与随机化的程度相匹配 4N,其中 N 等于随机化的碱基位点数量。在实验设计(DoE)中,若将每个独特的启动子或核糖体结合位点(RBS)序列视为一个独立的分类变量,将导致所需构建的实验载体数量达到实验上不可行的程度。因此,有必要通过对文库进行表征,将这些序列信息转化为连续变量,作为筛选的关键步骤,以评估随机化所获得的功能范围,并确定功能的高、中、低区间。这一过程首先通过报告基因检测文库的输出水平,作为衡量 RBS 或启动子变异体强度的指标来实现图2C)。如图所示,进行线性-对数转换,将连续变量离散化为若干水平,以便实验设计(DoE)探索不同组合,并建立描述这些变量效应的模型。随后采用包含3个水平的筛选设计,以组合方式描述每个因子活性范围内的变化情况(图 2D通过组装和测试所建议的设计,可高效探索实验空间并揭示各因素之间的相互作用。对所得数据进行统计分析,以确定哪些因素组合对生物传感器输出具有最显著的影响,同时采用SLSR预测系统在不同条件下的行为,从而推动生物传感器在特定目标(如提高动态范围或灵敏度)方面的优化。图 2D).
图3 展示了一个由人工转录因子(aTF)调控的启动子文库的构建与筛选方法。通过使用简并寡核苷酸进行等温组装,构建了质粒编码的文库,其中每个质粒在特定位置具有独特的随机化序列。文库的多样性程度最终决定了需要筛选的菌落数量,理论文库规模较大时,自动化筛选将显著提高效率。对与TphR同源操纵子的启动子序列分析提供了碱基保守性图谱,用于指导随机化位点的选择,特别是那些具有一定变异程度、可能调节启动子活性但并非绝对必需的碱基位点。23在-35和-10六联体区域中各选取三个碱基,以及在操纵子位点中选取六个碱基,进行完全随机化图3A),从而构建出约含 500,000 个启动子序列的理论文库。随后将质粒文库用于转化宿主菌株。在此阶段,高效的转化效率至关重要,以确保获得足够的文库覆盖度,常见的优化与故障排除方法如下所示 图3B优化DNA浓度、转化方法和克隆设计可显著提高转化子产量。 图3C 展示获得转化子后的典型工作流程:首先需将对应于不同变异体的单个菌落接种于培养基中生长,然后才能开始任何表征工作。为了覆盖理论文库规模,需要挑取并排列大量变异体至微孔板中。利用液体处理仪和菌落挑选仪等自动化系统可显著简化这一耗时费力的步骤。第1步 图3C 展示了将生长培养基转移至已手动装载到液体处理仪对接位的多孔板(MTPs)中,随后由菌落挑取仪进行自动接种的过程。某些步骤(如封板和将板转移至离线培养箱)为手动操作,但也可根据需要实现自动化。在培养物生长完成后,液体处理仪还可通过添加甘油制备冷冻保存菌种,如图所示。 图3C在此阶段,对培养板进行条形码标记可确保每个挑选出的变异株均与特定的培养板及孔位位置相关联,便于后续下游表征工作的准确追溯。自动化操作的主要优势之一(除减少人力外)是降低人为误差,使文库构建阶段的错误更不易被延续到后续步骤中。第2步 图3C 展示了文库构建的自动化表征阶段。该阶段始于 通过 使用液体处理平台将培养基加入深孔板(DWB),随后利用条形码冷冻菌种进行接种。此阶段的自动化操作可再次确保移液误差和人工操作降至最低。随后将微孔板密封,并手动转移至离线培养箱中进行培养;此时可开始将效应化合物点样至新的深孔板中。在对元件文库进行初步筛选时,简单的“开启/关闭”(ON/OFF)筛选策略可能是理想选择,因其可用于预筛出活性等于或低于基础构建体的非功能性变异体,从而富集具有增强活性的变异体。该策略还具有额外优势,即减少移液耗材(如吸头和微孔板)的材料成本,而这些成本在大规模文库筛选流程中可能变得极为高昂。然而,当需要优化更复杂的生物传感器性能指标时(例如,EC50),需要额外的效应物浓度。培养完成后,将培养板放回液体处理仪平台,由该平台开始向含有效应物化合物的培养板中接种,随后再手动将培养板放回培养箱,继续孵育直至实验结束。 图3D 展示数据收集前的最后一步自动化操作。在经过指定的生长时间和生物传感器激活时间后,将培养板从离线培养箱中取出,并放回液体处理平台。为去除可能干扰荧光信号检测的残留培养基,需对样品进行离心、移除上清液,并用1×PBS缓冲液洗涤细胞。液体处理系统可再次简化该流程,通过自动重悬菌液实现对培养板的快速处理,包括将洗涤后的细胞转移至96孔微孔板(MTP)中用于后续筛选。数据收集可采用手动或自动化方式进行,部分读板仪配备板堆栈功能,可与液体处理系统联用,进一步实现数据采集过程的自动化。通过比较效应分子存在(ON)与缺失(OFF)条件下生物传感器激活程度的比值,共评估了5,000个突变体的生物传感器激活倍数(fold change),以确定其功能活性;仅保留激活水平高于基础构建体(3.6倍)的突变体进入后续表征,如散点图中红粉色阴影区域所示图3D根据富集变异体文库所在的孔板位置,可回溯至实验流程第1步制备的条形码冷冻保存文库孔板,进而通过生物学重复实验或不同效应分子浓度条件,对目标变异体进行稳健的表征分析。
图4 展示了从初始文库筛选中分层筛选出的变异体,旨在构建一个用于优化灵敏度的启动子文库。基于此前工作流程中筛选的5,000个变异体数据,从初始的“开/关”筛选中确定出226个活性高于亲本序列的变异体,进一步对其灵敏度进行表征和排序,以便作为设计DSD(Definitive Screening Design)时的因子水平。第一步是将分类变量(本例中为Pout的高活性变异体)转换为跨越广泛灵敏度范围的连续变量。为了筛选灵敏度,需要通过绘制Hill函数获得EC50数据的剂量-响应曲线;这显著增加了平板操作的工作量,因此非常适合使用液体处理仪来自动化实验设置和筛选过程,如图4A所示。按照图3C步骤2建立的工作流程,利用与富集变异体池相对应的平板条形码和孔位信息,将菌种接种至含有培养基和抗生素的DWB(深孔板)中。为增强实验的可靠性,每个变异体均设置生物学重复三次。在将平板转移至离线培养箱进行培养后,使用液体处理仪将新鲜DWB分别加入含0、25和1000 µM效应物的培养基,以减少人工操作。为减少实验所需平板数量,选择覆盖剂量-响应曲线底部、中部和顶部的浓度范围,其中中点浓度可揭示各变异体的相对灵敏度,如图4A所示。在每个效应物浓度下接种变异体文库并检测荧光强度和OD600后,绘制剂量-响应曲线,并通过非线性回归分析确定EC50值。在此阶段,生成了每个变异体具有唯一EC50值的原始文库,并选取其中最稳定的前100个变异体进入下一步,如图4B所示,以进一步缩小文库规模。然而,在将该文库用于实验设计(DoE)之前,必须将这些独特变异体转化为一个代表其灵敏度范围的有序文库。这一目标通过数据的线性-对数(lin-log)转换实现,该转换对数据进行排序和重缩放,使每个变异体按灵敏度从高(-1)到低(+1)排列,同时定义一个中点值(0),代表数据集的几何平均值,如图4C所示。原始数据经转换后得到如图4D所示的蓝色曲线图,从中选取对应于+1、0和-1的离散Pout序列,作为Pout因子水平进入最终的筛选设计。
图5 展示了从DSD生成到基于实验设计(DoE)辅助学习的生物传感器建模与全局优化的完整工作流程,该流程始于文库构建之后。 图 5A 将典型的生物传感器分解为三个模块,其中转运模块和调控模块各有一个调控节点,输出模块有两个调控节点。以以下示例为例 图4,RBS 或启动子文库将被构建,并选择从 +1、0 到 -1 的水平,以涵盖每个因素的最大变异范围。筛选文库的规模通常决定了全面探索设计空间所需的实验次数,例如,若每个文库的大小为 22,则相当于 22 次实验4 (234,256) 种组合。实验设计(DoE)旨在通过结构化的筛选设计减少组合数量,从而简化实验工作量。尽管存在多种方法,但DSD(Definitive Screening Design,确定性筛选设计)在生物传感器开发中尤为理想,因其能够在避免混杂二阶效应的同时识别主要因素及双因素交互作用。此外,由于DSD设计采用三个水平,还可用于估计曲率(非线性)。 图 5A 展示了典型的DSD输出,其中4个模块分别设置为不同水平;由于每个水平对应特定的启动子或RBS变体,因此采用等温组装方法生成与DSD推荐设计相对应的遗传构建体。将推荐的构建体组装并转化至宿主菌株后,使用一系列浓度梯度的效应分子获得剂量-反应曲线,以更可靠地评估各构建体的性能 图5B由于DSD显著减少了构建体的数量,此步骤通常可手动完成,或根据需要使用自动化液体处理仪进行。 图5C 展示了在利用DSD筛选构建并测试建议组合、以及基于Hill系数(n)建立预测模型后,所获得的预测谱型的输出结果H)和 EC50 每种测试组合的输出结果。本实验的目的是构建一种在整体上对两种目标物均实现优化的生物传感器结构H 和 EC50 通过调控四个调控节点的表达水平,以最大化这两个参数。每个调控因子在各自的列中显示,其表达程度沿x轴表示,对应于经线性-对数转换的启动子和核糖体结合位点(RBS)元件文库(-1至+1)。改变各节点表达水平对EC的影响50 和 nH 由子图中的曲线表示。轮廓图凸显了生物传感器优化过程中常出现的非直观特性,即调控一个调节节点可能对输出参数产生相反的影响。例如,RBS转 未显示出与 n 有强相关性H,然而,它与EC呈正相关50 以非线性方式。在核糖体结合位点(RBS)的情况下,也暗示存在高阶(非线性)相互作用。出 强度增加会增大斜率(n 值更高)H)的同时灵敏度提高(EC50降低)50),从而产生具有更陡峭斜率和对效应物浓度增加更敏锐响应的曲线。通过这些模型,可以更清晰地揭示生物传感器调控中一些非直观的特性,进而推动调控节点向全局最优优化。这些模型被用于预测两种EC的全局最优值50 和 nH ,图中红线表示每个调控节点的最佳水平图 5C). 图 5D 展示了初始亲本生物传感器构建体(蓝色)与表现最优的DSD设计(绿色)及全球优化构建体(紫色)的剂量-反应特征对比。利用该模型预测最优模块强度,以最大化EC50 和 nH,一个对应于RBS的变异体转 (-1), Preg (-0.7), P出 (-0.3) 和 RBS出 (+1) 力量被组装并进行了表征,优化后的构建体显示出在EC方面的增强50 和 nH (图 5D)。尽管DSD和全球优化的生物传感器表现出相似的EC50 (0.8 对比 0.7 µM),nH 在不损害EC的情况下显著提高50 已取得的成果。结果明确展示了数据驱动设计相较于基于直觉的方法所具有的优势,并验证了实验设计(DoE)在简化和优化生物传感器调校过程中的有效性。

图1:基因编码型生物传感器参数的调控。 基因编码型生物传感器的遗传模块结构,包括aTF、操纵位点(OS)、六碱基盒(-35,-10)和RBS元件。彩色框表示通常影响生物传感器参数的相互作用,例如:配体与aTF的亲和力(灰色)、aTF与操纵位点的结合(粉红色)、RNAP与六碱基盒的结合(绿色)以及RBS(橙色)。各参数对剂量-响应特性的影响在代表性图示中予以标明。请点击此处查看该图的放大版本。

图2典型DoE生物传感器优化工作流程概述 (A生物传感器组件模块化概述,展示了一个编码转运蛋白的转运模块,用于导入目标效应物;一个与aTF相关的调控模块;以及一个编码报告蛋白(如sfGFP)的输出模块。图中还显示了调控节点,例如RBS。转,Preg,P出 和RBS出 对应于将进行随机化的遗传节点,以探索生物传感器的参数。B) 一系列可进行碱基随机化的序列元件,包括启动子和核糖体结合位点(RBS)。上方第一行为启动子的亲本序列,下方为最终确定的突变序列;星号表示未改变的碱基,K、M 和 N 分别代表鸟嘌呤/胸腺嘧啶、腺嘌呤/胞嘧啶或任意核苷酸。通过靶向六联体盒(hexboxes)或操纵位点,启动子可实现更广泛的随机化,还可包括序列的重复或间隔区的修饰。相比之下,RBS 文库的随机化选择较为有限,但由于其最大多样性较低,筛选起来显著更为简便。C) 对各变异体的表达水平进行表征,随后转换为分级的线性-对数文库,将分类的变异因素转化为更易于分析的3个离散水平 通过 DoE。(D通过使用每个模块三个水平的多重组合来映射实验空间,从而建立可用于指导设计选择的模型,以调节生物传感器性能,使其趋向于期望的结果,例如动态范围或灵敏度。 请点击此处以查看此图的放大版本。

图3生物传感器模块化、启动子文库构建与自动化工作流程 (A特定aTF启动子序列随机化及插入生物传感器构建体的示例 通过 等温组装。加粗字母表示在简并寡核苷酸合成过程中,根据提供的密码在操纵位点或六联体框中发生随机化的位点。B) 描述将获得的生物传感器变体文库转化至克隆宿主(如 大肠杆菌, 根据转化子产量决定后续步骤。转化效率低可能导致理论文库覆盖率不足,无法充分探索设计空间。此阶段必须进行故障排查,以确保有足够数量的变异体可供表征,并概述了常见的故障排查措施。C步骤1和步骤2的工作流程,如方案中所述,红色手形符号表示手动操作步骤,齿轮符号表示自动化步骤。步骤1的工作流程重点展示了从菌落筛选到冷冻保存菌种制备的关键步骤。步骤2的工作流程则展示了将冷冻保存菌种复苏并重新排列,用于剂量反应曲线测定的过程。D显示筛选前最终操作步骤的图示,包括细胞洗涤及转移至检测板,随后进行荧光和OD测定。图中展示了一个包含5000个变异体的筛选库,其中表现出相较于亲本启动子序列更高ON/OFF比值(超过3.6倍)的变异体以橙色框标出。可见大量变异体聚集在比值1附近,表明其性能较差且变异性低,可能由于序列层面的随机化导致功能丧失。图中框选出的226个变异体被进一步用于稳健性表征。数据改编自Alvarez Gonzalez等人的原始发表文献。23. 请点击此处以查看此图的放大版本。

图4启动子文库最优变体筛选与离散化 通过 线性-对数转换 (A) 生成RBS或启动子文库表达数据的标准流程示意图。利用已分选的、代表较宽表达水平范围的变异体,通过液体处理系统将效应物以预设浓度预先加入检测板中,用于获取226个分选变异体的剂量-响应曲线。B) 内皮细胞培养后50 确定并进一步将文库缩小至100个变体后,数据以柱状图形式展示,显示由启动子随机化产生的不同敏感性的分布情况。C)EC50 数据通过线性-对数速率方程进行转换,将连续数据集转化为更适合在DSD中进行因子分解的分类数据。D) 转化后的EC50 变异数据现已被简化为简化比例尺,并按EC值从高到低排序50 活性。据此选择对应于最高水平(+1)、几何平均值(0)和最低水平(-1)的三个水平,并将其推进至DSD中以探索实验空间。 请点击此处以查看此图的放大版本。

图5DSD实验设计、测试及基于模型的学习成果。 (A) 示意图工作流程,展示基于RBS的线性-对数转换后排序文库生成DSD设计表的过程转,Preg,P出,和RBS出 模块。DSD设计表建议使用最少的组合来高效地映射实验空间。示例输出中,+1、0 和 -1 分别表示每个调控节点中表现最优、中等和最差的变体,如线性-对数转换所述。这些变体由此构建而成 通过 等温组装,并通过测序验证后,转入表达宿主进行表征。B转化后,将细胞培养并用一系列不同浓度的效应分子进行检测,测量其荧光输出以生成剂量-反应曲线。从剂量-反应曲线中提取多种参数(如nH和EC50),并输入DSD以生成针对每个因子的预测模型。C) 利用这些模型,可以预测通过改变任意调控模块的表达水平来调节某一生物传感器参数所产生的影响。重要的是,可实现对调控节点的全局优化,从而同时最大化一个或多个生物传感器参数,如各子图中虚线红线所示。D) 将模型优化至最大灵敏度,得到全局优化的构建体(浅紫色),其剂量反应曲线与表现最优的 DSD 构建体(绿色)及亲本生物传感器构建体(蓝色)进行对比。提取的 nH 和 EC50 参数显示在图下方,表明这两个参数均优于表现最佳的DSD构建体,验证了由DSD生成的预测模型的有效性。数据改编自Alvarez Gonzalez等人的原始发表文献。23. 请点击此处以查看此图的放大版本。
补充图1:用于生物传感器文库制备和检测设置的自动化液体处理程序步骤。 请点击此处下载该文件。
补充图2至补充图6:确定性筛选设计(DSD)的逐步生成。 请点击此处下载该文件。
包含广泛遗传变异性的遗传元件文库对于基于实验设计(DoE)方法的成功至关重要。如文中所示 图2A,理论变异体的数量随着需靶向突变的位点数量以及随机化程度的增加而增加,这种不断扩大的文库规模导致了显著的筛选瓶颈。减少靶向位点数量或降低随机化程度可减少需要筛选的变异体数量,若需要更精确地调控或当存在重大限制时,这是一种具有吸引力的策略 先验的 已有对该系统的深入了解可作为指导。然而,对于生物传感器等具有大量重叠特征或遗传元件尚未充分表征的系统而言,很难规避对文库规模的需求。使用自动化液体处理设备可显著简化挑取菌落和培养变异株的工作,尤其是在需要收集更多数据点以绘制更复杂的功能曲线(如剂量-反应曲线)而非仅比较两个数据点(如开关状态)时。尽管难以精确量化引入自动化工作流程所节省的时间,但其主要优势在于能够将节省的时间用于开展其他并行实验。38.
尽管如此,在文库规模超过 104 的许多情况下,即使借助液体处理仪的方法也变得不切实际39。在这种情况下,使用流式细胞仪对变异体进行初步筛选是一种极具吸引力的方法,其分选通量可高达每小时 107 个细胞40。在对生物传感器的高性能变异体进行更全面的表征之前,通常采用荧光激活细胞分选(FACS)技术,结合两轮阳性筛选和至少一轮阴性筛选来进行优先级排序16,26,42。有关利用 FACS 开发和实施此类方案的详细综述已在其他文献中报道31。使用基于微孔板的液体处理仪检测方法也可实现初步筛选,如上述方案所述;通过比较在单一效应分子浓度下的开/关(ON/OFF)数据(如图 3D所示),仅选择功能显著增强(方法中定义为至少 3.6 倍)的变异型生物传感器进入后续深入表征,从而简化文库构建并缩短实验周期。然而,FACS 和液体处理仪平台均需要实验室投入较高的资金成本,且通常需要具备一定的技术专长才能操作和维护。基于琼脂平板的筛选方法则具有较低的技术和经济门槛,已与gfp荧光筛选或蓝白斑筛选结合使用,用于根据荧光强度选择核糖体结合位点(RBS)文库变异体以及酶突变体43,44。然而,这些方法在可有效筛选的变异体数量上同样受限,并且需要荧光信号之间存在显著差异才能被检测到44。作为一种在完全组合式、同时对多个元件进行突变策略之间的折中方案,"分而治之"的方法旨在将大规模变异文库划分为更易于管理的筛选模块41。尽管模块化策略可能具有实用性,但由于生物元件的性能已知高度依赖于上下文环境,尤其是在转录与翻译偶联普遍存在的细菌中,该方法无法有效探索组合设计空间,可能导致最终的设计选择陷入局部最优而非全局最优。
尽管转运和特异性诱导物的识别并非本方案的主要重点,但它仍是生物传感器开发中另一个值得关注的重要特征。针对目标分子缺乏合适的转录因子(aTF)是研究人员面临的一个重大挑战。合理选择能够结合目标效应物结构类似物的现有aTF,可为应用密码子随机化技术以调整aTF对目标效应物的特异性提供理想模板17。将目标序列与已解析的结构或AlphaFold预测结果进行比对,有助于识别效应物结合位点,并对疑似参与结合的氨基酸残基进行半理性随机化与排序,该策略可适配于本实验流程17。类似地,选择并调控负责效应物进出的转运蛋白,可显著改变生物传感器的剂量-响应特性。研究发现,转运蛋白基因的表达在生物传感器响应中起着关键作用;通过构建包含多样化Ptac启动子和核糖体结合位点(RBS)的文库来调控MucK转运蛋白的表达,可在多轮FACS筛选中稳定其表达水平,从而增强生物传感器响应的稳健性17。同样,直接筛选不同的转运蛋白本身也可调节生物传感器的特异性;利用原儿茶酸(PCA)响应型生物传感器筛选一组假定的PcaK转运蛋白,成功鉴定出两种 uniquely 能够摄取3,5-羟基化底物的转运蛋白,从而扩展了该系统可检测化合物的范围24。
将实验设计(DoE)原理与深度学习模型相结合后,自动化平台可成为更强大的表征与探索工具46,47。在利用高通量平台初步探索生物传感器的设计空间后,已有研究采用机器学习算法以较高准确度预测未表征序列的功能47。本方案中所述方法可轻松应用于新型语言学习模型在启动子设计中的测试,类似于基于跨核糖体结合位点(RBS)序列预测所开发的模型48。此外,整合此类模型可充分利用非功能性启动子设计中所包含的序列-功能数据,从而对生物传感器整体的更广泛功能提供关键见解。具体而言,这种方法有望解决DoE工作流程中的一个关键局限性:假阳性结果(例如非功能性启动子)并不一定等同于零测量输出,诸如随机转录等现象可能向DoE数据中引入噪声,而此类干扰难以识别和校正。至关重要的是,为了涵盖完整的实验设计空间,所构建的文库必须表现出广泛的功能活性;若活性范围不足,则会导致设计输出偏差,并降低基于该数据集生成的统计模型的可靠性30。若文库变异性过低成为问题,可尝试探索其他序列元件或提高随机化程度,并比较不同文库间的变异情况,直至获得合适的变体库。
实验设计(DoE)过程中的一个关键环节是正确估计和选择从DSD中获得的主效应与次级效应,并将其纳入统计分析。由于DoE是一种基于建模的方法,因此极易出现过拟合和偏差问题,这可能会通过引导迭代工程工作进入设计空间中的次优区域,从而迅速使优化过程复杂化49。因此,必须确保在实验设计构思阶段和数据分析阶段,所有设计方案均能有效避免此类影响。在初始筛选设计阶段,设置所有因素均处于几何平均值(即0,0,0,0)的中心运行点,有助于更准确地反映非线性交互作用,从而降低模型偏差,同时不会显著增加实验负担(仅需额外增加1–3次运行)49。此外,引入随机化设计有助于控制那些未被纳入实验设计但可能影响所测响应变量的外部变量。在生物学背景下,随机化可解决诸如空间-时间效应(如微孔板位置)或批次间变异等问题,防止这些因素显著干扰数据解读。在早期阶段关注这些细节,可提高模型的稳健性,并得出更可靠的结论。在完成DSD建议的实验后,需对数据进行统计分析,以明确对输出参数具有显著影响的因素。半正态图能够直观地展示效应大小:无显著性的效应通常落在一条直线上,而具有显著影响的效应则会偏离该直线,从而便于简单识别在生物传感器优化中最重要的因素。鉴于此,应采取保守的效应筛选策略,如同所有建模过程一样,以降低模型过拟合的风险。
快速设计和优化生物传感器及其他基因线路的能力将极大加快生物技术领域的研究进程,例如在菌株和酶的开发以及实时诊断方面。基于实验设计(DoE)的筛选方法在该领域中展现出特别广阔的前景,其能够在探索最大可能设计空间的同时,高效利用时间和资源,且已被成功应用于代谢通路和生物传感器基因线路的优化31,33,34,51。DoE尤其适用于多因素优化问题,其中存在大量一阶、二阶甚至三阶交互作用,而这些交互作用若采用传统的“一次改变一个因素”实验设计方法则难以被有效识别。此外,在对生物传感器某一特性进行工程化改造时,常常会无意中牺牲其他参数,例如在提高灵敏度的同时损失动态范围51。借助DoE识别此类隐藏交互作用的能力,以及构建可预测生物传感器行为的模型,显著加速了“构建-测试-学习”的循环过程。
作者声明无利益冲突。
GAG 和 PLR 获得了英国生物技术和生物科学研究生理事会(BBSRC)博士培训项目资助(BB/M011208/1)。MC 获得了 BBSRC 响应模式资助(BB/P01738X/1)。我们还要感谢亨利·罗伊斯先进材料研究所(通过 EPSRC 资助号 EP/R00661X/1、EP/S019367/1、EP/P025021/1 和 EP/P025498/1 提供资金)提供设施使用权限 ,以及 MBEC 英国研究与创新署(UKRI)工程生物学任务奖(BB/Y00812X/1)提供的技术支持与培训。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 1000 µL CO-RE 吸头,无菌无滤芯 | Hamilton | 235939 | |
| 2.2 mL 96 孔深孔板,方形孔,V 形底部 | Thermo | 11594754 | |
| 300 µL CO-RE 吸头,堆叠式 NTR,无菌 | Hamilton | 235985 | |
| 96 孔透明底黑色微孔板 | Greiner | 655097 | |
| 琼脂糖 | Invitrogen | 16500100 | |
| 已构建质粒 DNA | 用户自备 | NA | |
| ClarioStar Plus 微孔板读数仪 | BMG | NA | |
| 脱氧核苷酸(dNTP)溶液混合物 | NEB | N0447L | |
| 二甲基亚砜(DMSO) | Fisher BioReagents | BP231-100 | |
| DNA Ladder 100 bp | NEB | N3231L | |
| DNA Ladder 1 KB | NEB | N3232L | |
| DNA 测序 | Source Bioscience | NA | |
| DNA 合成 | IDT | NA | |
| Escherichia coli DH5α 感受态细胞 | NEB | C2987H | |
| 凝胶上样染料,紫色 X6,不含 SDS | NEB | B7025S | |
| 基因脉冲仪/微脉冲电穿孔比色皿,0.2 cm 间隙 | Bio-Rad | 1652082 | |
| GraphPad Prism 10 | GraphPad | NA | |
| Hamilton Star 液体处理系统 | Hamilton | NA | |
| HT multitron 平板摇床培养箱 | Infors HT | NA | |
| JMP 统计分析软件套件 | JMP | NA | |
| LB 肉汤(Miller) | Miller | L3522 | |
| 含琼脂的 LB 肉汤(Miller) | Sigma | L3147 | |
| MicroPulser 电穿孔仪 | Bio-Rad | 1652100 | |
| NEBuilder HiFi DNA 组装预混液 | NEB | E2621S | |
| Q5 高保真 DNA 聚合酶 | NEB | M0491S | |
| QIAprep Spin 中量提取试剂盒 | QIAGEN | 12143 | |
| QIAprep Spin 小量提取试剂盒 | QIAGEN | 27104 | |
| QIAquick 凝胶回收试剂盒 | QIAGEN | 28706X4 | |
| QIAquick PCR 纯化试剂盒 | QIAGEN | 28104 | |
| Qpix 420 菌落挑选仪 | Molecular Devices UK | NA | |
| SOC 扩增培养基 | NEB | B9020S | |
| SYBR Safe DNA 凝胶染料 | Invitrogen | S33102 | |
| TAE 缓冲液(Tris-乙酸-EDTA,50X) | Thermo Fisher | B49 | |
| UltraPureTM 无 DNase/RNase 蒸馏水 | Invitrogen | 10977015 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可