该双语方案提供了一个计算药物发现工作流程,评估Polo样激酶1至3(PLK1–3)的蛋白质-配体相互作用,以及数据库来源天然分子的吸收、分布、代谢、排泄、毒性和稳定性(ADMET-S)特性。
方法文章
该双语方案提供了一个计算药物发现工作流程,评估Polo样激酶1至3(PLK1–3)的蛋白质-配体相互作用,以及数据库来源天然分子的吸收、分布、代谢、排泄、毒性和稳定性(ADMET-S)特性。
Polo样激酶1(PLK1)在细胞周期的S期、G2期和M期中起着关键作用,其过度表达常在多种癌症中观察到,包括乳腺癌,这些疾病会导致基因组不稳定和细胞凋亡失调。与传统针对激酶结构域的ATP竞争抑制剂不同,选择性抑制PLK1的polo-box结构域(PBD)提供了一种有前景的策略,可以破坏对有丝分裂进展至关重要的蛋白质-配体相互作用,从而触发癌细胞的凋亡。然而,PLK1与其同源物(PLK2和PLK3)之间的高度结构相似性,分别对神经功能和应激反应至关重要,因此需要极高的选择性以避免偏靶效应。为应对这一挑战,该协议采用了双语(美国手语和英语)计算流程,整合了虚拟筛选、结构聚类、蛋白质-配体对接、结合亲和力预测、ADMET-S剖析以及量子力学(QM)稳定性分析。从SuperNatural 3.0天然产物数据库开始,化合物通过乳腺癌相关性和药物相似性标准进行筛选,进行聚类以确保化学多样性,并评估其与PLK1、PLK2和PLK3-PBD结构的相互作用。虽然虚拟对 接和计算机 上的ADMET-S评估无法明确确认选择性或作用机制,但本研究提出了可检验的假设,并优先考虑一组针对未来分子动力学模拟、生化验证或实验筛选的天然产物候选。
Polo样激酶(PLKs)是一类结构由N端结构域和C端组成的蛋白激酶家族,C端由一个或两个polo-box结构域(PBD)1,2组成。 这些polo-box结构域的数量和功能多样性在不同PLK家族成员间存在差异。PLK1参与细胞分裂的S、G2和M阶段。在细胞周期中,PLK1在S期作为DNA损伤检查点,在G2期调节染色体凝聚和中心体成熟。PLK1还促进有丝分裂进入M期,随后是纺锤组装、后期进入和细胞分裂3,4。PLK1的过度表达导致基因不稳定,导致中心体异常形成,导致细胞周期失调,使细胞无法调节凋亡。 这种过度表达在肺癌、头颈癌、食管癌、胃癌、结直肠癌和乳腺癌中均可见4.因此,通过靶向PBD抑制PLK1可能触发凋亡5,6。该工作流程旨在实现高选择性,以避免抑制PLK2和PLK3,这两者对神经功能和基因毒性应激的管理至关重要。
PLK2在特定情境下作为肿瘤抑制剂,调控G1/S转变,促进细胞周期蛋白E的降解,以防止细胞失控增殖。PLK3在细胞周期调控和基因毒性应激反应中扮演复杂角色,通过参与DNA损伤检查点激活和细胞凋亡诱导,有助于维持基因组完整性7。值得注意的是,尽管PLK1抑制已成为癌症治疗的有前景策略,但PLK2和PLK3在神经功能和应激反应中的关键作用,要求开发高度选择性的抑制剂,以最大限度减少对这些关键激酶的非靶向效应3。这种生物学背景和结构相似性超过38%3 强调了识别专门针对PLK1波洛盒结构域(PBD)且不干扰PLK2和PLK3在正常细胞生理保护功能的化合物的重要性。
已知的polo样激酶(PLK)抑制剂,尤其是针对PLK1的抑制剂,因其在癌症治疗中的潜在治疗应用而被广泛研究。包括BI 2536、volasertib(BI 6727)、onvansertib(NMS-1286937)和GSK461364在内的多种化合物已被开发并推进临床试验,通常作为ATP竞争抑制剂8,9,10。其他类型的抑制剂也针对PBD,包括胸腺喹酮(TQ)11,12、Poloxin13,14和异极A15。尽管据报道前景看好,但由于ADMET-S性能不佳和靶外效应等挑战,目前尚无获批的PBD特异性抑制剂或晚期临床试验6。例如,据报道,若干PLK1-PBD抑制剂是非特异性蛋白烷基化剂16,限制了其临床应用性。因此,提升潜在PLK1-PBD抑制剂的选择性和ADMET-S谱仍然是药物研发中的关键目标。
本研究旨在通过虚拟筛选、结构相似性过滤、对接、结合能计算和ADMET-S评估,探索具有ADMET-S特性的潜在PLK1-PBD抑制剂。PLK2和PLK3采用相同方案评估潜在选择性。虽然存在众多用于激酶抑制剂发现的计算流程,但很少有将PLK1–3 PBDs的选择性筛选与全面的ADMET-S和量子力学稳定性分析结合起来,尤其是使用天然产物库。该工作流程建立在既有的虚拟筛查范式基础上,但针对教育可及性和早期假设生成进行了定制。该协议只需一台标准笔记本电脑(8 GB 内存)、免费的学术软件,且无需任何编程经验,因此适用于高中、本科和研究生环境,包括基于课程的本科生研究体验(CUREs)。
该工作的计算流程始于蛋白质制备,从蛋白质数据库(PDB)检索PLK1-PBD、PLK2-PBD和PLK3-PBD的结构,或对其建模和处理以解决结构差异。接着,进行了天然产物数据库筛查,根据抗乳腺癌潜力和利平斯基五法则合规性筛选化合物。后续步骤基于分子指纹识别和相似性,将聚类为50个代表性结构。这些代表进行了蛋白质-配体对接和结合亲和力计算,生成了三个PLK的相互作用数据。随后,利用三种不同的服务器评估ADMET-S特性,以预测药物动力学、药物相似性、毒性和代谢稳定性。通过最高占领分子轨道(HOMO)和最低未占领分子轨道(LUMO)分析,对HOMO–LUMO缺口进行了量子力学计算。最后,分析了ADMET-S数据,根据物理化学、吸收、分布、代谢、排泄、毒性和稳定性标准,筛选并排序潜在且选择性PLK1-PBD抑制剂的化合物。
所有使用软件工具的研究资源标识符(RRIDs)和版本号均在 材料表中提供。
1. 靶向蛋白质制备
2. 天然产物数据库筛选
3. 聚类抽样
4. 蛋白质-配体的结合与结合亲和力计算
5. ADMET-S 评估
6. ADMET-S数据分析
目标蛋白结构文件协议确保目标蛋白文件针对分析和基于结构的对接进行优化。最终的结构文件(PDB格式)不含残基和氢的缺失、原子类型缺失,以及水分子和共结晶配体等不必要的成分。 图1A、B 展示了结构在准备前后(由Mol*观察器33可视化)的视觉差异。如果仍有残留的格式化问题(如未识别的原子名或残留不完整),CB-Dock2 通常会在上传时报错。此时,可以进行一些小的手动修正,比如将HSD改名为HIS或去除非标准残留物,然后再尝试对接步骤。
图2 展示了基于分子指纹识别和谷本相似性进行主成分分析(PCA)的聚类结果。图中,每个团簇被一个灰色阴影的椭圆分组,椭圆内有颜色相似的点,代表这些簇中的分子。 PCA分量1和2在轴上提供了Tanimoto矩阵中高维元素约简的二维线性表示。本研究在簇抽样步骤中利用谷本相似性,减少冗余并增强999种Lipinski合规天然产物的化学多样性。通过利用分子指纹计算Tananimo的相似性,数据集被划分为50个结构相关化合物的簇。然后从每个簇中选取一个代表性分子,确保最终的50个配体能够覆盖宽广的化学空间,同时最大限度地减少下游对接和ADMET-S分析中的计算冗余。这一策略提升了虚拟筛选的效率和代表性,尤其是在处理大型天然产品库如SuperNatural 3.0时。(见 图2)
模拟每个蛋白-配体复合体的最优姿态,并结合CB-Dock2中PLK1蛋白五个CurPocket态态的Vina分数预测亲和力,考虑范德华力和氢键。 图3中配体1的模拟示例显示,配体与第二个CurPocket态(C2)结合度最佳,Vina评分最低为-7.5 kcal/mol,相较于其他四个顶端态。与CB-Dock2的分子对接通过基于经验参数的评分函数和随机全局优化算法实现。CB-Dock2经过严格验证,显示其性能优于其他最先进的盲对接工具,使其成为对接研究的极佳选择26,34。该服务器在绑定姿态预测(RMSD <2 Å)方面成功率约为85%,优于包括首代CB-Dock版本、SwissDock、COACH-D和MTiAutoDock34在内的主流工具。这种高精度归功于CB-Dock2创新地整合了两种互补的对接方案:基于结构和基于模板的方法。
图4展示了使用PRODIGY网络服务器预测亲和力,展示每种蛋白质-配体组合的平均预测亲和力热图。 较高的亲和力,表现为较低的摩尔能量(kcal/mol)和更绿色的热图色调,是有利的结合亲和力。相比之下,较低亲和力,表现为更高的摩尔能量和更红的热图色调,则不那么有利。从选择性角度看,理想情况下,相对于同源蛋白(PLK2–3)具有对目标蛋白(PLK1)有利亲和力的化合物。例如,配体27是相对于配体45的选择性PLK1-PBD配体,这三种蛋白之间表现出相似的亲和力。虽然命中3、5、6、7、27、28、34、35和49对PLK1-PBD的亲和力高于PLK2/3,但它们在二维指纹空间中化学多样性(平均ECFP4 Tanimoto≈为0.135,无对≥0.50),表明更广泛的特异性很可能由保守的PBD口袋几何结构和共享的三维药效/相互作用模式驱动,而非支架身份。建议包括交互指纹比较和药共体定位,以识别PLK1-PBD识别的结构决定因素。
物理化学性质评估结果显示在雷达图(图5)中。评估的性质包括原子相互作用、溶解度和生物利用度。一些化合物因其更理想的物理化学性质而突出,范围为可接受范围:nHD = 0–7,nHA = 0–12,nStereo < 2,LogP = 0–3,LogD = 1–3,LogS = –4 至 0.5,Fsp3 > 0.41,nHet = 1–15。该雷达图为计算筛选工作流程中识别的50个代表配体的物理化学性质提供了全面、多维的可视化。该方法旨在通过绘制每种化合物的性质与既定的下限和上限,来评估其符合预定“类药”标准的程度。图表显示了十个关键分子描述符,围绕极轴排列,包括pKa酸性和pKa碱性。绿色多边形(下限)与蓝色多边形(上限)之间的阴影区域,基于协议中提供的阈值,标志着每个属性的理想或可接受范围。pKa酸(2–12)和pKa碱(3–10)的上限和下限是基于文献综述35、36、37确定的,因为药物发现中pKa没有单一的上下限。每条彩色线代表50个配体中的一个。连接单个配体数据点形成的形状,同时显示其在所选十个性质上的分布。这50个配体中的绝大多数位于绿色和蓝色多边形定义的可接受区域内或非常接近。这表明,最初的过滤步骤,特别是利用Lipinski五法则和基于谷本相似度的聚类,在丰富具有有利类药物性质的分子方面非常有效。建议对所有参数描述完整的文档数值范围。
图6A–C展示了ADMETlab3.0和SwissADME的ADME数据组成部分。从吸收和分布开始,SwissADME的图6A中的BOILED-Egg模型38表示药物通过脂溶性和渗透性的吸收和分布,图中黄色和白色椭圆表示。它包括P-gp底物和抑制剂,分别用蓝色和红色点表示,抑制P-gp对于提高吸收率至关重要。图6B中,代谢热图可视化了约7种CYP细胞色素p450酶的抑制和底物。配体的期望结果是作为CYP非抑制剂和非底物(绿色),理想结果是确认其安全且无药物相互作用。图6C表示药物清除和半衰期的排泄数据。排泄可通过最佳血浆净空(<5 mL/min/kg)区分。所有抗癌药物的药物半衰期取决于药物的作用机制、毒性和靶点。理想的半衰期是在治疗窗口内保持药物浓度的同时,最大限度地减少毒性,并允许方便的剂量安排,39,40。
书中展示了两种毒性评估的组合。 图7A显示了ADMETlab3.0识别的每个配体的毒理团数量。 目前没有明确的阈值或关于毒性物质可接受范围的信息。 图7B中,Toxtree的应用提供了与毒性等级(I-III)以及克莱默规则违规和依从性相关的信息。配体1的样本结果显示毒性结果及其SMILES代码,位于左下角窗口。右上角的类别毒性识别显示为高毒性(III类),基于Cramer规则对配体1,而非其他可能的II(中毒性)或I类(低毒性)。 右下角窗口显示了基于克莱默规则决策树的类识别书面推理。
ORCA量子力学对优化结构振动频率的计算,用于确定带隙的轨道能量值。 图8 展示了每个配体的能隙(eV),由HOMO与LUMO的差值推导出来。阈值范围表示在阴影区域,介于3.6 eV至5.0 eV之间,阴影区域内的每个点满足与更理想稳定性和反应性相关的能级。 图9总结了整个计算流程,展示了从靶向蛋白制备和天然产物数据库筛选到ADMET-S评估的顺序阶段,旨在识别选择性PLK1-PBD抑制剂,同时确保药物特性和化学稳定性。这份可视化路线图强调了该协议的模块化、可访问性以及适合教育实施的特性。
表1 通过将协议从线性指令序列转变为适合课堂和独立研究的稳健且可识别错误的流水线,实现了该协议的操作化。它明确解决了计算药物发现中已知的可重复性问题,通过在关键过渡点嵌入验证标准。例如,确认CHARMM-GUI处理后组氨酸残基统一标记为“HIS”,可防止下游对接时的无声故障;而在聚类前验证SMILES完整性则避免ADMET预测中的级联错误。表格还强调教学设计,每个故障排除提示都可操作且计算基础极少(例如,“在文本编辑器中打开.complex.pdb以检查链ID”),符合手稿对聋人、本科生和高中学生的无障碍目标。此外,通过标记结果对结果不成比例的步骤,如 通过 比较PRODIGY评分进行选择性评估,表格帮助用户优先分配注意力和资源。
这一集成工作流程的一个关键优势是能够揭示互补计算预测之间的差异,揭示任何单一方法的局限性边缘案例。例如,PLK1-PBD配体5表现出强烈的CB-Dock2 Vina评分(−7.9 kcal/mol)和有利的PRODIGY亲和力(ΔG = −9 kcal/mol, 见图4),但多个ADMET滤波器未通过。它不符合煮卵吸收分布模型,血浆清除值较低(9.3 mL/min/kg, 见图6),表明快速消除,Toxtree将其归类为Cramer III类(高毒性),含有五种毒物(见图7A)。相反,配体33表现出PRODIGY预测的PLK1亲和力中等(−5.4 kcal/mol),但符合所有ADMET标准,表现出低毒性(I类)、最佳LogP(0.7)、良好吸收分布和血浆清除率。尽管亲和力较弱,配体33更接近药物。这一对比说明了早期药物发现中的一个基本原则:仅靠高结合亲和力,如果没有有利的药物动力学和安全性,是不够的。同时,如配体5等化合物,尽管ADMET表现较差,仍可能为未来优化提供宝贵的支架,以提升安全性或代谢稳定性,同时不影响效力。
虽然该工作流程的早期筛选器旨在进行分流和优先级排序,而非永久排除,但进一步精简50个候选对象后,通过应用ADMET工具和文献中可用的理想限制,将其中一些筛选为“顶尖匹配”。在114个ADMET相关及电子描述符中评估的50个配体中,有13个至少满足95个理想性质标准。其中,六种化合物(10、13、14、32、43和47)表现出优异的ADMET-S特征,且结合亲和力高于PLK2/3,因此被指定为顶级候选抑制剂(见图10)。结构-功能与定量相似性的比较分析显示,所识别的命中与已知的PLK1-PBD抑制剂共享关键药学特征,暗示结合行为可能趋同。所有命中均含有芳香族或异芳烃支架,这些支架与TQ、Poloxin和Allopole-A的疏水环系统相呼应,使PBD囊中实现π–π和疏水相互作用。功能重叠通过保守的氢键基序(羧基、酰胺基和羰基基)显现,类似于参考抑制剂中介导关键极性接触的基序。多种命中中存在的柔性脂肪族和环状连接子与Poloxin类似物的构象适应性相呼应,有助于对必需结合残基的定位。定量上,Tanimoto相似度评分(0.36–0.54)证实命中与已知抑制剂之间存在中等结构相似性,其中命中10、13和14最接近Poloxin,命中32与TQ,命中43和47与异极A相似。综合来看,这些结果凸显了结构和功能上的明显重叠,表明这些命中很可能模拟了经过验证的PLK1-PBD抑制剂的结合拓扑和相互作用模式,同时保留了足够的新颖性以供进一步优化(见图10)。
为评估计算流程的稳健性,已知的PLK1-PBD抑制剂(Poloxinpan14 和Allopole-A15)作为阳性对照分析,二甲双胍和伊美格林(两种结构无关的抗糖尿病药物,且无报告活性)为ADMET-S、对接和结合亲和力分析的阴性对照。阳性对照组的结合亲和力分别为–5.8和–5.6 kcal/mol,而阴性对照组的亲和力较弱,分别为–5.1 kcal/mol(二甲双胍)和–4.8 kcal/mol(伊美格林素),这与其缺乏PBD结合活性的表现一致。有趣的是,ADMET-S评估显示阴性对照组满足的描述符(114个性质中的88个)比阳性对照组(114个中80个性质)更为理想,从而验证了工作流程区分药物动力学有利性与靶点特异性结合潜力的能力。这些结合强调了保持平衡视角的重要性:如果化合物表现出强烈的靶点亲和力,不应仅仅基于ADMET预测不优而过早弃用,因为此类支架仍可能为优化提供宝贵的起点。相反,具有优异药代动力学特性但结合较弱的分子,可能作为低风险的类似物开发模板。需要进一步的生化和细胞验证,以确认这些计算观察并完善优先级标准。

图1:未准备与CHARMM-GUI构建的4HCO结构结构比较。(A) 直接从PDB上传的4HCO结构,突出显示缺失残基。(B) CHARMM-GUI制备协议后的4HCO结构。4HCO(结合于TQ的PLK1-PBD)之所以被选中,是因为它是少数具有有机配体结合的PLK1-PBD晶体之一,直接适用于这一基于结构的小分子抑制剂发现。 请点击此处查看该图的放大版本。

图2:基于分子指纹识别和Tanimoto相似性,基于K-均值聚类,对999个Lipinski合规天然产物进行主成分分析(PCA)。每个点代表一个化合物,按其分配的簇(1–50)着色,簇用灰色椭圆分组以强调化学相似性。簇内的紧密聚类和簇间的分离表明,基于谷本的聚类成功减少了结构冗余,同时保持了数据集中的化学多样性。这种多样性确保了被选中用于下游对接的50个代表性配体覆盖广泛的化学空间区域,增强了虚拟筛选结果的稳健性和普遍性。 请点击此处查看该图的放大版本。

图3:CB-Dock2盲对接识别了PLK1波罗盒结构域(PBD)中配体1的高亲和力结合态。显示的CurPocket C2构象(Vina评分=−7.5 kcal/mol)代表了五个预测结合位点中的最佳姿态,特点是与关键PBD残基(Trp414、His538和Lys540)具有良好的范德华接触和氢键。该结果验证了结构基盲对接在无共结晶配体的情况下定位生物相关结合口袋的有效性,展示了工作流程如何优先考虑预测结合能最强的姿态以进行下游选择性分析。 请点击此处查看该图的放大版本。

图4:PRODIGY网络服务器热图,通过蛋白质-配体组合预测亲和力。热图直接处理了结合PLK1、PLK2和PLK3配体时配体之间的重叠情况。虽然部分配体(包括配体45)在三种PLK同位型间表现出相似的结合亲和力,表明选择性较差;而其他配体(尤其是配体3、5、6、7、27、28、34、35和49)表现出强烈的PLK1偏好(ΔΔG≥为3.0 kcal/mol,而非PLK2/PLK3),这与PBD选择性抑制的目标一致。定量上,50个配体中有20个基于PRODIGY预测的ΔG值,对PLK1的选择性几乎是PLK2和PLK3的2倍。这种差异结合归因于盲对接协议捕捉的PBD结合口袋的细微变化。 请点击此处查看该图的放大版本。

图5:结合ADMETlab3.0和SwissADME的物理化学性质表示。参数包括nHD = 氢供体数量,nHA = 氢受体数量,碱性pKa,酸性pKa,nStereo = 立体中心数,LogP = n-辛醇/水分布系数,LogD = n-辛醇/水分布系数(pH=7.4),LogS = 水溶度值,Fsp3 = sp3 杂化碳数/总碳数,nHet = 杂原子数。 请点击此处查看该图的放大版本。

图6:ADME实验室3.0和SwissADME的组合结果。(A) Wildman-Crippin LogP (WLOGP) vs.SwissADME提供的拓扑极地表面积(TPSA),表示黄色(卵黄)区域的吸收与分布血脑屏障(BBB)通透性,白色椭圆的胃肠道吸收(HIA),蓝色和红色点分别表示P糖蛋白底物和非底物。位于“卵”之外的分子被认为吸收和分布较差。(B)含有多种细胞色素P450(CYPs)标识符的代谢热图,涉及人类肝脏代谢(HLM)稳定性,其中红色作为抑制剂/底物,绿色作为非抑制剂/非底物,绿色为可取值。(C)排泄涉及参数、等离子体净空和半衰期。虚线红线表示理想血浆净空(<5 mL/min/kg),而5-15 mL/min/kg和>15 mL/min/kg分别表示中等和高净空。 请点击此处查看该图的放大版本。

图7:综合毒性剖析揭示了筛选配体中的关键安全责任。(A) 根据ADMETlab3.0预测的50种代表性天然产物中的毒物计数分布。(B) 配体1的样本毒性结果,红色标示为III类毒性,并附有详尽的相关克莱默规则说明,具体列于下方文本框中。这种双重评估方法(毒物+Cramer类)使高风险化合物能够早期分诊。 请点击此处查看该图的放大版本。

图8:50个代表性天然产物来源配体的HOMO–LUMO能隙能量(单位eV),在B3LYP/def2-TZVP理论层面使用ORCA计算。阴影区域(3.6至5.0 eV)表示最佳稳定性窗口:能隙低于3.6 eV表示化学反应性高或潜在光降解,而超过5.0 eV则可能表示电子极化性差且结合适应性降低。处于该范围内的配体在动力学稳定性和分子响应性之间表现出良好的平衡,支持其作为潜在PLK1-PBD抑制剂候选人的优先考虑。 请点击此处查看该图的放大版本。

图9:双语计算药物发现工作流程的流程图。该流程始于制备PLK1-PLK3 PBD结构,随后对SuperNatural 3.0数据库进行针对疾病的筛选, 并通过Lipinski 五法则进行过滤(分子量≤500 Da,氢键供体≤5,受体≤10,LogP ≤ 5)。经过聚类筛选代表性化合物,随后通过蛋白质-配体配体连接、结合亲和力预测以及全面的ADMET-S分析(包括吸收、分布、代谢、排泄、毒性和量子力学稳定性评估)进行评估。 请点击此处查看该图的放大版本。

图10:顶级候选配体与已知PLK1-PBD抑制剂之间的结构-功能重叠比较。图中突出了通过虚拟筛选、聚类、结合亲和力和ADMET-S剖析分析确定的六个顶尖候选化合物(10、13、14、32、43和47)。这些配体满足114个理想物理化学和药代动力学描述符中的至少95个,并且相较于PLK2/3表现出更高的PLK1-PBD结合亲和力。为评估潜在的结构和功能趋同,每个配体与已知的PLK1-PBD抑制剂TQ、Poloxin和Allopole-A进行了比较,基于共同的核心药学基序和成对Tananimoto相似系数(ECFP4指纹)。中等相似度评分(0.36–0.54)及常见功能基团如芳香环或异芳香环、氢键供体/受体对和疏水连接蛋白表明结合特征部分重叠。 请点击此处查看该图的放大版本。
| 工作流程阶段 | 中级检查点(如何确认成功) | 关键步骤(为什么它决定成功/失败) | 常见问题及故障排除指南 |
| 1. 靶向蛋白质制备 | • 在 Mol* 视图中,PDB 文件加载无错误。 • 装订袋内无遗漏残留物(目视检查)。 • 标注为“HIS”的组氨酸残基(非HSD/HSE) | 蛋白质结构不准确→假结合口袋→误导性的对接姿势。CHARMM-GUI确保正确的质子化、氢的定位以及水/配体的去除。 | 问题:CB-Dock2拒绝PDB文件。 解决方法:去除非标准残基,确保仅存在蛋白链,并用文本编辑器标准化原子/残基名称。 |
| 2. 天然产品过滤(利平斯基五法则) | • “all.csv”仅包含有效的SMILES(非空白,化学解析)。 • 预计比赛场数(例如999/1,193场)。 | 无效的 SMILES 会导致 RDKit、停靠服务器和 ADMET 工具崩溃。过滤必须保持化学有效性。 | 问题:脚本在集群过程中失败。 修复:在 Python 中使用 Chem.MolFromSmiles(smiles, sanitize=True) 添加 SMILES 验证;在继续之前,请记录并删除无效条目。 |
| 3. 集群抽样 | • “rep_struct.txt”中的50个独特微笑。 • PCA图(图2)显示了明显的簇分离。 | 聚集不良→冗余或缺乏多样性的代表,→筛选效率低下。 | 问题:所有分子都会聚集成一组。 修复方法:验证指纹类型(例如Morgan/ECFP4)、Tanimoto阈值以及SMILES标准化。如果多样性较低,考虑增加集群计数。 |
| 4. 蛋白质-配体对接(CB-Dock2) | • 每个配体返回≥1个“.complex.pdb”文件。 • Vina评分为负(例如≤ −5 kcal/mol)。 • 配体位于CurPocket(非表面)。 | 对接定义了束缚姿势和亲和力。姿势错误→天才预测错误。 | 问题:工作失败,或者配体未对接。 修复:在CB-Dock2中使用SMILES重新绘制配体;确保文件名中没有特殊字符;请核实邮箱以获取工作状态如果坚持不变,可以试试SwissDock作为备份。 |
| 5. 结合亲和力(PRODIGY) | • PRODIGY返回所有复形的ΔG值。 • 亲和力与CB-Dock(Vina)分数相关(趋势一致性)。 | 选择性评估依赖于PLK1与PLK2/PLK3的准确ΔG。链/配体ID错误分配→错误的预测。 | 问题:“找不到链条”错误。 修复方法:在文本编辑器中打开 .complex.pdb;确认蛋白链编号(例如“P”)和配体残基名称(例如“UNL”);在PRODIGY中正确输入。 |
| 6. ADMET-S 评估 | • SwissADME、ADMETlab3.0和ToxTree中所有50个SMILES返回结果。 • 输出CSV中无“N/A”或“Error”行。 | ADMET数据不一致→候选人排名有缺陷。平台可能在奇异天然产品的支架上失效。 | 问题:ADMETlab3.0拒绝SMILES。 修复方法:使用 RDKit(MolToSmiles(MolFromSmiles(...)规范化 SMILES。对于ToxTree,一次输入一个分子并验证结构渲染。 |
| 7. 量子稳定性(ORCA) | • 每个ORCA作业完成时没有“SCF未收敛”或“几何错误”。 • 输出(.out)文件中存在的HOMO/LUMO值。 | 带隙决定了化学稳定性和反应性。失败作业=键过滤缺少数据。 | 问题:ORCA工作崩溃。修复:重新优化Avogadro中的几何结构;确保没有重复的原子;提高maxcore的百分比,或者对大分子改用Def2-SVP基底。 |
| 8. 集成ADMET-S滤波 | • 配体最终列表满足所有标准(如LogP 0–3,能隙3.6–5 eV,Cramer I/II类)。 • ≥1配体表现出PLK1的选择性(ΔΔG ≥2 kcal/mol vs. PLK2/3)。 | 过于严格或不一致的门槛会失去可行的潜在客户;过于宽松的阈值会推进有毒或不稳定的化合物。 | 问题:没有配体能通过所有滤波器。 修正:一次放宽一个标准(例如允许Log≤P使用4或3个毒物),并记录权衡。与已知药物进行基准比较。 |
表1:八阶段双语计算流程中识别选择性PLK1-PBD抑制剂的关键质量控制检查点、高影响决策点及故障排除策略。每一行对应从蛋白质制备到集成 ADMET-S 过滤的主要协议阶段,并规定了(i)如何验证成功完成(中间检查点),(ii)为何该步骤对整体成功或失败至关重要(关键步骤理由),以及(iii)常见技术故障的实用解决方案(故障排除指导)。该表格既是验证路线图,也是在学术或资源有限环境中实施该方案的学生和研究人员的教学辅助工具。
补充文件1:Python脚本。包含用于Lipinski规则应用的Python脚本;用于聚类分析的Python脚本;用于物理化学性质计算的Python脚本;用于代谢分析的R脚本;用于排泄分析的Python脚本;用于毒性预测的Python脚本;用于稳定性评估的Python脚本;以及分析的50种化合物的SMILES字符串。请点击这里下载此文件。
本研究侧重于通过虚拟筛选、对接和ADMET-S分析,探索性计算流程识别和评估潜在的PLK1-PBD抑制剂。该管线有效根据预测的结合趋势和药代动力学特性优先排序化合物。在该方案中,识别出一组可能的PLK1抑制剂,并评估其ADMET特性及对PLK1–3蛋白的结合亲和力。该方案采用以疾病为中心的方法,从约73,400个分子的数据库中识别出50个分子(见图9)。随后,这50个分子接受了ADMET-S评估,计算其药代动力学和药效学特性、药物相似性及稳定性。此外,计算了它们对PLK1–3蛋白的结合亲和力,以评估其对PLK1的抑制效力及选择性。根据结果,有几个分子表现出更理想的特性。后续的药物发现研究可能会选择去除部分分子并专注于少数分子,或者避免早期消除,并在药物设计过程中利用这些结果来优化ADMET特性。
关注PLK1、PLK2和PLK3而排除PLK4和PLK5的生物学理由,基于结构和功能考虑。由于PLK4和PLK5与PLK1在结构和功能上存在明显差异,且对癌症治疗的相关性有限,因此被排除在本研究之外。PLK1以其激酶结构域和波罗盒结构域(PBD)为特征,在调控有丝分裂事件中发挥关键作用,是癌症治疗的关键靶点41。相比之下,PLK4和PLK5结构不同:PLK4包含隐蔽的波罗盒(CPB),而非典型的PBD,主要以中心粒复制为功能。同时,PLK5缺乏功能性激酶结构域,几乎完全在大脑中表达。鉴于其与PLK1-PBD的结构重叠极少,且对癌症中有丝分裂失调的相关性有限,其纳入对PLK1-PBD抑制剂的选择性影响不大。因此,筛查策略提供了一个生物学相关且计算上可操作的选择性评估框架。值得注意的是,六个顶级候选配体(10、13、14、32、43和47)表现出比已知抑制剂TQ和异极A更有利的结合能和ADMET-S谱,凸显它们作为潜在的PLK1-PBD调制因子。
为了支持稳健的实施,尤其是对于新接触计算药物发现工具的学生或研究人员, 表1中提供了关键检查点摘要(协议部分)、关键步骤及工作流程的故障排除指导。表格支持适应性;例如,如果用户缺乏HPC访问权限,可以注意ORCA稳定性分析是可延迟的;如果网页服务器宕机,则建议使用SwissDock等替代方案。这种灵活性确保工作流程在不同机构环境中依然可行,同时保持科学严谨性,强化研究作为包容性、双语和教育导向的早期药物发现贡献的创新性。尽管整个工作流程设计为一体化的流水线,但若干关键步骤根本决定其成败(见 表1)。此外,配套视频配有同步英文字幕和美国手语(ASL)手语,旨在提供公平的访问且不受干扰。签名者的指令会与屏幕上的动作时间对齐,例如先签署“下一步”,然后在光标点击“下一步”按钮时暂停。在4HCO准备步骤中,签名者使用手指标记(“A”和“B”)来指导链条选择,视频中与此精确对应。在《SuperNatural》3.0的放映环节中,签名者的窗口缩小并移动到右上角,同时将注意力引导到“路径”图标上,光标随后暂停。这些设计确保聋人和听力障碍观众能获得与听力用户相同的集成实时指导,有效复制了现场教师主导的实验体验。
除了好处之外,还有许多方法可以改善工作流程。首先,初始过滤可以进行修改;与其采用病害聚焦和簇抽样方法,不如先对天然产物数据库中所有分子进行对接模拟,以确定哪些化合物最适合配体-靶向蛋白结合。此外,更详细的估计是准确预测结合亲和力的必要条件。 PRODIGY的“无静电”蛋白质-配体亲和力计算涉及拟合在训练有素的多重线性回归模型中涉及的分类原子接触类型(碳-碳、氮-氮、氧-氧及其他原子),并采用四重交叉验证,该方法在多个场合与实验亲和力有显著相关性42,43。 可选方法如FoldX44、fastDRH45、深度学习模型46以及带有高级采样的MD,预计预测的一致性会根据每种方法的准确性有所不同。
另一个方面是,ADMET-S评估中使用的各种软件工具会产生大量指标,理解用于评估药物候选性所需的每项指标至关重要。确保准确性的一种方法是对市场上的多种药物进行该方案检测,以确定它们是否符合阈值。 在这种背景下,毒性需要进一步研究,因为分子不会仅凭如克莱默规则等细致决策树的毒性特征就被舍弃,许多可用药物也具有类似分类。 即使与毒性谱结合,毒物数量也无法完全说明毒性。 在此背景下,工作流程的扩展是对现有药物进行小分子样本的比较评价,以指导解释。 例如,研究人员引用了先前文献,记录了DFT计算在当前乳腺癌药物如他莫昔芬48、来曲唑49和顺铂50中的应用和观察,以解释通过量子力学计算HOMO–LUMO能隙值所确定的稳定性。此前,类似的工作流程已被采用用于识别针对各种疾病/障碍靶点的潜在抑制剂51。最近,Stafford等人回顾了 PLK1-PBD抑制剂的设计策略及癌症治疗机会。最新研究通过结构引导药效团建模、虚拟筛选、分子对接、分子动力学(MD)模拟和生物评估,鉴定出针对PLK1-PBD和PLK4-PB3的双靶抑制剂。Zhou等人还利用3D QSAR药共体、ADMET、支架跳跃、分子对接和MD53,从海洋天然产物库鉴定出PLK1-PBD抑制剂。
总体而言,这项研究的新颖性有四倍。首先,它是一种双语计算协议,以美国手语和英语两种方式提供,从而推动了STEM领域的可及性和包容性,特别是对聋人和听障学生及研究人员而言。这种双语教学在计算药物发现中极为罕见,也符合加劳德大学开创公平科学教育的使命。其次,尽管PLK1仍是一个有说服力的抗癌靶点,但利用结构、能量和ADMET-S综合标准评估PLK1、PLK2和PLK3选择性的严谨计算研究仍然稀少。大多数先前的研究仅聚焦于激酶结构域抑制,或缺乏比较选择性剖析。本研究通过提供针对三种PLK-PBD的初步探索性并行筛选协议,利用基于高PLK1亲和力和最小离靶结合的化合物的过滤器,弥补了这一空白。第三,工作流程设计时注重效率和可用性,尤其适用于教育和资源有限的环境。从数据库过滤到ADMET-S评估的整个流程可以在两周内完成,使用标准学术硬件(8GB内存的笔记本电脑),利用免费的基于网页的软件(CB-Dock2、PRODIGY、SwissADME、ADMETlab)。对接和结合亲和力计算不耗时(每个配体约30秒)。最耗时的步骤是使用ORCA进行量子力学稳定性分析,该步骤可以推迟到后期,或在高性能计算资源上运行,如所示。这些脚本模块化,只需通过基本的命令行或Jupyter笔记本编辑,便于无缝融入现有课程。运行时间适中,数据库过滤和 Lipinski 合规只需几分钟;在典型的桌面上,约1000个分子的聚类过程在30分钟内完成。所有软件工具均免费供学术使用,跨平台(Windows、macOS、Linux)支持,且无需商业许可,大大降低了进入门槛。第四,所鉴定配体表现出与纳摩尔范围相互作用一致的有前景结合亲和力,同时具备良好的药物相似性、代谢稳定性和低毒性特征。若干候选药物作为强效、选择性强的PLK1-PBD结合剂,具有理想的ADMET-S特性,值得 通过分子动力 学模拟或 体外 测定进一步验证。
因此,除了方法论上的实用性,本研究还展示了如何利用可及、开源且高效的计算工具作为起点,应对高价值生物医学挑战,同时促进包容性的科学培训。随着PLK1-PBD抑制剂在肿瘤学领域的持续普及,这一工作流程为早期药物发现提供了可重复且教育友好的蓝图。其多功能性使其适合高中、本科和研究生环境,并为CUREs提供了极佳的基础,为学生提供真实、动手操作的研究机会。与仅依赖激酶结构域对接或单蛋白筛选的管道不同,该方法同时评估了PLK1–3间PBD的选择性,鉴于其>38%的结构同源性和不同的生物学角色,这是必要的。此外,通过将聚类、ADMET-S和量子力学稳定性结合在开放访问框架中,相较于暴力破解虚拟筛查,增加了冗余和遗失风险。
作者声明没有利益冲突。
该研究得到了美国国立普通医学科学研究所、国立卫生研究院(1R15GM148942-01)、国家医学图书馆(R25LM014208)以及匹兹堡大学Momentum资助的支持。本工作利用了 darwin.hpc.udel.edu 年乌德尔的达尔文,通过高级网络基础设施协调生态系统:服务与支持(ACCESS)项目的分配[MED230016],该项目得到了美国国家科学基金会资助#2138259、#2138286、#2138307、#2137603和#2138296。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| ADMETLab3 | 模拟加。公司 | V3.0 | ADMET性质 |
| 阿尔法流形 | 谷歌DeepMind和Isomorphic Labs(字母子公司) | V3.0.1 | 三维蛋白质建模 |
| 蟒蛇/康达 | 安纳康达公司 | V24.9.2 | 开源包管理系统 |
| CB-Dock2 | 杨草实验室 | V2.0 | 蛋白质-配体盲对接 |
| 查姆-圭 | 利哈伊大学 | V3.8 | 生物分子操作与模拟 |
| ACCESS上的达尔文 | 特拉华大学 | 无 | 高性能计算 |
| ORCA | FAccTs 有限公司 | V6.1.0 | 量子化学包 |
| 蛋白质数据库 | 全球蛋白质数据库 | RRID:SCR_006555 | 蛋白质数据库 |
| RDKit | 开源 | RRID:SCR_014274 | 化学信息学编程 |
| 超自然力量3.0 | 生理与科学研究所-信息技术(柏林) | V3.0 | 天然分子库 |
| 瑞士美国机械工程 | 瑞士生物信息学研究所 | RRID:SCR_017865 | ADME 性质 |
| 托克斯树 | Ideaconsult有限公司 | V3.1.0 | 毒性分类 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可