本文介绍了一种通过整合多个配体的分子特征来构建共识药效团模型的实验方案。该方法适用于针对具有已知配体结合构象的任何生物靶标的药物发现研究,能够识别出用于虚拟筛选和合理药物设计的关键相互作用特征。
本文介绍了一种通过整合多个配体的分子特征来构建共识药效团模型的实验方案。该方法适用于针对具有已知配体结合构象的任何生物靶标的药物发现研究,能够识别出用于虚拟筛选和合理药物设计的关键相互作用特征。
药效团定义了化合物与其生物靶标之间实现最佳相互作用所需的分子特征的空间排列。这些模型可通过分析靶标与一组已知配体在其结合构象下的分子间相互作用而获得。共识药效团整合了多个配体的共同特征,从而减少模型偏差并提高预测能力。然而,从数量庞大且化学结构多样的配体集合中生成稳健的共识药效团仍面临技术挑战。
本文介绍了一种利用 ConPhar 构建共识药效团的实验方案。ConPhar 是一种开源信息学工具,旨在识别并聚类多个配体-靶标复合物中的药效团特征。该方案包括模型生成、优化,以及将其应用于超大分子库的虚拟筛选。作为案例研究,我们以严重急性呼吸综合征冠状病毒 2 型主蛋白酶(Mpro)为对象,使用了 100 个与靶标共结晶的非共价抑制剂进行分析。所获得的药效团模型捕获了 Mpro 催化区域的关键相互作用特征,并成功识别出新的潜在配体。
该策略广泛适用于任何可获得配体结合构象的生物靶点。对于拥有大量配体数据集的靶点,此方法尤为有价值,可通过简化具有理想相互作用特征的新候选分子的识别过程,支持理性药物发现。
药效团建模是计算机辅助药物设计中的一项基础技术,能够识别出负责生物活性的关键分子特征1,2。药效团定义了配体与生物靶标之间发生分子相互作用所必需的特征的空间排列,这些特征包括氢键供体、氢键受体、芳香环以及疏水区域3。当存在多个配体-靶标复合物结构(无论是来自实验晶体学数据还是分子模拟)时,可以将它们共有的相互作用模式整合为共识药效团模型,从而提高模型的稳健性,并增强虚拟筛选的准确性4,5。
尽管共识药效团具有实用价值,但其生成在技术上仍具挑战性,尤其是当配体结构多样性较高时。目前虽有多种软件工具可用于从单个配体生成药效团,但尚缺乏将多个特征集整合为统一模型的标准流程6,7。此外,很少有平台提供支持特征聚类、筛选,并能以兼容筛选和可视化工具格式导出的端到端工作流程8。这些局限性制约了共识药效团在大规模药物发现中的广泛应用。
为解决这一空白,ConPhar 被开发为一种全新的开源工具,专门用于从大量预先对齐的配体-靶标复合物中系统性地提取、聚类和构建药效团特征的共识模型。与现有软件不同,ConPhar 提供灵活的参数调节、自动化的特征整合功能,并兼容多种输出格式,有助于生成适用于虚拟筛选流程的稳健共识模型。该工具因此克服了以往在处理大规模且化学多样性丰富的配体库时所面临的关键瓶颈,显著提升了药效团建模工作流程的可重复性和可扩展性。
为展示该方法,我们提供了一种可重复的实验方案,用于从配体-靶标复合物集合中构建共识药效团模型。该工作流程整合了多种开源工具,用于药效团特征提取、聚类、可视化及后续应用。以严重急性呼吸综合征冠状病毒2主蛋白酶(Mpro)为例,我们应用了该方案。Mpro 是一个具有大量结构数据的关键治疗靶点9。我们整理了一个包含100个与 Mpro 共结晶的非共价配体的数据集(截至2025年5月27日的 PDB 条目),排除了无配体结构(apo forms)和冗余复合物。使用专为特征聚类设计的工具 ConPhar,将各个药效团特征提取并合并为一个共识模型10。该案例展示了该方案揭示保守相互作用模式的能力,并可用于超大化合物库的理性筛选。
方法1
方法2

图 1:通过安装 CondaColab 来配置 Google Colab 环境所用的第一个代码块的截图。 执行期间,单元格上方会显示一个蓝色的水平进度条,并在成功完成后变为绿色。请点击此处查看此图的放大版本。

图 2:在 Google Colab 中安装 ConPhar 软件包所用的第二个代码块的截图。 请点击此处查看该图的放大版本。

图 3:截图显示药效团 JSON 文件已成功上传至 Google Colab 中的指定文件夹。 请点击此处查看该图的放大版本。

图4:截图显示了从JSON文件中提取药效团特征并将其整合到单个DataFrame中的代码。 请点击此处查看该图的放大版本。

图 5: 共识药效团模型构建过程中生成的药效团特征聚类的可视化。 请点击此处查看该图的放大版本。

图6: 截图显示已成功生成适用于PyMOL和Pharmit的共识药效团文件。 请点击此处查看该图的放大版本。

图 7:截图显示按特征类型聚类生成的共识药效团文件,包括 PyMOL、Pharmit 和树状图可视化的输出结果。 请点击此处查看该图的放大版本。

图 8: 截图显示共识药效团数据已成功导出至 consensus_result.csv 文件。 请点击此处查看该图的放大版本。
将100个与不同非共价抑制剂共结晶的Mpro复合物进行叠合,如图9A所示。随后将每个配体提取为单独的文件(图9B),并上传至Pharmit服务器。保存会话以生成相应的JSON文件(见图9C)。

图9:用于共识药效团建模的配体准备。(A)三种代表性Mpro复合物的结构比对,这些复合物与非共价抑制剂共结晶。(B)本研究中包含的100个配体的叠加。(C)使用“Load Features”选项将每个配体上传至Pharmit服务器,随后通过“Save Session”选项生成JSON文件。两个操作均以红色箭头标示。请点击此处查看该图的放大版本。
使用完整的 JSON 文件集生成了共识药效团模型,该模型包含 1450 个药效团特征,分为 110 个簇:23 个芳香族(Aro)、30 个氢键受体(HBA)、16 个氢键供体(HBD)、36 个疏水(Hyd)以及 5 个带负电荷(Anion)的簇(图 10A,补充表 1)。我们识别出每种特征中较大的簇,并将其纳入共识模型。在 Aro 簇中,我们选择包含超过 20 个元素的簇;在 HBA、HBD 和 Hyd 组中,我们保留了至少包含 50 个元素的簇。所有 Anion 簇的成员均未超过 4 个,因此未被纳入共识模型(图 10B)。这些数值阈值(Aro 簇成员数 >20;HBA、HBD 和 Hyd 簇成员数 ≥50)是根据簇大小的分布经验确定的,旨在优先选择最保守且密集的相互作用模式。

图10:来自100个Mpro-配体复合物的药效团特征聚类。(A)1450个药效团特征的分布情况:芳香基团(Aro)以紫色表示,氢键受体(HBA)以橙色表示,氢键供体(HBD)以白色表示,疏水基团(Hyd)以绿色表示,带负电荷基团(Anion)以红色表示。(B)显示了包含≥10个成员的Aro、HBA、HBD和Hyd特征聚类;所有Anion聚类均被展示。最大聚类定义为:Aro特征中包含≥20个成员,HBA、HBD和Hyd特征中包含≥50个成员,Anion特征中包含≥4个成员,这些最大聚类以虚线球体突出显示。每个最大聚类中的成员数量均已明确标注。请点击此处查看该图的放大版本。
因此,我们的共识药效团模型包含11个特征:3个芳香环(Aro)特征,即Aro 1、2和3,分别来自包含20、24和45个成员的聚类;4个氢键受体(HBA)特征,即HBA 1、2、3和4,分别来自包含51、55、77和81个成员的聚类;2个氢键供体(HBD)特征,分别来自包含51和71个成员的聚类;以及2个疏水(Hyd)特征,分别来自包含50和52个成员的聚类(见图11A)。
采用已报道的策略10,利用药效团模型对 PubChem 数据库进行检索,但未发现匹配结果。为提高检索灵活性,移除了来源于最小且代表性最差的簇的芳香特征 Aro 1。这一调整使得检索到两个命中化合物,其中包括 PubChem CID 为 101267741 和 10285538 的化合物的构象体(见 图 11B)。化合物 101267741 的二维化学结构如 图 11C 所示。有趣的是,该被识别出的化合物能够很好地嵌入 Mpro 的结合口袋中。与共结晶配体 38a15(PDB ID: 9HAJ)的比较分析表明,化合物 101267741 中与药效团匹配的构象体在 Mpro 的 S1 和 S2 亚口袋中的埋藏深度甚至超过 38a。然而,38a 占据了结合口袋中更广泛的区域,这主要归因于其向 S1′ 亚口袋延伸的乙基羧酰胺侧链。尽管如此,38a 的关键分子间相互作用涉及的是其他基团而非该侧链。相比之下,化合物 101267741 形成了 11 个分子间相互作用,包括 7 个氢键和 4 个疏水接触。与 38a 形成的 3 个氢键和 2 个疏水相互作用相比,化合物 101267741 的结合模式更强(图 11D)。

图11:PubChem数据库中的药效团搜索。(A)完整的共识药效团模型包含11个特征:3个芳香环(紫色)、4个氢键受体(橙色)、2个氢键供体(白色)和2个疏水基团(绿色)。(B)化合物PubChem 101267741的构象与去除Aro 1特征后的简化药效团模型的匹配情况,以及(C)所鉴定化合物的二维化学结构。(D)化合物38a(品红色;来自PDB ID: 9HAJ)与化合物PubChem CID 101267741(绿色)结合于SARS-CoV-2 Mpro催化口袋的结合模式比较分析。每种化合物对应的分子间相互作用显示在右侧。氢键和疏水相互作用分别以蓝色和灰色虚线表示。请点击此处查看该图的放大版本。
支持文件 1:药效团工作流程脚本。 请点击此处下载该文件。
支持性表格1:药效团特征的聚类总结。聚类数量、每类成员数、类中心坐标及类半径 请点击此处下载该文件。
药效团建模有助于合理的药物发现16。本文详细描述的方案用于基于数十种非共价抑制剂,构建SARS-CoV-2主蛋白酶(Mpro)的共识药效团,但该方法也可适用于任何具有已知配体结合构象的生物靶标,尤其是那些拥有大量配体数据集的靶标。与单一药效团或纯配体为基础的模型相比,这种共识方法通过整合多种配体构象,增强了模型的稳健性并减少了偏差。本方案生成的共识药效团模型可应用于多种分子库,包括ChEMBL17和ZINC14等公共数据库、商业化合物库以及专有的内部化合物库。这种灵活性使得在虚拟筛选项目中能够探索广泛而多样的化学空间,从而提高发现新型生物活性化合物的可能性。因此,该工作流程有助于识别具有理想相互作用特征的新型生物活性化合物。
本方案中的一个关键步骤是配体-靶标复合物的精确制备与叠合。将配体预先精确叠合到其生物活性构象,对于确保特征的有意义且可靠的整合至关重要,因为构象错位可能削弱模型的预测能力10。为实现最佳叠合,我们建议利用保守的蛋白质结合位点残基或骨架原子进行结构叠合。对于包含多种配体的数据集,叠合关键相互作用点或药效团特征可增强整个数据集的一致性。此外,建议仔细进行人工检查并校正异常配体构象,以避免可能降低模型准确性的假象。同时,ConPhar 的开源特性便于将其整合到其他计算工作流程中,并可在聚类参数方面进行高级调整。有经验的用户可根据配体数据集的大小、化学多样性或靶标复杂性,调整药效团特征的聚类参数,以平衡模型的普适性与特异性。例如,在处理高度多样化的配体时,逐步聚类或亚组分析可更有效地捕捉相关特征18。
ConPhar 工具目前正处于积极开发阶段。这为希望根据特定研究需求定制该工具的用户提供了显著的灵活性,包括与互补软件流程的集成。然而,由于该软件可能仍会经历更新和变动,建议用户密切关注官方发布的更新信息,并查阅对应版本的文档。报告使用过程中遇到的问题将有助于该工具的持续改进以及更广泛的社区验证。我们的实验方案将构建包含全面相互作用模式的模型,因此可用于大规模化合物库的虚拟筛选。在本研究的代表性结果中,我们应用所获得的药效团模型,成功鉴定了 Mpro 催化区域的两个新的潜在配体。最终,这种共识药效团方法简化了苗头化合物的识别过程,并加速了先导化合物的优化。
然而,我们注意到该方案存在以下局限性:i) 依赖高质量的配体结合结构,因为低分辨率数据可能降低模型的准确性;ii) 可能忽略对特定配体至关重要的独特且重要的相互作用,因为共识药效团强调的是共有特征;iii) 不同软件工具对特征定义的差异可能影响结果的可重复性19。然而,这些局限性可通过分子动力学模拟优化蛋白-配体系统的结构、基于用户知识的聚类保留策略,以及统一使用特定软件识别药效团特征来克服20。
尽管本方案中的共识药效团模型未使用经典的二元指标进行验证,但其预测能力已在先前的研究中得到证实10。在该研究中,采用包含78个化学结构多样配体的独立测试集,对使用相同方法构建的共识药效团进行了验证。验证集中的配体具有≤0.5的Tanimoto相似性、分子量介于200至700 g/mol之间、≤17个可旋转键,并至少包含三个药效团特征。该模型成功识别出已知的活性化合物,证明其适用于虚拟筛选流程,并在化学结构多样的候选化合物中表现出良好的稳健性。
本文报道的实验方案可用于构建药效团模型,以捕获目标分子特有的全面相互作用模式。对于具有大量配体数据的目标分子(如病毒蛋白酶、激酶和核受体)而言,该方法尤其有价值21。所生成的模型适用于对大型化合物库进行虚拟筛选,有助于发现新的生物活性候选分子。通过突出保守且功能相关的关键特征,共识药效团方法可同时支持早期苗头化合物的发现以及后续的先导化合物优化。
作者声明无利益冲突。
本研究部分由 PAPIIT UNAM IV200121(M.A.V-V.)、SECIHTI 项目 CONACYT 639 号讲席(L.C-B. 和 M.A.V-V.)、LANCAD-UNAM-DGTIC-386(L.C-B.)以及生物治疗研发单位(UDIBI)资助。
作者衷心感谢 Eduardo Orozco 在本手稿开发过程中提供的宝贵支持和富有见地的贡献。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Google Colab | Google LLC | https://colab.google | 基于网络的 Python 笔记本运行平台;此处用于执行 ConPhar 和 PyMOL 脚本,以进行共识药效团建模。 |
| Pharmit | 匹兹堡大学 Koes 实验室 | https://pharmit.csb.pitt.edu/search.html | 用于交互式药效团虚拟筛选和化学空间探索的网络平台,支持上传配体文件并生成药效团特征。 |
| PyMOL | Schrödinger, Inc. | https://www.pymol.org | 分子可视化与结构比对软件,用于蛋白质–配体复合物的叠加与分析。 |
| 支持文件 1 药效团工作流程脚本 | Google LLC | https://colab.research.google.com/drive/1Zj8DjazV6mJM-we9iOpoGTZt8JfW4I7D?usp=sharing | 在 Google Colab 中安装 Conda、PyMOL 并运行药效团工作流程的完整可执行脚本。亦作为支持文件 1 提供。 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可