本研究探讨了来自多种药用植物基因组中参与或预测参与三维结构域交换的蛋白质。通过采用机器学习模型,准确预测三维结构域交换蛋白,并预测其功能及其在次生代谢物生成中的相关性。
方法文章
本研究探讨了来自多种药用植物基因组中参与或预测参与三维结构域交换的蛋白质。通过采用机器学习模型,准确预测三维结构域交换蛋白,并预测其功能及其在次生代谢物生成中的相关性。
3D 结构域互换是一种蛋白质结构现象,其中两个或多个蛋白质亚基交换相同的结构亚基并形成寡聚体。表现出 3D 结构域互换的蛋白质在多种生物学功能中发挥关键作用,例如药用植物中的次生代谢物生物合成,以及应对多种生物和非生物胁迫。本研究探讨了利用随机森林和 K-最近邻分类器模型预测药用植物基因组中 3D 结构域互换模式的能力,其准确率分别为 91.6% 和 88.7%。总共 420 条(31%)序列被预测为可能参与 3D 结构域互换。此外,还对来自多种药用植物的预测 3D 结构域互换蛋白序列进行了富集分析,基于基因本体(GO)术语、京都基因与基因组百科全书(KEGG)通路分析以及其在次生代谢物生物合成通路中的结构域分布进行功能注释。对预测序列的功能注释推断表明,3D 结构域互换序列参与多种分子功能,如光系统 II 中的光合电子传递和电子载体,在光合作用环式电子传递途径中转移电子,氧化磷酸化,以及通过合成次生代谢物(萜类、生物碱和多胺)调控环境胁迫(生物和非生物)相关基因的表达。这些发现强调了机器学习在预测蛋白质参与 3D 结构域互换现象及其相应功能方面的能力,并凸显了其在促进药物发现和生物工程研究中的潜力。
计算方法通过实现对蛋白质结构、功能和相互作用的详细分析与预测,彻底改变了蛋白质研究。精确识别和注释蛋白质功能对于揭示生命分子机制至关重要,并在医学进步和药物开发中具有深远意义。然而,实验方法本身具有复杂性和高成本,限制了其在大规模序列数据中的应用扩展。因此,蛋白质功能预测的计算方法已成为计算生物学和分子生物学中的一个关键研究领域,通过创新的大规模方法弥补了这一空白1。
3D结构域互换2是一种蛋白质中的结构现象,指共享结构中的某些片段在单个肽链之间发生交换。1994年,首次在白喉毒素二聚体中发现了关于3D结构域互换机制的报道3。然而,3D结构域互换的基本原理可追溯至四十年前。已有研究表明,牛胰核糖核酸酶A(RNase A)在乙酸中冻干时,可通过复杂的化学修饰实验观察到其形成二聚体4。在蛋白质寡聚化过程中,两条或更多条蛋白质链通过柔性的铰链区交换相同的结构元件。在单体亚基之间发生交换的蛋白质部分被称为互换结构域,其可能包含一个完整的球状结构域、一个环区,或在某些蛋白质中的二级结构元件。相反,在单体中原位置保持不变的区域则称为非互换结构域5。非互换结构域之间的结合被称为非互换结构域界面(NSDI),如图1所示。在3D结构域互换中,一个蛋白质亚基的非互换结构域与另一个亚基已互换的结构域之间的关系被称为互换结构域界面(SDI)。该现象的另一个重要特征是铰链区,即连接非互换结构域与互换结构域的一段柔性连接片段。铰链区在促进3D结构域互换的运动中发挥关键作用,并作为构象开关,使结构重排成为可能,从而实现结构域的互换。3D结构域互换已被证实参与多种生物学过程,包括蛋白质组装和功能调控5。此外,该现象还与某些蛋白质错误折叠疾病相关,异常的结构域互换可能导致聚集体或淀粉样纤维的形成。

图1:三维结构域交换的结构示意图。 该示意图展示了两个蛋白质单体之间通过一个柔性铰链区交换相同的结构元件,从而形成结构域交换的二聚体或寡聚体组装体。请点击此处查看该图的放大版本。
根据交换结构域的性质及形成的寡聚体结构,已鉴定出多种类型的三维结构域交换6。2002年,Eisenberg 及其同事确定了三种三维结构域交换类型:真实结构域交换(BDS)、准结构域交换(QDS)和三维结构域交换候选体(CDS)7。其中最常见的蛋白类别为真实结构域交换,指二聚体和单体分子均以稳定形式存在,其中二聚体呈现结构域交换构型,而单体则呈现闭合构型。在准结构域交换中,蛋白质以寡聚体形式存在,但其同源蛋白以单体形式存在。在CDS中,仅确认该蛋白质属于结构域交换类别,但缺乏相关单体或其单体同源物的结构信息8。在此类情况下,不存在单体或其单体同源物,而是存在异源蛋白质分子。表1列出了这三类的示例9。
表1:3D结构域交换的类型及示例。 请点击此处下载该表格。
后续研究揭示了大量发生结构域交换的蛋白质结构,为理解三维结构域交换概念奠定了基础。最早支持这一现象的结构证据来自λ噬菌体Cro阻遏蛋白分子,该蛋白通过其C末端链段的交换形成二聚体结构。1996年,研究人员发现单体形式的Cro蛋白也参与了三维结构域交换10。其他一些结构11,如βB2-晶状体蛋白12、人源CksHs2蛋白13、牛肝过氧化氢酶14以及重组人白细胞介素-515,也被报道可能属于三维结构域交换结构。根据蛋白质分子中发生交换的结构域位置,三维结构域交换可分为三类:C末端结构域交换、N末端结构域交换以及相对少见的中心结构域交换。有研究者利用完整的人类基因组预测结构域交换案例,采用随机森林和支持向量机作为二分类器,其准确率分别为81.7%和73.9%。在人类基因组中,近44%的蛋白质序列被预测为具有三维结构域交换特征6。研究还对预测结果进行了富集分析,涵盖其结构域分布、疾病相关性分布以及基于基因本体(GO)的功能注释。另一种方法通过对Ocimum tenuiflorum(罗勒)进行全基因组范围分析,采用随机森林算法,发现该物种中约25%的蛋白质序列被预测参与三维结构域交换。研究人员还通过GO术语关联及其蛋白质结构域家族关联进行功能注释,发现仅有1158条序列与非生物胁迫相关16。
植物表现出多种独特的蛋白质家族,其中某些特定蛋白质因其能够发生结构重排而受到关注,包括三维结构域交换(3D domain swapping)。三维结构域交换可能通过影响生物和非生物胁迫条件下次生代谢物的生成或其他具有重要生物学意义的通路,进而产生多种药理学应用;因此,该现象成为本研究的重要关注点。Wal1 的晶体结构显示出一种结构域交换的二聚体构型,其不对称单元中包含两个二聚体,并呈现出与半胱氨酸蛋白酶抑制剂 C(cystatin C)类似的结构重排。植物半胱氨酸蛋白酶抑制剂(Phytocystatins)在应对非生物胁迫中发挥重要作用,同时还能增强作物抗性。根据现有文献及多个相关数据库的资料,已鉴定出共计 20,121 种预测存在三维结构域交换的蛋白质,其中 17,552 种来源于植物,2,569 种来源于非植物生物17,18。
在文献中,已有多种利用机器学习方法预测不同植物中三维结构域交换的实例报道。例如,Arabidopsis thaliana 的12,033条经审阅序列中有4058条(占33.7%)存在三维结构域交换,Medicago truncatula 的186条经审阅序列中有39条(占20.9%),Solanum tuberosum 的400条经审阅序列中有146条(占36.5%),Solanum lycopersicum 的423条经审阅序列中有108条(占25.5%),以及 Ocimum tenuiflorum 的36,841条经审阅序列中有5706条(占15.5%)6。计算方法在探索三维结构域交换蛋白的结构与功能特性方面已变得不可或缺。这些方法基于最优特征19、注释及富集分析实现序列预测,有助于揭示基本的分子机制。通过使用基于支持向量机(SVM)的分类器,实现了对多种蛋白质序列中三维结构域交换的预测。该方法结合了序列与结构特征,训练数据集上的预测准确率达到76.33%,测试数据集上达到73.81%,表明其在识别蛋白质结构域交换倾向方面具有潜力20。选择KNN而非SVM的主要原因是KNN的训练过程更为简单,仅需设定一个主要参数K(即预测时考虑的最近邻数量),而SVM则需要仔细调节多个参数,如核函数类型、C值和gamma值。此外,KNN能更简便地处理多分类问题,而SVM通常需要采用更复杂的策略,例如一对一策略。
用于蛋白质结构预测的机器学习
蛋白质结构的预测涉及从其 FASTA 序列推断出蛋白质的三维形状。该领域的最新进展在很大程度上得益于将多种机器学习技术应用于进化数据21,22。早期从共进化数据中提取信息的方法依赖于机器学习技术。然而,近年来的策略,特别是利用深度残差网络的方法,在预测潜在目标方面表现出更优的性能23。Alphafold 是一个基于深度学习的数据库,而 Rosetta 是一个基于物理能量函数的工具。这些工具可用于预测可逼近实验结构的完整三维原子结构。它们仅提供原子分辨率的结构坐标,但无法明确识别三维结构域交换事件。相比之下,本文提出的方法并非完整的三维结构预测工具,而是仅用于预测某种蛋白质是否可能发生三维结构域交换24,25。
药用植物作为天然资源,因其生物活性化合物,已被用于预防和治疗多种疾病达数个世纪之久。它们在传统医学中具有重要作用,并促进了现代药物的研发。然而,在药用植物蛋白质三维结构域交换用于药物发现的研究领域,目前尚未开展显著的工作。包括机器学习及其集成模型在内的算法,能够识别序列数据中的模式与关系,以预测三维结构域交换现象。本研究选择药用植物的原因在于,它有助于揭示参与三维结构域交换的植物蛋白质的功能多样性,从而增进对植物应激响应、病原体防御以及代谢物生物合成机制的理解。由于利用核磁共振(NMR)或晶体学技术在大量且复杂的高级寡聚构象中确定蛋白质三维结构域交换存在技术挑战,因此凸显了开发先进计算方法的必要性。
本研究工作的总体目标是采用计算方法,利用随机森林(Random Forest, RF)26 和 K-最近邻(K-nearest neighbor, KNN)27 算法,对多种药用植物序列中的三维结构域交换现象进行蛋白质序列结构预测任务,并完成全基因组范围的分析。随机森林(RF)是一种二分类器,是一种稳健且通用的机器学习算法,广泛应用于蛋白质序列分析。该算法通过构建多个决策树(DT)的集成模型进行运算,在训练集和测试集上均能实现较高的预测准确率。在蛋白质序列分析任务中,RF 可以分析多种特征,包括理化性质、序列组成、二级结构以及从序列比对或谱图中提取的进化信息。RF 擅长处理大规模且含有噪声的数据集,并可提供特征重要性评估指标28。K-最近邻(K-Nearest Neighbors, KNN)分类器是一种简单而有效的机器学习算法,广泛应用于蛋白质序列分析。其原理是根据输入序列在特征空间中与其最近的 k 个邻居样本的多数类别来判定其分类。在蛋白质序列分析中,KNN 可用于预测功能类别、结构特性以及亚细胞定位。用于 KNN 分类的特征通常包括氨基酸组成、序列模体、进化谱图或理化属性。由于其结构简单、易于解释且效果良好,KNN 成为蛋白质序列分析中的常用工具29。这两种算法相互补充,共同构建了一个全面的计算框架,用于研究多种药用植物序列中的三维结构域交换现象。需要强调的是,这两个模型仅能预测可能发生结构域交换的潜在案例,并不能预测完整的三维结构坐标,也无法确定在交换过程中具体参与的区域或残基。明确参与交换的具体区域或残基,进而阐明三维结构域交换事件的机制及其功能意义,仍需进一步研究。三维结构域交换包含多种结构上不同的现象,例如闭环构型、开放末端交换,以及其他差异,如不同的铰链区和结构域架构。鉴于此,本文提出的方法将所有类型的三维结构域交换事件归入统一的分类体系中。这一选择最初是由于可用于标注特定三维结构域交换类别的数据十分有限。这是首次针对多种药用植物数据集开展的此类尝试,我们认为,若能区分不同的交换机制,将有助于提升模型的预测准确性。
药用植物中的富集分析有助于识别参与生物活性化合物合成和应激反应的关键基因、蛋白质及通路,从而揭示其分子机制。这类分析研究药用植物中与生物活性物质合成、抗逆性及抗病性相关的重要基因、蛋白质和生物学过程。对选定蛋白质进行功能注释,例如基因本体(GO)和KEGG通路分析,可揭示次生代谢物生成及环境胁迫响应背后的分子机制。该方法显著促进药物发现,提升作物抗逆能力,并阐明植物代谢通路,推动可持续农业与药用植物研究的发展。
本研究的新颖贡献
本研究强调了机器学习在推动构建更精确、更高效的模型以预测生物数据集中蛋白质结构模式方面的能力。
本研究将新特征整合到机器学习算法中,提升了其预测蛋白质功能的准确性。这些特征有助于更深入理解蛋白质的结构-功能关系,从而在蛋白质工程中实现更精确的蛋白质设计与优化。
对预测蛋白进行富集分析有助于发现关键的生物通路、细胞过程和分子功能,为生物标志物发现、药物设计以及疾病机制研究提供有价值的靶点。该分析可提高基于通路的干预措施及治疗靶点鉴定的精确性。
访问受限。请登录或开始试用以查看此内容。
注意:本部分提供了建议方法的全面概述,包含六个主要步骤:(a)数据收集,(b)特征选择,(c)数据预处理,(d)数据后处理,(e)模型构建,(f)所提出模型的结果评估,以及(g)在不同层次对预测为阳性的序列进行富集分析。本研究使用了第十代 Core i5-10500 处理器。该处理器拥有六个核心和 12 个线程,基础频率为 3.10 GHz,最大睿频可达 4.50 GHz。它配备 12 MB 的 Intel Smart Cache,支持 DDR4-2666 内存,并集成 UHD Graphics 630 以提供图形处理能力。该处理器专为高效多任务处理和生产力设计,兼容 LGA 1200 插槽,热设计功耗(TDP)为 65W。
1. 数据收集
2. 使用该功能进行模型创建
表2:新增特征及其描述列表。 该表格总结了在特征提取阶段构建的新颖特征,旨在提升模型在预测三维结构域交换方面的性能。每个特征均捕捉了蛋白质特定的基于序列、理化或结构特性,这些特性被认为可能影响其发生结构域交换的倾向性。文中提供了详细描述,以阐明各特征的生物学意义及其计算推导方法。请点击此处下载该表格。
3. 数据预处理与后处理
注意:数据预处理。数据预处理是机器学习中至关重要的步骤,涉及为分析准备原始数据。包括清理数据(例如,去除重复项、处理缺失值等)。
4. 模型的建立与实施

图 2:示意图说明。 本图展示了随机森林(Random Forest)和K近邻(K-Nearest Neighbor, KNN)机器学习模型,呈现了它们在二分类任务背景下的算法结构与功能工作流程 请点击此处查看该图的放大版本。

图3:基于机器学习的工作流程。该图展示了一种基于机器学习的流程,用于预测药用植物蛋白中的三维结构域交换。该过程始于数据集获取,整合基准数据集与元数据集。特征提取包括从蛋白质序列中推导已有特征和新特征。在数据集预处理阶段,通过序列解析和字典映射将FASTA序列转换为数值,以构建结构化数据框,其中包括特定的三维结构域交换特征。后处理步骤包括使用阈值(β = 0.5)分配结构域交换状态、将数据按70-30比例划分为训练集和测试集、特征标准化,以及通过k折交叉验证进行特征选择。训练了两种机器学习模型:随机森林(RF)和K近邻(KNN),并利用模型评估指标以及AUROC和AUPRC来评估其预测准确性与稳健性。请点击此处查看该图的放大版本。
5. 机器学习分类器的静态评估与模型评价
(1)
(2)
(3)
(4)
(5)
(6)6. 在多种药用植物物种中应用模型预测三维结构域交换
7. 药用植物中正向预测的三维结构域交换蛋白的富集分析
访问受限。请登录或开始试用以查看此内容。
表现出三维结构域交换的蛋白质常与多种生物学功能相关。然而,针对参与三维结构域交换的蛋白质序列进行系统性、全基因组范围的分析仍基本未被探索。本研究首次尝试从13种药用植物中预测潜在的三维结构域交换蛋白,并重点分析其与次生代谢物结构域、KEGG通路及基因本体(GO)术语的关联。通过对现有文献的综合分析及所应用机器学习模型的性能评估表明,相较于K-近邻算法(KNN),随机森林(RF)模型在预测三维结构域交换类别方面表现出更优的性能。 图4A,较高的AUC值表明AUROC分析性能优异;RF模型(AUC=-0.914)在区分3D-DS与3D-NDS类别方面表现出较强的判别能力。尽管KNN模型的AUC值(AUC=-0.883)略低于RF模型,但仍显示出良好的3D结构域交换分类能力& 三维非结构域交换。在 图4B,精确率-召回率曲线(AUPRC)显示,RF模型具有较高的精确率和召回率,表明其在减少假阳性(FP)病例方面效果显著。尽管KNN模型表现出完美的精确率,意味着其未产生任何假阳性结果,但其较低的召回率表明该模型遗漏了大...
访问受限。请登录或开始试用以查看此内容。
全面了解蛋白质在其完整基因组范围内的三维结构域交换现象在多个领域具有重要意义。机器学习方法,特别是随机森林和K近邻算法26,27,已被用于直接从基因组水平的蛋白质序列数据中预测三维结构域交换。这两种机器学习模型包含多个步骤,如数据集收集、特征选择、数据预处理与后处理、自定义模型脚本的实现以及模型评估。随机森林和K近邻模型的预测准确率分别为91.6%和88.7%。随后,这些预测模型被应用于13种药用植物的不同完整基因组。
据我们所知,这是首次利用机器学习技术在基因组尺度上对药用植物中的三维结构域交换现象进行全面研究。本研究选择KNN而非SVM,因为KNN更为简单,且在处理复杂非线性数据方面优于SVM。预测结果显示,在分析的序列中,有30.99%可能与三维结构域交换相关,凸显了这一结构现象在多种植物物种中的广泛存在。当前方法主要侧重于结构预测及其分子和功能多样性。RF和KNN仅能预测可能发生结构域交换的潜在案例,而无法预测完整的三维结构坐标,或确定具体参与该过程的残基区...
访问受限。请登录或开始试用以查看此内容。
作者声明,他们不存在任何已知的可能影响本文所报告工作的竞争性经济利益或个人关系。
本研究未获得任何资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 3DSwap+ | https://caps.ncbs.res.in/3Dswapplus/index.html | ||
| Pfam | EMBL-EBI | http://pfam.xfam.org/: | |
| HMMER | EMBL-EBI | https://www.ebi.ac.uk/Tools/hmmer/: | |
| Aaindex | https://www.genome.jp/aaindex/: | ||
| DIAL | Bioinformaticshome.com | https://bioinformaticshome.com/db/tool/DIAL: | |
| WEKA | 怀卡托大学 | https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/ | |
| KEGG | https://www.genome.jp/kegg/ : | ||
| ShinyGO | https://bioinformatics.sdstate.edu/go/ : | ||
| uniprot | Uniprot | https://www.uniprot.org/ : |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可