方法文章

药用植物中三维结构域交换蛋白的机器学习预测

DOI:

10.3791/68519

2025年8月15日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究探讨了来自多种药用植物基因组中参与或预测参与三维结构域交换的蛋白质。通过采用机器学习模型,准确预测三维结构域交换蛋白,并预测其功能及其在次生代谢物生成中的相关性。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

3D 结构域互换是一种蛋白质结构现象,其中两个或多个蛋白质亚基交换相同的结构亚基并形成寡聚体。表现出 3D 结构域互换的蛋白质在多种生物学功能中发挥关键作用,例如药用植物中的次生代谢物生物合成,以及应对多种生物和非生物胁迫。本研究探讨了利用随机森林和 K-最近邻分类器模型预测药用植物基因组中 3D 结构域互换模式的能力,其准确率分别为 91.6% 和 88.7%。总共 420 条(31%)序列被预测为可能参与 3D 结构域互换。此外,还对来自多种药用植物的预测 3D 结构域互换蛋白序列进行了富集分析,基于基因本体(GO)术语、京都基因与基因组百科全书(KEGG)通路分析以及其在次生代谢物生物合成通路中的结构域分布进行功能注释。对预测序列的功能注释推断表明,3D 结构域互换序列参与多种分子功能,如光系统 II 中的光合电子传递和电子载体,在光合作用环式电子传递途径中转移电子,氧化磷酸化,以及通过合成次生代谢物(萜类、生物碱和多胺)调控环境胁迫(生物和非生物)相关基因的表达。这些发现强调了机器学习在预测蛋白质参与 3D 结构域互换现象及其相应功能方面的能力,并凸显了其在促进药物发现和生物工程研究中的潜力。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

计算方法通过实现对蛋白质结构、功能和相互作用的详细分析与预测,彻底改变了蛋白质研究。精确识别和注释蛋白质功能对于揭示生命分子机制至关重要,并在医学进步和药物开发中具有深远意义。然而,实验方法本身具有复杂性和高成本,限制了其在大规模序列数据中的应用扩展。因此,蛋白质功能预测的计算方法已成为计算生物学和分子生物学中的一个关键研究领域,通过创新的大规模方法弥补了这一空白1

3D结构域互换2是一种蛋白质中的结构现象,指共享结构中的某些片段在单个肽链之间发生交换。1994年,首次在白喉毒素二聚体中发现了关于3D结构域互换机制的报道3。然而,3D结构域互换的基本原理可追溯至四十年前。已有研究表明,牛胰核糖核酸酶A(RNase A)在乙酸中冻干时,可通过复杂的化学修饰实验观察到其形成二聚体4。在蛋白质寡聚化过程中,两条或更多条蛋白质链通过柔性的铰链区交换相同的结构元件。在单体亚基之间发生交换的蛋白质部分被称为互换结构域,其可能包含一个完整的球状结构域、一个环区,或在某些蛋白质中的二级结构元件。相反,在单体中原位置保持不变的区域则称为非互换结构域5。非互换结构域之间的结合被称为非互换结构域界面(NSDI),如图1所示。在3D结构域互换中,一个蛋白质亚基的非互换结构域与另一个亚基已互换的结构域之间的关系被称为互换结构域界面(SDI)。该现象的另一个重要特征是铰链区,即连接非互换结构域与互换结构域的一段柔性连接片段。铰链区在促进3D结构域互换的运动中发挥关键作用,并作为构象开关,使结构重排成为可能,从而实现结构域的互换。3D结构域互换已被证实参与多种生物学过程,包括蛋白质组装和功能调控5。此外,该现象还与某些蛋白质错误折叠疾病相关,异常的结构域互换可能导致聚集体或淀粉样纤维的形成。

分子生物学过程中蛋白质单体和界面的结构域交换示意图。
图1:三维结构域交换的结构示意图。 该示意图展示了两个蛋白质单体之间通过一个柔性铰链区交换相同的结构元件,从而形成结构域交换的二聚体或寡聚体组装体。请点击此处查看该图的放大版本。

根据交换结构域的性质及形成的寡聚体结构,已鉴定出多种类型的三维结构域交换6。2002年,Eisenberg 及其同事确定了三种三维结构域交换类型:真实结构域交换(BDS)、准结构域交换(QDS)和三维结构域交换候选体(CDS)7。其中最常见的蛋白类别为真实结构域交换,指二聚体和单体分子均以稳定形式存在,其中二聚体呈现结构域交换构型,而单体则呈现闭合构型。在准结构域交换中,蛋白质以寡聚体形式存在,但其同源蛋白以单体形式存在。在CDS中,仅确认该蛋白质属于结构域交换类别,但缺乏相关单体或其单体同源物的结构信息8。在此类情况下,不存在单体或其单体同源物,而是存在异源蛋白质分子。表1列出了这三类的示例9

表1:3D结构域交换的类型及示例。 请点击此处下载该表格。

后续研究揭示了大量发生结构域交换的蛋白质结构,为理解三维结构域交换概念奠定了基础。最早支持这一现象的结构证据来自λ噬菌体Cro阻遏蛋白分子,该蛋白通过其C末端链段的交换形成二聚体结构。1996年,研究人员发现单体形式的Cro蛋白也参与了三维结构域交换10。其他一些结构11,如βB2-晶状体蛋白12、人源CksHs2蛋白13、牛肝过氧化氢酶14以及重组人白细胞介素-515,也被报道可能属于三维结构域交换结构。根据蛋白质分子中发生交换的结构域位置,三维结构域交换可分为三类:C末端结构域交换、N末端结构域交换以及相对少见的中心结构域交换。有研究者利用完整的人类基因组预测结构域交换案例,采用随机森林和支持向量机作为二分类器,其准确率分别为81.7%和73.9%。在人类基因组中,近44%的蛋白质序列被预测为具有三维结构域交换特征6。研究还对预测结果进行了富集分析,涵盖其结构域分布、疾病相关性分布以及基于基因本体(GO)的功能注释。另一种方法通过对Ocimum tenuiflorum(罗勒)进行全基因组范围分析,采用随机森林算法,发现该物种中约25%的蛋白质序列被预测参与三维结构域交换。研究人员还通过GO术语关联及其蛋白质结构域家族关联进行功能注释,发现仅有1158条序列与非生物胁迫相关16

植物表现出多种独特的蛋白质家族,其中某些特定蛋白质因其能够发生结构重排而受到关注,包括三维结构域交换(3D domain swapping)。三维结构域交换可能通过影响生物和非生物胁迫条件下次生代谢物的生成或其他具有重要生物学意义的通路,进而产生多种药理学应用;因此,该现象成为本研究的重要关注点。Wal1 的晶体结构显示出一种结构域交换的二聚体构型,其不对称单元中包含两个二聚体,并呈现出与半胱氨酸蛋白酶抑制剂 C(cystatin C)类似的结构重排。植物半胱氨酸蛋白酶抑制剂(Phytocystatins)在应对非生物胁迫中发挥重要作用,同时还能增强作物抗性。根据现有文献及多个相关数据库的资料,已鉴定出共计 20,121 种预测存在三维结构域交换的蛋白质,其中 17,552 种来源于植物,2,569 种来源于非植物生物1718

在文献中,已有多种利用机器学习方法预测不同植物中三维结构域交换的实例报道。例如,Arabidopsis thaliana 的12,033条经审阅序列中有4058条(占33.7%)存在三维结构域交换,Medicago truncatula 的186条经审阅序列中有39条(占20.9%),Solanum tuberosum 的400条经审阅序列中有146条(占36.5%),Solanum lycopersicum 的423条经审阅序列中有108条(占25.5%),以及 Ocimum tenuiflorum 的36,841条经审阅序列中有5706条(占15.5%)6。计算方法在探索三维结构域交换蛋白的结构与功能特性方面已变得不可或缺。这些方法基于最优特征19、注释及富集分析实现序列预测,有助于揭示基本的分子机制。通过使用基于支持向量机(SVM)的分类器,实现了对多种蛋白质序列中三维结构域交换的预测。该方法结合了序列与结构特征,训练数据集上的预测准确率达到76.33%,测试数据集上达到73.81%,表明其在识别蛋白质结构域交换倾向方面具有潜力20。选择KNN而非SVM的主要原因是KNN的训练过程更为简单,仅需设定一个主要参数K(即预测时考虑的最近邻数量),而SVM则需要仔细调节多个参数,如核函数类型、C值和gamma值。此外,KNN能更简便地处理多分类问题,而SVM通常需要采用更复杂的策略,例如一对一策略。

用于蛋白质结构预测的机器学习
蛋白质结构的预测涉及从其 FASTA 序列推断出蛋白质的三维形状。该领域的最新进展在很大程度上得益于将多种机器学习技术应用于进化数据21,22。早期从共进化数据中提取信息的方法依赖于机器学习技术。然而,近年来的策略,特别是利用深度残差网络的方法,在预测潜在目标方面表现出更优的性能23。Alphafold 是一个基于深度学习的数据库,而 Rosetta 是一个基于物理能量函数的工具。这些工具可用于预测可逼近实验结构的完整三维原子结构。它们仅提供原子分辨率的结构坐标,但无法明确识别三维结构域交换事件。相比之下,本文提出的方法并非完整的三维结构预测工具,而是仅用于预测某种蛋白质是否可能发生三维结构域交换24,25

药用植物作为天然资源,因其生物活性化合物,已被用于预防和治疗多种疾病达数个世纪之久。它们在传统医学中具有重要作用,并促进了现代药物的研发。然而,在药用植物蛋白质三维结构域交换用于药物发现的研究领域,目前尚未开展显著的工作。包括机器学习及其集成模型在内的算法,能够识别序列数据中的模式与关系,以预测三维结构域交换现象。本研究选择药用植物的原因在于,它有助于揭示参与三维结构域交换的植物蛋白质的功能多样性,从而增进对植物应激响应、病原体防御以及代谢物生物合成机制的理解。由于利用核磁共振(NMR)或晶体学技术在大量且复杂的高级寡聚构象中确定蛋白质三维结构域交换存在技术挑战,因此凸显了开发先进计算方法的必要性。

本研究工作的总体目标是采用计算方法,利用随机森林(Random Forest, RF)26 和 K-最近邻(K-nearest neighbor, KNN)27 算法,对多种药用植物序列中的三维结构域交换现象进行蛋白质序列结构预测任务,并完成全基因组范围的分析。随机森林(RF)是一种二分类器,是一种稳健且通用的机器学习算法,广泛应用于蛋白质序列分析。该算法通过构建多个决策树(DT)的集成模型进行运算,在训练集和测试集上均能实现较高的预测准确率。在蛋白质序列分析任务中,RF 可以分析多种特征,包括理化性质、序列组成、二级结构以及从序列比对或谱图中提取的进化信息。RF 擅长处理大规模且含有噪声的数据集,并可提供特征重要性评估指标28。K-最近邻(K-Nearest Neighbors, KNN)分类器是一种简单而有效的机器学习算法,广泛应用于蛋白质序列分析。其原理是根据输入序列在特征空间中与其最近的 k 个邻居样本的多数类别来判定其分类。在蛋白质序列分析中,KNN 可用于预测功能类别、结构特性以及亚细胞定位。用于 KNN 分类的特征通常包括氨基酸组成、序列模体、进化谱图或理化属性。由于其结构简单、易于解释且效果良好,KNN 成为蛋白质序列分析中的常用工具29。这两种算法相互补充,共同构建了一个全面的计算框架,用于研究多种药用植物序列中的三维结构域交换现象。需要强调的是,这两个模型仅能预测可能发生结构域交换的潜在案例,并不能预测完整的三维结构坐标,也无法确定在交换过程中具体参与的区域或残基。明确参与交换的具体区域或残基,进而阐明三维结构域交换事件的机制及其功能意义,仍需进一步研究。三维结构域交换包含多种结构上不同的现象,例如闭环构型、开放末端交换,以及其他差异,如不同的铰链区和结构域架构。鉴于此,本文提出的方法将所有类型的三维结构域交换事件归入统一的分类体系中。这一选择最初是由于可用于标注特定三维结构域交换类别的数据十分有限。这是首次针对多种药用植物数据集开展的此类尝试,我们认为,若能区分不同的交换机制,将有助于提升模型的预测准确性。

药用植物中的富集分析有助于识别参与生物活性化合物合成和应激反应的关键基因、蛋白质及通路,从而揭示其分子机制。这类分析研究药用植物中与生物活性物质合成、抗逆性及抗病性相关的重要基因、蛋白质和生物学过程。对选定蛋白质进行功能注释,例如基因本体(GO)和KEGG通路分析,可揭示次生代谢物生成及环境胁迫响应背后的分子机制。该方法显著促进药物发现,提升作物抗逆能力,并阐明植物代谢通路,推动可持续农业与药用植物研究的发展。

本研究的新颖贡献
本研究强调了机器学习在推动构建更精确、更高效的模型以预测生物数据集中蛋白质结构模式方面的能力。

本研究将新特征整合到机器学习算法中,提升了其预测蛋白质功能的准确性。这些特征有助于更深入理解蛋白质的结构-功能关系,从而在蛋白质工程中实现更精确的蛋白质设计与优化。

对预测蛋白进行富集分析有助于发现关键的生物通路、细胞过程和分子功能,为生物标志物发现、药物设计以及疾病机制研究提供有价值的靶点。该分析可提高基于通路的干预措施及治疗靶点鉴定的精确性。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

注意:本部分提供了建议方法的全面概述,包含六个主要步骤:(a)数据收集,(b)特征选择,(c)数据预处理,(d)数据后处理,(e)模型构建,(f)所提出模型的结果评估,以及(g)在不同层次对预测为阳性的序列进行富集分析。本研究使用了第十代 Core i5-10500 处理器。该处理器拥有六个核心和 12 个线程,基础频率为 3.10 GHz,最大睿频可达 4.50 GHz。它配备 12 MB 的 Intel Smart Cache,支持 DDR4-2666 内存,并集成 UHD Graphics 630 以提供图形处理能力。该处理器专为高效多任务处理和生产力设计,兼容 LGA 1200 插槽,热设计功耗(TDP)为 65W。

1. 数据收集

  1. 使用3d3dswap-pred(https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html)和3DSwap+(https://caps.ncbs.res.in/3Dswapplus/index.html)30补充表1、补充表2、补充文件1、补充文件2)。采用总共573个经人工整理的3D结构域交换分子的PDB条目,主要来源于药用植物。
  2. 采用最佳代表性谱图(Best Representative Profile, BRP)方法构建负数据集,为每个Pfam31蛋白家族(http://pfam.xfam.org/)分配一个最佳代表性序列(Best Representative Sequence, BRS)。使用HMMER32(https://www.ebi.ac.uk/Tools/hmmer/)以0.001的E值阈值,将总共10,112条结构序列与所有Pfam BRP进行比对。利用DIAL工具处理所得序列以识别结构域(https://bioinformaticshome.com/db/tool/DIAL)。将575个PDB条目作为负数据集(训练集)纳入分析。
  3. 纳入通过BRP方法获得的314条蛋白序列,以及由3DSwap+鉴定出的261条经人工整理的非3D结构域交换序列,作为负数据集。
  4. 从UniProt33(https://www.uniprot.org/)获取来自多种药用植物的共计1,355条经审核的蛋白序列条目。本研究共纳入13种药用植物(测试/预测数据集):Citrus sinensis (RS-102)、Vitis vinifera (RS-226)、Mentha (RS-28)、Cannabis sativa (RS-21)、Acorus clamus (RS-511)、Coffea arabica (RS-104)、Papaver somniferum (RS-58)、Hibiscus (RS-88)、Jasmine (RS-89)、Thyme (RS-30)、Thymus (RS-14)、Illicium oligandrum (RS-72) 和 Citrus limon (RS-12)。系统发育树见于补充图1

2. 使用该功能进行模型创建

  1. 利用包含453个特征的综合特征集来预测药用植物中的蛋白质序列。该特征集包括439个已知特征和16个新特征,这些新特征基于全面的文献综述精心筛选得出。
  2. 使用AAindex数据库34(https://www.genome.jp/aaindex/)确定氨基酸的理化性质。应用WEKA35机器学习平台(https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/)进行特征选择。新引入的特征详见表2

表2:新增特征及其描述列表。 该表格总结了在特征提取阶段构建的新颖特征,旨在提升模型在预测三维结构域交换方面的性能。每个特征均捕捉了蛋白质特定的基于序列、理化或结构特性,这些特性被认为可能影响其发生结构域交换的倾向性。文中提供了详细描述,以阐明各特征的生物学意义及其计算推导方法。请点击此处下载该表格。

3. 数据预处理与后处理

注意:数据预处理。数据预处理是机器学习中至关重要的步骤,涉及为分析准备原始数据。包括清理数据(例如,去除重复项、处理缺失值等)。

  1. 使用补充编码文件1将分类变量编码为数值形式,该文件包含四个主要步骤:(1)定义评分字典,(2)通过seq I0. parse处理fasta序列,(3)创建数据框,(4)对三维结构域交换特征进行数值分析。
  2. 通过数据后处理优化并解释模型输出。重新校准预测结果,汇总分析结果,并应用分类阈值。根据先前研究支持36,37,38,采用阈值β = 0.5(范围0–1)对双峰三维结构域交换数据集进行分类。
  3. 以70:30的训练集–测试集划分比例分割数据集,其中70%用于模型训练,30%用于独立评估。
  4. 使用标准缩放器(Standard Scaler)方法对训练数据进行标准化处理,使各特征值的均值为0、标准差为1,以提高与机器学习估计器的兼容性。进行特征选择以识别最具影响的变量。
    注意:数据标准化是许多机器学习算法广泛采用的预处理步骤,以确保最佳性能。偏离正态分布的数据可能对机器学习模型的性能产生负面影响39
  5. 进行验证。为确保模型评估的稳健性和无偏性,还实施了K折交叉验证,详见补充表3
  6. 将数据集划分为K个子集。在K=5个子集上迭代训练和评估模型,同时使用剩余子集进行独立测试。

4. 模型的建立与实施

  1. 实施并精细调整随机森林(Random Forest, RF)和 K-最近邻(K-Nearest Neighbors, KNN)算法,以优化预测性能。使用 573 和 575 条蛋白质序列进行模型的训练、验证,使用 1,355 条蛋白质序列进行测试。
  2. 使用 Python 脚本 (补充代码文件 1) 基于选定的蛋白质序列提取数值特征值。将这两个数据集的数值保存为 CSV 文件,并提交至 RF 和 KNN 分类器以生成二分类模型。
  3. 利用这些模型区分发生三维结构域交换与未发生三维结构域交换的蛋白质。参见 图 2图 3 中用于预测三维结构域交换的通用框架。
  4. 为 RF 模型设置超参数:n_estimators=20,max_depth=4,random_state=42。
  5. 为 KNN 分类器模型设置超参数:neighbors=5。
    注意:这些参数设置经过精细调优,旨在提升模型在人工整理的药用植物数据集上的性能。

显示决策树、分类和KNN数据处理流程图的集成学习示意图。
图 2:示意图说明。 本图展示了随机森林(Random Forest)和K近邻(K-Nearest Neighbor, KNN)机器学习模型,呈现了它们在二分类任务背景下的算法结构与功能工作流程 请点击此处查看该图的放大版本。

数据处理工作流程图,包括数据集获取、特征提取和模型创建。
图3:基于机器学习的工作流程。该图展示了一种基于机器学习的流程,用于预测药用植物蛋白中的三维结构域交换。该过程始于数据集获取,整合基准数据集与元数据集。特征提取包括从蛋白质序列中推导已有特征和新特征。在数据集预处理阶段,通过序列解析和字典映射将FASTA序列转换为数值,以构建结构化数据框,其中包括特定的三维结构域交换特征。后处理步骤包括使用阈值(β = 0.5)分配结构域交换状态、将数据按70-30比例划分为训练集和测试集、特征标准化,以及通过k折交叉验证进行特征选择。训练了两种机器学习模型:随机森林(RF)和K近邻(KNN),并利用模型评估指标以及AUROC和AUPRC来评估其预测准确性与稳健性。请点击此处查看该图的放大版本。

5. 机器学习分类器的静态评估与模型评价

  1. 实施并精细调整随机森林(Random Forest, RF)和 K-最近邻(K-Nearest Neighbors, KNN)算法,以优化预测性能。使用 573 和 575 条蛋白质序列进行模型训练、验证,使用 1,355 条蛋白质序列进行测试。
    统计分析中的灵敏度公式 X_sen=TP/(TP+FN)。    (1)
    特异性公式 X_spe = TN/(TN+FP),用于统计分析的数学方程。    (2)
    MCC 公式,用于二元分类结果的统计分析。    (3)
    准确率(ACC)计算公式,用于研究中数据分析的数学方程。    (4)
    精确率公式 TP/(TP+FP),科学研究中的统计分析方法。    (5)
    F1 分数方程;2×精确率×召回率/(精确率+召回率);公式示意图;性能度量指标。    (6)
    注:将 TP(真正例)定义为模型正确预测为结构域交换的序列所占的百分比;将 TN(真负例)定义为模型正确预测为非结构域交换的序列所占的百分比;FP(假正例)指非结构域交换蛋白被错误预测为结构域交换的情况;FN(假负例)指结构域交换蛋白被错误预测为非结构域交换的情况。
  2. 计算 Xsen,即模型准确识别的真正例所占比例,以及 Xspe,即模型正确识别的真负例所占比例。
    注:使用 MCC(马修斯相关系数)通过分析混淆矩阵中的真正例、真负例、假正例和假负例来评估二元分类的质量。
  3. 计算准确率(Accuracy, ACC),以衡量总预测中正确预测所占的比例。
    注:精确率(Precision)评估在所有被预测为正例的样本中,实际为正例的比例;F1 分数则是精确率与灵敏度(召回率)的调和平均数,用于平衡假正例和假负例的影响。
  4. 使用 AUC(曲线下面积)评估分类模型在二元分类任务中的性能。基于被分类为正类和负类的蛋白质,利用 Scikit-learn Python 库40 计算 AUC(Area Under the Curve)。
  5. 使用测试数据评估上述各项参数。

6. 在多种药用植物物种中应用模型预测三维结构域交换

  1. 对13种不同药用植物的共计1,355条经审阅序列(预测数据集)应用RF和KNN方法,包括 柑橘(Citrus sinensis)、薄荷(Mentha)、葡萄(Vitis vinifera)、百里香(Thyme)、普通百里香(Thymus vulgaris)、茉莉(Jasmine)、木槿(Hibiscus)、罂粟(Papaver somniferum)、少蕊八角(Illicium oligandrum)、柠檬(Citrus limon)、菖蒲(Acorus calamus)、大麻(Cannabis sativa)、阿拉比卡咖啡(Coffea arabica).
    注意:这些蛋白质与多种功能相关,例如与甜橙(Citrus sinensis)、薄荷(Mentha)、百里香(thyme)有关,有助于缓解消化不良葡萄(Vitis vinifera)、茉莉、木槿 是抗氧化剂的极佳来源,同时也有助于改善皮肤健康. 八角茴香寡蕊 以其抗真菌和抗菌特性等而闻名。

7. 药用植物中正向预测的三维结构域交换蛋白的富集分析

  1. 利用 UniProt 的数据,将这些蛋白质序列的登录号映射到次级代谢产物类别。
  2. 从预测的序列中提取基因 ID。
  3. 打开 KEGG 在线服务器41(https://www.genome.jp/kegg/),通过粘贴单个基因 ID 或蛋白质名称来检查其对应的代谢通路,进行 KEGG 通路富集分析。
  4. 通过将预测的 3D 结构域交换蛋白与预测数据集进行对比,开展比较分析,以检测特定基因本体(GO)术语和生物通路在统计学上的显著富集。将预测序列的基因 ID 粘贴至 ShinyGO v0.742(https://bioinformatics.sdstate.edu/go74/),并选择所需的功能或通路类别(生物学过程、细胞组分、分子功能、KEGG 等)。
    注意:使用一个支持用户编写和执行 Python 代码的在线云平台43 可视化这些注释信息。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

表现出三维结构域交换的蛋白质常与多种生物学功能相关。然而,针对参与三维结构域交换的蛋白质序列进行系统性、全基因组范围的分析仍基本未被探索。本研究首次尝试从13种药用植物中预测潜在的三维结构域交换蛋白,并重点分析其与次生代谢物结构域、KEGG通路及基因本体(GO)术语的关联。通过对现有文献的综合分析及所应用机器学习模型的性能评估表明,相较于K-近邻算法(KNN),随机森林(RF)模型在预测三维结构域交换类别方面表现出更优的性能。 图4A,较高的AUC值表明AUROC分析性能优异;RF模型(AUC=-0.914)在区分3D-DS与3D-NDS类别方面表现出较强的判别能力。尽管KNN模型的AUC值(AUC=-0.883)略低于RF模型,但仍显示出良好的3D结构域交换分类能力& 三维非结构域交换。在 图4B,精确率-召回率曲线(AUPRC)显示,RF模型具有较高的精确率和召回率,表明其在减少假阳性(FP)病例方面效果显著。尽管KNN模型表现出完美的精确率,意味着其未产生任何假阳性结果,但其较低的召回率表明该模型遗漏了大...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

全面了解蛋白质在其完整基因组范围内的三维结构域交换现象在多个领域具有重要意义。机器学习方法,特别是随机森林和K近邻算法26,27,已被用于直接从基因组水平的蛋白质序列数据中预测三维结构域交换。这两种机器学习模型包含多个步骤,如数据集收集、特征选择、数据预处理与后处理、自定义模型脚本的实现以及模型评估。随机森林和K近邻模型的预测准确率分别为91.6%和88.7%。随后,这些预测模型被应用于13种药用植物的不同完整基因组。

据我们所知,这是首次利用机器学习技术在基因组尺度上对药用植物中的三维结构域交换现象进行全面研究。本研究选择KNN而非SVM,因为KNN更为简单,且在处理复杂非线性数据方面优于SVM。预测结果显示,在分析的序列中,有30.99%可能与三维结构域交换相关,凸显了这一结构现象在多种植物物种中的广泛存在。当前方法主要侧重于结构预测及其分子和功能多样性。RF和KNN仅能预测可能发生结构域交换的潜在案例,而无法预测完整的三维结构坐标,或确定具体参与该过程的残基区...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,他们不存在任何已知的可能影响本文所报告工作的竞争性经济利益或个人关系。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究未获得任何资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
3DSwap+https://caps.ncbs.res.in/3Dswapplus/index.html 
PfamEMBL-EBIhttp://pfam.xfam.org/: 
HMMEREMBL-EBIhttps://www.ebi.ac.uk/Tools/hmmer/:  
Aaindexhttps://www.genome.jp/aaindex/:
DIALBioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL: 
WEKA怀卡托大学https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
 KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

3D K KEGG
视频即将推出

相关文章