Methodenartikel

Machine learning-voorspelling van 3D-domeinuitwisselingseiwitten in medicinale planten

DOI:

10.3791/68519

15 augustus 2025

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie onderzoekt eiwitten die betrokken zijn bij of waarvan voorspeld wordt dat ze betrokken zijn bij 3D-domeinwisseling van verschillende genomen van medicinale planten. Het maakt gebruik van machine learning-modellen om 3D-domeinwisselende eiwitten nauwkeurig te voorspellen en te anticiperen op hun functies en relevantie voor de productie van secundaire metabolieten.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

3D-domeinwisseling is een structureel eiwitfenomeen waarbij twee of meer eiwitsubeenheden identieke structurele subeenheden uitwisselen en oligomeren vormen. Eiwitten die 3D-domeinwisseling vertonen, spelen een cruciale rol in verschillende biologische functies, zoals de biosynthese van secundaire metabolieten, en bij het omgaan met verschillende biotische en abiotische spanningen in medicinale planten. Deze studie onderzoekt het vermogen om 3D-domeinruilpatronen tussen het genoom van geneeskrachtige planten te voorspellen met behulp van willekeurige bos- en K-dichtstbijzijnde buurclassificatiemodellen, waarbij nauwkeurigheden van respectievelijk 91,6% en 88,7% worden aangetoond. In totaal werd voorspeld dat 420 (31%) van de sequenties vermoedelijk betrokken waren bij 3D-domeinuitwisseling. Er werd ook een verrijkingsonderzoek uitgevoerd naar de voorspelde 3D-domeinverwisselde eiwitsequenties van verschillende geneeskrachtige planten voor functieannotatie op basis van genontologie (GO)-termen, Kyoto Encyclopedia of Genes and Genomes (KEGG) -routeanalyse en hun domeindistributie in biosyntheseroutes van secundaire metabolieten. Functionele annotatie van voorspelde sequenties concludeert dat 3D-domein verwisselde sequenties betrokken waren bij diverse moleculaire functies, zoals fotosynthetisch elektronentransport in fotosysteem II en elektronentransporters, het overbrengen van elektronen binnen de cyclische elektronentransportroute van fotosynthese-activiteit, oxidatieve fosforylering en genregulatie van omgevingsstress (biotisch en abiotisch) door secundaire metabolieten (terpenoïden, alkaloïden en polyaminen). Deze bevindingen onderstrepen het vermogen van machine learning om de betrokkenheid van eiwitten bij het 3D-domeinwisselingsfenomeen, hun respectieve functie en hun potentieel om de ontdekking van geneesmiddelen en bio-engineeringinitiatieven te vergemakkelijken, te voorspellen.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Computationele methoden hebben een revolutie teweeggebracht in eiwitonderzoek door gedetailleerde analyse en voorspellingen over eiwitstructuren, functies en interacties mogelijk te maken. De nauwkeurige identificatie en annotatie van eiwitfuncties zijn essentieel voor het ontrafelen van moleculaire mechanismen van het leven en zijn van groot belang voor de vooruitgang in de geneeskunde en de ontwikkeling van geneesmiddelen. De inherente complexiteit en kosten van experimentele methoden beperken echter hun schaalbaarheid om de grote sequentiegegevens te accommoderen. Als gevolg hiervan is de ontwikkeling van computationele methoden voor het voorspellen van eiwitfuncties naar voren gekomen als een cruciaal gebied in de computationele en moleculaire biologie, waarbij deze kloof wordt aangepakt door middel van innovatieve grootschalige benaderingen1.

3D domain swapping2 is een structureel fenomeen in eiwitten waarbij segmenten van een gedeelde structuur worden uitgewisseld tussen individuele ketens. In 1994 werd de inleidende documentatie over het mechanisme van 3D-domeinwisseling gevonden in het difterietoxinedimeer3. De basisprincipes van 3D-domeinwisseling gaan echter vier decennia terug. Er is waargenomen dat runderpancreasribonuclease A (RNase A) dimeren vormt tijdens vriesdrogen in azijnzuur, door middel van geavanceerde chemische modificatie-experimenten4. Bij eiwitoligomerisatie wisselen twee of meer eiwitketens identieke structurele elementen uit via flexibele scharniergebieden. Het deel van het eiwit dat wordt uitgewisseld tussen monomere subeenheden wordt het verwisselde domein genoemd, dat kan bestaan uit een heel bolvormig domein, een lus of een secundair structureel element in bepaalde eiwitten. Omgekeerd worden de regio's die onveranderd blijven op hun oorspronkelijke posities binnen de monomeren niet-geruilde domeinen genoemd5. Een koppeling tussen niet-geswapte domeinen wordt gedefinieerd als een niet-geswapte domeininterface (NSDI) die wordt weergegeven in figuur 1. Bij 3D-domeinruil wordt de relatie tussen het niet-geruilde domein van de ene eiwitsubeenheid en het reeds geruilde domein van een andere subeenheid de geswapte domeininterface (SDI) genoemd. Een ander belangrijk aspect van dit fenomeen is het scharniergebied, een flexibel linkersegment dat de niet-geswapte en geswapte domeinen met elkaar verbindt. Dit scharniergebied speelt een essentiële functie bij het helpen bij het verplaatsen van 3D-domeinwisseling en dient als een conformationele schakelaar, waardoor de structurele herconfiguratie mogelijk wordt die nodig is om domeinwisseling te laten plaatsvinden. 3D-domeinwisseling is betrokken bij verschillende biologische processen, waaronder eiwitassemblage en functionele regulatie5. Het wordt ook in verband gebracht met bepaalde ziekten met betrekking tot het verkeerd vouwen van eiwitten, waarbij afwijkende verwisseling kan leiden tot de vorming van aggregaten of amyloïde fibrillen.

figure-introduction-1
Figuur 1: Structurele weergave van 3D domain-swapping. De weergave illustreert de uitwisseling van identieke structurele elementen tussen twee eiwitmonomeren via een flexibel scharniergebied, wat resulteert in de vorming van een domeinverwisselde dimeer of oligomere assemblage Klik hier om een grotere versie van deze figuur te bekijken.

Er zijn verschillende soorten 3D-domeinwisseling geïdentificeerd op basis van de aard van de geruilde domeinen en de resulterende oligomere structuren6. In het jaar 2002 identificeerden Eisenberg en hun collega drie soorten 3D-domeinuitwisseling: bonafide domain swapping (BDS), quasi-domain swapping (QDS) en kandidaat voor 3D-domain swapping (CDS)7. De meest voorkomende eiwitklasse is bonafide domeinruil. Het verwijst naar een toestand waarin zowel dimeer- als monomeermoleculen in een stabiele vorm aanwezig zijn, waarbij het dimeer verondersteld wordt een domeinverwisselde configuratie aan te nemen, terwijl het monomeer verondersteld wordt een gesloten configuratie aan te nemen. Bij quasi-domeinwisseling is bekend dat een eiwit aanwezig is in de oligomere toestand, maar het is bekend dat de homologe structuur aanwezig is in de monomere toestand. In CDS bevestigt het alleen de eiwitclassificatie onder de domeinverwisselde categorieën, terwijl structurele informatie over betrokken monomeren of hun monomere homologen niet aanwezig is8. In deze procedure zijn monomeren of hun monomere homologen afwezig; er zijn eerder heterologe eiwitmoleculen aanwezig. Tabel 1 geeft een voorbeeld van deze drie categorieën9.

Tabel 1: Soorten 3D-domeinwisseling met voorbeeld. Klik hier om deze tabel te downloaden.

Latere studies brachten tal van domein-swapped structuren aan het licht, wat de weg vrijmaakte voor het begrip van het 3D-domein swapping-concept. Het vroegste structurele bewijs dat dit fenomeen ondersteunt, werd waargenomen in het molecuul van het Cro-repressoreiwit van bacteriofaag λ, dat een dimeerstructuur vormt door de uitwisseling van zijn C-terminale strengen. In 1996 ontdekte de onderzoeker dat het monomere Cro-molecuul betrokken was bij 3D-domeinruil10. Andere structuur11, zoals βB2-kristalline12, humaan CksHs213, runderlevercatalase14 en recombinant humaan interleukine-515, werden ook gerapporteerd als mogelijke 3D-domeinverwisselde structuren. Op basis van de geswapte domeinpositie binnen de eiwitmoleculen wordt 3D-domeinswapping gecategoriseerd in drie typen: C-terminale domeinswapping, N-terminale domeinswapping en de relatief zeldzame centrale domeinswapping. Auteurs gebruiken een compleet menselijk genoom om een domein-verwisseld geval te voorspellen. Ze gebruiken Random Forest en Support Vector Machine als binaire classifiers met een nauwkeurigheid van respectievelijk 81,7% en 73,9%. Bijna 44% van de eiwitsequentie werd voorspeld als 3D-domeinverwisseld in het menselijk genoom6. Verrijkingsanalyse werd uitgevoerd op voorspelde gevallen voor hun domeindistributie, ziektedistributie en functionele annotatie op basis van genontologie (GO). Een andere benadering onderzoekt de volledige genoombrede analyse van Ocimum tenuiforum met behulp van de Random Forest-benadering en ontdekte dat bijna 25% van de eiwitsequenties in Ocimum tenuiforum naar verwachting betrokken zijn bij de 3D-domeinwisseling. Onderzoekers voeren ook functionele annotatie uit door gebruik te maken van GO-termassociatie en hun eiwitdomeinfamilieassociatie en ontdekten dat slechts 1158 sequenties betrokken waren bij abiotische stress16.

Planten vertonen een verscheidenheid aan onderscheidende eiwitfamilies, met specifieke eiwitten waarvan wordt erkend dat ze het vermogen hebben om structurele herschikkingen te ondergaan, waaronder 3D-domeinwisseling. 3D-domeinwisseling kan biotische en abiotische stresscondities beïnvloeden met de productie van secundaire metabolieten of andere biologisch relevante routes die verschillende farmacologische toepassingen hebben; Daarom bieden ze een belangrijk aandachtspunt voor dit onderzoek. De kristalstructuur van Wal1 vertoonde een domeinverwisselde dimeerconfiguratie, met twee dimeren binnen de asymmetrische eenheid en de structurele herschikking in cystatine C. Fytocystatines spelen een belangrijke rol bij abiotische stress en verbeteren ook de resistentie van gewassen. In totaal zijn 20.121 3D-domeinverwisselde voorspelde eiwitten geïdentificeerd uit beschikbare literatuur en uit verschillende relevante repositories, waarvan 17.552 van plantaardige oorsprong zijn en 2569 van niet-plantaardige organismen17,18.

In de literatuur zijn verschillende andere voorbeelden gerapporteerd van 3D-domeinwisseling die verschillende planten voorspelt met behulp van een machine learning-benadering. Zoals Arabidopsis thaliana met 33,7% (4058 van de 12.033 beoordeelde sequenties), Medicago truncatula 20,9% (39 van de 186 beoordeelde sequenties), Solanum tuberosum 36,5% (146 van de 400 beoordeelde sequenties), Solanum lycopersicum 25,5% (108 van de 423 beoordeelde sequenties) en Ocimum tenuiforum 15,5% (5706 van de 36841 beoordeelde sequenties)6. Computationele methoden zijn van onschatbare waarde geworden bij het onderzoeken van de structurele en functionele aspecten van 3D-domeinverwisselde eiwitten. Deze benaderingen vergemakkelijken de voorspelling van sequenties op basis van de best mogelijke eigenschappen19, annotatie en verrijkingsanalyse, en bieden inzicht in de fundamentele moleculaire mechanismen. De voorspelling van 3D-domeinwisseling in verschillende eiwitsequenties werd bereikt met behulp van een op een ondersteunende vectormachine (SVM) gebaseerde classifier. Deze benadering is ontwikkeld door sequentie- en structurele kenmerken te integreren, wat een voorspellingsnauwkeurigheid opleverde van 76,33% op de trainingsdataset en 73,81% op de testdataset, wat het potentieel aangeeft bij het identificeren van neigingen tot domeinwisseling in eiwitten20. De belangrijkste reden om voor KNN te kiezen in plaats van SVM is dat KNN een veel eenvoudiger trainingsproces heeft. Het heeft slechts één hoofdparameter nodig, K (het is het aantal naaste buren waarmee rekening wordt gehouden bij het maken van een voorspelling), om te worden ingesteld, terwijl SVM een zorgvuldige afstemming van verschillende parameters vereist, zoals het kerneltype, C en gamma. Bovendien kan KNN gemakkelijker omgaan met classificatie met meerdere klassen, terwijl SVM meestal complexere strategieën nodig heeft, zoals één-tegen-één-strategieën.

Machine learning voor structurele voorspelling van eiwitten
De voorspelling van de eiwitstructuur omvat de afleiding van de driedimensionale vorm van een eiwit uit de FASTA-sequentie. Recente ontwikkelingen op dit gebied zijn aanzienlijk te danken aan de toepassing van verschillende machine learning-technieken op evolutionaire gegevens 21,22. Vroege benaderingen voor het extraheren van informatie uit co-evolutionaire gegevens waren gebaseerd op machine learning-methoden. Recentere strategieën, met name die welke gebruikmaken van diepe restnetwerken, hebben echter superieure prestaties laten zien bij het voorspellen van potentieel doel23. Alphafold is een op deep learning gebaseerde database, terwijl Rosetta een op fysica gebaseerde energiefunctietool is. Deze tools worden gebruikt om de volledige 3D-atomaire structuur te voorspellen die kan worden benaderd tot experimentele structuren. Ze bieden alleen structurele coördinaten met atomaire resolutie, maar deze tools specificeren niet de 3D-domeinwisselgebeurtenissen. Daarentegen is de voorgestelde aanpak geen volledige 3D-structuurvoorspeller, maar voorspelt het alleen of een eiwit waarschijnlijk 3D-domeinverwisseling zal ondergaan of niet24,25.

Geneeskrachtige planten worden al eeuwenlang gebruikt als natuurlijke hulpbronnen voor de preventie en behandeling van verschillende ziekten, toegeschreven aan hun bioactieve stoffen. Ze zijn essentieel in de traditionele geneeskunde en dragen bij aan de ontwikkeling van moderne farmaceutische medicijnen. Er is echter geen significant werk verricht op het gebied van eiwitdomeinuitwisseling van medicinale planten voor het ontdekken van geneesmiddelen. Algoritmen, waaronder machine learning en hun ensemblemodellen, herkennen patronen en relaties in sequentiegegevens om 3D-domeinwisseling te voorspellen. De reden achter het kiezen van de medicinale planten voor deze studie is dat het functionele diversiteit van een eiwit kan detecteren in planten die betrokken zijn bij 3D-domeinwisseling, wat resulteert in het begrip van stressrespons, afweer tegen ziekteverwekkers en metabole biosynthese. De technische uitdagingen die gepaard gaan met het bepalen van 3D-domeinwisseling van eiwitten in grote aantallen en complexe, geavanceerde oligomere conformaties door gebruik te maken van NMR- of kristallografietechnieken benadrukken de noodzaak van het ontwikkelen van geavanceerde computationele benaderingen.

Het algemene doel van het voorgestelde onderzoekswerk is om een computationele methodologie toe te passen door gebruik te maken van Random Forest (RF)26 en K-nearest neighbor (KNN)27-algoritmen voor hun voorspellingstaak voor de eiwitsequentiestructuur en volledige genoombrede analyse van verwisselde gevallen in verschillende sequenties van medicinale planten. Het Random Forest (RF) is een binaire classificatie; Het is een robuust en veelzijdig machine learning-algoritme dat veel wordt gebruikt bij de analyse van eiwitsequenties. Het werkt door een ensemble van beslissingsbomen (DT) te construeren en bereikt een vrij hoge nauwkeurigheid in zowel de trainings- als de testdatasets. Voor eiwitsequentietaken kan RF een verscheidenheid aan kenmerken analyseren, waaronder fysisch-chemische eigenschappen, sequentiesamenstelling, secundaire structuur en evolutionaire informatie afgeleid van sequentie-uitlijningen of -profielen. Het blinkt uit in het verwerken van grote, luidruchtige datasets en biedt statistieken over het belang van functies28. De K-Nearest Neighbors (KNN) classifier is een eenvoudig maar effectief machine learning-algoritme dat veel wordt toegepast in de analyse van eiwitsequenties. Het werkt door een invoersequentie te classificeren op basis van de meerderheidsklasse van de k naaste buren in de functieruimte. Bij de analyse van eiwitsequenties kan KNN worden gebruikt om functionele categorieën, structurele eigenschappen en subcellulaire lokalisatie te voorspellen. Kenmerken voor KNN-classificatie omvatten vaak aminozuursamenstelling, sequentiemotieven, evolutionaire profielen of fysisch-chemische eigenschappen. KNN is een populaire keuze voor eiwitanalyse vanwege zijn eenvoud; Interpreteerbaarheid en effectiviteit maken het een waardevol hulpmiddel voor eiwitsequentieanalyse29. Samen bieden deze algoritmen complementaire sterke punten, waardoor een uitgebreid computationeel raamwerk mogelijk is voor de studie van 3D-domeinwisseling in verschillende sequenties van medicinale planten. Deze twee modellen voorspellen alleen mogelijke gevallen die domeinwisseling kunnen ondergaan; het voorspelt niet de volledige 3D-structurele coördinaten of welk deel of residu in het bijzonder betrokken is bij dit verwisselingsproces. Dit is een kwestie van verder onderzoek, aangezien het identificeren van specifieke regio's of residuen die betrokken zijn bij swapping om het mechanisme en de functionele aspecten van 3D-domein-swapping te verduidelijken events.3D domain-swapping een verscheidenheid aan structureel verschillende fenomenen omvat, zoals closed-loop configuraties, open-ended swaps en andere verschillen die verschillende scharnierregio's en domeinarchitecturen omvatten. In het licht hiervan categoriseert de voorgestelde aanpak alleen alle soorten 3D-domeinwisselingen onder een uniforme classificatie. Deze selectie werd in eerste instantie gedreven door de beperkte beschikbaarheid van geannoteerde gegevens die een bepaalde klasse van 3D-domeinwisseling kunnen specificeren. Dit is de eerste soort pogingen om verschillende datasets op basis van medicinale planten te gebruiken, en we zijn van mening dat het onderscheiden van verschillende verwisselmechanismen de voorspellende nauwkeurigheid van het model zou kunnen verbeteren.

Een verrijkingsanalyse in de geneeskrachtige planten helpt bij het identificeren van belangrijke genen, eiwitten en routes die betrokken zijn bij de synthese van bioactieve stoffen en stressrespons. Het geeft inzicht in moleculaire mechanismen. Deze analyses in medicinale planten onderzoeken essentiële genen, eiwitten en biologische processen die verband houden met de synthese van bioactieve chemicaliën, stressbestendigheid en ziekteresistentie. Functionele annotatie van geselecteerde eiwitten, zoals genontologie (GO) en KEGG-routeanalyse, legt moleculaire mechanismen bloot die ten grondslag liggen aan de productie van secundaire metabolieten en stressreacties in de omgeving. Deze benadering helpt aanzienlijk bij het ontdekken van geneesmiddelen, verbetert de veerkracht van gewassen en verheldert de metabole routes van planten voor duurzame landbouw en medicinale vooruitgang.

Nieuwe bijdragen van de studie
Deze studie belicht de mogelijkheden van machine learning om preciezere en efficiëntere modellen te bevorderen om structurele eiwitpatronen in biologische datasets te voorspellen.

Dit onderzoek integreert nieuwe functies in machine learning-algoritmen, waardoor hun vermogen om eiwitfuncties met meer duidelijkheid te voorspellen wordt verbeterd. Dergelijke kenmerken zorgen voor een beter begrip van de structuur-functierelaties van eiwitten, wat helpt bij een nauwkeuriger eiwitontwerp en optimalisatie in eiwitengineering.

Verrijkingsanalyse van voorspelde eiwitten helpt bij het achterhalen van de belangrijkste biologische routes, cellulaire processen en moleculaire functies die waardevolle doelen bieden voor het ontdekken van biomarkers, het ontwerpen van geneesmiddelen en het begrijpen van ziektemechanismen. Deze analyse verbetert de precisie in pathways-gebaseerde interventies en therapeutische doelidentificaties.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

OPMERKING: Dit segment geeft een uitgebreid overzicht van de voorgestelde methodologie, die zes primaire stappen omvat: (a) gegevensverzameling, (b) functieselectie, (c) voorverwerking van gegevens, (d) nabewerking van gegevens, (e) modelontwikkeling, (f) resultaatevaluatie van het voorgestelde model en, (g) verrijkingsanalyse op verschillende niveaus van positief voorspelde sequenties. De Core i5-10500 is een processor van de 10e generatie die in dit onderzoek is gebruikt. Het heeft zes cores en 12 threads, met een basisfrequentie van 3,10 GHz en een maximale turbosnelheid van 4,50 GHz. Het is uitgerust met 12 MB Intel Smart Cache, ondersteunt DDR4-2666-geheugen en bevat UHD Graphics 630 voor geïntegreerde beelden. Hij is gebouwd voor efficiënte multitasking en productiviteit, is compatibel met de LGA 1200-socket en werkt met een TDP van 65 W.

1. Gegevensverzameling

  1. Use3d3dswap-pred (https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) en 3DSwap+ (https://caps.ncbs.res.in/3Dswapplus/index.html)3030 Aanvullende Tabel 1, Aanvullende Tabel 2, Aanvullend Bestand 1, Aanvullend Bestand 2). Gebruik in totaal 573 handmatig samengestelde PDB-vermeldingen van 3D-domeinverwisselde moleculen, voornamelijk van medicinale planten.
  2. Gebruik de Best Representative Profile (BRP)-methode om de negatieve dataset samen te stellen door een Best Representative Sequence (BRS) toe te wijzen aan elke Pfam31-eiwitfamilie (http://pfam.xfam.org/). Zoek in totaal 10.112 structurele sequenties tegen alle Pfam BRP's met behulp van HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/) met een E-waardedrempel van 0,001. Verwerk de resulterende sequentie met behulp van DIAL om structurele domeinen(https://bioinformaticshome.com/db/tool/DIAL) te identificeren. Neem 575 PDB-vermeldingen op als een negatieve dataset (training).
  3. Neem 314 eiwitsequenties op die zijn afgeleid via de BRP-methode en 261 handmatig samengestelde niet-3D-domeinverwisselde sequenties die door 3DSwap+ zijn geïdentificeerd als een negatieve dataset.
  4. Haal in totaal 1.355 beoordeelde eiwitsequentie-items op van verschillende geneeskrachtige planten uit UniProt33 (https://www.uniprot.org/). Neem 13 geneeskrachtige planten op in deze studie (test-/voorspellingsdataset): Citrus sinensis (RS-102), Vitis vinifera (RS-226), Mentha (RS-28), Cannabis sativa (RS-21), Acorus clamus (RS-511), Coffea arabica (RS-104), Papaver somniferum (RS-58), Hibiscus (RS-88), Jasmijn (RS-89), Tijm (RS-30), Thymus (RS-14), Illicium oligandrum (RS-72) en Citrus limon (RS-12). De fylogenetische boom wordt gegeven in aanvullende figuur 1.

2. De functie gebruiken voor het maken van modellen

  1. Gebruik een uitgebreide functieset bestaande uit 453 functies voor het voorspellen van eiwitsequenties in medicinale planten. Neem 439 gevestigde kenmerken en 16 nieuwe kenmerken op, zorgvuldig geselecteerd op basis van een grondig literatuuronderzoek.
  2. Gebruik de AAindex-database34(https://www.genome.jp/aaindex/) om de fysisch-chemische eigenschappen van aminozuren te bepalen. Pas het machine learning-platform (https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/) van WEKA35 toe voor functieselectie. Raadpleeg Tabel 2 voor de nieuw opgenomen functies.

Tabel 2: Lijst van nieuw toegevoegde functies samen met hun beschrijvingen. Deze tabel geeft een overzicht van de nieuwe functies die tijdens de functie-extractiefase zijn ontwikkeld om de modelprestaties bij het voorspellen van 3D-domeinwisseling te verbeteren. Elke functie legt specifieke op sequentie gebaseerde, fysisch-chemische of structurele eigenschappen van de eiwitten vast waarvan wordt verondersteld dat ze hun neiging tot domeinwisseling beïnvloeden. Gedetailleerde beschrijvingen worden gegeven om de biologische relevantie en computationele afleiding van elk kenmerk te verduidelijken. Klik hier om deze tabel te downloaden.

3. Voor- en naverwerking van gegevens

OPMERKING: Voorverwerking van gegevens. Voorverwerking van gegevens is een essentiële stap in machine learning, waarbij onbewerkte gegevens worden voorbereid voor analyse. Dit omvat het opschonen van de gegevens (bijv. het verwijderen van duplicaten, het omgaan met ontbrekende waarden, enz.).

  1. Gebruik Aanvullend coderingsbestand 1 voor het coderen van categorische variabelen in numerieke vorm, dat vier hoofdstappen omvat: (1) Definieer scoredicts, (2) verwerk fasta-reeks door seq I0. parseren, (3) gegevensframe maken, (4) numerieke analyse van 3D-domeinverwisselde functies.
  2. Verfijn en interpreteer de output van het model door middel van nabewerking van gegevens. Kalibreer voorspellingen opnieuw, voeg resultaten samen en pas een drempel voor classificatie toe. Classificeer de bimodale 3D-domeinverwisselingsdataset met behulp van een drempelwaarde β = 0,5 (bereik 0-1), zoals ondersteund door eerdere studies 36,37,38.
  3. Partitioneer de dataset met een 70:30 train-test-split, waarbij 70% wordt toegewezen voor modeltraining en 30% voor onafhankelijke evaluatie.
  4. Standaardiseer de trainingsgegevens met behulp van de Standard Scaler-methode om functiewaarden aan te passen aan een gemiddelde van 0 en een standaarddeviatie van 1, wat zorgt voor een betere compatibiliteit met machine learning-schatters. Voer functieselectie uit om de variabelen met de meeste impact te identificeren.
    OPMERKING: Het standaardiseren van een dataset is een veelgebruikte voorwaarde voor veel machine learning-algoritmen om optimale prestaties te garanderen. Gegevens die verre van normaal zijn verspreid, kunnen de prestaties van machine learning-modellen negatief beïnvloeden39.
  5. Doe validatie. Om een robuuste en onbevooroordeelde modelevaluatie te garanderen, werd ook K-fold-kruisvalidatie geïmplementeerd Aanvullende Tabel 3.
  6. Partitioneer de gegevensset in K-subsets. Train en evalueer het model iteratief op K=5-subsets terwijl de resterende subset wordt gebruikt voor onafhankelijke tests.

4. Creatie en implementatie van het model

  1. Implementeer en verfijn Random Forest (RF) en K-Nearest Neighbors (KNN) algoritmen om voorspellende prestaties te optimaliseren. Train, valideer en test de modellen met behulp van 573 en 575 eiwitsequenties voor training en 1.355 eiwitsequenties om te testen.
  2. Gebruik een Python-script (aanvullend coderingsbestand 1) om numerieke kenmerkwaarden te extraheren op basis van de geselecteerde eiwitsequentie. Sla deze numerieke waarden voor beide datasets op in CSV-bestanden en verzend ze naar de RF- en KNN-classificaties voor het genereren van binaire classificatiemodellen.
  3. Gebruik deze modellen om onderscheid te maken tussen 3D-domein-geruilde en niet-3D-domein-geruilde eiwitten. Zie Figuur 2 en Figuur 3 voor het algemene raamwerk voor het voorspellen van 3D-domeinwisseling.
  4. Pas hyperparameters toe, zoals n_estimators=20, max_depth=4 en random_state=42 voor het RF-model.
  5. Pas de hyperparameter neighbors=5 toe voor het KNN-classificatiemodel.
    OPMERKING: Deze parameterinstellingen zijn verfijnd om de prestaties van de modellen op de handmatig samengestelde dataset voor medicinale planten te verbeteren.

figure-protocol-1
Figuur 2: Illustratieve schematische weergave. De weergave toont de Random Forest en K-Nearest Neighbor (KNN) machine learning-modellen, waarbij hun algoritmische structuur en functionele workflow worden getoond in de context van binaire classificatietaken Klik hier om een grotere versie van deze figuur te bekijken.

figure-protocol-2
Afbeelding 3: Op machine learning gebaseerde workflow. Het diagram illustreert een op machine learning gebaseerde workflow voor het voorspellen van 3D-domeinwisseling in medicinale plantaardige eiwitten. Het proces begint met het verwerven van datasets, waarbij de benchmark- en metadatasets worden gecombineerd. Functie-extractie omvat het afleiden van zowel bestaande als nieuwe kenmerken uit eiwitsequenties. In de voorverwerking van gegevenssets worden FASTA-sequenties geconverteerd naar numerieke waarden met behulp van sequentieparsing en woordenboektoewijzing om gestructureerde dataframes te maken, inclusief specifieke 3D-domeinwisselfuncties. Nabewerking omvat het toewijzen van de status van domeinwissel met behulp van een drempel (β = 0,5), het opsplitsen van gegevens in trainings- en testsets (verhouding 70-30), het standaardiseren van functies en het uitvoeren van functieselectie met k-fold-validatie. Twee machine learning-modellen, Random Forest (RF) en K-Nearest Neighbors (KNN), worden getraind en hun prestaties worden geëvalueerd met behulp van modelmetrieken samen met AUROC en AUPRC om voorspellende nauwkeurigheid en robuustheid te beoordelen Klik hier om een grotere versie van deze figuur te bekijken.

5. Statische beoordeling en modelevaluaties van ML-classificaties

  1. Implementeer en verfijn Random Forest (RF) en K-Nearest Neighbors (KNN) algoritmen om voorspellende prestaties te optimaliseren. Train, valideer en test de modellen met behulp van 573 en 575 eiwitsequenties voor training en 1.355 eiwitsequenties om te testen.
    figure-protocol-3(1)
    figure-protocol-4(2)
    figure-protocol-5(3)
    figure-protocol-6(4)
    figure-protocol-7(5)
    figure-protocol-8(6)
    OPMERKING: Definieer TP (True Positive) als het percentage sequenties dat correct is voorspeld als domeinverwisseld door de modellen. Definieer TN (True Negative) als het percentage sequenties dat correct is voorspeld als niet-domein-geruild. Definieer False Positive (FP) als de gevallen waarin niet-domeinverwisselde eiwitten ten onrechte worden voorspeld als domeinverwisseld. Definieer vals-negatief (FN) als de gevallen waarin domeinverwisselde eiwitten ten onrechte worden voorspeld als niet-domeinverwisseld.
  2. Bereken Xsen als de verhouding van de werkelijk positieve punten die nauwkeurig zijn geïdentificeerd, en Xspe als de verhouding van de werkelijke negatieven die correct door het model zijn geïdentificeerd.
    OPMERKING: Gebruik MCC om de kwaliteit van binaire classificaties te evalueren door echte positieven, echte negatieven, fout-positieven en fout-negatieven uit de verwarringsmatrix te analyseren.
  3. Bereken de nauwkeurigheid (ACC) om het aandeel correcte voorspellingen in het totale aantal voorspellingen te meten.
    OPMERKING: Precisie evalueert een deel van de correct geïdentificeerde positieven van alle voorspelde positieven, terwijl de F1-score het harmonische gemiddelde is van precisie en gevoeligheid, waarbij valse positieven en valse negatieven in evenwicht zijn.
  4. Gebruik AUC om de prestaties van classificatiemodellen in binaire classificatietaken te evalueren. Bereken AUC (Area Under the Curve) met behulp van de Scikit-learn Python library40, gebaseerd op positief en negatief geclassificeerde eiwitten.
  5. Gebruik de testgegevens om deze parameters te evalueren.

6. Implementatie van een model voor de voorspelling van 3D-domeinwisseling op verschillende geneeskrachtige plantensoorten

  1. Pas RF en KNN toe op in totaal 1.355 beoordeelde sequenties (voorspellingsdataset) van 13 verschillende geneeskrachtige planten, waaronder Citrus sinensis, Mentha, Vitis vinifera, Tijm, Thymus vulgaris, Jasmijn, Hibiscus, Papaver somniferum, Illicium oligandrum, Citrus limon, Acorus calamus, Cannabis sativa en Coffea arabica.
    OPMERKING: Deze eiwitten worden geassocieerd met verschillende functies, zoals Citrus sinensis, Mentha, tijm helpt bij indigestie. Vitis vinifera, Jasmijn, Hibiscus is een zeer rijke bron van antioxidanten en ze verbeteren ook de gezondheid van de huid. Illicium oligandrum staat bekend om zijn schimmelwerende en antibacteriële eigenschappen enz.

7. Verrijkingsonderzoek naar positief voorspelde 3D domein geswapte eiwitten van medicinale plant

  1. Breng de toetredingscodes van deze eiwitsequenties in kaart met secundaire metabolietcategorieën met behulp van gegevens van UniProt.
  2. Extraheer gen-ID uit voorspelde sequenties.
  3. Open KEGG online webserver41 (https://www.genome.jp/kegg/) om KEGG-routeverrijkingsanalyse uit te voeren door de individuele gen-ID of eiwitnaam te plakken om hun respectievelijke routes te controleren.
  4. Voer een vergelijkende analyse uit door de voorspelde 3D-domeinruileiwitten te vergelijken met een voorspellingsdataset om statistisch significante oververtegenwoordiging van specifieke genontologietermen (GO) en biologische routes te detecteren. Plak de gen-ID van de voorspelde sequentie in ShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/) en selecteer de gewenste functie- of routecategorie (biologische functie, cellulaire component, moleculaire functie, KEGG, enz.).
    OPMERKING: Visualiseer deze annotaties met behulp van een online cloudgebaseerd platform43 waarmee gebruikers Python-code kunnen schrijven en uitvoeren.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Eiwitten die 3D-domeinwisseling vertonen, zijn vaak gekoppeld aan een verscheidenheid aan biologische functies. Een systematische, genoombrede analyse van eiwitsequenties die betrokken waren bij 3D-domeinwisseling blijft echter grotendeels onontgonnen. In dit onderzoek hebben we een eerste onderzoek uitgevoerd om 3D-domeinverwisselde eiwitten van 13 medicinale planten vermoedelijk te voorspellen, met de nadruk op hun associatie met secundaire metabolietdomeinen, KEGG-routes en genontolog...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het begrip van 3D-domeinwisseling in eiwitten over hun hele genoom is op verschillende gebieden van groot belang. Machine learning-benaderingen, met name willekeurig bos en K-naaste buur26,27, zijn gebruikt om 3D-domeinwisseling rechtstreeks te voorspellen op basis van eiwitsequentiegegevens op genoomniveau. Deze twee ML-modellen omvatten verschillende stappen, zoals het verzamelen van gegevenssets, functieselectie, gegevensvoor-...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat ze geen concurrerende financiële belangen of persoonlijke relaties hebben die van invloed zouden kunnen zijn geweest op het werk dat in dit artikel wordt gerapporteerd.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Voor dit onderzoek is geen financiering ontvangen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
3DSwap+https://caps.ncbs.res.in/3Dswapplus/index.html 
PfamEMBL-EBIhttp://pfam.xfam.org/: 
HMMEREMBL-EBIhttps://www.ebi.ac.uk/Tools/hmmer/:  
Aaindexhttps://www.genome.jp/aaindex/:
DIALBioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL: 
WEKAThe University of Wekatohttps://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
 KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

3D domeinwisselingprote ne oligomerisatieRandom ForestK Nearest Neighborfunctionele annotatiebiosynthese van secundaire metabolietenGene OntologyKEGG paden
Video binnenkort beschikbaar

Gerelateerde artikelen