Artykuł metodologiczny

Przewidywanie przez uczenie maszynowe białek 3D z zamianą domen w roślinach leczniczych

DOI:

10.3791/68519

15 sierpnia 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie bada białka biorące udział lub przewidywane jako zaangażowane w 3D zamianę domen z różnych genomów roślin leczniczych. Wykorzystuje modele uczenia maszynowego do dokładnego przewidywania białek 3D zamieniających domeny oraz przewidywania ich funkcji i znaczenia dla produkcji metabolitów wtórnych.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

3D zamiana domen to zjawisko strukturalne białka, w którym dwie lub więcej podjednostek białkowych wymienia identyczne podjednostki strukturalne i tworzy oligomery. Białka, które wykazują zamianę domen 3D, odgrywają kluczową rolę w różnych funkcjach biologicznych, takich jak biosynteza metabolitów wtórnych oraz w radzeniu sobie z kilkoma stresami biotycznymi i abiotycznymi w roślinach leczniczych. W tym badaniu zbadano zdolność do przewidywania wzorców zamiany domen 3D między genomami roślin leczniczych przy użyciu modeli losowych lasów i klasyfikatorów K-najbliższego sąsiada, wykazując dokładność odpowiednio 91,6% i 88,7%. W sumie przewidywano, że 420 (31%) sekwencji będzie przypuszczalnie zaangażowanych w zamianę domen 3D. Przeprowadzono również badania wzbogacające przewidywane sekwencje białek 3D z zamianą domen z różnych roślin leczniczych do adnotacji funkcji w oparciu o terminy Gene Ontology (GO), analizę szlaków Kyoto Encyclopedia of Genes and Genomes (KEGG) oraz ich rozkład domen w szlakach biosyntezy metabolitów wtórnych. Funkcjonalna adnotacja przewidywanych sekwencji sugeruje, że sekwencje zamienione domeną 3D były zaangażowane w różne funkcje molekularne, takie jak fotosyntetyczny transport elektronów w fotosystemie II i transportery elektronów, przenoszenie elektronów w ramach cyklicznego szlaku transportu elektronów aktywności fotosyntezy, fosforylacja oksydacyjna i regulacja genów stresów środowiskowych (biotycznych i abiotycznych) poprzez syntezę metabolitów wtórnych (terpenoidów, alkaloidy i poliaminy). Odkrycia te podkreślają zdolność uczenia maszynowego do przewidywania udziału białek w zjawisku zamiany domen 3D, ich odpowiednich funkcji oraz potencjału w zakresie ułatwiania odkrywania leków i inicjatyw bioinżynieryjnych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Metody obliczeniowe zrewolucjonizowały badania białek, umożliwiając szczegółową analizę i przewidywania dotyczące struktur, funkcji i interakcji białek. Precyzyjna identyfikacja i adnotacja funkcji białek są niezbędne do rozwikłania molekularnych mechanizmów życia i mają ogromne znaczenie dla postępów w medycynie i opracowywaniu leków. Jednak nieodłączna złożoność i koszty metod eksperymentalnych ograniczają ich skalowalność w celu dostosowania się do dużych danych sekwencyjnych. W rezultacie, rozwój metod obliczeniowych do przewidywania funkcji białek stał się kluczowym obszarem biologii obliczeniowej i molekularnej, wypełniając tę lukę za pomocą innowacyjnych podejść na dużą skalę1.

3D domain swapping2 to zjawisko strukturalne w białkach, w którym segmenty wspólnej struktury są wymieniane między poszczególnymi łańcuchami. W 1994 roku odnaleziono dokumentację wprowadzającą do mechanizmu zamiany domen 3D w tomorze błoniczym dimer3. Jednak podstawowe zasady zamiany domen 3D można prześledzić wstecz cztery dekady. Zaobserwowano, że bydlęca rybonukleaza trzustkowa A (RNaza A) tworzy dimery podczas liofilizacji w kwasie octowym, dzięki zaawansowanym eksperymentom modyfikacji chemicznej4. W oligomeryzacji białek dwa lub więcej łańcuchów białkowych wymienia identyczne elementy strukturalne za pośrednictwem elastycznych regionów zawiasowych. Część białka wymieniana między podjednostkami monomerycznymi jest określana jako zamieniona domena, która może składać się z całej domeny globularnej, pętli lub drugorzędowego elementu strukturalnego w niektórych białkach. I odwrotnie, regiony, które pozostają niezmienione w swoich pierwotnych pozycjach w monomerach, są określane jako domeny niezamienione5. Sprzężenie między niezamienionymi domenami jest zdefiniowane jako interfejs domeny bez zamiany (NSDI) pokazany w Rysunek 1. W zamianie domen 3D związek między niezamienioną domeną jednej podjednostki białka a już zamienioną domeną innej podjednostki jest określany jako interfejs zamienionej domeny (SDI). Innym istotnym aspektem tego zjawiska jest obszar zawiasów, elastyczny segment łącznika, który łączy domeny niezamienione i zamienione. Ten obszar zawiasu odgrywa istotną funkcję wspomagającą ruch zamiany domen 3D i służy jako przełącznik konformacyjny, umożliwiając rekonfigurację strukturalną niezbędną do zamiany domen. Zamiana domen 3D jest zaangażowana w różne procesy biologiczne, w tym składanie białek i regulację funkcjonalną5. Jest to również związane z niektórymi chorobami związanymi z nieprawidłowym fałdowaniem białek, w których nieprawidłowa zamiana może prowadzić do tworzenia agregatów lub włókien amyloidowych.

figure-introduction-1
Rysunek 1: Strukturalna reprezentacja zamiany domen 3D. Reprezentacja ilustruje wymianę identycznych elementów strukturalnych między dwoma monomerami białkowymi za pośrednictwem elastycznego regionu zawiasowego, co skutkuje powstaniem dimerycznego lub oligomerycznego zestawu z zamianą domen Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Różne typy zamiany domen 3D zostały zidentyfikowane na podstawie charakteru zamienionych domen i wynikających z nich struktur oligomerycznych6. W roku 2002 Eisenberg i jego koledzy zidentyfikowali trzy typy zamiany domen 3D: zamiana domen Bonafide (BDS), quasi-zamiana domen (QDS) i kandydat na zamianę domen 3D (CDS)7. Najczęstszą klasą białek jest zamiana domen w dobrej wierze. Odnosi się do stanu, w którym zarówno cząsteczki dimeru, jak i monomeru są obecne w stabilnej formie, w którym dimer ma przyjąć konfigurację z zamianą domeny, podczas gdy monomer ma przyjąć konfigurację zamkniętą. W przypadku quasi-zamiany domen wiadomo, że białko jest obecne w stanie oligomerycznym, ale wiadomo, że jego struktura homologiczna jest obecna w stanie monomerycznym. W CDS potwierdza jedynie klasyfikację białek w kategoriach z zamianą domen, podczas gdy informacje strukturalne zaangażowanych monomerów lub ich homologów monomerycznych nie są obecne8. W tej procedurze monomery lub ich homologi monomeryczne są nieobecne; raczej obecne są heterologiczne cząsteczki białka. Tabela 1 przedstawia przykład tych trzech kategorii9.

Tabela 1: Rodzaje zamiany domen 3D na przykładzie. Kliknij tutaj, aby pobrać tę tabelę.

Kolejne badania ujawniły liczne struktury z zamianą domen, torując drogę do zrozumienia koncepcji zamiany domen 3D. Najwcześniejsze dowody strukturalne potwierdzające to zjawisko zaobserwowano w cząsteczce białka represorowego Cro z bakteriofaga λ, które tworzy strukturę dimeryczną poprzez wymianę swoich C-końcowych nici. W 1996 roku badacz odkrył, że monomeryczna cząsteczka Cro była zaangażowana w 3D domainswapping10. Inne structure11, takie jak βB2-crystallin12, human CksHs213, beef liver catalase14, oraz rekombinowana ludzka interleukina-515, zostały również zgłoszone jako możliwe struktury 3D z zamianą domen. W oparciu o zamienioną pozycję domeny w cząsteczkach białka, zamiana domen 3D dzieli się na trzy typy: zamiana domen C-końcowych, zamiana domen N-końcowych i stosunkowo rzadka zamiana domen centralnych. Autorzy wykorzystują kompletny ludzki genom do przewidywania przypadku zamiany domen. Używają Random Forest i Support Vector Machine jako klasyfikatorów binarnych z dokładnością odpowiednio 81,7% i 73,9%. Prawie 44% sekwencji białka zostało przewidywane jako domena zamieniona w 3D w ludzkim genomie6. Analizę wzbogacenia przeprowadzono na przewidywanych przypadkach pod kątem ich dystrybucji domenowej, dystrybucji choroby i adnotacji funkcjonalnej w oparciu o ontologię genów (GO). Inne podejście bada pełną analizę całego genomu Ocimum tenuiforum przy użyciu podejścia Random Forest i stwierdza, że przewiduje się, że prawie 25% sekwencji białek w Ocimum tenuiforum jest zaangażowanych w zamianę domen 3D. Naukowcy przeprowadzają również adnotację funkcjonalną za pomocą asocjacji terminu GO i asocjacji rodziny domen białkowych i odkryli, że tylko 1158 sekwencji było zaangażowanych w stres abiotyczny16.

Rośliny wykazują różnorodność charakterystycznych rodzin białek, z określonymi białkami znanymi jako posiadające zdolność do przegrupowań strukturalnych, w tym 3D zamiana domen swapping. 3D domen może wpływać na warunki stresu biotycznego i abiotycznego poprzez produkcję metabolitów wtórnych lub innych biologicznie istotnych szlaków, które mają kilka zastosowań farmakologicznych; dlatego stanowią one istotny punkt zainteresowania dla tego badania. Struktura krystaliczna Wal1 wykazała konfigurację dimeryczną z zamianą domen, obejmującą dwa dimery w jednostce asymetrycznej i przegrupowanie strukturalne występujące w cystatynie C. Fitocystatyny odgrywają znaczącą rolę w stresie abiotycznym, a także poprawiają odporność upraw. Na podstawie dostępnej literatury i różnych odpowiednich repozytoriów zidentyfikowano łącznie 20 121 przewidywanych białek 3D z zamianą domen, z czego 17 552 są pochodzenia roślinnego, a 2569 z organizmów nieroślinnych17,18.

W literaturze opisano różne inne przykłady przewidywania 3D zamiany domen różnych zakładów przy użyciu podejścia opartego na uczeniu maszynowym. Takich jak Arabidopsis thaliana wykazując 33,7% (4058 z 12 033 recenzowanych sekwencji), Medicago truncatula 20,9% (39 ze 186 recenzowanych sekwencji), Solanum tuberosum 36,5% (146 z 400 recenzowanych sekwencji), Solanum lycopersicum 25,5% (108 z 423 recenzowanych sekwencji) i Ocimum tenuiforum 15,5% (5706 z 36841 recenzowanych sekwencji)6. Metody obliczeniowe stały się nieocenione w badaniu strukturalnych i funkcjonalnych aspektów białek 3D z zamianą domen. Podejścia te ułatwiają przewidywanie sekwencji na podstawie najlepszych możliwych cech19, adnotacji i analizy wzbogacenia, oferując wgląd w podstawowe mechanizmy molekularne. Przewidywanie zamiany domen 3D w różnych sekwencjach białek zostało zrealizowane przy użyciu klasyfikatora opartego na maszynie wektorów nośnych (SVM). Podejście to zostało opracowane przez integrację cech sekwencyjnych i strukturalnych, uzyskując dokładność przewidywania na poziomie 76,33% w zbiorze danych treningowych i 73,81% w zbiorze danych testowych, co wskazuje na jego potencjał w identyfikowaniu tendencji do zamiany domen w białkach20. Głównym powodem, dla którego warto wybrać KNN zamiast SVM, jest to, że KNN ma znacznie prostszy proces szkolenia. Wymaga tylko jednego głównego parametru, K (jest to liczba najbliższych sąsiadów branych pod uwagę podczas przewidywania), podczas gdy SVM wymaga starannego dostrojenia kilku parametrów, takich jak typ jądra, C i gamma. Dodatkowo, KNN łatwiej radzi sobie z klasyfikacją wieloklasową, podczas gdy SVM zwykle potrzebuje bardziej złożonych strategii, takich jak strategie jeden na jednego.

Uczenie maszynowe do przewidywania struktury białek
Przewidywanie struktury białka polega na wywnioskowaniu trójwymiarowego kształtu białka na podstawie jego sekwencji FASTA. Ostatnie postępy w tej dziedzinie są w znacznym stopniu napędzane przez zastosowanie różnych technik uczenia maszynowego do danych ewolucyjnych21,22. Wczesne podejścia do wydobywania informacji z danych koewolucyjnych opierały się na metodach uczenia maszynowego. Jednak nowsze strategie, szczególnie te wykorzystujące głębokie sieci szczątkowe, wykazały lepszą skuteczność w przewidywaniu potencjalnego celu23. Alphafold to baza danych oparta na głębokim uczeniu, podczas gdy Rosetta to narzędzie do funkcji energetycznych oparte na fizyce. Narzędzia te służą do przewidywania pełnej struktury atomowej 3D, którą można przybliżyć do struktur eksperymentalnych. Zapewniają one tylko współrzędne strukturalne rozdzielczości atomowej, ale te narzędzia nie określają zdarzeń zamiany domen 3D. W przeciwieństwie do tego, sugerowane podejście nie jest pełnym predyktorem struktury 3D, zamiast tego przewiduje tylko, czy białko prawdopodobnie zostanie poddane zamianie domen 3D, czy nie24,25.

Rośliny lecznicze były wykorzystywane od wieków jako naturalne zasoby do zapobiegania i leczenia różnych chorób, co przypisuje się ich związkom bioaktywnym. Są niezbędne w medycynie tradycyjnej i przyczyniają się do rozwoju nowoczesnych leków farmaceutycznych. Nie przeprowadzono jednak żadnych znaczących prac w dziedzinie zamiany domen białkowych roślin leczniczych w celu odkrywania leków. Algorytmy, w tym uczenie maszynowe i ich modele zespołowe, rozpoznają wzorce i relacje w danych sekwencji, aby przewidzieć zamianę domen 3D. Powodem wyboru roślin leczniczych do tego badania jest to, że może ono wykryć funkcjonalną różnorodność białka w roślinach zaangażowanych w zamianę domen 3D, co skutkuje zrozumieniem reakcji na stres, obrony patogenów i biosyntezy metabolicznej. Wyzwania techniczne związane z określaniem zamiany domen 3D białek w dużych ilościach i złożonych, zaawansowanych konformacji oligomerycznych przy użyciu technik NMR lub krystalografii podkreślają konieczność opracowania zaawansowanych podejść obliczeniowych.

Ogólnym celem proponowanej pracy badawczej jest zastosowanie metodologii obliczeniowej przy użyciu algorytmów Random Forest (RF)26 i K-najbliższego sąsiada (KNN)27 do zadania przewidywania struktury sekwencji białek oraz pełnej analizy całego genomu zamienionych przypadków w różnych sekwencjach roślin leczniczych. Las losowy (RF) jest klasyfikatorem binarnym; Jest to solidny i wszechstronny algorytm uczenia maszynowego szeroko stosowany w analizie sekwencji białek. Działa poprzez konstruowanie zestawu drzew decyzyjnych (DT) i osiąga dość wysoką dokładność zarówno w zestawach danych treningowych, jak i testowych. W przypadku zadań sekwencjonowania białek RF może analizować różne cechy, w tym właściwości fizykochemiczne, skład sekwencji, strukturę drugorzędową i informacje ewolucyjne pochodzące z dopasowań sekwencji lub profili. Doskonale radzi sobie z dużymi, hałaśliwymi zestawami danych i zapewnia metryki ważności funkcji28. Klasyfikator K-Najbliższych Sąsiadów (KNN) to prosty, ale skuteczny algorytm uczenia maszynowego szeroko stosowany w analizie sekwencji białek. Jego działanie polega na klasyfikowaniu sekwencji wejściowej na podstawie klasy większości jej k najbliższych sąsiadów w przestrzeni funkcji. W analizie sekwencji białek KNN można wykorzystać do przewidywania kategorii funkcjonalnych, właściwości strukturalnych i lokalizacji subkomórkowej. Cechy klasyfikacji KNN często obejmują skład aminokwasów, motywy sekwencji, profile ewolucyjne lub atrybuty fizykochemiczne. KNN jest popularnym wyborem do analizy białek ze względu na swoją prostotę; Interpretowalność i skuteczność sprawiają, że jest to cenne narzędzie do analizy sekwencji białek29. Razem algorytmy te zapewniają uzupełniające się mocne strony, umożliwiając stworzenie kompleksowych ram obliczeniowych do badania zamiany domen 3D w różnych sekwencjach roślin leczniczych. Te dwa modele przewidują tylko możliwe przypadki, które mogą zostać poddane zamianie domen; nie przewiduje pełnych współrzędnych strukturalnych 3D ani tego, która część lub pozostałość jest szczególnie zaangażowana w ten proces zamiany. Jest to kwestia dalszych badań, ponieważ identyfikacja określonych regionów lub reszt, które są zaangażowane w zamianę, w celu wyjaśnienia mechanizmu i funkcjonalnych aspektów zamiany domen 3D events.3D zamiana domen obejmuje szereg strukturalnie odrębnych zjawisk, takich jak konfiguracje w pętli zamkniętej, swapy otwarte i inne różnice, które obejmują różne regiony zawiasów i architektury domen. W związku z tym sugerowane podejście kategoryzuje tylko wszystkie rodzaje zdarzeń 3D związanych z zamianą domen w ramach ujednoliconej klasyfikacji. Ten wybór był początkowo spowodowany ograniczoną dostępnością danych z adnotacjami, które mogą określać określoną klasę zamiany domen 3D. Jest to pierwszy rodzaj prób na różnych zestawach danych opartych na roślinach leczniczych i uważamy, że rozróżnienie między różnymi mechanizmami wymiany może zwiększyć dokładność predykcyjną modelu.

Analiza wzbogacenia roślin leczniczych pomaga zidentyfikować kluczowe geny, białka i szlaki zaangażowane w syntezę związków bioaktywnych i reakcję na stres. Dostarcza informacji na temat mechanizmów molekularnych. Te analizy w roślinach leczniczych badają podstawowe geny, białka i procesy biologiczne związane z syntezą bioaktywnych substancji chemicznych, odpornością na stres i odpornością na choroby. Adnotacja funkcjonalna wybranych białek, taka jak ontologia genów (GO) i analiza szlaku KEGG, odkrywa mechanizmy molekularne leżące u podstaw produkcji metabolitów wtórnych i reakcji środowiskowych na stres. Takie podejście znacznie pomaga w odkrywaniu leków, poprawia odporność upraw i wyjaśnia szlaki metaboliczne roślin dla zrównoważonego rolnictwa i postępów w medycynie.

Nowatorski wkład badania
Badanie to podkreśla możliwości uczenia maszynowego w promowaniu bardziej precyzyjnych i wydajnych modeli do przewidywania wzorców strukturalnych białek w zbiorach danych biologicznych.

To badanie integruje nowe funkcje z algorytmami uczenia maszynowego, zwiększając ich zdolność do przewidywania funkcji białek z większą przejrzystością. Takie cechy pozwalają lepiej zrozumieć zależności między strukturą a funkcją białek, pomagając w bardziej precyzyjnym projektowaniu i optymalizacji białek w inżynierii białek.

Analiza wzbogacenia przewidywanych białek pomaga odkryć kluczowe szlaki biologiczne, procesy komórkowe i funkcje molekularne, dostarczając cennych celów do odkrywania biomarkerów, projektowania leków i zrozumienia mechanizmu choroby. Analiza ta zwiększa precyzję interwencji opartych na szlakach i identyfikacji celów terapeutycznych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

UWAGA: Ten segment zawiera obszerny zarys proponowanej metodologii, która obejmuje sześć podstawowych kroków: (a) zbieranie danych, (b) wybór cech, (c) wstępne przetwarzanie danych, (d) przetwarzanie końcowe danych, (e) opracowanie modelu, (f) ocena wyników proponowanego modelu i, (g) analiza wzbogacenia na różnych poziomach pozytywnie przewidywanych sekwencji. Core i5-10500 to procesor 10. generacji, który został wykorzystany w tych pracach badawczych. Ma sześć rdzeni i 12 wątków, z częstotliwością bazową 3,10 GHz i maksymalną prędkością turbo 4,50 GHz. Jest wyposażony w 12 MB pamięci podręcznej Intel Smart Cache, obsługuje pamięć DDR4-2666 i zawiera kartę graficzną UHD Graphics 630 do zintegrowanych efektów wizualnych. Zbudowany z myślą o wydajnej wielozadaniowości i produktywności, jest kompatybilny z gniazdem LGA 1200 i działa z TDP 65 W.

1. Zbieranie danych

  1. Use3d3dswap-pred (https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) i 3DSwap+ (https://caps.ncbs.res.in/3Dswapplus/index.html)3030 Tabela uzupełniająca 1, Tabela uzupełniająca 2, Tabela uzupełniająca 1, Plik uzupełniający 2). Użyj łącznie 573 ręcznie wyselekcjonowanych wpisów PDB zawierających cząsteczki 3D zamienione domenami, głównie z roślin leczniczych.
  2. Zastosuj metodę Profilu Najlepszego Przedstawiciela (BRP) do skonstruowania negatywnego zestawu danych, przypisując Sekwencję Najlepszego Przedstawiciela (BRS) do każdej rodziny białek Pfam31 (http://pfam.xfam.org/). Przeszukaj łącznie 10 112 sekwencji strukturalnych we wszystkich BRP Pfam przy użyciu HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/) z progiem wartości E wynoszącym 0,001. Przetwarzaj wynikową sekwencję za pomocą DIAL, aby zidentyfikować domeny strukturalne (https://bioinformaticshome.com/db/tool/DIAL). Uwzględnij 575 wpisów PDB jako negatywny zestaw danych (trenowanie).
  3. Uwzględnij 314 sekwencji białek uzyskanych metodą BRP i 261 ręcznie wyselekcjonowanych sekwencji bez 3D z zamianą domen zidentyfikowanych przez 3DSwap+ jako negatywny zestaw danych.
  4. Pobierz łącznie 1 355 sprawdzonych wpisów sekwencji białek z różnych roślin leczniczych z UniProt33 (https://www.uniprot.org/). Uwzględnij 13 roślin leczniczych w tym badaniu (zestaw danych testowych/predykcyjnych): Citrus sinensis (RS-102), Vitis vinifera (RS-226), Mentha (RS-28), Cannabis sativa (RS-21), Acorus clamus (RS-511), Coffea arabica (RS-104), Papaver somniferum (RS-58), Hibiscus (RS-88), Jaśmin (RS-89), Tymianek (RS-30), Grasica (RS-14), Illicium oligandrum (RS-72) i Citrus limon (RS-12). Drzewo filogenetyczne przedstawiono na rysunku uzupełniającym 1.

2. Korzystanie z funkcji do tworzenia modelu

  1. Wykorzystaj kompleksowy zestaw funkcji składający się z 453 funkcji do przewidywania sekwencji białek w roślinach leczniczych. Zawiera 439 uznanych funkcji i 16 nowatorskich funkcji, starannie wybranych na podstawie dokładnego przeglądu literatury.
  2. Użyj bazy danych AAindex34(https://www.genome.jp/aaindex/), aby określić właściwości fizykochemiczne aminokwasów. Zastosuj platformę uczenia maszynowego WEKA35 (https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/) do wyboru funkcji. Zapoznaj się z Tabelą 2, aby zapoznać się z nowo wprowadzonymi funkcjami.

Tabela 2: Lista nowo dodanych funkcji wraz z ich opisami. Poniższa tabela zawiera podsumowanie nowatorskich funkcji zaprojektowanych w fazie wyodrębniania funkcji w celu zwiększenia wydajności modelu w przewidywaniu zamiany domen 3D. Każda cecha wychwytuje specyficzne, oparte na sekwencji, fizykochemiczne lub strukturalne właściwości białek, które przypuszczalnie wpływają na ich skłonność do zamiany domen. Szczegółowe opisy są dostarczane w celu wyjaśnienia biologicznego znaczenia i obliczeniowego wyprowadzenia każdej cechy. Kliknij tutaj, aby pobrać tę tabelę.

3. Wstępne i końcowe przetwarzanie danych

UWAGA: Wstępne przetwarzanie danych. Wstępne przetwarzanie danych jest niezbędnym krokiem w uczeniu maszynowym, który polega na przygotowaniu nieprzetworzonych danych do analizy. Obejmuje to czyszczenie danych (np. usuwanie duplikatów, obsługę brakujących wartości itp.).

  1. Użyj dodatkowego pliku kodowania 1 do kodowania zmiennych jakościowych do postaci liczbowej, co obejmuje cztery główne kroki: (1) Definiowanie dyktowania wyników, (2) szybkie przetwarzanie sekwencji przez sekwencję I0. parse, (3) tworzenie ramki danych, (4) analiza numeryczna funkcji 3D z zamianą domen
  2. .
  3. Uściślanie i interpretowanie danych wyjściowych modelu za pomocą przetwarzania końcowego danych. Ponowne kalibrowanie przewidywań, agregowanie wyników i stosowanie progu klasyfikacji. Sklasyfikuj bimodalny zestaw danych zamiany domen 3D przy użyciu wartości progowej β = 0,5 (zakres 0-1), zgodnie z poprzednimi badaniami36,37,38.
  4. Podziel zestaw danych z podziałem 70:30 trenowania i testu, przydzielając 70% na trenowanie modelu i 30% na niezależną ocenę.
  5. Standaryzacja danych treningowych przy użyciu metody standardowego skalowania w celu dostosowania wartości funkcji do średniej 0 i odchylenia standardowego 1, zapewniając lepszą zgodność z estymatorami uczenia maszynowego. Przeprowadź selekcję funkcji, aby zidentyfikować zmienne o największym wpływie.
    UWAGA: Standaryzacja zestawu danych jest powszechnie stosowanym wymogiem wstępnym dla wielu algorytmów uczenia maszynowego w celu zapewnienia optymalnej wydajności. Dane, które są dalekie od rozkładu normalnego, mogą negatywnie wpływać na wydajność modeli uczenia maszynowego39.
  6. Przeprowadź walidację. Aby zapewnić solidną i bezstronną ocenę modelu, wdrożono również K-krotną walidację krzyżową Tabela uzupełniająca 3.
  7. Podziel zestaw danych na K podzbiorów. Trenuj i oceniaj model iteracyjnie na podzbiorach K=5, używając pozostałego podzbioru do niezależnych testów.

4. Tworzenie i implementacja modelu

  1. Implementuj i dostrajaj algorytmy lasu losowego (RF) i K-najbliższych sąsiadów (KNN), aby zoptymalizować wydajność predykcyjną. Trenuj, weryfikuj i testuj modele przy użyciu sekwencji białek 573 i 575 do trenowania oraz 1 355 sekwencji białek do testowania.
  2. Użyj skryptu języka Python (Supplementary Coding File 1), aby wyodrębnić wartości cech numerycznych na podstawie wybranej sekwencji białka. Zapisz te wartości liczbowe dla obu zestawów danych w plikach CSV i prześlij je do klasyfikatorów RF i KNN w celu wygenerowania binarnego modelu klasyfikacji.
  3. Użyj tych modeli, aby rozróżnić białka z zamianą domen 3D i białka bez domeny 3D. Zapoznaj się z Rysunek 2 i Rysunek 3, aby zapoznać się z uogólnionymi ramami przewidywania zamiany domen 3D.
  4. Zastosuj hiperparametry, takie jak n_estimators=20, max_depth=4 i random_state=42 dla modelu RF.
  5. Zastosuj hiperparametr neighbors=5 dla klasyfikatora KNN model.
    UWAGA: Te ustawienia parametrów zostały dostrojone w celu zwiększenia wydajności modeli w ręcznie wyselekcjonowanym zestawie danych roślin leczniczych.

figure-protocol-1
Rysunek 2: Ilustracyjne przedstawienie schematu. Reprezentacja przedstawia modele uczenia maszynowego Random Forest i K-Nearest Neighbor (KNN), prezentując ich strukturę algorytmiczną i funkcjonalny przepływ pracy w kontekście binarnych zadań klasyfikacyjnych Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

figure-protocol-2
Rysunek 3: Przepływ pracy oparty na uczeniu maszynowym. Diagram ilustruje przepływ pracy oparty na uczeniu maszynowym do przewidywania zamiany domen 3D w białkach roślin leczniczych. Proces rozpoczyna się od pozyskania zestawu danych, połączenia zestawu danych porównawczych i meta. Ekstrakcja cech polega na wyprowadzeniu zarówno istniejących, jak i nowych cech z sekwencji białek. W procesie wstępnego przetwarzania zbiorów danych sekwencje FASTA są konwertowane na wartości liczbowe przy użyciu analizowania sekwencji i mapowania słownikowego w celu utworzenia ustrukturyzowanych ramek danych, w tym określonych funkcji zamiany domen 3D. Przetwarzanie końcowe obejmuje przypisywanie statusu zamiany domeny za pomocą progu (β = 0,5), dzielenie danych na zestawy treningowe i testowe (stosunek 70-30), standaryzację funkcji i przeprowadzanie wyboru funkcji z walidacją k-krotnie. Dwa modele uczenia maszynowego, Random Forest (RF) i K-Nearest Neighbors (KNN), są trenowane, a ich wydajność jest oceniana przy użyciu metryk modelu wraz z AUROC i AUPRC w celu oceny dokładności i niezawodności predykcyjnej Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

5. Ocena statyczna i oceny modeli klasyfikatorów ML

  1. Implementuj i dostrajaj algorytmy lasu losowego (RF) i K-najbliższych sąsiadów (KNN), aby zoptymalizować wydajność predykcyjną. Trenuj, weryfikuj i testuj modele przy użyciu sekwencji białek 573 i 575 do trenowania oraz 1 355 sekwencji białek do testowania.
    figure-protocol-3 (1)
    figure-protocol-4 (2)
    figure-protocol-5 (3)
    figure-protocol-6 (4)
    figure-protocol-7 (5)
    figure-protocol-8 (6)
    UWAGA: Zdefiniuj TP (True Positive) jako procent sekwencji poprawnie przewidywanych przez modele jako zamienione domenami. Zdefiniuj TN (True Negative) jako procent sekwencji poprawnie przewidywanych jako niezamienione domenami. Zdefiniuj wynik fałszywie dodatni (FP) jako przypadki, w których białka niezamienione domeną są nieprawidłowo przewidywane jako zamienione domeny. Zdefiniuj wynik fałszywie ujemny (FN) jako przypadki, w których białka zamienione domenami są nieprawidłowo przewidywane jako niezamienione domeną.
  2. Oblicz Xsen jako stosunek dokładnie zidentyfikowanych wyników prawdziwie dodatnich, a Xspe jako stosunek wartości prawdziwie ujemnych poprawnie zidentyfikowanych przez model.
    UWAGA: Za pomocą MCK można ocenić jakość klasyfikacji binarnych przez przeanalizowanie wyników prawdziwie dodatnich, prawdziwie ujemnych, fałszywie dodatnich i fałszywie ujemnych z macierzy pomyłek.
  3. Oblicz dokładność (ACC), aby zmierzyć proporcję poprawnych przewidywań wśród wszystkich przewidywań.
    UWAGA: Precyzja ocenia proporcję prawidłowo zidentyfikowanych wyników dodatnich spośród wszystkich przewidywanych wyników dodatnich, podczas gdy wynik F1 jest średnią harmoniczną precyzji i czułości, równoważąc wyniki fałszywie dodatnie i fałszywie ujemne.
  4. Usługa AUC służy do oceny wydajności modeli klasyfikacji w zadaniach klasyfikacji binarnej. Oblicz AUC (Area Under the Curve) za pomocą biblioteki Pythona Scikit-learn40, na podstawie pozytywnie i negatywnie sklasyfikowanych białek.
  5. Użyj danych testowych, aby ocenić te parametry.

6. Implementacja modelu do przewidywania zamiany domen 3D na różnych gatunkach roślin leczniczych

  1. Zastosuj RF i KNN do łącznie 1,355 recenzowanych sekwencji (zestaw danych predykcyjnych) z 13 różnych roślin leczniczych, w tym Citrus sinensis, Mentha, Vitis vinifera, Tymianek, Thymus vulgaris, Jaśmin, Hibiskus, Papaver somniferum, Illicium oligandrum, Citrus limon, Acorus calamus, Cannabis sativa i Coffea arabica.
    UWAGA: Białka te są związane z różnymi funkcjami, takimi jak Citrus sinensis, Mentha, tymianek, pomaga w niestrawności. Vitis vinifera, jaśmin, hibiskus są bardzo bogatym źródłem przeciwutleniaczy, a także poprawiają zdrowie skóry. Illicium oligandrum jest znany ze swoich właściwości przeciwgrzybiczych, przeciwbakteryjnych itp.

7. Badanie wzbogacenia pozytywnie przewidywanych białek zamienionych domenami 3D z rośliny leczniczej

  1. Przyporządkuj kody akcesyjne tych sekwencji białek do kategorii metabolitów wtórnych, korzystając z danych z UniProt.
  2. Wyodrębnij identyfikator genu z przewidywanych sekwencji.
  3. Otwórz internetowy serwer WWW KEGG41 (https://www.genome.jp/kegg/), aby przeprowadzić analizę wzbogacania szlaku KEGG, wklejając indywidualny identyfikator genu lub nazwę białka w celu sprawdzenia ich odpowiednich ścieżek.
  4. Przeprowadź analizę porównawczą, porównując przewidywane białka 3D zamieniające domeny ze zbiorem danych predykcyjnych w celu wykrycia statystycznie istotnej nadreprezentacji określonych terminów ontologii genów (GO) i ścieżek biologicznych. Wklej identyfikator genu przewidywanej sekwencji do ShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/) i wybierz żądaną funkcję lub kategorię szlaku (funkcja biologiczna, składnik komórkowy, funkcja molekularna, KEGG itp.).
    UWAGA: Wizualizuj te adnotacje za pomocą internetowej platformy opartej na chmurze43, która umożliwia użytkownikom pisanie i wykonywanie kodu w języku Python.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Białka wykazujące zamianę domen 3D są często powiązane z różnymi funkcjami biologicznymi. Jednak systematyczna, obejmująca cały genom analiza sekwencji białek, które były zaangażowane w zamianę domen 3D, pozostaje w dużej mierze niezbadana. W tym badaniu przeprowadziliśmy wstępne badanie, aby przypuszczalnie przewidzieć białka 3D zamienione domenami z 13 roślin leczniczych, koncentrując się na ich związku z wtórnymi domenami metabolitów, szlakami KEGG i terminami ontologii genów (GO). Kompleksowa analiza dostępnej litera...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zrozumienie zamiany domen 3D w białkach w całym ich genomie ma istotne znaczenie w różnych dziedzinach. Podejścia oparte na uczeniu maszynowym, zwłaszcza las losowy i najbliższy sąsiadK 26,27, zostały wykorzystane do przewidywania zamiany domen 3D bezpośrednio na podstawie danych sekwencji białek na poziomie genomu. Te dwa modele uczenia maszynowego obejmują różne kroki, takie jak zbieranie zestawów danych, wybór funkcji, przetwarzanie wstępne/końcowe danych, imp...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy oświadczają, że nie są im znane żadne konkurencyjne interesy finansowe ani powiązania osobiste, które mogłyby mieć wpływ na pracę opisaną w tym artykule.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nie otrzymano żadnych funduszy na te badania.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
3DSwap+https://caps.ncbs.res.in/3Dswapplus/index.html 
PfamEMBL-EBIhttp://pfam.xfam.org/: 
HMMEREMBL-EBI;
Aaindexhttps://www.genome.jp/aaindex/:
TARCZABioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL: 
WEKAUniwersytet Wekatohttps://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
  KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :
https://www.ebi.ac.uk/Tools/hmmer/:  

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

3D zamiana domenoligomeryzacja bia ekmga Las LosowyK najbli szych s siad wadnotacja funkcjonalnabiosynteza wt rnych metabolit wGene Ontologyszlaki KEGG
Film wkrótce dostępny

Powiązane artykuły