$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Metody obliczeniowe zrewolucjonizowały badania białek, umożliwiając szczegółową analizę i przewidywania dotyczące struktur, funkcji i interakcji białek. Precyzyjna identyfikacja i adnotacja funkcji białek są niezbędne do rozwikłania molekularnych mechanizmów życia i mają ogromne znaczenie dla postępów w medycynie i opracowywaniu leków. Jednak nieodłączna złożoność i koszty metod eksperymentalnych ograniczają ich skalowalność w celu dostosowania się do dużych danych sekwencyjnych. W rezultacie, rozwój metod obliczeniowych do przewidywania funkcji białek stał się kluczowym obszarem biologii obliczeniowej i molekularnej, wypełniając tę lukę za pomocą innowacyjnych podejść na dużą skalę1.
3D domain swapping2 to zjawisko strukturalne w białkach, w którym segmenty wspólnej struktury są wymieniane między poszczególnymi łańcuchami. W 1994 roku odnaleziono dokumentację wprowadzającą do mechanizmu zamiany domen 3D w tomorze błoniczym dimer3. Jednak podstawowe zasady zamiany domen 3D można prześledzić wstecz cztery dekady. Zaobserwowano, że bydlęca rybonukleaza trzustkowa A (RNaza A) tworzy dimery podczas liofilizacji w kwasie octowym, dzięki zaawansowanym eksperymentom modyfikacji chemicznej4. W oligomeryzacji białek dwa lub więcej łańcuchów białkowych wymienia identyczne elementy strukturalne za pośrednictwem elastycznych regionów zawiasowych. Część białka wymieniana między podjednostkami monomerycznymi jest określana jako zamieniona domena, która może składać się z całej domeny globularnej, pętli lub drugorzędowego elementu strukturalnego w niektórych białkach. I odwrotnie, regiony, które pozostają niezmienione w swoich pierwotnych pozycjach w monomerach, są określane jako domeny niezamienione5. Sprzężenie między niezamienionymi domenami jest zdefiniowane jako interfejs domeny bez zamiany (NSDI) pokazany w Rysunek 1. W zamianie domen 3D związek między niezamienioną domeną jednej podjednostki białka a już zamienioną domeną innej podjednostki jest określany jako interfejs zamienionej domeny (SDI). Innym istotnym aspektem tego zjawiska jest obszar zawiasów, elastyczny segment łącznika, który łączy domeny niezamienione i zamienione. Ten obszar zawiasu odgrywa istotną funkcję wspomagającą ruch zamiany domen 3D i służy jako przełącznik konformacyjny, umożliwiając rekonfigurację strukturalną niezbędną do zamiany domen. Zamiana domen 3D jest zaangażowana w różne procesy biologiczne, w tym składanie białek i regulację funkcjonalną5. Jest to również związane z niektórymi chorobami związanymi z nieprawidłowym fałdowaniem białek, w których nieprawidłowa zamiana może prowadzić do tworzenia agregatów lub włókien amyloidowych.

Rysunek 1: Strukturalna reprezentacja zamiany domen 3D. Reprezentacja ilustruje wymianę identycznych elementów strukturalnych między dwoma monomerami białkowymi za pośrednictwem elastycznego regionu zawiasowego, co skutkuje powstaniem dimerycznego lub oligomerycznego zestawu z zamianą domen Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.
Różne typy zamiany domen 3D zostały zidentyfikowane na podstawie charakteru zamienionych domen i wynikających z nich struktur oligomerycznych6. W roku 2002 Eisenberg i jego koledzy zidentyfikowali trzy typy zamiany domen 3D: zamiana domen Bonafide (BDS), quasi-zamiana domen (QDS) i kandydat na zamianę domen 3D (CDS)7. Najczęstszą klasą białek jest zamiana domen w dobrej wierze. Odnosi się do stanu, w którym zarówno cząsteczki dimeru, jak i monomeru są obecne w stabilnej formie, w którym dimer ma przyjąć konfigurację z zamianą domeny, podczas gdy monomer ma przyjąć konfigurację zamkniętą. W przypadku quasi-zamiany domen wiadomo, że białko jest obecne w stanie oligomerycznym, ale wiadomo, że jego struktura homologiczna jest obecna w stanie monomerycznym. W CDS potwierdza jedynie klasyfikację białek w kategoriach z zamianą domen, podczas gdy informacje strukturalne zaangażowanych monomerów lub ich homologów monomerycznych nie są obecne8. W tej procedurze monomery lub ich homologi monomeryczne są nieobecne; raczej obecne są heterologiczne cząsteczki białka. Tabela 1 przedstawia przykład tych trzech kategorii9.
Tabela 1: Rodzaje zamiany domen 3D na przykładzie. Kliknij tutaj, aby pobrać tę tabelę.
Kolejne badania ujawniły liczne struktury z zamianą domen, torując drogę do zrozumienia koncepcji zamiany domen 3D. Najwcześniejsze dowody strukturalne potwierdzające to zjawisko zaobserwowano w cząsteczce białka represorowego Cro z bakteriofaga λ, które tworzy strukturę dimeryczną poprzez wymianę swoich C-końcowych nici. W 1996 roku badacz odkrył, że monomeryczna cząsteczka Cro była zaangażowana w 3D domainswapping10. Inne structure11, takie jak βB2-crystallin12, human CksHs213, beef liver catalase14, oraz rekombinowana ludzka interleukina-515, zostały również zgłoszone jako możliwe struktury 3D z zamianą domen. W oparciu o zamienioną pozycję domeny w cząsteczkach białka, zamiana domen 3D dzieli się na trzy typy: zamiana domen C-końcowych, zamiana domen N-końcowych i stosunkowo rzadka zamiana domen centralnych. Autorzy wykorzystują kompletny ludzki genom do przewidywania przypadku zamiany domen. Używają Random Forest i Support Vector Machine jako klasyfikatorów binarnych z dokładnością odpowiednio 81,7% i 73,9%. Prawie 44% sekwencji białka zostało przewidywane jako domena zamieniona w 3D w ludzkim genomie6. Analizę wzbogacenia przeprowadzono na przewidywanych przypadkach pod kątem ich dystrybucji domenowej, dystrybucji choroby i adnotacji funkcjonalnej w oparciu o ontologię genów (GO). Inne podejście bada pełną analizę całego genomu Ocimum tenuiforum przy użyciu podejścia Random Forest i stwierdza, że przewiduje się, że prawie 25% sekwencji białek w Ocimum tenuiforum jest zaangażowanych w zamianę domen 3D. Naukowcy przeprowadzają również adnotację funkcjonalną za pomocą asocjacji terminu GO i asocjacji rodziny domen białkowych i odkryli, że tylko 1158 sekwencji było zaangażowanych w stres abiotyczny16.
Rośliny wykazują różnorodność charakterystycznych rodzin białek, z określonymi białkami znanymi jako posiadające zdolność do przegrupowań strukturalnych, w tym 3D zamiana domen swapping. 3D domen może wpływać na warunki stresu biotycznego i abiotycznego poprzez produkcję metabolitów wtórnych lub innych biologicznie istotnych szlaków, które mają kilka zastosowań farmakologicznych; dlatego stanowią one istotny punkt zainteresowania dla tego badania. Struktura krystaliczna Wal1 wykazała konfigurację dimeryczną z zamianą domen, obejmującą dwa dimery w jednostce asymetrycznej i przegrupowanie strukturalne występujące w cystatynie C. Fitocystatyny odgrywają znaczącą rolę w stresie abiotycznym, a także poprawiają odporność upraw. Na podstawie dostępnej literatury i różnych odpowiednich repozytoriów zidentyfikowano łącznie 20 121 przewidywanych białek 3D z zamianą domen, z czego 17 552 są pochodzenia roślinnego, a 2569 z organizmów nieroślinnych17,18.
W literaturze opisano różne inne przykłady przewidywania 3D zamiany domen różnych zakładów przy użyciu podejścia opartego na uczeniu maszynowym. Takich jak Arabidopsis thaliana wykazując 33,7% (4058 z 12 033 recenzowanych sekwencji), Medicago truncatula 20,9% (39 ze 186 recenzowanych sekwencji), Solanum tuberosum 36,5% (146 z 400 recenzowanych sekwencji), Solanum lycopersicum 25,5% (108 z 423 recenzowanych sekwencji) i Ocimum tenuiforum 15,5% (5706 z 36841 recenzowanych sekwencji)6. Metody obliczeniowe stały się nieocenione w badaniu strukturalnych i funkcjonalnych aspektów białek 3D z zamianą domen. Podejścia te ułatwiają przewidywanie sekwencji na podstawie najlepszych możliwych cech19, adnotacji i analizy wzbogacenia, oferując wgląd w podstawowe mechanizmy molekularne. Przewidywanie zamiany domen 3D w różnych sekwencjach białek zostało zrealizowane przy użyciu klasyfikatora opartego na maszynie wektorów nośnych (SVM). Podejście to zostało opracowane przez integrację cech sekwencyjnych i strukturalnych, uzyskując dokładność przewidywania na poziomie 76,33% w zbiorze danych treningowych i 73,81% w zbiorze danych testowych, co wskazuje na jego potencjał w identyfikowaniu tendencji do zamiany domen w białkach20. Głównym powodem, dla którego warto wybrać KNN zamiast SVM, jest to, że KNN ma znacznie prostszy proces szkolenia. Wymaga tylko jednego głównego parametru, K (jest to liczba najbliższych sąsiadów branych pod uwagę podczas przewidywania), podczas gdy SVM wymaga starannego dostrojenia kilku parametrów, takich jak typ jądra, C i gamma. Dodatkowo, KNN łatwiej radzi sobie z klasyfikacją wieloklasową, podczas gdy SVM zwykle potrzebuje bardziej złożonych strategii, takich jak strategie jeden na jednego.
Uczenie maszynowe do przewidywania struktury białek
Przewidywanie struktury białka polega na wywnioskowaniu trójwymiarowego kształtu białka na podstawie jego sekwencji FASTA. Ostatnie postępy w tej dziedzinie są w znacznym stopniu napędzane przez zastosowanie różnych technik uczenia maszynowego do danych ewolucyjnych21,22. Wczesne podejścia do wydobywania informacji z danych koewolucyjnych opierały się na metodach uczenia maszynowego. Jednak nowsze strategie, szczególnie te wykorzystujące głębokie sieci szczątkowe, wykazały lepszą skuteczność w przewidywaniu potencjalnego celu23. Alphafold to baza danych oparta na głębokim uczeniu, podczas gdy Rosetta to narzędzie do funkcji energetycznych oparte na fizyce. Narzędzia te służą do przewidywania pełnej struktury atomowej 3D, którą można przybliżyć do struktur eksperymentalnych. Zapewniają one tylko współrzędne strukturalne rozdzielczości atomowej, ale te narzędzia nie określają zdarzeń zamiany domen 3D. W przeciwieństwie do tego, sugerowane podejście nie jest pełnym predyktorem struktury 3D, zamiast tego przewiduje tylko, czy białko prawdopodobnie zostanie poddane zamianie domen 3D, czy nie24,25.
Rośliny lecznicze były wykorzystywane od wieków jako naturalne zasoby do zapobiegania i leczenia różnych chorób, co przypisuje się ich związkom bioaktywnym. Są niezbędne w medycynie tradycyjnej i przyczyniają się do rozwoju nowoczesnych leków farmaceutycznych. Nie przeprowadzono jednak żadnych znaczących prac w dziedzinie zamiany domen białkowych roślin leczniczych w celu odkrywania leków. Algorytmy, w tym uczenie maszynowe i ich modele zespołowe, rozpoznają wzorce i relacje w danych sekwencji, aby przewidzieć zamianę domen 3D. Powodem wyboru roślin leczniczych do tego badania jest to, że może ono wykryć funkcjonalną różnorodność białka w roślinach zaangażowanych w zamianę domen 3D, co skutkuje zrozumieniem reakcji na stres, obrony patogenów i biosyntezy metabolicznej. Wyzwania techniczne związane z określaniem zamiany domen 3D białek w dużych ilościach i złożonych, zaawansowanych konformacji oligomerycznych przy użyciu technik NMR lub krystalografii podkreślają konieczność opracowania zaawansowanych podejść obliczeniowych.
Ogólnym celem proponowanej pracy badawczej jest zastosowanie metodologii obliczeniowej przy użyciu algorytmów Random Forest (RF)26 i K-najbliższego sąsiada (KNN)27 do zadania przewidywania struktury sekwencji białek oraz pełnej analizy całego genomu zamienionych przypadków w różnych sekwencjach roślin leczniczych. Las losowy (RF) jest klasyfikatorem binarnym; Jest to solidny i wszechstronny algorytm uczenia maszynowego szeroko stosowany w analizie sekwencji białek. Działa poprzez konstruowanie zestawu drzew decyzyjnych (DT) i osiąga dość wysoką dokładność zarówno w zestawach danych treningowych, jak i testowych. W przypadku zadań sekwencjonowania białek RF może analizować różne cechy, w tym właściwości fizykochemiczne, skład sekwencji, strukturę drugorzędową i informacje ewolucyjne pochodzące z dopasowań sekwencji lub profili. Doskonale radzi sobie z dużymi, hałaśliwymi zestawami danych i zapewnia metryki ważności funkcji28. Klasyfikator K-Najbliższych Sąsiadów (KNN) to prosty, ale skuteczny algorytm uczenia maszynowego szeroko stosowany w analizie sekwencji białek. Jego działanie polega na klasyfikowaniu sekwencji wejściowej na podstawie klasy większości jej k najbliższych sąsiadów w przestrzeni funkcji. W analizie sekwencji białek KNN można wykorzystać do przewidywania kategorii funkcjonalnych, właściwości strukturalnych i lokalizacji subkomórkowej. Cechy klasyfikacji KNN często obejmują skład aminokwasów, motywy sekwencji, profile ewolucyjne lub atrybuty fizykochemiczne. KNN jest popularnym wyborem do analizy białek ze względu na swoją prostotę; Interpretowalność i skuteczność sprawiają, że jest to cenne narzędzie do analizy sekwencji białek29. Razem algorytmy te zapewniają uzupełniające się mocne strony, umożliwiając stworzenie kompleksowych ram obliczeniowych do badania zamiany domen 3D w różnych sekwencjach roślin leczniczych. Te dwa modele przewidują tylko możliwe przypadki, które mogą zostać poddane zamianie domen; nie przewiduje pełnych współrzędnych strukturalnych 3D ani tego, która część lub pozostałość jest szczególnie zaangażowana w ten proces zamiany. Jest to kwestia dalszych badań, ponieważ identyfikacja określonych regionów lub reszt, które są zaangażowane w zamianę, w celu wyjaśnienia mechanizmu i funkcjonalnych aspektów zamiany domen 3D events.3D zamiana domen obejmuje szereg strukturalnie odrębnych zjawisk, takich jak konfiguracje w pętli zamkniętej, swapy otwarte i inne różnice, które obejmują różne regiony zawiasów i architektury domen. W związku z tym sugerowane podejście kategoryzuje tylko wszystkie rodzaje zdarzeń 3D związanych z zamianą domen w ramach ujednoliconej klasyfikacji. Ten wybór był początkowo spowodowany ograniczoną dostępnością danych z adnotacjami, które mogą określać określoną klasę zamiany domen 3D. Jest to pierwszy rodzaj prób na różnych zestawach danych opartych na roślinach leczniczych i uważamy, że rozróżnienie między różnymi mechanizmami wymiany może zwiększyć dokładność predykcyjną modelu.
Analiza wzbogacenia roślin leczniczych pomaga zidentyfikować kluczowe geny, białka i szlaki zaangażowane w syntezę związków bioaktywnych i reakcję na stres. Dostarcza informacji na temat mechanizmów molekularnych. Te analizy w roślinach leczniczych badają podstawowe geny, białka i procesy biologiczne związane z syntezą bioaktywnych substancji chemicznych, odpornością na stres i odpornością na choroby. Adnotacja funkcjonalna wybranych białek, taka jak ontologia genów (GO) i analiza szlaku KEGG, odkrywa mechanizmy molekularne leżące u podstaw produkcji metabolitów wtórnych i reakcji środowiskowych na stres. Takie podejście znacznie pomaga w odkrywaniu leków, poprawia odporność upraw i wyjaśnia szlaki metaboliczne roślin dla zrównoważonego rolnictwa i postępów w medycynie.
Nowatorski wkład badania
Badanie to podkreśla możliwości uczenia maszynowego w promowaniu bardziej precyzyjnych i wydajnych modeli do przewidywania wzorców strukturalnych białek w zbiorach danych biologicznych.
To badanie integruje nowe funkcje z algorytmami uczenia maszynowego, zwiększając ich zdolność do przewidywania funkcji białek z większą przejrzystością. Takie cechy pozwalają lepiej zrozumieć zależności między strukturą a funkcją białek, pomagając w bardziej precyzyjnym projektowaniu i optymalizacji białek w inżynierii białek.
Analiza wzbogacenia przewidywanych białek pomaga odkryć kluczowe szlaki biologiczne, procesy komórkowe i funkcje molekularne, dostarczając cennych celów do odkrywania biomarkerów, projektowania leków i zrozumienia mechanizmu choroby. Analiza ta zwiększa precyzję interwencji opartych na szlakach i identyfikacji celów terapeutycznych.