Metody obliczeniowe zrewolucjonizowały badania nad białkami, umożliwiając szczegółową analizę oraz tworzenie przewidywań dotyczących struktur, funkcji i oddziaływań białek. Precyzyjna identyfikacja i adnotacja funkcji białek są niezbędne do zrozumienia molekularnych mechanizmów życia i mają ogromne znaczenie dla postępów w medycynie oraz opracowywaniu leków. Jednakże przyrodzona złożoność i wysoki koszt metod eksperymentalnych ograniczają ich skalowalność w kontekście ogromnych zbiorów danych sekwencyjnych. W rezultacie opracowanie metod obliczeniowych do przewidywania funkcji białek stało się kluczowym obszarem biologii obliczeniowej i molekularnej, wypełniając tę lukę za pomocą innowacyjnych podejść na szeroką skalę1.
Wymiana domen 3D (3D domain swapping)2 jest zjawiskiem strukturalnym w białkach, w którym segmenty wspólnej struktury są wymieniane między poszczególnymi łańcuchami. W 1994 roku wstępna dokumentacja dotycząca mechanizmu wymiany domen 3D została odnaleziona w dimerze toksyny błoniczej3. Jednak podstawowe zasady wymiany domen 3D można wywieść z badań sprzed czterech dekad. Zaobserwowano, że rybonukleaza A z trzustki bydlęcej (RNase A) tworzy dimery podczas liofilizacji w kwasie octowym, co wykazano w ramach zaawansowanych eksperymentów z modyfikacjami chemicznymi4. W procesie oligomeryzacji białek dwa lub więcej łańcuchów białkowych wymienia identyczne elementy strukturalne poprzez elastyczne regiony zawiasowe. Część białka wymieniana między podjednostkami monomerycznymi nazywana jest domeną wymienioną, która w niektórych białkach może składać się z całej domeny globularnej, pętli lub elementu struktury drugorzędowej. Z kolei regiony, które pozostają niezmienione w swoich pierwotnych pozycjach w obrębie monomerów, określa się mianem domen niewymienionych5. Połączenie między domenami niewymienionymi definiuje się jako interfejs domen niewymienionych (NSDI), przedstawiony na Rysunku 1. W wymianie domen 3D relacja między domeną niewymienioną jednej podjednostki białkowej a już wymienioną domeną drugiej podjednostki nazywana jest interfejsem domeny wymienionej (SDI). Innym istotnym aspektem tego zjawiska jest region zawiasowy, czyli elastyczny segment łącznika, który łączy domeny niewymienione i wymienione. Region zawiasowy pełni kluczową funkcję, wspomagając ruch podczas wymiany domen 3D i służąc jako przełącznik konformacyjny, który umożliwia rekonfigurację strukturalną niezbędną do zajścia wymiany domen. Wymiana domen 3D jest zaangażowana w różne procesy biologiczne, w tym w składanie białek i regulację funkcjonalną5. Jest ona również powiązana z niektórymi chorobami wynikającymi z błędnego zwijania białek, gdzie aberracyjna wymiana może prowadzić do powstawania agregatów lub włókien amyloidowych.

Rysunek 1: Przedstawienie strukturalne wymiany domen 3D. Schemat ilustruje wymianę identycznych elementów strukturalnych między dwoma monomerami białkowymi za pośrednictwem elastycznego regionu zawiasowego, co prowadzi do powstania dimeru lub kompleksu oligomerycznego z wymianą domen Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tego rysunku.
W zależności od charakteru wymienionych domen oraz powstałych struktur oligomerycznych zidentyfikowano różne typy zamiany domen 3D6. W 2002 roku Eisenberg i współpracownicy wyróżnili trzy rodzaje zamiany domen 3D: właściwą zamianę domen (BDS), quasi-zamianę domen (QDS) oraz kandydata do zamiany domen 3D (CDS)7. Najpowszechniejszą klasą białek jest właściwa zamiana domen. Odnosi się ona do stanu, w którym zarówno cząsteczki dimeru, jak i monomeru występują w formie stabilnej, przy czym dimer przyjmuje konfigurację z zamienionymi domenami, natomiast monomer przyjmuje konfigurację zamkniętą. W przypadku quasi-zamiany domen wiadomo, że białko występuje w stanie oligomerycznym, lecz jego struktura homologiczna występuje w stanie monomerycznym. W przypadku CDS potwierdzono jedynie klasyfikację białka w kategoriach zamiany domen, podczas gdy informacje strukturalne o zaangażowanych monomerach lub ich monomerycznych homologach nie są dostępne8. W tej procedurze monomery lub ich monomeryczne homologi są nieobecne; zamiast nich występują heterologiczne cząsteczki białek. Tabela 1 przedstawia przykład tych trzech kategorii9.
Tabela 1: Rodzaje zamiany domen 3D wraz z przykładem. Kliknij tutaj, aby pobrać tę tabelę.
Kolejne badania ujawniły liczne struktury z zamianą domen, co utorowało drogę do zrozumienia koncepcji trójwymiarowej zamiany domen. Pierwsze dowody strukturalne potwierdzające to zjawisko zaobserwowano w cząsteczce białka represora Cro z bakteriofaga λ, która tworzy strukturę dimeryczną poprzez wymianę swoich nici C-końcowych. W 1996 roku badacz odkrył, że monomer cząsteczki Cro bierze udział w trójwymiarowej wymianie domen (domain swapping).10Inna struktura11takich jak βkrystalina B212, ludzkie CksHs213, katalaza z wątroby wołowej14oraz rekombinowaną ludzką interleukinę-515zgłoszono również jako możliwe struktury z wymianą domen 3D. W zależności od położenia wymienionej domeny w cząsteczkach białek, wymianę domen 3D kategoryzuje się na trzy typy: wymianę domeny C-końcowej, wymianę domeny N-końcowej oraz stosunkowo rzadką wymianę domeny centralnej. Autorzy wykorzystali kompletny ludzki genom do przewidywania przypadków wymiany domen. Jako klasyfikatory binarne zastosowano Random Forest oraz Support Vector Machine, które osiągnęły dokładność odpowiednio 81,7% i 73,9%. W ludzkim genomie niemal 44% sekwencji białkowych zostało przewidzianych jako struktury z wymianą domen 3D.6Przeprowadzono analizę wzbogacenia przewidywanych przypadków pod kątem rozkładu domen, rozkładu chorób oraz adnotacji funkcjonalnych w oparciu o ontologię genów (Gene Ontology, GO). Inne podejście bada pełną analizę całego genomu (Genome-Wide Analysis of *Ocimum tenuiforum* stosując podejście Random Forest, stwierdzono, że blisko 25% sekwencji białkowych u Ocimum tenuiforum wykazuje przewidywane zaangażowanie w zamianę domen 3D. Badacze przeprowadzili również adnotację funkcjonalną z wykorzystaniem powiązań z terminami GO oraz przynależności do rodzin domen białkowych, wykazując, że jedynie 1158 sekwencji było zaangażowanych w stres abiotyczny16.
Rośliny wykazują różnorodność charakterystycznych rodzin białek, wśród których niektóre specyficzne białka są znane z umiejętności przechodzenia reorganizacji strukturalnych, w tym trójwymiarowej wymiany domen (3D domain swapping). Trójwymiarowa wymiana domen może wpływać na reakcje na stres biotyczny i abiotyczny poprzez produkcję metabolitów wtórnych lub inne biologicznie istotne szlaki, które mają wiele zastosowań farmakologicznych; dlatego stanowią one istotny punkt skupienia niniejszego badania. Struktura krystaliczna Wal1 wykazała dimeryczną konfigurację z wymianą domen, charakteryzującą się obecnością dwóch dimerów w jednostce asymetrycznej oraz reorganizacją strukturalną spotykaną w cystatynie C. Fitocystatyny odgrywają istotną rolę w stresie abiotycznym, a także zwiększają odporność upraw. Na podstawie dostępnej literatury oraz z różnych odpowiednich repozytoriów zidentyfikowano łącznie 20 121 przewidywanych białek z trójwymiarową wymianą domen, z czego 17 552 pochodzi z roślin, a 2569 z organizmów niebędących roślinami17,18.
W literaturze opisano różne inne przykłady przewidywania zamiany domen 3D u różnych roślin z wykorzystaniem uczenia maszynowego. Przykładowo dla Arabidopsis thaliana wyniosło to 33,7% (4058 z 12 033 przeanalizowanych sekwencji), dla Medicago truncatula 20,9% (39 z 186 przeanalizowanych sekwencji), dla Solanum tuberosum 36,5% (146 z 400 przeanalizowanych sekwencji), dla Solanum lycopersicum 25,5% (108 z 423 przeanalizowanych sekwencji) oraz dla Ocimum tenuiforum 15,5% (5706 z 36 841 przeanalizowanych sekwencji)6. Metody obliczeniowe stały się nieocenione w badaniu aspektów strukturalnych i funkcjonalnych białek z zamianą domen 3D. Podejścia te ułatwiają przewidywanie sekwencji na podstawie najlepszych możliwych cech19, adnotację i analizę wzbogacenia, dostarczając wiedzy o podstawowych mechanizmach molekularnych. Przewidywanie zamiany domen 3D w różnych sekwencjach białkowych zrealizowano za pomocą klasyfikatora opartego na maszynach wektorów wspierających (SVM). Podejście to opracowano poprzez integrację cech sekwencyjnych i strukturalnych, co pozwoliło uzyskać dokładność przewidywań na poziomie 76,33% dla zbioru treningowego i 73,81% dla zbioru testowego, co wskazuje na jego potencjał w identyfikowaniu tendencji do zamiany domen w białkach20. Głównym powodem wyboru algorytmu KNN zamiast SVM jest znacznie prostszy proces uczenia w przypadku KNN. Wymaga on ustawienia tylko jednego głównego parametru, K (liczby najbliższych sąsiadów uwzględnianych podczas dokonywania przewidywania), podczas gdy SVM wymaga starnego dostrojenia kilku parametrów, takich jak typ jądra, C i gamma. Ponadto KNN łatwiej radzi sobie z klasyfikacją wieloklasową, podczas gdy SVM zazwyczaj wymaga bardziej złożonych strategii, takich jak strategie jeden-przeciw-jednemu.
Uczenie maszynowe w przewidywaniu struktury białek
Przewidywanie struktury białek polega na wnioskowaniu o trójwymiarowym kształcie białka na podstawie jego sekwencji FASTA. Niedawne postępy w tej dziedzinie były w znacznym stopniu napędzane przez zastosowanie różnych technik uczenia maszynowego do danych ewolucyjnych21,22. Wczesne podejścia do wyodrębniania informacji z danych koewolucyjnych opierały się na metodach uczenia maszynowego. Jednak nowsze strategie, w szczególności te wykorzystujące głębokie sieci rezdualne, wykazały wyższą skuteczność w przewidywaniu potencjalnych celów23. Alphafold jest bazą danych opartą na głębokim uczeniu, podczas gdy Rosetta jest narzędziem wykorzystującym funkcję energii opartą na prawach fizyki. Narzędzia te służą do przewidywania pełnej trójwymiarowej struktury atomowej, która może być zbliżona do struktur eksperymentalnych. Dostarczają one jedynie współrzędnych strukturalnych w rozdzielczości atomowej, ale nie określają zdarzeń zamiany domen 3D. W przeciwieństwie do nich, proponowane podejście nie jest pełnym predyktorem struktury 3D, lecz jedynie przewiduje, czy białko prawdopodobnie przejdzie proces zamiany domen 3D, czy nie24,25.
Rośliny lecznicze od wieków są wykorzystywane jako naturalne zasoby do zapobiegania i leczenia różnych chorób, co przypisuje się zawartym w nich związkom bioaktywnym. Odgrywają one kluczową rolę w medycynie tradycyjnej i przyczyniają się do opracowywania nowoczesnych leków farmaceutycznych. Niemniej jednak w dziedzinie zamiany domen białkowych u roślin leczniczych w celu poszukiwania nowych leków nie przeprowadzono dotychczas znaczących prac. Algorytmy, w tym uczenie maszynowe i ich modele zespołowe, rozpoznają wzorce i zależności w danych sekwencyjnych, aby przewidywać trójwymiarową (3D) zamianę domen. Powodem wyboru roślin leczniczych do niniejszego badania jest możliwość wykrycia różnorodności funkcjonalnej białek roślinnych biorących udział w 3D zamianie domen, co prowadzi do lepszego zrozumienia odpowiedzi na stres, obrony przed patogenami oraz biosyntezy metabolicznej. Wyzwania techniczne związane z określaniem 3D zamiany domen białkowych w dużych liczbach oraz w złożonych, zaawansowanych konformacjach oligomerycznych przy użyciu technik NMR lub krystalografii podkreślają konieczność opracowania zaawansowanych podejść obliczeniowych.
Ogólnym celem proponowanej pracy badawczej jest zastosowanie metodologii obliczeniowej z wykorzystaniem algorytmów Random Forest (RF)26 oraz K-nearest neighbor (KNN)27 do zadania przewidywania struktury sekwencji białkowych oraz przeprowadzenie pełnej analizy całogenomowej przypadków zamiany domen w sekwencjach różnych roślin leczniczych. Random Forest (RF) jest klasyfikatorem binarnym; jest to odporny i wszechstronny algorytm uczenia maszynowego szeroko stosowany w analizie sekwencji białkowych. Działa on poprzez konstrukcję zespołu drzew decyzyjnych (DT) i osiąga dość wysoką dokładność zarówno w zbiorach treningowych, jak i testowych. W zadaniach dotyczących sekwencji białkowych RF może analizować różnorodne cechy, w tym właściwości fizykochemiczne, skład sekwencji, strukturę drugorzędową oraz informacje ewolucyjne pochodzące z dopasowań lub profili sekwencji. Doskonale radzi sobie z dużymi, zaszumionymi zbiorami danych i dostarcza metryki istotności cech28. Klasyfikator K-Nearest Neighbors (KNN) to prosty, a zarazem skuteczny algorytm uczenia maszynowego szeroko stosowany w analizie sekwencji białkowych. Działa on poprzez klasyfikowanie sekwencji wejściowej na podstawie klasy większościowej jej k najbliższych sąsiadów w przestrzeni cech. W analizie sekwencji białkowych KNN może być wykorzystywany do przewidywania kategorii funkcjonalnych, właściwości strukturalnych i lokalizacji subkomórkowej. Cechy dla klasyfikacji KNN często obejmują skład aminokwasowy, motywy sekwencyjne, profile ewolucyjne lub atrybuty fizykochemiczne. KNN jest popularnym wyborem w analizie białek ze względu na swoją prostotę; interpretowalność i skuteczność czynią go cennym narzędziem w analizie sekwencji białkowych29. Razem algorytmy te zapewniają komplementarne zalety, umożliwiając stworzenie kompleksowych ram obliczeniowych do badania zamiany domen 3D w sekwencjach różnych roślin leczniczych. Te dwa modele przewidują jedynie możliwe przypadki, które mogą przejść proces zamiany domen; nie przewidują one pełnych współrzędnych strukturalnych 3D ani tego, która część lub reszta jest szczególnie zaangażowana w ten proces zamiany. Jest to kwestia dalszych badań, ponieważ identyfikacja konkretnych regionów lub reszt zaangażowanych w zamianę pozwoliłaby wyjaśnić mechanizmy i aspekty funkcjonalne zdarzeń zamiany domen 3D. Zamiana domen 3D obejmuje szereg strukturalnie odmiennych zjawisk, takich jak konfiguracje w pętli zamkniętej, zamiany otwarte oraz inne różnice, obejmujące różne regiony zawiasowe i architektury domen. W związku z tym sugerowane podejście kategoryzuje wszystkie rodzaje zdarzeń zamiany domen 3D w ramach jednolitej klasyfikacji. Wybór ten był początkowo podyktowany ograniczoną dostępnością adnotowanych danych, które mogłyby określić konkretną klasę zamiany domen 3D. Jest to pierwsza próba zastosowania tej metody w odniesieniu do zbiorów danych opartych na różnych roślinach leczniczych i uważamy, że rozróżnienie między różnymi mechanizmami zamiany mogłoby zwiększyć dokładność predykcyjną modelu.
Analiza wzbogacenia w roślinach leczniczych pomaga zidentyfikować kluczowe geny, białka i szlaki zaangażowane w syntezę związków bioaktywnych oraz odpowiedź na stres. Dostarcza ona wiedzy na temat mechanizmów molekularnych. Analizy te w roślinach leczniczych badają istotne geny, białka i procesy biologiczne powiązane z syntezą substancji chemicznych o działaniu biologicznym, odpornością na stres oraz odpornością na choroby. Adnotacja funkcjonalna wybranych białek, taka jak analiza ontologii genów (GO) i szlaków KEGG, ujawnia mechanizmy molekularne leżące u podstaw produkcji metabolitów wtórnych i reakcji na stres środowiskowy. Podejście to znacząco wspomaga proces odkrywania leków, poprawia odporność upraw oraz wyjaśnia szlaki metaboliczne roślin w celu rozwoju zrównoważonego rolnictwa i postępów w medycynie.
Nowe wkład badania
Niniejsze badanie podkreśla możliwości uczenia maszynowego w tworzeniu bardziej precyzyjnych i wydajnych modeli do przewidywania wzorców strukturalnych białek w zbiorach danych biologicznych.
Niniejsze badanie integruje nowe cechy z algorytmami uczenia maszynowego, zwiększając ich zdolność do przewidywania funkcji białek z większą precyzją. Cechy te zapewniają lepsze zrozumienie zależności między strukturą a funkcją białek, co wspomaga bardziej dokładne projektowanie i optymalizację białek w inżynierii białek.
Analiza wzbogacenia przewidywanych białek pomaga zidentyfikować kluczowe szlaki biologiczne, procesy komórkowe i funkcje molekularne, dostarczając cennych celów dla odkrywania biomarkerów, projektowania leków oraz zrozumienia mechanizmów chorób. Analiza ta zwiększa precyzję interwencji opartych na szlakach sygnałowych oraz identyfikacji celów terapeutycznych.