$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Вычислительные методы произвели революцию в исследованиях белков, позволив проводить детальный анализ и прогнозировать структуры, функции и взаимодействия белков. Точная идентификация и аннотация белковых функций имеют важное значение для разгадки молекулярных механизмов жизни и имеют огромное значение для прогресса в медицине и разработке лекарств. Тем не менее, присущая экспериментальным методам сложность и дороговизна ограничивают их масштабируемость для обработки больших данных последовательностей. В результате, разработка вычислительных методов для прогнозирования функции белка стала ключевой областью в вычислительной и молекулярной биологии, восполнив этот пробел с помощьюинновационных крупномасштабных подходов.
3D-обмен доменами2 — это структурное явление в белках, при котором сегменты общей структуры обмениваются между отдельными цепями. В 1994 году вводная документация о механизме подкачки 3D-доменов была обнаружена в димередифтерии 3 дифтерийного токсина. Тем не менее, основополагающие принципы 3D-подкачки доменов можно проследить уже четыре десятилетия назад. В ходесложных экспериментов по химической модификации было обнаружено, что рибонуклеаза А (РНКаза А) поджелудочной железы крупного рогатого скота образует димеры во время лиофилизации в уксусной кислоте. При олигомеризации белка две или более белковых цепей обмениваются идентичными структурными элементами через гибкие шарнирные области. Часть белка, обменивающаяся между мономерными субъединицами, называется поменявшимся доменом, который может состоять из целого глобулярного домена, петли или вторичного структурного элемента в определенных белках. И наоборот, области, которые остаются неизменными в своих исходных положениях внутри мономеров, называются непоменяемыми доменами5. Связь между неподставленными доменами определяется как непоменяемый доменный интерфейс (NSDI), показанный на рисунке 1. При обмене 3D-доменов отношение между непоменянным доменом одной белковой субъединицы и уже поменянным доменом другой субъединицы называется интерфейсом поменянного домена (SDI). Еще одним важным аспектом этого явления является шарнирная область, гибкий сегмент компоновщика, который соединяет непоменяемые и подменяемые местами домены. Эта шарнирная область играет важную роль, помогая движению 3D-переключения доменов, и служит конформационным переключателем, позволяющим структурную реконфигурацию, необходимую для переключения доменов. 3D-обмен доменами был вовлечен в различные биологические процессы, включая сборку белка и функциональную регуляцию5. Это также связано с некоторыми заболеваниями неправильного сворачивания белка, когда аберрантный обмен может привести к образованию агрегатов или амилоидных фибрилл.

Рисунок 1: Структурное представление 3D-переключения доменов. Изображение иллюстрирует обмен идентичными структурными элементами между двумя белковыми мономерами через гибкую шарнирную область, что приводит к образованию димерной или олигомерной сборки с обменом доменов.
Различные типы подкачки 3D-доменов были идентифицированы в зависимости от природы поменянных доменов и результирующих олигомерных структур6. В 2002 году Айзенберг и его коллега определили три типа 3D-подкачки доменов: добросовестная подкачка доменов (BDS), квази-подкачка доменов (QDS) и кандидат на 3D-подкачку доменов (CDS)7. Наиболее распространенным классом белков является добросовестная замена доменов. Это относится к состоянию, в котором молекулы димера и мономера присутствуют в стабильной форме, где предполагается, что димер принимает конфигурацию со сменой доменов, в то время как мономер должен принимать закрытую конфигурацию. Известно, что при квазиобмене доменами белок присутствует в олигомерном состоянии, но известно, что его гомологичная структура присутствует в мономерном состоянии. В CDS он только подтверждает классификацию белков по категориям со сменой доменов, в то время как структурная информация о вовлеченных мономерах или их мономерных гомологах отсутствует8. При этой процедуре мономеры или их мономерные гомологи отсутствуют; скорее, присутствуют гетерологичные белковые молекулы. В таблице 1 приведен пример этих трех категорий9.
Таблица 1: Виды 3D подкачки доменов с примером. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Последующие исследования выявили множество структур с переключением доменов, проложив путь к пониманию концепции 3D-переключения доменов. Самые ранние структурные доказательства, подтверждающие это явление, наблюдались в молекуле белка-репрессора Cro из бактериофага λ, который образует димерную структуру в результате обмена своими С-концевыми цепями. В 1996 году исследователи обнаружили, что мономерная молекула Cro участвует в 3D-обмене доменов10. Другие структуры11, такие как βB2-кристаллин12, человеческий CksHs213, каталаза говяжьей печени14 и рекомбинантный человеческий интерлейкин-515, также были зарегистрированы как возможные 3D-структуры с переключением доменов. Основываясь на положении поменянных доменов в молекулах белка, 3D-обмен доменами подразделяется на три типа: С-концевой обмен доменами, N-концевой обмен доменами и относительно редкий обмен центральными доменами. Авторы используют полный геном человека для прогнозирования случая замены домена. Они используют Random Forest и Support Vector Machine в качестве двоичных классификаторов с точностью 81,7% и 73,9% соответственно. Почти 44% последовательности белка было предсказано как 3D-обмен доменами в геноме человека. Анализ обогащения проводился по прогнозируемым случаям их доменного распределения, распространения заболевания и функциональной аннотации на основе онтологии генов (ГО). Другой подход исследует полный полногеномный анализ Ocimum tenuiforum с использованием подхода Random Forest и обнаружил, что почти 25% белковых последовательностей в Ocimum tenuiforum, как предполагается, участвуют в 3D-обмене доменами. Исследователи также выполнили функциональную аннотацию, используя ассоциацию терминов GO и их ассоциацию семейства белковых доменов, и обнаружили, что только 1158 последовательностей были вовлечены в абиотический стресс.
Растения демонстрируют множество отличительных семейств белков, при этом специфические белки обладают способностью претерпевать структурные перестройки, включая 3D-обмен доменами. 3D-переключение доменов может влиять на биотические и абиотические стрессовые условия с выработкой вторичных метаболитов или других биологически значимых путей, которые имеют несколько фармакологических применений; Таким образом, они обеспечивают значительное внимание для данного исследования. Кристаллическая структура Wal1 продемонстрировала димерную конфигурацию со сменой доменов, включающую два димера в асимметричной единице и структурную перегруппировку, обнаруженную в цистатине C. Фитоцистатины играют значительную роль в абиотическом стрессе, а также повышают устойчивость сельскохозяйственных культур. В общей сложности 20 121 предсказанный 3D-белок с обменом доменами был идентифицирован из доступной литературы и из различных соответствующих репозиториев, из которых 17 552 имеют растительное происхождение и 2569 — из нерастительныхорганизмов.
В литературе сообщалось о различных других примерах 3D-прогнозирования переключения доменов для различных растений с использованием подхода машинного обучения. Например, Arabidopsis thaliana с 33,7% (4058 из 12 033 рассмотренных последовательностей), Medicago truncatula 20,9% (39 из 186 рассмотренных последовательностей), Solanum tuberosum 36,5% (146 из 400 рассмотренных последовательностей), Solanum lycopersicum 25,5% (108 из 423 рассмотренных последовательностей) и Ocimum tenuiforum 15,5% (5706 из 36841 рассмотренных последовательностей)6. Вычислительные методы стали бесценными в изучении структурных и функциональных аспектов 3D-белков со сменой доменов. Эти подходы облегчают прогнозирование последовательностей на основе наилучших возможных признаков19, аннотации и анализа обогащения, предлагая понимание фундаментальных молекулярных механизмов. Прогнозирование 3D-подкачки доменов в различных белковых последовательностях было выполнено с помощью классификатора на основе метода опорных векторов (SVM). Этот подход был разработан путем интеграции последовательностей и структурных особенностей, что дало точность прогнозирования 76,33% на обучающем наборе данных и 73,81% на тестовом наборе данных, что указывает на его потенциал в выявлении тенденций к замене доменов в белках20. Основная причина выбора KNN вместо SVM заключается в том, что у KNN гораздо более простой процесс обучения. Для этого требуется задать только один основной параметр, K (это число ближайших соседей, учитываемое при прогнозировании), в то время как SVM требует тщательной настройки нескольких параметров, таких как тип ядра, C и гамма. Кроме того, KNN легче справляется с многоклассовой классификацией, в то время как SVM обычно требует более сложных стратегий, таких как стратегии «один на один».
Машинное обучение для прогнозирования структуры белка
Предсказание структуры белка включает в себя вывод трехмерной формы белка из его последовательности FASTA. Последние достижения в этой области в значительной степени обусловлены применением различных методов машинного обучения к эволюционным данным21,22. Ранние подходы к извлечению информации из коэволюционных данных опирались на методы машинного обучения. Тем не менее, более поздние стратегии, особенно те, которые используют глубокие сети остаточного действия, продемонстрировали превосходную эффективность в прогнозировании потенциальной цели23. Alphafold — это база данных, основанная на глубоком обучении, в то время как Rosetta — это инструмент для работы с энергетическими функциями, основанный на физике. Эти инструменты используются для прогнозирования полной трехмерной структуры атома, которая может быть приближена к экспериментальным структурам. Они предоставляют только структурные координаты с атомарным разрешением, но эти инструменты не указывают события 3D-переключения доменов. В отличие от этого, предлагаемый подход не является полноценным предиктором 3D-структуры, он только предсказывает, может ли белок подвергнуться 3D-обмену доменов или нет24,25.
Лекарственные растения веками использовались в качестве природных ресурсов для профилактики и лечения различных заболеваний, связанных с их биологически активными соединениями. Они незаменимы в народной медицине и способствуют разработке современных фармацевтических препаратов. Тем не менее, не было проведено существенной работы в области замены белковых доменов лекарственных растений для открытия лекарств. Алгоритмы, в том числе машинное обучение и их ансамблевые модели, распознают шаблоны и отношения в данных последовательностей для прогнозирования 3D-замены доменов. Причина выбора лекарственных растений для этого исследования заключается в том, что оно может обнаружить функциональное разнообразие белка в растениях, участвующих в 3D-обмене доменами, что приводит к пониманию реакции на стресс, защиты патогенов и метаболического биосинтеза. Технические проблемы, связанные с определением обмена 3D-доменами белка в больших количествах и сложных, усовершенствованных олигомерных конформаций с использованием методов ЯМР или кристаллографии, подчеркивают необходимость разработки передовых вычислительных подходов.
Общая цель предлагаемой исследовательской работы заключается в использовании вычислительной методологии с использованием алгоритмов Random Forest (RF)26 и K-ближайшего соседа (KNN)27 для задачи прогнозирования структуры белковых последовательностей и полного полногеномного анализа поменянных местами случаев в различных последовательностях лекарственных растений. Случайный лес (RF) — это двоичный классификатор; Это надежный и универсальный алгоритм машинного обучения, широко используемый в анализе последовательностей белков. Он работает путем построения ансамбля деревьев решений (DT) и достигает довольно высокой точности как в обучающем, так и в тестовом наборах данных. Для задач с белковыми последовательностями RF может анализировать различные характеристики, включая физико-химические свойства, состав последовательности, вторичную структуру и эволюционную информацию, полученную из выравниваний или профилей последовательностей. Он отлично справляется с большими зашумленными наборами данных и предоставляет метрики важности функций28. Классификатор K-ближайших соседей (KNN) — это простой, но эффективный алгоритм машинного обучения, широко применяемый в анализе белковых последовательностей. Он классифицирует входную последовательность на основе класса большинства ее k ближайших соседей в пространстве признаков. В анализе белковых последовательностей KNN может быть использован для прогнозирования функциональных категорий, структурных свойств и субклеточной локализации. Особенности классификации KNN часто включают аминокислотный состав, мотивы последовательностей, эволюционные профили или физико-химические атрибуты. KNN является популярным выбором для анализа белка из-за своей простоты; Интерпретируемость и эффективность делают его ценным инструментом для анализа последовательностей белков29. Вместе эти алгоритмы обеспечивают взаимодополняющие преимущества, позволяя создать всестороннюю вычислительную основу для изучения 3D-замены доменов в различных последовательностях лекарственных растений. Эти две модели предсказывают только возможные случаи, которые могут подвергнуться подмене доменов; он не предсказывает полные 3D-структурные координаты или то, какая часть или остаток особенно вовлечены в этот процесс замены. Это вопрос дальнейших исследований, поскольку идентификация конкретных областей или остатков, которые участвуют в подкачке для уточнения механизма и функциональных аспектов 3D-подкачки доменов events.3D подкачка доменов включает в себя множество структурно различных явлений, таких как конфигурации замкнутого цикла, открытые подкачки и другие различия, которые включают в себя различные шарнирные области и доменные архитектуры. В свете этого предлагаемый подход классифицирует только все виды событий 3D-переключения доменов в рамках единой классификации. Этот выбор изначально был обусловлен ограниченной доступностью аннотированных данных, которые могут указывать на определенный класс 3D-переключения доменов. Это первый вид попыток работы с различными наборами данных о лекарственных растениях, и мы считаем, что различение различных механизмов подкачки может повысить точность прогнозирования модели.
Анализ обогащения лекарственных растений помогает определить ключевые гены, белки и пути, участвующие в синтезе биологически активных соединений и реакции на стресс. Это дает представление о молекулярных механизмах. Эти анализы на лекарственных растениях исследуют основные гены, белки и биологические процессы, связанные с синтезом биологически активных химических веществ, стрессоустойчивостью и устойчивостью к болезням. Функциональная аннотация выбранных белков, такая как Gene Ontology (GO) и анализ путей KEGG, раскрывает молекулярные механизмы, лежащие в основе производства вторичных метаболитов и реакций окружающей среды на стресс. Этот подход существенно помогает в разработке лекарств, повышает устойчивость сельскохозяйственных культур и выясняет метаболические пути растений для устойчивого сельского хозяйства и медицинских достижений.
Новый вклад исследования
В этом исследовании подчеркиваются возможности машинного обучения для продвижения более точных и эффективных моделей для прогнозирования структурных паттернов белков в биологических наборах данных.
Это исследование интегрирует новые функции в алгоритмы машинного обучения, улучшая их способность предсказывать функции белка с большей ясностью. Такие особенности обеспечивают более глубокое понимание структурно-функциональных отношений белков, способствуя более точному дизайну белков и оптимизации белковой инженерии.
Анализ обогащения предсказанных белков помогает выяснить ключевые биологические пути, клеточные процессы и молекулярные функции, обеспечивающие ценные мишени для открытия биомаркеров, разработки лекарств и понимания механизма заболевания. Этот анализ повышает точность вмешательств, основанных на путях, и идентификации терапевтических мишеней.