Методическая статья

Машинное обучение прогнозирования 3D-переключения белков в лекарственных растениях

DOI:

10.3791/68519

15 августа 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании изучаются белки, участвующие или предположительно участвующие в 3D-обмене доменами из различных геномов лекарственных растений. Он использует модели машинного обучения для точного прогнозирования 3D-белков с переключением доменов и прогнозирования их функций и значимости для производства вторичных метаболитов.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

3D-обмен доменами — это структурное явление белка, при котором две или более белковых субъединиц обмениваются идентичными структурными субъединицами и образуют олигомеры. Белки, которые демонстрируют 3D-переключение доменов, играют решающую роль в различных биологических функциях, таких как вторичный биосинтез метаболитов, а также в преодолении нескольких биотических и абиотических стрессов у лекарственных растений. В этом исследовании изучается возможность прогнозирования 3D-моделей обмена доменами среди геномов лекарственных растений с использованием моделей классификаторов случайного леса и K-ближайшего соседа, демонстрируя точность 91,6% и 88,7% соответственно. В общей сложности 420 (31%) последовательностей были предположительно вовлечены в 3D-обмен доменами. Также было проведено исследование обогащения предсказанных 3D-последовательностей белков с заменой доменов из различных лекарственных растений для аннотации функций на основе терминов онтологии генов (GO), анализа путей Киотской энциклопедии генов и геномов (KEGG) и их распределения доменов в путях биосинтеза вторичных метаболитов. Функциональная аннотация предсказанных последовательностей позволяет сделать вывод о том, что 3D-последовательности с заменой доменов участвуют в различных молекулярных функциях, таких как фотосинтетический транспорт электронов в фотосистеме II и переносчики электронов, перенос электронов в циклическом пути переноса электронов фотосинтеза, окислительное фосфорилирование и генная регуляция стрессов окружающей среды (биотических и абиотических) путем синтеза вторичных метаболитов (терпеноидов, алкалоиды и полиамины). Эти результаты подчеркивают способность машинного обучения предсказывать участие белков в феномене 3D-переключения доменов, их соответствующие функции и их потенциал для содействия разработке лекарств и биоинженерным инициативам.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Вычислительные методы произвели революцию в исследованиях белков, позволив проводить детальный анализ и прогнозировать структуры, функции и взаимодействия белков. Точная идентификация и аннотация белковых функций имеют важное значение для разгадки молекулярных механизмов жизни и имеют огромное значение для прогресса в медицине и разработке лекарств. Тем не менее, присущая экспериментальным методам сложность и дороговизна ограничивают их масштабируемость для обработки больших данных последовательностей. В результате, разработка вычислительных методов для прогнозирования функции белка стала ключевой областью в вычислительной и молекулярной биологии, восполнив этот пробел с помощьюинновационных крупномасштабных подходов.

3D-обмен доменами2 — это структурное явление в белках, при котором сегменты общей структуры обмениваются между отдельными цепями. В 1994 году вводная документация о механизме подкачки 3D-доменов была обнаружена в димередифтерии 3 дифтерийного токсина. Тем не менее, основополагающие принципы 3D-подкачки доменов можно проследить уже четыре десятилетия назад. В ходесложных экспериментов по химической модификации было обнаружено, что рибонуклеаза А (РНКаза А) поджелудочной железы крупного рогатого скота образует димеры во время лиофилизации в уксусной кислоте. При олигомеризации белка две или более белковых цепей обмениваются идентичными структурными элементами через гибкие шарнирные области. Часть белка, обменивающаяся между мономерными субъединицами, называется поменявшимся доменом, который может состоять из целого глобулярного домена, петли или вторичного структурного элемента в определенных белках. И наоборот, области, которые остаются неизменными в своих исходных положениях внутри мономеров, называются непоменяемыми доменами5. Связь между неподставленными доменами определяется как непоменяемый доменный интерфейс (NSDI), показанный на рисунке 1. При обмене 3D-доменов отношение между непоменянным доменом одной белковой субъединицы и уже поменянным доменом другой субъединицы называется интерфейсом поменянного домена (SDI). Еще одним важным аспектом этого явления является шарнирная область, гибкий сегмент компоновщика, который соединяет непоменяемые и подменяемые местами домены. Эта шарнирная область играет важную роль, помогая движению 3D-переключения доменов, и служит конформационным переключателем, позволяющим структурную реконфигурацию, необходимую для переключения доменов. 3D-обмен доменами был вовлечен в различные биологические процессы, включая сборку белка и функциональную регуляцию5. Это также связано с некоторыми заболеваниями неправильного сворачивания белка, когда аберрантный обмен может привести к образованию агрегатов или амилоидных фибрилл.

figure-introduction-1
Рисунок 1: Структурное представление 3D-переключения доменов. Изображение иллюстрирует обмен идентичными структурными элементами между двумя белковыми мономерами через гибкую шарнирную область, что приводит к образованию димерной или олигомерной сборки с обменом доменов.

Различные типы подкачки 3D-доменов были идентифицированы в зависимости от природы поменянных доменов и результирующих олигомерных структур6. В 2002 году Айзенберг и его коллега определили три типа 3D-подкачки доменов: добросовестная подкачка доменов (BDS), квази-подкачка доменов (QDS) и кандидат на 3D-подкачку доменов (CDS)7. Наиболее распространенным классом белков является добросовестная замена доменов. Это относится к состоянию, в котором молекулы димера и мономера присутствуют в стабильной форме, где предполагается, что димер принимает конфигурацию со сменой доменов, в то время как мономер должен принимать закрытую конфигурацию. Известно, что при квазиобмене доменами белок присутствует в олигомерном состоянии, но известно, что его гомологичная структура присутствует в мономерном состоянии. В CDS он только подтверждает классификацию белков по категориям со сменой доменов, в то время как структурная информация о вовлеченных мономерах или их мономерных гомологах отсутствует8. При этой процедуре мономеры или их мономерные гомологи отсутствуют; скорее, присутствуют гетерологичные белковые молекулы. В таблице 1 приведен пример этих трех категорий9.

Таблица 1: Виды 3D подкачки доменов с примером. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

Последующие исследования выявили множество структур с переключением доменов, проложив путь к пониманию концепции 3D-переключения доменов. Самые ранние структурные доказательства, подтверждающие это явление, наблюдались в молекуле белка-репрессора Cro из бактериофага λ, который образует димерную структуру в результате обмена своими С-концевыми цепями. В 1996 году исследователи обнаружили, что мономерная молекула Cro участвует в 3D-обмене доменов10. Другие структуры11, такие как βB2-кристаллин12, человеческий CksHs213, каталаза говяжьей печени14 и рекомбинантный человеческий интерлейкин-515, также были зарегистрированы как возможные 3D-структуры с переключением доменов. Основываясь на положении поменянных доменов в молекулах белка, 3D-обмен доменами подразделяется на три типа: С-концевой обмен доменами, N-концевой обмен доменами и относительно редкий обмен центральными доменами. Авторы используют полный геном человека для прогнозирования случая замены домена. Они используют Random Forest и Support Vector Machine в качестве двоичных классификаторов с точностью 81,7% и 73,9% соответственно. Почти 44% последовательности белка было предсказано как 3D-обмен доменами в геноме человека. Анализ обогащения проводился по прогнозируемым случаям их доменного распределения, распространения заболевания и функциональной аннотации на основе онтологии генов (ГО). Другой подход исследует полный полногеномный анализ Ocimum tenuiforum с использованием подхода Random Forest и обнаружил, что почти 25% белковых последовательностей в Ocimum tenuiforum, как предполагается, участвуют в 3D-обмене доменами. Исследователи также выполнили функциональную аннотацию, используя ассоциацию терминов GO и их ассоциацию семейства белковых доменов, и обнаружили, что только 1158 последовательностей были вовлечены в абиотический стресс.

Растения демонстрируют множество отличительных семейств белков, при этом специфические белки обладают способностью претерпевать структурные перестройки, включая 3D-обмен доменами. 3D-переключение доменов может влиять на биотические и абиотические стрессовые условия с выработкой вторичных метаболитов или других биологически значимых путей, которые имеют несколько фармакологических применений; Таким образом, они обеспечивают значительное внимание для данного исследования. Кристаллическая структура Wal1 продемонстрировала димерную конфигурацию со сменой доменов, включающую два димера в асимметричной единице и структурную перегруппировку, обнаруженную в цистатине C. Фитоцистатины играют значительную роль в абиотическом стрессе, а также повышают устойчивость сельскохозяйственных культур. В общей сложности 20 121 предсказанный 3D-белок с обменом доменами был идентифицирован из доступной литературы и из различных соответствующих репозиториев, из которых 17 552 имеют растительное происхождение и 2569 — из нерастительныхорганизмов.

В литературе сообщалось о различных других примерах 3D-прогнозирования переключения доменов для различных растений с использованием подхода машинного обучения. Например, Arabidopsis thaliana с 33,7% (4058 из 12 033 рассмотренных последовательностей), Medicago truncatula 20,9% (39 из 186 рассмотренных последовательностей), Solanum tuberosum 36,5% (146 из 400 рассмотренных последовательностей), Solanum lycopersicum 25,5% (108 из 423 рассмотренных последовательностей) и Ocimum tenuiforum 15,5% (5706 из 36841 рассмотренных последовательностей)6. Вычислительные методы стали бесценными в изучении структурных и функциональных аспектов 3D-белков со сменой доменов. Эти подходы облегчают прогнозирование последовательностей на основе наилучших возможных признаков19, аннотации и анализа обогащения, предлагая понимание фундаментальных молекулярных механизмов. Прогнозирование 3D-подкачки доменов в различных белковых последовательностях было выполнено с помощью классификатора на основе метода опорных векторов (SVM). Этот подход был разработан путем интеграции последовательностей и структурных особенностей, что дало точность прогнозирования 76,33% на обучающем наборе данных и 73,81% на тестовом наборе данных, что указывает на его потенциал в выявлении тенденций к замене доменов в белках20. Основная причина выбора KNN вместо SVM заключается в том, что у KNN гораздо более простой процесс обучения. Для этого требуется задать только один основной параметр, K (это число ближайших соседей, учитываемое при прогнозировании), в то время как SVM требует тщательной настройки нескольких параметров, таких как тип ядра, C и гамма. Кроме того, KNN легче справляется с многоклассовой классификацией, в то время как SVM обычно требует более сложных стратегий, таких как стратегии «один на один».

Машинное обучение для прогнозирования структуры белка
Предсказание структуры белка включает в себя вывод трехмерной формы белка из его последовательности FASTA. Последние достижения в этой области в значительной степени обусловлены применением различных методов машинного обучения к эволюционным данным21,22. Ранние подходы к извлечению информации из коэволюционных данных опирались на методы машинного обучения. Тем не менее, более поздние стратегии, особенно те, которые используют глубокие сети остаточного действия, продемонстрировали превосходную эффективность в прогнозировании потенциальной цели23. Alphafold — это база данных, основанная на глубоком обучении, в то время как Rosetta — это инструмент для работы с энергетическими функциями, основанный на физике. Эти инструменты используются для прогнозирования полной трехмерной структуры атома, которая может быть приближена к экспериментальным структурам. Они предоставляют только структурные координаты с атомарным разрешением, но эти инструменты не указывают события 3D-переключения доменов. В отличие от этого, предлагаемый подход не является полноценным предиктором 3D-структуры, он только предсказывает, может ли белок подвергнуться 3D-обмену доменов или нет24,25.

Лекарственные растения веками использовались в качестве природных ресурсов для профилактики и лечения различных заболеваний, связанных с их биологически активными соединениями. Они незаменимы в народной медицине и способствуют разработке современных фармацевтических препаратов. Тем не менее, не было проведено существенной работы в области замены белковых доменов лекарственных растений для открытия лекарств. Алгоритмы, в том числе машинное обучение и их ансамблевые модели, распознают шаблоны и отношения в данных последовательностей для прогнозирования 3D-замены доменов. Причина выбора лекарственных растений для этого исследования заключается в том, что оно может обнаружить функциональное разнообразие белка в растениях, участвующих в 3D-обмене доменами, что приводит к пониманию реакции на стресс, защиты патогенов и метаболического биосинтеза. Технические проблемы, связанные с определением обмена 3D-доменами белка в больших количествах и сложных, усовершенствованных олигомерных конформаций с использованием методов ЯМР или кристаллографии, подчеркивают необходимость разработки передовых вычислительных подходов.

Общая цель предлагаемой исследовательской работы заключается в использовании вычислительной методологии с использованием алгоритмов Random Forest (RF)26 и K-ближайшего соседа (KNN)27 для задачи прогнозирования структуры белковых последовательностей и полного полногеномного анализа поменянных местами случаев в различных последовательностях лекарственных растений. Случайный лес (RF) — это двоичный классификатор; Это надежный и универсальный алгоритм машинного обучения, широко используемый в анализе последовательностей белков. Он работает путем построения ансамбля деревьев решений (DT) и достигает довольно высокой точности как в обучающем, так и в тестовом наборах данных. Для задач с белковыми последовательностями RF может анализировать различные характеристики, включая физико-химические свойства, состав последовательности, вторичную структуру и эволюционную информацию, полученную из выравниваний или профилей последовательностей. Он отлично справляется с большими зашумленными наборами данных и предоставляет метрики важности функций28. Классификатор K-ближайших соседей (KNN) — это простой, но эффективный алгоритм машинного обучения, широко применяемый в анализе белковых последовательностей. Он классифицирует входную последовательность на основе класса большинства ее k ближайших соседей в пространстве признаков. В анализе белковых последовательностей KNN может быть использован для прогнозирования функциональных категорий, структурных свойств и субклеточной локализации. Особенности классификации KNN часто включают аминокислотный состав, мотивы последовательностей, эволюционные профили или физико-химические атрибуты. KNN является популярным выбором для анализа белка из-за своей простоты; Интерпретируемость и эффективность делают его ценным инструментом для анализа последовательностей белков29. Вместе эти алгоритмы обеспечивают взаимодополняющие преимущества, позволяя создать всестороннюю вычислительную основу для изучения 3D-замены доменов в различных последовательностях лекарственных растений. Эти две модели предсказывают только возможные случаи, которые могут подвергнуться подмене доменов; он не предсказывает полные 3D-структурные координаты или то, какая часть или остаток особенно вовлечены в этот процесс замены. Это вопрос дальнейших исследований, поскольку идентификация конкретных областей или остатков, которые участвуют в подкачке для уточнения механизма и функциональных аспектов 3D-подкачки доменов events.3D подкачка доменов включает в себя множество структурно различных явлений, таких как конфигурации замкнутого цикла, открытые подкачки и другие различия, которые включают в себя различные шарнирные области и доменные архитектуры. В свете этого предлагаемый подход классифицирует только все виды событий 3D-переключения доменов в рамках единой классификации. Этот выбор изначально был обусловлен ограниченной доступностью аннотированных данных, которые могут указывать на определенный класс 3D-переключения доменов. Это первый вид попыток работы с различными наборами данных о лекарственных растениях, и мы считаем, что различение различных механизмов подкачки может повысить точность прогнозирования модели.

Анализ обогащения лекарственных растений помогает определить ключевые гены, белки и пути, участвующие в синтезе биологически активных соединений и реакции на стресс. Это дает представление о молекулярных механизмах. Эти анализы на лекарственных растениях исследуют основные гены, белки и биологические процессы, связанные с синтезом биологически активных химических веществ, стрессоустойчивостью и устойчивостью к болезням. Функциональная аннотация выбранных белков, такая как Gene Ontology (GO) и анализ путей KEGG, раскрывает молекулярные механизмы, лежащие в основе производства вторичных метаболитов и реакций окружающей среды на стресс. Этот подход существенно помогает в разработке лекарств, повышает устойчивость сельскохозяйственных культур и выясняет метаболические пути растений для устойчивого сельского хозяйства и медицинских достижений.

Новый вклад исследования
В этом исследовании подчеркиваются возможности машинного обучения для продвижения более точных и эффективных моделей для прогнозирования структурных паттернов белков в биологических наборах данных.

Это исследование интегрирует новые функции в алгоритмы машинного обучения, улучшая их способность предсказывать функции белка с большей ясностью. Такие особенности обеспечивают более глубокое понимание структурно-функциональных отношений белков, способствуя более точному дизайну белков и оптимизации белковой инженерии.

Анализ обогащения предсказанных белков помогает выяснить ключевые биологические пути, клеточные процессы и молекулярные функции, обеспечивающие ценные мишени для открытия биомаркеров, разработки лекарств и понимания механизма заболевания. Этот анализ повышает точность вмешательств, основанных на путях, и идентификации терапевтических мишеней.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ПРИМЕЧАНИЕ: Этот сегмент представляет собой всестороннее описание предлагаемой методологии, которая включает в себя шесть основных этапов: (a) сбор данных, (b) выбор признаков, (c) предварительная обработка данных, (d) постобработка данных, (e) разработка модели, (f) оценка результатов предлагаемой модели и (g) анализ обогащения на различных уровнях положительно прогнозируемых последовательностей. Core i5-10500 — это процессор 10-го поколения, который использовался в этой исследовательской работе. Он имеет шесть ядер и 12 потоков, с базовой частотой 3,10 ГГц и максимальной турбо-скоростью 4,50 ГГц. Он оснащен 12 МБ кэш-памяти Intel Smart Cache, поддерживает память DDR4-2666 и включает в себя графику UHD Graphics 630 для встроенных визуальных эффектов. Созданный для эффективной многозадачности и производительности, он совместим с сокетом LGA 1200 и работает с TDP 65 Вт.

1. Сбор данных

  1. Use3d3dswap-pred (https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) и 3DSwap+ (https://caps.ncbs.res.in/3Dswapplus/index.html)3030 Дополнительная таблица 1, Дополнительная таблица 2, Дополнительный файл 1, Дополнительный файл 2). Используйте в общей сложности 573 отобранные вручную PDB-записи 3D-молекул с заменой доменов, в основном из лекарственных растений.
  2. Используйте метод наилучшего репрезентативного профиля (BRP) для построения негативного набора данных, назначив наилучшую репрезентативную последовательность (BRS) каждому семейству белков Pfam31 (http://pfam.xfam.org/). Выполните поиск в общей сложности 10 112 структурных последовательностей по всем BRP Pfam с использованием HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/) с пороговым значением E 0,001. Обработайте результирующую последовательность с помощью DIAL для идентификации структурных доменов(https://bioinformaticshome.com/db/tool/DIAL). Включите 575 записей PDB в качестве отрицательного набора данных (обучения).
  3. Включите 314 белковых последовательностей, полученных с помощью метода BRP, и 261 отобранную вручную последовательность без 3D-замены доменов, идентифицированных 3DSwap+ как отрицательный набор данных.
  4. Получите в общей сложности 1 355 рассмотренных записей белковых последовательностей из различных лекарственных растений из UniProt33 (https://www.uniprot.org/). Включите в это исследование 13 лекарственных растений (набор данных для тестирования/прогнозирования): Citrus sinensis (RS-102), Vitis vinifera (RS-226), Mentha (RS-28), Cannabis sativa (RS-21), Acorus clamus (RS-511), Coffea arabica (RS-104), Papaver somniferum (RS-58), Гибискус (RS-88), Жасмин (RS-89), Тимьян (RS-30), Тимус (RS-14), Illicium oligandrum (RS-72) и Цитрусовый лимон (RS-12). Филогенетическое дерево представлено на дополнительном рисунке 1.

2. Использование функции для создания модели

  1. Используйте полный набор функций, состоящий из 453 признаков, для прогнозирования последовательностей белков в лекарственных растениях. Включает в себя 439 установленных полнометражных фильмов и 16 новых полнометражных фильмов, тщательно отобранных на основе тщательного обзора литературы.
  2. Используйте базу данных AAindex34(https://www.genome.jp/aaindex/) для определения физико-химических свойств аминокислот. Используйте платформу машинного обучения WEKA35 (https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/) для выбора функций. В таблице 2 приведены новые включенные функции.

Таблица 2: Список вновь добавленных функций вместе с их описанием. В этой таблице перечислены новые функции, разработанные на этапе извлечения признаков для повышения производительности модели при прогнозировании 3D-переключения доменов. Каждый признак отражает конкретные последовательные, физико-химические или структурные свойства белков, которые, как предполагается, влияют на их склонность к обмену доменами. Подробные описания предоставляются для уточнения биологической релевантности и вычислительной выдачи каждого признака. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

3. Предварительная и последующая обработка данных

ПРИМЕЧАНИЕ: Предварительная обработка данных. Предварительная обработка данных — это важный этап машинного обучения, который включает в себя подготовку необработанных данных для анализа. Это включает в себя очистку данных (например, удаление дубликатов, обработку отсутствующих значений и т. д.).

  1. Используйте Файл дополнительного кодирования 1 для кодирования категориальных переменных в числовую форму, которая включает в себя четыре основных шага: (1) Определение словарей оценки, (2) обработка последовательности fasta по последовательности I0. синтаксический анализ, (3) создание фрейма данных, (4) численный анализ 3D-объектов с переключением доменов.
  2. Уточняйте и интерпретируйте выходные данные модели с помощью постобработки данных. Повторная калибровка прогнозов, агрегирование результатов и применение порогового значения для классификации. Классификация бимодального набора данных для 3D переключения доменов с использованием порогового значения β = 0,5 (диапазон 0-1), что подтверждается предыдущими исследованиями 36,37,38.
  3. Разделите набор данных в соотношении 70:30, выделив 70 % для обучения модели и 30 % для независимой оценки.
  4. Стандартизируйте обучающие данные с помощью метода Standard Scaler, чтобы скорректировать значения признаков до среднего значения 0 и стандартного отклонения 1, обеспечивая лучшую совместимость с оценками машинного обучения. Проведите выбор функций, чтобы определить наиболее важные переменные.
    ПРИМЕЧАНИЕ: Стандартизация набора данных является широко используемым предварительным условием для многих алгоритмов машинного обучения для обеспечения оптимальной производительности. Распределение данных, которое далеко от нормального, может негативно сказаться на производительности моделей машинного обучения39.
  5. Проведите валидацию. Для обеспечения надежной и несмещенной оценки модели также была реализована K-кратная перекрестная валидация (Дополнительная таблица 3).
  6. Разделите набор данных на K подмножеств. Обучайте и оценивайте модель итеративно на подмножествах K=5, используя оставшееся подмножество для независимого тестирования.

4. Создание и внедрение модели

  1. Реализуйте и настройте алгоритмы случайного леса (RF) и K-ближайших соседей (KNN) для оптимизации производительности прогнозирования. Обучайте, проверяйте и тестируйте модели с использованием 573 и 575 последовательностей белков для обучения и 1 355 последовательностей белков для тестирования.
  2. Используйте скрипт Python (Supplementary Coding File 1) для извлечения числовых значений признаков на основе выбранной последовательности белка. Сохраните эти числовые значения для обоих наборов данных в файлах CSV и отправьте их в классификаторы RF и KNN для создания модели двоичной классификации.
  3. Используйте эти модели, чтобы различать 3D-белки со сменой доменов и белки, не относящиеся к 3D-доменам. На рисунках 2 и 3 приведена обобщенная схема прогнозирования 3D-подкачки доменов.
  4. Примените гиперпараметры, такие как n_estimators=20, max_depth=4 и random_state=42 для радиочастотной модели.
  5. Применим гиперпараметр neighbors=5 для модели классификатора KNN.
    ПРИМЕЧАНИЕ: Эти настройки параметров были точно настроены для повышения производительности моделей на наборе данных лекарственных растений, отобранном вручную.

figure-protocol-1
Рисунок 2: Иллюстративное схематическое изображение. На представлении показаны модели машинного обучения Random Forest и K-Nearest Neighbor (KNN), демонстрирующие их алгоритмическую структуру и функциональный рабочий процесс в контексте задач двоичной классификации Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-protocol-2
Рисунок 3: Рабочий процесс на основе машинного обучения. На диаграмме показан рабочий процесс на основе машинного обучения для прогнозирования 3D-замены доменов в белках лекарственных растений. Процесс начинается с получения набора данных, объединяющего эталонный и метанабор данных. Извлечение признаков включает в себя получение как существующих, так и новых признаков из последовательностей белков. При предварительной обработке набора данных последовательности FASTA преобразуются в числовые значения с помощью синтаксического анализа последовательностей и сопоставления по словарю для создания структурированных фреймов данных, включая определенные 3D-функции обмена доменами. Постобработка включает в себя присвоение статуса подкачки домена с использованием порогового значения (β = 0,5), разделение данных на обучающий и тестовый наборы (соотношение 70 на 30), стандартизацию признаков и выполнение выбора признаков с k-кратной проверкой. Обучаются две модели машинного обучения, Random Forest (RF) и K-Nearest Neighbors (KNN), и их производительность оценивается с использованием метрик модели вместе с AUROC и AUPRC для оценки точности и надежности прогнозирования.

5. Статическая оценка и оценка моделей ML-классификаторов

  1. Реализуйте и настройте алгоритмы случайного леса (RF) и K-ближайших соседей (KNN) для оптимизации производительности прогнозирования. Обучайте, проверяйте и тестируйте модели с использованием 573 и 575 последовательностей белков для обучения и 1 355 последовательностей белков для тестирования.
    figure-protocol-3(1)
    figure-protocol-4(2)
    figure-protocol-5(3)
    figure-protocol-6(4)
    figure-protocol-7(5)
    figure-protocol-8(6)
    ПРИМЕЧАНИЕ: Определите TP (True Positive) как процент последовательностей, правильно предсказанных моделями как поменянные местами доменов. Определите TN (True Negative) как процент последовательностей, правильно предсказанных как не подменяемые доменами. Определите ложноположительные результаты (FP) как случаи, когда белки, не связанные со сменой доменов, неверно прогнозируются как подмененные доменами. Определите ложноотрицательные результаты (FN) как случаи, когда белки со сменой доменов неверно прогнозируются как белки без замены доменов.
  2. Вычислите Xsen как отношение точно идентифицированных истинно положительных результатов, а Xspe как отношение истинно отрицательных результатов, правильно определенных моделью.
    ПРИМЕЧАНИЕ: Используйте MCC для оценки качества двоичных классификаций путем анализа истинно положительных, истинно отрицательных, ложноположительных и ложноотрицательных результатов из матрицы несоответствий.
  3. Вычисление точности (ACC) для измерения доли правильных прогнозов среди общего числа прогнозов.
    ПРИМЕЧАНИЕ: Прецизионность оценивает долю правильно идентифицированных положительных результатов среди всех прогнозируемых положительных результатов, в то время как оценка F1 является гармоническим средним точности и чувствительности, уравновешивающим ложноположительные и ложноотрицательные результаты.
  4. Используйте AUC для оценки производительности моделей классификации в задачах двоичной классификации. Рассчитайте AUC (площадь под кривой) с помощью библиотеки Python Scikit-learn40 на основе положительно и отрицательно классифицированных белков.
  5. Используйте тестовые данные для оценки этих параметров.

6. Реализация модели для прогнозирования 3D подмены доменов на различных видах лекарственных растений

  1. Примените RF и KNN в общей сложности к 1 355 рассмотренным последовательностям (набор данных прогнозов) из 13 различных лекарственных растений, включая Citrus sinensis, Mentha, Vitis vinifera, Thyme, Thymus vulgaris, Jasmine, Hibiscus, Papaver somniferum, Illicium oligandrum, Citrus limon, Acorus calamus, Cannabis sativa и Coffea arabica.
    ПРИМЕЧАНИЕ: Эти белки связаны с различными функциями, такими как Citrus sinensis, Mentha, тимьян помогает при несварении желудка. Vitis vinifera, жасмин, гибискус являются очень богатым источником антиоксидантов, которые также улучшают здоровье кожи. Illicium oligandrum известен своими противогрибковыми и антибактериальными свойствами и т.д.

7. Исследование обогащения положительно предсказанных 3D-доменных обмененных белков лекарственного растения

  1. Сопоставьте коды присоединения этих белковых последовательностей с вторичными категориями метаболитов, используя данные UniProt.
  2. Извлекайте ID гена из предсказанных последовательностей.
  3. Откройте онлайн-веб-серверKEGG 41 (https://www.genome.jp/kegg/) для проведения анализа обогащения путей KEGG путем вставки индивидуального идентификатора гена или названия белка для проверки соответствующих путей.
  4. Проведите сравнительный анализ путем сравнения предсказанных 3D-белков с обменом доменов с прогностическим набором данных, чтобы обнаружить статистически значимую избыточную представленность специфических терминов онтологии генов (GO) и биологических путей. Вставьте ID гена предсказанной последовательности в ShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/) и выберите нужную функцию или категорию пути (биологическая функция, клеточный компонент, молекулярная функция, KEGG и т.д.).
    ПРИМЕЧАНИЕ: Визуализируйте эти аннотации с помощью облачной онлайн-платформы43 , которая позволяет пользователям писать и выполнять код на языке Python.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Белки, демонстрирующие обмен 3D-доменами, часто связаны с различными биологическими функциями. Тем не менее, систематический полногеномный анализ последовательностей белков, которые были вовлечены в 3D-обмен доменами, остается в значительной степени неизученным. В этом исследовании мы провели первоначальное исследование, чтобы предположительно предсказать 3D-белки со сменой доменов у 13 лекарственных растений, сосредоточившись на их связи со вторичными метаболитными доменами, путями KEGG и терминами генной онтологии (GO)...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Понимание 3D-обмена доменами в белках по всему их полному геному имеет большое значение в различных областях. Подходы машинного обучения, особенно случайный лес и K-ближайший сосед26,27, были использованы для прогнозирования 3D-замены доменов непосредственно на основе данных о последовательностях белков на уровне генома. Эти две модели машинного обучения включают в себя различные этапы, такие как сбор набора данных, выбор признак...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет известных конкурирующих финансовых интересов или личных отношений, которые могли бы повлиять на работу, описанную в этой статье.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Финансирование для этого исследования получено не было.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
3DSwap+https://caps.ncbs.res.in/3Dswapplus/index.html 
PfamEMBL-EBIhttp://pfam.xfam.org/: 
ХММЕРЭМБЛ-ЭБИ;
Aaindexhttps://www.genome.jp/aaindex/:
НАБЕРИТЕBioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL: 
WEKAУниверситет Векатоhttps://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
  KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :
https://www.ebi.ac.uk/Tools/hmmer/:  

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

3DkKEGG
Видео скоро будет доступно

Похожие статьи