Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Обзорная статья

Мультиомика и интегративная аналитика в открытии природных продуктов

1.5K просмотров

DOI:

10.3791/69458

28 ноября 2025 г.

В этой статье

Краткое содержание

Этот обзор акцентирует внимание на передовых мультиомических методологиях, включая метаболомику, геномику, транскриптомику и протеомику, интегрирующие с искусственным интеллектом и машинным обучением, а также сетевой анализ для улучшения открытия и функциональной валидации новых природных продуктов.

Аннотация

Натуральные продукты (НП) давно являются важным источником новых биоактивных соединений для разработки лекарств; Однако традиционные методы скрининга и изоляции этих соединений могут быть медленными и часто приводить к убывающей отдачи. К счастью, современные мультиомические и вычислительные подходы предлагают мощные решения этих задач. В этом обзоре выделяются инновационные методологии, объединяющие метаболомику, геномику, транскриптомику и протеомику с биоинформатикой и аналитической химией для ускорения открытия NP. Например, нецеленаправленные метаболомные платформы, такие как высокоразрешающая жидкостная хроматография-тандемная масс-спектрометрия (LC-MS/MS) и молекулярная сеть Global Natural Products Social (GNPS), позволяют осуществлять комплексное профилирование новых соединений, а стратегии целенаправленной маркировки изотопов усиливают этот процесс. Кроме того, инструменты для добычи геномов и метагенома, такие как антибиотики и оболочка для анализа вторичных метаболитов (antiSMASH), глубокий биосинтетический генный кластер (DeepBGC) и Pipeline for Reconstructing Integrated Syntheses of Metabolites (PRISM), быстро выявляют биосинтетические генные кластеры (BGC) как в культивируемых, так и в некультивируемых организмах, часто используя гетерологичную экспрессию для валидации продуктов. Транскриптомические анализы, включая секвенирование РНК (RNA-seq), коэкспрессионные сети и флюксомику, помогают прояснить, как регулируются пути, а количественные протеомические методы, такие как тандемные массовые метки/изобарические метки для относительной и абсолютной количественности (TMT/iTRAQ) и методы без меток, а также хемопротеомические подходы, такие как клеточный термальный сдвиг и тепловое профилирование протеома (TPP), выявляют молекулярные мишени и их механизмы действия. В этом обзоре также уделяется особое внимание роли искусственного интеллекта (ИИ) и машинного обучения (ML) в интеграции мультиомиксных данных, охватывая деятельность — от построения корреляционных сетей ген-метаболит до использования графов знаний и нейронных сетей для слияния данных и функционального прогнозирования. В заключение, обзор завершается обсуждением синергетических преимуществ мультиомикс для открытия природных продуктов, решения текущих технических задач и изучения будущих направлений к высокопроизводительной, интеллектуальной интеграции данных для исследований нового поколения NP.

Введение

Натуральные продукты — молекулы, вырабатываемые различными организмами, включая микробы и растения, — давно служат жизненно важным источником лекарств — от антибиотиков, таких как пенициллин, до противораковых препаратов, таких как Таксол. Значительная часть наших современных антибиотиков и химиотерапевтических препаратов производится из этих природныхсоединений. 1. Однако традиционные методы открытия новых NP, такие как культивирование микробов и использование биоанализной изоляции, становятся всё более сложными. В конце XX века интерес фармацевтических предприятий к NP снизился, поскольку компании столкнулись с уменьшающейся доходностью; Многие соединения, которые было легко найти, уже были заново открыты, а технические сложности, связанные с скринингом и характеристикой этих соединений, делали процесс трудоёмким. К счастью, сейчас эта тенденция меняется. Недавние достижения в области омики и аналитических технологий оживляют поиск NP 2,3. Например, высокопроизводительное секвенирование ДНК позволяет исследовать геномы скрытых биосинтетических кластеров генов (BGC), а ультрачувствительная масс-спектрометрия (MS) позволяет выявлять крошечные количества новых метаболитов в сложных смесях. Эти технологические инновации появляются в решающий момент, поскольку существует острый мировой спрос на новые терапевтические средства, особенно антибиотики, способные бороться с устойчивыми к лекарствамбактериями 4. Современные исследования в области NP поднимаются, чтобы справиться с этой задачей, интегрируя традиционные экспертизы в области NP с передовыми методами геномного и химического анализа.

Интеграция мультиомики является центральным элементом нынешних достижений в биологических исследованиях. Концепция «мультиомик» включает в себя одновременный анализ различных биологических слоёв данных, таких как ДНК организма (геном), транскрипты мРНК, белки и метаболиты. Применение омикс-подходов преобразило исследования NPs, обеспечив высокопроизводительный скрининг, быструю идентификацию новых соединений и более глубокое исследование сложных сетей, формирующихбиологические системы 5. Интегрируя эти многослойные наборы данных, исследователи могут напрямую связывать гены с кодируемыми ими метаболитами, тем самым создавая более полное понимание биосинтеза NP6. Например, алгоритмы геномного майнинга могут точно определить кластер генов, которые могут кодировать новый антибиотик, а транскриптомические данные могут указывать на активную экспрессию этих генов. Кроме того, метаболомное профилирование позволяет определить соответствующую антибиотиковую молекулу в экстракте культуры организма 7,8,9. Такой интегрированный подход значительно ускоряет открытие новых соединений и понимание их биосинтетических путей. Что ещё важнее, идентификация лекарственных целей всё больше опирается на интегрированные мультиомические подходы, которые постепенно вытесняют традиционные стратегии с однимомиксом 10. Недавние достижения в аналитической химии, включая высокоразрешающую жидкостную хроматографию (LC-MS) и ядерный магнитный резонанс (NMR), позволяют исследователям обнаруживать и структурно анализировать новые NP из сложных биологическихобразцов 11,12. Эти методы создают огромные объёмы данных, и именно здесь биоинформатика и машинное обучение (ML) становятся необходимыми. Алгоритмы искусственного интеллекта (ИИ) и сетевые анализы всё чаще используются для анализа мультиомических данных, выявляя значимые закономерности и прогнозы, которые было бы трудно определитьвручную 13,14. Объединив передовые технологии омики с интеллектуальным анализом данных на базе ИИ, исследователи теперь могут создать надёжный конвейер для более быстрого и систематического поиска и анализа NP, чем когда-либо прежде.

Хотя мультиомические стратегии значительно продвинули открытие NP, их успешная реализация во многом зависит от тщательного экспериментального планирования. Например, тип и качество образцов имеют решающее значение; Необходимо собирать хорошо сохранившиеся микробные культуры, экологические изоляты или клинические материалы в условиях, минимизирующих деградацию нуклеиновых кислот иметаболитов. 15. Глубина секвенирования также играет важную роль в разрешении данных: секвенирование целого генома обычно требует покрытия не менее 30× для точной сборки, тогда как транскриптомическое профилирование часто требует десятков миллионов чтений для идентификации транскриптов с низким содержанием, как рекомендует Genohub16. Кроме того, для метаболомики необходимы соответствующие экстракционные растворители и методы для захвата различных химических классов; Следует сознательно выбирать протоколы извлечения, которые минимизируют смещение и максимизируютвоспроизводимость 17. Однако эти методы имеют свои сложности. Интеграция крупных, гетерогенных наборов данных может быть вычислительно трудоёмкой, а нестабильность или низкое содержание метаболитов может усложнять последующиеанализы 18. Кроме того, высокие затраты или ограниченный размер выборки могут ограничивать разработкуисследований 19. Загрязнение и смещение данных секвенирования, особенно в образцах с низким уровнем входа или разбавления, также представляют значительные риски, как отмечают Ласк и др. в отношении загрязнения при высокопроизводительномсеквенировании 20. Признавая эти практические и технические ограничения, исследователи могут принимать обоснованные решения о подходящих мультиомических комбинациях и интерпретировать их результаты с необходимой осторожностью.

Этот обзор подчёркивает инновационные методы, которые революционизируют открытие NP с помощью мультиомики и интегративной аналитики. Также исследуется растущее значение машинного обучения и искусственного интеллекта в связи этих различных потоков данных, включая создание корреляционных сетей ген-метаболит и выявление генных кластеров, которые, вероятно, будут производить новые биоактивные соединения. Кроме того, рассматривается значимость и потенциал этого интегрированного подхода. В заключение, сочетание различных омикс-технологий с передовой аналитикой не только ускоряет открытие новых NP сегодня, но и прокладывает путь к разработке лекарств следующего поколения, которые крайне необходимы обществу.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обзор и перспектива

Для составления этого обзора мы провели всесторонний поиск литературы в различных базах данных и платформах индексации, включая PubMed, Scopus, Web of Science, ScienceDirect и Google Scholar. Поиск охватывал публикации с января 2015 по июль 2025 года. Ключевые слова и булевые комбинации включали: «открытие натурального продукта», «омикс», «метаболомика», «геномика», «транскриптомика», «протеомика», «машинное обучение», «искусственный интеллект», «биосинтетические генные кластеры» и «мультиомическая интеграция». Списки литературы ключевых статей и недавних обзоров также были проверены для выявления дополнительных релевантных публикаций. Помимо рецензируемых исследований, было проконсультировано ограниченное количество препринтных статей с таких платформ, как bioRxiv и medRxiv , когда они предоставляли своевременные и релевантные инсайты, ещё недоступные в опубликованной литературе. Все препринты чётко маркированы для сохранения прозрачности. В этом разделе рассматриваются последние разработки и перспективы на будущее в ключевых областях открытия NP на основе омики, с акцентом на метаболомику, геномику, транскриптомику и протеомику. А также их интеграция через ИИ/машинное обучение. Основные инструменты и ресурсы, обсуждаемые в этих областях, собраны для справки в таблице 1.

1. Метаболомика в открытии NPs

  1. Аналитические платформы для метаболомики
    Метаболомика имеет решающее значение для открытия NP, так как позволяет проводить детальный анализ малых молекул, образующихся различными организмами. Основные аналитические инструменты для характеристики метаболомов NPs включают высокоразрешающие методы MS, такие как LC-MS/MS и газовая хроматография-MS (GC-MS), а такжеЯМР-спектроскопию 21,22. Нецеленаправленные рабочие процессы LC-MS/MS, такие как сверхвысокопроизводительный LC-MS в паре с MS/MS, позволяют идентифицировать широкий спектр метаболитов в сложных смесях, в то время как GC-MS превосходно профилирует летучие соединения. Кроме того, новые методы, такие как прямая инфузионно-тандемная МС и РС, расширяют набор метаболомных инструментов дляNPs 23,24. Передовые масс-спектрометрические методы, включая мультимодальный МС, сочетающий положительные и отрицательные ионные режимы или использующий многоступенчатую фрагментацию MSn, а также дефисные методы, такие как LC-MS в сочетании с ЯМР, дают более глубокие структурные представления о метаболитах, которыеобнаруживаются 25,26.
  2. Обработка данных и вычислительные инструменты
    Специализированные программные инструменты играют ключевую роль в обработке и интерпретации метаболомных данных. Программы, такие как XCMS, MZmine и OpenMS, обычно используются для обнаружения и выравнивания хроматографических признаков или пиков, в то время как тщательные этапы предварительной обработки данных, такие как выравнивание пиков, нормализация и фильтрация, необходимы для достижения воспроизводимых метаболическихпрофилей 27. Идентификация соединений поддерживается спектральными библиотеками MS/MS, включая NIST и mzCloud, а также инструментами фрагментации in silico, такими как SIRIUS и MetFrag28. Платформа Global Natural Products Social (GNPS) стала ключевым ресурсом для молекулярных сетей, которая организует связанные спектры MS/MS для акцента на химических семействах и облегчения депродукции известныхсоединений 29. Например, анализ с использованием GNPS на данных LC-MS/MS из культур Streptomyces успешно выявил известные антибиотики, такие как спирамицин и актиномицин, а также ранее не зарегистрированныеаналоги 30,31. Метод молекулярных сетей эффективно группировал связанные неизвестные спектры, а добавление ионно-идентичных сетей улучшило связность признаков. Эти сетевые анализы, в сочетании с многомерными статистическими инструментами, такими как анализ главных компонентов и ортогональный дискриминантный анализ частных наименьших квадратов, а также анализ корреляционных сетей, могут связывать закономерности производства метаболитов с конкретными биологическими или экологическими условиями. В одном конкретном исследовании молекулярная сеть экстрактов ферментации растений Streptomyces с помощью GNPS выявила различные метаболитные профили, которые варьировались в зависимости от используемого медиатора роста. Были обнаружены известные метаболиты, включая спирамицин, актиномицин и канцерогенное соединение под названием лингбиатоксин; Однако многие сетевые узлы не совпадали ни с одной записью в спектральных базах данных32. Это открытие свидетельствует о наличии действительно новых метаболитов, что подчёркивает, как нецелевая метаболомика в сочетании с GNPS может выявлять потенциально новые NPs для дальнейших исследований.
    Сочетание метаболомного скрининга с функциональными биоанализами способствует быстрому приоритизированию штаммов или экстрактов, образующих биоактивные соединения. Кроме того, новые общественные ресурсы, такие как Атлас натуральных продуктов (NPAtlas), а также интегрированные трубопроводы анализа метаболом-генома, играют ключевую роль в ассоциации обнаруженных метаболитов с их BGC в исходныхорганизмах 33,34. Эта интегративная стратегия позволяет исследователям сопоставлять сигналы метаболитов с геномными данными, что повышает эффективность идентификации NP и отслеживания их происхождения.

2. Геномика в открытии NP

За последнее десятилетие исследования микробных NPs вступили в трансформационную «эру глубокой добычи», подпитываемую такими достижениями, как высокопроизводительное секвенирование, сверхчувствительный высокоразрешающий MS и интегрированные мультиомическиеподходы 35. Эти инструменты сместили усилия по поиску информации от случайной изоляции к целенаправленному, основанному на данных. Трубопроводы геномной добычи, включая antiSMASH 7.0 и DeepBGC, теперь позволяют систематически идентифицировать криптические BGC, особенно в малоизученныхтаксонах 36,37.

  1. Высокопроизводительное секвенирование и гибридная сборка
    Технологии секвенирования ДНК с высокой пропускной способностью, такие как секвенирование ДНК с коротким чтением и высокой пропускной способностью в сочетании с платформами секвенирования с длинным чтением, значительно преобразили геномные исследования организмов, производящих NP. Используя гибридные стратегии сборки, объединяющие как длинные, так и короткие чтения, исследователи могут создавать сборки геномов с высокой смежностью, которые необходимы для захвата целых BGC внутригенома 38. Кроме того, метагеномное секвенирование, включающее восстановление геномов, собранных на метагеноме, расширяет открытие BGC на некультивируемые микробы, позволяя учёным изучать экологическую ДНК для изучения её биосинтетическогопотенциала 39. В случаях, когда традиционные методы сборки генома не способны разрешить крупные или повторяющиеся генные кластеры, для выделения и клонирования значительных геномных фрагментов могут использоваться библиотечные методы, такие как космид или бактериальные искусственные хромосомные библиотеки. Этот подход облегчает характеристику полных кластеров генов посредством целенаправленного секвенирования или гетерологичной экспрессии, тем самым расширяя наше понимание генетической основы биосинтезаNPs 40,41.
  2. Инструменты для добычи генома
    Специализированные биоинформатические инструменты необходимы для анализа геномных данных с целью выявления отличительных сигнатур вторичных метаболитных путей. Такие программы, как antiSMASH, PRISM и DeepBGC, играют ключевую роль в этом процессе, автоматически обнаруживая кандидатные BGC. Они делают это, распознавая специфические биосинтетические домены, такие как те, что ассоциируются с нерибосомными пептид-синтетазами, поликетидными синтазами, рибосомно синтезированными и посттрансляционно модифицированными пептидными (RiPP) путями, а также терпенциклазами и другими. Для облегчения депликации базы данных, такие как MIBiG, собирающая известные BGC и их продукты, и NPAtlas, каталогизирующая известные NP, помогают исследователям сопоставлять новые последовательности или соединения с устоявшимисяпримерами 37,42,43. Алгоритмы кластеризации, такие как BiG-SCAPE, а также инструменты вроде CORASON, организуют связанные BGC в семейства, предлагая сетевой обзор биосинтетического разнообразия и облегчая идентификацию новых семейств кластеров через сравнения с известными44. Дополнительные биоинформатические анализы, включая поиск BLAST и скрытые сканирования моделей Маркова, могут предсказать потенциальные функции ферментов, закодированных в BGC, в то время как сравнительные геномные подходы, такие как анализ синтении и коэволюция генов, помогают уточнить эти функциональныепрогнозы 45. Кроме того, геномные данные позволяют аннотировать регуляторные элементы, связанные с биосинтезом NPs, включая специфические для пути промоторы и транскрипционныерегуляторы 46. Эти инсайты служат основой для инжиниринга путей; например, методы синтетической биологии, такие как рекомбинационное клонирование с трансформацией и рекомбинирование Red/ET, позволяют исследователям захватывать и экспрессировать молчаливые или загадочные BGC в гетерологичном организме-хозяине, тем самым активируя выработку ихметаболитов 47.
    Геномные исследования успешно привели к открытию новых NP, сосредотачиваясь на специфических генетических сигналах. Например, систематический поиск генов, связанных с резистентностью к антибиотикам к гликопептидам, выявил несколько необычных BGC, которые, по прогнозам, кодируют новые антибиотики. Этот метод привёл к идентификации двух новых соединений — компстатина и кобрамицина, оба из которых обладают уникальными механизмами действия, нацеливаясь на бактериальныеаутолизины 48. В аналогичном ключе, изучение человеческого микробиома на предмет содержания генов биосинтетического организма вывело кандидата в антибиотик липопептида, известного как «хумицин», признанного своей потенциальной эффективностью против Staphylococcus и Streptococcus видов 49. В этих случаях соединения изначально идентифицировались с помощью вычислительных методов, при этом их химические структуры предсказывались на основе геномных данных. Впоследствии эти предсказанные молекулы были химически синтезированы и продемонстрировали ожидаемую активность антибиотиков, тем самым подтвердив стратегию открытия на основе генома. В более широком масштабе крупномасштабное секвенирование различных бактерий, включая многие редкие актиномицеты, выявляет множество «загадочных» кластеров генов BGCs, продукты которых остаются неизвестными. Например, исследования геномов Streptomyces выявили тысячи нехарактеризованных BGC50. Новый подход к связыванию этих осиротных кластеров с реальными метаболитами включает интеграцию метаболомных анализов с геномными исследованиями. Связывая наличие или экспрессию кластера генов с обнаружением уникальных метаболитных признаков через платформы, такие как GNPS или масс-спектральные базы данных, исследователи могут начать назначать предварительные химические продукты многочисленным новым BGC, тем самым облегчая открытие действительно новых NP из геномных данных.

3. Транскриптомика в открытии природных продуктов

Транскриптомические анализы дают динамический взгляд на активность БГК, измеряя экспрессию мРНК при различных условиях. В частности, эксперименты с RNA-seq могут выявить, какие BGC активно транскрибуются и как их уровень экспрессии колеблется в ответ на изменения окружающей среды или эксперимента. Сравнивая уровни транскриптов в разных условиях, дифференциальный анализ экспрессии с использованием таких инструментов, как DESeq2 или edgeR, позволяет выявить BGC, которые либо повышены, либо понижены регуляцией, тем самым выявляя генные кластеры, которые могут быть индуцированы или оставаться неактивными при стандартныхусловиях 51. Хотя традиционный РНК-секвенс, проводимый на массовых культивируемых клетках, является типичным методом для изучения экспрессии BGC, более продвинутые методы, такие как одноклеточные РНК-секвенты, начинают применяться в сложных микробиомах. Этот сдвиг позволяет наблюдать экспрессию генов в организмах окружающей среды, которые труднокультивировать 52,53. Стандартный рабочий процесс по РНК-секвенциям обычно включает сопоставление чтений с эталонным геномом с помощью выравнивателей, таких как STAR или HISAT2, количественную оценку экспрессии генов с помощью инструментов, таких как featureCounts или Kallisto, и нормализацию данных для выявления значимых изменений экспрессии. После этого анализ коэкспрессионной сети, часто проводящийся с пакетом WGCNA, может кластеризовать гены с похожими паттернами экспрессии. Когда также доступны данные о метаболите, эти сети могут быть расширены для включения метаболитов, связывая определённые соединения с соэкспрессированнымигенами 54.

Транскриптомические данные оказались ценными для выявления условно активных биосинтетических путей. Ярким примером такого подхода является детальное сравнение четырёх штаммов Salinispora51. В этом исследовании было выявлено, что более половины BGC в каждом штаму экспрессировались в той или иной степени, при этом многие кластеры, неактивные в одном штамме, проявили экспрессию в другом. Анализируя профили экспрессии генов в этих штаммах, исследователи смогли выявить несколько регуляторных факторов, которые, по-видимому, либо заглушают, либо активируют определённые кластеры. Этот интегративный метод привёл к идентификации ранее неизвестного семейства NP, известных как салинипостины. Транскриптомные данные указывали на криптический генный кластер как потенциальный источник неопознанного соединения; Когда этот кластер был индуцирован к экспрессии (через регуляторные изменения), это приводило к образованию молекул салинипостана, которые впоследствии были выделены и структурно охарактеризованы. Это исследование иллюстрирует, как транскриптомика может способствовать открытию NP: анализируя дифференциальную экспрессию генов, учёные могут выделять кандидаты на BGC, а корреляция между экспрессией генов и метаболитными профилями предоставляет подтверждающие доказательства взаимосвязей ген-метаболит, которые можно проверить с помощью целевых экспериментов.

4. Протеомика в открытии NP

  1. Подходы с дробовиком и целенаправленной протеомикой
    Протеомика, включающая масштабное изучение белков, предоставляет важный взгляд в исследованиях NP, напрямую измеряя ферменты и белки, играющие роль в биосинтетических путях. В целом протеомные подходы можно разделить на два основных типа: шотганная (нецелевая) протеомика и таргетированная протеомика. В протеомике с шотганом белки, извлеченные из микробных или растительных образцов, проходят ферментативное переваривание, обычно с помощью трипсина, а полученные пептиды анализируются с помощью высокоразрешающих LC-MS/MS, часто с применением современных масс-спектрометров, таких как квадрупольные фазы (QTOF) или высокоразрешающие орбитальные масс-спектрометры55. Собранные данные по РС, известные как спектры MS/MS, затем сопоставляются с пептидными последовательностями путем поиска в базе данных белков, основанной на геноме организма или близкородственном виду, с помощью программных инструментов, таких как MaxQuant илиMascot 56,57. Этот процесс позволяет количественно оценивать изменения количества белков при различных условиях, что можно достичь либо методами без меток, либо с помощью методов маркировки изотопов, таких как маркировка стабильных изотопов аминокислотами в клеточной культуре (SILAC) или изобарное метирование реагентами TMT/iTRAQ, чтобы определить, какие биосинтетические ферменты повышаются илипонижают 58, 59. В отличие от этого, методы таргетной протеомики, включая мониторинг выбранных реакций (SRM) или мониторинг параллельных реакций (PRM), сосредоточены на конкретном наборе ионов пептидов, часто уникальных пептидах ключевых биосинтетических ферментов или регуляторных белков, что позволяет точно и чувствительно измерять эти пептиды на несколькихобразцах 60,61.
  2. Инновационные подходы в протеомике
    Одной из значительных задач протеомного анализа вторичного метаболизма является обнаружение крупных биосинтетических ферментов, таких как нерибосомные пептид-синтетазы и поликетид-синтазы, которые часто превышают 100 кДа по размеру и дают мало обнаруживаемых пептидов при стандартных протоколах пищеварения, что затрудняет их наблюдение. Для решения этой проблемы Бампус и соавторы разработали метод, известный как PrISM, который улучшает обнаружение белков NRPS и PKS с помощью специфического кофактора, содержащегося на этихферментах 62. PrISM интегрирует традиционную протеомику для дробовиков с анализом на выброс фосфопантеинила (Ppant). Примечательно, что ферменты NRPS и PKS имеют ковалентно прикреплённую руку Ппанта к своим доменам носителя ацила или пептидил; во время фрагментации MS/MS эта протезная группа часто образует уникальный ион фрагмента, называемый ионом «выброса Ппанта». Путём вычислительной фильтрации данных LC-MS/MS для этого диагностического иона позволяет методу PrISM эффективно выделять пептиды, полученные из ферментов NRPS и PKS, в сложной смеси всех клеточных белков. Эта стратегия успешно выявила скрытые биосинтетические пути с помощью протеомики. Например, рабочий процесс PrISM позволил обнаруживать пептиды из комплекса граммицидина S-синтетазы (GrsA/GrsB) в культурах Bacillus brevis, установив прямую связь между этими ферментами NRPS и производством антибиотика грамицидина S в этоморганизме 62. Важно, что протеомная идентификация GrsA/GrsB не требовала предварительного геномного знания B. brevis, что показывает, что в некоторых случаях протеомный анализ может выявить активные биосинтетические пути NPs даже у организмов, чьи геномы ещё не секвенированы.
  3. Геномно-ориентированная протеомика
    Когда геномная последовательность доступна, возможности протеомики могут значительно увеличиться за счёт использования базы данных, специфичных для штамма, для идентификации пептидов. Например, в исследовании, анализирующем протеом Streptomyces lilacinus, учёные провели два анализа: один — поиском спектров по общей базе данных белков, другой — по специальной базе данных, основанной на секвенированном геномеэтого штамма 63. Анализ, основанный на геноме, дал примерно в десять раз больше выявленных пептидов и пептидов, связанных с шестью различными BGC внутри организма. Примечательно, что три из этих идентифицированных кластеров соответствовали ранее известным «орфанным» метаболитам, включая грейбактин, ракицидин D и специфический сидерофор, при этом их биосинтетические ферменты были подтверждены как экспрессированные. Оставшиеся обнаруженные скопления казались новыми и нехарактеризованными. Этот пример демонстрирует, что интеграция геномной информации в протеомные рабочие процессы позволяет подтвердить, какие биосинтетические пути активно экспрессируются в штамме, тем самым отдавая приоритет этим кластерам генов для выделения и характеристики их продуктов.
    Кроме того, протеомные методы могут выявить молекулярные цели и способы действия NP, область, часто называемую химической протеомикой. Например, профилирование белков на основе активности (ABPP) использует маломолекулярные зонды, обычно производные или аналоги NPs, которые реагируют с клеточными мишенями соединения, маркируя эти белки для обогащения и идентификации через MS64. Этот метод позволяет выявить белковые мишени, к которым связывается конкретная NP или связанная молекула внутри клетки. Другой метод, термопрофильное профилирование протеомов (TPP), включает нагрев образцов белков при наличии или отсутствии соединения, чтобы определить, какие белки демонстрируют изменённую термическую стабильность, что указывает на связывающеевзаимодействие 65. Эти химические протеомные подходы бесценны для валидации биологических мишеней NPs и разъяснения их механизмов действия, тем самым дополняя открытие самих NPs.

5. ML и ИИ для интеграции и прогнозирования омиксов

  1. Интеграция мультиомикс-данных с машинным обучением
    Захватывающим рубежом в открытии NP является применение машинного обучения и искусственного интеллекта для интеграции данных омиксов для функциональных прогнозов. В области геномики были разработаны контролируемые алгоритмы машинного обучения, включая случайные леса, опорные векторные машины и глубокие нейронные сети, для выявления закономерностей в BGC, связанных с определёнными типами NP. Например, эти модели ML могут классифицировать BGC на основе общего класса молекул, которые они производят, или даже прогнозировать определённые характеристики химической структуры, полученной из генной последовательности. Обзор, проведённый Dason MS и коллегами, выделяет различные инструменты машинного обучения, предназначенные для декодирования «языка» BGC с использованием данных последовательностей ДНК или аминокислот для определения структуры и биоактивности соответствующих NP66. Эти модели обычно опираются на обширные базы данных известных генных кластеров и соединений для изучения взаимосвязей между ними, что позволяет предсказывать потенциальную биологическую активность новых соединений. Например, они могут оценить, может ли продукт из нехарактеризованного BGC обладать антибиотиками или противораковыми свойствами. Значительные достижения, способствовавшие реализации этих возможностей, включают использование больших обучающих наборов данных, таких как тысячи известных NP-структур и кластеров генов, инновационные методы представления, такие как вложение последовательностей и графовые нейронные сети, отражающие особенности генных кластеров и химических структур, а также многопараметрические модели, объединяющие различные геномные и химические дескрипторы для повышения точности прогнозирования.
    В области метаболомики методы ИИ значительно улучшают интерпретацию сложных масс-спектральных данных. Ярким примером является инструмент CSI:FingerID, который использует машинное обучение для прогнозирования структурного отпечатка молекулы из её спектра MS/MS. Эта способность помогает выявлять неизвестные метаболиты, предлагая потенциальные подструктуры и кандидатные соединения67. Аналогично, модели глубокого обучения использовались для спектральной аннотации; сверточные нейронные сети и, более недавно, архитектуры на основе трансформаторов, такие как модель «DreaMS», изучают фрагментационные паттерны из обширных спектральных библиотек. Эти модели могут предлагать структуры для неизвестных спектров на основе изученных ими закономерностей, часто превосходя традиционные эвристические методы, особенно для метаболитов, которые не имеют точных совпадений в существующих базах данных68. Помимо структурной аннотации, ML также вносит вклад в метаболомику, выявляя глобальные закономерности. Например, неконтролируемые алгоритмы визуализации, такие как t-SNE (t-распределенное стохастическое соседское вложение) и UMAP (Uniform Manifold Approximation and Projection), могут уменьшить размерность нецелевых наборов метаболомики, облегчая кластеризацию образцов на основе сходств их метаболитных профилей. Тем временем контролируемые классификаторы могут связывать специфические метаболитные сигнатуры с фенотипическими признаками или биоактивностью образцов, что дополнительно обогащает анализ69,70,71.
    ML всё чаще используется для интеграции различных наборов данных омиксов, что позволяет более полно понять биосинтез и функции NP. Объединяя данные из геномики, транскриптомики, протеомики и метаболомики, интегративные модели могут выявить связи, которые могут быть упущены при отдельном изучении каждого типа данных. Например, исследователи могут создавать сети корреляции ген-метаболит, которые связывают уровни экспрессии генов или белков с уровнями производства метаболитов. ML-модели, обученные на этих интегрированных данных, могут предсказывать, какие генные кластеры, вероятно, отвечают за определённые метаболиты или биологическую активность72,73. Современные многомерные методы, такие как мультиомический факторный анализ (доступный в инструментах, таких как MOFA) и регуляризованные многомерные методы (встречающиеся в таких пакетах, как mixOmics), способствуют выявлению латентных факторов, охватывающих различные типы данных, например, набор коэкспрессированных генов вместе с группой сопутствующих метаболитов74,75,76. На практике, для открытия NP различные подходы помогают приоритизировать кандидатные генные кластеры, демонстрируя связь с наблюдаемыми метаболитами или фенотипами. Ярким примером такой интегративной, управляемой ИИ стратегии является открытие нового семейства рибосомно синтезированных и RiPP с использованием алгоритма DecRiPPter. Этот алгоритм использует модель на базе опорной векторной машины (SVM) для анализа геномных данных по криптическим пептидам прекурсоров RiPP, а затем перекрёстно сопоставляет эти прогнозы с пангеномным анализом для исключения известных соединений. Если применить к 1 295 Streptomyces геномы, DecRiPPter успешно выявил 42 предполагаемых новых семейства RiPP, которые ранее были упущены традиционными методами добычи генома. Среди этих предсказанных кластеров один был экспериментально проверен для получения нового лантипептида класса V, который исследователи назвали «пристинин A3». Индуцируя экспрессию этого безмолвного генного кластера, было выделено соединение пристинин A3, а его структура определена с помощью ЯМР и РС, что позволило выявить два ранее неизвестных фермента, образующих лантионин, закодированных в этом пути77. Это достижение подчёркивает, как анализы на основе ИИ могут выявлять скрытые NP: модель машинного обучения обнаружила иначе нераспознанный генетический сигнал, направляя экспериментальные усилия по обнаружению новой молекулы.
  2. Новые приложения ИИ
    Помимо текущих приложений, несколько новых стратегий на базе ИИ приведут к дальнейшей революции в исследованиях NP. Одной из перспективных областей является вычислительный ретросинтез и проектирование путей, где разрабатываются модели глубокого обучения для предложения биосинтетических путей или шагов синтетической химии для известных NP и их аналогов, что может значительно улучшить проектирование и производство новыхсоединений 78,79. Ещё одним захватывающим рубежом является предсказание функции ферментов с помощью ИИ. Используя современные инструменты прогнозирования структуры белков на основе алгоритмов глубокого обучения, а также методы машинного обучения, такие как контрастное обучение на белковых последовательностях, исследователи начинают делать выводы о вероятной активности нехарактеризованных ферментов, обнаруженных в BGC. Это может дать представление о типах химических превращений, которые эти ферменты катализируют 80,81,82. Разрабатываются полностью интегрированные конвейеры омикс-химии, где платформы ИИ стремятся автоматически соединять масс-спектральные признаки с геномнымиданными 83,84. В принципе, такая система могла бы анализировать набор данных LC-MS/MS из сложного образца вместе с геномными последовательностями из той же среды, что позволяло ей предсказывать, какой генный кластер отвечает за каждый неопознанный метаболит, оценивая совпадения ген-метаболит. Хотя эти подходы всё ещё находятся в зачаточном состоянии, они предполагают будущее, в котором ИИ сможет автономно связывать гены с молекулами, значительно ускоряя процесс от данных омиксов к открытию новых NP.
  3. Управление данными и этические проблемы в поиске NP с помощью ИИ
    Современные мультиомические исследования дают значительное количество разнообразных данных, но эффективность прогнозов ИИ во многом зависит от качества и согласованности этих наборов данных. Когда обучающие наборы плохо аннотированы или предвзяты, они могут привести к вводящим в заблуждение результатам и неудачнымвалидациям 85. Для решения этой проблемы исследователям следует внедрять принципы FAIR — Findable, Accessible, Intercomable и Reuseable — чтобы способствовать прозрачности, воспроизводимости и широкому повторному использованиюданных 86. Этот подход включает обмен как положительными, так и отрицательными результатами, тщательное документирование конвейеров предварительной обработки данных и предоставление анализа кода для облегчения независимой проверки. Кроме того, внедрение новых цифровых инфраструктур, таких как электронные лабораторные блокноты (ELN) и контейнерные рабочие процессы, имеет решающее значение для улучшения сбора данных и обеспечения стандартизированногокураторства 87,88.
    Хотя ИИ значительно ускоряет поиск NP, он также поднимает важные этические вопросы. Алгоритмы, обучающиеся на неполных или предвзятых наборах данных, могут усиливать существующие неравенства, подчёркивая необходимость разнообразия и репрезентативных обучающихданных 89. Кроме того, использование объяснимых методов ИИ жизненно важно для повышения прозрачности и помощи учёным в понимании прогнозов, обеспечивая то, что ИИ служит поддерживающим инструментом под контролем человека, а не принимающим решения85. Этические соображения также включают конфиденциальность данных, особенно при использовании клинических или человеческих наборов данных, а также последствия для рабочей силы, поскольку автоматизация всё больше влияет на исследовательскуюсреду 90. Для решения этих проблем системы ИИ должны регулярно подвергаться аудитам, оценке предвзятости и строгому регуляторному контролю, что поможет поддерживать справедливость, подотчётность и надёжность в области исследований NP.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Выводы

Текущее состояние открытия NP сочетает аналитическую химию и биоинформатику, создавая мощную синергию. Как показано на рисунке 1, передовые омикс-технологии, такие как метаболомика LC-MS, секвенирование высокой производительности, RNA-Seq и протеомика, работают вместе с вычислительной аналитикой, включая сети и машинное обучение, чтобы создать эффективный конвейер для открытия. Недавние достижения в этой области включают один...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Все авторы заявляют, что нет финансовых или личных отношений, которые могли бы рассматриваться как потенциальные конфликты интересов.

Благодарности

Эта работа была поддержана Национальным фондом естественных наук Китая (32500813), Программой постдокторских стипендий CPSF (GZC20251503), Программой науки и технологий Сычуани (2024ZYD0149), Специальным исследовательским фондом для постдокторской программы провинции Сычуань (TB2024017), ключевым исследовательским и разработочным проектом Бюро науки и технологий Дэян (2024SZY016, 2023SZZ009), Центром повышения потенциала и непрерывного образования Национальной комиссии здравоохранения (GWJJMB202510025060), и Специальный фонд для инкубационных проектов Народной больницы Дэян (FRH202501, FHT202501). Мы признаём, что рисунок 1 был создан с использованием BioRender,

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Ссылки

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги