Для составления этого обзора мы провели всесторонний поиск литературы в различных базах данных и платформах индексации, включая PubMed, Scopus, Web of Science, ScienceDirect и Google Scholar. Поиск охватывал публикации с января 2015 по июль 2025 года. Ключевые слова и булевые комбинации включали: «открытие натурального продукта», «омикс», «метаболомика», «геномика», «транскриптомика», «протеомика», «машинное обучение», «искусственный интеллект», «биосинтетические генные кластеры» и «мультиомическая интеграция». Списки литературы ключевых статей и недавних обзоров также были проверены для выявления дополнительных релевантных публикаций. Помимо рецензируемых исследований, было проконсультировано ограниченное количество препринтных статей с таких платформ, как bioRxiv и medRxiv , когда они предоставляли своевременные и релевантные инсайты, ещё недоступные в опубликованной литературе. Все препринты чётко маркированы для сохранения прозрачности. В этом разделе рассматриваются последние разработки и перспективы на будущее в ключевых областях открытия NP на основе омики, с акцентом на метаболомику, геномику, транскриптомику и протеомику. А также их интеграция через ИИ/машинное обучение. Основные инструменты и ресурсы, обсуждаемые в этих областях, собраны для справки в таблице 1.
1. Метаболомика в открытии NPs
- Аналитические платформы для метаболомики
Метаболомика имеет решающее значение для открытия NP, так как позволяет проводить детальный анализ малых молекул, образующихся различными организмами. Основные аналитические инструменты для характеристики метаболомов NPs включают высокоразрешающие методы MS, такие как LC-MS/MS и газовая хроматография-MS (GC-MS), а такжеЯМР-спектроскопию 21,22. Нецеленаправленные рабочие процессы LC-MS/MS, такие как сверхвысокопроизводительный LC-MS в паре с MS/MS, позволяют идентифицировать широкий спектр метаболитов в сложных смесях, в то время как GC-MS превосходно профилирует летучие соединения. Кроме того, новые методы, такие как прямая инфузионно-тандемная МС и РС, расширяют набор метаболомных инструментов дляNPs 23,24. Передовые масс-спектрометрические методы, включая мультимодальный МС, сочетающий положительные и отрицательные ионные режимы или использующий многоступенчатую фрагментацию MSn, а также дефисные методы, такие как LC-MS в сочетании с ЯМР, дают более глубокие структурные представления о метаболитах, которыеобнаруживаются 25,26.
- Обработка данных и вычислительные инструменты
Специализированные программные инструменты играют ключевую роль в обработке и интерпретации метаболомных данных. Программы, такие как XCMS, MZmine и OpenMS, обычно используются для обнаружения и выравнивания хроматографических признаков или пиков, в то время как тщательные этапы предварительной обработки данных, такие как выравнивание пиков, нормализация и фильтрация, необходимы для достижения воспроизводимых метаболическихпрофилей 27. Идентификация соединений поддерживается спектральными библиотеками MS/MS, включая NIST и mzCloud, а также инструментами фрагментации in silico, такими как SIRIUS и MetFrag28. Платформа Global Natural Products Social (GNPS) стала ключевым ресурсом для молекулярных сетей, которая организует связанные спектры MS/MS для акцента на химических семействах и облегчения депродукции известныхсоединений 29. Например, анализ с использованием GNPS на данных LC-MS/MS из культур Streptomyces успешно выявил известные антибиотики, такие как спирамицин и актиномицин, а также ранее не зарегистрированныеаналоги 30,31. Метод молекулярных сетей эффективно группировал связанные неизвестные спектры, а добавление ионно-идентичных сетей улучшило связность признаков. Эти сетевые анализы, в сочетании с многомерными статистическими инструментами, такими как анализ главных компонентов и ортогональный дискриминантный анализ частных наименьших квадратов, а также анализ корреляционных сетей, могут связывать закономерности производства метаболитов с конкретными биологическими или экологическими условиями. В одном конкретном исследовании молекулярная сеть экстрактов ферментации растений Streptomyces с помощью GNPS выявила различные метаболитные профили, которые варьировались в зависимости от используемого медиатора роста. Были обнаружены известные метаболиты, включая спирамицин, актиномицин и канцерогенное соединение под названием лингбиатоксин; Однако многие сетевые узлы не совпадали ни с одной записью в спектральных базах данных32. Это открытие свидетельствует о наличии действительно новых метаболитов, что подчёркивает, как нецелевая метаболомика в сочетании с GNPS может выявлять потенциально новые NPs для дальнейших исследований.
Сочетание метаболомного скрининга с функциональными биоанализами способствует быстрому приоритизированию штаммов или экстрактов, образующих биоактивные соединения. Кроме того, новые общественные ресурсы, такие как Атлас натуральных продуктов (NPAtlas), а также интегрированные трубопроводы анализа метаболом-генома, играют ключевую роль в ассоциации обнаруженных метаболитов с их BGC в исходныхорганизмах 33,34. Эта интегративная стратегия позволяет исследователям сопоставлять сигналы метаболитов с геномными данными, что повышает эффективность идентификации NP и отслеживания их происхождения.
2. Геномика в открытии NP
За последнее десятилетие исследования микробных NPs вступили в трансформационную «эру глубокой добычи», подпитываемую такими достижениями, как высокопроизводительное секвенирование, сверхчувствительный высокоразрешающий MS и интегрированные мультиомическиеподходы 35. Эти инструменты сместили усилия по поиску информации от случайной изоляции к целенаправленному, основанному на данных. Трубопроводы геномной добычи, включая antiSMASH 7.0 и DeepBGC, теперь позволяют систематически идентифицировать криптические BGC, особенно в малоизученныхтаксонах 36,37.
- Высокопроизводительное секвенирование и гибридная сборка
Технологии секвенирования ДНК с высокой пропускной способностью, такие как секвенирование ДНК с коротким чтением и высокой пропускной способностью в сочетании с платформами секвенирования с длинным чтением, значительно преобразили геномные исследования организмов, производящих NP. Используя гибридные стратегии сборки, объединяющие как длинные, так и короткие чтения, исследователи могут создавать сборки геномов с высокой смежностью, которые необходимы для захвата целых BGC внутригенома 38. Кроме того, метагеномное секвенирование, включающее восстановление геномов, собранных на метагеноме, расширяет открытие BGC на некультивируемые микробы, позволяя учёным изучать экологическую ДНК для изучения её биосинтетическогопотенциала 39. В случаях, когда традиционные методы сборки генома не способны разрешить крупные или повторяющиеся генные кластеры, для выделения и клонирования значительных геномных фрагментов могут использоваться библиотечные методы, такие как космид или бактериальные искусственные хромосомные библиотеки. Этот подход облегчает характеристику полных кластеров генов посредством целенаправленного секвенирования или гетерологичной экспрессии, тем самым расширяя наше понимание генетической основы биосинтезаNPs 40,41.
- Инструменты для добычи генома
Специализированные биоинформатические инструменты необходимы для анализа геномных данных с целью выявления отличительных сигнатур вторичных метаболитных путей. Такие программы, как antiSMASH, PRISM и DeepBGC, играют ключевую роль в этом процессе, автоматически обнаруживая кандидатные BGC. Они делают это, распознавая специфические биосинтетические домены, такие как те, что ассоциируются с нерибосомными пептид-синтетазами, поликетидными синтазами, рибосомно синтезированными и посттрансляционно модифицированными пептидными (RiPP) путями, а также терпенциклазами и другими. Для облегчения депликации базы данных, такие как MIBiG, собирающая известные BGC и их продукты, и NPAtlas, каталогизирующая известные NP, помогают исследователям сопоставлять новые последовательности или соединения с устоявшимисяпримерами 37,42,43. Алгоритмы кластеризации, такие как BiG-SCAPE, а также инструменты вроде CORASON, организуют связанные BGC в семейства, предлагая сетевой обзор биосинтетического разнообразия и облегчая идентификацию новых семейств кластеров через сравнения с известными44. Дополнительные биоинформатические анализы, включая поиск BLAST и скрытые сканирования моделей Маркова, могут предсказать потенциальные функции ферментов, закодированных в BGC, в то время как сравнительные геномные подходы, такие как анализ синтении и коэволюция генов, помогают уточнить эти функциональныепрогнозы 45. Кроме того, геномные данные позволяют аннотировать регуляторные элементы, связанные с биосинтезом NPs, включая специфические для пути промоторы и транскрипционныерегуляторы 46. Эти инсайты служат основой для инжиниринга путей; например, методы синтетической биологии, такие как рекомбинационное клонирование с трансформацией и рекомбинирование Red/ET, позволяют исследователям захватывать и экспрессировать молчаливые или загадочные BGC в гетерологичном организме-хозяине, тем самым активируя выработку ихметаболитов 47.
Геномные исследования успешно привели к открытию новых NP, сосредотачиваясь на специфических генетических сигналах. Например, систематический поиск генов, связанных с резистентностью к антибиотикам к гликопептидам, выявил несколько необычных BGC, которые, по прогнозам, кодируют новые антибиотики. Этот метод привёл к идентификации двух новых соединений — компстатина и кобрамицина, оба из которых обладают уникальными механизмами действия, нацеливаясь на бактериальныеаутолизины 48. В аналогичном ключе, изучение человеческого микробиома на предмет содержания генов биосинтетического организма вывело кандидата в антибиотик липопептида, известного как «хумицин», признанного своей потенциальной эффективностью против Staphylococcus и Streptococcus видов 49. В этих случаях соединения изначально идентифицировались с помощью вычислительных методов, при этом их химические структуры предсказывались на основе геномных данных. Впоследствии эти предсказанные молекулы были химически синтезированы и продемонстрировали ожидаемую активность антибиотиков, тем самым подтвердив стратегию открытия на основе генома. В более широком масштабе крупномасштабное секвенирование различных бактерий, включая многие редкие актиномицеты, выявляет множество «загадочных» кластеров генов BGCs, продукты которых остаются неизвестными. Например, исследования геномов Streptomyces выявили тысячи нехарактеризованных BGC50. Новый подход к связыванию этих осиротных кластеров с реальными метаболитами включает интеграцию метаболомных анализов с геномными исследованиями. Связывая наличие или экспрессию кластера генов с обнаружением уникальных метаболитных признаков через платформы, такие как GNPS или масс-спектральные базы данных, исследователи могут начать назначать предварительные химические продукты многочисленным новым BGC, тем самым облегчая открытие действительно новых NP из геномных данных.
3. Транскриптомика в открытии природных продуктов
Транскриптомические анализы дают динамический взгляд на активность БГК, измеряя экспрессию мРНК при различных условиях. В частности, эксперименты с RNA-seq могут выявить, какие BGC активно транскрибуются и как их уровень экспрессии колеблется в ответ на изменения окружающей среды или эксперимента. Сравнивая уровни транскриптов в разных условиях, дифференциальный анализ экспрессии с использованием таких инструментов, как DESeq2 или edgeR, позволяет выявить BGC, которые либо повышены, либо понижены регуляцией, тем самым выявляя генные кластеры, которые могут быть индуцированы или оставаться неактивными при стандартныхусловиях 51. Хотя традиционный РНК-секвенс, проводимый на массовых культивируемых клетках, является типичным методом для изучения экспрессии BGC, более продвинутые методы, такие как одноклеточные РНК-секвенты, начинают применяться в сложных микробиомах. Этот сдвиг позволяет наблюдать экспрессию генов в организмах окружающей среды, которые труднокультивировать 52,53. Стандартный рабочий процесс по РНК-секвенциям обычно включает сопоставление чтений с эталонным геномом с помощью выравнивателей, таких как STAR или HISAT2, количественную оценку экспрессии генов с помощью инструментов, таких как featureCounts или Kallisto, и нормализацию данных для выявления значимых изменений экспрессии. После этого анализ коэкспрессионной сети, часто проводящийся с пакетом WGCNA, может кластеризовать гены с похожими паттернами экспрессии. Когда также доступны данные о метаболите, эти сети могут быть расширены для включения метаболитов, связывая определённые соединения с соэкспрессированнымигенами 54.
Транскриптомические данные оказались ценными для выявления условно активных биосинтетических путей. Ярким примером такого подхода является детальное сравнение четырёх штаммов Salinispora51. В этом исследовании было выявлено, что более половины BGC в каждом штаму экспрессировались в той или иной степени, при этом многие кластеры, неактивные в одном штамме, проявили экспрессию в другом. Анализируя профили экспрессии генов в этих штаммах, исследователи смогли выявить несколько регуляторных факторов, которые, по-видимому, либо заглушают, либо активируют определённые кластеры. Этот интегративный метод привёл к идентификации ранее неизвестного семейства NP, известных как салинипостины. Транскриптомные данные указывали на криптический генный кластер как потенциальный источник неопознанного соединения; Когда этот кластер был индуцирован к экспрессии (через регуляторные изменения), это приводило к образованию молекул салинипостана, которые впоследствии были выделены и структурно охарактеризованы. Это исследование иллюстрирует, как транскриптомика может способствовать открытию NP: анализируя дифференциальную экспрессию генов, учёные могут выделять кандидаты на BGC, а корреляция между экспрессией генов и метаболитными профилями предоставляет подтверждающие доказательства взаимосвязей ген-метаболит, которые можно проверить с помощью целевых экспериментов.
4. Протеомика в открытии NP
- Подходы с дробовиком и целенаправленной протеомикой
Протеомика, включающая масштабное изучение белков, предоставляет важный взгляд в исследованиях NP, напрямую измеряя ферменты и белки, играющие роль в биосинтетических путях. В целом протеомные подходы можно разделить на два основных типа: шотганная (нецелевая) протеомика и таргетированная протеомика. В протеомике с шотганом белки, извлеченные из микробных или растительных образцов, проходят ферментативное переваривание, обычно с помощью трипсина, а полученные пептиды анализируются с помощью высокоразрешающих LC-MS/MS, часто с применением современных масс-спектрометров, таких как квадрупольные фазы (QTOF) или высокоразрешающие орбитальные масс-спектрометры55. Собранные данные по РС, известные как спектры MS/MS, затем сопоставляются с пептидными последовательностями путем поиска в базе данных белков, основанной на геноме организма или близкородственном виду, с помощью программных инструментов, таких как MaxQuant илиMascot 56,57. Этот процесс позволяет количественно оценивать изменения количества белков при различных условиях, что можно достичь либо методами без меток, либо с помощью методов маркировки изотопов, таких как маркировка стабильных изотопов аминокислотами в клеточной культуре (SILAC) или изобарное метирование реагентами TMT/iTRAQ, чтобы определить, какие биосинтетические ферменты повышаются илипонижают 58, 59. В отличие от этого, методы таргетной протеомики, включая мониторинг выбранных реакций (SRM) или мониторинг параллельных реакций (PRM), сосредоточены на конкретном наборе ионов пептидов, часто уникальных пептидах ключевых биосинтетических ферментов или регуляторных белков, что позволяет точно и чувствительно измерять эти пептиды на несколькихобразцах 60,61.
- Инновационные подходы в протеомике
Одной из значительных задач протеомного анализа вторичного метаболизма является обнаружение крупных биосинтетических ферментов, таких как нерибосомные пептид-синтетазы и поликетид-синтазы, которые часто превышают 100 кДа по размеру и дают мало обнаруживаемых пептидов при стандартных протоколах пищеварения, что затрудняет их наблюдение. Для решения этой проблемы Бампус и соавторы разработали метод, известный как PrISM, который улучшает обнаружение белков NRPS и PKS с помощью специфического кофактора, содержащегося на этихферментах 62. PrISM интегрирует традиционную протеомику для дробовиков с анализом на выброс фосфопантеинила (Ppant). Примечательно, что ферменты NRPS и PKS имеют ковалентно прикреплённую руку Ппанта к своим доменам носителя ацила или пептидил; во время фрагментации MS/MS эта протезная группа часто образует уникальный ион фрагмента, называемый ионом «выброса Ппанта». Путём вычислительной фильтрации данных LC-MS/MS для этого диагностического иона позволяет методу PrISM эффективно выделять пептиды, полученные из ферментов NRPS и PKS, в сложной смеси всех клеточных белков. Эта стратегия успешно выявила скрытые биосинтетические пути с помощью протеомики. Например, рабочий процесс PrISM позволил обнаруживать пептиды из комплекса граммицидина S-синтетазы (GrsA/GrsB) в культурах Bacillus brevis, установив прямую связь между этими ферментами NRPS и производством антибиотика грамицидина S в этоморганизме 62. Важно, что протеомная идентификация GrsA/GrsB не требовала предварительного геномного знания B. brevis, что показывает, что в некоторых случаях протеомный анализ может выявить активные биосинтетические пути NPs даже у организмов, чьи геномы ещё не секвенированы.
- Геномно-ориентированная протеомика
Когда геномная последовательность доступна, возможности протеомики могут значительно увеличиться за счёт использования базы данных, специфичных для штамма, для идентификации пептидов. Например, в исследовании, анализирующем протеом Streptomyces lilacinus, учёные провели два анализа: один — поиском спектров по общей базе данных белков, другой — по специальной базе данных, основанной на секвенированном геномеэтого штамма 63. Анализ, основанный на геноме, дал примерно в десять раз больше выявленных пептидов и пептидов, связанных с шестью различными BGC внутри организма. Примечательно, что три из этих идентифицированных кластеров соответствовали ранее известным «орфанным» метаболитам, включая грейбактин, ракицидин D и специфический сидерофор, при этом их биосинтетические ферменты были подтверждены как экспрессированные. Оставшиеся обнаруженные скопления казались новыми и нехарактеризованными. Этот пример демонстрирует, что интеграция геномной информации в протеомные рабочие процессы позволяет подтвердить, какие биосинтетические пути активно экспрессируются в штамме, тем самым отдавая приоритет этим кластерам генов для выделения и характеристики их продуктов.
Кроме того, протеомные методы могут выявить молекулярные цели и способы действия NP, область, часто называемую химической протеомикой. Например, профилирование белков на основе активности (ABPP) использует маломолекулярные зонды, обычно производные или аналоги NPs, которые реагируют с клеточными мишенями соединения, маркируя эти белки для обогащения и идентификации через MS64. Этот метод позволяет выявить белковые мишени, к которым связывается конкретная NP или связанная молекула внутри клетки. Другой метод, термопрофильное профилирование протеомов (TPP), включает нагрев образцов белков при наличии или отсутствии соединения, чтобы определить, какие белки демонстрируют изменённую термическую стабильность, что указывает на связывающеевзаимодействие 65. Эти химические протеомные подходы бесценны для валидации биологических мишеней NPs и разъяснения их механизмов действия, тем самым дополняя открытие самих NPs.
5. ML и ИИ для интеграции и прогнозирования омиксов
- Интеграция мультиомикс-данных с машинным обучением
Захватывающим рубежом в открытии NP является применение машинного обучения и искусственного интеллекта для интеграции данных омиксов для функциональных прогнозов. В области геномики были разработаны контролируемые алгоритмы машинного обучения, включая случайные леса, опорные векторные машины и глубокие нейронные сети, для выявления закономерностей в BGC, связанных с определёнными типами NP. Например, эти модели ML могут классифицировать BGC на основе общего класса молекул, которые они производят, или даже прогнозировать определённые характеристики химической структуры, полученной из генной последовательности. Обзор, проведённый Dason MS и коллегами, выделяет различные инструменты машинного обучения, предназначенные для декодирования «языка» BGC с использованием данных последовательностей ДНК или аминокислот для определения структуры и биоактивности соответствующих NP66. Эти модели обычно опираются на обширные базы данных известных генных кластеров и соединений для изучения взаимосвязей между ними, что позволяет предсказывать потенциальную биологическую активность новых соединений. Например, они могут оценить, может ли продукт из нехарактеризованного BGC обладать антибиотиками или противораковыми свойствами. Значительные достижения, способствовавшие реализации этих возможностей, включают использование больших обучающих наборов данных, таких как тысячи известных NP-структур и кластеров генов, инновационные методы представления, такие как вложение последовательностей и графовые нейронные сети, отражающие особенности генных кластеров и химических структур, а также многопараметрические модели, объединяющие различные геномные и химические дескрипторы для повышения точности прогнозирования.
В области метаболомики методы ИИ значительно улучшают интерпретацию сложных масс-спектральных данных. Ярким примером является инструмент CSI:FingerID, который использует машинное обучение для прогнозирования структурного отпечатка молекулы из её спектра MS/MS. Эта способность помогает выявлять неизвестные метаболиты, предлагая потенциальные подструктуры и кандидатные соединения67. Аналогично, модели глубокого обучения использовались для спектральной аннотации; сверточные нейронные сети и, более недавно, архитектуры на основе трансформаторов, такие как модель «DreaMS», изучают фрагментационные паттерны из обширных спектральных библиотек. Эти модели могут предлагать структуры для неизвестных спектров на основе изученных ими закономерностей, часто превосходя традиционные эвристические методы, особенно для метаболитов, которые не имеют точных совпадений в существующих базах данных68. Помимо структурной аннотации, ML также вносит вклад в метаболомику, выявляя глобальные закономерности. Например, неконтролируемые алгоритмы визуализации, такие как t-SNE (t-распределенное стохастическое соседское вложение) и UMAP (Uniform Manifold Approximation and Projection), могут уменьшить размерность нецелевых наборов метаболомики, облегчая кластеризацию образцов на основе сходств их метаболитных профилей. Тем временем контролируемые классификаторы могут связывать специфические метаболитные сигнатуры с фенотипическими признаками или биоактивностью образцов, что дополнительно обогащает анализ69,70,71.
ML всё чаще используется для интеграции различных наборов данных омиксов, что позволяет более полно понять биосинтез и функции NP. Объединяя данные из геномики, транскриптомики, протеомики и метаболомики, интегративные модели могут выявить связи, которые могут быть упущены при отдельном изучении каждого типа данных. Например, исследователи могут создавать сети корреляции ген-метаболит, которые связывают уровни экспрессии генов или белков с уровнями производства метаболитов. ML-модели, обученные на этих интегрированных данных, могут предсказывать, какие генные кластеры, вероятно, отвечают за определённые метаболиты или биологическую активность72,73. Современные многомерные методы, такие как мультиомический факторный анализ (доступный в инструментах, таких как MOFA) и регуляризованные многомерные методы (встречающиеся в таких пакетах, как mixOmics), способствуют выявлению латентных факторов, охватывающих различные типы данных, например, набор коэкспрессированных генов вместе с группой сопутствующих метаболитов74,75,76. На практике, для открытия NP различные подходы помогают приоритизировать кандидатные генные кластеры, демонстрируя связь с наблюдаемыми метаболитами или фенотипами. Ярким примером такой интегративной, управляемой ИИ стратегии является открытие нового семейства рибосомно синтезированных и RiPP с использованием алгоритма DecRiPPter. Этот алгоритм использует модель на базе опорной векторной машины (SVM) для анализа геномных данных по криптическим пептидам прекурсоров RiPP, а затем перекрёстно сопоставляет эти прогнозы с пангеномным анализом для исключения известных соединений. Если применить к 1 295 Streptomyces геномы, DecRiPPter успешно выявил 42 предполагаемых новых семейства RiPP, которые ранее были упущены традиционными методами добычи генома. Среди этих предсказанных кластеров один был экспериментально проверен для получения нового лантипептида класса V, который исследователи назвали «пристинин A3». Индуцируя экспрессию этого безмолвного генного кластера, было выделено соединение пристинин A3, а его структура определена с помощью ЯМР и РС, что позволило выявить два ранее неизвестных фермента, образующих лантионин, закодированных в этом пути77. Это достижение подчёркивает, как анализы на основе ИИ могут выявлять скрытые NP: модель машинного обучения обнаружила иначе нераспознанный генетический сигнал, направляя экспериментальные усилия по обнаружению новой молекулы.
- Новые приложения ИИ
Помимо текущих приложений, несколько новых стратегий на базе ИИ приведут к дальнейшей революции в исследованиях NP. Одной из перспективных областей является вычислительный ретросинтез и проектирование путей, где разрабатываются модели глубокого обучения для предложения биосинтетических путей или шагов синтетической химии для известных NP и их аналогов, что может значительно улучшить проектирование и производство новыхсоединений 78,79. Ещё одним захватывающим рубежом является предсказание функции ферментов с помощью ИИ. Используя современные инструменты прогнозирования структуры белков на основе алгоритмов глубокого обучения, а также методы машинного обучения, такие как контрастное обучение на белковых последовательностях, исследователи начинают делать выводы о вероятной активности нехарактеризованных ферментов, обнаруженных в BGC. Это может дать представление о типах химических превращений, которые эти ферменты катализируют 80,81,82. Разрабатываются полностью интегрированные конвейеры омикс-химии, где платформы ИИ стремятся автоматически соединять масс-спектральные признаки с геномнымиданными 83,84. В принципе, такая система могла бы анализировать набор данных LC-MS/MS из сложного образца вместе с геномными последовательностями из той же среды, что позволяло ей предсказывать, какой генный кластер отвечает за каждый неопознанный метаболит, оценивая совпадения ген-метаболит. Хотя эти подходы всё ещё находятся в зачаточном состоянии, они предполагают будущее, в котором ИИ сможет автономно связывать гены с молекулами, значительно ускоряя процесс от данных омиксов к открытию новых NP.
- Управление данными и этические проблемы в поиске NP с помощью ИИ
Современные мультиомические исследования дают значительное количество разнообразных данных, но эффективность прогнозов ИИ во многом зависит от качества и согласованности этих наборов данных. Когда обучающие наборы плохо аннотированы или предвзяты, они могут привести к вводящим в заблуждение результатам и неудачнымвалидациям 85. Для решения этой проблемы исследователям следует внедрять принципы FAIR — Findable, Accessible, Intercomable и Reuseable — чтобы способствовать прозрачности, воспроизводимости и широкому повторному использованиюданных 86. Этот подход включает обмен как положительными, так и отрицательными результатами, тщательное документирование конвейеров предварительной обработки данных и предоставление анализа кода для облегчения независимой проверки. Кроме того, внедрение новых цифровых инфраструктур, таких как электронные лабораторные блокноты (ELN) и контейнерные рабочие процессы, имеет решающее значение для улучшения сбора данных и обеспечения стандартизированногокураторства 87,88.
Хотя ИИ значительно ускоряет поиск NP, он также поднимает важные этические вопросы. Алгоритмы, обучающиеся на неполных или предвзятых наборах данных, могут усиливать существующие неравенства, подчёркивая необходимость разнообразия и репрезентативных обучающихданных 89. Кроме того, использование объяснимых методов ИИ жизненно важно для повышения прозрачности и помощи учёным в понимании прогнозов, обеспечивая то, что ИИ служит поддерживающим инструментом под контролем человека, а не принимающим решения85. Этические соображения также включают конфиденциальность данных, особенно при использовании клинических или человеческих наборов данных, а также последствия для рабочей силы, поскольку автоматизация всё больше влияет на исследовательскуюсреду 90. Для решения этих проблем системы ИИ должны регулярно подвергаться аудитам, оценке предвзятости и строгому регуляторному контролю, что поможет поддерживать справедливость, подотчётность и надёжность в области исследований NP.