Artigo de revisão

Multi-Ômica e Análise Integrativa na Descoberta de Produtos Naturais

1.4K vistas

DOI:

10.3791/69458

28 de novembro de 2025

Neste artigo

Resumo

Esta revisão enfatiza metodologias multi-ômicas de ponta, incluindo metabolômica, genômica, transcriptômica e proteômica, que são integradas com inteligência artificial e aprendizado de máquina, bem como análise de redes, para aprimorar a descoberta e validação funcional de novos produtos naturais.

Resumo

Produtos naturais (NPs) há muito tempo são uma fonte essencial de novos compostos bioativos para a descoberta de medicamentos; no entanto, métodos tradicionais de triagem e isolamento desses compostos podem ser lentos e frequentemente gerar retornos decrescentes. Felizmente, abordagens avançadas de multi-ômica e computacional apresentam soluções poderosas para esses desafios. Esta revisão destaca metodologias inovadoras que integram metabolômica, genômica, transcriptômica e proteômica com bioinformática e química analítica para acelerar a descoberta de NPs. Por exemplo, plataformas de metabolômica não direcionadas, como cromatografia líquida de alta resolução-espectrometria de massa tandem (LC-MS/MS) e redes moleculares Global Natural Products Social (GNPS), permitem o perfilamento abrangente de novos compostos, enquanto estratégias direcionadas de marcação isotópica aprimoram esse processo. Além disso, ferramentas de mineração genômica e metagenomica, como antibióticos e shell de análise de metabólitos secundários (antiSMASH), Deep Biosynthetic Gene Cluster (DeepBGC) e Pipeline for Reconstructing Integrated Syntheses of Metabolites (PRISM) identificam rapidamente clusters genéticos biossintéticos (BGCs) tanto em organismos cultivados quanto não cultivados, frequentemente usando expressão heteróloga para validar produtos. Análises transcriptômicas, incluindo sequenciamento de RNA (RNA-seq), redes de co-expressão e fluxômica, ajudam a esclarecer como as vias são reguladas, enquanto técnicas quantitativas de proteômica como marcadores de massa tandem/etiquetas isobáricas para quantificação relativa e absoluta (TMT/iTRAQ) e métodos sem marcador, juntamente com abordagens quimioproteômicas como ensaio de deslocamento térmico celular e perfil térmico de proteoma (TPP), revelam alvos moleculares e seus mecanismos de ação. Esta revisão também dá ênfase significativa ao papel da inteligência artificial (IA) e do aprendizado de máquina (ML) na integração de dados multi-ômicas, abrangendo atividades desde a construção de redes de correlação gênico-metabólito até o aproveitamento de grafos de conhecimento e redes neurais de grafos para fusão de dados e predição funcional. Por fim, esta revisão conclui discutindo os benefícios sinérgicos da multi-ômica para a descoberta de produtos naturais, abordando desafios técnicos atuais e explorando direções futuras para integração inteligente e de alta produtividade de dados para pesquisas de próxima geração em NP.

Introdução

Produtos naturais, que são moléculas produzidas por vários organismos, incluindo microrganismos e plantas, há muito tempo servem como uma fonte vital de medicamentos, que vão desde antibióticos como a penicilina até medicamentos anticâncer como o Taxol. Uma parte significativa dos nossos antibióticos e agentes quimioterápicos atuais é derivada desses compostosnaturais 1. No entanto, os métodos tradicionais usados para descobrir novos NPs, como o cultivo de microrganismos e o uso de isolamento guiado por bioensaio, tornaram-se cada vez mais difíceis. No final do século XX, o interesse farmacêutico em NPs diminuiu à medida que as empresas enfrentavam retornos decrescentes; muitos compostos fáceis de encontrar já haviam sido redescobertos, e os desafios técnicos associados à triagem e caracterização desses compostos tornaram o processo trabalhoso. Felizmente, essa tendência está se revertendo. Avanços recentes em cômicas e tecnologias analíticas estão revitalizando a busca porNPs 2,3. Por exemplo, o sequenciamento de DNA de alto rendimento permite que pesquisadores explorem genomas para aglomerados genéticos biossintéticos ocultos (BGCs), enquanto espectrometria de massa ultra-sensível (EM) pode identificar pequenas quantidades de novos metabólitos dentro de misturas complexas. Essas inovações tecnológicas chegam em um momento crucial, pois há uma demanda global urgente por novos tratamentos, especialmente antibióticos que podem combater bactérias resistentesa medicamentos 4. A pesquisa moderna em NPs está crescendo para enfrentar esse desafio ao integrar a expertise tradicional em NPs com técnicas de análise genômica e química de última geração.

A integração multi-ômica é central para os avanços atuais na pesquisa biológica. O conceito de "multi-ômica" envolve a análise simultânea de várias camadas de dados biológicos, como o DNA (genoma) de um organismo, transcritos de mRNA, proteínas e metabólitos. A aplicação de abordagens ômicas transformou a pesquisa sobre NPs, permitindo triagem de alto rendimento, identificação rápida de novos compostos e exploração mais profunda das redes intrincadas que moldam sistemas biológicos5. Ao integrar esses conjuntos de dados em múltiplas camadas, os pesquisadores podem vincular diretamente genes aos metabólitos que codificam, construindo assim uma compreensão mais abrangente da biossíntesedos NPs 6. Por exemplo, algoritmos de mineração genômica podem identificar um conjunto de genes que pode codificar um novo antibiótico, enquanto dados transcriptômicos podem indicar se esses genes estão ativamente expressos. Além disso, o perfil metabolômico pode identificar a molécula antibiótica correspondente no extrato de culturado organismo 7,8,9. Essa abordagem integrada acelera significativamente a descoberta de novos compostos e o entendimento de suas vias biossintéticas. Mais importante ainda, a identificação de alvos de fármacos está cada vez mais dependendo de abordagens multi-ômicas integradas, que estão gradualmente substituindo as estratégias tradicionais desingle-omics 10. Avanços recentes em química analítica, incluindo cromatografia líquida de alta resolução (LC-MS) e ressonância magnética nuclear (RMN), permitem que pesquisadores detectem e analisem estruturalmente novos NPs a partir de amostras biológicascomplexas 11,12. Essas técnicas produzem grandes quantidades de dados, e é aí que a bioinformática e o aprendizado de máquina (ML) se tornam essenciais. Algoritmos de inteligência artificial (IA) e análises baseadas em rede são cada vez mais utilizados para analisar dados multi-ômicas, revelando padrões e previsões significativas que seriam difíceis de discernir manualmente13,14. Ao unir tecnologias de ponta de omics com mineração de dados impulsionada por IA, os pesquisadores podem agora estabelecer um pipeline robusto para a descoberta e análise mais rápida e sistemática de NPs do que nunca.

Embora as estratégias multi-ômicas tenham avançado significativamente a descoberta dos NPs, sua implementação bem-sucedida depende fortemente de um planejamento experimental meticuloso. Por exemplo, o tipo e a qualidade das amostras são cruciais; É essencial coletar culturas microbianas bem preservadas, isolados ambientais ou materiais clínicos em condições que minimizem a degradação de ácidos nucleicos emetabólitos 15. A profundidade do sequenciamento também desempenha um papel vital na resolução de dados: o sequenciamento do genoma completo geralmente requer uma cobertura de pelo menos 30× para montagem precisa, enquanto o perfil transcriptômico frequentemente requer dezenas de milhões de leituras para identificar transcritos de baixa abundância, conforme recomendado peloGenohub 16. Além disso, para metabolômica, são necessários solventes e métodos de extração adequados para capturar diversas classes químicas; Deve-se escolher conscientemente protocolos de extração que minimizem o viés e maximizem a reprodutibilidade17. No entanto, essas metodologias trazem seus próprios desafios. Integrar grandes conjuntos de dados heterogêneos pode ser computacionalmente intensivo, e a instabilidade ou baixa abundância de metabólitos pode complicar análisessubsequentes 18. Além disso, os altos custos ou o tamanho limitado das amostras podem restringir o desenho dosestudos 19. Contaminação e viés nos dados de sequenciamento, especialmente em amostras de baixa entrada ou diluídas, também apresentam riscos significativos, como destacado por Lusk et al. em relação à contaminação em sequenciamentode alto rendimento 20. Ao reconhecer essas limitações práticas e técnicas, os pesquisadores podem tomar decisões informadas sobre combinações multi-ômicas adequadas e interpretar seus resultados com a cautela necessária.

Esta revisão destaca os métodos inovadores que estão revolucionando a descoberta dos NPs por meio do uso de multi-ômicas e análises integrativas. Também explora a crescente importância do ML e da IA na ligação desses diversos fluxos de dados, incluindo a construção de redes de correlação gene-metabólito e a identificação de clusters gênicos que provavelmente produzirão novos compostos bioativos. Além disso, examina a importância e o potencial futuro dessa abordagem integrada. Em conclusão, a combinação de diferentes tecnologias de omics com análises avançadas não apenas acelera a descoberta de novos NPs hoje, mas também está abrindo caminho para o desenvolvimento de medicamentos de próxima geração que são urgentemente necessários pela sociedade.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Revisão e perspetiva

Para compilar esta revisão, realizamos uma busca abrangente na literatura em múltiplos bancos de dados e plataformas de indexação, incluindo PubMed, Scopus, Web of Science, ScienceDirect e Google Scholar. A busca abrangeu publicações de janeiro de 2015 até julho de 2025. Palavras-chave e combinações booleanas incluíam: "descoberta de produto natural", "ômica", "metabolômica", "genômica", "transcriptômica", "proteômica", "aprendizado de máquina", "inteligência artificial", "clusters genéticos biossintéticos" e "integração multi-ômica". Listas de referências dos artigos-chave e revisões recentes também foram analisadas para identificar publicações relevantes adicionais. Além de estudos revisados por pares, um número limitado de artigos pré-publicados de plataformas como bioRxiv e medRxiv foi consultado quando forneceram insights oportunos e relevantes, ainda não disponíveis na literatura publicada. Todos os preprints são claramente rotulados para manter a transparência. Esta seção revisa os desenvolvimentos mais recentes e perspectivas futuras nas áreas-chave da descoberta de NPs baseadas em ômicas, focando especificamente em metabolômica, genômica, transcriptômica e proteômica. Além da integração deles via IA/ML. As principais ferramentas e recursos discutidos nessas áreas estão compilados para referência na Tabela 1.

1. Metabolômica na descoberta de NPs

  1. Plataformas analíticas para metabolômica
    A metabolômica é crucial para a descoberta de NPs, pois permite uma análise detalhada das pequenas moléculas geradas por vários organismos. As principais ferramentas analíticas usadas para caracterizar os metabolomas dos NPs incluem técnicas de EM de alta resolução, como LC-MS/MS e cromatografia gasosa-MS (gc-MS), juntamente com espectroscopia deRMN 21,22. Fluxos de trabalho LC-MS/MS não direcionados, como o LC-MS de ultra-alto desempenho combinado com o MS/MS, permitem a identificação de uma ampla gama de metabólitos em misturas complexas, enquanto o GC-MS se destaca no perfil de compostos voláteis. Além disso, novos métodos como a EM em em infusão direta em tandem e a imagem em EM estão aprimorando o kit de ferramentas de metabolômica para NPs23,24. Técnicas avançadas de espectrometria de massa, incluindo a EM multimodal, que combina modos iônicos positivos e negativos ou emprega fragmentação MSn em múltiplos estágios, e métodos hifenizados como LC-MS acoplados à RMN, oferecem insights estruturais mais profundos sobre os metabólitosdetectados 25,26.
  2. Ferramentas de processamento de dados e computacionais
    Ferramentas de software especializadas desempenham um papel crucial no processamento e interpretação de dados de metabolômica. Programas como XCMS, MZmine e OpenMS são comumente usados para detectar e alinhar características cromatográficas, ou picos, enquanto etapas meticulosas de pré-processamento de dados, como alinhamento de picos, normalização e filtragem, são essenciais para alcançar perfis metabólicosreprodutíveis 27. A identificação de compostos é suportada por bibliotecas espectrais MS/MS, incluindo NIST e mzCloud, bem como ferramentas de fragmentação in silico como SIRIUS e MetFrag28. A plataforma Global Natural Products Social (GNPS) emergiu como um recurso chave para redes moleculares, que organiza espectros MS/MS relacionados para enfatizar famílias químicas e facilitar a dereplicação de compostosconhecidos 29. Por exemplo, uma análise usando GNPS com dados de LC-MS/MS de culturas de Streptomyces identificou com sucesso antibióticos conhecidos como espiramicina e actinomicina, além de análogos previamentenão relatados 30,31. A técnica de rede molecular agrupava efetivamente espectros desconhecidos relacionados, e a adição da rede de identidade iônica melhorou a conectividade das características. Essas análises baseadas em rede, quando combinadas com ferramentas estatísticas multivariadas como a análise de componentes principais e a análise discriminante de mínimos quadrados parciais ortogonais, bem como a análise de redes de correlação, podem vincular padrões de produção de metabólitos a condições biológicas ou ambientais específicas. Em um estudo em particular, a GNPS em rede molecular de extratos de fermentação de Streptomyces associado à planta demonstrou perfis metabólicos distintos que variaram dependendo do mediador de crescimento utilizado. Metabólitos conhecidos, incluindo espiramicina, actinomicina e um composto carcinogênico chamado lingbyatoxina, foram detectados; No entanto, muitos nós de rede não correspondiam a nenhuma entrada nos bancos de dadosespectrais 32. Essa descoberta sugere a presença de metabólitos genuinamente novos, destacando como metabolômicas não direcionadas, em conjunto com o GNPS, podem identificar novos NPs potencialmente novos para exploração adicional.
    Combinar triagem metabolômica com bioensaios funcionais facilita a rápida priorização de cepas ou extratos que geram compostos bioativos. Além disso, recursos comunitários emergentes como o Natural Products Atlas (NPAtlas), juntamente com pipelines integrados de análise metaboloma-genoma, são fundamentais para associar metabólitos detectados com seus BGCs nos organismosde origem 33,34. Essa estratégia integrativa permite que pesquisadores correlacionem sinais de metabólitos com dados genômicos, aumentando assim a eficiência na identificação de NPs e no rastreamento de suas origens.

2. Descoberta da genômica na NPs

Na última década, a pesquisa em NPs microbianos entrou em uma era transformadora de "mineração profunda", impulsionada por avanços como sequenciamento de alta cadência, EM ultra-sensível e de alta resolução e abordagens multi-ômicasintegradas 35. Essas ferramentas mudaram os esforços de descoberta de isolamento fortuito, passando por exploração direcionada e orientada por dados. Pipelines de mineração de genomas, incluindo antiSMASH 7.0 e DeepBGC, agora permitem a identificação sistemática de BGCs enigmáticos, especialmente em táxonspouco explorados 36,37.

  1. Sequenciamento de alta taxa e montagem híbrida
    Tecnologias de sequenciamento de DNA de alta potência, como o sequenciamento de DNA de leitura curta e alta capacidade combinado com plataformas de sequenciamento de leitura longa, transformaram significativamente o estudo genômico de organismos que produzem NPs. Ao empregar estratégias híbridas de montagem que integram leituras longas e curtas, os pesquisadores podem alcançar montagens genômicas de alta contiguidade, essenciais para capturar BGCs inteiros dentro de umgenoma 38. Além disso, o sequenciamento metagenômico, que inclui a recuperação de genomas montados em metagenomas, amplia a descoberta de BGCs para microrganismos não cultivados, permitindo que cientistas explorem o DNA ambiental em busca de seu potencialbiossintético 39. Em casos em que métodos convencionais de montagem genômica falham na resolução de grandes ou repetitivos aglomerados gênicos, técnicas baseadas em bibliotecas, como bibliotecas de cosmid ou cromossômicos artificiais bacterianos, podem ser utilizadas para isolar e clonar fragmentos genômicos substanciais. Essa abordagem facilita a caracterização de clusters gênicos completos por meio de sequenciamento direcionado ou expressão heteróloga, aprimorando assim nossa compreensão da base genética para a biossíntese dosNPs 40,41.
  2. Ferramentas de mineração genômica
    Ferramentas bioinformáticas especializadas são essenciais para analisar dados genômicos e identificar as assinaturas distintas das vias metabólicas secundárias. Programas como antiSMASH, PRISM e DeepBGC desempenham um papel crucial nesse processo ao detectar automaticamente BGCs candidatos. Eles fazem isso reconhecendo domínios biossintéticos específicos, como aqueles associados a sínteses peptídicas não ribossomais, sintases policetidas, vias peptídicas sintetizadas e modificadas pós-traducionalmente (RiPP) e ciclases terpeno, entre outras. Para auxiliar na dereplicação, bancos de dados como o MIBiG, que compila BGCs conhecidos e seus produtos, e o NPAtlas, que cataloga NPs conhecidos, ajudam pesquisadores a comparar novas sequências ou compostos a exemplosestabelecidos 37,42,43. Algoritmos de agrupamento, como o BiG-SCAPE, juntamente com ferramentas como o CORASON, organizam BGCs relacionados em famílias, oferecendo uma visão de rede da diversidade biossintética e facilitando a identificação de novas famílias de clusters por meio de comparações com asconhecidas 44. Análises bioinformáticas adicionais, incluindo buscas BLAST e varreduras ocultas do modelo de Markov, podem prever as funções potenciais das enzimas codificadas em um BGC, enquanto abordagens genômicas comparativas, como análise de sintenia e coevolução de genes, ajudam a refinar essas previsõesfuncionais 45. Além disso, os dados genômicos permitem a anotação de elementos regulatórios ligados à biossíntese dos NPs, incluindo promotores específicos de vias e reguladorestranscricionais 46. Esses insights fornecem uma base para a engenharia de vias de viários; por exemplo, técnicas de biologia sintética como clonagem de recombinação associada a transformações e recombinação Red/ET capacitam pesquisadores a capturar e expressar BGCs silenciosos ou crípticos em um organismo hospedeiro heterólogo, ativando assim a produção de seusmetabólitos 47.
    Os esforços de mineração genômica levaram com sucesso à descoberta de novos NPs ao se concentrarem em sinais genéticos específicos. Por exemplo, uma busca sistemática por genes ligados à resistência a glicopeptídeos revelou vários BGCs incomuns previstos para codificar novos antibióticos. Esse método resultou na identificação de dois compostos inovadores, compstatina e cobramicina, ambos com mecanismos de ação únicos ao direcionar as autolisinasbacterianas 48. De forma semelhante, explorar o microbioma humano em busca de conteúdo gênico biossintético resultou em um candidato a lipopeptídeo conhecido como "humicin", reconhecido por sua potencial eficácia contra Staphylococcus e as espécies 49 de Streptococcus. Nesses casos, os compostos foram inicialmente identificados por métodos computacionais, com suas estruturas químicas previstas com base em dados genômicos. Subsequentemente, essas moléculas previstas foram sintetizadas quimicamente e demonstraram as atividades antibióticas esperadas, validando assim a estratégia de descoberta baseada no genoma. Em uma escala mais ampla, o sequenciamento em larga escala de várias bactérias, incluindo muitos actinomicetos raros, está revelando uma grande quantidade de clusters genéticos "enigmáticos" de BGCs cujos produtos permanecem desconhecidos. Por exemplo, investigações sobre genomas de Streptomyces revelaram milhares de BGCsnão caracterizados 50. Uma abordagem emergente para ligar esses agrupamentos de órfãos a metabólitos reais envolve a integração de análises metabolômicas com levantamentos genômicos. Ao correlacionar a presença ou expressão de um cluster gênico com a detecção de características únicas do metabólito por meio de plataformas como GNPS ou bancos de dados espectrais de massa, os pesquisadores podem começar a atribuir produtos químicos provisórios aos inúmeros novos BGCs, facilitando assim a descoberta de NPs verdadeiramente novos a partir de dados genômicos.

3. Transcriptômica na descoberta de produtos naturais

Análises transcriptômicas oferecem uma perspectiva dinâmica sobre a atividade dos BGCs ao medir a expressão de mRNA sob várias condições. Especificamente, experimentos de RNA-seq podem descobrir quais BGCs são ativamente transcritos e como seus níveis de expressão flutuam em resposta a mudanças ambientais ou experimentais. Ao comparar os níveis de transcritos entre diferentes condições, a análise de expressão diferencial, utilizando ferramentas como DESeq2 ou edgeR, pode identificar BGCs que estão regulados para cima ou para baixo, destacando assim clusters gênicos que podem ser induzíveis ou permanecer silenciosos sob condições padrão51. Embora o RNA-seq convencional realizado em células cultivadas em massa seja a abordagem típica para investigar a expressão de BGC, técnicas mais avançadas como RNA-seq de célula única estão começando a ser utilizadas em microbiomas complexos. Essa mudança permite a observação da expressão gênica em organismos ambientais que são difíceis decultivar 52,53. Um fluxo de trabalho padrão de RNA-seq geralmente inclui mapeamento de leituras para um genoma de referência usando alinhadores como STAR ou HISAT2, quantificação da expressão gênica com ferramentas como featureCounts ou Kallisto, e normalização dos dados para identificar mudanças significativas na expressão. Após isso, a análise de redes de coexpressão, frequentemente realizada com o pacote WGCNA, pode agrupar genes que exibem padrões de expressão semelhantes. Quando os dados do metabólito também estão disponíveis, essas redes podem ser expandidas para incorporar metabólitos, ligando assim compostos específicos aos genescoexpressos 54.

Dados transcriptômicos têm se mostrado valiosos na identificação de vias biossintéticas condicionalmente ativas. Um exemplo notável dessa abordagem é encontrado em uma comparação detalhada de quatro cepas deSalinispora 51. Neste estudo, foi revelado que mais da metade dos BGCs de cada cepa foram expressos em algum grau, com muitos agrupamentos inativos em uma cepa apresentando expressão em outra. Ao analisar os perfis de expressão gênica dessas cepas, os pesquisadores conseguiram identificar vários fatores regulatórios que pareciam silenciar ou ativar aglomerados específicos. Esse método integrativo levou à identificação de uma família de NPs até então desconhecida, conhecida como salinipostinas. Dados transcriptômicos indicaram um agrupamento gênico críptico como fonte potencial para um composto não identificado; Quando esse agrupamento foi induzido a se expressar (por meio de mudanças regulatórias), resultou na produção de moléculas de salinipostina, que foram posteriormente isoladas e estruturalmente caracterizadas. Este estudo exemplifica como a transcriptômica pode facilitar a descoberta dos NPs: ao analisar a expressão diferencial gênica, os pesquisadores podem destacar BGCs candidatos, e a correlação entre expressão gênica e perfis de metabólitos fornece evidências de apoio para as relações gene-metabólito que podem ser validadas por meio de experimentos direcionados.

4. Proteômica na descoberta de NPs

  1. Abordagens de espingarda e proteômica direcionada
    A proteômica, que envolve o estudo em larga escala de proteínas, oferece uma perspectiva vital na pesquisa em NPs ao medir diretamente as enzimas e proteínas que desempenham papéis nas vias biossintéticas. Geralmente, abordagens proteômicas podem ser categorizadas em dois tipos principais: proteômica shotgun (não direcionada) e proteômica direcionada. Na proteômica shotgun, proteínas extraídas de amostras microbianas ou vegetais passam por digestão enzimática, tipicamente com tripsina, e os peptídeos resultantes são analisados usando LC-MS/MS de alta resolução, frequentemente empregando espectrômetros de massa avançados como o tempo de voo quadrupolar (QTOF) ou espectrômetros de massa de armadilha orbitalde alta resolução 55. Os dados coletados da EM, conhecidos como espectros MS/MS, são então comparados a sequências peptídicas por meio de pesquisas em um banco de dados de proteínas derivado do genoma do organismo ou de uma espécie intimamente relacionada, utilizando ferramentas de software como MaxQuant ou Mascot56,57. Esse processo permite quantificar mudanças na abundância de proteínas sob diferentes condições, o que pode ser alcançado tanto por métodos sem marcador quanto por técnicas de marcação de isótopos, como a marcação de isótopos estáveis por aminoácidos em cultura celular (SILAC) ou a marcação isobárica com reagentes TMT/iTRAQ, para determinar quais enzimas biossintéticas estão reguladas para cima ou para baixo58, 59. Em contraste, métodos de proteômica direcionada, incluindo monitoramento de reações selecionadas (SRM) ou monitoramento de reações paralelas (PRM), concentram-se em um conjunto específico de íons peptídicos, frequentemente péptídeos únicos de enzimas biossintéticas ou proteínas reguladoras chave, permitindo quantificação precisa e sensível desses peptídeos em múltiplasamostras 60,61.
  2. Abordagens inovadoras em proteômica
    Um desafio significativo na análise proteômica do metabolismo secundário é a detecção de grandes enzimas biossintéticas, como sintetas peptídicas não ribossómicas e policetidas sintases, que frequentemente ultrapassam 100 kDa de tamanho e produzem poucos peptídeos detectáveis com protocolos digerentes padrão, tornando-as difíceis de observar. Para enfrentar essa questão, Bumpus et al. desenvolveram um método conhecido como PrISM, que aprimora a detecção das proteínas NRPS e PKS utilizando um cofator específico encontrado nessasenzimas 62. O PrISM integra proteômica convencional de espingarda com um ensaio de ejeção de fosfofinanteteinil (Ppant). Notavelmente, as enzimas NRPS e PKS possuem um braço Ppant covalentemente ligado em seus domínios portadores acil ou portadores peptidil; durante a fragmentação MS/EM, esse grupo protético frequentemente gera um íon fragmentado único, chamado de íon "ejeção de Ppant". Ao filtrar computacionalmente os dados LC-MS/MS para esse íon diagnóstico, o método PrISM pode destacar efetivamente peptídeos derivados das enzimas NRPS e PKS em meio à mistura complexa de todas as proteínas celulares. Essa estratégia conseguiu descobrir vias biossintéticas ocultas por meio da proteômica. Por exemplo, o fluxo de trabalho PrISM permitiu a detecção de peptídeos do complexo gramicidina S sintetase (GrsA/GrsB) em culturas de Bacillus brevis, estabelecendo uma ligação direta entre essas enzimas NRPS e a produção do antibiótico gramicidina S nesseorganismo 62. Importante destacar que a identificação proteômica de GrsA/GrsB não exigiu conhecimento genômico prévio de B. brevis, ilustrando que, em certos casos, a análise proteômica sozinha pode revelar vias biossintéticas ativas de NPs mesmo em organismos cujos genomas ainda não foram sequenciados.
  3. Proteômica informada pelo genoma
    Quando uma sequência genômica está disponível, o poder da proteômica pode ser significativamente aprimorado utilizando um banco de dados específico para cepas para identificação de peptídeos. Por exemplo, em um estudo que analisou o proteoma de Streptomyces lilacinus, pesquisadores realizaram duas análises: uma pesquisando espectros em um banco de dados geral de proteínas e outra em um banco de dados personalizado derivado do genoma sequenciado daquelacepa 63. A análise informada pelo genoma revelou aproximadamente dez vezes mais peptídeos identificados e detectou peptídeos ligados a seis BGCs distintos dentro do organismo. Notavelmente, três desses grupos identificados correspondiam a metabólitos "órfãos" já conhecidos, incluindo graybactina, rakicidina D e um sideróforo específico, com suas enzimas biossintéticas confirmadas como expressas. Os aglomerados demais detectados pareciam ser novos e não caracterizados. Este exemplo demonstra que a integração de informações genômicas em fluxos de trabalho proteômicos pode confirmar quais vias biossintéticas são ativamente expressas em uma cepa, priorizando assim esses clusters gênicos para o isolamento e caracterização de seus produtos.
    Além disso, métodos proteômicos podem iluminar os alvos moleculares e modos de ação dos NPs, área frequentemente chamada de proteômica química. Por exemplo, o perfil proteico baseado em atividade (ABPP) utiliza sondas de pequenas moléculas, tipicamente derivados ou análogos de NPs, que reagem com os alvos celulares do composto, marcando essas proteínas para enriquecimento e identificação por meio da MS64. Essa técnica pode descobrir os alvos proteicos aos quais uma NP específica ou molécula relacionada se liga dentro da célula. Outro método, o perfil térmico de proteoma (TPP), envolve aquecer amostras de proteína na presença ou ausência de um composto para determinar quais proteínas apresentam alterada estabilidade térmica, indicando uma interação de ligação65. Essas abordagens proteômicas químicas são inestimáveis para validar os alvos biológicos dos NPs e elucidar seus mecanismos de ação, complementando assim a descoberta dos próprios NPs.

5. ML e IA para integração e previsão de omics

  1. Integração de dados multi-ômicos com ML
    Uma fronteira empolgante na descoberta dos NPs é a aplicação de ML e IA para integrar dados de ômicas para previsões funcionais. No campo da genômica, algoritmos de ML supervisionados, incluindo random forests, máquinas de vetores de suporte e redes neurais profundas, foram desenvolvidos para identificar padrões em BGCs associados a tipos específicos de NPs. Por exemplo, esses modelos de ML podem categorizar os BGCs com base na classe geral de moléculas que produzem ou até mesmo prever certas características da estrutura química derivada da sequência gênica. Uma revisão feita por Dason MS e colegas destaca várias ferramentas de ML projetadas para decodificar a "linguagem" dos BGCs, utilizando dados de sequências de DNA ou aminoácidos para deduzir as estruturas e bioatividades dos NPs correspondentes66. Esses modelos normalmente dependem de extensos bancos de dados de clusters e compostos gênicos conhecidos para aprender as relações entre eles, permitindo previsões sobre a potencial atividade biológica de novos compostos. Por exemplo, eles podem avaliar se um produto de uma BGC não caracterizada pode possuir propriedades antibióticas ou anticancerígenas. Avanços significativos que facilitaram essas capacidades incluem a utilização de grandes conjuntos de dados de treinamento, como milhares de estruturas NP conhecidas e clusters gênicos, técnicas inovadoras de representação como embeddings de sequências e redes neurais de grafos que capturam características de clusters gênicos e estruturas químicas, e modelos multiparamétricos que combinam vários descritores genômicos e químicos para melhorar a precisão da previsão.
    No campo da metabolômica, as técnicas de IA estão aprimorando significativamente a interpretação de dados espectrais de massa complexos. Um exemplo notável é a ferramenta CSI:FingerID, que utiliza ML para prever a impressão digital estrutural de uma molécula a partir do seu espectro MS/MS. Essa capacidade ajuda na identificação de metabólitos desconhecidos ao sugerir subestruturas potenciais e compostos candidatos67. De forma semelhante, modelos de aprendizado profundo foram utilizados para anotação espectral; redes neurais convolucionais e, mais recentemente, arquiteturas baseadas em transformadores, como o modelo "DreaMS", aprendem padrões de fragmentação a partir de extensas bibliotecas espectrais. Esses modelos podem propor estruturas para espectros desconhecidos com base nos padrões que aprenderam, frequentemente superando métodos heurísticos tradicionais, especialmente para metabólitos que não têm correspondências exatas em bancos de dados existentes68. Além da anotação estrutural, o ML também contribui para a metabolômica ao identificar padrões globais. Por exemplo, algoritmos de visualização não supervisionada como t-SNE (t-distributed stochastic neighbor embedding) e UMAP (Uniform Manifold Approximation and Projection) podem reduzir a dimensionalidade de conjuntos de dados de metabolômica não direcionados, facilitando o agrupamento de amostras com base em semelhanças em seus perfis de metabólitos. Enquanto isso, classificadores supervisionados podem conectar assinaturas metabólicas específicas às características fenotípicas ou bioatividades das amostras, enriquecendo ainda mais a análise69,70,71.
    O ML está sendo cada vez mais utilizado para integrar diversos conjuntos de dados de omics, criando uma compreensão mais abrangente da biossíntese e função dos NPs. Ao unir dados de genômica, transcriptômica, proteômica e metabolômica, modelos integrativos podem revelar conexões que podem ser negligenciadas ao examinar cada tipo de dado separadamente. Por exemplo, pesquisadores podem construir redes de correlação gene-metabólito que relacionem os níveis de expressão de genes ou proteínas aos níveis de produção de metabólitos. Modelos de ML treinados com esses dados integrados podem então prever quais clusters gênicos provavelmente são responsáveis por metabólitos específicos ou atividades biológicas72,73. Técnicas multivariadas avançadas, como a análise fatorial multi-ômica (disponível em ferramentas como o MOFA) e métodos multivariados regularizados (encontrados em pacotes como o mixOmics), facilitam a identificação de fatores latentes que abrangem diferentes tipos de dados, como um conjunto de genes co-expressos ao lado de um grupo de metabólitos coexistentes74,75,76. Na prática, para a descoberta de NPs, diversas abordagens auxiliam na priorização de agrupamentos gênicos candidatos ao demonstrar uma conexão com metabólitos ou fenótipos observados. Um exemplo notável dessa estratégia integrativa guiada por IA é a descoberta de uma nova família de RiPPs sintetizados ribossosmicamente e RiPPs usando o algoritmo DecRiPPter. Esse algoritmo utiliza um modelo baseado em máquina de vetores de suporte (SVM) para analisar dados genômicos de peptídeos precursores RiPP enigmáticos e depois cruza essas previsões com análise pan-genômica para eliminar compostos conhecidos. Quando aplicado a 1.295 Streptomyces genomas, DecRiPPter identificou com sucesso 42 supostas novas famílias RiPP que anteriormente haviam sido ignoradas pelos métodos tradicionais de mineração genômica. Entre esses aglomerados previstos, um foi validado experimentalmente para produzir um novo lantipeptídeo classe V, que os pesquisadores nomearam "pristinina A3." Ao induzir a expressão desse aglomerado gênico silencioso, o composto pristinina A3 foi isolado, e sua estrutura foi determinada por RMN e EM, revelando duas enzimas formadoras de lantionina até então desconhecidas codificadas na via77. Essa conquista destaca como análises impulsionadas por IA podem revelar NPs ocultos: o modelo de ML detectou um sinal genético que não seria reconhecido, orientando os esforços experimentais para descobrir uma molécula nova.
  2. Aplicações emergentes de IA
    Além das aplicações atuais, várias estratégias emergentes impulsionadas por IA estão prestes a revolucionar ainda mais a pesquisa em NPs. Uma área promissora é a retrossíntese computacional e o design de vias, onde modelos de aprendizado profundo estão sendo desenvolvidos para sugerir rotas biossintéticas ou etapas de química sintética para NPs conhecidos e seus análogos, o que poderia melhorar significativamente o design e a produção de novoscompostos 78,79. Outra fronteira empolgante é a previsão da função enzimática usando IA. Ao aproveitar ferramentas modernas de predição da estrutura de proteínas baseadas em algoritmos de aprendizado profundo, juntamente com técnicas de aprendizagem automática como o aprendizado contrastivo em sequências de proteínas, os pesquisadores estão começando a deduzir as atividades prováveis de enzimas não caracterizadas encontradas em BGCs. Isso pode fornecer insights sobre os tipos de transformações químicas que essas enzimas catalisam 80,81,82. Pipelines totalmente integrados de ómicas para química estão sendo desenvolvidos, onde as plataformas de IA visam conectar automaticamente características espectrais de massa a dadosgenômicos 83,84. Em princípio, tal sistema poderia analisar um conjunto de dados LC-MS/MS de uma amostra complexa junto com sequências genômicas do mesmo ambiente, permitindo prever qual cluster gênico é responsável por cada metabólito não identificado ao pontuar correspondências entre cluster gênico e metabólito. Embora essas abordagens ainda estejam em sua infância, elas sugerem um futuro em que a IA poderia ligar genes a moléculas de forma autônoma, acelerando muito o processo desde dados ômicos até a descoberta de novos NPs.
  3. Governança de dados e desafios éticos na descoberta de NPs assistida por IA
    A pesquisa moderna em multi-ômica produz uma quantidade significativa de dados diversos, mas a eficácia das previsões de IA depende fortemente da qualidade e consistência desses conjuntos de dados. Quando os conjuntos de treinamento são mal anotados ou tendenciosos, eles podem resultar em resultados enganosos e validaçõesmalsucedidas 85. Para enfrentar essa questão, os pesquisadores devem implementar os princípios FAIR — Localizável, Acessível, Interoperável e Reutilizável — para promover transparência de dados, reprodutibilidade e reutilizaçãoextensa 86. Essa abordagem envolve compartilhar resultados positivos e negativos, documentar minuciosamente os pipelines de pré-processamento de dados e fornecer código de análise para facilitar a verificação independente. Além disso, a adoção de infraestruturas digitais emergentes, como cadernos eletrônicos de laboratório (ELNs) e fluxos de trabalho conteinerizados, é essencial para melhorar a captura de dados e garantir a curadoriapadronizada 87,88.
    Embora a IA acelere significativamente a descoberta de NPs, ela também traz à tona preocupações éticas cruciais. Algoritmos treinados com conjuntos de dados incompletos ou tendenciosos podem reforçar desigualdades existentes, ressaltando a necessidade de dados de treinamento diversos erepresentativos 89. Além disso, o uso de métodos explicáveis de IA é vital para aumentar a transparência e ajudar os cientistas a entender as previsões, garantindo que a IA atue como uma ferramenta de apoio sob controle humano, e não como um tomadorde decisão 85. Considerações éticas também abrangem a privacidade dos dados, especialmente ao usar conjuntos de dados clínicos ou derivados de humanos, bem como as implicações para a força de trabalho, à medida que a automação influencia cada vez mais o ambiente de pesquisa. Para enfrentar essas questões, os sistemas de IA devem estar sujeitos a auditorias regulares, avaliações de viés e rigorosa supervisão regulatória, o que ajudará a manter a justiça, a responsabilidade e a confiabilidade no campo da pesquisa dos NPs.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Conclusões

O estado atual da descoberta dos NPs utiliza uma combinação de química analítica e bioinformática, criando uma sinergia poderosa. Como descrito na Figura 1, tecnologias avançadas de óticas como metabolômica LC-MS, sequenciamento de alto rendimento, RNA-Seq e proteômica, trabalham em conjunto com análises computacionais, incluindo redes e ML, para formar um pipeline eficaz de descoberta. Desenvolvimentos recentes na área inclu...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Todos os autores afirmam que não existem relacionamentos financeiros ou pessoais que possam ser percebidos como potenciais conflitos de interesse.

Agradecimentos

Esse trabalho foi apoiado pela Fundação Nacional de Ciências Naturais da China (32500813), Programa de Bolsas de Pós-Doutorado da CPSF (GZC20251503), Programa de Ciência e Tecnologia de Sichuan (2024ZYD0149), Fundação Especial de Pesquisa para o Programa de Pós-Doutorado da Província de Sichuan (TB2024017), Projeto-Chave de Pesquisa e Desenvolvimento do Escritório de Ciência e Tecnologia Deyang (2024SZY016, 2023SZZ009), Centro de Capacitação e Educação Continuada da Comissão Nacional de Saúde (GWJJMB202510025060). e Fundo Especial para Projetos de Incubação do Hospital Popular Deyang (FRH202501, FHT202501). Reconhecemos que a Figura 1 foi criada usando o BioRender,

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Referências

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

An lises Multi micasPlataformas de Metabol micaAbordagens Gen micasT cnicas de Prote micaFerramentas de Bioinform ticaRedes MolecularesMinera o de GenomaIntelig ncia Artificial

Artigos relacionados