Para compilar esta revisão, realizamos uma busca abrangente na literatura em múltiplos bancos de dados e plataformas de indexação, incluindo PubMed, Scopus, Web of Science, ScienceDirect e Google Scholar. A busca abrangeu publicações de janeiro de 2015 até julho de 2025. Palavras-chave e combinações booleanas incluíam: "descoberta de produto natural", "ômica", "metabolômica", "genômica", "transcriptômica", "proteômica", "aprendizado de máquina", "inteligência artificial", "clusters genéticos biossintéticos" e "integração multi-ômica". Listas de referências dos artigos-chave e revisões recentes também foram analisadas para identificar publicações relevantes adicionais. Além de estudos revisados por pares, um número limitado de artigos pré-publicados de plataformas como bioRxiv e medRxiv foi consultado quando forneceram insights oportunos e relevantes, ainda não disponíveis na literatura publicada. Todos os preprints são claramente rotulados para manter a transparência. Esta seção revisa os desenvolvimentos mais recentes e perspectivas futuras nas áreas-chave da descoberta de NPs baseadas em ômicas, focando especificamente em metabolômica, genômica, transcriptômica e proteômica. Além da integração deles via IA/ML. As principais ferramentas e recursos discutidos nessas áreas estão compilados para referência na Tabela 1.
1. Metabolômica na descoberta de NPs
- Plataformas analíticas para metabolômica
A metabolômica é crucial para a descoberta de NPs, pois permite uma análise detalhada das pequenas moléculas geradas por vários organismos. As principais ferramentas analíticas usadas para caracterizar os metabolomas dos NPs incluem técnicas de EM de alta resolução, como LC-MS/MS e cromatografia gasosa-MS (gc-MS), juntamente com espectroscopia deRMN 21,22. Fluxos de trabalho LC-MS/MS não direcionados, como o LC-MS de ultra-alto desempenho combinado com o MS/MS, permitem a identificação de uma ampla gama de metabólitos em misturas complexas, enquanto o GC-MS se destaca no perfil de compostos voláteis. Além disso, novos métodos como a EM em em infusão direta em tandem e a imagem em EM estão aprimorando o kit de ferramentas de metabolômica para NPs23,24. Técnicas avançadas de espectrometria de massa, incluindo a EM multimodal, que combina modos iônicos positivos e negativos ou emprega fragmentação MSn em múltiplos estágios, e métodos hifenizados como LC-MS acoplados à RMN, oferecem insights estruturais mais profundos sobre os metabólitosdetectados 25,26.
- Ferramentas de processamento de dados e computacionais
Ferramentas de software especializadas desempenham um papel crucial no processamento e interpretação de dados de metabolômica. Programas como XCMS, MZmine e OpenMS são comumente usados para detectar e alinhar características cromatográficas, ou picos, enquanto etapas meticulosas de pré-processamento de dados, como alinhamento de picos, normalização e filtragem, são essenciais para alcançar perfis metabólicosreprodutíveis 27. A identificação de compostos é suportada por bibliotecas espectrais MS/MS, incluindo NIST e mzCloud, bem como ferramentas de fragmentação in silico como SIRIUS e MetFrag28. A plataforma Global Natural Products Social (GNPS) emergiu como um recurso chave para redes moleculares, que organiza espectros MS/MS relacionados para enfatizar famílias químicas e facilitar a dereplicação de compostosconhecidos 29. Por exemplo, uma análise usando GNPS com dados de LC-MS/MS de culturas de Streptomyces identificou com sucesso antibióticos conhecidos como espiramicina e actinomicina, além de análogos previamentenão relatados 30,31. A técnica de rede molecular agrupava efetivamente espectros desconhecidos relacionados, e a adição da rede de identidade iônica melhorou a conectividade das características. Essas análises baseadas em rede, quando combinadas com ferramentas estatísticas multivariadas como a análise de componentes principais e a análise discriminante de mínimos quadrados parciais ortogonais, bem como a análise de redes de correlação, podem vincular padrões de produção de metabólitos a condições biológicas ou ambientais específicas. Em um estudo em particular, a GNPS em rede molecular de extratos de fermentação de Streptomyces associado à planta demonstrou perfis metabólicos distintos que variaram dependendo do mediador de crescimento utilizado. Metabólitos conhecidos, incluindo espiramicina, actinomicina e um composto carcinogênico chamado lingbyatoxina, foram detectados; No entanto, muitos nós de rede não correspondiam a nenhuma entrada nos bancos de dadosespectrais 32. Essa descoberta sugere a presença de metabólitos genuinamente novos, destacando como metabolômicas não direcionadas, em conjunto com o GNPS, podem identificar novos NPs potencialmente novos para exploração adicional.
Combinar triagem metabolômica com bioensaios funcionais facilita a rápida priorização de cepas ou extratos que geram compostos bioativos. Além disso, recursos comunitários emergentes como o Natural Products Atlas (NPAtlas), juntamente com pipelines integrados de análise metaboloma-genoma, são fundamentais para associar metabólitos detectados com seus BGCs nos organismosde origem 33,34. Essa estratégia integrativa permite que pesquisadores correlacionem sinais de metabólitos com dados genômicos, aumentando assim a eficiência na identificação de NPs e no rastreamento de suas origens.
2. Descoberta da genômica na NPs
Na última década, a pesquisa em NPs microbianos entrou em uma era transformadora de "mineração profunda", impulsionada por avanços como sequenciamento de alta cadência, EM ultra-sensível e de alta resolução e abordagens multi-ômicasintegradas 35. Essas ferramentas mudaram os esforços de descoberta de isolamento fortuito, passando por exploração direcionada e orientada por dados. Pipelines de mineração de genomas, incluindo antiSMASH 7.0 e DeepBGC, agora permitem a identificação sistemática de BGCs enigmáticos, especialmente em táxonspouco explorados 36,37.
- Sequenciamento de alta taxa e montagem híbrida
Tecnologias de sequenciamento de DNA de alta potência, como o sequenciamento de DNA de leitura curta e alta capacidade combinado com plataformas de sequenciamento de leitura longa, transformaram significativamente o estudo genômico de organismos que produzem NPs. Ao empregar estratégias híbridas de montagem que integram leituras longas e curtas, os pesquisadores podem alcançar montagens genômicas de alta contiguidade, essenciais para capturar BGCs inteiros dentro de umgenoma 38. Além disso, o sequenciamento metagenômico, que inclui a recuperação de genomas montados em metagenomas, amplia a descoberta de BGCs para microrganismos não cultivados, permitindo que cientistas explorem o DNA ambiental em busca de seu potencialbiossintético 39. Em casos em que métodos convencionais de montagem genômica falham na resolução de grandes ou repetitivos aglomerados gênicos, técnicas baseadas em bibliotecas, como bibliotecas de cosmid ou cromossômicos artificiais bacterianos, podem ser utilizadas para isolar e clonar fragmentos genômicos substanciais. Essa abordagem facilita a caracterização de clusters gênicos completos por meio de sequenciamento direcionado ou expressão heteróloga, aprimorando assim nossa compreensão da base genética para a biossíntese dosNPs 40,41.
- Ferramentas de mineração genômica
Ferramentas bioinformáticas especializadas são essenciais para analisar dados genômicos e identificar as assinaturas distintas das vias metabólicas secundárias. Programas como antiSMASH, PRISM e DeepBGC desempenham um papel crucial nesse processo ao detectar automaticamente BGCs candidatos. Eles fazem isso reconhecendo domínios biossintéticos específicos, como aqueles associados a sínteses peptídicas não ribossomais, sintases policetidas, vias peptídicas sintetizadas e modificadas pós-traducionalmente (RiPP) e ciclases terpeno, entre outras. Para auxiliar na dereplicação, bancos de dados como o MIBiG, que compila BGCs conhecidos e seus produtos, e o NPAtlas, que cataloga NPs conhecidos, ajudam pesquisadores a comparar novas sequências ou compostos a exemplosestabelecidos 37,42,43. Algoritmos de agrupamento, como o BiG-SCAPE, juntamente com ferramentas como o CORASON, organizam BGCs relacionados em famílias, oferecendo uma visão de rede da diversidade biossintética e facilitando a identificação de novas famílias de clusters por meio de comparações com asconhecidas 44. Análises bioinformáticas adicionais, incluindo buscas BLAST e varreduras ocultas do modelo de Markov, podem prever as funções potenciais das enzimas codificadas em um BGC, enquanto abordagens genômicas comparativas, como análise de sintenia e coevolução de genes, ajudam a refinar essas previsõesfuncionais 45. Além disso, os dados genômicos permitem a anotação de elementos regulatórios ligados à biossíntese dos NPs, incluindo promotores específicos de vias e reguladorestranscricionais 46. Esses insights fornecem uma base para a engenharia de vias de viários; por exemplo, técnicas de biologia sintética como clonagem de recombinação associada a transformações e recombinação Red/ET capacitam pesquisadores a capturar e expressar BGCs silenciosos ou crípticos em um organismo hospedeiro heterólogo, ativando assim a produção de seusmetabólitos 47.
Os esforços de mineração genômica levaram com sucesso à descoberta de novos NPs ao se concentrarem em sinais genéticos específicos. Por exemplo, uma busca sistemática por genes ligados à resistência a glicopeptídeos revelou vários BGCs incomuns previstos para codificar novos antibióticos. Esse método resultou na identificação de dois compostos inovadores, compstatina e cobramicina, ambos com mecanismos de ação únicos ao direcionar as autolisinasbacterianas 48. De forma semelhante, explorar o microbioma humano em busca de conteúdo gênico biossintético resultou em um candidato a lipopeptídeo conhecido como "humicin", reconhecido por sua potencial eficácia contra Staphylococcus e as espécies 49 de Streptococcus. Nesses casos, os compostos foram inicialmente identificados por métodos computacionais, com suas estruturas químicas previstas com base em dados genômicos. Subsequentemente, essas moléculas previstas foram sintetizadas quimicamente e demonstraram as atividades antibióticas esperadas, validando assim a estratégia de descoberta baseada no genoma. Em uma escala mais ampla, o sequenciamento em larga escala de várias bactérias, incluindo muitos actinomicetos raros, está revelando uma grande quantidade de clusters genéticos "enigmáticos" de BGCs cujos produtos permanecem desconhecidos. Por exemplo, investigações sobre genomas de Streptomyces revelaram milhares de BGCsnão caracterizados 50. Uma abordagem emergente para ligar esses agrupamentos de órfãos a metabólitos reais envolve a integração de análises metabolômicas com levantamentos genômicos. Ao correlacionar a presença ou expressão de um cluster gênico com a detecção de características únicas do metabólito por meio de plataformas como GNPS ou bancos de dados espectrais de massa, os pesquisadores podem começar a atribuir produtos químicos provisórios aos inúmeros novos BGCs, facilitando assim a descoberta de NPs verdadeiramente novos a partir de dados genômicos.
3. Transcriptômica na descoberta de produtos naturais
Análises transcriptômicas oferecem uma perspectiva dinâmica sobre a atividade dos BGCs ao medir a expressão de mRNA sob várias condições. Especificamente, experimentos de RNA-seq podem descobrir quais BGCs são ativamente transcritos e como seus níveis de expressão flutuam em resposta a mudanças ambientais ou experimentais. Ao comparar os níveis de transcritos entre diferentes condições, a análise de expressão diferencial, utilizando ferramentas como DESeq2 ou edgeR, pode identificar BGCs que estão regulados para cima ou para baixo, destacando assim clusters gênicos que podem ser induzíveis ou permanecer silenciosos sob condições padrão51. Embora o RNA-seq convencional realizado em células cultivadas em massa seja a abordagem típica para investigar a expressão de BGC, técnicas mais avançadas como RNA-seq de célula única estão começando a ser utilizadas em microbiomas complexos. Essa mudança permite a observação da expressão gênica em organismos ambientais que são difíceis decultivar 52,53. Um fluxo de trabalho padrão de RNA-seq geralmente inclui mapeamento de leituras para um genoma de referência usando alinhadores como STAR ou HISAT2, quantificação da expressão gênica com ferramentas como featureCounts ou Kallisto, e normalização dos dados para identificar mudanças significativas na expressão. Após isso, a análise de redes de coexpressão, frequentemente realizada com o pacote WGCNA, pode agrupar genes que exibem padrões de expressão semelhantes. Quando os dados do metabólito também estão disponíveis, essas redes podem ser expandidas para incorporar metabólitos, ligando assim compostos específicos aos genescoexpressos 54.
Dados transcriptômicos têm se mostrado valiosos na identificação de vias biossintéticas condicionalmente ativas. Um exemplo notável dessa abordagem é encontrado em uma comparação detalhada de quatro cepas deSalinispora 51. Neste estudo, foi revelado que mais da metade dos BGCs de cada cepa foram expressos em algum grau, com muitos agrupamentos inativos em uma cepa apresentando expressão em outra. Ao analisar os perfis de expressão gênica dessas cepas, os pesquisadores conseguiram identificar vários fatores regulatórios que pareciam silenciar ou ativar aglomerados específicos. Esse método integrativo levou à identificação de uma família de NPs até então desconhecida, conhecida como salinipostinas. Dados transcriptômicos indicaram um agrupamento gênico críptico como fonte potencial para um composto não identificado; Quando esse agrupamento foi induzido a se expressar (por meio de mudanças regulatórias), resultou na produção de moléculas de salinipostina, que foram posteriormente isoladas e estruturalmente caracterizadas. Este estudo exemplifica como a transcriptômica pode facilitar a descoberta dos NPs: ao analisar a expressão diferencial gênica, os pesquisadores podem destacar BGCs candidatos, e a correlação entre expressão gênica e perfis de metabólitos fornece evidências de apoio para as relações gene-metabólito que podem ser validadas por meio de experimentos direcionados.
4. Proteômica na descoberta de NPs
- Abordagens de espingarda e proteômica direcionada
A proteômica, que envolve o estudo em larga escala de proteínas, oferece uma perspectiva vital na pesquisa em NPs ao medir diretamente as enzimas e proteínas que desempenham papéis nas vias biossintéticas. Geralmente, abordagens proteômicas podem ser categorizadas em dois tipos principais: proteômica shotgun (não direcionada) e proteômica direcionada. Na proteômica shotgun, proteínas extraídas de amostras microbianas ou vegetais passam por digestão enzimática, tipicamente com tripsina, e os peptídeos resultantes são analisados usando LC-MS/MS de alta resolução, frequentemente empregando espectrômetros de massa avançados como o tempo de voo quadrupolar (QTOF) ou espectrômetros de massa de armadilha orbitalde alta resolução 55. Os dados coletados da EM, conhecidos como espectros MS/MS, são então comparados a sequências peptídicas por meio de pesquisas em um banco de dados de proteínas derivado do genoma do organismo ou de uma espécie intimamente relacionada, utilizando ferramentas de software como MaxQuant ou Mascot56,57. Esse processo permite quantificar mudanças na abundância de proteínas sob diferentes condições, o que pode ser alcançado tanto por métodos sem marcador quanto por técnicas de marcação de isótopos, como a marcação de isótopos estáveis por aminoácidos em cultura celular (SILAC) ou a marcação isobárica com reagentes TMT/iTRAQ, para determinar quais enzimas biossintéticas estão reguladas para cima ou para baixo58, 59. Em contraste, métodos de proteômica direcionada, incluindo monitoramento de reações selecionadas (SRM) ou monitoramento de reações paralelas (PRM), concentram-se em um conjunto específico de íons peptídicos, frequentemente péptídeos únicos de enzimas biossintéticas ou proteínas reguladoras chave, permitindo quantificação precisa e sensível desses peptídeos em múltiplasamostras 60,61.
- Abordagens inovadoras em proteômica
Um desafio significativo na análise proteômica do metabolismo secundário é a detecção de grandes enzimas biossintéticas, como sintetas peptídicas não ribossómicas e policetidas sintases, que frequentemente ultrapassam 100 kDa de tamanho e produzem poucos peptídeos detectáveis com protocolos digerentes padrão, tornando-as difíceis de observar. Para enfrentar essa questão, Bumpus et al. desenvolveram um método conhecido como PrISM, que aprimora a detecção das proteínas NRPS e PKS utilizando um cofator específico encontrado nessasenzimas 62. O PrISM integra proteômica convencional de espingarda com um ensaio de ejeção de fosfofinanteteinil (Ppant). Notavelmente, as enzimas NRPS e PKS possuem um braço Ppant covalentemente ligado em seus domínios portadores acil ou portadores peptidil; durante a fragmentação MS/EM, esse grupo protético frequentemente gera um íon fragmentado único, chamado de íon "ejeção de Ppant". Ao filtrar computacionalmente os dados LC-MS/MS para esse íon diagnóstico, o método PrISM pode destacar efetivamente peptídeos derivados das enzimas NRPS e PKS em meio à mistura complexa de todas as proteínas celulares. Essa estratégia conseguiu descobrir vias biossintéticas ocultas por meio da proteômica. Por exemplo, o fluxo de trabalho PrISM permitiu a detecção de peptídeos do complexo gramicidina S sintetase (GrsA/GrsB) em culturas de Bacillus brevis, estabelecendo uma ligação direta entre essas enzimas NRPS e a produção do antibiótico gramicidina S nesseorganismo 62. Importante destacar que a identificação proteômica de GrsA/GrsB não exigiu conhecimento genômico prévio de B. brevis, ilustrando que, em certos casos, a análise proteômica sozinha pode revelar vias biossintéticas ativas de NPs mesmo em organismos cujos genomas ainda não foram sequenciados.
- Proteômica informada pelo genoma
Quando uma sequência genômica está disponível, o poder da proteômica pode ser significativamente aprimorado utilizando um banco de dados específico para cepas para identificação de peptídeos. Por exemplo, em um estudo que analisou o proteoma de Streptomyces lilacinus, pesquisadores realizaram duas análises: uma pesquisando espectros em um banco de dados geral de proteínas e outra em um banco de dados personalizado derivado do genoma sequenciado daquelacepa 63. A análise informada pelo genoma revelou aproximadamente dez vezes mais peptídeos identificados e detectou peptídeos ligados a seis BGCs distintos dentro do organismo. Notavelmente, três desses grupos identificados correspondiam a metabólitos "órfãos" já conhecidos, incluindo graybactina, rakicidina D e um sideróforo específico, com suas enzimas biossintéticas confirmadas como expressas. Os aglomerados demais detectados pareciam ser novos e não caracterizados. Este exemplo demonstra que a integração de informações genômicas em fluxos de trabalho proteômicos pode confirmar quais vias biossintéticas são ativamente expressas em uma cepa, priorizando assim esses clusters gênicos para o isolamento e caracterização de seus produtos.
Além disso, métodos proteômicos podem iluminar os alvos moleculares e modos de ação dos NPs, área frequentemente chamada de proteômica química. Por exemplo, o perfil proteico baseado em atividade (ABPP) utiliza sondas de pequenas moléculas, tipicamente derivados ou análogos de NPs, que reagem com os alvos celulares do composto, marcando essas proteínas para enriquecimento e identificação por meio da MS64. Essa técnica pode descobrir os alvos proteicos aos quais uma NP específica ou molécula relacionada se liga dentro da célula. Outro método, o perfil térmico de proteoma (TPP), envolve aquecer amostras de proteína na presença ou ausência de um composto para determinar quais proteínas apresentam alterada estabilidade térmica, indicando uma interação de ligação65. Essas abordagens proteômicas químicas são inestimáveis para validar os alvos biológicos dos NPs e elucidar seus mecanismos de ação, complementando assim a descoberta dos próprios NPs.
5. ML e IA para integração e previsão de omics
- Integração de dados multi-ômicos com ML
Uma fronteira empolgante na descoberta dos NPs é a aplicação de ML e IA para integrar dados de ômicas para previsões funcionais. No campo da genômica, algoritmos de ML supervisionados, incluindo random forests, máquinas de vetores de suporte e redes neurais profundas, foram desenvolvidos para identificar padrões em BGCs associados a tipos específicos de NPs. Por exemplo, esses modelos de ML podem categorizar os BGCs com base na classe geral de moléculas que produzem ou até mesmo prever certas características da estrutura química derivada da sequência gênica. Uma revisão feita por Dason MS e colegas destaca várias ferramentas de ML projetadas para decodificar a "linguagem" dos BGCs, utilizando dados de sequências de DNA ou aminoácidos para deduzir as estruturas e bioatividades dos NPs correspondentes66. Esses modelos normalmente dependem de extensos bancos de dados de clusters e compostos gênicos conhecidos para aprender as relações entre eles, permitindo previsões sobre a potencial atividade biológica de novos compostos. Por exemplo, eles podem avaliar se um produto de uma BGC não caracterizada pode possuir propriedades antibióticas ou anticancerígenas. Avanços significativos que facilitaram essas capacidades incluem a utilização de grandes conjuntos de dados de treinamento, como milhares de estruturas NP conhecidas e clusters gênicos, técnicas inovadoras de representação como embeddings de sequências e redes neurais de grafos que capturam características de clusters gênicos e estruturas químicas, e modelos multiparamétricos que combinam vários descritores genômicos e químicos para melhorar a precisão da previsão.
No campo da metabolômica, as técnicas de IA estão aprimorando significativamente a interpretação de dados espectrais de massa complexos. Um exemplo notável é a ferramenta CSI:FingerID, que utiliza ML para prever a impressão digital estrutural de uma molécula a partir do seu espectro MS/MS. Essa capacidade ajuda na identificação de metabólitos desconhecidos ao sugerir subestruturas potenciais e compostos candidatos67. De forma semelhante, modelos de aprendizado profundo foram utilizados para anotação espectral; redes neurais convolucionais e, mais recentemente, arquiteturas baseadas em transformadores, como o modelo "DreaMS", aprendem padrões de fragmentação a partir de extensas bibliotecas espectrais. Esses modelos podem propor estruturas para espectros desconhecidos com base nos padrões que aprenderam, frequentemente superando métodos heurísticos tradicionais, especialmente para metabólitos que não têm correspondências exatas em bancos de dados existentes68. Além da anotação estrutural, o ML também contribui para a metabolômica ao identificar padrões globais. Por exemplo, algoritmos de visualização não supervisionada como t-SNE (t-distributed stochastic neighbor embedding) e UMAP (Uniform Manifold Approximation and Projection) podem reduzir a dimensionalidade de conjuntos de dados de metabolômica não direcionados, facilitando o agrupamento de amostras com base em semelhanças em seus perfis de metabólitos. Enquanto isso, classificadores supervisionados podem conectar assinaturas metabólicas específicas às características fenotípicas ou bioatividades das amostras, enriquecendo ainda mais a análise69,70,71.
O ML está sendo cada vez mais utilizado para integrar diversos conjuntos de dados de omics, criando uma compreensão mais abrangente da biossíntese e função dos NPs. Ao unir dados de genômica, transcriptômica, proteômica e metabolômica, modelos integrativos podem revelar conexões que podem ser negligenciadas ao examinar cada tipo de dado separadamente. Por exemplo, pesquisadores podem construir redes de correlação gene-metabólito que relacionem os níveis de expressão de genes ou proteínas aos níveis de produção de metabólitos. Modelos de ML treinados com esses dados integrados podem então prever quais clusters gênicos provavelmente são responsáveis por metabólitos específicos ou atividades biológicas72,73. Técnicas multivariadas avançadas, como a análise fatorial multi-ômica (disponível em ferramentas como o MOFA) e métodos multivariados regularizados (encontrados em pacotes como o mixOmics), facilitam a identificação de fatores latentes que abrangem diferentes tipos de dados, como um conjunto de genes co-expressos ao lado de um grupo de metabólitos coexistentes74,75,76. Na prática, para a descoberta de NPs, diversas abordagens auxiliam na priorização de agrupamentos gênicos candidatos ao demonstrar uma conexão com metabólitos ou fenótipos observados. Um exemplo notável dessa estratégia integrativa guiada por IA é a descoberta de uma nova família de RiPPs sintetizados ribossosmicamente e RiPPs usando o algoritmo DecRiPPter. Esse algoritmo utiliza um modelo baseado em máquina de vetores de suporte (SVM) para analisar dados genômicos de peptídeos precursores RiPP enigmáticos e depois cruza essas previsões com análise pan-genômica para eliminar compostos conhecidos. Quando aplicado a 1.295 Streptomyces genomas, DecRiPPter identificou com sucesso 42 supostas novas famílias RiPP que anteriormente haviam sido ignoradas pelos métodos tradicionais de mineração genômica. Entre esses aglomerados previstos, um foi validado experimentalmente para produzir um novo lantipeptídeo classe V, que os pesquisadores nomearam "pristinina A3." Ao induzir a expressão desse aglomerado gênico silencioso, o composto pristinina A3 foi isolado, e sua estrutura foi determinada por RMN e EM, revelando duas enzimas formadoras de lantionina até então desconhecidas codificadas na via77. Essa conquista destaca como análises impulsionadas por IA podem revelar NPs ocultos: o modelo de ML detectou um sinal genético que não seria reconhecido, orientando os esforços experimentais para descobrir uma molécula nova.
- Aplicações emergentes de IA
Além das aplicações atuais, várias estratégias emergentes impulsionadas por IA estão prestes a revolucionar ainda mais a pesquisa em NPs. Uma área promissora é a retrossíntese computacional e o design de vias, onde modelos de aprendizado profundo estão sendo desenvolvidos para sugerir rotas biossintéticas ou etapas de química sintética para NPs conhecidos e seus análogos, o que poderia melhorar significativamente o design e a produção de novoscompostos 78,79. Outra fronteira empolgante é a previsão da função enzimática usando IA. Ao aproveitar ferramentas modernas de predição da estrutura de proteínas baseadas em algoritmos de aprendizado profundo, juntamente com técnicas de aprendizagem automática como o aprendizado contrastivo em sequências de proteínas, os pesquisadores estão começando a deduzir as atividades prováveis de enzimas não caracterizadas encontradas em BGCs. Isso pode fornecer insights sobre os tipos de transformações químicas que essas enzimas catalisam 80,81,82. Pipelines totalmente integrados de ómicas para química estão sendo desenvolvidos, onde as plataformas de IA visam conectar automaticamente características espectrais de massa a dadosgenômicos 83,84. Em princípio, tal sistema poderia analisar um conjunto de dados LC-MS/MS de uma amostra complexa junto com sequências genômicas do mesmo ambiente, permitindo prever qual cluster gênico é responsável por cada metabólito não identificado ao pontuar correspondências entre cluster gênico e metabólito. Embora essas abordagens ainda estejam em sua infância, elas sugerem um futuro em que a IA poderia ligar genes a moléculas de forma autônoma, acelerando muito o processo desde dados ômicos até a descoberta de novos NPs.
- Governança de dados e desafios éticos na descoberta de NPs assistida por IA
A pesquisa moderna em multi-ômica produz uma quantidade significativa de dados diversos, mas a eficácia das previsões de IA depende fortemente da qualidade e consistência desses conjuntos de dados. Quando os conjuntos de treinamento são mal anotados ou tendenciosos, eles podem resultar em resultados enganosos e validaçõesmalsucedidas 85. Para enfrentar essa questão, os pesquisadores devem implementar os princípios FAIR — Localizável, Acessível, Interoperável e Reutilizável — para promover transparência de dados, reprodutibilidade e reutilizaçãoextensa 86. Essa abordagem envolve compartilhar resultados positivos e negativos, documentar minuciosamente os pipelines de pré-processamento de dados e fornecer código de análise para facilitar a verificação independente. Além disso, a adoção de infraestruturas digitais emergentes, como cadernos eletrônicos de laboratório (ELNs) e fluxos de trabalho conteinerizados, é essencial para melhorar a captura de dados e garantir a curadoriapadronizada 87,88.
Embora a IA acelere significativamente a descoberta de NPs, ela também traz à tona preocupações éticas cruciais. Algoritmos treinados com conjuntos de dados incompletos ou tendenciosos podem reforçar desigualdades existentes, ressaltando a necessidade de dados de treinamento diversos erepresentativos 89. Além disso, o uso de métodos explicáveis de IA é vital para aumentar a transparência e ajudar os cientistas a entender as previsões, garantindo que a IA atue como uma ferramenta de apoio sob controle humano, e não como um tomadorde decisão 85. Considerações éticas também abrangem a privacidade dos dados, especialmente ao usar conjuntos de dados clínicos ou derivados de humanos, bem como as implicações para a força de trabalho, à medida que a automação influencia cada vez mais o ambiente de pesquisa. Para enfrentar essas questões, os sistemas de IA devem estar sujeitos a auditorias regulares, avaliações de viés e rigorosa supervisão regulatória, o que ajudará a manter a justiça, a responsabilidade e a confiabilidade no campo da pesquisa dos NPs.