Artículo de revisión

Multi-ómica y analítica integrativa en el descubrimiento de productos naturales

1.4K vistas

DOI:

10.3791/69458

28 de noviembre de 2025

En este artículo

Resumen

Esta revisión enfatiza metodologías multiómicas de vanguardia, incluyendo metabolómica, genómica, transcriptómica y proteómica, que se integran con inteligencia artificial y aprendizaje automático, así como con el análisis de redes, para mejorar el descubrimiento y la validación funcional de nuevos productos naturales.

Resumen

Los productos naturales (NP) han sido durante mucho tiempo una fuente esencial de nuevos compuestos bioactivos para el descubrimiento de fármacos; sin embargo, los métodos tradicionales para cribar y aislar estos compuestos pueden ser lentos y a menudo producir rendimientos decrecientes. Afortunadamente, los enfoques avanzados de multi-ómica y computación ofrecen soluciones poderosas a estos desafíos. Esta revisión destaca metodologías innovadoras que integran metabolómica, genómica, transcriptómica y proteómica con bioinformática y química analítica para acelerar el descubrimiento de NP. Por ejemplo, plataformas de metabolómica no dirigidas como la espectrometría de masas tándem de cromatografía líquida de alta resolución (LC-MS/MS) y la red molecular Global Natural Products Social (GNPS) permiten un perfilado integral de nuevos compuestos, mientras que las estrategias de marcado isotópico dirigidas mejoran este proceso. Además, herramientas de minería genómica y metagenómica como antibióticos y capa de análisis de metabolitos secundarios (antiSMASH), Deep Biosynthetic Gene Cluster (DeepBGC) y Pipeline for Reconstructing Integrated Syntheses of Metabolites (PRISM) identifican rápidamente clústeres génicos biosintéticos (BGCs) tanto en organismos cultivados como en no cultivados, a menudo utilizando expresiones heterólogas para validar productos. Los análisis transcriptómicos, incluyendo la secuenciación de ARN (RNA-seq), las redes de coexpresiones y la fluxómica, ayudan a clarificar cómo se regulan las vías, mientras que técnicas de proteómica cuantitativa como las etiquetas de masa tándem/etiquetas isobáricas para cuantificación relativa y absoluta (TMT/iTRAQ) y métodos sin marcador, junto con enfoques quimioproteómicos como el ensayo de desplazamiento térmico celular y el perfilado térmico de proteoma (TPP), descubren objetivos moleculares y sus mecanismos de acción. Esta revisión también pone un énfasis significativo en el papel de la inteligencia artificial (IA) y el aprendizaje automático (ML) en la integración de datos multiómicos, abarcando actividades que van desde la construcción de redes de correlación génico-metabolito hasta el aprovechamiento de grafos de conocimiento y redes neuronales de grafos para la fusión de datos y la predicción funcional. Finalmente, esta revisión concluye discutiendo los beneficios sinérgicos de la multi-ómica para el descubrimiento de productos naturales, abordando los desafíos técnicos actuales y explorando futuras direcciones hacia la integración inteligente de datos de alto rendimiento para la investigación de nueva generación en NP.

Introducción

Los productos naturales, que son moléculas producidas por diversos organismos, incluidos microbios y plantas, han sido durante mucho tiempo una fuente vital de medicamentos, que van desde antibióticos como la penicilina hasta fármacos anticancerígenos como el Taxol. Una parte significativa de nuestros antibióticos y agentes quimioterapéuticos actuales proviene de estos compuestosnaturales 1. Sin embargo, los métodos tradicionales utilizados para descubrir nuevos NPs, como el cultivo de microbios y el uso de aislamiento guiado por bioensayos, se han vuelto cada vez más difíciles. A finales del siglo XX, el interés farmacéutico en los parques naturales disminuyó a medida que las empresas sufrían rendimientos decrecientes; muchos compuestos fáciles de encontrar ya habían sido redescubiertos, y los desafíos técnicos asociados al cribado y caracterización de estos compuestos hacían que el proceso fuera laborioso. Afortunadamente, esta tendencia ahora se está revirtiendo. Los avances recientes en ómicas y tecnologías analíticas están revitalizando la búsqueda deNPs 2,3. Por ejemplo, la secuenciación de ADN de alto rendimiento permite a los investigadores explorar genomas para clústeres génicos biosintéticos ocultos (BGCs), mientras que la espectrometría de masas ultrasensible (EM) puede identificar pequeñas cantidades de metabolitos novedosos dentro de mezclas complejas. Estas innovaciones tecnológicas llegan en un momento crucial, ya que existe una demanda global urgente de nuevos tratamientos, especialmente antibióticos que pueden combatir bacterias resistentesa los medicamentos 4. La investigación moderna en NPs está surgiendo para afrontar este reto integrando la experiencia tradicional en NPs con técnicas de análisis genómico y químico de última generación.

La integración multiómica es fundamental para los avances actuales en la investigación biológica. El concepto de "multi-ómica" implica el análisis simultáneo de diversas capas de datos biológicos, como el ADN (genoma) de un organismo, transcritos de ARNm, proteínas y metabolitos. La aplicación de enfoques ómicos ha transformado la investigación de los NPs, permitiendo el cribado de alto rendimiento, la identificación rápida de compuestos nuevos y una exploración más profunda de las intrincadas redes que conforman los sistemasbiológicos 5. Al integrar estos conjuntos de datos multilayer, los investigadores pueden vincular directamente los genes con los metabolitos que codifican, construyendo así una comprensión más completa de la biosíntesisde NPs 6. Por ejemplo, los algoritmos de minería genómica pueden identificar un conjunto de genes que pueden codificar un nuevo antibiótico, mientras que los datos transcriptómicos pueden indicar si esos genes están expresados activamente. Además, el perfilado metabolómico puede identificar la molécula antibiótica correspondiente en el extracto de cultivo del organismo 7,8,9. Este enfoque integrado acelera significativamente el descubrimiento de nuevos compuestos y la comprensión de sus vías biosintéticas. Más importante aún, la identificación de fármacos objetivo depende cada vez más de enfoques multiómicos integrados, que están desplazando gradualmente las estrategias tradicionales de monoómica10. Los avances recientes en química analítica, incluyendo la cromatografía líquida de alta resolución (LM-MS) y la resonancia magnética nuclear (RMN), permiten a los investigadores detectar y analizar estructuralmente nuevos NPs a partir de muestras biológicascomplejas 11,12. Estas técnicas producen grandes cantidades de datos, y es aquí donde la bioinformática y el aprendizaje automático (ML) se vuelven esenciales. Los algoritmos de inteligencia artificial (IA) y los análisis basados en redes se utilizan cada vez más para analizar datos multi-ómicos, descubriendo patrones y predicciones significativas que serían difíciles de discernir manualmente13,14. Al combinar tecnologías ómicas de vanguardia con la minería de datos impulsada por IA, los investigadores pueden ahora establecer una pipeline robusta para el descubrimiento y análisis más rápido y sistemático de NPs que nunca antes.

Aunque las estrategias multiómicas han avanzado significativamente en el descubrimiento de los NPs, su implementación exitosa depende en gran medida de una planificación experimental meticulosa. Por ejemplo, el tipo y la calidad de las muestras son cruciales; Es esencial recoger cultivos microbianos bien conservados, aislados ambientales o materiales clínicos en condiciones que minimizen la degradación de ácidos nucleicos ymetabolitos 15. La profundidad de la secuenciación también juega un papel vital en la resolución de datos: la secuenciación del genoma completo generalmente requiere una cobertura de al menos 30× para un ensamblaje preciso, mientras que el perfilado transcriptómico a menudo requiere decenas de millones de lecturas para identificar transcritos de baja abundancia, como recomienda Genohub16. Además, para la metabolómica, se necesitan disolventes y métodos de extracción adecuados para capturar diversas clases químicas; Se deben elegir conscientemente protocolos de extracción que minimicen el sesgo y maximicen lareproducibilidad 17. Sin embargo, estas metodologías conllevan sus propios desafíos. Integrar conjuntos de datos grandes y heterogéneos puede ser computacionalmente intensivo, y la inestabilidad o baja abundancia de metabolitos puede complicar análisisposteriores 18. Además, los altos costes o los tamaños limitados de muestra pueden restringir el diseño de losestudios 19. La contaminación y el sesgo en los datos de secuenciación, especialmente en muestras de baja entrada o diluidas, también suponen riesgos significativos, como destacan Lusk et al. respecto a la contaminación en secuenciaciónde alto rendimiento 20. Reconociendo estas limitaciones prácticas y técnicas, los investigadores pueden tomar decisiones informadas sobre combinaciones multiómicas adecuadas e interpretar sus resultados con la precaución necesaria.

Esta revisión destaca los métodos innovadores que están revolucionando el descubrimiento de los NPs mediante el uso de multi-ómica y análisis integrativo. También explora la creciente importancia del aprendizaje automático y la IA en la vinculación de estos diversos flujos de datos, incluyendo la construcción de redes de correlación génico-metabolito y la identificación de clústeres génicos que probablemente produzcan nuevos compuestos bioactivos. Además, examina la importancia y el potencial futuro de este enfoque integrado. En conclusión, la combinación de diferentes tecnologías ómicas con análisis avanzados no solo acelera el descubrimiento de nuevos NPs hoy en día, sino que también allana el camino para el desarrollo de fármacos de próxima generación que la sociedad necesita con urgencia.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Revisión y perspectiva

Para elaborar esta revisión, realizamos una búsqueda exhaustiva en la literatura en múltiples bases de datos y plataformas de indexación, incluyendo PubMed, Scopus, Web of Science, ScienceDirect y Google Scholar. La búsqueda abarcó publicaciones desde enero de 2015 hasta julio de 2025. Las palabras clave y combinaciones booleanas incluían: "descubrimiento de productos naturales", "ómica", "metabolómica", "genómica", "transcriptómica", "proteómica", "aprendizaje automático", "inteligencia artificial", "cúmulos génicos biosintéticos" y "integración multi-ómica". También se revisaron listas de referencias de artículos clave y revisiones recientes para identificar publicaciones relevantes adicionales. Además de los estudios revisados por pares, se consultó un número limitado de artículos preprints de plataformas como bioRxiv y medRxiv cuando aportaban información oportuna y relevante, aún no disponible en la literatura publicada. Todos los preprints están claramente etiquetados para mantener la transparencia. Esta sección revisa los últimos desarrollos y perspectivas futuras en las áreas clave del descubrimiento de NPs basados en ómica, centrándose específicamente en metabolómica, genómica, transcriptómica y proteómica. Así como su integración mediante IA/ML. Las herramientas y recursos principales tratados en estos campos se recopilan para referencia en la Tabla 1.

1. Metabolómica en el descubrimiento de NPs

  1. Plataformas analíticas para metabolómica
    La metabolómica es crucial para descubrir NPs, ya que permite un análisis detallado de las pequeñas moléculas generadas por diversos organismos. Las principales herramientas analíticas utilizadas para caracterizar los metabolomas de los NP incluyen técnicas de MS de alta resolución, como LC-MS/MS y cromatografía de gases-MS (GC-MS), junto con espectroscopíaRMN 21,22. Los flujos de trabajo LC-MS/MS no dirigidos, como el LC-MS de ultraalto rendimiento combinado con MS/MS, permiten la identificación de una amplia gama de metabolitos en mezclas complejas, mientras que GC-MS destaca en el perfilado de compuestos volátiles. Además, nuevos métodos como la EM en tándem por infusión directa y la imagen de EM están mejorando el conjunto de herramientas de metabolómica para NPs23,24. Técnicas avanzadas de espectrometría de masas, incluyendo la MS multimodal, que combina modos iónicos positivos y negativos o emplea fragmentación MSn en varias etapas, y métodos compuestos como LC-MS junto con RMN, ofrecen una visión estructural más profunda de los metabolitosdetectados 25,26.
  2. Herramientas de procesamiento de datos y computación
    Las herramientas de software especializadas desempeñan un papel crucial en el procesamiento e interpretación de datos de metabolómica. Programas como XCMS, MZmine y OpenMS se utilizan comúnmente para detectar y alinear características cromatográficas, o picos, mientras que pasos meticulosos de preprocesamiento de datos, como la alineación de picos, la normalización y el filtrado, son esenciales para lograr perfiles metabólicosreproducibles 27. La identificación de compuestos está soportada por bibliotecas espectrales MS/MS, incluyendo NIST y mzCloud, así como por herramientas de fragmentación in silico como SIRIUS y MetFrag28. La plataforma Global Natural Products Social (GNPS) ha surgido como un recurso clave para la creación de redes moleculares, que organiza espectros MS/MS relacionados para enfatizar familias químicas y facilitar la recreación de compuestosconocidos 29. Por ejemplo, un análisis usando GNPS sobre datos de LC-MS/MS de cultivos de Streptomyces identificó con éxito antibióticos conocidos como la espiramicina y la actinomicina, junto con análogos previamenteno reportados 30,31. La técnica de red molecular agrupaba eficazmente espectros desconocidos relacionados, y la adición de la red de identidad iónica mejoró la conectividad de características. Estos análisis basados en redes, cuando se combinan con herramientas estadísticas multivariantes como el análisis de componentes principales y el análisis discriminante de mínimos cuadrados parciales ortogonales, así como el análisis de redes de correlación, pueden vincular patrones de producción de metabolitos con condiciones biológicas o ambientales específicas. En un estudio en particular, la red molecular GNPS de extractos de fermentación de un Streptomyces asociado a plantas demostró perfiles metabolitos distintos que variaban según el mediador de crecimiento utilizado. Se detectaron metabolitos conocidos, incluyendo espiramicina, actinomicina y un compuesto cancerígeno llamado lingbyatoxina; sin embargo, muchos nodos de red no coincidían con ninguna entrada en las bases de datosespectrales 32. Este hallazgo sugiere la presencia de metabolitos genuinamente novedosos, lo que pone de manifiesto cómo la metabolómica no dirigida, junto con el GNPS, puede identificar posibles nuevas NPs para una exploración más profunda.
    Combinar el cribado metabolómico con bioensayos funcionales facilita la rápida priorización de cepas o extractos que producen compuestos bioactivos. Además, recursos comunitarios emergentes como el Natural Products Atlas (NPAtlas), junto con canales integrados de análisis metaboloma-genoma, son fundamentales para asociar metabolitos detectados con sus BGCs en los organismos fuente33,34. Esta estrategia integradora permite a los investigadores correlacionar señales de metabolitos con datos genómicos, mejorando así la eficiencia en la identificación de NPs y el rastreo de su origen.

2. Genómica en el descubrimiento de los NPs

En la última década, la investigación sobre NPs microbianos ha entrado en una era transformadora de "minería profunda" impulsada por avances como la secuenciación de alto rendimiento, la esclerosis múltiple ultrasensible y de alta resolución y los enfoques multiómicosintegrados 35. Estas herramientas han desplazado los esfuerzos de descubrimiento de un aislamiento fortuito, pasando de una exploración dirigida y basada en datos. Las tuberías de minería del genoma, incluyendo antiSMASH 7.0 y DeepBGC, permiten ahora la identificación sistemática de BGCs crípticos, especialmente en taxones pocoexplorados 36,37.

  1. Secuenciación de alto rendimiento y ensamblaje híbrido
    Las tecnologías de secuenciación de ADN de alto rendimiento, como la secuenciación de ADN de lectura corta y alto rendimiento combinada con plataformas de secuenciación de lectura larga, han transformado significativamente el estudio genómico de organismos que producen NPs. Al emplear estrategias híbridas de ensamblaje que integran tanto lecturas largas como cortas, los investigadores pueden lograr ensamblajes genómicos de alta contigüidad, esenciales para capturar BGCs completos dentro de un genoma38. Además, la secuenciación metagenómica, que incluye la recuperación de genomas ensamblados en metagenomas, amplía el descubrimiento de los BGC a microbios no cultivados, permitiendo a los científicos explorar el ADN ambiental para su potencialbiosintético 39. En casos donde los métodos convencionales de ensamblaje genómico no logran resolver grandes o repetitivos clústeres génicos, se pueden utilizar técnicas basadas en bibliotecas, como el cosmid o las bibliotecas de cromosomas artificiales bacterianos, para aislar y clonar fragmentos genómicos sustanciales. Este enfoque facilita la caracterización de cúmulos génicos completos mediante secuenciación dirigida o expresión heteróloga, ampliando así nuestra comprensión de la base genética de la biosíntesisde NPs 40,41.
  2. Herramientas de minería del genoma
    Las herramientas bioinformáticas especializadas son esenciales para analizar los datos genómicos y identificar las firmas distintivas de las vías metabolicas secundarias. Programas como antiSMASH, PRISM y DeepBGC desempeñan un papel crucial en este proceso al detectar automáticamente los BGCs candidatos. Lo hacen reconociendo dominios biosintéticos específicos, como los asociados a síntesas peptídicas no ribosomales, síntesis de policetidas, vías peptídicas sintetizadas y modificadas postraduccionalmente (RiPP) y ciclasas terpeno, entre otros. Para facilitar la dereplicación, bases de datos como MIBiG, que recopila BGCs conocidos y sus productos, y NPAtlas, que cataloga NPs conocidos, ayudan a los investigadores a emparejar nuevas secuencias o compuestos con ejemplosestablecidos 37,42,43. Algoritmos de agrupamiento, como BiG-SCAPE, junto con herramientas como CORASON, organizan los BGCs relacionados en familias, ofreciendo una visión de red de la diversidad biosintética y facilitando la identificación de nuevas familias de conglomerados mediante comparaciones con familias conocidas44. Análisis bioinformáticos adicionales, incluyendo búsquedas BLAST y escaneos ocultos de modelos de Markov, pueden predecir las funciones potenciales de enzimas codificadas dentro de un BGC, mientras que los enfoques genómicos comparativos, como el análisis de sintensia y la coevolución de genes, ayudan a refinar estas prediccionesfuncionales 45. Además, los datos genómicos permiten la anotación de elementos reguladores vinculados a la biosíntesis de NPs, incluyendo promotores específicos de vías y reguladorestranscripcionales 46. Estas ideas proporcionan una base para la ingeniería de vías; por ejemplo, técnicas de biología sintética como la clonación de recombinación asociada a transformaciones y la recombinación Red/ET permiten a los investigadores capturar y expresar BGCs silenciosas o crípticas en un organismo huésped heterólogo, activando así la producción de susmetabolitos 47.
    Los esfuerzos de minería genómica han llevado con éxito al descubrimiento de nuevos NPs al concentrarse en señales genéticas específicas. Por ejemplo, una búsqueda sistemática de genes vinculados a la resistencia a los glicopéptidos reveló varios BGCs inusuales que se predicen codificando nuevos antibióticos. Este método resultó en la identificación de dos compuestos novedosos, la compstatina y la cobramicina, ambos con mecanismos de acción únicos al dirigirse a las autolisinasbacterianas 48. De manera similar, explorar el microbioma humano en busca de contenido génico biosintético produjo un candidato a lipopéptido conocido como "humicin", reconocido por su posible eficacia contra Staphylococcus y las especies49 de Streptococcus. En estos casos, los compuestos se identificaron inicialmente mediante métodos computacionales, prediciendo sus estructuras químicas a partir de datos genómicos. Posteriormente, estas moléculas predichas fueron sintetizadas químicamente y demostraron las actividades antibióticas esperadas, validando así la estrategia de descubrimiento basado en el genoma. A mayor escala, la secuenciación a gran escala de diversas bacterias, incluidos muchos actinomicetos raros, está descubriendo una gran cantidad de clústeres génicos "crípticos" de BGCs cuyos productos siguen siendo desconocidos. Por ejemplo, las investigaciones sobre los genomas de Streptomyces han revelado miles de BGCsno caracterizados 50. Un enfoque emergente para vincular estos grupos de huérfanos con metabolitos reales implica integrar análisis metabolómicos con encuestas genómicas. Al correlacionar la presencia o expresión de un cúmulo génico con la detección de características únicas del metabolito a través de plataformas como GNPS o bases de datos espectrales de masas, los investigadores pueden empezar a asignar productos químicos tentativos a los numerosos nuevos BGCs, facilitando así el descubrimiento de NPs verdaderamente novedosos a partir de datos genómicos.

3. Transcriptómica en el descubrimiento de productos naturales

Los análisis transcriptómicos ofrecen una perspectiva dinámica sobre la actividad de los BGC midiendo la expresión de ARNm bajo diversas condiciones. Específicamente, los experimentos de RNA-seq pueden descubrir qué BGCs se transcriben activamente y cómo fluctúan sus niveles de expresión en respuesta a cambios ambientales o experimentales. Comparando los niveles de transcritos entre diferentes condiciones, el análisis de expresión diferencial, utilizando herramientas como DESeq2 o edgeR, puede identificar BGCs que están regulados al alza o a la baja, destacando así los clústeres génicos que pueden ser inducibles o permanecer en silencio bajo las condicionesestándar 51. Aunque el enfoque típico para investigar la expresión de BGC es el ARN-seq convencional realizado en células cultivadas a granel, se están empezando a utilizar técnicas más avanzadas como el RNA-seq unicelular en microbiomas complejos. Este cambio permite la observación de la expresión génica en organismos ambientales que son difíciles decultivar 52,53. Un flujo de trabajo estándar de RNA-seq generalmente incluye el mapeo de lecturas a un genoma de referencia usando alineadores como STAR o HISAT2, la cuantificación de la expresión génica con herramientas como featureCounts o Kallisto, y la normalización de los datos para identificar cambios significativos en la expresión. A continuación, el análisis de redes de coexpresión, a menudo realizado con el paquete WGCNA, puede agrupar genes que presentan patrones de expresión similares. Cuando también hay datos de metabolitos disponibles, estas redes pueden ampliarse aún más para incorporar metabolitos, vinculando así compuestos específicos con genescoexpresados 54.

Los datos transcriptómicos han demostrado ser valiosos para identificar vías biosintéticas condicionalmente activas. Un ejemplo notable de este enfoque se encuentra en una comparación detallada de cuatro cepas51 de Salinispora. En este estudio, se reveló que más de la mitad de las BGC en cada cepa se expresaron en cierta medida, y muchos grupos inactivos en una cepa mostraron expresión en otra. Al analizar los perfiles de expresión génica en estas cepas, los investigadores pudieron identificar varios factores reguladores que parecían silenciar o activar grupos específicos. Este método integrador condujo a la identificación de una familia de NPs previamente desconocida, conocida como salinipostinas. Los datos transcriptómicos indicaron un cúmulo génico críptico como posible fuente de un compuesto no identificado; Cuando este grupo se indujo a expresarse (mediante cambios regulatorios), se produjo moléculas de salinipostina, que posteriormente fueron aisladas y caracterizadas estructuralmente. Este estudio ejemplifica cómo la transcriptómica puede facilitar el descubrimiento de NPs: al analizar la expresión diferencial de genes, los investigadores pueden destacar los BGCs candidatos, y la correlación entre la expresión génica y los perfiles de metabolitos proporciona evidencia de apoyo para las relaciones gen-metabolito que pueden validarse mediante experimentos dirigidos.

4. Proteómica en el descubrimiento de NPs

  1. Enfoques de escopeta y proteómica dirigida
    La proteómica, que implica el estudio a gran escala de proteínas, ofrece una perspectiva vital en la investigación de NPs al medir directamente las enzimas y proteínas que desempeñan un papel en las vías biosintéticas. Generalmente, los enfoques proteómicos pueden clasificarse en dos tipos principales: proteómica de escopeta (no dirigida) y proteómica dirigida. En la proteómica shotgun, las proteínas extraídas de muestras microbianas o vegetales son sometidas a digestión enzimática, típicamente con tripsina, y los péptidos resultantes se analizan utilizando LC-MS/MS de alta resolución, a menudo empleando espectrómetros de masas avanzados como el tiempo de vuelo cuadrupolar (QTOF) o espectrómetros de masa orbitaltrampa de alta resolución 55. Los datos de la EM recogidos, conocidos como espectros MS/MS, se comparan con secuencias peptídicas mediante la búsqueda en una base de datos de proteínas derivada del genoma del organismo o de una especie estrechamente relacionada, utilizando herramientas de software como MaxQuant o Mascot56,57. Este proceso permite cuantificar los cambios en la abundancia de proteínas bajo diferentes condiciones, lo que puede lograrse mediante métodos sin marcaje o empleando técnicas de marcado isotópico, como el marcaje estable de isótopos por aminoácidos en cultivo celular (SILAC) o el marcaje isobárico con reactivos TMT/iTRAQ, para determinar qué enzimas biosintéticas están reguladas al alza o a la baja58, 59. En cambio, los métodos de proteómica dirigida, incluyendo la monitorización de reacciones seleccionadas (SRM) o la monitorización de reacciones paralelas (PRM), se concentran en un conjunto específico de iones peptídicos, a menudo péptidos únicos de enzimas biosintéticas clave o proteínas reguladoras, lo que permite una cuantificación precisa y sensible de estos péptidos en múltiplesmuestras 60,61.
  2. Enfoques innovadores en proteómica
    Un desafío significativo en el análisis proteómico del metabolismo secundario es la detección de grandes enzimas biosintéticas, como las sintetas peptídicas no ribosomales y las síntesis de policetida, que a menudo superan los 100 kDa de tamaño y producen pocos péptidos detectables con protocolos digestivos estándar, lo que dificulta su observación. Para abordar este problema, Bumpus et al. desarrollaron un método conocido como PrISM, que mejora la detección de proteínas NRPS y PKS utilizando un cofactor específico presente en estasenzimas 62. PrISM integra proteómica convencional de escopeta con un ensayo de eyección de fosfofinanteteinilo (Ppant). Cabe destacar que las enzimas NRPS y PKS poseen un brazo Ppant unido covalentemente en sus dominios portadores acilo o portadores peptidil; durante la fragmentación de MS/EM, este grupo protésico genera frecuentemente un único fragmento de ion, conocido como ion de "eyección de Ppant". Filtrando computacionalmente los datos LC-MS/MS para este ion diagnóstico, el método PrISM puede resaltar eficazmente péptidos derivados de las enzimas NRPS y PKS en medio de la compleja mezcla de todas las proteínas celulares. Esta estrategia ha descubierto con éxito vías biosintéticas ocultas a través de la proteómica. Por ejemplo, el flujo de trabajo PrISM permitió la detección de péptidos del complejo gramicidina S sintetasa (GrsA/GrsB) en cultivos de Bacillus brevis, estableciendo un vínculo directo entre estas enzimas NRPS y la producción del antibiótico gramicidina S en eseorganismo 62. Es importante destacar que la identificación proteómica de GrsA/GrsB no requirió un conocimiento genómico previo de B. brevis, lo que ilustra que en ciertos casos, el análisis proteómico por sí solo puede descubrir vías biosintéticas activas de NPs incluso en organismos cuyos genomas aún no han sido secuenciados.
  3. Proteómica informada por el genoma
    Cuando hay una secuencia genómica disponible, el poder de la proteómica puede mejorarse significativamente utilizando una base de datos específica de cepas para la identificación de péptidos. Por ejemplo, en un estudio que analizó el proteoma de Streptomyces lilacinus, los investigadores realizaron dos análisis: uno buscando espectros en una base de datos general de proteínas y otro en una base de datos personalizada derivada del genoma secuenciado de esacepa 63. El análisis informado por el genoma arrojó aproximadamente diez veces más péptidos identificados y detectó péptidos vinculados a seis BGCs distintos dentro del organismo. Cabe destacar que tres de estos grupos identificados correspondían a metabolitos "huérfanos" previamente conocidos, incluyendo graybactina, rakicidina D y un sideróforo específico, con sus enzimas biosintéticas confirmadas como expresadas. Los cúmulos restantes detectados parecían ser novedosos y no caracterizados. Este ejemplo demuestra que integrar la información genómica en los flujos de trabajo proteómicos puede confirmar qué vías biosintéticas se expresan activamente en una cepa, priorizando así esos clústeres génicos para el aislamiento y caracterización de sus productos.
    Además, los métodos proteómicos pueden iluminar los objetivos moleculares y modos de acción de los NPs, un área que a menudo se denomina proteómica química. Por ejemplo, el perfilado basado en la actividad de proteínas (ABPP) emplea sondas de moléculas pequeñas, típicamente derivados o análogos de NPs, que reaccionan con los objetivos celulares del compuesto, marcando esas proteínas para su enriquecimiento e identificación a través de MS64. Esta técnica puede descubrir los objetivos proteicos a los que una NP específica o molécula relacionada se une dentro de la célula. Otro método, el perfilado térmico de proteoma (TPP), consiste en calentar muestras de proteínas en presencia o ausencia de un compuesto para determinar qué proteínas muestran alterada estabilidad térmica, indicando una interacciónde unión 65. Estos enfoques proteómicos químicos son invaluables para validar los objetivos biológicos de los NPs y esclarecer sus mecanismos de acción, complementando así el descubrimiento de los propios NPs.

5. ML e IA para integración y predicción de ómics

  1. Integración de datos multi-ómicos con ML
    Una frontera emocionante en el descubrimiento de NPs es la aplicación de ML e IA para integrar datos ómicos en predicciones funcionales. En el ámbito genómico, se han desarrollado algoritmos de aprendizaje automático supervisados, incluyendo bosques aleatorios, máquinas de vectores de soporte y redes neuronales profundas, para identificar patrones en BGCs asociados con tipos específicos de NPs. Por ejemplo, estos modelos de aprendizaje automático pueden categorizar los BGC en función de la clase general de moléculas que producen o incluso predecir ciertas características de la estructura química derivada de la secuencia génica. Una revisión realizada por Dason MS y sus colegas destaca varias herramientas de aprendizaje automático diseñadas para descifrar el "lenguaje" de los BGC, utilizando datos de secuencias de ADN o aminoácidos para deducir las estructuras y bioactividades de los NPs correspondientes66. Estos modelos suelen basarse en extensas bases de datos de clústeres y compuestos génicos conocidos para conocer las relaciones entre ellos, lo que permite predicciones sobre la posible actividad biológica de nuevos compuestos. Por ejemplo, pueden evaluar si un producto de una BGC no caracterizada podría poseer propiedades antibióticas o anticancerígenas. Los avances significativos que han facilitado estas capacidades incluyen la utilización de grandes conjuntos de datos de entrenamiento, como miles de estructuras NP y clústeres génicos conocidos, técnicas innovadoras de representación como incrustaciones de secuencias y redes neuronales de grafos que capturan las características de los cúmulos génicos y las estructuras químicas, y modelos multiparamétricos que combinan diversos descriptores genómicos y químicos para mejorar la precisión de la predicción.
    En el campo de la metabolómica, las técnicas de IA están mejorando significativamente la interpretación de datos espectrales de masas complejos. Un ejemplo notable es la herramienta CSI:FingerID, que emplea ML para predecir la huella estructural de una molécula a partir de su espectro MS/MS. Esta capacidad ayuda a identificar metabolitos desconocidos al sugerir subestructuras potenciales y compuestos candidatos67. De manera similar, se han utilizado modelos de aprendizaje profundo para la anotación espectral; las redes neuronales convolucionales y, más recientemente, las arquitecturas basadas en transformadores, como el modelo "DreaMS", aprenden patrones de fragmentación a partir de extensas bibliotecas espectrales. Estos modelos pueden proponer estructuras para espectros desconocidos basándose en los patrones que han aprendido, a menudo superando a los métodos heurísticos tradicionales, especialmente para metabolitos que no tienen coincidencias exactas en bases de datos existentes68. Más allá de la anotación estructural, el aprendizaje automático también contribuye a la metabolómica al identificar patrones globales. Por ejemplo, algoritmos de visualización no supervisados como t-SNE (t-distributed stochastic neighbor embedding) y UMAP (Uniform Manifold Approximation and Projection) pueden reducir la dimensionalidad de conjuntos de datos de metabolómica no dirigidos, facilitando la agrupación de muestras basándose en similitudes en sus perfiles de metabolitos. Mientras tanto, los clasificadores supervisados pueden conectar firmas metabolitas específicas con los rasgos fenotípicos o las bioactividades de las muestras, enriqueciendo aún más el análisis69,70,71.
    El aprendizaje automático se utiliza cada vez más para integrar diversos conjuntos de datos ómicos, creando una comprensión más completa de la biosíntesis y función de los NP. Al combinar datos de genómica, transcriptómica, proteómica y metabolómica, los modelos integrativos pueden revelar conexiones que pueden pasar desapercibidas al examinar cada tipo de dato por separado. Por ejemplo, los investigadores pueden construir redes de correlación gen-metabolito que vinculen los niveles de expresión de genes o proteínas con los niveles de producción de metabolitos. Los modelos de aprendizaje automático entrenados con estos datos integrados pueden entonces predecir qué grupos génicos son probablemente responsables de metabolitos específicos o actividades biológicas72,73. Técnicas multivariantes avanzadas, como el análisis factorial multi-ómico (disponible en herramientas como MOFA) y los métodos multivariantes regularizados (que se encuentran en paquetes como mixOmics), facilitan la identificación de factores latentes que abarcan diferentes tipos de datos, como un conjunto de genes coexpresados junto a un grupo de metabolitos coexistentes74,75,76. En términos prácticos, para el descubrimiento de NPs, varios enfoques ayudan a priorizar los clústeres génicos candidatos demostrando una conexión con metabolitos o fenotipos observados. Un ejemplo notable de esta estrategia integradora guiada por IA es el descubrimiento de una nueva familia de RiPPs sintetizados ribosómicamente y RiPPs utilizando el algoritmo DecRiPPter. Este algoritmo utiliza un modelo basado en máquina de vectores de soporte (SVM) para analizar datos genómicos de péptidos precursores crípticos de RiPP y luego cruza estas predicciones con análisis pan-genómico para eliminar compuestos conocidos. Cuando se aplica a 1.295 Streptomyces Genomas, DecRiPPter identificó con éxito 42 familias RiPP novedosas que previamente habían pasado desapercibidas en los métodos tradicionales de minería genómica. Entre estos clústeres predichos, uno fue validado experimentalmente para producir un nuevo lantipéptido de clase V, al que los investigadores denominaron "pristinina A3". Al inducir la expresión de este cúmulo génico silencioso, se aisló el compuesto pristinina A3 y se determinó su estructura mediante RMN y EM, revelando dos enzimas formadoras de lantoionina previamente desconocidas codificadas dentro de la vía77. Este logro pone de manifiesto cómo los análisis impulsados por IA pueden descubrir NPs ocultos: el modelo de aprendizaje automático detectó una señal genética que de otro modo no sería reconocida, guiando los esfuerzos experimentales para descubrir una molécula novedosa.
  2. Aplicaciones emergentes de IA
    Además de las aplicaciones actuales, varias estrategias emergentes impulsadas por IA están a punto de revolucionar aún más la investigación en NPs. Un área prometedora es la retrosíntesis computacional y el diseño de vías, donde se están desarrollando modelos de aprendizaje profundo para sugerir rutas biosintéticas o pasos de química sintética para NPs conocidos y sus análogos, lo que podría mejorar significativamente el diseño y la producción de compuestosnovedosos 78,79. Otra frontera emocionante es la predicción de la función enzimática mediante IA. Aprovechando herramientas modernas de predicción de la estructura de proteínas basadas en algoritmos de aprendizaje profundo, junto con técnicas de aprendizaje automático como el aprendizaje contrastivo en secuencias proteicas, los investigadores están empezando a deducir las actividades probables de enzimas no caracterizadas encontradas en los BGC. Esto podría aportar información sobre los tipos de transformaciones químicas que estas enzimas catalizan 80,81,82. Se están desarrollando pipelines totalmente integrados de ómics a química, donde las plataformas de IA buscan conectar automáticamente características espectrales de masas con datosgenómicos 83,84. En principio, dicho sistema podría analizar un conjunto de datos LC-MS/MS de una muestra compleja junto con secuencias genómicas del mismo entorno, permitiéndole predecir qué grupo génico es responsable de cada metabolito no identificado mediante la puntuación de coincidencias entre clústeres génicos y metabolitos. Aunque estos enfoques aún están en pañales, sugieren un futuro en el que la IA podría vincular de forma autónoma genes a moléculas, acelerando enormemente el proceso desde los datos ómicos hasta el descubrimiento de nuevas NPs.
  3. Gobernanza de datos y desafíos éticos en el descubrimiento de NPs asistidos por IA
    La investigación moderna en multiómica produce una cantidad significativa de datos diversos, pero la efectividad de las predicciones de IA depende en gran medida de la calidad y consistencia de estos conjuntos de datos. Cuando los conjuntos de entrenamiento están mal anotados o sesgados, pueden dar lugar a resultados engañosos y validacionesfallidas 85. Para abordar este problema, los investigadores deberían implementar los principios FAIR —Localizable, Accesible, Interoperable y Reutilizable— para promover la transparencia de los datos, la reproducibilidad y la reutilizaciónextensa 86. Este enfoque implica compartir tanto resultados positivos como negativos, documentar minuciosamente las canalizaciones de preprocesamiento de datos y proporcionar código de análisis para facilitar la verificación independiente. Además, la adopción de infraestructuras digitales emergentes, como cuadernos electrónicos de laboratorio (ELN) y flujos de trabajo contenedores, es esencial para mejorar la captura de datos y garantizar una curaciónestandarizada 87,88.
    Aunque la IA acelera significativamente el descubrimiento de NPs, también plantea preocupaciones éticas cruciales. Los algoritmos entrenados con conjuntos de datos incompletos o sesgados pueden reforzar desigualdades existentes, subrayando la necesidad de datos de entrenamiento diversos yrepresentativos 89. Además, emplear métodos de IA explicables es vital para mejorar la transparencia y ayudar a los científicos a comprender las predicciones, asegurando que la IA sirva como una herramienta de apoyo bajo control humano y no como un tomadorde decisiones 85. Las consideraciones éticas también abarcan la privacidad de los datos, especialmente al utilizar conjuntos de datos clínicos o derivados del ser humano, así como las implicaciones para la fuerza laboral a medida que la automatización influye cada vez más en el entorno de investigación. Para abordar estos problemas, los sistemas de IA deberían estar sujetos a auditorías periódicas, evaluaciones de sesgo y una estricta supervisión regulatoria, lo que ayudará a mantener la equidad, la responsabilidad y la fiabilidad en el campo de la investigación de los NPs.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Conclusiones

El estado actual del descubrimiento de los NP aprovecha una combinación de química analítica y bioinformática, creando una sinergia poderosa. Como se expone en la Figura 1, tecnologías ómicas avanzadas como la metabolómica LC-MS, la secuenciación de alto rendimiento, el RNA-Seq y la proteómica trabajan conjuntamente con la analítica computacional, incluyendo redes y aprendizaje automático, para formar una cadena eficaz de des...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Todos los autores afirman que no existen relaciones financieras o personales que puedan percibirse como posibles conflictos de interés.

Agradecimientos

Este trabajo fue apoyado por la Fundación Nacional de Ciencias Naturales de China (32500813), el Programa de Becas Postdoctorales de la CPSF (GZC20251503), el Programa de Ciencia y Tecnología de Sichuan (2024ZYD0149), la Fundación Especial de Investigación para el Programa Postdoctoral de la Provincia de Sichuan (TB2024017), el Proyecto Clave de Investigación y Desarrollo de la Oficina de Ciencia y Tecnología Deyang (2024SZY016, 2023SZZ009), y el Centro de Fortalecimiento de Capacidades y Educación Continua de la Comisión Nacional de Salud (GWJJMB202510025060). y Fondo Especial para Proyectos de Incubación del Hospital Popular Deyang (FRH202501, FHT202501). Reconocemos que la Figura 1 fue creada usando BioRender,

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Referencias

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

An lisis multi micoplataformas de metabol micaenfoques gen micost cnicas prote micasherramientas bioinform ticasredes molecularesminer a de genomasinteligencia artificial

Artículos relacionados