Para elaborar esta revisión, realizamos una búsqueda exhaustiva en la literatura en múltiples bases de datos y plataformas de indexación, incluyendo PubMed, Scopus, Web of Science, ScienceDirect y Google Scholar. La búsqueda abarcó publicaciones desde enero de 2015 hasta julio de 2025. Las palabras clave y combinaciones booleanas incluían: "descubrimiento de productos naturales", "ómica", "metabolómica", "genómica", "transcriptómica", "proteómica", "aprendizaje automático", "inteligencia artificial", "cúmulos génicos biosintéticos" y "integración multi-ómica". También se revisaron listas de referencias de artículos clave y revisiones recientes para identificar publicaciones relevantes adicionales. Además de los estudios revisados por pares, se consultó un número limitado de artículos preprints de plataformas como bioRxiv y medRxiv cuando aportaban información oportuna y relevante, aún no disponible en la literatura publicada. Todos los preprints están claramente etiquetados para mantener la transparencia. Esta sección revisa los últimos desarrollos y perspectivas futuras en las áreas clave del descubrimiento de NPs basados en ómica, centrándose específicamente en metabolómica, genómica, transcriptómica y proteómica. Así como su integración mediante IA/ML. Las herramientas y recursos principales tratados en estos campos se recopilan para referencia en la Tabla 1.
1. Metabolómica en el descubrimiento de NPs
- Plataformas analíticas para metabolómica
La metabolómica es crucial para descubrir NPs, ya que permite un análisis detallado de las pequeñas moléculas generadas por diversos organismos. Las principales herramientas analíticas utilizadas para caracterizar los metabolomas de los NP incluyen técnicas de MS de alta resolución, como LC-MS/MS y cromatografía de gases-MS (GC-MS), junto con espectroscopíaRMN 21,22. Los flujos de trabajo LC-MS/MS no dirigidos, como el LC-MS de ultraalto rendimiento combinado con MS/MS, permiten la identificación de una amplia gama de metabolitos en mezclas complejas, mientras que GC-MS destaca en el perfilado de compuestos volátiles. Además, nuevos métodos como la EM en tándem por infusión directa y la imagen de EM están mejorando el conjunto de herramientas de metabolómica para NPs23,24. Técnicas avanzadas de espectrometría de masas, incluyendo la MS multimodal, que combina modos iónicos positivos y negativos o emplea fragmentación MSn en varias etapas, y métodos compuestos como LC-MS junto con RMN, ofrecen una visión estructural más profunda de los metabolitosdetectados 25,26.
- Herramientas de procesamiento de datos y computación
Las herramientas de software especializadas desempeñan un papel crucial en el procesamiento e interpretación de datos de metabolómica. Programas como XCMS, MZmine y OpenMS se utilizan comúnmente para detectar y alinear características cromatográficas, o picos, mientras que pasos meticulosos de preprocesamiento de datos, como la alineación de picos, la normalización y el filtrado, son esenciales para lograr perfiles metabólicosreproducibles 27. La identificación de compuestos está soportada por bibliotecas espectrales MS/MS, incluyendo NIST y mzCloud, así como por herramientas de fragmentación in silico como SIRIUS y MetFrag28. La plataforma Global Natural Products Social (GNPS) ha surgido como un recurso clave para la creación de redes moleculares, que organiza espectros MS/MS relacionados para enfatizar familias químicas y facilitar la recreación de compuestosconocidos 29. Por ejemplo, un análisis usando GNPS sobre datos de LC-MS/MS de cultivos de Streptomyces identificó con éxito antibióticos conocidos como la espiramicina y la actinomicina, junto con análogos previamenteno reportados 30,31. La técnica de red molecular agrupaba eficazmente espectros desconocidos relacionados, y la adición de la red de identidad iónica mejoró la conectividad de características. Estos análisis basados en redes, cuando se combinan con herramientas estadísticas multivariantes como el análisis de componentes principales y el análisis discriminante de mínimos cuadrados parciales ortogonales, así como el análisis de redes de correlación, pueden vincular patrones de producción de metabolitos con condiciones biológicas o ambientales específicas. En un estudio en particular, la red molecular GNPS de extractos de fermentación de un Streptomyces asociado a plantas demostró perfiles metabolitos distintos que variaban según el mediador de crecimiento utilizado. Se detectaron metabolitos conocidos, incluyendo espiramicina, actinomicina y un compuesto cancerígeno llamado lingbyatoxina; sin embargo, muchos nodos de red no coincidían con ninguna entrada en las bases de datosespectrales 32. Este hallazgo sugiere la presencia de metabolitos genuinamente novedosos, lo que pone de manifiesto cómo la metabolómica no dirigida, junto con el GNPS, puede identificar posibles nuevas NPs para una exploración más profunda.
Combinar el cribado metabolómico con bioensayos funcionales facilita la rápida priorización de cepas o extractos que producen compuestos bioactivos. Además, recursos comunitarios emergentes como el Natural Products Atlas (NPAtlas), junto con canales integrados de análisis metaboloma-genoma, son fundamentales para asociar metabolitos detectados con sus BGCs en los organismos fuente33,34. Esta estrategia integradora permite a los investigadores correlacionar señales de metabolitos con datos genómicos, mejorando así la eficiencia en la identificación de NPs y el rastreo de su origen.
2. Genómica en el descubrimiento de los NPs
En la última década, la investigación sobre NPs microbianos ha entrado en una era transformadora de "minería profunda" impulsada por avances como la secuenciación de alto rendimiento, la esclerosis múltiple ultrasensible y de alta resolución y los enfoques multiómicosintegrados 35. Estas herramientas han desplazado los esfuerzos de descubrimiento de un aislamiento fortuito, pasando de una exploración dirigida y basada en datos. Las tuberías de minería del genoma, incluyendo antiSMASH 7.0 y DeepBGC, permiten ahora la identificación sistemática de BGCs crípticos, especialmente en taxones pocoexplorados 36,37.
- Secuenciación de alto rendimiento y ensamblaje híbrido
Las tecnologías de secuenciación de ADN de alto rendimiento, como la secuenciación de ADN de lectura corta y alto rendimiento combinada con plataformas de secuenciación de lectura larga, han transformado significativamente el estudio genómico de organismos que producen NPs. Al emplear estrategias híbridas de ensamblaje que integran tanto lecturas largas como cortas, los investigadores pueden lograr ensamblajes genómicos de alta contigüidad, esenciales para capturar BGCs completos dentro de un genoma38. Además, la secuenciación metagenómica, que incluye la recuperación de genomas ensamblados en metagenomas, amplía el descubrimiento de los BGC a microbios no cultivados, permitiendo a los científicos explorar el ADN ambiental para su potencialbiosintético 39. En casos donde los métodos convencionales de ensamblaje genómico no logran resolver grandes o repetitivos clústeres génicos, se pueden utilizar técnicas basadas en bibliotecas, como el cosmid o las bibliotecas de cromosomas artificiales bacterianos, para aislar y clonar fragmentos genómicos sustanciales. Este enfoque facilita la caracterización de cúmulos génicos completos mediante secuenciación dirigida o expresión heteróloga, ampliando así nuestra comprensión de la base genética de la biosíntesisde NPs 40,41.
- Herramientas de minería del genoma
Las herramientas bioinformáticas especializadas son esenciales para analizar los datos genómicos y identificar las firmas distintivas de las vías metabolicas secundarias. Programas como antiSMASH, PRISM y DeepBGC desempeñan un papel crucial en este proceso al detectar automáticamente los BGCs candidatos. Lo hacen reconociendo dominios biosintéticos específicos, como los asociados a síntesas peptídicas no ribosomales, síntesis de policetidas, vías peptídicas sintetizadas y modificadas postraduccionalmente (RiPP) y ciclasas terpeno, entre otros. Para facilitar la dereplicación, bases de datos como MIBiG, que recopila BGCs conocidos y sus productos, y NPAtlas, que cataloga NPs conocidos, ayudan a los investigadores a emparejar nuevas secuencias o compuestos con ejemplosestablecidos 37,42,43. Algoritmos de agrupamiento, como BiG-SCAPE, junto con herramientas como CORASON, organizan los BGCs relacionados en familias, ofreciendo una visión de red de la diversidad biosintética y facilitando la identificación de nuevas familias de conglomerados mediante comparaciones con familias conocidas44. Análisis bioinformáticos adicionales, incluyendo búsquedas BLAST y escaneos ocultos de modelos de Markov, pueden predecir las funciones potenciales de enzimas codificadas dentro de un BGC, mientras que los enfoques genómicos comparativos, como el análisis de sintensia y la coevolución de genes, ayudan a refinar estas prediccionesfuncionales 45. Además, los datos genómicos permiten la anotación de elementos reguladores vinculados a la biosíntesis de NPs, incluyendo promotores específicos de vías y reguladorestranscripcionales 46. Estas ideas proporcionan una base para la ingeniería de vías; por ejemplo, técnicas de biología sintética como la clonación de recombinación asociada a transformaciones y la recombinación Red/ET permiten a los investigadores capturar y expresar BGCs silenciosas o crípticas en un organismo huésped heterólogo, activando así la producción de susmetabolitos 47.
Los esfuerzos de minería genómica han llevado con éxito al descubrimiento de nuevos NPs al concentrarse en señales genéticas específicas. Por ejemplo, una búsqueda sistemática de genes vinculados a la resistencia a los glicopéptidos reveló varios BGCs inusuales que se predicen codificando nuevos antibióticos. Este método resultó en la identificación de dos compuestos novedosos, la compstatina y la cobramicina, ambos con mecanismos de acción únicos al dirigirse a las autolisinasbacterianas 48. De manera similar, explorar el microbioma humano en busca de contenido génico biosintético produjo un candidato a lipopéptido conocido como "humicin", reconocido por su posible eficacia contra Staphylococcus y las especies49 de Streptococcus. En estos casos, los compuestos se identificaron inicialmente mediante métodos computacionales, prediciendo sus estructuras químicas a partir de datos genómicos. Posteriormente, estas moléculas predichas fueron sintetizadas químicamente y demostraron las actividades antibióticas esperadas, validando así la estrategia de descubrimiento basado en el genoma. A mayor escala, la secuenciación a gran escala de diversas bacterias, incluidos muchos actinomicetos raros, está descubriendo una gran cantidad de clústeres génicos "crípticos" de BGCs cuyos productos siguen siendo desconocidos. Por ejemplo, las investigaciones sobre los genomas de Streptomyces han revelado miles de BGCsno caracterizados 50. Un enfoque emergente para vincular estos grupos de huérfanos con metabolitos reales implica integrar análisis metabolómicos con encuestas genómicas. Al correlacionar la presencia o expresión de un cúmulo génico con la detección de características únicas del metabolito a través de plataformas como GNPS o bases de datos espectrales de masas, los investigadores pueden empezar a asignar productos químicos tentativos a los numerosos nuevos BGCs, facilitando así el descubrimiento de NPs verdaderamente novedosos a partir de datos genómicos.
3. Transcriptómica en el descubrimiento de productos naturales
Los análisis transcriptómicos ofrecen una perspectiva dinámica sobre la actividad de los BGC midiendo la expresión de ARNm bajo diversas condiciones. Específicamente, los experimentos de RNA-seq pueden descubrir qué BGCs se transcriben activamente y cómo fluctúan sus niveles de expresión en respuesta a cambios ambientales o experimentales. Comparando los niveles de transcritos entre diferentes condiciones, el análisis de expresión diferencial, utilizando herramientas como DESeq2 o edgeR, puede identificar BGCs que están regulados al alza o a la baja, destacando así los clústeres génicos que pueden ser inducibles o permanecer en silencio bajo las condicionesestándar 51. Aunque el enfoque típico para investigar la expresión de BGC es el ARN-seq convencional realizado en células cultivadas a granel, se están empezando a utilizar técnicas más avanzadas como el RNA-seq unicelular en microbiomas complejos. Este cambio permite la observación de la expresión génica en organismos ambientales que son difíciles decultivar 52,53. Un flujo de trabajo estándar de RNA-seq generalmente incluye el mapeo de lecturas a un genoma de referencia usando alineadores como STAR o HISAT2, la cuantificación de la expresión génica con herramientas como featureCounts o Kallisto, y la normalización de los datos para identificar cambios significativos en la expresión. A continuación, el análisis de redes de coexpresión, a menudo realizado con el paquete WGCNA, puede agrupar genes que presentan patrones de expresión similares. Cuando también hay datos de metabolitos disponibles, estas redes pueden ampliarse aún más para incorporar metabolitos, vinculando así compuestos específicos con genescoexpresados 54.
Los datos transcriptómicos han demostrado ser valiosos para identificar vías biosintéticas condicionalmente activas. Un ejemplo notable de este enfoque se encuentra en una comparación detallada de cuatro cepas51 de Salinispora. En este estudio, se reveló que más de la mitad de las BGC en cada cepa se expresaron en cierta medida, y muchos grupos inactivos en una cepa mostraron expresión en otra. Al analizar los perfiles de expresión génica en estas cepas, los investigadores pudieron identificar varios factores reguladores que parecían silenciar o activar grupos específicos. Este método integrador condujo a la identificación de una familia de NPs previamente desconocida, conocida como salinipostinas. Los datos transcriptómicos indicaron un cúmulo génico críptico como posible fuente de un compuesto no identificado; Cuando este grupo se indujo a expresarse (mediante cambios regulatorios), se produjo moléculas de salinipostina, que posteriormente fueron aisladas y caracterizadas estructuralmente. Este estudio ejemplifica cómo la transcriptómica puede facilitar el descubrimiento de NPs: al analizar la expresión diferencial de genes, los investigadores pueden destacar los BGCs candidatos, y la correlación entre la expresión génica y los perfiles de metabolitos proporciona evidencia de apoyo para las relaciones gen-metabolito que pueden validarse mediante experimentos dirigidos.
4. Proteómica en el descubrimiento de NPs
- Enfoques de escopeta y proteómica dirigida
La proteómica, que implica el estudio a gran escala de proteínas, ofrece una perspectiva vital en la investigación de NPs al medir directamente las enzimas y proteínas que desempeñan un papel en las vías biosintéticas. Generalmente, los enfoques proteómicos pueden clasificarse en dos tipos principales: proteómica de escopeta (no dirigida) y proteómica dirigida. En la proteómica shotgun, las proteínas extraídas de muestras microbianas o vegetales son sometidas a digestión enzimática, típicamente con tripsina, y los péptidos resultantes se analizan utilizando LC-MS/MS de alta resolución, a menudo empleando espectrómetros de masas avanzados como el tiempo de vuelo cuadrupolar (QTOF) o espectrómetros de masa orbitaltrampa de alta resolución 55. Los datos de la EM recogidos, conocidos como espectros MS/MS, se comparan con secuencias peptídicas mediante la búsqueda en una base de datos de proteínas derivada del genoma del organismo o de una especie estrechamente relacionada, utilizando herramientas de software como MaxQuant o Mascot56,57. Este proceso permite cuantificar los cambios en la abundancia de proteínas bajo diferentes condiciones, lo que puede lograrse mediante métodos sin marcaje o empleando técnicas de marcado isotópico, como el marcaje estable de isótopos por aminoácidos en cultivo celular (SILAC) o el marcaje isobárico con reactivos TMT/iTRAQ, para determinar qué enzimas biosintéticas están reguladas al alza o a la baja58, 59. En cambio, los métodos de proteómica dirigida, incluyendo la monitorización de reacciones seleccionadas (SRM) o la monitorización de reacciones paralelas (PRM), se concentran en un conjunto específico de iones peptídicos, a menudo péptidos únicos de enzimas biosintéticas clave o proteínas reguladoras, lo que permite una cuantificación precisa y sensible de estos péptidos en múltiplesmuestras 60,61.
- Enfoques innovadores en proteómica
Un desafío significativo en el análisis proteómico del metabolismo secundario es la detección de grandes enzimas biosintéticas, como las sintetas peptídicas no ribosomales y las síntesis de policetida, que a menudo superan los 100 kDa de tamaño y producen pocos péptidos detectables con protocolos digestivos estándar, lo que dificulta su observación. Para abordar este problema, Bumpus et al. desarrollaron un método conocido como PrISM, que mejora la detección de proteínas NRPS y PKS utilizando un cofactor específico presente en estasenzimas 62. PrISM integra proteómica convencional de escopeta con un ensayo de eyección de fosfofinanteteinilo (Ppant). Cabe destacar que las enzimas NRPS y PKS poseen un brazo Ppant unido covalentemente en sus dominios portadores acilo o portadores peptidil; durante la fragmentación de MS/EM, este grupo protésico genera frecuentemente un único fragmento de ion, conocido como ion de "eyección de Ppant". Filtrando computacionalmente los datos LC-MS/MS para este ion diagnóstico, el método PrISM puede resaltar eficazmente péptidos derivados de las enzimas NRPS y PKS en medio de la compleja mezcla de todas las proteínas celulares. Esta estrategia ha descubierto con éxito vías biosintéticas ocultas a través de la proteómica. Por ejemplo, el flujo de trabajo PrISM permitió la detección de péptidos del complejo gramicidina S sintetasa (GrsA/GrsB) en cultivos de Bacillus brevis, estableciendo un vínculo directo entre estas enzimas NRPS y la producción del antibiótico gramicidina S en eseorganismo 62. Es importante destacar que la identificación proteómica de GrsA/GrsB no requirió un conocimiento genómico previo de B. brevis, lo que ilustra que en ciertos casos, el análisis proteómico por sí solo puede descubrir vías biosintéticas activas de NPs incluso en organismos cuyos genomas aún no han sido secuenciados.
- Proteómica informada por el genoma
Cuando hay una secuencia genómica disponible, el poder de la proteómica puede mejorarse significativamente utilizando una base de datos específica de cepas para la identificación de péptidos. Por ejemplo, en un estudio que analizó el proteoma de Streptomyces lilacinus, los investigadores realizaron dos análisis: uno buscando espectros en una base de datos general de proteínas y otro en una base de datos personalizada derivada del genoma secuenciado de esacepa 63. El análisis informado por el genoma arrojó aproximadamente diez veces más péptidos identificados y detectó péptidos vinculados a seis BGCs distintos dentro del organismo. Cabe destacar que tres de estos grupos identificados correspondían a metabolitos "huérfanos" previamente conocidos, incluyendo graybactina, rakicidina D y un sideróforo específico, con sus enzimas biosintéticas confirmadas como expresadas. Los cúmulos restantes detectados parecían ser novedosos y no caracterizados. Este ejemplo demuestra que integrar la información genómica en los flujos de trabajo proteómicos puede confirmar qué vías biosintéticas se expresan activamente en una cepa, priorizando así esos clústeres génicos para el aislamiento y caracterización de sus productos.
Además, los métodos proteómicos pueden iluminar los objetivos moleculares y modos de acción de los NPs, un área que a menudo se denomina proteómica química. Por ejemplo, el perfilado basado en la actividad de proteínas (ABPP) emplea sondas de moléculas pequeñas, típicamente derivados o análogos de NPs, que reaccionan con los objetivos celulares del compuesto, marcando esas proteínas para su enriquecimiento e identificación a través de MS64. Esta técnica puede descubrir los objetivos proteicos a los que una NP específica o molécula relacionada se une dentro de la célula. Otro método, el perfilado térmico de proteoma (TPP), consiste en calentar muestras de proteínas en presencia o ausencia de un compuesto para determinar qué proteínas muestran alterada estabilidad térmica, indicando una interacciónde unión 65. Estos enfoques proteómicos químicos son invaluables para validar los objetivos biológicos de los NPs y esclarecer sus mecanismos de acción, complementando así el descubrimiento de los propios NPs.
5. ML e IA para integración y predicción de ómics
- Integración de datos multi-ómicos con ML
Una frontera emocionante en el descubrimiento de NPs es la aplicación de ML e IA para integrar datos ómicos en predicciones funcionales. En el ámbito genómico, se han desarrollado algoritmos de aprendizaje automático supervisados, incluyendo bosques aleatorios, máquinas de vectores de soporte y redes neuronales profundas, para identificar patrones en BGCs asociados con tipos específicos de NPs. Por ejemplo, estos modelos de aprendizaje automático pueden categorizar los BGC en función de la clase general de moléculas que producen o incluso predecir ciertas características de la estructura química derivada de la secuencia génica. Una revisión realizada por Dason MS y sus colegas destaca varias herramientas de aprendizaje automático diseñadas para descifrar el "lenguaje" de los BGC, utilizando datos de secuencias de ADN o aminoácidos para deducir las estructuras y bioactividades de los NPs correspondientes66. Estos modelos suelen basarse en extensas bases de datos de clústeres y compuestos génicos conocidos para conocer las relaciones entre ellos, lo que permite predicciones sobre la posible actividad biológica de nuevos compuestos. Por ejemplo, pueden evaluar si un producto de una BGC no caracterizada podría poseer propiedades antibióticas o anticancerígenas. Los avances significativos que han facilitado estas capacidades incluyen la utilización de grandes conjuntos de datos de entrenamiento, como miles de estructuras NP y clústeres génicos conocidos, técnicas innovadoras de representación como incrustaciones de secuencias y redes neuronales de grafos que capturan las características de los cúmulos génicos y las estructuras químicas, y modelos multiparamétricos que combinan diversos descriptores genómicos y químicos para mejorar la precisión de la predicción.
En el campo de la metabolómica, las técnicas de IA están mejorando significativamente la interpretación de datos espectrales de masas complejos. Un ejemplo notable es la herramienta CSI:FingerID, que emplea ML para predecir la huella estructural de una molécula a partir de su espectro MS/MS. Esta capacidad ayuda a identificar metabolitos desconocidos al sugerir subestructuras potenciales y compuestos candidatos67. De manera similar, se han utilizado modelos de aprendizaje profundo para la anotación espectral; las redes neuronales convolucionales y, más recientemente, las arquitecturas basadas en transformadores, como el modelo "DreaMS", aprenden patrones de fragmentación a partir de extensas bibliotecas espectrales. Estos modelos pueden proponer estructuras para espectros desconocidos basándose en los patrones que han aprendido, a menudo superando a los métodos heurísticos tradicionales, especialmente para metabolitos que no tienen coincidencias exactas en bases de datos existentes68. Más allá de la anotación estructural, el aprendizaje automático también contribuye a la metabolómica al identificar patrones globales. Por ejemplo, algoritmos de visualización no supervisados como t-SNE (t-distributed stochastic neighbor embedding) y UMAP (Uniform Manifold Approximation and Projection) pueden reducir la dimensionalidad de conjuntos de datos de metabolómica no dirigidos, facilitando la agrupación de muestras basándose en similitudes en sus perfiles de metabolitos. Mientras tanto, los clasificadores supervisados pueden conectar firmas metabolitas específicas con los rasgos fenotípicos o las bioactividades de las muestras, enriqueciendo aún más el análisis69,70,71.
El aprendizaje automático se utiliza cada vez más para integrar diversos conjuntos de datos ómicos, creando una comprensión más completa de la biosíntesis y función de los NP. Al combinar datos de genómica, transcriptómica, proteómica y metabolómica, los modelos integrativos pueden revelar conexiones que pueden pasar desapercibidas al examinar cada tipo de dato por separado. Por ejemplo, los investigadores pueden construir redes de correlación gen-metabolito que vinculen los niveles de expresión de genes o proteínas con los niveles de producción de metabolitos. Los modelos de aprendizaje automático entrenados con estos datos integrados pueden entonces predecir qué grupos génicos son probablemente responsables de metabolitos específicos o actividades biológicas72,73. Técnicas multivariantes avanzadas, como el análisis factorial multi-ómico (disponible en herramientas como MOFA) y los métodos multivariantes regularizados (que se encuentran en paquetes como mixOmics), facilitan la identificación de factores latentes que abarcan diferentes tipos de datos, como un conjunto de genes coexpresados junto a un grupo de metabolitos coexistentes74,75,76. En términos prácticos, para el descubrimiento de NPs, varios enfoques ayudan a priorizar los clústeres génicos candidatos demostrando una conexión con metabolitos o fenotipos observados. Un ejemplo notable de esta estrategia integradora guiada por IA es el descubrimiento de una nueva familia de RiPPs sintetizados ribosómicamente y RiPPs utilizando el algoritmo DecRiPPter. Este algoritmo utiliza un modelo basado en máquina de vectores de soporte (SVM) para analizar datos genómicos de péptidos precursores crípticos de RiPP y luego cruza estas predicciones con análisis pan-genómico para eliminar compuestos conocidos. Cuando se aplica a 1.295 Streptomyces Genomas, DecRiPPter identificó con éxito 42 familias RiPP novedosas que previamente habían pasado desapercibidas en los métodos tradicionales de minería genómica. Entre estos clústeres predichos, uno fue validado experimentalmente para producir un nuevo lantipéptido de clase V, al que los investigadores denominaron "pristinina A3". Al inducir la expresión de este cúmulo génico silencioso, se aisló el compuesto pristinina A3 y se determinó su estructura mediante RMN y EM, revelando dos enzimas formadoras de lantoionina previamente desconocidas codificadas dentro de la vía77. Este logro pone de manifiesto cómo los análisis impulsados por IA pueden descubrir NPs ocultos: el modelo de aprendizaje automático detectó una señal genética que de otro modo no sería reconocida, guiando los esfuerzos experimentales para descubrir una molécula novedosa.
- Aplicaciones emergentes de IA
Además de las aplicaciones actuales, varias estrategias emergentes impulsadas por IA están a punto de revolucionar aún más la investigación en NPs. Un área prometedora es la retrosíntesis computacional y el diseño de vías, donde se están desarrollando modelos de aprendizaje profundo para sugerir rutas biosintéticas o pasos de química sintética para NPs conocidos y sus análogos, lo que podría mejorar significativamente el diseño y la producción de compuestosnovedosos 78,79. Otra frontera emocionante es la predicción de la función enzimática mediante IA. Aprovechando herramientas modernas de predicción de la estructura de proteínas basadas en algoritmos de aprendizaje profundo, junto con técnicas de aprendizaje automático como el aprendizaje contrastivo en secuencias proteicas, los investigadores están empezando a deducir las actividades probables de enzimas no caracterizadas encontradas en los BGC. Esto podría aportar información sobre los tipos de transformaciones químicas que estas enzimas catalizan 80,81,82. Se están desarrollando pipelines totalmente integrados de ómics a química, donde las plataformas de IA buscan conectar automáticamente características espectrales de masas con datosgenómicos 83,84. En principio, dicho sistema podría analizar un conjunto de datos LC-MS/MS de una muestra compleja junto con secuencias genómicas del mismo entorno, permitiéndole predecir qué grupo génico es responsable de cada metabolito no identificado mediante la puntuación de coincidencias entre clústeres génicos y metabolitos. Aunque estos enfoques aún están en pañales, sugieren un futuro en el que la IA podría vincular de forma autónoma genes a moléculas, acelerando enormemente el proceso desde los datos ómicos hasta el descubrimiento de nuevas NPs.
- Gobernanza de datos y desafíos éticos en el descubrimiento de NPs asistidos por IA
La investigación moderna en multiómica produce una cantidad significativa de datos diversos, pero la efectividad de las predicciones de IA depende en gran medida de la calidad y consistencia de estos conjuntos de datos. Cuando los conjuntos de entrenamiento están mal anotados o sesgados, pueden dar lugar a resultados engañosos y validacionesfallidas 85. Para abordar este problema, los investigadores deberían implementar los principios FAIR —Localizable, Accesible, Interoperable y Reutilizable— para promover la transparencia de los datos, la reproducibilidad y la reutilizaciónextensa 86. Este enfoque implica compartir tanto resultados positivos como negativos, documentar minuciosamente las canalizaciones de preprocesamiento de datos y proporcionar código de análisis para facilitar la verificación independiente. Además, la adopción de infraestructuras digitales emergentes, como cuadernos electrónicos de laboratorio (ELN) y flujos de trabajo contenedores, es esencial para mejorar la captura de datos y garantizar una curaciónestandarizada 87,88.
Aunque la IA acelera significativamente el descubrimiento de NPs, también plantea preocupaciones éticas cruciales. Los algoritmos entrenados con conjuntos de datos incompletos o sesgados pueden reforzar desigualdades existentes, subrayando la necesidad de datos de entrenamiento diversos yrepresentativos 89. Además, emplear métodos de IA explicables es vital para mejorar la transparencia y ayudar a los científicos a comprender las predicciones, asegurando que la IA sirva como una herramienta de apoyo bajo control humano y no como un tomadorde decisiones 85. Las consideraciones éticas también abarcan la privacidad de los datos, especialmente al utilizar conjuntos de datos clínicos o derivados del ser humano, así como las implicaciones para la fuerza laboral a medida que la automatización influye cada vez más en el entorno de investigación. Para abordar estos problemas, los sistemas de IA deberían estar sujetos a auditorías periódicas, evaluaciones de sesgo y una estricta supervisión regulatoria, lo que ayudará a mantener la equidad, la responsabilidad y la fiabilidad en el campo de la investigación de los NPs.