Artículo de método

Predicción de aprendizaje automático de proteínas de intercambio de dominios 3D en plantas medicinales

DOI:

10.3791/68519

15 de agosto de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio examina las proteínas involucradas o que se predice que estarán involucradas en el intercambio de dominios 3D de varios genomas de plantas medicinales. Emplea modelos de aprendizaje automático para predecir con precisión las proteínas de intercambio de dominios 3D y anticipar sus funciones y relevancia para la producción de metabolitos secundarios.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El intercambio de dominios 3D es un fenómeno estructural de proteínas en el que dos o más subunidades de proteínas intercambian subunidades estructurales idénticas y forman oligómeros. Las proteínas que exhiben intercambio de dominios 3D juegan un papel crucial en diversas funciones biológicas, como la biosíntesis de metabolitos secundarios, y en hacer frente a varios estreses bióticos y abióticos en plantas medicinales. Este estudio investiga la capacidad de predecir patrones de intercambio de dominios 3D entre los genomas de plantas medicinales utilizando modelos clasificadores de bosque aleatorio y K-vecino más cercano, demostrando precisiones de 91.6% y 88.7%, respectivamente. Se predijo que un total de 420 (31%) de secuencias estaban supuestamente involucradas en el intercambio de dominios 3D. También se llevó a cabo una investigación de enriquecimiento en las secuencias de proteínas intercambiadas en 3D predichas de varias plantas medicinales para la anotación de funciones basadas en términos de Gene Ontology (GO), análisis de vías de la Enciclopedia de Genes y Genomas de Kioto (KEGG) y su distribución de dominios en vías de biosíntesis de metabolitos secundarios. La anotación funcional de las secuencias predichas infiere que las secuencias intercambiadas de dominios 3D estaban involucradas en diversas funciones moleculares, como el transporte fotosintético de electrones en el fotosistema II y los transportadores de electrones, la transferencia de electrones dentro de la vía cíclica de transporte de electrones de la actividad de la fotosíntesis, la fosforilación oxidativa y la regulación génica de las tensiones ambientales (bióticas y abióticas) mediante la síntesis de metabolitos secundarios (terpenoides, alcaloides y poliaminas). Estos hallazgos subrayan la capacidad del aprendizaje automático para predecir la participación de las proteínas en el fenómeno de intercambio de dominios 3D, su función respectiva y su potencial para facilitar el descubrimiento de fármacos y las iniciativas de bioingeniería.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los métodos computacionales han revolucionado la investigación de proteínas al permitir análisis detallados y predicciones sobre estructuras, funciones e interacciones de proteínas. La identificación y anotación precisas de las funciones de las proteínas son esenciales para desentrañar los mecanismos moleculares de la vida y tienen una gran importancia para los avances en la medicina y el desarrollo de fármacos. Sin embargo, la complejidad y el costo inherentes de los métodos experimentales limitan su escalabilidad para acomodar los datos de secuencia grandes. Como resultado, el desarrollo de métodos computacionales para la predicción de la función de las proteínas se ha convertido en un área fundamental en la biología computacional y molecular, abordando esta brecha a travésde enfoques innovadores a gran escala.

El intercambio de dominios 3D2 es un fenómeno estructural en proteínas donde los segmentos de una estructura compartida se intercambian entre cadenas individuales. En 1994, la documentación introductoria sobre el mecanismo de intercambio de dominios 3D se encontró en el dímero3 de la toxina de la difteria. Sin embargo, los principios fundamentales del intercambio de dominios 3D se remontan a cuatro décadas. Se ha observado que la ribonucleasa A pancreática bovina (ARNasa A) forma dímeros durante la liofilización en ácido acético, a través de sofisticados experimentos de modificación química4. En la oligomerización de proteínas, dos o más cadenas de proteínas intercambian elementos estructurales idénticos a través de regiones de bisagra flexibles. La porción de la proteína intercambiada entre subunidades monoméricas se denomina dominio intercambiado, que puede consistir en un dominio globular completo, un bucle o un elemento estructural secundario en ciertas proteínas. Por el contrario, las regiones que permanecen sin cambios en sus posiciones originales dentro de los monómeros se denominan dominios no intercambiados5. Un acoplamiento entre dominios no intercambiados se define como una interfaz de dominio no intercambiada (NSDI) que se muestra en la Figura 1. En el intercambio de dominios 3D, la relación entre el dominio no intercambiado de una subunidad de proteína y el dominio ya intercambiado de otra subunidad se denomina interfaz de dominio intercambiado (SDI). Otro aspecto significativo de este fenómeno es la región bisagra, un segmento de enlazador flexible que conecta los dominios intercambiados y no intercambiados. Esta región de bisagra juega una función esencial para ayudar al movimiento del intercambio de dominios 3D y sirve como un interruptor conformacional, lo que permite la reconfiguración estructural necesaria para que ocurra el intercambio de dominios. El intercambio de dominios 3D se ha implicado en varios procesos biológicos, incluido el ensamblaje de proteínas y la regulación funcional5. También se asocia con ciertas enfermedades de plegamiento incorrecto de proteínas, donde el intercambio aberrante puede conducir a la formación de agregados o fibrillas amiloides.

figure-introduction-1
Figura 1: Representación estructural del intercambio de dominios 3D. La representación ilustra el intercambio de elementos estructurales idénticos entre dos monómeros de proteínas a través de una región de bisagra flexible, lo que da como resultado la formación de un ensamblaje dimérico u oligomérico intercambiado de dominio . Haga clic aquí para ver una versión más grande de esta figura.

Se han identificado diferentes tipos de intercambio de dominios 3D en función de la naturaleza de los dominios intercambiados y las estructuras oligoméricas resultantes6. En el año 2002, Eisenberg y su colega identificaron tres tipos de intercambio de dominios 3D: intercambio de dominios de buena fe (BDS), intercambio de cuasi-dominios (QDS) y candidato para intercambio de dominios 3D (CDS)7. La clase de proteína más común es el intercambio de dominios de buena fe. Se refiere a un estado en el que tanto las moléculas de dímero como las de monómero están presentes en una forma estable, donde se supone que el dímero adopta una configuración de intercambio de dominio mientras que el monómero se supone que adopta una configuración cerrada. En el intercambio de cuasidominios, se sabe que una proteína está presente en el estado oligomérico, pero se sabe que su estructura homóloga está presente en el estado monomérico. En CDS, solo confirma la clasificación de proteínas bajo las categorías de intercambio de dominios, mientras que la información estructural de los monómeros involucrados o sus homólogos monoméricos no está presente8. En este procedimiento, los monómeros o sus homólogos monoméricos están ausentes; más bien, están presentes moléculas de proteínas heterólogas. La Tabla 1 muestra un ejemplo de estas tres categorías9.

Tabla 1: Tipos de intercambio de dominios 3D con ejemplo. Haga clic aquí para descargar esta tabla.

Estudios posteriores revelaron numerosas estructuras de intercambio de dominios, allanando el camino para la comprensión del concepto de intercambio de dominios 3D. La evidencia estructural más temprana que respalda este fenómeno se observó en la molécula de la proteína represora Cro del bacteriófago λ, que forma una estructura dimérica a través del intercambio de sus hebras C-terminales. En 1996, el investigador descubrió que la molécula monomérica Cro estaba involucrada en el intercambio de dominios 3D10. Otras estructuras11, como βB2-cristalina12, CksHs213 humana, catalasa14 de hígado de res e interleucina-515 humana recombinante, también se informaron como posibles estructuras intercambiadas de dominio 3D. Según la posición del dominio intercambiado dentro de las moléculas de proteína, el intercambio de dominios 3D se clasifica en tres tipos: intercambio de dominios C-terminales, intercambio de dominios N-terminales y el intercambio de dominios centrales relativamente raro. Los autores utilizan un genoma humano completo para predecir un caso de intercambio de dominio. Utilizan Random Forest y Support Vector Machine como clasificadores binarios con precisiones del 81,7% y 73,9%, respectivamente. Casi el 44% de la secuencia de proteínas se predijo como intercambio de dominio 3D en el genoma humano6. Se llevó a cabo un análisis de enriquecimiento de los casos predichos para su distribución de dominios, distribución de enfermedades y anotación funcional basada en la ontología genética (GO). Otro enfoque investiga el análisis completo de todo el genoma de Ocimum tenuiforum utilizando el enfoque de bosque aleatorio y encontró que se predice que casi el 25% de las secuencias de proteínas en Ocimum tenuiforum están involucradas en el intercambio de dominios 3D. Los investigadores también realizan anotaciones funcionales utilizando la asociación de términos GO y su asociación familiar de dominios de proteínas y encontraron que solo 1158 secuencias estaban involucradas en el estrés abiótico16.

Las plantas demuestran una variedad de familias de proteínas distintivas, con proteínas específicas reconocidas por tener la capacidad de sufrir reordenamientos estructurales, incluido el intercambio de dominios 3D. El intercambio de dominios 3D puede influir en condiciones de estrés biótico y abiótico con la producción de metabolitos secundarios u otras vías biológicamente relevantes que tienen varias aplicaciones farmacológicas; por lo tanto, proporcionan un enfoque significativo para esta investigación. La estructura cristalina de Wal1 demostró una configuración dimérica de dominio intercambiado, con dos dímeros dentro de la unidad asimétrica y el reordenamiento estructural que se encuentra en la cistatina C. Las fitocistatinas juegan un papel importante en el estrés abiótico y también mejoran la resistencia de los cultivos. Se ha identificado un total de 20.121 proteínas predichas intercambiadas de dominio 3D a partir de la literatura disponible y de varios repositorios relevantes, de las cuales 17.552 son de origen vegetal y 2569 son de organismos no vegetales17,18.

En la literatura, se han reportado varios otros ejemplos de predicción de intercambio de dominios 3D de diferentes plantas utilizando un enfoque de aprendizaje automático. Como Arabidopsis thaliana mostrando 33.7% (4058 de 12,033 secuencias revisadas), Medicago truncatula 20.9% (39 de 186 secuencias revisadas), Solanum tuberosum 36.5% (146 de 400 secuencias revisadas), Solanum lycopersicum 25.5% (108 de 423 secuencias revisadas) y Ocimum tenuiforum 15.5% (5706 de 36841 secuencias revisadas)6. Los métodos computacionales se han vuelto invaluables para explorar los aspectos estructurales y funcionales de las proteínas intercambiadas de dominio 3D. Estos enfoques facilitan la predicción de secuencias sobre la base de las mejores características posibles19, la anotación y el análisis de enriquecimiento, ofreciendo información sobre los mecanismos moleculares fundamentales. La predicción del intercambio de dominios 3D en varias secuencias de proteínas se logró mediante el uso de un clasificador basado en una máquina de vectores de soporte (SVM). Este enfoque se desarrolló mediante la integración de características estructurales y de secuencia, lo que arrojó precisiones de predicción del 76,33% en el conjunto de datos de entrenamiento y del 73,81% en el conjunto de datos de prueba, lo que significa su potencial para identificar tendencias de intercambio de dominios en proteínas20. La razón principal para elegir KNN en lugar de SVM es que KNN tiene un proceso de capacitación mucho más simple. Solo necesita un parámetro principal, K (es el número de vecinos más cercanos considerados al hacer una predicción), para establecerse, mientras que SVM requiere un ajuste cuidadoso de varios parámetros como el tipo de kernel, C y gamma. Además, KNN maneja la clasificación de varias clases más fácilmente, mientras que SVM generalmente necesita estrategias más complejas, como estrategias uno contra uno.

Aprendizaje automático para la predicción estructural de proteínas
La predicción de la estructura de la proteína implica la inferencia de la forma tridimensional de una proteína a partir de su secuencia FASTA. Los avances recientes en este campo han sido impulsados significativamente por la aplicación de diversas técnicas de aprendizaje automático a los datos evolutivos21,22. Los primeros enfoques para extraer información de datos coevolutivos se basaron en métodos de aprendizaje automático. Sin embargo, las estrategias más recientes, en particular las que utilizan redes residuales profundas, han demostrado un rendimiento superior en la predicción del objetivopotencial 23. Alphafold es una base de datos basada en el aprendizaje profundo, mientras que Rosetta es una herramienta de función energética basada en la física. Estas herramientas se utilizan para predecir la estructura atómica 3D completa que se puede aproximar a las estructuras experimentales. Solo proporcionan coordenadas estructurales de resolución atómica, pero estas herramientas no especifican los eventos de intercambio de dominios 3D. Por el contrario, el enfoque sugerido no es un predictor completo de la estructura 3D, sino que solo predice si es probable que una proteína sufra un intercambio de dominio 3Do no 24,25.

Las plantas medicinales se han utilizado durante siglos como recursos naturales para la prevención y el tratamiento de diversas enfermedades, atribuidas a sus compuestos bioactivos. Son esenciales en la medicina tradicional y contribuyen al desarrollo de medicamentos farmacéuticos modernos. Sin embargo, no se ha llevado a cabo ningún trabajo significativo en el campo del intercambio de dominios proteicos de plantas medicinales para el descubrimiento de fármacos. Los algoritmos, incluido el aprendizaje automático y sus modelos de conjunto, reconocen patrones y relaciones en datos de secuencia para predecir el intercambio de dominios 3D. La razón detrás de la elección de las plantas medicinales para este estudio es que puede detectar la diversidad funcional de una proteína en las plantas involucradas en el intercambio de dominios 3D, lo que resulta en la comprensión de la respuesta al estrés, la defensa contra patógenos y la biosíntesis metabólica. Los desafíos técnicos asociados con la determinación del intercambio de dominios 3D de proteínas en grandes cantidades y conformaciones oligoméricas complejas y avanzadas mediante el uso de técnicas de RMN o cristalografía resaltan la necesidad de desarrollar enfoques computacionales avanzados.

El objetivo general del trabajo de investigación propuesto es emplear una metodología computacional mediante el uso de algoritmos Random Forest (RF)26 y K-nearest neighbor (KNN)27 para su tarea de predicción de la estructura de la secuencia de proteínas y el análisis completo de todo el genoma de casos intercambiados en varias secuencias de plantas medicinales. El bosque aleatorio (RF) es un clasificador binario; Es un algoritmo de aprendizaje automático robusto y versátil ampliamente utilizado en el análisis de secuencias de proteínas. Funciona mediante la construcción de un conjunto de árboles de decisión (DT) y alcanza una precisión bastante alta tanto en los conjuntos de datos de entrenamiento como en los de prueba. Para las tareas de secuencia de proteínas, RF puede analizar una variedad de características, incluidas las propiedades fisicoquímicas, la composición de la secuencia, la estructura secundaria y la información evolutiva derivada de alineaciones o perfiles de secuencia. Sobresale en el manejo de conjuntos de datos grandes y ruidosos y proporciona métricas de importancia de características28. El clasificador K-Nearest Neighbors (KNN) es un algoritmo de aprendizaje automático simple pero efectivo ampliamente aplicado en el análisis de secuencias de proteínas. Funciona clasificando una secuencia de entrada en función de la clase mayoritaria de sus k vecinos más cercanos en el espacio de entidades. En el análisis de secuencias de proteínas, KNN se puede utilizar para predecir categorías funcionales, propiedades estructurales y localización subcelular. Las características de la clasificación KNN a menudo incluyen la composición de aminoácidos, motivos de secuencia, perfiles evolutivos o atributos fisicoquímicos. KNN es una opción popular para el análisis de proteínas debido a su simplicidad; la interpretabilidad y la eficacia lo convierten en una herramienta valiosa para el análisis de secuencias de proteínas29. Juntos, estos algoritmos proporcionan fortalezas complementarias, lo que permite un marco computacional integral para el estudio del intercambio de dominios 3D en varias secuencias de plantas medicinales. Estos dos modelos solo predicen posibles casos que pueden sufrir un intercambio de dominio; no predice las coordenadas estructurales 3D completas o qué parte o residuo está particularmente involucrado en este proceso de intercambio. Esta es una cuestión de investigación adicional, ya que la identificación de regiones o residuos específicos que están involucrados en el intercambio para aclarar el mecanismo y los aspectos funcionales del intercambio de dominios 3D events.3D el intercambio de dominios comprende una variedad de fenómenos estructuralmente distintos, como configuraciones de circuito cerrado, intercambios abiertos y otras diferencias que incluyen diferentes regiones de bisagra y arquitecturas de dominio. A la luz de esto, el enfoque sugerido solo clasifica todos los tipos de eventos de intercambio de dominios 3D bajo una clasificación unificada. Esta selección fue impulsada inicialmente por la disponibilidad limitada de datos anotados que pueden especificar una clase particular de intercambio de dominios 3D. Este es el primer tipo de intentos en varios conjuntos de datos basados en plantas medicinales, y creemos que distinguir entre diferentes mecanismos de intercambio podría mejorar la precisión predictiva del modelo.

Un análisis de enriquecimiento en las plantas medicinales ayuda a identificar genes, proteínas y vías clave involucradas en la síntesis de compuestos bioactivos y la respuesta al estrés. Proporciona información sobre los mecanismos moleculares. Estos análisis en plantas medicinales investigan genes esenciales, proteínas y procesos biológicos asociados con la síntesis de sustancias químicas bioactivas, la resistencia al estrés y la resistencia a las enfermedades. La anotación funcional de proteínas seleccionadas, como la ontología genética (GO) y el análisis de la vía KEGG, descubre los mecanismos moleculares subyacentes a la producción de metabolitos secundarios y las respuestas al estrés ambiental. Este enfoque ayuda sustancialmente en el descubrimiento de fármacos, mejora la resiliencia de los cultivos y aclara las vías metabólicas de las plantas para la agricultura sostenible y los avances medicinales.

Contribuciones novedosas del estudio
Este estudio destaca las capacidades del aprendizaje automático para promover modelos más precisos y eficientes para predecir patrones estructurales de proteínas en conjuntos de datos biológicos.

Esta investigación integra características novedosas en algoritmos de aprendizaje automático, mejorando su capacidad para predecir las funciones de las proteínas con mayor claridad. Estas características proporcionan una mejor comprensión de las relaciones estructura-función de las proteínas, lo que ayuda a un diseño y optimización de proteínas más precisos en la ingeniería de proteínas.

El análisis de enriquecimiento de las proteínas predichas ayuda a descubrir las vías biológicas clave, el proceso celular y las funciones moleculares, proporcionando objetivos valiosos para el descubrimiento de biomarcadores, el diseño de fármacos y la comprensión del mecanismo de la enfermedad. Este análisis mejora la precisión en las intervenciones basadas en vías y la identificación de objetivos terapéuticos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NOTA: Este segmento proporciona un resumen completo de la metodología sugerida, que abarca seis pasos principales: (a) recopilación de datos, (b) selección de características, (c) preprocesamiento de datos, (d) posprocesamiento de datos (e) desarrollo del modelo (f) evaluación de resultados del modelo propuesto y, (g) análisis de enriquecimiento a diferentes niveles de secuencias predichas positivamente. El Core i5-10500 es un procesador de 10ª generación que se ha utilizado en este trabajo de investigación. Tiene seis núcleos y 12 hilos, con una frecuencia base de 3,10 GHz y una velocidad turbo máxima de 4,50 GHz. Viene equipado con 12 MB de Intel Smart Cache, admite memoria DDR4-2666 e incluye UHD Graphics 630 para imágenes integradas. Construido para la multitarea y la productividad eficientes, es compatible con el zócalo LGA 1200 y funciona a un TDP de 65W.

1. Recopilación de datos

  1. use3d3dswap-pred (https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) y 3DSwap+ (https://caps.ncbs.res.in/3Dswapplus/index.html)3030 Tabla complementaria 1, Tabla complementaria 2, Archivo complementario 1, Archivo complementario 2). Utilice un total de 573 entradas PDB seleccionadas manualmente de moléculas intercambiadas por dominios 3D, principalmente de plantas medicinales.
  2. Emplee el método del perfil mejor representativo (BRP) para construir el conjunto de datos negativo asignando una secuencia mejor representativa (BRS) a cada familia de proteínas Pfam31 (http://pfam.xfam.org/). Busque un total de 10.112 secuencias estructurales en todos los BRP de Pfam utilizando HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/) con un umbral de valor E de 0,001. Procese la secuencia resultante usando DIAL para identificar dominios estructurales (https://bioinformaticshome.com/db/tool/DIAL). Incluya 575 entradas PDB como un conjunto de datos negativo (entrenamiento).
  3. Incluya 314 secuencias de proteínas derivadas a través del método BRP y 261 secuencias no intercambiadas por dominios 3D seleccionadas manualmente identificadas por 3DSwap+ como un conjunto de datos negativo.
  4. Recupere un total de 1,355 entradas de secuencias de proteínas revisadas de varias plantas medicinales de UniProt33 (https://www.uniprot.org/). Incluir 13 plantas medicinales en este estudio (conjunto de datos de prueba/predicción): Citrus sinensis (RS-102), Vitis vinifera (RS-226), Mentha (RS-28), Cannabis sativa (RS-21), Acorus clamus (RS-511), Coffea arabica (RS-104), Papaver somniferum (RS-58), Hibisco (RS-88), Jazmín (RS-89), Tomillo (RS-30), Timo (RS-14), Illicium oligandrum (RS-72) y Citrus limon (RS-12). El árbol filogenético se da en la Figura complementaria 1.

2. Uso de la función para la creación de modelos

  1. Utilice un conjunto completo de características que comprende 453 características para predecir secuencias de proteínas en plantas medicinales. Incluye 439 características establecidas y 16 características novedosas, cuidadosamente seleccionadas en base a una revisión exhaustiva de la literatura.
  2. Utilice la base de datos AAindex34 (https://www.genome.jp/aaindex/) para determinar las propiedades fisicoquímicas de los aminoácidos. Aplique la plataforma de aprendizaje automático (https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/) WEKA35 para la selección de características. Consulte la Tabla 2 para conocer las características recién incorporadas.

Tabla 2: Lista de características recién agregadas junto con sus descripciones. Esta tabla resume las características novedosas diseñadas durante la fase de extracción de características para mejorar el rendimiento del modelo en la predicción del intercambio de dominios 3D. Cada característica captura propiedades específicas basadas en secuencias, fisicoquímicas o estructurales de las proteínas que se hipotetiza que influyen en su propensión al intercambio de dominios. Se proporcionan descripciones detalladas para aclarar la relevancia biológica y la derivación computacional de cada característica. Haga clic aquí para descargar esta tabla.

3. Pre y posprocesamiento de datos

NOTA: Preprocesamiento de datos. El preprocesamiento de datos es un paso esencial en el aprendizaje automático que implica la preparación de datos sin procesar para el análisis. Esto incluye la limpieza de los datos (por ejemplo, eliminar duplicados, manejar valores faltantes, etc.).

  1. Utilice el archivo de codificación suplementario 1 para codificar variables categóricas en forma numérica, que incluye cuatro pasos principales: (1) definir dictados de puntuación, (2) procesar una secuencia rápida por seq I0. analizar, (3) crear un marco de datos, (4) análisis numérico de características intercambiadas por dominios 3D.
  2. Refine e interprete la salida del modelo a través del posprocesamiento de datos. Recalibrar predicciones, agregar resultados y aplicar un umbral para la clasificación. Clasifique el conjunto de datos de intercambio de dominios 3D bimodal utilizando un valor umbral β = 0.5 (rango 0-1), como lo respaldan estudios previos 36,37,38.
  3. Divida el conjunto de datos con una división de entrenamiento y prueba 70:30, asignando el 70 % para el entrenamiento del modelo y el 30 % para la evaluación independiente.
  4. Estandarice los datos de entrenamiento utilizando el método Standard Scaler para ajustar los valores de las características a una media de 0 y una desviación estándar de 1, lo que garantiza una mejor compatibilidad con los estimadores de aprendizaje automático. Realice una selección de características para identificar las variables más impactantes.
    NOTA: La estandarización de un conjunto de datos es un requisito previo ampliamente utilizado para muchos algoritmos de aprendizaje automático para garantizar un rendimiento óptimo. Los datos que están lejos de la distribución normal pueden afectar negativamente el rendimiento de los modelos de aprendizaje automático39.
  5. Hacer validación. Para garantizar una evaluación sólida e imparcial del modelo, también se implementó la validación cruzada de K-fold Tabla complementaria 3.
  6. Divida el conjunto de datos en K subconjuntos. Entrene y evalúe el modelo de forma iterativa en subconjuntos K=5 mientras usa el subconjunto restante para pruebas independientes.

4. Creación e implementación del modelo

  1. Implemente y ajuste los algoritmos de bosque aleatorio (RF) y K-vecinos más cercanos (KNN) para optimizar el rendimiento predictivo. Entrene, valide y pruebe los modelos utilizando 573 y 575 secuencias de proteínas para el entrenamiento y 1.355 secuencias de proteínas para las pruebas.
  2. Utilice un script de Python (archivo de codificación complementario 1) para extraer valores de características numéricas basados en la secuencia de proteínas seleccionada. Guarde estos valores numéricos para ambos conjuntos de datos en archivos CSV y envíelos a los clasificadores RF y KNN para la generación de modelos de clasificación binaria.
  3. Utilice estos modelos para distinguir entre proteínas intercambiadas por dominios 3D y no intercambiadas por dominios 3D. Consulte la Figura 2 y la Figura 3 para conocer el marco generalizado para predecir el intercambio de dominios 3D.
  4. Aplique hiperparámetros como n_estimators=20, max_depth=4 y random_state=42 para el modelo de RF.
  5. Aplique el hiperparámetro neighbors=5 para el modelo clasificador KNN.
    NOTA: Esta configuración de parámetros se ajustó para mejorar el rendimiento de los modelos en el conjunto de datos de plantas medicinales curado manualmente.

figure-protocol-1
Figura 2: Representación esquemática ilustrativa. La representación muestra los modelos de aprendizaje automático Random Forest y K-Nearest Neighbor (KNN), mostrando su estructura algorítmica y flujo de trabajo funcional en el contexto de las tareas de clasificación binaria . Haga clic aquí para ver una versión más grande de esta figura.

figure-protocol-2
Figura 3: Flujo de trabajo basado en aprendizaje automático. El diagrama ilustra un flujo de trabajo basado en el aprendizaje automático para predecir el intercambio de dominios 3D en proteínas de plantas medicinales. El proceso comienza con la adquisición del conjunto de datos, combinando el punto de referencia y los metadatos. La extracción de características implica derivar características existentes y novedosas de secuencias de proteínas. En el preprocesamiento del conjunto de datos, las secuencias FASTA se convierten en valores numéricos mediante el análisis de secuencias y el mapeo de diccionarios para crear marcos de datos estructurados, incluidas características específicas de intercambio de dominios 3D. El posprocesamiento incluye la asignación del estado de intercambio de dominio mediante un umbral (β = 0,5), la división de datos en conjuntos de entrenamiento y prueba (proporción 70-30), la estandarización de características y la realización de la selección de características con validación de k-fold. Se entrenan dos modelos de aprendizaje automático, Random Forest (RF) y K-Nearest Neighbors (KNN), y su rendimiento se evalúa utilizando métricas de modelo junto con AUROC y AUPRC para evaluar la precisión y la solidez predictivas. Haga clic aquí para ver una versión más grande de esta figura.

5. Evaluación estática y evaluaciones de modelos de clasificadores de ML

  1. Implemente y ajuste los algoritmos de bosque aleatorio (RF) y K-vecinos más cercanos (KNN) para optimizar el rendimiento predictivo. Entrene, valide y pruebe los modelos utilizando 573 y 575 secuencias de proteínas para el entrenamiento y 1.355 secuencias de proteínas para las pruebas.
    figure-protocol-3(1)
    figure-protocol-4(2)
    figure-protocol-5(3)
    figure-protocol-6(4)
    figure-protocol-7(5)
    figure-protocol-8(6)
    NOTA: Defina TP (True Positive) como el porcentaje de secuencias predichas correctamente como intercambiadas por los modelos en dominio. Defina TN (True Negative) como el porcentaje de secuencias predichas correctamente como no intercambiadas por dominio. Defina el falso positivo (FP) como los casos en los que las proteínas no intercambiadas por dominio se predicen incorrectamente como intercambiadas por dominio. Defina Falso Negativo (FN) como los casos en los que las proteínas intercambiadas por dominio se predicen incorrectamente como no intercambiadas por dominio.
  2. Calcule Xsen como la proporción de verdaderos positivos identificados con precisión y Xspe como la proporción de verdaderos negativos identificados correctamente por el modelo.
    NOTA: Utilice MCC para evaluar la calidad de las clasificaciones binarias analizando los verdaderos positivos, los verdaderos negativos, los falsos positivos y los falsos negativos de la matriz de confusión.
  3. Calcular precisión (ACC) para medir la proporción de predicciones correctas entre las predicciones totales.
    NOTA: La precisión evalúa una proporción de positivos correctamente identificados entre todos los positivos predichos, mientras que la puntuación F1 es la media armónica de Precisión y Sensibilidad, equilibrando los falsos positivos y los falsos negativos.
  4. Use AUC para evaluar el rendimiento de los modelos de clasificación en tareas de clasificación binaria. Calcule el AUC (Área bajo la curva) utilizando la biblioteca Python40 de Scikit-learn, basada en proteínas clasificadas positiva y negativamente.
  5. Utilice los datos de prueba para evaluar estos parámetros.

6. Implementación de un modelo para la predicción del intercambio de dominios 3D en varias especies de plantas medicinales

  1. Aplique RF y KNN en un total de 1.355 secuencias revisadas (conjunto de datos de predicción) de 13 plantas medicinales diferentes, incluidas Citrus sinensis, Mentha, Vitis vinifera, Tomillo, Thymus vulgaris, Jazmín, Hibisco, Papaver somniferum, Illicium oligandrum, Citrus limon, Acorus calamus, Cannabis sativa y Coffea arabica.
    NOTA: Estas proteínas están asociadas con varias funciones como Citrus sinensis, Mentha, tomillo ayuda a la indigestión. Vitis vinifera, Jazmín, Hibisco es una fuente muy rica en antioxidantes y también mejoran la salud de la piel. Illicium oligandrum es conocido por sus propiedades antifúngicas y antibacterianas, etc.

7. Investigación de enriquecimiento de proteínas intercambiadas en 3D predichas positivamente de plantas medicinales

  1. Asigne los códigos de acceso de estas secuencias de proteínas a categorías de metabolitos secundarios utilizando datos de UniProt.
  2. Extraiga la identificación de genes de las secuencias predichas.
  3. Abra el servidor web en líneaKEGG 41 (https://www.genome.jp/kegg/) para realizar un análisis de enriquecimiento de la vía KEGG pegando la identificación del gen individual o el nombre de la proteína para verificar sus respectivas vías.
  4. Realice un análisis comparativo contrastando las proteínas de intercambio de dominios 3D predichas con un conjunto de datos de predicción para detectar una sobrerrepresentación estadísticamente significativa de términos específicos de ontología genética (GO) y vías biológicas. Pegue el ID del gen de la secuencia predicha en ShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/) y seleccione la función deseada o la categoría de vía (función biológica, componente celular, función molecular, KEGG, etc.).
    NOTA: Visualice estas anotaciones utilizando una plataforma en línea basada en la nube43 que permite a los usuarios escribir y ejecutar código Python.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Las proteínas que exhiben intercambio de dominios 3D con frecuencia están vinculadas a una variedad de funciones biológicas. Sin embargo, un análisis sistemático de todo el genoma de las secuencias de proteínas que participaron en el intercambio de dominios 3D sigue siendo en gran medida inexplorado. En esta investigación, realizamos una investigación inicial para predecir supuestamente proteínas intercambiadas en dominios 3D de 13 plantas medicinales, centrándonos en su asociación con dominios de metabolitos secundarios...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La comprensión del intercambio de dominios 3D en proteínas a lo largo de su genoma completo tiene una importancia significativa en varios campos. Los enfoques de aprendizaje automático, especialmente el bosque aleatorio y el vecino K más cercano26,27, se han empleado para predecir el intercambio de dominios 3D directamente a partir de datos de secuencia de proteínas a nivel de genoma. Estos dos modelos de ML incluyen varios pasos...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses financieros o relaciones personales que puedan haber influido en el trabajo reportado en este artículo.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

No se recibió financiación para esta investigación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
3DSwap+https://caps.ncbs.res.in/3Dswapplus/index.html 
PfamEMBL-EBIhttp://pfam.xfam.org/: 
HMMEREMBL-EBI;
Aaindexhttps://www.genome.jp/aaindex/:
ESFERABioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL: 
WEKAUniversidad de Wekatohttps://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
  KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :
https://www.ebi.ac.uk/Tools/hmmer/:  

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Intercambio de dominios 3Doligomerizaci n de prote nasRandom ForestK Nearest Neighboranotaci n funcionalbios ntesis de metabolitos secundariosGene Ontologyrutas KEGG
Video próximamente

Artículos relacionados