$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Los métodos computacionales han revolucionado la investigación de proteínas al permitir análisis detallados y predicciones sobre estructuras, funciones e interacciones de proteínas. La identificación y anotación precisas de las funciones de las proteínas son esenciales para desentrañar los mecanismos moleculares de la vida y tienen una gran importancia para los avances en la medicina y el desarrollo de fármacos. Sin embargo, la complejidad y el costo inherentes de los métodos experimentales limitan su escalabilidad para acomodar los datos de secuencia grandes. Como resultado, el desarrollo de métodos computacionales para la predicción de la función de las proteínas se ha convertido en un área fundamental en la biología computacional y molecular, abordando esta brecha a travésde enfoques innovadores a gran escala.
El intercambio de dominios 3D2 es un fenómeno estructural en proteínas donde los segmentos de una estructura compartida se intercambian entre cadenas individuales. En 1994, la documentación introductoria sobre el mecanismo de intercambio de dominios 3D se encontró en el dímero3 de la toxina de la difteria. Sin embargo, los principios fundamentales del intercambio de dominios 3D se remontan a cuatro décadas. Se ha observado que la ribonucleasa A pancreática bovina (ARNasa A) forma dímeros durante la liofilización en ácido acético, a través de sofisticados experimentos de modificación química4. En la oligomerización de proteínas, dos o más cadenas de proteínas intercambian elementos estructurales idénticos a través de regiones de bisagra flexibles. La porción de la proteína intercambiada entre subunidades monoméricas se denomina dominio intercambiado, que puede consistir en un dominio globular completo, un bucle o un elemento estructural secundario en ciertas proteínas. Por el contrario, las regiones que permanecen sin cambios en sus posiciones originales dentro de los monómeros se denominan dominios no intercambiados5. Un acoplamiento entre dominios no intercambiados se define como una interfaz de dominio no intercambiada (NSDI) que se muestra en la Figura 1. En el intercambio de dominios 3D, la relación entre el dominio no intercambiado de una subunidad de proteína y el dominio ya intercambiado de otra subunidad se denomina interfaz de dominio intercambiado (SDI). Otro aspecto significativo de este fenómeno es la región bisagra, un segmento de enlazador flexible que conecta los dominios intercambiados y no intercambiados. Esta región de bisagra juega una función esencial para ayudar al movimiento del intercambio de dominios 3D y sirve como un interruptor conformacional, lo que permite la reconfiguración estructural necesaria para que ocurra el intercambio de dominios. El intercambio de dominios 3D se ha implicado en varios procesos biológicos, incluido el ensamblaje de proteínas y la regulación funcional5. También se asocia con ciertas enfermedades de plegamiento incorrecto de proteínas, donde el intercambio aberrante puede conducir a la formación de agregados o fibrillas amiloides.

Figura 1: Representación estructural del intercambio de dominios 3D. La representación ilustra el intercambio de elementos estructurales idénticos entre dos monómeros de proteínas a través de una región de bisagra flexible, lo que da como resultado la formación de un ensamblaje dimérico u oligomérico intercambiado de dominio . Haga clic aquí para ver una versión más grande de esta figura.
Se han identificado diferentes tipos de intercambio de dominios 3D en función de la naturaleza de los dominios intercambiados y las estructuras oligoméricas resultantes6. En el año 2002, Eisenberg y su colega identificaron tres tipos de intercambio de dominios 3D: intercambio de dominios de buena fe (BDS), intercambio de cuasi-dominios (QDS) y candidato para intercambio de dominios 3D (CDS)7. La clase de proteína más común es el intercambio de dominios de buena fe. Se refiere a un estado en el que tanto las moléculas de dímero como las de monómero están presentes en una forma estable, donde se supone que el dímero adopta una configuración de intercambio de dominio mientras que el monómero se supone que adopta una configuración cerrada. En el intercambio de cuasidominios, se sabe que una proteína está presente en el estado oligomérico, pero se sabe que su estructura homóloga está presente en el estado monomérico. En CDS, solo confirma la clasificación de proteínas bajo las categorías de intercambio de dominios, mientras que la información estructural de los monómeros involucrados o sus homólogos monoméricos no está presente8. En este procedimiento, los monómeros o sus homólogos monoméricos están ausentes; más bien, están presentes moléculas de proteínas heterólogas. La Tabla 1 muestra un ejemplo de estas tres categorías9.
Tabla 1: Tipos de intercambio de dominios 3D con ejemplo. Haga clic aquí para descargar esta tabla.
Estudios posteriores revelaron numerosas estructuras de intercambio de dominios, allanando el camino para la comprensión del concepto de intercambio de dominios 3D. La evidencia estructural más temprana que respalda este fenómeno se observó en la molécula de la proteína represora Cro del bacteriófago λ, que forma una estructura dimérica a través del intercambio de sus hebras C-terminales. En 1996, el investigador descubrió que la molécula monomérica Cro estaba involucrada en el intercambio de dominios 3D10. Otras estructuras11, como βB2-cristalina12, CksHs213 humana, catalasa14 de hígado de res e interleucina-515 humana recombinante, también se informaron como posibles estructuras intercambiadas de dominio 3D. Según la posición del dominio intercambiado dentro de las moléculas de proteína, el intercambio de dominios 3D se clasifica en tres tipos: intercambio de dominios C-terminales, intercambio de dominios N-terminales y el intercambio de dominios centrales relativamente raro. Los autores utilizan un genoma humano completo para predecir un caso de intercambio de dominio. Utilizan Random Forest y Support Vector Machine como clasificadores binarios con precisiones del 81,7% y 73,9%, respectivamente. Casi el 44% de la secuencia de proteínas se predijo como intercambio de dominio 3D en el genoma humano6. Se llevó a cabo un análisis de enriquecimiento de los casos predichos para su distribución de dominios, distribución de enfermedades y anotación funcional basada en la ontología genética (GO). Otro enfoque investiga el análisis completo de todo el genoma de Ocimum tenuiforum utilizando el enfoque de bosque aleatorio y encontró que se predice que casi el 25% de las secuencias de proteínas en Ocimum tenuiforum están involucradas en el intercambio de dominios 3D. Los investigadores también realizan anotaciones funcionales utilizando la asociación de términos GO y su asociación familiar de dominios de proteínas y encontraron que solo 1158 secuencias estaban involucradas en el estrés abiótico16.
Las plantas demuestran una variedad de familias de proteínas distintivas, con proteínas específicas reconocidas por tener la capacidad de sufrir reordenamientos estructurales, incluido el intercambio de dominios 3D. El intercambio de dominios 3D puede influir en condiciones de estrés biótico y abiótico con la producción de metabolitos secundarios u otras vías biológicamente relevantes que tienen varias aplicaciones farmacológicas; por lo tanto, proporcionan un enfoque significativo para esta investigación. La estructura cristalina de Wal1 demostró una configuración dimérica de dominio intercambiado, con dos dímeros dentro de la unidad asimétrica y el reordenamiento estructural que se encuentra en la cistatina C. Las fitocistatinas juegan un papel importante en el estrés abiótico y también mejoran la resistencia de los cultivos. Se ha identificado un total de 20.121 proteínas predichas intercambiadas de dominio 3D a partir de la literatura disponible y de varios repositorios relevantes, de las cuales 17.552 son de origen vegetal y 2569 son de organismos no vegetales17,18.
En la literatura, se han reportado varios otros ejemplos de predicción de intercambio de dominios 3D de diferentes plantas utilizando un enfoque de aprendizaje automático. Como Arabidopsis thaliana mostrando 33.7% (4058 de 12,033 secuencias revisadas), Medicago truncatula 20.9% (39 de 186 secuencias revisadas), Solanum tuberosum 36.5% (146 de 400 secuencias revisadas), Solanum lycopersicum 25.5% (108 de 423 secuencias revisadas) y Ocimum tenuiforum 15.5% (5706 de 36841 secuencias revisadas)6. Los métodos computacionales se han vuelto invaluables para explorar los aspectos estructurales y funcionales de las proteínas intercambiadas de dominio 3D. Estos enfoques facilitan la predicción de secuencias sobre la base de las mejores características posibles19, la anotación y el análisis de enriquecimiento, ofreciendo información sobre los mecanismos moleculares fundamentales. La predicción del intercambio de dominios 3D en varias secuencias de proteínas se logró mediante el uso de un clasificador basado en una máquina de vectores de soporte (SVM). Este enfoque se desarrolló mediante la integración de características estructurales y de secuencia, lo que arrojó precisiones de predicción del 76,33% en el conjunto de datos de entrenamiento y del 73,81% en el conjunto de datos de prueba, lo que significa su potencial para identificar tendencias de intercambio de dominios en proteínas20. La razón principal para elegir KNN en lugar de SVM es que KNN tiene un proceso de capacitación mucho más simple. Solo necesita un parámetro principal, K (es el número de vecinos más cercanos considerados al hacer una predicción), para establecerse, mientras que SVM requiere un ajuste cuidadoso de varios parámetros como el tipo de kernel, C y gamma. Además, KNN maneja la clasificación de varias clases más fácilmente, mientras que SVM generalmente necesita estrategias más complejas, como estrategias uno contra uno.
Aprendizaje automático para la predicción estructural de proteínas
La predicción de la estructura de la proteína implica la inferencia de la forma tridimensional de una proteína a partir de su secuencia FASTA. Los avances recientes en este campo han sido impulsados significativamente por la aplicación de diversas técnicas de aprendizaje automático a los datos evolutivos21,22. Los primeros enfoques para extraer información de datos coevolutivos se basaron en métodos de aprendizaje automático. Sin embargo, las estrategias más recientes, en particular las que utilizan redes residuales profundas, han demostrado un rendimiento superior en la predicción del objetivopotencial 23. Alphafold es una base de datos basada en el aprendizaje profundo, mientras que Rosetta es una herramienta de función energética basada en la física. Estas herramientas se utilizan para predecir la estructura atómica 3D completa que se puede aproximar a las estructuras experimentales. Solo proporcionan coordenadas estructurales de resolución atómica, pero estas herramientas no especifican los eventos de intercambio de dominios 3D. Por el contrario, el enfoque sugerido no es un predictor completo de la estructura 3D, sino que solo predice si es probable que una proteína sufra un intercambio de dominio 3Do no 24,25.
Las plantas medicinales se han utilizado durante siglos como recursos naturales para la prevención y el tratamiento de diversas enfermedades, atribuidas a sus compuestos bioactivos. Son esenciales en la medicina tradicional y contribuyen al desarrollo de medicamentos farmacéuticos modernos. Sin embargo, no se ha llevado a cabo ningún trabajo significativo en el campo del intercambio de dominios proteicos de plantas medicinales para el descubrimiento de fármacos. Los algoritmos, incluido el aprendizaje automático y sus modelos de conjunto, reconocen patrones y relaciones en datos de secuencia para predecir el intercambio de dominios 3D. La razón detrás de la elección de las plantas medicinales para este estudio es que puede detectar la diversidad funcional de una proteína en las plantas involucradas en el intercambio de dominios 3D, lo que resulta en la comprensión de la respuesta al estrés, la defensa contra patógenos y la biosíntesis metabólica. Los desafíos técnicos asociados con la determinación del intercambio de dominios 3D de proteínas en grandes cantidades y conformaciones oligoméricas complejas y avanzadas mediante el uso de técnicas de RMN o cristalografía resaltan la necesidad de desarrollar enfoques computacionales avanzados.
El objetivo general del trabajo de investigación propuesto es emplear una metodología computacional mediante el uso de algoritmos Random Forest (RF)26 y K-nearest neighbor (KNN)27 para su tarea de predicción de la estructura de la secuencia de proteínas y el análisis completo de todo el genoma de casos intercambiados en varias secuencias de plantas medicinales. El bosque aleatorio (RF) es un clasificador binario; Es un algoritmo de aprendizaje automático robusto y versátil ampliamente utilizado en el análisis de secuencias de proteínas. Funciona mediante la construcción de un conjunto de árboles de decisión (DT) y alcanza una precisión bastante alta tanto en los conjuntos de datos de entrenamiento como en los de prueba. Para las tareas de secuencia de proteínas, RF puede analizar una variedad de características, incluidas las propiedades fisicoquímicas, la composición de la secuencia, la estructura secundaria y la información evolutiva derivada de alineaciones o perfiles de secuencia. Sobresale en el manejo de conjuntos de datos grandes y ruidosos y proporciona métricas de importancia de características28. El clasificador K-Nearest Neighbors (KNN) es un algoritmo de aprendizaje automático simple pero efectivo ampliamente aplicado en el análisis de secuencias de proteínas. Funciona clasificando una secuencia de entrada en función de la clase mayoritaria de sus k vecinos más cercanos en el espacio de entidades. En el análisis de secuencias de proteínas, KNN se puede utilizar para predecir categorías funcionales, propiedades estructurales y localización subcelular. Las características de la clasificación KNN a menudo incluyen la composición de aminoácidos, motivos de secuencia, perfiles evolutivos o atributos fisicoquímicos. KNN es una opción popular para el análisis de proteínas debido a su simplicidad; la interpretabilidad y la eficacia lo convierten en una herramienta valiosa para el análisis de secuencias de proteínas29. Juntos, estos algoritmos proporcionan fortalezas complementarias, lo que permite un marco computacional integral para el estudio del intercambio de dominios 3D en varias secuencias de plantas medicinales. Estos dos modelos solo predicen posibles casos que pueden sufrir un intercambio de dominio; no predice las coordenadas estructurales 3D completas o qué parte o residuo está particularmente involucrado en este proceso de intercambio. Esta es una cuestión de investigación adicional, ya que la identificación de regiones o residuos específicos que están involucrados en el intercambio para aclarar el mecanismo y los aspectos funcionales del intercambio de dominios 3D events.3D el intercambio de dominios comprende una variedad de fenómenos estructuralmente distintos, como configuraciones de circuito cerrado, intercambios abiertos y otras diferencias que incluyen diferentes regiones de bisagra y arquitecturas de dominio. A la luz de esto, el enfoque sugerido solo clasifica todos los tipos de eventos de intercambio de dominios 3D bajo una clasificación unificada. Esta selección fue impulsada inicialmente por la disponibilidad limitada de datos anotados que pueden especificar una clase particular de intercambio de dominios 3D. Este es el primer tipo de intentos en varios conjuntos de datos basados en plantas medicinales, y creemos que distinguir entre diferentes mecanismos de intercambio podría mejorar la precisión predictiva del modelo.
Un análisis de enriquecimiento en las plantas medicinales ayuda a identificar genes, proteínas y vías clave involucradas en la síntesis de compuestos bioactivos y la respuesta al estrés. Proporciona información sobre los mecanismos moleculares. Estos análisis en plantas medicinales investigan genes esenciales, proteínas y procesos biológicos asociados con la síntesis de sustancias químicas bioactivas, la resistencia al estrés y la resistencia a las enfermedades. La anotación funcional de proteínas seleccionadas, como la ontología genética (GO) y el análisis de la vía KEGG, descubre los mecanismos moleculares subyacentes a la producción de metabolitos secundarios y las respuestas al estrés ambiental. Este enfoque ayuda sustancialmente en el descubrimiento de fármacos, mejora la resiliencia de los cultivos y aclara las vías metabólicas de las plantas para la agricultura sostenible y los avances medicinales.
Contribuciones novedosas del estudio
Este estudio destaca las capacidades del aprendizaje automático para promover modelos más precisos y eficientes para predecir patrones estructurales de proteínas en conjuntos de datos biológicos.
Esta investigación integra características novedosas en algoritmos de aprendizaje automático, mejorando su capacidad para predecir las funciones de las proteínas con mayor claridad. Estas características proporcionan una mejor comprensión de las relaciones estructura-función de las proteínas, lo que ayuda a un diseño y optimización de proteínas más precisos en la ingeniería de proteínas.
El análisis de enriquecimiento de las proteínas predichas ayuda a descubrir las vías biológicas clave, el proceso celular y las funciones moleculares, proporcionando objetivos valiosos para el descubrimiento de biomarcadores, el diseño de fármacos y la comprensión del mecanismo de la enfermedad. Este análisis mejora la precisión en las intervenciones basadas en vías y la identificación de objetivos terapéuticos.