3 de noviembre de 2011
Directrices para el ordenador basado en la caracterización estructural y funcional de la proteína mediante la canalización I-TASSER se describe. A partir de secuencias de proteínas de la consulta, los modelos 3D se generan con múltiples alineaciones threading e iterativo simulaciones estructurales de montaje. Inferencias funcionales a partir de entonces son elaborados sobre la base de los partidos a las proteínas de estructura conocida y funciones.
El objetivo de este procedimiento es predecir computacionalmente las estructuras tridimensionales y la función biológica de moléculas proteicas a partir de sus secuencias de aminoácidos. Esto se logra primero prediciendo la estructura secundaria de las proteínas mediante aprendizaje automático. Luego, las secuencias y la estructura secundaria predicha se comparan con las estructuras resueltas en la biblioteca PDB para identificar las mejores plantillas estructurales posibles.
Este procedimiento se denomina alineación estructural (threading). Tras el procedimiento de alineación estructural, el programa IT AER dividirá las plantillas en fragmentos basándose en las alineaciones de secuencias de las plantillas, y luego volverá a ensamblar los fragmentos en modelos de longitud completa en el tercer paso. Los modelos atómicos completos se construyen mediante refinamientos a nivel atómico para optimizar las redes de enlaces de hidrógeno y eliminar solapamientos estéricos.
El último paso del procedimiento consiste en identificar la función biológica de las proteínas mediante la comparación de las estructuras predichas con proteínas de función conocida en la biblioteca de funciones. La principal ventaja de ITER frente a los métodos existentes de modelado estructural es su enfoque inherente de ensamblaje de fragmentos estructurales, que puede guiar de forma consistente los alineamientos por threading hacia el estado nativo. Estos modelos estructurales de alta calidad también constituyen la base para anotaciones funcionales precisas basadas en la estructura, lo que promueve el uso de ITER en la comunidad científica.
Nuestro laboratorio ha puesto a disposición un sitio web donde se pueden enviar las secuencias de proteínas para ITER. Este sitio web actúa como un nexo mediante el cual los usuarios de todo el mundo pueden registrarse en una interfaz de clúster informático, que gestiona y ejecuta simulaciones ITER. Un trabajo de simulación ITER consta de más de una docena de sub-simulaciones más pequeñas.
Estas simulaciones, cuando se ejecutan en una sola computadora con un único núcleo de procesador, pueden tardar más de cien horas. El clúster de computadoras del laboratorio Zang toma y distribuye estas sub-simulaciones entre cientos de computadoras y es capaz de ejecutar más de 2000 simulaciones. Concurrentemente con nuestro clúster de computadoras, somos capaces de completar cientos de simulaciones de I taster cada día.
A pesar de esta capacidad, queda mucho trabajo por hacer para optimizar el sistema y minimizar el tiempo de espera para los usuarios en línea de IT AER. Para comenzar el experimento de modelado de estructura y función, acceda a la página web de IT AER. Las direcciones URL de todas las páginas web relevantes mencionadas aquí pueden encontrarse en el protocolo escrito.
Copie y pegue la secuencia de aminoácidos en el formulario proporcionado, o cargue directamente la secuencia haciendo clic en el botón de exploración. Proporcione una dirección de correo electrónico y un nombre para el trabajo. Los usuarios pueden especificar opcionalmente contactos externos entre residuos o restricciones de distancia.
Agregue una plantilla adicional o excluya algunas proteínas de plantilla durante el proceso de modelado de la estructura. Para enviar la secuencia, haga clic en el botón ejecutar taser. Verifique el estado del trabajo enviado visitando la página de cola de taser IT.
Haga clic en la pestaña de búsqueda y utilice el número de identificación del trabajo o la secuencia de consulta para buscar el trabajo enviado. Una vez finalizado el modelado de la estructura y la función, se enviará un correo electrónico de notificación con una imagen de las estructuras predichas y un enlace web a la dirección de correo proporcionada. Haga clic en este enlace para ver y descargar los resultados.
Comience el análisis de la estructura examinando la predicción de la estructura secundaria, que se muestra como H para hélice alfa, S para cadena beta o C para bucle. También tenga en cuenta la puntuación de confianza de la predicción para cada residuo. Busque regiones con estructuras largas de predicciones regulares de estructura secundaria para estimar la región central de la proteína.
La clase estructural de la proteína también puede analizarse según la distribución de los elementos de estructura secundaria. Visualice la accesibilidad al solvente predicha para determinar las regiones enterradas y expuestas al solvente. En los valores de consulta, la accesibilidad al solvente predicha oscila entre una puntuación de cero para un residuo enterrado y una puntuación de nueve para un residuo expuesto.
Las regiones que contienen principalmente residuos enterrados pueden utilizarse para delimitar la región central en la proteína, mientras que las regiones con residuos expuestos al disolvente e hidrofílicos son posibles sitios de hidratación o funcionales. Para ver las estructuras terciarias predichas de la proteína consultada, desplácese hacia abajo hasta el applet interactivo de JMO que aparece a la izquierda. Haga clic en el applet para cambiar la apariencia de la estructura mostrada.
Acérquese a una región específica, seleccione tipos de residuos específicos en el modelo predicho o calcule las distancias entre residuos. Analice las puntuaciones de confianza del modelado estructural para estimar la calidad de las estructuras predichas. Los valores de Csco suelen estar en el rango de menos cinco a dos, donde una puntuación más alta refleja un modelo de mejor calidad.
El valor TM estimado y la RMSD del primer modelo se muestran como la precisión estimada del modelo uno. Haga clic en el enlace más información sobre csco. Para analizar el tamaño del grupo csco y la densidad del grupo de todos los modelos, analice las 10 plantillas de alineamiento principales de la proteína de consulta identificadas por programas de alineamiento de baja energía.
Al desplazarse hacia abajo en la página de resultados, observe el valor Z normalizado para analizar la calidad de los alineamientos por threading. Los alineamientos con un valor csco normalizado mayor que uno reflejan una alineación segura y es más probable que tengan el mismo plegamiento que la proteína de consulta. Examine la identidad de secuencia en la región alineada por threading y en toda la cadena para evaluar la homología entre la proteína de consulta y las proteínas molde.
Una alta identidad de secuencia es un indicador de la relación evolutiva entre las proteínas de consulta y las proteínas molde. Observe los residuos alineados por plegamiento, mostrados en color, para identificar visualmente residuos o motivos conservados en la proteína de consulta y la proteína molde. Una mayor identidad de secuencia en la región alineada por plegamiento en comparación con el alineamiento de toda la cadena también indica la presencia de motivos o dominios estructurales conservados en la proteína de consulta. Evalúe la cobertura del alineamiento por plegamiento mediante el análisis del alineamiento.
Si la cobertura del alineamiento superior es baja y está limitada a solo una pequeña región de la proteína de consulta o ausente en un segmento largo de la secuencia de consulta, indica que la proteína de consulta contiene más de un dominio. En este caso, se recomienda dividir la secuencia y modelar los dominios individualmente. Consulte la siguiente tabla de la página de resultados para determinar los 10 análogos estructurales principales del primer modelo predicho, identificados por el programa de alineamiento estructural TM align.
Un valor TM superior a 0,5 indica que el análogo detectado y el modelo tienen una topología similar y pueden utilizarse para determinar la clase estructural o la familia de proteínas de la proteína consultada. Aquellos con un valor TM inferior a 0,3 indican una similitud estructural aleatoria. Analice la identidad de secuencia y la RMSD en la región alineada estructuralmente para evaluar la conservación de los motivos espaciales en el modelo y el análogo estructural.
Inspeccione visualmente los pares de residuos coloreados y alineados en el alineamiento para identificar estos residuos y motivos estructuralmente conservados. Observe la tabla de números EC predichos para ver los cinco posibles OGs de enzimas principales de la proteína de consulta. El nivel de confianza de la predicción del número EC utilizando estas plantillas se muestra como la puntuación EC basada en análisis de referencia.
La similitud funcional entre la proteína de consulta y la proteína molde puede interpretarse de forma confiable utilizando una puntuación EC mayor que 1,1. A continuación, busque un consenso de función entre las plantillas, que tienen un plegamiento similar al de la proteína de consulta. Si múltiples plantillas tienen el mismo número EC y la puntuación EC es mayor que 1,1, el nivel de confianza de la predicción es muy alto.
Sin embargo, si el puntaje EC es alto, pero existe una falta de consenso entre los resultados identificados, la predicción se vuelve menos confiable y se recomienda a los usuarios consultar la ontología genética. La vista de predicciones de términos muestra la tabla de términos de ontología genética predichos para identificar los 10 homólogos principales de la proteína de consulta en la biblioteca PDB anotados con términos de ontología genética; cada proteína suele estar asociada con múltiples términos de ontología genética que describen sus funciones moleculares, procesos biológicos y localización celular. Haga clic en cada término para visitar el sitio web AmiGO y analizar su definición y linaje.
Analice la columna de puntuación de homología funcional para evaluar la similitud funcional entre las proteínas consultadas y las de la plantilla. También se puede estimar el nivel de confianza para transferir la anotación funcional a partir de estas proteínas. Consulte la tabla de predicción consenso de términos de ontología genética para analizar la concordancia funcional entre las plantillas.
Estas funciones comunes se utilizan para predecir los términos de ontología genética de la proteína de consulta y para evaluar el nivel de confianza de las predicciones de términos de geo. Finalmente, desplácese hacia abajo hasta el final de la página para ver las 10 principales predicciones de sitios de unión de ligandos para la proteína de consulta; los sitios de unión predichos se clasifican según la cantidad de confirmaciones de ligandos predichos que comparten un bolsillo de unión común. El mejor sitio de unión identificado ya se muestra en la aplicación JM OL.
Haga clic en los botones de opción para analizar otras predicciones y visualizar los residuos de interacción del ligando. El puntaje BS revela la similitud local entre el sitio de unión del modelo y el de las plantillas. Un puntaje BS mayor que 1,1 indica una alta similitud de secuencia y estructura cerca del sitio de unión predicho.
En el modelo, en comparación con el sitio de unión conocido en la plantilla, la TI es una página web principal que contiene enlaces a otras funciones útiles. La función de foro permite al usuario crear una cuenta en línea y solicitar ayuda a otros usuarios de ITER sobre modelado de estructuras o ayuda para interpretar los resultados. La función de descarga permite a los usuarios descargar iter y paquetes relacionados e instalarlos en su computadora.
Esto ayuda a reducir el tiempo necesario para realizar los experimentos de modelado. La función de cola permite ver el estado de todos los trabajos enviados en la página de IT a Q. Los usuarios también pueden inspeccionar visualmente la imagen de las estructuras modeladas para los trabajos finalizados.
En esta página, también se muestra en la puntuación TM esperada del CSCO y la RMSD esperada del primer modelo, y la fecha de envío mostrada aquí es un extracto de la página de resultados de IT AER que muestra la secuencia de consulta con formato más rápido, la estructura secundaria predicha y las puntuaciones de confianza asociadas y la accesibilidad al solvente predicha de los residuos. La región central analizada y el sitio de hidratación potencial en la consulta se resaltan con rectángulos cian y rojos respectivamente. Aquí se muestran las predicciones de la estructura terciaria para las proteínas de consulta.
Los modelos predichos se muestran en un visor interactivo de aplicaciones JML, lo que permite al usuario modificar la visualización de la molécula. Los modelos también pueden descargarse haciendo clic en los enlaces de descarga; la puntuación de confianza para estimar la calidad del modelo se informa como la csco. Se presenta un ejemplo de la página de resultados de itta A que muestra las 10 mejores plantillas de alineación identificadas y los alineamientos obtenidos mediante los programas de alineamiento Loomis.
La calidad de los alineamientos de anidado se evalúa en función de la puntuación Z normalizada, donde un valor mayor que uno refleja un alineamiento confiable. Los residuos alineados en la plantilla que son idénticos a los residuos correspondientes de la consulta se resaltan en color para indicar la presencia de un residuo o motivo conservado. Por el contrario, la falta de alineamiento en la mayoría de las plantillas principales indica la presencia de múltiples dominios en la proteína de consulta, y los residuos no alineados corresponden a regiones de enlace entre dominios.
Esta tabla muestra los 10 análogos estructurales y alineamientos estructurales identificados por el programa de alineamiento estructural TM alineado. La clasificación de los análogos se basa en la puntuación TM del alineamiento estructural. Una puntuación TM mayor que 0,5 indica que las dos estructuras comparadas tienen una topología similar.
Mientras que una puntuación TM inferior a 0,3 indica una similitud entre dos estructuras aleatorias. Los pares de residuos alineados estructuralmente se resaltan con color según su propiedad de aminoácido, mientras que las regiones no alineadas se indican mediante un guion. A continuación se muestra un ejemplo de la página de resultados de ITR que muestra los homólogos enzimáticos identificados de la proteína de consulta en la biblioteca PDB.
El nivel de confianza en la predicción del número EC se analiza en función del puntaje EC, donde un puntaje EC mayor que 1,1 indica similitud funcional entre la proteína de consulta y la proteína de plantilla. La tabla de predicción de términos de ontología genética para la proteína de consulta incluye homólogos funcionales de esta proteína en la biblioteca de plantillas de ontología genética, ordenados según su puntaje de homología funcional. Se deducen características funcionales comunes a partir de estos resultados con los puntajes más altos para generar las predicciones finales de términos de ontología genética para la proteína de consulta.
La calidad de los términos predichos de ontología génica se estima en función del puntaje geo, donde un puntaje geo mayor a 0,5 indica una predicción confiable, mostrado aquí como ejemplo de la página de resultados de IT AZA que muestra las 10 principales predicciones de sitios de unión de ligandos proteicos utilizando el algoritmo de cofactor. La clasificación de los sitios de unión predichos se basa en el número de confirmaciones de ligandos predichos que comparten un mismo bolsillo de unión. En la consulta, el puntaje BS es una medida de la similitud local de la secuencia y la estructura entre el sitio de unión predicho y las plantillas, y es útil para analizar la conservación de los bolsillos de los sitios de unión.
Aunque ISER es uno de los algoritmos más eficientes para la predicción de la estructura y función de proteínas, es importante recordar que se trata únicamente de una predicción generada por algoritmos informáticos. Cualquier dato experimental o información funcional, por ejemplo, datos sobre contactos entre residuos o unión, será extremadamente útil para aumentar la precisión de las predicciones. El servidor IT AER dispone de un portal para incluir esta información durante el procedimiento de modelado, para atender al creciente interés en esta herramienta.
Aer, el laboratorio de Zang ha liberado el software IT AER gratuitamente para investigación sin fines comerciales. Actualmente estamos desarrollando y mejorando el IT AER y el eye taster, con la esperanza de que su disponibilidad conduzca a aplicaciones a gran escala fuera del laboratorio de Zang y beneficie, así como impulse, investigaciones adicionales en la comunidad científica.
Este artículo describe la canalización I-TASSER para predecir las estructuras tridimensionales y funciones de proteínas a partir de sus secuencias de aminoácidos. El proceso implica alineamiento por hebras, ensamblaje de fragmentos e inferencia funcional basada en estructuras de proteínas conocidas.
La predicción computacional de la estructura y función de proteínas permite reducir riesgos en dianas durante las primeras etapas del descubrimiento de fármacos, al proporcionar conocimientos mecanicistas sobre proteínas no caracterizadas experimentalmente. La plataforma I-TASSER apoya la comprobación de hipótesis y la anotación funcional, mejorando la confianza predictiva en los procesos de selección de dianas e identificación de compuestos iniciales. Este enfoque disminuye la dependencia de métodos experimentales de bajo rendimiento y acelera la validación de dianas en la investigación y desarrollo biofarmacéuticos.
El método I-TASSER se integra en el continuo de descubrimiento desde la identificación del objetivo hasta la optimización del fármaco líder, al proporcionar conocimientos estructurales y funcionales que orientan la toma de decisiones en cada etapa.