5 de febrero de 2014
Aquí se describe una tubería de paso a paso para generar filogenias confiables desde el nucleótido o secuencia de aminoácidos conjuntos de datos. Esta guía tiene como objetivo servir a los investigadores o estudiantes nuevos para el análisis filogenético.
El objetivo general de este artículo es reconstruir un árbol filogenético confiable a partir de secuencias de ADN o proteínas. Esto se logra primero identificando secuencias similares mediante programas blast en el NCBI. El segundo paso consiste en alinear las secuencias similares.
A continuación, se determina el modelo de evolución con mejor ajuste a partir del alineamiento. El paso final consiste en inferir la relación filogenética a partir de las secuencias alineadas. En última instancia, la secuencia de pasos se utiliza para mostrar cómo los usuarios pueden pasar de datos de secuencias a filogenias confiables.
Este método puede ayudar a responder preguntas clave en diversos campos al inferir la identidad y la función de secuencias novedosas. Para utilizar la versión en línea de la herramienta básica de búsqueda de alineamiento local, o blast, diríjase al Servidor Web de Blast del Centro Nacional de Información Biotecnológica o NNC B's. Haga clic en el programa blast adecuado.
Introduzca una secuencia de texto en formato FASTA, como la que se muestra aquí, en el cuadro de consulta. Haga clic en el programa BLAST adecuado para usarlo en la búsqueda y luego haga clic en BLAST. La salida está en formato HTML por defecto y muestra las secuencias más similares a la secuencia de texto introducida.
La siguiente sección trata sobre el uso de un ejecutable blast local en Windows Mac. Los usuarios pueden pasar a la siguiente sección llamada Ejecutables locales Blast para Macs x. Para ejecutar el programa de línea de comandos blast en una máquina Windows, descargue el ejecutable de Windows apropiado desde el sitio web de NCBI blast.
Después de instalar el programa Blast, configure la variable de entorno del PC de la siguiente manera: haga clic en el botón de inicio del PC y haga clic con el botón derecho en equipo. Luego, haga clic en propiedades. En la nueva ventana, seleccione configuraciones avanzadas del sistema y, en la pestaña avanzado del nuevo cuadro emergente, haga clic en el botón variables de entorno.
Luego, en la sección de variables de usuario, haga clic en el botón nuevo. En la ventana emergente, agregue el nombre de la variable path y el valor de la variable que se muestra aquí. A continuación, descargue una base de datos blast preformateada, que se actualiza diariamente desde el sitio web del NCBI, o un genoma para un organismo particular.
Luego, abra un símbolo del sistema MS DOS haciendo clic en Inicio y escribiendo CMD en la barra de búsqueda, y cambie al directorio de BLAST del NCBI. Cree la base de datos utilizando el comando Crear base de datos BLAST que se muestra aquí. Cree una secuencia proteica de consulta denominada test insertando una secuencia proteica en formato FASTA en la carpeta de la base de datos.
Luego, para identificar las secuencias más similares a la proteína de prueba, consulte la base de datos mediante el comando de consulta blast P. La siguiente sección repite esta información para usuarios de Mac. Los usuarios de Windows pueden pasar a la sección cinco, Generación de alineamientos múltiples de secuencias.
Para ejecutar el programa de línea de comandos blast en una Mac, descargue el ejecutable adecuado para MAC accediendo remotamente al sitio F-T-P del N-C-B-I. Para ello, abra el buscador y busque terminal en la ventana de terminal, escriba la dirección F-T-P del sitio del N-C-B-I. Escriba anonymous como nombre y contraseña, y luego escriba CD blast barra ejecutables barra más reciente.
Enumere los ejecutables escribiendo LS y descargue la versión más reciente que cumpla con los requisitos de su sistema escribiendo lo siguiente. Ahora, descomprima los archivos descargados. A continuación, agregue la ubicación de los binarios para el ejecutable de blast a su ruta, de modo que el intérprete de comandos pueda buscar en este directorio.
Al buscar comandos, descargue una base de datos blast preformateada o un genoma desde el sitio web del NCBI. Busque en el directorio de genomas escribiendo CD genomas. Luego descargue el genoma o la secuencia de interés como se indica a continuación, y después escriba quit para salir del sitio FTP.
A continuación, cree la base de datos escribiendo la instrucción Make Blast DB. Inserte una secuencia de consulta en formato FASTA en la carpeta bin e interrogue la base de datos con el comando de consulta blast P para encontrar la secuencia más similar a los datos de la secuencia de prueba. Entre los programas comúnmente utilizados de alineación múltiple de secuencias o MSA, está tea coffee. Después de ingresar los datos de la secuencia en formato FASTA en el cuadro de consulta en el sitio de tea coffee, la salida indica los residuos similares mediante un código de colores.
Otro programa de AMS ampliamente utilizado es el AMS clusteral, que puede descargarse como una versión de línea de comandos, CLUSTAL W, o como una versión gráfica, CLUSTAL X, para diversos sistemas operativos. A continuación, cargue los datos en el programa clusteral como un texto de secuencia con formato fasta seleccionando la pestaña de archivo. Luego, haga clic en el botón cargar secuencias.
Ahora cambie a la pestaña de alineación y haga clic en el botón realizar alineación completa para alinear las secuencias según un modelo de evolución de mejor ajuste. Descargue el programa protest. Una vez que protest se haya descargado, haga doble clic sobre protest.
Una vez iniciada la protesta, haga clic en seleccionar archivo en el cuadro de alineación para cargar los datos de secuencia. Luego, haga clic en iniciar para ejecutar el programa. Tras completar la ejecución, el programa indica el mejor modelo según los criterios para inferir secuencias.
Después de descargar e iniciar Phi ML, cargue la secuencia de entrada como una secuencia con formato lip introduciendo el nombre del archivo y PY. Luego inicie el programa escribiendo y. Después de descargar un programa de inferencia bayesiana desde el sitio web de Mr Bays, inicie el programa haciendo clic en el archivo ejecutable. A continuación, cargue los datos de secuencias con formato Nexus en el programa escribiendo execute nombre_del_archivo punto NEX.
A continuación, configure el modelo evolutivo y seleccione el número de generaciones a ejecutar. Después de realizar el análisis con el comando mc mc, resuma los árboles utilizando el comando sum T para visualizar un árbol filogenético. Descargue el programa para ver árboles.
Como nota final, se lanzan constantemente nuevos programas informáticos destinados a proporcionar mejores alineamientos, predicciones de similitud o árboles filogenéticos. Aunque en este video se ha presentado una visión general de programas populares, se anima al espectador a explorar opciones adicionales. El algoritmo blast realiza alineamientos locales, que buscan segmentos cortos de similitud en las secuencias.
Después de que el algoritmo haya buscado todos los segmentos posibles de la secuencia de consulta y extendido al máximo estas secuencias, ensambla entonces los alineamientos. Para cada par de secuencias de consulta, el valor e indica la significancia estadística de una coincidencia. Cuanto menor sea el valor E, más significativo será el resultado.
Por ejemplo, un alineamiento de secuencias con un valor E de 0.05 significa que la probabilidad de que esta coincidencia ocurra por azar es de cinco en 100. El puntaje BIT utiliza una matriz de puntuación específica para indicar qué tan bueno es el alineamiento. Cuanto mayor sea el puntaje BIT, mejor será el alineamiento.
Un alineamiento múltiple de secuencias o AMS es un alineamiento de secuencias de tres o más secuencias primarias compuestas de aminoácidos, ADN o ARN. La salida del AMS té café que se muestra aquí codifica con colores los residuos similares. Aquí se muestra un ejemplo de alineamiento de seis secuencias proteicas alineadas mediante Cluster X para alineamientos de aminoácidos.
El programa protest se utiliza para determinar la selección de los modelos de reemplazo de aminoácidos que mejor se ajustan. Dentro de los datos, el programa enumera los modelos a medida que se analizan y muestra el modelo de mejor ajuste tras la finalización del programa. Phi ML estima filogenias de máxima verosimilitud a partir de alineamientos de secuencias de nucleótidos o aminoácidos. Incorpora un gran número de modelos de sustitución junto con diversas opciones para explorar el espacio de topologías filogenéticas.
Mr.Bayes utiliza inferencia bayesiana CMC a través de varios modelos evolutivos para reconstruir relaciones filogenéticas. Una vez que el programa está en ejecución, se puede observar el progreso en intervalos específicos como se muestra aquí. Una vez que se genera un árbol filogenético, es necesario visualizar la topología.
En esta figura, la ventana de vista de árbol muestra un árbol de ejemplo de proteínas de fly.Base. La vista de árbol incluye un editor de árboles que permite al usuario mover ramas y reorganizar árboles. Al realizar este procedimiento, es importante recordar leer cuidadosamente las guías del usuario para cada programa.
Este protocolo proporciona un punto de partida práctico para presentar al lector cómo funcionan estos programas. Sin embargo, animo al lector a experimentar y familiarizarse con los muchos ajustes asociados a cada programa.
Vea la transcripción completa y acceda a miles de videos científicos
Este artículo presenta una secuencia paso a paso para reconstruir árboles filogenéticos confiables a partir de secuencias de ADN o proteínas. Está diseñado para investigadores y estudiantes nuevos en el análisis filogenético.
El análisis filogenético permite la validación de objetivos y la reducción de riesgos mecanicistas en las primeras etapas del descubrimiento, al inferir la identidad funcional y las relaciones evolutivas de secuencias novedosas. Esta metodología respalda la confianza predictiva en la identificación de candidatos principales al aclarar el contexto biológico y reducir la ambigüedad en las pruebas de hipótesis sobre los objetivos. Proporciona un puente traslacional desde los datos de secuencia hasta la anotación funcional, orientando la selección de carteras y las decisiones de avance ajustadas al riesgo.
El método se integra en la continuación del descubrimiento desde la identificación del blanco hasta la optimización del fármaco inicial, permitiendo la comprobación de hipótesis, la reducción de riesgos biológicos y la modelización predictiva basada en relaciones evolutivas.