5 de febrero de 2014
Aquí se describe una tubería de paso a paso para generar filogenias confiables desde el nucleótido o secuencia de aminoácidos conjuntos de datos. Esta guía tiene como objetivo servir a los investigadores o estudiantes nuevos para el análisis filogenético.
El objetivo general de este artículo es reconstruir un árbol filogenético fiable a partir de secuencias de ADN o proteínas. Esto se logra identificando primero secuencias similares utilizando programas de voladura en el NCBI. El segundo paso es alinear secuencias similares.
A continuación, se determina el modelo de evolución de mejor ajuste a partir de la alineación. El paso final es inferir la relación filogenética a partir de las secuencias alineadas. En última instancia, la canalización paso a paso se utiliza para mostrar cómo los usuarios pueden pasar de los datos de secuencia a las filogenias fiables.
Este método puede ayudar a responder preguntas clave en diversos campos al inferir identidad y función a secuencias novedosas. Para usar la versión en línea de la herramienta básica de búsqueda de alineación local o voladura, navegue hasta el Centro Nacional de Información Biotecnológica o el servidor web Blast de NNC B. Haga clic en el programa de voladura correspondiente.
Introduzca una secuencia de texto con formato FASTA como la que se muestra aquí en el cuadro de consulta. Haga clic en el programa de voladura adecuado para su uso en la búsqueda y, a continuación, haga clic en voladura. La salida está en formato HTML de forma predeterminada y muestra las secuencias más similares a la secuencia de texto de entrada.
La siguiente sección trata sobre el uso de un ejecutable de Blast local en Mac con Windows. Los usuarios pueden pasar a la siguiente sección llamada Ejecutables de Blast Local para Mac x. Para ejecutar el programa de línea de comandos blast en un equipo Windows, descargue el ejecutable de Windows apropiado desde el sitio web de NCBI blast.
Después de instalar el programa Blast, configure la variable de entorno de PC de la siguiente manera, haga clic en el botón de inicio de PC y haga clic con el botón derecho en la computadora. A continuación, haga clic en propiedades. En la nueva ventana, seleccione configuración avanzada del sistema y, en la pestaña avanzada de la nueva ventana emergente, haga clic en el botón Variables de entorno.
A continuación, en la sección Variables de usuario para usuario, haga clic en el botón Nuevo. En la nueva ventana emergente, agregue la ruta del nombre de la variable y el valor de la variable que se muestra aquí. A continuación, descargue una base de datos de voladuras preformateada, que se actualiza diariamente desde el sitio web del NCBI o un genoma de un organismo en particular.
A continuación, abra un símbolo del sistema de MS DOS haciendo clic en iniciar y escribiendo CMD en la barra de búsqueda y cambie a la carpeta NCBI blast. Cree la base de datos utilizando el comando Make blast DB que se muestra aquí. Cree una secuencia de proteínas de consulta denominada test insertando una secuencia de texto de proteínas con formato FASTA en la carpeta DB.
A continuación, para identificar las secuencias más similares a la proteína de prueba, interrogue a la base de datos mediante un comando de consulta blast P. En la siguiente sección se repite esta información para los usuarios de Mac. Los usuarios de Windows pueden saltar a la sección cinco generando múltiples alineaciones de secuencia.
Para ejecutar el programa de línea de comandos blast en un Mac, descargue el ejecutable MAC apropiado accediendo de forma remota al sitio N-C-B-I-F-T-P. Para hacer esto, abra el buscador y busque terminal en la ventana del terminal, escriba la dirección FTP para el sitio N-C-B-I-F-T-P. Escriba anonymous para nombre y contraseña y, a continuación, escriba CD blast slash executables slash last.
Enumere los ejecutables escribiendo LS y descargue la versión más reciente que coincida con los requisitos del sistema escribiendo lo siguiente. Ahora, descomprime los archivos descargados. Ahora agregue la ubicación de los binarios para el ejecutable blast a su ruta para que el shell pueda buscar a través de este directorio.
Cuando busque comandos, descargue una base de datos de voladuras preformateada o un genoma del sitio web del NCBI. Busque en el directorio de genomas escribiendo CD genomas. A continuación, descargue el genoma o la secuencia de interés de la siguiente manera y, a continuación, escriba quit para salir del sitio FTP.
A continuación, cree la base de datos escribiendo la instrucción Make Blast DB. Inserte una secuencia de consulta con formato FASTA en la carpeta bin e interrogue a la base de datos con el comando de consulta blast P para encontrar la secuencia más similar a los datos de la secuencia de prueba entre los programas de alineación de secuencia múltiple o MSA de uso común es el té y el café. Después de ingresar los datos de secuencia formateados fasta en el cuadro de consulta en el sitio de té y café, la salida indica residuos similares mediante el código de colores.
Otro programa MSA comúnmente utilizado es el MSA clusteral, que se puede descargar como una versión de línea de comandos, CLUSTERAL W, o una versión gráfica CLUSTERAL X para varios sistemas operativos. A continuación, cargue los datos en el programa agrupado tan rápido como un texto de secuencia formateado seleccionando la pestaña de archivo. A continuación, haga clic en el botón Cargar secuencias.
Ahora cambie a la pestaña de alineación y haga clic en el botón completar alineación para alinear las secuencias y obtener un modelo de evolución que se ajuste mejor. Descargue el programa de protesta. Una vez descargada la protesta, haga doble clic en protesta.
Una vez iniciada la protesta, haga clic en seleccionar archivo en el cuadro de alineación para cargar los datos de la secuencia. A continuación, haga clic en iniciar para ejecutar el programa. Después de completar la ejecución, el programa indica el mejor modelo en función de los criterios para inferir secuencias.
Después de descargar e iniciar Phi ML, cargue la secuencia de entrada como una secuencia con formato de labio de archivo escribiendo el nombre del archivo y PY. A continuación, inicie el programa escribiendo y. Después de descargar un programa de inferencia bayesiana del sitio web de Mr Bays, inicie el programa haciendo clic en el archivo ejecutable. A continuación, lea los datos de secuencia formateados de Nexus en el programa escribiendo execute file name dot NEX.
A continuación, establezca el modelo evolutivo y seleccione el número de generaciones que se van a ejecutar. Después de ejecutar el análisis con el comando mc mc, resuma los árboles utilizando el comando sum T para ver un árbol filogenético. Descargue el programa de vista de árbol.
Como nota final, hay lanzamientos constantes de nuevo software destinado a proporcionar mejores alineaciones, predicciones de similitud o árboles filogenéticos. Si bien la descripción general de este video cubrió programas populares, se alienta al espectador a explorar opciones adicionales. El algoritmo de voladura realiza alineaciones locales, que buscan tramos cortos de similitud de secuencia.
Una vez que el algoritmo ha buscado todas las extensiones posibles de la secuencia de consulta y ha extendido al máximo estas secuencias, ensambla las alineaciones. Para cada par de secuencia de consulta, el valor e proporciona una indicación de la significación estadística de una coincidencia. Cuanto menor sea el valor E, más significativo será el impacto.
Por ejemplo, una alineación de secuencia con un valor E de 0,05 significa que la probabilidad de que esta coincidencia ocurra solo por casualidad es de cinco en 100. La puntuación BIT utiliza una matriz de puntuación específica para proporcionar una indicación de la calidad de la alineación. Cuanto mayor sea la puntuación del BIT, mejor será la alineación.
Un alineamiento de secuencia múltiple o MSA es un alineamiento de secuencia de tres o más secuencias primarias compuestas por aminoácidos, ADN o ARN. La salida del café de té MSA que se ve aquí, codifica por colores residuos similares. Aquí se muestra una muestra de alineación de seis secuencias de proteínas alineadas usando el grupo X para alineaciones de aminoácidos.
El programa de protesta se utiliza para determinar la selección de los modelos más adecuados de reemplazos de aminoácidos. Dentro de los datos, el programa enumera los modelos a medida que se analizan y muestra el mejor ajuste después de completar el programa, Phi ML estima las filogenias de máxima verosimilitud a partir de alineaciones de secuencias de nucleótidos o aminoácidos. Incorpora un gran número de modelos de sustitución acoplados a varias opciones para buscar el espacio de topología de árbol.
El Sr. Bayes utiliza la inferencia bayesiana de CMC a través de una serie de modelos evolutivos para reconstruir las relaciones filogenéticas. Una vez que el programa se está ejecutando, el progreso se puede ver en intervalos específicos como se muestra aquí. Una vez que se genera un árbol filogenético, es necesario visualizar la topología.
En esta figura, la ventana de vista de árbol muestra un árbol de muestra de proteínas de la mosca. Base. La vista de árbol incluye un editor de árboles que permite al usuario mover ramas y redirigir árboles. Al intentar este procedimiento, es importante recordar leer detenidamente las guías de usuario de cada programa.
Este protocolo proporciona un punto de partida práctico para presentar al lector el funcionamiento de estos programas. Sin embargo, animo al lector a jugar y familiarizarse con los muchos ajustes asociados con cada programa.
Vea la transcripción completa y acceda a miles de videos científicos
Este artículo presenta una tubería paso a paso para reconstruir árboles filogenéticos confiables a partir de secuencias de ADN o proteínas. Está diseñado para investigadores y estudiantes nuevos en el análisis filogenético.
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.