9 de mayo de 2017
Este protocolo describe un flujo de trabajo comparativo de anotación y ensamblaje de transcriptomas de novo para bioinformáticos novatos. El flujo de trabajo está disponible de forma gratuita en su totalidad a través de CyVerse y conectado por el almacén de datos. Se utilizan interfaces gráficas de usuario y de línea de comandos, pero todo el código necesario está disponible para copiar y pegar.
El objetivo general de este procedimiento es evaluar, ensamblar, anotar y comparar la expresión génica diferencial a través de la transcriptómica De Novo, a partir de archivos FASTQ sin procesar. Este método puede ayudar a responder preguntas en biología comparativa y molecular, incluyendo qué transcripciones están dentro de un organismo, qué están haciendo esas transcripciones dentro de esos organismos y cuáles son las diferencias entre las condiciones experimentales. La principal ventaja de esta técnica es que proporciona un entorno interactivo.
Proporciona recursos computacionales bajo demanda y permite a los investigadores comenzar a analizar inmediatamente sus datos de RNA-Seq. Este método es particularmente útil para los investigadores que comparan experimentos dentro de un solo organismo que involucra múltiples tejidos, condiciones y puntos de tiempo para comprender cómo cambian los sistemas biológicos. Este método se centra en organismos no modelo sin genomas, pero también se puede aplicar a organismos con ensamblajes de genomas disponibles, incluso aquellos con decenas o cientos de miles de andamios en su ensamblaje.
Para empezar, obtenga acceso a Atmósfera en el entorno de detección. Solicite una cuenta gratuita de CyVerse navegando a la página de registro. Utilice un correo electrónico institucional para registrarse en la cuenta.
A continuación, vaya a la pestaña de aplicaciones y servicios y solicite acceso a Atmosphere. El acceso al entorno de detección se concede automáticamente. Inicie sesión en el entorno de detección, abreviado como DE. A continuación, seleccione la pestaña Datos para abrir un menú que contenga todas las carpetas del almacén de datos.
Cree una carpeta principal del proyecto que contenga todos los datos asociados con el proyecto. Busque la barra de herramientas en la parte superior de la ventana de datos y seleccione Archivo, Nueva carpeta. No utilice espacios ni caracteres especiales en los nombres de las carpetas ni en los nombres de los archivos de entrada y salida.
En su lugar, use guiones bajos o guiones cuando corresponda. Cargue los archivos de secuencia FASTQ sin procesar y la carpeta, 1_Raw_Sequence, en una subcarpeta titulada Carpeta A_Raw_Reads. En el caso de los archivos de menos de dos gigabits, utilice la función de carga sencilla del almacén de datos para navegar a la barra de herramientas de la ventana de datos haciendo clic en el botón Datos en el escritorio principal de DE.
Seleccione Cargar, Carga simple desde el escritorio. A continuación, seleccione el botón Examinar para navegar a los archivos de secuenciación FASTQ sin procesar en el equipo local. Evalúe las lecturas de secuenciación sin procesar cargadas mediante la aplicación FastQC en el DE. Seleccione el botón Aplicaciones en el escritorio principal de DE para abrir una ventana que contenga todas las aplicaciones de análisis disponibles en el DE. Busque en la ventana la herramienta FastQC en la barra de herramientas de búsqueda en la parte superior de la ventana.
Abra la versión de varios archivos si hay más de un archivo FASTQ. Seleccione Archivo y cree una nueva carpeta y, a continuación, seleccione esta carpeta como carpeta de salida. Cargue los archivos de lectura de FASTQ en la ventana de herramientas llamada Seleccionar datos de entrada y seleccione Iniciar análisis.
Busque la aplicación programable Trimmomatic en el DE y ábrala. Cargue la carpeta de archivos de lectura FASTQ sin procesar en la sección de configuración. Seleccione si los archivos de secuenciación son de un solo extremo o emparejados.
Utilice el archivo de control estándar que se proporciona seleccionando el botón Examinar y pegando la ruta del archivo en el cuadro de visualización. Seleccione el archivo de control Trimmomatic e inicie el análisis. Para lecturas de secuencia de recorte de calidad, busque y abra la aplicación Sickle en el DE. Seleccione las lecturas de FASTQ recortadas como lecturas de entrada y cambie el nombre de los archivos de salida.
Incluya la configuración de calidad en las opciones. Abra la versión más reciente de la instancia de Atmosphere navegando a la página wiki. Seleccione el enlace para la versión más reciente de la imagen de Trinity y Trinotate.
Seleccione el botón Iniciar sesión para iniciar y, a continuación, asigne un nombre a la instancia de Atmosphere. Seleccione un tamaño de instancia de medium3 o large3. Inicie la instancia y espere a que se compile.
Si una imagen de Atmosphere no se pone en marcha, puede intentar solicitar una instancia más pequeña o puede solicitar a Jetstream una asignación mayor. Todos los detalles están en la wiki complementaria. Mueva los archivos de salida de Trinity a la carpeta, 3_Assembly, en el DE y etiquete la carpeta, A_Trinity_de_novo_assembly.
Ejecutar Trinity requiere conocimientos de línea de comandos y varios días o posiblemente semanas para completar análisis grandes. Hay recursos gratuitos disponibles que están vinculados en la wiki para ayudar a comprender la línea de comandos. Asigne a cada transcriptoma que se haya ensamblado una subcarpeta dentro de la carpeta A_Trinity_de_novo_assembly.
Utilice nombres únicos, incluidos los nombres científicos de los organismos y los tratamientos asociados con cada transcriptoma, y luego cree otra subcarpeta llamada Carpeta B_rnaQUAT_Output en la carpeta 3_Assembly. Abra la aplicación titulada De Novo rnaQUAST. Asigne un nombre al análisis y seleccione Carpeta B_rnaQUAST_Output como carpeta de salida.
Busque el decodificador de transcripción y ejecute el transdecodificador en el archivo fasta de salida de De Novo Trinity Assembly en el entorno de detección. Abra la aplicación deseq2 en el DE.Name el análisis y seleccione la carpeta de salida como 4_Differential_Expresssion. En la sección Entrada, seleccione el archivo de tabla de recuentos de la ejecución de Trinity Assembly.
Además, seleccione la columna donde se pueden encontrar los nombres de contig. Introduzca los encabezados de columna del archivo de tabla de datos de recuentos para determinar qué columnas se comparan. Incluya las comas entre cada una de las condiciones.
No incluya el encabezado de la primera columna que contiene los nombres de contig. En el caso de las réplicas, repita el mismo nombre. En la segunda línea, proporcione los nombres de las dos condiciones que se van a comparar.
Coincida con los nombres de encabezado de columna proporcionados en la primera línea. Aquí se muestra una comparación sistemática de las lecturas de secuenciación después de cada paso de preprocesamiento. Después de recortar, la lectura debe tener un contenido de GC y un contenido de secuencia menos sesgados, y tener una mayor proporción con respecto a las lecturas con una puntuación de calidad alta.
Se necesitan lecturas de alta calidad para ensamblar transcriptomas De Novo. Los resultados de un control de calidad rápido dependen de los organismos y las muestras que se secuencian. Por la uniformidad en todas las muestras que se compararán aguas abajo, el objetivo principal de las lecturas previas al procesamiento es el mismo.
rnaQUAST aprovecha el código boost para generar estadísticas resumidas sobre ensamblajes basados en genes centrales conocidos en clados taxonómicos. La precisión de los ensambladores se revela por el número de discordancias por transcripción y cuántas transcripciones coinciden con los genes canónicos. Las últimas cuatro subtramas presentadas aquí proporcionan estadísticas resumidas de la longitud de contig e isoformas, así como la cobertura de las isoformas esperadas.
NAx representa el porcentaje de contigs con una longitud más larga que la longitud del eje y. La fracción ensamblada es la transcripción ensamblada más larga dividida por su longitud. Donde como fracción cubierta es el porcentaje de isoformas de transcripción ensambladas completas según lo esperado por los genes procariotas o eucariotas centrales de BUSCO.
Después de ver este video, debería tener una buena comprensión de cómo ensamblar e ingresar transcriptomas. Además, este protocolo le permitirá detectar la expresión génica diferencial entre dos condiciones. Por lo general, las personas tienen dificultades con los paquetes bioinformáticos porque hay muchos de ellos, hay muchas configuraciones y variables asociadas con ellos, y por lo general hay que tener conocimiento de la línea de comandos para ejecutarlos.
Es importante etiquetar y organizar las entradas de datos y las salidas de análisis para que otros investigadores puedan entender lo que se hizo. Debe incluir los pasos del pedido que se completaron, las versiones del programa y la información de muestra. Además, omita los espacios en los nombres de carpeta o archivo.
Constantemente se integran nuevas herramientas y nuevas versiones de las herramientas, pero también se mantienen las versiones antiguas de las herramientas. Todos los cambios se registrarán en la wiki complementaria. Siguiendo este procedimiento, se pueden realizar otros métodos bioinformáticos como el análisis de redes, el enriquecimiento de GO y la identificación de vías metabólicas para ayudar a responder preguntas como la variación del fenotipo, las condiciones que cambian los perfiles de expresión y la identificación de genes de interés para la genómica funcional.
Este protocolo describe un flujo de trabajo para el ensamblaje y anotación de novo del transcriptoma, diseñado para bioinformáticos principiantes. Proporciona un entorno interactivo para analizar datos de RNA-Seq, accesible a través de CyVerse.
Este flujo de trabajo permite a los equipos de I+D en biofármacos generar datos transcriptómicos de alta calidad a partir de organismos no modelo, apoyando la validación de dianas en sistemas biológicos poco explorados. Al proporcionar un entorno interactivo basado en la nube para el ensamblaje de novo y el análisis de expresión diferencial, reduce las barreras para la desviación mecanicista en las fases iniciales del descubrimiento. El enfoque mejora la confianza predictiva al estudiar las respuestas específicas del organismo a perturbaciones experimentales, informando la priorización de carteras.
El método se enmarca dentro del continuo de descubrimiento temprano, apoyando la comprobación de hipótesis y la aclaración de vías antes de los esfuerzos de identificación de compuestos prometedores.