$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Homo sapiens y varias especies animales modelo clave tales como Drosophila melanogaster , Mus musculus , y Danio rerio representan la mayoría de trabajo de genómica funcional actual y pasado. Sin embargo, el costo rápidamente decreciente de la tecnología de secuenciación de alto rendimiento está proporcionando oportunidades para la genómica funcional en especies animales no modelo ( también conocidas como "descuidadas" o "subatendidas") 1 . Esta es una importante transición en genómica ya que los organismos no modelo representan con frecuencia especies económicamente relevantes ( por ejemplo , ostras, camarones, cangrejos) y ofrecen oportunidades para investigar nuevos fenotipos y sistemas biológicos fuera del alcance de los encontrados en especies modelo.
Aunque los organismos desatendidos presentan una oportunidad atractiva para investigar sistemas biológicos únicos, varios desafíos se enfrentan a los investigadores particularmente durante el análisis bioinformático. Algunos de losLos desafíos son innatos al procesamiento de grandes conjuntos de datos, mientras que otros resultan de la falta de recursos genéticos disponibles para los investigadores que trabajan en organismos desatendidos, como un genoma de referencia, ontologías específicas de organismos, etc. Comparación con los de análisis de datos, y como tal los análisis bioinformáticos generalmente se muestra como el costo más subestimado de los proyectos de secuenciación [ 2] . Por ejemplo, un análisis bioinformático de secuenciación básica de próxima generación podría consistir en los siguientes pasos: filtrar y recortar la calidad de las lecturas de secuencias sin procesar, ensamblar lecturas cortas en piezas contiguas más grandes, y anotación y / o comparaciones con otros sistemas para obtener comprensión biológica. Mientras que aparentemente simple, este flujo de trabajo del ejemplo requiere el conocimiento de la especialidad y los recursos computacionales más allá del alcance de un ordenador del laboratorio-banco, poniéndolo fuera del alcance de muchos científicos que estudian no-Organismos modelo.
Los retos innatos pueden ser de infraestructura o de conocimiento. Un desafío clásico de la infraestructura es el acceso a recursos computacionales apropiados. Por ejemplo, el ensamblaje y la anotación se basan en algoritmos computacionalmente intensivos que requieren potentes equipos o clústeres de ordenadores, con gran cantidad de RAM (256 GB-1 TB) y varios procesadores / núcleos para ejecutarse. Desafortunadamente, muchos investigadores no tienen acceso a tales recursos informáticos o no tienen los conocimientos necesarios para interactuar con estos sistemas. Otros investigadores podrían tener acceso a clusters de computación de alto rendimiento a través de sus universidades o instituciones, pero el acceso a estos recursos puede ser limitado ya veces resulta en cargos por hora de cálculo, es decir , el número de procesadores de CPU multiplicado por el número de " Horas "que esos procesadores están funcionando. Aprovechando un sistema de ciberinfraestructura financiado por la National Science FoundationComo CyVerse 3, que proporciona acceso gratuito a los recursos de computación para investigadores, en los Estados Unidos y en todo el mundo, puede ayudar a aliviar los retos de infraestructura, como se demostrará aquí.
Un ejemplo de un reto típico basado en el conocimiento es entender el software necesario para realizar análisis completos. Para llevar a cabo con eficacia un proyecto basado en la secuenciación, los investigadores necesitan estar familiarizados con la miríada de herramientas de software que se han desarrollado para los análisis bioinformáticos. Aprender cada paquete es difícil por sí mismo, pero se ve exacerbado por el hecho de que los paquetes se actualizan constantemente, se vuelven a publicar, se reúnen en nuevos flujos de trabajo y, a veces, se restringen para su uso bajo nuevas licencias. Además, la vinculación de las entradas y salidas de estas herramientas a veces requiere transformar tipos de datos para hacerlos compatibles, agregando otra herramienta al flujo de trabajo. Por último, también es difícil saber qué paquete de software esE mejor "para un análisis, y la identificación frecuente del mejor software para condiciones experimentales particulares es una cuestión de sutiles diferencias. En algunos casos, las revisiones útiles del software están disponibles, pero debido a la liberación continuada de nuevas actualizaciones y de opciones del software, éstas pasan rápidamente de fecha.
Para los investigadores que investigan los organismos subatendidos, estos retos innatos vienen además de los retos asociados con el análisis de datos en un organismo novedoso. Estos desafíos específicos de organismos desatendidos se ilustran mejor durante la anotación de genes. Por ejemplo, los organismos desatendidos frecuentemente no tienen un organismo modelo estrechamente relacionado que pueda ser utilizado razonablemente para identificar ortografía y función genética ( por ejemplo, invertebrados marinos y Drosophila ). Muchas herramientas bioinformáticas también requieren "entrenamiento" para identificar motivos estructurales, que pueden usarse para identificar la función del gen. Sin embargo, los datos de entrenamiento normalmente solo están disponibles para modLos organismos y la formación de modelos de Markov ocultos (HMM) está fuera del alcance de los biólogos, e incluso muchos bioinformáticos. Por último, aunque se puedan realizar anotaciones utilizando datos de organismos modelo, algunas ontologías genéticas asociadas con organismos modelo no tienen sentido cuando se considera la biología y la historia natural del organismo subatendido ( por ejemplo , transferir información de Drosophila a camarón).
A la luz de estos desafíos, los recursos bioinformáticos deben desarrollarse con investigadores que realicen análisis de novo sobre organismos desatendidos específicamente en mente. Los próximos años de proyectos de secuenciación genómica funcional ayudarán a cerrar la brecha entre los organismos modelo y los subatendidos ( https://genome10k.soe.ucsc.edu/ ), pero hay muchas herramientas que deberán desarrollarse para abordar los desafíos Consideradas anteriormente. CyVerse se dedica a crear ecosistemas de iInteroperabilidad mediante la vinculación de la ciberinfrastructure existente y las aplicaciones de terceros para entregar la gestión de datos, herramientas de análisis bioinformático, y visualizaciones de datos a los científicos de la vida. La interoperabilidad ayuda a suavizar las transiciones entre aplicaciones y plataformas bioinformáticas proporcionando recursos computacionales escalables y limitando las conversiones de formato de archivo y la cantidad de datos transferidos entre plataformas. CyVerse ofrece varias plataformas, incluyendo el Discovery Environment (DE 4 , Atmosphere 5 y Data Store 3. El DE está basado en la web y tiene muchas herramientas analíticas comunes de bioinformática convertidas en formatos de apuntar y hacer clic "), Y es la interfaz gráfica de usuario (GUI) para el almacén de datos donde se almacenan y gestionan grandes conjuntos de datos ( es decir , lecturas de secuencias sin procesar, genomas ensamblados).Utilizando los recursos computacionales de la Máquina Virtual, que tienen una amplia gama de herramientas bioinformáticas preinstaladas. Ambas plataformas están vinculadas al almacén de datos y se pueden utilizar conjuntamente para crear flujos de trabajo como los que se describen aquí. Este informe se centra en un ensamblaje de transcriptome de novo y flujos de trabajo de análisis de expresión génica diferencial, y además aborda algunas prácticas recomendadas asociadas con el desarrollo y la realización de análisis bioinformáticos. Una explicación de la misión más amplia de CyVerse ( http://www.cyverse.org/about ) y descripciones detalladas de la plataforma ( http://www.cyverse.org/learning-center ) están públicamente disponibles. Todos los análisis descritos en este documento utilizan el Entorno de Descubrimiento 4 (DE) y la Atmósfera 5 , y se presentan de una manera que los hace accesibles a los investigadores de todos los niveles computacionales. DE workflows y AtmosphLas imágenes se pueden referenciar directamente mediante URL para asegurar la procedencia a largo plazo, la reutilización y la reproducibilidad.