$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Homo sapiens et plusieurs espèces d'animaux modèles clés tels que Drosophila melanogaster , Mus musculus et Danio rerio représentent la majorité du travail de génomique fonctionnel actuel et passé. Cependant, le coût en baisse rapide de la technologie de séquençage à haut débit fournit des possibilités de génomique fonctionnelle dans les espèces animales non-modèles ( aka "négligées" ou "mal desservies" 1) . Il s'agit d'une transition importante dans la génomique car les organismes non-modèles représentent fréquemment des espèces économiquement pertinentes ( p. Ex. Les huîtres, les crevettes, le crabe) et offrent des possibilités d'enquêter sur de nouveaux phénotypes et des systèmes biologiques en dehors de la portée des espèces modèles.
Bien que les organismes mal desservis présentent une opportunité intéressante pour étudier des systèmes biologiques uniques, plusieurs défis sont confrontés aux chercheurs en particulier lors de l'analyse bioinformatique. CertainsLes défis sont innés au traitement de grands ensembles de données, tandis que d'autres résultent du manque de ressources génétiques disponibles pour les chercheurs travaillant dans des organismes mal desservis tels qu'un génome de référence, des ontologies spécifiques à l'organisme, etc. Les problèmes liés à l'isolement et au séquençage des acides nucléiques sont souvent courants Comparaison avec celles de l'analyse des données, et en tant que telles, les analyses bioinformatiques se révèlent généralement être le coût le plus sous-estimé des projets de séquençage 2 . Par exemple, une analyse bioinformatique de base de prochaine génération de la prochaine génération pourrait comporter les étapes suivantes: filtrage et coupe de qualité des lectures séquentielles brutes, assemblage de lectures courtes en pièces contiguës plus importantes et annotations et / ou comparaisons avec d'autres systèmes pour acquérir une compréhension biologique. Bien que tout simplement simple, cet exemple de flux de travail nécessite des connaissances spécialisées et des ressources informatiques au-delà de la portée d'un ordinateur de laboratoire, en le plaçant hors de la portée de nombreux scientifiques qui étudient des non-Organismes modèles.
Les défis innés peuvent être basés sur l'infrastructure ou la connaissance. Un défi d'infrastructure classique est l'accès à des ressources informatiques appropriées. Par exemple, l'assemblage et l'annotation s'appuient sur des algorithmes à forte intensité de calcul qui nécessitent des ordinateurs puissants ou des clusters d'ordinateurs, disposant d'une grande quantité de RAM (256 Go-1 TB) et de plusieurs processeurs / noyaux à exécuter. Malheureusement, de nombreux chercheurs n'ont pas accès à de telles ressources informatiques ou n'ont pas les connaissances nécessaires pour interagir avec ces systèmes. D'autres chercheurs pourraient avoir accès à des grappes informatiques performantes dans leurs universités ou institutions, mais l'accès à ces ressources pourrait être limité et parfois entraîner des charges par heure de calcul, c'est-à-dire le nombre de processeurs CPU multiplié par le nombre d'horloge en temps réel Heures "que ces processeurs fonctionnent. Tirer parti d'un système de cyberinfrastructure financé par l'US National Science Foundation sUch que CyVerse 3 qui offre un accès gratuit aux ressources de calcul pour les chercheurs, aux États-Unis et dans le monde entier, peut aider à atténuer les défis de l'infrastructure, comme cela sera démontré ici.
Un exemple d'un défi typique basé sur le savoir consiste à comprendre le logiciel nécessaire aux analyses complètes. Pour mener efficacement un projet basé sur le séquençage, les chercheurs doivent se familiariser avec la myriade d'outils logiciels qui ont été développés pour les analyses bioinformatiques. L'apprentissage de chaque paquet est difficile à part entière, mais il est exacerbé par le fait que les paquets sont constamment mis à niveau, rediffusés, mis en place dans de nouveaux flux de travail et parfois restreints pour être utilisés sous de nouvelles licences. En outre, la liaison des entrées et des sorties de ces outils nécessite parfois la transformation de types de données pour les rendre compatibles, en ajoutant un autre outil au flux de travail. Enfin, il est également difficile de savoir quel paquet logiciel est 'thLe meilleur "pour une analyse, et souvent identifier le meilleur logiciel pour des conditions expérimentales particulières est une question de différences subtiles. Dans certains cas, des critiques utiles sur les logiciels sont disponibles, mais en raison de la publication continue de nouvelles mises à jour et d'options logicielles, celles-ci sont rapidement dépassées.
Pour les chercheurs qui étudient les organismes mal desservis, ces défis innés s'ajoutent aux défis associés à l'analyse des données dans un organisme nouveau. Ces défis spécifiques aux organismes mal desservis sont mieux illustrés lors de l'annotation des gènes. Par exemple, les organismes mal desservis ne possèdent souvent pas d'organisme modèle étroitement lié qui peut être utilisé de façon raisonnable pour identifier l'orthologie et la fonction des gènes ( p. Ex. Invertébrés marins et Drosophila ). De nombreux outils bioinformatiques nécessitent également une «formation» pour identifier des motifs structurels, qui peuvent être utilisés pour identifier la fonction des gènes. Cependant, les données de formation ne sont généralement disponibles que pour le modLes organismes et les modèles cachés de Markov (HMM) ne relèvent pas des biologistes, et même de nombreux bioinformaticiens. Enfin, même si des annotations peuvent être réalisées à l'aide de données provenant d'organismes modèles, certaines ontologies de gènes associées à des organismes modèles n'ont pas de sens lorsque la biologie et l'histoire naturelle de l'organisme mal desservi sont considérées ( p. Ex . Transfert d'informations de Drosophila aux crevettes ).
À la lumière de ces défis, les ressources bioinformatiques doivent être développées avec des chercheurs qui effectuent des analyses de novo sur les organismes mal desservis. Les prochaines années de projets de séquençage génomique fonctionnel aideront à combler l'écart entre les organismes modèles et mal desservis ( https://genome10k.soe.ucsc.edu/ ), mais il existe plusieurs outils qui devront être développés pour relever les défis Considéré ci-dessus. CyVerse est dédié à la création d'écosystèmes de iNteropérabilité en liant la cyberinfrastructure existante et les applications tierces pour fournir une gestion des données, des outils d'analyse bioinformatique et des visualisations de données à des scientifiques de la vie. L'interopérabilité contribue à lisser les transitions entre les applications bioinformatiques et les plates-formes en fournissant des ressources informatiques évolutives et en limitant les conversions de format de fichier et la quantité de données transférées entre les plates-formes. CyVerse offre plusieurs plates-formes, y compris l'environnement Discovery (DE 4 , Atmosphere 5 et Data Store 3) . Le DE est basé sur le Web et dispose de nombreux outils analytiques de bioinformatique communs converties en formats conviviaux point-et-clic (appelés "applications "), Et est l'interface utilisateur graphique (GUI) pour le magasin de données où sont stockés et gérés des ensembles de données volumineux ( c'est-à-dire des lectures séquentielles brutes, des génomes assemblés). L'atmosphère est un service de cloud computing offrant aux chercheurs une flexibilité accrue pourEn utilisant les ressources informatiques de la machine virtuelle, qui possèdent une large gamme d'outils de bioinformatique préinstallés. Ces deux plates-formes sont liées au magasin de données et peuvent être utilisées ensemble pour créer des flux de travail tels que ceux décrits ici. Ce rapport se concentre sur un assemblage de transcriptome de novo et des flux de travail différentiels d'analyse de l'expression des gènes, et traite en outre des meilleures pratiques associées au développement et à la réalisation d'analyses bioinformatiques. Une explication de la mission plus large de CyVerse ( http://www.cyverse.org/about ) et des descriptions détaillées de plate-forme ( http://www.cyverse.org/learning-center ) sont publiquement disponibles. Toutes les analyses décrites ici utilisent Discovery Environment 4 (DE) et Atmosphere 5 , et sont présentées de manière à les rendre accessibles aux chercheurs de tous les niveaux de calcul. DE workflows et AtmosphLes images peuvent être référencées directement à l'aide d'URL pour assurer la provenance, la réutilisation et la reproductibilité à long terme.