$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
O Homo sapiens e várias espécies-chave de animais como Drosophila melanogaster , Mus musculus e Danio rerio representam a maioria do trabalho genômico funcional atual e passado. No entanto, o custo rapidamente decrescente da tecnologia de sequenciamento de alto rendimento está proporcionando oportunidades para a genômica funcional em espécies animais não-modelo ( também conhecidas como "negligenciadas" ou "subatendidas") 1 . Esta é uma transição importante na genômica, uma vez que os organismos não-modelo freqüentemente representam espécies economicamente relevantes ( por exemplo , ostras, camarão, caranguejo) e oferecem oportunidades para investigar novos fenótipos e sistemas biológicos fora do escopo daqueles encontrados em espécies-modelo.
Embora os organismos subatendidos apresentam uma oportunidade atraente para investigar sistemas biológicos únicos, vários desafios enfrentam os pesquisadores particularmente durante a análise bioinformática. Alguns dosOs desafios são inatos ao processamento de grandes conjuntos de dados, enquanto outros resultam da falta de recursos genéticos disponíveis para os pesquisadores que trabalham em organismos subatendidos, como um genoma de referência, ontologias específicas de organismos, etc. Os desafios do isolamento e seqüenciamento de ácidos nucleicos são freqüentemente rotineiros. Comparação com os da análise de dados, e como tais análises bioinformáticas geralmente revela-se o custo mais subestimado de projetos de seqüenciamento 2 . Por exemplo, uma análise bioinformática de sequenciação básica de próxima geração pode consistir nas seguintes etapas: filtragem de qualidade e corte de leituras em seqüência em bruto, montagem de leituras curtas em peças contíguas maiores e anotação e / ou comparações com outros sistemas para obter entendimento biológico. Embora aparentemente simples, este fluxo de trabalho de exemplo requer conhecimento especializado e recursos computacionais além do escopo de um computador de laboratório, colocando-o fora do alcance de muitos cientistas estudando não-Organismos-modelo.
Os desafios inerentes podem ser baseados na infra-estrutura ou no conhecimento. Um desafio clássico da infra-estrutura é o acesso a recursos computacionais apropriados. Por exemplo, a montagem ea anotação dependem de algoritmos computacionalmente intensivos que exigem computadores poderosos ou clusters de computadores, com grande quantidade de RAM (256 GB-1 TB) e vários processadores / núcleos para serem executados. Infelizmente, muitos pesquisadores não têm acesso a tais recursos de computação ou não têm o conhecimento necessário para interagir com esses sistemas. Outros pesquisadores podem ter acesso a clusters de computação de alto desempenho por meio de suas universidades ou instituições, mas o acesso a esses recursos pode ser limitado e às vezes resulta em encargos por hora computacional, ou seja , o número de processadores de CPU multiplicado pelo número de clock Horas "que esses processadores estão em execução. Aproveitando um sistema de infra-estrutura cibernética financiado pela US National Science Foundation sComo o CyVerse 3, que oferece acesso gratuito aos recursos de computação para pesquisadores, nos Estados Unidos e em todo o mundo, pode ajudar a aliviar os desafios de infra-estrutura, como será demonstrado aqui.
Um exemplo de um desafio típico baseado no conhecimento é entender o software necessário para análises completas. Para efetivamente realizar um projeto baseado em seqüenciamento, os pesquisadores precisam estar familiarizados com a miríade de ferramentas de software que foram desenvolvidas para análises bioinformáticas. Aprender cada pacote é difícil por si só, mas é exacerbado pelo fato de que os pacotes estão constantemente sendo atualizados, rereleased, reunidos em novos fluxos de trabalho, e às vezes ficam restritos para uso sob novas licenças. Além disso, ao vincular as entradas e saídas dessas ferramentas, às vezes, é necessário transformar os tipos de dados para torná-los compatíveis, adicionando outra ferramenta ao fluxo de trabalho. Finalmente, também é difícil saber qual é o pacote deE melhor "para uma análise, e freqüentemente identificar o melhor software para determinadas condições experimentais é uma questão de sutis diferenças. Em alguns casos, as revisões úteis do software estão disponíveis, mas devido à liberação contínua de atualizações novas e de opções do software, estas rapidamente saem da data.
Para os pesquisadores que investigam organismos subatendidos, esses desafios inatos vêm além dos desafios associados à análise de dados em um novo organismo. Esses desafios específicos do organismo mal atendidos são melhor ilustrados durante a anotação do gene. Por exemplo, os organismos subatendidos frequentemente não têm um organismo modelo estreitamente relacionado que possa ser razoavelmente utilizado para identificar a ortografia e a função dos genes ( por exemplo, invertebrados marinhos e Drosophila ). Muitas ferramentas bioinformáticas também exigem "treinamento" para identificar motivos estruturais, que podem ser usados para identificar a função do gene. No entanto, os dados de treinamento normalmente só estão disponíveis para modOs organismos e formação de modelos de Markov ocultos (HMMs) está fora do âmbito de biólogos, e até mesmo muitos bioinformáticos. Por fim, mesmo se as anotações podem ser realizadas usando dados de organismos modelo, algumas ontologias de genes associadas a organismos modelo não fazem sentido quando a biologia ea história natural do organismo subatendido é considerada ( por exemplo , transferindo informações de Drosophila para camarão).
À luz desses desafios, os recursos bioinformáticos precisam ser desenvolvidos com pesquisadores que realizam análises de novo sobre os organismos carentes especificamente em mente. Os próximos anos de projetos de sequenciação de genômica funcional ajudarão a reduzir o hiato entre os organismos modelo e subatendidos ( https://genome10k.soe.ucsc.edu/ ), mas há muitas ferramentas que precisarão ser desenvolvidas para enfrentar os desafios Consideradas acima. CyVerse é dedicado à criação de ecossistemas de iA interoperabilidade ligando a infra-estrutura existente e as aplicações de terceiros para fornecer gerenciamento de dados, ferramentas de análise bioinformática e visualizações de dados para cientistas de vida. A interoperabilidade ajuda a suavizar as transições entre aplicações e plataformas bioinformáticas fornecendo recursos computacionais escaláveis e limitando as conversões de formatos de arquivos ea quantidade de dados transferidos entre plataformas. CyVerse oferece várias plataformas, incluindo o Discovery Environment (DE 4 , Atmosphere 5 e Data Store 3. O DE é baseado na web e tem muitas ferramentas analíticas bioinformáticas comuns convertidas em formatos user-friendly point-and-click "), E é a interface gráfica do usuário (GUI) para o armazenamento de dados onde os grandes conjuntos de dados ( ou seja , leituras de seqüenciamento em bruto, genomas montados) são armazenados e gerenciados.A atmosfera é um serviço de computação em nuvem que oferece aos pesquisadores maior flexibilidade paraUsando recursos computacionais da Máquina Virtual, que possuem uma ampla gama de ferramentas bioinformáticas pré-instaladas. Ambas as plataformas estão vinculadas ao Data Store e podem ser usadas em conjunto para criar fluxos de trabalho como o descrito aqui. Este relatório centra-se em um novo transcriptome assembly e análise diferencial expressão genética workflows, e ainda aborda algumas das melhores práticas associadas ao desenvolvimento e realização de bioinformática análises. Uma explicação da missão mais ampla do CyVerse ( http://www.cyverse.org/about ) e descrições detalhadas da plataforma ( http://www.cyverse.org/learning-center ) estão publicamente disponíveis. Todas as análises aqui descritas utilizam o Ambiente de Descoberta 4 (DE) e Atmosfera 5 , e são apresentadas de forma a torná-las acessíveis a investigadores de todos os níveis computacionais. DE workflows e AtmosphEre imagens podem ser referenciadas diretamente usando URLs para garantir proveniência a longo prazo, reutilização e reprodutibilidade.