$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Homo sapiens и несколько ключевых модельных видов животных, таких как Drosophila melanogaster , Mus musculus и Danio rerio, представляют собой большую часть текущей и прошлой функциональной работы по геномике. Однако стремительно снижающаяся стоимость технологии высокопроизводительной последовательности обеспечивает возможности для функциональной геномики в немодельных ( так называемых, «забытых» или «недостаточно обслуживаемых») видах животных1. Это важный переход в геномике, поскольку немодельные организмы часто представляют экономически значимые виды ( например, устрицы, креветки, крабы) и дают возможность исследовать новые фенотипы и биологические системы, выходящие за рамки тех, что найдены в модельных видах.
Хотя недостаточно обслуживаемые организмы представляют собой привлекательную возможность для исследования уникальных биологических систем, перед исследователями, особенно во время биоинформационного анализа, стоит ряд проблем. Некоторые изПроблемы связаны с обработкой больших массивов данных, в то время как другие связаны с отсутствием генетических ресурсов, доступных для исследователей, работающих в таких недостаточно обслуживаемых организмах, как эталонный геном, онтологию, специфичную для организма и т . Д. Проблемы изоляции и секвенирования нуклеиновых кислот часто являются рутинными в Сравнение с анализом данных, и как таковой биоинформационный анализ, как правило, оказывается наиболее недооцененной стоимостью проектов по определению последовательности. 2 . Например, базовый биоинформационный анализ последующего поколения может состоять из следующих этапов: фильтрация качества и обрезка необработанных последовательностей считывания, сборка коротких чтений в более крупные непрерывные фрагменты и аннотация и / или сравнение с другими системами для получения биологического понимания. Несмотря на кажущуюся простоту, этот примерный рабочий процесс требует специальных знаний и вычислительных ресурсов, выходящих за рамки лабораторного стенда, что делает его недоступным для многих ученых,Модельных организмов.
Врожденные проблемы могут быть основаны на инфраструктуре или знаниях. Классической задачей инфраструктуры является доступ к соответствующим вычислительным ресурсам. Например, сборка и аннотирование основаны на вычислительно-интенсивных алгоритмах, требующих мощных компьютеров или кластеров компьютеров, имеющих большой объем оперативной памяти (256 ГБ-1 ТБ) и несколько процессоров / ядер. К сожалению, многие исследователи либо не имеют доступа к таким вычислительным ресурсам, либо не обладают знаниями, необходимыми для взаимодействия с этими системами. Другие исследователи могут иметь доступ к высокопроизводительным вычислительным кластерам через свои университеты или учреждения, но доступ к этим ресурсам может быть ограниченным и иногда приводит к расходам за час вычислений, то есть количество процессоров процессора, умноженное на количество «часов реального времени» Часов ", что эти процессоры работают. Использование системы киберинфраструктуры, финансируемой Национальным научным фондом СШАНапример, CyVerse 3, которая обеспечивает свободный доступ к вычислительным ресурсам для исследователей в Соединенных Штатах и во всем мире, может помочь решить проблемы инфраструктуры, как будет показано ниже.
Примером типичной задачи, основанной на знаниях, является понимание программного обеспечения, необходимого для полного анализа. Чтобы эффективно проводить проект на основе последовательности, исследователи должны быть знакомы с несметным числом программных средств, разработанных для биоинформационного анализа. Изучение каждого пакета затруднено само по себе, но усугубляется тем фактом, что пакеты постоянно обновляются, повторно запускаются, объединяются в новые рабочие процессы и иногда становятся ограниченными для использования под новыми лицензиями. Кроме того, связывание входов и выходов этих инструментов иногда требует преобразования типов данных, чтобы сделать их совместимыми, добавив еще один инструмент в рабочий процесс. Наконец, также сложно узнать, какой программный пакет является «th»E best 'для анализа, и часто определение лучшего программного обеспечения для конкретных экспериментальных условий - это вопрос тонких различий. В некоторых случаях доступны полезные обзоры программного обеспечения, но из-за продолжающегося выпуска новых обновлений и опций программного обеспечения они быстро устаревают.
Для исследователей, изучающих недостаточно обслуживаемые организмы, эти врожденные проблемы вызывают помимо проблем, связанных с анализом данных в новом организме. Эти недостающие специфические для организма проблемы лучше всего иллюстрируются в аннотации гена. Например, у недостаточно обслуживаемых организмов часто нет близкородственного модельного организма, который можно разумно использовать для идентификации ортологии гена и функции ( например, морских беспозвоночных и дрозофилы ). Многие биоинформационные инструменты также требуют «обучения» для определения структурных мотивов, которые могут быть использованы для идентификации функции гена. Однако учебные данные обычно доступны только для модаЭль-организмов и обучение скрытых марковских моделей (ГММ) не входит в компетенцию биологов и даже многих биоинформатиков. Наконец, даже если аннотации могут быть выполнены с использованием данных модельных организмов, некоторые онтологии генов, связанные с модельными организмами, не имеют смысла, когда рассматривается биология и естественная история недостаточно обслуживаемого организма ( например , передача информации от дрозофилы креветкам ).
В свете этих проблем, биоинформационные ресурсы должны быть разработаны с исследователями, проводящими de novo анализы на недостаточно обслуживаемых организмах, конкретно в виду. Следующие несколько лет проектов по упорядочению функциональной геномики помогут сократить разрыв между модельными и недостаточно обслуживаемыми организмами ( https://genome10k.soe.ucsc.edu/ ), но есть много инструментов, которые необходимо будет разработать для решения проблем Рассмотренных выше. CyVerse посвящена созданию экосистемы iСвязывая существующую киберинфраструктуру и сторонние приложения для предоставления управления данными, инструментами биоинформационного анализа и визуализации данных для ученых-медиков. Интероперабельность помогает сгладить переходы между биоинформационными приложениями и платформами, предоставляя масштабируемые вычислительные ресурсы и ограничивая преобразование формата файлов и объем данных, передаваемых между платформами. CyVerse предлагает несколько платформ, в том числе среду Discovery (DE 4 , Atmosphere 5 и Data Store 3. DE имеет веб-интерфейс и имеет много общих аналитических инструментов для биоинформатики, преобразованных в удобные для пользователя форматы «наведите и нажмите» («apps» »), И является графическим пользовательским интерфейсом (GUI) для хранилища данных, где хранятся и управляются большие массивы данных ( например, чтение первичных последовательностей, собранные геномы). Atmosphere - это сервис облачных вычислений, который предлагает исследователям повышенную гибкость дляИспользуя вычислительные ресурсы виртуальной машины, которые имеют широкий набор инструментов биоинформатики, предварительно установленных. Обе эти платформы связаны с хранилищем данных и могут использоваться вместе для создания рабочих процессов, таких как описанные здесь. В этом отчете основное внимание уделено процессам анализа декомплексов de novo и дифференциального анализа экспрессии генов, а также рассматриваются некоторые лучшие практики, связанные с разработкой и проведением биоинформационных анализов. Объяснение более широкой миссии CyVerse ( http://www.cyverse.org/about ) и подробных описаний платформ ( http://www.cyverse.org/learning-center ) являются общедоступными. Все описанные здесь анализы используют среду обнаружения 4 (DE) и атмосферу 5 и представлены таким образом, чтобы сделать их доступными для исследователей всех вычислительных уровней. Рабочие процессы DE и AtmosphНа изображения можно ссылаться напрямую, используя URL-адреса, чтобы обеспечить долгосрочное прохождение, повторное использование и воспроизводимость.