9 мая 2017 г.
Этот протокол описывает сравнительный рабочий процесс сборки и аннотирования транскриптома de novo для начинающих биоинформатиков. Рабочий процесс доступен бесплатно полностью через CyVerse и подключен к хранилищу данных. Используются командная строка и графические пользовательские интерфейсы, но весь необходимый код доступен для копирования и вставки.
Общая цель этой процедуры заключается в оценке, сборке, аннотировании и сравнении дифференциальной экспрессии генов с помощью транскриптомики De Novo, начиная с необработанных файлов FASTQ. Этот метод может помочь ответить на вопросы сравнительной и молекулярной биологии, в том числе о том, какие транскрипты находятся внутри организма, что эти транскрипты делают внутри этих организмов и каковы различия между экспериментальными условиями. Основное преимущество этой методики заключается в том, что она обеспечивает интерактивную среду.
Он предоставляет вычислительные ресурсы по требованию и позволяет исследователям немедленно приступить к анализу данных RNA-Seq. Этот метод особенно полезен для исследователей, сравнивающих эксперименты в одном организме, который включает в себя множество тканей, условий, временных точек, чтобы понять, как изменяются биологические системы. Этот метод ориентирован на немодельные организмы без геномов, но также может быть применен к организмам с доступными сборками генома, даже к тем, у которых в сборке десятки или сотни тысяч скаффолдов.
Для начала получите доступ к Atmosphere в среде Discovery. Запросите бесплатную учетную запись CyVerse, перейдя на страницу регистрации. Используйте адрес электронной почты учреждения для регистрации учетной записи.
Затем перейдите на вкладку «Приложения и сервисы» и запросите доступ к Atmosphere. Доступ к среде обнаружения предоставляется автоматически. Войдите в среду обнаружения, сокращенно DE. Затем выберите вкладку Данные, чтобы открыть меню, содержащее все папки в хранилище данных.
Создайте основную папку проекта, в которой будут храниться все данные, связанные с проектом. Найдите панель инструментов в верхней части окна данных и выберите «Файл», «Новая папка». Не используйте пробелы или специальные символы в именах папок или любых выходных файлах ввода.
Вместо этого используйте символы подчеркивания или тире там, где это уместно. Загрузите необработанные файлы последовательности FASTQ и папку 1_Raw_Sequence в подпапку под названием Folder A_Raw_Reads. Для файлов размером менее двух гигабит используйте простую функцию загрузки хранилища данных, чтобы перейти к панели инструментов окна данных, нажав кнопку «Данные» на главном рабочем столе DE.
Выберите «Загрузить», «Простая загрузка с рабочего стола». Затем нажмите кнопку «Обзор», чтобы перейти к необработанным файлам секвенирования FASTQ на локальном компьютере. Оценивайте загруженные необработанные чтения секвенирования с помощью приложения FastQC в DE. Нажмите кнопку «Приложения» на главном рабочем столе DE, чтобы открыть окно, содержащее все аналитические приложения, доступные в DE. Найдите в окне инструмент FastQC на панели инструментов поиска в верхней части окна.
Откройте многофайловую версию, если в ней более одного файла FASTQ. Выберите «Файл» и создайте новую папку, затем выберите эту папку в качестве выходной папки. Загрузите файлы чтения FASTQ в окно инструмента «Выбрать входные данные» и выберите «Запустить анализ».
Найдите программируемое приложение Trimmomatic в DE и откройте его. Загрузите папку с необработанными файлами чтения FASTQ в раздел настроек. Выберите, являются ли файлы секвенирования одиночными или парными.
Используйте стандартный файл управления, нажав кнопку «Обзор» и вставив путь к файлу в поле просмотра. Выберите файл управления Trimmomatic и запустите анализ. Для чтения последовательности качественной обрезки найдите и откройте приложение Sickle в DE. Выберите обрезанные операции чтения FASTQ в качестве входных операций чтения и переименуйте выходные файлы.
Включите настройки качества в опции. Откройте самую последнюю версию экземпляра Atmosphere, перейдя на вики-страницу. Выберите ссылку для самой последней версии изображения Троицы и Тринотата.
Нажмите кнопку «Войти для запуска», а затем присвойте экземпляру Atmosphere имя. Выберите размер экземпляра medium3 или large3. Запустите экземпляр и дождитесь его сборки.
Если изображение Atmosphere не запускается, вы можете попробовать подать заявку на меньший экземпляр или подать заявку на Jetstream для большего распределения. Все подробности есть в сопутствующей вики. Переместите выходные файлы Trinity в папку 3_Assembly в DE и пометьте папку A_Trinity_de_novo_assembly.
Запуск Trinity требует знаний командной строки и нескольких дней или, возможно, недель для выполнения больших анализов. Существуют бесплатные ресурсы, ссылки на которые приведены на вики, чтобы помочь разобраться в командной строке. Дайте каждому собранному транскриптому вложенную папку внутри папки A_Trinity_de_novo_assembly.
Используйте уникальные имена, включая научные названия организмов и методов лечения, связанных с каждым транскриптомом, а затем создайте еще одну вложенную папку под названием Folder B_rnaQUAT_Output в папке 3_Assembly. Откройте приложение под названием De Novo rnaQUAST. Присвойте анализу имя и выберите Папка B_rnaQUAST_Output в качестве выходной папки.
Найдите декодер расшифровки и запустите трансдекодер на выходном fasta файле De Novo Trinity Assembly в среде обнаружения. Откройте приложение deseq2 в DE.Name анализа и выберите папку вывода в качестве 4_Differential_Expresssion. В разделе Ввод выберите файл таблицы счетчиков из прогона Trinity Assembly.
Кроме того, выберите столбец, в котором можно найти имена контигов. Введите заголовки столбцов из файла таблицы данных счетчиков, чтобы определить, какие столбцы сравниваются. Поставьте запятые между каждым из условий.
Не включайте заголовок первого столбца, содержащий имена контигов. Для реплик повторяйте одно и то же имя. Во второй строке укажите названия двух сравниваемых условий.
Сопоставьте названия заголовков столбцов, указанные в первой строке. Здесь показано систематическое сравнение прочтений секвенирования после каждого этапа предварительной обработки. После обрезки чтение должно иметь меньшее искажение содержимого GC и содержимого последовательности, а также большую долю чтения с высокой оценкой качества.
Высокое качество чтения необходимо для сборки транскриптомов De Novo. Результаты быстрого контроля качества зависят от организмов и секвенируемых образцов. Однородность всех образцов, которые будут сравниваться на последующих этапах, является основной целью предварительной обработки чтений.
rnaQUAST использует код boost для создания сводной статистики о сборках на основе известных основных генов в таксономических кладах. Точность ассемблеров проявляется в количестве несоответствий в каждом транскрипте и в том, сколько транскриптов соответствует каноническим генам. Последние четыре подграфика, представленные здесь, предоставляют сводную статистику длины контига и изоформы, а также охват ожидаемых изоформ.
NAx представляет собой процент контигов с длиной длиннее оси y. Собранная дробь — это самая длинная одиночная собранная транскрипт, деленная на ее длину. В то время как покрытая дробь — это процент изоформ полностью собранного транскрипта, как ожидается по основным прокариотическим или эукариотическим генам из BUSCO.
После просмотра этого видео у вас должно сложиться хорошее представление о том, как собирать и вводить транскрипции. Кроме того, этот протокол позволит вам обнаружить дифференциальную экспрессию генов между двумя состояниями. Как правило, люди испытывают трудности с биоинформационными пакетами, потому что их очень много, с ними связано множество настроек и переменных, и обычно для их выполнения требуется знание командной строки.
Важно пометить и упорядочить входные данные и результаты анализа, чтобы другие исследователи могли понять, что было сделано. Вы должны указать, какие шаги заказа были выполнены, версии программы и информацию об образце. Кроме того, опустите пробелы в именах папок или файлов.
Новые инструменты и новые версии инструментов постоянно интегрируются, но старые версии инструментов также сохраняются. Все изменения будут записаны в сопутствующей вики. После этой процедуры могут быть выполнены другие биоинформатические методы, такие как сетевой анализ, обогащение ГО и идентификация метаболических путей, чтобы помочь ответить на такие вопросы, как вариация фенотипа, условия, которые изменяют профили экспрессии, и идентификация генов, представляющих интерес для функциональной геномики.
В данном протоколе описан рабочий процесс сборки и аннотации транскриптома de novo, разработанный для биоинформатиков-новичков. Он предоставляет интерактивную среду для анализа данных RNA-Seq, доступную через CyVerse.
Данный рабочий процесс позволяет научно-исследовательским группам в области биофармацевтики получать высококачественные транскриптомные данные немодельных организмов, что способствует валидации мишеней в малоизученных биологических системах. Предоставляя интерактивную облачную среду для сборки de novo и анализа дифференциальной экспрессии, этот метод снижает барьеры для механистического снижения рисков на ранних этапах поиска. Данный подход повышает достоверность прогнозов при изучении специфических для конкретного организма ответов на экспериментальные воздействия, что помогает в приоритизации портфеля разработок.
Данный метод вписывается в континуум ранних этапов поиска, обеспечивая проверку гипотез и уточнение путей передачи сигналов перед началом работ по идентификации ведущих соединений.