April 8th, 2017
Galaxy и DAVID появились в качестве популярных инструментов, которые позволяют следователям без подготовки биоинформатики для анализа и интерпретации РНК-Seq данных. Мы опишем протокол для C. Элеганс исследователей проводить РНК-Seq экспериментов, доступ и обрабатывать набор данных с помощью Galaxy и получить значимую биологическую информацию из списков генов с использованием DAVID.
Общая цель этого протокола — помочь исследователям C.elegans, не имеющим опыта в области биоинформатики, провести эксперимент по секвенированию РНК и проанализировать данные с помощью платформы открытого доступа Galaxy. Этот метод может помочь в анализе сложных данных секвенирования с высоким уровнем, чтобы получить представление о транскриптомных сигнатурах, стоящих за фенотипами у C.elegans. Основное преимущество этого метода заключается в том, что он позволяет ученым, не имеющим предварительного образования в области биоинформатики, анализировать исходные данные секвенирования и создавать список дифференциально экспрессируемых генов, а также связанные с ними термины онтологии генов.
Несмотря на то, что этот метод специально ориентирован на нюансы данных секвенирования C.elegans, он также может быть применен к другим организмам и биологическому контексту, где необходимо изучить ключевые изменения транскрипции геномов. В этом видео рассказывается об использовании конвейера Galaxy в Интернете. Если возможно, запустите рабочий процесс локально.
Скачайте и установите Galaxy в соответствии с инструкциями на странице wiki. После использования руководства «Начни здесь», представленного на главной странице Galaxy, посмотрите это видео. Для пользователя крайне важно ознакомиться и сориентироваться в пользовательском интерфейсе Galaxy и инструментах, используемых в рабочем процессе.
Для начала нажмите «Анализировать данные» на панели заголовка, чтобы получить доступ к главному виду анализа. Индикатор выполнения в правом верхнем углу отслеживает, сколько места на диске было использовано. Затем откройте меню инструментов на левой панели и нажмите на «Анализ РНК NGS».
Это дает возможность использовать все инструменты, необходимые для анализа данных о последовательностях РНК. Теперь приступаем к новому анализу истории. Перейдите на панель истории справа.
Нажмите на значок шестеренки и выберите опцию «Создать новый» во всплывающем меню. Затем укажите имя в разделе «История», чтобы идентифицировать анализ. Чтобы продолжить, перейдите в меню «Инструменты» и в разделе «Получить данные» нажмите на функцию «Загрузить файл», чтобы загрузить необработанные файлы быстрой очереди.
После того, как задача откроется в интерфейсе анализа, нажмите на кнопку «Выбрать локальный файл» или выберите «FTP-файл» для перехода и выбора соответствующих данных последовательности. По умолчанию Galaxy автоматически определяет тип файла. Затем выберите организм из выпадающего меню, которым в данном случае является C.elegans.
Затем нажмите «Начать», чтобы начать загрузку данных. После загрузки файла действие сохраняется на панели истории, с которой можно выбрать данные и получить к ним доступ. Теперь преобразуйте файлы из формата быстрой очереди по одному в формат Fast Queue sanger, открыв меню контроля качества и манипуляций NGS, выбрав Fast queue Groomer, выбрав файл под файлом для очистки.
Выберите подходящий тип быстрых оценок быстрого равенства и запустите инструмент с параметрами по умолчанию. Теперь файл данных можно анализировать. Обратите особое внимание на форматы файлов и параметры тестирования, используемые во всем протоколе.
Эти знания ценны для устранения неполадок, неудачных тестов и других проблем. Прежде чем продолжить, можно использовать тесты контроля качества. Подробная информация об их запуске представлена в текстовом протоколе.
Как только файл будет готов к анализу, сопоставьте данные секвенирования, сначала открыв раздел анализа NGS RNA, а затем щелкнув по инструменту Top Hat. В выпадающем меню заполните ответ на вопрос: это одиночные или парные конечные данные? Далее выберите подходящий файл быстрой очереди.
Выберите «Использовать встроенный геном» в следующем раскрывающемся меню и выберите эталонные данные генома C.elegans. Выберите значение по умолчанию для всех остальных параметров и нажмите кнопку Выполнить. Чтобы оценить относительное обилие транскриптов в наборе данных, выберите инструмент «Запонки» в разделе анализа NGS РНК и из первого выпадающего меню выберите сопоставленные принятые хиты в формате BAM, полученный в результате Top Hat Analysis.
Во втором выпадающем меню установите аннотацию ссылки на файл GTF, содержащий текущие данные генома. Когда появится опция «Выполнить коррекцию смещения», выберите «Да» и запустите задачу с настройками по умолчанию. Затем в меню анализа NGS РНК откройте инструмент cuff merge, чтобы объединить собранные транскрипты, полученные для всех образцов последовательности РНК.
В первом окне инструмента загружаются все файлы GTF, созданные с использованием запонок на предыдущем шаге. Теперь выберите собранный файл транскриптов для каждого из тестируемых штаммов или условий, включая биологические реплики одного и того же штаммового состояния. Выберите Yes для аннотации к справочнику пользователя и выберите файл данных эталонного генома.
Затем выберите «Да» для параметра «Использовать данные последовательности». Это позволит автоматически обнаружить и выбрать подходящий референсный геном. Оставьте все остальные параметры по умолчанию и нажмите «Выполнить».
Будет создан один файл GTF. Чтобы сравнить несколько штаммов или состояний, вернитесь в раздел анализа РНК NGS и выберите инструмент cuff div. Затем в меню расшифровок в инструменте cuff div выберите объединенный выходной файл из cuff merge.
Затем введите метки для двух условий. Для каждого условия перейдите в раздел репликации и выберите отдельные принятые выходные файлы из верхнего шляпа, которые соответствуют различным биологическим репликам этого состояния. Чтобы выбрать несколько файлов одновременно, удерживайте нажатой клавишу Command или Control.
После выбора файлов используйте настройки параметров по умолчанию и нажмите «Выполнить», чтобы запустить задачу. Загрузите дифференциально выраженные данные, щелкнув значок сохранения в окне тестирования дифференциального гена, созданном на панели истории. Для начала зайдите на сайт Дэвида.
В шапке веб-страницы выберите «Начать анализ». Скопируйте список генов, полученных из Galaxy, в поле А и в этом примере выберите идентификатор гена в качестве базового гена червя. Затем в разделе «Тип списка» в третьем вопросе выберите список генов и нажмите на значок отправки списка. Теперь откроется домашняя страница мастера анализа, из которой можно выбрать задачи Дэвида.
В этом видеосюжете описаны некоторые из этих вариантов. Во-первых, выберите кластеризацию функциональных аннотаций, чтобы перейти на страницу сводки. Оставьте настройки категорий аннотаций по умолчанию и нажмите на кластеризацию функциональных аннотаций.
Этот вариант генерирует кластеры похожих терминов аннотаций, ранжированных по их баллу обогащения. Теперь вернитесь к мастеру анализа и выберите опцию диаграммы функциональных аннотаций, чтобы определить значительно перепредставленные биологические термины, связанные со списком генов. Ценной функцией Дэвида является возможность создания таблицы функциональных аннотаций.
В нем перечислены все аннотации, связанные с генами, без каких-либо статистических расчетов. Это может быть полезно для погенного анализа и для поиска конкретных генов, представляющих интерес. Еще одним полезным инструментом Дэвида для обзора является функциональная классификация генов.
Этот вариант разделяет гены в список функционально связанных групп, ранжированных по их степени обогащения. Описанный протокол был использован для идентификации генов, экспрессия которых модулируется tcer-1 после потери зародышевой линии. Транскриптом долгоживущих мутантов glp-1 из списка зародышевой линии сравнивали с двойными мутантами tcer-1 glp-1, которые перечислены в нашей зародышевой линии, но не демонстрируют увеличения продолжительности жизни.
Проверка качества последовательностей не выявила плохого качества чтения, содержание GC от 48 до 49% и постоянную длину чтения последовательности в 51 пару оснований. Покрытие генома образцов было оценено в 7-11 раз. Galaxy позволил объединить данные NGS от двух реплик каждого штамма и выполнить дифференциальный анализ для создания списков генов, выделяющих профиль экспрессии всего генома.
В целом, 835 генов были дифференциально экспрессированы между двумя штаммами с использованием значения P, равного 0,05. Функциональный анализ аннотаций вышерегулируемых генов выявил четыре кластера аннотаций с высокими показателями обогащения. Самый высокий уровень включает гены цитохрома Р450 и ксенобиотикового ответа, за которыми следуют гены, участвующие в модификациях липидов.
Функциональная кластеризация аннотаций для пониженных регулируемых целей также выявила разнообразие кластеров аннотаций. К ним относятся кластеры, обогащенные цитоскелетной функцией, положительной регуляцией роста, размножения и старения. Конвейер Galaxy проложил путь исследователям в широком спектре биологических дисциплин для быстрого и эффективного анализа крупномасштабных изменений экспрессии генов.
После просмотра этого видео вы сможете провести эксперимент по поиску РНК и проанализировать исходные данные секвенирования с высоким уровнем с помощью конвейера Galaxy. Вы также должны иметь возможность извлекать биологически значимую информацию из данных Galaxy с помощью платформы David.
View the full transcript and gain access to thousands of scientific videos
Этот протокол помогает исследователям C.elegans в проведении экспериментов по секвенированию РНК и анализу данных с использованием платформы Galaxy. Он позволяет людям без подготовки в области биоинформатики эффективно интерпретировать сложные данные секвенирования.
Accessible transcriptomic analysis platforms like Galaxy enable discovery teams to interrogate gene expression changes without requiring deep bioinformatics expertise, accelerating early-stage target validation and mechanistic de-risking. By streamlining RNA-Seq data processing and functional annotation, this workflow supports rapid hypothesis testing and portfolio triage in model systems such as C. elegans. The approach enhances reproducibility and scalability for both novice and experienced R&D teams handling small-scale transcriptomic studies.
This workflow positions RNA-Seq analysis from raw data through differential expression and functional annotation within the early discovery to preclinical continuum, supporting both target validation and mechanistic studies.