5 февраля 2014 г.
Здесь мы опишем шаг за шагом трубопровод для генерации надежных филогении из наборов данных последовательности нуклеотидов или аминокислот. Это руководство стремится служить исследователей или студентов новых к филогенетического анализа.
Общая цель данной статьи — реконструировать достоверное филогенетическое дерево на основе последовательностей ДНК или белков. Это достигается путем первоначального поиска сходных последовательностей с помощью программ blast в NCBI. Вторым шагом является выравнивание сходных последовательностей.
Затем на основе выравнивания определяется наиболее подходящая модель эволюции. Заключительным этапом является восстановление филогенетических связей по выровненным последовательностям. В конечном итоге этот пошаговый алгоритм демонстрирует, как пользователи могут пройти путь от данных о последовательностях до построения достоверных филогенетических деревьев.
Данный метод позволяет ответить на ключевые вопросы в различных областях исследований путем определения идентичности и функции новых последовательностей. Чтобы воспользоваться онлайн-версией базового инструмента локального выравнивания последовательностей (blast), перейдите на веб-сервер Blast Национального центра биотехнологической информации (NCBI). Выберите соответствующую программу blast.
Введите текстовую последовательность в формате FASTA, подобную представленной здесь, в поле запроса. Выберите подходящую программу BLAST для поиска, а затем нажмите кнопку blast. По умолчанию результат выводится в формате HTML и отображает последовательности, наиболее сходные с введенной текстовой последовательностью.
В следующем разделе рассматривается использование локального исполняемого файла blast в ОС Windows. Пользователи могут перейти к следующему разделу под названием Blast Local executables for Macs x. Чтобы запустить командную строку blast на компьютере с Windows, загрузите соответствующий исполняемый файл для Windows с веб-сайта NCBI blast.
После установки программы Blast настройте переменные среды ПК следующим образом: нажмите кнопку «Пуск» и щелкните правой кнопкой мыши по пункту «Компьютер». Затем выберите «Свойства». В открывшемся окне перейдите в «Дополнительные параметры системы» и на вкладке «Дополнительно» в появившемся окне нажмите кнопку «Переменные среды».
Затем в разделе пользовательских переменных (user variables) нажмите кнопку «new». В появившемся окне введите имя переменной «path» и значение переменной, указанное здесь. Далее скачайте предварительно отформатированную базу данных BLAST, которые ежедневно обновляются на сайте NCBI, или геном конкретного организма.
Затем откройте командную строку MS DOS, нажав «Пуск» и введя CMD в строке поиска, и перейдите в папку NCBI blast. Создайте базу данных с помощью команды Make blast DB, показанной здесь. Создайте запрос белковой последовательности под названием test, вставив текстовую последовательность белка в формате FASTA в папку DB.
Затем, чтобы определить наиболее похожие последовательности на тестируемый белок, выполните запрос к базе данных с помощью команды blast P. В следующем разделе эта информация приведена для пользователей Mac. Пользователи Windows могут перейти сразу к разделу пять «Создание множественного выравнивания последовательностей».
Для запуска командной программы blast на Mac скачайте соответствующий исполняемый файл для MAC, получив удаленный доступ к сайту N-C-B-I-F-T-P. Для этого откройте Finder и найдите программу «Терминал»; в окне терминала введите FTP-адрес сайта N-C-B-I-F-T-P. Введите anonymous в качестве имени пользователя и пароля, а затем введите CD blast slash executables slash latest.
Выведите список исполняемых файлов, введя команду LS, и загрузите последнюю версию, соответствующую требованиям вашей системы, введя следующее. Теперь распакуйте загруженные файлы. Добавьте путь к исполняемым файлам blast в переменную PATH, чтобы оболочка могла выполнять поиск в этом каталоге.
Для поиска команд загрузите предварительно отформатированную базу данных BLAST или геном с веб-сайта NCBI. Найдите каталог геномов, введя CD genomes. Затем загрузите интересующий вас геном или последовательность следующим образом, после чего введите quit для выхода с FTP-сайта.
Затем создайте базу данных, введя инструкцию Make Blast DB. Поместите запрос в формате FASTA в папку bin и выполните поиск по базе данных с помощью команды blast P query, чтобы найти последовательность, наиболее схожую с данными тестовой последовательности; одной из наиболее часто используемых программ для множественного выравнивания последовательностей (MSA) является T-Coffee. После ввода данных последовательности в формате FASTA в поле запроса на сайте T-Coffee, в выходных данных схожие остатки будут отмечены цветовой кодировкой.
Еще одной широко используемой программой для множественного выравнивания последовательностей (MSA) является Clustal MSA, которую можно скачать в виде консольной версии CLUSTAL W или графической версии CLUSTAL X для различных операционных систем. Далее загрузите данные в программу Clustal в виде текстового файла с отформатированными последовательностями, выбрав вкладку «File», а затем нажав кнопку «Load Sequences».
Теперь перейдите на вкладку align и нажмите кнопку do complete alignment, чтобы выровнять последовательности для построения оптимальной модели эволюции. Загрузите программу ProtTest. После загрузки ProtTest дважды щелкните по иконке программы.
После запуска программы Protest нажмите кнопку «select file» в окне выравнивания, чтобы загрузить данные последовательностей. Затем нажмите «start» для запуска анализа. По завершении работы программа укажет оптимальную модель на основе критериев вывода последовательностей.
После загрузки и запуска Phi ML загрузите входную последовательность в виде файла с последовательностью в формате lip, введя имя файла и PY. Затем запустите программу, введя y. После загрузки программы для байесовского вывода с веб-сайта Mr Bays запустите программу, щелкнув по исполняемому файлу. Затем считайте в программу данные последовательности в формате Nexus, введя execute имя файла dot NEX.
Затем задайте эволюционную модель и выберите количество поколений для запуска. После выполнения анализа с помощью команды mc mc суммируйте деревья с помощью команды sum T, чтобы просмотреть филогенетическое дерево. Загрузите программу для визуализации деревьев.
В заключение следует отметить, что постоянно выходят новые программные обеспечения, направленные на улучшение выравнивания, прогнозирование сходства или построение филогенетических деревьев. Хотя в данном видео был представлен обзор популярных программ, зрителям рекомендуется изучить и другие доступные варианты. Алгоритм blast выполняет локальное выравнивание, которое ищет короткие участки сходства последовательностей.
После того как алгоритм найдет все возможные участки из запрашиваемой последовательности и максимально расширит эти последовательности, он приступит к сборке выравниваний. Для каждой пары запрашиваемых последовательностей значение e указывает на статистическую значимость совпадения. Чем ниже значение E, тем значимее результат поиска.
Например, выравнивание последовательностей со значением E = 0.05 означает, что вероятность случайного возникновения такого совпадения составляет пять из 100. Показатель BIT использует определенную матрицу весов для оценки качества выравнивания. Чем выше показатель BIT, тем качественнее выравнивание.
Множественное выравнивание последовательностей или MSA представляет собой выравнивание трех или более первичных последовательностей, состоящих из аминокислот, ДНК или РНК. Результат работы программы MSA tea coffee, представленный здесь, содержит цветовую кодировку схожих остатков. Здесь показан пример выравнивания шести белковых последовательностей, выполненного с помощью Cluster X, для выравнивания аминокислот.
Программа Protest используется для определения наиболее подходящих моделей замены аминокислот. В процессе работы программа перечисляет анализируемые модели, а по завершении выводит наиболее подходящую из них. PhiML оценивает филогении методом максимального правдоподобия на основе выравниваний нуклеотидных или аминокислотных последовательностей. Она включает большое количество моделей замещения в сочетании с различными вариантами поиска в пространстве топологий деревьев.
Программа Mr.Bayes использует байесовский вывод CMC в нескольких эволюционных моделях для реконструкции филогенетических связей. После запуска программы можно отслеживать прогресс через определенные интервалы, как показано здесь. После генерации филогенетического дерева необходимо визуализировать его топологию.
На этом рисунке в окне представления в виде дерева показан пример дерева белков из базы данных fly.Base. Представление в виде дерева включает редактор деревьев, который позволяет пользователю перемещать ветви и изменять маршрутизацию деревьев. При выполнении этой процедуры важно не забывать внимательно изучать руководства пользователя для каждой программы.
Данный протокол служит практической отправной точкой, чтобы познакомить читателя с принципами работы этих программ. Тем не менее, я рекомендую читателю самостоятельно изучить и протестировать многочисленные настройки, доступные в каждой из программ.
Просмотрите полный транскрипт и получите доступ к тысячам научных видео
В данной статье представлен пошаговый алгоритм построения достоверных филогенетических деревьев на основе последовательностей ДНК или белков. Руководство предназначено для исследователей и студентов, начинающих изучать филогенетический анализ.
Филогенетический анализ позволяет проводить валидацию мишеней и снижение механистических рисков на ранних этапах поиска за счет определения функциональной идентичности и эволюционных связей новых последовательностей. Данный рабочий процесс повышает прогностическую достоверность при идентификации перспективных соединений-лидеров, уточняя биологический контекст и снижая неопределенность при проверке гипотез о мишенях. Он служит трансляционным связующим звеном между данными о последовательностях и функциональной аннотацией, что позволяет эффективно проводить сортировку портфеля проектов и принимать обоснованные решения о продвижении разработок с учетом рисков.
Данный метод интегрируется в общий цикл разработки препаратов — от идентификации мишени до оптимизации ведущих соединений, позволяя проводить проверку гипотез, снижать биологические риски и создавать прогностические модели на основе эволюционных связей.