3 ноября 2011 г.
Руководящие принципы для компьютерных структурные и функциональные характеристики белка использованием I-TASSER трубопровода описывается. Начиная с запросом последовательности белка, 3D-модели создаются с использованием нескольких потоков выравнивания и итерационные структурного моделирования сборки. Функциональные выводы являются после этого сделать на основе матчей белков с известной структурой и функциями.
Целью данной процедуры является компьютерное предсказание трехмерной структуры и биологической функции молекул белков на основе их аминокислотных последовательностей. Это достигается путем первоначального предсказания вторичной структуры белков с помощью машинного обучения. Затем последовательности и предсказанная вторичная структура сопоставляются с решенными структурами в библиотеке PDB для поиска наиболее подходящих структурных шаблонов.
Эта процедура называется тредингом. После выполнения трединга программа IT AER разделит шаблоны на фрагменты на основе выравниваний последовательностей шаблонов, а затем на третьем этапе повторно соберет фрагменты в полноразмерные модели. Полноатомные модели создаются путем уточнения на атомном уровне для оптимизации сетей водородных связей и устранения стерических перекрытий.
Заключительным этапом процедуры является определение биологической функции белков путем сопоставления предсказанных структур с белками с известной функцией из функциональной библиотеки. Основным преимуществом ITER перед существующими методами моделирования структур является встроенный подход к сборке структурных фрагментов, который позволяет последовательно приближать выравнивания при трединге к нативному состоянию. Эти высококачественные модели структур также служат основой для точных функциональных аннотаций на базе структур, что способствует более широкому использованию ITER в научном сообществе.
Наша лаборатория создала веб-сайт, на который можно отправлять белковые последовательности для обработки в iter. Этот сайт служит связующим звеном, через которое пользователи из любой точки мира могут получить доступ к интерфейсу компьютерного кластера, который управляет симуляциями ITER и запускает их. Одна задача симуляции ITER состоит из более чем десятка более мелких подсимуляций.
Выполнение этих симуляций на одном компьютере с одним процессорным ядром может занять более ста часов. Компьютерный кластер лаборатории Цан принимает эти подсимуляции и распределяет их между сотнями компьютеров, что позволяет запускать более 2000 симуляций. Благодаря использованию нашего компьютерного кластера мы можем ежедневно завершать сотни симуляций I taster.
Несмотря на такую мощность, предстоит проделать большую работу по оптимизации системы и минимизации времени ожидания для пользователей онлайн-сервиса IT AER. Для начала эксперимента по моделированию структуры и функции войдите на веб-страницу IT AER. URL-адреса всех соответствующих веб-страниц, обсуждаемых здесь, можно найти в письменном протоколе.
Скопируйте и вставьте аминокислотную последовательность в соответствующую форму или загрузите файл с последовательностью, нажав кнопку обзора. Укажите адрес электронной почты и название задания. Пользователи могут опционально задать внешние ограничения по контактам или расстояниям между остатками.
Добавьте дополнительный шаблон или исключите некоторые белки-шаблоны в процессе моделирования структуры. Чтобы отправить последовательность, нажмите кнопку запуска IT-taser. Проверяйте статус отправленной задачи на странице очереди IT-taser.
Перейдите на вкладку поиска и используйте идентификационный номер задания или запрашиваемую последовательность для поиска отправленного задания. После завершения моделирования структуры и функции на указанный адрес электронной почты будет отправлено уведомление, содержащее изображение предсказанных структур и веб-ссылку. Нажмите на эту ссылку, чтобы просмотреть и загрузить результаты.
Начните структурный анализ с изучения предсказания вторичной структуры, где H обозначает альфа-спираль, S — бета-слой, а C — случайный клубок. Также учитывайте показатель достоверности предсказания для каждого остатка. Найдите области с протяженными регулярными вторичными структурами, чтобы определить область ядра белка.
Структурный класс белка также можно проанализировать на основе распределения элементов вторичной структуры. Оцените прогнозируемую доступность растворителю, чтобы определить скрытые и экспонированные области. В запросе значения прогнозируемой доступности растворителю варьируют от нуля для скрытого остатка до девяти для экспонированного остатка.
Области, содержащие преимущественно скрытые остатки, могут быть использованы для определения ядра белка, в то время как области с гидрофильными остатками, экспонированными в растворитель, являются потенциальными сайтами гидратации или функциональными центрами. Чтобы просмотреть предсказанные третичные структуры исследуемого белка, прокрутите страницу вниз к интерактивному приложению JMO Appt, расположенному слева. Нажмите на приложение, чтобы изменить вид отображаемой структуры.
Увеличьте масштаб конкретной области, выберите определенные типы остатков в предсказанной модели или рассчитайте расстояния между остатками. Проанализируйте показатели достоверности структурного моделирования, чтобы оценить качество предсказанных структур. Значения Csco обычно находятся в диапазоне от -5 до 2, при этом более высокий балл указывает на более высокое качество модели.
Расчетный показатель TM-score и значение RMSD для первой модели представлены в качестве расчетной точности модели один. Перейдите по ссылке «подробнее о csco». Чтобы проанализировать размер кластера csco и плотность кластеров для всех моделей, изучите 10 лучших шаблонов трединга для искомого белка, определенных с помощью программ трединга low mets.
Прокрутите страницу результатов вниз, чтобы просмотреть нормализованный Z-показатель для анализа качества выравнивания методом трединга. Выравнивания с нормализованным значением csco более одного свидетельствуют об уверенном выравнивании и с наибольшей вероятностью имеют ту же укладку, что и белок-запрос. Оцените идентичность последовательностей в области выравнивания трединга и для всей цепи, чтобы определить степень гомологии между белком-запросом и белком-шаблоном.
Высокая идентичность последовательностей указывает на эволюционную близость между белками-запросами и белками-шаблонами. Рассмотрите цветное выделение выровненных остатков при трединге, чтобы визуально определить консервативные остатки или мотивы в белках-запросах и шаблонах; более высокая идентичность последовательностей в области выравнивания при трединге по сравнению с выравниванием всей цепи также указывает на наличие консервативных структурных мотивов или доменов в запросе. Оцените степень покрытия выравнивания при трединге, проанализировав само выравнивание.
Если покрытие лучшего выравнивания низкое и ограничено лишь небольшим участком искомого белка или отсутствует на протяжении длинного сегмента последовательности запроса, это указывает на то, что искомый белок содержит более одного домена. В таком случае рекомендуется разделить последовательность и моделировать домены по отдельности. Перейдите к следующей таблице на странице результатов, чтобы определить 10 лучших структурных аналогов первой предсказанной модели, выявленных программой структурного выравнивания TM-align.
Значение TM-score выше 0,5 указывает на то, что обнаруженный аналог и модель имеют схожую топологию и могут быть использованы для определения структурного класса или семейства белков изучаемого белка. Значения TM-score менее 0,3 свидетельствуют о случайном сходстве структур. Проанализируйте идентичность последовательностей и значение RMSD в структурно выровненной области, чтобы оценить консервативность пространственных мотивов в модели и структурном аналоге.
Визуально осмотрите выделенные цветом и выровненные пары остатков в выравнивании, чтобы определить эти структурно консервативные остатки и мотивы. Обратитесь к таблице предсказанных номеров EC, чтобы просмотреть пять наиболее вероятных ортологических групп (OG) ферментов для исследуемого белка. Степень достоверности предсказания номера EC с использованием данных шаблонов представлена в виде показателя EC score, рассчитанного на основе сравнительного анализа.
Функциональное сходство между запрашиваемым и шаблонным белками можно достоверно интерпретировать при значении индекса EC выше 1,1. Затем следует проверить согласованность функций среди шаблонов, имеющих схожую укладку с запрашиваемым белком. Если несколько шаблонов имеют один и тот же номер EC, а индекс EC превышает 1,1, уровень достоверности предсказания считается очень высоким.
Однако, если показатель EC высок, но среди выявленных результатов отсутствует консенсус, прогноз становится менее надежным, и пользователям рекомендуется обратиться к генной онтологии. В режиме просмотра прогнозов терминов изучите таблицу прогнозируемых терминов генной онтологии, чтобы определить 10 основных гомологов искомого белка в библиотеке PDB, аннотированных терминами генной онтологии; обычно каждый белок связан с несколькими терминами генной онтологии, описывающими его молекулярные функции, биологические процессы и клеточную локализацию. Нажмите на каждый термин, чтобы перейти на веб-сайт Amigo и проанализировать его определение и иерархию.
Проанализируйте столбец оценки функциональной гомологии, чтобы определить функциональное сходство между белками-запросами и белками-шаблонами. Также можно оценить уровень достоверности переноса функциональной аннотации с этих белков. Просмотрите таблицу консенсусного прогноза терминов генной онтологии для анализа совпадения функций между шаблонами.
Эти общепринятые функции используются для прогнозирования терминов онтологии генов исследуемого белка и оценки уровня достоверности предсказанных geo-терминов. Наконец, прокрутите страницу вниз, чтобы просмотреть 10 лучших прогнозов сайтов связывания лигандов для исследуемого белка; предсказанные сайты связывания ранжируются на основе количества предсказанных конформаций лигандов, имеющих общий карман связывания. Лучший идентифицированный сайт связывания уже отображен в приложении JM OL.
Нажимайте на переключатели, чтобы проанализировать другие прогнозы и визуализировать остатки, взаимодействующие с лигандом. Показатель BS отражает локальное сходство между моделью и сайтом связывания шаблонов. Значение BS выше 1,1 указывает на высокую последовательностную и структурную схожесть в области предполагаемого сайта связывания.
По сравнению с известным сайтом связывания в шаблоне в данной модели IT представляет собой основную веб-страницу, содержащую ссылки на другие полезные функции. Функция форума позволяет пользователю создать онлайн-аккаунт и обратиться за помощью к другим пользователям ITER по вопросам моделирования структуры или интерпретации результатов. Функция загрузки позволяет пользователям скачивать iter и связанные с ним пакеты и устанавливать их на свой компьютер.
Это помогает сократить время, необходимое для проведения экспериментов по моделированию. Функция очереди позволяет просматривать статус всех отправленных заданий на странице IT a Q. Пользователи также могут визуально проверить изображения смоделированных структур для завершенных заданий.
На этой странице также указаны ожидаемый показатель TM и ожидаемое значение RMSD первой модели в CSCO, а также дата отправки; здесь представлен фрагмент страницы результатов IT AER, на которой отображены быстро отформатированная последовательность запроса, предсказанная вторичная структура, соответствующие показатели достоверности и предсказанная доступность растворителю остатков. Анализируемый основной регион и потенциальный сайт гидратации в запросе выделены голубым и красным прямоугольниками соответственно. Здесь показаны предсказания третичной структуры белков-запросов.
Предполагаемые модели отображаются в интерактивном модуле JML, позволяющем пользователю изменять способ визуализации молекулы. Модели также можно скачать, перейдя по соответствующим ссылкам; показатель достоверности для оценки качества модели указан как csco. Представлен пример страницы результатов itta A, на которой показаны 10 лучших идентифицированных шаблонов трединга и выравниваний, полученных с помощью программ трединга Loomis.
Качество выравниваний методом трединга оценивается на основе нормированного Z-показателя, где значение более единицы свидетельствует о достоверности выравнивания. Выровненные остатки в шаблоне, идентичные соответствующим остаткам в запрашиваемой последовательности, выделены цветом, что указывает на наличие консервативного остатка или мотива. Напротив, отсутствие выравнивания в большинстве основных шаблонов указывает на наличие нескольких доменов в запрашиваемом белке, при этом невыровненные остатки соответствуют областям линкеров доменов.
В этой таблице представлены 10 наиболее подходящих структурных аналогов и результаты их структурного выравнивания, определенные программой TM-align Structural alignment. Ранжирование аналогов основано на значении TM-score структурного выравнивания. Значение TM-score более 0,5 указывает на то, что две сравниваемые структуры имеют схожую топологию.
При этом значение TM-score менее 0.3 указывает на сходство между двумя случайными структурами. Структурно выровненные пары остатков выделены цветом в зависимости от свойств их аминокислот, а невыровненные области обозначены тире. Ниже приведен пример страницы результатов ITR, на которой показаны идентифицированные гомологи фермента для запрашиваемого белка в библиотеке PDB.
Уровень достоверности предсказания номера КФ анализируется на основе показателя EC, при этом значение показателя EC более 1,1 указывает на функциональное сходство между исследуемым и шаблонным белками. Таблица предсказания терминов генной онтологии для исследуемого белка включает функциональные гомологи исследуемого белка из библиотеки шаблонов генной онтологии, ранжированные по их показателю функциональной гомологии. Общие функциональные признаки этих наиболее высоко оцениваемых совпадений используются для формирования окончательных предсказаний терминов генной онтологии для исследуемого белка.
Качество предсказанных терминов онтологии генов оценивается на основе показателя geo score, при этом значение geo score более 0,5 указывает на достоверность предсказания; здесь в качестве примера представлена страница результатов IT AZA, отображающая 10 лучших предсказаний сайтов связывания белковых лигандов с использованием алгоритма кофактора. Ранжирование предсказанных сайтов связывания основано на количестве предсказанных конформаций лиганда, имеющих общий карман связывания. В запросе показатель BS score является мерой локального сходства последовательности и структуры между предсказанным сайтом связывания и сайтом-шаблоном и полезен для анализа консервативности карманов сайтов связывания.
Хотя ISER является одним из наиболее эффективных алгоритмов для предсказания структуры и функции белков, важно помнить, что это всего лишь результат работы компьютерных алгоритмов. Любые экспериментальные данные или сведения о функциях, например, информация о контактах остатков при связывании, будут крайне полезны для повышения точности предсказаний. Чтобы удовлетворить растущий интерес к этой возможности, в сервере IT AER предусмотрен портал для включения таких данных в процессе моделирования.
Лаборатория Цан (Zang lab) предоставила программное обеспечение IT AER бесплатно для некоммерческих исследований. Мы активно работаем над совершенствованием IT AER и системы анализа движений глаз (eye taster) в надежде, что доступность этого инструмента приведет к его широкому применению за пределами лаборатории Цан, принесет пользу и даст импульс дальнейшим исследованиям в научном сообществе.
В данной статье описывается конвейер I-TASSER для предсказания трехмерных структур и функций белков на основе их аминокислотных последовательностей. Процесс включает в себя трединг, сборку фрагментов и функциональный вывод на основе известных структур белков.
Вычислительное прогнозирование структуры и функции белков позволяет снизить риски при выборе мишеней на ранних этапах разработки лекарственных средств, предоставляя понимание механизмов работы белков, не охарактеризованных экспериментально. Конвейер I-TASSER поддерживает проверку гипотез и функциональную аннотацию, повышая достоверность прогнозов в процессах выбора мишеней и идентификации соединений-лидеров. Такой подход снижает зависимость от низкопроизводительных экспериментальных методов и ускоряет валидацию мишеней в биофармацевтических исследованиях и разработках.
Метод I-TASSER интегрируется в непрерывный процесс разработки лекарственных средств — от идентификации мишени до оптимизации ведущих соединений, предоставляя структурные и функциональные данные, которые позволяют принимать обоснованные решения на каждом этапе.