9 мая 2011 г.
Мы представляем общественности вычислительной веб-сайта для анализа геномных последовательностей. Он обнаруживает модели последовательности ДНК с различными неслучайный нуклеотидных композиций. Этот ресурс также генерирует рандомизированных последовательностей с различными уровнями сложности.
Общая цель этой процедуры заключается в исследовании неслучайности среднего уровня, также называемой гомогенностью заданной пользователем геномной последовательности. Это достигается путем предварительного изучения олигонуклеотидного состава входной последовательности и создания таблицы частот олигонуклеотидов, составляющих последовательность. Эта цель достигается путем вызова программы SRI Analyzer.
Второй шаг заключается в получении случайных последовательностей, которые имеют точно такой же олигонуклеотидный состав, как и входная последовательность. Это достигается за счет вызова программы-генератора SRI. Третьим этапом процедуры является нахождение сегментов внутри входных и рандомизированных последовательностей, которые значительно обогащены определенным нуклеотидом или комбинацией нуклеотидов, например, GC или ag.
Эта цель достигается с помощью программы «Анализатор МРТ». Заключительным этапом процедуры является загрузка файлов, содержащих последовательности всех областей МРТ, обнаруженных программой. В конечном счете, могут быть получены результаты, показывающие, что большинство областей генома многоклеточных ариасов значительно обогащены сегментами, содержащими экстремальные значения состава оснований, обнаруженные для каждого из четырех нуклеотидов или любой из их комбинаций.
Они в однородных областях связаны с необычными подтверждениями ДНК и/или определенными свойствами ДНК. Этот метод может помочь ответить на ключевые вопросы в области геномики, такие как поиск потенциально функциональных элементов ДНК в обширных областях некодирующих последовательностей, включая межгенные области или входы. Хотя этот метод может дать представление о геноме млекопитающих, он также может быть применен к другим организмам, таким как беспозвоночные, растения, грибы и бактерии.
Откройте домашнюю страницу онлайн геномного среднего уровня по гомогенности или пакета G GM I по адресу www.bioinfo.utoledo. edu/gri/the web resource. Также предоставляет подробную информацию о программах в справке по ссылке Readme.
В то время как все опубликованные материалы по геномной МРТ и подобным алгоритмам перечислены в ссылках на соответствующие ресурсы, создайте файл с более быстрым форматированием последовательности для начала сеанса анализа A-G-M-R-I. Более быстрая последовательность начинается с морковки или символа «больше», за которым следует уникальный идентификатор или имя и последовательность в следующих строках. Только нуклеотиды TG и C будут обработаны с помощью геномной МРТ, хотя допускаются и другие входные данные признаков.
Используется файл последовательности для одного гена PKD. Чтобы продемонстрировать сеанс, нажмите кнопку запуска. Откроется новая веб-страница, которая дает возможность скопировать и вставить последовательность ввода в предоставленное окно или если файл большой.
Чтобы загрузить файл, нажмите кнопку «Выбрать файл». Перейдите к нужному файлу. Затем нажмите кнопку «Начать эту сессию с этим файлом» Подтверждение того, что файл был успешно загружен, отображается вверху страницы. Ниже.
Это сообщение является идентификатором текущей сессии, которая в данном случае является C eight EP oh six. Чтобы проанализировать короткий диапазон однородности входной последовательности, нажмите кнопку Анализировать короткий диапазон однородности. Программа открывает новую страницу, специально предназначенную для выполнения программы SRI Analyzer.
Здесь нам нужно выбрать максимальную длину исследуемых олигонуклеотидов. Поскольку наши входные последовательности среднего размера составляют около 50 000 нуклеотидов, мы выбираем формеры как наибольшую длину олигонуклеотидов, для которых будут рассчитываться частоты. Наконец, нам нужно немедленно нажать кнопку анализа файла.
Программа вычисляет частоты всех олигонуклеотидов выбранной длины и меньшей длины во входной последовательности. Чтобы увидеть частоты всех олигонуклеотидов, нажмите на ссылку скачать файл состава. Этот файл называется user file.
com представляет собой таблицу с тремя столбцами. В первом столбце указываются олигонуклеотиды. Второй представляет их относительные частоты, а третий представляет количество олигонуклеотидов в входной последовательности.
Чтобы сгенерировать рандомизированные последовательности с тем же олигонуклеотидным составом, что и входной файл, перейдите на вкладку «Генератор SRI». На новой странице выберите количество выборок случайных последовательностей, которые будут сгенерированы. Каждый из этих образцов будет содержать случайные последовательности того же количества и длины, что и входные последовательности в пользовательском файле.
В этом примере пользовательский файл представляет собой последовательность гена PKD one. Далее выберите наибольшую длину олигонуклеотидов, частоты которых будут аппроксимированы в рандомизированных последовательностях, выбрав радиокнопку для формеров, которая обозначает четыре олигонуклеотида основания. Затем выберите два для количества выборок рандомизированных последовательностей, которые будут сгенерированы.
Наконец, запустите программу, нажав кнопку «Создать файл» для входных последовательностей сотен тысяч нуклеотидов. На генерацию случайных последовательностей может уйти пара минут. Поэтому подождите, пока внизу этой страницы не появятся синие ссылки для скачивания.
Для анализа среднего диапазона по однородности входных и рандомизированных последовательностей перейдите на вкладку «Анализатор МРТ». На новой странице выберите последовательность для анализа в списке файла для анализа. Затем выберите содержимое GC из списка семи типов содержимого.
Содержание GC расшифровывается как G плюс C композиция. Поле размера окна позволяет выбрать длину окна, для которого будут проверяться последовательности с богатым и плохим содержимым. Оставьте размер окна по умолчанию 50 нуклеотидов.
Наконец, выберите верхний и нижний пороги для регионов с богатым и бедным контентом соответственно. Эти пороговые значения могут быть определены по количеству конкретных нуклеотидов в текущем окне или по процентному соотношению этих нуклеотидов в окне. В этом случае мы изначально выберем случайные значения 60% для верхнего порога и 30% для нижнего порога.
Далее нажмите кнопку анализа файла После этого появляется ссылка на выходной файл и отображается графическое представление результатов. Все области с богатым содержимым во входной последовательности помечены синими пиками вверх, а области с низким содержанием — красными пиками вниз. На графике видно, что существует слишком много синих шипов, которые показывают области, богатые GC, и гораздо меньше красных пиков, которые показывают области с низким GC.
Это означает, что выбранные параметры не являются оптимальными. Для следующей итерации используйте верхний порог в 75% и нижний порог в 32%. Снова запустите МРТ-анализатор, нажав кнопку анализа файла.
Новый график показывает, что даже для новых, гораздо более строгих параметров, есть сотни синих шипов. Поэтому увеличьте верхний порог до 80% и повторите расчеты. Новый график показывает, что 62 богатых GC областей имеют содержание GC больше или равно 80%, а 28 бедных GC областей с содержанием GC ниже 32%. Далее сравните результаты для входного файла с двумя рандомизированными последовательностями, которые имеют тот же олигонуклеотидный состав, что и один ген PKD.
Для этого измените последовательность с одного гена PKD на случайную с помощью списка «Файл для анализа», сохранив при этом те же параметры для богатых и бедных областей GC. Вновь сгенерированное графическое отображение для случайной последовательности номер один показывает, что эта случайная последовательность имеет только одну плохую область GC и 31 богатую область GC. Другая рандомизированная последовательность может привести к некоторым колебаниям в количестве областей с богатым и бедным контентом, но тенденция должна быть такой же.
Рандомизированные последовательности для поликистоза почек у одного гена имеют в несколько раз меньше. Регионы, богатые GC, более чем в 10 раз меньше бедные регионы GC. В следующей демонстрации используется другой тип содержимого МРТ.
В том же pkg один человеческий ген интроны этого гена содержат несколько богатых пурином областей, связанных со структурами DN aex. На веб-странице МРТ-анализатора переключите содержимое ДНК на нуклеотиды ag, которые представляют собой пурины. Оставьте размер окна равным 50 основаниям и измените верхний порог на 80%, а нижний порог на 10%, затем нажмите кнопку анализа файла, чтобы вызвать программу.
Показанный график показывает, что этот ген имеет шесть областей, богатых Ag, обозначенных синими вертикальными шипами, и 14 областей с низким содержанием Ag, обозначенных красными шипами. Затем сравните эти результаты, полученные для одного гена PKD, с данными из рандомизированных последовательностей, которые имеют тот же олигонуклеотидный состав, что и исследуемый ген, сначала переключитесь на рандомизированную последовательность, например номер два, и сохраните те же параметры, что и в предыдущем тесте. График для этой случайной последовательности показывает, что она содержит только одну регион, богатую сельским хозяйством, и ни одной области с низким содержанием сельскохозяйственной продукции.
Все данные, сгенерированные во время сеанса, сохраняются в специальных файлах, доступных через вкладку «Файлы загрузки» в правом верхнем углу каждой веб-страницы. Открыв эту ссылку, загрузите входную последовательность, а также все сгенерированные рандомизированные последовательности. Под этим списком файлов находится ссылка на таблицу частот олигонуклеотидов, сгенерированную программой анализатора SRI.
Далее идут ссылки на все результаты, полученные программой МРТ-анализатора во время сеанса. Например, нажмите на файл пользователя RAND one four AGCO 50 32 14, представляющий результаты, полученные для рандомизированной последовательности. Номер один со следующими параметрами, содержание ag 50 нуклеотидов длинное окно, верхний порог, 32 нуклеотида и нижний порог 14 нуклеотидов.
В этом файле все сегменты нуклеотидной последовательности, которые соответствуют критериям богатого или плохого содержания, а также их координаты доступны в виде списка в соответствии с их последовательным положением вдоль входной последовательности. После просмотра этого видео у вас должно сложиться хорошее понимание того, как ориентироваться по геномной МРТ, вычислительному ресурсу.
В этой статье представлен вычислительный веб-ресурс, предназначенный для анализа геномических последовательностей с акцентом на выявление неслуча́йных нуклеотидных составов. Инструмент генерирует рандомизированные последовательности с похожими олигону́клеотидными составами, что облегчает исследование геномической неоднородности.
Genomic MRI provides a computational approach to detect non-random nucleotide patterns in non-coding DNA, supporting target validation by identifying regulatory elements with potential functional significance. This enables mechanistic de-risking in early discovery by linking sequence inhomogeneity to biological processes such as gene expression and recombination. The resource enhances predictive confidence in lead identification by prioritizing genomic regions with extreme base composition for downstream assay development.
The method integrates into the discovery continuum from target validation through lead identification to preclinical work by providing quantitative outputs on sequence enrichment that inform biological de-risking decisions.