4.15
Весь геном организма не может быть секвенирован в непрерывных последовательностях - даже новейшее поколение технологий секвенирования дает фрагментарные данные из тысяч коротких фрагментов ДНК длиной от 50 до 1000.о.
Эти короткие последовательности ДНК, называемые прочтениями, должны быть собраны для реконструкции полной последовательности генома в процессе, называемом сборкой генома.
Любая сборка генома нового поколения состоит из четырех основных этапов: анализ исходных данных, сборка контига, создание строительных лесов и, наконец, закрытие разрывов.
Первым шагом является анализ полученных исходных данных на качество, а затем устранение любых загрязнений, предвзятости данных или некачественных считываний с большим количеством неизвестных нуклеотидов.
Затем чистые чтения обрезаются, чтобы удалить последовательности адаптеров с их концов. Любые основания на концах фрагментов, которые не проходят порог качества, также обрезаются.
Затем используется хорошо подходящий инструмент для сборки прочтений в непрерывные последовательности, называемые контигами, на основе перекрывающихся сегментов ДНК.
Сравнительная сборка генома может быть использована, когда имеется референсный геном близкородственного организма для управления реконструкцией нового генома. Здесь прочтения выравниваются по референсному геному, и это обеспечивает схему для дальнейших шагов сборки генома.
В качестве альтернативы, сборка генома de novo должна быть выполнена в отсутствие референсного генома. Здесь перекрывающиеся чтения используются для ориентации последовательностей в более длинные контиги.
На следующем этапе парные короткие чтения, которые представляют собой нависающие прочтения в конце контигов, используются для построения каркаса генома.
Промежутки между соседними контигами заполняются N в случае неизвестных последовательностей. Однако, если для сшивания контигов используются длинные чтения длиной более 1 КБ, пробелы могут быть заполнены реальными последовательностями.
В результате получается собранный геном, который затем необходимо аннотировать с помощью автоматизированных инструментов — процесс, называемый аннотацией генома.
Двумя основными целями аннотации генома являются структура гена и предсказание функции гена, обычно известные как структурная аннотация и функциональная аннотация соответственно.
В то время как структурная аннотация приводит к идентификации таких элементов генома, как кодирующие области, регуляторные мотивы и т.д., функциональная аннотация помогает правильно идентифицировать биологическую функцию этих структурных элементов, особенно генов, кодирующих белки.
Инструменты аннотирования генома используют доступные данные, включая известные транскрипты, белковые или сигнальные последовательности, предсказанные гены из других секвенированных геномов или сигнатуры консервативных доменов, в качестве ссылок для любой новой аннотации.
После того, как программное обеспечение выровняет эти доступные данные с проектом генома, его необходимо отфильтровать и отполировать либо вручную, либо с помощью инструментов аннотации для получения окончательного набора аннотаций генов.
Геном относится ко всему генетическому материалу в организме. Оно может варьироваться от нескольких миллионов пар оснований в микробных клетках до нес…
© 2026 MyJoVE Corporation. Все права защищены.