$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Идентификация полного набора кодирующих элементов в геноме была основной целью с момента начала проекта «Геном человека» и остается центральной задачей для понимания биологических систем и этиологии генетических заболеваний 1,2,3,4. Достижения в методах NGS привели к производству целых последовательностей генома для широкого круга организмов, включая позвоночных, беспозвоночных, дрожжи и растения5. Кроме того, высокопроизводительные методы транскрипционного секвенирования дополнительно выявили сложность клеточного транскриптома и идентифицировали тысячи новых молекул РНК с кодирующими белки и некодирующими функциями 6,7. Расшифровка этого огромного количества информации о последовательностях является непрерывным процессом, и проблемы остаются с комплексными усилиями по аннотированию генов8.
Недавняя разработка методов трансляционного профилирования, включая профилирование рибосом 9,10 и секвенирование полирибосом11, предоставила доказательства, указывающие на то, что сотни неканонических событий трансляции сопоставляются с неаннотированными в настоящее время sORFs по всему геному, с потенциалом генерировать небольшие белки, называемые микропротеинами или микропептидами 12,13,14,15,16. 17. Микропротеины появились как новый класс универсальных белков, ранее упускавшихся из виду стандартными методами аннотирования генов из-за их небольшого размера (<100 аминокислот) и отсутствия классических кодирующих белок характеристик генов 8,12,18,19,20. Микропротеины были описаны практически во всех организмах, включая дрожжи21,22, мух 17,23,24 и млекопитающих 25,26,27,28, и было показано, что они играют решающую роль в различных процессах, включая развитие, метаболизм и передачу сигналов о стрессе 19,20,29. 30,31,32,33,34. Таким образом, крайне важно продолжать добывать геном для дополнительных членов этого давно забытого класса функциональных малых белков.
Несмотря на широкое признание биологической важности микропротеинов, этот класс генов остается значительно недопредставленным в аннотациях генома, и их точная идентификация по-прежнему является постоянной проблемой, которая препятствует прогрессу в этой области. Недавно были разработаны различные вычислительные инструменты и экспериментальные методы для преодоления трудностей, связанных с идентификацией микропротеин-кодирующих последовательностей (подробно обсуждается в нескольких всеобъемлющих обзорах 8,35,36,37). Многие недавние исследования по идентификации микропротеинов 38,39,40,41,42,43,44,45,46,47 в значительной степени опирались на использование одного такого алгоритма под названием PhyloCSF48,49 , мощный подход к сравнительной геномике, который может быть использован для отличия сохраненных белково-кодирующих областей генома от тех, которые не являются кодирующими.
PhyloCSF сравнивает частоты замещения кодонов (CSF) с использованием многовидовых нуклеотидных выравниваний и филогенетических моделей для обнаружения эволюционных сигнатур генов, кодирующих белок. Этот эмпирический подход, основанный на модели, опирается на предпосылку, что белки в основном сохраняются на уровне аминокислот, а не на нуклеотидной последовательности. Поэтому синонимичные замены кодонов, которые кодируют одну и ту же аминокислоту, или замены кодонов на аминокислоты с сохраненными свойствами (т. е. заряд, гидрофобность, полярность) оцениваются положительно, в то время как несинонимные замены, включая неправильные и бессмысленные замены, оцениваются отрицательно. PhyloCSF обучен на данных всего генома и доказал свою эффективность в оценке коротких участков кодирующей последовательности (CDS) в отрыве от полной последовательности, что необходимо при анализе микропротеинов или отдельных экзонов стандартных белково-кодирующих генов48,49.
Примечательно, что недавняя интеграция трековых хабов PhyloCSF в браузере генома 49,50,51 Калифорнийского университета в Санта-Крус (UCSC) позволяет исследователям всех слоев общества легко получить доступ к удобному интерфейсу для запроса геномных областей, представляющих интерес для потенциала кодирования белка. Протокол, описанный ниже, предоставляет подробную инструкцию о том, как загрузить концентраторы трека PhyloCSF в браузер генома UCSC и впоследствии опрашивать геномные области, представляющие интерес для исследования высоконадежных белково-кодирующих областей (или их отсутствия). Кроме того, в случае, когда наблюдается положительная оценка PhyloCSF, описываются шаги для дальнейшего анализа потенциала кодирования микропротеинов и эффективного создания нескольких видовых выравниваний идентифицированных аминокислотных последовательностей для иллюстрации сохранения межвидовых последовательностей. Наконец, в ходе обсуждения был представлен ряд дополнительных общедоступных ресурсов и инструментов для изучения выявленных характеристик микропротеинов, включая прогнозируемые структуры доменов и понимание предполагаемой функции микропротеинов.