$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
МикроРНК (микроРНК) представляют собой короткие некодирующие молекулы РНК, которые существенно влияют на экспрессию генов, действуя на посттранскрипционной стадии1. Обычно они функционируют путем связывания с комплементарными последовательностями в 3'-нетранслируемых областях (UTR) целевых матричных РНК (мРНК), что приводит к деградации мРНК или репрессии трансляции1. За последние два десятилетия микроРНК все чаще признаются в качестве центральных регуляторов различных биологических процессов, включая пролиферацию клеток, дифференцировку, апоптоз, иммунные реакции и развитие органов2. Кроме того, нарушение регуляции экспрессии микроРНК было вовлечено в патогенез многих заболеваний, таких как рак, сердечно-сосудистые заболевания, неврологические расстройстваи заболевания почек. Эти результаты подчеркивают потенциал микроРНК не только в качестве терапевтических мишеней, но и в качестве минимально инвазивных биомаркеров в клинической диагностике.
С появлением технологий секвенирования нового поколения (NGS) изучение микроРНК вступило в новую эру. В отличие от методов, основанных на микрочипах, которые ограничены известными микроРНК, секвенирование микроРНК (miRNA-Seq) обеспечивает всестороннее, высокопроизводительное и несмещенное профилирование как известных, так и новых микроРНК в различных типах образцов и условиях4. miRNA-Seq обеспечивает превосходную чувствительность, точность и динамический диапазон, что делает его предпочтительным методом для исследования паттернов экспрессии микроРНК и обнаружения регуляторных механизмов в физиологических и патологических условиях5. Тем не менее, анализ данных miRNA-Seq сопряжен с определенными вычислительными проблемами, включая обработку коротких длин чтения, удаление адаптерных последовательностей, различение близкородственных членов семейства микроРНК и управление высокой избыточностью при подсчетепрочтений. Эти характеристики обуславливают необходимость тщательно разработанного и стандартизированного аналитического рабочего процесса.
Несмотря на то, что для анализа данных miRNA-Seq были разработаны различные конвейеры и программные инструменты, многие из них опираются на графические пользовательские интерфейсы или фиксированные рабочие процессы, которые ограничивают гибкость и воспроизводимость7. В отличие от этого, среда программирования R предоставляет мощную и настраиваемую платформудля биоинформатического анализа8. R предлагает богатую экосистему пакетов для статистического моделирования, визуализации данных и интеграции с биологическими базами данных. Это позволяет пользователям выполнять всесторонний и воспроизводимый анализ прозрачным и основанным на сценариях способом. Кроме того, модульный характер рабочих процессов R позволяет исследователям адаптировать каждый шаг в соответствии с конкретными экспериментальными требованиями, от предварительной обработки исходных данных до функциональной интерпретации.
В этом протоколе мы представляем проверенный и полный рабочий процесс анализа miRNA-Seq, полностью реализованный на R, с целью предоставления воспроизводимого и адаптируемого к пользователю решения для исследователей, работающих с данными об экспрессии микроРНК. Рабочий процесс начинается с контроля качества и обрезки адаптером необработанных прочтений секвенирования, за которыми следует выравнивание по референсному геному или известным последовательностям микроРНК. Последующие шаги включают количественную оценку количества прочтений, нормализацию, анализ дифференциальной экспрессии, прогнозирование гена-мишени, функциональное обогащение и визуализацию сети. Рабочий процесс включает в себя несколько широко используемых и хорошо поддерживаемых пакетов R, обеспечивающих надежность и совместимость с будущими обновлениями и расширениями.
Одно из основных преимуществ этого протокола заключается в его способности выходить за рамки результатов дифференциальной экспрессии и обеспечивать осмысленную биологическую интерпретацию. Благодаря интеграции курируемых баз данных проверенных и прогнозируемых взаимодействий микроРНК-мРНК рабочий процесс позволяет пользователям идентифицировать биологически значимые гены-мишени. Затем эти мишени могут быть подвергнуты онтологии генов и анализу обогащения путей, чтобы выявить затронутые биологические процессы и молекулярные пути. На заключительном этапе сети взаимодействия микроРНК и мРНК могут быть визуализированы с помощью внешних инструментов, таких как Cytoscape9, что дает представление о регуляторном ландшафте и выявляет ключевые микроРНК-концентраторы с потенциальной функциональной важностью.
Этот метод был успешно применен в контексте клинических исследований, в том числе в исследованиях заболеваний почек, где циркулирующие микроРНК служат многообещающими биомаркерами для диагностики и прогноза. Тем не менее, модульная и гибкая структура рабочего процесса делает его пригодным для широкого спектра приложений, включая моделирование заболеваний, исследования реакции на лекарства, биологию развития и сравнительную геномику. Исследователи могут легко адаптировать рабочий процесс для адаптации к видоспецифичным аннотациям, экспериментальным условиям или дополнительным слоям омиксных данных.
Предлагая решение с открытым исходным кодом на основе сценариев, этот R-ориентированный конвейер устраняет несколько основных ограничений, связанных с существующими инструментами miRNA-Seq, включая ограниченную настройку, зависимость от непрозрачных графических интерфейсов, отсутствие поддержки немодельных организмов, плохую воспроизводимость из-за отсутствия контроля версий и трудности интеграции с последующими средами статистического и функционального анализа. Он обеспечивает полный контроль над параметрами обработки данных, поощряет воспроизводимость с помощью кода с контролем версий и способствует прозрачности исследований в области биоинформатики. По мере того, как важность микроРНК продолжает расти в контексте системной биологии и трансляционной медицины, доступ к надежной и адаптируемой системе анализа становится все более важным.