В последние годы онкологическая помощь претерпела значительные изменения благодаря применению технологий секвенирования следующего поколения (NGS) для уточнения диагноза, прогноза и выбора терапии1. Тестирование NGS стало стандартом оказания помощи при различных типах опухолей для: 1) установления диагноза молекулярно определенной опухоли, 2) использования результатов анализа биомаркеров, не зависящих от типа опухоли, для принятия решений о терапии и 3) определения стратификации риска для конкретных типов опухолей2,3. Точные и своевременные результаты NGS и других тестов на биомаркеры стали критически важным компонентом ухода за пациентами и планирования лечения в онкологии.
Тестирование с помощью NGS обычно проводится либо в крупных референс-лабораториях, либо в госпитальных/академических лабораториях, если учреждения обладают достаточным опытом и ресурсами для разработки и поддержания таких методов тестирования. Организация Genomics Organization for Academic Laboratories (GOAL) была задумана как совместная сеть, ориентированная на обмен академическими знаниями и разделение затрат на реагенты4. Значительная часть усилий консорциума GOAL была направлена на проведение обучающих сессий по критически важным аспектам анализа и подготовки отчетов по клиническим исследованиям. Эти сессии были разработаны в формате практических занятий и включают интерактивный воркшоп по использованию integrative genomics viewer (IGV) для демонстрации его базовых и расширенных возможностей в геномной медицине.
IGV представляет собой инструмент визуализации данных, разработанный для того, чтобы пользователи могли легко анализировать данные NGS и другие большие наборы данных, поскольку большинство данных NGS слишком объемны и неудобны для работы без графического пользовательского интерфейса5. Изначально IGV не предназначался для клинического анализа вариантов. Однако благодаря простоте использования для всех специалистов по молекулярной биологии, независимо от их опыта в биоинформатике, он был широко внедрен во многих лабораториях как часть сложного рабочего процесса анализа данных6. Данное исследование было подготовлено с целью распространения этой информации среди широкого сообщества специалистов геномных лабораторий.
Клиническая необходимость использования IGV в рамках рабочего процесса включает выявление ошибок секвенирования, решение проблем, связанных со сложностями при определении геномных вариантов, а также анализ других рекуррентных перестроек, при которых дополнительная визуализация может помочь в правильной интерпретации данных7. Для работы с IGV требуются стандартные биоинформатические файлы, полученные в результате исследования NGS8. Основные функции программного обеспечения IGV позволяют визуализировать данные секвенирования и требуют настройки ряда предпочтений и опций для клинической интерпретации вариантов (Дополнительный файл 1).
Рабочий процесс секвенирования короткими reads характеризуется использованием стандартов файлов FASTQ, binary alignment map (BAM) и variant call format (VCF). NGS достигает высокой пропускной способности за счет параллельного генерирования миллионов коротких ридов. Хотя эта стратегия значительно ускоряет получение данных, каждый рид является лишь фрагментом исходной ДНК или РНК. Он прикрепляется к определенной позиции на проточной ячейке NGS с помощью адаптерной последовательности. Информация о последовательности и качестве оснований, полученная в результате оптической обработки, записывается в файлы FASTQ. Эти необработанные риды представляют собой нуклеотидные последовательности вместе с показателями качества для каждого основания. Поэтому одним из первых этапов обработки необработанных ридов является выравнивание каждого рида по референсному геному8. Поскольку каждому риду присваивается определенная позиция в референсном геноме с наибольшей вероятностью выравнивания, риды, соответствующие одной и той же локации, "наслаиваются" в каждом локусе; такие данные сохраняются в BAM-файле в соответствии со спецификациями sequence alignment mapping (SAM) (доступны по адресу https://samtools.github.io/hts-specs/SAMv1.pdf; проверено: 30.09.2025) (Рисунок 1A). Эту информацию можно визуально проанализировать с помощью браузера генома, такого как IGV. Как показано на Рисунке 1B, сравнение ридов друг с другом или с самой референсной последовательностью может выявить различия или несоответствия между нуклеотидными последовательностями. Сводки только по таким "вариантным" позициям по всему геному собираются в VCF-файл, который может быть значительно меньше по размеру, чем BAM-файл, но при этом содержать большую часть полезной информации, необходимой для анализа вариантов. По этой причине VCF-файл обычно является конечным результатом конвейеров поиска вариантов (Рисунок 1C). Таким образом, в то время как файлы FASTQ содержат необработанные данные о ридах и их качестве, BAM-файл дает представление о том, насколько достоверно эти риды картируются на геном, а VCF представляет различия между референсной последовательностью и последовательностью образца, предоставляя гораздо более управляемый объем данных для анализа с целью возможного составления отчета.
Шесть клинических виньеток в данном исследовании иллюстрируют типичные аналитические сценарии, связанные с выявлением соматических вариантов в молекулярных лабораториях, а также проблемы, затрудняющие правильное понимание и интерпретацию исходных данных. В целом, эти виньетки были выбраны для демонстрации все более сложных сценариев интерпретации и того, как использование расширенных функций IGV позволяет более детально описать комплексные геномные характеристики. Хотя данное исследование сосредоточено на интерпретации соматических вариантов, эти функции применимы и при использовании IGV для визуализации и интерпретации герминальных изменений6. Следует отметить, что термины, используемые в данной статье, основаны на химическом методе секвенирования путем синтеза и, где это уместно, включают другие аналогичные термины/понятия для других платформ.
Каждое клиническое описание начинается с краткого изложения клинического контекста, за которым следуют инструкции по исследованию варианта или вариантов и поиску ответа на вопрос: какой из обнаруженных вариантов (если таковые имеются) является истинным, а какой (если таковой имеется) — артефактом. Клинический контекст вместе с особенностями данных секвенирования имеет важное значение для ответа на этот вопрос.