Методическая статья

Интерпретация клинических вариантов с помощью Integrative Genomics Viewer (IGV) для молекулярных патологов

38 просмотров

DOI:

10.3791/71808

14 августа 2026 г.

* These authors contributed equally

В этой статье

Краткое содержание

Программное обеспечение Integrative Genomics Viewer (IGV) предоставляет функциональный и интуитивно понятный интерфейс для анализа исходных данных при поиске клинически значимых вариантов. В данной работе мы представляем пять примеров, демонстрирующих, как быстро дифференцировать истинные патогенные события и артефакты, что в конечном итоге повышает диагностическую уверенность специалистов, занимающихся интерпретацией результатов секвенирования следующего поколения (NGS).

Аннотация

Интегративный геномный браузер (IGV) является ключевым инструментом в клинической геномике, позволяющим визуализировать и интерпретировать сложные данные секвенирования. Сочетание клинических знаний с визуальной оценкой результатов секвенирования — основной способ, с помощью которого молекулярные патологи и другие специалисты оценивают и завершают анализ случаев. Различные программные инструменты могут оказать помощь, однако их связь с исходными данными должна быть понятна и применяться систематически. Данное исследование содержит основные сведения о типах файлов данных секвенирования следующего поколения (NGS) (например, FASTQ, BAM, VCF) с обсуждением их формата и назначения. Затем мы описываем функции IGV, которые позволяют выявлять нюансы в этих файлах. Мы используем серию отобранных практических случаев на основе клинических виньеток, с помощью которых читатель сможет взаимодействовать с клиническими данными NGS, используя программное обеспечение IGV для анализа различных типов клинически значимых вариантов относительно референсного генома человека. Эти клинические виньетки были подобраны для описания примеров некоторых сложностей интерпретации геномных данных и того, как использование IGV в рамках стандартного рабочего процесса может предоставить дополнительную интерпретационную информацию о вариантах, выходящую за рамки стандартных вызовов вариантов, генерируемых биоинформатическими алгоритмами. Визуальный осмотр геномных вариантов с помощью инструментов IGV позволяет выявить тонкие контекстные признаки (т. е. частоту вариантного аллеля, смещение цепи, тканеспецифический контекст), которые могут повлиять на интерпретацию геномных вариантов. Хотя данное исследование сосредоточено на использовании IGV для обнаружения и интерпретации соматических вариантов, представленные методы могут быть экстраполированы на герминальные варианты, включая анализ сложных вариантов и выявление мозаицизма.

Введение

В последние годы онкологическая помощь претерпела значительные изменения благодаря применению технологий секвенирования следующего поколения (NGS) для уточнения диагноза, прогноза и выбора терапии1. Тестирование NGS стало стандартом оказания помощи при различных типах опухолей для: 1) установления диагноза молекулярно определенной опухоли, 2) использования результатов анализа биомаркеров, не зависящих от типа опухоли, для принятия решений о терапии и 3) определения стратификации риска для конкретных типов опухолей2,3. Точные и своевременные результаты NGS и других тестов на биомаркеры стали критически важным компонентом ухода за пациентами и планирования лечения в онкологии.

Тестирование с помощью NGS обычно проводится либо в крупных референс-лабораториях, либо в госпитальных/академических лабораториях, если учреждения обладают достаточным опытом и ресурсами для разработки и поддержания таких методов тестирования. Организация Genomics Organization for Academic Laboratories (GOAL) была задумана как совместная сеть, ориентированная на обмен академическими знаниями и разделение затрат на реагенты4. Значительная часть усилий консорциума GOAL была направлена на проведение обучающих сессий по критически важным аспектам анализа и подготовки отчетов по клиническим исследованиям. Эти сессии были разработаны в формате практических занятий и включают интерактивный воркшоп по использованию integrative genomics viewer (IGV) для демонстрации его базовых и расширенных возможностей в геномной медицине.

IGV представляет собой инструмент визуализации данных, разработанный для того, чтобы пользователи могли легко анализировать данные NGS и другие большие наборы данных, поскольку большинство данных NGS слишком объемны и неудобны для работы без графического пользовательского интерфейса5. Изначально IGV не предназначался для клинического анализа вариантов. Однако благодаря простоте использования для всех специалистов по молекулярной биологии, независимо от их опыта в биоинформатике, он был широко внедрен во многих лабораториях как часть сложного рабочего процесса анализа данных6. Данное исследование было подготовлено с целью распространения этой информации среди широкого сообщества специалистов геномных лабораторий.

Клиническая необходимость использования IGV в рамках рабочего процесса включает выявление ошибок секвенирования, решение проблем, связанных со сложностями при определении геномных вариантов, а также анализ других рекуррентных перестроек, при которых дополнительная визуализация может помочь в правильной интерпретации данных7. Для работы с IGV требуются стандартные биоинформатические файлы, полученные в результате исследования NGS8. Основные функции программного обеспечения IGV позволяют визуализировать данные секвенирования и требуют настройки ряда предпочтений и опций для клинической интерпретации вариантов (Дополнительный файл 1).

Рабочий процесс секвенирования короткими reads характеризуется использованием стандартов файлов FASTQ, binary alignment map (BAM) и variant call format (VCF). NGS достигает высокой пропускной способности за счет параллельного генерирования миллионов коротких ридов. Хотя эта стратегия значительно ускоряет получение данных, каждый рид является лишь фрагментом исходной ДНК или РНК. Он прикрепляется к определенной позиции на проточной ячейке NGS с помощью адаптерной последовательности. Информация о последовательности и качестве оснований, полученная в результате оптической обработки, записывается в файлы FASTQ. Эти необработанные риды представляют собой нуклеотидные последовательности вместе с показателями качества для каждого основания. Поэтому одним из первых этапов обработки необработанных ридов является выравнивание каждого рида по референсному геному8. Поскольку каждому риду присваивается определенная позиция в референсном геноме с наибольшей вероятностью выравнивания, риды, соответствующие одной и той же локации, "наслаиваются" в каждом локусе; такие данные сохраняются в BAM-файле в соответствии со спецификациями sequence alignment mapping (SAM) (доступны по адресу https://samtools.github.io/hts-specs/SAMv1.pdf; проверено: 30.09.2025) (Рисунок 1A). Эту информацию можно визуально проанализировать с помощью браузера генома, такого как IGV. Как показано на Рисунке 1B, сравнение ридов друг с другом или с самой референсной последовательностью может выявить различия или несоответствия между нуклеотидными последовательностями. Сводки только по таким "вариантным" позициям по всему геному собираются в VCF-файл, который может быть значительно меньше по размеру, чем BAM-файл, но при этом содержать большую часть полезной информации, необходимой для анализа вариантов. По этой причине VCF-файл обычно является конечным результатом конвейеров поиска вариантов (Рисунок 1C). Таким образом, в то время как файлы FASTQ содержат необработанные данные о ридах и их качестве, BAM-файл дает представление о том, насколько достоверно эти риды картируются на геном, а VCF представляет различия между референсной последовательностью и последовательностью образца, предоставляя гораздо более управляемый объем данных для анализа с целью возможного составления отчета.

Шесть клинических виньеток в данном исследовании иллюстрируют типичные аналитические сценарии, связанные с выявлением соматических вариантов в молекулярных лабораториях, а также проблемы, затрудняющие правильное понимание и интерпретацию исходных данных. В целом, эти виньетки были выбраны для демонстрации все более сложных сценариев интерпретации и того, как использование расширенных функций IGV позволяет более детально описать комплексные геномные характеристики. Хотя данное исследование сосредоточено на интерпретации соматических вариантов, эти функции применимы и при использовании IGV для визуализации и интерпретации герминальных изменений6. Следует отметить, что термины, используемые в данной статье, основаны на химическом методе секвенирования путем синтеза и, где это уместно, включают другие аналогичные термины/понятия для других платформ.

Каждое клиническое описание начинается с краткого изложения клинического контекста, за которым следуют инструкции по исследованию варианта или вариантов и поиску ответа на вопрос: какой из обнаруженных вариантов (если таковые имеются) является истинным, а какой (если таковой имеется) — артефактом. Клинический контекст вместе с особенностями данных секвенирования имеет важное значение для ответа на этот вопрос.

Протокол

Представленные здесь данные представляют собой смесь симулированных и реальных данных NGS пациентов. При этом все данные пациентов были деидентифицированы путем удаления меток и извлечения чтений по одному локусу. Данный протокол соответствует применимым правилам комитетов по этике исследований с участием человека во всех учреждениях авторов.

1. Загрузка последней версии Integrative Genomics Viewer (IGV)

ПРИМЕЧАНИЕ: IGV — это бесплатная программа для загрузки, предназначенная для визуализации различных геномов, включая геном человека (https://igv.org/doc/desktop/#DownloadPage/). IGV периодически обновляется, чтобы включать новые версии транскриптов, функциональных элементов и треков, при этом самая актуальная версия обычно находится в верхней части списка.

  1. Загрузите файл с именем «IGV for Windows, Java Included», доступный по указанному выше адресу (URL), на рабочий стол; в зависимости от учреждения для этого могут потребоваться права администратора.
  2. Выберите сборку генома человека, которая планируется к использованию в отчетах (например, hg19 или hg38), доступную в IGV.
    ПРИМЕЧАНИЕ: В данном исследовании использовался IGV 2.19.7. В рамках этого протокола была загружена версия для Windows с интегрированным Java. IGV запускался с выделением оперативной памяти по умолчанию в размере 8Gb RAM. Настройки, рекомендованные во вкладке предпочтений (preferences) и других разделах IGV, указаны в Дополнительном файле 1 (Supplementary File 1).

2. Изучение клинических виньеток и загрузка необходимых файлов

  1. Перейдите в репозиторий GitHub: все файлы доступны для скачивания в репозитории GitHub https://github.com/Eitan177/Demo_IGV.
    ПРИМЕЧАНИЕ: в репозитории GitHub для каждого примера имеется файл сессии; загрузка этого файла избавляет от необходимости отдельно загружать файлы и переходить к соответствующему локусу, так как файл сессии выполняет эти действия автоматически.
  2. Загрузите файл сессии через меню «Файл». Нажмите File > Open Session и выберите соответствующий файл сессии.

3. Настройка трека покрытия

ПРИМЕЧАНИЕ: В IGV основное окно включает "трек покрытия". В некоторых контекстах даже небольшая доля ридов, содержащих специфические раковые варианты, может иметь клиническое значение. В связи с этим крайне важно достичь очень большой глубины прочтения в исследуемых участках генома. Если только 2% ридов содержат определенный вариант, для достоверного выявления этого варианта может потребоваться глубина прочтения в сотни или тысячи ридов — отсюда термин "глубокое секвенирование".

  1. Убедитесь в наличии дорожки покрытия: в верхнем меню выберите View > Preferences и перейдите на вкладку Alignments. В верхней части вкладки находится поле «Show coverage track». Убедитесь, что в нем установлен флажок.
  2. Установите клинически значимый порог для вариантов с низким уровнем экспрессии: перейдите на вкладку Alignments, как описано в шаге 3.1, и прокрутите страницу вниз до появления поля «Coverage allele-fraction». Установите в этом поле значение 0.01 и нажмите Save (после нажатия кнопки Save окно настроек должно закрыться).

4. Настройка мягкого обрезания ридов (soft-clipping)

ПРИМЕЧАНИЕ: Эта настройка неоценима для обнаружения крупных структурных вариантов, таких как перестройки генов, изменения числа копий или комбинированные события инсерции-делеции. Углубленные примеры — в частности, посвященные амплификациям и делециям EGFR — демонстрируют, как чтения с «мягкой обрезкой» (soft-clipped reads) могут подтвердить наличие структурных вариантов, которые в противном случае могли бы быть пропущены стандартными методами поиска вариантов.

  1. Включите мягкую обрезку (soft-clips): в верхнем меню выберите View > Preferences и перейдите на вкладку Alignments. Прокрутите вниз до поля Show soft-clipped bases и убедитесь, что флажок установлен (Supplementary File 1), чтобы отобразить частично выровненные риды — те, края которых не сопоставляются с референсом и оказываются "обрезанными".

5. Клинические примеры

  1. Клинический случай №1: Отличие истинного патогенного варианта KRAS (гомолог онкогена вируса саркомы крыс Кирстена) от артефакта секвенирования.
    ПРИМЕЧАНИЕ: В случае А представлен мужчина 65 лет с недавно диагностированной аденокарциномой легкого, при этом гистологическая оценка показала примерно 80% опухолевых клеток. Профилирование методом NGS выявило вариант KRAS NM_004985.5 c.34G>T (p.G12C), который является известной драйверной мутацией при немелкоклеточном раке легкого (НМРЛ). Полученный миссенс-вариант KRAS c.34G>T (p.G12C) встречается примерно в 13% аденокарцином легкого и дает основание для назначения таргетной терапии9. В случае B представлена женщина 54 лет с подтвержденной саркомой (расчетно 50% опухоли и 50% нормальной ткани). В этом образце был выявлен идентичный вариант KRAS c.34G>T (p.G12C). Однако, поскольку вариант KRAS c.34G>T (p.G12C) редко описывается при саркоме, его присутствие вызывает подозрение на возможный артефакт секвенирования. 
    1. Рабочий процесс в IGV (файл сессии KRAS.xml)             
      1. Загрузка данных: выберите Hg19 в выпадающем списке геномов, загрузите bam-файл kras2A_fixed_backbone_2A_new_final_sorted.bam и перейдите к региону chr12:25,398,281–25,403,833, чтобы сфокусироваться на области гена KRAS. Обратите внимание, что индексный файл (с тем же именем, что и bam-файл, но с расширением .bai) должен находиться в той же директории, что и bam-файл.  
      2. Анализ покрытия и VAF: изучите кодон 12 в экзоне 2 (NM_004985.5) и нажмите на позицию варианта в треке покрытия, чтобы отобразить глубину чтения в этой позиции. Отметьте замену G→T (трансверсия) с VAF 35%–40%, что высоко характерно для гетерозиготной клональной драйверной мутации (Рисунок 2A), особенно в контексте опухолевой клеточности около 80%.   
      3. Проверка на смещение по цепи (StrandBias): используйте цветовую маркировку по цепям (см. Дополнительный файл 1, шаг 4), чтобы выявить распределение прямой (красный): обратной (синий) цепей примерно 50:50 в образце легкого.  
      4. Повторите шаги 5.1.1.1–5.1.1.3 для случая B (образец саркомы): загрузите bam-файл kras2B_fixed_backbone_2B_new_final_sorted.bam и отметьте VAF <1% и почти исключительную поддержку прямой цепью, что указывает на артефакт ПЦР/выравнивания (Рисунок 2B).
  2. Клинический случай №2: Разрешение ошибки классификации многонуклеотидного варианта (MNV).
    ПРИМЕЧАНИЕ: Женщине 50 лет с метастатической меланомой проводится профилирование опухоли на основе NGS. Анализ выявляет потенциальную мутацию BRAF (протоонкоген B-Raf, серин-треониновая киназа) c.1798_1799delinsAA. В то время как BRAF NM_004333.6: c.1799T>A (p.V600E) более распространен при различных солидных опухолях, вариант BRAF c.1798_1799delinsAA (p.V600K) относительно специфичен для меланомы, так как УФ-излучение может индуцировать переходы C > T в дипиримидинах10. Согласно правилам HGVS, два однонуклеотидных варианта (SNV), находящиеся в цис-положении, должны быть обозначены как один MNV. Во многих случаях биоинформатический конвейер может ошибочно идентифицировать этот сложный вариант как два соседних SNV в цис-положении: BRAF c.1798G>A и BRAF c.1799T>A. Поскольку существуют технические (связанные с программой поиска вариантов) и биологические (различие цис против транс) аспекты, существует опасение, что мутация может быть неправильно указана в итоговом заключении, если визуализация данных не будет проведена во время клинического обзора.      
    1. Рабочий процесс в IGV (файл сессии BRAF.xml)           
      1. Загрузка данных: выберите Hg38 в выпадающем списке геномов, загрузите bam-файл kras2B_fixed_backbone_2B_new_final_sorted.bam и перейдите к региону chr7:140,453,136–140,753,336. Обратите внимание, что индексный файл (с тем же именем, что и bam-файл, но с расширением .bai) должен находиться в той же директории, что и bam-файл.
      2. Увеличение масштаба кодона 600 гена BRAF: отметьте динуклеотидную замену GT→AA на основании соседних позиций трека покрытия, которые окрашены в зеленый и синий цвета вместо серого, что соответствует p.V600K. 
      3. Поиск двух отдельных SNV для определения, находятся ли они в цис или транс-положении: отметьте, что оба SNV картируются на одни и те же риды и находятся в цис-положении.  
      4. Анализ цепей и покрытия: используйте цветовую маркировку ридов для демонстрации примерно равной поддержки прямой и обратной цепями (см. Дополнительный файл 1, шаг 4), а также VAF более 50%, что характерно для клонального драйвера. Порог трека покрытия 0,01 (см. настройки в Дополнительном файле 1, шаг 3) гарантирует, что частичные субклоны (если они есть) останутся видимыми (Рисунок 2C).  
      5. Анализ контекста и номенклатура MNV: две нуклеотидные замены расположены рядом друг с другом. Согласно экспертному консенсусу, SNV на расстоянии до 50 bp, которые картируются на один и тот же рид последовательности, следует определять как один "сложный" или "delins" вариант11. 
  3. Клинический случай №3: Изучение инсерции в экзоне 9 гена KIT (протоонкоген KIT, рецепторная тирозинкиназа) при гастроинтестинальной стромальной опухоли (ГИСО)
    ПРИМЕЧАНИЕ: Пациенту мужчине 58 лет с гастроинтестинальной стромальной опухолью проводится резекция, и назначается тестирование методом NGS. Результаты указывают на возможный вариант в гене KIT. Мутации KIT являются частыми драйверами при ГИСО, встречаясь примерно в 75% случаев, и являются мишенями для терапии. После активирующих мутаций в экзоне 11, активирующие мутации в экзоне 9 гена KIT являются наиболее распространенными выявленными драйверами, хотя ГИСО с мутацией в экзоне 9 и ГИСО с мутацией в экзоне 11 по-разному реагируют на ингибиторы тирозинкиназы12. 
    1. Рабочий процесс в IGV (файл сессии KIT.xml)
      1. Загрузка данных: выберите геном Hg19, загрузите BAM-файл KITdupmod2.bam и убедитесь, что индексный файл (с тем же именем, что и bam, но с расширением .bai) находится в той же директории. Перейдите к региону chr4:55,592,144-55,592,257, соответствующему части экзона 9 гена KIT.
      2. Сжатие вида: щелкните правой кнопкой мыши по треку выравнивания и выберите  Squished  (Сжатый), чтобы уплотнить вид (Рисунок 3A).
      3. Поиск вставки: найдите маркер инсерции в форме наконечника стрелки непосредственно над треком покрытия, расположенный между позициями 55,592,178 и 55,592,179, что указывает на короткую вставку (Рисунок 3B,C).
      4. Работа с вставкой: нажмите на наконечник стрелки, чтобы развернуть вид, и щелкните по одному из ридов, заполняющих разрыв основаниями, чтобы просмотреть детали во всплывающем окне. Сравните вставленную последовательность с референсной, чтобы определить, является ли она дупликацией (Рисунок 3D,E).
      5. Анализ покрытия: нажмите на трек покрытия непосредственно рядом с маркером-стрелкой вставки, чтобы отобразить количество поддерживающих ридов; это значение можно сравнить с общим количеством ридов для определения приблизительной частоты вариантного аллеля (VAF), в данном случае ~28%.
      6. Проверка смещения по цепи: отсортируйте риды по цепи и просмотрите мягко обрезанные (soft-clipped) основания (см. Дополнительный файл 1, раздел 3), чтобы увидеть область интереса рядом с инсерцией в обратных ридах (Рисунок 3F).
  4. Клинический случай №4: Изучение делеции в экзоне 19 гена EGFR (рецептор эпидермального фактора роста) при немелкоклеточном раке легкого (НМРЛ).
    ПРИМЕЧАНИЕ: Женщине 70 лет с недавно диагностированным НМРЛ проводится хирургическая резекция образования. NGS назначается для секции ткани с достаточной чистотой опухоли, и результаты показывают возможный вариант в гене EGFR. Многие мутации EGFR чувствительны к ингибиторам тирозинкиназы, и этот вариант может повлиять на терапию и прогноз пациента13.
    1. Рабочий процесс в IGV (файл сессии EGFR.xml)
      1. Загрузка данных: выберите геном Hg19, загрузите bam-файл EGFRE746_A750delmod.bam, убедитесь, что индексный файл (с тем же именем, что и bam, но с расширением .bai) находится в той же директории, и перейдите к региону chr7:55,242,420-55,242,513, соответствующему части экзона 19 гена EGFR.
      2. Анализ делеции с помощью трека покрытия: изучите трек покрытия, чтобы выявить небольшой участок с более низким покрытием, который не находится в концах ридов (Рисунок 4A,B). Анализ трека покрытия показывает снижение покрытия на небольшом участке экзона 19.
      3. Анализ делеции с помощью ридов: разверните вид выравнивания, чтобы показать риды с разрывом выравнивания, который представлен черной линией внутри рида (Рисунок 4C,D).
      4. Анализ геномного контекста: изучите нуклеотидную последовательность референса в области делеции и непосредственно вокруг нее. Оцените результат определения делеции с учетом ее положения в референсной последовательности, так как делеции в гомополимерных или повторяющихся регионах могут быть артефактами секвенирования, особенно при низкой частоте вариантного аллеля. См. раздел Просмотр небольшой делеции в Дополнительном файле 2 для подробного описания рабочего процесса.
  5. Клинический случай №5: Изучение изменений EGFR у пациента с глиобластомой.
    ПРИМЕЧАНИЕ: Женщине 77 лет с глиобластомой с диким типом IDH проводится секвенирование следующего поколения (NGS). Результаты указывают на потенциальное увеличение числа копий EGFR и потенциальную перестройку EGFRvIII (делеция экзонов 2–7). И амплификация EGFR, и изменения EGFRvIII имеют прогностическое и терапевтическое значение при глиобластоме. Кроме того, эти два изменения часто сопутствуют друг другу, что означает, что наличие одного может подтвердить достоверность другого при обнаружении на низком уровне.
    1. Рабочий процесс в IGV (файл сессии copynumber.xml):
      1. Загрузка данных: выберите геном Hg38, загрузите файл сегментации proband.seg и образцы-компараторы  c1.seg-c9.seg, перетащив их в окно IGV. Перейдите к Chr7.
        ПРИМЕЧАНИЕ: Файлы сегментации, созданные с помощью CNVKit, доступны для скачивания. Полный рабочий процесс использования CNVKit для количественного определения числа копий выходит за рамки данного исследования. Однако, кратко: использовалась версия CNVKit 0.9.9 (доступна для скачивания по адресу https://github.com/etal/cnvkit) с заранее подготовленным объединенным референсом, состоящим из нормальных эуплоидных образцов. Входные данные включают bed-файл, содержащий 9 144 локации зондов остова CNV, распределенных по геному. Важным моментом здесь является то, что детали входных данных и параметров конвейера числа копий менее важны, чем тот факт, что образцы обрабатываются с использованием одинаковых настроек для всех образцов в одном запуске. Это облегчает распознавание системной ошибки.
      2. Оценка тепловой карты: сравните относительную интенсивность цвета между интересующим образцом (найдите строку тепловой карты, соответствующую этому образцу, помеченную как proband) и другими образцами (c1-9), чтобы отличить истинные изменения числа копий от артефактов.
        ПРИМЕЧАНИЕ: Вертикальное визуальное сравнение локуса по всем образцам является способом выявления аномалий (качественные различия на основе цветовых различий между строками, а не количественные различия) в данном локусе в каждом образце относительно фона. См. Рисунок 5 и раздел Просмотр изменений числа копий в Дополнительном файле 2 для подробных шагов.
  6. Клинический случай №6: Изучение EGFRvIII у пациента с глиобластомой.
    ПРИМЕЧАНИЕ: У того же пациента также имеются признаки перестройки EGFRvIII (делеция экзонов 2–7). И амплификация EGFR, и изменения EGFRvIII имеют прогностическое и терапевтическое значение при глиобластоме. Кроме того, эти два изменения часто сопутствуют друг другу, что означает, что наличие одного может подтвердить достоверность другого при обнаружении на низком уровне.
    1. Рабочий процесс в IGV (файл сессии egfr_vIII.xml):
      1. Загрузка данных: выберите геном Hg19, загрузите bam-файл пациента proband.bam, убедитесь, что индексный файл (с тем же именем, что и bam, но с расширением .bai) находится в той же директории, и перейдите к гену EGFR.
      2. Визуализация точек разрыва EGFRvIII: настройте вид для индивидуального изучения потенциальных точек разрыва (выше экзона 2 и ниже экзона 7 для EGFRvIII) и выполните сортировку по основаниям ('sort-by-base'  (или используйте сочетание клавиш Ctrl-s в Windows/Linux или Cmd-s в Mac) в точках разрыва, чтобы визуализировать скопления мягко обрезанных ридов.
      3. Выравнивание ридов с помощью BLAT: щелкните правой кнопкой мыши по мягко обрезанной последовательности и выберите  BLAT sequence (IGV использует настройки по умолчанию из UCSC, см. https://ucsc.crg.eu/FAQ/FAQblat.html для параметров BLAT по умолчанию). Нажмите на первую строку и изучите Blat track, который появится в нижней части раздела треков IGV.
        ПРИМЕЧАНИЕ: Даже одного рида, который выравнивается на стыке экзона 1/интрона 1 и на стыке интрона 6/экзона 7, может быть достаточно для подтверждения EGFRvIII, при условии, что перекрестное загрязнение из другого образца исключено как причина появления этого рида. См. Рисунок 6 и раздел Просмотр структурной перестройки в Дополнительном файле 2 для подробных шагов.

Результаты

Следует отметить, что данное исследование сосредоточено на описании нюансов анализа вариантов в IGV для подготовки клинических отчетов. Окончательное формирование клинического отчета должно основываться на валидированном пайплайне, критериях качества и политике отчетности каждой отдельной лаборатории. Полное обсуждение этой важной темы выходит за рамки настоящего исследования; тем не менее, рекомендованные стандарты и руководства, разработанные Американским колледжем медицинской генетики и геномики и Ассоциацией молекулярной патологии7, регулярно внедряются в практику клинических лабораторий.

Интерпретация клинического случая №1:

Учитывая высокую VAF, сбалансированное распределение цепей и известную частоту встречаемости мутации KRAS c.34G>T (p.G12C) при раке легкого (Рисунок 2A), вариант в случае A может стать основанием для проведения таргетной терапии и, следовательно, имеет решающее значение для клинического отчета. Несмотря на положительный результат по тому же варианту KRAS c.34 G>T во втором случае (саркома) (Рисунок 2B), наблюдается несколько признаков ложноположительного результата: (1) зарегистрированная частота аллеля варианта (VAF) составляет ~1%, что значительно ниже ожидаемого уровня для драйверного события в образце с даже низкой расчетной опухолевой клеточностью (20%) и (2) риды, подтверждающие этот вариант, демонстрируют смещение цепей, проявляясь почти исключительно на прямой цепи. В сочетании с отсутствием биологического правдоподобия для данного типа рака, эти данные свидетельствуют о том, что находка в случае B является артефактом.

Интерпретация клинического случая №2:

В данной иллюстрации показаны несколько различных типов ошибок, о которых должны знать клиницисты. Во-первых, программы для выявления вариантов (variant callers) могут правильно или неправильно определять соседние генетические варианты либо как два SNV, либо как один MNV (Рисунок 2C). Это связано с различиями в реализации алгоритмов выявления вариантов с учетом гаплотипов в программах для анализа соматических вариантов. Лишь несколько недавно опубликованных инструментов выявления вариантов включают эту функцию14,15. Во-вторых, технические различия и вариации в номенклатуре, подобные этим, передаются в внешние базы данных центрами секвенирования, использующими разные биоинформатические конвейеры. Таким образом, базы данных могут содержать несколько разных записей о том, что должно быть указано как один генетический вариант. Если фазирование базы данных не проводится периодически, это может привести к различным неблагоприятным последствиям при последующей клинической интерпретации. В совокупности эти возможные источники ошибок могут привести к составлению неправильного отчета о состоянии пациента. Этот сложный сценарий подчеркивает ценность визуализации вариантов с использованием высококачественного программного обеспечения, такого как IGV.

Интерпретация клинического случая №3:

Учитывая поддержку дупликации при многократном чтении и известный механизм конститутивной активации KIT при дупликациях в экзоне 9 при ГИСО, можно сделать вывод, что данный вариант KIT c.1504_1509dup (p.A502_Y503dup) является реальным, а не артефактом (Рисунок 3). Мутации KIT являются частыми драйверами при ГИСО, встречаясь примерно в 90% случаев. Точная характеристика варианта в данном случае имеет решающее значение, поскольку, хотя активирующие мутации в экзоне 11 являются наиболее распространенными, ГИСО с мутациями в экзоне 9 по-разному реагируют на чувствительность к ингибиторам тирозинкиназы, что меняет терапевтический подход. Учитывая клиническую значимость мутаций KIT при ГИСО, этот вариант следует включить в окончательный отчет.

Интерпретация клинического случая №4:

С учетом трека покрытия, стереотипного вида коротких делеций, поддержки ридами и известного механизма конститутивной активации EGFR делеции в 19-м экзоне при НМРЛ, мы можем сделать вывод, что это EGFR Вариант c.2235_2249del (p.E746_A750del) является истинным, а не артефактом (Рисунок 4). Многие EGFR мутации, включая эту хорошо известную делецию в экзоне 19, обладают высокой чувствительностью к ингибиторам тирозинкиназы. Учитывая клиническую значимость EGFR при наличии мутаций в НМРЛ данный вариант должен быть включен в окончательный отчет.

Интерпретация клинического случая №5 и случая №6:

Данные тепловых карт подтверждают амплификацию EGFR, а анализ точки разрыва между экзонами 1 и 8, проведенный с помощью BLAT, подтверждает оба этих результата у данного пациента (Рисунок 5 и Рисунок 6). Амплификация EGFR обычно считается прогностическим фактором более агрессивного течения заболевания, а перестройка гена EGFRvIII является специфическим биомаркером ГБМ и потенциально может быть мишенью для терапии16,17.

Отдельные рабочие процессы можно воспроизвести, используя файлы, сохраненные в основной ветке репозитория GitHub https://github.com/Eitan177/Demo_IGV (обновлено 09.06.2026), который содержит шесть файлов сессий (по одному для каждого примера), пять пар файлов bam и bai (по одной для каждого примера, использующего файл выравнивания) и 10 файлов seg для пятого примера, в котором используются файлы сегментации вместо файлов выравнивания.

figure-results-1
Рисунок 1: Стандарты файлов NGS и рабочий процесс секвенирования. (A) Короткие риды, полученные в проточной кювете, отслеживаются с помощью оптических измерений и сохраняются в формате FASTQ, который включает как данные о последовательности, так и показатели качества для каждого основания. Затем эти риды сортируются и выравниваются по референсному геному, в результате чего создается BAM-файл, в котором каждый рид «накладывается» на соответствующий ему локус. (B) Расхождения между референсом и ридами (например, точечные мутации, небольшие индели) выявляются алгоритмами поиска вариантов (variant-calling). (C) Наконец, эти обнаруженные варианты объединяются в VCF-файл, в котором обобщены их позиции, референсные/альтернативные основания и другие данные аннотации. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

figure-results-2
Рисунок 2: Визуализация вариантов KRAS c.34G>T (p.G12C) и BRAF c.1798_1799delinsAA (p.V600K) с помощью IGV. (A) Визуализация реального варианта (KRAS c.34G>T (p.G12C)) в IGV, демонстрирующая высокую глубину прочтения (тысячи ридов) и ~35–40% ридов с заменой G→T. Прямые (красные) и обратные (синие) риды сбалансированы, что указывает на истинную гетерозиготную мутацию. (B) Предполагаемый артефакт в нерелевантной ткани, демонстрирующий вариант с минимальной поддержкой прочтениями (1% VAF). Большинство вариантов прочтения наблюдаются на прямой цепи (красная), что указывает на смещение цепей (strand bias). (C) Сложный вариант BRAF c.1798_1799delinsAA (p.V600K) в IGV, выявляющий двухнуклеотидную замену (GT→AA) в cis. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-3
Рисунок 3: Визуализация небольшой инсерции. (A) «Сжатый» (Squished) вид экзона 9 KIT в IGV помогает определить область интереса. (B) Область интереса (красная рамка), определенная путем визуализации полосы инсерции и софт-клиппированных (soft clipped) оснований. (C) Установка «Расширенного» (Expanded) вида в IGV для визуализации инсерции. (D) Нажатие на полосу инсерции (красная рамка) отображает вставленную последовательность. (E) Вставленная последовательность сравнивается с референсной последовательностью для идентификации дублированных оснований. (F) Сортировка ридов по направлению цепи (read-strand), демонстрирующая, что софт-клиппированные основания соответствуют инсерции в обратных ридах. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

figure-results-4
Рисунок 4: Визуализация небольшой делеции. (A) «Сжатый» вид экзона 19 EGFR, демонстрирующий делецию, присутствующую в многочисленных ридах. (B) Использование трека покрытия для анализа количества ридов в позициях внутри делеции и прилегающих к ней. (C) «Развернутый» вид, демонстрирующий делецию и позволяющий определить количество удаленных оснований. (D) Сравнение с референсной последовательностью (красная рамка) позволяет идентифицировать удаленные основания. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-5
Рисунок 5: Визуализация увеличения числа копий. (A) Файл seg содержит шесть столбцов: ID образца, хромосома, начало, конец, маркеры в сегменте и среднее значение сегмента. (B) Загрузка файлов seg непосредственно в IGV обеспечивает удобную визуализацию. (C) Визуализация данных в масштабе всего генома. Каждый образец отображается в виде строки данных, где цвета определяют значения: красный для >0 и синий для <0, при этом более интенсивные цвета отражают значения, более удаленные от 0. При открытии интересующего образца и девяти случайных образцов из того же запуска результаты представляются в виде многообразцовой теплокарты из десяти строк. Интересующий образец выделен красной рамкой внизу. (D) При сужении области просмотра до локуса EGFR в интересующем образце внизу видна красная полоса, а в случайных образцах — белые или синие полосы. Эта разница в цвете между интересующим образцом и случайными образцами в других строках демонстрирует, что определение амплификации в интересующем образце в данном локусе превышает уровень фона или шума. (E) При масштабировании до chr7 заметен контраст между локусом, содержащим EGFR в нашем образце, и его отсутствием в случайных образцах. Амплификация EGFR отображается в виде красной полоски в нижнем образце. (F) При сужении области просмотра до локуса MET амплификация MET повторяется в разной степени в девяти случайных образцах, а также в интересующем образце, что позволяет предположить, что данное определение амплификации является артефактом. Это подчеркивает различие во внешнем виде между истинным определением числа копий в локусе EGFR и артефактом. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-6
Рисунок 6: Визуализация перестройки гена EGFRvIII. Перед началом работы с этим случаем убедитесь, что настроена визуализация мягко обрезанных (soft-clipped) оснований (дополнительные сведения см. в Дополнительном файле 1). (A) Перейдите к первому потенциальному месту стыка и установите вид трека выравнивания на «Squished». (B) Перемещайтесь по локусу, итеративно применяя сочетание клавиш для сортировки по основаниям «control-s», пока в верхней части трека выравнивания не станет виден накопитель (pileup) аналогично мягко обрезанных ридов. Чем больше количество similarly soft-clipped ридов (красный квадрат) в накопителе, тем выше достоверность структурной перестройки. (C) Инструмент BLAT извлекает последовательность мягко обрезанных оснований и определяет, где в геноме присутствует эта последовательность, вместе с количественным показателем, измеряющим степень соответствия последовательности конкретной последовательности в целевой базе данных. Выбор определенной строки приведет к переходу в соответствующее местоположение. (D) Повторное использование функции сортировки по основаниям «control-s» демонстрирует накопитель мягких обрезок, на этот раз с противоположной стороны ридов. Чтобы подтвердить отсутствие дополнительных оснований в образце относительно референса hg38, щелкните правой кнопкой мыши по риду с серией мягко обрезанных оснований и снова примените BLAT к этим основаниям. В появившейся таблице отображается первая точка разрыва стыка — локус, который был визуализирован изначально: стык экзона 1 и интрона 1. (E) Выбор верхней строки возвращает к первой точке разрыва. Основания в месте стыка выравнивания по референсу BLAT идентичны мягко обрезанным основаниям, использованным в качестве запроса, что указывает на то, что вся серия мягко обрезанных ридов содержится в выравнивании референсной последовательности. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Дополнительный файл 1: Рекомендуемые настройки IGV.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 2: Сокращенные схемы рабочих процессов.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Точный анализ вариантов для клинической отчетности зависит от сложных биоинформатических алгоритмов и включения визуального анализа сложных вариантов с использованием IGV5,6. Данное исследование было разработано с целью создания краткого руководства по рекомендуемым настройкам для визуализации простых и сложных геномных перестроек в IGV (Дополнительный файл 1). В этом исследовании основное внимание уделяется распространенным соматическим изменениям и методам их анализа в IGV.

Протокол начинается с оценки простой substitutions-мутации (Рисунок 2A) и сложной substitutions-мутации (Рисунок 2C) с особым вниманием к определению того, является ли выявленный результат реальным или представляет собой артефакт. Затем рассматриваются простая инсерция (Рисунок 3) и простая делеция (Рисунок 4), с демонстрацией того, как эти изменения выглядят в IGV. В завершение обсуждаются сложные геномные изменения, включая вариации числа копий (Рисунок 5) и структурные перестройки (Рисунок 6). Сокращенные рабочие процессы, описывающие основные этапы анализа каждой из этих особенностей, обобщены в Дополнительном файле 2. Данное исследование направлено на то, чтобы познакомить читателя с тем, как различные геномные изменения отображаются в IGV5.

Следует отметить, что IGV не используется как инструмент конвейера для независимого обнаружения вариантов. Хотя это выходит за рамки данной статьи, в правилах и процедурах лаборатории следует прописать вопросы, касающиеся регистрируемых вариантов, исходя из ограничений валидации анализа по частоте аллелей варианта и глубине покрытия. Для исследовательских лабораторий настоятельно рекомендуется, а для клинических лабораторий требуется1,7 определить, требуется ли ортогональное подтверждение вариантов при определенных обстоятельствах, а также учесть сложности, связанные с версиями биоинформационного программного обеспечения и межиндивидуальной вариабельностью при визуальной интерпретации.

Раскрытие информации

Все авторы заявляют об отсутствии конфликта интересов.

Благодарности

Мы выражаем благодарность всем разработчикам программного обеспечения IGV, а также Национальным институтам здравоохранения (NIH) за грант  U24CA258406, в рамках которого в настоящее время осуществляется разработка IGV. Финансирование разработки данного исследования не предоставлялось.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
BLATПоиск BLAT по геномуhttps://genome.ucsc.edu/cgi-bin/hgBlatОтдельная веб-страница BLAT. API BLAT доступен в IGV, дополнительная установка не требуется
CNVKitGitHubhttps://github.com/etal/cnvkitПубличный репозиторий GitHub с бесплатным доступом к CNVKit. Инструкции по загрузке и запуску CNVKit также доступны здесь.
Файл сегмента компаратора №1 для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c1.segФайлы числа копий
Файл сегмента компаратора №2 для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c2.segФайлы числа копий
Файл сегмента компаратора №3 для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c4.segФайлы числа копий
Файл сегмента компаратора №4 для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c5.segФайлы числа копий
Файл сегмента компаратора №5 для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c6.segФайлы числа копий
Файл сегмента компаратора №6 для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c7.segФайлы числа копий
Файл сегмента компаратора №7 для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c8.segФайлы числа копий
Файл сегмента компаратора №8 для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c9.segФайлы числа копий
Файл сегмента компаратора для примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c3.segФайлы числа копий
Последовательность генома человекаПоследовательность генома человекаhttps://hgdownload.soe.ucsc.edu/goldenPath/hg38/bigZips/latest/hg38.fa.gzЗагружаемый fasta-файл, содержащий сборку генома человека Hg38.  Доступно внутри IGV, дополнительная загрузка не требуется
Последовательность генома человекаПоследовательность генома человекаhttps://hgdownload.soe.ucsc.edu/goldenPath/hg19/bigZips/latest/hg19.fa.gzЗагружаемый fasta-файл, содержащий сборку генома человека Hg19. Доступно внутри IGV, дополнительная загрузка не требуется
Пакет ПО IGVПО IGVhttps://data.broadinstitute.org/igv/projects/downloads/2.19/IGV_Win_2.19.7-WithJava-installer.exeПО IGV версии 2.19.7 с Java (JDK 21), бесплатно для загрузки. Данная ссылка предназначена для Windows, однако также доступны ссылки для Linux и Mac.
Файл сегмента для случая примера №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/proband.segФайлы числа копий
Репозиторий учебного пособия на GitHubGitHubhttps://github.com/Eitan177/Demo_IGV/tree/mainПубличный репозиторий GitHub со всеми файлами, необходимыми для воспроизведения шести примеров
Пример №1GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/KRAS.xmlФайлы сессий
Индекс bai случая A примера №1GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/kras2A_fixed_backbone_
2A_new_final_sorted.bam.bai
Файлы выравнивания
Файл выравнивания bam случая A примера №1GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/kras2A_fixed_backbone_
2A_new_final_sorted.bam
Файлы выравнивания
Индекс bai случая B примера №1GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/kras2B_fixed_backbone_
2B_new_final_sorted.bam.bai
Файлы выравнивания
Файл выравнивания bam случая B примера №1GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/kras2B_fixed_backbone_
2B_new_final_sorted.bam
Файлы выравнивания
Пример №2GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/BRAF.xmlФайлы сессий
Индекс bai примера №2 GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/fig2C_braf_v600k_2bp_
backbone_2CD_new_final_sorted.bam.bai
Файлы выравнивания
Файл выравнивания bam примера №2 GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/fig2C_braf_v600k_2bp_
backbone_2CD_new_final_sorted.bam
Файлы выравнивания
Пример №3GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/KIT.xmlФайлы сессий
Файл индекса bai примера №3GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/KITdupmod2.baiФайлы выравнивания
Файл выравнивания bam примера №3GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/KITdupmod2.bamФайлы выравнивания
Пример №4GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/EGFR.xmlФайлы сессий
Файл выравнивания примера №4GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/EGFRE746_A750delmod.bamФайлы выравнивания
Индекс bai примера №4GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/EGFRE746_A750delmod.baiФайлы выравнивания
Пример №5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/copynumber.xmlФайлы сессий
Пример №6GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/egfr_vIII.xmlФайлы сессий
Индекс bai примера №6GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/proband.baiФайлы выравнивания
Файл выравнивания bam примера №6GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/proband.bamФайлы выравнивания

Ссылки

  1. Tjota MY, Segal JP, Wang P. Clinical utility and benefits of comprehensive genomic profiling in cancer. J Appl Lab Med. 2024;9(1):76-91.
  2. Freedman AN, et al. Use of next-generation sequencing tests to guide cancer treatment: results from a nationally representative survey of oncologists in the United States. JCO Precis Oncol. 2018;2:PO.18.00169.
  3. Ghoreyshi N, et al. Next-generation sequencing in cancer diagnosis and treatment: clinical applications and future directions. Discov Oncol. 2025;16:578.
  4. Aisner DL, et al. The Genomics Organization for Academic Laboratories (GOAL): A vision for a genomics future for academic pathology. Acad Pathol. 2023;10(3):100090.
  5. Robinson JT, Thorvaldsdóttir H, Wenger AM, Zehir A, Mesirov JP. Variant review with the Integrative Genomics Viewer (IGV). Cancer Res. 2017;77(21):e31-e34.
  6. Thorvaldsdóttir H, Robinson JT, Mesirov JP. Integrative Genomics Viewer (IGV): high-performance genomics data visualization and exploration. Brief Bioinform. 2013;14(2):178-192.
  7. Richards S, et al. Standards and guidelines for the interpretation of sequence variants: a joint consensus recommendation of the American College of Medical Genetics and Genomics and the Association for Molecular Pathology. Genet Med. 2015;17(5):405-424.
  8. Larson NB, Oberg AL, Adjei AA, Wang L. A clinician's guide to bioinformatics for next-generation sequencing. J Thorac Oncol. 2023;18(2):143-157.
  9. Jänne PA, et al. Adagrasib in non-small-cell lung cancer harboring a KRAS G12C mutation. N Engl J Med. 2022;387(2):120-131.
  10. Vandenberg BN, et al. Contributions of replicative and translesion DNA polymerases to mutagenic bypass of canonical and atypical UV photoproducts. Nat Commun. 2023;14(1):2576.
  11. Dunn T, Narayanasamy S. vcfdist: accurately benchmarking phased small variant calls in human genomes. Nat Commun. 2023;14(1):8149.
  12. Trent JC. Toward personalized, targeted therapy of gastrointestinal stromal tumor. Gastrointest Cancer Res. 2008;2(5):256-257.
  13. Xu CW, et al. Molecular characteristics and clinical outcomes of EGFR Exon 19 C-helix deletion in non-small cell lung cancer and response to EGFR TKIs. Transl Oncol. 2020;13(9):100791.
  14. Guille A, et al. A benchmarking study of individual somatic variant callers and voting-based ensembles for whole-exome sequencing. Brief Bioinform. 2024;26(1):bbae697.
  15. Cooke DP, Wedge DC, Lunter G. A unified haplotype-based method for accurate and comprehensive variant calling. Nat Biotechnol. 2021;39(7):885-892.
  16. Ezzati S, Salib S, Balasubramaniam M, Aboud O. Epidermal Growth Factor Receptor inhibitors in glioblastoma: current status and future possibilities. Int J Mol Sci. 2024;25(4):2316.
  17. Vivanco I, et al. Differential sensitivity of glioma- versus lung cancer-specific EGFR mutations to EGFR kinase inhibitors. Cancer Discov. 2012;2(5):458-471.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

VCFBAM
Видео скоро будет доступно

Похожие статьи