Этот протокол описывает реализацию системы контроля качества для выявления межиндивидуальных загрязнений и несоответствий в данных секвенирования следующего поколения путём проверки генетической идентичности пар образцов внутри индивидуумов.
Методическая статья
Этот протокол описывает реализацию системы контроля качества для выявления межиндивидуальных загрязнений и несоответствий в данных секвенирования следующего поколения путём проверки генетической идентичности пар образцов внутри индивидуумов.
Высокопроизводительная обработка биообразцов пациентов с помощью секвенирования следующего поколения и сравнение молекулярных данных с клиническими данными на уровне пациента и образцов требуют точного отслеживания и сопоставления идентификаторов образцов по всей цепочке хранения биообразцов и имеют решающее значение для надёжной интерпретации результатов испытаний с биомаркерами. Помимо отслеживания отдельных этапов в процессах обработки образцов и данных, биоинформатика может использоваться для подтверждения того, что образцы происходят от одного и того же пациента. Здесь демонстрируется использование биоинформатического рабочего процесса для выявления совпадающих образцов, происходящих от одного и того же человека. Рабочий процесс анализа подходит для сравнения и проверки любых двух или более пар наборов данных NGS на происхождение образцов пациентов. Алгоритм оценки, основанный на сравнении образцов по всему геному, позволяет пользователю определить, происходят ли два образца от одного и того же человека. В частности, для идентификации и сравнения образцов используются однонуклеотидные полиморфизмы (SNP) внутри выбранных блоков дисбаланса связывания. Были выявлены пороговые комбинации для разрешительного и строгого отбора совпадающих и несовпадающих выборок. Полезность этого протокола была продемонстрирована в его применении для контроля качества и валидации клинических образцов тканей опухоли и крови, охватывающих различные омикс-методы более чем 2000 пациентов.
Крупномасштабный сбор и анализ клинических образцов требуют точного отслеживания образцов вдоль их цепочки хранения, поскольку правильное сопоставление молекулярных данных из одного или другого метода, а также клинических данных на уровне пациентов и образцов необходимо для точной интерпретации и принятия обоснованных решений. Несмотря на серьёзные усилия по оптимизации протоколов обработки образцов в рамках хорошей клинической практики, обмен образцов или неправильная маркировка могут происходить на различных этапах — от биопсии/извлечения образца до этапов подготовки и обработки, а также до этапа анализа данных (см. рисунок 1). С увеличением количества образцов и этапов обработки увеличивается вероятность обмена образцов и перекрёстного загрязнения. Это может привести к анализу данных с неправильными соотношениями выборки и пациента, что влияет на дальнейший анализ и выводы, и поэтому является важным аспектом, который следует учитывать в клинических геномных исследованиях. В клинических исследованиях неправильная идентификация образцов может сильно повлиять на общие результаты, особенно при исследованиях с малым размеромвыборки 1. Загрязнение между пациентами может привести к потере питания для выявления различий и ложноположительным результатам при сравнении нескольких образцов одного и того же пациента. Обмен образцов влияет на способность обнаружения генетических ассоциаций и может привести к недооценке наследуемости сложных признаков в анализе ассоциаций на уровне всегогенома 2.
Исследования рака — одна из областей, где проводятся масштабные геномные и транскриптомическиеанализы, 3, в частности, мониторинг геномной и фенотипической меж- и внутрипациентской гетерогенности. Одним из аспектов исследований рака является то, что образцы одного и того же пациента могут нести разные мутации и изменения числа копий, а значит, демонстрировать независимые частоты аллелейвариантов 4. Особенно при интерпретации данных из нескольких типов омиксов важна правильная интеграция мультимодальных наборов данных от одних и тех же людей, что требует мониторинга межиндивидуальныхзагрязнений 5,6,7,8. Исследования на наборах данных из программы атласа генома рака (TCGA) и консорциума геномных исследований легких (LGRC) выявили в среднем уровень ошибочной идентификации выборок 3% и до ~20% внекоторых исследованиях 2,9,10,11. Эти примеры демонстрируют важность мониторинга случаев обмена образцов и перекрёстногозагрязнения 12. Помимо рутинного мониторинга и контроля качества на каждом этапе процесса, сравнительный анализ результатов секвенирования служит окончательной проверкой качества. Это обеспечивает точное сопоставление выборок перед переходом к анализу и интерпретации данных.
Было разработано несколько биоинформатических подходов для определения, происходят ли образцы от одного и того жеиндивидуума 1,4,13,14,15,16. Первоначальные подходы использовали короткие тандемные повторы для проверки идентичностиобразца 17. Данные секвенирования следующего поколения на уровне РНК и ДНК теперь позволяют сравнивать пары образцов на основе однонуклеотидныхполиморфизмов 18. Они различаются по применимости к различным модальностям секвенирования и наборам данных, например, для секвенированияРНК 19 или для данных секвенирования целыхэкзомов 5, их реализации, например, проверке по линиямсеквенирования 20, и простоте использования. Хотя образцы одного и того же человека можно идентифицировать на основе 20–45 однонуклеотидных полиморфизмов, методы секвенирования с низким и средним покрытием, обычно используемые в исследованиях рака, требуют интеграции большого числаSNP 1.
Здесь описываются реализация и корректировка одного из таких подходов с использованием блоков дисбаланса связейSNP 15, используемых для контроля качества сопоставленных образцов. Метод показал низкую частоту ложных флагов и ложных сопоставлений, а рабочий процесс позволяет сравнивать их между модальностями, например, между целостным экзомным секвенированием и РНК-секвенированием, а также для использования с различными форматами данных. Для широкомасштабного применения метода на различных наборах данных в образцах клинических испытаний биоинформатический конвейер был реализован на общем языке рабочих процессов (CWL)21,22. Благодаря читаемости и синтаксису, похожему на YAML, учёные с ограниченным опытом программирования могут легко интерпретировать общую структуру рабочих процессов и результаты анализа. Ещё одной важной особенностью CWL является функция рассеяния/сбора, которая позволяет параллелизировать процессы для полного использования выделенных вычислительных ресурсов. Пользователи могут задавать условия выполнения определённых шагов, что повышает гибкость результативных анализов. CWL может быть интегрирован с другими компонентами полной системы управления рабочими процессами, такими как хранилище баз данных, графический пользовательский интерфейс и диспетчер заданий, создавая мощную платформу для создания, запуска и поддержания воспроизводимого набора научных анализов. Таким образом, эта реализация обеспечивает облегчённый доступ к рабочему процессу и высокопроизводительную обработку наборов данных в контексте определённых систем управления рабочими процессами.
Кроме того, были изучены эффекты порогового значения параметров настройки между сопоставленными и несопоставленными образцами, а также определены пороги для разрешительного и строгого отбора несовпадающих случаев. Были показаны эффекты изменения этих параметров на выборку пар выборок и их применимость внутри и между различными омикс-модальностями. Эффективная настройка этих параметров позволит пользователям корректировать строгость своих интерпретаций. Рабочий процесс применялся к набору крупномасштабных клинических наборов данных с несколькими тысячами образцов.
Этическое заявление: Этот анализ межиндивидуального загрязнения был проведён ретроспективно с использованием индивидуальных данных на уровне пациентов из завершенных клинических исследований фаз I и II фаз, в соответствии с процессом ответственного повторного использования данных Roche и в соответствии с основной формой информированного согласия для каждого исследования. Одобрения Этического комитета/Институционального экспертного совета для каждого исследования были получены перед его проведением. Участники дали и подписали информированное согласие на участие в этих исследованиях.
Рабочий процесс в биоинформатике
ПРИМЕЧАНИЕ: Реализация биоинформатического рабочего процесса начинается с необработанных fastq-файлов, полученных из данных секвенирования следующего поколения, например, секвенирование целого генома, цельного экзома или целого транскриптома. Отдельные этапы, описанные здесь, интегрированы в рабочий процесс CWL.
1. Необходимы справочные материалы
2. Выравнивание для референсного генома, сортировка и индексация
3. Извлечение отпечатков пальцев
4. Расчёт оценок сходства
5. Доступность кода
Вычислительный рабочий процесс будет доступен на Github: https://github.com/Roche/sample-matching-workflow.
Реализация рабочих процессов CWL
Был реализован рабочий процесс идентификации совпадений выборок, основанный на ранее установленном подходе, использующий блоки дисбаланса связей однонуклеотидных полиморфизмов для идентификации заменыобразцов 15. Авторы показали классификационные показатели 0% FMR и 0,01% FFR для этого метода. Сравнение с другими подходами показало схожие результаты с NGSCheckmate при высоком и среднем покрытии, а также улучшенные результаты по сравнению с NGSCheckmate при низком покрытии и при минимальном региональном геномном пересечении. При сравнении Conpair и BAMixChecker 13,15,25 были получены неубедительные результаты. Здесь рабочий процесс был реализован в CWL, исследованы и оптимизированы пороги LOD, а также применялся для сравнения пар секвенирования РНК и пар секвенирования ДНК или между модальностями внутри образцов, извлечённых из ткани, а также между образцами из ткани и периферической крови (Рисунок 3, Таблица 1). Реализация рабочего процесса позволяла сравнивать все возможные комбинации пар выборок или выбранное сравнение между выборками из заранее определённого списка.
Ввод рабочего процесса использует выбранный набор гаплотипов. Они используются для вычисления однонуклеотидных полиморфизмов в блоках дисбаланса связи. Расчёт оценок логарифмического отношения шансов (LOD) этих блоков SNP по парам выборок позволяет дифференцировать сопоставленные и несовпадающие выборки. Ранее результаты LOD в диапазоне LOD < -5 и LOD > 5 корректно классифицировали парывыборок 15. Дополнительные показатели LOD (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) рассчитываются с учётом возможной потери гетерозиготности в образце опухоли для любого из образцов (гетерозиготные области в одном образце выявлены как гомозиготные в другом).
Влияние входных параметров и порогов на коэффициенты совпадения/несоответствия
Оценка этого рабочего процесса выделила три ключевых аспекта, влияющих на его производительность и точность. Во-первых, выбор геномных областей, охваченных картой гаплотипа, оказался ключевым этапом. Выбор этих регионов напрямую влияет на дискриминационную силу процесса подбора. Во-вторых, сочетание стратегий выравнивания чтения и специфических карт гаплотипов, используемых для извлечения отпечатков пальцев, существенно повлияло на итоговые результаты анализа. Вариации в этих этапах обработки на этапе обработки могут привести к тонким искажениям, которые распространяются на сопоставление баллов (рисунок 4A–B). В-третьих, тщательная оценка и выбор порогов для определения совпадения выборки были крайне важны. Оптимальные пороговые значения могут значительно варьироваться в зависимости от конкретной модальности данных (например, секвенирование целого экзома против целого секвенирования транскриптома) и оцениваемых геномных областей. Различные пороги могут корректировать строгость подхода (высокий процент ложноположительных результатов против высокого уровня ложноотрицательных) (рисунок 4C). Для решения этой проблемы для широкой когорты клинических выборок метод был адаптирован для определения как разрешительных и строгих комбинаций сопоставления баллов выборки, основанных на сочетании используемых баллов LOD и компаратора. Первый пороговый подход (I) был достигнут путём учета любого положительного значения по трём баллам LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR). Включая информацию о TUMOR_NORMAL и NORMAL_TUMOR баллах, можно смягчить эффекты потери гетерозиготности, возникающей из-за изменений количества копий в образцах рака. Напротив, более строгий порог несоответствий (II) был реализован путём применения двух альтернативных критериев фильтрации, направленных на снижение ложноположительных результатов: (a) категоризация только как совпадения, если LOD_SCORE положительно, b) категоризация как совпадения, если для данной выборки LOD_SCORE выше максимального балла других парных LOD_SCOREs среди выборок, которые не ожидается совпадения (на основе задокументированного пациента происхождения), Даже если сам LOD_SCORE отрицательный.
В данном приложении, чтобы создать порог допуска, любая пара выборки, обозначенная как совпадение по любому из вышеуказанных критериев (I, IIa, IIb), считалась совпадающей. Это обеспечивало высокую уверенность во всех выявленных несоответствиях, за счёт того, что некоторые потенциальные истинные несоответствия были признаны совпадениями (то есть ложноотрицательные результаты). Сравнение разрешительного порога с более строгими порогами показало сдвиг в проценте пар, классифицируемых как несоответствие. Разница между подходами по всем анализируемым исследованиям составляла от 3,9% (любая из трёх положительных результатов LOD (I)), 13,3% (LOD_SCORE должна быть положительной (IIa)), 9,2% (LOD_SCORE по сравнению с несовпадающими парами выборки (IIb)) и 3,6% (с учётом того, насколько это перечислено для обозначения совпадения) (рисунок 4C).
Влияние покрытия геномных регионов
Разница между отрицательными и положительными показателями LOD для сопоставленных и несовпадающих образцов наибольше, когда охвачен широкий спектр геномных областей (секвенирование всего генома (WGS) или сравнение образцов WGS с другими модальностями), что облегчает отбор порога (рисунок 5A). Для сравнения секвенирования целых экзомов и РНК-секвенирования показатели LOD ближе к нулю, а пороговые подходы влияют на результаты, что подчёркивает важность оценки строгости порогов для модальностей с более низким геномным покрытием. Распределение результатов из известных парных выборок с положительными баллами LOD показано на рисунке 5B. Джавед и др. (2020) показали, что достаточно всего 0,02% перекрытия генома для различия между сопоставленными и несопоставленными образцами при использовании блоков дисбалансасвязи 15.
Валидация
Подход был проверен на дополнительных наборах данных по раку молочной железы, колоректальному раку и раку легких по секвенированию целого экзому (WES) и секвенированию РНК, для которых ожидалось, что известный набор образцов будет происходить от тех же людей (рисунок 6A). Пары выборок одного и того же человека показали 100% совпадения (рисунок 6B), тогда как дополнительные сравнения с другими выборками, известными как происходящие от разных людей, показали 100% несоответствие. Ни ложноположительных, ни ложноотрицательных результатов в этих наборах данных не наблюдались.
В заключение, внедрение рабочего процесса контроля качества облегчает межиндивидуальные сравнения пар выборок следующего поколения, обеспечивая стандартизированный, воспроизводимый подход. Полученные пороги LOD дают низкие показатели ложноположительных и ложноотрицательных результатов для образцов с большим геномным региональным перекрытием, и дополнительная пороговая оптимизация может быть применена для образцов с низкой глубиной секвенирования или для которых геномное пересечение мало присутствует.

Рисунок 1: Схематическое представление случаев обмена образцов и неправильного маркировки. (A) Обмен выборками одного образца между двумя особями. (B) Представление этапов обработки образцов — от извлечения биопсии до анализа данных секвенирования. Создано в BioRender. Войт фон Войтенберг, Л. (2026) https://BioRender.com/xhbp178. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 2: Представление пользовательского интерфейса для входных файлов и параметров, необходимых для запуска рабочего процесса контроля качества сэмплов в CWL. Графический пользовательский интерфейс для ввода файлов и параметров. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 3: Результаты, полученные в результате рабочего процесса сопоставления образцов. Распределение LOD баллов для образцового набора секвенирования ДНК (целый геном и целый экзом) образцов (слева), для сравнения секвенирования ДНК и секвенирования РНК (в центре), чтобы показать, как очень мало несовпадающих образцов ведут себя по сравнению с распределением сопоставленных образцов, а также для примерной более крупной когорты пар секвенирования РНК (справа) с данными, известными как происходящие от разных индивидуумов (несоответствия, светло-красный) и от того же человека (совпадения, светло-зелёный). Сокращения; LOD = логарифмическое отношение шансов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 4: Наблюдаются примерные различия в оценке LOD. (A) при комбинировании различных подходов к выравниванию последовательностей и карт гаплотипов для набора известных несовпадающих и совпадающих образцов, и (B) для оценки путём интеграции опухоли и нормальной информации. (C) Наличие количества совпадений и несоответствий выборок, определённых пороговыми подходами разной строгости. Сокращения; LOD = логарифмическое отношение шансов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 5: Образцовое распределение LOD для сравнения различных методов секвенирования следующего поколения. (A) Распределение LOD ожидаемых несовпадающих и совпадающих образцов между ДНК-секвенированием из крови и опухолевой ткани и РНК-секвенированием из опухолевой ткани. (B) распределение LOD баллов сопоставленных выборок для комбинаций различных модальностей. Сокращения; LOD = логарифмическое отношение шансов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 6: Распределение показателей LOD для анализа набора данных по секвенированию РНК по раку молочной железы. Деидентифицированный набор данных по раку молочной железы был получен от Caris Life Sciences и основан на основе комплексного профилирования опухолей. (A) Логарифмическое наличие LOD для сравнения образцов опухоли WES (слева) и между РНК-секвенирующими образцами (справа). (B) распределение баллов LOD для ожидаемых пар образцов от одних и тех же индивидуумов (верхний ряд VES, нижний ряд с РНК-секвенированием). Сокращения; LOD = логарифмическое отношение шансов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
| LEFT_GROUP_VALUE | RIGHT_GROUP_VALUE | РЕЗУЛЬТАТ | LOD_SCORE | LOD_SCORE_ TUMOR_NORMAL | LOD_SCORE_ NORMAL_TUMOR |
| Пример 1 | Пример 1 | EXPECTED_MATCH | 38.119266 | 29.649485 | 29.649485 |
| Пример 1 | Пример 2 | EXPECTED_MISMATCH | -2.552644 | -4.57422 | 5.283698 |
| Пример 2 | Пример 1 | EXPECTED_MISMATCH | -2.552644 | 5.283698 | -4.57422 |
| Пример 2 | Пример 2 | EXPECTED_MATCH | 12.328737 | 8.796457 | 8.796457 |
Таблица 1: Образцовые результаты, полученные при проведении Crosscheck Fingerprints. В таблице показаны примерные результаты пары выборок, сравниваемых с помощью подхода сопоставления выборок.
Доступны различные методы идентификации совпаденийвыборок 1, 4, 13, 14, 15, 16. Здесь была описана реализация подхода с использованием блоков неравновесия сцеплений SNP, применимых к нескольким омикс-модальностям с низкими показателями ложноположительных и ложноотрицательныхфакторов 15. Реализация осуществлялась в CWL для обеспечения высокопроизводительной обработки между наборами данных в рамках стандартизированной среды рабочих процессов. Оценка рабочих процессов выделила три ключевых аспекта, которые следует учитывать при применении подхода. Ключевым этапом процесса является выбор геномных областей, покрываемых картой гаплотипа. Кроме того, сочетание выравнивания считывания с извлечением отпечатков пальцев с использованием различных карт гаплотипов может повлиять на результаты анализа. Кроме того, тщательная оценка и отбор порогов, которые могут зависеть от модальности данных и охваченных областей, являются необходимыми и могут привести к более или менее разрешительной проверке выборки.
Для оценки больших наборов клинических выборок метод был адаптирован для определения комбинаций порогов для разрешительных и строгих оценок сопоставления выборок. Метод был скорректирован с учетом разрешительного порогового подхода с учётом комбинированного балла, включающего любой из баллов LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) или два альтернативных критерия фильтрации, что привело к более строгому отбору выборок. Применимость подхода ограничена образцами, для которых доступна информация SNP по разным геномным регионам, например, данные секвенирования следующего поколения. Кроме того, для сравнительного анализа и сопоставления выборок требуются как минимум пары образцов от одного и того же человека. Дополнительная клиническая информация, такая как статус мутации, полученный целевыми методами, или метаданные пациентов, например, пол, может использоваться для получения дополнительных доказательств сопоставления между высокоразмерными молекулярными данными и клиническими данными на уровне пациента.
Внедрение подхода в среде управления рабочими процессами с возможностью параллельного хранения данных позволяет проводить высокопроизводительный анализ качества образцов на предмет межиндивидуального загрязнения. Таким образом, это повышает доступность и воспроизводимость подхода между наборами данных и выборками. Адаптивность пороговых критериев в этом подходе позволяет обрабатывать и анализировать образцы рака с низким и высоким уровнем мутационной нагрузки и количества копий опухоли, что может привести к потере гетерозиготности и, следовательно, повлиять на вероятность генотипа.
Метод может найти широкое применение в любом типе проектов, связанных с данными секвенирования следующего поколения от отдельных людей и для которых доступно более одного выбора на человека. Это может варьироваться от персонализированных подходов для отдельных пациентов до крупных клинических испытаний, собирающих высокоразмерные молекулярные данные для различных областей заболевания. Её можно сочетать с рабочими процессами контроля качества, исследованием межвидового загрязнения и подходами к связыванию высокомерных молекулярных наборов данных с клинической информацией для интеграции в любой конвейер контроля качества для данных секвенирования следующего поколения.
Все авторы являются сотрудниками или внешними подрядчиками и акционерами F. Hoffmann-La Roche Ltd. Кроме того, Закари Уитфилд является сотрудником Rancho Biosciences, а Ана Тейшейра — сотрудником A4Pbio. Авторы не заявляют о конкурирующих интересах.
Мы искренне благодарим пациентов и их семьи за предоставленные образцы. Мы выражаем глубочайшую благодарность всем, кто участвует в клинических исследованиях, особенно членам исследовательских команд, исследовательских и проектных команд наших клинических исследовательских организаций, за их неоценимый вклад. Авторы благодарят Н. Наира и Э. Гуарина за критическое чтение рукописи и ценные комментарии. Мы также выражаем благодарность А. Косоло за поддержку в обеспечении доступа к дополнительным наборам данных. Мы признаем признательность всей сети Roche Enhanced Data and Insights Sharing (EDIS) за их усилия в области кураторства и гармонизации данных.
| Имя | Компания | Каталожный номер | Комментарии |
|---|---|---|---|
| FastQC | v0.11.9 | SCR_014583 | |
| MultiQC | v1.8 | SCR_014982 | |
| BWA-MEM | v0.7.17 | SCR_010910 | |
| ЗВЕЗДА | v2.7.9a | SCR_004463 | |
| SAMtools | V1.12, v1.19.2 | SCR_005227 | |
| - faidx | |||
| - сортировать | |||
| - Индекс | |||
| - Addreplacerg | |||
| Пикар | V2.25.5, v3.0.0 | SCR_006525 | |
| - CreateSequenceDictionary | |||
| - MarkDuplicates | |||
| - build_fingerprint_maps | |||
| - ExtractFingerprints | |||
| - CrosscheckFingerprints | |||
| CWL | v1.2 | SCR_015528 | |
| R | R v4.3.1 | SCR_001905 | |
| dplyr v1.1.4 |
Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE
Запросить разрешение