Методическая статья

Обнаружение межиндивидуальных загрязнений и несоответствий в данных секвенирования следующего поколения мультиомики

DOI:

10.3791/69428

17 апреля 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол описывает реализацию системы контроля качества для выявления межиндивидуальных загрязнений и несоответствий в данных секвенирования следующего поколения путём проверки генетической идентичности пар образцов внутри индивидуумов.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Высокопроизводительная обработка биообразцов пациентов с помощью секвенирования следующего поколения и сравнение молекулярных данных с клиническими данными на уровне пациента и образцов требуют точного отслеживания и сопоставления идентификаторов образцов по всей цепочке хранения биообразцов и имеют решающее значение для надёжной интерпретации результатов испытаний с биомаркерами. Помимо отслеживания отдельных этапов в процессах обработки образцов и данных, биоинформатика может использоваться для подтверждения того, что образцы происходят от одного и того же пациента. Здесь демонстрируется использование биоинформатического рабочего процесса для выявления совпадающих образцов, происходящих от одного и того же человека. Рабочий процесс анализа подходит для сравнения и проверки любых двух или более пар наборов данных NGS на происхождение образцов пациентов. Алгоритм оценки, основанный на сравнении образцов по всему геному, позволяет пользователю определить, происходят ли два образца от одного и того же человека. В частности, для идентификации и сравнения образцов используются однонуклеотидные полиморфизмы (SNP) внутри выбранных блоков дисбаланса связывания. Были выявлены пороговые комбинации для разрешительного и строгого отбора совпадающих и несовпадающих выборок. Полезность этого протокола была продемонстрирована в его применении для контроля качества и валидации клинических образцов тканей опухоли и крови, охватывающих различные омикс-методы более чем 2000 пациентов.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Крупномасштабный сбор и анализ клинических образцов требуют точного отслеживания образцов вдоль их цепочки хранения, поскольку правильное сопоставление молекулярных данных из одного или другого метода, а также клинических данных на уровне пациентов и образцов необходимо для точной интерпретации и принятия обоснованных решений. Несмотря на серьёзные усилия по оптимизации протоколов обработки образцов в рамках хорошей клинической практики, обмен образцов или неправильная маркировка могут происходить на различных этапах — от биопсии/извлечения образца до этапов подготовки и обработки, а также до этапа анализа данных (см. рисунок 1). С увеличением количества образцов и этапов обработки увеличивается вероятность обмена образцов и перекрёстного загрязнения. Это может привести к анализу данных с неправильными соотношениями выборки и пациента, что влияет на дальнейший анализ и выводы, и поэтому является важным аспектом, который следует учитывать в клинических геномных исследованиях. В клинических исследованиях неправильная идентификация образцов может сильно повлиять на общие результаты, особенно при исследованиях с малым размеромвыборки 1. Загрязнение между пациентами может привести к потере питания для выявления различий и ложноположительным результатам при сравнении нескольких образцов одного и того же пациента. Обмен образцов влияет на способность обнаружения генетических ассоциаций и может привести к недооценке наследуемости сложных признаков в анализе ассоциаций на уровне всегогенома 2.

Исследования рака — одна из областей, где проводятся масштабные геномные и транскриптомическиеанализы, 3, в частности, мониторинг геномной и фенотипической меж- и внутрипациентской гетерогенности. Одним из аспектов исследований рака является то, что образцы одного и того же пациента могут нести разные мутации и изменения числа копий, а значит, демонстрировать независимые частоты аллелейвариантов 4. Особенно при интерпретации данных из нескольких типов омиксов важна правильная интеграция мультимодальных наборов данных от одних и тех же людей, что требует мониторинга межиндивидуальныхзагрязнений 5,6,7,8. Исследования на наборах данных из программы атласа генома рака (TCGA) и консорциума геномных исследований легких (LGRC) выявили в среднем уровень ошибочной идентификации выборок 3% и до ~20% внекоторых исследованиях 2,9,10,11. Эти примеры демонстрируют важность мониторинга случаев обмена образцов и перекрёстногозагрязнения 12. Помимо рутинного мониторинга и контроля качества на каждом этапе процесса, сравнительный анализ результатов секвенирования служит окончательной проверкой качества. Это обеспечивает точное сопоставление выборок перед переходом к анализу и интерпретации данных.

Было разработано несколько биоинформатических подходов для определения, происходят ли образцы от одного и того жеиндивидуума 1,4,13,14,15,16. Первоначальные подходы использовали короткие тандемные повторы для проверки идентичностиобразца 17. Данные секвенирования следующего поколения на уровне РНК и ДНК теперь позволяют сравнивать пары образцов на основе однонуклеотидныхполиморфизмов 18. Они различаются по применимости к различным модальностям секвенирования и наборам данных, например, для секвенированияРНК 19 или для данных секвенирования целыхэкзомов 5, их реализации, например, проверке по линиямсеквенирования 20, и простоте использования. Хотя образцы одного и того же человека можно идентифицировать на основе 20–45 однонуклеотидных полиморфизмов, методы секвенирования с низким и средним покрытием, обычно используемые в исследованиях рака, требуют интеграции большого числаSNP 1.

Здесь описываются реализация и корректировка одного из таких подходов с использованием блоков дисбаланса связейSNP 15, используемых для контроля качества сопоставленных образцов. Метод показал низкую частоту ложных флагов и ложных сопоставлений, а рабочий процесс позволяет сравнивать их между модальностями, например, между целостным экзомным секвенированием и РНК-секвенированием, а также для использования с различными форматами данных. Для широкомасштабного применения метода на различных наборах данных в образцах клинических испытаний биоинформатический конвейер был реализован на общем языке рабочих процессов (CWL)21,22. Благодаря читаемости и синтаксису, похожему на YAML, учёные с ограниченным опытом программирования могут легко интерпретировать общую структуру рабочих процессов и результаты анализа. Ещё одной важной особенностью CWL является функция рассеяния/сбора, которая позволяет параллелизировать процессы для полного использования выделенных вычислительных ресурсов. Пользователи могут задавать условия выполнения определённых шагов, что повышает гибкость результативных анализов. CWL может быть интегрирован с другими компонентами полной системы управления рабочими процессами, такими как хранилище баз данных, графический пользовательский интерфейс и диспетчер заданий, создавая мощную платформу для создания, запуска и поддержания воспроизводимого набора научных анализов. Таким образом, эта реализация обеспечивает облегчённый доступ к рабочему процессу и высокопроизводительную обработку наборов данных в контексте определённых систем управления рабочими процессами.

Кроме того, были изучены эффекты порогового значения параметров настройки между сопоставленными и несопоставленными образцами, а также определены пороги для разрешительного и строгого отбора несовпадающих случаев. Были показаны эффекты изменения этих параметров на выборку пар выборок и их применимость внутри и между различными омикс-модальностями. Эффективная настройка этих параметров позволит пользователям корректировать строгость своих интерпретаций. Рабочий процесс применялся к набору крупномасштабных клинических наборов данных с несколькими тысячами образцов.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этическое заявление: Этот анализ межиндивидуального загрязнения был проведён ретроспективно с использованием индивидуальных данных на уровне пациентов из завершенных клинических исследований фаз I и II фаз, в соответствии с процессом ответственного повторного использования данных Roche и в соответствии с основной формой информированного согласия для каждого исследования. Одобрения Этического комитета/Институционального экспертного совета для каждого исследования были получены перед его проведением. Участники дали и подписали информированное согласие на участие в этих исследованиях.

Рабочий процесс в биоинформатике
ПРИМЕЧАНИЕ: Реализация биоинформатического рабочего процесса начинается с необработанных fastq-файлов, полученных из данных секвенирования следующего поколения, например, секвенирование целого генома, цельного экзома или целого транскриптома. Отдельные этапы, описанные здесь, интегрированы в рабочий процесс CWL.

1. Необходимы справочные материалы

  1. Для биоинформатического рабочего процесса предоставьте следующее:
    1. Человеческий референсный геном (GRCh38) в . Формат FASTA .
    2. Соответствующий индексный файл как .fasta.fai.
    3. Соответствующий словарь в формате .dict .
    4. Карта гаплотипов, соответствующая интересующимся геномным областям для SNP и блоков дисбаланса связей (например, Picard build_fingerprint_maps, SCR_006525).
  2. Убедитесь, что заголовок карты гаплотипа совпадает с эталонным геномом.

2. Выравнивание для референсного генома, сортировка и индексация

  1. Запустите рабочий процесс CWL, чтобы предоставить результаты следующих шагов, описанных ниже (список инструментов в таблице материалов) (рисунок 2).
  2. Запустите рабочий процесс CWL, предоставив каталог с парными файлами fastq или выровненными bam-файлами.
  3. Укажите шаблон, например, R1/R2, в качестве входного шаблона регулярного выражения в команде CWL.
  4. Кроме того, укажите место для запуска рабочего процесса, геномные ссылки и файлы отображения гаплотипов.
    ПРИМЕЧАНИЕ: Для сравнения всех к всем используется полный каталог ввода. Если нужно сравнивать подмножество файлов, предоставьте файл с разделёнными запятой с именами файлов для сравнения. Расширенная опция позволяет выбирать память с произвольным доступом и количество центральных процессоров для запуска процесса.
  5. Сопоставьте файлы fastq с человеческим эталонным геномом с помощью алгоритма отображения.
    ПРИМЕЧАНИЕ: В зависимости от модальности секвенирования BWA-MEM используется для секвенирования ДНКрезультатов 23, а картограф STAR с учётом сплетений — для результатов секвенированияРНК 24. Примерный код для выравнивания STAR приведён ниже:
    STAR \
    --readFilesCommand zcat \
    --runThreadN 8 \
    --outSAMmapqUnique 60 \
    --outSAMатрибуты Все \
    --outReadsUnmapped Fastx \
    --outTmpDir /tmp/STARtmp/ \
    --runDirPerm All_RWX \
    --outSAMtype BAM Unsorted \
    --outFileNamePrefix /FILENAME_ \
    --outSAMattrRGline ID:FILEID. L001 SM:SAMPLE \
    --genomeDir /REF/GENOME/DIR \
    --readFilesIn /path/to/FILENAME. R1.fastq.gz /path/to/FILENAME. R2.fastq.gz
  6. Отсортируйте полученные файлы выравниваемой бинарной матрицы выравнивания (BAM) по прочитанной координате с помощью SAMtools sort (samtools sort -o FILENAME_OUT.bam FILENAME_IN.bam).
  7. Индексируйте отсортированные BAM-файлы с помощью индекса SAMtools (samtools index FILENAME_OUT.bam).
  8. Отмечайте и удаляйте дубликаты, используя Picard MarkDuplicates.
  9. Переиндексируйте файлы BAM и включайте группы чтения (RG) с помощью SAMtools.
    ПРИМЕЧАНИЕ: BAM-файлы должны иметь теги RG для работы рабочего процесса.

3. Извлечение отпечатков пальцев

  1. Используйте отсортированные и индексированные BAM-файлы для идентификации отпечатков SNP с помощью Picard ExtractFingerprints.
  2. Используйте промежуточное хранение полученных файлов вариантного формата вызова (VCF) исключительно для сравнения между выборками.

4. Расчёт оценок сходства

  1. Используйте Picard CrossCheckFingerprints для расчёта логарифмических коэффициентов шансов (LOD) сходства на основе блоков дисбаланса связи, которые предоставляются в формате crosscheck_metrics файла как crosscheck_metrics.txt.
    ПРИМЕЧАНИЕ: Реализация рабочего процесса позволяет сравнивать все возможные комбинации пар выборок или выбранное сравнение между выборками из заранее определённого списка.
  2. Удалить промежуточные VCF-файлы.
  3. Файл crosscheck_metrics содержит четыре сравнения для каждой пары тестируемых образцов. Интерпретация баллов LOD следующая:
    Балл LOD > 0: выборки, вероятно, взяты от одного и того же человека (совпадение выборки)
    Балл LOD ≤ 0: выборки, вероятно, взяты от разных людей
  4. Проверьте сроговое значение для совпадений выборок, визуализируя распределение LOD в виде гистограммы, например, в R или Python (рисунок 3).
  5. Рекомендуется создать совместную команду, включающую опытных специалистов в биоинформатике, чтобы определить, достаточно ли доказательств для однозначной идентификации идентичностей выборок и возможной корректировки используемых порогов, например, путём включения всех трёх баллов LOD или сравнения с распределением LOD по выборкам, известным как происходящие от разных людей.
    ПРИМЕЧАНИЕ: Смешение выборок может привести к нескольким неожиданным совпадениям (LOD < 0 для образцов одного донора) и несоответствиям (LOD > 0 для образцов разных доноров). Сложные интерпретации требуют тесного обмена между межфункциональной командой и экспертом по биоинформатике.

5. Доступность кода

Вычислительный рабочий процесс будет доступен на Github: https://github.com/Roche/sample-matching-workflow.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Реализация рабочих процессов CWL
Был реализован рабочий процесс идентификации совпадений выборок, основанный на ранее установленном подходе, использующий блоки дисбаланса связей однонуклеотидных полиморфизмов для идентификации заменыобразцов 15. Авторы показали классификационные показатели 0% FMR и 0,01% FFR для этого метода. Сравнение с другими подходами показало схожие результаты с NGSCheckmate при высоком и среднем покрытии, а также улучшенные результаты по сравнению с NGSCheckmate при низком покрытии и при минимальном региональном геномном пересечении. При сравнении Conpair и BAMixChecker 13,15,25 были получены неубедительные результаты. Здесь рабочий процесс был реализован в CWL, исследованы и оптимизированы пороги LOD, а также применялся для сравнения пар секвенирования РНК и пар секвенирования ДНК или между модальностями внутри образцов, извлечённых из ткани, а также между образцами из ткани и периферической крови (Рисунок 3, Таблица 1). Реализация рабочего процесса позволяла сравнивать все возможные комбинации пар выборок или выбранное сравнение между выборками из заранее определённого списка.

Ввод рабочего процесса использует выбранный набор гаплотипов. Они используются для вычисления однонуклеотидных полиморфизмов в блоках дисбаланса связи. Расчёт оценок логарифмического отношения шансов (LOD) этих блоков SNP по парам выборок позволяет дифференцировать сопоставленные и несовпадающие выборки. Ранее результаты LOD в диапазоне LOD < -5 и LOD > 5 корректно классифицировали парывыборок 15. Дополнительные показатели LOD (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) рассчитываются с учётом возможной потери гетерозиготности в образце опухоли для любого из образцов (гетерозиготные области в одном образце выявлены как гомозиготные в другом).

Влияние входных параметров и порогов на коэффициенты совпадения/несоответствия
Оценка этого рабочего процесса выделила три ключевых аспекта, влияющих на его производительность и точность. Во-первых, выбор геномных областей, охваченных картой гаплотипа, оказался ключевым этапом. Выбор этих регионов напрямую влияет на дискриминационную силу процесса подбора. Во-вторых, сочетание стратегий выравнивания чтения и специфических карт гаплотипов, используемых для извлечения отпечатков пальцев, существенно повлияло на итоговые результаты анализа. Вариации в этих этапах обработки на этапе обработки могут привести к тонким искажениям, которые распространяются на сопоставление баллов (рисунок 4A–B). В-третьих, тщательная оценка и выбор порогов для определения совпадения выборки были крайне важны. Оптимальные пороговые значения могут значительно варьироваться в зависимости от конкретной модальности данных (например, секвенирование целого экзома против целого секвенирования транскриптома) и оцениваемых геномных областей. Различные пороги могут корректировать строгость подхода (высокий процент ложноположительных результатов против высокого уровня ложноотрицательных) (рисунок 4C). Для решения этой проблемы для широкой когорты клинических выборок метод был адаптирован для определения как разрешительных и строгих комбинаций сопоставления баллов выборки, основанных на сочетании используемых баллов LOD и компаратора. Первый пороговый подход (I) был достигнут путём учета любого положительного значения по трём баллам LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR). Включая информацию о TUMOR_NORMAL и NORMAL_TUMOR баллах, можно смягчить эффекты потери гетерозиготности, возникающей из-за изменений количества копий в образцах рака. Напротив, более строгий порог несоответствий (II) был реализован путём применения двух альтернативных критериев фильтрации, направленных на снижение ложноположительных результатов: (a) категоризация только как совпадения, если LOD_SCORE положительно, b) категоризация как совпадения, если для данной выборки LOD_SCORE выше максимального балла других парных LOD_SCOREs среди выборок, которые не ожидается совпадения (на основе задокументированного пациента происхождения), Даже если сам LOD_SCORE отрицательный.

В данном приложении, чтобы создать порог допуска, любая пара выборки, обозначенная как совпадение по любому из вышеуказанных критериев (I, IIa, IIb), считалась совпадающей. Это обеспечивало высокую уверенность во всех выявленных несоответствиях, за счёт того, что некоторые потенциальные истинные несоответствия были признаны совпадениями (то есть ложноотрицательные результаты). Сравнение разрешительного порога с более строгими порогами показало сдвиг в проценте пар, классифицируемых как несоответствие. Разница между подходами по всем анализируемым исследованиям составляла от 3,9% (любая из трёх положительных результатов LOD (I)), 13,3% (LOD_SCORE должна быть положительной (IIa)), 9,2% (LOD_SCORE по сравнению с несовпадающими парами выборки (IIb)) и 3,6% (с учётом того, насколько это перечислено для обозначения совпадения) (рисунок 4C).

Влияние покрытия геномных регионов
Разница между отрицательными и положительными показателями LOD для сопоставленных и несовпадающих образцов наибольше, когда охвачен широкий спектр геномных областей (секвенирование всего генома (WGS) или сравнение образцов WGS с другими модальностями), что облегчает отбор порога (рисунок 5A). Для сравнения секвенирования целых экзомов и РНК-секвенирования показатели LOD ближе к нулю, а пороговые подходы влияют на результаты, что подчёркивает важность оценки строгости порогов для модальностей с более низким геномным покрытием. Распределение результатов из известных парных выборок с положительными баллами LOD показано на рисунке 5B. Джавед и др. (2020) показали, что достаточно всего 0,02% перекрытия генома для различия между сопоставленными и несопоставленными образцами при использовании блоков дисбалансасвязи 15.

Валидация
Подход был проверен на дополнительных наборах данных по раку молочной железы, колоректальному раку и раку легких по секвенированию целого экзому (WES) и секвенированию РНК, для которых ожидалось, что известный набор образцов будет происходить от тех же людей (рисунок 6A). Пары выборок одного и того же человека показали 100% совпадения (рисунок 6B), тогда как дополнительные сравнения с другими выборками, известными как происходящие от разных людей, показали 100% несоответствие. Ни ложноположительных, ни ложноотрицательных результатов в этих наборах данных не наблюдались.

В заключение, внедрение рабочего процесса контроля качества облегчает межиндивидуальные сравнения пар выборок следующего поколения, обеспечивая стандартизированный, воспроизводимый подход. Полученные пороги LOD дают низкие показатели ложноположительных и ложноотрицательных результатов для образцов с большим геномным региональным перекрытием, и дополнительная пороговая оптимизация может быть применена для образцов с низкой глубиной секвенирования или для которых геномное пересечение мало присутствует.

figure-results-1
Рисунок 1: Схематическое представление случаев обмена образцов и неправильного маркировки. (A) Обмен выборками одного образца между двумя особями. (B) Представление этапов обработки образцов — от извлечения биопсии до анализа данных секвенирования. Создано в BioRender. Войт фон Войтенберг, Л. (2026) https://BioRender.com/xhbp178. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-2
Рисунок 2: Представление пользовательского интерфейса для входных файлов и параметров, необходимых для запуска рабочего процесса контроля качества сэмплов в CWL. Графический пользовательский интерфейс для ввода файлов и параметров. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-3
Рисунок 3: Результаты, полученные в результате рабочего процесса сопоставления образцов. Распределение LOD баллов для образцового набора секвенирования ДНК (целый геном и целый экзом) образцов (слева), для сравнения секвенирования ДНК и секвенирования РНК (в центре), чтобы показать, как очень мало несовпадающих образцов ведут себя по сравнению с распределением сопоставленных образцов, а также для примерной более крупной когорты пар секвенирования РНК (справа) с данными, известными как происходящие от разных индивидуумов (несоответствия, светло-красный) и от того же человека (совпадения, светло-зелёный). Сокращения; LOD = логарифмическое отношение шансов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-4
Рисунок 4: Наблюдаются примерные различия в оценке LOD. (A) при комбинировании различных подходов к выравниванию последовательностей и карт гаплотипов для набора известных несовпадающих и совпадающих образцов, и (B) для оценки путём интеграции опухоли и нормальной информации. (C) Наличие количества совпадений и несоответствий выборок, определённых пороговыми подходами разной строгости. Сокращения; LOD = логарифмическое отношение шансов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-5
Рисунок 5: Образцовое распределение LOD для сравнения различных методов секвенирования следующего поколения. (A) Распределение LOD ожидаемых несовпадающих и совпадающих образцов между ДНК-секвенированием из крови и опухолевой ткани и РНК-секвенированием из опухолевой ткани. (B) распределение LOD баллов сопоставленных выборок для комбинаций различных модальностей. Сокращения; LOD = логарифмическое отношение шансов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-6
Рисунок 6: Распределение показателей LOD для анализа набора данных по секвенированию РНК по раку молочной железы. Деидентифицированный набор данных по раку молочной железы был получен от Caris Life Sciences и основан на основе комплексного профилирования опухолей. (A) Логарифмическое наличие LOD для сравнения образцов опухоли WES (слева) и между РНК-секвенирующими образцами (справа). (B) распределение баллов LOD для ожидаемых пар образцов от одних и тех же индивидуумов (верхний ряд VES, нижний ряд с РНК-секвенированием). Сокращения; LOD = логарифмическое отношение шансов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

LEFT_GROUP_VALUERIGHT_GROUP_VALUEРЕЗУЛЬТАТLOD_SCORELOD_SCORE_
TUMOR_NORMAL
LOD_SCORE_
NORMAL_TUMOR
Пример 1Пример 1EXPECTED_MATCH38.11926629.64948529.649485
Пример 1Пример 2EXPECTED_MISMATCH-2.552644-4.574225.283698
Пример 2Пример 1EXPECTED_MISMATCH-2.5526445.283698-4.57422
Пример 2Пример 2EXPECTED_MATCH12.3287378.7964578.796457

Таблица 1: Образцовые результаты, полученные при проведении Crosscheck Fingerprints. В таблице показаны примерные результаты пары выборок, сравниваемых с помощью подхода сопоставления выборок.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Доступны различные методы идентификации совпаденийвыборок 1, 4, 13, 14, 15, 16. Здесь была описана реализация подхода с использованием блоков неравновесия сцеплений SNP, применимых к нескольким омикс-модальностям с низкими показателями ложноположительных и ложноотрицательныхфакторов 15. Реализация осуществлялась в CWL для обеспечения высокопроизводительной обработки между наборами данных в рамках стандартизированной среды рабочих процессов. Оценка рабочих процессов выделила три ключевых аспекта, которые следует учитывать при применении подхода. Ключевым этапом процесса является выбор геномных областей, покрываемых картой гаплотипа. Кроме того, сочетание выравнивания считывания с извлечением отпечатков пальцев с использованием различных карт гаплотипов может повлиять на результаты анализа. Кроме того, тщательная оценка и отбор порогов, которые могут зависеть от модальности данных и охваченных областей, являются необходимыми и могут привести к более или менее разрешительной проверке выборки.

Для оценки больших наборов клинических выборок метод был адаптирован для определения комбинаций порогов для разрешительных и строгих оценок сопоставления выборок. Метод был скорректирован с учетом разрешительного порогового подхода с учётом комбинированного балла, включающего любой из баллов LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) или два альтернативных критерия фильтрации, что привело к более строгому отбору выборок. Применимость подхода ограничена образцами, для которых доступна информация SNP по разным геномным регионам, например, данные секвенирования следующего поколения. Кроме того, для сравнительного анализа и сопоставления выборок требуются как минимум пары образцов от одного и того же человека. Дополнительная клиническая информация, такая как статус мутации, полученный целевыми методами, или метаданные пациентов, например, пол, может использоваться для получения дополнительных доказательств сопоставления между высокоразмерными молекулярными данными и клиническими данными на уровне пациента.

Внедрение подхода в среде управления рабочими процессами с возможностью параллельного хранения данных позволяет проводить высокопроизводительный анализ качества образцов на предмет межиндивидуального загрязнения. Таким образом, это повышает доступность и воспроизводимость подхода между наборами данных и выборками. Адаптивность пороговых критериев в этом подходе позволяет обрабатывать и анализировать образцы рака с низким и высоким уровнем мутационной нагрузки и количества копий опухоли, что может привести к потере гетерозиготности и, следовательно, повлиять на вероятность генотипа.

Метод может найти широкое применение в любом типе проектов, связанных с данными секвенирования следующего поколения от отдельных людей и для которых доступно более одного выбора на человека. Это может варьироваться от персонализированных подходов для отдельных пациентов до крупных клинических испытаний, собирающих высокоразмерные молекулярные данные для различных областей заболевания. Её можно сочетать с рабочими процессами контроля качества, исследованием межвидового загрязнения и подходами к связыванию высокомерных молекулярных наборов данных с клинической информацией для интеграции в любой конвейер контроля качества для данных секвенирования следующего поколения.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Все авторы являются сотрудниками или внешними подрядчиками и акционерами F. Hoffmann-La Roche Ltd. Кроме того, Закари Уитфилд является сотрудником Rancho Biosciences, а Ана Тейшейра — сотрудником A4Pbio. Авторы не заявляют о конкурирующих интересах.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы искренне благодарим пациентов и их семьи за предоставленные образцы. Мы выражаем глубочайшую благодарность всем, кто участвует в клинических исследованиях, особенно членам исследовательских команд, исследовательских и проектных команд наших клинических исследовательских организаций, за их неоценимый вклад. Авторы благодарят Н. Наира и Э. Гуарина за критическое чтение рукописи и ценные комментарии. Мы также выражаем благодарность А. Косоло за поддержку в обеспечении доступа к дополнительным наборам данных. Мы признаем признательность всей сети Roche Enhanced Data and Insights Sharing (EDIS) за их усилия в области кураторства и гармонизации данных.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
FastQCv0.11.9SCR_014583
MultiQCv1.8SCR_014982
BWA-MEMv0.7.17SCR_010910
ЗВЕЗДАv2.7.9aSCR_004463
SAMtoolsV1.12, v1.19.2SCR_005227
-  faidx
-  сортировать
-  Индекс
- Addreplacerg
ПикарV2.25.5, v3.0.0SCR_006525
- CreateSequenceDictionary
- MarkDuplicates
- build_fingerprint_maps
- ExtractFingerprints
- CrosscheckFingerprints
CWLv1.2SCR_015528
RR v4.3.1SCR_001905
dplyr v1.1.4

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Westphal, M., et al. SMaSH: sample matching using SNPs in humans. BMC Genomics. 20 (12), 1001(2019).
  2. Westra, H. J., et al. MixupMapper: correcting sample mix-ups in genome-wide datasets increases power to detect small genetic effects. Bioinformatics. 27 (15), 2104-2111 (2011).
  3. Addala, V., et al. Computational immunogenomic approaches to predict response to cancer immunotherapies. Nat. Rev. Clin. Oncol. 21 (1), 28-46 (2024).
  4. Schröder, J., Corbin, V., Papenfuss, A. T. HYSYS: have you swapped your samples. Bioinformatics. 33 (4), 596-598 (2017).
  5. Pengelly, R. J., et al. A SNP profiling panel for sample tracking in whole-exome sequencing studies. Genome Med. 5 (9), 89(2013).
  6. Subramanian, I., et al. Multi-omics data integration, interpretation, and its application. Bioinform Biol Insights. 14, 117793221989905(2020).
  7. Baião, A. R., et al. A technical review of multi-omics data integration methods: from classical statistical to deep generative approaches. Brief Bioinform. 26 (4), bbaf355(2025).
  8. Wang, Z., Zhao, Y., Zhang, L. Emerging trends and hot topics in the application of multi-omics in drug discovery: A bibliometric and visualized study. Curr Pharm Anal. 21 (1), 20-32 (2024).
  9. Morris, S., et al. Two algorithms for biospecimen comparison and differentiation using SNP genotypes. Pharmacogenomics. 14 (4), 379-390 (2013).
  10. Yoo, S., et al. MODMatcher: multi-omics data matcher for integrative genomic analysis. PLoS Comput Biol. 10 (8), e1003790(2014).
  11. Li, L., et al. SMAP is a pipeline for sample matching in proteogenomics. Nat Commun. 13 (1), 744(2022).
  12. Cibulskis, K., et al. ContEst: estimating cross-contamination of human samples in next-generation sequencing data. Bioinformatics. 27 (18), 2601-2602 (2011).
  13. Chun, H., Kim, S. BAMixChecker: an automated checkup tool for matched sample pairs in NGS cohort. Bioinformatics. 35 (22), 4806-4808 (2019).
  14. Lee, S., et al. NGSCheckMate: software for validating sample identity in next-generation sequencing studies within and across data types. Nucleic Acids Res. 45 (11), e103-e103 (2017).
  15. Javed, N., et al. Detecting sample swaps in diverse NGS data types using linkage disequilibrium. Nature Commun. 11 (1), 3697(2020).
  16. Wang, P. P. S., Parker, W. T., Branford, S., Schreiber, A. W. BAM-matcher: a tool for rapid NGS sample matching. Bioinformatics. 32 (17), 2699-2701 (2016).
  17. Katsanis, S. H., Wagner, J. K. Characterization of the standard and recommended codis markers. J Forensic Sci. 58, s1(2013).
  18. Yousefi, S., et al. BIOS consortium. A SNP panel for identification of DNA and RNA specimens. BMC Genomics. 19 (1), 90(2018).
  19. Huang, J., Chen, J., Lathrop, M., Liang, L. A tool for RNA sequencing sample identity check. Bioinformatics. 29 (11), 1463-1464 (2013).
  20. Goldfeder, R. L., et al. A bioinformatics approach for determining sample identity from different lanes of high-throughput sequencing data. PLoS ONE. 6 (8), e23683(2011).
  21. Crusoe, M. R., et al. Methods included: standardizing computational reuse and portability with the common workflow language. Commun ACM. 65 (6), 54-63 (2022).
  22. Ahmed, A. E., et al. Design considerations for workflow management systems use in production genomics research and the clinic. Scientific Rep. 11 (1), (2021).
  23. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  24. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  25. Bergmann, E. A., et al. Conpair: concordance and contamination estimator for matched tumor–normal pairs. Bioinformatics. 32 (20), 3196-3198 (2016).

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи