Методическая статья

Комплексная оценка инструментов импутации генотипов для данных секвенирования целого генома с ультранизкой глубиной

DOI:

10.3791/68879

12 декабря 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Три инструмента импутации — STITCH, QUILT2 и GLIMPSE2 — были проведены по разной глубине секвенирования и размерам выборок с использованием эталонных панелей CKB и EAS. Результаты предоставляют практическую основу для выбора подходящих стратегий импутации в данных секвенирования сверхнизкой глубины, что способствует проведению крупномасштабных исследований популяционного генома и сложных признаков.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Секвенирование ультранизкой глубины (ULDS) — это экономичная стратегия для крупномасштабных геномных исследований, но его полезность зависит от точного импутации генотипа. В этом исследовании оцениваются три инструмента импутации — STITCH, QUILT2 и GLIMPSE2 — с разной глубиной секвенирования и размером выборки, используя эталонные панели China Kadoorie Biobank (CKB) и Восточноазиатского проекта 1000 Genomes Project (1KGP). Демонстрируются критические расхождения в производительности: чувствительность к размеру выборки: точность STITCH значительно улучшилась при увеличении выборок, тогда как QUILT2 и GLIMPSE2 показали минимальную зависимость от размера выборки. Оптимизация референтной панели: популяционно-специфический CKB значительно повысил точность для QUILT2 и GLIMPSE2, но оказал незначительное влияние на STITCH, который основан на внутреннем гаплотипном выводе. Пороги глубины: Все инструменты достигли высокой точности на умеренных глубинах секвенирования (≥ 0,5x), но STITCH значительно уступал на ультранизких глубинах (≤ 0,1x). GLIMPSE2 с CKB обеспечивал наивысшую общую точность, а QUILT2 сбалансировал точность и вычислительную эффективность. Для данных неинвазивного пренатального тестирования (NIPT) GLIMPSE2+CKB обеспечивал достаточную точность для дальнейших анализов. Предлагается система принятия решений, в которой приоритет отдаются панели с сопоставлением по численности населения и инструменты, адаптированные к глубине, предлагая практические рекомендации по оптимизации ULDS-WGS в различных исследовательских условиях. Эти открытия объединяют методологические достижения с практической реализацией, позволяя экономически эффективно масштабировать геномные исследования без ущерба для качества данных.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Секвенирование с ультранизкой глубиной (ULDS), определяемое как покрытие секвенирования менее 1x, получило популярность благодаря низкой стоимости, широкому охвату генома и совместимости с различными типами выборок. Он уже продемонстрировал клиническую ценность в таких приложениях, как неинвазивное пренатальное тестирование (NIPT)1, мониторинграка 2 и обнаружение вариаций числа хромосомных копий (CNV) 3,4. Помимо клинической диагностики, снижение стоимости секвенирования и быстрый прогресс в биоинформатике позволили ULDS играть всё большую роль в популяционной геномике и исследованиях сложных признаков. Объединяя данные ULDS с эталонными панелями гаплотипов на уровне популяции, импутация генотипов позволяет восстанавливать информацию о вариантах по всему геному на индивидуальном уровне. В результате ULDS стал экономичной альтернативой традиционным массивам однонуклеотидных полиморфизмов (SNP) и глубокому секвенированию целого генома (WGS)5, особенно в масштабных исследованиях, таких как геномные ассоциативные исследования (GWAS) и анализ структуры популяций.

Предыдущие исследования показали возможность проведения различных генетических исследований с использованием данных секвенирования NIPT, включая вызов вариантов, реконструкцию популяционного анамнеза, выведение вирусной инфекции иGWAS 6.

Несмотря на эти преимущества, крайне скудный характер данных ULDS представляет собой уникальные трудности. На уровне вариантов многие участки полностью не наблюдаются или представлены только одним аллелем на индивида, что приводит к недостаточному качеству данных для дальнейших анализов. Поэтому импутация генотипов крайне важна, используя структуру гаплотипов из крупных эталонных панелей (например, 1000геномов 7 или ресурсы, специфичные для популяции), чтобы статистически вывести отсутствующие или неопределённые генотипы. Предыдущие исследования показали, что импутация на основе данных NIPT может достигать высокой точности и сохранять надёжную статистическую мощь в GWAS для идентификации вариантов, связанных спризнаками, 8. С помощью алгоритмаSTITCH 9 данные NIPT (средняя глубина ~0,15x) в когорте из 20 900 китайских беременных женщин были успешно вчислены, что привело к выявлению локусов, связанных с беременностью. Вчисленные генотипы показали сильное соответствие с данными высокого уровня WGS в результатах GWAS (Pearson R² > 0.8)10.

Успех анализов на основе ULDS критически зависит от точности импутации, на которую влияют глубина секвенирования, качество эталонной панели и совпадение популяции, производительность алгоритма импутации, размер выборки и спектр частотыаллелей 11. Среди них выбор эталонной панели является важным фактором точности импутации. Широко используемые панели включают глобально репрезентативные ресурсы, такие как проект 1000 геномов (1KGP)7,TOPMed 12 и Haplotype Reference Consortium (HRC)13, а также всё более доступные панели, ориентированные на популяцию или регионы, такие как Singapore 10,000 Genomes (SG10K)14, China Kadoorie Biobank (CKB)15. Ещё одним ключевым фактором в эффективности импутации является выбор алгоритма. Было разработано несколько инструментов для решения уникальных задач низкоглубинного секвенирования, что значительно способствует практическому применению импутации в крупномасштабных генетических исследованиях. Хотя методы импутации, такие как Beagle (v5+)16, Minimac417 и IMPUTE511 , широко применяются для массив SNP и средней и высокой глубины WGS, они часто работают неоптимально в условиях ULDS. В последнее время были разработаны специализированные инструменты для решения этих проблем. STITCH9 выводит гаплотипы напрямую из чтений низкой глубины секвенирования, что делает его особенно подходящим для больших однородных когорт. QUILT2 18 использует сжатую гаплотипную библиотеку и локализованную модель правдоподобия, что обеспечивает эффективную импутацию с помощью огромных эталонных панелей и предлагает уникальные применения в пренатальной геномике. GLIMPSE219, расширение оригинального фреймворка GLIMPSE, обеспечивает дальнейшие улучшения как точности, так и вычислительной эффективности.

Хотя эти инструменты представляют собой значительный прогресс, их относительная эффективность при различных экспериментальных проектах (например, глубина секвенирования, размер когорты и выбор эталонной панели) не была систематически оценена, что оставило исследователей без чётких указаний по выбору наиболее подходящей стратегии. Чтобы преодолеть этот разрыв, три широко используемых инструмента импутации ULDS — STITCH, QUILT2 и GLIMPSE2 — были систематически тестированы при различных глубинах секвенирования и размерах выборок. Их результаты оценивались с помощью двух восточноазиатских референсных панелей, очень актуальных для китайского населения. Результаты показывают, что импутация ULDS в целом надёжна на глубинах секвенирования ≥0,5x, тогда как глубины <0,1x требуют значительно больших когорт для достижения приемлемой точности. Выбор эталонной панели должен быть адаптирован к контексту исследования, при этом панели, сопоставленные по популяциям, такие как CKB, улучшают точность импутации. Кроме того, эти подходы напрямую применимы к сверхнизкоглубоким данным, полученным в крупномасштабных популяционных исследованиях и NIPT. Таким образом, это исследование устанавливает практическую основу для выбора инструментов в исследованиях на основе ULDS, предоставляя методологические рекомендации для будущих применений в популяционной генетике и анализе сложных признаков.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Все участники предоставили письменное информированное согласие перед участием. Исследование с использованием глубоких данных WGS было рассмотрено и одобрено Институциональным обзорным советом BGI (BGI-IRB 23058-T2), а одобрение на сбор человеческих генетических ресурсов было получено Управлением по человеческим генетическим ресурсам Китая ([2023] CJ0262). Исследование с использованием данных ULDS из NIPT было одобрено Институциональным обзорным советом Уханской детской больницы (2021R062) и Институциональным обзорным советом BGI (BGI-IRB 21088), с дополнительным одобрением Управления по человеческим генетическим ресурсам Китая ([2021] CJ2002).

ПРИМЕЧАНИЕ: В этом исследовании были включены два типа данных WGS. Первый тип состоял из глубоких данных WGS (30xx), полученных из образцов крови 500 особей, набранных из естественной популяционной когорты в Шэньчжэне. Эти данные использовались для создания высококачественного набора данных по правде на земле, а также для последующей оценки понижения выборки и точности. Второй тип включал данные ULDS, полученные из NIPT 10 000 беременных женщин из района Уханя.

1. Данные секвенирования целого генома с большой глубиной

  1. Собрать 500 образцов периферической крови (по 5 мл каждая) из общей группы населения после информированного согласия. Храните образцы в пробирках ЭДТА и транспортируйте их при температуре 2-8 °C.
  2. Центрифугуйте кровь в концентрации 1600 г в течение 10 минут при 4 °C, чтобы отделить плазму и оболочку. Аккуратно соберите баффи и храните при -80 °C до извлечения ДНК.
  3. Извлекайте геномную ДНК из шерсти Buffy с помощью набора на основе магнитных бусин, следуя инструкциям производителя.
  4. Количественно определить концентрацию ДНК с помощью флюорометрического анализа и оценить целостность ДНК с помощью агарозного гелевого электрофореза. Выбирайте образцы с общим выходом ДНК ≥1 мкг, концентрацией ≥12,5 нг/мкл и длиной фрагмента >20 кб без видимого разрушения для подготовки библиотеки.
  5. Сдвиг 80-200 нг высококачественной геномной ДНК до среднего размера 350-400 бп с помощью ультразвука.
  6. Выполните ремонт концов при 20 °C в течение 30 минут, лигирование адаптера при 20 °C в течение 15 минут и циркуляризацию при 37 °C в течение 30 минут для создания библиотек без ПЦР. Генерируйте ДНК-наношары (DNB) с помощью амплификации с вращающимся кругом (RCA). Последовательности парных концовых библиотек (PE100, длина чтения 100 bp) на платформе DNBSEQ до целевой глубины ~30x (средняя длина 100 Гб на образец). Храните необработанные чтения секвенирования в формате FASTQ для дальнейшего анализа.
    ПРИМЕЧАНИЕ: Обрабатывайте все образцы, полученные человеком, в лабораторных условиях BSL-2. Избегайте повторяющихся циклов замораживания и оттаивания, чтобы предотвратить деградацию ДНК. Утилизировать материалы, полученные из крови, как биологически опасные отходы; Утилизация химических реагентов в соответствии с институциональными рекомендациями по опасным отходам.

2. Ультранизкоглубокие данные NIPT (~0,1x WGS)

  1. Соберите 10 000 образцов материнской крови (по 5 мл каждый) для рутинного неинвазивного пренатального тестирования (NIPT). Используйте EDTA-трубки и транспортируйте при температуре 2-8 °C; Обрабатывайте плазму в течение 8 часов после сбора.
  2. Для стабилизации циркулирующих ДНК-трубок (K-трубок или G-трубок) транспортируются при 6-35 °C с использованием носителей с контролируемой температурой и обработывают в течение 96 часов, следуя стандартным производственным процедурам.
  3. Центрифугуйте кровь при 1600 г в течение 10 минут при 4 °C для разделения плазмы. Аккуратно соберите верхний слой плазмы, не нарушая шерсть баффи или клеточную гранулу с помощью пипетки, и перенесите его в новую трубку. Центрифугуйте восстановленную плазму снова при 16 000 x g в течение 10 минут при 4 °C, чтобы удалить остатки клеток или мусор. Аккуратно перенесите очищенный супернатант (безклеточную плазму) в новую трубку для извлечения ДНК.
  4. Извлечение циркулирующей ДНК без клеток (cfDNA) из плазмы с помощью набора для экстракции нуклеиновых кислот. Выполнение конечного ремонта при 20 °C в течение 30 минут, лигирование адаптера при 20 °C в течение 15 минут и усиление ПЦР (12 циклов, денатурация при 98 °C 10 с, отжиг 60 °C 30 с, расширение 72 °C 30 с).
  5. Очищайте продукты ПЦР и циркуляризуйте библиотеки при 37 °C в течение 30 минут. Генерируйте DNB через RCA. Последовательность библиотек с одним концом (SE35, длина чтения 35 bp) на платформе BGISEQ-500. Храните сырые данные секвенирования в формате FASTQ.
    ПРИМЕЧАНИЕ: Обрабатывайте образцы плазмы как потенциально инфекционный материал в условиях BSL-2. Минимизировать циклы замораживания и оттаивания для снижения деградации cfDNA. Утилизировать плазменные отходы и пластиковые расходники как биологически опасные материалы.

3. Конвейер предварительной обработки данных

  1. Для систематической оценки эффективности инструментов импутации генотипов при различных глубинах секвенирования проводится стандартизированный рабочий процесс предварительной обработки как исходных данных WGS высокой глубины (30x), так и сверхнизкоглубинных данных NIPT (<0,1x), включая имитированное понижение дискретизации, контроль качества, выравнивание считывания, удаление дубликатов и перекалибровку базового балла качества (BQSR).
    ПРИМЕЧАНИЕ: Шаги от этого момента к оценке точности импутации составляют основной протокол (рисунок 1) данного исследования. Конкретный код можно найти в Дополнительном файле 1.
  2. Даунсэмплинг
    1. Сгенерируйте серию пониженных наборов данных из оригинальных 30-кратных выборок секвенирования высокой глубины. Используйте две стратегии для реалистичного имитирования секвенирующих характеристик данных NIPT, описанных ниже.
    2. Случайная подвыборка: используйте seqtk v1.5 (https://github.com/lh3/seqtk) с фиксированным случайным seed 100 для создания четырёх уровней низкоглубоких данных (0.05x, 0.1x, 0.5x и 1.0x).
    3. Симуляция структуры чтения, подобная NIPT: Сохранять только первое считывание (R1) каждого парного конца считывания и усечать все сохранённые считывания до 35 bp с помощью seqtk trimfq -L 35, что соответствует типичному одноконцевому, короткочитающему характеру сверхнизкого NIPT-секвенирования.
  3. Контроль качества
    1. Обрабатывайте все сырые FASTQ-файлы с помощью fastp v0.23.420. Используйте следующие параметры: --qualified_quality_phred=5 (порог качества базы), --unqualified_percent_limit=50 (максимальный процент низкокачественных оснований), --n_base_limit=10 (максимальное количество N баз за чтение) и удаление индивидуального адаптера с помощью --adapter_sequence=AAGTCGGAGGCCAAGCGGTCTTAG
      GAAGACAA (R1) и --adapter_sequence_r2=AAGTCGGATCGGTAGCC
      ATGTCGTTCTGTGAG
      CCAAGGAGTTG (R2).
    2. Отключите обрезку хвоста Poly-G (--disable_trim_poly_g) и генерируйте отчёты в форматах JSON и HTML для каждого образца.
  4. Выравнивание и удаление дублирования
    1. Выровнять высококачественные считывания с человеческим эталонным геномом GRCh38 (hg38)21 с использованием BWA v0.7.16a-r118122.
    2. Выполните выравнивание алгоритмом aln (-e 10 -t 4 -i 5 -q 0), затем samse для одноконцевого выравнивания с информацией о группе чтения.
    3. Конвертируйте полученные SAM-файлы в BAM, отсортированные (samtools sort -@ 8) и удаляйте дубликаты с помощью SAMtools v1.323 (samtools rmdup). Индексируйте все BAM-файлы.
  5. Рекалибровка базового качества (BQSR)
    1. Выполните BQSR с использованием GATK v4.0.4.024. Обучить модель перекалибровки на трёх высокодоверенных вариантных наборах данных: dbSNP build 14625, Mills и 1000G золотой стандартindels 21 и24 известных файла ресурсов GATK для GRCh38. Используемые файлы наборов относятся к официальному примеру GATK (https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json). Всего скачайте три файла и соответствующие им индексные файлы.
    2. Запустите BaseRecalibrator, затем ApplyBQSR для генерации перекалиброванных BAM-файлов. Индексируйте все BAM с помощью SAMtools версии 1.3.
      ПРИМЕЧАНИЕ: Все симулированные наборы данных прошли одинаковые этапы предварительной обработки — снижение выборки, контроль качества, выравнивание, удаление дубликатов и BQSR — для обеспечения согласованности и сопоставимости при последующих оценках эффективности импутации.

4. Импутация генотипа

  1. Подготовка данных
    1. Настройка наборов данных импутации: Постройте несколько наборов данных для систематического сравнения инструментов импутации генотипов на разных глубинах и размерах выборок, как описано ниже. Всего формируется девять комбинаций на основе различных размеров выборок и глубины секвенирования, упомянутых выше. Входные файлы состоят из данных секвенирования, которые BAM-файлы перечисляют (bamlist.txt) для вышеупомянутых девяти подмножеств после контроля качества, хранящихся в соответствующих bamlist.txt файлах. Другие входные файлы включают человеческий референсный геном (GRCh3821) и генетическую карту из проекта 1000Genomes Project 7.
      1. Пониженная дискретизация данных WGS с высокой глубиной: случайным образом выберите две подгруппы (200 и 500 образцов) из 500 особей, секвенированных на глубине 30x. Понизьте дискретизацию каждого подмножества до четырёх глубин (1x, 0.5x, 0.1x и 0.05x), чтобы получить восемь экспериментальных условий.
      2. Набор данных ULDS на основе NIPT: Объедините 10 000 образцов ультранизкой глубины NIPT (средняя глубина 0,102x, рисунок 2) с 50 образцами высокой глубины, уменьшенными до 0,1x.
    2. Спецификация области анализа: Ограничить все анализы областью хромосомы 1 chr1:150,500,000-160,500,000 (10 Мб), с буфером 500 кб для импутации, чтобы обеспечить прямое сопоставимость между инструментами.
    3. Выбор референтной панели: используйте две панели (Таблица 1): панель CKB, построенная на основе данных о китайском населении, и панель 1KGP-EAS, основанная на восточноазиатском подмножестве проекта 1000 геномов.
      ПРИМЕЧАНИЕ: Референсная панельCKB 15 была создана на основе данных секвенирования целого генома с высокой глубиной (~15x) от 9 964 взрослых китайских взрослых в China Kadoorie Biobank, крупном проспективном когортном исследовании. Эти образцы получены из естественной популяции с минимальными фенотипическими искажениями, однородным ханьским происхождением и устойчивой структурой популяции, что делает их особенно подходящими для импутации генотипов в китайских когортах. Ю и др. 15 продемонстрировали, что в реальном фенотипном GWAS для роста импутация с использованием панели CKB утроила количество обнаруженных SNP и удвоила количество значимых вариантов по всему геному. Проект 1000 геномов (1KGP)7,26, наиболее широко используемый геномный справочник, включает 585 особей в своей восточноазиатской (EAS) фазе 3. Эта подгруппа охватывает пять восточноазиатских популяций с глубиной секвенирования примерно 30x, включая ханьцев в Пекине (CHB), южных ханьцев (CHS), китайских дай в Сишуанбаньна (CDX), кинь в Хошимине, Вьетнам (KHV) и японцев в Токио (JPT).
  2. Инструменты импутации
    1. Оценить три алгоритма импутации, выбранных за их уникальные стратегии моделирования и применимость к данным секвенирования сверхнизкой глубины (ULDS).
      1. STITCH: STITCH (v1.6.6) — это алгоритм импутации на основе гаплотипов без ссылки, который может по желанию включать внешние эталонные гаплотипы. Включайте списки BAM, человеческий референсный геном (GRCh38) в качестве входных файлов. При выполнении импутации на основе ссылки готовьте файлы панели отсылок (hap/legend/pos). Включите следующие ключевые параметры: method=диплоид, buffer=500 kb, K=10 предковых гаплотипов и nGen=4x размер выборки/K (как рекомендовано в документации STITCH). Генерируйте выходные файлы с дозировками генотипа для каждого SNP для всех индивидов.
        ПРИМЕЧАНИЕ: Согласно официальной документации STITCH, K — это число предковых гаплотипов в модели. Более крупный K повышает точность импутации для больших выборок и более высоких покрытий, но также увеличивает время вычислений, и точность может снижаться при меньшем покрытии.
      2. QUILT2: QUILT2 применяет байесовский ориентированный подход, оптимизированный для данных ULDS. Выполните подготовку эталонной панели с помощью предоставленного prepare_reference скрипта, указывая генетическую карту и координаты региона. Запускайте режим импутационного диплоида с тем же размером буфера (500 кб) и настройками nGen как STITCH для обеспечения сопоставимости.
      3. GLIMPSE2: GLIMPSE2 — это инструмент импутации на основе HMM, предназначенный для крупномасштабных и очень низкоглубоких секвенирующих наборов данных. Выполнить импутацию с помощью GLIMPSE2_phase_static, указывая входный список BAM, человеческую референсную панель VCF, генетическую карту, входную область = chr1:150,000,000-161,000,000, выходную область = chr1:150,500,000-160,500,000 (для поддержания буфера 500 кб). Файл списка BAM, введённый здесь, должен содержать два столбца: один — путь BAM, второй — имя примера. Если второй столбец не введён, каждое имя файла BAM будет использоваться как имя образца в выходном VCF-файле.

5. Оценка точности импутации

  1. Определение множества истинности
    1. Выберите 50 особей, секвенированных на 30-кратной глубине в качестве набора данных на земле. Включить эти образцы в экспериментальные условия понижения пробы для обеспечения сопоставимости.
    2. Выполните вызов вариантов для набора истины с помощью следующего конвейера: SOAPnuke27 для контроля качества, BWA для выравнивания, Picard для дублирующей маркировки, GATK v4.0.4.0 BQSR и HaplotypeCaller для вызова вариантов, DPGT (https://github.com/BGI-flexlab/DPGT) для совместного вызова и BCFtools v1.1123 для фильтрации качества вариантов.
    3. Сохраняйте только варианты PASS с высокой уверенностью для генерации бенчмарк-файла VCF. Ограничьте оценку chr1:150,500,000-160,500,000, в соответствии с введёнными наборами данных.
  2. Гармонизация и фильтрация данных
    1. Обрабатывайте VCF-файлы со всех инструментов с помощью PLINK2.028. Извлечь данные о дозировке и конвертировать в формат pgen.
    2. Применяйте контроль качества на уровне SNP со следующими фильтрами: частота малых аллелей (MAF) ≥ 0,05 (--maf 0,05), равновесие Харди-Вайнберга (HWE) p-значение ≥ 1e-6 (--hwe 1e-6), только биалельные SNP (--макс-аллели 2).
    3. Экспортные варианты, передающие контроль качества в формат traw для сравнения в следующем потоке.
  3. Метрики точности
    1. Сравните предполагаемые дозировки с дозами для каждого SNP. Вычислить коэффициенты корреляции Пирсона (R) на основе SNP за SNP, сохранить только сайты, общие для обоих наборов данных, и вычислить среднее квадрат коэффициентов корреляции (R²) по всем оценённым SNP для количественной оценки общей точности импутации для каждого условия.
    2. Используйте эту метрику точности, чтобы зафиксировать согласованность оценок дозы генотипов между вчисленными и истинными генотипами.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Влияние размера выборки на точность импутации
Увеличение размера выборки с N = 200 до N = 500 повысило точность импутации STITCH, особенно при условиях низкого покрытия. Например, при референсной панели CKB с 1x покрытием STITCH достигR 2> 0,916 (N=500) по сравнению с 0,882 (N=200), что составляет рост на 3,4 % (рисунок 3; Дополнительный файл 2). Аналогично, при покрытии 0,5x его точность вырос...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании систематически оценивалась работа трёх широко используемых инструментов генотиповой импутации для ULDS, при этом высокоглубокий WGS служил золотым стандартом. Ключевым методологическим преимуществом является внедрение единого конвейера предобработки, включающего выравнивание, контроль качества и перекалибровку базовых оценок качества, который минимизирует эффекты пакетов и обеспечивает сопоставимость между инструментами и условиями. Понижая дискретизацию глубоко секве...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не заявляют о конкурирующих интересах.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование было поддержано Шэньчжэньским медицинским исследовательским фондом (B2404004), Национальной программой ключевых исследований и разработок Китая (2023YFC2605400, 2022YFC2502402), Шэньчжэньской научной и технологической программой (SYSPG20241211173852024), Открытым исследовательским проектом в Государственной ключевой лаборатории сосудистой гомеостаза и ремоделирования (Пекинский университет) (2025-SKLVHR-013) и Ключевой исследовательской и разработочной программой провинции Гуандун (2023B0303040001).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Data
10 000 низкоглубинных образцов NIPTЭта статьяДанные секвенирования целого генома с ультранизкой глубиной, используемые для бенчмарка импутации.
500 глубоких образцов WGSЭта статья30 с лишним раз; Высокоглубина WGS используется как золотой стандарт/набор истины.
<сильный>Референсный панель
Эталонная панель 1KGP-EASПроект 1000 геномов (Восточная Азия)Подмножество 1KGP для восточноазиатского происхождения.
Эталонная панель CKBChina Kadoorie BiobankИндивидуальная панель, специфичная для популяции, для импутации генотипа.
<Сильно>Программное обеспечение и алгоритмы
BCFtools v1.11GitHub (samtools/bcftools)Используется для слияния и сортировки результатов на уровне хромосом, а также для фильтрации вариантов.
BQSR набора инструментов GATK 4.0.4.0Институт БроудИспользуется для перекалибровки базового качества баллов (BQSR).
BWA-MEM .7.16a-r1181Хэн Ли / GitHubДля выравнивания исходных считываний в GRCh38.
DPGT (Инструмент распределённой популяционной генетики)BGIРаспределённый инструмент анализа популяционной генетики, позволяющий совместный вызов миллионов образцов WGS. Доступно на [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)
fastp.0.23.4Открытый исходный код (Chen и др., 2018)Для контроля качества и обрезки адаптеров.
GLIMPSE2Оксфордский университетБыстрая фазировка и импутация генотипов для WGS с низким покрытием
Оригинальный код анализаЭта статья<сильный>дополнительный файл 1 Оригинальный код для анализа
Набор инструментов PicardИнститут БроудИспользуется для маркировки дубликатов и конвертации файлов в формат файла.
Plink 2.0С. Чанг, С. Пёрселл / Институт БроудДля преобразования формата генотипа и анализа ассоциаций.
Python 3.8Фонд программного обеспечения PythonИспользуется для скриптов, автоматизации и анализа данных.
QUILT2Оксфордский институт больших данныхИмпутация на основе HMM с использованием внешних эталонных панелей
R 4.1.3Фонд RИспользуется для запуска STITCH, QUILT2 и построения графиков/статистики.
SAMtools v1.3GitHub (samtools/samtools)Для обработки SAM/BAM файлов.
Seqtk-1.5GitHub (lh3/seqtk)Набор инструментов для обработки последовательностей в форматах FASTA/Q. Доступно на [GitHub - lh3/seqtk](https://github.com/lh3/seqtk)
SOAPnukeBGIДля контроля качества и фильтрации данных NGS.
STITCH v1.6.6Оксфордский университетИнструмент импутации, оптимизированный для секвенирования сверхнизкого покрытия
tabixGitHub (samtools/tabix)Используется для индексации и запросов к bgzip-файлам VCF.
<прочные>другие материалы
Файлы наборов GATKGATKДоступно по адресу [https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json]
Генетическая карта для 1000G (GRCh38)Проект Оксфорд / 1000 геномовТребуется для инструментов фазирования/импутации
GRCh38Консорциум геномных референтовИспользуется для выравнивания считывания и вызова вариантов

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи