مقالة منهجية

تقييم شامل لأدوات تحديد النمط الجيني لبيانات تسلسل الجينوم الكامل منخفضة العمق جدا

DOI:

10.3791/68879

ديسمبر 12, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم قياس ثلاث أدوات للنسب—STITCH، QUILT2، و GLIMPSE2—عبر أعماق وأحجام عينات مختلفة، باستخدام لوحات مرجعية CKB وEAS. توفر النتائج إطارا عمليا لاختيار استراتيجيات التعيين المناسبة في بيانات التسلسل ذات العمق المنخفض جدا، مما يسهل دراسات الجينوم السكانية والصفات المعقدة واسعة النطاق.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعد تسلسل التسلسل فائق العمق (ULDS) استراتيجية فعالة من حيث التكلفة للدراسات الجينومية واسعة النطاق، لكن فائدته تعتمد على تحديد النمط الجيني الدقيق. تقيم هذه الدراسة ثلاث أدوات للتقييم — STITCH وQUILT2 و GLIMPSE2 — عبر أعماق وأحجام عينات مختلفة، باستخدام لوحات مرجعية لبنك الصين كادوري البيولوجي (CKB) ومشروع 1000 جينوم (1KGP) شرق آسيا (EAS). تم إثبات الفروقات الحرجة في الأداء: حساسية حجم العينة: تحسنت دقة STITCH بشكل ملحوظ مع العينات الأكبر، بينما أظهرت QUILT2 و GLIMPSE2 اعتمادا ضئيلا على حجم العينة. تحسين لوحات المراجع: حسن CKB الخاص بالسكان زاد بشكل كبير من الدقة ل QUILT2 و GLIMPSE2 لكنه كان له تأثير ضئيل على STITCH، الذي يعتمد على الاستدلال الهوسلوبي الداخلي. عتبات العمق: حققت جميع الأدوات دقة قوية عند أعماق تسلسل متوسطة (≥ 0.5x)، لكن أداء STITCH كان أقل بكثير عند الأعماق المنخفضة جدا (≤ 0.1x). قدم GLIMPSE2 مع CKB أعلى دقة إجمالية، بينما وازن QUILT2 بين الدقة والكفاءة الحاسوبية. بالنسبة لبيانات اختبارات ما قبل الولادة غير الجراحية (NIPT)، حافظ GLIMPSE2+CKB على دقة كافية للتحليلات اللاحقة. تم اقتراح إطار قرار يعطي الأولوية للجان المطابقة للسكان والأدوات المعدلة للعمق، ويقدم إرشادات قابلة للتنفيذ لتحسين نظام ULDS-WGS في بيئات بحثية متنوعة. تربط هذه الرؤى بين التقدم المنهجي والتنفيذ العملي، مما يتيح توسيع نطاق الدراسات الجينومية بشكل فعال من حيث التكلفة دون المساس بجودة البيانات.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

التسلسل فائق العمق (ULDS)، المعروف بأنه تغطية التسلسل أقل من 1x، اكتسب شعبية بسبب تكلفته المنخفضة، وتغطيته الجينومية الواسعة، وتوافقه مع أنواع العينات المتنوعة. وقد أظهرت بالفعل قيمة سريرية في تطبيقات مثل الفحص غير الجراحي قبل الولادة (NIPT)1، ومراقبة السرطان2، وكشف تغير عدد النسخ الكروموسومي (CNV) 3,4. بعيدا عن التشخيص السريري، فإن انخفاض تكلفة التسلسل والتقدم السريع في المعلوماتية الحيوية مكن ULDS من لعب دور متزايد في علم الجينوم السكاني وأبحاث السمات المعقدة. من خلال دمج بيانات ULDS مع لوحات مرجعية للأنماط الجينية على نطاق السكان، يمكن التصنيف الجيني من استعادة معلومات المتغيرات على مستوى الجينوم على مستوى الفرد. ونتيجة لذلك، برز ULDS كبديل فعال من حيث التكلفة لمصفوفات تعدد الأشكال الأحادية النيوكليوتيد التقليدية (SNP) والتسلسل العميق للجينوم الكامل (WGS)5، خاصة في الدراسات واسعة النطاق مثل دراسات الارتباط الجينومي العام (GWAS) وتحليلات بنية السكان.

أظهرت أبحاث سابقة جدوى إجراء دراسات جينية متنوعة باستخدام بيانات تسلسل NIPT، بما في ذلك استدعاء المتغيرات، وإعادة بناء تاريخ السكان، واستنتاج أنماط العدوى الفيروسية، وGWAS6.

على الرغم من هذه المزايا، فإن الطبيعة النادرة جدا لبيانات ULDS تطرح تحديات فريدة. على مستوى المتغيرات، العديد من المواقع غير ملحوظة تماما أو ممثلة بأليل واحد فقط لكل فرد، مما يؤدي إلى نقص جودة البيانات للتحليلات اللاحقة. لذلك، فإن تصنيف النمط الجيني أمر أساسي، مع الاستفادة من بنية الأنماط الجينية من لوحات مرجعية كبيرة (مثل 1000 جينوم7 أو موارد محددة للمجتمع) لاستنتاج أنماط جينية مفقودة أو غير مؤكدة إحصائيا. أظهرت الأعمال السابقة أن النسبة من بيانات NIPT يمكن أن تحقق دقة عالية وتحتفظ بقوة إحصائية قوية في GWAS لتحديد المتغيرات المرتبطة بالصفات8. باستخدام خوارزمية STITCH9 ، تم اعتماد بيانات NIPT (المتوسط العمق ~0.15x) في مجموعة مكونة من 20,900 امرأة حوامل صينية بنجاح، مما أدى إلى تحديد المواقع المرتبطة بالحمل. أظهرت الأنماط الجينية المحسوبة توافقا قويا مع بيانات WGS عالية العمق في نتائج GWAS (بيرسون R² > 0.8)10.

يعتمد نجاح التحليلات القائمة على ULDS بشكل حاسم على دقة الحساب، التي تتأثر بعمق التسلسل، وجودة لوحات المرجع ومطابقة السكان، وأداء خوارزمية الحساب، وحجم العينة، وطيف تردد الأليل11. من بين هذه العوامل، يعد اختيار لوحة المراجع معدلا رئيسيا لدقة الحساب. تشمل اللوحات المستخدمة بشكل شائع موارد تمثيلية عالميا مثل مشروع 1000 جينوم (1KGP)7، وTOPMed12، واتحاد مرجع النمط النموذجي (HRC)13، بالإضافة إلى لوحات مخصصة للسكان أو المناطق المتاحة بشكل متزايد مثل Singapore 10,000 Genomes (SG10K)14، وبنك الصين كادوري الحيوي (CKB)15. عامل رئيسي آخر في أداء التحويل هو اختيار الخوارزمية. تم تطوير عدة أدوات لاستيعاب التحديات الفريدة للتسلسل منخفض العمق، مما يعزز بشكل كبير الاستخدام العملي للإشارة في الأبحاث الجينية واسعة النطاق. بينما تستخدم طرق الحساب مثل بيغل (v5+)16، Minimac417، و IMPUTE511 على نطاق واسع لمصفوفات SNP وبيانات WGS متوسطة إلى العالية، إلا أنها غالبا ما تؤدي أداء غير مثالي في إعدادات ULDS. ومؤخرا، تم تطوير أدوات متخصصة لمواجهة هذه التحديات. تستنتج STITCH9 الأنماط الجينية مباشرة من قراءات التسلسل منخفض العمق، مما يجعله مناسبا بشكل خاص للمجموعات الكبيرة المتجانسة. يستخدم QUILT218 مكتبة هابلوتايب مضغوطة ونموذج احتمالية محلي، مما يتيح حسابا فعالا من خلال لوحات مرجعية ضخمة ويقدم تطبيقات فريدة في علم الجينوم قبل الولادة. GLIMPSE219، وهو امتداد لإطار GLIMPSE الأصلي، يوفر تحسينات إضافية في كل من الدقة والكفاءة الحاسوبية.

على الرغم من أن هذه الأدوات تمثل تقدما كبيرا، إلا أن أدائها النسبي تحت تصاميم تجريبية مختلفة (مثل عمق التسلسل، حجم المجموعة، واختيار لوحة المرجع) لم يتم تقييمه بشكل منهجي، مما ترك الباحثين بدون إرشادات واضحة لاختيار الاستراتيجية الأنسب. لسد هذه الفجوة، تم قياس ثلاث أدوات تعبيد ULDS مستخدمة على نطاق واسع — STITCH وQUILT2 و GLIMPSE2 — بشكل منهجي تحت أعماق وأحجام عينات متعددة في التسلسل. تم تقييم أدائهم باستخدام لوحتين مرجعيتين شرق آسيويتين ذات صلة كبيرة بالسكان الصينيين. تشير النتائج إلى أن التعيينات بنظام ULDS موثوق عموما عند أعماق التسلسل ≥0.5x، بينما تتطلب الأعماق <0.1x مجموعات أكبر بكثير لتحقيق دقة مقبولة. يجب أن يكون اختيار لوحات المراجع مخصصا لسياق الدراسة، مع تحسين اللوحات المطابقة للسكان مثل CKB على تحسين دقة النسب. علاوة على ذلك، تنطبق هذه الأساليب مباشرة على البيانات ذات العمق المنخفض جدا التي يتم إنشاؤها في دراسات السكان واسعة النطاق وNIPT. تؤسس هذه الدراسة بذلك إطارا عمليا لاختيار الأدوات في الأبحاث القائمة على ULDS، وتوفر إرشادات منهجية للتطبيقات المستقبلية في علم الوراثة السكانية وتحليلات الصفات المعقدة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

قدم جميع المشاركين موافقة مستنيرة مكتوبة قبل المشاركة. تمت مراجعة الدراسة التي شملت بيانات التنوع العلمي عالية العمق والموافقة عليها من قبل مجلس مراجعة المؤسسات في BGI (BGI-IRB 23058-T2)، وتم الحصول على الموافقة على جمع الموارد البشرية الوراثية من إدارة الموارد البشرية الوراثية في الصين ([2023] CJ0262). تمت الموافقة على الدراسة التي تناولت بيانات ULDS من NIPT من قبل مجلس المراجعة المؤسسية لمستشفى ووهان للأطفال (2021R062) ومجلس المراجعة المؤسسية لمعهد BGI (BGI-IRB 21088)، مع موافقة إضافية من إدارة الموارد البشرية الوراثية في الصين ([2021] CJ2002).

ملاحظة: تضمنت هذه الدراسة نوعين من بيانات WGS. كان النوع الأول عبارة عن بيانات بيانات WGS عالية العمق (30xx) تم الحصول عليها من عينات دم 500 فرد تم تجنيدهم من مجموعة سكانية طبيعية في شنزن. تم استخدام هذه البيانات لبناء مجموعة بيانات دقيقة أرضية عالية الجودة ولإجراء تقييمات لاحقة للتقليل من العينة والدقة. أما النوع الثاني فكان يتضمن بيانات ULDS المستمدة من اختبار NIPT ل 10,000 امرأة حامل من منطقة ووهان.

1. بيانات تسلسل الجينوم الكامل عالية العمق

  1. اجمع 500 عينة دم محيطية (5 مل لكل واحدة) من مجموعة عامة بعد الحصول على موافقة مستنيرة. تخزين العينات في أنابيب EDTA ونقلها عند 2-8 درجات مئوية.
  2. دم الطرد المركزي بقوة 1,600 × جرام لمدة 10 دقائق عند 4 درجات مئوية لفصل البلازما عن الطبقة الصوفية. اجمع معطف البوفي بعناية وخزنها عند -80 درجة مئوية حتى يتم استخراج الحمض النووي.
  3. استخلاص الحمض النووي الجينومي من Buffy Cot باستخدام مجموعة خرزات مغناطيسية وفقا لتعليمات الشركة المصنعة.
  4. قم بقياس تركيز الحمض النووي باستخدام اختبار فلورومتري وتقييم سلامة الحمض النووي باستخدام الرحلان الكهربائي بجل الأغاروز. اختاروا عينات بعائد DNA إجمالي ≥1 ميكروغرام، وتركيز ≥12.5 نانوغرام/ميكرولتر، وطول الشظايا >20 كيلو بايت، دون تدهور مرئي لتحضير المكتبة.
  5. يتم قص 80-200 نانوغرام من الحمض النووي الجيني عالي الجودة إلى متوسط حجم 350-400 بن لكل حرس عن طريق الموجات فوق الصوتية.
  6. قم بإصلاح الطرف عند 20 درجة مئوية لمدة 30 دقيقة، وربط المحول عند 20 درجة مئوية لمدة 15 دقيقة، والتدوير عند 37 درجة مئوية لمدة 30 دقيقة لبناء مكتبات خالية من PCR. توليد كرات نانوية للحمض النووي (DNBs) باستخدام تضخيم الدائرة المتدحرجة (RCA). مكتبات التسلسل ذات النهاية المزدوجة (PE100، طول القراءة 100 بيتاب) على منصة DNBSEQ بعمق مستهدف ~30x (متوسط 100 جيجابت لكل عينة). تخزين قراءات التسلسل الخام بصيغة FASTQ للتحليل اللاحق.
    ملاحظة: التعامل مع جميع العينات المشتقة من الإنسان تحت ظروف مختبرية BSL-2. تجنب تكرار دورات التجميد والذوبان لمنع تحلل الحمض النووي. التخلص من المواد المشتقة من الدم كنفايات بيولوجية خطرة؛ التخلص من الكواشف الكيميائية وفقا لإرشادات النفايات الخطرة المؤسسية.

2. بيانات NIPT ذات عمق منخفض جدا (~0.1x WGS)

  1. اجمع 10,000 عينة دم أم (5 مل لكل واحدة) لإجراء اختبارات روتينية غير جراحية قبل الولادة (NIPT). استخدم أنابيب EDTA والنقل عند 2-8 درجات مئوية؛ معالجة البلازما ضمن 8 ساعات من الجمع.
  2. بالنسبة لأنابيب الحمض النووي المتداولة المثبتة (أنابيب K أو أنابيب G)، يتم النقل عند 6-35 درجة مئوية باستخدام حاملات تحكم في درجة الحرارة وتقوم بالمعالجة خلال 96 ساعة وفقا لإجراءات التشغيل القياسية للمصنع.
  3. دم الطرد المركزي بقوة 1,600 × جرام لمدة 10 دقائق عند 4 درجات مئوية لفصل البلازما. اجمع بعناية الطبقة العليا من البلازما دون الإخلال بطبقة البلازما أو الحبيبات الخلوية باستخدام ماصة وانقلها إلى أنبوب جديد. قم بالطرد المركزي للبلازما المستخرجة مرة أخرى عند 16,000 x g لمدة 10 دقائق عند 4 درجات مئوية لإزالة أي خلايا أو حطام متبق. انقل بعناية الفائق الشفاف (البلازما الخالية من الخلية) إلى أنبوب جديد لاستخراج الحمض النووي.
  4. استخلاص الحمض النووي الخلوي الخالي من الخلايا (cfDNA) المتداول من البلازما باستخدام مجموعة استخلاص الأحماض النووية. قم بإصلاح الطرف عند 20 درجة مئوية لمدة 30 دقيقة، وربط المحول عند 20 درجة مئوية لمدة 15 دقيقة، وتضخيم PCR (12 دورة، إزالة الطبيعة 98 درجة مئوية 10 ثوان، التلدين 60 درجة مئوية 30 ثانية، 72 درجة مئوية 30 ثانية).
  5. قم بتنقية منتجات PCR وتدوير المكتبات عند 37 درجة مئوية لمدة 30 دقيقة. توليد DNBs عبر RCA. مكتبات التسلسل أحادي الطرف (SE35، طول القراءة 35 قطعة بنطل) على منصة BGISEQ-500. تخزين بيانات التسلسل الخام بصيغة FASTQ.
    ملاحظة: تعامل مع عينات البلازما كمادة محتملة معدية تحت ظروف BSL-2. تقليل دورات التجمد والذوبان لتقليل تحلل الحمض النووي الكربوني (cfDNA). التخلص من نفايات البلازما والمواد البلاستيكية كمواد خطرة بيولوجيا.

3. خط معالجة البيانات المسبق

  1. لتقييم أداء أدوات التحديد الجيني بشكل منهجي تحت أعماق تسلسل مختلفة، تنفيذ سير عمل مسبق موحد على بيانات WGS الأصلية عالية العمق (30x) وبيانات NIPT منخفضة العمق جدا (<0.1x)، بما في ذلك تقليل العينة المحاكاة، ومراقبة الجودة، ومحاذاة القراءة، وإزالة التكرار، وإعادة معايرة جودة الأساس (BQSR).
    ملاحظة: الخطوات من هذه النقطة إلى تقييم دقة النسبة تشكل البروتوكول الرئيسي (الشكل 1) لهذه الدراسة. يمكن العثور على الرمز المحدد في الملف التكميلي 1.
  2. تقليل العينات
    1. توليد سلسلة من مجموعات البيانات المخفضة من عينات التسلسل عالية العمق الأصلية التي بلغت 30 ضعفا. استخدم استراتيجيتين لمحاكاة خصائص التسلسل لبيانات NIPT بشكل واقعي كما هو موضح أدناه.
    2. أخذ عينات عشوائية: استخدم seqtk v1.5 (https://github.com/lh3/seqtk) مع بذرة عشوائية ثابتة 100 لإنشاء أربعة مستويات من البيانات منخفضة العمق (0.05x، 0.1x، 0.5x، و1.0x).
    3. محاكاة بنية القراءة الشبيهة ب NIPT: يحتفظ فقط بالقراءة الأولى (R1) لكل قراءة مزدوجة النهاية ويقص جميع القراءات المحتجزة إلى 35 نقطة أساس باستخدام seqtk trimfq -L 35، بما يتوافق مع الطبيعة النموذجية للقراءة القصيرة أحادية الطرف والقصيرة لتسلسل NIPT منخفض العمق للغاية.
  3. مراقبة الجودة
    1. معالجة جميع ملفات FASTQ الخام باستخدام fastp v0.23.420. استخدم المعايير التالية: --qualified_quality_phred=5 (عتبة جودة الأساس)، --unqualified_percent_limit=50 (الحد الأقصى للقواعد منخفضة الجودة المسموح بها)، --n_base_limit=10 (أقصى N قواعد لكل قراءة)، وإزالة المحول المخصص مع --adapter_sequence=AAGTCGGGGCCAAGCGGTCTTAG
      GAAGACAA (R1) و --adapter_sequence_r2=AAGTCGGATCGTAGCC
      ATGTCGTTGTGTGAG
      CCAAGGAGTTG (R2).
    2. قم بتعطيل تقليم الذيل في Poly-G (--disable_trim_poly_g)، وإنشاء تقارير بتنسيقي JSON وHTML لكل عينة.
  4. المحاذاة وإزالة التكرار
    1. محاذاة القراءات عالية الجودة مع الجينوم المرجعي البشري GRCh38 (hg38)21 باستخدام BWA v0.7.16a-r118122.
    2. قم بتنفيذ المحاذاة باستخدام خوارزمية aln (-e 10 -t 4 -i 5 -q 0)، تليها samse لمحاذاة الطرف الواحد مع معلومات مجموعة القراءة.
    3. تحويل ملفات SAM الناتجة إلى BAM، مرتب (samtools sort -@ 8)، وإزالة التكرارات باستخدام SAMtools v1.323 (samtools rmdup). قم بفهرسة جميع ملفات BAM.
  5. إعادة معايرة نقاط الجودة الأساسية (BQSR)
    1. قم بأداء BQSR باستخدام GATK v4.0.4.024. درب نموذج إعادة المعايرة على ثلاث مجموعات بيانات متغيرة عالية الثقة: dbSNP build 14625، Mills و1000G الذهبي القياسيindels 21، وحزمة الموارد24 المعروفة ل GATK لملف INDELS المعروف ل GRCh38. تشير ملفات الحزم المستخدمة إلى المثال الرسمي ل GATK (https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json). بالمجمل، قم بتحميل ثلاثة ملفات وملفات الفهرس المقابلة لها.
    2. شغل BaseRecalibrator متبوعا ب ApplyBQSR لتوليد ملفات BAM معاد معايرة. قم بفهرسة جميع أجهزة BAM باستخدام SAMtools v1.3.
      ملاحظة: جميع مجموعات البيانات المحاكاة خضعت لخطوات معالجة مسبق متطابقة - خفض العينة، مراقبة الجودة، المحاذاة، إزالة التكرار، وBQSR - لضمان الاتساق والمقارنة في تقييمات أداء الحسابات اللاحقة.

4. النسبة الجينية

  1. إعداد البيانات
    1. إعداد مجموعة بيانات الحساب: قم بإنشاء مجموعات بيانات تقييم متعددة لمقارنة أدوات التصنيف الجيني بشكل منهجي عبر أعماق وأحجام عينات مختلفة كما هو موضح أدناه. يتم تكوين تسع تركيبات بناء على أحجام العينات المختلفة وأعماق التسلسل المذكورة أعلاه. تتكون ملفات الإدخال من قوائم ملفات BAM لبيانات التسلسل (bamlist.txt) للمجموعات التسع المذكورة أعلاه بعد مراقبة الجودة، ويتم تخزينها في ملفات bamlist.txt المقابلة. تشمل ملفات المدخلات الأخرى الجينوم المرجعي البشري (GRCh3821) والخريطة الجينية من مشروع 1000 جينوم7.
      1. تم تقليل عينات بيانات WGS عالية العمق: اختر عشوائيا مجموعتين فرعيتين (200 و500 عينة) من 500 فرد تم تتابعهم على عمق 30x. قم بتقليل كل مجموعة إلى أربعة أعماق (1x، 0.5x، 0.1x، و0.05x) لتوليد ثمانية ظروف تجريبية.
      2. مجموعة بيانات ULDS المبنية على NIPT: اجمع بين 10,000 عينة NIPT منخفضة العمق جدا (العمق المتوسط 0.102x، الشكل 2) مع 50 عينة عالية العمق تم تخفيض العينة إلى 0.1x.
    2. مواصفات منطقة التحليل: تقييد جميع التحليلات على منطقة الكروموسوم 1 chr1:150,500,000-160,500,000 (10 ميغابايت)، مع مخزن مؤقت 500 كيلوبايت للحساب، لضمان قابلية المقارنة المباشرة عبر الأدوات.
    3. اختيار لوحة المرجع: استخدم لوحتين مرجعيتين (الجدول 1): لوحة CKB، المبنية من بيانات السكان الصينيين، ولوحة 1KGP-EAS، المشتقة من فرع شرق آسيا من مشروع 1000 جينوم.
      ملاحظة: تم بناء لوحة مرجعية CKBرقم 15 باستخدام بيانات تسلسل جينوم كامل عالية العمق (~15x) من 9,964 بالغا صينيا في بنك الصين كادوري الحيوي، وهي دراسة جماعية كبيرة مستقبلية. هذه العينات مشتقة من مجموعة طبيعية ذات تحيز ظاهري طفيف بسيط، وأصول هانية متجانسة، وبنية سكانية متسقة، مما يجعلها مناسبة بشكل خاص لتحديد النمط الجيني في المجموعات الصينية. أظهر يو وآخرون 15 أنه في حالة GWAS للطول بنمط ظاهري حقيقي، ضاعف التصنيف باستخدام لوحة CKB عدد SNPs المكتشفة ثلاث مرات وضاعف عدد المتغيرات ذات الدلالة على مستوى الجينوم. مشروع 1000 جينوم (1KGP)7,26، وهو المرجع الجينومي الأكثر استخداما، يشمل 585 فردا في مجموعة المرحلة الثالثة من شرق آسيا (EAS). تغطي هذه المجموعة الفرعية خمسة مجموعات من شرق آسيا، يبلغ عمق التسلسل حوالي 30 ضعفا، بما في ذلك الهان الصيني في بكين (CHB)، والهان الجنوبي (CHS)، والداي الصيني في شيشوانغبانا (CDX)، والكينه في مدينة هو تشي منه، فيتنام (KHV)، واليابانيين في طوكيو (JPT).
  2. أدوات الحساب
    1. تقييم ثلاث خوارزميات للحساب، تم اختيارها بناء على استراتيجيات النمذجة المميزة وقابليتها للتطبيق على بيانات التسلسل فائق العمق (ULDS).
      1. STITCH: STITCH (v1.6.6) هي خوارزمية تعسيب تعتمد على النمط الجيني الخالي من المرجع ويمكن اختياريا دمج أنماط مرجعية خارجية. تضمين قوائم BAM وجينوم مرجعي بشري (GRCh38) كملفات إدخال. جهز ملفات لوحات المراجع (hap/legend/pos) عند تنفيذ التعيين المعتمد على المرجع. تضمين المعايير الرئيسية التالية: الطريقة=الصبغة، المخازن=500 كيلوبايت، K=10 أنماط هابلوتايب الأسلاف، وnGen=4x حجم العينة/K (كما هو موصى به في وثائق STITCH). توليد ملفات مخرجات تحتوي على جرعات لكل نمط جيني لكل SNP لجميع الأفراد.
        ملاحظة: وفقا للتوثيق الرسمي ل STITCH، K هو عدد الأنماط الجينية الأسلاف في النموذج. يحسن K أكبر دقة النسبة للعينات الأكبر والتغطيات الأعلى، لكنه أيضا يزيد من وقت الحساب، وقد تنخفض الدقة مع انخفاض التغطية.
      2. QUILT2: يطبق QUILT2 نهجا بايزيا موجها بالمرجع محسن لبيانات ULDS. قم بتحضير لوحة المراجع باستخدام سكريبت prepare_reference المرفق، مع تحديد الخريطة الجينية وإحداثيات المنطقة. شغل وضع الطباعة الثنائية الصبغية بنفس حجم المخزن (500 كيلوبايت) وإعداد nGen مثل STITCH لضمان قابلية المقارنة.
      3. GLIMPSE2: GLIMPSE2 هي أداة تصنيف معتمدة على HMM تعتمد على المرجع، مصممة لمجموعات بيانات التسلسل واسعة النطاق ومنخفضة العمق جدا. نفذ الحساب باستخدام GLIMPSE2_phase_static، وتحديد قائمة BAM المدخلة، لوحة VCF المرجعية البشرية، الخريطة الجينية، منطقة الإدخال = chr1:150,000,000-161,000,000، منطقة الإخراج = chr1:150,500,000-160,500,000 (للحفاظ على مخزن مؤقت 500 كيلوبايت). يجب أن يحتوي ملف قائمة BAM المدخل هنا على عمودين: أحدهما هو مسار BAM، والعمود الثاني هو اسم العينة. إذا لم يتم إدخال العمود الثاني، سيتم استخدام كل اسم ملف BAM كاسم عينة في ملف VCF المخرج.

5. تقييم دقة النسبة

  1. تعريف مجموعة الحقيقة
    1. تم ترتيب 50 فردا على عمق 30x كمجموعة بيانات الحقيقة الأرضية. إدراج هذه العينات في ظروف تقليل العينات التجريبية لضمان قابلية المقارنة.
    2. نفذ استدعاء ببوري لمجموعة الحقيقة باستخدام خط الأنابيب التالي: SOAPnuke27 للمراقبة الجودة، BWA للمحاذاة، Picard لتمييز التكرار، GATK v4.0.4.0 BQSR وHaplotypeCaller للاستدعاء المتغير، DPGT (https://github.com/BGI-flexlab/DPGT) للاستدعاء المشترك، وBCFtools v1.1123 لتصفية جودة المتغيرات.
    3. احتفظ فقط بنسخ PASS عالية الثقة لتوليد ملف VCF معياري. حدد التقييم عند chr1:150,500,000-160,500,000، بما يتوافق مع مجموعات البيانات المذكورة.
  2. توحيد وتصفية البيانات
    1. معالجة ملفات VCF المحسوبة من جميع الأدوات باستخدام PLINK2.028. استخرج بيانات الجرعة وحول إلى صيغة pgen.
    2. تطبيق مراقبة جودة على مستوى SNP باستخدام المرشحات التالية: تردد الأليل الصغير (MAF) ≥ 0.05 (--maf 0.05)، توازن هاردي-وينبرغ (HWE) بقيمة p ≥ 1e-6 (--hwe 1e-6)، SNPs ثنائي الأليل فقط (--max-alleles 2).
    3. تصدير النسخ التي تنقل QC إلى صيغة traw للمقارنة في مرحلة لاحقة.
  3. مقاييس الدقة
    1. قارن الجرعات المذكورة مع الجرعات الواقعية لكل SNP. احسب معاملات الارتباط بيرسون (R) على أساس SNP لكل SNP، والاحتفاظ فقط بالمواقع المشتركة بين كلا المجموعتين، وحساب متوسط معاملات الارتباط التربيعية (R²) عبر جميع SNPs المقيمين لقياس دقة الحساب الكلية لكل حالة.
    2. استخدم هذا المقياس للدقة لالتقاط توافق تقديرات جرعات النمط الجيني بين الأنماط الجينية المنسوبة والحقيقية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تأثير حجم العينة على دقة الحساب
زيادة حجم العينة من N = 200 إلى N = 500 حسنت دقة النسبة في STITCH، خاصة في ظروف التغطية المنخفضة. على سبيل المثال، مع تغطية لوحة مرجعية CKB ب 1x، حقق STITCH نسبةR 2> 0.916 (N=500) مقارنة ب 0.882 (N=200)، مما يمثل زيادة بنسبة 3.4٪ (الشكل 3؛ الملف الإضافي 2). وبالمثل، عند تغطية 0.5x، ارتفعت دقتها من 0.800 إلى 0.868 (ΔR2> = 8.5٪). على النقيض من ذلك، أظهرت...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

قامت هذه الدراسة بتقييم منهجي لأداء ثلاث أدوات لتحديد النمط الجيني المستخدم على نطاق واسع ل ULDS، حيث كانت WGS عالية العمق هي المعيار الذهبي. تكمن قوة منهجية رئيسية في اعتماد خط معالجة مسبق موحد - يشمل المحاذاة، ومراقبة الجودة، وإعادة معايرة الدرجات الأساسية - يقلل من تأثيرات الدفعات ويضمن قابلية المقارنة عبر الأدوات والظروف. من خلال تقليل أخذ عينات متسلسل بعمق، تم محاكاة بيانات العمق المنخفض جدا تحت إعدادات محكمة، مما وفر إطارا موضوعيا للمقارنة المرجعية. تضمن تقييد التحليلات بفترة جينوم...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون عدم وجود مصالح متنافسة.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

وقد دعمت هذه الدراسة صندوق شنتشن للأبحاث الطبية (B2404004)، والبرنامج الوطني الرئيسي للبحث والتطوير في الصين (2023YFC2605400، 2022YFC2502402)، وبرنامج شنزن للعلوم والتكنولوجيا (SYSPG20241211173852024)، ومشروع البحث المفتوح في مختبر الدولة الرئيسي لتوازن الأوعية الدموية وإعادة تشكيلها (جامعة بكين) (2025-SKLVHR-013)، وبرنامج البحث والتطوير في المناطق الرئيسية في مقاطعة قوانغدونغ (2023B0303040001).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
<قوي>داتا
10,000 عينة NIPT منخفضة العمقهذه الورقةبيانات تسلسل الجينوم الكامل ذات عمق منخفض جدا تستخدم لاختبار الحساب.
500 عينة من WGS عالي العمقهذه الورقة30&00; WGS عالي العمق استخدم كمعيار ذهبي/مجموعة الحقيقة.
<قوي>لوحة مرجعية
لوحة مرجعية 1KGP-EASمشروع 1000 جينوم (شرق آسيا)مجموعة فرعية من 1KGP للنسب الخاص بأصول شرق آسيا.
لوحة مرجعية CKBبنك الصين كادوري الحيويلوحة مخصصة مخصصة للسكان لتحديد النمط الجيني.
<قوي>برمجيات وخوارزميات
BCFtools v1.11GitHub (samtools/bcftools)يستخدم لدمج وفرز نتائج مستوى الكروموسومات، وتصفية المتغيرات.
BQSR لمجموعة أدوات GATK 4.0.4.0معهد بروديستخدم لإعادة معايرة نقاط الجودة الأساسية (BQSR).
BWA-MEM .7.16A-R1181هينغ لي / GitHubلمحاذاة القراءات الخام مع GRCh38.
DPGT (أداة علم الوراثة الموزعة للسكان)BGIأداة تحليل وراثة السكان الموزعة مكنت الاستدعاء المشترك لملايين عينات WGS. متوفر على [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)
fastp.0.23.4مفتوح المصدر (تشين وآخرون، 2018)لمراقبة الجودة وتقليم المحولات.
GLIMPSE2جامعة أكسفوردالمراحل الجينية السريعة والنسبة للأنظمة الجينومية منخفضة التغطية
الشيفرة الأصلية للتحليلاتهذه الورقة<الملف القوي>الإضافي 1 الكود الأصلي للتحليلات
مجموعة أدوات بيكارمعهد بروديستخدم لتعليم النسخ المكررة وتحويل صيغة الملفات.
Plink 2.0سي. تشانغ، س. بورسيل / معهد برودلتحويل تنسيق النمط الجيني وتحليل الارتباط.
بايثون 3.8مؤسسة بايثون للبرمجياتيستخدم للبرمجة النصية، والأتمتة، وتحليل البيانات.
QUILT2معهد أكسفورد للبيانات الضخمةالتعيين القائم على HMM باستخدام لوحات مرجعية خارجية
R 4.1.3مؤسسة Rيستخدم لتشغيل STITCH وQUILT2 ورسم الرسم والإحصائيات.
SAMtools v1.3GitHub (samtools/samtools)للتلاعب بملفات SAM/BAM.
Seqtk-1.5GitHub (lh3/seqtk)مجموعة أدوات لمعالجة التسلسلات بصيغ FASTA/Q. متوفر على [GitHub - lh3/seqtk](https://github.com/lh3/seqtk)
سوبونكBGIلمراقبة جودة البيانات وتصفية البيانات في NGS.
STITCH v1.6.6جامعة أكسفوردأداة التعيين المحسنة لتسلسل التغطية المنخفضة جدا
تابكسGitHub (samtools/tabix)يستخدم لفهرسة واستعلام ملفات VCF المضغوطة في bg.
<قوي>مواد أخرى
ملفات حزم GATKGATKمتوفر على [https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json]
خريطة جينية ل 1000G (GRCh38)مشروع أكسفورد / 1000 جينوممطلوب لأدوات التصنيف/التصنيف
GRCh38اتحاد مراجع الجينوميستخدم في محاذاة القراءة واستدعاء التغيرات

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

مقالات ذات صلة