مقالة منهجية

اكتشاف التلوث وعدم التوافق بين الأفراد في بيانات تسلسل الجيل القادم من Multiomics

DOI:

10.3791/69428

أبريل 17, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصف هذا البروتوكول تنفيذ إطار عمل لمراقبة الجودة لاكتشاف التلوث والتفاوت بين الأفراد في بيانات التسلسل من الجيل التالي من خلال التحقق من الهوية الجينية لأزواج العينات داخل الأفراد.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تتطلب معالجة عينات المرضى الحيوية عالية السرعة من خلال التسلسل من الجيل التالي ومقارنة البيانات الجزيئية مع بيانات سريرية على مستوى المريض والعينة تتبعا دقيقا ومطابقة معرفات العينات عبر سلسلة حيازة العينة الحيوية، وهي ضرورية لتمكين تفسير قوي لنتائج تجارب المؤشرات الحيوية. بالإضافة إلى تتبع الخطوات الفردية في سير عمل العينات ومعالجة البيانات، يمكن استخدام حلول المعلوماتية الحيوية للتأكد من أن العينات تأتي من نفس المريض. هنا، يتم عرض استخدام سير عمل المعلوماتية الحيوية لتحديد العينات المتطابقة القادمة من نفس الفرد. سير عمل التحليل مناسب لأي زوجين أو أكثر من مجموعات بيانات NGS التي يتم مقارنتها والتحقق منها لأصل عينة المرضى. تمكن خوارزمية التقييم المبنية على المقارنات الجينومية للعينات المستخدم من تحديد ما إذا كانت عينتان تنتميان إلى نفس الفرد. على وجه التحديد، تستخدم تعدد أشكال النيوكليوتيدات الأحادية (SNPs) ضمن كتل عدم توازن الربط المختارة لتحديد ومقارنة العينات. تم تحديد تركيبات عتبة للاختيار المسرح والصارم للعينات المتطابقة وغير المتطابقة. وقد أظهرت فائدة هذا البروتوكول من خلال تطبيقه في مراقبة الجودة والتحقق من صحة عينات الأنسجة والدم السريرية، والتي شملت عدة طرق أوميكس من أكثر من 2000 مريض.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يتطلب جمع وتحليل العينات السريرية على نطاق واسع تتبع العينات بدقة على طول سلسلة حيازتها، حيث أن المطابقة الصحيحة للبيانات الجزيئية من نفس الأساليب أو من نفس الأساليب أو من بيانات المرضى والعينات السريرية أمر ضروري للتفسير الدقيق واتخاذ قرارات مستنيرة. على الرغم من الجهود الصارمة لتبسيط بروتوكولات معالجة العينات ضمن الممارسات السريرية الجيدة، يمكن أن يحدث تبديل العينات أو وضع الوسم بشكل خاطئ في مراحل مختلفة، من الخزعة/استخراج العينة إلى مراحل التحضير والمعالجة، وحتى مرحلة تحليل البيانات (الشكل 1). مع زيادة أعداد العينات وخطوات معالجة العينات، تزداد احتمالية تبديل العينات والتلوث المتبادل. وقد يؤدي ذلك إلى تحليل بيانات ذات علاقات غير صحيحة بين العينة والمريض، مما يؤثر على التحليل والاستنتاجات في المراحل اللاحقة، وبالتالي يعد جانبا مهما يجب أخذه في الاعتبار في أبحاث الجينوم السريري. في الدراسات السريرية، يمكن أن يؤثر التحديد الخاطئ للعينات بشكل كبير على النتائج العامة، خاصة للدراسات ذات حجم العينةالصغير 1. يمكن أن يؤدي التلوث بين الأفراد إلى فقدان القدرة على تحديد الفروقات والنتائج الإيجابية الكاذبة عند مقارنة عدة عينات من نفس المريض. تؤثر تبادلات العينات على قوة الكشف عن الارتباطات الجينية وقد تؤدي إلى التقليل من تقدير وراثة الصفات المعقدة في تحليل الارتباط الجينوميالشامل 2.

تعد أبحاث السرطان من المجالاتالتي تجرى فيها تحليلات جينومية وعملية نقل ونسخ واسعة النطاق، وبشكل خاص تراقب التباين الجينومي والظاهري بين المرضى وداخل المرضى. أحد جوانب أبحاث السرطان هو أن عينات من نفس المريض قد تحمل طفرات مختلفة وتغيرات في عدد النسخ وبالتالي تظهر ترددات أليلات مستقلة4. وخاصة عند تفسير البيانات من أنواع الأوميكس المتعددة، فإن التكامل الصحيح لمجموعات البيانات متعددة الوسائط من نفس الأفراد أمر مهم، وبالتالي يتطلب مراقبة التلوث بين الأفراد 5,6,7,8. أظهرت الدراسات على مجموعات بيانات برنامج أطلس جينوم السرطان (TCGA) واتحاد أبحاث الجينوم الرئوي الرئوي (LGRC) معدلات خطأ في التعرف على العينة تبلغ 3٪ في المتوسط وتصل إلى ~20٪ في بعض الدراسات 2,9,10,11. تظهر هذه الأمثلة أهمية مراقبة حدوث تبادلات العينات والتلوث المتبادل12. بعيدا عن المراقبة الروتينية ومراقبة الجودة في كل خطوة من خطوات العملية، يعمل التحليل المقارن لنتائج التسلسل كاختبار جودة نهائي. هذا يضمن مطابقة العينات بدقة قبل الانتقال إلى تحليل البيانات وتفسيرها.

تم إنشاء عدد من الأساليب المعلوماتية الحيوية لتحديد ما إذا كانت العينات تنتمي إلى نفس الفرد 1,4,13,14,15,16. استفادت الأساليب الأولية من تكرارات قصيرة متتالية للتحقق من هويةالعينة 17. تسمح بيانات التسلسل من الجيل التالي على مستوى الحمض النووي الريبي والحمض النووي الآن بالمقارنة بين أزواج العينات بناء على تعدد أشكال النيوكليوتيد الواحد18. تختلف في قابليتها للتطبيق على أنماط ومجموعات بيانات التسلسل المختلفة، مثل تسلسل الحمض النووي الريبي19 أو لتسلسل الإكسوم الكامل5، وتنفيذها، مثل التحقق عبر المسارات20، وسهولة الاستخدام. على الرغم من إمكانية تحديد عينات من نفس الفرد بناء على 20–45 تعدد أشكال أحادي النيوكليوتيد، إلا أن طرق التسلسل ذات التغطية المنخفضة إلى المتوسطة تستخدم عادة في أبحاث السرطان تتطلب دمج عدد كبير منSNPs 1.

هنا، يتم وصف تنفيذ وتعديلات أحد هذه الأساليب باستخدام كتل عدم التوازن في SNPs15، والتي تستخدم لمراقبة جودة العينات المتطابقة. لقد ثبت أن هذا النهج لديه معدل علم خاطئ منخفض ومعدل تطابق خاطئ، ويسمح سير العمل بالمقارنة بين الأنماط المختلفة، مثل التسلسل الكامل للإكسوم وعينات تسلسل الحمض النووي الريبي، وكذلك للاستخدام مع صيغ بيانات مختلفة. من أجل تطبيق الطريقة على نطاق واسع عبر مجموعات البيانات في عينات التجارب السريرية، تم تنفيذ خط أنابيب المعلوماتية الحيوية بلغة سير العمل المشتركة (CWL)21,22. بفضل سهولة قراءته وصياغة جملته الشبيهة ب YAML، يمكن للعلماء ذوي الخبرة المحدودة في البرمجة تفسير البنية العامة لسير العمل ونتائج التحليل بسهولة. ميزة رئيسية أخرى ل CWL هي وظيفة التشتت/الجمع، التي تمكن من توازي العمليات من الاستفادة الكاملة من الموارد الحسابية المخصصة. يمكن للمستخدمين تحديد الشروط التي يتم فيها تنفيذ بعض الخطوات، مما يعزز مرونة التحليلات الناتجة. يمكن دمج CWL مع مكونات أخرى لنظام إدارة سير العمل الكامل، مثل تخزين قواعد البيانات، وواجهة المستخدم الرسومية، وموزع المهام، مما يشكل منصة قوية لإنشاء وتشغيل وصيانة مجموعة قابلة للتكرار من التحليلات العلمية. وبالتالي، يسمح هذا التطبيق بتسهيل الوصول إلى سير العمل والمعالجة عالية الإنتاجية لمجموعات البيانات في سياق أنظمة إدارة سير العمل المحددة.

علاوة على ذلك، تم التحقيق في تأثيرات تحديد معايير اختيار الضبط بين العينات المتطابقة وغير المتطابقة، وتم تحديد عتبات للاختيار الصارم والملائم للحالات غير المتطابقة. تم عرض تأثيرات تعديل هذه المعايير على اختيار أزواج العينة وقابليتها للتطبيق داخل وعبر أنماط الأوميكس المختلفة. الضبط الدقيق لهذه المعايير سيسمح للمستخدمين بضبط صرامة تفسيراتهم. تم تطبيق سير العمل على مجموعة من مجموعات البيانات السريرية واسعة النطاق مع عدة آلاف من العينات.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

بيان أخلاقي: تم إجراء هذا التحليل للتلوث بين الأفراد بأثر رجعي باستخدام بيانات على مستوى المريض من دراسات سريرية مكتملة في المرحلة الأولى والثانية، وفقا لعملية إعادة استخدام البيانات المسؤولة في روش ووفقا لنموذج الموافقة المستنيرة الرئيسي لكل دراسة. تم الحصول على موافقات لجنة الأخلاقيات/مجلس المراجعة المؤسسية لكل دراسة قبل إجرائها. قدم المشاركون ووقعوا موافقة مستنيرة للمشاركة في هذه الدراسات.

سير عمل المعلوماتية الحيوية
ملاحظة: يبدأ تنفيذ سير عمل المعلوماتية الحيوية من ملفات fastq خام مشتقة من بيانات تسلسل الجيل القادم، مثل تسلسل الجينوم الكامل، أو التسلسل الكامل الإكسوم، أو الترجمة الكاملة. الخطوات الفردية الموضحة هنا مدمجة في سير عمل CWL.

1. المواد المرجعية المطلوبة

  1. بالنسبة لسير عمل المعلوماتية الحيوية، قدم ما يلي:
    1. الجينوم المرجعي البشري (GRCh38) في . صيغة fasta .
    2. ملف الفهرسة المقابل هو .fasta.fai.
    3. قاموس مقابل بصيغة .dict .
    4. خريطة هابلوتايب تطابق المناطق الجينومية المهمة ل SNPs وكتل عدم التوازن في الربط (مثل Picard build_fingerprint_maps، SCR_006525).
  2. تأكد من أن رأس خريطة النمط الجيني يتطابق مع الجينوم المرجعي.

2. المحاذاة مع الجينوم المرجعي، الفرز، والفهرسة

  1. شغل سير عمل CWL لتوفير المخرجات للخطوات التالية الموضحة أدناه (قائمة الأدوات في جدول المواد) (الشكل 2).
  2. ابدأ سير عمل CWL من خلال توفير دليل لملفات fastq المزدوجة أو ملفات bam المحاذية.
  3. توفير النمط، مثل R1/R2، كنمط تعبير منتظم مدخل في أمر CWL.
  4. بالإضافة إلى ذلك، توفير موقع سير العمل، ومرجع الجينوم، وملفات رسم الأنماط الهابلوتايب.
    ملاحظة: للمقارنة الشاملة، يستخدم دليل الإدخالات الكامل. إذا كان من المقرر مقارنة مجموعة فرعية من الملفات، قدم ملفا مفصولا بفواصل يحتوي على أسماء الملفات للمقارنة. الخيار المتقدم يسمح باختيار ذاكرة الوصول العشوائي وعدد وحدات المعالجة المركزية لتشغيل العملية.
  5. قم بربط ملفات fastq بالجينوم المرجعي البشري باستخدام خوارزمية رسم الخرائط.
    ملاحظة: اعتمادا على طريقة التسلسل، يستخدم BWA-MEM لنتائج تسلسل الحمض النووي23، ويستخدم جهاز تعيين STAR الواعي بالوصلة لنتائج تسلسل الحمض النوويالريبي 24. كود نموذجي لمحاذاة STAR مقدم أدناه:
    ستار \
    --readFilesCommand zcat \
    --runThreadN 8 \
    --outSAMmapqUnique 60 \
    --outSAMattributes All \
    --outReadsUnmapd Fastx \
    --outTmpDir /tmp/STARtmp/ \
    --runDirPerm All_RWX \
    --outSAMtype BAM غير مرتب \
    --outFileNamePrefix /FILENAME_ \
    --outSAMattrRGline ID:FILEID. L001 SM:SAMPLE \
    --جينوم Dir /مرجع/جينوم/مدير \
    --readFilesIn /path/to/FILENAME. R1.fastq.gz /path/to/FILENAME. R2.fastq.gz
  6. قم بترتيب ملفات مصفوفة المحاذاة الثنائية (BAM) الناتجة حسب إحداثيات القراءة باستخدام فرز SAMtools (samtools sort -o FILENAME_OUT.bam FILENAME_IN.bam).
  7. قم بفهرسة ملفات BAM المرتبة باستخدام مؤشر SAMtools (samtools index FILENAME_OUT.bam).
  8. قم بوضع علامة وإزالة النسخ باستخدام مضاعفات بيكار.
  9. أعد فهرسة ملفات BAM وضم مجموعات القراءة (RG) باستخدام SAMtools.
    ملاحظة: يجب أن تحتوي ملفات BAM على علامات RG لكي يعمل سير العمل.

3. استخراج البصمات

  1. استخدم ملفات BAM المرتبة والمفهرسة لتحديد بصمات SNP باستخدام Picard ExtractPrints.
  2. استخدم التخزين الوسيط لملفات تنسيق الاستدعاء المتغير (VCF) الناتج فقط لغرض المقارنة بين العينات.

4. حساب درجات التشابه

  1. استخدم Picard CrossCheckFingerprints لحساب درجات نسبة احتمالات اللوغاريتمية (LOD) للتشابه بناء على كتل عدم توازن الربط، والتي تقدم بصيغة ملف crosscheck_metrics crosscheck_metrics.txt.
    ملاحظة: يسمح تنفيذ سير العمل بمقارنة متبادلة لجميع التركيبات الممكنة من أزواج العينات أو مقارنة مختارة عبر عينات من قائمة محددة مسبقا.
  2. احذف ملفات VCF الوسيطة.
  3. يوفر ملف crosscheck_metrics أربع مقارنات لكل زوج من العينات التي تم اختبارها. تفسير درجات LOD هو كما يلي:
    درجة LOD > 0: من المحتمل أن تكون العينات من نفس الفرد (تطابق العينة)
    درجة LOD ≤ 0: من المحتمل أن العينات تأتي من أفراد مختلفين
  4. تحقق من قيمة القطع لمطابقات العينة من خلال تصور توزيع نقاط LOD كمخطط مدرج نهجي، على سبيل المثال، في R أو بايثون (الشكل 3).
  5. يقترح فريق تعاوني يضم خبرة في المعلوماتية الحيوية لتحديد ما إذا كانت الأدلة كافية لتحديد هويات العينات بشكل لا لبس فيه، وإمكانية تعديل العتبات المستخدمة، على سبيل المثال، من خلال تضمين درجات LOD الثلاث أو مقارنة مع توزيع درجات LOD للعينات المعروفة بأنها تنبع من أفراد مختلفين.
    ملاحظة: قد تؤدي الخلط في العينات إلى عدة تطابقات غير متوقعة (درجة LOD < 0 لعينات من نفس المتبرع) وعدم تطابقات (درجة LOD > 0 لعينات من متبرعين مختلفين). تتطلب التفسيرات المعقدة تبادلا وثيقا بين الفريق متعدد التخصصات وخبير المعلوماتية الحيوية.

5. توفر الكود

سيتم توفير سير العمل الحسابي على Github: https://github.com/Roche/sample-matching-workflow.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تنفيذ سير عمل CWL
تم تنفيذ سير عمل لتحديد تطابقات العينات، استنادا إلى نهج سبق أن يستخدم كتل عدم توازن الارتباط من تعدد أشكال النيوكليوتيد الأحادي لتحديد تبادلات العينات،15. أظهر المؤلفون معدلات تصنيف 0٪ FMR و0.01٪ FFR لهذه الطريقة. أظهرت المقارنة مع طرق أخرى أداء مشابها ل NGSCheckmate عند تغطية عالية ومتوسطة وأداء محسنا مقارنة ب NGSCheckmate عند التغطية المنخفضة ولتقليل التداخل الجيني الإقليمي. تم الحصول على نتائج غير حاسمة عند المقارنة مع Conpair و BAMixChecker 13,15,25. هنا، تم تنفيذ سير العمل في CWL، وتم دراسة عتبات LOD وتحسينها، وتم تطبيقه لمقارنة أزواج تسلسل الحمض النووي الريبي وأزواج تسلسل الحمض النووي أو عبر الأنماط داخل العينات المستخرجة من الأنسجة وبين عينات من الأنسجة والدم المحيطي (الشكل 3، الجدول 1). سمح تنفيذ سير العمل بمقارنة متبادلة لجميع التركيبات الممكنة من أزواج العينات أو مقارنة مختارة عبر عينات من قائمة محددة مسبقا.

يستخدم إدخال سير العمل مجموعة محددة من الأنماط الجينية (haplotype). تستخدم هذه لحساب تعدد أشكال النيوكليوتيدات الأحادي في كتل عدم التوازن الارتباطي. حساب درجات نسبة اللوغاريتم-احتمالات (LOD) لهذه الكتل من SNPs عبر أزواج العينات يسمح بالتمييز بين العينات المتطابقة وغير المتطابقة. سابقا، أظهرت درجات LOD في نطاق LOD < -5 وLOD > 5 تصنيف أزواج متطابقة من العينات15 بشكل صحيح. يتم حساب درجات LOD إضافية (LOD_SCORE_TUMOR_NORMAL، LOD_SCORE_NORMAL_TUMOR) مع الأخذ في الاعتبار فقدان محتمل للتنوع المتغاير في عينة الورم لأي من العينتين (المناطق غير المتغاير في عينة واحدة تم اكتشافها كمتماثلة الزيجوت في العينة الأخرى).

تأثير معلمات الإدخال والعتبات على معدلات المطابقة/عدم المطابقة
أبرز تقييم هذا السير ثلاثة جوانب حاسمة تؤثر على أدائه ودقته. أولا، ثبت أن اختيار المناطق الجينومية التي تغطيها خريطة النمط الجيني كان خطوة محورية. اختيار هذه المناطق يؤثر مباشرة على القوة التمييزية لعملية المطابقة. ثانيا، أثر الجمع بين استراتيجيات محاذاة القراءة وخرائط النمط الجيني المحددة المستخدمة في استخراج البصمات بشكل كبير على نتائج التحليل النهائي. يمكن أن تؤدي التغيرات في هذه الخطوات في المعالجة إلى إدخال تحيزات دقيقة تنتقل إلى نتائج المطابقة (الشكل 4A–B). ثالثا، كان التقييم الدقيق واختيار العتبات لتحديد تطابق العينة أمرا ضروريا. يمكن أن تختلف قيم العتبة المثلى بشكل كبير حسب طريقة البيانات المحددة (مثل تسلسل الإكسوم الكامل مقابل تسلسل النسخ الكامل بالنسخ) والمناطق الجينومية التي يتم تقييمها. يمكن للعتبات المختلفة تعديل صرامة النهج (معدل إيجابي كاذب مرتفع مقابل معدل سلبي كاذب مرتفع) (الشكل 4C). لمعالجة هذا لمجموعة كبيرة من العينات السريرية، تم تكييف الطريقة لتحديد تركيبات درجات مطابقة العينات الصارمة والمسمحة بناء على مزيج درجات LOD المستخدمة والمقارن. تم تحقيق نهج العتبة الأولى (I) من خلال النظر في أي قيمة إيجابية عبر درجات LOD الثلاثة (LOD_SCORE، LOD_SCORE_TUMOR_NORMAL، LOD_SCORE_NORMAL_TUMOR). من خلال تضمين معلومات عن درجات TUMOR_NORMAL و NORMAL_TUMOR، يمكن التخفيف من آثار فقدان التغاير الزيجوسي، الناتج عن تغييرات أرقام النسخ في عينات السرطان. وعلى العكس، تم تنفيذ عتبة أكثر صرامة لعدم التوافق (II) من خلال تطبيق معيارين بديلين للترشيح، مصممين لتقليل الإيجابيات الكاذبة: (أ) التصنيف كمطابقة فقط، إذا كان LOD_SCORE إيجابيا، ب) التصنيف كمطابقة، إذا كان LOD_SCORE في عينة معينة أكبر من الحد الأقصى للدرجة المزدوجة الأخرى لتلك العينة LOD_SCOREs بين العينات التي لا يتوقع منها مطابقتها (استنادا إلى المريض الأصلي الموثق)، حتى لو كان LOD_SCORE نفسه سلبيا.

في هذا التطبيق، لتوليد عتبة تساهل، يعتبر أي زوج عينة تم تصنيفه كمطابقة وفقا لأي من المعايير السابقة (I, IIa, IIb) تطابقا. وقد وفر هذا ثقة عالية في جميع الاختلافات المحددة، على حساب تصنيف بعض العدم التوافقي الحقيقي المحتمل كمطابقات (أي السلبيات الكاذبة). أظهرت مقارنة العتبة المسموح بها مع العتبات الأكثر صرامة تحولا في نسبة الأزواج التي تم تصنيفها كعدم تطابقات. تراوح الفرق بين النهجين، عبر جميع الدراسات المحللة، بين 3.9٪ (أي من درجات LOD الثلاثة إيجابية (I))، 13.3٪ (يجب أن تكون LOD_SCORE إيجابية (IIa))، 9.2٪ (LOD_SCORE مقارنة بأزواج غير متطابقة في العينة (IIb))، و3.6٪ (مع الأخذ في الاعتبار إذا كان أي من ما سبق لتحديد تطابق) (الشكل 4C).

تأثير تغطية المناطق الجينومية
يكون الفرق بين درجات LOD سالبة وإيجابية للعينات المتطابقة وغير المتطابقة أعلى عند تغطية نطاق واسع من المناطق الجينومية (تسلسل الجينوم الكامل (WGS) أو مقارنة عينات WGS مع أنماط أخرى)، مما يسهل اختيار العتبة (الشكل 5A). بالنسبة لمقارنات تسلسل الإكسوم الكامل وتسلسل الحمض النووي الريبي، تقترب درجات LOD من الصفر مع تأثير أساليب العتبة على النتائج، مما يبرز أهمية تقييم صرامة العتبات للطرق ذات التغطية الجينومية الأقل. يتم عرض توزيع النتائج من عينات مزدوجة معروفة ذات درجات LOD إيجابية في الشكل 5B. أظهر جافيد وآخرون (2020) أن تداخل الجينوم بنسبة 0.02٪ يكفي للتمييز بين العينات المتطابقة وغير المتطابقة عند استخدام كتل عدم توازن الربط15.

التحقق من الصحة
تم التحقق من صحة هذا النهج على مجموعات بيانات إضافية لتسلسل الأكسوم الكامل (WES) وتسلسل RNA لسرطان الثدي، وسرطان القولون والمستقيم، والتي كان من المتوقع أن تكون مجموعة معروفة من العينات من نفس الأفراد (الشكل 6A). أظهرت أزواج العينات من نفس الفرد معدل تطابق 100٪ (الشكل 6B)، في حين أظهرت المقارنات الإضافية مع عينات أخرى معروفة أنها من أفراد مختلفين معدل عدم تطابق 100٪. لم تلاحظ أي إيجابيات كاذبة أو سلبية كاذبة في أي من هذه المجموعات.

باختصار، يسهل تنفيذ سير عمل مراقبة الجودة المقارنات بين الأفراد لأزواج عينات التسلسل من الجيل التالي من خلال توفير نهج موحد وقابل للتكرار. تعطي عتبات درجات LOD الناتجة معدلات منخفضة للإيجابيات الكاذبة والسلبية الكاذبة للعينات التي تحتوي على تداخل جينومي إقليمي كبير، وقد يتم تطبيق تحسين عتبة إضافي للعينات ذات عمق التسلسل المنخفض أو التي يوجد فيها تداخل جينومي قليل.

figure-results-1
الشكل 1: تمثيل تخطيطي لحدوث تبادلات العينات ووضع الوسم بشكل خاطئ. (أ) تبادل عينة لكل من عينة واحدة بين فردين. (ب) تمثيل خطوات معالجة العينة من استخراج الخزعة إلى تحليل بيانات التسلسل. تم إنشاؤه في BioRender. فويت فون فويتنبرغ، ل. (2026) https://BioRender.com/xhbp178. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-2
الشكل 2: تمثيل واجهة المستخدم لملفات الإدخال والمعلمات المطلوبة لتشغيل سير عمل مراقبة الجودة المطابقة للعينة في CWL. واجهة مستخدم رسومية لإدخال الملفات والمعلمات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-3
الشكل 3: النتائج التي تم الحصول عليها من سير عمل مطابقة العينة. توزيع درجات LOD لمجموعة نموذجية من عينات تسلسل الحمض النووي (تسلسل الجينوم الكامل وتسلسل الإكسوم الكامل) (يسار)، وللمقارنة بين تسلسل الحمض النووي وتسلسل الحمض النووي الريبي (في الوسط) لإظهار مدى قلة العينات غير المتطابقة مقارنة بتوزيع العينات المتطابقة، ولمجموعة أكبر نموذجية من أزواج تسلسل الحمض النووي الريبي (يمين) مع بيانات معروفة بأنها من أفراد مختلفين (عدم تطابقات، أحمر فاتح) ومن نفس الفرد (تطابق الطابق، أخضر فاتح). الاختصارات؛ LOD = نسبة احتمالات لوغاريتم. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-4
الشكل 4: فروق نموذجية في درجة LOD لوحظت. (أ) عند دمج طرق محاذاة التسلسل المختلفة وخرائط الأنماط التكرارية لمجموعة من العينات المعروفة غير المتطابقة والمطابقة، و(ب) للتقييم من خلال دمج المعلومات الورمية والطبيعية. (ج) حدوث عدد المطابقات وعدم المطابقة في العينات التي تحددها أساليب العتبة ذات الصرامة المختلفة. الاختصارات؛ LOD = نسبة احتمالات لوغاريتم. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-5
الشكل 5: توزيع نموذجي لدرجات LOD لمقارنة طرق التسلسل المختلفة من الجيل القادم. (أ) توزيع درجات LOD للعينات المتوقعة غير المتطابقة والمتوقعة بين تسلسل الحمض النووي من الدم وأنسجة الورم وتسلسل الحمض النووي الريبي من أنسجة الورم. (ب) توزيع درجات LOD للعينات المتطابقة لتركيبات من أنماط مختلفة. الاختصارات؛ LOD = نسبة احتمالات لوغاريتم. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-6
الشكل 6: توزيع درجات LOD لتحليل مجموعة بيانات WES وتسلسل RNA لسرطان الثدي. تم الحصول على مجموعة بيانات سرطان الثدي غير المحددة من Caris Life Sciences وهي مستمدة من التحليل الشامل للورم. (أ) الحدوث اللوغاريتمي لدرجات LOD للمقارنات بين عينات WES للورم (يسار) وبين عينات تسلسل الحمض النووي الريبي (يمين). (ب) توزيعات درجات LOD لأزواج متوقعة من العينات من نفس الأفراد (الصف العلوي في WES، تسلسل الصف السفلي بالحمض النووي الريبي). الاختصارات؛ LOD = نسبة احتمالات لوغاريتم. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

LEFT_GROUP_VALUERIGHT_GROUP_VALUEالنتيجةLOD_SCORELOD_SCORE_
TUMOR_NORMAL
LOD_SCORE_
NORMAL_TUMOR
عينة 1عينة 1EXPECTED_MATCH38.11926629.64948529.649485
عينة 1عينة 2EXPECTED_MISMATCH-2.552644-4.574225.283698
عينة 2عينة 1EXPECTED_MISMATCH-2.5526445.283698-4.57422
عينة 2عينة 2EXPECTED_MATCH12.3287378.7964578.796457

الجدول 1: نتائج نموذجية تم الحصول عليها من إجراء فحص بصمات الأصابع المتقاطعة. يعرض الجدول نتائج نموذجية لزوج من العينات مقارنة بأسلوب مطابقة العينة.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تتوفر مجموعة متنوعة من الطرق لتحديد تطابقات العينة 1,4,13,14,15,16. هنا، تم وصف تطبيق نهج يستخدم كتل عدم توازن ربط SNP قابلة للتطبيق عبر عدة أوميكس، مع معدلات منخفضة للإيجابيات الكاذبة والسلبية الكاذبة. تم تنفيذ التنفيذ في CWL لتسهيل المعالجة عالية الإنتاجية عبر مجموعات البيانات ضمن بيئة سير عمل موحدة. حدد تقييم سير العمل ثلاثة جوانب رئيسية يجب أخذها في الاعتبار عند تطبيق النهج. خطوة رئيسية في العملية هي اختيار المناطق الجينومية التي تغطيها خريطة النمط الجيني (haplotype). بالإضافة إلى ذلك، يمكن أن يؤثر دمج محاذاة القراءة مع استخراج البصمة باستخدام خرائط أنماط مختلفة على نتائج التحليل. علاوة على ذلك، فإن التقييم الدقيق واختيار العتبات، التي قد تعتمد على طريقة البيانات والمناطق المغطاة، أمر ضروري ويمكن أن يؤدي إلى استدعاء مطابقة عينات أكثر أو أقل تساهلا.

لتقييم مجموعات كبيرة من العينات السريرية، تم تكييف الطريقة لتحديد تركيبات من العتبات لدرجات مطابقة العينات الصارمة والسهلية. تم تعديل الطريقة لتشمل نهج عتبة متساهلة من خلال النظر في درجة مجمعة تتكون من أي من درجات LOD (LOD_SCORE، LOD_SCORE_TUMOR_NORMAL، LOD_SCORE_NORMAL_TUMOR) أو معيارين بديلين للترشيح، مما أدى إلى اختيار أكثر صرامة للعينات. يقتصر تطبيق هذا النهج على العينات التي تتوفر لها معلومات SNP عبر مجموعة من المناطق الجينومية، مثل بيانات التسلسل من الجيل القادم. علاوة على ذلك، هناك حاجة إلى أزواج على الأقل من العينات من نفس الفرد للتحليل المقارن ومطابقة العينات. قد تستخدم معلومات سريرية إضافية، مثل حالة الطفرة التي تم الحصول عليها بالطرق المستهدفة أو بيانات وصفية للمرضى، مثل الجنس، لتقديم أدلة إضافية للمطابقة بين البيانات الجزيئية عالية الأبعاد وبيانات سريرية على مستوى المريض.

يتيح تطبيق هذا النهج في بيئة إدارة سير العمل، مع إمكانية تخزين البيانات المتوازي، تحليل جودة عالي الإنتاجية للعينات بحثا عن التلوث بين الأفراد. وبالتالي، يزيد من سهولة الوصول وقابلية إعادة الإنتاج للنهج عبر مجموعات البيانات والعينات. تمكن قابلية معايير التكيف في هذا النهج من معالجة وتحليل عينات السرطان ذات العبء الطفري المنخفض والعالي للورم وتغيرات في عدد النسخ التي قد تؤدي إلى فقدان التغاير الزيجوي وبالتالي التأثير على احتمال النمط الجيني.

يمكن للطريقة أن تجد تطبيقا واسعا على أي نوع من المشاريع التي تتضمن بيانات تسلسل الجيل القادم من الأفراد البشر، والتي يتوفر لها أكثر من عينة واحدة لكل شخص. قد يتراوح هذا من أساليب مخصصة للمرضى الفرديين إلى تجارب سريرية كبيرة تجمع بيانات جزيئية عالية الأبعاد لمناطق مرضية مختلفة. يمكن دمجها مع سير عمل مراقبة الجودة، والتحقيق في التلوث بين الأنواع، وطرق لربط مجموعات البيانات الجزيئية عالية الأبعاد بالمعلومات السريرية لدمجها في أي خط لمراقبة الجودة لبيانات التسلسل من الجيل القادم.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

جميع المؤلفين هم موظفون أو متعاقدون خارجيون ومساهمون في شركة F. Hoffmann-La Roche Ltd. بالإضافة إلى ذلك، زاكاري ويتفيلد هو موظف في رانشو بيوساينسز، وآنا تيكسيرا موظفة في A4Pbio. يعلن المؤلفون عدم وجود مصالح متنافسة.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

نشكر المرضى وعائلاتهم بصدق على تقديم عيناتهم. نعبر عن أعمق امتناننا لكل من شارك في الدراسات السريرية، وخاصة أعضاء فرق الدراسة، وفرق المحققين، وفرق المشاريع في منظمات البحث السريري لدينا، على مساهماتهم التي لا تقدر بثمن. يشكر المؤلفان ن. ناير وإ. غوارين على قراءتهما النقدية للمخطوط وتعليقاتهما القيمة. كما نعبر عن امتناننا لأ. كوسولو على دعمه في جعل مجموعات بيانات إضافية متاحة. نشكر شبكة مشاركة البيانات والرؤى المحسنة على مستوى روش (EDIS) على جهودهم في تنظيم وتوحيد البيانات.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
فاست كيو سيv0.11.9SCR_014583
MultiQCالإصدار 1.8SCR_014982
BWA-MEMv0.7.17SCR_010910
ستارv2.7.9aSCR_004463
أدوات سامالإصدار 1.12، الإصدار 1.19.2SCR_005227
-  فايدكس
-  ترتيب
-  الفهرس
- أدريبلاسيجر
بيكارالإصدار 2.25.5، الإصدار 3.0.0SCR_006525
- قاموس إنشاء التسلسل
- مارك دبكيتس
- build_fingerprint_maps
- استخراج بصمات الأصابع
- التحقق المتقاطع من البصمات
CWLالإصدار 1.2SCR_015528
RR v4.3.1SCR_001905
DPLYR v1.1.4

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Westphal, M., et al. SMaSH: sample matching using SNPs in humans. BMC Genomics. 20 (12), 1001(2019).
  2. Westra, H. J., et al. MixupMapper: correcting sample mix-ups in genome-wide datasets increases power to detect small genetic effects. Bioinformatics. 27 (15), 2104-2111 (2011).
  3. Addala, V., et al. Computational immunogenomic approaches to predict response to cancer immunotherapies. Nat. Rev. Clin. Oncol. 21 (1), 28-46 (2024).
  4. Schröder, J., Corbin, V., Papenfuss, A. T. HYSYS: have you swapped your samples. Bioinformatics. 33 (4), 596-598 (2017).
  5. Pengelly, R. J., et al. A SNP profiling panel for sample tracking in whole-exome sequencing studies. Genome Med. 5 (9), 89(2013).
  6. Subramanian, I., et al. Multi-omics data integration, interpretation, and its application. Bioinform Biol Insights. 14, 117793221989905(2020).
  7. Baião, A. R., et al. A technical review of multi-omics data integration methods: from classical statistical to deep generative approaches. Brief Bioinform. 26 (4), bbaf355(2025).
  8. Wang, Z., Zhao, Y., Zhang, L. Emerging trends and hot topics in the application of multi-omics in drug discovery: A bibliometric and visualized study. Curr Pharm Anal. 21 (1), 20-32 (2024).
  9. Morris, S., et al. Two algorithms for biospecimen comparison and differentiation using SNP genotypes. Pharmacogenomics. 14 (4), 379-390 (2013).
  10. Yoo, S., et al. MODMatcher: multi-omics data matcher for integrative genomic analysis. PLoS Comput Biol. 10 (8), e1003790(2014).
  11. Li, L., et al. SMAP is a pipeline for sample matching in proteogenomics. Nat Commun. 13 (1), 744(2022).
  12. Cibulskis, K., et al. ContEst: estimating cross-contamination of human samples in next-generation sequencing data. Bioinformatics. 27 (18), 2601-2602 (2011).
  13. Chun, H., Kim, S. BAMixChecker: an automated checkup tool for matched sample pairs in NGS cohort. Bioinformatics. 35 (22), 4806-4808 (2019).
  14. Lee, S., et al. NGSCheckMate: software for validating sample identity in next-generation sequencing studies within and across data types. Nucleic Acids Res. 45 (11), e103-e103 (2017).
  15. Javed, N., et al. Detecting sample swaps in diverse NGS data types using linkage disequilibrium. Nature Commun. 11 (1), 3697(2020).
  16. Wang, P. P. S., Parker, W. T., Branford, S., Schreiber, A. W. BAM-matcher: a tool for rapid NGS sample matching. Bioinformatics. 32 (17), 2699-2701 (2016).
  17. Katsanis, S. H., Wagner, J. K. Characterization of the standard and recommended codis markers. J Forensic Sci. 58, s1(2013).
  18. Yousefi, S., et al. BIOS consortium. A SNP panel for identification of DNA and RNA specimens. BMC Genomics. 19 (1), 90(2018).
  19. Huang, J., Chen, J., Lathrop, M., Liang, L. A tool for RNA sequencing sample identity check. Bioinformatics. 29 (11), 1463-1464 (2013).
  20. Goldfeder, R. L., et al. A bioinformatics approach for determining sample identity from different lanes of high-throughput sequencing data. PLoS ONE. 6 (8), e23683(2011).
  21. Crusoe, M. R., et al. Methods included: standardizing computational reuse and portability with the common workflow language. Commun ACM. 65 (6), 54-63 (2022).
  22. Ahmed, A. E., et al. Design considerations for workflow management systems use in production genomics research and the clinic. Scientific Rep. 11 (1), (2021).
  23. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  24. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  25. Bergmann, E. A., et al. Conpair: concordance and contamination estimator for matched tumor–normal pairs. Bioinformatics. 32 (20), 3196-3198 (2016).

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

مقالات ذات صلة