يونيو 23, 2012
تجميع تسلسل الحمض النووي هو استراتيجية سريعة وفعالة من حيث التكلفة للكشف عن بدائل نادر المرتبطة الظواهر المعقدة في أفواج كبيرة. نحن هنا وصف التحليل الحسابي من تجميع التسلسل من الجيل التالي، من الجينات المتصلة بالسرطان 32 باستخدام حزمة البرامج منشقة. هذه الطريقة هي قابلة للتطوير، والتي تنطبق على أي النمط الظاهري في المصالح.
الهدف العام من هذا الإجراء هو تحديد الجينات ضمن مجموعة من الأفراد الذين يظهرون غلبة في التباينات الوظيفية النادرة. يتم تحقيق ذلك أولاً عن طريق تجميع عينات DNA من مجموعة سكانية. وتتمثل الخطوة الثانية في إنشاء مكتبة لتسلسل الجيل القادم وإجراء التسلسل لها.
يتبع ذلك محاذاة القراءات مع التسلسل المرجعي وإنشاء نموذج للأخطاء. وتتمثل الخطوة النهائية في التحليل الحسابي باستخدام خوارزمية splinter. وفي النهاية، يُستخدم تحليل splinter لتسلسل الجيل القادم المجمع (pooled Next generation sequencing) لإظهار الجينات داخل المجموعات السكانية التي تحمل غلبة من التباين الوظيفي النادر، مما يوضح الإجراء المتبع.
سيكون معنا اليوم فرانشيسكو فيلانيا، وهو طالب دراسات عليا في مختبر معلمي ومعاوننا، روب ميترا، وينضم إليه إنريكي راموس، وهو طالب دراسات عليا في مختبري. تكمن الميزة الرئيسية لهذه التقنية مقارنة بالطرق الحالية، مثل تحديد الأنماط الجينية للفرد الواحد، في أنها تتيح لك الكشف بدقة عالية عن المتغيرات التسلسلية النادرة في مجموعة مختلطة من جزيئات DNA دون الحاجة إلى أي معلومات مسبقة. يمكن لهذه الطريقة أن تساعد في الإجابة على أسئلة جوهرية في مجالات الوراثة والجينوميات، مثل كيفية تحديد تكرار المتغيرات النادرة الجديدة المسببة للأمراض في دراسات المجموعات السكانية الكبيرة.
تتطلب كل تجربة شظية وجود ضابط سلبي وآخر إيجابي لتحقيق الدقة المثلى، قم بتحضير خليط تفاعل PCR باستخدام PFU ultra high fidelity DNA polymerase. والضابط السلبي هو ناتج PCR من أي تسلسل DNA معروف بخلوه من التباين الجيني، مثل هيكل ناقل مستنسخ.
هنا، يتم استخدام قطعة تضخيم بطول 1,934 زوجاً قاعدياً من ناقل M 13 MP 18. يمكن أن تكون الضابطة الموجبة أي مجموعة من متغيرات التسلسلات التي تم التحقق من صحتها مسبقاً والموجودة في المجتمع بأكمله. وفي حال عدم توفر هذه البيانات، فقد صمم هذا المختبر ضابطة موجبة اصطناعية تتكون من ناتج PCR بطول 331 زوجاً قاعدياً من خليط من التسلسلات المهندسة والمستنسخة في ناقل PGMT easy كما هو موضح في هذا الجدول.
تُدمج هذه التسلسلات لمحاكاة ترددات مختلفة للأليلات الثانوية للمتغيرات الحقيقية ضمن مجموعة المرضى. بعد تضخيم العينات بواسطة تفاعل البوليميراز المتسلسل (PCR) كما هو موضح في البروتوكول المكتوب المرفق بهذا الفيديو، يتم تنقية كل ناتج PCR من البادئات الزائدة باستخدام أعمدة تنقية kyogen kayak quick column، أو ألواح ترشيح ذات 96 بئراً مع مجمع تفريغ لإجراء عملية التنقية على نطاق واسع. وبمجرد التنقية، يتم تحديد كمية كل ناتج PCR باستخدام التقنيات القياسية.
استعد لدمج جميع نواتج PCR والعينات الضابطة في تجمع واحد يتم توحيده بناءً على عدد الجزيئات. سيؤدي التجميع بناءً على التركيز إلى تمثيل مفرط لقطع التضخيم الصغيرة مقارنة بالنواتج الأكبر حجمًا. وبدلاً من ذلك، قم بتجميع عدد موحد من الجزيئات لكل قطعة تضخيم.
اختر أرقاماً عشوائية كبيرة بما يكفي للحفاظ على الدقة أثناء عملية السحب بالماصة. اسحب نواتج PCR والعينات الضابطة. يعد ربط نواتج PCR ضرورياً لأن تجزئة قطع PCR الصغيرة ستؤدي على الأرجح إلى تحيز في التمثيل نحو نهاياتها.
لهذا السبب، نقوم بربط نواتج تفاعل PCR المستخلصة في ناقلات كبيرة قبل تفتيتها. قم بتحضير خليط الربط للنهايات غير الطرفية باستخدام T four Ligase و T four PNK و PEG كما هو موضح في البروتوكول. يتم تحضين التفاعل عند 22 degrees Celsius لمدة 17 ساعة.
يتبع ذلك التحضين عند 65 درجة Celsius لمدة 20 دقيقة، ثم الحفظ عند أربع درجات Celsius. بعد ذلك، يتم التحقق من عملية الربط عن طريق تحميل 50 nanograms من العينة في هلام الأجاروز. سيؤدي الربط الناجح إلى ظهور حزمة ذات وزن جزيئي مرتفع في المسار.
استعد لتجزئة الـ DNA من خلال استراتيجية السونيكيشن العشوائي عن طريق تخفيف العينة بنسبة 10 إلى 1 في منظم Qiagen PB Buffer لتقليل لزوجتها. بعد ذلك، قم بتجزئة التراكيز العالية من نواتج الـ PCR باستخدام جهاز Diagenode Bioruptor بسعة 24 عينة، مع إجراء السونيكيشن بقدرة عالية على مدار 25 دقيقة، بحيث يتم التشغيل لمدة 40 ثانية والإيقاف لمدة 20 ثانية في كل دقيقة. تحقق من نتائج تجزئة الـ DNA باستخدام هلام الأجاروز، ثم تابع عملية تسلسل Illumina كما هو موضح في النص.
لبدء عملية التسلسل، يتم إجراء محاذاة القراءات. إما عن طريق تحويل ملفات قراءات التسلسل الخام إلى صيغة scarf، أو ضغطها. ويعد الضغط خطوة اختيارية.
يوفر ذلك الوقت والمساحة لخطوات التحليل اللاحقة دون فقدان أي معلومات ذات صلة. باستخدام أداة المحاذاة المضمنة، قم بمحاذاة القراءات الخام مع التسلسل المرجعي الأسرع والمشروح. تشمل المناطق المستهدفة تحديداً تفاعلات PCR بالإضافة إلى الضوابط الموجبة والسالبة.
يجب أن يكون تنسيق الإدخال بصيغة scarf أو مضغوطاً. بعد ذلك، يتم إجراء وسم للملفات كما هو موضح في النص. تُنتج كل عملية تشغيل ملف تعريف فريداً لأخطاء التسلسل، والذي يجب توصيفه لضمان دقة تحديد المتغيرات من خلال نمذجة الأخطاء الخاصة بكل عملية تشغيل.
يتم تضمين ضابط داخلي معروف بتنوع تسلسله في كل مكتبة عينات مجمعة من الملف الملحق المصطف. قم بإنشاء ملف نموذج الخطأ باستخدام الأداة المضمنة مع التسلسل المرجعي للضابط السلبي، حيث يمكن استخدام جميع تسلسلات الضابط السلبي أو بدلاً من ذلك استخدام مجموعة فرعية فقط عند تحديد نهايتيها الخامسة الأولى والثالثة.
ستقوم الأداة بإنشاء ثلاثة ملفات تحمل نفس اسم ملف المخرجات المحدّد في المعاملات، وتنتهي بالأرقام صفر أو واحد أو اثنين. وتتوافق هذه الملفات مع نماذج خطأ من الرتبة صفر والأولى والثانية على التوالي لعملية تحديد المتغيرات (variant calling) باستخدام splinter. ويجب دائمًا استخدام نموذج الخطأ من الرتبة الثانية لتصور ملف معدل الخطأ الخاص بالتشغيل.
يمكن استخدام نص Perl البرمجي المستخدم لرسم مخطط نموذج الخطأ لإنشاء مخطط خطأ بصيغة PDF لملف نموذج الخطأ من الدرجة صفر. سيكشف ملف المخطط عن اتجاهات الخطأ الخاصة بكل عملية تشغيل، ويمكن استخدامه لاستنتاج الحد الأقصى لعدد القواعد المقروءة للتحليل. سيوضح القسم التالي كيفية تشغيل splinter على الملف المحاذى باستخدام نموذج الخطأ للكشف عن متغيرات التسلسل النادرة.
تتمثل الخطوة الأولى في التحليل في تشغيل برنامج splinter على الملف المحاذى باستخدام التسلسل المرجعي ونموذج الخطأ. ويمكن استبعاد القواعد أحادية القراءة من التحليل إذا تبين أنها معيبة. وتحدد قيمة قطع P-value مدى صرامة تحليل استدعاء المتغيرات.
تعتبر قيمة القطع الدنيا -1.301 نقطة بداية جيدة. يعمل خيار حجم التجميع (pool size) على تحسين تمييز إشارة الخوارزمية من الضجيج عن طريق التخلص من التباين المحتمل مع ترددات الأليلات الثانوية التي تقل عن تردد أليل واحد في التجميع الفعلي. يجب ضبط خيار حجم التجميع على أقرب قيمة تكون أكبر من العدد الفعلي للأليلات التي تم تحليلها في التجربة.
سيتم تجاهل التباينات التي تظهر بترددات منخفضة باعتبارها ضجيجاً. بعد إدخال جميع المعايير وأسماء الملفات، قم بتشغيل splinter. يعيد هذا الملف جميع النتائج ذات الدلالة الإحصائية عبر العينة مع وصف لموقع التباين ونوعه.
قيمة P لكل تردد لشريط DNA للمتغير وإجمالي التغطية لكل شريط DNA. يتم استخدام قارورة القائمة بواسطة splinter لتوحيد التغطية عبر العينة. يشير الحقل الأول إلى قطعة amplicon ذات الأهمية، بينما يشير الحقل الثاني إلى الموضع الذي توجد فيه الطفرة.
يشير الحرف N إلى أن بقية التسلسل لا تحتوي على أي طفرة. ويعد تحليل الضابط الموجب كجزء من عملية المعايرة أمرًا أساسيًا لزيادة الحساسية والنوعية إلى أقصى حد في تشغيل معين. وهذا أمر مهم لأن نقطة الفصل الأولية البالغة 1.301- لن تكون كافية على الأرجح لاستبعاد جميع النتائج الإيجابية الكاذبة.
سوف يظهر كل تحليل للشظايا (splinter analysis) قيمة P-value الفعلية لكل متغير تم تحديده، وهو أمر لا يمكن التنبؤ بأولويته مسبقاً. ومع ذلك، يمكن تكرار التحليل بأكمله باستخدام أقل قيمة P-value صرامة تظهر في المخرجات الأولية لمواقع القواعد الإيجابية الحقيقية المعروفة. سيعمل ذلك على الاحتفاظ بجميع الحالات الإيجابية الحقيقية مع استبعاد معظم الحالات الإيجابية الكاذبة، إن لم يكن جميعها، والتي عادة ما تكون قيم P-value الخاصة بها أقل أهمية بكثير مقارنة بالحالات الإيجابية الحقيقية.
لأتمتة هذه العملية، يمكن استخدام نص "cutoff tester" البرمجي. يتطلب نص "cutoff tester" البرمجي ملف مخرجات splinter وقائمة من نتائج الضوابط الإيجابية (positive control hits) في شكل ملف محدد بعلامات جدولة (tab delimited file) مثل الملف المستخدم في عملية التطبيع (normalization). ستكون المخرجات الناتجة عبارة عن قائمة من قيم القطع (cutoffs) التي تصل تدريجيًا إلى القيمة المثلى.
يمثل السطر الأخير نقطة الفصل الأكثر مثالية لهذا التشغيل، وبالتالي يمكن استخدامه لتحليل البيانات. والنتيجة المثالية هي تحقيق حساسية ونوعية تبلغ واحد. ومع ذلك، في حال عدم تحقيق ذلك، يمكن تحسين تحليل الشظايا عن طريق تغيير عدد قواعد القراءة المدمجة.
يمكن تطبيق نقطة القطع النهائية على البيانات باستخدام نص برمجي للقطع (cutoff cut script)، والذي سيقوم بتصفية ملف مخرجات splinter من النتائج التي تقل عن نقطة القطع المثلى. ستؤدي هذه الخطوة إلى إنشاء ملف مخرجات splinter النهائي، والذي سيحتوي على الـ snips والـ indels الموجودة في العينة. يرجى ملاحظة أن مخرجات عمليات الإدخال تختلف قليلاً عن مخرجات عمليات الاستبدال أو الحذف.
يتم تصور الدقة كدالة في التغطية لأليل واحد في عينة مجمعة في هذا النوع من المخططات. وتُقدر الدقة على أنها المساحة تحت المنحنى، والتي يُرمز لها بـ AUC في منحنى خصائص تشغيل المستقبل، وتتراوح من دقة عشوائية تبلغ 0.5 إلى دقة مثالية تبلغ 1.0. وفي هذا المثال، يتم رسم AUC كدالة في التغطية لكل أليل للكشف عن أليلات طافرة مفردة في تجمعات تتراوح بين 200 و500 و1,000 أليل.
يتم هنا رسم UC كدالة للإجمالي بالنسبة للإقحامات والحذوفات والاستبدالات. يوضح مخطط الخطأ هذا احتمالية دمج قاعدة خاطئة في موضع معين. ويُظهر ملف تعريف الخطأ معدلات خطأ منخفضة مع اتجاه متزايد نحو النهاية '3 لقراءة التسلسل.
تُظهر النيوكليوتيدات المرجعية المختلفة بشكل ملحوظ احتمالات خطأ متفاوتة. يوضح هذا المخطط دقة برنامج splinter في تقدير تكرار الأليل للمواضع التي كانت تغطيتها أكبر من 25 ضعفاً لكل أليل. مقارنة بين تكرارات أليلات الحمض النووي المجمعة المقدرة بواسطة splinter مع أعداد الأليلات المقاسة بواسطة دراسات الارتباط الجينومي الكامل أو نتائج GWAS.
في ارتباط عالٍ جداً، تم سحب مجموعة مكونة من 974 فرداً واستهداف أكثر من 20 كيلوبايس للتسلسل. تم تطبيق Splinter للكشف عن المتغيرات النادرة. ووفقاً للبروتوكول القياسي، خضع كل فرد مسبقاً للتنميط الجيني من خلال توافق gwas بين التنميط الجيني للمتغيرات المحددة والمتغيرات الجديدة.
كانت نتائج تحديد المتغيرات في العينة المجمعة ممتازة. حيث تم تحديد ثلاثة متغيرات من نتائج التسلسل، اثنان منها كانا نادرين في المجتمع، واعتُبرا طفرات جديدة (denovo)، وتم التحقق من صحتهما عن طريق تسلسل Pyro الفردي، وكان تردد الأليلات الثانوية أو التطابق الحسابي بين تسلسل Pyro والتسلسل المجمع ممتازاً. وبمجرد الانتهاء من العثور على المتغير النادر في العينة المجمعة، يرغب الكثيرون في معرفة العواقب الوظيفية للمتغير الذي تم تحديده.
وبذلك تصبح عملية توصيف التباين الخاص بك هي الخطوة التالية في العملية بعد مرحلة التطوير. وقد مهدت هذه التقنية الطريق للباحثين في مجال تسلسل DNA لدراسة المتغيرات النادرة بطريقة سريعة وفعالة من حيث التكلفة لتوصيف المتغيرات النادرة في دراسات المجموعات السكانية الكبيرة. بعد مشاهدة هذا الفيديو، يجب أن يكون لديك فهم جيد لكيفية الكشف عن متغيرات التسلسل النادرة في عينة DNA مجمعة باستخدام splinter.
يُعد تسلسل الحمض النووي المجمع (Pooled DNA sequencing) طريقة فعالة لتحديد المتغيرات الجينية النادرة المرتبطة بسمات معقدة في المجموعات السكانية الكبيرة. تفصل هذه المقالة التحليل الحسابي لبيانات التسلسل المجمع من 32 جيناً مرتبطاً بالسرطان باستخدام حزمة برمجيات SPLINTER.
يعد الكشف عن المتغيرات الجينومية النادرة في المجموعات السكانية الكبيرة أمراً بالغ الأهمية للتحقق من الأهداف في أبحاث الأمراض المعقدة، حيث تفشل المتغيرات الشائعة في تفسير التباين المظهري. يوفر نهج التسلسل المجمع المدعوم بتقنية SPLINTER طريقة قابلة للتوسع وفعالة من حيث التكلفة لفحص الفرضيات العلاجية من خلال تحديد المتغيرات الوظيفية منخفضة التردد دون معرفة مسبقة بالمتغيرات. ويدعم ذلك الحد من مخاطر الاكتشاف المبكر من خلال تمكين تقدير تردد الأليل وتأكيد المتغيرات في المجموعات ذات الصلة بالمرض، مما يوجه بشكل مباشر عملية تحديد أولويات المحفظة والمتابعة الميكانيكية.
تندرج هذه الطريقة ضمن سلسلة مراحل الاكتشاف، بدءاً من صياغة الفرضيات وصولاً إلى تحديد المركبات الرائدة، حيث توفر مخرجات للكشف عن المتغيرات التي تساهم في توجيه عملية اختيار الهدف ومدى جاهزية المقايسة.