June 23rd, 2012
تجميع تسلسل الحمض النووي هو استراتيجية سريعة وفعالة من حيث التكلفة للكشف عن بدائل نادر المرتبطة الظواهر المعقدة في أفواج كبيرة. نحن هنا وصف التحليل الحسابي من تجميع التسلسل من الجيل التالي، من الجينات المتصلة بالسرطان 32 باستخدام حزمة البرامج منشقة. هذه الطريقة هي قابلة للتطوير، والتي تنطبق على أي النمط الظاهري في المصالح.
الهدف العام من هذا الإجراء هو تحديد الجينات داخل مجموعة من الأفراد الذين يظهرون غلبة التباين الوظيفي النادر. يتم تحقيق ذلك عن طريق تجميع مجموعة من عينات الحمض النووي أولا. الخطوة الثانية هي إنشاء مكتبة تسلسل من الجيل التالي وتسلسلها.
يتبع ذلك محاذاة القراءات مع التسلسل المرجعي وإنشاء نموذج خطأ. الخطوة الأخيرة هي التحليل الحسابي باستخدام خوارزمية الشظية. في نهاية المطاف ، يتم استخدام تحليل الشظيا لتسلسل الجيل التالي المجمع لإظهار الجينات داخل السكان الذين يؤوون غلبة التباين الوظيفي النادر مما يدل على الإجراء.
اليوم سيكون فرانشيسكو فيلانيا ، وهو طالب دراسات عليا في مختبر معلمي ومساعدنا ، روب ميترا ، وسينضم إليه إنريكي راموس ، طالب دراسات عليا في مختبري. الميزة الرئيسية لهذه التقنية على الطرق الحالية مثل الأنماط الجينية الفردية الفردية ، هي أنها تسمح لك باكتشاف متغيرات التسلسل النادرة بدقة شديدة في مجموعة مختلطة من جزيء الحمض النووي دون الحاجة إلى أي معلومات مسبقة. يمكن أن تساعد هذه الطريقة في الإجابة على الأسئلة الرئيسية في مجالات علم الوراثة وعلم الجينوم ، مثل كيفية تحديد تواتر المرض الجديد الذي يسبب متغيرات نادرة في دراسات الأتراب الكبيرة.
تتطلب كل تجربة منشقة وجود تحكم سلبي وإيجابي للحصول على الدقة المثلى ، وإعداد مزيج تفاعل تفاعل البوليميراز المتسلسل باستخدام دقة PFU فائقة الدقة. بوليميراز الحمض النووي. التحكم السلبي هو منتج تفاعل البوليميراز المتسلسل من أي تسلسل DNA معروف بأنه بدون تباين جيني ، مثل العمود الفقري للناقل المستنسخ.
هنا ، يتم استخدام أمبليكون زوج أساسي 1 ، 934 من متجه M 13 MP 18. يمكن أن يكون التحكم الإيجابي أي مجموعة من متغيرات التسلسل التي تم التحقق من صحتها مسبقا والموجودة في جميع السكان. إذا لم تكن هذه البيانات متوفرة ، فقد صمم هذا المختبر عنصر تحكم إيجابي اصطناعي يتكون من 331 قاعدة لكل منتج PCR من مزيج من التسلسلات الهندسية المستنسخة في متجه PGMT السهل كما هو موضح في هذا الجدول.
يتم الجمع بين هذه التسلسلات لتقليد ترددات الأليل الثانوية المختلفة للمتغيرات الحقيقية داخل مجموعة المرضى. بعد تضخيم PCR للعينات كما تمت مناقشته في البروتوكول المكتوب المصاحب لهذا الفيديو ، قم بتنظيف كل منتج PCR من البادئات الزائدة باستخدام تنقية عمود kyogen Kayak السريع ، أو 96 لوحة مرشح بئر مع مشعب فراغ للتنظيف على نطاق واسع. بمجرد التنقية ، حدد كل منتج من منتجات تفاعل البوليميراز المتسلسل باستخدام التقنيات القياسية.
استعد لدمج جميع منتجات تفاعل البوليميراز المتسلسل وعناصر التحكم في مجموعة تطبيع حسب رقم الجزيء. سيؤدي التجميع حسب التركيز إلى التمثيل المفرط للأمبليكونات الصغيرة على المنتجات الكبيرة. بدلا من ذلك ، قم بتجميع عدد طبيعي من الجزيئات لكل مكبرات صوت.
اختر أرقاما عشوائية كبيرة بما يكفي للحفاظ على الدقة أثناء سحب العينات. اسحب منتجات PCR وأدوات التحكم. يعد ربط منتجات تفاعل البوليميراز المتسلسل ضروريا لأن تجزئة المتقدمين الصغار لتفاعل البوليميراز المتسلسل من المحتمل أن يؤدي إلى تحيز التمثيل نحو غاياتهم.
لهذا السبب ، نقوم بربط منتجات سحب PCR في خدعة كبيرة قبل تجزئتها. قم بإعداد المزيج للربط غير الحاد باستخدام T four Ligase و T four PNK و PEG كما هو موضح في البروتوكول. احتضان التفاعل عند 22 درجة مئوية لمدة 17 ساعة.
يتبع بالحضانة عند 65 درجة مئوية لمدة 20 دقيقة ويمسك بأربع درجات مئوية بعد ذلك. تحقق من الربط عن طريق تحميل 50 نانوغراما من العينة في هلام نشأتي. سيؤدي الربط الناجح إلى وجود نطاق عالي للوزن الجزيئي في الممر.
استعد لتجزئة الحمض النووي من خلال استراتيجية صوتنة عشوائية عن طريق تخفيف العينة 10 إلى واحد في Qiagen PB Buffer لجعلها أقل لزوجة. ثم قم بتجزئة المخروط الكبير لمنتجات تفاعل البوليميراز المتسلسل باستخدام تمزق حيوي للعقدة ثنائية العينة المكونة من 24 عينة ، وصوتنة بقوة عالية على مدار 25 دقيقة مع 40 ثانية تشغيل و 20 ثانية في الدقيقة. تحقق من نتائج تجزئة الحمض النووي على هلام زراعي واستمر في التسلسل المضيء كما هو موضح في النص.
لبدء التسلسل، اقرأ المحاذاة. إما تحويل التسلسل الخام أو قراءة الملفات إلى تنسيق وشاح أو ضغطها. الضغط اختياري.
يوفر الوقت والمساحة لخطوات التحليل اللاحقة دون فقد أي معلومات ذات صلة. باستخدام أداة المحاذاة المضمنة، قم بمحاذاة القراءات الأولية مع التسلسل المرجعي الأسرع المشروح. تشمل المناطق المستهدفة تفاعلات تفاعل البوليميراز المتسلسل بالإضافة إلى الضوابط الإيجابية والسلبية.
يجب أن يكون تنسيق الإدخال بتنسيق وشاح أو مضغوطا. بعد ذلك ، قم بإجراء وضع علامات على الملفات كما هو موضح في النص. ينشئ كل تشغيل ملف تعريف فريدا لخطأ التسلسل ليتم تمييزه لاستدعاء المتغير الدقيق لأخطاء النموذج لكل تشغيل.
يتم تضمين عنصر تحكم داخلي معروف بنشره لتباين التسلسل في كل مكتبة عينة تجمع من الملف المحاذاة ذي العلامات التجارية. قم بإنشاء ملف نموذج خطأ باستخدام الأداة المضمنة مع التسلسل المرجعي للتحكم السلبي ، ويمكن استخدام كل تسلسل التحكم السلبي أو بدلا من ذلك مجموعة فرعية فقط عند تحديدها بواسطة نهاياتها الأولية الخمسة والثلاثة الرئيسية. يجب دائما تطبيق القراءات الفريدة والأعداد الزائفة.
ستقوم الأداة بإنشاء ثلاثة ملفات تسمى معلمة اسم ملف الإخراج تنتهي بصفر أو واحد أو اثنين. تتوافق هذه الملفات مع نموذج خطأ من الدرجة الأولى والثانية صفرا على التوالي لاستدعاء المتغير مع الشظية. يجب دائما إستخدام نموذج خطأ الترتيب الثاني لتصور ملف تعريف معدل خطأ التشغيل.
يمكن استخدام البرنامج النصي اللؤلؤي المستخدم لرسم الرسم البياني لنموذج الخطأ لإنشاء مخطط خطأ PDF على ملف نموذج الخطأ من الدرجة الصفرية. سيكشف ملف المؤامرة عن اتجاهات خطأ محددة للتشغيل ويمكن استخدامه لاستنتاج الحد الأقصى لعدد قواعد القراءة للتحليل. سيوضح القسم التالي كيفية تشغيل الشظية على الملف المحاذاة باستخدام نموذج الخطأ للكشف عن متغيرات التسلسل النادرة.
تتمثل الخطوة الأولى في التحليل في تشغيل splinter على الملف المحاذاة باستخدام التسلسل المرجعي ونموذج الخطأ. يمكن استبعاد قواعد القراءة الفردية من التحليل إذا تبين أنها معيبة. يحدد الحد الأقصى لقيمة P مدى صرامة تحليل استدعاء المتغير.
يعد الحد الأدنى للحد الأقصى سالب 1.301 بداية جيدة. يعمل خيار حجم التجمع على تحسين إشارة الخوارزمية لتمييز الضوضاء عن طريق القضاء على التباين المحتمل مع ترددات الأليل الثانوية أقل من ترددات الأليل الفردي في التجمع الفعلي. يجب تعيين خيار حجم التجمع على أقرب قيمة أكبر من العدد الفعلي للأليلات التي تم تحليلها في التجربة.
سيتم تجاهل التباين الذي يتم استدعاؤه عند الترددات المنخفضة كضوضاء. بعد إدخال جميع المعلمات وأسماء الملفات ، قم بتشغيل splinter. يرجع هذا الملف جميع النتائج ذات الدلالة الإحصائية عبر العينة مع وصف لموضع نوع المتغير من المتغير.
قيمة p لكل تردد خيط الحمض النووي للمتغير والتغطية الإجمالية لكل خيط DNA. يتم استخدام قارورة القائمة بواسطة الشظية لتطبيع التغطية عبر العينة. يشير الحقل الأول إلى المساحة المهمة ، بينما يشير الحقل الثاني إلى الموضع الذي توجد فيه الطفرة.
يشير N إلى أن بقية التسلسل لا يحتوي على أي طفرة. يعد تحليل التحكم الإيجابي أمرا أساسيا لزيادة الحساسية والخصوصية لتشغيل معين. هذا مهم لأنه على الأرجح لن يكون الحد الأولي للحد السلبي 1.301 كافيا للتخلص من جميع الإيجابيات الخاطئة.
سيظهر كل تحليل شظية القيمة P الفعلية لكل متغير يسمى ، والتي لا يمكن التنبؤ بها كأولوية. ومع ذلك ، يمكن تكرار التحليل بالكامل باستخدام أقل قيمة P صرامة معروضة في المخرجات الأولية للمراكز الأساسية الإيجابية الحقيقية المعروفة. سيعمل هذا على الاحتفاظ بجميع الإيجابيات الحقيقية مع استبعاد معظم الإيجابيات الخاطئة ، إن لم يكن كلها ، والتي عادة ما يكون لها قيم P أقل أهمية مقارنة بالإيجابيات الحقيقية.
لأتمتة هذه العملية ، يمكن استخدام البرنامج النصي لاختبار القطع. يتطلب البرنامج النصي لاختبار القطع ملف إخراج منشق وقائمة بنتائج التحكم الإيجابية في شكل ملف محدد بعلامات التبويب كملف يستخدم للتطبيع. سيكون الناتج الناتج عبارة عن قائمة بقطع القطع التي تصل تدريجيا إلى النهائي الأمثل.
يمثل السطر الأخير القطع الأمثل للتشغيل وبالتالي يمكن استخدامه لتحليل البيانات. والنتيجة المثلى هي تحقيق حساسية وخصوصية واحدة. ومع ذلك، إذا لم يتم التوصل إليه، يمكن تحسين تحليل الشظايا عن طريق تغيير عدد قواعد القراءة المدمجة.
يمكن تطبيق القطع النهائي على البيانات باستخدام البرنامج النصي للقطع ، والذي سيقوم بتصفية ملف إخراج الشظية من الزيارات الموجودة أسفل القطع الأمثل. ستقوم هذه الخطوة بإنشاء ملف إخراج الشظية النهائي ، والذي سيحتوي على قصاصات وأجزاء موجودة في العينة. يرجى ملاحظة أن مخرجات الإدخالات تختلف قليلا عن البدائل أو الحذف.
يتم تصور الدقة كدالة لتغطية أليل واحد في عينة مجمعة في هذا النوع من المؤامرة. تقدر الدقة على أنها المساحة الموجودة أسفل المنحنى تختصر UC لمنحنى مشغل جهاز الاستقبال وتتراوح من دقة عشوائية تبلغ 0.5 إلى دقة مثالية تبلغ 1.0. في هذا المثال ، يتم رسم UC كدالة للتغطية لكل أليل للكشف عن الأليلات الطافرة المفردة في تجمعات من 200 501 ، 000 أليل.
هنا يتم رسم UC كدالة للإجمالي للإدخالات والحذف والاستبدالات. يوضح مخطط الخطأ هذا احتمال دمج قاعدة خاطئة في موضع معين. يظهر ملف تعريف الخطأ معدلات خطأ منخفضة مع اتجاه متزايد نحو الطرف الرئيسي الثلاثة لقراءة التسلسل.
وبشكل ملحوظ ، تعرض النيوكليوتيدات المرجعية المختلفة احتمالات خطأ مختلفة. يكشف هذا المخطط عن دقة الشظية في تقدير تردد الأليل للمواضع التي تحتوي على تغطية أكبر من 25 ضعفا لكل أليل. مقارنة بين ترددات أليل الحمض النووي المجمعة المقدرة بالشظية مع عدد الأليل المقاس بواسطة دراسات الارتباط على نطاق الجينوم أو نتائج GWAS.
في ارتباط عال للغاية ، تم سحب عدد السكان البالغ عددهم 974 فردا واستهدافهم أكثر من 20 كيلو قاعدة للتسلسل. تم تطبيق Splinter للكشف عن المتغيرات النادرة. باتباع البروتوكول القياسي ، كان لكل فرد التنميط الجيني الذي تم إجراؤه سابقا بواسطة توافق gwas بين التنميط الجيني للمتغيرات الموسومة والجديدة.
تم استدعاؤها في العينة المجمعة كانت ممتازة. ثلاثة متغيرات ، اثنان منها نادران في السكان ، تم استدعاؤها denovo من نتائج التسلسل ، وتم التحقق من صحتها من خلال تسلسل pyro الفردي أو ترددات الأليل الطفيفة أو التوافق الرياضي بين تسلسل pyro والتسلسل المسحوب كان ممتازا. بمجرد الانتهاء من العثور على التباين النادر في عينتك المجمعة ، يرغب العديد من الأشخاص في معرفة العواقب الوظيفية للتباين الذي تم تحديده.
لذا يصبح التعليق التوضيحي للتباين الخاص بك هو الخطوة التالية في العملية بعد التطوير. مهدت هذه التقنية الطريق للباحثين في مجال تسلسل الحمض النووي لدراسة المتغيرات النادرة بطريقة سريعة وفعالة من حيث التكلفة لتوصيف المتغيرات النادرة في دراسات سكانية كبيرة. بعد مشاهدة هذا الفيديو ، يجب أن يكون لديك فهم جيد لكيفية اكتشاف متغيرات التسلسل النادرة في تجمع ، عينة الحمض النووي باستخدام الشظية.
تسلسل الحمض النووي المجمع هو طريقة فعالة لتحديد المتغيرات الجينية النادرة المرتبطة بالسمات المعقدة في المجتمعات الكبيرة. يوضح هذا المقال التحليل الحسابي لبيانات التسلسل المجمعة من 32 جينًا مرتبطًا بالسرطان باستخدام حزمة برامج SPLINTER.
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.