December 10th, 2012
تغيير وجهة نظرنا النظرية الافتراضية (BCP) خوارزمية يستند دولة من بين الفن النمذجة التقدم في التغيير عبر نقاط نماذج ماركوف المخفية ويطبقها على لونين مناعي التسلسل (ChIPseq) تحليل البيانات. BCP يؤدي جيدا في كل أنواع البيانات واسعة النطاق والمنقط، ولكن تتفوق في تحديد بدقة قوية والجزر استنساخه من تخصيب هيستون منتشر.
الهدف العام من التجربة التالية هو الاستفادة من كثافة مواضع القراءة المعينة من بيانات تسلسل الترسيب المناعي للكروماتين لتقدير متوسط كثافة القراءة الخلفية عبر الجينوم. يتم تحقيق ذلك عن طريق المعالجة المسبقة. يقرأ ChIP-seq المعين إلى ملفات تعريف كثافة محظورة مع نفس عدد القراءات التي تقع ضمن 200 صندوق غير متداخل للزوج الأساسي.
يتم دمج أي صناديق متجاورة بنفس الكثافة في كتلة أكبر كخطوة ثانية يتم حساب متوسط الكثافة الخلفية لكل كتلة بشكل متكرر في سياق جميع الكتل المحيطة باستخدام نموذج بايز مع مرشحات أمامية وخلفية. حيث يتم تصميم عدد القراءة للكتلة بتوزيع بواسون مع معلمة ثيتا تأخذ توزيعا مسبقا لجاما مع معلمات ألفا وبيتا. بعد ذلك ، يتم تقييم تقديرات متوسط الكثافة الخلفية لكل كتلة من حيث الأهمية بناء على ما إذا كانت تتجاوز الكمية 90 فيما يتعلق بكثافة خلفية التحكم في المدخلات أم لا ، من أجل توليد نتائج مقاطع الجينوم المخصبة النهائية التي توضح التقدم من القراءات المتسلسلة الخام إلى تقديرات كثافة القراءة المتوسطة الخلفية ، وأخيرا الجزر المخصبة على بيانات ChIP-seq أثناء تحليل BCP.
علاوة على ذلك ، تظهر النتائج أن BCP يتفوق على أداة المنافسة. الميزة الرئيسية لهذه التقنية على الأساليب الحالية مثل CER هي أن BCP استخدمت أحدث التطورات A في نماذج العلامات المخفية ، لذلك فهي تميز الفروق الدقيقة في تحليل بيانات chipsy بشكل أفضل من الطرق الإرشادية السابقة. يمكن أن تساعد هذه الطريقة في الأسئلة الرئيسية في مجال علم الجينوم ، مثل دور تعديلات الأنسجة عن طريق توصيف أنماط التخصيب على نطاق الجينوم الخاص بها.
على الرغم من أن طريقة المريض هذه يمكن أن توفر نظرة ثاقبة لتحليل بيانات ChIP-seq ، إلا أنه يمكن أيضا تطبيق الإطار الأساسي على تحليل بيانات تسلسل الجيل التالي الآخر ، مثل تحديد المناطق الميثيلية تفاضليا في بيانات تسلسل bis Sufi ، أو مواقع النسخ الجديدة في RNA-Seq ، أو تباين رقم النسخ أو أي عدد من بيانات تبليط المصفوفات الدقيقة. يعد العرض المرئي لهذه الطريقة أمرا بالغ الأهمية لفهم المنهجية بوضوح وأنه يفيد الأشياء. المزايا النظرية مخفية داخل البرنامج.
تم تجميع جميع الخطوات الإجرائية الموضحة هنا في ملف قابل للتنفيذ واحد في حزمة برامج BCP ، وهي متاحة للتنزيل في هذا الفيديو. يتم وصف الخطوات التي ينفذها البرنامج لتشغيل البرنامج. مطلوب ثلاث معلمات.
ملف يحتوي على قراءات معينة بشكل فريد من عينة شريحة وملف مشابه لقراءات التحكم في الإدخال، بالإضافة إلى اسم ملف الإخراج لإعداد ملفات الإدخال لتحليل BCP. أولا ، قم بمحاذاة القراءات القصيرة الناتجة عن تشغيل التسلسل مع الجينوم المرجعي المناسب باستخدام برنامج محاذاة القراءة القصيرة المفضل. يجب تحويل المواقع المعينة إلى بيانات قابلة للتوسيع في متصفح الأعمدة الستة أو تنسيق BED ، وهو خط محدد بعلامة التبويب لكل قراءة معينة يشير إلى موضع بدء الكروموسوم المعين ، وموضع النهاية ، واسم القراءة ، والنتيجة ، والخيوط.
قم بتوسيع مواقع الشريحة وخريطة الإدخال إلى طول جزء محدد مسبقا. على سبيل المثال ، حجم الشظية المستهدفة أثناء هضم الإنزيم أو صوتنة الحمض النووي ، عادة حوالي 200 زوج قاعدة. ثم يتم تجميع عدد الأجزاء في صناديق متجاورة.
بشكل افتراضي، يتم تعيين حجم الحاوية إلى طول الجزء المقدر ل 200 زوج أساسي. من المرجح أن تقع أي نقاط تغيير محتملة في مجموعة من الصناديق ذات العد المتطابق عند الحدود الخارجية. وفقا لذلك ، من غير المحتمل أن تحدث نقطة تغيير عند حدود داخلية بين صندوقين بنفس عدد القراءة.
لذلك، قم بتجميع الصناديق المجاورة ذات القراءات المتطابقة لكل حاوية في كتلة واحدة. بعد إعداد ملفات الإدخال ، استدعي تقدير BCP ببساطة عن طريق كتابة الأمر الموضح في أسفل الشاشة. يتم نمذجة كثافة القراءة لكل كتلة كتوزيع بواسون مع معلمة متوسطة ثيتا بعد مزيج من توزيعات جاما مع معلمات ألفا وبيتا واحتمال مسبق لحدوث نقطة تغيير في أي كتلة.
حدود P تكييف كل كتلة بهذه الطريقة يجعل بشكل فعال حالة لا نهائية مخفية نموذج ماركوف أو HMM. يتم تقدير المعلمات المفرطة ألفا وبيتا و P باستخدام أقصى احتمالية خلفية. يتم حساب تقديرات الخلجان بشكل صريح لكل كتلة ثيتا الفرعية T كتوقع لثيتا الفرعي T نظرا لسبب استبدال المرشحات الفرعية T الأكثر تقليدية ولكنها تستغرق وقتا طويلا والتي غالبا ما تستخدم في HMS بتقريب خليط التعقيد المحدود الأكثر كفاءة من الناحية الحسابية لتقدير الوسائل الخلفية theta hat الفرعية T. سيتم تنعيم الوسائل الخلفية الناتجة في ملف تعريف ثابت تقريبي للقطعة ، لذلك يجب حظر الكتل ذات القبعة الفرعية المتطابقة T مع إحداثيات الحدود المحدثة.
يستخدم BCP عدد قراءات الإدخال لكل كتلة كمعدل الخلفية ويحدد الإثراء. باستخدام اختبار فرضية بسيط يعتمد على ما إذا كان متوسط كثافة موضع الرقاقة للكتلة يتجاوز بعض عتبة الأهمية. الكمية 90 هي العتبة الافتراضية وهي مناسبة في معظم الحالات.
ثم يدمج BCP كتل متوسط الكثافة الخلفية المجاورة التي تتجاوز التخصيب في منطقة واحدة ويبلغ عن الإحداثيات المدمجة في المستعرض. يتفوق تنسيق البيانات القابل للتوسيع BCP في تحديد مناطق الإثراء الواسع في بيانات تعديل الهيستون. هنا. تتم مقارنة نتائج BCP بنتائج CSER ، وهي أداة موجودة أظهرت أداء قويا قبل العمل من هذا المختبر الذي يدرس ثلاثي ميثيل H three K 36 ميلا لحجم جزيرة أكبر بكثير في BCP من cer.
الجزر الأكبر أكثر انسجاما مع التوقعات التقليدية لجزر منتشرة واسعة من H three K 36 ثلاثي الميثيل. الجزر الأكبر لا تشير وحدها إلى الدقة. لذلك ، تم استخدام الارتباط المعروف ل H three K 36 Trimethylation Islands مع أجسام الجينات المنسوخة بنشاط بالإضافة إلى حصرها المتبادل مع H three K 27 Trimethylation Islands لتقييم أداء BCP و CER مقارنة ب CER BCP تسمى الجزر المتجاورة الأكبر التي تلتقط أجسام الجينات بشكل أفضل دون التضحية بالتداخل المتزايد مع H three K 27 ، جزر ثلاثي الميثيل.
يحافظ BCP على التداخل العالي للجينات النشطة بواسطة H three K 36 Trimethylation Islands مع حدود تتماشى بشكل وثيق مع أجسام الجينات دون زيادة درجة التداخل الإيجابي الخاطئ مع جينات الفضاء بين الجينات مع النسخ المكبوت أو العلامة القمعية H three K 27 TRIMETHYLATION أثناء تقييم قابلية استنساخ استدعاءات جزيرة BCP في مجموعتين من البيانات المكررة ، ولوحظ أن استمرارية استمرارية الأعمال لم تعاني من اعتماد كبير على عمق تغطية القصب في الخوارزمية المنافسة لمراقبة الانبعاثات المعتمدة على متانة وقابلية استنساخ استمرارية الأعمال من خلال فحص مناطق متميزة إضافية، مما يدل على اتساق حدود الجزيرة على الرغم من انخفاض عمق التغطية. لإثبات تعدد استخدامات BCP بشكل كامل ، تم الحصول على مجموعة واسعة من بيانات تعديل الهيستون ، بما في ذلك علامات النقط H ثلاثة K 27 الأستلة ، و H ثلاثة K تسعة أستلة ، و H ثلاثة K أربعة ثلاثي الميثيل ، والعلامة المنتشرة H ثلاثة K تسعة ثلاثي الميثيل بالإضافة إلى H ثلاثة K 27 ثلاثي الميثيل و H ثلاثة K 36 ثلاثي الميثيل. تم تحليل مجموعات البيانات هذه باستخدام إعدادات المعلمات الافتراضية لكل من BCP و CSER.
في المركز يقع H three K 36 trimethylation enrichation في جين PX DN الذي يشير إلى النسخ النشط الذي يسقط بشكل متوقع في موقع بدء النسخ هي العلامات النشطة الإضافية H ثلاثة K 27 الأستلة ، H ثلاثة K تسعة الأستلات ، و H ثلاثة K أربعة ثلاثي الميثيل. في اتجاه مجرى PXDN فقط ، يتم قمع مساحة بين الجينات ، والتي تتميز بتخصيب ثلاثي الميثيل H three K 27 على الجانب الآخر ، يوجد جين مكبوت H three K 27 TRIMETHYLATION. التحرك خطوة أخرى للخارج.
الكروماتين الصامت لدينا كما يتضح من وجود H ثلاثة K تسعة تخصيب ثلاثي الميثيل ، والذي يبدو أنه يشير إلى إسكات SN TG اثنين و MYT واحد L ، ربما بمعنى أقل عابرة من قمع H three K 27 ثلاثي الميثيل. تشمل هذه المنطقة غالبية الظواهر التي تمت مواجهتها في Chipseek لتعديلات هيستون. يوضح كيف يمكن للطبيعة الديناميكية ل BCP تحديد كل من الأستلة المنقطة و H three K أربع علامات ثلاثية الميثيل ، بينما يميز في نفس الوقت الجزر الكبيرة المتجاورة من H ثلاثة K 27 ثلاثي الميثيل و H ثلاثة K تسعة قمع ثلاثي الميثيل ، بالإضافة إلى H ثلاثة K 36 النسخ النشط ثلاثي الميثيل.
يمكن إجراء هذه الخوارزمية لمدة 30 دقيقة تقريبا اعتمادا على عدد القراءات ونتيجة علامات الجينوم. أي تحسين كبير كما هو مطلوب غالبا مع طرق أخرى باتباع هذا الإجراء. يمكن دراسة العديد من البروتينات المستهدفة المختلفة للترسيب المناعي للكروماتين باستخدام BBCP بما في ذلك العديد من التعديلات الأخرى على hisone بالإضافة إلى عوامل نسخ ربط الحمض النووي للإجابة على أسئلة إضافية حول آليات الجينوم اللاجيني وتنظيم الجينات.
بعد مشاهدة هذا الفيديو ، يجب أن يكون لديك فهم جيد لكيفية استخدام BCP لتحديد المناطق في متناول العلامات المنتشرة في تحليل بيانات chipsy.
View the full transcript and gain access to thousands of scientific videos
تقدم هذه الدراسة خوارزمية Bayesian Change Point (BCP) التي تعزز تحليل تسلسل المناعة الكروماتين (ChIP-seq). من خلال استخدام نماذج Hidden Markov، يحدد BCP بفعالية مناطق إثراء الهستون في كل من أنواع البيانات العريضة والمنقطة.
The Bayesian Change Point (BCP) algorithm provides a unified, parameter-light approach to identifying enriched genomic regions across diverse ChIP-seq data types, from punctate transcription factor binding to diffuse histone modification islands. By reducing reliance on heuristic thresholds and model switching, BCP enhances reproducibility and cross-lab comparability in epigenomic target validation. This supports mechanistic de-risking in early discovery by delivering statistically grounded, quantitative read density profiles that inform target confidence and pathway analysis.
The BCP algorithm fits into the discovery continuum from raw sequencing data to biological insight, supporting hypothesis-driven target validation, reproducible epigenomic profiling, and data integration across early screening and preclinical validation stages.