مقالة منهجية

التحليل التمهيدي والتحقق من صحة بيانات تسلسل CUT &RUN

DOI:

10.3791/67359

ديسمبر 13, 2024

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يوجه هذا البروتوكول المبتدئين في المعلوماتية الحيوية من خلال خط أنابيب تحليل CUT &RUN التمهيدي الذي يمكن المستخدمين من إكمال التحليل الأولي والتحقق من صحة بيانات تسلسل CUT&RUN. سيسمح إكمال خطوات التحليل الموضحة هنا ، جنبا إلى جنب مع التعليق التوضيحي للذروة النهائية ، للمستخدمين باستخلاص رؤى ميكانيكية لتنظيم الكروماتين.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تسهل تقنية CUT & RUN الكشف عن تفاعلات البروتين والحمض النووي عبر الجينوم. تشمل التطبيقات النموذجية ل CUT & RUN تغييرات التنميط في تعديلات ذيل الهيستون أو رسم خرائط شغل كروماتين عامل النسخ. إن الاعتماد الواسع النطاق ل CUT & RUN مدفوع جزئيا بالمزايا التقنية مقارنة ب ChIP-seq التقليدية التي تشمل متطلبات إدخال الخلايا المنخفضة ، ومتطلبات عمق التسلسل المنخفضة ، وزيادة الحساسية مع إشارة الخلفية المنخفضة بسبب نقص عوامل الربط المتقاطع التي تخفي حواتم الأجسام المضادة. كما تم تحقيق اعتماد CUT & RUN على نطاق واسع من خلال المشاركة السخية للكواشف من قبل مختبر Henikoff وتطوير مجموعات تجارية لتسريع اعتماد المبتدئين. مع زيادة الاعتماد الفني ل CUT &RUN ، يصبح تحليل تسلسل CUT &RUN والتحقق من صحته اختناقات حاسمة يجب التغلب عليها لتمكين التبني الكامل من قبل فرق المختبر الرطبة في الغالب. يبدأ تحليل CUT &RUN عادة بفحوصات مراقبة الجودة على قراءات التسلسل الخام لتقييم عمق التسلسل وجودة القراءة والتحيزات المحتملة. ثم تتم محاذاة القراءات مع مجموعة تسلسل الجينوم المرجعي ، ويتم استخدام العديد من أدوات المعلوماتية الحيوية لاحقا للتعليق على المناطق الجينومية لإثراء البروتين ، وتأكيد قابلية تفسير البيانات ، واستخلاص استنتاجات بيولوجية. على الرغم من تطوير العديد من خطوط أنابيب تحليل السيليكو لدعم تحليل بيانات CUT & RUN ، إلا أن هيكلها المعقد متعدد الوحدات واستخدام لغات برمجة متعددة يجعل الأنظمة الأساسية صعبة على مبتدئي المعلوماتية الحيوية الذين قد يفتقرون إلى الإلمام بلغات برمجة متعددة ولكنهم يرغبون في فهم إجراء تحليل CUT & RUN وتخصيص خطوط أنابيب التحليل الخاصة بهم. هنا ، نقدم بروتوكول خط أنابيب تحليل CUT &RUN خطوة بخطوة بلغة واحدة مصمم للمستخدمين الذين لديهم أي مستوى من الخبرة في المعلوماتية الحيوية. يتضمن هذا البروتوكول إكمال فحوصات الجودة الهامة للتحقق من أن بيانات التسلسل مناسبة للتفسير البيولوجي. نتوقع أن يسمح اتباع البروتوكول التمهيدي المقدم في هذه المقالة جنبا إلى جنب مع التعليق التوضيحي لذروة المصب للمستخدمين باستخلاص رؤى بيولوجية من مجموعات بيانات CUT &RUN الخاصة بهم.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تعد القدرة على قياس التفاعلات بين البروتينات والحمض النووي الجيني أمرا أساسيا لفهم بيولوجيا تنظيم الكروماتين. توفر المقايسات الفعالة التي تقيس احتلال الكروماتين لبروتين معين قطعتين رئيسيتين على الأقل من المعلومات: أنا) التوطين الجيني و ب) وفرة البروتين في منطقة جينومية معينة. يمكن أن يكشف تتبع تغييرات التوظيف والتوطين لبروتين ذي أهمية في الكروماتين عن المواقع المستهدفة المباشرة للبروتين ويكشف عن الأدوار الميكانيكية لهذا البروتين في العمليات البيولوجية القائمة على الكروماتين مثل تنظيم النسخ أو إصلاح الحمض النووي أو تكرار الحمض النووي. تمكن التقنيات المتاحة اليوم لتمييز تفاعلات البروتين والحمض النووي الباحثين من استكشاف التنظيم بدقة غير مسبوقة. تم تمكين مثل هذه التطورات التقنية من خلال إدخال تقنيات جديدة لتوصيف الكروماتين والتي تشمل تطوير الانقسام تحت الأهداف والإفراج باستخدام Nuclease (CUT & RUN) من قبل مختبر Henikoff. تقدم CUT & RUN العديد من المزايا التقنية مقارنة بالترسيب المناعي التقليدي للكروماتين (ChIP) والتي تشمل متطلبات إدخال الخلايا المنخفضة ، ومتطلبات عمق التسلسل المنخفضة ، وزيادة الحساسية مع إشارة الخلفية المنخفضة بسبب نقص عوامل الربط المتقاطع التي تخفي حواتم الأجسام المضادة. يتطلب اعتماد هذه التقنية لدراسة تنظيم الكروماتين فهما شاملا للمبدأ الكامن وراء هذه التقنية ، وفهما لكيفية تحليل بيانات CUT &RUN والتحقق من صحتها وتفسيرها.

يبدأ إجراء CUT & RUN بربط الخلايا ب Concanavalin A المترافق مع الخرز المغناطيسي لتمكين التلاعب بأعداد الخلايا المنخفضة طوال الإجراء. يتم نفاذية الخلايا المعزولة باستخدام منظف معتدل لتسهيل إدخال الجسم المضاد الذي يستهدف البروتين محل الاهتمام. ثم يتم تجنيد نوكلياز المكورات الدقيقة (MNase) في الجسم المضاد المرتبط باستخدام علامة البروتين A أو البروتين A / G المربوطة بالإنزيم. يتم إدخال الكالسيوم لبدء النشاط الأنزيمي. ينتج عن هضم MNase مجمعات بروتين الحمض النووي أحادية النواة. يتم بعد ذلك مخلب الكالسيوم لإنهاء تفاعل الهضم ، ويتم إطلاق شظايا الحمض النووي القصيرة من هضم MNase من النوى ، ثم تخضع لتنقية الحمض النووي ، وإعداد المكتبة ، وتسلسل عاليالإنتاجية 1 (الشكل 1).

في السيليكو ، تطورت مناهج رسم خريطة وقياس إشغال البروتين عبر الجينوم بالتوازي مع مناهج المختبر الرطب المستخدمة لإثراء تفاعلات الحمض النووي والبروتين. يعد تحديد مناطق الإشارات المخصبة (القمم) أحد أهم الخطوات في تحليل المعلوماتية الحيوية. استخدمت طرق تحليل ChIP-seq الأولية خوارزميات مثل MACS2 و SICER3 ، والتي استخدمت نماذج إحصائية لتمييز مواقع ربط البروتين والحمض النووي حسن النية عن ضوضاء الخلفية. ومع ذلك ، فإن ضوضاء الخلفية المنخفضة والدقة العالية لبيانات CUT &RUN تجعل بعض برامج استدعاء الذروة المستخدمة في تحليل ChIP-seq غير مناسبة لتحليل CUT &RUN4. يسلط هذا التحدي الضوء على الحاجة إلى أدوات جديدة أكثر ملاءمة لتحليل بيانات CUT &RUN. يمثل SEACR4 إحدى هذه الأدوات التي تم تطويرها مؤخرا لتمكين ذروة الاتصال من بيانات CUT & RUN مع التغلب على القيود المرتبطة بالأدوات المستخدمة عادة في تحليل ChIP-seq.

يتم استخلاص التفسيرات البيولوجية من بيانات تسلسل CUT & RUN من المخرجات النهائية لاستدعاء الذروة في خط أنابيب التحليل. يمكن تنفيذ العديد من برامج التعليقات التوضيحية الوظيفية للتنبؤ بالأهمية البيولوجية المحتملة للقمم المسماة من بيانات CUT & RUN. على سبيل المثال ، يوفر مشروع علم الوجود الجيني (GO) تحديدا وظيفيا راسخا للجينات ذات الأهمية5،6،7. تسهل أدوات وموارد البرامج المختلفة تحليل GO للكشف عن الجينات ومجموعات الجينات المخصبة بين قمم CUT &RUN8،9،10،11،12،13،14. علاوة على ذلك ، تتيح برامج التصور مثل Deeptools15 و Integrative genomics viewer (IGV) 16 و UCSC Genome Browser17 تصور توزيع الإشارات والأنماط في مناطق الاهتمام عبر الجينوم.

تعتمد القدرة على استخلاص التفسيرات البيولوجية من بيانات CUT &RUN بشكل حاسم على التحقق من جودة البيانات. تشمل المكونات الهامة التي يجب التحقق من صحتها تقييم: أ) جودة تسلسل مكتبة CUT &RUN ، ب) تكرار التشابه ، و ج) توزيع الإشارات في مراكز الذروة. يعد استكمال التحقق من صحة المكونات الثلاثة أمرا بالغ الأهمية لضمان موثوقية عينات مكتبة CUT &RUN ونتائج التحليل النهائي. لذلك ، من الضروري إنشاء أدلة تحليل CUT &RUN تمهيدية لتمكين المبتدئين في المعلوماتية الحيوية والباحثين في المختبرات الرطبة من إجراء خطوات التحقق من الصحة هذه كجزء من خطوط أنابيب تحليل CUT &RUN القياسية.

إلى جانب تطوير تجربة CUT &RUN في المختبر الرطب ، تم تطوير العديد من خطوط أنابيب تحليل CUT &RUN في السيليكو ، مثل CUT & RUNTools 2.018،19 و nf-core / cutandrun20 و CnRAP21 ، لدعم تحليل بيانات CUT &RUN. توفر هذه الأدوات طرقا قوية لتحليل مجموعات بيانات CUT &RUN و CUT & Tag أحادية الخلية والجمعية. ومع ذلك ، فإن هيكل البرنامج المعياري المعقد نسبيا والإلمام المطلوب بلغات البرمجة المتعددة لإجراء خطوط أنابيب التحليل هذه قد يعيق اعتماد المبتدئين في المعلوماتية الحيوية الذين يسعون إلى فهم خطوات تحليل CUT &RUN بدقة وتخصيص خطوط الأنابيب الخاصة بهم. يتطلب التحايل على هذا الحاجز خط أنابيب تحليل CUT &RUN تمهيديا جديدا يتم توفيره في نصوص بسيطة خطوة بخطوة مشفرة باستخدام لغة برمجة واحدة بسيطة.

في هذه المقالة ، نصف بروتوكول خط أنابيب تحليل CUT &RUN بسيط أحادي اللغة يوفر نصوصا نصية خطوة بخطوة مدعومة بأوصاف مفصلة لتمكين المستخدمين الجدد والمبتدئين من إجراء تحليل تسلسل CUT&RUN. البرامج المستخدمة في هذا المسار متاحة للجمهور من قبل مجموعات المطورين الأصلية. تشمل الخطوات الرئيسية الموضحة في هذا البروتوكول محاذاة القراءة ، واستدعاء الذروة ، والتحليل الوظيفي ، والأهم من ذلك ، خطوات التحقق من الصحة لتقييم جودة العينة لتحديد مدى ملاءمة البيانات وموثوقيتها للتفسير البيولوجي (الشكل 2). علاوة على ذلك ، يوفر خط الأنابيب هذا للمستخدمين الفرصة للإشارة إلى نتائج التحليل مقابل مجموعات بيانات CUT &RUN المتاحة للجمهور. في النهاية ، يعمل بروتوكول خط أنابيب التحليل CUT &RUN هذا كدليل تمهيدي ومرجع للمبتدئين في تحليل المعلوماتية الحيوية والباحثين في المختبرات الرطبة.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ملاحظة: تتوفر معلومات عن ملفات CUT&RUN fastq في GSE126612 في الجدول 1. وترد المعلومات المتعلقة بتطبيقات البرمجيات المستخدمة في هذه الدراسة في جدول المواد.

1. تنزيل خط أنابيب Easy-Shells_CUTnRUN من صفحة Github الخاصة به

  1. افتح المحطة من نظام التشغيل.
    ملاحظة: إذا لم يكن المستخدم متأكدا من كيفية فتح الجهاز الطرفي في macOS و Windows ، فراجع صفحة الويب هذه (https://discovery.cs.illinois.edu/guides/System-Setup/terminal/). بالنسبة لنظام التشغيل Linux ، راجع صفحة الويب هذه (https://www.geeksforgeeks.org/how-to-open-terminal-in-linux/).
  2. قم بتنزيل مسار التحليل المضغوط من Github عن طريق كتابة wget https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/archive/refs/heads/main.zip -O ~ / Desktop / Easy-Shells_CUTnRUN.zip في المحطة الطرفية.
  3. بعد تنزيل الملف المضغوط ، قم بفك ضغط الملف المضغوط الذي تم تنزيله عن طريق كتابة فك الضغط ~ / Desktop / Easy-Shells_CUTnRUN.zip -d ~ / Desktop / في الجهاز الطرفي.
  4. بعد فك الضغط ، احذف الملف المضغوط عن طريق كتابة rm ~ / Desktop / Easy-Shells_CUTnRUN.zip في الجهاز وقم بتغيير اسم المجلد عن طريق كتابة mv ~ / Desktop / Easy-Shells_CUTnRUN-master ~ / Desktop / Easy-Shells_CUTnRUN.
  5. بعد إزالة الملف المضغوط ، اكتب chmod + x ~ / Desktop / Easy-Shells_CUTnRUN / script / * .sh في الجهاز لتعيين الإذن القابل للتنفيذ لجميع البرامج النصية shell داخل دليل العمل. من الآن فصاعدا ، ما عليك سوى كتابة المسار واسم البرامج النصية shell هذه في المحطة الطرفية أو سحب البرامج النصية إلى المحطة الطرفية والدخول لتشغيل البرامج النصية shell هذه في المحطة الطرفية.
    ملاحظة: عادة ما يتم تثبيت Bash shell مسبقا على معظم توزيعات Linux. ومع ذلك، لم تعد إصدارات macOS الحديثة توفر Bash shell المثبت مسبقا. إذا لم يكن النظام يحتوي على Bash ، فقم بتثبيت Bash shell أولا. قم بزيارة الروابط أدناه للحصول على إرشادات تصف كيفية تثبيت Bash shell في نظام التشغيل Linux (https://ioflood.com/blog/install-bash-shell-linux/) و macOS (https://www.cs.cornell.edu/courses/cs2043/2024sp/styled-3/#:~:text=The first thing you will,you will see the following:). تتم كتابة هذه البرامج النصية خطوة بخطوة لإنشاء مجلد واحد ~ / Desktop / GSE126612 لإجراء معظم تحليل CUT &RUN هذا داخل هذا الدليل دون الحاجة إلى التعديل. إذا كان المستخدم يفهم كيفية استخدام البرامج النصية shell هذه ، فيمكن للمستخدمين مراجعة وتخصيص البرامج النصية shell هذه لتحليل مجموعات بيانات CUT &RUN الأخرى وتعديل الخيارات وفقا للاحتياجات الخاصة بالمشروع. لقراءة البرامج النصية shell هذه وتحريرها، ضع في اعتبارك استخدام Visual studio Code (https://code.visualstudio.com/) كخيار واحد لبرنامج سهل الاستخدام متوفر لأنظمة التشغيل الرئيسية.

2. تثبيت البرامج المطلوبة ل Easy Shells CUTnRUN

  1. من بين البرامج النصية shell التي تحمل اسم Script_01_installation_***.sh ، اكتشف البرنامج النصي shell الذي يتضمن الاسم نوع نظام التشغيل لنظام المستخدم. حاليا ، يدعم Easy Shells CUTnRUN البرنامج النصي للتثبيت للأنظمة المستندة إلى macOS و Debian / Ubuntu و CentOS / RPM .
  2. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  3. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  4. في الجهاز الطرفي ، قم بتشغيل البرنامج النصي لغلاف التثبيت عن طريق كتابة ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_01_installation_*** .sh أو اسحب ملف البرنامج النصي shell إلى الجهاز الطرفي وأدخله.
  5. اقرأ ملف Test_README.md في مجلد /path/to/SEACR-1.3/Testfiles. اتبع التعليمات الموجودة داخل ملف README لتوضيح ما إذا كان SEACR في نظام المستخدم يعمل بشكل صحيح.
    ملاحظة: من الأهمية بمكان التحقق من صحة وظيفة SEACR باستخدام ملفات الاختبار التي تقدمها صفحة SEACR Github للحصول على نتائج استدعاء الذروة المناسبة من بيانات CUT & RUN. لذلك ، اتبع تعليمات Test_README.md في /path/to/SEACR-1.3/Testfiles مباشرة بعد تثبيت SEACR. على الرغم من أن Easy Shells يوفر CUTnRUN برامج نصية لهيكل التثبيت لبعض أنظمة التشغيل ، إلا أن هذه البرامج النصية قد لا تعمل في نظام بعض المستخدمين لتثبيت جميع البرامج المطلوبة ل Easy Shells CUTnRUN. إذا كانت هناك أي مشكلة في التثبيت، فراجع موقع الويب الأصلي للبرنامج الذي تم إلغاء تثبيته، أو اطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).

3. تنزيل مجموعة بيانات CUT &RUN المتاحة للجمهور من Sequence Read Archive (SRA)

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_02_download-fastq.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: سيقوم هذا البرنامج النصي بما يلي: (i) إنشاء مجلد واحد (~ / Desktop / GSE126612 / fastq) وتنزيل قائمة بملفات SRA المكتوبة في ملف نصي (~ / Desktop / Easy-Shells_CUTnRUN / sample_info / SRR_list.txt) داخل مجلد fastq. على سبيل المثال ، يتضمن SRR_list.txt ملفات fastq لمجموعة فرعية من عينات GSE126612 CUT &RUN. (ii) قم بتنزيل ملفات fastq الأولية داخل مجلد fastq. (iii) قم بإنشاء مجلد واحد (~/Desktop/GSE126612/log/fastq) وقم بتدوين ملف سجل (download-fastq_log.txt) وملف معلومات عينة تم تنزيله (SRR_list_info.txt) داخل مجلد السجل هذا.
  4. بعد تشغيل البرنامج النصي ، تحقق من ملف السجل. إذا كانت هناك أي رسالة خطأ داخل ملف السجل، فقم بإصلاح الخطأ وحاول الخطوة 3.3 مرة أخرى. إذا كانت هناك أي مشكلة لحل المشكلة ، فاطلب المساعدة في صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: لتسهيل ممارسة خط أنابيب تحليل CUT &RUN هذا ، يتم استرداد العينات التالية المتاحة للجمهور من SRA: عينة واحدة من التحكم الوهمي (IgG) ، وثلاث عينات من بنية الكروماتين وبروتين عامل النسخ (CTCF) ، وأربع عينات تتوافق مع علامة هيستون "نشطة" (H3K27Ac) ، وثلاث عينات تتوافق مع مناطق بدء النسخ التي تميز ببوليميراز الحمض النووي الريبي II (RNAPII-S5P). تم إجراء التسلسل كنهاية مزدوجة ، لذلك يتم إقران ملفين لكل عينة.

4. فحص الجودة الأولي لملفات التسلسل الخام

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_03_fastQC.sh في الجهاز الطرفي أو اسحب البرنامج النصي shell إلى الجهاز الطرفي وأدخله.
    ملاحظة: سيقوم البرنامج النصي shell هذا: (i) بتشغيل برنامج FastQC لجميع ملفات fastq الأولية في المجلد ~/Desktop/GSE126612/fastq وحفظ ملفات تقرير التحقق من الجودة في المجلد ~/Desktop/GSE126612/fastqc.1st . (ii) اكتب ملف سجل (fastqc.1st.log.SRR-number.txt) لكل تشغيل FastQC في مجلد سجل (~/Desktop/GSE126612/log/fastqc.1st).
  4. بعد الانتهاء من تشغيل البرنامج النصي shell ، راجع ملف السجل لتوضيح نجاح التشغيل. إذا كانت هناك أي رسالة خطأ داخل ملف السجل، فقم بتصحيح الخطأ وكرر الخطوة 4.3. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: من بين ملفات الإخراج ، تتضمن ملفات fastqc.html نتائج فحص جودة سهلة الاستخدام. إذا كانت هناك مشكلة (مشكلات) شديدة في الجودة ، فناقش مع زملائه في المعلوماتية الحيوية لتحديد مدى ملاءمة البيانات لتحليل المصب. يتم استخدام تقارير مراقبة الجودة المماثلة لتأكيد جودة البيانات المحسنة بعد تشذيب المحول. لاستخدام هذا البرنامج النصي لمجموعات البيانات الأخرى، قم بتحرير مسار دلائل العمل والإخراج لتلبية احتياجات المستخدم. يتمثل الاختلاف الملحوظ عند تفسير مراقبة الجودة ل CUT &RUN مقارنة بقراءات ChIP-seq في أن القراءات المكررة في CUT & RUN لا تشير بالضرورة إلى تكرارات PCR. وذلك لأن MNase المجند سوف يهضم في نفس المواقع أو مواقع مماثلة داخل المجموعات التجريبية.

5. تشذيب الجودة والمحول لملفات التسلسل الخام

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_04_trimming.sh في الجهاز الطرفي أو اسحب البرنامج النصي Script_04_trimming.sh إلى الجهاز وأدخله.
    ملاحظة: سيقوم البرنامج النصي shell هذا: (i) بتشغيل برنامج Trim-Galore لجميع ملفات fastq الأولية في ~/Desktop/GSE126612/fastq لإجراء تشذيب المحول والجودة. (ii) قم بإنشاء مجلد واحد (~ / سطح المكتب / GSE126612 / trimmed) واحفظ ملفات إخراج Trim-Galore داخل المجلد المقتطع. (iii) قم بإنشاء مجلد سجل واحد (~/Desktop/GSE126612/log/trim_galore) وقم بتدوين ملف سجل trim_galore_log_RSS-number.txt لكل تشغيل Trim-Abundant.
  4. بعد الانتهاء من التشغيل، راجع ملف السجل بعناية. إذا كانت هناك أي رسالة خطأ داخل ملف السجل، فقم بتصحيح الخطأ وكرر الخطوة 5.3. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
  5. بعد الانتهاء من هذه العملية ، قارن ملفات الإخراج .html بملفات fastqc.html التي تم إنشاؤها في 4.3. قم بمراجعة مسار دلائل الإدخال والإخراج لتنفيذ خطوة التشذيب لأي ملفات fastq موجودة في مكان آخر.

6. تنزيل فهرس bowtie2 للجينومات المرجعية لعينات التحكم الفعلية والمرتفعة

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_05_bowtie2-index.sh في الجهاز الطرفي أو اسحب البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: سيقوم هذا البرنامج النصي بما يلي: (أنا) تنزيل فهارس Bowtie2 للجينومات المرجعية الفعلية للعينة (الإنسان ؛ hg19 ؛ المستخدمة في المنشور الأصلي22) والجينومات المرجعية للتحكم في Spike-in (الخميرة الناشئة. R64-1-1) في مجلد فهرس bowtie2 (~ / سطح المكتب / سهل Shells_CUTnRUN / bowtie2-index). (iii) اكتب ملف سجل (bowtie2-index-log.txt) في دليل سجل (~ / Desktop / GSE126612 / log / bowtie2-index).
  4. بعد الانتهاء من التشغيل، تحقق من ملف السجل. إذا كانت هناك أي رسالة خطأ، فقم بتصحيح الخطأ وكرر الخطوة 6.3. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: حاليا ، يتم توفير فهارس Bowtie2 لجينومات مرجعية مختلفة في موقع Bowtie2 (https://bowtie-bio.sourceforge.net/bowtie2/manual.shtml). يمكن للمستخدمين تحرير Script_05_bowtie2-index.sh لتنزيل أي فهرس Bowtie2 لتلبية متطلبات المستخدم. إذا لم يتمكن المستخدم من تحديد موقع فهرس Bowtie2 للجينوم المرجعي محل الاهتمام ، فحدد موقع تسلسل الجينوم المرجعي ملفات fasta من:
    1. فرقة ftp (https://ftp.ensembl.org/pub/current_fasta/)
    2. صفحة الويب الخاصة بجامعة كاليفورنيا (https://hgdownload.soe.ucsc.edu/downloads.html)
    3. أو قواعد بيانات أخرى خاصة بالأنواع.
      بعد تحديد موقع تسلسل الجينوم المرجعي ملفات fasta ، قم بإنشاء فهرس Bowtie2 للجينوم المرجعي الذي تم تنزيله باتباع قسم "مفهرس بناء bowtie2" (https://bowtie-bio.sourceforge.net/bowtie2/manual.shtml#the-bowtie2-build-indexer) من موقع Bowtie2 على الويب.

7. رسم خرائط القراءة المشذبة لتسلسل CUT & RUN إلى الجينومات المرجعية

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_06_bowtie2-mapping.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: سيقوم البرنامج النصي shell هذا: (1) بتشغيل برنامج bowtie2 لتعيين جميع ملفات المحول وملفات fastq المشذبة بالجودة لكل من التحكم التجريبي (البشري ؛ hg19) والتحكم في الارتفاع (الخميرة الناشئة. R64-1-1) الجينومات المرجعية بشكل مستقل. (ii) قم بتشغيل وظيفة عرض samtools لضغط ملفات أزواج القراءة المعينة بتنسيق BAM. (ثالثا) قم بإنشاء مجلد واحد (~ / سطح المكتب / GSE126612 / bowtie2-mapped) واحفظ ملف أزواج القراءة المضغوطة المعينة داخل المجلد المعين bowtie2. (رابعا) قم بإنشاء مجلد واحد (~ / Desktop / GSE126612 / log / bowtie2-mapped) واكتب سجل عملية التعيين كملف نصي bowtie2_log_hg19_SRR-number.txt لأزواج القراءة المعينة على الجينوم المرجعي hg19 و bowtie2_log_R64-1-1_SRR-number.txt لأزواج القراءة المعينة على R64-1-1) للإشارة إلى كفاءة رسم الخرائط داخل مجلد سجل رسم الخرائط bowtie2.
  4. بعد الانتهاء من التشغيل، تحقق من ملف السجل. إذا كانت هناك أي رسالة خطأ داخل ملف السجل ، فقم بتصحيح الخطأ وتشغيل البرنامج النصي shell مرة أخرى. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: يقوم البرنامج النصي shell هذا بتشغيل bowtie2 مع خيارات لتعيين ملفات التسلسل المزدوجة للعثور على أزواج قراءة معينة بشكل متسق بأطوال أجزاء 10 نقطة أساس - 700 نقطة أساس. اكتشف أوصاف الخيارات عن طريق كتابة ربطة العنق 2 - المساعدة في المحطة أو من خلال زيارة موقع ربطة العنق 2 (https://bowtie-bio.sourceforge.net/bowtie2/manual.shtml#the-bowtie2-aligner) لفهم الخيارات وتغييرها حسب الحاجة. استخدم البرنامج النصي shell هذا لتعيين أي ملفات fastq أخرى عن طريق تغيير تنسيق المسار والاسم لملفات fastq وفهارس Bowtie2.

8. فرز وتصفية ملفات أزواج القراءة المعينة

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم يكن الغلاف الافتراضي هو Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة "chsh -s $(which bash)" في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_07_filter-sort-bam.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: سيقوم هذا البرنامج النصي بما يلي: (i) تشغيل وظيفة عرض samtools لجميع ملفات زوج القراءة المعينة المضغوطة في مجلد ~/Desktop/GSE126612/bowtie2-mappped لتصفية أزواج القراءة المعينة في مناطق الكروموسوم غير الأساسية والقائمة السوداء المشروحة علنا ومناطق تكرار TA. (ii) قم بتنفيذ وظيفة فرز samtools لفرز ملفات bam التي تمت تصفيتها حسب أسماء الأجزاء أو الإحداثيات داخل نفس الدليل. (iii) اكتب ملف سجل لكل ملف إدخال bam في دليل ~ / Desktop / GSE126612 / log / filter-sort-bam .
  4. بعد الانتهاء من التشغيل، راجع ملفات السجل بعناية. إذا كانت هناك أي رسالة خطأ في ملفات السجل ، فقم بتصحيح الخطأ وحاول تشغيل البرنامج النصي shell مرة أخرى. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: ستعمل ملفات bam الناتجة (الإخراج) التي تم فرزها حسب أسماء الأجزاء كملفات إدخال لإنشاء ملفات BED وملفات bedGraph لعدد القراءات الخام. ستعمل ملفات bam التي تم فرزها حسب الإحداثيات كملفات إدخال لإنشاء ملفات BEDPE مجزأة. سيتم استخدام جميع BED و bedGraph و BEDPE لاستدعاء الذروة والتصور في التحليل النهائي. توجد جميع ملفات سرير التعليقات التوضيحية لمناطق الكروموسوم المتعارف عليها (chr1 ~ 22 و chrX و chrY و chrM) ومناطق القائمة السوداء المشروحةعلنا 23 ومناطق تكرار TA18 في دليل ~ / Desktop / Easy-Shells_CUTnRUN / blacklist . إذا لزم الأمر، استخدم هذا الدليل لإضافة ملفات إضافية في القائمة السوداء. استخدم هذا البرنامج النصي shell لأداء نفس الوظائف لأزواج القراءة الأخرى المعينة وملفات bam عن طريق تغيير المسار واسم ملفات bam. اكتب samtools view --help و samtools sort --help في terminal لمزيد من الوصف حول هذه الوظائف.

9. تحويل أزواج القراءة المعينة إلى أجزاء ملفات bedpe و BED و readcounts bedGraph

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_08_bam-to-BEDPE-BED-bedGraph.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: سيقوم هذا البرنامج النصي بما يلي: (i) تشغيل macs3 filterdup ووظيفة awk لتحويل ملفات bam التي تم فرزها حسب الإحداثيات لتقطيع ملفات BEDPE التي تكون أطوال الأجزاء منها أقصر من 1 كيلو بايت ، وحفظ ملفات BEDPE في ~ / Desktop / GSE126612 / BEDPE. (ii) إنشاء دليل سجل (~/Desktop/GSE126612/log/bam-to-BEDPE) وكتابة ملف سجل لكل ملف أجزاء يقرأ معين. (ثالثا) قم بتشغيل وظائف bedtools bamtobed و awk و cut و sort لتحويل ملفات bam التي تم فرزها حسب أسماء الأجزاء إلى تجزئة ملفات BED التي تكون أطوال الأجزاء منها أقصر من 1 كيلو بايت. (رابعا) قم بإنشاء مجلد واحد (~ / سطح المكتب / GSE126612 / bam إلى السرير) وحفظ ملفات BED المجزأة داخل مجلد bam-to-bed. (v) اكتب ملف سجل لكل جزء من القراءة المعينة لملف BED في دليل سجل (~ / Desktop / GSE126612 / log / bam-to-bed). (سادسا) تنفيذ وظيفة genomecov أدوات السرير لإنشاء ملفات bedGraph الخام باستخدام ملفات BED المجزأة في مجلد واحد (~ / Desktop / GSE126612 / bedGraph).
  4. بعد الانتهاء من التشغيل ، تحقق من ملفات السجل بعناية. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: سيتم استخدام ملفات bedGraph لعمليات القراءة الأولية للإخراج كملفات إدخال لبرنامج المتصل ذو الذروة SEACR مع خيار التسوية في القسم 12 وتطبيع عدد القراءات الجزئي المقلم (SFRC)22 في القسم 10. ستعمل ملفات BED المجزأة كملفات إدخال لقراءة Spike-in المعادية لكل مليون قراءة معينة في تطبيع التحكم السلبي (SRPMC)24،25 في القسم 10.To التقاط الأجزاء القصيرة (>100 نقطة أساس) فقط لبيانات CUT &RUN للعوامل المرتبطة بالكروماتين ، وتغيير خطوة ترشيح الأجزاء في هذا البرنامج النصي ومتابعة خطوة التطبيع. لمقارنة إشارات CUT & RUN بين الأجزاء ذات الحجم القصير والمنتظم داخل نفس العينة ، قد يكون تطبيع SFRC مفيدا لتقليل تأثير أخذ العينات المحتملة الناجم عن التقاط الأجزاء القصيرة فقط. استخدم البرنامج النصي shell هذا لتنفيذ نفس العمليات لملفات bam المصنفة المتسلسلة الأخرى المزدوجة عن طريق تغيير تنسيق المسار والاسم لملفات bam و bed.

10. تحويل ملفات bedGraph الأولية إلى ملفات bedGraph و bigWig الطبيعية

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_09_normalization_SFRC.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) Run for-loop with awk function لإنشاء ملفات bedGraph المعادية ل SFRC باستخدام ملفات bedGraph الأولية في ~/Desktop/GSE126612/bedGraph. (ii) قم بتنفيذ وظيفة bedGraphToBigWig لإنشاء تنسيق مضغوط (.bw) لملفات bedGraph المطبعة ل SFRC في ~ / Desktop / GSE126612 / bigWig. (iii) اكتب ملف سجل واحد لتسجيل عامل التطبيع المستخدم لحساب SFRC لكل تشغيل وحفظ ملف السجل داخل ~ / Desktop / GSE126612 / log / SFRC.
  4. بعد الانتهاء من التشغيل، تحقق من ملفات السجل. إذا كانت هناك أي رسالة خطأ ، فقم بتصحيح الخطأ وقم بتشغيل البرنامج النصي shell مرة أخرى. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: تم استخدام تطبيع عدد القراءة الكسري المقاس في المنشورالأصلي 22 من مجموعة بيانات CUT &RUN GSE126612. صيغة التطبيع في bin i هي نفسها كما يلي:
    figure-protocol-1
    نظرا لأن طريقة التطبيع هذه لا تتضمن التطبيع مع التحكم السلبي (على سبيل المثال ، عينة IgG) ولا التحكم في الارتفاع ، فقد لا يكون هذا النهج مثاليا لمراقبة اختلاف الإشارة على مستوى الجينوم بين العينات. ومع ذلك ، نظرا لأن هذه الطريقة متشابهة نظريا مع التطبيع الآخر القائم على إجمالي عمليات القراءة (على سبيل المثال ، العد لكل مليون) ، فسيكون من الجيد بما يكفي ملاحظة اختلاف الإشارة المحلية بين العينات.
  5. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_09_normalization_SRPMC.sh في الجهاز أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: سيقوم هذا البرنامج النصي بما يلي: (i) تشغيل for-loop مع وظيفة genomecov bedtools لإنشاء ملفات bedgraph طبيعية SRPMC في ~ / Desktop / GSE126612 / bedGraph باستخدام ملفات BED المجزأة في ~ / Desktop / GSE126612 / bam إلى السرير. (ii) تدوين ملف سجل لتسجيل عوامل التطبيع المستخدمة لتطبيع SRPMC لكل تشغيل في ~/Desktop/GSE126612/log/SRPMC. (iii) قم بتنفيذ وظيفة bedGraphToBigWig لإنشاء تنسيق مضغوط (.bw) لملفات bedGraph الطبيعية وحفظ ملفات bigWig الطبيعية في مجلد ~ / Desktop / GSE126612 / bigWig .
  6. بعد الانتهاء من التشغيل، راجع ملفات السجل بعناية. إذا كانت هناك أي رسالة خطأ داخل ملفات السجل ، فقم بتصحيح الخطأ وتشغيل البرنامج النصي shell مرة أخرى. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: تم تطوير صيغة تطبيع SRPMC لتطبيع عدد قراءات العينة الفعلية مع كل من التحكم السلبي (عينة IgG ، على سبيل المثال) والتحكم في الارتفاع من خلال الجمع بين عامل تطبيع RPM (يقرأ لكل مليون قراءة معينة) و RPS (نسبة القراءة لكل قراءة سبايك) ونسبة الإشارة النسبية للتحكم24،25. تعريف RPS هو نفسه كما يلي:
    figure-protocol-2
    من خلال تطبيق RPS لكل من العينة الفعلية وعينة التحكم السالبة ، يمكن حساب نسبة الإشارة النسبية (RS) للتحكم في العينة الفعلية على النحو التالي:
    figure-protocol-3
    وتعريف عامل تطبيع RPM (RPM: NF) هو نفسه على النحو التالي:
    figure-protocol-4
    من هنا ، ظهر عامل تطبيع SRPMC (SRPMC: NF) من خلال الجمع بين RS و RPM: NF معا:
    figure-protocol-5
    ويمكن تبسيط هذه الصيغة على النحو التالي:
    figure-protocol-6
    لذلك ، تعمل طريقة SRPMC على تطبيع القراءات من خلال (1) نسبة قراءات الارتفاع بين التحكم والعينة ، و (2) قراءات التحكم الطبيعية RPM نظرا لأن عامل التطبيع هذا يأخذ في الاعتبار قراءات الارتفاع ويجعل قراءات التحكم قابلة للمقارنة بين العينات معا ، فستكون هذه الطريقة مناسبة لمراقبة الفرق على مستوى الجينوم بين العينات وتقليل تأثير الدفعة في إجمالي القراءات للعينات الفعلية والضوابط في تجارب الدفعات المختلفة. ستصبح ملفات bedGraph المعادية هذه ملفات إدخال لاستدعاء القمم باستخدام SEACR في القسم 11. وسيتم استخدام ملفات bigWig المعادية هذه في تصور المواقع من خلال IGV وإنشاء خريطة حرارية ومؤامرة متوسطة عبر Deeptools. يقترح بشدة استخدام متصفح الجينوم لتصور نمط المشهد لمجموعة بيانات CUT & RUN باستخدام ملفات bigWig الطبيعية في المناطق الجينومية التمثيلية لتقييم جودة البيانات. من المحتمل أن تكون عينات CUT&RUN التي تعرض أنماط إشارة خلفية صاخبة تشبه عنصر تحكم IgG مناسبة لحذفها للتحليلات النهائية استخدم البرامج النصية shell هذه لتطبيع ملفات bedGraph وعمليات القراءة الأخرى وملفات bedGraph الأولية عن طريق تغيير أسماء المسار والملفات لكل من ملفات سرير الإدخال والإخراج وbedgraph. قم بتحرير هذه البرامج النصية لتطبيق حسابات التسوية الأخرى عن طريق تغيير العوامل والصيغة داخل هذا البرنامج النصي.

11. التحقق من صحة توزيع حجم القطعة

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_10_insert-size-analysis.sh في الجهاز أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل picard.jar الدالة CollectInsertSizeMetrics باستخدام ملفات bam لأزواج القراءة المعينة في مجلد ~/Desktop/GSE126612/filtered-bam لتحديد توزيع حجم الإدراج. (ii) قم بإنشاء مجلد واحد (~/Desktop/GSE126612/insert-size-distribution) وحفظ نتائج تحليل توزيع حجم الإدراج في المجلد الذي تم إنشاؤه. (ثالثا) اكتب ملف سجل لكل ملف إدخال bam في مجلد ~ / Desktop / GSE126612 / log / insert-size-distribution .
  4. بعد الانتهاء من التشغيل ، تحقق من ملفات السجل بعناية. إذا كانت هناك أي رسالة خطأ داخل ملفات السجل ، فقم بتصحيح الخطأ وحاول تشغيل البرنامج النصي shell مرة أخرى. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: بشكل عام ، يظهر تحليل حجم الإدراج (الإخراج) لعينات CUT &RUN قمم رئيسية عند نطاقات حجم النواة أحادية (100-300 نقطة أساس) و ثنائي (300-500 نقطة أساس). يمكن أن تتسبب الأخطاء / القيود الفنية (مثل الإفراط في / نقص هضم MNase أثناء تحضير عينة CUT &RUN أو اختيار الحجم غير الصحيح أثناء إعداد المكتبة) في إثراء نفس أو أكبر من ثلاثي النوكليosomal (500-700 نقطة أساس) ونفس أو أقصر من شظايا النوكليosomi الفرعية (<100 نقطة أساس). في بعض الأحيان ، قد يكون عدم وجود قمم أحادية الحجم أحادية النواة مع إثراء الأجزاء الطويلة (>500 نقطة أساس) والقصيرة (<100 نقطة أساس) بسبب نطاقات اختيار حجم المكتبة المختارة في مرحلة المختبر الرطب ، أو عمق التسلسل المنخفض. قارن عمق التسلسل ("إجمالي القواعد المتسلسلة" / "إجمالي حجم الجينوم المرجعي") ، ونظرة عامة على المشهد الجينومي باستخدام ملفات bigWig المقروضة المطبعة في القسم 10 ، ونمط توزيع حجم الإدراج معا لتوضيح جودة عينات CUT &RUN المعالجة. تمثل الخطوط المتقطعة في الرسوم البيانية "الكسر التراكمي" للقراءات بحجم إدراج أكبر من أو يساوي القيمة الموجودة على المحور السيني. يتيح هذا الخط المتقطع تحديد توزيع أحجام الإدراج في ملف القراءات المعينة للإدخال. يرتبط التقدم على طول المحور x بزيادة حجم الإدراج. يحدد الخط المتقطع نسبة أزواج القراءة المعينة في ملف bam المدخل التي لها حجم إدراج لا يقل عن حجمه المشار إليه في موضع المحور x المتقاطع. لذلك ، يبدأ التفسير عند 1 على اليسار ، مما يشير إلى أن جميع القراءات لها حجم إدخال أكبر من أو يساوي أصغر حجم ، وينخفض نحو 0 مع زيادة حجم الإدراج.

12. استدعاء القمم باستخدام MACS2 و MACS3 و SEACR

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_11_peak-calling_MACS.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظائف macs2 callpeak و macs3 مع وبدون تحكم IgG باستخدام ملفات BEDPE المجزأة لاستدعاء الذروة وحفظ نتائج استدعاء الذروة في دلائل الإخراج (~/Desktop/GSE126612/MACS2 و ~/Desktop/GSE126612/MACS3). (ii) اكتب سجل استدعاءات الذروة هذه كملف نصي في دليل السجل (~/Desktop/GSE126612/log/MACS2 و ~/Desktop/GSE126612/log/MACS3)
  4. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_11_peak-calling_SEACR.sh في الجهاز أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل البرنامج النصي SEACR_1.3.sh مع عنصر تحكم IgG وبدونه، مع خيارات صارمة ومريحة باستخدام redcounts readcounts الأولية bedGraph وملفات bedGraph الطبيعية لاستدعاء القممة. (ii) إنشاء دليل الإخراج (~/Desktop/GSE126612/SEACR-peaks) وحفظ نتائج استدعاء الذروة بواسطة SEACR. (ثالثا) اكتب سجل استدعاءات الذروة هذه كملف نصي في دليل السجل (~ / Desktop / GSE126612 / log / SEACR).
  5. بعد الانتهاء من تشغيل البرامج النصية shell ، تحقق من ملفات السجل بعناية. إذا كانت هناك أي رسالة خطأ في ملفات السجل ، فقم بتصحيح الخطأ أولا. قد لا تستدعي بعض البرامج الذروة لعينة التحكم IgG مع خيار التحكم IgG معا ، وبالتالي ، احذف رسالة الخطأ المتعلقة بعينة تحكم IgG مع خيار التحكم IgG. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: يقوم هذان النصان النصيان الشبكيان بإجراء استدعاء الذروة لعينات CUT &RUN باستخدام ثلاثة متصلين بالذروة (MACS2 و MACS3 و SEACR) مع خيارات متنوعة: مع / بدون خيار التحكم IgG ، باستخدام ملفات bedGraph لعمليات القراءة الأولية مع خيار التطبيع لذروة المتصل أو ملفات bedGraph المقيدة بالعدد الطبيعي بدون خيار التطبيع لمتصل الذروة ، وخيارات استدعاء ذروة SEACR الصارمة والمريحة. نظرا لأن ملفات إخراج استدعاء الذروة ليست كافية لاستخدامها مباشرة في تحليلات المصب ، فإن Easy Shells يتضمن CUTnRUN برنامجا نصيا واحدا لمعالجة ملفات إخراج الذروة المسماة لإنشاء ملفات ذروة جديدة تتضمن الكروموسوم والبدء والنهاية واسم القمم. من خلال مناهج مكالمات الذروة المكثفة ، توفر Easy Shells CUTnRUN فرصة لاختيار برنامج الاتصال الذروة الأنسب لمشروع CUT &RUN للمستخدم من خلال مقارنة القمم التي يتم استدعاؤها عبر ثلاثة متصلين بالذروة. بالإضافة إلى ذلك ، يوفر خط أنابيب تحليل CUT &RUN هذا أيضا فرصة لتحديد خيارات الاتصال الذروة الأنسب لمشروع CUT &RUN للمستخدم. سيتم إجراء هذه المقارنات عن طريق مخطط Venn ، والتصور كخريطة حرارية ومخطط متوسط.

13. إنشاء ملفات سرير الذروة

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_12_make-peak-bed.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظيفة awk باستخدام ملفات السرير في المجلد ~ / Desktop / GSE126612 / SEACR لإنشاء نوعين من ملفات ذروة السرير SEACR ~ / سطح المكتب / GSE126612 / peak-bed_SEACR . تتضمن ملفات سرير الذروة بأكملها بداية ونهاية كل ذروة ، وتتضمن ملفات سرير الذروة المركزة بداية وسرير أعلى صندوق إشارة داخل كل ذروة. (ii) قم بتشغيل وظيفة awk باستخدام ملفات _peaks.xls في مجلدات ~ / Desktop / GSE126612 / MACS2 و ~ / Desktop / GSE126612 / MACS3 لإنشاء ملفات ذروة كاملة تتضمن بداية ونهاية كل ذروة يتم استدعاؤها بواسطة MACS2 و MACS3 في مجلدات ~ / Desktop / GSE126612 / peak-bed_MACS2 و ~ / Desktop / GSE126612 / peak-bed_MACS3 . (iii) قم بتشغيل وظيفة awk باستخدام ملفات _summits.bed في مجلدات ~ / Desktop / GSE126612 / MACS2 و ~ / Desktop / GSE126612 / MACS3 لإنشاء ملفات ذروة مركزة تتضمن بداية ونهاية الحاوية الأكثر أهمية داخل كل ذروة. (iv) تتم كتابة ملفات السجل بتنسيق ملف نصي في مجلد ~ / Desktop / GSE126612 / log / peak-bed .
  4. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_13_filter-peaks.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظيفة تقاطع bedtools باستخدام ملفات ذروة السرير التي يتم استدعاؤها بدون خيار التحكم IgG لإزالة القمم المتداخلة مع قمم التحكم IgG. (ii) يتم حفظ ملفات ذروة السرير التي تمت تصفيتها في مجلدات ~ / Desktop / GSE126612 / peak-bed-filtered_MACS2 و ~ / Desktop / GSE126612 / peak-bed-filtered_MACS3 و ~ / Desktop / GSE126612 / peak-bed-filtered_SEACR . (iii) يتم إنشاء ملف سجل log_filter-peaks.txt في مجلد ~ / Desktop / GSE126612 / log / filter-peaks .
  5. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_14_cat-merge-peak-bed_MACS.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظائف cat والفرز لتسلسل ملفات ذروة السرير MACS2 و MACS3 بالكامل للنسخ المتماثلة كملف سرير ذروة واحد وفرز ملف سرير الذروة المتسلسل في مجلد ~/Desktop/GSE126612/bed-for-comparison. (ii) قم بتشغيل وظيفة دمج أدوات السرير باستخدام ملفات سرير الذروة الكاملة المتسلسلة لدمج القمم التي تتداخل مع بعضها البعض. (iii) تمت كتابة log_cat-merged-peak-bed_MACS.txt ملف السجل في مجلد السجل ~ / Desktop / GSE126612 / log / cat-merged-peak-bed.
  6. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_14_cat-merge-peak-bed_SEACR.sh في الجهاز أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظائف cat والفرز لتسلسل ملفات سرير الذروة الكاملة SEACR للنسخ المتماثلة كملف سرير ذروة واحد وفرز ملف سرير الذروة المتسلسل في مجلد ~/Desktop/GSE126612/bed-for-comparison. (ii) قم بتشغيل وظيفة دمج أدوات السرير باستخدام ملفات سرير الذروة الكاملة المتسلسلة لدمج القمم التي تتداخل مع بعضها البعض. (iii) تمت كتابة log_cat-merged-peak-bed_SEACR.txt ملف السجل في مجلد السجل ~ / Desktop / GSE126612 / log / cat-merged-peak-bed.
  7. بعد الانتهاء من تشغيل البرامج النصية shell ، راجع ملفات السجل بعناية. إذا كانت هناك أي رسالة خطأ في ملفات السجل ، فقم بتصحيح الخطأ وتشغيل البرنامج النصي (البرامج النصية) مرة أخرى. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: سيتم استخدام ملفات ذروة طبقات الذروة بأكملها كملفات إدخال لتحليل مخطط Venn لمقارنة التشابه بين خيارات استدعاء الذروة وطرق استدعاء الذروة والتكرارات وملاحظات المناظر الطبيعية الجينومية بالقرب من مناطق الذروة. سيتم استخدام ملفات ذروة مناطق الذروة المدمجة بالكامل لتحليل المكون الرئيسي (PC) وتحليل ارتباط معامل بيرسون باستخدام الأدوات العميقة. سيتم استخدام ملفات ذروة السرير المركزة لخريطة الحرارة وتحليل متوسط المؤامرة باستخدام Deeptools.

14. التحقق من صحة التشابه بين التكرارات باستخدام ارتباط بيرسون وتحليل المكون الرئيسي (PC).

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يرى المستخدمون ما يلي: /path/to/bash (أو رسالة مماثلة مثل /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كإعداد افتراضي، فتخط هذه الخطوة.
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_15_correlation_plotCorrelation.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظيفة multiBamSummary BED-file باستخدام ملفات bam للنسخ المتماثلة ، والتي تم فرزها حسب الإحداثيات ، ودمج ملفات ذروة السرير بالكامل ل CTCF و H3K27Ac و RNAPII-S5P لإنشاء ملفات مصفوفة لتحليل ارتباط Pearson في مجلد سطح المكتب / GSE126612 / deeptools_multiBamSummary . (ii) قم بتشغيل وظيفة plotCorrelation باستخدام ملفات المصفوفة لإجراء حساب معامل ارتباط Pearson وتجميع خريطة التمثيل اللوني وحفظ النتيجة في مجلد ~ / Desktop / GSE126612 / deeptools_plotCorrelation . (ثالثا) اكتب ملف سجل log_plotCorrelation.txt في مجلد ~ / Desktop / GSE126612 / log / correlation .
  4. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_15_correlation_plotPCA.sh في الجهاز أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظيفة multiBamSummary BED-file باستخدام ملفات bam ، التي تم فرزها حسب الإحداثيات ، ودمج ملفات ذروة السرير بالكامل ، والتي تتضمن جميع قمم CTCF و H3K27ac و RNAPII-S5P ، لإنشاء ملفات مصفوفة لتحليل المكون الرئيسي (PCA) في مجلد سطح المكتب / GSE126612 / deeptools_multiBamSummary . (ii) قم بتشغيل وظيفة plotPCA باستخدام ملفات المصفوفة لأداء PCA وحفظ النتيجة في مجلد ~ / Desktop / GSE126612 / deeptools_plotPCA . (iii) اكتب ملف سجل log_plotPCA.txt في مجلد ~ / Desktop / GSE126612 / log / correlation .
  5. بعد الانتهاء من تشغيل البرامج النصية shell ، تحقق من ملفات السجل. إذا كانت هناك أي رسالة خطأ ، فقم بتصحيح الخطأ وقم بتشغيل البرامج النصية shell مرة أخرى. إذا كانت هناك أي مشكلة لحل المشكلة، فاطلب المساعدة باستخدام صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: من حيث المبدأ، تظهر النسخ المتماثلة المعدة والمعالجة بشكل صحيح قيم معامل ارتباط بيرسون أعلى داخل نفس مجموعة التجميع وتحديد المواقع القريبة في تحليل المكون الرئيسي. قد يمثل أي تكرار ، يظهر معامل ارتباط بيرسون أقل ، ومسافة طويلة من التكرارات الأخرى في مخطط المكون الرئيسي ، متطرفا محتملا بين التكرارات. ينطبق البرنامج النصي shell هذا على أي بيانات قراءة بتنسيق bam معينة. قم بتغيير المسار واسم الملف للملفات الكبيرة لتلبية المتطلبات الخاصة بالمشروع.

15. التحقق من صحة التشابه بين النسخ المتماثلة وطرق استدعاء الذروة والخيارات باستخدام مخطط Venn

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يكون هناك شيء مثل /path/to/bash (على سبيل المثال، /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كافتراضي ، ففكر في تخطي هذه الخطوة
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_16_venn-diagram_methods.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظيفة التدخل venn باستخدام ملفات ذروة طبقة الذروة بأكملها للعثور على التداخلات بين القمم التي يتم استدعاؤها بواسطة خيارات مختلفة (مع/بدون خيار التحكم IgG، مع/بدون تطبيع، وخيارات استدعاء الذروة الصارمة/المريحة ل SEACR). (ii) قم بإنشاء مجلد واحد (~/Desktop/GSE126612/intervene_methods) واحفظ نتائج تحليل مخطط Venn في هذا المجلد. (iii) اكتب log_intervene_methods.txt ملف سجل واحد في مجلد ~ / Desktop / GSE126612 / log / intervention .
  4. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_16_venn-diagram_replicates.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل الدالة inter venn باستخدام ملفات ذروة منطقة الذروة بأكملها للعثور على التداخلات بين قمم النسخ المتماثلة. (ii) قم بإنشاء مجلد واحد (~/Desktop/GSE126612/intervene_replicates) واحفظ نتائج تحليل مخطط Venn في هذا المجلد. (iii) اكتب log_intervene_replicates.txt ملف سجل واحد في مجلد ~ / Desktop / GSE126612 / log / intervention .
  5. بعد الانتهاء من تشغيل البرامج النصية shell ، راجع ملفات السجل. إذا كانت هناك أي رسالة خطأ ، فقم بتصحيح الخطأ وقم بتشغيل البرامج النصية shell مرة أخرى. إذا كانت هناك أي مشكلة في استخدام مسار تحليل Easy Shells CUTnRUN، فاطلب المساعدة في صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: توفر نتائج تحليل مخطط Venn هذه نظرة ثاقبة لاختيار أنسب خيارات استدعاء الذروة والأساليب والتكرارات ذات قابلية التكرار العالية لتحليل المصب. قد يكون من المفضل اختيار خيارات وطرق استدعاء الذروة التي تظهر أعلى أرقام الذروة المسماة مع تداخل جيد مع طرق وخيارات استدعاء الذروة الأخرى.

16. تحليل خرائط الحرارة ومتوسط المؤامرات لتصور القمم المسماة.

  1. افتح الجهاز واكتب echo $SHELL للتحقق من الغلاف الافتراضي في الطرف النشط. إذا كان Bash shell هو الغلاف الافتراضي في المحطة الطرفية الحالية، فقد يكون هناك شيء مثل /path/to/bash (على سبيل المثال، /bin/bash) في المحطة الطرفية.
  2. إذا لم تكن الغلاف الافتراضي هي Bash، فقم بتعيين Bash shell كغلاف افتراضي عن طريق كتابة chsh -s $(which bash) في المحطة الطرفية. إذا كانت المحطة الطرفية تستخدم Bash shell كافتراضي ، ففكر في تخطي هذه الخطوة
  3. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_27_plotHeatmap_focused.sh في الجهاز الطرفي أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    ملاحظة: تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظيفة النقطة المرجعية computeMatrix باستخدام ملفات bigWig المعادية وملفات ذروة السرير المركزة لإنشاء مصفوفات قراءة عادية في وسط القمم المركزة في المجلد ~/Desktop/GSE126612/deeptools_computeMatrix . (ii) قم بتشغيل وظيفة plotHeatmap باستخدام مصفوفة عمليات إعادة القراءة الطبيعية لإنشاء خرائط حرارية ومخططات متوسطة تصور نمط توزيع عمليات إعادة القراءة الطبيعية في مواقع الذروة المركزة. (iii) قم بإنشاء مجلد واحد (~ / Desktop / GSE126612 / deeptools_plotHeatmap) واحفظ ملفات إخراج plotHeatmap داخل هذا المجلد. (iv) اكتب log_plotHeatmap_focused.txt ملف سجل واحد في مجلد ~ / Desktop / GSE126612 / log / plotHeatmap .
  4. اكتب ~ / Desktop / Easy-Shells_CUTnRUN / scripts / Script_27_plotHeatmap_whole.sh في الجهاز أو اسحب ملف البرنامج النصي shell إلى الجهاز وأدخله.
    تمت كتابة هذا البرنامج النصي إلى: (i) تشغيل وظيفة النقطة المرجعية computeMatrix باستخدام ملفات bigWig المعادية وملفات ذروة السرير بالكامل لإنشاء مصفوفات قراءة طبيعية في وسط القمم بأكملها في المجلد ~ / Desktop / GSE126612 / deeptools_computeMatrix . (ii) قم بتشغيل وظيفة plotHeatmap باستخدام مصفوفة عمليات إعادة القراءة الطبيعية لإنشاء خرائط حرارية ومخططات متوسطة تصور نمط توزيع عمليات إعادة القراءة الطبيعية في مواقع الذروة بأكملها. (ثالثا) قم بإنشاء مجلد واحد (~ / Desktop / GSE126612 / deeptools_plotHeatmap) واحفظ ملفات إخراج plotHeatmap داخل هذا المجلد. (iv) اكتب log_plotHeatmap_whole.txt ملف سجل واحد في مجلد ~ / Desktop / GSE126612 / log / plotHeatmap .
  5. بعد الانتهاء من تشغيل البرامج النصية shell ، راجع ملفات السجل. إذا كانت هناك أي رسالة خطأ ، فقم بتصحيح الخطأ وقم بتشغيل البرامج النصية shell مرة أخرى. إذا كانت هناك أي مشكلة في استخدام مسار تحليل Easy Shells CUTnRUN، فاطلب المساعدة في صفحة ويب مشكلات Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ملاحظة: من الناحية المثالية ، تظهر مواقع الذروة لقمم MACS2 / 3 ومواقع الذروة المركزة لقمم SEACR توزيعا حادا ومركزا للإشارة في وسط المؤامرات. ومع ذلك ، إذا لم تعمل خوارزمية استدعاء الذروة بشكل صحيح لبيانات CUT & RUN ، فقد يظهر توزيع إشارة "صاخبة" أقل تركيزا في المخططات. لذلك ، فإن استخدام عدد القمم المستدعى وأنماط توزيع إشارة الذروة لمخططات الإخراج سيوجه تحديد صلاحية الذروة لمزيد من تحليل CUT & RUN الذي يتضمن تعليق ذروة المصب.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تحتفظ الجودة والتشذيب بالمحول بالقراءات بجودة تسلسل عالية
تقنيات التسلسل عالية الإنتاجية عرضة لتوليد أخطاء في التسلسل مثل "طفرات" التسلسل في القراءات. علاوة على ذلك ، يمكن إثراء ثنائيات محول التسلسل في مجموعات بيانات التسلسل بسبب سوء إزالة المحول أثناء إعداد المكتبة. يمكن أن تؤدي أخطاء التسلسل المفرطة ، مثل طفرات القراءة ، وتوليد قراءات أقصر من المطلوب لرسم الخرائط الصحيحة ، وإثراء ثنائيات المحول ، إلى زيادة وقت تعيين القراءة ويمكن أن تنتج قراءات مخططة إيجابية كاذبة تشوه نتائج تحليل المعلوماتية الحيوية في اتجاه مصب. لذلك ، يلزم تصفية الجودة وتشذيب المحول للاحتفاظ بقراءات عالية الجودة لتحليل المصب والتفسير.

للاحتفاظ بقراءات عالية الجودة للتحليل ، يستخدم خط أنابيب تحليل CUT & RUN هذا (الشكل 2) FastQC26 و Trim Galore27. يقوم البرنامج النصي shell "Script_03_fastQC.sh" بتشغيل FastQC لجميع ملفات fastq داخل دليل العمل. تحدد النتائج (الشكل 3) لهذه الخطوة باستخدام مجموعة بيانات CTCF CUT & RUN المتاحة للجمهور من GSE126612 (SRR8581589) بعض القراءات ذات قواعد الدرجات منخفضة الجودة (الشكل 3 أ ، ج) وبعض درجات عدم تطابق توزيع محتويات GC لكل تسلسل بين التقدير النظري والقراءات الفعلية (الشكل 3 ه).

يؤدي تنفيذ البرنامج النصي "Script_04_trimming.sh" لتشغيل Trim Galore بنجاح إلى إزالة تلك القراءات ذات قواعد الدرجات منخفضة الجودة (أقل من 20 في الشكل 3 أ) ومتوسط متوسط منخفض الصفات الواضحة للتشذيب المسبق (الشكل 3B-D). بالإضافة إلى ذلك ، نجح "Script_04_trimming.sh" أيضا في إزالة 55 ~ 60٪ متوسط تخصيب محتوى GC المعروض في توزيع GC "التشذيب المسبق" على مخطط التسلسل (الشكل 3E ، F). توضح هذه النتائج أن خط أنابيب تحليل CUT &RUN هذا يقوم بتصفية قراءات عالية الجودة لتسهيل رسم خرائط القراءة السريع والدقيق للجينوم المرجعي.

يمكن أن يعطي توزيع حجم الإدراج تقديرا لنتائج استدعاء الذروة
نظرا لاستخدام MNase في CUT & RUN (الشكل 1) ، من المتوقع أن تظهر قراءات CUT & RUN المعينة قمم حجم جزء الحمض النووي أحادية (~ 200 نقطة أساس) وثنائية النواة (~ 350 نقطة أساس) داخل مخططات توزيع حجم الإدراج (الشكل 4). قد تؤدي المشكلات المتعلقة باكتشاف بعض الأهداف إلى إدخالات قصيرة (< 100 نقطة أساس) (الشكل 4C). يقلل المستوى العالي من القراءات القصيرة من عدد القراءات التي يمكن استخدامها لاستدعاء الذروة عالي الثقة ، وبالتالي تقليل أرقام الذروة والتأثير على تحليل المصب. في مسار تحليل CUT&RUN هذا ، يقوم "Script_10_insert-size-analysis.sh" بتشغيل وظيفة "picard.jar CollectInsertSizeMetrics" لإجراء تحليل توزيع حجم الإدراج وتصدير الرسوم البيانية كمخرجات تصور (الشكل 2). في مخططات الإخراج (الشكل 4A-C) ، يظهر المحور x نطاق حجم الإدراج ، والجانب الأيسر من المحور y والرسم البياني المملوء يمثل عدد الإدخالات بالقيمة الموجودة على المحور x ، ويظهر الجانب الأيمن من المحور y والخط المتقطع الكسر التراكمي من الإدخالات بحجم إدراج يساوي أو أكبر من القيمة الموجودة على المحور x. لذلك ، فإن كلا الموقع على المحور X مع التغيير الأكثر دراماتيكية في منحدر الخط المتقطع الذي يتقاطع مع مستوى الارتفاعات في الرسم البياني يحدد حجم الإدخال الرئيسي في العينة. من بين القراءات المعينة على الجينوم المرجعي ذي الأهمية (الإنسان ، hg19) ، تظهر شظايا عينة H3K27Ac (علامة هيستون النشطة) توزيع حجم إدراج CUT & RUN المتوقع مع أعلى حجم أحادي النواة وقمم حجم ثنائية النواة يمكن اكتشافها (الشكل 4 ب). أظهرت شظايا عينة CTCF مجموعات إضافية عند مناطق طول الشظية 100 ~ 200 نقطة أساس (الشكل 4 أ). إجمالا ، يوفر خط أنابيب تحليل CUT & RUN نصوص shell سهلة الاستخدام لإجراء تحليل توزيع حجم الإدراج بعد تعيين القراءات على الجينومات المرجعية. تصبح هذه التحليلات مهمة عند تقدير كفاءة استدعاء الذروة قبل التحليل النهائي.

يوفر خط أنابيب تحليل Easy Shells CUTnRUN عمليات ترشيح وخيارات تطبيع لإنشاء عدد قراءات موثوق به
تتمثل إحدى النقاط الحاسمة في تحليل CUT & RUN في الحصول على أزواج قراءة معينة مناسبة عن طريق تصفية أزواج القراءة التي بها مشكلات من مخرجات التعيين الأولية وتطبيع عدد القراءات المعينة التي تمت تصفيتها باستخدام طريقة حساب التطبيع المحددة التي يمكن أن تلبي أهداف / احتياجات تحليل المستخدم. يتضمن خط أنابيب تحليل CUT &RUN الذي تمت مناقشته في هذه الدراسة نصا نصيا "Script_07_filter-sort-bam.sh" لإزالة أزواج القراءة التي تم تعيينها على الكروموسومات غير القانونية ، ومناطق القائمة السوداء المشروحةعلنا 23 ، و TA يكرر المناطق18،22 من أزواج القراءة التي تم تعيينها بواسطة bowtie2 باستخدام "Script_06_bowtie2-mapping.sh". هذه الترشيحات مطلوبة لإزالة أزواج القراءة التي يمكن أن تنتج إشارات ارتفاع إيجابية كاذبة وغريبة وتسمى القمم في تحليل المصب (الشكل 5 ؛ مناطق الصندوق الأصفر).

بالإضافة إلى الترشيحات ، يعد تطبيق طريقة التطبيع الصحيحة عاملا مهما لتصور فرق الإشارة بين العينات بدقة. لذلك ، يتضمن خط أنابيب تحليل CUT&RUN نصوصا نصية "Script_09_normalization_SFRC.sh" و "Script_09_normalization_SRPMC.sh" لتوفير طريقتين للتطبيع تم التحقق منها علنا - القراءة الكسرية المقاسة (SFRC) 22 و Spike-in القراءات الطبيعية لكل مليون قراءة معينة في عنصر التحكم السلبي (SRPMC) 24،25 (الشكل 5A-D). نظرا لأن SFRC لا يتضمن التحكم (على سبيل المثال ، IgG) ولا عينة الارتفاع في الصيغة ، يمكن استخدام تطبيع SFRC للعينات التي لا تتضمن أي عينة تحكم أو من المتوقع أن تظهر اختلافات في الإشارة في المناطق المحلية فقط دون اختلاف على نطاق الجينوم. تنتج العينات الطبيعية ل SFRC التي تمت معالجتها بواسطة خط أنابيب تحليل CUT &RUN (الشكل 5A-D ؛ المسارات الحمراء) نفس أنماط توزيع الإشارات مثل القراءات المعينة المتاحة للجمهور من GEO (الشكل 5A-D ؛ المسارات السوداء) ، مما يشير إلى أن خط الأنابيب هذا يمكنه إعادة إنتاج نتائج النشر.

وطريقة SRPMC مفيدة لتطبيع العينات التي تشمل كلا من عينات التحكم وعينات الارتفاع المفاجئ ومن المتوقع أن تظهر اختلافا عالميا في الإشارة بين العينات (الشكل 5A-D؛ المسارات الخضراء). نظرا لأن عينة H3K27Ac (SRR8581599) تظهر نسبة أعلى بكثير من "(قراءات CUT &RUN الفعلية) / (قراءات سبايك في)" (عينة RPS ؛ 997) من التكرارات الأخرى (237 و 175 و 161) ، تظهر إشارات H3K27Ac النسبية مختلفة بين التكرارات في العينات الطبيعية SFRC و SRPMC (الشكل 5A-D ؛ مقارنة H3K27AC عبر جميع المسارات). تظهر عينات RNAPII-S5P عينات RPS عينة أقل نسبيا (1.7 ، 0.8 ، 2.1) من التحكم في IgG (259) ، وبالتالي فإن عينات RNAPII-S5P تظهر إشارة أقل من التحكم في IgG بعد تطبيع SRPMC (الشكل 5A-D; مقارنة RNAPII-S5P عبر جميع المسارات). لذلك ، يوصي خط أنابيب تحليل CUT &RUN الذي تمت مناقشته هنا باستخدام طريقة SRPMC فقط للعينات التي تحتوي على قراءات كافية في العينات التجريبية بالنسبة لكل من قراءات التحكم في IgG والتحكم في السنبل.

يمكن أن تعطي مقارنة مخطط Venn أفكارا لاختيار طريقة وخيارات أفضل لاستدعاء الذروة
تتيح برامج استدعاء الذروة المتعددة تحديد إشغال البروتين المخصب بشكل كبير عبر الجينوم. تشمل هذه البرامج المستخدمة لتحليل CUT &RUN برامج عائلة MACS2 و SEACR4 كطرق رئيسية حتى الآن. ومع ذلك ، قد يكون من الصعب ، خاصة بالنسبة للمبتدئين في المعلوماتية الحيوية ، تحديد طريقة وخيارات استدعاء الذروة الأنسب لمشروع CUT &RUN معين. لذلك ، يتضمن خط أنابيب تحليل CUT&RUN خطوات تحليل مخطط Venn لإعطاء فرصة للمستخدمين لمقارنة التشابه والاختلاف في نتائج استدعاء الذروة بين خيارات اتصال الذروة المختلفة (خيارات Script_17_intervene) وبرامج اتصال الذروة (Script_19_intervene_methods.sh) (الشكل 6A-H).

وفقا للمقارنة ، فإن قمم CTCF و H3K27ac و RNAPII-S5P المدمجة والتي يتم استدعاؤها مع وبدون خيار التحكم IgG أثناء خطوة استدعاء الذروة ، استدعى MACS2 و MACS3 المزيد من القمم مع خيار التحكم في IgG (الشكل 6 أ) ، لكن SEACR دعا المزيد من القمم بدون خيار التحكم في IgG في كل من الخيارات الصارمة والمريحة (الشكل 6B-D). لذلك ، يقترح خط أنابيب تحليل CUT & RUN (1) تطبيق خيار التحكم IgG ل MACS2 و MACS3 ، (2) استدعاء الذروة لعينات CUT &RUN التجريبية وعينات التحكم IgG بشكل منفصل ، ثم تصفية قمم IgG لاحقا لمتصل ذروة SEACR. بين MACS2 و MACS3 ، دعا MACS3 قمم أكثر قليلا (الشكل 6 أ).

علاوة على ذلك ، تظهر مقارنة القمم التي يطلق عليها MACS2 و MACS3 مع خيار التحكم IgG و SEACR بدون خيار التحكم IgG أن قمم SEACR التي تسمى بالخيار الصارم تتداخل مع قمم MACS 2 و MACS3 أكثر من قمم SEACR التي تسمى بالخيار المريح (الشكل 6E ، F). وبالتالي ، تشير مخرجات خط أنابيب تحليل CUT &RUN إلى أن الخيار الصارم يزيد من تناسق SEACR مع استدعاء ذروة MACS. أخيرا ، يكشف مخطط Venn لمقارنة تداخل القمم التي استدعى SEACR مع التطبيع لملفات CUT &RUN bedGraph الأولية وبدون تطبيع لعمليات القراءة CUT & RUN ملفات bedGraph الطبيعية لا يوجد فرق بين طرق SFRC و SRPMC ل SEACR مع الخيار الصارم. تظهر قمم SFRC أرقام ذروة أعلى بكثير وتتداخل بشكل أفضل مع قمم الخيارات الطبيعية ("القاعدة" في الشكل 6) من قمم SRPMC ل SEACR مع خيارات مريحة (الشكل 6G ، H).

المقارنات الإحصائية بين التكرارات والعينات
يتطلب استخلاص استنتاجات دقيقة عبر التكرارات المتعددة تقييما للتشابه المتماثل. يستخدم خط أنابيب تحليل CUT & RUN المستخدم هنا حساب معامل الارتباط الإحصائي القائم على Deeptools215 ، وتجميع خريطة الحرارة وتحليل المكونات الرئيسية (PCA) لتسهيل تحديد العينات والتكرارات المناسبة لتحليل المصب الصالح. أظهر تجميع خريطة الحرارة المستندة إلى معامل ارتباط بيرسون ارتباطا ذا دلالة إحصائية بين التكرارات ل CTCF و H3K27Ac و RNAPII-S5P في مناطق الذروة المسماة (الشكل 7A-C). ومع ذلك ، أظهر PCA أن عينة واحدة من CTCF (SRR8581590) و H3K27Ac (SRR8581608) تقع بعيدا نسبيا عن التكرارات الأخرى (الشكل 7D) في جميع CTCF و H3K27Ac و RNAPII-S5P تسمى مناطق الذروة.

وفقا لمخطط Venn للمقارنة بين القمم بين التكرارات ، أظهرت قمم CTCF (SRR8581590) أقل تداخل مع التكرارات الأخرى في جميع نتائج متصل الذروة الثلاثة (الشكل 7E-G) ، وأظهرت قمم H3K27Ac (SRR8581608) أقل تداخل مع التكرارات الأخرى في نتائج استدعاء ذروة SEACR (الشكل 7F). لم تظهر قمم H3K27Ac (SRR8581608) الحد الأدنى من التداخل مع التكرارات الأخرى في نتائج استدعاء الذروة MACS2 و MACS3 (الشكل 7F) ، مما قد يشير إلى أن المسافة بين التكرارات في PCA ليست كافية لتحديد العينة الخارجة. لذلك ، يقترح خط أنابيب تحليل CUT & RUN تعريف النسخ المتماثل القيم المتطرفة على أنه "العينة التي تظهر معامل ارتباط بيرسون منخفضا في مجموعة تجميع خريطة الحرارة ، والمسافة الطويلة في مخطط PCA مع النسخ المتماثلة الأخرى ، وأدنى تداخل ذروة عبر النسخ المتماثلة".

تسهل استدعاء الذروة تصور وتفسير بيانات CUT &RUN
يستخدم خط أنابيب تحليل CUT &RUN المفصل في هذه الدراسة نوعين من المتصلين بالذروة المتاحين للجمهور: عائلة MACS و SEACR. لتحسين تصور القمم المسماة ، يختار خط الأنابيب هذا أعلى صندوق إشارة كمركز ذروة لتحليلات خريطة الحرارة والمؤامرة الوصفية. أظهرت جميع قمم CTCF و H3K27Ac و RNAPII-S5P التي يطلق عليها المتصلون بالذروة MACS3 و SEACR نمط توزيع ذروة أكثر حدة في مركز أعلى صناديق الإشارة (الشكل 8A-F ، المخططات "المركزة") من مركز مناطق الذروة بأكملها (الشكل 8A-F ، المخططات "الكاملة"). تظهر عينات CUT &RUN التي تمت معالجتها بواسطة خط أنابيب تحليل Easy Shells CUTnRUN مع تطبيع SFRC (الشكل 8 A-F ، مخططات "SFRC") أنماط توزيع إشارة مماثلة مع تلك الخاصة بعينات SFRC التي تم تطبيعها والتي تكون أزواج القراءة المعينة الأولية متاحة للجمهور في GEO (الشكل 8A-F ، المخططات "العامة") في القمم التي يسددها خط أنابيب التحليل. وبالتالي ، يمكن لخط أنابيب تحليل CUT &RUN إعادة إنتاج نتائج النشر بنجاح.

figure-results-1
الشكل 1: تخطيطي للإجراء التجريبي CUT & RUN. CUT & RUN هو نهج قائم على الإنزيم للكشف عن تفاعلات البروتين والحمض النووي عبر الجينوم. يبدأ إجراء CUT & RUN بربط الخلايا (أو النوى المعزولة) ب Concanavalin A المترافق مع الخرز المغناطيسي لتمكين عزل ومعالجة أعداد الخلايا المنخفضة طوال الإجراء. يتم نفاذية الخلايا المعزولة باستخدام منظف معتدل لتسهيل إدخال الجسم المضاد الذي يستهدف البروتين محل الاهتمام. ثم يتم إدخال نوكلياز المكورات الدقيقة (MNase) المرتبط بعلامة البروتين A أو البروتين A / G في الخلية المنفذة. يتم تجنيد pA-MNase (أو pAG-MNase) في الجسم المضاد المرتبط باستخدام علامة البروتين A أو البروتين A / G. بمجرد توطين MNase في المواقع المستهدفة ، يتم تنشيط النوكلياز لفترة وجيزة من خلال إدخال الكالسيوم لهضم الحمض النووي حول البروتين المستهدف. ينتج عن هضم MNase مجمعات بروتين الحمض النووي أحادية النواة. يتم بعد ذلك مخلب الكالسيوم لإنهاء تفاعل الهضم ، ويتم إطلاق شظايا الحمض النووي القصيرة من هضم MNase من النوى عن طريق حضانة قصيرة عند 37 درجة مئوية ، ثم تخضع لتنقية الحمض النووي ، وإعداد المكتبة ، وتسلسل عاليالإنتاجية 1. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-2
الشكل 2: ملخص تخطيطي لخط أنابيب تحليل Easy-Shell CUT&RUN. تم تصميم خط أنابيب تحليل Easy-Shell CUT & RUN في ثلاثة أقسام رئيسية - (1) مراقبة الجودة ورسم خرائط ملفات القراءة الأولية (يسار ؛ أرجواني) ، (2) تطبيع القراءات المعينة وعدد القراءات وذروة الاتصال (المركز ؛ الأخضر) ، و (3) التحقق من صحة القراءات المعينة والقمم المسماة (اليمين ؛ الوردي). في كل خطوة ، يتم توفير رقم البرنامج النصي المقابل للshell ، ووصف موجز ، وأداة البرنامج المستخدمة في تلك الخطوة (بين قوسين). تظهر الأسهم العادية التدفقات المباشرة بين الخطوات. يوفر خط أنابيب تحليل CUT &RUN طريقتين لتطبيع القراءة يمكن أن تلبي احتياجات المستخدمين مع قراءات التحكم وبدونها ، وعمليات التحقق من الصحة متعددة الطبقات لتحديد التكرارات المناسبة لتحليل المصب ، وتحديد الذروة المركز لخريطة الحرارة المركزة وإنشاء مخرجات metaplot. تمت كتابة خط أنابيب التحليل هذا في نصوص قذائف سهلة الاستخدام بطريقة خطوة بخطوة لتزويد المبتدئين في المعلوماتية الحيوية بفرصة تعلم وممارسة تحليل بيانات CUT &RUN الأساسي من خلال قراءة البرامج النصية وتحريرها بأنفسهم. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-3
الشكل 3: مقارنة نتائج فحص الجودة قبل تشذيب الجودة مقابل التشذيب اللاحق. حدد مخرجات تقرير فحص الجودة من FastQC تعرض تأثير تشذيب الجودة باستخدام القراءات من SRR8581589 (GSM3609748 ، CTCF). تشمل المخرجات المعروضة ما يلي: (أ) درجة الجودة عبر التشذيب المسبق للقواعد. (ب) نفس القراءة مثل أ) التشذيب اللاحق. (ج) توزيع درجات الجودة على جميع التسلسلات قبل التشذيب. (د) نفس القراءة مثل ج) التشذيب اللاحق. (ه) توزيع GC على جميع التسلسلات قبل التشذيب. (و) نفس القراءة مثل ه) التشذيب اللاحق. يتم زيادة الحد الأدنى لدرجة الجودة في كل موضع ضمن قراءات التسلسل (A ، B) والحد الأدنى لمتوسط جودة التسلسل (C ، D) بعد تشذيب الجودة. علاوة على ذلك ، يمكن أن تقلل هذه الخطوة من الفرق بين توزيع أعداد GC النظرية وعدد GC الفعلي لكل قاعدة في القراءات (E ، F) عن طريق إزالة أزواج القراءات التي تحتوي على نسبة عدم تطابق أساسية عالية. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-4
الشكل 4: أدخل تحليل توزيع الحجم. أدخل الرسم البياني للحجم ل (A) CTCF و (B) H3K27AC و (C) serine 5 phosphorylated RNA polymerase II (RNAPII-S5P). تعرض الرسوم البيانية اختلافات نسبية في توزيع حجم الإدراج بين العينات. يمثل الخط المتقطع في الرسم البياني الكسر التراكمي للقراءات بحجم إدراج أكبر من أو يساوي القيمة الموجودة على المحور السيني. N: عدد القراءات الفريدة المعينة بشكل متناسق لكل عينة بعد الترشيح. FR: شظايا. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-5
الشكل 5: نظرة عامة على المناظر الطبيعية لعينات CUT &RUN. يتم عرض القراءات المعينة ل CUT & RUN المتاحة للجمهور والتي تم تطبيعها بواسطة العد الكسري المقاس (SFRC) بدون ترشيح إضافي (مسارات سوداء) ، وعينات CUT & RUN التي تمت معالجتها بواسطة خط أنابيب تحليل Easy Shells CUTnRUN مع تطبيع SFRC (المسارات الحمراء) و "قراءات طبيعية لكل مليون قراءة معينة في التحكم السلبي (SRPMC ؛ المسارات الخضراء)" في (أ) منطقة مجموعة جينات هيستون ، و (B-D) ثلاث مناطق أخرى بها قمم CTCF و H3K27Ac و RNAPII-S5P التي يطلق عليها جميع المتصلين بالذروة MACS2 و MACS3 و SEACR. تسلط المربعات الصفراء الضوء على موقع إشارات الارتفاع التي تمت تصفيتها أثناء خطوة الترشيح في خط أنابيب تحليل Easy Shells CUTnRUN. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-6
الشكل 6: مخطط Venn للمقارنة بين القمم التي يتصل بها متصلو الذروة المختلفون وخيارات الاتصال بالذروة. (أ) مقارنة بين القمم التي يتم استدعاؤها بواسطة MACS2 و MACS3 مع خيار إدخال IgG وبدونه أثناء استدعاء الذروة. (ب-د) مقارنة بين القمم التي يسدعها SEACR مع وبدون خيار إدخال IgG ، والخيارات "الصارمة" و "المريحة" ، ومع خيار التطبيع باستخدام ملفات أزواج القراءة الأولية (B) ، بدون خيار التطبيع باستخدام ملفات عد القراءة الطبيعية SFRC (C) أو ملفات إعادة قراءة SRPMC الطبيعية (D). (ه، و) مقارنة بين القمم التي يطلق عليها MACS2 و MACS3 مع خيار إدخال IgG و SEACR مع خيار صارم (E) أو مريح (F). (ز ، ح) مقارنة بين القمم التي يسدعها SEACR بدون خيار إدخال IgG ومع خيارات صارمة (G) أو مريحة (H). ث / IgG: قمم تسمى بخيار إدخال IgG. بدون IgG: قمم تسمى بدون خيار إدخال IgG. المعيار: القمم التي تسمى مع خيار التطبيع. لا: قمم تسمى بدون خيار التطبيع. SFRC: القمم التي يتم تسويتها بواسطة ملفات readcounts التي تمت تسويتها بواسطة طريقة "العد الكسري المقلم (SFRC)". SRPMC: القمم التي يتم استدعاؤها بواسطة ملفات readcounts التي تمت تسويتها بواسطة "Spike-in Normalized Reads Per Million Designated Read in in the system system system (SRPMC)". الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-7
الشكل 7: ارتباط بيرسون وتحليل المكون الرئيسي ومخطط Venn للتحقق من صحة التشابه بين التكرارات. (A-C) يعرض تجميع خريطة الحرارة مع قيم معامل ارتباط بيرسون درجة التشابه بين التكرارات عند القمم التي يسدعها MACS2 (A) و MACS3 (B) و SEACR (C)). معامل ارتباط بيرسون في قيمة بين -1 و 1. تشير قيمة معامل ارتباط بيرسون المطلقة الأكبر إلى وجود ارتباط أقوى بين متغيرين ، وتشير قيمة معامل ارتباط بيرسون الإيجابية إلى ارتباط إيجابي ، حيث يتحرك المتغيران في نفس الاتجاه. لذلك ، تظهر العينات ذات التشابه الأعلى نسبا أقرب في تجميع خريطة الحرارة وقيمة معامل بيرسون أعلى. (د) يعرض تحليل المكون الرئيسي (PCA) درجة التشابه بين التكرارات والعينات في جميع مناطق الذروة CTCF و H3K27Ac و RNAPII-S5P التي يطلق عليها MACS2 (يسار) و MACS3 (في الوسط) و SEACR (يمين). يتم وضع العينات ذات التشابه الأعلى بالقرب من بعضها البعض في مخطط PCA. (E-G) تحليل مخطط Venn لمقارنة القمم الموجودة في كل تكرار بواسطة MACS2 (E) و MACS3 (F) و SEACR (G). اقترح خط أنابيب تحليل Easy-Shell CUT & RUN تطبيق جميع الطرق الثلاث لتحديد التكرارات ذات التشابه العالي التي قد تكون مناسبة لدمج القمم المسماة لتحليل المصب. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-8
الشكل 8: خريطة الحرارة وتصور المخطط الوصفي لتوزيع الإشارة عند الذروة. تعرض خريطة الحرارة والمؤامرات الوصفية توزيع الإثراء حول مراكز الذروة التي تسمى باستخدام متصلين مختلفين بالذروة. (أ ، ب) قمم CTCF CUT&RUN التي يتم استدعاؤها من نسخة مكررة واحدة (SRR8581589) بواسطة MACS3 (A) و SEACR (B). (ج، د) يتم استدعاء قمم H3K27Ac CUT &RUN من نسخة مكررة واحدة (SRR8581607) باستخدام MACS3 (C) و SEACR (D). (ه، و) قمم RNAPII CUT & RUN التي يتم استدعاؤها من نسخة مكررة واحدة (SRR8581589) بواسطة MACS3 (E) و SEACR (F). تتم مقارنة أزواج القراءة المعينة المتاحة للجمهور ("عام" في الشكل 8) والأجزاء المعينة بواسطة خط أنابيب تحليل Easy Shells CUTnRUN ("SFRC" في الشكل 8) بعد تطبيع "العد الكسري المتدرج (SFRC)". يتم استدعاء القمم بواسطة MACS3 مع خيار إدخال IgG ("MACS3 w / IgG" في الشكل 8) و SEACR بدون إدخال IgG وبدون خيار التطبيع باستخدام ملفات إعادة قراءة SFRC المعادية في الوضع الصارم ("SEACR w / o IgG غير صارم SFRC" في الشكل 8). يتم إعداد نسختين من ملفات الإحداثيات للقمم المسماة: من البداية إلى النهاية من القمم المسماة ("كاملة" في الشكل 8) وموقع الحاوية مع أعلى إشارة داخل القمم المسماة (القمم في MACS3 تسمى القمم; "مركز" في الشكل 8). الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

الجدول 1: معلومات عن ملفات CUT & RUN fastq في GSE126612. يتم سرد جميع ملفات CUT &RUN fastq التي تقرأ الأولية والتي تم تضمينها في GSE126612 والتي يتم تحديدها كمجموعة بيانات مثال لخط أنابيب تحليل Easy Shells CUTnRUN كجدول. يعرض عمود "اسم الملف" أسماء ملفات CUT & RUN الأولية التي ستقرأ ملفات fastq التي ستظهر في "~ / Desktop / GSE126612 / fastq" بعد تشغيل "Script_02_download-fastq.sh". يشارك "md5sum" MD5 (خوارزمية ملخص الرسائل 5) لمجموعة البيانات النموذجية التي يمكن استخدامها للتحقق من سلامة الملفات بعد تنزيل مجموعة البيانات عبر تشغيل "Script_02_download-fastq.sh". يصف العمود الأخير هدف CUT&RUN لكل عينة. الرجاء النقر هنا لتنزيل هذا الجدول.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تعد القدرة على رسم خريطة لشغل البروتين على الكروماتين أمرا أساسيا لإجراء دراسات ميكانيكية في مجال بيولوجيا الكروماتين. نظرا لأن المختبرات تتبنى تقنيات مختبرية رطبة جديدة لتوصيف الكروماتين ، فإن القدرة على تحليل بيانات التسلسل من تلك التجارب المعملية الرطبة تصبح عنق الزجاجة الشائع لعلماء المختبرات الرطبة. لذلك ، نصف بروتوكولا تمهيديا خطوة بخطوة لتمكين المبتدئين في المعلوماتية الحيوية من التغلب على عنق الزجاجة في التحليل ، وبدء التحليل وفحوصات مراقبة الجودة لبيانات تسلسل CUT &RUN الخاصة بهم.

يصف بروتوكول تحليل CUT&RUN هذا تطبيق عدة خطوات لضمان تحديد الإشارات بحسن نية. تعد إزالة القراءات ذات الجودة الرديئة وتسلسلات المحول من بيانات القراءة الأولية واحدة من أولى خطوات مراقبة الجودة ، وواحدة من أهم الخطوات للحصول على نتائج تحليل دقيقة. لذلك ، يتضمن خط أنابيب التحليل هذا خطوات تشذيب جودة ومحول سهلة التطبيق باستخدام برنامجTrim-galore 27. نظرا لأهمية هذه العملية ، يتضمن خط أنابيب التحليل هذا خطوات لمقارنة جودة النتائج قبل (الخطوة 4.3) وبعد (الخطوة 5.3) عملية التشذيب (الخطوة 5.5). بالإضافة إلى تشذيب الجودة والمحول، يزيل خط أنابيب التحليل هذا أيضا قراءات الكروموسوم غير الأساسية، ومناطق تكرار TA، ومناطق القائمة السوداء، والتي يمكن أن تقدم تحيزا لمحتوى GC والارتفاعات الإيجابية الكاذبة/القمم المسماة. توفر خطوات الترشيح هذه خط أنابيب تمهيديا مناسبا للمبتدئين في المعلوماتية الحيوية لفهم خطوات مراقبة الجودة الحاسمة لتحليل بيانات CUT & RUN.

بعد خطوة الترشيح ، يوفر خط أنابيب تحليل CUT &RUN خيارين للتطبيع: "عدد القراءات الجزئية المقاسة (SFRC) 22" و "قراءات طبيعية لكل مليون قراءة معينة في التحكم السلبي (SRPMC) 24،25 لإنشاء ملفات إدخال لاستدعاء ذروة المصب والتصور. إذا كان من المتوقع أن تكشف مجموعة بيانات CUT & RUN عن الاختلافات المحلية فقط دون اختلافات إشارة على مستوى الجينوم بين العينات ، فقد يكون عدد القراءة الكسري المقاس (جزء التعداد مضروبا في حجم جنوم المرجع) كافيا لتحليل المصب. ومع ذلك ، إذا كان هناك احتمال أن تكون هناك اختلافات في إشارة المقياس العالمي بين عينات CUT & RUN ، فيمكن للمستخدمين اختيار طريقة SRPMC التي تأخذ في الاعتبار نسبة القراءات بين السنبلة والعينة (كل من عينات CUT & RUN التجريبية وعينات التحكم السلبية) جنبا إلى جنب مع تطبيع القراءات لكل مليون (RPM) لقراءات التحكم السلبية لجعل قراءات التحكم السلبية قابلة للمقارنة بين العينات المختلفة. نظرا لأن SRPMC يوفر قراءات طبيعية بالنسبة لقراءات التحكم السلبية الطبيعية ، فإن هذا النهج يقلل من إشارة التحكم السلبية التي تمكن من المقارنة بين مجموعات البيانات التي تم إنشاؤها في دفعات ومجموعات مختلفة.

أحد العوامل المهمة في استدعاء ذروة عينة CUT & RUN هو القضاء على قمم CUT & RUN الإيجابية الخاطئة أثناء التحليل في السيليكو ، جزئيا ، من خلال تضمين عينات IgG. على وجه التحديد ، يوفر خط أنابيب التحليل هذا مناهج اتصال الذروة للمتصلين المختلفين بالذروة للتخلص من CUT &RUN الإيجابي الكاذب المسمى القمم. بالنسبة للمتصلين بذروة MACS2/3، يطبق خط أنابيب التحليل الخاص بنا قراءات IgG الوهمية كعينة إدخال أثناء استدعاء الذروة. بالنسبة إلى SEACR ، يوصي خط أنابيب التحليل هذا باستدعاء القمم للعينات التجريبية وعينات التحكم السلبية بشكل مستقل أولا ، ثم إزالة القمم التي تتداخل بين العينات التجريبية وعينات التحكم السلبية لأن SEACR قد "تخسر" غالبية القمم إذا تم تزويدها بالتحكم السلبي أثناء ذروة استدعاء العينات التجريبية. تظهر القمم المنسقة تشابها مماثلا بين المتصلين والتكرارات المختلفة (الشكل 5). إجمالا ، توفر إزالة الكروموسومات ذات الجودة الرديئة ، والكروموسومات غير القانونية ، ومنطقة القائمة السوداء ، وتكرار TA ، وتقليم تسلسل المحول ، وتطبيع الحمض النووي ، والمعالجة المناسبة للتحكم السلبي أثناء خطوات استدعاء الذروة للمستخدمين ملفات إعادة قراءة مناسبة مناسبة لتحليلات المصب. من خلال ملفات القراءة الطبيعية عالية الجودة والقمم المنسقة ، يمكن للمستخدمين المتابعة لمقارنة التشابه بين النسخ المتماثلة وإنشاء خرائط حرارية ومؤامرات وصفية بإشارة خلفية فائقة النظافة للتحقق من صحة استدعاء الذروة الفعال.

تشير ذروة الاتصال مع قراءات عالية الجودة إلى بدء استخلاص التفسيرات البيولوجية من بيانات CUT & RUN. يصف هذا البروتوكول الحصول على إشارات الذروة المركزة في خرائط الحرارة والمخططات الوصفية عن طريق تعيين أعلى إشارة أو مواقع الإشارة الأكثر دلالة إحصائيا كمراكز الذروة. لا تحدد بعض مناهج الذروة للاتصال أعلى الإشارات أو الإشارات الأكثر دلالة إحصائيا في موقعها المركزي. لذلك ، فإن إعادة تعريف مركز كل ذروة باعتباره أعلى إشارة أو موقع إشارة أكثر دلالة إحصائيا بمثابة خطوة مهمة لإنشاء مخرجات بيانات مرئية مع إشارات مركزة جيدا في وسط المخططات. يتم الاحتفاظ بملفات السرير الأصلية المسماة القمم لإجراء التعليق التوضيحي للذروة وتحليل الصلة الوظيفية كخطوات تالية بعد الانتهاء من الخطوات الموضحة في هذا البروتوكول.

على الرغم من أن خط أنابيب تحليل CUT &RUN يتضمن خطوات لوصف تثبيت البرامج المطلوبة ، إلا أن المبتدئين في المعلوماتية الحيوية قد يواجهون صعوبات في تثبيت أدوات التحليل. لذلك، تم إنشاء صفحة مشكلة Github مقترنة لتوفير أوصاف أكثر تفصيلا خطوة بخطوة لتثبيت البرنامج ولتسهيل الاتصالات لدعم المستخدمين أثناء تثبيت البرنامج في نظامهم الخاص. تتضمن الخطوات التالية في خط أنابيب تحليل CUT &RUN خارج البروتوكول الموضح في هذه المقالة التعليق التوضيحي للذروة ، وتحديد التداخلات بين الأنواع المختلفة من القمم المسماة ، والتعليق التوضيحي الوظيفي للقمم المسماة. سيمكن إكمال خطوات مراقبة الجودة وذروة الاتصال الموصوفة في هذا البروتوكول جنبا إلى جنب مع التعليق التوضيحي لذروة المصب المستخدمين من استخلاص المعنى البيولوجي من بيانات CUT &RUN الخاصة بهم.

تم تصميم خط أنابيب تحليل CUT&RUN هذا لتوفير إرشادات تمهيدية عامة خطوة بخطوة لتحليل CUT&RUN بالجملة. يمتلك خط الأنابيب هذا بعض القيود. أولا ، على الرغم من أن خط أنابيب التحليل هذا يحاول التعامل مع التأثير المدفوع بتباين محتويات GC عن طريق تصفية القراءات على مناطق القائمة السوداء (والتي تشمل "مناطق القطع الأثرية عالية الإشارة" و "مناطق تكرار القطع الأثرية" ، ومناطق تكرار TA) ، قد لا يكون هذا النهج كافيا لبعض الكائنات الحية التي قد تحتوي على محتوى GC مميز على جينومها. لذلك، إذا كان المستخدمون قلقين بشأن أي تحيزات تستند إلى محتوى GC، ففكر في إضافة خطوة أخرى لتصحيح القراءات المعينة. بالنسبة للمبتدئين في المعلوماتية الحيوية ، قد تكون "computeGCBias" و "correctGCBias" في Deeptools خيارين لهذا الهدف. ثانيا ، يتعامل خط أنابيب التحليل هذا مع كل من حجم الإدراج العادي (100 نقطة أساس -1 كيلو بايت) وقراءات حجم الإدراج الصغير (< 100 نقطة أساس) ، والتي قد تكون القراءات الفعلية لبعض البروتينات المرتبطة بالكروماتين ، داخل نفس الملف. نظرا لأن مسار التحليل هذا مكتوب في نصوص shell ، يمكن للمستخدمين تعديل "Script_08_bam-to-BEDPE-BED-bedGraph.sh" للاستيلاء على قراءات حجم الإدراج القصيرة بشكل منفصل عن قراءات حجم الأجزاء العادية أثناء خطوة إنشاء ملف سرير القراءات المعينة. بعد ذلك ، يمكن تطبيع ملف السرير بحجم الإدراج القصير بشكل مستقل عن القراءات المعينة بحجم الإدراج العادي لتقليل تأثير تقليص الحجم. ثالثا ، لتقليل تعقيد خط أنابيب التحليل ، لا يتضمن Easy Shells CUTnRUN خطوة أخذ عينات لأسفل لمطابقة عمق تسلسل عينات CUT & RUN. ومع ذلك ، يمكن للمستخدمين تطبيق خطوة عينة أقل بعد تصفية ملفات bam باستخدام samtools view28 أو PositionBasedDownsampleSam (Picard) 29.

تتم كتابة جميع خطوات التحليل في هذا البروتوكول في نصوص shell لتمكين المبتدئين في المعلوماتية الحيوية من تعلم أساسيات تحليل CUT &RUN من خلال مراجعة البرامج النصية. نتوقع أن يتمكن المستخدمون من ممارسة تحليل المعلوماتية الحيوية بطريقة خطوة بخطوة عن طريق تشغيل كل برنامج نصي للغلاف بالتتابع في المحطة الطرفية. علاوة على ذلك ، فإن بساطة البرامج النصية shell المتوفرة في خط أنابيب تحليل CUT &RUN هذا تسمح للمستخدمين بمراجعة هذه البرامج النصية وتخصيصها لتطبيق خط أنابيب التحليل هذا على بيانات CUT &RUN الخاصة بهم. في النهاية ، نتوقع أن خط أنابيب تحليل CUT &RUN هذا يمكن أن يقلل من الاختناقات الشائعة في عملية تحليل بيانات CUT &RUN لتمكين الباحثين في المختبرات الرطبة والمبتدئين في المعلوماتية الحيوية من استخلاص استنتاجات بيولوجية من بيانات تسلسل CUT &RUN الخاصة بهم.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ولا يعلن أصحاب البلاغ أي إفصاح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم إنشاء جميع الأشكال المصورة باستخدام BioRender.com. تقر CAI بالدعم المقدم من خلال جائزة الباحث الوظيفي المبكر لتحالف أبحاث سرطان المبيض ، ومنحة تسريع مؤسسة فوربيك ، وجائزة أبحاث الكشف المبكر الوطنية لتحالف سرطان المبيض في مينيستوا.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
bedGraphToBigWigENCODEhttps://hgdownload.soe.ucsc.edu/admin/exe/برنامج لضغط وتحويل readcounts bedGraph إلى bigWig
bedtools-2.31.1The Quinlan Lab @ the U. of Utahhttps://bedtools.readthedocs.io/en/latest/index.htmlSoftware لمعالجة ملفات bam / bed / bedGraph
bowtie2 2.5.4جامعةجونز هوبكنزhttps://bowtie-bio.sourceforge.net/bowtie2/index.shtmlبرنامج لبناء مؤشر ربطة العنق وأداء المحاذاة
CollectInsertSizeMetrics (Picard)معهد واسعhttps://github.com/broadinstitute/picardالبرمجيات لإجراء تحليل توزيع حجم الإدراج
CutadaptNBIShttps://cutadapt.readthedocs.io/en/stable/index.htmlبرنامج لأداء تشذيب
المحولDeeptoolsv3.5.1ماكس بلانكhttps://deeptools.readthedocs.io/en/develop/index.htmlبرنامج لإجراء تحليل ارتباط معامل بيرسون ، وتحليل المكون الرئيسي ، وخريطة الحرارة / متوسط المؤامرة
FastQC الإصدار 0.12.0Babraham Bioinformaticshttps://github.com/s-andrews/FastQCSoftware للتحقق من جودة ملف fastq
Intervenev0.6.1علم الأحياء الحسابي & تنظيم الجينات - مجموعة Mathelierhttps://intervene.readthedocs.io/en/latest/index.htmlبرنامج لإجراء تحليل مخطط فين باستخدام ملفات الذروة
MACSv2.2.9.1مبادرة تشان زوكربيرجhttps://github.com/macs3-project/MACS/tree/macs_v2برنامج لاستدعاء القمم
MACSv3.0.2مبادرة تشان زوكربيرجhttps://github.com/macs3-project/MACS/tree/masterبرنامج لاستدعاء القمم
Samtools-1.21معهد ويلكوم سانجرhttps://github.com/samtools/samtoolsبرنامج لمعالجة ملفات sam / bam
SEACRv1.3معهد هوارد هيوز ميديالhttps://github.com/FredHutch/SEACRبرنامج لاستدعاء قمم
مجموعة أدوات SRA الإصدار 3.1.1برنامج NCBIhttps://github.com/ncbi/sra-toolsلتنزيل SRR من GEO
Trim_Galore v0.6.10برنامج Babraham Bioinformaticshttps://github.com/FelixKrueger/TrimGaloreلأداء الجودة والتشذيب المقاوم
معهد

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Hainer, S. J., Fazzio, T. G. High-resolution chromatin profiling using CUT&RUN. Curr Protoc Mol Biol. 126 (1), e85(2019).
  2. Zhang, Y., et al. Model-based analysis of ChiP-Seq (MACS). Genome Biology. 9 (9), R137(2008).
  3. Xu, S., Grullon, S., Ge, K., Peng, W. Stem cell transcriptional networks: Methods and Protocols. , Springer. New York, NY. (2014).
  4. Meers, M. P., Tenenbaum, D., Henikoff, S. Peak calling by sparse enrichment analysis for cut&run chromatin profiling. Epigenetics Chromatin. 12 (1), 42(2019).
  5. Ashburner, M., et al. Gene ontology: Tool for the unification of biology. The gene ontology consortium. Nat Genet. 25 (1), 25-29 (2000).
  6. Harris, M. A., et al. The gene ontology (GO) database and informatics resource. Nucleic Acids Res. 32 (Database issue), D258-D261 (2004).
  7. The Gene Ontology Consortium. The gene ontology resource: 20 years and still going strong. Nucleic Acids Res. 47 (D1), D330-D338 (2019).
  8. Conesa, A., et al. Blast2go: A universal tool for annotation, visualization and analysis in functional genomics research. Bioinformatics. 21 (18), 3674-3676 (2005).
  9. Carbon, S., et al. AmiGO: Online access to ontology and annotation data. Bioinformatics. 25 (2), 288-289 (2009).
  10. Eden, E., Navon, R., Steinfeld, I., Lipson, D., Yakhini, Z. Gorilla: A tool for discovery and visualization of enriched go terms in ranked gene lists. BMC Bioinformatics. 10, 48(2009).
  11. Huang Da, W., Sherman, B. T., Lempicki, R. A. Bioinformatics enrichment tools: Paths toward the comprehensive functional analysis of large gene lists. Nucleic Acids Res. 37 (1), 1-13 (2009).
  12. Huang Da, W., Sherman, B. T., Lempicki, R. A. Systematic and integrative analysis of large gene lists using david bioinformatics resources. Nat Protoc. 4 (1), 44-57 (2009).
  13. Ge, S. X., Jung, D., Yao, R. ShinyGO: A graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  14. Tang, D., et al. SRplot: A free online platform for data visualization and graphing. PLoS One. 18 (11), e0294236(2023).
  15. Ramírez, F., et al. Deeptools2: A next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  16. Robinson, J. T., et al. Integrative genomics viewer. Nat Biotechnol. 29 (1), 24-26 (2011).
  17. Kent, W. J., et al. The human genome browser at ucsc. Genome Res. 12 (6), 996-1006 (2002).
  18. Yu, F., Sankaran, V. G., Yuan, G. -C. CUT&RUNTools 2.0: A pipeline for single-cell and bulk-level CUT&RUN and CUT&Tag data analysis. Bioinformatics. 38 (1), 252-254 (2021).
  19. Zhu, Q., Liu, N., Orkin, S. H., Yuan, G. -C. CUT&RUNTools: A flexible pipeline for CUT&RUN processing and footprint analysis. Genome Biol. 20 (1), 192(2019).
  20. Chris Cheshire, C. -W., et al. Nf-core/cutandrun: Nf-core/cutandrun v3.2.2 iridium ibis. , At https://github.com/nf-core/cutandrun/tree/3.2.2 (2024).
  21. Kong, N. R., Chai, L., Tenen, D. G., Bassal, M. A. A modified CUT&RUN protocol and analysis pipeline to identify transcription factor binding sites in human cell lines. STAR Protoc. 2 (3), 100750(2021).
  22. Meers, M. P., Bryson, T. D., Henikoff, J. G., Henikoff, S. Improved CUT&RUN chromatin profiling tools. eLife. 8, e46314(2019).
  23. Amemiya, H. M., Kundaje, A., Boyle, A. P. The encode blacklist: Identification of problematic regions of the genome. Sci Rep. 9 (1), 9354(2019).
  24. Deberardine, M. BRgenomics for analyzing high-resolution genomics data in R. Bioinformatics. 39 (6), btad331(2023).
  25. Deberardine, M., Booth, G. T., Versluis, P. P., Lis, J. T. The nelf pausing checkpoint mediates the functional divergence of cdk9. Nat Commun. 14 (1), 2762(2023).
  26. Andrews, S. Fastqc: A quality control tool for high throughput sequence data. , At http://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  27. Krueger, F., James, F. O., Ewels, P. A., Afyounian, E., Schuster-Boeckler, B. FelixKrueger/TrimGalore: v0.6.7 - DOI via Zenodo. , (2021).
  28. Mcgaughey, D. Easy bam downsampling. , Available from: https://davemcg.github.io/post/easy-bam-downsampling/ (2018).
  29. Positionbaseddownsamplesam (picard). , GATK Team. At https://gatk.broadinstitute.org/hc/en-us/articles/360041850311-PositionBasedDownsampleSam-Picard (2020).

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

CUT And RUN Bowtie

مقالات ذات صلة