$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
ملاحظة: يتم سرد كافة مجموعات البيانات الأولية المستخدمة في سير العمل في الجدول 1. يتم توفير تفاصيل أدوات المعلوماتية الحيوية في جدول المواد. يمكن ضبط عدد مؤشرات الترابط المستخدمة في خط الأنابيب هذا عن طريق تعديل متغير مؤشرات الترابط المحدد في الجزء العلوي من كل برنامج نصي. يمكن للمستخدمين زيادة العدد لتسريع التحليل اعتمادا على موارد وحدة المعالجة المركزية للمستخدم.
بعد كل خطوة ، يتم إنشاء ملف سجل. لفحوصات الفشل السريعة ، استخدم أوامر مثل cat StepXX_log.txt grep -qF "ERROR" StepXX_log.txt && echo "ERROR found. إصلاح قبل الخطوة التالية." || صدى "موافق: لا توجد علامات خطأ". إذا ظهر أي خطأ ، فتعامل مع الخطوة على أنها فاشلة وحلها أولا.
1. تنزيل خط أنابيب التحليل الكامل من مستودع GitHub
(https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to-visualization/)
- قم بتشغيل واجهة سطر الأوامر (CLI) المناسبة لنظام التشغيل المستخدم.
- Windows: قم بإعداد بيئة Linux باستخدام نظام Windows الفرعي لنظام التشغيل Linux (WSL). اتبع التعليمات الرسمية لتثبيت WSL وتكوينه قبل متابعة32.
- macOS: تابع بدون إعداد إضافي، لأن macOS يستند إلى يونكس. يرجى الرجوع إلى الدليل الرسمي لفتح مبنى المطاررقم 33.
- مستخدمو Linux ، وخاصة أولئك الذين يستخدمون Ubuntu: افتح محطة طرفية كما هو موضح في التعليمات المشار إليها34.
- قم بتشغيل wget https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to-visualization/archive/refs/heads/main.zip -O ~ / pipeline.zip في المحطة الطرفية لتنزيل خط أنابيب لتحديد المحسن وقياس كمية الحمض النووي الريبي المحسن.
- اكتب فك الضغط ~/pipeline.zip -d ~/ في المحطة الطرفية. سيؤدي هذا إلى استخراج جميع الملفات الضرورية في الدليل الرئيسي.
- قم بتشغيل rm ~/pipeline.zip واكتب mv ~/Enhancer-transcript-identification-from-read-to-visualization-main ~/Enhancer-transcript-identification-from-read-to-visualization لإزالة الأرشيف وإعادة تسمية المجلد المستخرج.
- اكتب cd ~/Enhancer-transcript-identification-from-read-to-visualization/، وقم بتشغيل chmod +x scripts/* لجعل جميع البرامج النصية في دليل "scripts/" قابلة للتنفيذ.
2. إعداد بيئة مامبا / كوندا لخط أنابيب التحليل
- اكتب bash scripts/Step1_conda_environment_formation.sh لإنشاء بيئة ظاهرية mamba وتشغيلها. إذا طلب منك ذلك أثناء التنفيذ، فاكتب Y واضغط على Enter لتأكيد عمليات تثبيت الحزمة. بالنسبة لنظام التشغيل macOS، اتبع الخطوة 2.1.1؛ بالنسبة للأنظمة التي تم تثبيت Mamba أو Conda عليها بالفعل ، اتبع الخطوة 2.1.2.
- MacOS: افتح البرنامج النصي واستبدل رابط تنزيل miniconda بإصدار macOS:
https://repo.anaconda.com/miniconda/Miniconda3-latest-MacOSX-x86_64.sh
بعد ذلك، اتبع الخطوة 2.1.
- بمجرد ظهور (enhancer-env) في المطالبة، اكتب bash scripts/Step2_package_installation.sh لتثبيت الحزم المطلوبة للتحليلات النهائية. اكتب Y واضغط على Enter إذا طلب منك ذلك أثناء التثبيت.
- بعد تشغيل الخطوة 2.2 ، تحقق من إخراج المحطة الطرفية بحثا عن أي رسائل خطأ. حل أي مشكلات؛ ثم أعد تشغيل الخطوة 2.2.
- (اختياري) قم بتشغيل قائمة mamba للتأكد من تثبيت جميع الحزم التي تديرها mamba في جدول المواد . يتم تثبيت HOMER يدويا ولن يظهر في قائمة mamba. تحقق من HOMER عن طريق التحقق من وجود دليل "~/homer/".
3. قم بتنزيل مجموعات بيانات ChIP-seq و ATAC-seq و GRO-seq المتاحة للجمهور من SRA (أرشيف قراءة التسلسل)
- قم بتشغيل cp scripts/Step{3..12}_*.sh ./ لنسخ البرامج النصية shell الضرورية لمعالجة القراءة الأولية.
- اكتب bash Step3_download_file_list.sh > Step3_log.txt 2>&1 واضغط على مفتاح Enter لتنزيل بيانات التسلسل الأولية ومعالجتها من SRA.
ملاحظة: يعمل هذا البرنامج النصي على أتمتة تنزيل بيانات التسلسل العام وإعدادها لتحليلها. يقوم بإنشاء بنية مجلد موحدة تحت "MATERIAL/" ، منظمة حسب نوع الفحص وتكرارها (بيولوجي: rep1 / rep2 ؛ تقني: trep1 / trep2). تعمل القائمة المضمنة لأرقام وصول SRA على عمليات الاسترداد باستخدام الجلب المسبق (الإصدار 3.2.0) والتحويل إلى FASTQ باستخدام fastq-dump (الإصدار 3.2.0) (الطرف المقترن: --split-files) والضغط باستخدام pigz (الإصدار 2.8) لتقليل التخزين. تتبع المعالجة الجلب المسبق ، fastq-dump ، pigz ، مع المخرجات المكتوبة إلى الدلائل "00.Rawdata/" المقابلة.
4. أداء مراقبة الجودة وتقليم القراءات الخام
- اكتب bash Step4_read_trimming_and_QC.sh > Step4_log.txt 2>&1 لإجراء تشذيب القراءة ومراقبة الجودة لملفات FASTQ الأولية.
ملاحظة: يعالج هذا البرنامج النصي ملفات FASTQ الأولية من GRO-seq و ATAC-seq و ChIP-seq (H3K27ac و H3K4me1) مع عناصر التحكم في الإدخال المقابلة. يقوم بتشغيل FastQC (v0.12.1)35 على القراءات الأولية ، ثم يقوم بقص المحولات باستخدام Trim Galore (v0.6.10)36 باستخدام معلمات خاصة بالمقايسة. بالنسبة إلى GRO-seq ، فإنه يزيل أولا ذيول NextSeq G وقراءات قصيرة جدا (--nextseq 20 ، --length 20) ، ثم يستخدم Cutadapt (v5.1) 37 لتجريد المسالك الطويلة poly-A مع الاحتفاظ بقراءات أطول من 20 نيوكليوتيد ( -a A{15} ، -m 20). بالنسبة إلى ATAC-seq ، فإنه يعالج مكتبات الطرف المقترن ويستهدف محولات Tn5 / Nextera (--mateed ، --nextera). بالنسبة إلى H3K27ac والمدخلات المقابلة ، فإنه يتعامل مع مكتبات ChIP-seq ذات الطرف المقترن (--مقترنة). بالنسبة إلى H3K4me1 وإدخالاته ، فإنه يقوم بإجراء تشذيب قياسي أحادي الطرف (افتراضي). يتم تشغيل FastQC مرة أخرى على القراءات المقتطعة. تتم كتابة المخرجات إلى دليل "01.Clean/" الخاص بكل فحص ، وتتم إزالة الملفات الوسيطة المقطوعة بمحول GRO-seq.
5. إعداد مؤشر مرجعي Bowtie2
- اختر أحد الخيارين أدناه لإعداد مؤشر جينوم Bowtie2 (v2.5.4) 38 للجينوم المرجعي mm10 (Mus musculus).
- قم بتشغيل bash Step5_1_download_reference_index.sh > Step5_1_log.txt 2>&1 لاستخدام فهرس Bowtie2 المنشأ مسبقا الذي يوفره المطورون.
- ركض باش Step5_2_download_reference_make_index_with_
bowtie2.sh > Step5_2_log.txt 2> و 1 لتنزيل تسلسل جينوم mm10 الخام وبناء الفهرس يدويا.
ملاحظة: يقوم كلا النهجين بإنشاء ملف فهرس إلى الدليل "reference_index/" وهما مكافئان وظيفيا للمحاذاة القياسية.
6. محاذاة القراءات المشذبة إلى الجينوم المرجعي mm10
- اكتب bash Step6_alignment_to_make_bam.sh > Step6_log.txt 2>&1 لمحاذاة قراءات كل فحص للرجوع إلى ملفات BAM وإنشائها.
ملاحظة: تقوم هذه الخطوة بتعيين قراءات كل فحص إلى مرجع mm10 المفهرس مسبقا. يستخدم H3K27ac ChIP-seq والمدخلات المقابلة تعيين الطرف المقترن للحصول على دقة متوازنة (-1 ، -2) مع الحساسية الافتراضية. يستخدم H3K4me1 ChIP-seq والإدخال المقابل تعيين أحادي الطرف ضمن الإعدادات الافتراضية (-U). يستخدم ATAC-seq تعيين عالي الحساسية لاستيعاب الأجزاء المتغيرة الطويلة المشتقة من Tn5 (--حساسة للغاية ، -X 2000) مع إدخال الطرف المقترن (-1 ، -2). يستخدم GRO-seq تعيين عالي الحساسية لوضع قراءات قصيرة ومشذبة بشكل أفضل (--حساسة جدا) مع إدخال أحادي الطرف (-U). يتم تحويل ملفات SAM إلى BAM وتصفيتها باستخدام طريقة عرض samtools (v1.22.1)39 ، باستخدام MAPQ معتدل ل ChIP/الإدخال (-b ، -q 10) وعتبات أكثر صرامة ل ATAC-seq و GRO-seq (-b ، -q 30) ؛ تتم كتابة ملفات BAM النهائية في دليل "02.Align/" الخاص بكل مجموعة بيانات.
7. دمج النسخ المتماثلة الفنية لبيانات H3K27ac ChIP-seq
- قم بتشغيل bash Step7_merge_trep.sh > Step7_log.txt 2>&1 لدمج النسخ المتماثلة التقنية ل H3K27ac ChIP-seq وملفات BAM المدخلة المقابلة.
ملاحظة: يقوم هذا البرنامج النصي بفرز ملفات BAM للنسخ المتماثلة الفنية مع فرز sambamba (v1.0.1)40 ثم يدمج H3K27ac ChIP-seq والنسخ المتماثلة للمدخلات المقابلة في BAMs موحدة مع دمج sambamba. إذا كانت مجموعة بيانات المستخدم لا تحتوي على أي نسخ متماثلة تقنية، فتخطي هذه الخطوة وتابع ملفات BAM الفردية.
8. إزالة التكرارات والكروموسومات غير الأساسية
- قم بإزالة التكرارات وفرز القراءات المعينة ل ChIP-seq و GRO-seq.
- اكتب bash Step8_1_duplicate_removal_sorting-ChIP_GRO.sh > Step8_1_log.txt 2>&1 لإزالة التكرارات من مجموعات بيانات Histone ChIP-seq وفرز كل من BAM إخراج ChIP-seq و GRO-seq.
ملاحظة: يزيل هذا البرنامج النصي تكرارات PCR مع ترميز sambamba (-r) وفرز الإحداثيات مع فرز sambamba. بالنسبة إلى H3K27ac ، تستهدف معالجة BAMs من النسخ المتماثلة التقنية المدمجة ، ومعالجة ChIP والإدخال بشكل منفصل. بالنسبة إلى H3K4me1 ، تتم معالجة كل مكرر ومدخلات متطابقة بشكل فردي. بالنسبة إلى GRO-seq، يتم تخطي إزالة التكرارات وتطبيق فرز الإحداثيات فقط. يتم حفظ المخرجات في دليل "02.Align/" الخاص بكل مجموعة بيانات.
- قم بإزالة التكرارات وتصفية القراءات المعينة بكروموسوم الميتوكوندريا من ATAC-seq.
- اكتب bash Step8_2_duplicate_chrM_removal_sorting_ATAC.sh > Step8_2_log.txt 2>&1 لإزالة تكرارات تفاعل البوليميراز المتسلسل ، وتصفية قراءات الميتوكوندريا (chrM) ، وفرز ATAC-seq BAMs.
ملاحظة: يشير هذا البرنامج النصي إلى توصيات خط أنابيب ENCODE لمعالجة بيانات ATAC-seq. يبدأ بإجراء فرز الاسم باستخدام فرز sambamba (-n) ، وإصلاح معلومات زوج الشريك باستخدام samtools fixmate (-m). تضمن هذه الخطوة تعيين معلومات mate بشكل صحيح قبل وضع علامة على التكرارات. بعد ذلك ، تتم إزالة تكرارات تفاعل البوليميراز المتسلسل باستخدام علامات سامبامبا (-r). تتم إزالة قراءات الميتوكوندريا عن طريق إنشاء قائمة حفظ من samtools idxstats (باستثناء chrM و *) والاحتفاظ بالمراجع المدرجة فقط مع عرض samtools (-b). يتم إجراء فرز الإحداثيات النهائي باستخدام فرز سامبامبا. تتم كتابة BAMs التي تم تنظيفها إلى دليل "02.Align/" الخاص بكل نسخة متماثلة.
9. إجراء استدعاء الذروة لكل مجموعة بيانات
- قم بتشغيل البرنامج النصي للخطوة 9 عن طريق كتابة bash Step9_peak_calling.sh > Step9_log.txt 2>&1 لإجراء استدعاء الذروة لبيانات ChIP-seq و ATAC-seq.
ملاحظة: يقوم هذا البرنامج النصي بإجراء مكالمات ذروة باستخدام MACS3 (الإصدار 3.0.3)41 ل ATAC-seq و ChIP-seq (H3K27ac ، H3K4me1). يولد ATAC-seq قمم من خلال توفير جميع BAMs المكررة كإشارة في وضع عدم وجود نموذج مع تحول / امتداد (-f BAMPE ، --nomodel ، --shift -100 ، --extsize 200 ، -q 0.01). يستدعي H3K27ac قمم واسعة من النسخ المتماثلة التقنية المدمجة مع الإدخال المتطابق (-f BAMPE ، --broad). يتم تكرار كل من عمليات H3K4me1 على حدة مع إدخالاتها المتطابقة في الوضع العريض أحادي الطرف (-f BAM ، --wide) ، ويتم الحصول على قمم متداخلة مع أدوات السرير (v2.31.1) 42 المتقاطعة. تتم كتابة المخرجات إلى دليل "peak_calling/" لكل مجموعة بيانات ، مع قمم H3K4me1 عالية الثقة ضمن "peak_calling / overlapped_peak /".
10. دمج النسخ المتماثلة البيولوجية لملفات ChIP-seq و ATAC-seq BAM لتحليل إشارة المصب
- قم بتشغيل bash Step10_merge_rep_forMakingSignal.sh > Step10_log.txt 2>&1 لدمج ملفات BAM من النسخ المتماثلة البيولوجية ل ATAC-seq و H3K4me1 ChIP-seq.
ملاحظة: يجمع هذا البرنامج النصي بين BAMs المكررة ودمج sambamba ل ATAC-seq و H3K4me1 ChIP-seq وإدخال H3K4me1 المقابل. تدعم BAMs المدمجة التحليلات النهائية (على سبيل المثال ، إنشاء إشارة bigWig ، التطبيع). يتم حفظ BAMs الإخراج في دلائل "merge/02.align/" ضمن كل مسار نموذج.
11. إنشاء أدلة العلامات وإشارات ملفات bigWig من القراءات المعينة
- قم بتشغيل bash Step11_make_tag_to_signal.sh > Step11_log.txt 2>&1 لإنشاء أدلة العلامات وإنشاء ملفات إشارة bigWig للقراءات المعينة لكل مجموعة بيانات.
ملاحظة: يقوم هذا البرنامج النصي بإنشاء أدلة علامات HOMER باستخدام makeTagDirectory ثم يقوم بإنشاء مسارات إشارة bigWig باستخدام الأمر makeUCSCfile باستخدام حزم HOMER (v5.1) 43 و ucsc-bedgraphtobigwig (v482) 44 . يتم إنشاء جميع مسارات الإشارة باستخدام ملفات حجم الكروموسوم من متصفح الجينوم UCSC (https://hgdownload.soe.ucsc.edu/goldenPath/mm10/). تنتج GRO-seq مسارات إشارة خاصة بالخيوط (-style rnaseq ، -strand + / -, -bigWig). ينتج ATAC-seq مسارات غير طبيعية من BAMs المدمجة (-bigWig). ينتج ChIP-seq (H3K27ac ، H3K4me1) مسارات طبيعية للمدخلات بعدد زائف يبلغ 1 (-bigWig ، -i ، -pseudo 1). يتم تنظيم المخرجات تحت "03.TagDir/" و "04.bigwig/".
12. إعداد الملفات لتحديد المحسن
- اكتب bash Step12_E_identification_material.sh > Step12_log.txt 2>&1 في المحطة الطرفية لإعداد الملفات الضرورية والمرجع لتحديد المحسن.
ملاحظة: تقوم هذه الخطوة بتجميع جميع الملفات الضرورية لتحديد المحسن في مجلدات "01.E_identification/material/"، منظمة في مجلدات "ATAC/" و "Histone/" و "Annotation/". يقوم بنسخ ملفات الذروة (ATAC-seq و H3K27ac و H3K4me1) إلى أدلة مناسبة. يتم تنزيل ملف التعليقات التوضيحية GENCODE M23 (mm10) تلقائيا ، ويتم نسخ الملفات المرجعية ، بما في ذلك القائمة السوداء ENCODE45 (mm10-blacklist.v2.bed) وملف حجم الكروموسوم (mm10.chrom.sizes) من مسار محدد مسبقا.
13. تحديد مرشحي المروج والأجسام الجينية من التعليق التوضيحي
- اكتب cd 01.E_identification/ للدخول إلى دليل العمل ، ثم قم بتشغيل cp .. /scripts/Step{13..20}_*.sh ./ لنسخ البرامج النصية لتحديد المحسن.
- قم بتشغيل bash Step13_promoter_candidates_genebody_identification.sh > Step13_log.txt 2> &1 لإنشاء ملفات BED لمناطق المروج وأجسام الجينات والجينات المشفرة للبروتين (PCGs) باستخدام التعليق التوضيحي GENCODE.
ملاحظة: يعالج هذا البرنامج النصي تنسيق نقل الجينات GENCODE M23 الذي تم تنزيله (GTF) لإنشاء ملفات BED لمرشحي المروج ، وجميع الأجسام الجينية ، وأجسام PCG ، مما يوفر المخرجات في "مادة / تعليق توضيحي /". يتم تعريف المروجين على أنهم نافذة 2 كيلوبايت حول TSS (موقع بدء النسخ) الخاص بكل نسخة مع انحدار أدوات السرير (-b 2000 ، -g mm10.chrom.sizes). يتم اشتقاق أجسام ترميز الجينات والبروتين من إدخالات GTF المشروحة كجين ، مع تصفية إدخالات ترميز البروتين بشكل أكبر بواسطة "gene_type = protein_coding".
14. قمم العملية لتحديد المحسن
- قم بتشغيل bash Step14_ATAC_ChIP-seq_processing.sh > Step14_log.txt 2>&1 للمعالجة المسبقة لملفات ذروة ATAC-seq و histone ChIP-seq لتحديد المحسن.
ملاحظة: يقوم هذا البرنامج النصي بمعالجة مجموعات الذروة مسبقا لاستدعاء المحسن. بالنسبة إلى ATAC-seq ، فإنه يزيل المناطق المتداخلة في القائمة السوداء مع طرح أدوات السرير (-A) ثم يستبعد القمم المتداخلة المرشحين المروجين مع طرح أدوات السرير (-A) ؛ بالنسبة لعلامات الهيستون (H3K27ac ، H3K4me1) ، فإنه يوسع بشكل متماثل كل ذروة بمقدار 1 كيلو بايت على كل جانب مع انحدار أدوات السرير (-b 1000 -g mm10.chrom.sizes) ثم يزيل تداخلات المروج مع أدوات السرير.
15. تحديد وتصنيف المعززات
- قم بتشغيل bash Step15_inter_intragenic_E_sets_identification.sh > Step15_log.txt 2>&1 لتحديد وتصنيف المعززات باستخدام بيانات ذروة الكروماتين.
ملاحظة: تحدد هذه الخطوة المعززات وتعلق عليها باستخدام أدوات السرير. يتم الحصول على التداخلات بين قمم ATAC-seq وقمم H3K4me1 الموسعة المنحدرة مع تقاطع (-wa، -u) ، وتصنف المناطق التي تتداخل أيضا مع قمم H3K27ac المحاطة على أنها معززات نشطة مع تقاطع (-wa، -u). يتم اشتقاق المعززات غير النشطة عن طريق إزالة المناطق النشطة من مجموعة المحسن الكامل مع الطرح. يتم جمع قمم ATAC-seq المتداخلة مع كل مجموعة محسنات مع تقاطع (-u) ، ثم يتم تقسيم القمم إلى بين الجينات وداخل الجين مع تقاطع (-v أو -u) ضد جسم الجين. يتم أخيرا تعيين فترات المحسن للفئات بين الجينات / داخل الجينات بناء على القمة المرتبطة بالذروة مع التقاطع (-u). يتم حفظ جميع النتائج في "01.E_identification/" ضمن "01.allE/" و "02.interE/" و "03.intraE/".
16. تعيين معلومات حبلا مؤقتة للمحسنات داخل الجين
- اكتب bash Step16_assign_temp_strand_from_gene_overlap.sh > Step16_log.txt 2>&1 لتعيين معلومات الخيط المؤقتة ل BED المحسن داخل الجين.
ملاحظة: تقوم هذه الخطوة بتعيين تسميات خيوط الجينات إلى المعززات داخل الجينات عن طريق تداخل فترات المحسن مع أجسام الجينات باستخدام أدوات السرير التي تتقاطع (-wa، -wb). يتم الاحتفاظ بالأعمدة 1 و 2 و 3 و 4 و 5 و 16 مع awk ، ثم يتم فرز السجلات وإلغاء تكرارها. يتم حفظ الإخراج ك "03.intraE/strand_designation/01.overlapped_gene_strand/ES_E_intragenic_strand_with_dup.bed".
17. إعطاء الأولوية لتعيين الخيوط للمحسنات المتداخلة مع جينات كلا الخيطين
- اكتب bash Step17_initial_strand_assignment_for_both_strand_enhancers_PCG_based.sh > Step17_log.txt 2> &1 لحل اتجاه الخيط للمحسنات داخل الجينات المتداخلة على كلا الخيطين.
ملاحظة: يحل هذا البرنامج النصي غموض الخيط للمحسنات داخل الجينات المتداخلة على كلا الخيطين من خلال إعطاء الأولوية لتداخلات PCG. يتم عزل المعززات الموجودة على كلا الخيطين أولا (تجميع awk بواسطة chrom / start / end / id / strand) ، ويتم اختيار حالات PCG المتداخلة على نفس الخيط مع تقاطع أدوات السرير (-s ، -wa ، -u) ، ويتم الاحتفاظ بالحالات غير PCG مع تقاطع أدوات السرير (-v). يتم تسلسل المجموعات المحددة والمحتجزة وترتيبها. الإخراج: "03.intraE/strand_designation/02.enhancer_with_PCG_priority/ES_E_intragenic_PCG_priority.bed".
18. احسب القراءات الخاصة بالخيوط لكل كيلو قاعدة لكل مليون قراءة معينة (RPKM) للجينات المتداخلة مع المعززات داخل الجينات ذات الأولوية ل PCG
- اكتب bash Step18_RPKM_cal_from_partially_strand_assigned_enhancers.sh > Step18_log.txt 2>&1 لحساب RPKM الخاص بالخيوط للمحسنات المتداخلة للجينات على نفس الخيط.
ملاحظة: تستخدم هذه الخطوة "ES_E_intragenic_PCG_priority.bed" من الخطوة 17 ، والتي تحتوي على معززات (1) تداخلت مع PCG على خيط واحد وتلقت خيطا ، (2) تداخلت PCGs على كلا الخيوط وظلت غامضة ، أو (3) لم يكن لها تداخل PCG واحتفظت بكلا الخيطين. يتم اختيار الجينات المتداخلة من نفس الخيط مع أدوات السرير التي تتقاطع (-s ، -wa ، -u) ، وتحويلها إلى GTF عبر awk ، ويتم قياسها كميا من GRO-seq باستخدام featureCounts (v2.1.1) 46 وضع العد الخاص بالخيوط (-s 1 ، -t الجين ، -g gene_id ، -O ، --fraction). يتم الحصول على إجمالي القراءات المعينة باستخدام علم سامبامبا ، ويتم حساب RPKM من طول الجينات والأعداد والإجماليات. المخرجات مكتوبة على "03.intraE/strand_designation/03.RPKM_calculation_of_overlapped_gene/".
19. تعيين الخيط النهائي بناء على التعبير الجيني (RPKM) للجينات المتداخلة
- اكتب bash Step19_second_strand_assignment_by_RPKM.sh > Step19_log.txt 2>&1 لإنهاء تعيين الخيوط للمحسنات داخل الجين.
ملاحظة: تقوم هذه الخطوة بتعيين خيوط للمحسنات داخل الجينات باستخدام دعم التعبير الجيني من الخطوة 18. تم العثور على تداخلات نفس الخيط بين المعززات (ES_E_intragenic_PCG_priority.bed) والجينات مع تقاطع أدوات السرير (-s ، -wa ، -wb). يتم ربط قيم RPKM للجين بفترات الجينات عبر awk / sort / join ، مما ينتج عنه BED. لكل محسن ، يتم تحديد الجين المتداخل الذي يحتوي على أعلى RPKM ، ويرث المحسن خيط هذا الجين. يتم حفظ النتائج في "03.intraE/strand_designation/04.enhancer_strand_designation_by_RPKM_of_gene/ES_E_intragenic_PCG_priority_strand_by_gene_RPKM.bed".
20. تعيين معلومات الخيط إلى المعززات داخل الجينات وقمم المحسن
- اكتب bash Step20_strand_assignment_for_intragenicE_and_summits.sh > Step20_log.txt 2>&1 لتعيين معلومات الخيط المقررة لجميع المعززات داخل الجينات وكل قمة.
ملاحظة: تنهي هذه الخطوة تعيين الخيوط للمحسنات داخل الجينات ومطابقة القمم باستخدام أدوات السرير. تتم إزالة الفواصل الزمنية للحبلا المعاكس بالطرح (-S) ، ويتم تقاطع المعززات المعينة للحبلا مع مجموعات نشطة وغير نشطة باستخدام تقاطع (-wa، -u) ، ويتم إعادة تعليق ملفات القمة من خلال القمم المتداخلة مع المعززات المعينة للحبلا عبر تقاطع (-wa، -wb) والحصول على حبلا مع awk. يتم حفظ النتائج في "03.intraE/final_strand_IntragenicE/" ومجلدها الفرعي "summit/".
21. إعداد ملفات الإدخال للتحقق من صحة المحسن وتقدير الحمض النووي الريبي الإلكتروني (eRNA) والتصور
- اكتب قرص مضغوط .. / أو cd ~/Enhancer-transcript-identification-from-read-to-visualization للانتقال إلى جذر خط الأنابيب ، ثم اكتب cp scripts / Step21_preparing_quantification_and_visualization.sh ./ لنسخ البرنامج النصي لإعداد تحليل المصب.
- قم بتشغيل bash Step21_preparing_quantification_and_visualization.sh > Step21_log.txt 2>&1 لإعداد جميع الملفات الضرورية لتجميع المحسن ومعالجة إشارات GRO-seq وقياس كمية eRNA.
ملاحظة: تقوم هذه الخطوة بإعداد ملفات الإدخال وبنية الدليل للتحقق من صحة المحسن وقياس eRNA وتصور الإشارة ضمن "02.E_visualization_quantification/". يتم إنشاء المجلدات الفرعية لملفات bigWig و BEDs المحسنة و BAMs ومصفوفات الإشارة والأعداد والمخططات. يتم نسخ المدخلات الرئيسية مثل BEDs للقمة و bigWigs وقوائم المعززات و GRO-seq BAMs إلى المواقع المناسبة.
22. إنشاء مخططات تجميع للتحقق من صحة المحسن
- اكتب cd 02.E_visualization_quantification/ للدخول إلى دليل العمل ، ثم اكتب cp .. /scripts/Step{22..24}_*.* ./ لنسخ البرامج النصية الضرورية للتحليل النهائي.
- قم بتشغيل bash Step22_generation_of_aggregation_plot.sh > Step22_log.txt 2>&1 لإنشاء مخططات تجميع لإشارات الكروماتين حول كل نوع من أنواع قمة المحسن.
ملاحظة: تصور هذه الخطوة متوسط إثراء إشارة الكروماتين المتمحور حول قمم المحسن باستخدام computeMatrix و plotProfile من deepTools (v3.5.6) 47. لكل مجموعة محسن محددة ، تحسب النقطة المرجعية computeMatrix (--referencePoint center ، -a 5000 ، -b 5000 ، -missingDataAsZero) كثافة الإشارة داخل نافذة 10 كيلوبايت حول قمم المحسن باستخدام ملفات bigWig ل ATAC-seq و H3K27ac و H3K4me1. يتم تمرير مصفوفة الإخراج إلى plotProfile ، والتي تولد منحنيات تجميع الإشارات للمقارنة بين مجموعات المحسنين. يتم حفظ مخططات التجميع في الدليل "01.Profiling/04_1.aggregation/".
23. تحديد وتصور تعبير الحمض النووي الريبي المحسن
- قم بتشغيل bash Step23_quantifing_eRNA_RPKM.sh > Step23_log.txt 2>&1 لتحديد مستويات تعبير eRNA من GRO-seq باستخدام featureCounts.
ملاحظة: تحدد هذه الخطوة نسخ eRNA من مناطق محسن محددة بطريقة خاصة بالخيوط باستخدام GRO-seq. يتم حساب المعززات بين الجينات باستخدام featuresCounts في الوضع غير المجدول (-s 0 ، -t enhancer ، -g gene_id ، -O ، --fraction) ، ويتم قياس المعززات داخل الجينات في وضع antisense (-s 2) لاستبعاد الإشارة من النسخ الجيني المتداخل. يتم تحويل مناطق BED إلى GTF مع awk قبل العد. يأتي إجمالي القراءات المعينة من sambamba flagstat ، ويتم تطبيع الأعداد إلى RPKM باستخدام طول المحسن وعدد القراءة وإجمالي القراءات المعينة. وتنظم النواتج تحت الرقم "02.eRNA_quantification/03.count_normalized_with_RPKM/" بعبارة "inter/" و "intra/".
- قم بتشغيل Rscript Step24_visualization_of_enhancer_transcript. R > Step24_log.txt 2>&1 لتصور ومقارنة مستويات تعبير eRNA عبر مجموعات المحسن باستخدام R.
ملاحظة: يستخدم البرنامج النصي R حزم ggplot2 (v3.5.2)48 و cowplot (v1.2.0)49 لإنشاء مخططات الكمان والصندوق التي تقارن تعبير المحسن النشط وغير النشط بناء على قيم RPKM. للتصور والاختبار الإحصائي، يتم تحويل قيم RPKM إلى السجل2 (RPKM + 1). يتم تقييم الدلالة الإحصائية باستخدام اختبار مجموع رتبة ويلكوكسون. يتم حفظ كل من المخططات الملخصة وجدول p-value في "03.eRNA_visualization/" للتفسير النهائي.
ملاحظة: إذا فشلت أي خطوة في هذا المسار واستمرت حتى بعد إعادة التشغيل، فقم بالإبلاغ عن المشكلة في https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to المرئيات/المشكلات. يضمن تحديد الخطوة الفاشلة بوضوح وإرفاق ملف السجل دعما دقيقا لاستكشاف الأخطاء وإصلاحها.