$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. التثبيت (تخطي إذا اكتمل)
- المتطلبات المسبقه
- قم بتثبيت Anaconda أو Minconda لتحميل المتطلبات لتشغيل المعالجة المسبقة (القسم 5) و WonderPeaks (القسم 6 أو القسم 7).
ملاحظة: للحصول على دليل مستخدم ل Anaconda ، راجع المرجع16.
- قم بتثبيت Python: Python داخل Anaconda أو Miniconda.
- قم بتثبيت Jupyter Notebooks لتنفيذ جميع الوظائف في هذه الطريقة.
ملاحظة: يمكن العثور على دليل مستخدم المبتدئين ل Jupyter Notebooks في المرجع17.
تنبيه: بالنسبة للجينومات الفطرية (≤100 ميجابت في الثانية) ، تأكد من بيئة حوسبة بها 20 نواة على الأقل و 8 جيجابايت من ذاكرة الوصول العشوائي و 30 جيجابايت من مساحة القرص المتاحة.
- تثبيت وظائف المعالجة المسبقة.
- في المحطة الطرفية، نفذ: conda create -n WP_preprocessing
- في المحطة الطرفية ، قم بتنفيذها: conda activate WP_preprocessing
- في المحطة الطرفية ، قم بتنفيذ ما يلي: conda env update --file environment.yml --name
ملاحظة: environment.yml هو ملف يحتوي على جميع تبعيات الحزمة ويجب تنزيله من https://github.com/mgarber21/WonderPeaks_preprocessing.git.
- في المحطة الطرفية ، قم بتنفيذه: pip install WonderPeaks-preprocessing
- في المحطة الطرفية ، قم بتنفيذ : conda deactivate WP_preprocessing
- قم بتثبيت وظائف WonderPeaks:
- في المحطة ، قم بتنفيذ : conda create -n WonderPeaks
- في المحطة ، قم بتنفيذ ما يلي: conda تنشيط WonderPeaks
- في المحطة الطرفية ، قم بتنفيذ ما يلي: conda env update --file environment.yml --name
ملاحظة: environment.yml هو ملف يحتوي على جميع تبعيات الحزمة ويجب تنزيله من https://github.com/mgarber21/WonderPeaks.git.
- في المحطة ، قم بتنفيذه: pip install WonderPeaks
- في المحطة ، قم بتنفيذ ما يلي: conda deactivate WonderPeaks
ملاحظة: تحقق الخطوتان 1.2 و 1.3 ما يلي: تقوم بإنشاء بيئة Conda مخصصة للمعالجة المسبقة (القسم 5) و WonderPeaks (القسمان 6 و 7) ، وعزل التبعيات لتجنب التعارضات مع البرامج الأخرى. يقومون بتنشيط البيئة ، وإعدادها لتثبيت وتشغيل وظائف WP_preprocessing أو WonderPeaks. يقومون بتثبيت تبعيات البرامج والأدوات اللازمة للمعالجة المسبقة للبيانات. يقومون بإلغاء تنشيط البيئة عندما لا تكون قيد الاستخدام لمنع التعديل العرضي وتحرير موارد النظام.
- قم بتنزيل دفاتر ملاحظات Jupyter والقوالب من مستودع WonderPeaks GitHub. قم بتحميل تنزيلات WonderPeaks إلى نظام التشغيل الذي يحتوي على البيانات الأولية (سيتم إنشاء الدليل في القسم 2).
ملاحظة: تحتوي دفاتر ملاحظات Jupyter على برامج نصية وقوالب مكتوبة مسبقا ضرورية لتشغيل مهام سير عمل المعالجة المسبقة و WonderPeaks و PeakStream. يضمن تحميلها إلى نفس النظام مثل البيانات الأولية محاذاة المسارات والدلائل بشكل صحيح.
2. إنشاء دليل بيانات
ملاحظة: تتطلب مهام سير عمل WonderPeaks و PeakStream تخزين جميع البيانات (الأولية والمعالجة) في نفس الدليل. توضح هذه الخطوة كيفية إنشاء هذا الدليل الجديد ({data_directory} = /path/to/your/data) وكيفية نقل البيانات الأولية التجريبية (قراءات التسلسل غير المعالجة) إلى مجلد داخل هذا الدليل يسمى raw_data.
- إنشاء دليل بيانات.
- في المحطة الطرفية، قم بتنفيذ mkdir {data_directory} (على سبيل المثال، mkdir /path/to/your/data)
- قم بإنشاء دليل فرعي للبيانات الأولية لقراءات التسلسل غير المعالجة.
- في المحطة الطرفية ، قم بتنفيذ mkdir {data_directory} / raw_data (على سبيل المثال mkdir / path / to / your / data / raw_data)
- انقل قراءات التسلسل غير المعالجة إلى دليل البيانات الأولية.
- في المحطة ، قم بتنفيذ mv {current_path_to_raw_data} / * fastq * {data_directory} / raw_data (على سبيل المثال ، mv current / data / path / * fastq * / path / to / your / data / raw_data
3. إنشاء ملف مدخلات المستخدم (NGS_user_input.csv)
ملاحظة: يحدد ملف الإدخال التكوينات التي تم إنشاؤها بواسطة المستخدم لتشغيل المعالجة المسبقة و WonderPeaks.
- قم بتنزيل NGS_user_inputs.csv القالب من مستودع WonderPeaks GitHub.
- تحديث الحقول في NGS_user_inputs.csv. قم بتحديث الحقول على النحو التالي:
دليل البيانات: /path/to/your/data
دليل الجينوم: /path/to/your/genome
الجينوم fasta: الجينوم fasta
التعليق التوضيحي للجينوم: genome_annotation.gtf (أدخل اسم ملف التعليق التوضيحي للجينوم بتنسيق GTF)
- احفظ NGS_user_inputs.csv المحدثة في دليل البيانات الذي تم إنشاؤه في القسم 2.
تنبيه: لا تقم بتغيير اسم الملف. لن يتعرف WonderPeaks على هذا الملف إلا إذا تم تسميته NGS_user_input.csv.
4. إنشاء ملف بيانات وصفية (NGS_user_metadata.csv)
ملاحظة: يتم استخدام ملف بيانات التعريف لتخزين أي معلومات ذات صلة بالتجربة. يمكن إضافة أعمدة إضافية لوصف ظروف التجربة، ولكنها لن تؤثر على الخطوات اللاحقة.
- قم بتنزيل NGS_user_metadata.csv القالب من مستودع WonderPeaks GitHub.
- تحديث الحقول في NGS_user_metadata.csv الحقول كما يلي:
- file: تأكد من أن اسم الملف لا يحتوي على مسافات، ويتضمن مقبض الملف (على سبيل المثال، fastq، fastq.gz)، ولا يتضمن المسار المطلق.
- bedgraph: حدد ما إذا كان يجب تضمين الملف في PeakStream عن طريق تعيين هذا الحقل إلى TRUE أو FALSE.
- قم بتعيين حقل bedgraph إلى FALSE عندما يمكن استبعاد الملف بشكل معقول من تحليل PeakStream. على سبيل المثال ، في تجربة RNAseq ، قم بتعيين معلمة bedgraph bedgraph = FALSE للطفرات أو الحالات الأخرى التي لا يتوقع فيها اختلافات UTR بين العينات. ومع ذلك، تأكد من تعيين حقل bedgraph إلى TRUE لجميع ملفات التحكم في تجربة RNAseq ولجميع الملفات في تجربة ChIPseq.
- عامل التصميم
- designfactor1: تحديد عامل تصميم ذي صلة بالتصميم التجريبي (على سبيل المثال، المعالجة أو sample_type).
- designfactor2: تحديد عامل تصميم ثان ذي صلة بالتصميم التجريبي (على سبيل المثال، السلالة أو الحاتمة). بالنسبة لتجربة RNAseq ، قم بتضمين العلاج والإجهاد كعوامل تصميم نموذجية. يسرد عمود العلاج العلاجات المطبقة (على سبيل المثال ، التحكم ، الدواء 1) ، ويسرد عمود الإجهاد معلومات السلالة (على سبيل المثال ، النوع البري ، المتحور). بالنسبة لتجربة ChIPseq ، قم بتضمين sample_type و epitope كعوامل تصميم نموذجية. يسرد العمود sample_type ما إذا كان البروتين قد تم تمييزه أو عدم وضع علامة عليه ، ويسرد عمود الظتمة اسم الحاتمة المستخدمة.
ملاحظة: عوامل التصميم هي سمات خاصة بالتصميم التجريبي.
WonderPeaks متوافق مع عناصر التحكم غير المميزة أو عناصر التحكم في الإدخال كخط أساس.
- تأكد من أن أعمدة عامل التصميم لا تتضمن رقم النسخ المتماثل الفريد (على سبيل المثال، sample_type: [مميز، مميز، untagged_control، untagged_control] وليس sample_type: [tagged_1، tagged_2، untagged_control _1، untagged_control _2]. سيؤدي توفير أرقام نسخ متماثلة فريدة إلى حدوث خطأ أثناء التشغيل.
- تأكد من استخدام الشرطة السفلية (_) بدلا من المسافات في أسماء عوامل التصميم.
- بالنسبة لتطبيق ChIPseq ، تأكد من أن عمود sample_type (أو الاسم المخصص) في ملف بيانات التعريف يتضمن مصطلحات تحتوي على علامة الكلمات والتحكم.
ملاحظة: على سبيل المثال، يمكن أن تتضمن الإدخالات الصالحة علامات وعلامة untagged_control. سيؤدي توفير عمود sample_type بدون هذه المصطلحات إلى حدوث خطأ أثناء التشغيل.
تنبيه: بالنسبة لتطبيق ChIP ، يجب على المستخدم تحديد عاملين للتصميم.
- أضف عوامل التصميم إلى صف NGS_user_inputs.csv ذي الصلة. تأكد من إدراج أسماء الأعمدة المستخدمة لعوامل التصميم كسلسلة منفصلة بفاصلة منقوطة (على سبيل المثال ، المعالجة ؛ سلالة أو sample_type ؛ حاتمة).
تنبيه: يجب أن تتطابق عوامل التصميم في NGS_user_inputs.csv مع أعمدة NGS_user_metadata.csv تماما. سيؤدي أي تشغيل غير متطابق إلى حدوث خطأ أثناء التشغيل (الشكل 2 ، الجدول التكميلي S1 ، والجدول التكميلي S2).

الشكل 2: مثال NGS_user_input.csv و NGS_user_metadata.csv. أمثلة على NGS_user_input.csv (اللوحة العلوية) و NGS_user_metadata.csv (اللوحة السفلية)، مما يبرز التطابق بين عمودي designfactor وdesignfactor بنص وأسهم وردية أو زرقاء. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
5. المعالجة المسبقة لبيانات NGS
ملاحظة: انتقل إلى القسم 5 أو القسم 6 إذا كنت تستخدم المعالجة المسبقة المخصصة.
- افتح جهاز NGS للمعالجة المسبقة Jupyter Notebook (NGS_Preprocessing.ipynb).
- قم بتنشيط WP_preprocessing البيئة (التي تم إنشاؤها في الخطوة 1.2) في الزاوية العلوية اليسرى من واجهة دفتر الملاحظات.
- قم بتنفيذ الخلية الأولى بالضغط باستمرار على مفتاح Shift ثم الضغط على Enter (Shift+Enter).
- في الخلية الثانية من Jupyter Notebook، قم بتحديث مسار الدليل عن طريق تعيين الدليل = "path/to/your/data"، حيث path/to/your/data/ هو الدليل الذي تم إنشاؤه في القسم 2.
- إنشاء ملفات المحاذاة. ستقوم وظائف المعالجة المسبقة بإجراء التشذيب باستخدام FastP18 ؛ مراقبة الجودة باستخدام FastQC19 و MultiQC20 ؛ المحاذاة باستخدام STAR21. يتم حفظ ملفات محاذاة الإخراج في دليل فرعي يسمى startout داخل دليل البيانات (على سبيل المثال ، path/to/your/data/starout) ؛ التصفية (optional) باستخدام عرض samtools22 ، قم بتصفية ملف المحاذاة للاحتفاظ بالقراءات فقط فوق الحد المحدد في NGS_user_inputs.csv.
ملاحظة: ستعالج هذه الوظائف قراءات واحدة فقط (على سبيل المثال ، R1) لمجموعة البيانات في كل مرة. يمكن للمستخدمين تحديد خيارات التشغيل ل FastP و STAR في NGS_user_inputs.csv (على سبيل المثال ، FastP: adapter_sequence (اختياري) ؛ STAR: genomeDir ، genomeFastaFiles ، sjdbGTFfil).
- قم بتنفيذ وظائف المعالجة المسبقة في الخلية الثانية باستخدام Shift + Enter.
ملاحظة: قد تستغرق المهام الموجودة في الخلية الثانية عدة ساعات لإكمالها. إذا تمت مقاطعة التشغيل، كرر الخطوات 5.3-5.6 لإعادة تشغيل التشغيل. لن يتم استبدال التقدم المحرز من الخطوات السابقة ، وستستمر العملية من حيث توقفت.
- قم بإنشاء ملفات تتبع لتغطية المحاذاة باستخدام BamCoverage23 (راجع الخطوتين 5.7.1 و 5.7.2).
ملاحظة: بالنسبة إلى ChIPseq ، يتطلب WonderPeaks ملفات مخطط سرير واحد تحتوي على تغطية لكل من القراءات الأمامية والخلفية. بالنسبة إلى RNAseq مع تحضير Poly (A) ، يتطلب PeakStream ملفين للرسم البياني ، أحدهما للقراءات الأمامية (_fwd.bedgraph) والآخر للقراءات العكسية (_rev.bedgraph). يتم إنشاء القراءات الأمامية والعكسية باستخدام معلمة filterRNAstrand داخل BamCoverage23.
- ChIPseq باستخدام المعلمات التالية: outfilfeformat = "bedgraph" ، strand = لا شيء ، binsize = 20 ، smoothLength = 60 ، minMappingQuality = 255 ، normalizeUsing = "CPM".
ملاحظة: الإخراج: ينتج ملفات رسم بياني أحادي تحتوي على تغطية لكل من القراءات الأمامية والخلفية. يتم تخزين الإخراج في /path/to/your/data/bedgraphout (الشكل 3).
- قم بتنفيذ وظيفة BamCoverage في الخلية الثالثة باستخدام Shift + Enter.
- RNAseq باستخدام المعلمات التالية: outfilfeformat = "bedgraph" ، strand = "forward" أو "reverse" ، binsize = 20 ، smoothLength = 60 ، minMappingQuality = 255 ، normalizeUsing = "CPM".
تنبيه: تأكد من تنفيذ الوظيفة مرتين مع ضبط الخصلة على الأمام أو الخلف لإنشاء ملفات للقراءة في كلا الاتجاهين.
ملاحظة: الإخراج: ينتج ملفين للرسم البياني للمجموعة: أحدهما للقراءات الأمامية (_fwd.bedgraph) والآخر للقراءات العكسية (_rev.bedgraph). يتم تخزين الإخراج في /path/to/your/data/ bedgraphout (الشكل 3).
- قم بتنفيذ وظيفة BamCoverage في الخلية الثالثة باستخدام Shift + Enter.

الشكل 3: تنظيم الملفات ل WonderPeaks. لقطة شاشة لمجلد البيانات مع ملفات bedgraph في الدليل bedgrapghout/normalizeUsingCPM. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
6. WonderPeaks ل ChIPseq
- الفحص المسبق
- تأكد من أن جميع ملفات bedgraph باستخدام filehandle .bedgraph موجودة في دليل فرعي داخل دليل البيانات يسمى bedgraphout (الشكل 3).
- تأكد من أن عوامل التصميم في ملف user_inputs (NGS_user_inputs.csv) (الشكل 2) تتطابق مع الأعمدة الموجودة في ملف بيانات التعريف (NGS_user_metadata.csv) وأن صفوف أعمدة عامل التصميم ليست فريدة (راجع التحذير في الخطوة 4.2.4).
- افتح دفتر ملاحظات Jupyter للمعالجة المسبقة ل NGS (WP4ChIP.ipynb).
- قم بتنشيط WonderPeaks (البيئة التي تم إنشاؤها في الخطوة 1.3) في الزاوية العلوية اليمنى من واجهة الكمبيوتر المحمول.
- قم بتنفيذ الخلايا باستخدام Shift+Enter حتى نقطة التوقف لتشغيل استدعاء الذروة. بمجرد الانتهاء ، سيتم حفظ سجل للبيانات التي تمت معالجتها وتخزينه في دليل فرعي داخل دليل البيانات يسمى WonderPeaks
- ابحث عن WOnder_init.csv: تسلسل لجميع التغطية الأولية والنتائج من حساب المشتق الأول.
- ملاحظة WOnder_unfiltered_peaks.csv: تسلسل لجميع القمم غير المفلترة تسمى بناء على المشتق الأول.
- لاحظ bedgraph_summary.csv: ملخص لإحصائيات الدرجات بعد تجميع كل ملف وكروموسوم.
- تحديد معلمات التشغيل:
- قم بتشغيل الخلية 1أسفل نقطة توقف التخفيض.
ملاحظة: ستظهر قطعة أرض تعرض البيانات الأولية المنفصلة عن عوامل التصميم المحددة وجدول يوضح عوامل التصميم ؛ استخدم الجدول والمخطط لتحديد القيم في الخطوات اللاحقة (الشكل 4).
- في الخلية التالية، حدد قيم score_cut و fold_change وdesignfactor (الشكل 4).
- score_cut هي قيمة العتبة المستخدمة لتحديد ما إذا كان سيتم النظر في الذروة في المخرجات. لتحديد score_cut ، راقب المؤامرة واختر قيمة قريبة من متوسط البيانات الموسومة (انظر الخط المجزأ ، الشكل 4). أدخل هذه القيمة على النحو التالي: score_cut = القيمة.
- fold_change هي قيمة العتبة لدرجات نسبة Tagged:untagged المستخدمة لتحديد ما إذا كانت الذروة تعتبر حقيقية أم لا. لتحديد fold_change ، راقب المخطط واختر قيمة أعلى من نسبة متوسطات البيانات غير الموسومة والمميزة. أدخل هذه القيمة على النحو التالي: fold_change= القيمة.
- تم تحديد designfactor_value كجزء من التصميم التجريبي. يتم سرد عوامل التصميم المحتملة باللون الأحمر في الجدول المطبوع. لتحديد عامل التصميم، اختر إحدى القيم المدرجة باللون الأحمر. أدخل هذه القيمة بين علامات الاقتباس على النحو التالي: designfactor_value ="{ value}".
- قم بتنفيذ الخلايا التالية باستخدام Shift + Enter لتشغيل تصفية الذروة وتعيينها. سيتم تخزين البيانات والمخططات الملخصة في دليل فرعي داخل دليل البيانات يسمى WonderPeaks.
- لاحظ {designfactor_value}_taggedVuntagged.csv: جدول محوري لجميع القمم المتداخلة مع عمود لكل من العينات ذات العلامات وغير المميزة.
- ملاحظة {designfactor_value}_all_tagged_peaks.csv: جدول ملخص لجميع القمم الحقيقية، استنادا إلى معلمات المستخدم (الخطوة 6.5).
- لاحظ {designfactor_value}_peaks2gtf.csv: تعيين القمم الحقيقية ، بناء على معلمات المستخدم (الخطوة 6.5) ، إلى الجينات الموجودة في ملف التعليقات التوضيحية المحدد للمستخدم.
- اختياري: قم بتبديل المعلمات في الخطوة 6.5 عن طريق إعادة تنفيذ الخطوات 6.5-6.6. في حالة استخدام نفس designfactor_value، سيتم استبدال الملفات التي تم إنشاؤها، كما هو موضح في الخطوة 6.6.

الشكل 4: لقطة شاشة تسلط الضوء على designfactor_value والعتبات المحددة من قبل المستخدم في WonderPeaks ل ChIP-seq. لقطة شاشة لدفتر ملاحظات WonderPeaks jupyter ، مع تسليط الضوء على خيارات designfactor_value الممكنة من الجدول المعروض ، وكيفية تنفيذ designfactor_value في الخلية التالية. يشير السهم الأسود العلوي إلى جدول يعرض إدخالات designfactor_value المحتملة. يتم وضع دائرة حول قيمة Op وتظهر كإدخال المستخدم المحدد ل designfactor_value في خلية الخيارات (السهم الأسود السفلي). في الرسم البياني ، تشير الخطوط الصلبة والمتقطعة إلى متوسط درجات الذروة التقريبية للعينات الموسومة وغير الموسومة ، على التوالي ، في تجارب الخلايا غير الشفافة. تستخدم هذه المتوسطات لتحديد معلمات score_cut (الوسيط المميز) و fold_change (نسبة المتوسطات الموسومة إلى غير المميزة). الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
7. PeakStream ل 3'RNAseq
- الفحص المسبق:
- تأكد من وجود جميع ملفات bedgraph في دليل فرعي داخل دليل البيانات يسمى bedgraphout (الشكل 2).
- افتح جهاز NGS للمعالجة المسبقة Jupyter Notebook (PeakStream.ipynb)
- قم بتنشيط WonderPeaks (البيئة التي تم إنشاؤها في الخطوة 1.3) في الزاوية العلوية اليمنى من واجهة الكمبيوتر المحمول.
- قم بتنفيذ الخلايا باستخدام Shift+Enter حتى نقطة التوقف لتشغيل استدعاء الذروة وتعيين الذروة. بمجرد الانتهاء ، سيتم حفظ ملف تعليق توضيحي جديد يحتوي على ملفات UTRs المتوقعة 3 بوصات و FeatureCounts24 وتخزينها في دليل فرعي داخل دليل البيانات الخاص بك يسمى PeakStream (الشكل 5).
ملاحظة: بشكل افتراضي ، سيتضمن ملف الإخراج فقط تعليقات توضيحية للأنماط الحيوية لترميز البروتين ، ولكن يمكن تبديل ذلك باستخدام خيار النمط الحيوي.

الشكل 5: تنظيم الملفات ل PeakStream. لقطة شاشة لمجلد البيانات مع ملفات bedgraph في دليل bedgrapghout. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.