مقالة منهجية

خوارزميات استدعاء الذروة (WonderPeaks و PeakStream) كأدوات لتحسين ChIP-seq وتحليل النسخ في مسببات الأمراض الفطرية

DOI:

10.3791/68301

أغسطس 8, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقدم هذا التقرير WonderPeaks ، وهي أداة حسابية جديدة لتحليل بيانات RNA-seq و ChIP-seq. تحدد هذه الأداة بنجاح القمم (قراءة التراكمات) في تسلسل البيانات ، مما يتيح توصيف حدود المنطقة غير المترجمة في تسلسل الحمض النووي الريبي واكتشاف إثراء الكروماتين في ChIP-seq ، مما يوفر رؤى قيمة لأبحاث مسببات الأمراض الفطرية.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

أصبح توصيف التغييرات في التعبير الجيني من خلال النسخ ونشاط منظم النسخ نهجا أساسيا لفهم الاستجابات المتنوعة التي ينطوي عليها التسبب الفطري. تقدم هذه الورقة أداتين حسابيتين مصممتين لمعالجة التحديات الرئيسية في دراسة تنظيم النسخ في مسببات الأمراض الفطرية ، لا سيما غير النموذجية ذات التعليقات التوضيحية الجينومية المحدودة. أولا ، نقدم WonderPeaks ، وهي خوارزمية جديدة لاستدعاء الذروة تستفيد من المشتق الأول من البيانات الجينومية المعينة من تجارب تسلسل الجيل التالي (NGS) لتحديد القمم المخصبة في Chromatin ImmunoPrecipitation متبوعا بالتسلسل (ChIP-seq). ثانيا ، نقدم PeakStream ، وهو امتداد ل WonderPeaks للتعليق على 3 مناطق غير مترجمة (UTRs) في البيانات النسخية التي تم إنشاؤها باستخدام إعداد مكتبة بولي (A). توفر هذه الأدوات معا خط أنابيب تحليل بيانات شامل ، مما يوفر حلا سهل الاستخدام للباحثين الذين يدرسون تنظيم النسخ في الفطريات. نثبت فعاليتها من خلال بيانات من العامل الممرض الفطري المبيضات البيضاء ، وتحديد القمم التي تم التحقق منها في بيانات ChIP-seq والتعليق على UTRs التي تم التحقق من صحتها من خلال المقارنة مع إجمالي بيانات تسلسل الحمض النووي الريبي في ظل نفس الظروف. نناقش أيضا قيود WonderPeaks لبيانات ChIP-seq مقارنة بأحدث الأساليب الحالية ونقترح توجيهات للتحسينات المستقبلية. في النهاية ، يوفر هذا العمل إرشادات عملية وموارد قوية لدراسة تنظيم النسخ ، مع صلة فورية بالفطريات المسببة للأمراض والتطبيقات المحتملة في الدراسات الجينومية الأوسع.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تعد مسببات الأمراض الفطرية مصدر قلق صحي عالمي ناشئ ، حيث ارتفعت الإصابات في السنوات الأخيرة1. تظهر العديد من مسببات الأمراض مقاومة عالية للفطريات وترتبط بمعدلات وفيات كبيرة2. ومع ذلك ، بالمقارنة مع الكائنات الفطرية النموذجية ، لا تزال العديد من الفطريات المسببة للأمراض سيئة الوصف ، مما يسلط الضوء على الحاجة إلى مزيد من البحث في آليات إمراضها. تلعب تقنيات تسلسل الجيل التالي (NGS) مثل تسلسل الترسيب المناعي للكروماتين (ChIP-Seq) وتسلسل الحمض النووي الريبي (RNA-Seq) دورا مهما في الكشف عن الآليات الجزيئية للتعبير الجيني الكامن وراء الإمراضية الفطرية.

تعتمد جودة الرؤى المستمدة من بيانات NGS بشكل كبير على دقة البرنامج المستخدم لتحليل البيانات الأولية. من بين التحديات الرئيسية لتحليل بيانات NGS هو استدعاء الذروة - التحديد الدقيق لمناطق قراءات NGS المخصبة - وهو أمر معقد بشكل خاص بسبب التنوع الواسع في تقنيات إعداد المكتبات وتسلسلها ، مما يجعل الحل الشامل غير عملي. تعتبر خوارزمية MACS3 ، بما في ذلك إصدارها الأحدث ، MACS3 ، على نطاق واسع المعيار الذهبي لتحليل مجموعات بيانات ChIP-seq. ومع ذلك ، يعتمد MACS على المعلمات المحددة من قبل المستخدم - مثل الحد الأدنى لطول الذروة والحد الأقصى للفجوة - والتي قد لا تكون قابلة للتطبيق عالميا وغالبا ما يصعب تحديدها قبل التحليل. والجدير بالذكر أن أحدث إصدار من MACS3 يتضمن ميزة تحليل القطع التي تسمح للمستخدمين بتقدير المعلمات قبل ذروة الاتصال. لتحسين الأداء ، يمكن للمستخدمين أيضا تقديم قائمة بالمناطق الجينومية "المدرجة في القائمة السوداء" المعروفة بإدخال التحيز بسبب بنية الكروماتين أو اختلاف رقم النسخ. في حين أن MACS لا تزال أداة استدعاء الذروة الأكثر استخداما وموثوقية لبيانات ChIP-seq ، إلا أن القليل من الخوارزميات البديلة متاحة ، خاصة بالنسبة للحالات التي تتطلب إعدادات معلمات مصممة للغاية.

RNA-Seq هي تقنية لا تقدر بثمن لدراسة استجابات التعبير الجيني للفطريات المسببة للأمراض أثناء النمو في الجسم الحي ، كما هو الحال في زراعة الأنسجة أو نماذج عدوى الفئران4،5،6،7. مطلوب عمق تسلسل عال لتحليل التعبير التفاضلي الدقيق في هذه الظروف ، والذي يمكن أن يكون باهظ التكلفة والموارد8،9. يمكن أن تساعد طرق إعداد المكتبة مثل تسلسل أولي poly-adenylation (poly (A)) (3'RNA-Seq) ، والتي تستخدم بادئات مصممة لتلدين ذيول poly (A) من mRNA لتوليد الحمض النووي (cDNA) ، في تقليل عمق التسلسل اللازم لتحليل التعبير الجيني10. ومع ذلك ، يعتمد هذا النهج على التعليقات التوضيحية الجينومية عالية الجودة ، لا سيما في 3 'مناطق غير مترجمة (UTRs) ، حيث توجد القمم من أحداث تحضير poly (A) عادة11. تفتقر التعليقات التوضيحية الجينومية للعديد من مسببات الأمراض الفطرية التي لم تتم دراستها جيدا إلى أي تعليقات توضيحية UTR ، مما يجعل استخدام 3'RNA-Seq في هذه الكائنات الحية أمرا صعبا. بالإضافة إلى ذلك ، يمكن أن يكون طول UTR لجين واحد ديناميكيا عبر ظروف النمو المختلفة وأنواع الخلايا12،13. بينما تم تطوير عدد من أدوات التحليل الجديدة لتحديد UTRs والتعليق عليها ، فقد تم تصميم العديد منها لمجموعات بيانات الثدييات ، التي يختلف تنظيمها الجيني اختلافا كبيرا عن تنظيم الفطريات ، أو تتطلب بيانات من تجارب التسلسل المستقلة ، مثل تسلسل mRNA أحادي الخلية أو العكسي ، والتي يمكن أن تزيد من الوقت والتكاليف للباحث الذي يتطلع إلى إجراء تحليل النسخ12 ، 14،15.

في هذه الورقة ، نقدم WonderPeaks ، وهو برنامج جديد لاستدعاء الذروة ، مصمم وفقا لمبادئ المشتق الأول ، والذي يمكن استخدامه لاستدعاء الذروة ديناميكيا في مجموعات بيانات NGS (الشكل 1). يحدد WonderPeaks القمم عن طريق حساب المشتق الأول لإشارة التغطية واستخدام هذه القيمة - ميل الذروة - لتحديد القمم المحتملة. تبحث الخوارزمية عن الحالات التي يظهر فيها المشتق الأول حدا أقصى محليا أعلى من عتبة المنحدر التي يوفرها المستخدم أو المستنبطة من البيانات (تشير إلى إشارة متزايدة) ، متبوعا بحد أدنى محلي أعلى من نفس العتبة (يشير إلى إشارة متناقصة) ، وبالتالي الكشف عن جميع القمم المرشحة في مجموعة البيانات. بالنسبة لتطبيقات ChIP-seq ، يقارن WonderPeaks جميع القمم المرشحة بين عينات الاختبار والتحكم لتحديد القمم المخصبة بشكل فريد. من خلال تطبيق WonderPeaks على مجموعة بيانات ChIP-seq المنشورة سابقا لعامل النسخ في العامل الممرض الفطري Candida albicans16 ، أظهرنا قدرته على تحديد القمم بنجاح في المنبع للجينات الرئيسية التي تم تسليط الضوء عليها في الدراسة الأصلية ، مع مناقشة القيود الحالية للخوارزمية في هذا التطبيق.

نقدم أيضا PeakStream ، وهي أداة برمجية تستفيد من WonderPeaks لتحديد القمم في مجموعات بيانات 3'RNA-Seq. 3 تعتمد مكتبات RNA-Seq على تعليقات توضيحية دقيقة 3 بوصات UTR ، حيث أن القراءات التي تم إنشاؤها من خلال تحضير poly (A) غالبا ما تمتد إلى ما وراء الكودون التوقف لتسلسلات الترميز (CDS) للجينات وبالتالي لا يتم حسابها عند استخدام التعليقات التوضيحية القياسية التي تركز فقط على مناطق الترميز. تم تصميم خط أنابيب تحليل PeakStream لإنشاء تعليقات توضيحية جديدة للجينوم باستخدام بيانات 3 'RNA-Seq ، مع التركيز على المناطق اللاحقة لمناطق تسلسل ترميز الجينات (CDS). يعين PeakStream هذه القمم للجينات ، مما يؤدي إلى إنشاء تعليق توضيحي جديد للجينوم لاستخدامه في برامج عد القراءة النهائية. نوضح أن استخدام PeakStream يمكن أن يحدد بدقة وتعيين القمم التي تم إنشاؤها بواسطة poly (A) في اتجاه مجرى النهر للجين المناسب في مجموعة بيانات 3'RNA-Seq C. albicans . يعلق PeakStream أيضا على القمم التي من غير المحتمل أن ترتبط بأي تعليقات توضيحية جينية حالية ، مما يسهل اكتشاف النصوص الجديدة المحتملة. يمثل PeakStream و WonderPeaks معا مجموعة قوية من الأدوات سهلة الاستخدام لاكتشاف الذروة في مجموعات بيانات تسلسل الجيل التالي (NGS).

figure-introduction-1
الشكل 1: نظرة عامة على رقم استدعاء الذروة بواسطة WonderPeaks و PeakStream. على اليسار: ذروة الاتصال باستخدام المشتق الأول. أعلى اليمين: استدعاء الذروة على مجموعات بيانات ChIP-Seq باستخدام WonderPeaks. أسفل اليمين: استدعاء الذروة على مجموعات بيانات RNA-Seq باستخدام PeakStream. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. التثبيت (تخطي إذا اكتمل)

  1. المتطلبات المسبقه
    1. قم بتثبيت Anaconda أو Minconda لتحميل المتطلبات لتشغيل المعالجة المسبقة (القسم 5) و WonderPeaks (القسم 6 أو القسم 7).
      ملاحظة: للحصول على دليل مستخدم ل Anaconda ، راجع المرجع16.
    2. قم بتثبيت Python: Python داخل Anaconda أو Miniconda.
    3. قم بتثبيت Jupyter Notebooks لتنفيذ جميع الوظائف في هذه الطريقة.
      ملاحظة: يمكن العثور على دليل مستخدم المبتدئين ل Jupyter Notebooks في المرجع17.
      تنبيه: بالنسبة للجينومات الفطرية (≤100 ميجابت في الثانية) ، تأكد من بيئة حوسبة بها 20 نواة على الأقل و 8 جيجابايت من ذاكرة الوصول العشوائي و 30 جيجابايت من مساحة القرص المتاحة.
  2. تثبيت وظائف المعالجة المسبقة.
    1. في المحطة الطرفية، نفذ: conda create -n WP_preprocessing
    2. في المحطة الطرفية ، قم بتنفيذها: conda activate WP_preprocessing
    3. في المحطة الطرفية ، قم بتنفيذ ما يلي: conda env update --file environment.yml --name
      ملاحظة: environment.yml هو ملف يحتوي على جميع تبعيات الحزمة ويجب تنزيله من https://github.com/mgarber21/WonderPeaks_preprocessing.git.
    4. في المحطة الطرفية ، قم بتنفيذه: pip install WonderPeaks-preprocessing
    5. في المحطة الطرفية ، قم بتنفيذ : conda deactivate WP_preprocessing
  3. قم بتثبيت وظائف WonderPeaks:
    1. في المحطة ، قم بتنفيذ : conda create -n WonderPeaks
    2. في المحطة ، قم بتنفيذ ما يلي: conda تنشيط WonderPeaks
    3. في المحطة الطرفية ، قم بتنفيذ ما يلي: conda env update --file environment.yml --name
      ملاحظة: environment.yml هو ملف يحتوي على جميع تبعيات الحزمة ويجب تنزيله من https://github.com/mgarber21/WonderPeaks.git.
    4. في المحطة ، قم بتنفيذه: pip install WonderPeaks
    5. في المحطة ، قم بتنفيذ ما يلي: conda deactivate WonderPeaks
      ملاحظة: تحقق الخطوتان 1.2 و 1.3 ما يلي: تقوم بإنشاء بيئة Conda مخصصة للمعالجة المسبقة (القسم 5) و WonderPeaks (القسمان 6 و 7) ، وعزل التبعيات لتجنب التعارضات مع البرامج الأخرى. يقومون بتنشيط البيئة ، وإعدادها لتثبيت وتشغيل وظائف WP_preprocessing أو WonderPeaks. يقومون بتثبيت تبعيات البرامج والأدوات اللازمة للمعالجة المسبقة للبيانات. يقومون بإلغاء تنشيط البيئة عندما لا تكون قيد الاستخدام لمنع التعديل العرضي وتحرير موارد النظام.
  4. قم بتنزيل دفاتر ملاحظات Jupyter والقوالب من مستودع WonderPeaks GitHub. قم بتحميل تنزيلات WonderPeaks إلى نظام التشغيل الذي يحتوي على البيانات الأولية (سيتم إنشاء الدليل في القسم 2).
    ملاحظة: تحتوي دفاتر ملاحظات Jupyter على برامج نصية وقوالب مكتوبة مسبقا ضرورية لتشغيل مهام سير عمل المعالجة المسبقة و WonderPeaks و PeakStream. يضمن تحميلها إلى نفس النظام مثل البيانات الأولية محاذاة المسارات والدلائل بشكل صحيح.

2. إنشاء دليل بيانات

ملاحظة: تتطلب مهام سير عمل WonderPeaks و PeakStream تخزين جميع البيانات (الأولية والمعالجة) في نفس الدليل. توضح هذه الخطوة كيفية إنشاء هذا الدليل الجديد ({data_directory} = /path/to/your/data) وكيفية نقل البيانات الأولية التجريبية (قراءات التسلسل غير المعالجة) إلى مجلد داخل هذا الدليل يسمى raw_data.

  1. إنشاء دليل بيانات.
    1. في المحطة الطرفية، قم بتنفيذ mkdir {data_directory} (على سبيل المثال، mkdir /path/to/your/data)
  2. قم بإنشاء دليل فرعي للبيانات الأولية لقراءات التسلسل غير المعالجة.
    1. في المحطة الطرفية ، قم بتنفيذ mkdir {data_directory} / raw_data (على سبيل المثال mkdir / path / to / your / data / raw_data)
  3. انقل قراءات التسلسل غير المعالجة إلى دليل البيانات الأولية.
    1. في المحطة ، قم بتنفيذ mv {current_path_to_raw_data} / * fastq * {data_directory} / raw_data (على سبيل المثال ، mv current / data / path / * fastq * / path / to / your / data / raw_data

3. إنشاء ملف مدخلات المستخدم (NGS_user_input.csv)

ملاحظة: يحدد ملف الإدخال التكوينات التي تم إنشاؤها بواسطة المستخدم لتشغيل المعالجة المسبقة و WonderPeaks.

  1. قم بتنزيل NGS_user_inputs.csv القالب من مستودع WonderPeaks GitHub.
  2. تحديث الحقول في NGS_user_inputs.csv. قم بتحديث الحقول على النحو التالي:
    دليل البيانات: /path/to/your/data
    دليل الجينوم: /path/to/your/genome
    الجينوم fasta: الجينوم fasta
    التعليق التوضيحي للجينوم: genome_annotation.gtf (أدخل اسم ملف التعليق التوضيحي للجينوم بتنسيق GTF)
  3. احفظ NGS_user_inputs.csv المحدثة في دليل البيانات الذي تم إنشاؤه في القسم 2.
    تنبيه: لا تقم بتغيير اسم الملف. لن يتعرف WonderPeaks على هذا الملف إلا إذا تم تسميته NGS_user_input.csv.

4. إنشاء ملف بيانات وصفية (NGS_user_metadata.csv)

ملاحظة: يتم استخدام ملف بيانات التعريف لتخزين أي معلومات ذات صلة بالتجربة. يمكن إضافة أعمدة إضافية لوصف ظروف التجربة، ولكنها لن تؤثر على الخطوات اللاحقة.

  1. قم بتنزيل NGS_user_metadata.csv القالب من مستودع WonderPeaks GitHub.
  2. تحديث الحقول في NGS_user_metadata.csv الحقول كما يلي:
    1. file: تأكد من أن اسم الملف لا يحتوي على مسافات، ويتضمن مقبض الملف (على سبيل المثال، fastq، fastq.gz)، ولا يتضمن المسار المطلق.
    2. bedgraph: حدد ما إذا كان يجب تضمين الملف في PeakStream عن طريق تعيين هذا الحقل إلى TRUE أو FALSE.
      1. قم بتعيين حقل bedgraph إلى FALSE عندما يمكن استبعاد الملف بشكل معقول من تحليل PeakStream. على سبيل المثال ، في تجربة RNAseq ، قم بتعيين معلمة bedgraph bedgraph = FALSE للطفرات أو الحالات الأخرى التي لا يتوقع فيها اختلافات UTR بين العينات. ومع ذلك، تأكد من تعيين حقل bedgraph إلى TRUE لجميع ملفات التحكم في تجربة RNAseq ولجميع الملفات في تجربة ChIPseq.
    3. عامل التصميم
      1. designfactor1: تحديد عامل تصميم ذي صلة بالتصميم التجريبي (على سبيل المثال، المعالجة أو sample_type).
      2. designfactor2: تحديد عامل تصميم ثان ذي صلة بالتصميم التجريبي (على سبيل المثال، السلالة أو الحاتمة). بالنسبة لتجربة RNAseq ، قم بتضمين العلاج والإجهاد كعوامل تصميم نموذجية. يسرد عمود العلاج العلاجات المطبقة (على سبيل المثال ، التحكم ، الدواء 1) ، ويسرد عمود الإجهاد معلومات السلالة (على سبيل المثال ، النوع البري ، المتحور). بالنسبة لتجربة ChIPseq ، قم بتضمين sample_type و epitope كعوامل تصميم نموذجية. يسرد العمود sample_type ما إذا كان البروتين قد تم تمييزه أو عدم وضع علامة عليه ، ويسرد عمود الظتمة اسم الحاتمة المستخدمة.
        ملاحظة: عوامل التصميم هي سمات خاصة بالتصميم التجريبي.
        WonderPeaks متوافق مع عناصر التحكم غير المميزة أو عناصر التحكم في الإدخال كخط أساس.
      3. تأكد من أن أعمدة عامل التصميم لا تتضمن رقم النسخ المتماثل الفريد (على سبيل المثال، sample_type: [مميز، مميز، untagged_control، untagged_control] وليس sample_type: [tagged_1، tagged_2، untagged_control _1، untagged_control _2]. سيؤدي توفير أرقام نسخ متماثلة فريدة إلى حدوث خطأ أثناء التشغيل.
      4. تأكد من استخدام الشرطة السفلية (_) بدلا من المسافات في أسماء عوامل التصميم.
      5. بالنسبة لتطبيق ChIPseq ، تأكد من أن عمود sample_type (أو الاسم المخصص) في ملف بيانات التعريف يتضمن مصطلحات تحتوي على علامة الكلمات والتحكم.
        ملاحظة: على سبيل المثال، يمكن أن تتضمن الإدخالات الصالحة علامات وعلامة untagged_control. سيؤدي توفير عمود sample_type بدون هذه المصطلحات إلى حدوث خطأ أثناء التشغيل.
        تنبيه: بالنسبة لتطبيق ChIP ، يجب على المستخدم تحديد عاملين للتصميم.
      6. أضف عوامل التصميم إلى صف NGS_user_inputs.csv ذي الصلة. تأكد من إدراج أسماء الأعمدة المستخدمة لعوامل التصميم كسلسلة منفصلة بفاصلة منقوطة (على سبيل المثال ، المعالجة ؛ سلالة أو sample_type ؛ حاتمة).
        تنبيه: يجب أن تتطابق عوامل التصميم في NGS_user_inputs.csv مع أعمدة NGS_user_metadata.csv تماما. سيؤدي أي تشغيل غير متطابق إلى حدوث خطأ أثناء التشغيل (الشكل 2 ، الجدول التكميلي S1 ، والجدول التكميلي S2).

figure-protocol-1
الشكل 2: مثال NGS_user_input.csv و NGS_user_metadata.csv. أمثلة على NGS_user_input.csv (اللوحة العلوية) و NGS_user_metadata.csv (اللوحة السفلية)، مما يبرز التطابق بين عمودي designfactor وdesignfactor بنص وأسهم وردية أو زرقاء. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

5. المعالجة المسبقة لبيانات NGS

ملاحظة: انتقل إلى القسم 5 أو القسم 6 إذا كنت تستخدم المعالجة المسبقة المخصصة.

  1. افتح جهاز NGS للمعالجة المسبقة Jupyter Notebook (NGS_Preprocessing.ipynb).
  2. قم بتنشيط WP_preprocessing البيئة (التي تم إنشاؤها في الخطوة 1.2) في الزاوية العلوية اليسرى من واجهة دفتر الملاحظات.
  3. قم بتنفيذ الخلية الأولى بالضغط باستمرار على مفتاح Shift ثم الضغط على Enter (Shift+Enter).
  4. في الخلية الثانية من Jupyter Notebook، قم بتحديث مسار الدليل عن طريق تعيين الدليل = "path/to/your/data"، حيث path/to/your/data/ هو الدليل الذي تم إنشاؤه في القسم 2.
  5. إنشاء ملفات المحاذاة. ستقوم وظائف المعالجة المسبقة بإجراء التشذيب باستخدام FastP18 ؛ مراقبة الجودة باستخدام FastQC19 و MultiQC20 ؛ المحاذاة باستخدام STAR21. يتم حفظ ملفات محاذاة الإخراج في دليل فرعي يسمى startout داخل دليل البيانات (على سبيل المثال ، path/to/your/data/starout) ؛ التصفية (optional) باستخدام عرض samtools22 ، قم بتصفية ملف المحاذاة للاحتفاظ بالقراءات فقط فوق الحد المحدد في NGS_user_inputs.csv.
    ملاحظة: ستعالج هذه الوظائف قراءات واحدة فقط (على سبيل المثال ، R1) لمجموعة البيانات في كل مرة. يمكن للمستخدمين تحديد خيارات التشغيل ل FastP و STAR في NGS_user_inputs.csv (على سبيل المثال ، FastP: adapter_sequence (اختياري) ؛ STAR: genomeDir ، genomeFastaFiles ، sjdbGTFfil).
  6. قم بتنفيذ وظائف المعالجة المسبقة في الخلية الثانية باستخدام Shift + Enter.
    ملاحظة: قد تستغرق المهام الموجودة في الخلية الثانية عدة ساعات لإكمالها. إذا تمت مقاطعة التشغيل، كرر الخطوات 5.3-5.6 لإعادة تشغيل التشغيل. لن يتم استبدال التقدم المحرز من الخطوات السابقة ، وستستمر العملية من حيث توقفت.
  7. قم بإنشاء ملفات تتبع لتغطية المحاذاة باستخدام BamCoverage23 (راجع الخطوتين 5.7.1 و 5.7.2).
    ملاحظة: بالنسبة إلى ChIPseq ، يتطلب WonderPeaks ملفات مخطط سرير واحد تحتوي على تغطية لكل من القراءات الأمامية والخلفية. بالنسبة إلى RNAseq مع تحضير Poly (A) ، يتطلب PeakStream ملفين للرسم البياني ، أحدهما للقراءات الأمامية (_fwd.bedgraph) والآخر للقراءات العكسية (_rev.bedgraph). يتم إنشاء القراءات الأمامية والعكسية باستخدام معلمة filterRNAstrand داخل BamCoverage23.
    1. ChIPseq باستخدام المعلمات التالية: outfilfeformat = "bedgraph" ، strand = لا شيء ، binsize = 20 ، smoothLength = 60 ، minMappingQuality = 255 ، normalizeUsing = "CPM".
      ملاحظة: الإخراج: ينتج ملفات رسم بياني أحادي تحتوي على تغطية لكل من القراءات الأمامية والخلفية. يتم تخزين الإخراج في /path/to/your/data/bedgraphout (الشكل 3).
      1. قم بتنفيذ وظيفة BamCoverage في الخلية الثالثة باستخدام Shift + Enter.
    2. RNAseq باستخدام المعلمات التالية: outfilfeformat = "bedgraph" ، strand = "forward" أو "reverse" ، binsize = 20 ، smoothLength = 60 ، minMappingQuality = 255 ، normalizeUsing = "CPM".
      تنبيه: تأكد من تنفيذ الوظيفة مرتين مع ضبط الخصلة على الأمام أو الخلف لإنشاء ملفات للقراءة في كلا الاتجاهين.
      ملاحظة: الإخراج: ينتج ملفين للرسم البياني للمجموعة: أحدهما للقراءات الأمامية (_fwd.bedgraph) والآخر للقراءات العكسية (_rev.bedgraph). يتم تخزين الإخراج في /path/to/your/data/ bedgraphout (الشكل 3).
      1. قم بتنفيذ وظيفة BamCoverage في الخلية الثالثة باستخدام Shift + Enter.

figure-protocol-2
الشكل 3: تنظيم الملفات ل WonderPeaks. لقطة شاشة لمجلد البيانات مع ملفات bedgraph في الدليل bedgrapghout/normalizeUsingCPM. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

6. WonderPeaks ل ChIPseq

  1. الفحص المسبق
    1. تأكد من أن جميع ملفات bedgraph باستخدام filehandle .bedgraph موجودة في دليل فرعي داخل دليل البيانات يسمى bedgraphout (الشكل 3).
    2. تأكد من أن عوامل التصميم في ملف user_inputs (NGS_user_inputs.csv) (الشكل 2) تتطابق مع الأعمدة الموجودة في ملف بيانات التعريف (NGS_user_metadata.csv) وأن صفوف أعمدة عامل التصميم ليست فريدة (راجع التحذير في الخطوة 4.2.4).
  2. افتح دفتر ملاحظات Jupyter للمعالجة المسبقة ل NGS (WP4ChIP.ipynb).
  3. قم بتنشيط WonderPeaks (البيئة التي تم إنشاؤها في الخطوة 1.3) في الزاوية العلوية اليمنى من واجهة الكمبيوتر المحمول.
  4. قم بتنفيذ الخلايا باستخدام Shift+Enter حتى نقطة التوقف لتشغيل استدعاء الذروة. بمجرد الانتهاء ، سيتم حفظ سجل للبيانات التي تمت معالجتها وتخزينه في دليل فرعي داخل دليل البيانات يسمى WonderPeaks
    1. ابحث عن WOnder_init.csv: تسلسل لجميع التغطية الأولية والنتائج من حساب المشتق الأول.
    2. ملاحظة WOnder_unfiltered_peaks.csv: تسلسل لجميع القمم غير المفلترة تسمى بناء على المشتق الأول.
    3. لاحظ bedgraph_summary.csv: ملخص لإحصائيات الدرجات بعد تجميع كل ملف وكروموسوم.
  5. تحديد معلمات التشغيل:
    1. قم بتشغيل الخلية 1أسفل نقطة توقف التخفيض.
      ملاحظة: ستظهر قطعة أرض تعرض البيانات الأولية المنفصلة عن عوامل التصميم المحددة وجدول يوضح عوامل التصميم ؛ استخدم الجدول والمخطط لتحديد القيم في الخطوات اللاحقة (الشكل 4).
    2. في الخلية التالية، حدد قيم score_cut و fold_change وdesignfactor (الشكل 4).
      1. score_cut هي قيمة العتبة المستخدمة لتحديد ما إذا كان سيتم النظر في الذروة في المخرجات. لتحديد score_cut ، راقب المؤامرة واختر قيمة قريبة من متوسط البيانات الموسومة (انظر الخط المجزأ ، الشكل 4). أدخل هذه القيمة على النحو التالي: score_cut = القيمة.
      2. fold_change هي قيمة العتبة لدرجات نسبة Tagged:untagged المستخدمة لتحديد ما إذا كانت الذروة تعتبر حقيقية أم لا. لتحديد fold_change ، راقب المخطط واختر قيمة أعلى من نسبة متوسطات البيانات غير الموسومة والمميزة. أدخل هذه القيمة على النحو التالي: fold_change= القيمة.
      3. تم تحديد designfactor_value كجزء من التصميم التجريبي. يتم سرد عوامل التصميم المحتملة باللون الأحمر في الجدول المطبوع. لتحديد عامل التصميم، اختر إحدى القيم المدرجة باللون الأحمر. أدخل هذه القيمة بين علامات الاقتباس على النحو التالي: designfactor_value ="{ value}".
  6. قم بتنفيذ الخلايا التالية باستخدام Shift + Enter لتشغيل تصفية الذروة وتعيينها. سيتم تخزين البيانات والمخططات الملخصة في دليل فرعي داخل دليل البيانات يسمى WonderPeaks.
    1. لاحظ {designfactor_value}_taggedVuntagged.csv: جدول محوري لجميع القمم المتداخلة مع عمود لكل من العينات ذات العلامات وغير المميزة.
    2. ملاحظة {designfactor_value}_all_tagged_peaks.csv: جدول ملخص لجميع القمم الحقيقية، استنادا إلى معلمات المستخدم (الخطوة 6.5).
    3. لاحظ {designfactor_value}_peaks2gtf.csv: تعيين القمم الحقيقية ، بناء على معلمات المستخدم (الخطوة 6.5) ، إلى الجينات الموجودة في ملف التعليقات التوضيحية المحدد للمستخدم.
  7. اختياري: قم بتبديل المعلمات في الخطوة 6.5 عن طريق إعادة تنفيذ الخطوات 6.5-6.6. في حالة استخدام نفس designfactor_value، سيتم استبدال الملفات التي تم إنشاؤها، كما هو موضح في الخطوة 6.6.

figure-protocol-3
الشكل 4: لقطة شاشة تسلط الضوء على designfactor_value والعتبات المحددة من قبل المستخدم في WonderPeaks ل ChIP-seq. لقطة شاشة لدفتر ملاحظات WonderPeaks jupyter ، مع تسليط الضوء على خيارات designfactor_value الممكنة من الجدول المعروض ، وكيفية تنفيذ designfactor_value في الخلية التالية. يشير السهم الأسود العلوي إلى جدول يعرض إدخالات designfactor_value المحتملة. يتم وضع دائرة حول قيمة Op وتظهر كإدخال المستخدم المحدد ل designfactor_value في خلية الخيارات (السهم الأسود السفلي). في الرسم البياني ، تشير الخطوط الصلبة والمتقطعة إلى متوسط درجات الذروة التقريبية للعينات الموسومة وغير الموسومة ، على التوالي ، في تجارب الخلايا غير الشفافة. تستخدم هذه المتوسطات لتحديد معلمات score_cut (الوسيط المميز) و fold_change (نسبة المتوسطات الموسومة إلى غير المميزة). الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

7. PeakStream ل 3'RNAseq

  1. الفحص المسبق:
    1. تأكد من وجود جميع ملفات bedgraph في دليل فرعي داخل دليل البيانات يسمى bedgraphout (الشكل 2).
    2. افتح جهاز NGS للمعالجة المسبقة Jupyter Notebook (PeakStream.ipynb)
    3. قم بتنشيط WonderPeaks (البيئة التي تم إنشاؤها في الخطوة 1.3) في الزاوية العلوية اليمنى من واجهة الكمبيوتر المحمول.
  2. قم بتنفيذ الخلايا باستخدام Shift+Enter حتى نقطة التوقف لتشغيل استدعاء الذروة وتعيين الذروة. بمجرد الانتهاء ، سيتم حفظ ملف تعليق توضيحي جديد يحتوي على ملفات UTRs المتوقعة 3 بوصات و FeatureCounts24 وتخزينها في دليل فرعي داخل دليل البيانات الخاص بك يسمى PeakStream (الشكل 5).
    ملاحظة: بشكل افتراضي ، سيتضمن ملف الإخراج فقط تعليقات توضيحية للأنماط الحيوية لترميز البروتين ، ولكن يمكن تبديل ذلك باستخدام خيار النمط الحيوي.

figure-protocol-4
الشكل 5: تنظيم الملفات ل PeakStream. لقطة شاشة لمجلد البيانات مع ملفات bedgraph في دليل bedgrapghout. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

WonderPeaks
بعد إجراء تجربة ChIP-seq ، يستخدم الباحثون عادة متصلين بالذروة ، مثل MACS3 ، لتحديد المناطق الجينومية المخصبة ببروتين مرتبط بالحمض النووي الموسومة بالحاتمة. لقد قمنا بتطوير WonderPeaks كمتصل ذروة سهل الاستخدام مصمم لتحديد القمم باستخدام الطريقة الموضحة أعلاه.

يحدد WonderPeaks القمم عن طريق حساب المشتق الأول للتغطية أولا ويستخدم هذه القيمة (ميل الذروة) لتحديد القمم المحتملة. ثم يبحث عن الحالات التي يظهر فيها المشتق الأول حدا أقصى محليا أعل...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

توفر تقنيات تسلسل الجيل التالي (NGS) نظرة ثاقبة لا مثيل لها في تنظيم الجينات والتعبير عنها في مسببات الأمراض الفطرية. على هذا النحو ، يجب أن تكون الأدوات الحسابية شاملة - تلتقط جميع البيانات التي تم إنشاؤها في التجربة - ويمكن الوصول إليها من قبل المستخدمين العامين ، وخاصة علماء مقاعد البدلاء. في هذا التقرير ، قدمنا أداتين ، WonderPeaks و PeakStream ، تلبي هذه الاحتياجات للباحثين في مسببات الأمراض الفطرية في سير عمل ChIP-seq و RNA-seq.

WonderPeaks هو سير عمل سه...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ليس لدى المؤلفين أي تضارب في المصالح للإعلان عنه.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم دعم هذا العمل من خلال منح المعاهد الوطنية للصحة (NIH) RO1AI175080 و R01GM037049 (إلى ألكسندر دي جونسون) وجائزة منحة تدريب NIH T32 T32 الذكاء الاصطناعي 60537-20 (إلى HG). نشكر ألكسندر جونسون وماثيو لوهس وجيني تشانغ وبريان وانغ على المناقشات والنصائح المفيدة. نشكر أيضا أعضاء مختبر كارول جروس على ردود الفعل. نشكر أناندا ميندوزا على الدعم الفني. تم إجراء التسلسل في UCSF CAT ، بدعم من منح UCSF PBBR و RRP IMIA و NIH 1S10OD028511-01. نحن نقر باستخدام ChatGPT من OpenAI للمساعدة في استكشاف أخطاء التعليمات البرمجية وإصلاحها وتقديم اقتراحات لتحرير المخطوطة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
مجموعة CORALL Total RNA-seq V1Lexogen095مواد المختبر الرطبة  
فطريات خيوطية riboPOOLsiTOOLsdp-P096-6مواد المختبر الرطبة 
شاشة الحمض النووي الريبي عالية الحساسيةAgilent5067-5579مادة المختبر الرطب  
عالية الحساسية RNA ScreenTape سلمرشيق<قوي>5067-5581< / قوي>مادة مختبر رطبة 
عالية الحساسية RNA ScreenTape عينة العازلةAgilent5067-5580< / قوي>مادة المختبر الرطبة 
https://github.com/mgarber21/WonderPeaks/blob/main/environment.ymlقائمة التبعيات ل WonderPeaks
https://github.com/mgarber21/WonderPeaks_preprocessing/blob/main/environment.ymlقائمة التبعيات ل WonderPeaks_preprocessing
Monarch Spin RNA Cleanup KiNEBT2040Lمواد المختبر الرطب  
pygenometracks (3.9)
QuantSeq 3′ mRNA-Seq FWD Library Prep Kit V1Lexogen015المواد المختبرية الرطبة 
كيوبيت الحمض النووي الريبي عالي الحساسية (HS) مجموعة الفحصInvitrogen< قوي > Q32852 < / قوي >مادة مختبر رطبة   ؛
الحمض النووي الريبي نظيف & Concentrator-5Zymo ResearchR1016مواد المختبر الرطبة 
طقم TURBO الخالي من الحمض النوويThermoFisherAM1907مادة المختبر الرطبة 
WonderPeaks (0.1.14)
WonderPeaks_preprocessing (0.2.3)

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. fungal priority pathogens list to guide research, development and public health action. , WHO. https://www.who.int/publications/i/item/9789240060241 (2022).
  2. Fisher, M. C., Denning, D. W. The WHO fungal priority pathogens list as a game-changer. Nat Rev Microbiol. 21 (4), 211-212 (2023).
  3. Gaspar, J. M. Improved peak-calling with MACS2. bioRxiv. 496521, (2018).
  4. Muñoz, J. F., et al. Coordinated host-pathogen transcriptional dynamics revealed using sorted subpopulations and single macrophages infected with Candida albicans. Nat Commun. 10 (1), 1607(2019).
  5. Miramón, P., Pountain, A. W., Lorenz, M. C. Candida auris-macrophage cellular interactions and transcriptional response. Infect Immun. 91 (11), e0027423(2023).
  6. Lindemann-Perez, E., Rodríguez, D. L., Pérez, J. C. An approach to analyze spatiotemporal patterns of gene expression at single-cell resolution in Candida albicans-infected mouse tongues. mSphere. 9 (9), e0028224(2024).
  7. Mo, X., et al. In vivo RNA sequencing reveals a crucial role of Fus3-Kss1 MAPK pathway in Candida glabrata pathogenicity. mSphere. 9 (11), e0071524(2024).
  8. Haas, B. J., Chin, M., Nusbaum, C., Birren, B. W., Livny, J. How deep is deep enough for RNA-Seq profiling of bacterial transcriptomes. BMC Genomics. 13, 734(2012).
  9. Zaheer, R., et al. Impact of sequencing depth on the characterization of the microbiome and resistome. Sci Rep. 8 (1), 5890(2018).
  10. Xiong, Y., et al. A comparison of mRNA sequencing with random primed and 3′-directed libraries. Sci Rep. 7 (1), 14626(2017).
  11. Ma, F., et al. A comparison between whole transcript and 3' RNA sequencing methods using Kapa and Lexogen library preparation methods. BMC Genomics. 20, 9(2019).
  12. Fansler, M. M., Mitschka, S., Mayr, C. Quantifying 3′UTR length from scRNA-seq data reveals changes independent of gene expression. Nat Commun. 15 (1), 4050(2024).
  13. Tuch, B. B., et al. The transcriptomes of two heritable cell types illuminate the circuit governing their differentiation. PLoS Genet. 6, e1001070(2010).
  14. Shenker, S., Miura, P., Sanfilippo, P., Lai, E. C. IsoSCM: improved and alternative 3′ UTR annotation using multiple change-point inference. RNA. 21 (1), 14-27 (2015).
  15. Haese-Hill, W., Crouch, K., Otto, T. D. peaks2utr: a robust Python tool for the annotation of 3′ UTRs. Bioinformatics. 39 (3), btad112(2023).
  16. Anaconda - Getting started. , https://docs.anaconda.com/anaconda/getting-started/ (2025).
  17. Pryke, B. Jupyter Notebook tutorial. , https://www.dataquest.io/blog/jupyter-notebook-tutorial/ (2025).
  18. Chen, S., Zhou, Y., Chen, Y., Gu, J. fastp: an ultra-fast all-in-one FASTQ preprocessor. Bioinformatics. 34 (17), i884-i890 (2018).
  19. Andrews, S. FastQC: a quality control tool for high throughput sequence data. , https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  20. Ewels, P., Magnusson, M., Lundin, S., Käller, M. MultiQC: summarize analysis results for multiple tools and samples in a single report. Bioinformatics. 32 (19), 3047-3048 (2016).
  21. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  22. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), giab008(2021).
  23. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  24. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  25. Lohse, M. B., Johnson, A. D. Identification and characterization of Wor4, a new transcriptional regulator of white-opaque switching. G3 (Bethesda). 6 (3), 721-729 (2016).
  26. Nagalakshmi, U., et al. The transcriptional landscape of the yeast genome defined by RNA sequencing. Science. 320 (5881), 1344-1349 (2008).
  27. Diaz, A., Park, K., Lim, D. A., Song, J. S. Normalization, bias correction, and peak calling for ChIP-seq. Stat Appl Genet Mol Biol. 11 (3), Article 9(2012).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

ChIP Seq WonderPeaks PeakStream 3 UTR Candida Albicans
الفيديو قريباً

مقالات ذات صلة