$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
يجب تنظيم التعبير الجيني بإحكام حتى تتمكن الخلايا من إنشاء وظيفتها البيولوجية الصحيحة والحفاظ عليها. من المعروف أن التعبير الجيني الشاذ يكمن وراء التسبب في العديد من الأمراض ، وبالتالي ، يكمن قدر كبير من الاهتمام البحثي في فهم آليات تنظيم الجينات1. يتم تسهيل التعبير الجيني من خلال العناصر التنظيمية مثل المحفزات والمعززات. ضمن تسلسلها ، تحتوي هذه العناصر على مواقع ربط عامل النسخ (TF) ، والتي ، عند نشاطها ، توفر منصة لربط TF. يؤدي ارتباط TFs في هذه المواقع إلى إزاحة النيوكليوسومات ، مما يؤدي إلى زيادة إمكانية الوصول إلى الحمض النووي وزيادة لاحقة في السماح بآلية النسخ. نتيجة لهذا الوصول المتزايد ، تكون مناطق الحمض النووي هذه أكثر حساسية للنوكليازات والينقولات مثل DNase و Tn5 ، وهي خاصية كيميائية حيوية تم استغلالها من قبل الباحثين الذين يحققون في تنظيم النسخ2،3.
يسمح DNase-seq و ATAC-seq للباحثين برسم خرائط لمناطق الكروماتين المفتوح ومواقع ربط TF وتحديد المواقع النووية عبر الجينوم. من بين هاتين التقنيتين ، نمت شعبية ATAC-seq على مدار العقد الماضي بسبب البروتوكول البسيط المكون من خطوتين ومتطلبات عدد الخلايا المنخفض (50,000 خلية مقارنة ب 1 مليون لكل تكرار ل DNase-seq). بينما يقدم ATAC-seq نظرة عامة على المشهد العام للكروماتين في مجموعة من الخلايا ، إلا أنه لا أدري إلى حد كبير الذي ترتبط به بروتينات معينة بالجينوم4،5. من أجل تحديد المواقع التي يتفاعل فيها بروتين معين مع الجينوم ، فإن التقنية القياسية الذهبية هي Chromatin Immunoprecipitation (ChIP)-seq. يتضمن ChIP-seq التثبيت الكيميائي لتفاعلات البروتين والحمض النووي في الخلية ، متبوعا بالترسيب المناعي ("المنسدل") باستخدام جسم مضاد خاص بالبروتين محل الاهتمام لاختيار شظايا الحمض النووي المرتبطة بالبروتين محل الاهتمام (POI). يمكن تسلسل شظايا الحمض النووي هذه للكشف عن مواقع الارتباط الجينومي لبروتينات معينة مثل TFs ، أو المواقع التي تحتوي على تعديلات هيستون محددة1. من خلال الجمع بين مجموعات بيانات ATAC-seq و ChIP-seq ، يمكن اشتقاق صورة مفصلة للمشهد التنظيمي لمجموعة من الخلايا.
سير العمل الأساسي المطلوب للتحليل هو كما يلي: يجب التحكم في جودة قراءات التسلسل الخام قبل المحاذاة مع الجينوم المرجعي ("رسم الخرائط"). يمكن بعد ذلك تصفية القراءات المعينة بنجاح لإزالة كل من القراءات منخفضة الجودة وتكرارات PCR. من أجل تصور هذه القراءات المعينة والمفلترة ، من الضروري حساب "تغطية" هذه القراءات عبر الجينوم. يؤدي هذا إلى إنشاء ملف يمكن تحميله إلى متصفح الجينوم مثل عرض متعدد المواقع (MLV) أو متصفح الجينوم UCSC ك "مسار"6،7. عادة ما يتم تحديد الذروة ، أو "استدعاء الذروة" لمسارات التغطية هذه باستخدام أدوات مثل LanceOtron أو MACS2 8,9. أخيرا ، من خلال تحليل موقع الذروة والشكل والحجم ، يمكن إجراء مقارنات بين العينات أو الظروف البيولوجية. يعد تحليل مجموعات البيانات هذه ودمجها عملية معقدة متعددة الخطوات يمكن من خلالها تنفيذ مجموعات مختلفة من أدوات المعلوماتية الحيوية. قد تكون الإصدارات المختلفة من الأدوات غير متوافقة مع بعضها البعض وقد تغير إخراج معالجة البيانات. هناك أيضا مجموعة متنوعة في القوة الحسابية وكفاءة المستخدم المطلوبة لتنفيذ أجزاء مختلفة من معالجة البيانات كما هو موضح في خطوط أنابيبnf-core 10 أوpanpipes 11 أو genpipes12 أو PEPATAC13 أو ChIP-AP14.
بشكل عام ، أدى هذا إلى تناقضات في كل من تحليل التحليل والإبلاغ عنه ، مما أدى بدوره إلى ضعف قابلية التكرار وإمكانية الوصول والراحة لأي شخص لديه معرفة محدودة بالمعلوماتية الحيوية. نعالج كل هذه المشكلات من خلال CATCH-UP (خط أنابيب ATAC-seq و ChIP-seq الكامل ، وهو خط أنابيب سهل الاستخدام ومرن ومعياري لمعالجة بيانات ChIP-seq و ATAC / DNase- seq. يتطلب تنفيذ اللحاق بالركب الحد الأدنى من الخبرة في المعلوماتية الحيوية. يمكن تشغيله على بنى تحتية مختلفة للحوسبة ويتيح تحليل البيانات القابلة للتكرار داخل مجموعات البحث وعبرها.
CATCH-UP هو خط أنابيب Snakemake قائم على Python تم تصميمه لتوحيد تحليل بيانات ChIP-seq و ATAC-seq. يأخذ بيانات التسلسل الأولية (ملفات fastq.gz) كمدخلات ويولد مخرجات في شكل ملفات الذروة (.bed) التي توفر النتيجة المعنية لكل خطوة. نحن نقدم ملف تكوين بتنسيق yaml (config.yaml) ، حيث يمكن للمستخدم تحرير معلمات كل خطوة تحليل. يتيح نظام الإدارة المنفذة داخل snakemake استخدام بنى تحتية مختلفة للحوسبة (مثل الخوادم أو المجموعات أو الأنظمة السحابية أو أجهزة الكمبيوتر الشخصية) وبالتوازي إذا كان المستخدم يوفر كمية كبيرة من البيانات.
أدناه ، نقدم وصفا تفصيليا لكل خطوة من خطوات سير العمل (انظر الشكل 1 للحصول على توضيح سير العمل). هذا التفسير ضروري لاتباع خطوة بخطوة في قسم البروتوكول:
نقل fastq: تتمثل الخطوة الأولى في المسار في نسخ ملفات fastq الأولية إلى دليل التحليل المسمى. هذا يترك البيانات الأصلية كما هي لتجنب إتلاف أو تعديل ملفات البيانات الأولية.
التسلسل: إذا كانت بيانات التسلسل الأولية تحتوي على ممرات متعددة ، فهذه الخطوة مطلوبة لتسلسل الممرات قبل التحليل. بشكل افتراضي، يعالج المسار جميع ملفات fastq كعينات فردية. يجب تحديد خطوة التسلسل هذه في ملف التكوين.
التشذيب: خطوة تنظيف البيانات الاختيارية. يسمح ذلك بقص القراءات منخفضة الجودة أو تسلسلات المحول باستخدام trimmomatic15. يمكن للمستخدم توفير ملفات fasta مخصصة لتسلسلات المحول. يتم توفير مثال في دليل المحول. يمكن تحديد معلمات التشذيب الإضافية في ملف التكوين. بشكل افتراضي، يتخطى سير العمل هذه القاعدة.
التقويم: للمحاذاة ، يتم تطبيق Bowtie216 افتراضيا ؛ يمكن أيضا تحديد أدوات المحاذاة البديلة مثل BWA-MEM217 . يتم تحديد أداة محاذاة Bowtie2 كإعداد افتراضي لأنها بارعة بشكل خاص في محاذاة القراءات القصيرة نسبيا مع الجينومات الكبيرة نسبيا ، وبالتالي فهي مناسبة تماما لمحاذاة بيانات ChIP-seq و ATAC-seq مع جينومات الثدييات. لتجنب أي ملفات وسيطة ، يتم إدخال المحاذاة في عرض samtools لحفظ ملف bam في الإخراج. بالنسبة لهذه القاعدة ، يجب على المستخدم تحديد بناء الجينوم المفضل الذي يتم تعيين القراءات عليه على سبيل المثال ، hg19 / hg38 (إنسان) ، mm10 / mm39 (الماوس).
التصفية: يتم الاحتفاظ بالقراءات المعينة بشكل صحيح ، ويتم تصفية القراءات ذات الجودة المنخفضة. الافتراضي: عرض samtools ، مع المعلمات: -bShuF 4 -f 3 -q 30.
الفرز: يتم فرز القراءات المحاذاة بترتيب الإحداثيات في أقصى اليسار. الافتراضي: فرز samtools (غلاف صنع الثعابين) ، مع المعلمة: -m 4G.
وضع علامة على التكرارات: يتم تحديد جميع عمليات القراءة المكررة ووضع علامة عليها. يمكن للمستخدم أن يقرر إزالتها عن طريق تغيير معلمة ملف التكوين. الافتراضي: Picard MarkDuplicates (غلاف snakemake) ، مع المعلمة: --REMOVE_DUPLICATES False للإبلاغ عن التكرارات والاحتفاظ بها.
دمج بام: إذا كانت بيانات التسلسل تتكون من نسخ متماثلة أو عينات ، فقد يرغب المستخدم في الدمج في بام واحد. في هذه الحالة ، يمكن للمستخدم اختيار دمج bams أو الاحتفاظ بملفات bam منفصلة طوال التحليل. إذا اختار المستخدم دمج bams (استخدام دمج samtools) ، فيجب تحديد بادئة مشتركة ل bams المدمجة.
الفهرس: تقوم هذه الخطوة بفهرسة الإحداثيات التي تم فرزها. الافتراضي: فهرس samtools (غلاف snakemake) ، باستخدام المعلمات الافتراضية المحددة بواسطة samtools.
BamCoverage: تنشئ هذه القاعدة مسار تغطية كبير من القراءات المحاذاة. يتم تطبيق أداة bamCoverage من deepTools ، ويتم حساب التغطية على أنها عدد القراءات لكل سلة ، حيث تمثل الحاوية نافذة بحجم محدد. في هذا المسار ، يتم تطبيق bamCoverage مع تعيين المعلمات التالية كافتراضي: -bs 1 -normalizeUsing RPKM -extendReads.
ذروة الاتصال: تم تحديد LanceOtron8 كمستدعي الذروة الافتراضي لخط الأنابيب هذا. على عكس المتصلين التقليديين بالذروة ، والتي تعتمد في الغالب على الاختبار الإحصائي ، فإن LanceOtron عبارة عن متصل ذروة قائم على التعلم العميق ، والذي يتضمن قياسات الإثراء الجيني والاختبارات الإحصائية وقد ثبت أنه يتفوق على متصل الذروة القياسي في الصناعة ، MACS29. لكي تكون الشخصيات البارزة متوافقة مع LanceOtron ، يجب حساب التغطية لكل زوج أساسي ، وتطبيع RPKM ؛ ينعكس هذا في الإعدادات الافتراضية لخطوة BamCoverage. يمكن تحديد MACS2 كمتصل ذو ذروة بديل. ستتم مراقبة إصدار المتصلين الجدد بالذروة ودمجها حسب الاقتضاء من أجل الحفاظ على أداء خط أنابيب التحليل هذا وتحسينه.
TrackDb: يؤدي هذا إلى إنشاء اقتران زوج من المفتاح والقيمة للملفات الكبيرة من أجل تحميلها وتصورها في أدوات مثل الأنظمة الأساسية MLV6 أو UCSC Genome Browser18 .
بالإضافة إلى بيانات الإخراج، تقوم كل خطوة من خطوات المسار بإخراج ملف سجل، ويتم توفير فحوصات مراقبة الجودة المناسبة حتى يتمكن المستخدم من تتبع تقدم التحليل. يتم تطبيق FastQC19 على بيانات التسلسل الأولية والمقتطعة (إذا تم تحديدها) (الخطوات 1 - نقل fastq و 2- التشذيب). تستخدم إحصائيات Samtools بالإضافة إلى MultiQC20 لجمع وإنتاج وتصور تقارير مراقبة الجودة على ملفات bam في الإخراج في الخطوات 3 - Aligner و 6 - وضع علامة على التكرارات و 7 - دمج bam. لمزيد من المعلومات حول كل أداة من الأدوات المطبقة في الخطوات أعلاه ، انظر الجدول 1.