يصف البروتوكول المعروض هنا خط أنابيب كامل لتحليل بيانات النسخ التسلسلية من قراءات الخام إلى التحليل الوظيفي ، بما في ذلك مراقبة الجودة وخطوات المعالجة المسبقة للنهج التحليلية الإحصائية المتقدمة.
مقالة منهجية
يصف البروتوكول المعروض هنا خط أنابيب كامل لتحليل بيانات النسخ التسلسلية من قراءات الخام إلى التحليل الوظيفي ، بما في ذلك مراقبة الجودة وخطوات المعالجة المسبقة للنهج التحليلية الإحصائية المتقدمة.
مسببات الأمراض يمكن أن تسبب مجموعة واسعة من الأمراض المعدية. العمليات البيولوجية التي يسببها المضيف استجابة للعدوى تحدد شدة المرض. لدراسة مثل هذه العمليات، يمكن للباحثين استخدام تقنيات التسلسل عالية الإنتاجية (RNA-seq) التي تقيس التغيرات الديناميكية للنسخ المضيف في مراحل مختلفة من العدوى، والنتائج السريرية، أو شدة المرض. يمكن أن يؤدي هذا التحقيق إلى فهم أفضل للأمراض ، فضلا عن الكشف عن أهداف الأدوية المحتملة والعلاجات. يصف البروتوكول المعروض هنا خط أنابيب كامل لتحليل بيانات تسلسل الحمض النووي الريبي من القراءات الخام إلى التحليل الوظيفي. وينقسم خط الأنابيب إلى خمس خطوات: (1) مراقبة جودة البيانات؛ (2) نوعية البيانات؛ (2) نوعية البيانات؛ (2) نوعية البيانات؛ (2) نوعية البيانات؛ (2) نوعية (2) رسم خرائط الجينات والتعليق على هذه الجينات؛ (3) التحليل الإحصائي لتحديد الجينات المعرب عنها بشكل متمايز والجينات المعرب عنها؛ (4) تحديد الدرجة الجزيئية لازدراق العينات؛ و (5) التحليل الوظيفي. الخطوة 1 يزيل القطع الفنية التي قد تؤثر على جودة التحليلات المصب. في الخطوة 2، يتم تعيين الجينات وشرحها وفقا لبروتوكولات المكتبة القياسية. ويحدد التحليل الإحصائي في الخطوة 3 الجينات التي يتم التعبير عنها بشكل تفاضلي أو التعبير عنها في العينات المصابة، بالمقارنة مع تلك غير المصابة. يتم التحقق من تقلب العينة ووجود القيم المتطرفة البيولوجية المحتملة باستخدام الدرجة الجزيئية لنهج الاضطراب في الخطوة 4. وأخيرا، يكشف التحليل الوظيفي في الخطوة 5 عن المسارات المرتبطة بالنمط الظاهري للمرض. يهدف خط الأنابيب المعروض إلى دعم الباحثين من خلال تحليل بيانات الحمض النووي الريبي-seq من دراسات التفاعل بين المضيف ومسببات الأمراض ودفع المستقبل في المختبر أو في تجارب الجسم الحي ، التي تعتبر ضرورية لفهم الآلية الجزيئية للعدوى.
وقد ارتبطت فيروسات الأربو، مثل حمى الضنك والحمى الصفراء وشيكونغونيا وزيكا، على نطاق واسع بعدة فاشيات متوطنة وبرزت كواحدة من مسببات الأمراض الرئيسية المسؤولة عن إصابة البشر في العقود الأخيرة1،2. غالبا ما يعاني الأفراد المصابون بفيروس شيكونغونيا (CHIKV) من الحمى والصداع والطفح الجلدي والتهاب المفاصل والتهاب المفاصل3,4,5. يمكن للفيروسات تخريب التعبير الجيني للخلية والتأثير على مسارات الإشارات المضيفة المختلفة. في الآونة الأخيرة، استخدمت دراسات نسخ الدم الحمض النووي الريبي-seq لتحديد الجينات المعرب عنها بشكل متفاوت (DEGs) المرتبطة بعدوى CHIKV الحادة بالمقارنة مع النقاهة6 أو الضوابط الصحية7. كان لدى الأطفال المصابين ب CHIKV جينات منظمة تشارك في المناعة الفطرية ، مثل تلك المتعلقة بأجهزة الاستشعار الخلوية لرنا الفيروسي ، وإشارات JAK / STAT ، ومسارات إشارات المستقبلات الشبيهة بالحصيلة6. كما أظهر البالغون المصابون بشدة ب CHIKV تحريض الجينات المتعلقة بالحصانة الفطرية ، مثل تلك المتعلقة بالخلايا الأحادية وتفعيل الخلايا التغصنية ، والاستجابات المضادة للفيروسات7. وشملت مسارات الإشارات المخصبة بالجينات الخاضعة للتنظيم الأسفل المسارات المتعلقة بالحصانة التكيفية، مثل تنشيط الخلايا التائية والتمايز والإثراء في الخلايا T وB7.
يمكن استخدام عدة طرق لتحليل بيانات النسخ من الجينات المضيفة ومسببات الأمراض. في كثير من الأحيان ، يبدأ إعداد مكتبة RNA-seq بإثراء نصوص البولي-أ الناضجة. هذه الخطوة يزيل معظم الحمض النووي الريبي الريبوسومي (rRNA) وفي بعض الحالات الحمض النووي الريبي الفيروسية / البكتيرية. ومع ذلك ، عندما ينطوي السؤال البيولوجي على الكشف عن نص مسببات الأمراض ويتم تسلسل الحمض النووي الريبي بشكل مستقل عن الاختيار السابق ، يمكن الكشف عن العديد من النصوص المختلفة الأخرى عن طريق التسلسل. فعلى سبيل المثال، تبين أن الرناس دون الذري عامل هام للتحقق من شدة الأمراض8. وبالإضافة إلى ذلك، بالنسبة لبعض الفيروسات مثل CHIKV و SARS-CoV-2، حتى المكتبات الغنية بالبولي ألف تولد قراءات فيروسية يمكن استخدامها في التحليلات النهائية9,10. عند التركيز على تحليل النسخة المضيفة ، يمكن للباحثين التحقيق في الاضطراب البيولوجي عبر العينات ، وتحديد الجينات المعرب عنها بشكل متفاوت والمسارات المخصبة ، وتوليد وحدات التعبير المشترك7،11،12. يسلط هذا البروتوكول الضوء على تحليلات النسخ للمرضى المصابين ب CHIKV والأفراد الأصحاء باستخدام نهج المعلوماتية الحيوية المختلفة (الشكل 1A). واستخدمت البيانات المستقاة من دراسة نشرت سابقا7 تتألف من 20 شخصا أصحاء و 39 شخصا مصابا إصابة حادة من الشيكف لتوليد النتائج التمثيلية.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
وقد وافقت لجان الأخلاقيات في كل من قسم علم الأحياء المجهرية التابع لمعهد العلوم الطبية الحيوية في جامعة ساو باولو والجامعة الاتحادية لسيرغيبي على العينات المستخدمة في هذا البروتوكول (البروتوكولان: 54937216.5.0000.5467 و54835916.2.0000.5546 على التوالي).
1. دوكر تثبيت سطح المكتب
ملاحظة: تختلف الخطوات لإعداد بيئة Docker بين أنظمة التشغيل (OSs). لذلك، يجب على مستخدمي Mac اتباع الخطوات المسرودة ك 1.1، ويجب على مستخدمي Linux اتباع الخطوات المدرجة ك 1.2، ويجب على مستخدمي Windows اتباع الخطوات المذكورة في القائمة 1.3.
2. مراقبة جودة البيانات
ملاحظة: تقييم، بيانيا، احتمال الأخطاء في يقرأ التسلسل. إزالة جميع التسلسلات التقنية، على سبيل المثال، محولات.
3. رسم خرائط وتعليقات توضيحية للعينات
ملاحظة: بعد الحصول على قراءات ذات نوعية جيدة، هذه تحتاج إلى تعيين إلى الجينوم المرجعي. لهذه الخطوة، تم استخدام مخطط STAR لتعيين نماذج المثال. تتطلب أداة مخطط STAR ذاكرة ذاكرة وصول عشوائي 32 غيغابايت لتحميل وتنفيذ تعيين القراءة والجينوم. بالنسبة للمستخدمين الذين ليس لديهم ذاكرة RAM 32 غيغابايت، يمكن استخدام القراءات المعينة مسبقا. في مثل هذه الحالات الانتقال إلى الخطوة 3.3 أو استخدام مخطط Bowtie2. يحتوي هذا القسم على برامج نصية ل STAR (النتائج الموضحة في جميع الأشكال) و Bowtie2 (مخطط الذاكرة المنخفضة المطلوب).
4. الجينات المعرب عنها بشكل تفاضلي والجينات المشتركة
5. تحديد الدرجة الجزيئية من اضطراب العينات
6. تحليل الإثراء الوظيفي
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تم إنشاء بيئة الحوسبة لتحليلات النسخ وتكوينها على منصة Docker. هذا النهج يسمح للمستخدمين المبتدئين لينكس لاستخدام أنظمة المحطة الطرفية لينكس دون معرفة الإدارة المسبقة. يستخدم النظام الأساسي Docker موارد نظام التشغيل المضيف لإنشاء حاوية خدمة تتضمن أدوات مستخدمين محددة (الشكل 1B). تم إنشاء حاوية على أساس توزيع Linux OS Ubuntu 20.04 وتم تكوينها بالكامل للتحليلات النسخية ، والتي يمكن الوصول إليها عبر محطة سطر الأوامر. في هذه الحاوية، يوجد بنية مجلد معرفة مسبقا لمجموعات البيانات والبرامج...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
يعد إعداد مكتبات التسلسل خطوة حاسمة نحو الإجابة على الأسئلة البيولوجية بأفضل طريقة ممكنة. وسيسترشد بنوع المحاضر التي تهم الدراسة نوع مكتبة التسلسل التي سيتم اختيارها وتدفع التحليلات المعلوماتية الحيوية. على سبيل المثال ، من تسلسل تفاعل الممرض والمضيف ، وفقا لنوع التسلسل ، من الممكن تحديد التسلسلات من كلا أو فقط من نصوص المضيف.
ويقيس الجيل التالي من معدات التسلسل، مثل منصة إيلومينا، درجات جودة التسلسل، التي ترمز إلى احتمال تسمية قاعدة بشكل غير صحيح. التحليلات المصب حساسة جدا لتسلسل منخفض الجودة...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
وليس لدى صاحبي البلاغ ما يكشفان عنه.
يتم تمويل HN من قبل FAPESP (أرقام المنح: #2017/50137-3، 2012/19278-6، 2018/14933-2، 2018/21934-5، و2013/08216-2) والمجلس الوطني لنواب الشعب (313662/2017-7).
نحن ممتنون بشكل خاص للمنح التالية للزملاء: ANAG (FAPESP Process 2019/13880-5)، VEM (FAPESP Process 2019/16418 -0)، IMSC (FAPESP عملية 2020/05284-0)، APV (FAPESP عملية 2019/27146-1) و، RLTO (عملية CNPq 134204/2019-0).
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| مختبر بيولوجيا الأنظمة الحاسوبية | CEMiTool | 1.12.2 | اكتشاف وتحليل وحدات الجينات ذات التعبير المشترك بطريقة تلقائية بالكامل ، مع توفير تقرير HTML سهل الاستخدام مع رسوم بيانية عالية الجودة. |
| EdgeR | Bioconductor (المشرف: Yunshun Chen [yuchen at wehi.edu.au]) | 3.30.3 | تحليل التعبير التفاضلي لملامح تعبير الحمض النووي الريبي مع النسخ المتماثل البيولوجي |
| المحسن الموصل الحيوي البركان | (المشرف: كيفن بليغي [كيفن في clinicalbioinformatics.co.uk]) | 1.6.0 | مخططات البراكين الجاهزة للنشر مع تلوين ووضع العلامات |
| المحسنة FastQC | Babraham Bioinformatics | 0.11.9 | يهدف إلى توفير طريقة بسيطة لإجراء بعض فحوصات مراقبة الجودة على بيانات التسلسل الخام القادمة من تسلسل الإنتاجية العالية |
| المعلوماتية الحيوية FeatureCounts ، معهد والتر وإليزا هول للبحوث الطبية | 2.0.0 | تعيين قراءات التسلسل المعينة للميزات الجينومية المحددة | |
| MDP | مختبر بيولوجيا الأنظمة الحاسوبية | 1.8.0 | تحسب الدرجة الجزيئية للاضطراب درجات عينات بيانات النسخ بناء على اضطرابها من عناصر التحكم |
| R | R Core Group | 4.0.3 | لغة البرمجة وبيئة البرمجيات المجانية للحوسبة الإحصائية والرسومات |
| قسم المعلوماتية الحيوية STAR ، معهد والتر وإليزا هول للبحوث الطبية | 2.7.6a | تم تصميم Aligner لمعالجة العديد من تحديات رسم خرائط بيانات RNA-seq على وجه التحديد باستخدام استراتيجية لحساب المحاذاة المقسمة | |
| Bowtie2 | جامعة جونز هوبكنز | 2.4.2 | أداة فائقة السرعة وفعالة للذاكرة لمحاذاة قراءات التسلسل مع التسلسلات المرجعية الطويلة |
| Trimmomatic | THE USADEL LAB | 0.39 | مهام تسلسل محول التشذيب لبيانات Illumina المقترنة والأحادية |
| احصل على Docker | Docker | 20.10.2 | إنشاء بيئة معلوماتية حيوية قابلة للتكرار والتنبؤ بها (https://docs.docker.com/get-docker/) |
| WSL2-Kernel | Windows | NA | https://docs.microsoft.com/en-us/windows/wsl/wsl2-kernel |
| الحصول على Docker Linux | Docker | NA | https://docs.docker.com/engine/install/ubuntu/ |
| مستودع Docker Linux | Docker | NA | موقع https://docs.docker.com/engine/install/ubuntu/#install-using-the-repository |
| MDP | مختبر الأحياء الأنظمة الحاسوبية | NA | https://mdp.sysbio.tools |
| Enrichr الموقع الإلكتروني | MaayanLab | NA | https://maayanlab.cloud/Enrichr/ |
| webCEMiTool | مختبر الأحياء للأنظمة الحاسوبية | NA | https://cemitool.sysbio.tools/ |
| gProfiler | المعلوماتية الحيوية والخوارزميات واستخراج البيانات مجموعة | NA | https://biit.cs.ut.ee/gprofiler/gost |
| goseq | Bioconductor (المشرف: ماثيو يونغ [my4 في sanger.ac.uk]) NA | http://bioconductor.org/packages/release/bioc/html/goseq.html | |
| SRA دراسة NCBI | NA | https://www.ncbi.nlm.nih.gov/bioproject/PRJNA507472/ |
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن