مايو 9, 2017
يحدد هذا البروتوكول سير عمل مقارن لتجميع النسخ والتعليقات التوضيحية لعلماء المعلوماتية الحيوية المبتدئين. سير العمل متاح مجانا بالكامل من خلال CyVerse ومتصل بواسطة Data Store. يتم استخدام سطر الأوامر وواجهات المستخدم الرسومية ، ولكن كل التعليمات البرمجية المطلوبة متاحة للنسخ واللصق.
الهدف العام من هذا الإجراء هو تقييم التعبير الجيني التفاضلي وتجميعه والتعليق عليه ومقارنته من خلال نسخ De Novo ، بدءا من ملفات FASTQ الأولية. يمكن أن تساعد هذه الطريقة في الإجابة على أسئلة في البيولوجيا المقارنة والجزيئية ، بما في ذلك النصوص الموجودة داخل الكائن الحي ، وما تفعله هذه النصوص داخل تلك الكائنات الحية ، وما هي الاختلافات بين الظروف التجريبية. الميزة الرئيسية لهذه التقنية هي أنها توفر بيئة تفاعلية.
يوفر موارد حسابية عند الطلب ويسمح للباحثين بالبدء على الفور في تحليل بيانات RNA-Seq الخاصة بهم. هذه الطريقة مفيدة بشكل خاص للباحثين الذين يقارنون التجارب داخل كائن حي واحد يتضمن أنسجة وظروف ونقاط زمنية متعددة لفهم كيفية تغير الأنظمة البيولوجية. تركز هذه الطريقة على الكائنات الحية غير النموذجية التي لا تحتوي على جينومات ، ولكن يمكن تطبيقها أيضا على الكائنات الحية التي تتوفر فيها تجميعات الجينوم ، حتى تلك التي تحتوي على عشرات أو مئات الآلاف من السقالات في تجميعها.
للبدء ، احصل على إمكانية الوصول إلى الغلاف الجوي في بيئة الاكتشاف. اطلب حساب CyVerse مجانيا بالانتقال إلى صفحة التسجيل. استخدم بريدا إلكترونيا مؤسسيا للتسجيل للحصول على الحساب.
بعد ذلك ، انتقل إلى علامة تبويب التطبيقات والخدمات واطلب الوصول إلى Atmosphere. يتم منح الوصول إلى بيئة الاكتشاف تلقائيا. قم بتسجيل الدخول إلى بيئة الاكتشاف ، والمختصرة باسم DE. ثم حدد علامة التبويب "بيانات" لإظهار قائمة تحتوي على جميع المجلدات الموجودة في مخزن البيانات.
قم بإنشاء مجلد مشروع رئيسي يضم جميع البيانات المرتبطة بالمشروع. ابحث عن شريط الأدوات في الجزء العلوي من نافذة البيانات وحدد ملف، مجلد جديد. لا تستخدم مسافات أو أحرف خاصة في أسماء المجلدات أو أي أسماء ملفات إخراج إدخال.
بدلا من ذلك، استخدم الشرطة السفلية أو الشرطات عند الاقتضاء. قم بتحميل ملفات تسلسل FASTQ الأولية والمجلد ، 1_Raw_Sequence ، في مجلد فرعي بعنوان المجلد A_Raw_Reads. بالنسبة للملفات التي يقل حجمها عن غيغابايت، استخدم ميزة التحميل البسيطة لمخزن البيانات للانتقال إلى شريط أدوات نافذة البيانات بالنقر فوق الزر "بيانات" في سطح مكتب DE الرئيسي.
حدد تحميل، تحميل بسيط من سطح المكتب. ثم حدد الزر "استعراض" للانتقال إلى ملفات تسلسل FASTQ الأولية على الكمبيوتر المحلي. تقييم قراءات التسلسل الخام التي تم تحميلها باستخدام تطبيق FastQC في DE. حدد الزر التطبيقات على سطح مكتب DE الرئيسي لفتح نافذة تحتوي على جميع تطبيقات التحليل المتوفرة في DE. ابحث في النافذة عن أداة FastQC في شريط أدوات البحث أعلى النافذة.
افتح الإصدار متعدد الملفات إذا كان هناك أكثر من ملف FASTQ واحد. حدد ملف وأنشئ مجلدا جديدا، ثم حدد هذا المجلد كمجلد الإخراج. قم بتحميل ملفات قراءة FASTQ في نافذة الأداة المسماة تحديد بيانات الإدخال وحدد بدء التحليل.
ابحث عن تطبيق Trimmomatic القابل للبرمجة في DE وافتحه. قم بتحميل مجلد ملفات قراءة FASTQ الأولية في قسم الإعدادات. حدد ما إذا كانت ملفات التسلسل مفردة أو مقترنة.
استخدم ملف التحكم القياسي المتوفر عن طريق تحديد الزر استعراض ولصق مسار الملف في مربع العرض. حدد ملف التحكم Trimmomatic وابدأ التحليل. للحصول على قراءات تسلسل التشذيب عالية الجودة ، ابحث وافتح تطبيق Sickle في DE. حدد قراءات FASTQ المقتطعة كقراءات إدخال وإعادة تسمية ملفات الإخراج.
قم بتضمين إعدادات الجودة في الخيارات. افتح أحدث إصدار من مثيل الغلاف الجوي بالانتقال إلى صفحة wiki. حدد الارتباط لأحدث إصدار من صورة الثالوث والترميث.
حدد الزر تسجيل الدخول إلى التشغيل ثم قم بتسمية مثيل Atmosphere. حدد حجم مثيل متوسط3 أو كبير3. قم بتشغيل المثيل وانتظر حتى يتم إنشاؤه.
إذا فشلت صورة الغلاف الجوي في الدوران، فيمكنك محاولة التقدم بطلب للحصول على مثيل أصغر أو يمكنك التقدم إلى Jetstream للحصول على تخصيص أكبر. جميع التفاصيل موجودة على الويكي المصاحب. انقل ملفات إخراج Trinity إلى المجلد ، 3_Assembly ، في DE وقم بتسمية المجلد ، A_Trinity_de_novo_assembly.
يتطلب تشغيل Trinity معرفة بسطر الأوامر وعدة أيام أو ربما أسابيع لإكمال التحليلات الكبيرة. هناك موارد مجانية متاحة مرتبطة على الويكي للمساعدة في فهم سطر الأوامر. امنح كل نسخة تم تجميعها مجلدا فرعيا داخل مجلد A_Trinity_de_novo_assembly.
استخدم أسماء فريدة بما في ذلك الأسماء العلمية للكائنات الحية والعلاجات المرتبطة بكل نسخ ، ثم قم بإنشاء مجلد فرعي آخر يسمى B_rnaQUAT_Output المجلد في مجلد 3_Assembly. افتح التطبيق بعنوان De Novo rnaQUAST. قم بتسمية التحليل وحدد B_rnaQUAST_Output المجلد كمجلد الإخراج.
ابحث عن وحدة فك ترميز النص وقم بتشغيل محول ترميز على ملف إخراج De Novo Trinity Assembly fasta في بيئة الاكتشاف. افتح تطبيق deseq2 في DE.Name التحليل وحدد مجلد الإخراج 4_Differential_Expresssion. في قسم الإدخال، حدد ملف جدول الأعداد من تشغيل تجميع الثالوث.
أيضا ، حدد العمود حيث يمكن العثور على أسماء contig. أدخل رؤوس الأعمدة من ملف جدول بيانات الأعداد لتحديد الأعمدة التي تتم مقارنتها. قم بتضمين الفواصل بين كل شرط.
لا تقم بتضمين رأس العمود الأول الذي يحتوي على أسماء contig. بالنسبة للنسخ المتماثلة، كرر نفس الاسم. في السطر الثاني ، أدخل أسماء الشرطين المراد مقارنتهما.
تطابق أسماء رؤوس الأعمدة المتوفرة في السطر الأول. تظهر هنا مقارنة منهجية لقراءات التسلسل بعد كل خطوة من خطوات المعالجة المسبقة. بعد التشذيب، يجب أن تحتوي القراءة على محتوى GC أقل انحرافا ومحتوى تسلسل، وأن يكون لها نسبة أكبر من القراءات ذات درجة الجودة العالية.
القراءات عالية الجودة ضرورية لتجميع نسخ De Novo. تعتمد النتائج الناتجة عن مراقبة الجودة السريعة على الكائنات الحية والعينات التي يتم تسلسلها. من خلال التوحيد عبر جميع العينات التي ستتم مقارنتها في اتجاه مجرى النهر هو الهدف الأساسي للقراءات المسبقة للمعالجة.
rnaQUAST للاستفادة من كود التعزيز لإنشاء إحصائيات موجزة حول التجميعات بناء على الجينات الأساسية المعروفة في الكتل التصنيفية. يتم الكشف عن دقة المجمعات من خلال عدد حالات عدم التطابق لكل نسخة ، وعدد النصوص التي تتطابق مع الجينات القانونية. توفر المخططات الفرعية الأربع الأخيرة المعروضة هنا إحصائيات موجزة لطول contig والشكل الإسوي ، بالإضافة إلى تغطية الأشكال الإسوية المتوقعة.
يمثل NAx النسبة المئوية للcontigs التي يبلغ طولها أطول من طول المحور y. الكسر المجمع هو أطول نسخة مجمعة مقسومة على طولها. حيث الكسر المغطى هو النسبة المئوية للأشكال الإسوية للنسخة المجمعة الكاملة كما هو متوقع من قبل الجينات بدائية النواة الأساسية أو حقيقية النواة من BUSCO.
بعد مشاهدة هذا الفيديو ، يجب أن يكون لديك فهم جيد لكيفية تجميع النسخ وإدخالها. بالإضافة إلى ذلك ، سيسمح لك هذا البروتوكول باكتشاف التعبير الجيني التفاضلي بين حالتين. بشكل عام ، يكافح الأفراد مع حزم المعلوماتية الحيوية نظرا لوجود الكثير منها ، وهناك الكثير من الإعدادات والمتغيرات المرتبطة بها ، وعادة ما يجب أن يكون لديك معرفة بسطر الأوامر لتنفيذها بالفعل.
من المهم تسمية وتنظيم مدخلات البيانات ومخرجات التحليل حتى يتمكن الباحثون الآخرون من فهم ما تم إنجازه. يجب عليك تضمين خطوات الطلب التي تم إكمالها وإصدارات البرنامج ومعلومات العينة. أيضا ، احذف أي مسافات في أسماء المجلد أو الملفات.
يتم دمج أدوات جديدة وإصدارات جديدة من الأدوات باستمرار ، ولكن يتم أيضا الاحتفاظ بالإصدارات القديمة من الأدوات. سيتم تسجيل جميع التغييرات على الويكي المصاحب. باتباع هذا الإجراء ، يمكن إجراء طرق معلوماتية حيوية أخرى مثل تحليل الشبكة ، وإثراء GO ، وتحديد مسار التمثيل الغذائي للمساعدة في الإجابة على أسئلة مثل تباين النمط الظاهري ، والظروف التي تغير ملفات تعريف التعبير ، وتحديد الجينات ذات الأهمية لعلم الجينوم الوظيفي.
يوضح هذا البروتوكول سير عمل لتجميع وتعليق المخطط النسخي من الصفر (de novo transcriptome assembly and annotation)، وهو مصمم للمبتدئين في مجال المعلوماتية الحيوية. كما يوفر بيئة تفاعلية لتحليل بيانات RNA-Seq، يمكن الوصول إليها عبر CyVerse.
يتيح سير العمل هذا لفرق البحث والتطوير في مجال الأدوية الحيوية توليد بيانات ترانسكريبتومية عالية الجودة من كائنات غير نموذجية، مما يدعم التحقق من الأهداف في الأنظمة البيولوجية غير المستكشفة بشكل كافٍ. ومن خلال توفير بيئة تفاعلية قائمة على السحابة للتجميع الابتكاري (de novo assembly) وتحليل التعبير التفاضلي، فإنه يقلل من العوائق التي تحول دون تقليل المخاطر الميكانيكية في مراحل الاكتشاف المبكرة. ويعزز هذا النهج من الثقة التنبؤية عند دراسة الاستجابات الخاصة بالكائن الحي للاضطرابات التجريبية، مما يساهم في تحديد أولويات محفظة المشاريع.
تندرج هذه الطريقة ضمن سلسلة مراحل الاكتشاف المبكر، مما يدعم اختبار الفرضيات وتوضيح المسارات قبل البدء بجهود تحديد المركبات الرائدة.