9 במאי 2017
פרוטוקול זה מתאר זרימת עבודה השוואתית של הרכבה והערות של טרנסקריפטום דה נובו עבור ביואינפורמטיקאים מתחילים. זרימת העבודה זמינה בחינם לחלוטין דרך CyVerse ומחוברת על ידי מאגר הנתונים. נעשה שימוש בשורת פקודה ובממשקי משתמש גרפיים, אך כל הקוד הדרוש זמין להעתקה והדבקה.
המטרה הכוללת של הליך זה היא להעריך, להרכיב, להוסיף הערות ולהשוות ביטוי גנים דיפרנציאלי באמצעות טרנסקריפטומיקה של דה נובו, החל מקבצי FASTQ גולמיים. שיטה זו יכולה לעזור לענות על שאלות בביולוגיה השוואתית ומולקולרית, כולל אילו תעתיקים נמצאים בתוך אורגניזם, מה התעתיקים האלה עושים בתוך האורגניזמים האלה, ומהם ההבדלים בין תנאי הניסוי. היתרון העיקרי של טכניקה זו הוא שהיא מספקת סביבה אינטראקטיבית.
הוא מספק משאבי חישוב לפי דרישה והוא מאפשר לחוקרים להתחיל לנתח מיד את נתוני ה-RNA-Seq שלהם. שיטה זו שימושית במיוחד עבור חוקרים המשווים ניסויים בתוך אורגניזם יחיד הכולל מספר רקמות, תנאים, נקודות זמן כדי להבין כיצד מערכות ביולוגיות משתנות. שיטה זו מתמקדת באורגניזמים שאינם מודלים ללא גנום, אך ניתן ליישם אותה גם על אורגניזמים עם מכלולי גנום זמינים, אפילו כאלה עם עשרות או מאות אלפי פיגומים בהרכבתם.
כדי להתחיל, קבלו גישה לאטמוספירה בסביבת הגילוי. בקש חשבון CyVerse בחינם על ידי ניווט לדף ההרשמה. השתמש בדוא"ל מוסדי כדי להירשם לחשבון.
לאחר מכן, נווטו ללשונית האפליקציות והשירותים ובקשו גישה לאטמוספירה. הגישה לסביבת הגילוי מוענקת באופן אוטומטי. היכנס לסביבת הגילוי, בקיצור DE. לאחר מכן, בחר בכרטיסיה נתונים כדי להציג תפריט המכיל את כל התיקיות במאגר הנתונים.
צור תיקיית פרוייקט ראשית שתכיל את כל הנתונים המשויכים לפרוייקט. מצא את סרגל הכלים בחלק העליון של חלון הנתונים ובחר קובץ, תיקייה חדשה. אל תשתמש ברווחים או בתווים מיוחדים בשמות התיקיות או בשמות קבצי פלט קלט כלשהם.
במקום זאת, השתמש בקו תחתון או בקווים מפרידים במידת הצורך. העלה קבצי רצף FASTQ גולמיים ואת התיקיה, 1_Raw_Sequence, לתיקיית משנה בשם תיקיה A_Raw_Reads. עבור קבצים מתחת לשני ג'יגה-ביט, השתמש בתכונת ההעלאה הפשוטה של מאגר הנתונים כדי לנווט לסרגל הכלים של חלון הנתונים על ידי לחיצה על כפתור הנתונים בשולחן העבודה הראשי של DE.
בחר העלאה, העלאה פשוטה משולחן העבודה. לאחר מכן, בחר את לדפדף כפתור כדי לנווט אל קבצי הרצף הגולמיים של FASTQ במחשב המקומי. הערך קריאות רצף גולמיות שהועלו באמצעות אפליקציית FastQC ב- DE. בחר בלחצן Apps בשולחן העבודה הראשי של DE כדי לפתוח חלון המכיל את כל יישומי הניתוח הזמינים ב- DE. חפש בחלון את הכלי FastQC בסרגל הכלים לחיפוש בחלק העליון של החלון.
פתח את הגרסה מרובת הקבצים אם יש יותר מקובץ FASTQ אחד. בחר קובץ וצור תיקיה חדשה ולאחר מכן בחר תיקיה זו כתיקיית הפלט. טען את קבצי הקריאה של FASTQ לחלון הכלי שנקרא בחר נתוני קלט ובחר הפעל ניתוח.
חפש את אפליקציית Trimmomatic הניתנת לתכנות ב-DE ופתח אותה. העלה את התיקיה של קבצי קריאה גולמיים של FASTQ לקטע ההגדרות. בחר אם קבצי הרצף הם יחידים או משויכים.
השתמש בקובץ הבקרה הרגיל שסופק על-ידי בחירה בלחצן עיון והדבקת נתיב הקובץ בתיבת התצוגה. בחר את קובץ הבקרה Trimmomatic והפעל את הניתוח. לקריאות רצף חיתוך איכותיות, חפש ופתח את אפליקציית המגל ב-DE. בחר את קריאות ה-FASTQ החתוכות כקריאות קלט ושנה את שמות קבצי הפלט.
כלול הגדרות איכות באפשרויות. פתח את הגרסה העדכנית ביותר של מופע האטמוספירה על ידי ניווט לדף הוויקי. בחר את הקישור עבור הגרסה העדכנית ביותר של תמונת השילוש הקדוש.
בחר בלחצן התחבר להפעלה ולאחר מכן תן שם למופע האטמוספירה. בחר גודל מופע בינוני3 או גדול3. הפעל את המופע והמתן עד שהוא ייבנה.
אם תמונת אטמוספירה לא מצליחה להסתובב, אתה יכול לנסות להגיש בקשה למופע קטן יותר או שאתה יכול להחיל על Jetstream להקצאה גדולה יותר. כל הפרטים נמצאים בוויקי הנלווה. העבר את קבצי הפלט של Trinity לתיקיה, 3_Assembly, ב-DE וסמן את התיקיה A_Trinity_de_novo_assembly.
הפעלת טריניטי דורשת ידע בשורת הפקודה ומספר ימים או אולי שבועות כדי להשלים ניתוחים גדולים. ישנם משאבים חינמיים זמינים המקושרים בוויקי כדי לעזור להבין את שורת הפקודה. תן לכל טרנסקריפטום שהורכב תיקיית משנה בתוך תיקיית A_Trinity_de_novo_assembly.
השתמש בשמות ייחודיים כולל השמות המדעיים של אורגניזמים וטיפולים הקשורים לכל טרנסקריפטום, ולאחר מכן צור תיקיית משנה נוספת בשם Folder B_rnaQUAT_Output בתיקיית 3_Assembly. פתח את האפליקציה שכותרתה De Novo rnaQUAST. תן שם לניתוח ובחר תיקיה B_rnaQUAST_Output כתיקיית הפלט.
חפש מפענח תמלול והפעל את מפענח הטרנס-מפענח בקובץ הפלט של De Novo Trinity Assembly בסביבת הגילוי. פתח את אפליקציית deseq2 DE.Name הניתוח ובחר את תיקיית הפלט 4_Differential_Expresssion. במקטע קלט, בחר את קובץ טבלת הספירה מהריצה של Trinity Assembly.
כמו כן, בחר את העמודה שבה ניתן למצוא את שמות ה-contig. הזן את כותרות העמודות מקובץ טבלת הנתונים של ספירות כדי לקבוע אילו עמודות יושוו. כלול את הפסיקים בין כל אחד מהתנאים.
אל תכלול את כותרת העמודה הראשונה המכילה את שמות ה-contig. לשכפולים, חזור על אותו שם. בשורה השניה, ספק את שמות שני התנאים שיש להשוות.
התאם את שמות כותרות העמודות שסופקו בשורה הראשונה. מוצגת כאן השוואה שיטתית של קריאות רצף לאחר כל שלב עיבוד מקדים. לאחר החיתוך, הקריאה צריכה להיות פחות מוטה תוכן GC ותוכן רצף, ויש לה פרופורציה גדולה יותר לקריאות עם ציון איכות גבוה.
יש צורך בקריאות באיכות גבוהה כדי להרכיב טרנסקריפטומים של דה נובו. התוצאות מ-QC מהיר תלויות באורגניזמים ובדגימות המרוצפות. על ידי אחידות בכל הדגימות שיושוו במורד הזרם היא המטרה העיקרית של קריאות עיבוד מקדים.
rnaQUAST כדי למנף קוד Boost כדי ליצור סטטיסטיקות סיכום על מכלולים המבוססים על גני ליבה ידועים בקליידים טקסונומיים. הדיוק של אסמבלרים מתגלה על ידי מספר אי-ההתאמות לכל תעתיק, וכמה תעתיקים תואמים לגנים קנוניים. ארבע עלילות המשנה האחרונות המוצגות כאן מספקות סטטיסטיקה מסכמת של אורך קונטיג ואיזופורמים, כמו גם כיסוי של איזופורמים צפויים.
NAx מייצג את אחוז ה-contigs עם אורך ארוך יותר מאורך ציר ה-y. שבר מורכב הוא התעתיק המורכב היחיד הארוך ביותר חלקי אורכו. כאשר כשבר מכוסה הוא אחוז האיזופורמים של תעתיק מורכב שלם כצפוי על ידי הגנים הפרוקריוטיים או האיקריוטיים של הליבה מ-BUSCO.
לאחר צפייה בסרטון זה, אתה אמור להבין היטב כיצד להרכיב ולהזין תעתיקים. בנוסף, פרוטוקול זה יאפשר לך לזהות ביטוי גנים דיפרנציאלי בין שני מצבים. בדרך כלל, אנשים נאבקים עם חבילות ביואינפורמטיות מכיוון שיש כל כך הרבה מהן, יש הרבה הגדרות ומשתנים הקשורים אליהן, ובדרך כלל אתה צריך להיות בעל ידע בשורת הפקודה כדי לבצע בפועל.
חשוב לתייג ולארגן את קלט הנתונים ותפוקות הניתוח שלך כדי שחוקרים אחרים יוכלו להבין מה נעשה. עליך לכלול את שלבי ההזמנה שהושלמו, גירסאות התוכנית ומידע לדוגמה. כמו כן, השמט רווחים בשמות התיקיות או הקבצים.
כלים חדשים וגרסאות חדשות של הכלים משולבים כל הזמן, אך גם גרסאות ישנות של הכלים נשמרות. כל השינויים יתועדו בוויקי הנלווה. בעקבות הליך זה, ניתן לבצע שיטות ביואינפורמטיות אחרות כמו ניתוח רשת, העשרת GO וזיהוי מסלול מטבולי כדי לעזור לענות על שאלות כמו וריאציה פנוטיפית, מצבים המשנים פרופילי ביטוי וזיהוי גנים מעניינים לגנומיקה פונקציונלית.
פרוטוקול זה מפרט זרימת עבודה להרכבה ואנוטציה של טרנסקריפטום דה נובו (de novo), אשר תוכננה עבור ביו-אינפורמטיקאים מתחילים. הוא מספק סביבה אינטראקטיבית לניתוח נתוני RNA-Seq, הנגישה דרך CyVerse.
תהליך עבודה זה מאפשר לצוותי מחקר ופיתוח בביופארמה להפיק נתונים טרנסקריפטומיים באיכות גבוהה מאורגניזמים שאינם אורגניזמי מודל, ובכך לתמוך בתיקוף מטרות במערכות ביולוגיות שאינן נחקרות מספיק. על ידי אספקת סביבה אינטראקטיבית מבוססת ענן להרכבה (assembly) דה-נובו ולניתוח ביטוי דיפרנציאלי, הוא מפחית חסמים להורדת סיכונים מכניסטיים בשלבי הגילוי המוקדמים. גישה זו מגבירה את הביטחון החזוי בעת חקר תגובות ספציפיות לאורגניזם בעקבות הפרעות ניסיוניות, ובכך מסייעת לתעדוף תיקי פרויקטים.
השיטה משתלבת ברצף הגילוי המוקדם, ותומכת בבדיקת השערות ובבירור מסלולים לפני מאמצים לזיהוי מובילים.