הפרוטוקול המוצג כאן מתאר צינור שלם לניתוח נתוני תמלול ריצוף RNA מקריאות גולמיות לניתוח פונקציונלי, כולל בקרת איכות וצעדי עיבוד מראש לגישות אנליטיות סטטיסטיות מתקדמות.
מאמר שיטה
הפרוטוקול המוצג כאן מתאר צינור שלם לניתוח נתוני תמלול ריצוף RNA מקריאות גולמיות לניתוח פונקציונלי, כולל בקרת איכות וצעדי עיבוד מראש לגישות אנליטיות סטטיסטיות מתקדמות.
פתוגנים יכולים לגרום למגוון רחב של מחלות זיהומיות. התהליכים הביולוגיים הנגרמים על ידי המארח בתגובה לזיהום קובעים את חומרת המחלה. כדי לחקור תהליכים כאלה, חוקרים יכולים להשתמש בטכניקות ריצוף תפוקה גבוהה (RNA-seq) המודדות את השינויים הדינמיים של התמלול המארח בשלבים שונים של זיהום, תוצאות קליניות או חומרת המחלה. חקירה זו יכולה להוביל להבנה טובה יותר של המחלות, כמו גם לחשוף מטרות וטיפולים תרופתיים פוטנציאליים. הפרוטוקול המוצג כאן מתאר צינור שלם לניתוח נתוני ריצוף RNA מקריאות גולמיות לניתוח פונקציונלי. הצינור מחולק לחמישה שלבים: (1) בקרת איכות של הנתונים; (2) מיפוי וביאור של גנים; (3) ניתוח סטטיסטי לזיהוי גנים מבוטאים באופן דיפרנציאלי וגנים משותפים; (4) קביעת המידה המולקולרית של ההסתבכויות של דגימות; וניתוח פונקציונלי (5). שלב 1 מסיר ממצאים טכניים שעשויים להשפיע על איכות הניתוחים במורד הזרם. בשלב 2, גנים ממופים ומביאים ביאורים בהתאם לפרוטוקולי הספרייה הסטנדרטיים. הניתוח הסטטיסטי בשלב 3 מזהה גנים המתבטאים באופן דיפרנציאלי או באים לידי ביטוי בדגימות נגועות, בהשוואה לגנים שאינם נגועים. שונות מדגם ונוכחות של חריגים ביולוגיים פוטנציאליים מאומתים באמצעות מידת הגישה המולקולרית של perturbation בשלב 4. לבסוף, הניתוח התפקודי בשלב 5 חושף את המסלולים הקשורים פנוטיפ המחלה. הצינור המוצג נועד לתמוך לחוקרים באמצעות ניתוח נתוני RNA-seq ממחקרי אינטראקציה בין מארח לפתוגן ולהניע ניסויים עתידיים במבחנה או ב- vivo , החיוניים להבנת המנגנון המולקולרי של זיהומים.
Arboviruses, כגון דנגי, קדחת צהובה, chikungunya, וזיקה, היו קשורים באופן נרחב עם מספר התפרצויות אנדמיות התגלו כאחד הפתוגנים העיקריים האחראים להדביק בני אדם בעשורים האחרונים1,2. אנשים נגועים בנגיף chikungunya (CHIKV) לעתים קרובות יש חום, כאב ראש, פריחה, polyarthralgia, דלקת פרקים3,4,5. וירוסים יכולים לחתור תחת ביטוי הגנים של התא ולהשפיע על מסלולי איתות מארח שונים. לאחרונה, מחקרי תמלול דם השתמשו RNA-seq כדי לזהות את הגנים המובעים דיפרנציאלי (DEGs) הקשורים זיהום CHIKV חריף בהשוואה הבראה6 או פקדים בריאים7. לילדים נגועים CHIKV היו גנים מוסדרים המעורבים בחסינות מולדת, כגון אלה הקשורים לחיישנים סלולריים עבור RNA ויראלי, איתות JAK / STAT, ומסלולי איתות קולטן דמוי אגרה6. מבוגרים שנדבקו באופן חריף ב- CHIKV הראו גם אינדוקציה של גנים הקשורים לחסינות מולדת, כגון אלה הקשורים למונוציטים והפעלת תאים דנדריטיים, ולתגובות אנטי ויראליות7. מסלולי האיתות המועשרים בגנים מווסתים כלפי מטה כללו את אלה הקשורים לחסינות אדפטיבית, כגון הפעלת תאי T ובידול והעשרה בתאי T ו- B7.
ניתן להשתמש במספר שיטות לניתוח נתוני שעתוק של גנים מארחים ופתוגנים. לעתים קרובות, הכנת ספריית RNA-seq מתחילה בהעשרה של תמלילי פולי-A בוגרים. שלב זה מסיר את רוב הרנ"א ריבוזומלי (rRNA) ובחלק מהמקרים RNAs ויראלי/חיידקי. עם זאת, כאשר השאלה הביולוגית כוללת את זיהוי תעתיק הפתוגן ו- RNA רצפים ללא תלות בבחירה הקודמת, ניתן היה לזהות תמלילים רבים ושונים אחרים על ידי רצף. לדוגמה, mRNAs תת-גנומי הוכחו כגורם חשוב כדי לאמת את חומרת המחלות8. בנוסף, עבור וירוסים מסוימים כגון CHIKV ו SARS-CoV-2, אפילו ספריות מועשרות poly-A ליצור קריאות ויראליות שניתן להשתמש בהם ניתוחים במורד הזרם9,10. כאשר מתמקדים בניתוח התמלול המארח, חוקרים יכולים לחקור את ההסתבות הביולוגית על פני דגימות, לזהות גנים מבוטאים באופן דיפרנציאלי ומסלולים מועשרים, וליצור מודולי ביטוי משותף7,11,12. פרוטוקול זה מדגיש ניתוחי תמלול של חולים נגועים ב-CHIKV ואנשים בריאים המשתמשים בגישות ביו-אינפורמטיות שונות (איור 1A). נתונים ממחקר שפורסם בעבר7 המורכב מ -20 אנשים בריאים ו -39 נדבקים בחריפות שימשו כדי להפיק את התוצאות הייצוגיות.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
הדגימות המשמשות בפרוטוקול זה אושרו על ידי ועדות האתיקה הן מהמחלקה למיקרוביולוגיה של המכון למדעי הביו-רפואה באוניברסיטת סאו פאולו והן מהאוניברסיטה הפדרלית של סרג'יפה (פרוטוקולים: 54937216.5.0000.5467 ו- 54835916.2.0000.5546, בהתאמה).
1. התקנת שולחן עבודה של Docker
הערה: השלבים להכנת סביבת Docker שונים בין מערכות ההפעלה (OSs). לכן, משתמשי Mac חייבים לבצע את השלבים המפורטים כ- 1.1, משתמשי Linux חייבים לבצע את השלבים המפורטים כ- 1.2, ומשתמשי Windows חייבים לבצע את השלבים המפורטים כ- 1.3.
2. בקרת איכות של הנתונים
הערה: הערך, באופן גרפי, את ההסתברות לשגיאות ברצף קורא. הסר את כל הרצפים הטכניים, למשל, מתאמים.
3. מיפוי וביאור של דגימות
הערה: לאחר קבלת קריאות באיכות טובה, אלה צריכים להיות ממופים לגנום הייחוס. עבור שלב זה, ממפה STAR שימש למיפוי הדוגמאות לדוגמה. הכלי ממפה STAR דורש זיכרון RAM של 32 GB כדי לטעון ולבצע את הקריאות ומיפוי הגנום. עבור משתמשים שאין להם זיכרון RAM של 32 GB, ניתן להשתמש בקריאות שכבר מופו. במקרים כאלה לקפוץ לשלב 3.3 או להשתמש בממפה Bowtie2. מקטע זה כולל סקריפטים עבור STAR (תוצאות המוצגות בכל הנתונים) ו- Bowtie2 (ממפה נדרש עם זיכרון נמוך).
4. גנים מבוטאים באופן דיפרנציאלי וגנים משותפים
5. קביעת מידת ההסתה המולקולרית של דגימות
6. ניתוח העשרה פונקציונלי
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
סביבת המחשוב עבור ניתוחי תמלול נוצרה ומוגדרת בפלטפורמת Docker. גישה זו מאפשרת למשתמשי לינוקס מתחילים להשתמש במערכות מסופים של לינוקס ללא ידע ניהולי קודם. פלטפורמת Docker משתמשת במשאבים של מערכת ההפעלה המארחת כדי ליצור גורם מכיל של שירות הכולל כלים של משתמשים ספציפיים (איור 1B). מכולה המבוססת על הפצת לינוקס OS Ubuntu 20.04 נוצרה והיא הוגדרה במלואה עבור ניתוחי תמלול, הנגישים באמצעות מסוף שורת הפקודה. בגורם מכיל זה, קיים מבנה תיקיות מוגדר מראש עבור ערכות נתונים וקבצי Script הנחוצים עבו...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
הכנת ספריות הרצף היא צעד מכריע לקראת מענה על שאלות ביולוגיות בצורה הטובה ביותר. סוג התמלילים שמעניינים את המחקר ינחה איזה סוג של ספריית רצף ייבחר ויניע ניתוחים ביואינפורמטיים. לדוגמה, מתוך רצף של פתוגן ואינטראקציה מארח, על פי סוג הרצף, ניתן לזהות רצפים משניהם או רק מן התמלילים המארח.
ציוד הרצף של הדור הבא, למשל, פלטפורמת Illumina, מודד את ציוני איכות הרצף, מה שמייצג את ההסתברות שבסיס נקרא באופן שגוי. הניתוחים במורד הזרם רגישים מאוד לרצפים באיכות נמוכה ומובילים לביטוי גנים שלא נקרא כהלכה או לא ...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
למחברים אין מה לחשוף.
HN ממומן על ידי FAPESP (מספרי מענקים: #2017/50137-3, 2012/19278-6, 2018/14933-2, 2018/21934-5, ו-2013/08216-2) ו-CNPq (313662/2017-7).
אנו מודים במיוחד על המענקים הבאים לעמיתים: ANAG (תהליך FAPESP 2019/13880-5), VEM (תהליך FAPESP 2019/16418-0), IMSC (תהליך FAPESP 2020/05284-0), APV (תהליך FAPESP 2019/27146-1) ו- RLTO (תהליך CNPq 134204/2019-0).
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| CEMiTool | מעבדה לביולוגיה של מערכות חישוביות | 1.12.2 | גילוי וניתוח מודולי גנים של ביטוי משותף באופן אוטומטי לחלוטין, תוך מתן דוח HTML ידידותי למשתמש עם גרפים באיכות גבוהה. |
| EdgeR | Bioconductor (מתחזק: Yunshun Chen [yuchen at wehi.edu.au]) | 3.30.3 | ניתוח ביטוי דיפרנציאלי של פרופילי ביטוי RNA-seq עם שכפול ביולוגי |
| EnhancedVolcano | Bioconductor (מתחזק: קווין בליגה [קווין ב-clinicalbioinformatics.co.uk]) | 1.6.0 | עלילות הר געש מוכנות לפרסום עם צביעה ותיוג משופרים |
| FastQC | Babraham Bioinformatics | 0.11.9 | נועד לספק דרך פשוטה לבצע כמה בדיקות בקרת איכות על נתוני רצף גולמיים המגיעים מריצוף תפוקה גבוהה |
| FeatureCounts | החטיבה לביואינפורמטיקה, מכון וולטר ואליזה הול למחקר רפואי | 2.0.0 | הקצאת קריאות ריצוף ממופות לתכונות גנומיות מוגדרות |
| MDP | מעבדה לביולוגיה של מערכות חישוביות | 1.8.0 | דרגה מולקולרית של הפרעה מחשבת ציונים עבור דגימות נתוני טרנסקריפטום על סמך ההפרעה שלהן מבקרות |
| R | R Core Group | 4.0.3 | שפת תכנות וסביבת תוכנה חופשית למחשוב סטטיסטי וגרפיקה |
| STAR חטיבת הביואינפורמטיקה, המכון למחקר רפואי ע"ש וולטר ואליזה הול | 2.7.6a | Aligner תוכנן לתת מענה ספציפי לרבים מהאתגרים של מיפוי נתוני RNA-seq באמצעות אסטרטגיה להסביר יישורים מחוברים | |
| Bowtie2 | אוניברסיטת ג'ונס הופקינס | 2.4.2 | כלי מהיר במיוחד וחסכוני בזיכרון ליישור קריאות רצף לרצפי ייחוס ארוכים |
| Trimmomatic | THE USADEL LAB | 0.39 | משימות רצף מתאם חיתוך עבור נתונים מזווגים ונתונים חד-קצתיים של Illumina |
| קבל Docker | Docker | 20.10.2 | צור סביבה ביואינפורמטית הניתנת לשחזור וחיזוי (https://docs.docker.com/get-docker/) |
| WSL2-Kernel | Windows | NA | https://docs.microsoft.com/en-us/windows/wsl/wsl2-kernel |
| קבל את Docker Linux | Docker | NA | https://docs.docker.com/engine/install/ubuntu/ |
| Docker Linux Repository | Docker | NA | https://docs.docker.com/engine/install/ubuntu/#install-using-the-repository |
| MDP אתר | המעבדה לביולוגיה של מערכות חישוביות | NA | https://mdp.sysbio.tools |
| Enrichr אתר | MaayanLab | NA https://maayanlab.cloud/Enrichr/ | |
| webCEMiTool | Computational Systems Biology Laboratory | NA | https://cemitool.sysbio.tools/ |
| gProfiler | קבוצת ביואינפורמטיקה, אלגוריתמיקה וכריית נתונים | NA | https://biit.cs.ut.ee/gprofiler/gost |
| goseq | Bioconductor (מתחזק: מתיו יאנג [my4 ב-sanger.ac.uk]) | NA | http://bioconductor.org/packages/release/bioc/html/goseq.html |
| מחקר SRA | NCBI NCBI | NA https://www.ncbi.nlm.nih.gov/bioproject/PRJNA507472/ |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה