5 בפברואר 2014
כאן אנו מתארים צינור צעד אחר צעד ליצירת phylogenies אמין ממערכי נתוני רצף נוקליאוטידים או חומצות אמינו. מדריך זה נועד לשרת את חוקרים או סטודנטים חדשים לניתוח פילוגנטי.
המטרה הכללית של מאמר זה היא לשחזר עץ פילוגנטי מהימן מרצפי DNA או חלבונים. מטרה זו מושגת תחילה על ידי זיהוי רצפים דומים באמצעות תוכניות blast ב-NCBI. השלב השני הוא ביצוע יישור (alignment) של הרצפים הדומים.
בשלב הבא, נקבע מודל האבולוציה המתאים ביותר על סמך השליחייה (alignment). השלב הסופי הוא הסקת מערכת היחסים הפילוגנטית מרצפי השליחייה. בסופו של דבר, השורה של שלבי העבודה (pipeline) משמשת להדגמה כיצד משתמשים יכולים להגיע מנתוני רצפים לעצי פילוגנייה מהימנים.
שיטה זו יכולה לסייע במתן תשובות לשאלות מפתח בתחומים מגוונים, על ידי הסקת זהות ותפקוד של רצפים חדשים. כדי להשתמש בגרסה המקוונת של כלי החיפוש ליישור מקומי בסיסי, או blast, נווטו למרכז הלאומי למידע בביוטכנולוגיה (NCBI) או לשרת האינטרנט של Blast ב-NCBI. לחצו על תוכנית ה-blast המתאימה.
הזינו לרשימת השאילתה רצף טקסט בפורמט FASTA, כגון זה המוצג כאן. לחצו על תוכנית ה-blast המתאימה לביצוע החיפוש, ולאחר מכן לחצו על blast. הפלט הוא בפורמט HTML כברירת מחדל ומציג את הרצפים הדומים ביותר לרצף הטקסט שהוזן.
הסעיף הבא עוסק בשימוש בקובץ הרצה מקומי של blast במערכות הפעלה Windows ו-Mac. משתמשים יכולים לדלג לסעיף הבא שנקרא Blast Local executables for Macs x. כדי להריץ את תוכנית שורת הפקודה של blast במחשב עם מערכת הפעלה Windows, יש להוריד את קובץ ההרצה המתאים ל-Windows מאתר ה-blast של NCBI.
לאחר התקנת תוכנת Blast, הגדירו את משתני הסביבה של המחשב באופן הבא: לחצו על כפתור ההתחלה של המחשב ולחצו קליק ימני על "המחשב זה" (Computer). לאחר מכן, לחצו על "מאפיינים" (Properties). בחלון החדש, בחרו ב"הגדרות מערכת מתקדמות" (Advanced system settings), ובלשונית "מתקדם" בחלון שנפתח, לחצו על כפתור "משתני סביבה" (Environment variables).
לאחר מכן, תחת משתני המשתמש (user variables) במדור המשתמש, לחצו על הכפתור new. בחלון הצף שייפתח, הוסיפו את שם המשתנה path ואת ערך המשתנה המוצג כאן. לאחר מכן, הורידו מסד נתונים של blast בפורמט מוכן, המתעדכן מדי יום מאתר ה-NCBI, או גנום של אורגניזם מסוים.
לאחר מכן, פתחו חלון שורת פקודה של MS DOS על ידי לחיצה על התחל והקלדת CMD בשורת החיפוש, ועברו לספריית ה-NCBI blast. צרו את מאגר הנתונים באמצעות פקודת Make blast DB המוצגת כאן. צרו רצף חלבון לשאילתה בשם test על ידי הכנסת רצף טקסט של חלבון בפורמט FASTA לתיקיית ה-DB.
לאחר מכן, כדי לזהות את הרצפים הדומים ביותר לחלבון הבדיקה, יש לבצע שאילתה מול מסד הנתונים באמצעות פקודת blast P. הסעיף הבא חוזר על מידע זה עבור משתמשי Mac. משתמשי Windows יכולים לדלג לסעיף חמש, יצירת יישורי רצפים מרובים.
כדי להריץ את תוכנת ה-blast משורת הפקודה במחשב Mac, הורד את קובץ ההרצה המתאים למערכת MAC באמצעות גישה מרחוק לאתר N-C-B-I-F-T-P. לשם כך, פתח את ה-finder וחפש את ה-terminal; בחלון הטרמינל, הקלד את כתובת ה-FTP של אתר N-C-B-I-F-T-P. הקלד anonymous כשם המשתמש ובסיסמה, ולאחר מכן הקלד CD blast slash executables slash latest.
רשמו את קבצי ההרצה על ידי הקלדת LS והורידו את הגרסה העדכנית ביותר התואמת לדרישות המערכת שלכם על ידי הקלדת הפקודה הבאה. כעת, דחוסו את הקבצים שהורדו. כעת הוסיפו את נתיב הקבצים הבינאריים עבור קובץ ההרצה של blast לנתיב המערכת (path), כך שהמעטפת (shell) תוכל לחפש בתיקייה זו.
בחיפוש אחר פקודות, הורד מאגר נתונים של blast בפורמט מוכן מראש או גנום מאתר ה-NCBI. חפש בתיקיית הגנומים על ידי הקלדת CD genomes. לאחר מכן, הורד את הגנום או את הרצף המבוקש באופן הבא, ואז הקלד quit כדי לצאת מאתר ה-FTP.
בשלב הבא, צרו את בסיס הנתונים על ידי הקלדת ההוראה Make Blast DB. הכניסו רצף שאילתה בפורמט FASTA לתוך תיקיית ה-bin ובדקו את בסיס הנתונים באמצעות הפקודה blast P query כדי למצוא את הרצף הדמי ביותר לנתוני רצף הבדיקה; אחת מתוכנות יישור רצפים מרובים (MSA) הנפוצות היא tea coffee. לאחר הזנת נתוני רצף בפורמט fasta לתיבת השאילתה באתר tea coffee, הפלט מצביע על שאריות דומות באמצעות קידוד צבעים.
תוכנת MSA נפוצה נוספת היא clusteral MSA, אותה ניתן להוריד כגרסת שורת פקודה, CLUSTERAL W, או כגרסה גרפית, CLUSTERAL X, עבור מערכות הפעלה שונות. לאחר מכן, טענו את הנתונים לתוכנת clusteral כטקסט רצפים בפורמט fast על ידי בחירת לשונית הקובץ. לאחר מכן, לחצו על כפתור טעינת הרצפים.
כעת עברו ללשונית היישור (align) ולחצו על כפתור ביצוע יישור מלא (do complete alignment) כדי ליישר את הרצפים עבור מודל אבולוציה אופטימלי. הורידו את תוכנת protest. לאחר הורדת protest, לחצו פעמיים על protest.
לאחר הפעלת PROTTEST, לחצו על select file בתיבת היישור (alignment) כדי לטעון את נתוני הרצף. לאחר מכן, לחצו על start להרצת התוכנית. עם סיום ההרצה, התוכנית תצביע על המודל המיטבי על בסיס הקריטריונים להסקת רצפים.
לאחר הורדה והפעלה של Phi ML, טענו את רצף הקלט כקובץ רצף בפורמט lip על ידי הקלדת שם הקובץ ו-PY. לאחר מכן, הפעילו את התוכנה על ידי הקלדת y. לאחר הורדת תוכנית לחישוב הסקה בייסיאנית (Bayesian inference) מאתר Mr Bays, הפעילו את התוכנה על ידי לחיצה על קובץ ההפעלה. לאחר מכן, טענו לתוכנה נתוני רצפים בפורמט Nexus על ידי הקלדת execute ושם הקובץ עם סיומת NEX.
בשלב הבא, הגדירו את המודל האבולוציוני ובחרו את מספר הדורות להרצה. לאחר הרצת הניתוח באמצעות הפקודה mc mc, סכמו את העצים באמצעות הפקודה sum T כדי לצפות בעץ פילוגנטי. הורידו את תוכנת התצוגה של העץ.
כהערה סופית, ישנן גרסאות חדשות שיוצאות באופן קבוע לתוכנות המיועדות לספק יישור רצפים (alignments) טובים יותר, חיזויים של דמיון, או עצי פילוגנטיקה. בעוד שהסקירה בסרטון זה כיסתה תוכנות פופולריות, המצופה מהצופה לבחון אפשרויות נוספות. אלגוריתם ה-blast מבצע יישור רצפים מקומי, המחפש מקטעים קצרים של דמיון ברצף.
לאחר שהאלגוריתם חיפש את כל הרצפים האפשריים מרצף השאילתה והרחיב רצפים אלו באופן מקסימלי, הוא מרכיב את ההתאמות (alignments). עבור כל זוג רצפי שאילתה, ערך ה-e מעיד על המובהקות הסטטיסטית של ההתאמה. ככל שערך ה-E נמוך יותר, כך הפגיעה (hit) מובהקת יותר.
לדוגמה, יישור רצפים עם ערך E של 0.05 פירושו שההסתברות שההתאמה הזו תתרחש במקרה בלבד היא חמש מתוך 100. מדד ה-BIT score משתמש במטריצת ניקוד ספציפית כדי לספק אינדיקציה לאיכות היישור. ככל שערך ה-BIT score גבוה יותר, כך היישור טוב יותר.
יישור רצפים מרובה, או MSA, הוא יישור רצפים של שלושה רצפים ראשוניים או יותר המורכבים מחומצות אמינו, DNA או RNA. הפלט מ-MSA tea coffee המוצג כאן, מקודד בצבעים שארידים דומים. יישור לדוגמה של שש רצפי חלבון שיושרו באמצעות cluster X מוצג כאן עבור יישורי חומצות אמינו.
התוכנה protest משמשת לקביעת בחירת המודלים המתאימים ביותר להחלפות חומצות אמינו. בתוך הנתונים, התוכנה מפרטת את המודלים בעודם מנותחים ומציגה את ההתאמה הטובה ביותר עם סיום פעולת התוכנה. Phi ML מעריכה פילוגניות בשיטת נראות מקסימלית (maximum likelihood) מרצפי יישור של נוקלאוטידים או חומצות אמינו. היא כוללת מספר רב של מודלי החלפה המשולבים עם אפשרויות שונות לחיפוש במרחב הטופולוגיה של העץ.
תוכנת Mr.Bayes משתמשת בהסקה של Bayesian CMC על פני מספר מודלים אבולוציוניים כדי לשחזר קשרים פילוגנטיים. לאחר הפעלת התוכנית, ניתן לעקוב אחר ההתקדמות במרווחי זמן ספציפיים כפי שמוצג כאן. ברגע שנוצר עץ פילוגנטי, יש להציג את הטופולוגיה שלו באופן חזותי.
באיור זה, חלון תצוגת העץ מציג עץ לדוגמה של חלבונים מתוך fly.Base. תצוגת העץ כוללת עורך עצים המאפשר למשתמש להזיז ענפים ולשנות את ניתוב העצים. בעת ביצוע הליך זה, חשוב לזכור לקרוא בעיון את מדריכי המשתמש עבור כל תוכנה.
פרוטוקול זה מספק נקודת התחלה מעשית להכרת אופן הפעולה של תוכניות אלו. עם זאת, אני ממליץ לקורא להתנסות ולהכיר את ההגדרות הרבות הקשורות לכל תוכנית.
צפו בתמליל המלא וקבלו גישה לאלפי סרטונים מדעיים
מאמר זה מציג תהליך עבודה (pipeline) שלב-אחר-שלב לשחזור עצי פילוגנטיקה מהימנים מרצפי DNA או חלבונים. הוא מיועד לחוקרים ולסטודנטים המגיעים לניתוח פילוגנטיครั้ง ראשונה.
ניתוח פילוגנטי מאפשר תיקוף של מטרות (target validation) והפחתת סיכונים מכניסטיים בשלבים מוקדמים של הגילוי, באמצעות הסקת זהות פונקציונלית וקשרים אבולוציוניים של רצפים חדשים. תהליך עבודה (pipeline) זה תומך בביטחון חזוי בזיהוי מובילים (leads) על ידי הבהרת ההקשר הביולוגי וצמצום העמימות בבדיקת השערות לגבי המטרה. הוא מספק גשר תרגומי מנתוני רצף לאנוטציה פונקציונלית, ומסייע בקבלת החלטות לגבי תיעדוף תיקי פיתוח וקידום מותאם סיכונים.
השיטה משתלבת ברצף הגילוי, החל מזיהוי המטרה ועד לאופטימיזציה של המוליך (lead optimization), ומאפשרת בדיקת השערות, הפחתת סיכונים ביולוגיים ומודלים חיזויים המבוססים על קשרים אבולוציוניים.