3 בנובמבר 2011
הנחיות מחשב מבוסס אפיון מבניים ותפקודיים של חלבון באמצעות צינור I-TASSER מתואר. החל מ רצף חלבון השאילתה, מודלים 3D נוצרות באמצעות מערכים השחלה מרובים איטרטיבי סימולציות הרכבה המבני. מסקנות פונקציונלית נמשכים לאחר מכן מבוסס על התאמות לחלבונים עם מבנה ופונקציות ידוע.
מטרת פרוצדורה זו היא לנבא באופן חישובי מבנים תלת-ממדיים ותפקוד ביולוגי של מולקולות חלבון, החל מרצפי חומצות האמינו שלהן. הדבר מתבצע תחילה על ידי ניבוי המבנה השניוני של החלבונים באמצעות למידת מכונה. לאחר מכן, הרצפים והמבנה השניוני המנובא מותאמים למבנים פתורים בספריית ה-PDB כדי לזהות את התבניות המבניות המיטביות ביותר.
הליך זה נקרא threading. לאחר הליך ה-threading, תוכנית ה-IT AER תפצל את התבניות למקטעים על בסיס יישורי רצפי התבנית, ולאחר מכן תרכיב מחדש את המקטעים למודלים באורך מלא בשלב השלישי. מודלים אטומיים מלאים נבנים באמצעות עידונים ברמה אטומית כדי למטב רשתות של קשרי מימן ולהסיר חפיפות סטריות.
השלב האחרון של הפרוצדורה הוא זיהוי התפקוד הביולוגי של החלבונים על ידי התאמת מבני החיזוי לחלבונים בעלי תפקוד ידוע בספריית התפקודים. היתרון המרכזי של ITER על פני שיטות קיימות למידול מבני הוא גישת הרכבת מקטעי המבנה המובנית, שיכולה להוביל באופן עקבי את יישורי ההשחלה (threading alignments) קרוב יותר למצב הטבעי. מודלים מבניים באיכות גבוהה זו מהווים גם את הבסיס לאנוטציות תפקודיות מדויקות המבוססות על מבנה, במטרה לקדם את השימוש ב-ITER בקהילה המדעית.
המעבדה שלנו העמידה לרשות הציבור אתר אינטרנט שבו ניתן להגיש רצפי חלבונים ל-iter. אתר זה משמש כצומת המאפשר למשתמשים מרחבי העולם להירשם לממשק למקבץ מחשבים (computer cluster), המנהל ומריץ סימולציות ITER. תהליך סימולציית ITER מורכב מיותר מתריסר סימולציות משנה קטנות יותר.
סימולציות אלו, כאשר הן מורצות במחשב בודד עם ליבה אחת של מעבד, עשויות להימשך למעלה ממאה שעות. צבר המחשבים של מעבדת Zang מקבל ומפיץ את תתי-הסימולציות הללו למאות מחשבים ומסוגל להריץ למעלה מ-2000 סימולציות. באמצעות צבר המחשבים שלנו, אנו מסוגלים להשלים מאות סימולציות I taster מדי יום.
על אף קיבולת זו, נדרשת עבודה רבה כדי לייעל את המערכת ולמזער את זמן ההמתנה עבור משתמשי ה-IT AER המקוונים שלנו. כדי להתחיל את הניסוי למידול המבנה והתפקוד, התחברו לדף האינטרנט של ה-IT AER. ניתן למצוא את כתובות ה-URL עבור כל דפי האינטרנט הרלוונטיים הנדונים כאן בפרוטוקול הכתוב.
העתיקו והדביקו את רצף חומצות האמינו לתוך הטופס המסופק, או העלו את הרצף ישירות על ידי לחיצה על כפתור הדפדוף. ספקו כתובת דוא"ל ושם למשימה. משתמשים יכולים להגדיר באופן רשות אילוצי מגע או מרחק בין שאריות חיצוניים.
הוסיפו תבנית נוספת או השמיעו חלק מחלבוני התבנית במהלך תהליך מידול המבנה. כדי להגיש את הרצף, לחצו על כפתור run it taser. ניתן לבדוק את סטטוס הגשת העבודה על ידי ביקור בדף התור של IT taser.
לחצו על לשונית החיפוש והשתמשו במספר מזהה העבודה (job ID) או ברצף השאילתה כדי לחפש את העבודה שהוגשה. לאחר סיום מידול המבנה והתפקוד, יישלח למספר הדוא"ל שסופק הודעת דוא"ל הכוללת תמונה של המבנים החזויים וקישור לאתר. לחצו על קישור זה כדי לצפות בתוצאות ולהוריד אותן.
התחילו את ניתוח המבנה בבחינת חיזוי המבנה השניוני, המוצג כ-H עבור alpha helix, S עבור beta strand, או C עבור coil. כמו כן, התחשבו במדד הביטחון (confidence score) של החיזוי עבור כל שארית. חפשו אזורים בעלי מבנים ארוכים של חיזויים של מבנה שניוני רגיל כדי להעריך את אזור הליבה בחלבון.
ניתן לנתח את המחלקה המבנית של החלבון גם על בסיס התפלגות אלמנטים של מבנה שניוני. בחנו את הנגישות החזויה לממס כדי לקבוע אזורים קבורים ואזורים חשופים לממס. בערכי השאילתה, הנגישות החזויה לממס נעה בין ציון של אפס עבור שארית קבורה לבין ציון של תשע עבור שארית חשופה.
ניתן להשתמש באזורים המכילים בעיקר שאריות קבורים כדי להגדיר את אזור הליבה בחלבון, בעוד שאזורים עם שאריות הידרופיליות החשופות לממס מהווים אתרים פוטנציאליים להידרציה או אתרים פונקציונליים. כדי לצפות במבנים השלישוניים החזויים של חלבון השאילתה, גללו למטה לאפליקציית ה-JMO המוצגת משמאל. לחצו על האפליקציה כדי לשנות את המראה של המבנה המוצג.
בצעו זום לאזור ספציפי, בחרו סוגי שאריות ספציפיים במודל שנחזה או חשבו מרחקים בין שאריות. נתחו את ציוני הביטחון של המידול המבני כדי להעריך את איכות המבנים שנחזו. ערכי Csco הם בדרך כלל בטווח שבין מינוס חמש לשתיים, כאשר ציון גבוה יותר משקף מודל באיכות טובה יותר.
ציון ה-TM וה-RMSD המוערכים של המודל הראשון מוצגים כדיוק המוערך של מודל מספר אחת. לחץ על הקישור למידע נוסף על csco. כדי לנתח את גודל אשכול ה-csco ואת צפיפות האשכול של כל המודלים, נתח את 10 תבניות השחלה (threading templates) המובילות של חלבון השאילתה כפי שזוהו על ידי תוכניות שחלה של low mets.
על ידי גלילה למטה בדף התוצאות, צפו ב-Z-score הנורמל כדי לנתח את איכות יישומי ה-threading. יישומים עם csco נורמל הגבוה מ-1 מעידים על יישום מהימן וסביר שיהיה להם אותו קיפול כמו לחלבון השאילתה. בחנו את זהות הרצף באזור ה-threading המיושם וכן עבור כל הש으로는 כדי להעריך את ההומולוגיה בין חלבוני השאילתה לתבנית.
זהות רצף גבוהה היא אינדיקטור לקשר אבולוציוני בין חלבוני השאילתה והתבנית. התבוננו בשאריות המיושרות בשיטת ה-threading המוצגות בצבע כדי לזהות באופן חזותי שאריות או מוטיבים שמורים בחלבוני השאילתה והתבנית; זהות רצף גבוהה יותר באזור המיושר ב-threading בהשוואה ליישור של השלשלת כולה מעידה גם על נוכחותם של מוטיבים או דומיינים מבניים שמורים בשאילתה. העריכו את הכיסוי של יישור ה-threading באמצעות בדיקת היישור.
אם הכיסוי של ההתאמה המובילה נמוך ומוגבל לאזור קטן בלבד של חלבון השאילתה, או חסר במקטע ארוך של רצף השאילתה, הדבר מעיד על כך שחלבון השאילתה מכיל יותר מדומיין אחד. במקרה זה, מומלץ לפצל את הרצף ולבצע מידול של הדומיינים באופן פרטני. עיין בטבלה הבאה בעמוד התוצאות כדי לקבוע את 10 האנלוגים המבניים המובילים של המודל הראשון שנחזה, כפי שזוהו על ידי תוכנית ההתאמה המבנית, TM align.
ציון TM הגבוה מ-0.5 מעיד על כך שלאנלוג שהתגלה ולמודל יש טופולוגיה דומה, וניתן להשתמש בהם כדי לקבוע את המחלקה המבנית או את משפחת החלבונים של חלבון השאילתה. אלו בעלי ציון TM נמוך מ-0.3 מעידים על דמיון מבני מקרי. יש לנתח את זהות הרצף ואת ה-RMSD באזור המיושר מבנית כדי להעריך את השימור של מוטיבים מרחביים במודל ובאנלוג המבני.
בצעו בדיקה חזותית של זוגות השאריות הצבועות והמיושרות ביישור כדי לזהות את השאריות והמוטיבים השמורים מבחינה מבנית. עיינו בטבלת מספרי ה-EC החזויים כדי לראות את חמשת ה-OGs האנזימטיים הפוטנציאליים המובילים עבור חלבון השאילתה. רמת הביטחון של חיזוי מספר ה-EC באמצעות תבניות אלו מוצגת כציון ה-EC המבוסס על ניתוח השוואתי (benchmarking analysis).
ניתן לפרש באופן מהימן דמיון תפקודי בין חלבון השאילתה לחלבון התבנית באמצעות ציון EC הגבוה מ-1.1. לאחר מכן, חפש קונסנזוס תפקודי בין התבניות, בעלות קיפול דומה לחלבון השאילתה. אם למספר תבניות יש את אותו מספר EC וציון ה-EC גבוה מ-1.1, רמת הביטחון של החיזוי גבוהה מאוד.
עם זאת, אם ציון ה-EC גבוה, אך חסר קונצנזוס בין הפגיעות (hits) שזוהו, התחזית הופכת לפחות אמינה ומומלץ למשתמשים לעיין באונטולוגיה של הגנים. בתצוגת תחזיות המונחים, יש לבחון את טבלת מונחי אונטולוגיית הגנים החזויים כדי לזהות את 10 ההומולוגים המובילים של חלבון השאילתה בספריית ה-PDB המאוannotated במונחי אונטולוגיית גנים; כל חלבון מקושר בדרך כלל למספר מונחי אונטולוגיית גנים המתארים את תפקודיו המולקולריים, תהליכיו הביולוגיים ומיקומו התאי. לחצו על כל מונח כדי לבקר באתר amigo ולנתח את הגדרתו וההיררכיה שלו.
נתחו את עמודת ציון ההומולוגיה הפונקציונלית (functional homology score) כדי להעריך את הדמיון הפונקציונלי בין חלבוני השאילתה (query) והתבנית (template). ניתן גם להעריך את רמת הביטחון בהעברת הערות פונקציונליות (functional annotation) מחלבונים אלו. עיינו בטבלת חיזוי הקונסנזוס של מונחי האונטולוגיה של הגנים (gene ontology terms) כדי לנתח את ההסכמה הפונקציונלית בין התבניות.
פונקציות נפוצות אלו משמשות לחיזוי מונחי ה-gene ontology של חלבון השאילתה ולהערכת רמת הביטחון של תחזיות מונחי ה-geo. לבסוף, גללו לתחתית הדף כדי לצפות ב-10 התחזיות המובילות לאתרי קישור של ליגנדים עבור חלבון השאילתה; אתרי קישור חזויים מדורגים על בסיס מספר קונפורמציות הליגנד החזויות שחולקות כיס קישור משותף. אתר הקישור המזוהה הטוב ביותר כבר מוצג באפליקציית ה-JM OL.
לחצו על כפתורי הבחירה כדי לנתח תחזיות אחרות ולהציג את השאריות האינטראקטיביות של הליגנד. ציון ה-BS חושף דמיון מקומי בין המודל לבין אתר הקשירה של התבניות. ציון BS הגבוה מ-1.1 מעיד על דמיון רצפי ומבני גבוה בסביבת אתר הקשירה החזוי.
במודל, בהשוואה לאתר הקשירה הידוע בתבנית, ה-IT הוא דף אינטרנט ראשי המכיל קישורים למאפיינים שימושיים אחרים. מאפיין הפורום מאפשר למשתמש ליצור חשבון מקוון ולבקש עזרה ממשתמשי ITER אחרים בנוגע למידול מבני או לסיוע בפירוש התוצאות. מאפיין ההורדה מאפשר למשתמשים להוריד את iter וחבילות רלוונטיות ולהתקינן במחשב שלהם.
דבר זה מסייע להפחית את הזמן הנדרש לביצוע ניסויי המידול. תכונת התור מאפשרת לראות את הסטטוס של כל המשימות שהוגשו בדף ה-IT a Q. משתמשים יכולים גם לבחון באופן ויזואלי את תמונת המבנים הממודלים עבור משימות שהסתיימו.
בדף זה מוצגים גם ציון ה-TM הצפוי ו-RMSD הצפוי של המודל הראשון עבור CSCO, וכן תאריך ההגשה. כאן מופיע קטע מדף תוצאות ה-IT AER המציג את רצף השאילתה המעובד במהירות, את המבנה השניוני החזוי, ואת מדדי הביטחון הנלווים ואת נגישות הממס הצפויה של השאריות. אזור הליבה המנותח ואתר ההידרציה הפוטנציאלי בשאילתה מודגשים במלבנים בצבע תכלת ואדום בהתאמה. כאן מוצגות תחזיות המבנה השלישי עבור חלבוני השאילתה.
המודלים החזויים מוצגים ביציאת אפליקציית JML אינטראקטיבית, המאפשרת למשתמש לשנות את תצוגת המולקולה. ניתן להוריד את המודלים על ידי לחיצה על קישורי ההורדה; ציון הביטחון להערכת איכות המודל מדווח כ-csco. מוצג דוגמה לדף תוצאות של itta A המציג את 10 תבניות ההשחלה (threading templates) והיישור (alignments) המובילות שזוהו על ידי תוכניות ההשחלה של Loomis.
איכות יישורי ההשחלה (threading alignments) מוערכת על בסיס מדד Z-score מנורמל, כאשר ערך הגבוה מ-1 משקף יישור בעל רמת ביטחון גבוהה. שאריות מיושרות בתבנית אשר זהות לשאריות השאילתה התואמות הן מודגשות בצבע כדי להצביע על נוכחות של שארית או מוטיב שמורים. לעומת זאת, היעדר יישור ברוב התבניות המובילות מעיד על נוכחות של מספר דומיינים בחלבון השאילתה, והשאריות שאינן מיושרות תואמות לאזורי מקשר (linker regions) בין הדומיינים.
טבלה זו מציגה את 10 האנלוגים המבניים וההתאמות המבניות המובילים שזוהו על ידי תוכנת ההתאמה המבנית TM-align. הדירוג של האנלוגים מבוסס על ציון ה-TM של ההתאמה המבנית. ציון TM הגבוה מ-0.5 מעיד על כך שלשני המבנים המושוות יש טופולוגיה דומה.
בעוד שציון TM נמוך מ-0.3 מעיד על דמיון בין שני מבנים אקראיים. זוגות שאריות שבוצע להם יישור מבני מודגשים בצבע בהתאם למאפייני החומצה האמינית שלהם, בעוד שבאזורים שלא בוצע להם יישור מופיע קו מפריד. להלן דוגמה לדף תוצאות ה-ITR המציג הומולוגים של אנזימים שזוהו עבור חלבון השאילתה בספריית ה-PDB.
רמת הביטחון של חיזוי מספר ה-EC מנותחת על בסיס מדד ה-EC, כאשר מדד EC הגבוה מ-1.1 מעיד על דמיון תפקודי בין חלבון השאילתה לחלבון התבנית. טבלת חיזוי מונחי האונטולוגיה של הגנים (gene ontology) עבור חלבון השאילתה כוללת הומולוגים תפקודיים עבור חלבון השאילתה מספריית תבניות האונטולוגיה של הגנים, המדורגים על פי מדד ההומולוגיה התפקודית שלהם. מאפיינים תפקודיים משותפים מהתוצאות בעלות המדד הגבוה ביותר נגזרים כדי להפיק את חיזוי מונחי האונטולוגיה של הגנים הסופי עבור חלבון השאילתה.
איכות מונחי האונטולוגיה של הגנים (gene ontology) שנחזו מוערכת על סמך מדד geo, כאשר מדד geo הגבוה מ-0.5 מעיד על חיזוי מהימן, כפי שמוצג כאן בדוגמה של דף תוצאות IT AZA המציג את 10 החיזויים המובילים לאתרי קישור של ליגנדים לחלבון באמצעות אלגוריתם cofactor. דירוג אתרי הקישור שנחזו מבוסס על מספר הקונפורמציות של הליגנדים שנחזו המשותפות לכיס קישור אחד. בשאילתה, מדד BS score הוא מדד לדמיון המקומי בין הרצף והמבנה של אתר הקישור שנחזה לבין אתר הקישור של התבניות, והוא שימושי לניתוח השימור של כיסי אתרי הקישור.
למרות ש-ISER הוא אחד האלגוריתמים היעילים ביותר לחיזוי מבנה ותפקוד של חלבונים, חשוב לזכור כי מדובר בחיזוי המבוסס על אלגוריתמים ממוחשבים בלבד. כל נתון ניסויי או תובנה תפקודית, למשל מידע על קשרי קישור בין שאריות, יהיו שימושיים ביותר להעלאת דיוק החיזויים. כדי לתת מענה לעניין הגובר בכך, שרת IT AER כולל פורטל להזנת מידעים אלו במהלך תהליך המידול.
מעבדת Zang שחררה את תוכנת IT AER בחינם למחקר שאינו מסחרי. אנו מפתחים באופן פעיל גרסאות משופרות של IT AER ושל eye taster, בתקווה שזמינותן תוביל ליישום רחב היקף מחוץ למעבדת Zang ותועיל ותניע מחקרים נוספים בקהילה המדעית.
מאמר זה מתאר את תהליך העבודה של I-TASSER לניבוי המבנים התלת-ממדיים והתפקודים של חלבונים על סמך רצפי חומצות האמינו שלהם. התהליך כולל threading, הרכבת פרגמנטים והסקת מסקנות תפקודית המבוססת על מבני חלבונים ידועים.
חיזוי חישובי של מבנה ותפקוד חלבונים מאפשר הפחתת סיכונים של מטרות בשלבים מוקדמים של גילוי תרופות, על ידי אספקת תובנות מכניסטיות עבור חלבונים שלא אופיינו ניסויית. תהליך העבודה של I-TASSER תומך בבדיקת השערות ובאנוטציה תפקודית, ובכך משפר את רמת הביטחון בחיזויים בתהליכי בחירת מטרות וזיהוי תרכובות מובילות (lead identification). גישה זו מפחיתה את ההסתמכות על שיטות ניסוייות בעלות תפוקה נמוכה ומאיצה את תיקוף המטרה במחקר ופיתוח בביופארמה.
שיטת I-TASSER משתלבת ברצף הגילוי, מזיהוי המטרה ועד לאופטימיזציה של תרכיבים מובילים (lead optimization), על ידי אספקת תובנות מבניות ותפקודיות המנחות את קבלת ההחלטות בכל שלב.