מאמר שיטה

חיזוי למידת מכונה של חלבונים מחליפים תחום תלת מימד בצמחי מרפא

DOI:

10.3791/68519

15 באוגוסט 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה בוחן חלבונים המעורבים או צפויים להיות מעורבים בהחלפת תחום תלת מימד מגנומים שונים של צמחי מרפא. הוא משתמש במודלים של למידת מכונה כדי לחזות במדויק חלבונים מחליפים תחומים תלת מימדיים ולחזות את תפקודיהם ואת הרלוונטיות שלהם לייצור מטבוליט משני.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

החלפת תחום תלת מימד היא תופעה מבנית של חלבון שבה שתי תת-יחידות חלבון או יותר מחליפות תת-יחידות מבניות זהות ויוצרות אוליגומרים. חלבונים המציגים החלפת תחום תלת מימד ממלאים תפקיד מכריע בפונקציות ביולוגיות שונות, כגון ביוסינתזה של מטבוליט משני, ובהתמודדות עם מספר לחצים ביוטיים ואביוטיים בצמחי מרפא. מחקר זה חוקר את היכולת לחזות דפוסי החלפת תחום תלת מימד בין הגנומים של צמחי מרפא באמצעות מודלים של יער אקראי ומסווג השכן הקרוב ביותר, המדגים דיוק של 91.6% ו-88.7%, בהתאמה. בסך הכל 420 (31%) מהרצפים נחזו כמעורבים כביכול בהחלפת דומיינים תלת מימדיים. חקירת העשרה בוצעה גם על רצפי החלבון המוחלפים בתלת מימד מצמחי מרפא שונים לביאור תפקוד המבוסס על מונחי אונטולוגיה גנטית (GO), ניתוח מסלולי האנציקלופדיה של גנים וגנומים של קיוטו (KEGG), והתפלגות התחומים שלהם במסלולי ביוסינתזה של מטבוליטים משניים. ביאור פונקציונלי של רצפים חזויים מסיק כי רצפים שהוחלפו בתחום תלת מימד היו מעורבים בפונקציות מולקולריות מגוונות כגון הובלת אלקטרונים פוטוסינתטית במערכת צילום II ומובילי אלקטרונים, העברת אלקטרונים בתוך מסלול הובלת האלקטרונים המחזורי של פעילות פוטוסינתזה, זרחון חמצוני וויסות גנים של מתחים סביבתיים (ביוטיים ואביוטיים) על ידי סינתזה של מטבוליטים משניים (טרפנואידים, אלקלואידים ופוליאמינים). ממצאים אלה מדגישים את היכולת של למידת מכונה לחזות את מעורבותם של חלבונים בתופעת החלפת הדומיינים התלת-ממדית, את תפקידם ואת הפוטנציאל שלהם להקל על גילוי תרופות ויוזמות ביו-הנדסיות.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

שיטות חישוביות חוללו מהפכה בחקר החלבונים בכך שאפשרו ניתוח מפורט ותחזיות לגבי מבנים, תפקודים ואינטראקציות של חלבונים. הזיהוי וההערות המדויקים של פונקציות החלבון חיוניים לפענוח מנגנונים מולקולריים של חיים ויש להם חשיבות עמוקה להתקדמות ברפואה ובפיתוח תרופות. עם זאת, המורכבות וההוצאות האינהרנטיות של שיטות ניסיוניות מגבילות את יכולת ההרחבה שלהן כדי להתאים לנתוני הרצף הגדולים. כתוצאה מכך, פיתוח שיטות חישוביות לחיזוי תפקודי חלבונים התגלה כתחום מרכזי בביולוגיה חישובית ומולקולרית, המטפלת בפער זה באמצעות גישות חדשניות בקנה מידה גדול1.

החלפת תחום תלת מימד2 היא תופעה מבנית בחלבונים שבה מקטעים של מבנה משותף מוחלפים בין שרשראות בודדות. בשנת 1994, תיעוד המבוא על המנגנון של החלפת דומיינים תלת מימדיים נמצא ברעלן דיפתריהדימר 3. עם זאת, ניתן לאתר את עקרונות היסוד של החלפת דומיינים תלת מימדיים ארבעה עשורים אחורה. ריבונוקלאז לבלב בקר A (RNase A) נצפה כיוצר דימרים במהלך ליופיליזציה בחומצה אצטית, באמצעות ניסויי שינוי כימי מתוחכמים4. באוליגומריזציה של חלבון, שתי שרשראות חלבון או יותר מחליפות אלמנטים מבניים זהים דרך אזורי צירים גמישים. החלק של החלבון המוחלף בין תת-יחידות מונומריות מכונה התחום המוחלף, שעשוי להיות מורכב מתחום כדורי שלם, לולאה או אלמנט מבני משני בחלבונים מסוימים. לעומת זאת, האזורים שנותרו ללא שינוי במיקומם המקורי בתוך המונומרים נקראים דומיינים לא מוחלפים5. צימוד בין דומיינים שאינם מוחלפים מוגדר כממשק דומיין לא-מוחלף (NSDI) המוצג באיור 1. בהחלפת דומיינים תלת מימדיים, הקשר בין התחום הלא מוחלף של תת-יחידת חלבון אחת לבין התחום שכבר הוחלף של תת-יחידה אחרת מכונה ממשק הדומיין המוחלף (SDI). היבט משמעותי נוסף של תופעה זו הוא אזור הציר, מקטע קישור גמיש המחבר בין הדומיינים הלא מוחלפים והמוחלפים. אזור ציר זה ממלא תפקיד חיוני בסיוע לתנועה של החלפת תחום תלת מימד ומשמש כמתג קונפורמציה, המאפשר את התצורה המבנית מחדש הדרושה להחלפת תחום. החלפת תחום תלת מימד הייתה מעורבת בתהליכים ביולוגיים שונים, כולל הרכבת חלבונים וויסות פונקציונלי5. זה קשור גם למחלות מסוימות של קיפול שגוי של חלבונים, שבהן החלפה חריגה עלולה להוביל להיווצרות אגרגטים או סיבי עמילואיד.

figure-introduction-1
איור 1: ייצוג מבני של החלפת דומיינים תלת-ממדית. הייצוג ממחיש את ההחלפה של אלמנטים מבניים זהים בין שני מונומרים של חלבונים באמצעות אזור ציר גמיש, וכתוצאה מכך נוצר מכלול דימרי או אוליגומרי שהוחלף בתחום אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

סוגים שונים של החלפת דומיינים תלת מימדיים זוהו על סמך אופי הדומיינים שהוחלפו והמבנים האוליגומריים המתקבלים6. בשנת 2002, אייזנברג ועמיתם זיהו שלושה סוגים של החלפת דומיינים תלת-ממדית: החלפת דומיינים Bonafide (BDS), החלפת דומיינים מעין (QDS) ומועמד להחלפת דומיינים תלת-ממדיים (CDS)7. קבוצת החלבון הנפוצה ביותר היא החלפת דומיינים בתום לב. הכוונה היא למצב שבו גם מולקולות דימר וגם מולקולות מונומר קיימות בצורה יציבה, כאשר הדימר אמור לאמץ תצורה מוחלפת תחום בעוד המונומר אמור לאמץ תצורה סגורה. בהחלפת תחום, ידוע כי חלבון נמצא במצב אוליגומרי, אך ידוע כי המבנה ההומולוגי שלו קיים במצב מונומרי. ב-CDS, זה רק מאשר את סיווג החלבון תחת הקטגוריות המוחלפות בתחום, בעוד שמידע מבני של מונומרים מעורבים או ההומולוגים המונומריים שלהם אינו קיים8. בהליך זה, מונומרים או ההומולוגים המונומריים שלהם נעדרים; במקום זאת, קיימות מולקולות חלבון הטרולוגיות. טבלה 1 מציגה דוגמה לשלוש קטגוריות אלה9.

טבלה 1: סוגי החלפת דומיינים תלת מימדיים עם דוגמה. אנא לחץ כאן להורדת טבלה זו.

מחקרים עוקבים חשפו מבנים רבים שהוחלפו בתחום, וסללו את הדרך להבנת מושג החלפת הדומיין התלת-ממדי. הראיות המבניות המוקדמות ביותר התומכות בתופעה זו נצפו במולקולה של חלבון מדכא Cro מבקטריופאג' λ, היוצר מבנה דימרי באמצעות חילופי גדילי C-terminal שלו. בשנת 1996 החוקר מצא שמולקולת Cro מונומרית הייתה מעורבת בהחלפת דומיין תלת מימדית10. מבנים אחרים11, כגון βB2-קריסטלין12, CksHs213 אנושי, קטלאז כבד בקר14 ואינטרלוקין-5 אנושי רקומביננטי15, דווחו גם כמבנים תלת מימדיים אפשריים שהוחלפו דומיין. בהתבסס על מיקום התחום המוחלף בתוך מולקולות החלבון, החלפת תחום תלת מימד מסווגת לשלושה סוגים: החלפת תחום C-terminal, החלפת תחום N-terminal והחלפת תחום מרכזי נדיר יחסית. מחברים משתמשים בגנום אנושי שלם כדי לחזות מקרה שהוחלף בתחום. הם משתמשים ב-Random Forest וב-Support Vector Machine כמסווגים בינאריים עם דיוק של 81.7% ו-73.9%, בהתאמה. כמעט 44% מרצף החלבון נחזה כהחלפת תחום תלת מימדית בגנום האנושי6. ניתוח העשרה בוצע על מקרים חזויים עבור התפלגות התחום, התפלגות המחלה וההערות הפונקציונליות המבוססות על אונטולוגיה גנטית (GO). גישה אחרת חוקרת את הניתוח הגנומי המלא של Ocimum tenuiforum על ידי שימוש בגישת היער האקראי ומצאה שכמעט 25% מרצפי החלבונים ב-Ocimum tenuiforum צפויים להיות מעורבים בהחלפת הדומיין התלת-ממדי. החוקרים מבצעים גם הערות פונקציונליות על ידי שימוש באסוציאציה של מונחי GO והקשר המשפחתי של תחום החלבון שלהם ומצאו שרק 1158 רצפים היו מעורבים במתח אביוטי16.

צמחים מדגימים מגוון של משפחות חלבונים ייחודיות, עם חלבונים ספציפיים המוכרים כבעלי יכולת לעבור סידורים מבניים, כולל החלפת תחום תלת מימדי. החלפת תחום תלת מימד עשויה להשפיע על תנאי עקה ביוטיים ואביוטיים עם ייצור מטבוליטים משניים או מסלולים רלוונטיים ביולוגיים אחרים המחזיקים במספר יישומים פרמקולוגיים; לכן, הם מספקים מוקד משמעותי לחקירה זו. המבנה הגבישי של Wal1 הדגים תצורה דימרית שהוחלפה בתחום, הכוללת שני דימרים בתוך היחידה האסימטרית והסידור מחדש המבני שנמצא בציסטטין C. פיטוציסטטינים ממלאים תפקיד משמעותי בעקה אביוטית, והם גם משפרים את עמידות היבול. בסך הכל זוהו 20,121 חלבונים חזויים שהוחלפו בתלת-ממד מהספרות הזמינה וממאגרים רלוונטיים שונים, מתוכם 17,552 ממקור צמחי ו-2569 מאורגניזמים שאינם צמחיים17,18.

בספרות דווחו דוגמאות שונות אחרות לחיזוי החלפת תחום תלת מימד של צמחים שונים באמצעות גישת למידת מכונה. כגון Arabidopsis thaliana המראה 33.7% (4058 מתוך 12,033 רצפים שנבדקו), Medicago truncatula 20.9% (39 מתוך 186 רצפים שנבדקו), Solanum tuberosum 36.5% (146 מתוך 400 רצפים שנבדקו), Solanum lycopersicum 25.5% (108 מתוך 423 רצפים שנבדקו) ו-Ocimum tenuiforum 15.5% (5706 מתוך 36841 רצפים שנבדקו)6. שיטות חישוביות הפכו ליקרות ערך בחקר ההיבטים המבניים והפונקציונליים של חלבונים מוחלפים בתלת מימד. גישות אלה מקלות על חיזוי רצפים על בסיס התכונות הטובות ביותר האפשריות19, הערות וניתוח העשרה, ומציעות תובנות לגבי המנגנונים המולקולריים הבסיסיים. החיזוי של החלפת תחום תלת מימד ברצפי חלבונים שונים הושג על ידי שימוש במסווג מבוסס מכונה וקטורית תומכת (SVM). גישה זו פותחה על ידי שילוב רצף ותכונות מבניות, והניבה דיוק חיזוי של 76.33% במערך נתוני האימון ו-73.81% במערך נתוני הבדיקה, מה שמסמן את הפוטנציאל שלה בזיהוי נטיות להחלפת תחומים בחלבונים20. הסיבה העיקרית לבחירת KNN על פני SVM היא של-KNN יש תהליך הכשרה הרבה יותר פשוט. הוא זקוק רק לפרמטר עיקרי אחד, K (זהו מספר השכנים הקרובים ביותר שנלקחים בחשבון בעת ביצוע חיזוי), בעוד ש-SVM דורש כוונון קפדני של מספר פרמטרים כמו סוג הליבה, C וגמא. בנוסף, KNN מטפל בסיווג מרובה מחלקות ביתר קלות, בעוד ש-SVM בדרך כלל זקוק לאסטרטגיות מורכבות יותר, כמו אסטרטגיות אחד נגד אחד.

למידת מכונה לחיזוי מבני חלבונים
חיזוי מבנה החלבון כרוך בהסקת הצורה התלת מימדית של חלבון מרצף ה-FASTA שלו. ההתקדמות האחרונה בתחום זה הונעה באופן משמעותי על ידי יישום טכניקות שונות של למידת מכונה על נתונים אבולוציוניים21,22. גישות מוקדמות לחילוץ מידע מנתונים אבולוציוניים משותפים הסתמכו על שיטות למידת מכונה. עם זאת, אסטרטגיות עדכניות יותר, במיוחד אלה המשתמשות ברשתות שיוריות עמוקות, הוכיחו ביצועים טובים יותר בחיזוי יעדפוטנציאלי 23. Alphafold הוא מסד נתונים מבוסס למידה עמוקה, ואילו Rosetta הוא כלי פונקציית אנרגיה מבוסס פיזיקה. כלים אלה משמשים לחיזוי המבנה האטומי התלת-ממדי המלא שניתן לקרב למבנים ניסיוניים. הם מספקים רק קואורדינטות מבניות ברזולוציה אטומית, אך כלים אלה אינם מציינים את אירועי החלפת התחום התלת-ממדי. לעומת זאת, הגישה המוצעת אינה מנבא מבנה תלת מימד מלא במקום זאת, היא רק מנבאת אם חלבון צפוי לעבור החלפת תחום תלת מימד או לא24,25.

צמחי מרפא שימשו במשך מאות שנים כמשאבי טבע למניעה וטיפול במחלות שונות, המיוחסות לתרכובות הביו-אקטיביות שלהם. הם חיוניים ברפואה המסורתית ותורמים לפיתוח תרופות פרמצבטיות מודרניות. עם זאת, לא נעשתה עבודה משמעותית בתחום החלפת תחום החלבון של צמחי מרפא לגילוי תרופות. אלגוריתמים, כולל למידת מכונה ומודלי האנסמבל שלהם, מזהים דפוסים ויחסים בנתוני רצף כדי לחזות החלפת תחומים תלת מימדיים. הסיבה מאחורי בחירת צמחי המרפא למחקר זה היא שהוא יכול לזהות מגוון תפקודי של חלבון בצמחים המעורבים בהחלפת תחום תלת מימדי, וכתוצאה מכך להבין את תגובת הלחץ, הגנה מפני פתוגנים וביוסינתזה מטבולית. האתגרים הטכניים הקשורים לקביעת החלפת תחום תלת מימד של חלבונים במספרים גדולים וקונפורמציות אוליגומריות מורכבות ומתקדמות על ידי שימוש בטכניקות NMR או קריסטלוגרפיה מדגישים את הצורך בפיתוח גישות חישוביות מתקדמות.

המטרה הכוללת של עבודת המחקר המוצעת היא להשתמש במתודולוגיה חישובית על ידי שימוש באלגוריתמים של יער אקראי (RF)26 ו-K-nearest Neighbor (KNN)27 עבור משימת חיזוי מבנה רצף החלבון שלהם וניתוח גנומי מלא של מקרים שהוחלפו ברצפי צמחי מרפא שונים. היער האקראי (RF) הוא מסווג בינארי; זהו אלגוריתם למידת מכונה חזק ורב-תכליתי הנמצא בשימוש נרחב בניתוח רצפי חלבונים. הוא פועל על ידי בניית אנסמבל של עצי החלטה (DT) ומשיג דיוק גבוה למדי הן במערכי ההדרכה והן בבדיקה. עבור משימות רצף חלבונים, RF יכול לנתח מגוון תכונות, כולל תכונות פיזיקוכימיות, הרכב רצף, מבנה משני ומידע אבולוציוני הנגזר מיישורי רצף או פרופילים. הוא מצטיין בטיפול במערכי נתונים גדולים ורועשים ומספק מדדי חשיבות תכונה28. מסווג K-Nearest Neighbors (KNN) הוא אלגוריתם למידת מכונה פשוט אך יעיל המיושם באופן נרחב בניתוח רצף חלבונים. זה עובד על ידי סיווג רצף קלט על סמך מחלקת הרוב של k השכנים הקרובים ביותר שלו במרחב התכונות. בניתוח רצף חלבונים, ניתן להשתמש ב-KNN כדי לחזות קטגוריות פונקציונליות, תכונות מבניות ולוקליזציה תת-תאית. תכונות לסיווג KNN כוללות לעתים קרובות הרכב חומצות אמינו, מוטיבים ברצף, פרופילים אבולוציוניים או תכונות פיזיקוכימיות. KNN היא בחירה פופולרית לניתוח חלבונים בגלל הפשטות שלה; יכולת הפרשנות והיעילות הופכות אותו לכלי רב ערך לניתוח רצף חלבונים29. יחד, אלגוריתמים אלה מספקים חוזקות משלימות, המאפשרות מסגרת חישובית מקיפה לחקר החלפת תחום תלת מימד ברצפים שונים של צמחי מרפא. שני המודלים הללו חוזים רק מקרים אפשריים שעשויים לעבור החלפת דומיינים; הוא אינו חוזה את הקואורדינטות המבניות התלת-ממדיות המלאות או איזה חלק או שאריות מעורבים במיוחד בתהליך החלפה זה. זהו עניין של מחקר נוסף, שכן זיהוי אזורים או שאריות ספציפיים המעורבים בהחלפה כדי להבהיר את המנגנון וההיבטים הפונקציונליים של החלפת דומיינים תלת מימדית events.3D החלפת דומיינים מורכב ממגוון תופעות נפרדות מבחינה מבנית, כגון תצורות לולאה סגורה, החלפות פתוחות והבדלים אחרים הכוללים אזורי צירים וארכיטקטורות תחומים שונות. לאור זאת, הגישה המוצעת מסווגת רק כל מיני אירועי החלפת דומיינים תלת מימדיים תחת סיווג אחיד. בחירה זו הונעה בתחילה על ידי הזמינות המוגבלת של נתונים מבוארים שיכולים לציין סוג מסוים של החלפת דומיינים תלת מימדית. זהו הסוג הראשון של ניסיונות על מערכי נתונים שונים מבוססי צמחי מרפא, ואנו מרגישים שהבחנה בין מנגנוני החלפה שונים יכולה לשפר את דיוק החיזוי של המודל.

ניתוח העשרה בצמחי המרפא מסייע בזיהוי גנים, חלבונים ומסלולים מרכזיים המעורבים בסינתזה של תרכובות ביו-אקטיביות ותגובת עקה. הוא מספק תובנות לגבי מנגנונים מולקולריים. ניתוחים אלה בצמחי מרפא חוקרים גנים, חלבונים ותהליכים ביולוגיים חיוניים הקשורים לסינתזה של כימיקלים ביו-אקטיביים, עמידות בפני עקה ועמידות למחלות. ביאור פונקציונלי של חלבונים נבחרים, כגון אונטולוגיה גנטית (GO) וניתוח מסלול KEGG, חושף מנגנונים מולקולריים העומדים בבסיס ייצור מטבוליטים משניים ותגובות לחץ סביבתיות. גישה זו מסייעת באופן משמעותי בגילוי תרופות, משפרת את עמידות היבול ומבהירה מסלולים מטבוליים של צמחים לחקלאות בת קיימא והתקדמות רפואית.

תרומות חדשות של המחקר
מחקר זה מדגיש את היכולות של למידת מכונה לקדם מודלים מדויקים ויעילים יותר לחיזוי דפוסים מבניים של חלבונים במערכי נתונים ביולוגיים.

מחקר זה משלב תכונות חדשות באלגוריתמים של למידת מכונה, ומשפר את יכולתם לחזות פונקציות חלבון בבהירות רבה יותר. תכונות כאלה מספקות הבנה משופרת של יחסי מבנה-תפקוד של חלבונים, ומסייעות בתכנון מדויק יותר של חלבונים ואופטימיזציה בהנדסת חלבונים.

ניתוח העשרה של חלבונים חזויים מסייע לגלות את המסלולים הביולוגיים המרכזיים, התהליכים התאיים והתפקודים המולקולריים המספקים מטרות חשובות לגילוי סמנים ביולוגיים, תכנון תרופות והבנת מנגנון המחלה. ניתוח זה משפר את הדיוק בהתערבויות מבוססות מסלולים ובזיהוי מטרות טיפוליות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הערה: חלק זה מספק מתווה מקיף של המתודולוגיה המוצעת, הכוללת שישה שלבים עיקריים: (א) איסוף נתונים, (ב) בחירת תכונות, (ג) עיבוד מקדים של נתונים, (ד) עיבוד נתונים לאחר (ה) פיתוח מודל (ו) הערכת תוצאות של המודל המוצע ו, (ז) ניתוח העשרה ברמה שונה של רצפים חזויים חיוביים. ה- Core i5-10500 הוא מעבד דור 10 ששימש בעבודת מחקר זו. יש לו שש ליבות ו -12 חוטים, עם תדר בסיס של 3.10 ג'יגה הרץ ומהירות טורבו מקסימלית של 4.50 ג'יגה הרץ. הוא מצויד ב-12 מגה-בייט של Intel Smart Cache, תומך בזיכרון DDR4-2666 וכולל UHD Graphics 630 לוויזואליה משולבת. בנוי לריבוי משימות ופרודוקטיביות יעילים, הוא תואם לשקע LGA 1200 ופועל ב-TDP של 65W.

1. איסוף נתונים

  1. Use3d3dswap-pred (https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) ו-3DSwap+ (https://caps.ncbs.res.in/3Dswapplus/index.html)3030 טבלה משלימה 1, טבלה משלימה 2, קובץ משלים 1, קובץ משלים 2). השתמש בסך הכל ב-573 ערכי PDB שנאספו ידנית של מולקולות תלת-ממדיות שהוחלפו בתחום, בעיקר מצמחי מרפא.
  2. השתמש בשיטת הפרופיל המייצג הטוב ביותר (BRP) כדי לבנות את מערך הנתונים השלילי על ידי הקצאת רצף מייצג הטוב ביותר (BRS) לכל משפחת חלבונים Pfam31 (http://pfam.xfam.org/). חפש בסך הכל 10,112 רצפים מבניים מול כל ה-Pfam BRPs באמצעות HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/) עם סף ערך E של 0.001. עבד את הרצף המתקבל באמצעות DIAL כדי לזהות תחומים מבניים (https://bioinformaticshome.com/db/tool/DIAL). כלול 575 ערכי PDB כמערך נתונים שלילי (אימון).
  3. כלול 314 רצפי חלבון שמקורם בשיטת BRP ו-261 רצפים שנאספו ידנית שאינם מוחלפים בתלת-ממד שזוהו על ידי 3DSwap+ כמערך נתונים שלילי.
  4. אחזר בסך הכל 1,355 ערכי רצף חלבונים שנבדקו מצמחי מרפא שונים מ-UniProt33 (https://www.uniprot.org/). כלול 13 צמחי מרפא במחקר זה (מערך נתונים של בדיקה/חיזוי): Citrus sinensis (RS-102), Vitis vinifera (RS-226), Mentha (RS-28), Cannabis sativa (RS-21), Acorus clamus (RS-511), Coffea arabica (RS-104), Papaver somniferum (RS-58), היביסקוס (RS-88), יסמין (RS-89), טימין (RS-30), תימוס (RS-14), Illicium oligandrum (RS-72) ולימון הדרים (RS-12). עץ פילוגנטי ניתן באיור משלים 1.

2. שימוש בתכונה ליצירת מודל

  1. השתמש במערך תכונות מקיף הכולל 453 תכונות לחיזוי רצפי חלבונים בצמחי מרפא. כולל 439 פיצ'רים מבוססים ו-16 פיצ'רים חדשים, שנבחרו בקפידה על סמך סקירת ספרות יסודית.
  2. השתמש במסד הנתונים AAindex34(https://www.genome.jp/aaindex/) כדי לקבוע תכונות פיזיקוכימיות של חומצות אמינו. החל את פלטפורמת למידת המכונה WEKA35 (https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/) לבחירת תכונות. עיין בטבלה 2 לתכונות החדשות ששולבו.

טבלה 2: רשימת התכונות החדשות שנוספו יחד עם התיאורים שלהן. טבלה זו מסכמת את התכונות החדשות שתוכננו במהלך שלב חילוץ התכונות כדי לשפר את ביצועי המודל בחיזוי החלפת דומיינים תלת מימדיים. כל תכונה לוכדת תכונות ספציפיות מבוססות רצף, פיזיקוכימיות או מבניות של החלבונים המשוערות להשפיע על נטייתם להחלפת תחומים. תיאורים מפורטים ניתנים כדי להבהיר את הרלוונטיות הביולוגית והנגזרת החישובית של כל תכונה. אנא לחץ כאן להורדת טבלה זו.

3. עיבוד נתונים לפני ואחרי

הערה: עיבוד מקדים של נתונים. עיבוד מקדים של נתונים הוא שלב חיוני בלמידת מכונה הכולל הכנת נתונים גולמיים לניתוח. זה כולל ניקוי הנתונים (למשל, הסרת כפילויות, טיפול בערכים חסרים וכו').

  1. השתמש בקובץ קידוד משלים 1 לקידוד משתנים קטגוריים לצורה מספרית, הכוללת ארבעה שלבים עיקריים: (1) הגדר כתבי ציון, (2) עבד רצף מהיר לפי רצף I0. ניתוח, (3) יצירת מסגרת נתונים, (4) ניתוח מספרי של תכונות תלת מימד שהוחלפו בדומיין.
  2. לחדד ולפרש את פלט המודל באמצעות עיבוד נתונים לאחר מכן. כיול מחדש של תחזיות, צבירת תוצאות והחלת סף לסיווג. סווג את מערך הנתונים של החלפת דומיינים תלת-ממדיים בימודאליים באמצעות ערך סף β = 0.5 (טווח 0-1), כפי שנתמך על ידי מחקרים קודמים 36,37,38.
  3. חלק את מערך הנתונים עם פיצול מבחן רכבת של 70:30, הקצה 70% לאימון מודל ו-30% להערכה עצמאית.
  4. תקנן את נתוני האימון באמצעות שיטת Standard Scaler כדי להתאים את ערכי התכונה לממוצע של 0 וסטיית תקן של 1, מה שמבטיח תאימות טובה יותר עם אומדני למידת מכונה. בצע בחירת תכונות כדי לזהות את המשתנים המשפיעים ביותר.
    הערה: סטנדרטיזציה של מערך נתונים היא תנאי מוקדם בשימוש נרחב עבור אלגוריתמים רבים של למידת מכונה כדי להבטיח ביצועים מיטביים. נתונים הרחוקים מהתפלגות נורמלית יכולים להשפיע לרעה על הביצועים של מודלים של למידת מכונה39.
  5. תעשה אימות. כדי להבטיח הערכת מודל חזקה וחסרת פניות, יושם גם אימות צולב K-fold טבלה משלימה 3.
  6. חלק את מערך הנתונים ל-K תת-ערכות. אימון והערכה של המודל באופן איטרטיבי על תת-קבוצות K=5 תוך שימוש בתת-הקבוצה הנותרת לבדיקה עצמאית.

4. יצירה ויישום של המודל

  1. יישם וכוונן אלגוריתמים של יער אקראי (RF) ו-K-Nearest Neighbors (KNN) כדי למטב את ביצועי החיזוי. אימון, אימות ובדיקה של המודלים באמצעות 573 ו-575 רצפי חלבון לאימון, ו-1,355 רצפי חלבונים לבדיקה.
  2. השתמש בסקריפט Python (קובץ קידוד משלים 1) כדי לחלץ ערכי תכונות מספריות על סמך רצף החלבון שנבחר. שמור את הערכים המספריים הללו עבור שני מערכי הנתונים בקבצי CSV ושלח אותם למסווגי RF ו-KNN ליצירת מודל סיווג בינארי.
  3. השתמש במודלים אלה כדי להבחין בין חלבונים שהוחלפו בתחום בתלת-ממד לבין חלבונים שאינם מוחלפים בתלת-ממד. עיין באיור 2 ובאיור 3 עבור המסגרת הכללית לחיזוי החלפת דומיינים תלת מימדיים.
  4. החל פרמטרים היפר כגון n_estimators=20, max_depth=4 ו-random_state=42 עבור מודל RF.
  5. החל את הפרמטר ההיפר שכנים=5 עבור מודל המסווג KNN.
    הערה: הגדרות פרמטרים אלה כוונו כדי לשפר את ביצועי המודלים במערך הנתונים של צמחי המרפא שנאספו ידנית.

figure-protocol-1
איור 2: ייצוג סכמטי להמחשה. הייצוג מציג את מודלי למידת המכונה של Random Forest ו-K-Nearest Neighbor (KNN), המציגים את המבנה האלגוריתמי שלהם ואת זרימת העבודה הפונקציונלית שלהם בהקשר של משימות סיווג בינאריות אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

figure-protocol-2
איור 3: זרימת עבודה מבוססת למידת מכונה. התרשים ממחיש זרימת עבודה מבוססת למידת מכונה לחיזוי החלפת דומיינים תלת מימדית בחלבוני צמחי מרפא. התהליך מתחיל ברכישת מערכי נתונים, המשלבים את מערכי הנתונים של הבנצ'מרק והמטא. מיצוי תכונות כרוך בגזירת תכונות קיימות וחדשות מרצפי חלבונים. בעיבוד מקדים של מערך נתונים, רצפי FASTA מומרים לערכים מספריים באמצעות ניתוח רצף ומיפוי מילון ליצירת מסגרות נתונים מובנות, כולל תכונות ספציפיות של החלפת דומיינים תלת מימדית. עיבוד לאחר כולל הקצאת סטטוס החלפת דומיין באמצעות סף (β = 0.5), פיצול נתונים לערכות הדרכה ובדיקה (יחס 70-30), סטנדרטיזציה של תכונות וביצוע בחירת תכונות עם אימות k-fold. שני מודלים של למידת מכונה, יער אקראי (RF) ו-K-Nearest Neighbors (KNN), מאומנים, והביצועים שלהם מוערכים באמצעות מדדי מודל יחד עם AUROC ו-AUPRC כדי להעריך דיוק וחוסן חיזוי אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

5. הערכה סטטית והערכות מודלים של מסווגי ML

  1. יישם וכוונן אלגוריתמים של יער אקראי (RF) ו-K-Nearest Neighbors (KNN) כדי למטב את ביצועי החיזוי. אימון, אימות ובדיקה של המודלים באמצעות 573 ו-575 רצפי חלבון לאימון, ו-1,355 רצפי חלבונים לבדיקה.
    figure-protocol-3(1)
    figure-protocol-4(2)
    figure-protocol-5(3)
    figure-protocol-6(4)
    figure-protocol-7(5)
    figure-protocol-8(6)
    הערה: הגדר TP (חיובי אמיתי) כאחוז הרצפים שנחזו כהלכה כהחלפת דומיין על ידי המודלים. הגדר TN (שלילי אמיתי) כאחוז הרצפים שנחזו כהלכה כלא מוחלפים על ידי דומיין. הגדר חיובי כוזב (FP) כמקרים שבהם חלבונים שאינם מוחלפים דומיין נחזים באופן שגוי כמחליפים דומיין. הגדר שלילי כוזב (FN) כמקרים שבהם חלבונים שהוחלפו דומיין נחזים באופן שגוי כחלבונים שאינם מוחלפים בדומיין.
  2. חשב את Xsen כיחס בין החיוביים האמיתיים שזוהו במדויק, ואת Xspe כיחס בין השלילים האמיתיים שזוהו כהלכה על ידי המודל.
    הערה: השתמש ב-MCC כדי להעריך את האיכות של סיווגים בינאריים על-ידי ניתוח תוצאות חיוביות אמיתיות, שליליות אמיתיות, תוצאות חיוביות מוטעות ושליליות מוטעות ממטריצת הבלבול.
  3. חשב דיוק (ACC) כדי למדוד את היחס של התחזיות הנכונות בין סך התחזיות.
    הערה: דיוק מעריך חלק מהתוצאות החיוביות שזוהו כהלכה מבין כל התוצאות החיוביות החזויות, בעוד שציון F1 הוא הממוצע ההרמוני של דיוק ורגישות, המאזן בין תוצאות חיוביות שגויות ושליליות שגויות.
  4. השתמש ב-AUC כדי להעריך את הביצועים של מודלים של סיווג במשימות סיווג בינאריות. חשב AUC (שטח מתחת לעקומה) באמצעות ספריית Scikit-learn Python40, בהתבסס על חלבונים המסווגים חיובית ושלילית.
  5. השתמש בנתוני הבדיקה כדי להעריך פרמטרים אלה.

6. יישום מודל לחיזוי החלפת תחום תלת מימד על מיני צמחי מרפא שונים

  1. החל RF ו-KNN על סך של 1,355 רצפים שנבדקו (מערך נתוני חיזוי) מ-13 צמחי מרפא שונים, כולל Citrus sinensis, Mentha, Vitis vinifera, Thismus vulgaris, יסמין, היביסקוס, Papaver somniferum, Illicium oligandrum, Citrus limon, Acorus calamus, Cannabis sativa ו-Coffea arabica.
    הערה: חלבונים אלה קשורים לתפקודים שונים כמו הדרים סיננסיס, מנטה, טימין המסייעים לקשיי עיכול. גפן היין, יסמין, היביסקוס הם מקור עשיר מאוד לנוגדי חמצון והם גם משפרים את בריאות העור. Illicium oligandrum ידוע בתכונותיו האנטי-פטרייתיות והאנטיבקטריאליות וכו'.

7. חקירת העשרה של חלבונים שהוחלפו בתחום תלת מימד עם חיזוי חיובי מצמח מרפא

  1. מפה את קודי ההצטרפות של רצפי חלבונים אלה לקטגוריות מטבוליט משניות באמצעות נתונים מ-UniProt.
  2. חלץ מזהה גן מרצפים חזויים.
  3. פתח את שרת האינטרנט המקוון KEGG41 (https://www.genome.jp/kegg/) כדי לבצע ניתוח העשרה של מסלול KEGG על ידי הדבקת מזהה הגן הבודד או שם החלבון כדי לבדוק את המסלולים שלהם.
  4. בצע ניתוח השוואתי באמצעות השוואה בין החלבונים החלפת הדומיין התלת-ממדיים החזויים מול מערך נתוני חיזוי כדי לזהות ייצוג יתר מובהק סטטיסטית של מונחים ספציפיים באונטולוגיה של גנים (GO) ומסלולים ביולוגיים. הדבק את מזהה הגן של הרצף החזוי ב-ShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/) ובחר את הפונקציה או קטגוריית המסלול הרצויה (פונקציה ביולוגית, רכיב תאי, פונקציה מולקולרית, KEGG וכו').
    הערה: דמיין את ההערות הללו באמצעות פלטפורמה מקוונתמבוססת ענן 43 המאפשרת למשתמשים לכתוב ולהפעיל קוד Python.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

חלבונים המציגים החלפת תחום תלת מימד מקושרים לעתים קרובות למגוון פונקציות ביולוגיות. עם זאת, ניתוח שיטתי של רצפי חלבונים שהיו מעורבים בהחלפת תחום תלת מימד נותר ברובו לא נחקר. במחקר זה, ערכנו מחקר ראשוני כדי לחזות כביכול חלבונים שהוחלפו בתלת מימד מ-13 צמחי מרפא, תוך התמקדות בקשר שלהם עם תחומי מטבוליט משניים, מסלולי KEGG ומונחי אונטולוגיה גנטית (GO). ניתוח מקיף של הספרות הנגישה והערכת הביצועים של מודלים יישומיים של למידת מכונה מצביעים על כך שהמודלים המוצעים, יער אקראי (RF) בהשוואה לשכנים הקרובים ביותר (KNN), מפגינים תוצאות ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

להבנה של החלפת תחום תלת מימד בחלבונים על פני הגנום השלם שלהם יש חשיבות משמעותית בתחומים שונים. גישות למידת מכונה, במיוחד יער אקראי והשכן הקרוב ביותרK 26,27, שימשו כדי לחזות החלפת תחום תלת מימד ישירות מנתוני רצף חלבונים ברמת הגנום. שני דגמי ML אלה כוללים שלבים שונים כגון איסוף מערכי נתונים, בחירת תכונות, עיבוד נתונים לפני/אחרי, יישום סקריפט מודל מותאם אישית והערכת מודל. דגמי ה-RF וה-KNN מדגימים דיוק של 91.6% ו-88.7%, בהתאמה. מודלי...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים כי לא ידוע על אינטרסים פיננסיים מתחרים או קשרים אישיים שיכולים היו להשפיע על העבודה המדווחת במאמר זה.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

לא התקבל מימון למחקר זה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
3DSwap +https://caps.ncbs.res.in/3Dswapplus/index.html 
PfamEMBL-EBIhttp://pfam.xfam.org/: 
HMMEREMBL-EBI;
Aaindexhttps://www.genome.jp/aaindex/:
DIALBioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL: 
WEKAאוניברסיטת וקאטוhttps://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
  KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :
https://www.ebi.ac.uk/Tools/hmmer/:  

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

KKEGG
הסרטון יגיע בקרוב

מאמרים קשורים