מאמר שיטה

אופטימיזציה של גילוי תרופות מונעת נתונים לסרטן השד באמצעות מודלים של למידת מכונה הניתנים לפירוש

DOI:

10.3791/68705

12 בספטמבר 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מציג צינור למידת מכונה באמצעות XGBoost ו-SHAP כדי לחזות רגישות לתרופות בסרטן השד. זרימת העבודה כוללת עיבוד מקדים של נתונים, מודלים היברידיים, פרשנות מבוססת SHAP, ניקוד סינרגיה ואשכולות PCA כדי לזהות תרופות חזקות ולהבין גורמים ביולוגיים מרכזיים המשפיעים על התגובה הטיפולית.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סרטן השד נותר אחת הממאירות השכיחות ביותר בעולם, ומציב אתגרים טיפוליים משמעותיים בשל הטרוגניות הגידול ועמידות לתרופות. מחקר זה מציג פרוטוקול למידת מכונה הניתן לשחזור ומונחה נתונים לחיזוי רגישות לתרופות בשורות תאים של סרטן השד, במטרה כפולה של זיהוי חומרים בודדים חזקים ושילובי תרופות סינרגטיים. באמצעות מערכי נתונים שנאספו מהגנומיקה של רגישות לתרופות בסרטן (GDSC), יושמו שתי גישות חיזוי: רגרסור XGBoost עצמאי וצינור היברידי של Autoencoder-XGBoost. העיבוד המקדים כלל קידוד תוויות, קידוד חם אחד, סטנדרטיזציה של ציון Z, הטמעת ערך חסר והפחתת מימדים באמצעות PCA. הערכת המודל הראתה ש-XGBoost השיג ביצועים מעולים (MSE = 1.3789, R2 = 0.8145) בהשוואה למודל ההיברידי (MSE = 4.0322, R2 = 0.4577). יכולת הפרשנות טופלה באמצעות SHapley Additive exPlanations (SHAP), שזיהה TARGET_PATHWAY, DRUG_ID, TARGET ו-CELL_LINE_NAME כתכונות חיזוי מרכזיות, המיישרות קו עם מנגנונים פרמקולוגיים מבוססים. ציוני סינרגיה חזויים, שנגזרו משילוב תפוקות המודל עם נתוני DrugComb ו-SynergyDB, הדגישו זוגות תרופות מבטיחים כגון Bortezomib + Romidepsin ו-Paclitaxel + Bortezomib. ממצאים אלה נתמכו עוד יותר על ידי אשכולות פרמקולוגיים מבוססי PCA, שחשפו קבוצות רלוונטיות ביולוגית של תרופות עם מנגנוני פעולה דומים. הפרוטוקול המוצע מספק מסגרת שקופה וניתנת להתאמה למחקר אונקולוגי מדויק, המאפשר הן דיוק ניבוי והן פרשנות ביולוגית. על ידי שילוב עיבוד מקדים קפדני, אימות מודל, יכולת הסבר וניתוח סינרגיה של תרופות, זרימת עבודה זו מציעה בסיס ניתן להרחבה לגילוי תרופות תרגומי וייעוד מחדש בטיפול בסרטן השד.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סרטן השד נותר הסרטן השכיח ביותר המאובחן והגורם השני המוביל למוות הקשור לסרטן בקרב נשים ברחבי העולם1. בארצות הברית לבדה, היא מהווה כמעט 30% מכלל הגידולים הממאירים הנשיים החדשים, עם למעלה מ-280,000 מקרים חדשים המאובחנים מדישנה. למרות ההתקדמות הטיפולית, במיוחד בתת-סוגים חיוביים ל-HER2 וחיוביים לקולטני הורמונים, עמידות לטיפול והישנות נותרו אתגרים קריטיים - במיוחד עבור תת-סוגים אגרסיביים כמו סרטן שד טריפל נגטיב (TNBC), שחסר טיפולים ממוקדים 3,4. זה מדגיש את הצורך הדחוף בגילוי תרופות מונע דיוק כדי לזהות חומרים טיפוליים יעילים ושילובים המותאמים לפרופילים מולקולריים בודדים. גילוי תרופות, המונחה באופן מסורתי על ידי שיטות ניסוי וניסוי וטעייה, ראה האצה יוצאת דופן באמצעות שילוב של טכניקות למידת מכונה (ML) 5,6. ML מאפשר מידול של קשרים מורכבים ולא ליניאריים על פני נתונים ביו-רפואיים בממדים גבוהים ויכול לסייע בזיהוי מטרה, גילוי סמנים ביולוגיים, חיזוי רגישות לתרופות ותכנון טיפול משולב 7,8. עם זאת, הפריסה המעשית של מודלים של ML באונקולוגיה עומדת בפני מספר מכשולים, כולל פרשנות מודל, יכולת שחזור, התאמת יתר על מערכי נתונים דלילים והכללה על פני תת-סוגים של סרטן 9,10,11.

כדי להתגבר על מגבלות אלה, המחקר האחרון התמקד בשילוב למידה עמוקה לחילוץ תכונות עם למידת אנסמבל לחיזוי חזק. במחקרים שהעריכו אלגוריתמים מרובים, מודלים כגון רשתות עצביות מלאכותיות (ANN) השיגו רמות דיוק של עד 93.2%, וביצעו ביצועים טובים יותר מסווגים קונבנציונליים כמו Naïve Bayes ו-Decision Trees12. בנוסף, טכניקות כריית תכונות משולבות חשפו גנים מניעים מרכזיים ומטרות מולקולריות באמצעות מסדי נתונים כמו GEO (Gene Expression Omnibus) ו-GSE45827, וזיהו עד 1,700 גנים המתבטאים באופן דיפרנציאלי, שחלקם מציגים אינטראקציות ידועות בין תרופות13. יתר על כן, מחקרים חדשניים לייעוד מחדש של תרופות חשפו את הפוטנציאל של תרכובות לא אונקולוגיות כמו קלציטריול להפחית את כדאיות תאי סרטן השד בצורה יעילה יותר מאשר טיפולים סטנדרטיים כמו נרטיניב, במיוחד בשורות תאי HER2+14. חקירות של מסלול איתות Akt הראו גם הבטחה בהתגברות על עמידות לטרסטוזומאב, מה שמציע מיקוד מסלול מולקולרי כחלופה לטיפול ממוקד קולטנים15,16. עם זאת, למרות התקדמות זו, מסגרת שיטתית וניתנת להסבר המסוגלת לחזות ערכי תגובה מתמשכת לתרופות, לדרג שילובי תרופות יעילים ולהמחיש קווי דמיון פרמקולוגיים נותרה לא נחקרת בספרות הנוכחית. מודלים רבים מבוססי סיווג או חסרי בהירות תרגומית, במיוחד כאשר הם מיושמים על מערכי נתונים פרמקוגנומיים בעולם האמיתי.

ניתן לשפר את גילוי התרופות וקבלת ההחלטות על ידי למידת מכונה (ML), המציעה כלים לנתונים באיכות גבוהה. כל שלבי גילוי התרופות, כולל אימות מטרה, זיהוי סמנים ביולוגיים וניתוח ניסויים קליניים, יכולים להפיק תועלת מהשימוש בלמידת מכונה. גם יכולת הפרשנות והשחזור של תוצאות שנוצרו על ידי ML מהווים מכשולים17. ניתן להשיג הפחתת שיעורי כישלון וזירוז התהליך על ידי טיפול בבעיות אלו והעלאת הידע על משתני אימות. באמצעות אלגוריתמים של למידת מכונה, החוקרים העריכו דגימות ביופסיה בשלבים שונים של סרטן. דיוק המבחנים היה גבוה, עם ANN 93.2%, Naïve Bayes (NB) 90.4%, Decision Tree (DT) 87.8% ו-RF 85.9%, על פי הממצאים. בסך הכל נמצאו 350 גנים חזויים ו-164 גנים המתבטאים באופן דיפרנציאלי על ידי שילוב מסד הנתונים של GEO על ידי Rakhshaninejad et al.18. במערך הנתונים המשולב, האלגוריתם Binary Grey Wolf Optimization with Simulated Annealing Ensemble (BGWO_SA_Ens) מצא 1404 גנים, בעוד שבמערך הנתונים GSE45827 הוא מצא 1710. נמצאו כ-35 גנים עליונים, יחד עם תפקידיהם במסלולים חשובים והקשרים בין גנים עליונים לתרופות אנטי-סרטניות. כדי למצוא גנים יעד ממסלול איתות ביטוי יתר של קולטן גורם גדילה אפידרמלי (EGFR (EGFR) ובני משפחתם הקשורים אליהם, בוצעו חקירות רשת מולקולרית על ידי Nagaraj et al.19 לתרופה בשם קלציטריול, המורשית לטפל במצבים שאינם קשורים לסרטן, היו קשרים חזקים עם כל אחד מארבעת הקולטנים. לפי in vitro מחקרי ציטוטוקסיות, קלציטריול הפחית את כדאיות תאי SK-BR-3 באופן תלוי מינון, מה שמעיד על ציטוטוקסיות מעולה והפחתת התפשטות תאי סרטן השד בהשוואה לנרטיניב. מסלול איתות Akt פעיל וניתן לתרופה הוצע על ידי Jernström et al.20 ששני קווי תאים שהיו חסרי רגישות לטרסטוזומאב הגיבו למעכב קינאז Akt1/2. במקום להתמקד בהגברה או ביטוי של HER2, המחקר ממליץ להתמקד במסלול איתות Akt ולקחת בחשבון היבטים מולקולריים בעת קבלת החלטות טיפוליות. שלושים אחוז מהגידולים הממאירים הנשיים החדשים בארה"ב הם סרטן השד, מה שהופך אותה למחלה הממאירה השכיחה ביותר בקרב נשים. המטרה של Witt ו-Tollefsbol21 היה לפתח כלי בסיסי שיעזור לחוקרים לבחור קו תאים של סרטן השד לשימוש בניסויי קסנוגרפטים, מניעת סרטן ותגליות אפיגנטיות, בין היתר. כמו כן מכוסים דיונים על מקורם של קווי תאים ספציפיים של סרטן השד והיתרונות של שימוש בקסנוגרפט שמקורו בחולה (PDX) בניגוד לקסנוגרפט שמקורו בתאים (CDX). השימוש בטכניקות חיזוי תרופות כדי לספק השערות חדשות לגילוי תרופות נבדק ב-Gruener et al.22עם דגש על סרטן שד טריפל נגטיב (TNBC)., על בסיס נתוני טרנסקריפטום קו התאים, נבנו מודלים של למידת מכונה של תגובה לתרופות ולאחר מכן יושמו על נתוני גידול חולים. הממצאים הראו כי למעכב Wee1 AZD-1775 הייתה פעולה מועדפת ב-TNBC וכי מוטציות TP53 היו קשורות קשר הדוק ליעילותו. על מנת לחזות אינטראקציות לא ידועות בין תרופות למטרה בחקר סרטן השד, סונג ואחרים23 הציגו גישה מבוססת תכונות המכונה Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction (PsePDC-DTIs), העושה שימוש ברצפי חלבונים, מקדם ניתוח מתאם קנוני עמוק (DCCA) ומתאר טביעת אצבע מולקולרית. הטכניקה חוזה DTIs בארבעה מערכי נתונים סטנדרטיים של זהב באמצעות מסווג יער אקראי ומטפלת בנתונים לא מאוזנים באמצעות SMOTE. בנוסף, המודל משתמש בגני סיכון ממחקר גנטי כלל-גנומי כדי לחקור מטרות חדשות לטיפול בסרטן השד. עליונותו ותוקפו של המודל מודגמים על ידי עשרת ה-DTI האפשריים שהוא מציע לטיפול. עשרה עד עשרים אחוז ממקרי סרטן השד הם סרטן שד טריפל נגטיב (TNBC). כיום אין טיפולים ממוקדים ל-TNBC, למרות ההתקדמות בטיפולים ב-HER2+ ובקולטן הורמונלי+24. למרות שה-EGFR מתבטא על ידי רוב החולים, מחקרים מוקדמים לא מצאו פעילות ניכרת. טיפולים ניסיוניים עתידיים ל-TNBC מוצעים על ידי ממצאים אחרונים והתקדמות קלינית25.

למרות השילוב ההולך וגובר של למידת מכונה בגילוי תרופות, המודלים הנוכחיים לרוב חסרים יכולת פרשנות ושחזור, מה שמגביל את היישום התרגומי שלהם. בעוד שמחקרים קודמים חקרו את דיוק הסיווג וכריית גנים, מעטים חזו באופן שיטתי רגישות מתמשכת לתרופות (כמו LN_IC50) באמצעות מודלים היברידיים הניתנים לפירוש. יתר על כן, השילוב של טכניקות הפחתת מימדים עם רגרסורים חזקים נותר לא נחקר בהקשר של טיפול בסרטן השד. מחקר זה מטפל בפער זה על ידי הצגה והערכה של אסטרטגיית צינור כפול - XGBoost ו- Autoencoder-XGBoost - לחיזוי נאמנות גבוהה של תגובת התרופה, יחד עם כלי מיפוי סינרגטיים והסבר ליישום קליני בעולם האמיתי.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. רכישת מערכי נתונים

  1. הורד נתוני רגישות לתרופות מ-GDSC (https://www.cancerrxgene.org/downloads/drug_data). סיכום של מערך הנתונים המשומש מסופק בטבלה 1. הקבצים שבהם נעשה שימוש הם gdsc_drug_data.csv (תגובה לתרופות), gdsc_expression_data.csv (ביטוי גנים) ו-gdsc_cell_metadata.csv (מידע על קו התא).
    ראה איור 1 לדוגמא של מבנה ערכת הנתונים המשמש בזרימת עבודה זו.
  2. סנן את מערך הנתונים כך שיכלול רק קווי תאים של סרטן השד באמצעות Python (ספריית פנדה).
    1. בחר רשומות שבהן העמודה TCGA_DESC שווה ל- "שד".
    2. חלץ ערכי CELL_LINE_NAME מתאימים.
    3. עיין בקוד משלים 1 (קובץ משלים 1) ליישום.
      הערה: הגבלת מערך הנתונים לקווי תאים של סרטן השד מבטיחה אימון מודל ספציפי לתחום ומשפרת את התוקף הביולוגי. מערך הנתונים ששימש במחקר זה אוחזר ממסד הנתונים של גנומיקה של רגישות לתרופות בסרטן (GDSC), ותכונותיו העיקריות מוצגות בטבלה 2.

2. עיבוד מקדים של נתונים

  1. צינור העיבוד המקדים:
    1. קודד משתנים קטגוריים כגון DRUG_ID, CELL_LINE_NAME ו-TARGET_PATHWAY באמצעות LabelEncoder כדי להמיר אותם לתבניות מבוססות מספרים שלמים המתאימות לקלט XGBoost.
    2. נרמל תכונות מספריות, כולל נתוני ביטוי גנים, שינויים במספר עותקים (CNA) ותכונות מתילציה, באמצעות סטנדרטיזציה של ציון Z (StandardScaler) כדי להבטיח אפס שונות ממוצעת ויחידה.
    3. הסר דוגמאות עם יותר מ-30% תכונות חסרות.
    4. חשב את הערכים החסרים הנותרים באמצעות החציון של כל עמודת תכונה מתאימה עם SimpleImputer(strategy='median').
    5. החל קידוד חם אחד על משתנים קטגוריים (DRUG_ID ו-TARGET_PATHWAY) באמצעות OneHotEncoder מ-scikit-learn.
    6. בצע הפחתת מימדים בתכונות ביטוי גנים באמצעות ניתוח רכיבים עיקריים (PCA) כדי להפחית את שטח התכונה תוך שמירה על שונות.
    7. פצל את מערך הנתונים הסופי הנקי לערכות אימון (80%) ובדיקה (20%) באמצעות train_test_split מ-scikit-learn, תוך שמירה על התפלגות זוגות תאי תרופה.
      הערה: הרציונל המפורט עבור כל שלב עיבוד מקדים וממדי מערך הנתונים המתקבלים נדון בסעיף דיון.
  2. טיפול במשתנים קטגוריים
    1. זהה משתנים קטגוריים (CELL_LINE_NAME, DRUG_NAME, TARGET_PATHWAY) באמצעות פנדות.
    2. החילו קידוד תוויות על משתנים אלה באמצעות LabelEncoder של scikit-learn.
    3. יישם שלב זה באופן פרוגרמטי כפי שמוצג בקוד משלים 2 (קובץ משלים 1).
      הערה: אלגוריתמים של למידת מכונה דורשים קלט מספרי; קידוד תוויות ממיר משתנים קטגוריים לפורמט מספר שלם תוך שמירה על הבדלי מעמדות.
  3. סטנדרטיזציה של תכונות מספריות
    1. זהה משתנים מספריים על פני ביטוי גנים, שינוי מספר עותקים (CNA) ותכונות מתילציה.
    2. החל את StandardScaler כדי לנרמל תכונות לאפס ממוצע ושונות יחידה.
      הערה: סטנדרטיזציה מבטיחה שכל התכונות המספריות יתרמו באופן שווה למודל על ידי שינוי קנה המידה שלהן כך שיהיו להן שונות ממוצעת ויחידה אפס. זה מונע מתכונות בקנה מידה גדול יותר לשלוט באימון מודלים ומשפר את ההתכנסות באלגוריתמי אופטימיזציה.
  4. לטפל בערכים חסרים
    1. זיהוי ערכים חסרים בכל התכונות.
    2. הסר רשומות עם יותר מ- 30% נתונים חסרים.
    3. ייחוס ערכים חסרים שנותרו באמצעות אסטרטגיית החישוב החציונית.
      הערה: נתונים לא שלמים עלולים להציג הטיה ולהפחית את חוסן המודל. הסרת רשומות חסרות מאוד מבטיחה אמינות נתונים, בעוד ששיוך חציוני מספק שיטה יציבה ועמידה בפני חריגות לשימור מידע שמיש מבלי להציג הנחות הפצה חזקות.
  5. פיצול מערך הנתונים
    1. השתמש בשיטה אוטומטית (למשל, train_test_split מ-sikit-learn) כדי לחלק את מערך הנתונים הסופי שנוקה לתת-קבוצות הדרכה ובדיקה.
    2. ציין זרע אקראי (לדוגמה, random_state=42) כדי להבטיח שחזור.
    3. הקצה 80% מהנתונים לערכת ההדרכה ו-20% למערך הבדיקות.
    4. עיין בקוד משלים 3 (קובץ משלים 1) ליישום הקוד המלא.
      הערה: חלוקת נתונים לקבוצות משנה של הדרכה ובדיקה מאפשרת הערכה חסרת פניות של הכללת המודל.

3. מסגרת מידול

  1. הגדרת מטרת רגרסיה
    1. מסגר את משימת החיזוי כבעיית רגרסיה כדי להעריך את הלוגריתם הטבעי של ריכוז מעכב חצי מקסימלי (LN_IC50) עבור כל זוג תאי תרופה.
    2. בחר LN_IC50 כמשתנה היעד כדי לייצב את השונות ולשפר את המודל.
      הערה: הפיכת IC50 ל-LN_IC50 מפחיתה את ההטיה ומשפרת את ביצועי הדגם.
  2. רכבת XGBoost Regressor (דגם 1)
    1. בחר ב-XGBoost כמודל העיקרי בשל הביצועים החזקים שלו במערכי נתונים פרמקוגנומיים מובנים ויכולתו לדגמן אינטראקציות תכונות לא ליניאריות עם רגולציה כדי למנוע התאמת יתר.
    2. אתחל את המודל באופן פרוגרמטי באמצעות המחלקה XGBRegressor מספריית xgboost. ציין היפרפרמטרים מכווננים (קצב למידה, עומק מרבי, מספר אומדנים וזרע אקראי) שזוהו באמצעות אימות צולב.
    3. אמן את המודל בתת-קבוצת ההדרכה (X_train, y_train) באמצעות שיטת fit().
    4. צור תחזיות על תת-קבוצת הבדיקה (X_test) באמצעות שיטת predict().
    5. הערך ביצועים באמצעות שגיאה ריבועית ממוצעת (MSE) וציון R² עם פונקציות mean_squared_error ו-r2_score של scikit-learn.
      הערה: עיין בקוד משלים 4 (קובץ משלים 1) ליישום המלא.
  3. שקול מודלים חלופיים
    1. הערכת רגרסיה וקטורית תומכת (SVR) על חוסנה בהגדרות נתונים של מדגם קטן וממדים גבוהים.
    2. הערך היברידי Autoencoder-XGBoost לרווחים פוטנציאליים בביצועים באמצעות חילוץ תכונות סמויות עמוקות ומידול לא ליניארי.
    3. השווה ביצועים בין מודלים באמצעות מדדי הערכה זהים ואימות צולב.
      הערה: SVR לא נכלל בתוצאות הסופיות עקב דיוק ניבוי נמוך יותר בהשוואה ל-XGBoost, בעוד שההיברידית Autoencoder-XGBoost נשמרה להשוואה בין גישות למידה עמוקה ולמידת מכונה.
  4. דגם 1: XGBoost Regressor
    1. בחר ב-XGBoost כמודל הבסיס בשל הביצועים החזקים שלו על נתונים ביו-רפואיים מובנים, יכולתו למדל אינטראקציות תכונות לא-ליניאריות והרגולציה המובנית שלו המפחיתה התאמת יתר.
    2. הגדר את מודל XGBoost עם היפרפרמטרים learning_rate = 0.05, max_depth = 6 ו- n_estimators = 100.
    3. בצע אופטימיזציה של היפרפרמטרים באמצעות חיפוש רשת ואמת ביצועים עם אימות צולב פי 5.
    4. אמן את המודל על מערך נתוני האימון המוכן (X_train, y_train).
    5. הערך ביצועי חיזוי באמצעות שגיאה ריבועית ממוצעת (MSE) וציון R² המחושבים עם פונקציות mean_squared_error ו-r2_score של scikitlearn.
      הערה: מחקרים קודמים26 הראו ש-XGBoost עולה באופן עקבי על מודלים של למידה עמוקה על מערכי נתונים ביו-רפואיים טבלאיים עם עלות חישובית נמוכה יותר.
  5. בנה מקודד אוטומטי היברידי + דגם XGBoost (דגם 2)
    1. תכנן מקודד אוטומטי להפחתת מימדים ללא פיקוח
      הערה: המקודד דוחס תכונות קלט לייצוג סמוי בעל מימד נמוך. המפענח משחזר קלט כדי למזער את שגיאת השחזור.
    2. אמן את המקודד האוטומטי על מטריצת התכונות המלאה כדי לחלץ תכונות סמויות.
    3. העבירו את פלט המקודד (תכונות סמויות) כקלט לרגרסור XGBoost, כפי שמוצג בקוד משלים 5A (קובץ משלים 1).
    4. אמן את הרגרסור XGBoost על ערכת התכונות המקודדות עם LN_IC50 כמשתנה היעד, כפי שמוצג בקוד משלים 5B (קובץ משלים 1).
    5. הערך את ביצועי המודל באמצעות אותם מדדים כמו מודל 1 להשוואה ישירה.
      הערה: גישה היברידית זו ממנפת למידת ייצוג מבוססת למידה עמוקה ואת יכולת הרגרסיה החזקה של XGBoost, ומספקת יתרון לנתונים ביולוגיים בממדים גבוהים.
  6. הערכת מודל
    1. הערך את מודל הרגרסיה המאומן על ידי חיזוי ערכי יעד באמצעות שיטת predict() במערך נתוני הבדיקה (X_test).
    2. חשב את השגיאה הריבועית הממוצעת (MSE) כדי למדוד את ההפרש הממוצע בריבוע בין ערכי ה-LN_IC50 החזוי והאמיתי באמצעות mean_squared_error(y_test, y_pred) מ-scikit-learn.
      הערה: יחד, מודלים אלה משלבים פרשנות ודיוק, ויוצרים מסגרת חזקה לחיזוי רגישות לתרופות בחקר סרטן השד27,28.
      figure-protocol-1
      כאשר yi מציין את LN_IC50 האמיתי עבור זוג תאי התרופה, figure-protocol-2 הוא הערך החזוי המתאים, ו-n הוא המספר הכולל של התצפיות. עבור המקודד האוטומטי, אובדן השחזור ניתן על ידי,
      figure-protocol-3
      כאשר X היא מטריצת תכונת הקלט, E(·) היא פונקציית המקודד הממפה X לייצוג סמוי, ו-D(·) היא פונקציית המפענח המשחזרת X מהמרחב הסמוי.
    3. חשב את ציון R2 כדי לקבוע את שיעור השונות במשתנה היעד המוסבר על ידי המודל באמצעות r2_score(y_test, y_pred) מ-scikit-learn.
    4. רשום את ערכי MSE ו- R2 המחושבים לצורך דיווח. ערכי MSE ו-R² המחושבים מסוכמים בטבלה 3 כדי להציג בבירור ולהשוות ישירות את הביצועים של המודלים השונים.
    5. פרש את מדדי ההערכה: MSE נמוך יותר מצביע על דיוק ניבוי גבוה יותר, וציון R2 קרוב יותר ל-1 מצביע על כוח הסבר חזק יותר ויכולת הכללה טובה יותר של המודל.
  7. יכולת הסבר SHAP
    1. התקן וייבא את ספריית SHAP (ייבוא shap). ודא שהגירסה היא 0.41.0 לצורך שחזור.
    2. אתחל את מסביר SHAP באמצעות מודל XGBoost המאומן על ידי ביצוע קוד משלים 6 (קובץ משלים 1).
    3. חשב ערכי SHAP עבור מערך הנתונים של הבדיקה כדי לקבל ציוני תרומת תכונות.
    4. צור תרשים סיכום חשיבות תכונה גלובלית כדי להמחיש אילו תכונות תורמות הכי הרבה לתחזיות.
    5. צור הסבר חיזוי פרטני עבור דגימה שנבחרה באמצעות תרשים מפל SHAP.
    6. פרש את העלילות כדי לזהות תכונות מפתח המשפיעות על תחזיות. כפי שמוצג בטבלה 4, תכונות קריטיות כוללות TARGET_PATHWAY, DRUG_ID, CELL_LINE_NAME, חלבון TARGET ו-Screen Medium, מה שמצביע על כך שתכונות ספציפיות לתרופה וספציפיות לתא משפיעות באופן משמעותי על תחזיות התגובה לתרופות.
      הערה: ערכי SHAP חושבו באמצעות shap. TreeExplainer() עבור מודלים של XGBoost. חשיבות התכונה הגלובלית הודגמה באמצעות shap.summary_plot(), והסברים לכל דגימה נוצרו עם shap.dependence_plot() ו-shap.waterfall_plot() (SHAP v0.41.0) כפי שמוצג בטבלה 4, המאפיינים המשפיעים ביותר כללו TARGET_PATHWAY, DRUG_ID ו-CELL_LINE_NAME, מה שמצביע על כך שגם מאפיינים ספציפיים לתרופה וגם מאפיינים ספציפיים לתא היו קריטיים בקביעת התגובה לתרופה. תורמים מרכזיים נוספים היו חלבון TARGET ו-Screen Medium, מה שהדגיש עוד יותר את יישור המודל עם גורמים רלוונטיים לתחום בפרמקוגנומיקה של סרטן.
  8. סינרגיה ואשכולות תרופות
    1. הורד נתוני סינרגיה
      1. הורד נתוני סינרגיה של שילוב תרופות ממאגרים זמינים לציבור:
        DrugComb:https://drugcomb.fimm.fi
        SynergyDB: https://synergy.bioinformatics.nl
    2. מזג נתוני סינרגיה עם תגובה חזויה.
      1. השתמש בשילובי קו תרופות-תאים כמפתחות ייחודיים כדי למזג ציוני סינרגיה שהורדו (ZIP, Bliss, Loewe, HSA) עם ערכי תגובה חזויים לתרופות (LN_IC50).
      2. ודא התאמה של מזהי תרופות ושמות קווי תאים בין מערכי נתונים לפני המיזוג.
    3. חשב ציוני סינרגיה מבוססי מודל.
      1. עבור כל זוג תרופות, חשב את היעילות החזויה המשולבת באמצעות הממוצע של ערכי LN_IC50 החזוי במודל:
        figure-protocol-4
        כאשר, Scomb מציין את ציון ה-LN_IC50 המשולב החזוי עבור זוג תרופות, figure-protocol-5 הוא LN_IC50 החזוי עבור תרופה 1.
      2. דרג שילובי תרופות על סמך ציוני סינרגיה.
      3. זהה שילובים מובילים (למשל, Bortezomib + Romidepsin, Vinblastine + Dactinomycin) המציגים את ציוני הסינרגיה הנמוכים ביותר, מה שמעיד על יעילות חזויה גבוהה יותר.
        הערה: ציון סינרגיה נמוך יותר משקף פוטנציאל טיפולי חזוי גדול יותר, מה שהופך את זוגות התרופות הללו למועמדים לאימות ניסיוני נוסף. בצע את השלבים המפורטים בקוד משלים 7A ובקוד משלים 7B (קובץ משלים 1).
  9. דירוג סינרגיה ואשכולות מבוססי PCA
    1. דרג זוגות תרופות לפי ציון סינרגיה.
      1. מיזוג ציוני סינרגיה (ZIP, Bliss, Loewe, HSA) עם ערכי LN_IC50 חזויים באמצעות שילובי קו תרופה-תא כמפתחות ייחודיים.
      2. חשב ציוני סינרגיה עבור כל זוג תרופות באמצעות ערכי LN_IC50 הממוצעים החזויים:
      3. דרג זוגות תרופות על סמך ציוני סינרגיה מחושבים.
      4. זהה זוגות תרופות עם הציונים הנמוכים ביותר (השליליים ביותר) כשילובים סינרגטיים פוטנציאליים (למשל, Bortezomib + Romidepsin, Vinblastine + Dactinomycin).
    2. בצע PCA על מטריצת התגובה לתרופות.
      1. בנה מטריצת תגובה לתרופות באמצעות ערכי LN_IC50 חזויים עם תרופות כשורות ושורות תאים כעמודות, לפי השלבים המוצגים בקוד משלים 8 (קובץ משלים 1).
      2. תקן את המטריצה באמצעות נורמליזציה של zscore.
      3. בצע ניתוח רכיבים עיקריים (PCA) עם שני רכיבים עיקריים (n_components = 2) כדי להפחית את הממדיות וללכוד שונות גדולה.
    3. הדמיה של אשכולות PCA
      1. שרטט את הקרנת ה-PCA הדו-ממדית באמצעות Matplotlib או Seaborn.
      2. אשר שתרופות בעלות מנגנוני פעולה דומים (למשל, Docetaxel ו-Paclitaxel) מתקבצות יחד, ומאמתות את יכולת המודל ללכוד קשרים בעלי משמעות ביולוגית.
    4. יציבות הדגם ואיזון התכונות
      1. סנן משתנים קטגוריים נדירים במהלך הקידוד כדי למנוע בעיות דלילות.
      2. כוונן את שיעורי הלמידה של המקודד האוטומטי וכלול שכבות נשירה כדי למנוע בעיות התכנסות.
      3. הגבל את ניתוח SHAP ל-100 התכונות המובילות כדי להפחית את תקורת הזיכרון ולהבטיח יעילות חישובית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה התמקד באופטימיזציה של בחירת תרופות וחיזוי יעילות קומבינטורית לסרטן השד באמצעות מודלים מתקדמים של למידת מכונה. מערך הנתונים כלל פאנל אוצר ומסונן של קווי תאים של סרטן השד, מדדי רגישות לתרופות (LN_IC50, AUC, Z-Score), ומתארים מולקולריים כגון CNA, מתילציה, ביטוי גנים, מתארי רקמות ומטרות תרופות. המטרה העיקרית הייתה לחזות את LN_IC50 (לוג טבעי של ריכוז מעכב חצי מקסימלי) של תרופות בודדות על פני קווי תאים, לזהות שילובים סינרגטיים ולספק פרשנות באמצעות יכולת הסבר SHAP. המודלים פותחו באמצעות למידת מכונה עצמאית (XGBoost) וצינ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציג צינור משולב של למידת מכונה כדי להסתגל לבחירת התרופה, לחזות שילובים סינרגטיים ולזהות את האפשרויות של ייעוד מחדש של תרופות. נתונים ממסד הנתונים של GDSC ומאגרי סינרגיה (למשל, SynergyDB, DrugComb) שולבו כדי לאצור פאנל מקיף של אינטראקציות בין תרופות לקו תאים, הכולל מאפיינים מולקולריים (למשל, ביטוי גנים, שינויים במספר עותקים) ותגובות פרמקולוגיות31. המטרה העיקרית כאן הייתה לבצע חיזוי מדויק של רגישות לתרופות בשורות תאים, לדרג את התרופות היעילות ביותר ולהעריך ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים כי אין ניגודי אינטרסים הקשורים לעבודה זו. אנו מאשרים כי טכנולוגיית מודל שפה גדול (LLM) (ChatGPT, שפותחה על ידי OpenAI) שימשה בקיבולת מוגבלת במהלך השלבים המוקדמים של הכנת כתב היד. באופן ספציפי, ChatGPT שימש ליצירת רעיונות וסיעור מוחות ראשוני של מסגרות מושגיות, שלאחר מכן שוכללו, אומתו ושוכתבו במלואן על ידי המחברים. כל תוכן הליבה המדעי, ניתוח הנתונים, הפרשנות והניסוח הסופי בוצעו באופן בלעדי על ידי המחברים. התפוקות מ-ChatGPT נבדקו באופן ביקורתי לדיוק, קוהרנטיות ויושרה לפני ההכללה, בהתאם לשקיפות ולהנחיות האתיות של כתב העת. כל המחברים בדקו ואישרו את הגרסה הסופית של כתב היד ומאשרים כי אין קשרים פיננסיים, אישיים או מקצועיים שיכולים להתפרש כמשפיעים על תוכן פרסום זה.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מכירים בכנות בתמיכה המוסדית שניתנה על ידי המחלקה למדעי המחשב, אוניברסיטת קרייסט, שאפשרה את המשאבים החישוביים והסביבה האקדמית הדרושים לביצוע מחקר זה. אנו אסירי תודה גם על ההדרכה והעידוד המשותפים שהוענקו על ידי עמיתינו והמנטורים שלנו במהלך עבודה זו.

תרומת המחבר:
דיוטי באנרג'י הגתה את המחקר, עיצב את המתודולוגיה ואצר את מערך הנתונים. Sivaneasan Bala Krishnan ו-Kamal Upreti יישמו את מודלי למידת המכונה וביצעו את הניתוח החישובי. Sumegh Shrikant Tharewal ו-Uma Shankar תרמו לעיבוד מקדים של נתונים, הנדסת תכונות ואימות תוצאות. פראווין קשירסאגאר ערך את ניתוח הסינרגיה ואשכולות מבוססי PCA. מנוג' קומאר סייע בסקירת הספרות, פרשנות הממצאים וניסוח כתבי היד. כל המחברים תרמו לתיקון כתב היד, אישרו את הגרסה הסופית ומסכימים להיות אחראים לכל ההיבטים של העבודה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
מקודד אוטומטי (מודל למידה עמוקה)TensorFlow (גוגל)https://www.tensorflow.orgהפחתת מימדים וקידוד תכונות למידול תגובה לתרופות
Bortezomibסלק כימיקליםS1013תרופה המשמשת בניתוח סינרגיה
דקטינומיציןסיגמא-אולדריץ'D1037תרופה המשמשת בניתוח סינרגיה
דוסטקסלסיגמא-אולדריץ'D1080תרופה המשמשת לאימות אשכולות מבוסס מנגנון
ספריית Matplotlibאינדקס חבילות Python (PyPI)https://matplotlib.orgויזואליזציה ושרטוט נתונים ב-Python
ספריית NumPyאינדקס חבילות Python (PyPI)https://numpy.orgמחשוב נומרי ופעולות מטריצה
פקליטקסלסיגמא-אולדריץ'T7191תרופה המשמשת לאימות אשכולות מבוסס מנגנון
ספריית פנדהאינדקס חבילות Python (PyPI)https://pandas.pydata.orgמניפולציה ועיבוד נתונים
פייתון 3.10קרן התוכנה של פייתוןhttps://www.python.orgשפת תכנות ראשית
רומידפסיןסלק כימיקליםעונה 3020תרופה המשמשת בניתוח סינרגיה
ספריית Scikit-learnאינדקס חבילות Python (PyPI)https://scikit-learn.orgכלי מידול ועיבוד מקדים של למידת מכונה
ספריית סיבורןאינדקס חבילות Python (PyPI)https://seaborn.pydata.orgויזואליזציה של נתונים ושרטוט סטטיסטי
ספריית SHAPאינדקס חבילות Python (PyPI)https://shap.readthedocs.ioיכולת פירוש מודל AI הניתנת להסבר
נתוני סינרגיה (DrugComb)FIMM, פינלנדhttps://drugcomb.fimm.fiמערך נתונים של התייחסות לסינרגיה של תרופות
נתוני סינרגיה (SynergyDB)אוניברסיטת חרונינגןhttps://synergy.bioinformatics.nlמערך נתונים של התייחסות לסינרגיה של תרופות
טנסור פלו - TensorFlow 2.11גוגלhttps://www.tensorflow.orgיישום מודל למידה עמוקה של מקודד אוטומטי
וינבלסטיןסיגמא-אולדריץ'V1377תרופה המשמשת בניתוח סינרגיה
ספריית XGBoostאינדקס חבילות Python (PyPI)https://xgboost.readthedocs.ioמידול רגרסיה מגביר שיפוע

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

Breast CancerDrug DiscoveryMachine LearningDrug SensitivityXGBoost ModelAutoencoder PipelineDrug SynergySHAP AnalysisPrecision OncologyPharmacological Clustering

מאמרים קשורים