האימוץ הנרחב של טכנולוגיות ריצוף בתפוקה גבוהה השפיע באופן משמעותי על הבנתנו את הביולוגיה וההטרוגניות של הסרטן1. התקדמות פורצת דרך זו בביוטכנולוגיה לא רק העמיקה את הידע המדעי שלנו אלא גם חוללה מהפכה בתחום המחקר הרפואי. על ידי מתן אפשרות למדענים לרצף כמויות גדולות של חומר גנטי במהירות ובדייקנות, ריצוף בתפוקה גבוהה האיץ את גילוי הגנים, המוטציות והמסלולים הביולוגיים החדשים. גוף הולך וגדל של מחקרים תיאר חתימות מולקולריות ספציפיות הקשורות להתקדמות המחלה, פרוגנוזה של המטופל והיענות טיפולית מנתוני ריצוף 2,3,4. חתימות ספציפיות אלה מציעות נוף מקיף של הבנת רשת הרגולציה התעתיקית העומדת בבסיס הביולוגיה של הגידול, כולל מקור הגידול, התמיינות, הגירה ועמידות לטיפול5. מאפיינים אלה הם לעתים קרובות מגוונים ומגוונים, ומקיפים פנים מרובות ולא מוגבלים לתערוכה אחת. זה מקשה על סינון וזיהוי גנים ספציפיים הקשורים מאוד למחלה. לפיכך, יש צורך דחוף באסטרטגיות חישוביות הגיוניות לסינון גנים חיוניים המעורבים במחלות.
למידת מכונה (ML) היא ענף של בינה מלאכותית המתמקד בבניית מערכות שיכולות ללמוד ממערכי נתונים מורכבים, לזהות דפוסים ולפתח מודל חיזוי עם דיוק גבוה כדי לספק התייחסות לקבלת החלטות6. לאחרונה, הפיתוח של מודלים מבוססי למידת מכונה מנתוני טרנסקריפטום לחיזוי תוצאות חולים או אבחון מחלות התקדם במהירות במגוון מחלות 7,8,9,10. הביצועים של מודלים אלה משתנים לרוב בשל מערכי הנתונים והאלגוריתמים השונים המשמשים לאימון. בחירת המודל האופטימלי לניסויים וליישומים קליניים עוקבים התגלתה כאתגר דחוף. גישה בת קיימא כרוכה בהשוואת הביצועים של דגמים שונים ובחירת המבטיח ביותר לשימוש נוסף 7,11. יתר על כן, הגיוון בפרמטרים ובפורמטים של תוצאות הנתמכים במסגרות מחשוב שונות מציב אתגרים משמעותיים לניתוח השוואתי. עם זאת, אין כיום תוכנה המשלבת אלגוריתמים מתקדמים של למידת מכונה כדי להשוות את החוזקות והחולשות של מודלים שונים ולפשט את תהליך בחירת הפרמטרים, מה שמקל על המשתמשים לגשת אליו. לפיכך, יש צורך בפיתוח תוכנה ידידותית למשתמש שיכולה להקל על שילוב נתוני תמלול עם אלגוריתמים מגוונים של למידת מכונה, תוך התייחסות למגבלות הנוכחיות של בחירת סמנים ביולוגיים ופרשנות מודלים. התקדמות כזו תרחיב מאוד את יכולתנו לספק תובנות חשובות בתחומי המחקר הנוכחיים ובסופו של דבר לשפר את תוצאות המטופלים.
במחקר זה, פיתחנו חבילת R בקוד פתוח בשם Mime12, המדגימה ביצועים חזקים על פני מערכי נתונים ומטרתה לייעל את האינטגרציה של מערכי נתונים של טרנסקריפטום עם אלגוריתמים שונים של למידת מכונה, ובכך לפשט את התהליכים הנלווים. כדי לזהות מועמדים פוטנציאליים מנתוני טרנסקריפטום בקנה מידה גדול ולפתח מודלים אופטימליים, Mime מציעה ארבע פונקציות יישום: מודל פרוגנוזה אופטימלי שנבנה על ידי שילוב 10 אלגוריתמים של למידת מכונה; מודל תגובה בינארי שנבנה באמצעות שבעה אלגוריתמים של למידת מכונה; תכונות ליבה הקשורות לפרוגנוזה שזוהו באמצעות שמונה אלגוריתמים של למידת מכונה; והדמיה של הביצועים של כל דגם.