למידת מכונה עם סמנים ביולוגיים רב-מודליים משפרת את חיזוי ומעקב המחלה, ומציעה הבטחה להתקדמות בתחום הבריאות בתחומים שונים, ומשפרת את תוצאות הבריאות באמצעות חיזוי מחלה מדויק.
Research Article
למידת מכונה עם סמנים ביולוגיים רב-מודליים משפרת את חיזוי ומעקב המחלה, ומציעה הבטחה להתקדמות בתחום הבריאות בתחומים שונים, ומשפרת את תוצאות הבריאות באמצעות חיזוי מחלה מדויק.
בכל שנה, אנשים רבים ברחבי העולם מושפעים בהדרגה ממצבים הרסניים של בעיות בריאות כמו מחלות לב, זיהומים בדרכי הנשימה, תפקוד נוירולוגי, לחץ קוגניטיבי, סרטן, שבץ, סוכרת ועוד, מה שמוביל לסיבוכים בריאותיים חמורים ולחריגות נלוות. לכן, ניתוחי בריאות מוקדמים הם קריטיים, שכן הם מאפשרים התערבות בזמן עם טיפולים ממוקדים, מה שעשוי לספק הקלה מיידית ותועלת ארוכת טווח שעשויה להאט את התקדמות המחלה. עקב התהליכים הפתופיזיולוגיים המורכבים והניסויים הקליניים ההטרוגניים במצבים בריאותיים שונים, יש צורך בסמנים ביולוגיים רגישים ורב-מודליים ובגישות חקירה יעילות לזיהוי ומעקב מדויק אחר תוצאות בריאות המטופלים. לכן, אלגוריתמים של למידת מכונה עם קטגוריות וטכניקות שונות נשקלים לחיזוי תוצאות, כולל פרוגנוזה, הערכת סיכונים, סטרטיפיקציה של מטופלים ומעקב אחר מחלות. זרימת העבודה המוצעת מחולקת לשלושה שלבים: השלב הראשון מגדיר את חשיבות הבריאות באמצעות מחקרי מקרה, ואחריו אלגוריתמים מסורתיים של למידת מכונה (ML), גישות מסורתיות של למידה עמוקה (DL), וטכניקות למידה עמוקה מודרניות (TabNet ו-AutoInt) בשלב השני. לבסוף, הניסויים מיושמים כדי להצדיק את התוצאות. עבודה זו מדגישה את קיבוץ המודאליות על ידי שילוב סמנים ביולוגיים מולקולריים, חלבונים, כימיים וגנטיים עם תכונות למידת מכונה מתפתחות. התוצאות מצביעות על שיפור משמעותי בחיזוי הדיוק באמצעות המתודולוגיה המוצעת.
מערכת הבריאות משתמשת יותר ויותר באנליטיקה חזויה כדי לנטר מטופלים ולאבחן תוצאות בריאות בזמן, מה שמקל על טיפול פרואקטיבי ומשפר את תוצאות המטופלים. על ידי שילוב אנליטיקה חזויה עם סמנים ביולוגיים, רופאים יכולים לשפר את דיוק האבחון, לזהות טיפולים יעילים, לעקוב אחר התקדמות הטיפול ולקבל תובנות חשובות על מנגנוני מחלה, מה שמוביל בסופו של דבר להחלטות טיפול מושכלות ויעילות יותר. סמנים ביולוגיים מתייחסים לתכונות של מולקולות ביולוגיות או אינדיקטורים שנמצאים בדגימות, כגון נוזלים ביולוגיים, רקמות, תאים, DNA, RNA, דם ושתן, שמודדים נוכחות או התקדמות מחלה בגוף האדם, ומסייעים להעריך את יעילות הטיפול1.
ההתקדמות ביישום סמנים ביולוגיים מולקולריים ממלאת תפקיד מרכזי ברפואה מותאמת אישית על ידי מדידת מולקולות ספציפיות במדויק לזיהוי בעיות בריאות ייחודיות אצל מטופלים, ומאפשרת אסטרטגיות טיפול ממוקדות מהשלבים הראשוניים2. בהמשך הדרך, גישות רב-מודליות יסייעו לשלב מספר מודאליות של דפוסי מחלה מורכבים, ויאפשרו זיהוי מדויק יותר של פרוגנוזה של מחלות בסרטן ובמחלות ניווניות באמצעות טכניקות אנליטיות חיזויות מתקדמות3. המתודולוגיה המתקדמת עושה שימוש בנתוני מולטי-אומיקס, ביואינפורמטיקה ואלגוריתמים של למידת מכונה, כדי לזהות סמנים ביולוגיים חדשים, המאפשרים פרופיל סיכון ספציפי למטופל ואסטרטגיות טיפול סובייקטיביות למחלות לב וכלי דם (CVDs)ומחלות מורכבות אחרות. השילוב בין סמנים מולקולריים לגישות מולטי-אומיקס טומן בחובו הבטחה לשיפור דיוק האבחון והסטרטיפיקציה הטיפולית במחלות נוירולוגיות5.
עם התקדמות טכניקות הלמידה, סמנים מולקולריים מולטימודליים יכולים לשלב סוגי נתונים מגוונים כדי לזהות סימני מחלה חדשים במצבים בריאותיים שונים, מה שמאפשר אבחון מדויק יותר ואסטרטגיות טיפול מותאמות אישית. בהתבסס על פוטנציאל זה, המחבר בוחן טכניקות למידת מכונה שונות במערכת הבריאות כדי לחזות גורמי סיכון לאבחון מחלות ומדגיש את חשיבותםבענפי בריאות שונים. עם שינוי האבחון והטיפול במחלות, מרפאות התרופות משתמשות יותר ויותר באלגוריתמים לקבלת החלטות כדי לנתח תוצאות בריאות המטופלים ולתת מענה לצרכיהם היומיומיים, מה שמאפשרטיפול מושכל ויעיל יותר. בהסתמך על הצורך הפוטנציאלי באינטגרציה של נתונים רב-מודליים, מחקר זה פיתח סמנים ביולוגיים באמצעות נתונים מולטימודליים (MRI וגנטי) לחיזוי התפתחות והתקדמות מחלת האלצהיימר, והראו שנתונים גנטיים חוזו טוב יותר את התקדמות האלצהיימר בעתיד בקרב נבדקים ביקורתיים תקינים, בעוד שנתוני MRI אפיינו טוב יותר ליקוי קוגניטיבי קל ויציב, ובשילוב של שניהם, וביצועי סיווג באיכות טובהיותר 8.
בהמשך קידום יישום ניתוח נתונים רב-מודליים, למידה עמוקה רב-מודלית עושה שימוש בנתוני ביטוי גנים כדי לזהות תרופות המכוונות לקווי תאים ספציפיים של מולקולות ביולוגיות חדשות, ובכך להסביר כיצד וריאציות גנומיות משפיעות על תגובת הטיפול9. בשילוב עם התקדמות בניתוח נתונים רב-מודלי, סמנים ביולוגיים לא פולשניים, המוערכים באמצעות מדדי AI ו-ML, מתפתחים ככלים מבטיחים לאבחון, עם פרופילי ספציפיות ורגישות משתנים לעומת סמנים פולשניים, בהתאם ליישום הספציפי ולהקשר הנתונים10. בהתאם לחשיבות הגוברת של ניתוח נתונים רב-מודלי, מודלים אנסמבלים של למידה עמוקה (DL) יכולים להתמודד ביעילות עם נתונים מורכבים על ידי שילוב סמנים ביולוגיים חדשניים, כולל אינטראקציות בין גנים לחלבון, כדי לשפר את מחקר הסרטן ולייעל אסטרטגיות טיפול11. ככל שמודלים אנסמבלים של DL ממשיכים לקדם את מחקר הסרטן, אנליטיקה חזויה ממלאת תפקיד מרכזי באבחון וטיפול במחלות על ידי ניתוח כמויות גדולות של נתונים משותפים ממקורות שונים, כולל מצבים בריאותיים מגוונים, כדי לספק סקירה מקיפה של המצב, כגון הערכת סיכונים ואבחון12.
מטרת הפרוטוקול המוצע היא ליישם אלגוריתמים מבוססי למידת מכונה ו-DL שמשלבים את הסמנים הביולוגיים השונים כדי לשפר את הדיוק של ניתוחי שירותי הבריאות. טכניקות חיזוי קונבנציונליות המשתמשות בסמנים ביולוגיים מסתמכות בדרך כלל על נתונים חד-מודליים ומודלים סטטיסטיים ליניאריים, שעשויים שלא ללכוד כראוי את הקשרים המורכבים והלא-ליניאריים המשפיעים על התפתחות המחלה והבדלים אישיים. שילוב כמויות עצומות של נתונים מתצפיות, רשומות בריאות אלקטרוניות, קריאות מעבדה, מדידות פיזיות והערכות קליניות מספק הזדמנות משמעותית לסנתז ולייעל את הערכת הסיכון באבחון מטופלים13. סמנים ביולוגיים ממלאים תפקיד מרכזי ברפואה מדויקת, ומאפשרים טיפול ממוקד בזמן הנכון. בעוד שסמנים ביולוגיים מורכבים ומציבים אתגרים במדידת תת-סוגי מחלות וצמיחה מולקולרית, הם יקרי ערך בהערכת תגובות רעילות בתנאים חריגים שונים, ובכך מסייעים בניתוח נוסף. באמצעות שימוש בסמנים ביולוגיים במהלך תצפית קלינית, אנשי מקצוע בתחום הבריאות יכולים לחזות בצורה מדויקת יותר את התקדמות המחלה ולנטר את תגובות הטיפול. בסופו של דבר, ההתכנסות של סמנים מולקולריים רב-מודליים באנליטיקה רפואית עם בינה מלאכותית מאפשרת זיהוי דפוסים יעיל יותר, תוך התאמה למאפיינים קיימים כדי להפחית את ההשפעה הקלינית.
בהשוואה לגישות מתקדמות, במיוחד לעבודות של סומפאלי ואח' 14, שבהן המחברים הציעו אלגוריתמים למידת מכונה על נתוני גנום, כגון נתונים מטבוליים, אפיגנטיים ופרוטאומיים, והציעו קווים מנחים כלליים לבחירת אלגוריתמים של למידת מכונה. עם זאת, קיימת מגבלה בניתוח הנתונים. בעבודההקיימת 15, שיטות אינטגרציה לא מפוקחות יושמו על נתוני אומיקס, תוך התמקדות באתגרים חישוביים. לעומת זאת, קיימות מגבלות על היקף וניתוח השיטות. יתרה מזאת, הואנג ואחרים כיסו את רוב שיטות ה-DL לניתוח יישומים מגוונים, במטרה להבין את כוחם של ביג דאטה ומסגרות חישוביות. החסרונות כללו חוסר איזון בנתונים, התאמת יתר ובעיות פרשנות. הפרוטוקול המוצע קריטי לטיפול בפער קריטי במחקר ביומרקרים אינטגרטיבי, שכן הטכניקות הנוכחיות אינן מצליחות לשלב בצורה יעילה נתונים ביולוגיים רב-ממדיים ומגוונים. באמצעות שימוש בלמידת מכונה ו-DL מתקדמים המצטיינים בזיהוי דפוסים, בחירת תכונות ומיזוג רב-מודלי, ההגשה המוצעת שואפת לזהות חתימות חיזוי חזקות שמשפרות אבחון מוקדם, פרוגנוזה ואפשרויות טיפול אישיות. פרוטוקול זה מתמודד ישירות עם המגבלה של הערכות ביומרקר מפורקות על ידי הצגת מודל מקיף ומונחה נתונים המאפשר תחזיות בריאות ניתנות להרחבה, פרשנות ורלוונטיות קלינית.
Access restricted. Please log in or start a trial to view this content.
1. תהליך עבודה ניסיוני
איור 1 ממחיש צינור זרימת עבודה מאורגן ומודולרית שנועד לסווג סמנים ביולוגיים מולקולריים לקטגוריות סיכון או אינדיקציה אבחנתית באמצעות טכניקות למידת מכונה ולמידה עמוקה. להלן הסבר מפורט שלב אחר שלב של התהליך:

איור 1: דיאגרמת זרימה של העבודה המוצעת. תהליך העבודה של הבעיה המוצעת מתואר באיור זה. השלבים הם קדם-עיבוד נתונים, הנדסת תכונות, פיתוח מודלים, פיצול, הערכת מודלים באמצעות מדדים וניתוח ביומרקרים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
2. תיאור מערך הנתונים
שם מערך הנתונים הוא all_sequence_variants עם הרחבת csv. יש עמודות עם שמות כמו 'id', 'variation', 'position', 'external_link', 'gene_symbol', 'entrez_gene_id', 'reference', conditions', 'indication_types', כאשר כולן מסוג אובייקט למעט id כסוג int ו-entrez_gene_id כסוג float. מספר השורות הכולל הוא 42818 עם 9 עמודות. יתרה מזאת, למאגר הנתונים יש ערכים אפסיים לשנות, מיקום, external_link, entrez_gene_id, ייחוס, תנאים ו-indication_types. מאגר הנתונים נלקח מהקישור הניתן כך: https://markerdb.ca/downloads17
3. עיבוד מוקדם של מאגר נתונים
בשלב זה, עיבוד נתונים מתחיל באיסוף מידע על מערכי נתונים, תיאור, זיהוי כפילויות ואיתור ערכים חסרים/אפסים. אין השפעה של התכונה external_link כאשר נמדדת על ידי מקדם המתאמ, ולכן היא מוסרת. ערכי האפס של עמודות קטגוריות ועמודות נומריות מלאים בממוצע ובממוצע, בהתאמה. לבסוף, צורת מערך הנתונים של קלט ופלט היא (42787, 6)(42787,). עמודות הקלט הן 'id', 'variation', 'position', 'gene_symbol', 'entrez_gene_id', 'conditions', בעוד שעמודת היעד היא indication_types.
4. סמנים ביולוגיים: קטגוריות, אתגרי נתונים ותפקיד הסיכון המולקולרי
סמן ביולוגי הוא תכונה ניתנת לכימות שמסמנת פעילויות ביולוגיות תקינות או חריגות או תגובות לחשיפות או התערבויות שונות. סמנים ביולוגיים יכולים להיות מולקולריים, היסטולוגיים, רנטגניים או פיזיולוגיים ומחולקים לשבע קטגוריות עיקריות: (1) סמן ביולוגי אבחנתי קובע האם לאדם יש מחלה או הפרעה מסוימת ואם הוא משתייך לתת-סוג, (2) סמן ניטור מציין את התקדמות המחלה ותגובתה לטיפול, (3) סמן תגובה מראה האם המטופל מגיב לתרופה או לטיפול, כגון שינוי בקצב הלב, (4) ביומרקר חיזוי יכול לקבוע האם אדם נמצא בסיכון לפתח מחלה מסוימת וכיצד הוא עשוי להגיב לטיפול מסוים, (5) סמן ביולוגי פרוגנוסטי יכול להציע תובנות לגבי הסבירות להתפתחות או להישנות המחלה אם המטופל נוטה לתוצאה בריאותית מסוימת, (6) ביומרקר סיכון מעריך את רמת הסיכון הפוטנציאלית למצב לפני שהמטופל מקבל אבחנה רשמית, ו-(7) סמן בטיחות מעריך את הפוטנציאל לתגובות רעילות או שליליות שעשויות להיגרם מהטיפול. מחקר זה מתמקד בעיקר בניתוח סמנים ביולוגיים מולקולריים הקשורים להערכת סיכונים ואבחון, כפי שמוצג באיור 2. בהינתן כמות הנתונים הקלינית הרחבה הזמינה ברחבי העולם, סמנים ביולוגיים חיוניים להכוונת החלטות קליניות, קידום מחקר והקלה על רפואה מותאמת אישית.

איור 2: קטגוריית סמן ביולוגי לקבלת החלטות קליניות. החלטות הסמן הביולוגי מיוצגות בדיאגרמה זו. בהתבסס על האנליטיקה המיושמת על הסמנים הביולוגיים, נלקחות בחשבון החלטות קליניות, ומיושמים אלגוריתמים ללמידת מכונה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
מציאת והבנת מידע קליני שימושי על סמנים ביולוגיים היא מאתגרת בשל המגוון הרחב של סוגי סמן, מאפיינים ואיכות. הצמיחה המהירה של מחקרי סמנים ביולוגיים בעשרים השנים האחרונות סיבכה עוד יותר את הגישה לנתונים מקיפים ועדכניים, במיוחד עבור סמנים מולקולריים. דבר זה הוביל לבעיות כמו ממצאים לא עקביים, גילוי חוזר של סמנים ביולוגיים קיימים, תוצאות סותרות והזדמנויות מוזנחות לשימוש בסמנים ביולוגיים מבוססים18. הופעת מדידות "אומיקס" החריפה את הבעיה, וגרמה להתפשטות של סמנים ביולוגיים מולקולריים חדשים בבדיקות קליניות ובספרות, מה שמקשה יותר ויותר על ניווט ויישום ידע ביומרקים ביעילות19.
MarkerDB 2.0 מספק גישה לסמנים מולקולריים מגוונים למטרות ניסוי20. סמנים ביולוגיים שונים משמשים במחקר קליני וביישומים רפואיים לאבחון, חיזוי ומעקב אחר מחלות. ביניהם, סמנים ביולוגיים חלבונים משתמשים בנוזלים ביולוגיים כגון סרום, דם, נוזל מוח-שדרה (CSF), נוזל פריטונאלי, מי שפיר, פלזמה ושתן לניתוח מצבים כמו סוכרת, שחפת, תסמונת דאון והפרעות הקשורות למיופתיה. באופן דומה, סמנים גנטיים משתמשים בסמלים גנים כמו LRP1, LPP, MAPT ו-SPI1 כדי לנתח מצבים כמו ניוון מקולרי הקשור לגיל, מחלות אלרגיות, מחלת אלצהיימר, סרטן ואסטמה. יתרה מזאת, סמנים מולקולריים רב-מודליים מסייעים במדידת סיכון ומדדי אבחוןלמטופלים 21. עבודה זו מדגישה את הצורך באנליטיקה רפואית המשתמשת בגישות למידת מכונה לשיפור אבחון, חיזוי וטיפול מותאם אישית.
5. מידול גישות סטטיסטיות של למידת מכונה לגילוי סמנים ביולוגיים
יישום גישות למידת מכונה שינה את תחום הבריאות בדרכים רבות. באופן ספציפי, סמנים ביולוגיים מולקולריים נותחו באמצעות טכניקות ML שונות, כולל ניתוח רכיבים עיקריים (PCA), אשכולות K-means (KMA), ניתוח שכן קרוב (NNA) ואלגוריתמים של רשתות עצביות22. מודלים אלו מזהים דפוסים מורכבים מתכונות שנבחרו, מנהלים נתונים לא שלמים או לא עקביים, ותומכים במעקב בזמן אמת אחר התקדמות המחלה. בנוסף לאבחון מחלות, אלגוריתמים של למידת מכונה מספקים תובנות משמעותיות לגבי בעיות מטופלים באמצעות בדיקת נתונים והדמיה, ומאפשרים טיפול מהיר וממוקד23. כתוצאה מכך, הדבר משפר את תוצאות הבריאות של המטופלים במצבים חריגים. יתרה מזאת, היכולת של למידת מכונה לחולל מהפכה בגילוי סמנים ביולוגיים ותוצאות טיפוליות במחלות שונות, כולל ניתוח סמנים מולקולריים, הופכת ליותר ויותר תוססת.
אלגוריתמים של למידת מכונה מסווגים לחמישה סוגים עיקריים, כפי שמוצג באיור 3. למידה מפוקחת היא תהליך של אימון על מערכי נתונים מסומנים להבנת יחסי קלט-פלט, מה שהופך אותו לאידיאלי למשימות כמו סיווג ורגרסיה, כמו עצי החלטות ומכונות וקטוריות תומכות. למידה ללא פיקוח מזהה דפוסים בתוך נתונים לא מתויגים, ולעיתים קרובות מיושמת לאשכול ולהפחתת ממד, באמצעות טכניקות כמו קיבוץ k-ממוצעים וניתוח רכיבים עיקריים. למידה חצי-מפוקחת משלבת גם נתונים מסומנים וגם לא מסומנים ליצירת תחזיות. למידת חיזוק מתמקדת בקבלת החלטות המבוססת על משוב מהסביבה, ומשמשת לעיתים קרובות במשחקים ורובוטיקה, עם שיטות כמו למידת Q ורשתות למידה עם חיזוק עמוק. למידה עמוקה עושה שימוש ברשתות עצביות מלאכותיות עם שכבות מרובות כדי לזהות דפוסים מורכבים בנתונים. טכניקה זו מסייעת בחיזוי סמנים ביולוגיים למחלות נפוצות, כולל סרטן, שבץ, מחלת אלצהיימר ומחלת פרקינסון. יישומים רבים שאושרו קלינית עושים שימוש בטכנולוגיה זו24,25. האבחנה המדויקת של מטופלים עם גידולים ממאירים תלויה בדרך כלל ברכישת וניתוח פתולוגי של דגימות רקמה, המפיקות מידע קריטי לגבי דרגת גידול, תת-סוג, שלב וביומרקרים נוספים של גידול.

איור 3: סיווג אלגוריתמים של למידת מכונה לקבלת החלטות קליניות. סוגי האלגוריתמים של למידת מכונה בדיאגרמה מוצגים כדי לסייע בהבנת המתודולוגיה המיושמת. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
סטטיסטיקה ולמידת מכונה הן שתי תחומים נפרדים שמצטלבים לעיתים קרובות. סטטיסטיקה כוללת איסוף, ניתוח ופירוש נתונים, בדרך כלל עבודה עם מאגרי נתונים קטנים ומוגדרים היטב, ומתמקדת בעיקר בהשוואה וסיכום מידע. מצד שני, למידת מכונה היא תת-תחום של בינה מלאכותית שיוצרת מודלים חיזויים, לעיתים עוסקים במאגרי נתונים גדולים ומורכבים. בעוד שסטטיסטיקה ממלאת תפקיד חשוב במחקר מאשר ובהבנת המנגנונים הבסיסיים, למידת מכונה יעילה יותר במחקר חקרני, גילוי דפוסים מורכבים וניהול נתונים חסרים. שיטות כמו רגרסיה לוגיסטית ניתנות לראות גם כמודלים סטטיסטיים וגם כמודלים מפוקחים של למידת מכונה, הממחישות את ההבדלים המטושטשים בין שני התחומים. בסופו של דבר, החוקרים חייבים להעריך את מטרות המחקר שלהם ואת אופי הנתונים שלהם כדי לבחור את השיטה המתאימה ביותר.
6. מידול MLP ווריאציות של MLP
MLP, הידוע גם כפרספטרון רב-שכבתי, הוא סוג של ארכיטקטורת רשת עצבית הכוללת שכבות נוירון מרובות בין שכבות הקלט והפלט, כפי שמודגם באיור 4. MLP הוצג בשנות ה-50 וזכה לשימוש נרחב עם ההתקדמות וההתקדמות בהפצה בשנות ה-80, מה שסייע לצמצם את האובדן. עקרונות הלמידה הבסיסיים של MLP הם רשתות עצביות, משקלים וערכי הטיה לחישוב הפלט. לבסוף, לדעת את פונקציית ההפעלה ואת ערך הסף כדי לקבל את הפלט בשכבת הפלט. במתודולוגיה המוצעת, הצמתים בשכבת הקלט, השכבה הנסתרת ושכבת הפלט תואמים לתכונות קליניות וגנטיות, שכבות מחוברות במלואן עם הפעלת ReLU, ונוירון יחיד עם הפעלה סיגמואידי לחיזוי התוצאה הבינארית של סוג אינדיקציה (סיכון, אבחון), בהתאמה. היתרונות העיקריים הם שהם פשוטים לאימון ולפענוח. עם זאת, ה-MLP הפשוט אינו יכול להתמודד עם מערכי נתונים גדולים ורגיש לקצב למידה26. לכן, כדי להתגבר על חסרונות אלו, MLP עם מתזמן קצבי למידה נלקח בחשבון עם הארכיטקטורה המוצגת באיור 3B. MLP עם LR הוא מנגנון דינמי עוצמתי עם דעיכה תלולה, דעיכה אקספוננציאלית, דעיכה בזמן הפוך, ReduceLROnPlateau, ואנילינג קוסינוס. במקום ערך LR קבוע, קצב הלמידה משתנה בהתאם לביצועי המודל ולאימון.

איור 4: מידול Perceptron רב-שכבתי ו-MLP עם מתזמן LR. (א) פרספטרון רב-שכבתי: מבנה ה-MLP מודגם בשכבת קלט, שכבה נסתרת ושכבת פלט. השכבה הראשונה מקבלת את הקלט ומעבדת אותו בשכבה השנייה באמצעות הפעלה, והפלט מתקבל בשכבה האחרונה. MLP פשוט ליישום. (B) MLP עם מתזמן LR: זה דומה ל-MLP; עם זאת, מתווסף מתזמן קצב למידה כדי לשלוט במהירות האימון ולקבל קצב התכנסות טוב יותר. קצב הלמידה יורד ברמת רמה נמוכה. זה מפחית את המינימום של חריגה מדי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
גישה זו יעילה, אמינה ואפקטיבית יותר עבור נתונים טבלאיים. בנוסף, ישנם יתרונות כמו שיפור בהתכנסות יציבה בנתונים רועשים, הכללה משופרת והפחתת המאמץ בכוונון היפרפרמטרים. עם זאת, עבור משימות חיזוי מסוימות, עלולות להתעורר קשיים, כמו להיתקע במינימום מקומי. יתרה מזאת, בארכיטקטורת MLP הרחבה והעמוקה המוצגת באיור 5, רכיבים רחבים ועמוקים מוכנסים ל-MLP כדי להצטיין במיפוי קורלציה, שינון כללים ולמידת דפוסים חדשים, תוך שמירה על סטנדרטים גבוהים של הכללה. על ידי שילוב היבטים אלה בשכבת הפלט, הפלט הבינארי צפוי27. עם זאת, קיימות מגבלות להכללה של תכונות בלתי נראות ולהכללה מופרזת. לסיכום, MLP עם Batch Norm ו-Dropout משמש לנרמול תהליך ההכשרה, תוך שילוב Dropout ללמידה והכללה של תכונות לא ידועות. במיוחד, טכניקה זו יכולה להיות מיושמת על נתונים בממדים גבוהים ומסייעת למנוע התאמת יתר. עם זאת, טכניקה זו סובלת ממגבלות גודל אצווה, צריכת זיכרון מוגברת (עקב שכבות נורמליזציה באצווה), ואינה פתרון אוניברסלי28,29.

איור 5: מידול רשת MLP רחבה ועמוקה. התרשים ממחיש את המסלול העמוק של ה-MLP, שיכול ללכוד קשרים לא ליניאריים ומשלב את הפלט עם יחידת סיגמואיד לסיווג. ארכיטקטורה זו לוכדת למידת דפוסים וידע עבור נתוני סמנים ביולוגיים הטרוגניים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
7. טאבנט
ה-TabNet הוא מודל למידה עמוקה הידוע בשם Tabular Network שפותח על ידי צוות המחקרשל Google 30. המוטיבציה העיקרית של מודל TabNet היא ליישב את ההבדלים בין גישות DL לגישות תמונה, טקסט, דיבור (CNN, Autoencoder, Transformers) ולמידת מכונה מבוססת עץ (XGBoost, Random Forest, LightGBM). יתרה מזאת, המגבלות של גישות DL משפיעות רבות על מודל TabNet, כאשר MLP הוא מודל פרמטרי מסודר. מעל לכל, גישות ה-DL חסרות פרשנות בבעיות מהעולם האמיתי, למידה בפיקוח עצמיויכולת למידה רציפה. מודלי TabNet מוגבלים ליישומים כמו חיזוי סיכון ביטוחי32, הערכת תכולת אפר פחם33, חיזוי רעילות כימית34, וזיהוי רמאות במבחנים חינוכיים35. הארכיטקטורה של TabNet מוצגת באיור 6.

איור 6: מידול רשת טבלאות. רשת הטבלה לוקחת תכונות קלט בפורמט טבולרי ומיישמת את טכניקת השנאי באופן רציף בכל בלוק. בלוק ה-GLU, הידוע גם כבלוק היחידה הליניארית השוגרת, שולט בזרימת המידע קדימה ברשת, ומקל על בחירת תכונות ולמידה יציבה. הפלט מוצג בשכבת הפלט מתוך הפלט המצטבר. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
מהדיאגרמה הארכיטקטורה שלמעלה, המערכת מחולקת לארבעה רכיבים: בלוק קלט, טרנספורמר תכונות משותף, שלבי החלטה סדרתיים, וחישוב ההפסדים באמצעות אופטימיזציה. בתכונות הקטגוריות, התכונות מומרת למספרים שלמים לאחר שכבת ההטמעה. במקביל, התכונות הרציפות נלקחות כפי שהן. לבסוף, התכונות מומרת לווקטור תכונות מאוחד כאשר x ∈ Rd. בשלב הבא מיושמות שכבות מחוברות לחלוטין עם פונקציות הפעלה, ואחריהן טרנספורמציה להמרת הנתונים לווקטור, ומתקבלת החלטה. בשלב השלישי משתמשים בזה אחר זה בטרנספורמטור הקשב, המסכה, שנאי ההחלטה והצטברות החיזוי. המטרות של שלב זה הן תשומת לב סלקטיבית, חשיבה סדרתית ומסלולי החלטה. בשלב האחרון, משתמשים בשיטות חוצה-אנטרופיה בינארית או דומות כדי למצוא את האובדן ולייעל את הערך. בנוסף, רגולריזציה מתבצעת באמצעות תשומת לב מועטה למניעת התאמת יתר.
8. אוטואינט
למידת אינטראקציה אוטומטית עם תכונות באמצעות רשתות עצביות קשובות עצמית (AutoInt) היא הצורה המלאה של AutoInt, שהוצגה בחיזוי קצב הלחיצה (CTR)36 והחלה מאוחר יותר על יישומים שונים, כולל חיזוי תקלות תוכנה37, מערכות המלצה38, וזיהוי גנום39. קיימות מגבלות בגישות הקיימות ל-ML, כולל טיפול בנתונים דלילים מממד גבוה, תכונות קומבינטוריות מסדר גבוה, הבנת יכולת החיזוי של התכונה, והצורך בהנדסת תכונות ידנית. כל האתגרים שהוזכרו מטופלים על ידי מודל AutoInt ביעילות, יעילות והסבר. המטרה של AutoInt במתודולוגיה המוצעת היא לחזות האם הווריאנט הנתון הוא מסוג סיכון או סוג אינדיקציה אבחנתית. מוצעים שבעה שלבים עבור מאגר הנתונים הנתון, כפי שמוצג באיור 6, יחד עם קוד המקור. ראשית, קריאת נתונים ועיבוד מוקדם מיושמים כדי לקודד את כל התכונות הקטגוריות כמספרים שלמים ולמפות את התוויות ל-0 ו-1 עבור סיכון ואבחון, בהתאמה. בשלב השני, מתבצע ייצוג תכונות ליצירת מטריצת ההטמעה; בתורה, המטריצה מומרת לנרמול התכונות המספריות. ישנן שכבות אינטראקטיביות שבהן האינטראקציה האוטומטית הנייטרלית בין התכונות נלמדת ללא אינטראקציה ידנית עם הטרנספורמרים. יתרה מזאת, ראשים מרובים לומדים סוגים שונים של אינטראקציות, ולבסוף, התכונות מחוברות, מה שמשפר את הייצוג. קיימים חיבורים שאריתיים כדי ללמוד אינטראקציות מדרגה נמוכה וגבוהה, כמו תכונה אחת, 2 תכונות, 3 תכונות וכדומה. לבסוף, מהרשת השאריתית, הפלטים מועברים לפונקציית הסיגמואיד עבור חישובי ערכים בינאריים, כפי שמוצג באיור 7.

איור 7: מידול רשת AutoInt. רשת AutoInt לומדת אוטומטית תכונות, כאשר שכבת ההטמעה לוקחת את התכונות וממפה אותן לשכבה הבאה באמצעות מנגנון תשומת לב עצמית וחיבורים שאריים. הרכיב האחרון כולל את שכבת MLP ופונקציות הפעלה ליצירת הפלט. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
Access restricted. Please log in or start a trial to view this content.
הניסויים מתבצעים באמצעות גישות למידת מכונה ו-DL להשוואה בין ביצועיהם. במקביל, נשקלת יצירת מודלים של למידת מכונה המשתמשים במנגנוני למידה מפוקחים ובלתי מפוקחים. הטכניקות המפוקחות במתודולוגיה זו הן רגרסיה לוגיסטית, עץ החלטות, יער אקראי, הגברת גרדיאנט, מכונת וקטור תמיכה, ואלגוריתמים של K-שכן הקרוב ביותר. האלגוריתמים הללו נעים ממודלים סטטיסטיים פשוטים ועד ניתוחים מורכבים מבוססי עצים. מצד שני, אלגוריתמים של למידת מכונה לא מפוקחים הם K-Means Clustering, DBSCAN Clustering, וטכניקות אשכולות אגלומ...
Access restricted. Please log in or start a trial to view this content.
העבודה המוצעת דנה בבירור בחשיבות הסמנים הביולוגיים בזיהוי ומעקב אחר מחלה ומאפייניה. הגישה המוצעת למתודולוגיית סמנים ביולוגיים מבוססת על ארבעה שלבים חיוניים: הכנת נתונים קפדנית (ניקוי, קידוד, הסרת מזהים); קידוד מטרה אחיד (סיכון=0, אבחון=1); נורמליזציה של תכונות והטמעה עמוקה באיכות גבוהה לדגמים כמו AutoInt37/TabNet; ושלמות תהליך הערכה יציבה (מחלקת רכבות/בדיקות מתאימה, דיווח מטרי נכון). יתרה מזאת, הוויתור למחלה באמצעות גנים נחזה בתמיכת אלגוריתמים של ML ו-DL. האלגורית...
Access restricted. Please log in or start a trial to view this content.
למחברים אין מה לחשוף.
המחברים לא קיבלו מימון חיצוני.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| מודל AutoInt | אוניברסיטת פקין | https://github.com/shichence/AutoInt | למידת אינטראקציה אוטומטית בין תכונות באמצעות רשתות עצביות קשובות עצמית: אלגוריתם יעיל ללמידה אוטומטית בין אינטראקציות תכונות מסדר גבוה עבור תכונות קטגוריות ומספריות (דלילות) |
| deepctr_torch.models | קוד פתוח | https://github.com/shenweichen/DeepCTR-Torch | חבילת מודולרית ומורחבת של מודלים מבוססי למידה עמוקה לבניית מודל מותאם אישית בקלות. |
| Google Colaboratory | גוגל | https://colab.research.google.com/ | מבוסס ענן סביבה לכתיבה וביצוע קוד פייתון דרך הדפדפן ללמידת מכונה וניתוח נתונים |
| קראס 2.6.0 | קראס | https://keras.io/ | מספק ממשק פייתון להרצת רשתות עצביות שרץ מעל Tensorflow |
| MarkerDB 2.0 | MarkerDB | https://markerdb.ca/downloads | מאגר נתונים ציבורי של סמנים מולקולריים |
| Matplotlib 3.4.3 | Matplotlib | https://matplotlib.org/ | ספריית ויזואליזציה לפייתון |
| Numpy 1.21.4 | נאמפי | https://numpy.org/ | חבילת יסוד למחשוב מדעי עם פייתון |
| פנדות 1.3.4 | פנדות | https://pandas.pydata.org/ | כלי ניתוח ומניפולציה של נתונים בקוד פתוח עוצמתי, גמיש וקל לשימוש, שנבנה על גבי שפת התכנות פייתון. |
| פייתון 3.8.10 | קרן התוכנה של פייתון | https://www.python.org/ | שפות תכנות פופולריות שמשלבות מערכות למידה עמוקה בצורה יעילה יותר. |
| pytorch_tabnet.tab_model | פייטורץ' | https://pypi.org/project/pytorch-tabnet/ | ליישום בעיות סיווג בינארי/רב-מחלקתי ורגרסיה. |
| Scikit-learn | Scikit-learn | https://scikit-learn.org/stable/ | מודול פייתון לאלגוריתמים של למידת מכונה |
| סיבורן | סיבורן | https://seaborn.pydata.org/ | ספריית ויזואליזציה של נתונים ברמה גבוהה לציור גרפיקה סטטיסטית אטרקטיבית ומעשירה |
| מודל TabNet | גוגל | https://github.com/dreamquark-ai/tabnet | TabNet היא רשת עצבית מקצה לקצה שנועדה לטפל ישירות בנתונים טבולריים |
| טנסורפלו 2.6.0 | גוגל | https://www.tensorflow.org/ | פלטפורמה מקצה לקצה ללמידת מכונה |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission