אנו מציגים זרימת עבודה גמישה וניתנת להרחבה המבוססת על מעבדת יופיטר לניתוח ללא פיקוח של מערכי נתונים מורכבים של מולטי-אומיקס, המשלבת שלבים שונים של עיבוד מקדים, הערכה של מודל ניתוח הגורמים הרב-אומיקס ומספר ניתוחים במורד הזרם.
מאמר שיטה
אנו מציגים זרימת עבודה גמישה וניתנת להרחבה המבוססת על מעבדת יופיטר לניתוח ללא פיקוח של מערכי נתונים מורכבים של מולטי-אומיקס, המשלבת שלבים שונים של עיבוד מקדים, הערכה של מודל ניתוח הגורמים הרב-אומיקס ומספר ניתוחים במורד הזרם.
מנגנוני מחלה הם בדרך כלל מורכבים ונשלטים על ידי אינטראקציה של מספר תהליכים מולקולריים שונים. מערכי נתונים מורכבים ורב-ממדיים הם משאב רב ערך ליצירת תובנות נוספות לגבי תהליכים אלה, אך הניתוח של מערכי נתונים כאלה יכול להיות מאתגר בשל המימדיות הגבוהה הנובעת למשל ממצבי מחלה שונים, נקודות זמן ואומיקה הלוכדת את התהליך ברזולוציות שונות.
כאן, אנו מציגים גישה לנתח ולחקור מערך נתונים מורכב כזה של מולטיומיקה באופן בלתי מפוקח על ידי יישום ניתוח גורמים מולטי-אומיים (MOFA) על מערך נתונים שנוצר מדגימות דם הלוכדות את התגובה החיסונית בתסמונות כליליות חריפות וכרוניות. מערך הנתונים מורכב ממספר בדיקות ברזולוציות שונות, כולל נתוני ציטוקינים ברמת הדגימה, פלזמה-פרוטאומיקה ונויטרופילים ראשוניים-seq, ונתוני RNA-seq חד-תאי (scRNA-seq). מורכבות נוספת מתווספת על ידי כך שנמדדו מספר נקודות זמן שונות לכל מטופל וכמה תת-קבוצות של מטופלים.
זרימת העבודה של הניתוח מתארת כיצד לשלב ולנתח את הנתונים במספר שלבים: (1) עיבוד מראש של נתונים והרמוניזציה, (2) הערכה של מודל MOFA, (3) ניתוח במורד הזרם. שלב 1 מתאר כיצד לעבד את התכונות של סוגי הנתונים השונים, לסנן תכונות באיכות נמוכה ולנרמל אותן כדי ליצור הרמוניה בין ההפצות שלהן לניתוח נוסף. שלב 2 מראה כיצד ליישם את מודל MOFA ולחקור את מקורות השונות העיקריים בתוך מערך הנתונים בכל האומיקה והתכונות. שלב 3 מציג מספר אסטרטגיות לניתוח במורד הזרם של הדפוסים שנלכדו, ומקשר אותם לתנאי המחלה ולתהליכים המולקולריים הפוטנציאליים השולטים בתנאים אלה.
בסך הכל, אנו מציגים זרימת עבודה לחקירת נתונים ללא פיקוח של מערכי נתונים מולטי-אומיים מורכבים כדי לאפשר זיהוי של צירי וריאציה עיקריים המורכבים מתכונות מולקולריות שונות שניתן ליישם גם בהקשרים אחרים ובמערכי נתונים רב-אומיים (כולל בדיקות אחרות כפי שהוצגו במקרה השימוש לדוגמה).
מנגנוני מחלה הם בדרך כלל מורכבים ונשלטים על ידי אינטראקציה של מספר תהליכים מולקולריים שונים. פענוח המנגנונים המולקולריים המורכבים המובילים למחלות ספציפיות או שולטים באבולוציה של מחלה היא משימה בעלת רלוונטיות רפואית גבוהה מכיוון שהיא עשויה לחשוף תובנות חדשות להבנה וטיפול במחלות.
ההתקדמות הטכנולוגית האחרונה מאפשרת למדוד תהליכים אלה ברזולוציה גבוהה יותר (למשל, ברמת התא הבודד) ובשכבות ביולוגיות שונות (למשל, DNA, mRNA, נגישות כרומטין, מתילציה של DNA, פרוטאומיקה) בו זמנית. זה מוביל לדור הולך וגדל של מערכי נתונים ביולוגיים רב-ממדיים גדולים, שניתן לנתח במשותף כדי להפיק תובנות נוספות לגבי התהליכים הבסיסיים. יחד עם זאת, שילוב וניתוח מקורות הנתונים השונים באופן בעל משמעות ביולוגית נותר משימה מאתגרת1.
מגבלות טכנולוגיות, רעשים וטווחי שונות שונים בין אומיקה שונים מציבים אתגר אחד. לדוגמה, נתוני ריצוף RNA חד-תאי (scRNA-seq) הם דלילים מאוד ומושפעים לעתים קרובות מהשפעות טכניות או אצווה גדולות. בנוסף, מרחב התכונות הוא לעתים קרובות גדול מאוד, ונע על פני כמה אלפי גנים או חלבונים שנמדדו, בעוד שגודל הדגימה מוגבל. זה מסובך עוד יותר על ידי תכנונים מורכבים, שעשויים לכלול מספר מצבי מחלה, גורמים מבלבלים, נקודות זמן ורזולוציות. לדוגמה, במקרה השימוש המוצג, סוגי נתונים שונים היו זמינים ברמת תא בודד או מדגם (בתפזורת). מלבד זאת, הנתונים עשויים להיות חלקיים, ולא כל המדידות עשויות להיות זמינות עבור כל הנבדקים שנותחו.
בשל אתגרים אלה, אומיקה שונה ותכונות כלולות עדיין מנותחות לעתים קרובות רק בנפרד2 למרות שביצוע ניתוח משולב אינו יכול רק לספק תמונה מלאה של התהליך, אלא רעשים ביולוגיים וטכניים מאומיקה אחת עשויים להיות מפוצים גם על ידי אומיקה אחרת 3,4. מספר שיטות שונות הוצעו לביצוע ניתוח משולב של נתונים מולטי-אומיקס, כולל שיטות בייסיאניות, שיטות מבוססות רשת 5,6, למידה עמוקה רב-מודאלית7 ושיטות הפחתת ממדיות באמצעות פקטורליזציה של מטריצה 8,9. עבור האחרון, התוצאות של מחקר השוואת ביצועים גדול10 הראו את שיטת MOFA9 (ניתוח גורמים multi-omic) כאחד הכלים המתאימים יותר כאשר הנתונים צריכים להיות מקושרים ביאורים קליניים.
במיוחד בסביבות מורכבות, שיטות פירוק לגורמים של מטריצה ללא פיקוח הן גישה שימושית להפחתת המורכבות ולחילוץ אותות משותפים ומשלימים ממקורות נתונים ותכונות שונות. על ידי פירוק המרחב המרוכב לייצוגים סמויים מדרגה נמוכה יותר, ניתן לחקור במהירות את מקורות השונות העיקריים בתוך הנתונים ולקשר אותם לקובריאטים ידועים. במקרה שאותו דפוס של שונות משותף על פני תכונות מרובות (למשל, גנים או חלבונים), זה עשוי להיות מצטבר למספר גורמים בזמן שהרעש מופחת. ניתן להשתמש ברגולציה כדי להגדיל את הדלילות של מקדמי המודל, מה שהופך את הגישה למתאימה היטב בהגדרות שבהן מרחב התכונות גדול בעוד שמספר הדגימות מוגבל9.
פרוטוקול זה מציג זרימת עבודה גמישה של ניתוח המשתמש במודל MOFA כדי להציג כיצד לחקור במהירות מערך נתונים מורכב של מולטי-אומיקס ולזקק את דפוסי השונות העיקריים המאפיינים מערך נתונים זה. זרימת העבודה מורכבת משלושה שלבים עיקריים. בשלב הראשון, עיבוד מראש של נתונים והרמוניזציה, מוצגות אסטרטגיות שונות לעיבוד מקדים של נתונים המבוססים על סוגי נתוני קלט שונים (scRNA-seq, פרוטאומיקה, ציטוקינים, נתונים קליניים). הפרוטוקול מפרט כיצד לעבד את התכונות של מערכי נתוני הקלט השונים, לסנן תכונות באיכות נמוכה ולנרמל אותן כדי ליצור הרמוניה בין ההתפלגויות שלהן. אנו גם מראים כיצד החלטות קדם-עיבוד אלה עשויות להשפיע על התוצאות במורד הזרם. בשלב השני, מודל MOFA מוחל על הנתונים, וניתן להשתמש בפירוק השונות המתקבל כדי להעריך את השילוב של מערכי הנתונים השונים. השלב השלישי מראה כיצד לקשר את הגורמים שנלכדו למשתנים משותפים ולחשוף את התוכניות המולקולריות המגדירות גורמים אלה. בעזרת זרימת העבודה שהוצגה, הצלחנו לחלץ מספר גורמים סמויים הקשורים לקו-משתנים קליניים במערך נתונים של חולים הסובלים מתסמונות כליליות ולזהות תוכניות חיסון רב-תאיות פוטנציאליות מפרויקט קודם11. אנו נשתמש במערך נתונים זה כאן, אך ניתן להחיל את הפרוטוקול בקלות על הקשרים אחרים, כולל omics אחרים.
מערך הנתונים מורכב מדגימות ממטופלים עם תסמונות כליליות כרוניות יציבות (CCS), תסמונות כליליות חריפות (ACS) וקבוצת ביקורת עם מחלות לב כליליות בריאות (שאינן CCS) (איור 1). ACS נגרמת על ידי קרע פלאק ב- CCS קיים, המוביל להפרעה חריפה של זרימת הדם לשריר הלב ופגיעה איסכמית של הלב לאחר מכן. פגיעה זו גורמת לתגובה דלקתית של מערכת החיסון ולאחריה שלב מתקן, שנמשך עד מספר ימים לאחר האירוע החריף12. כדי לאפיין תגובה חיסונית זו עבור חולי ACS, דגימות דם נלקחו בארבע נקודות זמן שונות: אקוטי (TP1); לאחר חידוש (14 [± 8] ח) (TP2); 60 [± 12] שעה מאוחר יותר (TP3); לפני השחרור (6.5 [±1.5] ימים) (TP4) (איור 1A). עבור CCS וחולים עם מחלות לב כליליות בריאות, רק נקודת זמן אחת הייתה זמינה- (TP0). עבור כל החולים ונקודות הזמן נמדדו בדיקות שונות המבוססות על דגימות הדם: סמנים קליניים של דלקת (קריאטין-קינאז (CK), CK-MB, טרופונין, חלבון מגיב C (CRP)), scRNA-seq של תאי דם חד-גרעיניים היקפיים (PBMCs), ניתוח ציטוקינים, פרוטאומיקה פלזמה ונתוני Prime-seq13 של נויטרופילים.

איור 1: ערכת נתונים של קלט מולטי-אומי של אוטם שריר הלב. ערכת נתוני קלט: הנתונים המנותחים כוללים דגימות דם מחולים (n = 62) עם תסמונת כלילית חריפה (ACS), תסמונות כליליות כרוניות (CCS) וחולים עם כליליים בריאים (שאינם CCS). עבור חולי ACS דגימות דם נכללו בארבע נקודות זמן שונות (TP1-4), עבור CCS וחולים שאינם CCS בנקודת זמן אחת (TP0). כל שילוב של מטופל ונקודת זמן מטופל כמדגם נפרד בניתוח. בדיקות OMIC שונות נמדדו על הדגימות: בדיקות דם קליניות (n = 125), scRNA-seq (n = 121), פלזמה-פרוטאומיקה (n = 119), בדיקת ציטוקינים (n = 127) ונויטרופילים prime-seq (n = 121). לאחר מכן, הפרוטוקול המתואר יושם כדי לשלב את הנתונים בכל האומיקה ולחקור אותם באמצעות מודל MOFA וניתוח במורד הזרם (ניתוח גורמים, העשרת מסלולים). אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
כקלט עבור זרימת העבודה כפי שמוצג כאן, אנו לוקחים ספירות גולמיות מנתוני scRNA-seq לאחר עיבוד עם cellranger ובקרת איכות (QC) כמתואר לדוגמה, במדריך העיבוד מראש של scanpy14 . עבור ביאור מסוג תא, השתמשנו בצינור Azimuth15 האוטומטי. לאחר מכן הספירות נצברות ברמת המדגם עבור כל סוג תא על-ידי לקיחת הממוצע על פני כל התאים עבור כל דגימה וסוג תא (צבירה פסאודו-בתפזורת). פלזמה-פרוטאומיקה נכללת כעוצמות מנורמלות וממוקדות חציון, ועבור נויטרופילים, אנו לוקחים את ספירת האקסון של המזהה המולקולרי הייחודי של UMI (UMI) מהפריים-סק. על ציטוקינים וערכים קליניים, לא יושם עיבוד מקדים קודם. פרטים נוספים על הפקת הנתונים (הניסיוניים) מפורטים בכתב היד המקביל11. מכיוון שהתוצאות המוצגות כאן מבוססות על שימוש בביאור האזימוט האוטומטי עבור סוגי תאים בנתוני scRNA-seq בהשוואה לאסטרטגיה מבוססת הסמן ששימשה בפרסום המוזכר, התוצאות המוצגות כאן דומות אך לא בדיוק זהות לאלה שהוצגו בפרסום. בכתב היד ניתן להראות כי אסטרטגיית הביאור מסוג התא אינה משנה את הדפוסים העיקריים ואת הפרשנויות הביולוגיות של הניתוח, אך שינויים קטנים בערכים המדויקים הנובעים מהמודל עשויים להשתנות. בסך הכל, נתוני הקלט היו מערך נתונים רב-ממדי מורכב הכולל נקודות זמן שונות ורמות מדידה שונות (תאים בודדים לעומת תפזורת) של יותר מ-10,000 תכונות שונות (גנים, חלבונים, ערכים קליניים). אסטרטגיה קפדנית של עיבוד מקדים והרמוניזציה של נתונים ואחריה ניתוח MOFA הוכחה ככלי שימושי ומהיר לחקר הנתונים ולחילוץ תוכנית חיסונית רלוונטית. כל נקודת זמן ושילוב מטופלים מטופלים כמדגם עצמאי בניתוח MOFA. כל סוג נתונים וסוג תא נחשבים לתצוגה נפרדת בניתוח MOFA.
פרוטוקול זה מספק הוראות להכנת נתוני הקלט עבור זרימת העבודה, ביצוע שלבי זרימת העבודה השונים, התאמה אישית של תצורות, פירוש הנתונים המתקבלים והתאמה איטרטיבית של התצורות בהתבסס על הפרשנויות. סקירה כללית של השלבים השונים של הפרוטוקול, ערכות נתוני הקלט הנדרשות בכל שלב, והנתונים ומערכי הנתונים המתקבלים ניתנת על-ידי סקירת זרימת העבודה הטכנית (איור 2).

איור 2: מבט כולל על זרימת עבודה טכנית. מתווה זרימת העבודה לניתוח ערכת הנתונים multi-omics. האלמנטים השונים מודגשים על ידי צבעים וסמלים שונים. מחברות Jupyter השייכות לשלב עיבוד מראש והרמוניזציה של נתונים (1) צבועות בכחול. מחברות יופיטר השייכות לשלב 'מודל MOFA' (2) צבועות בכתום. מחברות יופיטר השייכות לשלב 'ניתוח במורד הזרם' (3) צבועות בירוק. מחברת יופיטר אחת שתשמש להשוואת התוצאות צבועה בצהוב. קבצי תצורה שבהם ניתן לשנות פרמטרים לביצוע זרימת העבודה מודגשים בסגול. ערכות נתונים של קלט הדרושות להפעלת זרימת העבודה מסומנות על-ידי סמל ערכת הנתונים ומודגשות באפור. כל פלטי האיור הנוצרים במהלך ביצוע זרימת העבודה מסומנים על-ידי סמל זכוכית המגדלת. ערכות נתונים שנוצרו במהלך ביצוע זרימת עבודה מסומנות כטבלאות. באופן כללי, זרימת העבודה מבוצעת ברצף: (1) עיבוד מקדים והרמוניזציה של נתונים מורכב משני שלבים: הדור הראשון של טבלה פסאודו-תפזורת המבוססת על נתוני הקלט scRNA-seq (01_Prepare_Pseudobulk) ולאחר מכן אינטגרציה ונורמליזציה של נתונים אלה יחד עם כל הקלטים האחרים ברמת המדגם (בתפזורת) (02_Integrate_and_Normalize_Data). במסגרת שלב זה באמצעות קבצי התצורה, ניתן להגדיר עבור כל ערכת נתונים בנפרד איזה משלבי העיבוד מראש והנורמליזציה שצוינו (לדוגמה, מסנן לדוגמה) יש ליישם. (2) 'מודל MOFA': מפעיל את מודל MOFA על הקלט שנוצר של השלב הראשון עם התצורות שצוינו בקובץ התצורה (03_MOFA_configs.csv) (3) 'ניתוח במורד הזרם': מורכב משלוש מחברות שונות שניתן להריץ בנפרד זו מזו כדי להפיק תובנות לגבי תוצאות MOFA שנוצרו ולשייך אותן למטא-נתונים לדוגמה (קובריאטים) שסופקו כקלט באמצעות קובץ 'מטא Data.csv לדוגמה'. (4) 'השוואת מודלים': הוא שלב נפרד קטן שניתן להשתמש בו כדי להשוות מודלים שונים שנוצרו בשלב 2. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
תהליך העבודה מורכב ממספר מחברות Jupyter שנכתבו ב-R וב-Python (ידע בשפת R ו-Python אינו נדרש להפעלת זרימת העבודה, אך עשוי להיות שימושי במקרה של הופעת שגיאות). בשלבים שונים של הפרוטוקול, פרמטרים משתנים באמצעות קבצי תצורה (קבצי '.csv' המכילים את הקידומת '_Configs' בשם). בתוך הפרוטוקול, אנו מתארים רק את הפרמטרים שיש לשנות החל מתצורת ברירת המחדל.
מספר פרמטרים אחרים עשויים להשתנות גם, למשל כדי להתאים אישית את העיבוד מראש. תיעוד של פרמטרים והסברים אלה ניתן בקובץ 'Documentation_Config_Parameter', הכלול במאגר שהורדת.
1. הכנות: התקנה והתקנה טכניות
הערה: כדי להפעיל תוכנית זו, יש להתקין מראש את wget , git ו- Apptainer בהתקן. מדריך להתקנת Apptainer במערכות שונות (Linux, Windows, Mac) ניתן כאן: https://apptainer.org/docs/admin/main/installation.html. מידע התקנה על git ניתן למצוא כאן: https://git-scm.com/book/en/v2/Getting-Started-Installing-Git. בהתאם לגודל של ערכות נתוני הקלט השונות, מומלץ להפעיל את זרימת העבודה במחשב מתאים (16 CPU, 64GB זיכרון). ניתן לבצע בדיקת עשן עם הנתונים לדוגמה שסופקו במחשב המקומי. הוראות ופלטים צפויים מהפעלת הפרוטוקול על הנתונים לדוגמה ניתנים בקובץ משלים 1. עיין בקובץ וידאו משלים 1 לקבלת השלבים החשובים של הפרוטוקול המבוצעים במערך הנתונים המתואר לעיל.
2. אתחול והכנת נתונים

איור 3: קלט נתונים והגדרתם. לצורך ביצוע זרימת העבודה, יש לאחסן את כל הנתונים בתיקיית input_data שצוינה. עבור כל ערכת נתוני קלט יש לספק קובץ נפרד. נתונים של תא בודד צריכים להינתן כ- .h5ad המכיל ביאור תאים ב- cluster_id (הנובע למשל משלבי ביאור קודמים מסוג תא) ועמודת sample_id (המזהה באופן ייחודי כל מדגם נפרד שיש לנתח). כל שאר מערכי נתוני הקלט צריכים להינתן בתבנית '.csv', כולל עמודה אחת המציינת את sample_id (התאמה לעמודה המתאימה של הנתונים בתא בודד) ותכונות שישמשו בניתוח MOFA בכל העמודות האחרות. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 4: קובצי תצורה של Jupyter-lab. במהלך ביצוע זרימת העבודה, שינויים בפרמטרים (למשל, התאמת אפשרויות סינון וכו ') מוגדרים באמצעות קבצי תצורה '.csv'. בתוך המאגר המשוכפל, נכללים קבצי תצורה המוגדרים כברירת מחדל עבור כל שלב. ניתן לערוך אותם ישירות במסוף מעבדת יופיטר, בדומה לגיליון אלקטרוני. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 5: סקריפטים של Jupyter-notebooks. זרימת העבודה המלאה מורכבת מסדרה של מחברות Jupyter שיבוצעו ברצף לאחר שינוי קבצי התצורה המתאימים. על ידי לחיצה כפולה על מחברת יופיטר בצד שמאל, הקובץ המתאים ייפתח בצד ימין. ניתן להתחיל את הביצוע המלא של הקובץ עם הלחצן המודגש בחלק העליון. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
3. עיבוד מקדים והרמוניזציה של נתונים

איור 6: עיבוד מקדים והרמוניזציה של נתונים. אחד התוצרים של שלב '01_Prepare_Pseudobulk' הוא העלילה 'Fig01_Amount_of_Cells_Overview'. כאן, עבור כל cluster_id (ציר y המציין את סוג התא משלבי ביאור קודמים של סוג תא), ניתן מספר התאים לכל דגימה ('sample_id'). בתוך התוצאות המוצגות, סוגי תאים עם כמות נמוכה של תאים לכל מדגם אינם נכללים בניתוח הבא (מסומן על ידי קו חוצה). אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
4. הפעלת MOFA
5. ניתוח במורד הזרם
6. השוואת תצורות וגרסאות שונות (איור משלים 1, תרשים משלים 2, תרשים משלים 3, תרשים משלים 4)
7. הרחבת זרימת העבודה: הוספת פרמטרים ותצורות אחרות
הערה: מלבד הפרמטרים הניתנים כעת להגדרה בקבצי התצורה, ייתכן שייכללו התאמות אחרות בקוד או בפרמטרים אחרים. לדוגמה, מודל MOFA עצמו מציע מספר פרמטרי אימון אחרים17 שניתן לשנות ישירות בקוד או לבצע כוונון באמצעות קבצי התצורה. החלק הבא של הפרוטוקול יתאר דוגמה כיצד לעשות זאת עבור פרמטרים נוספים של אימון מודל MOFA. עבור חלק זה, נדרש ידע בתכנות R.
לאחר ביצוע מוצלח של זרימת העבודה, נוצרות מספר טבלאות ואיורים כפי שמצוין באיור 2. האיורים ימוקמו בתיקייה /figures (איור 6, איור 7, איור 8, איור משלים 1, איור משלים 2, איור משלים 3, איור משלים 4), וטבלאות ימוקמו בתיקייה /results שצוינה.
במקרה שביצוע זרימת העבודה אינו מצליח, הדבר עשוי לנבוע בעיקר מ: שגיאות טכניות הנגרמות לדוגמה על-ידי זיכרון לא מספיק (במיוחד בשלב הראשון שבו נטען מערך נתונים גדול של תא בודד), נתונים שעוצבו באופן שגוי (לדוגמה, עמודות sample_id לא תואמות בין ערכות נתונים) או מפרטים שגויים בקבצי התצורה (לדוגמה, לא כולל תכונות רבות). במקרה זה, בדרך כלל, הודעת שגיאה בתוך סקריפט Jupyter-notebook תתרחש במהלך הביצוע ולא ייווצרו חלקות ונתונים. מומלץ להשתמש בקבצי ברירת המחדל של התצורה כפי שנוצרו במהלך ביצוע ה-script ולשנות רק פרמטרים ספציפיים כמתואר בפרוטוקול.
ביצוע מוצלח מסומן על ידי הדור של מגרשים וטבלאות וכתוצאה מכך, וכל צעד יגלה מידע נוסף על הנתונים ואת דפוסי השונות העיקריים הטמונים בו. עם זאת, לא בהכרח כל ביצוע יניב תוצאות מועילות ביולוגית וניתנות לפרשנות. לעתים קרובות, הנתונים מאופיינים באפקטים טכניים גדולים והתפלגויות שונות, שיש לקחת בחשבון בשלב 'עיבוד מראש והרמוניזציה של נתונים' או ב'מודל MOFA9 ' (המאפשר גם לציין התפלגויות שונות עבור סוגי נתוני הקלט) כדי להיות מסוגלים לחלץ את השונות של הנתונים המשקפים את התהליכים הביולוגיים הבסיסיים.
בתוך זרימת העבודה המוצגת, ערכות נתונים רב-אומיות שונות עשויות לשמש כקלט. נכון לעכשיו, זרימת העבודה מקבלת את תבנית הקובץ הפופולרית .h5ad עבור נתונים של תא בודד ותבנית קובץ .csv כללית מאוד עבור כל ערכות הנתונים האחרות כקלט (איור 3). מקובל שלערכות נתונים אומיות שונות יש תבניות קובץ שונות מאוד. כדי לא להגביל את ביצוע זרימת העבודה לתבניות קובץ ספציפיות, .csv משמש כפורמט כללי מאוד. לכן, ניתן להשתמש בכל מיני ערכות נתונים שונות של omics כקלט עבור זרימת העבודה, אך יש להמיר אותן לתבנית .csv המתאימה כפי שמצוין באיור 3 תחילה לפני השימוש בזרימת עבודה זו. זה עשוי להיות מוכן באמצעות גיליון אלקטרוני או תוכנה ספציפית omic. כדי לעבד מראש את ערכות הנתונים השונות של omics, קיימות מספר אפשרויות זמינות בתוך זרימת העבודה כדי להחיל שלבי עיבוד מקדים ונורמליזציה שונים (לדוגמה, התאמת גודל ספריה, המרת יומן, נורמליזציה כמותית לדוגמה) על ערכות נתוני הקלט השונות על-ידי קביעת התצורה של קובץ 02_Pre_Processing_Configs.csv וקובץ 02_Pre_Processing_Configs_SC.csv (איור 2)). עם זאת, האפשרויות הזמינות כאן מבוססות בעיקר על נתוני הקלט הספציפיים הזמינים במערך הנתונים המוצג כאן (scRNA-seq, בדיקת ציטוקינים, פרוטאומיקה, prime-seq). במקרה שנעשה שימוש באומיקה/סוגי נתונים אחרים, ייתכן שיהיה צורך להחיל שלבי נורמליזציה ספציפיים נוספים בהתאם לשיטות העבודה המומלצות הקיימות. במקרה זה, ניתן להעביר את הנתונים לזרימת העבודה בטופס שכבר עובד מראש, והם ישולבו יחד עם ערכות הנתונים האחרות מבלי להחיל שלבי עיבוד מקדים נוספים. במקרים רבים, יישום שלב הנורמליזציה הכמותית של Feature Wise שימושי ביישור ההתפלגות של כל סוגי הנתונים להתפלגות נורמלית ובהפיכת הניתוח במורד הזרם בין תכונות הקלט השונות לדומה יותר ותואם יותר למפרט המודל של רעש גאוס.
במהלך ביצוע זרימת העבודה נוצרים מספר חלקות ופלטים התומכים בתהליך שילוב הנתונים והפרשנות הביולוגית במורד הזרם. עבור נתוני scRNA-seq, התרשים ב-FIG01_Amount_of_Cells_Overview (איור 6) מציין אילו סוגי תאים עשויים לכלול מעט מדי תאים לכל דגימה וסוג תא כדי למדוד באופן אמין אות ביטוי גנים, שכן בניתוחים הבאים, הערך הממוצע בכל התאים של סוג תא לדגימה משמש כהערכת ביטוי (גישת psedobulk). במקרה שימוש זה, אנו לא כוללים סוגי תאים הכוללים פחות משלושה תאים ברוב הדגימות.
תרשים פירוק השונות FIG03_Overview_Variance_Decomposition (איור 7, איור משלים 1) יכול לציין עד כמה מקורות הנתונים השונים משתלבים וכמה מהשונות במקורות הנתונים השונים משותפת וייחודית לכל מקור נתונים. לדוגמה, בדיקת אסטרטגיות קדם-עיבוד שונות במערך הנתונים המשמש כאן מראה למשל שהסרת שלב הנורמליזציה של Feature Wise Quantile מהעיבוד המקדים מובילה לגורמים סמויים הממוקדים יותר בתצוגות נתונים ספציפיות ומפחיתה את השילוב של הנתונים הפרוטאומיים עם מקורות הנתונים האחרים. ניתן לראות זאת בצמצום השונות המוסברת (איור משלים 1B). הפעלת מודל MOFA ללא סינון של מאפיינים או ללא נורמליזציה מובילה לפחות שונות משותפת בין ההשקפות השונות שנתפסו על-ידי הגורמים הסמויים (איור משלים 1C). הדבר מצביע על כך שגורמים סמויים משקפים בעיקר השפעות טכניות ספציפיות לסוג הנתונים. מלבד זאת, מודל MOFA9 עצמו עשוי גם להחזיר אזהרות במקרה של נתונים לא מעובדים מראש. דוגמה לאזהרה כזו מוצגת באיור משלים 1 עבור תצורות העיבוד מראש החלופיות MI_v2 ו-MI_v3 (קובצי התצורה לדוגמה הספציפיים מאוחסנים במאגר GitHub המשוכפל בתיקייה config_examples).
בנוסף, לאחר הפעלת מודל MOFA, ניתן להעריך את התוצאות במספר ניתוחים במורד הזרם על ידי שיוך הגורם עם מטא-מידע ביולוגי ידוע על הדגימות, כמו גם משתנים טכניים ומבלבלים אחרים (04_Downstream_Factor_Analysis) כדי לזהות את הגורם האפשרי לשונות שנלכדה על ידי הגורמים. לדוגמה, אם אחד הגורמים של מודלי MOFA מקשר חזק עם אחד המשתנים הטכניים (כגון מידע אצווה), זה עשוי להצביע על כך שגורם זה לוכד שונות טכנית בתוך הנתונים במקום שונות ביולוגית.
כדי לצמצם את הפרשנות הביולוגית בחלק הניתוח במורד הזרם, מתוארים כאן כמה ממצאים המבוססים על מערך נתוני הקלט (פרשנות מעודנת יותר ניתן למצוא בפרסום המקורי11). בשלב הראשון יכולנו לראות שבעזרת אסטרטגיית קדם-עיבוד מיושמת, אנו מוצאים כמה גורמים שלוכדים שונות בין סוגי תאים מרובים, אולם גם סוגי נתונים אחרים של אומיקס (איור 7A). לדוגמה, גורם 2 לוכד שונות בתכונות הקלט הקליני ובמספר סוגי תאים של מערך הנתונים scRNA-seq. שיוך שלושת הגורמים הראשונים עם משתנים קליניים רלוונטיים כמו 'CRP' ו-'CK' (איור 7B) וחקירת ההבדלים בערכי הגורמים עבור תת-קבוצות המטופלים השונות: 'בקרה (כולל CCS ו-non-CCS) לעומת 'ACS' שנמדדה בנקודות הזמן השונות (TP1-TP4) (איור 7C), אנו מוצאים גם שפקטור2 מקשר באופן משמעותי לערך 'CK' ופקטור3 לערך 'CRP'. במקביל, דגימות 'ACS' ב- TP1 ו- TP2 (המשקפות את השלב החריף של התגובה החיסונית לאוטם שריר הלב (MI)) מראות עלייה בערכי הגורמים בהשוואה לדגימות 'בקרה' ונקודות זמן מאוחרות יותר (TP3/TP4). CK הוא סמן ידוע של נזק לשריר הלב ומאופיין בדרך כלל בערכים מוגברים ב- TP1/TP2, בדומה לדפוס שנלכד על ידי פקטור 2.
כדי להפיק תובנות לגבי התהליכים הביולוגיים המעצבים את פקטור2, אנו מעריכים את התכונות המובילות של הגורם על ידי התבוננות בטבלת משקלי התכונות שנוצרה על ידי המודל (03_Weight_Data.csv). ניתוח העליון 1% של תכונות עם המשקולות האבסולוטיות הגבוהות ביותר על הגורם, אנו מוצאים בעיקר CD4. TCM ו- CD14. תכונות הנגזרות ממונו מיוצגות יתר על המידה בהשוואה למספר הכולל של תכונות הקלט שלהן (איור 8A), מה שמצביע על כך שסוגי תאים אלה רלוונטיים מאוד בתהליך הדלקתי לאחר MI (הערה: במקרה שלא יושמה נורמליזציה כמותית מבחינת תכונות בעיבוד המקדים, התפלגויות שונות של התכונות עשויות גם הן להשפיע על תוצאה זו, ויש לבצע הערכה בנפרד לפי סוג הנתונים). ניתוח התכונות המובילות של CD4. סוג תא TCM על הגורם, אנו מוצאים כמה גנים מעניינים כמו EIF3E18 הנדרש להפעלה חזקה של תאי T ו- HMGB119, אשר מקדם הרחבה והפעלה של תאי T (איור 8B). לאחר מכן, אנו מריצים את ניתוח העשרת המסלולים באמצעות מסלולים חיסוניים ממסד הנתונים REACTOME20 כערכת מסלולים (Prepared_Pathway_Data.csv). אנו מוצאים העשרה למספר מסלולי 'אינטרלוקין', כולל איתות 'אינטרלוקין-6'. רמות הביטוי של מספר גנים בסוגי תאים שונים של נתוני scRNA-seq וערכי הציטוקינים 'IL6' שנמדדו על-ידי בדיקת הציטוקינים תרמו לתוצאה זו (איור 8C). זיהוי דפוסים משותפים אלה בין סוגי נתונים מדגיש את הערך המוסף של ניתוח משולב. בסך הכל, גישה זו יכולה גם לזהות מספר גורמים אחרים המשקפים את מצב המחלה או את תוצאות הטיפול הקשורות ואת תוכניות החיסון הרב-תאיות הבסיסיות, כפי שמתואר בפירוט רב יותר בפרסום המקביל11.
כדי להדגיש עוד יותר את היתרון של ניתוחים משולבים על פני אומיקה מרובים, אותו תהליך עבודה גם הופעל רק כולל נתוני הקלט של פרוטאומיקה (איור משלים 4). ניתוח הגורמים המתקבלים, אנו מוצאים בדומה לניתוח המשולב גורם (פקטור 1) שיש לו מתאם חזק עם ערך 'CRP'. תבנית זו מתארת את המקור העיקרי לשונות בתוך נתוני הפרוטאומיקה, והיא מיושרת גם עם חלק מהשונות במערכי הנתונים האחרים כפי שנלכדו על-ידי 'פקטור 3' בניתוח המשולב (איור 7C). עם זאת, דפוס דומה כפי שצוין על ידי פקטור 2 אשר לוכד את מהלך הזמן של דלקת בניתוח משולב לא ניתן לזהות אך ורק על סמך נתוני פרוטאומיקה.
זרימת העבודה שהוצגה ומודל MOFA9 עצמו ניתנים להתאמה אישית רבה עם פרמטרים מתכווננים רבים. לכן, חשוב לדמיין ולהשוות באופן שיטתי את התוצאות המיוצרות על ידי תצורות שונות. כדי להקל על משימה זו, הפלט הסופי שניתן להפיק על ידי זרימת העבודה הוא השוואה של ריצות בעלות שם שונות של הצינור עם פרמטרים שונים בעיבוד מראש ובהערכת המודל. לדוגמה, ניתן להעריך את מודל MOFA עם מספרים שונים של גורמים סמויים (איור משלים 2A) או לשקלל תצוגות עם מספר נמוך יותר של תכונות (איור משלים 3A). קביעת תצורה והפעלה של הסקריפט האחרון של זרימת העבודה '07_Compare_Models' מייצרת מספר חלקות להערכת הדמיון בין ריצות צינור שונות. FIG07_Variance_Model_Comparison (איור משלים 2B, איור משלים 3B) מציג השוואה של השונות המוסברת הכוללת עבור כל תצוגה עבור ריצות שונות. המתאם בין ערכי הגורמים ומשקלי הגורמים בין הריצות השונות יכול להצביע על מידת השינוי בתוצאות בעת שינוי פרמטר מסוים (איור משלים 2C, איור משלים 3C). כאן, שינוי מספר הגורמים גורם רק לשינויים קלים בערכי הגורמים המשוערים ובמשקלי התכונות (איור משלים 2C). שינוי השקלול של תצוגת הנתונים מביא לשונות מוסברת גבוהה בהרבה בתצוגות עם מספר נמוך יותר של מאפיינים, למשל התצוגה ה'קלינית' (איור משלים 3B). עם זאת, המאפיינים הרלוונטיים בשלושת הגורמים הראשונים עדיין מתואמים מאוד עם אלה שהוסקו בגרסה הלא משוקללת (איור משלים 3C).
עם פלט המודל שנוצר .csv קבצים בתיקיית התוצאות (למשל, הגורם המשוער ומשקלי התכונות), ניתן לבצע ניתוחים בודדים נוספים במורד הזרם. כל הקוד וקבצי התצורה הדרושים (כולל תיעוד) זמינים ב- GitHub בכתובת https://github.com/heiniglab/mofa_workflow. את תמונת הסינגולריות שנוצרה כדי לאפשר התקנה קלה של חבילות הקונדה הנדרשות לניתוח ניתן להוריד מ-https://doi.org/10.5281/zenodo.10815146. ניתן להוריד מערך נתונים לדוגמה קטן שניתן להשתמש בו לביצוע בדיקה ראשונית של הצינור גם מאותה רשומת זנודו.

איור 7: ניתוח תפוקת MOFA. לאחר הפעלת מודל MOFA (03_Run_MOFA.ipynb) וניתוח במורד הזרם של ערכי גורמים (04_Downstream_Factor_Analysis.ipynb) נוצרות מספר חלקות: (A) FIG03_Overview_Variance_Decomposition: החזרת תצוגה חזותית של השונות המוסברת של גורמי MOFA המשוערים בתצוגות השונות. מפת חום (משמאל): מציגה את אחוז השונות הכוללת של תצוגה שצולמה על-ידי גורם עבור כל תצוגה. Barplot (מימין): מציג את אחוז השונות הכולל שנלכד על-ידי כל הגורמים עבור כל תצוגה. (B) FIG04_Factor_Association_Numerical_Features: מראה את מתאם פירסון של ערכי הגורמים עם קובריאטים נבחרים של דגימה מספרית, כאן: משתנים קליניים (CRP, CK). (C) FIG04_Factor_Association_Categorical_Features: מציג את ההבדל בערכי גורמים עבור משתנים משותפים של מדגם קטגורי כתרשים תיבה. כאן, ערכי הגורמים של גורמים 1-3 עבור כל נקודת זמן של חולי ACS ובקרה מושווים. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 8: ניתוח תכונות MOFA. לאחר הרצת הניתוחים במורד הזרם (04_Downstream_Factor_Analysis.ipynb, 05_Downstream_Investigate_Features.ipynb) נוצרות מספר חלקות. כל החלקות כאן מציגות את MOFA גורם 2: (A) FIG04_Top_Feature_Overview_per_Factor: מפת חום (משמאל) מציגה עבור כל תצוגה את אחוז השונות שנלכד על-ידי הגורם שנבחר. Barplots (מימין) לציין את הרלוונטיות של התכונות של תצוגות שונות עבור גורם. בצד שמאל ניתנת הכמות הכוללת של תכונות של תצוגה ספציפית בתוך 1% התכונות בעלות הדירוג הגבוה ביותר בין צפיות בגורם. בצד ימין, האחוז ניתן, ומחלק את המספר הכולל בין 1% העליון במספר הכולל של תכונות של אותה השקפה. (B) FIG05_Heatmap_Feature_Overview: מפת חום (משמאל) מציגה עבור הדירוג הגבוה ביותר 1% מהתכונות של CD4. סוג תא TCM ערכי הביטוי המנורמלים של כל דגימה המשווה את מטופלי קבוצת הביקורת (CCS ולא CCS) לנקודות הזמן השונות עבור חולי 'ACS'. barplot (מימין) מראה את המשקל של התכונות. כיוון סימן המשקל מצוין לפני משמאל לפני שמות סוג התא: '+' משקל גורם חיובי; '-' משקל גורם שלילי. (C) FIG06_Pathway_and_Genes: מראה את משקלם של הגנים בעלי הדירוג הגבוה ביותר של 25% עבור הגורם השייך למסלולי אינטרלוקין מועשרים. במפת החום למעלה, הם ממוצעים על פני תצוגות, ובמפת החום בתחתית מוצגת לכל תצוגה. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
איור משלים 1: אפקטים של הרמוניזציה של נתונים. האיור מציג FIG03_Overview_Variance_Decomposition עבור מספר תצורות שונות של עיבוד מקדים של נתונים: הדמיה של השונות המוסברת של גורמי MOFA המשוערים בתצוגות השונות. מפת חום (משמאל): מציגה עבור כל תצוגה את אחוז השונות הכוללת של תצוגה שנלכדת על-ידי גורם. Barplot (מימין): מציג עבור כל תצוגה את אחוז השונות הכולל שנלכד על-ידי כל הגורמים. (A) התצורה ('MI_v1') שעל בסיסה נותחו תוצאות ביולוגיות במורד הזרם באיורים קודמים (פרמטרים שנקבעו כמו בקובצי תצורה ברירת מחדל במאגר המשוכפל). (B) אותה תצורת עיבוד מקדים כמו ב- 'MI_v1' עם השינוי שלא מיושמת נורמליזציה כמותית חכמה של תכונה (פרמטרים שנקבעו כמו בקבצי תצורה לדוגמה בתיקיית 'config_examples' של המאגר). צילום מסך של אזהרת הפלט של דגם MOFA עבור תצורה זו מתווסף לעלילה שלהלן. (C) פירוק השונות שנוצר כאשר לא מוחלים שלבי עיבוד מראש, וכל הנתונים משמשים כקלט ללא כל עיבוד מקדים או סינון של תכונות (פרמטרים המוגדרים כמו בקובץ תצורה לדוגמה בתיקיית 'config_examples' של המאגר). צילום מסך של אזהרת הפלט של דגם MOFA עבור תצורה זו מתווסף לעלילה שלהלן. אנא לחץ כאן כדי להוריד קובץ זה.
תרשים משלים 2: תצורת MOFA - אפקט כמות פקטור. הנתונים המתקבלים שנוצרו על ידי סקריפט '07_Compare_Models.ipynb' באמצעות מספר תצורות שונות כדי להפעיל את מודל MOFA. (A) '03_MOFA_configs.csv': דוגמה לתצורות השונות המשמשות להפעלת קובץ ה- Script '03_Run_MOFA.ipynb' המציין מספר גורמים שונים (10,15,20,25). '07_Comparison_configs.csv': דוגמה לאופן שבו ניתן לציין את קובץ קלט התצורה לביצוע הסקריפט '07_Compare_Models.ipynb'. (B) 'FIG07_Variance_Model_Comparison' המציג את השונות המוסברת הכוללת עבור כל תצוגה (ציר Y) עבור המודלים השונים בכל הגורמים שצוינו במודל. (C) 'FIG07_Factor_Correlations' המציג את המתאם של ערכי דגימת הגורמים בין התצורות השונות. אנא לחץ כאן כדי להוריד קובץ זה.
תרשים משלים 3: תצורת MOFA - השפעת שקלול תצוגות. הנתונים המתקבלים שנוצרו על ידי סקריפט '07_Compare_Models.ipynb' באמצעות מספר תצורות שונות כדי להפעיל את מודל MOFA. (A) '03_MOFA_configs.csv': דוגמה לתצורות השונות המשמשות להפעלת קובץ ה-script '03_Run_MOFA.ipynb' המציין שהפרמטר 'weighting_of_views' יהיה 'TRUE' (MI_v1_MOFA_weighted) או 'FALSE' (MI_v1_MOFA). '07_Comparison_configs.csv': דוגמה לאופן שבו ניתן לציין את קובץ קלט התצורה לביצוע הסקריפט '07_Compare_Models.ipynb'. (B) 'FIG07_Variance_Model_Comparison' המציג את השונות המוסברת הכוללת עבור כל תצוגה (ציר Y) עבור המודלים השונים בכל הגורמים שצוינו במודל. (ג) 'FIG07_Feature_Correlations' המציג את המתאם בין משקלי גורם התכונה בין התצורות השונות. אנא לחץ כאן כדי להוריד קובץ זה.
תרשים משלים 4: אפקט אינטגרציה רב-אומית - שימוש בנתונים פרוטאומיים בלבד. הדפוסים המתקבלים נלכדים על ידי הגורמים הסמויים כאשר משתמשים רק בנתוני פרוטאומיקה כקלט. (A) FIG04_Factor_Association_Numerical_Features: מתאם פירסון של ערכי הגורמים עם משתנים קליניים (CRP, CK). (B) FIG04_Factor_Association_Categorical_Features: השוואת Boxplot של ערכי הגורמים של כל נקודת זמן של חולי ACS ו-Control. אנא לחץ כאן כדי להוריד קובץ זה.
קובץ משלים 1: Supplementary_File_
Running_Pipeline_with_Exemplary_Data. תיאורים כיצד להפעיל את הצינור על הנתונים לדוגמה והתפוקות הצפויות ניתנים בקובץ משלים שסופק בנוסף. אנא לחץ כאן כדי להוריד קובץ זה.
קובץ וידאו משלים 1: סרטון לכידת מסך של הפרוטוקול. אנא לחץ כאן כדי להוריד קובץ זה.
עם הפרוטוקול המתואר, מוצגת זרימת עבודה מודולרית וניתנת להרחבה המבוססת על מחברת Jupyter, שניתן להשתמש בה כדי לחקור במהירות מערך נתונים רב-אומי מורכב. החלקים העיקריים של זרימת העבודה כוללים את החלק של עיבוד מראש והרמוניזציה של נתונים (המציע שלבים סטנדרטיים שונים לסינון ונורמליזציה של הנתונים), הערכה של מודל MOFA9 וכמה ניתוח מופתי במורד הזרם. אחד השלבים הקריטיים העיקריים הוא לעבד מראש ולשלב, וליצור הרמוניה בין מערכי הנתונים השונים של omics. כאן, אנו מציגים אסטרטגיה למערך נתונים הכולל נתוני scRNA-seq, RNA בתפזורת prime-seq, בדיקת ציטוקינים, פרוטאומיקה של פלזמה וערכים קליניים, שהביאו למערך נתונים משולב והרמוני שניתן להשתמש בו כדי לזהות תהליכים ביולוגיים רלוונטיים ב- MI11. במקרה שמערכי נתונים OMIC אחרים דורשים אסטרטגיות עיבוד מקדים נוספות של נתונים, יש לבצע אותן לפני ניתוח MOFA. לאחר מכן ניתן להשתמש בנתונים המעובדים מראש כקלט לזרימת העבודה הנוכחית. ניתן להשתמש בפלט המודל כדי להעריך את איכות השילוב של מערכי הנתונים השונים ואת ההשפעות של העיבוד המקדים כדי לזהות השפעות טכניות פוטנציאליות. לדוגמה, אפשר להתחיל על ידי יישום רק מינימום של שלבי עיבוד מראש ונורמליזציה ולאחר מכן להעריך את ההשפעה של נורמליזציה נוספת. ביישום זה, נצפה כי הוספת "נורמליזציה כמותית חכמה תכונה" מובילה לשילוב טוב יותר של פרוטאומיקה עם שאר המבחנים.
חלק גדול נוסף של זרימת העבודה הוא הערכה של מודל MOFA9 על נתונים מצטברים ברמת המדגם. קיימות הרחבות נוספות של מודל MOFA, כגון
MOFA+21 (במיוחד עבור נתונים חד-תאיים), MEFISTO22 (במיוחד עבור נתונים הכוללים רכיב זמן) ו-MuVI23 (שילוב ידע בתחום בגישת ניתוח גורמים). אלה הן הרחבות שימושיות מאוד של השיטה עבור סוגים ספציפיים של ערכות נתונים או הגדרות, אבל יישום אותם מגיע עם דרישות ספציפיות. לדוגמה, שימוש ב- MOFA+21 במיוחד עבור נתונים של תא בודד במקרה שלנו פירושו שלא ניתן להשתמש בקלות ברמת המדגם בנתוני omics אחרים זמינים. השימוש בשיטת MEFISTO22 מאפשר למדל באופן ספציפי את מסלול הזמן, אך הוא אינו ישים בהגדרות שבהן נקודות זמן מרובות אינן זמינות, או, במקרה שלנו, לשילוב דגימות 'בקרה' שיש להן רק מדידות בנקודת זמן אחת עם הנתונים שנפתרו בזמן של דגימות 'ACS'. לכן, בתהליך עבודה כללי זה, אנו בוחרים להשתמש בשיטת MOFA9, מכיוון שהיא השיטה הגמישה ביותר לחקר כל מיני מערכי נתונים ללא דרישות רבות מדי באופן מהיר. שים לב, ניתן לחלופין לנתח את הנתונים המעובדים מראש שנוצרו בזרימת העבודה בשיטות אלה או להרחיב את הסקריפטים הנוכחיים כדי לשלב שיטות אלה אם מערך הנתונים תואם לדרישות השיטות. לקבלת תרחישי שימוש נוספים, ערכות לימוד ותיעוד, עיין במאגר GitHub של מפתחי MOFA24.
בהשוואה לשיטות הפחתת ממדיות כלליות עוד יותר כמו ניתוח רכיבים עיקריים (PCA), מודל MOFA9 מציע מספר יתרונות, במיוחד בסביבה multi-omics. לדוגמה, ניתן לנתח בקלות את פירוק השונות לכל תצוגת קלט וניתן להקצות משקלים לתצוגות שונות כדי לקחת בחשבון מספר שונה של תכונות. המודל מעודד דלילות, מה שמגדיל את יכולת הפרשנות של התוצאות. יתר על כן, דגימות עם נתונים חסרים באחד האומיקס אינן צריכות להיכלל, והמודל מיישם כמה תכונות כדי להתמקד בלמידת משקלי גורם תכונה דלילים. כמו כן, מודל MOFA מציע מספר הגדרות לשילוב נתונים המאופיינים בהפצות שונות (מידול סבירות 'גאוסיאני', 'ברנולי' או 'פואסון'). בזרימת עבודה זו, אנו משלבים רק נתונים רציפים, אותם אנו מנרמלים כדי לעקוב אחר התפלגות 'גאוסיאנית', אך ניתן גם להרחיב את הקוד הקיים כדי לשלב סוגי נתונים אחרים במידת הצורך. קיימות שיטות אחרות המבוססות על פירוק, כגון scITD25, במיוחד עבור נתוני scRNA-seq, אך אלה מגיעות עם המגבלה שהן אינן מתוכננות לעבוד עם אומיקה אחרת.
זרימת העבודה המוצגת מציגה פרוטוקול לחקירה בלתי מפוקחת של מערכי נתונים מולטי-אומיים גדולים ומורכבים כדי לזהות תהליכים ביולוגיים פוטנציאליים ותכונות אחרות המניעות שונות בתוך הנתונים. ניתן ליישם אותו כמעט בכל סביבה שבה יש לחקור שינויים בנתונים, למשל, הנגרמים על ידי מחלה או הפרעות ביולוגיות או טכניות אחרות. הניתוחים במורד הזרם וערכות התכונות המתקבלות המניעות את השונות בין האומיקה השונים יכולים לחשוף תהליכים ביולוגיים רלוונטיים לחקירה נוספת בהקשר הספציפי. לדוגמה, בהקשר של מחלה, היא עשויה לאפשר זיהוי של סמנים אבחוניים חדשים או יעדי טיפול.
המחברים מצהירים כי אין ניגוד עניינים.
C.L. נתמך על ידי אגודת הלמהולץ תחת בית הספר למחקר משותף "Munich School for Data Science - MUDS".
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| Apptainer | NA | NA | https://apptainer.org/docs/admin/main/installation.html |
| שרת מחשוב או תחנת עבודה או ענן (סביבת לינוקס, מק או חלונות). בהתאם לגודל מערכי נתוני הקלט השונים אנו ממליצים להפעיל את זרימת העבודה במחשב מתאים (בהגדרה שלנו אנו משתמשים: 16 מעבד, זיכרון 64GB) | כל יצרן | 16 מעבד, זיכרון 64GB זיכרון | גדול נדרש רק לעיבוד נתוני התא הבודד הגולמיים. לאחר העיבוד המקדים, ניתן לבצע את שלבי הניתוח המאוחרים יותר גם במחשבים שולחניים או ניידים רגילים |
| , git | NA | NA | https://git-scm.com/book/en/v2/Getting-Started-Installing-Git |
| GitHub | GitHub | NA | https://github.com/heiniglab/mofa_workflow |
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה