בהתאם לצעדים לסקירה אתית של מדעי החיים ומחקר רפואי הכולל נבדקים אנושיים שפורסמו בסין ב-18 בפברואר 2023, מחקר המבוסס על נתונים זמינים לציבור עשוי לעמוד בקריטריונים לפטור מסקירה אתית. מחקר זה השתמש רק בנתונים טרנסקריפטומיים משניים זמינים לציבור, לא מזוהים, ולא כלל גיוס משתתפים אנושיים חדשים, איסוף דגימות אנושיות או ניסויים בבעלי חיים. לכן, לא נדרשה אישור מוסדי מוסדי נוסף. לא בוצעו ניסויים בבעלי חיים במחקר זה. לכן, אישור מוועדת הטיפול והשימוש בבעלי חיים המוסדית לא היה רלוונטי.
מקורות נתונים לגנים הקשורים ללחץ ברשת אנדופלזמית בפרפור פרוזדורים
במחקר זה, מאגרי נתונים טרנסקריפטומיים זמינים לציבור הקשורים ל-AF נאספו ממאגר הנתונים GEO, כולל GSE41177, GSE79768, GSE115574, GSE14975 ו-GSE165838. מידע מפורט על מאגרי הנתונים של GSE מסופק בקובץ המשלים 1—טבלה משלימה S1. GSE41177 ו-GSE79768 שימשו לבניית קבוצת ההכשרה המשולבת של טרנסקריפטומיה בכמויות גדולות, בעוד ש-GSE115574 ו-GSE14975 שימשו כשתי קבוצות אימות חיצוניות עצמאיות. GSE165838 שימש לניתוח טרנסקריפטומי חד-תא. מכיוון שמאגרי נתונים אלו נוצרו בפלטפורמות שונות ועשויים להשתנות במקור הרקמה, ברקע הקליני ובהרכב הדגימה, כל מערך נתונים עובד מראש בנפרד בהתאם למאפייני הפלטפורמה שלו לפני האינטגרציה או האימות. לאחר מכן בוצעה תיקון אפקט אצווה באמצעות חבילת sva R עבור קבוצת האימון הממוזגת. מערך הגנים הקשור ללחץ ברשת האנדופלזמית נשלף ממאגר GeneCards עם ציון רלוונטיות ≥ 3, ולאחר הסרת השכפול, יצר את רשימת הגנים היעד ששימשה במחקר זה.
ניתוח גנים המבוטאים באופן דיפרנציאלי
לאחר סטנדרטיזציה ונרמול נתונים, נעשה שימוש בחבילת R לזיהוי גנים מבוטאים באופן שונה (DEGs) במערך האימון המשולב. DEGs הוגדרו לפי קריטריוני מובהקות הבאים: ערך P מותאם לקצב גילוי שגוי (תואר. P.Val) < 0.05 ו-|log2FC| > 0.58510. כדי להמחיש את דפוסי הביטוי של DEGs, נוצרו גרפים של הרי געש ומפות חום באמצעות חבילות ggplot2 ו-pheatmap, בהתאמה.
ניתוח WGCNA
כדי להבהיר מנגנונים פוטנציאליים של ויסות גנים מתואם, להגדיר את דפוסי הקשר בין מודולי הביטוי המשותפים למשתני תכונה קלינית, ולזהות סמנים ביולוגיים מרכזיים או מטרות טיפוליות עם פוטנציאל תרגומי, יושם WGCNA11.
רשת קו-ביטוי משוקללת נבנתה באמצעות חבילת WGCNA ב-R. עוצמת הסף הרך (β) נבחרה לפי קריטריון הטופולוגיה ללא קנה מידה; ערך ה-β המתאים נבחר לניתוחים הבאים כאשר מדד ההתאמה הטופולוגיית ללא קנה מידה (R2) הגיע ונשאר מעל 0.8512. במהלך זיהוי המודולים, פרמטרים הקשורים לכריתת עצים דינמית ורגישות לזיהוי מודול אופטימיזם לשיפור רזולוציה ויציבות גבולות המודול. לבסוף, מודולים הקשורים באופן מובהק לתכונת היעד הוצאו, וגנים תוך-מודולריים זוהו כקבוצות גנים מועמדות לניתוחים במורד הזרם.
ניתוח העשרה של DEGs הקשורים ל-AF
כדי לזהות במדויק את גני הציר, ה-DEGs נחתכו תחילה עם גנים מהמודולים המרכזיים של WGCNA כדי להגדיר קבוצת גנים המעורבים בפתוגנזה של AF. לאחר מכן, קבוצת הגנים AF הזו נחתכה עוד יותר עם גנים הקשורים ל-ERS, והגנים החופפים שנוצרו נשמרו לניתוחים הבאים.
העשרה פונקציונלית של הגנים שנבדקו הוערכה באמצעות ניתוחי אונטולוגיית גנים (GO) ואנציקלופדיה קיוטו לגנים וגנומים (KEGG). מונחי GO נותחו באמצעות clusterProfiler של חבילת R כדי לסכם העשרה בקטגוריות13 של תהליך ביולוגי (BP), רכיב תאי (CC) ותפקוד מולקולרי (MF). ניתוח KEGG שימש לאחר מכן לזיהוי מסלולים מועשרים הקשורים לגנים המטרה14. תוצאות העשרה עם ערך P מותאם < 0.05 נחשבו למובהקות סטטיסטית. מונחי GO המובילים ונתיבי KEGG הוצגו כגרפים של בר וגרפים בועות באמצעות ggplot2.
ניתוח אינטראקציה בין חלבון לחלבון (PPI)
ניתוח PPI בוצע על ידי העלאת מערך הגנים המצטלב למאגר הנתונים STRING, כאשר האורגניזם הוגבל להומו ספיינס. צמתים מנותקים הוסרו, והאינטראקציות נאספו באמצעות סף ציון ביטחון בינוני (ציון משולב ≥ 0.4). רשת ה-PPI שנוצרה יובאה לאחר מכן לכלי ויזואליזציה וניתוח רשת לניתוח טופולוגי לזיהוי צמתים מרכזיים.
בניית מודל סיווג מועמד AF-ERS המבוסס על 12 אלגוריתמים ללמידת מכונה
במחקר זה, פותחה מסגרת סיווג אנסמבל המבוססת על שנים-עשר אלגוריתמים קונבנציונליים של למידת מכונה כדי לסינון גנים מועמדים הקשורים ל-ERS הקשורים ל-AF ולמקסם את ביצועי הסיווג. לחלוקת נתונים, לאחר תקינה ונרמול, GSE41177 ו-GSE79768 אוחדו ליצירת מטריצת ביטוי קבוצת האימון. GSE115574 שימש כקבוצת אימות חיצונית עצמאית להערכת הכללות המודל. באופן ספציפי, DEGs זוהו לראשונה בקבוצת ההכשרה (|log2FC| >0.585, מותאם p < 0.05). ה-DEGs הללו נחתכו לאחר מכן עם גנים מהמודולים המרכזיים של WGCNA וגנים הקשורים ל-ERS, ומערך הגנים שנוצר שימש כתכונות קלט לבניית המודל.
כדי לקשר גנים הקשורים ל-ERS לפנוטיפ AF, פותח מודל סיווג מועמד המשתמש ב-12 גישות למידת מכונה: Lasso, Ridge, מודל ליניארי מוכלל שלב בשלב (Stepglm), הגברת גרדיאנט קיצוני (XGBoost), יער אקראי (RF), רשת אלסטית (Enet), רגרסיה חלקית של מינימום ריבועים למודלים ליניאריים מוכללים (plsRglm), מודל רגרסיה מוגברת מוכללת (GBM), נאיב בייס, ניתוח דיסקרימיננטי ליניארי (LDA), glmBoost, ומכונת וקטור תמיכה (SVM). אומצה אסטרטגיית מידול קומבינטורי שיטתי על ידי הוספת אלגוריתם שני לראשון ואינטגרציה באמצעות α פרמטר הכיוון, מה שהוביל ל-113 שילובים של בחירת תכונות והתאמת מודלים שהוערכו באופן מקיף. הבחנה במודל הוערכה על ידי חישוב השטח מתחת לעקומת המאפיינים התפעולית של המקלט (AUC). לפי קריטריוני בחירת המודל שדווחו בעבר, מסגרת המועמד הסופית הוגדרה כמודל עם הביצועים הכוללים הטובים ביותר, כפי שהוערך על ידי ממוצע AUC בין קבוצות ההכשרה והאימות.
אסטרטגיית המידול הקומבינטורי הזו הושפעה ממחקרים קודמים בלמידת מכונהביו-רפואית 15,16,17. יחד, מחקרים אלו מצביעים על כך שאף אלגוריתם בודד לא מצליח בעקביות על אחרים במערכי נתונים ומשימות אנליטיות. בהתבסס על הנחה זו, אימוץ מסגרת למידה קבוצתית ומידולים קומבינטוריים יכול להגדיל את הסיכוי לקבל מודל מועמד בעל ביצועים גבוהים עם הכללה יציבה יותר ולשפר את עמידות בחירת המודלים.
בהמשך, ערכי SHapley Additive exPlanations (SHAP) יושמו כדי לפרש את מודל למידת המכונה על ידי המחשת המאפיינים המרכזיים שמניעים את סיווג AF, ובכך לכמת את תרומת כל תכונה לתוצאה החזויה והמחשת כיצד גני חתימה בודדים משפיעים על התוצר הסופי של המודל18.
הערכת ביצועי המודל ואימות חיצוני של המודל האופטימלי
ביצועי המודל האופטימלי הוערכו בקבוצת ההכשרה ובקבוצת האימות החיצונית העצמאית (GSE115574). ברמת המודל, נבנתה מטריצת בלבול המבוססת על תוויות המחלקה החזויות, ודווחו מדדי הסיווג המתאימים. עקומות מאפייני הפעלה של מקלט (ROC) נוצרו באמצעות חבילת R pROC, וה-AUC חושב לכימות ביצועים מבחינים.
ברמת הביומרקר, עקומות ROC חד-גני צוירו עבור כל גן מפתח במודל האופטימלי, ו-AUCs המתאימים חושבו כדי להעריך את יכולת ההבחנה האישית שלהם. בנוסף, הביטוי השונה של הגנים המרכזיים סוכם באמצעות גרף הר געש, והשתמשו בתרשימי קופסה להצגת התפלגות הביטוי שלהם במחלות לעומת דגימות בריאות. כדי להעריך עוד את ההכללה של חתימת הגן האופטימלית שהוגדרה מראש על ידי המודל, בוצעה אימות חיצוני עצמאי נוסף באמצעות GSE14975. GSE14975 מכיל נתונים טרנסקריפטומיים מדגימות של איבר עלייה שמאלית, כולל חמש דגימות פרפור עליות וחמש דגימות קצב/ביקורת סינוסים. כל הגנים הכלולים בחתימה הנעולה היו זמינים במאגר נתונים זה. כדי לשמור על עקביות עם תהליך העבודה האנליטי המקורי בין קבוצות קבוצות, קבוצת הפיתוח GSE14975 תואמת באמצעות ComBat עם מקור מערך הנתונים כמשתנה אצווה. ההרמוניזציה הזו בוצעה ללא פיקוח. חשוב לציין שתוויות מחלות/בקרה מ-GSE14975 לא שימשו לבחירת תכונות, הערכת מקדמים, קביעת סף או כיוון היפרפרמטרים.
מודל הניקוד האופטימלי שמבוסס על המודל הותאם באמצעות קבוצת הפיתוח בלבד ואז יושם על GSE14975 לאימות חיצוני. ביצועי המודל ב-GSE14975 הוערכו באמצעות ניתוח עקומת מאפייני תפעול של המקלט, שטח מתחת לעקומה, רווח סמך (CI), רגישות, ספציפיות, דיוק, ערכי חיזוי חיוביים ושליליים, וציון ברייר. בנוסף, נוצרו עקומות ROC חד-גני לכל הגנים האופטימליים שמקורם במודל ב-GSE14975 כדי להמחיש את יכולת ההבחנה האישית שלהם. כדי להעריך עוד את הפוטנציאל של התאמת יתר בקבוצת הפיתוח, בוצעו אימות צולב חוזר של 10 פעמים ותיקון אופטימיות של בוטסטרפ באמצעות חתימת הגן שמקורה במודל האופטימלי הנעול. לצורך אימות הדדי חוזר, קבוצת הפיתוח חולקה שוב ושוב ל-10 חלקיות, והבחנה בין מודלים סוכמה בכל האיטרציות. לצורך אימות בוטסטרפ, נוצרו 1,000 דגימות בוטסטרפ כדי להעריך את האופטימיות של ביצועי קבוצת הפיתוח הנראות לכאורה ולחישוב ה-AUC המתוקן באופטימיות. מכיוון שהחתימה הסופית נגזרה מהמודל האופטימלי, התרומה של כל גן פורשה בעיקר לפי הגודל והכיוון המוחלט של מקדמי המודל. בנוסף, בוצעו ניתוחי ROC חד-גנים GSE14975 כדי להמחיש את יכולת ההבחנה האישית של כל גן רכיב. לצורכי ויזואליזציה, עקומות ROC חד-גני היו מכוונות לשקף יכולת הבחנה ללא קשר לשאלה אם הביטוי הגבוה או הנמוך קשור ל-AF.
ניתוח העשרת קבוצות גנים (GSEA)
כדי לחקור את ההשלכות הפונקציונליות של הגנים המרכזיים, בוצע GSEA באמצעות דגימות מקבוצת המחלה19. לכל גן מפתח, הדגימות חולקו לתת-קבוצות בעלות ביטוי גבוה ונמוך תוך שימוש בערך הביטוי החציוני בקבוצת המחלה כנקודת החיתוך. ההבדל הממוצע בביטוי בין שתי תת-הקבוצות לכל גן חושב, ונוצרה רשימת גנים מדורגת בסדר יורד כקלט לניתוח העשרה. GSEA בוצע באמצעות clusterProfiler של חבילת R, עם מערכי גנים שנאספו מאוסף MSigDB c2.cp.kegg.Hs.symbols.gmt. המובהקות הסטטיסטית הוגדרה כ-p < 0.05. כיוון ההעשרה נקבע לפי סימן ציון ההעשרה המנורמל (NES), ונוצרו גרפים של העשרה עבור מסלולים מייצגים.
הערכת שפע תת-סוג תאי החיסון והביטוי המבדל
אלגוריתם הדקונבולוציה CIBERSORT יושם להערכת השפע היחסי של תת-קבוצות תאי חיסון החודרות והקשרים ביניהם בין דגמים. בהתבסס על מטריצת החתימה של LM22 לויקוציטים, הרכב תאי החיסון הוסקה כמותית מפרופילי ביטוי גנים באמצעות חבילת R CIBERSORT20. סף p < 0.05 שימש לסינון התוצאות, ורק דגימות שעמדו בקריטריון זה נשמרו לניתוחים הבאים. נוצרו תרשימי קופסה כדי להשוות את החלקים היחסיים המוערכים של תת-קבוצות תאי חיסון בין קבוצות AF לקבוצת הביקורת. בנוסף, ניתוח הקורלציה של ספירמן בוצע כדי להעריך את הקשרים בין רמות חדירת תאי מערכת החיסון לבין ביטוי הגנים של האב.
ניתוח תא יחיד
ניתוח טרנסקריפטומי חד-תאי בוצע באמצעות מערך הנתונים GEO GSE165838. מטריצות ספירת תאי גן גולמיות יובאו ל-R ועובדו באמצעות Seurat v4.4.0. לכל דגימה, נוצר אובייקט Seurat באמצעות CreateSeuratObject עם min.cells = 5 ו-min.features = 300. מדדי בקרת איכות, כולל מספר הגנים שזוהו, סך כל מזהה מולקולרי ייחודי (UMI), אחוז הגנים המיטוכונדריאליים, אחוז הגנים הריבוזומליים ואחוז המוגלובין גנטי, חושבו עבור כל תא. התאים נשמרו אם היו להם יותר מ-500 גנים שזוהו, פחות מ-5,000 ספירות UMI, אחוז הגנים המיטוכונדריאלי < 25%, אחוז הגנים הריבוזומליים > 3%, ואחוז המוגלובין < 1%. גנים שזוהו בפחות משלושה תאים הוסרו. גני MALAT1 ומיטוכונדריאלים גם הם הוצאו לפני הניתוח במורד הזרם. DoubletFinder שימש לזיהוי ולהוציא דאבלטים פוטנציאליים. בקצרה, תאים חולקו לפי זהות המדגם, וזיהוי כפול בוצע בנפרד לכל מדגם באמצעות רכיבים עיקריים 1–30.
פרמטר pN הוגדר ל-0.25, והערך האופטימלי של pK נבחר לפי מדד BC מקסימלי שהושג מסריקת פרמטרים. קצב הכפול הצפוי הוערך לפי מספר התאים שנמצאו בכל דגימה, כאשר שיעורים של 2.5%, 5% ו-6.5% שימשו לדגימות עם מספר תאים נמוך יחסית, ביניים וגבוהים, בהתאמה. רק תאים שסווגו כסינגלטים נשמרו. זיהום ה-RNA הסביבתי הוערך עוד באמצעות DecontX, ותאים עם ציון זיהום ≥ 0.2 הוצאו. לאחר בקרת איכות, הסרת דאבלטים וסינון RNA סביבתי, נשמרו 40,886 תאים ו-23,947 גנים לניתוח במורד הזרם. מערך הנתונים החד-תאי המסונן ננורם בשיטת LogNormalize באמצעות גורם קנה מידה של 10,000, ואחריו זיהוי גנים משתנים מאוד. הנתונים הוגדלו לאחר מכן לפני ניתוח הרכיבים העיקריים.
כדי להפחית אפקטים ספציפיים לדגימה, הוחל Harmony באמצעות orig.ident כמשתנה אצווה. ויזואליזציה של קירוב והיטל אחיד של מניפולד (UMAP) ובניית גרף השכן הקרוב ביותר בוצעו באמצעות 15 הממדים הראשונים שתוקנו בהרמוניה21. הקיבוץ בוצע באמצעות אלגוריתם לוון, ונערכו רזולוציות אשכולות מרובות. ההערה הסופית המרכזית של סוג תא התבססה על תוצאת האשכול ברזולוציה 0.05. אשכולות תאים עברו הערות ידניות בהתאם לביטוי גנים של סמן קנוני. אסטרטגיית הסימון המבוססת על סימנים זו תואמת למחקרים קודמים בנושא פרופיל חיסון חד-תאי22. תאי T זוהו על ידי CD3D, CD3E ו-TRAC; תאי הרג טבעיים (NK) על ידי NKG7, GNLY, NCAM1 ו-KLRG1; תאי מונוציטים-מקרופאגים על ידי LYZ, CD14, FCGR3A, CD68, CD163, FCN1, TYROBP, S100A8, ו-S100A9; תאי B של MS4A1 ו-CD79A; תאי פלזמה על ידי MZB1 ו-XBP1; תאי אנדותל על ידי PECAM1, VWF ו-CDH5; תאי שריר חלק כלי דם על ידי ACTA2, TAGLN, MYH11 ו-MYL9; פיברובלסטים על ידי DCN, LUM, COL1A1, COL1A2 ו-PDGFRA; תאים דמויי נויטרופילים על ידי FCGR3B, CXCR2, S100A8 ו-MPO; תאי פיטום על ידי TPSB2; ותאים דנדריטיים על ידי LILRA4, CD1C ו-XCR1. ביטוי גן הסימון בין אשכולות הוצג באמצעות גרפים של נקודות, והתפלגות הביטוי של גני המרכז הסופיים הקשורים ל-ERS הוצגה בהטמעות UMAP.
כדי לכמת את פעילות השעתוק הקשורה ל-ERS ברמת תא יחיד, נעשה שימוש בקבוצת הגנים המרכזית הסופית לחישוב ציוני חתימה תאיים באמצעות AUCell, ניתוח העשרת קבוצות גנים בדגימה בודדת ו-Seurat AddModuleScore. ב-AUCell, דירוגי התאים נבנו מתוך מטריצת ביטוי RNA מנורמלת, וציוני AUC חושבו באמצעות קבוצת הגנים המרכזית שבה 10% הגנים המדורגים העליונים היו סף הדירוג המקסימלי. עבור ssGSEA, ציוני העשרה חושבו באמצעות חבילת GSVA. שלושת תוצרי הניקוד היו ממורכזים ומוגדרים, לאחר מכן נורמל מינימום-מקסימום, ולבסוף סוכמו ליצירת ציון משולב משולב הקשור ל-ERS לכל תא. התפלגות הציון המשולב הושוותה בין אוכלוסיות תאים עם הערות כדי להעריך את ההטרוגניות של סוגי התאים בתוכנית הקשורה ל-ERS. מכיוון ששושלת המונוציטים-מקרופאגים הציגה העשרת חתימה בולטת הקשורה ל-ERS והייתה קשורה קשר הדוק לשחזור חיסוני-דלקתי, היא נבחרה לניתוחים נוספים בתוך השושלת. תאי מונוציטים-מקרופאגים חולקו לקבוצות בעלות ציון גבוה ונמוך לפי ציון משולב חציוני הקשור ל-ERS. לאחר מכן בוצע ניתוח מסלול פסאודוטיים על תאי מונוציטים-מקרופאגים באמצעות מונוקל.
לניתוח פסאודו-זמן, נוצר אובייקט CellDataSet מתוך מטריצת הספירה הגולמית באמצעות מודל ביטוי בינומי שלילי. לאחר מכן הוערכו גורמי גודל ופיזורים. גני הסדר נבחרו באמצעות סף ביטוי ממוצע של ≥ 0.1 ופיזור אמפירי גבוה מהפיזור המותאם. הממדיות הופחתה באמצעות אלגוריתם DDRTree, והתאים סודרו לאורך המסלול המוסק. דפוסי הביטוי הדינמיים של גני המרכז הקשורים ל-ERS לאורך זמן פסאודוטיים הוצגו. ניתוח תקשורת תא-תא בוצע באמצעות CellChat כדי לחקור אינטראקציות פוטנציאליות בין ליגנד-קולטן בין תאי מונוציטים-מקרופאגים עם ציונים שונים הקשורים ל-ERS. לצורך ניתוח זה, תאי מונוציטים-מקרופאג' סומנו כבעלי ציון גבוה או נמוך לפי ציון מורכב חציוני, בעוד שתאים אחרים שמרו על תוויות סוג התאים המקוריות שלהם. מטריצת ביטוי ה-RNA המנורמל וההערות המתאימות של קבוצת תאים שימשו ליצירת אובייקט CellChat. לניתוח תקשורת תא-תא, נבחר מסד הנתונים האנושי CellChatDB, ורק אינטראקציות איתות מופרשות הוערכו. גנים מבוטאים יתר וזוגות ליגנד-קולטנים זוהו לפני חישוב הסתברויות התקשורת. קבוצות תאים שכללו פחות מ-10 תאים הוצאו מניתוח האינטראקציה. לאחר מכן הוערכו ואוגדו הסתברויות תקשורת ברמת המסלול כדי להשוות את מספר ועוצמת האינטראקציות בין אוכלוסיות תאים. כדי להקל על השכפול, מוצגת טבלת נקודות ביקורת למטה המקשרת כל שלב פרוטוקול למספר או לטבלה הצפויה המתאימה לו (קובץ משלים 1—טבלה משלימה S2).