מחקר זה אושר על ידי ועדת הביקורת המוסדית של בית החולים הראשון המסונף של אוניברסיטת בנגבו לרפואה (מספר אישור: 2023YJS162). התקבלה הסכמה בכתב מדעת מכל המשתתפים לפני איסוף הדגימה.
איסוף נתונים
נתוני הטרנסקריפטום ששימשו במחקר זה התקבלו ממאגר Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). מאגר הנתונים הראשי של האימון, GSE150910, נוצר באמצעות פלטפורמת Illumina NovaSeq 6000 (GPL24676) וכלל 103 דגימות IPF ו-103 דגימות רקמת ריאה תקינה. לאימות הממצאים, נעשה שימוש במערכי נתונים עצמאיים GSE24206, GSE110147, GSE93606 ו-GSE38958. מידע מפורט על כל מערך נתונים מסופק בטבלה 1. בנוסף, נבחרו בסך הכל 636 קבוצות GRG מתוך מחקר שפורסםקודם לכן, 14.
ניתוח ביטוי דיפרנציאלי ואפיון פונקציונלי של DEGs הקשורים לגליקוזילציה
ניתוח ביטוי שונה בין IPF לדגימות רקמת ריאה תקינות מתוך מאגר הנתונים GSE150910 בוצע באמצעות חבילת R DESeq2 (RRID: SCR_015687). גנים עם ערך P מותאם (padj) < 0.05 ו-|log2FoldChange| > 0.5 נחשבו גנים מבוטאים באופן שונה (DEGs). DEGs הקשורים לגליקוזילציה (GR-DEGs) זוהו על ידי חיתוך ה-DEGs עם קבוצה מוגדרת מראש של 636 GRGs. כדי לחקור עוד את התפקידים הביולוגיים של גנים אלו, בוצעו ניתוח העשרת גנים אונטולוגיה (GO) וניתוח מסלולים של אנציקלופדיית קיוטו לגנים וגנומים (KEGG) כדי להבהיר את תפקידיהם הפונקציונליים ואת מעורבתם במסלול. רשת אינטראקציה בין חלבון לחלבון (PPI) נוצרה באמצעות מאגר הנתונים STRING (RRID: SCR_005223)15 עם סף אמון אינטראקציה של > 0.7, כדי להבהיר את האינטראקציות המולקולריות והמנגנונים הרגולטוריים הפוטנציאליים של GR-DEGs ב-IPF.
סקר גנים מרכזיים ובניית מודל אבחוני
כדי לסנן גנים מרכזיים ל-IPF מ-GR-DEGs, השתמשנו במספר אלגוריתמים של למידת מכונה. בתחילה, רגרסיית LASSO (RRID: SCR_003418) הותקנה עם רגרסיה לוגיסטית בינארית (משפחה = "בינומי") ופרמטר העונש האופטימלי λ נבחר באמצעות אימות צולב של 10 פעמים (nfold = 10). תוצאות הבחירה הסופיות היו התכונות עם מקדמים שאינם אפס התואמים λ_(min) (0.01700442). עבור SVM-RFE, נעשה שימוש בפונקציית RFE מה-R package caret. הסרת תכונות רקורסיבית בוצעה באמצעות אימות צולב של 10 פעמים (שיטה = "cv", מספר = 10), תוך סינון הדרגתי של תכונות מ-1 עד 126, עם דיוק לקביעת תת-הקבוצה האופטימלית של התכונות. ב-XGBoost, פונקציית המטרה הוגדרה לרגרסיה לוגיסטית בינארית (objective = "בינארי: לוגיסטי"), כאשר מדד ההערכה מוגדר ל-log loss (eval_metric = "logloss"), מספר האיטרציות (nrounds) הוגדר ל-100, וקצב הלמידה (ETA) מוגדר ל-0.1. 20 הגנים המובילים נבחרו על פי ציוני חשיבות התכונות שלהם (Gain). על ידי חיתוך התוצאות של שיטות אלו, זוהה סט מעודן של גנים מרכזיים. בהתבסס על מערך גנים זה, נבנה מודל אבחוני XGBoost באמצעות מאגר הנתונים של האימון (GSE150910), והביצועים החיזויים שלו הוערכו באמצעות ניתוח מאפייני הפעלה של מקלט (ROC) על מאגרי אימות חיצוניים (GSE110147, GSE24206, GSE93606 ו-GSE38958). בנוסף, פותחה נומוגרמה להמחשת תרומתו של כל גן שנבחר להסתברות המחלה, והשימושיות הקלינית של המודל הוערכה באמצעות עקומות כיול וניתוח עקומות החלטה (DCA).
חקר המסלולים הביולוגיים של גנים מרכזיים
לחקור את ההקשר הביולוגי של הגנים המרכזיים שזוהו על ידי למידת מכונה. ניתוח העשרת מערך גנים (GSEA)16 בוצע בהתבסס על רשימות הגנים מ-Molecular Signatures Database (MSigDB) (RRID: SCR_016863)17והמסלולים נבדקו ל-NES > 1. המסלולים המועשרים העליונים הוצגו באמצעות פונקציית enrichplot.
חקר תפקוד ביולוגי והבדלים בנוף החיסון בתתי-סוגים של IPF בהתבסס על ציוני גנים מרכזיים
בהתבסס על פרופילי הביטוי של הגנים המרכזיים שזוהו, חושבו ציוני ניתוח העשרת מערך גנים (ssGSEA) במדגם יחיד ושימשו לחלוקת מטופלי IPF לקבוצות עם ציון גבוה ונמוך, בהתבסס על הציון החציוני. בוצע ניתוח ביטוי שונה בין שתי הקבוצות, ואחריו ניתוח GSEA (RRID: SCR_003199)18 לביצוע ניתוחי העשרת מסלולי GO Biological Processes (GOBP) ו-KEGG על ה-DEGs.
ניתוח חדירת תאי חיסון והבדלים מרכזיים בביטוי גנים
לאחר שכבות תת-קבוצות בהתבסס על ציוני ssGSEA, הוערכו הבדלים בחדירת מערכת החיסון בין קבוצות הציון הגבוה והנמוך. ראשית, חישבנו את השפע היחסי של 22 סוגי תאי מערכת החיסון בדגימות באמצעות אלגוריתם CIBERSORT (RRID: SCR_016955)19 בשילוב עם מטריצת התכונות LM22. באופן ספציפי, פונקציית ה-deconv_tme בחבילת R IOBR (פרמטרים: שיטה = "cibersort", arrays = FALSE, perm = 200) שימשה לחישובים, וגרפים קופסה נוצרו באמצעות חבילת ggpubr (RRID: SCR_021139) להערכת הבדלים בחדירת תאי החיסון בין קבוצות עם ציון גבוה לקבוצות עם ציון נמוך. בנוסף, פונקציית ה-GSVA בחבילת R GSVA (בשיטת ssGSEA) שימשה לחישוב ציוני העשרה עבור 28 סוגי תאי חיסון. הציונים הללו נרמו לאחר מכן באמצעות קנה מידה מינימלי-מקסי כדי למפות אותם למרווח [0, 1], מה שהקל על השוואות בין סוגי תאים. לבסוף, בוצעו בדיקות סכום דירוג של וילקוקסון להשוואת ביטוי גנים מרכזיים בין דגימות תקינות למטופלי IPF במאגרי הנתונים GSE150910 ו-GSE110147, וסיפקו ניתוח מקיף של חדירת תאי חיסון והבדלים בביטוי גנים בין תת-קבוצות IPF.
אימות גנים מרכזיים בחולי IPF באמצעות ניתוח RT-qPCR
כדי לאמת את הרלוונטיות האבחנתית של הגנים שזוהו, נבחרו שישה גנים עם ציוני החשיבות הגבוהים ביותר מאלגוריתם XGBoost לאימות רמת הביטוי בקרב מטופלי IPF ובקרות בריאות באמצעות PCR כמותי עם שעתוק הפוך (RT-qPCR). בסך הכל נאספו 20 דגימות דם, כולל 9 מחולות IPF ו-11 מאנשים בריאים, מבית החולים הראשון המסונף של אוניברסיטת בנגבו לרפואה. סך ה-RNA הוצא מדגימות הדם, וריכוז ה-RNA נמדד באמצעות קורא מיקרופלט רב-תכליתי. איכות ה-RNA הוערכה לפני ניתוחים במורד הזרם. DNA גנומי הוסר במהלך שעתוק הפוך, ורצפי פריימר ששימשו ל-RT-qPCR מפורטים בטבלה 2. ספציפיות הפריימר אושרה באמצעות ניתוח עקומת התכה. GAPDH שימש כגן ייחוס פנימי. רמות ביטוי הגנים היחסיות חושבו באמצעות שיטת 2-ΔΔCt . שלב האימות הזה מספק תמיכה ניסויית ראשונית לביטוי שונה ולרלוונטיות האבחנתית הפוטנציאלית של הגנים שזוהו ב-IPF.
ניתוח סטטיסטי
הנתונים נותחו ב-R, ומבחן וילקוקסון שימש לזיהוי הבדלים בין שתי הקבוצות. ניתוח העשרת GSEA, GO ו-KEGG בוצעו באמצעות clusterProfiler של חבילת R (RRID: SCR_016884). ערך p < 0.05 נחשב משמעותי אלא אם צוין אחרת.