מחקר זה מציג תהליך עבודה (pipeline) ביו-אינפורמטיי הש可-שחזור, המשלב טרנסקריפטומיקה, למידת מכונה וניתוח חדירה חיסונית, במטרה לזהות סמנים ביולוגיים אבחנתיים פוטנציאליים ורשתות בקרה במחלה ריאתית חסימה כרונית (COPD).
מאמר מחקר
* These authors contributed equally
מחקר זה מציג תהליך עבודה (pipeline) ביו-אינפורמטיי הש可-שחזור, המשלב טרנסקריפטומיקה, למידת מכונה וניתוח חדירה חיסונית, במטרה לזהות סמנים ביולוגיים אבחנתיים פוטנציאליים ורשתות בקרה במחלה ריאתית חסימה כרונית (COPD).
COPD היא הפרעה נשימתית פרוגרסיבית המאופיינת בהגבלה מתמשכת של זרימת האוויר ובדלקת כרונית, אך תפקידה של מודיפיקציית ה-RNA מסוג N4-acetylcytidine (ac4C) בפתוגנזה שלה נותר במידה רבה לא חקורה. מחקר זה נועד לסרוק באופן שיטתי גנים הקשורים ל-ac4C (ac4C-RGs) מתוך מאגר נתונים שפורסם ולחקור את רשתות הבקרה שלהם ב-COPD, ובכך לזהות סמנים ביולוגיים פוטנציאליים למחקרי מנגנון נוספים, מבלי להניח קשר רגולטורי ישיר בין גן ספציפי כלשהו לבין מודיפיקציית ac4C. גנים בעלי ביטוי שונה (DEGs) זוהו מתוך פרופילים טרנסקריפטומיים, וניתוח רשת ביטוי משותף משוקלל (WGCNA) הוחל כדי לחשוף מודולים מרכזיים של ביטוי משותף. בוצע ניתוח הצלבה בין ה-DEGs, המודולים המשמעותיים וה-ac4C-RGs. גנים מרכזיים נסרקו באמצעות רגרסיית LASSO, אלגוריתמי XGBoost ויער אקראי (random forest), ולאחריהם נבנה מודל אבחנתי המבוסס על רגרסיה לוגיסטית. ביצועי המודל הוערכו באמצעות ניתוח עקומת מאפייני תגובה (ROC), שטח תחת העקומה (AUC) עם רווחי סמך של 95%, הערכת עקומת כיול וניתוח עקומת החלטה (DCA). בסך הכל זוהו 160 גנים חופפים, ושישה גני מפתח (PTRF, PRKCDBP, UPP1, TOR3A, FAM168B, ו-B4GALT2) נבחרו באופן עקבי על ידי כל שלושת אלגוריתמי הלמידה המכונה. המודל האבחנתי הפגין ביצועי הבחנה טובים, עם AUC של 0.766, 0.759 ו-0.723 בקבוצת האימון, בבדיקה הפנימית ובקבוצת התיקוף החיצונית, בהתאמה. ניתוח רשת הבקרה הצביע על צירים פוטנציאליים של ceRNA ואינטראקציות של גורמי שעתוק, בעוד שפרופיל חדירת תאי מערכת החיסון חשף מתאמים משמעותיים בין גנים מרכזיים למספר תתי-אוכלוסיות של תאי חיסון. ניתוח אינטראקציה תרופה-גן וסימולציית עגינה מולקולרית (molecular docking) הצביעו על כך ש-fluorouracil, capecitabine ו-5-benzylacyclouridine עשויים להפגין זיקות קישור חזויות חיוביות עם UPP1. לסיכום, PTRF, PRKCDBP, UPP1, TOR3A, FAM168B ו-B4GALT2 זוהו כסמנים ביולוגיים פוטנציאליים הקשורים ל-ac4C ב-COPD, העשויים להיות מעורבים בבקרה חיסונית ומטבולית, ובכך הם מספקים בסיס למחקרי תפקוד וחקירה טיפולית בעתיד.
COPD היא הפרעה נשימתית כרונית והטרוגנית המתאפיינת בהגבלה פרוגרסיבית של זרימת האוויר כתוצאה מפתולוגיות במבני הנאולבוליים ובדרכי הנשימה1,2. חוסר איזון בין פרוטאז לאנטי-פרוטאז, עקה חמצונית, דלקת כרונית והזדקנות תאית מהווים את מנגנוני הפתופיזיולוגיה המרכזיים של COPD, המובילים להרס מבני ולפגיעה תפקודית של רקמת הריאה3,4. יתרה מכך, COPD מושפעת מגורמי סיכון מרובים, כולל עישון ממושך, זיהום סביבתי, חשיפה תעסוקתית, זיהומים נשימתיים ונטייה גנטית5,6. COPD הטילה נטל משמעותי על הכלכלה העולמית. צפוי כי היא תהווה 0.111% מהתוצר המקומי הגולמי העולמי מדי שנה בין השנים 2020 ל-20507. למרות שאסטרטגיות טיפוליות נוכחיות, כגון מרחיבי סימפונות, קורטיקוסטרואידים בשאיפה, שיקום ריאתי וטיפול בחמצן לטווח ארוך, יכולות להקל על התסמינים, עצירת התקדמות המחלה נותרה מאתגרת. בשל הטרוגניות קלינית בולטת, תוצאות הטיפול במטופלים משתנות במידה רבה8. לפיכך, קיימים צרכים דחופים לסמני ביולוגים אבחנאיים חדשניים ומדדי פרוגנוזה כדי לשפר את הניהול של COPD ולהגביר את הישרדות המטופלים.
מודיפיקציה של RNA מתייחסת לשינוי כימי של מולקולות RNA, אשר יכול לשנות את מבנה ה-RNA ותפקודו כדי לווסת את ביטוי הגנים9,10. מודיפיקציות נפוצות של RNA כוללות N6-methyladenosine (m6A), pseudouridine (Ψ), 5-methylcytosine (m5C), ו-ac4C11. המודיפיקציה ac4C ממלאת תפקיד מכריע בשימור יציבות ה-mRNA ובקידום תרגום ה-mRNA12,13. NAT10 הוא האנזים האיקריוטי היחיד המוכר המקטליז את מודיפיקציית ac4C, ופעילותו חיונית להיווצרות מודיפיקציה זו14. מחקרים הראו מתאם חזק בין עקה חמצונית, הזדקנות תאית, דלקת ומודיפיקציית ac4C. לדוגמה, לימפוציטים T מסוג +CD4 ברקמות מעי גדול של אנשים עם מחלה דלקתית של המעי (IBD) מראים רמות מוגברות באופן ניכר של NAT1015. NAT10 מגביר את האצטילציה של ac4C בכימוקינים CCL2 ו-CXCL1, ובכך מקדם חדירה של מקרופגים ונויטרופילים ומחמיר את הנזק הדלקתי16. התגובה התאית לעקה חמצונית עשויה לערב מודיפיקציית ac4C, כפי שעולה מהעלייה הבולטת ברמות ac4C תחת עקה חמצונית. בנוסף, NAT10 מקדם פיברוזיס ריאתי המושרה על ידי PM2.5 על ידי ייצוב mRNA של TGFB1 באמצעות מודיפיקציית ac4C, ובכך מפעיל מעבר אפיתליאלי-מזנכימלי17. עם זאת, תפקידה של מודיפיקציית ac4C ב-COPD נותר במידה רבה לא חקרה, דבר המדגיש את הצורך במחקר נוסף בתחום זה.
במחקר זה נעשה שימוש במסד הנתונים GEO כדי לזהות DEGs בין חולי COPD לבקרה. לאחר מכן, רשימה מפורסמת של ac4C-RGs, שנאספה מנתוני multiomics18, שולבה עם ה-DEGs כדי לזהות מועמדים חופפים. בהינתן שמוכר כי מודיפיקציית ac4C משפיעה על דלקת ועקה חמצונית – תהליכים מרכזיים ב-COPD – השערנו שגנים הקשורים לרשת הבקרה של ac4C עשויים להיות בעלי ביטוי משתנה (dysregulated) ב-COPD. עם זאת, הגנים החופפים לא נחשבו כמסובסטראטים ישירים של NAT10 או כגנים המהווסים ישירות על ידי ac4C; תוכו שהם מועמדים הקשורים לרשת הקשורה ל-ac4C. גנים מרכזיים סוננו באמצעות מספר אלגוריתמים של למידה חישובית (machine learning), ולאחריהם נבנה וותוקף מודל אבחנתי. בהמשך, נקבעו מסלולים רלוונטיים המעורבים בפתוגנזה של COPD, ונחזו תרופות פוטנציאליות למטרה זו. לבסוף, בוצעו בדיקות RT-qPCR כדי לאשר את רמות הביטוי של הגנים המרכזיים, ובכך סופקו תובנות ראשוניות לגבי הפתופיזיולוגיה של COPD ונתיבים פוטנציאליים לחקר טיפולי.
הצהרת ועדת אתיקה מוסדית
מחקר זה נערך בהתאם להצהרת הלסינקי. הפרוטוקול אושר על ידי ועדת האתיקה של בית החולים לרפואה סינית מסורתית שנגז'ן לוהו (מספר אישור 2024-LHQZYYYXLL-KY-039), והסכמה מדעת בכתב התקבלה מכל המשתתפים לפני גיוסם. פרטים על כלי המחקר והחומרים ששימשו בפרוטוקול זה מפורטים ב- טבלת חומרים.
מקור הנתונים ועיבודם
מאגרי נתונים של ביטוי גנים הקשורים ל-COPD הושגו ממאגר ה-Gene Expression Omnibus (GEO). מאגר הנתונים GSE54837 שימש כמאגר הטרנסקריפטום, ומאגר הנתונים GSE112811 שימש כקבוצת אימות (טבלה 1). הגנים ac4C-RGs נאספו מהספרות המקצועית18. גנים בעלי ביטוי Differentially Expressed Genes (DEGs) בין קבוצת ה-COPD לקבוצת הביקורת זוהו באמצעות חבילת ה-R הנקראת limma. DEGs נחשבו למשמעותיים מבחינה סטטיסטית אם |log2FC| > 0 ו- p < 0.05. גרפי Volcano נוצרו כדי להמחיש את ההתפלגות הכללית של שינויים בביטוי הגנים.
בניית WGCNA
ניתוח WGCNA בוצע על מערך הנתונים GSE54837 באמצעות R כדי לזהות מודולים הקשורים ל-COPD. לפני בניית הרשת, דגימות חריגות זוהו והוסרו באמצעות ניתוח מקבצים היררכי (hierarchical clustering) בעזרת הפונקציה hclust בשיטת קישור ממוצע (average linkage) ומדד מרחק אוקלידי. נבחר הספק סף-רך אופטימלי (β = 10) כדי להשיג מדד התאמה של טופולוגיה חסרת קנה מידה R2 ≥ 0.85, תוך איזון בין הטופולוגיה חסרת קנה המידה לבין קישוריות ממוצעת. נבנתה מטריצת סמיכות אשר הומרה למטריצת חפיפה טופולוגית (TOM). מודולי גנים זוהו באמצעות אלגוריתם חיתוך עץ דינמי (deepSplit = 2, minClusterSize = 50). מודולים עם מתאם גן-עצמי (eigengene correlations) > 0.75 מוזגו לאחר מכן באמצעות הפונקציה mergeCloseModules. גני-העצם של המודולים הוקשרו לאחר מכן למאפיינים קליניים (סטטוס COPD, גיל, מין ומצב עישון) באמצעות מקדמי מתאם של פירסון, כדי לזהות מודולים הקשורים ל-COPD לצורך ניתוח המשך.
סינון, אנליזה של העשרה ואנליזה של רשת PPI של גנים חופפים
דיאגרמת ונ (Venn diagram) נוצרה באמצעות חבילת ה-R בשם ggvenn כדי לזהות גנים חופפים בקרב ה-DEGs, הגנים של מודול MEsalmon ו-ac4C-RGs. ניתוח העשרה תפקודי של הגנים החופפים בוצע באמצעות מאגרי המידע Gene Ontology (GO) ו-Kyoto Encyclopedia of Genes and Genomes (KEGG) בעזרת חבילת ה-R בשם clusterProfiler. מידע על אינטראקציות חלבון-חלבון (PPI) הופק ממאגר המידע STRING (https://string-db.org/) כדי לנתח אינטראקציות ברמת החלבון בין הגנים החופפים. תוכנת Cytoscape שימשה להדמיה חזותית של רשת ה-PPI שהתקבלה.
זיהוי גנים מרכזיים באמצעות למידת מכונה
שלוש טכניקות של למידה חישובית יושמו: רגרסיית least absolute shrinkage and selection operator (LASSO), extreme gradient boosting (XGBoost) ו-random forest (RF). רגרסיית LASSO הוטמעה באמצעות חבילת glmnet עם תיקוף צולב בעשרה (10-fold cross-validation) כדי לקבוע את פרמטר העונש האופטימלי λ. הפרמטר type.measure הוגדר כ-"deviance", והפרמטר family הוגדר כ-"binomial". ה-λ האופטימלי נבחר לפי קריטריון λmin, הממזער את ה-deviance בתיקוף הצולב, ובכך הניב 17 גנים. XGBoost בוצע באמצעות חבילת xgboost עם ההיפר-פרמטרים הבאים: nrounds = 100, max_depth = 6, eta = 0.3, subsample = 0.8, colsample_bytree = 0.8, ו-eval_metric = "logloss". חשיבות המאפיינים דורגה לפי מדד ה-gain, ו-30 הגנים המובילים נבחרו. Random forest הוטמעה באמצעות חבילת randomForest עם ntree = 200. חשיבות המאפיינים דורגה לפי mean decrease in Gini, ו-30 הגנים המובילים נבחרו. הגנים שנבחרו על ידי שלוש שיטות הלמידה החישובית נחתכו כדי לזהות גנים מרכזיים לניתוחים עוקבים.
בנייה והערכה של מודל רגרסיה לוגיסטית לחיזוי סיכונים
את מערך הנתונים GSE54837 חילקו באופן אקראי לקבוצת אימון (70%) ולקבוצת בדיקה (30%). מודל רגרסיה לוגיסטית נבנה על קבוצת האימון באמצעות הפונקציה glm מחבילת MASS, כאשר רמות הביטוי של גנים מרכזיים שימשו כמאפייני קלט. ביצועי המודל הוערכו באמצעות עקומות ROC שנוצרו בעזרת חבילת pROC. רווחי סמך של 95% עבור ה-AUC חושבו באמצעות 2,000 חזרות bootstrap. כיול המודל נבחן באמצעות עקומות כיול שנוצרו עם 1,000 דגימות bootstrap חוזרות (חבילת rms). ניתוח DCA בוצע באמצעות חבילת dca כדי להעריך את התועלת הקלינית נטו על פני טווח של הסתברויות סף. נומוגרמה נבנתה באמצעות הפונקציה nomogram מחבילת rms כדי להקל על הערכת סיכון פרטנית.
משוואת הרגרסיה הייתה:
logit(P) = 0.5823 + 0.6010 × UPP1 - 0.6563 × PTRF + 0.3853 × B4GALT2 - 0.3972 × FAM168B + 0.1848 × PRKCDBP - 0.4787 × TOR3A. (1)
כאן, P מייצג את ההסתברות החזויה ל-COPD, וכל מקדם מייצג את התרומה של ערך ביטוי הגנים המתאים ל-log odds של COPD.
ניתוח ביטוי, רשת GeneMANIA ורשת בקרה מולקולרית
רמות ביטוי הגנים בין קבוצת ה-COPD לקבוצת הביקורת במערך הנתונים GSE54837 הושוו באמצעות מבחן Wilcoxon rank-sum. תרשימי קופסה (Box plots) נוצרו באמצעות חבילת ggplot2 כדי להמחיש את התפלגות רמות הביטוי, כאשר החציונה, הטווח הבין-רבעוני (IQR) ונקודות נתונים בודדות הוצגו על גבי התרשים. GeneMANIA שימשה לבניית רשתות גנים ולניבוי אינטראקציות תפקודיות. החיפוש בוצע עם פרמטרי ברירת המחדל: species = Homo sapiens, maximum related genes = 20. הרשת שהתקבלה הורדה והוצגה ויזואלית, כאשר צבעי הקשרי הרשת (edges) מצביעים על סוגי האינטראקציות. רשת RNA אנדוגנית תחרותית (ceRNA) נבנתה כדי לחקור מנגנוני בקרה פוסט-טרנסקריפציונליים. miRNA-ים המכוונים לששת הגנים המרכזיים נחזו באמצעות שני מאגרי נתונים בלתי תלויים: DIANA-microT (score ≥ 0.8) ו-miRanda (score ≥ 140, energy ≤ −20 kcal/mol). החיתוך של ה-miRNA-ים שזוהו בשני מאגרי הנתונים שימש לבניית זוגות miRNA-mRNA. לאחר מכן, lncRNA-ים המכוונים ל-miRNA-ים אלו נחזו באמצעות מאגר הנתונים StarBase. רשת בקרה של lncRNA-miRNA-mRNA נבנתה והוצגה ויזואלית באמצעות Cytoscape. קשרי בקרה טרנסקריפציונליים נחזו באמצעות ChIP-X Enrichment Analysis Version 3 (ChEA3). עבור כל גן מרכזי עם TFs שנחזו, נבחרו 10 גורמי השעתוק בעלי ציוני ההעשרה הגבוהים ביותר. רשת בקרה של TF-target נבנתה ב-Cytoscape.
ניתוח העשרה של קבוצות גנים והערכת חדירה של תאי מערכת החיסון
ניתוח העשרה של קבוצות גנים (GSEA) בוצע באמצעות חבילת clusterProfiler כדי לחקור את התפקודים הביולוגיים של כל גן מרכזי. עבור כל גן מרכזי, הדגימות חולקו לקבוצות של ביטוי גבוה וביטוי נמוך על בסיס ערך החציונה. ניתוח ביטוי דיפרנציאלי בין שתי הקבוצות בוצע באמצעות limma, ורשימת הגנים שהתקבלה דורגה לפי ה-signed log₂ fold-change. GSEA בוצע באמצעות הפונקציה gseGO עבור מונחי תהליכים ביולוגיים של GO והפונקציה gseKEGG עבור מסלולי KEGG, עם הפרמטרים הבאים: minGSSize = 10, maxGSSize = 500, pvalueCutoff = 0.05, ו-nPerm = 1,000. השפעות יחסית של 28 סוגי תאי חיסון נאמדו באמצעות ניתוח העשרה של קבוצות גנים לדגימה בודדת (ssGSEA) שיושם בחבילת GSVA. מטריצת חתימות של קבוצות גנים נבחרות המכילה גנים מסמנים עבור 28 סוגי תאי חיסון הושגה מספרה ספרותית קודמת19. עבור כל דגימה, הפונקציה gsva הוחלה עם method = "ssgsea", ssgsea.norm = TRUE, ו-kcdf = "Gaussian". מקדמי מתאם של Spearman בין ציוני ההעשרה של ssGSEA לבין רמות הביטוי של ששת הגנים המרכזיים חושבו באמצעות הפונקציה cor.test. ערכי ה-p עברו התאמה לבדיקות מרובות באמצעות שיטת Benjamini-Hochberg. מטריצת המתאם הוצגה חזותית כמפת חום (heatmap) באמצעות חבילת pheatmap.
חיזוי תרופות, עגינה מולקולרית ואנליזה של קשרי מחלות
תרכובות טיפוליות פוטנציאליות המכוונות לגנים מרכזיים זוהו באמצעות מאגר הנתונים DrugBank. רשת אינטראקציות של "תרופה המכוונת לגן מרכזי" נבנתה ב-Cytoscape כדי להציג באופן חזותי אינטראקציות חזויות בין תרופות לגנים. ביצוע עגינה מולקולרית (Molecular docking) בוצע באמצעות פלטפורמת CB-Dock2 כדי להעריך זיקות קישור. מבנה החלבון התלת-ממדי של UPP1 אנושי נשלף ממאגר החלבונים (PDB ID: 7B8T). מבנים מולקולריים של תרופות (בפורמט SMILES) התקבלו מ-PubChem. העגינה בוצעה באמצעות מנוע AutoDock Vina, והתוצאות דורגו לפי אנרגיה חופשית של קישור (ΔG, ביחידות kcal/mol). קומפלקסים של עגינה הוצגו חזותית באמצעות PyMOL. קשרים בין גנים מרכזיים למחלות אנושיות הקשורות לחשיפות סביבתיות נחקרו באמצעות מאגר הנתונים Comparative Toxicogenomics Database (CTD). עבור כל גן בוצעה שאילתה בנפרד, ועשר המחלות בעלות הקשר החזק ביותר הופקו והוצגו באמצעות תרשימי רדאר.
פרוטוקול RT-qPCR
דגימות דם ורידי פריפריות נאספו משמונה חולי COPD ושמונה ביקורות בריאות בבית החולים לרפואה סינית מסורתית שנג'ן לוהו (Shenzhen Luohu Hospital of Traditional Chinese Medicine). COPD אובחן על פי הקריטריונים של היוזמה הגלובלית למחלות ריאה חסרמיות כרוניות (GOLD), שהוגדרה כ-FEV1/FVC לאחר הרחבת סימפונות < 0.70. קבוצת הביקורת כללה מתנדבים בריאים שהותאמו לפי גיל ומגדר, ללא היסטוריה של מחלות נשימה ובדיקות תפקודי ריאה תקינות (FEV1% חזוי ≥ 80% ו-FEV1/FVC ≥ 0.70). המידע הבסיסי של החולים מוצג ב-טבלה 2. RNA כולל הופק מדגימות דם של חולי COPD באמצעות ערכה להפקת RNA מדם. עבור סינתזת cDNA, כמות של 500 ng של RNA כולל עברה שעתוק הפוך באמצעות ערכה לסינתזת cDNA עם הסרת DNA גנומי לפי הפרוטוקול המסופק. ה-cDNA שהתקבל דולל לריכוז של 150 ng/μL.
ביצוע RT-qPCR בוצע באמצעות תערובת מאסטר ל-qPCR מבוססת SYBR Green במערכת PCR בזמן אמת. כל תגובה בנפח 10 μL הכילה 5 μL של תערובת מאסטר 2x SYBR Green, 0.5 μL של פריימרים קדמיים ואחוריים (10 μM), 1 μL של cDNA מהולל (15 ng/μL), ו-3 μL של מים נקיים מנוקלאז. תנאי המחזור כללו דנטורציה ראשונית ב-95 °C למשך 5 min, ולאחריה 40 מחזורים של 95 °C למשך 10 s ו-60 °C למשך 30 s, עם ניתוח עקומת התכה סופית מ-60 °C עד 95 °C לאימות סגוליות ההגברה. כל התגובות בוצעו בשלוש חזרות טכניות. β-actin שימש כגן ייחוס פנימי. יעילות הפריימרים עבור כל גן מטרה אומתה באמצעות סדרת דילול של עקומת סטנדרט ונעה בין 90% ל-110%. רמות ביטוי הגנים נורמלו ל-β-actin, והביטוי היחסי חושב בשיטת 2-ΔΔCt. השוואות סטטיסטיות בין קבוצת COPD לקבוצת הביקורת בוצעו באמצעות מבחן Mann-Whitney U.
ניתוח סטטיסטי
ויזואליזציות של הרשתות נוצרו באמצעות Cytoscape, וניתוחים סטטיסטיים בוצעו באמצעות תוכנת R. אלא אם צוין אחרת, נעשה שימוש במבחן Mann-Whitney U עבור נתונים בעלי התפלגות שאינה נורמלית, ובמבחן Student's t-test עבור נתונים בעלי התפלגות נורמלית להשוואה בין שתי קבוצות. ערך של p < 0.05 נחשב למשמעותי מבחינה סטטיסטית.
זיהוי גנים חופפים, ניתוח העשרה ובניית רשת PPI
מתוך מערך הנתונים GSE54837, זוהו 3,371 גנים עם ביטוי Differentially Expressed (DEGs), הכוללים 1,675 גנים עם ביטוי מוגבר (upregulated) ו-1,696 גנים עם ביטוי מופחת (downregulated). 10 הגנים בעלי רמות הביטוי המוגבר והמופחת המשמעותיות ביותר מוצגים ב- איור 1Aבוצעו קיבציות היררכיות (Hierarchical clustering) של נתוני GSE54837 (איור משלים 1A), ויושם סף רך (soft-thresholding) של 10 כדי להבטיח טופולוגיה של רשת נטולת קנה מידה (scale-free network topology) (איור 1Bמודולים של ביטוי גנים משותף (gene co-expression modules) נבנו באמצעות שיטת dynamic tree cut עם גודל מודול מינימלי של 50 גנים, ולכל מודול הוקצה צבע נפרד (איור משלים 1B). מודולים עם מתאמי גן-עצמי (eigengene correlations) > 0.75 מוזגו לאחר מכן (איור משלים 1C, איור 1C), מה שהביא ל-14 מודולים נפרדים. על בסיס ניתוח מתאם פירסון (Pearson correlation) בין הגנים המייצגים של המודולים (module eigengenes) לבין מאפיינים קליניים, מודול ה-MEsalmon (הכולל 5,226 גנים) הפגין את המתאם החיובי המשמעותי ביותר עם COPD (r = 0.35, p = 7 x 10⁻8, איור 1Dניתוח ון (Venn analysis) זיהה 160 גנים חופפים מתוך 3,371 הגנים עם ביטוי Differentially Expressed (DEGs), 5,226 גנים ממודול MEsalmon ו-2,118 גנים הקשורים ל-ac4C (ac4C-RGs).איור 1E). ניתוח העשרה פונקציונלית של 160 גנים אלו הראה כי מונחי GO משמעותיים כללו קישור ל-RNA גדיולי, ויסות של תהליך מטבולי של mRNA, ומסלול אותות RIG-I (איור 1F). בנוסף, ניתוח KEGG הדגים כי גנים אלו היו מועשרים בעיקר בבליעה המתווכת על ידי Fc gamma R, במסלול המעקב אחר mRNA ובבקיעת מוקדי הדבקה (איור 1G). רשת אינטראקציות החלבונים (PPI) של הגנים החופפים הכילה 118 צמתים ו-196 קשתות (איור 1H).
זיהוי של שישה גנים מרכזיים ב-COPD
על מנת לזהות גנים מרכזיים פוטנציאליים מבין 160 המועמדים החופפים, יושמו שלושה אלגוריתמים של למידת מכונה. ראשית הופעל רגרסיית LASSO, כאשר נעשה שימוש בתיקוף צולב (cross-validation) כדי לקבוע את פרמטר הענישה האופטימלי (λ) ≈ 0.091 (איור 2A). תרשים פרופיל המקדמים הצביע על כך ש-17 גנים נשמרו בערך ה-λ האופטימלי (איור 2B). ניתוח XGBoost זיהה את 30 הגנים המובילים בעלי ה-gain הגבוה ביותר, שביניהם PTRF, WBP11 ו-LDOC1L הפגינו ערך ניבוי גבוה (איור 2C). אלגוריתם RF דירג באופן דומה את 30 הגנים המובילים על פי מדדי חשיבות ה-Gini שלהם, כאשר PTRF, RFX5 ו-PRKCDBP היו בין בעלי יכולת הניבוי הגבוהה ביותר (איור 2D). ניתוח חיתוך של הגנים שנבחרו על ידי שלוש השיטות זיהה שישה גנים חופפים מרכזיים: PTRF, PRKCDBP, UPP1, TOR3A, FAM168B ו-B4GALT2 (איור 2E).
בניית מודל אבחנתי ואנליזה של ביטוי גנים מרכזיים
תוך שימוש ב-70% ממאגר הנתונים GSE54837 כסט אימון, הוקם מודל רגרסיה לוגיסטית המשלב את ששת הגנים המרכזיים. ניתוח עקומת ROC העיד על ביצועים אבחנתיים בינוניים, עם ערכי AUC של 0.766 (95% CI: 0.691–0.8417), 0.759 (95% CI: 0.6368–0.8817), ו-0.723 (95% CI: 0.6085–0.8596) עבור סט האימון, סט הבדיקה הפנימי וסט התיקוף החיצוני, בהתאמה (איור 3A–C). ניתוח כיול אישר אמינות גבוהה, ו-DCA הצביע על תועלת קלינית נטו ברורה במגוון רחב של הסתברויות סף הן בסט האימון (איור 3D–E) והן בסטים התיקוף (איור 3F–G). נומוגרמה נבנתה כדי להמחיש את התרומה של כל גן ולהקל על הערכת סיכון פרטנית (איור 3H). ניתוח ביטוי גנים גילה כי B4GALT2, PRKCDBP ו-UPP1 היו בעלי ביטוי מוגבר (upregulated) באופן מובהק בדגימות COPD, בעוד ש-FAM168B, PTRF ו-TOR3A היו בעלי ביטוי מופחת (downregulated) (איור 3I).
רשת רגולטורית ואנליזה פונקציונלית של גנים מרכזיים ב-COPD
רשת אינטראקציות פונקציונלית הכוללת את 20 הגנים בעלי הקשר החזק ביותר לגנים המרכזיים (hub genes) שזוהו, נבנתה באמצעות ניתוח GeneMANIA (איור 4A). אינטראקציות פיזיות היוו את מרבית הקשרים, ואחריהן קורלציות של ביטוי משותף (co-expression) ודומיינים חלבוניים משותפים. אנוטציה פונקציונלית הצביעה על העשרה משמעותית בתהליכים כגון nucleobase-containing small molecule catabolic process, nucleoside catabolic process, ו-plasma membrane raft. בקרה פוסט-טרנסקריפציונלית נבחנה על ידי הצלבת תחזיות miRNA ממאגרי המידע DIANA-microT ו-miRanda, אשר זיהו שמונה miRNA חופפים (איור 4B). לאחר מכן נבנה ציר רגולטורי של lncRNA-miRNA-mRNA. על פי תרשים Sankey, שניים מה-miRNA שזוהו, שניהם קשורים לוויסות של FAM168B, נחזו כמתים על ידי שבעה lncRNAs; לא זוהו אינטראקציות רגולטוריות כאלה עבור חמשת הגנים המרכזיים הנותרים (איור 4C). בקרה טרנסקריפציונלית נחקרה בהמשך באמצעות פלטפורמת ChEA3, שחזתה גורמי שעתוק (TFs) במעלה הזרם עבור B4GALT2, UPP1, FAM168B, ו-TOR3A. עשרת ה-TFs המובילים עבור כל גן נבחרו לבניית רשת רגולטורית של TF-target (איור 4D). ניתוח GSEA בוצע כדי לבחון את הפונקציות הביולוגיות של ששת הגנים המרכזיים. UPP1 הראה העשרה משמעותית בתהליכים ביולוגיים כגון diacylglycerol metabolic process ו-purine nucleoside triphosphate biosynthetic process, וכן במסלולים הכוללים את ה-proteasome ו-metabolism of xenobiotics by cytochrome P450 (איור 4E–F). תוצאות ההעשרה עבור חמשת הגנים המרכזיים הנותרים מופיעות ב-איור משלים 2A–J.
חדירה חיסונית של UPP1 וחיזוי מטרות תרופתיות ב-COPD
רמות חדירה חיסונית של 28 סוגי תאי מערכת החיסון הוערכו בקבוצות הביקורת ובקבוצות ה-COPD באמצעות אלגוריתם ה-ssGSEA. בחולי COPD, תאי B מסוג זיכרון, תאים מדכאים ממקור מיאלואידי ותאי דנדריטיים מופעלים הראו ציוני העשרה גבוהים באופן משמעותי. לעומת זאת, תאי T מסייעים מסוג 1, תאי B מופעלים ותאי B לא בשלים הראו ציוני העשרה נמוכים באופן משמעותי (איור 5A). יש לציין כי ssGSEA מספק הערכות העשרה יחסיות של תאי מערכת החיסון המבוססות על נתונים טרנסקריפטומיים ולא מדידות ישירות של פרופורציות תאי מערכת החיסון. ניתוח קורלציה גילה כי ששת הגנים המרכזיים הפגינו דפוסי קשר דיפרנציאליים עם תת-אוכלוסיות של תאי מערכת החיסון. באופן ספציפי, UPP1, PRKCDBP ו-B4GALT2 היו במתאם חיובי עם רמות החדירה של תאי B מסוג זיכרון, תאי דנדריטיים מופעלים ותאים מדכאים ממקור מיאלואידי (Spearman ρ > 0.4, p < 0.05), בעוד ש-PTRF, TOR3A ו-FAM168B הראו מתאמים שליליים עם תאי T מסייעים מסוג 1 ותאי B מופעלים (Spearman ρ < −0.3, p < 0.05). מטריצת הקורלציה המלאה מוצגת במפת החום (איור 5B). ניתוח חיזוי תרופות זיהה את UPP1 כגנו היחיד מבין ששת המועמדים עם אינטראקציות חזויות עם מולקולות קטנות. שלוש תרכובות, הכוללות את fluorouracil, capecitabine ו-5-benzylacyclouridine, זוהו מתוך מאגר הנתונים כתרכובות פוטנציאליות בעלות אינטראקציה עם UPP1 (איור 5C). תרכובות אלו משמשות בעיקר באונקולוגיה או במסגרות ניסיוניות, והרלוונטיות שלהן ל-COPD דורשת חקירה נוספת. חישובי אנרגיית קישור חופשית גילו כי 5-benzylacyclouridine הפגין את זיקת הקישור החזקה ביותר, מה שמעיד על זיקת קישור חזויה גבוהה יחסית (טבלה 3). ויזואליזציות של עגינה מולקולרית עבור כל שלוש התרכובות הצביעו על קונפורמציות קישור חזויות נוחות עם UPP1, בהתאמה לתחזיות עגינה חישוביות ולא לתיקוף ניסיוני (איור 5D–F). בנוסף, ניתוח CTD הצביע על כך שכל ששת הגנים המרכזיים היו קשורים באופן חזק לפנוטיפים של מחלות שונות, כולל השפעות מאוחרות של חשיפה טרום-לידנית, ירידה במשקל, הגדלה של הכבד (hepatomegaly) ודלקת (איור 5G–L).
תיקוף RT-qPCR של גנים אבחנתיים מרכזיים בדגימות קליניות
כדי לתקף את רמות הביטוי של גנים מרכזיים, נאספו דגימות דם משמונה חולי COPD ושמונה נבדקי ביקורת, וניתוח זה נחשב כתיקוף ראשוני בשל גודל המדגם המוגבל. כפי שמוצג ב-איור 6A–F, הביטוי של PTRF, TOR3A ו-FAM168B היה מופחת באופן משמעותי, בעוד שהביטוי של PRKCDBP ו-UPP1 היה מוגבר באופן משמעותי בדגימות COPD, בדומה למגמות שנצפו בניתוח הביואינפורמטי. לעומת זאת, לא נצפה הבדל משמעותי בביטוי של B4GALT2 בין שתי הקבוצות. סתירה זו עשויה להיות תולדה של גודל המדגם המוגבל או של הבדלים בסוגי הדגימות בין מאגרי הנתונים לדגימות הקליניות.
הצהרה על זמינות נתונים:
כל נתוני רצף ה-RNA התקבלו ממאגר הנתונים Gene Expression Omnibus (GEO, https://www.ncbi.nlm.nih.gov), כאשר GSE54837 נבחרה כקבוצת האימון ו-GSE112811 כקבוצת האימות. ניתן להשיג את הקוד ששימש בניתוח זה בכתובת https://doi.org/10.5281/zenodo.21771476.

איור 1: זיהוי גנים חופפים, ניתוח העשרה ובניית רשת PPI. (A) תרשים הרי געש (Volcano plot) של DEGs במערך הנתונים GSE54837. (B) סינון סף רך. (C) דנדרוגרמה של אשכולי מודולים (לאחר מיזוג). (D) מפת חום של המתאם בין מודולים לתכונות. (E) דיאגרמת ון לזיהוי גנים חופפים. (F) תרשים Mulberry של ניתוח העשרת GO, המציג את תוצאות ההעשרה העיקריות של הגנים בחיתוך ב-MF, CC ו-BP. (G) תרשים Lollipop של ניתוח העשרת מסלולי אותות KEGG, גודל הבועה מייצג את מספר הגנים המועשרים. (H) רשת PPI של הגנים החופפים; צמתים מייצגים חלבונים, וקצוות מייצגים אינטראקציות חלבון-חלבון. קיצורים: DEGs = differentially expressed genes; PPI = protein-protein interaction; GO = Gene Ontology; MF = molecular function; CC = cellular component; BP = biological process; KEGG = Kyoto Encyclopedia of Genes and Genomes; ac4C-RGs = N4-acetylcytidine-related genes. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 2: זיהוי שישה גנים מרכזיים ב-COPD. (A) עקומת תיקוף צולב (cross-validation) של LASSO. (B) תרשים נתיב מקדמי רגרסיית LASSO. ככל ש-λ עולה, מקדמי הגנים שאינם חשובים מתכנסים ל-0. (C) דירוג חשיבות מאפיינים של XGBoost. ציר ה-x מייצג את ערך ה-gain, ציר ה-y מייצג את שם הגן, ועומק הצבע מייצג את החשיבות. (D) דירוג חשיבות מאפיינים של RF. ציר ה-x מייצג את הממוצע של הירידה במדד Gini. (E) דיאגרמת ונ של גנים חופפים שהתקבלו על ידי ניתוח מצולב של שלושת האלגוריתמים. קיצורים: LASSO = least absolute shrinkage and selection operator; XGBoost = extreme gradient boosting; RF = random forest. אנא לחץ כאן כדי לצפות בגרסה מורחבת של איור זה.

איור 3: בניית מודל אבחנתי וניתוח ביטוי של גנים מרכזיים. (A) עקומת ROC של קבוצת האימון. (B) עקומת ROC של קבוצת הבדיקה הפנימית. (C) עקומת ROC של קבוצת התיקוף החיצונית. (D) עקומת כיול של קבוצת האימון. (E) DCA של קבוצת האימון. (F) עקומת כיול של קבוצת התיקוף החיצונית. (G) DCA של קבוצת התיקוף החיצונית. (H) נומוגרמה של שישה גנים מרכזיים. לצורך חיזוי סיכון אישי ל-COPD, לכל גן מוקצה ניקוד תואם. (I) ניתוח ביטוי של שישה גנים מרכזיים בדגימות COPD ובדגימות ביקורת מתוך מאגר הנתונים GSE54837. קיצורים: ROC = receiver operating characteristic; AUC = area under the curve; DCA = decision curve analysis; COPD = מחלה ריאתית חסימתית כרונית. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 4: רשת רגולטורית והמשמעות התפקודית של גנים מרכזיים ב-COPD. (A) תוצאות ניתוח GeneMANIA של 6 גנים מרכזיים. צבע הקווים מציין את המתאם בין הגנים, וצבע הצמתים מציין קטגוריות תפקודיות שונות. (B) דיאגרמת ון של ניתוח הצלבה בין מאגרי המידע DIANA-microT ו-miRanda. (C) דיאגרמת Mulberry של רשת הרגולציה של ceRNA. (D) רשת רגולטורית פוטנציאלית של פקטורי שעתוק. צמתים כחולים מייצגים פקטורי שעתוק, וצמתים כתומים מייצגים גנים מטרה. (E) ניתוח העשרה של GSEA לגן בודד UPP1, כולל GO. (F) ניתוח העשרה של GSEA לגן בודד UPP1, כולל KEGG. קיצורים: GO = Gene Ontology; KEGG = Kyoto Encyclopedia of Genes and Genomes. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 5: חדירה חיסונית של גנים מרכזיים וניבוי מטרות תרופתיות ב-COPD. (A) הבדלים בשפע תאי החיסון בין הקבוצות. (B) מפת חום של המתאם בין תאי חיסון לגנים מרכזיים. (C) רשת אינטראקציות בין גנים מרכזיים לתרופות חזויות. (D) דוקינג מולקולרי של fluorouracil עם UPP1. (E) דוקינג מולקולרי של capecitabine עם UPP1. (F) דוקינג מולקולרי של 5-benzylacyclouridine עם UPP1. עבור כל תרכובת, התמונה השמאלית מראה את קונפורמציית הדוקינג הכללית, והתמונה הימנית מראה את אינטראקציות הקישור המקומיות. (G) ניתוח CTD של B4GALT2. (H) ניתוח CTD של FAM168B. (I) ניתוח CTD של PRKCDBP. (J) ניתוח CTD של PTRF. (K) ניתוח CTD של TOR3A. (L) ניתוח CTD של UPP1. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 6: תיקוף RT-qPCR של ביטוי גנים מרכזיים בדגימות COPD ודגימות ביקורת. (A) ביטוי יחסי של PTRF. (B) ביטוי יחסי של PRKCDBP. (C) ביטוי יחסי של UPP1. (D) ביטוי יחסי של TOR3A. (E) ביטוי יחסי של FAM168B. (F) ביטוי יחסי של B4GALT2. ns = לא מובהק, p > 0.05; * p < 0.05; ** p < 0.01; *** p < 0.001; **** p < 0.0001. קיצור: RT-qPCR = reverse transcription quantitative polymerase chain reaction. אנא לחצו כאן להצגת גרסה גדולה יותר של איור זה.
איור משלים 1: דגימות מערך הנתונים GSE54837 וקיבץ מודולי גנים. (A) תרשים קיבץ דגימות של מערך הנתונים GSE54837. (B) דנדרוגרמה של קיבץ מודולים לפני מיזוג. הגנים קובצו באמצעות שיטת ה-dynamic tree cut כדי לזהות מודולים נפרדים. (C) דנדרוגרמה של קיבץ היררכי של eigengenes של המודולים. מודולים עם דפוסי ביטוי דומים קובצו על בסיס הדמיון בין ה-eigengenes שלהם.אנא לחץ כאן כדי להוריד קובץ זה.
איור משלים 2: ניתוח העשרה GSEA. (A) ניתוח GO של PRKCDBP. (B) ניתוח KEGG של PRKCDBP. (C) ניתוח GO של PTRF. (D) ניתוח KEGG של PTRF. (E) ניתוח GO של TOR3A. (F) ניתוח KEGG של TOR3A. (G) ניתוח GO של FAM168B. (H) ניתוח KEGG של FAM168B. (I) ניתוח GO של B4GALT2. (J) ניתוח KEGG של B4GALT2. קיצורים: GO = Gene Ontology; KEGG = Kyoto Encyclopedia of Genes and Genomes.אנא לחצו כאן כדי להוריד קובץ זה.
| סט נתונים | ביקרות | מטופלים | פלטפורמת ריצוף |
| GSE54837 | 90 | 136 | GPL570 |
| GSE112811 | 44 | 20 | GPL570 |
טבלה 1: מערכי נתונים של ביטוי גנים ששימשו במחקר. מאפייני מערכי הנתונים GSE54837 ו-GSE112811 ששימשו לפיתוח המודל/בדיקה פנימית ולתיקוף חיצוני, בהתאמה.
| מטופל | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| מגדר (נקבה/זכר) | M | מ' | M | ז׳ | M | M | מ' | M |
| גיל (שנים) | 69 | 72 | 75 | 73 | 68 | 70 | 69 | 71 |
| סטטוס עישון | כן | כן | הפסקת עישון (שנתיים) | לא | כן | כן | כן | הפסקת עישון (5 שנים) |
| שנות-חפיסות | 20 ליום / 30 שנה | 15 ליום / 35 שנים | 20 ליום / 50 שנה | 20 ליום / 40 שנה | 30 ליום / 40 שנה | 15 ליום / 40 שנים | 20 ליום / 30 שנה | |
| קבוצת COPD | 2 | 3 | 3 | 2 | 2 | 3 | 2 | 3 |
טבלה 2: מאפייני בסיס של המשתתפים במחקר. מאפיינים דמוגרפיים וקליניים בבסיס של חולי ה-COPD ושל קבוצת הביקורת הבריאה שנכללו בתיקוף ה-RT-qPCR.
| שם מולקולרי | גן | ציון (kcal/mol) |
| 5-בנזילאציקלו-אורידין | UPP1 | -9.6 |
| קפסיטבין (Capecitabine) | UPP1 | -6.1 |
| פלואורוראציל | UPP1 | -5.5 |
טבלה 3: תוצאות עגינה מולקולרית (molecular docking) עבור UPP1 ותרכובות מועמדות.
תוצאות עגינה מולקולרית חזויות לאינטראקציה של UPP1 עם fluorouracil, capecitabine ו-5-benzylacyclouridine, כולל זיקות הקשירה שלהם.
המודיפיקציה השמורה של RNA, ac4C, המתרחשת בעיקר ב-RNA שליח (mRNA) וב-RNA מעביר (tRNA), מחזקת את יציבות ה-mRNA ואת יעילות התרגום20. NAT10 הוא ה-RNA acetyltransferase היחיד המוכר המתווך את מודיפיקציית ac4C21. מחקרים הראו כי NAT10 נמצא בביטוי מוגבר (upregulated) בתאי אפיתל של ריאות אצל חולי COPD. השתקת (Knockdown) של NAT10 משבשת את התפקוד המיטוכונדריאלי ואת התגובות הטרנסקריפטומיות22. על בסיס ניתוח מולטי-אומיקה אינטגרטיבי, מחקר זה זיהה שישה גנים מרכזיים הקשורים קשר הדוק ל-COPD ופיתח מודל אבחנתי, שהראה ביצועי אבחון בינוניים וערך פוטנציאלי למחקר נוסף. ניתוח מעמיק יותר חשף את התפקידים המרכזיים של גנים אלו בבקרת שעתוק, ברשתות ceRNA ובמיקרו-סביבה החיסונית. בנוסף, נחזו תרופות פוטנציאליות לטיפול ממוקד, המספקות תובנות לגבי הפתוגנזה של COPD ומסייעות בפיתוח אסטרטגיות טיפול מותאמות אישית ומדויקות. זיהינו גנים שהיו בעלי ביטוי דיפרנציאלי ב-COPD ומופיעים ברשימה של גנים הקשורים ל-ac4C שפורסמה בעבר, באמצעות WGCNA וניתוח ביטוי דיפרנציאלי. חשוב לציין כי גנים אלו נבחרו על בסיס הקשר שלהם לרשת הרגולטורית של ac4C, ולא על בסיס קשרים מנגנוניים מוכחים ל-NAT10 או לאצטילציה של ac4C, דבר שהניב סך של 160 גנים מועמדים. שישה גנים מרכזיים (PTRF, PRKCDBP, UPP1, TOR3A, FAM168B, ו-B4GALT2) זוהו באמצעות אלגוריתמים של למידת מכונה. ביניהם, PTRF ממלא תפקיד קריטי בדלקת דרכי נשימה המושרה על ידי קרדית אבק הבית (HDM) באמצעות ויסות של נקרופטוזיס של מקרופאגים המתווך על ידי IL-33-ZBP1, מה שמרמז כי הוא עשוי להיות מעורב במצבים דלקתיים כרוניים של הריאות כגון COPD23. Lai et al.24 הוכיחו כי מתן אקסוגני של uridine מעכב פֵרוֹפְּטוֹזיס (ferroptosis) במקרופאגים דרך נתיב Nrf2/SLC7A11/GPX4, ובכך מקל על פגיעה ריאתית חריפה הנגרמת מאספסו. למרות שנצפתה עלייה בביטוי של UPP1, אנזים מרכזי בחילוף חומרים של uridine, ברקמת ריאה ממודלים של פגיעה ריאתית חריפה, תפקידו המדויק — והאם עלייה זו מייצגת תגובה מגנה או תוצאה של נזק רקמתי — טרם הובהרו במלואם. עם זאת, ממצא זה מרמז כי ל-UPP1 עשוי להיות קשר פוטנציאלי לתהליכים הפתופיזיולוגיים של מחלות ריאה דלקתיות כגון COPD, מה שמצדיק מחקר נוסף. ארבעת הגנים המרכזיים שנותרו נחקרו פחות בהפרעות הקשורות לריאה, אך על בסיס תפקודיהם במחלות אחרות וממצאינו הנוכחיים, אנו משערים נתיבים פוטנציאליים שדרכם הם עשויים לתרום לפתוגנזה של COPD.
על בסיס ששת הגנים המרכזיים, בנינו מודל לאבחון COPD ותיקפנו את ביצועי הניבוי הטובים שלו. ניתוח ביטוי הראה כי UPP1, B4GALT2 ו-PRKCDBP היו במצב של ביטוי מוגבר (upregulated) באופן משמעותי, בעוד ש-FAM168B, PTRF ו-TOR3A היו במצב של ביטוי מופחת (downregulated) באופן ניכר ב-COPD. למרות ש-B4GALT2 זוהה כבעל ביטוי מוגבר בניתוח מאגרי הנתונים, לא נצפה הבדל משמעותי בתיקוף באמצעות RT-qPCR. פער זה עשוי להיות מיוחס לגודל מדגם מוגבל, להטרוגניות של הקוהורט ולהבדלים במקורות הדגימות בין מאגרי הנתונים הציבוריים לבין דגימות דם קליניות. ניתוח העשרה של קבוצות גנים (Gene set enrichment analysis) העלה כי גנים מרכזיים אלו היו מועשרים באופן משמעותי בתהליכי RNA splicing ועיבוד mRNA, כמו גם במסלולים כגון מחזור התא והתמכרות לניקוטין. עצירה בלתי הפיכה של מחזור התא הוכרה כמנגנון מרכזי העומד בבסיס ההזדקנות התאית, שעשויה לתרום באופן משמעותי לפתופיזיולוגיה של COPD25,26. ניתוח נוסף הצביע על כך שהפנוטיפ הפרשתי הקשור להזדקנות (SASP), המושרה על ידי נזק ל-DNA, עשוי לקדם את התקדמותה המתמשכת של COPD על ידי שמירה על דלקת כרונית והחמרת הפגיעה ברקמת הריאה27. מחקר קודם סקר גם את הקשרים הגנטיים העומדים בבסיס התמכרות לניקוטין ו-COPD28. למרות שעישון הוא גורם הסיכון העיקרי ל-COPD, רק חלק קטן מהמעשנים מפתחים את המחלה, מה שמרמז כי לגורמים גנטיים יש תפקיד חשוב הן ב-COPD והן בתלות בניקוטין. Liu et al.29 סיכמו את תפקידם של חלבוני קישור ל-RNA (RBPs) ב-COPD וביתר לחץ ריאתי (PH), תוך הדגשת מעורבותם בעיצוב מחדש של כלי הדם הריאתיים ובתגובות דלקתיות באמצעות ויסות של mRNA splicing וביטוי גנים לאחר שעתוק, ובכך הדגישו את פוטנציאלם כסמנים ביולוגיים וכמטרות טיפוליות. לסיכום, הגנים המרכזיים והמסלולים הקשורים אליהם שזוהו במחקר זה לא רק מעמיקים את הבנתנו את פתוגנזה של COPD, אלא מספקים גם בסיס איתן לפיתוח סמנים ביולוגיים אבחוניים ואסטרטגיות טיפוליות ממוקדות בעתיד.
רשת ה-ceRNA כוללת סוגים שונים של RNA, כולל lncRNAs, circRNAs ו-mRNAs, אשר נקשרים באופן תחרותי ל-miRNAs משותפים, ובכך יוצרים מערכות יחסים רגולטוריות הדדיות ומשפיעים על ביטוי גנים30. רשת מורכבת זו משתתפת בתהליכים פיזיולוגיים ופתולוגיים רבים ותורמת להבנת מנגנוני בקרה גנטית והפתוגנזה של מחלות כגון סרטן והפרעות דלקתיות כרוניות. לדוגמה, Wang et al. בניו רשת coexpression של ceRNA הכוללת 11 lncRNAs, חמישה miRNAs ו-16 mRNAs, שבה תת-הרשת המרכזית הייתה קשורה לשינויים בפרופורציות של תאי חיסון ובתפקוד הריאות ב-COPD31. באופן דומה, Zhang et al.32 פיתחו רשת ceRNA מסוג circRNA-miRNA-mRNA בהתבסס על תאים חד גרעיים של דם פריפריאלי (PBMCs) ממעשנים זכרים, וזיהו circRNAs עם ביטוי משובש ומסלולים מרכזיים הקשורים ל-COPD. ניתוח רשת ה-coexpression שלנו גילה כי הגנים המרכזיים יצרו קשרים פונקציונליים בעיקר באמצעות אינטראקציות פיזיות, ביטוי משותף ודומיינים חלבוניים משותפים, והם היו מועשרים באופן משמעותי במספר מסלולים הקשורים למטבוליזם. על בסיס ממצאים אלה, בנינו בהמשך רשת רגולטורית של גורמי שעתוק (TF)-מטרה וציר רגולטורי של miRNA-lncRNA-mRNA. תוצאות אלו מרמזות כי הגנים המרכזיים עשויים להיות מווסתים באופן שיתופי באמצעות מנגנונים רב-שכבתיים המערבים lncRNAs, גורמי שעתוק ו-miRNAs ב-COPD.
חדירה חיסונית משקפת את המצב החיסוני על ידי ציון הפריסה והפעילות של תאי מערכת החיסון בתוך רקמות או בדם. על בסיס זה, תרופות מועמדות פוטנציאליות נחזו באמצעות סינון חישובי, ולאחריו סימולציות של עגינה מולקולרית (molecular docking) להערכת זיקת הקשירה ויציבותן עם חלבוני מטרה. יחד, ניתוחים אלו מקלים על זיהוי סוכני טיפול חדשניים ומספקים תובנות עמוקות יותר לגבי מנגנוני המחלה. במחקר זה, שישה גנים מרכזיים הראו מתאם חיובי עם מרבית החדירות של תאי מערכת החיסון. חיזוי תרופות זיהה אינטראקציות פוטנציאליות בין UPP1 לבין fluorouracil, capecitabine ו-5-benzylacyclouridine, כאשר האחרון הפגין את זיקת הקשירה החזקה ביותר, כפי שאושר בהמשך באמצעות עגינה מולקולרית. ראוי לציין כי fluorouracil ו-capecitabine משמשים בעיקר כסוכנים נוגותי גידולים, ובמחקר זה הם זוהו כתרכובות בעלות אינטראקציה עם UPP1 על פי תחזיות מסד נתונים, ולא כאפשרויות טיפוליות מאושרות עבור COPD. מחקרים קודמים דיווחו כי מתן מקומי של fluorouracil עשוי לשפר את פתוחות דרכי הנשימה במקרים של חסימה חמורה של דרכי הנשימה33. עם זאת, ראיות אחרות מצביעות על כך ש-fluorouracil ו-capecitabine עלולים לגרום לרעילות ריאתית, במיוחד בחולים עם מחלות ריאה קיימות34. לכן, הרלוונטיות הפוטנציאלית שלהם ל-COPD דורשת אימות ניסויי ובדיקת בטיחות נוספות. יתרה מכך, ניתוח ה-CTD הצביע על כך שכל ששת הגנים המרכזיים היו קשורים לתהליכים פתולוגיים מרובים. יחד, הניתוח המשולב של חדירה חיסונית, חיזוי תרופות ועגינה מולקולרית מספק מטרות מולקולריות חדשות ובסיס תיאורטי לטיפול מדויק ב-COPD, ובכך מקדם את הפיתוח והתרגום הקליני של תרופות קשורות.
עם זאת, יש להכיר במספר מגבלות. המחקר התבסס על מאגרי נתונים ציבוריים עם מקורות דגימות מוגבלים יחסית, דבר שעלול להוביל לאפקטים של batch ולהתאמת-יתר (overfitting) פוטנציאלית של המודל. תיקוף ה-RT-qPCR בוצע בקוהורט קטן, והחוסר בעקביות שנצפה בביטוי של B4GALT2 מרמז על הומוגניות אפשרית של הקוהורט. בנוסף, ניתוחי חדירת תאי מערכת החיסון וחיזוי תרופות היו בעלי אופי חישובי ודורשים תיקוף ניסיוני נוסף. יתרה מכך, כחקירה ביואינפורמטית בשלב הגילוי, המודל האבחנתי שלנו הוערך בעיקר באמצעות ערכי AUC עם רווחי בר-סמך של 95%. מדדי ביצועים מקיפים כגון רגישות, ספציפיות, ערכים ניבויים וסטטיסטיקות כיול מפורטות לא הוערכו במלואם בשל אופיים הרטרוספקטיבי של מאגרי הנתונים הציבוריים וגודל הדגימות המוגבל. לפיכך, יש להתייחס למודל שלנו ככלי להוכחת היתכנות (proof-of-concept), ותועלתו הקלינית מצריכה תיקוף נוסף בקוהורטים פרוספקטיביים גדולים יותר.
באמצעות ניתוחים אינטגרטיביים של ביו-אינפורמטיקה ולמידת מכונה, מחקר זה זיהה שישה גנים מרכזיים הקשורים באופן מובהק ל-COPD. מודל אבחוני חסון הוקם והפגין ביצועי חיזוי אמינים על פני מספר קהלות. ניתוחים פונקציונליים גילினர் כי גנים אלו משתתפים ברשתות רגולטוריות קריטיות הכוללות בקרה שעתוקית ואחרי-שעתוקית, חדירת תאי מערכת החיסון ומסלולים הקשורים להתמכרות לניקוטין ולמחזור התא. ניתוחים של חיזוי תרופות ועגינה מולקולרית הדגישו את UPP1 כיעד טיפולי מבטיח, כאשר מספר תרכובות מועמדות הפגינו זיקות קישור חזקות. באופן כללי, ממצאים אלו מעמיקים את הבנתנו את הפתופיזיולוגיה של COPD ומספקים יעדים מולקולריים בעלי ערך לפיתוח טיפולי עתידי ולאסטרטגיות של רפואה מותאמת אישית.
המחברים מצהירים כי אין ניגודי עניינים. הסכמה מושכלת התקבלה מכל הנבדקים שהשתתפו במחקר.
אנו מודים לבית החולים לרפואה סינית מסורתית של שנג'ן לוהו (Shenzhen Luohu Hospital of Traditional Chinese Medicine) על אספקת המתקנים הקליניים והתמיכה המנהלית שהיו חיוניים למחקר זה. לבסוף, אנו מביעים תודה לכל המטופלים ומתנדבים הבריאים שהשתתפו במחקר זה; תרומתם הייתה חיונית לעבודה זו. עבודה זו נתמכה על ידי פרויקט סנמינג לרפואה בשנג'ן (מס' SZZYSM202401018), קרנות ההתמחות בעדיפות של מחוז לוהו (מס' LX202402021), וקרנות ההתמחות בעדיפות של מחוז לוהו (מס' LX202302064).
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| βפריימרים ל-actin | צינקי | לא רלוונטי | קדימה: 5’-CATGTACGTTGCTATCCAGGC-3’ הפוך: 5’-CTCCTTAATGTCACGCACGAT-3’ |
| פריימרים ל-B4GALT2 | צ'ינגקה | לא רלוונטי | קדימה: 5’-GGGCAGACTGCTGATCGAG-3’ הפוך: 5’-CCGGTGTCTAAAGGGGATGAT-3’ |
| CB-Dock2 | LabShare | מקוון | עגינה מולקולרית |
| clusterProfiler | Bioconductor | v4.14.6 | ניתוח העשרה |
| Cytoscape | קונסורציום Cytoscape | v3.8.3 | ויזואליזציה של רשתות |
| DrugBank | University of Alberta | מקוון | חיזוי תרופות |
| פריימרים עבור FAM168B | צ'ינגקה | לא רלוונטי | קדימה: 5’-TCTGGGGTTCCCTATGCAAAT-3’ הפוך: 5’-GTAGGATTCGCTCCAGGATACA-3’ |
| glmnet | CRAN | v4.1 | רגרסיית LASSO |
| GSVA | Bioconductor | v1.52.3 | ניתוח ssGSEA |
| Hifair III סופר-מיקס לסינתזה של גדיל cDNA ראשון | YEASEN | 11141ES | סינתזה של cDNA |
| Hieff RTPCR SYBR Green Master Mix | YEASEN | 11201ES | הגברה ב-qPCR |
| limma | Bioconductor | v3.54.0 | ביטוי דיפרנציאלי |
| מערכת LightCycler 480 II | Roche | LightCycler 480 II | PCR בזמן אמת |
| פריימרים ל-PTRF | צ'ינגקה | לא רלוונטי | קדימה: 5’-GGGCCGTAGACCAGATCCA-3’ הפוך: 5’-CTTGCTCACCGTATTGCTCGT-3’ |
| פריימרים ל-PRKCDBP | צ'ינגקה | לא רלוונטי | קדימה: 5’-CACGTTCTGCTCTTCAAGGAG-3’ הפוך: 5’-TGTACCTTCTGCAATCCGGTG-3’ |
| תוכנת R | R Foundation | v4.4.2 | מיחשוב סטטיסטי |
| יער אקראי | CRAN | גרסה 4.7 | יער אקראי |
| מבודד RNA, ערכה לבידוד RNA מדם MolPure | YEASEN | 19241ES50 | הוצאת RNA |
| מאגר הנתונים STRING | EMBL | מקוון | רשת PPI |
| פריימרים ל-TOR3A | צ'ינגקה | לא רלוונטי | קדימה: 5’-CCCTTGCTCTGTCGTTCCAC-3’ הפוך: 5’-CCCGTCCCGATACAGGTTC-3’ |
| פריימרים ל-UPP1 | צ'ינגקה | לא רלוונטי | קדימה: 5’-CTGTCAGTCATGGTATGGGCA-3’ הפוך: 5’-GAGCACCGGGCATAGTACA-3’ |
| WGCNA | CRAN | v1.72 | רשת ביטוי משותף |
| XGBoost | CRAN | v1.7 | אלגוריתם XGBoost |