מאגרי הנתונים הציבוריים של Gene Expression Omnibus (GEO) שנותחו במחקר זה הכילו נתונים טרנסקריפטומיים שעברו דה-אידנטיפיקציה ממחקרים שפורסמו בעבר, ולא דרשו אישור אתי נוסף. ועדת האתיקה של אוניברסיטת Huaihua אישרה את מחקר התיקוף העצמאי של רקמות ריאה אנושיות באמצעות PCR עם שעתוק הפוך כמותי (qRT-PCR) (מספר אישור 2024(A05112)). הסכמה מדעת בכתב התקבלה מכל המשתתפים או מנציגיהם המורשים על פי חוק לפני איסוף הדגימות. הליכי האישור וההסכמה חלו על כל 20 דגימות רקמת הריאה של חולי יתר לחץ דם رئתי (PAH) ו-20 דגימות הביקורת שנכללו בתיקוף ה-qRT-PCR. כלי המחקר ששימשו לפרוטוקול זה מפורטים ב- טבלת חומרים.
1. איסוף ועיבוד מקדים של מאגרי נתונים טרנסקריפטומיים ציבוריים
מאגרי נתוני מיקרו-מערך (microarray) GSE22356, GSE33463 ו-GSE48149 הקשורים ליתר לחץ דם ריאתי (PH) הופקו ממאגר הנתונים GEO. דגימות של PH/יתר לחץ דם עורקי ריאתי (PAH) ודגימות ביקורת חולצו בהתאם להערות הפנוטיפ המקוריות. מטריצות ביטוי וקבצי הערות פלטפורמה הורדו באמצעות סקריפטים של R הניתנים לשחזור ובאמצעות חבילת GEOquery.
ביצוע השרויות הפרובים (Probe annotation) ומיפוי סמלי הגנים בוצעו באופן עקבי בכל מערכי הנתונים. כאשר מספר פרובים מופו לאותו גן, חושב ערך הביטוי הממוצע. הוחל נורמליזציית קוונטילים (Quantile normalization), וגנים עם ביטוי נמוך או שונות נמוכה הוסרו. מערכי הנתונים מוזגו, והשפעות אלומה (batch effects) תוקנו באמצעות אלגוריתם ה-ComBat בחבילת ה-sva8. התיקון הוערך באמצעות תרשימי קופסה (boxplots) וניתוח רכיבים ראשיים (principal component analysis).
2. זיהוי גנים המבטאים ביטוי דיפרנציאלי
חבילת limma שימשה להשוואת רמות הביטוי בין דגימות PH לדגימות ביקורת במטריצת הביטוי המתוקנת עבור אפקטי batch9. הותאמה מודל ליניארי, ויושמו סטטיסטיקות Bayes אמפיריות. גנים בעלי ביטוי דיפרנציאלי הוגדרו באמצעות ערך P מתוקנן <0.05 ושינוי קיפול (fold change) מוחלט של log2 > 0.585. התוצאות הוצגו באופן ויזואלי באמצעות volcano plots ומפות חום (heatmaps).
3. בניית רשת ביטוי גנים משותף משוקללת
רשת ביטוי גנים משותף משוקללת נבנתה באמצעות חבילת WGCNA10. ביצוע אשכולות לדגימות (Sample clustering) בוצע כדי לזהות ערכים חריגים. עוצמת הסף הרך (soft-thresholding power) נבחרה על בסיס מדד התאמה לטופולוגיה חסרת קנה מידה (scale-free topology fit index). מודולי גנים זוהו באמצעות אלגוריתם חיתוך עץ דינמי. ביצעו מתאם בין ה-eigengenes של המודולים לבין הפנוטיפ של PH, והמודול הקשור למחלה בעל המתאם החזק ביותר נבחר. הגנים במודול המרכזי הושוו לגנים בעלי ביטוי Differentially Expressed כדי להגיע לגנים בהסכמה (consensus genes).
4. ניתוח העשרה פונקציונלית
קטגוריות של תהליכים ביולוגיים, רכיבים תאיים ותפקודים מולקולריים מ-Gene Ontology נותחו באמצעות clusterProfiler11. ניתוח העשרה של מסלולים מ-Kyoto Encyclopedia of Genes and Genomes בוצע כדי לזהות מסלולי איתות12. ערך P < 0.05 וערך q < 0.2 שימשו כספי העשרה, ומונחים מועשרים הוצגו חזותית באמצעות תרשימי בועות (bubble plots)11.
5. בניית רשת אינטראקציות בין חלבונים וזיהוי גנים מרכזיים (hub-genes)
רשימת הגנים המוסכמת הוגשה למסד הנתונים STRING, כאשר Homo sapiens נבחר כמין וסף ביטחון לאינטראקציה היה > 0.413. קובץ האינטראקציות יובא ל-Cytoscape, והתוסף CytoHubba שימש לדירוג הגנים לפי דרגת הצומת (node degree). גנים בעלי קישוריות גבוהה הוגדרו כגני מפתח (hub genes).
6. בחירת גנים בעלי מאפיינים אבחנתיים באמצעות למידה חישובית
יושמנו שלושה אלגוריתמים עצמאיים לבחירת מאפיינים. ראשית, בוצע רגרסיה לוגיסטית בשיטת LASSO (least absolute shrinkage and selection operator) באמצעות חבילת glmnet ואימות צולב של 10 קיפולים (10-fold cross-validation) כדי לזהות גנים עם מקדמים שאינם אפס14. שנית, יושמה שיטת סילוק מאפיינים רקורסיבי (RFE) עם מכונות וקטור תמיכה (SVM) כדי להסיר מאפיינים עודפים ולבחור את תת-קבוצת המאפיינים שהשיגה את הדיוק הגבוה ביותר באימות הצולב15. שלישית, נבנה מודל יער אקראי (random forest), והמאפיינים דורגו לפי הירידה הממוצעת בטומאת גיני (Gini impurity)16. חיתוך קבוצות הגנים שהתקבלו משלושת האלגוריתמים שימש להגדרת קבוצתו הסופית של גני המאפייני-ליבה. חבילת pROC שימשה ליצירת עקומות מאפייני תפעול של מקלט (ROC) ולחישוב ערכי השטח תחת העקומה (AUC)17.
7. תיקוף של גנים מרכזיים באמצעות מאגרי נתונים בלתי תלויים של bulk ושל תא בודד (single-cell)
GSE117261 שימש כעקבה חיצונית בלתי תלויה לתיקוף של רקמות ריאה, הכוללת 58 דגימות PAH ו-25 דגימות ביקורת של תורמים שנפסלו18. מערך נתונים זה לא שימש בניתוח הביטוי הדיפרנציאלי של שלב הגילוי, בבניית רשת ביטוי גנים משותף משוקללת (weighted gene co-expression network), או בבחירת מאפיינים באמצעות למידת מכונה. מטריצת הביטוי עברה נורמליזציה ואנוטציה, והביטוי הדיפרנציאלי נותח באמצעות limma v3.68.0. תיקון שיעור גילויים שגויים (FDR) לפי Benjamini-Hochberg הוחל על כל התסריפטום שעבר אנוטציה. עקומות מאפיינים של תפעול מקבל (ROC) עבור גנים בודדים חושבו באמצעות pROC v1.19.0.1, רווחי סמך של 95% לפי DeLong, ונקודות חיתוך לפי מדד Youden. מודל רגרסיה לוגיסטית גשש של חמישה גנים הותאם בתוך GSE117261, וביצועיו הפנימיים הוערכו בנוסף באמצעות תיקוף צולב מקונן חוזר (repeated nested cross-validation).
GSE210248 (טבלה 1) שימשה כסט נתונים לאימות של עורק ריאתי ברמת התא הבודד, הכולל דגימות משלושה מטופלים עם PAH ושלושה תורמים בריאים19הנתונים עובדו באמצעות Seurat v5.5.1 לצורך בקרת איכות, נורמליזציה, הפחתת ממדים, מקבץ (clustering) ואנוטציה של תאים.20זוהו אוכלוסיות תאים עיקריות, כולל תאי אנדותל, תאי שריר חלק, פיברובלאסטים, מונוציטים/מקרופאגים ותאי T/NK. תקשורת בין-תאית נותחה באמצעות CellChat v2.1.2 ומסד הנתונים של ליגנד-רספטור CellChatDB.human.21אובייקט CellChat נוצר ממטריצת הביטוי המנורמלת של Seurat וממטא-נתונים של סוגי התאים. זוהו גנים בעלי ביטוי יתר ואינטראקציות ליגנד-רצפטור; חושבו הסתברויות תקשורת; אינטראקציות המערבות קבוצות תאים עם פחות מ-10 תאים הוסרו; ורשתות תקשורת ברמת מסלול הוסקו וסוכמו. מערך נתונים זה שימש אך ורק לצורך תיקוף מכניסטי חיצוני ולא לאימון המודל.
| פריט | תיאור |
| ערכת נתונים | GSE210248 |
| סוג נתונים | ריצוף RNA של תא בודד מבוסס טיפות של 10x Genomics; פרופיל טרנסקריפטומי בעלת תפוקה גבוהה |
| דגימות אנושיות | שלוש דגימות של עורק ריאתי מחולי PAH ושלוש דגימות של עורק ריאתי מתורמים בריאים |
| מקור הרקמה | רקמת עורק ריאתי ex vivo, המשקפת בעיקרה את האקולוגיה התאית של דופן כלי הדם הריאתיים ואת תהליך עיצוב התבניות הווסקולרי (vascular remodeling) |
| מטרה אנליטית עיקרית | לוקליזציה של סוגי תאים, מעבר פנוטיפי של תאי שריר חלק, תקשורת בין תאים חיסוניים למבניים תאיים, ותיקוף של עקביות מכניסטית של גנים מועמדים |
טבלה 1: מידע בסיסי עבור מערך נתוני התיקוף של תאי בודדים GSE210248. הטבלה מסכמת את מספר הגישה למערך הנתונים, פלטפורמת הריצוף, מקור הרקמה, הרכב הדגימות והמטרה האנליטית של ניתוח התיקוף של עורקי הריאה ברמה של תאים בודדים.
8. תיקוף של ביטוי גנים באמצעות qRT-PCR
תיקוף ה-qRT-PCR כלל 20 דגימות רקמת ריאה PAH בלתי תלויות ביולוגית מחולים עם PH/PAH ו-20 דגימות רקמת ריאה של ביקורת בלתי תלויות ביולוגית. RNA כולל הופק באמצעות Total RNA Extraction Kit. ריכוז ה-RNA ודרגת הניקיון שלו נבחנו באמצעות ספקטרופוטומטר, ושלמות ה-RNA הוערכה באמצעות אלקטרופורזה של ג'ל אגרוזה. רק דגימות RNA עם ערכי A260/280 שבין 1.8 ל-2.1 וללא פירוק נראה לעין נכללו בניסוי.
כמויות שוות של RNA עברו תעתוק הפוך ל-DNA משלים באמצעות Solarbio Universal RT-PCR Kit (AMV; מספר קטלוג RP1200). PCR כמותי עבור CXCL10, JUN, IFIH1, MX1 ו-TLR7 בוצע באמצעות SYBR Green PCR Master Mix במערכת Real-Time PCR. כל דגימה ביולוגית נותחה בשלוש חזרות טכניות, יחד עם בקרות ללא תבנית (no-template) וללא תעתוק הפוך (no-reverse-transcription). ערך ה-Ct הממוצע של שלוש החזרות הטכניות שימש לניתוחים הבאים; חזרות טכניות לא נחשבו כתצפיות בלתי תלויות. נעשה שימוש בפריימרים המגשרים על חיבורי אקסון-אקסון ומפיקים אמפליקונים של 80–200 bp (טבלה 2). ספציפיות הפריימרים אומתה באמצעות NCBI Primer-BLAST וניתוח עקומת התכה22.
β-actin (ACTB) שימש כגן הייחוס הפנימי לנרמול רמות הביטוי של גני המטרה. הביטוי היחסי חושב באמצעות שיטת 2-ΔΔCt23. מבחני Mann-Whitney U דו-זנביים שימשו להשוואות בין קבוצות בהתבסס על התפלגות הנתונים, ותיקון Benjamini-Hochberg לקצב התגליות השגויות (FDR) הוחל על חמשת הגנים. עקומות ROC לגן בודד הופקו עם רווחי סמך של 95% לפי DeLong, ונקודות חיתוך אופטימליות נבחרו באמצעות מדד Youden. מודל רגרסיה לוגיסטית של חמישה גנים הותאם והוערך תחילה על אותן 40 דגימות ביולוגיות; לכן, הערכה זו הוגדרה כביצועי הדגימה הגלויים (apparent in-sample performance). כדי להעריך התאמת-יתר (overfitting) פוטנציאלית, בוצעו 100 חזרות של ולידציה צולבת מחומש (five-fold cross-validation) בשכבות באמצעות מודל רגרסיה לוגיסטית עם רגולריזציית L2, וחושב ביצוע ROC המאוחד של הדגימות שאינן חלק מאימון המודל (out-of-fold).
| Gene | RefSeq accession | Forward primer (5′–3′) | Reverse primer (5′–3′) | Product size (bp) | Tm (°C) | Exon-spanning |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Yes |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Yes |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Yes |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Yes |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Yes |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Yes |
טבלה 2: רצפי פריימרים ששימשו ל-quantitative reverse transcription PCR. הטבלה מפרטת את הגנים המטרים, מספרי הגישה של RefSeq, רצפי הפריימרים הקדמיים וההפוכים, גדלי המוצרים, טמפרטורות ההמסה, והמעמד של הפריימרים כחוצים אקסונים (exon-spanning) ששימשו ל-qRT-PCR.
9. סריקת תרכובות מועמדות ועגינה מולקולרית
חתימות הגנים המרכזיים שהראו ביטוי מוגבר (upregulated) או מופחת (downregulated) הוגשו למסד הנתונים Connectivity Map כדי לזהות מולקולות קטנות שנחזו כי הן מסוגלות להפוך את פרופיל הביטוי הקשור ל-PH7. המועמדים דורגו לפי מדד Logit והסתברות לחיזוי.
המבנה התלת-ממדי של BRD-K91900765/VX-745 התקבל מ-PubChem תחת CID 303852524. מידע פרמקולוגי הקשור לתרכובת נאסף ממאגרי מידע ציבוריים של תרופות, ודסקריפטורים מבניים חושבו באמצעות DrugBank ו-SwissADME25,26. מבני חלבונים התקבלו מ-RCSB Protein Data Bank באמצעות מזהי ה-PDB הבאים: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; ו-MAPK14/p38α, 1OUK27. זיהוי חללי קישור (blind cavity detection) ועגינה מולקולרית (molecular docking) בוצעו באמצעות CB-Dock2 v2.0 עם מנוע הניקוד AutoDock Vina v1.2.028,29. קבצי החלבון והליגנד הועלו ל-CB-Dock2, חללים פוטנציאליים זוהו באופן אוטומטי, והעגינה בוצעה בתוך תיבות ספציפיות לחללים שהופקו על ידי השרת. עבור כל חלבון, נרשמו מזהה החלל, ציון ה-Vina, נפח החלל, מרכז תיבת העגינה, ממדי תיבת העגינה וקובץ קומפלקס החלבון-ליגנד. הפוזה בעלת ציון ה-Vina השלילי ביותר נבחרה כקונפורמציה החזויה בעלת הדירוג הגבוה ביותר. MAPK14/p38α נכלל כמטרה הפרמקולוגית המוכרת וכחלבון עגינה המשמש כביקורת חיובית עבור VX-745. עגינה מול CXCL10, JUN, IFIH1, MX1 ו-TLR7 הייתה לצורכי מחקר ראשוני ולא פורשה כראיה למיקוד פרמקולוגי ישיר, קישור, עיכוב או יעילות.
10. ניתוח סטטיסטי ובקרת הדירות
כל הניתוחים הסטטיסטיים בוצעו ב-R אלא אם צוין אחרת. ערכי P דו-זנביים < 0.05 נחשבו למשמעותיים סטטיסטית. תיקון לבדיקות מרובות הוחל על ניתוחי הביטוי הדיפרנציאלי, ההעשרה, התיקוף החיצוני ו-qRT-PCR כפי שפורט לעיל. תיקוף צולב (Cross-validation) שימש להערכת היציבות של מודלי הלמידה השמישית ומודלי ה-qRT-PCR המשולבים.