הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר מחקר

זיהוי של סמנים ביולוגיים ותרכובות טיפוליות פוטנציאליות עבור יתר לחץ דם ריאתי באמצעות ביואינפורמטיקה ולמידה חישובית

82 צפיות

⸱

DOI:

10.3791/73519

⸱

25 באוגוסט 2026

במאמר זה

סיכום

מאמר זה מציג תהליך עבודה (workflow) בביואינפורמטיקה הניתן לשחזור, המשלב מאגרי נתונים טרנסקריפטומיים ציבוריים, למידה חישובית (machine learning), תיקוף חיצוני, quantitative reverse transcription PCR, סריקת Connectivity Map וסימולציית docking מולקולרי, במטרה לזהות סממנים ביולוגיים (biomarkers) ותאי תרופה פוטנציאליים עבור יתר לחץ דם ריאתי.

תקציר

מחקר זה נועד לזהות ביומרקרים מולקולריים ותרכובות מולקולות קטנות מועמדות הקשורות ליתר לחץ דם ריאתי (PH) באמצעות נתונים טרנסקריפטומיים ציבוריים ומשאבי תיקוף עצמאיים. שלושה מאגרי נתונים מ-Gene Expression Omnibus (מספריהם GSE22356, GSE33463, ו-GSE48149) שולבו לאחר נורמליזציה, אנוטציה של גששים ותיקון אפקט-אצווה באמצעות ComBat. לצורך זיהוי גני מאפיין מרכזיים, נעשה שימוש בניתוח ביטוי דיפרנציאלי, ניתוח רשתות ביטוי גנים משותף משוקלל (WGCNA), ניתוח העשרה פונקציונלית, ניתוח רשתות אינטראקציית חלבון-חלבון ושלושה אלגוריתמים של למידת מכונה. הביצועים האבחנאיים הוערכו באמצעות עקומות ROC (Receiver Operating Characteristic). התיקוף החיצוני כלל קוהורט עצמאי של רקמת ריאה (GSE117261), מאגר נתונים של ריצוף RNA של תא בודד (single-cell RNA-sequencing) מעורק ריאתי (GSE210248), ותיקוף באמצעות qRT-PCR בדגימות עצמאיות של רקמת ריאה. לצורך סריקת תרכובות מועמדות, נעשה שימוש במיפוי תרופות מבוסס Connectivity Map ובעגינה מולקולרית (molecular docking). זוהו שבעים ושמונה גנים עם ביטוי דיפרנציאלי, והגנים CXCL10, JUN, IFIH1, MX1 ו-TLR7 נבחרו כגני מאפיין מרכזיים. בקוהורט העצמאי של רקמת ריאה GSE117261, הגן JUN הראה את התמיכה החיצונית החזקה ביותר, בעוד שהשחזור של שאר הגנים היה משתנה. בדיקת qRT-PCR ב-20 דגימות של יתר לחץ דם עורקי ריאתי בלתי תלויות ביולוגית וב-20 דגימות ביקורת איששה את העלייה בביטוי של כל חמשת הגנים. מודל ה-qRT-PCR של חמשת הגנים וניתוחי תיקוף צולב מחומש עם 100 חזרות מרובד הניבו שניהם שטח תחת העקומה (AUC) של 1.000, אם כי גודל הקוהורט הקטן מחייב פרשנות זהירה ותיקוף פרוספקטיבי עצמאי. ניתוח תאים בודדים של GSE210248 תמך בתקשורת משובשת בין תאי מערכת החיסון לתאים מבניים ובשינוי פנוטיפי של תאי שריר חלק. התרכובת BRD-K91900765/VX-745 דורגה במקום הגבוה ביותר בסריקת ה-Connectivity Map. החלבון MAPK14/p38α, שהווה את המטרה הפרמקולוגית המוכרת שלו, נכלל כחלבון עגינה לצורכי ייחוס חיובי, בעוד שהעגינה מול חמשת החלבונים הקשורים לביומרקרים נחשבה כשלב גשש. ממצאים אלו תומכים בחמישה הגנים כביומרקרים מועמדים ל-PH וב-VX-745 כהיפותזה של מיקום תרופתי מחדש מבוסס חישוב, הדורשת תיקוף ניסויי.

מבוא

יתר לחץ דם ריאתי (PH) הוא תסמונת קרדיופולמונרית פרוגרסיבית המאופיינת בלחץ עורקי ריאתי גבוה באופן מתמיד, עלייה בהתנגדות הווסקולרית הריאתית, ובסופו של דבר כשל של החדר הימני. הקריטריונים ההמודינמיים הנוכחיים מגדירים PH כלחץ עורקי ריאתי ממוצע במנוחה של >20 mmHg, כפי שנמדד באמצעות קטטריזציה של הלב הימני1. בין תתי-הסוגים הקליניים השונים, יתר לחץ דם עורקי ריאתי (PAH) הוא אחת הצורות החמורות ביותר והוא מאופיין במידול (remodeling) וסקולרי ריאתי פרוגרסיבי. המאפיינים הפתולוגיים שלו כוללים דיספונקציה אנדותליאלית, התרבות ונדידה חריגה של תאי שריר חלק בעורקים הריאתיים, הפעלת פיברובלסטים באדוונטיציה, השקעת מטריקס חוץ-תאי, חדירה של תאי דלקת, והיצרות או חסימה של העורקים הריאתיים הדיסטליים2. שינויים אלו מעידים כי PH/PAH אינו רק הפרעה של כיווץ כלי דם (vasoconstriction), אלא מחלה מורכבת של מידול וסקולרי המונעת על ידי מנגנונים מולקולריים, תאיים ואימונו-דלקתיים מתואמים.

הטיפולים הנוכחיים ב-PAH מתמקדים בעיקר במסלולי הפרוסטציקלין, האנדותלין, תחמוצת החנקן–סולובל גואנילט ציקלאז, והפוספודיאסטראז מסוג 53˒4. למרות שטיפולים אלו משפרים את התסמינים, את יכולת הפעילות הגופנית ואת הפרמטרים ההמודינמיים, השפעותיהם נשארות במידה רבה וזודילטוריות (מרחיבות כלי דם) והמודינמיות. יכולתם להפוך רמודלינג וסקולרי ריאתי קיים היא מוגבלת, ומטופלים רבים ממשיכים לחוות התקדמות של המחלה למרות טיפול משולב. לפיכך, זיהוי ביומרקרים מולקולריים חדשים ומועמדים טיפוליים המשקפים את תהליך הרמודלינג מהווה צורך ממשי שטרם נענה. בפרט, אקטיבציה אימונו-דלקתית, סיגנלינג הקשור לאינטרפרון, מסלולי קולטני Toll-like, גיוס חיסוני המתווך על ידי כימוקינים, ומעבר פנוטיפי של תאי שריר חלק עלו כגורמים פוטנציאליים להתקדמות PH/PAH5˒6.

מאגרי נתונים טרנסקריפטומיים בעתקת תפוקה גבוהה מספקים משאבים בעלי ערך לזיהוי חתימות מולקולריות הקשורות למחלות ב-PH/PAH. עם זאת, מחקרים המבוססים על מאגר נתונים בודד מוגבלים לעיתים קרובות על ידי גודלי מדגם קטנים, אפקטים של סדרות (batch effects), הטרוגניות של פלטפורמות ואי-ספיקות של תיקוף. ניתוח ביטוי דיפרנציאלי יכול לזהות גנים עם ביטוי משתנה, אך עשוי שלא ללכוד באופן מלא מודולים של ביטוי משותף הקשורים למחלה או אינטראקציות ברמת הרשת. ניתוח רשת ביטוי משותף משוקלל של גנים (WGCNA) יכול לזהות מודולים של גנים הקשורים למאפייני המחלה, בעוד שניתוח רשת אינטראקציות חלבון-חלבון (PPI) יכול לחשוף גנים בעלי קישוריות גבוהה בתוך רשתות ביולוגיות. שיטות למידה חישובית יכולות גם לתעדף גנים בעלי ערך אבחנתי או סיווגי. עם זאת, הסתמכות על אלגוריתם בודד עלולה להכניס הטיות ספציפיות למודל. לפיכך, שילוב של ניתוח ביטוי דיפרנציאלי, WGCNA, ניתוח רשת PPI ומספר אלגוריתמים של למידה חישובית עשוי לשפר את החוסן של גילוי סממנים ביולוגיים.

אתגר מרכזי נוסף במחקרי סמנים ביולוגיים טרנסקריפטומיים הוא הפרשנות הביולוגית. אותות מרקמה כוללת (Bulk-tissue) עשויים לשקף שינויים בביטוי גנים בתוך תאי כלי דם תושבים, חדירה של תאי מערכת החיסון, או שינויים בפרופורציות של אוכלוסיות תאים מרובות. ריצוף RNA של תא בודד (Single-cell RNA sequencing) מספק הזדמנות להציב גנים מועמדים שזוהו בריצוף כולל בתוך הקשר תאי. ב-PH/PAH, עיצוב מחדש של כלי הדם הריאתיים מערב תאי אנדותל, תאי שריר חלק, פיברובלסטים, מונוציטים/מקרופגים, לימפוציטים ותאים חיסוניים או מבניים אחרים. התקדמות המחלה קשורה גם לשינוי בתקשורת בין תאים ולמעבר פנוטיפי של תאי שריר חלק. לכן, שילוב של סריקה טרנסקריפטומית כוללת יחד עם תיקוף של תא בודד עשוי לסייע בקביעה האם הסמנים הביולוגיים המועמדים קשורים להפעלה חיסונית, לעיצוב מבני של כלי הדם, או לחוסר איזון בתקשורת רב-תאית.

בנוסף לגילוי סמנים ביולוגיים, ניתן להשתמש בחתימות טרנסקריפטומיות למיקום מחדש של תרופות בשיטות חישוביות. ה-Connectivity Map (CMap) מקשר בין פרופילים של ביטוי גנים הקשורים למחלות לבין מולקולות קטנות שעשויות להפוך או לווסת חתימות אלו7. כאשר אסטרטגיה זו משולבת עם אוצרות של תרכובות ועגינה מולקולרית (molecular docking), היא יכולה להניב היפותזות טיפוליות הניתנות לבדיקה ניסיונית. למרות שחיזוי באמצעות CMap ועגינה מולקולרית אינם יכולים לקבוע את יעילות התרופה, הם יכולים לתעדף תרכובות מועמדות עבור בדיקות קישור למטרה, ניסויים מבוססי תאים ותיקוף במודלים של בעלי חיים בעתיד.

פותח תהליך עבודה (workflow) משולב וניתן לשחזור לזיהוי ביומרקרים של PH/PAH ותרכובות טיפוליות פוטנציאליות. שלושה מאגרי נתונים טרנסקריפטומיים ציבוריים מ-Gene Expression Omnibus שולבו לאחר נורמליזציה ותיקון אפקט-סדרה (batch-effect correction). לצורך סינון גנים בעלי מאפיינים חסונים, נעשה שימוש בניתוח ביטוי דיפרנציאלי, WGCNA, ניתוח העשרה תפקודי, ניתוח רשת PPI ושלושה אלגוריתמים של למידת מכונה. לצורך הערכה נוספת של הגנים שנבחרו, נעשה שימוש בניתוח עקומת ROC, קוהורט תיקוף עצמאי של רקמת ריאה, ראיות מריצוף RNA של תאים בודדים (single-cell RNA-sequencing) בעורקי הריאה, ותיקוף באמצעות quantitative reverse transcription PCR במדגמים עצמאיים. לבסוף, יושמו תהליכי מיקום מחדש של תרופות (drug repositioning) מבוססי CMap וסימולציית עגינה מולקולרית (molecular docking) כדי לזהות תרכובות מועמדות. החדשנות של המחקר טמונה במסגרת התיקוף רב-שכבתית שלו, המקשרת בין גילוי טרנסקריפטומי ב-bulk, תעדוף באמצעות למידת מכונה, תיקוף עצמאי, אישור ניסיוני באמצעות quantitative reverse transcription PCR, פרשנות מכניסטית ברמת התא הבודד וסינון חישובי של תרכובות. השערת המחקר הייתה כי PH/PAH מונעים על ידי תוכנית מתואמת של דלקת-חיסונית ועיצוב מחדש של כלי הדם (vascular remodeling), וכי גנים חסונים בתוך תוכנית זו עשויים לשמש כביומרקרים מועמדים ולספק הזדמנויות למיקום מחדש של תרופות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

מאגרי הנתונים הציבוריים של Gene Expression Omnibus (GEO) שנותחו במחקר זה הכילו נתונים טרנסקריפטומיים שעברו דה-אידנטיפיקציה ממחקרים שפורסמו בעבר, ולא דרשו אישור אתי נוסף. ועדת האתיקה של אוניברסיטת Huaihua אישרה את מחקר התיקוף העצמאי של רקמות ריאה אנושיות באמצעות PCR עם שעתוק הפוך כמותי (qRT-PCR) (מספר אישור 2024(A05112)). הסכמה מדעת בכתב התקבלה מכל המשתתפים או מנציגיהם המורשים על פי חוק לפני איסוף הדגימות. הליכי האישור וההסכמה חלו על כל 20 דגימות רקמת הריאה של חולי יתר לחץ דם رئתי (PAH) ו-20 דגימות הביקורת שנכללו בתיקוף ה-qRT-PCR. כלי המחקר ששימשו לפרוטוקול זה מפורטים ב- טבלת חומרים.

1. איסוף ועיבוד מקדים של מאגרי נתונים טרנסקריפטומיים ציבוריים

מאגרי נתוני מיקרו-מערך (microarray) GSE22356, GSE33463 ו-GSE48149 הקשורים ליתר לחץ דם ריאתי (PH) הופקו ממאגר הנתונים GEO. דגימות של PH/יתר לחץ דם עורקי ריאתי (PAH) ודגימות ביקורת חולצו בהתאם להערות הפנוטיפ המקוריות. מטריצות ביטוי וקבצי הערות פלטפורמה הורדו באמצעות סקריפטים של R הניתנים לשחזור ובאמצעות חבילת GEOquery.

ביצוע השרויות הפרובים (Probe annotation) ומיפוי סמלי הגנים בוצעו באופן עקבי בכל מערכי הנתונים. כאשר מספר פרובים מופו לאותו גן, חושב ערך הביטוי הממוצע. הוחל נורמליזציית קוונטילים (Quantile normalization), וגנים עם ביטוי נמוך או שונות נמוכה הוסרו. מערכי הנתונים מוזגו, והשפעות אלומה (batch effects) תוקנו באמצעות אלגוריתם ה-ComBat בחבילת ה-sva8. התיקון הוערך באמצעות תרשימי קופסה (boxplots) וניתוח רכיבים ראשיים (principal component analysis).

2. זיהוי גנים המבטאים ביטוי דיפרנציאלי

חבילת limma שימשה להשוואת רמות הביטוי בין דגימות PH לדגימות ביקורת במטריצת הביטוי המתוקנת עבור אפקטי batch9. הותאמה מודל ליניארי, ויושמו סטטיסטיקות Bayes אמפיריות. גנים בעלי ביטוי דיפרנציאלי הוגדרו באמצעות ערך P מתוקנן <0.05 ושינוי קיפול (fold change) מוחלט של log2 > 0.585. התוצאות הוצגו באופן ויזואלי באמצעות volcano plots ומפות חום (heatmaps).

3. בניית רשת ביטוי גנים משותף משוקללת

רשת ביטוי גנים משותף משוקללת נבנתה באמצעות חבילת WGCNA10. ביצוע אשכולות לדגימות (Sample clustering) בוצע כדי לזהות ערכים חריגים. עוצמת הסף הרך (soft-thresholding power) נבחרה על בסיס מדד התאמה לטופולוגיה חסרת קנה מידה (scale-free topology fit index). מודולי גנים זוהו באמצעות אלגוריתם חיתוך עץ דינמי. ביצעו מתאם בין ה-eigengenes של המודולים לבין הפנוטיפ של PH, והמודול הקשור למחלה בעל המתאם החזק ביותר נבחר. הגנים במודול המרכזי הושוו לגנים בעלי ביטוי Differentially Expressed כדי להגיע לגנים בהסכמה (consensus genes).

4. ניתוח העשרה פונקציונלית

קטגוריות של תהליכים ביולוגיים, רכיבים תאיים ותפקודים מולקולריים מ-Gene Ontology נותחו באמצעות clusterProfiler11. ניתוח העשרה של מסלולים מ-Kyoto Encyclopedia of Genes and Genomes בוצע כדי לזהות מסלולי איתות12. ערך P < 0.05 וערך q < 0.2 שימשו כספי העשרה, ומונחים מועשרים הוצגו חזותית באמצעות תרשימי בועות (bubble plots)11.

5. בניית רשת אינטראקציות בין חלבונים וזיהוי גנים מרכזיים (hub-genes)

רשימת הגנים המוסכמת הוגשה למסד הנתונים STRING, כאשר Homo sapiens נבחר כמין וסף ביטחון לאינטראקציה היה > 0.413. קובץ האינטראקציות יובא ל-Cytoscape, והתוסף CytoHubba שימש לדירוג הגנים לפי דרגת הצומת (node degree). גנים בעלי קישוריות גבוהה הוגדרו כגני מפתח (hub genes).

6. בחירת גנים בעלי מאפיינים אבחנתיים באמצעות למידה חישובית

יושמנו שלושה אלגוריתמים עצמאיים לבחירת מאפיינים. ראשית, בוצע רגרסיה לוגיסטית בשיטת LASSO (least absolute shrinkage and selection operator) באמצעות חבילת glmnet ואימות צולב של 10 קיפולים (10-fold cross-validation) כדי לזהות גנים עם מקדמים שאינם אפס14. שנית, יושמה שיטת סילוק מאפיינים רקורסיבי (RFE) עם מכונות וקטור תמיכה (SVM) כדי להסיר מאפיינים עודפים ולבחור את תת-קבוצת המאפיינים שהשיגה את הדיוק הגבוה ביותר באימות הצולב15. שלישית, נבנה מודל יער אקראי (random forest), והמאפיינים דורגו לפי הירידה הממוצעת בטומאת גיני (Gini impurity)16. חיתוך קבוצות הגנים שהתקבלו משלושת האלגוריתמים שימש להגדרת קבוצתו הסופית של גני המאפייני-ליבה. חבילת pROC שימשה ליצירת עקומות מאפייני תפעול של מקלט (ROC) ולחישוב ערכי השטח תחת העקומה (AUC)17.

7. תיקוף של גנים מרכזיים באמצעות מאגרי נתונים בלתי תלויים של bulk ושל תא בודד (single-cell)

GSE117261 שימש כעקבה חיצונית בלתי תלויה לתיקוף של רקמות ריאה, הכוללת 58 דגימות PAH ו-25 דגימות ביקורת של תורמים שנפסלו18. מערך נתונים זה לא שימש בניתוח הביטוי הדיפרנציאלי של שלב הגילוי, בבניית רשת ביטוי גנים משותף משוקללת (weighted gene co-expression network), או בבחירת מאפיינים באמצעות למידת מכונה. מטריצת הביטוי עברה נורמליזציה ואנוטציה, והביטוי הדיפרנציאלי נותח באמצעות limma v3.68.0. תיקון שיעור גילויים שגויים (FDR) לפי Benjamini-Hochberg הוחל על כל התסריפטום שעבר אנוטציה. עקומות מאפיינים של תפעול מקבל (ROC) עבור גנים בודדים חושבו באמצעות pROC v1.19.0.1, רווחי סמך של 95% לפי DeLong, ונקודות חיתוך לפי מדד Youden. מודל רגרסיה לוגיסטית גשש של חמישה גנים הותאם בתוך GSE117261, וביצועיו הפנימיים הוערכו בנוסף באמצעות תיקוף צולב מקונן חוזר (repeated nested cross-validation).

GSE210248 (טבלה 1) שימשה כסט נתונים לאימות של עורק ריאתי ברמת התא הבודד, הכולל דגימות משלושה מטופלים עם PAH ושלושה תורמים בריאים19הנתונים עובדו באמצעות Seurat v5.5.1 לצורך בקרת איכות, נורמליזציה, הפחתת ממדים, מקבץ (clustering) ואנוטציה של תאים.20זוהו אוכלוסיות תאים עיקריות, כולל תאי אנדותל, תאי שריר חלק, פיברובלאסטים, מונוציטים/מקרופאגים ותאי T/NK. תקשורת בין-תאית נותחה באמצעות CellChat v2.1.2 ומסד הנתונים של ליגנד-רספטור CellChatDB.human.21אובייקט CellChat נוצר ממטריצת הביטוי המנורמלת של Seurat וממטא-נתונים של סוגי התאים. זוהו גנים בעלי ביטוי יתר ואינטראקציות ליגנד-רצפטור; חושבו הסתברויות תקשורת; אינטראקציות המערבות קבוצות תאים עם פחות מ-10 תאים הוסרו; ורשתות תקשורת ברמת מסלול הוסקו וסוכמו. מערך נתונים זה שימש אך ורק לצורך תיקוף מכניסטי חיצוני ולא לאימון המודל.

פריטתיאור
ערכת נתוניםGSE210248
סוג נתוניםריצוף RNA של תא בודד מבוסס טיפות של 10x Genomics; פרופיל טרנסקריפטומי בעלת תפוקה גבוהה
דגימות אנושיותשלוש דגימות של עורק ריאתי מחולי PAH ושלוש דגימות של עורק ריאתי מתורמים בריאים
מקור הרקמהרקמת עורק ריאתי ex vivo, המשקפת בעיקרה את האקולוגיה התאית של דופן כלי הדם הריאתיים ואת תהליך עיצוב התבניות הווסקולרי (vascular remodeling)
מטרה אנליטית עיקריתלוקליזציה של סוגי תאים, מעבר פנוטיפי של תאי שריר חלק, תקשורת בין תאים חיסוניים למבניים תאיים, ותיקוף של עקביות מכניסטית של גנים מועמדים

טבלה 1: מידע בסיסי עבור מערך נתוני התיקוף של תאי בודדים GSE210248. הטבלה מסכמת את מספר הגישה למערך הנתונים, פלטפורמת הריצוף, מקור הרקמה, הרכב הדגימות והמטרה האנליטית של ניתוח התיקוף של עורקי הריאה ברמה של תאים בודדים.

8. תיקוף של ביטוי גנים באמצעות qRT-PCR

תיקוף ה-qRT-PCR כלל 20 דגימות רקמת ריאה PAH בלתי תלויות ביולוגית מחולים עם PH/PAH ו-20 דגימות רקמת ריאה של ביקורת בלתי תלויות ביולוגית. RNA כולל הופק באמצעות Total RNA Extraction Kit. ריכוז ה-RNA ודרגת הניקיון שלו נבחנו באמצעות ספקטרופוטומטר, ושלמות ה-RNA הוערכה באמצעות אלקטרופורזה של ג'ל אגרוזה. רק דגימות RNA עם ערכי A260/280 שבין 1.8 ל-2.1 וללא פירוק נראה לעין נכללו בניסוי.

כמויות שוות של RNA עברו תעתוק הפוך ל-DNA משלים באמצעות Solarbio Universal RT-PCR Kit (AMV; מספר קטלוג RP1200). PCR כמותי עבור CXCL10, JUN, IFIH1, MX1 ו-TLR7 בוצע באמצעות SYBR Green PCR Master Mix במערכת Real-Time PCR. כל דגימה ביולוגית נותחה בשלוש חזרות טכניות, יחד עם בקרות ללא תבנית (no-template) וללא תעתוק הפוך (no-reverse-transcription). ערך ה-Ct הממוצע של שלוש החזרות הטכניות שימש לניתוחים הבאים; חזרות טכניות לא נחשבו כתצפיות בלתי תלויות. נעשה שימוש בפריימרים המגשרים על חיבורי אקסון-אקסון ומפיקים אמפליקונים של 80–200 bp (טבלה 2). ספציפיות הפריימרים אומתה באמצעות NCBI Primer-BLAST וניתוח עקומת התכה22.

β-actin (ACTB) שימש כגן הייחוס הפנימי לנרמול רמות הביטוי של גני המטרה. הביטוי היחסי חושב באמצעות שיטת 2-ΔΔCt23. מבחני Mann-Whitney U דו-זנביים שימשו להשוואות בין קבוצות בהתבסס על התפלגות הנתונים, ותיקון Benjamini-Hochberg לקצב התגליות השגויות (FDR) הוחל על חמשת הגנים. עקומות ROC לגן בודד הופקו עם רווחי סמך של 95% לפי DeLong, ונקודות חיתוך אופטימליות נבחרו באמצעות מדד Youden. מודל רגרסיה לוגיסטית של חמישה גנים הותאם והוערך תחילה על אותן 40 דגימות ביולוגיות; לכן, הערכה זו הוגדרה כביצועי הדגימה הגלויים (apparent in-sample performance). כדי להעריך התאמת-יתר (overfitting) פוטנציאלית, בוצעו 100 חזרות של ולידציה צולבת מחומש (five-fold cross-validation) בשכבות באמצעות מודל רגרסיה לוגיסטית עם רגולריזציית L2, וחושב ביצוע ROC המאוחד של הדגימות שאינן חלק מאימון המודל (out-of-fold).

GeneRefSeq accessionForward primer (5′–3′)Reverse primer (5′–3′)Product size (bp)Tm (°C)Exon-spanning
CXCL10NM_001565.4GTCAAGCCAT
AATTGTTC
ATAGTGCCAG
GGTAGAGT
14146.1Yes
JUNNM_002228.4ACAAGTGGCA
GAGTCCCG
CGCCCAAGTT
CAACAACC
15254.5Yes
IFIH1NM_022168GCACAGAGCG
GTAGACCCT
GCCCTGAAGC
ACGAGATG
18254.7Yes
MX1NM_002462.5TTAGCCGTGG
TGATTTAGC
CAAGGTGGAG
CGATTCTG
15652.3Yes
TLR7NM_016562.4ATTGCCCTCGT
TGTTATA
TTCCTGGAGTT
TGTTGAT
17948.1Yes
ACTBNM_001101.3CTCACCATGGAT
GATGATATCGC
AGGAATCCTTCT
GACCCATGC
19456.2Yes

טבלה 2: רצפי פריימרים ששימשו ל-quantitative reverse transcription PCR. הטבלה מפרטת את הגנים המטרים, מספרי הגישה של RefSeq, רצפי הפריימרים הקדמיים וההפוכים, גדלי המוצרים, טמפרטורות ההמסה, והמעמד של הפריימרים כחוצים אקסונים (exon-spanning) ששימשו ל-qRT-PCR.

9. סריקת תרכובות מועמדות ועגינה מולקולרית

חתימות הגנים המרכזיים שהראו ביטוי מוגבר (upregulated) או מופחת (downregulated) הוגשו למסד הנתונים Connectivity Map כדי לזהות מולקולות קטנות שנחזו כי הן מסוגלות להפוך את פרופיל הביטוי הקשור ל-PH7. המועמדים דורגו לפי מדד Logit והסתברות לחיזוי.

המבנה התלת-ממדי של BRD-K91900765/VX-745 התקבל מ-PubChem תחת CID 303852524. מידע פרמקולוגי הקשור לתרכובת נאסף ממאגרי מידע ציבוריים של תרופות, ודסקריפטורים מבניים חושבו באמצעות DrugBank ו-SwissADME25,26. מבני חלבונים התקבלו מ-RCSB Protein Data Bank באמצעות מזהי ה-PDB הבאים: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; ו-MAPK14/p38α, 1OUK27. זיהוי חללי קישור (blind cavity detection) ועגינה מולקולרית (molecular docking) בוצעו באמצעות CB-Dock2 v2.0 עם מנוע הניקוד AutoDock Vina v1.2.028,29. קבצי החלבון והליגנד הועלו ל-CB-Dock2, חללים פוטנציאליים זוהו באופן אוטומטי, והעגינה בוצעה בתוך תיבות ספציפיות לחללים שהופקו על ידי השרת. עבור כל חלבון, נרשמו מזהה החלל, ציון ה-Vina, נפח החלל, מרכז תיבת העגינה, ממדי תיבת העגינה וקובץ קומפלקס החלבון-ליגנד. הפוזה בעלת ציון ה-Vina השלילי ביותר נבחרה כקונפורמציה החזויה בעלת הדירוג הגבוה ביותר. MAPK14/p38α נכלל כמטרה הפרמקולוגית המוכרת וכחלבון עגינה המשמש כביקורת חיובית עבור VX-745. עגינה מול CXCL10, JUN, IFIH1, MX1 ו-TLR7 הייתה לצורכי מחקר ראשוני ולא פורשה כראיה למיקוד פרמקולוגי ישיר, קישור, עיכוב או יעילות.

10. ניתוח סטטיסטי ובקרת הדירות

כל הניתוחים הסטטיסטיים בוצעו ב-R אלא אם צוין אחרת. ערכי P דו-זנביים < 0.05 נחשבו למשמעותיים סטטיסטית. תיקון לבדיקות מרובות הוחל על ניתוחי הביטוי הדיפרנציאלי, ההעשרה, התיקוף החיצוני ו-qRT-PCR כפי שפורט לעיל. תיקוף צולב (Cross-validation) שימש להערכת היציבות של מודלי הלמידה השמישית ומודלי ה-qRT-PCR המשולבים.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

עיבוד מקדים של נתונים טרנסקריפטומיים ציבוריים וזיהוי גנים בעלי ביטוי דיפרנציאלי

אינטגרציה ותיקון ComBat של GSE2356, GSE33463 ו-GSE48149 הפחיתו הבדלים סיסטמטיים בין מערכי הנתונים. תרשימי קופסה הראו כי התפלגויות הביטוי של הדגימות הפכו לעקביות יותר לאחר התיקון. ניתוח רכיבים ראשיים העיד כי הדגימות התקבצו בעיקר לפי מקור מערך הנתונים לפני התיקון, אך הפכו למעורבבות יותר לאחר התיקון, מה שמעיד על הפחתה יעילה של אפקט הסדרה (איור 1).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

פותח תהליך עבודה (workflow) אינטגרטיבי וניתן לשחזור לזיהוי סמנים ביולוגיים מולקולריים ותהליכים תרופתיים מועמדים הקשורים ל-PH/PAH, וזאת באמצעות שילוב של נתוני טרנסקריפטומיקה פומביים, ניתוח רשתות ביטוי גנים משוקלל (WGCNA), העשרה תפקודית, ניתוח רשתות אינטראקציה בין חלבונים, שלושה אלגוריתמים של למידת מכונה, תיקוף חיצוני, פרשנות טרנסקריפטומית ברמת התא הבודד, אישור באמצעות quantitative reverse transcription PCR, סריקת Connectivity Map ועגינה מולקולרית (molecular docking). הגנים CXCL10, JUN, IFIH1, MX1 ו-TLR7 תועדפו באופן עקבי ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

המחברים מצהירים כי אין להם ניגודי אינטרסים.

תודות

מחקר זה נתמך על ידי פרויקט בניית המחוז החדשני של Hunan (מס' 2022JJ30465).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
2× SYBR Green PCR MastermixBeijing Solarbio Science & .Technology Co., Ltdמספר קטלוג SR1110הגברה וגילוי פלואורסצנציה ב-PCR כמותי בזמן אמת מבוסס צבע
AI21.msvmRFE.R ו-e1071סקריפט R מותאם אישית עם חבילת e1071 מ-CRANAI21.msvmRFE.R; e1071 v1.7-17סילוק תכונות רקורסיבי באמצעות מכונת וקטורים תומכים
אגרוזBeijing Solarbio Science & .Technology Co., Ltdמספר קטלוג A8201; CAS 9012-36-6הערכת שלמות ה-RNA הכולל באמצעות אלקטרופורזה של ג'ל אגרוזה
מכשיר לאלקטרופורזה של ג'ל אגרוזהBeijing Liuyi Biotechnology Co., Ltd.דגם DYCZ-24DNהערכה אלקטרופורטית של שלמות ה-RNA
מנוע הניקוד של AutoDock Vinaהמרכז לביולוגיה מבנית חישובית, Scripps Researchv1.2.0; RRID: SCR_011958דירוג תנוחות של חלבון-ליגנד במסגרת זרימת העבודה של CB-Dock2
CB-Dock2מעבדת Cao, שרת האינטרנט CB-Dock2גרסה 2.0; נגישה מיולי 2026זיהוי חללים עיוור (Blind cavity detection) ועגינה מולקולרית (molecular docking) של VX-745 עם מבני החלבון שנבחרו
CellChatחבילת ה-R‏ CellChatv2.1.2הסקה וויזואליזציה של תקשורת בין תאים מתוך מטריצת ביטוי של תא בודד
CellChatDB.humanמופץ באמצעות חבילת ה-R בשם CellChatCellChatDB.human; תת-קבוצה של איתות מופרש; סף תאים מינימלי = 10מאגר נתוני אינטראקציות ליגנד-רספטור אנושי עבור CellChat
clusterProfilerחבילת R של Bioconductorv4.20.0; גרסת Bioconductor 3.23ניתוחי העשרה של Gene Ontology ושל Kyoto Encyclopedia of Genes and Genomes
מפת קישוריות (CMap/CLUE)Broad Instituteמשאב L1000/CLUE; RRID: SCR_016204; נגישה ביולי 2026ניתוח חישובי לאיתור שימושים חדשים לתרופות (drug-repositioning)
פריימרים של אוליגונוקלאוטידים בהתאמה אישיתBeijing Solarbio Science & .Technology Co., Ltdסנתזה מותאמת אישית; רצפי הפריימרים מופיעים בטבלה 2הגברה של ACTB, CXCL10, JUN, IFIH1, MX1 ו-TLR7
cytoHubbaחנות האפליקציות של Cytoscapeגרסה 0.1דירוג גנים מרכזיים (hub genes) מבוסס דרגה ברשת אינטראקציות חלבון-חלבון
Cytoscapeקונסורציום Cytoscapev3.10.4; RRID: SCR_003032ויזואליזציה ואנליזה של רשתות אינטראקציית חלבון-חלבון
DrugBankמאגר הידע DrugBankv6.0; RRID: SCR_002700זיהוי תרכובות ואוצרות מידע פרמקולוגי
מערכת לתיעוד ג'ליםBeijing Liuyi Biotechnology Co., Ltd.דגם WO-9413Bויזואליזציה ותיעוד של תוצאות שלמות ה-RNA בג'ל אגרוז
Gene Expression Omnibus (GEO)המרכז הלאומי למידע בביוטכנולוגיהGSE22356, GSE33463, GSE48149, GSE117261, ו-GSE210248; RRID: SCR_005012שליפה של מאגרי נתונים טרנסקריפטומיים ברמה של אוכלוסיית תאים (bulk) וברמה של תא בודד (single-cell)
GEOqueryחבילת R של Bioconductorv2.80.0; גרסת Bioconductor 3.23הורדה וייבוא תכנותיים של נתוני ביטוי ופנוטיפ מ-GEO
glmnetחבילת R של CRANגרסה 5.0רגרסיה לוגיסטית בשיטת LASSO (מפעיל בחירה וכיווץ מוחלט מינימלי) ומידול לוגיסטי רגולריזציוני
limmaחבילת R של Bioconductorv3.68.0; Bioconductor release 3.23; RRID: SCR_010943ניתוח ביטוי דיפרנציאלי וסטטיסטיקה של בייס אמפירי (Empirical Bayes)
ספקטרופוטומטר NanoDropThermo Fisher ScientificNanoDrop ND-1000; גרסת תוכנה 3.8מדידת ריכוז RNA ויחסי טוהר של A260/280 ו-A260/230
NCBI Primer-BLASTהמרכז הלאומי למידע בביוטכנולוגיהכלי רשת; RRID: SCR_003095; נגישה ביולי 2026אימות ספציפיות של הפריימרים
pROCחבילת R של CRANv1.19.0.1; RRID: SCR_024286ניתוח עקומת מאפייני הפעלה של מקלט (ROC), רווחי סמך של DeLong ונקודות חיתוך לפי מדד Youden
מאגר נתוני החלבונים (Protein Data Bank - PDB)RCSB Protein Data BankCXCL10: 1LV9; JUN: 1JUN; IFIH1: 3B6E; MX1: 5GTM; TLR7: 7CYN; MAPK14/p38α: 1OUK; RRID: SCR_012820שליפת מבני חלבונים שנקבעו ניסויית עבור עגינה מולקולרית
PubChemהמרכז הלאומי למידע ביוטכנולוגיPubChem CID 3038525; RRID: SCR_004284שחזור המבנה התלת-ממדי ומזהים כימיים של BRD-K91900765/VX-745
RR Foundation for Statistical Computingv4.6.1; RRID: SCR_001905חישוב סטטיסטי, עיבוד נתונים, למידת מכונה והדמיה ויזואלית
יער אקראי (randomForest)חבילת R של CRANv4.7-1.2בחירת תכונות ודירוג חשיבות משתנים באמצעות יער אקראי (Random forest)
מערכת PCR בזמן אמתStratagene, כיום Agilent Technologiesמערכת Mx3000P ל-PCR בזמן אמתהגברה ב-qRT-PCR, רכישת פלואורסצנציה, ניתוח עקומת התכה וייצוא ערכי Ct
Seuratחבילת R של CRAN; מעבדת Satijav5.5.1; RRID: SCR_016341בקרת איכות, נורמליזציה, הפחתת ממדיים, אשכול (clustering) ואנוטציה של רצף RNA של תא בודד (scRNA-seq)
נא לספק את הטקסט המקור באנגלית לתרגום.קונסורציום STRINGv12.0; RRID: SCR_005223בניית רשת אינטראקציות חלבון-חלבון
sva (ComBat)חבילת R של Bioconductorv3.60.0; גרסת Bioconductor 3.23תיקון אפקטים של אצווה (batch effects) בין מאגרי נתונים
SwissADMEהמכון השוויצרי לביואינפורמטיקהשרת אינטרנט; נגישה ביולי 2026סינון מקדים של דמיון לתרופה, תכונות פיזיקכימיות ו-ADME
ערכה למיצוי RNA כוללBeijing Solarbio Science & .Technology Co., Ltdמספר קטלוג R1200מיצוי וטיהור של RNA כולל מדגימות רקמת ריאה
ערכה אוניברסלית ל-RT-PCR (AMV)Beijing Solarbio Science & .Technology Co., Ltdמספר קטלוג RP1200שעתוק הפוך של RNA כולל ל-DNA משלים
WGCNAחבילת R של CRANv1.74בניית רשת ביטוי גנים משותף משוקללת ואנליזה של קשרי מודולים-תכונות

מקורות

  1. Simonneau G, et al. Haemodynamic definitions and updated clinical classification of pulmonary hypertension. Eur Respir J. 2019;53(1):1801913. doi: 10.1183/13993003.01913-2018.
  2. Rabinovitch M, Guignabert C, Humbert M, Nicolls MR. Inflammation and immunity in the pathogenesis of pulmonary arterial hypertension. Circ Res. 2014;115(1):165–175.
  3. Humbert M, et al. 2022 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Heart J. 2022;43(38):3618–3731.
  4. Galiè N, et al. 2015 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Respir J. 2015;46(4):903–975.
  5. Soon E, et al. Elevated levels of inflammatory cytokines predict survival in idiopathic and familial pulmonary arterial hypertension. Circulation. 2010;122(9):920–927.
  6. George PM, et al. Evidence for the involvement of type I interferon in pulmonary arterial hypertension. Circ Res. 2014;114(4):677–688.
  7. Subramanian A, et al. A next-generation Connectivity Map: L1000 platform and the first 1,000,000 profiles. Cell. 2017;171(6):1437–1452.e17.
  8. Leek JT, et al. The sva package for removing batch effects and other unwanted variation in high-throughput experiments. Bioinformatics. 2012;28(6):882–883.
  9. Ritchie ME, et al. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 2015;43(7):e47. doi: 10.1093/nar/gkv007.
  10. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9:559. doi: 10.1186/1471-2105-9-559.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–287.
  12. Kanehisa M, Goto S. KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Res. 2000;28(1):27–30.
  13. Szklarczyk D, et al. The STRING database in protein–protein association networks and functional enrichment analyses for any sequenced genome of interest. Nucleic Acids Res. 2023;51(D1):D638–D646.
  14. Friedman J, Hastie T, Tibshirani R. Regularization paths for generalized linear models via coordinate descent. J Stat Softw. 2010;33(1):1–22.
  15. Guyon I, Weston J, Barnhill S, Vapnik V. Gene selection for cancer classification using support vector machines. Mach Learn. 2002;46:389–422.
  16. Breiman L. Random forests. Mach Learn. 2001;45(1):5–32.
  17. Robin X, et al. pROC: an open-source package for R and S+ to analyze and compare ROC curves. BMC Bioinformatics. 2011;12:77. doi: 10.1186/s12859-011-0077-8.
  18. Stearman RS, et al. Systems analysis of the human pulmonary arterial hypertension lung transcriptome. Am J Respir Cell Mol Biol. 2019;60(6):637–649.
  19. Crnkovic S, et al. Single-cell transcriptomics reveals skewed cellular communication and phenotypic shift in pulmonary artery remodeling. JCI Insight. 2022;7(20):e153471. doi: 10.1172/jci.insight.153471.
  20. Hao Y, et al. Integrated analysis of multimodal single-cell data. Cell. 2021;184(13):3573–3587.e29.
  21. Jin S, et al. Inference and analysis of cell–cell communication using CellChat. Nat Commun. 2021;12(1):1088. doi: 10.1038/s41467-021-21246-9.
  22. Bustin SA, et al. MIQE 2.0: revision of the Minimum Information for Publication of Quantitative Real-Time PCR Experiments guidelines. Clin Chem. 2025;71(6):634–651.
  23. Livak KJ, Schmittgen TD. Analysis of relative gene expression data using real-time quantitative PCR and the 2−ΔΔCt method. Methods. 2001;25(4):402–408.
  24. Kim S, et al. PubChem 2023 update. Nucleic Acids Res. 2023;51(D1):D1373–D1380.
  25. Knox C, et al. DrugBank 6.0: the DrugBank Knowledgebase for 2024. Nucleic Acids Res. 2024;52(D1):D1265–D1275.
  26. Daina A, Michielin O, Zoete V. SwissADME: a free web tool to evaluate pharmacokinetics, drug-likeness, and medicinal chemistry friendliness of small molecules. Sci Rep. 2017;7:42717. doi: 10.1038/srep42717.
  27. Burley SK, et al. RCSB Protein Data Bank: powerful new tools for exploring 3D structures of biological macromolecules for basic and applied research and education. Nucleic Acids Res. 2021;49(D1):D437–D451. doi: 10.1093/nar/gkaa1038.
  28. Eberhardt J, Santos-Martins D, Tillack AF, Forli S. AutoDock Vina 1.2.0: new docking methods, expanded force field, and Python bindings. J Chem Inf Model. 2021;61(8):3891–3898. doi: 10.1021/acs.jcim.1c00203.
  29. Liu Y, et al. CB-Dock2: improved protein-ligand blind docking by integrating cavity detection, docking, and homologous template fitting. Nucleic Acids Res. 2022;50(W1):W159–W164. doi: 10.1093/nar/gkac394.
  30. Duffy JP, et al. The discovery of VX-745: a novel and selective p38α kinase inhibitor. ACS Med Chem Lett. 2011;2(10):758–763.
  31. Sheng Y, et al. Crocin inhibits neutrophil migration and activation to treat hypoxic pulmonary hypertension through targeting HCK. Phytomedicine. 2025;148:157334. doi: 10.1016/j.phymed.2025.157334.
  32. Cui H, et al. Leonurine ameliorates hypoxic pulmonary hypertension by inhibiting cross-talk between neutrophils and endothelial cells via SERPINB3 targeting. Int Immunopharmacol. 2026;176:116467. doi: 10.1016/j.intimp.2026.116467.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

זיהוי סמנים ביולוגייםנתונים טרנסקריפטומייםביטוי דיפרנציאליביטוי משותף של גניםרשת אינטראקציית חלבוניםריצוף RNA של תא בודדהתאמת תרופות מחדשPCR כמותי