احتوت مجموعات البيانات العامة من مستودع التعبير الجيني (Gene Expression Omnibus (GEO)) التي تم تحليلها في هذه الدراسة على بيانات ترانسكريبتومية مجهولة الهوية من دراسات نُشرت سابقاً، ولم تتطلب موافقة أخلاقية إضافية. وقد وافقت لجنة الأخلاقيات بجامعة Huaihua على دراسة التحقق المستقلة باستخدام تفاعل البوليميراز المتسلسل الكمي باستخدام النسخ العكسي (qRT-PCR) على أنسجة الرئة البشرية (رقم الموافقة 2024(A05112)). كما تم الحصول على موافقة كتابية مستنيرة من جميع المشاركين أو ممثليهم المفوضين قانوناً قبل جمع العينات. وقد طُبقت إجراءات الموافقة والرضا على جميع عينات أنسجة الرئة البالغ عددها 20 عينة لمرض ارتفاع ضغط الدم الشرياني الرئوي (PAH) و20 عينة ضابطة شملها التحقق بواسطة qRT-PCR. تدرج أدوات البحث المستخدمة في هذا البروتوكول في الـ جدول المواد.
1. جمع ومعالجة مجموعات البيانات النسخية العامة مسبقاً
تم الحصول على مجموعات بيانات المصفوفات الدقيقة GSE22356 وGSE33463 وGSE48149 المتعلقة بفرط ضغط الدم الرئوي (PH) من قاعدة بيانات GEO. واستُخلصت عينات فرط ضغط الدم الرئوي/فرط ضغط الدم الشرياني الرئوي (PAH) وعينات الضبط وفقاً لتوصيفات النمط الظاهري الأصلية. كما تم تنزيل مصفوفات التعبير وملفات توصيف المنصة باستخدام برمجيات R القابلة للتكرار وحزمة GEOquery.
تم إجراء تعليق المسبارات ومطابقة رموز الجينات بشكل متسق عبر مجموعات البيانات. وعندما تطابقت مسبارات متعددة مع الجين نفسه، تم حساب قيمة التعبير المتوسطة. كما طُبقت عملية تسوية المئينات (Quantile normalization)، وتمت إزالة الجينات ذات التعبير المنخفض أو التباين المنخفض. ثم دُمجت مجموعات البيانات، وصُححت تأثيرات الدفعات (batch effects) باستخدام خوارزمية ComBat في حزمة sva8. وتم تقييم التصحيح باستخدام المخططات الصندوقية وتحليل المكونات الرئيسية.
2. تحديد الجينات ذات التعبير المتباين
استُخدمت حزمة limma لمقارنة مستويات التعبير بين عينات PH والعينات الضابطة في مصفوفة التعبير المصححة من تأثيرات الدفعات.9تم تطبيق نموذج خطي، واستُخدمت إحصائيات بايز التجريبية. وقد حُددت الجينات ذات التعبير المتباين باستخدام قيمة معدلة P قيمة <0.05 وتغير طي لوغاريتمي مطلق (log2 fold change) > 0.585. تم تصور النتائج باستخدام مخططات البركان والخرائط الحرارية.
3. بناء شبكة التعبير الجيني المشترك الموزونة
تم بناء شبكة التعبير الجيني المشترك المرجحة باستخدام حزمة WGCNA10. أُجري تجميع للعينات للكشف عن القيم المتطرفة. تم اختيار قوة العتبة اللينة بناءً على مؤشر ملاءمة الطوبولوجيا الخالية من المقياس. حُددت الوحدات الجينية باستخدام خوارزمية قطع الشجرة الديناميكية. تم ربط الجينات الذاتية للوحدات بالنمط الظاهري لـ PH، واختيرت الوحدة المرتبطة بالمرض والتي أظهرت أقوى ارتباط. ثم تم تقاطع الجينات الموجودة في الوحدة الرئيسية مع الجينات ذات التعبير المتباين للحصول على الجينات المتفق عليها.
4. تحليل الإثراء الوظيفي
تم تحليل فئات العملية البيولوجية والمكون الخلوي والوظيفة الجزيئية في وجود Gene Ontology باستخدام clusterProfiler11. كما أُجري تحليل إثراء المسارات باستخدام Kyoto Encyclopedia of Genes and Genomes لتحديد مسارات الإشارات12. استُخدمت قيمة P < 0.05 وقيمة q < 0.2 كحدود للإثراء، وتم تمثيل المصطلحات المثرية بصرياً باستخدام مخططات الفقاعات11.
5. بناء شبكة تفاعلات البروتين-البروتين وتحديد الجينات المركزية
تم تقديم قائمة الجينات المتفق عليها إلى قاعدة بيانات STRING، مع اختيار Homo sapiens كنوع، وعتبة ثقة للتفاعل > 0.413. تم استيراد ملف التفاعل إلى برنامج Cytoscape، واستُخدمت إضافة CytoHubba لترتيب الجينات حسب درجة العقدة. وقد عُرِفت الجينات عالية الاتصال بأنها جينات مركزية (hub genes).
6. اختيار الجينات ذات السمات التشخيصية باستخدام التعلم الآلي
تم تطبيق ثلاث خوارزميات مستقلة لاختيار الميزات. أولاً، أُجري تحليل الانحدار اللوجستي باستخدام مشغل تقليص واختيار الحد الأدنى (lasso) عبر حزمة glmnet والتحقق المتقاطع بمقدار 10 طيات لتحديد الجينات ذات المعاملات غير الصفرية14. ثانياً، طُبق نظام إزالة الميزات المتكرر باستخدام آلات المتجهات الداعمة لإزالة الميزات الزائدة واختيار مجموعة الميزات الفرعية التي حققت أعلى دقة في التحقق المتقاطع15. ثالثاً، تم بناء نموذج الغابة العشوائية، وصُنفت الميزات وفقاً لمتوسط الانخفاض في شوائب جيني (Gini impurity)16. واستُخدم تقاطع مجموعات الجينات المستمدة من الخوارزميات الثلاث لتحديد المجموعة النهائية من جينات الميزات الأساسية. كما استُخدمت حزمة pROC لإنشاء منحنيات خصائص التشغيل للمستقبل وحساب قيم المساحة تحت المنحنى17.
7. التحقق من صحة الجينات الجوهرية باستخدام مجموعات بيانات مستقلة للكتلة والخلية الواحدة
استُخدمت مجموعة GSE117261 كجموعة تحقق خارجية مستقلة لأنسجة الرئة، وهي تحتوي على 58 عينة من PAH و25 عينة ضابطة من متبرعين فاشلين18. ولم تُستخدم مجموعة البيانات هذه في تحليل التعبير التفاضلي للاكتشاف، أو بناء شبكة التعبير الجيني المرجحة المشتركة، أو اختيار الميزات باستخدام تعلم الآلة. تم تطبيع مصفوفة التعبير وتزويدها بالتعليقات التوضيحية، وحُلل التعبير التفاضلي باستخدام limma v3.68.0. كما طُبق تصحيح معدل الاكتشاف الكاذب بطريقة Benjamini-Hochberg على كامل النسخ الجيني الموضح بالتعليقات التوضيحية. وحُسبت منحنيات خصائص تشغيل المستقبل (ROC) للجينات المفردة باستخدام pROC v1.19.0.1، وفواصل ثقة DeLong بنسبة 95%، ونقاط القطع بناءً على مؤشر Youden. كما تم تطبيق نموذج انحدار لوجستي استكشافي مكون من خمسة جينات ضمن GSE117261، وجرى تقييم أدائه الداخلي إضافياً باستخدام التحقق المتقاطع المتداخل والمتكرر.
استُخدمت مجموعة بيانات GSE210248 (الجدول 1>) كمجموعة بيانات تحقق من الخلايا المفردة في الشريان الرئوي، والتي تحتوي على عينات من ثلاثة مرضى مصابين بـ PAH وثلاثة متبرعين أصحاء19. تمت معالجة البيانات باستخدام Seurat v5.5.1 لغرض مراقبة الجودة، والتطبيع (normalization)، وخفض الأبعاد، والتجميع (clustering)، وتصنيف الخلايا20. تم تحديد المجموعات الخلوية الرئيسية، بما في ذلك الخلايا البطانية، وخلايا العضلات الملساء، والأرومات الليفية، والخلايا الوحيدة/البلعمية، وخلايا T/الخلايا القاتلة الطبيعية. حُلل التواصل بين الخلايا باستخدام CellChat v2.1.2 وقاعدة بيانات الربيطة والمستقبل CellChatDB.human21. أُنشئ كائن CellChat من مصفوفة تعبير Seurat المُنظّمة والبيانات الوصفية لأنواع الخلايا. تم تحديد الجينات المفرطة التعبير وتفاعلات الربيطة والمستقبل؛ وحُسبت احتمالات التواصل؛ وأُزيلت التفاعلات التي تشمل مجموعات خلوية تحتوي على أقل من 10 خلايا؛ ثم استُنتجت شبكات التواصل على مستوى المسار وجُمِعت. استُخدمت مجموعة البيانات هذه فقط للتحقق الميكانيكي الخارجي وليس لتدريب النموذج.
| عنصر | الوصف |
| مجموعة البيانات | GSE210248 |
| نوع البيانات | تسلسل الحمض النووي الريبوزي أحادي الخلية القائم على القطيرات من 10x Genomics؛ التنميط النسخي عالي الإنتاجية |
| عينات بشرية | ثلاث عينات من الشريان الرئوي لمرضى ارتفاع الضغط الشرياني الرئوي (PAH) وثلاث عينات من الشريان الرئوي لمتبرعين أصحاء |
| مصدر النسيج | أنسجة الشريان الرئوي خارج الجسم، والتي تعكس بشكل أساسي البيئة الخلوية لجدار الأوعية الرئوية وعملية إعادة تشكيل الأوعية الدموية |
| الغرض التحليلي الرئيسي | تحديد التموضع حسب نوع الخلية، والتحول المظهري لخلايا العضلات الملساء، والتواصل بين الخلايا المناعية والخلايا التركيبية، والتحقق من الاتساق الآلي للجينات المرشحة |
الجدول 1: معلومات أساسية لمجموعة بيانات التحقق من الخلية الواحدة GSE210248. يلخص الجدول رقم الوصول إلى مجموعة البيانات، ومنصة التسلسل، ومصدر النسيج، وتكوين العينة، والغرض التحليلي لتحليل التحقق من الشريان الرئوي في الخلية الواحدة.
8. التحقق من التعبير الجيني بواسطة qRT-PCR
تضمن التحقق باستخدام qRT-PCR عدد 20 عينة نسيج رئوي مستقلة بيولوجياً مصابة بـ PAH من مرضى يعانون من PH/PAH، و20 عينة نسيج رئوي ضابطة مستقلة بيولوجياً. تم استخلاص RNA الكلي باستخدام Total RNA Extraction Kit. وقُيم تركيز RNA ونقاوته باستخدام مقياس الطيف الضوئي (spectrophotometer)، كما تم تقييم سلامة RNA عن طريق الفصل الكهربائي لهلام الأغاروز. وتم تضمين عينات RNA التي تتراوح قيم A260/280 الخاصة بها بين 1.8 و2.1 والتي لم تظهر بها علامات تحلل مرئية فقط.
تم نسخ كميات متساوية من RNA عكسياً إلى DNA مكمل باستخدام Solarbio Universal RT-PCR Kit (AMV; رقم الكتالوج RP1200). أُجري تفاعل البوليميراز المتسلسل الكمي (qPCR) لكل من CXCL10 وJUN وIFIH1 وMX1 وTLR7 باستخدام SYBR Green PCR Master Mix على نظام Real-Time PCR. تم تحليل كل عينة بيولوجية في ثلاث مكررات تقنية، جنباً إلى جنب مع ضوابط خالية من القالب وضوابط خالية من النسخ العكسي. استُخدم متوسط قيمة Ct للمكررات التقنية الثلاثة في التحليلات اللاحقة؛ ولم تُعامل المكررات التقنية كملاحظات مستقلة. استُخدمت بادئات تغطي الوصلات بين الإكسونات وتنتج قطع تضخيم تتراوح ما بين 80-200 bp (الجدول 2). تم التحقق من نوعية البادئات باستخدام NCBI Primer-BLAST وتحليل منحنى الانصهار22.
استُخدم جين β-actin (ACTB) كجين مرجعي داخلي لمعايرة مستويات تعبير الجينات المستهدفة. وحُسب التعبير النسبي باستخدام طريقة 2-ΔΔCt23. كما استُخدمت اختبارات Mann-Whitney U ثنائية الجانب لإجراء المقارنات بين المجموعات بناءً على توزيع البيانات، وطُبق تصحيح معدل الاكتشاف الخاطئ لـ Benjamini-Hochberg على الجينات الخمسة. وأُنشئت منحنيات ROC للجينات المنفردة مع فواصل ثقة DeLong بنسبة 95%، واختيرت نقاط القطع المثلى باستخدام مؤشر Youden. تم في البداية ضبط نموذج الانحدار اللوجستي المكون من خمسة جينات وتقييمه على نفس العينات البيولوجية البالغ عددها 40 عينة؛ وبناءً عليه، عُرِّف هذا التقدير على أنه الأداء الظاهري داخل العينة. ولتقييم احتمالية وجود فرط توافق، أُجريت 100 تكرار للتحقق المتقاطع خماسي الطيات الطبقي باستخدام نموذج انحدار لوجستي منتظم من نوع L2، ثم حُسب أداء ROC المجمع خارج الطيات.
| جين | رقم وصول RefSeq | البادئ الأمامي (5'′–3′) | بادئ عكسي (5′–3′) | حجم الناتج (زوج قاعدي) | درجة حرارة الانصهار (Tm)°C) | ممتد عبر الإكسونات |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | نعم |
| يون | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | نعم |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | نعم |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | نعم |
| مستقبل TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | نعم |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | نعم |
الجدول 2: تسلسلات البادئات المستخدمة في تفاعل البوليميراز المتسلسل النسخي العكسي الكمي. يدرج الجدول الجينات المستهدفة، وأرقام تتبع RefSeq، وتسلسلات البادئات الأمامية والعكسية، وأحجام النواتج، ودرجات حرارة الانصهار، وحالة تغطية الإكسونات للبادئات المستخدمة في qRT-PCR.
9. فحص المركبات المرشحة والرسو الجزيئي
تم إرسال تواقيع الجينات الأساسية المرتفعة والمنخفضة التعبير إلى قاعدة بيانات Connectivity Map لتحديد الجزيئات الصغيرة المتوقع أن تعكس ملف التعبير الجيني المرتبط بفرط ضغط الدم الرئوي (PH)7. وقد تم ترتيب المرشحين وفقاً لدرجة Logit واحتمالية التنبؤ.
تم الحصول على البنية ثلاثية الأبعاد لـ BRD-K91900765/VX-745 من PubChem تحت معرف CID 303852524. وقد تم جمع المعلومات الصيدلانية المتعلقة بالمركب من قواعد بيانات الأدوية العامة، وحُسبت الواصفات البنيوية باستخدام DrugBank وSwissADME25,26. كما تم الحصول على بنيات البروتين من RCSB Protein Data Bank باستخدام معرفات PDB التالية: CXCL10، 1LV9؛ وJUN، 1JUN؛ وIFIH1، 3B6E؛ وMX1، 5GTM؛ وTLR7، 7CYN؛ وMAPK14/p38α، 1OUK27. أُجري الكشف عن التجويفات العمياء والرسو الجزيئي باستخدام CB-Dock2 v2.0 مع محرك تسجيل النقاط AutoDock Vina v1.2.028,29. رُفعت ملفات البروتين والرابط إلى CB-Dock2، وكُشفت التجويفات المرشحة تلقائياً، وأُجري الرسو ضمن الصناديق المحددة للتجويفات والتي أنشأها الخادم. وبالنسبة لكل بروتين، تم تسجيل معرف التجويف، ودرجة Vina، وحجم التجويف، ومركز صندوق الرسو، وأبعاد صندوق الرسو، وملف معقد البروتين-الرابط. تم اختيار الوضعية ذات درجة Vina الأكثر سلبية كأفضل تشكيل متوقع. أُدرج MAPK14/p38α كهدف صيدلاني معروف وبروتين رسو مرجعي إيجابي لـ VX-745. أما الرسو ضد CXCL10 وJUN وIFIH1 وMX1 وTLR7 فكان استكشافياً ولم يتم تفسيره كدليل على استهداف صيدلاني مباشر أو ارتباط أو تثبيط أو فعالية.
10. التحليل الإحصائي والتحكم في قابلية التكرار
أُجريت جميع التحليلات الإحصائية باستخدام برنامج R ما لم يُذكر خلاف ذلك. واعتُبرت قيم P ثنائية الطرف التي كانت < 0.05 دالة إحصائياً. كما طُبق تصحيح الاختبارات المتعددة على تحليلات التعبير التفاضلي، والإثراء، والتحقق الخارجي، وتحليلات qRT-PCR كما هو محدد أعلاه. واستُخدم التحقق المتقاطع لتقييم استقرار نماذج التعلم الآلي ونماذج qRT-PCR المدمجة.