تمت الموافقة على هذه الدراسة من قبل مجلس المراجعة المؤسسية للمستشفى الأول التابع لجامعة بنغبو الطبية (رقم الموافقة: 2023YJS162). تم الحصول على موافقة مكتوبة ومستنيرة من جميع المشاركين قبل جمع العينات.
جمع البيانات
تم الحصول على بيانات النسخ المستخدمة في هذه الدراسة من قاعدة بيانات التعبير الجيني (GEO) (https://www.ncbi.nlm.nih.gov/؛ RRID: SCR_005012). تم إنشاء مجموعة البيانات التدريبية الأساسية، GSE150910، باستخدام منصة Illumina NovaSeq 6000 (GPL24676) وشملت 103 عينات IPF و103 عينات من أنسجة الرئة الطبيعية. للتحقق من صحة النتائج، تم استخدام مجموعات بيانات مستقلة GSE24206 و GSE110147 و GSE93606 و GSE38958. يتم توفير معلومات مفصلة عن كل مجموعة بيانات في الجدول 1. بالإضافة إلى ذلك، تم اختيار ما مجموعه 636 مجموعة من المجموعات الشاملة من دراسة منشورة سابقا14.
تحليل التعبير التفاضلي وتوصيف الوظيفة لمستويات DEG المرتبطة بالجليكوزيل
تم إجراء تحليل التعبير التفاضلي بين عينات الأنسجة الرئوية الطبيعية وIPF من مجموعة بيانات GSE150910 باستخدام حزمة R DESeq2 (RRID: SCR_015687). الجينات ذات قيمة P المعدلة (padj) < 0.05 و |log2FoldChange| تم اعتبار > 0.5 جينات معبر عنها بشكل تفاضلي (DEGs). تم تحديد DEGs المرتبطة بالجليكوزيل (GR-DEGs) من خلال تقاطع DEGs مع مجموعة محددة مسبقا من 636 GRG. ولدراسة الأدوار البيولوجية لهذه الجينات بشكل أعمق، تم إجراء تحليل إثراء جينات (GO) وتحليل مسار موسوعة كيوتو للجينات والجينوم (KEGG) لتوضيح أدوارها الوظيفية وتورطها في المسارات. تم إنشاء شبكة تفاعل بروتين (PPI) باستخدام قاعدة بيانات STRING (RRID: SCR_005223)15 مع عتبة درجة ثقة التفاعل > 0.7، لتوضيح التفاعلات الجزيئية والآليات التنظيمية المحتملة ل GR-DEGs في IPF.
فحص الجينات الرئيسية وبناء نموذج تشخيصي
لفحص الجينات الرئيسية ل IPF من GR-DEGs، استخدمنا عدة خوارزميات تعلم آلة. في البداية، تم تجهيز انحدار LASSO (RRID: SCR_003418) بانحدار لوجستي ثنائي (العائلة = "ثنائية الحدين") وتم اختيار معامل العقوبة الأمثل λ عبر التحقق المتقاطع بعشرة أضعاف (nfold = 10). كانت نتائج الاختيار النهائية هي الميزات ذات المعاملات غير الصفرية التي تتوافق مع λ_(min) (0.01700442). بالنسبة ل SVM-RFE، تم استخدام وظيفة rfe من حزمة R caret. تم إجراء إزالة الميزات العودية عبر التحقق المتقاطع بعشرة مرات (الطريقة = "cv"، العدد = 10)، مع تصفية تدريجية للميزات من 1 إلى 126، مع دقة لتحديد المجموعة الفرعية المثلى للميزة. في XGBoost، تم تعيين دالة الهدف على الانحدار اللوجستي الثنائي (الهدف = "ثنائي: لوجستي"), مع تعيين مقياس التقييم على لوغاريتيم الفقد (eval_metric = "لوغارتلاس"), وعدد التكرارات (nrounds) على 100، ومعدل التعلم (ETA) على 0.1. تم اختيار أفضل 20 جينا بناء على درجات أهمية ميزاتها (Gain). من خلال تقاطع نتائج هذه الطرق، تم تحديد مجموعة محسنة من الجينات الرئيسية. استنادا إلى هذه المجموعة الجينية، تم بناء نموذج تشخيصي ل XGBoost باستخدام مجموعة بيانات التدريب (GSE150910)، وتم تقييم أدائه التنبؤي باستخدام تحليل خصائص تشغيل المستقبل (ROC) على مجموعات بيانات التحقق الخارجية (GSE110147، GSE24206، GSE93606، و GSE38958). بالإضافة إلى ذلك، تم تطوير صورة نوموغرامية لعرض مساهمة كل جين مختارة في احتمال المرض، وتم تقييم الفائدة السريرية للنموذج من خلال منحنيات المعايرة وتحليل منحنى القرار (DCA).
استكشاف المسارات البيولوجية للجينات الرئيسية
لاستكشاف السياق البيولوجي للجينات الرئيسية التي تم تحديدها بواسطة التعلم الآلي. تم إجراء تحليل إثراء مجموعة الجينات (GSEA)16 بناء على قوائم الجينات من قاعدة بيانات التواقيع الجزيئية (MSigDB) (RRID: SCR_016863)17، وتم فحص المسارات للكشف عن NES > 1. تم تصور المسارات المثرية العليا باستخدام دالة مخطط الإثراء.
استكشاف الفروقات في الوظائف البيولوجية ومشهد المناعة في الأنواع الفرعية ل IPF بناء على درجات الجينات الرئيسية
استنادا إلى ملفات التعبير للجينات الرئيسية المحددة، تم حساب درجات تحليل إثراء مجموعة الجينات ذات العينة الواحدة (ssGSEA) واستخدامها لتقسيم مرضى IPF إلى مجموعات ذات درجات عالية ومنخفضة بناء على الدرجة المتوسطة. تم إجراء تحليل تعبير تفاضلي بين المجموعتين، تلاه تحليل GSEA (RRID: SCR_003199)18 لإجراء تحليلات إثراء مسارات GO (GOBP) وKEGG على DEGs.
تحليل تسلل الخلايا المناعية والفروق الرئيسية في التعبير الجيني
بعد تصنيف المجموعات الفرعية بناء على درجات ssGSEA، تم تقييم فروق التسلل المناعي بين المجموعتين ذات الدرجات العالية والمنخفضة. أولا، حسبنا الوفرة النسبية ل 22 نوعا من الخلايا المناعية في العينات باستخدام خوارزمية CIBERSORT (RRID: SCR_016955)19 بالاقتران مع مصفوفة ميزات LM22. على وجه التحديد، تم استخدام دالة deconv_tme في حزمة R IOBR (المعلمات: الطريقة = "cibersort"، المصفوفات = FALSE، perm = 200) للحسابات، وتم إنشاء مخططات مربعية باستخدام حزمة ggpubr (RRID: SCR_021139) لتقييم الفروق في تسرب الخلايا المناعية بين المجموعتين ذات الدرجات العالية والمنخفضة. بالإضافة إلى ذلك، تم استخدام وظيفة GSVA في حزمة R GSVA (باستخدام طريقة ssGSEA) لحساب درجات الإثراء ل 28 نوعا من الخلايا المناعية. ثم تم تطبيع هذه الدرجات باستخدام مقياس الحد الأدنى (Min-Max) لمطابقتها إلى الفترة [0, 1]، مما سهل المقارنات بين أنواع الخلايا. وأخيرا، أجريت اختبارات ويلكوكسون لجمع الرتبة لمقارنة تعبير الجينات الرئيسية بين العينات الطبيعية ومرضى IPF في مجموعات البيانات GSE150910 و GSE110147، مما وفر تحليلا شاملا لتسلل الخلايا المناعية وفروق التعبير الجيني بين مجموعات IPF.
التحقق من صحة الجينات الرئيسية لدى مرضى IPF باستخدام تحليل RT-qPCR
للتحقق من أهمية الجينات التشخيصية، تم اختيار ستة جينات حصلت على أعلى درجات الأهمية من خوارزمية XGBoost للتحقق من مستوى التعبير لدى مرضى IPF والأشخاص الأصحاء باستخدام PCR الكمي العكسي (RT-qPCR). تم جمع ما مجموعه 20 عينة دم، منها 9 من مرضى التهاب الجلد الداخلي و11 من أشخاص أصحاء، من المستشفى الأول التابع لجامعة بنغبو الطبية. تم استخراج إجمالي الحمض النووي الريبي من عينات الدم، وتم قياس تركيز الحمض النووي الريبي باستخدام قارئ لوحة دقيقة متعددة الوظائف. تم تقييم جودة الحمض النووي الريبي قبل التحليل اللاحق. تمت إزالة الحمض النووي الجيني أثناء النسخ العكسي، وتم سرد تسلسلات البادئية المستخدمة في RT-qPCR في الجدول 2. تم التحقق من خصوصية البادئية من خلال تحليل منحنى الصهر. تم استخدام GAPDH كجين مرجعي داخلي. تم حساب مستويات التعبير الجيني النسبية باستخدام طريقة 2-ΔΔCt . توفر خطوة التحقق هذه دعما تجريبيا أوليا للتعبير التفريقي والأهمية التشخيصية المحتملة للجينات المحددة في IPF.
التحليل الإحصائي
تم تحليل البيانات في R، واستخدم اختبار ويلكوكسون لاكتشاف الفروق بين المجموعتين. تم إجراء تحليل تخصيب GSEA وGO وKEGG باستخدام clusterProfiler في حزمة R (RRID: SCR_016884). وكانت قيمة p < 0.05 تعتبر ذات دلالة كبيرة ما لم يذكر خلاف ذلك.