$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
استخدمت هذه الدراسة فقط مجموعات بيانات متاحة للجمهور وغير المحددة من قاعدة بيانات التعبير الجيني (GEO). نظرا لأن العمل شمل تحليلا ثانويا للبيانات العامة القائمة ولم يشمل الاتصال المباشر بالمشاركين أو التدخل أو الوصول إلى معلومات شخصية قابلة للتعريف، لم تكن هناك حاجة لموافقة إضافية من لجنة الأخلاقيات أو موافقة مستنيرة.
مصادر البيانات والمعالجة المسبقة
تم الحصول على جميع بيانات التعبير الجيني ومجموعة بيانات الخلية المفردة من قاعدة بيانات GEO24. بالنسبة لاضطراب الاكتئاب الرئيسي، تم استخدام مجموعة بيانات GSE98793، والتي تضم عينات دم محيطية من 128 مريضا و64 ضابطا صحيا. بالنسبة لالتهاب الجلد العضلي، تم اختيار مجموعات البيانات بناء على معايير محددة مسبقا، بما في ذلك تحليل تعبير الإنسان العاقل، ومجموعات الأمراض والسيطرة المعروفة بوضوح، وتوفر التعليقات على المنصات لرسم الخرائط من المجس إلى الجينات، والملاءمة للاكتشاف أو تحليل التحقق. عندما احتوت سلسلة GEO على عدة أنواع فرعية من اعتلال عضلة الالتهاب، تم استخراج فقط من التهاب الجلد العضلي وعينات التحكم الطبيعية في هذه الدراسة. تم استخدام GSE1551 و GSE46239 و GSE128470 كمجموعات بيانات للاكتشاف/التدريب، بينما استخدمت GSE5370 و GSE39454 و GSE11971 كمجموعات بيانات تحقق مستقلة. تم استخراج مجموعات بيانات التهاب العظام الجلدي التي تم تحليلها في هذه الدراسة بشكل رئيسي من العضلات أو أنسجة الجلد المتأثرة وليس من الدم المحيطي. تم الحصول على بيانات خلية واحدة لالتهاب الجلد العضلي من مجموعة البيانات GSE190510.
تم تنزيل مصفوفات التعبيرات الخام من قاعدة بيانات GEO مع ملفات التعليقات التوضيحية الخاصة بالمنصة. تم تعيين معرفات المجسات إلى رموز جينية رسمية وفقا لملاحظة GPL المقدمة من الشركة المصنعة. تمت إزالة المجسات التي لا يمكن ربطها بشكل واضح برمز جيني رسمي واحد. عندما تم تعيين عدة مجسات إلى نفس الجين، تم تدميرها على مستوى الجين باستخدام متوسط قيمة التعبير التي تنفيذها دالة 'الأفيريبس' في حزمة ليما، مما يولد مصفوفة تعبير جين بعينة على حدة.
لتقليل التحيز المعتمد على الشدة وتثبيت التباين، تم تطبيق تحويل log2 عند الاقتضاء وفقا لتوزيع قيم التعبير. ثم تم إجراء تطبيع بين المصفوفة باستخدام دالة 'normalizeBetween Arrays' في حزمة limma. كانت القيم المفقودة، عند وجودها، تحسب باستخدام نسبة K-أقرب جار. بالنسبة لمجموعات بيانات تدريب التهاب الجلد العضلي المتكامل، تم إجراء تصحيح دفعي باستخدام دالة 'ComBat' في حزمة sva، مع معاملة أصل مجموعة البيانات/المنصة كمتغير دفعي ومجموعة عينة (التهاب الجلد العضلي مقابل التحكم الصحي) في مصفوفة التصميم للحفاظ على التفاوت البيولوجي المهم أثناء تعديل الدفعات.
تم إجراء جميع التحليلات بلغة R باستخدام بيئة تطوير متكاملة ل R على نظام تشغيل سطح المكتب. تم استخدام حزمة ليما لتلخيص المجسات وتطبيعها. تم استخدام حزمة SVA لتصحيح دفعات ComBat. تم احتساب القيم المفقودة باستخدام نسبة K-أقرب جار حيث k = 10.
تحليل شبكات التعبير المشترك للجينات المرجحة
تم إجراء تحليل شبكة التعبير المشترك للجينات المرجحة (WGCNA) بشكل منفصل لمجموعات بيانات اضطراب الاكتئاب الرئيسي والتهاب العظام الجلدي باستخدام حزمة WGCNA Rرقم 25,26. تم تجميع العينات هرميا باستخدام flashClust لتحديد القيم الشاذة؛ تم استبعاد العينات التي تتجاوز ارتفاع الشجرات 100 والجينات في أسفل 25٪ من التباين. لكل شبكة، تم اختيار قدرة عتبة ناعمة (β) باستخدام pickSoftThreshold لتحقيق طوبولوجيا تقريبية خالية من المقياس (R2 > 0.8). تم تحويل مصفوفة المجاورة إلى مصفوفة تداخل طوبولوجي (TOM)، وتم تحديد الوحدات عبر قطع الشجرة الديناميكي بحجم وحدة لا يقل عن 60 وارتفاع قطع دمج 0.2527. تم استخدام حزمة WGCNA R مع flashClust للتجميع الهرمي. تم ضبط البذرة العشوائية على 12345 من أجل إمكانية التكرار. تمت ربط جينات الوحدات الذاتية بحالة المرض باستخدام ارتباط بيرسون، مع تعديل قيم P بطريقة بنجاميني-هوشبرغ. لكل مرض، تم الاحتفاظ بالوحدة التي تظهر أقوى وأهم ارتباط بحالة المرض كوحدة رئيسية مرتبطة بالمرض. تم تعريف التداخل بين جينات الوحدة الرئيسية من مجموعة بيانات اضطراب الاكتئاب الرئيسي وتلك الموجودة في مجموعة بيانات التهاب الجلد بالعض كمجموعة الجينات المشتركة المرشحة للتحليلات اللاحقة. تم إجراء تحليل التعبير التفاضلي لمجموعة التهاب الجلد العظام المتكامل بشكل منفصل لتوصيف التغيرات النمطية المرتبطة بالتهاب الجلد العضلي.
تحليل الإثراء الوظيفي
تم إجراء تحليل إثراء جيني (GO) باستخدام R. تم تحويل رموز الجينات إلى معرفات Entrez باستخدام org. تم تحديد Hs.eg.db ومصطلحات GO غنية بشكل كبير (p < 0.05) باستخدام enrichGO في clusterProfiler. لعرض النتائج متعدد الأبعاد، تم إنشاء مخططات شريطية ومخططات فقاعة باستخدام حزمة مخطط الإثراء، بينما تم إنشاء مخطط دائري مع حزمة circlize لعرض فئات GO وعدد الجينات وعوامل الإثراء. تمت إضافة الأساطير مع حزمة خريطة ComplexHeatmap. كما أجري تحليل إثراء مسارات موسوعة كيوتو للجينات والجينومات (KEGG) للجينات المعبر عنها بشكل تفاضلي باستخدام R. تم تحويل رموز الجينات إلى معرفات Entrez بناء على المنظمة. تم تحديد قاعدة البيانات Hs.eg.db والمسارات المثرية بشكل كبير (FDR < 0.05) باستخدام دالة enrichKEGG من حزمة clusterProfiler 28,29,30,31. تم تصور نتائج الإثراء باستخدام مخططات الشريط والفقاعات.
تحليل شبكة الارتباط الوظيفي القائم على GeneMANIA
استنادا إلى الجينات المشتركة التي تم تحديدها سابقا، تم إنشاء شبكة ارتباط وظيفية قائمة على GeneMANIA لاستكشاف سياق التفاعل بين هذه الجينات وشركائها المرتبطين. تم تقديم قائمة الجينات إلى GeneMANIA باستخدام الإنسان العاقل كنوع مرجعي. يدمج جينمانيا أنواع متعددة من الأدلة، بما في ذلك التعبير المشترك، والتفاعلات الفيزيائية، والمسارات، والتموضع المشترك، والتفاعلات الجينية، والمجالات البروتينية المشتركة. تم تصدير الشبكة الناتجة واستيرادها إلى منصة تصور الشبكة للتصوير والتحليل. ثم تم إجراء تحليل طوبولوجي للشبكة في منصة تصور شبكي للتصور والتحليل لتحديد العقد المرشحة عالية الاتصال 32,33,34.
بناء نماذج التشخيص القائمة على التعلم الآلي
تم استخدام عدة خوارزميات تعلم آلي لتصنيف التشخيص، بما في ذلك الغابة العشوائية (RF)، آلة المتجه الداعمة (SVM)، التحليل الخطي المميز (LDA)، نايف بايز، آلة تعزيز التدرج (GBM)، XGBoost، glmBoost، الشبكة المرنة (Enet)، الحاجز، أقل انكماش مطلق وعامل اختيار (LASSO)، النموذج الخطي المعمم خطوة بخطوة (Stepglm)، والنموذج الخطي المعمم للانحدار الجزئي للمربعات الصغرى (plsRglm)35. تم تطبيق إطار نمذجة من مرحلتين لتوليد 113 تركيبة نماذج مرشحة. في المرحلة الأولى، تم استخدام الخوارزمية الأولية لفحص المتغيرات في مجموعة التدريب؛ في المرحلة الثانية، تم استخدام المتغيرات المحتجزة لتناسب نموذج تصنيف تشخيصي. تم استبعاد النماذج التي تحتوي على ≤5 متغيرات مختارة من المقارنة الإضافية. كانت مجموعات بيانات التهاب العظام الجلدي المجمعة بمثابة مجموعة التدريب، مع تسميات تعرف بأنها التهاب العظام الجلدي مقابل الضابطين الأصحاء، بينما تم استخدام مجموعة التحقق المستقلة لتقييم الأداء الخارجي. كانت إعادة الأخذ والضبط الداخلي محددة بالخوارزمية: حيث استخدمت نماذج قائمة على glmnet (LASSO، Ridge، وElastic Net) التحقق المتقاطع بعشرة أطعاف لاختيار lambda.min؛ استخدم GBM التحقق الداخلي المتقاطع بعشرة أضعاف لتحديد العدد الأمثل للأشجار؛ استخدم XGBoost إعادة العينات بخمس مرات لاختيار جولة التعزيز النهائية وفقا لأقل فقدان لوغاريتمي للاختبار؛ استخدم glmBoost التحقق الداخلي المتقاطع القائم على cvrisk لتحديد تكرار التوقف؛ وتم تركيب LDA ضمن إطار التحقق المتقاطع للقياط. بالنسبة للخوارزميات التي لا تحتوي على خطوات ضبط صريحة في التنفيذ الحالي، تم استخدام إعدادات ثابتة أو إعدادات افتراضية للحزمة. لتقليل تسرب المعلومات، تم إجراء اختيار الميزات، وملاءمة النماذج، والضبط الداخلي باستخدام مجموعة التدريب فقط، بينما استخدمت مجموعات التحقق فقط للتنبؤ المستقل وتقييم الأداء القائم على AUC. تم استخدام حزمة caret لإدارة سير عمل التعلم الآلي، مع glmnet و randomForest و e1071 و gbm و xgboost و mboost و plsRglm و MASS للخوارزميات الفردية. تم إجراء تحليل SHAP باستخدام حزمة shapviz. تم ضبط البذرة العشوائية على 12345 قبل كل تركيب نموذج. تم استبعاد النماذج التي تحتوي على أقل من 5 ميزات مختارة. تم تقييم قابلية تفسير النموذج ومساهمته على مستوى الجين بشكل إضافي باستخدام تفسير شابلي الإضافي (SHAP)، وتم إعطاء أولوية للجينات الأكثر إفادة كميزات مرشحة مختارة من قبل النموذج للتفسير البيولوجي لاحقا.
تقييم الأداء التشخيصي
تم توليد منحنيات خصائص تشغيل المستقبل (ROC) باستخدام حزمة "pROC" R لتقييم الأداء التشخيصي للمؤشرات الحيوية المرشحة. تم التحقق من صحة مستويات التعبير ودقة التنبؤ بالمؤشرات المرشحة في مجموعات بيانات مستقلة (GSE5370، GSE11971، GSE39454). تم تقييم أداء النموذج بشكل إضافي باستخدام مصفوفات الالتباس. تم تصور التعبير التفاضلي لجينات الوحدة الرئيسية باستخدام مخططات البراكين والصندوق، وتم بناء منحنيات ROC لتقييم القيمة التشخيصية للجينات الفردية.
تحليل إثراء مجموعات الجينات
لاستكشاف التغيرات الوظيفية المنسقة المرتبطة بإشارات النسخ المشتركة المرشحة، تم إجراء تحليل إثراء مجموعة الجينات (GSEA) باستخدام clusterProfiler36,37. تم تصنيف بيانات التعبير الجيني من التهاب الجلد العظام وعينات التحكم وفقا للتعبير التفريقي. تم استخدام مجموعات جينية محددة مسبقا تتوافق مع مسارات KEGG (c2.cp.kegg.Hs.symbols.gmt) لتقييم ما إذا كانت الجينات داخل كل مسار تظهر اتجاها منسقا من التنظيم صعودا أو هبوطا. تم تعريف الدلالة الإحصائية بأنها P < 0.05.
تحليل تسرب الخلايا المناعية
تم استخدام مصفوفة التهاب الجلد العضلي المصحح، المحولة إلى log2، والمصححة دفعة لإزالة الالتفاف المناعي. تم تطبيق خوارزمية CIBERSORT لتقدير الوفرة النسبية لأنواع الخلايا المناعية باستخدام مصفوفة LM22 المرجعية38. تم الاحتفاظ بالعينات التي تحتوي على فك الالتفاف P < 0.05 للتحليل في المراحل النهائية. تم تصور الفروق في نسب الخلايا المناعية المستنتاج بين المجموعات باستخدام مخططات الصندوق، وأجري تحليل الارتباط من سبيرمان لتقييم الارتباطات بين المجموعات الفرعية من خلايا المناعة والجينات المشتركة المرشحة.
تحليل تسلسل الحمض النووي الريبي أحادي الخلية لوضع السياق الخلوي
تم إجراء تحليلات RNA-seq أحادية الخلية في R باستخدام Seurat. تم استخدام Harmony لتصحيح الدفعات، وDoubletFinder لاكتشاف الدوبلت، وcelda/decontX لتقدير الحمض النووي الريبي المحيط، وMonocle لتحليل المسار الزائف الزمن، وCellChat لتحليل الاتصال الخلوي-الخلوي، وAUCell لتقييم نشاط مجموعات الجينات، وGSVA لتقييم ssGSEA. تم استيراد مصفوفات العد الخام إلى كائنات سورا مع المعلمات min.cells = 5 وmini.features = 300. تم حساب مقاييس مراقبة الجودة، بما في ذلك نسب جينات الميتوكوندريا والريبوسوم والهيموغلوبين، لكل خلية. تم الاحتفاظ بالخلايا فقط إذا استوفت جميع المعايير التالية: nFeature_RNA > 500، nCount_RNA < 5000، percent_mito < 25، percent_ribo > 3، و percent_hb < 1. تم استبعاد الجينات التي تم اكتشافها في أقل من 3 خلايا. بالإضافة إلى ذلك، تمت إزالة جينات MALAT1 والميتوكوندريا قبل التحليل اللاحق. بعد الترشيح الأولي، تم تحديد الدوبلت في كل عينة باستخدام DoubletFinder، حيث كانت PCs = 1:30 و pN = 0.25؛ تم تحديد معدلات الثنائية المتوقعة وفقا لأرقام الخلايا الخاصة بالعينة (<4,000 خلية: 2.5٪؛ 4,000–8,000 خلية: 5٪؛ >8,000 خلية: 6.5٪). تم الاحتفاظ بالأغاني الفردية فقط. تم تقدير تلوث الحمض النووي الريبي المحيط باستخدام decontX، وتم الاحتفاظ بالخلايا التي حصلت على درجات التلوث < 0.2.
تم تطبيع البيانات المصفاة باستخدام طريقة LogNormalize بعامل مقياس 10,000، تلاها تحديد الجينات المتغيرة، وتوسيع البيانات، وتحليل المكونات الرئيسية. تم تصحيح تأثيرات الدفعات عبر العينات باستخدام Harmony مع orig.ident كمتغير دفعي. تم استخدام أول 15 بعدا هارموني لتصوير UMAP وبناء الرسوم البيانية للجيران. تم إجراء التجميع باستخدام FindNeighbors و FindClusters، وتم تعريف نتيجة التجميع النهائية بدقة 0.05. تم تدوين أنواع الخلايا يدويا وفقا لجينات العلامات القانونية مع نتائج FindAllMarkers39.
لتوضيح السياق الوظيفي لاحقا، تم تقييم نشاط الجينات المرشحة على مستوى الخلية الواحدة، وخضعت المجموعة المعنية من الخلايا المناعية لتحليلات المسار والاتصالات بين الخلايا. تم إجراء تحليل الزمن الزائف باستخدام Monocle مع تقليل الأبعاد المعتمد على DDRTree تليها ترتيب الخلايا. تم إجراء تحليل الاتصال الخلوي-الخلوي باستخدام CellChat باستخدام قاعدة بيانات مستقبلات الرابطة البشرية، والتي اقتصرت على فئة الإشارات المفسرة، وتم تصفية الاتصالات التي تحتوي على أقل من 10 خلايا.
لكل خلية، تم قياس نشاط الجين المرشح باستخدام ثلاثة أساليب تكميلية: AUCell، ssGSEA، وAddModuleScore. تم حساب درجات AUCell بناء على مصفوفات تصنيف الجينات، وتم توليد درجات ssGSEA باستخدام إطار GSVA. تم حساب AddModuleScore باستخدام دالة Seurat المدمجة. ثم تم دمج قيم AUCell وssGSEA وAddModuleScore الناتجة في مصفوفة درجات واحدة. تم توحيد كل نوع من الدرجات أولا بواسطة تحويل درجة Z ثم أعيد تحجيمه إلى نطاق 0–1 باستخدام التطبيع الأدنى-القصوى. تم تعريف النتيجة المركبة النهائية ("التقييم") لكل خلية بأنها مجموع الدرجات الثلاث المعادلة:
Scorering = AUCell المعدل + ssGSEA المعدل + AddModuleScore المنور.
في تحليلات المجموعات الفرعية اللاحقة، تم استخراج مجموعة خلايا T من CD8⁺، وتم تقسيم الخلايا وفقا لقيمة التسجيل الوسيطة ضمن هذه المجموعة. تم تعيين الخلايا التي كانت قيم التسجيل فيها أكبر من الوسيط إلى المجموعة High_Hub_genes، بينما تم تعيين الخلايا المتبقية إلى المجموعة Low_Hub_genes.