وفقا لإجراءات المراجعة الأخلاقية لأبحاث علوم الحياة والطبية التي تشمل البشر التي صدرت في الصين في 18 فبراير 2023، قد تستوفي الأبحاث التي تستخدم بيانات متاحة للجمهور معايير الإعفاء من المراجعة الأخلاقية. استخدمت هذه الدراسة فقط بيانات النسخ الثانوية المتاحة للجمهور ولم تشمل تجنيد المشاركين الجدد من البشر، أو جمع عينات بشرية، أو تجارب حيوانية. لذلك، لم تكن هناك حاجة إلى موافقة أخلاقية مؤسسية إضافية. لم تجر أي تجارب على الحيوانات في هذه الدراسة. لذلك، لم يكن من الممكن تطبيق موافقة لجنة رعاية واستخدام الحيوانات المؤسسية.
مصادر البيانات لجينات الإجهاد الشبكي الإندوبلازمي في الرجفان الأذيني
في هذه الدراسة، تم استرجاع مجموعات بيانات النسخ المكتوبة المتعلقة بالرجفان الأذيني المتاحة للجمهور من قاعدة بيانات GEO، بما في ذلك GSE41177 و GSE79768 و GSE115574 و GSE14975 و GSE165838. المعلومات التفصيلية حول مجموعات بيانات GSE متوفرة في الملف التكميلي 1—الجدول التكميلي S1. تم استخدام GSE41177 و GSE79768 لبناء مجموعة التدريب الجماعي المتكاملة للنسخ، بينما تم استخدام GSE115574 و GSE14975 كمجموعتين مستقلتين للتحقق الخارجي. تم استخدام GSE165838 لتحليل النسخ الأحادي الخلية. نظرا لأن هذه المجموعات تم إنشاؤها على منصات مختلفة وقد تختلف في مصدر الأنسجة، والخلفية السريرية، وتركيب العينة، فقد تمت معالجة كل مجموعة بيانات بشكل منفصل وفقا لخصائص منصتها قبل الدمج أو التحقق. ثم تم إجراء تصحيح تأثير الدفعات باستخدام حزمة sva R لمجموعة التدريب المدمجة. تم استرجاع مجموعة الجينات المرتبطة بالإجهاد في الشبكة الإندوبلازمية من قاعدة بيانات GeneCards بدرجة ملاءمة ≥ 3، وبعد إزالة التكرار، شكلت قائمة الجينات المستهدفة المستخدمة في هذه الدراسة.
تحليل الجينات المعبر عنها بشكل مختلف
بعد توحيد البيانات وتطبيعها، تم استخدام حزمة R limma لتحديد الجينات المعبر عنها بشكل تفاضلي (DEGs) في مجموعة التدريب المتكاملة. تم تعريف DEGs باستخدام معايير الأهمية التالية: قيمة P المعدلة بمعدل الاكتشاف الكاذب (الوصف. P.Val) < 0.05 و |log2FC| > 0.58510. لتصور أنماط التعبير في DEGs، تم إنشاء مخططات براكين وخرائط حرارية باستخدام حزم ggplot2 و pheatmap على التوالي.
تحليل WGCNA
لتوضيح الآليات المحتملة لتنظيم الجينات المنسق، وتحديد أنماط الارتباط بين وحدات التعبير المشترك ومتغيرات السمات السريرية، وتحديد العلامات الحيوية الأساسية أو الأهداف العلاجية ذات الإمكانيات الانتقالية، تم تطبيق WGCNA11.
تم بناء شبكة تعبير مشترك موزونة باستخدام حزمة WGCNA في R. تم اختيار قدرة العتبة اللينة (β) وفقا لمعيار الطوبولوجيا الخالية من المقياس؛ تم اختيار قيمة β المقابلة للتحليلات اللاحقة عندما وصل مؤشر ملاءمة الطوبولوجيا الخالي من المقياس (R2) وبقي فوق 0.8512. أثناء تحديد الوحدات، تم تحسين المعايير المتعلقة بقطع الأشجار الديناميكي وحساسية اكتشاف الوحدة لتحسين دقة حدود الوحدة واستقرارها. وأخيرا، تم استخراج وحدات مرتبطة بشكل كبير بالصفة المستهدفة، وتم تحديد جينات مركز داخل الوحدات كمجموعات جينية مرشحة للتحليلات اللاحقة.
تحليل الإثراء لمستويات الرجفان الرجفية المرتبطة بالرجفان الأكسي
لتحديد جينات المركز بدقة، تم أولا تقاطع الجينات المبكرة مع جينات من وحدات WGCNA الرئيسية لتعريف مجموعة من الجينات المتورطة في تكوين مرض الأفين الأذيني. بعد ذلك، تم تداخل مجموعة جينات الأذينية هذه مع جينات مرتبطة ب ERS، وتم الاحتفاظ بالجينات المتداخلة الناتجة للتحليلات اللاحقة.
تم تقييم الإثراء الوظيفي للجينات التي تم فحصها باستخدام تحليلات علم الجينات (GO) وموسوعة كيوتو للجينات والجينومات (KEGG). تم تحليل مصطلحات GO باستخدام clusterProfiler حزمة R لتلخيص الإثراء عبر الفئات13 من العملية البيولوجية (BP)، والمكون الخلوي (CC)، والوظيفة الجزيئية (MF). ثم تم استخدام تحليل KEGG لتحديد المسارات الغنية المرتبطة بالجيناتالمستهدفة 14. تم اعتبار نتائج الإثراء ذات القيمة P المعدلة < 0.05 ذات دلالة إحصائية. تم عرض مصطلحات GO الرئيسية ومسارات KEGG كمخططات شريطية ومخططات فقاعة باستخدام ggplot2.
تحليل تفاعل البروتين والبروتين (PPI)
تم إجراء تحليل PPI عن طريق رفع مجموعة الجينات المتقاطعة إلى قاعدة بيانات STRING، مع تقييد الكائن الحي على الإنسان العاقل. تمت إزالة العقد المنفصلة، وتم استرجاع التفاعلات باستخدام عتبة درجة ثقة متوسطة (الدرجة المجمعة ≥ 0.4). ثم تم استيراد شبكة PPI الناتجة إلى أداة تصور وتحليل شبكة للتحليل الطوبولوجي لتحديد العقد الرئيسية.
بناء نموذج تصنيف مرشح ل AF-ERS يعتمد على 12 خوارزمية تعلم آلي
في هذه الدراسة، تم تطوير إطار تصنيف جماعي يعتمد على اثني عشر خوارزمية تقليدية للتعلم الآلي لفحص جينات توقيع المرشحين المرتبطة ب ERS المرتبطة بالرجفان الأذيني وتحسين أداء التصنيف. لتقسيم البيانات، بعد التوحيد والتطبيع، تم دمج GSE41177 و GSE79768 لتوليد مصفوفة تعبيرات مجموعة التدريب. تم استخدام GSE115574 كمجموعة تحقق خارجية مستقلة لتقييم قابلية تعميم النموذج. تحديدا، تم تحديد DEGs لأول مرة في مجموعة التدريب (|log2FC| >0.585، معدل p < 0.05). ثم تم تقاطع هذه الجينات مع جينات من وحدات WGCNA الرئيسية والجينات المرتبطة ب ERS، وتم استخدام مجموعة الجينات الناتجة كميزات إدخال لبناء النماذج.
لربط الجينات المرتبطة ب ERS مع النمط الظاهري للرجوفان الرجفية، تم تطوير نموذج تصنيف مرشح باستخدام 12 نهجا لتعلم الآلة: لاسو، ريدج، نموذج خطي معمم تدريجيا (Stepglm)، تعزيز التدرج القصوى (XGBoost)، الغابة العشوائية (RF)، الشبكة المرنة (Enet)، الانحدار الجزئي لأصغر مربعات النماذج الخطية المعممة (plsRglm)، نمذجة الانحدار المعممة المعممة (GBM)، نمذجة بايز الساذجة، التحليل الخطي المميز (LDA)، glmBoost، وآلة الدعم المتجهة (SVM). تم اعتماد استراتيجية نمذجة توافقية منهجية بإضافة خوارزمية ثانية إلى الأولى وتكاملها عبر α معامل الضبط، مما أدى إلى 113 تركيبة من اختيار الميزات وملاءمة النموذج تم تقييمها بشكل شامل. تم تقييم التمييز النموذجي من خلال حساب المساحة تحت منحنى خصائص تشغيل المستقبل (AUC). وفقا لمعايير اختيار النماذج التي تم الإبلاغ عنها سابقا، تم تعريف إطار المرشح النهائي بأنه النموذج الذي يحقق أفضل أداء إجمالي، كما تم تقييمه بواسطة متوسط AUC عبر مجموعات التدريب والتحقق.
استندت هذه الاستراتيجية للنمذجة التوافقية إلى دراسات سابقة في التعلم الآلي الطبيالحيوي 15,16,17. تشير هذه الدراسات مجتمعة إلى أنه لا توجد خوارزمية واحدة تتفوق باستمرار على غيرها عبر مجموعات البيانات والمهام التحليلية. استنادا إلى هذا الفرضية، يمكن أن يزيد اعتماد إطار التعلم الجماعي والنمذجة التوافقية من احتمالية الحصول على نموذج مرشح عالي الأداء مع قابلية تعميم أكثر استقرارا ويحسن من متانة اختيار النماذج.
لاحقا، تم تطبيق قيم التفسيرات الإضافية لشابلي (SHAP) لتفسير نموذج التعلم الآلي من خلال تصور الميزات الرئيسية التي تدفع تصنيف الذكاء الاصطناعي، وبالتالي قياس مساهمة كل ميزة في النتيجة المتوقعة وتوضيح كيف تؤثر جينات التوقيع الفردية على الناتج النهائيللنموذج 18.
تقييم أداء النموذج والتحقق الخارجي للنموذج الأمثل
تم تقييم أداء النموذج الأمثل في مجموعة التدريب وفي مجموعة التحقق الخارجية المستقلة (GSE115574). على مستوى النموذج، تم إنشاء مصفوفة لبس بناء على تسميات الفئات المتوقعة، وتم الإبلاغ عن مقاييس التصنيف المقابلة. تم توليد منحنيات خصائص تشغيل المستقبل (ROC) باستخدام حزمة R pROC، وتم حساب AUC لقياس الأداء التمييزي.
على مستوى المؤشرات الحيوية، تم رسم منحنيات ROC لجين واحد لكل جين رئيسي في النموذج الأمثل، وتم حساب منحنيات AUCs المقابلة لتقييم قدرتها التمييزية الفردية. بالإضافة إلى ذلك، تم تلخيص التعبير التفاضلي للجينات الرئيسية باستخدام مخطط البركان، واستخدمت مخططات الصندوق لعرض توزيعات تعبيرها في العينات المرضية مقابل السليمة. ولتقييم قابلية تعميم توقيع الجين المشتق من النموذج الأمثل معرف سابقا، تم إجراء تحقق خارجي مستقل إضافي باستخدام GSE14975. يحتوي GSE14975 على بيانات النسخ من عينات من زائدة الأذين الأيسر، بما في ذلك خمس عينات من الرجفان الأذيني وخمس عينات من إيقاع الجيوب الأنفية/التحكم. جميع الجينات المدرجة في التوقيع المغلق كانت متاحة في هذه المجموعة. للحفاظ على الاتساق مع سير العمل التحليلي الأصلي بين الفئات، تم توحيد مجموعة التطوير و GSE14975 باستخدام ComBat مع مصدر مجموعة البيانات كمتغير دفعي. تم تنفيذ هذا التنسيق بطريقة غير مراقبة. ومن المهم أن تسميات المرض/السيطرة من GSE14975 لم تستخدم لاختيار الميزات، أو تقدير معاملات، أو تحديد العتبة، أو ضبط المعاملات الفائقة.
تم تعديل نموذج التقييم الأمثل المستخرج من النموذج باستخدام مجموعة التطوير فقط ثم تطبيق على GSE14975 للتحقق الخارجي. تم تقييم أداء النموذج في GSE14975 باستخدام تحليل منحنى خصائص التشغيل المستقبل، والمساحة تحت المنحنى، وفترة الثقة 95٪، والحساسية، والنوعية، والدقة، والقيم التنبؤية الموجبة والسالبة، ودرجة برير. بالإضافة إلى ذلك، تم توليد منحنيات ROC لجين واحد لجميع الجينات المشتقة من النموذج الأمثل في GSE14975 لتوضيح قدرتها الفردية على التمييز المختلفة. لتقييم الإمكانية الفائضة في مجموعة التطور، تم إجراء التحقق المتقاطع المتكرر بعشرة مرات وتصحيح تفاؤل التمهيد باستخدام التوقيع الجيني المستخرج من النموذج الأمثل المغلق. للتحقق المتقاطع المتكرر، تم تقسيم مجموعة التطوير مرارا إلى 10 أضعاف، وتم تلخيص التمييز بين النماذج عبر جميع التكرارات. لتحقق التمهيد، تم توليد 1000 عينة إعادة تمهيد لتقدير التفاؤل في أداء مجموعة التطوير الظاهرة ولحساب AUC المصحح بالتفاؤل. نظرا لأن التوقيع النهائي اشتقاق من النموذج الأمثل، فقد تم تفسير مساهمة كل جين بشكل أساسي وفقا للحجم المطلق واتجاه معاملات النموذج. بالإضافة إلى ذلك، أجريت تحليلات ROC على جين واحد في GSE14975 لتوضيح القدرة التمييزية الفردية لكل جين مكون. لأغراض التصور، تم توجيه منحنيات ROC لجين واحد لتعكس القدرة التمييزية بغض النظر عما إذا كان التعبير الأعلى أو الأقل مرتبطا بالرجفان الأفني.
تحليل إثراء مجموعات الجينات (GSEA)
لاستكشاف الآثار الوظيفية للجينات الرئيسية، تم إجراء اختبار GSEA باستخدام عينات من مجموعة المرض19. لكل جين رئيسي، تم تصنيف العينات إلى مجموعات فرعية عالية ومنخفضة التعبير باستخدام قيمة التعبير الوسيطة في مجموعة المرض كنقطة فاصل. تم حساب متوسط فرق التعبير بين المجموعتين الفرعيتين لكل جين، وتم إنشاء قائمة جينات مرتبة بترتيب تنازلي كمدخل لتحليل الإثراء. تم إجراء GSEA باستخدام clusterProfiler من حزم R، مع مجموعات جينات تم الحصول عليها من مجموعة MSigDB c2.cp.kegg.Hs.symbols.gmt. تم تعريف الدلالة الإحصائية بأنها p < 0.05. تم تحديد اتجاه الإثراء بواسطة علامة درجة الإثراء المطبعة (NES)، وتم إنشاء مخططات إثراء للمسارات التمثيلية.
تقييم وفرة النوع الفرعي للخلايا المناعية والتعبير التفريقي
تم تطبيق خوارزمية فك الالالتفاف CIBERSORT لتقدير الوفرة النسبية للمجموعات الفرعية المتسللة من خلايا المناعة وعلاقاتها المتبادلة عبر العينات. استنادا إلى مصفوفة توقيع كريات الدم البيضاء LM22، تم استنتاج تركيب الخلايا المناعية كميا من ملفات تعريف التعبير الجيني باستخدام حزمة R CIBERSORT20. تم استخدام عتبة p < 0.05 لتصفية النتائج، ولم تحتفظ إلا بالعينات التي اجتازت هذا المعيار للتحليلات اللاحقة. تم إنشاء مخططات مربعية لمقارنة النسب النسبية المقدرة لمجموعات الخلايا المناعية بين مجموعتي الرجفان الأذيني والضابطة. بالإضافة إلى ذلك، أجري تحليل الارتباط الذي أجرته سبيرمان لتقييم الروابط بين مستويات تسرب الخلايا المناعية وتعبير جينات المحور.
تحليل الخلية الأحادية
تم إجراء تحليل النسخ النصي لخلية واحدة باستخدام مجموعة بيانات GEO GSE165838. تم استيراد مصفوفات عد الخلايا الجينية الخام إلى R ومعالجتها باستخدام Seurat v4.4.0. لكل عينة، تم توليد كائن Seurat باستخدام CreateSeuratObject مع min.cells = 5 وmin.features = 300. تم حساب مقاييس مراقبة الجودة، بما في ذلك عدد الجينات المكتشفة، وإجمالي عدد المعرفات الجزيئية الفريدة (UMI)، ونسبة جينات الميتوكوندريا، ونسبة جينات الريبوسوم، ونسبة جين الهيموغلوبين، لكل خلية. تم الاحتفاظ بالخلايا إذا كان لديها أكثر من 500 جين مكتشف، وأقل من 5000 عدد من الكثافة العضلية الموحدة، ونسبة جينات الميتوكوندريا < 25٪، ونسبة جينات الريبوسوم > 3٪، ونسبة جينات الهيموغلوبين < 1٪. تمت إزالة الجينات التي تم اكتشافها في أقل من ثلاث خلايا. كما تم استبعاد جينات MALAT1 والميتوكوندريا قبل التحليل اللاحق. تم استخدام DoubletFinder لاكتشاف واستبعاد الدوبلتات المحتملة. باختصار، تم تقسيم الخلايا حسب هوية العينة، وتم إجراء اكتشاف المزدوج بشكل منفصل لكل عينة باستخدام المكونات الرئيسية من 1 إلى 30.
تم تعيين معامل pN على 0.25، وتم اختيار القيمة المثلى pK وفقا لمقياس BC الأقصى الذي تم الحصول عليه من مسح المعلمات. تم تقدير معدل الدوبليت المتوقع بناء على عدد الخلايا المستردة في كل عينة، مع استخدام معدلات 2.5٪، 5٪، و6.5٪ للعينات ذات أعداد الخلايا المنخفضة والمتوسطة والعالية على التوالي. تم الاحتفاظ فقط بالخلايا المصنفة كخلايا منفردة. تم تقدير تلوث الحمض النووي الريبي المحيط باستخدام DecontX، وتم استبعاد الخلايا ذات درجة التلوث ≥ 0.2. بعد مراقبة الجودة، وإزالة الدوبلت، وترشيح الحمض النووي الريبي المحيط، تم الاحتفاظ ب 40,886 خلية و23,947 جينا للتحليل اللاحق. تم تطبيع مجموعة بيانات الخلية المفردة المصفاة باستخدام طريقة LogNormalize باستخدام عامل مقياس 10,000، تلاها تحديد جينات متغيرة للغاية. ثم تم تحجيم البيانات قبل تحليل المكونات الرئيسية.
لتقليل تأثيرات الدفعات الخاصة بالعينة، تم تطبيق Harmony باستخدام orig.ident كمتغير دفعي. تم تنفيذ تصور تقريب وإسقاط متجانس (UMAP) وبناء رسم الجيران الأقرب باستخدام أول 15 بعدا مصححا بالهارموني21. تم إجراء التجميع باستخدام خوارزمية لوفان، وتم تقييم دقة التجميع المتعددة. كان التعليق النهائي الرئيسي لنوع الخلية يعتمد على نتيجة التجميع بدقة 0.05. تم توضيح تجمعات الخلايا يدويا وفقا للتعبير القياسي عن الجينات المرجعية. تتوافق هذه الاستراتيجية التوضيحية القائمة على العلامات مع الدراسات السابقة لتحليل المناعة على خلية واحدة22. تم تحديد الخلايا التائية بواسطة CD3D وCD3E وTRAC؛ الخلايا القاتلة الطبيعية (NK) بواسطة NKG7 وGNLY وNCAM1 وKLRG1؛ خلايا الخلايا البلعمية الأحادية بواسطة LYZ، CD14، FCGR3A، CD68، CD163، FCN1، TYROBP، S100A8، وS100A9؛ خلايا B بواسطة MS4A1 وCD79A؛ خلايا البلازما بواسطة MZB1 وXBP1؛ خلايا البطانة بواسطة PECAM1 وVWF وCDH5؛ خلايا العضلات الملساء الوعائية بواسطة ACTA2، TAGLN، MYH11، وMYL9؛ الأرومات الليفية بواسطة DCN، LUM، COL1A1، COL1A2، وPDGFRA؛ خلايا شبيهة بالعدلات بواسطة FCGR3B وCXCR2 وS100A8 وMPO؛ الخلايا البدينة بواسطة TPSB2؛ والخلايا التغصنية بواسطة LILRA4 وCD1C وXCR1. تم تصور تعبير جين العلامة عبر المجموعات باستخدام مخططات نقطية، وتم تصور توزيع التعبير لجينات المركز النهائية المرتبطة ب ERS على تضمينات UMAP.
لقياس النشاط النسخي المرتبط ب ERS على مستوى الخلية الواحدة، تم استخدام مجموعة الجينات المركزية النهائية لحساب درجات التوقيع على مستوى الخلايا باستخدام AUCell، وتحليل إثراء مجموعة الجينات بعينة واحدة، وSeurat AddModuleScore. بالنسبة ل AUCell، تم بناء تصنيفات الخلايا من مصفوفة تعبير RNA المطبيعية، وتم حساب درجات AUC باستخدام مجموعة الجينات المركزية التي تكون أعلى 10٪ من الجينات المصنفة كأقصى عتبة تصنيف. بالنسبة ل ssGSEA، تم حساب درجات الإثراء باستخدام حزمة GSVA. تم تمركز ومخارج التسجيل الثلاثة في المركز والتكبير، ثم تم تطبيعه على الحد الأقصى، وأخيرا جمعها لتوليد درجة مركبة متكاملة مرتبطة ب ERS لكل خلية. تمت مقارنة توزيع الدرجة المركبة عبر مجموعات الخلايا المشروحة لتقييم تباين نوع الخلايا في البرنامج المرتبط ب ERS. نظرا لأن سلالة وحيدة الخلية والبلعم أظهرت إثراء توقيعا بارزا مرتبطا ب ERS وكانت مرتبطة ارتباطا وثيقا بإعادة تشكيل المناعة الالتهابية، فقد تم اختيارها لتحليلات لاحقة داخل السلالة. تم تقسيم خلايا الخلايا الأحادية البلعمية إلى مجموعتين ذات درجات عالية ومنخفضة وفقا لدرجة المركب الوسيطة المرتبطة ب ERS. ثم تم إجراء تحليل المسار الزمني الكاذب على خلايا الخلايا البلعمية الأحادية باستخدام مونوكل.
لتحليل الوقت الزائف، تم إنشاء كائن CellDataSet من مصفوفة العد الخام باستخدام نموذج تعبير ثنائي السالب. ثم تم تقدير عوامل الحجم والتشتتات. تم اختيار جينات الترتيب باستخدام عتبة تعبير متوسطة ≥ 0.1 والتشتت التجريبي أكبر من التشتت المطابق. تم تقليل الأبعاد باستخدام خوارزمية DDRTree، وتم ترتيب الخلايا على طول المسار المستنتج. تم تصور أنماط التعبير الديناميكية لجينات المركز المرتبطة ب ERS على طول الزمن الزائف. تم إجراء تحليل الاتصال الخلوي-الخلوي باستخدام CellChat لاستكشاف التفاعلات المحتملة بين الليغاند-المستقبلات التي تشمل خلايا وحيدة الخلية والبلاعم ذات درجات مختلفة مرتبطة ب ERS. لهذا التحليل، تم تصنيف خلايا الخلايا البلعمية الأحادية كخلايا ذات درجة عالية أو منخفضة وفقا للدرجة المركبة الوسيطة، بينما احتفظت خلايا أخرى بتسمياتها الأصلية لنوع الخلية. تم استخدام مصفوفة تعبير RNA الموحدة والتعليقات المقابلة لمجموعات الخلايا لإنشاء كائن CellChat. لتحليل الاتصال الخلوي-الخلوي، تم اختيار قاعدة بيانات CellChatDB البشرية، وتم تقييم التفاعلات الإشارية المفسرة فقط. تم اكتشاف الجينات المعبر عنها بشكل مفرط وأزواج الليغاند-مستقبلات قبل حساب احتمالات الاتصال. تم استبعاد مجموعات الخلايا التي تحتوي على أقل من 10 خلايا من تحليل التفاعل. تم تقدير وتجميع احتمالات التواصل على مستوى المسار لاحقا لمقارنة عدد وقوة التفاعلات بين مجموعات الخلايا. لتسهيل قابلية التكرار، يتم توفير جدول نقاط تفتيش أدناه يربط كل خطوة بروتوكول برقم أو جدول الناتج المتوقع المقابل (الملف التكميلي 1—الجدول التكميلي S2).