$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
أجريت الدراسة وفقا لإعلان هلسنكي، وتمت الموافقة على البروتوكول من قبل لجنة الأخلاقيات في المستشفى الثالث لجامعة خبي الطبية (W2025-065-1) في نوفمبر 2024. تم الحصول على موافقة مستنيرة من جميع المشاركين في الدراسة.
مصدر البيانات والمعالجة المسبقة
تم الحصول على بيانات RNA-seq المرتبطة ب HF، بما في ذلك مجموعتي بيانات ميكروآراي من Gene Expression Omnibus (https://www.ncbi.nlm.nih.gov/geo/). تم اختيار مجموعتين من بيانات مصفوفة الدم المحيطية: GSE59867 (34 عينة HF و30 عينة ضابطة) كمجموعة بيانات تدريبية؛ تم استخدام GSE57338 (177 عينة HF و136 عينة ضابطة) كمجموعة بيانات للتحقق. تم استرجاع المعلومات السريرية المتاحة ل GSE57338، بما في ذلك العمر والجنس وحالة المرض، من GEO ويتم تلخيصها في الجدول التكميلي 1. بالإضافة إلى ذلك، تم الحصول على ما مجموعه 3,893 جين مرتبط بالميتوكوندريا (SRGs) من قاعدة بيانات dbPTM (https://awi.cuhk.edu.cn/dbPTM/index.php) (الجدول التكميلي 2)، بينما تم جمع 2,030 جينا مرتبطا بالميتوكوندريا (MRGs) بناء على دراسة سابقة24 (الجدول التكميلي 3). بعد ذلك، تم استخدام حزمة R GEOquery (v 2.72.0)25 لتحميل مجموعات البيانات من قاعدة بيانات GEO، واستخراج مصفوفة التعبير، والحصول على معلومات النمط الظاهري العيني. تم إجراء التعليق عن طريق تعيين ملف التعليقات ومطابقة معرفات الجينات. تمت إزالة معرفات جينية غير صالحة، وتم الاحتفاظ بأكثر المجسات تعبيرا بشكل واضح.
اختيار الجينات الرئيسية عبر التعلم الآلي
تم استخدام نهج متعدد الخطوات لاختيار الجينات المتعلقة ب HF، وSUMOylation، والميتوكوندريا. أولا، تم تحديد الجينات المشتركة بين مجموعة بيانات التدريب، ومجموعات SRG، وMRGs باستخدام تحليل التقاطع. تم تحديد الوظيفة المحتملة للجينات الشائعة من خلال تحليل إثراء جينات الجينات (GO) وموسوعة كيوتو للجينات والجينومات (KEGG) باستخدام حزمة R ClusterProfiler (الإصدار 4.12.6)26. ثم تم استخدام ثلاث طرق تعلم آلة، وهي انحدار LASSO، وXGBoost، والغابة العشوائية (RF)، لتصفية الجينات بشكل أكبر. في انحدار LASSO، تم اختيار معامل التنظيم الأمثل λ عبر التحقق المتقاطع لتحديد السمات الجينية ذات القيمة التنبؤية الأعظم. تم اختيار الجينات غير الصفرية للتحليل لاحقا. ثم تم استخدام خوارزميات XGBoost وRF لحساب درجات أهمية الميزات وفحص أفضل 20 جينا.
بناء وتقييم النماذج التشخيصية
تم بناء نموذج تشخيصي باستخدام الانحدار اللوجستي بناء على مجموعة البيانات GSE59867. ثم تم تطبيق النموذج للتنبؤ بحالة المرض وحساب درجات الاحتمالية. للتحقق من صحة النموذج، تم استخراج نفس الجينات الرئيسية من مجموعة البيانات GSE57338، وتم تطبيعها لتطابق مجموعة بيانات التدريب، واستخدامها للتنبؤ الخارجي. تم تقييم أداء النموذج باستخدام منحنيات خصائص تشغيل المستقبل (ROC)، ومصفوفة الالتباس، ومنحنى المعايرة، وتحليل منحنى القرار (DCA).
تحليل إثراء مجموعات الجينات (GSEA) وتحديد المواقع تحت الخلوية
تم استخدام تحليل الارتباط في سبيرمان لتحديد الجينات المترابطة لكل جين رئيسي. تم إجراء تحليل GSEA باستخدام حزمة R ClusterProfiler (الإصدار 4.12.6) على الجينات المرتبطة بالجينات الرئيسية. وفي الوقت نفسه، لتحديد الموقع الدقيق للجينات الرئيسية تحت الخلية داخل الخلية، تم تحديد موقعها تحت الخلوي باستخدام قاعدة بيانات GeneCards (https://www.genecards.org/).
الارتباط بين الجين والمرض والتنبؤ الدوائي
لتقييم الأهمية السريرية للجينات الرئيسية المحددة، أجريت تحليلات منهجية للارتباط بالأمراض وتفاعل الأدوية. تم استجواب الروابط بين الأمراض والجينات باستخدام قاعدة بيانات السموم المقارنة (CTD؛ https://ctdbase.org/)، حيث تم تصنيف النتائج بناء على درجات الاستنتاج وعدد المراجع (أفضل 10 ارتباطات تم الإبلاغ عنها). تم الحصول على بيانات التفاعل بين الجينات والدواء الرئيسية من قاعدة بيانات تفاعل الدواء والجين (DGIdb)، وتم استبعاد الأدوية بناء على درجة التفاعل < 0.5. بعد ذلك، قمنا بتحميل البنى ثلاثية الأبعاد للبروتينات المقابلة للجينات الرئيسية من قاعدة بيانات PDB (https://www.rcsb.org/) والهياكل الجزيئية للأدوية المحتملة من PubChem (https://pubchem.ncbi.nlm.nih.gov/). بعد ذلك، أجري تحليل الالتحام الجزيئي باستخدام CB-Dock227 (https://cadd.labshare.cn/cb-dock2/php/index.php) لحساب درجات الارتباط بين الأدوية والبروتينات المحتملة. تشير طاقة الارتباط الحرة الأقل إلى تفاعل أكثر استقرارا، مما يشير إلى أن المركب قد يكون لديه إمكانات استهداف أكبر.
تحليل تسرب المناعة
تم تقييم تسرب الخلايا المناعية باستخدام ثلاث طرق تكميلية: عداد تجمعات الخلايا في البيئة الدقيقة (MCP-counter)28، تحديد نوع الخلية من خلال تقدير مجموعات نسبية من نسخ RNA (CIBERSORT)29 ، وتحليل إثراء العينة الواحدة (ssGSEA)30. تم إجراء تحليل عداد MCP وCIBERSORT باستخدام حزمة R IOBR (v 0.99.0)31. تم استخدام عداد MCP لتقدير وفرة الخلايا المناعية وخلايا البث، بينما استخدم CIBERSORT لقياس النسب النسبية ل 22 نوعا من الخلايا المناعية. تم إجراء ssGSEA باستخدام حزمة GSVA (v1.52.3)32 لتقييم إثراء الأنواع الفرعية لخلايا المناعة على مستوى العينة.
بناء شبكة تنظيمية للحمض النووي الريبي الداخلي (ceRNA) المتنافسة
لدراسة الأدوار التنظيمية المحتملة ل miRNA–lncRNA المرتبطة بالجينات الرئيسية التي تم تحديدها مسبقا، تم بناء شبكة تنظيمية ل ceRNA. تم استخدام حزمة R multiMiR (الإصدار 1.26.0)33 للتنبؤ بتفاعلات الميكروRNA المحتملة بين الميكرو RNA (miRNA)–mRNA للجينات الرئيسية، مع دمج بيانات من PITA (https://omictools.com/pita-tool/) وقاعدة بيانات miRDB (https://mirdb.org/). تم اختيار أزواج miRNA–mRNA ذات ثقة عالية واتساق. لاحقا، تم استرجاع تفاعلات lncRNA–miRNA من قاعدة بيانات StarBase (https://rnasysu.com/encori/) وتصفيتها بحثا عن تفاعلات مدعومة بتجارب CLIP-seq ≥ عشرة وتصنيفها كlincRNAs. تم بناء شبكة ceRNA من خلال دمج تفاعلات lncRNA-miRNA-mRNA.
التحقق من qPCR
للتحقق من تعبير الجينات الرئيسية، تم جمع عينات دم من مرضى HF ومجموعة تحكم صحية من المجموعة السريرية (n = 6 لكل مجموعة) في المستشفى الثالث بجامعة خبي الطبية (W2025-065-1) وفقا لبروتوكولات معتمدة وموافقة مستنيرة. تم عزل إجمالي الحمض النووي الريبي باستخدام كاشف تريزول مع الكلوروفورم والإيزوبروبانول. بعد الاستخلاص، تم إذابة الحمض النووي الريبي في ماء معالج ب DEPC، وتم تقييم تركيزه ونقائه باستخدام مطياف نانودروب. للتحليل النسخي، تم نسخ RNA عكسيا إلى cDNA باستخدام مزيج تخليق cDNA سريع للسلسلة الأولى لعلاج RT (مع dsDNase). تم إجراء PCR الكمي لاحقا باستخدام مزيج Fast Taq qPCR SYBR Green Mix. يتم تفصيل تسلسلات البرايمر المحددة في جدول المواد. تم حساب مستويات التعبير الجيني النسبية باستخدام طريقة 2-ΔΔCT ، مع التطبيع المناسب.
التحليل الإحصائي
تم إجراء جميع التحليلات الإحصائية باستخدام برنامج R ومنشور GraphPad. تم إجراء مقارنات إحصائية بين مجموعتين مستقلتين باستخدام اختبار t لطالب أو اختبار مان-ويتني U، اعتمادا على توزيع البيانات. تم اعتبار قيمة p أقل من 0.05 دلالة على الدلالة الإحصائية.