$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
بيان الأخلاقيات
لم تشمل هذه الدراسة بشكل مباشر أي مشاركين بشريين أو حيوانات.
استحواذ BaP على تارجت
تميزت BaP بدمج البيانات من قواعد بيانات متعددة. تم الاستعلام عن قاعدة بيانات PubChem (https://pubchem.ncbi.nlm.nih.gov/) باستخدام الكلمة المفتاحية "Benzo[a]pyrene" للحصول على تركيبها الكيميائي وتركيبها ثنائي الأبعاد المعتمد (سلسلة SMILES: C1=CC=C2C3=C4C(=CC2=C1)C=CC5=C4C(=CC=C5)C=C3)14. تم استرجاع الأهداف المحتملة ل BaP من قواعد بيانات ChEMBL (https://www.ebi.ac.uk/chembl/)، SEA (https://sea.bkslab.org/)، وPharmMapper (http://lilab-ecust.cn/pharmmapper)15، 16، 17. جميع الأهداف المتوقعة كانت محصورة على بروتيوم الإنسان العاقل. تم توفير القائمة الكاملة لأهداف BaP المتوقعة (n = 474) في الجدول التكميلي S1. يتم تمثيل سير العمل التحليلي الكامل بشكل تخطيطي في الشكل 1.

الشكل 1. مخطط تدفق لتحليل مجموعات البيانات في هذه الورقة، يوضح سير العمل العام بما في ذلك جمع البيانات، المعالجة المسبقة، تحليل التعبيرات التفاضلية، بناء الشبكة، وخطوات التحقق. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
الحصول على أهداف متعلقة ب RA
في هذه الدراسة، تم الحصول على خمس مجموعات بيانات لالتهاب المفاصل الروماتويدي من قاعدة بيانات NCBI Mass Expression Gene Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/gds/) باستخدام الكلمات المفتاحية "التهاب المفاصل الروماتويدي" و"الإنسان العاقل"18. استنادا إلى حجم مجموعة البيانات وتصميم التجارب، GSE77298 (RA: 16 عينة؛ الضابط: 7 عينات)، GSE1919 (الروماتيدين: 5 عينات؛ الضابطة: 5 عينات)، و GSE55235 (الروماتيدين: 10 عينات؛ مجموعة الضابطة: 10 عينات) شكلت مجموعة التدريب لتحديد الجينات المعبر عنها بشكل تفاضلي (DEGs)، بينما GSE12021 (RA: 24 عينة؛ الضابط: 13 عينة) و GSE55457 (الروماتويد: 13 عينة؛ Control: 10 عينات) كانت مجموعة التحقق من الصحة. يمكن العثور على مزيد من التفاصيل حول هذه المجموعات من البيانات، مثل المنصات، العينات، وسلاسل GSE، في الجدول 1.
تم توحيد البيانات باستخدام أداة GEO2R الإلكترونية، حيث تولد مصفوفات تعبير محولة إلى log2 للتحليل اللاحق. لإزالة التداخل من دفعات تجريبية مختلفة، تم تصحيح التحيزات المنهجية بين مجموعات البيانات باستخدام دالة ComBat من حزمة SVA بناء على إطار عمل بايز تجريبي بارامتري (Parametric Baes). تم استخدام تحليل المكونات الرئيسية (PCA) لاحقا للتحقق من تأثير التصحيح، مما أظهر تحسنا ملحوظا في تجميع العينات بين الدفعات، مما أكد الإزالة الفعالة لتأثيرات الدفعات. تم استخدام مصفوفة البيانات المدمجة والمصححة للتحليل التفاضلي اللاحق.
| سلسلة GSE | عينات | المنصة | المجموعة |
| GSE77298 | 16 RA و7 عناصر تحكم | GPL570 | مجموعة التدريب |
| GSE1919 | 5 RA و5 عناصر تحكم | GPL91 | مجموعة التدريب |
| GSE55235 | 10 RA و10 عناصر تحكم | GPL96 | مجموعة التدريب |
| GSE12021 | 24 RA و13 وحدة تحكم | GPL96 | مجموعة التحقق |
| GSE55457 | 13 RA و10 عناصر تحكم | GPL9 | مجموعة التحقق |
الجدول 1: ملخص مجموعات بيانات GEO الخمسة المستخدمة في هذه الدراسة.
يوفر الجدول رقم وصول GEO (سلسلة GSE)، وتركيب العينة (عدد مرضى التهاب المفاصل الروماتويدي وعدد الضوابط الأصحاء)، ومعرف المنصة (GPL) لكل مجموعة بيانات وتعيين إما لمجموعة التدريب أو مجموعة التحقق.
تحليل شبكة التعبير المشترك للجينات المرجحة (WGCNA)
تم استخدام WGCNA لتقييم خصائص شبكات التعبير المشترك لمستويات DEGs المرتبطة ب RA19. استنادا إلى مصفوفة التعبير المصححة بتأثير الدفعة، تم إجراء معالجة بيانات مسبقة أولا: تمت إزالة الجينات منخفضة التباين ذات الانحراف المعياري الأقل من 0.5، بينما تم تقييم جودة العينة والجينات باستخدام دالة لتقييم عينات وجينات جيدة. لاحقا، تم تطبيق التجميع الهرمي لتحديد وإزالة العينات الشاذة. لبناء شبكة تعبير مشترك موزونة، تم استخدام دالة للتقييم المنهجي لقيم القوة ذات العتبات الناعمة لتقييم منهجية قيم القوة ذات العتبات الناعمة التي تتراوح من 1 إلى 20. تم اختيار القوة = 12 كعتبة ناعمة مثلى (مؤشر ملاءمة الطوبولوجيا الخالية من المقياس R2 = 0.90)، مما يضمن التزام طوبولوجيا الشبكة بمعيار خال من المقياس. استنادا إلى هذه القيمة القوية، تم بناء مصفوفة مجاورة، وتم حساب مصفوفة التداخل الطوبولوجي (TOM). تم تجميع الجينات بشكل هرمي، وتم استخدام خوارزمية القطع الديناميكي بالأشجار لتحديد وحدات الجينات الأولية. لاحقا، تم دمج وحدات مماثلة من خلال تجميع الجينات الذاتية للوحدات، مما أدى إلى شبكة وحدات جينية قوية. تم إجراء جميع التحليلات باستخدام حزمة R مخصصة لتحليل الشبكات ذات التعبيرات المشتركة المرجحة لضمان موثوقية وقابلية تكرار بناء الشبكة. تم إجراء تحليل لتقاطع جينات DEGs/WGCNA والأهداف المتوقعة ل BaP لتحديد الأهداف الأساسية ل BaP المرتبطة بمسببات الحمض الروماتويدي، والتي تم تصورها باستخدام برنامج مخطط فين.
تحديد الأهداف المرتبطة ب BaP المرتبطة بمسببات الالتهاب الروماتويدي
تم إجراء تحليل التقاطع باستخدام حزمة R لمخططات فين لتحديد أهداف BaP التي تتداخل مع منشأ أمراض الروماتويد. تم استيراد هذه النقاط إلى قاعدة بيانات STRING لبناء شبكة تفاعل بروتين (PPI)، مع تعيين النوع على "الإنسان العاقل" ودرجة ثقة التفاعل على > 0.7 لضمان موثوقية عالية في الشبكة20. تم اختيار هذا الحد لأنه يتوافق مع مستوى "ثقة عالية" في قاعدة بيانات STRING، والذي يوازن بين الاحتفاظ بالتفاعلات البيولوجية ذات الصلة مع تقليل الإيجابيات الكاذبة المرتبطة عادة بدرجات ثقة أقل. تم اعتماد حد أقصى > 0.7 على نطاق واسع في دراسات السموم الشبكية لإعطاء الأولوية للارتباطات البروتينية القوية والقابلة للتكرار. تم تنزيل ملف TSV الناتج من قاعدة بيانات تفاعل البروتين والبروتين (STRING) واستيراده إلى برنامج التصور الشبكي (Cytoscape) لعرض الشبكة. تم تحديد البروتينات الأساسية في الشبكة بناء على نتائج التصنيف التي تولدها خوارزمية Degree في إضافة CytoHubba واستخدمت للتحليل اللاحق.
تحليل إثراء KEGG و GO
تم تحويل اختصارات الجينات المرتبطة بكل من تعديل BaP ومسببات أمراض RA إلى معرفات Entrez باستخدام "org". حزمة تعليقات Hs.eg.db" باللغة R. لاحقا، تم إجراء تحليل إثراء مسار KEGG باستخدام أداة clusterProfiler، مع تعيين عتبة الدلالة على 0.05. وفي الوقت نفسه، غطى التعليق الوظيفي ل GO الفئات الثلاث الرئيسية ل GO: العملية البيولوجية (BP)، والمكون الخلوي (CC)، والوظيفة الجزيئية (MF)، وتم تنفيذه باستخدام دالة enrichGO، مع تحديد كل من القطع في قيمة P وقيم q إلى 0.05. يجدر بالذكر أنه لم يتم تطبيق تصحيح متعدد الاختبارات، حيث كان الهدف الأساسي من هذا التحليل الاستكشافي هو تعظيم اكتشاف المسارات البيولوجية والمصطلحات الوظيفية ذات الصلة المحتملة، مما يولد مجموعة أوسع من الفرضيات القابلة للاختبار للتحقق من صحة التجارب المستقبلية. وأخيرا، تم عرض نتائج تحليل الإثراء بشكل بياني باستخدام دالة مخطط الشريط ومخطط النقاط من حزمة مخطط الإثراء.
التحقق القائم على التعلم الآلي للجينات الأساسية
لتقييم القدرة التنبؤية للجينات الأساسية المرتبطة ب BaP وRA، وللحفاظ على شفافية النماذج، قمنا بتنفيذ سير عمل منهجي لتعلم الآلة. باستخدام ملفات التعبير للجينات الأساسية المختارة، تم بناء نماذج تنبؤية باستخدام 11 خوارزمية تعلم آلي مميزة: الانحدار الحبل (LR)، آلة الدعم المتجه (SVM)، الغابة العشوائية (RF)، glmBoost، النموذج الخطي المعمم خطوة بخطوة (GLM)، الانحدار الحاف، الشبكة المرنة (Enet)، آلة تعزيز التدرج (GBM)، التحليل الخطي المميز (LDA)، تعزيز التدرج الكهربائي (XGBoost)، وبايز الساذج. تم تحسين المعلمات الفائقة من خلال التحقق المتقاطع الخماسي، مع استخدام العينة الطبقية لتقسيم البيانات إلى مجموعات تدريب ومجموعات تحقق داخلية. تم استخدام بذرة عشوائية ثابتة (set.seed(123)) طوال سير عمل تعلم الآلة لضمان قابلية تكرار تقسيم البيانات، وطيات التحقق المتقاطع، وتدريب النماذج. المعاملات الفائقة الرئيسية لكل خوارزمية موفرة في الجدول التكميلي S2. تم تقييم أداء النموذج باستخدام عدة مقاييس، منها المساحة تحت المنحنى (AUC)، الدقة، ودرجة F1. لمعالجة القيود الكامنة في أساليب النموذج الواحد، طبقنا استراتيجية مجموعة تكديس تدمج التنبؤات من أفضل النماذج الأساسية أداء. وبعد إدراك الطبيعة "الصندوق الأسود" للعديد من نماذج التعلم الآلي، استخدمنا خوارزمية شابلي التوضيحية الإضافية (SHAP) لقياس مساهمة كل جين في التنبؤات. تم استخدام حجم واتجاه قيم SHAP لتفسير أهمية الجين في قرارات التصنيف، مما عزز قابلية تفسير مخرجات النموذج.
الالتحام الجزيئي ل BaP مع الأهداف الأساسية
لدراسة خصائص الارتباط بين BaP والمنتجات الجينية الأساسية، أجريت محاكاة للالتحام الجزيئي. تم الحصول على البنية ثلاثية الأبعاد ل BaP (ليغاند) بصيغة SDF من قاعدة بيانات PubChem. تم استرجاع هياكل البروتين المقابلة للأهداف الأساسية من بنك بيانات البروتين الخاص ب RCSB (https://www.rcsb.org/) بصيغة PDB، وتم اختيارها وفقا لمعرفات UniProt الخاصة بها، مع إعطاء تفضيل للهياكل التي تحتوي على روابط متبلور مشتركة أو إحداثيات عالية الدقة. قبل التثبيت، تم تحضير البروتين باستخدام PyMol، حيث تمت إزالة جزيئات الماء، والروابط المتبلورة، ومكونات غير بروتينية مثل الأيونات لمنع التداخل21. بالنسبة للبروتينات التي تحتوي على روابط متبلور في هياكل PDB الأصلية، تم تعريف مركز الموقع النشط باستخدام الإحداثيات الذرية للرابطة المرتبطة. بالنسبة للبروتينات التي لا تحتوي على روابط متبلورة معا، تم تحديد مركز الموقع النشط بناء على إحداثيات البقايا الرئيسية التي أبلغ عنها الأدبيات بأنها حاسمة للنشاط التحفيزي أو ارتباط المثبطات. تم تمركز شبكة الالتحام عند إحداثيات الموقع النشط المحددة، مع تطبيق صندوق مكعب بأبعاد 25 × 25 × 25 أنطوسترا على كل هدف. يضمن حجم الصندوق القياسي 25 Å تغطية كاملة لكل موقع نشط مع هامش كاف لأخذ عينات الليجند مع تجنب التكاليف الحاسوبية المفرطة. تم تنفيذ جميع حسابات الإرساء باستخدام أوتودوك فينا (الإصدار 1.2.5). تم اختيار الشكل الذي يظهر أعلى درجة فينا كنمط ربط تمثيلي، وتم تسجيل طاقة الربط المقابلة. تم توليد وضعيات ربط ثلاثية الأبعاد باستخدام PyMol (الإصدار 2.5.7)، وتم إنتاج مخططات تفاعل ثنائية الأبعاد باستخدام Discovery Studio (الإصدار 2021) لتصور التفاعلات الرئيسية، بما في ذلك الروابط الهيدروجينية والتلامسات الكارهة للماء.
محاكاة الديناميكا الجزيئية
تم إجراء محاكاة الديناميكا الجزيئية باستخدام جروماكس 2025.3، باستخدام المركبات المشتقة من الالتحام كهياكل بداية. تم نمذجة ذرات البروتين باستخدام حقل القوة AMBER14SB، وتم تمثيل جزيئات الماء باستخدام نموذج TIP3P. تم حل كل مركب بروتين-ليغاند في صندوق ماء مكعب، مع مسافة دنيا تبلغ 1 نانومتر بين سطح البروتين وحدود الصندوق. تمت إضافة أيونات الصوديوم أو الكلوريد حسب الحاجة لتحقيق الحيادية الكهربائية للنظام. تم إجراء تقليل الطاقة الأولي باستخدام مزيج من خوارزميات النزول الأكثر حدة والتدرج الاقترافي، كل منها يمتد لما يصل إلى 10,000 خطوة. تم حساب التفاعلات الكهروستاتيكية طويلة المدى باستخدام طريقة إيوالد الجسيم-الشبكة (PME)، بينما تم تطبيق مسافة قطع تبلغ 1.0 نانومتر لكل من فان دير فال والتفاعلات الكهروستاتيكية قصيرة المدى. بعد تقليل الطاقة، تم تعديل الأنظمة تدريجيا تحت ظروف NVT (الحجم ودرجة الحرارة الثابتين) وNPT (الضغط ودرجة الحرارة الثابتين). ثم تم تنفيذ عمليات إنتاج بطول 100 نانوثانية تحت درجة حرارة وضغط ثابتين، مع خطوة زمنية تبلغ 0.002 حصان ثانية (2 ف) وإجمالي 50,000,000 خطوة. تم إجراء كل محاكاة مرة واحدة (دون تكرار)، حيث كان الهدف الأساسي تقييم استقرار مركبات الارتباط تحت الظروف القياسية. تم الحفاظ على درجة الحرارة باستخدام منظم الحرارة V-rescale، وتم التحكم في الضغط باستخدام باروستات بارينيلو-رحمن. طوال المحاكاة، تم تطبيق حد 1.0 نانومتر بشكل متسق للتفاعلات غير المرتبطة. لتقييم الاستقرار والمرونة الهيكلية، حسبنا متوسط الانحراف التربيعي الجذري (RMSD) لمواقع الذرات، ومتوسط التربيع الجذري (RMSF) لكل بقايا، ونصف قطر الدوران (Rg) كمقياس للضغط الهيكلي، ومساحة السطح المتاحة للمذيب (SASA). تم توليد جميع المخططات باستخدام QtGrace.