الاستحواذ من قاعدة بيانات TCGA
تم الحصول على بيانات تسلسل RNA والمعلومات السريرية لمجموعة سرطان الثدي الغازي في أطلس جينوم السرطان (TCGA-BRCA) من بوابة البيانات الجينية المشتركة14. تم استخراج بيانات RNA-seq الخاصة بسير عمل STAR بتنسيق عدد النسخ لكل مليون (TPM) جنبًا إلى جنب مع التوصيفات السريرية المطابقة. وقد استُبعدت عينات RNA-seq التي تفتقر إلى المعلومات السريرية المقابلة. وبالنسبة للتحليلات القائمة على التعبير الجيني، تم تحويل قيم TPM إلى log2(TPM + 1). كما استُخرج تعبير MPO باستخدام رمز الجين MPO ومعرف جين Ensembl رقم ENSG00000005381.8. وبالنسبة للتحليلات التي تتطلب تقسيمًا إلى مجموعات MPO-high وMPO-low، تم تضمين عينات أورام TCGA-BRCA فقط، واستُبعدت العينات الطبيعية المجاورة من تخصيص المجموعات. قُسمت عينات الأورام وفقًا للقيمة الوسيطة لتعبير MPO المُحول بـ log2(TPM + 1) بين عينات أورام TCGA-BRCA. خُصصت العينات التي كان تعبير MPO فيها أكبر من أو يساوي القيمة الوسيطة إلى مجموعة MPO-high، بينما خُصصت العينات التي كانت أقل من القيمة الوسيطة إلى مجموعة MPO-low. استُخدمت استراتيجية التقسيم القائمة على الوسيط هذه في تحليل البقاء، وتحليل التعبير التفاضلي، وتحليل الإثراء، وتقسيم الميثيلية، ومقارنات إثراء الخلايا المناعية، ما لم يُنص على خلاف ذلك. حُللت الخصائص المرضية السريرية، بما في ذلك الجنس، والعمر، والعرق، والمرحلة المرضية T، والدرجة النسيجية، والنمط الفرعي PAM50، والمرحلة المرضية، وحالة الورم، ونقاط النهاية للبقاء، بما في ذلك البقاء الإجمالي (OS)، والفترة الخالية من تطور المرض (PFI)، والبقاء الخاص بالمرض (DSS)، باستخدام إصدار R 4.2.1.
استرجاع صور الكيمياء النسيجية المناعية العامة
استُخدمت صور ممثلة للكيمياء النسيجية المناعية (IHC) لبروتين MPO في أنسجة الثدي الطبيعية المجاورة وأنسجة سرطان الثدي كمرجع نوعي لمستويات البروتين. ولم تُدرج هذه الصور في التحليلات المورفومترية الكمية أو التحليلات الإحصائية. وتشير المناطق المحددة بالمربعات إلى المناطق المعروضة بتكبير أعلى. تشير أشرطة المقياس إلى 100 µm في صور 20× و 50 µm في صور 40×.
تحليل ارتباط التعبير
استُخدمت مجموعة بيانات TCGA-BRCA لفحص الجينات التي يتغير تعبيرها بشكل مشترك مع تعبير MPO في سرطان الثدي. تم حساب معاملات ارتباط بيرسون على مستوى الجينوم بين MPO والجينات المشفرة للبروتين، واختيرت أعلى 30 جينًا ذات ارتباط إيجابي وأعلى 30 جينًا ذات ارتباط سلبي للتصور البياني. وبالنسبة لتحليلات الارتباط التي شملت جينات متعددة تم اختبارها، عُدلت قيم p الاسمية باستخدام طريقة بنجاميني-هوكبرج لمعدل الاكتشاف الكاذب. كما تم إنشاء شبكة التفاعل بين البروتينات (PPI) المرتبطة بـ MPO باستخدام قاعدة بيانات أداة البحث عن الجينات/البروتينات المتفاعلة (STRING)، مع الاحتفاظ بأزواج البروتينات التي أظهرت درجات تفاعل أكبر من 0.40 للتصور البياني15.
تحليل الإثراء الوظيفي
تم تحديد الجينات ذات التعبير المتباين (DEGs) من خلال مقارنة مجموعات أورام TCGA-BRCA ذات التعبير المرتفع عن MPO والتعبير المنخفض عنه، وذلك باستخدام عتبات |log2FC| > 1 وقيمة p-value معدلة وفق طريقة Benjamini-Hochberg < 0.05. كما أُجري تحليل الإثراء الوظيفي للجينات ذات التعبير المتباين باستخدام حزمة R clusterProfiler الإصدار 4.4.4، بما في ذلك تحليل الأنطولوجيا الجينية (GO) للعمليات البيولوجية، والمكونات الخلوية، والوظائف الجزيئية، وتحليلات مسارات موسوعة كيوتو للجينات والجينومات (KEGG)16,17,18,19,20. واعتُبرت مصطلحات GO وKEGG المُثراة ذات دلالة إحصائية عندما كانت قيمة p-value المعدلة < 0.05.
تم إجراء تحليل إثراء مجموعة الجينات (GSEA) باستخدام قائمة جينات مرتبة مسبقاً بناءً على إحصائيات التعبير التفاضلي بين المجموعات ذات المستوى العالي من MPO والمجموعات ذات المستوى المنخفض من MPO. استُخدمت مجموعة المسارات القياسية C2 من قاعدة بيانات MSigDB المسماة c2.cp.all.v2022.1.Hs.symbols.gmt، والتي تقابل MSigDB v2022.1.Hs وتحتوي على 3,050 مجموعة جينات21,22. واعتُبرت المصطلحات المثرية ذات دلالة إحصائية وفقاً لقيمة p-value المعدلة بطريقة بنجاميني-هوخبيرج < 0.05، وقيمة FDR q-value < 0.25، و|درجة الإثراء الطبيعية| > 1. وحيثما كان ذلك مناسباً، تم حساب قيم Z-scores للمصطلحات المثرية بشكل دال إحصائياً باستخدام حزمة GOplot لأغراض التصوير البياني.
تحليل إثراء الخلايا المناعية في الأورام
تم تقييم المكونات المناعية والسداوية في مجموعة TCGA-BRCA باستخدام خوارزمية ESTIMATE المطبقة في حزمة R package estimate الإصدار 1.0.13. واستُخدمت بيانات التعبير التي خضعت لتحويل Log2(TPM + 1) كمدخلات، حيث تم حساب الدرجة المناعية، والدرجة السداوية، ودرجة ESTIMATE لكل عينة ورمية. واستُخدم برنامج TIMER/TIMER2.0 لتقييم الارتباطات بين تعبير MPO ومستويات الارتشاح المقدرة لمجموعات الخلايا المناعية الرئيسية في مجموعة TCGA-BRCA، بما في ذلك الخلايا البائية، وخلايا T CD8+، وخلايا T CD4+، والبلعميات، والعدلات، والخلايا الشجيرية23,24,25. وقد فُسِّرت النتائج المستندة إلى TIMER على أنها تقديرات للارتشاح المناعي مشتقة من المورد المتاح عبر الإنترنت. ولإجراء تحليل إثراء الخلايا المناعية عبر 24 نوعاً من الخلايا المناعية، تم تطبيق تحليل إثراء مجموعة الجينات للعينة الواحدة (ssGSEA) باستخدام حزمة R package GSVA الإصدار 1.46.026. وتتوفر مصفوفة بصمة الخلايا المناعية LM22 المستخدمة لفك التلافيف المستند إلى CIBERSORT لـ 22 نوعاً من الخلايا المناعية في الجدول التكميلي 1. كما تم تقييم الارتباطات بين تعبير MPO ودرجات إثراء الخلايا المناعية باستخدام معامل ارتباط سبيرمان للرتب. وقورنت الاختلافات في درجات إثراء الخلايا المناعية بين مجموعات الأورام ذات التعبير العالي عن MPO والمنخفض عنه (والمحددة بناءً على الوسيط) باستخدام اختبار ويلكوكسون لمجموع الرتب. وبالنسبة للتحليلات التي شملت أنواعاً متعددة من الخلايا المناعية، تم تعديل قيم p باستخدام طريقة بنجاميني-هوخبيرج لمعدل الاكتشاف الكاذب.
مثيلة الحمض النووي DNA لجين MPO
تم تقييم أنماط مثيلة DNA ضمن موقع MPO باستخدام منصة MethSurv. وقد تم الحصول على قيم بيتا لمثيلة CpG وارتباطات البقاء على قيد الحياة لبيانات TCGA-BRCA من منصة MethSurv. وتم تصوير مواقع CpG المختارة المرتبطة بـ MPO، وتقييم ارتباطاتها بنتائج البقاء على قيد الحياة باستخدام مخرجات تحليل البقاء التي وفرتها منصة MethSurv27. وبالنسبة للتحليلات التي شملت مواقع CpG متعددة، تم تعديل قيم p عبر مواقع CpG المختبرة المرتبطة بـ MPO باستخدام طريقة Benjamini-Hochberg لمعدل الاكتشاف الكاذب. وقد فُسرت تحليلات المثيلة هذه على أنها توصيفات فوق جينية استكشافية.
بناء شبكة التفاعلات البروتينية-البروتينية (PPI) وتحليل الارتباط للجينات المرتبطة بالعدلات
لفحص الارتباط بين MPO والبيولوجيا المتعلقة بالخلايا المتعادلة، أُجري تحليل شبكي منهجي. وقد جُمعت مجموعة جينات تضم وسائط مثبتة لتنشيط الخلايا المتعادلة والعمليات الالتهابية المرتبطة بها من الأدبيات الحالية. تتوفر القائمة الكاملة للجينات المتعلقة بالخلايا المتعادلة في الجدول التكميلي 2. وُحدت رموز الجينات وفقاً للرموز الرسمية، وحُذفت المدخلات المكررة، ثم جرى تقاطع الجينات المتاحة مع مصفوفة التعبير الخاصة بـ TCGA-BRCA قبل إجراء تحليل STRING/PPI، وتحديد أولويات الجينات المحورية، وتحليل الارتباط بين MPO والجينات المحورية. تم بناء شبكة تفاعلات البروتين-بروتين (PPI) بين هذه الجينات باستخدام قاعدة بيانات STRING (الإصدار 11.5) مع تحديد عتبة درجة ثقة متوسطة للتفاعل (>0.40). صُنفت الجينات المحورية ضمن هذه الشبكة خوارزمياً بناءً على مركزية الدرجة، والتي تقيس عدد التفاعلات المباشرة لكل عقدة. وقد تم اختيار أعلى 20 جيناً سجلت أعلى درجات المركزية لإجراء تحليل الارتباط اللاحق.
لاحقًا، تم استخراج ملفات التعبير الجيني لهذه الجينات المحورية وMPO من مجموعة بيانات النسخ الخاصة بـ TCGA-BRCA. كما تم تقييم الارتباط بين MPO وكل جين محوري إحصائيًا باستخدام معامل ارتباط سبيرمان (Spearman's rank correlation). ولتحديد أنماط الارتباط بين الجينات المحورية نفسها، تم حساب مصفوفة ارتباط سبيرمان ثنائية عبر جميع عينات الأورام. وقد وفرت تحليلات الارتباط هذه الأساس الكمي للتصويرات البيانية اللاحقة، بما في ذلك مخطط المصاصة (lollipop plot) لارتباطات MPO بالجينات المحورية، والمخطط الوترِي (chord diagram) أو الخريطة الحرارية التي توضح أنماط ارتباط الجينات المحورية.
التنبؤ بعوامل النسخ والـ miRNAs العلوية التي تستهدف MPO
استُخدمت قاعدة بيانات KnockTF (https://bio.liclab.net/KnockTF/index.php)28,29، وقاعدة بيانات ChIP (http://chip-atlas.org/)30,31، وقاعدة بيانات GTRD32,33 (https://gtrd.biouml.org/#!) للتنبؤ بعوامل النسخ (TFs) المستهدفة بواسطة MPO. بالإضافة إلى ذلك، استُخدمت قاعدة بيانات TargetScan (https://www.targetscan.org/vert_80/) للتنبؤ بمواقع ربط miRNA المحتملة التي تستهدف MPO. كما تم إنشاء مخططات فين (Venn diagrams) باستخدام موقع MicroBioinformatics الإلكتروني (https://www.bioinformatics.com.cn/static/others/jvenn/example.html)34.
تحليل الخلية الواحدة لـ MPO
تأتي مجموعة البيانات المحددة GSE161529 من قاعدة بيانات Gene Expression Omnibus (GEO). بدأت عملية المعالجة المسبقة للبيانات بإجراء تصفية على مستوى الخلية لاستبعاد الخلايا منخفضة الجودة، وهي الخلايا التي استوفت أيًا من المعايير التالية: تعبير الجينات الميتوكوندرية الذي يتجاوز 25%، أو إجمالي عدد المعرفات الجزيئية الفريدة (UMI) الذي يقل عن 5000، أو اكتشاف أقل من 2500 جين. بعد ذلك، تم تصحيح التلوث بالحمض النووي الريبي (RNA) المحيط والتأثيرات التقنية للدفعات35. أُجري تحليل المكونات الرئيسية (PCA) لتقليل الأبعاد لتقييم التشابه الخلوي، متبوعًا بـ UMAP لتجميع الخلايا وتصورها. ثم تم تعيين مجموعات الخلايا المختلفة إلى أنواع خلوية بناءً على الجينات الواسمة النموذجية للخلايا11. تتوفر مجموعة الجينات المرتبطة بـ MPO المستخدمة في تسجيل البصمة أحادية الخلية في الملف التكميلي 1. وقبل التسجيل، تمت مواءمة رموز الجينات مع الرموز الرسمية، وإزالة الإدخالات المكررة، ومقاطعة الجينات المتاحة مع مصفوفة التعبير GSE161529. استُخدمت أدوات AUCell وSeurat AddModuleScore وssGSEA لحساب درجات ارتباط MPO لكل خلية. خضعت الدرجات الناتجة عن الطرق الثلاث لعملية تسوية Z-score، وتم قياسها إلى نطاق قابل للمقارنة، ثم دمجها لإنشاء درجة مركبة مرتبطة بـ MPO للتحليلات الوصفية اللاحقة. تم استقصاء شبكات التفاعل بين الخلايا لمقارنة أنماط الاتصال المستنتاجة بين الليجاند والمستقبل التي تشمل الخلايا الورمية الظهارية المصنفة حسب إشارة ارتباط MPO وأنواع مختلفة من الخلايا الشريكة. فُسرت هذه المخرجات على أنها أنماط اتصال وصفية وليست دليلًا على أن الخلايا التي تعبر عن MPO تتوسط الاتصال بين الخلايا بشكل مباشر.
إسكات جيني افتراضي أحادي الخلية لـ MPO وتحليل إثراء المسارات باستخدام scTenifoldKnk
تم إجراء عملية إسكات افتراضي لـ MPO على مستوى الخلية الواحدة من خلال دمج Seurat وscTenifoldKnk. وبناءً على مراقبة الجودة القياسية (200–6,000 جين لكل خلية؛ ونسبة الميتوكوندريا < 10%)، خضعت البيانات للتطبيع اللوغاريتمي (log-normalization)، وتم اختيار 2,000 جين شديد التباين لتقليل الأبعاد والتجميع. ولإثراء السياقات ذات الصلة بـ MPO، تم الاحتفاظ بالخلايا التي سجلت في أعلى 50% من وحدة جينات النخاع/الخلايا المتعادلة. ومن هذه الخلايا، تم تحديد مجموعة فرعية من "جوار MPO" عن طريق التوسع من بذور موجبة لـ MPO باستخدام k = 40 من أقرب الجيران في فضاء PCA. ولم يتم التعامل مع المجموعة الفرعية الموسعة كعشيرة نقية موجبة لـ MPO، كما لم يتم استخلاص أي استنتاجات حول نسبة أنواع الخلايا من خطوة توسيع KNN هذه. خضعت هذه المجموعة الفرعية لتحليل الإسكات الافتراضي عبر scTenifoldKnk، باستخدام اتحاد الجينات شديدة التباين وMPO (المعبر عنه في ≥25 خلية) كمجموعة جينات. وتم تحديد الجينات التي تعرضت لاضطراب ملحوظ (FDR < 0.05، مصححة وفقاً لطريقة BH). كما تم تحليل الجينات الناتجة لاحقاً لمعرفة الإثراء الوظيفي في العمليات البيولوجية لـ GO ومسارات KEGG (q < 0.05).
الاسترجاع الاستكشافي للعلاقة بين الدواء والجين و توصيف ADMET
تم الاستعلام من قاعدة بيانات DGIdb للحصول على سجلات أولية للتفاعلات بين الدواء والجينة أو الكيميائية والجينة المرتبطة بـ MPO. وبما أن قوائم التفاعلات المستمدة من قواعد البيانات قد تتضمن إدخالات مدعومة بأنواع أدلة متباينة وقد لا تتوافق مباشرة مع العوامل العلاجية القابلة للتطبيق سريرياً، فقد تم التعامل مع المركبات المسترجعة على أنها تعليقات توضيحية استكشافية بدلاً من كونها مرشحات علاجية ذات أولوية. بعد ذلك، استُخدم كل من SwissADME وADMETlab لتلخيص الخصائص الفيزيائية والكيميائية، والحركية الدوائية، والسموم المتوقعة. وقد استُخدمت هذه التعليقات التوضيحية التي تمت حاسوبياً (in silico) لتوفير سياق أولي لتفسير مستوى المركبات ولتسليط الضوء على الحاجة إلى مزيد من التقييم الدوائي والسمومي والسريري قبل النظر في أي صلة علاجية36.