$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تم إنتاج نتائج تمثيلية باتباع هذا البروتوكول لدراسة الارتباطات بين بروتينات الميتوكوندريا (الجدول 2) وثماني فئات من أمراض القلب والأوعية الدموية (الجدول 3). في هذه الفئات ، وجدنا 363,567 منشورا منشورا منشورا من عام 2012 إلى أكتوبر 2022 (362,878 منشورا مصنفا حسب البيانات الوصفية ل MeSH ، و 6,923 منشورا مصنفا حسب احتساب الملصق). كان لجميع المنشورات عناوين ، وكان 276,524 يحتوي على ملخصات ، و 51,065 كان النص الكامل متاحا. بشكل عام ، تم تحديد 584 من 1,687 من بروتينات الميتوكوندريا التي تم الاستفسار عنها في المنشورات ، بينما تم تحديد 3,284 من 8,026 بروتينا مرتبطا وظيفيا. في المجموع ، تم تحديد 14 بروتينا فريدا بدرجات مهمة في جميع فئات المرض ، مع عتبة درجة z تبلغ 3.0 (الشكل 5). كشف تحليل مسار Reactome لهذه البروتينات عن 12 مسارا مهما لجميع الأمراض (الشكل 6). تم دمج جميع البروتينات والمسارات والأمراض والدرجات في الرسم البياني المعرفي (الجدول 4). تم الاستفادة من هذا الرسم البياني المعرفي للتنبؤ ب 12,688 جمعية جديدة لأمراض البروتين وتمت تصفيتها بدرجة احتمالية 0.90 للحصول على 1,583 تنبؤا عالي الثقة. يوضح الشكل 7 مثالا بارزا لارتباطين بين البروتين والمرض، موضحا في سياق الكيانات البيولوجية الأخرى ذات الصلة المرتبطة وظيفيا بالبروتينات. وترد مقاييس تقييم النموذج في الجدول 5.

الشكل 1: عرض ديناميكي لسير العمل. يمثل هذا الرقم الخطوات الرئيسية الأربع في سير العمل هذا. أولا ، يتم تنسيق البروتينات ذات الصلة بناء على شروط GO المقدمة من المستخدم (على سبيل المثال ، المكونات الخلوية) ، ويتم إعداد فئات الأمراض بناء على معرفات MeSH للمرض التي يوفرها المستخدم. ثانيا ، يتم حساب الارتباطات بين البروتينات والأمراض في خطوة التنقيب عن النصوص. يتم تنزيل المنشورات ضمن نطاق زمني معين وفهرستها. يتم تحديد منشورات دراسة الأمراض (عبر ملصقات MeSH واختياريا عبر الملصقات المنسوبة) ، ويتم تنزيل نصوصها الكاملة وفهرستها. يتم الاستعلام عن أسماء البروتين داخل المنشورات واستخدامها لحساب درجات ارتباط البروتين والمرض. بعد ذلك ، بعد التنقيب عن النص ، تساعد هذه الدرجات في تحديد أهم ارتباطات البروتين والمسار. أخيرا ، يتم إنشاء رسم بياني معرفي يشمل هذه البروتينات والأمراض وعلاقاتها داخل قاعدة المعرفة الطبية الحيوية. يتم التنبؤ بارتباطات جديدة بين البروتين والمرض بناء على الرسم البياني المعرفي المبني. تستخدم هذه الخطوات أحدث البيانات المتاحة من قواعد المعرفة الطبية الحيوية و PubMed. يرجى النقر هنا لعرض نسخة أكبر من هذا الرقم.

الشكل 2: البنية التقنية لسير العمل. التفاصيل الفنية لسير العمل هذا موضحة في هذا الشكل. يوفر المستخدم أرقام شجرة MeSH لفئات المرض ومصطلح (مصطلحات) GO. يتم تنزيل المستندات النصية من PubMed ، ويتم تحديد المستندات ذات الصلة بالمرض بناء على ملصقات MeSH المقدمة ، وتتلقى المستندات التي لا تحتوي على تسميات MeSH التي تشير إلى الموضوع تسميات الفئات المنسوبة. يتم الحصول على البروتينات المرتبطة بمصطلح (مصطلحات) GO المقدمة. يتم توسيع مجموعة البروتين هذه لتشمل البروتينات المرتبطة وظيفيا عبر تفاعلات البروتين والبروتين ، والمسارات البيولوجية المشتركة ، والاعتماد على عامل النسخ. يتم الاستعلام عن هذه البروتينات في الوثائق ذات الصلة بالمرض ويتم تسجيلها بواسطة CaseOLAP. يرجى النقر هنا لعرض نسخة أكبر من هذا الرقم.

الشكل 3: مثال على مستند تمت معالجته. يتم تقديم مثال على مستند نصي مفهرس تم تحليله هنا. بالترتيب ، تشير الحقول ذات الصلة إلى اسم الفهرس (_index ، _type) ، معرف PubMed (_id ، pmid) ، الأقسام الفرعية للوثيقة (العنوان ، الملخص ، full_text ، المقدمة ، الأساليب ، النتائج ، المناقشة) ، والبيانات الوصفية الأخرى (السنة ، MeSH ، الموقع ، المجلة). لأغراض العرض فقط، يتم اقتطاع الأقسام الفرعية للمستند بعلامات حذف. يحتوي حقل MeSH على موضوعات المستند ، والتي قد يتم توفيرها أحيانا من خلال خطوة تضمين التسمية. يرجى النقر هنا لعرض نسخة أكبر من هذا الرقم.

الشكل 4: مخطط الرسم البياني المعرفي والموارد الطبية الحيوية. يوضح هذا الشكل مخطط الرسم البياني المعرفي. تمثل كل عقدة وحافة نوع عقدة أو حافة ، على التوالي. يتم ترجيح الحواف بين أمراض القلب والأوعية الدموية (CVDs) والبروتينات من خلال درجات CaseOLAP. يتم ترجيح حواف تفاعل البروتين والبروتين (PPI) من خلال درجات ثقة STRING. حواف الاعتماد على عامل النسخ المشتق من GRNdb / GTEx (TFD) ، وحواف شجرة المرض المشتقة من MeSH ، وحواف المسار المشتقة من المفاعل غير مرجحة. يرجى النقر هنا لعرض نسخة أكبر من هذا الرقم.

الشكل 5: أهم ارتباطات أمراض البروتين. يعرض هذا الشكل بروتينات الميتوكوندريا المهمة لكل فئة من فئات الأمراض. تم تطبيق تحويل درجة Z على درجات CaseOLAP داخل كل فئة لتحديد البروتينات المهمة باستخدام عتبة 3.0. (أعلى) عدد بروتينات الميتوكوندريا المهمة لكل مرض: تصور مخططات الكمان هذه توزيع درجات z للبروتينات في كل فئة من فئات الأمراض. يظهر العدد الإجمالي للبروتينات المهمة لكل فئة مرضية فوق كل مؤامرة كمان. تم تحديد ما مجموعه 14 بروتينا فريدا على أنها مهمة في جميع الأمراض ، وكانت بعض البروتينات مهمة لأمراض متعددة. (أسفل) البروتينات الأعلى تسجيلا: تعرض خريطة الحرارة أفضل 10 بروتينات حصلت على أعلى متوسط درجات z في جميع الأمراض. لا تمثل القيم الفارغة أي درجة تم الحصول عليها بين البروتين والمرض. يرجى النقر هنا لعرض نسخة أكبر من هذا الرقم.

الشكل 6: أهم ارتباطات المسار والمرض. يوضح هذا الشكل أهم المسارات البيولوجية المرتبطة بفئات الأمراض المدروسة ، كما هو محدد من خلال تحليل مسار المفاعل. تمت تصفية جميع تحليلات المسار باستخدام p < 0.05. تمثل قيم خريطة الحرارة متوسط درجة z لجميع البروتينات داخل المسار. (أعلى) المسارات المحفوظة بين جميع الأمراض: بشكل عام ، تم تحديد 14 بروتينا ذات صلة بجميع فئات الأمراض ، وتم الكشف عن 12 مسارا محفوظا بين جميع فئات الأمراض. تم بناء مخطط شجيري بناء على الهيكل الهرمي للمسار لربط المسارات بوظائف بيولوجية مماثلة. يمثل ارتفاع التشوه الصخري العمق النسبي داخل التسلسل الهرمي للمسار. الوظائف البيولوجية الواسعة لها أطراف أطول ، والمسارات الأكثر تحديدا لها أطراف أقصر. (أسفل) مسارات مميزة لفئة المرض: تم إجراء تحليل المسار باستخدام البروتينات التي حققت درجة z كبيرة في كل مرض. يتم عرض المسارات الثلاثة الأولى ذات القيم p الأقل المرتبطة بكل مرض والإشارة إليها بالعلامات النجمية. يمكن أن تكون المسارات ضمن المراكز الثلاثة الأولى في أمراض متعددة. يرجى النقر هنا لعرض نسخة أكبر من هذا الرقم.

الشكل 7: تطبيق التعلم العميق لإكمال الرسم البياني المعرفي. يتم تقديم مثال على تطبيق التعلم العميق على الرسم البياني المعرفي الخاص بالمرض في هذا الشكل. يتم التنبؤ بالعلاقات الخفية بين البروتينات والمرض ، ويشار إليها باللون الأزرق. يتم عرض الاحتمالات المحسوبة لكلا التنبؤين ، بقيم تتراوح من 0.0 إلى 1.0 ومع 1.0 تشير إلى تنبؤ قوي. يتم تضمين العديد من البروتينات ذات التفاعلات المعروفة ، والتي تمثل تفاعلات البروتين والبروتين ، والاعتماد على عامل النسخ ، والمسارات البيولوجية المشتركة. للتصور ، يتم عرض رسم بياني فرعي لبعض العقد ذات الصلة بالمثال المميز. مفتاح: IHD = مرض نقص تروية القلب. R-HSA-1430728 = التمثيل الغذائي. O14949 = الوحدة الفرعية المعقدة للسيتوكروم b-c1 8 ؛ P17568 = نازعة هيدروجين NADH (يوبيكوينون) 1 وحدة فرعية فرعية بيتا 7 ؛ Q9NYF8 عامل النسخ المرتبط ب Bcl-2 1 ، النتيجة: 7.24 × 10−7 ؛ P49821 = نازعة هيدروجين NADH (يوبيكوينون) فلافوبروتين 1 ، الميتوكوندريا ، النتيجة: 1.06 × 10−5 ؛ P31930 = الوحدة الفرعية المعقدة للسيتوكروم b-c1 1 ، الميتوكوندريا ، النتيجة: 4.98 × 10−5 ؛ P99999 = السيتوكروم ج ، النتيجة: 0.399. يرجى النقر هنا لعرض نسخة أكبر من هذا الرقم.
الجدول 1: سير العمل وخطوات تحديد المعدل. يعرض هذا الجدول تقديرات تقريبية للوقت الحسابي لكل مرحلة من مراحل سير العمل. ستؤدي خيارات تضمين مكونات خط الأنابيب إلى تغيير إجمالي وقت التشغيل اللازم لإكمال التحليل. يختلف تقدير الوقت الإجمالي وفقا للموارد الحسابية المتاحة، بما في ذلك مواصفات الأجهزة وإعدادات البرامج. كتقدير تقريبي ، استغرق البروتوكول 36 ساعة من وقت التشغيل النشط للتنفيذ على خادمنا الحسابي ، مع ستة نوى ، و 32 جيجابايت من ذاكرة الوصول العشوائي ، و 2 تيرابايت من التخزين ، ولكن هذا قد يكون أسرع أو أبطأ على الأجهزة الأخرى. الرجاء الضغط هنا لتنزيل هذا الجدول.
الجدول 2: التجميع التلقائي للبروتينات المكونة الخلوية. يوضح هذا الجدول عدد البروتينات المرتبطة بمكون خلوي معين (أي مصطلح GO) ، والبروتينات المرتبطة وظيفيا بها عبر تفاعلات البروتين والبروتين (PPI) ، والمسارات المشتركة (PW) ، والاعتماد على عامل النسخ (TFD). عدد البروتينات الكلية هو عدد البروتينات من جميع الفئات السابقة مجتمعة. تم الحصول على جميع البروتينات ذات الصلة وظيفيا باستخدام المعلمات الافتراضية ل CaseOLAP LIFT. الرجاء الضغط هنا لتنزيل هذا الجدول.
الجدول 3: إحصاءات احتساب تسمية MeSH. يعرض هذا الجدول فئات الأمراض ، وأرقام شجرة MeSH المستخدمة كمصطلح أصلي لجميع الأمراض المدرجة في الفئة ، وعدد مقالات PubMed الموجودة في كل فئة من 2012-2022 ، وعدد المقالات الإضافية المضمنة بناء على خطوة احتساب التسمية. الرجاء الضغط هنا لتنزيل هذا الجدول.
الجدول 4: إحصاءات بناء الرسم البياني المعرفي. يصف هذا الجدول إحصائيات حجم الرسم البياني المعرفي الذي تم إنشاؤه، بما في ذلك العقد المختلفة وأنواع الحواف. تمثل درجات CaseOLAP العلاقة بين فئة البروتين وأمراض القلب والأوعية الدموية (CVD). الرجاء الضغط هنا لتنزيل هذا الجدول.
الجدول 5: إحصاءات التنبؤ بالرسم البياني المعرفي وعمليات التحقق من الصحة. يوضح هذا الجدول مقاييس التقييم للتنبؤ بارتباط الرسم البياني المعرفي لارتباطات أمراض البروتين الجديدة / المخفية. تم تقسيم حواف الرسم البياني المعرفي إلى مجموعات بيانات تدريب واختبار 70/30 ، وتم الحفاظ على اتصال الرسم البياني للحواف في كلتا مجموعتي البيانات. تشير الدقة إلى نسبة التنبؤات المصنفة بشكل صحيح ، بينما تصحح الدقة المتوازنة اختلال التوازن الطبقي. تشير الخصوصية إلى نسبة التنبؤات السلبية المصنفة بشكل صحيح. تشير الدقة إلى نسبة التنبؤات الإيجابية الصحيحة من بين جميع التنبؤات الإيجابية ، بينما يشير الاستدعاء إلى نسبة التنبؤات الإيجابية الصحيحة من جميع الحواف الإيجابية (أي ارتباطات أمراض البروتين التي تم تحديدها عن طريق التنقيب عن النصوص). درجة F1 هي الوسيلة التوافقية للدقة والتذكر. تصف المنطقة الواقعة أسفل منحنى خصائص تشغيل المستقبل (AUROC) مدى تميز النموذج بين التنبؤات الإيجابية والسلبية ، حيث يشير 1.0 إلى مصنف مثالي. تقيس المنطقة الواقعة تحت منحنى الاستدعاء الدقيق (AUPRC) المفاضلة بين الدقة والاستدعاء عند عتبات احتمالية متفاوتة ، مع القيم الأعلى التي تشير إلى أداء أفضل. الرجاء الضغط هنا لتنزيل هذا الجدول.