وقد نفذ البروتوكول وفقا لإعلان هلسنكي ووافق مجلس الاستعراض المؤسسي في مستشفى صحة الأم والطفل في تشانغشا على البروتوكول؛ تم الحصول على موافقة مستنيرة من الرعايا.
1. تحديد الأطفال المصابين بالتوحد باستخدام DSM-5
- جمع التاريخ الطبي والمعلومات الأساسية
- التاريخ التنموي
- جمع معلومات عن التطور المبكر للمريض ، بما في ذلك تقدم المهارات اللغوية والاجتماعية والحركية.
- لاحظ أي تأخير أو تشوهات في النمو (على سبيل المثال ، تأخر اللغة ، وصعوبات في التفاعل الاجتماعي).
- التاريخ العائلي
- استفسر عن أي تاريخ عائلي للإصابة بالتوحد أو اضطرابات النمو العصبي الأخرى.
- المستوى الوظيفي الحالي
- تقييم أداء المريض في الحياة اليومية ، بما في ذلك التعلم والعمل والتفاعلات الاجتماعية ومهارات المعيشة المستقلة.
- استخدام معايير تشخيص DSM-5
- العجز المستمر في التواصل الاجتماعي والتفاعل الاجتماعي
- تأكد من استيفاء اثنين على الأقل من المعايير الثلاثة التالية:
- أوجه القصور في المعاملة بالمثل الاجتماعية والعاطفية - تبحث عن نقص الاتصال البصري الطبيعي أو تعبيرات الوجه أو لغة الجسد وصعوبة تكوين صداقات أو علاقات مناسبة للعمر.
- أوجه القصور في السلوكيات التواصلية غير اللفظية - تبحث عن تحديات في استخدام الإيماءات أو تعبيرات الوجه أو نبرة الصوت لنقل المشاعر والفهم المحدود للإشارات غير اللفظية من الآخرين.
- أوجه القصور في تطوير العلاقات والحفاظ عليها وفهمها - تبحث عن صعوبة التكيف مع السياقات الاجتماعية المختلفة وعدم الاهتمام بالأقرانهم أو عدم القدرة على الانخراط في اللعب الخيالي.
- أنماط السلوك أو الاهتمامات أو الأنشطة المقيدة والمتكررة
- تأكد من استيفاء اثنين على الأقل من المعايير الأربعة التالية:
- الحركات الحركية النمطية أو المتكررة (على سبيل المثال ، رفرفة اليد أو هز الجسم أو استخدام الأشياء المتكررة).
- الإصرار على التماثل أو أنماط السلوك الطقسية - ابحث عن الضيق الشديد بسبب التغييرات الطفيفة في الروتين.
- اهتمامات مقيدة للغاية وثابتة - ابحث عن تركيز مكثف بشكل غير طبيعي على موضوعات أو أنشطة محددة.
- ابحث عن استجابات غير نمطية للمنبهات الحسية مثل الأصوات أو الأضواء أو اللمس.
- تقييم ظهور الأعراض وشدتها
- توقيت الأعراض - يؤكد أن الأعراض كانت موجودة في مرحلة الطفولة المبكرة (عادة قبل سن 3) ، حتى لو أصبحت أكثر وضوحا لاحقا.
- تأثير الأعراض - يؤكد أن الأعراض تسبب ضعفا كبيرا في المجالات الاجتماعية أو المهنية أو غيرها من مجالات الأداء المهمة.
- مستويات الخطورة
ملاحظة: وفقا ل DSM-5 ، يتم تصنيف شدة ASD إلى ثلاثة مستويات (الجدول التكميلي S1).
- صنف على أنه المستوى 1 إذا كان المريض يحتاج إلى دعم خفيف فقط.
- قم بالتصنيف على أنه المستوى 2 إذا كان المريض يحتاج إلى دعم كبير (معتدل).
- صنف على أنه المستوى 3 إذا كان المريض يحتاج إلى دعم كبير جدا (شديد).
- استبعاد الأسباب المحتملة الأخرى
- الفحص الطبي قم بإجراء التقييمات الطبية اللازمة (على سبيل المثال ، الاختبارات الجينية ، تصوير الدماغ) لاستبعاد الحالات الأخرى التي قد تسبب أعراضا مماثلة (على سبيل المثال ، المتلازمات الوراثية ، ضعف السمع ، الإعاقات الذهنية).
- تقييم الاعتلال المشترك: تقييم وجود حالات مراضة مصاحبة (على سبيل المثال ، اضطراب نقص الانتباه وفرط الحركة ، اضطرابات القلق ، الاكتئاب ، الصرع ، إلخ).
2. تحضير العينة لتحليل قياس الطيف الكتلي DIA
- الامتثال الأخلاقي وجمع العينات
- الحصول على موافقة مستنيرة من الوالدين أو الأوصياء القانونيين للأطفال الذين تتراوح أعمارهم بين 3-7 سنوات والذين تم تشخيص إصابتهم باضطراب طيف التوحد (ASD).
- صنف المرضى إلى مستويات الشدة من 1 إلى 3 وفقا لمعايير التشخيص الموضحة في الدليل التشخيصي والإحصائي الأمريكي للتوحد (الخطوة 1.3.3).
- جمع عينات المصل من المشاركين. تأكد من معالجة جميع العينات في غضون أربع ساعات من جمع الدم لمنع تدهور البروتين. احتفظ بالعينات على الثلج أثناء المعالجة.
- إزالة البروتينات عالية الوفرة
- استخدم مجموعة تجارية لاستنفاد البروتينات عالية الوفرة من 60 ميكرولتر من المصل لكل عينة ، باتباع تعليمات الشركة المصنعة. باختصار ، قم بموازنة عمود النضوب مع المخزن المؤقت للربط ، وقم بتحميل عينة المصل ، واسمح لها بالمرور عبر العمود تحت تدفق الجاذبية. اجمع التدفق الذي يحتوي على جزء البروتين منخفض الوفرة.
- قم بقياس تركيز البروتين الكلي باستخدام مقايسة BCA. تطبيع جميع العينات إلى تركيز نهائي من 0.5-1.0 ميكروغرام / ميكرولتر قبل الهضم في المحلول. تأكد من أن كل عينة تحتوي على 100 ميكروغرام على الأقل من البروتين لتحليلها لاحقا.
- هضم البروتين
ملاحظة: تم إجراء هضم البروتين باستخدام طريقة FASP التي وصفها Wisniewski et al.24.
- أضف المنظف ، ديثيوثريتول (DTT) ، ويودو أسيتاميد (IAA) في المخزن المؤقت UA (اليوريا العازلة) لمنع السيستين المخفض.
- هضم معلق البروتين مع التربسين بنسبة 50: 1 طوال الليل عند 37 درجة مئوية.
- تحلية الببتيد ، والتنظيف ، وتجزئة الطور العكسي عالية الأس الهيدروجيني
- قم بالطرد المركزي لمخاليط الببتيد عند 16,000 × جم لمدة 15 دقيقة عند درجة مئوية لإزالة الحطام غير القابل للذوبان.
- انقل المادة الطافية (التي تحتوي على الببتيدات المهضومة) إلى أنبوب طرد مركزي دقيق جديد منخفض الارتباط لتقليل خسائر الامتزاز.
- . قم بإعداد الأعمدة الدقيقة C18 (معبأة داخليا براتنج C18) عن طريق التكييف المسبق بميثانول 100٪ (20 ميكرولتر) والتوازن مع 0.1٪ (v / v) حمض ثلاثي فلورو أسيتيك (TFA) في الماء (المخزن المؤقت A ؛ 20 ميكرولتر).
- قم بتحميل عينة الببتيد على العمود الدقيق. اغسل العمود ب 20 ميكرولتر من المخزن المؤقت A لإزالة الأملاح والمنظفات والملوثات غير الببتية.
- الببتيدات المنقاة مع 20 ميكرولتر من 80٪ أسيتونيتريل تحتوي على 0.1٪ TFA.
- جفف الببتيدات المملوءة تحت الفراغ باستخدام مكثف فراغ بالطرد المركزي. قم بتخزين الببتيدات المجففة في درجة حرارة -8 درجة مئوية حتى الاستخدام مرة أخرى.
- أعد تكوين الببتيدات المجففة في حمض الفورميك 0.1٪ قبل تحليل LC-MS / MS.
- 2.4.8. تحديد تركيز الببتيد عن طريق قياس الامتصاص عند 280 نانومتر (OD280) باستخدام مقياس الطيف الضوئي ، مع مراعاة مساهمات بقايا التربتوفان والتيروزين لقياس كمية دقيق.
لتجزئة مخاليط الببتيد باستخدام HPLC ذات الطور العكسي عالي الأس الهيدروجيني ، استخدم عمود C18 (3.5 ميكرومتر ، 2.1 × 150 مم) على نظام HPLC بمعدل تدفق 0.3 مل / دقيقة ، المرحلة المتنقلة أ: 10 ملي مولار فورمات الأمونيوم في الماء ، الرقم الهيدروجيني 10 (معدل بهيدروكسيد الأمونيوم) ، المرحلة المتنقلة ب: 10 ملي مولار فورمات الأمونيوم في 90٪ أسيتونيتريل ، درجة الحموضة 10. قم بإجراء شطف متدرج لجمع 60 كسرا لكل عينة على مدار ~ 60 دقيقة.
- اجمع كل جزء ثالث لتقليل التكرار ، مما ينتج عنه 20 كزما مجمعة لكل عينة. جفف كل جزء مجمع تحت الفراغ لتحليله النهائي.
ملاحظة: أصبحت كسور الببتيد الناتجة جاهزة الآن لتحليل nano-LC-MS / MS.
3. التقديم لتحليل الطيف الكتلي DIA
- تحليل الطيف الكتلي DIA
- قم بزيادة الببتيد المعتمد على البيانات (DDA) من جزء HPRP باستخدام الببتيدات القياسية iRT وفصلها باستخدام الكروماتوغرافيا السائلة عالية الأداء ذات الطور العكسي (RP-HPLC) على نظام nano-HPLC مع عمود (75 ميكرومتر × 150 مم ؛ 2 ميكرومتر C18 حبات ، 120 Å) بمعدل تدفق 300 نانومتر / دقيقة مع المرحلة المتنقلة A: 0.1٪ حمض الفورميك في الماء ، المرحلة المتنقلة ب: 0.1٪ حمض الفورميك في 95٪ أسيتونيتريل.
- قم بإزالة الببتيدات على مدى 60 دقيقة بتدرج خطي للمخزن المؤقت B على النحو التالي: 0 - 2 دقيقة ، التدرج الخطي من 2٪ إلى 5٪ عازلة B ؛ 2 - 42 دقيقة ، التدرج الخطي من 5٪ إلى 20٪ عازلة B ؛ 42 - 50 دقيقة ، التدرج الخطي من 20٪ إلى 35٪ عازلة B ؛ 50 - 52 دقيقة ، التدرج الخطي من 35٪ إلى 90٪ عازلة B ؛ 52 - 60 دقيقة ، حافظ المخزن المؤقت B عند 90٪.
- تحليل الببتيدات المشوهة على مطياف الكتلة المشار إليه. احصل على بيانات MS باستخدام طريقة top20 تعتمد على البيانات ديناميكيا لاختيار أيونات السلائف الأكثر وفرة من فحص المسح (350 - 1500 م / z) لتجزئة HCD.
- قم بتشغيل الجهاز مع تمكين وضع التعرف على الببتيد . استخدم كتلة قفل تبلغ 445.120025 Da كمعيار داخلي لمعايرة الكتلة. احصل على مسح MS الكامل بدقة 70,000 عند m / z 200 ، و 17,500 عند m / z 200 لمسح MS / MS. اضبط الحد الأقصى لوقت الحقن على 50 مللي ثانية ل MS و 30 مللي ثانية ل MS / MS ، وطاقة الاصطدام الطبيعية إلى 28 ، ونافذة العزل على 1.6 Th ، ومدة الاستبعاد الديناميكي إلى 30 ثانية.
- تحليل LC-MS/MS للاقتناء المستقل عن البيانات (DIA)
- قم بزيادة الببتيدات من كل عينة باستخدام iRT بالتساوي وبشكل منفصل.
- قم بإجراء LC-MS/MS على مطياف الكتلة رباعي الأقطاب مقترنا بنظام nano-HPLC. قم بتعيين شرط LC بنفس الطريقة المستخدمة في طريقة DDA أعلاه. قم بإجراء مسح مسح من 400 إلى 1,200 م / z بدقة 60,000 مع هدف AGC البالغ 3E6 و 30 مللي ثانية من وقت الحقن. احصل على عمليات المسح الضوئي DIA MS/MS بدقة 15,000 مع نافذة عزل 20 m/z وبهدف AGC يبلغ 1E6 ووقت حقن 50 مللي ثانية. اضبط طاقة الاصطدام الطبيعية على 30.
- سجل أطياف فحوصات MS و DIA الكاملة في أنواع الملف الشخصي والطراز المركزي ، على التوالي.
- البحث في قاعدة بيانات التسلسل
- تحليل بيانات DDA MS باستخدام برنامج DIA2.
- ابحث في بيانات MS مقابل قاعدة بيانات UniProtKB البشرية (إجمالي 186,532 إدخالا ، تم تنزيله في 10/2019) ، مزينة بالبروتينات التي تتكون من 11 تسلسل ببتيد iRT.
- حدد التربسين كإنزيم الهضم. حدد الحد الأقصى لموقعي الانقسام المفقودين والتسامح الكتلي البالغ 4.5 جزء في المليون لأيونات السلائف و 20 جزء في المليون لأيونات التجزئة للبحث في قاعدة البيانات. تعريف كارباميدوميثيل السيستين كتعديل ثابت وأسيتيل للبروتين N-terminal وأكسدة الميثيونين كتعديلات متغيرة للبحث في قاعدة البيانات.
- قم بتصفية نتائج البحث في قاعدة البيانات وتصديرها بمعدل اكتشاف خاطئ (FDR) بنسبة <1٪ عند مستويات الببتيد المتطابقة مع طيف الببتيد والبروتين ، على التوالي.
- إجراء معالجة البيانات الأولية
- تحليل بيانات DIA MS تم تحليلها باستخدام برنامج DIA [34 ، 35] لإنشاء مكتبة طيفية من نتائج البحث. استخدم الإعدادات الافتراضية للبحث وiRT الديناميكي للتنبؤ بوقت الاستبقاء. تأكد من تمكين تصحيح التداخل لفحص MS/MS.
- تصدير النتائج مع <1٪ FDR على مستوى الببتيد.
4. تحليل البروتين التفاضلي
- قم بإجراء اختبار الفرضيات باستخدام اختبار الطالب t جنبا إلى جنب مع تغيير الطي (FC) عند http://www.omickits.com/open/tooldetail?id=70.
- قم بتسجيل الدخول إلى النظام الأساسي السحابي وانتقل إلى أداة تحليل اختبار الفرضيات . قم بتحميل ملف بيانات قياس كمية البروتين المعالج مسبقا (على سبيل المثال ، تنسيق CSV أو TXT).
- في إعدادات المعلمات، حدد اختبار t للطالب كطريقة إحصائية وعتبة الدلالة عند قيمة p < 0.05. حدد عتبة تغيير الطي على أنها FC > 1.5 أو FC < 1 / 1.5. انقر فوق تشغيل التحليل وانتظر حتى يتم إنشاء النتائج.
- قم بتنزيل ملف الإخراج الذي يحتوي على قيم p و log2 (FC) وحالة الأهمية لكل بروتين.
ملاحظة: يوازن هذا النهج ثنائي المعايير بين الأهمية الإحصائية والملاءمة البيولوجية ، مما يضمن التحديد القوي للبروتينات المعبر عنها تفاضليا (DEPs).
5. تحليل مسار الإشارة
- تصور مؤامرة البركان
- انتقل إلى الأداة في http://www.omickits.com/open/tooldetail?id=63 ثم إلى صفحة أداة مخطط البركان .
- قم بتحميل ملف نتيجة تحليل DEP من القسم 4.
- تكوين معلمة التصور: المحور X: log2 (تغيير الطي) - يشير إلى اتجاه التغيير ؛ المحور Y: -log10 (قيمة ع) - يعكس الدلالة الإحصائية. ترميز اللون: أحمر : بروتينات عالية التنظيم (ص < 0.05 و FC > 1.5); الأزرق : بروتينات منخفضة إلى حد كبير (ص < 0.05 و FC < 0.667); رمادي : البروتينات غير الهامة (ص ≥ 0.05 أو 1 / 1.5 ≤ FC ≤ 1.5).
- انقر فوق إنشاء صورة وقم بتنزيل الصورة عالية الدقة (تنسيق PDF/SVG) للنشر.
- خريطة التحويل اللوني للتجميع الهرمي
- انتقل إلى الأداة في http://www.omickits.com/open/tooldetail?id=17
- قم بالوصول إلى أداة خريطة التمثيل اللوني للتجميع .
- قم بتحميل مصفوفة تعبير DEP التي تمت تصفيتها.
- تعيين المعلمات التالية: طريقة التطبيع: صف الحكيم Z-score للقضاء على اختلافات المقياس; مقياس المسافة: المسافة الإقليدية. طريقة التجميع: التجميع الهرمي الكامل للارتباط. اختياري: تمكين تجميع الأعمدة و/أو الصفوف بناء على تجميع العينات.
- انقر فوق تشغيل لإنشاء خريطة التمثيل اللوني.
- قم بتنزيل خريطة التمثيل اللوني وحفظها كصورة جاهزة للنشر.
ملاحظة: تمثل خريطة التمثيل اللوني بصريا تشابه وتباعد أنماط تعبير البروتين عبر العينات.
- التعليقات التوضيحية الوظيفية GO وتحليل الإثراء
- تثبيت وتحميل حزم R المطلوبة:
المكتبة (clusterProfiler)
المكتبة (المنظمة. Hs.eg.db)
المكتبة (ggplot2)
- قم بتحويل معرفات البروتين (على سبيل المثال ، Uniprot أو رموز الجينات) إلى معرفات Entrez:
entrez_ids <- bitr(diff_proteins, fromType = "UNIPROT", toType = "ENTREZID", OrgDb = org. Hs.eg.db)
- قم بإجراء تحليل تخصيب GO:
go_enrich <- enrichGO (الجين = entrez_ids $ ENTREZID ، OrgDb = org. Hs.eg.db ، keyType = "ENTREZID" ، ont = "BP")
- تصور النتائج باستخدام المخططات النقطية:
- نقطة النقطة(go_enrich ، عرضالفئة = 20)
صيغة:
عامل الغني = (أ / ب) / (ج / د)
أين:
أ = عدد DEPs المشروحة للمصطلح ؛
(ب) = العدد الإجمالي للخطط التنفيذية للخطر؛
ج = عدد بروتينات الخلفية المشروحة للمصطلح ؛
د = العدد الإجمالي لبروتينات الخلفية.
- التعليقات التوضيحية لمسار KEGG وتحليل الإثراء
- إجراء تحليل تخصيب KEGG:
kegg_enrich <- إثراء كيج (الجين = entrez_ids $ ENTREZID ، الكائن الحي = "لديه")
- تصور نتائج مسار KEGG:
الشريط (kegg_enrich ، عرضالفئة = 20)
- تخصيص المؤامرات باستخدام ggplot2 لتنسيق المنشور.
6. الفحص الأولي للبروتينات باستخدام تحليل منحنى ROC
- إعداد البيانات: قم بتحميل مجموعة بيانات البروتينات التي تحتوي على جميع البروتينات المعبر عنها تفاضليا (DEPs) المحددة من اضطراب طيف التوحد (ASD) ومجموعات التحكم. تأكد من أن مجموعة البيانات تتضمن قيم تعبير البروتين لكلتا المجموعتين ، مع تسميات واضحة تشير إلى ASD وعينات التحكم.
- قم بإجراء تحليل منحنى ROC.
- استخدم حزمة pROC في R لإجراء تحليل منحنى خاصية تشغيل المستقبل (ROC) لكل بروتين.
- قم بتقييم قدرة كل بروتين على التمييز بين ASD ومجموعات التحكم عن طريق حساب المنطقة تحت المنحنى (AUC).
AUC = 0.5: لا تمييز (أي ما يعادل الصدفة العشوائية).
0.7 ≤ AUC < 0.8: تمييز مقبول.
0.8 ≤ AUC < 0.9: تمييز ممتاز.
≥ الجامعة الأمريكية بالقاهرة 0.9: التمييز البارز.
ملاحظة: يمثل AUC احتمال أن يكون لدى الفرد المختار عشوائيا من مجموعة ASD مستوى بروتين أعلى من الفرد المختار عشوائيا من المجموعة الضابطة. يشير ارتفاع AUC إلى أداء تشخيصي أفضل ، مع قيم أعلى من 0.8 تعتبر عموما ذات مغزى سريريا في دراسات المؤشرات الحيوية.
- سجل قيم AUC لجميع البروتينات.
- حدد المؤشرات الحيوية المرشحة.
- حدد البروتينات ذات AUC أكبر من 0.7 كمؤشرات حيوية مرشحة.
- تصدير قائمة المؤشرات الحيوية المرشحة لمزيد من التحليل.
- تصور النتائج.
- استخدم حزمة ggplot2 في R لإنشاء تصورات لمنحنيات ROC للبروتينات الأفضل أداء.
- قم بتضمين قيم AUC في وسائل إيضاح الحبكة للوضوح.
7. الفحص الثانوي باستخدام الغابة العشوائية
- إعداد بيانات الإدخال.
- استخدم قائمة المؤشرات الحيوية المرشحة التي تم الحصول عليها من تحليل ROC كمدخلات لتحليل الغابات العشوائية.
- تأكد من تنسيق مجموعة البيانات بشكل مناسب، مع صفوف تمثل عينات وأعمدة تمثل قيم تعبير البروتين.
- تدريب نموذج الغابة العشوائية.
- قم بتطبيق خوارزمية الغابة العشوائية باستخدام حزمة randomForest في R.
- قم بتعيين عدد الأشجار (ntree) إلى 500 وعدد المتغيرات التي تم أخذ عينات منها عشوائيا في كل تقسيم (mtry) إلى الجذر التربيعي للعدد الإجمالي للميزات.
- قم بتقييم أهمية الميزة باستخدام مقياس MeanDecreaseAccuracy، الذي يقيس الانخفاض في دقة النموذج عند إزالة معلم معين.
- تدريب نموذج غابة عشوائي باستخدام حزمة randomForest في R:
مكتبة R. (randomForest)
# مثال: مجموعة التنبؤ (على سبيل المثال ، ASD مقابل السيطرة) باستخدام مستويات البروتين
rf_model <- عشوائي الغابة(x = protein_data,
y = as.factor (مجموعة) ،
importance = TRUE, # مطلوب لحساب أهمية الميزة
ntree = 500) # عدد الأشجار
- استخراج مقاييس أهمية الميزة باستخدام الدالة important():
R. importance_scores <- الأهمية (rf_model)
- استرجع قيم MeanDecreaseAccuracy وفرزها بترتيب تنازلي:
R. mean_dec_acc <- importance_scores[ ، "MeanDecreaseAccuracy"]
importance_rank <- فرز (mean_dec_acc ، تناقص = صواب)
- تصور أهمية الميزة باستخدام وظيفة varImpPlot() المدمجة:
R. varImpplot (rf_model ، الرئيسي = "أهمية الميزة (متوسط الانخفاض في الدقة)")
ملاحظة: يعكس مقياس MeanDecreaseAccuracy مدى أهمية كل ميزة للأداء التنبؤي للنموذج. يشير الانخفاض الكبير في الدقة عند الإزالة إلى أهمية عالية. هذا النهج مفيد بشكل خاص لاكتشاف المؤشرات الحيوية ، لأنه يساعد في تحديد أولويات البروتينات أو الجينات ذات القوة التمييزية الأقوى بين المجموعات.
- تصدير درجات الأهمية لإعداد التقارير أو التحليل النهائي:
R. importance_table <- data.frame (
الميزة = الأسماء (importance_rank) ،
MeanDecreaseAccuracy = importance_rank
)
write.csv(importance_table، "feature_importance.csv"، row.names = خطأ)
- رتب البروتينات بناء على درجات MeanDecreaseAccuracy الخاصة بهم.
- حدد أفضل 15 بروتينا مع أعلى درجات MeanDecreaseAccuracy كأهم الميزات للنمذجة اللاحقة.
- تصدير قائمة هذه البروتينات لمزيد من التحقق من الصحة.
ملاحظة: قد يكون للبروتينات ذات قيم MeanDecreaseAccuracy المنخفضة تأثير ضئيل على أداء النموذج إذا تمت إزالتها.
- تسليط الضوء على الأهمية البيولوجية للبروتينات المختارة ، لا سيما تلك المتعلقة بوظائف المناعة أو المسارات المتورطة في اضطراب طيف التوحد.
8. اجمع بين النتائج لاختيار المؤشر الحيوي النهائي.
ملاحظة: تأكد من تثبيت R مع الحزم التالية: pROC و randomForest و ggplot2. تأكد من معالجة مجموعة بيانات البروتينات مسبقا وتطبيعها قبل التحليل. احفظ قوائم المؤشرات الحيوية المرشحة ومخططات التصور كملفات منفصلة للرجوع إليها.
- دمج النتائج.
- قم بالإحالة الترافقية لنتائج تحليل ROC وفحص الغابات العشوائي لتحديد البروتينات المتداخلة.
- إعطاء الأولوية للبروتينات التي تظهر في كلا التحليلين كمؤشرات حيوية مرشحة موثوقة للغاية.
- قم بتنفيذ خطوات التحقق الإضافية ، مثل التحقق المتقاطع من ترك واحد للخارج (LOOCV) ، لتأكيد متانة المؤشرات الحيوية المحددة.
- استخدم نماذج الانحدار اللوجستي لتقييم الدقة التنبؤية لمجموعة المؤشرات الحيوية المدمجة.
- قم بإنشاء منحنيات ROC ومخططات استدعاء دقيقة للمجموعة النهائية من المؤشرات الحيوية باستخدام حزمة ggplot2.
- قم بتضمين مقاييس مثل AUC وقيم الاستدعاء الدقيق لإثبات الإمكانات التشخيصية للمؤشرات الحيوية المختارة.
9. اختيار ميزة ثنائية الاتجاه
- إعداد البيانات وتحديد النموذج.
- قم بتحميل مجموعة البيانات التي تحتوي على قيم تعبير البروتين والتسميات المقابلة (على سبيل المثال ، ASD مقابل التحكم). تأكد من معالجة مجموعة البيانات مسبقا وتطبيعها.
- تحديد النموذج الأولي: استخدم نموذجا خطيا معمما (GLM) مع عائلة ذات حدين للتصنيف.
- استخدم AIC كمقياس للتقييم لمقارنة النماذج أثناء تحديد الميزات.
- قم بإجراء تحديد ميزة إعادة التوجيه.
- ابدأ بنموذج فارغ يحتوي فقط على مصطلح الاعتراض.
- أضف ميزة واحدة في كل مرة بناء على أكبر انخفاض في AIC.
- سجل قيمة AIC بعد كل إضافة. توقف عند عدم ملاحظة أي انخفاض إضافي في AIC.
- قم بإجراء تحديد الميزة السابقة.
- تدريب نموذج باستخدام جميع الميزات المتاحة.
- قم بإزالة ميزة واحدة في كل مرة بناء على أصغر زيادة في AIC.
- سجل قيمة AIC بعد كل إزالة. توقف عند عدم ملاحظة أي انخفاض إضافي في AIC.
- اجمع بين الخطوات الأمامية والخلفية.
- قم بالتبديل بين الاختيار الأمامي والخلفي.
- قم بإجراء جولة واحدة من تحديد الميزة الأمامية، متبوعة على الفور بجولة واحدة من تحديد الميزة للخلف. كرر هذه العملية حتى لا يلاحظ أي تحسينات أخرى في AIC.
- النهج البديل: ابدأ بتحديد الميزة للخلف، ثم قم بإجراء تحديد الميزة للأمام. تقييم تأثير إضافة المعالم التي تمت إزالتها مسبقا مرة أخرى إلى النموذج.
- قم بإنهاء الميزات المحددة.
- تصدير القائمة النهائية للخصائص المختارة والمعاملات المقابلة لها (الشكل التكميلي S1).
10. التحقق المتبادل من اختيار الميزة ثنائية الاتجاه باستخدام الانحدار اللوجستي باستخدام طريقة الإجازة الواحدة
ملاحظة: تأكد من تثبيت R مع الحزم التالية: علامة الإقحام وpROC وggplot2. يجب معالجة مجموعة بيانات البروتينات مسبقا وتطبيعها قبل التحليل. احفظ مصفوفة الارتباك ومنحنى ROC وملخص النموذج كملفات منفصلة للرجوع إليها.
- إعداد البيانات وتحديد النموذج.
- قم بتحميل مجموعة البيانات التي تحتوي على قيم تعبير البروتين والتسميات المقابلة (على سبيل المثال، ASD مقابل التحكم) من ملف GLMSTEP/bothFitModel.txt. تأكد من معالجة مجموعة البيانات مسبقا وتطبيعها.
- تحديد النموذج الأولي باستخدام نموذج خطي معمم (GLM) مع عائلة ذات حدين للتصنيف.
- استخدام الدقة ومعامل كابا كمقاييس تقييم لتقييم أداء النموذج أثناء التحقق المتبادل.
- قم بإجراء التحقق المتقاطع من ترك واحد للخارج.
- قم بتهيئة التحقق المتبادل باستخدام حزمة علامة الإقحام في R لتنفيذ التحقق المتقاطع (LOOCV).
- احتواء نموذج الانحدار اللوجستي باستخدام الميزات الثمانية المحددة.
- سجل الدقة ومعامل كابا لكل تكرار للتحقق المتبادل.
- تحليل نتائج التحقق المتبادل.
- لخص النتائج.
ملاحظة: ستبدو نتائج عملية LOOCV كما هو الحال في هذه الدراسة): نموذج خطي معمم ، 169 عينة ، 8 تنبؤات ، فئتان: "أ" ، "ب" ، إعادة التشكيل: التحقق المتبادل من اترك مرة واحدة ، ملخص أحجام العينات: 168 ، 168 ، 168 ، 168 ، 168 ، 168 ، ... ، نتائج إعادة العينات: الدقة كابا 0.9526627 0.9024531.
- تفسير المقاييس.
ملاحظة: هنا ، حقق النموذج دقة 0.9527 ومعامل كابا 0.9025 ، مما يشير إلى اتفاق ممتاز بين النتائج المتوقعة والملحوظة.
- انظر إلى معامل كابا لقياس القوة التنبؤية للنموذج. يتراوح معامل كابا من -1 إلى 1 ، حيث يشير 0 إلى التنبؤ العشوائي و 1 يشير إلى الاتفاق التام.
ملاحظة: في هذه الدراسة ، تعكس قيمة Kappa البالغة 0.9025 القوة التنبؤية القوية للنموذج.
- تقييم معاملات النموذج.
- فحص معاملات نموذج الانحدار اللوجستي لفهم مساهمة كل ميزة. قم بتقييم الانحراف الفارغ والانحراف المتبقي و AIC لتأكيد ملاءمة النموذج.
ملاحظة: على سبيل المثال ، في هذه الدراسة ، حصلنا على انحراف فارغ: 2.2928e + 02 على 168 درجة من الحرية ، الانحراف المتبقي: 2.2378e-07 على 160 درجة من الحرية ، AIC: 18 ، عدد تكرارات تسجيل فيشر: 25.
- تصور النتائج.
- قم بإنشاء مصفوفة ارتباك لتصور الأداء التنبؤي للنموذج.
- ارسم منحنى خاصية تشغيل جهاز الاستقبال (ROC) لتقييم أداء تصنيف النموذج.
- تفسير النتائج. احسب المساحة تحت المنحنى (AUC) للحصول على مؤشر أداء التصنيف للنموذج.
ملاحظة: يوضح منحنى ROC المفاضلة بين المعدل الإيجابي الحقيقي والمعدل الإيجابي الخاطئ. يجب أن تكون المنطقة الموجودة أسفل المنحنى (AUC) قريبة من 1 ، مما يشير إلى أداء تصنيف ممتاز. يعكس منحنى ROC التغيرات في المعدل الإيجابي الحقيقي والمعدل الإيجابي الخاطئ للنموذج عند عتبات مختلفة. كلما زادت قيمة AUC ، كان أداء النموذج أفضل.