$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
مصدر البيانات وبيان الأخلاقيات
استخدمت هذه الدراسة الاستعادية بيانات من MIMIC-IV (الإصدار 3.1)، وهو قاعدة بيانات صحية للرعاية الحرجة للصحة الطارئة متاحة للجمهور وغير محددة الهوية ومستضافة على PhysioNet. تتضمن قاعدة البيانات معلومات ديموغرافية، وعلامات حيوية، وفحوصات مخبرية، وتشخيصات، وإجراءات، وأدوية.
يتطلب الوصول إلى MIMIC-IV تفويضا معتمدا والالتزام باتفاقية استخدام البيانات ومتطلبات التدريب الخاصة ب PhysioNet. أكمل الباحثون التدريب المطلوب ومنحوا حق الوصول (رقم الشهادة: 68351548). نظرا لأن قاعدة البيانات غير محددة، حللت هذه الدراسة بيانات مجهولة الهوية ولم تتضمن اتصالا مباشرا مع المرضى؛ لذلك، لم يكن مطلوبا الموافقة المستنيرة. يتم توضيح سير عمل النمذجة التنفيذية الكامل خطوة بخطوة في الشكل 1.

الشكل 1. سير العمل العام لنمذجة التنبؤ بمخاطر هشاشة العظام لدى مرضى السكري. التمثيل التخطيطي لخط أنابيب الدراسة، بما في ذلك تحديد المجموعات، واستخراج البيانات، وهندسة الميزات، وقياس المقارنة متعددة النماذج، واختيار النموذج بناء على أداء التحقق، وقابلية التفسير المعتمدة على SHAP للنموذج النهائي. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
دراسة السكان واستخراج البيانات
تم استخراج البيانات من قاعدة بيانات مركز المعلومات الطبية للرعاية المركزة IV (MIMIC-IV) باستخدام أداة إدارة قواعد البيانات. لضمان قابلية التكرار، يتم توفير استعلامات SQL الدقيقة، بما في ذلك أسماء الجداول ومنطق التصفية المستخدم لاسترجاع المجموعات، في الملف التكميلي 1. تم تحديد المرضى البالغين (≥18 سنة) الذين تم تشخيصهم بمرض السكري باستخدام رموز ICD-9 (249، 250) ورموز ICD-10 (E08–E13). تم تعريف النتيجة الأساسية، OP، باستخدام رموز ICD-9 (733.x) ورموز ICD-10 (M80، M81، M82). ضمن المجموعة الأولية المؤهلة لمرضى السكري (n = 46,226)، تم تحديد 3,672 حدثا إيجابيا (مرضى مصابين ب OP) و42,554 حدثا سلبيا (مرضى بدون OPT). يتم عرض مخطط انسيابي مفصل لاختيار المرضى ونزوفهم في الشكل 2.

الشكل 2. مخطط تدفق لاختيار المرضى وبناء المجموعة. يوضح مخطط الانسيابية اشتقاق المجموعة خطوة بخطوة من قاعدة بيانات MIMIC-IV (الإصدار 3.1). تم تحديد المرضى البالغين المصابين بالسكري باستخدام رموز ICD، تلاها استبعاد المرضى في العمر والمرضى في سن ومرض السكري الضابط اللازم؛ 18 سنة، مفقود بيانات حرجة و gt; 30٪، أو سجلات غير صالحة. تم تقسيم المجموعة النهائية إلى OP (الأحداث الإيجابية) وغير OP (الأحداث السلبية). تم معالجة عدم توازن الفئة باستخدام تقليل العينات العشوائية وتطبيق SMOTE على بيانات التدريب قبل تقسيم مجموعات البيانات الطبقية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
هندسة الميزات
لضمان مقارنة عادلة عبر خوارزميات تعلم الآلة، وقابلية إعادة إنتاج دقيقة، تم تطبيق تسلسل مماثل من خطوات المعالجة المسبقة: اختيار الميزات، نقص القيمة، التوسع المستمر للميزات، موازنة الفئات، وتقسيم مجموعات البيانات. القائمة الكاملة لميزات الإدخال، بما في ذلك أسماء المتغيرات والوحدات ومصادر البيانات، مفصلة في الجدول 1.
| الميزات | المجموع (n = 14,688) | مجموعة التدريب (n = 9,546) | مجموعة التحقق (n = 2,204) | مجموعة الاختبار (n = 2,938) | قيمة P |
| الجنس | | | | | 0.345 |
| ذكر | 6222 (42.36%) | 4045 (42.37%) | 935 (42.42%) | 1242 (42.27%) | |
| أنثى | 8466 (57.64%) | 5501 (57.63%) | 1269 (57.58%) | 1696 (57.73%) | |
| العمر | 0.28 (−0.40، 0.94) | 0.28 (−0.43، 0.94) | 0.23 (−0.46، 0.89) | 0.28 (−0.39، 0.95) | 0.1655 |
| خلايا الدم الحمراء | −0.14 (−0.79، 0.49) | −0.13 (−0.79، 0.49) | −0.17 (−0.83، 0.48) | −0.14 (−0.76، 0.49) | 0.3641 |
| هيماتوكريت | −0.14 (−0.81، 0.52) | −0.13 (−0.80، 0.52) | −0.14 (−0.87، 0.51) | −0.16 (−0.81، 0.52) | 0.3709 |
| الهيموغلوبين | −0.12 (−0.79، 0.52) | −0.12 (−0.79، 0.51) | −0.15 (−0.86، 0.53) | −0.13 (−0.78، 0.52) | 0.3616 |
| RDW | −0.16 (−0.59، 0.45) | −0.17 (−0.59، 0.46) | −0.14 (−0.59، 0.45) | −0.17 (−0.60، 0.42) | 0.5803 |
| الفوسفات | −0.14 (−0.60، 0.38) | −0.15 (−0.61، 0.38) | −0.11 (−0.57، 0.38) | −0.13 (−0.56، 0.34) | 0.415 |
| MCV | 0.05 (−0.50، 0.63) | 0.06 (−0.50، 0.65) | 0.03 (−0.49، 0.65) | 0.02 (−0.50، 0.59) | 0.5408 |
| المغنيسيوم | −0.10 (−0.52، 0.37) | −0.10 (−0.52، 0.37) | −0.10 (−0.52، 0.37) | −0.09 (−0.50، 0.37) | 0.7797 |
| خلايا الدم البيضاء | −0.16 (−0.47، 0.21) | −0.16 (−0.47، 0.20) | −0.15 (−0.48، 0.25) | −0.16 (−0.46، 0.20) | 0.6856 |
| أنيون فجوة | −0.12 (−0.64، 0.45) | −0.13 (−0.64، 0.45) | −0.07 (−0.61، 0.48) | −0.13 (−0.64، 0.45) | 0.1217 |
| الكرياتينين | −0.30 (−0.48، 0.01) | −0.30 (−0.48، 0.01) | −0.30 (−0.46، 0.01) | −0.30 (−0.48، −0.00) | 0.3323 |
| MCH | 0.11 (−0.48، 0.62) | 0.12 (−0.48، 0.62) | 0.11 (−0.47، 0.62) | 0.09 (−0.48، 0.61) | 0.5195 |
| عدد الصفائح الدموية | −0.09 (−0.61، 0.49) | −0.09 (−0.61، 0.49) | −0.08 (−0.62، 0.47) | −0.10 (−0.62، 0.48) | 0.9709 |
| MCHC | −0.00 (−0.59، 0.59) | −0.00 (−0.60، 0.59) | −0.00 (−0.57، 0.58) | 0.00 (−0.57، 0.60) | 0.9263 |
| الكلوريد | 0.05 (−0.54، 0.64) | 0.05 (−0.52، 0.65) | 0.03 (−0.59، 0.62) | 0.07 (−0.52، 0.62) | 0.4675 |
| البوتاسيوم | −0.07 (−0.67، 0.53) | −0.09 (−0.67، 0.53) | −0.07 (−0.67، 0.53) | −0.07 (−0.62، 0.53) | 0.3071 |
| الصوديوم | 0.05 (−0.56، 0.60) | 0.05 (−0.55، 0.60) | −0.00 (−0.60، 0.60) | 0.07 (−0.57، 0.61) | 0.3492 |
| نيتروجين اليوريا | −0.28 (−0.60، 0.29) | −0.28 (−0.60، 0.29) | −0.26 (−0.59، 0.31) | −0.28 (−0.59، 0.25) | 0.6826 |
| الكالسيوم الكلي | 0.02 (−0.61، 0.59) | 0.02 (−0.61، 0.59) | −0.01 (−0.59، 0.56) | 0.01 (−0.61، 0.60) | 0.8203 |
الجدول 1. الخصائص الأساسية والميزات الهندسية لمجموعة الدراسة. تعرض المتغيرات الفئوية ك n (٪). تعرض المتغيرات المستمرة كوسيط (نطاق رباعي) للقيم الموحدة. تم حساب قيم P لمقارنة التوزيعات عبر مجموعات التدريب والتحقق والاختبار باستخدام اختبارات إحصائية مناسبة.
تم تجميع المتغيرات المستمرة مع القياسات المتكررة باستخدام المتوسط الحسابي ضمن نافذة المراقبة الكاملة للبقاء في وحدة العناية المركزة للحصول على متجه ميزة واحد لكل مريض. تم استبعاد المتغيرات التي تجاوز معدل الغياب فيها 30٪. بالنسبة للمتغيرات العددية المتبقية، تم احتساب القيم المفقودة باستخدام خوارزمية K-أقرب الجيران (KNN) (n_neighbors = 5، الأوزان = 'موحد'). تم احتساب المتغيرات الفئوية باستخدام الفئة الأكثر شيوعا ثم تحويلها لاحقا باستخدام التعيين الثنائي، حيث تم تعيين أي فئات غير مرئية متجه أصفار.
تم توحيد المتغيرات المستمرة باستخدام صيغة مقياس درجة z (). تمت إزالة الميزات التي تظهر عدم وجود تباين صراحة قبل التحجيم. تم تقدير جميع معلمات المعالجة المسبقة (μ و σ.) بشكل صارم على مجموعة التدريب وطبقت بشكل متسق على مجموعات التحقق والاختبار.
نظرا لعدم التوازن الطبقي الشديد (3,672 مقابل 42,554)، تم تطبيق استراتيجية توازن هجينة حصريا على بيانات التدريب لتجنب تضخيم تقديرات الأداء. أولا، تم استخدام التقليل العشوائي من العينة لتقليل الفئة السلبية في الأغلبية لتحقيق نسبة 1:2 (إيجابية-سالبة) (مما أدى إلى 7,344 عينة سالبة). بعد ذلك، تم تطبيق تقنية أخذ العينات الزائدة للأقليات الاصطناعية (SMOTE) على الفئة الموجبة لتحقيق نسبة متوازنة نهائية 1:1 (7,344 مقابل 7,344)8.
وأخيرا، تم تقسيم المجموعة على مستوى المريض إلى مجموعات تدريب (65٪)، والتحقق (15٪)، ومجموعات اختبار (20٪) باستخدام العينة الطبقية. للسيطرة الصارمة على جميع العمليات العشوائية عبر النسب، الموازنة، والتقسيم، تم فرض بذرة عشوائية عالمية (random_state = 42).
بنية النماذج
لتحديد النموذج التنبؤي الأنسب لمخاطر OP لدى مرضى السكري، تم استخدام إطار قياس واسع النطاق لمقارنة 70 متغيرا في خوارزمية التعلم الآلي تحت بروتوكول تمثيل وتقييم بيانات متطابق. شملت عائلات النماذج المرشحة المصنفات الخطية المنظمة، وأجهزة الدعم المتجهية (SVMs)، وkNN، ومجموعات الأشجار، وبنى تعزيز التدرج، والبيرسبترونات متعددة الطبقات 9,10,11,12,13,14,15,16,17.
بدلا من استخدام البحث الشبكي التقليدي، تم تحسين المعاملات الفائقة من خلال تقييم تكوينات محددة مسبقا وقوية عبر هذه النماذج السبعين في تقسيم التدريب. كان الاختيار يعتمد بشكل صارم على تعظيم المساحة تحت منحنى خاصية تشغيل المستقبل (ROC) (AUC) على مجموعة التحقق. تم تكوين النموذج النهائي الأفضل أداء ب n_estimators = 200، مع بقاء المعلمات الأخرى في الإعدادات الافتراضية لحزمة البرمجيات المدرجة في جدول المواد. تم حساب مقاييس التقييم، بما في ذلك AUC، الدقة، درجة F1، الدقة، والاستدعاء، باستخدام عتبة احتمالية افتراضية 0.5.
لدعم الشفافية السريرية، تم تطبيق SHAP على النموذج المختار باستخدام طريقة TreeExplainer. نظرا للطبيعة القائمة على الشجرة للنموذج النهائي، تم استخدام القيم المتوقعة الدقيقة المعتمدة على مسار الشجرة كتكوين خلفي.