مصدر البيانات
كانت هذه الدراسة تحليلا بأثر رجعي استنادا إلى قاعدة بيانات Medical Information Mart for Intensive Care IV (MIMIC-IV، الإصدار 3.1)، وهي قاعدة بيانات للرعاية الحرجة متاحة للجمهور مستضافة على PhysioNet (https://physionet.org/content/mimiciv/3.1/). تم تطوير قاعدة البيانات من خلال تعاون بين مختبر معهد ماساتشوستس للتكنولوجيا للفسيولوجيا الحاسوبية، ومركز بيث إسرائيل ديكونيس الطبي، وشركة فيليبس، وتحتوي على بيانات سريرية شاملة غير محددة الهوية، بما في ذلك المعلومات الديموغرافية، والعلامات الحيوية، والقياسات المختبرية، وسجلات الأدوية.
جميع بيانات المرضى في MIMIC-IV غير محددة بالكامل وفقا لقانون قابلية نقل ومساءلة التأمين الصحي (HIPAA)، ولذلك لم تتطلب هذه الدراسة موافقة مجلس مراجعة المؤسسات (IRB). يتم تنظيم استخدام قاعدة البيانات بموجب اتفاقية استخدام البيانات (DUA)، ويمنح الوصول فقط للمستخدمين المصرح لهم الذين أكملوا التدريب والشهادات المطلوبة. أكمل المؤلفون التدريب اللازم وحصلوا على بيانات الوصول (مستخدم معتمد من PhysioNet) وأجروا هذه الدراسة وفقا لجميع لوائح استخدام البيانات ذات الصلة.
دراسة السكان واستخراج البيانات
تم تحديد المرضى البالغين (≥18 سنة) الذين خضعوا لإجراءات جراحة الأعصاب في العمود الفقري من قاعدة بيانات MIMIC-IV باستخدام رموز ICD المتعلقة بالإجراءات. تم تعريف إجراءات جراحة الأعصاب في العمود الفقري بأنها رموز ICD-9 تبدأ ب 03 (عمليات على الحبل الشوكي والقناة الشوكية) ورموز ICD-10 تبدأ ب 00B، 00H، 00J، 00N، 00P، 00Q، 00R، 00S، 00T، أو 00U (الإجراءات المتعلقة بالحبل الشوكي). بالنسبة للمرضى الذين تم دخولهم عدة مستشفيات، تم الاحتفاظ فقط بالدخول الأول الذي يحتوي على إجراء مؤهل لتجنب تكرار القياسات من نفس الشخص.
تم تعريف متغير النتيجة، هشاشة العظام، بناء على رموز ICD-9 التي تبدأ ب 733 ورموز ICD-10 التي تبدأ ب M80 أو M81 أو M82 المسجلة أثناء قبول المؤشر. نظرا لأن كل من المتنبئين والنتيجة اشتقاقا من نفس حالة الاستشفاء، تم تأطير المهمة التحليلية في هذه الدراسة كتصنيف داخل المستشفى بدلا من التنبؤ المستقبلي بالمخاطر.
استوفى ما مجموعه 10,803 مريض معايير الإدراج. بعد التقسيم الطبقي، تم تقسيم مجموعة البيانات إلى مجموعة تدريب (n = 7,561)، ومجموعة تحقق (n = 1,621)، ومجموعة اختبار (n = 1,621). كان توزيع الفئة غير متوازن للغاية عبر جميع التقسيمات. في مجموعة التدريب، كان 499 مريضا (6.60٪) إيجابيين لهشاشة العظام و7,062 (93.40٪) سلبيين لهشاشة العظام. في مجموعة التحقق، كان 107 مرضى (6.60٪) إيجابيين و1,514 (93.40٪) سلبيين. أظهرت مجموعة الاختبارات نفس التوزيعة، حيث كان 107 حالة إيجابية (6.60٪) و1,514 حالة سلبية (93.40٪) فقط.
تم استخراج البيانات السريرية باستخدام برنامج إدارة قواعد البيانات العلائقية من MIMIC-IV. شملت المتغيرات المستخرجة الخصائص الديموغرافية (مثل العمر والجنس)، والقياسات المخبرية، والعلامات الحيوية، وسجلات الأدوية. لكل مريض، تم استخدام بيانات من القبول في المؤشر لبناء الميزات اللاحقة.
لضمان صحة تقييم النماذج، تم تقسيم مجموعة البيانات أولا إلى مجموعات تدريب، وتحقق من الصحة، ومجموعات اختبار باستخدام أخذ عينات طبقية (70٪، 15٪، و15٪)3,7. جميع خطوات المعالجة المسبقة اللاحقة التي قد تسبب تحيزا، بما في ذلك اختيار الميزات وإعادة أخذ العينات، تم تنفيذها حصريا داخل مجموعة التدريب. تم معالجة اختلال التوازن الطبقي في مجموعة التدريب باستخدام مزيج من تقليل العينات من فئة الأغلبية وتقنية العينة الزائدة للأقلية الاصطناعية (SMOTE)، بينما احتفظت مجموعات التحقق والاختبار بتوزيع الفئات الأصلي ليعكس الانتشار في العالم الحقيقي.
هندسة الميزات
تم تنفيذ خط معالجة هندسة ميزات متعدد المراحل لتعزيز أداء النموذج مع الحفاظ على قابلية التفسير. لكل مريض، تم تجميع سجلات الدواء، والمختبر، وسجلات العلامات الحيوية من دخول المؤشر في ميزات على مستوى الملخص (مثل القيم المتوسطة للقياسات المتكررة ومتوسط التعرض للأدوية).
لتقليل تنوع الميزات، تم استبعاد مجموعات الميزات المرشحة التي تتجاوز 30٪ من القيم المفقودة. لتجنب تسرب البيانات، تم تنفيذ هذه الخطوة فقط باستخدام مجموعة التدريب، ثم تم تطبيق نفس مجموعة الميزات على مجموعات التحقق والاختبار.
لاحقا، تم إجراء فحص الميزات أحادية المتغير على مستوى مجموعة السمات باستخدام اختبار مان–ويتني U لمقارنة التوزيعات بين المرضى الإيجابيين لهشاشة العظام والمرضى السلبيين لهشاشة العظام. تم تصنيف مجموعات الميزات بناء على الدلالة الإحصائية، وتم الاحتفاظ بالمجموعات العليا (k = 20) للنمذجة اللاحقة. كما تم تنفيذ هذه العملية الانتخابية حصريا ضمن مجموعة التدريب لمنع تسرب المعلومات.
نظرا لدرجة الغياب العالية نسبيا عبر مجموعات الميزات المرشحة، كان الدور الأساسي لهذه الخطوة في اختيار الأعلى هو تصفية الميزات ذات الإشارات الإحصائية الضعيفة بدلا من تحسين أبعاد الميزات بشكل صارم. في الواقع، لم يكن أداء النموذج حساسا جدا للقيمة الدقيقة ل k ضمن نطاق معقول، مما يشير إلى أن هذه الخطوة كانت في الأساس إجراء فحص موجه نحو المتانة لاستبعاد الميزات منخفضة المعلومات مع الحفاظ على الإشارات ذات الصلة سريريا.
تم الاحتفاظ بالميزات الديموغرافية الأساسية في جميع الطرازات. تم احتساب القيم المفقودة في هذه المتغيرات الديموغرافية باستخدام القيمة المتوسطة المحسوبة من مجموعة التدريب. تم اختيار المتوسط لبساطته وثباته في هذه المجموعة الكبيرة، رغم أنه قد يقلل من التباين ويدخل التحيز؛ هذا القيود معترف بها.
بالنسبة لميزات الأدوية المختارة والإشارات الحيوية المختارة، تم ترميز غياب قياس أو تعرض مسجل كصفر لتمكين إدخال رقمي متسق لتدريب النماذج. نعترف بأن هذا النهج قد يخلط بين القيم الصفرية الحقيقية والاختفاء أو عدم التعرض، خاصة للمتغيرات التي لا يكون فيها الصفر ذا معنى فسيولوجي. ومع ذلك، تم تطبيق هذه الاستراتيجية بشكل متسق عبر جميع العينات، تلتها توحيد درجة Z، التي تقلل من التشويه المرتبط بالمقياس. يناقش التأثير المحتمل لهذا الافتراض كقيد.
تم توحيد جميع الميزات العددية باستخدام تطبيع درجة Z بناء على المتوسط والانحراف المعياري المقدرة من مجموعة التدريب:
z = (x — μ)/σ
حيث يمثل x القيمة الخامية للميزة، ويشير μ و σ إلى المتوسط والانحراف المعياري المحسوبين من مجموعة التدريب. تم ترميز المتغيرات الفطرية رقميا لتلبية متطلبات الإدخال لنماذج التعلم العميق.
مكنت هذه الاستراتيجية الهندسية من تقليل الأبعاد بشكل منهجي مع الحفاظ على المجالات ذات الصلة سريريا، بما في ذلك الديموغرافيا، وظائف الكلى، مؤشرات الدم، العلامات الالتهابية، والمعلمات الأيضية. يتم عرض الخصائص الأساسية التفصيلية لمجموعة الدراسة عبر مجموعات التدريب والتحقق والاختبار في الجدول 1.
| الميزات | المجموع | مجموعة التدريب | مجموعة التحقق | مجموعة الاختبار | قيمة P |
| (n=5238) | (n=1996) | (n=1621) | (n=1621) |
| الجنس | | <0.001 |
| ذكر | 2477 (47.29%) | 834 (41.78%) | 797 (49.17%) | 846 (52.19%) | |
| أنثى | 2761 (52.71%) | 1162 (58.22%) | 824 (50.83%) | 775 (47.81%) | |
| العمر | 60.69 (48.29, 70.61) | 63.45 (52.00, 72.41) | 58.00 (46.00, 69.00) | 60.00 (46.00, 70.00) | <0.001 |
| الارتفاع | 165.23 (160.79, 171.21) | 164.25(161.41, 172.23) | 166.32 (161.85, 171.22) | 165.22 (161.31, 169.89) | <0.001 |
| الوزن | 72.01 (56.77, 82.46) | 75.45 (63.22, 81.45) | 70.55 (60.22, 79.33) | 73.62 (65.22, 81.88) | <0.001 |
| سينا | 1.00 (-0.73, 8.60) | 1.00 (-0.30, 8.60) | 1.00 (-1.00, 8.60) | 1.00 (-1.00, 8.60) | <0.001 |
| دوكوزيت الصوديوم | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 0.001 |
| هيبارين | 5000.00 (1655.28, 5000.00) | 5000.00 (-1.00, 5000.00) | 5000.00 (1600.00, 5000.00) | 5000.00 (3750.00, 5000.00) | 0.292 |
| كلوريد الصوديوم 0.9٪ تدفق | 3.00 (1.76, 3.00) | 3.00 (3.00, 3.00) | 3.00 (-1.00, 3.00) | 3.00 (3.00, 3.00) | <0.001 |
| خلايا الدم الحمراء | 3.96 (3.51, 4.35) | 3.90 (3.49, 4.28) | 4.02 (3.53, 4.40) | 3.97 (3.50, 4.38) | <0.001 |
| الهيموغلوبين | 11.81 (10.51, 13.02) | 11.66 (10.47, 12.82) | 11.91 (10.58, 13.14) | 11.90 (10.49, 13.15) | <0.001 |
| RDW | 13.98 (13.22, 15.15) | 14.12 (13.35, 15.24) | 13.90 (13.10, 15.06) | 13.90 (13.18, 15.13) | <0.001 |
| هيماتوكريت | 35.67 (31.95, 39.00) | 35.32 (31.63, 38.50) | 36.00 (32.28, 39.37) | 35.77 (32.01, 39.25) | <0.001 |
| الجاذبية النوعية | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | <0.001 |
| البيكربونات | 25.72 (24.04, 27.15) | 25.86 (24.17, 27.27) | 25.65 (23.92, 27.03) | 25.62 (24.00, 27.12) | <0.001 |
| العدلات | 68.67 (60.52, 76.23) | 69.41 (61.90, 76.52) | 68.10 (59.60, 75.88) | 68.34 (59.75, 76.23) | <0.001 |
| الكرياتينين | 0.82 (0.68, 1.02) | 0.81 (0.68, 1.00) | 0.83 (0.69, 1.02) | 0.83 (0.68, 1.03) | <0.001 |
| الفوسفات | 3.29 (2.92, 3.64) | 3.27 (2.93, 3.57) | 3.30 (2.93, 3.69) | 3.30 (2.90, 3.65) | 0.002 |
| نيتروجين اليوريا | 15.43 (12.08, 20.18) | 15.74 (12.50, 20.20) | 15.00 (11.64, 19.89) | 15.48 (12.00, 20.43) | <0.001 |
| الخلايا اللمفاوية | 19.12 (12.22, 26.15) | 18.81 (12.49, 25.30) | 19.36 (12.40, 27.07) | 19.24 (11.72, 26.27) | 0.001 |
| ألانين أمينوترانسفيراز (ALT) | 20.49 (10.84, 32.82) | 20.47 (11.67, 32.06) | 20.00 (10.00, 32.93) | 21.00 (10.67, 33.67) | 0.3283 |
| MCV | 90.90 (87.50, 94.32) | 91.03 (87.64, 94.51) | 90.64 (87.43, 94.00) | 91.00 (87.40, 94.40) | <0.001 |
| MCHC | 33.14 (32.37, 33.92) | 33.11 (32.37, 33.88) | 33.16 (32.38, 33.97) | 33.16 (32.35, 33.93) | <0.001 |
| البازوفيلز | 0.42 (0.27, 0.61) | 0.41 (0.27, 0.59) | 0.45 (0.29, 0.63) | 0.41 (0.26, 0.60) | 0.037 |
الجدول 1. الخصائص الأساسية لفئة الدراسة تم تصنيفها حسب التدريب، والتحقق، والاختبار.
بنية النماذج
لنمذجة العلاقات المعقدة بين الميزات السريرية الجدولية غير المتجانسة، استخدمنا بنية قائمة على TabTransformer تم تنفيذها باستخدام إطار عمل PyTorch6. تم تصميم النموذج لمعالجة المتغيرات التصنيفية والعددية والتقاط التفاعلات السياقية بين الميزات من خلال آلية الانتباه الذاتي.
تمثيل المدخلات
تم تحويل المتغيرات الفئوية أولا إلى تضمينات كثيفة. تم تعيين كل ميزة تصنيفية إلى متجه تضمين ذو بعد d(embedding_dim = 256). تم توحيد الميزات العددية باستخدام تطبيع درجة Z ثم إسقاطها في نفس فضاء التضمين عبر طبقة تحويل خطية، مما أتاح المعالجة المشتركة مع الميزات التصنيفية.
تم دمج متجهات الميزات المدمجة لتشكيل تسلسل من الرموز:
X = [x1,x 2,... xn]
حيث يمثل كل xi ∈ Rd ميزة مدمجة.
مشفر المحول
تم تمرير التضمينات المتسلسلة عبر مجموعة من طبقات ترميز المحولات (num_layers = 3). تكونت كل طبقة من تركيز ذاتي متعدد الرؤوس تليها شبكة تغذية متقدمة حسب الموضع.
تعرف آلية الانتباه الذاتي متعددة الرؤوس بأنها:
—> الانتباه(Q,K,V) = سوفتماكس
V
حيث تشير Q وK وV إلى مصفوفات الاستعلام، والمفاتيح، والقيمة. تم استخدام رؤوس انتباه متعددة (num_heads = 8) لالتقاط تفاعلات الميزات المتنوعة.
كل كتلة محول تضمنت انتباها ذاتيا متعدد الرؤوس، واتصالا متبقيا وتطبيع الطبقة، وشبكة تغذية مقدمة، وانقطاع (معدل = 0.243).
تجميع وتصنيف الميزات
تم تسطيح مخرج طبقة المحول النهائية وتمريره عبر بيرسيبترون متعدد الطبقات (MLP) للتصنيف. تكون MLP من طبقة أو أكثر متصلة بالكامل مع دوال تنشيط غير خطية.
استخدمت الطبقة النهائية الإنتاجية دالة تنشيط السيجمويد لإنتاج الاحتمال المتوقع لهشاشة العظام:
—>
= σ(z)
حيث z هو مخرج اللوجيت.
وظيفة الخسارة واستراتيجية التدريب
تم تدريب النموذج باستخدام فقدان الإنتروبيا الثنائية المتقاطعة:
—> L = −(1/N) Σ [ yi log(ŷi) + (1 − yi) log(1 − ŷi) ]
حيثy i يرمز إلى التسمية الحقيقية وi
هو الاحتمالية المتوقعة.
تم تحسين النموذج باستخدام محسن آدم (معدل التعلم = 1.9e-4، حجم الدفعة = 64) لمدة 100 عصر. تم تطبيق التوقف المبكر بناء على أداء التحقق (الصبر = 15) لمنع الإفراط في التوافق. لدعم قابلية التكرار، تم تنفيذ جميع الإجراءات التجريبية باستخدام بذرة عشوائية ثابتة (البذرة = 42).
قابلية تفسير النموذج
لتعزيز قابلية التفسير، تم تطبيق إبراز شابلي الإضافي (SHAP) على النموذج المدرب. تم حساب قيم SHAP على مجموعة الاختبار لقياس مساهمة كل ميزة في النتيجة المتوقعة، مما يمكن من تفسير سلوك النموذج على المستوى العام والفردي.
كما هو موضح في الشكل 1، يلخص سير العمل العملية من معالجة بيانات MIMIC-IV إلى بناء وتصنيف النموذج. تلتقط بنية TabTransformer التفاعلات بين الميزات الجدولية غير المتجانسة من خلال الانتباه الذاتي، بينما يوفر التصور المعتمد على SHAP رؤى قابلة للتفسير حول مساهمات الميزات. يتيح هذا الإطار تحليلا داخليا مثبتا لأنماط هشاشة العظام في مجموعة جراحة الأعصاب الشوكية غير المتجانسة.

الشكل 1. ادرس سير العمل وهندسة النماذج. يوضح هذا الشكل التصميم العام للدراسة، بما في ذلك اختيار المجموعات، والمعالجة المسبقة للبيانات، وهندسة الميزات، وتقسيم مجموعات البيانات، وتطوير النماذج. كما يلخص بنية TabTransformer المستخدمة في التصنيف، بما في ذلك تضمين الميزات، وطبقات ترميز المحولات، ومخرجات التصنيف النهائي. تم تضمين أول قبول مؤهل لكل مريض فقط. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.