$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تمت الموافقة على هذا التحقيق من قبل مجلس مراجعة الأخلاقيات في المركز الوطني لإحصاءات الصحة (NCHS)، وتم الحصول على موافقة مستنيرة من جميع المشاركين. تم استخدام بيانات NHANES المتاحة للجمهور للامتثال للإرشادات ذات الصلة.
سكان الدراسة
يوفر المسح الوطني للفحص الصحي والتغذية (NHANES)، الذي تجريه NCHS، بيانات تمثيلية وطنية حول الحالة الصحية والتغذوية للسكان غير المؤسسيين في الولايات المتحدة. تم استرجاع بيانات من دورات 2001–2004 و2009–2010. تم استبعاد المشاركين الذين تبلغ أعمارهم ≥18 عاما)، بينما تم استبعاد الأفراد الذين لديهم بيانات مفقودة عن LBP المزمن، أو المغذيات الدقيقة في الغذاء، أو مستوى التعليم، أو المتغيرات الرئيسية — بما في ذلك نسبة الفقر إلى الدخل (PIR)، مؤشر كتلة الجسم (BMI)، حالة التدخين، ارتفاع ضغط الدم، السكري، واستهلاك الكحول. تكونت المجموعة التحليلية النهائية من 8,710 مشاركا (الشكل 1).
تقييم العناصر الغذائية الغذائية
تم الحصول على بيانات تناول الطعام باستخدام مقابلتين استمرت 24 ساعة لاستدعاء النظام الغذائي. أجريت المقابلة الأولى في مركز امتحانات متنقل، والثانية عبر الهاتف خلال عدة أيام. تم تطبيق طريقة التمرير المتعدد الآلي لتحسين دقة الاستدعاء وتقليل تحيز الإبلاغ. تم وصف إجراءات AMPM التفصيلية في وثائق منهجية النظام الغذائي الخاصة ب NHANES.
تقييم LBP المزمن
تم تحديد حالة LBP المزمن باستخدام بيانات الاستبيان. تم تصنيف المشاركين على أنهم يعانون من LBP إذا أبلغوا عن ألم ظهر استمر ≥3 أشهر.
المتغيرات المشتركة
شملت الخصائص الديموغرافية العمر، الجنس، العرق/الإثنية (مكسيكي أمريكي، آخرون من أصل إسباني، غير لاتينيين أبيض، غير لاتينيين أسود، أعراق أخرى)، التعليم (<الصف التاسع، الصف التاسع إلى الحادي عشر)، الدرجة (شهادة ثانوية ثانوية/شهادة GED، بعض شهادات الجامعة/الدبلوم الدبلوم وخريجي الجامعة)، نسبة دخل الأسرة إلى الفقر (PIR)، مؤشر كتلة الجسم (BMI)، حالة التدخين بالإضافة إلى حالة الشرب وتاريخ ارتفاع ضغط الدم والسكري. تم تعريف ارتفاع ضغط الدم بناء على تشخيص الطبيب المبلغ عنه ذاتيا أو الاستخدام الحالي لأدوية مضادات ضغط الدم. تم تعريف السكري باستخدام تشخيص الطبيب المبلغ عنه، أو ارتفاع مستويات الجلوكوز بعد اختبار تحمل الجلوكوز لمدة ساعتين (≥11.1 ملليمول/لتر)، أو الهيموغلوبين السكري ≥6.5٪ أو الجلوكوز الصائم ≥7.0 ملليمول/لتر). تم تعريف ما قبل السكري بأنه أن يخبر الطبيب أنك مرت بما قبل السكري، وتحمل الجلوكوز خلال ساعتين من 7.8–11.1 ملمول/لتر، وجلوكوز صائم بين 6.1–6.9 م.ل/لتر. أو قيمة HbA1c بين 5.7٪ و6.4٪. تم تعريف حالة التدخين بأنها (1) غير محاضر قبل الشهر الأخير، أو الإقلاع لأكثر من عام، و(2) التدخين الحالي (الإبلاغ الذاتي حديث) يعرف بأنه تدخين أكثر من سيجارتين يوميا بعد استعادة العادة أو قبل الإقلاع. فيما يتعلق بحالة الشرب، هناك تعريفان: (1) غير شربين مدى الحياة دون استهلاك سابق للكحول (<12 بالمجموع)، و(2) من يشربون حاليون يبلغون عن شرب ≥12 مرة في السنة، أو شربهم على الأقل ست مرات خلال الاثني عشر شهرا الماضية. تم حساب مؤشر كتلة الجسم كوزن ÷ الطول2.
المعالجة المسبق واختيار الميزات لتعلم الآلة
تم تضمين ما مجموعه 52 متغيرا، بما في ذلك 45 متغيرا مستمرا و7 متغيرا تصنيفيا. تم تنفيذ جميع إجراءات المعالجة المسبقة واختيار الميزات—بما في ذلك إزالة التضاريس المتعددة، وتطبيق SMOTE، واختيار الميزات المعتمدة على بوروتا—حصريا على مجموعة التدريب لمنع تسرب البيانات. لإزالة التعددية التعاونية، تمت إزالة المتغيرات ذات معاملات الارتباط التي تزيد عن 0.9 أولا، ثم المتغيرات ذات القيم التفاعلية الأكبر من 3.
لتحسين عدم توازن الطبقات والتعرف على الفئات الأقلية (أي الأكثر صعوبة)، تم تطبيق تقنية أخذ العينات الزائدة للأقليات الاصطناعية (SMOTE) (الشكل التكميلي 1)، التي تخلق مسافات بين عينات فئات الأقليات، وتحسب الجيران الأقرب k لتلك المسافات، وتولد بيانات تركيبية في اتجاهات عشوائية لموازنة الفئات. ثم تم توحيد جميع المتغيرات المستخدمة.
تم إكمال اختيار الميزات باستخدام بوروتا على الغابات العشوائية، حيث أنتجت ما يسمى "ميزات الظل" و"اختبر" هذه الميزات مقارنة بميزات الإدخال على مدى 500 تكرار. تم الاحتفاظ بمن تم تصنيفهم ك "مؤكدون" لبناء النموذج. للحصول على معلومات مفصلة حول ضبط المعاملات الفائقة، يرجى الرجوع إلى الجدول التكميلي 1.
التحليل الإحصائي
تم إجراء جميع التحليلات وفقا للإرشادات التحليلية لنظام NHANES. تم الإبلاغ عن المتغيرات المستمرة كمتوسط ± انحرافات معيارية (SD)، بينما تم التعبير عن المتغيرات التصنيفية كعدد ونسبة مئوية. تم اختبار الفروق بين المجموعات باستخدام اختبار كاي-تربيع أو اختبارات t للطالب حيثما كان ذلك مناسبا.
لمنع التداخل الزائد، تم تقسيم البيانات عشوائيا إلى مجموعة تدريب7 ومجموعة اختبار. باستخدام MLR3، تم بناء ست خوارزميات تعلم آلي: الغابة العشوائية التي تبني العديد من أشجار القرار وتربط توقعاتها، وتتمتع بقوة تعميم قوية واتساق؛ LightGBM يعتمد على أشجار قرار معززة بالتدرج، والتي تم ضبطها للكفاءة والحجم؛ تقوم K-KNN بفرز العينات بناء على مدى قربها من جيرانها، وعادة ما تحقق K-KNN نتائج أفضل على مجموعات بيانات صغيرة غير خطية؛ بايز الساذج، الذي يمنح بساطة باستخدام مبرهنة بايز و هو قوي؛ SVM التي تمتلك مستويات فائقة مثالية لمهمة التصنيف، حتى للعينات ذات الأبعاد العالية؛ XGBoost هو شكل من أشكال مجموعة تعزيز التدرج التي تتمتع بأداء عالي، حتى مع مجموعات بيانات كبيرة جدا غير مكتملة.
تم تقييم النموذج باستخدام الدقة، وF-beta، والمساحة تحت منحنيات ROC (AUC-ROC)، والحساسية، والنوعية، وAUC-PR. المقياس الرئيسي الذي يستخدمونه هو AUC-ROC، بينما تعطي المقاييس الأخرى رؤى أعمق حول الأداء. يقومون بالتحقق من نماذجهم باستخدام التحقق المتقاطع عشرة أضعاف لضمان الاستقرار. تم تقييم الفروق في أداء نماذجهم باستخدام ANOVA واختبار كروسكال–واليس H.
تم دراسة قابلية تفسير الميزات باستخدام تفسيرات شابلي الإضافية (SHAP) وتفسيرات محلية غير متوافقة مع النموذج (LIME). يستخلص SHAP تقديرات لمساهمة كل ميزة في توقعات النماذج باستخدام قيم شابلي، استنادا إلى نظرية الألعاب التعاونية، لتمثيل التأثيرات الخطية والتفاعلية على حد سواء. يستمد LIME تأثير الميزات من خلال تقريب النماذج المعقدة باستخدام بدائل أبسط وقابلة للتفسير (مثل انحدارات لاسو) للمساعدة في تفسير تأثير الخصائص الفردية. تم إجراء جميع التحليلات في IBM SPSS Statistics الإصدار 24.0 وفي R الإصدار 4.3.0. القيمة p ذات الذيلين < 0.05 تعتبر ذات دلالة إحصائية.