$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu araştırma, Ulusal Sağlık İstatistikleri Merkezi (NCHS) Etik İnceleme Kurulu tarafından onaylanmış ve tüm katılımcılardan bilgilendirilmiş onayı alınmıştır. Kamuya açık NHANES verileri, ilgili yönergelere uygun olarak kullanıldı.
Çalışma nüfusu
NCHS tarafından yürütülen Ulusal Sağlık ve Beslenme Muayene Anketi (NHANES), kurumsal olmayan ABD nüfusunun sağlık ve beslenme durumu hakkında ulusal düzeyde temsil eden veriler sunmaktadır. 2001–2004 ve 2009–2010 döngülerine ait veriler alındı. ≥18 yaşındaki katılımcılar dahil edildi, kronik LBP, diyet mikrobesinleri, eğitim seviyesi veya yoksulluk-gelir oranı (PIR), vücut kitle indeksi (BMI), sigara durumu, hipertansiyon, diyabet ve alkol tüketimi gibi temel kovaryatlar gibi verileri eksik olan bireyler hariç tutuldu. Son analitik kohort 8.710 katılımcıdan oluşuyordu (Şekil 1).
Diyet besinlerinin değerlendirilmesi
Diyet alım verileri, iki 24 saatlik diyet hatırlama mülakatı kullanılarak elde edildi. İlk görüşme bir Mobil Sınav Merkezi'nde yapıldı, ikincisi ise birkaç gün içinde telefonla tamamlandı. Otomatik Çoklu Geçiş Yöntemi, hatırlama doğruluğunu artırmak ve raporlama yanlılığını en aza indirmek için uygulandı. Ayrıntılı AMPM prosedürleri NHANES diyet metodolojisi dokümantasyonunda açıklanmıştır.
Kronik LBP'nin Değerlendirilmesi
Kronik LBP durumu anket verileri kullanılarak belirlendi. Katılımcılar, sırt ağrısı bildirirlerse ≥3 ay sürerse kalp tanesili olarak sınıflandırıldı.
Kovaryantlar
Demografik özellikler arasında yaş, cinsiyet, ırk/etnik köken (Meksikalı Amerikalı, Diğer Hispanik, Hispanik olmayan beyaz, Hispanik olmayan siyah, diğer ırk), eğitim (<9. sınıf, 9–11. sınıf), derece (lise diploması/GED, bazı üniversite/AA derecesi ve üniversite mezunu), aile gelir-yoksulluk oranı (PIR), vücut kitle indeksi (BMI), sigara durumu ve alkol durumu ile hipertansiyon ve diyabet öyküsü yer alıyordu. Hipertansiyon, kendi bildirimindeki doktor tanısı veya mevcut antihipertansif ilaç kullanımı temelinde tanımlandı. Diyabet, kendi bildirilen doktor teşhisi, 2 saatlik glukoz tolerans testinden sonra yükselen glikoz seviyeleri (≥11,1 mmol/L) veya glikize hemoglobin ≥%6,5 veya açlık glikozu ≥7,0 mmol/L kullanılarak tanımlandı. Prediyabet, bir doktor tarafından prediyabet olduğunu, 2 saat OGTT glukoz tolerans değerleri 7,8–11,1 mmol/L, açlık glikozu 6,1–6,9 mmol/L olarak belirtilmesiyle tanımlandı. veya %5,7–%6,4 arasında HbA1c değeri var. Sigara içmenin durumu (1) Son aydan önce güncel olmayan veya bir yıldan fazla süreyle bırakma ve (2) şu anda (son zamanlarda kendi kendine bildirdiğim) sigara kullanımı, alışkanlığı yeniden kazandıktan sonra veya bırakmadan önce günde 2'den fazla sigara içmek olarak tanımlanmıştır. İçki durumu açısından iki tanım vardır: (1) ömür boyu alkol içmeyenler, önceden alkol tüketmemiş olanlar (toplamda <12) ve (2) ≥yılda 12 kez veya son 12 ayda en az altı kez içtiklerini bildiren mevcut alkol içenler. BMI, ağırlık ÷ boy2 olarak hesaplandı.
Makine öğrenimi için özellik ön işleme ve seçimi
Toplam 52 değişken dahil edildi; bunların arasında 45 sürekli ve 7 kategorik değişken bulundu. Tüm ön işleme ve özellik seçimi prosedürleri—çoklu kollinearlığın kaldırılması, SMOTE uygulaması ve Boruta tabanlı özellik seçimi dahil—veri sızıntısını önlemek için yalnızca eğitim setinde gerçekleştirildi. Çok kollineerliği ortadan kaldırmak için, önce 0.9'dan büyük korelasyon katsayısına sahip değişkenler, ardından VIF'leri 3'ten büyük olan değişkenler çıkarıldı.
Sınıf dengesizliğini ve azınlık (yani daha zor) sınıfların tanınmasını iyileştirmek için, Sentetik Azınlık Aşırı Örnekleme Tekniği (SMOTE) uygulandı (Ek Şekil 1); bu teknik, azınlık sınıfı örnekleri arasında mesafeler oluşturur, bu mesafeler için k-en yakın komşuları hesaplar ve sınıfları dengelemek için rastgele yönlerde sentetik veri üretir. Kullanılan tüm değişkenler daha sonra standartlaştırıldı.
Özellik seçimi, Boruta ile Random Forests üzerinde tamamlandı; sözde "gölge özellikler" oluşturuldu ve bunları giriş özellikleriyle karşılaştırmak için 500 üzerinden "test edildi". "Onaylandı" olarak sınıflandırılanlar modeli inşa etmek üzere tutuldu. Hiperparametre ayarlaması hakkında ayrıntılı bilgi için lütfen Ek Tablo 1'e bakınız.
İstatistiksel analiz
Tüm analizler NHANES analitik yönergelerine uygun olarak gerçekleştirildi. Sürekli değişkenler ortalama ± standart sapmalar (SD) olarak bildirilirken, kategorik değişkenler sayım ve yüzde olarak ifade edildi. Gruplar arası farklar, uygun olduğunda ki-kare veya Öğrenci t-testleri kullanılarak test edildi.
Aşırı uyumu önlemek için veriler rastgele olarak bir eğitimseti 7 ve bir test seti olarak bölündü. MLR3 kullanılarak altı makine öğrenimi algoritması oluşturuldu: Random Forest, birçok karar ağacı oluşturup tahminlerini birleştirir, güçlü genelleme gücü ve tutarlılığa sahiptir; Verimlilik ve ölçek için ayarlanmış, gradyan destekli karar ağaçlarına dayalı LightGBM; K-KNN örnekleri komşularına ne kadar yakın olduklarına göre sıralar; K-KNN genellikle küçük doğrusal olmayan veri setlerinde daha iyi sonuçlar verir; Bayes teoremini kullanarak basitlik sağlayan ve sağlam olan Naive Bayes; yüksek boyutlu örnekler için bile sınıflandırma görevi için ideal hiper düzlemlere sahip SVM; XGBoost, çok büyük eksik veri setlerine rağmen yüksek performansa sahip bir gradyan güçlendirme topluluğudur.
Model, doğruluk, F-beta, ROC eğrilerinin altındaki alan (AUC-ROC), hassasiyet, özgülük ve AUC-PR kullanılarak değerlendirildi. Kullandıkları ana metrik AUC-ROC, diğer metrikler ise performansa dair daha derin içgörüler sağlar. Modellerini, istikrar sağlamak için on kat çapraz doğrulama ile doğrularlar. Modellerinin performansındaki farklılıklar ANOVA ve Kruskal–Wallis H testi kullanılarak değerlendirildi.
Özellik yorumlanabilirliği, SHapley Ekleyici Açıklamaları (SHAP) ve Yerel Yorumlanabilir Model-Agnostik Açıklamalar (LIME) kullanılarak araştırıldı. SHAP, her özelliğin model tahminlerine katkısını Shapley değerleri kullanılarak, kooperatif oyun teorisine dayanarak hem doğrusal hem de etkileşimli etkileri temsil eder. LIME, bireysel özellik etkisini açıklamaya yardımcı olmak için karmaşık modelleri daha basit ve yorumlanabilir vekillerle (örneğin, Lasso regresyonları) yaklaştırarak özellik etkisini türetir. Tüm analizler IBM SPSS Statistics sürüm 24.0 ve R sürüm 4.3.0'da gerçekleştirildi. İki kuyruklu p-değeri < 0.05 istatistiksel olarak anlamlı kabul edilir.