$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
To dochodzenie zostało zatwierdzone przez Radę Etyki Narodowego Centrum Statystyki Zdrowia (NCHS), a wszyscy uczestnicy uzyskali świadomą zgodę. Publicznie dostępne dane NHANES zostały wykorzystane zgodnie z odpowiednimi wytycznymi.
Populacja badawcza
Narodowe Badanie Zdrowia i Żywienia (NHANES), prowadzone przez NCHS, dostarcza reprezentatywnych danych na poziomie krajowym o stanie zdrowia i odżywieniu populacji USA nieinstytucjonalizowanej. Dane z cykli 2001–2004 oraz 2009–2010 zostały pobrane. Uczestniczki w wieku ≥18 lat zostały uwzględnione, natomiast osoby z brakującymi danymi dotyczącymi przewlekłego LBP, mikroelementów diety, poziomu wykształcenia lub kluczowych współwariantów — w tym wskaźnika ubóstwa do dochodów (PIR), wskaźnika masy ciała (BMI), statusu palenia, nadciśnienia, cukrzycy i spożycia alkoholu — zostały wykluczone. Ostatnia kohorta analityczna liczyła 8 710 uczestników (Rysunek 1).
Ocena składników odżywczych w diecie
Dane dotyczące spożycia diety uzyskano podczas dwóch 24-godzinnych wywiadów z przypomnieniem sobie diety. Pierwsza rozmowa odbyła się w Mobilnym Centrum Egzaminacyjnym, a druga telefonicznie w ciągu kilku dni. Zastosowano Automatyczną Metodę Wielokrotnych Przepustek, aby poprawić dokładność przypominania i zminimalizować błędy raportowania. Szczegółowe procedury AMPM opisano w dokumentacji metodologii dietetycznej NHANES.
Ocena przewlekłego LBP
Status przewlekłej LBP został określony na podstawie danych z kwestionariusza. Uczestnicy byli klasyfikowani jako osoby z długą linią brzegu (LBP), jeśli zgłaszali ból pleców trwający ≥3 miesiące.
Kowarianity
Charakterystyka demograficzna obejmowała wiek, płeć, rasę/pochodzenie etniczne (Meksykanie-Amerykanin, Inny Hiszpańczyk, Biali nie-Hiszpańskojęzy, Czarnoskórzy nie-latynosi, Inna rasa), wykształcenie (< 9 klasa, 9–11), stopień (świadectwo ukończenia szkoły średniej/GED, niektóre stopnie wyższe/AA oraz ukończenie studiów), stosunek dochodów rodziny do ubóstwa (PIR), wskaźnik masy ciała (BMI), status palenia, a także status alkoholu oraz historię nadciśnienia i cukrzycy. Nadciśnienie definiowano na podstawie diagnozy zgłaszanej przez lekarza lub obecnego stosowania leków przeciwnadciśnieniowych. Cukrzycę definiowano na podstawie diagnozy zgłaszanej przez lekarza, podwyższonego poziomu glukozy po 2-godzinnym teście tolerancji glukozy (≥11,1 mmol/L) lub hemoglobiny glikowanej ≥6,5% lub glukozy na czczo ≥7,0 mmol/L. Stan przedcukrzycowy definiowano jako informację lekarza o stanie przedcukrzycowym, 2-godzinne wartości tolerancji glukozy OGTT wynoszące 7,8–11,1 mmol/L, Glukoza na czczo 6,1–6,9 mmol/L, czyli wartość HbA1c między 5,7%–6,4%. Status palenia definiowano jako (1) nieaktualny przed ostatnim miesiącem lub rzucenie palenia na ponad rok, oraz (2) palenie obecnie (samoraportujące niedawno) oznacza palenie więcej niż 2 papierosy dziennie po powrocie do nawyku lub przed rzuceniem palenia. Jeśli chodzi o status alkoholu, istnieją dwie definicje: (1) osoby niepijące alkoholu przez całe życie bez wcześniejszego spożycia alkoholu (łącznie <12) oraz (2) obecne osoby pijące, które zgłaszają picie ≥12 razy rocznie lub co najmniej sześć razy w ciągu ostatnich 12 miesięcy. BMI obliczane jako waga ÷ wzrost2.
Wstępne przetwarzanie i selekcja cech w uczeniu maszynowym
Uwzględniono łącznie 52 zmienne, w tym 45 zmiennych ciągłych i 7 kategorycznych. Wszystkie procedury wstępnego przetwarzania i wyboru cech — w tym usuwanie wielokolinearności, aplikacja SMOTE oraz wybór cech opartych na Boruta — były wykonywane wyłącznie na zbiorze treningowym, aby zapobiec wyciekom danych. Aby wyeliminować wielokolinearność, najpierw usunięto zmienne z współczynnikami korelacji powyżej 0,9, a następnie zmienne z VIF większymi niż 3.
Aby poprawić nierównowagę klasową i rozpoznać klasy mniejszościowe (czytaj: trudniejsze), zastosowano Technikę Syntetycznego Nadpróbkowania Mniejszości (SMOTE) (Rysunek Uzupełniający 1), która tworzy odległości między próbkami klas mniejszościowych, oblicza k-najbliższych sąsiadów dla tych odległości oraz generuje syntetyczne dane w losowych kierunkach w celu zrównoważenia klas. Wszystkie użyte zmienne zostały następnie ustandaryzowane.
Wybór funkcji został wykonany za pomocą Boruta na Random Forests, generując tzw. "cechy cieni" i "testując" je w porównaniu z funkcjami wejściowymi w ponad 500 iteracjach. Osoby sklasyfikowane jako "potwierdzone" zostały zatrzymane do budowy modelu. Aby uzyskać szczegółowe informacje na temat strojenia hiperparametrów, prosimy zapoznać się z Tabelą Uzupełniającą 1.
Analiza statystyczna
Wszystkie analizy przeprowadzono zgodnie z wytycznymi analitycznymi NHANES. Zmienne ciągłe podawano jako średnie ± odchylenia standardowe (SD), natomiast zmienne kategoryczne jako liczba i procent. Różnice między grupami testowano za pomocą chi-kwadrat lub testów Studenta t, gdzie było to stosowne.
Aby zapobiec nadmiernemu dostosowaniu, dane były losowo podzielone na zestawtreningowy 7 oraz zestaw testowy. Korzystając z MLR3, zbudowano sześć algorytmów uczenia maszynowego: Random Forest, który konstruuje wiele drzew decyzyjnych i łączy ich przewidywania, oferując silną moc uogólnień i spójność; LightGBM oparty na drzewach decyzyjnym z gradientem boostowanym, które jest dostrojone pod kątem efektywności i skali; K-KNN sortuje próbki według ich bliskości sąsiadów. K-KNN zazwyczaj osiąga lepsze wyniki na małych, nieliniowych zbiorach danych; Naivne Bayesa, które dzięki wykorzystaniu twierdzenia Bayesa zapewnia prostotę i jest odporne; SVM, które posiada idealne hiperpłaszczyzny do zadania klasyfikacji, nawet dla próbek o wysokiej wymiarowości; XGBoost to forma zespołu gradient boosting, która oferuje wysoką wydajność, nawet przy bardzo dużych, niekompletnych zbiorach danych.
Model oceniano na podstawie dokładności, F-beta, powierzchni pod krzywymi ROC (AUC-ROC), czułości, swoistości oraz AUC-PR. Głównym wskaźnikiem jest AUC-ROC, podczas gdy pozostałe wskaźniki dają głębsze wglądy w wydajność. Walidują swoje modele za pomocą dziesięciokrotnej walidacji krzyżowej, aby zapewnić stabilność. Różnice w wydajności ich modeli oceniano za pomocą ANOVA oraz testu Kruskal–Wallis H.
Interpretowalność cech była badana za pomocą SHapley Additive ExPlanations (SHAP) oraz lokalnych interpretowalnych wyjaśnień modelowo-niezależnych (LIME). SHAP wyprowadza szacunki wkładu każdej cechy w prognozy modelu, wykorzystując wartości Shapleya, oparte na teorii gier kooperacyjnych, aby reprezentować zarówno efekty liniowe, jak i interaktywne. LIME wyprowadza wpływ cech poprzez aproksymację złożonych modeli za pomocą prostszych, interpretowalnych zastępstw (np. regresji Lasso), aby pomóc wyjaśnić wpływ poszczególnych cech. Wszystkie analizy zostały przeprowadzone w IBM SPSS Statistics w wersji 24.0 oraz w R wersji 4.3.0. Dwustronna wartość p < 0,05 jest uznawana za istotną statystycznie.