Artykuł badawczy

Przewidywanie przewlekłego bólu dolnej części pleców na podstawie pierwiastków śladowych w diecie z wykorzystaniem wielu modeli uczenia maszynowego oraz ram podwójnej interpretowalności

DOI:

10.3791/70624

26 maja 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie to bada związki między pierwiastkami śladowymi w diecie a przewlekłym bólem dolnej części pleców, wykorzystując dane NHANES. Interpretowalne modele uczenia maszynowego są stosowane do oceny predykcyjnej wydajności i identyfikacji składników odżywczych związanych ze zmniejszonym ryzykiem, dostarczając wglądu w potencjalne czynniki żywieniowe związane z bólem dolnej części pleców.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Związek między pierwiastkami śladowymi w diecie a ryzykiem przewlekłego bólu dolnej części pleców (LBP) pozostaje niejasny. Dane z cykli National Health and Nutrition Examination Survey (NHANES) z lat 2001–2004 oraz 2009–2010 zostały przeanalizowane. Multikolinearyczność oceniano za pomocą współczynników korelacji i wariancji inflacji (VIF) Spearmana, a wybór cech za pomocą algorytmu Boruty. Następnie opracowano sześć modeli uczenia maszynowego, w których zastosowano SHAP i LIME w celu zwiększenia interpretowalności i identyfikacji kluczowych powiązań między pierwiastkami śladowymi w diecie a ryzykiem LBP. Spośród ocenianych modeli Random Forest wykazał najlepsze wyniki predykcyjne, zarówno przy uwzględnianiu zmiennych demograficznych, jak i przy użyciu wyłącznie elementów śladowych w diecie. Analizy interpretowalności konsekwentnie wskazywały kilka składników diety—w tym wilgoć, teobrominę, wapń, kofeinę, sód i witaminę C—jako odwrotnie powiązane z ryzykiem LBP. Chociaż dyskryminacja modelu była umiarkowana (AUC ≈ 0,60–0,72), te wyniki ujawniają klinicznie istotne wzorce, które mogą wspierać stratyfikację ryzyka na poziomie populacji i podkreślają potencjalnie modyfikowalne czynniki dietetyczne do przyszłych badań.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przewlekły ból dolnej części pleców (LBP) jest jednym z najczęstszych zaburzeń układu mięśniowo-szkieletowego na świecie i wiąże się ze znacznymi kosztami społeczno-ekonomicznymi związanymi z niepełnosprawnością, opieką zdrowotną oraz utratą jakości życia. Dane epidemiologiczne wskazują, że 7–10% dorosłych zgłasza LBP na całym świecie, a całkowita częstość występowania czasami sięga 84%1. Najczęściej występuje w krajach o niskich i średnich dochodach, gdzie czynniki związane z pracą, słaby dostęp do usług zdrowotnych oraz nierówności społeczno-ekonomiczne zwiększają ryzyko, a częstość występowania przekracza 20% wśród dorosłych w wieku produkcyjnym2. Szczególnie nastolatki i osoby starsze są bardziej narażone na zmiany strukturalne i zwyrodnieniowe, takie jak zwyrodnienie dysku międzykręgowego i osteoporoza3.

LBP to choroba wieloczynnikowa, na którą wpływają czynniki biomechaniczne, psychospołeczne, genetyczne i żywieniowe, co wymaga stosowania metod analitycznych zdolnych jednocześnie uchwycić złożone interakcje między tymi różnorodnymi zmiennymi. Najnowsze przeglądy systematyczne nadal podkreślają, że etiologia LBP pozostaje zagadkowa, pod wpływem czynników biomechanicznych, psychospołecznych i genetycznych, dlatego trudno ją precyzyjnie określić. Ponad 85% przypadków "LBP" jest niespecyficznych – co utrudnia rozwój celowanej profilaktyki i leczenia 4,5. Chociaż terapie multimodalne obejmujące połączenie metod fizycznych i farmakologicznych zwykle przynoszą ulgę objawową, wielu pacjentów nadal występuje na stałe – co wskazuje na pilną potrzebę pojawienia się nowych, możliwych do uniknięcia i modyfikowalnych czynników ryzyka LBP6.

Tradycyjne metody statystyczne są ograniczone w radzeniu sobie z tą złożonością, ponieważ często opierają się na liniowych założeniach i nie są w stanie odpowiednio modelować interakcji wysokowymiarowych oraz nieliniowych relacji wpisanych w dane wieloczynnikowe, takie jak profile żywieniowe NHANES. Natomiast podejścia do uczenia maszynowego oferują wyższą użyteczność, obsługując jednocześnie dużą liczbę zmiennych, wykrywając subtelne wzorce i interakcje oraz dostarczając solidnych prognoz dla chorób takich jak LBP, gdzie wiele czynników się łączy.

Mikroelementy diety, w tym witaminy, minerały i pierwiastki śladowe, są niezbędne dla równowagi fizjologicznej i pomagają zmniejszyć ryzyko chorób przewlekłych. Witaminy przeciwutleniacze E (α-tokoferol) i C zmniejszają uszkodzenia oksydacyjne występujące w chorobach sercowo-naczyniowych i neurodegeneracyjnych 7,8. Witaminy z grupy B, takie jak tiamina (witamina B1), pirydoksyna (witamina B6), folian i kobalamina (witamina B12), również są immunoregulacyjne i ułatwiają metabolizm energii komórkowej; niedobory tych objawów zostały powiązane z rakiem, niepłodnością i pogorszonym nastrojem 9,10,11. Minerały, szczególnie magnez, cynk, miedź i selen, uczestniczą w enzymatycznych i przeciwzapalnych szlakach zapobiegających sarkopenii, endometriozie oraz pooperacyjnemu wydzielaniu odżywczym po operacji bariatrycznej12. Przeglądy narracyjne podkreślają ich znaczenie w zapobieganiu współistniejącym chorobom i chorobom skóry związanym z otyłością, takim jak łojotokowe zapalenie skóry i łysienie areata, poprzez modulację lipidów i funkcje immunologiczne13,14. Ogólnie jest to sygnał, że najlepszym podejściem do zdrowia społeczności może być odpowiednie spożycie mikroskładników, choć badania interwencyjne w dużej mierze pokazują zróżnicowane wyniki oparte na czynnikach kontekstowych15,16.

Ponadto aplikacje uczenia maszynowego wykorzystujące dane żywieniowe wykazały skuteczność w wyjaśnianiu czynników ryzyka innych chorób układu mięśniowo-szkieletowego, takich jak przewidywanie ryzyka artretyzmu na podstawie danychankietowych 17 oraz identyfikacja czynników ze względu na styl życia (w tym dieteczny) przyczyniających się do LBP i pokrewnych schorzeń w kohortach populacyjnych18.

Pomimo wielu powiązań między mikroskładnikami a chorobami przewlekłymi, związek między mikroskładnikami w żywności a ryzykiem LBP pozostaje słabo zdefiniowany, a mechanizmy działania są niepewne. Chociaż badania obserwacyjne często zgłaszają niedobory witaminy D, magnezu i przeciwutleniaczy u osób z LBP, metaanalizy badań suplementacyjnych — szczególnie tych z udziałem witaminy D — przyniosły ograniczone i niespójne dowody na łagodzenie bólu19,20.

Systematyczne badanie istniejącej literatury ujawnia kluczowe ograniczenia: poleganie na projektach przekrojowych i przypadków-kontrolnych, które nie mogą ustalić przyczynowości21; niewystarczająca kontrola czynników zakłócających, w tym demografii, stylu życia i współistniejącychchorób 20,22; małe i niereprezentatywne próby; zmienne definicje statusu mikroskładników i wyników leczenia bólu; oraz skupienie na izolowanych składnikach odżywczych bez uwzględniania synergii dietetycznych czy antagonizmów23. Te niedociągnięcia utrudniły opracowanie jasnych, praktycznych wniosków dotyczących modulacji odżywczej LBP.

Dla bardziej wyraźnej struktury hipotezy proponuje się, że mikroelementy wywierają ochronne działanie przeciwko LBP poprzez trójkąt mechanizystycznie powiązanych szlaków: działanie antyoksydacyjne i przeciwzapalne, które łagodzą stres oksydacyjny i neurozapalne (witaminy C, E, selen, cynk, magnez); wsparcie dla naprawy nerwowej i łagodzenia uszkodzeń wywołanych homocysteiną (witaminy kompleksu B); oraz wzmocnienie homeostazy kości i mięśni poprzez sygnalizację mineralną oraz regulację wapnia podsycaną witaminą D (witamina D, magnez, wapń). Takie ramy podkreślają dwukierunkową interakcję między statusem mikroskładników, stanem zapalnym ogólnoustrojowym a przewlekłością bólu, co potwierdzają powiązania z dietami prozapalnymi24.

Badania przekrojowe wskazują, że prozapalne diety pozbawione mikroskładników powodują większy poziom bólu brzucha lub przewlekłego, co sugeruje dwukierunkowe powiązanie, w którym brak mikroskładników nasila stany zapalnei ból ogólnoustrojowy.

Aby rozwiązać te problemy, opracowano wiele modeli ML, które zawierają szeroki wachlarz dietetycznych mikroskładników (witaminy (E, A, B1, B6, B12, C, K), minerały (wapń, magnez, żelazo, cynk, miedź, selen) oraz inne składniki diety, w tym błonnik, wielonienasycone kwasy tłuszczowe, potas i kofeina) z danymi NHANES do przewidywania ryzyka LBP. Ta strategia oparta na ML jest szczególnie odpowiednia dla wieloczynnikowego charakteru LBP, ponieważ przezwycięża ograniczenia tradycyjnej statystyki poprzez modelowanie złożonych, nieliniowych powiązań między czynnikami żywieniowymi i innymi czynnikami ryzyka jednocześnie. To bardziej szczegółowe badanie pozwala na nieliniowe powiązania i dostarcza solidnego równania dla kluczowych predyktorów LBP. Wykorzystując wartości SHAP dla globalnej interpretowalności, mogą zobaczyć, jak kombinacje składników odżywczych wpływają na ryzyko LBP, co otwiera drzwi do spersonalizowanych interwencji i badań genetycznych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To dochodzenie zostało zatwierdzone przez Radę Etyki Narodowego Centrum Statystyki Zdrowia (NCHS), a wszyscy uczestnicy uzyskali świadomą zgodę. Publicznie dostępne dane NHANES zostały wykorzystane zgodnie z odpowiednimi wytycznymi.

Populacja badawcza

Narodowe Badanie Zdrowia i Żywienia (NHANES), prowadzone przez NCHS, dostarcza reprezentatywnych danych na poziomie krajowym o stanie zdrowia i odżywieniu populacji USA nieinstytucjonalizowanej. Dane z cykli 2001–2004 oraz 2009–2010 zostały pobrane. Uczestniczki w wieku ≥18 lat zostały uwzględnione, natomiast osoby z brakującymi danymi dotyczącymi przewlekłego LBP, mikroelementów diety, poziomu wykształcenia lub kluczowych współwariantów — w tym wskaźnika ubóstwa do dochodów (PIR), wskaźnika masy ciała (BMI), statusu palenia, nadciśnienia, cukrzycy i spożycia alkoholu — zostały wykluczone. Ostatnia kohorta analityczna liczyła 8 710 uczestników (Rysunek 1).

Ocena składników odżywczych w diecie

Dane dotyczące spożycia diety uzyskano podczas dwóch 24-godzinnych wywiadów z przypomnieniem sobie diety. Pierwsza rozmowa odbyła się w Mobilnym Centrum Egzaminacyjnym, a druga telefonicznie w ciągu kilku dni. Zastosowano Automatyczną Metodę Wielokrotnych Przepustek, aby poprawić dokładność przypominania i zminimalizować błędy raportowania. Szczegółowe procedury AMPM opisano w dokumentacji metodologii dietetycznej NHANES.

Ocena przewlekłego LBP

Status przewlekłej LBP został określony na podstawie danych z kwestionariusza. Uczestnicy byli klasyfikowani jako osoby z długą linią brzegu (LBP), jeśli zgłaszali ból pleców trwający ≥3 miesiące.

Kowarianity

Charakterystyka demograficzna obejmowała wiek, płeć, rasę/pochodzenie etniczne (Meksykanie-Amerykanin, Inny Hiszpańczyk, Biali nie-Hiszpańskojęzy, Czarnoskórzy nie-latynosi, Inna rasa), wykształcenie (< 9 klasa, 9–11), stopień (świadectwo ukończenia szkoły średniej/GED, niektóre stopnie wyższe/AA oraz ukończenie studiów), stosunek dochodów rodziny do ubóstwa (PIR), wskaźnik masy ciała (BMI), status palenia, a także status alkoholu oraz historię nadciśnienia i cukrzycy. Nadciśnienie definiowano na podstawie diagnozy zgłaszanej przez lekarza lub obecnego stosowania leków przeciwnadciśnieniowych. Cukrzycę definiowano na podstawie diagnozy zgłaszanej przez lekarza, podwyższonego poziomu glukozy po 2-godzinnym teście tolerancji glukozy (≥11,1 mmol/L) lub hemoglobiny glikowanej ≥6,5% lub glukozy na czczo ≥7,0 mmol/L. Stan przedcukrzycowy definiowano jako informację lekarza o stanie przedcukrzycowym, 2-godzinne wartości tolerancji glukozy OGTT wynoszące 7,8–11,1 mmol/L, Glukoza na czczo 6,1–6,9 mmol/L, czyli wartość HbA1c między 5,7%–6,4%. Status palenia definiowano jako (1) nieaktualny przed ostatnim miesiącem lub rzucenie palenia na ponad rok, oraz (2) palenie obecnie (samoraportujące niedawno) oznacza palenie więcej niż 2 papierosy dziennie po powrocie do nawyku lub przed rzuceniem palenia. Jeśli chodzi o status alkoholu, istnieją dwie definicje: (1) osoby niepijące alkoholu przez całe życie bez wcześniejszego spożycia alkoholu (łącznie <12) oraz (2) obecne osoby pijące, które zgłaszają picie ≥12 razy rocznie lub co najmniej sześć razy w ciągu ostatnich 12 miesięcy. BMI obliczane jako waga ÷ wzrost2.

Wstępne przetwarzanie i selekcja cech w uczeniu maszynowym

Uwzględniono łącznie 52 zmienne, w tym 45 zmiennych ciągłych i 7 kategorycznych. Wszystkie procedury wstępnego przetwarzania i wyboru cech — w tym usuwanie wielokolinearności, aplikacja SMOTE oraz wybór cech opartych na Boruta — były wykonywane wyłącznie na zbiorze treningowym, aby zapobiec wyciekom danych. Aby wyeliminować wielokolinearność, najpierw usunięto zmienne z współczynnikami korelacji powyżej 0,9, a następnie zmienne z VIF większymi niż 3.

Aby poprawić nierównowagę klasową i rozpoznać klasy mniejszościowe (czytaj: trudniejsze), zastosowano Technikę Syntetycznego Nadpróbkowania Mniejszości (SMOTE) (Rysunek Uzupełniający 1), która tworzy odległości między próbkami klas mniejszościowych, oblicza k-najbliższych sąsiadów dla tych odległości oraz generuje syntetyczne dane w losowych kierunkach w celu zrównoważenia klas. Wszystkie użyte zmienne zostały następnie ustandaryzowane.

Wybór funkcji został wykonany za pomocą Boruta na Random Forests, generując tzw. "cechy cieni" i "testując" je w porównaniu z funkcjami wejściowymi w ponad 500 iteracjach. Osoby sklasyfikowane jako "potwierdzone" zostały zatrzymane do budowy modelu. Aby uzyskać szczegółowe informacje na temat strojenia hiperparametrów, prosimy zapoznać się z Tabelą Uzupełniającą 1.

Analiza statystyczna

Wszystkie analizy przeprowadzono zgodnie z wytycznymi analitycznymi NHANES. Zmienne ciągłe podawano jako średnie ± odchylenia standardowe (SD), natomiast zmienne kategoryczne jako liczba i procent. Różnice między grupami testowano za pomocą chi-kwadrat lub testów Studenta t, gdzie było to stosowne.

Aby zapobiec nadmiernemu dostosowaniu, dane były losowo podzielone na zestawtreningowy 7 oraz zestaw testowy. Korzystając z MLR3, zbudowano sześć algorytmów uczenia maszynowego: Random Forest, który konstruuje wiele drzew decyzyjnych i łączy ich przewidywania, oferując silną moc uogólnień i spójność; LightGBM oparty na drzewach decyzyjnym z gradientem boostowanym, które jest dostrojone pod kątem efektywności i skali; K-KNN sortuje próbki według ich bliskości sąsiadów. K-KNN zazwyczaj osiąga lepsze wyniki na małych, nieliniowych zbiorach danych; Naivne Bayesa, które dzięki wykorzystaniu twierdzenia Bayesa zapewnia prostotę i jest odporne; SVM, które posiada idealne hiperpłaszczyzny do zadania klasyfikacji, nawet dla próbek o wysokiej wymiarowości; XGBoost to forma zespołu gradient boosting, która oferuje wysoką wydajność, nawet przy bardzo dużych, niekompletnych zbiorach danych.

Model oceniano na podstawie dokładności, F-beta, powierzchni pod krzywymi ROC (AUC-ROC), czułości, swoistości oraz AUC-PR. Głównym wskaźnikiem jest AUC-ROC, podczas gdy pozostałe wskaźniki dają głębsze wglądy w wydajność. Walidują swoje modele za pomocą dziesięciokrotnej walidacji krzyżowej, aby zapewnić stabilność. Różnice w wydajności ich modeli oceniano za pomocą ANOVA oraz testu Kruskal–Wallis H.

Interpretowalność cech była badana za pomocą SHapley Additive ExPlanations (SHAP) oraz lokalnych interpretowalnych wyjaśnień modelowo-niezależnych (LIME). SHAP wyprowadza szacunki wkładu każdej cechy w prognozy modelu, wykorzystując wartości Shapleya, oparte na teorii gier kooperacyjnych, aby reprezentować zarówno efekty liniowe, jak i interaktywne. LIME wyprowadza wpływ cech poprzez aproksymację złożonych modeli za pomocą prostszych, interpretowalnych zastępstw (np. regresji Lasso), aby pomóc wyjaśnić wpływ poszczególnych cech. Wszystkie analizy zostały przeprowadzone w IBM SPSS Statistics w wersji 24.0 oraz w R wersji 4.3.0. Dwustronna wartość p < 0,05 jest uznawana za istotną statystycznie.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Charakterystyka wyjściowa według przewlekłego statusu LBP

Charakterystyki bazowe, rozłożone na przewlekły status LBP, opisano w Tabeli 1. Ostatnia kohorta analityczna obejmowała 8 710 uczestników z NHANES w latach 2001–2004 oraz 2009–2010, ze średnim wiekiem 49,13 roku (SD = 18,43). Spośród nich 4 528 (51,99%) stanowiły kobiety, a 4 182 (48,01%) to mężczyźni. Łącznie 3 838 uczestników zgłosiło LBP (średni wiek 48,62 lat; SD = 17,69). W porównaniu z uczestnikam...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie to wykorzystało dane NHANES i zastosowało kilka algorytmów, znajdując związek między mikroskładnikami dietetycznymi a przewlekłą LBP. Co ważne, biorąc pod uwagę przekrojowy projekt obserwacyjny, wyniki te odzwierciedlają powiązania predykcyjne, a nie przyczynowe, a modele uczenia maszynowego nie są w stanie ustalić przyczynowości między spożyciem mikroskładników a ryzykiem LBP. Po wyborze cech i testach kolineariczności, Losowy Las wydawał się dostarczać najlepszych prognoz, zarówno uwzględniając dane demograficz...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają żadnych konfliktów interesów do zgłoszenia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prace te były wspierane przez Fundację Projektu Hangzhou na rzecz Rolnictwa i Rozwoju Społecznego (20241029Y119), Projekt Wskazówek Planu Nauki i Technologii Dystryktu Xiaoshan (2025316) oraz Projekt Nauki i Technologii Tradycyjnej Medycyny Chińskiej Prowincji Zhejiang (2024ZR152).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Zautomatyzowana metoda wielokrotnego przebiegu (AMPM)Narodowe Centrum Statystyki Zdrowia (NCHS), CDCNie maSystem oceny diety stosowany w 24-godzinnych wywiadach żywieniowych NHANES w celu poprawy dokładności raportowania
Algorytm BorutyOpen-source (pakiet R: Boruta)Nie maMetoda wyboru cech oparta na losowych lasach; Wykorzystywane do identyfikacji istotnych zmiennych poprzez porównanie cech cieniowych
Komputerowe wspomaganie osobistych wywiadów (CAPI)Narodowe Centrum Statystyki Zdrowia (NCHS), CDCNie maSystem wywiadów używany przez wykwalifikowany personel do zbierania danych z kwestionariuszy
Narodowe badanie Badań Zdrowotnych i Żywieniowych (NHANES)Narodowe Centrum Statystyki Zdrowia (NCHS), CDCNie maOgólnokrajowe badanie dostarczające dane demograficzne, dietetyczne i zdrowotne
Kwestionariusz dotyczący problemów prostaty (KIQ)Narodowe Centrum Statystyki Zdrowia (NCHS), CDCNie maŹródło ankiety użyte do oceny informacji o bólu pleców
Algorytm losowego lasuOpen-source (np. implementacje R / Python)Nie maModel uczenia maszynowego używany przy wyborze i klasyfikacji cech
Technika nadpróbkowania syntetycznych mniejszości (SMOTE)Open-source (np. DMwR / imbalanced-learn)Nie maTechnika nadpróbkowania stosowana do rozwiązania nierównowagi klasowej poprzez generowanie syntetycznych próbek mniejszościowych

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Przewidywanie ryzykaRandom Forestanaliza SHAPinterpretowalno LIMEselekcja cechdane NHANESstratyfikacja ryzyka populacyjnego

Powiązane artykuły