연구 논문

여러 기계 학습 모델과 이중 해석 가능성 프레임워크를 이용한 식이 미량 요소를 기반으로 한 만성 요통 위험 예측

DOI:

10.3791/70624

2026년 5월 26일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 NHANES 데이터를 사용하여 식이 미량 원소와 만성 요통 간의 연관성을 조사합니다. 해석 가능한 머신러닝 모델을 적용해 예측 성능을 평가하고 위험 감소와 관련된 영양소를 식별하여, 요통과 관련된 잠재적 식이 요인에 대한 통찰을 제공합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

식이 미량 원소와 만성 요통(LBP) 위험 간의 관계는 아직 명확하지 않습니다. 2001–2004년과 2009–2010년 주기의 국가건강영양검사조사(NHANES) 데이터를 분석하였습니다. 다중공선성은 스피어먼의 상관관계 및 분산 인플레이션 인플레이션(VIF)을 사용하여 평가되었고, 특징 선택은 보루타 알고리즘을 사용해 수행되었습니다. 이후 6개의 머신러닝 모델이 개발되었으며, SHAP과 LIME을 적용해 해석 가능성을 높이고 식이 미량 요소와 LBP 위험 간의 주요 연관성을 규명했습니다. 평가된 모델 중에서 무작위 숲은 인구통계학적 변수를 포함했을 때와 식이 미량 원소만 사용할 때 모두 가장 우수한 예측 성능을 보였습니다. 해석 가능성 분석 결과, 수분, 테오브로민, 칼슘, 카페인, 나트륨, 비타민 C 등 여러 식이 성분이 요통성 발병 위험과 반비례하는 것으로 일관되게 확인되었습니다. 모델 구별은 중간 정도(AUC ≈ 0.60–0.72)였으나, 이러한 결과는 인구 수준 위험 계층화를 뒷받침할 수 있는 임상적으로 중요한 패턴을 드러내며, 향후 연구를 위한 잠재적으로 조절 가능한 식이 요인을 강조합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

만성 요통(LBP)은 전 세계적으로 가장 흔한 근골격계 질환 중 하나이며, 장애, 의료 서비스, 삶의 질 상실과 관련된 상당한 사회경제적 비용을 동반합니다. 역학 자료에 따르면 전 세계적으로 성인의 7–10%가 요통 발병을 보고하며, 평생 유병률은 때때로 84%에 이를 수 있습니다1. 이 질환은 노동 관련 요인, 의료 서비스 접근성 부족, 사회경제적 불평등이 위험을 높이는 저소득/중간 소득 국가에서 가장 흔하며, 노동 연령 성인의 유병률은 종종 20%를 초과합니다2. 청소년과 노인은 특히 추간판 변행, 골다공증과 같은 구조적 및 퇴행성 변화에 더 취약합니다.

LBP는 생체역학적, 심리사회적, 유전적, 영양 요인에 의해 영향을 받는 다요인 질환으로, 이러한 다양한 변수들 간의 복잡한 상호작용을 동시에 포착할 수 있는 분석 방법이 필요합니다. 최근 체계적 문헌고찰은 LBP의 병인이 여전히 수수께끼로, 생체역학적, 심리사회적, 유전적 요인에 의해 영향을 받아 특정적으로 규명하기 어렵다는 점을 강조하고 있습니다. 'LBP' 사례의 85% 이상이 비특이적이며, 이는 표적 예방과 치료 개발이 어렵습니다. 물리적·약리학적 방법을 결합한 다중 모달 치료가 증상 완화를 제공하는 경향이 있지만, 많은 환자가 재발하는 경우가 많아 LBP6에 대한 새롭고 예방 가능하며 조절 가능한 위험 인자가 긴급히 필요함을 나타냅니다.

전통적인 통계 방법은 이러한 복잡성을 다루는 데 한계가 있는데, 이는 선형 가정에 의존하는 경우가 많아 NHANES 식이 프로필과 같은 다요인 데이터에 내재된 고차원 상호작용과 비선형 관계를 충분히 모델링하지 못하기 때문입니다. 반면, 머신러닝 접근법은 다수의 변수를 동시에 처리하고, 미묘한 패턴과 상호작용을 감지하며, 여러 요인이 수렴하는 요통성 질환에 대해 강력한 예측을 제공하는 우수한 유용성을 제공합니다.

비타민, 미네랄, 미량 원소 등 식이 미량 영양소는 생리적 균형을 위해 필요하며 만성 질환 위험을 줄이는 데 도움을 줍니다. 항산화 비타민 E(α-토코페롤)와 C는 심혈관 및 신경퇴행성 질환에서 존재하는 산화 손상을 줄여줍니다 7,8. 티아민(비타민 B1), 피리독신(비타민 B6), 엽산, 코발라민(비타민 B12)과 같은 비타민 B군 비타민도 면역조절 역할을 하며 세포 에너지 대사를 촉진합니다; 이 결핍은 암, 불임, 우울한 기분과 연관되어 있습니다 9,10,11. 특히 마그네슘, 아연, 구리, 셀레늄 등 미네랄은 근감소증, 자궁내막증, 비만 수술 후 영양 분비를 예방하는 효소 및 항염증 경로에 관여합니다12. 내러티브 리뷰는 지질 조절과 면역학적 역할을 통해 비만 관련 동반질환과 지루성 피부염, 원형 탈모 같은 피부 질환 예방에 중요함을 강조합니다13,14. 전반적으로, 지역사회 건강에 가장 적합한 접근법이 적절한 미량 영양소 섭취일 수 있음을 시사하는 신호이나, 중재적 임상시험은 맥락적 요인에 따른 이질적인 결과를 주로 보입니다15,16.

더욱이, 영양 데이터를 통합한 머신러닝 애플리케이션은 설문 데이터를 통해 관절염 위험 예측과 인구 기반 코호트에서 요통성 요통 및 관련 질환에 대한 생활습관(식이 포함) 기여 요인 규명과 같은 다른 근골격계 질환의 위험 요인 규명에 효과가 있음을 보여주었습니다.

미량 영양소와 만성 질환 사이의 풍부한 연관성에도 불구하고, 음식 내 미량 영양소와 요통성 질환 위험 간의 관계는 여전히 불확실하며, 작용 기전도 불확실합니다. 관찰 연구에서는 요통성 요통 환자 사이에서 비타민 D, 마그네슘, 항산화제 결핍이 자주 보고되지만, 특히 비타민 D 관련 보충 임상시험의 메타분석에서는 통증 완화에 대한 증거가 제한적이고 일관되지 않았습니다19,20.

기존 문헌을 체계적으로 검토한 결과 주요 한계가 드러납니다: 인과관계를 입증하지 못하는 횡단면 및 사례-대조군 설계에 의존하는것; 인구통계, 생활습관, 동반 질환 등 교란 요인에 대한 통제 불충분한20,22; 소규모 및 대표성이 없는 표본; 미량영양소 상태와 통증 결과의 가변적 정의; 식이 시너지나 길항작용을 고려하지 않고 분리된 영양소에 집중하는것. 이러한 한계는 요통의 영양 조절에 대한 명확하고 실행 가능한 통찰 개발을 방해했습니다.

보다 명확한 가설 구조로는, 미량 영양소가 기전적으로 연결된 삼가지 경로(비타민 C, E, 셀레늄, 아연, 마그네슘)를 통해 LBP에 대해 보호 효과를 발휘한다고 제안합니다: 산화 및 항염증 작용으로 산화 스트레스와 신경염증을 완화하는 기능(비타민 C, E, 셀레늄, 아연, 마그네슘); 호모시스테인에 의한 손상(비타민 B군)의 신경 복구 및 완화 지원; 그리고 미네랄 신호 전달과 비타민 D 매개 칼슘 조절(비타민 D, 마그네슘, 칼슘)을 통한 뼈 및 근육 항상성 향상. 이러한 틀은 미량영양소 상태, 전신 염증, 통증 만성 간의 양방향 상호작용을 강조하며, 이는 염증성 식이와의 연관성에서 확인할 수 있다24.

단면 연구들은 미량 영양소가 부족한 염증성 식단이 복부 또는 만성 통증을 더 많이 유발한다는 것을 보여주며, 미량 영양소 부족이 전신 염증과 통증을 악화시키는 양방향 연관성을 시사합니다24.

이러한 문제를 해결하기 위해 우리는 다양한 식이 미량 영양소(비타민(E, A, B1, B6, B12, C, K), 미네랄(칼슘, 마그네슘, 철, 아연, 구리, 셀레늄) 및 섬유질, 다중불포화지방산, 칼륨, 카페인 등 다양한 식이 요소를 통합한 여러 ML 모델을 개발했으며, 이는 NHANES 데이터를 활용해 요통 위험 예측을 지원합니다. 이 ML 기반 전략은 영양 및 기타 위험 요인 간의 복잡하고 비선형적인 연관성을 동시에 모델링함으로써 전통 통계의 한계를 극복하여 LBP의 다요인적 특성에 특히 적합합니다. 이 보다 포괄적인 탐구는 비선형 연관성을 다룰 수 있으며, 주요 LBP 예측 변수에 대한 견고한 방정식을 제공합니다. SHAP 값을 활용해 전역 해석 가능성을 높이면, 영양소 조합이 요통성 위험에 미치는 영향을 파악할 수 있으며, 이는 맞춤형 개입과 영양유전체 연구의 문을 열어줍니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 조사는 미국 국립보건통계센터(NCHS) 윤리 검토 위원회의 승인을 받았으며, 모든 참가자로부터 사전 동의를 받았습니다. 공개된 NHANES 데이터는 관련 지침을 준수하여 사용되었습니다.

연구 대상

NCHS가 실시하는 국가 건강 및 영양 검사 조사(NHANES)는 비기관화된 미국 인구의 건강 및 영양 상태에 대한 전국 대표성 데이터를 제공합니다. 2001–2004년과 2009–2010년 사이클의 데이터가 수집되었습니다. 18세 ≥세 참가자가 포함되었으며, 만성 요통, 식이 미량 영양소, 교육 수준 또는 주요 공변량(빈곤-소득 비율(PIR), 체질량지수(BMI), 흡연 상태, 고혈압, 당뇨병, 음주 섭취 등 주요 공변량 데이터가 누락된 사람은 제외했습니다. 최종 분석 코호트는 8,710명의 참가자로 구성되었습니다(그림 1).

식이 영양소 평가

식이 섭취 데이터는 24시간 식이 회상 인터뷰를 통해 얻었습니다. 첫 번째 면접은 이동 시험 센터에서 진행되었고, 두 번째 면접은 며칠 내에 전화로 완료되었습니다. 자동 다중 통과 방법을 적용하여 회상 정확도를 높이고 보고 편향을 최소화하였습니다. 상세한 AMPM 절차는 NHANES 식이 방법론 문서에 설명되어 있습니다.

만성 요통 평가

만성 요통 상태는 설문지 데이터를 사용하여 확인하였다. 참가자들은 요통이 ≥3개월간 지속된다고 보고하면 요통으로 분류되었습니다.

공변량

인구통계학적 특징에는 연령, 성별, 인종/민족(멕시코계 미국인, 기타 히스패닉, 비히스패닉 백인, 비히스패닉 흑인, 기타 인종), 학력(<9학년, 9–11학년), 학위(고등학교 졸업장/GED, 일부 대학/AA 학위 및 대학 졸업), 가족 소득 대비 빈곤비(PIR), 체질량지수(BMI), 흡연 여부, 음주 여부, 고혈압 및 당뇨병 병력 등이 포함되었습니다. 고혈압은 의사의 자기보고적 진단 또는 현재 항고혈압약 사용 여부를 기준으로 정의되었습니다. 당뇨병은 의사의 자기보고적 진단, 2시간 포도당 내성 검사 후 혈당 상승(≥11.1 mmol/L), 또는 당화 헤모글로빈 ≥6.5% 또는 공복 혈당≥7.0 mmol/L)을 기준으로 정의되었습니다. 당뇨 전단계는 의사로부터 당뇨병 전단계임을 알리고, 2시간 OGTT 포도당 내성 7.8–11.1 mmol/L, 공복 혈당 6.1–6.9 mmol/L로 정의되었습니다. 또는 HbA1c 수치는 5.7%에서 6.4% 사이입니다. 흡연 상태는 (1) 최근 한 달 이전에 현재 금연 중이거나 1년 이상 금연한 것으로 정의되었으며, (2) 현재 흡연(자기보고적 최근)은 습관을 되찾았거나 금연 전에 하루에 2개 이상의 담배를 피운 것으로 정의되었습니다. 음주 상태에 관해서는 두 가지 정의가 있습니다: (1) 평생 음주하지 않고 이전에 음주한 적이 없는 사람(총 <12회), (2) 현재 음주자가 연간 ≥12회 음주 또는 최근 12개월 동안 최소 6회 음주를 보고한 경우. BMI는 체중÷ 키로 계산됩니다.

머신러닝을 위한 특징 전처리 및 선택

총 52개의 변수가 포함되었으며, 이 중 45개는 연속 변수, 7개는 범주 변수였습니다. 모든 전처리 및 특징 선택 절차—다중공선성 제거, SMOTE 적용, 보루타 기반 특징 선택 포함—는 데이터 유출을 방지하기 위해 오직 훈련 세트에서만 수행되었습니다. 다중공선성을 제거하기 위해 상관계수가 0.9를 초과하는 변수를 먼저 제거하고, 그 다음 VIF가 3인 변수를 제거했습니다.

계급 불균형과 소수(즉, 더 어려운) 계급 인식을 개선하기 위해, 합성 소수민족 과잉표본 기법(SMOTE)이 적용되었습니다(보충 그림 1). 이 기법은 소수계급 표본 간 거리를 생성하고, 그 거리의 k-최근접 이웃을 계산하며, 무작위 방향으로 합성 데이터를 생성해 계급 균형을 맞추는 방식입니다. 사용된 모든 변수는 표준화되었습니다.

특징 선택은 Boruta와 함께 랜덤 포레스트에서 완료되었으며, 이른바 '그림자 특징'을 생성하고 입력 특징과 500회 이상 '테스트'했습니다. "확정"으로 분류된 이들은 모델 제작을 위해 남겨졌습니다. 하이퍼파라미터 튜닝에 대한 자세한 정보는 보충 표 1을 참조하십시오.

통계 분석

모든 분석은 NHANES 분석 지침에 따라 수행되었습니다. 연속 변수는 평균 ±표준편차(SD)로 보고되었고, 범주 변수는 개수와 백분율로 표현되었습니다. 그룹 간 차이는 적절한 경우 카이제곱 또는 학생 t-검정을 사용하여 검사하였습니다.

과적합을 방지하기 위해 데이터를 무작위로 훈련 세트7 과 테스트 세트로 분할했습니다. MLR3를 사용하여 여섯 가지 머신러닝 알고리즘이 구축되었습니다: 많은 의사결정 트리를 구성하고 그 예측을 연결하는 랜덤 포레스트(Random Forest)는 강한 일반화력과 일관성을 가지며; 효율성과 규모를 고려해 조정된 그라디언트 부스트 의사결정 트리를 기반으로 한 LightGBM; K-KNN 샘플은 이웃 샘플과의 근접성에 따라 정렬합니다. K-KNN은 일반적으로 작은 비선형 데이터셋에서 더 나은 결과를 얻습니다; 베이즈 정리를 활용하여 단순함을 제공하고 견고함을 제공하는 순진한 베이즈; 분류 작업에 적합한 이상적인 초평면을 가진 SVM, 심지어 고차원 샘플에 대해서도; XGBoost는 매우 방대한 불완전한 데이터셋에도 높은 성능을 가진 그라디언트 부스팅 앙상블의 한 형태입니다.

모델은 정확도, F-베타, ROC 곡선 아래 면적(AUC-ROC), 민감도, 특이도, AUC-PR을 사용하여 평가하였습니다. AUC-ROC가 그들이 사용하는 주요 지표이고, 다른 지표들은 성과에 대한 더 깊은 통찰을 제공합니다. 안정성을 보장하기 위해 10배 교차 검증을 통해 모델을 검증합니다. 모델 성능 차이는 ANOVA와 Kruskal–Wallis H 검정을 사용하여 평가되었습니다.

특징 해석 가능성은 SHapley 적법 설명(SHAP)과 국소 해석 가능 모델-무관적 설명(LIME)을 사용하여 조사되었습니다. SHAP는 협동 게임 이론을 기반으로 셰플리 값을 사용하여 각 특징이 모델 예측에 기여하는 기여도를 추정하여 선형 효과와 상호작용 효과를 모두 표현합니다. LIME은 개별 특징 영향을 설명하기 위해 복잡한 모델을 더 단순하고 해석 가능한 대리인(예: Lasso 회귀)으로 근사하여 특징 영향을 도출합니다. 모든 분석은 IBM SPSS Statistics 버전 24.0과 R 버전 4.3.0에서 수행되었습니다. 양측 p-값< 0.05는 통계적으로 유의미한 것으로 간주됩니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

만성 요통 상태에 따른 기초 특성

만성 요통 상태에 따라 계층화된 기저 특성은 표 1에 설명되어 있습니다. 최종 분석 코호트에는 NHANES 2001–2004 및 2009–2010 학년의 8,710명 참가자가 포함되었으며, 평균 연령은 49.13세(SD = 18.43)였습니다. 이 중 여성은 4,528명(51.99%), 남성은 4,182명(48.01%)이었습니다. 전체적으로 3,838명의 참가자가 요통증을 보고했습니다(평균 연령 48.62세; SD = 17.69). LBP가 없는 참가자들과 비교했을 때, LBP 환자는 식이섬유(15.67 대 16.07, p = 0.010), α-카로틴(357.39 대 389.51, p = 0.009), β-카로틴(1,902.99 대 2,061.90, p < 0.001), β-크립토톡산틴(131.99 대 155.57, p < 0...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 NHANES 데이터를 사용해 여러 알고리즘을 적용하여 식이 미량 영양소와 만성 요통성 질환 간의 연관성을 발견했습니다. 중요한 점은, 횡단면 관찰 설계를 고려할 때, 이러한 결과는 인과관계보다는 예측적 연관성을 반영하며, 머신러닝 모델은 미량 영양소 섭취와 LBP 위험 간의 인과관계를 입증하지 못한다는 것입니다. 특징 선택과 공선성 검사 결과, 무작위 숲은 인구통계학적 포함과 식이 미량 영양소만 포함한 경우 가장 좋은 예측을 제공하는 것으로 보였습니다. SHAP과 LIME 결과는 부정적으로 예측된 가장 중요한 특징은 수분, 테오브로민, 칼슘, 나트륨으로, 각각 높은 수치가 질병 위험 감소와 상관관계가 있음을 발견했습니다.

기계 학습 모델들은 중간 정도의 성능(AUC 값 약 0.6–0.7)만을 보였지만, 이 수준은 비특이적 만성 요랑골쇠와 같은 고이질적이고 다인성 질환에 대한 영양 역학 연구에서 전형적이고 임상...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 상충을 선언할 필요가 없습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 작업은 항저우 농업 및 사회발전 프로젝트 재단(20241029Y119), 샤오산 구 과학기술 계획 지도 프로젝트(2025316), 저장성 전통 중의학 과학기술 프로젝트(2024ZR152)의 지원을 받았습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
자동 다중 패스 방법(AMPM)국립보건통계센터(NCHS), CDC해당 없음NHANES 24시간 식이 회상 면담에서 보고 정확성을 높이기 위해 사용되는 식이 평가 시스템
보루타 알고리즘오픈 소스 (R 패키지: Boruta)해당 없음무작위 숲을 기반으로 한 특징 선택 방법; 섀도우 특징 비교를 통해 관련 변수를 식별하는 데 사용됩니다
컴퓨터 지원 개인 면접(CAPI)국립보건통계센터(NCHS), CDC해당 없음훈련된 인력이 설문지 데이터를 수집하기 위해 사용하는 인터뷰 시스템
국가 건강 및 영양 검사 조사(NHANES)국립보건통계센터(NCHS), CDC해당 없음인구통계, 식이, 건강 관련 데이터를 제공하는 전국 조사
전립선 상태 설문지(KIQ)국립보건통계센터(NCHS), CDC해당 없음요통 정보 평가에 사용되는 설문지 출처
랜덤 포레스트 알고리즘오픈 소스 (예: R / Python 구현)해당 없음특징 선택 및 분류에 사용되는 머신러닝 모델
합성 소수 과잉 샘플링 기법 (SMOTE)오픈 소스 (예: DMwR / imbalanced-learn)해당 없음과샘플링 기법: 합성 소수 표본을 생성하여 클래스 불균형을 해결하기 위해 사용되는 기법

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

SHAPLIMENHANES

관련 논문