Artículo de investigación

Predicción del riesgo de dolor lumbar crónico basado en elementos traza dietéticos utilizando múltiples modelos de aprendizaje automático y marcos de interpretabilidad dual

DOI:

10.3791/70624

26 de mayo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio investiga las asociaciones entre los oligoelementos dietéticos y el dolor lumbar crónico utilizando datos de NHANES. Se aplican modelos de aprendizaje automático interpretables para evaluar el rendimiento predictivo e identificar nutrientes asociados con un riesgo reducido, proporcionando información sobre posibles factores dietéticos relacionados con el dolor lumbar.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La relación entre los oligoelementos dietéticos y el riesgo de dolor lumbar crónico (LBP) sigue siendo incierta. Se analizaron los datos de la Encuesta Nacional de Salud y Nutrición (NHANES) de los ciclos 2001–2004 y 2009–2010. La multicolinealidad se evaluó utilizando los factores de correlación y inflación de la varianza (VIF) de Spearman, y la selección de características se realizó utilizando el algoritmo de Boruta. Posteriormente se desarrollaron seis modelos de aprendizaje automático, aplicando SHAP y LIME para mejorar la interpretabilidad e identificar asociaciones clave entre los elementos traza dietéticos y el riesgo de LBP. Entre los modelos evaluados, Random Forest demostró el mejor rendimiento predictivo, tanto al incorporar variables demográficas como al usar únicamente oligoelementos dietéticos. Los análisis de interpretabilidad identificaron de forma consistente varios componentes dietéticos —incluyendo humedad, teobromina, calcio, cafeína, sodio y vitamina C— como inversamente asociados con el riesgo de la lombal. Aunque la discriminación en modelos fue moderada (AUC ≈ 0,60–0,72), estos hallazgos revelan patrones clínicamente relevantes que pueden apoyar la estratificación de riesgo a nivel poblacional y destacar factores dietéticos potencialmente modificables para futuras investigaciones.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El dolor lumbar crónico (LBP) es uno de los trastornos musculoesqueléticos más prevalentes a nivel mundial y tiene importantes costes socioeconómicos asociados con la discapacidad, la atención sanitaria y la pérdida de calidad de vida. Los datos epidemiológicos indican que entre el 7 y el 10 % de los adultos reportan la lombalgia lumbar a nivel mundial, con una prevalencia a lo largo de la vida que a veces alcanza el 84 %. Es más común en países de ingresos bajos o medios, donde factores relacionados con el trabajo, el mal acceso a servicios de salud y la desigualdad socioeconómica aumentan el riesgo, con una prevalencia que suele superar el 20% entre adultos en edadlaboral 2. Los adolescentes y las personas mayores, en particular, son más vulnerables a cambios estructurales y degenerativos como la degeneración del disco intervertebral y laosteoporosis 3.

La LBP es una enfermedad multifactorial influida por factores biomecánicos, psicosociales, genéticos y nutricionales, lo que requiere métodos analíticos capaces de capturar simultáneamente las complejas interacciones entre estas diversas variables. Las revisiones sistemáticas recientes siguen destacando que la etiología de la LBP sigue siendo enigmática, influida por factores biomecánicos, psicosociales y genéticos, y que por ello es difícil de identificar con precisión. Más del 85% de los casos de 'LBP son inespecíficos', lo que dificulta el desarrollo de prevención y tratamientodirigidos 4,5. Aunque las terapias multimodales que combinan métodos físicos y farmacológicos tienden a proporcionar alivio sintomático, muchos pacientes siguen siendo recurrentes, lo que indica una necesidad urgente de nuevos factores de riesgo prevenibles y modificables para laLBP 6.

Los métodos estadísticos tradicionales son limitados para abordar esta complejidad, ya que a menudo se basan en supuestos lineales y no modelan adecuadamente las interacciones de alta dimensión y las relaciones no lineales inherentes a datos multifactoriales como los perfiles dietéticos de NHANES. En cambio, los enfoques de aprendizaje automático ofrecen una utilidad superior al manejar un gran número de variables simultáneamente, detectar patrones e interacciones sutiles, y proporcionar predicciones robustas para enfermedades como la LBP donde convergen múltiples factores.

Los micronutrientes dietéticos, incluyendo vitaminas, minerales y oligoelementos, son necesarios para el equilibrio fisiológico y ayudan a reducir el riesgo de enfermedades crónicas. Las vitaminas antioxidantes E (α-tocoferol) y C reducen el daño oxidativo presente en enfermedades cardiovasculares yneurodegenerativas 7,8. Las vitaminas del complejo B, como la tiamina (vitamina B1), la piridoxina (vitamina B6), el folato y la cobalamina (vitamina B12), también son inmunoreguladoras y facilitan el metabolismo energético celular; deficiencias de las cuales se han relacionado con cáncer, infertilidad y estado de ánimodeprimido 9,10,11. Los minerales, especialmente magnesio, zinc, cobre y selenio, participan en vías enzimáticas y antiinflamatorias que previenen la sarcopenia, la endometriosis y la descarga nutricional postoperatoria tras la cirugíabariátrica 12. Las revisiones narrativas destacan su importancia en la prevención de comorbilidades relacionadas con la obesidad y afecciones cutáneas como la dermatitis seborreica y la alopecia areata, mediante la modulación lipídica y los rolesinmunológicos 13,14. En general, una señal de que el mejor enfoque para la salud comunitaria puede ser la ingesta adecuada de micronutrientes, aunque los ensayos intervencionistas muestran en gran medida resultados heterogéneos basados en factorescontextuales 15,16.

Además, aplicaciones de aprendizaje automático que incorporan datos nutricionales han demostrado eficacia para esclarecer factores de riesgo para otras enfermedades musculoesqueléticas, como predecir el riesgo de artritis a partir de datos dela encuesta 17 e identificar factores de estilo de vida (incluida la dieta) que contribuyen a la lombalesis y condiciones relacionadas en cohortespoblacionales 18.

A pesar de la abundancia de vínculos entre micronutrientes y enfermedades crónicas, la relación entre los micronutrientes en los alimentos y el riesgo de lombalesis sigue estando poco definida, y los mecanismos de acción son inciertos. Aunque los estudios observacionales suelen informar de deficiencias de vitamina D, magnesio y antioxidantes entre personas con lomble, los metaanálisis de ensayos de suplementación —especialmente aquellos que implican vitamina D— han arrojado evidencia limitada e inconsistente de aliviodel dolor 19,20.

Un examen sistemático de la literatura existente revela limitaciones clave: dependencia de diseños transversales y caso-control que no pueden establecer lacausalidad 21; control inadecuado de los factores de confusión, incluyendo demografía, estilo de vida ycomorbilidades 20,22; muestras pequeñas y no representativas; definiciones variables del estado de los micronutrientes y los resultados del dolor; y un enfoque en nutrientes aislados sin considerar sinergias o antagonismosdietéticos 23. Estas carencias han dificultado el desarrollo de conocimientos claros y accionables sobre la modulación nutricional de la LBP.

Para una estructura hipotética más explícita, se propone que los micronutrientes ejercen efectos protectores contra la lumbre lumbar a través de una tríada de vías mecanísticamente vinculadas: acciones antioxidantes y antiinflamatorias que atenuan el estrés oxidativo y la neuroinflamación (vitaminas C, E, selenio, zinc, magnesio); apoyo para la reparación neural y mitigación del daño inducido por homocisteína (vitaminas del complejo B); y la mejora de la homeostasis ósea y muscular mediante la señalización mineral y la regulación del calcio mediada por la vitamina D (vitamina D, magnesio, calcio). Este marco pone de relieve la interacción bidireccional entre el estado de micronutrientes, la inflamación sistémica y la cronicidad del dolor, como lo evidencian las asociaciones con dietasproinflamatorias 24.

Los estudios transversales indican que las dietas proinflamatorias carentes de micronutrientes producen mayores niveles de dolor abdominal o crónico, lo que sugiere una asociación bidireccional en la que la falta de aportaciones de micronutrientes agrava la inflamación y el dolorsistémicos 24.

Para abordar estos problemas, han desarrollado múltiples modelos de aprendizaje automático que incorporan una amplia gama de micronutrientes de la dieta (vitaminas (E, A, B1, B6, B12, C, K), minerales (calcio, magnesio, hierro, zinc, cobre, selenio) y otros elementos dietéticos como fibra, ácidos grasos poliinsaturados, potasio y cafeína) con datos NHANES para predecir el riesgo de la lombal. Esta estrategia basada en aprendizaje automático es especialmente adecuada para la naturaleza multifactorial de la LBP, ya que supera las limitaciones de la estadística tradicional modelando simultáneamente asociaciones complejas y no lineales entre factores nutricionales y otros factores de riesgo. Esta exploración más exhaustiva puede gestionar asociaciones no lineales y proporciona una ecuación robusta para los predictores clave de LBP. Utilizando los valores SHAP para la interpretabilidad global, pueden ver cómo las combinaciones de nutrientes afectan al riesgo de la largibil, lo que abre la puerta a intervenciones personalizadas y estudios nutrigenómicos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación fue aprobada por la Junta de Revisión de Ética del Centro Nacional de Estadísticas de la Salud (NCHS), y se obtuvo el consentimiento informado de todos los participantes. Los datos públicos de NHANES se utilizaron en cumplimiento de las directrices pertinentes.

Población estudiada

La Encuesta Nacional de Salud y Nutrición (NHANES), realizada por el NCHS, proporciona datos representativos a nivel nacional sobre el estado de salud y nutrición de la población estadounidense no institucionalizada. Se recuperaron datos de los ciclos 2001–2004 y 2009–2010. Se incluyeron participantes de ≥18 años, mientras que se excluyeron individuos con datos faltantes sobre la lombalgia lumbar crónica, micronutrientes dietéticos, nivel educativo o covariables clave —incluyendo la relación pobreza-ingresos (PIR), índice de masa corporal (IMC), estado de tabaquismo, hipertensión, diabetes y consumo de alcohol. La cohorte analítica final comprendió 8.710 participantes (Figura 1).

Evaluación de nutrientes dietéticos

Los datos de ingesta dietética se obtuvieron mediante dos entrevistas de retiro dietético de 24 horas. La primera entrevista se realizó en un Centro Móvil de Exámenes y la segunda se realizó por teléfono en pocos días. Se aplicó el Método Automatizado de Múltiples Pasadas para mejorar la precisión de la llamada y minimizar el sesgo en la notificación. Los procedimientos detallados de AMPM se describen en la documentación de metodología dietética de NHANES.

Evaluación de la lombalgia crónica

El estado de la lombalgia crónica se determinó mediante datos de cuestionarios. Los participantes fueron clasificados como con lombalesis si reportaban dolor de espalda de duración ≥3 meses.

Covariables

Las características demográficas incluían edad, sexo, raza/etnia (mexicoamericano, otros hispanos, blancos no hispanos, negros no hispanos, otra raza), educación (<9º curso, 9º–11º curso), título universitario (diploma/GED, algunos títulos universitarios/AA y graduados universitarios), ratio ingreso-pobreza familiar (PIR), índice de masa corporal (IMC), estado de tabaquismo, así como estado de consumo y antecedentes de hipertensión y diabetes. La hipertensión se definió en función del diagnóstico autoinformado por el médico o del uso actual de medicación antihipertensiva. La diabetes se definió mediante un diagnóstico autoinformado por el médico, niveles elevados de glucosa tras una prueba de tolerancia a la glucosa de 2 horas (≥11,1 mmol/L), hemoglobina glicada ≥6,5% o glucosa en ayunas ≥7,0 mmol/L. La prediabetes se definió como que un médico le dijera que tenías prediabetes, valores de tolerancia a la glucosa OGTT a 2 horas de 7,8–11,1 mmol/L, glucosa en ayunas de 6,1–6,9 mmol/L, o un valor de HbA1c entre el 5,7% y el 6,4%. El estado de fumar se definía como (1) No actual antes del último mes, o dejado de fumar durante más de un año, y (2) fumar actualmente (autoinforme reciente) se define como fumar más de 2 cigarrillos al día al recuperar el hábito o antes de dejar de fumar. En cuanto al estado de consumo de alcohol, existen dos definiciones: (1) no bebedores de por vida sin consumo previo de alcohol (<12 en total), y (2) bebedores actuales que declaran haber bebido ≥12 veces al año, o haber bebido al menos seis veces en los últimos 12 meses. IMC calculado como peso ÷ altura2.

Preprocesamiento y selección de características para aprendizaje automático

Se incluyeron un total de 52 variables, incluyendo 45 continuas y 7 categóricas. Todos los procedimientos de preprocesamiento y selección de características —incluyendo la eliminación de multicolinealidad, la aplicación SMOTE y la selección de características basada en Boruta— se realizaron exclusivamente en el conjunto de entrenamiento para evitar fugas de datos. Para eliminar la multicolinealidad, primero se eliminaron las variables con coeficientes de correlación superiores a 0,9 y luego las variables con FIF mayores a 3.

Para mejorar el desequilibrio de clases y el reconocimiento de clases minoritarias (léase: más difíciles), se aplicó la Técnica de Sobremuestreo de Minorías Sintéticas (SMOTE) (Figura Suplementaria 1), que crea distancias entre muestras de clases minoritarias, calcula los k vecinos más cercanos para esas distancias y genera datos sintéticos en direcciones aleatorias para equilibrar las clases. A continuación, todas las variables utilizadas se estandarizaron.

La selección de características se completó con Boruta en Random Forests, generando las llamadas "características sombra" y "probándolas" frente a las características de entrada a lo largo de 500 iteraciones. Los clasificados como "confirmados" fueron retenidos para construir el modelo. Para información detallada sobre la sintonización de hiperparámetros, consulte la Tabla Suplementaria 1.

Análisis estadístico

Todos los análisis se realizaron de acuerdo con las directrices analíticas de NHANES. Las variables continuas se informaron como media ± desviaciones estándar (DS), mientras que las variables categóricas se expresaron como recuento y porcentaje. Las diferencias entre grupos se evaluaron utilizando chi-cuadrado o pruebas t de Student cuando era apropiado.

Para evitar el sobreajuste, los datos se particionaban aleatoriamente en un conjunto de entrenamiento7 y un conjunto de prueba. Usando MLR3, se construyeron seis algoritmos de aprendizaje automático: Random Forest, que construye muchos árboles de decisión y une sus predicciones, con un fuerte poder de generalización y consistencia; LightGBM basado en árboles de decisión potenciados por gradiente, que está ajustado para eficiencia y escala; K-KNN ordena las muestras según la proximidad que tienen a sus vecinas; K-KNN suele obtener mejores resultados en conjuntos de datos pequeños y no lineales; Naive Bayes, que utilizando el teorema de Bayes da simplicidad y es robusto; SVM que posee hiperplanos ideales para la tarea de clasificación, incluso para muestras de alta dimensionalidad; XGBoost es una forma de conjunto de aumento de gradiente que posee un alto rendimiento, incluso con conjuntos de datos muy grandes e incompletos.

El modelo se evaluó utilizando precisión, F-beta, área bajo las curvas ROC (AUC-ROC), la sensibilidad, especificidad y AUC-PR. El AUC-ROC es la métrica principal que utilizan, mientras que las otras métricas ofrecen una visión más profunda del rendimiento. Validan sus modelos mediante validación cruzada de diez veces para garantizar la estabilidad. Las diferencias en el rendimiento de sus modelos se evaluaron utilizando ANOVA y la prueba de Kruskal–Wallis H.

La interpretabilidad de características se investigó utilizando SHapley Aditivive ExPlanations (SHAP) y Local Interpretable Model-Agnostic Explanations (LIME). SHAP obtiene estimaciones de la contribución de cada característica a las predicciones del modelo utilizando valores de Shapley, basados en la teoría cooperativa de juegos, para representar tanto efectos lineales como interactivos. LIME obtiene la influencia de características aproximando modelos complejos con sustitutos más simples e interpretables (por ejemplo, regresiones de Lazo) para ayudar a explicar la influencia de características individuales. Todos los análisis se realizaron en IBM SPSS Statistics versión 24.0 y en R versión 4.3.0. Un valor p bilateral < 0,05 se considera estadísticamente significativo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Características basales según el estado de lombalis crónica

Las características basales estratificadas por el estado de lombalesis crónica se describen en la Tabla 1. La cohorte analítica final incluyó 8.710 participantes de NHANES 2001–2004 y 2009–2010, con una edad media de 49,13 años (DE = 18,43). De estos, 4.528 (51,99%) eran mujeres y 4.182 (48,01%) hombres. En total, 3.838 participantes reportaron tener LBP (edad media 4...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utilizó datos de NHANES y aplicó varios algoritmos, encontrando una asociación entre los micronutrientes dietéticos y la lombalgia crónica. Es importante destacar que, dado el diseño observacional transversal, estos hallazgos reflejan asociaciones predictivas más que relaciones causales, y los modelos de aprendizaje automático no pueden establecer causalidad entre la ingesta de micronutrientes y el riesgo de LBP. Tras la selección de características y las pruebas de colineal...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés que declarar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue apoyado por la Fundación del Proyecto Hangzhou para la Agricultura y el Desarrollo Social (20241029Y119), el Proyecto de Orientación del Plan de Ciencia y Tecnología del Distrito de Xiaoshan (2025316) y el Proyecto de Ciencia y Tecnología de la Medicina Tradicional China de la Provincia de Zhejiang (2024ZR152).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Método Automatizado de Paso Múltiple (AMPM)Centro Nacional de Estadísticas de Salud (NCHS), CDCN/ASistema de evaluación dietética utilizado en entrevistas de retiro dietético de 24 horas de NHANES para mejorar la precisión de los informes
Algoritmo BorutaCódigo abierto (paquete R: Boruta)N/AMétodo de selección de características basado en bosques aleatorios; Utilizado para identificar variables relevantes mediante comparación de características de sombra
Entrevistas personales asistidas por ordenador (CAPI)Centro Nacional de Estadísticas de Salud (NCHS), CDCN/ASistema de entrevistas utilizado por personal capacitado para recopilar datos de cuestionarios
Encuesta Nacional de Salud y Nutrición (NHANES)Centro Nacional de Estadísticas de Salud (NCHS), CDCN/AEncuesta nacional que proporciona datos demográficos, dietéticos y relacionados con la salud
Cuestionario sobre Condiciones de Próstata (KIQ)Centro Nacional de Estadísticas de Salud (NCHS), CDCN/AFuente del cuestionario utilizada para evaluar la información sobre el dolor de espalda
Algoritmo de Bosque AleatorioCódigo abierto (por ejemplo, implementaciones de R / Python)N/AModelo de aprendizaje automático utilizado en la selección y clasificación de características
Técnica de sobremuestreo de minorías sintéticas (SMOTE)Código abierto (por ejemplo, DMwR / desbalanceado-aprendizaje)N/ATécnica de sobremuestreo utilizada para abordar el desequilibrio de clases generando muestras sintéticas de minorías

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Predicci n de riesgosRandom Forestan lisis SHAPinterpretabilidad LIMEselecci n de caracter sticasdatos de NHANESestratificaci n del riesgo poblacional

Artículos relacionados