Article de recherche

Prédiction du risque de douleurs lombaires chroniques basée sur les oligo-éléments alimentaires à l’aide de multiples modèles d’apprentissage automatique et de cadres d’interprétabilité duale

DOI :

10.3791/70624

26 mai 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude étudie les associations entre les oligo-éléments alimentaires et les douleurs lombaires chroniques à l’aide des données NHANES. Des modèles d’apprentissage automatique interprétables sont appliqués pour évaluer la performance prédictive et identifier les nutriments associés à une réduction du risque, fournissant ainsi des informations sur les facteurs alimentaires potentiels liés aux douleurs lombaires.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La relation entre les oligo-éléments alimentaires et le risque de douleurs lombaires chroniques (LBP) reste incertaine. Les données de l’Enquête nationale sur la santé et la nutrition (NHANES) des cycles 2001–2004 et 2009–2010 ont été analysées. La multicolinéarité a été évaluée à l’aide des facteurs d’inflation de corrélation et de variance (VIF) de Spearman, et la sélection des caractéristiques a été réalisée à l’aide de l’algorithme Boruta. Six modèles d’apprentissage automatique ont ensuite été développés, avec SHAP et LIME appliqués pour améliorer l’interprétabilité et identifier les principales associations entre les otrace-éléments alimentaires et le risque de LBP. Parmi les modèles évalués, Random Forest a démontré la meilleure performance prédictive, tant en intégrant des variables démographiques qu’en utilisant uniquement des oligo-éléments alimentaires. Les analyses d’interprétabilité ont constamment identifié plusieurs composantes alimentaires — dont l’hydratation, la théobromine, le calcium, la caféine, le sodium et la vitamine C — comme étant inversement associées au risque de lésbie lésbicique. Bien que la discrimination des modèles ait été modérée (AUC ≈ 0,60–0,72), ces résultats révèlent des schémas cliniquement pertinents qui pourraient soutenir une stratification du risque au niveau de la population et mettre en lumière des facteurs alimentaires potentiellement modifiables pour de futures recherches.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La douleur lombaire chronique (LBP) est l’un des troubles musculosquelettiques les plus répandus dans le monde et comporte des coûts socio-économiques importants liés au handicap, aux soins de santé et à la perte de qualité de vie. Les données épidémiologiques indiquent que 7 à 10 % des adultes déclarent la lombie à l’échelle mondiale, avec une prévalence à vie atteignant parfois 84 %. Elle est la plus fréquente dans les pays à revenu faible/intermédiaire, où les facteurs liés au travail, le faible accès aux services de santé et les inégalités socio-économiques augmentent le risque, avec une prévalence souvent supérieure à 20 % chez les adultes en âge detravailler 2. Les adolescents et les personnes âgées, en particulier, sont plus vulnérables aux changements structurels et dégénératifs tels que la dégénérescence des disques intervertébraux et l’ostéoporose3.

La LBP est une maladie multifactorielle influencée par des facteurs biomécaniques, psychosociaux, génétiques et nutritionnels, nécessitant des méthodes analytiques capables de capturer simultanément les interactions complexes entre ces variables diverses. Les revues systématiques récentes continuent de souligner que l’étiologie de la LBP reste énigmatique, influencée par des facteurs biomécaniques, psychosociaux et génétiques, et qu’il est donc difficile de la déterminer avec précision. Plus de 85 % des cas de « LBP sont non spécifiques » – ce qui rend le développement de la prévention et du traitement ciblésdifficile 4,5. Bien que les thérapies multimodales combinant méthodes physiques et pharmacologiques tendent à apporter un soulagement symptomatique, de nombreux patients restent récurrents, un signe qui indique un besoin urgent de nouveaux facteurs de risque évitables et modifiables pour lalombalesie 6.

Les méthodes statistiques traditionnelles sont limitées pour traiter cette complexité, car elles reposent souvent sur des hypothèses linéaires et ne modélisent pas adéquatement les interactions à haute dimension et les relations non linéaires inhérentes aux données multifactorielles telles que les profils alimentaires NHANES. En revanche, les approches d’apprentissage automatique offrent une utilité supérieure en traitant simultanément un grand nombre de variables, en détectant des motifs et interactions subtils, et en fournissant des prédictions robustes pour des maladies comme la lombalesie où plusieurs facteurs convergent.

Les micronutriments alimentaires, y compris les vitamines, minéraux et oligo-éléments, sont nécessaires à l’équilibre physiologique et contribuent à réduire le risque de maladies chroniques. Les vitamines antioxydantes E (α-tocophérol) et C réduisent les dommages oxydatifs présents dans les maladies cardiovasculaires etneurodégénératives 7,8. Les vitamines du complexe B, telles que la thiamine (vitamine B1), la pyridoxine (vitamine B6), le folate et la cobalamine (vitamine B12), sont également immunorégulatrices et facilitent le métabolisme énergétique cellulaire ; dont des carences ont été associées au cancer, à l’infertilité et à une humeurdépressive 9,10,11. Les minéraux, en particulier le magnésium, le zinc, le cuivre et le sélénium, participent aux voies enzymatiques et anti-inflammatoires qui préviennent la sarcopénie, l’endométriose et les pertes nutritionnelles postopératoires après une chirurgiebariatrique 12. Les revues narratives soulignent leur importance dans la prévention des comorbidités liées à l’obésité et des affections cutanées telles que la dermatite séborrhéique et l’alopécie areata, via la modulation lipidique et les rôlesimmunologiques 13,14. Dans l’ensemble, un signe que la meilleure approche pour la santé communautaire pourrait être une apport adéquat en micronutriments, bien que les essais interventionnels montrent en grande partie des résultats hétérogènes basés sur des facteurscontextuels 15,16.

De plus, des applications d’apprentissage automatique intégrant des données nutritionnelles ont montré leur efficacité pour élucider les facteurs de risque d’autres maladies musculo-squelettiques, comme la prédiction du risque d’arthrite à partir des données del’enquête 17 et l’identification des facteurs liés au mode de vie (y compris l’alimentation) à la lombalesie et aux affections associées dans les cohortespopulationnelles 18.

Malgré une richesse de liens entre les micronutriments et les maladies chroniques, la relation entre les micronutriments alimentaires et le risque de lésbie reste peu définie, et les mécanismes d’action restent incertains. Bien que les études observationnelles rapportent fréquemment des carences en vitamine D, magnésium et antioxydants chez les personnes atteintes de lombale, les méta-analyses des essais de supplémentation — en particulier ceux impliquant de la vitamine D — ont produit des preuves limitées et incohérentes de soulagementde la douleur 19,20.

Un examen systématique de la littérature existante révèle des limites clés : la dépendance à des plans transversals et cas-témoins qui ne peuvent pas établir lacausalité 21 ; contrôle inadéquat des facteurs de confusion, y compris la démographie, le mode de vie et lescomorbidités 20,22 ; des échantillons petits et non représentatifs ; définitions variables de l’état des micronutriments et des conséquences de la douleur ; et un accent sur les nutriments isolés sans prendre en compte les synergies ou antagonismesalimentaires 23. Ces lacunes ont freiné le développement d’informations claires et exploitables sur la modulation nutritionnelle de la largibile.

Pour une structure hypothétique plus explicite, il est proposé que les micronutriments exercent des effets protecteurs contre la lombalesie par une triade de voies mécanistiques liées : des actions antioxydantes et anti-inflammatoires qui atténuent le stress oxydatif et la neuroinflammation (vitamines C, E, sélénium, zinc, magnésium) ; le soutien à la réparation neuronale et à l’atténuation des lésions induites par l’homocystéine (vitamines du complexe B) ; et l’amélioration de l’homéostasie osseuse et musculaire via la signalisation minérale et la régulation calcique médiée par la vitamine D (vitamine D, magnésium, calcium). Un tel cadre met en lumière l’interaction bidirectionnelle entre l’état des micronutriments, l’inflammation systémique et la chronicité de la douleur, comme en témoignent les associations avec des régimes pro-inflammatoires24.

Des études transversales indiquent que les régimes pro-inflammatoires dépourvus de micronutriments produisent des niveaux plus élevés de douleurs abdominales ou chroniques, suggérant une association bidirectionnelle dans laquelle un manque d’apports en micronutriments aggrave l’inflammation systémique et la douleur24.

Pour répondre à ces problèmes, ils ont développé plusieurs modèles ML incorporant un large éventail de micronutriments alimentaires (vitamines (E, A, B1, B6, B12, C, K), minéraux (calcium, magnésium, fer, zinc, cuivre, sélénium) et d’autres éléments alimentaires tels que les fibres, les acides gras polyinsaturés, le potassium et la caféine) avec les données NHANES pour prédire le risque de lésbie lésique (LBP). Cette stratégie basée sur l’apprentissage automatique convient particulièrement à la nature multifactorielle de la LBP, car elle surmonte les limites des statistiques traditionnelles en modélisant simultanément des associations complexes et non linéaires entre facteurs nutritionnels et autres facteurs de risque. Cette exploration plus exhaustive permet de traiter des associations non linéaires et fournit une équation robuste pour les principaux prédicteurs LBP. En utilisant les valeurs SHAP pour l’interprétabilité globale, ils peuvent observer comment les combinaisons de nutriments influencent le risque de lb, ce qui ouvre la porte à des interventions personnalisées et à des études nutrigénomiques.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette enquête a été approuvée par le Conseil d’éthique du National Center for Health Statistics (NCHS), et le consentement éclairé a été obtenu de tous les participants. Les données du NHANES accessibles au public ont été utilisées conformément aux directives pertinentes.

Population étudiée

L’Enquête nationale sur la santé et la nutrition (NHANES), menée par le NCHS, fournit des données représentatives à l’échelle nationale sur la santé et l’état nutritionnel de la population américaine non institutionnalisée. Les données des cycles 2001–2004 et 2009–2010 ont été récupérées. Les participants âgés de ≥18 ans ont été inclus, tandis que les individus ayant manqué de données sur la lombie chronique, les micronutriments alimentaires, le niveau d’éducation ou les covariables clés — y compris le ratio pauvreté-revenu (IPR), l’indice de masse corporelle (IMC), le statut tabagique, l’hypertension, le diabète et la consommation d’alcool — ont été exclus. La cohorte analytique finale comprenait 8 710 participants (Figure 1).

Évaluation des nutriments alimentaires

Les données sur l’apport alimentaire ont été obtenues à partir de deux entretiens de rappel alimentaire de 24 heures. Le premier entretien a été réalisé dans un centre mobile d’examen, et le second a été réalisé par téléphone en quelques jours. La méthode automatisée à passages multiples a été appliquée pour améliorer la précision des rappels et minimiser les biais de signalement. Les procédures détaillées de l’AMPM sont décrites dans la documentation de la méthodologie alimentaire NHANES.

Évaluation de la lambique chronique

Le statut de lombalgie chronique a été déterminé à l’aide de données de questionnaire. Les participants ont été classés comme ayant une lombalgie s’ils ont rapporté des douleurs dorsales durant ≥3 mois.

Covariables

Les caractéristiques démographiques comprenaient l’âge, le sexe, la race/l’ethnicité (Mexicano-Américain, autres Hispaniques, Blancs non hispaniques, Noirs non hispaniques, Autres races), l’éducation (< 9e année, 9e–11e), le diplôme (diplôme d’études secondaires/GED, certains diplômes universitaires/AA et diplômés universitaires), le ratio revenu/pauvreté familiale (PIR), l’indice de masse corporelle (IMC), le statut tabagiste ainsi que le niveau d’alcool et les antécédents d’hypertension et de diabète. L’hypertension a été définie sur la base d’un diagnostic auto-déclaré par le médecin ou de l’utilisation actuelle de médicaments antihypertenseurs. Le diabète a été défini à partir d’un diagnostic médical auto-déclaré, d’un taux de glucose élevé après un test de tolérance au glucose de 2 heures (≥11,1 mmol/L), ou de l’hémoglobine glicchée ≥6,5 % ou de la glycémie à jeun ≥7,0 mmol/L. Le prédiabète a été défini comme étant informé par un médecin d’un prédiabète, une tolérance à la glycémie OGTT à 2 heures de 7,8–11,1 mmol/L, une glycémie à jeun de 6,1–6,9 mmol/L, ou une valeur d’HbA1c comprise entre 5,7 % et 6,4 %. Le statut du tabagisme était défini comme (1) Non courant avant le mois dernier, ou arrêté depuis plus d’un an, et (2) fumer actuellement (auto-déclaration récente) est défini comme fumer plus de 2 cigarettes par jour après avoir repris l’habitude ou avant d’arrêter. En ce qui concerne le statut de consommation d’alcool, deux définitions existent : (1) les non-buveurs à vie sans consommation préalable d’alcool (<12 au total), et (2) les buveurs actuels qui déclarent avoir bu ≥12 fois par an, ou avoir bu au moins six fois au cours des 12 derniers mois. IMC calculé comme poids ÷ taille2.

Prétraitement et sélection de fonctionnalités pour l’apprentissage automatique

Un total de 52 variables, dont 45 continues et 7 variables catégorielles, ont été incluses. Toutes les procédures de prétraitement et de sélection de caractéristiques — y compris la suppression de multicolinéarité, l’application SMOTE et la sélection de fonctionnalités basée sur Boruta — étaient réalisées exclusivement sur l’ensemble d’entraînement afin d’éviter la fuite de données. Pour éliminer la multicolinéarité, les variables ayant des coefficients de corrélation supérieures à 0,9 ont été d’abord supprimées, puis les variables avec des FIF supérieures à 3.

Pour améliorer le déséquilibre de classes et la reconnaissance des classes minoritaires (lire : plus difficiles), la technique de suréchantillonnage des minorités synthétiques (SMOTE) a été appliquée (Figure supplémentaire 1), qui crée des distances entre les échantillons de classes minoritaires, calcule les k plus proches voisins pour ces distances, et génère des données synthétiques dans des directions aléatoires pour équilibrer les classes. Toutes les variables utilisées ont ensuite été standardisées.

La sélection des fonctionnalités a été réalisée avec Boruta sur Random Forests, générant les soi-disant « shadow features » et les « testant » par rapport aux fonctionnalités d’entrée sur plus de 500 itérations. Ceux classés comme « confirmés » ont été retenus pour construire le modèle. Pour des informations détaillées sur l’ajustement des hyperparamètres, veuillez consulter le Tableau Supplémentaire 1.

Analyse statistique

Toutes les analyses ont été réalisées conformément aux directives analytiques du NHANES. Les variables continues étaient rapportées en moyenne ± écarts-types (DE), tandis que les variables catégorielles étaient exprimées en nombre et en pourcentage. Les différences entre groupes ont été testées à l’aide de tests chi-carrés ou de tests t de Student, lorsque cela était approprié.

Pour éviter le sur-ajustement, les données étaient partitionnées aléatoirement en un ensemble d’entraînement7 et un ensemble de test. En utilisant MLR3, six algorithmes d’apprentissage automatique ont été construits : Random Forest qui construit de nombreux arbres de décision et joint leurs prédictions, doté d’un fort pouvoir de généralisation et de cohérence ; LightGBM basé sur des arbres de décision boostés par gradient, qui est ajusté pour l’efficacité et l’échelle ; K-KNN trie les échantillons selon leur proximité avec leurs voisins : K-KNN donne généralement de meilleurs résultats sur de petits ensembles de données non linéaires ; Naive Bayes, qui, en utilisant le théorème de Bayes, donne de la simplicité et est robuste ; SVM qui possède des hyperplans idéaux pour la tâche de classification, même pour des échantillons de haute dimensionnalité ; XGBoost est une forme d’ensemble de gradient boosting qui possède de hautes performances, même avec des ensembles de données très volumineux et incomplets.

Le modèle a été évalué à l’aide de la précision, du F-bêta, de la zone sous les courbes ROC (AUC-ROC), de la sensibilité, de la spécificité et de l’AUC-PR. L’AUC-ROC est la principale métrique qu’ils utilisent, tandis que les autres indicateurs offrent des analyses plus approfondies sur la performance. Ils valident leurs modèles en utilisant une validation croisée dix fois plus grande pour garantir la stabilité. Les différences dans la performance de leurs modèles ont été évaluées à l’aide d’ANOVA et du test H de Kruskal–Wallis.

L’interprétabilité des caractéristiques a été étudiée à l’aide des explications additives SHAPs (SHAP) et des explications indépendantes du modèle interprétable local (LIME). SHAP estime la contribution de chaque caractéristique aux prédictions du modèle en utilisant les valeurs de Shapley, basées sur la théorie coopérative des jeux, pour représenter à la fois des effets linéaires et interactifs. LIME dérive l’influence des caractéristiques en approximant des modèles complexes avec des substituts plus simples et interprétables (par exemple, des régressions de Lasso) afin d’aider à expliquer l’influence des caractéristiques individuelles. Toutes les analyses ont été réalisées dans IBM SPSS Statistics version 24.0 et R version 4.3.0. Une valeur p à deux côtés < 0,05 est considérée comme statistiquement significative.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Caractéristiques de base selon le statut chronique de lésbile

Les caractéristiques de base stratifiées par le statut de lésbie chronique sont décrites dans le tableau 1. La cohorte analytique finale comprenait 8 710 participants issus du NHANES 2001–2004 et 2009–2010, avec un âge moyen de 49,13 ans (DE = 18,43). Parmi eux, 4 528 (51,99 %) étaient des femmes et 4 182 (48,01 %) des hommes. Au total, 3 838 participants ont déclar...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a utilisé les données NHANES et a appliqué plusieurs algorithmes, trouvant une association entre les micronutriments alimentaires et la lombie chronique. Il est important de noter que, compte tenu du plan observationnel transversal, ces résultats reflètent des associations prédictives plutôt que des relations causales, et les modèles d’apprentissage automatique ne peuvent pas établir la causalité entre l’apport en micronutriments et le risque de lombale. Après la sélection de...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a été soutenu par la Fondation du Projet Hangzhou pour l’agriculture et le développement social (20241029Y119), le projet d’orientation du plan scientifique et technologique du district de Xiaoshan (2025316), et le projet de science et technologie de la médecine traditionnelle chinoise de la province du Zhejiang (2024ZR152).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Méthode automatisée à passes multiples (AMPM)Centre national des statistiques de la santé (NCHS), CDCN/ASystème d’évaluation alimentaire utilisé lors des entretiens de rappel alimentaire 24 heures sur 24 NHANES pour améliorer la précision des rapports
Algorithme de BorutaOpen source (paquet R : Boruta)N/AMéthode de sélection des caractéristiques basée sur des forêts aléatoires ; Utilisé pour identifier les variables pertinentes via la comparaison des caractéristiques d’ombre
Entretien personnel assisté par ordinateur (CAPI)Centre national des statistiques de la santé (NCHS), CDCN/ASystème d’entretien utilisé par le personnel formé pour collecter les données des questionnaires
Enquête nationale sur l’examen de santé et de nutrition (NHANES)Centre national des statistiques de la santé (NCHS), CDCN/AEnquête nationale fournissant des données démographiques, alimentaires et liées à la santé
Questionnaire sur les conditions de la prostate (QI)Centre national des statistiques de la santé (NCHS), CDCN/ASource du questionnaire utilisée pour évaluer les informations sur les douleurs dorsales
Algorithme de forêt aléatoireOpen source (par exemple, implémentations R / Python)N/AModèle d’apprentissage automatique utilisé dans la sélection et la classification des caractéristiques
Technique de suréchantillonnage des minorités synthétiques (SMOTE)Open source (par exemple, DMwR / déséquilibré-apprentissage)N/ATechnique de suréchantillonnage utilisée pour corriger le déséquilibre de classe en générant des échantillons de minorités synthétiques

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Pr diction des risquesFor t al atoireAnalyse SHAPInterpr tabilit LIMES lection de caract ristiquesDonn es NHANESStratification du risque populationnel

Articles connexes