$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Cette enquête a été approuvée par le Conseil d’éthique du National Center for Health Statistics (NCHS), et le consentement éclairé a été obtenu de tous les participants. Les données du NHANES accessibles au public ont été utilisées conformément aux directives pertinentes.
Population étudiée
L’Enquête nationale sur la santé et la nutrition (NHANES), menée par le NCHS, fournit des données représentatives à l’échelle nationale sur la santé et l’état nutritionnel de la population américaine non institutionnalisée. Les données des cycles 2001–2004 et 2009–2010 ont été récupérées. Les participants âgés de ≥18 ans ont été inclus, tandis que les individus ayant manqué de données sur la lombie chronique, les micronutriments alimentaires, le niveau d’éducation ou les covariables clés — y compris le ratio pauvreté-revenu (IPR), l’indice de masse corporelle (IMC), le statut tabagique, l’hypertension, le diabète et la consommation d’alcool — ont été exclus. La cohorte analytique finale comprenait 8 710 participants (Figure 1).
Évaluation des nutriments alimentaires
Les données sur l’apport alimentaire ont été obtenues à partir de deux entretiens de rappel alimentaire de 24 heures. Le premier entretien a été réalisé dans un centre mobile d’examen, et le second a été réalisé par téléphone en quelques jours. La méthode automatisée à passages multiples a été appliquée pour améliorer la précision des rappels et minimiser les biais de signalement. Les procédures détaillées de l’AMPM sont décrites dans la documentation de la méthodologie alimentaire NHANES.
Évaluation de la lambique chronique
Le statut de lombalgie chronique a été déterminé à l’aide de données de questionnaire. Les participants ont été classés comme ayant une lombalgie s’ils ont rapporté des douleurs dorsales durant ≥3 mois.
Covariables
Les caractéristiques démographiques comprenaient l’âge, le sexe, la race/l’ethnicité (Mexicano-Américain, autres Hispaniques, Blancs non hispaniques, Noirs non hispaniques, Autres races), l’éducation (< 9e année, 9e–11e), le diplôme (diplôme d’études secondaires/GED, certains diplômes universitaires/AA et diplômés universitaires), le ratio revenu/pauvreté familiale (PIR), l’indice de masse corporelle (IMC), le statut tabagiste ainsi que le niveau d’alcool et les antécédents d’hypertension et de diabète. L’hypertension a été définie sur la base d’un diagnostic auto-déclaré par le médecin ou de l’utilisation actuelle de médicaments antihypertenseurs. Le diabète a été défini à partir d’un diagnostic médical auto-déclaré, d’un taux de glucose élevé après un test de tolérance au glucose de 2 heures (≥11,1 mmol/L), ou de l’hémoglobine glicchée ≥6,5 % ou de la glycémie à jeun ≥7,0 mmol/L. Le prédiabète a été défini comme étant informé par un médecin d’un prédiabète, une tolérance à la glycémie OGTT à 2 heures de 7,8–11,1 mmol/L, une glycémie à jeun de 6,1–6,9 mmol/L, ou une valeur d’HbA1c comprise entre 5,7 % et 6,4 %. Le statut du tabagisme était défini comme (1) Non courant avant le mois dernier, ou arrêté depuis plus d’un an, et (2) fumer actuellement (auto-déclaration récente) est défini comme fumer plus de 2 cigarettes par jour après avoir repris l’habitude ou avant d’arrêter. En ce qui concerne le statut de consommation d’alcool, deux définitions existent : (1) les non-buveurs à vie sans consommation préalable d’alcool (<12 au total), et (2) les buveurs actuels qui déclarent avoir bu ≥12 fois par an, ou avoir bu au moins six fois au cours des 12 derniers mois. IMC calculé comme poids ÷ taille2.
Prétraitement et sélection de fonctionnalités pour l’apprentissage automatique
Un total de 52 variables, dont 45 continues et 7 variables catégorielles, ont été incluses. Toutes les procédures de prétraitement et de sélection de caractéristiques — y compris la suppression de multicolinéarité, l’application SMOTE et la sélection de fonctionnalités basée sur Boruta — étaient réalisées exclusivement sur l’ensemble d’entraînement afin d’éviter la fuite de données. Pour éliminer la multicolinéarité, les variables ayant des coefficients de corrélation supérieures à 0,9 ont été d’abord supprimées, puis les variables avec des FIF supérieures à 3.
Pour améliorer le déséquilibre de classes et la reconnaissance des classes minoritaires (lire : plus difficiles), la technique de suréchantillonnage des minorités synthétiques (SMOTE) a été appliquée (Figure supplémentaire 1), qui crée des distances entre les échantillons de classes minoritaires, calcule les k plus proches voisins pour ces distances, et génère des données synthétiques dans des directions aléatoires pour équilibrer les classes. Toutes les variables utilisées ont ensuite été standardisées.
La sélection des fonctionnalités a été réalisée avec Boruta sur Random Forests, générant les soi-disant « shadow features » et les « testant » par rapport aux fonctionnalités d’entrée sur plus de 500 itérations. Ceux classés comme « confirmés » ont été retenus pour construire le modèle. Pour des informations détaillées sur l’ajustement des hyperparamètres, veuillez consulter le Tableau Supplémentaire 1.
Analyse statistique
Toutes les analyses ont été réalisées conformément aux directives analytiques du NHANES. Les variables continues étaient rapportées en moyenne ± écarts-types (DE), tandis que les variables catégorielles étaient exprimées en nombre et en pourcentage. Les différences entre groupes ont été testées à l’aide de tests chi-carrés ou de tests t de Student, lorsque cela était approprié.
Pour éviter le sur-ajustement, les données étaient partitionnées aléatoirement en un ensemble d’entraînement7 et un ensemble de test. En utilisant MLR3, six algorithmes d’apprentissage automatique ont été construits : Random Forest qui construit de nombreux arbres de décision et joint leurs prédictions, doté d’un fort pouvoir de généralisation et de cohérence ; LightGBM basé sur des arbres de décision boostés par gradient, qui est ajusté pour l’efficacité et l’échelle ; K-KNN trie les échantillons selon leur proximité avec leurs voisins : K-KNN donne généralement de meilleurs résultats sur de petits ensembles de données non linéaires ; Naive Bayes, qui, en utilisant le théorème de Bayes, donne de la simplicité et est robuste ; SVM qui possède des hyperplans idéaux pour la tâche de classification, même pour des échantillons de haute dimensionnalité ; XGBoost est une forme d’ensemble de gradient boosting qui possède de hautes performances, même avec des ensembles de données très volumineux et incomplets.
Le modèle a été évalué à l’aide de la précision, du F-bêta, de la zone sous les courbes ROC (AUC-ROC), de la sensibilité, de la spécificité et de l’AUC-PR. L’AUC-ROC est la principale métrique qu’ils utilisent, tandis que les autres indicateurs offrent des analyses plus approfondies sur la performance. Ils valident leurs modèles en utilisant une validation croisée dix fois plus grande pour garantir la stabilité. Les différences dans la performance de leurs modèles ont été évaluées à l’aide d’ANOVA et du test H de Kruskal–Wallis.
L’interprétabilité des caractéristiques a été étudiée à l’aide des explications additives SHAPs (SHAP) et des explications indépendantes du modèle interprétable local (LIME). SHAP estime la contribution de chaque caractéristique aux prédictions du modèle en utilisant les valeurs de Shapley, basées sur la théorie coopérative des jeux, pour représenter à la fois des effets linéaires et interactifs. LIME dérive l’influence des caractéristiques en approximant des modèles complexes avec des substituts plus simples et interprétables (par exemple, des régressions de Lasso) afin d’aider à expliquer l’influence des caractéristiques individuelles. Toutes les analyses ont été réalisées dans IBM SPSS Statistics version 24.0 et R version 4.3.0. Une valeur p à deux côtés < 0,05 est considérée comme statistiquement significative.