$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Questa indagine è stata approvata dal Consiglio di Revisione Etica del National Center for Health Statistics (NCHS) e è stato ottenuto il consenso informato da tutti i partecipanti. I dati NHANES pubblicamente disponibili sono stati utilizzati in conformità con le linee guida pertinenti.
Popolazione dello studio
Il National Health and Nutrition Examination Survey (NHANES), condotto dal NCHS, fornisce dati rappresentativi a livello nazionale sullo stato di salute e nutrizionale della popolazione statunitense non istituzionalizzata. Sono stati recuperati i dati dei cicli 2001–2004 e 2009–2010. Sono stati inclusi i partecipanti di età ≥18 anni, mentre sono stati esclusi individui con dati mancanti su loglibia cronica, micronutrienti alimentari, livello di istruzione o covariazioni chiave—inclusi rapporto povertà-reddito (PIR), indice di massa corporea (BMI), stato di fumo, ipertensione, diabete e consumo di alcol. La coorte analitica finale comprendeva 8.710 partecipanti (Figura 1).
Valutazione dei nutrienti alimentari
I dati sull'assunzione dietetica sono stati raccolti utilizzando due interviste di richiamo dietetico di 24 ore. Il primo colloquio è stato condotto in un Centro Esami Mobile, e il secondo è stato completato telefonicamente nel giro di pochi giorni. Il Metodo Automatico a Passaggi Multipli è stato applicato per migliorare la precisione del richiamo e minimizzare il bias di segnalazione. Le procedure dettagliate dell'AMPM sono descritte nella documentazione della metodologia dietetica NHANES.
Valutazione della lombalgia cronica
Lo stato cronico della lombalgie è stato determinato utilizzando i dati del questionario. I partecipanti sono stati classificati come affettivi di lombalgie se hanno riportato dolori alla schiena durati ≥3 mesi.
Covariate
Le caratteristiche demografiche includevano età, sesso, razza/etnia (messicano-americano, altri ispanici, bianchi non ispanici, neri non ispanici, altre razze), istruzione (<9ª classe, 9ª–11ª), titolo di studio (diploma/GED, alcuni titoli universitari/AA e laureati), rapporto reddito-povertà familiare (PIR), indice di massa corporea (BMI), stato di fumo, stato di consumo e storia di ipertensione e diabete. L'ipertensione è stata definita in base alla diagnosi auto-riferita dal medico o all'uso attuale di farmaci antiipertensivi. Il diabete è stato definito tramite diagnosi auto-riferite dal medico, livelli elevati di glucosio dopo un test di tolleranza al glucosio di 2 ore (≥11,1 mmol/L), o emoglobina glicatrice ≥6,5% o glucosio a digiuno ≥7,0 mmol/L. Il prediabete è stato definito come l'essere stato informato da un medico che si aveva prediabete, valori di tolleranza al glucosio OGTT a 2 ore di 7,8–11,1 mmol/L, glicemia a digiuno di 6,1–6,9 mmol/L, oppure un valore di HbA1c compreso tra il 5,7% e il 6,4%. Lo stato del fumo era definito come (1) Non corrente prima dell'ultimo mese, o smesso da più di un anno, e (2) fumare attualmente (auto-dichiarazione recente) è definito come fumare più di 2 sigarette al giorno dopo aver ripreso l'abitudine o prima di smettere. Per quanto riguarda lo stato di alcol, esistono due definizioni: (1) chi non beve a vita senza alcun consumo precedente di alcol (<12 in totale), e (2) chi ha bevuto attualmente e dichiara di aver bevuto ≥12 volte all'anno, o di aver bevuto almeno sei volte negli ultimi 12 mesi. IMC calcolato come peso ÷altezza2.
Preprocessing e selezione delle funzionalità per il machine learning
Sono state incluse in totale 52 variabili, tra cui 45 continue e 7 variabili categoriche. Tutte le procedure di preprocessing e selezione delle funzionalità — inclusa la rimozione della multicollinearità, l'applicazione SMOTE e la selezione delle funzionalità basate su Boruta — venivano eseguite esclusivamente sul set di addestramento per prevenire la perdita di dati. Per eliminare la multicollinearità, sono state rimosse prima le variabili con coefficienti di correlazione superiori a 0,9, e poi le variabili con VIF maggiori di 3.
Per migliorare lo squilibrio di classe e il riconoscimento delle classi minoritarie (leggi: più difficili), è stata applicata la Tecnica di Sovracampionamento Sintetico delle Minoranze (SMOTE) (Figura Supplementare 1), che crea distanze tra campioni di classi minoritarie, calcola i k-vicini più prossimi per tali distanze e genera dati sintetici in direzioni casuali per bilanciare le classi. Tutte le variabili utilizzate sono state poi standardizzate.
La selezione delle caratteristiche è stata completata con Boruta su Foreste Casuali, generando le cosiddette "caratteristiche ombra" e "testandole" rispetto alle funzionalità di input in oltre 500 iterazioni. Coloro che sono stati classificati come "confermati" sono stati mantenuti per costruire il modello. Per informazioni dettagliate sulla sintonia degli iperparametri, si prega di consultare la Tabella Supplementare 1.
Analisi statistica
Tutte le analisi sono state condotte in conformità con le linee guida analitiche NHANES. Le variabili continue sono state riportate come media ± deviazioni standard (SD), mentre le variabili categoriche sono state espresse come conteggio e percentuale. Le differenze tra i gruppi sono state testate utilizzando chi-quadrato o test t di Student, dove appropriato.
Per evitare l'overfitting, i dati venivano suddivisi casualmente in un set diaddestramento 7 e un set di test. Utilizzando MLR3, sono stati costruiti sei algoritmi di machine learning: Random Forest che costruisce molti alberi decisionali e unisce le loro previsioni, avendo forte potere di generalizzazione e coerenza; LightGBM basato su alberi decisionali potenziati dal gradiente, ottimizzati per efficienza e scala; K-KNN ordina i campioni in base alla loro vicinanza ai vicini, K-KNN ottiene tipicamente risultati migliori su piccoli dataset non lineari; Naive Bayes, che utilizzando il teorema di Bayes dà semplicità ed è robusto; SVM che possiede iperpiani ideali per il compito di classificazione, anche per campioni ad alta dimensionalità; XGBoost è una forma di ensemble di gradient boosting che possiede alte prestazioni, anche con dataset molto grandi e incompleti.
Il modello è stato valutato utilizzando accuratezza, F-beta, area sotto le curve ROC (AUC-ROC), sensibilità, specificità e AUC-PR. L'AUC-ROC è la metrica principale che utilizzano, mentre le altre metriche offrono approfondimenti sulle prestazioni. Convalidano i loro modelli utilizzando la validazione incrociata dieci volte per garantire la stabilità. Le differenze nelle prestazioni dei loro modelli sono state valutate utilizzando ANOVA e il test Kruskal–Wallis H.
L'interpretabilità delle caratteristiche è stata studiata utilizzando SHapley Additives ExPlanations (SHAP) e Local Interpretable Model-agnostic Explanations (LIME). SHAP deduce stime del contributo di ogni caratteristica alle previsioni del modello utilizzando i valori di Shapley, basati sulla teoria dei giochi cooperativi, per rappresentare sia effetti lineari che interattivi. LIME deriva l'influenza delle caratteristiche approssimando modelli complessi con surrogati più semplici e interpretabili (ad esempio, regressioni di Lasso) per aiutare a spiegare l'influenza delle singole caratteristiche. Tutte le analisi sono state effettuate in IBM SPSS Statistics versione 24.0 e in R versione 4.3.0. Un p-value a due code < 0,05 è considerato statisticamente significativo.