$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Pazienti e progettazione dello studio
Il primo dataset di questo studio è stato ottenuto dal database del National Health and Nutrition Examination Survey (NHANES) per il periodo 2017–2018. Questo periodo di tempo specifico è stato scelto perché i dati del sondaggio includevano misurazioni di elastografia transitoria a ultrasuoni epatici utilizzando la tecnologia FibroScan®. NHANES adotta un design di campionamento probabilistico stratificato e multi-stadio e funge da indagine nazionale basata sulla popolazione condotta biennale. Raccoglie sistematicamente dati sanitari rappresentativi a livello nazionale sulla popolazione statunitense non istituzionalizzata per valutare lo stato nutrizionale e sanitario della popolazione civile generale negliStati Uniti. Il NHANES è uno studio trasversale rappresentativo a livello nazionale amministrato dal National Center for Health Statistics (NCHS). Il protocollo del sondaggio ha ricevuto l'approvazione del Consiglio di Revisione Etica della Ricerca NCHS, con il consenso informato documentato ottenuto da tutti i partecipanti. Lo studio è stato condotto in conformità sia con le Dichiarazioni di Helsinki che quelle di Istanbul, ed è stato approvato dal comitato etico del Primo Ospedale Affiliato dell'Università Medica di Wenzhou (2016–246, 1° dicembre 2016), e ciascun partecipante ha ottenuto il consenso scritto e informato.
Il primo dataset era composto da 5494 individui del sondaggio NHANES 2017–2018 che hanno sottoposto l'esame FibroScan. A seguito dell'esclusione di seguito, un totale di 2677 partecipanti è stato incluso nell'analisi, comprendendo 718 individui con NAFLD e 1959 con non-NAFLD. Questi partecipanti sono stati poi divisi casualmente in un set di addestramento (n = 1785) e un set di test (n = 892). Il secondo dataset comprendeva 582 individui del Dipartimento di Malattie Infettive del Primo Ospedale Affiliato dell'Università Medica di Wenzhou (2018–2020). Dopo aver applicato gli stessi criteri di esclusione, sono stati inclusi in totale 200 individui, di cui 159 individui con NAFLD e 41 individui con non-NAFLD. Questa coorte è stata utilizzata come insieme di validazione indipendente. Il disegno dello studio è stato sviluppato per costruire e validare il modello utilizzando dati multicentrici, migliorando così l'affidabilità e la generalizzazione dei risultati. Le caratteristiche cliniche di base dei gruppi NAFLD e non-NAFLD sono state riassunte utilizzando il pacchetto della tabella uno (Tabella 1). Inoltre, il processo di selezione dei pazienti e il flusso complessivo dello studio sono illustrati nella Figura 1.
Criteri diagnostici e criteri di esclusione per la NAFLD
La diagnosi di NAFLD si basava sui seguenticriteri: 16 anni: età di 18 anni o più, partecipazione allo screening di elastografia transitoria (FibroScan) con assunzione di alcol limitata a ≤140 g/settimana per le donne e ≤ 210 g/settimana per gli uomini negli ultimi 12 mesi, un valore del parametro di attenuazione controllata (CAP) di ≥ 302 dB/m misurato utilizzando il sistema FibroScan 502 V2 Touch (Echosens, Parigi, Francia) con una sonda media (M) o extra-large (XL), oppure una diagnosi confermata da patologia biopsia epatica presso il Dipartimento di Malattie Infettive del Primo Ospedale Affiliato dell'Università Medicadi Wenzhou 23.
I criteri di esclusione per la NAFLD sono descritti come segue:.consumo elevato di alcol (assunzione media giornaliera > 20 g per le donne e > 30 g per gli uomini secondo il sondaggioNHANES sull'uso di alcol 5), presenza di epatite B o C, infezione da HIV, epatite autoimmune, colangite biliare primaria, malattia di Wilson, uso prolungato di farmaci antinfiammatori non steroidei, bloccanti dei canali di calcio, tamoxifene, amiodarone, corticosteroidi, isoniazide o metotrexato, gravidanza o allattamento, e una diagnosi di cancro al fegato o di qualsiasi altro tumore benigno o maligno.
Raccolta dati e selezione delle variabili
Le variabili potenziali predittive incluse in questo studio sono elencate di seguito:
Caratteristiche demografiche (cioè età e genere); Indice di massa corporea (BMI); valori CAP dei partecipanti nel database NHANES; Test biochimici generali [cioè, albumina(ALB), globulina (GLO), Proteine totali (TP), lattato deidrogenasi (LDH), azoto ureico nel sangue (BUN), acido urico (UA), gamma-glutamil transferasi (GGT), trigliceridi (TG), siero-glucosio (glu), creatinina sierica (SCr), bilirubina totale (TBIL), sodio (Na⁺), cloruro (Cl⁻), potassio (K⁺), calcio (Ca), bicarbonato (HCO₃), colesterolo totale (TC), aspartato aminotransferasi (AST) e alanina aminotransferasi (ALT)]; Parametri ematologici standard [ad esempio, conteggio dei globuli rossi (RBC), conteggio dei globuli bianchi (WBC), conteggio dei neutrofili (NEUT), conteggio degli eosinofili (EOS), conteggio dei linfociti (LYM), conteggio dei monociti (MON), larghezza della distribuzione dei globuli rossi (RDW) e conteggio delle piastrine (PLT)]; Storia di ipertensione e diabete mellito (DM). Tra i soggetti inclusi nello studio, i criteri diagnostici per diabete e ipertensione sono stati ottenuti da uno studio precedente basato su un modello di predizione basato su apprendimento automatico focalizzato suNAFLD 24.
Mancanza di gestione dei dati e selezione delle funzionalità
I dati della coorte utilizzati in questo studio includevano valori mancanti. Escludere tutti i record incompleti non solo ridurrebbe la dimensione del campione di analisi, ma comprometterebbe anche la qualità dei dati e potenzialmente influenzerebbe i risultati della previsione. Pertanto, sono stati esclusi tutti i dati con valori mancanti superiori al 20%. Per i dataset con valori mancanti ≤20%, sono stati applicati diversi metodi di imputazione basati sul tipo di dato: "norm" per variabili continue, "logreg" per variabili di classificazione binaria e "polyreg" per variabili multiclasse. Queste imputazioni sono state condotte utilizzando il pacchetto "topi" in R per imputazionimultiple 25. In questo studio, tutte le variabili continue sono state dicotomiate in variabili binarie, con soglie ottimali di classificazione determinate tramite analisi della curva della caratteristica operativa del ricevitore (ROC). In particolare, il punto di soglia corrispondente al massimo indice di Youden sulla curva ROC è stato selezionato come criterio ottimale di classificazione, ottimizzando così le prestazioni della classificazione mantenendo un giusto equilibrio tra sensibilità e specificità. Successivamente, è stata impiegata l'analisi discriminante dei minimi quadrati parziali (PLS-DA) per raggruppare efficacemente i dati.
Per una selezione ulteriore delle caratteristiche, gli individui venivano assegnati casualmente in set di addestramento e test con un rapporto 7:3 utilizzando il pacchetto "caret". Per prima cosa, è stata utilizzata la regressione dell'operatore di riduzione e selezione minima assoluta (LASSO) per la selezione delle caratteristiche, identificando 14 variabili chiave per analisi successive. Successivamente, è stato applicato ChatGPT-4 per assegnare un punteggio di importanza a ogni variabile. Per valutare sistematicamente l'importanza delle caratteristiche, controllando al contempo il potenziale bias e la variazione stocastica, è stato implementato un protocollo di valutazione standardizzato. Il prompt specifico fornito al modello era: "Sulla base della letteratura clinica consolidata riguardante la malattia epatica adiposa non alcolica (NAFLD), assegnare un punteggio di importanza che va da 1 (minimo) a 10 (più alto) per ciascuna delle seguenti 14 variabili identificate tramite regressione LASSO." Limitando la valutazione esclusivamente alle variabili preselezionate dalla regressione LASSO, il rischio di incorporare caratteristiche allucinate o irrilevanti è stato minimizzato. Per prevenire rigorosamente la possibile fuga di dati e l'uso involontario della prevalenza degli esiti, il modello linguistico è stato completamente accecato rispetto al dataset empirico. La valutazione è stata limitata alla sintesi di conoscenze mediche preesistenti riguardanti i nomi delle variabili. Questa procedura migliora le metodologie tradizionali, come la selezione della stabilità LASSO o la potatura basata su SHAP, assicurando che le caratteristiche puramente basate sui dati mostrino una plausibilità patofisiologica robusta prima dell'integrazione finale del modello. Inoltre, per mitigare la varianza a risposta singola, questa procedura è stata iterata 10 volte in modo indipendente. Il punteggio medio per ogni variabile veniva calcolato tra queste iterazioni, garantendo una priorità oggettiva. Le variabili venivano poi classificate in ordine decrescente in base ai loro punteggi medi. Infine, la selezione è stata ristretta includendo solo quelle variabili con un punteggio medio di importanza superiore a 5, risultando in 8 variabili chiave: SCr, UA, GGT, Glu, Ipertensione, Diabete, TG e BMI.
Sviluppo di modelli di previsione basati su AutoML per la NAFLD
In questo studio, è stata integrata una suite completa di algoritmi classici e avanzati di machine learning utilizzando H2O AutoML per la diagnosi efficace della NAFLD. Sfruttando le capacità AutoML della piattaforma H2O.ai, sono state condotte analisi di machine learning per compiti di classificazione binaria. Gli algoritmi utilizzati includevano eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Generalized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) e Stacked Ensemble. Questi algoritmi sono stati valutati sistematicamente per identificare il modello ottimale per la diagnosi della malattia. Per garantire una rigorosa riproducibilità metodologica, i parametri di esecuzione di H2O AutoML sono stati esplicitamente definiti. La ricerca automatica era limitata a un tempo massimo di esecuzione di 11.687 secondi e a un massimo di 302 modelli, utilizzando un seed casuale fisso di 13. I flag interni di preprocessing includevano l'imputazione automatica dei valori residui mancanti tramite algoritmi media/modalità, oltre alla codifica target per variabili categoriche ad alta cardinalità. L'architettura ottimale selezionata (etichettata GBM_grid_1_model77) era una macchina di aumento di gradiente con i seguenti iperparametri specifici: un totale di 28 alberi, una profondità massima di 5 e una velocità di apprendimento di 0,1.
Per migliorare la robustezza del modello e mitigare i rischi di sovrafitting, è stato implementato un framework AutoML che incorpora protocolli sistematici di ottimizzazione e validazione degli iperparametri. Il processo è iniziato con l'esplorazione automatizzata di 200 configurazioni distinte di modelli tramite ottimizzazione con iperparametri, utilizzando la validazione incrociata a 5 volte in cui il dataset di addestramento è stato suddiviso in cinque sottoinsiemi mutuamente esclusivi. Durante l'addestramento iterativo, ogni configurazione utilizzava quattro sottoinsiemi (80%) per la costruzione del modello, riservando un sottoinsieme (20%) per la validazione, con questo ruolo di validazione che ruotava sequenzialmente su tutte le pieghe. Per bilanciare l'efficienza computazionale con l'ottimizzazione delle prestazioni, è stato implementato il dynamic early stopping basato sull'area sotto la metrica ROC curve (AUC). Questo meccanismo ha sospeso l'addestramento quando i miglioramenti AUC sono scesi sotto la soglia di 0,001 per tre cicli consecutivi, applicandosi sia al perfezionamento individuale dei modelli sia al processo complessivo di ricerca AutoML. La selezione finale del modello ha dato priorità alle configurazioni che dimostrano la massima media AUC sia tra i set di addestramento che tra quelli di validazione, richiedendo contemporaneamente prestazioni coerenti tra questi insiemi e una minima varianza metrica tra iterazioni di validazione incrociata. Questo approccio integrato garantiva un'accuratezza predittiva ottimale mantenendo una forte generalizzazione attraverso protocolli di validazione rigorosi e vincoli di ottimizzazione automatizzata.
Valutazione delle prestazioni del modello e interpretazione dei risultati delle previsioni
Le prestazioni del modello e l'interpretazione dei risultati della previsione sono state valutate in modo completo utilizzando curve ROC, punteggi F1 e analisi SHAPapley additive explanation (SHAP). Le prestazioni del modello e l'interpretazione dei risultati di previsione sono state valutate in modo completo utilizzando curve ROC, punteggi F1 e analisi SHAPapley Additive Explanation (SHAP). Inizialmente, le previsioni venivano generate sul dataset di test utilizzando il modello addestrato e le probabilità previste per la classe positiva (cioè classe 1) venivano estratte (pred_prob). La curva ROC è stata costruita utilizzando il pacchetto pROC e è stato calcolato l'AUC del modello, insieme al suo intervallo di confidenza del 95%. La soglia ottimale sulla curva ROC è stata determinata utilizzando la statistica J di Youden (J = Sensibilità + Specificità − 1) per la determinazione binaria dell'etichetta di classificazione. Basandosi su questa soglia derivata dalla curva ROC, le probabilità previste sono state convertite in etichette di previsione binarie (0 o 1) e successivamente è stata generata una matrice di confusione. Il punteggio F1 sul set di test veniva calcolato utilizzando la funzione della matrice di confusione, e veniva prodotta e salvata una visualizzazione della matrice di confusione. Inoltre, il modello è stato ulteriormente convalidato su un dataset indipendente di validazione esterna composto da 200 casi (dal First Affiliated Hospital dell'Università Medica di Wenzhou). I valori SHAP sono stati analizzati utilizzando il pacchetto "shapviz" per chiarire l'impatto di ciascuna variabile sugli esiti di previsione del modello, fornendo così spunti sull'interpretazione delle singole previsioni di verosimiglianza NAFLD.
Metodi statistici
"L'analisi statistica e lo sviluppo software sono stati effettuati utilizzando la versione R 4.2.3 (R Foundation for Statistical Computing, Vienna, Austria). Le variabili continue sono state inizialmente valutate per la normalità utilizzando il test di Shapiro-Wilk o l'ispezione visiva dei grafici Q-Q. I dati normalmente distribuiti sono stati presentati come media ± deviazione standard (SD), e sono stati effettuati confronti tra due gruppi indipendenti utilizzando i test t a campioni indipendenti. Per confronti multipli di gruppi, è stato impiegato ANOVA unidirezionale con i test HSD di Tukey post-hoc quando appropriato. I dati continui non normalmente distribuiti sono stati riassunti come mediana [intervallo interquartile (IQR), P25–P75], e confronti di gruppo sono stati effettuati utilizzando il test Mann-Whitney U per due gruppi indipendenti o il test Kruskal-Wallis per gruppi multipli, seguito dal test post-hoc di Dunn se necessario. Le variabili categoriche sono state espresse come frequenze e percentuali (%), e i confronti delle proporzioni tra i gruppi sono stati analizzati utilizzando il test chi-quadrato (test χ2 ) o il test esatto di Fisher quando il conteggio atteso delle cellule era inferiore a 5. Il livello di significatività è stato fissato a α = 0,05 (a due code), e un valore p < 0,05 è stato considerato statisticamente significativo.