Articolo di ricerca

Modello automatico di machine learning per la previsione della fegato grassa non alcolica e la validazione delle coorti esterne

DOI:

10.3791/70033

3 luglio 2026

* These authors contributed equally

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Viene presentato un protocollo AutoML passo dopo passo per lo screening della fegato adiposo non alcolica utilizzando dati NHANES e una coorte esterna. Il metodo automatizza la priorità delle funzionalità e la selezione del modello (GBM), e include l'interpretazione basata su SHAP e la validazione esterna per la distribuzione clinica riproducibile.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La fegato adiposo non alcolica (NAFLD) è un disturbo epatico comune associato a obesità, resistenza all'insulina e sindrome metabolica, spesso non diagnosticato fino a stadi avanzati. I metodi diagnostici tradizionali, inclusi l'imaging e la biopsia epatica, presentano limitazioni nella diagnosi precoce. È necessario uno strumento efficiente e non invasivo per lo screening precoce della NAFLD. Utilizzando la tecnologia di machine learning automatizzato (AutoML), è stato sviluppato un modello diagnostico per la NAFLD sfruttando un ampio dataset di NHANES (n = 2677). Inoltre, è stata impiegata una coorte indipendente di validazione esterna (n = 200) per valutare la validità esterna e le prestazioni del modello. Per la selezione delle caratteristiche cliniche promettenti, è stato applicato un metodo di selezione delle caratteristiche a due stadi, che combina la regressione LASSO con l'analisi intelligente basata su ChatGPT-4. Successivamente, il processo AutoML, che integrava più algoritmi di machine learning, è stato eseguito per l'addestramento e la validazione dei modelli. Le prestazioni del modello sono state valutate utilizzando curve ROC, punteggi F1 e analisi SHAPapley per spiegazione additiva (SHAP). Il modello GBM ha raggiunto un AUC di 0,843 nel set di addestramento, 0,851 nel set di test e 0,945 nel set di validazione esterno, dimostrando un'elevata accuratezza diagnostica tra diversi dataset. Predittori chiave, tra cui BMI, trigliceridi e GGT, sono stati identificati come contributori significativi alle previsioni del modello. L'analisi SHAP ha ulteriormente confermato l'importanza di queste variabili nella previsione della NAFLD. Il modello diagnostico basato su AutoML per la NAFLD ha dimostrato prestazioni di rilevamento precoce significativamente migliorate, offrendo un'alternativa affidabile, non invasiva ed efficiente ai metodi diagnostici convenzionali. Questo metodo ha un grande potenziale per un'applicazione clinica più ampia nella NAFLD, riducendo la dipendenza dalla conoscenza degli esperti e migliorando la precisione diagnostica.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La fegato grasso non alcolica (NAFLD) è una delle malattie epatiche più diffuse a livello globale, attualmente colpisce circa il 35% della popolazione adulta nel mondo, e non è attribuibile a un consumo eccessivodi alcol 1. È caratterizzata dall'accumulo di grasso in oltre il 5% degli epatociti, che può potenzialmente evolvere verso condizioni più gravi, tra cui infiammazione, fibrosi epatica, cirrosi e, infine, insufficienzaepatica 2,3. Attualmente, i metodi tradizionali per diagnosticare la NAFLD si basano principalmente su marcatori biochimici epatici anomali e sull'ecografia. Tuttavia, l'ecografia mostra una sensibilità limitata quando il grado di steatosi è inferiore al 20%, il che compromette la sua affidabilità nel rilevare lievi infiltrazioni di grasso e spesso porta a diagnosi mancate diNAFLD 4 in stadio iniziale. Sebbene la biopsia epatica sia considerata lo standard d'oro per la diagnosi della NAFLD, la sua natura invasiva e il rischio di complicazioni come dolore, infezione e sanguinamento ne limitano la fattibilità per uno screening su largascala 5. Di conseguenza, è urgente la necessità di uno strumento efficiente, non invasivo, economico e altamente sensibile per facilitare lo screening NAFLD.

Con lo sviluppo rapido delle tecnologie di intelligenza artificiale (IA) e machine learning (ML), gli approcci basati sui dati offrono nuove soluzioni per la diagnosi precoce e la valutazione del rischio della NAFLD. Analizzando dati complessi e su larga scala, le tecnologie ML possono identificare automaticamente potenziali schemi e relazioni, e sono state ampiamente applicate nella diagnosi e nella previsione di varie malattie6. Ad esempio, sono stati utilizzati algoritmi ML per prevedere il rischio di cirrosi in individui con infezione cronica da virus dell'epatite B, ottenendo risultatipromettenti. Studi simili nel campo della NAFLD hanno sviluppato con successo modelli diagnostici utilizzando algoritmi tradizionali di apprendimento automatico, come le macchine a vettori di supporto (SVM) e le foreste random (RF), raggiungendo alti livelli di accuratezza e dimostrando una forte applicabilità clinica 8,9,10,11,12,13,14,15,16,17,18. Ad esempio, i ricercatori hanno sviluppato un modello di machine learning che utilizza parametri di laboratorio per filtrare efficacemente la NAFLD nella popolazione generale attraverso l'analisi dei dati di laboratorio di routine. Un modello ML che utilizzava parametri di laboratorio è statosviluppato 13 per filtrare efficacemente la NAFLD nella popolazione generale attraverso l'analisi dei dati di laboratorio di routine. La prevalenza della NAFLD negli USA è stata prevista combinando l'elastografia transitoria con metodi di apprendimento automatico utilizzando i dati NHANES 2017–201816. Il team di ricerca ha utilizzato algoritmi di machine learning per indagare la correlazione tra elastografia transitoria e altre variabili cliniche, sviluppando un modello predittivo che stima in modo affidabile la prevalenza della NAFLD in popolazioni diverse.

Tuttavia, i metodi tradizionali di machine learning richiedono tipicamente un notevole sforzo manuale, in particolare nell'ingegneria delle caratteristiche, nella selezione dei modelli e nella sintonia dei parametri, che richiedono conoscenze ed esperienza specializzate. Per affrontare queste limitazioni, è stato sviluppato l'apprendimento automatico automatico (AutoML). AutoML automatizza l'intera pipeline di costruzione dei modelli, comprendendo preprocessing dei dati, selezione delle caratteristiche, selezione dei modelli e ottimizzazione degli iperparametri, migliorando così notevolmente sia l'efficienza che la precisione dei processi di machinelearning 19. Un modello predittivo per il sanguinamento variciale esofageo è stato sviluppato e validato utilizzando la piattaforma H2OAutoML 20. Il modello impiegava vari algoritmi, tra cui deep learning (DL), eXtreme Gradient Boosting (XGBoost), modelli lineari generalizzati (GLM), macchine per il gradient boosting (GBM), foreste random (RF) e ensemble di impilamento, con un orizzonte di previsione su 12 mesi. AutoML è stato utilizzato per prevedere il rischio di metastasi epatica nei pazienti con tumore stromale gastrointestinale, sfruttando dati del databaseSEER 21. Le piattaforme AutoML sono state sfruttate per sviluppare uno strumento diagnostico rapido ed economico per il cancro alla prostata utilizzando dati clinici di routine22. L'emergere di AutoML ha offerto soluzioni più efficienti per la diagnosi clinica, e il suo potenziale nello screening della NAFLD merita un'ulteriore esplorazione. Sebbene la diagnosi precoce e la diagnosi accurata della NAFLD siano fondamentali, la natura asintomatica della malattia presenta sfide diagnostiche significative. Sebbene la tecnologia AutoML abbia mostrato grande potenziale nella diagnosi delle malattie, la sua applicazione nella diagnosi della NAFLD rimane limitata, sottolineando le promettenti prospettive di questo campo di ricerca.

Questo studio ha sviluppato un modello diagnostico di fegato adiposo non alcolico (NAFLD) sfruttando la tecnologia AutoML in combinazione con l'elasografia transitoria, utilizzando dati dal database statunitense NHANES (2017–2018). Il modello è stato convalidato esternamente utilizzando un dataset di individui del Dipartimento di Malattie Infettive, Primo Ospedale Affiliato della Wenzhou Medical University (2018–2020). Lo studio ha valutato le prestazioni del modello su un dataset esterno e lo ha confrontato con metodi tradizionali, colmando così le lacune di ricerca esistenti. Attraverso l'analisi di molteplici marcatori ematici e biochimici, sono stati costruiti modelli predittivi utilizzando algoritmi come la regressione logistica e le foreste casuali. I risultati hanno indicato la performance superiore del modello nell'identificare accuratamente individui non NAFLD. Questo non solo offre uno strumento efficiente e preciso per lo screening precoce della NAFLD, ma favorisce anche l'integrazione dell'AutoML nelle applicazioni mediche.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pazienti e progettazione dello studio

Il primo dataset di questo studio è stato ottenuto dal database del National Health and Nutrition Examination Survey (NHANES) per il periodo 2017–2018. Questo periodo di tempo specifico è stato scelto perché i dati del sondaggio includevano misurazioni di elastografia transitoria a ultrasuoni epatici utilizzando la tecnologia FibroScan®. NHANES adotta un design di campionamento probabilistico stratificato e multi-stadio e funge da indagine nazionale basata sulla popolazione condotta biennale. Raccoglie sistematicamente dati sanitari rappresentativi a livello nazionale sulla popolazione statunitense non istituzionalizzata per valutare lo stato nutrizionale e sanitario della popolazione civile generale negliStati Uniti. Il NHANES è uno studio trasversale rappresentativo a livello nazionale amministrato dal National Center for Health Statistics (NCHS). Il protocollo del sondaggio ha ricevuto l'approvazione del Consiglio di Revisione Etica della Ricerca NCHS, con il consenso informato documentato ottenuto da tutti i partecipanti. Lo studio è stato condotto in conformità sia con le Dichiarazioni di Helsinki che quelle di Istanbul, ed è stato approvato dal comitato etico del Primo Ospedale Affiliato dell'Università Medica di Wenzhou (2016–246, 1° dicembre 2016), e ciascun partecipante ha ottenuto il consenso scritto e informato.

Il primo dataset era composto da 5494 individui del sondaggio NHANES 20172018 che hanno sottoposto l'esame FibroScan. A seguito dell'esclusione di seguito, un totale di 2677 partecipanti è stato incluso nell'analisi, comprendendo 718 individui con NAFLD e 1959 con non-NAFLD. Questi partecipanti sono stati poi divisi casualmente in un set di addestramento (n = 1785) e un set di test (n = 892). Il secondo dataset comprendeva 582 individui del Dipartimento di Malattie Infettive del Primo Ospedale Affiliato dell'Università Medica di Wenzhou (2018–2020). Dopo aver applicato gli stessi criteri di esclusione, sono stati inclusi in totale 200 individui, di cui 159 individui con NAFLD e 41 individui con non-NAFLD. Questa coorte è stata utilizzata come insieme di validazione indipendente. Il disegno dello studio è stato sviluppato per costruire e validare il modello utilizzando dati multicentrici, migliorando così l'affidabilità e la generalizzazione dei risultati. Le caratteristiche cliniche di base dei gruppi NAFLD e non-NAFLD sono state riassunte utilizzando il pacchetto della tabella uno (Tabella 1). Inoltre, il processo di selezione dei pazienti e il flusso complessivo dello studio sono illustrati nella Figura 1.

Criteri diagnostici e criteri di esclusione per la NAFLD

La diagnosi di NAFLD si basava sui seguenticriteri: 16 anni: età di 18 anni o più, partecipazione allo screening di elastografia transitoria (FibroScan) con assunzione di alcol limitata a ≤140 g/settimana per le donne e ≤ 210 g/settimana per gli uomini negli ultimi 12 mesi, un valore del parametro di attenuazione controllata (CAP) di ≥ 302 dB/m misurato utilizzando il sistema FibroScan 502 V2 Touch (Echosens, Parigi, Francia) con una sonda media (M) o extra-large (XL), oppure una diagnosi confermata da patologia biopsia epatica presso il Dipartimento di Malattie Infettive del Primo Ospedale Affiliato dell'Università Medicadi Wenzhou 23.

I criteri di esclusione per la NAFLD sono descritti come segue:.consumo elevato di alcol (assunzione media giornaliera > 20 g per le donne e > 30 g per gli uomini secondo il sondaggioNHANES sull'uso di alcol 5), presenza di epatite B o C, infezione da HIV, epatite autoimmune, colangite biliare primaria, malattia di Wilson, uso prolungato di farmaci antinfiammatori non steroidei, bloccanti dei canali di calcio, tamoxifene, amiodarone, corticosteroidi, isoniazide o metotrexato, gravidanza o allattamento, e una diagnosi di cancro al fegato o di qualsiasi altro tumore benigno o maligno.

Raccolta dati e selezione delle variabili

Le variabili potenziali predittive incluse in questo studio sono elencate di seguito:

Caratteristiche demografiche (cioè età e genere); Indice di massa corporea (BMI); valori CAP dei partecipanti nel database NHANES; Test biochimici generali [cioè, albumina(ALB), globulina (GLO), Proteine totali (TP), lattato deidrogenasi (LDH), azoto ureico nel sangue (BUN), acido urico (UA), gamma-glutamil transferasi (GGT), trigliceridi (TG), siero-glucosio (glu), creatinina sierica (SCr), bilirubina totale (TBIL), sodio (Na⁺), cloruro (Cl⁻), potassio (K⁺), calcio (Ca), bicarbonato (HCO₃), colesterolo totale (TC), aspartato aminotransferasi (AST) e alanina aminotransferasi (ALT)]; Parametri ematologici standard [ad esempio, conteggio dei globuli rossi (RBC), conteggio dei globuli bianchi (WBC), conteggio dei neutrofili (NEUT), conteggio degli eosinofili (EOS), conteggio dei linfociti (LYM), conteggio dei monociti (MON), larghezza della distribuzione dei globuli rossi (RDW) e conteggio delle piastrine (PLT)]; Storia di ipertensione e diabete mellito (DM). Tra i soggetti inclusi nello studio, i criteri diagnostici per diabete e ipertensione sono stati ottenuti da uno studio precedente basato su un modello di predizione basato su apprendimento automatico focalizzato suNAFLD 24.

Mancanza di gestione dei dati e selezione delle funzionalità

I dati della coorte utilizzati in questo studio includevano valori mancanti. Escludere tutti i record incompleti non solo ridurrebbe la dimensione del campione di analisi, ma comprometterebbe anche la qualità dei dati e potenzialmente influenzerebbe i risultati della previsione. Pertanto, sono stati esclusi tutti i dati con valori mancanti superiori al 20%. Per i dataset con valori mancanti ≤20%, sono stati applicati diversi metodi di imputazione basati sul tipo di dato: "norm" per variabili continue, "logreg" per variabili di classificazione binaria e "polyreg" per variabili multiclasse. Queste imputazioni sono state condotte utilizzando il pacchetto "topi" in R per imputazionimultiple 25. In questo studio, tutte le variabili continue sono state dicotomiate in variabili binarie, con soglie ottimali di classificazione determinate tramite analisi della curva della caratteristica operativa del ricevitore (ROC). In particolare, il punto di soglia corrispondente al massimo indice di Youden sulla curva ROC è stato selezionato come criterio ottimale di classificazione, ottimizzando così le prestazioni della classificazione mantenendo un giusto equilibrio tra sensibilità e specificità. Successivamente, è stata impiegata l'analisi discriminante dei minimi quadrati parziali (PLS-DA) per raggruppare efficacemente i dati.

Per una selezione ulteriore delle caratteristiche, gli individui venivano assegnati casualmente in set di addestramento e test con un rapporto 7:3 utilizzando il pacchetto "caret". Per prima cosa, è stata utilizzata la regressione dell'operatore di riduzione e selezione minima assoluta (LASSO) per la selezione delle caratteristiche, identificando 14 variabili chiave per analisi successive. Successivamente, è stato applicato ChatGPT-4 per assegnare un punteggio di importanza a ogni variabile. Per valutare sistematicamente l'importanza delle caratteristiche, controllando al contempo il potenziale bias e la variazione stocastica, è stato implementato un protocollo di valutazione standardizzato. Il prompt specifico fornito al modello era: "Sulla base della letteratura clinica consolidata riguardante la malattia epatica adiposa non alcolica (NAFLD), assegnare un punteggio di importanza che va da 1 (minimo) a 10 (più alto) per ciascuna delle seguenti 14 variabili identificate tramite regressione LASSO." Limitando la valutazione esclusivamente alle variabili preselezionate dalla regressione LASSO, il rischio di incorporare caratteristiche allucinate o irrilevanti è stato minimizzato. Per prevenire rigorosamente la possibile fuga di dati e l'uso involontario della prevalenza degli esiti, il modello linguistico è stato completamente accecato rispetto al dataset empirico. La valutazione è stata limitata alla sintesi di conoscenze mediche preesistenti riguardanti i nomi delle variabili. Questa procedura migliora le metodologie tradizionali, come la selezione della stabilità LASSO o la potatura basata su SHAP, assicurando che le caratteristiche puramente basate sui dati mostrino una plausibilità patofisiologica robusta prima dell'integrazione finale del modello. Inoltre, per mitigare la varianza a risposta singola, questa procedura è stata iterata 10 volte in modo indipendente. Il punteggio medio per ogni variabile veniva calcolato tra queste iterazioni, garantendo una priorità oggettiva. Le variabili venivano poi classificate in ordine decrescente in base ai loro punteggi medi. Infine, la selezione è stata ristretta includendo solo quelle variabili con un punteggio medio di importanza superiore a 5, risultando in 8 variabili chiave: SCr, UA, GGT, Glu, Ipertensione, Diabete, TG e BMI.

Sviluppo di modelli di previsione basati su AutoML per la NAFLD

In questo studio, è stata integrata una suite completa di algoritmi classici e avanzati di machine learning utilizzando H2O AutoML per la diagnosi efficace della NAFLD. Sfruttando le capacità AutoML della piattaforma H2O.ai, sono state condotte analisi di machine learning per compiti di classificazione binaria. Gli algoritmi utilizzati includevano eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Generalized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) e Stacked Ensemble. Questi algoritmi sono stati valutati sistematicamente per identificare il modello ottimale per la diagnosi della malattia. Per garantire una rigorosa riproducibilità metodologica, i parametri di esecuzione di H2O AutoML sono stati esplicitamente definiti. La ricerca automatica era limitata a un tempo massimo di esecuzione di 11.687 secondi e a un massimo di 302 modelli, utilizzando un seed casuale fisso di 13. I flag interni di preprocessing includevano l'imputazione automatica dei valori residui mancanti tramite algoritmi media/modalità, oltre alla codifica target per variabili categoriche ad alta cardinalità. L'architettura ottimale selezionata (etichettata GBM_grid_1_model77) era una macchina di aumento di gradiente con i seguenti iperparametri specifici: un totale di 28 alberi, una profondità massima di 5 e una velocità di apprendimento di 0,1.

Per migliorare la robustezza del modello e mitigare i rischi di sovrafitting, è stato implementato un framework AutoML che incorpora protocolli sistematici di ottimizzazione e validazione degli iperparametri. Il processo è iniziato con l'esplorazione automatizzata di 200 configurazioni distinte di modelli tramite ottimizzazione con iperparametri, utilizzando la validazione incrociata a 5 volte in cui il dataset di addestramento è stato suddiviso in cinque sottoinsiemi mutuamente esclusivi. Durante l'addestramento iterativo, ogni configurazione utilizzava quattro sottoinsiemi (80%) per la costruzione del modello, riservando un sottoinsieme (20%) per la validazione, con questo ruolo di validazione che ruotava sequenzialmente su tutte le pieghe. Per bilanciare l'efficienza computazionale con l'ottimizzazione delle prestazioni, è stato implementato il dynamic early stopping basato sull'area sotto la metrica ROC curve (AUC). Questo meccanismo ha sospeso l'addestramento quando i miglioramenti AUC sono scesi sotto la soglia di 0,001 per tre cicli consecutivi, applicandosi sia al perfezionamento individuale dei modelli sia al processo complessivo di ricerca AutoML. La selezione finale del modello ha dato priorità alle configurazioni che dimostrano la massima media AUC sia tra i set di addestramento che tra quelli di validazione, richiedendo contemporaneamente prestazioni coerenti tra questi insiemi e una minima varianza metrica tra iterazioni di validazione incrociata. Questo approccio integrato garantiva un'accuratezza predittiva ottimale mantenendo una forte generalizzazione attraverso protocolli di validazione rigorosi e vincoli di ottimizzazione automatizzata.

Valutazione delle prestazioni del modello e interpretazione dei risultati delle previsioni

Le prestazioni del modello e l'interpretazione dei risultati della previsione sono state valutate in modo completo utilizzando curve ROC, punteggi F1 e analisi SHAPapley additive explanation (SHAP). Le prestazioni del modello e l'interpretazione dei risultati di previsione sono state valutate in modo completo utilizzando curve ROC, punteggi F1 e analisi SHAPapley Additive Explanation (SHAP). Inizialmente, le previsioni venivano generate sul dataset di test utilizzando il modello addestrato e le probabilità previste per la classe positiva (cioè classe 1) venivano estratte (pred_prob). La curva ROC è stata costruita utilizzando il pacchetto pROC e è stato calcolato l'AUC del modello, insieme al suo intervallo di confidenza del 95%. La soglia ottimale sulla curva ROC è stata determinata utilizzando la statistica J di Youden (J = Sensibilità + Specificità − 1) per la determinazione binaria dell'etichetta di classificazione. Basandosi su questa soglia derivata dalla curva ROC, le probabilità previste sono state convertite in etichette di previsione binarie (0 o 1) e successivamente è stata generata una matrice di confusione. Il punteggio F1 sul set di test veniva calcolato utilizzando la funzione della matrice di confusione, e veniva prodotta e salvata una visualizzazione della matrice di confusione. Inoltre, il modello è stato ulteriormente convalidato su un dataset indipendente di validazione esterna composto da 200 casi (dal First Affiliated Hospital dell'Università Medica di Wenzhou). I valori SHAP sono stati analizzati utilizzando il pacchetto "shapviz" per chiarire l'impatto di ciascuna variabile sugli esiti di previsione del modello, fornendo così spunti sull'interpretazione delle singole previsioni di verosimiglianza NAFLD.

Metodi statistici

"L'analisi statistica e lo sviluppo software sono stati effettuati utilizzando la versione R 4.2.3 (R Foundation for Statistical Computing, Vienna, Austria). Le variabili continue sono state inizialmente valutate per la normalità utilizzando il test di Shapiro-Wilk o l'ispezione visiva dei grafici Q-Q. I dati normalmente distribuiti sono stati presentati come media ± deviazione standard (SD), e sono stati effettuati confronti tra due gruppi indipendenti utilizzando i test t a campioni indipendenti. Per confronti multipli di gruppi, è stato impiegato ANOVA unidirezionale con i test HSD di Tukey post-hoc quando appropriato. I dati continui non normalmente distribuiti sono stati riassunti come mediana [intervallo interquartile (IQR), P25–P75], e confronti di gruppo sono stati effettuati utilizzando il test Mann-Whitney U per due gruppi indipendenti o il test Kruskal-Wallis per gruppi multipli, seguito dal test post-hoc di Dunn se necessario. Le variabili categoriche sono state espresse come frequenze e percentuali (%), e i confronti delle proporzioni tra i gruppi sono stati analizzati utilizzando il test chi-quadrato (test χ2 ) o il test esatto di Fisher quando il conteggio atteso delle cellule era inferiore a 5. Il livello di significatività è stato fissato a α = 0,05 (a due code), e un valore p < 0,05 è stato considerato statisticamente significativo.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Caratteristiche cliniche della NAFLD

In questo studio, le caratteristiche cliniche degli individui con e senza NAFLD sono state analizzate sistematicamente. È stato impiegato un insieme di metodi per illustrare chiaramente la distribuzione e le differenze di queste caratteristiche all'interno della popolazione campionaria (Tabella 1). Un totale di 2.677 individui sono stati inclusi nell'analisi, di cui 718 con NAFLD. L'analisi...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La NAFLD è la causa più comune di malattie croniche del fegato a livello mondiale e la sua prevalenza aumenta di circa l'1% ognianno 26. Circa il 30% della popolazione mondiale è colpito, rendendo la NAFLD non solo il principale disturbo cronico del fegato, ma anche l'indicazione in più rapida crescita per il trapiantodi fegato 3. L'apprendimento automatico automatico (AutoML) è emerso come uno strumento prezioso in medici...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere conflitto di interessi. In questo studio, ChatGPT-4 (OpenAI) è stato utilizzato come strumento analitico intelligente durante la fase di selezione delle caratteristiche per valutare la rilevanza clinica delle variabili identificate dalla regressione LASSO. Tutti i punteggi generati dall'IA sono stati attentamente esaminati dagli autori e validati empiricamente attraverso il successivo processo AutoML. ChatGPT-4 non veniva utilizzato per modificare dati grezzi o eseguire calcoli matematici. Gli autori si assumono la piena responsabilità per l'integrità e l'accuratezza dei risultati finali.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo lavoro è stato sostenuto dal Fondo Iniziale per la Ricerca Scientifica dell'Università Medica di Fujian [2021QH1176]; il Laboratorio Chiave di Diagnosi di Laboratorio Clinico e Ricerca Tralazionale della Provincia di Zhejiang [2022E10022]; il Progetto Provinciale di Scienze Mediche e Tecnologie Sanitarie dello Zhejiang [2024KY1265]; e il Progetto di Ricerca sul Benessere Pubblico di Base di Wenzhou [Y2023096].

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Datasets per NAFLD (2017–2018)Database NHANES [https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017]N/Acome set di addestramento per la costruzione del modello
Datasets per NAFLD (2018–2020)The First Affiliated Hospital of Wenzhou Medical University (2018–2020), Cina. [https://doi.org/10.6084/m9.figshare.32105248.]N/Acome set di test per la validazione esterna del modello
R (versione 4.2.3)R Foundation for Statistical ComputingN/Autilizzato in combinazione con altri strumenti per condurre analisi dei dati e generare presentazioni visive e grafiche.
Adobe Illustrator 2025 (versione 29.2)Adobe Systems IncorporatedN/APer layout e modifica di immagini
ChatGPT-4OpenAI Inc.N/APer l'assegnazione di un punteggio di importanza a ciascuna variabile selezionata
H2O AutoML (3.44.0.3)H2O.aiN/APer l'integrazione di un set completo di algoritmi di apprendimento automatico

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

MedicinaNumero 233Numero 233Questo mese in JoVENumeroAutoMLdiagnosiGradient Boosting Machine

Articoli correlati