$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Patiënten en studieontwerp
De eerste dataset van deze studie werd verkregen uit de National Health and Nutrition Examination Survey (NHANES) database voor de periode 2017–2018. Deze specifieke periode werd gekozen omdat de onderzoeksgegevens lever-ultrasone transiënte elastografiemetingen omvatten met behulp van FibroScan-technologie®. NHANES hanteert een gestratificeerd, meerfasig probability sampling design en dient als een landelijke, populatiegebaseerde enquête die om de twee jaar wordt uitgevoerd. Het verzamelt systematisch nationaal representatieve gezondheidsgerelateerde gegevens over de niet-geïnstitutionaliseerde Amerikaanse bevolking om de voedings- en gezondheidstoestand van de algemene burgerbevolking in deVerenigde Staten te evalueren. De NHANES is een nationaal representatieve, crosssectionele studie die wordt uitgevoerd door het National Center for Health Statistics (NCHS). Het enquêteprotocol kreeg goedkeuring van de NCHS Research Ethics Review Board, waarbij gedocumenteerde geïnformeerde toestemming van alle deelnemers werd verkregen. De studie werd uitgevoerd in overeenstemming met zowel de Verklaringen van Helsinki als Istanbul, en werd goedgekeurd door de ethische commissie van het Eerste Geaffilieerde Ziekenhuis van de Wenzhou Medische Universiteit (2016–246, 1 december 2016), waarbij schriftelijke geïnformeerde toestemming van elke deelnemer werd verkregen.
De eerste dataset bestond uit 5494 personen uit de NHANES-enquête 2017–2018 die een FibroScan-onderzoek ondergingen. Na de onderstaande uitsluiting werden in totaal 2677 deelnemers in de analyse opgenomen, bestaande uit 718 personen met NAFLD en 1959 met niet-NAFLD. Deze deelnemers werden vervolgens willekeurig verdeeld in een trainingsset (n = 1785) en een testset (n = 892). De tweede dataset bestond uit 582 personen van de afdeling Infectieziekten van het Eerste Geaffilieerde Ziekenhuis van de Wenzhou Medische Universiteit (2018–2020). Na toepassing van dezelfde uitsluitingscriteria werden in totaal 200 personen opgenomen, bestaande uit 159 personen met NAFLD en 41 personen met niet-NAFLD. Deze cohort werd gebruikt als een onafhankelijke validatieset. Het onderzoeksontwerp is ontwikkeld om het model te construeren en te valideren met behulp van multi-center data, waardoor de betrouwbaarheid en generaliseerbaarheid van de bevindingen worden verbeterd. De klinische basiskenmerken van de NAFLD- en niet-NAFLD-groepen werden samengevat met behulp van het tabel één-pakket (Tabel 1). Daarnaast worden het proces van patiëntselectie en de algemene studieflow geïllustreerd in Figuur 1.
Diagnostische criteria en exclusiecriteria voor NAFLD
De diagnose NAFLD was gebaseerd op de volgende criteria:16 jaar of ouder, deelname aan transient elastografie (FibroScan) screening met alcoholinname beperkt tot ≤140 g/week voor vrouwen en ≤ 210 g/week voor mannen over de voorgaande 12 maanden, een gecontroleerde attenuatieparameter (CAP)-waarde van ≥ 302 dB/m gemeten met het FibroScan 502 V2 Touch-systeem (Echosens, Parijs, Frankrijk) met een middelgrote (M) of extra grote (XL) sonde, of een diagnose bevestigd door leverbiopsiepathologie van de afdeling Infectieziekten van het Eerste Geaffilieerde Ziekenhuis van de Wenzhou Medische Universiteit23.
De uitsluitingscriteria voor NAFLD zijn als volgt uiteengezet:hoge alcoholconsumptie (gemiddelde dagelijkse inname > 20 g voor vrouwen en > 30 g voor mannen volgens de NHANES alcoholgebruiksenquête5), aanwezigheid van hepatitis B of C, hiv-infectie, auto-immuunhepatitis, primaire galwegcholangitis, de ziekte van Wilson, langdurig gebruik van niet-steroïde ontstekingsremmers, calciumkanaalblokkers, tamoxifen, amiodaron, corticosteroïden, isoniazide of methotrexaat, zwangerschap of borstvoeding, en een diagnose leverkanker of een andere goedaardige of kwaadaardige tumor.
Dataverzameling en variabeleselectie
De potentiële voorspellervariabelen die in deze studie zijn opgenomen, worden hieronder vermeld:
Demografische kenmerken (d.w.z. leeftijd en geslacht); Body mass index (BMI); CAP-waarden van deelnemers in de NHANES-database; Algemene biochemische tests [d.w.z. albumine (ALB), globuline (GLO), totaal eiwit (TP), lactaatdehydrogenase (LDH), bloedureastikstof (BUN), urinezuur (UA), gamma-glutamyltransferase (GGT), triglyceride (TG), serumglucose (glu), serumcreatinine (SCr), totale bilirubine (TBIL), natrium (Na⁺), chloride (cl⁻), kalium (K⁺), calcium (ca), bicarbonaat (HCO₃), totaal cholesterol (TC), aspartaataminotransferase (AST) en alanineaminotransferase (ALT)]; Standaard hematologische parameters [d.w.z. Rode Bloedcellen tellingen (RBC), Witte bloedcellen (WBC), Neutrofieltellingen (NEUT), Eosinofieltellingen (EOS), lymfocytentellingen (LYM), Monocytentellingen (MON), Rode bloedcellen distributiebreedte (RDW) en Bloedplaatjes (PLT)]; Voorgeschiedenis van hypertensie en diabetes mellitus (DM). Onder de betrokken proefpersonen werden de diagnostische criteria voor diabetes en hypertensie verkregen uit een eerdere machine learning-gebaseerde voorspellingsmodelstudie gericht op NAFLD24.
Verwerking van ontbrekende gegevens en functieselectie
De cohortgegevens die in deze studie werden gebruikt, omvatten ontbrekende waarden. Het uitsluiten van alle onvolledige records zou niet alleen de steekproefgrootte van de analyse verkleinen, maar ook de datakwaliteit aantasten en mogelijk de voorspellingsresultaten vertekenen. Daarom werden alle gegevens met ontbrekende waarden boven de 20% uitgesloten. Voor datasets met ontbrekende waarden ≤20% werden verschillende imputatiemethoden toegepast op basis van het datatype: "norm" voor continue variabelen, "logreg" voor binaire classificatievariabelen en "polyreg" voor multiclass-variabelen. Deze imputaties werden uitgevoerd met het "muizen"-pakket in R voor meervoudige imputatie25. In deze studie werden alle continue variabelen gedichotomiseerd in binaire variabelen, waarbij optimale classificatiedrempels werden bepaald via de analyse van de receiver operating characteristic (ROC). Specifiek werd het cut-offpunt dat overeenkomt met de maximale Youden-index op de ROC-curve gekozen als het optimale classificatiecriterium, waardoor de classificatieprestaties werden geoptimaliseerd terwijl een passend evenwicht tussen gevoeligheid en specificiteit behouden bleef. Vervolgens werd gedeeltelijke least squares discriminant analysis (PLS-DA) toegepast om de data effectief te clusteren.
Voor verdere functieselectie werden individuen willekeurig toegewezen aan trainings- en testsets met een verhouding van 7:3 met behulp van het "caret"-pakket. Ten eerste werd de regressie van de minimale absolute krimp en selectie-operator (LASSO) gebruikt voor featureselectie, waarbij 14 belangrijke variabelen werden geïdentificeerd voor latere analyse. Vervolgens werd ChatGPT-4 toegepast om aan elke variabele een belangrijkheidsscore toe te wijzen. Om het belang van kenmerken systematisch te evalueren terwijl er rekening wordt gehouden met mogelijke bias en stochastische variatie, werd een gestandaardiseerd beoordelingsprotocol geïmplementeerd. De specifieke prompt die aan het model werd gegeven was: "Op basis van gevestigde klinische literatuur over niet-alcoholische leververvetting (NAFLD), ken een belangrijkheidsscore toe van 1 (laagste) tot 10 (hoogste) voor elk van de volgende 14 variabelen die via LASSO-regressie zijn geïdentificeerd." Door de evaluatie strikt te beperken tot de vooraf geselecteerde variabelen door LASSO-regressie, werd het risico op het opnemen van gehallucineerde of irrelevante kenmerken geminimaliseerd. Om mogelijk datalekken en onbedoeld gebruik van uitkomstprevalentie strikt te voorkomen, was het taalmodel volledig geblindeerd voor de empirische dataset. De scoring was beperkt tot het synthetiseren van bestaande medische kennis over de variabelennamen. Deze procedure versterkt traditionele methodologieën, zoals LASSO-stabiliteitsselectie of SHAP-gebaseerde snoei, door ervoor te zorgen dat puur datagedreven kenmerken robuuste pathofysiologische plausibiliteit vertonen vóór de definitieve modelintegratie. Daarnaast werd deze procedure om single-response variantie te beperken tien keer onafhankelijk herhaald. De gemiddelde score voor elke variabele werd berekend over deze iteraties, wat een objectieve prioritering waarborgde. Variabelen werden vervolgens in aflopende volgorde gerangschikt op basis van hun gemiddelde scores. Ten slotte werd de selectie beperkt tot alleen die variabelen met een gemiddelde belangrijkheidsscore boven de 5, wat resulteerde in 8 belangrijke variabelen: SCr, UA, GGT, Glu, Hypertensie, Diabetes, TG en BMI.
Ontwikkeling van op AutoML gebaseerde voorspellingsmodellen voor NAFLD
In deze studie werd een uitgebreide reeks klassieke en geavanceerde machine learning-algoritmen geïntegreerd met H2O AutoML voor de effectieve diagnose van NAFLD. Door gebruik te maken van de AutoML-mogelijkheden van het H2O.ai platform, werden machine learning-analyses uitgevoerd voor binaire classificatietaken. De gebruikte algoritmen omvatten eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Generalized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) en Stacked Ensemble. Deze algoritmen werden systematisch geëvalueerd om het optimale model voor ziektediagnose te identificeren. Om een rigoureuze methodologische reproduceerbaarheid te waarborgen, werden de uitvoeringsparameters van H2O AutoML expliciet gedefinieerd. De geautomatiseerde zoekopdracht was beperkt tot een maximale looptijd van 11.687 seconden en maximaal 302 modellen, waarbij een vaste willekeurige seed van 13 werd gebruikt. Interne preprocessing-vlaggen omvatten automatische imputatie van resterende ontbrekende waarden met behulp van mean/mode-algoritmen, evenals doelcodering voor categorische variabelen met hoge kardinaliteit. De geselecteerde optimale architectuur (aangeduid GBM_grid_1_model77) was een gradient boosting machine met de volgende specifieke hyperparameters: in totaal 28 bomen, een maximale boomdiepte van 5 en een leersnelheid van 0,1.
Om de robuustheid van het model te verbeteren en overfitting-risico's te beperken, werd een AutoML-framework geïmplementeerd met systematische hyperparameterafstemming en validatieprotocollen. Het proces begon met geautomatiseerde verkenning van 200 verschillende modelconfiguraties via hyperparameteroptimalisatie, waarbij gebruik werd gemaakt van 5-voudige kruisvalidatie waarbij de trainingsdataset werd opgedeeld in vijf wederzijds exclusieve subsets. Tijdens iteratieve training gebruikte elke configuratie vier subsets (80%) voor modelbouw, terwijl één subset (20%) werd gereserveerd voor validatie, waarbij deze validatierol sequentieel over alle folds werd geroteerd. Om rekenefficiëntie in balans te brengen met prestatieoptimalisatie, werd dynamische vroege stopwerking geïmplementeerd op basis van het oppervlak onder de ROC-curve (AUC) metriek. Dit mechanisme schortte de training op wanneer AUC-verbeteringen drie opeenvolgende cycli onder een drempel van 0,001 kwamen, wat zowel gold voor individuele modelverfijning als het totale AutoML-zoekproces. De definitieve modelselectie gaf prioriteit aan configuraties die een maximale gemiddelde AUC aantoonden over zowel trainings- als validatiesets, terwijl tegelijkertijd consistente prestaties tussen deze sets en minimale metrische variatie over cross-validatieiteraties werden vereist. Deze geïntegreerde aanpak zorgde voor optimale voorspellende nauwkeurigheid terwijl sterke generaliseerbaarheid behouden bleef door rigoureuze validatieprotocollen en geautomatiseerde optimalisatiebeperkingen.
Evaluatie van modelprestaties en interpretatie van voorspellingsresultaten
Modelprestaties en de interpretatie van voorspellingsresultaten werden uitgebreid beoordeeld met behulp van ROC-curves, F1-scores en SHapley additive explanation (SHAP) analyse. De prestaties van het model en de interpretatie van de voorspellingsresultaten werden uitgebreid geëvalueerd met behulp van ROC-curves, F1-scores en SHapley Additive Explanation (SHAP)-analyse. Aanvankelijk werden voorspellingen gegenereerd op de testdataset met behulp van het getrainde model, en werden de voorspelde kansen voor de positieve klasse (d.w.z. klasse 1) geëxtraheerd (pred_prob). De ROC-curve werd geconstrueerd met behulp van het pROC-pakket, en de AUC van het model, samen met het 95% betrouwbaarheidsinterval, werd berekend. De optimale drempel op de ROC-curve werd bepaald met behulp van Youden's J-statistiek (J = Gevoeligheid + Specificiteit − 1) voor het bepalen van binaire classificatielabels. Op basis van deze drempel, afgeleid van de ROC-curve, werden de voorspelde kansen omgezet in binaire voorspellingslabels (0 of 1), en werd vervolgens een verwarringsmatrix gegenereerd. De F1-score op de testset werd berekend met behulp van de verwarringsmatrixfunctie, en een visualisatie van de verwarringsmatrix werd gemaakt en opgeslagen. Daarnaast werd het model verder gevalideerd op een onafhankelijke externe validatiedataset bestaande uit 200 gevallen (van het First Affiliated Hospital van de Wenzhou Medical University). SHAP-waarden werden geanalyseerd met het "shapviz"-pakket om de impact van elke variabele op de voorspellingsuitkomsten van het model te verduidelijken, waardoor inzicht werd gegeven in de interpretatie van individuele NAFLD-likelihood-voorspellingen.
Statistische methoden
"Statistische analyse en softwareontwikkeling werden uitgevoerd met R versie 4.2.3 (R Foundation for Statistical Computing, Wenen, Oostenrijk). Continue variabelen werden aanvankelijk beoordeeld op normaliteit met behulp van de Shapiro-Wilk-test of visuele inspectie van Q-Q-grafieken. Normaal verdeelde gegevens werden gepresenteerd als gemiddelde ± standaarddeviatie (SD), en vergelijkingen tussen twee onafhankelijke groepen werden uitgevoerd met behulp van onafhankelijke steekproeven t-tests. Voor meervoudige groepsvergelijkingen werd eenrichtings-ANOVA toegepast met post-hoc Tukey's HSD-tests wanneer dat passend was. Niet-normaal verdeelde continue gegevens werden samengevat als mediaan [interkwartielbereik (IQR), P25–P75], en groepsvergelijkingen werden uitgevoerd met behulp van de Mann-Whitney U-test voor twee onafhankelijke groepen of de Kruskal-Wallis-test voor meerdere groepen, gevolgd door Dunns post-hoc test indien nodig. Categorische variabelen werden uitgedrukt als frequenties en percentages (%), en vergelijkingen van verhoudingen tussen groepen werden geanalyseerd met behulp van de chi-kwadraattest (χ2-test ) of de exacte test van Fisher wanneer de verwachte celtellingen minder dan 5 waren. Het significantieniveau werd vastgesteld op α = 0,05 (tweezijdig), en een p-waarde < 0,05 werd als statistisch significant beschouwd.