Forschungsartikel

Automatisiertes Machine-Learning-Modell zur Vorhersage der nicht-alkoholischen Fettlebererkrankung und zur Validierung externer Kohorten

DOI:

10.3791/70033

3. Juli 2026

* These authors contributed equally

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ein Schritt-für-Schritt-AutoML-Protokoll wird vorgestellt, um auf nichtalkoholische Fettlebererkrankung mithilfe von NHANES-Daten und einer externen Kohorte zu screenen. Die Methode automatisiert die Feature-Priorisierung und Modellauswahl (GBM) und beinhaltet SHAP-basierte Interpretation sowie externe Validierung für eine reproduzierbare klinische Bereitstellung.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die nicht-alkoholische Fettlebererkrankung (NAFLD) ist eine häufige Lebererkrankung, die mit Fettleibigkeit, Insulinresistenz und metabolischem Syndrom in Verbindung steht und oft erst in fortgeschrittenen Stadien diagnostiziert wird. Traditionelle diagnostische Methoden, einschließlich Bildgebung und Leberbiopsie, haben Einschränkungen bei der Früherkennung. Es besteht Bedarf an einem effizienten, nicht-invasiven Instrument für das frühe NAFLD-Screening. Mit automatisierter maschineller Lerntechnologie (AutoML) wurde ein Diagnosemodell für NAFLD entwickelt, das einen großen Datensatz von NHANES (n = 2677) nutzt. Zusätzlich wurde eine unabhängige externe Validierungskohorte (n = 200) eingesetzt, um die externe Validität und Leistung des Modells zu bewerten. Zur Auswahl vielversprechender klinischer Merkmale wurde eine zweistufige Merkmalauswahlmethode angewandt, die LASSO-Regression mit einer intelligenten Analyse auf Basis von ChatGPT-4 kombiniert. Anschließend wurde der AutoML-Prozess, der mehrere maschinelle Lernalgorithmen integrierte, für das Modelltraining und die Validierung durchgeführt. Die Leistung des Modells wurde mittels ROC-Kurven, F1-Scores und SHapley-additiver Erklärungsanalyse (SHAP) bewertet. Das GBM-Modell erreichte einen AUC von 0,843 im Trainingsset, 0,851 im Testsatz und 0,945 im externen Validierungssatz und zeigte eine hohe diagnostische Genauigkeit über verschiedene Datensätze hinweg. Wichtige Prädiktoren, darunter BMI, Triglyzeride und GGT, wurden als bedeutende Beiträger zu den Vorhersagen des Modells identifiziert. Die SHAP-Analyse bestätigte zudem die Bedeutung dieser Variablen bei der Vorhersage von NAFLD. Das AutoML-gesteuerte Diagnosemodell für NAFLD zeigte eine deutlich verbesserte Früherkennungsleistung und bot eine zuverlässige, nicht-invasive und effiziente Alternative zu herkömmlichen Diagnosemethoden. Diese Methode birgt großes Potenzial für eine breitere klinische Anwendung im NAFLD, da sie die Abhängigkeit von Expertenwissen verringert und gleichzeitig die diagnostische Präzision verbessert.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die nicht-alkoholische Fettlebererkrankung (NAFLD) ist eine der weltweit am häufigsten verbreiteten Lebererkrankungen, betrifft derzeit etwa 35 % der erwachsenen Bevölkerung weltweit und ist nicht auf übermäßigen Alkoholkonsum zurückzuführen1. Es ist gekennzeichnet durch die Ansammlung von Fett in mehr als 5 % der Hepatozyten, was potenziell zu schwerwiegenderen Erkrankungen wie Entzündungen, Leberfibrose, Zirrhose und letztlich Leberversagen 2,3 führen kann. Derzeit basieren die traditionellen Methoden zur Diagnose von NAFLD hauptsächlich auf abnormen Leberbiochemischen Markern und Ultraschallbildgebung. Ultraschall zeigt jedoch eine begrenzte Empfindlichkeit, wenn der Grad der Steatose unter 20 % liegt, was die Zuverlässigkeit bei der Erkennung leichter Fettinfiltration beeinträchtigt und oft zu Fehldiagnosen von NAFLD4 im Frühstadium führt. Obwohl eine Leberbiopsie als Goldstandard für die Diagnose von NAFLD gilt, schränken ihre invasive Natur und das Risiko von Komplikationen wie Schmerzen, Infektionen und Blutungen ihre Machbarkeit für groß angelegte Screeningsein. Daher besteht ein dringender Bedarf an einem effizienten, nicht-invasiven, kosteneffizienten und hochsensiblen Instrument zur Erleichterung des NAFLD-Screenings.

Mit der rasanten Entwicklung von Künstlicher Intelligenz (KI) und maschinellem Lernen (ML) bieten datengetriebene Ansätze neue Lösungen für die frühzeitige Diagnose und Risikobewertung von NAFLD. Durch die Analyse groß angelegter, komplexer Daten können ML-Technologien potenzielle Muster und Zusammenhänge automatisch erkennen und wurden weit verbreitet bei der Diagnose und Vorhersage verschiedener Krankheiteneingesetzt 6. Beispielsweise wurden ML-Algorithmen verwendet, um das Risiko für Leberzirrhose bei Personen mit chronischer Hepatitis-B-Virus-Infektion vorherzusagen, was vielversprechende Ergebnisse erzielte7. Ähnliche Studien im NAFLD-Bereich haben erfolgreich diagnostische Modelle mit traditionellen maschinellen Lernalgorithmen wie Support Vector Machines (SVM) und Random Forests (RF) entwickelt, mit hoher Genauigkeit und starker klinischer Anwendbarkeit 8,9,10,11,12,13,14,15,16,17,18. So entwickelten Forscher beispielsweise ein Machine-Learning-Modell, das Laborparameter nutzt, um NAFLD in der Allgemeinbevölkerung durch die Analyse routinemäßiger Labordaten effektiv auszusortieren. Ein ML-Modell mit Laborparametern wurdeentwickelt, um NAFLD in der Allgemeinbevölkerung durch die Analyse routinemäßiger Labordaten effektiv auszusortieren. Die Prävalenz von NAFLD in den USA wurde durch die Kombination der transienten Elastographie mit maschinellen Lernmethoden unter Verwendung von NHANES 2017–2018 Daten16 vorhergesagt. Das Forschungsteam nutzte maschinelle Lernalgorithmen, um die Korrelation zwischen transienter Elastographie und anderen klinischen Variablen zu untersuchen und entwickelte ein prädiktives Modell, das die Prävalenz von NAFLD in verschiedenen Populationen zuverlässig schätzte.

Traditionelle Methoden des maschinellen Lernens erfordern jedoch typischerweise erheblichen manuellen Aufwand, insbesondere bei der Feature Engineering, Modellauswahl und Parameterabstimmung, die spezielles Wissen und Erfahrung erfordern. Um diese Einschränkungen zu beheben, wurde automatisiertes maschinelles Lernen (AutoML) entwickelt. AutoML automatisiert die gesamte Modellbau-Pipeline und umfasst Datenvorverarbeitung, Merkmalauswahl, Modellauswahl und Hyperparameteroptimierung und verbessert so sowohl die Effizienz als auch die Genauigkeit von Machine-Learning-Prozessenerheblich 19. Ein prädiktives Modell für die ösophageale Varicealblutung wurde entwickelt und mit der H2O AutoML-Plattform20 validiert. Das Modell verwendete verschiedene Algorithmen, darunter Deep Learning (DL), eXtreme Gradient Boosting (XGBoost), generalisierte lineare Modelle (GLM), Gradient Boosting Machines (GBM), Random Forests (RF) und Stacking-Ensembles mit einem 12-monatigen Vorhersagehorizont. AutoML wurde eingesetzt, um das Risiko von Lebermetastasen bei Patienten mit gastrointestinalem Stromaltumor vorherzusagen, wobei Daten aus der SEER-Datenbank21 verwendet wurden. AutoML-Plattformen wurden genutzt, um ein schnelles und kostengünstiges diagnostisches Werkzeug für Prostatakrebs unter Verwendung routinemäßiger klinischer Datenzu entwickeln 22. Das Aufkommen von AutoML hat effizientere Lösungen für klinische Diagnosen geboten, und sein Potenzial im NAFLD-Screening verdient eine weitere Untersuchung. Während die frühzeitige Erkennung und genaue Diagnose von NAFLD entscheidend sind, stellt die asymptomatische Natur der Krankheit erhebliche diagnostische Herausforderungen dar. Obwohl die AutoML-Technologie großes Potenzial bei der Krankheitsdiagnose gezeigt hat, bleibt ihre Anwendung in der NAFLD-Diagnose eingeschränkt, was die vielversprechenden Aussichten dieses Forschungsfeldes unterstreicht.

Diese Studie entwickelte ein Diagnosemodell für nicht-alkoholische Fettleber (NAFLD), indem AutoML-Technologie in Verbindung mit transienter Elastographie genutzt wurde, basierend auf Daten aus der US NHANES-Datenbank (2017–2018). Das Modell wurde extern anhand eines Datensatzes von Personen der Abteilung für Infektionskrankheiten des First Affiliated Hospital der Wenzhou Medical University (2018–2020) validiert. Die Studie bewertete die Leistung des Modells an einem externen Datensatz und verglich ihn mit traditionellen Methoden, wodurch bestehende Forschungslücken behoben wurden. Durch die Analyse mehrerer Blut- und biochemischer Marker wurden prädiktive Modelle mit Algorithmen wie logistischer Regression und Zufallswäldern erstellt. Die Ergebnisse zeigten die überlegene Leistung des Modells bei der genauen Identifizierung von Nicht-NAFLD-Personen. Dies bietet nicht nur ein effizientes und präzises Werkzeug für das frühe NAFLD-Screening, sondern fördert auch die Integration von AutoML in medizinischen Anwendungen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Patienten und Studiendesign

Der erste Datensatz dieser Studie stammt aus der National Health and Nutrition Examination Survey (NHANES) Datenbank für den Zeitraum 2017–2018. Dieser spezielle Zeitraum wurde ausgewählt, weil die Umfragedaten Leberultraschall-Transient-Elastographiemessungen mit FibroScan-Technologie® enthielten. NHANES verwendet ein geschichtetes, mehrstufiges Probabilitätsstichprobensystem und dient als landesweite, bevölkerungsbasierte Umfrage, die alle zwei Jahre durchgeführt wird. Sie sammelt systematisch national repräsentative gesundheitsbezogene Daten zur nicht-institutionalisierten US-Bevölkerung, um den Ernährungs- und Gesundheitszustand der allgemeinen Zivilbevölkerung in den Vereinigten Staaten zu bewerten1. Die NHANES ist eine landesweit repräsentative Querschnittsstudie, die vom National Center for Health Statistics (NCHS) durchgeführt wird. Das Umfrageprotokoll wurde vom NCHS Research Ethics Review Board genehmigt, wobei von allen Teilnehmern dokumentierte informierte Zustimmung eingeholt wurde. Die Studie wurde gemäß den Erklärungen von Helsinki und Istanbul durchgeführt und vom Ethikkomitee des Ersten Angeschlossenen Krankenhauses der Medizinischen Universität Wenzhou (2016–246, 1. Dezember 2016) genehmigt, wobei von jedem Teilnehmer eine schriftliche informierte Zustimmung eingeholt wurde.

Der erste Datensatz bestand aus 5494 Personen aus der NHANES-Umfrage 2017–2018, die sich einer FibroScan-Untersuchung unterzogen hatten. Nach dem untenstehenden Ausschluss wurden insgesamt 2677 Teilnehmer in die Analyse einbezogen, darunter 718 Personen mit NAFLD und 1959 mit Nicht-NAFLD. Diese Teilnehmer wurden dann zufällig in einen Trainingssatz (n = 1785) und einen Testsatz (n = 892) eingeteilt. Der zweite Datensatz umfasste 582 Personen aus der Abteilung für Infektionskrankheiten am First Affiliated Hospital der Wenzhou Medical University (2018–2020). Nach Anwendung derselben Ausschlusskriterien wurden insgesamt 200 Personen eingeschlossen, darunter 159 Personen mit NAFLD und 41 Personen mit Nicht-NAFLD. Diese Kohorte wurde als unabhängiges Validierungsset verwendet. Das Studiendesign wurde entwickelt, um das Modell mit Multi-Center-Daten zu konstruieren und zu validieren, wodurch die Zuverlässigkeit und Generalisierbarkeit der Ergebnisse verbessert werden. Die klinischen Ausgangsmerkmale der NAFLD- und Nicht-NAFLD-Gruppen wurden anhand des Tabellenpakets 1 (Tabelle 1) zusammengefasst. Zusätzlich sind der Prozess der Patientenauswahl und der gesamte Studienablauf in Abbildung 1 dargestellt.

Diagnostische Kriterien und Ausschlusskriterien für NAFLD

Die NAFLD-Diagnose basierte auf folgenden Kriterien:16 Jahre oder älter: 18 Jahre oder älter, Teilnahme an einer transienten Elastographie (FibroScan) mit Alkoholkonsum begrenzt auf ≤140 g/Woche bei Frauen und ≤ 210 g/Woche bei Männern in den vorangegangenen 12 Monaten, ein kontrollierter Dämpfungsparameter (CAP)-Wert von ≥ 302 dB/m, gemessen mit dem FibroScan 502 V2 Touch-System (Echosens, Paris, Frankreich) mit entweder einer mittleren (M) oder extra-großen (XL) Sonde oder einer durch Leberbiopsie bestätigten Diagnose der Abteilung für Infektionskrankheiten des ersten angeschlossenen Krankenhauses der Wenzhou Medical University23.

Die Ausschlusskriterien für NAFLD sind wie folgt dargelegt:hoher Alkoholkonsum (durchschnittliche tägliche Aufnahme > 20 g bei Frauen und > 30 g bei Männern laut NHANES-Alkoholkonsum-Umfrage5), Vorhandensein von Hepatitis B oder C, HIV-Infektion, Autoimmunhepatitis, primäre galliäre Cholangitis, Morbus Wilson, langfristige Anwendung nichtsteroidaler entzündungshemmender Medikamente, Kalziumkanalblocker, Tamoxifen, Amiodaron, Kortikosteroide, Isoniazid oder Methotrexat, Schwangerschaft oder Stillen. und eine Diagnose von Leberkrebs oder einem anderen gutartigen oder bösartigen Tumor.

Datenerhebung und Variablenauswahl

Die potenziellen Prädiktorvariablen, die in dieser Studie enthalten sind, sind unten aufgeführt:

Demografische Merkmale (d. h. Alter und Geschlecht); Body-Mass-Index (BMI); CAP-Werte der Teilnehmer in der NHANES-Datenbank; Allgemeine biochemische Tests [d. h. Albumin (ALB), Globulin (GLO), Gesamtprotein (TP), Laktatdehydrogenase (LDH), Blutharnstoff-Stickstoff (BUN), Harnsäure (UA), Gamma-Glutamyl-Transferase (GGT), Triglyzerid (TG), Serum-Glukose (Glu), Serumkreatinin (SCr), Gesamtbilirubin (TBIL), Natrium (Na⁺), Chlorid (Cl⁻), Kalium (K⁺), Calcium (Ca), Bicarbonat (HCO₃), Gesamtcholesterin (TC), Aspartat-Aminotransferase (AST) und Alanin-Aminotransferase (ALT)]; Standardhämatologische Parameter [d. h. Rote Blutkörperchenzählungen (RBC), Weiße Blutkörperchenzählungen (WBC), Neutrophilzählungen (NEUT), Eosinophilzahlen (EOS), Lymphozytenzählungen (LYM), Monozytenzählungen (MON), Verteilungsbreite der roten Blutkörperchen (RDW) und Thrombozytenzahlen (PLT)]; Vorgeschichte von Bluthochdruck und Diabetes mellitus (DM). Unter den in der Studie eingeschlossenen Probanden wurden die diagnostischen Kriterien für Diabetes und Bluthochdruck aus einer früheren maschinell-learningbasierten Vorhersagemodellstudie mit Fokus auf NAFLD24 gewonnen.

Fehlende Datenverarbeitung und Merkmalsauswahl

Die in dieser Studie verwendeten Kohortendaten enthielten fehlende Werte. Das Ausschließen aller unvollständigen Datensätze würde nicht nur die Stichprobengröße der Analyse verringern, sondern auch die Datenqualität beeinträchtigen und potenziell die Vorhersageergebnisse verzerren. Daher wurden alle Daten mit fehlenden Werten über 20 % ausgeschlossen. Für Datensätze mit fehlenden Werten ≤20 % wurden je nach Datentyp unterschiedliche Imputationsmethoden angewendet: "norm" für stetige Variablen, "logreg" für binäre Klassifikationsvariablen und "polyreg" für Mehrklassenvariablen. Diese Imputationen wurden mit dem "mäus"-Paket in R für Mehrfachimputation25 durchgeführt. In dieser Studie wurden alle stetigen Variablen in binäre Variablen aufgeteilt, wobei optimale Klassifikationsschwellenwerte mittels Analyse der Empfänger-Betriebscharakteristik (ROC) bestimmt wurden. Konkret wurde der Grenzwert, der dem maximalen Youden-Index auf der ROC-Kurve entspricht, als optimales Klassifikationskriterium ausgewählt, wodurch die Klassifikationsleistung optimiert und gleichzeitig ein angemessenes Gleichgewicht zwischen Sensitivität und Spezifität gewahrt wird. Anschließend wurde die teilweise kleinste Quadrat-Diskriminantenanalyse (PLS-DA) eingesetzt, um die Daten effektiv zu gruppieren.

Zur weiteren Auswahl der Funktionen wurden die Personen zufällig in Trainings- und Testgruppen im Verhältnis 7:3 mit dem "Carart"-Paket eingeteilt. Zunächst wurde für die Merkmalsauswahl (LASSO) die Regression mit minimaler absoluter Schrumpfung und Auswahloperator verwendet, wobei 14 Schlüsselvariablen für die spätere Analyse identifiziert wurden. Anschließend wurde ChatGPT-4 angewendet, um jeder Variablen einen Wichtigkeitswert zuzuweisen. Um die Merkmalsbedeutung systematisch zu bewerten und gleichzeitig potenzielle Verzerrungen und stochastische Variationen zu kontrollieren, wurde ein standardisiertes Bewertungsprotokoll implementiert. Der spezifische Prompt für das Modell lautete: "Basierend auf der etablierten klinischen Literatur zur nicht-alkoholischen Fettlebererkrankung (NAFLD) sollten Sie für jede der folgenden 14 Variablen, die durch die LASSO-Regression identifiziert wurden, einen Wichtigkeitswert von 1 (niedrigster) bis 10 (höchster) zuweisen." Indem die Bewertung strikt auf die durch LASSO-Regression vorausgewählten Variablen beschränkt wurde, wurde das Risiko, halluzinierte oder irrelevante Merkmale einzubeziehen, minimiert. Um ein mögliches Datenleck und unbeabsichtigten Einsatz von Outcome-Prävalenz strikt zu verhindern, wurde das Sprachmodell vollständig auf den empirischen Datensatz verblindet. Die Bewertung war darauf beschränkt, bereits vorhandenes medizinisches Wissen über die Variablennamen zu synthetisieren. Dieses Verfahren verbessert traditionelle Methoden, wie die LASSO-Stabilitätsauswahl oder SHAP-basiertes Pruning, indem sichergestellt wird, dass rein datengetriebene Merkmale vor der endgültigen Modellintegration eine robuste pathophysiologische Plausibilität aufweisen. Zusätzlich wurde dieses Verfahren zur Minderung der Single-Response-Varianz zehnmal unabhängig davon iteriert. Der Durchschnittswert für jede Variable wurde über diese Iterationen hinweg berechnet, um eine objektive Priorisierung sicherzustellen. Die Variablen wurden dann in absteigender Reihenfolge basierend auf ihren Durchschnittswerten gerankt. Schließlich wurde die Auswahl auf nur jene Variablen mit einem durchschnittlichen Wichtigkeitswert von über 5 eingegrenzt, was zu 8 Schlüsselvariablen führte: SCr, Harnurinteil, GGT, Glu, Bluthochdruck, Diabetes, TG und BMI.

Entwicklung von AutoML-basierten Vorhersagemodellen für NAFLD

In dieser Studie wurde eine umfassende Suite klassischer und fortschrittlicher maschineller Lernalgorithmen mit H2O-AutoML für die effektive Diagnose von NAFLD integriert. Durch die Nutzung der AutoML-Fähigkeiten der H2O.ai-Plattform wurden maschinelle Lernanalysen für binäre Klassifikationsaufgaben durchgeführt. Zu den verwendeten Algorithmen gehörten eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Generalized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) und Stacked Ensemble. Diese Algorithmen wurden systematisch ausgewertet, um das optimale Modell für die Krankheitsdiagnose zu identifizieren. Um eine strenge methodologische Reproduzierbarkeit zu gewährleisten, wurden die Ausführungsparameter von H2O AutoML explizit definiert. Die automatisierte Suche war auf eine maximale Laufzeit von 11.687 Sekunden und maximal 302 Modelle beschränkt, wobei ein fester zufälliger Seed von 13 verwendet wurde. Interne Vorverarbeitungs-Flags beinhalteten die automatische Imputation von Restwerten mit Mittelwert-/Modusalgorithmen sowie die Zielkodierung für kategoriale Variablen mit hoher Kardinalität. Die ausgewählte optimale Architektur (bezeichnet als GBM_grid_1_model77) war eine Gradient-Boosting-Maschine mit folgenden spezifischen Hyperparametern: insgesamt 28 Bäume, eine maximale Baumtiefe von 5 und eine Lernrate von 0,1.

Um die Modellrobustheit zu verbessern und Überanpassungsrisiken zu mindern, wurde ein AutoML-Framework implementiert, das systematische Hyperparameter-Tuning- und Validierungsprotokolle integriert. Der Prozess begann mit einer automatisierten Untersuchung von 200 verschiedenen Modellkonfigurationen durch Hyperparameteroptimierung, wobei fünffache Kreuzvalidierung eingesetzt wurde, bei der der Trainingsdatensatz in fünf gegenseitig ausschließende Teilmengen aufgeteilt wurde. Während des iterativen Trainings nutzte jede Konfiguration vier Teilmengen (80 %) für den Modellbau, während eine Teilmenge (20 %) für die Validierung reserviert wurde, wobei diese Validierungsrolle sequentiell über alle Falten hinweg rotierte. Um die Recheneffizienz mit der Leistungsoptimierung auszubalancieren, wurde dynamisches frühes Stoppen basierend auf der Fläche unter der ROC-Kurve (AUC)-Metrik implementiert. Dieser Mechanismus unterbrach das Training, wenn AUC-Verbesserungen drei aufeinanderfolgende Zyklen unter eine Schwelle von 0,001 fielen, was sowohl auf die individuelle Modelloptimierung als auch auf den gesamten AutoML-Suchprozess angewendet wurde. Die endgültige Modellauswahl priorisierte Konfigurationen, die einen maximalen durchschnittlichen AUC über sowohl Trainings- als auch Validierungssets zeigten, während gleichzeitig eine konsistente Leistung zwischen diesen Sätzen und minimale metrische Varianz über Cross-Validierungsiterationen erforderlich waren. Dieser integrierte Ansatz gewährleistete eine optimale prädiktive Genauigkeit bei gleichzeitiger Erhaltung einer starken Generalisierung durch rigorose Validierungsprotokolle und automatisierte Optimierungsbeschränkungen.

Modellleistungsbewertung und Interpretation der Vorhersageergebnisse

Die Modellleistung und die Interpretation der Vorhersageergebnisse wurden umfassend mittels ROC-Kurven, F1-Werten und SHapley-additiver Erklärungsanalyse (SHAP) bewertet. Die Leistung des Modells und die Interpretation seiner Vorhersageergebnisse wurden umfassend mit ROC-Kurven, F1-Werten und SHapley Additive Explanation (SHAP)-Analyse bewertet. Anfangs wurden Vorhersagen auf dem Testdatensatz mit dem trainierten Modell generiert, und die vorhergesagten Wahrscheinlichkeiten für die positive Klasse (d. h. Klasse 1) wurden extrahiert (pred_prob). Die ROC-Kurve wurde mit dem pROC-Paket konstruiert, und die AUC des Modells sowie ihr 95%-Konfidenzintervall wurden berechnet. Der optimale Schwellenwert auf der ROC-Kurve wurde mittels Youdens J-Statistik (J = Sensitivität + Spezifität − 1) zur Bestimmung binärer Klassifikationslabels bestimmt. Basierend auf diesem Schwellenwert, der aus der ROC-Kurve abgeleitet wurde, wurden die vorhergesagten Wahrscheinlichkeiten in binäre Vorhersagelabels (0 oder 1) umgewandelt, und anschließend wurde eine Verwirrungsmatrix erzeugt. Der F1-Wert im Testsatz wurde mit der Verwirrungsmatrixfunktion berechnet, und eine Visualisierung der Verwirrungsmatrix wurde erstellt und gespeichert. Zusätzlich wurde das Modell auf einem unabhängigen externen Validierungsdatensatz aus 200 Fällen (vom First Affiliated Hospital der Wenzhou Medical University) weiter validiert. SHAP-Werte wurden mit dem "shapviz"-Paket analysiert, um die Auswirkungen jeder Variablen auf die Vorhersageergebnisse des Modells zu erläutern und so Einblicke in die Interpretation einzelner NAFLD-Likelihood-Vorhersagen zu liefern.

Statistische Methoden

"Statistische Analysen und Softwareentwicklung wurden mit R Version 4.2.3 (R Foundation for Statistical Computing, Wien, Österreich) durchgeführt. Kontinuierliche Variablen wurden zunächst mit dem Shapiro-Wilk-Test oder der visuellen Inspektion von Q-Q-Diagrammen auf Normalität bewertet. Normal verteilte Daten wurden als Mittelwert ± Standardabweichung (SD) präsentiert, und Vergleiche zwischen zwei unabhängigen Gruppen wurden mit unabhängigen Stichproben durchgeführt. Für mehrere Gruppenvergleiche wurde einseitig ANOVA zusammen mit post-hoc Tukey's HSD-Tests eingesetzt, wenn es angemessen war. Nicht normal verteilte kontinuierliche Daten wurden als Median zusammengefasst [Interquartilbereich (IQR), P25–P75], und Gruppenvergleiche wurden mit dem Mann-Whitney-U-Test für zwei unabhängige Gruppen oder dem Kruskal-Wallis-Test für mehrere Gruppen durchgeführt, gefolgt von Dunns Post-hoc-Test, falls nötig. Kategoriale Variablen wurden als Häufigkeiten und Prozentsätze (%) angegeben, und Vergleiche der Anteile zwischen den Gruppen wurden mit dem Chi-Quadrat-Test (χ-2-Test ) oder dem Fisher-Exakt-Test analysiert, wenn die erwarteten Zellzahlen unter 5 lagen. Das Signifikanzniveau wurde auf α = 0,05 (zweiseitig) festgelegt, und ein p-Wert < 0,05 wurde als statistisch signifikant angesehen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Klinische Merkmale von NAFLD

In dieser Studie wurden die klinischen Merkmale von Personen mit und ohne NAFLD systematisch analysiert. Eine Reihe von Methoden wurde angewandt, um die Verteilung und Unterschiede dieser Merkmale innerhalb der Stichprobenpopulation klar zu veranschaulichen (Tabelle 1). Insgesamt wurden 2.677 Personen in die Analyse eingeschlossen, von denen 718 NAFLD hatten. Die Analyse umfasste eine Reihe klinisc...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NAFLD ist weltweit die häufigste Ursache für chronische Lebererkrankungen, und ihre Prävalenz steigt jedesJahr 26 um etwa 1 %. Etwa 30 % der Weltbevölkerung sind betroffen, womit NAFLD nicht nur die führende chronische Lebererkrankung, sondern auch die am schnellsten wachsende Indikation für eine Lebertransplantationist. Automatisiertes maschinelles Lernen (AutoML) hat sich als wertvolles Werkzeug in der Medizin etabliert,...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren erklären, dass sie keinen Interessenkonflikt haben. In dieser Studie wurde ChatGPT-4 (OpenAI) als intelligentes analytisches Werkzeug während der Merkmalauswahlphase eingesetzt, um die klinische Relevanz der durch LASSO-Regression identifizierten Variablen zu bewerten. Alle KI-generierten Werte wurden von den Autoren sorgfältig geprüft und empirisch durch den anschließenden AutoML-Prozess validiert. ChatGPT-4 wurde nicht verwendet, um Rohdaten zu verändern oder mathematische Berechnungen durchzuführen. Die Autoren übernehmen die volle Verantwortung für die Integrität und Genauigkeit der Endergebnisse.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Arbeit wurde vom Startup-Fonds für wissenschaftliche Forschung der Fujian Medical University [2021QH1176] unterstützt; das Schlüssellabor für klinische Labordiagnostik und translationale Forschung der Provinz Zhejiang [2022E10022]; das Provinzprojekt für Medizin und Gesundheitswissenschaften und -technologie der Provinz Zhejiang [2024KY1265]; und das Wenzhou Municipal Basic Public Welfare Research Project [Y2023096].

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

```html

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Datensätze für NAFLD (2017–2018)NHANES-Datenbank [https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017]N/Aals Trainingsdatensatz für die Modellkonstruktion
Datensätze für NAFLD (2018–2020)Das Erste Angeschlossene Krankenhaus der Medizinischen Universität Wenzhou (2018–2020), China. [https://doi.org/10.6084/m9.figshare.32105248.]N/Aals Testdatensatz für die externe Validierung des Modells
R (Version 4.2.3)R Foundation for Statistical ComputingN/Azur Verwendung in Verbindung mit anderen Tools zur Durchführung von Datenanalysen und zur Erstellung visueller und grafischer Präsentationen.
Adobe Illustrator 2025 (Version 29.2)Adobe Systems IncorporatedN/AFür Bildlayout und -bearbeitung
ChatGPT-4OpenAI Inc.N/AZum Zuweisen einer Wichtigkeitsbewertung für jede ausgewählte Variable
H2O AutoML (3.44.0.3)H2O.aiN/AZur Integration eines umfassenden Satzes von Machine-Learning-Algorithmen
```

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

MedizinAusgabe 233Ausgabe 233Diesen Monat in JoVEAusgabeAutoMLDiagnoseGradient Boosting Machine

Verwandte Artikel