$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Diese Studie griff nach Abschluss der 44151052 Medical Information Mart for Intensive Care IV (Mimic-IV) Datenbank 11 (Version 1.0, PhysioNet: https://physionet.org/content/mimiciv/1.0/) und der Telehealth Intensive Care Unit (eICU) Datenbank12 (Version 2.0, PhysioNet: https://physionet.org/content/eicu-crd/2.0/) auf die Medical Information Mart for Intensive Care IV (mimic-IV) Datenbank12 (Version 2.0, PhysioNet: ) zu. Diese Studie wurde gemäß den Grundsätzen der Erklärung von Helsinki (2013) durchgeführt, und die Patienten hatten ihre Zustimmung zur Erfassung ihrer Daten in den beiden Datenbanken erteilt. Die ethische Zulassung wurde für diese Studie aufgehoben, da die Daten in den Datenbanken der eICU und MIMIC-IV vollständig anonymisiert waren (keine persönlichen Identifikatoren wurden erhalten).
Materialien und Werkzeuge
Datenquellen: MIMIC-IV-Datenbank: Version 1.0, Einzelzentrum-Open-Access-Register mit 76.540 Intensivstationsaufnahmen (2008–2019), abgerufen über PhysioNet. eICU-Datenbank: Version 2.0, Multicenter-Datenbank mit >200.000 elektronischen Krankenakten aus 335 Einheiten in 208 US-Krankenhäusern (2014–2015), abgerufen über PhysioNet. Software und Ausführungsumgebung: RapidMiner Studio: Version 9.10.001 (Ausführungsumgebung: Windows 10 Pro 64-Bit), verwendet für den Modellbau (Klassifikation/Clustering) und die Auswahl von Funktionen; IBM SPSS Statistics: Version 23.0 (Ausführungsumgebung: Windows 10 Pro 64-Bit), verwendet für statistische Analysen und Imputation fehlender Werte; Java Development Kit (JDK): Version Java SE 8u381 (Ausführungsumgebung: Windows 10 Pro 64-Bit), verwendet für die Entwicklung von Webanwendungen; unterstützende IDE: Eclipse IDE 2023-09; Apache Tomcat: Version 9.0.85, verwendet zum Bereitstellen der webbasierten Anwendung.
Studiendesign und Umgebungen
Das Konzept dieser Studie ist in ergänzender Abbildung 1 dargestellt. Diese Studie analysierte Daten aus zwei großen Quellen, der Medical Information Mart for Intensive Care IV (MIMIC-IV) und der Telehealth Intensive Care Unit (eICU)-Datenbanken, um ein prädiktives Modell der lungenentzündungsassoziierten ARDS zu erstellen und betroffene Patienten nach klinischen Phänotypen zu klassifizieren. Diese Studie folgte den Richtlinien des Transparent Reporting of a Multivariable Prediction Model for Individual Prognosis or Diagnosis (TRIPOD).
Studienproben
Die Trainings- und Testdaten dieser Studie wurden von MIMIC-IV gewonnen. Die Quelle der externen Verifizierung war die multizentrische eICU-Datenbank. Diese Studie nutzte die International Classification of Diseases (neunte und zehnte Revision), um Daten über Patienten mit Lungenentzündung und lungenentzündungsassoziiertem ARDS zu extrahieren. Patienten, die weniger als 24 Stunden aufgenommen wurden, wurden ausgeschlossen.
Prädiktoren
Nach Auswertung der Datenverfügbarkeit und der Rate fehlender klinischer Variablen in den MIMIC-IV- und eICU-Datensätzen wurden 52 Variablen für lungenentzündungsassoziierte ARDS als Kandidaten-Trainingsvariablen für den Einsatz im maschinellen Lernen ausgewählt, einschließlich demografischer Merkmale der Patienten, Laborergebnissen und Werten der Krankheitsschwere. Diese Studie verwendete einen Gewichtungs-nach-Korrelations-Algorithmus (basierend auf dem Korrelationsgewicht zwischen Variablen und Ergebnissen), um nach Schlüsselprädiktoren (Variablen, die letztlich in die Modelle einbezogen werden) der 52 Kandidatenvariablen zu filtern und anschließend Subgruppen-Clusteringfaktoren aus den wichtigsten Prädiktoren auszuwählen.
Dazu öffnen Sie RapidMiner Studio, erstellen Sie einen neuen Prozess und fügen Sie den Operator Gewicht nach Korrelation hinzu, indem Sie auf Process > Operators > Feature Selection > Weight by Correlation klicken. Setzen Sie den Parameter: Korrelationsschwelle = 0,04 (behalten Sie Variablen mit Gewicht > 0,04). Um das Modell dazu zu zwingen, frühe Krankheitsstadien und Aktualität zu berücksichtigen, wurden innerhalb von 24 Stunden nach der Aufnahme die Maximal- und Minimalwerte der Laborindikatoren ermittelt. Da der Acute Physiology Score III (APSIII) nicht in der eICU-Datenbank enthalten war, wurden stattdessen Werte für die Acute Physiology and Chronic Health Evaluation IV (APACHE IV) verwendet. Diese Studie bereinigte die Daten und interpolierte die fehlenden Werte mithilfe der Mehrfachimputationsmethode und standardisierte die Eingabevariablen bei der Entwicklung von Prädiktions- und Subphänotypisierungsmodellen.
Statistische Analyse
Öffnen Sie SPSS 23.0, importieren Sie den vorverarbeiteten Datensatz und wählen Sie Analysieren > Deskriptive Statistiken > Erkunden. Überprüfen Sie Normalitätsdiagramme mit Tests , um den Kolmogorov-Smirnov-Test für kontinuierliche Variablen durchzuführen. Schiefverteilte Variablen werden als Median (Interquartilbereich, IQR) angegeben; Kategoriale Variablen werden als Anzahl (Prozent, %) angegeben. Um kontinuierliche Variablen zwischen Gruppen zu vergleichen, wurde je nach Bedarf der Mann-Whitney-U-Test oder der Kruskal-Wallis-Test verwendet. Um kategorische Variablen zwischen Gruppen zu vergleichen, wurde je nach Bedarf Pearsons Chi-Quadrat-Test oder Fishers exakter Test verwendet.
Modellentwicklung und Webpräsentation
Für die Modellentwicklung teilte diese Studie die MIMIC-IV-Derivationskohorte in ein Trainingsset (90 % der Gesamtstichprobe wurden zufällig für Modellentwicklung und Hyperparameter-Tuning ausgewählt) und ein Testset (10 % der Gesamtstichprobe wurden zufällig für interne Tests ausgewählt); diese Studie führte eine externe Verifikation auf der eICU durch. Diese Studie implementierte maschinelles Lernen mit fünf Methoden: Entscheidungsbaum, logistische Regression, naive Bayes, Stacking (Basislerner waren die logistische Regression, naive Bayes und Random Forest-Methoden; der Stacking-Learner war die Entscheidungsbaummethode) und Random Forest. Entscheidungsbaum: Klicken Sie auf Prozess > Operatoren > Modellierung > Klassifikation > Entscheidungsbaum mit Algorithmus = C4,5, minimale Blattgröße = 5. Für logistische Regression: Klicken Sie auf Prozess > Operatoren > Modellierung > Klassifikation > logistische Regression mit Regularisierungsstärke = 0,1, maximale Iterationen = 100. Für naive Bayes: Klicken Sie auf Prozess > Operatoren > Modellierung > Klassifikation > naive Bayes mit Kerneltyp = Gaußsch. Für Random Forest: Klicken Sie auf Process > Operators > Modeling > Classification > Random Forest mit Anzahl der Bäume = 100, maximale Tiefe = 20. Für Stacking: Klicken Sie auf Process > Operatoren > Modellierung > Ensemble > Stacking with Base Learners = Logistic Regression + Naive Bayes + Random Forest; Stacking Learner = Entscheidungsbaum. Diese Studie maß die Vorhersageleistung des entwickelten Modells, indem sie die Fläche unter der Empfänger-Betriebscharakteristiekkurve (AUC), Genauigkeit, Präzision und Abruf berechnete.
Bei der Erstellung der Klassifikation der pneumonieassoziierten ARDS-klinischen Untergruppen verwendete diese Studie k-Means-Clustering mit wichtigen Prädiktoren. Um die optimale Anzahl von Clustern k zu bestimmen, wurde der Wert der Gap-Statistiken im Gap-Statistik-Plot untersucht, der die optimale Anzahl von Clustern nahelegte. Diese Studie analysierte die klinischen Merkmale und Ergebnisse verschiedener Phänotypen und verglichen die Unterschiede in den Sterblichkeitsraten im Krankenhaus bei Patienten mit unterschiedlichen Clustern, die frühzeitig eine niedrig- bis mitteldosierte Kortikosteroidbehandlung erhielten oder nicht.
Wählen Sie in RapidMiner Studio Datei > Export Model aus und speichern Sie die Diagnosevorhersage- und Untergruppenklassifikationsmodelle als .model-Dateien. Verwenden Sie JDK Java SE 8u381 und Eclipse IDE 2023-09, um Webseiten in Java-Sprache zu schreiben; Importiere die .model-Dateien ins Projekt. Diese Studie nutzte die Java-Sprache, um eine Webseite zu entwickeln, auf der das diagnostische Modell und das klinische Subgruppen-Clustering-Modell eingebettet wurden, und wir haben das Modell online hochgeladen.