$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Datenbankzugriff und Softwareumgebung
Erhalten Sie den autorisierten Zugang zur Medical Information Mart for Intensive Care IV-Datenbank (MIMIC-IV, v3.1) nach Abschluss der erforderlichen Schulung zur Nutzung ethischer Daten (Zertifizierungs-ID: 69002811). Laut den Measures for Ethical Review of Life Science and Medical Research Involving Human Subjects (18. Februar 2023, China) schreibt Artikel 32 vor, dass Forschung mit legal erworbenen öffentlichen Daten, Daten, die ohne Beeinträchtigung des öffentlichen Verhaltens generiert wurden, oder anonymisierten Informationen von der ethischen Überprüfung ausgenommen sind. Im Einklang mit diesen Bestimmungen war diese Studie von der institutionellen ethischen Zulassung ausgenommen. Das Datennutzungsprotokoll und die ethischen Richtlinien wurden strikt befolgt, und die Studie wurde ausschließlich zu wissenschaftlichen Forschungszwecken durchgeführt. Richte die Datenbankumgebung mit PostgreSQL (v17.1.11) ein. Verwenden Sie Navicat Premium (v17) als Datenbankverwaltungs- und Abfrageschnittstelle, um SQL-Abfragen auszuführen und extrahierte Datensätze zur Analyse zu exportieren.
Patientenauswahl
Identifizieren Sie Patienten mit Lungenkrebs in MIMIC-IV mithilfe der International Classification of Diseases, Ninth and Tenth Revision (ICD-9 und ICD-10) Codes17. Wenden Sie folgende Ausschlusskriterien nacheinander an: Alter <18 Jahre oder >90 Jahre; Fehlende Serumalbuminmessungen innerhalb der ersten 24 Stunden der Intensivstationseinweisung; Mehrere Intensivstationen oder Krankenhausaufnahmen; Dauer des Aufenthalts auf der Intensivstation <24 Stunden.
Variable Extraktion
Variablen aus MIMIC-IV (v3.1) mit PostgreSQL (v17.1.11) über Navicat Premium (v17) extrahieren, einschließlich: Demografie, Vitalzeichen, Labortests, Komorbiditäten, therapeutische Interventionen, Schweregradwerte und Endpunkte. Demografie: Alter, Geschlecht. Vitalwerte innerhalb der ersten 24 Stunden nach der Intensivstation: Herzfrequenz (HR), Atemfrequenz (RR), Sauerstoffsättigung (SpO₂) und Temperatur. Laborvariablen innerhalb der ersten 24 Stunden: Serumalbumin, Glukose, Kreatinin, Harnstoffstoff, Gesamtzahl von Bilirubin, Hämoglobin, Anzahl roter Blutkörperchen (RBC), Anzahl weißer Blutkörperchen (WBC), Thrombozytenzahl, Verteilungsbreite der roten Blutkörperchen (RDW), Alaninaminotransferase (ALT), Aspartataminotransferase (AST), Prothrombinzeit (PT), Kalzium, Kalium, Natrium, Chlorid. Komorbiditäten laut Diagnoseunterlagen: Bluthochdruck, Leberzirrhose, chronische Nierenerkrankung, Diabetes mellitus, chronische Bronchitis, Herzinsuffizienz und chronisch obstruktive Lungenerkrankung (COPD). Schweregradwerte bei der Intensivstation: Sequential Organ Failure Assessment (SOFA), Simplified Acute Physiology Score II (SAPS II), Charlson Comorbidity Index, Acute Physiology and Chronic Health Evaluation II (APACHE II). Therapeutische Interventionen: systemische Kortikosteroide, Antibiotika, Vasopressoren. Lebensstilfaktor: Rauchvorgeschichte. Für alle Laborvariablen und Schweregradwerte innerhalb der ersten 24 Stunden, wenn mehrere Messungen verfügbar sind, berechnen Sie den Durchschnittswert über denersten Tag und verwenden Sie diesen Wert für die Analyse. Variablen mit mehr als 20 % fehlenden Daten ausschließen. Für Variablen mit Fehlverhalten ≤20 % führen Sie Imputationen mit dem missForest-Algorithmus durch, einer auf Zufallswald basierenden maschinellen Lernmethode zur Verarbeitung gemischter klinischer Daten. Der Anteil der fehlenden Daten für Schlüsselvariablen ist in ergänzender Tabelle 1 angegeben.
Ergebnisdefinition
Definieren Sie das primäre Ergebnis als Gesamtmortalität innerhalb von 28 Tagen nach Aufnahme auf die Intensivstation. Ermitteln Sie den Sterblichkeitsstatus anhand der Sterberegister, die in der MIMIC-IV-Datenbank verfügbar sind. Klassifizieren Sie Patienten als Überlebende oder Nicht-Überlebende basierend auf dem 28-Tage-Sterblichkeitsstatus.
Statistische Analyse
Bewerten Sie die Verteilung stettiger Variablen mit dem Shapiro–Wilk-Test. Vergleichen Sie normalverteilte Variablen mit dem Student-t-Test und nicht-normalverteilte Variablen mit dem Wilcoxon-Rangsummentest. Vergleichen Sie kategoriale Variablen mit dem Chi-Quadrat-Test. Führen Sie eine Regression mit minimaler absoluter Schrumpfung und Auswahloperator (LASSO) mit 10-facher Kreuzvalidierung durch, um Kandidatenvariablen auszuwählen und die Multikollinearität zu reduzieren. Erstellen Sie multivariable Cox-Proportionalhazard-Modelle, um die unabhängige Verbindung zwischen Serumalbumin und 28-Tage-Mortalität zu bewerten. Serumalbumin wurde sowohl als kontinuierliche als auch als kategoriale Variable eingegeben, und Kovariaten, die durch die LASSO-Regression ausgewählt wurden, wurden zur Anpassung einbezogen. Hazard Ratios (HRs) und 95%-Konfidenzintervalle (KI) wurden geschätzt. Untersuchen Sie nichtlineare Assoziationen mithilfe der Limited cubic Spline (RCS)-Analyse. Die Knoten wurden an vordefinierten Perzentilen der Albuminverteilung platziert, und die Nichtlinearität wurde durch Tests der Spline-Terme bewertet. Erstellen Sie Kaplan–Meier-Überlebenskurven und vergleichen Sie Überlebensverteilungen mit dem Log-Rank-Test.
Entwicklung und Validierung von Modellen für maschinelles Lernen
Teilen Sie den Datensatz auf Patientenebene zufällig in ein Trainingsset (70 %), ein Validierungsset (15 %) und ein unabhängiges Testset (15 %) auf. Führen Sie die Merkmalsauswahl ausschließlich mit dem Trainingssatz durch, indem Sie die Schnittmenge der durch LASSO-Regression und den Boruta-Algorithmus ausgewählten Variablen identifizieren, wobei sichergestellt wird, dass nur stabile und relevante Prädiktoren erhalten bleiben. Trainieren Sie acht maschinelle Lernklassifikatoren auf dem Trainingsset, darunter logistische Regression, Random Forest, Entscheidungsbaum, Support Vector Machine, XGBoost, LightGBM, Complement Na�ive Bayes und Support Vector Classifier. Die Modellleistung wurde zunächst im Validierungsset bewertet und anschließend im unabhängigen Testsatz mit AUC-ROC, AUC-PR, Genauigkeit, Sensitivität, Spezifität, Kalibrierungskurven, Entscheidungskurvenanalyse und Lernkurven bestätigt.
Modellinterpretation und Endpunkt
Identifizieren Sie das leistungsstärkste maschinelle Lernmodell anhand von Validierungsmetriken. Wenden Sie SHapley Additive Explanations (SHAP) an, um den Beitrag jedes Merkmals zur Sterblichkeitsprognose zu quantifizieren. Erstellen Sie SHAP-Zusammenfassungs- und Abhängigkeitsdiagramme, um die relative Bedeutung und Richtung von Serumalbumin und anderen Prädiktoren zu visualisieren. Schließen Sie die Analyse ab, indem Sie statistische und maschinelle Lernergebnisse integrieren, um einen interpretierbaren Risikostratifizierungsrahmen zu etablieren.