$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Database-toegang en softwareomgeving
Verkrijg geautoriseerde toegang tot de Medical Information Mart for Intensive Care IV-database (MIMIC-IV, v3.1) na het voltooien van de vereiste training over ethisch datagebruik (Certificerings-ID: 69002811). Volgens de Measures for Ethical Review of Life Science and Medical Research Involving Human Subjects (18 februari 2023, China) bepaalt Artikel 32 dat onderzoek met legaal verkregen openbare gegevens, data die niet het publieke gedrag belemmert, of geanonimiseerde informatie is vrijgesteld van ethische beoordeling. In overeenstemming met deze bepalingen was deze studie vrijgesteld van institutionele ethische goedkeuring. Het datagebruikprotocol en de ethische richtlijnen werden strikt gevolgd, en de studie werd uitsluitend uitgevoerd voor wetenschappelijk onderzoek. Stel de databaseomgeving op met PostgreSQL (v17.1.11). Gebruik Navicat Premium (v17) als databasebeheer- en queryinterface om SQL-query's uit te voeren en geëxtraheerde datasets te exporteren voor analyse.
Patiëntselectie
Identificeer patiënten met longkanker in MIMIC-IV met behulp van de International Classification of Diseases, Ninth and Tenth Revision (ICD-9 en ICD-10) codes17. Pas de volgende uitsluitingscriteria opeenvolgend toe: Leeftijd <18 jaar of >90 jaar; Ontbrekende serumalbuminemetingen binnen de eerste 24 uur na IC-opname; Meerdere IC- of ziekenhuisopnames; IC-verblijfsduur <24 uur.
Variabele extractie
Haal variabelen uit MIMIC-IV (v3.1) met behulp van PostgreSQL (v17.1.11) via Navicat Premium (v17), waaronder: demografie, vitale functies, laboratoriumtesten, comorbiditeiten, therapeutische interventies, ernstscores en uitkomsten. Demografie: leeftijd, geslacht. Vitale functies binnen de eerste 24 uur na IC-opname: hartslag (HR), ademhalingsfrequentie (RR), zuurstofsaturatie (SpO₂) en temperatuur. Laboratoriumvariabelen binnen de eerste 24 uur: serumalbumine, glucose, creatinine, ureumstikstof, totale bilirubine, hemoglobine, rode bloedcellen (RBC) telling, witte bloedcellen (WBC) telling, bloedplaatjesaantal, rode bloedcelverdelingsbreedte (RDW), alanineaminotransferase (ALT), aspartaataminotransferase (AST), protrombinetijd (PT), calcium, kalium, natrium, chloride. Comorbiditeiten uit diagnostische dossiers: hypertensie, levercirrose, chronische nierziekte, diabetes mellitus, chronische bronchitis, congestief hartfalen en chronische obstructieve longziekte (COPD). Ernstscores bij IC-opname: Sequentiële Orgaanfalingsbeoordeling (SOFA), Vereenvoudigde Acute Fysiologie Score II (SAPS II), Charlson Comorbiditeitsindex, Acute Fysiologie en Chronische Gezondheidsevaluatie II (APACHE II). Therapeutische interventies: systemische corticosteroïden, antibiotica, vasopressors. Levensstijlfactor: rookgeschiedenis. Voor alle laboratoriumvariabelen en ernstwaarden binnen de eerste 24 uur, als meerdere metingen beschikbaar zijn, bereken je de gemiddelde waarde over deeerste dag en gebruik deze waarde voor de analyse. Sluit variabelen uit met meer dan 20% ontbrekende gegevens. Voor variabelen met ontbrekende ≤20%, voer imputatie uit met het missForest-algoritme, een op random forest-gebaseerde machine learning-methode voor het verwerken van gemengde klinische data. Het aandeel ontbrekende gegevens voor sleutelvariabelen wordt weergegeven in Aanvullende Tabel 1.
Definitie van uitkomsten
Definieer de primaire uitkomst als sterfte door alle oorzaken binnen 28 dagen na opname op de IC. Bepaal de sterftestatus met behulp van overlijdensregisters beschikbaar in de MIMIC-IV-database. Classificeer patiënten als overlevenden of niet-overlevenden op basis van de 28-dagen sterftestatus.
Statistische analyse
Beoordeel de verdeling van continue variabelen met behulp van de Shapiro–Wilk-test. Vergelijk normaal verdeelde variabelen met behulp van Student's t-test en niet-normaal verstreken variabelen met behulp van de Wilcoxon rangsomtest. Vergelijk categorische variabelen met behulp van de chi-kwadraattest. Voer least absolute shrinkage and selection operator (LASSO) regressie uit met 10-voudige kruisvalidatie om kandidaatvariabelen te selecteren en multicollineariteit te verminderen. Constructeer multivariabele Cox-proportionele hazardmodellen om de onafhankelijke associatie tussen serumalbumine en 28-dagen sterfte te evalueren. Serumalbumine werd zowel als continue als categorische variabele ingevoerd, en covariaten geselecteerd door LASSO-regressie werden opgenomen voor aanpassing. Hazard ratios (HR's) en 95% betrouwbaarheidsintervallen (BI's) werden geschat. Onderzoek niet-lineaire associaties met behulp van restricted cubic spline (RCS) analyse. Knopen werden geplaatst op vooraf gedefinieerde percentielen van de albumineverdeling, en de niet-lineariteit werd beoordeeld door de splinetermen te testen. Genereer Kaplan–Meier-overlevingscurves en vergelijk overlevingsverdelingen met behulp van de log-rangtest.
Ontwikkeling en validatie van machine learning-modellen
Splits de dataset op patiëntniveau willekeurig op in een trainingsset (70%), een validatieset (15%) en een onafhankelijke testset (15%). Voer feature-selectie uit met behulp van de trainingsset alleen door het identificeren van de snijpunten van variabelen die door LASSO-regressie en het Boruta-algoritme zijn geselecteerd, zodat alleen stabiele en relevante voorspellers behouden blijven. Train acht machine-learning classifiers op de trainingsset, waaronder logistische regressie, random forest, decision tree, support vector machine, XGBoost, LightGBM, complement naïeve Bayes en support vector classifier. De modelprestaties werden eerst beoordeeld in de validatieset en vervolgens bevestigd in de onafhankelijke testset met behulp van AUC-ROC, AUC-PR, nauwkeurigheid, gevoeligheid, specificiteit, kalibratiecurves, beslissingscurveanalyse en leercurves.
Modelinterpretatie en eindpunt
Identificeer het best presterende machine learning-model op basis van validatieprestatie-metrics. Pas SHapley Additive Explanations (SHAP) toe om de bijdrage van elk kenmerk aan sterftevoorspelling te kwantificeren. Genereer SHAP-samenvattings- en afhankelijkheidsgrafieken om het relatieve belang en de richting van serumalbumine en andere voorspellers te visualiseren. Voltooi de analyse door statistische en machine learning-resultaten te integreren om een interpreteerbaar risicostratificatiekader vast te stellen.