$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Accesso a database e ambiente software
Ottenere l'accesso autorizzato al database Medical Information Mart for Intensive Care IV (MIMIC-IV, v3.1) dopo aver completato la formazione richiesta sull'uso etico dei dati (ID certificazione: 69002811). Secondo le Misure per la Revisione Etica delle Scienze della Vita e della Ricerca Medica che coinvolgono Soggetti Umani (18 febbraio 2023, Cina), l'Articolo 32 stabilisce che la ricerca che utilizza dati pubblici ottenuti legalmente, dati generati senza interferire con il comportamento pubblico o informazioni anonime sono esentate dalla revisione etica. In conformità con queste disposizioni, questo studio è stato esente dall'approvazione etica istituzionale. Il protocollo di utilizzo dei dati e le linee guida etiche sono stati seguiti rigorosamente, e lo studio è stato condotto esclusivamente a scopo di ricerca scientifica. Configura l'ambiente del database usando PostgreSQL (v17.1.11). Usa Navicat Premium (v17) come interfaccia di gestione database e query per eseguire query SQL ed esportare dataset estratti per l'analisi.
Selezione dei pazienti
Identificare i pazienti con cancro ai polmoni in MIMIC-IV utilizzando i codici17 della Classificazione Internazionale delle Malattie, Nona e Decima Revisione (ICD-9 e ICD-10). Applicare i seguenti criteri di esclusione in sequenza: Età <18 anni o >90 anni; Mancanza di misurazioni di albumina sierica entro le prime 24 ore dal ricovero in terapia intensiva; Ricoveri multipli in terapia intensiva o ospedale; Durata del soggiorno in terapia intensiva <24 ore.
Estrazione variabile
Estrai le variabili da MIMIC-IV (v3.1) utilizzando PostgreSQL (v17.1.11) tramite Navicat Premium (v17), inclusi: dati demografici, parametri vitali, test di laboratorio, comorbidità, interventi terapeutici, punteggi di gravità e risultati. Demografia: età, genere. Segni vitali nelle prime 24 ore dopo il ricovero in terapia intensiva: frequenza cardiaca (FC), frequenza respiratoria (RR), saturazione di ossigeno (SpO₂) e temperatura. Variabili di laboratorio nelle prime 24 ore: albumina sierica, glucosio, creatinina, azoto ureico, bilirubina totale, emoglobina, conteggio dei globuli rossi (RBC), conteggio dei globuli bianchi (GBB), conteggio delle piastrine, larghezza della distribuzione dei globuli rossi (RDW), alanina aminotransferasi (ALT), aspartato aminotransferasi (AST), tempo della protrombina (PT), calcio, potassio, sodio, cloruro. Comorbidità dai dati diagnostici: ipertensione, cirrosi epatica, malattia renale cronica, diabete mellito, bronchite cronica, insufficienza cardiaca congestizia e bronchiopatia ostruttiva cronica (BPCO). Punteggi di gravità all'ammissione in terapia intensiva: Valutazione Sequenziale di Insufficienza Organica (SOFA), Punteggio di Fisiologia Acuta Semplificata II (SAPS II), Indice di Comorbidità di Charlson, Valutazione della Fisiologia Acuta e della Salute Cronica II (APACHE II). Interventi terapeutici: corticosteroidi sistemici, antibiotici, vasopressori. Fattore di stile di vita: storia del fumo. Per tutte le variabili di laboratorio e i punteggi di gravità nelle prime 24 ore, se sono disponibili più misurazioni, si calcola il valore medio delprimo giorno e si utilizza questo valore per l'analisi. Escludere variabili con più del 20% di dati mancanti. Per variabili con mancanza ≤20%, esegui l'imputazione utilizzando l'algoritmo missForest, un metodo di apprendimento automatico basato su foresta casuale per gestire dati clinici di tipo misto. La proporzione di dati mancanti per le variabili chiave è fornita nella Tabella Supplementare 1.
Definizione dell'esito
Definire l'esito primario come mortalità per tutte le cause entro 28 giorni dal ricovero in terapia intensiva. Accertare lo stato di mortalità utilizzando i registri dei decessi disponibili nel database MIMIC-IV. Classificare i pazienti come sopravvissuti o non sopravvissuti in base allo stato di mortalità di 28 giorni.
Analisi statistica
Valutare la distribuzione delle variabili continue utilizzando il test di Shapiro–Wilk. Confronta le variabili normalmente distribuite usando il test t di Student e le variabili normalmente distribuite usando il test di somma dei rangi di Wilcoxon. Confronta le variabili categoriche usando il test del chi-quadrato. Eseguire la regressione LASSO, con minima riduzione assoluta e l'operatore di selezione (LASSO), con validazione incrociata a 10 volte per selezionare variabili candidate e ridurre la multicollinearità. Costruire modelli multivariabili di rischio proporzionale di Cox per valutare l'associazione indipendente tra albumina sierica e mortalità a 28 giorni. L'albumina sierica è stata inserita sia come variabile continua che categorica, e sono state incluse le covarie selezionate tramite regressione LASSO per l'aggiustamento. Sono stati stimati i rapporti di rischio (HR) e gli intervalli di confidenza (IC) al 95%. Esplora le associazioni non lineari utilizzando l'analisi a spline cubiche limitate (RCS). I nodi sono stati posizionati a percentili predefiniti della distribuzione dell'albumina e la non linearità è stata valutata testando i termini delle spline. Generare curve di sopravvivenza di Kaplan–Meier e confrontare le distribuzioni di sopravvivenza utilizzando il test log-rank.
Sviluppo e validazione di modelli di machine learning
Dividere casualmente il dataset a livello di paziente in un set di addestramento (70%), un set di validazione (15%) e un set di test indipendente (15%). Effettuare la selezione delle caratteristiche utilizzando il set di addestramento solo identificando l'intersezione delle variabili selezionate dalla regressione LASSO e dall'algoritmo Boruta, assicurando che vengano mantenuti solo predittori stabili e rilevanti. Addestrare otto classificatori di apprendimento automatico sul set di addestramento, inclusi regressione logistica, foresta casuale, albero decisionale, macchina a vettori di supporto, XGBoost, LightGBM, Bayes naïve del complemento e classificatore a vettori di supporto. Le prestazioni del modello sono state valutate inizialmente nel set di validazione e successivamente confermate nel set di test indipendente utilizzando AUC-ROC, AUC-PR, accuratezza, sensibilità, specificità, curve di calibrazione, analisi della curva decisionale e curve di apprendimento.
Interpretazione del modello e endpoint
Identificare il modello di apprendimento automatico con le migliori prestazioni basandosi sulle metriche di validazione delle prestazioni. Applicare le SHapley Additives Explanations (SHAP) per quantificare il contributo di ciascuna caratteristica alla previsione della mortalità. Genera riepiloghi SHAP e grafici di dipendenza per visualizzare l'importanza relativa e la direzione dell'albumina sierica e di altri predittori. Completare l'analisi integrando risultati statistici e di apprendimento automatico per stabilire un quadro interpretabile di stratificazione del rischio.