$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Accès à la base de données et environnement logiciel
Obtenir un accès autorisé à la base de données Medical Information Mart for Intensive Care IV (MIMIC-IV, v3.1) après avoir suivi la formation requise sur l’utilisation éthique des données (ID de certification : 69002811). Selon les Mesures pour l’examen éthique des sciences de la vie et de la recherche médicale impliquant des sujets humains (18 février 2023, Chine), l’article 32 stipule que la recherche utilisant des données publiques légalement obtenues, des données générées sans interférer avec le comportement public ou des informations anonymisées est exemptée d’examen éthique. Conformément à ces dispositions, cette étude était exemptée de toute approbation éthique institutionnelle. Le protocole d’utilisation des données et les directives éthiques ont été strictement respectés, et l’étude a été menée uniquement à des fins de recherche scientifique. Configurez l’environnement de base de données avec PostgreSQL (v17.1.11). Utilisez Navicat Premium (v17) comme interface de gestion de base de données et de requêtes pour exécuter des requêtes SQL et exporter les ensembles de données extraits pour analyse.
Sélection des patients
Identifier les patients atteints de cancer du poumon dans le MIMIC-IV en utilisant les codes17 de la Classification internationale des maladies, neuvième et dixième révision (CIM-9 et CIM-10). Appliquer les critères d’exclusion suivants de manière séquentielle : Âge <18 ans ou >90 ans ; Mesures d’albumine sérique manquantes dans les 24 premières heures suivant l’admission en réanimation ; Plusieurs admissions en réanimation ou à l’hôpital ; Durée du séjour en réanimation <24 h.
Extraction variable
Extraire les variables de MIMIC-IV (v3.1) via PostgreSQL (v17.1.11) via Navicat Premium (v17), y compris : démographie, signes vitaux, tests de laboratoire, comorbidités, interventions thérapeutiques, scores de gravité et résultats. Démographie : âge, sexe. Signes vitaux dans les 24 premières heures suivant l’admission en réanimation : fréquence cardiaque (FC), fréquence respiratoire (RR), saturation en oxygène (SpO₂) et température. Variables de laboratoire dans les 24 premières heures : albumine sérique, glucose, créatinine, azote urésique, bilirubine totale, hémoglobine, nombre de globules rouges (globules rouges), nombre de globules blancs (GB), nombre de plaquettes, largeur de distribution des globules rouges (RDW), alanine aminotransférase (ALT), aspartate aminotransférase (AST), temps de prothrombine (PT), calcium, potassium, sodium, chlorure. Comorbidités issues des dossiers diagnostiques : hypertension, cirrhose hépatique, maladie rénale chronique, diabète sucrée, bronchite chronique, insuffisance cardiaque congestive et maladie pulmonaire obstructive chronique (MPOC). Scores de sévérité à l’admission en réanimation : Évaluation séquentielle de l’insuffisance organique (SOFA), Score simplifié de physiologie aiguë II (SAPS II), Indice de comorbidité de Charlson, Évaluation de la physiologie aiguë et de la santé chronique II (APACHE II). Interventions thérapeutiques : corticostéroïdes systémiques, antibiotiques, vasopresseurs. Facteur mode de vie : antécédents de tabagisme. Pour toutes les variables de laboratoire et les scores de séversion dans les 24 premières heures, si plusieurs mesures sont disponibles, calculez la valeur moyenne sur le jour et utilisez cette valeur pour l’analyse. Excluez les variables avec plus de 20 % de données manquantes. Pour les variables manquantes ≤20 %, effectuez l’imputation à l’aide de l’algorithme missForest, une méthode d’apprentissage automatique basée sur la forêt aléatoire pour traiter des données cliniques mixtes. La proportion de données manquantes pour les variables clés est fournie dans le Tableau Supplémentaire 1.
Définition du résultat
Définir le critère principal comme la mortalité toutes causes confondues dans les 28 jours suivant l’admission en réanimation. Déterminer le statut de mortalité à l’aide des registres de décès disponibles dans la base de données MIMIC-IV. Classez les patients comme survivants ou non survivants en fonction du statut de mortalité à 28 jours.
Analyse statistique
Évaluer la distribution des variables continues à l’aide du test de Shapiro–Wilk. Comparez les variables normalement distribuées en utilisant le test t de Student et les variables anormalement distribuées en utilisant le test de somme des rangs de Wilcoxon. Comparez les variables catégorielles à l’aide du test du chi carré. Effectuer une régression de réduction absolue minimale et d’opérateur de sélection (LASSO) avec une validation croisée de 10 fois pour sélectionner les variables candidates et réduire la multicolinéarité. Construire des modèles multivariés de risques proportionnels de Cox pour évaluer l’association indépendante entre l’albumine sérique et la mortalité à 28 jours. L’albumine sérique a été saisie à la fois comme variable continue et catégorique, et les covariables sélectionnées par la régression LASSO ont été incluses pour ajustement. Des rapports de risque (HR) et des intervalles de confiance (IC) à 95 % ont été estimés. Explorez les associations non linéaires à l’aide de l’analyse à spline cubique restreinte (RCS). Les nœuds ont été placés à des percentiles prédéfinis de la distribution de l’albumine, et la non-linéarité a été évaluée en testant les termes spline. Générez des courbes de survie de Kaplan–Meier et comparez les distributions de survie à l’aide du test log-rank.
Développement et validation de modèles d’apprentissage automatique
Divisez aléatoirement le jeu de données au niveau du patient en un ensemble d’entraînement (70 %), un ensemble de validation (15 %) et un ensemble de tests indépendant (15 %). Effectuer la sélection des caractéristiques en utilisant l’ensemble d’entraînement uniquement en identifiant l’intersection des variables sélectionnées par la régression LASSO et l’algorithme Boruta, en veillant à conserver uniquement les prédicteurs stables et pertinents. Entraîner huit classificateurs d’apprentissage automatique sur l’ensemble d’entraînement, incluant la régression logistique, la forêt aléatoire, l’arbre de décision, la machine à vecteurs de support, XGBoost, LightGBM, le Bayes naïve de complément et le classificateur de vecteurs de support. La performance du modèle a d’abord été évaluée dans l’ensemble de validation puis confirmée dans l’ensemble de test indépendant à l’aide de l’AUC-ROC, AUC-PR, précision, sensibilité, spécificité, courbes d’étalonnage, analyse de la courbe de décision et courbes d’apprentissage.
Interprétation du modèle et point final
Identifier le modèle d’apprentissage automatique le mieux performant en fonction des métriques de performance de validation. Appliquer les explications additives SHapley (SHAP) pour quantifier la contribution de chaque caractéristique à la prédiction de la mortalité. Générez des résumés SHAP et des graphiques de dépendance pour visualiser l’importance relative et la directionnalité de l’albumine sérique et d’autres prédicteurs. Complétez l’analyse en intégrant les résultats statistiques et d’apprentissage automatique afin d’établir un cadre interprétable de stratification des risques.