$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Source des données et déclaration d’éthique
Cette étude rétrospective a utilisé les données du MIMIC-IV (version 3.1), une base de données publique des DSE en soins critiques désidentifiée hébergée sur PhysioNet. La base de données comprend des informations démographiques, des signes vitaux, des analyses de laboratoire, des diagnostics, des procédures et des médicaments.
L’accès à MIMIC-IV nécessite une autorisation accréditée et le respect de l’accord d’utilisation des données PhysioNet ainsi que des exigences de formation. Les enquêteurs ont suivi la formation requise et ont obtenu l’accès (numéro de certificat : 68351548). Comme la base de données est désidentifiée, cette étude a analysé des données anonymisées et n’a pas impliqué de contact direct avec les patients ; par conséquent, le consentement éclairé n’était pas requis. Le flux de travail complet de modélisation exécutable étape par étape est illustré à la Figure 1.

Figure 1. Flux de travail global de modélisation pour la prédiction du risque d’ostéoporose (OP) chez les patients diabétiques. Représentation schématique de la chaîne d’études, incluant l’identification des cohortes, l’extraction de données, l’ingénierie des caractéristiques, le benchmarking multi-modèles, la sélection de modèles basée sur la performance de validation, et l’interprétabilité du modèle final basée sur SHAP. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Étude de la population et extraction des données
Les données ont été extraites de la base de données Medical Information Mart for Intensive Care IV (MIMIC-IV) à l’aide d’un outil de gestion de base de données. Pour garantir la reproductibilité, les requêtes SQL exactes, y compris les noms des tables et la logique de filtrage utilisées pour la récupération des cohortes, sont fournies dans le Fichier Supplémentaire 1. Les patients adultes (≥18 ans) diagnostiqués avec un diabète sucré ont été identifiés à l’aide des codes CIM-9 (249, 250) et des codes CIM-10 (E08–E13). Le résultat principal, OP, a été défini à l’aide des codes CIM-9 (733.x) et des codes CIM-10 (M80, M81, M82). Au sein de la cohorte initiale éligible de diabétiques (n = 46 226), 3 672 événements positifs (patients avec OP) et 42 554 événements négatifs (patients sans OP) ont été identifiés. Un organigramme détaillé de sélection et d’attrition des patients est présenté à la Figure 2.

Figure 2. Organigramme de la sélection des patients et de la construction des cohortes. Le diagramme illustre la dérivation par étapes par cohorte à partir de la base de données MIMIC-IV (v3.1). Les patients adultes atteints de diabète sucré ont été identifiés à l’aide de codes CIM, suivis de l’exclusion des patients ayant atteint l’âge et la Lt ; 18 ans, données critiques manquantes gt ; 30 %, ou des dossiers invalides. La cohorte finale a été divisée en OP (événements positifs) et non-OP (événements négatifs). Le déséquilibre de classe a été corrigé par sous-échantillonnage aléatoire et SMOTE appliqué aux données d’entraînement avant la division stratifiée des ensembles de données. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Ingénierie des caractéristiques
Pour garantir un benchmarking équitable entre plusieurs algorithmes d’apprentissage automatique et une reproductibilité précise, une séquence identique d’étapes de prétraitement a été appliquée : sélection des caractéristiques, imputation des valeurs manquantes, mise à l’échelle continue des caractéristiques, équilibrage des classes et division des ensembles de données. La liste complète des caractéristiques d’entrée, incluant les noms des variables, les unités et les sources de données, est détaillée dans le Tableau 1.
| Caractéristiques | Total (n = 14 688) | Ensemble d’entraînement (n = 9 546) | Ensemble de validation (n = 2 204) | Ensemble d’essai (n = 2 938) | Valeur p |
| Genre | | | | | 0.345 |
| Homme | 6222 (42.36%) | 4045 (42.37%) | 935 (42.42%) | 1242 (42.27%) | |
| Féminin | 8466 (57.64%) | 5501 (57.63%) | 1269 (57.58%) | 1696 (57.73%) | |
| Âge | 0,28 (−0,40, 0,94) | 0,28 (−0,43, 0,94) | 0,23 (−0,46, 0,89) | 0,28 (−0,39, 0,95) | 0.1655 |
| Globules rouges | −0,14 (−0,79, 0,49) | −0,13 (−0,79, 0,49) | −0,17 (−0,83, 0,48) | −0,14 (−0,76, 0,49) | 0.3641 |
| Hématocrite | −0,14 (−0,81, 0,52) | −0,13 (−0,80, 0,52) | −0,14 (−0,87, 0,51) | −0,16 (−0,81, 0,52) | 0.3709 |
| Hémoglobine | −0,12 (−0,79, 0,52) | −0,12 (−0,79, 0,51) | −0,15 (−0,86, 0,53) | −0,13 (−0,78, 0,52) | 0.3616 |
| RDW | −0,16 (−0,59, 0,45) | −0,17 (−0,59, 0,46) | −0,14 (−0,59, 0,45) | −0,17 (−0,60, 0,42) | 0.5803 |
| Phosphate | −0,14 (−0,60, 0,38) | −0,15 (−0,61, 0,38) | −0,11 (−0,57, 0,38) | −0,13 (−0,56, 0,34) | 0.415 |
| MCV | 0,05 (−0,50, 0,63) | 0,06 (−0,50, 0,65) | 0,03 (−0,49, 0,65) | 0,02 (−0,50, 0,59) | 0.5408 |
| Magnésium | −0,10 (−0,52, 0,37) | −0,10 (−0,52, 0,37) | −0,10 (−0,52, 0,37) | −0,09 (−0,50, 0,37) | 0.7797 |
| Globules blancs | −0,16 (−0,47, 0,21) | −0,16 (−0,47, 0,20) | −0,15 (−0,48, 0,25) | −0,16 (−0,46, 0,20) | 0.6856 |
| Trou d’Anion | −0,12 (−0,64, 0,45) | −0,13 (−0,64, 0,45) | −0,07 (−0,61, 0,48) | −0,13 (−0,64, 0,45) | 0.1217 |
| Créatinine | −0,30 (−0,48, 0,01) | −0,30 (−0,48, 0,01) | −0,30 (−0,46, 0,01) | −0,30 (−0,48, −0,00) | 0.3323 |
| MCH | 0,11 (−0,48, 0,62) | 0,12 (−0,48, 0,62) | 0,11 (−0,47, 0,62) | 0,09 (−0,48, 0,61) | 0.5195 |
| Nombre de plaquettes | −0,09 (−0,61, 0,49) | −0,09 (−0,61, 0,49) | −0,08 (−0,62, 0,47) | −0,10 (−0,62, 0,48) | 0.9709 |
| MCHC | −0,00 (−0,59, 0,59) | −0,00 (−0,60, 0,59) | −0,00 (−0,57, 0,58) | 0,00 (−0,57, 0,60) | 0.9263 |
| Chlorure | 0,05 (−0,54, 0,64) | 0,05 (−0,52, 0,65) | 0,03 (−0,59, 0,62) | 0,07 (−0,52, 0,62) | 0.4675 |
| Potassium | −0,07 (−0,67, 0,53) | −0,09 (−0,67, 0,53) | −0,07 (−0,67, 0,53) | −0,07 (−0,62, 0,53) | 0.3071 |
| Sodium | 0,05 (−0,56, 0,60) | 0,05 (−0,55, 0,60) | −0,00 (−0,60, 0,60) | 0,07 (−0,57, 0,61) | 0.3492 |
| Azote urée | −0,28 (−0,60, 0,29) | −0,28 (−0,60, 0,29) | −0,26 (−0,59, 0,31) | −0,28 (−0,59, 0,25) | 0.6826 |
| Total Calcium | 0,02 (−0,61, 0,59) | 0,02 (−0,61, 0,59) | −0,01 (−0,59, 0,56) | 0,01 (−0,61, 0,60) | 0.8203 |
Tableau 1. Caractéristiques de base et caractéristiques modifiées de la cohorte d’étude. Les variables catégorielles sont présentées comme n ( %). Les variables continues sont présentées comme une médiane (intervalle interquartile) des valeurs standardisées. Les valeurs P ont été calculées pour comparer les distributions entre les ensembles d’entraînement, de validation et de test à l’aide de tests statistiques appropriés.
Les variables continues avec mesures répétées ont été agrégées en utilisant la moyenne arithmétique sur toute la fenêtre d’observation en réanimation pour obtenir un seul vecteur caractéristique par patient. Les variables dont le taux de disparition dépasse 30 % ont été exclues. Pour les variables numériques restantes, les valeurs manquantes ont été imputées à l’aide de l’algorithme K-Nearest Neighbors (KNN) (n_neighbors = 5, poids = « uniforme »). Les variables catégorielles étaient imputées à l’aide de la catégorie la plus fréquente puis transformées par application binaire, les catégories non vues étant attribuées à un vecteur de zéros.
Les variables continues ont été standardisées à l’aide de la formule d’échelle z-score (). Les caractéristiques présentant une variance nulle ont été explicitement supprimées avant l’échelle. Tous les paramètres de prétraitement (μ et σ.) ont été estimés strictement sur l’ensemble d’entraînement et appliqués de manière cohérente aux ensembles de validation et de test.
Compte tenu du déséquilibre sévère des classes (3 672 contre 42 554), une stratégie d’équilibrage hybride a été appliquée exclusivement aux données d’entraînement afin d’éviter d’augmenter les estimations de performance. Premièrement, un sous-échantillonnage aléatoire a été utilisé pour réduire la classe majoritairement négative afin d’obtenir un ratio de 1:2 (positif :négatif) (donnant 7 344 échantillons négatifs). Ensuite, la technique de suréchantillonnage des minorités synthétiques (SMOTE) a été appliquée à la classe positive afin d’obtenir un ratio équilibré final de 1:1 (7 344 contre 7 344)8.
Enfin, la cohorte a été divisée au niveau du patient en formations (65 %), validations (15 %) et tests (20 %) utilisant des échantillonnages stratifiés. Pour contrôler strictement tous les processus aléatoires à travers l’imputation, l’équilibrage et la scission, une graine aléatoire globale (random_state = 42) a été appliquée.
Architecture du modèle
Pour identifier le modèle prédictif le plus adapté au risque OP chez les patients diabétiques, un cadre de benchmarking à grande échelle a été utilisé pour comparer 70 variantes d’algorithmes ML sous un protocole identique de représentation et d’évaluation des données. Les familles de modèles candidates comprenaient des classificateurs linéaires régularisés, des machines à vecteurs de support (SVM), kNN, des ensembles d’arbres, des architectures d’amplification de gradient, et des perceptrons multicouches 9,10,11,12,13,14,15,16,17.
Plutôt que d’utiliser une recherche traditionnelle en grille, l’optimisation des hyperparamètres a été réalisée en évaluant des configurations prédéfinies et robustes à travers ces 70 variantes de modèles sur la répartition de l’entraînement. La sélection était strictement basée sur la maximisation de la surface sous la courbe de caractéristique de fonctionnement du récepteur (ROC) (AUC) sur l’ensemble de validation. Le modèle final le plus performant a été configuré avec n_estimators = 200, les autres paramètres restant aux paramètres par défaut du logiciel listés dans le tableau des matériaux. Les indicateurs d’évaluation, incluant l’AUC, la précision, le score F1, la précision et le rappel, ont été calculés en utilisant un seuil de probabilité par défaut de 0,5.
Pour soutenir la transparence clinique, SHAP a été appliqué au modèle sélectionné en utilisant la méthode TreeExplainer. Étant donné la nature basée sur un arbre du modèle final, des valeurs attendues exactes dépendantes du chemin de l’arbre étaient utilisées comme configuration de fond.