Source des données
Cette étude était une analyse rétrospective basée sur la base de données Medical Information Mart for Intensive Care IV (MIMIC-IV, version 3.1), une base de données publique de soins intensifs hébergée sur PhysioNet (https://physionet.org/content/mimiciv/3.1/). La base de données a été développée grâce à une collaboration entre le Laboratoire de physiologie computationnelle du Massachusetts Institute of Technology, le Beth Israel Deaconess Medical Center et Philips, et contient des données cliniques complètes et dé-identifiées, incluant des informations démographiques, des signes vitaux, des mesures de laboratoire et des dossiers médicamenteux.
Toutes les données des patients dans MIMIC-IV sont entièrement désidentifiées conformément à la loi sur la portabilité et la responsabilité de l’assurance maladie (HIPAA), et cette étude n’a donc pas nécessité l’approbation du comité d’examen institutionnel (IRB). L’utilisation de la base de données est régie par un accord d’utilisation des données (DUA), et l’accès n’est accordé qu’aux utilisateurs autorisés ayant suivi la formation et la certification requises. Les auteurs ont suivi la formation nécessaire et obtenu les identifiants d’accès (utilisateur accrédité PhysioNet) et ont mené cette étude en conformité avec toutes les réglementations pertinentes sur l’utilisation des données.
Étude de la population et extraction des données
Les patients adultes (≥18 ans) ayant subi des interventions neurochirurgicales de la colonne vertébrale ont été identifiés à partir de la base de données MIMIC-IV à l’aide de codes CIM liés à la procédure. Les procédures neurochirurgicales de la colonne vertébrale étaient définies comme des codes CIM-9 commençant par 03 (opérations sur la moelle épinière et le canal spinal) et des codes CIM-10 commençant par 00B, 00H, 00J, 00N, 00P, 00Q, 00R, 00S, 00T ou 00U (procédures liées à la moelle épinière). Pour les patients ayant reçu plusieurs admissions hospitalières, seule la première admission contenant une procédure éligible a été conservée afin d’éviter des mesures répétées par la même personne.
La variable de résultat, l’ostéoporose, a été définie sur la base des codes CIM-9 commençant par 733 et des codes CIM-10 commençant par M80, M81 ou M82 enregistrés lors de l’admission à l’indice. Comme les prédicteurs et les résultats ont tous deux été dérivés de la même hospitalisation, la tâche analytique de cette étude a été présentée comme une classification en milieu hospitalier plutôt que comme une prédiction prospective du risque.
Au total, 10 803 patients ont rempli les critères d’inclusion. Après une découpe stratifiée, l’ensemble de données a été divisé en un ensemble d’entraînement (n = 7 561), un ensemble de validation (n = 1 621) et un ensemble de test (n = 1 621). La répartition des classes était très déséquilibrée sur toutes les partitions. Dans l’ensemble d’entraînement, 499 patients (6,60 %) étaient ostéoporose positifs et 7 062 (93,40 %) ostéoporose négative. Dans le groupe de validation, 107 patients (6,60 %) étaient positifs et 1 514 (93,40 %) négatifs. L’ensemble de tests a montré la même distribution, avec 107 cas positifs (6,60 %) et 1 514 cas négatifs (93,40 %).
Les données cliniques ont été extraites à l’aide d’un logiciel de gestion de bases de données relationnelles issu de MIMIC-IV. Les variables extraites comprenaient les caractéristiques démographiques (par exemple, âge et sexe), les mesures de laboratoire, les signes vitaux et les dossiers médicamenteux. Pour chaque patient, les données de l’admission indice ont été utilisées pour la construction ultérieure des caractéristiques.
Pour garantir une évaluation valide du modèle, l’ensemble de données a d’abord été divisé en ensembles d’entraînement, de validation et de test à l’aide d’échantillonnages stratifiés (70 %, 15 % et 15 %). Toutes les étapes de prétraitement ultérieures pouvant introduire des biais, y compris la sélection de caractéristiques et le rééchantillonnage, ont été réalisées exclusivement dans l’ensemble d’entraînement. Le déséquilibre de classes dans l’ensemble d’entraînement a été corrigé en combinant un sous-échantillonnage de la classe majoritaire et la technique de suréchantillonnage des minorités synthétiques (SMOTE), tandis que les ensembles de validation et de test ont conservé la distribution de classes originale pour refléter la prévalence réelle.
Ingénierie des caractéristiques
Un pipeline d’ingénierie des fonctionnalités à plusieurs étapes a été mis en œuvre pour améliorer les performances du modèle tout en maintenant l’interprétabilité. Pour chaque patient, les dossiers médicamenteux, de laboratoire et des signes vitaux issus de l’admission indice ont été agrégés en caractéristiques de niveau résumé (par exemple, les valeurs moyennes pour les mesures répétées et l’exposition moyenne pour les médicaments).
Pour réduire la rareté des caractéristiques, les groupes candidats de caractéristiques ayant plus de 30 % de valeurs manquantes ont été exclus. Pour éviter la fuite de données, cette étape de filtrage était réalisée exclusivement en utilisant l’ensemble d’entraînement, et le même ensemble de fonctionnalités était ensuite appliqué aux ensembles de validation et de test.
Par la suite, un dépistage univarié des caractéristiques a été réalisé au niveau du groupe de caractéristiques à l’aide du test U de Mann–Whitney pour comparer les distributions entre les patients ostéoporose positifs et ostéoporose négatifs. Les groupes de caractéristiques ont été classés selon la signification statistique, et les k groupes du top k (k = 20) ont été conservés pour la modélisation en aval. Cette procédure de sélection était également réalisée exclusivement dans le cadre de l’ensemble d’entraînement afin d’éviter la fuite d’informations.
Étant donné le degré relativement élevé de manque entre les groupes de caractéristiques candidats, le rôle principal de cette étape de sélection top-k était de filtrer les caractéristiques avec des signaux statistiques faibles plutôt que d’optimiser strictement la dimensionnalité des caractéristiques. En pratique, la performance du modèle n’était pas très sensible à la valeur exacte de k dans une plage raisonnable, ce qui suggère que cette étape servait principalement de procédure de dépistage axée sur la robustesse pour exclure des caractéristiques peu informatives tout en préservant les signaux cliniquement pertinents.
Les caractéristiques démographiques de base ont été conservées sur tous les modèles. Les valeurs manquantes dans ces variables démographiques ont été imputées à l’aide de la valeur moyenne calculée à partir de l’ensemble d’entraînement. L’imputation moyenne a été choisie pour sa simplicité et sa stabilité dans ce vaste ensemble de données, bien qu’elle puisse réduire la variance et introduire des biais ; Cette limitation est reconnue.
Pour certaines caractéristiques de médicaments, de laboratoire et signes vitaux, l’absence de mesure ou d’exposition enregistrée a été codée comme zéro afin de permettre une entrée numérique cohérente pour l’entraînement du modèle. Nous reconnaissons que cette approche peut confondre les valeurs de zéro véritable avec l’absence ou la non-exposition, en particulier pour les variables où zéro n’a pas de signification physiologique. Cependant, cette stratégie d’encodage a été appliquée de manière cohérente sur tous les échantillons et suivie par la standardisation Z-score, qui atténue la distorsion liée à l’échelle. L’impact potentiel de cette hypothèse est abordé comme une limitation.
Toutes les caractéristiques numériques ont été standardisées par normalisation Z-score basée sur la moyenne et l’écart-type estimés à partir de l’ensemble d’entraînement :
z = (x — μ)/σ
Où x représente la valeur brute des caractéristiques, et μ et σ désignent la moyenne et l’écart-type calculés à partir de l’ensemble d’entraînement. Les variables catégorielles étaient codées numériquement pour répondre aux exigences d’entrée des modèles d’apprentissage profond.
Cette stratégie d’ingénierie des caractéristiques a permis une réduction systématique de la dimensionnalité tout en préservant les domaines cliniquement pertinents, notamment la démographie, la fonction rénale, les indices hématologiques, les marqueurs inflammatoires et les paramètres métaboliques. Les caractéristiques de référence détaillées de la population étudiée à travers les ensembles d’entraînement, de validation et de test sont présentées dans le Tableau 1.
| Caractéristiques | Total | Ensemble d’entraînement | Ensemble de validation | Ensemble d’essai | Valeur p |
| (n=5238) | (n=1996) | (n=1621) | (n=1621) |
| Genre | | <0,001 |
| Homme | 2477 (47.29%) | 834 (41.78%) | 797 (49.17%) | 846 (52.19%) | |
| Féminin | 2761 (52.71%) | 1162 (58.22%) | 824 (50.83%) | 775 (47.81%) | |
| Âge | 60.69 (48.29, 70.61) | 63.45 (52.00, 72.41) | 58.00 (46.00, 69.00) | 60.00 (46.00, 70.00) | <0,001 |
| Hauteur | 165.23 (160.79, 171.21) | 164.25(161.41, 172.23) | 166.32 (161.85, 171.22) | 165.22 (161.31, 169.89) | <0,001 |
| Poids | 72.01 (56.77, 82.46) | 75.45 (63.22, 81.45) | 70.55 (60.22, 79.33) | 73.62 (65.22, 81.88) | <0,001 |
| Senna | 1.00 (-0.73, 8.60) | 1.00 (-0.30, 8.60) | 1.00 (-1.00, 8.60) | 1.00 (-1.00, 8.60) | <0,001 |
| Docusate Sodium | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 0.001 |
| Héparine | 5000.00 (1655.28, 5000.00) | 5000.00 (-1.00, 5000.00) | 5000.00 (1600.00, 5000.00) | 5000.00 (3750.00, 5000.00) | 0.292 |
| Rinçage au chlorure de sodium 0,9 % | 3.00 (1.76, 3.00) | 3.00 (3.00, 3.00) | 3.00 (-1.00, 3.00) | 3.00 (3.00, 3.00) | <0,001 |
| Globules rouges | 3.96 (3.51, 4.35) | 3.90 (3.49, 4.28) | 4.02 (3.53, 4.40) | 3.97 (3.50, 4.38) | <0,001 |
| Hémoglobine | 11.81 (10.51, 13.02) | 11.66 (10.47, 12.82) | 11.91 (10.58, 13.14) | 11.90 (10.49, 13.15) | <0,001 |
| RDW | 13.98 (13.22, 15.15) | 14.12 (13.35, 15.24) | 13.90 (13.10, 15.06) | 13.90 (13.18, 15.13) | <0,001 |
| Hématocrite | 35.67 (31.95, 39.00) | 35.32 (31.63, 38.50) | 36.00 (32.28, 39.37) | 35.77 (32.01, 39.25) | <0,001 |
| Densité spécifique | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | <0,001 |
| Bicarbonate | 25.72 (24.04, 27.15) | 25.86 (24.17, 27.27) | 25.65 (23.92, 27.03) | 25.62 (24.00, 27.12) | <0,001 |
| Neutrophiles | 68.67 (60.52, 76.23) | 69.41 (61.90, 76.52) | 68.10 (59.60, 75.88) | 68.34 (59.75, 76.23) | <0,001 |
| Créatinine | 0.82 (0.68, 1.02) | 0.81 (0.68, 1.00) | 0.83 (0.69, 1.02) | 0.83 (0.68, 1.03) | <0,001 |
| Phosphate | 3.29 (2.92, 3.64) | 3.27 (2.93, 3.57) | 3.30 (2.93, 3.69) | 3.30 (2.90, 3.65) | 0.002 |
| Azote urée | 15.43 (12.08, 20.18) | 15.74 (12.50, 20.20) | 15.00 (11.64, 19.89) | 15.48 (12.00, 20.43) | <0,001 |
| Lymphocytes | 19.12 (12.22, 26.15) | 18.81 (12.49, 25.30) | 19.36 (12.40, 27.07) | 19.24 (11.72, 26.27) | 0.001 |
| Aminotransférase d’alanine (ALT) | 20.49 (10.84, 32.82) | 20.47 (11.67, 32.06) | 20.00 (10.00, 32.93) | 21.00 (10.67, 33.67) | 0.3283 |
| MCV | 90.90 (87.50, 94.32) | 91.03 (87.64, 94.51) | 90.64 (87.43, 94.00) | 91.00 (87.40, 94.40) | <0,001 |
| MCHC | 33.14 (32.37, 33.92) | 33.11 (32.37, 33.88) | 33.16 (32.38, 33.97) | 33.16 (32.35, 33.93) | <0,001 |
| Basophiles | 0.42 (0.27, 0.61) | 0.41 (0.27, 0.59) | 0.45 (0.29, 0.63) | 0.41 (0.26, 0.60) | 0.037 |
Tableau 1. Les caractéristiques de base de la population étudiée sont stratifiées par ensembles d’entraînement, de validation et de test.
Architecture du modèle
Pour modéliser des relations complexes entre des caractéristiques cliniques tabulaires hétérogènes, nous avons utilisé une architecture basée sur TabTransformer implémentée à l’aide du frameworkPyTorch 6. Le modèle a été conçu pour traiter à la fois les variables catégorielles et numériques et pour capturer les interactions contextuelles entre les caractéristiques via un mécanisme d’auto-attention.
Représentation en entrée
Les variables catégorielles ont d’abord été transformées en plongements denses. Chaque caractéristique catégorielle était mappée à un vecteur d’immersion de dimension d(embedding_dim = 256). Les caractéristiques numériques ont été standardisées grâce à la normalisation Z-score puis projetées dans le même espace d’intégration via une couche de transformation linéaire, permettant un traitement conjoint avec des caractéristiques catégorielles.
Les vecteurs de caractéristiques intégrés ont été concaténés pour former une séquence de jetons :
X = [x 1,x 2,... xn]
où chaque xi ∈ Rd représente une caractéristique intégrée.
Encodeur transformateur
Les embeddings de caractéristiques concaténés étaient passés à travers une pile de couches d’encodeurs Transformer (num_layers = 3). Chaque couche consistait en une auto-attention multi-têtes suivie d’un réseau d’avance par position.
Le mécanisme d’auto-attention multi-têtes est défini comme suit :
—> Attention(Q,K,V) = soft max
V
Où Q, K et V désignent les matrices de requête, de clé et de valeurs. Des têtes d’attention multiples (num_heads = 8) ont été utilisées pour capturer diverses interactions de caractéristiques.
Chaque bloc transformateur comprenait l’auto-attention multi-tête, la connexion résiduelle et la normalisation des couches, un réseau à avance, un coupure (taux = 0,243).
Agrégation et classification des caractéristiques
La sortie de la couche finale du Transformer était aplatie et passée à travers un perceptron multicouche (MLP) pour la classification. La MLP se composait d’une ou plusieurs couches entièrement connectées avec des fonctions d’activation non linéaires.
La couche finale de sortie utilisait une fonction d’activation sigmoïde pour produire la probabilité prédite d’ostéoporose :
—>
= σ(z)
Où z est la sortie logit.
Fonction de perte et stratégie d’entraînement
Le modèle a été entraîné en utilisant la perte d’entropie binaire :
—> L = −(1/N) Σ [ yi log(ŷi) + (1 − yi) log(1 − ŷi) ]
Où yi désigne l’étiquette vraie et
i la probabilité prédite.
Le modèle a été optimisé à l’aide de l’optimiseur Adam (taux d’apprentissage = 1,9e-4, taille du lot = 64) pour 100 époques. Un arrêt précoce a été appliqué en fonction de la performance de validation (patience = 15) pour éviter le sur-ajustement. Pour soutenir la reproductibilité, toutes les procédures expérimentales ont été réalisées à l’aide d’une graine aléatoire constante (graine = 42).
Interprétabilité du modèle
Pour améliorer l’interprétabilité, des explications additives SHAPapley (SHAP) ont été appliquées au modèle entraîné. Les valeurs SHAP ont été calculées sur l’ensemble de test pour quantifier la contribution de chaque caractéristique au résultat prédit, permettant à la fois une interprétation globale et individuelle du comportement du modèle.
Comme illustré à la Figure 1, le flux de travail résume le processus depuis le prétraitement des données MIMIC-IV jusqu’à la construction et la classification du modèle. L’architecture TabTransformer capture les interactions entre des caractéristiques tabulaires hétérogènes grâce à l’auto-attention, tandis que la visualisation basée sur SHAP fournit des informations interprétables sur les contributions des caractéristiques. Ce cadre permet une analyse validée en interne des schémas liés à l’ostéoporose dans une cohorte hétérogène de neurochirurgie spinale.

Figure 1. Étudiez le flux de travail et l’architecture des modèles. Cette figure illustre la conception globale de l’étude, incluant la sélection des cohortes, le prétraitement des données, l’ingénierie des fonctionnalités, la division des ensembles de données et le développement de modèles. Il résume également l’architecture TabTransformer utilisée pour la classification, incluant l’intégration de caractéristiques, les couches d’encodeur Transformer et la sortie finale de classification. Seule la première admission éligible par patient était incluse. Veuillez cliquer ici pour voir une version agrandie de cette figurine.