Article de recherche

Classification hospitalière basée sur TabTransformer de l’ostéoporose chez les adultes subissant des procédures neurochirurgicales spinales

265 vues

DOI :

10.3791/71119

14 avril 2026

* These authors contributed equally

Dans cet article

Résumé

Nous avons développé et évalué en interne un modèle TabTransformer basé sur l’attention pour la classification hospitalière de l’ostéoporose chez les adultes subissant des neurochirurgies spinales, en utilisant des données cliniques de Medical Information Mart pour les soins intensifs IV collectées de manière routinière.

Résumé

L’objectif était de développer et d’évaluer en interne un modèle d’apprentissage profond pour la classification hospitalière de l’ostéoporose chez les adultes subissant des neurochirurgies spinales, en utilisant des données cliniques tabulaires collectées de manière routinière. Cette étude rétrospective a utilisé la base de données Medical Information Mart for Intensive Care IV (MIMIC-IV) pour identifier les patients adultes ayant subi des interventions neurochirurgicales de la colonne vertébrale. L’ostéoporose était définie par les codes de diagnostic CIM-9/10 enregistrés lors de l’admission indice. Les caractéristiques démographiques, les dossiers médicamenteux, les mesures de laboratoire et les signes vitaux issus d’une même hospitalisation ont été utilisés pour le développement du modèle. Après la division stratifiée en ensembles d’entraînement, de validation et de test, le déséquilibre de classe n’a été traité que dans l’ensemble d’entraînement. Un modèle basé sur TabTransformer a été développé et comparé avec XGBoost, LSTM_Attention et Temporal Convolutional Networks (TCN). L’interprétabilité du modèle a été évaluée à l’aide des explications additives SHAPapley (SHAP). Sur l’ensemble de test étendu, TabTransformer a obtenu les meilleures performances globales, avec une zone sous la courbe caractéristique de fonctionnement du récepteur (AUC) de 0,953 et une précision moyenne (AP) de 0,799. Les valeurs correspondantes pour TCN, XGBoost et LSTM_Attention étaient respectivement 0,937/0,707, 0,857/0,303 et 0,755/0,179. L’analyse SHAP a identifié l’âge, le sexe, la créatinine, la largeur de distribution des globules rouges, le bicarbonate, le phosphate, les neutrophiles et plusieurs variables liées aux médicaments comme contributeurs influents à la production du modèle. Dans cette cohorte rétrospective à centre unique, le modèle TabTransformer a montré une forte performance discriminative pour la classification hospitalière de l’ostéoporose et a fourni des associations interprétables au niveau des caractéristiques via SHAP. Parce que les prédicteurs et les résultats ont été définis au sein du même hospitalisation, ce cadre doit être interprété comme un modèle de classification exploratoire validé en interne plutôt que comme un outil de prédiction du risque futur explicite et temporellement.

Introduction

L’ostéoporose (OP) est une affection squelettique répandue caractérisée par une diminution de la densité minérale osseuse et une dégradation structurelle du tissu osseuse, entraînant une fragilité osseuse accrue et un risque accru defractures 1. Elle continue de poser un problème important pour la santé publique, en particulier chez les personnes âgées et les femmespostménopausées 2. Chez les patients hospitalisés subissant des neurochirurgies de la colonne vertébrale, la santé osseuse peut être influencée par une mobilité réduite, des réponses au stress systémique, une exposition aux médicaments et des troubles de l’homéostasie métabolique lors de l’admission à l’indice. Les preuves antérieures issues de troubles neurologiques et de lésions de la moelle épinière suggèrent que l’immobilisation et les maladies systémiques peuvent contribuer à une perte osseuseaccélérée 3,4, bien que les signaux liés à l’ostéoporose dans ce contexte clinique spécifique restent insuffisamment caractérisés.

Les données électroniques de dossiers médicaux collectées régulièrement offrent l’opportunité d’examiner les schémas liés à l’ostéoporose dans cette population en utilisant des variables déjà disponibles lors des soins réguliers, telles que les caractéristiques démographiques, les dossiers médicamenteux, les analyses de laboratoire et les signes vitaux. Certaines variables liées aux soins (par exemple, les schémas d’utilisation des médicaments) peuvent également agir comme des substituts indirects de l’état fonctionnel ou de la mobilité. Cependant, relativement peu d’études se sont concentrées sur des adultes subissant des interventions neurochirurgicales de la colonne vertébrale utilisant des données cliniques structurées et tabulaires. De plus, la base de données Medical Information Mart for Intensive Care IV (MIMIC-IV) représente une grande cohorte rétrospective de soins intensifs provenant d’un seul centre tertiaire plutôt qu’une population multicentrique largement représentative. Par conséquent, les analyses basées sur cette ressource doivent être interprétées dans le cadre de la validation interne et de la modélisation clinique exploratoire. Des études récentes d’apprentissage automatique ont amélioré la modélisation des risques liés à l’ostéoporose en intégrant des biomarqueurs avec des variables cliniques, mais ces travaux ont été principalement menés dans des populations nonneurochirurgicales 5.

Les méthodes d’apprentissage automatique sont de plus en plus utilisées pour analyser des données cliniques tabulaires de haute dimension, en particulier lorsque des interactions complexes et non linéaires peuvent exister entre variables hétérogènes. Parmi ces approches, l’architecture TabTransformer convient bien aux entrées tabulaires mixtes car elle peut modéliser les relations contextuelles entre les caractéristiques par l’auto-attention tout en préservant la flexibilité pour les variables catégorielles etnumériques 6. Lorsqu’ils sont combinés avec les explications additives SHapley (SHAP), ces modèles peuvent également fournir une description interprétable des contributions des caractéristiques, permettant une évaluation exploratoire de la manière dont les variables démographiques, de laboratoire, physiologiques et liées aux médicaments sont associées à la production du modèle.

En conséquence, dans cette étude, nous avons utilisé les données MIMIC-IV pour développer et évaluer en interne un modèle TabTransformer basé sur l’attention pour l’identification hospitalière de l’ostéoporose chez des adultes ayant subi des interventions neurochirurgicales de la colonne vertébrale lors de l’admission indice. En utilisant des variables démographiques ainsi que des caractéristiques agrégées de médicaments, de laboratoire et de signes vitaux au niveau d’admission, nous avons comparé le modèle TabTransformer avec plusieurs modèles de référence et examiné les caractéristiques les plus influentes par une interprétation basée sur SHAP. Parce que les prédicteurs et les résultats ont été définis au sein d’une même hospitalisation, cette analyse représente un cadre de classification hospitalière concurrente plutôt qu’un modèle de prédiction du risque futur explicite et temporellement. Ce travail est donc destiné à être une analyse exploratoire validée en interne dans une cohorte rétrospective de soins intensifs à centre unique.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Source des données
Cette étude était une analyse rétrospective basée sur la base de données Medical Information Mart for Intensive Care IV (MIMIC-IV, version 3.1), une base de données publique de soins intensifs hébergée sur PhysioNet (https://physionet.org/content/mimiciv/3.1/). La base de données a été développée grâce à une collaboration entre le Laboratoire de physiologie computationnelle du Massachusetts Institute of Technology, le Beth Israel Deaconess Medical Center et Philips, et contient des données cliniques complètes et dé-identifiées, incluant des informations démographiques, des signes vitaux, des mesures de laboratoire et des dossiers médicamenteux.

Toutes les données des patients dans MIMIC-IV sont entièrement désidentifiées conformément à la loi sur la portabilité et la responsabilité de l’assurance maladie (HIPAA), et cette étude n’a donc pas nécessité l’approbation du comité d’examen institutionnel (IRB). L’utilisation de la base de données est régie par un accord d’utilisation des données (DUA), et l’accès n’est accordé qu’aux utilisateurs autorisés ayant suivi la formation et la certification requises. Les auteurs ont suivi la formation nécessaire et obtenu les identifiants d’accès (utilisateur accrédité PhysioNet) et ont mené cette étude en conformité avec toutes les réglementations pertinentes sur l’utilisation des données.

Étude de la population et extraction des données
Les patients adultes (≥18 ans) ayant subi des interventions neurochirurgicales de la colonne vertébrale ont été identifiés à partir de la base de données MIMIC-IV à l’aide de codes CIM liés à la procédure. Les procédures neurochirurgicales de la colonne vertébrale étaient définies comme des codes CIM-9 commençant par 03 (opérations sur la moelle épinière et le canal spinal) et des codes CIM-10 commençant par 00B, 00H, 00J, 00N, 00P, 00Q, 00R, 00S, 00T ou 00U (procédures liées à la moelle épinière). Pour les patients ayant reçu plusieurs admissions hospitalières, seule la première admission contenant une procédure éligible a été conservée afin d’éviter des mesures répétées par la même personne.

La variable de résultat, l’ostéoporose, a été définie sur la base des codes CIM-9 commençant par 733 et des codes CIM-10 commençant par M80, M81 ou M82 enregistrés lors de l’admission à l’indice. Comme les prédicteurs et les résultats ont tous deux été dérivés de la même hospitalisation, la tâche analytique de cette étude a été présentée comme une classification en milieu hospitalier plutôt que comme une prédiction prospective du risque.

Au total, 10 803 patients ont rempli les critères d’inclusion. Après une découpe stratifiée, l’ensemble de données a été divisé en un ensemble d’entraînement (n = 7 561), un ensemble de validation (n = 1 621) et un ensemble de test (n = 1 621). La répartition des classes était très déséquilibrée sur toutes les partitions. Dans l’ensemble d’entraînement, 499 patients (6,60 %) étaient ostéoporose positifs et 7 062 (93,40 %) ostéoporose négative. Dans le groupe de validation, 107 patients (6,60 %) étaient positifs et 1 514 (93,40 %) négatifs. L’ensemble de tests a montré la même distribution, avec 107 cas positifs (6,60 %) et 1 514 cas négatifs (93,40 %).

Les données cliniques ont été extraites à l’aide d’un logiciel de gestion de bases de données relationnelles issu de MIMIC-IV. Les variables extraites comprenaient les caractéristiques démographiques (par exemple, âge et sexe), les mesures de laboratoire, les signes vitaux et les dossiers médicamenteux. Pour chaque patient, les données de l’admission indice ont été utilisées pour la construction ultérieure des caractéristiques.

Pour garantir une évaluation valide du modèle, l’ensemble de données a d’abord été divisé en ensembles d’entraînement, de validation et de test à l’aide d’échantillonnages stratifiés (70 %, 15 % et 15 %). Toutes les étapes de prétraitement ultérieures pouvant introduire des biais, y compris la sélection de caractéristiques et le rééchantillonnage, ont été réalisées exclusivement dans l’ensemble d’entraînement. Le déséquilibre de classes dans l’ensemble d’entraînement a été corrigé en combinant un sous-échantillonnage de la classe majoritaire et la technique de suréchantillonnage des minorités synthétiques (SMOTE), tandis que les ensembles de validation et de test ont conservé la distribution de classes originale pour refléter la prévalence réelle.

Ingénierie des caractéristiques
Un pipeline d’ingénierie des fonctionnalités à plusieurs étapes a été mis en œuvre pour améliorer les performances du modèle tout en maintenant l’interprétabilité. Pour chaque patient, les dossiers médicamenteux, de laboratoire et des signes vitaux issus de l’admission indice ont été agrégés en caractéristiques de niveau résumé (par exemple, les valeurs moyennes pour les mesures répétées et l’exposition moyenne pour les médicaments).

Pour réduire la rareté des caractéristiques, les groupes candidats de caractéristiques ayant plus de 30 % de valeurs manquantes ont été exclus. Pour éviter la fuite de données, cette étape de filtrage était réalisée exclusivement en utilisant l’ensemble d’entraînement, et le même ensemble de fonctionnalités était ensuite appliqué aux ensembles de validation et de test.

Par la suite, un dépistage univarié des caractéristiques a été réalisé au niveau du groupe de caractéristiques à l’aide du test U de Mann–Whitney pour comparer les distributions entre les patients ostéoporose positifs et ostéoporose négatifs. Les groupes de caractéristiques ont été classés selon la signification statistique, et les k groupes du top k (k = 20) ont été conservés pour la modélisation en aval. Cette procédure de sélection était également réalisée exclusivement dans le cadre de l’ensemble d’entraînement afin d’éviter la fuite d’informations.

Étant donné le degré relativement élevé de manque entre les groupes de caractéristiques candidats, le rôle principal de cette étape de sélection top-k était de filtrer les caractéristiques avec des signaux statistiques faibles plutôt que d’optimiser strictement la dimensionnalité des caractéristiques. En pratique, la performance du modèle n’était pas très sensible à la valeur exacte de k dans une plage raisonnable, ce qui suggère que cette étape servait principalement de procédure de dépistage axée sur la robustesse pour exclure des caractéristiques peu informatives tout en préservant les signaux cliniquement pertinents.

Les caractéristiques démographiques de base ont été conservées sur tous les modèles. Les valeurs manquantes dans ces variables démographiques ont été imputées à l’aide de la valeur moyenne calculée à partir de l’ensemble d’entraînement. L’imputation moyenne a été choisie pour sa simplicité et sa stabilité dans ce vaste ensemble de données, bien qu’elle puisse réduire la variance et introduire des biais ; Cette limitation est reconnue.

Pour certaines caractéristiques de médicaments, de laboratoire et signes vitaux, l’absence de mesure ou d’exposition enregistrée a été codée comme zéro afin de permettre une entrée numérique cohérente pour l’entraînement du modèle. Nous reconnaissons que cette approche peut confondre les valeurs de zéro véritable avec l’absence ou la non-exposition, en particulier pour les variables où zéro n’a pas de signification physiologique. Cependant, cette stratégie d’encodage a été appliquée de manière cohérente sur tous les échantillons et suivie par la standardisation Z-score, qui atténue la distorsion liée à l’échelle. L’impact potentiel de cette hypothèse est abordé comme une limitation.

Toutes les caractéristiques numériques ont été standardisées par normalisation Z-score basée sur la moyenne et l’écart-type estimés à partir de l’ensemble d’entraînement :

z = (x — μ)/σ

Où x représente la valeur brute des caractéristiques, et μ et σ désignent la moyenne et l’écart-type calculés à partir de l’ensemble d’entraînement. Les variables catégorielles étaient codées numériquement pour répondre aux exigences d’entrée des modèles d’apprentissage profond.

Cette stratégie d’ingénierie des caractéristiques a permis une réduction systématique de la dimensionnalité tout en préservant les domaines cliniquement pertinents, notamment la démographie, la fonction rénale, les indices hématologiques, les marqueurs inflammatoires et les paramètres métaboliques. Les caractéristiques de référence détaillées de la population étudiée à travers les ensembles d’entraînement, de validation et de test sont présentées dans le Tableau 1.

CaractéristiquesTotalEnsemble d’entraînementEnsemble de validationEnsemble d’essaiValeur p
(n=5238)(n=1996)(n=1621)(n=1621)
Genre<0,001
Homme2477 (47.29%)834 (41.78%)797 (49.17%)846 (52.19%)
Féminin2761 (52.71%)1162 (58.22%)824 (50.83%)775 (47.81%)
Âge60.69 (48.29, 70.61)63.45 (52.00, 72.41)58.00 (46.00, 69.00)60.00 (46.00, 70.00)<0,001
Hauteur165.23 (160.79, 171.21)164.25(161.41, 172.23)166.32 (161.85, 171.22)165.22 (161.31, 169.89)<0,001
Poids72.01 (56.77, 82.46)75.45 (63.22, 81.45)70.55 (60.22, 79.33)73.62 (65.22, 81.88)<0,001
Senna1.00 (-0.73, 8.60)1.00 (-0.30, 8.60)1.00 (-1.00, 8.60)1.00 (-1.00, 8.60)<0,001
Docusate Sodium100.00 (100.00, 100.00)100.00 (100.00, 100.00)100.00 (100.00, 100.00)100.00 (100.00, 100.00)0.001
Héparine5000.00 (1655.28, 5000.00)5000.00 (-1.00, 5000.00)5000.00 (1600.00, 5000.00)5000.00 (3750.00, 5000.00)0.292
Rinçage au chlorure de sodium 0,9 %3.00 (1.76, 3.00)3.00 (3.00, 3.00)3.00 (-1.00, 3.00)3.00 (3.00, 3.00)<0,001
Globules rouges3.96 (3.51, 4.35)3.90 (3.49, 4.28)4.02 (3.53, 4.40)3.97 (3.50, 4.38)<0,001
Hémoglobine11.81 (10.51, 13.02)11.66 (10.47, 12.82)11.91 (10.58, 13.14)11.90 (10.49, 13.15)<0,001
RDW13.98 (13.22, 15.15)14.12 (13.35, 15.24)13.90 (13.10, 15.06)13.90 (13.18, 15.13)<0,001
Hématocrite35.67 (31.95, 39.00)35.32 (31.63, 38.50)36.00 (32.28, 39.37)35.77 (32.01, 39.25)<0,001
Densité spécifique1.01 (1.01, 1.02)1.01 (1.01, 1.02)1.01 (1.01, 1.02)1.01 (1.01, 1.02)<0,001
Bicarbonate25.72 (24.04, 27.15)25.86 (24.17, 27.27)25.65 (23.92, 27.03)25.62 (24.00, 27.12)<0,001
Neutrophiles68.67 (60.52, 76.23)69.41 (61.90, 76.52)68.10 (59.60, 75.88)68.34 (59.75, 76.23)<0,001
Créatinine0.82 (0.68, 1.02)0.81 (0.68, 1.00)0.83 (0.69, 1.02)0.83 (0.68, 1.03)<0,001
Phosphate3.29 (2.92, 3.64)3.27 (2.93, 3.57)3.30 (2.93, 3.69)3.30 (2.90, 3.65)0.002
Azote urée15.43 (12.08, 20.18)15.74 (12.50, 20.20)15.00 (11.64, 19.89)15.48 (12.00, 20.43)<0,001
Lymphocytes19.12 (12.22, 26.15)18.81 (12.49, 25.30)19.36 (12.40, 27.07)19.24 (11.72, 26.27)0.001
Aminotransférase d’alanine (ALT)20.49 (10.84, 32.82)20.47 (11.67, 32.06)20.00 (10.00, 32.93)21.00 (10.67, 33.67)0.3283
MCV90.90 (87.50, 94.32)91.03 (87.64, 94.51)90.64 (87.43, 94.00)91.00 (87.40, 94.40)<0,001
MCHC33.14 (32.37, 33.92)33.11 (32.37, 33.88)33.16 (32.38, 33.97)33.16 (32.35, 33.93)<0,001
Basophiles0.42 (0.27, 0.61)0.41 (0.27, 0.59)0.45 (0.29, 0.63)0.41 (0.26, 0.60)0.037

Tableau 1. Les caractéristiques de base de la population étudiée sont stratifiées par ensembles d’entraînement, de validation et de test.

Architecture du modèle
Pour modéliser des relations complexes entre des caractéristiques cliniques tabulaires hétérogènes, nous avons utilisé une architecture basée sur TabTransformer implémentée à l’aide du frameworkPyTorch 6. Le modèle a été conçu pour traiter à la fois les variables catégorielles et numériques et pour capturer les interactions contextuelles entre les caractéristiques via un mécanisme d’auto-attention.

Représentation en entrée
Les variables catégorielles ont d’abord été transformées en plongements denses. Chaque caractéristique catégorielle était mappée à un vecteur d’immersion de dimension d(embedding_dim = 256). Les caractéristiques numériques ont été standardisées grâce à la normalisation Z-score puis projetées dans le même espace d’intégration via une couche de transformation linéaire, permettant un traitement conjoint avec des caractéristiques catégorielles.

Les vecteurs de caractéristiques intégrés ont été concaténés pour former une séquence de jetons :

X = [x 1,x 2,... xn]

où chaque xi ∈ Rd représente une caractéristique intégrée.

Encodeur transformateur
Les embeddings de caractéristiques concaténés étaient passés à travers une pile de couches d’encodeurs Transformer (num_layers = 3). Chaque couche consistait en une auto-attention multi-têtes suivie d’un réseau d’avance par position.

Le mécanisme d’auto-attention multi-têtes est défini comme suit :

—> Attention(Q,K,V) = soft max figure-protocol-1V

Où Q, K et V désignent les matrices de requête, de clé et de valeurs. Des têtes d’attention multiples (num_heads = 8) ont été utilisées pour capturer diverses interactions de caractéristiques.

Chaque bloc transformateur comprenait l’auto-attention multi-tête, la connexion résiduelle et la normalisation des couches, un réseau à avance, un coupure (taux = 0,243).

Agrégation et classification des caractéristiques
La sortie de la couche finale du Transformer était aplatie et passée à travers un perceptron multicouche (MLP) pour la classification. La MLP se composait d’une ou plusieurs couches entièrement connectées avec des fonctions d’activation non linéaires.

La couche finale de sortie utilisait une fonction d’activation sigmoïde pour produire la probabilité prédite d’ostéoporose :

—> figure-protocol-2= σ(z)

Où z est la sortie logit.

Fonction de perte et stratégie d’entraînement
Le modèle a été entraîné en utilisant la perte d’entropie binaire :

—> L = −(1/N) Σ [ yi log(ŷi) + (1 − yi) log(1 − ŷi) ]

Où yi désigne l’étiquette vraie et figure-protocol-3i la probabilité prédite.

Le modèle a été optimisé à l’aide de l’optimiseur Adam (taux d’apprentissage = 1,9e-4, taille du lot = 64) pour 100 époques. Un arrêt précoce a été appliqué en fonction de la performance de validation (patience = 15) pour éviter le sur-ajustement. Pour soutenir la reproductibilité, toutes les procédures expérimentales ont été réalisées à l’aide d’une graine aléatoire constante (graine = 42).

Interprétabilité du modèle
Pour améliorer l’interprétabilité, des explications additives SHAPapley (SHAP) ont été appliquées au modèle entraîné. Les valeurs SHAP ont été calculées sur l’ensemble de test pour quantifier la contribution de chaque caractéristique au résultat prédit, permettant à la fois une interprétation globale et individuelle du comportement du modèle.

Comme illustré à la Figure 1, le flux de travail résume le processus depuis le prétraitement des données MIMIC-IV jusqu’à la construction et la classification du modèle. L’architecture TabTransformer capture les interactions entre des caractéristiques tabulaires hétérogènes grâce à l’auto-attention, tandis que la visualisation basée sur SHAP fournit des informations interprétables sur les contributions des caractéristiques. Ce cadre permet une analyse validée en interne des schémas liés à l’ostéoporose dans une cohorte hétérogène de neurochirurgie spinale.

figure-protocol-4
Figure 1. Étudiez le flux de travail et l’architecture des modèles. Cette figure illustre la conception globale de l’étude, incluant la sélection des cohortes, le prétraitement des données, l’ingénierie des fonctionnalités, la division des ensembles de données et le développement de modèles. Il résume également l’architecture TabTransformer utilisée pour la classification, incluant l’intégration de caractéristiques, les couches d’encodeur Transformer et la sortie finale de classification. Seule la première admission éligible par patient était incluse. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Comparaison des performances des modèles
Nous avons comparé le modèle TabTransformer proposé avec trois modèles de référence (XGBoost, LSTM avec attention, et Réseaux Convolutionnels Temporels [TCN]) sur l’ensemble de test posé. Comme montré à la Figure 2, TabTransformer a obtenu la performance discriminative la plus élevée avec un AUC de 0,953 (IC 95 % : 0,924–0,977), suivi par TCN (AUC = 0,937, IC 95 % : 0,903–0,967), XGBoost (AUC = 0,8...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Dans cette étude, nous avons développé un modèle TabTransformer basé sur l’attention pour la classification hospitalière de l’ostéoporose chez les adultes subissant des neurochirurgies spinales et utilisé les SHapley Additive ExPlanations (SHAP) pour explorer les principales variables à l’origine des modèles (Figure 5 et Figure 6). Les résultats du SHAP suggèrent que l’âge était le principal contributeur, suivi de signaux récurr...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Remerciements

Les auteurs reconnaissent chaleureusement le soutien financier du Programme de Science et Technologie Guides de la ville de Suqian (Subvention n° Z202342).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Adam optimizerPyTorchInclus dans PyTorchUtilisé pour l'entraînement de TabTransformer
Jupyter NotebookProject JupyterVersion la plus récente disponibleUtilisé pour le développement du modèle et le flux de travail d'analyse
Base de données MIMIC-IVPhysioNetversion 3.1; https://physionet.org/content/mimiciv/3.1/Base de données publique anonymisée de soins intensifs
PythonPython Software FoundationVersion la plus récente disponibleEnvironnement de programmation principal
PyTorchPyTorch FoundationVersion la plus récente disponibleCadre de deep learning utilisé pour implémenter TabTransformer
Logiciel de gestion de base de données relationnelleNavicatversion 17.0; https://www.navicat.com.cn/Utilisé pour l'extraction de données de MIMIC-IV
scikit-learnDéveloppeurs de scikit-learnVersion la plus récente disponibleUtilisé pour le prétraitement, le fractionnement des données et les modèles de base
SHAPDéveloppeurs de SHAPVersion la plus récente disponibleUtilisé pour l'analyse d'interprétabilité des modèles
SMOTEimbalanced-learnVersion la plus récente disponibleUtilisé pour le suréchantillonnage des classes minoritaires dans l'ensemble d'entraînement
XGBoostDéveloppeurs de XGBoostVersion la plus récente disponibleModèle de comparaison de base

Références

  1. Rachner, T. D., Khosla, S., Hofbauer, L. C. Osteoporosis: now and the future. Lancet. 377 (9773), 1276-1287 (2011).
  2. Khosla, S., Hofbauer, L. C. Osteoporosis treatment: recent developments and ongoing challenges. Lancet Diabetes Endocrinol. 5 (11), 898-907 (2017).
  3. Jiang, S. D., Dai, L. Y., Jiang, L. S. Osteoporosis after spinal cord injury. Osteoporos Int. 17 (2), 180-192 (2006).
  4. Kivrak, M., et al. The impact of the SMOTE method on machine learning and ensemble learning performance results in addressing class imbalance in data used for predicting total testosterone deficiency in type 2 diabetes patients. Diagnostics (Basel). 14 (23), 2634 (2024).
  5. Carvalho, F. R., Gavaia, P. J. Enhancing osteoporosis risk prediction using machine learning: a holistic approach integrating biomarkers and clinical data. Comput Biol Med. 192, 110289 (2025).
  6. Huang, X., Khetan, A., Cvitkovic, M., Karnin, Z. TabTransformer: tabular data modeling using contextual embeddings. arXiv. , (2020).
  7. Kapila, A., Takkar, A. Neurological disorders, corticosteroids, and fracture risk: hiding in the hindsight!. J Postgrad Med Educ Res. 56 (2), 61-62 (2022).
  8. Battaglino, R. A., Lazzari, A. A., Garshick, E., Morse, L. R. Spinal cord injury-induced osteoporosis: pathogenesis and emerging therapies. Curr Osteoporos Rep. 10 (4), 278-285 (2012).
  9. Landi, F., Liperoti, R., Russo, A., Giovannini, S., et al. Sarcopenia as a risk factor for falls in elderly individuals: results from the ilSIRENTE study. Clin Nutr. 31 (5), 652-658 (2012).
  10. Romagnani, P., et al. Chronic kidney disease. Nat Rev Dis Primers. 11 (1), 8 (2025).
  11. Liu, S., Liang, R. Synergistic impact of immuno-nutritional and hypoxia-metabolic disturbances on post-stroke epilepsy: a “two-hit” prediction model and web-based risk calculator. Front Nutr. 13, 1759899 (2026).
  12. Liu, S., Zhou, J. Trends and development of enhanced recovery after surgery programs in cranial and spinal neurosurgery. Neurochirurgie. 71 (5), 101704 (2025).
  13. Carvalho, F. R., Gavaia, P. J., Brito Camacho, A. OrthoMortPred: predicting one-year mortality following orthopedic hospitalization. Int J Med Inform. 192, 105657 (2024).
  14. Liu, S., Liang, R. Risk stratification for intracranial infection after high-grade gliomas surgery: a nomogram development and validation study. Front Oncol. 15, 1697966 (2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Classification de l ost oporoseMod le TabTransformerNeurochirurgie rachidienneDonn es tabulaires cliniquesBase de donn es MIMIC IVMod le d apprentissage profondAnalyse SHAPInterpr tabilit du mod leD s quilibre des classesImportance des caract ristiques

Articles connexes