Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Apprentissage profond des radiographies thoracolombaires de profil et facteurs de risque cliniques pour les fractures vertébrales incidentes : étude de cohorte rétrospective monocentrique

105 vues

⸱

DOI :

10.3791/71628

⸱

18 août 2026

Dans cet article

Résumé

Un score d'apprentissage profond extrait de radiographies latérales thoracolombaires, combiné à des facteurs de risque cliniques, a permis une prédiction précise de fractures vertébrales incidentes dans un délai de deux ans. Le modèle validé en interne a montré une meilleure discrimination, calibration, reclassement et bénéfice décisionnel que le modèle clinique, soutenant ainsi des stratégies de stratification du risque individualisée et une prise en charge préventive précoce.

Résumé

L'identification précoce des patients à risque de fracture vertébrale incidente reste difficile, car l'évaluation clinique habituelle du risque ne reflète pas complètement la fragilité locale de la colonne vertébrale. Cette étude de cohorte rétrospective monocentrique a évalué si des caractéristiques issues de l'apprentissage profond (DL) extraites de radiographies latérales thoracolombaires initiales améliorent la prédiction de fracture vertébrale incidente dans les deux ans suivant l'examen, lorsqu'elles sont combinées à des facteurs de risque cliniques. Un total de 2 173 patients ont été inclus et répartis chronologiquement en une cohorte de développement (n = 1 449) et une cohorte de validation interne (n = 724). Les caractéristiques DL ont été extraites des radiographies initiales, et une régression de type LASSO-Cox a été utilisée pour sélectionner les prédicteurs et construire un modèle clinique, un modèle DL et un modèle combiné. Les performances ont été évaluées par correction de l'optimisme via bootstrap, validation interne temporelle, calibration, analyse de courbe décisionnelle, amélioration nette de reclassement dépendant du temps (NRI), amélioration intégrée de la discrimination (IDI) et analyses de sensibilité. Parmi 2 048 caractéristiques DL candidates, 5 ont été retenues pour générer un score DL, qui est resté un prédicteur indépendant dans le modèle combiné (HR 1,64, IC 95 % 1,34–2,01 ; P < 0,001). Dans la validation interne, le modèle combiné a atteint un indice C de 0,759, une AUC à 2 ans de 0,774 et un score de Brier à 2 ans de 0,077, tous supérieurs au modèle clinique, avec une bonne calibration (ordonnée à l'origine 0,012 ; pente 0,972). Par rapport au modèle clinique, le modèle combiné a également amélioré le reclassement (NRI à 2 ans de 0,316 dans la cohorte de développement et de 0,241 dans celle de validation) et la discrimination (IDI à 2 ans de 0,047 et 0,033, respectivement ; tous les P < 0,01), tout en offrant un bénéfice net supérieur selon l'analyse de courbe décisionnelle. Les analyses de sensibilité étaient concordantes avec les résultats principaux. La combinaison de caractéristiques DL extraites de radiographies latérales thoracolombaires avec des facteurs de risque cliniques pourrait permettre une prédiction individualisée plus précise de la fracture vertébrale incidente dans les deux ans suivant l'examen.

Introduction

La fracture vertébrale est l'un des types de fractures de fragilité ostéoporotique les plus fréquents, en particulier dans la région thoracolombaire. Elle peut entraîner des douleurs chroniques, une perte de taille, une déformation cyphotique, une mobilité réduite, et augmenter le risque de refraction ainsi que d’un pronostic défavorable1. En pratique clinique, une proportion importante de patients ne présente pas de symptômes typiques avant la survenue de la fracture, et de nombreux cas ne sont détectés que lors d’examens d’imagerie de suivi, ce qui suggère que le fait de s’appuyer uniquement sur les symptômes ou sur un diagnostic rétrospectif rend difficile la réalisation d’un dépistage opportun des populations à haut risque2,3. L’évaluation actuelle du risque repose principalement sur des informations telles que l’âge, le sexe, l’indice de masse corporelle, les fractures de fragilité antérieures, le diabète, l’exposition aux glucocorticoïdes et la densité minérale osseuse, qui permettent de refléter le contexte de fragilité osseuse systémique, mais il est difficile de caractériser pleinement la fragilité structurelle locale et les anomalies mécaniques de la colonne thoracolombaire, ce qui constitue également une difficulté majeure persistante dans la prédiction du risque de nouvelle fracture vertébrale4. La radiographie latérale thoracolombaire est l’un des examens d’imagerie rachidienne les plus couramment utilisés et accessibles en pratique clinique. Elle permet non seulement de visualiser la morphologie vertébrale, mais peut également révéler des phénotypes occultes associés à un risque futur de fracture, tels que des modifications des plateaux vertébraux, une trame osseuse clairsemée, un léger aplatissement en coin ou un déséquilibre de l’alignement5. Les études antérieures se sont principalement concentrées sur la détection des fractures vertébrales existantes, le diagnostic de l’ostéoporose ou l’évaluation du risque à l’aide d’indicateurs mesurés manuellement6,7. Des données récentes ont en outre montré que l’identification, par apprentissage profond, de fractures vertébrales prévalentes et d’ostéoporose sur des images latérales de la colonne vertébrale, combinée aux facteurs de risque cliniques, peut améliorer la prédiction des nouvelles fractures5 ; toutefois, les preuves restent limitées concernant la prédiction de nouvelles fractures vertébrales spécifiquement chez les patients sans fracture vertébrale cible au moment du diagnostic initial, à partir de radiographies latérales thoracolombaires de routine et de caractéristiques locales d’apprentissage profond (DL). Les méthodes d’intelligence artificielle ont été utilisées pour l’analyse d’imagerie rachidienne, mais les études directement axées sur ce scénario clinique spécifique restent rares, et l’évaluation systématique de la calibration, du bénéfice net issue de l’analyse décisionnelle et de la validation par division temporelle demeure insuffisante dans ce contexte8.

Par conséquent, il est difficile de répondre à une question cliniquement plus pertinente : les caractéristiques extraites par apprentissage profond à partir de radiographies latérales thoracolombaires de routine peuvent-elles fournir des informations supplémentaires indépendantes et significatives au-delà de l'évaluation clinique des risques9 ? Sur la base des éléments exposés ci-dessus, cette étude a adopté un dispositif de cohorte rétrospective monocentrique, extrait des caractéristiques issues de l'apprentissage profond à partir de radiographies latérales thoracolombaires, puis les a combinées aux facteurs de risque cliniques afin de construire un modèle de prédiction du risque de fracture vertébrale incidente dans les deux années suivantes. La discrimination, la calibration, la robustesse et la valeur clinique du modèle ont été évaluées par validation interne temporelle, correction de l'optimisme par rééchantillonnage bootstrap et analyse de sensibilité. Cette étude s'est concentrée sur l'alerte personnalisée au risque à partir de radiographies de routine, en intégrant des phénotypes d'images d'ostéoporose locale occulte et des informations cliniques systémiques de susceptibilité dans un outil de prédiction interprétable, afin de fournir une base pour l'identification des patients à haut risque, un suivi renforcé et des interventions préventives.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Cette étude a été examinée et approuvée par le comité d'éthique médicale de l'hôpital populaire n°8 de Shanghai, Shanghai, Chine (numéro d'approbation 2026-102-03-02). Étant donné que cette étude était une étude rétrospective et que toutes les données avaient été désidentifiées avant l'analyse, le comité d'éthique a dispensé le consentement éclairé des patients.

Conception de l'étude :

Type d'étude

Cette étude était une étude de cohorte rétrospective monocentrique, et la base de données de l'étude a été établie à l'aide de données provenant du système de gestion et d'archivage d'images (PACS), du système d'information radiologique (RIS) et du système de dossier médical électronique de l'hôpital. La population étudiée comprenait des patients consécutifs ayant subi un examen radiographique numérique latéral du rachis thoracolombaire à l'hôpital. La période d'inclusion s'est étendue du 1er janvier 2018 au 31 décembre 2023, et la date limite de suivi était le 31 décembre 2025. Le rapport d'étude a suivi les recommandations TRIPOD+AI et STROBE afin d'assurer la standardisation des rapports d'études sur les modèles prédictifs impliquant l'intelligence artificielle et les études observationnelles.

Contexte de l'étude et source des cas

Les cas provenaient du processus habituel de diagnostic clinique et de traitement des patients externes, des patients aux urgences et des patients hospitalisés dans l'établissement. Les données d'imagerie provenaient toutes de fichiers DICOM originaux du système PACS, et les données cliniques provenaient des dossiers médicaux électroniques structurés, des systèmes de laboratoire et des dossiers de prescriptions. La date du premier examen radiographique latéral thoracolombaire répondant aux critères d'inclusion pendant la période d'étude a été définie comme la date de référence ; lorsqu'un même patient avait plusieurs examens satisfaisant aux critères, seul le plus ancien était conservé comme examen de référence afin d'éviter un double enrôlement. Toutes les données ont été désidentifiées avant l'analyse, et les informations d'imagerie et cliniques ont été appariées à l'aide d'un numéro d'identification d'étude unique.

Population étudiée :

Critères d'inclusion

Les critères d'inclusion étaient les suivants : âge de 50 ans ou plus ; réalisation d'un examen standard de radiographie numérique latérale thoracolombaire en position debout à l'hôpital pendant la période de l'étude ; imagerie de référence disponible en format DICOM traçable ; visualisation complète des vertèbres T10 à L4 sur l'imagerie de référence ; absence de fracture vertébrale préexistante entre T10 et L4 à l'analyse de l'imagerie de référence ; extraction possible des variables cliniques de base prédéfinies à partir des dossiers médicaux électroniques ; au moins un examen d'imagerie thoracolombaire de suivi par radiographie, tomodensitométrie (CT) ou imagerie par résonance magnétique (IRM) dans les 24 mois suivant l'examen de référence, ou survenue d'une fracture vertébrale nouvelle confirmée par imagerie dans les 24 mois.

Critères d'exclusion

Les critères d'exclusion étaient les suivants : fracture vertébrale de T10 à L4 au moment du début de l'étude ; antécédent certain de traumatisme violent à haute énergie au moment du début de l'étude ou pendant le suivi ; tumeur spinale primitive ou métastatique, infection spinale ou maladie osseuse destructive ; chirurgie antérieure de fixation interne thoracolombaire, vertébroplastie ou kyphoplastie ; scoliose avec un angle de Cobb supérieur à 30° ou déformation cyphosique évidente (y compris une cyphose de type Scheuermann, si présente), entraînant l'impossibilité d'identifier précisément les plateaux vertébraux de T10 à L4 ; artefact de mouvement marqué, exposition anormale, occultation métallique ou plage de visualisation insuffisante sur les images ; impossibilité de confirmer les variables clés au moment du début de l'étude ou les informations sur les résultats à partir des dossiers médicaux électroniques.

Processus de construction d'une cohorte rétrospective

Le dépistage de la population étudiée a été réalisé indépendamment par deux chercheurs selon des critères prédéfinis, et les désaccords ont été résolus par discussion afin d'aboutir à un consensus. Une fois le dépistage des cas terminé, un regroupement en séries chronologiques a été effectué selon la date de référence : les patients inclus du 1er janvier 2018 au 31 décembre 2021 ont constitué la cohorte de construction pour la sélection des caractéristiques et l'élaboration du modèle ; les patients inclus du 1er janvier 2022 au 31 décembre 2023 ont constitué la cohorte de validation interne pour l'évaluation des performances du modèle. La division temporelle, plutôt qu'une division aléatoire, permet de réduire le risque de fuite d'information et se rapproche davantage du scénario réel d'application du modèle chez des patients ultérieurs. Le processus de sélection de la population étudiée est présenté sous forme de diagramme de flux.

Résultat principal et sa détermination :

Définition du critère de jugement principal

Le critère de jugement principal de cette étude était la première fracture vertébrale de fragilité entre T10 et L4 survenant dans les 24 mois suivant le moment de référence. La fenêtre temporelle de prédiction de l'étude avait été prédéfinie à 2 ans, et le résultat du modèle était la probabilité individuelle de survenue d'une fracture vertébrale dans les 2 ans.

Critères pour la détermination d'une fracture vertébrale incidente

Une fracture vertébrale incidente était définie comme suit : par rapport aux images de référence, les images de suivi montraient une diminution de 20 % ou plus de la hauteur antérieure, moyenne ou postérieure de n'importe quel corps vertébral entre T10 et L4, avec une réduction absolue de hauteur d'au moins 4 mm, ou l'apparition d'un effondrement nouveau de la plaque terminale ou d'une interruption corticale10. La détermination du résultat a été effectuée de manière exhaustive à partir des radiographies de suivi du rachis thoracolombaire, de tomodensitométries (CT) et d'IRM. La lecture des images a été réalisée indépendamment par deux radiologues spécialisés en appareil locomoteur, ayant respectivement 8 ans et 12 ans d'expérience diagnostique pertinente, et aucun n'avait accès aux données cliniques ni aux résultats du modèle pendant la lecture des images ; en cas de désaccord, un troisième radiologue senior spécialisé en appareil locomoteur, disposant de 18 ans d'expérience, assurait l'arbitrage. Les fractures vertébrales causées par une tumeur, une infection ou un traumatisme à haute énergie n'étaient pas comptabilisées comme des événements d'issue.

Point de départ, point d'arrivée et fenêtre d'observation du suivi

Le point de départ du suivi était la date de l'examen radiographique latéral thoracolumbar de référence. Le point final du suivi était défini comme le plus précoce des événements suivants : la date du premier incident de fracture vertébrale, 24 mois après l'examen de référence, la date du dernier examen d'imagerie spinale confirmant l'absence de fracture vertébrale, ou la date du décès. Les fractures apparaissant pour la première fois après 24 mois n'ont pas été incluses dans le résultat principal. Les patients sans événement de résultat ont été considérés comme censurés.

Récolte des données cliniques et définition des variables cliniques candidates :

Données démographiques et cliniques générales

Les données cliniques de base ont été extraites du système de dossier médical électronique par deux chercheurs selon un formulaire de rapport de cas normalisé, sans examiner les résultats de la détermination des issues pendant l'extraction. Les données démographiques et cliniques générales recueillies comprenaient l'âge, le sexe, la taille, le poids et l'indice de masse corporelle. L'âge correspondait à l'âge réel à la date de référence ; le poids et la taille provenaient de l'enregistrement le plus proche de la date de référence, dans un intervalle de 30 jours avant ou après celle-ci ; l'indice de masse corporelle était calculé comme le poids divisé par le carré de la taille, en kilogrammes par mètre carré.

Antécédents médicaux, utilisation de médicaments et données relatives au métabolisme osseux

Sur la base de la disponibilité clinique et de la généralisabilité du modèle, les facteurs de risque cliniques candidats suivants ont été prédéfinis pour inclusion : antécédents de fracture de fragilité, diabète sucré de type 2, arthrite rhumatoïde, utilisation chronique de glucocorticoïdes par voie orale et traitement anti-ostéoporotique au moment de l'inclusion. Les mesures normalisées de la densité minérale osseuse au moment de l'inclusion et le score FRAX n'ont pas été prédéfinis comme prédicteurs candidats, car ils n'étaient pas systématiquement disponibles en tant que variables normalisées au moment de l'inclusion pour l'ensemble de la cohorte ; plusieurs facteurs cliniques liés au FRAX ont plutôt été considérés séparément comme variables candidates individuelles. Les antécédents de fracture de fragilité, le diagnostic de maladies sous-jacentes et les informations sur les médicaments ont tous été extraits des dossiers médicaux électroniques, des comptes rendus de sortie et des systèmes de prescription avant l'inclusion, et toutes les variables devaient exister avant l'inclusion afin de garantir que les prédicteurs précèdent temporellement l'événement cible.

Critères de définition des variables cliniques

Les antécédents de fracture fragilitaire ont été définis comme une fracture survenue après l'âge de 40 ans, provoquée par un traumatisme de faible énergie et clairement enregistrée dans le dossier médical ; les fractures du crâne, des os du visage, des doigts et des orteils n'étaient pas incluses dans cette définition. Le diabète de type 2 a été défini par un diagnostic clairement établi avant la période initiale, ou par une utilisation prolongée de médicaments hypoglycémiants. La polyarthrite rhumatoïde a été définie par un diagnostic précis établi par un spécialiste en rhumatologie dans le dossier médical. L'utilisation chronique de glucocorticoïdes par voie orale a été définie comme une dose équivalente de prednisone d'au moins 5 mg/j pendant au moins 3 mois au cours de l'année précédant la période initiale. Le traitement anti-ostéoporotique au moment initial a été défini comme l'utilisation continue de l'un des médicaments suivants — bisphosphonates, denosumab, téripapatide, raloxifène, calcitonine, alfacalcidol ou calcitriol — au cours des 3 mois précédant la période initiale, pendant une durée d'au moins 8 semaines. L'âge et l'indice de masse corporelle ont été considérés comme des variables continues dans les modèles statistiques et n'ont pas été artificiellement catégorisés.

Acquisition des données d'imagerie et prétraitement des images

Protocole d'acquisition de radiographies latérales thoracolombaires

Toutes les images de base étaient des radiographies latérales standard du rachis thoracolombaire réalisées en position debout, acquises par le système de radiographie numérique de l'hôpital. Lors de l'examen, les patients adoptaient une position naturelle debout, avec les deux membres supérieurs fléchis vers l'avant afin de réduire le recouvrement des épaules, et la zone d'imagerie couvrait T10 à L4. Un contrôle automatique de l'exposition a été utilisé pour l'examen, avec une tension du tube comprise entre 80 et 95 kV et une distance source-image de 110 cm. Chez le même patient, lorsqu'il existait plusieurs radiographies latérales admissibles à la date de référence, celle présentant une plage de visualisation complète et la meilleure qualité d'image était sélectionnée comme objet d'analyse.

Critères d'inclusion des images et contrôle de qualité

Les images de référence devaient satisfaire aux critères de qualité suivants : visualisation complète des vertèbres T10 à L4 et de leurs plateaux supérieur et inférieur ; contours antérieur et postérieur des vertèbres, plateaux et limites corticales bien définis ; absence d'artéfact de mouvement évident ; absence de surexposition ou sous-exposition sévère ; absence d'occlusion métallique sur une grande surface ; et absence de distorsion morphologique évidente due à une rotation de la position corporelle. Les images présentant des modifications dégénératives sévères ou des ostéophytes empêchant une identification fiable des contours vertébraux ou des plateaux étaient également exclues. Deux radiologues spécialisés en appareil musculosquelettique ont effectué l'évaluation de qualité de toutes les images de référence, et toute image ne satisfaisant pas à l'un des critères de qualité essentiels a été exclue.

Prétraitement et standardisation des images

Toutes les images DICOM ont été rendues anonymes avant l'analyse. Les étapes de prétraitement comprenaient l'unification de l'orientation des images, un rééchantillonnage à une résolution spatiale de 0,30 mm × 0,30 mm, la troncature des valeurs de niveaux de gris entre le 0,5e centile et le 99,5e centile, et la normalisation des valeurs des pixels à l'intervalle 0–1 à l'aide de la méthode de normalisation min-max. Le flux de travail de prétraitement ci-dessus a été maintenu identique pour la cohorte de développement et la cohorte de validation, et a été entièrement automatisé par des scripts prédéfinis afin de réduire les biais liés aux opérations manuelles.

Extraction de caractéristiques d'imagerie par apprentissage profond :

Détermination de la région d'intérêt

La région d'intérêt correspondait à la zone de projection latérale de la colonne vertébrale comprise entre la plaque supérieure de T10 et la plaque inférieure de L4. Un radiologue spécialisé en appareil locomoteur, possédant 8 ans d'expérience, a réalisé une annotation sous forme de boîte rectangulaire sur toutes les images de référence à l'aide du logiciel ITK-SNAP, en définissant la limite antérieure à 5 mm en avant de la marge antérieure du corps vertébral et la limite postérieure à 5 mm en arrière de la marge postérieure du corps vertébral11 ; un second radiologue spécialisé en appareil locomoteur, possédant 12 ans d'expérience, a ensuite examiné les images cas par cas. La région d'intérêt constituait une boîte rectangulaire au niveau régional, et non une segmentation stricte du contour vertébral ; par conséquent, les ostéophytes marginaux courants n'ont pas été retirés séparément et pouvaient être partiellement inclus s'ils se trouvaient à l'intérieur des limites prédéfinies, tandis que les cas présentant des modifications dégénératives suffisamment sévères pour masquer les marges vertébrales ou les plaques vertébrales avaient déjà été exclus lors de l'évaluation de la qualité des images. Afin d'évaluer la reproductibilité de l'annotation des régions, 50 images ont été sélectionnées aléatoirement et réannotées par le même radiologue après un délai de 4 semaines, puis réannotées indépendamment par le second radiologue, en vue d'une analyse ultérieure de la stabilité des caractéristiques. Après le recadrage de la région d'intérêt, toutes les images ont été redimensionnées uniformément à 224 × 224 pixels.

Architecture du modèle d'apprentissage profond et processus d'extraction de caractéristiques

Cette étude a utilisé le réseau neuronal convolutionnel ResNet50 comme extracteur de caractéristiques d'apprentissage profond. Les paramètres du réseau ont été initialisés avec des poids préentraînés sur ImageNet, et un processus d'adaptation de domaine auto-supervisé a été effectué sur toutes les images de ROI de base de la cohorte de dérivation, sans utiliser d'étiquettes de résultat pendant cette phase d'adaptation. Plus précisément, une tâche auto-supervisée contrastive a été mise en œuvre, dans laquelle deux vues augmentées indépendamment à partir d'une même image de ROI étaient considérées comme une paire positive, tandis que les vues provenant de patients différents au sein du même mini-lot étaient traitées comme des paires négatives, afin que l'encodeur puisse s'adapter à la distribution des images de l'étude. L'entraînement du modèle a utilisé l'optimiseur AdamW, avec un taux d'apprentissage initial fixé à 1 × 10^-4, une taille de lot de 64 et 200 époques d'entraînement ; durant l'entraînement, une augmentation des données a été réalisée avec une rotation de ±5°, un facteur de mise à l'échelle de 0,9 à 1,1, une translation de pas plus de 10 pixels et une perturbation du contraste de ±10%12. Ces augmentations ont été utilisées pour générer des paires de vues destinées à la tâche auto-supervisée, et seules les images non étiquetées de la cohorte de dérivation ont été utilisées à ce stade. Après l'adaptation de domaine, aucune réadaptation supervisée par les résultats n'a été effectuée, et l'encodeur principal adapté a été figé pour l'extraction de caractéristiques. Une fois l'adaptation de domaine terminée, le vecteur de 2 048 dimensions issu de la couche de moyennage global a été extrait comme caractéristiques candidates d'apprentissage profond pour chaque patient.

Préparation des caractéristiques d'imagerie et réduction de la dimensionnalité

Premièrement, le coefficient de corrélation intraclasse des caractéristiques a été calculé à partir des 50 images ayant fait l'objet d'annotations répétées, et les caractéristiques dont les coefficients ICC intra-observateur et inter-observateur étaient tous deux supérieurs ou égaux à 0,80 ont été conservées afin d'assurer la stabilité des caractéristiques face à de légères variations des régions d'intérêt. Ensuite, les caractéristiques retenues ont été standardisées selon le score Z dans la cohorte de modélisation, les caractéristiques de variance nulle ont été éliminées, et parmi les caractéristiques présentant un coefficient de corrélation par paires absolu supérieur à 0,90, une seule a été conservée. Enfin, une régression LASSO-Cox a été utilisée pour la sélection des caractéristiques, le paramètre de pénalité étant déterminé par une validation croisée en 10 parties selon le critère de 1-SE. Les caractéristiques dont les coefficients de régression étaient non nuls ont été pondérées puis additionnées selon leurs coefficients respectifs afin de construire le score d'apprentissage profond (score DL)13. Une fois cette formule de scoring établie dans la cohorte de modélisation, elle a été fixée sans modification et appliquée directement à la cohorte de validation interne.

Prétraitement et intégration des prédicteurs candidats :

Traitement des données manquantes et standardisation des données

Toutes les variables cliniques candidates ont été obtenues à partir de champs structurés du dossier médical. Les variables dont le taux de valeurs manquantes dépassait 20 % ont été exclues du processus de modélisation. Les valeurs manquantes restantes ont été traitées par imputation multiple par équations en chaîne, générant 10 jeux de données imputées ; le modèle d'imputation a intégré tous les prédicteurs candidats, la variable indicatrice de l'issue et l'estimation de la fonction de risque cumulée de Nelson-Aalen afin de préserver autant que possible l'information sur le délai jusqu'à l'événement. Les variables cliniques continues et le score DL ont été standardisés à l'aide de la moyenne et de l'écart-type de la cohorte de développement, et les mêmes paramètres de transformation ont été appliqués à la cohorte de validation ; les variables binaires ont été codées uniformément comme 0 ou 1.

Sélection des facteurs de risque cliniques

La prédéfinition des facteurs de risque cliniques candidats était fondée sur l'interprétabilité clinique, les preuves antérieures et la disponibilité des données, et aucun criblage basé sur la valeur P univariée n'a été utilisé. Les variables cliniques candidates introduites dans la sélection par régression LASSO-Cox étaient l'âge, le sexe, l'indice de masse corporelle, les antécédents de fracture de fragilité, le diabète de type 2, la polyarthrite rhumatoïde, l'utilisation chronique de glucocorticoïdes par voie orale et le traitement anti-ostéoporotique au moment de l'inclusion ; la taille et le poids ont été recueillis de manière descriptive et utilisés pour calculer l'indice de masse corporelle, mais n'ont pas été intégrés séparément dans la modélisation. La régression LASSO-Cox a été réalisée séparément sur les 10 jeux de données imputées de la cohorte de développement, et le paramètre de pénalité a été sélectionné par validation croisée en 10 parties ; les variables présentant des coefficients non nuls dans au moins 7 jeux de données imputées ont été retenues pour le modèle clinique final. L'âge et l'indice de masse corporelle ont tous deux été testés pour des relations non linéaires à l'aide de splines cubiques restreintes ; si le terme non linéaire n'était pas statistiquement significatif, la forme linéaire a été conservée. La multicolinéarité a été évaluée à l'aide du facteur d'inflation de la variance, et les variables présentant un facteur d'inflation de la variance supérieur à 5 n'ont pas été conservées simultanément.

Construction de l'ensemble de prédicteurs combiné

Pour éviter un surajustement dû à l'entrée directe de caractéristiques d'imagerie en haute dimension dans le modèle, les informations issues de l'apprentissage profond ont d'abord été compressées en une seule variable continue, le score DL, puis introduites conjointement dans un modèle combiné avec les facteurs de risque cliniques sélectionnés. Aucun terme d'interaction n'a été prédéfini dans le modèle combiné, afin de préserver la parcimonie et l'interprétabilité du modèle. L'ensemble final de prédicteurs combinés comprenait le score DL et les variables cliniques conservées.

Construction du modèle de prédiction des risques :

Stratégie de modélisation

Dans la cohorte de dérivation, le modèle clinique, le modèle d'apprentissage profond et le modèle combiné ont été établis séparément. Les modèles ont utilisé une régression de Cox aux risques proportionnels, la première fracture vertébrale de fragilité survenue dans les 24 mois suivant le moment de référence étant définie comme critère d'évaluation principal, et les règles de censure sont décrites dans la définition du suivi ci-dessus. Afin de limiter le surajustement, la complexité du modèle combiné a été restreinte avant la modélisation, et un ratio relativement élevé événements-par-paramètre a été maintenu autant que possible. Les coefficients de régression finaux et les erreurs standards de chaque modèle ont été estimés séparément dans les 10 jeux de données imputés, puis regroupés selon les règles de Rubin. La fonction de risque de base a été estimée selon la méthode de Breslow, et la probabilité individuelle de risque à 2 ans a été calculée.

Construction du modèle clinique

Le modèle clinique comprenait les facteurs de risque cliniques conservés après la sélection par régression LASSO-Cox. Toutes les variables continues ont été maintenues sous forme continue et n'ont pas été dichotomisées. Après l'ajustement du modèle, l'hypothèse de proportionalité des risques a été testée à l'aide des résidus de Schoenfeld ; pour les variables ne satisfaisant pas à cette hypothèse, un terme d'interaction avec ln(temps) a été ajouté afin de la corriger. Le modèle clinique a été utilisé pour caractériser la capacité prédictive des informations cliniques traditionnelles concernant la survenue de fractures vertébrales incidentes.

Construction du modèle d'imagerie par apprentissage profond

Le modèle d'apprentissage profond a été établi comme un modèle de risques proportionnels de Cox utilisant le score DL comme seul prédicteur, afin de quantifier la capacité prédictive des caractéristiques d'apprentissage profond issues de la radiographie latérale thoracolombaire de base pour le risque de fracture vertébrale incidente dans les 2 ans. Ce modèle n'a introduit aucune information clinique et a donc servi de modèle unimodal d'imagerie pour la comparaison avec les autres modèles.

Construction du modèle combiné

Le modèle combiné a en outre ajouté le score d'apprentissage profond (DL) à partir du modèle clinique, et a construit un modèle prédictif complet fondé sur des caractéristiques d'apprentissage profond issues de la radiographie latérale thoracolombaire combinées à des facteurs de risque cliniques. Une fois le modèle combiné établi, un nomogramme de risque sur 2 ans a été établi selon ses coefficients de régression, afin de permettre l'estimation individualisée du risque et de présenter son application clinique.

Validation interne et évaluation des performances du modèle :

Méthode de validation interne

La validation interne a adopté une stratégie de validation interne monocentrique séparée dans le temps. Tous les modèles établis dans la cohorte de dérivation ont été directement appliqués à la cohorte de validation recrutée du 1er janvier 2022 au 31 décembre 2023, une fois les paramètres fixés, sans réajustement. En outre, 1 000 rééchantillonnages par bootstrap ont été réalisés au sein de la cohorte de dérivation afin d'obtenir des estimations de performance corrigées de l'optimisme, dans le but d'évaluer la stabilité du modèle.

Évaluation de la discrimination

La discrimination du modèle a été évaluée à l'aide de l'indice de concordance de Harrell et de la superficie sous la courbe (AUC) dépendante du temps à 2 ans, calculée selon la méthode de pondération par la probabilité inverse de censure, les deux étant accompagnées d'intervalles de confiance à 95 %. Une discrimination plus élevée indique que le modèle est plus performant pour distinguer les individus qui développeront ou non des fractures vertébrales incidentes à l'avenir. Les différences de discrimination entre les modèles ont été calculées à l'aide de la méthode de bootstrap avec des intervalles de confiance à 95 %.

Évaluation de l'étalonnage

L'étalonnage du modèle a été évalué à l'aide de la courbe d'étalonnage du risque à 2 ans, de l'ordonnée à l'origine d'étalonnage, de la pente d'étalonnage et du score de Brier à 2 ans. La courbe d'étalonnage a été tracée en fonction des déciles du risque prédit et corrigée par rééchantillonnage avec remise. Une ordonnée à l'origine d'étalonnage proche de 0, une pente d'étalonnage proche de 1 et un score de Brier plus faible indiquent un bon accord entre le risque prédit et le risque effectivement observé.

Évaluation de la valeur d'application clinique

La valeur d'application clinique du modèle a été évaluée par une analyse de courbe de décision sur deux ans, comparant le bénéfice net selon différentes probabilités seuils. La plage de probabilité seuil a été prédéfinie entre 0,05 et 0,30 afin de couvrir l'intervalle de risque pouvant être utilisé en clinique pour un suivi intensifié, une évaluation osseuse complémentaire ou une prise en charge thérapeutique14. Un modèle présentant un bénéfice net plus élevé était considéré comme ayant une meilleure valeur d'aide à la décision clinique.

Comparaison des modèles et détermination du meilleur modèle

Le modèle clinique, le modèle d'apprentissage profond et le modèle combiné ont été comparés de manière exhaustive selon la discrimination, la calibration, le score de Brier et la courbe de décision. Le gain du modèle combiné par rapport au modèle clinique a été davantage quantifié à l'aide de l'amélioration nette de reclassement dépendante du temps à 2 ans et de l'amélioration intégrée de discrimination. Le meilleur modèle était prédéfini comme étant celui qui présentait simultanément une discrimination plus élevée, une bonne calibration, une erreur de prédiction plus faible et un bénéfice net plus grand.

Analyse statistique :

Les variables continues ont d'abord été évaluées quant à leur distribution à l'aide du test de Shapiro-Wilk ; celles qui suivaient une distribution normale ont été exprimées par la moyenne ± l'écart-type, tandis que celles présentant une distribution asymétrique ont été rapportées par la médiane et l'intervalle interquartile ; les variables catégorielles ont été présentées par le nombre de cas et le pourcentage. Les comparaisons des caractéristiques initiales entre le groupe de construction du modèle et le groupe de validation ont été effectuées à l'aide du test t pour échantillons indépendants, du test de Mann-Whitney U, du test χ2 ou du test exact de Fisher, respectivement. Les comparaisons initiales ont uniquement servi à décrire les caractéristiques des groupes et n'ont pas été utilisées comme critère de sélection des variables. Tous les tests statistiques étaient bilatéraux, et une valeur de P < 0,05 a été considérée comme statistiquement significative. Les analyses statistiques ont été réalisées avec le logiciel R, principalement à l'aide des packages survival, glmnet, mice, rms, timeROC et rmda ; le prétraitement des images et l'analyse par apprentissage profond ont été effectués dans l'environnement Python et PyTorch. Afin d'évaluer la robustesse des résultats, une analyse sur cas complets a été réalisée en complément comme analyse de sensibilité.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Processus de construction de la cohorte rétrospective et caractéristiques de base des cohortes

Pendant la période d'étude, des radiographies latérales thoracolumbaires ont été récupérées, et 6 114 patients ont été inclus pour le dépistage après suppression des doublons. Après une exclusion progressive des patients âgés de < 50 ans, de ceux présentant des fractures préexistantes au moment de l'inclusion et de ceux ayant un suivi insuffisant, un total de 2 ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Le modèle combiné a conservé une performance optimale après correction de l'optimisme et validation interne temporelle, ce qui suggère que les caractéristiques issues de l'apprentissage profond à partir de radiographies latérales thoracolombaires ne constituent pas une simple répétition des informations cliniques, mais qu'elles peuvent fournir des informations complémentaires indépendantes et vérifiables pour l'évaluation du risque de fracture vertébrale incidente dans les deux années suivantes. Son importance réside dan...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs déclarent qu’ils n’ont aucun conflit d’intérêts.

Remerciements

Les auteurs remercient le personnel de l'hôpital étudié pour leur soutien dans la récupération des images, l'extraction des données et la gestion des données. Les auteurs remercient également tous les cliniciens et technologues en imagerie médicale ayant participé aux soins des patients et à l'acquisition des images. Cette étude a été financée par le projet de recherche médicale du district de Xuhui en 2024 (SHXH202405).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
paquet glmnetCRANN/AUtilisé pour l'analyse de régression LASSO-Cox.
ITK-SNAPUniversité de Pennsylvanie / Projet ITK-SNAPN/AUtilisé pour l'annotation des régions d'intérêt (ROI) sur les images de base.
paquet miceCRANN/AUtilisé pour l'imputation multiple.
PythonFondation Python Software Foundationversion 3.10Utilisé pour le prétraitement des images et l'analyse par apprentissage profond.
PyTorchFondation PyTorch / Linux Foundationversion 2.1Utilisé pour le développement du modèle d'apprentissage profond et l'extraction de caractéristiques.
version de RFondation R pour l'informatique statistiqueversion 4.3.2Utilisé pour l'analyse statistique.
paquet rmdaCRANN/AUtilisé pour l'analyse de courbe de décision.
paquet rmsCRANN/AUtilisé pour le développement du modèle et l'analyse de calibration.
paquet survivalCRANN/AUtilisé pour l'analyse de régression des risques proportionnels de Cox.
paquet timeROCCRANN/AUtilisé pour l'analyse de la CUA dépendante du temps.

Références

  1. Daskalakis II, Bastian JD, Mavrogenis AF, Tosounidis TH. Osteoporotic vertebral fractures: an update. SICOT J. 2025;11:40.
  2. Na D et al. Underdiagnosis and underreporting of vertebral fractures on chest radiographs in men aged over 50 years or postmenopausal women with and without type 2 diabetes mellitus: a retrospective cohort study. BMC Med Imaging. 2022;22(1):81.
  3. Urrutia J, Besa P, Piza C. Incidental identification of vertebral compression fractures in patients over 60 years old using computed tomography scans showing the entire thoraco-lumbar spine. Arch Orthop Trauma Surg. 2019;139(11):1497-1503.
  4. Zerikly R, Demetriou EW. Use of Fracture Risk Assessment Tool in clinical practice and Fracture Risk Assessment Tool future directions. Women's Health (Lond). 2024;20:17455057241231387.
  5. Hong N et al. Deep learning-based identification of vertebral fracture and osteoporosis in lateral spine radiographs and DXA vertebral fracture assessment to predict incident fracture. J Bone Miner Res. 2025;40(5):628-638.
  6. Hong N et al. Deep-Learning-Based Detection of Vertebral Fracture and Osteoporosis Using Lateral Spine X-Ray Radiography. J Bone Miner Res. 2023;38(6):887-895.
  7. Johansson L et al. Grade 1 Vertebral Fractures Identified by Densitometric Lateral Spine Imaging Predict Incident Major Osteoporotic Fracture Independently of Clinical Risk Factors and Bone Mineral Density in Older Women. J Bone Miner Res. 2020;35(10):1942-1951.
  8. Li Y et al. Machine learning value in the diagnosis of vertebral fractures: A systematic review and meta-analysis. Eur J Radiol. 2024;181:111714.
  9. Kong SH et al. Development of a Spine X-Ray-Based Fracture Prediction Model Using a Deep Learning Algorithm. Endocrinol Metab (Seoul). 2022;37(4):674-683.
  10. Lunt M et al. Defining incident vertebral deformities in population studies: a comparison of morphometric criteria. Osteoporos Int. 2002;13(10):809-815.
  11. Da Mutten R et al. Whole Spine Segmentation Using Object Detection and Semantic Segmentation. Neurospine. 2024;21(1):57-67.
  12. Xiao W, Chen R. A study on ACCC surface defect classification method using ResNet18 with integrated SE attention mechanism. Appl Sci. 2026;16(4):1899.
  13. Liu F, Zhang DB, Cheng SH, Gu GS. A radiomics and deep learning nomogram developed and validated for predicting no-collapse survival in patients with osteonecrosis after multiple drilling. BMC Med Inform Decis Mak. 2025;25(1):26.
  14. Yokota T et al. Internal validation of an 11-yr prediction model for new vertebral fractures using the vertebral bone quality score: a prospective cohort study. JBMR Plus. 2025;9(11):ziaf155.
  15. Chen W, Mao M, Fang J, Xie Y, Rui Y. Fracture risk assessment in diabetes mellitus. Front Endocrinol (Lausanne). 2022;13:961761.
  16. Kong SH. Incorporating Artificial Intelligence into Fracture Risk Assessment: Using Clinical Imaging to Predict the Unpredictable. Endocrinol Metab (Seoul). 2025;40(4):499-507.
  17. Schini M et al. An overview of the use of the fracture risk assessment tool (FRAX) in osteoporosis. J Endocrinol Invest. 2024;47(3):501-511.
  18. LeBoff MS et al. The clinician's guide to prevention and treatment of osteoporosis. Osteoporos Int. 2022;33(10):2049-2102.
  19. Gu Y, Wang Y, Li M, Wang R. Current applications of deep learning in vertebral fracture diagnosis. Osteoporos Int. 2025;36(11):2071-2082.
  20. Cavati G et al. Role of Advanced Glycation End-Products and Oxidative Stress in Type-2-Diabetes-Induced Bone Fragility and Implications on Fracture Risk Stratification. Antioxidants (Basel). 2023;12(4):928.
  21. Hofbauer LC, Compston JE, Saag KG, Rauner M, Tsourdi E. Glucocorticoid-induced osteoporosis: novel concepts and clinical implications. Lancet Diabetes Endocrinol. 2025;13(11):964-979.
  22. Saravi B et al. Integrating radiomics with clinical data for enhanced prediction of vertebral fracture risk. Front Bioeng Biotechnol. 2024;12:1485364.
  23. Zhang J et al. Differentiation of acute and chronic vertebral compression fractures using conventional CT based on deep transfer learning features and hand-crafted radiomics features. BMC Musculoskelet Disord. 2023;24(1):165.
  24. McGrath LJ et al. Using negative control outcomes to assess the comparability of treatment groups among women with osteoporosis in the United States. Pharmacoepidemiol Drug Saf. 2020;29(8):854-863.
  25. Piovani D, Sokou R, Tsantes AG, Vitello AS, Bonovas S. Optimizing Clinical Decision Making with Decision Curve Analysis: Insights for Clinical Investigators. Healthcare (Basel). 2023;11(16):2244.
  26. Nguyen HT et al. A predictive nomogram for selective screening of asymptomatic vertebral fractures: The Vietnam Osteoporosis Study. Osteoporos Sarcopenia. 2025;11(1):9-14.
  27. Hu Y et al. Beyond Comparing Machine Learning and Logistic Regression in Clinical Prediction Modelling: Shifting from Model Debate to Data Quality. J Med Internet Res. 2025;27:e77721.
  28. Groot OQ et al. Availability and reporting quality of external validations of machine-learning prediction models with orthopedic surgical outcomes: a systematic review. Acta Orthop. 2021;92(4):385-393.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Régression LASSO-CoxValidation de modèlePrédiction du risqueAnalyse de la courbe de décisionAmélioration nette de la reclassification