L’arthrose du genou (KOA) est une maladie articulaire progressive et de longue durée, qui est l’une des principales raisons pour lesquelles les personnes âgées dans le monde entier deviennent handicapées1. La détection précoce de modifications structurelles subtiles est cruciale pour une intervention efficace ; cependant, les instruments diagnostiques traditionnels, tels que le système de notation de Kellgren-Lawrence (KL) et les indices cliniques comme WOMAC, sont contraints par la subjectivité et la variabilitéinter-observateurs 1.
Avec la disponibilité croissante de dépôts d’imagerie du genou à grande échelle tels que l’OAI et le MOST, les approches computationnelles pour l’évaluation objective du KOA ont pris de l’importance2. Les premières méthodes d’analyse radiographique basées sur des descripteurs artisanaux et une classification statistique montraient une robustesse limitée pour les données d’imagerie en hautedimension 2. Les cadres de modélisation plus récents basés sur l’image ont amélioré la sensibilité aux AKO en phase précoce, mais continuent de rencontrer des défis en matière d’interprétabilité clinique et de transparence décisionnelle.
L’analyse pilotée par l’IA peut détecter l’arthrose du genou tôt et sans chirurgie, ce qui réduit le besoin de radiographies répétées et l’impact environnemental des examens d’imagerie à grande échelle et de diagnostics surpapier 3. À ce jour, des modèles d’apprentissage automatique, tels que les arbres de décision et les forêts aléatoires, ont pu prédire le risque de précision au niveau WOMAC et KL (Figure 1) ; Cependant, ils ont eu du mal avec des données d’imagerie à hautedimensionnalité 4. Les architectures d’apprentissage profond, en particulier les CNN et les réseaux ResNet, automatisaient l’extraction des fonctionnalités et obtenaient une meilleure précision, mais elles étaient difficiles à comprendre. Les Transformation de la Vision (ViTs) ont apporté une compréhension contextuelle globale par l’attention à soi.
Le cadre DeciViT-F soutient les pratiques cliniques durables en créant des solutions de santé précises, compréhensibles et abordables. Cela aide les personnes en situation de handicap chronique et améliore leur qualité de vie, en particulier chez les personnes âgées. Il est explicable que la logique fuzzy-bayésienne favorise une utilisation éthique de l’IA, garantissant confiance, inclusivité et transparence dans la prise de décision clinique. Au final, cette approche conduira à un avenir meilleur, plus juste et plus respectueux de l’environnement pour nous tous.
Le cadre DeciViT-Knee 2025 est par la présente établi comme un pipeline hybride et interprétable pour répondre à ces problèmes. Il utilise ViT-B/16 pour la représentation profonde de l’image 2,4, des arbres de décision bayésiens pour une classification claire et probabiliste, et une couche d’inférencefloue 5 qui transforme l’incertitude en langage comprenable. Cette fusion en trois couches offre une grande précision diagnostique, une calibration solide et une interprétabilité au niveau du clinicien.
Revue de la littérature
Aucune recherche antérieure n’a complètement combiné l’extraction de caractéristiques basée sur ViT-B/16 avec les arbres de décision bayésiens pour un raisonnement probabiliste sur des données KOA multimodales. Des études récentes sur l’interprétabilité ont montré comment la logique floue peut aider à relier des nombres précis au raisonnement basé sur le langage. Les systèmes flous permettent des représentations partielles de vérité (par exemple, une légère perte de cartilage ou une présence limite d’ostéophytes), qui correspondent à l’incertitude fréquemment exprimée dans les évaluations radiologiques. Il a été démontré que les couches d’inférence floue diminuent la variabilité entre observateurs et améliorent l’interprétabilité clinique lorsqu’elles sont intégrées dans des réseauxprofonds 5,6,7,8,9,10. Mettre une couche fuzzy-bayésienne par-dessus des plongements ViT crée des frontières décisionnelles à la fois probabilistes et linguistiquement significatives. Cela transforme les activations abstraites en ensembles de règles que les gens peuvent comprendre, comme : SI l’amincissement du cartilage est modéré ET la variation d’intensité osseuse est élevée, ALORS le grade KL est probablement ≥ 2.
DeciViT-Knee 2025 vise à fournir une détection précoce, claire et reproductible des KOA grâce à un cadre ViT-Fuzzy-Bayésien optimisé pour une utilisation en milieu clinique. Cela comblera efficacement l’écart entre précision, interprétabilité et transparence linguistique.
L’approche suivante offre une description claire et répétable de chaque étape, de la mise en place de l’environnement et la préparation du jeu de données à l’entraînement, aux tests et à la visualisation du modèle. Cela aidera les chercheurs et les cliniciens à répéter et à développer ce travail pour un diagnostic précis des troubles musculosquelettiques
Choisir et mettre en place un modèle
Nous avons choisi le Transformation de Vision (ViT-B/16) comme principal extracteur de caractéristiques d’image car il peut utiliser l’auto-attention multi-têtes pour modéliser les relations contextuelles globales dans les imagesradiographiques 2,4,11. La structure ViT permet l’analyse simultanée à la fois des variations de texture à grain fin et des dépendances spatiales à longue portée, importantes pour distinguer les changements subtils d’arthrothrite à travers les grades KL 0-4, 2, 4, 12. Cela diffère des architectures basées sur CNN, qui utilisent des champs réceptifslocalisés 11.
Une couche d’inférence floue (FIL) a été ajoutée entre la sortie de l’embedding du transformateur et le classificateur probabiliste pour gérer l’incertitude liée à la gradation radiographique, en particulier pour les KOA borderline et précoce (Figure 2)13,14. Le beau-père transforme les activations d’immersion continue en ensembles flous qui ont du sens en termes de langage (par exemple, perte légère, modérée ou sévère de cartilage) et crée des degrés d’appartenance qui montrent à quel point le diagnostic est incertain 7,8. Cette conception facilite la compréhension en faisant correspondre les prédictions numériques avec les schémas de raisonnement qualitatif utiliséspar les radiologues 15.
Un ensemble d’arbres de décision bayésiens (BDTE) a été utilisé pour transformer les plongements de caractéristiques améliorées par flou en résultats de classification probabiliste afin que les prédictions soient précises et faciles à comprendre 16,17,18,19. Chaque arbre de l’ensemble calcule les probabilités postérieures et les intervalles de confiance, ce qui aide à définir des limites de décisionbien calibrées 13. Cette méthode combine la précision statistique de l’inférence bayésienne avec la clarté basée sur les règles des arbres de décision, donnant à chaque résultat diagnostique à la fois une certitude quantitative et une raison compréhensible de saréalisation 19.
Étalonnage par comparaison
Nous avons utilisé les mêmes divisions d’entraînement et de validation pour comparer systématiquement le pipeline hybride ViT + FIL + BDTE aux références CNN et ResNet-50. Nous avons utilisé la précision de la classification, l’AUC, le score Brier et l’interprétabilité évaluée par le clinicien sur une échelle de cinq points comme indicateurs de comparaison. L’utilisation de plusieurs bases de référence a permis de tester équitablement la généralisabilité du modèle, la cohérence de l’étalonnage et l’explicabilité entre architectures.