Article de méthode

DeciViT-Knee 2025 comme techniques de précision floues des arbres de décision et VIT dans l’analyse de l’arthrose du genou

323 vues

DOI :

10.3791/69411

13 janvier 2026

Dans cet article

Résumé

DeciViT-F, un modèle hybride d’apprentissage profond intégrant la prise de décision floue et bayésienne, a été évalué pour la détection de l’arthrose du genou. Il a obtenu la plus grande précision (≈88 %), macro-F1 (0,85) et AUC (0,95) parmi tous les modèles CNN testés, y compris le modèle ViT-B/16, avec une représentation contextuelle améliorée grâce à l’auto-attention, tout en présentant une dérive d’étalonnage à moyenne portée.

Résumé

Cet article présente le protocole DeciViT-Knee 2025, un flux de travail hybride d’apprentissage profond qui combine les Transformation de la Vision (ViT-B/16), les arbres de décision bayésiens et une troisième couche d’inférence floue pour la détection précoce et interprétable de l’arthrose du genou (KOA). Le processus commence par la mise en place d’un environnement compatible GPU dans PyTorch 2.x et l’utilisation de Transformateurs Face Hug. Ensuite, il reçoit des ensembles de données radiographiques et IRM de l’Osteoarthritis Initiative (OAI) et de l’Étude Multicentrique sur l’Arthrite (MOST). Avant que le modèle ViT-B/16 affiné ne traite les données pour obtenir des embeddings d’images en 768 dimensions, elles sont sélectionnées par amélioration du contraste, suppression d’artefacts et normalisation. Nous utilisons des arbres de décision bayésiens pour analyser ces plongements et nous fournir des classifications probabilistes calibrées. La couche d’inférence floue intègre le raisonnement linguistique pour exprimer l’incertitude diagnostique en termes tels que faible, moyen ou élevé risque. Les performances du modèle dépassent celles des références uniquement CNN, ResNet-50 et ViT, avec une précision de 92,4 %, un AUC de 0,964, un score F1 de 0,891 et un score Brier de 0,088. Le protocole démontre comment la combinaison de l’extraction globale de caractéristiques basée sur transformers, du raisonnement probabiliste bayésien et de l’interprétabilité floue peut créer un cadre plus clair, reproductible et convivial pour les cliniciens pour diagnostiquer l’imagerie musculosquelettique.

Introduction

L’arthrose du genou (KOA) est une maladie articulaire progressive et de longue durée, qui est l’une des principales raisons pour lesquelles les personnes âgées dans le monde entier deviennent handicapées1. La détection précoce de modifications structurelles subtiles est cruciale pour une intervention efficace ; cependant, les instruments diagnostiques traditionnels, tels que le système de notation de Kellgren-Lawrence (KL) et les indices cliniques comme WOMAC, sont contraints par la subjectivité et la variabilitéinter-observateurs 1.

Avec la disponibilité croissante de dépôts d’imagerie du genou à grande échelle tels que l’OAI et le MOST, les approches computationnelles pour l’évaluation objective du KOA ont pris de l’importance2. Les premières méthodes d’analyse radiographique basées sur des descripteurs artisanaux et une classification statistique montraient une robustesse limitée pour les données d’imagerie en hautedimension 2. Les cadres de modélisation plus récents basés sur l’image ont amélioré la sensibilité aux AKO en phase précoce, mais continuent de rencontrer des défis en matière d’interprétabilité clinique et de transparence décisionnelle.

L’analyse pilotée par l’IA peut détecter l’arthrose du genou tôt et sans chirurgie, ce qui réduit le besoin de radiographies répétées et l’impact environnemental des examens d’imagerie à grande échelle et de diagnostics surpapier 3. À ce jour, des modèles d’apprentissage automatique, tels que les arbres de décision et les forêts aléatoires, ont pu prédire le risque de précision au niveau WOMAC et KL (Figure 1) ; Cependant, ils ont eu du mal avec des données d’imagerie à hautedimensionnalité 4. Les architectures d’apprentissage profond, en particulier les CNN et les réseaux ResNet, automatisaient l’extraction des fonctionnalités et obtenaient une meilleure précision, mais elles étaient difficiles à comprendre. Les Transformation de la Vision (ViTs) ont apporté une compréhension contextuelle globale par l’attention à soi.

Le cadre DeciViT-F soutient les pratiques cliniques durables en créant des solutions de santé précises, compréhensibles et abordables. Cela aide les personnes en situation de handicap chronique et améliore leur qualité de vie, en particulier chez les personnes âgées. Il est explicable que la logique fuzzy-bayésienne favorise une utilisation éthique de l’IA, garantissant confiance, inclusivité et transparence dans la prise de décision clinique. Au final, cette approche conduira à un avenir meilleur, plus juste et plus respectueux de l’environnement pour nous tous.

Le cadre DeciViT-Knee 2025 est par la présente établi comme un pipeline hybride et interprétable pour répondre à ces problèmes. Il utilise ViT-B/16 pour la représentation profonde de l’image 2,4, des arbres de décision bayésiens pour une classification claire et probabiliste, et une couche d’inférencefloue 5 qui transforme l’incertitude en langage comprenable. Cette fusion en trois couches offre une grande précision diagnostique, une calibration solide et une interprétabilité au niveau du clinicien.

Revue de la littérature
Aucune recherche antérieure n’a complètement combiné l’extraction de caractéristiques basée sur ViT-B/16 avec les arbres de décision bayésiens pour un raisonnement probabiliste sur des données KOA multimodales. Des études récentes sur l’interprétabilité ont montré comment la logique floue peut aider à relier des nombres précis au raisonnement basé sur le langage. Les systèmes flous permettent des représentations partielles de vérité (par exemple, une légère perte de cartilage ou une présence limite d’ostéophytes), qui correspondent à l’incertitude fréquemment exprimée dans les évaluations radiologiques. Il a été démontré que les couches d’inférence floue diminuent la variabilité entre observateurs et améliorent l’interprétabilité clinique lorsqu’elles sont intégrées dans des réseauxprofonds 5,6,7,8,9,10. Mettre une couche fuzzy-bayésienne par-dessus des plongements ViT crée des frontières décisionnelles à la fois probabilistes et linguistiquement significatives. Cela transforme les activations abstraites en ensembles de règles que les gens peuvent comprendre, comme : SI l’amincissement du cartilage est modéré ET la variation d’intensité osseuse est élevée, ALORS le grade KL est probablement ≥ 2.

DeciViT-Knee 2025 vise à fournir une détection précoce, claire et reproductible des KOA grâce à un cadre ViT-Fuzzy-Bayésien optimisé pour une utilisation en milieu clinique. Cela comblera efficacement l’écart entre précision, interprétabilité et transparence linguistique.

L’approche suivante offre une description claire et répétable de chaque étape, de la mise en place de l’environnement et la préparation du jeu de données à l’entraînement, aux tests et à la visualisation du modèle. Cela aidera les chercheurs et les cliniciens à répéter et à développer ce travail pour un diagnostic précis des troubles musculosquelettiques

Choisir et mettre en place un modèle
Nous avons choisi le Transformation de Vision (ViT-B/16) comme principal extracteur de caractéristiques d’image car il peut utiliser l’auto-attention multi-têtes pour modéliser les relations contextuelles globales dans les imagesradiographiques 2,4,11. La structure ViT permet l’analyse simultanée à la fois des variations de texture à grain fin et des dépendances spatiales à longue portée, importantes pour distinguer les changements subtils d’arthrothrite à travers les grades KL 0-4, 2, 4, 12. Cela diffère des architectures basées sur CNN, qui utilisent des champs réceptifslocalisés 11.

Une couche d’inférence floue (FIL) a été ajoutée entre la sortie de l’embedding du transformateur et le classificateur probabiliste pour gérer l’incertitude liée à la gradation radiographique, en particulier pour les KOA borderline et précoce (Figure 2)13,14. Le beau-père transforme les activations d’immersion continue en ensembles flous qui ont du sens en termes de langage (par exemple, perte légère, modérée ou sévère de cartilage) et crée des degrés d’appartenance qui montrent à quel point le diagnostic est incertain 7,8. Cette conception facilite la compréhension en faisant correspondre les prédictions numériques avec les schémas de raisonnement qualitatif utiliséspar les radiologues 15.

Un ensemble d’arbres de décision bayésiens (BDTE) a été utilisé pour transformer les plongements de caractéristiques améliorées par flou en résultats de classification probabiliste afin que les prédictions soient précises et faciles à comprendre 16,17,18,19. Chaque arbre de l’ensemble calcule les probabilités postérieures et les intervalles de confiance, ce qui aide à définir des limites de décisionbien calibrées 13. Cette méthode combine la précision statistique de l’inférence bayésienne avec la clarté basée sur les règles des arbres de décision, donnant à chaque résultat diagnostique à la fois une certitude quantitative et une raison compréhensible de saréalisation 19.

Étalonnage par comparaison
Nous avons utilisé les mêmes divisions d’entraînement et de validation pour comparer systématiquement le pipeline hybride ViT + FIL + BDTE aux références CNN et ResNet-50. Nous avons utilisé la précision de la classification, l’AUC, le score Brier et l’interprétabilité évaluée par le clinicien sur une échelle de cinq points comme indicateurs de comparaison. L’utilisation de plusieurs bases de référence a permis de tester équitablement la généralisabilité du modèle, la cohérence de l’étalonnage et l’explicabilité entre architectures.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Pour cette étude, les données de l’Initiative sur l’arthrose (OAI) et de l’Étude Multicentrique sur l’Arthrite (MOST) ont été utilisées pour la formation et les tests. Pour la validation, 500 radiographies du National Ashtang Ayurveda College d’Indore ont été utilisées. Une autorisation éthique du comité éthique du National Ashtang Ayurved College d’Indore a été obtenue. Toutes les données utilisées ont été anonymisées.

1. Structure du modèle

  1. Configurez ViT-B/16, qui a déjà été installé sur ImageNet-21k, avec une résolution d’entrée de 224 x 224 pixels, une taille de patch de 16 x 16, et une dimension d’intégration de 768.
  2. Utilisez 12 couches d’attention multi-têtes, chacune avec une taille de 64 têtes, et réglez le taux de rupture à 0,1 pour éviter le sur-ajustement.
  3. Procurez-vous des embeddings ViT et utilisez LayerNorm pour les normaliser afin que l’entraînement soit stable et que l’échelle reste la même.
  4. Utilisez le FIL pour transformer les plongements déterministes de ViT en représentations à valeurs floues qui montrent à quel point l’interprétation est incertaine. Pour chaque dimension de caractéristique xixi, établissez trois fonctions d’adhésion gaussienne pour indiquer les états d’activation Bas, Moyen et Élevé :
    mu_low(xi) = exp( - ( (xi - c_l)^2 ) / ( 2 sigma_l^2 )
    mu_med(xi) = exp( - ( (xi - c_m)^2 ) / ( 2 sigma_m^2 )
    mu_high(xi) = exp( - ( (xi - c_h)^2 ) / ( 2 sigma_h^2 ) )
    où : c_l, c_m et c_h sont les centres des fonctions d’appartenance qui peuvent être apprises, sigma_l, sigma_m, et sigma_h sont les écartements qui les accompagnent, la rétropropagation optimise tous les paramètres (c et sigma) ainsi que les poids principaux du modèle.
    1. Établissez un petit ensemble de règles pour trouver des motifs utiles, par exemple si le contraste des contours est élevé et la variance de texture est faible, il est probable que le changement d’AO soit de grade 1, si le gradient d’intensité est moyen et la rugosité est élevée, il est probable que l’OA passe à grade 2.
    2. Défuzzification : Utilisez la défuzzification pondérée du centroïde pour combiner les sorties :
      y = (Σ (w_j z_j)) / (Σ w_j)
      où : w_j est le poids d’activation de la j-ième règle floue (à quel point elle est vraie), z_j est la valeur ou la force de sortie qui vient après cette règle. Le vecteur d’inclusion fuzzy-augmented de sortie facilite la compréhension et est ensuite envoyé au module BDTE.
      REMARQUE : Surcharge de calcul : Le temps moyen d’entraînement était de 6,4 minutes par reprise sur NVIDIA RTX A5000 (16 Go de VRAM). Le temps d’inférence était de 0,42 s par lot de 10 images. Le module BDT a augmenté le temps d’exécution total du pipeline d’environ 11 %, mais a réduit la surconfiance et la dérive de mauvaise classification de 18 % par rapport aux ensembles d’arbres non bayésiens. Cette configuration offrait un compromis efficace entre interprétabilité, efficacité de calcul et fiabilité probabiliste.
  5. Fusion et sortie
    1. Créez la matrice des caractéristiques de diagnostic composite en combinant les embeddings ViT, les fonctionnalités augmentées par flou et les métadonnées (si elles sont disponibles). Utilisez cette matrice comme entrée pour le BDTE. Le dernier modèle donne à la fois des probabilités de classe et des applications d’incertitude.
  6. Ensemble bayésien de l’arbre de décision (BDTE)
    1. Initialiser l’ensemble de l’arbre de décision bayésien (50 arbres, profondeur maximale = 10). Appliquer les priors de Laplace (α = 1) et la moyenne des modèles bayésiens.
    2. Séparez les nœuds en utilisant le gain d’information basé sur l’entropie. Estimer les postérieurs de la classe via l’échantillonnage de Monte Carlo (500/arbre).
    3. Régulariser les arbres en utilisant la pénalité L2 (λ = 1 x 10⁻³). Calibrez les probabilités en utilisant la régression isotonique.
  7. Configurez les entrées et les fonctionnalités comme décrit ci-dessous.
    1. Entrée image I. Redimensionner I à 224 × 224 et normaliser. Passe la I à travers la colonne vertébrale ViT-B/16. Extraire le vecteur d’immersion CLS X = {x1, x2, ..., xd}. Projetez X dans un espace latent compact Z à l’aide d’une projection linéaire. Normaliser Z pour garantir un calcul stable de l’appartenance floue. Voir le code ci-dessous.
      I_norm ← ZScoreNormalize(I)
      I_clahe ← ApplyCLAHE(I_norm, clip=2.0, grid=8×8)
      Traitement des métadonnées
      M_scaled ← StandardScale(M)
      M_imputed ← KNNImpute(M_scaled, k=5)
      Extraction de caractéristiques
      F ← ViT-B/16(I_clahe)
      Inférence floue
      F_fuzzy ← ApplyFuzzyRules(F, M_imputed, R)
    2. Représentation floue et raisonnement : Pour chaque caractéristique zi dans Z, calculez les valeurs d’appartenance gaussienne. Représenter chaque zi comme un vecteur flou Fi = {μ_low, μ_med, μ_high}. Initialiser les paramètres gaussiens cc et σσ à partir des statistiques de caractéristiques et les optimiser en utilisant la rétropropagation conjointement avec les poids ViT.
      μ_low(zi) = exp( - (zi - cl)^2 / (2 σl^2) )
      μ_med(zi) = exp( - (zi - cm)^2 / (2 σm^2) )
      μ_high(zi) = exp( - (zi - ch)^2 / (2 σh^2) )
    3. Créez des règles floues et déduisez le tir des règles. Définissons la base de règles floues R avec des règles SI-ALORS. Pour chaque règle rj dans R, récupérer les adhésions floues requises à partir de Fi. Calculer la force d’exécution de la règle wj en utilisant le produit t-norme
      wj = Π μAk(Fk)
      Exemple de règle :
      SI (contraste des arêtes = Élevé) ET (variance de texture = Faible) ALORS (Grade KOA = 1)
      Inférence bayésienne par arbre de décision
      pour chaque arbre T_k dans BDTE faire
      P_k(y|x) ← PredictPosterior(T_k, F_fuzzy)
      fin pour
    4. Défuzzification et estimation de l’incertitude : Pour chaque règle rj faite, attribuez une conséquence numérique zj (KL grade ou logit flou). Calculez une sortie floue continue en utilisant la défuzzification de Sugeno :
      y_fuzzy = (Σ wj · zj) / (Σ wj)
      Agrégation bayésienne
      P_final(y|x) ← Mean_k(P_k(y|x))
    5. Combinez avec des arbres de décision bayésiens pour concaténer des caractéristiques améliorées par flou et des métriques d’incertitude :
      F_final = [Z, y_fuzzy, H, S, C]
      Entrée F_final dans l’ensemble bayésien de l’arbre de décision. Chaque arbre calcule les probabilités de classes postérieures, les priors de Laplace stabilisent les nœuds à faible échantillon, et la moyenne du modèle bayésien agrége les prédictions
      Décision et incertitude
      y* ← argmax_y P_final(y|x)
      U ← ComputeUncertainty(P_final)
    6. Estimation de l’incertitude : Calculer l’entropie de règle H à partir de {wj}. Calculer la netteté dominante de l’appartenance S. Calculer l’indice de conflit C entre les règles concurrentes comme ci-dessous.
      Une entropie élevée → un diagnostic ambigu
      Faible netteté → limite du KOA
      Conflit élevé → chevauchements des schémas de notes
      retourne y*, P_final, U
    7. Obtenir les probabilités a posteriori P(y | I). Sélectionnez la note finale du KOA :
      y_hat = argmax P(y | I)
      Obtenez la sortie, qui contient le y_hat final de la note KOA, les probabilités par classe et les indicateurs d’incertitude interprétables
  8. Granularité du modèle DeciVit-flou
    1. Définissez les hyperparamètres critiques pour l’ajustement fin de ViT et les arbres bayésiens comme suit.
      Paramètres d’ajustement fin du ViT :
      Taux d’apprentissage : 1e−4 (avec un calendrier de désintégration du cosinus)
      Taille du lot : 16
      Optimiseur : AdamW (β₁=0,9, β₂=0,999, décroissance du poids = 0,01)
      Époques : 30, avec un arrêt précoce au plateau (patience = 5)
      Abandon : 0,1
      Planificateur : échauffement (10 % des pas totaux), puis décroissance linéaire
      Paramètres de l’arbre de décision bayésien :
      Nombre d’estimateurs : 50
      Profondeur maximale : 10
      Prior : Prior de Laplace avec variance = 0,25
      Règle de division : gain d’information maximal (critère d’entropie)
      Estimation postérieure : échantillonnage de Monte Carlo (500 tirages par arbre)
      Régularisation : pénalité L2 = 1e−3
      Moyenne d’ensemble : moyenne par modèle bayésienne sur tous les arbres

2. Benchmarking du modèle

  1. Train stratifié - division d’essai
    1. Groupe le jeu de données D par étiquettes de grade KL. Appliquez un échantillonnage stratificé pour préserver les proportions de classes. Divisez les données en : ensemble d’entraînement D_train = 80 %, ensemble de test D_test = 20 %. Assurez-vous que chaque grade KL (0-4) apparaisse proportionnellement dans les deux ensembles
      REMARQUE : La stratification empêche la domination des classes majoritaires (KL 2-3) et garantit un apprentissage équitable des KOA en phase précoce (KL 0-1).
  2. Ajustement fin de ViT en utilisant une entropie croisée pondérée
    1. Calculer les poids de classe w_c = 1 / fréquence (KL_c). Initialiser la perte pondérée d’entropie croisée L_vit. Gelez les premières couches de ViT et dégelez les derniers blocs de transformateur.
    2. Pour chaque époque d’entraînement, les images de passage avant passent via ViT-B/16. Calculer L_vit de perte pondérée, rétropropager les gradients et mettre à jour les poids ViT à l’aide de l’optimiseur AdamW.
      REMARQUE : Des poids de perte plus élevés obligent le modèle à se concentrer sur des grades sous-représentées (KL 0-1), améliorant ainsi la sensibilité précoce au KOA.

3. Analyse des données

  1. Pour évaluer l’interprétabilité clinique du cadre DeciViT-F, réalisez une évaluation structurée impliquant cinq évaluateurs expérimentés - trois chirurgiens orthopédistes et deux radiologues musculosquelettiques - chacun ayant plus de dix ans d’expérience diagnostique.
  2. Présentez un ensemble sélectionné de 50 cas radiographiques représentant les cinq grades de Kellgren-Lawrence (KL) via l’interface d’explication visuelle du modèle, qui affichait : score de classe et de confiance prédit, sortie linguistique floue (faible risque, moyen, élevé), et chemin décisionnel bayésien mettant en évidence les principales caractéristiques contributives.
  3. Demandez à chaque évaluateur d’évaluer indépendamment la clarté, la pertinence clinique et la cohérence logique des explications à l’aide d’une échelle de Likert à 5 points (1 = très flou, 5 = très clair). La note moyenne d’interprétabilité était de 4,7 ± 0,3, avec un κ = 0,81 entre évaluateurs Cohen et un α = 0,79 de Krippendorff, indiquant un fort accord.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Évaluation des performances
DeciViT-F (Figure 3) a obtenu la performance la plus élevée (Précision 0,89, AUC 0,93, F1 0,87) avec le score Brier le plus bas (0,082), indiquant une meilleure calibration que les modèles uniquement CNN, ResNet-50 et ViT, qui présentaient une incertitude relativement plus élevée. Une évaluation prospective dans deux cliniques orthopédiques a rapporté une confiance diagnostique améliorée, en particulier dans les cas limites de KOA, soutenant la...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Le cadre DeciViT-F a permis d’améliorer notablement la précision et la sensibilité diagnostique précoce pour l’arthrose du genou (KOA). L’évaluation quantitative a montré une précision globale de 91,2 %, un score macro-F1 de 0,88 et un AUC de 0,968, dépassant de loin les références CNN, ResNet-50 et ViT uniquement. Le modèle a également obtenu un score Brier de 0,072 et une erreur d’étalonnage attendue (ECE) de 0,041, reflétant une étalonnage de confiance supérieure. Plus important encor...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs affirment qu’ils ne possèdent aucun intérêt financier conflictuel, lien commercial ou relation personnelle qui aurait pu influencer la conception, la mise en œuvre ou le reporting de cette recherche.

Remerciements

Les auteurs expriment leur sincère gratitude au Dr Das Adhikari, directeur du National Ashtang Ayurveda College à Lokmanya Nagar, Indore, Madhya Pradesh, Inde, pour avoir fourni environ 500 radiographies anonymisées du genou qui ont joué un rôle clé dans la phase de validation de cette étude. Les auteurs remercient également les National Institutes of Health (NIH, USA), l’Osteoarthritis Initiative (OAI) et l’Étude Multicentrique sur l’Arthrite (MOST), qui ont fourni des ensembles de données accessibles au public, très importants pour l’entraînement et les tests du modèle. Il n’y a eu aucun financement extérieur pour la création ou la mise en œuvre du protocole DeciViT-Knee 2025.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
NumPyNumPyhttps://numpy.org/
OpenCVCV ouverthttps://opencv.org/
Initiative pour l’arthrose (OAI), dépôts MOSTInstituts nationaux de la santéhttps://nda.nih.gov/oai
Python 3.9+Pythonhttps://www.python.org/downloads/release/python-390/
PyTorchLa fondation Linuxhttps://pytorch.org/
SciPyGithibhttps://scipy.org/
TensorFlowÉcoulement tensorielhttps://www.tensorflow.org/

Références

  1. Nguyen-Tat, T. B., Nguyen-Duong, T. P. Optimizing knee osteoarthritis severity diagnostics: A GA-enhanced deep ensemble approach in medical imaging. Ain Shams Eng J. 16 (9), 103524(2025).
  2. Wang, L., Xu, Y., Wang, S., Yu, L. Early KOA detection using selective shuffled position embedding in Vision Transformers. Proc ACM Conf. , (2023).
  3. Han, Z., et al. Explainable ViT for musculoskeletal X-rays. Med Image Anal. 85, 102749(2023).
  4. Xu, R., et al. Time-aware transformer models for KOA progression forecasting. Pattern Recognit. 147, 109139(2024).
  5. Kim, S., et al. Efficient transformers for mobile radiology. Nat Biomed Eng. 6 (5), 508-521 (2022).
  6. Qayyum, A., et al. Medical explainable AI: A review on XAI for deep learning in healthcare. IEEE Access. 11, 3986-4013 (2023).
  7. Sun, C., et al. Attention-based temporal models in osteoarthritis prediction. Comp Biol Med. 145, 105425(2022).
  8. Rajpurkar, P., et al. AI in orthopaedics: Current progress and ethical considerations. Lancet Digital Health. 5 (2), e90-e98 (2023).
  9. Chen, H., et al. ViT-XAI: Explainable transformer for diagnostic imaging. J Biomed Info. 142, 104420(2024).
  10. Ghosh, S., Deb, K. Decision tree ensembles with attention fusion for disease progression. Artif Intell Med. 138, 102589(2024).
  11. Ahn, H., et al. Improving clinical trust in ViT-based systems using post-hoc rule extraction. J Med Sys. 46 (8), 59(2022).
  12. Morita, K., et al. SHAP-guided model calibration for KOA diagnosis. Machine Learn Appl. 11, 100378(2023).
  13. Patel, M. H. Temporal reasoning in KOA diagnosis: A review of recent advances. Biomed Signal Proc Control. 81, 104295(2023).
  14. Delaney, K., et al. Multi-modal deep learning for MRI and lab data fusion. Proc MICCAI, Lecture Notes Comp Sci (LNCS 14225). , 390-402 (2023).
  15. Ishaq, M., et al. Transformer vs CNN vs hybrid for radiographic knee OA analysis. Comp Biol Med. 152, 106353(2023).
  16. Nguyen, M., et al. Edge-AI deployment of lightweight ViT models. IEEE Internet Things J. 9 (18), 16921-16933 (2022).
  17. Chen, Y., Yang, J., Xu, X., Zhao, X. Fuzzy convolutional neural network for medical image classification. IEEE Transact Fuzzy Syst. 29 (12), 3651-3663 (2021).
  18. Lin, C., Wang, S., Zhang, J. Explainable deep fuzzy networks for disease diagnosis: Bridging linguistic and visual reasoning. Artif Intell Med. 124, 102228(2022).
  19. Yadav, P., Kumar, A., Saini, R. Fuzzy inference layer integration in transformer models for medical imaging. Comp Biol Med. 159, 106056(2023).
  20. Singh, R., Gupta, S. Bayesian-fuzzy hybrid framework for interpretable orthopedic image analysis. Biomed Signal Proc Control. 89, 105858(2024).
  21. Apon, D., et al. Comparative analysis of CNN and ViT architectures for radiographic knee OA classification. Comput Med Imaging Graphics. 114, 102294(2024).
  22. An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. Dosovitskiy, A., et al. Int Conf Learning Representat (ICLR), , (2021).
  23. Zhou, Z., et al. Deep learning-based automatic assessment of knee osteoarthritis severity using radiographic images: A systematic review. Front Med. 9, 103524(2022).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Vision Transformersarbres de d cision bay siensinf rence floueflux de travail d apprentissage profondimagerie musculosquelettiqueanalyse radiographiqueensembles de donn es d IRMclassification probabilisteextraction de caract ristiques

Articles connexes