Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Un protocole reproductible pour développer et évaluer des cadres d’intelligence artificielle explicables dans l’analyse des soins de santé

93 vues

DOI :

10.3791/71999

31 juillet 2026

Dans cet article

Résumé

Ici, nous présentons un protocole reproductible pour développer et évaluer des modèles d’intelligence artificielle explicables pour l’analyse de la santé. Le flux de travail intègre le prétraitement des données, la modélisation prédictive, l’explicabilité basée sur SHAP, LIME- et Grad-CAM, l’évaluation quantitative et la validation centrée sur l’humain pour soutenir une prise de décision clinique transparente et fiable.

Résumé

L’Intelligence Artificielle Explicable (XAI) est de plus en plus reconnue comme un outil indispensable pour construire des systèmes d’IA fiables dans le secteur de la santé, où la transparence et la capacité à expliquer les décisions sont des éléments essentiels de la prise de décision clinique. Cette publication présente une approche expérimentale reproductible pour développer et évaluer des systèmes d’IA explicables pour l’analyse des soins de santé. Le pipeline développé intègre les étapes de prétraitement des données, de modélisation prédictive, de génération d’interprétation et d’évaluation en un seul flux de travail fluide pouvant être appliqué à la fois aux données cliniques structurées et aux ensembles de données d’imagerie médicale. Les modèles d’apprentissage automatique en ensemble ont démontré de fortes performances prédictives sur des ensembles de données tabulaires structurés, tandis que les modèles d’apprentissage profond sont efficaces pour apprendre des motifs complexes dans les données d’imagerie médicale. Des techniques telles que SHAP, LIME et Grad-CAM sont des explications globales et locales qui facilitent l’interprétation du modèle. Très utile. L’évaluation quantitative du cadre couvre de nombreux indicateurs différents tels que la précision, la précision, la rappel, le score F1, le ROC-AUC, les indicateurs d’explication, la fidélité et la stabilité. Les résultats indiquent que lorsque les conditions expérimentales sont contrôlées, le cadre a démontré une amélioration des performances prédictives et de la qualité de l’explication dans les conditions expérimentales évaluées. En tant que document guidé par un protocole, ce travail soutient la reproductibilité et la scalabilité, la mise en œuvre persistante par d’autres êtres vivants. Ce modèle d’IA transparent et compréhensible est la base sur laquelle le soutien à la prise de décision clinique et les systèmes d’analyse en santé gagnent confiance et utilisation à grande échelle.

Introduction

L’intelligence artificielle (IA) est devenue un élément important des soins de santé modernes en soutenant le diagnostic, le pronostic, la stratification des risques, l’analyse d’images médicales et la prise de décision clinique1. Les avancées en apprentissage automatique et en apprentissage profond ont permis aux systèmes de santé de traiter de grands volumes de données structurées et non structurées, atteignant souvent des performances prédictives comparables ou supérieures aux approches statistiquesconventionnelles 2. Malgré ces avancées, de nombreux modèles d’IA fonctionnent comme des systèmes complexes en boîte noire, rendant difficile pour les cliniciens et les acteurs du secteur de la santé de comprendre comment les prédictions sontgénérées 3. Ce manque de transparence peut limiter la confiance, l’adoption et la responsabilité dans les environnements de santé à enjeuxélevés 4,5.

L’intelligence artificielle explicable (XAI) s’est imposée comme une approche prometteuse pour améliorer la transparence et l’interprétabilité des modèles d’apprentissageautomatique 6. Les techniques d’explication largement utilisées, notamment SHAP (explications additives de Shapley), LIME (explications locales interprétables agnostiques au modèle) et la cartographie d’activation des classes pondérée par gradient (Grad-CAM), fournissent des éclairages sur le comportement des modèles grâce à l’attribution de caractéristiques et aux mécanismes d’explicationvisuelle 7,8,9. Ces méthodes ont été de plus en plus appliquées aux applications de santé pour soutenir l’interprétation clinique, l’audit de modèles et le supportdécisionnel 10,11. Cependant, l’explicabilité seule ne garantit pas la fiabilité, la reproductibilité ou l’utilité clinique. Des études récentes ont mis en lumière des défis liés à l’instabilité des explications, à la sensibilité aux perturbations, à la validation limitée par les cliniciens et aux incohérences entre les résultats explicatifs et le raisonnement véritablementdu modèle 12,13,14,15.

Outre les défis d’explicabilité, la reproductibilité reste une préoccupation majeure dans la recherche en apprentissage automatique en santé 16,17,18. De nombreuses études publiées fournissent des informations limitées concernant les procédures de prétraitement, les environnements logiciels, les configurations d’hyperparamètres, les stratégies de validation et les flux de travail d’implémentation, rendant la réplication indépendante difficile 19,20,21. De plus, les études sur l’IA de santé se concentrent fréquemment sur la performance prédictive tout en fournissant des orientations limitées concernant l’évaluation de la qualité de l’explication, l’évaluation centrée sur le clinicien et les considérations pratiquesde mise en œuvre 22. Ces limitations peuvent entraver la traduction de systèmes d’IA explicables des environnements de recherche vers des environnements de santéréels 23,24,25,26,27.

Les flux de travail XAI actuels en santé évaluent souvent les techniques d’explication individuelle ou les modèles prédictifs isolément et fournissent rarement des protocoles standardisés intégrant la préparation des données, la modélisation prédictive, l’évaluation de l’explicabilité, l’évaluation centrée sur l’humain et les ressources dereproductibilité 28,29,30,31 . Par conséquent, chercheurs et praticiens peuvent rencontrer des difficultés pour reproduire des flux de travail, comparer les méthodes d’explication ou évaluer l’utilité pratique des systèmes d’IA explicables dans différents ensembles de données et domaines d’application de la santé. Un protocole complet et reproductible est donc nécessaire pour faciliter la mise en œuvre, l’évaluation et le reporting cohérents des flux de travail explicables en IAen santé 32,33,34,35.

Ici, nous présentons un protocole reproductible pour développer, évaluer et interpréter des systèmes d’intelligence artificielle explicables dans l’analyse de la santé. Le protocole intègre le prétraitement des données, la modélisation prédicative, l’évaluation de l’explicabilité utilisant SHAP, LIME et Grad-CAM, l’évaluation centrée sur le clinicien, des procédures de validation et des ressources de reproductibilité au sein d’un flux de travail unifié. L’objectif est de fournir un cadre standardisé qui soutient le développement transparent de modèles, l’évaluation de la qualité des explications et la mise en œuvre reproductible à travers divers ensembles de donnéesde santé 36, 37, 38, 39. La contribution méthodologique de ce travail réside dans l’intégration de l’analytique prédicative, de l’évaluation de l’explicabilité, de la validation par les cliniciens et des pratiques de reproductibilité dans un protocole unique adapté à la recherche, à l’éducation et aux études orientées déploiement en IAen santé 40,41,42,43.

La contribution principale de ce travail n’est pas le développement d’un nouvel algorithme d’explicabilité.

Il fournit plutôt un protocole standardisé, reproductible et validé expérimentalement qui intègre la modélisation prédictive, l’évaluation de l’explicabilité, la visualisation, l’évaluation et l’interprétation centrée sur l’humain dans un flux de travail unifié adapté à l’analyse de santé et à la diffusion de protocoles basés sur JoVE. L’objectif principal de ce travail n’est pas d’introduire un nouvel algorithme prédictif, mais de fournir un protocole standardisé, reproductible et validé expérimentalement pour mettre en œuvre des flux de travail d’intelligence artificielle explicables dans l’analyse de la santé. Le protocole intègre le prétraitement des données, la modélisation prédictive, l’évaluation de l’explicabilité, l’évaluation centrée sur le clinicien et les ressources de reproductibilité dans un cadre unifié adapté à l’adoption, à la réplication et à la diffusion éducative.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Tous les ensembles de données utilisés dans cette étude ont été obtenus à partir de dépôts publics et entièrement anonymisés, y compris le dépôt UCI Machine Learning, la base de données PhysioNet MIMIC-III et les jeux de données de radiographies thoraciques du NIH. Aucune information identifiable du patient n’a été consultée. L’étude a respecté les directives institutionnelles d’éthique de la recherche pour l’analyse secondaire des données dé-identifiées publiques. L’approbation formelle du Conseil d’Éthique Institutionnelle n’était pas requise car aucun participant humain n’a été recruté directement et aucune information de santé protégée n’a été utilisée.

1. Aperçu des cadres expérimentaux

  1. Développer un pipeline d’intelligence artificielle (XAI) reproductible et explicable pour des analyses de santé transparentes. Organisez le flux de travail en couche données, couche prétraitement, couche modélisation, couche explicabilité, couche d’évaluation et couche de visualisation.
  2. Intégrez ces modules dans un flux de travail unifié capable de traiter des données cliniques structurées, des dossiers médicaux électroniques et des ensembles de données d’imagerie médicale.
  3. Assurez-vous que chaque module contribue à la reproductibilité, à l’interprétabilité, à l’évolutivité et à l’exécution expérimentale standardisée.
  4. Concevez l’architecture modulaire pour supporter le flux continu de données et garantir que chaque étape du pipeline contribue à la reproductibilité, à l’interprétabilité et à l’évolutivité tout au long du flux de travail expérimental.

2. Environnement de calcul et configuration du système

  1. Installez les dépendances logicielles requises avant d’exécuter le flux de travail en ouvrant un terminal en ligne de commande et en exécutant la commande suivante :
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Vérifiez l’installation réussie de tous les logiciels et confirmez la compatibilité avec les versions logicielles indiquées dans le tableau des matériaux avant de procéder au prétraitement des données et au développement du modèle.
  3. Utilisez Python 3.11 comme environnement de programmation principal. Installer et configurer NumPy 1.26 et Pandas 2.1 pour les tâches de manipulation des données et d’ingénierie de fonctionnalités. Installez Scikit-learn 1.5 pour le développement et l’évaluation de modèles d’apprentissage automatique.
  4. Installez TensorFlow 2.15 pour l’entraînement et l’inférence de modèles en apprentissage profond. Installez SHAP 0.46 et LIME 0.2.0 pour une analyse d’explicabilité. Installez OpenCV 4.10 pour les tâches de traitement d’image. Installez Matplotlib 3.9 et Seaborn 0.13 pour la visualisation des données et le reporting des résultats. Consultez le tableau des matériaux pour les spécifications logicielles complètes et les détails d’implémentation nécessaires à la reproductibilité.
  5. Configurez l’environnement de calcul à l’aide d’une station de travail équipée d’un processeur multi-cœur, d’une accélération GPU (GPU) et de ressources mémoire suffisantes pour accueillir de grands ensembles de données de santé et des charges de travail en apprentissage profond.
  6. Définir des graines aléatoires fixes pour le partitionnement des données, l’initialisation du modèle et les procédures d’entraînement afin d’assurer la reproductibilité entre les exécutions expérimentales. Activez les mécanismes de journalisation pour enregistrer les opérations de prétraitement des données, les configurations de modèles, les paramètres d’hyperparamètres, les procédures d’entraînement et les résultats d’évaluation tout au long du flux de travail.
  7. Configurez les architectures des modèles, les paramètres d’optimisation, les taux d’apprentissage, la taille des lots, les paramètres d’entraînement et les valeurs des hyperparamètres selon les spécifications résumées dans le tableau 1. Respectez ces paramètres lors des expériences de réplication afin d’assurer la cohérence avec les résultats rapportés.
  8. Sortie Attendue – Un environnement informatique entièrement configuré et reproductible avec tous les logiciels nécessaires, les ressources matérielles, les mécanismes de journalisation et les paramètres de configuration des modèles disponibles pour le prétraitement des données, le développement du modèle, l’analyse d’explicabilité et les procédures d’évaluation ultérieures.
ComposantParamètreValeurDescription
Forêt aléatoiren_estimators100Nombre d’arbres
Forêt aléatoiremax_depthAucunProfondeur de l’arbre
XGBoostlearning_rate0.01Taux d’apprentissage
XGBoostn_estimators100Munitions boostantes
CNNÉpoques25Époques d’entraînement
CNNbatch_size32Taille du lot
CNNOptimiseurAdamAlgorithme d’optimisation
MLPhidden_layers2Nombre de couches cachées
MLPActivationReLUFonction d’activation
Généralitéstrain_split70%Rapport de données d’entraînement
Généralitésvalidation_split15%Rapport de validation
Généralitéstest_split15%Ratio d’essais

Tableau 1 : Détails de l’implémentation et configuration des hyperparamètres.

Ce tableau résume l’environnement informatique, les bibliothèques logicielles, les configurations de modèles d’apprentissage automatique et d’apprentissage profond, les paramètres d’optimisation, les taux d’apprentissage, les tailles de lot, les paramètres d’entraînement et les valeurs d’hyperparamètre utilisés tout au long de l’évaluation expérimentale du cadre d’IA explicable proposé.

3. Préparation et prétraitement des jeux de données

  1. Sélectionner des ensembles de données de santé accessibles publiquement afin d’assurer la transparence et la reproductibilité du flux de travail expérimental.
  2. Utilisez quatre scénarios de santé représentatifs pour valider le cadre proposé : (i) diagnostic du cancer du sein à l’aide du Wisconsin Breast Cancer Dataset, (ii) prédiction du risque de diabète à l’aide du Pima Indians Diabetes Dataset, (iii) prédiction des résultats cliniques à l’aide des dossiers médicaux électroniques MIMIC-III, et (iv) classification des maladies thoraciques à l’aide du jeu de données des radiographies thoraciques du NIH. Choisissez ces ensembles de données pour évaluer le cadre à travers les dossiers cliniques structurés, les dossiers de santé électroniques longitudinaux et les modalités d’imagerie médicale couramment utilisées dans les systèmes d’aide à la décision en santé.
  3. Importez chaque jeu de données dans l’environnement Python et séparez les enregistrements en caractéristiques d’entrée et variables cibles. Organiser des données cliniques structurées pour les tâches de prédiction de maladie, les dossiers médicaux électroniques pour l’analyse longitudinale des résultats, et les ensembles de données d’imagerie médicale pour les tâches de classification diagnostique. Vérifiez l’intégrité de chaque jeu de données avant de procéder aux opérations de prétraitement.
  4. Identifier et corriger les valeurs manquantes en utilisant des techniques d’imputation appropriées. Standardiser les caractéristiques numériques grâce à des procédures d’échelle et de normalisation des caractéristiques afin d’assurer la comparabilité entre les variables.
  5. Encoder des variables catégorielles en utilisant des méthodes d’encodage appropriées basées sur les caractéristiques du jeu de données. Effectuer la sélection des caractéristiques en utilisant l’analyse de corrélation et des mesures d’importance des caractéristiques basées sur des modèles afin d’identifier les variables les plus pertinentes et de réduire la dimensionnalité des données.
  6. Redimensionnez toutes les images médicales à 224 à 224 pixels avant l’entraînement du modèle. Normaliser les valeurs d’intensité des pixels selon les exigences de l’architecture d’apprentissage profond sélectionnée. Appliquer des techniques d’augmentation de données, incluant la rotation d’image et le retournement horizontal, pour améliorer la généralisation des modèles et réduire le surajustement. Vérifiez la qualité de l’image et assurez-vous de la cohérence des dimensions de l’image dans tout le jeu de données.
  7. Évaluez l’intégrité des données en évaluant l’exhaustivité, la cohérence et l’alignement des étiquettes de caractéristiques des ensembles de données. Vérifiez que tous les enregistrements sont correctement attribués à leurs classes cibles correspondantes. Examinez les caractéristiques des ensembles de données, y compris la taille de l’échantillon, le nombre de caractéristiques et la modalité des données, telles que résumées dans le tableau 2.
  8. Mettez en place des procédures de validation spécifiques à chaque ensemble de données afin d’assurer la rigueur méthodologique et la reproductibilité. Enregistrez la taille de l’échantillon, la répartition des classes, la stratégie de répartition train-validation-test, les mesures de prévention des fuites, les procédures d’optimisation des hyperparamètres, la conception croisée et le protocole de test externe pour chaque jeu de données. Résumez ces procédures de validation dans le tableau 3.
  9. Effectuer des contrôles de qualité en prétraitement en évaluant la gestion des valeurs manquantes, la suppression des valeurs aberrantes, la mise à l’échelle des caractéristiques, l’encodage catégorique, la préservation de la distribution des classes et la partition des ensembles de données. Vérifiez que les opérations de prétraitement sont appliquées de manière cohérente sur tous les ensembles de données.
  10. Confirmez l’absence de fuite importante de données lors du partitionnement des jeux de données. Examinez les résultats de validation du prétraitement présentés à la Figure 1 afin de vous assurer que des ensembles de données standardisés ont été générés pour les analyses ultérieures d’apprentissage automatique et d’explicabilité.
  11. Résultats attendus – Générer des ensembles de données nettoyés et standardisés avec des valeurs manquantes correctement adressées, des variables catégorielles encodées, des caractéristiques numériques normalisées, et des enregistrements partitionnés en sous-ensembles d’entraînement, de validation et de test. Assurez-vous que les caractéristiques des ensembles de données, les distributions de classes et les procédures de validation correspondent à celles rapportées dans les Tableaux 2 et 3, et confirmez la validation réussie du prétraitement comme illustré à la Figure 1.
Jeu de donnéesTypeÉchantillonsCaractéristiquesCible
Cancer du seinTabulaire56930Bénin/Malin
DiabèteTabulaire7688Conséquences du diabète
MIMIC-IIIDSE~60 000Variables cliniquesMortalité
Radiographie thoraciqueImagerie~112 000ImagesÉtiquettes de maladies

Tableau 2 : Caractéristiques de l’ensemble de données et cas d’utilisation dans le secteur de la santé.

Ce tableau fournit un résumé des ensembles de données de santé utilisés dans l’étude, incluant le type de jeu de données, le nombre d’échantillons, le nombre de caractéristiques, les variables cibles, le domaine d’application de la santé et les cas d’usage cliniques associés. Ces ensembles de données englobent des dossiers cliniques structurés, des dossiers médicaux électroniques et des données d’imagerie médicale afin de démontrer l’applicabilité du cadre à travers divers scénarios d’analyse en santé.

Jeu de donnéesTaille de l’échantillonRépartition des classesStratégie de SplitPrévention des fuitesRecherche par hyperparamètresValidation croiséeTest externe
Cancer du sein (UCI Wisconsin)569357 Bénin / 212 Malin70/15/15Prétraitement uniquement pour trainsRecherche en grilleCV stratifié à 5 branchesEnsemble Indépendant de Résistance
Diabète des Indiens Pima768500 Non-Diabétiques / 268 Diabétiques70/15/15Prétraitement uniquement pour trainsRecherche en grilleCV stratifié à 5 branchesEnsemble Indépendant de Résistance
MIMIC-III EHR5274Cohortes stratifiées par résultats70/15/15 Niveau patientSéparation au niveau du patientRecherche aléatoireCV au niveau patient à 5 branchesEnsemble Indépendant de Résistance
Radiographie thoracique des NIH112120Pneumonie / Normale stratifiée70/15/15Séparation au niveau d’imageRecherche aléatoireCV stratifié à 5 branchesEnsemble Indépendant de Résistance

Tableau 3 : Validation au niveau des ensembles de données et conception expérimentale.

Ce tableau résume la méthodologie de validation employée pour chaque jeu de données, incluant la taille de l’échantillon, la distribution des classes, la stratégie de répartition train-validation-test, les procédures de prévention des fuites, les méthodes d’optimisation des hyperparamètres, la conception croisée de validation et les protocoles de test externes. Ces mesures ont été mises en œuvre pour garantir la rigueur méthodologique, la reproductibilité et une évaluation impartiale du modèle.

figure-protocol-1
Figure 1 : Validation du pipeline de prétraitement des données.
Résultats de validation pour les opérations clés de prétraitement effectuées avant le développement du modèle. (A) Analyse des valeurs manquantes à travers les caractéristiques représentatives de la santé. (B) Distribution d’une variable numérique avant et après la manipulation des valeurs aberrantes. (C) Validation de la mise à l’échelle des fonctionnalités via la standardisation. (D) Validation de l’encodage catégorique. (E) Distribution de classes après prétraitement. (F) Validation du partitionnement des données train-validation-test. Ces résultats confirment le prétraitement et la préparation réussis des ensembles de données pour la modélisation prédictive et l’analyse de l’explicabilité. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

4. Architecture système du cadre d’IA explicable

  1. Organiser le cadre à l’aide d’une architecture en couches pour faciliter le traitement modulaire, améliorer la transparence des flux de travail et soutenir une implémentation reproductible. Configurez la couche de données pour recevoir et gérer des ensembles de données brutes en santé. Acheminez tous les ensembles de données entrants via la couche de données avant d’initier les opérations de prétraitement.
  2. Effectuer des procédures de nettoyage des données, transformations, normalisation, ingénierie des caractéristiques et encodage au sein de la couche de prétraitement. Assurez-vous que toutes les opérations de prétraitement sont terminées avant le développement du modèle.
  3. Développer des modèles prédictifs au sein de la couche de modélisation en utilisant l’apprentissage automatique et les algorithmes d’apprentissage profond. Train Gradient Boosting, Random Forest, Multilayer Perceptron (MLP) et réseaux de neurones convolutionnels (CNN) utilisant les ensembles de données prétraités et des configurations optimisées d’hyperparamètres.
  4. Appliquer des techniques d’explicabilité au sein de la couche d’explicabilité pour interpréter les prédictions des modèles. Générez des explications d’attribution de caractéristiques en utilisant SHAP et LIME pour des ensembles de données structurés. Générez des heatmaps Grad-CAM pour des modèles basés sur des images afin de visualiser les régions contribuant aux prédictions du modèle.
  5. Évaluer la performance prédictive et explicable au sein de la couche d’évaluation. Calculez la précision, la précision, la rappel, le score F1, le ROC-AUC, la fidélité, la stabilité et les métriques d’évaluation centrées sur le clinicien. Consignez tous les résultats des évaluations pour analyses et rapports ultérieurs.
  6. Générez des résultats visuels cliniquement interprétables au sein de la couche de visualisation. Créez des graphiques de comparaison de performances, des visualisations d’importance des caractéristiques, des graphiques résumés SHAP, des explications LIME, des cartes thermiques Grad-CAM et des tableaux de bord de reporting orientés cliniciens. Stockez tous les résultats visuels pour inclusion dans le rapport expérimental final.
  7. Examinez l’architecture complète du framework illustrée à la Figure 2 avant de procéder à l’exécution du workflow.
  8. Résultats attendus - Générer des modèles entièrement entraînés en apprentissage automatique et deep learning, incluant des architectures Gradient Boosting, Random Forest, CNN et MLP. Stockez les configurations de modèles, les hyperparamètres optimisés, les journaux d’entraînement, les fichiers de points de contrôle, les sorties d’explicabilité et les artefacts de visualisation pour une évaluation et une analyse d’interprétabilité ultérieure.

figure-protocol-2
Figure 2 : Architecture système du cadre d’IA explicable pour l’analytique en santé. Veuillez cliquer ici pour voir une version agrandie de cette figure.

5. Exécution du flux de travail

  1. Acquérir des ensembles de données de santé à partir de dépôts publics et stocker ces ensembles de données dans des formats structurés adaptés à l’apprentissage automatique et à l’analyse de deep learning. Examinez le flux de travail complet illustré à la Figure 3 avant d’entamer la procédure expérimentale.
  2. Effectuer le nettoyage et le prétraitement des données conformément aux procédures décrites à la Section 3. Normaliser les variables numériques en utilisant des méthodes d’échelle appropriées. Encoder des variables catégorielles en utilisant des techniques d’encodage appropriées. Identifier et imputer les valeurs manquantes en utilisant des stratégies d’imputation spécifiques à chaque ensemble de données. Vérifiez la qualité des données, l’alignement des étiquettes de caractéristiques et l’exhaustivité du jeu de données avant de procéder au développement du modèle.
  3. Partitionner chaque jeu de données en sous-ensembles d’entraînement, de validation et de test pour soutenir une évaluation impartiale du modèle. Préserver les distributions de classes lors du partitionnement des jeux de données et mettre en place des mesures de prévention des fuites lorsque cela est applicable. Réservez le sous-ensemble de test exclusivement pour l’évaluation finale du modèle.
  4. Entraînez des modèles d’apprentissage automatique sur des ensembles de données structurés à l’aide d’algorithmes basés sur ensemble, notamment le Gradient Boosting et le Random Forest. Entraînez des modèles d’apprentissage profond sur des ensembles de données d’imagerie utilisant des architectures de réseaux neuronaux convolutionnels (CNN) capables d’apprendre les caractéristiques spatiales de l’image. Mettez à jour les paramètres du modèle de manière itérative pendant la formation et surveillez la performance de validation après chaque époque d’entraînement. Appliquer un arrêt précoce lorsque la performance de validation se détériore ou ne s’améliore pas selon les critères d’arrêt prédéfinis.
  5. Optimiser les hyperparamètres du modèle en utilisant des stratégies de recherche systématique, incluant la recherche en grille et la recherche randomisée. Ajustez le taux d’apprentissage, le nombre d’estimateurs, la profondeur de l’arbre, la taille du lot, le nombre d’époques et d’autres paramètres spécifiques au modèle en fonction de la performance de validation. Sélectionnez le modèle final en fonction de la performance prédictive et de la capacité de généralisation à travers les ensembles de données de validation.
  6. Appliquer des méthodes d’explicabilité après avoir terminé la formation modèle. Générer des explications globales en utilisant des techniques d’attribution de caractéristiques pour identifier les variables contribuant le plus fortement aux prédictions du modèle. Générer des explications locales pour analyser les cas de prédiction individuels et évaluer le comportement du modèle au niveau de l’échantillon. Créez des heatmaps Grad-CAM pour des modèles de classification d’images afin de mettre en évidence les régions de l’image qui contribuent au résultat prédit. Stockez tous les résultats explicatifs pour une analyse et un rapport ultérieurs.
  7. Évaluer la performance prédictive en utilisant la précision, la précision, le rappel, le score F1 et la zone caractéristique de fonctionnement du récepteur sous la courbe (ROC-AUC). Évaluer la qualité de l’explication en utilisant des indicateurs de fidélité et de stabilité pour évaluer la fiabilité et la cohérence de l’explication. Comparez la performance des modèles entre ensembles de données et méthodes d’explicabilité pour évaluer la robustesse et la généralisabilité du cadre.
  8. Générez des résultats de visualisation et des rapports analytiques pour communiquer les résultats de manière cliniquement interprétable. Créez des graphiques comparatifs de performance, des graphiques d’importance des caractéristiques, des visualisations résumées SHAP, des résultats d’explications LIME, des cartes thermiques Grad-CAM et d’autres visualisations cliniquement pertinentes. Examinez tous les résultats visuels pour garantir la clarté et la cohérence avant de faire un rapport.
  9. Documentez toutes les opérations de prétraitement, les configurations de modèles, les paramètres d’hyperparamètres, les procédures d’explicabilité, les stratégies de validation et les résultats d’évaluation. Maintenir des registres expérimentaux détaillés pour faciliter la reproductibilité et la réplication indépendante du flux de travail. Vérifier la cohérence des résultats à travers les répétitions d’essais et archiver tous les artefacts du flux de travail pour référence future.
  10. Résultats attendus – Générer un modèle prédictif entièrement entraîné avec des hyperparamètres optimisés, des poids enregistrés, des journaux d’entraînement, des métriques de performance et des résultats explicables, incluant les explications SHAP, LIME et heatmaps Grad-CAM. Stockez tous les artefacts du modèle, rapports d’évaluation et résultats de visualisation pour une analyse ultérieure et une évaluation de la reproductibilité.

figure-protocol-3
Figure 3 : Flux de travail de bout en bout du pipeline d’IA explicable. Veuillez cliquer ici pour voir une version agrandie de cette figure.

6. Évaluation du modèle et de l’explicabilité

  1. Évaluer la performance du modèle prédictif à l’aide de métriques de classification standard, incluant la précision, la précision, le rappel, le score F1 et la zone de caractéristiques de fonctionnement du récepteur sous la courbe (ROC-AUC). Calculer la précision pour mesurer la correction globale de la classification.
  2. Calculer la précision pour évaluer la proportion de prédictions positives correctement identifiées. Calculez la mémoire pour évaluer la capacité du modèle à identifier les cas positifs. Calculez le score F1 pour équilibrer précision et rappel. Calculer le ROC-AUC pour évaluer la performance discriminative selon différents seuils de classification.
  3. Appliquer ces métriques d’évaluation de manière cohérente à tous les ensembles de données et architectures de modèles afin de faciliter une comparaison objective des performances. Enregistrez toutes les valeurs des indicateurs et stockez les résultats de l’évaluation pour une analyse statistique et des rapports ultérieurs.
  4. Évaluez la performance de l’explicabilité à l’aide de métriques de fidélité et de stabilité. Calculer la fidélité pour déterminer dans quelle mesure les explications générées reflètent avec précision les prédictions du modèle et le comportement décisionnel.
  5. Calculez la stabilité en comparant les explications générées à partir d’échantillons d’entrée similaires et en quantifiant la cohérence des résultats explicatifs. Vérifiez que les valeurs de fidélité et de stabilité respectent les critères de qualité prédéfinis avant d’interpréter les explications du modèle.
  6. Comparez les performances d’explicabilité entre les sorties SHAP, LIME et Grad-CAM.
  7. Résultats attendus – Générez des résultats d’évaluation quantitative, incluant la précision, la précision, la rappel, le score F1, le ROC-AUC, les métriques de fidélité et de stabilité. Produire des résultats explicables et des visualisations adaptés au reporting scientifique, à l’évaluation de la reproductibilité et à l’interprétation clinique.

7. Évaluation centrée sur l’humain

  1. Recrutez 12 professionnels de santé, dont 6 médecins, 3 radiologues et 3 analystes de données cliniques. Sélectionnez des participants ayant une expérience préalable en prise de décision clinique, interprétation d’images médicales, analyse de soins de santé ou examen électronique des dossiers médicaux. Obtenez le consentement éclairé de tous les participants avant d’entamer la procédure d’évaluation.
  2. Sélectionnez aléatoirement 100 cas parmi les jeux de données de test après avoir terminé l’entraînement du modèle et l’analyse d’explicabilité. Générer deux conditions d’évaluation pour chaque cas :
    1. Sortie uniquement prédiction et
    2. prédiction accompagnée d’informations explicables. Randomisez l’ordre de présentation des cas et des conditions d’évaluation afin de minimiser les biais de présentation et les effets d’apprentissage.
  3. Préparez des formulaires d’évaluation standardisés contenant les résultats de prédiction, les résultats explicatifs et les questionnaires d’évaluation. Présenter les cas individuellement aux participants via une interface d’évaluation informatisée.
  4. Demandez aux participants d’examiner chaque cas de manière indépendante sans discuter des réponses avec d’autres évaluateurs. Permettre aux participants de réaliser toutes les évaluations dans des conditions expérimentales identiques.
  5. Administrez un questionnaire à cinq points à l’échelle Likert adapté d’études d’évaluation de l’intelligence artificielle explicables publiées. Demandez aux participants d’évaluer la confiance, l’interprétabilité et l’utilisabilité pour chaque cas examiné. Enregistrez électroniquement les réponses au questionnaire et vérifiez la complétion de tous les items de l’enquête avant de procéder à l’analyse statistique.
  6. Mesurer les indicateurs objectifs de l’utilité clinique lors du processus d’évaluation. Enregistrer l’accord de décision en comparant les décisions des participants avec les labels de référence correspondants ou les résultats de base de la réalité. Calculer l’accord de décision comme le pourcentage de décisions des participants correspondant au résultat de référence.
  7. Enregistrez le temps de révision pour chaque cas en mesurant l’intervalle entre la présentation du dossier et la soumission de la réponse finale. Calculez séparément le temps moyen de révision pour les conditions de prédiction uniquement et de prédiction avec explication.
  8. Calculez les scores moyens de confiance, d’interprétabilité et d’utilisabilité pour tous les participants et les cas d’évaluation. Comparez les scores obtenus sous des conditions de prédiction seule et prédiction avec explication.
  9. Effectuer des tests t par paires après l’achèvement de toutes les évaluations des participants afin de déterminer si les différences de confiance, d’interprétabilité, d’utilisabilité, d’accord décisionnel et de temps d’examen sont statistiquement significatives. Utilisez un seuil de signification de p 0,05 pour toutes les comparaisons statistiques.
  10. Calculer Fleiss Kappa après avoir recueilli les réponses de tous les participants pour évaluer l’accord inter-évaluateurs. Utilisez les évaluations agrégées des participants pour déterminer la cohérence des évaluations entre les évaluateurs. Interprétez les valeurs de Fleiss Kappa selon les directives d’accord établies et enregistrez les statistiques d’accord résultantes.
  11. Résumez la démographie des participants, la méthodologie d’évaluation, la conception du questionnaire, les procédures d’analyse statistique, les mesures de performance objective et les résultats d’accord inter-évaluateurs dans le tableau 4.
  12. Examinez les résultats du modèle dans les deux conditions d’évaluation et comparez les réponses des participants entre les différentes conditions. Vérifiez que les explications améliorent la confiance, l’interprétabilité et l’utilisabilité sans nuire à la qualité des décisions.
  13. Confirmez la cohérence des évaluations des participants à l’aide de la statistique Fleiss Kappa calculée. Consignez tous les résultats de l’évaluation pour un rapport ultérieur et une évaluation de la reproductibilité.
  14. Résultats attendus – Générez les scores de confiance des cliniciens, les évaluations d’interprétabilité, les évaluations d’utilisabilité, les mesures décision-accord, les statistiques sur le temps de révision, les résultats du test t appariés et les statistiques d’accord inter-évaluateurs. Produire des preuves quantitatives décrivant l’utilité clinique, l’interprétabilité et la fiabilité du cadre d’intelligence artificielle explicable.
ParamètreValeur
Experts12
Médecins6
Radiologues3
Analystes de données cliniques3
Affaires examinées100
Conception d’évaluationAléatoire (Prédiction uniquement vs Prédiction+Explication)
Instrument de levéÉchelle de Likert à 5 points
Évaluation de la fiducieInterprétabilité, Confiance, Ergonomie
Test statistiqueTest t apparié (p 0,05)
Fiabilité inter-évaluateursFleiss Kappa
Mesures objectivesAccord de décision, temps de révision

Tableau 4 : Protocole d’évaluation centré sur l’humain et conception de l’évaluation par le clinicien.

Ce tableau présente le cadre d’évaluation des cliniciens utilisé pour évaluer l’interprétabilité, la fiabilité et l’utilisabilité du système d’IA explicable. Les informations concernant la démographie des participants, la méthodologie de l’évaluation des cas, la conception de l’enquête, les procédures d’analyse statistique, l’évaluation de fiabilité inter-évaluateurs et les mesures d’évaluation objective sont résumées.

8. Validation et évaluation de la reproductibilité

  1. Réaliser des études de validation et d’ablation afin d’évaluer la robustesse et la fiabilité du cadre proposé. Identifier les caractéristiques ayant des scores d’importance élevés en utilisant les méthodes d’explicabilité sélectionnées. Supprimer progressivement les caractéristiques importantes et réentraîner les modèles prédictifs après chaque étape de suppression de caractéristiques.
  2. Évaluer la performance du modèle après chaque expérience d’ablation en utilisant la précision, la précision, le rappel, le score F1 et les métriques ROC-AUC. Comparez les valeurs de performance résultantes avec celles du modèle de référence pour déterminer la contribution des caractéristiques individuelles aux résultats prédictifs.
  3. Évaluez la stabilité des explications en générant des explications pour des échantillons d’entrée similaires à l’aide de SHAP, de CLIME, et de Grad-CAM. Comparez les résultats explicatifs à travers des évaluations répétées et quantifiez la cohérence à l’aide des métriques de stabilité prédéfinies. Vérifiez que les explications restent stables sous de légères variations d’entrée et des répétitions d’expérimentations.
  4. Enregistrez toutes les procédures expérimentales tout au long du flux de travail. Opérations de prétraitement des données documentées, procédures de partitionnement des ensembles de données, architectures de modèles, paramètres d’hyperparamètres, configurations d’entraînement, méthodes d’explicabilité, stratégies de validation et métriques d’évaluation. Stockez tous les paramètres de configuration et les sorties expérimentales dans un format structuré pour faciliter la reproductibilité et la vérification indépendante.
  5. Examinez tous les dossiers expérimentaux pour en assurer l’exhaustivité et la cohérence. Vérifiez que le flux de travail peut être reproduit à l’aide des procédures documentées, des fichiers de configuration et des spécifications logicielles. Maintenir une structure de flux de travail modulaire pour faciliter l’adaptation du protocole pour de futures études et soutenir la conversion en un protocole expérimental basé sur la vidéo, conforme aux exigences méthodologiques de JoVE.

9. Ressources de reproductibilité

  1. Exécutez toutes les expériences en utilisant des graines aléatoires fixes afin d’assurer des résultats reproductibles sur des répétitions répétées. Maintenir le code source, les scripts de prétraitement, les fichiers de configuration, les spécifications d’environnement, les paramètres de modèle et les scripts de visualisation au sein d’un dépôt accessible au public.
  2. Fournir des instructions détaillées pour l’acquisition des ensembles de données, le prétraitement, l’exécution d’expériences, l’entraînement des modèles, la génération d’explicabilités, les procédures de validation et la régénération de toutes les tables et figures rapportées. Archivez tous les composants du flux de travail nécessaires à la réplication indépendante, y compris les spécifications logicielles, les flux de prétraitement, les fichiers de configuration, les instructions d’accès aux ensembles de données, les points de contrôle des modèles et les ressources de visualisation.
  3. Résumez les ressources logicielles, les flux de travail de prétraitement, les fichiers de configuration, les instructions d’accès aux jeux de données et les ressources de reproductibilité utilisées dans tout le cadre dans le tableau 5.
  4. Résultats attendus – Générez un package expérimental complet reproductible contenant des scripts de prétraitement, des fichiers de configuration, des modèles entraînés, des points de contrôle de modèles, des sorties explicables, des rapports de validation, des artefacts de visualisation, des spécifications logicielles et la documentation nécessaires à la réplication et à la vérification indépendantes du cadre proposé.
RessourceDescription
Source CodeScripts d’implémentation Python pour le prétraitement des données, l’entraînement des modèles, l’explicabilité et l’évaluation
Fichier Environnementrequirements.txt contenant les dépendances et versions des paquets
Fichiers de configurationParamètres d’architecture du modèle, hyperparamètres et configurations expérimentales
Graines aléatoires fixesGraine = 42 utilisées pour les expériences reproductibles
Instructions d’accès au jeu de donnéesLiens et procédures pour acquérir des ensembles de données en santé publique
Scripts de prétraitementScripts pour le nettoyage, la normalisation, l’encodage et la sélection des fonctionnalités des données
Scripts de génération de figuresÉcritures pour régénérer toutes les figures manuscrites
Scripts de génération de tableScripts pour reproduire les tableaux et métriques rapportés
Exemples d’entréesEnsembles de données d’exemple et fichiers d’entrée
Exemples de sortiesRésultats de prédiction, explications et rapports d’évaluation

Tableau 5 : Ressources de reproductibilité et actifs expérimentaux.

Ce tableau résume les ressources fournies pour soutenir la reproductibilité expérimentale, y compris le code source, les scripts de prétraitement, les fichiers de configuration, les spécifications d’environnement, les instructions d’accès au jeu de données, les réglages de semence aléatoires fixes, les scripts de génération de figures et les exemples de fichiers d’entrée/sortie nécessaires à la reproduction des résultats rapportés.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Nous avons examiné en profondeur la composante IA explicative de l’ensemble de notre pipeline, évaluant sa capacité à prédire différents types de données de santé, y compris les données cliniques structurées et les images médicales. Les résultats ont indiqué une performance prédictive cohérente à travers les ensembles de données évalués. Parmi les modèles testés, le modèle de gradient boosting a obtenu la plus grande précision à 97,4 %, suivi du modèle de forêt aléatoire à 94,2 %. Les mé...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Cette étude a développé et évalué un flux de travail d’intelligence artificielle explicable reproductible (XAI) pour l’analyse de la santé, qui intègre modélisation prédictive, évaluation de l’explicabilité, évaluation centrée sur le clinicien et ressources de reproductibilité au sein d’un seul protocole. Les résultats ont démontré que les modèles d’apprentissage automatique basés sur des ensembles, en particulier le Gradient Boosting et le Random Forest, obtenaient les meilleures perfor...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs déclarent qu’ils n’ont aucun intérêt financier concurrent ni conflit d’intérêts liés à cette œuvre. La recherche a été menée de manière indépendante, sans aucune relation commerciale ou financière pouvant être considérée comme un conflit d’intérêts potentiel.

Divulgation de l’utilisation de l’intelligence artificielle

Des outils d’intelligence artificielle étaient utilisés pour l’affinement du langage, la correction grammaticale et l’assistance éditoriale lors de la préparation du manuscrit. Tout le contenu scientifique, la conception expérimentale, l’analyse des données, l’interprétation et la vérification finale du manuscrit ont été réalisés par les auteurs. Les auteurs ont examiné et validé tous les résultats assistés par l’IA afin d’assurer l’exactitude, l’intégrité et la conformité aux directives des revues.

Remerciements

Les auteurs tiennent à remercier leurs institutions respectives pour avoir fourni l’infrastructure nécessaire et le soutien à la recherche pour mener cette étude. Les auteurs reconnaissent également l’utilisation de jeux de données publics et d’outils open source qui ont facilité le développement et l’évaluation du cadre d’IA explicable proposé. Un merci particulier est adressé aux experts du domaine qui ont apporté des informations précieuses durant la phase d’évaluation centrée sur l’humain.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
GPU WorkstationDépendant du fabricantNAFormation de modèles d'apprentissage profond
Jupyter NotebookProject JupyterDernière version stableExécution interactive des expériences
LIMELIMEVersion 0.2.0Explications locales interpretables
MatplotlibMatplotlib ProjectVersion 3.9Visualisation de données
MIMIC-III DatabasePhysioNetVersion 1.4Analyse des dossiers médicaux électroniques
NIH Chest X-ray DatasetNIH Clinical CenterDataset publicClassification des maladies thoraciques
NumPyNumPy DevelopersVersion 1.26Calcul numérique et opérations sur les tableaux
OpenCVOpenCV FoundationVersion 4.10Prétraitement d'images
PandasPandas Development TeamVersion 2.1Manipulation et prétraitement des données
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryDataset publicPrédiction du risque de diabète
Python 3.11Python Software FoundationVersion 3.11Environnement de programmation principal
Scikit-learnscikit-learnVersion 1.5Algorithmes et évaluation d'apprentissage automatique
SeabornSeabornVersion 0.13Visualisation statistique
SHAPSHAPVersion 0.46Attribution et explicabilité des caractéristiques
TensorFlowTensorFlowVersion 2.15Développement de modèles d'apprentissage profond
Windows / Ubuntu LinuxMicrosoft / CanonicalNASystème d'exploitation
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryDataset publicDiagnostic du cancer du sein

Références

  1. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  2. Ribeiro MT, Singh S, Guestrin C. Why should I trust you. Explaining the predictions of any classifier. Presented at: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 1135-44. doi:10.1145/2939672.2939778.
  3. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 2020;128(2):336-59.
  4. Tjoa E, Guan C. A survey on explainable artificial intelligence: Toward medical XAI. IEEE Trans Neural Netw Learn Syst. 2021;32(11):4793-813.
  5. Samek W, et al. Explainable AI: Interpreting, Explaining and Visualizing Deep Learning. Springer; Cham; 2019.
  6. Arrieta AB, et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  7. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. Wiley Interdiscip Rev Data Min Knowl Discov. 2020;10(5):e1312.
  8. Topol E. Deep medicine: How artificial intelligence can make healthcare human again. Nat Med. 2020;25:44-56.
  9. Esteva A, et al. A guide to deep learning in healthcare. Nat Med. 2019;25(1):24-9.
  10. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28:31-38.
  11. Doshi-Velez F, Kim B. Towards a rigorous science of interpretable machine learning. arXiv. 2021. doi:10.48550/arXiv.1702.08608.
  12. Molnar C. Interpretable Machine Learning. Lulu Press; 2022.
  13. Rudin C. Stop explaining black box machine learning models for high-stakes decisions and use interpretable models instead. Nat Mach Intell. 2019;1(5):206-15.
  14. Zhang Q, Zhu S. Visual interpretability for deep learning: A survey. Front Inf Technol Electron Eng. 2020;21:27-39.
  15. Holzinger A, Biemann C, Pattichis CS, Kell DB. What do we need to build explainable AI systems for the medical domain. arXiv. 2020. Available at: https://arxiv.org/abs/1712.09923.
  16. McDermott MB, et al. Reproducibility in machine learning for health. Nat Med. 2021;27:1016-23.
  17. Kelly CJ, et al. Key challenges for delivering clinical impact with AI. BMC Med. 2019;17:195.
  18. Ahmad MA, Teredesai A, Eckert C. Interpretable machine learning in healthcare. Proc ACM Conf Health Inference Learn. 2021;4:1-7.
  19. Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable AI in healthcare. Lancet Digit Health. 2021;3(11):e745-50.
  20. Carvalho DV, Pereira EM, Cardoso JS. Machine learning interpretability: A survey on methods and metrics. Inf Fusion. 2020;58:82-115.
  21. Chen RJ, et al. Synthetic data in healthcare: A narrative review. Nat Biomed Eng. 2021;5:493-97.
  22. Zhou B, et al. Learning deep features for discriminative localization. Presented at: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2016. p. 2921-29.
  23. Vellido A. The importance of interpretability and visualization in machine learning for applications in medicine and health care. Expert Syst Appl. 2020;146:113222.
  24. Lipton ZC. The mythos of model interpretability. Commun ACM. 2018;61(10):36-43.
  25. Guidotti R, et al. A survey of methods for explaining black box models. ACM Comput Surv. 2018;51(5):93.
  26. Suresh H, Guttag J. A framework for understanding unintended consequences of machine learning. Commun ACM. 2021;64(12):42-50.
  27. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-40.
  28. Rajkomar A, Dean J, Kohane I. Machine learning in medicine. N Engl J Med. 2019;380(14):1347-58.
  29. Lundberg SM, Lee SI. A unified approach to interpreting model predictions. Presented at: Advances in Neural Information Processing Systems. 2017;30:4765-74.
  30. Agarwal R, et al. Neural additive models: Interpretable machine learning with neural nets. Presented at: Advances in Neural Information Processing Systems. 2021;34:4699-711.
  31. Singh C, Murdoch WJ, Yu B. Hierarchical interpretations for neural network predictions. Proc Natl Acad Sci U S A. 2020;117(32):19950-57.
  32. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(5):176-85.
  33. Wang F, Preininger A. AI in health care: Applications, challenges, and future directions. Annu Rev Biomed Data Sci. 2019;2:221-52.
  34. Azizi S, et al. Big self-supervised models advance medical AI. Nat Med. 2021;27(8):1431-42.
  35. Zhang Y, et al. Explainable deep learning for healthcare: Methods, applications and challenges. IEEE Access. 2020;8:120455-475.
  36. Holzinger A, et al. Explainable AI methods: A brief overview. Mach Learn Knowl Extr. 2021;3(2):606-27.
  37. Rudin C, Radin J. Why are we using black box models in AI when we do not need to  A lesson from an explainable AI competition. Nat Mach Intell. 2019;1(5):206-15.
  38. Doshi-Velez F, et al. Accountability of AI Under the Law: The Role of Explanation. Harvard University; Cambridge; 2020.
  39. Kaur H, et al. Interpreting interpretability: Understanding data scientists' use of interpretability tools for machine learning. Presented at: Proceedings of the CHI Conference on Human Factors in Computing Systems; 2020. p. 1-14.
  40. Caruana R, et al. Intelligible models for healthcare: Predicting pneumonia risk and hospital 30-day readmission. Presented at: Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2015. p. 1721-30.
  41. Mangalote IAC, et al. Development and validation of a class imbalance-resilient cardiac arrest prediction framework incorporating multiscale aggregation, ICA and explainability. IEEE Trans Biomed Eng. 2025;72(5):1674-84.
  42. Ansari MY, Mangalote IAC, Masri D, Dakua SP. Neural network-based fast liver ultrasound image segmentation. Presented at: 2023 International Joint Conference on Neural Networks; 2023. p. 1-8.
  43. Dakua SP, et al. Artificial intelligence enabled biomineralization for eco-friendly nanomaterial synthesis: Charting future trends. Nano Select. 2025;6(5):e202400118.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Mots-clés

Ing nierieNum ro 233Num ro 233Valeur videNum roIntelligence artificielle explicable XAIApprentissage automatiqueapprentissage profondInterpr tabilit des mod lesSyst mes d aide la d cision cliniqueProtocole exp rimental reproductible