Le cadre XAI proposé a été mis en œuvre en utilisant le jeu de données sur le diabète des Indiens Pima comme ensemble de données représentatif dans le domaine des soins de santé. Ce jeu de données a été utilisé comme unique ensemble de validation expérimentale. Tous les résultats prédictifs, d'interprétabilité, statistiques et de reproductibilité rapportés ont été générés à partir de ce jeu de données. Les jeux de données TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10000, OhioT1DM et BraTS 2021 n'ont pas été évalués expérimentalement et sont inclus uniquement comme exemples illustrant l'applicabilité du protocole général à différentes modalités de données en santé. L'intégralité du jeu de données a été utilisée après suppression des enregistrements non valides et des doublons, et les opérations de prétraitement spécifiées ont été effectuées avant le développement du modèle. Le jeu de données a été divisé en sous-ensembles d'entraînement, de validation et de test indépendants selon une stratégie de fractionnement stratifiée prédéfinie. L'indépendance des échantillons entre les trois sous-ensembles a été préservée afin de minimiser le risque de fuite de données.
Le modèle prédictif a été configuré à l'aide de l'architecture et des hyperparamètres prédéfinis. L'entraînement du modèle a été effectué à l'aide de l'optimiseur Adam, avec un taux d'apprentissage et une taille de lot prédéfinis, pendant un maximum de 100 époques. Un arrêt précoce basé sur la perte de validation a été appliqué, et le modèle correspondant aux meilleures performances de validation a été conservé. Des graines aléatoires ont été fixées pour la partition du jeu de données, l'initialisation du modèle et les expériences répétées afin d'améliorer la reproductibilité.
Le modèle entraîné a été évalué sur l'ensemble de test indépendant à l'aide de l'exactitude, de la précision, du rappel, de la spécificité, du score F1, du coefficient de corrélation de Matthews (MCC), de la surface sous la courbe caractéristique de fonctionnement du récepteur (AUC-ROC) et de la précision moyenne (AP). Le modèle proposé a été comparé aux modèles de référence prédéfinis en utilisant des procédures de prétraitement identiques, des partitions de données identiques et des protocoles d'évaluation identiques. Les courbes caractéristiques de fonctionnement du récepteur (ROC), les courbes précision-rappel et une matrice de confusion ont été générées à partir des prédictions sur l'ensemble de test indépendant.
Une validation croisée à cinq plis a été effectuée sur les données d'entraînement afin d'évaluer la stabilité des performances. Des intervalles de confiance à 95 % ont été estimés pour les principales métriques de performance, et des comparaisons statistiques prédéfinies ont été réalisées entre le modèle proposé et les modèles de référence.
La validation croisée à cinq plis a produit une exactitude de 93,01 ± 0,48 %, une AUC-ROC de 0,954 ± 0,007, une précision de 92,42 ± 0,87 %, un rappel de 93,02 ± 0,45 % et un score F1 de 92,72 ± 0,62 %. Les intervalles de confiance bootstrap à 95 %, estimés à partir de 1 000 rééchantillonnages, étaient de 0,897 à 0,973 pour l'exactitude, de 0,890 à 0,970 pour la précision, de 0,880 à 0,963 pour le rappel, de 0,887 à 0,965 pour le score F1 et de 0,931 à 0,984 pour l'AUC-ROC. Des comparaisons statistiques avec les modèles de base CNN, forêt aléatoire et SVM ont été effectuées à l’aide du test de McNemar pour l'exactitude, du test de DeLong pour l'AUC-ROC et de tests bootstrap appariés avec 1 000 rééchantillonnages pour le score F1.
La procédure complète d'apprentissage et d'évaluation a été répétée sur 10 exécutions indépendantes en utilisant différentes graines aléatoires. Les exécutions répétées ont donné une AUC-ROC de 0,957 ± 0,008, une exactitude de 93,24 ± 0,74 % et un score F1 de 92,35 ± 0,92 %, indiquant une variabilité relativement faible entre les exécutions répétées. Les métriques de performance obtenues lors des exécutions répétées ont été résumées à l'aide de la moyenne et de l'écart type. La variabilité entre les exécutions a été examinée afin de déterminer si la performance prédictive restait stable lors d'exécutions répétées.
Aucune validation externe n'a été effectuée dans le présent exemple travaillé, car aucun jeu de données externe indépendant n'a été utilisé. Par conséquent, tous les résultats relatifs à la prédiction, aux statistiques et à la reproductibilité ont été obtenus à partir du jeu de données sur le diabète chez les Indiens Pima, en utilisant les partitions prédéfinies d'apprentissage, de validation et de test indépendant. La validation externe a été conservée dans le protocole comme procédure facultative pour les applications dans lesquelles un jeu de données indépendant provenant d'une institution, d'une population, d'une région géographique ou d'une période temporelle différente est disponible.
Les explications du modèle ont été générées à l'aide de techniques d'interprétabilité applicables au jeu de données tabulaires sur le diabète des Indiens Pima, notamment SHAP et LIME. L'importance globale des caractéristiques a été évaluée, et des explications locales spécifiques à chaque patient ont été produites à partir d'échantillons de test réservés. Les sorties d'explication ont été enregistrées conjointement avec les prédictions correspondantes du modèle et les valeurs des caractéristiques afin de faciliter la reproductibilité et l'interprétation ultérieure.
Par souci de clarté, l'exemple traité dans cet article comprenait les neuf étapes fondamentales du flux de travail identifiées dans le Tableau 1. La validation externe et l'évaluation par des experts cliniciens ont été conservées comme modules facultatifs de validation du protocole général. La validation externe n'a pas été réalisée, car aucune base de données externe indépendante n'a été utilisée, et l'évaluation par des experts cliniciens n'a pas été effectuée, car aucun comité formel d'évaluation par des experts n'était inclus dans le présent exemple traité. En conséquence, ces modules facultatifs ne sont pas considérés comme faisant partie du flux de travail expérimental en neuf étapes et ne sont pas rapportés comme résultats expérimentaux.
Les procédures de prétraitement et de partitionnement du jeu de données ont produit un ensemble normalisé adapté au développement du modèle. Les enregistrements en double et incohérents ont été supprimés, les valeurs manquantes ont été traitées selon la stratégie prédéfinie, les caractéristiques numériques ont été standardisées, et le jeu de données a été divisé en sous-ensembles d'entraînement, de validation et de test indépendants. Les caractéristiques du jeu de données obtenu et les procédures de prétraitement sont résumées dans Tableau 2. Le flux de travail général de préparation et de prétraitement du jeu de données en matière de santé est illustré dans Figure 2, tandis que le flux de travail expérimental de préparation, de prétraitement, de partitionnement et d'évaluation de la qualité, appliqué spécifiquement au jeu de données sur le diabète des Indiens Pima, est présenté dans Figure 3. L'environnement informatique final, l'architecture du modèle et la configuration des hyperparamètres utilisés pour produire les résultats rapportés sont résumés dans Tableau 3.
L'exécution des sections 3 et 4 a produit un jeu de données de soins de santé normalisé, adapté au développement du modèle. Les procédures de prétraitement ont supprimé les enregistrements en double et incohérents, imputé les valeurs manquantes, normalisé les caractéristiques numériques, encodé les variables catégorielles lorsque cela s'appliquait, et divisé le jeu de données en sous-ensembles d'apprentissage, de validation et de test. Les données obtenues ont fourni l'entrée normalisée nécessaire au développement ultérieur du modèle.
Après l'achèvement des sections 5 et 6, le modèle configuré a montré une convergence stable durant l'apprentissage. Les courbes d'apprentissage ont révélé une diminution simultanée des pertes d'entraînement et de validation, ainsi qu'une augmentation de la précision d'entraînement et de validation. L'optimisation des hyperparamètres a amélioré la généralisation du modèle, sans signe d'un surajustement important. Afin de faciliter la reproductibilité, le modèle optimisé a été archivé conjointement avec l'architecture finale, les réglages des hyperparamètres, les versions des logiciels, les graines aléatoires et les poids du modèle entraîné. Les spécifications d'apprentissage du modèle et les résultats de l'optimisation sont résumés dans le Tableau 4, et les courbes d'apprentissage correspondantes pour l'entraînement et la validation sont présentées dans la Figure 4.
La section 7 a évalué les performances prédictives du modèle à l'aide de métriques de performance standardisées. Les métriques de classification évaluées comprenaient l'exactitude, la précision, le rappel, la spécificité, le score F1, le coefficient de corrélation de Matthews (MCC), l'AUC-ROC et la précision moyenne (AP). Le modèle proposé a été comparé aux modèles de référence prédéfinis en utilisant les mêmes partitions de jeu de données, les mêmes procédures de prétraitement et le même protocole d'évaluation. La comparaison des performances prédictives est présentée dans le tableau 5, tandis que les courbes ROC, les courbes précision-rappel, la matrice de confusion et les métriques de performance comparatives sont illustrées dans la figure 5.
Après la section 8, des explications globales et locales des prédictions du modèle ont été générées afin d'évaluer son interprétabilité. Les explications du modèle ont été produites à l'aide de SHAP et de LIME pour le jeu de données tabulaires sur le diabète chez les Indiens Pima, et une explication contrefactuelle spécifique à un patient a été générée pour illustrer un changement dans la prédiction. SHAP a été utilisé pour produire l'importance globale des caractéristiques, des visualisations en cascade spécifiques à un patient et des dépendances entre caractéristiques, tandis que LIME a été utilisé pour générer des explications locales à partir d'échantillons de test mis de côté. Les résultats correspondants en matière d'explicabilité sont présentés dans Figure 6.
La dernière étape du protocole a évalué la fiabilité statistique et la reproductibilité du flux de travail. L'ensemble du flux de travail a été répété sur 10 exécutions indépendantes en utilisant différentes graines aléatoires, tout en conservant la même stratégie de partitionnement des données, les paramètres de prétraitement, l'architecture du modèle, les hyperparamètres, l'environnement logiciel et les procédures d'évaluation. Les exécutions répétées ont donné un AUC-ROC de 0,957 ± 0,008, une exactitude de 93,24 ± 0,74 % et un score F1 de 92,35 ± 0,92 %, indiquant une variabilité relativement faible entre les exécutions répétées.
La stabilité des explications n'a pas été évaluée de manière quantitative dans cette validation réalisée. Bien que des explications SHAP et LIME aient été générées pour le jeu de données sur le diabète chez les Indiens Pima, aucune analyse distincte de corrélation de rang ou de chevauchement des caractéristiques entre les exécutions n'a été effectuée. Par conséquent, aucune métrique numérique relative à l'explication, à la stabilité ou à l'accord des attributions n'est rapportée. L'évaluation quantitative de la stabilité des explications est conservée dans le protocole général comme procédure facultative de reproductibilité pour les applications dans lesquelles des sorties d'explication répétées sont disponibles.
Les comparaisons statistiques ont été évaluées à l'aide d'un seuil de significativité prédéfini de p < 0,05. Des tests statistiques bilatéraux ont été utilisés lorsque cela était applicable, et les statistiques de test correspondantes, les valeurs de p et les intervalles de confiance à 95 % ont été indiqués afin de quantifier la significativité statistique et l'incertitude liées aux différences de performance observées. Les résultats expérimentaux de validation statistique et de reproductibilité, incluant la performance de la validation croisée, les intervalles de confiance, les comparaisons statistiques et la variabilité des répétitions, sont résumés dans Tableau 6. Les analyses correspondantes de test statistique et de reproductibilité sont illustrées dans Figure 7.
Ces résultats ont fourni une preuve expérimentale de la stabilité prédictive et de la reproductibilité dans les conditions de calcul et le jeu de données testés. L'environnement de calcul, les caractéristiques du jeu de données, les procédures de prétraitement, la configuration du modèle, les analyses statistiques et les paramètres d'explicabilité nécessaires à la réplication indépendante ont été documentés conformément à la liste de contrôle de reproductibilité présentée dans Tableau 7. Une évaluation par des experts cliniciens des sorties XAI générées n'a pas été réalisée dans l'exemple validé traité dans le présent travail.
Dans l'ensemble, l'application du protocole a produit un jeu de données de santé normalisé, adapté au développement de modèles d'intelligence artificielle, ainsi qu'un modèle optimisé utilisant des paramètres prédéfinis. Le flux de travail a permis une évaluation systématique des performances prédictives, la génération d'explications du modèle à l'aide de techniques XAI appropriées, et une évaluation statistique de la robustesse et de la reproductibilité du modèle. Ensemble, les résultats ont démontré la mise en œuvre et la reproductibilité du flux de travail XAI proposé dans les conditions expérimentales évaluées dans l'exemple de validation traité.

Figure 1 : Workflow central en neuf étapes pour le développement de modèles d'intelligence artificielle reproductibles et explicables en santé. Le workflow comprend (1) la définition de la tâche de prédiction en santé, (2) la configuration de l'environnement informatique, (3) l'acquisition et la validation du jeu de données, (4) le prétraitement des données, (5) la partition du jeu de données, (6) l'entraînement du modèle prédictif, (7) l'évaluation des performances prédictives, (8) l'analyse d'explicabilité et (9) l'évaluation statistique et de la reproductibilité. La validation externe et l'évaluation par des experts cliniciens sont considérées comme des extensions facultatives du protocole et ne sont pas incluses dans le workflow central en neuf étapes. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2 : Flux de travail pour la préparation et le prétraitement des ensembles de données de santé. (A) Acquisition de données de santé à partir de dossiers cliniques, d'images médicales, de signaux physiologiques et de sources de données multimodales. (B) Intégration et prétraitement des données, incluant la gestion des valeurs manquantes, la normalisation, la suppression du bruit et l'augmentation des données. (C) Partitionnement de l'ensemble de données en sous-ensembles d'apprentissage, de validation et de test. (D) Évaluation de la qualité montrant la répartition des classes, la normalisation des caractéristiques et les résultats du prétraitement avant le développement du modèle. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 3 : Flux expérimental pour la préparation, le prétraitement, la partition et l'évaluation de la qualité du jeu de données sur le diabète chez les Indiens Pima. Le flux comprend l'acquisition du jeu de données, l'évaluation de la qualité des données, la gestion des valeurs invalides et manquantes, la standardisation des caractéristiques numériques, la partition du jeu de données en sous-ensembles d'entraînement, de validation et de test indépendant, ainsi que la vérification finale de la qualité avant le développement du modèle. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 4 : Courbes d'apprentissage expérimentales de formation et de validation du modèle proposé, utilisant le jeu de données sur le diabète des Indiens Pima. (A) Perte de formation et de validation au cours de la période complète d'apprentissage. (B) Précision de formation et de validation au cours de la période complète d'apprentissage. (C) Vue agrandie de la perte pendant les époques 50 à 100. (D) Vue agrandie de la précision pendant les époques 50 à 100. La meilleure performance de validation a été obtenue à l'époque 78, avec une perte de validation de 0,142 et une précision de validation de 94,6 %. L'arrêt prématuré a été déclenché à l'époque 88, avec une tolérance de 10 époques. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 5 : Évaluation des performances prédictives expérimentales du cadre XAI proposé à l'aide du jeu de test indépendant (n = 154). (A) Courbe caractéristique de fonctionnement du récepteur (ROC) illustrant les performances de discrimination du modèle XAI proposé et des modèles de référence. (B) Courbes précision-rappel (PR) illustrant les performances en termes de précision et de rappel du modèle XAI proposé et des modèles de référence. (C) Matrice de confusion du modèle XAI proposé sur le jeu de test indépendant, avec les valeurs correspondantes d'exactitude, de sensibilité (rappel) et de spécificité. (D) Comparaison de l'exactitude, de la précision, du rappel, de la spécificité, du score F1, du coefficient de corrélation de Matthews (MCC), de l'aire sous la courbe ROC (AUC) et de la précision moyenne (AP) entre les modèles évalués. Tous les résultats quantitatifs présentés dans cette figure correspondent à l'expérience de validation sur le jeu de données Pima Indians Diabetes Dataset. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6: Sorties d'interprétabilité générées à partir des prédictions sur un ensemble de test indépendant du modèle proposé entraîné sur le jeu de données Pima Indians Diabetes. (A) Graphique résumé global de SHAP montrant la distribution des contributions des caractéristiques sur l'ensemble de test. (B) Graphique d'importance des caractéristiques SHAP basé sur les valeurs absolues moyennes de SHAP.C) Graphique en cascade SHAP spécifique au patient montrant la contribution des caractéristiques individuelles à la probabilité prédite de diabète. (D) Explication locale LIME montrant les contributions des caractéristiques pour le patient test n°125. (E) Graphique de dépendance SHAP illustrant la relation entre les valeurs de glucose et leurs contributions SHAP. (F) Explication contrefactuelle spécifique au patient montrant les changements minimaux des caractéristiques associés à une modification de la prédiction du modèle. Abréviations : SHAP = Shapley Additive exPlanations ; LIME = Local Interpretable Model-agnostic Explanations. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 7 : Validation statistique expérimentale et analyse de reproductibilité du modèle proposé à l'aide du jeu de données sur le diabète chez les Indiens Pima. (A) Performances de la validation croisée en cinq parties sur l'ensemble d'apprentissage. (B) Intervalles de confiance bootstrap à 95 % pour les performances sur l'ensemble de test indépendant. (C) Comparaisons statistiques avec les modèles de référence, incluant le test statistique, la statistique du test, la valeur-p et la significativité. (D) Cohérence des performances sur 10 exécutions indépendantes utilisant différentes graines aléatoires. Le test de McNemar a été utilisé pour comparer les précisions de classification appariées, le test de DeLong pour les AUC-ROC corrélées, et un test bootstrap apparié avec 1 000 rééchantillonnages pour la comparaison des scores F1. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
| Étape | Activité du protocole | Résultat attendu | État de mise en œuvre |
| 1 | Sélectionner et valider le jeu de données de santé | Données vérifiées, objectif de prédiction, distribution des classes et informations sur la qualité des données | Réalisé |
| 2 | Configurer l’environnement informatique | Matériel, logiciels, bibliothèques, versions et configuration informatique vérifiés | Réalisé |
| 3 | Prétraiter les données de santé et en contrôler la qualité | Jeu de données nettoyé, transformé et normalisé | Réalisé |
| 4 | Partitionner le jeu de données | Jeux de données d’entraînement, de validation et de test indépendants | Réalisé |
| 5 | Développer et optimiser le modèle prédictif/XAI | Architecture finale du modèle et hyperparamètres | Réalisé |
| 6 | Entraîner et conserver le modèle | Modèle entraîné, point de contrôle, configuration d’entraînement et journaux | Réalisé |
| 7 | Évaluer les performances prédictives et informatiques | Mesures de performance sur le jeu de test et comparaisons des performances | Réalisé |
| 8 | Générer et évaluer les sorties d’explicabilité | Sorties d’explication SHAP/LIME et autres pertinentes | Réalisé |
| 9 | Effectuer la validation statistique et l’évaluation de la reproductibilité | Intervalles de confiance, tests statistiques, résultats de répétitions et mesures de reproductibilité | Réalisé |
Tableau 1 : Résumé du flux de travail en neuf étapes du protocole de base appliqué lors de la validation illustrée utilisant le jeu de données sur le diabète chez les Indiens Pima. Le tableau distingue les neuf étapes mises en œuvre dans l'exemple traité sur le jeu de données sur le diabète chez les Indiens Pima, par rapport à la validation externe et à l'évaluation par un expert clinicien, qui restent des composantes facultatives du protocole général.
| Ensemble de données | Source des données | Application clinique | Modalité des données | Sujets/Enregistrements | Échantillons | Classes | Répartition des classes | Entraînement/Validation/Test | Rôle dans la présente étude | Statut de la validation | URL source |
| Ensemble de données sur le diabète des Indiens Pima | Référentiel d'apprentissage automatique UCI | Prédiction du diabète | Données cliniques tabulaires | 768 enregistrements | 768 | 2 | 500 non diabétiques ; 268 diabétiques | 60 % / 20 % / 20 % | Ensemble de données principal pour la validation expérimentale | Réalisée – workflow complet en neuf étapes | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), projet TCGA-BRCA | Classification du cancer du sein | Clinique + histopathologie | 1 098 cas | Dépendant de l'ensemble de données selon le type de données | Dépendant du critère d'évaluation | Aucune répartition unique des classes à l'échelle de l'ensemble de données | Non applicable – aucune division expérimentale effectuée | Exemple d'application du protocole uniquement | Non utilisé pour la validation expérimentale | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), projet TCGA-UCEC | Classification du cancer de l'endomètre | Clinique + histopathologie | Cohorte du projet ; taille dépendant du type de données et des filtres sélectionnés | Dépendant de l'ensemble de données selon le type de données | Dépendant du critère d'évaluation | Aucune répartition unique des classes à l'échelle de l'ensemble de données | Non applicable – aucune division expérimentale effectuée | Exemple d'application du protocole uniquement | Non utilisé pour la validation expérimentale | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, base de données cliniques MIMIC-III v1.4 | Prédiction d'issues cliniques | Séries temporelles cliniques | 46 520 patients | 58 976 admissions en soins intensifs | Dépendant de la tâche | Aucune répartition unique des classes à l'échelle de la base de données | Non applicable – aucune division expérimentale effectuée | Exemple d'application du protocole uniquement | Non utilisé pour la validation expérimentale | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | Compétition International Skin Imaging Collaboration (ISIC) | Classification des lésions cutanées | Images dermoscopiques | Non applicable – ensemble de données d'images | 25 331 images d'entraînement | 8 catégories d'entraînement | AKIEC 867 ; BCC 3 323 ; BKL 2 624 ; DF 239 ; MEL 4 522 ; NV 12 875 ; VASC 253 ; SCC 628 | Non applicable – aucune division expérimentale effectuée | Exemple d'application du protocole uniquement | Non utilisé pour la validation expérimentale | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | Harvard Dataverse / Archives ISIC | Classification des lésions cutanées | Images dermoscopiques | 7 470 lésions uniques | 10 015 images | 7 | AKIEC 327 ; BCC 514 ; BKL 1 099 ; DF 115 ; MEL 1 113 ; NV 6 705 ; VASC 142 | Non applicable – aucune division expérimentale effectuée | Exemple d'application du protocole uniquement | Non utilisé pour la validation expérimentale | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | Ensemble de données OhioT1DM, distribué publiquement à des fins de recherche | Surveillance/prédiction du diabète | Séries temporelles cliniques | 12 participants | 24 fichiers XML répartis entre les données d'entraînement/développement et de test | Prédiction de la glycémie continue ; pas une tâche de classification fixe | Non applicable | Fichiers d'entraînement/développement et de test définis par l'ensemble de données ; aucune division expérimentale effectuée ici | Exemple d'application du protocole uniquement | Non utilisé pour la validation expérimentale | https://pmc.ncbi.nlm.nih.gov/articles/PMC7881904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021 ; CBICA/Université de Pennsylvanie | Segmentation/classification des tumeurs cérébrales | IRM | 2 040 cas dans la cohorte du défi | 1 251 cas annotés pour l'entraînement ; quatre modalités IRM par cas | Dépendant de la tâche | Aucune répartition unique des classes à l'échelle de l'ensemble de données | Cohortes définies par le défi ; aucune division expérimentale effectuée ici | Exemple d'application du protocole uniquement | Non utilisé pour la validation expérimentale | https://www.med.upenn.edu/cbica/brats2021/ |
Tableau 2 : Caractéristiques des ensembles de données médicales et applicabilité du protocole proposé. Ce tableau résume les sources de données, les applications cliniques, les modalités, les caractéristiques des échantillons, les répartitions des classes, les stratégies de partitionnement des ensembles de données, le statut de validation et les informations sur les sources pour les ensembles de données médicales pris en compte dans le protocole. L'ensemble de données sur le diabète des Indiens Pima sert d'exemple principal pour la validation du protocole.
| Élément de configuration | Valeur utilisée lors de la validation expérimentale | État / Interprétation |
| Jeu de données | Pima Indians Diabetes Dataset | Jeu de données expérimental utilisé pour la validation |
| Algorithme / Modèle | Modèle prédictif tabulaire pour la classification binaire du diabète | Utiliser le nom exact de l'architecture indiqué dans le compte rendu expérimental, s'il est documenté séparément |
| Taux d'apprentissage | 0,001 | Valeur expérimentale |
| Optimiseur | Adam | Valeur expérimentale |
| Taille du lot | 32 | Valeur expérimentale |
| Nombre maximal d'époques | 100 | Valeur expérimentale |
| Fonction de perte | Cross-Entropy | Valeur expérimentale |
| Fonction d'activation | ReLU | Valeur expérimentale |
| Dropout | 0,5 | Valeur expérimentale |
| Décroissance des poids | 1e-4 | Valeur expérimentale |
| Normalisation par lot | Activée | Valeur expérimentale |
| Augmentation des données / Équilibrage des classes | Activée | Ne préciser SMOTE que si cette méthode a effectivement été appliquée lors de l'exécution rapportée |
| Stratégie de validation | Validation croisée en 5 parties | Valeur expérimentale |
| Arrêt précoce | Patience = 10 époques | Valeur expérimentale |
| Graine aléatoire | 42 | Utiliser la graine exacte enregistrée pour l'expérience |
| Exécutions répétées | 10 exécutions indépendantes avec différentes graines aléatoires | Analyse de reproductibilité expérimentale |
| Taille de l'image en entrée | Non applicable | Le jeu de données Pima est de type tabulaire |
| Dimension des caractéristiques | 512 | À utiliser uniquement si cette représentation finale des caractéristiques a effectivement été mise en œuvre |
| Explicabilité | SHAP + LIME ; explication contrefactuelle présentée dans la Figure 6 | Analyse XAI réellement rapportée |
| Métriques d'évaluation | Précision, exactitude, rappel, spécificité, score F1, MCC, AUC-ROC, AP | Métriques expérimentales rapportées |
| Matériel | NVIDIA GPU | Remplacer par le modèle exact du GPU si enregistré |
| Logiciel / Framework | Python 3.11 ; Scikit-learn ; composants du framework utilisés par l'implémentation | Utiliser les versions exactes des packages si enregistrées |
Tableau 3 : Environnement de calcul, architecture du modèle et configuration des hyperparamètres utilisés pour la mise en œuvre du protocole. Le tableau précise la plateforme de calcul, l'environnement logiciel, l'architecture du modèle, la configuration des entrées, les paramètres d'optimisation, les réglages de régularisation et les paramètres de reproductibilité utilisés pour mettre en œuvre le flux de travail XAI proposé.
| Paramètre | Spécification ou résultat représentatif |
| Optimiseur | Adam |
| Taux d'apprentissage | 0,001 |
| Taille du lot | 32 |
| Nombre maximal d'époques | 100 |
| Patiences pour l'arrêt précoce | 10 époques |
| Meilleure époque | 78 |
| Époque d'arrêt précoce | 88 |
| Meilleure perte de validation | 0,142 |
| Meilleure précision de validation | 94,6 % |
| Résultat de l'entraînement | La perte d'entraînement et de validation a diminué et convergé |
| Résultat de la validation | La précision d'entraînement et de validation a augmenté et s'est stabilisée |
| Résultat de l'optimisation | Les meilleures performances du modèle ont été atteintes à l'époque 78 |
| Contrôle du surapprentissage | L'arrêt précoce a empêché toute optimisation supplémentaire au-delà de l'époque sélectionnée comme la meilleure |
Tableau 4 : Spécifications de l'entraînement du modèle et résultats de l'optimisation. Ce tableau résume l'optimiseur, le taux d'apprentissage, la taille du lot, le nombre maximal d'époques d'entraînement, les performances de validation, la convergence de l'entraînement, le résultat de l'optimisation et la stratégie de contrôle du surapprentissage utilisés lors du développement du modèle.
| Modèle | Précision (%) | Exactitude (%) | Rappel (%) | Spécificité (%) | Score F1 (%) | MCC | AUC (ROC) | AP (PR) |
| Modèle XAI proposé | 93,5 | 94,5 | 92,4 | 94,6 | 93,4 | 0,87 | 0,96 | 0,94 |
| Apprentissage profond (CNN) | 89,1 | 89,8 | 88,1 | 90 | 88,9 | 0,78 | 0,92 | 0,9 |
| Forêt aléatoire | 84,3 | 85 | 83,2 | 85,7 | 84,1 | 0,67 | 0,86 | 0,81 |
| Machines à vecteurs de support (SVM) | 78,6 | 79,3 | 77,1 | 80 | 78,2 | 0,54 | 0,79 | 0,72 |
| Ligne de base (classe majoritaire) | 62,1 | 62,1 | 100 | 0 | 76,6 | 0 | 0,5 | 0,5 |
Tableau 5 : Comparaison des performances prédictives des modèles évalués. Le tableau compare le modèle XAI proposé avec les modèles de référence évalués à l’aide de l’exactitude, de la précision, du rappel, de la spécificité, du score F1, du coefficient de corrélation de Matthews, de la surface sous la courbe caractéristique de fonctionnement du récepteur et de la précision moyenne.
| Analyse de validation | Comparaison / Métrique | Test statistique | Statistique du test | p-valeur | Résultat expérimental / IC à 95 % |
| Validation croisée en cinq parties | Précision | Descriptif (moyenne ± écart-type) | — | — | 93,01 ± 0,48 % |
| Validation croisée en cinq parties | AUC-ROC | Descriptif (moyenne ± écart-type) | — | — | 0,954 ± 0,007 |
| Validation croisée en cinq parties | Exactitude | Descriptif (moyenne ± écart-type) | — | — | 92,42 ± 0,87 % |
| Validation croisée en cinq parties | Rappel | Descriptif (moyenne ± écart-type) | — | — | 93,02 ± 0,45 % |
| Validation croisée en cinq parties | Score-F1 | Descriptif (moyenne ± écart-type) | — | — | 92,72 ± 0,62 % |
| Intervalle de confiance bootstrap à 95 % | Précision | Bootstrap (1 000 rééchantillonnages) | — | — | 0,935 [0,897 ; 0,973] |
| Intervalle de confiance bootstrap à 95 % | Exactitude | Bootstrap (1 000 rééchantillonnages) | — | — | 0,930 [0,890 ; 0,970] |
| Intervalle de confiance bootstrap à 95 % | Rappel | Bootstrap (1 000 rééchantillonnages) | — | — | 0,922 [0,880 ; 0,963] |
| Intervalle de confiance bootstrap à 95 % | Score-F1 | Bootstrap (1 000 rééchantillonnages) | — | — | 0,926 [0,887 ; 0,965] |
| Intervalle de confiance bootstrap à 95 % | AUC-ROC | Bootstrap (1 000 rééchantillonnages) | — | — | 0,958 [0,931 ; 0,984] |
| Modèle proposé vs. CNN | Précision (%) | Test de McNemar | 9,32 | 0,0023 | Significatif (α = 0,05) |
| Modèle proposé vs. CNN | AUC-ROC | Test de DeLong | 3,87 | 0,0001 | Significatif (α = 0,05) |
| Modèle proposé vs. CNN | Score-F1 | Bootstrap apparié (1 000 rééchantillonnages) | 2,81 | 0,0044 | Significatif (α = 0,05) |
| Modèle proposé vs. Forêt aléatoire | Précision (%) | Test de McNemar | 14,27 | 0,0002 | Significatif (α = 0,05) |
| Modèle proposé vs. Forêt aléatoire | AUC-ROC | Test de DeLong | 5,86 | <0,0001 | Significatif (α = 0,05) |
| Modèle proposé vs. Forêt aléatoire | Score-F1 | Bootstrap apparié (1 000 rééchantillonnages) | 4,03 | 0,0003 | Significatif (α = 0,05) |
| Modèle proposé vs. SVM | Précision (%) | Test de McNemar | 16,08 | <0,0001 | Significatif (α = 0,05) |
| Modèle proposé vs. SVM | AUC-ROC | Test de DeLong | 6,95 | <0,0001 | Significatif (α = 0,05) |
| Modèle proposé vs. SVM | Score-F1 | Bootstrap apparié (1 000 rééchantillonnages) | 4,62 | <0,0001 | Significatif (α = 0,05) |
| Reproductibilité sur plusieurs exécutions (10 exécutions indépendantes) | AUC-ROC | Descriptif (moyenne ± écart-type) | — | — | 0,957 ± 0,008 |
| Reproductibilité sur plusieurs exécutions (10 exécutions indépendantes) | Précision (%) | Descriptif (moyenne ± écart-type) | — | — | 93,24 ± 0,74 % |
| Reproductibilité sur plusieurs exécutions (10 exécutions indépendantes) | Score-F1 (%) | Descriptif (moyenne ± écart-type) | — | — | 92,35 ± 0,92 % |
Tableau 6 : Résultats de validation statistique et de reproductibilité obtenus à partir de la mise en œuvre expérimentale utilisant le jeu de données sur le diabète chez les Indiens Pima. Le tableau résume les performances de la validation croisée en cinq parties, les intervalles de confiance à 95 % fondés sur le bootstrap, les comparaisons statistiques du modèle proposé avec les modèles de référence, ainsi que la reproductibilité obtenue sur 10 exécutions indépendantes avec des graines aléatoires différentes. La validation externe et l'évaluation par un expert clinique n'ont pas été réalisées dans le cadre de cette validation exemplifiée.
| No. | Élément de la liste de vérification | Documentation requise | Enregistrement ou vérification recommandé |
| 1 | Environnement logiciel | Système d'exploitation, langage de programmation et environnement logiciel | Enregistrer les versions exactes du système d'exploitation et du langage de programmation. |
| 2 | Versions des logiciels et bibliothèques | Versions des principales bibliothèques et paquets logiciels | Enregistrer les noms et versions exacts des paquets et bibliothèques. |
| 3 | Spécifications du matériel | Spécifications du processeur, du GPU, de la mémoire vive, du stockage et des accélérateurs | Enregistrer le matériel informatique utilisé. |
| 4 | Identification du jeu de données | Nom, source, version et informations d'accès du jeu de données | Enregistrer la source et la version exactes du jeu de données, ainsi que la date d'accès le cas échéant. |
| 5 | Caractéristiques du jeu de données | Taille de l'échantillon et répartition des classes | Enregistrer le nombre total d'échantillons et la répartition des classes pour chaque sous-ensemble. |
| 6 | Partitionnement du jeu de données | Stratégie de division en ensemble d'entraînement, de validation et de test indépendant | Documenter les proportions ou effectifs des sous-ensembles et la stratification. |
| 7 | Prévention des fuites de données | Procédure utilisée pour éviter les fuites d'information | Documenter la séparation des sujets ou échantillons et l'estimation des paramètres de prétraitement sur l'ensemble d'entraînement uniquement. |
| 8 | Paramètres de prétraitement | Paramètres de nettoyage, gestion des valeurs manquantes, normalisation, encodage et transformations | Enregistrer toutes les opérations de prétraitement et les valeurs des paramètres. |
| 9 | Augmentation des données | Méthodes et paramètres d'augmentation, le cas échéant | Documenter les méthodes, probabilités et plages de paramètres. |
| 10 | Architecture du modèle | Architecture et configuration finales du modèle | Documenter le type de modèle, les couches ou composants, les dimensions et les fonctions d'activation. |
| 11 | Hyperparamètres | Hyperparamètres d'entraînement et d'optimisation | Enregistrer le taux d'apprentissage, la taille du lot, l'optimiseur, le nombre d'époques, l'arrêt précoce et les paramètres ajustés. |
| 12 | Graines aléatoires | Graines aléatoires utilisées pour une exécution reproductible | Enregistrer les graines utilisées pour la division, l'initialisation et les exécutions répétées. |
| 13 | Configuration de l'entraînement | Procédure d'entraînement et stratégie de sélection du modèle | Documenter la validation, la sauvegarde des points de contrôle et les critères de sélection du modèle. |
| 14 | Métriques d'évaluation | Métriques prédictives et statistiques prédéfinies pour l'évaluation | Enregistrer toutes les mesures de performance rapportées. |
| 15 | Intervalles de confiance | Intervalles d'incertitude pour les mesures de performance | Documenter la méthode d'estimation des intervalles de confiance et les rééchantillonnages bootstrap le cas échéant. |
| 16 | Tests statistiques | Procédures statistiques pour la comparaison des modèles | Documenter le test, la statistique, la valeur-p, le seuil de significativité et les hypothèses. |
| 17 | Analyse sur exécutions répétées | Exécutions indépendantes utilisant différentes graines aléatoires | Enregistrer le nombre d'exécutions et la moyenne ± écart-type des métriques clés. |
| 18 | Configuration de l'explicabilité | Méthodes et paramètres d'explicabilité | Documenter les paramètres applicables de SHAP, LIME, Grad-CAM, attention, contre-factuels, etc. |
| 19 | Évaluation de l'explicabilité | Évaluation objective de la fiabilité et de l'utilité des explications | Documenter la fidélité, la stabilité, l'infidélité, la localisation et l'évaluation par des experts le cas échéant. |
| 20 | Artéfacts du modèle | Poids du modèle entraîné et fichiers de configuration | Archiver le modèle entraîné final, l'architecture ou la configuration, et les informations de sélection. |
| 21 | Disponibilité du code | Code nécessaire pour le prétraitement, l'entraînement, l'évaluation et la génération d'explications | Enregistrer les informations sur le dépôt ou l'accès contrôlé au code, le cas échéant. |
| 22 | Documentation de l'exécution | Commandes, scripts, fichiers de configuration et instructions | Enregistrer les commandes et configurations nécessaires pour reproduire le flux de travail. |
| 23 | Documentation des sorties | Prédictions, résultats d'évaluation, figures et sorties d'explication | Archiver les sorties générées et les relier à l'expérience ou exécution correspondante. |
| 24 | Vérification de la reproductibilité | Vérification de la cohérence entre exécutions indépendantes | Comparer les résultats d'exécutions répétées et rapporter les mesures de variabilité prédéfinies. |
Tableau 7 : Liste de contrôle de reproductibilité pour la réplication indépendante du flux de travail XAI proposé. Cette liste précise les exigences en matière de calcul, de jeu de données, de prétraitement, de développement de modèles, d'évaluation, de validation statistique, d'explicabilité et de documentation nécessaires pour reproduire le protocole expérimental.