Tous les ensembles de données utilisés dans cette étude ont été obtenus à partir de dépôts publics et entièrement anonymisés, y compris le dépôt UCI Machine Learning, la base de données PhysioNet MIMIC-III et les jeux de données de radiographies thoraciques du NIH. Aucune information identifiable du patient n’a été consultée. L’étude a respecté les directives institutionnelles d’éthique de la recherche pour l’analyse secondaire des données dé-identifiées publiques. L’approbation formelle du Conseil d’Éthique Institutionnelle n’était pas requise car aucun participant humain n’a été recruté directement et aucune information de santé protégée n’a été utilisée.
1. Aperçu des cadres expérimentaux
- Développer un pipeline d’intelligence artificielle (XAI) reproductible et explicable pour des analyses de santé transparentes. Organisez le flux de travail en couche données, couche prétraitement, couche modélisation, couche explicabilité, couche d’évaluation et couche de visualisation.
- Intégrez ces modules dans un flux de travail unifié capable de traiter des données cliniques structurées, des dossiers médicaux électroniques et des ensembles de données d’imagerie médicale.
- Assurez-vous que chaque module contribue à la reproductibilité, à l’interprétabilité, à l’évolutivité et à l’exécution expérimentale standardisée.
- Concevez l’architecture modulaire pour supporter le flux continu de données et garantir que chaque étape du pipeline contribue à la reproductibilité, à l’interprétabilité et à l’évolutivité tout au long du flux de travail expérimental.
2. Environnement de calcul et configuration du système
- Installez les dépendances logicielles requises avant d’exécuter le flux de travail en ouvrant un terminal en ligne de commande et en exécutant la commande suivante :
pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
- Vérifiez l’installation réussie de tous les logiciels et confirmez la compatibilité avec les versions logicielles indiquées dans le tableau des matériaux avant de procéder au prétraitement des données et au développement du modèle.
- Utilisez Python 3.11 comme environnement de programmation principal. Installer et configurer NumPy 1.26 et Pandas 2.1 pour les tâches de manipulation des données et d’ingénierie de fonctionnalités. Installez Scikit-learn 1.5 pour le développement et l’évaluation de modèles d’apprentissage automatique.
- Installez TensorFlow 2.15 pour l’entraînement et l’inférence de modèles en apprentissage profond. Installez SHAP 0.46 et LIME 0.2.0 pour une analyse d’explicabilité. Installez OpenCV 4.10 pour les tâches de traitement d’image. Installez Matplotlib 3.9 et Seaborn 0.13 pour la visualisation des données et le reporting des résultats. Consultez le tableau des matériaux pour les spécifications logicielles complètes et les détails d’implémentation nécessaires à la reproductibilité.
- Configurez l’environnement de calcul à l’aide d’une station de travail équipée d’un processeur multi-cœur, d’une accélération GPU (GPU) et de ressources mémoire suffisantes pour accueillir de grands ensembles de données de santé et des charges de travail en apprentissage profond.
- Définir des graines aléatoires fixes pour le partitionnement des données, l’initialisation du modèle et les procédures d’entraînement afin d’assurer la reproductibilité entre les exécutions expérimentales. Activez les mécanismes de journalisation pour enregistrer les opérations de prétraitement des données, les configurations de modèles, les paramètres d’hyperparamètres, les procédures d’entraînement et les résultats d’évaluation tout au long du flux de travail.
- Configurez les architectures des modèles, les paramètres d’optimisation, les taux d’apprentissage, la taille des lots, les paramètres d’entraînement et les valeurs des hyperparamètres selon les spécifications résumées dans le tableau 1. Respectez ces paramètres lors des expériences de réplication afin d’assurer la cohérence avec les résultats rapportés.
- Sortie Attendue – Un environnement informatique entièrement configuré et reproductible avec tous les logiciels nécessaires, les ressources matérielles, les mécanismes de journalisation et les paramètres de configuration des modèles disponibles pour le prétraitement des données, le développement du modèle, l’analyse d’explicabilité et les procédures d’évaluation ultérieures.
| Composant | Paramètre | Valeur | Description |
| Forêt aléatoire | n_estimators | 100 | Nombre d’arbres |
| Forêt aléatoire | max_depth | Aucun | Profondeur de l’arbre |
| XGBoost | learning_rate | 0.01 | Taux d’apprentissage |
| XGBoost | n_estimators | 100 | Munitions boostantes |
| CNN | Époques | 25 | Époques d’entraînement |
| CNN | batch_size | 32 | Taille du lot |
| CNN | Optimiseur | Adam | Algorithme d’optimisation |
| MLP | hidden_layers | 2 | Nombre de couches cachées |
| MLP | Activation | ReLU | Fonction d’activation |
| Généralités | train_split | 70% | Rapport de données d’entraînement |
| Généralités | validation_split | 15% | Rapport de validation |
| Généralités | test_split | 15% | Ratio d’essais |
Tableau 1 : Détails de l’implémentation et configuration des hyperparamètres.
Ce tableau résume l’environnement informatique, les bibliothèques logicielles, les configurations de modèles d’apprentissage automatique et d’apprentissage profond, les paramètres d’optimisation, les taux d’apprentissage, les tailles de lot, les paramètres d’entraînement et les valeurs d’hyperparamètre utilisés tout au long de l’évaluation expérimentale du cadre d’IA explicable proposé.
3. Préparation et prétraitement des jeux de données
- Sélectionner des ensembles de données de santé accessibles publiquement afin d’assurer la transparence et la reproductibilité du flux de travail expérimental.
- Utilisez quatre scénarios de santé représentatifs pour valider le cadre proposé : (i) diagnostic du cancer du sein à l’aide du Wisconsin Breast Cancer Dataset, (ii) prédiction du risque de diabète à l’aide du Pima Indians Diabetes Dataset, (iii) prédiction des résultats cliniques à l’aide des dossiers médicaux électroniques MIMIC-III, et (iv) classification des maladies thoraciques à l’aide du jeu de données des radiographies thoraciques du NIH. Choisissez ces ensembles de données pour évaluer le cadre à travers les dossiers cliniques structurés, les dossiers de santé électroniques longitudinaux et les modalités d’imagerie médicale couramment utilisées dans les systèmes d’aide à la décision en santé.
- Importez chaque jeu de données dans l’environnement Python et séparez les enregistrements en caractéristiques d’entrée et variables cibles. Organiser des données cliniques structurées pour les tâches de prédiction de maladie, les dossiers médicaux électroniques pour l’analyse longitudinale des résultats, et les ensembles de données d’imagerie médicale pour les tâches de classification diagnostique. Vérifiez l’intégrité de chaque jeu de données avant de procéder aux opérations de prétraitement.
- Identifier et corriger les valeurs manquantes en utilisant des techniques d’imputation appropriées. Standardiser les caractéristiques numériques grâce à des procédures d’échelle et de normalisation des caractéristiques afin d’assurer la comparabilité entre les variables.
- Encoder des variables catégorielles en utilisant des méthodes d’encodage appropriées basées sur les caractéristiques du jeu de données. Effectuer la sélection des caractéristiques en utilisant l’analyse de corrélation et des mesures d’importance des caractéristiques basées sur des modèles afin d’identifier les variables les plus pertinentes et de réduire la dimensionnalité des données.
- Redimensionnez toutes les images médicales à 224 à 224 pixels avant l’entraînement du modèle. Normaliser les valeurs d’intensité des pixels selon les exigences de l’architecture d’apprentissage profond sélectionnée. Appliquer des techniques d’augmentation de données, incluant la rotation d’image et le retournement horizontal, pour améliorer la généralisation des modèles et réduire le surajustement. Vérifiez la qualité de l’image et assurez-vous de la cohérence des dimensions de l’image dans tout le jeu de données.
- Évaluez l’intégrité des données en évaluant l’exhaustivité, la cohérence et l’alignement des étiquettes de caractéristiques des ensembles de données. Vérifiez que tous les enregistrements sont correctement attribués à leurs classes cibles correspondantes. Examinez les caractéristiques des ensembles de données, y compris la taille de l’échantillon, le nombre de caractéristiques et la modalité des données, telles que résumées dans le tableau 2.
- Mettez en place des procédures de validation spécifiques à chaque ensemble de données afin d’assurer la rigueur méthodologique et la reproductibilité. Enregistrez la taille de l’échantillon, la répartition des classes, la stratégie de répartition train-validation-test, les mesures de prévention des fuites, les procédures d’optimisation des hyperparamètres, la conception croisée et le protocole de test externe pour chaque jeu de données. Résumez ces procédures de validation dans le tableau 3.
- Effectuer des contrôles de qualité en prétraitement en évaluant la gestion des valeurs manquantes, la suppression des valeurs aberrantes, la mise à l’échelle des caractéristiques, l’encodage catégorique, la préservation de la distribution des classes et la partition des ensembles de données. Vérifiez que les opérations de prétraitement sont appliquées de manière cohérente sur tous les ensembles de données.
- Confirmez l’absence de fuite importante de données lors du partitionnement des jeux de données. Examinez les résultats de validation du prétraitement présentés à la Figure 1 afin de vous assurer que des ensembles de données standardisés ont été générés pour les analyses ultérieures d’apprentissage automatique et d’explicabilité.
- Résultats attendus – Générer des ensembles de données nettoyés et standardisés avec des valeurs manquantes correctement adressées, des variables catégorielles encodées, des caractéristiques numériques normalisées, et des enregistrements partitionnés en sous-ensembles d’entraînement, de validation et de test. Assurez-vous que les caractéristiques des ensembles de données, les distributions de classes et les procédures de validation correspondent à celles rapportées dans les Tableaux 2 et 3, et confirmez la validation réussie du prétraitement comme illustré à la Figure 1.
| Jeu de données | Type | Échantillons | Caractéristiques | Cible |
| Cancer du sein | Tabulaire | 569 | 30 | Bénin/Malin |
| Diabète | Tabulaire | 768 | 8 | Conséquences du diabète |
| MIMIC-III | DSE | ~60 000 | Variables cliniques | Mortalité |
| Radiographie thoracique | Imagerie | ~112 000 | Images | Étiquettes de maladies |
Tableau 2 : Caractéristiques de l’ensemble de données et cas d’utilisation dans le secteur de la santé.
Ce tableau fournit un résumé des ensembles de données de santé utilisés dans l’étude, incluant le type de jeu de données, le nombre d’échantillons, le nombre de caractéristiques, les variables cibles, le domaine d’application de la santé et les cas d’usage cliniques associés. Ces ensembles de données englobent des dossiers cliniques structurés, des dossiers médicaux électroniques et des données d’imagerie médicale afin de démontrer l’applicabilité du cadre à travers divers scénarios d’analyse en santé.
| Jeu de données | Taille de l’échantillon | Répartition des classes | Stratégie de Split | Prévention des fuites | Recherche par hyperparamètres | Validation croisée | Test externe |
| Cancer du sein (UCI Wisconsin) | 569 | 357 Bénin / 212 Malin | 70/15/15 | Prétraitement uniquement pour trains | Recherche en grille | CV stratifié à 5 branches | Ensemble Indépendant de Résistance |
| Diabète des Indiens Pima | 768 | 500 Non-Diabétiques / 268 Diabétiques | 70/15/15 | Prétraitement uniquement pour trains | Recherche en grille | CV stratifié à 5 branches | Ensemble Indépendant de Résistance |
| MIMIC-III EHR | 5274 | Cohortes stratifiées par résultats | 70/15/15 Niveau patient | Séparation au niveau du patient | Recherche aléatoire | CV au niveau patient à 5 branches | Ensemble Indépendant de Résistance |
| Radiographie thoracique des NIH | 112120 | Pneumonie / Normale stratifiée | 70/15/15 | Séparation au niveau d’image | Recherche aléatoire | CV stratifié à 5 branches | Ensemble Indépendant de Résistance |
Tableau 3 : Validation au niveau des ensembles de données et conception expérimentale.
Ce tableau résume la méthodologie de validation employée pour chaque jeu de données, incluant la taille de l’échantillon, la distribution des classes, la stratégie de répartition train-validation-test, les procédures de prévention des fuites, les méthodes d’optimisation des hyperparamètres, la conception croisée de validation et les protocoles de test externes. Ces mesures ont été mises en œuvre pour garantir la rigueur méthodologique, la reproductibilité et une évaluation impartiale du modèle.

Figure 1 : Validation du pipeline de prétraitement des données.
Résultats de validation pour les opérations clés de prétraitement effectuées avant le développement du modèle. (A) Analyse des valeurs manquantes à travers les caractéristiques représentatives de la santé. (B) Distribution d’une variable numérique avant et après la manipulation des valeurs aberrantes. (C) Validation de la mise à l’échelle des fonctionnalités via la standardisation. (D) Validation de l’encodage catégorique. (E) Distribution de classes après prétraitement. (F) Validation du partitionnement des données train-validation-test. Ces résultats confirment le prétraitement et la préparation réussis des ensembles de données pour la modélisation prédictive et l’analyse de l’explicabilité. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
4. Architecture système du cadre d’IA explicable
- Organiser le cadre à l’aide d’une architecture en couches pour faciliter le traitement modulaire, améliorer la transparence des flux de travail et soutenir une implémentation reproductible. Configurez la couche de données pour recevoir et gérer des ensembles de données brutes en santé. Acheminez tous les ensembles de données entrants via la couche de données avant d’initier les opérations de prétraitement.
- Effectuer des procédures de nettoyage des données, transformations, normalisation, ingénierie des caractéristiques et encodage au sein de la couche de prétraitement. Assurez-vous que toutes les opérations de prétraitement sont terminées avant le développement du modèle.
- Développer des modèles prédictifs au sein de la couche de modélisation en utilisant l’apprentissage automatique et les algorithmes d’apprentissage profond. Train Gradient Boosting, Random Forest, Multilayer Perceptron (MLP) et réseaux de neurones convolutionnels (CNN) utilisant les ensembles de données prétraités et des configurations optimisées d’hyperparamètres.
- Appliquer des techniques d’explicabilité au sein de la couche d’explicabilité pour interpréter les prédictions des modèles. Générez des explications d’attribution de caractéristiques en utilisant SHAP et LIME pour des ensembles de données structurés. Générez des heatmaps Grad-CAM pour des modèles basés sur des images afin de visualiser les régions contribuant aux prédictions du modèle.
- Évaluer la performance prédictive et explicable au sein de la couche d’évaluation. Calculez la précision, la précision, la rappel, le score F1, le ROC-AUC, la fidélité, la stabilité et les métriques d’évaluation centrées sur le clinicien. Consignez tous les résultats des évaluations pour analyses et rapports ultérieurs.
- Générez des résultats visuels cliniquement interprétables au sein de la couche de visualisation. Créez des graphiques de comparaison de performances, des visualisations d’importance des caractéristiques, des graphiques résumés SHAP, des explications LIME, des cartes thermiques Grad-CAM et des tableaux de bord de reporting orientés cliniciens. Stockez tous les résultats visuels pour inclusion dans le rapport expérimental final.
- Examinez l’architecture complète du framework illustrée à la Figure 2 avant de procéder à l’exécution du workflow.
- Résultats attendus - Générer des modèles entièrement entraînés en apprentissage automatique et deep learning, incluant des architectures Gradient Boosting, Random Forest, CNN et MLP. Stockez les configurations de modèles, les hyperparamètres optimisés, les journaux d’entraînement, les fichiers de points de contrôle, les sorties d’explicabilité et les artefacts de visualisation pour une évaluation et une analyse d’interprétabilité ultérieure.

Figure 2 : Architecture système du cadre d’IA explicable pour l’analytique en santé. Veuillez cliquer ici pour voir une version agrandie de cette figure.
5. Exécution du flux de travail
- Acquérir des ensembles de données de santé à partir de dépôts publics et stocker ces ensembles de données dans des formats structurés adaptés à l’apprentissage automatique et à l’analyse de deep learning. Examinez le flux de travail complet illustré à la Figure 3 avant d’entamer la procédure expérimentale.
- Effectuer le nettoyage et le prétraitement des données conformément aux procédures décrites à la Section 3. Normaliser les variables numériques en utilisant des méthodes d’échelle appropriées. Encoder des variables catégorielles en utilisant des techniques d’encodage appropriées. Identifier et imputer les valeurs manquantes en utilisant des stratégies d’imputation spécifiques à chaque ensemble de données. Vérifiez la qualité des données, l’alignement des étiquettes de caractéristiques et l’exhaustivité du jeu de données avant de procéder au développement du modèle.
- Partitionner chaque jeu de données en sous-ensembles d’entraînement, de validation et de test pour soutenir une évaluation impartiale du modèle. Préserver les distributions de classes lors du partitionnement des jeux de données et mettre en place des mesures de prévention des fuites lorsque cela est applicable. Réservez le sous-ensemble de test exclusivement pour l’évaluation finale du modèle.
- Entraînez des modèles d’apprentissage automatique sur des ensembles de données structurés à l’aide d’algorithmes basés sur ensemble, notamment le Gradient Boosting et le Random Forest. Entraînez des modèles d’apprentissage profond sur des ensembles de données d’imagerie utilisant des architectures de réseaux neuronaux convolutionnels (CNN) capables d’apprendre les caractéristiques spatiales de l’image. Mettez à jour les paramètres du modèle de manière itérative pendant la formation et surveillez la performance de validation après chaque époque d’entraînement. Appliquer un arrêt précoce lorsque la performance de validation se détériore ou ne s’améliore pas selon les critères d’arrêt prédéfinis.
- Optimiser les hyperparamètres du modèle en utilisant des stratégies de recherche systématique, incluant la recherche en grille et la recherche randomisée. Ajustez le taux d’apprentissage, le nombre d’estimateurs, la profondeur de l’arbre, la taille du lot, le nombre d’époques et d’autres paramètres spécifiques au modèle en fonction de la performance de validation. Sélectionnez le modèle final en fonction de la performance prédictive et de la capacité de généralisation à travers les ensembles de données de validation.
- Appliquer des méthodes d’explicabilité après avoir terminé la formation modèle. Générer des explications globales en utilisant des techniques d’attribution de caractéristiques pour identifier les variables contribuant le plus fortement aux prédictions du modèle. Générer des explications locales pour analyser les cas de prédiction individuels et évaluer le comportement du modèle au niveau de l’échantillon. Créez des heatmaps Grad-CAM pour des modèles de classification d’images afin de mettre en évidence les régions de l’image qui contribuent au résultat prédit. Stockez tous les résultats explicatifs pour une analyse et un rapport ultérieurs.
- Évaluer la performance prédictive en utilisant la précision, la précision, le rappel, le score F1 et la zone caractéristique de fonctionnement du récepteur sous la courbe (ROC-AUC). Évaluer la qualité de l’explication en utilisant des indicateurs de fidélité et de stabilité pour évaluer la fiabilité et la cohérence de l’explication. Comparez la performance des modèles entre ensembles de données et méthodes d’explicabilité pour évaluer la robustesse et la généralisabilité du cadre.
- Générez des résultats de visualisation et des rapports analytiques pour communiquer les résultats de manière cliniquement interprétable. Créez des graphiques comparatifs de performance, des graphiques d’importance des caractéristiques, des visualisations résumées SHAP, des résultats d’explications LIME, des cartes thermiques Grad-CAM et d’autres visualisations cliniquement pertinentes. Examinez tous les résultats visuels pour garantir la clarté et la cohérence avant de faire un rapport.
- Documentez toutes les opérations de prétraitement, les configurations de modèles, les paramètres d’hyperparamètres, les procédures d’explicabilité, les stratégies de validation et les résultats d’évaluation. Maintenir des registres expérimentaux détaillés pour faciliter la reproductibilité et la réplication indépendante du flux de travail. Vérifier la cohérence des résultats à travers les répétitions d’essais et archiver tous les artefacts du flux de travail pour référence future.
- Résultats attendus – Générer un modèle prédictif entièrement entraîné avec des hyperparamètres optimisés, des poids enregistrés, des journaux d’entraînement, des métriques de performance et des résultats explicables, incluant les explications SHAP, LIME et heatmaps Grad-CAM. Stockez tous les artefacts du modèle, rapports d’évaluation et résultats de visualisation pour une analyse ultérieure et une évaluation de la reproductibilité.

Figure 3 : Flux de travail de bout en bout du pipeline d’IA explicable. Veuillez cliquer ici pour voir une version agrandie de cette figure.
6. Évaluation du modèle et de l’explicabilité
- Évaluer la performance du modèle prédictif à l’aide de métriques de classification standard, incluant la précision, la précision, le rappel, le score F1 et la zone de caractéristiques de fonctionnement du récepteur sous la courbe (ROC-AUC). Calculer la précision pour mesurer la correction globale de la classification.
- Calculer la précision pour évaluer la proportion de prédictions positives correctement identifiées. Calculez la mémoire pour évaluer la capacité du modèle à identifier les cas positifs. Calculez le score F1 pour équilibrer précision et rappel. Calculer le ROC-AUC pour évaluer la performance discriminative selon différents seuils de classification.
- Appliquer ces métriques d’évaluation de manière cohérente à tous les ensembles de données et architectures de modèles afin de faciliter une comparaison objective des performances. Enregistrez toutes les valeurs des indicateurs et stockez les résultats de l’évaluation pour une analyse statistique et des rapports ultérieurs.
- Évaluez la performance de l’explicabilité à l’aide de métriques de fidélité et de stabilité. Calculer la fidélité pour déterminer dans quelle mesure les explications générées reflètent avec précision les prédictions du modèle et le comportement décisionnel.
- Calculez la stabilité en comparant les explications générées à partir d’échantillons d’entrée similaires et en quantifiant la cohérence des résultats explicatifs. Vérifiez que les valeurs de fidélité et de stabilité respectent les critères de qualité prédéfinis avant d’interpréter les explications du modèle.
- Comparez les performances d’explicabilité entre les sorties SHAP, LIME et Grad-CAM.
- Résultats attendus – Générez des résultats d’évaluation quantitative, incluant la précision, la précision, la rappel, le score F1, le ROC-AUC, les métriques de fidélité et de stabilité. Produire des résultats explicables et des visualisations adaptés au reporting scientifique, à l’évaluation de la reproductibilité et à l’interprétation clinique.
7. Évaluation centrée sur l’humain
- Recrutez 12 professionnels de santé, dont 6 médecins, 3 radiologues et 3 analystes de données cliniques. Sélectionnez des participants ayant une expérience préalable en prise de décision clinique, interprétation d’images médicales, analyse de soins de santé ou examen électronique des dossiers médicaux. Obtenez le consentement éclairé de tous les participants avant d’entamer la procédure d’évaluation.
- Sélectionnez aléatoirement 100 cas parmi les jeux de données de test après avoir terminé l’entraînement du modèle et l’analyse d’explicabilité. Générer deux conditions d’évaluation pour chaque cas :
- Sortie uniquement prédiction et
- prédiction accompagnée d’informations explicables. Randomisez l’ordre de présentation des cas et des conditions d’évaluation afin de minimiser les biais de présentation et les effets d’apprentissage.
- Préparez des formulaires d’évaluation standardisés contenant les résultats de prédiction, les résultats explicatifs et les questionnaires d’évaluation. Présenter les cas individuellement aux participants via une interface d’évaluation informatisée.
- Demandez aux participants d’examiner chaque cas de manière indépendante sans discuter des réponses avec d’autres évaluateurs. Permettre aux participants de réaliser toutes les évaluations dans des conditions expérimentales identiques.
- Administrez un questionnaire à cinq points à l’échelle Likert adapté d’études d’évaluation de l’intelligence artificielle explicables publiées. Demandez aux participants d’évaluer la confiance, l’interprétabilité et l’utilisabilité pour chaque cas examiné. Enregistrez électroniquement les réponses au questionnaire et vérifiez la complétion de tous les items de l’enquête avant de procéder à l’analyse statistique.
- Mesurer les indicateurs objectifs de l’utilité clinique lors du processus d’évaluation. Enregistrer l’accord de décision en comparant les décisions des participants avec les labels de référence correspondants ou les résultats de base de la réalité. Calculer l’accord de décision comme le pourcentage de décisions des participants correspondant au résultat de référence.
- Enregistrez le temps de révision pour chaque cas en mesurant l’intervalle entre la présentation du dossier et la soumission de la réponse finale. Calculez séparément le temps moyen de révision pour les conditions de prédiction uniquement et de prédiction avec explication.
- Calculez les scores moyens de confiance, d’interprétabilité et d’utilisabilité pour tous les participants et les cas d’évaluation. Comparez les scores obtenus sous des conditions de prédiction seule et prédiction avec explication.
- Effectuer des tests t par paires après l’achèvement de toutes les évaluations des participants afin de déterminer si les différences de confiance, d’interprétabilité, d’utilisabilité, d’accord décisionnel et de temps d’examen sont statistiquement significatives. Utilisez un seuil de signification de p 0,05 pour toutes les comparaisons statistiques.
- Calculer Fleiss Kappa après avoir recueilli les réponses de tous les participants pour évaluer l’accord inter-évaluateurs. Utilisez les évaluations agrégées des participants pour déterminer la cohérence des évaluations entre les évaluateurs. Interprétez les valeurs de Fleiss Kappa selon les directives d’accord établies et enregistrez les statistiques d’accord résultantes.
- Résumez la démographie des participants, la méthodologie d’évaluation, la conception du questionnaire, les procédures d’analyse statistique, les mesures de performance objective et les résultats d’accord inter-évaluateurs dans le tableau 4.
- Examinez les résultats du modèle dans les deux conditions d’évaluation et comparez les réponses des participants entre les différentes conditions. Vérifiez que les explications améliorent la confiance, l’interprétabilité et l’utilisabilité sans nuire à la qualité des décisions.
- Confirmez la cohérence des évaluations des participants à l’aide de la statistique Fleiss Kappa calculée. Consignez tous les résultats de l’évaluation pour un rapport ultérieur et une évaluation de la reproductibilité.
- Résultats attendus – Générez les scores de confiance des cliniciens, les évaluations d’interprétabilité, les évaluations d’utilisabilité, les mesures décision-accord, les statistiques sur le temps de révision, les résultats du test t appariés et les statistiques d’accord inter-évaluateurs. Produire des preuves quantitatives décrivant l’utilité clinique, l’interprétabilité et la fiabilité du cadre d’intelligence artificielle explicable.
| Paramètre | Valeur |
| Experts | 12 |
| Médecins | 6 |
| Radiologues | 3 |
| Analystes de données cliniques | 3 |
| Affaires examinées | 100 |
| Conception d’évaluation | Aléatoire (Prédiction uniquement vs Prédiction+Explication) |
| Instrument de levé | Échelle de Likert à 5 points |
| Évaluation de la fiducie | Interprétabilité, Confiance, Ergonomie |
| Test statistique | Test t apparié (p 0,05) |
| Fiabilité inter-évaluateurs | Fleiss Kappa |
| Mesures objectives | Accord de décision, temps de révision |
Tableau 4 : Protocole d’évaluation centré sur l’humain et conception de l’évaluation par le clinicien.
Ce tableau présente le cadre d’évaluation des cliniciens utilisé pour évaluer l’interprétabilité, la fiabilité et l’utilisabilité du système d’IA explicable. Les informations concernant la démographie des participants, la méthodologie de l’évaluation des cas, la conception de l’enquête, les procédures d’analyse statistique, l’évaluation de fiabilité inter-évaluateurs et les mesures d’évaluation objective sont résumées.
8. Validation et évaluation de la reproductibilité
- Réaliser des études de validation et d’ablation afin d’évaluer la robustesse et la fiabilité du cadre proposé. Identifier les caractéristiques ayant des scores d’importance élevés en utilisant les méthodes d’explicabilité sélectionnées. Supprimer progressivement les caractéristiques importantes et réentraîner les modèles prédictifs après chaque étape de suppression de caractéristiques.
- Évaluer la performance du modèle après chaque expérience d’ablation en utilisant la précision, la précision, le rappel, le score F1 et les métriques ROC-AUC. Comparez les valeurs de performance résultantes avec celles du modèle de référence pour déterminer la contribution des caractéristiques individuelles aux résultats prédictifs.
- Évaluez la stabilité des explications en générant des explications pour des échantillons d’entrée similaires à l’aide de SHAP, de CLIME, et de Grad-CAM. Comparez les résultats explicatifs à travers des évaluations répétées et quantifiez la cohérence à l’aide des métriques de stabilité prédéfinies. Vérifiez que les explications restent stables sous de légères variations d’entrée et des répétitions d’expérimentations.
- Enregistrez toutes les procédures expérimentales tout au long du flux de travail. Opérations de prétraitement des données documentées, procédures de partitionnement des ensembles de données, architectures de modèles, paramètres d’hyperparamètres, configurations d’entraînement, méthodes d’explicabilité, stratégies de validation et métriques d’évaluation. Stockez tous les paramètres de configuration et les sorties expérimentales dans un format structuré pour faciliter la reproductibilité et la vérification indépendante.
- Examinez tous les dossiers expérimentaux pour en assurer l’exhaustivité et la cohérence. Vérifiez que le flux de travail peut être reproduit à l’aide des procédures documentées, des fichiers de configuration et des spécifications logicielles. Maintenir une structure de flux de travail modulaire pour faciliter l’adaptation du protocole pour de futures études et soutenir la conversion en un protocole expérimental basé sur la vidéo, conforme aux exigences méthodologiques de JoVE.
9. Ressources de reproductibilité
- Exécutez toutes les expériences en utilisant des graines aléatoires fixes afin d’assurer des résultats reproductibles sur des répétitions répétées. Maintenir le code source, les scripts de prétraitement, les fichiers de configuration, les spécifications d’environnement, les paramètres de modèle et les scripts de visualisation au sein d’un dépôt accessible au public.
- Fournir des instructions détaillées pour l’acquisition des ensembles de données, le prétraitement, l’exécution d’expériences, l’entraînement des modèles, la génération d’explicabilités, les procédures de validation et la régénération de toutes les tables et figures rapportées. Archivez tous les composants du flux de travail nécessaires à la réplication indépendante, y compris les spécifications logicielles, les flux de prétraitement, les fichiers de configuration, les instructions d’accès aux ensembles de données, les points de contrôle des modèles et les ressources de visualisation.
- Résumez les ressources logicielles, les flux de travail de prétraitement, les fichiers de configuration, les instructions d’accès aux jeux de données et les ressources de reproductibilité utilisées dans tout le cadre dans le tableau 5.
- Résultats attendus – Générez un package expérimental complet reproductible contenant des scripts de prétraitement, des fichiers de configuration, des modèles entraînés, des points de contrôle de modèles, des sorties explicables, des rapports de validation, des artefacts de visualisation, des spécifications logicielles et la documentation nécessaires à la réplication et à la vérification indépendantes du cadre proposé.
| Ressource | Description |
| Source Code | Scripts d’implémentation Python pour le prétraitement des données, l’entraînement des modèles, l’explicabilité et l’évaluation |
| Fichier Environnement | requirements.txt contenant les dépendances et versions des paquets |
| Fichiers de configuration | Paramètres d’architecture du modèle, hyperparamètres et configurations expérimentales |
| Graines aléatoires fixes | Graine = 42 utilisées pour les expériences reproductibles |
| Instructions d’accès au jeu de données | Liens et procédures pour acquérir des ensembles de données en santé publique |
| Scripts de prétraitement | Scripts pour le nettoyage, la normalisation, l’encodage et la sélection des fonctionnalités des données |
| Scripts de génération de figures | Écritures pour régénérer toutes les figures manuscrites |
| Scripts de génération de table | Scripts pour reproduire les tableaux et métriques rapportés |
| Exemples d’entrées | Ensembles de données d’exemple et fichiers d’entrée |
| Exemples de sorties | Résultats de prédiction, explications et rapports d’évaluation |
Tableau 5 : Ressources de reproductibilité et actifs expérimentaux.
Ce tableau résume les ressources fournies pour soutenir la reproductibilité expérimentale, y compris le code source, les scripts de prétraitement, les fichiers de configuration, les spécifications d’environnement, les instructions d’accès au jeu de données, les réglages de semence aléatoires fixes, les scripts de génération de figures et les exemples de fichiers d’entrée/sortie nécessaires à la reproduction des résultats rapportés.