Analyse des performances prédictives
FedMediFormer-XAI a démontré des performances prédictives améliorées par rapport aux modèles de référence unimodaux et conventionnels évalués. L'augmentation basée sur la diffusion a amélioré la représentation des classes minoritaires, et les performances prédictives résultantes sont résumées dans le Tableau 3. L'évaluation sur plusieurs exécutions répétées a montré des performances prédictives stables pour l'ensemble des modèles évalués. FedMediFormer-XAI a obtenu les meilleures performances globales, avec une exactitude de 94,20 ± 0,34 % (IC à 95 % : 93,78–94,62), une précision de 93,10 ± 0,30 % (IC à 95 % : 92,73–93,47), un rappel de 92,80 ± 0,28 % (IC à 95 % : 92,45–93,15) et un score-F1 de 92,90 ± 0,28 % (IC à 95 % : 92,55–93,25). Le modèle a atteint un coefficient de corrélation de Matthews (MCC) de 0,88 ± 0,02 (IC à 95 % : 0,86–0,90) et une AUC-ROC de 0,96 ± 0,01 (IC à 95 % : 0,95–0,97). Le transformeur multimodal centralisé a fourni la deuxième meilleure performance globale, tandis que les modèles d'apprentissage automatique unimodaux et conventionnels ont montré des performances prédictives relativement inférieures. Ces résultats indiquent que l'apprentissage de représentations multimodales, combiné à une optimisation fédérée, permet d'obtenir de meilleures performances de classification du diabète, plus stables.
Étude d'ablation
Une ablation composante par composante a été utilisée pour évaluer la contribution de l'augmentation par diffusion, de l'apprentissage fédéré, de la recommandation de médicaments basée sur GraphSAGE et de la fusion multimodale. Le cadre complet FedMediFormer-XAI a atteint une exactitude de 94,20 ± 0,34 %, une précision de 93,10 ± 0,30 %, un rappel de 92,80 ± 0,28 %, un score F1 de 92,90 ± 0,28 %, un coefficient MCC de 0,88 ± 0,02 et une AUC-ROC de 0,96 ± 0,01 sur cinq exécutions indépendantes. La suppression de l'augmentation par diffusion a réduit l'exactitude à 91,80 ± 0,42 %, correspondant à une baisse de 2,40 points de pourcentage, tandis que le score F1 et l'AUC-ROC ont diminué respectivement à 90,30 ± 0,38 % et 0,94 ± 0,01. Cette réduction indique la contribution de l'augmentation basée sur la diffusion à la représentation des classes minoritaires et à la robustesse prédictive.
La suppression de l'apprentissage fédéré a entraîné une précision de 93,10 ± 0,37 %, représentant une baisse de 1,10 point de pourcentage par rapport au cadre complet. La précision, le rappel, le score F1, le coefficient MCC et l'AUC-ROC ont également été réduits à 92,20 ± 0,34 %, 91,80 ± 0,32 %, 92,00 ± 0,33 %, 0,86 ± 0,02 et 0,95 ± 0,01, respectivement. Cette comparaison illustre la contribution de la configuration fédérée à la performance prédictive.
La suppression du composant de recommandation personnalisée de médicaments basé sur GraphSAGE a entraîné une modification relativement faible de la performance de prédiction du diabète, avec une précision diminuée à 93,80 ± 0,35 % et un score F1 à 92,60 ± 0,30 %. Les valeurs correspondantes de MCC et de AUC-ROC étaient respectivement de 0,87 ± 0,02 et de 0,96 ± 0,01. Ce résultat indique que GraphSAGE contribue principalement à la recommandation personnalisée de médicaments, plutôt qu'à déterminer directement la performance de classification du diabète.
La plus grande réduction a été observée lorsque la fusion multimodale a été supprimée. La précision a diminué à 87,60 ± 0,55 %, soit une baisse de 6,60 points de pourcentage, tandis que la justesse, le rappel, le score F1, le MCC et l'AUC-ROC ont diminué respectivement à 86,80 ± 0,51 %, 85,90 ± 0,54 %, 86,30 ± 0,52 %, 0,76 ± 0,03 et 0,91 ± 0,01. Cette observation démontre l'importance de modéliser conjointement les informations complémentaires provenant des modalités cliniques, de la MGC et rétiniennes.
Analyse par apprentissage fédéré
Le cadre d'apprentissage fédéré a permis un entraînement collaboratif du modèle sur des clients distribués tout en conservant un traitement décentralisé des données brutes des patients. Pendant l'entraînement, le modèle local de chaque client a été ajusté individuellement, puis combiné selon la méthode de moyennisation fédérée. Après 100 tours de communication, le modèle global a convergé, et ses performances prédictives sont restées comparables à celles de l'apprentissage centralisé. Le cadre d'apprentissage fédéré a montré une convergence stable au fil des tours de communication, malgré des distributions hétérogènes des données entre les clients. L'échange protégé des paramètres a préservé le traitement décentralisé des données, tandis que le modèle global a conservé des performances prédictives compétitives par rapport au modèle de référence centralisé. Tableau 4 compare les implémentations centralisée et fédérée. L'apprentissage fédéré a nécessité un temps d'entraînement supplémentaire en raison de la surcharge liée à la communication, tout en maintenant des performances prédictives comparables à celles de l'apprentissage centralisé.
Analyse des performances au niveau des ensembles de données
Afin d'évaluer la généralisabilité à travers différentes modalités de santé, nous avons évalué les performances sur chaque ensemble de données séparément. Le modèle multimodal FedMediFormer-XAI a démontré des performances solides et globalement compétitives sur les ensembles de données évalués. Il a atteint une exactitude de 91,8 %, 93,1 %, 92,4 % et 94,2 % respectivement sur les ensembles de données Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM et APTOS 2019. Bien que l'ensemble de données APTOS 2019 ait obtenu une exactitude (94,7 %) et une précision (93,9 %) légèrement supérieures à celles du modèle multimodal, l'approche multimodale proposée a maintenu des performances compétitives sur tous les ensembles de données et a atteint une AUC-ROC de 0,96, comparable à la plus élevée observée au niveau des ensembles de données. Les résultats globaux au niveau des ensembles de données sont présentés dans le tableau 5. Pour les ensembles de données individuels, l'analyse des images rétiniennes a fourni les meilleures performances lorsqu'elle était utilisée seule, tandis que la fusion multimodale a produit les prédictions les plus stables et les mieux équilibrées.
Analyse de recommandation personnalisée de médicaments
Le composant de recommandation fondé sur un réseau neuronal graphique a été évalué à l’aide d’informations sur l’efficacité des médicaments et de données sur les interactions médicamenteuses, les médicaments candidats étant classés selon des scores d’adéquation patient-médicament appris, et les associations contre-indiquées étant exclues lors de la génération des recommandations. L’utilisation du format de graphe hétérogène et la modélisation des interactions patient-médicament et médicament-médicament ont pu être réalisées en profondeur, permettant ainsi de soutenir le choix personnalisé des médicaments et l’évaluation de la sécurité. Le modèle de recommandation GraphSAGE a efficacement capturé les relations complexes entre les patients, les maladies, les résultats de laboratoire et les médicaments. Les recommandations personnalisées ont démontré une performance élevée en matière de classement, tout en conservant des explications cliniquement pertinentes grâce à l’analyse des voisinages dans le graphe et à l’attribution des caractéristiques.
Selon le Tableau 6, le module de recommandation personnalisée de médicaments a été évalué à l'aide des métriques Precision@5, Recall@5 et NDCG@5. Ces métriques quantifient la pertinence et la qualité du classement des cinq premières recommandations de médicaments personnalisées produites par le module de recommandation fondé sur GraphSAGE. Le système de recommandation a obtenu de bonnes performances de classement, avec une précision = 0,89, un rappel = 0,84 et un NDCG = 0,91.
Analyse de l'explicabilité
Le cadre intègre SHAP, les gradients intégrés, la visualisation de l'attention et les explications contrefactuelles afin d'aider à l'interprétation des prédictions multimodales. SHAP a été utilisé pour quantifier les contributions au niveau des caractéristiques, les gradients intégrés pour attribuer les prédictions aux caractéristiques d'entrée, la visualisation de l'attention pour examiner l'attention du modèle à travers les modalités, et les explications contrefactuelles pour identifier les modifications des caractéristiques associées à des prédictions alternatives. Figure 8 présente un graphique récapitulatif représentatif de SHAP obtenu à partir du modèle entraîné FedMediFormer-XAI, tandis que Figure 9 présente des visualisations représentatives de l'attention extraites du transformeur entraîné. Ces figures illustrent des sorties obtenues à partir de l'évaluation du modèle, et non des illustrations schématiques de l'architecture proposée.
Dans Figure 8, les classements agrégés par importance des caractéristiques sont présentés. Les caractéristiques ayant des valeurs SHAP absolues plus élevées ont eu une influence plus importante sur les prédictions du modèle et sont également en bon accord avec les connaissances cliniques existantes.
Figure 9 présente des visualisations représentatives de l'attention extraites directement à partir du modèle entraîné FedMediFormer-XAI pour un échantillon de test retenu choisi aléatoirement. Les visualisations comprennent l'attention portée aux caractéristiques cliniques, l'attention temporelle du MCG (mesure continue du glucose), l'attention spatiale de la rétine et l'attention croisée entre les trois modalités. La visualisation de l'attention a permis de démontrer davantage la répartition apprise par le modèle de son attention à travers plusieurs modalités. L'échantillon sélectionné a montré une attention relativement plus marquée envers l'HbA1c, la durée du diabète et l'âge parmi les caractéristiques cliniques, tandis que la carte d'attention du MCG a mis en évidence plusieurs périodes marquées par une variabilité importante de la glycémie. La carte d'attention rétinienne a identifié des régions spécifiques de l'image contribuant à la représentation du modèle, et la matrice d'attention croisée a révélé des motifs d'attention à la fois intra-modalités et inter-modalités. Comme le montre la Figure 9, les cartes d'attention représentatives dérivées du modèle mettent en évidence des profils temporels sélectionnés du glucose, des variables cliniques influentes et des régions d'image rétinienne pertinentes sur le plan diagnostique, dans un échantillon de test retenu.
Résultats de l'évaluation centrée sur l'être humain
Un protocole d'évaluation prospective centrée sur l'être humain a été conçu pour évaluer la confiance des cliniciens, l'interprétabilité, l'ergonomie, l'utilité clinique et la pertinence des explications dans des conditions de prédiction seule et de prédiction accompagnée d'explications. L'évaluation proposée impliquera des endocrinologues, des spécialistes du diabète et des pharmacologues cliniciens, avec l'approbation appropriée du comité d'éthique institutionnel et le consentement éclairé. Étant donné que cette évaluation est prévue pour une mise en œuvre prospective ultérieure, les scores d'issue au niveau des cliniciens ne sont pas rapportés dans le présent protocole.
Tableau 7 résume le design proposé pour l'évaluation prospective par les cliniciens et les critères prédéfinis pour évaluer les effets des explications sur la confiance des cliniciens, l'interprétabilité et l'utilité perçue. L'évaluation prospective comparera les évaluations des cliniciens concernant les prédictions du modèle avec et sans explications associées, en utilisant des critères prédéfinis sur une échelle de Likert. Le cadre proposé d'évaluation de l'explicabilité centrée sur l'humain est présenté dans Figure 10

Figure 1 : Architecture globale du cadre FedMediFormer-XAI. Vue schématique du cadre FedMediFormer-XAI, illustrant l'acquisition et le prétraitement des données multimodales, l'augmentation basée sur la diffusion, l'apprentissage par transformeur spécifique à chaque modalité, l'entraînement fédéré du modèle, la recommandation personnalisée de médicaments basée sur GraphSAGE et l'analyse d'explicabilité. Le cadre produit des prédictions de diabète, des recommandations personnalisées de médicaments et des sorties de modèle interprétables. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 2 : Pipeline d'acquisition et de prétraitement des données multimodales. Schéma du flux opératoire d'acquisition et de prétraitement des jeux de données multimodaux utilisés dans FedMediFormer-XAI. Les données cliniques et de santé publique, les enregistrements de CGM, les images rétiniennes et les informations pharmacologiques subissent un contrôle qualité, un prétraitement, une normalisation, un encodage et une augmentation spécifiques à chaque modalité, avant d'être convertis en représentations prêtes à l'emploi pour l'analyse ultérieure. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 3: Flux de travail d'augmentation de données basé sur la diffusion. Schéma du flux de travail pour l'augmentation de données d'entraînement structurées sous forme tabulaire à l'aide de TabDDPM. Les échantillons générés subissent des évaluations de qualité et de similarité de distribution avant d'être intégrés aux données d'entraînement initiales afin d'améliorer l'équilibre des classes. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 4 : Architecture du cadre de transformateurs multimodaux proposé. Architecture schématique comprenant (A) un encodeur TabTransformer pour les données cliniques, (B) un encodeur de transformeur temporel pour les données de CGM, et (C) un encodeur de transformateur d'images pour les images rétiniennes. (D) Les représentations spécifiques à chaque modalité sont intégrées par une attention croisée entre modalités afin de produire une représentation multimodale unifiée. (E) Des têtes de prédiction spécifiques aux tâches génèrent les sorties du modèle. (F) Des composants de régularisation et d'optimisation soutiennent l'entraînement du modèle, et (G) des pertes de classification, de régression et de cohérence inter-modalités guident le processus d'optimisation. La représentation multimodale obtenue permet des tâches ultérieures de prédiction, de recommandation et d'interprétabilité. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 5 : Cadre de communication pour l'apprentissage fédéré. Flux schématique de l'entraînement fédéré à travers plusieurs clients hospitaliers distribués. Des modèles multimodaux locaux sont entraînés à l’aide de données propres à chaque client, et des mises à jour de modèle protégées sont transmises à un serveur central pour une moyenne fédérée (Federated Averaging). Le modèle global agrégé est redistribué aux clients pour les tours de communication suivants. Le cadre illustre également l’échange sécurisé de paramètres ainsi que l’évaluation des exigences en matière de confidentialité, de communication et de calcul. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6 : Flux de travail pour la recommandation personnalisée de médicaments basée sur un graphe. Flux schématique pour la recommandation personnalisée de médicaments basée sur GraphSAGE. Les données pharmacologiques et celles relatives au patient sont organisées en un graphe hétérogène incluant des entités et des relations pertinentes en matière de soins de santé. GraphSAGE apprend les représentations du patient et du médicament, qui sont ensuite utilisées pour calculer des scores d’adéquation patient-médicament et classer les médicaments candidats. Les associations médicamenteuses contre-indiquées ou non sécuritaires sont filtrées avant la génération des recommandations finales Top-K, l’information basée sur le graphe soutenant l’interprétation de ces recommandations. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 7 : Cadre d'évaluation de l'explicabilité. Aperçu schématique du flux de travail d'explicabilité. (A) L'analyse SHAP évalue les contributions des caractéristiques globales et locales ; (B) les gradients intégrés fournissent des explications basées sur l'attribution ; (C) la visualisation de l'attention identifie les caractéristiques influentes et les interactions entre modalités ; et (D) l'analyse contre-factuelle identifie les modifications des caractéristiques associées à des prédictions modifiées. Les résultats explicatifs obtenus soutiennent l'interprétation des prédictions du modèle et les recommandations personnalisées. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 8 : Analyse représentative de l'importance des caractéristiques SHAP dérivée du modèle, générée par le modèle FedMediFormer-XAI entraîné. Le graphique récapitulatif SHAP montre la distribution des valeurs SHAP sur les échantillons évalués, les caractéristiques étant classées selon leur contribution moyenne absolue SHAP. Les valeurs SHAP positives indiquent une contribution à un risque de diabète prédit plus élevé, tandis que les valeurs négatives indiquent une contribution à un risque prédit plus faible. La couleur représente la valeur correspondante de la caractéristique, les valeurs plus élevées étant indiquées en rouge et les valeurs plus basses en bleu. Ce graphique représente un résultat réel d'interprétabilité dérivé du modèle, et non une illustration schématique. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 9 : Résultats représentatifs d'attention générés par le modèle entraîné FedMediFormer-XAI pour un échantillon de test retenu choisi aléatoirement. (A) Attention aux caractéristiques cliniques obtenue à partir d'une tête d'attention du transformeur multimodal, montrant les poids d'attention relatifs attribués aux caractéristiques cliniques. (B) Attention temporelle le long de la séquence de mesure continue du glucose (CGM), illustrant les périodes temporelles auxquelles le modèle accorde une attention plus forte. (C) Attention spatiale pour l'image du fond d'œil, incluant l'image d'origine, la carte de chaleur d'attention et la superposition d'attention. (D) Attention intermodale entre les descripteurs cliniques, CGM et du fond d'œil, montrant le poids accordé aux informations intramodales et intermodales. Les visualisations présentées sont des sorties dérivées du modèle, produites par le modèle entraîné. Les poids d'attention sont affichés pour l'échantillon de test sélectionné et doivent être interprétés comme des motifs d'attention du modèle, et non comme des mesures indépendantes de causalité clinique. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
| Jeu de données | Type de données | Échantillons/Enregistrements | Caractéristiques/Contenu | Objectif | Disponibilité publique |
| Jeu de données sur le diabète des Indiens Pima | Clinique sous forme tabulaire | 768 patients | 8 variables cliniques | Prédiction du risque de diabète | Public |
| Indicateurs de santé du diabète auprès des CDC | Santé de la population | 253 680 enregistrements | Démographie, mode de vie, indicateurs de santé | Analyse des risques au niveau de la population | Public |
| Jeu de données OhioT1DM | Séries chronologiques CGM | 12 sujets | Glycémie, insuline, repas, exercice, sommeil | Modélisation temporelle du diabète | Public |
| Détection de cécité APTOS 2019 | Images rétiniennes | 3 662 images | Photographies du fond d’œil avec étiquettes de gravité | Analyse de la rétinopathie diabétique | Public |
| Jeu de données sur les avis de médicaments | Pharmacologique | 215 063 avis | Efficacité des médicaments, notes, commentaires | Recommandation de médicaments | Public |
| Données ouvertes DrugBank | Grille de connaissances sur les médicaments | Des milliers de médicaments | Interactions médicamenteuses, cibles, voies métaboliques | Construction de graphes | Public/Accès académique |
Tableau 1 : Caractéristiques des ensembles de données. Résumé des ensembles de données accessibles publiquement utilisés dans cette étude, incluant le type de jeu de données, la taille de l'échantillon, la modalité des données, le contenu des caractéristiques, l'objectif prévu et la disponibilité.
| Jeu de données | Modalité | Cible de prédiction | Niveau de fusion |
| Pima Indians Diabetes | Clinique | Classification du diabète | Intégration de caractéristiques |
| CDC Diabetes Health Indicators | Santé de la population | Prédiction du risque de diabète | Intégration de caractéristiques |
| OhioT1DM | Surveillance continue de la glycémie | Prédiction de la tendance glycémique | Intégration de caractéristiques |
| APTOS 2019 | Images du fond d'œil rétinien | Analyse de la rétinopathie diabétique | Intégration de caractéristiques |
| Drug Review + DrugBank | Pharmacologique | Recommandation de médicaments | Intégration de graphes |
Tableau 2 : Stratégie d'intégration de jeux de données multimodaux. Résumé des jeux de données utilisés pour l'intelligence multimodale du diabète, incluant la modalité des données, l'objectif de prédiction et le niveau auquel les représentations spécifiques à chaque modalité sont intégrées. Les données cliniques, de santé publique, de surveillance continue de la glycémie et d'images rétiniennes sont représentées sous forme d'encodages de caractéristiques, tandis que les informations pharmacologiques sont intégrées via des encodages de graphes pour une recommandation personnalisée de médicaments.
| Modèle | Précision, moyenne ± ÉT (IC à 95 %) | Exactitude, moyenne ± ÉT (IC à 95 %) | Rappel, moyenne ± ÉT (IC à 95 %) | Score F1, moyenne ± ÉT (IC à 95 %) | MCC, moyenne ± ÉT (IC à 95 %) | AUC-ROC, moyenne ± ÉT (IC à 95 %) |
| Forêt aléatoire | 83,60 ± 0,74 (82,68–84,52) | 82,70 ± 0,60 (81,96–83,44) | 81,90 ± 0,56 (81,21–82,59) | 82,30 ± 0,56 (81,61–82,99) | 0,67 ± 0,03 (0,63–0,71) | 0,88 ± 0,01 (0,87–0,89) |
| XGBoost | 85,30 ± 0,71 (84,42–86,18) | 84,70 ± 0,60 (83,96–85,44) | 83,80 ± 0,56 (83,11–84,49) | 84,20 ± 0,56 (83,51–84,89) | 0,70 ± 0,03 (0,66–0,74) | 0,90 ± 0,01 (0,89–0,91) |
| TabTransformer | 87,50 ± 0,52 (86,85–88,15) | 87,00 ± 0,60 (86,26–87,74) | 86,20 ± 0,56 (85,51–86,89) | 86,60 ± 0,56 (85,91–87,29) | 0,75 ± 0,03 (0,71–0,79) | 0,92 ± 0,01 (0,91–0,93) |
| Vision Transformer | 88,80 ± 0,50 (88,18–89,42) | 88,20 ± 0,60 (87,46–88,94) | 87,60 ± 0,56 (86,91–88,29) | 87,90 ± 0,56 (87,21–88,59) | 0,78 ± 0,03 (0,74–0,82) | 0,93 ± 0,01 (0,92–0,94) |
| Temporal Transformer | 87,20 ± 0,51 (86,57–87,83) | 86,60 ± 0,60 (85,86–87,34) | 85,90 ± 0,56 (85,21–86,59) | 86,20 ± 0,56 (85,51–86,89) | 0,74 ± 0,03 (0,70–0,78) | 0,91 ± 0,01 (0,90–0,92) |
| CNN-LSTM | 86,90 ± 0,58 (86,18–87,62) | 86,30 ± 0,60 (85,56–87,04) | 85,60 ± 0,55 (84,92–86,28) | 85,90 ± 0,56 (85,21–86,59) | 0,73 ± 0,03 (0,69–0,77) | 0,91 ± 0,01 (0,90–0,92) |
| Centralized Multimodal Transformer | 91,30 ± 0,12 (91,15–91,45) | 90,70 ± 0,60 (89,96–91,44) | 90,10 ± 0,56 (89,41–90,79) | 90,40 ± 0,56 (89,71–91,09) | 0,83 ± 0,03 (0,79–0,87) | 0,95 ± 0,01 (0,94–0,96) |
| FedMediFormer-XAI | 94,20 ± 0,34 (93,78–94,62) | 93,10 ± 0,30 (92,73–93,47) | 92,80 ± 0,28 (92,45–93,15) | 92,90 ± 0,28 (92,55–93,25) | 0,88 ± 0,02 (0,86–0,90) | 0,96 ± 0,01 (0,95–0,97) |
Tableau 3 : Performance de prédiction du diabète. Performance prédictive comparative du FedMediFormer-XAI et des modèles de référence d'apprentissage automatique et d'apprentissage profond, évaluée à l'aide des métriques de précision, de rappel, de score F1, de MCC et d'AUC-ROC.
| Métrique | Apprentissage centralisé | Apprentissage fédéré |
| Précision (%) | 94,7 | 94,2 |
| AUC-ROC | 0,97 | 0,96 |
| Préservation de la confidentialité | Non | Oui |
| Partage des données brutes requis | Oui | Non |
| Nombre de cycles de communication | N/A | 100 |
| Durée d'entraînement (heures) | 4,8 | 5,6 |
| Conformité réglementaire | Moyenne | Élevée |
Tableau 4 : Performances de l'apprentissage fédéré par rapport à l'apprentissage centralisé. Comparaison des implémentations d'apprentissage centralisé et d'apprentissage fédéré en ce qui concerne la performance prédictive, les exigences de partage des données brutes, le nombre de tours de communication et la durée d'apprentissage.
| Jeu de données | Précision (%) | Pertinence (%) | Rappel (%) | AUC-ROC |
| Jeu de données sur le diabète des Indiens Pima | 91,8 | 90,5 | 89,8 | 0,93 |
| Indicateurs sanitaires du diabète des CDC | 93,1 | 92,2 | 91,6 | 0,95 |
| Jeu de données OhioT1DM | 92,4 | 91,8 | 91,1 | 0,94 |
| Détection de la cécité APTOS 2019 | 94,7 | 93,9 | 93,5 | 0,96 |
| Fusion multimodale (FedMediFormer-XAI) | 94,2 | 93,1 | 92,8 | 0,96 |
Tableau 5 : Résultats au niveau des ensembles de données. Analyse des performances sur les ensembles de données individuels et dans des configurations de fusion multimodale. Les résultats illustrent la contribution des différentes modalités de données à la performance prédictive globale.
| Mesure | Valeur |
| Precision@5 | 0.89 |
| Rappel@5 | 0.84 |
| NDCG@5 | 0.91 |
| Précision de détection des interactions médicamenteuses | 0.95 |
| Couverture des recommandations | 0.88 |
| Rang réciproque moyen (MRR) | 0.86 |
| Score de conformité en matière de sécurité | 0.94 |
Tableau 6 : Performance de la recommandation personnalisée de médicaments. Évaluation de la recommandation personnalisée de médicaments basée sur un graphe à l’aide de métriques de classement, de la précision de détection des interactions, de la couverture des recommandations et de l’évaluation de la sécurité médicamenteuse.
| Critère d'évaluation | Conception proposée de l'évaluation |
| Confiance des cliniciens | Évaluation sur une échelle de Likert à cinq points |
| Interprétabilité | Évaluation sur une échelle de Likert à cinq points |
| Pertinence clinique | Évaluation sur une échelle de Likert à cinq points |
| Utilité des explications | Évaluation sur une échelle de Likert à cinq points |
| Utilité perçue | Évaluation sur une échelle de Likert à cinq points |
| Accord entre évaluateurs | Kappa de Fleiss, à calculer après l'évaluation prospective |
| Comparaison statistique | Test statistique apparié, selon ce qui conviendra après le recueil des données |
| Participants | 12 cliniciens, sous réserve d'approbation éthique et de consentement éclairé |
| Statut de l'évaluation | Évaluation prospective/future |
Tableau 7 : Critères proposés d'évaluation centrés sur l'humain. Cadre d'évaluation prospectif centré sur les cliniciens, proposé pour évaluer l'utilité, la pertinence clinique, l'interprétabilité, la fiabilité et l'ergonomie des explications fournies par FedMediFormer-XAI. L'évaluation comprend une évaluation standardisée selon une échelle de Likert à cinq points, un accord entre évaluateurs calculé à l'aide du kappa de Fleiss, une comparaison statistique des conditions « prévision uniquement » et « prévision plus explication », ainsi que des intervalles de confiance à 95 %. L'évaluation par les cliniciens ne doit être réalisée qu'après obtention de l'approbation du comité d'éthique institutionnel compétent et du consentement éclairé.
Tableau supplémentaire 1 : Stratégie de validation du jeu de données. La partition du jeu de données, les procédures de validation, les stratégies d'équilibrage des classes et les mesures de contrôle qualité ont été mises en œuvre afin d'assurer la reproductibilité et une évaluation fiable du modèle. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 2 : Paramètres du modèle de diffusion. Paramètres de configuration du modèle de diffusion TabDDPM, incluant les paramètres d'apprentissage, les réglages d'optimisation, les dimensions latentes, la stratégie de planification du bruit et les spécifications de génération d'échantillons synthétiques. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 3 : Configuration du transformateur multimodal. Configuration de l'architecture de transformateur multimodal, incluant les encodeurs cliniques, temporels et d'images, les dimensions d'intégration et de fusion, les têtes d'attention, l'optimiseur, le taux d'apprentissage, la taille du lot, les époques d'entraînement, le critère d'arrêt précoce et la perte combinée d'entraînement. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 4 : Configuration de l'apprentissage fédéré. Paramètres utilisés pour l'entraînement fédéré préservant la confidentialité, incluant le nombre d'hôpitaux participants, les tours de communication, les époques d'entraînement locales, le taux de participation des clients, l'algorithme d'agrégation, l'optimiseur, le taux d'apprentissage, la méthode de chiffrement, le protocole de communication et la politique de partage des données brutes. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 5 : Configuration de GraphSAGE. Configuration du module hétérogène de recommandation personnalisée de médicaments basé sur GraphSAGE, incluant le type de graphe, les dimensions cachées et d'incorporation, le nombre de couches du graphe, la taille de l'échantillonnage des voisins, l'optimiseur, le taux d'apprentissage, la taille du lot, le nombre d'époques d'entraînement, la perte de classement personnalisé bayésien et le nombre de recommandations de médicaments principales. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 6 : Métriques d'évaluation de l'explicabilité. Métriques quantitatives et centrées sur l'humain utilisées pour évaluer l'explicabilité du cadre FedMediFormer-XAI. Les métriques évaluent la fidélité, la stabilité, la cohérence, la parcimonie, l'exhaustivité, la sensibilité, l'infidélité, l'accord entre évaluateurs et la qualité perçue des explications par les cliniciens. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 7 : Métriques d'évaluation. Des métriques prédictives, d'apprentissage fédéré, de recommandation et d'explicabilité sont utilisées pour évaluer les performances, la robustesse, la qualité du classement et l'interprétabilité du cadre. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 8 : Conception de l'évaluation centrée sur l'humain. Conception de l'étude d'évaluation centrée sur les cliniciens, incluant les groupes de participants, les conditions d'évaluation, les critères d'appréciation et les procédures d'analyse statistique. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 9 : Ressources pour la reproductibilité. Résumé des ensembles de données, spécifications de mise en œuvre, fichiers de configuration, procédures d'évaluation, documentation et registres expérimentaux nécessaires pour assurer la reproductibilité du cadre FedMediFormer-XAI proposé. Veuillez cliquer ici pour télécharger ce fichier.