Construction d'un réseau neuronal graphique pour le graphe de connaissances juridiques en intelligence artificielle médicale
Comme illustré dans la Figure 1, le cadre proposé comprend trois modules principaux. La couche d'entrée intègre des données provenant de multiples sources dans un graphe hétérogène grâce à un encodage d'entités multimodal et une modélisation d'arêtes dirigées. La couche GCN sensible aux relations effectue ensuite un alignement sémantique intermodal à l'aide de poids et d'attention spécifiques aux types, produisant des intégrations nodales unifiées. Enfin, ces intégrations permettent le traçage des biais (par rétropropagation du gradient et détection de communautés) et la surveillance dynamique de la conformité (par mappage en temps réel des nœuds et suivi des poids des arêtes), la sortie fournissant des preuves d'attribution interprétables et des alertes de risque destinées aux régulateurs.

Figure 1 : Graphe de connaissances juridiques et architecture de traçage des biais pour l'IA médicale. Ce schéma illustre le flux de travail global du cadre proposé. La couche d'entrée fusionne des données hétérogènes provenant de multiples sources (textes juridiques, lignes directrices cliniques, rapports d'audit d'algorithmes), qui sont encodées en quatre types d'entités (clauses juridiques, comportements médicaux, modules d'algorithmes, parties responsables) et reliées par quatre relations juridico-sémantiques orientées (violation, base, déclenchement, attribution). La couche GCN sensible aux relations effectue un alignement sémantique intermodal à l'aide de poids et d'attention spécifiques aux types. Le module de traçage des biais utilise la rétropropagation du gradient pour identifier les arêtes à forte contribution, puis applique une détection de communautés afin de localiser les grappes de nœuds racines. Le moniteur dynamique de conformité associe les décisions en temps réel à des nœuds temporaires, évalue la similarité des plongements par rapport aux clauses juridiques, et suit l'évolution des poids des arêtes pour une alerte précoce. Les sorties comprennent des preuves d'attribution interprétables et des alertes de risque. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Codage structuré par graphe hétérogène des entités juridiques et de leurs relations
Quatre entités fondamentales sont systématiquement extraites des lois réglementaires sur l'intelligence artificielle médicale, des lignes directrices de pratique clinique et des rapports d'audit d'algorithmes : les clauses juridiques, les procédures médicales, les modules d'algorithme et les entités responsables. Un modèle distinct d'apprentissage de représentation de caractéristiques est proposé pour chaque type d'entité afin qu'il soit sémantiquement distinguable. Les nœuds correspondant aux clauses juridiques sont structurés de manière à contenir le numéro de la clause juridique, utilisé comme identifiant (ID) unique pour cette clause. Parallèlement, un indice de quantification de la sévérité de la sanction est défini afin d'indiquer le niveau de responsabilité juridique associé à la clause, et par conséquent, un vecteur de caractéristiques est établi.
(1)
ci est le numéro d'entrée, Emb(·) représente l'application de plongement en basse dimension, et [·;·] représente l'opération de concaténation vectorielle. Cette représentation préserve à la fois la structure formelle et la gravité de la sanction du texte juridique, permettant un raisonnement croisé entre énoncés.
Les nœuds de comportement médical sont normalisés et encodés selon un système de classification des opérations cliniques, en extrayant leur niveau de risque rj ∈ {1,2,3} et l'ensemble des étiquettes de scénario applicables sj ⊂ S, où S est l'ensemble complet des catégories de scénario prédéfinies. Un encodage multi-hot est utilisé pour traiter l'ensemble des étiquettes, puis il est concaténé à l'incorporation du niveau de risque afin de former une représentation initiale :
(2)
Cette stratégie garantit que différents types de comportements médicaux possèdent des relations de distance mesurables dans l'espace vectoriel, permettant ainsi des comparaisons croisées entre scénarios. La fonction d'incorporation de texte Emb(·) est mise en œuvre à l'aide du modèle de langage juridique chinois pré-entraîné Lawformer (pré-entraîné sur un vaste corpus juridique chinois), la dimension de sortie étant fixée à 768.
En se basant sur les dépendances logiques et les contraintes juridiques entre les entités, quatre types de relations sémantiques orientées sont établies : « violation », « base », « déclenchement » et « attribution », chacune correspondant à des schémas causaux juridiques différents. Chaque arête eij ⊂ E se voit attribuer un type d'étiquette tij ⊂ T = {violate, base, trigger, attribute} afin de permettre la transmission ultérieure de messages assurant la prise en compte des relations. La construction des arêtes suit strictement le mécanisme d'appariement selon les règles du domaine : lorsqu'un comportement médical s'écarte des exigences normatives, une arête de type « violation » est établie, allant du nœud du comportement vers la clause juridique pertinente ; lorsque la clause juridique constitue la base de conformité technique d'une opération, une arête de type « base » est créée ; si la sortie d'un module d'algorithme déclenche directement l'exécution d'un comportement médical spécifique, une arête de type « déclenchement » est établie ; la relation d'attribution de responsabilité est construite à partir des documents de responsabilité de l'organisation et des conclusions d'audit, créant ainsi une arête de type « attribution » entre la partie responsable et la violation ou le défaut d'algorithme.
Une fois tous les nœuds initialisés, un graphe hétérogène (V, E, H0) est constitué, où V désigne l'ensemble des nœuds, E l'ensemble des arcs orientés munis d'étiquettes de type, et H0 la matrice initiale de caractéristiques. Afin d'améliorer la capacité discriminante sémantique de la structure du graphe, les caractéristiques des nœuds sont normalisées :
(3)
μk et σk sont respectivement la moyenne et l'écart type de la caractéristique du k-ième nœud sur l'ensemble d'apprentissage, et ∈ est une petite constante destinée à éviter la division par zéro. La normalisation garantit que les caractéristiques hétérogènes provenant de multiples sources participent aux opérations de convolution sur graphe à une échelle uniforme, empêchant ainsi les effets de domination numérique d'interférer avec l'apprentissage sémantique. Le modèle de graphe structuré obtenu reflète intégralement la topologie relationnelle des quatre dimensions que sont le droit, le comportement, la technologie et la responsabilité dans le système d'IA médicale, fournissant une base de graphe calculable pour l'analyse ultérieure de la propagation des biais.
Amélioration de l'alignement par convolution de graphes pour la sémantique juridique multi-modale
Un réseau de convolution graphique sensible aux relations38,39, qui étend le cadre du réseau de convolution graphique relationnel (R-GCN), est utilisé pour propager les caractéristiques à travers plusieurs couches du graphe hétérogène initial. Alors que le R-GCN introduit des matrices de transformation spécifiques à chaque relation pour des données relationnelles générales, notre approche intègre en outre un mécanisme d'attention apprenable afin de pondérer dynamiquement les contributions des voisins, et définit quatre types spécifiques de relations sémantiques juridiques (violation, base, déclenchement, attribution) adaptés à l'analyse de conformité en intelligence artificielle médicale. L'opération de chaque couche paramétrise indépendamment le processus de transformation en fonction du type sémantique des arêtes. Pour tout nœud cible, les informations de son voisinage sont regroupées et agrégées selon les types d'arêtes les reliant. Chaque type de relation dispose d'une matrice de transformation linéaire dédiée afin de différencier les caractéristiques transmises le long de différents chemins sémantiques juridiques40,41. Si l'arête entre le nœud de clause juridique et le nœud de comportement médical est de type « base », lorsque le nœud de clause juridique reçoit un message en provenance d'un nœud de comportement médical, il applique la matrice de poids correspondante pour mapper spatialement les caractéristiques du voisin. De la même manière, lorsqu'un nœud de comportement médical envoie une sortie via le module d'intégration d'arêtes de type « déclenchement » vers un module d'algorithme, la matrice de paramètres déclenchée, associée à cette relation, effectue la transformation des caractéristiques. Ceci imite la fluidité des différents types de logique juridique, permettant ainsi de réaliser ou d'informer différentes couches logiques tout en maintenant l'indépendance sémantique durant le flux d'information, sans bruit inter-modal. L'agrégation est définie comme suit :
(4)
mi(l) représente l'information complète recueillie par le nœud i dans la couche l, Nil est son ensemble de nœuds voisins selon la relation r, Wr est la matrice de transformation linéaire, et hj(l−1) est la représentation intégrée du nœud voisin dans la couche précédente.
Un mécanisme d'attention apprenable est introduit lors de l'agrégation des messages afin d'ajuster dynamiquement l'intensité d'influence des différents nœuds voisins sur la mise à jour de la représentation du nœud cible42,43. Le coefficient d'attention est généré à partir de deux facteurs : la similarité des attributs des nœuds et l'importance juridique, sans dépendre de poids a priori fixes. Pour les nœuds correspondant à des clauses juridiques, lorsqu'ils reçoivent des caractéristiques de comportements médicaux voisins, le score d'attention est calculé à partir de la valeur quantifiée de l'intensité de la sanction associée à ce dernier ; lorsque le nœud du module algorithmique fusionne des informations sur les comportements médicaux, il se concentre sur les voisins présentant des niveaux de risque opérationnel plus élevés. Le poids d'attention est calculé de la manière suivante :
(5)
αij est le coefficient d'attention du nœud j au nœud i, et a est le vecteur d'attention apprenable. Ce modèle permet l'identification automatique des chemins connectés à haut risque ou à contraintes élevées durant l'entraînement de bout en bout, en leur attribuant une attention plus importante. L'incorporation finale des nœuds mise à jour est déterminée par les messages pondérés et les connexions résiduelles.
(6)
σ est la fonction d'activation, et la conception résiduelle atténue le problème de disparition du gradient lors de la propagation profonde et garantit la stabilité en cas de conflits sémantiques multiples. Après L = 3 couches de convolution sur graphes (chacune ayant une dimension cachée de 256 et une activation ReLU), les plongements de tous les nœuds intègrent de manière fluide des informations contextuelles croisées entre modalités et deviennent des représentations unifiées dotées de capacités de discrimination sémantique juridique.
Deux diagrammes alternatifs d'analyse de conformité juridique pour l'intelligence artificielle en santé sont illustrés dans la Figure 2, dans le but de visualiser les types de relations juridiques et les voies de propagation des biais, indiquant ainsi les sources potentielles de biais dans cette prise de décision. La Figure 2A montre l'influence de diverses relations sémantiques juridiques, où quatre types de relations sont codés par couleur, chaque type étant représenté par une couleur d'arête différente. L'épaisseur de l'arête correspond au poids d'attention de cette relation particulière, c'est-à-dire dans quelle mesure celle-ci contribue à la décision de l'IA. Une arête épaisse indique essentiellement une relation juridique dominante dans la décision, suffisamment déterminante pour justifier l'issue du cas. La taille des nœuds reflète leur contribution aux violations : des nœuds plus grands indiquent une relation plus forte entre le comportement et des clauses juridiques spécifiques, et donc un risque potentiel plus élevé. Cette visualisation fournit une couche sémantique juridique claire, permettant d'identifier les voies juridiques les plus fortes et les plus risquées dans la prise de décision par IA. La Figure 2B met également en évidence les chemins à forte contribution (à la propagation des biais), en accentuant les arêtes à forte contribution, qui sont en gras et accompagnées de lignes en pointillés (par exemple B1-B3) dans le processus de décision. Le doublement de l'épaisseur de ces arêtes représente leur importance dans la diffusion d'un biais systémique. Les combinaisons de règles juridiques et de comportements techniques entraînant cet effet d'amplification sont illustrées dans la Figure 2. Cette analyse révèle non seulement le parcours de propagation des biais, mais facilite également l'identification de l'origine de ces biais, sur la base de laquelle peuvent être établies l'audit de conformité et la responsabilité de l'outil d'IA.

Figure 2 : Analyse de la conformité juridique et de la propagation des biais dans l'intelligence artificielle en santé (exemple illustratif). (A) Relations sémantiques juridiques codées par couleur : violation (rouge), fondement (bleu), déclencheur (vert), attribution (orange). L'épaisseur des arêtes est proportionnelle au poids d'attention, indiquant l'influence de chaque relation sur la décision de l'IA. La taille des nœuds est proportionnelle à leur contribution à la violation, mettant en évidence les entités à risque. (B) Sous-graphe de propagation des biais : les arêtes à forte contribution sont en gras et en pointillés (par exemple, B1-B3) ; les arêtes de double épaisseur indiquent une amplification du biais systémique. Cette visualisation permet d'identifier les chemins juridiques dominants, les origines des biais et de réaliser un audit de conformité. Aucune échelle de mesure ni de barres d'erreur n'est applicable, car il s'agit d'une illustration schématique. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Mécanisme de retour arrière sur sous-graphe pour le chemin de propagation du biais
Dans cette étude, le « biais » est défini comme l'écart systématique entre la sortie d'un système d'intelligence artificielle et la décision attendue sur le plan clinique et juridique, mesuré par la divergence entre le score de risque prédit par le modèle et l'étiquette de conformité de référence. Le signal de biais est quantifié par la perte d'entropie croisée entre la sortie finale de l'algorithme et un indicateur binaire de conformité (1 pour conforme, 0 pour non conforme), agrégé sur l'ensemble des instances de décision dans un lot.
Une fois le réseau neuronal graphique entraîné, sa différentiabilité est utilisée pour effectuer une analyse de rétropropagation du signal de biais dans la couche de sortie. À partir du nœud de décision de l'algorithme qui détecte les anomalies, l'amplitude du gradient de la fonction de perte par rapport à chaque arête connectée est calculée afin de quantifier la contribution de chaque arête à la formation du biais. Ce processus est mis en œuvre à l'aide d'un cadre de différentiation automatique, en remontant couche par couche le long des arêtes orientées dans la structure du graphe pour obtenir l'intensité d'influence de chaque transformation de paramètre d'arête sur le changement de la sortie finale. Plus la valeur absolue du gradient est élevée, plus la relation juridico-technique portée par cette arête est dominante dans la propagation du biais. La contribution d'une arête est définie comme suit :
(7)
Lbias est la perte différentiable définie pour un comportement biaisé, et wi est le vecteur de poids d'entrée correspondant au type d'arête. Cette valeur de gradient reflète le degré de participation d'une relation sémantique spécifique au biais d'association actuel. Une fois que toutes les arêtes ont été notées de cette manière, un seuil dynamique τ est fixé pour filtrer l'ensemble des arêtes à forte contribution Ehigh dont la contribution dépasse gij > τ, formant ainsi le sous-graphe initial de propagation du biais Gbias = (Vbias, Ehigh). Plus précisément, τ est déterminé comme le 85e centile des valeurs absolues du gradient sur l'ensemble des arêtes à chaque époque d'apprentissage, garantissant ainsi que seules les 15 % des arêtes les plus influentes sont conservées pour la construction du sous-graphe. Ce sous-graphe se concentre sur les chemins de connexion clés les plus susceptibles de provoquer un biais systématique, réduisant l'espace de recherche et améliorant l'efficacité du traçage des sources.
Au sein du sous-graphe de propagation des biais construit, un algorithme de détection de communautés guidé par le regroupement spectral est exécuté afin d'identifier des structures de clusters de nœuds fortement cohérentes. Ce processus repose sur la factorisation de la matrice de Laplace normalisée du sous-graphe, projetant les intégrations de nœuds vers un espace spectral de faible dimension et appliquant une stratégie de regroupement sensible à la densité dans cet espace, afin de garantir que les nœuds de types différents (tels que des clauses juridiques et des modules d'algorithme) soient regroupés dans le même cluster lorsqu'ils sont fonctionnellement étroitement liés. Chaque communauté identifiée représente une boucle fonctionnelle potentielle ou une unité d'agrégation de responsabilités. Les résultats de partitionnement en communautés sont déterminés par les objectifs d'optimisation suivants :
(8)
L=D−A est la matrice laplacienne du sous-graphe, A est la matrice d'adjacence, D est la matrice de degré, ck est le vecteur indicateur de la k-ième communauté, et K est le nombre prédéfini de communautés. Ce critère maximise la différence de coupe minimale entre les communautés, garantissant des connexions internes étroites.
Une analyse basée sur la composition croisée des couches est désormais effectuée pour chaque communauté. Si une communauté contient des nœuds de clauses juridiques et des nœuds de modules algorithmiques, elle est marquée comme une source potentielle de biais. Pour tester sa causalité, un test d'intervention est réalisé : toutes les arêtes de cette région sont temporairement supprimées du graphe, le même processus de prise de décision est exécuté à nouveau, et les différences dans les mesures de biais sont observées. La mesure de validité causale est définie comme suit :
(9)
Borig et Bmask représentent respectivement l'intensité du biais du modèle d'origine et le biais après masquage. Si la mesure de validité causale est nettement supérieure au seuil prédéterminé, cela implique que le regroupement de nœuds a été identifié comme une source explicative de biais, ce qui guidera ultérieurement la correction de conformité et l'attribution des défaillances.
Vérification dynamique de la conformité aux contraintes juridiques
Les instances de décision en temps réel apparaissant lors du fonctionnement d'un système d'intelligence artificielle médical sont introduites comme des nœuds transitoires et intégrées dans un espace de graphe de connaissances appris. Chaque nœud produit un vecteur de caractéristiques initial en lisant son contexte d'entrée, son comportement de sortie et l'état de l'algorithme. Ensuite, ce vecteur est transmis à un réseau neuronal graphique aux paramètres figés afin d'effectuer une propagation avant en une couche, produisant un plongement aligné sur le graphe de connaissances sans modifier la structure originale du graphe. Cela permet ainsi de comparer les nœuds transitoires et les nœuds correspondant à des clauses juridiques dans un même espace sémantique.
Ensuite, calculez la similarité cosinus entre le nœud transitoire et chacun des nœuds de clause juridique :
(10)
htemp est le vecteur intégré du nœud temporaire, et hjlaw est le vecteur intégré du nœud de la j-ième clause juridique. La valeur de similarité reflète virtuellement le degré d'appariement sémantique entre la décision actuelle et chaque contrainte légale. Un seuil dynamique de conformité θ est défini à partir de la distribution de similarité des échantillons historiques de conformité, afin d'adapter la frontière de jugement aux différents scénarios d'application. Plus précisément, θ = µ - 2σ, où µ et σ représentent respectivement la moyenne et l'écart type de la distribution de similarité cosinus calculée à partir d'un jeu de validation composé de 500 instances de décisions conformes connues.
Si un score de similarité cosinus est inférieur au seuil de conformité dynamique, la règle de droit correspondante est considérée comme violée, déclenchant ainsi le mécanisme d'alerte de conformité. La notification inclut également le numéro minimal de la clause juridique correspondante, la valeur de similarité et le sens de l'analyse de divergence, ce qui devrait permettre aux régulateurs d'agir rapidement. Cette approche offre une cartographie interprétable allant d'une prise de décision opaque à l'espace de la sémantique juridique et facilite la vérification de conformité en temps réel.
Pendant le fonctionnement continu, on suit l'évolution du poids des arêtes clés de connexion entre le droit et la technologie dans le sous-graphe de propagation des biais. L'accent est mis sur les arêtes reliant les nœuds de modules algorithmiques aux nœuds de clauses juridiques, car elles représentent directement l'intensité de la réponse du comportement technique à des réglementations spécifiques. Les paramètres de la matrice de transformation pour chaque arête cible sont enregistrés durant l'inférence, et leur norme est extraite comme indicateur dynamique de l'évolution de la force de corrélation entre les deux. On définit la séquence de force d'arête comme suit :
(11)
wt représente la norme de Frobenius de la matrice de poids correspondant à la relation entre l'arête eij au moment t, et Wkl(t) est la matrice de paramètres effectivement utilisée dans le modèle à cet instant. Cet indicateur reflète la profondeur d'apprentissage du modèle ou sa dépendance à la contrainte légale.
Un test de monotonie à fenêtre glissante est effectué sur la séquence, et un test des signes amélioré est utilisé pour déterminer si une tendance ascendante significative est observée. Si les accroissements sur N pas de temps consécutifs satisfont la condition de dominance positive, alors l'arête est considérée comme présentant un phénomène anormal de renforcement. En combinant davantage des données historiques sur la contribution du gradient, si l'arête a été identifiée comme un chemin à fort impact lors du tour précédent de l'analyse de traçage de la source, un processus d'alerte précoce d'accumulation de biais systémique est initié.
Enfin, un rapport de traçabilité des sources est généré, incluant des informations sur les nœuds situés aux deux extrémités de l'arête cible, les courbes d'évolution des poids, les statistiques relatives à la fréquence des décisions associées, ainsi que des recommandations potentielles d'attribution. Ce mécanisme permet un saut qualitatif allant du jugement statique de conformité à la prédiction dynamique des risques, en soutenant une intervention proactive face aux déviations institutionnelles potentielles.
Données expérimentales et conception
Afin de vérifier l'efficacité du cadre proposé, cet article construit un jeu de données hétérogène multi-source intégrant des réglementations réelles et des données de simulation, et conçoit des expériences de contrôle rigoureuses. Les sources de données comprennent les réglementations nationales sur l'intelligence artificielle en milieu médical, les lignes directrices de traitement clinique, les rapports d'audit d'algorithmes open source et les journaux de décisions simulées. Après prétraitement, un graphe de connaissances hétérogène de référence contenant 285 nœuds (85 clauses juridiques, 120 comportements médicaux, 42 modules d'algorithme et 38 entités responsables) et 1247 arêtes orientées est construit, comme illustré dans la Figure 3.

Figure 3 : Répartition et caractéristiques des types d'entités hétérogènes. (A) Histogramme montrant le nombre de nœuds pour chaque type d'entité : clauses juridiques (85), comportements médicaux (120), modules d'algorithme (42), parties responsables (38). (B) Histogramme de l'intensité des pénalités pour les nœuds correspondant aux clauses juridiques, regroupées en catégories faible (0‑0,33), moyenne (0,34‑0,66) et forte (0,67‑1,0) ; l'axe vertical représente le nombre d'occurrences. (C) Camembert de la répartition des niveaux de risque parmi les nœuds de comportements médicaux : faible (19 %), moyen (43 %), élevé (38 %). Toutes les valeurs sont des effectifs absolus ou des pourcentages ; aucune barre d'erreur n'est indiquée car il s'agit de statistiques descriptives du jeu de données. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Figure 3 illustre la répartition et les caractéristiques des nœuds d'entité dans le graphe de connaissances hétérogène. Figure 3A présente la répartition du nombre de quatre types de nœuds d'entité, les nœuds « comportement médical » étant les plus nombreux (120), suivis des nœuds « clauses juridiques » (85), tandis que les « modules d'algorithme » (42) et les « entités responsables » (38) sont relativement moins nombreux. Cela s'explique par le fait que le graphe est conçu structurellement à partir des comportements et des règles. Figure 3B montre la répartition des intensités de sanctions pour les nœuds représentant une clause juridique unique, l'intensité mesurant la gravité de la responsabilité juridique. Les données indiquent qu'il existe relativement peu de dispositions à forte intensité de sanction, la majorité se situant dans une fourchette d'intensité moyenne à faible, ce qui est conforme à la réalité selon laquelle seules quelques clauses de violation grave existent dans les systèmes juridiques réels. Figure 3C illustre la répartition du niveau de risque parmi les nœuds de comportement médical, les comportements à risque modéré représentant la plus grande proportion (43 %), tandis que les comportements à faible risque ont la plus faible proportion (19 %), ce qui révèle que les scénarios médicaux sont généralement courants, et que les opérations à haut risque sont soumises à des contraintes d'association plus rigoureuses dans le graphe. Ces statistiques justifient collectivement le schéma de codage d'ambiguïté des entités adopté lors de la construction du graphe de connaissances, afin d'offrir un soutien en caractéristiques pour l'alignement ultérieur par convolution sur graphe.
L'ensemble des données a été divisé aléatoirement en ensembles d'apprentissage (70 %), de validation (10 %) et de test (20 %), en stratifiant selon le type de nœud et la distribution des relations afin de préserver la structure globale du graphe dans chaque sous-ensemble. La même répartition a été utilisée de manière cohérente pour toutes les méthodes de référence afin d'assurer une comparaison équitable. En complément de cette répartition de base, les trois gradients de densité du graphe de connaissances (faible, moyenne, élevée) et les trois configurations de complexité interjuridictionnelle (unique, bilatérale, multilatérale) décrites ci-dessus servent de bancs d'essai pratiques indépendants, qui évaluent collectivement la robustesse de la méthode dans des conditions variables de complétude des données et de chevauchement réglementaire. Pour établir les étiquettes de référence permettant l'évaluation de la localisation des biais, nous avons adopté une stratégie en deux étapes : (1) Annotation par des experts — trois experts en droit et en médecine ont examiné indépendamment les journaux de décisions et identifié les nœuds sources et les chemins de propagation pour chaque violation de conformité enregistrée, les désaccords étant résolus par vote majoritaire ; (2) Injection simulée — pour des tests contrôlés, nous avons artificiellement injecté des signaux de biais dans 20 chemins de décision sélectionnés aléatoirement en modifiant les poids des arêtes dans le graphe de connaissances, en veillant à ce que les nœuds sources réels et les arêtes affectées soient connus a priori.
Pour toutes les méthodes de référence (TransE, ComplEx, GNNExplainer, KG-BERT et Node2Vec), nous avons utilisé la même configuration d'entraînement (optimiseur Adam, taux d'apprentissage de 1 × 10−3, taille de lot de 64, 100 époques) et les mêmes partitions de données que notre méthode afin d'assurer une comparaison équitable. Pour TransE et ComplEx, la dimension d'incorporation a été fixée à 256 avec une marge de 1,0 ; pour KG-BERT, nous avons utilisé le modèle BERT-base pré-entraîné avec une taille de lot de 16 et une longueur maximale de séquence de 128 ; pour GNNExplainer, nous avons utilisé un GCN à 3 couches avec la même dimension cachée de 256 ; et pour Node2Vec, nous avons défini la longueur de marche à 80, le nombre de marches par nœud à 10, et la dimension d'incorporation à 256.
Afin d'assurer une comparaison équitable, nous avons adapté toutes les méthodes de référence aux mêmes tâches de localisation de biais, à savoir l'identification du nœud racine et la reconstruction du chemin de propagation. Pour TransE, ComplEx et Node2Vec, qui ne sont pas intrinsèquement explicables, nous avons calculé le gradient de la perte liée au biais par rapport à l'incorporation de chaque nœud et utilisé l'amplitude du gradient comme score d'importance du nœud ; les nœuds racines ont été sélectionnés en appliquant un seuil à ces scores, et les chemins de propagation ont été reconstruits en conservant les arêtes ayant les contributions de gradient les plus élevées. Pour GNNExplainer, nous avons directement utilisé ses mécanismes intégrés d'importance des arêtes et de masquage des nœuds afin d'obtenir à la fois les nœuds racines et les sous-graphes. Pour KG-BERT, qui opère sur des triplets, nous avons converti chaque arête du graphe en un triplet textuel et utilisé les poids d'attention du modèle sur les entités pour déterminer l'importance des nœuds, suivis de la même stratégie de seuil pour la reconstruction du chemin. Grâce à ces adaptations, chaque méthode de référence produit des prédictions de nœuds racines et des prédictions de chemins de propagation, permettant ainsi une évaluation uniforme de toutes les méthodes.
L'évaluation est centrée sur quatre capacités fondamentales : la précision de l'alignement sémantique, la capacité à localiser les biais, l'efficacité de la responsabilisation et la généralisation à travers différents domaines. Elle présente également trois variables de contrôle importantes, imitant la complexité du monde réel.
1) Gradient de densité du graphe de connaissances : Afin d'évaluer la performance de la méthode à différents niveaux de complétude des informations, deux sous-ensembles sont créés à partir du graphe complet de référence (densité D = 1,0) selon une stratégie aléatoire de suppression d'arêtes, comme suit :
Graphe clairsemé (D ~ 0,3) : 30 % des arêtes sont conservées aléatoirement, ce qui simule le stade de construction initiale des connaissances, où de nombreuses informations sont manquantes.
Graphe de densité moyenne (D ~ 0,6) : 60 % des arêtes sont conservées aléatoirement, simulant un scénario typique de structure des connaissances partiellement connue.
Graphe dense (D = 1,0) : en utilisant toutes les 1247 arêtes, ce qui correspond à un scénario optimal où les connaissances sont relativement complètes.
2) Situation de la fréquence des décisions médicales par intelligence artificielle : Trois charges de flux de décision artificiels sont configurées pour tester les performances en temps réel de la surveillance dynamique de la conformité :
Fréquence basse de 10 Hz : en moyenne, 10 événements de décision sont générés par seconde, simulant la surveillance de systèmes à petite échelle ou à site unique.
Fréquence moyenne de 50 Hz : 50 événements de décision par seconde, simulant la charge du système d'intelligence artificielle d'établissements médicaux régionaux ou de taille moyenne.
Haute fréquence de 100 Hz : 100 événements de décision par seconde simulent des scénarios de forte pression de concurrence pour les services d'intelligence artificielle déployés dans un grand hôpital ou sur une plateforme cloud.
3) Gradient de complexité interjuridictionnel : Pour tester la transférabilité de la modélisation des contraintes juridiques, trois jeux de données de test fondés sur la complexité ont été élaborés :
Juridiction unique : se compose exclusivement des lois et réglementations chinoises en vigueur régissant l'intelligence artificielle médicale.
Juridiction bilatérale : intègre les régimes réglementaires de la Chine et de l'Union européenne, environ 15 % des règles étant contradictoires et superposées.
Juridiction multilatérale : S'appuyant sur les deux premières, elle intègre en outre les règles de confidentialité et de sécurité issues du HIPAA américain (Health Insurance Portability and Accountability Act), créant un environnement d'essai dans lequel les systèmes juridiques des trois régimes juridiques s'entrecroisent, augmentant ainsi le taux de conflit de règles à environ 25 %.
Les indicateurs clés suivants ont été utilisés pour l'évaluation quantitative :
1) Précision de l'alignement sémantique : mesure la capacité du graphe à modéliser les relations entre les entités juridiques et techniques.
Précision du rapprochement d'entités :
(12)
Ppred est l'ensemble des paires d'entités alignées prédites par le modèle, et Pgold est l'ensemble des alignements de référence annotés par des experts.
Intégrité de la préservation des relations :
(13)
Rgraph est l'ensemble des relations reconstruites dans le graphe, et Rtext est l'ensemble des relations explicites extraites du texte juridique d'origine.
2) Capacité de localisation des biais : Évaluation de l'efficacité du traçage des causes profondes et des voies de propagation des biais.
Taux de rappel du nœud racine :
(14)
Npred est l'ensemble des nœuds sources de biais identifiés par le modèle, et Ntrue est l'ensemble des nœuds sources réels étiquetés par des experts.
Précision du trajet de propagation :
(15)
Epred est l'ensemble des arêtes dans le sous-graphe de propagation du biais déduit par le modèle, et Etrue est l'ensemble réel des arêtes de propagation du biais.
3) Efficacité du suivi de la responsabilité : Tester les performances du système dans des scénarios de surveillance en temps réel.
Latence moyenne de traçage :
(16)
M représente le nombre total de demandes, et titrigger et tireport sont les horodatages respectifs du i-ème déclenchement de biais et de la génération du rapport source.
Débit du système :
(17)
Nprocessed représente le nombre de demandes de traçage simultanées correctement traitées dans la fenêtre temporelle ΔT.
4) Capacité de généralisation interdomaines : vérification de l'adaptabilité de la méthode à différents systèmes juridiques.
Couverture juridictionnelle :
(18)
Cencoded représente le nombre de clauses juridictionnelles différentes correctement encodées dans le graphe, et Cinput représente le nombre total de clauses d'entrée.
Taux de détection des conflits de contrainte :
(19)
Dpred est l'ensemble des contradictions logiques légales détectées par le modèle, et Dgold est l'ensemble de toutes les paires de contradictions annotées par des experts.
Toutes les expériences ont été réalisées à l'aide d'une station de travail équipée d'un processeur multicœur et d'une unité de traitement graphique ; les spécifications complètes du matériel sont fournies dans le tableau des matériaux.
Les principaux hyperparamètres de cette approche et leurs valeurs sont indiqués dans le Tableau 1, couvrant la structure du modèle, la configuration de l'entraînement ainsi que des seuils cruciaux, tels que la dimension de l'incorporation, le nombre de couches de convolution, le taux d'apprentissage et la taille du lot. Tous les paramètres ont été ajustés par rapport à l'ensemble de validation à l'aide d'une recherche en grille, le modèle entraîné a convergé de manière stable, et les performances sont optimales. Certains seuils ont été définis conjointement avec des critères propres au domaine afin de satisfaire aux exigences de haute fiabilité du contrôle de conformité de l'IA médicale.
| Paramètre | Valeur | Description |
| Dimension de l'incorporation | 128 | Taille de la dimension des caractéristiques pour les incorporations de nœuds |
| Nombre de couches de convolution | 3 | Profondeur du réseau de convolution sur graphes sensible aux relations |
| Taux d'apprentissage | 0,001 | Taux d'apprentissage initial pour l'optimiseur Adam |
| Taille du lot | 32 | Nombre de sous-graphes traités par lot |
| Taux de dropout | 0,1 | Probabilité de dropout appliquée aux caractéristiques des nœuds pendant l'entraînement |
| Nombre de têtes d'attention | 8 | Nombre de têtes dans le mécanisme d'attention multi-têtes |
| Coefficient de régularisation L2 | 5 × 10⁻⁴ | Coefficient de décroissance du poids pour la régularisation des paramètres |
| Seuil de similarité | 0,75 | Similarité minimale des incorporations pour la validation de conformité |
| Seuil de contribution du gradient | 0,01 | Seuil pour sélectionner les arêtes à fort impact dans la construction du sous-graphe biaisé |
| Taille de la fenêtre de surveillance | 10 | Pas de temps utilisés pour suivre la dynamique des poids des arêtes |
Tableau 1 : Paramètres principaux. Liste des principaux hyperparamètres utilisés dans les expériences : dimension de l'incorporation (256), nombre de couches GCN (3), dimension cachée (256), taux d'apprentissage (1 × 10−3), taille du lot (64), dimension du vecteur d'attention, seuil de contribution des arêtes (85e percentile des amplitudes du gradient), seuil dynamique de conformité (µ‑2σ, où µ and σ proviennent de l'ensemble de validation composé de 500 instances conformes), nombre de communautés K (déterminé par regroupement spectral) et optimiseur (Adam). Ces valeurs ont été sélectionnées par recherche en grille sur l'ensemble de validation.