Construction d'un réseau neuronal graphique pour un graphe de connaissances juridiques en intelligence artificielle médicale
Comme illustré dans la Figure 1, le cadre proposé comprend trois modules principaux. La couche d'entrée intègre des données provenant de multiples sources dans un graphe hétérogène grâce à un encodage d'entités multimodal et une modélisation d'arêtes orientées. La couche GCN sensible aux relations effectue ensuite un alignement sémantique intermodal à l'aide de poids et d'attention spécifiques aux types, produisant des intégrations nodales unifiées. Enfin, ces intégrations permettent le traçage des biais (par rétropropagation du gradient et détection de communautés) et la surveillance dynamique de la conformité (par mappage en temps réel des nœuds et suivi des poids des arêtes), la sortie fournissant des preuves d'attribution interprétables et des alertes de risque destinées aux régulateurs.

Figure 1 : Graphe de connaissances juridiques et architecture de traçage des biais pour l'IA médicale. Ce schéma illustre le flux opérationnel global du cadre proposé. La couche d'entrée fusionne des données hétérogènes provenant de multiples sources (textes juridiques, lignes directrices cliniques, rapports d'audit d'algorithmes), qui sont encodées en quatre types d'entités (dispositions juridiques, comportements médicaux, modules d'algorithmes, parties responsables) et reliées par quatre relations juridico-sémantiques orientées (violation, fondement, déclenchement, attribution). La couche GCN sensible aux relations effectue un alignement sémantique intermodal à l'aide de poids et d'attention spécifiques aux types. Le module de traçage des biais utilise la rétropropagation du gradient pour identifier les arêtes à forte contribution, puis applique une détection de communautés afin de localiser les groupes de nœuds racines. Le moniteur dynamique de conformité associe les décisions en temps réel à des nœuds temporaires, évalue la similarité des plongements par rapport aux dispositions juridiques et suit l'évolution des poids des arêtes pour une alerte précoce. Les sorties comprennent des preuves d'attribution interprétables et des alertes de risque. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Codage structuré de graphes hétérogènes d'entités juridiques et de relations
Quatre entités fondamentales sont systématiquement extraites des lois réglementaires sur l'intelligence artificielle médicale, des lignes directrices de pratique clinique et des rapports d'audit d'algorithmes : les clauses juridiques, les procédures médicales, les modules d'algorithme et les entités responsables. Un modèle distinct d'apprentissage de représentation de caractéristiques est proposé pour chaque type d'entité afin qu'il soit sémantiquement distinguable. Les nœuds correspondant aux clauses juridiques sont organisés de manière à contenir le numéro de la clause juridique, utilisé comme identifiant (ID) unique pour cette clause. Parallèlement, un indice de quantification de la gravité de la sanction est défini afin d'indiquer le niveau de responsabilité juridique associé à la clause, et par conséquent, un vecteur de caractéristiques est établi.
(1)
ci est le numéro d'entrée, Emb(·) représente l'application de plongement en basse dimension, et [·;·] représente l'opération de concaténation vectorielle. Cette représentation préserve à la fois la structure formelle et la gravité de la sanction du texte juridique, ce qui permet un raisonnement transversal entre énoncés.
Les nœuds de comportement médical sont normalisés et codés selon un système de classification des opérations cliniques, extrayant leur niveau de risque rj ∈ {1,2,3} et l'ensemble des étiquettes de scénario applicables sj ⊂ S, où S est l'ensemble complet des catégories de scénario prédéfinies. Un encodage multi-hot est utilisé pour traiter l'ensemble des étiquettes, puis est concaténé à l'intégration du niveau de risque afin de former une représentation initiale :
(2)
Cette stratégie garantit que différents types de comportements médicaux présentent des relations de distance mesurables dans l'espace vectoriel, permettant des comparaisons inter-scénarios. La fonction d'incorporation de texte Emb(·) est mise en œuvre à l'aide du modèle linguistique juridique chinois pré-entraîné Lawformer (pré-entraîné sur un vaste corpus juridique chinois), la dimension de sortie étant fixée à 768.
En se basant sur les dépendances logiques et les contraintes juridiques entre les entités, quatre types de relations sémantiques orientées sont établies : « violation », « base », « déclenchement » et « attribution », chacune correspondant à différents schémas causaux juridiques. Chaque arête eij ⊂ E se voit attribuer un type d'étiquette tij ⊂ T = {violate, base, trigger, attribute} afin de permettre la transmission de messages ultérieurs assurant la prise en compte des relations. La construction des arêtes suit strictement le mécanisme d'appariement selon les règles du domaine : lorsqu'un comportement médical s'écarte des exigences normatives, une arête de type « violation » est établie, orientée du nœud du comportement vers la clause juridique pertinente ; lorsque la clause juridique constitue la base normative justifiant une opération, une arête de type « base » est créée ; si la sortie du module d'algorithme déclenche directement l'exécution d'un comportement médical spécifique, une arête de type « déclenchement » est reliée ; la relation d'attribution de responsabilité est établie à partir des documents de responsabilité organisationnelle et des conclusions d'audit, en créant une arête de type « attribution » entre la partie responsable et la violation ou le défaut d'algorithme.
Une fois que tous les nœuds sont initialisés, un graphe hétérogène (V, E, H0) est formé, où V représente l'ensemble des nœuds, E l'ensemble des arêtes dirigées munies d'étiquettes de type, et H0 la matrice de caractéristiques initiale. Afin d'améliorer la capacité discriminative sémantique de la structure du graphe, les caractéristiques des nœuds sont normalisées :
(3)
μk et σk sont respectivement la moyenne et l'écart type de la caractéristique du k-ième nœud sur l'ensemble d'apprentissage, et ∈ est une petite constante destinée à éviter la division par zéro. La normalisation garantit que les caractéristiques hétérogènes provenant de multiples sources participent aux opérations de convolution sur graphe à une échelle uniforme, empêchant ainsi les effets de domination numérique d'interférer avec l'apprentissage sémantique. Le modèle de graphe structuré obtenu reflète intégralement la topologie relationnelle des quatre dimensions que sont le droit, le comportement, la technologie et la responsabilité dans le système d'IA médicale, fournissant une base de graphe calculable pour l'analyse ultérieure de la propagation des biais.
Amélioration de l'alignement par convolution de graphes pour la sémantique juridique transmodale
Un réseau de convolution graphique sensible aux relations38,39, qui étend le cadre du Réseau de Convolution Graphique Relationnel (R-GCN), est utilisé pour propager les caractéristiques à travers plusieurs couches du graphe hétérogène initial. Alors que le R-GCN introduit des matrices de transformation spécifiques à chaque relation pour des données relationnelles générales, notre approche intègre en outre un mécanisme d'attention apprenable afin de pondérer dynamiquement les contributions des voisins, et définit quatre types spécifiques de relations sémantiques juridiques (violation, base, déclenchement, attribution), adaptés à l'analyse de conformité en intelligence artificielle médicale. L'opération de chaque couche paramétrise indépendamment le processus de transformation selon le type sémantique des arêtes. Pour tout nœud cible, les informations de son voisinage sont regroupées et agrégées selon les types des arêtes les reliant. Chaque type de relation est doté d'une matrice de transformation linéaire dédiée, permettant de différencier les caractéristiques transmises le long de différents chemins sémantiques juridiques40,41. Si l'arête entre le nœud de clause juridique et le nœud de comportement médical est de type « base », lorsque le nœud de clause juridique reçoit un message d'un nœud de comportement médical, il applique la matrice de poids correspondante pour projeter spatialement les caractéristiques du voisin. De la même manière, lorsqu'un nœud de comportement médical envoie une sortie via le module d'intégration d'arête de type « déclenchement » vers un module d'algorithme, la matrice de paramètres associée à cette relation est activée et effectue la transformation des caractéristiques. Ce mécanisme imite la fluidité des différents types de logique juridique, permettant ainsi de distinguer différentes couches logiques afin de préserver l'indépendance sémantique durant le flux d'information, sans bruit inter-modal. L'agrégation est définie comme suit :
(4)
mi(l) représente l'ensemble des informations recueillies par le nœud i dans la couche l, Nil est son ensemble de nœuds voisins selon la relation r, Wr est la matrice de transformation linéaire, et hj(l−1) est la représentation intégrée du nœud voisin dans la couche précédente.
Un mécanisme d'attention apprenable est introduit lors de l'agrégation des messages afin d'ajuster dynamiquement l'intensité d'influence des différents nœuds voisins sur la mise à jour de la représentation du nœud cible42,43. Le coefficient d'attention est généré à partir de deux facteurs combinés : la similarité des attributs des nœuds et leur importance juridique, sans dépendre de poids a priori fixes. Pour les nœuds correspondant à des clauses juridiques, lorsqu'ils reçoivent des caractéristiques de comportements médicaux voisins, le score d'attention est calculé selon la valeur quantifiée de l'intensité de la sanction associée à ce dernier ; lorsque le nœud du module algorithmique fusionne des informations sur les comportements médicaux, il se concentre sur les voisins présentant des niveaux de risque opérationnel plus élevés. Le poids d'attention est calculé de la manière suivante :
(5)
αij est le coefficient d'attention du nœud j vers le nœud i, et a est le vecteur d'attention apprenable. Ce modèle permet l'identification automatique des chemins connectés à risque élevé ou à contraintes élevées durant l'entraînement de bout en bout, en leur attribuant une attention plus importante. L'incorporation finale mise à jour du nœud est déterminée par les messages pondérés et les connexions résiduelles.
(6)
σ est la fonction d'activation, et la conception résiduelle atténue le problème de disparition du gradient lors de la propagation profonde et garantit la stabilité en présence de conflits sémantiques multiples. Après L = 3 couches de convolution sur graphes (chacune ayant une dimension cachée de 256 et une activation ReLU), les plongements de tous les nœuds intègrent de manière fluide l'information contextuelle multi-modale et deviennent des représentations unifiées dotées de capacités de discrimination sémantique juridique.
Deux diagrammes alternatifs d'analyse de conformité juridique pour l'intelligence artificielle en santé sont représentés dans la Figure 2, dans le but de visualiser les types de relations juridiques et les voies de propagation des biais, indiquant ainsi les sources potentielles de biais dans cette prise de décision. La Figure 2A illustre l'influence de diverses relations sémantiques juridiques, où quatre types de relations sont codés par couleur, chaque type étant représenté par une couleur d'arête différente. L'épaisseur de l'arête correspond au poids d'attention de la relation considérée, c'est-à-dire à l'importance de cette relation dans la décision de l'IA. Une arête épaisse indique essentiellement une relation juridique dominante dans la décision, et dans ce cas, elle justifie suffisamment l'issue du cas. La taille des nœuds reflète leur contribution aux violations : des nœuds plus grands indiquent une relation plus forte entre le comportement et des clauses juridiques spécifiques, et donc un risque potentiel plus élevé. La visualisation ci-dessus fournit une couche sémantique juridique claire, qui nous permet d'identifier les voies juridiques les plus fortes et les plus risquées dans la prise de décision par l'IA. La Figure 2B met également en évidence les chemins à forte contribution (à la propagation des biais), en soulignant les arêtes à forte contribution, qui sont en gras et accompagnées de lignes en pointillés (par exemple B1-B3) dans le processus de décision. Le doublement de la largeur de ces arêtes représente leur importance dans la diffusion d'un biais systémique. Les combinaisons de règles juridiques et de comportements techniques entraînant cet effet d'amplification du biais sont illustrées dans la Figure 2. Cette analyse révèle non seulement le parcours de propagation des biais, mais facilite également l'identification de l'origine de ces biais, sur la base desquels peuvent être établis le contrôle de conformité et la responsabilité de l'outil d'IA.

Figure 2 : Analyse de la conformité juridique et de la propagation des biais dans l'intelligence artificielle en santé (exemple illustratif). (A) Relations sémantiques juridiques codées par couleurs : violation (rouge), fondement (bleu), déclencheur (vert), attribution (orange). L'épaisseur des arêtes est proportionnelle au poids d'attention, indiquant l'influence de chaque relation sur la décision de l'IA. La taille des nœuds est proportionnelle à leur contribution à la violation, mettant en évidence les entités à risque. (B) Sous-graphe de propagation des biais : les arêtes à forte contribution sont en gras et en pointillés (par exemple, B1‑B3) ; les arêtes de largeur double indiquent une amplification du biais systémique. Cette visualisation facilite l'identification des chemins juridiques dominants, des origines des biais et de l'audit de conformité. Aucune échelle de mesure ni barre d'erreur n'est applicable, car il s'agit d'une illustration schématique. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Mécanisme de retour arrière sur sous-graphe pour le chemin de propagation du biais
Dans cette étude, le « biais » est défini comme l'écart systématique entre la sortie d'un système d'intelligence artificielle et la décision attendue sur le plan clinique et juridique, mesuré par la différence entre le score de risque prédit par le modèle et l'étiquette de conformité réelle. Le signal de biais est quantifié par la perte logarithmique (cross-entropy) entre la sortie finale de l'algorithme et un indicateur binaire de conformité (1 pour conforme, 0 pour non conforme), agrégé sur l'ensemble des instances de décision d'un lot.
Une fois le réseau neuronal graphique entraîné, sa différentiabilité est utilisée pour effectuer une analyse de rétropropagation du signal de biais dans la couche de sortie. À partir du nœud de décision de l'algorithme qui détecte les anomalies, l'amplitude du gradient de la fonction de perte par rapport à chaque arête connectée est calculée afin de quantifier la contribution de chaque arête à la formation du biais. Ce processus est mis en œuvre à l'aide d'un cadre de différentiation automatique, qui remonte couche par couche le long des arêtes orientées de la structure du graphe pour obtenir l'intensité d'influence de chaque transformation de paramètre d'arête sur la variation de la sortie finale. Plus la valeur absolue du gradient est élevée, plus la relation juridico-technique véhiculée par cette arête joue un rôle dominant dans la propagation du biais. La contribution d'une arête est définie comme suit :
(7)
Lbiais est la perte différentiable définie pour un comportement biaisé, et wi est le vecteur de poids d'entrée correspondant au type d'arête. Cette valeur de gradient reflète le degré de participation d'une relation sémantique spécifique au biais d'association actuel. Une fois que toutes les arêtes ont été notées de cette manière, un seuil dynamique τ est défini pour filtrer l'ensemble des arêtes à forte contribution. Eélevé dont la contribution dépasse gij > τ, formant le sous-graphe initial de propagation du biais Gbiais = (Vbiais, Eélevé). Plus précisément, τ est déterminé comme le 85e centile des valeurs absolues du gradient sur l'ensemble des arêtes à chaque époque d'apprentissage, garantissant ainsi que seules les 15 % des arêtes les plus influentes sont conservées pour la construction du sous-graphe. Ce sous-graphe met l'accent sur les chemins de connexion clés les plus susceptibles d'induire un biais systématique, réduisant l'espace de recherche et améliorant l'efficacité du traçage des sources.
Au sein du sous-graphe de propagation de biais construit, un algorithme de détection de communautés guidé par une segmentation spectrale est exécuté afin d'identifier des structures de grappes de nœuds fortement cohérentes. Ce processus repose sur la factorisation de la matrice de Laplace normalisée du sous-graphe, qui projette les intégrations des nœuds dans un espace spectral de faible dimension et applique une stratégie de regroupement sensible à la densité dans cet espace, garantissant ainsi que les nœuds de types différents (tels que des clauses juridiques et des modules d'algorithme) soient regroupés dans la même grappe lorsqu'ils sont fonctionnellement étroitement liés. Chaque communauté identifiée représente une boucle fonctionnelle potentielle ou une unité d'agrégation de responsabilités. Les résultats de partitionnement en communautés sont déterminés par les objectifs d'optimisation suivants :
(8)
L=D−A est la matrice laplacienne du sous-graphe, A est la matrice d'adjacence, D est la matrice de degré, ck est le vecteur indicateur de la k-ième communauté, et K est le nombre prédéfini de communautés. Ce critère maximise la différence de coupe minimale entre les communautés, assurant des connexions internes étroites.
Une analyse basée sur la composition croisée des couches est désormais effectuée pour chaque communauté. Si une communauté contient des nœuds correspondant à des clauses juridiques et des nœuds de modules algorithmiques, elle est marquée comme une source potentielle de biais. Pour tester sa causalité, un test d'intervention est réalisé : toutes les arêtes de cette région sont temporairement supprimées du graphe, le même processus de prise de décision est exécuté à nouveau, et les différences observées dans les mesures de biais sont notées. La mesure de validité causale est définie comme suit :
(9)
Borig et Bmask représentent respectivement l'intensité du biais du modèle d'origine et celle du biais après masquage. Si la mesure de validité causale est nettement supérieure au seuil prédéterminé, cela implique que le regroupement de nœuds a été identifié comme une source explicative de biais, ce qui guidera ultérieurement la correction de conformité et l'attribution des défaillances.
Vérification dynamique de la conformité aux contraintes juridiques
Les instances de décision en temps réel apparaissant lors du fonctionnement d'un système d'intelligence artificielle médical sont introduites comme des nœuds transitoires et intégrées dans un espace de graphe de connaissances appris. Chaque nœud produit un vecteur de caractéristiques initial en lisant son contexte d'entrée, son comportement de sortie et l'état de l'algorithme. Ensuite, ce vecteur est transmis à un réseau neuronal graphique aux paramètres figés afin d'effectuer une propagation avant en une couche, produisant un vecteur intégré aligné sur le graphe de connaissances sans modifier la structure originale du graphe. Cela permet ainsi de comparer les nœuds transitoires et les nœuds correspondant à des clauses juridiques dans un espace sémantique commun.
Ensuite, calculez la similarité cosinus entre le nœud transitoire et chacun des nœuds correspondant aux clauses légales :
(10)
htemp est l'incorporation du nœud temporaire, et hjlaw est l'incorporation du nœud de la j-ième clause juridique. La valeur de similarité reflète virtuellement le degré de correspondance sémantique entre la décision actuelle et chaque contrainte juridique. Un seuil de conformité dynamique θ est défini à partir de la distribution de similarité d'échantillons historiques de conformité, afin d'adapter la limite de jugement à différents scénarios d'application. Plus précisément, θ = µ - 2σ, où µ et σ représentent respectivement la moyenne et l'écart type de la distribution de similarité cosinus calculée à partir d'un jeu de validation composé de 500 décisions conformes connues.
Si un score de similarité cosinus est inférieur au seuil de conformité dynamique, la règle de droit correspondante est considérée comme violée, ce qui déclenche le mécanisme d'alerte de conformité. La notification inclut également le numéro minimal de la clause juridique correspondante, la valeur de similarité et la direction de l'analyse de divergence, ce qui devrait permettre aux régulateurs d'agir rapidement. Cette approche fournit une cartographie interprétable allant d'une prise de décision opaque vers l'espace de la sémantique juridique et facilite la vérification de la conformité en temps réel.
Pendant le fonctionnement continu, on suit l'évolution du poids des arêtes clés du sous-graphe de propagation des biais, qui représentent les connexions entre le droit et la technologie. L'accent est mis sur les arêtes reliant les nœuds des modules algorithmiques aux nœuds des clauses juridiques, car elles représentent directement l'intensité de la réponse du comportement technique à des réglementations spécifiques. Les paramètres de la matrice de transformation pour chaque arête cible sont enregistrés pendant l'inférence, et leur norme est extraite comme indicateur dynamique de l'évolution de la force de corrélation entre les deux. On définit la séquence de force d'arête comme suit :
(11)
wt représente la norme de Frobenius de la matrice de poids correspondant à la relation entre l'arête eij au temps t, et Wkl(t) est la matrice de paramètres effectivement utilisée dans le modèle à ce moment. Cet indicateur reflète la profondeur d'apprentissage du modèle ou sa dépendance vis-à-vis de la contrainte légale.
Un test de monotonie à fenêtre glissante est effectué sur la séquence, et un test des signes amélioré est utilisé pour déterminer si une tendance croissante significative est observée. Si les accroissements sur N pas de temps consécutifs satisfont la condition de dominance positive, alors l'arête est considérée comme présentant un phénomène de renforcement anormal. En combinant davantage les données historiques de contribution du gradient, si l'arête a été identifiée comme un chemin à fort impact lors du tour précédent de l'analyse de traçage de source, un processus précoce d'alerte d'accumulation de biais systémique est initié.
Enfin, un rapport de traçage de la source est généré, incluant des informations sur les nœuds situés aux deux extrémités de l'arête cible, les courbes d'évolution des poids, des statistiques sur la fréquence des décisions associées, ainsi que des recommandations d'attribution potentielles. Ce mécanisme permet un saut allant du jugement statique de conformité à la prédiction dynamique des risques, en soutenant une intervention proactive face aux écarts institutionnels potentiels.
Données expérimentales et conception
Afin de vérifier l'efficacité du cadre proposé, cet article construit un jeu de données hétérogène multi-source intégrant des réglementations réelles et des données de simulation, et conçoit des expériences de contrôle rigoureuses. Les sources de données comprennent les réglementations nationales sur l'intelligence artificielle en milieu médical, les lignes directrices de traitement clinique, les rapports d'audit d'algorithmes open source et les journaux de décisions simulées. Après prétraitement, un graphe de connaissances hétérogène de référence contenant 285 noeuds (85 clauses juridiques, 120 comportements médicaux, 42 modules d'algorithme et 38 entités responsables) et 1247 arcs orientés est construit, comme illustré dans la Figure 3.

Figure 3 : Répartition et caractéristiques des types d'entités hétérogènes. (A) Graphique en barres montrant le nombre de nœuds pour chaque type d'entité : clauses juridiques (85), comportements médicaux (120), modules d'algorithme (42), parties responsables (38). (B) Histogramme de l'intensité des pénalités pour les nœuds correspondant aux clauses juridiques, regroupés en catégories faible (0‑0,33), moyenne (0,34‑0,66) et élevée (0,67‑1,0) ; l'axe vertical représente le nombre d'occurrences. (C) Camembert de la répartition des niveaux de risque parmi les nœuds de comportements médicaux : faible (19 %), moyen (43 %), élevé (38 %). Toutes les valeurs sont des effectifs absolus ou des pourcentages ; aucune barre d'erreur n'est indiquée car il s'agit de statistiques descriptives du jeu de données. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Figure 3 illustre la répartition et les caractéristiques des nœuds d'entité dans le graphe de connaissances hétérogène. Figure 3A présente la répartition du nombre de quatre types de nœuds d'entité, les nœuds « comportement médical » étant les plus nombreux (120), suivis des « clauses juridiques » (85), tandis que les « modules d'algorithme » (42) et les « entités responsables » (38) sont relativement moins nombreux. Cela s'explique par le fait que le graphe est structurellement conçu sur la base des comportements et des règles. Figure 3B montre la répartition des intensités de sanctions pour les nœuds représentant une clause juridique unique, l'intensité mesurant la gravité de la responsabilité juridique. Les données indiquent qu'il existe relativement peu de dispositions à forte intensité de sanction, la majorité se situant dans une fourchette d'intensité moyenne à faible, ce qui est conforme à la réalité selon laquelle seules quelques clauses de violation grave existent dans les systèmes juridiques réels. Figure 3C illustre la répartition du niveau de risque parmi les nœuds de comportement médical, les comportements à risque modéré représentant la plus grande proportion (43 %), tandis que les comportements à faible risque ont la proportion la plus faible (19 %), ce qui révèle que les scénarios médicaux fonctionnent généralement de manière normale, et que les opérations à haut risque sont soumises à des contraintes d'association plus rigoureuses dans le graphe. Ces statistiques justifient collectivement le schéma de codage d'ambiguïté des entités adopté lors de la construction du graphe de connaissances, afin de fournir un soutien en caractéristiques pour l'alignement ultérieur par convolution sur graphe.
L'ensemble complet des données a été divisé aléatoirement en ensembles d'apprentissage (70 %), de validation (10 %) et de test (20 %), en stratifiant selon le type de nœud et la distribution des relations afin de préserver la structure globale du graphe dans chaque sous-ensemble. La même répartition a été utilisée de manière cohérente pour toutes les méthodes de référence afin d'assurer une comparaison équitable. En complément de cette répartition de base, les trois gradients de densité du graphe de connaissances (faible, moyenne, élevée) et les trois niveaux de complexité interjuridictionnelle (unique, bilatérale, multilatérale) décrits ci-dessus servent de bancs d'essai pratiques indépendants, qui évaluent collectivement la robustesse de la méthode dans des conditions variables de complétude des données et de chevauchement réglementaire. Pour construire les étiquettes de référence permettant l'évaluation de la localisation des biais, nous avons adopté une stratégie en deux étapes : (1) Annotation par des experts — trois experts en droit et en médecine ont examiné indépendamment les journaux de décisions et identifié les nœuds à l'origine des biais ainsi que les chemins de propagation pour chaque violation de conformité enregistrée, les divergences ayant été résolues par vote majoritaire ; (2) Injection simulée — pour des tests contrôlés, nous avons artificiellement injecté des signaux de biais dans 20 chemins de décision sélectionnés aléatoirement en perturbant les poids des arêtes dans le graphe de connaissances, en veillant à ce que les nœuds sources réels et les arêtes affectées soient connus a priori.
Pour toutes les méthodes de référence (TransE, ComplEx, GNNExplainer, KG-BERT et Node2Vec), nous avons utilisé la même configuration d'apprentissage (optimiseur Adam, taux d'apprentissage de 1 × 10−3, taille de lot de 64, 100 époques) et les mêmes partitions de données que celles de notre méthode afin d'assurer une comparaison équitable. Pour TransE et ComplEx, la dimension d'incorporation a été fixée à 256 avec une marge de 1,0 ; pour KG-BERT, nous avons utilisé le modèle BERT-base pré-entraîné avec une taille de lot de 16 et une longueur maximale de séquence de 128 ; pour GNNExplainer, nous avons utilisé un GCN à 3 couches avec la même dimension cachée de 256 ; et pour Node2Vec, nous avons défini la longueur de marche à 80, le nombre de marches par nœud à 10 et la dimension d'incorporation à 256.
Afin d'assurer une comparaison équitable, nous avons adapté toutes les méthodes de base aux mêmes tâches de localisation des biais, à savoir l'identification du nœud racine et la reconstruction du chemin de propagation. Pour TransE, ComplEx et Node2Vec, qui ne sont pas intrinsèquement explicables, nous avons calculé le gradient de la perte liée au biais par rapport à l'incorporation de chaque nœud et utilisé l'amplitude du gradient comme score d'importance du nœud ; les nœuds racines ont été sélectionnés en appliquant un seuil à ces scores, et les chemins de propagation ont été reconstruits en conservant les arêtes ayant les contributions de gradient les plus élevées. Pour GNNExplainer, nous avons utilisé directement ses mécanismes intégrés d'importance des arêtes et de masquage des nœuds afin d'obtenir à la fois les nœuds racines et les sous-graphes. Pour KG-BERT, qui opère sur des triplets, nous avons converti chaque arête du graphe en un triplet textuel et utilisé les poids d'attention du modèle sur les entités pour déterminer l'importance des nœuds, suivis de la même stratégie de seuil pour la reconstruction du chemin. Grâce à ces adaptations, chaque méthode de base produit des prédictions de nœuds racines et des prédictions de chemins de propagation, permettant ainsi une évaluation uniforme de toutes les méthodes.
L'évaluation est centrée sur quatre capacités fondamentales : la précision de l'alignement sémantique, la capacité à localiser les biais, l'efficacité de la traçabilité et la généralisation à travers différents domaines. Elle présente également trois variables de contrôle importantes, imitant la complexité du monde réel.
1) Gradient de densité du graphe de connaissances : Pour évaluer la performance de la méthode à différents niveaux de complétude des informations, deux sous-ensembles sont créés à partir du graphe complet de référence (densité D = 1,0) selon une stratégie aléatoire de suppression d'arêtes, comme suit :
Graphe clairsemé (D ~ 0,3) : 30 % des arêtes sont conservées aléatoirement, ce qui simule l'étape de construction précoce des connaissances où de nombreuses informations sont manquantes.
Graphe de densité moyenne (D ~ 0,6) : 60 % des arêtes sont conservées aléatoirement, simulant un scénario typique de structure de connaissances partiellement connue.
Graphe dense (D = 1,0) : utilisation des 1247 arêtes, correspondant à un scénario idéal de connaissance relativement complète.
2) Situation de la fréquence des décisions médicales par intelligence artificielle : Trois charges de flux de décision artificiels sont définies pour tester les performances en temps réel de la surveillance dynamique de la conformité :
Basse fréquence de 10 Hz : en moyenne, 10 événements de décision sont générés par seconde, simulant la surveillance de systèmes à petite échelle ou de sites uniques.
Fréquence moyenne de 50 Hz : 50 événements de décision par seconde, simulant la charge du système d'intelligence artificielle d'établissements médicaux régionaux ou de taille moyenne.
Haute fréquence à 100 Hz : 100 événements de décision par seconde simulent des scénarios de forte pression de concurrence pour les services d'intelligence artificielle déployés dans un grand hôpital ou sur une plateforme cloud.
3) Gradient de complexité interjuridictionnel : Afin de tester la transférabilité de la modélisation des contraintes juridiques, trois jeux de données expérimentaux fondés sur la complexité ont été établis :
Juridiction unique : se compose exclusivement des lois et réglementations chinoises actuelles régissant l'intelligence artificielle médicale.
Juridiction bilatérale : intègre les régimes réglementaires de la Chine et de l'Union européenne, environ 15 % des règles étant contradictoires et superposées.
Juridiction multilatérale : S'appuyant sur les deux premières, elle intègre en outre les règles de confidentialité et de sécurité issues du HIPAA des États-Unis (Health Insurance Portability and Accountability Act), créant un environnement d'essai dans lequel les systèmes juridiques des trois régimes juridiques s'entrecroisent, augmentant ainsi le taux de conflit de règles à environ 25 %.
Les indicateurs clés suivants ont été utilisés pour l'évaluation quantitative :
1) Précision de l'alignement sémantique : mesure la capacité du graphe à modéliser les relations entre les entités juridiques et techniques.
Précision du rapprochement d'entités :
(12)
Ppred est l'ensemble des paires d'entités alignées prédites par le modèle, et Pgold est l'ensemble des alignements de référence annotés par des experts.
Intégrité de la préservation des relations :
(13)
Rgraph est l'ensemble reconstruit des relations dans le graphe, et Rtext est l'ensemble des relations explicites extraites du texte juridique d'origine.
2) Capacité de localisation des biais : Évaluer l'efficacité du traçage des causes profondes et des chemins de propagation des biais.
Taux de rappel du nœud racine :
(14)
Npred est l'ensemble des nœuds sources de biais identifiés par le modèle, et Ntrue est l'ensemble des nœuds sources réels étiquetés par des experts.
Précision du trajet de propagation :
(15)
Epred est l'ensemble des arêtes dans le sous-graphe de propagation des biais déduit par le modèle, et Etrue est l'ensemble réel des arêtes de propagation des biais.
3) Efficacité du suivi de la responsabilité : Tester les performances du système dans des scénarios de surveillance en temps réel.
Latence moyenne de traçage :
(16)
M représente le nombre total de demandes, et titrigger et tireport sont les horodatages respectifs du i-ième déclenchement de biais et de la génération du rapport source.
Débit du système :
(17)
Nprocessed représente le nombre de demandes de traçage simultanées traitées avec succès dans l'intervalle de temps ΔT.
4) Capacité de généralisation interdomaines : vérification de l'adaptabilité de la méthode à différents systèmes juridiques.
Couverture juridictionnelle :
(18)
Cencoded représente le nombre de clauses juridictionnelles différentes correctement encodées dans le graphe, et Cinput représente le nombre total de clauses d'entrée.
Taux de détection des conflits de contrainte :
(19)
Dpred est l'ensemble des contradictions logiques légales détectées par le modèle, et Dgold est l'ensemble de toutes les paires de contradictions annotées par des experts.
Toutes les expériences ont été réalisées à l'aide d'une station de travail équipée d'un processeur multicœur et d'une unité de traitement graphique ; les spécifications complètes du matériel sont fournies dans le tableau des matériaux.
Les principaux hyperparamètres de cette approche et leurs valeurs sont indiqués dans Tableau 1, incluant la structure du modèle, la configuration de l'apprentissage ainsi que des seuils essentiels tels que la dimension de l'incorporation, le nombre de couches convolutionnelles, le taux d'apprentissage et la taille du lot. Tous les paramètres ont été ajustés par rapport à l'ensemble de validation à l'aide d'une recherche en grille, le modèle entraîné a convergé de façon stable, et les performances sont optimales. Certains seuils ont été définis conjointement avec des critères spécialisés afin de satisfaire aux exigences de haute fiabilité du contrôle de conformité en intelligence artificielle médicale.
| Paramètre | Valeur | Description |
| Dimension de l'incorporation | 128 | Taille de la dimension des caractéristiques pour les incorporations de nœuds |
| Nombre de couches de convolution | 3 | Profondeur du réseau de convolution sur graphes sensible aux relations |
| Taux d'apprentissage | 0.001 | Taux d'apprentissage initial pour l'optimiseur Adam |
| Taille du lot | 32 | Nombre de sous-graphes traités par lot |
| Taux de dropout | 0.1 | Probabilité de dropout appliquée aux caractéristiques des nœuds pendant l'entraînement |
| Nombre de têtes d'attention | 8 | Nombre de têtes dans le mécanisme d'attention multi-têtes |
| Coefficient de régularisation L2 | 5 × 10⁻⁴ | Coefficient de décroissance du poids pour la régularisation des paramètres |
| Seuil de similarité | 0.75 | Similarité minimale des incorporations pour la validation de conformité |
| Seuil de contribution du gradient | 0.01 | Seuil pour sélectionner les arêtes à fort impact dans la construction du sous-graphe biaisé |
| Taille de la fenêtre de surveillance | 10 | Pas de temps utilisés pour suivre la dynamique des poids des arêtes |
Tableau 1 : Paramètres principaux. Liste des principaux hyperparamètres utilisés dans les expériences : dimension de l'incorporation (256), nombre de couches GCN (3), dimension cachée (256), taux d'apprentissage (1 × 10−3), taille du lot (64), dimension du vecteur d'attention, seuil de contribution des arêtes (95e centile des amplitudes du gradient), seuil de conformité dynamique (µ‑2σ, où µ et σ proviennent de l'ensemble de validation composé de 500 instances conformes), nombre de communautés K (déterminé par regroupement spectral) et optimiseur (Adam). Ces valeurs ont été sélectionnées par recherche en grille sur l'ensemble de validation.