Construcción de una red neuronal gráfica para el grafo de conocimiento jurídico médico de inteligencia artificial
Como se muestra en la Figura 1, el marco propuesto comprende tres módulos principales. La capa de entrada integra datos de múltiples fuentes en un grafo heterogéneo mediante la codificación de entidades multimodales y la modelización de aristas dirigidas. Luego, la capa GCN sensible a relaciones realiza un alineamiento semántico cruzado mediante pesos y atención específicos para cada tipo, generando incrustaciones unificadas de nodos. Finalmente, estas incrustaciones permiten el rastreo de sesgos (mediante retropropagación del gradiente y detección de comunidades) y el monitoreo dinámico del cumplimiento (mediante mapeo en tiempo real de nodos y seguimiento de pesos de aristas), entregando como salida evidencia interpretable de atribución y alertas de riesgo para los reguladores.

Figura 1: Grafo de conocimiento legal y arquitectura para el rastreo de sesgos en inteligencia artificial médica. Este diagrama ilustra el flujo general del marco propuesto. La capa de entrada fusiona datos heterogéneos de múltiples fuentes (textos legales, guías clínicas, informes de auditoría de algoritmos), que se codifican en cuatro tipos de entidades (cláusulas legales, comportamientos médicos, módulos de algoritmos, partes responsables) y se conectan mediante cuatro relaciones legales-semánticas dirigidas (violación, base, desencadenante, atribución). La capa GCN sensible a relaciones realiza alineación semántica cruzada mediante pesos y atención específicos por tipo. El módulo de rastreo de sesgos utiliza la retropropagación del gradiente para identificar aristas de alta contribución y luego aplica detección de comunidades para localizar grupos de nodos raíz. El monitor dinámico de cumplimiento asigna decisiones en tiempo real a nodos temporales, evalúa la similitud de los vectores integrados respecto a las cláusulas legales y rastrea la evolución del peso de las aristas para emitir alertas tempranas. Las salidas incluyen evidencia interpretable de atribución y alertas de riesgo. Haga clic aquí para ver una versión ampliada de esta figura.
Codificación estructurada de grafo heterogéneo de entidades legales y relaciones
Se derivan consistentemente cuatro entidades fundamentales de las leyes regulatorias de inteligencia artificial médica, las guías clínicas y los informes de auditoría de algoritmos: cláusulas legales, procedimientos médicos, módulos de algoritmos y entidades responsables. Se propone un modelo independiente de aprendizaje de representación de características para cada tipo de entidad, con el fin de que sean semánticamente distinguibles. Los nodos de cláusulas legales se organizan para contener el número de la cláusula legal, el cual se utiliza como un ID (identificador) único para dicha cláusula. Al mismo tiempo, se define un índice de cuantificación de la severidad de la sanción para indicar el nivel de responsabilidad legal asociado a la cláusula, y, en consecuencia, se establece un vector de características.
(1)
ci es el número de entrada, Emb(·) representa la aplicación de incrustación de baja dimensión, y [·;·] representa la operación de concatenación de vectores. Esta representación conserva tanto la estructura formal como la gravedad del castigo del texto legal, lo que permite el razonamiento entre enunciados.
Los nodos de comportamiento médico se estandarizan y codifican según un sistema de clasificación de operaciones clínicas, extrayendo su nivel de riesgo rj ∈ {1,2,3} y el conjunto de etiquetas de escenarios aplicables sj ⊂ S, donde S es el conjunto completo de categorías de escenarios predefinidas. Se utiliza la codificación multi-hot para procesar el conjunto de etiquetas, y se concatena con la incrustación del nivel de riesgo para formar una representación inicial:
(2)
Esta estrategia asegura que diferentes tipos de comportamientos médicos tengan relaciones de distancia medibles en el espacio vectorial, lo que permite comparaciones entre escenarios. La función de incrustación de texto Emb(·) se implementa utilizando el modelo de lenguaje jurídico chino preentrenado Lawformer (preentrenado en un corpus jurídico chino a gran escala), con una dimensión de salida fija de 768.
Basándose en las dependencias lógicas y las restricciones legales entre entidades, se establecen cuatro tipos de relaciones semánticas dirigidas: «violación», «base», «activación» y «atribución», cada una correspondiente a diferentes patrones causales legales. A cada arista eij ⊂ E se le asigna un tipo de etiqueta tij ⊂ T = {violate, base, trigger, attribute} para la transmisión de mensajes posterior con reconocimiento de relaciones. La construcción de aristas sigue estrictamente el mecanismo de coincidencia de reglas del dominio: cuando un comportamiento médico se desvía de los requisitos normativos, se establece una arista de «violación» que va desde el nodo de comportamiento hasta la cláusula legal pertinente; cuando la cláusula legal sirve como fundamento técnico de cumplimiento para una operación, se establece una arista de «base»; si la salida del módulo algorítmico activa directamente la ejecución de un comportamiento médico específico, se conecta una arista de «activación»; la relación de atribución de responsabilidad se establece a partir de los documentos de responsabilidad de la organización y las conclusiones de auditoría, creando una arista de «atribución» entre la parte responsable y la violación o el defecto algorítmico.
Después de que todos los nodos se inicializan, se forma un grafo heterogéneo (V, E, H0), donde V es el conjunto de nodos, E es el conjunto de aristas dirigidas con etiquetas de tipo, y H0 es la matriz de características inicial. Para mejorar la capacidad discriminativa semántica de la estructura del grafo, las características de los nodos se normalizan:
(3)
μk y σk son la media y la desviación estándar de la característica del k-ésimo nodo en el conjunto de entrenamiento, respectivamente, y ∈ es una constante pequeña para evitar la división por cero. La normalización garantiza que las características heterogéneas de múltiples fuentes participen en las operaciones de convolución de grafos a una escala uniforme, evitando que los efectos de dominancia numérica interfieran con el aprendizaje semántico. El modelo de grafo estructurado resultante representa completamente la topología relacional de los cuatro elementos dimensionales de ley, comportamiento, tecnología y responsabilidad en el sistema de inteligencia artificial médica, proporcionando una base de grafo computable para el análisis posterior de la propagación de sesgos.
Mejora de la alineación por convolución de grafos para semántica jurídica multimodal
Se utiliza una red convolucional gráfica con conocimiento de relaciones38,39, que amplía el marco de la Red Convolutiva Gráfica Relacional (R-GCN), para propagar características a través de múltiples capas del grafo heterogéneo inicial. Mientras que R-GCN introduce matrices de transformación por relación para datos relacionales generales, nuestro enfoque incorpora además un mecanismo de atención aprendible para ponderar dinámicamente las contribuciones de los vecinos y define cuatro tipos específicos de relaciones jurídico-semánticas (violación, base, activación, atribución) adaptadas al análisis de cumplimiento en inteligencia artificial médica. La operación de cada capa parametriza independientemente el proceso de transformación según el tipo semántico de las aristas. Para cualquier nodo objetivo, su información vecinal se agrupa y agrega según los tipos de aristas que lo conectan. Cada tipo de relación dispone de una matriz de transformación lineal dedicada para diferenciar las características transmitidas a lo largo de distintos caminos semánticos jurídicos40,41. Si la arista entre el nodo de cláusula jurídica y el nodo de comportamiento médico es del tipo «base», cuando el nodo de cláusula jurídica recibe un mensaje desde un nodo de comportamiento médico, aplica la matriz de pesos correspondiente para mapear espacialmente las características del vecino. De la misma manera, cuando un nodo de comportamiento médico envía una salida a través del módulo de nodo «activación» del esquema de integración de aristas hacia un módulo algorítmico, se utiliza la matriz de parámetros asociada a esta relación para realizar la transformación de características. Esto imita la fluidez de diferentes tipos de lógica jurídica, permitiendo la realización o definición de distintas capas lógicas que mantienen la independencia semántica durante el flujo de información, sin ruido intermodal. La agregación se define de la siguiente manera:
(4)
mi(l) representa la información integral recopilada por el nodo i en la capa l, Nil es su conjunto de vecinos bajo la relación r, Wr es la matriz de transformación lineal, y hj(l−1) es la representación integrada del nodo vecino en la capa anterior.
Se introduce un mecanismo de atención aprendible durante la agregación de mensajes para ajustar dinámicamente la intensidad de influencia de diferentes nodos vecinos en la actualización de la representación del nodo objetivo42,43. El coeficiente de atención se genera en función de dos factores: la similitud de atributos entre nodos y la importancia legal, sin depender de pesos previos fijos. Para los nodos de cláusulas legales, al recibir características de comportamientos médicos vecinos, la puntuación de atención se calcula según el valor cuantificado de la intensidad de la sanción asociada a estos últimos; cuando el nodo del módulo algorítmico fusiona información sobre comportamientos médicos, se centra en los vecinos con niveles más altos de riesgo operativo. El peso de atención se calcula de la siguiente manera:
(5)
αij es el coeficiente de atención del nodo j al nodo i, y a es el vector de atención aprendible. Este modelo permite la identificación automática de rutas conectadas de alto riesgo o alta restricción durante el entrenamiento de extremo a extremo, asignándoles una mayor atención. La incrustación final del nodo actualizada se determina mediante mensajes ponderados y conexiones residuales.
(6)
σ es la función de activación, y el diseño residual mitiga el problema de desvanecimiento del gradiente en la propagación profunda y garantiza estabilidad ante múltiples conflictos semánticos. Tras L = 3 capas de convolución gráfica (cada una con una dimensión oculta de 256 y activación ReLU), los embeddings de todos los nodos incorporan de forma fluida información contextual multimodal y se convierten en representaciones unificadas con capacidades de discriminación semántica legal.
Se muestran dos diagramas alternativos de análisis de cumplimiento legal para la inteligencia artificial en el ámbito sanitario en la Figura 2, con el objetivo de abordar la visualización de los tipos de relaciones legales y rutas de propagación de sesgos, indicando posibles fuentes de sesgo en esta toma de decisiones. La Figura 2A muestra la influencia de diversas relaciones semánticas legales, donde cuatro tipos de relación están codificados por colores, y para cada tipo las aristas se distinguen mediante un color diferente. El grosor de la arista corresponde al peso de atención de esa relación particular, es decir, en qué medida dicha relación contribuye a la decisión de la IA. Una arista gruesa indica esencialmente una relación legal dominante en la decisión, y en este caso motivó suficientemente el resultado del caso. El tamaño del nodo se mide según su contribución a las violaciones: los nodos más grandes indican una relación más estrecha entre la conducta y cláusulas legales específicas, y por tanto un riesgo potencial mayor. La visualización anterior proporciona una capa semántica legal clara, que nos permite identificar las rutas legales más fuertes y arriesgadas en la toma de decisiones de la IA. La Figura 2B también indica rutas de alta contribución (a la propagación de sesgos), haciendo énfasis en las aristas con altas contribuciones, que se muestran en negrita y acompañadas de líneas discontinuas (por ejemplo, B1-B3) en el proceso de toma de decisiones. El doble ancho de estas aristas representa su importancia en la difusión del sesgo sistémico. Las combinaciones de normas legales y comportamientos técnicos que dan lugar a este efecto de amplificación se muestran en la Figura 2. Este análisis no solo revela la ruta de propagación del sesgo, sino que también facilita la identificación del origen del sesgo, sobre la base del cual puede establecerse la auditoría de cumplimiento y la responsabilidad de la herramienta de IA.

Figura 2: Análisis del cumplimiento legal y la propagación de sesgos en la inteligencia artificial para la atención sanitaria (ejemplo ilustrativo). (A) Relaciones semánticas legales codificadas por colores: violación (rojo), base (azul), desencadenante (verde), atribución (naranja). El grosor de las líneas es proporcional al peso de atención, lo que indica la influencia de cada relación en la decisión de la IA. El tamaño de los nodos es proporcional a su contribución a la violación, resaltando las entidades de riesgo. (B) Subgrafo de propagación de sesgos: las aristas de alta contribución aparecen en negrita y con líneas discontinuas (por ejemplo, B1-B3); las aristas de doble grosor indican amplificación del sesgo sistémico. Esta visualización facilita la identificación de rutas legales dominantes, orígenes de sesgos y auditorías de cumplimiento. No se aplican escalas de medición ni barras de error, ya que se trata de una ilustración esquemática. Haga clic aquí para ver una versión ampliada de esta figura.
Mecanismo de retroceso de subgrafos para la propagación de sesgo
En este estudio, el «sesgo» se define como la desviación sistemática de la salida de un sistema de inteligencia artificial respecto a la decisión clínicamente y legalmente esperada, medida por la discrepancia entre la puntuación de riesgo predicha por el modelo y la etiqueta real de cumplimiento. La señal de sesgo se cuantifica como la pérdida de entropía cruzada entre la salida final del algoritmo y un indicador binario de cumplimiento (1 para cumplimiento, 0 para incumplimiento), agregada sobre todas las instancias de decisión en un lote.
Después de entrenar la red neuronal gráfica, se utiliza su diferenciabilidad para realizar un análisis de retropropagación sobre la señal de sesgo en la capa de salida. A partir del nodo de decisión del algoritmo que detecta anomalías, se calcula la magnitud del gradiente de la función de pérdida con respecto a cada arista conectada, con el fin de cuantificar la contribución de cada arista en la formación del sesgo. Este proceso se implementa mediante un marco de diferenciación automática, retrocediendo capa por capa a lo largo de las aristas dirigidas en la estructura del grafo para obtener la intensidad de influencia de cada transformación de parámetro de arista sobre el cambio en la salida final. Cuanto mayor sea el valor absoluto del gradiente, más dominante será la relación jurídico-técnica que transporta dicha arista en la propagación del sesgo. La contribución de una arista se define como:
(7)
Lbias es la pérdida diferenciable definida para el comportamiento sesgado, y wi es el vector de pesos de entrada correspondiente al tipo de arista. Este valor de gradiente refleja el grado de participación de una relación semántica específica en el sesgo de asociación actual. Después de puntuar todas las aristas de esta manera, se establece un umbral dinámico τ para filtrar el conjunto de aristas de alta contribución Ehigh cuya contribución excede gij > τ, formando el subgrafo inicial de propagación del sesgo Gbias = (Vbias, Ehigh). Específicamente, τ se determina como el percentil 85 de los valores absolutos de los gradientes en todas las aristas en cada época de entrenamiento, asegurando que solo se conserven el 15 % de las aristas más influyentes para la construcción del subgrafo. Este subgrafo se centra en las rutas de conexión clave más propensas a generar sesgo sistemático, comprimiendo el espacio de búsqueda y mejorando la eficiencia del rastreo de fuentes.
Dentro del subgrafo de propagación de sesgo construido, se ejecuta un algoritmo de detección de comunidades guiado por agrupamiento espectral para identificar estructuras de clústeres de nodos altamente coherentes. Este proceso se basa en la factorización de la matriz laplaciana normalizada del subgrafo, proyectando las representaciones de los nodos en un espacio espectral de baja dimensionalidad y aplicando una estrategia de agrupamiento sensible a la densidad en este espacio, asegurando así que los nodos de distinto tipo (como cláusulas legales y módulos de algoritmos) se agrupen en el mismo clúster cuando estén funcionalmente estrechamente relacionados. Cada comunidad identificada representa una posible unidad de bucle funcional o de agregación de responsabilidades. Los resultados de la partición en comunidades se rigen por los siguientes objetivos de optimización:
(8)
L=D−A es la matriz laplaciana del subgrafo, A es la matriz de adyacencia, D es la matriz de grados, ck es el vector indicador de la k-ésima comunidad, y K es el número predeterminado de comunidades. Este criterio maximiza la diferencia mínima del corte entre comunidades, asegurando conexiones internas estrechas.
Ahora, se realiza un análisis basado en composición cruzada de capas en cada comunidad. Si una comunidad tiene nodos de cláusulas legales y nodos de módulos algorítmicos, se etiqueta como una fuente potencial de sesgo. Para probar su causalidad, se lleva a cabo una prueba de intervención: todas las aristas en esta región se eliminan temporalmente del grafo, se ejecuta nuevamente el mismo proceso de toma de decisiones y se observan las diferencias en las mediciones del sesgo. La medida de validez causal se define como:
(9)
Borig y Bmáscara representan la intensidad del sesgo del modelo original y del sesgo tras la aplicación de la máscara, respectivamente. Si la medida de validez causal está significativamente por encima del umbral predeterminado, implica que el grupo de nodos ha sido identificado como una fuente explicable de sesgo, lo cual guiará la corrección de conformidad y la asignación de fallos posteriores.
Verificación dinámica del cumplimiento de las restricciones legales
Las instancias de toma de decisiones en tiempo real que surgen durante el funcionamiento de un sistema de inteligencia artificial médica se introducen como nodos transitorios y se integran en un espacio de grafo de conocimiento aprendido. Cada nodo genera un vector de características inicial leyendo su contexto de entrada, su comportamiento de salida y el estado del algoritmo. Luego, este vector se introduce en una red neuronal gráfica con parámetros congelados para realizar una propagación hacia adelante de una sola capa, produciendo un vector integrado alineado con el grafo de conocimiento, sin alterar la estructura original del grafo. De este modo, se permite comparar los nodos transitorios y los nodos de cláusulas legales en un espacio semántico común.
Luego calcule la similitud del coseno entre el nodo transitorio y cada uno de los nodos de cláusulas legales:
(10)
htemp es la incorporación del nodo temporal, y hjlaw es la incorporación del nodo de la cláusula legal j-ésima. El valor de similitud refleja virtualmente el grado de coincidencia semántica entre la decisión actual y cada restricción legal. Se establece un umbral dinámico de cumplimiento θ basado en la distribución de similitud de muestras históricas de cumplimiento, para adaptar el límite de evaluación a diferentes escenarios de aplicación. Específicamente, θ = µ - 2σ, donde µ y σ son la media y la desviación estándar de la distribución de similitud del coseno calculada a partir de un conjunto de validación de 500 instancias de decisiones cumplidoras conocidas.
Si un puntaje de similitud coseno cae por debajo del umbral dinámico de cumplimiento, se considera que se ha violado la norma correspondiente, lo que activa el mecanismo de alerta de cumplimiento. La notificación también incluye el número mínimo de la cláusula legal coincidente, el valor de similitud y la dirección del análisis de divergencia, lo cual debería ser suficiente para que los reguladores actúen de inmediato. Este enfoque proporciona una asignación interpretable desde la toma de decisiones opaca hasta el espacio de la semántica jurídica y facilita la verificación de cumplimiento en tiempo real.
Durante la operación continua, se rastrea la tendencia del cambio de peso en los bordes clave de conexión entre tecnología jurídica en el subgrafo de propagación de sesgos. Se hace hincapié en los bordes que conectan los nodos del módulo algorítmico con los nodos de cláusulas legales, ya que representan directamente la intensidad de respuesta del comportamiento técnico frente a regulaciones específicas. Los parámetros de la matriz de transformación para cada borde objetivo se registran durante la inferencia, y su norma se extrae como un indicador dinámico de la evolución de la intensidad de correlación entre ambos. Definiendo la secuencia de intensidad del borde como:
(11)
wt representa la norma de Frobenius de la matriz de pesos correspondiente a la relación entre el borde eij en el instante t, y Wkl(t) es la matriz de parámetros utilizada realmente en el modelo en ese momento. Este indicador refleja la profundidad del aprendizaje del modelo o su dependencia respecto a la restricción legal.
Se realiza una prueba de monotonicidad con ventana deslizante sobre la secuencia, y se utiliza una prueba de signos mejorada para determinar si se observa una tendencia ascendente significativa. Si los incrementos durante N pasos de tiempo consecutivos cumplen la condición de dominancia positiva, entonces se considera que el borde presenta un fenómeno de refuerzo anormal. Combinando además datos históricos de contribución del gradiente, si se ha identificado que el borde fue un camino de alto impacto en la ronda anterior del análisis de rastreo de fuente, se inicia un proceso de alerta temprana por acumulación de sesgo sistémico.
Finalmente, se genera un informe de rastreo de origen, que incluye información sobre los nodos en ambos extremos del borde objetivo, curvas de cambio de peso, estadísticas sobre la frecuencia de decisiones relacionadas y recomendaciones potenciales de atribución. Este mecanismo permite un salto desde un juicio estático de cumplimiento hacia una predicción dinámica de riesgos, apoyando la intervención proactiva ante posibles desviaciones institucionales.
Datos y diseño experimentales
Para verificar la eficacia del marco propuesto, este artículo construye un conjunto de datos heterogéneo de múltiples fuentes que integra regulaciones reales y datos de simulación, y diseña experimentos de control rigurosos. Las fuentes de datos incluyen regulaciones nacionales sobre inteligencia artificial en medicina, guías clínicas de tratamiento, informes de auditoría de algoritmos de código abierto y registros simulados de decisiones. Tras el preprocesamiento, se construye un grafo de conocimiento heterogéneo de referencia que contiene 285 nodos (85 cláusulas legales, 120 comportamientos médicos, 42 módulos de algoritmos y 38 entidades responsables) y 1247 aristas dirigidas, como se muestra en Figura 3.

Figura 3: Distribución y características de los tipos heterogéneos de entidades. (A) Gráfico de barras que muestra el número de nodos para cada tipo de entidad: cláusulas legales (85), comportamientos médicos (120), módulos de algoritmos (42), partes responsables (38). (B) Histograma de la intensidad de sanciones para los nodos de cláusulas legales, agrupados en categorías baja (0‑0,33), media (0,34‑0,66) y alta (0,67‑1,0); el eje vertical representa el conteo. (C) Gráfico circular de la distribución de niveles de riesgo entre los nodos de comportamientos médicos: bajo (19 %), medio (43 %), alto (38 %). Todos los valores son conteos absolutos o porcentajes; no se presentan barras de error porque estas son estadísticas descriptivas del conjunto de datos. Haga clic aquí para ver una versión más grande de esta figura.
Figura 3 ilustra la distribución y características de los nodos de entidad en el grafo de conocimiento heterogéneo. Figura 3A muestra la distribución del número de cuatro tipos de nodos de entidad, siendo los nodos de «comportamiento médico» los más numerosos (120), seguidos por los de «cláusulas legales» (85), mientras que los de «módulos de algoritmos» (42) y «entidades responsables» (38) son relativamente menos numerosos. Esto se debe a que el grafo está diseñado estructuralmente en función del comportamiento y las normas. Figura 3B presenta la distribución de las intensidades de sanción para nodos que representan una cláusula legal única, donde la intensidad mide la gravedad de la responsabilidad legal. Los datos indican que hay relativamente pocas disposiciones con alta intensidad de sanción, y la mayoría se encuentran en un rango de intensidad media a baja, lo cual es coherente con la realidad de que solo existen unas pocas cláusulas de violación grave en los sistemas legales del mundo real. Figura 3C ilustra la distribución del nivel de riesgo en los nodos de comportamiento médico, donde los comportamientos de riesgo medio tienen la mayor proporción (43 %), mientras que los de riesgo bajo tienen la proporción más baja (19 %), lo que revela que los escenarios médicos operan normalmente, y las operaciones de alto riesgo están sujetas a restricciones de asociación más rigurosas en el grafo. Estas estadísticas justifican colectivamente el esquema de codificación de desambiguación de entidades adoptado en la construcción del grafo de conocimiento para proporcionar soporte de características al alineamiento posterior mediante convolución en grafos.
Todo el conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento (70%), validación (10%) y prueba (20%), estratificados por tipo de nodo y distribución de relaciones, para preservar la estructura general del grafo en cada partición. La misma partición se utilizó de forma consistente para todos los métodos de referencia para garantizar una comparación justa. Además de esta partición básica, los tres gradientes de densidad del grafo de conocimiento (escaso, medio, denso) y las tres configuraciones de complejidad interjurisdiccional (única, bilateral, multilateral) descritas anteriormente sirven como bancos de pruebas prácticos e independientes, que en conjunto evalúan la robustez del método bajo condiciones variables de completitud de datos y superposición regulatoria. Para construir etiquetas de referencia verdaderas para la evaluación de la localización de sesgos, adoptamos una estrategia de dos pasos: (1) Anotación por expertos: tres expertos en derecho y medicina revisaron de forma independiente los registros de decisiones e identificaron los nodos causales y las rutas de propagación de cada violación de cumplimiento registrada, resolviéndose las discrepancias por votación mayoritaria; (2) Inyección simulada: para pruebas controladas, se inyectaron artificialmente señales de sesgo en 20 rutas de decisión seleccionadas al azar mediante la perturbación de los pesos de las aristas en el grafo de conocimiento, asegurando que los nodos fuente reales y las aristas afectadas fueran conocidos de antemano.
Para todos los métodos de referencia (TransE, ComplEx, Explicador de Redes Neurales de Grafos (GNN), KG-BERT y Node2Vec), utilizamos la misma configuración de entrenamiento (optimizador Adam, tasa de aprendizaje 1 × 10−3, tamaño de lote 64, 100 épocas) y las mismas particiones de datos que nuestro método para garantizar una comparación justa. Para TransE y ComplEx, la dimensión del embedding se estableció en 256 con un margen de 1,0; para KG-BERT, utilizamos el modelo BERT-base preentrenado con un tamaño de lote de 16 y una longitud máxima de secuencia de 128; para GNNExplainer, utilizamos una GCN de 3 capas con la misma dimensión oculta de 256; y para Node2Vec, establecimos la longitud del recorrido en 80, el número de recorridos por nodo en 10 y la dimensión del embedding en 256.
Para garantizar una comparación justa, adaptamos todos los métodos de referencia a las mismas tareas de localización de sesgos, concretamente la identificación del nodo raíz y la reconstrucción del camino de propagación. Para TransE, ComplEx y Node2Vec, que no son inherentemente explicables, calculamos el gradiente de la pérdida por sesgo respecto al embedding de cada nodo y utilizamos la magnitud del gradiente como puntuación de importancia del nodo; los nodos raíz se seleccionaron mediante umbralización de estas puntuaciones, y los caminos de propagación se reconstruyeron conservando las aristas con las mayores contribuciones del gradiente. Para GNNExplainer, utilizamos directamente sus mecanismos integrados de importancia de aristas y máscara de nodos para obtener tanto los nodos raíz como los subgrafos. Para KG‑BERT, que opera sobre tripletas, convertimos cada arista del grafo en una tripleta textual y empleamos los pesos de atención del modelo sobre las entidades para derivar la importancia de los nodos, seguido de la misma estrategia de umbralización para la reconstrucción del camino. Mediante estas adaptaciones, cada método de referencia produce predicciones tanto de nodos raíz como de caminos de propagación, lo que permite una evaluación uniforme de todos los métodos.
La evaluación se centra en cuatro capacidades fundamentales: precisión del alineamiento semántico, capacidad para localizar sesgos, eficiencia de la responsabilidad y generalización entre dominios. También presenta tres variables de control importantes, que imitan la complejidad del mundo real.
1) Gradiente de densidad del grafo de conocimiento: Para evaluar el desempeño del método en diferentes niveles de completitud de la información, se crean dos subconjuntos a partir del grafo completo de referencia (densidad D = 1.0) basándose en una estrategia aleatoria de eliminación de enlaces de la siguiente manera:
Grafo disperso (D ~ 0.3): se conserva aleatoriamente el 30 % de las conexiones, simulando la etapa de construcción temprana del conocimiento con mucha información faltante.
Gráfico de densidad media (D ~ 0,6): se conservan aleatoriamente el 60 % de los enlaces, simulando un escenario típico de una estructura de conocimiento parcialmente conocida.
Grafo denso (D = 1.0): utilizando todas las 1247 aristas, lo que corresponde a un escenario óptimo con un conocimiento relativamente completo.
2) Situación de frecuencia de decisiones médicas con IA: Se establecen tres cargas de flujo de decisiones artificiales para probar el rendimiento en tiempo real del monitoreo dinámico de cumplimiento:
Baja frecuencia de 10 Hz: en promedio, se generan 10 eventos de decisión por segundo, simulando el monitoreo de sistemas a pequeña escala o de un solo sitio.
Frecuencia media de 50 Hz: 50 eventos de decisión por segundo simulando la carga del sistema de inteligencia artificial de instituciones médicas regionales o de escala media.
Alta frecuencia de 100 Hz: 100 eventos de decisión por segundo simulan escenarios de alta presión de concurrencia para los servicios de inteligencia artificial que se implementan en un hospital grande o en una plataforma en la nube.
3) Gradiente de complejidad interjurisdiccional: Para evaluar la transferibilidad del modelado de restricciones legales, se construyeron tres conjuntos de prueba basados en la complejidad:
Jurisdicción única: Consiste únicamente en las leyes y regulaciones chinas vigentes que rigen la inteligencia artificial médica.
Jurisdicción bilateral: Incorpora los regímenes regulatorios de China y la Unión Europea, con aproximadamente el 15 % de las normas siendo contradictorias y superpuestas.
Jurisdicción multilateral: Basándose en los dos primeros, integra además las normas de privacidad y seguridad de la HIPAA de EE. UU. (Ley de Portabilidad y Responsabilidad del Seguro Médico), creando un entorno de prueba en el que los sistemas legales de los tres regímenes jurídicos se entrelazan, aumentando la tasa de conflicto normativo a aproximadamente el 25 %.
Los siguientes indicadores clave se utilizaron para la evaluación cuantitativa:
1) Precisión de alineación semántica: Mide la capacidad del grafo para modelar las relaciones entre entidades legales y técnicas.
Precisión en la alineación de entidades:
(12)
Ppred es el conjunto de pares de entidades alineados predichos por el modelo, y Pgold es el conjunto de alineaciones de referencia anotadas por expertos.
Integridad de la preservación de relaciones:
(13)
Rgraph es el conjunto reconstruido de relaciones en el grafo, y Rtext es el conjunto de relaciones explícitas extraídas del texto legal original.
2) Capacidad de localización de sesgos: Evaluación de la eficacia para rastrear las causas fundamentales y las trayectorias de propagación de los sesgos.
Tasa de recuperación del nodo raíz:
(14)
Npred es el conjunto de nodos fuente de sesgo identificados por el modelo, y Ntrue es el conjunto de nodos fuente reales etiquetados por expertos.
Precisión de la trayectoria de propagación:
(15)
Epred es el conjunto de aristas en el subgrafo de propagación de sesgo inferido por el modelo, y Etrue es el conjunto verdadero de aristas de propagación de sesgo.
3) Eficiencia del rastreo de responsabilidad: evaluar el rendimiento del sistema en escenarios de monitoreo en tiempo real.
Latencia media de rastreo:
(16)
M representa el número total de solicitudes, y titrigger y tireport son las marcas de tiempo del i-ésimo disparador de sesgo y de la generación del informe fuente, respectivamente.
Rendimiento del sistema:
(17)
Nprocesado representa el número de solicitudes de rastreo concurrentes procesadas con éxito dentro del intervalo de tiempo ΔT.
4) Capacidad de generalización entre dominios: Verificación de la adaptabilidad del método a diferentes sistemas jurídicos.
Cobertura jurisdiccional:
(18)
Cencoded representa el número de cláusulas jurisdiccionales diferentes codificadas exitosamente en el grafo, y Cinput representa el número total de cláusulas de entrada.
Tasa de detección de conflictos de restricción:
(19)
Dpred es el conjunto de contradicciones lógicas legales detectadas por el modelo, y Dgold es el conjunto de todos los pares de contradicciones anotados por expertos.
Todos los experimentos se realizaron utilizando una estación de trabajo equipada con un procesador multinúcleo y una unidad de procesamiento gráfico; las especificaciones completas del hardware se proporcionan en la Tabla de Materiales.
Los principales hiperparámetros de este enfoque y sus valores se enumeran en la Tabla 1, que incluye la estructura del modelo, la configuración del entrenamiento y umbrales cruciales, como la dimensión del embedding, el número de capas convolucionales, la tasa de aprendizaje y el tamaño del lote. Todos los parámetros se ajustaron con respecto al conjunto de validación mediante búsqueda en cuadrícula, el modelo entrenado ha convergido de forma estable y el rendimiento es óptimo. Algunos umbrales se establecieron conjuntamente con criterios del dominio para cumplir con los requisitos de alta fiabilidad en la verificación de cumplimiento de la inteligencia artificial médica.
| Parámetro | Valor | Descripción |
| Dimensión del embedding | 128 | Tamaño de la dimensión de características para los embeddings de nodos |
| Número de capas de convolución | 3 | Profundidad de la red de convolución de grafos sensible a relaciones |
| Tasa de aprendizaje | 0.001 | Tasa de aprendizaje inicial para el optimizador Adam |
| Tamaño del lote | 32 | Número de subgrafos procesados por lote |
| Tasa de abandono (dropout) | 0.1 | Probabilidad de abandono aplicada a las características de los nodos durante el entrenamiento |
| Número de cabezales de atención | 8 | Número de cabezales en el mecanismo de atención múltiple |
| Coeficiente de regularización L2 | 5 × 10⁻⁴ | Coeficiente de decaimiento del peso para la regularización de parámetros |
| Umbral de similitud | 0.75 | Similitud mínima de embeddings para la validación de conformidad |
| Umbral de contribución del gradiente | 0.01 | Umbral para seleccionar aristas de alto impacto en la construcción del subgrafo de sesgo |
| Tamaño de la ventana de monitoreo | 10 | Pasos de tiempo utilizados para rastrear la dinámica de los pesos de las aristas |
Tabla 1: Configuraciones principales de los parámetros. Lista de los principales hiperparámetros utilizados en los experimentos: dimensión del embedding (256), número de capas GCN (3), dimensión oculta (256), tasa de aprendizaje (1 × 10−3), tamaño del lote (64), dimensión del vector de atención, umbral de contribución de las aristas (percentil 85 de las magnitudes del gradiente), umbral dinámico de conformidad (µ‑2σ, donde µ y σ provienen del conjunto de validación de 500 instancias conformes), número de comunidades K (determinado mediante agrupamiento espectral) y optimizador (Adam). Estos valores se seleccionaron mediante una búsqueda en cuadrícula sobre el conjunto de validación.