Análisis del rendimiento predictivo
FedMediFormer-XAI demostró un mejor rendimiento predictivo en comparación con los modelos de referencia unimodales y convencionales evaluados. La ampliación basada en difusión mejoró la representación de las clases minoritarias, y el rendimiento predictivo resultante se resume en la Tabla 3. La evaluación con ejecuciones repetidas mostró un rendimiento predictivo estable en todos los modelos evaluados. FedMediFormer-XAI alcanzó el rendimiento general más alto, con una exactitud del 94,20 ± 0,34 % (IC del 95 %: 93,78–94,62), una precisión del 93,10 ± 0,30 % (IC del 95 %: 92,73–93,47), una recuperación del 92,80 ± 0,28 % (IC del 95 %: 92,45–93,15) y una puntuación F1 del 92,90 ± 0,28 % (IC del 95 %: 92,55–93,25). El modelo obtuvo un coeficiente de correlación de Matthews (MCC) de 0,88 ± 0,02 (IC del 95 %: 0,86–0,90) y un AUC-ROC de 0,96 ± 0,01 (IC del 95 %: 0,95–0,97). El transformador multimodal centralizado ofreció el segundo mejor rendimiento general, mientras que los modelos de aprendizaje automático unimodales y convencionales mostraron un rendimiento predictivo comparativamente más bajo. Estos resultados indican que el aprendizaje de representaciones multimodales, combinado con la optimización federada, proporciona un mejor rendimiento y mayor estabilidad en la clasificación de la diabetes.
Estudio de ablación
Se utilizó una ablación por componentes para evaluar la contribución del aumento por difusión, el aprendizaje federado, la recomendación de fármacos basada en GraphSAGE y la fusión multimodal. El marco completo FedMediFormer-XAI alcanzó una exactitud de 94,20 ± 0,34 %, una precisión de 93,10 ± 0,30 %, un valor de recuperación de 92,80 ± 0,28 %, una puntuación F1 de 92,90 ± 0,28 %, un coeficiente de correlación Matthew (MCC) de 0,88 ± 0,02 y un AUC-ROC de 0,96 ± 0,01 en cinco ejecuciones independientes. La eliminación del aumento por difusión redujo la exactitud a 91,80 ± 0,42 %, lo que corresponde a una disminución de 2,40 puntos porcentuales, mientras que la puntuación F1 y el AUC-ROC disminuyeron a 90,30 ± 0,38 % y 0,94 ± 0,01, respectivamente. Esta reducción indica la contribución del aumento basado en difusión a la representación de las clases minoritarias y a la robustez predictiva.
La eliminación del aprendizaje federado dio como resultado una precisión del 93,10 ± 0,37 %, lo que representa una disminución de 1,10 puntos porcentuales en comparación con el marco completo. La precisión, recuperación, puntuación F1, MCC y AUC-ROC también se redujeron a 92,20 ± 0,34 %, 91,80 ± 0,32 %, 92,00 ± 0,33 %, 0,86 ± 0,02 y 0,95 ± 0,01, respectivamente. Esta comparación demuestra la contribución de la configuración federada al rendimiento predictivo.
La eliminación del componente de recomendación personalizada de fármacos basado en GraphSAGE provocó un cambio comparativamente pequeño en el rendimiento de la predicción de diabetes, con una precisión que disminuyó a 93,80 ± 0,35 % y una puntuación F1 a 92,60 ± 0,30 %. Los valores correspondientes de MCC y AUC-ROC fueron 0,87 ± 0,02 y 0,96 ± 0,01, respectivamente. Este resultado indica que GraphSAGE contribuye principalmente a la recomendación personalizada de medicamentos, más que a determinar directamente el rendimiento de la clasificación de la diabetes.
La mayor reducción se observó cuando se eliminó la fusión multimodal. La precisión disminuyó a 87,60 ± 0,55 %, lo que representa una disminución de 6,60 puntos porcentuales, mientras que la precisión, recuperación, puntuación F1, MCC y AUC-ROC disminuyeron a 86,80 ± 0,51 %, 85,90 ± 0,54 %, 86,30 ± 0,52 %, 0,76 ± 0,03 y 0,91 ± 0,01, respectivamente. Este hallazgo demuestra la importancia de modelar conjuntamente la información complementaria procedente de modalidades clínicas, de CGM y retinianas.
Análisis del aprendizaje federado
El marco del aprendizaje federado permitió el entrenamiento colaborativo del modelo en clientes distribuidos, manteniendo al mismo tiempo un manejo descentralizado de los datos clínicos brutos. Durante el entrenamiento, el modelo local de cada cliente se ajustó individualmente y se combinó mediante el método de promediado federado. Tras 100 rondas de comunicación, el modelo global convergió, y su rendimiento predictivo se mantuvo consistente con el aprendizaje centralizado. El marco del aprendizaje federado demostró una convergencia estable a lo largo de las rondas de comunicación, a pesar de las distribuciones heterogéneas de los datos entre los clientes. El intercambio protegido de parámetros preservó el manejo descentralizado de los datos, mientras que el modelo global mantuvo un rendimiento predictivo competitivo en comparación con la línea base centralizada. Tabla 4 compara las implementaciones centralizada y federada. El aprendizaje federado requirió un tiempo adicional de entrenamiento debido a la sobrecarga de comunicación, aunque mantuvo un rendimiento predictivo comparable al del aprendizaje centralizado.
Análisis del rendimiento a nivel de conjunto de datos
Para evaluar la generalización en diferentes modalidades sanitarias, se evaluó el rendimiento en cada conjunto de datos por separado. El modelo multimodal FedMediFormer-XAI mostró un rendimiento sólido y generalmente competitivo en todos los conjuntos de datos evaluados. Alcanzó una precisión del 91,8 %, 93,1 %, 92,4 % y 94,2 % en los conjuntos de datos Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM y APTOS 2019, respectivamente. Aunque el conjunto de datos APTOS 2019 obtuvo una precisión ligeramente mayor (94,7 %) y una exactitud (93,9 %) superiores al modelo multimodal, el enfoque multimodal propuesto mantuvo un rendimiento competitivo en todos los conjuntos de datos y alcanzó un AUC-ROC de 0,96, comparable al AUC-ROC más alto a nivel de conjunto de datos. Los resultados generales a nivel de conjunto de datos se presentan en la Tabla 5. Para conjuntos de datos individuales, el análisis de imágenes de retina logró el mejor rendimiento cuando se utilizó de forma aislada, mientras que la fusión multimodal produjo predicciones más estables y equilibradas.
Análisis de recomendación personalizada de medicamentos
El componente de recomendación basado en redes neuronales gráficas se evaluó utilizando información sobre la eficacia de los medicamentos y datos de interacciones entre fármacos, clasificando los medicamentos candidatos según las puntuaciones aprendidas de adecuación paciente-medicamento y excluyendo combinaciones contraindicadas durante la generación de recomendaciones. El uso del formato de grafo heterogéneo y la modelización de las interacciones paciente-medicamento y medicamento-medicamento pudieron realizarse exhaustivamente, apoyando así la selección personalizada de medicamentos y la evaluación de seguridad. El modelo de recomendación GraphSAGE capturó eficazmente las relaciones complejas entre pacientes, enfermedades, hallazgos de laboratorio y medicamentos. Las recomendaciones personalizadas mostraron un alto desempeño en la clasificación, manteniendo al mismo tiempo explicaciones clínicamente significativas mediante el análisis del entorno del grafo y la atribución de características.
Según la Tabla 6, el módulo de recomendación personalizada de medicamentos se evaluó utilizando Precision@5, Recall@5 y NDCG@5. Estas métricas cuantifican la relevancia y la calidad del ordenamiento de las cinco principales recomendaciones personalizadas de medicamentos generadas por el módulo de recomendación basado en GraphSAGE. El sistema de recomendación alcanzó un buen desempeño en el ordenamiento, con una precisión = 0,89, recuperación = 0,84 y NDCG = 0,91.
Análisis de explicabilidad
El marco incorpora SHAP, gradientes integrados, visualización de la atención y explicaciones contrafácticas para apoyar la interpretación de predicciones multimodales. SHAP se utilizó para cuantificar las contribuciones a nivel de característica, los gradientes integrados para atribuir las predicciones a las características de entrada, la visualización de la atención para examinar el enfoque del modelo a través de las modalidades, y las explicaciones contrafácticas para identificar los cambios en las características asociados con predicciones alternativas. Figura 8 presenta un gráfico resumen representativo derivado del modelo FedMediFormer-XAI entrenado, mientras que Figura 9 presenta visualizaciones representativas de la atención extraídas del transformador entrenado. Estas figuras representan salidas obtenidas a partir de la evaluación del modelo, no ilustraciones esquemáticas de la arquitectura propuesta.
En Figura 8, se presentan las clasificaciones a nivel agregado de la importancia de las características. Las características con valores absolutos de SHAP más altos tuvieron una mayor influencia en las predicciones del modelo y también se alinearon bien con el conocimiento clínico existente.
Figura 9 presenta visualizaciones representativas de la atención extraídas directamente del modelo entrenado FedMediFormer-XAI para una muestra de prueba retenida seleccionada al azar. Las visualizaciones incluyen la atención a características clínicas, la atención temporal del MCG, la atención espacial de la retina y la atención cruzada entre las tres modalidades. La visualización de la atención demostró además la asignación aprendida por el modelo de atención a través de múltiples modalidades. La muestra seleccionada mostró una atención relativamente mayor a HbA1c, duración de la diabetes y edad entre las características clínicas, mientras que el mapa de atención del MCG resaltó varios períodos con variabilidad glucémica prominente. El mapa de atención retiniana identificó regiones específicas de la imagen que contribuyen a la representación del modelo, y la matriz de atención cruzada mostró patrones de atención tanto intra-modal como inter-modal. Como se muestra en Figura 9, los mapas de atención derivados del modelo representativos resaltan patrones glucémicos temporales seleccionados, variables clínicas influyentes y regiones de imágenes retinianas relevantes desde el punto de vista diagnóstico en una muestra de prueba retenida.
Resultados de la evaluación centrada en el ser humano
Se diseñó un protocolo prospectivo de evaluación centrada en el ser humano para evaluar la confianza del clínico, la interpretabilidad, la facilidad de uso, la utilidad clínica y la relevancia de las explicaciones bajo condiciones de solo predicción y de predicción más explicación. La evaluación propuesta involucrará a endocrinólogos, especialistas en diabetes y farmacólogos clínicos, con la aprobación correspondiente del Comité Institucional de Ética y el consentimiento informado. Dado que esta evaluación está destinada a una implementación prospectiva futura, en el presente protocolo no se informan las puntuaciones de resultados a nivel de clínico.
Tabla 7 resume el diseño propuesto para la evaluación prospectiva por parte del clínico y los criterios predefinidos para evaluar los efectos de las explicaciones sobre la confianza del clínico, la interpretabilidad y la utilidad percibida. La evaluación prospectiva comparará las valoraciones de los clínicos sobre las predicciones del modelo con y sin explicaciones complementarias, utilizando criterios predefinidos de escala Likert. El marco propuesto para la evaluación prospectiva centrada en el ser humano de la explicabilidad se presenta en la Figura 10

Figura 1: Arquitectura general del marco FedMediFormer-XAI. Descripción esquemática del marco FedMediFormer-XAI, que muestra la adquisición y preprocesamiento de datos multimodales, la ampliación basada en difusión, el aprendizaje específico de modalidad mediante transformadores, el entrenamiento federado del modelo, la recomendación personalizada de medicamentos basada en GraphSAGE y el análisis de explicabilidad. El marco genera predicciones de diabetes, recomendaciones personalizadas de medicamentos y salidas del modelo interpretables. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Adquisición y procesamiento previo de la canalización de conjuntos de datos multimodales. Flujo esquemático para la adquisición y el preprocesamiento de los conjuntos de datos multimodales utilizados en FedMediFormer-XAI. Los datos clínicos y de salud poblacional, los registros de CGM, las imágenes retinianas y la información farmacológica pasan por control de calidad específico por modalidad, preprocesamiento, normalización, codificación y aumento antes de convertirse en representaciones listas para el modelo para análisis posteriores. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Flujo de trabajo para la ampliación de datos basada en difusión. Flujo de trabajo esquemático para la ampliación basada en difusión de datos tabulares estructurados mediante TabDDPM. Las muestras generadas pasan por evaluaciones de calidad y similitud de distribución antes de integrarse con los datos de entrenamiento originales para mejorar el equilibrio de clases. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Arquitectura del marco propuesto del transformador multimodal. Arquitectura esquemática que comprende (A) un codificador TabTransformer para datos clínicos, (B) un codificador transformador temporal para datos de CGM y (C) un codificador Vision Transformer para imágenes de retina. (D) Las representaciones específicas de cada modalidad se integran mediante atención cruzada para generar una representación multimodal unificada. (E) Cabezas de predicción específicas para cada tarea generan las salidas del modelo. (F) Los componentes de regularización y optimización apoyan el entrenamiento del modelo, y (G) las pérdidas de clasificación, regresión y consistencia cruzada guían el proceso de optimización. La representación multimodal resultante permite tareas de predicción, recomendación y explicabilidad posteriores. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Marco de comunicación del aprendizaje federado. Flujo esquemático del entrenamiento federado entre clientes hospitalarios distribuidos. Los modelos multimodales locales se entrenan utilizando datos específicos de cada cliente, y las actualizaciones protegidas del modelo se transmiten a un servidor central para el promedio federado. El modelo global agregado se redistribuye entre los clientes para rondas posteriores de comunicación. El marco también ilustra el intercambio seguro de parámetros y la evaluación de los requisitos de privacidad, comunicación y capacidad computacional. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Flujo de trabajo para recomendación personalizada de fármacos basado en grafos. Flujo de trabajo esquemático para la recomendación personalizada de fármacos basada en GraphSAGE. Los datos farmacológicos y de representación del paciente se organizan en un grafo heterogéneo que incluye entidades y relaciones relevantes en el ámbito sanitario. GraphSAGE aprende representaciones de pacientes y fármacos, que se utilizan para calcular puntuaciones de adecuación entre paciente y fármaco y ordenar los medicamentos candidatos. Las combinaciones de fármacos contraindicadas o inseguras se filtran antes de generar las recomendaciones finales Top-K, con información basada en grafos que apoya la interpretación de dichas recomendaciones. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Marco de evaluación de explicabilidad. Resumen esquemático del flujo de trabajo de explicabilidad. (A) El análisis SHAP evalúa las contribuciones de características globales y locales; (B) Los gradientes integrados proporcionan explicaciones basadas en atribuciones; (C) la visualización de la atención identifica características influyentes e interacciones entre modalidades; y (D) el análisis contrafactual identifica cambios en las características asociados con predicciones alteradas. Las salidas de explicación resultantes apoyan la interpretación de las predicciones del modelo y las recomendaciones personalizadas. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Análisis representativo de la importancia de características derivado del modelo SHAP generado por el modelo entrenado FedMediFormer-XAI. El gráfico resumen de SHAP muestra la distribución de los valores SHAP en todas las muestras evaluadas, con las características ordenadas según su contribución media absoluta SHAP. Los valores SHAP positivos indican contribuciones hacia un mayor riesgo predicho de diabetes, mientras que los valores negativos indican contribuciones hacia un menor riesgo predicho. El color representa el valor correspondiente de la característica, siendo los valores más altos de la característica de color rojo y los más bajos de color azul. El gráfico representa una salida real de explicabilidad derivada del modelo, no una ilustración esquemática. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9: Salidas representativas de atención generadas por el modelo entrenado FedMediFormer-XAI para una muestra de prueba excluida seleccionada al azar. (A) Atención a las características clínicas obtenida de una cabeza de atención del transformador multimodal, que muestra los pesos relativos de atención asignados a las características clínicas. (B) Atención temporal a lo largo de la secuencia de CGM, que ilustra los periodos de tiempo que reciben mayor atención del modelo. (C) Atención espacial para la imagen de fondo de retina, que incluye la imagen original, el mapa de calor de atención y la superposición de atención. (D) Atención cruzada entre los tokens clínicos, de CGM y de modalidad retiniana, que muestra el ponderado de información intra-modal e intermodal. Las visualizaciones mostradas son salidas derivadas del modelo generadas por el modelo entrenado. Los pesos de atención se muestran para la muestra de prueba seleccionada y deben interpretarse como patrones de atención del modelo, no como medidas independientes de causalidad clínica. Haga clic aquí para ver una versión más grande de esta figura.
| Conjunto de datos | Tipo de datos | Muestras/Registros | Características/Contenido | Propósito | Disponibilidad pública |
| Pima Indians Diabetes Dataset | Tabular clínico | 768 pacientes | 8 variables clínicas | Predicción del riesgo de diabetes | Público |
| CDC Diabetes Health Indicators | Salud poblacional | 253.680 registros | Indicadores demográficos, estilo de vida y de salud | Análisis del riesgo poblacional | Público |
| OhioT1DM Dataset | Serie temporal de CGM | 12 sujetos | Glucosa, insulina, comidas, ejercicio, sueño | Modelado temporal de la diabetes | Público |
| APTOS 2019 Blindness Detection | Imágenes de retina | 3.662 imágenes | Fotografías de fondo de ojo con etiquetas de gravedad | Análisis de retinopatía diabética | Público |
| Drug Review Dataset | Farmacológico | 215.063 reseñas | Eficacia del fármaco, calificaciones, reseñas | Recomendación de medicamentos | Público |
| DrugBank Open Data | Grafo de conocimiento de fármacos | Miles de fármacos | Interacciones entre fármacos, dianas, vías metabólicas | Construcción de grafos | Público/Acceso académico |
Tabla 1: Características del conjunto de datos. Resumen de los conjuntos de datos disponibles públicamente utilizados en este estudio, que incluye el tipo de conjunto de datos, tamaño de la muestra, modalidad de los datos, contenido de las características, propósito previsto y disponibilidad.
| Conjunto de datos | Modalidad | Objetivo de predicción | Nivel de fusión |
| Pima Indians Diabetes | Clínica | Clasificación de diabetes | Incrustación de características |
| CDC Diabetes Health Indicators | Salud poblacional | Predicción de riesgo de diabetes | Incrustación de características |
| OhioT1DM | Monitoreo continuo de glucosa | Predicción de tendencia glucémica | Incrustación de características |
| APTOS 2019 | Imágenes de fondo de retina | Análisis de retinopatía diabética | Incrustación de características |
| Drug Review + DrugBank | Farmacológica | Recomendación de fármacos | Incrustación de grafos |
Tabla 2: Estrategia de integración de conjuntos de datos multimodales. Resumen de los conjuntos de datos utilizados para la inteligencia multimodal de la diabetes, que incluye la modalidad de datos, el objetivo de predicción y el nivel en el que se integran las representaciones específicas de cada modalidad. Los datos clínicos, de salud poblacional, de monitoreo continuo de glucosa y de imágenes retinianas se representan como incrustaciones de características, mientras que la información farmacológica se integra mediante incrustaciones de grafos para la recomendación personalizada de fármacos.
| Modelo | Precisión, media ± DE (IC del 95%) | Exactitud, media ± DE (IC del 95%) | Sensibilidad, media ± DE (IC del 95%) | Puntuación F1, media ± DE (IC del 95%) | MCC, media ± DE (IC del 95%) | AUC-ROC, media ± DE (IC del 95%) |
| Bosque aleatorio | 83,60 ± 0,74 (82,68–84,52) | 82,70 ± 0,60 (81,96–83,44) | 81,90 ± 0,56 (81,21–82,59) | 82,30 ± 0,56 (81,61–82,99) | 0,67 ± 0,03 (0,63–0,71) | 0,88 ± 0,01 (0,87–0,89) |
| XGBoost | 85,30 ± 0,71 (84,42–86,18) | 84,70 ± 0,60 (83,96–85,44) | 83,80 ± 0,56 (83,11–84,49) | 84,20 ± 0,56 (83,51–84,89) | 0,70 ± 0,03 (0,66–0,74) | 0,90 ± 0,01 (0,89–0,91) |
| TabTransformer | 87,50 ± 0,52 (86,85–88,15) | 87,00 ± 0,60 (86,26–87,74) | 86,20 ± 0,56 (85,51–86,89) | 86,60 ± 0,56 (85,91–87,29) | 0,75 ± 0,03 (0,71–0,79) | 0,92 ± 0,01 (0,91–0,93) |
| Transformador de visión | 88,80 ± 0,50 (88,18–89,42) | 88,20 ± 0,60 (87,46–88,94) | 87,60 ± 0,56 (86,91–88,29) | 87,90 ± 0,56 (87,21–88,59) | 0,78 ± 0,03 (0,74–0,82) | 0,93 ± 0,01 (0,92–0,94) |
| Transformador temporal | 87,20 ± 0,51 (86,57–87,83) | 86,60 ± 0,60 (85,86–87,34) | 85,90 ± 0,56 (85,21–86,59) | 86,20 ± 0,56 (85,51–86,89) | 0,74 ± 0,03 (0,70–0,78) | 0,91 ± 0,01 (0,90–0,92) |
| CNN-LSTM | 86,90 ± 0,58 (86,18–87,62) | 86,30 ± 0,60 (85,56–87,04) | 85,60 ± 0,55 (84,92–86,28) | 85,90 ± 0,56 (85,21–86,59) | 0,73 ± 0,03 (0,69–0,77) | 0,91 ± 0,01 (0,90–0,92) |
| Transformador multimodal centralizado | 91,30 ± 0,12 (91,15–91,45) | 90,70 ± 0,60 (89,96–91,44) | 90,10 ± 0,56 (89,41–90,79) | 90,40 ± 0,56 (89,71–91,09) | 0,83 ± 0,03 (0,79–0,87) | 0,95 ± 0,01 (0,94–0,96) |
| FedMediFormer-XAI | 94,20 ± 0,34 (93,78–94,62) | 93,10 ± 0,30 (92,73–93,47) | 92,80 ± 0,28 (92,45–93,15) | 92,90 ± 0,28 (92,55–93,25) | 0,88 ± 0,02 (0,86–0,90) | 0,96 ± 0,01 (0,95–0,97) |
Tabla 3: Rendimiento de predicción de diabetes. Rendimiento predictivo comparativo de FedMediFormer-XAI y modelos básicos de aprendizaje automático y aprendizaje profundo utilizando métricas de exactitud, precisión, recuperación, puntuación F1, MCC y AUC-ROC.
| Métrica | Aprendizaje centralizado | Aprendizaje federado |
| Precisión (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| Preservación de la privacidad | No | Sí |
| Compartición de datos brutos requerida | Sí | No |
| Rondas de comunicación | N/A | 100 |
| Tiempo de entrenamiento (horas) | 4.8 | 5.6 |
| Cumplimiento normativo | Moderado | Alto |
Tabla 4: Rendimiento del aprendizaje federado frente al centralizado. Comparación de las implementaciones de aprendizaje centralizado y federado en cuanto al rendimiento predictivo, requisitos de intercambio de datos brutos, rondas de comunicación y tiempo de entrenamiento.
| Conjunto de datos | Precisión (%) | Exactitud (%) | Recuperación (%) | AUC-ROC |
| Conjunto de datos de diabetes de Pima Indians | 91.8 | 90.5 | 89.8 | 0.93 |
| Indicadores de salud de diabetes del CDC | 93.1 | 92.2 | 91.6 | 0.95 |
| Conjunto de datos OhioT1DM | 92.4 | 91.8 | 91.1 | 0.94 |
| Detección de ceguera APTOS 2019 | 94.7 | 93.9 | 93.5 | 0.96 |
| Fusión multimodal (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Tabla 5: Resultados a nivel de conjunto de datos. Análisis del rendimiento en conjuntos de datos individuales y configuraciones de fusión multimodal. Los resultados ilustran la contribución de diferentes modalidades de datos al rendimiento predictivo general.
| Métrica | Valor |
| Precisión@5 | 0.89 |
| Recall@5 | 0.84 |
| NDCG@5 | 0.91 |
| Precisión en la Detección de Interacciones entre Fármacos | 0.95 |
| Cobertura de Recomendación | 0.88 |
| Rango Recíproco Medio (MRR) | 0.86 |
| Puntuación de Cumplimiento de Seguridad | 0.94 |
Tabla 6: Rendimiento de la recomendación personalizada de medicamentos. Evaluación de la recomendación personalizada de medicamentos basada en grafos mediante métricas de clasificación, precisión en la detección de interacciones, cobertura de recomendaciones y evaluación de la seguridad medicamentosa.
| Criterio de evaluación | Diseño de evaluación propuesto |
| Confianza del clínico | Evaluación mediante escala Likert de cinco puntos |
| Interpretabilidad | Evaluación mediante escala Likert de cinco puntos |
| Relevancia clínica | Evaluación mediante escala Likert de cinco puntos |
| Utilidad de la explicación | Evaluación mediante escala Likert de cinco puntos |
| Utilidad percibida | Evaluación mediante escala Likert de cinco puntos |
| Acuerdo entre evaluadores | Kappa de Fleiss, que se calculará tras la evaluación prospectiva |
| Comparación estadística | Prueba estadística pareada, según corresponda tras la recolección de datos |
| Participantes | 12 clínicos, sujetos a aprobación ética y consentimiento informado |
| Estado de la evaluación | Evaluación prospectiva/futura |
Tabla 7: Criterios propuestos de evaluación centrados en el ser humano. Marco de evaluación prospectivo centrado en el clínico propuesto para evaluar la utilidad, relevancia clínica, interpretabilidad, confiabilidad y usabilidad de las explicaciones de FedMediFormer-XAI. La evaluación incluye una evaluación estandarizada mediante una escala Likert de cinco puntos, acuerdo entre evaluadores utilizando kappa de Fleiss, comparación estadística de las condiciones de predicción solamente y predicción más explicación, e intervalos de confianza del 95 %. La evaluación por parte del clínico debe realizarse únicamente tras obtener la aprobación del comité ético institucional correspondiente y el consentimiento informado.
Tabla suplementaria 1: Estrategia de validación del conjunto de datos. Se implementaron partición del conjunto de datos, procedimientos de validación, estrategias de equilibrio de clases y medidas de control de calidad para garantizar la reproducibilidad y una evaluación confiable del modelo. Haga clic aquí para descargar este archivo.
Tabla suplementaria 2: Parámetros del modelo de difusión. Configuración de los ajustes para el modelo de difusión TabDDPM, incluyendo parámetros de entrenamiento, configuraciones de optimización, dimensiones latentes, estrategia de programación de ruido y especificaciones para la generación de muestras sintéticas. Haga clic aquí para descargar este archivo.
Tabla suplementaria 3: Configuración del transformador multimodal. Configuración de la arquitectura del transformador multimodal, que incluye los codificadores clínicos, temporales y de imagen, las dimensiones de incrustación y fusión, las cabezas de atención, el optimizador, la tasa de aprendizaje, el tamaño del lote, las épocas de entrenamiento, el criterio de detención temprana y la pérdida combinada de entrenamiento. Haga clic aquí para descargar este archivo.
Tabla suplementaria 4: Configuración del aprendizaje federado. Parámetros utilizados para el entrenamiento federado con preservación de privacidad, incluyendo el número de hospitales participantes, rondas de comunicación, épocas de entrenamiento local, tasa de participación de los clientes, algoritmo de agregación, optimizador, tasa de aprendizaje, método de encriptación, protocolo de comunicación y política de intercambio de datos brutos. Haga clic aquí para descargar este archivo.
Tabla suplementaria 5: Configuración de GraphSAGE. Configuración del módulo heterogéneo de recomendación personalizada de medicamentos basado en GraphSAGE, que incluye el tipo de grafo, dimensiones ocultas y de incrustación, número de capas del grafo, tamaño de muestreo del vecindario, optimizador, tasa de aprendizaje, tamaño del lote, épocas de entrenamiento, pérdida de clasificación personalizada bayesiana y número de recomendaciones principales de medicamentos. Haga clic aquí para descargar este archivo.
Tabla suplementaria 6: Métricas de evaluación de la explicabilidad. Métricas cuantitativas y centradas en el ser humano utilizadas para evaluar la explicabilidad del marco FedMediFormer-XAI. Las métricas evalúan la fidelidad, estabilidad, consistencia, dispersión, completitud, sensibilidad, infidelidad, acuerdo entre evaluadores y la calidad percibida por los clínicos de las explicaciones. Haga clic aquí para descargar este archivo.
Tabla suplementaria 7: Métricas de evaluación. Se utilizan métricas predictivas, de aprendizaje federado, de recomendación y de explicabilidad para evaluar el rendimiento, la robustez, la calidad del ordenamiento y la interpretabilidad del marco. Haga clic aquí para descargar este archivo.
Tabla suplementaria 8: Diseño de la evaluación centrada en el ser humano. Diseño del estudio de evaluación centrado en el clínico, que incluye grupos de participantes, condiciones de evaluación, criterios de valoración y procedimientos de análisis estadístico. Haga clic aquí para descargar este archivo.
Tabla suplementaria 9: Activos para la reproducibilidad. Resumen de los conjuntos de datos, especificaciones de implementación, archivos de configuración, procedimientos de evaluación, documentación y registros experimentales necesarios para respaldar la reproducibilidad del marco propuesto FedMediFormer-XAI. Haga clic aquí para descargar este archivo.