El marco de XAI propuesto se implementó utilizando el conjunto de datos de diabetes de los indios Pima como conjunto de datos representativo del sector salud. El conjunto de datos de diabetes de los indios Pima se utilizó como el único conjunto de datos para la validación experimental. Todos los resultados predictivos, de explicabilidad, estadísticos y de reproducibilidad informados se generaron a partir de este conjunto de datos. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10000, OhioT1DM y BraTS 2021 no fueron evaluados experimentalmente y se incluyen únicamente como ejemplos que ilustran la aplicabilidad del protocolo general en diferentes modalidades de datos sanitarios. Se utilizó el conjunto de datos completo tras eliminar los registros inválidos y duplicados, y se realizaron las operaciones de preprocesamiento especificadas antes del desarrollo del modelo. El conjunto de datos se dividió en subconjuntos independientes de entrenamiento, validación y prueba mediante una estrategia de partición estratificada predefinida. Se mantuvo la independencia de las muestras entre los tres subconjuntos para minimizar la posibilidad de fugas de datos.
El modelo predictivo se configuró utilizando la arquitectura y los hiperparámetros predefinidos. El modelo se entrenó utilizando el optimizador Adam con la tasa de aprendizaje y el tamaño de lote predefinidos durante un máximo de 100 épocas. Se aplicó detención temprana basada en la pérdida de validación, y se conservó el modelo correspondiente al mejor desempeño en validación. Se especificaron semillas aleatorias para la partición del conjunto de datos, la inicialización del modelo y experimentos repetidos para mejorar la reproducibilidad.
El modelo entrenado se evaluó en el conjunto de prueba independiente utilizando exactitud, precisión, exhaustividad, especificidad, puntuación F1, coeficiente de correlación de Matthews (MCC), área bajo la curva característica de operación del receptor (AUC-ROC) y precisión promedio (AP). El modelo propuesto se comparó con los modelos de referencia predefinidos utilizando procedimientos idénticos de preprocesamiento, particiones de datos y protocolos de evaluación. Se generaron curvas características de operación del receptor (ROC), curvas de precisión-exhaustividad y una matriz de confusión a partir de las predicciones del conjunto de prueba independiente.
Se realizó una validación cruzada de cinco pliegues en los datos de entrenamiento para evaluar la estabilidad del rendimiento. Se estimaron intervalos de confianza del 95 % para las métricas principales de rendimiento, y se llevaron a cabo comparaciones estadísticas predefinidas entre el modelo propuesto y los modelos de referencia.
La validación cruzada de cinco pliegues produjo una precisión del 93,01 ± 0,48 %, un AUC-ROC de 0,954 ± 0,007, una exactitud del 92,42 ± 0,87 %, una recuperación del 93,02 ± 0,45 % y una puntuación F1 del 92,72 ± 0,62 %. Los intervalos de confianza bootstrap del 95 % estimados a partir de 1.000 remuestras fueron de 0,897–0,973 para la precisión, de 0,890–0,970 para la exactitud, de 0,880–0,963 para la recuperación, de 0,887–0,965 para la puntuación F1 y de 0,931–0,984 para el AUC-ROC. Las comparaciones estadísticas con los modelos básicos CNN, bosque aleatorio y SVM se realizaron utilizando la prueba de McNemar para la precisión, la prueba de DeLong para el AUC-ROC y pruebas bootstrap pareadas con 1.000 remuestras para la puntuación F1.
El procedimiento completo de entrenamiento y evaluación se repitió en 10 ejecuciones independientes utilizando diferentes semillas aleatorias. Las ejecuciones repetidas arrojaron un AUC-ROC de 0,957 ± 0,008, una exactitud de 93,24 ± 0,74 % y una puntuación F1 de 92,35 ± 0,92 %, lo que indica una variabilidad relativamente baja entre ejecuciones repetidas. Las métricas de rendimiento obtenidas en las ejecuciones repetidas se resumieron utilizando la media y la desviación estándar. Se examinó la variabilidad entre ejecuciones para determinar si el rendimiento predictivo permaneció estable bajo ejecuciones repetidas.
No se realizó una validación externa en el ejemplo práctico presentado porque no se utilizó ningún conjunto de datos externo e independiente. Por consiguiente, todos los resultados predictivos, estadísticos y de reproducibilidad informados se obtuvieron a partir del Conjunto de Datos sobre Diabetes en Indios Pima utilizando las particiones predefinidas de entrenamiento, validación y prueba independiente. La validación externa se incluyó en el protocolo como un procedimiento opcional para aplicaciones en las que se disponga de un conjunto de datos independiente procedente de una institución, población, región geográfica o período temporal diferente.
Las explicaciones del modelo se generaron utilizando técnicas de interpretabilidad aplicables al conjunto de datos tabulares sobre diabetes en indígenas Pima, incluyendo SHAP y LIME. Se evaluó la importancia global de las características y se generaron explicaciones locales específicas para cada paciente utilizando muestras de prueba reservadas. Las salidas de las explicaciones se registraron junto con las predicciones correspondientes del modelo y los valores de las características para facilitar la reproducibilidad y la interpretación posterior.
Por claridad, el presente ejemplo práctico incluyó las nueve etapas fundamentales del flujo de trabajo identificadas en la Tabla 1. La validación externa y la evaluación por expertos clínicos se mantuvieron como módulos opcionales de validación del protocolo general. No se realizó validación externa porque no se utilizó ningún conjunto de datos externo independiente, y no se llevó a cabo evaluación por expertos clínicos porque en el presente ejemplo práctico no se incluyó un panel formal de evaluación por expertos. Por consiguiente, estos módulos opcionales no se consideran parte del flujo de trabajo experimental de nueve etapas y no se informan como resultados experimentales.
Los procedimientos de preprocesamiento y partición del conjunto de datos generaron un conjunto de datos estandarizado adecuado para el desarrollo del modelo. Se eliminaron registros duplicados e inconsistentes, se gestionaron los valores faltantes según la estrategia predefinida, se estandarizaron las características numéricas y se dividió el conjunto de datos en subconjuntos independientes de entrenamiento, validación y prueba. Las características del conjunto de datos resultante y los procedimientos de preprocesamiento se resumen en Tabla 2. El flujo de trabajo general para la preparación y el preprocesamiento del conjunto de datos de atención sanitaria se ilustra en Figura 2, mientras que el flujo de trabajo experimental de preparación, preprocesamiento, partición y evaluación de la calidad aplicado específicamente al Conjunto de Datos de Diabetes de los Indios Pima se muestra en Figura 3. El entorno computacional final, la arquitectura del modelo y la configuración de hiperparámetros utilizados para generar los resultados reportados se resumen en Tabla 3.
La ejecución de las secciones 3 y 4 produjo un conjunto de datos sanitarios estandarizado adecuado para el desarrollo del modelo. Los procedimientos de preprocesamiento eliminaron registros duplicados e inconsistentes, imputaron valores ausentes, estandarizaron las características numéricas, codificaron las variables categóricas cuando correspondía y dividieron el conjunto de datos en subconjuntos de entrenamiento, validación y prueba. Los datos resultantes proporcionaron la entrada estandarizada necesaria para el desarrollo posterior del modelo.
Tras completar las secciones 5 y 6, el modelo configurado demostró una convergencia estable durante el entrenamiento. Las curvas de aprendizaje mostraron disminuciones simultáneas en las pérdidas de entrenamiento y validación, así como aumentos en la precisión de entrenamiento y validación. La optimización de hiperparámetros mejoró la generalización del modelo, sin evidencia de sobreajuste sustancial. Para favorecer la reproducibilidad, el modelo optimizado se archivó junto con la arquitectura finalizada, los ajustes de hiperparámetros, las versiones del software, las semillas aleatorias y los pesos del modelo entrenado. Las especificaciones del entrenamiento del modelo y los resultados de la optimización se resumen en Tabla 4, y las curvas de aprendizaje correspondientes de entrenamiento y validación se presentan en Figura 4.
La sección 7 evaluó el rendimiento predictivo del modelo utilizando métricas de desempeño estandarizadas. Las métricas de clasificación evaluadas incluyeron exactitud, precisión, recuperación, especificidad, puntuación F1, MCC, AUC-ROC y AP. El modelo propuesto se comparó con los modelos de referencia predefinidos utilizando las mismas particiones del conjunto de datos, procedimientos de preprocesamiento y protocolo de evaluación. La comparación del rendimiento predictivo se presenta en Tabla 5, mientras que las curvas ROC, las curvas de precisión-recuperación, la matriz de confusión y las métricas comparativas de desempeño se muestran en Figura 5.
Tras la Sección 8, se generaron explicaciones globales y locales de las predicciones del modelo para evaluar su interpretabilidad. Las explicaciones del modelo se generaron mediante SHAP y LIME para el conjunto de datos tabulares de Diabetes en Pima Indians, y se produjo una explicación contrafactual específica del paciente para ilustrar un cambio en la predicción. SHAP se utilizó para generar la importancia global de las características, visualizaciones de cascada específicas del paciente y dependencia de características, mientras que LIME se utilizó para generar explicaciones locales a partir de muestras de prueba reservadas. Las salidas correspondientes de explicabilidad se presentan en Figura 6.
La etapa final del protocolo evaluó la fiabilidad estadística y la reproducibilidad del flujo de trabajo. Se repitió el flujo de trabajo completo en 10 ejecuciones independientes utilizando diferentes semillas aleatorias, manteniendo constante la estrategia de particionamiento del conjunto de datos, los parámetros de preprocesamiento, la arquitectura del modelo, los hiperparámetros, el entorno de software y los procedimientos de evaluación. Las ejecuciones repetidas arrojaron un AUC-ROC de 0,957 ± 0,008, una exactitud de 93,24 ± 0,74 % y una puntuación F1 de 92,35 ± 0,92 %, lo que indica una variabilidad relativamente baja entre las ejecuciones repetidas.
La estabilidad de las explicaciones no se evaluó cuantitativamente en la validación realizada en este trabajo. Aunque se generaron explicaciones mediante SHAP y LIME para el conjunto de datos de Diabetes en Indios Pima, no se realizó ningún análisis independiente de correlación de rangos entre ejecuciones ni de superposición de características. Por lo tanto, no se presentan métricas numéricas sobre explicaciones, estabilidad ni acuerdo en la atribución. La evaluación cuantitativa de la estabilidad de las explicaciones se mantiene en el protocolo general como un procedimiento opcional de reproducibilidad para aplicaciones en las que se dispone de salidas de explicación repetidas.
Las comparaciones estadísticas se evaluaron utilizando un umbral de significancia predefinido de p < 0,05. Se utilizaron pruebas estadísticas bilaterales cuando fue aplicable, y se informaron las estadísticas de prueba correspondientes, los valores p y los intervalos de confianza del 95 % para cuantificar la significancia estadística e incertidumbre de las diferencias de rendimiento observadas. Los resultados experimentales de validación estadística y reproducibilidad, incluido el rendimiento de la validación cruzada, los intervalos de confianza, las comparaciones estadísticas y la variabilidad en ejecuciones repetidas, se resumen en Tabla 6. Los análisis correspondientes de pruebas estadísticas y reproducibilidad se ilustran en Figura 7.
Estos resultados proporcionaron evidencia experimental de estabilidad predictiva y reproducibilidad bajo las condiciones computacionales y el conjunto de datos evaluados. Se documentaron el entorno computacional, las características del conjunto de datos, los procedimientos de preprocesamiento, la configuración del modelo, los análisis estadísticos y los ajustes de explicabilidad necesarios para la replicación independiente, de acuerdo con la lista de verificación de reproducibilidad presentada en la Tabla 7. No se realizó la evaluación por expertos clínicos de las salidas de XAI generadas en el ejemplo de validación desarrollado en el presente trabajo.
En general, la aplicación del protocolo produjo un conjunto de datos estandarizado de atención médica adecuado para el desarrollo de modelos de inteligencia artificial y un modelo optimizado utilizando configuraciones predeterminadas de hiperparámetros. El flujo de trabajo permitió la evaluación sistemática del rendimiento predictivo, la generación de explicaciones del modelo mediante técnicas aplicables de XAI y la evaluación estadística de la solidez y reproducibilidad del modelo. En conjunto, los resultados demostraron la implementación y reproducibilidad del flujo de trabajo de XAI propuesto bajo las condiciones experimentales evaluadas en el ejemplo de validación desarrollado.

Figura 1: Flujo de trabajo central de nueve etapas para desarrollar modelos de IA reproducibles y explicables en el ámbito sanitario. El flujo de trabajo comprende (1) definición de la tarea de predicción en el ámbito sanitario, (2) configuración del entorno computacional, (3) obtención y validación del conjunto de datos, (4) preprocesamiento de los datos, (5) partición del conjunto de datos, (6) entrenamiento del modelo predictivo, (7) evaluación del rendimiento predictivo, (8) análisis de explicabilidad y (9) validación estadística y evaluación de la reproductibilidad. La validación externa y la evaluación por expertos clínicos se consideran extensiones opcionales del protocolo y no están incluidas en el flujo de trabajo central de nueve etapas. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 2: Flujo de trabajo para la preparación y preprocesamiento de conjuntos de datos de atención médica. (A) Adquisición de datos de atención médica a partir de registros clínicos, imágenes médicas, señales fisiológicas y fuentes de datos multimodales. (B) Integración y preprocesamiento de datos, incluyendo el manejo de valores faltantes, normalización, eliminación de ruido y aumento de datos. (C) Partición del conjunto de datos en subconjuntos de entrenamiento, validación y prueba. (D) Evaluación de la calidad que muestra la distribución de clases, la normalización de características y los resultados del preprocesamiento antes del desarrollo del modelo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Flujo de trabajo experimental para la preparación, preprocesamiento, partición y evaluación de la calidad del Conjunto de Datos de Diabetes en Indios Pima. El flujo de trabajo incluye la obtención del conjunto de datos, la evaluación de la calidad de los datos, el manejo de valores inválidos y faltantes, la estandarización de características numéricas, la partición del conjunto de datos en subconjuntos de entrenamiento, validación y prueba independiente, y la verificación final de la calidad antes del desarrollo del modelo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Curvas de aprendizaje experimental de entrenamiento y validación del modelo propuesto utilizando el conjunto de datos de Diabetes en Indios Pima. (A) Pérdida de entrenamiento y validación a lo largo del período completo de entrenamiento. (B) Precisión de entrenamiento y validación a lo largo del período completo de entrenamiento. (C) Vista ampliada de la pérdida durante las épocas 50–100. (D) Vista ampliada de la precisión durante las épocas 50–100. El mejor rendimiento de validación se obtuvo en la época 78, con una pérdida de validación de 0,142 y una precisión de validación del 94,6 %. Se activó la detención temprana en la época 88 utilizando una paciencia de 10 épocas. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Evaluación del rendimiento predictivo experimental del marco XAI propuesto utilizando el conjunto de prueba independiente (n = 154). (A) Curva característica de operación del receptor (ROC) que muestra el rendimiento de discriminación del modelo XAI propuesto y los modelos de referencia. (B) Curvas de precisión–recuperación (PR) que muestran el rendimiento de precisión y recuperación del modelo XAI propuesto y los modelos de referencia. (C) Matriz de confusión del modelo XAI propuesto en el conjunto de prueba independiente, con la exactitud, sensibilidad (recuperación) y especificidad correspondientes. (D) Comparación de exactitud, precisión, recuperación, especificidad, puntuación F1, coeficiente de correlación de Matthews (MCC), área bajo la curva ROC (AUC) y precisión promedio (AP) entre los modelos evaluados. Todos los resultados cuantitativos mostrados en esta figura corresponden al experimento de validación en el Conjunto de Datos de Diabetes de los Indios Pima. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Resultados de explicabilidad generados a partir de predicciones independientes en el conjunto de prueba del modelo propuesto, entrenado con el conjunto de datos de Diabetes en Indios Pima. (A) Gráfico resumen global de SHAP que muestra la distribución de las contribuciones de las características en todo el conjunto de prueba. (B) Gráfico de importancia de características de SHAP basado en los valores absolutos medios de SHAP. (C) Gráfico de cascada de SHAP específico para un paciente que muestra las contribuciones de cada característica individual a la probabilidad predicha de diabetes. (D) Explicación local LIME que muestra las contribuciones de las características para el Paciente de Prueba n.º 125. (E) Gráfico de dependencia de SHAP que muestra la relación entre los valores de glucosa y sus contribuciones SHAP. (F) Explicación contrafactual específica para un paciente que muestra los cambios mínimos en las características asociados a un cambio en la predicción del modelo. Abreviaturas: SHAP = Explicaciones Aditivas de Shapley; LIME = Explicaciones Locales, Interpretables y Agnósticas respecto al Modelo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Validación estadística experimental y análisis de reproducibilidad del modelo propuesto utilizando el Conjunto de Datos de Diabetes de los Indios Pima. (A) Rendimiento de la validación cruzada de cinco particiones en el conjunto de entrenamiento. (B) Intervalos de confianza bootstrap del 95 % para el rendimiento en el conjunto de prueba independiente. (C) Comparaciones estadísticas con modelos de referencia, incluyendo la prueba estadística, el estadístico de prueba, el valor p y la significancia. (D) Consistencia del rendimiento en 10 ejecuciones independientes utilizando diferentes semillas aleatorias. Se utilizó la prueba de McNemar para la precisión de clasificación emparejada, la prueba de DeLong para el área bajo la curva ROC (ROC-AUC) correlacionada y pruebas bootstrap emparejadas con 1.000 remuestras para la comparación del puntaje F1. Haga clic aquí para ver una versión más grande de esta figura.
| Etapa | Actividad del protocolo | Resultado esperado | Estado de implementación |
| 1 | Seleccionar y validar el conjunto de datos de atención médica | Conjunto de datos verificado, objetivo de predicción, distribución de clases e información sobre la calidad de los datos | Realizado |
| 2 | Configurar el entorno computacional | Hardware, software, bibliotecas, versiones y configuración computacional verificados | Realizado |
| 3 | Preprocesar y controlar la calidad de los datos de atención médica | Conjunto de datos limpio, transformado y estandarizado | Realizado |
| 4 | Dividir el conjunto de datos | Conjuntos de datos independientes de entrenamiento, validación y prueba | Realizado |
| 5 | Desarrollar y optimizar el modelo predictivo y de IA explicativa (XAI) | Arquitectura final del modelo y sus hiperparámetros | Realizado |
| 6 | Entrenar y conservar el modelo | Modelo entrenado, punto de control (checkpoint), configuración de entrenamiento y registros | Realizado |
| 7 | Evaluar el rendimiento predictivo y computacional | Métricas de rendimiento en el conjunto de prueba y comparaciones de rendimiento | Realizado |
| 8 | Generar y evaluar las salidas de explicabilidad | Salidas explicativas mediante SHAP/LIME y otros métodos aplicables | Realizado |
| 9 | Realizar la validación estadística y la evaluación de la reproducibilidad | Intervalos de confianza, pruebas estadísticas, resultados de ejecuciones repetidas y medidas de reproducibilidad | Realizado |
Tabla 1: Resumen del flujo de trabajo del protocolo central de nueve etapas aplicado en la validación desarrollada utilizando el Conjunto de Datos de Diabetes en Indios Pima. La tabla distingue las nueve etapas implementadas en el ejemplo práctico del Conjunto de Datos de Diabetes en Indios Pima de la validación externa y la evaluación por expertos clínicos, que se mantienen como componentes opcionales del protocolo general.
| Conjunto de datos | Fuente de datos | Aplicación clínica | Modalidad de datos | Sujetos/registros | Muestras | Clases | Distribución de clases | Entrenamiento/Validación/Prueba | Papel en el presente estudio | Estado de validación | URL de origen |
| Conjunto de datos de diabetes de Pima Indians | Repositorio de Aprendizaje Automático UCI | Predicción de diabetes | Tabular clínico | 768 registros | 768 | 2 | 500 no diabéticos; 268 diabéticos | 60% / 20% / 20% | Conjunto de datos principal para validación experimental | Realizada – flujo de trabajo central completo de nueve etapas | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), proyecto TCGA-BRCA | Clasificación del cáncer de mama | Clínico + histopatología | 1.098 casos | Dependiente del conjunto de datos según el tipo de datos | Dependiente del punto final | No existe una única distribución de clases a nivel del conjunto de datos | No aplicable – no se realizó división experimental | Solo como ejemplo de aplicabilidad del protocolo | No utilizado para validación experimental | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), proyecto TCGA-UCEC | Clasificación del cáncer de endometrio | Clínico + histopatología | Cohorte del proyecto; tamaño depende del tipo de datos y filtros seleccionados | Dependiente del conjunto de datos según el tipo de datos | Dependiente del punto final | No existe una única distribución de clases a nivel del conjunto de datos | No aplicable – no se realizó división experimental | Solo como ejemplo de aplicabilidad del protocolo | No utilizado para validación experimental | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, Base de datos clínica MIMIC-III v1.4 | Predicción de resultados clínicos | Serie temporal clínica | 46.520 pacientes | 58.976 ingresos en UCI | Dependiente de la tarea | No existe una única distribución de clases a nivel de la base de datos | No aplicable – no se realizó división experimental | Solo como ejemplo de aplicabilidad del protocolo | No utilizado para validación experimental | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | Desafío de la Colaboración Internacional de Imágenes Cutáneas (ISIC) | Clasificación de lesiones cutáneas | Imágenes dermatoscópicas | No aplicable – conjunto de datos de imágenes | 25.331 imágenes de entrenamiento | 8 categorías de entrenamiento | AKIEC 867; BCC 3.323; BKL 2.624; DF 239; MEL 4.522; NV 12.875; VASC 253; SCC 628 | No aplicable – no se realizó división experimental | Solo como ejemplo de aplicabilidad del protocolo | No utilizado para validación experimental | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | Harvard Dataverse / Archivo ISIC | Clasificación de lesiones cutáneas | Imágenes dermatoscópicas | 7.470 lesiones únicas | 10.015 imágenes | 7 | AKIEC 327; BCC 514; BKL 1.099; DF 115; MEL 1.113; NV 6.705; VASC 142 | No aplicable – no se realizó división experimental | Solo como ejemplo de aplicabilidad del protocolo | No utilizado para validación experimental | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | Conjunto de datos OhioT1DM, distribuido públicamente para investigación | Monitoreo/predicción de diabetes | Serie temporal clínica | 12 participantes | 24 archivos XML entre los datos de entrenamiento/desarrollo y prueba | Predicción de glucosa continua; no es una tarea de clasificación fija | No aplicable | Archivos definidos por el conjunto de datos para entrenamiento/desarrollo y prueba; no se realizó división experimental aquí | Solo como ejemplo de aplicabilidad del protocolo | No utilizado para validación experimental | https://pmc.ncbi.nlm.nih.gov/articles/PMC7881904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/Universidad de Pensilvania | Segmentación/clasificación de tumores cerebrales | IRM | 2.040 casos en la cohorte del desafío | 1.251 casos de entrenamiento anotados; cuatro modalidades de IRM por caso | Dependiente de la tarea | No existe una única distribución de clases a nivel del conjunto de datos | Cohortes definidas por el desafío; no se realizó división experimental aquí | Solo como ejemplo de aplicabilidad del protocolo | No utilizado para validación experimental | https://www.med.upenn.edu/cbica/brats2021/ |
Tabla 2: Características del conjunto de datos de atención médica y aplicabilidad del protocolo propuesto. La tabla resume las fuentes de datos, aplicaciones clínicas, modalidades, características de las muestras, distribuciones de clases, estrategias de particionamiento de los conjuntos de datos, estado de validación e información de origen para los conjuntos de datos de atención médica considerados en el protocolo. El conjunto de datos de Pima Indians Diabetes sirve como ejemplo principal desarrollado para la validación del protocolo.
| Elemento de configuración | Configuración real utilizada y validada | Estado / Interpretación |
| Conjunto de datos | Conjunto de datos de diabetes de los indígenas Pima | Conjunto de datos experimentales validado |
| Algoritmo / Modelo | Modelo predictivo tabular para clasificación binaria de diabetes | Utilice el nombre exacto de la arquitectura del experimento si se documentó por separado |
| Tasa de aprendizaje | 0.001 | Configuración experimental |
| Optimizador | Adam | Configuración experimental |
| Tamaño del lote | 32 | Configuración experimental |
| Épocas máximas | 100 | Configuración experimental |
| Función de pérdida | Cross-Entropy | Configuración experimental |
| Función de activación | ReLU | Configuración experimental |
| Dropout | 0.5 | Configuración experimental |
| Decaimiento del peso | 1e-4 | Configuración experimental |
| Normalización del lote | Habilitada | Configuración experimental |
| Aumento de datos / Equilibrio de clases | Habilitado | Especifique SMOTE solo si se aplicó realmente en la ejecución reportada |
| Estrategia de validación | Validación cruzada de 5 particiones | Configuración experimental |
| Detención temprana | Paciencia = 10 épocas | Configuración experimental |
| Semilla aleatoria | 42 | Utilice la configuración exacta de semilla registrada para el experimento |
| Ejecuciones repetidas | 10 ejecuciones independientes usando diferentes semillas aleatorias | Análisis experimental de reproducibilidad |
| Tamaño de la imagen de entrada | No aplicable | El conjunto de datos Pima es tabular |
| Dimensión de características | 512 | Utilice solo si esta es la representación final implementada de las características |
| Explicabilidad | SHAP + LIME; explicación contrafactual mostrada en la Figura 6 | Análisis real de XAI reportado |
| Métricas de evaluación | Precisión, exactitud, recuperación, especificidad, puntuación F1, MCC, AUC-ROC, AP | Métricas experimentales de evaluación reportadas |
| Hardware | GPU NVIDIA | Sustituya por el modelo exacto de GPU si se registró |
| Software / Framework | Python 3.11; Scikit-learn; componentes del framework utilizados por la implementación | Utilice versiones exactas de los paquetes si se registraron |
Tabla 3: Entorno computacional, arquitectura del modelo y configuración de hiperparámetros utilizados para la implementación del protocolo. La tabla especifica la plataforma computacional, el entorno de software, la arquitectura del modelo, la configuración de entrada, los parámetros de optimización, los ajustes de regularización y los parámetros de reproducibilidad empleados para implementar el flujo de trabajo de XAI propuesto.
| Parámetro | Especificación / resultado representativo |
| Optimizador | Adam |
| Tasa de aprendizaje | 0.001 |
| Tamaño del lote | 32 |
| Épocas máximas | 100 |
| Paciencia para detención temprana | 10 épocas |
| Mejor época | 78 |
| Época de detención temprana | 88 |
| Mejor pérdida en validación | 0.142 |
| Mejor precisión en validación | 94.6% |
| Resultado del entrenamiento | La pérdida de entrenamiento y validación disminuyó y convergió |
| Resultado de validación | La precisión de entrenamiento y validación aumentó y se estabilizó |
| Resultado de la optimización | Se logró el mejor desempeño del modelo en la época 78 |
| Control de sobreajuste | La detención temprana evitó una optimización adicional más allá de la mejor época seleccionada |
Tabla 4: Especificaciones del entrenamiento del modelo y resultados de la optimización. La tabla resume el optimizador, la tasa de aprendizaje, el tamaño del lote, el número máximo de épocas de entrenamiento, el rendimiento en la validación, la convergencia del entrenamiento, el resultado de la optimización y la estrategia de control del sobreajuste utilizados durante el desarrollo del modelo.
| Modelo | Precisión (%) | Exactitud (%) | Sensibilidad (%) | Especificidad (%) | Puntuación F1 (%) | MCC | AUC (ROC) | AP (PR) |
| Modelo XAI propuesto | 93,5 | 94,5 | 92,4 | 94,6 | 93,4 | 0,87 | 0,96 | 0,94 |
| Aprendizaje profundo (CNN) | 89,1 | 89,8 | 88,1 | 90 | 88,9 | 0,78 | 0,92 | 0,9 |
| Bosque aleatorio | 84,3 | 85 | 83,2 | 85,7 | 84,1 | 0,67 | 0,86 | 0,81 |
| Máquina de vectores de soporte (SVM) | 78,6 | 79,3 | 77,1 | 80 | 78,2 | 0,54 | 0,79 | 0,72 |
| Línea base (clase mayoritaria) | 62,1 | 62,1 | 100 | 0 | 76,6 | 0 | 0,5 | 0,5 |
Tabla 5: Comparación del rendimiento predictivo de los modelos evaluados. La tabla compara el modelo XAI propuesto con los modelos básicos evaluados utilizando precisión, exactitud, recuperación, especificidad, puntuación F1, coeficiente de correlación de Matthews, área bajo la curva ROC y precisión promedio.
| Análisis de validación | Comparación / Métrica | Prueba estadística | Estadístico de prueba | p-valor | Resultado experimental / IC 95% |
| Validación cruzada de cinco pliegues | Precisión | Descriptiva (media ± DE) | — | — | 93,01 ± 0,48% |
| Validación cruzada de cinco pliegues | AUC-ROC | Descriptiva (media ± DE) | — | — | 0,954 ± 0,007 |
| Validación cruzada de cinco pliegues | Precisión | Descriptiva (media ± DE) | — | — | 92,42 ± 0,87% |
| Validación cruzada de cinco pliegues | Sensibilidad | Descriptiva (media ± DE) | — | — | 93,02 ± 0,45% |
| Validación cruzada de cinco pliegues | Puntaje F1 | Descriptiva (media ± DE) | — | — | 92,72 ± 0,62% |
| Intervalo de confianza bootstrap al 95% | Precisión | Bootstrap (1.000 remuestras) | — | — | 0,935 [0,897, 0,973] |
| Intervalo de confianza bootstrap al 95% | Precisión | Bootstrap (1.000 remuestras) | — | — | 0,930 [0,890, 0,970] |
| Intervalo de confianza bootstrap al 95% | Sensibilidad | Bootstrap (1.000 remuestras) | — | — | 0,922 [0,880, 0,963] |
| Intervalo de confianza bootstrap al 95% | Puntaje F1 | Bootstrap (1.000 remuestras) | — | — | 0,926 [0,887, 0,965] |
| Intervalo de confianza bootstrap al 95% | AUC-ROC | Bootstrap (1.000 remuestras) | — | — | 0,958 [0,931, 0,984] |
| Modelo propuesto frente a CNN | Precisión (%) | Prueba de McNemar | 9,32 | 0,0023 | Significativo (α = 0,05) |
| Modelo propuesto frente a CNN | AUC-ROC | Prueba de DeLong | 3,87 | 0,0001 | Significativo (α = 0,05) |
| Modelo propuesto frente a CNN | Puntaje F1 | Bootstrap pareado (1.000 remuestras) | 2,81 | 0,0044 | Significativo (α = 0,05) |
| Modelo propuesto frente a Bosque Aleatorio | Precisión (%) | Prueba de McNemar | 14,27 | 0,0002 | Significativo (α = 0,05) |
| Modelo propuesto frente a Bosque Aleatorio | AUC-ROC | Prueba de DeLong | 5,86 | <0,0001 | Significativo (α = 0,05) |
| Modelo propuesto frente a Bosque Aleatorio | Puntaje F1 | Bootstrap pareado (1.000 remuestras) | 4,03 | 0,0003 | Significativo (α = 0,05) |
| Modelo propuesto frente a SVM | Precisión (%) | Prueba de McNemar | 16,08 | <0,0001 | Significativo (α = 0,05) |
| Modelo propuesto frente a SVM | AUC-ROC | Prueba de DeLong | 6,95 | <0,0001 | Significativo (α = 0,05) |
| Modelo propuesto frente a SVM | Puntaje F1 | Bootstrap pareado (1.000 remuestras) | 4,62 | <0,0001 | Significativo (α = 0,05) |
| Reproducibilidad en ejecuciones repetidas (10 ejecuciones independientes) | AUC-ROC | Descriptiva (media ± DE) | — | — | 0,957 ± 0,008 |
| Reproducibilidad en ejecuciones repetidas (10 ejecuciones independientes) | Precisión (%) | Descriptiva (media ± DE) | — | — | 93,24 ± 0,74% |
| Reproducibilidad en ejecuciones repetidas (10 ejecuciones independientes) | Puntaje F1 (%) | Descriptiva (media ± DE) | — | — | 92,35 ± 0,92% |
Tabla 6: Resultados de validación estadística y reproducibilidad obtenidos a partir de la implementación experimental utilizando el conjunto de datos de Diabetes en Indios Pima. La tabla resume el rendimiento de la validación cruzada de cinco pliegues, los intervalos de confianza del 95 % basados en bootstrap, las comparaciones estadísticas del modelo propuesto con los modelos de referencia y la reproducibilidad en ejecuciones repetidas a lo largo de 10 semillas aleatorias independientes. No se realizó validación externa ni evaluación por expertos clínicos en la presente validación desarrollada.
| No. | Elemento de la lista de verificación | Documentación requerida | Grabación o verificación recomendada |
| 1 | Entorno de software | Sistema operativo, lenguaje de programación y entorno de software | Registrar las versiones exactas del sistema operativo y del lenguaje de programación. |
| 2 | Versiones de software y bibliotecas | Versiones de bibliotecas y paquetes de software principales | Registrar los nombres y versiones exactos de los paquetes y bibliotecas. |
| 3 | Especificaciones de hardware | Especificaciones de CPU, GPU, RAM, almacenamiento y aceleradores | Registrar el hardware computacional utilizado. |
| 4 | Identificación del conjunto de datos | Nombre, fuente, versión e información de acceso del conjunto de datos | Registrar la fuente y versión exactas del conjunto de datos y la fecha de acceso cuando sea aplicable. |
| 5 | Características del conjunto de datos | Tamaño de la muestra y distribución de clases | Registrar el número total de muestras y la distribución de clases para cada división. |
| 6 | Particionamiento del conjunto de datos | Estrategia de conjuntos de entrenamiento, validación y prueba independiente | Documentar las proporciones o cantidades de las divisiones y la estratificación. |
| 7 | Prevención de fugas de datos | Procedimiento utilizado para prevenir fugas de información | Documentar la separación de sujetos/muestras y la estimación de parámetros de preprocesamiento solo con datos de entrenamiento. |
| 8 | Parámetros de preprocesamiento | Configuraciones de limpieza, manejo de valores faltantes, normalización, codificación y transformaciones | Registrar todas las operaciones de preprocesamiento y los valores de los parámetros. |
| 9 | Aumento de datos | Métodos y configuraciones de parámetros de aumento, cuando sea aplicable | Documentar los métodos, probabilidades y rangos de parámetros. |
| 10 | Arquitectura del modelo | Arquitectura y configuración finales del modelo | Documentar el tipo de modelo, capas/componentes, dimensiones y funciones de activación. |
| 11 | Hiperparámetros | Hiperparámetros de entrenamiento y optimización | Registrar la tasa de aprendizaje, tamaño del lote, optimizador, épocas, detención temprana y parámetros ajustados. |
| 12 | Semillas aleatorias | Semillas aleatorias utilizadas para ejecución reproducible | Registrar las semillas para la división, inicialización y ejecuciones repetidas. |
| 13 | Configuración del entrenamiento | Procedimiento de entrenamiento y estrategia de selección del modelo | Documentar la validación, puntos de control y criterios de selección del modelo. |
| 14 | Métricas de evaluación | Métricas predictivas y estadísticas predefinidas para evaluación | Registrar todas las medidas de rendimiento reportadas. |
| 15 | Intervalos de confianza | Intervalos de incertidumbre para las medidas de rendimiento | Documentar el procedimiento de estimación de intervalos de confianza y remuestras bootstrap cuando sea aplicable. |
| 16 | Pruebas estadísticas | Procedimientos estadísticos para comparación de modelos | Documentar la prueba, el estadístico, el valor p, el umbral de significancia y los supuestos. |
| 17 | Análisis de ejecuciones repetidas | Ejecuciones independientes utilizando diferentes semillas aleatorias | Registrar el número de ejecuciones y la media ± DE de las métricas clave. |
| 18 | Configuración de explicabilidad | Métodos y configuraciones de parámetros de explicabilidad | Documentar SHAP, LIME, Grad-CAM, atención, contrafácticos o configuraciones aplicables. |
| 19 | Evaluación de explicabilidad | Evaluación objetiva de la fiabilidad y utilidad de las explicaciones | Documentar fidelidad, estabilidad, infidelidad, localización y evaluación por expertos cuando sea aplicable. |
| 20 | Artefactos del modelo | Pesos del modelo entrenado y archivos de configuración | Archivar el modelo entrenado final, la arquitectura/configuración y la información de selección. |
| 21 | Disponibilidad del código | Código necesario para preprocesamiento, entrenamiento, evaluación y generación de explicaciones | Registrar la información del repositorio o acceso controlado al código, cuando sea aplicable. |
| 22 | Documentación de ejecución | Comandos, scripts, archivos de configuración e instrucciones | Registrar los comandos y configuraciones necesarios para reproducir el flujo de trabajo. |
| 23 | Documentación de resultados | Predicciones, resultados de evaluación, figuras y salidas de explicaciones | Archivar las salidas generadas y vincularlas al experimento/ejecución correspondiente. |
| 24 | Verificación de reproducibilidad | Verificación de la consistencia entre ejecuciones independientes | Comparar los resultados de ejecuciones repetidas y reportar medidas de variabilidad predefinidas. |
Tabla 7: Lista de verificación de reproducibilidad para la replicación independiente del flujo de trabajo de XAI propuesto. La lista de verificación especifica los requisitos computacionales, de conjunto de datos, preprocesamiento, desarrollo del modelo, evaluación, validación estadística, explicabilidad y documentación necesarios para reproducir el flujo de trabajo experimental.