Todos los conjuntos de datos utilizados en este estudio se obtuvieron de repositorios públicos y totalmente anonimizados, incluyendo el Repositorio de Aprendizaje Automático UCI, la base de datos PhysioNet MIMIC-III y los conjuntos de datos de rayos X de tórax del NIH. No se accedió a información identificable del paciente. El estudio cumplió con las directrices éticas institucionales de investigación para el análisis secundario de datos desidentificados disponibles públicamente. No se requirió la aprobación formal de la Junta de Revisión Institucional porque no se reclutaron directamente participantes humanos ni se utilizó información sanitaria protegida.
1. Visión general de los marcos experimentales
- Desarrollar una cadena de inteligencia artificial (XAI) reproducible y explicable para una analítica sanitaria transparente. Organiza el flujo de trabajo en la capa de datos, capa de preprocesamiento, capa de modelado, capa de explicabilidad, capa de evaluación y capa de visualización.
- Integrar estos módulos en un flujo de trabajo unificado capaz de procesar datos clínicos estructurados, historiales electrónicos de salud y conjuntos de datos de imágenes médicas.
- Asegurarse de que cada módulo contribuya a la reproducibilidad, interpretabilidad, escalabilidad y ejecución experimental estandarizada.
- Diseña la arquitectura modular para soportar el flujo continuo de datos y asegurar que cada etapa de la tubería contribuya a la reproducibilidad, interpretabilidad y escalabilidad a lo largo del flujo de trabajo experimental.
2. Entorno computacional y configuración del sistema
- Instala las dependencias de software necesarias antes de ejecutar el flujo de trabajo abriendo un terminal de línea de comandos y ejecutando el siguiente comando:
pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
- Verifica la instalación exitosa de todos los paquetes de software y confirma la compatibilidad con las versiones de software listadas en la Tabla de Materiales antes de proceder con el preprocesamiento de datos y el desarrollo del modelo.
- Usa Python 3.11 como entorno de programación principal. Instala y configura NumPy 1.26 y Pandas 2.1 para tareas de manipulación de datos e ingeniería de características. Instala Scikit-learn 1.5 para el desarrollo y evaluación de modelos de aprendizaje automático.
- Instala TensorFlow 2.15 para el entrenamiento y la inferencia de modelos de aprendizaje profundo. Instala SHAP 0.46 y LIME 0.2.0 para análisis de explicabilidad. Instala OpenCV 4.10 para tareas de procesamiento de imágenes. Instala Matplotlib 3.9 y Seaborn 0.13 para visualización de datos e informes de resultados. Consulte la Tabla de Materiales para las especificaciones completas del software y los detalles de implementación necesarios para la reproducibilidad.
- Configura el entorno computacional utilizando una estación de trabajo equipada con un procesador multinúcleo, aceleración de la unidad de procesamiento gráfico (GPU) y recursos de memoria suficientes para acomodar grandes conjuntos de datos sanitarios y cargas de trabajo de aprendizaje profundo.
- Establece semillas aleatorias fijas para la partición de datos, la inicialización del modelo y los procedimientos de entrenamiento para asegurar la reproducibilidad en las ejecuciones experimentales. Habilitar mecanismos de registro para registrar operaciones de preprocesamiento de datos, configuraciones de modelos, ajustes de hiperparámetros, procedimientos de entrenamiento y resultados de evaluación a lo largo del flujo de trabajo.
- Configura las arquitecturas de modelos, parámetros de optimización, tasas de aprendizaje, tamaños de lote, ajustes de entrenamiento y valores de hiperparámetros según las especificaciones resumidas en la Tabla 1. Cumple con estos ajustes durante los experimentos de replicación para garantizar la coherencia con los resultados reportados.
- Salida esperada: un entorno computacional totalmente configurado y reproducible con todos los paquetes de software necesarios, recursos de hardware, mecanismos de registro y configuraciones de modelos disponibles para el preprocesamiento de datos posteriores, desarrollo de modelos, análisis de explicabilidad y procedimientos de evaluación.
| Componente | Parámetro | Valor | Descripción |
| Bosque Aleatorio | n_estimators | 100 | Número de árboles |
| Bosque Aleatorio | max_depth | Ninguno | Profundidad del árbol |
| XGBoost | learning_rate | 0.01 | Tasa de aprendizaje |
| XGBoost | n_estimators | 100 | Cartuchos de refuerzo |
| CNN | Épocas | 25 | Épocas de entrenamiento |
| CNN | batch_size | 32 | Tamaño del lote |
| CNN | Optimizador | Adam | Algoritmo de optimización |
| MLP | hidden_layers | 2 | Número de capas ocultas |
| MLP | Activación | ReLU | Función de activación |
| General | train_split | 70% | Ratio de datos de entrenamiento |
| General | validation_split | 15% | Razón de validación |
| General | test_split | 15% | Ratio de pruebas |
Tabla 1: Detalles de implementación y configuración de hiperparámetros.
Esta tabla resume el entorno computacional, las bibliotecas de software, las configuraciones de modelos de aprendizaje automático y aprendizaje profundo, los ajustes de optimización, las tasas de aprendizaje, los tamaños de lote, los parámetros de entrenamiento y los valores de hiperparámetros utilizados a lo largo de la evaluación experimental del marco de IA explicable propuesto.
3. Preparación y preprocesamiento de conjuntos de datos
- Seleccionar conjuntos de datos sanitarios disponibles públicamente para garantizar la transparencia y reproducibilidad del flujo de trabajo experimental.;
- Utilizar cuatro escenarios representativos de atención sanitaria para validar el marco propuesto: (i) diagnóstico de cáncer de mama utilizando el Wisconsin Breast Cancer Dataset, (ii) predicción del riesgo de diabetes usando el Pima Indians Diabetes Dataset, (iii) predicción de resultados clínicos usando historiales electrónicos de salud MIMIC-III, y (iv) clasificación de la enfermedad torácica usando el NIH Chest X-ray Dataset. Elige estos conjuntos de datos para evaluar el marco a través de historiales clínicos estructurados, historiales electrónicos longitudinales y modalidades de imagen médica comúnmente utilizadas en sistemas de apoyo a la toma de decisiones sanitarias.
- Importa cada conjunto de datos al entorno Python y separa los registros en características de entrada y variables de destino. Organizar datos clínicos estructurados para tareas de predicción de enfermedades, historiales electrónicos de salud para análisis longitudinales de resultados y conjuntos de datos de imágenes médicas para tareas de clasificación diagnóstica. Verifica la integridad de cada conjunto de datos antes de proceder con las operaciones de preprocesamiento.
- Identificar y corregir los valores ausentes utilizando técnicas de imputación adecuadas. Estandarizar las características numéricas mediante procedimientos de escalado y normalización de características para garantizar la comparabilidad entre variables.
- Codificar variables categóricas utilizando métodos de codificación adecuados basados en las características del conjunto de datos. Realizar la selección de características utilizando análisis de correlación y medidas de importancia de características basadas en modelos para identificar las variables más relevantes y reducir la dimensionalidad de los datos.
- Redimensiona todas las imágenes médicas a 224, 224 píxeles antes del entrenamiento del modelo. Normalizar los valores de intensidad de píxeles según los requisitos de la arquitectura de aprendizaje profundo seleccionada. Aplicar técnicas de aumento de datos, incluyendo rotación de imágenes y volteo horizontal, para mejorar la generalización del modelo y reducir el sobreajuste. Verifica la calidad de la imagen y asegura la consistencia de las dimensiones de la imagen en todo el conjunto de datos.
- Evalúa la integridad de los datos evaluando la completitud del conjunto de datos, la consistencia y la alineación de las etiquetas de características. Verifica que todos los registros estén correctamente asignados a sus respectivas clases objetivo. Revisa las características del conjunto de datos, incluyendo el tamaño de la muestra, el recuento de características y la modalidad de los datos, tal como se resume en la Tabla 2.
- Implementar procedimientos de validación específicos de cada conjunto de datos para garantizar el rigor metodológico y la reproducibilidad. Registrar el tamaño de la muestra, la distribución de clases, la estrategia de división tren-validación-prueba, las medidas de prevención de fugas, los procedimientos de optimización de hiperparámetros, el diseño de validación cruzada y el protocolo de pruebas externo para cada conjunto de datos. Resume estos procedimientos de validación en la Tabla 3.
- Realizar controles de calidad de preprocesamiento evaluando el manejo de valores faltantes, eliminación de valores atípicos, escalado de características, codificación categórica, preservación de distribución de clases y procedimientos de partición de conjuntos de datos. Verifica que las operaciones de preprocesamiento se apliquen de forma consistente en todos los conjuntos de datos.
- Confirma la ausencia de una fuga sustancial de datos durante la partición de conjuntos de datos. Revise los resultados de la validación de preprocesamiento presentados en la Figura 1 para asegurar que se han generado conjuntos de datos estandarizados para análisis posteriores de aprendizaje automático y explicabilidad.
- Salida esperada: Generar conjuntos de datos limpios y estandarizados con valores faltantes correctamente direccionados, variables categóricas codificadas, características numéricas normalizadas y registros particionados en subconjuntos de entrenamiento, validación y prueba. Asegúrese de que las características del conjunto de datos, distribuciones de clases y procedimientos de validación correspondan a los reportados en las Tablas 2 y 3, y confirme la validación exitosa del preprocesamiento como se ilustra en la Figura 1.
| Conjunto de datos | Tipo | Muestras | Características | Objetivo |
| Cáncer de mama | Tabular | 569 | 30 | Benigno/Maligno |
| Diabetes | Tabular | 768 | 8 | Consecuencias de la diabetes |
| MIMIC-III | EHR | ~60.000 | Variables clínicas | Mortalidad |
| Radiografía de tórax | Imagen | ~112.000 | Imágenes | Etiquetas de enfermedades |
Tabla 2: Características del conjunto de datos y casos de uso en la atención sanitaria.
Esta tabla ofrece un resumen de los conjuntos de datos sanitarios utilizados en el estudio, incluyendo el tipo de conjunto, número de muestras, recuento de características, variables objetivo, dominio de aplicación sanitaria y casos de uso clínicos asociados. Los conjuntos de datos abarcan historias clínicas estructuradas, historiales electrónicos de salud y datos de imagen médica para demostrar la aplicabilidad del marco en diversos escenarios analíticos sanitarios.
| Conjunto de datos | Tamaño de la muestra | Distribución de clases | Estrategia dividida | Prevención de fugas | Búsqueda por hiperparámetros | Validación cruzada | Prueba externa |
| Cáncer de mama (UCI Wisconsin) | 569 | 357 benigno / 212 maligno | 70/15/15 | Preprocesamiento solo para trenes | Búsqueda en cuadrícula | CV estratificada de 5 órdenes | Set Independiente de Resistencia |
| Diabetes de los indios Pima | 768 | 500 No diabéticos / 268 Diabéticos | 70/15/15 | Preprocesamiento solo para trenes | Búsqueda en cuadrícula | CV estratificada de 5 órdenes | Set Independiente de Resistencia |
| MIMIC-III EHR | 5274 | Cohortes estratificadas por resultados | 70/15/15 Nivel de paciente | Separación a nivel de paciente | Búsqueda aleatoria | CV a nivel de paciente de 5 víbores | Set Independiente de Resistencia |
| Radiografía de tórax del NIH | 112120 | Neumonía/Normal estratificado | 70/15/15 | Separación a nivel de imagen | Búsqueda aleatoria | CV estratificada de 5 órdenes | Set Independiente de Resistencia |
Tabla 3: Validación a nivel de conjunto de datos y diseño experimental.
Esta tabla resume la metodología de validación empleada para cada conjunto de datos, incluyendo el tamaño de la muestra, la distribución de clases, la estrategia de división tren-validación-prueba, procedimientos de prevención de fugas, métodos de optimización de hiperparámetros, diseño de validación cruzada y protocolos de prueba externos. Estas medidas se implementaron para garantizar el rigor metodológico, la reproducibilidad y la evaluación imparcial del modelo.

Figura 1: Validación de la cadena de preprocesamiento de datos.
Resultados de validación para operaciones clave de preprocesamiento realizadas antes del desarrollo del modelo. (A) Análisis de valor perdido en características representativas de la salud. (B) Distribución de una variable numérica antes y después del manejo de valores atípicos. (C) Validación de escalado de características mediante estandarización. (D) Validación de codificación categórica. (E) Distribución de clases tras el preprocesamiento. (F) Validación de la partición de datos de entrenamiento-validación-prueba. Estos resultados confirman el preprocesamiento y la preparación exitosos de los conjuntos de datos para modelado predictivo y análisis de explicabilidad. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
4. Arquitectura del sistema del Marco de IA Explicable
- Organizar el marco utilizando una arquitectura en capas para facilitar el procesamiento modular, mejorar la transparencia del flujo de trabajo y apoyar la implementación reproducible. Configura la Capa de Datos para recibir y gestionar conjuntos de datos sanitarios en bruto. Enruta todos los conjuntos de datos entrantes a través de la Capa de Datos antes de iniciar operaciones de preprocesamiento.
- Realizar procedimientos de limpieza, transformación, normalización, ingeniería de características y codificación de datos dentro de la Capa de Preprocesamiento. Asegúrate de que todas las operaciones de preprocesamiento se completen antes del desarrollo del modelo.
- Desarrollar modelos predictivos dentro de la Capa de Modelado utilizando algoritmos de aprendizaje automático y aprendizaje profundo. Modelos de Train Gradient Boosting, Random Forest, Multilayer Perceptrón (MLP) y Redes Neuronales Convolucionales (CNN) utilizando conjuntos de datos preprocesados y configuraciones optimizadas de hiperparámetros.
- Aplicar técnicas de explicabilidad dentro de la Capa de Explicabilidad para interpretar las predicciones del modelo. Generar explicaciones de atribución de características usando SHAP y LIME para conjuntos de datos estructurados. Genera mapas de calor Grad-CAM para modelos basados en imágenes para visualizar regiones que contribuyen a las predicciones del modelo.
- Evalúa el rendimiento predictivo y explicativo dentro de la Capa de Evaluación. Calcular precisión, precisión, recuerdo, puntuación F1, ROC-AUC, fidelidad, estabilidad y métricas de evaluación centrada en el clínico. Registrar todos los resultados de la evaluación para su análisis y presentación posteriores.
- Genera resultados visuales clínicamente interpretables dentro de la Capa de Visualización. Crea gráficos de comparación de rendimiento, visualizaciones de importancia de características, gráficos resumen SHAP, explicaciones LIME, mapas de calor Grad-CAM y paneles de informes orientados al clínico. Almacena todos los resultados visuales para incluirlos en el informe experimental final.
- Revisa la arquitectura completa del framework ilustrada en la Figura 2 antes de proceder con la ejecución del flujo de trabajo.
- Salida esperada: Generar modelos de aprendizaje automático y aprendizaje profundo totalmente entrenados, incluyendo Gradient Boosting, Random Forest, CNN y MLP. Almacena configuraciones de modelos, hiperparámetros optimizados, registros de entrenamiento, archivos de puntos de control, salidas de explicabilidad y artefactos de visualización para su posterior evaluación e interpretabilidad.

Figura 2: Arquitectura del Sistema del Marco de IA Explicable para la Analítica en Salud. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
5. Ejecución de flujos de trabajo
- Adquiere conjuntos de datos sanitarios de repositorios públicos y almacena los conjuntos en formatos estructurados adecuados para aprendizaje automático y análisis de aprendizaje profundo. Revise el flujo de trabajo completo ilustrado en la Figura 3 antes de iniciar el procedimiento experimental.
- Realizar limpieza y preprocesamiento de datos según los procedimientos descritos en la Sección 3. Normaliza las variables numéricas utilizando métodos de escalado apropiados. Codificar variables categóricas utilizando técnicas de codificación adecuadas. Identificar e imputar valores faltantes utilizando estrategias de imputación específicas de cada conjunto de datos. Verifica la calidad de los datos, la alineación de las etiquetas de características y la completitud del conjunto de datos antes de continuar con el desarrollo del modelo.
- Particiona cada conjunto de datos en subconjuntos de entrenamiento, validación y prueba para apoyar la evaluación imparcial del modelo. Preservar las distribuciones de clases durante la partición de conjuntos de datos e implementar medidas de prevención de fugas cuando sea aplicable. Reserva el subconjunto de pruebas exclusivamente para la evaluación final del modelo.
- Entrenar modelos de aprendizaje automático en conjuntos de datos estructurados usando algoritmos basados en conjuntos, incluyendo Gradient Boosting y Random Forest. Entrenar modelos de aprendizaje profundo en conjuntos de datos de imágenes utilizando arquitecturas de Redes Neuronales Convolucionales (CNN) capaces de aprender características espaciales de la imagen. Actualizar los parámetros del modelo de forma iterativa durante el entrenamiento y monitorizar el rendimiento de validación tras cada época de entrenamiento. Aplicar la parada anticipada cuando el rendimiento de validación se deteriore o no mejore según los criterios de parada predefinidos.
- Optimizar los hiperparámetros del modelo utilizando estrategias de búsqueda sistemática, incluyendo búsqueda en cuadrícula y búsqueda aleatoria. Ajusta la tasa de aprendizaje, número de estimadores, profundidad del árbol, tamaño del lote, número de épocas y otros parámetros específicos del modelo según el rendimiento de validación. Selecciona el modelo final en función del rendimiento predictivo y la capacidad de generalización entre conjuntos de datos de validación.
- Aplica métodos de explicabilidad tras completar el entrenamiento con modelos. Generar explicaciones globales utilizando técnicas de atribución de características para identificar las variables que contribuyen más fuertemente a las predicciones del modelo. Generar explicaciones locales para analizar casos de predicción individuales y evaluar el comportamiento del modelo a nivel muestral. Crea mapas de calor Grad-CAM para modelos de clasificación de imágenes que resalten las regiones de la imagen que contribuyen al resultado previsto. Almacena todas las explicaciones para análisis e informes posteriores.
- Evalúa el rendimiento predictivo utilizando precisión, precisión, recall, puntuación F1 y área característica de operación del receptor bajo la curva (ROC-AUC). Evalúa la calidad de la explicación utilizando métricas de fidelidad y estabilidad para evaluar la fiabilidad y consistencia de la explicación. Comparar el rendimiento de los modelos entre conjuntos de datos y métodos de explicabilidad para evaluar la robustez y generalizabilidad del marco.
- Generar resultados de visualización e informes analíticos para comunicar los resultados de manera clínicamente interpretable. Crea gráficos comparativos de rendimiento, gráficos de importancia de características, visualizaciones resumen SHAP, resultados de explicación LIME, mapas de calor Grad-CAM y otras visualizaciones clínicamente relevantes. Revisa todos los resultados visuales para asegurar claridad y consistencia antes de informar.
- Documentar todas las operaciones de preprocesamiento, configuraciones de modelos, ajustes de hiperparámetros, procedimientos de explicabilidad, estrategias de validación y resultados de evaluación. Mantener registros experimentales detallados para facilitar la reproducibilidad y la replicación independiente del flujo de trabajo. Verifica la consistencia de los resultados a través de repetidas ejecuciones experimentales y archiva todos los artefactos del flujo de trabajo para referencia futura.
- Salida esperada: Generar un modelo predictivo completamente entrenado con hiperparámetros optimizados, pesos guardados del modelo, registros de entrenamiento, métricas de rendimiento y resultados explicables, incluyendo explicaciones SHAP, explicaciones LIME y mapas de calor Grad-CAM. Almacena todos los artefactos del modelo, informes de evaluación y resultados de visualización para su posterior análisis y evaluación de reproducibilidad.

Figura 3: Flujo de trabajo de extremo a extremo de la cadena de IA explicable. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
6. Evaluación del modelo y evaluación de la explicabilidad
- Evaluar el rendimiento predictivo del modelo utilizando métricas estándar de clasificación, incluyendo precisión, precisión, recuerdo, puntuación F1 y área característica de operación del receptor bajo la curva (ROC-AUC). Calcular la precisión para medir la corrección general de la clasificación.
- Calcular la precisión para evaluar la proporción de predicciones positivas correctamente identificadas. Calcula la memoria para evaluar la capacidad del modelo para identificar casos positivos. Calcula la puntuación F1 para equilibrar precisión y recuerdo. Calcular ROC-AUC para evaluar el desempeño discriminatorio a través de diferentes umbrales de clasificación.
- Aplicar estas métricas de evaluación de forma consistente en todos los conjuntos de datos y arquitecturas de modelos para facilitar la comparación objetiva del rendimiento. Registrar todos los valores de las métricas y almacenar los resultados de la evaluación para su posterior análisis estadístico e informes.
- Evalúa el rendimiento de la explicabilidad usando métricas de fidelidad y estabilidad. Calcular la fidelidad para determinar hasta qué punto las explicaciones generadas reflejan con precisión las predicciones del modelo y el comportamiento de toma de decisiones.
- Calcula la estabilidad comparando explicaciones generadas a partir de muestras de entrada similares y cuantificando la consistencia de los resultados de las explicaciones. Verifica que los valores de fidelidad y estabilidad cumplan con los criterios de calidad predefinidos antes de interpretar las explicaciones del modelo.
- Compara el rendimiento de la explicabilidad entre salidas SHAP, CAL y Grad-CAM.
- Resultados esperados: generar resultados cuantitativos de evaluación, incluyendo precisión, precisión, recuerdo, puntuación F1, ROC-AUC, métricas de fidelidad y estabilidad. Producir resultados explicables y visualizaciones adecuadas para informes científicos, evaluación de reproducibilidad e interpretación clínica.
7. Evaluación centrada en el ser humano
- Recluta 12 profesionales sanitarios, compuestos por 6 médicos, 3 radiólogos y 3 analistas de datos clínicos. Selecciona participantes con experiencia previa en toma de decisiones clínicas, interpretación de imágenes médicas, análisis sanitarios o revisión de historiales electrónicos de salud. Obtén el consentimiento informado de todos los participantes antes de iniciar el procedimiento de evaluación.
- Seleccionar aleatoriamente 100 casos de los conjuntos de datos de pruebas tras completar el entrenamiento del modelo y el análisis de explicabilidad. Genera dos condiciones de evaluación para cada caso:
- Salida solo de predicción y
- predicción acompañada de información explicable. Aleatoriza el orden de presentación de los casos y las condiciones de evaluación para minimizar el sesgo de presentación y los efectos del aprendizaje.
- Preparar formularios de evaluación estandarizados que contengan resultados de predicción, resultados explicativos y cuestionarios de evaluación. Presenta los casos individualmente a los participantes mediante una interfaz de evaluación basada en ordenador.
- Instruye a los participantes a revisar cada caso de forma independiente sin discutir las respuestas con otros evaluadores. Permitir que los participantes completen todas las evaluaciones bajo condiciones experimentales idénticas.
- Administrar un cuestionario de cinco puntos a escala Likert adaptado de estudios de evaluación de inteligencia artificial explicables publicados. Instruye a los participantes para que evalúen la confianza, la interpretabilidad y la usabilidad para cada caso revisado. Registra las respuestas electrónicamente al cuestionario y verifica la finalización de todos los ítems de la encuesta antes de proceder al análisis estadístico.
- Mide indicadores objetivos de utilidad clínica durante el proceso de evaluación. Registrar el acuerdo de decisión comparando las decisiones de los participantes con las etiquetas de referencia correspondientes o resultados de la verdad del terreno. Calcular el acuerdo de decisión como el porcentaje de decisiones de los participantes que coinciden con el resultado de referencia.
- Registra el tiempo de revisión de cada caso midiendo el intervalo entre la presentación del caso y la presentación de la respuesta final. Calcular el tiempo medio de revisión por separado para condiciones de solo predicción y predicción con explicación.
- Calcula las puntuaciones medias de confianza, interpretabilidad y usabilidad entre todos los participantes y casos de evaluación. Comparar las puntuaciones obtenidas bajo condiciones de solo predicción y predicción con explicación.
- Realizar pruebas t pareadas tras completar todas las evaluaciones de los participantes para determinar si las diferencias en confianza, interpretabilidad, usabilidad, acuerdo de decisión y tiempo de revisión son estadísticamente significativas. Utiliza un umbral de significación de p 0,05 para todas las comparaciones estadísticas.
- Calcula Fleiss Kappa tras recopilar respuestas de todos los participantes para evaluar el acuerdo entre evaluadores. Utiliza las valoraciones agregadas de los participantes para determinar la consistencia de las evaluaciones entre revisores. Interpreta los valores de Fleiss Kappa según las directrices establecidas del acuerdo y registra las estadísticas resultantes del acuerdo.
- Resume la demografía de los participantes, la metodología de evaluación, el diseño de cuestionarios, los procedimientos de análisis estadístico, las medidas de desempeño objetivo y los resultados de acuerdos entre evaluadores en la Tabla 4.
- Revisa los resultados del modelo bajo ambas condiciones de evaluación y compara las respuestas de los participantes entre condiciones. Verifica que las explicaciones mejoren la confianza, la interpretabilidad y la usabilidad sin afectar negativamente la calidad de la decisión.
- Confirmar la consistencia de las evaluaciones de los participantes utilizando la estadística calculada de Fleiss Kappa. Registrar todos los resultados de la evaluación para informes posteriores y evaluaciones de reproducibilidad.
- Salida esperada: Generar puntuaciones de confianza de los clínicos, valoraciones de interpretabilidad, valoraciones de usabilidad, medidas de decisión y acuerdo, estadísticas de tiempo de revisión, resultados de pruebas t pareadas y estadísticas de acuerdo entre evaluadores. Producir evidencia cuantitativa que describa la utilidad clínica, la interpretabilidad y la fiabilidad del marco explicable de inteligencia artificial.
| Parámetro | Valor |
| Expertos | 12 |
| Médicos | 6 |
| Radiólogos | 3 |
| Analistas de Datos Clínicos | 3 |
| Casos revisados | 100 |
| Diseño de evaluación | Aleatorizados (Solo predicción vs Predicción+Explicación) |
| Instrumento de Topografía | Escala de Likert de 5 puntos |
| Evaluación del fideicomiso | Interpretabilidad, Confianza, Usabilidad |
| Prueba estadística | Prueba t emparejada (p 0,05) |
| Fiabilidad entre evaluadores | Fleiss Kappa |
| Medidas Objetivo | Acuerdo de Decisión, Tiempo de Revisión |
Tabla 4: Protocolo de evaluación centrada en el ser humano y diseño de evaluación por parte del clínico.
Esta tabla presenta el marco de evaluación del clínico utilizado para evaluar la interpretabilidad, fiabilidad y usabilidad del sistema de IA explicable. Se resume la información sobre la demografía de los participantes, la metodología de revisión de casos, el diseño de la encuesta, los procedimientos de análisis estadístico, la evaluación de fiabilidad entre evaluadores y las medidas de evaluación objetiva.
8. Validación y evaluación de reproducibilidad
- Realizar estudios de validación y ablación para evaluar la robustez y fiabilidad del marco propuesto. Identificar características con puntuaciones de alta importancia utilizando los métodos de explicabilidad seleccionados. Eliminar características importantes de forma incremental y reentrenar los modelos predictivos tras cada paso de eliminación de características.
- Evalúa el rendimiento del modelo tras cada experimento de ablación utilizando precisión, precisión, recuerdo, puntuación F1 y métricas ROC-AUC. Compara los valores de rendimiento resultantes con el rendimiento de referencia del modelo para determinar la contribución de características individuales a los resultados predictivos.
- Evalúa la estabilidad de las explicaciones generando explicaciones para muestras de entrada similares usando SHAP, CAL y Grad-CAM. Compara los resultados de las explicaciones entre evaluaciones repetidas y cuantifica la consistencia usando las métricas de estabilidad predefinidas. Verifica que las explicaciones se mantengan estables bajo pequeñas variaciones de entrada y repetidas pruebas experimentales.
- Registra todos los procedimientos experimentales a lo largo del flujo de trabajo. Operaciones de preprocesamiento de datos documentales, procedimientos de partición de conjuntos de datos, arquitecturas de modelos, ajustes de hiperparámetros, configuraciones de entrenamiento, métodos de explicabilidad, estrategias de validación y métricas de evaluación. Almacena todos los parámetros de configuración y salidas experimentales en un formato estructurado para facilitar la reproducibilidad y la verificación independiente.
- Revisa todos los registros experimentales para asegurar la completitud y la coherencia. Verifica que el flujo de trabajo pueda replicarse utilizando los procedimientos documentados, archivos de configuración y especificaciones de software. Mantener una estructura de flujo de trabajo modular para facilitar la adaptación del protocolo para futuros estudios y apoyar la conversión a un protocolo experimental basado en vídeo, conforme a los requisitos metodológicos de JoVE.
9. Recursos de Reproducibilidad
- Ejecutar todos los experimentos usando semillas aleatorias fijas para asegurar resultados reproducibles a lo largo de las ejecuciones repetidas. Mantener el código fuente, los scripts de preprocesamiento, los archivos de configuración, las especificaciones del entorno, los parámetros del modelo y los scripts de visualización dentro de un repositorio de acceso público.
- Proporcionar instrucciones detalladas para la adquisición de conjuntos de datos, preprocesamiento, ejecución de experimentos, entrenamiento de modelos, generación de explicabilidades, procedimientos de validación y regeneración de todas las tablas y figuras reportadas. Archivar todos los componentes del flujo de trabajo necesarios para la replicación independiente, incluyendo especificaciones de software, flujos de preprocesamiento, archivos de configuración, instrucciones de acceso al conjunto de datos, puntos de control de modelos y activos de visualización.
- Resume los recursos de software, los flujos de preprocesamiento, los archivos de configuración, las instrucciones de acceso al conjunto de datos y los activos de reproducibilidad utilizados a lo largo del marco en la Tabla 5.
- Salida esperada: Generar un paquete experimental reproducible completo que contenga scripts de preprocesamiento, archivos de configuración, modelos entrenados, puntos de control de modelos, salidas de explicabilidad, informes de validación, artefactos de visualización, especificaciones de software y documentación necesaria para la replicación y verificación independiente del marco propuesto.
| Recurso | Descripción |
| Código fuente | Scripts de implementación en Python para preprocesamiento de datos, entrenamiento de modelos, explicabilidad y evaluación |
| Archivo de Entorno | requirements.txt que contiene dependencias y versiones de paquetes |
| Archivos de configuración | Configuración de arquitectura de modelos, hiperparámetros y configuraciones de experimentos |
| Semillas aleatorias fijas | Semilla = 42 usados para experimentos reproducibles |
| Instrucciones de acceso al conjunto de datos | Enlaces y procedimientos para adquirir conjuntos de datos de salud pública |
| Preprocesamiento de scripts | Scripts para limpieza de datos, normalización, codificación y selección de características |
| Scripts de generación de figuras | Escrituras para regenerar todas las figuras manuscritas |
| Scripts de generación de tablas | Scripts para reproducir tablas y métricas reportadas |
| Ejemplos de entradas | Conjuntos de datos de ejemplo y archivos de entrada |
| Ejemplos de salidas | Resultados de predicción, explicaciones e informes de evaluación |
Tabla 5: Recursos de reproducibilidad y activos experimentales.
Esta tabla resume los recursos proporcionados para soportar la reproducibilidad experimental, incluyendo código fuente, scripts de preprocesamiento, archivos de configuración, especificaciones del entorno, instrucciones de acceso al conjunto de datos, configuraciones de semilla aleatoria fijas, scripts de generación de figuras y archivos de entrada/salida de ejemplo necesarios para reproducir los resultados reportados.