Artículo de investigación

Un protocolo reproducible para desarrollar y evaluar marcos explicables de inteligencia artificial en la analítica sanitaria

DOI:

10.3791/71999

31 de julio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aquí presentamos un protocolo reproducible para desarrollar y evaluar modelos explicables de inteligencia artificial para la analítica sanitaria. El flujo de trabajo integra preprocesamiento de datos, modelado predictivo, explicabilidad basada en SHAP, LIME y Grad-CAM, evaluación cuantitativa y validación centrada en el ser humano para apoyar una toma de decisiones clínicas transparente y fiable.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La Inteligencia Artificial Explicable (XAI) es cada vez más reconocida como una herramienta indispensable para construir sistemas de IA fiables en el sector sanitario, donde la transparencia y la capacidad de explicar decisiones son componentes esenciales de la toma de decisiones clínicas. Esta publicación presenta un enfoque experimental reproducible para desarrollar y evaluar sistemas de IA explicables para la analítica sanitaria. La cadena desarrollada integra los pasos de preprocesamiento de datos, modelado predictivo, generación de interpretaciones y evaluación en un único flujo de trabajo fluido que puede aplicarse tanto a datos clínicos estructurados como a conjuntos de datos de imagen médica. Los modelos de aprendizaje automático en conjunto han demostrado un fuerte rendimiento predictivo en conjuntos de datos tabulares estructurados, mientras que los modelos de aprendizaje profundo son eficaces para aprender patrones complejos en datos de imagen médica. Técnicas como SHAP, LIME y Grad-CAM son explicaciones globales y locales que facilitan la interpretación de modelos. Muy útil. La evaluación cuantitativa del marco abarca muchas métricas diferentes como precisión, precisión, recuerdo, puntuación F1, ROC-AUC, métricas de explicación, fidelidad y estabilidad. Los resultados indican que, cuando se controlan las condiciones experimentales, el marco demostró una mejora en el rendimiento predictivo y la calidad de la explicación bajo las condiciones experimentales evaluadas. Como documento guiado por protocolo, este trabajo respalda la reproducibilidad y escalabilidad, la implementación persistente por otros seres vivos. Este modelo de IA transparente y comprensible es la base sobre la que el apoyo a la toma de decisiones clínicas y los sistemas de análisis sanitario ganan confianza y uso a gran escala.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La inteligencia artificial (IA) se ha convertido en un componente importante de la sanidad moderna al apoyar el diagnóstico de enfermedades, el pronóstico, la estratificación de riesgos, el análisis de imágenes médicas y la toma de decisionesclínicas. Los avances en aprendizaje automático y aprendizaje profundo han permitido a los sistemas sanitarios procesar grandes volúmenes de datos estructurados y no estructurados, logrando a menudo un rendimiento predictivo comparable o superior a los enfoques estadísticosconvencionales 2. A pesar de estos avances, muchos modelos de IA funcionan como sistemas complejos de caja negra, lo que dificulta que los clínicos y los actores sanitarios comprendan cómo se generan laspredicciones 3. Esta falta de transparencia puede limitar la confianza, la adopción y la rendición de cuentas en entornos sanitarios de alto riesgo 4,5.

La inteligencia artificial explicable (XAI) ha surgido como un enfoque prometedor para mejorar la transparencia y la interpretabilidad de los modelos de aprendizajeautomático 6. Las técnicas de explicación ampliamente utilizadas, incluyendo SHAP (explicaciones aditivas de Shapley), LIME (explicaciones locales interpretables agnósticas al modelo) y mapeo de activación de clases ponderado por gradiente (Grad-CAM), proporcionan información sobre el comportamiento del modelo mediante atribución de características y mecanismos de explicaciónvisual 7,8,9. Estos métodos se han aplicado cada vez más a aplicaciones sanitarias para apoyar la interpretación clínica, la auditoría de modelos y el soporte a la tomade decisiones 10,11. Sin embargo, la explicabilidad por sí sola no garantiza fiabilidad, reproducibilidad ni utilidad clínica. Estudios recientes han destacado desafíos relacionados con la inestabilidad de la explicación, la sensibilidad a las perturbaciones, la validación limitada por parte del clínico y las inconsistencias entre los resultados de las explicaciones y el razonamiento verdadero del modelo 12,13,14,15.

Además de los desafíos de explicabilidad, la reproducibilidad sigue siendo una preocupación importante en la investigación en aprendizaje automático en salud 16,17,18. Muchos estudios publicados proporcionan información limitada sobre procedimientos de preprocesamiento, entornos de software, configuraciones de hiperparámetros, estrategias de validación y flujos de trabajo de implementación, lo que dificulta la replicación independiente 19,20,21. Además, los estudios sobre IA sanitaria se centran frecuentemente en el rendimiento predictivo, proporcionando una orientación limitada sobre la evaluación de la calidad de la explicación, la evaluación centrada en el clínico y consideraciones prácticasde implementación 22. Estas limitaciones pueden dificultar la traducción de sistemas de IA explicables desde entornos de investigación a entornos sanitariosreales 23,24,25,26,27.

Los flujos de trabajo actuales en XAI en la sanidad suelen evaluar técnicas de explicación individual o modelos predictivos de forma aislada y rara vez proporcionan protocolos estandarizados que integren la preparación de datos, modelado predictivo, evaluación de la explicabilidad, evaluación centrada en el ser humano y recursos dereproducibilidad 28,29,30,31 . En consecuencia, investigadores y profesionales pueden encontrar dificultades al reproducir flujos de trabajo, comparar métodos de explicación o evaluar la utilidad práctica de sistemas de IA explicables en diferentes conjuntos de datos y dominios de aplicación sanitarios. Por tanto, se necesita un protocolo integral y reproducible para facilitar la implementación, evaluación y reporte consistente de flujos de trabajo explicables de IA sanitaria 32,33,34,35.

Aquí presentamos un protocolo reproducible para desarrollar, evaluar e interpretar sistemas de inteligencia artificial explicables en la analítica sanitaria. El protocolo integra preprocesamiento de datos, modelado predictivo, evaluación de la explicabilidad usando SHAP, LIME y Grad-CAM, evaluación centrada en el clínico, procedimientos de validación y recursos de reproducibilidad dentro de un flujo de trabajo unificado. El objetivo es proporcionar un marco estandarizado que apoye el desarrollo transparente de modelos, la evaluación de la calidad de la explicación y la implementación reproducible a través de diversos conjuntos de datossanitarios 36, 37, 38, 39. La contribución metodológica de este trabajo radica en la integración de análisis predictivo, evaluación de explicabilidad, validación de clínicos y prácticas de reproducibilidad en un único protocolo adecuado para la investigación, educación y estudios orientados al despliegue en IAsanitaria 40,41,42,43.

La contribución principal de este trabajo no es el desarrollo de un algoritmo novedoso de explicabilidad.

Más bien, proporciona un protocolo estandarizado, reproducible y validado experimentalmente que integra modelado predictivo, evaluación de explicabilidad, visualización, evaluación e interpretación centrada en el ser humano en un flujo de trabajo unificado adecuado para la analítica sanitaria y la difusión de protocolos basados en JoVE. El objetivo principal de este trabajo no es introducir un algoritmo predictivo novedoso, sino proporcionar un protocolo estandarizado, reproducible y validado experimentalmente para implementar flujos de trabajo de inteligencia artificial explicables en la analítica sanitaria. El protocolo integra el preprocesamiento de datos, modelado predictivo, evaluación de la explicabilidad, evaluación centrada en el clínico y recursos de reproducibilidad en un marco unificado adecuado para su adopción, replicación y difusión educativa.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos los conjuntos de datos utilizados en este estudio se obtuvieron de repositorios públicos y totalmente anonimizados, incluyendo el Repositorio de Aprendizaje Automático UCI, la base de datos PhysioNet MIMIC-III y los conjuntos de datos de rayos X de tórax del NIH. No se accedió a información identificable del paciente. El estudio cumplió con las directrices éticas institucionales de investigación para el análisis secundario de datos desidentificados disponibles públicamente. No se requirió la aprobación formal de la Junta de Revisión Institucional porque no se reclutaron directamente participantes humanos ni se utilizó información sanitaria protegida.

1. Visión general de los marcos experimentales

  1. Desarrollar una cadena de inteligencia artificial (XAI) reproducible y explicable para una analítica sanitaria transparente. Organiza el flujo de trabajo en la capa de datos, capa de preprocesamiento, capa de modelado, capa de explicabilidad, capa de evaluación y capa de visualización.
  2. Integrar estos módulos en un flujo de trabajo unificado capaz de procesar datos clínicos estructurados, historiales electrónicos de salud y conjuntos de datos de imágenes médicas.
  3. Asegurarse de que cada módulo contribuya a la reproducibilidad, interpretabilidad, escalabilidad y ejecución experimental estandarizada.
  4. Diseña la arquitectura modular para soportar el flujo continuo de datos y asegurar que cada etapa de la tubería contribuya a la reproducibilidad, interpretabilidad y escalabilidad a lo largo del flujo de trabajo experimental.

2. Entorno computacional y configuración del sistema

  1. Instala las dependencias de software necesarias antes de ejecutar el flujo de trabajo abriendo un terminal de línea de comandos y ejecutando el siguiente comando:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Verifica la instalación exitosa de todos los paquetes de software y confirma la compatibilidad con las versiones de software listadas en la Tabla de Materiales antes de proceder con el preprocesamiento de datos y el desarrollo del modelo.
  3. Usa Python 3.11 como entorno de programación principal. Instala y configura NumPy 1.26 y Pandas 2.1 para tareas de manipulación de datos e ingeniería de características. Instala Scikit-learn 1.5 para el desarrollo y evaluación de modelos de aprendizaje automático.
  4. Instala TensorFlow 2.15 para el entrenamiento y la inferencia de modelos de aprendizaje profundo. Instala SHAP 0.46 y LIME 0.2.0 para análisis de explicabilidad. Instala OpenCV 4.10 para tareas de procesamiento de imágenes. Instala Matplotlib 3.9 y Seaborn 0.13 para visualización de datos e informes de resultados. Consulte la Tabla de Materiales para las especificaciones completas del software y los detalles de implementación necesarios para la reproducibilidad.
  5. Configura el entorno computacional utilizando una estación de trabajo equipada con un procesador multinúcleo, aceleración de la unidad de procesamiento gráfico (GPU) y recursos de memoria suficientes para acomodar grandes conjuntos de datos sanitarios y cargas de trabajo de aprendizaje profundo.
  6. Establece semillas aleatorias fijas para la partición de datos, la inicialización del modelo y los procedimientos de entrenamiento para asegurar la reproducibilidad en las ejecuciones experimentales. Habilitar mecanismos de registro para registrar operaciones de preprocesamiento de datos, configuraciones de modelos, ajustes de hiperparámetros, procedimientos de entrenamiento y resultados de evaluación a lo largo del flujo de trabajo.
  7. Configura las arquitecturas de modelos, parámetros de optimización, tasas de aprendizaje, tamaños de lote, ajustes de entrenamiento y valores de hiperparámetros según las especificaciones resumidas en la Tabla 1. Cumple con estos ajustes durante los experimentos de replicación para garantizar la coherencia con los resultados reportados.
  8. Salida esperada: un entorno computacional totalmente configurado y reproducible con todos los paquetes de software necesarios, recursos de hardware, mecanismos de registro y configuraciones de modelos disponibles para el preprocesamiento de datos posteriores, desarrollo de modelos, análisis de explicabilidad y procedimientos de evaluación.
ComponenteParámetroValorDescripción
Bosque Aleatorion_estimators100Número de árboles
Bosque Aleatoriomax_depthNingunoProfundidad del árbol
XGBoostlearning_rate0.01Tasa de aprendizaje
XGBoostn_estimators100Cartuchos de refuerzo
CNNÉpocas25Épocas de entrenamiento
CNNbatch_size32Tamaño del lote
CNNOptimizadorAdamAlgoritmo de optimización
MLPhidden_layers2Número de capas ocultas
MLPActivaciónReLUFunción de activación
Generaltrain_split70%Ratio de datos de entrenamiento
Generalvalidation_split15%Razón de validación
Generaltest_split15%Ratio de pruebas

Tabla 1: Detalles de implementación y configuración de hiperparámetros.

Esta tabla resume el entorno computacional, las bibliotecas de software, las configuraciones de modelos de aprendizaje automático y aprendizaje profundo, los ajustes de optimización, las tasas de aprendizaje, los tamaños de lote, los parámetros de entrenamiento y los valores de hiperparámetros utilizados a lo largo de la evaluación experimental del marco de IA explicable propuesto.

3. Preparación y preprocesamiento de conjuntos de datos

  1. Seleccionar conjuntos de datos sanitarios disponibles públicamente para garantizar la transparencia y reproducibilidad del flujo de trabajo experimental.;
  2. Utilizar cuatro escenarios representativos de atención sanitaria para validar el marco propuesto: (i) diagnóstico de cáncer de mama utilizando el Wisconsin Breast Cancer Dataset, (ii) predicción del riesgo de diabetes usando el Pima Indians Diabetes Dataset, (iii) predicción de resultados clínicos usando historiales electrónicos de salud MIMIC-III, y (iv) clasificación de la enfermedad torácica usando el NIH Chest X-ray Dataset. Elige estos conjuntos de datos para evaluar el marco a través de historiales clínicos estructurados, historiales electrónicos longitudinales y modalidades de imagen médica comúnmente utilizadas en sistemas de apoyo a la toma de decisiones sanitarias.
  3. Importa cada conjunto de datos al entorno Python y separa los registros en características de entrada y variables de destino. Organizar datos clínicos estructurados para tareas de predicción de enfermedades, historiales electrónicos de salud para análisis longitudinales de resultados y conjuntos de datos de imágenes médicas para tareas de clasificación diagnóstica. Verifica la integridad de cada conjunto de datos antes de proceder con las operaciones de preprocesamiento.
  4. Identificar y corregir los valores ausentes utilizando técnicas de imputación adecuadas. Estandarizar las características numéricas mediante procedimientos de escalado y normalización de características para garantizar la comparabilidad entre variables.
  5. Codificar variables categóricas utilizando métodos de codificación adecuados basados en las características del conjunto de datos. Realizar la selección de características utilizando análisis de correlación y medidas de importancia de características basadas en modelos para identificar las variables más relevantes y reducir la dimensionalidad de los datos.
  6. Redimensiona todas las imágenes médicas a 224, 224 píxeles antes del entrenamiento del modelo. Normalizar los valores de intensidad de píxeles según los requisitos de la arquitectura de aprendizaje profundo seleccionada. Aplicar técnicas de aumento de datos, incluyendo rotación de imágenes y volteo horizontal, para mejorar la generalización del modelo y reducir el sobreajuste. Verifica la calidad de la imagen y asegura la consistencia de las dimensiones de la imagen en todo el conjunto de datos.
  7. Evalúa la integridad de los datos evaluando la completitud del conjunto de datos, la consistencia y la alineación de las etiquetas de características. Verifica que todos los registros estén correctamente asignados a sus respectivas clases objetivo. Revisa las características del conjunto de datos, incluyendo el tamaño de la muestra, el recuento de características y la modalidad de los datos, tal como se resume en la Tabla 2.
  8. Implementar procedimientos de validación específicos de cada conjunto de datos para garantizar el rigor metodológico y la reproducibilidad. Registrar el tamaño de la muestra, la distribución de clases, la estrategia de división tren-validación-prueba, las medidas de prevención de fugas, los procedimientos de optimización de hiperparámetros, el diseño de validación cruzada y el protocolo de pruebas externo para cada conjunto de datos. Resume estos procedimientos de validación en la Tabla 3.
  9. Realizar controles de calidad de preprocesamiento evaluando el manejo de valores faltantes, eliminación de valores atípicos, escalado de características, codificación categórica, preservación de distribución de clases y procedimientos de partición de conjuntos de datos. Verifica que las operaciones de preprocesamiento se apliquen de forma consistente en todos los conjuntos de datos.
  10. Confirma la ausencia de una fuga sustancial de datos durante la partición de conjuntos de datos. Revise los resultados de la validación de preprocesamiento presentados en la Figura 1 para asegurar que se han generado conjuntos de datos estandarizados para análisis posteriores de aprendizaje automático y explicabilidad.
  11. Salida esperada: Generar conjuntos de datos limpios y estandarizados con valores faltantes correctamente direccionados, variables categóricas codificadas, características numéricas normalizadas y registros particionados en subconjuntos de entrenamiento, validación y prueba. Asegúrese de que las características del conjunto de datos, distribuciones de clases y procedimientos de validación correspondan a los reportados en las Tablas 2 y 3, y confirme la validación exitosa del preprocesamiento como se ilustra en la Figura 1.
Conjunto de datosTipoMuestrasCaracterísticasObjetivo
Cáncer de mamaTabular56930Benigno/Maligno
DiabetesTabular7688Consecuencias de la diabetes
MIMIC-IIIEHR~60.000Variables clínicasMortalidad
Radiografía de tóraxImagen~112.000ImágenesEtiquetas de enfermedades

Tabla 2: Características del conjunto de datos y casos de uso en la atención sanitaria.

Esta tabla ofrece un resumen de los conjuntos de datos sanitarios utilizados en el estudio, incluyendo el tipo de conjunto, número de muestras, recuento de características, variables objetivo, dominio de aplicación sanitaria y casos de uso clínicos asociados. Los conjuntos de datos abarcan historias clínicas estructuradas, historiales electrónicos de salud y datos de imagen médica para demostrar la aplicabilidad del marco en diversos escenarios analíticos sanitarios.

Conjunto de datosTamaño de la muestraDistribución de clasesEstrategia divididaPrevención de fugasBúsqueda por hiperparámetrosValidación cruzadaPrueba externa
Cáncer de mama (UCI Wisconsin)569357 benigno / 212 maligno70/15/15Preprocesamiento solo para trenesBúsqueda en cuadrículaCV estratificada de 5 órdenesSet Independiente de Resistencia
Diabetes de los indios Pima768500 No diabéticos / 268 Diabéticos70/15/15Preprocesamiento solo para trenesBúsqueda en cuadrículaCV estratificada de 5 órdenesSet Independiente de Resistencia
MIMIC-III EHR5274Cohortes estratificadas por resultados70/15/15 Nivel de pacienteSeparación a nivel de pacienteBúsqueda aleatoriaCV a nivel de paciente de 5 víboresSet Independiente de Resistencia
Radiografía de tórax del NIH112120Neumonía/Normal estratificado70/15/15Separación a nivel de imagenBúsqueda aleatoriaCV estratificada de 5 órdenesSet Independiente de Resistencia

Tabla 3: Validación a nivel de conjunto de datos y diseño experimental.

Esta tabla resume la metodología de validación empleada para cada conjunto de datos, incluyendo el tamaño de la muestra, la distribución de clases, la estrategia de división tren-validación-prueba, procedimientos de prevención de fugas, métodos de optimización de hiperparámetros, diseño de validación cruzada y protocolos de prueba externos. Estas medidas se implementaron para garantizar el rigor metodológico, la reproducibilidad y la evaluación imparcial del modelo.

figure-protocol-1
Figura 1: Validación de la cadena de preprocesamiento de datos.
Resultados de validación para operaciones clave de preprocesamiento realizadas antes del desarrollo del modelo. (A) Análisis de valor perdido en características representativas de la salud. (B) Distribución de una variable numérica antes y después del manejo de valores atípicos. (C) Validación de escalado de características mediante estandarización. (D) Validación de codificación categórica. (E) Distribución de clases tras el preprocesamiento. (F) Validación de la partición de datos de entrenamiento-validación-prueba. Estos resultados confirman el preprocesamiento y la preparación exitosos de los conjuntos de datos para modelado predictivo y análisis de explicabilidad. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

4. Arquitectura del sistema del Marco de IA Explicable

  1. Organizar el marco utilizando una arquitectura en capas para facilitar el procesamiento modular, mejorar la transparencia del flujo de trabajo y apoyar la implementación reproducible. Configura la Capa de Datos para recibir y gestionar conjuntos de datos sanitarios en bruto. Enruta todos los conjuntos de datos entrantes a través de la Capa de Datos antes de iniciar operaciones de preprocesamiento.
  2. Realizar procedimientos de limpieza, transformación, normalización, ingeniería de características y codificación de datos dentro de la Capa de Preprocesamiento. Asegúrate de que todas las operaciones de preprocesamiento se completen antes del desarrollo del modelo.
  3. Desarrollar modelos predictivos dentro de la Capa de Modelado utilizando algoritmos de aprendizaje automático y aprendizaje profundo. Modelos de Train Gradient Boosting, Random Forest, Multilayer Perceptrón (MLP) y Redes Neuronales Convolucionales (CNN) utilizando conjuntos de datos preprocesados y configuraciones optimizadas de hiperparámetros.
  4. Aplicar técnicas de explicabilidad dentro de la Capa de Explicabilidad para interpretar las predicciones del modelo. Generar explicaciones de atribución de características usando SHAP y LIME para conjuntos de datos estructurados. Genera mapas de calor Grad-CAM para modelos basados en imágenes para visualizar regiones que contribuyen a las predicciones del modelo.
  5. Evalúa el rendimiento predictivo y explicativo dentro de la Capa de Evaluación. Calcular precisión, precisión, recuerdo, puntuación F1, ROC-AUC, fidelidad, estabilidad y métricas de evaluación centrada en el clínico. Registrar todos los resultados de la evaluación para su análisis y presentación posteriores.
  6. Genera resultados visuales clínicamente interpretables dentro de la Capa de Visualización. Crea gráficos de comparación de rendimiento, visualizaciones de importancia de características, gráficos resumen SHAP, explicaciones LIME, mapas de calor Grad-CAM y paneles de informes orientados al clínico. Almacena todos los resultados visuales para incluirlos en el informe experimental final.
  7. Revisa la arquitectura completa del framework ilustrada en la Figura 2 antes de proceder con la ejecución del flujo de trabajo.
  8. Salida esperada: Generar modelos de aprendizaje automático y aprendizaje profundo totalmente entrenados, incluyendo Gradient Boosting, Random Forest, CNN y MLP. Almacena configuraciones de modelos, hiperparámetros optimizados, registros de entrenamiento, archivos de puntos de control, salidas de explicabilidad y artefactos de visualización para su posterior evaluación e interpretabilidad.

figure-protocol-2
Figura 2: Arquitectura del Sistema del Marco de IA Explicable para la Analítica en Salud. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

5. Ejecución de flujos de trabajo

  1. Adquiere conjuntos de datos sanitarios de repositorios públicos y almacena los conjuntos en formatos estructurados adecuados para aprendizaje automático y análisis de aprendizaje profundo. Revise el flujo de trabajo completo ilustrado en la Figura 3 antes de iniciar el procedimiento experimental.
  2. Realizar limpieza y preprocesamiento de datos según los procedimientos descritos en la Sección 3. Normaliza las variables numéricas utilizando métodos de escalado apropiados. Codificar variables categóricas utilizando técnicas de codificación adecuadas. Identificar e imputar valores faltantes utilizando estrategias de imputación específicas de cada conjunto de datos. Verifica la calidad de los datos, la alineación de las etiquetas de características y la completitud del conjunto de datos antes de continuar con el desarrollo del modelo.
  3. Particiona cada conjunto de datos en subconjuntos de entrenamiento, validación y prueba para apoyar la evaluación imparcial del modelo. Preservar las distribuciones de clases durante la partición de conjuntos de datos e implementar medidas de prevención de fugas cuando sea aplicable. Reserva el subconjunto de pruebas exclusivamente para la evaluación final del modelo.
  4. Entrenar modelos de aprendizaje automático en conjuntos de datos estructurados usando algoritmos basados en conjuntos, incluyendo Gradient Boosting y Random Forest. Entrenar modelos de aprendizaje profundo en conjuntos de datos de imágenes utilizando arquitecturas de Redes Neuronales Convolucionales (CNN) capaces de aprender características espaciales de la imagen. Actualizar los parámetros del modelo de forma iterativa durante el entrenamiento y monitorizar el rendimiento de validación tras cada época de entrenamiento. Aplicar la parada anticipada cuando el rendimiento de validación se deteriore o no mejore según los criterios de parada predefinidos.
  5. Optimizar los hiperparámetros del modelo utilizando estrategias de búsqueda sistemática, incluyendo búsqueda en cuadrícula y búsqueda aleatoria. Ajusta la tasa de aprendizaje, número de estimadores, profundidad del árbol, tamaño del lote, número de épocas y otros parámetros específicos del modelo según el rendimiento de validación. Selecciona el modelo final en función del rendimiento predictivo y la capacidad de generalización entre conjuntos de datos de validación.
  6. Aplica métodos de explicabilidad tras completar el entrenamiento con modelos. Generar explicaciones globales utilizando técnicas de atribución de características para identificar las variables que contribuyen más fuertemente a las predicciones del modelo. Generar explicaciones locales para analizar casos de predicción individuales y evaluar el comportamiento del modelo a nivel muestral. Crea mapas de calor Grad-CAM para modelos de clasificación de imágenes que resalten las regiones de la imagen que contribuyen al resultado previsto. Almacena todas las explicaciones para análisis e informes posteriores.
  7. Evalúa el rendimiento predictivo utilizando precisión, precisión, recall, puntuación F1 y área característica de operación del receptor bajo la curva (ROC-AUC). Evalúa la calidad de la explicación utilizando métricas de fidelidad y estabilidad para evaluar la fiabilidad y consistencia de la explicación. Comparar el rendimiento de los modelos entre conjuntos de datos y métodos de explicabilidad para evaluar la robustez y generalizabilidad del marco.
  8. Generar resultados de visualización e informes analíticos para comunicar los resultados de manera clínicamente interpretable. Crea gráficos comparativos de rendimiento, gráficos de importancia de características, visualizaciones resumen SHAP, resultados de explicación LIME, mapas de calor Grad-CAM y otras visualizaciones clínicamente relevantes. Revisa todos los resultados visuales para asegurar claridad y consistencia antes de informar.
  9. Documentar todas las operaciones de preprocesamiento, configuraciones de modelos, ajustes de hiperparámetros, procedimientos de explicabilidad, estrategias de validación y resultados de evaluación. Mantener registros experimentales detallados para facilitar la reproducibilidad y la replicación independiente del flujo de trabajo. Verifica la consistencia de los resultados a través de repetidas ejecuciones experimentales y archiva todos los artefactos del flujo de trabajo para referencia futura.
  10. Salida esperada: Generar un modelo predictivo completamente entrenado con hiperparámetros optimizados, pesos guardados del modelo, registros de entrenamiento, métricas de rendimiento y resultados explicables, incluyendo explicaciones SHAP, explicaciones LIME y mapas de calor Grad-CAM. Almacena todos los artefactos del modelo, informes de evaluación y resultados de visualización para su posterior análisis y evaluación de reproducibilidad.

figure-protocol-3
Figura 3: Flujo de trabajo de extremo a extremo de la cadena de IA explicable. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

6. Evaluación del modelo y evaluación de la explicabilidad

  1. Evaluar el rendimiento predictivo del modelo utilizando métricas estándar de clasificación, incluyendo precisión, precisión, recuerdo, puntuación F1 y área característica de operación del receptor bajo la curva (ROC-AUC). Calcular la precisión para medir la corrección general de la clasificación.
  2. Calcular la precisión para evaluar la proporción de predicciones positivas correctamente identificadas. Calcula la memoria para evaluar la capacidad del modelo para identificar casos positivos. Calcula la puntuación F1 para equilibrar precisión y recuerdo. Calcular ROC-AUC para evaluar el desempeño discriminatorio a través de diferentes umbrales de clasificación.
  3. Aplicar estas métricas de evaluación de forma consistente en todos los conjuntos de datos y arquitecturas de modelos para facilitar la comparación objetiva del rendimiento. Registrar todos los valores de las métricas y almacenar los resultados de la evaluación para su posterior análisis estadístico e informes.
  4. Evalúa el rendimiento de la explicabilidad usando métricas de fidelidad y estabilidad. Calcular la fidelidad para determinar hasta qué punto las explicaciones generadas reflejan con precisión las predicciones del modelo y el comportamiento de toma de decisiones.
  5. Calcula la estabilidad comparando explicaciones generadas a partir de muestras de entrada similares y cuantificando la consistencia de los resultados de las explicaciones. Verifica que los valores de fidelidad y estabilidad cumplan con los criterios de calidad predefinidos antes de interpretar las explicaciones del modelo.
  6. Compara el rendimiento de la explicabilidad entre salidas SHAP, CAL y Grad-CAM.
  7. Resultados esperados: generar resultados cuantitativos de evaluación, incluyendo precisión, precisión, recuerdo, puntuación F1, ROC-AUC, métricas de fidelidad y estabilidad. Producir resultados explicables y visualizaciones adecuadas para informes científicos, evaluación de reproducibilidad e interpretación clínica.

7. Evaluación centrada en el ser humano

  1. Recluta 12 profesionales sanitarios, compuestos por 6 médicos, 3 radiólogos y 3 analistas de datos clínicos. Selecciona participantes con experiencia previa en toma de decisiones clínicas, interpretación de imágenes médicas, análisis sanitarios o revisión de historiales electrónicos de salud. Obtén el consentimiento informado de todos los participantes antes de iniciar el procedimiento de evaluación.
  2. Seleccionar aleatoriamente 100 casos de los conjuntos de datos de pruebas tras completar el entrenamiento del modelo y el análisis de explicabilidad. Genera dos condiciones de evaluación para cada caso:
    1. Salida solo de predicción y
    2. predicción acompañada de información explicable. Aleatoriza el orden de presentación de los casos y las condiciones de evaluación para minimizar el sesgo de presentación y los efectos del aprendizaje.
  3. Preparar formularios de evaluación estandarizados que contengan resultados de predicción, resultados explicativos y cuestionarios de evaluación. Presenta los casos individualmente a los participantes mediante una interfaz de evaluación basada en ordenador.
  4. Instruye a los participantes a revisar cada caso de forma independiente sin discutir las respuestas con otros evaluadores. Permitir que los participantes completen todas las evaluaciones bajo condiciones experimentales idénticas.
  5. Administrar un cuestionario de cinco puntos a escala Likert adaptado de estudios de evaluación de inteligencia artificial explicables publicados. Instruye a los participantes para que evalúen la confianza, la interpretabilidad y la usabilidad para cada caso revisado. Registra las respuestas electrónicamente al cuestionario y verifica la finalización de todos los ítems de la encuesta antes de proceder al análisis estadístico.
  6. Mide indicadores objetivos de utilidad clínica durante el proceso de evaluación. Registrar el acuerdo de decisión comparando las decisiones de los participantes con las etiquetas de referencia correspondientes o resultados de la verdad del terreno. Calcular el acuerdo de decisión como el porcentaje de decisiones de los participantes que coinciden con el resultado de referencia.
  7. Registra el tiempo de revisión de cada caso midiendo el intervalo entre la presentación del caso y la presentación de la respuesta final. Calcular el tiempo medio de revisión por separado para condiciones de solo predicción y predicción con explicación.
  8. Calcula las puntuaciones medias de confianza, interpretabilidad y usabilidad entre todos los participantes y casos de evaluación. Comparar las puntuaciones obtenidas bajo condiciones de solo predicción y predicción con explicación.
  9. Realizar pruebas t pareadas tras completar todas las evaluaciones de los participantes para determinar si las diferencias en confianza, interpretabilidad, usabilidad, acuerdo de decisión y tiempo de revisión son estadísticamente significativas. Utiliza un umbral de significación de p 0,05 para todas las comparaciones estadísticas.
  10. Calcula Fleiss Kappa tras recopilar respuestas de todos los participantes para evaluar el acuerdo entre evaluadores. Utiliza las valoraciones agregadas de los participantes para determinar la consistencia de las evaluaciones entre revisores. Interpreta los valores de Fleiss Kappa según las directrices establecidas del acuerdo y registra las estadísticas resultantes del acuerdo.
  11. Resume la demografía de los participantes, la metodología de evaluación, el diseño de cuestionarios, los procedimientos de análisis estadístico, las medidas de desempeño objetivo y los resultados de acuerdos entre evaluadores en la Tabla 4.
  12. Revisa los resultados del modelo bajo ambas condiciones de evaluación y compara las respuestas de los participantes entre condiciones. Verifica que las explicaciones mejoren la confianza, la interpretabilidad y la usabilidad sin afectar negativamente la calidad de la decisión.
  13. Confirmar la consistencia de las evaluaciones de los participantes utilizando la estadística calculada de Fleiss Kappa. Registrar todos los resultados de la evaluación para informes posteriores y evaluaciones de reproducibilidad.
  14. Salida esperada: Generar puntuaciones de confianza de los clínicos, valoraciones de interpretabilidad, valoraciones de usabilidad, medidas de decisión y acuerdo, estadísticas de tiempo de revisión, resultados de pruebas t pareadas y estadísticas de acuerdo entre evaluadores. Producir evidencia cuantitativa que describa la utilidad clínica, la interpretabilidad y la fiabilidad del marco explicable de inteligencia artificial.
ParámetroValor
Expertos12
Médicos6
Radiólogos3
Analistas de Datos Clínicos3
Casos revisados100
Diseño de evaluaciónAleatorizados (Solo predicción vs Predicción+Explicación)
Instrumento de TopografíaEscala de Likert de 5 puntos
Evaluación del fideicomisoInterpretabilidad, Confianza, Usabilidad
Prueba estadísticaPrueba t emparejada (p 0,05)
Fiabilidad entre evaluadoresFleiss Kappa
Medidas ObjetivoAcuerdo de Decisión, Tiempo de Revisión

Tabla 4: Protocolo de evaluación centrada en el ser humano y diseño de evaluación por parte del clínico.

Esta tabla presenta el marco de evaluación del clínico utilizado para evaluar la interpretabilidad, fiabilidad y usabilidad del sistema de IA explicable. Se resume la información sobre la demografía de los participantes, la metodología de revisión de casos, el diseño de la encuesta, los procedimientos de análisis estadístico, la evaluación de fiabilidad entre evaluadores y las medidas de evaluación objetiva.

8. Validación y evaluación de reproducibilidad

  1. Realizar estudios de validación y ablación para evaluar la robustez y fiabilidad del marco propuesto. Identificar características con puntuaciones de alta importancia utilizando los métodos de explicabilidad seleccionados. Eliminar características importantes de forma incremental y reentrenar los modelos predictivos tras cada paso de eliminación de características.
  2. Evalúa el rendimiento del modelo tras cada experimento de ablación utilizando precisión, precisión, recuerdo, puntuación F1 y métricas ROC-AUC. Compara los valores de rendimiento resultantes con el rendimiento de referencia del modelo para determinar la contribución de características individuales a los resultados predictivos.
  3. Evalúa la estabilidad de las explicaciones generando explicaciones para muestras de entrada similares usando SHAP, CAL y Grad-CAM. Compara los resultados de las explicaciones entre evaluaciones repetidas y cuantifica la consistencia usando las métricas de estabilidad predefinidas. Verifica que las explicaciones se mantengan estables bajo pequeñas variaciones de entrada y repetidas pruebas experimentales.
  4. Registra todos los procedimientos experimentales a lo largo del flujo de trabajo. Operaciones de preprocesamiento de datos documentales, procedimientos de partición de conjuntos de datos, arquitecturas de modelos, ajustes de hiperparámetros, configuraciones de entrenamiento, métodos de explicabilidad, estrategias de validación y métricas de evaluación. Almacena todos los parámetros de configuración y salidas experimentales en un formato estructurado para facilitar la reproducibilidad y la verificación independiente.
  5. Revisa todos los registros experimentales para asegurar la completitud y la coherencia. Verifica que el flujo de trabajo pueda replicarse utilizando los procedimientos documentados, archivos de configuración y especificaciones de software. Mantener una estructura de flujo de trabajo modular para facilitar la adaptación del protocolo para futuros estudios y apoyar la conversión a un protocolo experimental basado en vídeo, conforme a los requisitos metodológicos de JoVE.

9. Recursos de Reproducibilidad

  1. Ejecutar todos los experimentos usando semillas aleatorias fijas para asegurar resultados reproducibles a lo largo de las ejecuciones repetidas. Mantener el código fuente, los scripts de preprocesamiento, los archivos de configuración, las especificaciones del entorno, los parámetros del modelo y los scripts de visualización dentro de un repositorio de acceso público.
  2. Proporcionar instrucciones detalladas para la adquisición de conjuntos de datos, preprocesamiento, ejecución de experimentos, entrenamiento de modelos, generación de explicabilidades, procedimientos de validación y regeneración de todas las tablas y figuras reportadas. Archivar todos los componentes del flujo de trabajo necesarios para la replicación independiente, incluyendo especificaciones de software, flujos de preprocesamiento, archivos de configuración, instrucciones de acceso al conjunto de datos, puntos de control de modelos y activos de visualización.
  3. Resume los recursos de software, los flujos de preprocesamiento, los archivos de configuración, las instrucciones de acceso al conjunto de datos y los activos de reproducibilidad utilizados a lo largo del marco en la Tabla 5.
  4. Salida esperada: Generar un paquete experimental reproducible completo que contenga scripts de preprocesamiento, archivos de configuración, modelos entrenados, puntos de control de modelos, salidas de explicabilidad, informes de validación, artefactos de visualización, especificaciones de software y documentación necesaria para la replicación y verificación independiente del marco propuesto.
RecursoDescripción
Código fuenteScripts de implementación en Python para preprocesamiento de datos, entrenamiento de modelos, explicabilidad y evaluación
Archivo de Entornorequirements.txt que contiene dependencias y versiones de paquetes
Archivos de configuraciónConfiguración de arquitectura de modelos, hiperparámetros y configuraciones de experimentos
Semillas aleatorias fijasSemilla = 42 usados para experimentos reproducibles
Instrucciones de acceso al conjunto de datosEnlaces y procedimientos para adquirir conjuntos de datos de salud pública
Preprocesamiento de scriptsScripts para limpieza de datos, normalización, codificación y selección de características
Scripts de generación de figurasEscrituras para regenerar todas las figuras manuscritas
Scripts de generación de tablasScripts para reproducir tablas y métricas reportadas
Ejemplos de entradasConjuntos de datos de ejemplo y archivos de entrada
Ejemplos de salidasResultados de predicción, explicaciones e informes de evaluación

Tabla 5: Recursos de reproducibilidad y activos experimentales.

Esta tabla resume los recursos proporcionados para soportar la reproducibilidad experimental, incluyendo código fuente, scripts de preprocesamiento, archivos de configuración, especificaciones del entorno, instrucciones de acceso al conjunto de datos, configuraciones de semilla aleatoria fijas, scripts de generación de figuras y archivos de entrada/salida de ejemplo necesarios para reproducir los resultados reportados.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Evaluamos a fondo el componente explicativo de IA de toda nuestra cartera, evaluando qué tan bien predecía en diferentes tipos de datos sanitarios, incluyendo tanto datos clínicos estructurados como imágenes médicas. Los resultados indicaron un rendimiento predictivo consistente en los conjuntos de datos evaluados. Entre los modelos probados, el modelo de aumento de gradiente alcanzó la mayor precisión con un 97,4%, seguido por el modelo de bosque aleatorio con un 94,2%. Los métodos de aprendizaje profundo aplicados a conjuntos de imágenes alcanzaron una precisión del 91,3%, mientras que los modelos de perceptrón multicapa produjeron resultados ligeramente inferiores, 90,8%. Esto sugiere que los modelos de aprendizaje automático basados en conjuntos funcionan mejor en datos sanitarios estructurados, mientras que las arquitecturas de aprendizaje profundo destacan en tareas de imagen. La Tabla 6 detalla en detalle varias métricas de rendimiento para funciones de predicción, incluyendo precisión, precisión, recuerdo y puntuación F1, así como métricas de explicabilidad como fidelidad y estabilidad. Llegamos a estas cifras empleando una validación cruzada de cinco veces y presentando los resultados como valores medios (con intervalos de confianza del 95%). Los intervalos de confianza no solo indican la incertidumbre del modelo, sino que también hacen que las comparaciones de rendimiento predictivo sean más fiables, teniendo en cuenta la memoria de conjuntos de datos y las diferencias en las arquitecturas de modelos.

ModeloPrecisión (%)PrecisiónRevocaciónF1-ScoreFidelidadEstabilidadIC 95%
Bosque Aleatorio94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN (Imagen)91.30.900.910.900.880.8690.1–92.5

Tabla 6: Rendimiento comparativo de modelos predictivos y métodos de explicabilidad.
Esta tabla presenta una evaluación comparativa de modelos de aprendizaje automático y aprendizaje profundo utilizando métricas predictivas de rendimiento, incluyendo precisión, precisión, recuerdo, puntuación F1 y ROC-AUC. Además, se informan que métricas de explicabilidad como fidelidad, estabilidad, comprensibilidad y puntuaciones de confianza humana proporcionan una evaluación integral tanto de la efectividad predictiva como de la interpretabilidad.

Los resultados indican que el Gradient Boosting logró el mayor rendimiento predictivo global (97,4% de precisión), superando a Random Forest por 3,2 puntos porcentuales y a los modelos de aprendizaje profundo por más de 6 puntos porcentuales. Esta observación sugiere que los métodos de aprendizaje basado en conjuntos fueron especialmente efectivos para los conjuntos de datos estructurados de salud incluidos en este estudio. La menor diferencia de rendimiento entre los modelos CNN y MLP indica que el aumento de la complejidad del modelo por sí solo no se traducía necesariamente en un rendimiento predictivo superior bajo las condiciones experimentales evaluadas.
Para mostrar la utilidad de nuestro marco propuesto en una variedad de tareas de análisis sanitario, presentamos los resultados de rendimiento predictivo específico de conjunto de datos en la Tabla 7.

Análisis específico de conjuntos de datos.
El rendimiento varió entre conjuntos de datos debido a diferencias en complejidad de características, tamaño de muestra, distribución de clases y modalidad de datos. El conjunto de datos Breast Cancer alcanzó la mayor precisión predictiva, probablemente debido a una separabilidad bien definida de características. Un rendimiento ligeramente inferior en los conjuntos de datos de radiografías de tórax MIMIC-III y NIH refleja la mayor complejidad de los registros clínicos longitudinales y los datos de imagen médica. Estos hallazgos demuestran que el rendimiento del marco está influido por las características del conjunto de datos y el contexto clínico.

Conjunto de datosPrecisión (%)Precisión (%)Revocación (%)Puntuación F1 (%)
Cáncer de mama97.497.297.697.1
Diabetes94.293.994.494
MIMIC-III91.39191.591.1
Radiografía de tórax del NIH90.890.491.290.6

Tabla 7: Resultados predictivos específicos de conjunto de datos.
Rendimiento predictivo del marco propuesto de IA explicable en cuatro conjuntos de datos representativos de salud. La precisión, la exactitud, la memoria y la puntuación F1 se reportan como porcentajes (%) en los conjuntos de pruebas independientes. Valores más altos indican un mejor rendimiento en la clasificación.

Para evaluar el rendimiento predictivo, se evaluaron cuatro modelos de aprendizaje automático y aprendizaje profundo, a saber, Gradient Boosting, Random Forest, Convolutional Neural Network (CNN) y Multilayer Perceptron (MLP), en cuatro conjuntos de datos sanitarios representativos. El rendimiento del modelo se evaluó utilizando precisión, precisión, recuerdo, puntuación F1 y métricas ROC-AUC en conjuntos de datos de prueba independientes tras una división de prueba 70:15:15 entre tren y validación cruzada de cinco veces. Las mejoras en el rendimiento predictivo se determinaron comparando métricas de evaluación específicas del modelo entre condiciones idénticas de preprocesamiento y validación.
Para ilustrar cómo difieren los rendimientos de los modelos en varios métodos, la Figura 4 muestra pictóricamente las ventajas y desventajas de los modelos de ensamblaje, redes neuronales y aprendizaje profundo.

figure-results-1
Figura 4: Rendimiento comparativo de modelos de aprendizaje automático y aprendizaje profundo en tareas de predicción sanitaria. (A) Comparación de precisión de modelos de Gradient Boosting, Random Forest, CNN y MLP en el conjunto de datos de pruebas. (B) Comparación de puntuaciones F1 de modelos de Gradient Boosting, Random Forest, CNN y MLP en el conjunto de datos de prueba. (C) Comparación precisa de modelos de Gradient Boosting, Random Forest, CNN y MLP en el conjunto de datos de prueba. (D) Recordar la comparación de los modelos de Gradient Boosting, Random Forest, CNN y MLP en el conjunto de datos de prueba. Valores más altos indican un mejor rendimiento predictivo. El aumento de gradiente logró el mayor rendimiento global en todas las métricas de evaluación, seguido por el Bosque Aleatorio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Interpretación de la Explicabilidad Rendimiento.
SHAP logró consistentemente las puntuaciones más altas de fidelidad y estabilidad entre los métodos evaluados de explicabilidad, lo que indica una mayor concordancia entre las explicaciones generadas y las predicciones del modelo subyacente. La CAL mostró una estabilidad comparativamente menor, lo que sugiere una mayor sensibilidad a perturbaciones locales y variabilidad muestral. Grad-CAM proporcionó explicaciones visualmente interpretables para modelos basados en imágenes, pero produjo valores de fidelidad ligeramente inferiores a los de SHAP. Estos hallazgos indican que la calidad de la explicación depende tanto de la técnica explicativa seleccionada como de la arquitectura del modelo predictivo subyacente.

Las técnicas de explicabilidad integradas en la cartera han sido evaluadas en términos de su rendimiento tanto cuantitativa como cualitativamente. Específicamente, los métodos de atribución de características han logrado descubrir la lógica interna del modelo de forma bastante consistente a través de diferentes conjuntos de datos.
Todos los métodos considerados en el estudio, SHAP, lograron la mayor fidelidad (0,92) y estabilidad (0,89) entre los métodos de explicabilidad evaluados. En pocas palabras, las explicaciones eran representaciones muy precisas de lo que el modelo realmente predijo. Los métodos de explicación local son una especie de ventana a través de la cual podemos ver una predicción específica y entender cuál fue la base que el modelo utilizó para la decisión.

El desempeño de interpretabilidad se evaluó utilizando puntuaciones de fidelidad, estabilidad, comprensibilidad y confianza del clínico obtenidas a partir de la evaluación centrada en el ser humano. Se compararon las explicaciones de SHAP, LIME y Grad-CAM utilizando conjuntos de datos idénticos y modelos entrenados. Las mejoras en la explicabilidad se evaluaron comparando métricas de calidad de explicación y valoraciones de los clínicos entre los métodos de habilidad explicativa evaluados. Las técnicas de visualización para modelos de aprendizaje profundo que trabajan con imágenes producen esencialmente mapas de calor, que identifican las regiones de las imágenes que tienen mayor relevancia para la predicción del modelo. Las distribuciones de importancia de las características y las comparaciones de rendimiento de explicabilidad entre diferentes métodos se muestran en la Figura 5.

figure-results-2
Figura 5: Evaluación del rendimiento de la explicabilidad.La figura presenta el rendimiento de métodos de explicabilidad con la ayuda de métricas de fidelidad y estabilidad. SHAP lidera en fidelidad (0,92) y estabilidad (0,89), lo que refleja un buen acuerdo entre explicaciones y predicciones del modelo. LIME resulta ser la mejor herramienta para la interpretabilidad de ejemplos individuales. Por otro lado, Grad-CAM genera mapas de calor visuales utilizados principalmente en modelos de imagen, mostrando de forma general las regiones más importantes responsables de la predicción del modelo, lo cual, desde un punto de vista clínico, podría ser muy relevante. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Tras evaluar los modelos predictivos y las técnicas de interpretabilidad, se reveló que la correlación entre la precisión de un modelo y la fiabilidad de sus explicaciones es muy fuerte. De hecho, los mismos modelos que mostraron mejoras en la predicción también explicaban sus resultados con mayor estabilidad y consistencia cuando se aplicaban correctamente las técnicas de interpretabilidad. Se encontró que los modelos de conjunto eran los más interpretables cuando se acompañaban de métodos de atribución de características, mientras que los modelos de aprendizaje profundo se beneficiaban mejor de métodos explicables basados en visualización. El vínculo que une la precisión de la predicción y la fiabilidad de las explicaciones puede verse en la Figura 6, que detalla la dinámica conceptual entre modelo y explicabilidad.

figure-results-3
Figura 6: Análisis comparativo de modelos y explicación de métodos de habilidad.El gráfico muestra una comparación detallada de la precisión y explica las medidas de capacidad de varios modelos. Consiste en un gráfico de dispersión que muestra la correlación entre precisión y estabilidad explicativa, una comparación tabular de los rendimientos y una matriz de idoneidad que describe los diferentes métodos de explicación SHAP, LIME y Grad-CAM, así como su efectividad con distintos tipos de modelos. El visual muestra claramente que los modelos de conjunto más SHAP ofrecen una gran interpretabilidad, mientras que los modelos de aprendizaje profundo se explican mediante técnicas de visualización. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La evaluación centrada en el ser humano confirmó la utilidad real del sistema sugerido en hospitales y otras instalaciones clínicas. Los profesionales médicos revisaron los resultados del modelo con y sin explicaciones. Mostrar los resultados con explicaciones llevó a un aumento considerable de la confianza y interpretabilidad de los usuarios; El valor medio del fideicomiso subió de 3,1 a 4,7 en la escala del 1 al 5. El aumento en la puntuación de confianza de 3,1 a 4,7 representa una mejora relativa aproximada del 51,6%. El acuerdo sustancial entre evaluadores (κ de Fleiss = 0,81) indica además una evaluación coherente por parte del clínico sobre la utilidad de la explicación. Estos hallazgos sugieren que los resultados de explicabilidad pueden mejorar la confianza de los usuarios y facilitar la interpretación de decisiones clínicas asistidas por IA. Los profesionales afirmaron una mejor comprensión de los resultados de los modelos y una mayor confianza en el juicio apoyado por IA sobre situaciones clínicas, lo que pone de manifiesto la importancia de la interpretabilidad en la implementación real de la atención sanitaria.

Además, verificamos la robustez de nuestro marco mediante análisis de ablación. La eliminación de características críticas que, mediante métodos de explicabilidad, se consideraban esenciales resultó en una gran pérdida de rendimiento predictivo. Así, el hallazgo refleja que las características no solo eran pertinentes, sino también significativas para la tarea predictiva. Además, los resultados de la explicación mostraban solo diferencias insignificantes cuando se explicaban diferentes muestras de entrada, mostrando así la estabilidad y fiabilidad de los métodos de explicabilidad.

Para comprobar la viabilidad de la tubería para su uso práctico, medimos su velocidad computacional. La introducción de técnicas de explicabilidad provocó cierto aumento en el tiempo computacional, especialmente al atribuir características y crear visualizaciones. No obstante, el tiempo total de ejecución seguía siendo factible y no demasiado largo. La Figura 7 muestra cómo el tiempo computacional se comparte entre las diferentes etapas de la canalización, como preprocesamiento, entrenamiento de modelos, generación de explicabilidades, evaluación y visualización.

figure-results-4
Figura 7: Desglose del tiempo de ejecución de la pipeline. Este gráfico muestra cómo el tiempo computacional se divide entre las distintas fases de la cadena de IA explicable, como el preprocesamiento, el entrenamiento de modelos, la creación de habilidades, la evaluación y la visualización de la habilidad. Los datos revelan que la mayor parte de la línea temporal se ocupa en el entrenamiento del modelo, que luego es seguido por el procesamiento de habilidades explicativo. Por otro lado, el tiempo dedicado al preprocesamiento y a los informes es bastante mínimo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

También probamos la resistencia del marco propuesto mediante un análisis de ablación. Eliminar las características esenciales descubiertas mediante métodos de explicabilidad mostró una clara disminución en el rendimiento predictivo, lo que es una señal clara de que esas características no solo son relevantes, sino también bastante importantes. Además, las salidas de explicación fueron bastante estables incluso cuando hubo un ligero cambio en las muestras de entrada, lo que demuestra la consistencia y fiabilidad de las técnicas de explicabilidad.

En resumen, al combinar la medición del rendimiento predictivo, la explicabilidad y la validación centrada en el ser humano, se demostró que el marco propuesto era eficaz. El sistema no solo hacía predicciones muy precisas, sino que también seguía siendo muy interpretable y fácil de usar. Incorporar métodos de explicabilidad hizo que todo el proceso fuera transparente sin afectar al rendimiento del modelo. Las mejoras que vimos en la precisión y interpretabilidad de las predicciones no solo se lograron bajo un estricto control experimental, sino que también fueron estadísticamente significativas, un hecho que habla de la resistencia y autenticidad del método propuesto. Se realizaron comparaciones por pares entre modelos predictivos utilizando pruebas t emparejadas entre pliegues de validación cruzada. Se observaron diferencias estadísticamente significativas entre el Gradient Boosting y los modelos competidores (p < 0,05), lo que confirma la superioridad de la configuración propuesta.

Hallazgos generales.
En conjunto, los resultados demuestran que el rendimiento predictivo, la calidad de la explicación y la confianza del clínico pueden evaluarse dentro de un flujo de trabajo unificado y reproducible. El marco mantuvo un rendimiento consistente en múltiples conjuntos de datos sanitarios, al tiempo que apoyaba una interpretación transparente mediante explicaciones de SHAP, LIME y Grad-CAM. Sin embargo, los resultados deben interpretarse dentro del contexto de los conjuntos de datos seleccionados y configuraciones de validación, y sigue siendo necesaria una validación externa adicional antes de su despliegue en el mundo real.

DISPONIBILIDAD DE DATOS:
Obtuvimos los conjuntos de datos utilizados en la investigación actual de fuentes públicas, y pueden encontrarse en repositorios de datos reconocidos. Por ejemplo, los datos relacionados con el cáncer de mama y la diabetes se pueden descargar desde el Repositorio de Aprendizaje Automático de UCI en: https://archive.ics.uci.edu/ml/index.php

Se puede acceder al conjunto de datos de historial médico electrónico (MIMIC-III) a través de Physio Net en:
https://physionet.org/content/mimiciii/1.4/

Los datos de radiografía de tórax se extrajeron del Conjunto de Datos de Rayos X de Tórax del NIH y pueden encontrarse en: https://www.kaggle.com/datasets/nih-chest-xrays/data

Todos los conjuntos de datos que hemos explorado en este estudio están anonimizados y se hacen públicos a disposición pública. Los pasos de preprocesamiento, el modelo entrenado y los resultados de explicación de habilidades que produjimos durante la investigación están disponibles a través del autor correspondiente si se hace una solicitud razonable. El código fuente, los scripts de preprocesamiento, los archivos de configuración y los recursos de reproducibilidad se depositarán en un repositorio público una vez aceptados los manuscritos.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio desarrolló y evaluó un flujo de trabajo de inteligencia artificial explicable reproducible (XAI) para análisis sanitarios que integra modelado predictivo, evaluación de explicabilidad, evaluación centrada en el clínico y recursos de reproducibilidad dentro de un único protocolo. Los resultados demostraron que los modelos de aprendizaje automático basados en conjuntos, especialmente Gradient Boosting y Random Forest, lograron el mayor rendimiento predictivo en los conjuntos de datos estructurados evaluados, mientras que los modelos de aprendizaje profundo eran más adecuados para análisis basados en imágenes. Estos hallazgos ponen de manifiesto la importancia de seleccionar arquitecturas de modelos según las características de los datos, en lugar de asumir que los modelos más complejos siempre ofrecerán un rendimiento superior. Una contribución clave de este trabajo es la integración de modelado predictivo, evaluación de explicabilidad, evaluación centrada en el ser humano y prácticas de reproducibilidad dentro de un flujo de trabajo estandarizado. A diferencia de los estudios que evalúan técnicas de explicabilidad de forma aislada, el marco propuesto ofrece una metodología basada en protocolos que permite experimentación transparente y reproducible a través de diversos conjuntos de datos sanitarios.

El análisis de explicabilidad demostró diferencias medibles entre los métodos evaluados. SHAP logró las puntuaciones más altas de fidelidad y estabilidad dentro de las condiciones experimentales evaluadas, lo que indica una mayor concordancia entre las explicaciones generadas y las predicciones del modelo. LIME proporcionó explicaciones locales útiles pero mostró menor estabilidad, mientras que Grad-CAM generó explicaciones visuales intuitivas para los datos de imagen. Estos hallazgos sugieren que la calidad de la explicación depende tanto del método de explicabilidad seleccionado como del modelo predictivo subyacente. La evaluación centrada en el ser humano demostró además que la inclusión de explicaciones mejoró la confianza y la interpretabilidad del clínico. El aumento observado en las puntuaciones de confianza y el acuerdo sustancial entre evaluadores (κ de Fleiss = 0,81) indican una evaluación consistente de la utilidad de la explicación entre los participantes. Estos hallazgos respaldan el valor potencial de los métodos de explicabilidad para mejorar la transparencia y la aceptación por parte de los usuarios en los sistemas de apoyo a la toma de decisiones sanitarias.

Se deben tener en cuenta varias limitaciones al interpretar los resultados. En primer lugar, el marco se evaluó utilizando un número limitado de conjuntos de datos públicos y puede que no represente completamente la variabilidad encontrada en entornos clínicos reales. En segundo lugar, la evaluación del clínico implicó una cohorte de participantes relativamente pequeña, lo que puede limitar la generalización. En tercer lugar, los métodos de explicabilidad investigados en este estudio son técnicas a posteriori y, por tanto, siguen sujetas a limitaciones conocidas, incluyendo la sensibilidad a perturbaciones y posibles discrepancias entre las explicaciones y el razonamiento verdadero del modelo. Finalmente, la validación externa entre instituciones sanitarias independientes estaba fuera del alcance del presente estudio.

La investigación futura debería investigar la analítica sanitaria multimodal integrando registros clínicos, imágenes médicas, señales fisiológicas y datos de sensores portátiles. Se necesita trabajo adicional para evaluar métodos de explicación causal y contrafactual, cuantificación de incertidumbre, evaluación de equidad, análisis de calibración y validación clínica prospectiva. Estos estudios podrían mejorar aún más la transparencia, fiabilidad y aplicabilidad de los sistemas de IA explicables en la sanidad.

Además de la evaluación del rendimiento, deben considerarse varios desafíos prácticos de implementación y modificaciones de protocolo para garantizar un despliegue robusto del marco de IA explicable propuesto en diversos entornos sanitarios.

Limitaciones de los métodos de explicabilidad

SHAP, LIME y Grad-CAM, aunque ofrecen información útil sobre el comportamiento del modelo, también presentan varias desventajas. Se ha observado en la literatura que estas herramientas pueden ser inestables en ejecuciones repetidas, bastante sensibles a las perturbaciones, difieren entre conjuntos de datos y, a veces, no reflejan con precisión las verdaderas razones del modelo. Por lo tanto, las explicaciones a posteriori solo deben verse como evidencia complementaria y no como la representación real de los mecanismos de decisión causal. La validación adecuada de la fiabilidad de las explicaciones sigue siendo un paso fundamental antes de que puedan utilizarse en entornos clínicos de gran impacto.

Esto también es coherente con los hallazgos de investigaciones recientes en IA biomédica, que han subrayado la necesidad de explicar la validación de la fiabilidad antes de su implementación en entornos clínicos. La incorporación de la explicabilidad se ha utilizado como un aspecto clave de la validación en los sistemas de predicción de paros cardíacos para que sean más transparentes y ganen la confianza de las prediccionesclínicas 41. De la misma manera, la segmentación de imágenes por ultrasonido hepático utilizando técnicas de explicabilidad basadas en visualización estaba orientada a aumentar la interpretabilidad sin dejar de lado que las explicaciones post hoc son limitadas. Estos artículos confirman que son necesarias comprobaciones de consistencia explicativa, pruebas de robustez explicativa y validaciones de resultados de explicabilidad clínicamente significativas para alcanzar el nivel más alto de preparación clínica para el uso42.

Calibración, Equidad, Robustez y Generalización Externa

Las versiones futuras del marco propuesto incluirán la evaluación de la calibración de probabilidad mediante curvas de calibración y puntuación Brier, estimación de la incertidumbre mediante métodos bayesianos y basados en conjuntos, auditoría de equidad de los subgrupos demográficos y comprobación de robustez bajo la presencia de datos ruidosos y condiciones cambiantes del dominio. Estos análisis son especialmente importantes en entornos sanitarios donde la confianza en el modelo, el rendimiento equitativo y la fiabilidad bajo entornos clínicos cambiantes influyen directamente en la seguridad del paciente y la adopción clínica. Los marcos científicos recientes habilitados por IA han enfatizado de manera similar la importancia de sistemas de apoyo a la decisión fiables, transparentes y fiables más allá de la evaluación predictiva convencional del rendimiento. Los marcos científicos recientes habilitados por IA han enfatizado de manera similar la importancia de sistemas de apoyo a la decisión fiables, transparentes y fiables más allá de la evaluación predictiva convencional del rendimiento 43.

Resolución de problemas y modificaciones de protocolo

Es necesario considerar varios aspectos prácticos para el despliegue exitoso del marco propuesto de IA explicable. Un problema típico es el sobreajuste, por ejemplo, al entrenar modelos de aprendizaje profundo en conjuntos de datos sanitarios relativamente pequeños. El sobreajuste puede reducirse aplicando validación cruzada, paradas tempranas, regularización de caídas, aumento de datos y optimización exhaustiva de hiperparámetros. Observar el rendimiento de validación durante el entrenamiento es una buena forma de evitar un modelo muy complejo que generaliza mal.

Otro tema muy importante en los conjuntos de datos sanitarios es el desequilibrio de clases, es decir, los resultados clínicos positivos son mucho más raros que los casos negativos. Para abordar este problema, el muestreo estratificado, el ajuste por peso de clase, el sobremuestreo sintético de minorías y el uso de métricas de evaluación equilibrada como la puntuación F1 y el ROC-AUC deberían formar parte de la cadena de modelización. Ignorar el desequilibrio de clases corre el riesgo de producir métricas de rendimiento que no representan realmente el modelo ni las predicciones clínicas que podrían estar sesgadas.

Los conjuntos de datos de imagen médica normalmente no son perfectos y pueden estar corrompidos por ruido, artefactos de adquisición, calidad inconsistente, etc. Estos factores también varían según el tipo de dispositivo de imagen. Estos factores pueden afectar negativamente al rendimiento predictivo y también afectar a los resultados de explicabilidad. Por lo tanto, deben aplicarse pasos estandarizados de preprocesamiento, normalización de imágenes, controles de calidad y técnicas de aumento de datos para lograr la robustez y fiabilidad del modelo.

SHAP permite deducir explicaciones altamente informativas de atribución de características. Sin embargo, no se pueden descartar las ocurrencias de inestabilidad, especialmente cuando existen características altamente correlacionadas o cuando los resultados del modelo son muy sensibles a pequeños cambios en los datos de entrada. Para mejorar la consistencia y fiabilidad de la explicación, se recomienda escribir la explicación varias veces, evaluar la estabilidad en varias ejecuciones, usar estrategias de agrupación de características y comprobar contra otros métodos de explicabilidad como LIME.

Cuando se trata de datos sanitarios a gran escala y grandes arquitecturas de redes neuronales profundas, los límites de memoria de las GPU pueden convertirse en una de las principales limitaciones. Las necesidades de memoria pueden reducirse considerablemente mediante cambios en el tamaño del lote, entrenamiento de precisión mixta, poda de modelos, reducción en la dimensionalidad de características y adopción de cargas de datos eficientes. Además, los investigadores que despliegan el framework en sistemas de pocos recursos podrían plantearse utilizar entornos de computación en la nube o entrenamiento distribuido.

El diseño modular del marco propuesto permite realizar cambios fácilmente para diferentes aplicaciones sanitarias. Dependiendo de la tarea clínica, los científicos pueden modificar uno o más modelos de predicción individuales, añadir nuevos métodos de explicación, utilizar diferentes tipos de datos sanitarios juntos o incluir módulos de cuantificación y calibración de incertidumbre sin modificar el flujo de trabajo general. Esta flexibilidad ayuda a que el marco sea utilizable en casos muy diferentes de análisis sanitario, sin perder la forma de ser reproducible e interpretable.

Consideraciones regulatorias y éticas:

Los sistemas de IA hechos más comprensibles pueden ser de gran ayuda en la sanidad. Pero no es suficiente. Las normas reguladoras, que exigen transparencia, rendición de cuentas, privacidad y seguridad del paciente, deben cumplirse. Aunque la explicabilidad pueda aumentar la confianza y la interpretabilidad, no puede garantizar por sí sola la validez clínica. La implementación responsable requiere validación clínica prospectiva, evaluación de la equidad, revisión regulatoria y monitorización posterior al despliegue. Además, se deben tener en cuenta la confidencialidad del paciente, la supervisión del profesional y el rendimiento equitativo entre grupos demográficos al implementar el marco en el futuro. Para integrarse en los flujos de trabajo clínicos reales, los sistemas de IA y los profesionales sanitarios deben interactuar sin fallos. Por lo tanto, la información explicativa debe formar parte de los historiales electrónicos actuales y de las plataformas de apoyo a la decisión clínica, no herramientas separadas que solo funcionen por sí solas. Las decisiones finales deben ser tomadas por los médicos, mientras que la IA explicable es simplemente una tecnología auxiliar que mejora la transparencia, respalda el razonamiento basado en la evidencia y facilita la comunicación entre los profesionales sanitarios y los pacientes.

Este artículo presenta un protocolo reproducible para desarrollar, evaluar e interpretar sistemas de inteligencia artificial explicables en la analítica sanitaria. La contribución es metodológica y orientada al flujo de trabajo, proporcionando a investigadores y clínicos un marco estandarizado que puede replicarse, adaptarse y extenderse a múltiples aplicaciones sanitarias. Combina diferentes aspectos como el preprocesamiento de datos, el modelado predictivo, los métodos de explicabilidad y la evaluación del rendimiento de manera unificada. La metodología demostró un fuerte rendimiento predictivo en múltiples conjuntos de datos sanitarios. En cuanto al análisis de datos estructurados, los conjuntos de modelos son los que mejor rinden, mientras que los modelos de aprendizaje profundo se han demostrado muy efectivos para tareas de imagen médica. Además, el uso de técnicas de explicación facilita a los usuarios la comprensión de los modelos, ya que ofrece interpretaciones tanto globales como locales de los resultados de la predicción. Por lo tanto, no solo aumenta la confianza de los clínicos, sino también la usabilidad de los modelos. Los hallazgos indican que la IA explicable puede apoyar el desarrollo de sistemas de análisis sanitario transparentes e interpretables para encontrar un compromiso entre la precisión y la interpretabilidad de los modelos, que son esenciales para una analítica sanitaria fiable y fiable. Por lo tanto, el método presentado aquí es una herramienta muy eficaz y sencilla para el análisis de datos médicos que puede ayudar a los profesionales sanitarios a utilizar tecnologías de IA en las que confíen. Este artículo presenta un protocolo reproducible para desarrollar, evaluar e interpretar modelos explicables de inteligencia artificial en la analítica sanitaria. Al integrar el preprocesamiento de datos, la modelización predictiva, la evaluación de la explicabilidad, la evaluación centrada en el clínico y los recursos de reproducibilidad dentro de un flujo de trabajo unificado, el protocolo proporciona un marco práctico para la investigación transparente en IA sanitaria. El flujo de trabajo puede adaptarse a diversos conjuntos de datos y dominios de aplicación sanitarias, apoyando la implementación reproducible, evaluación e informes de sistemas de aprendizaje automático explicables.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses financieros en competencia ni conflictos de interés relacionados con esta obra. La investigación se llevó a cabo de forma independiente, sin ninguna relación comercial o financiera que pudiera considerarse un posible conflicto de intereses.

Divulgación del uso de la inteligencia artificial

Se utilizaron herramientas de inteligencia artificial para el refinamiento del lenguaje, la corrección gramatical y la asistencia editorial durante la preparación de manuscritos. Todo el contenido científico, el diseño experimental, el análisis de datos, la interpretación y la verificación final del manuscrito fueron realizados por los autores. Los autores revisaron y validaron todos los resultados asistidos por IA para garantizar la precisión, integridad y cumplimiento de las directrices de la revista.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores desean agradecer a sus respectivas instituciones por proporcionar la infraestructura y el apoyo en investigación necesarios para llevar a cabo este estudio. Los autores también reconocen el uso de conjuntos de datos y herramientas de código abierto disponibles públicamente que facilitaron el desarrollo y la evaluación del marco propuesto de IA explicable. Se extiende un agradecimiento especial a los expertos del sector que aportaron valiosas ideas durante la fase de evaluación centrada en el ser humano.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
GPU WorkstationDependiente del fabricanteNAEntrenamiento de modelos de aprendizaje profundo
Jupyter NotebookProject JupyterÚltima versión estableEjecución interactiva de experimentos
LIMELIMEVersión 0.2.0Explicaciones interpretables locales
MatplotlibMatplotlib ProjectVersión 3.9Visualización de datos
MIMIC-III DatabasePhysioNetVersión 1.4Análisis de registros de salud electrónicos
NIH Chest X-ray DatasetNIH Clinical CenterConjunto de datos públicoClasificación de enfermedades torácicas
NumPyNumPy DevelopersVersión 1.26Computación numérica y operaciones de matrices
OpenCVOpenCV FoundationVersión 4.10Preprocesamiento de imágenes
PandasPandas Development TeamVersión 2.1Manipulación y preprocesamiento de datos
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryConjunto de datos públicoPredicción del riesgo de diabetes
Python 3.11Python Software FoundationVersión 3.11Entorno de programación principal
Scikit-learnscikit-learnVersión 1.5Algoritmos de aprendizaje automático y evaluación
SeabornSeabornVersión 0.13Visualización estadística
SHAPSHAPVersión 0.46Atribución de características y explicabilidad
TensorFlowTensorFlowVersión 2.15Desarrollo de modelos de aprendizaje profundo
Windows / Ubuntu LinuxMicrosoft / CanonicalNASistema operativo
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryConjunto de datos públicoDiagnóstico de cáncer de mama

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

EngineeringExplainable Artificial Intelligence XAIMachine learningdeep learningModel InterpretabilityClinical Decision Support SystemsReproducible Experimental Protocol

Artículos relacionados