$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Evaluamos a fondo el componente explicativo de IA de toda nuestra cartera, evaluando qué tan bien predecía en diferentes tipos de datos sanitarios, incluyendo tanto datos clínicos estructurados como imágenes médicas. Los resultados indicaron un rendimiento predictivo consistente en los conjuntos de datos evaluados. Entre los modelos probados, el modelo de aumento de gradiente alcanzó la mayor precisión con un 97,4%, seguido por el modelo de bosque aleatorio con un 94,2%. Los métodos de aprendizaje profundo aplicados a conjuntos de imágenes alcanzaron una precisión del 91,3%, mientras que los modelos de perceptrón multicapa produjeron resultados ligeramente inferiores, 90,8%. Esto sugiere que los modelos de aprendizaje automático basados en conjuntos funcionan mejor en datos sanitarios estructurados, mientras que las arquitecturas de aprendizaje profundo destacan en tareas de imagen. La Tabla 6 detalla en detalle varias métricas de rendimiento para funciones de predicción, incluyendo precisión, precisión, recuerdo y puntuación F1, así como métricas de explicabilidad como fidelidad y estabilidad. Llegamos a estas cifras empleando una validación cruzada de cinco veces y presentando los resultados como valores medios (con intervalos de confianza del 95%). Los intervalos de confianza no solo indican la incertidumbre del modelo, sino que también hacen que las comparaciones de rendimiento predictivo sean más fiables, teniendo en cuenta la memoria de conjuntos de datos y las diferencias en las arquitecturas de modelos.
| Modelo | Precisión (%) | Precisión | Revocación | F1-Score | Fidelidad | Estabilidad | IC 95% |
| Bosque Aleatorio | 94.2 | 0.93 | 0.92 | 0.92 | 0.85 | 0.82 | 93.1–95.3 |
| XGBoost | 97.4 | 0.96 | 0.95 | 0.95 | 0.92 | 0.89 | 96.5–98.3 |
| MLP | 90.8 | 0.89 | 0.88 | 0.88 | 0.80 | 0.78 | 89.6–92.0 |
| CNN (Imagen) | 91.3 | 0.90 | 0.91 | 0.90 | 0.88 | 0.86 | 90.1–92.5 |
Tabla 6: Rendimiento comparativo de modelos predictivos y métodos de explicabilidad.
Esta tabla presenta una evaluación comparativa de modelos de aprendizaje automático y aprendizaje profundo utilizando métricas predictivas de rendimiento, incluyendo precisión, precisión, recuerdo, puntuación F1 y ROC-AUC. Además, se informan que métricas de explicabilidad como fidelidad, estabilidad, comprensibilidad y puntuaciones de confianza humana proporcionan una evaluación integral tanto de la efectividad predictiva como de la interpretabilidad.
Los resultados indican que el Gradient Boosting logró el mayor rendimiento predictivo global (97,4% de precisión), superando a Random Forest por 3,2 puntos porcentuales y a los modelos de aprendizaje profundo por más de 6 puntos porcentuales. Esta observación sugiere que los métodos de aprendizaje basado en conjuntos fueron especialmente efectivos para los conjuntos de datos estructurados de salud incluidos en este estudio. La menor diferencia de rendimiento entre los modelos CNN y MLP indica que el aumento de la complejidad del modelo por sí solo no se traducía necesariamente en un rendimiento predictivo superior bajo las condiciones experimentales evaluadas.
Para mostrar la utilidad de nuestro marco propuesto en una variedad de tareas de análisis sanitario, presentamos los resultados de rendimiento predictivo específico de conjunto de datos en la Tabla 7.
Análisis específico de conjuntos de datos.
El rendimiento varió entre conjuntos de datos debido a diferencias en complejidad de características, tamaño de muestra, distribución de clases y modalidad de datos. El conjunto de datos Breast Cancer alcanzó la mayor precisión predictiva, probablemente debido a una separabilidad bien definida de características. Un rendimiento ligeramente inferior en los conjuntos de datos de radiografías de tórax MIMIC-III y NIH refleja la mayor complejidad de los registros clínicos longitudinales y los datos de imagen médica. Estos hallazgos demuestran que el rendimiento del marco está influido por las características del conjunto de datos y el contexto clínico.
| Conjunto de datos | Precisión (%) | Precisión (%) | Revocación (%) | Puntuación F1 (%) |
| Cáncer de mama | 97.4 | 97.2 | 97.6 | 97.1 |
| Diabetes | 94.2 | 93.9 | 94.4 | 94 |
| MIMIC-III | 91.3 | 91 | 91.5 | 91.1 |
| Radiografía de tórax del NIH | 90.8 | 90.4 | 91.2 | 90.6 |
Tabla 7: Resultados predictivos específicos de conjunto de datos.
Rendimiento predictivo del marco propuesto de IA explicable en cuatro conjuntos de datos representativos de salud. La precisión, la exactitud, la memoria y la puntuación F1 se reportan como porcentajes (%) en los conjuntos de pruebas independientes. Valores más altos indican un mejor rendimiento en la clasificación.
Para evaluar el rendimiento predictivo, se evaluaron cuatro modelos de aprendizaje automático y aprendizaje profundo, a saber, Gradient Boosting, Random Forest, Convolutional Neural Network (CNN) y Multilayer Perceptron (MLP), en cuatro conjuntos de datos sanitarios representativos. El rendimiento del modelo se evaluó utilizando precisión, precisión, recuerdo, puntuación F1 y métricas ROC-AUC en conjuntos de datos de prueba independientes tras una división de prueba 70:15:15 entre tren y validación cruzada de cinco veces. Las mejoras en el rendimiento predictivo se determinaron comparando métricas de evaluación específicas del modelo entre condiciones idénticas de preprocesamiento y validación.
Para ilustrar cómo difieren los rendimientos de los modelos en varios métodos, la Figura 4 muestra pictóricamente las ventajas y desventajas de los modelos de ensamblaje, redes neuronales y aprendizaje profundo.

Figura 4: Rendimiento comparativo de modelos de aprendizaje automático y aprendizaje profundo en tareas de predicción sanitaria. (A) Comparación de precisión de modelos de Gradient Boosting, Random Forest, CNN y MLP en el conjunto de datos de pruebas. (B) Comparación de puntuaciones F1 de modelos de Gradient Boosting, Random Forest, CNN y MLP en el conjunto de datos de prueba. (C) Comparación precisa de modelos de Gradient Boosting, Random Forest, CNN y MLP en el conjunto de datos de prueba. (D) Recordar la comparación de los modelos de Gradient Boosting, Random Forest, CNN y MLP en el conjunto de datos de prueba. Valores más altos indican un mejor rendimiento predictivo. El aumento de gradiente logró el mayor rendimiento global en todas las métricas de evaluación, seguido por el Bosque Aleatorio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Interpretación de la Explicabilidad Rendimiento.
SHAP logró consistentemente las puntuaciones más altas de fidelidad y estabilidad entre los métodos evaluados de explicabilidad, lo que indica una mayor concordancia entre las explicaciones generadas y las predicciones del modelo subyacente. La CAL mostró una estabilidad comparativamente menor, lo que sugiere una mayor sensibilidad a perturbaciones locales y variabilidad muestral. Grad-CAM proporcionó explicaciones visualmente interpretables para modelos basados en imágenes, pero produjo valores de fidelidad ligeramente inferiores a los de SHAP. Estos hallazgos indican que la calidad de la explicación depende tanto de la técnica explicativa seleccionada como de la arquitectura del modelo predictivo subyacente.
Las técnicas de explicabilidad integradas en la cartera han sido evaluadas en términos de su rendimiento tanto cuantitativa como cualitativamente. Específicamente, los métodos de atribución de características han logrado descubrir la lógica interna del modelo de forma bastante consistente a través de diferentes conjuntos de datos.
Todos los métodos considerados en el estudio, SHAP, lograron la mayor fidelidad (0,92) y estabilidad (0,89) entre los métodos de explicabilidad evaluados. En pocas palabras, las explicaciones eran representaciones muy precisas de lo que el modelo realmente predijo. Los métodos de explicación local son una especie de ventana a través de la cual podemos ver una predicción específica y entender cuál fue la base que el modelo utilizó para la decisión.
El desempeño de interpretabilidad se evaluó utilizando puntuaciones de fidelidad, estabilidad, comprensibilidad y confianza del clínico obtenidas a partir de la evaluación centrada en el ser humano. Se compararon las explicaciones de SHAP, LIME y Grad-CAM utilizando conjuntos de datos idénticos y modelos entrenados. Las mejoras en la explicabilidad se evaluaron comparando métricas de calidad de explicación y valoraciones de los clínicos entre los métodos de habilidad explicativa evaluados. Las técnicas de visualización para modelos de aprendizaje profundo que trabajan con imágenes producen esencialmente mapas de calor, que identifican las regiones de las imágenes que tienen mayor relevancia para la predicción del modelo. Las distribuciones de importancia de las características y las comparaciones de rendimiento de explicabilidad entre diferentes métodos se muestran en la Figura 5.

Figura 5: Evaluación del rendimiento de la explicabilidad.La figura presenta el rendimiento de métodos de explicabilidad con la ayuda de métricas de fidelidad y estabilidad. SHAP lidera en fidelidad (0,92) y estabilidad (0,89), lo que refleja un buen acuerdo entre explicaciones y predicciones del modelo. LIME resulta ser la mejor herramienta para la interpretabilidad de ejemplos individuales. Por otro lado, Grad-CAM genera mapas de calor visuales utilizados principalmente en modelos de imagen, mostrando de forma general las regiones más importantes responsables de la predicción del modelo, lo cual, desde un punto de vista clínico, podría ser muy relevante. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Tras evaluar los modelos predictivos y las técnicas de interpretabilidad, se reveló que la correlación entre la precisión de un modelo y la fiabilidad de sus explicaciones es muy fuerte. De hecho, los mismos modelos que mostraron mejoras en la predicción también explicaban sus resultados con mayor estabilidad y consistencia cuando se aplicaban correctamente las técnicas de interpretabilidad. Se encontró que los modelos de conjunto eran los más interpretables cuando se acompañaban de métodos de atribución de características, mientras que los modelos de aprendizaje profundo se beneficiaban mejor de métodos explicables basados en visualización. El vínculo que une la precisión de la predicción y la fiabilidad de las explicaciones puede verse en la Figura 6, que detalla la dinámica conceptual entre modelo y explicabilidad.

Figura 6: Análisis comparativo de modelos y explicación de métodos de habilidad.El gráfico muestra una comparación detallada de la precisión y explica las medidas de capacidad de varios modelos. Consiste en un gráfico de dispersión que muestra la correlación entre precisión y estabilidad explicativa, una comparación tabular de los rendimientos y una matriz de idoneidad que describe los diferentes métodos de explicación SHAP, LIME y Grad-CAM, así como su efectividad con distintos tipos de modelos. El visual muestra claramente que los modelos de conjunto más SHAP ofrecen una gran interpretabilidad, mientras que los modelos de aprendizaje profundo se explican mediante técnicas de visualización. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La evaluación centrada en el ser humano confirmó la utilidad real del sistema sugerido en hospitales y otras instalaciones clínicas. Los profesionales médicos revisaron los resultados del modelo con y sin explicaciones. Mostrar los resultados con explicaciones llevó a un aumento considerable de la confianza y interpretabilidad de los usuarios; El valor medio del fideicomiso subió de 3,1 a 4,7 en la escala del 1 al 5. El aumento en la puntuación de confianza de 3,1 a 4,7 representa una mejora relativa aproximada del 51,6%. El acuerdo sustancial entre evaluadores (κ de Fleiss = 0,81) indica además una evaluación coherente por parte del clínico sobre la utilidad de la explicación. Estos hallazgos sugieren que los resultados de explicabilidad pueden mejorar la confianza de los usuarios y facilitar la interpretación de decisiones clínicas asistidas por IA. Los profesionales afirmaron una mejor comprensión de los resultados de los modelos y una mayor confianza en el juicio apoyado por IA sobre situaciones clínicas, lo que pone de manifiesto la importancia de la interpretabilidad en la implementación real de la atención sanitaria.
Además, verificamos la robustez de nuestro marco mediante análisis de ablación. La eliminación de características críticas que, mediante métodos de explicabilidad, se consideraban esenciales resultó en una gran pérdida de rendimiento predictivo. Así, el hallazgo refleja que las características no solo eran pertinentes, sino también significativas para la tarea predictiva. Además, los resultados de la explicación mostraban solo diferencias insignificantes cuando se explicaban diferentes muestras de entrada, mostrando así la estabilidad y fiabilidad de los métodos de explicabilidad.
Para comprobar la viabilidad de la tubería para su uso práctico, medimos su velocidad computacional. La introducción de técnicas de explicabilidad provocó cierto aumento en el tiempo computacional, especialmente al atribuir características y crear visualizaciones. No obstante, el tiempo total de ejecución seguía siendo factible y no demasiado largo. La Figura 7 muestra cómo el tiempo computacional se comparte entre las diferentes etapas de la canalización, como preprocesamiento, entrenamiento de modelos, generación de explicabilidades, evaluación y visualización.

Figura 7: Desglose del tiempo de ejecución de la pipeline. Este gráfico muestra cómo el tiempo computacional se divide entre las distintas fases de la cadena de IA explicable, como el preprocesamiento, el entrenamiento de modelos, la creación de habilidades, la evaluación y la visualización de la habilidad. Los datos revelan que la mayor parte de la línea temporal se ocupa en el entrenamiento del modelo, que luego es seguido por el procesamiento de habilidades explicativo. Por otro lado, el tiempo dedicado al preprocesamiento y a los informes es bastante mínimo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
También probamos la resistencia del marco propuesto mediante un análisis de ablación. Eliminar las características esenciales descubiertas mediante métodos de explicabilidad mostró una clara disminución en el rendimiento predictivo, lo que es una señal clara de que esas características no solo son relevantes, sino también bastante importantes. Además, las salidas de explicación fueron bastante estables incluso cuando hubo un ligero cambio en las muestras de entrada, lo que demuestra la consistencia y fiabilidad de las técnicas de explicabilidad.
En resumen, al combinar la medición del rendimiento predictivo, la explicabilidad y la validación centrada en el ser humano, se demostró que el marco propuesto era eficaz. El sistema no solo hacía predicciones muy precisas, sino que también seguía siendo muy interpretable y fácil de usar. Incorporar métodos de explicabilidad hizo que todo el proceso fuera transparente sin afectar al rendimiento del modelo. Las mejoras que vimos en la precisión y interpretabilidad de las predicciones no solo se lograron bajo un estricto control experimental, sino que también fueron estadísticamente significativas, un hecho que habla de la resistencia y autenticidad del método propuesto. Se realizaron comparaciones por pares entre modelos predictivos utilizando pruebas t emparejadas entre pliegues de validación cruzada. Se observaron diferencias estadísticamente significativas entre el Gradient Boosting y los modelos competidores (p < 0,05), lo que confirma la superioridad de la configuración propuesta.
Hallazgos generales.
En conjunto, los resultados demuestran que el rendimiento predictivo, la calidad de la explicación y la confianza del clínico pueden evaluarse dentro de un flujo de trabajo unificado y reproducible. El marco mantuvo un rendimiento consistente en múltiples conjuntos de datos sanitarios, al tiempo que apoyaba una interpretación transparente mediante explicaciones de SHAP, LIME y Grad-CAM. Sin embargo, los resultados deben interpretarse dentro del contexto de los conjuntos de datos seleccionados y configuraciones de validación, y sigue siendo necesaria una validación externa adicional antes de su despliegue en el mundo real.
DISPONIBILIDAD DE DATOS:
Obtuvimos los conjuntos de datos utilizados en la investigación actual de fuentes públicas, y pueden encontrarse en repositorios de datos reconocidos. Por ejemplo, los datos relacionados con el cáncer de mama y la diabetes se pueden descargar desde el Repositorio de Aprendizaje Automático de UCI en: https://archive.ics.uci.edu/ml/index.php
Se puede acceder al conjunto de datos de historial médico electrónico (MIMIC-III) a través de Physio Net en:
https://physionet.org/content/mimiciii/1.4/
Los datos de radiografía de tórax se extrajeron del Conjunto de Datos de Rayos X de Tórax del NIH y pueden encontrarse en: https://www.kaggle.com/datasets/nih-chest-xrays/data
Todos los conjuntos de datos que hemos explorado en este estudio están anonimizados y se hacen públicos a disposición pública. Los pasos de preprocesamiento, el modelo entrenado y los resultados de explicación de habilidades que produjimos durante la investigación están disponibles a través del autor correspondiente si se hace una solicitud razonable. El código fuente, los scripts de preprocesamiento, los archivos de configuración y los recursos de reproducibilidad se depositarán en un repositorio público una vez aceptados los manuscritos.