$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Avaliamos minuciosamente o componente explicativo de IA de todo o nosso pipeline, avaliando o quão bem ele previu em diferentes tipos de dados de saúde, incluindo tanto dados clínicos estruturados quanto imagens médicas. Os resultados indicaram desempenho preditivo consistente entre os conjuntos de dados avaliados. Entre os modelos testados, o modelo de gradiente de aumento alcançou a maior precisão com 97,4%, seguido pelo modelo de floresta aleatória com 94,2%. Métodos de aprendizado profundo aplicados a conjuntos de imagens alcançaram 91,3% de precisão, enquanto modelos de perceptron multicamada produziram resultados marginalmente menores, 90,8%. Isso sugere que modelos de aprendizado de máquina baseados em conjunto têm melhor desempenho em dados estruturados de saúde, enquanto arquiteturas de aprendizado profundo se destacam em tarefas de imagem. A Tabela 6 detalha várias métricas de desempenho para funções de previsão, incluindo precisão, precisão, recordação e pontuação F1, bem como métricas de explicabilidade como fidelidade e estabilidade. Chegamos a esses números de desempenho empregando a validação cruzada de cinco vezes e apresentando os resultados como valores médios (com intervalos de confiança de 95%). Intervalos de confiança não apenas indicam a incerteza do modelo, mas também tornam as comparações de desempenho preditivo mais confiáveis, levando em conta a memória do conjunto de dados e as diferenças nas arquiteturas dos modelos.
| Modelo | Precisão (%) | Precisão | Recall | F1-Score | Fidelidade | Estabilidade | IC 95% |
| Floresta Aleatória | 94.2 | 0.93 | 0.92 | 0.92 | 0.85 | 0.82 | 93.1–95.3 |
| XGBoost | 97.4 | 0.96 | 0.95 | 0.95 | 0.92 | 0.89 | 96.5–98.3 |
| MLP | 90.8 | 0.89 | 0.88 | 0.88 | 0.80 | 0.78 | 89.6–92.0 |
| CNN (Imagens) | 91.3 | 0.90 | 0.91 | 0.90 | 0.88 | 0.86 | 90.1–92.5 |
Tabela 6: Desempenho Comparativo de Modelos Preditivos e Métodos de Explicabilidade.
Esta tabela apresenta uma avaliação comparativa de modelos de aprendizado de máquina e deep learning usando métricas de desempenho preditivas, incluindo precisão, precisão, recordação, escore F1 e ROC-AUC. Além disso, métricas de explicabilidade como fidelidade, estabilidade, compreensibilidade e pontuações de confiança humana são relatadas para fornecer uma avaliação abrangente tanto da eficácia preditiva quanto da interpretabilidade.
Os resultados indicam que o Gradient Boosting alcançou o maior desempenho preditivo geral (97,4% de precisão), superando a Random Forest em 3,2 pontos percentuais e os modelos de deep learning em mais de 6 pontos percentuais. Essa observação sugere que métodos de aprendizagem baseados em conjunto foram particularmente eficazes para os conjuntos de dados estruturados de saúde incluídos neste estudo. A menor diferença de desempenho entre os modelos CNN e MLP indica que o aumento da complexidade do modelo sozinho não necessariamente se traduziu em desempenho preditivo superior sob as condições experimentais avaliadas.
Para mostrar a utilidade do nosso framework proposto em uma variedade de tarefas de análise de saúde, apresentamos os resultados de desempenho de previsão específicos de conjunto de dados na Tabela 7.
Análise Específica de Conjunto de Dados.
O desempenho variou entre os conjuntos de dados devido a diferenças na complexidade das características, tamanho da amostra, distribuição de classes e modalidade dos dados. O conjunto de dados Breast Cancer alcançou a maior precisão preditiva, provavelmente devido à separabilidade de características bem definida. Desempenho ligeiramente menor nos conjuntos de dados de raio-X de tórax MIMIC-III e NIH reflete a maior complexidade dos registros clínicos longitudinais e dos dados de imagem médica. Esses achados demonstram que o desempenho do framework é influenciado pelas características do conjunto de dados e pelo contexto clínico.
| Conjunto de dados | Precisão (%) | Precisão (%) | Revogação (%) | Pontuação F1 (%) |
| Câncer de Mama | 97.4 | 97.2 | 97.6 | 97.1 |
| Diabetes | 94.2 | 93.9 | 94.4 | 94 |
| MIMIC-III | 91.3 | 91 | 91.5 | 91.1 |
| Raio-X de Tórax do NIH | 90.8 | 90.4 | 91.2 | 90.6 |
Tabela 7: Resultados Preditivos de Performance Específicos de Conjunto de Dados.
Desempenho preditivo do framework proposto para IA explicável em quatro conjuntos de dados representativos de saúde. Precisão, precisão, recordação e pontuação F1 são reportados como porcentagens (%) nos conjuntos de teste independentes. Valores mais altos indicam melhor desempenho na classificação.
Para avaliar o desempenho preditivo, quatro modelos de aprendizado de máquina e deep learning, a saber, Gradient Boosting, Random Forest, Convolutional Neural Network (CNN) e Multilayer Perceptron (MLP), foram avaliados em quatro conjuntos de dados representativos de saúde. O desempenho do modelo foi avaliado usando precisão, precisão, recordação, escore F1 e métricas ROC-AUC em conjuntos de dados de teste independentes, após uma divisão de 70:15:15 entre trem e validação de teste e cinco vezes cruzada. Melhorias no desempenho preditivo foram determinadas comparando métricas de avaliação específicas do modelo em condições idênticas de pré-processamento e validação.
Para esclarecer como os desempenhos dos modelos diferem em vários métodos, a Figura 4 mostra as vantagens e desvantagens dos modelos de conjunto, redes neurais e deep learning de forma pictórica.

Figura 4: Desempenho comparativo de modelos de aprendizado de máquina e deep learning em tarefas de predição em saúde. (A) Comparação de precisão dos modelos de Gradient Boosting, Random Forest, CNN e MLP no conjunto de dados de teste. (B) Comparação de pontuação F1 dos modelos Gradient Boosting, Random Forest, CNN e MLP no conjunto de dados de teste. (C) Comparação precisa dos modelos Gradient Boosting, Random Forest, CNN e MLP no conjunto de dados de teste. (D) Lembre-se da comparação dos modelos Gradient Boosting, Random Forest, CNN e MLP no conjunto de dados de teste. Valores mais altos indicam melhor desempenho preditivo. Gradient Boosting alcançou o maior desempenho geral em todas as métricas de avaliação, seguido pelo Random Forest. Por favor, clique aqui para ver uma versão ampliada desta figura.
Interpretação do desempenho explicável.
O SHAP alcançou consistentemente as maiores pontuações de fidelidade e estabilidade entre os métodos de explicabilidade avaliados, indicando maior concordância entre as explicações geradas e as previsões do modelo subjacente. A CAL apresentou estabilidade comparativamente menor, sugerindo maior sensibilidade a perturbações locais e variabilidade amostral. O Grad-CAM forneceu explicações visualmente interpretáveis para modelos baseados em imagem, mas produziu valores de fidelidade ligeiramente inferiores aos do SHAP. Esses achados indicam que a qualidade da explicação depende tanto da técnica de explicação selecionada quanto da arquitetura do modelo preditivo subjacente.
As técnicas de explicabilidade integradas ao pipeline foram avaliadas em termos de desempenho quantitativa e qualitativamente. Especificamente, métodos de atribuição de características conseguiram revelar a lógica interna do modelo de forma bastante consistente entre diferentes conjuntos de dados.
Todos os métodos considerados no estudo, SHAP, alcançaram a maior fidelidade (0,92) e estabilidade (0,89) entre os métodos de explicabilidade avaliados. Simplificando, as explicações eram representações muito precisas do que o modelo realmente previa. Métodos de explicação local são uma espécie de janela através da qual podemos ver uma previsão específica e entender qual o modelo usou como base para a decisão.
O desempenho da interpretabilidade foi avaliado usando escores de fidelidade, estabilidade, compreensibilidade e confiança do clínico obtidos a partir da avaliação centrada no ser humano. Explicações SHAP, LIME e Grad-CAM foram comparadas usando conjuntos de dados idênticos e modelos treinados. As melhorias na explicabilidade foram avaliadas comparando métricas de qualidade da explicação e avaliações dos clínicos entre os métodos de explicação avaliados. Técnicas de visualização para modelos de deep learning que trabalham com imagens produzem essencialmente mapas de calor, que identificam as regiões das imagens que têm maior relevância para a previsão do modelo. Distribuições de importância das características e comparações de desempenho de explicabilidade entre diferentes métodos são mostradas na Figura 5.

Figura 5: Avaliação de Desempenho da Explicabilidade.A figura apresenta o desempenho dos métodos de explicabilidade com a ajuda de métricas de fidelidade e estabilidade. O SHAP lidera em fidelidade (0,92) e estabilidade (0,89), o que reflete boa concordância entre explicações e previsões do modelo. O LIME se destaca como a melhor ferramenta para a interpretabilidade de exemplos individuais. Por outro lado, o Grad-CAM produz mapas de calor visuais usados principalmente em modelos de imagem, mostrando grosseiramente as regiões mais importantes responsáveis pela previsão do modelo, o que, do ponto de vista clínico, pode ser muito relevante. Por favor, clique aqui para ver uma versão ampliada desta figura.
Após avaliar os modelos preditivos e as técnicas de interpretabilidade, foi revelado que a correlação entre a precisão de um modelo e a confiabilidade de suas explicações é muito forte. Na verdade, os mesmos modelos que mostraram melhorias na previsão também explicavam seus resultados com mais estabilidade e consistência quando as técnicas de interpretabilidade eram devidamente aplicadas. Modelos em conjunto mostraram-se os mais interpretáveis quando acompanhados por métodos de atribuição de características, enquanto modelos de aprendizado profundo foram melhor atendidos por métodos explicáveis baseados em visualização. A ligação que une a precisão da previsão e a confiabilidade das explicações pode ser vista na Figura 6, que detalha a dinâmica conceitual entre modelo e explicabilidade.

Figura 6: Análise comparativa de modelos e explicação dos métodos de habilidade.O gráfico mostra uma comparação detalhada da precisão e explica as medidas de habilidade de vários modelos. Ele compreende um gráfico de dispersão que mostra a correlação entre precisão e estabilidade de explicação, uma comparação tabular de desempenhos e uma matriz de adequação que delineia os diferentes métodos de explicação SHAP, LIME e Grad-CAM, e sua eficácia com diferentes tipos de modelos. O visual mostra claramente que os modelos de conjunto mais o SHAP oferecem ótima interpretabilidade, enquanto modelos de aprendizado profundo são explicáveis por meio de técnicas de visualização. Por favor, clique aqui para ver uma versão ampliada desta figura.
A avaliação centrada no ser humano confirmou a utilidade prática do sistema sugerido em hospitais e outras instalações clínicas. Profissionais de saúde revisaram os resultados dos modelos com e sem explicações. Mostrar os resultados com explicações levou a um aumento considerável na confiança e interpretabilidade dos usuários; O valor médio do trust subiu de 3,1 para 4,7 na escala de 1 a 5. O aumento no escore de confiança de 3,1 para 4,7 representa uma melhora relativa aproximada de 51,6%. O acordo substancial entre avaliadores (κ de Fleiss = 0,81) indica ainda uma avaliação consistente dos clínicos sobre a utilidade da explicação. Esses achados sugerem que os resultados de explicabilidade podem aumentar a confiança dos usuários e facilitar a interpretação de decisões clínicas assistidas por IA. Profissionais relataram melhor compreensão dos resultados dos modelos e maior confiança no julgamento apoiado por IA sobre situações clínicas, o que aponta para a importância da interpretabilidade na implementação real da saúde.
Verificamos ainda a robustez do nosso framework com análise de ablação. A remoção de características críticas que, por meio de métodos de explicabilidade, eram consideradas essenciais resultou em uma grande perda de desempenho de previsão. Assim, a constatação reflete que as características não eram apenas pertinentes, mas também significativas para a tarefa preditiva. Além disso, os resultados de explicação continuavam mostrando diferenças apenas desprezíveis quando diferentes amostras de entrada eram explicadas, mostrando assim a estabilidade e confiabilidade dos métodos de explicabilidade.
Para verificar a viabilidade do pipeline para uso prático, medimos sua velocidade computacional. A introdução de técnicas de explicabilidade causou algum aumento no tempo computacional, especialmente ao atribuir características e criar visualizações. Ainda assim, o tempo total de execução ainda era viável e não muito longo. A Figura 7 mostra como o tempo computacional é compartilhado entre diferentes etapas do pipeline, como pré-processamento, treinamento de modelos, geração de explicabilidade, avaliação e visualização.

Figura 7: Divisão do tempo de execução do pipeline. Este gráfico mostra como o tempo computacional é dividido entre várias fases do pipeline explicável de IA, como pré-processamento, treinamento de modelos, criação de habilidades, avaliação e visualização de habilidades. Os dados revelam que a maior parte da linha do tempo é ocupada pelo treinamento do modelo, que é seguido pelo processamento de habilidade explicativa. Por outro lado, o tempo gasto em pré-processamento e relatórios é bem mínimo. Por favor, clique aqui para ver uma versão ampliada desta figura.
Também testamos a força do framework proposto por meio de uma análise de ablação. Remover as características essenciais descobertas por meio de métodos de explicabilidade mostrou uma clara diminuição no desempenho preditivo, o que é um sinal claro de que essas características não são apenas relevantes, mas também bastante importantes. Além disso, as saídas explicativas eram bastante estáveis mesmo quando havia uma leve mudança nas amostras de entrada, o que é prova da consistência e confiabilidade das técnicas de explicabilidade.
Em resumo, ao combinar a medição de desempenho preditivo, explicabilidade e validação focada no ser humano, foi demonstrado que o framework proposto era eficaz. O sistema não só fazia previsões muito precisas, como também permanecia altamente interpretável e fácil de usar. A introdução de métodos de explicabilidade tornou todo o processo transparente sem prejudicar o desempenho do modelo. As melhorias que vimos na precisão e interpretabilidade das previsões não foram apenas feitas sob controle experimental rigoroso, mas também foram estatisticamente significativas, fato que reflete a resistência e a autenticidade do método proposto. Comparações par a par entre modelos preditivos foram realizadas usando testes t pareados em dobras de validação cruzada. Diferenças estatisticamente significativas foram observadas entre o Gradient Boosting e os modelos concorrentes (p < 0,05), confirmando a superioridade da configuração proposta.
Resultados gerais.
Coletivamente, os resultados demonstram que desempenho preditivo, qualidade da explicação e confiança dos profissionais podem ser avaliados dentro de um fluxo de trabalho unificado e reproduzível. A estrutura manteve desempenho consistente em múltiplos conjuntos de dados de saúde, ao mesmo tempo em que apoia interpretação transparente por meio de explicações SHAP, LIME e Grad-CAM. No entanto, os achados devem ser interpretados dentro do contexto dos conjuntos de dados selecionados e configurações de validação, e validação externa adicional permanece necessária antes da implantação no mundo real.
DISPONIBILIDADE DE DADOS:
Obtivemos os conjuntos de dados usados na pesquisa atual de fontes públicas, e eles podem ser encontrados em repositórios de dados bem conhecidos. Por exemplo, os dados relacionados ao câncer de mama e diabetes podem ser baixados do Repositório de Aprendizado de Máquina da UCI em: https://archive.ics.uci.edu/ml/index.php
É possível obter o conjunto de dados de prontuários eletrônicos de saúde (MIMIC-III) via Physio Net em:
https://physionet.org/content/mimiciii/1.4/
Os dados de raio-X do tórax foram extraídos do Conjunto de Dados de Raios X de Tórax do NIH e podem ser encontrados em: https://www.kaggle.com/datasets/nih-chest-xrays/data
Todos os conjuntos de dados que exploramos neste estudo são anonimizados e disponibilizados publicamente. As etapas de pré-processamento, o modelo treinado e os resultados explicativos de habilidades que produzimos durante a pesquisa estão disponíveis pelo autor correspondente, caso haja uma solicitação razoável. Código-fonte, scripts de pré-processamento, arquivos de configuração e recursos de reprodutibilidade serão depositados em um repositório público após a aceitação do manuscrito.