Artigo de investigação

Um Protocolo Reproduzível para Desenvolver e Avaliar Frameworks de Inteligência Artificial Explicáveis em Análise de Saúde

DOI:

10.3791/71999

31 de julho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aqui, apresentamos um protocolo reprodutível para desenvolver e avaliar modelos explicáveis de inteligência artificial para análises em saúde. O fluxo de trabalho integra pré-processamento de dados, modelagem preditiva, explicabilidade baseada em SHAP, LIME- e Grad-CAM, avaliação quantitativa e validação centrada no ser humano para apoiar a tomada de decisão clínica transparente e confiável.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A Inteligência Artificial Explicável (XAI) é cada vez mais reconhecida como uma ferramenta indispensável para construir sistemas de IA confiáveis na saúde, onde a transparência e a capacidade de explicar decisões são componentes essenciais da tomada de decisão clínica. Esta publicação apresenta uma abordagem experimental reprodutível para desenvolver e avaliar sistemas de IA explicáveis para análises em saúde. O pipeline desenvolvido integra as etapas de pré-processamento de dados, modelagem preditiva, geração de interpretação e avaliação em um fluxo de trabalho contínuo que pode ser aplicado tanto a dados clínicos estruturados quanto a conjuntos de dados de imagem médica. Modelos de aprendizado de máquina em conjunto demonstraram forte desempenho preditivo em conjuntos de dados tabulares estruturados, enquanto modelos de aprendizado profundo são eficazes para aprender padrões complexos em dados de imagem médica. Técnicas como SHAP, LIME e Grad-CAM são explicações globais e locais que facilitam a interpretação de modelos. Muito útil. A avaliação quantitativa do framework abrange muitos tipos diferentes de métricas, como precisão, exatidão, recordação, pontuação F1, ROC-AUC, métricas de explicação, fidelidade e estabilidade. Os resultados indicam que, quando as condições experimentais são controladas, a estrutura demonstrou melhor desempenho preditivo e qualidade de explicação sob as condições experimentais avaliadas. Como um documento guiado por protocolo, este trabalho apoia a reprodutibilidade e escalabilidade, a implementação persistente por outros seres vivos. Esse modelo de IA transparente e compreensível é a base sobre a qual o suporte à tomada de decisão clínica e os sistemas de análise em saúde ganham confiança e uso em larga escala.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A inteligência artificial (IA) tornou-se um componente importante da saúde moderna ao apoiar o diagnóstico de doenças, prognóstico, estratificação de riscos, análise de imagens médicas e tomada de decisãoclínica. Avanços em aprendizado de máquina e deep learning permitiram que sistemas de saúde processassem grandes volumes de dados estruturados e não estruturados, frequentemente alcançando desempenho preditivo comparável ou superior às abordagens estatísticasconvencionais 2. Apesar desses avanços, muitos modelos de IA operam como sistemas complexos de caixa-preta, dificultando para clínicos e atores da saúde entenderem como as previsõessão geradas 3. Essa falta de transparência pode limitar a confiança, a adoção e a responsabilidade em ambientes de saúde de alto risco 4,5.

A inteligência artificial explicável (XAI) surgiu como uma abordagem promissora para melhorar a transparência e a interpretabilidade dos modelos de aprendizadode máquina 6. Técnicas de explicação amplamente utilizadas, incluindo SHAP (explicações aditivas de Shapley), LIME (explicações locais interpretáveis ao modelo) e mapeamento de ativação de classes ponderado por gradiente (Grad-CAM), fornecem insights sobre o comportamento do modelo por meio de atribuição de características e mecanismos de explicaçãovisual 7,8,9. Esses métodos têm sido cada vez mais aplicados a aplicações de saúde para apoiar interpretação clínica, auditoria de modelos e suporte à decisão10,11. No entanto, a explicabilidade por si só não garante confiabilidade, reprodutibilidade ou utilidade clínica. Estudos recentes destacaram desafios relacionados à instabilidade da explicação, sensibilidade a perturbações, validação limitada pelos clínicos e inconsistências entre os resultados das explicações e o raciocínio verdadeiro do modelo 12,13,14,15.

Além dos desafios de explicabilidade, a reprodutibilidade continua sendo uma preocupação significativa na pesquisa em aprendizado de máquina em saúde 16,17,18. Muitos estudos publicados fornecem informações limitadas sobre procedimentos de pré-processamento, ambientes de software, configurações de hiperparâmetros, estratégias de validação e fluxos de trabalho de implementação, tornando a replicação independente difícil 19,20,21. Além disso, estudos de IA em saúde frequentemente focam no desempenho preditivo, ao mesmo tempo em que fornecem orientações limitadas sobre avaliação de qualidade de explicação, avaliação centrada no clínico e considerações práticasde implementação 22. Essas limitações podem dificultar a tradução de sistemas de IA explicáveis de ambientes de pesquisa para ambientes reais de saúde 23,24,25,26,27.

Os fluxos de trabalho atuais de XAI em saúde frequentemente avaliam técnicas de explicação individual ou modelos preditivos isoladamente e raramente fornecem protocolos padronizados que integrem preparação de dados, modelagem preditiva, avaliação de explicabilidade, avaliação centrada no ser humano e recursos de reprodutibilidade 28,29,30,31. Consequentemente, pesquisadores e profissionais podem enfrentar dificuldades ao reproduzir fluxos de trabalho, comparar métodos explicativos ou avaliar a utilidade prática de sistemas de IA explicáveis em diferentes conjuntos de dados e domínios de aplicação em saúde. Portanto, é necessário um protocolo abrangente e reproduzível para facilitar a implementação, avaliação e relatórios consistentes dos fluxos de trabalho explicáveis de IAem saúde 32,33,34,35.

Aqui, apresentamos um protocolo reprodutível para desenvolver, avaliar e interpretar sistemas de inteligência artificial explicáveis em análises de saúde em áreas. O protocolo integra pré-processamento de dados, modelagem preditiva, avaliação de explicabilidade usando SHAP, LIME e Grad-CAM, avaliação centrada no clínico, procedimentos de validação e recursos de reprodutibilidade dentro de um fluxo de trabalho unificado. O objetivo é fornecer uma estrutura padronizada que apoie o desenvolvimento transparente de modelos, avaliação da qualidade da explicação e implementação reprodutível em diversos conjuntos de dados de saúde36, 37, 38, 39. A contribuição metodológica deste trabalho está na integração de análises preditivas, avaliação de explicabilidade, validação por clínicos e práticas de reprodutibilidade em um único protocolo adequado para pesquisa, educação e estudos orientados à implantação em IAem saúde 40,41,42,43.

A principal contribuição deste trabalho não é o desenvolvimento de um novo algoritmo de explicabilidade.

Em vez disso, oferece um protocolo padronizado, reproduzível e validado experimentalmente que integra modelagem preditiva, avaliação de explicabilidade, visualização, avaliação e interpretação centrada no ser humano em um fluxo de trabalho unificado, adequado para análise de dados em saúde e disseminação de protocolos baseados em JoVE. O objetivo principal deste trabalho não é introduzir um algoritmo preditivo inovador, mas fornecer um protocolo padronizado, reproduzível e validado experimentalmente para implementar fluxos de trabalho de inteligência artificial explicáveis em análises de saúde. O protocolo integra pré-processamento de dados, modelagem preditiva, avaliação de explicabilidade, avaliação centrada no clínico e recursos de reprodutibilidade em um arcabouço unificado adequado para adoção, replicação e disseminação educacional.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos os conjuntos de dados utilizados neste estudo foram obtidos de repositórios públicos e totalmente anonimizados, incluindo o Repositório de Aprendizado de Máquina UCI, o banco de dados PhysioNet MIMIC-III e os conjuntos de dados de raio-X do tórax do NIH. Nenhuma informação identificável do paciente foi acessada. O estudo cumpriu as diretrizes institucionais de ética em pesquisa para análise secundária de dados públicos e desidentificados. Não foi necessária aprovação formal do Conselho de Revisão Institucional porque nenhum participante humano foi recrutado diretamente e nenhuma informação de saúde protegida foi utilizada.

1. Visão geral dos Marcos Experimentais

  1. Desenvolver um pipeline de inteligência artificial (XAI) reproduzível e explicável para análises transparentes em saúde. Organize o fluxo de trabalho em Camada de Dados, Camada de Pré-processamento, Camada de Modelagem, Camada de Explicabilidade, Camada de Avaliação e Camada de Visualização.
  2. Integre esses módulos em um fluxo de trabalho unificado capaz de processar dados clínicos estruturados, prontuários eletrônicos e conjuntos de dados de imagens médicas.
  3. Garanta que cada módulo contribua para a reprodutibilidade, interpretabilidade, escalabilidade e execução experimental padronizada.
  4. Projete a arquitetura modular para suportar fluxo contínuo de dados e garantir que cada etapa do pipeline contribua para a reprodutibilidade, interpretabilidade e escalabilidade ao longo do fluxo de trabalho experimental.

2. Ambiente Computacional e Configuração do Sistema

  1. Instale as dependências de software necessárias antes de executar o fluxo de trabalho, abrindo um terminal de linha de comando e executando o seguinte comando:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Verifique a instalação bem-sucedida de todos os pacotes de software e confirme a compatibilidade com as versões listadas na Tabela de Materiais antes de prosseguir com o pré-processamento de dados e o desenvolvimento do modelo.
  3. Use Python 3.11 como o principal ambiente de programação. Instale e configure o NumPy 1.26 e o Pandas 2.1 para tarefas de manipulação de dados e engenharia de recursos. Instale o Scikit-learn 1.5 para desenvolvimento e avaliação de modelos de aprendizado de máquina.
  4. Instale o TensorFlow 2.15 para treinamento e inferência de modelos de aprendizado profundo. Instale o SHAP 0.46 e o LIME 0.2.0 para análise de explicabilidade. Instale o OpenCV 4.10 para tarefas de processamento de imagem. Instale o Matplotlib 3.9 e o Seaborn 0.13 para visualização de dados e relatórios de resultados. Consulte a Tabela de Materiais para as especificações completas de software e detalhes de implementação necessários para reprodutibilidade.
  5. Configure o ambiente computacional usando uma estação de trabalho equipada com processador multi-core, aceleração de unidades de processamento gráfico (GPU) e recursos de memória suficientes para acomodar grandes conjuntos de dados de saúde e cargas de trabalho de aprendizado profundo.
  6. Estabeleça sementes aleatórias fixas para particionamento de dados, inicialização do modelo e procedimentos de treinamento para garantir reprodutibilidade em execuções experimentais. Permitir mecanismos de registro para registrar operações de pré-processamento de dados, configurações de modelos, configurações de hiperparâmetros, procedimentos de treinamento e resultados de avaliação ao longo do fluxo de trabalho.
  7. Configure as arquiteturas dos modelos, parâmetros de otimização, taxas de aprendizado, tamanhos de lote, configurações de treinamento e valores de hiperparâmetros de acordo com as especificações resumidas na Tabela 1. Siga essas configurações durante os experimentos de replicação para garantir consistência com os resultados relatados.
  8. Saída Esperada - Um ambiente computacional totalmente configurado e reproduzível com todos os pacotes de software necessários, recursos de hardware, mecanismos de registro e configurações de modelo disponíveis para pré-processamento de dados subsequentes, desenvolvimento de modelos, análise de explicabilidade e procedimentos de avaliação.
ComponenteParâmetroValorDescrição
Floresta Aleatórian_estimators100Número de árvores
Floresta Aleatóriamax_depthNenhumProfundidade da árvore
XGBoostlearning_rate0.01Taxa de aprendizado
XGBoostn_estimators100Munição de reforço
CNNÉpocas25Épocas de treinamento
CNNbatch_size32Tamanho do lote
CNNotimizadorAdamAlgoritmo de otimização
MLPhidden_layers2Número de camadas ocultas
MLPAtivaçãoReLUFunção de ativação
Geraltrain_split70%Razão de dados de treinamento
Geralvalidation_split15%Razão de validação
Geraltest_split15%Razão de testes

Tabela 1: Detalhes da Implementação e Configuração dos Hiperparâmetros.

Esta tabela resume o ambiente computacional, bibliotecas de software, configurações de modelos de aprendizado de máquina e deep learning, configurações de otimização, taxas de aprendizado, tamanhos de lote, parâmetros de treinamento e valores de hiperparâmetros usados durante toda a avaliação experimental do framework de IA explicável proposto.

3. Preparação e Pré-processamento de Conjuntos de Dados

  1. Selecionar conjuntos de dados de saúde públicos disponíveis para garantir transparência e reprodutibilidade do fluxo de trabalho experimental.;
  2. Use quatro cenários representativos de saúde para validar o quadro proposto: (i) diagnóstico de câncer de mama usando o Wisconsin Breast Cancer Dataset, (ii) predição de risco de diabetes usando o Pima Indians Diabetes Dataset, (iii) previsão de resultados clínicos usando registros eletrônicos de saúde MIMIC-III, e (iv) classificação de doenças torácicas usando o NIH Chest X-ray Dataset. Escolha esses conjuntos de dados para avaliar a estrutura em registros clínicos estruturados, prontuários eletrônicos longitudinais e modalidades de imagem médica comumente usadas em sistemas de suporte à decisão em saúde.
  3. Importe cada conjunto de dados para o ambiente Python e separe os registros em características de entrada e variáveis de alvo. Organizar dados clínicos estruturados para tarefas de predição de doenças, prontuários eletrônicos de saúde para análise longitudinal de desfechos e conjuntos de dados de imagens médicas para tarefas de classificação diagnóstica. Verifique a integridade de cada conjunto de dados antes de prosseguir com as operações de pré-processamento.
  4. Identifique e corriga valores ausentes usando técnicas de imputação apropriadas. Padronize características numéricas por meio de procedimentos de escalonamento e normalização de características para garantir comparabilidade entre variáveis.
  5. Codificar variáveis categóricas usando métodos de codificação adequados baseados nas características do conjunto de dados. Realize a seleção de características usando análise de correlação e medidas de importância de características baseadas em modelos para identificar as variáveis mais relevantes e reduzir a dimensionalidade dos dados.
  6. Redimensione todas as imagens médicas para 224, 224 pixels antes do treinamento do modelo. Normalize os valores de intensidade dos pixels de acordo com os requisitos da arquitetura de deep learning selecionada. Aplicar técnicas de aumento de dados, incluindo rotação de imagens e inversão horizontal, para melhorar a generalização dos modelos e reduzir o sobreajuste. Verifique a qualidade da imagem e garanta a consistência das dimensões da imagem em todo o conjunto de dados.
  7. Avalie a integridade dos dados avaliando a completude, consistência e alinhamento dos rótulos de características. Verifique se todos os registros estão corretamente atribuídos às suas respectivas classes-alvo. Revise as características do conjunto de dados, incluindo tamanho da amostra, contagem de características e modalidade dos dados, conforme resumido na Tabela 2.
  8. Implementar procedimentos específicos de validação para cada conjunto de dados para garantir rigor metodológico e reprodutibilidade. Registre o tamanho da amostra, distribuição de classes, estratégia de divisão train-validation-test, medidas de prevenção de vazamento, procedimentos de otimização de hiperparâmetros, design de validação cruzada e protocolo de teste externo para cada conjunto de dados. Resuma esses procedimentos de validação na Tabela 3.
  9. Realize verificações de controle de qualidade de pré-processamento avaliando o tratamento de valores faltantes, remoção de outliers, escalonamento de características, codificação categórica, preservação de distribuição de classes e procedimentos de particionamento de conjuntos de dados. Verifique se as operações de pré-processamento são aplicadas de forma consistente em todos os conjuntos de dados.
  10. Confirme a ausência de vazamento substancial de dados durante o particionamento do conjunto de dados. Revise os resultados da validação do pré-processamento apresentados na Figura 1 para garantir que conjuntos de dados padronizados tenham sido gerados para análises subsequentes de aprendizado de máquina e explicabilidade.
  11. Saída Esperada – Gerar conjuntos de dados limpos e padronizados com valores ausentes devidamente endereçados, variáveis categóricas codificadas, recursos numéricos normalizados e registros particionados em subconjuntos de treinamento, validação e teste. Certifique-se de que as características do conjunto de dados, distribuições de classes e procedimentos de validação correspondam aos relatados nas Tabelas 2 e Tablas 3, e confirme a validação bem-sucedida do pré-processamento, conforme ilustrado na Figura 1.
Conjunto de dadosTipoSamplesCaracterísticasAlvo
Câncer de MamaTabular56930Benigno/Maligno
DiabetesTabular7688Desfecho do Diabetes
MIMIC-IIIEHR~60.000Variáveis clínicasMortalidade
Raio-X de tóraxImagem~112.000ImagensEtiquetas de Doenças

Tabela 2: Características do Conjunto de Dados e Casos de Uso em Saúde.

Esta tabela fornece um resumo dos conjuntos de dados de dados de saúde usados no estudo, incluindo tipo de conjunto, número de amostras, contagem de características, variáveis-alvo, domínio de aplicação em saúde e casos de uso clínicos associados. Os conjuntos de dados abrangem prontuários clínicos estruturados, registros eletrônicos de saúde e dados de imagem médica para demonstrar a aplicabilidade do framework em diversos cenários de análise de saúde.

Conjunto de dadosTamanho da AmostraDistribuição de classesEstratégia DivididaPrevenção de VazamentosBusca por HiperparâmetrosValidação cruzadaTeste Externo
Câncer de Mama (UCI, Wisconsin)569357 Benigno / 212 Maligno70/15/15Pré-processamento exclusivo de trensBusca em GradeCV estratificado de 5 vezesConjunto Independente de Resistência
Diabetes dos índios Pima768500 Não Diabéticos / 268 Diabéticos70/15/15Pré-processamento exclusivo de trensBusca em GradeCV estratificado de 5 vezesConjunto Independente de Resistência
MIMIC-III EHR5274Coortes estratificadas por resultado70/15/15 Nível de pacienteSeparação em nível de pacienteBusca AleatóriaCV em nível de paciente 5 vezesConjunto Independente de Resistência
Raio-X de Tórax do NIH112120Pneumonia/Estratificado normal70/15/15Separação em nível de imagemBusca AleatóriaCV estratificado de 5 vezesConjunto Independente de Resistência

Tabela 3: Validação em Nível de Conjunto de Dados e Desenho Experimental.

Esta tabela resume a metodologia de validação empregada para cada conjunto de dados, incluindo tamanho da amostra, distribuição de classes, estratégia de divisão train-validation-test, procedimentos de prevenção de vazamentos, métodos de otimização de hiperparâmetros, design de validação cruzada e protocolos externos de teste. Essas medidas foram implementadas para garantir rigor metodológico, reprodutibilidade e avaliação imparcial do modelo.

figure-protocol-1
Figura 1: Validação do Pipeline de Pré-processamento de Dados.
Resultados de validação para operações de pré-processamento chave realizadas antes do desenvolvimento do modelo. (A) Análise de valor perdido em recursos representativos de saúde. (B) Distribuição de uma variável numérica antes e depois do tratamento de outliers. (C) Validação de escalonamento de características usando padronização. (D) Validação de codificação categórica. (E) Distribuição de classes após o pré-processamento. (F) Validação da partição de dados de treino-validação-teste. Esses resultados confirmam o pré-processamento e a preparação bem-sucedidos dos conjuntos de dados para modelagem preditiva e análise de explicabilidade. Por favor, clique aqui para ver uma versão ampliada desta figura.

4. Arquitetura do Sistema do Framework de IA Explicável

  1. Organize o framework usando uma arquitetura em camadas para facilitar o processamento modular, melhorar a transparência do fluxo de trabalho e apoiar a implementação reproduzível. Configure a Camada de Dados para receber e gerenciar conjuntos de dados brutos de saúde. Roteie todos os conjuntos de dados recebidos pela Camada de Dados antes de iniciar operações de pré-processamento.
  2. Realizar procedimentos de limpeza, transformação, normalização, engenharia de características e codificação de dados dentro da Camada de Pré-processamento. Certifique-se de que todas as operações de pré-processamento sejam concluídas antes do desenvolvimento do modelo.
  3. Desenvolver modelos preditivos dentro da Camada de Modelagem usando algoritmos de aprendizado de máquina e deep learning. Modelos de Train Gradient Boosting, Random Forest, Multilayer Perceptron (MLP) e Convolutional Neural Network (CNN) usando conjuntos de dados pré-processados e configurações otimizadas de hiperparâmetros.
  4. Aplique técnicas de explicabilidade dentro da Camada de Explicabilidade para interpretar as previsões do modelo. Gerar explicações de atribuição de características usando SHAP e LIME para conjuntos de dados estruturados. Gerar mapas de calor Grad-CAM para modelos baseados em imagem para visualizar regiões que contribuem para as previsões do modelo.
  5. Avalie o desempenho preditivo e explicável dentro da Camada de Avaliação. Calcule precisão, exatidão, recordação, escore F1, ROC-AUC, fidelidade, estabilidade e métricas de avaliação centradas no clínico. Registre todos os resultados das avaliações para análises e relatórios subsequentes.
  6. Gerar resultados visuais clinicamente interpretáveis dentro da Camada de Visualização. Crie gráficos de comparação de desempenho, visualizações de importância de características, gráficos resumo SHAP, explicações LIME, mapas de calor Grad-CAM e painéis de relatórios orientados para clínicos. Armazene todos os resultados visuais para inclusão no relatório experimental final.
  7. Revise a arquitetura completa do framework ilustrada na Figura 2 antes de prosseguir com a execução do fluxo de trabalho.
  8. Saída Esperada - Gerar modelos totalmente treinados de aprendizado de máquina e deep learning, incluindo arquiteturas Gradient Boosting, Random Forest, CNN e MLP. Armazene configurações de modelos, hiperparâmetros otimizados, logs de treinamento, arquivos de checkpoint, saídas de explicabilidade e artefatos de visualização para avaliação e análise de interpretabilidade subsequentes.

figure-protocol-2
Figura 2: Arquitetura do Sistema do Framework de IA Explicável para Análise de Serviços de Saúde. Por favor, clique aqui para ver uma versão maior desta figura.

5. Execução do Fluxo de Trabalho

  1. Adquirir conjuntos de dados de saúde de repositórios públicos e armazenar esses conjuntos em formatos estruturados adequados para aprendizado de máquina e análise de deep learning. Revise o fluxo de trabalho completo ilustrado na Figura 3 antes de iniciar o procedimento experimental.
  2. Realizar a limpeza e pré-processamento dos dados de acordo com os procedimentos descritos na Seção 3. Normalize variáveis numéricas usando métodos de escalonamento apropriados. Codificar variáveis categóricas usando técnicas de codificação adequadas. Identifique e impute valores ausentes usando estratégias de imputação específicas de cada conjunto de dados. Verifique a qualidade dos dados, o alinhamento dos rótulos de características e a completude do conjunto de dados antes de prosseguir com o desenvolvimento do modelo.
  3. Particione cada conjunto de dados em subconjuntos de treinamento, validação e teste para suportar a avaliação imparcial do modelo. Preservar as distribuições de classes durante o particionamento de conjuntos de dados e implementar medidas de prevenção de vazamentos quando aplicável. Reserve o subconjunto de testes exclusivamente para avaliação final do modelo.
  4. Treine modelos de aprendizado de máquina em conjuntos de dados estruturados usando algoritmos baseados em conjunto, incluindo Gradient Boosting e Random Forest. Treine modelos de aprendizado profundo em conjuntos de dados de imagem usando arquiteturas de Redes Neurais Convolucionais (CNN) capazes de aprender características espaciais de imagem. Atualize os parâmetros do modelo iterativamente durante o treinamento e monitore o desempenho da validação após cada época de treinamento. Aplique parada precoce quando o desempenho da validação se deteriorar ou não melhorar de acordo com os critérios pré-definidos de parada.
  5. Otimize os hiperparâmetros do modelo usando estratégias de busca sistemática, incluindo busca em grade e busca randomizada. Ajuste a taxa de aprendizado, número de estimadores, profundidade da árvore, tamanho do lote, número de épocas e outros parâmetros específicos do modelo de acordo com o desempenho da validação. Selecione o modelo final com base no desempenho preditivo e na capacidade de generalização entre conjuntos de dados de validação.
  6. Aplique métodos de explicabilidade após concluir o treinamento de modelo. Gerar explicações globais usando técnicas de atribuição de características para identificar variáveis que contribuem mais fortemente para as previsões do modelo. Gerar explicações locais para analisar casos individuais de previsão e avaliar o comportamento do modelo em nível amostral. Crie mapas de calor Grad-CAM para modelos de classificação de imagens para destacar regiões da imagem que contribuem para o resultado previsto. Armazene todos os resultados explicativos para análises e relatórios subsequentes.
  7. Avalie o desempenho preditivo usando precisão, precisão, recall, F1-score e área de características operacionais do receptor sob a curva (ROC-AUC). Avalie a qualidade da explicação usando métricas de fidelidade e estabilidade para avaliar a confiabilidade e consistência da explicação. Compare o desempenho dos modelos entre conjuntos de dados e métodos de explicabilidade para avaliar a robustez e a generalização do framework.
  8. Gerar resultados de visualização e relatórios analíticos para comunicar resultados de forma clinicamente interpretável. Crie gráficos de comparação de desempenho, gráficos de importância de características, visualizações resumidas do SHAP, resultados de explicação LIME, mapas de calor Grad-CAM e outras visualizações clinicamente relevantes. Revise todos os resultados visuais para garantir clareza e consistência antes de relatar.
  9. Documente todas as operações de pré-processamento, configurações de modelos, configurações de hiperparâmetros, procedimentos de explicabilidade, estratégias de validação e resultados de avaliação. Mantenha registros experimentais detalhados para facilitar a reprodutibilidade e a replicação independente do fluxo de trabalho. Verifique a consistência dos resultados ao longo de repetidas execuções experimentais e arquive todos os artefatos do fluxo de trabalho para referência futura.
  10. Saída Esperada - Gerar um modelo preditivo totalmente treinado com hiperparâmetros otimizados, pesos salvos do modelo, logs de treinamento, métricas de desempenho e resultados explicáveis, incluindo explicações SHAP, explicações LIME e heatmaps Grad-CAM. Armazene todos os artefatos do modelo, relatórios de avaliação e resultados de visualização para análise subsequente e avaliação de reprodutibilidade.

figure-protocol-3
Figura 3: Fluxo de Trabalho Completo a Ponta do Pipeline de IA Explicável. Por favor, clique aqui para ver uma versão maior desta figura.

6. Avaliação do Modelo e Avaliação de Explicabilidade

  1. Avalie o desempenho do modelo preditivo usando métricas padrão de classificação, incluindo precisão, precisão, recordação, pontuação F1 e área característica operacional do receptor sob a curva (ROC-AUC). Calcule a precisão para medir a correção geral da classificação.
  2. Calcule a precisão para avaliar a proporção de previsões positivas corretamente identificadas. Calcule a recordação para avaliar a capacidade do modelo de identificar casos positivos. Calcule a pontuação F1 para equilibrar precisão e recordação. Calcule o ROC-AUC para avaliar desempenho discriminativo em diferentes limiares de classificação.
  3. Aplique essas métricas de avaliação de forma consistente em todos os conjuntos de dados e arquiteturas de modelos para facilitar a comparação objetiva de desempenho. Registre todos os valores das métricas e armazene os resultados da avaliação para análise estatística e relatórios subsequentes.
  4. Avalie o desempenho da explicabilidade usando métricas de fidelidade e estabilidade. Calcule a fidelidade para determinar até que ponto as explicações geradas refletem com precisão as previsões do modelo e o comportamento de tomada de decisão.
  5. Calcule a estabilidade comparando explicações geradas a partir de amostras de entrada semelhantes e quantificando a consistência das saídas das explicações. Verifique se os valores de fidelidade e estabilidade atendem aos critérios de qualidade pré-definidos antes de interpretar as explicações do modelo.
  6. Compare o desempenho da explicabilidade entre saídas SHAP, LIME e Grad-CAM.
  7. Resultado Esperado - Gerar resultados quantitativos de avaliação, incluindo precisão, exatidão, recordação, pontuação F1, ROC-AUC, métricas de fidelidade e estabilidade. Produzir resultados explicáveis e visualizações adequados para relatórios científicos, avaliação de reprodutibilidade e interpretação clínica.

7. Avaliação Centrada no Ser Humano

  1. Recrute 12 profissionais de saúde, compostos por 6 médicos, 3 radiologistas e 3 analistas de dados clínicos. Selecione participantes com experiência prévia em tomada de decisão clínica, interpretação de imagens médicas, análises em saúde ou revisão de prontuários eletrônicos. Obtenha consentimento informado de todos os participantes antes de iniciar o procedimento de avaliação.
  2. Selecione aleatoriamente 100 casos dos conjuntos de dados de teste após a conclusão do treinamento do modelo e da análise de explicabilidade. Gerar duas condições de avaliação para cada caso:
    1. Saída apenas para previsão e
    2. previsão acompanhada de informações explicáveis. Randomize a ordem de apresentação dos casos e as condições de avaliação para minimizar o viés de apresentação e os efeitos de aprendizagem.
  3. Prepare formulários padronizados de avaliação contendo resultados de previsão, resultados explicativos e questionários de avaliação. Apresentar casos individualmente aos participantes usando uma interface de avaliação baseada em computador.
  4. Instrua os participantes a revisarem cada caso de forma independente, sem discutir as respostas com outros avaliadores. Permitir que os participantes completem todas as avaliações sob condições experimentais idênticas.
  5. Administrar um questionário em escala Likert de cinco pontos, adaptado de estudos publicados e explicáveis de avaliação de inteligência artificial. Instrua os participantes a avaliarem confiança, interpretabilidade e usabilidade para cada caso analisado. Registre as respostas do questionário eletronicamente e verifique a conclusão de todos os itens da pesquisa antes de prosseguir para a análise estatística.
  6. Meça indicadores objetivos de utilidade clínica durante o processo de avaliação. Registre o acordo de decisão comparando as decisões dos participantes com os rótulos de referência correspondentes ou resultados de verdade. Calcule o acordo de decisão como a porcentagem de decisões dos participantes que correspondem ao resultado de referência.
  7. Registre o tempo de revisão de cada caso medindo o intervalo entre a apresentação do caso e a submissão da resposta final. Calcule o tempo médio de revisão separadamente para condições apenas de previsão e previsão com explicação.
  8. Calcule as médias de confiança, interpretabilidade e usabilidade entre todos os participantes e casos de avaliação. Compare as pontuações obtidas sob condições apenas de previsão e previsão com explicação.
  9. Realize testes t pareados após a conclusão de todas as avaliações dos participantes para determinar se diferenças em confiança, interpretabilidade, usabilidade, acordo de decisão e tempo de revisão são estatisticamente significativas. Use um limiar de significância de p 0,05 para todas as comparações estatísticas.
  10. Calcule o Fleiss Kappa após coletar respostas de todos os participantes para avaliar a concordância entre avaliadores. Use as avaliações agregadas dos participantes para determinar a consistência das avaliações entre os revisores. Interprete os valores Fleiss Kappa de acordo com as diretrizes estabelecidas do acordo e registre as estatísticas resultantes do acordo.
  11. Resuma a demografia dos participantes, metodologia de avaliação, desenho do questionário, procedimentos de análise estatística, medidas de desempenho objetivo e resultados de concordância entre avaliadores na Tabela 4.
  12. Revise os resultados do modelo sob ambas as condições de avaliação e compare as respostas dos participantes entre as condições. Verifique se as explicações melhoram a confiança, a interpretabilidade e a usabilidade sem afetar negativamente a qualidade da decisão.
  13. Confirme a consistência das avaliações dos participantes usando a estatística calculada de Fleiss Kappa. Registre todos os resultados da avaliação para relatórios subsequentes e avaliações de reprodutibilidade.
  14. Resultado Esperado – Gerar escores de confiança dos clínicos, avaliações de interpretabilidade, avaliações de usabilidade, medidas de decisão e acordo, estatísticas de tempo de revisão, resultados de testes t pareados e estatísticas de concordância entre avaliadores. Produzir evidências quantitativas que descrevam a utilidade clínica, interpretabilidade e confiabilidade do arcabouço explicável de inteligência artificial.
ParâmetroValor
Especialistas12
Médicos6
Radiologistas3
Analistas de Dados Clínicos3
Casos Revisados100
Projeto de AvaliaçãoRandomizado (Apenas Previsão vs Previsão+Explicação)
Instrumento de LevantamentoEscala de Likert de 5 pontos
Avaliação de ConfiançaInterpretabilidade, Confiança, Usabilidade
Teste EstatísticoTeste t pareado (p 0,05)
Confiabilidade entre avaliadoresFleiss Kappa
Medidas ObjetivasAcordo de Decisão, Tempo de Revisão

Tabela 4: Protocolo de Avaliação Centrada no Ser Humano e Desenho de Avaliação do Clínico.

Esta tabela apresenta o arcabouço de avaliação do clínico usado para avaliar a interpretabilidade, confiabilidade e usabilidade do sistema de IA explicável. Informações sobre demografia dos participantes, metodologia de revisão de casos, desenho de pesquisas, procedimentos de análise estatística, avaliação de confiabilidade entre avaliadores e medidas de avaliação objetiva são resumidas.

8. Validação e Avaliação de Reprodutibilidade

  1. Realizar estudos de validação e ablação para avaliar a robustez e confiabilidade do framework proposto. Identifique características com altas pontuações de importância usando os métodos de explicabilidade selecionados. Remover características importantes incrementalmente e reeducar os modelos preditivos após cada etapa de remoção de características.
  2. Avalie o desempenho do modelo após cada experimento de ablação usando precisão, precisão, recordação, escore F1 e métricas ROC-AUC. Compare os valores de desempenho resultantes com o desempenho do modelo de referência para determinar a contribuição de características individuais para os resultados preditivos.
  3. Avalie a estabilidade da explicação gerando explicações para amostras de entrada semelhantes usando SHAP, LIME e Grad-CAM. Compare os resultados das explicações em avaliações repetidas e quantifique a consistência usando as métricas de estabilidade predefinidas. Verifique se as explicações permanecem estáveis sob pequenas variações de entrada e repetidas execuções experimentais.
  4. Registre todos os procedimentos experimentais durante todo o fluxo de trabalho. Documentos operações de pré-processamento de dados, procedimentos de particionamento de conjuntos de dados, arquiteturas de modelos, configurações de hiperparâmetros, configurações de treinamento, métodos de explicabilidade, estratégias de validação e métricas de avaliação. Armazene todos os parâmetros de configuração e resultados experimentais em um formato estruturado para facilitar a reprodutibilidade e a verificação independente.
  5. Revise todos os registros experimentais para garantir completude e consistência. Verifique se o fluxo de trabalho pode ser replicado usando os procedimentos documentados, arquivos de configuração e especificações de software. Manter uma estrutura de fluxo de trabalho modular para facilitar a adaptação do protocolo para estudos futuros e apoiar a conversão em um protocolo experimental baseado em vídeo, consistente com os requisitos metodológicos do JoVE.

9. Recursos de Reprodutibilidade

  1. Execute todos os experimentos usando sementes aleatórias fixas para garantir resultados reproduzíveis em repetidas sequências. Mantenha código-fonte, scripts de pré-processamento, arquivos de configuração, especificações do ambiente, parâmetros do modelo e scripts de visualização dentro de um repositório acessível publicamente.
  2. Forneça instruções detalhadas para aquisição de conjuntos de dados, pré-processamento, execução de experimentos, treinamento de modelos, geração de explicabilidade, procedimentos de validação e regeneração de todas as tabelas e figuras reportadas. Arquive todos os componentes do fluxo de trabalho necessários para replicação independente, incluindo especificações de software, fluxos de pré-processamento, arquivos de configuração, instruções de acesso ao conjunto de dados, checkpoints de modelos e ativos de visualização.
  3. Resuma os recursos de software, fluxos de trabalho de pré-processamento, arquivos de configuração, instruções de acesso ao conjunto de dados e ativos de reprodutibilidade usados em todo o framework na Tabela 5.
  4. Saída Esperada - Gerar um pacote experimental completo e reproduzível contendo scripts de pré-processamento, arquivos de configuração, modelos treinados, checkpoints de modelo, resultados explicativos, relatórios de validação, artefatos de visualização, especificações de software e documentação necessária para replicação e verificação independentes do framework proposto.
RecursoDescrição
Código-fonteScripts de implementação em Python para pré-processamento de dados, treinamento de modelos, explicabilidade e avaliação
Arquivo de Ambienterequirements.txt contendo dependências e versões de pacotes
Arquivos de configuraçãoConfigurações da arquitetura do modelo, hiperparâmetros e configurações experimentais
Sementes aleatórias fixasSemente = 42 usados para experimentos reprodutíveis
Instruções de Acesso ao Conjunto de DadosLinks e procedimentos para aquisição de conjuntos de dados de saúde pública
Scripts de pré-processamentoScripts para limpeza de dados, normalização, codificação e seleção de recursos
Scripts de Geração de FigurasEscritas para regenerar todas as figuras manuscritas
Scripts de Geração de TabelasScripts para reproduzir tabelas e métricas reportadas
Exemplos de EntradasConjuntos de dados de exemplo e arquivos de entrada
Exemplos de SaídasResultados de previsão, explicações e relatórios de avaliação

Tabela 5: Recursos de Reprodutibilidade e Ativos Experimentais.

Esta tabela resume os recursos fornecidos para suportar a reprodutibilidade experimental, incluindo código-fonte, scripts de pré-processamento, arquivos de configuração, especificações de ambiente, instruções de acesso ao conjunto de dados, configurações aleatórias de semente fixas, scripts de geração de figuras e arquivos de entrada/saída de exemplo necessários para reproduzir os resultados reportados.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Avaliamos minuciosamente o componente explicativo de IA de todo o nosso pipeline, avaliando o quão bem ele previu em diferentes tipos de dados de saúde, incluindo tanto dados clínicos estruturados quanto imagens médicas. Os resultados indicaram desempenho preditivo consistente entre os conjuntos de dados avaliados. Entre os modelos testados, o modelo de gradiente de aumento alcançou a maior precisão com 97,4%, seguido pelo modelo de floresta aleatória com 94,2%. Métodos de aprendizado profundo aplicados a conjuntos de imagens alcançaram 91,3% de precisão, enquanto modelos de perceptron multicamada produziram resultados marginalmente menores, 90,8%. Isso sugere que modelos de aprendizado de máquina baseados em conjunto têm melhor desempenho em dados estruturados de saúde, enquanto arquiteturas de aprendizado profundo se destacam em tarefas de imagem. A Tabela 6 detalha várias métricas de desempenho para funções de previsão, incluindo precisão, precisão, recordação e pontuação F1, bem como métricas de explicabilidade como fidelidade e estabilidade. Chegamos a esses números de desempenho empregando a validação cruzada de cinco vezes e apresentando os resultados como valores médios (com intervalos de confiança de 95%). Intervalos de confiança não apenas indicam a incerteza do modelo, mas também tornam as comparações de desempenho preditivo mais confiáveis, levando em conta a memória do conjunto de dados e as diferenças nas arquiteturas dos modelos.

ModeloPrecisão (%)PrecisãoRecallF1-ScoreFidelidadeEstabilidadeIC 95%
Floresta Aleatória94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN (Imagens)91.30.900.910.900.880.8690.1–92.5

Tabela 6: Desempenho Comparativo de Modelos Preditivos e Métodos de Explicabilidade.
Esta tabela apresenta uma avaliação comparativa de modelos de aprendizado de máquina e deep learning usando métricas de desempenho preditivas, incluindo precisão, precisão, recordação, escore F1 e ROC-AUC. Além disso, métricas de explicabilidade como fidelidade, estabilidade, compreensibilidade e pontuações de confiança humana são relatadas para fornecer uma avaliação abrangente tanto da eficácia preditiva quanto da interpretabilidade.

Os resultados indicam que o Gradient Boosting alcançou o maior desempenho preditivo geral (97,4% de precisão), superando a Random Forest em 3,2 pontos percentuais e os modelos de deep learning em mais de 6 pontos percentuais. Essa observação sugere que métodos de aprendizagem baseados em conjunto foram particularmente eficazes para os conjuntos de dados estruturados de saúde incluídos neste estudo. A menor diferença de desempenho entre os modelos CNN e MLP indica que o aumento da complexidade do modelo sozinho não necessariamente se traduziu em desempenho preditivo superior sob as condições experimentais avaliadas.
Para mostrar a utilidade do nosso framework proposto em uma variedade de tarefas de análise de saúde, apresentamos os resultados de desempenho de previsão específicos de conjunto de dados na Tabela 7.

Análise Específica de Conjunto de Dados.
O desempenho variou entre os conjuntos de dados devido a diferenças na complexidade das características, tamanho da amostra, distribuição de classes e modalidade dos dados. O conjunto de dados Breast Cancer alcançou a maior precisão preditiva, provavelmente devido à separabilidade de características bem definida. Desempenho ligeiramente menor nos conjuntos de dados de raio-X de tórax MIMIC-III e NIH reflete a maior complexidade dos registros clínicos longitudinais e dos dados de imagem médica. Esses achados demonstram que o desempenho do framework é influenciado pelas características do conjunto de dados e pelo contexto clínico.

Conjunto de dadosPrecisão (%)Precisão (%)Revogação (%)Pontuação F1 (%)
Câncer de Mama97.497.297.697.1
Diabetes94.293.994.494
MIMIC-III91.39191.591.1
Raio-X de Tórax do NIH90.890.491.290.6

Tabela 7: Resultados Preditivos de Performance Específicos de Conjunto de Dados.
Desempenho preditivo do framework proposto para IA explicável em quatro conjuntos de dados representativos de saúde. Precisão, precisão, recordação e pontuação F1 são reportados como porcentagens (%) nos conjuntos de teste independentes. Valores mais altos indicam melhor desempenho na classificação.

Para avaliar o desempenho preditivo, quatro modelos de aprendizado de máquina e deep learning, a saber, Gradient Boosting, Random Forest, Convolutional Neural Network (CNN) e Multilayer Perceptron (MLP), foram avaliados em quatro conjuntos de dados representativos de saúde. O desempenho do modelo foi avaliado usando precisão, precisão, recordação, escore F1 e métricas ROC-AUC em conjuntos de dados de teste independentes, após uma divisão de 70:15:15 entre trem e validação de teste e cinco vezes cruzada. Melhorias no desempenho preditivo foram determinadas comparando métricas de avaliação específicas do modelo em condições idênticas de pré-processamento e validação.
Para esclarecer como os desempenhos dos modelos diferem em vários métodos, a Figura 4 mostra as vantagens e desvantagens dos modelos de conjunto, redes neurais e deep learning de forma pictórica.

figure-results-1
Figura 4: Desempenho comparativo de modelos de aprendizado de máquina e deep learning em tarefas de predição em saúde. (A) Comparação de precisão dos modelos de Gradient Boosting, Random Forest, CNN e MLP no conjunto de dados de teste. (B) Comparação de pontuação F1 dos modelos Gradient Boosting, Random Forest, CNN e MLP no conjunto de dados de teste. (C) Comparação precisa dos modelos Gradient Boosting, Random Forest, CNN e MLP no conjunto de dados de teste. (D) Lembre-se da comparação dos modelos Gradient Boosting, Random Forest, CNN e MLP no conjunto de dados de teste. Valores mais altos indicam melhor desempenho preditivo. Gradient Boosting alcançou o maior desempenho geral em todas as métricas de avaliação, seguido pelo Random Forest. Por favor, clique aqui para ver uma versão ampliada desta figura.

Interpretação do desempenho explicável.
O SHAP alcançou consistentemente as maiores pontuações de fidelidade e estabilidade entre os métodos de explicabilidade avaliados, indicando maior concordância entre as explicações geradas e as previsões do modelo subjacente. A CAL apresentou estabilidade comparativamente menor, sugerindo maior sensibilidade a perturbações locais e variabilidade amostral. O Grad-CAM forneceu explicações visualmente interpretáveis para modelos baseados em imagem, mas produziu valores de fidelidade ligeiramente inferiores aos do SHAP. Esses achados indicam que a qualidade da explicação depende tanto da técnica de explicação selecionada quanto da arquitetura do modelo preditivo subjacente.

As técnicas de explicabilidade integradas ao pipeline foram avaliadas em termos de desempenho quantitativa e qualitativamente. Especificamente, métodos de atribuição de características conseguiram revelar a lógica interna do modelo de forma bastante consistente entre diferentes conjuntos de dados.
Todos os métodos considerados no estudo, SHAP, alcançaram a maior fidelidade (0,92) e estabilidade (0,89) entre os métodos de explicabilidade avaliados. Simplificando, as explicações eram representações muito precisas do que o modelo realmente previa. Métodos de explicação local são uma espécie de janela através da qual podemos ver uma previsão específica e entender qual o modelo usou como base para a decisão.

O desempenho da interpretabilidade foi avaliado usando escores de fidelidade, estabilidade, compreensibilidade e confiança do clínico obtidos a partir da avaliação centrada no ser humano. Explicações SHAP, LIME e Grad-CAM foram comparadas usando conjuntos de dados idênticos e modelos treinados. As melhorias na explicabilidade foram avaliadas comparando métricas de qualidade da explicação e avaliações dos clínicos entre os métodos de explicação avaliados. Técnicas de visualização para modelos de deep learning que trabalham com imagens produzem essencialmente mapas de calor, que identificam as regiões das imagens que têm maior relevância para a previsão do modelo. Distribuições de importância das características e comparações de desempenho de explicabilidade entre diferentes métodos são mostradas na Figura 5.

figure-results-2
Figura 5: Avaliação de Desempenho da Explicabilidade.A figura apresenta o desempenho dos métodos de explicabilidade com a ajuda de métricas de fidelidade e estabilidade. O SHAP lidera em fidelidade (0,92) e estabilidade (0,89), o que reflete boa concordância entre explicações e previsões do modelo. O LIME se destaca como a melhor ferramenta para a interpretabilidade de exemplos individuais. Por outro lado, o Grad-CAM produz mapas de calor visuais usados principalmente em modelos de imagem, mostrando grosseiramente as regiões mais importantes responsáveis pela previsão do modelo, o que, do ponto de vista clínico, pode ser muito relevante. Por favor, clique aqui para ver uma versão ampliada desta figura.

Após avaliar os modelos preditivos e as técnicas de interpretabilidade, foi revelado que a correlação entre a precisão de um modelo e a confiabilidade de suas explicações é muito forte. Na verdade, os mesmos modelos que mostraram melhorias na previsão também explicavam seus resultados com mais estabilidade e consistência quando as técnicas de interpretabilidade eram devidamente aplicadas. Modelos em conjunto mostraram-se os mais interpretáveis quando acompanhados por métodos de atribuição de características, enquanto modelos de aprendizado profundo foram melhor atendidos por métodos explicáveis baseados em visualização. A ligação que une a precisão da previsão e a confiabilidade das explicações pode ser vista na Figura 6, que detalha a dinâmica conceitual entre modelo e explicabilidade.

figure-results-3
Figura 6: Análise comparativa de modelos e explicação dos métodos de habilidade.O gráfico mostra uma comparação detalhada da precisão e explica as medidas de habilidade de vários modelos. Ele compreende um gráfico de dispersão que mostra a correlação entre precisão e estabilidade de explicação, uma comparação tabular de desempenhos e uma matriz de adequação que delineia os diferentes métodos de explicação SHAP, LIME e Grad-CAM, e sua eficácia com diferentes tipos de modelos. O visual mostra claramente que os modelos de conjunto mais o SHAP oferecem ótima interpretabilidade, enquanto modelos de aprendizado profundo são explicáveis por meio de técnicas de visualização. Por favor, clique aqui para ver uma versão ampliada desta figura.

A avaliação centrada no ser humano confirmou a utilidade prática do sistema sugerido em hospitais e outras instalações clínicas. Profissionais de saúde revisaram os resultados dos modelos com e sem explicações. Mostrar os resultados com explicações levou a um aumento considerável na confiança e interpretabilidade dos usuários; O valor médio do trust subiu de 3,1 para 4,7 na escala de 1 a 5. O aumento no escore de confiança de 3,1 para 4,7 representa uma melhora relativa aproximada de 51,6%. O acordo substancial entre avaliadores (κ de Fleiss = 0,81) indica ainda uma avaliação consistente dos clínicos sobre a utilidade da explicação. Esses achados sugerem que os resultados de explicabilidade podem aumentar a confiança dos usuários e facilitar a interpretação de decisões clínicas assistidas por IA. Profissionais relataram melhor compreensão dos resultados dos modelos e maior confiança no julgamento apoiado por IA sobre situações clínicas, o que aponta para a importância da interpretabilidade na implementação real da saúde.

Verificamos ainda a robustez do nosso framework com análise de ablação. A remoção de características críticas que, por meio de métodos de explicabilidade, eram consideradas essenciais resultou em uma grande perda de desempenho de previsão. Assim, a constatação reflete que as características não eram apenas pertinentes, mas também significativas para a tarefa preditiva. Além disso, os resultados de explicação continuavam mostrando diferenças apenas desprezíveis quando diferentes amostras de entrada eram explicadas, mostrando assim a estabilidade e confiabilidade dos métodos de explicabilidade.

Para verificar a viabilidade do pipeline para uso prático, medimos sua velocidade computacional. A introdução de técnicas de explicabilidade causou algum aumento no tempo computacional, especialmente ao atribuir características e criar visualizações. Ainda assim, o tempo total de execução ainda era viável e não muito longo. A Figura 7 mostra como o tempo computacional é compartilhado entre diferentes etapas do pipeline, como pré-processamento, treinamento de modelos, geração de explicabilidade, avaliação e visualização.

figure-results-4
Figura 7: Divisão do tempo de execução do pipeline. Este gráfico mostra como o tempo computacional é dividido entre várias fases do pipeline explicável de IA, como pré-processamento, treinamento de modelos, criação de habilidades, avaliação e visualização de habilidades. Os dados revelam que a maior parte da linha do tempo é ocupada pelo treinamento do modelo, que é seguido pelo processamento de habilidade explicativa. Por outro lado, o tempo gasto em pré-processamento e relatórios é bem mínimo. Por favor, clique aqui para ver uma versão ampliada desta figura.

Também testamos a força do framework proposto por meio de uma análise de ablação. Remover as características essenciais descobertas por meio de métodos de explicabilidade mostrou uma clara diminuição no desempenho preditivo, o que é um sinal claro de que essas características não são apenas relevantes, mas também bastante importantes. Além disso, as saídas explicativas eram bastante estáveis mesmo quando havia uma leve mudança nas amostras de entrada, o que é prova da consistência e confiabilidade das técnicas de explicabilidade.

Em resumo, ao combinar a medição de desempenho preditivo, explicabilidade e validação focada no ser humano, foi demonstrado que o framework proposto era eficaz. O sistema não só fazia previsões muito precisas, como também permanecia altamente interpretável e fácil de usar. A introdução de métodos de explicabilidade tornou todo o processo transparente sem prejudicar o desempenho do modelo. As melhorias que vimos na precisão e interpretabilidade das previsões não foram apenas feitas sob controle experimental rigoroso, mas também foram estatisticamente significativas, fato que reflete a resistência e a autenticidade do método proposto. Comparações par a par entre modelos preditivos foram realizadas usando testes t pareados em dobras de validação cruzada. Diferenças estatisticamente significativas foram observadas entre o Gradient Boosting e os modelos concorrentes (p < 0,05), confirmando a superioridade da configuração proposta.

Resultados gerais.
Coletivamente, os resultados demonstram que desempenho preditivo, qualidade da explicação e confiança dos profissionais podem ser avaliados dentro de um fluxo de trabalho unificado e reproduzível. A estrutura manteve desempenho consistente em múltiplos conjuntos de dados de saúde, ao mesmo tempo em que apoia interpretação transparente por meio de explicações SHAP, LIME e Grad-CAM. No entanto, os achados devem ser interpretados dentro do contexto dos conjuntos de dados selecionados e configurações de validação, e validação externa adicional permanece necessária antes da implantação no mundo real.

DISPONIBILIDADE DE DADOS:
Obtivemos os conjuntos de dados usados na pesquisa atual de fontes públicas, e eles podem ser encontrados em repositórios de dados bem conhecidos. Por exemplo, os dados relacionados ao câncer de mama e diabetes podem ser baixados do Repositório de Aprendizado de Máquina da UCI em: https://archive.ics.uci.edu/ml/index.php

É possível obter o conjunto de dados de prontuários eletrônicos de saúde (MIMIC-III) via Physio Net em:
https://physionet.org/content/mimiciii/1.4/

Os dados de raio-X do tórax foram extraídos do Conjunto de Dados de Raios X de Tórax do NIH e podem ser encontrados em: https://www.kaggle.com/datasets/nih-chest-xrays/data

Todos os conjuntos de dados que exploramos neste estudo são anonimizados e disponibilizados publicamente. As etapas de pré-processamento, o modelo treinado e os resultados explicativos de habilidades que produzimos durante a pesquisa estão disponíveis pelo autor correspondente, caso haja uma solicitação razoável. Código-fonte, scripts de pré-processamento, arquivos de configuração e recursos de reprodutibilidade serão depositados em um repositório público após a aceitação do manuscrito.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo desenvolveu e avaliou um fluxo de trabalho de inteligência artificial explicável reprodutível (XAI) para análises em saúde, que integra modelagem preditiva, avaliação de explicabilidade, avaliação centrada no clínico e recursos de reprodutibilidade dentro de um único protocolo. Os resultados demonstraram que modelos de aprendizado de máquina baseados em conjunto, especialmente Gradient Boosting e Random Forest, alcançaram o maior desempenho preditivo nos conjuntos de dados estruturados avaliados em saúde, enquanto modelos de aprendizado profundo eram mais adequados para análises baseadas em imagens. Esses achados destacam a importância de selecionar arquiteturas de modelos de acordo com características dos dados, em vez de assumir que modelos mais complexos sempre gerarão desempenho superior. Uma contribuição fundamental deste trabalho é a integração de modelagem preditiva, avaliação de explicabilidade, avaliação centrada no ser humano e práticas de reprodutibilidade dentro de um fluxo de trabalho padronizado. Ao contrário dos estudos que avaliam técnicas de explicabilidade isoladamente, o framework proposto oferece uma metodologia orientada por protocolos que apoia experimentação transparente e reprodutível em diversos conjuntos de dados de saúde.

A análise de explicabilidade demonstrou diferenças mensuráveis entre os métodos avaliados. O SHAP alcançou as maiores pontuações de fidelidade e estabilidade dentro das condições experimentais avaliadas, indicando uma concordância mais próxima entre as explicações geradas e as previsões do modelo. O LIME forneceu explicações locais úteis, mas apresentou menor estabilidade, enquanto o Grad-CAM gerou explicações visuais intuitivas para dados de imagem. Esses achados sugerem que a qualidade da explicação depende tanto do método de explicabilidade selecionado quanto do modelo preditivo subjacente. A avaliação centrada no ser humano demonstrou ainda que a inclusão de explicações melhorou a confiança e a interpretabilidade dos clínicos. O aumento observado nas pontuações de confiança e o acordo substancial entre avaliadores (κ de Fleiss = 0,81) indicam uma avaliação consistente da utilidade da explicação entre os participantes. Essas descobertas reforçam o valor potencial dos métodos de explicabilidade para melhorar a transparência e a aceitação dos usuários nos sistemas de apoio à decisão em saúde.

Várias limitações devem ser consideradas ao interpretar os resultados. Primeiro, o framework foi avaliado usando um número limitado de conjuntos de dados públicos disponíveis e pode não representar totalmente a variabilidade encontrada em ambientes clínicos do mundo real. Segundo, a avaliação do clínico envolveu uma coorte de participantes relativamente pequena, o que pode limitar a generalizabilidade. Terceiro, os métodos de explicabilidade investigados neste estudo são técnicas pós-hoc e, portanto, permanecem sujeitos a limitações conhecidas, incluindo sensibilidade a perturbações e possíveis discrepâncias entre explicações e o raciocínio verdadeiro do modelo. Por fim, a validação externa entre instituições de saúde independentes estava além do escopo do presente estudo.

Pesquisas futuras devem investigar análises multimodais em saúde integrando registros clínicos, imagens médicas, sinais fisiológicos e dados de sensores vestíveis. Trabalho adicional é necessário para avaliar métodos de explicação causal e contrafactual, quantificação de incertezas, avaliação de justiça, análise de calibração e validação clínica prospectiva. Tais estudos podem melhorar ainda mais a transparência, confiabilidade e aplicabilidade de sistemas de IA explicáveis na saúde.

Além da avaliação de desempenho, vários desafios práticos de implementação e modificações de protocolo devem ser considerados para garantir uma implantação robusta do framework de IA explicável proposto em diversos ambientes de saúde.

Limitações dos Métodos de Explicabilidade

SHAP, LIME e Grad-CAM, embora forneçam insights úteis sobre o comportamento dos modelos, também apresentam várias desdesvans. Foi observado na literatura que essas ferramentas podem ser instáveis em execuções repetidas, bastante sensíveis a perturbações, diferir entre conjuntos de dados e, às vezes, não refletir com precisão as razões reais do modelo. Portanto, explicações pós-hoc devem ser vistas apenas como evidências suplementares e não como a representação real dos mecanismos de decisão causal. A validação adequada da confiabilidade das explicações ainda é um passo fundamental antes que possam ser usadas em ambientes clínicos de grande impacto.

Isso também é consistente com as descobertas de pesquisas recentes em IA biomédica, que enfatizam a necessidade de explicar a validação da confiabilidade antes de sua implementação em ambientes clínicos. A incorporação da explicabilidade tem sido usada como um aspecto fundamental da validação em sistemas de predição de parada cardíaca, para que possam ser mais transparentes e ganhar a confiança das previsõesclínicas 41. Da mesma forma, a segmentação de imagens por ultrassom hepático usando técnicas de explicabilidade baseadas em visualização teve como objetivo aumentar a interpretabilidade sem desconsiderar o fato de que as explicações pós-hoc são limitadas. Esses artigos confirmam que verificações de consistência explicativa, testes de robustez explicativa e validações de saída de explicabilidade clinicamente significativas são necessárias para estar no mais alto nível de prontidão clínicapara uso 42.

Calibração, Justiça, Robustez e Generalização Externa

As versões futuras do framework proposto incluirão a avaliação da calibração de probabilidade por meio de curvas de calibração e pontuação Brier, estimativa da incerteza usando métodos bayesianos e baseados em conjunto, auditoria de justiça dos subgrupos demográficos e verificação de robustez sob presença de dados ruidosos e mudanças nas condições do domínio. Essas análises são particularmente importantes em ambientes de saúde, onde a confiança do modelo, o desempenho equitativo e a confiabilidade sob ambientes clínicos em mudança influenciam diretamente a segurança do paciente e a adoção clínica. Estruturas científicas recentes habilitadas por IA também enfatizaram a importância de sistemas de apoio à decisão confiáveis, transparentes e confiáveis, além da avaliação preditiva convencional de desempenho. Estruturas científicas recentes habilitadas por IA também enfatizaram a importância de sistemas de apoio à decisão confiáveis, transparentes e confiáveis além da avaliação preditiva convencional de desempenho 43.

Solução de Problemas e Modificações de Protocolo

Vários pontos práticos precisam ser considerados para a implementação bem-sucedida do framework proposto para IA explicável. Um problema típico é o superajuste, por exemplo, ao treinar modelos de deep learning em conjuntos de dados de saúde relativamente pequenos. O sobreajuste pode ser reduzido aplicando validação cruzada, parada precoce, regularização de dropout, aumento de dados e otimização completa de hiperparâmetros. Observar o desempenho da validação durante o treinamento é uma boa forma de evitar um modelo muito complexo que generaliza mal.

Outra questão muito importante nos conjuntos de dados de saúde é o desequilíbrio de classes, ou seja, resultados clínicos positivos são muito mais raros do que casos negativos. Para lidar com esse problema, a amostragem estratificada, o ajuste por peso de classe, a sobreamostragem sintética de minorias e o uso de métricas de avaliação balanceada como o escore F1 e o ROC-AUC devem fazer parte da linha de modelagem. Ignorar o desequilíbrio de classes corre o risco de gerar métricas de desempenho que não representam verdadeiramente o modelo e as previsões clínicas que podem ser tendenciosas.

Conjuntos de dados de imagem médica normalmente não são perfeitos e podem ser corrompidos por ruído, artefatos de aquisição, qualidade inconsistente, etc. Esses fatores também variam conforme o tipo de dispositivo de imagem. Esses fatores podem impactar negativamente o desempenho preditivo e também afetar os resultados de explicabilidade. Portanto, devem ser aplicados passos padronizados de pré-processamento, normalização de imagem, verificações de qualidade e técnicas de aumento de dados para garantir robustez e confiabilidade do modelo.

O SHAP permite a dedução de explicações altamente informativas de atribuição de características. No entanto, ocorrências de instabilidade não podem ser desconsideradas, especialmente quando existem características altamente correlacionadas ou quando os resultados do modelo são muito sensíveis a pequenas mudanças nos dados de entrada. Para aumentar a consistência e confiabilidade da explicação, recomenda-se escrever a explicação várias vezes, avaliar a estabilidade em múltiplas execuções, usar estratégias de agrupamento de características e verificar contra outros métodos de explicabilidade como o LIME.

Quando se trata de dados de saúde em grande escala e arquiteturas de redes neurais profundas e enormes, os limites de memória da GPU podem se tornar uma das principais limitações. As necessidades de memória podem ser consideravelmente reduzidas por meio de mudanças no tamanho do lote, treinamento de precisão mista, poda de modelos, redução da dimensionalidade das características e adoção de carregamento eficiente de dados. Além disso, pesquisadores que implantam o framework em sistemas de poucos recursos podem considerar o uso de ambientes de computação em nuvem ou treinamento distribuído.

O design modular do framework proposto permite que mudanças sejam feitas facilmente para diferentes aplicações em saúde. Dependendo da tarefa clínica, os cientistas podem alterar um ou mais modelos individuais de previsão, adicionar novos métodos de explicação, usar diferentes tipos de dados de saúde juntos ou incluir módulos de quantificação e calibração da incerteza sem alterar o fluxo de trabalho geral. Essa flexibilidade ajuda a tornar o framework utilizável em casos de análise de saúde muito diferentes, ao mesmo tempo em que é reproduzível e interpretável.

Considerações Regulatórias e Éticas:

Sistemas de IA tornados mais compreensíveis podem ser de grande ajuda na saúde. Mas não é suficiente. As regras dos reguladores, que exigem transparência, responsabilidade, privacidade e segurança do paciente, devem ser cumpridas. Mesmo que a explicabilidade possa aumentar a confiança e a interpretabilidade, ela não pode garantir a validade clínica sozinha. A implementação responsável exige validação clínica prospectiva, avaliação de justiça, revisão regulatória e monitoramento pós-implantação. Além disso, a confidencialidade do paciente, supervisão dos clínicos e desempenho equitativo entre grupos demográficos devem ser considerados ao implementar o arcabouço no futuro. Para serem integrados aos fluxos de trabalho clínicos do mundo real, os sistemas de IA e os profissionais de saúde precisam interagir sem falhas. Portanto, a informação explicável precisa fazer parte dos prontuários eletrônicos atuais e das plataformas de apoio à decisão clínica, e não ferramentas separadas que funcionam sozinhas. As escolhas finais devem ser feitas pelos médicos, enquanto a IA explicável é apenas uma tecnologia auxiliar que aumenta a transparência, sustenta o raciocínio baseado em evidências e facilita a comunicação entre profissionais de saúde e pacientes.

Este artigo apresenta um protocolo reprodutível para desenvolver, avaliar e interpretar sistemas de inteligência artificial explicáveis em análises de saúde. A contribuição é metodológica e orientada para fluxos de trabalho, oferecendo a pesquisadores e clínicos uma estrutura padronizada que pode ser replicada, adaptada e estendida por múltiplas aplicações de saúde. Ele combina diferentes aspectos, como pré-processamento de dados, modelagem preditiva, métodos de explicabilidade e avaliação de desempenho, de forma unificada. A metodologia demonstrou forte desempenho preditivo em múltiplos conjuntos de dados de saúde. Quando se trata de análise de dados estruturados, os conjuntos de modelos são os que mais apresentam desempenho, enquanto modelos de deep learning são considerados muito eficazes para tarefas de imagem médica. Além disso, o uso de técnicas de explicação facilita para os usuários entenderem os modelos, pois oferece interpretações globais e locais dos resultados da previsão. Portanto, isso não só aumenta a confiança dos clínicos, mas também a usabilidade dos modelos. Os resultados indicam que a IA explicável pode apoiar o desenvolvimento de sistemas de análise de saúde transparentes e interpretáveis para encontrar um compromisso entre a precisão e a interpretabilidade dos modelos, que são essenciais para análises em saúde confiáveis e confiáveis. Consequentemente, o método apresentado aqui é uma ferramenta muito eficaz e direta para análise de dados médicos, que pode ajudar profissionais de saúde a utilizar tecnologias de IA em que confiam. Este artigo apresenta um protocolo reprodutível para desenvolver, avaliar e interpretar modelos explicáveis de inteligência artificial em análises de saúde (healthcare). Ao integrar pré-processamento de dados, modelagem preditiva, avaliação de explicabilidade, avaliação centrada no clínico e recursos de reprodutibilidade em um fluxo de trabalho unificado, o protocolo oferece uma estrutura prática para pesquisas transparentes em IA em saúde. O fluxo de trabalho pode ser adaptado a diversos conjuntos de dados e domínios de aplicação da área da saúde, apoiando implementação, avaliação e relatórios reprodutíveis de sistemas explicáveis de aprendizado de máquina.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não possuem interesses financeiros ou conflitos de interesse concorrentes relacionados a esta obra. A pesquisa foi conduzida de forma independente, sem quaisquer relações comerciais ou financeiras que pudessem ser interpretadas como um potencial conflito de interesses.

Divulgação do Uso de Inteligência Artificial

Ferramentas de inteligência artificial foram usadas para refinamento da linguagem, correção gramatical e assistência editorial durante a preparação de manuscritos. Todo o conteúdo científico, desenho experimental, análise de dados, interpretação e verificação final do manuscrito foram realizados pelos autores. Os autores revisaram e validaram todos os resultados assistidos por IA para garantir precisão, integridade e conformidade com as diretrizes dos periódicos.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores gostariam de agradecer às suas respectivas instituições por fornecerem a infraestrutura necessária e o apoio à pesquisa para realizar este estudo. Os autores também reconhecem o uso de conjuntos de dados públicos e ferramentas de código aberto que facilitaram o desenvolvimento e a avaliação do framework proposto para IA explicável. Agradecimentos especiais são enviados aos especialistas do setor que forneceram insights valiosos durante a fase de avaliação centrada no ser humano.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
GPU WorkstationDependente do fabricanteNATreinamento de modelos de aprendizado de máquina profundo
Jupyter NotebookProject JupyterVersão estável mais recenteExecução interativa de experimentos
LIMELIMEVersão 0.2.0Explicações interpretáveis locais
MatplotlibMatplotlib ProjectVersão 3.9Visualização de dados
MIMIC-III DatabasePhysioNetVersão 1.4Análise de registro eletrônico de saúde
NIH Chest X-ray DatasetNIH Clinical CenterConjunto de dados públicoClassificação de doenças torácicas
NumPyDesenvolvedores do NumPyVersão 1.26Computação numérica e operações de matriz
OpenCVOpenCV FoundationVersão 4.10Pré-processamento de imagens
PandasPandas Development TeamVersão 2.1Manipulação e pré-processamento de dados
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryConjunto de dados públicoPredição de risco de diabetes
Python 3.11Python Software FoundationVersão 3.11Ambiente de programação primário
Scikit-learnscikit-learnVersão 1.5Algoritmos e avaliação de aprendizado de máquina
SeabornSeabornVersão 0.13Visualização estatística
SHAPSHAPVersão 0.46Atribuição de características e explicabilidade
TensorFlowTensorFlowVersão 2.15Desenvolvimento de modelos de aprendizado de máquina profundo
Windows / Ubuntu LinuxMicrosoft / CanonicalNASistema operacional
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryConjunto de dados públicoDiagnóstico de câncer de mama

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

EngineeringExplainable Artificial Intelligence XAIMachine learningdeep learningModel InterpretabilityClinical Decision Support SystemsReproducible Experimental Protocol

Artigos relacionados