Análise do desempenho preditivo
O FedMediFormer-XAI demonstrou desempenho preditivo aprimorado em comparação com os modelos de referência unimodais e convencionais avaliados. A ampliação baseada em difusão melhorou a representação das classes minoritárias, e o desempenho preditivo resultante é resumido na Tabela 3. A avaliação com execuções repetidas demonstrou desempenho preditivo estável entre os modelos avaliados. O FedMediFormer-XAI alcançou o desempenho geral mais alto, com uma acurácia de 94,20 ± 0,34% (IC 95%: 93,78–94,62), precisão de 93,10 ± 0,30% (IC 95%: 92,73–93,47), revocação de 92,80 ± 0,28% (IC 95%: 92,45–93,15) e pontuação F1 de 92,90 ± 0,28% (IC 95%: 92,55–93,25). O modelo alcançou um MCC de 0,88 ± 0,02 (IC 95%: 0,86–0,90) e AUC-ROC de 0,96 ± 0,01 (IC 95%: 0,95–0,97). O transformador multimodal centralizado apresentou o segundo melhor desempenho geral, enquanto os modelos de aprendizado de máquina unimodais e convencionais mostraram desempenho preditivo comparativamente inferior. Esses resultados indicam que a aprendizagem de representação multimodal, combinada com otimização federada, proporciona desempenho aprimorado e mais estável na classificação de diabetes.
Estudo de ablação
A ablação por componentes foi utilizada para avaliar a contribuição do aumento por difusão, aprendizado federado, recomendação de fármacos baseada em GraphSAGE e fusão multimodal. O framework completo FedMediFormer-XAI alcançou uma acurácia de 94,20 ± 0,34%, precisão de 93,10 ± 0,30%, revocação de 92,80 ± 0,28%, pontuação F1 de 92,90 ± 0,28%, MCC de 0,88 ± 0,02 e AUC-ROC de 0,96 ± 0,01 ao longo de cinco execuções independentes. A remoção do aumento por difusão reduziu a acurácia para 91,80 ± 0,42%, correspondendo a uma diminuição de 2,40 pontos percentuais, enquanto a pontuação F1 e a AUC-ROC diminuíram para 90,30 ± 0,38% e 0,94 ± 0,01, respectivamente. Essa redução indica a contribuição do aumento baseado em difusão para a representação de classes minoritárias e a robustez preditiva.
A remoção do aprendizado federado resultou em uma acurácia de 93,10 ± 0,37%, representando uma diminuição de 1,10 ponto percentual em relação à estrutura completa. A precisão, revocação, pontuação F1, MCC e AUC-ROC também foram reduzidos para 92,20 ± 0,34%, 91,80 ± 0,32%, 92,00 ± 0,33%, 0,86 ± 0,02 e 0,95 ± 0,01, respectivamente. Essa comparação demonstra a contribuição da configuração federada para o desempenho preditivo.
A remoção do componente de recomendação personalizada de medicamentos baseado no GraphSAGE resultou em uma alteração comparativamente pequena no desempenho da predição de diabetes, com a acurácia diminuindo para 93,80 ± 0,35% e o F1-score para 92,60 ± 0,30%. Os valores correspondentes de MCC e AUC-ROC foram 0,87 ± 0,02 e 0,96 ± 0,01, respectivamente. Esse resultado indica que o GraphSAGE contribui principalmente para a recomendação personalizada de medicamentos, em vez de determinar diretamente o desempenho da classificação de diabetes.
A maior redução foi observada quando a fusão multimodal foi removida. A acurácia diminuiu para 87,60 ± 0,55%, representando uma queda de 6,60 pontos percentuais, enquanto precisão, revocação, pontuação F1, MCC e AUC-ROC diminuíram para 86,80 ± 0,51%, 85,90 ± 0,54%, 86,30 ± 0,52%, 0,76 ± 0,03 e 0,91 ± 0,01, respectivamente. Esse resultado demonstra a importância de modelar conjuntamente as informações complementares provenientes das modalidades clínicas, de CGM e retinianas.
Análise de aprendizado federado
O framework de aprendizado federado permitiu o treinamento colaborativo de modelos em clientes distribuídos, mantendo o tratamento descentralizado dos dados brutos dos pacientes. Durante o treinamento, o modelo local de cada cliente foi ajustado individualmente e combinado por meio do método de Média Federada. Após 100 rodadas de comunicação, o modelo global convergiu, e seu desempenho preditivo permaneceu consistente com o aprendizado centralizado. O framework de aprendizado federado demonstrou convergência estável ao longo das rodadas de comunicação, apesar das distribuições heterogêneas dos dados dos clientes. A troca protegida de parâmetros preservou o manuseio descentralizado dos dados, enquanto o modelo global manteve um desempenho preditivo competitivo em relação à linha de base centralizada. Tabela 4 compara as implementações centralizada e federada. O aprendizado federado exigiu tempo adicional de treinamento devido à sobrecarga de comunicação, mantendo ao mesmo tempo um desempenho preditivo comparável ao do aprendizado centralizado.
Análise de Desempenho no Nível de Conjunto de Dados
Para avaliar a generalização em diferentes modalidades de saúde, avaliamos o desempenho em cada conjunto de dados separadamente. O modelo multimodal FedMediFormer-XAI demonstrou desempenho robusto e geralmente competitivo nos conjuntos de dados avaliados. Ele alcançou uma acurácia de 91,8%, 93,1%, 92,4% e 94,2% nos conjuntos de dados Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM e APTOS 2019, respectivamente. Embora o conjunto de dados APTOS 2019 tenha alcançado acurácia (94,7%) e precisão (93,9%) ligeiramente superiores em comparação com o modelo multimodal, a abordagem multimodal proposta manteve desempenho competitivo em todos os conjuntos de dados e obteve uma AUC-ROC de 0,96, comparável à AUC-ROC mais alta no nível de conjunto de dados. Os resultados gerais no nível de conjunto de dados são apresentados na Tabela 5. Para conjuntos de dados individuais, a análise de imagens de retina alcançou o melhor desempenho quando utilizada isoladamente, enquanto a fusão multimodal gerou previsões mais estáveis e equilibradas.
Análise de recomendação personalizada de medicamentos
O componente de recomendação baseado em rede neural gráfica foi avaliado utilizando informações sobre eficácia medicamentosa e dados de interação entre medicamentos, com os medicamentos candidatos classificados de acordo com escores aprendidos de adequação paciente-medicamento e combinações contraindicadas excluídas durante a geração das recomendações. O uso do formato de grafo heterogêneo e a modelagem das interações paciente-medicamento e medicamento-medicamento puderam ser realizados de forma minuciosa, apoiando assim a escolha personalizada de medicamentos e a avaliação de segurança. O modelo de recomendação GraphSAGE capturou efetivamente relações complexas entre pacientes, doenças, achados laboratoriais e medicamentos. As recomendações personalizadas demonstraram alto desempenho na classificação, mantendo ao mesmo tempo explicações clinicamente significativas por meio da análise de vizinhança do grafo e da atribuição de características.
De acordo com a Tabela 6, o módulo de recomendação personalizada de medicamentos foi avaliado usando Precisão@5, Revocação@5 e NDCG@5. Essas métricas quantificam a relevância e a qualidade da classificação das cinco principais recomendações personalizadas de medicamentos geradas pelo módulo de recomendação baseado em GraphSAGE. O sistema de recomendação alcançou um desempenho elevado na classificação, com precisão = 0,89, revocação = 0,84 e NDCG = 0,91.
Análise de explicabilidade
O framework incorpora SHAP, Gradientes Integrados, visualização de atenção e explicações contrafactuais para apoiar a interpretação de previsões multimodais. O SHAP foi utilizado para quantificar as contribuições em nível de características, os Gradientes Integrados para atribuir as previsões às características de entrada, a visualização de atenção para examinar o foco do modelo nas diferentes modalidades e as explicações contrafactuais para identificar alterações nas características associadas a previsões alternativas. Figura 8 apresenta um gráfico resumo representativo derivado do modelo FedMediFormer-XAI treinado, enquanto Figura 9 apresenta visualizações representativas de atenção extraídas do transformador treinado. Essas figuras representam saídas obtidas a partir da avaliação do modelo, e não ilustrações esquemáticas da arquitetura proposta.
Na Figura 8, são apresentadas as classificações agregadas de importância das características. Características com valores SHAP absolutos mais altos tiveram maior influência nas previsões do modelo e também se alinharam bem com o conhecimento clínico existente.
Figura 9 apresenta visualizações representativas de atenção extraídas diretamente do modelo treinado FedMediFormer-XAI para uma amostra de teste mantida selecionada aleatoriamente. As visualizações incluem atenção a características clínicas, atenção temporal à CGM, atenção espacial à retina e atenção cruzada entre as três modalidades. A visualização de atenção demonstrou ainda mais a alocação aprendida pelo modelo ao longo de múltiplas modalidades. A amostra selecionada mostrou atenção relativamente maior a HbA1c, duração do diabetes e idade entre as características clínicas, enquanto o mapa de atenção da CGM destacou vários períodos com variabilidade glicêmica acentuada. O mapa de atenção da retina identificou regiões específicas da imagem que contribuíram para a representação do modelo, e a matriz de atenção cruzada demonstrou padrões de atenção tanto intra-modal quanto intermodal. Como mostrado na Figura 9, os mapas de atenção derivados do modelo destacam padrões temporais selecionados de glicose, variáveis clínicas influentes e regiões da imagem de retina clinicamente relevantes em uma amostra de teste mantida.
Resultados da avaliação centrada no ser humano
Um protocolo prospectivo de avaliação centrada no ser humano foi projetado para avaliar a confiança do clínico, interpretabilidade, usabilidade, utilidade clínica e relevância das explicações sob condições de apenas previsão e previsão com explicação. A avaliação proposta envolverá endocrinologistas, especialistas em diabetes e farmacologistas clínicos, com aprovação apropriada do Comitê de Ética Institucional e consentimento informado. Como esta avaliação destina-se à implementação prospectiva futura, pontuações de desfecho em nível de clínico não são relatadas no presente protocolo.
Tabela 7 resume o design proposto para a avaliação clínica prospectiva e os critérios predefinidos para avaliar os efeitos das explicações sobre a confiança do clínico, a interpretabilidade e a utilidade percebida. A avaliação prospectiva comparará as avaliações clínicas das previsões do modelo com e sem explicações acompanhantes, utilizando critérios predefinidos em escala Likert. O quadro proposto para avaliação de explicabilidade centrada no ser humano é apresentado na Figura 10

Figura 1: Arquitetura geral do framework FedMediFormer-XAI. Visão esquemática do framework FedMediFormer-XAI, mostrando a aquisição e pré-processamento de dados multimodais, aumento baseado em difusão, aprendizado com transformadores específico por modalidade, treinamento federado do modelo, recomendação personalizada de medicamentos baseada em GraphSAGE e análise de explicabilidade. O framework gera predição de diabetes, recomendações personalizadas de medicamentos e saídas de modelo interpretáveis. Clique aqui para visualizar uma versão maior desta figura.

Figura 2: Pipeline de aquisição e pré-processamento de conjunto de dados multimodal. Fluxo esquemático para aquisição e pré-processamento dos conjuntos de dados multimodais utilizados no FedMediFormer-XAI. Dados clínicos e de saúde populacional, registros de CGM, imagens de retina e informações farmacológicas passam por controle de qualidade, pré-processamento, normalização, codificação e aumento específicos para cada modalidade antes de serem convertidos em representações prontas para o modelo, destinadas à análise posterior. Clique aqui para visualizar uma versão maior desta figura.

Figura 3: Fluxo de trabalho para aumento de dados baseado em difusão. Fluxo esquemático do aumento baseado em difusão de dados tabulares estruturados utilizando TabDDPM. As amostras geradas passam por avaliações de qualidade e de semelhança de distribuição antes de serem integradas aos dados de treinamento originais para melhorar o equilíbrio entre classes. Clique aqui para visualizar uma versão maior desta figura.

Figura 4: Arquitetura do framework proposto do transformador multimodal. Arquitetura esquemática composta por (A) um codificador TabTransformer para dados clínicos, (B) um codificador transformador temporal para dados de CGM e (C) um codificador Vision Transformer para imagens de retina. (D) Representações específicas de cada modalidade são integradas por meio de atenção cruzada para gerar uma representação multimodal unificada. (E) Cabeças de predição específicas para cada tarefa geram as saídas do modelo. (F) Componentes de regularização e otimização apoiam o treinamento do modelo e (G) perdas de classificação, regressão e consistência cruzada orientam o processo de otimização. A representação multimodal resultante suporta tarefas preditivas, de recomendação e de explicabilidade posteriores. Clique aqui para visualizar uma versão ampliada desta figura.

Figura 5: Estrutura de comunicação de aprendizado federado. Fluxo esquemático do treinamento federado entre clientes hospitalares distribuídos. Modelos multimodais locais são treinados utilizando dados específicos de cada cliente, e atualizações protegidas do modelo são transmitidas a um servidor central para Média Federada. O modelo global agregado é redistribuído entre os clientes para rodadas subsequentes de comunicação. A estrutura também ilustra a troca segura de parâmetros e a avaliação dos requisitos de privacidade, comunicação e computação. Clique aqui para visualizar uma versão maior desta figura.

Figura 6: Fluxo de trabalho para recomendação personalizada de medicamentos baseado em grafos. Fluxo esquemático para recomendação personalizada de medicamentos baseado em GraphSAGE. Dados farmacológicos e de representação do paciente são organizados em um grafo heterogêneo que inclui entidades e relações relevantes no cuidado à saúde. O GraphSAGE aprende representações de pacientes e medicamentos, que são usadas para calcular pontuações de adequação entre paciente e medicamento e classificar os medicamentos candidatos. Combinações de medicamentos contraindicadas ou inseguras são filtradas antes da geração das recomendações finais Top-K, com informações baseadas em grafos apoiando a interpretação das recomendações. Clique aqui para visualizar uma versão maior desta figura.

Figura 7: Estrutura para avaliação da explicabilidade. Visão esquemática do fluxo de trabalho de explicabilidade. (A) A análise SHAP avalia as contribuições globais e locais das características; (B) os Gradientes Integrados fornecem explicações baseadas em atribuição; (C) a visualização de atenção identifica características influentes e interações entre modalidades; e (D) a análise contrafactual identifica alterações nas características associadas a previsões modificadas. As saídas resultantes das explicações apoiam a interpretação das previsões do modelo e recomendações personalizadas. Clique aqui para visualizar uma versão maior desta figura.

Figura 8: Análise representativa da importância de características derivada do modelo SHAP gerada pelo modelo treinado FedMediFormer-XAI. O gráfico resumo SHAP mostra a distribuição dos valores SHAP entre as amostras avaliadas, com as características classificadas de acordo com sua contribuição média absoluta SHAP. Valores SHAP positivos indicam contribuições para um risco predito maior de diabetes, enquanto valores negativos indicam contribuições para um risco predito menor. A cor representa o valor correspondente da característica, sendo os valores mais altos mostrados em vermelho e os mais baixos em azul. O gráfico representa uma saída real de explicabilidade derivada do modelo, e não uma ilustração esquemática. Clique aqui para visualizar uma versão maior desta figura.

Figura 9: Saídas representativas de atenção geradas pelo modelo treinado FedMediFormer-XAI para uma amostra de teste mantida selecionada aleatoriamente. (A) Atenção às características clínicas obtida a partir de uma cabeça de atenção do transformador multimodal, mostrando os pesos relativos de atenção atribuídos às características clínicas. (B) Atenção temporal ao longo da sequência de CGM, ilustrando os períodos de tempo que receberam maior atenção do modelo. (C) Atenção espacial para a imagem de fundo de olho, incluindo a imagem original, o mapa de calor de atenção e a sobreposição de atenção. (D) Atenção cruzada entre os tokens clínicos, de CGM e de modalidade retiniana, mostrando o peso da informação intra-modal e intermodal. As visualizações exibidas são saídas derivadas do modelo geradas pelo modelo treinado. Os pesos de atenção são mostrados para a amostra de teste selecionada e devem ser interpretados como padrões de atenção do modelo, e não como medidas independentes de causalidade clínica. Clique aqui para visualizar uma versão maior desta figura.
| Conjunto de Dados | Tipo de Dados | Amostras/Registros | Características/Conteúdo | Finalidade | Disponibilidade Pública |
| Pima Indians Diabetes Dataset | Clínico Tabular | 768 pacientes | 8 variáveis clínicas | Predição de risco de diabetes | Público |
| CDC Diabetes Health Indicators | Saúde da População | 253.680 registros | Dados demográficos, estilo de vida, indicadores de saúde | Análise de risco populacional | Público |
| OhioT1DM Dataset | Série Temporal de CGM | 12 indivíduos | Glicose, insulina, refeições, exercícios, sono | Modelagem temporal do diabetes | Público |
| APTOS 2019 Blindness Detection | Imagens de Retina | 3.662 imagens | Fotografias de fundo de olho com rótulos de gravidade | Análise de retinopatia diabética | Público |
| Drug Review Dataset | Farmacológico | 215.063 avaliações | Efetividade do medicamento, classificações, avaliações | Recomendação de medicamentos | Público |
| DrugBank Open Data | Grafo de Conhecimento de Medicamentos | Milhares de medicamentos | Interações medicamentosas, alvos, vias metabólicas | Construção de grafo | Público/Acesso Acadêmico |
Tabela 1: Características dos conjuntos de dados. Resumo dos conjuntos de dados disponíveis publicamente utilizados neste estudo, incluindo tipo do conjunto de dados, tamanho da amostra, modalidade dos dados, conteúdo de características, finalidade pretendida e disponibilidade.
| Conjunto de dados | Modalidade | Alvo da predição | Nível de fusão |
| Pima Indians Diabetes | Clínica | Classificação de diabetes | Incorporação de características |
| CDC Diabetes Health Indicators | Saúde populacional | Predição de risco de diabetes | Incorporação de características |
| OhioT1DM | Monitoramento contínuo de glicose | Predição da tendência glicêmica | Incorporação de características |
| APTOS 2019 | Imagens de fundo de retina | Análise de retinopatia diabética | Incorporação de características |
| Drug Review + DrugBank | Farmacológica | Recomendação de medicamentos | Incorporação de grafo |
Tabela 2: Estratégia de integração de conjunto de dados multimodal. Resumo dos conjuntos de dados utilizados para a inteligência multimodal do diabetes, incluindo a modalidade dos dados, o alvo de predição e o nível no qual as representações específicas da modalidade são integradas. Os dados clínicos, de saúde populacional, de monitoramento contínuo de glicose e de imagens de retina são representados como incorporações de características, enquanto as informações farmacológicas são integradas por meio de incorporações de grafos para recomendação personalizada de medicamentos.
| Modelo | Exatidão, Média ± DP (IC 95%) | Precisão, Média ± DP (IC 95%) | Revocação, Média ± DP (IC 95%) | Pontuação F1, Média ± DP (IC 95%) | MCC, Média ± DP (IC 95%) | AUC-ROC, Média ± DP (IC 95%) |
| Random Forest | 83,60 ± 0,74 (82,68–84,52) | 82,70 ± 0,60 (81,96–83,44) | 81,90 ± 0,56 (81,21–82,59) | 82,30 ± 0,56 (81,61–82,99) | 0,67 ± 0,03 (0,63–0,71) | 0,88 ± 0,01 (0,87–0,89) |
| XGBoost | 85,30 ± 0,71 (84,42–86,18) | 84,70 ± 0,60 (83,96–85,44) | 83,80 ± 0,56 (83,11–84,49) | 84,20 ± 0,56 (83,51–84,89) | 0,70 ± 0,03 (0,66–0,74) | 0,90 ± 0,01 (0,89–0,91) |
| TabTransformer | 87,50 ± 0,52 (86,85–88,15) | 87,00 ± 0,60 (86,26–87,74) | 86,20 ± 0,56 (85,51–86,89) | 86,60 ± 0,56 (85,91–87,29) | 0,75 ± 0,03 (0,71–0,79) | 0,92 ± 0,01 (0,91–0,93) |
| Vision Transformer | 88,80 ± 0,50 (88,18–89,42) | 88,20 ± 0,60 (87,46–88,94) | 87,60 ± 0,56 (86,91–88,29) | 87,90 ± 0,56 (87,21–88,59) | 0,78 ± 0,03 (0,74–0,82) | 0,93 ± 0,01 (0,92–0,94) |
| Temporal Transformer | 87,20 ± 0,51 (86,57–87,83) | 86,60 ± 0,60 (85,86–87,34) | 85,90 ± 0,56 (85,21–86,59) | 86,20 ± 0,56 (85,51–86,89) | 0,74 ± 0,03 (0,70–0,78) | 0,91 ± 0,01 (0,90–0,92) |
| CNN-LSTM | 86,90 ± 0,58 (86,18–87,62) | 86,30 ± 0,60 (85,56–87,04) | 85,60 ± 0,55 (84,92–86,28) | 85,90 ± 0,56 (85,21–86,59) | 0,73 ± 0,03 (0,69–0,77) | 0,91 ± 0,01 (0,90–0,92) |
| Centralized Multimodal Transformer | 91,30 ± 0,12 (91,15–91,45) | 90,70 ± 0,60 (89,96–91,44) | 90,10 ± 0,56 (89,41–90,79) | 90,40 ± 0,56 (89,71–91,09) | 0,83 ± 0,03 (0,79–0,87) | 0,95 ± 0,01 (0,94–0,96) |
| FedMediFormer-XAI | 94,20 ± 0,34 (93,78–94,62) | 93,10 ± 0,30 (92,73–93,47) | 92,80 ± 0,28 (92,45–93,15) | 92,90 ± 0,28 (92,55–93,25) | 0,88 ± 0,02 (0,86–0,90) | 0,96 ± 0,01 (0,95–0,97) |
Tabela 3: Desempenho da predição de diabetes. Desempenho preditivo comparativo do FedMediFormer-XAI e modelos de aprendizado de máquina e aprendizado profundo de referência utilizando métricas de acurácia, precisão, revocação, pontuação F1, MCC e AUC-ROC.
| Métrica | Aprendizado Centralizado | Aprendizado Federado |
| Precisão (%) | 94,7 | 94,2 |
| AUC-ROC | 0,97 | 0,96 |
| Preservação de Privacidade | Não | Sim |
| Compartilhamento de Dados Brutos Necessário | Sim | Não |
| Rodadas de Comunicação | N/A | 100 |
| Tempo de Treinamento (horas) | 4,8 | 5,6 |
| Conformidade Regulatória | Moderada | Alta |
Tabela 4: Desempenho do aprendizado federado versus centralizado. Comparação das implementações de aprendizado centralizado e federado em relação ao desempenho preditivo, requisitos de compartilhamento de dados brutos, rodadas de comunicação e tempo de treinamento.
| Conjunto de dados | Precisão (%) | Precisão positiva (%) | Revocação (%) | AUC-ROC |
| Conjunto de dados de diabetes dos índios Pima | 91.8 | 90.5 | 89.8 | 0.93 |
| Indicadores de saúde relacionados ao diabetes do CDC | 93.1 | 92.2 | 91.6 | 0.95 |
| Conjunto de dados OhioT1DM | 92.4 | 91.8 | 91.1 | 0.94 |
| Detecção de cegueira APTOS 2019 | 94.7 | 93.9 | 93.5 | 0.96 |
| Fusão multimodal (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Tabela 5: Resultados no nível do conjunto de dados. Análise de desempenho em conjuntos de dados individuais e configurações de fusão multimodal. Os resultados ilustram a contribuição de diferentes modalidades de dados para o desempenho preditivo geral.
| Métrica | Valor |
| Precisão@5 | 0.89 |
| Revocação@5 | 0.84 |
| NDCG@5 | 0.91 |
| Precisão na Detecção de Interações Medicamentosas | 0.95 |
| Cobertura da Recomendação | 0.88 |
| Posto Médio Recíproco (MRR) | 0.86 |
| Pontuação de Conformidade com a Segurança | 0.94 |
Tabela 6: Desempenho da recomendação personalizada de medicamentos. Avaliação da recomendação personalizada de medicamentos baseada em grafos utilizando métricas de classificação, precisão na detecção de interações, cobertura da recomendação e avaliação da segurança medicamentosa.
| critério de avaliação | desenho proposto para a avaliação |
| confiança do clínico | avaliação em escala Likert de cinco pontos |
| interpretabilidade | avaliação em escala Likert de cinco pontos |
| relevância clínica | avaliação em escala Likert de cinco pontos |
| utilidade da explicação | avaliação em escala Likert de cinco pontos |
| utilidade percebida | avaliação em escala Likert de cinco pontos |
| acordo entre avaliadores | kappa de Fleiss, a ser calculado após a avaliação prospectiva |
| comparação estatística | teste estatístico pareado, conforme apropriado após a coleta de dados |
| participantes | 12 clínicos, sujeitos à aprovação ética e ao consentimento informado |
| status da avaliação | avaliação prospectiva/futura |
Tabela 7: Critérios propostos de avaliação centrada no ser humano. Estrutura prospectiva proposta centrada no clínico para avaliar a utilidade, relevância clínica, interpretabilidade, confiabilidade e usabilidade das explicações do FedMediFormer-XAI. A avaliação envolve uma avaliação padronizada em escala Likert de cinco pontos, concordância entre avaliadores usando kappa de Fleiss, comparação estatística das condições de predição apenas e predição com explicação, e intervalos de confiança de 95%. A avaliação pelo clínico deve ser realizada somente após obter aprovação do Comitê de Ética Institucional apropriado e o consentimento informado.
Tabela Suplementar 1: Estratégia de validação do conjunto de dados. A partição do conjunto de dados, procedimentos de validação, estratégias de balanceamento de classes e medidas de controle de qualidade foram implementados para garantir a reprodutibilidade e uma avaliação confiável do modelo. Clique aqui para baixar este arquivo.
Tabela Suplementar 2: Parâmetros do modelo de difusão. Configurações do modelo de difusão TabDDPM, incluindo parâmetros de treinamento, configurações de otimização, dimensões latentes, estratégia de agendamento de ruído e especificações de geração de amostras sintéticas. Clique aqui para baixar este arquivo.
Tabela Suplementar 3: Configuração do transformador multimodal. Configuração da arquitetura do transformador multimodal, incluindo os codificadores clínico, temporal e de imagem, dimensões de incorporação e fusão, cabeças de atenção, otimizador, taxa de aprendizado, tamanho do lote, épocas de treinamento, critério de parada antecipada e perda combinada de treinamento. Clique aqui para baixar este arquivo.
Tabela Suplementar 4: Configuração da aprendizagem federada. Parâmetros utilizados para o treinamento federado com preservação de privacidade, incluindo o número de hospitais participantes, rodadas de comunicação, épocas locais de treinamento, taxa de participação dos clientes, algoritmo de agregação, otimizador, taxa de aprendizado, método de criptografia, protocolo de comunicação e política de compartilhamento de dados brutos. Clique aqui para baixar este arquivo.
Tabela Suplementar 5: Configuração do GraphSAGE. Configuração do módulo heterogêneo de recomendação personalizada de medicamentos baseado no GraphSAGE, incluindo tipo de grafo, dimensões ocultas e de incorporação, número de camadas do grafo, tamanho da amostragem de vizinhança, otimizador, taxa de aprendizado, tamanho do lote, épocas de treinamento, perda do Ranking Pessoal Bayesiano e número de recomendações principais de medicamentos. Clique aqui para baixar este arquivo.
Tabela Suplementar 6: Métricas de avaliação da explicabilidade. Métricas quantitativas e centradas no ser humano utilizadas para avaliar a explicabilidade do framework FedMediFormer-XAI. As métricas avaliam fidelidade da explicação, estabilidade, consistência, esparsidade, completude, sensibilidade, infidelidade, concordância entre avaliadores e qualidade percebida da explicação pelos clínicos. Clique aqui para baixar este arquivo.
Tabela Suplementar 7: Métricas de avaliação. Métricas preditivas, de aprendizado federado, de recomendação e de explicabilidade são utilizadas para avaliar o desempenho, a robustez, a qualidade do ranqueamento e a interpretabilidade do framework. Clique aqui para baixar este arquivo.
Tabela Suplementar 8: Desenho da avaliação centrada no ser humano. Desenho do estudo de avaliação centrado no clínico, incluindo grupos de participantes, condições de avaliação, critérios de avaliação e procedimentos de análise estatística. Clique aqui para baixar este arquivo.
Tabela Suplementar 9: Ativos de reprodutibilidade. Resumo dos conjuntos de dados, especificações de implementação, arquivos de configuração, procedimentos de avaliação, documentação e registros experimentais necessários para apoiar a reprodutibilidade do framework proposto FedMediFormer-XAI. Clique aqui para baixar este arquivo.