Analisi delle prestazioni predittive
FedMediFormer-XAI ha dimostrato prestazioni predittive migliorate rispetto ai modelli di base unimodali e convenzionali valutati. L'aumento basato sulla diffusione ha migliorato la rappresentazione delle classi minoritarie e le prestazioni predittive risultanti sono riassunte nella Tabella 3. La valutazione con esecuzioni ripetute ha dimostrato prestazioni predittive stabili tra i modelli valutati. FedMediFormer-XAI ha ottenuto le prestazioni complessive più elevate, con un'accuratezza del 94,20 ± 0,34% (IC 95%: 93,78–94,62), una precisione del 93,10 ± 0,30% (IC 95%: 92,73–93,47), un richiamo del 92,80 ± 0,28% (IC 95%: 92,45–93,15) e un punteggio F1 del 92,90 ± 0,28% (IC 95%: 92,55–93,25). Il modello ha ottenuto un MCC di 0,88 ± 0,02 (IC 95%: 0,86–0,90) e un AUC-ROC di 0,96 ± 0,01 (IC 95%: 0,95–0,97). Il trasformatore multimodale centralizzato ha fornito le seconde migliori prestazioni complessive, mentre i modelli di apprendimento automatico unimodali e convenzionali hanno mostrato prestazioni predittive relativamente inferiori. Questi risultati indicano che l'apprendimento della rappresentazione multimodale, combinato con l'ottimizzazione federata, produce prestazioni migliorate e più stabili nella classificazione del diabete.
Studio di ablazione
È stata utilizzata un'ablazione componente per componente per valutare il contributo dell'aumento basato sulla diffusione, dell'apprendimento federato, della raccomandazione di farmaci basata su GraphSAGE e della fusione multimodale. L'intero framework FedMediFormer-XAI ha raggiunto un'accuratezza del 94,20 ± 0,34%, una precisione del 93,10 ± 0,30%, un richiamo del 92,80 ± 0,28%, un punteggio F1 del 92,90 ± 0,28%, un MCC di 0,88 ± 0,02 e un AUC-ROC di 0,96 ± 0,01 su cinque esecuzioni indipendenti. Rimuovendo l'aumento basato sulla diffusione, l'accuratezza è scesa al 91,80 ± 0,42%, corrispondente a una diminuzione di 2,40 punti percentuali, mentre il punteggio F1 e l'AUC-ROC sono diminuiti rispettivamente a 90,30 ± 0,38% e 0,94 ± 0,01. Tale riduzione indica il contributo dell'aumento basato sulla diffusione alla rappresentazione delle classi minoritarie e alla robustezza predittiva.
La rimozione dell'apprendimento federato ha determinato un'accuratezza del 93,10 ± 0,37%, corrispondente a una diminuzione di 1,10 punti percentuali rispetto al framework completo. Precisione, richiamo, punteggio F1, MCC e AUC-ROC sono stati anch'essi ridotti rispettivamente al 92,20 ± 0,34%, 91,80 ± 0,32%, 92,00 ± 0,33%, 0,86 ± 0,02 e 0,95 ± 0,01. Questo confronto dimostra il contributo della configurazione federata alle prestazioni predittive.
La rimozione del componente di raccomandazione personalizzata dei farmaci basato su GraphSAGE ha determinato un cambiamento relativamente modesto nelle prestazioni di previsione del diabete, con un'accuratezza ridotta al 93,80 ± 0,35% e uno score F1 al 92,60 ± 0,30%. Gli indicatori MCC e AUC-ROC corrispondenti sono stati rispettivamente 0,87 ± 0,02 e 0,96 ± 0,01. Questo risultato indica che GraphSAGE contribuisce principalmente alla raccomandazione personalizzata dei farmaci piuttosto che determinare direttamente le prestazioni nella classificazione del diabete.
La riduzione maggiore è stata osservata quando è stata rimossa la fusione multimodale. L'accuratezza è diminuita all'87,60 ± 0,55%, con una diminuzione di 6,60 punti percentuali, mentre precisione, richiamo, punteggio F1, MCC e AUC-ROC sono diminuiti rispettivamente all'86,80 ± 0,51%, 85,90 ± 0,54%, 86,30 ± 0,52%, 0,76 ± 0,03 e 0,91 ± 0,01. Questo risultato dimostra l'importanza di modellare congiuntamente le informazioni complementari provenienti dalle modalità cliniche, dai sensori CGM e retinici.
Analisi del federated learning
Il framework del federated learning ha consentito un addestramento collaborativo del modello tra client distribuiti, mantenendo al contempo un trattamento decentralizzato dei dati clinici grezzi. Durante l'addestramento, il modello locale di ciascun client è stato affinato individualmente e combinato mediante il metodo Federated Averaging. Dopo 100 cicli di comunicazione, il modello globale ha raggiunto la convergenza, e le sue prestazioni predittive sono rimaste coerenti con quelle dell'apprendimento centralizzato. Il framework del federated learning ha dimostrato una convergenza stabile lungo i cicli di comunicazione, nonostante le distribuzioni eterogenee dei dati tra i client. Lo scambio protetto dei parametri ha preservato il trattamento decentralizzato dei dati, mentre il modello globale ha mantenuto prestazioni predittive competitive rispetto al modello centralizzato di riferimento. Tabella 4 confronta le implementazioni centralizzata e federata. Il federated learning ha richiesto un tempo aggiuntivo di addestramento a causa dell'overhead di comunicazione, pur mantenendo prestazioni predittive paragonabili a quelle dell'apprendimento centralizzato.
Analisi delle Prestazioni a Livello di Dataset
Per valutare la generalizzabilità attraverso diverse modalità sanitarie, abbiamo valutato le prestazioni su ciascun dataset separatamente. Il modello multimodale FedMediFormer-XAI ha dimostrato prestazioni elevate e generalmente competitive su tutti i dataset valutati. Ha raggiunto un'accuratezza del 91,8%, 93,1%, 92,4% e 94,2% rispettivamente sui dataset Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM e APTOS 2019. Sebbene il dataset APTOS 2019 abbia ottenuto un'accuratezza (94,7%) e una precisione (93,9%) leggermente superiori rispetto al modello multimodale, l'approccio multimodale proposto ha mantenuto prestazioni competitive su tutti i dataset, raggiungendo un AUC-ROC di 0,96, paragonabile al valore più alto di AUC-ROC a livello di dataset. I risultati complessivi a livello di dataset sono presentati in Tabella 5. Per singoli dataset, l'analisi delle immagini retiniche ha ottenuto le migliori prestazioni quando utilizzata da sola, mentre la fusione multimodale ha prodotto previsioni più stabili e bilanciate.
Analisi di raccomandazione farmacologica personalizzata
Il componente di raccomandazione basato su reti neurali grafiche è stato valutato utilizzando informazioni sull'efficacia dei farmaci e dati sulle interazioni tra farmaci, con i farmaci candidati ordinati in base ai punteggi di idoneità paziente-farmaco appresi ed escludendo combinazioni controindicate durante la generazione delle raccomandazioni. L'uso del formato grafico eterogeneo e la modellizzazione delle interazioni paziente-farmaco e farmaco-farmaco hanno permesso un'analisi approfondita, sostenendo così scelte terapeutiche personalizzate e la valutazione della sicurezza. Il modello di raccomandazione GraphSAGE ha efficacemente catturato le relazioni complesse tra pazienti, malattie, risultati di laboratorio e farmaci. Le raccomandazioni personalizzate hanno dimostrato elevate prestazioni di classificazione, mantenendo al contempo spiegazioni clinicamente significative attraverso l'analisi del vicinato del grafo e l'attribuzione delle caratteristiche.
Secondo la Tabella 6, il modulo di raccomandazione personalizzata dei farmaci è stato valutato utilizzando Precisione@5, Richiamo@5 e NDCG@5. Queste metriche quantificano la rilevanza e la qualità del posizionamento delle prime cinque raccomandazioni di farmaci personalizzate generate dal modulo di raccomandazione basato su GraphSAGE. Il sistema di raccomandazione ha ottenuto prestazioni elevate nel posizionamento, con precisione = 0,89, richiamo = 0,84 e NDCG = 0,91.
Analisi della spiegabilità
Il framework incorpora SHAP, gradienti integrati, visualizzazione dell'attenzione e spiegazioni controfattuali per supportare l'interpretazione delle previsioni multimodali. SHAP è stato utilizzato per quantificare i contributi a livello di caratteristica, i gradienti integrati per attribuire le previsioni alle caratteristiche di input, la visualizzazione dell'attenzione per esaminare il focus del modello attraverso le diverse modalità e le spiegazioni controfattuali per identificare i cambiamenti nelle caratteristiche associati a previsioni alternative. Figura 8 presenta un grafico riassuntivo rappresentativo di SHAP ottenuto dal modello addestrato FedMediFormer-XAI, mentre Figura 9 presenta rappresentative visualizzazioni dell'attenzione estratte dal transformer addestrato. Queste figure rappresentano output ottenuti dalla valutazione del modello e non illustrazioni schematiche dell'architettura proposta.
In Figura 8 sono presentate le classifiche a livello aggregato dell'importanza delle caratteristiche. Le caratteristiche con valori SHAP assoluti più elevati hanno avuto un'influenza maggiore sulle previsioni del modello e si sono anche allineate bene con le conoscenze cliniche esistenti.
Figura 9 presenta visualizzazioni rappresentative dell'attenzione estratte direttamente dal modello addestrato FedMediFormer-XAI per un campione di test tenuto in disparte selezionato casualmente. Le visualizzazioni includono l'attenzione alle caratteristiche cliniche, l'attenzione temporale del CGM, l'attenzione spaziale della retina e l'attenzione incrociata tra le tre modalità. La visualizzazione dell'attenzione ha ulteriormente dimostrato l'allocazione appresa dal modello dell'attenzione attraverso più modalità. Il campione selezionato ha mostrato un'attenzione relativamente maggiore all'HbA1c, alla durata del diabete e all'età tra le caratteristiche cliniche, mentre la mappa di attenzione del CGM ha evidenziato diversi periodi con una marcata variabilità glicemica. La mappa di attenzione retinica ha identificato specifiche regioni dell'immagine che contribuiscono alla rappresentazione del modello, e la matrice di attenzione incrociata ha mostrato pattern di attenzione sia intra-modale che inter-modale. Come mostrato in Figura 9, le mappe di attenzione rappresentative derivate dal modello evidenziano pattern temporali selezionati del glucosio, variabili cliniche influenti e regioni dell'immagine retinica clinicamente rilevanti in un campione di test tenuto in disparte.
Risultati della valutazione centrata sull'uomo
È stato progettato un protocollo prospettico di valutazione centrata sull'uomo per analizzare la fiducia degli operatori sanitari, l'interpretabilità, l'usabilità, l'utilità clinica e la pertinenza delle spiegazioni in condizioni di sola previsione e di previsione più spiegazione. La valutazione proposta coinvolgerà endocrinologi, specialisti in diabete e farmacologi clinici, con l'approvazione appropriata del Comitato Etico Istituzionale e il consenso informato. Poiché questa valutazione è prevista per un'implementazione futura e prospettica, i punteggi degli esiti a livello di operatore sanitario non vengono riportati nel presente protocollo.
Tabella 7 riassume il disegno proposto per la valutazione clinica prospettica e i criteri predeterminati per la valutazione degli effetti delle spiegazioni sulla fiducia del clinico, sull'interpretabilità e sull'utilità percepita. La valutazione prospettica confronterà le valutazioni dei clinici riguardo alle previsioni del modello con e senza spiegazioni associate, utilizzando criteri predeterminati su scala Likert. Il framework proposto per la valutazione dell'esplainabilità centrata sull'essere umano è presentato in Figura 10

Figura 1: Architettura generale del framework FedMediFormer-XAI. Panoramica schematica del framework FedMediFormer-XAI, che mostra l'acquisizione e la pre-elaborazione dei dati multimodali, l'aumento basato sulla diffusione, l'apprendimento specifico per modalità mediante trasformatori, l'addestramento federato del modello, la raccomandazione personalizzata di farmaci basata su GraphSAGE e l'analisi dell'interpretabilità. Il framework genera previsioni relative al diabete, raccomandazioni personalizzate di farmaci e output del modello interpretabili. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Pipeline di acquisizione e pre-elaborazione del dataset multimodale. Flusso schematizzato per l'acquisizione e la pre-elaborazione dei dataset multimodali utilizzati in FedMediFormer-XAI. I dati clinici e di salute della popolazione, i record CGM, le immagini retiniche e le informazioni farmacologiche vengono sottoposti a controlli di qualità specifici per ciascuna modalità, pre-elaborazione, normalizzazione, codifica e aumento, prima di essere convertiti in rappresentazioni pronte per il modello per l'analisi successiva. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Flusso di lavoro per l'aumento dei dati basato sulla diffusione. Flusso di lavoro schematico per l'aumento di dati strutturati in formato tabellare mediante l'uso di TabDDPM. I campioni generati vengono sottoposti a valutazioni della qualità e della somiglianza nella distribuzione prima di essere integrati con i dati di addestramento originali per migliorare l'equilibrio tra le classi. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 4: Architettura del framework proposto basato su trasformatori multimodali. Architettura schematica composta da (A) un codificatore TabTransformer per i dati clinici, (B) un codificatore temporale basato su trasformatori per i dati CGM e (C) un codificatore Vision Transformer per le immagini retiniche. (D) Le rappresentazioni specifiche per ogni modalità vengono integrate attraverso un'attenzione incrociata tra modalità per generare una rappresentazione multimodale unificata. (E) Teste di previsione specifiche per il compito producono gli output del modello. (F) Componenti di regolarizzazione e ottimizzazione supportano l'addestramento del modello e (G) le perdite di classificazione, regressione e coerenza incrociata tra modalità guidano il processo di ottimizzazione. La rappresentazione multimodale risultante supporta attività di previsione, raccomandazione e spiegazione successive. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 5: Architettura di comunicazione per l'apprendimento federato. Flusso schematizzato per l'addestramento federato su client ospedalieri distribuiti. Modelli multimodali locali vengono addestrati utilizzando dati specifici per ciascun client, e gli aggiornamenti protetti del modello vengono trasmessi a un server centrale per la mediazione federata. Il modello globale aggregato viene ridistribuito ai client per i successivi cicli di comunicazione. L'architettura illustra inoltre lo scambio sicuro di parametri e la valutazione dei requisiti relativi a privacy, comunicazione e capacità computazionale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 6: Flusso di lavoro per raccomandazioni farmacologiche personalizzate basato su grafi. Flusso di lavoro schematico per raccomandazioni farmacologiche personalizzate basate su GraphSAGE. I dati farmacologici e quelli relativi alla rappresentazione del paziente vengono organizzati in un grafo eterogeneo che include entità sanitarie pertinenti e le loro relazioni. GraphSAGE apprende le rappresentazioni relative a pazienti e farmaci, che vengono utilizzate per calcolare punteggi di idoneità paziente-farmaco e ordinare i farmaci candidati. Le combinazioni di farmaci controindicate o non sicure vengono filtrate prima della generazione delle raccomandazioni finali Top-K, con informazioni basate sui grafi che supportano l'interpretazione delle raccomandazioni. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 7: Schema di valutazione dell'interpretabilità. Panoramica schematica del flusso di lavoro per l'interpretabilità. (A) L'analisi SHAP valuta i contributi delle caratteristiche a livello globale e locale; (B) I Gradienti Integrati forniscono spiegazioni basate sull'attribuzione; (C) la visualizzazione dell'attenzione identifica le caratteristiche influenti e le interazioni tra le modalità; e (D) l'analisi controfattuale identifica i cambiamenti nelle caratteristiche associati a previsioni modificate. Gli output risultanti delle spiegazioni supportano l'interpretazione delle previsioni del modello e raccomandazioni personalizzate. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 8: Analisi rappresentativa dell'importanza delle caratteristiche SHAP derivata dal modello, generata dal modello addestrato FedMediFormer-XAI. Il grafico riassuntivo SHAP mostra la distribuzione dei valori SHAP tra i campioni valutati, con le caratteristiche ordinate in base al loro contributo medio assoluto SHAP. I valori SHAP positivi indicano un contributo verso un rischio predetto di diabete più elevato, mentre i valori negativi indicano un contributo verso un rischio predetto più basso. Il colore rappresenta il valore corrispondente della caratteristica, con valori più alti mostrati in rosso e valori più bassi in blu. Il grafico rappresenta un output effettivo di spiegabilità derivato dal modello, piuttosto che un'illustrazione schematica. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 9: Output rappresentativi di attenzione generati dal modello addestrato FedMediFormer-XAI per un campione di test scelto casualmente e tenuto in disparte. (A) Attenzione per le caratteristiche cliniche ottenuta da una testa di attenzione del trasformatore multimodale, che mostra i pesi di attenzione relativi assegnati alle caratteristiche cliniche. (B) Attenzione temporale lungo la sequenza CGM, che illustra i periodi di tempo ai quali il modello attribuisce maggiore attenzione. (C) Attenzione spaziale per l'immagine del fondo retinico, inclusa l'immagine originale, la mappa di calore dell'attenzione e la sovrapposizione dell'attenzione. (D) Attenzione multimodale tra i token delle modalità clinica, CGM e retinica, che mostra il peso attribuito alle informazioni intra-modali e inter-modali. Le visualizzazioni mostrate sono output derivati dal modello, generati dal modello addestrato. I pesi di attenzione sono mostrati per il campione di test selezionato e devono essere interpretati come schemi di attenzione del modello, piuttosto che come misure indipendenti di causalità clinica. Cliccare qui per visualizzare una versione ingrandita di questa figura.
| Dataset | Tipo di dati | Campioni/Record | Caratteristiche/Contenuto | Scopo | Disponibilità pubblica |
| Pima Indians Diabetes Dataset | Clinico tabellare | 768 pazienti | 8 variabili cliniche | Predizione del rischio di diabete | Pubblico |
| CDC Diabetes Health Indicators | Salute della popolazione | 253.680 record | Dati demografici, stile di vita, indicatori sanitari | Analisi del rischio per la popolazione | Pubblico |
| OhioT1DM Dataset | Serie temporali CGM | 12 soggetti | Glicemia, insulina, pasti, esercizio fisico, sonno | Modellizzazione temporale del diabete | Pubblico |
| APTOS 2019 Blindness Detection | Immagini retiniche | 3.662 immagini | Fotografie del fondo oculare con etichette di gravità | Analisi della retinopatia diabetica | Pubblico |
| Drug Review Dataset | Farmacologico | 215.063 recensioni | Efficacia del farmaco, valutazioni, recensioni | Raccomandazione farmacologica | Pubblico |
| DrugBank Open Data | Grafo della conoscenza sui farmaci | Migliaia di farmaci | Interazioni tra farmaci, bersagli, vie metaboliche | Costruzione di grafi | Pubblico/Accesso accademico |
Tabella 1: Caratteristiche del set di dati. Sintesi dei set di dati disponibili pubblicamente utilizzati in questo studio, inclusi il tipo di set di dati, la dimensione del campione, la modalità dei dati, il contenuto delle caratteristiche, lo scopo previsto e la disponibilità.
| Set di dati | Modalità | Obiettivo della previsione | Livello di fusione |
| Pima Indians Diabetes | Clinica | Classificazione del diabete | Embedding delle caratteristiche |
| CDC Diabetes Health Indicators | Salute della popolazione | Previsione del rischio di diabete | Embedding delle caratteristiche |
| OhioT1DM | Monitoraggio continuo della glicemia | Previsione della tendenza glicemica | Embedding delle caratteristiche |
| APTOS 2019 | Immagini del fondo oculare retinico | Analisi della retinopatia diabetica | Embedding delle caratteristiche |
| Drug Review + DrugBank | Farmacologica | Raccomandazione di farmaci | Embedding del grafo |
Tabella 2: Strategia di integrazione dei dataset multimodali. Riepilogo dei dataset utilizzati per l'intelligenza multimodale sul diabete, inclusa la modalità dei dati, la variabile predittiva e il livello a cui vengono integrate le rappresentazioni specifiche per ciascuna modalità. I dati clinici, di salute della popolazione, del monitoraggio continuo del glucosio e delle immagini retiniche sono rappresentati come embedding di caratteristiche, mentre le informazioni farmacologiche vengono integrate tramite embedding di grafi per raccomandazioni personalizzate di farmaci.
| Modello | Accuratezza, Media ± DS (IC 95%) | Precisione, Media ± DS (IC 95%) | Recupero, Media ± DS (IC 95%) | Punteggio F1, Media ± DS (IC 95%) | MCC, Media ± DS (IC 95%) | AUC-ROC, Media ± DS (IC 95%) |
| Random Forest | 83,60 ± 0,74 (82,68–84,52) | 82,70 ± 0,60 (81,96–83,44) | 81,90 ± 0,56 (81,21–82,59) | 82,30 ± 0,56 (81,61–82,99) | 0,67 ± 0,03 (0,63–0,71) | 0,88 ± 0,01 (0,87–0,89) |
| XGBoost | 85,30 ± 0,71 (84,42–86,18) | 84,70 ± 0,60 (83,96–85,44) | 83,80 ± 0,56 (83,11–84,49) | 84,20 ± 0,56 (83,51–84,89) | 0,70 ± 0,03 (0,66–0,74) | 0,90 ± 0,01 (0,89–0,91) |
| TabTransformer | 87,50 ± 0,52 (86,85–88,15) | 87,00 ± 0,60 (86,26–87,74) | 86,20 ± 0,56 (85,51–86,89) | 86,60 ± 0,56 (85,91–87,29) | 0,75 ± 0,03 (0,71–0,79) | 0,92 ± 0,01 (0,91–0,93) |
| Vision Transformer | 88,80 ± 0,50 (88,18–89,42) | 88,20 ± 0,60 (87,46–88,94) | 87,60 ± 0,56 (86,91–88,29) | 87,90 ± 0,56 (87,21–88,59) | 0,78 ± 0,03 (0,74–0,82) | 0,93 ± 0,01 (0,92–0,94) |
| Temporal Transformer | 87,20 ± 0,51 (86,57–87,83) | 86,60 ± 0,60 (85,86–87,34) | 85,90 ± 0,56 (85,21–86,59) | 86,20 ± 0,56 (85,51–86,89) | 0,74 ± 0,03 (0,70–0,78) | 0,91 ± 0,01 (0,90–0,92) |
| CNN-LSTM | 86,90 ± 0,58 (86,18–87,62) | 86,30 ± 0,60 (85,56–87,04) | 85,60 ± 0,55 (84,92–86,28) | 85,90 ± 0,56 (85,21–86,59) | 0,73 ± 0,03 (0,69–0,77) | 0,91 ± 0,01 (0,90–0,92) |
| Centralized Multimodal Transformer | 91,30 ± 0,12 (91,15–91,45) | 90,70 ± 0,60 (89,96–91,44) | 90,10 ± 0,56 (89,41–90,79) | 90,40 ± 0,56 (89,71–91,09) | 0,83 ± 0,03 (0,79–0,87) | 0,95 ± 0,01 (0,94–0,96) |
| FedMediFormer-XAI | 94,20 ± 0,34 (93,78–94,62) | 93,10 ± 0,30 (92,73–93,47) | 92,80 ± 0,28 (92,45–93,15) | 92,90 ± 0,28 (92,55–93,25) | 0,88 ± 0,02 (0,86–0,90) | 0,96 ± 0,01 (0,95–0,97) |
Tabella 3: Prestazioni nella previsione del diabete. Confronto delle prestazioni predittive di FedMediFormer-XAI e dei modelli di apprendimento automatico e apprendimento profondo di riferimento, utilizzando metriche di accuratezza, precisione, richiamo, punteggio F1, MCC e AUC-ROC.
| Metrica | Apprendimento Centralizzato | Apprendimento Federato |
| Accuratezza (%) | 94,7 | 94,2 |
| AUC-ROC | 0,97 | 0,96 |
| Preservazione della Privacy | No | Sì |
| Condivisione dei Dati Grezzi Richiesta | Sì | No |
| Round di Comunicazione | N/D | 100 |
| Tempo di Addestramento (ore) | 4,8 | 5,6 |
| Conformità Regolamentare | Moderata | Alta |
Tabella 4: Prestazioni dell'apprendimento federato rispetto a quello centralizzato. Confronto tra implementazioni di apprendimento centralizzato e federato in relazione alle prestazioni predittive, ai requisiti di condivisione dei dati grezzi, ai cicli di comunicazione e al tempo di addestramento.
| Dataset | Accuratezza (%) | Precisione (%) | Recupero (%) | AUC-ROC |
| Pima Indians Diabetes Dataset | 91.8 | 90.5 | 89.8 | 0.93 |
| CDC Diabetes Health Indicators | 93.1 | 92.2 | 91.6 | 0.95 |
| OhioT1DM Dataset | 92.4 | 91.8 | 91.1 | 0.94 |
| APTOS 2019 Blindness Detection | 94.7 | 93.9 | 93.5 | 0.96 |
| Fusione multimodale (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Tabella 5: Risultati a livello di dataset. Analisi delle prestazioni su singoli dataset e in condizioni di fusione multimodale. I risultati illustrano il contributo delle diverse modalità di dati alle prestazioni predittive complessive.
| Metrica | Valore |
| Precisione@5 | 0.89 |
| Recupero@5 | 0.84 |
| NDCG@5 | 0.91 |
| Accuratezza nel Rilevamento delle Interazioni Farmacologiche | 0.95 |
| Copertura delle Raccomandazioni | 0.88 |
| Rango Reciproco Medio (MRR) | 0.86 |
| Punteggio di Conformità alla Sicurezza | 0.94 |
Tabella 6: Prestazioni della raccomandazione personalizzata di farmaci. Valutazione della raccomandazione personalizzata di farmaci basata su grafi mediante metriche di classificazione, accuratezza nel rilevamento delle interazioni, copertura delle raccomandazioni e valutazione della sicurezza dei farmaci.
| Criterio di valutazione | Progettazione della valutazione proposta |
| Fiducia del clinico | Valutazione su scala Likert a cinque punti |
| Interpretabilità | Valutazione su scala Likert a cinque punti |
| Rilevanza clinica | Valutazione su scala Likert a cinque punti |
| Utilità della spiegazione | Valutazione su scala Likert a cinque punti |
| Utilità percepita | Valutazione su scala Likert a cinque punti |
| Accordo tra valutatori | Kappa di Fleiss, da calcolare dopo la valutazione prospettica |
| Confronto statistico | Test statistico accoppiato, appropriato in base ai dati raccolti |
| Partecipanti | 12 clinici, soggetti all'approvazione etica e al consenso informato |
| Stato della valutazione | Valutazione prospettica/futura |
Tabella 7: Criteri proposti di valutazione centrati sull'essere umano. Quadro di valutazione proposto centrato sul clinico per valutare l'utilità, la rilevanza clinica, l'interpretabilità, l'affidabilità e l'usabilità delle spiegazioni fornite da FedMediFormer-XAI. La valutazione prevede una valutazione standardizzata su scala Likert a cinque punti, l'accordo tra valutatori calcolato mediante kappa di Fleiss, un confronto statistico tra le condizioni di sola previsione e previsione più spiegazione, e intervalli di confidenza al 95%. La valutazione da parte del clinico deve essere effettuata solo dopo aver ottenuto l'approvazione dal competente Comitato Etico Istituzionale e il consenso informato.
Tabella supplementare 1: Strategia di validazione del dataset. Sono state implementate partizioni del dataset, procedure di validazione, strategie di bilanciamento delle classi e misure di controllo qualità per garantire la riproducibilità e una valutazione affidabile del modello. Cliccare qui per scaricare il file.
Tabella supplementare 2: Parametri del modello di diffusione. Impostazioni di configurazione per il modello di diffusione TabDDPM, inclusi i parametri di addestramento, le impostazioni di ottimizzazione, le dimensioni latenti, la strategia di programmazione del rumore e le specifiche per la generazione di campioni sintetici. Cliccare qui per scaricare il file.
Tabella supplementare 3: Configurazione del trasformatore multimodale. Configurazione dell'architettura del trasformatore multimodale, inclusi gli encoder clinici, temporali e per immagini, le dimensioni degli embedding e della fusione, le teste di attenzione, l'ottimizzatore, il tasso di apprendimento, la dimensione del batch, le epoche di addestramento, il criterio di arresto anticipato e la perdita combinata durante l'addestramento. Cliccare qui per scaricare il file.
Tabella supplementare 4: Configurazione dell'apprendimento federato. Parametri utilizzati per l'addestramento federato con protezione della privacy, inclusi il numero di ospedali partecipanti, i cicli di comunicazione, le epoche di addestramento locale, la percentuale di partecipazione dei client, l'algoritmo di aggregazione, l'ottimizzatore, il tasso di apprendimento, il metodo di crittografia, il protocollo di comunicazione e la politica di condivisione dei dati grezzi. Cliccare qui per scaricare il file.
Tabella supplementare 5: Configurazione di GraphSAGE. Configurazione del modulo eterogeneo di raccomandazione personalizzata di farmaci basato su GraphSAGE, inclusi il tipo di grafo, le dimensioni nascoste e di incorporamento, il numero di livelli del grafo, la dimensione del campionamento dei vicini, l'ottimizzatore, il tasso di apprendimento, la dimensione del batch, le epoche di addestramento, la funzione di perdita Bayesian Personalized Ranking e il numero di farmaci raccomandati in cima alla lista. Cliccare qui per scaricare il file.
Tabella Supplementare 6: Metriche di valutazione dell'interpretabilità. Metriche quantitative e centrate sull'essere umano utilizzate per valutare l'interpretabilità del framework FedMediFormer-XAI. Le metriche valutano fedeltà, stabilità, coerenza, sparsità, completezza, sensibilità, infedeltà, accordo tra valutatori e qualità percepita dagli operatori sanitari delle spiegazioni. Cliccare qui per scaricare il file.
Tabella supplementare 7: Metriche di valutazione. Vengono utilizzate metriche predittive, di apprendimento federato, di raccomandazione e di spiegabilità per valutare le prestazioni, la robustezza, la qualità del ranking e l'interpretabilità del framework. Cliccare qui per scaricare il file.
Tabella supplementare 8: Progettazione della valutazione centrata sull'uomo. Progettazione dello studio di valutazione centrato sul clinico, inclusi gruppi di partecipanti, condizioni di valutazione, criteri di valutazione e procedure di analisi statistica. Cliccare qui per scaricare questo file.
Tabella supplementare 9: Risorse per la riproducibilità. Sintesi dei set di dati, specifiche di implementazione, file di configurazione, procedure di valutazione, documentazione e registrazioni sperimentali necessari per supportare la riproducibilità del framework proposto FedMediFormer-XAI. Cliccare qui per scaricare il file.