Articolo di ricerca

Un protocollo riproducibile per lo sviluppo e la valutazione di framework di intelligenza artificiale spiegabili nell'analisi sanitaria

DOI:

10.3791/71999

31 luglio 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Qui presentiamo un protocollo riproducibile per sviluppare e valutare modelli di intelligenza artificiale spiegabili per l'analisi sanitaria. Il flusso di lavoro integra preelaborazione dei dati, modellazione predittiva, spiegabilità basata su SHAP, LIME- e Grad-CAM, valutazione quantitativa e validazione centrata sull'uomo per supportare decisioni cliniche trasparenti e affidabili.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'Intelligenza Artificiale Spiegabile (XAI) è sempre più riconosciuta come uno strumento indispensabile per costruire sistemi di IA affidabili nel settore sanitario, dove la trasparenza e la capacità di spiegare le decisioni sono componenti essenziali del processo decisionale clinico. Questa pubblicazione presenta un approccio sperimentale riproducibile allo sviluppo e alla valutazione di sistemi di IA spiegabili per l'analisi sanitaria. La pipeline sviluppata integra i passaggi di preprocessing dei dati, modellazione predittiva, generazione di interpretazioni e valutazione in un unico flusso di lavoro fluido che può essere applicato sia a dati clinici strutturati che a dataset di imaging medico. I modelli di machine learning in ensemble hanno dimostrato forti prestazioni predittive su dataset tabellari strutturati, mentre i modelli di deep learning sono efficaci per apprendere modelli complessi nei dati di imaging medico. Tecniche come SHAP, LIME e Grad-CAM sono spiegazioni globali e locali che facilitano l'interpretazione dei modelli. Molto utile. La valutazione quantitativa del framework comprende molte metriche diverse come accuratezza, precisione, richiamo, punteggio F1, ROC-AUC, metriche di spiegazione, fedeltà e stabilità. I risultati indicano che, quando le condizioni sperimentali sono controllate, il quadro ha dimostrato un miglioramento delle prestazioni predittive e della qualità delle spiegazioni nelle condizioni sperimentali valutate. Come documento guidato da protocolli, questo lavoro sostiene la riproducibilità e la scalabilità, l'implementazione persistente da parte di altri esseri viventi. Questo modello di IA trasparente e comprensibile è la base su cui il supporto alle decisioni cliniche e i sistemi di analisi sanitaria acquisiscono fiducia e utilizzo su larga scala.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'intelligenza artificiale (IA) è diventata un componente importante dell'assistenza sanitaria moderna supportando la diagnosi delle malattie, la prognosi, la stratificazione del rischio, l'analisi delle immagini mediche e il processo decisionaleclinico. I progressi nel machine learning e nel deep learning hanno permesso ai sistemi sanitari di elaborare grandi volumi di dati strutturati e non strutturati, spesso raggiungendo prestazioni predittive paragonabili o superiori agli approcci statisticiconvenzionali 2. Nonostante questi progressi, molti modelli di IA operano come complessi sistemi a scatola nera, rendendo difficile per clinici e stakeholder sanitari comprendere come vengano generatele previsioni 3. Questa mancanza di trasparenza può limitare fiducia, adozione e responsabilità negli ambienti sanitari ad alto rischio 4,5.

L'intelligenza artificiale spiegabile (XAI) si è affermata come un approccio promettente per migliorare la trasparenza e l'interpretabilità dei modelli di machinelearning 6. Tecniche di spiegazione ampiamente utilizzate, tra cui SHAP (spiegazioni additive di Shapley), LIME (spiegazioni interpretabili locali agnostiche del modello) e mappatura dell'attivazione delle classi ponderata in gradiente (Grad-CAM), forniscono intuizioni sul comportamento del modello attraverso meccanismi di attribuzione delle caratteristiche e spiegazioni visive 7,8,9. Questi metodi sono stati applicati sempre più spesso alle applicazioni sanitarie per supportare l'interpretazione clinica, l'audit dei modelli e il supportodecisionale 10,11. Tuttavia, la spiegabilità da sola non garantisce affidabilità, riproducibilità o utilità clinica. Studi recenti hanno evidenziato sfide legate all'instabilità delle spiegazioni, alla sensibilità alle perturbazioni, alla limitata validazione da parte dei clinici e alle incongruenze tra i risultati delle spiegazioni e il vero ragionamento del modello 12,13,14,15.

Oltre alle sfide di spiegabilità, la riproducibilità rimane una preoccupazione significativa nella ricerca sul machine learningsanitario 16,17,18. Molti studi pubblicati forniscono informazioni limitate riguardo alle procedure di pre-elaborazione, agli ambienti software, alle configurazioni degli iperparametri, alle strategie di validazione e ai flussi di lavoro di implementazione, rendendo difficile la replica indipendente 19,20,21. Inoltre, gli studi sull'IA sanitaria si concentrano frequentemente sulla performance predittiva, fornendo però indicazioni limitate riguardo alla valutazione della qualità della spiegazione, alla valutazione centrata sul clinico e alle considerazioni pratiche diimplementazione. Queste limitazioni possono ostacolare la traduzione di sistemi di IA spiegabili dagli ambienti di ricerca agli ambienti sanitarireali 23,24,25,26,27.

Gli attuali flussi di lavoro XAI nel settore sanitario spesso valutano tecniche di spiegazione individuale o modelli predittivi isolatamente e raramente forniscono protocolli standardizzati che integrino la preparazione dei dati, la modellazione predittiva, la valutazione della spiegabilità, la valutazione centrata sull'uomo e le risorse di riproducibilità 28,29,30,31 . Di conseguenza, ricercatori e professionisti possono incontrare difficoltà nel riprodurre flussi di lavoro, confrontare metodi di spiegazione o valutare l'utilità pratica dei sistemi di IA spiegabili tra diversi dataset e domini applicativi sanitari. È quindi necessario un protocollo completo e riproducibile per facilitare un'implementazione, valutazione e reportistica coerente dei flussi di lavoro spiegabili dell'IA sanitaria 32,33,34,35.

Qui presentiamo un protocollo riproducibile per sviluppare, valutare e interpretare sistemi di intelligenza artificiale spiegabili nell'analisi sanitaria. Il protocollo integra la preelaborazione dei dati, la modellazione predittiva, la valutazione della spiegabilità utilizzando SHAP, LIME e Grad-CAM, la valutazione centrata sul clinico, procedure di validazione e risorse di riproducibilità all'interno di un flusso di lavoro unificato. L'obiettivo è fornire un quadro standardizzato che supporti lo sviluppo trasparente dei modelli, la valutazione della qualità delle spiegazioni e l'implementazione riproducibile attraverso diversi datasetsanitari 36, 37, 38, 39. Il contributo metodologico di questo lavoro risiede nell'integrazione di analisi predittiva, valutazione della spiegabilità, validazione da parte dei clinici e pratiche di riproducibilità in un unico protocollo adatto alla ricerca, istruzione e studi orientati al deployment dell'IAsanitaria 40,41,42,43.

Il contributo principale di questo lavoro non è lo sviluppo di un nuovo algoritmo di spiegabilità.

Piuttosto, fornisce un protocollo standardizzato, riproducibile e convalidato sperimentalmente che integra modellazione predittiva, valutazione della spiegabilità, visualizzazione, valutazione e interpretazione centrata sull'uomo in un flusso di lavoro unificato adatto all'analisi sanitaria e alla diffusione di protocolli basati su JoVE. L'obiettivo principale di questo lavoro non è introdurre un algoritmo predittivo innovativo, ma fornire un protocollo standardizzato, riproducibile e convalidato sperimentalmente per implementare flussi di lavoro di intelligenza artificiale spiegabili nell'analisi sanitaria. Il protocollo integra la preelaborazione dei dati, la modellazione predittiva, la valutazione della spiegabilità, la valutazione centrata sul clinico e le risorse di riproducibilità in un quadro unificato adatto all'adozione, replicazione e diffusione educativa.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tutti i dataset utilizzati in questo studio sono stati ottenuti da repository pubblici e completamente anonimizzati, inclusi il UCI Machine Learning Repository, il database PhysioNet MIMIC-III e i dataset NIH Chest X-ray. Non sono state accessibili informazioni identificabili del paziente. Lo studio ha rispettato le linee guida etiche istituzionali della ricerca per l'analisi secondaria di dati pubblicamente deidentificati. Non era richiesta l'approvazione formale del Consiglio di Revisione Istituzionale perché non sono stati reclutati direttamente partecipanti umani e non sono state utilizzate informazioni sanitarie protette.

1. Panoramica dei Quadri Sperimentali

  1. Sviluppare una pipeline di intelligenza artificiale (XAI) riproducibile e spiegabile per un'analisi sanitaria trasparente. Organizza il flusso di lavoro in livello dati, livello di preelaborazione, livello di modellazione, livello di spiegabilità, livello di valutazione e livello di visualizzazione.
  2. Integrare questi moduli in un flusso di lavoro unificato in grado di elaborare dati clinici strutturati, cartelle cliniche elettroniche e dataset di imaging medico.
  3. Assicurati che ogni modulo contribuisca alla riproducibilità, interpretabilità, scalabilità e esecuzione sperimentale standardizzata.
  4. Progetta l'architettura modulare per supportare lo streaming continuo dei dati e garantire che ogni fase della pipeline contribuisca alla riproducibilità, interpretabilità e scalabilità durante tutto il flusso di lavoro sperimentale.

2. Ambiente computazionale e configurazione del sistema

  1. Installa le dipendenze software richieste prima di eseguire il flusso di lavoro aprendo un terminale da riga di comando ed eseguendo il seguente comando:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Verifica l'installazione riuscita di tutti i pacchetti software e verifica la compatibilità con le versioni software elencate nella Tabella dei Materiali prima di procedere con la pre-elaborazione dei dati e lo sviluppo del modello.
  3. Usa Python 3.11 come ambiente di programmazione principale. Installa e configura NumPy 1.26 e Pandas 2.1 per compiti di manipolazione dei dati e ingegneria delle funzionalità. Installa Scikit-learn 1.5 per lo sviluppo e la valutazione di modelli di machine learning.
  4. Installa TensorFlow 2.15 per l'addestramento e l'inferenza di modelli di deep learning. Installa SHAP 0.46 e LIME 0.2.0 per l'analisi della spiegabilità. Installa OpenCV 4.10 per i compiti di elaborazione delle immagini. Installa Matplotlib 3.9 e Seaborn 0.13 per la visualizzazione dei dati e la reportistica dei risultati. Consulta la Tabella dei Materiali per le specifiche software complete e i dettagli di implementazione necessari per la riproducibilità.
  5. Configura l'ambiente computazionale utilizzando una workstation dotata di processore multi-core, accelerazione delle unità di elaborazione grafica (GPU) e risorse di memoria sufficienti per ospitare grandi dataset sanitari e carichi di lavoro di deep learning.
  6. Impostare semi casuali fissi per la partizione dei dati, l'inizializzazione del modello e le procedure di addestramento per garantire la riproducibilità tra esecuzioni sperimentali. Abilita meccanismi di logging per registrare operazioni di pre-elaborazione dei dati, configurazioni di modelli, impostazioni di iperparametri, procedure di addestramento e risultati di valutazione durante tutto il flusso di lavoro.
  7. Configura le architetture dei modelli, i parametri di ottimizzazione, le velocità di apprendimento, le dimensioni dei lotti, le impostazioni di addestramento e i valori degli iperparametri secondo le specifiche riassunte nella Tabella 1. Rispetta queste impostazioni durante gli esperimenti di replicazione per garantire la coerenza con i risultati riportati.
  8. Output Atteso - Un ambiente computazionale completamente configurato e riproducibile con tutti i pacchetti software necessari, risorse hardware, meccanismi di logging e impostazioni di configurazione del modello disponibili per la successiva preprocessing dei dati, sviluppo del modello, analisi della spiegabilità e procedure di valutazione.
ComponenteParametroValoreDescrizione
Foresta Casualen_estimators100Numero di alberi
Foresta Casualemax_depthNessunaProfondità dell'albero
XGBoostlearning_rate0.01Tasso di apprendimento
XGBoostn_estimators100Munizioni di potenziamento
CNNEpoche25Epoche di addestramento
CNNbatch_size32Dimensione del lotto
CNNOttimizzatoreAdamAlgoritmo di ottimizzazione
MLPhidden_layers2Numero di strati nascosti
MLPAttivazioneReLUFunzione di attivazione
Generaletrain_split70%Rapporto dati di addestramento
Generalevalidation_split15%Rapporto di validazione
Generaletest_split15%Rapporto di test

Tabella 1: Dettagli di implementazione e configurazione degli iperparametri.

Questa tabella riassume l'ambiente computazionale, le librerie software, le configurazioni dei modelli di machine learning e deep learning, le impostazioni di ottimizzazione, i tassi di apprendimento, le dimensioni dei lotti, i parametri di addestramento e i valori degli iperparametri utilizzati durante la valutazione sperimentale del framework di IA spiegabile proposto.

3. Preparazione e preelaborazione del dataset

  1. Selezionare dataset sanitari pubblici per garantire trasparenza e riproducibilità del flusso di lavoro sperimentale;
  2. Utilizzare quattro scenari rappresentativi di sanità per validare il quadro proposto: (i) diagnosi di cancro al seno utilizzando il Wisconsin Breast Cancer Dataset, (ii) previsione del rischio di diabete utilizzando il Pima Indians Diabetes Dataset, (iii) previsione degli esiti clinici utilizzando le cartelle cliniche elettroniche MIMIC-III, e (iv) classificazione della malattia toracica utilizzando il NIH Chest X-ray Dataset. Scegli questi dataset per valutare il quadro tra cartelle cliniche strutturate, cartelle cliniche elettroniche longitudinali e modalità di imaging medico comunemente utilizzate nei sistemi di supporto alle decisioni sanitarie.
  3. Importare ogni dataset nell'ambiente Python e separare i record in caratteristiche di input e variabili target. Organizzare dati clinici strutturati per compiti di previsione delle malattie, cartelle cliniche elettroniche per l'analisi longitudinale degli esiti e dataset di imaging medico per compiti di classificazione diagnostica. Verifica l'integrità di ogni dataset prima di procedere con le operazioni di pre-elaborazione.
  4. Identificare e correggere i valori mancanti utilizzando tecniche di imputazione appropriate. Standardizzare le caratteristiche numeriche tramite procedure di scala e normalizzazione delle caratteristiche per garantire la comparabilità tra variabili.
  5. Codificare variabili categoriche utilizzando metodi di codifica adeguati basati sulle caratteristiche del dataset. Effettuare la selezione delle caratteristiche utilizzando analisi di correlazione e misure di importanza delle caratteristiche basate su modelli per identificare le variabili più rilevanti e ridurre la dimensionalità dei dati.
  6. Ridimensiona tutte le immagini mediche a 224, 224 pixel prima dell'addestramento al modello. Normalizzare i valori dell'intensità dei pixel in base ai requisiti dell'architettura di deep learning selezionata. Applicare tecniche di aumento dei dati, inclusi la rotazione delle immagini e il flipping orizzontale, per migliorare la generalizzazione dei modelli e ridurre l'overfitting. Verifica la qualità dell'immagine e assicurati la coerenza delle dimensioni dell'immagine in tutto il dataset.
  7. Valuta l'integrità dei dati valutando la completezza, la coerenza e l'allineamento delle etichette delle caratteristiche. Verifica che tutti i record siano correttamente assegnati alle rispettive classi target. Rivedere le caratteristiche del dataset, inclusa la dimensione del campione, il numero di caratteristiche e la modalità dei dati, come riassunto nella Tabella 2.
  8. Implementare procedure di validazione specifiche per dataset per garantire rigore metodologico e riproducibilità. Registra la dimensione del campione, la distribuzione delle classi, la strategia di divisione train-validation-test, le misure di prevenzione delle perdite, le procedure di ottimizzazione degli iperparametri, il design di validazione incrociata e il protocollo di test esterno per ogni dataset. Riassumi queste procedure di validazione nella Tabella 3.
  9. Eseguire controlli di qualità pre-elaborazione valutando la gestione dei valori mancanti, la rimozione degli outlieri, la scala delle caratteristiche, la codifica categoriale, la conservazione della distribuzione delle classi e le procedure di partizionamento dei dataset. Verifica che le operazioni di preprocessing siano applicate in modo coerente su tutti i dataset.
  10. Confermare l'assenza di una notevole perdita di dati durante la partizione del dataset. Esaminare i risultati della validazione della pre-elaborazione presentati nella Figura 1 per assicurarti che siano stati generati dataset standardizzati per le successive analisi di machine learning e spiegabilità.
  11. Output atteso - Generare dataset puliti e standardizzati con valori mancanti adeguatamente indirizzati, variabili categoriche codificate, caratteristiche numeriche normalizzate e record suddivisi in sottoinsiemi di addestramento, validazione e test. Assicurarsi che le caratteristiche del dataset, le distribuzioni di classe e le procedure di validazione corrispondano a quelle riportate nelle Tabelle 2 e Tabella 3, e confermare la validazione di preelaborazione di successo come illustrato nella Figura 1.
DatasetTipoCampioniCaratteristicheBersaglio
Cancro al senoTabulare56930Benigno/Maligno
DiabeteTabulare7688Esito del diabete
MIMIC-IIIEHR~60.000Variabili clinicheMortalità
Radiografia toracicaImaging~112.000ImmaginiEtichette per le malattie

Tabella 2: Caratteristiche del dataset e casi d'uso nel settore sanitario.

Questa tabella fornisce un riassunto dei dataset sanitari utilizzati nello studio, inclusi il tipo di dataset, il numero di campioni, il numero di caratteristiche, le variabili target, il dominio applicativo sanitario e i relativi casi d'uso clinici. I dataset comprendono cartelle cliniche strutturate, cartelle cliniche elettroniche e dati di imaging medico per dimostrare l'applicabilità del quadro in diversi scenari di analisi sanitaria.

DatasetDimensione del campioneDistribuzione delle classiStrategia di DivisionePrevenzione delle perditeRicerca con iperparametriValidazione incrociataTest esterno
Cancro al seno (UCI Wisconsin)569357 Benigno / 212 Maligno70/15/15Preprocessing solo per treniRicerca a grigliaCV stratificata a 5 piediSet Indipendente di Resistenza
Diabete degli Indiani Pima768500 Non Diabetici / 268 Diabetici70/15/15Preprocessing solo per treniRicerca a grigliaCV stratificata a 5 piediSet Indipendente di Resistenza
MIMIC-III EHR5274Coorti stratificate per risultati70/15/15 Livello pazienteSeparazione a livello di pazienteRicerca casualeCV a 5 volte a livello pazienteSet Indipendente di Resistenza
Radiografia toracica del NIH112120Polmonite/Stratificata normale70/15/15Separazione a livello di immagineRicerca casualeCV stratificata a 5 piediSet Indipendente di Resistenza

Tabella 3: Validazione a livello di dataset e progettazione sperimentale.

Questa tabella riassume la metodologia di validazione utilizzata per ogni dataset, inclusa dimensione del campione, distribuzione delle classi, strategia di divisione train-validation-test, procedure di prevenzione delle perdite, metodi di ottimizzazione degli iperparametri, progettazione di validazione incrociata e protocolli di test esterni. Queste misure sono state implementate per garantire rigore metodologico, riproducibilità e valutazione imparziale del modello.

figure-protocol-1
Figura 1: Validazione della pipeline di preprocessing dei dati.
Risultati di validazione per le operazioni chiave di preprocessing eseguite prima dello sviluppo del modello. (A) Analisi del valore mancante tra le caratteristiche rappresentative della sanità. (B) Distribuzione di una variabile numerica prima e dopo la gestione degli outlie. (C) Validazione della scala delle funzionalità tramite standardizzazione. (D) Validazione della codifica categorica. (E) Distribuzione delle classi dopo la preelaborazione. (F) Validazione della partizionazione dei dati train-validation-test. Questi risultati confermano il successo della pre-elaborazione e della preparazione dei dataset per modellazione predittiva e analisi della spiegabilità. Clicca qui per visualizzare una versione più grande di questa figura.

4. Architettura di Sistema del Framework di IA Spiegabile

  1. Organizza il framework utilizzando un'architettura a livelli per facilitare l'elaborazione modulare, migliorare la trasparenza del flusso di lavoro e supportare un'implementazione riproducibile. Configura il Data Layer per ricevere e gestire dataset sanitari grezzi. Instradare tutti i dataset in arrivo attraverso il Data Layer prima di avviare le operazioni di pre-elaborazione.
  2. Eseguire procedure di pulizia dei dati, trasformazione, normalizzazione, ingegneria delle caratteristiche e codifica all'interno dello Livello di Preelaborazione. Assicurarsi che tutte le operazioni di pre-elaborazione siano completate prima dello sviluppo del modello.
  3. Sviluppare modelli predittivi all'interno del Livello di Modellazione utilizzando algoritmi di machine learning e deep learning. Modelli di Train Gradient Boosting, Random Forest, Multilayer Perceptron (MLP) e Convolutional Neural Network (CNN) utilizzando dataset preprocessati e configurazioni ottimizzate degli iperparametri.
  4. Applicare tecniche di spiegabilità all'interno dello Strato di Spiegabilità per interpretare le previsioni dei modelli. Genera spiegazioni di attribuzione di caratteristiche usando SHAP e LIME per dataset strutturati. Genera heatmap Grad-CAM per modelli basati su immagini per visualizzare le regioni che contribuiscono alle previsioni del modello.
  5. Valutare le prestazioni predittive e di spiegabilità all'interno del Livello di Valutazione. Calcola accuratezza, precisione, richiamo, punteggio F1, ROC-AUC, fedeltà, stabilità e metriche di valutazione centrate sul clinico. Registra tutti i risultati delle valutazioni per analisi e report successivi.
  6. Genera output visivi clinicamente interpretabili all'interno dello Layer di Visualizzazione. Crea grafici di confronto delle prestazioni, visualizzazioni di importanza delle caratteristiche, grafici riassuntivi SHAP, spiegazioni LIME, heatmap Grad-CAM e dashboard di reportistica orientati ai clinici. Conserva tutti i risultati visivi per essere inclusi nel rapporto sperimentale finale.
  7. Esamina l'architettura completa del framework illustrata nella Figura 2 prima di procedere con l'esecuzione del workflow.
  8. Output atteso - Generare modelli completamente addestrati di machine learning e deep learning, inclusi Gradient Boosting, Random Forest, CNN e MLP. Memorizza configurazioni dei modelli, iperparametri ottimizzati, log di addestramento, file checkpoint, output di spiegabilità e artefatti di visualizzazione per la successiva valutazione e analisi interpretabile.

figure-protocol-2
Figura 2: Architettura di Sistema del Framework di IA Spiegabile per l'Analisi Sanitaria. Clicca qui per visualizzare una versione più grande di questa figura.

5. Esecuzione del flusso di lavoro

  1. Acquisire dataset sanitari da repository pubblici e memorizzare i dataset in formati strutturati adatti all'analisi di machine learning e deep learning. Esaminare l'intero flusso di lavoro illustrato nella Figura 3 prima di avviare la procedura sperimentale.
  2. Eseguire la pulizia e la pre-elaborazione dei dati secondo le procedure descritte nella Sezione 3. Normalizzare le variabili numeriche utilizzando metodi di scalabilità appropriati. Codificare variabili categoriche utilizzando tecniche di codifica appropriate. Identificare e imputare i valori mancanti utilizzando strategie di imputazione specifiche per dataset. Verifica la qualità dei dati, l'allineamento delle etichette delle caratteristiche e la completezza del dataset prima di procedere con lo sviluppo del modello.
  3. Partizionare ogni dataset in sottoinsiemi di addestramento, validazione e test per supportare la valutazione imparziale del modello. Preservare le distribuzioni di classe durante la partizionazione del dataset e implementare misure di prevenzione delle perdite quando applicabile. Riserva il sottoinsieme di test esclusivamente per la valutazione finale del modello.
  4. Addestrare modelli di machine learning su dataset strutturati utilizzando algoritmi basati su ensemble, inclusi Gradient Boosting e Random Forest. Addestrare modelli di deep learning su dataset di imaging utilizzando architetture di Reti Neurali Convoluzionali (CNN) capaci di apprendere le caratteristiche dell'immagine spaziale. Aggiornare iterativamente i parametri del modello durante l'addestramento e monitorare le prestazioni di validazione dopo ogni epoca di addestramento. Applicare l'arresto anticipato quando le prestazioni di validazione peggiorano o non migliorano secondo i criteri di arresto predefiniti.
  5. Ottimizzare gli iperparametri del modello utilizzando strategie di ricerca sistematica, inclusa la ricerca a griglia e la ricerca randomizzata. Regolare la velocità di apprendimento, il numero di stimatori, la profondità dell'albero, la dimensione del lotto, il numero di epoche e altri parametri specifici del modello in base alle prestazioni di validazione. Seleziona il modello finale in base alle prestazioni predittive e alla capacità di generalizzazione tra i dataset di validazione.
  6. Applica metodi di spiegabilità dopo aver completato l'addestramento al modello. Generare spiegazioni globali utilizzando tecniche di attribuzione di caratteristiche per identificare le variabili che contribuiscono maggiormente alle previsioni del modello. Generare spiegazioni locali per analizzare i singoli casi di previsione e valutare il comportamento del modello a livello di campione. Crea heatmap Grad-CAM per modelli di classificazione delle immagini per evidenziare le regioni dell'immagine che contribuiscono al risultato previsto. Conserva tutti i risultati delle spiegazioni per analisi e report successivi.
  7. Valutare le prestazioni predittive utilizzando accuratezza, precisione, richiamo, punteggio F1 e area di caratteristiche operative del ricevitore sotto la curva (ROC-AUC). Valuta la qualità delle spiegazioni utilizzando metriche di fedeltà e stabilità per valutare l'affidabilità e la coerenza delle spiegazioni. Confronta le prestazioni dei modelli tra dataset e metodi di spiegabilità per valutare la robustezza e la generalizzazione del framework.
  8. Generare risultati di visualizzazione e rapporti analitici per comunicare i risultati in modo clinicamente interpretabile. Crea grafici di confronto delle prestazioni, grafici di importanza delle caratteristiche, visualizzazioni riassuntive SHAP, output delle spiegazioni LIME, heatmap Grad-CAM e altre visualizzazioni clinicamente rilevanti. Rivedi tutti i risultati visivi per assicurarti chiarezza e coerenza prima di segnalare.
  9. Documenta tutte le operazioni di preelaborazione, configurazioni del modello, impostazioni degli iperparametri, procedure di spiegabilità, strategie di validazione e risultati di valutazione. Mantenere registri sperimentali dettagliati per facilitare la riproducibilità e la replica indipendente del flusso di lavoro. Verifica la coerenza dei risultati attraverso ripetute esecuzioni sperimentali e archivia tutti gli artefatti del workflow per riferimento futuro.
  10. Output atteso - Generare un modello predittivo completamente addestrato con iperparametri ottimizzati, pesi del modello salvati, log di addestramento, metriche di performance e output spiegabili, incluse spiegazioni SHAP, LIME e heatmap Grad-CAM. Memorizza tutti gli artefatti del modello, i rapporti di valutazione e i risultati della visualizzazione per analisi successive e valutazioni della riproducibilità.

figure-protocol-3
Figura 3: Flusso di lavoro end-to-end della pipeline di IA spiegabile. Clicca qui per visualizzare una versione più grande di questa figura.

6. Valutazione del modello e valutazione della spiegabilità

  1. Valutare le prestazioni predittive del modello utilizzando metriche di classificazione standard, tra cui accuratezza, precisione, richiamo, punteggio F1 e area di caratteristiche operative del ricevitore sotto la curva (ROC-AUC). Calcola l'accuratezza per misurare la correttezza complessiva della classificazione.
  2. Calcolare la precisione per valutare la proporzione di previsioni positive correttamente identificate. Calcola il richiamo per valutare la capacità del modello di identificare casi positivi. Calcola il punteggio F1 per bilanciare precisione e richiamo. Calcolare il ROC-AUC per valutare le prestazioni discriminative su diverse soglie di classificazione.
  3. Applicare queste metriche di valutazione in modo coerente su tutti i dataset e le architetture dei modelli per facilitare il confronto oggettivo delle prestazioni. Registra tutti i valori delle metriche e memorizza i risultati della valutazione per analisi statistiche e reportistiche successive.
  4. Valuta le prestazioni di spiegabilità utilizzando metriche di fedeltà e stabilità. Calcola la fedeltà per determinare fino a che punto le spiegazioni generate riflettano accuratamente le previsioni del modello e il comportamento decisionale.
  5. Calcola la stabilità confrontando le spiegazioni generate da campioni di input simili e quantificando la coerenza degli output delle spiegazioni. Verifica che i valori di fedeltà e stabilità soddisfino i criteri di qualità predefiniti prima di interpretare le spiegazioni del modello.
  6. Confronta le prestazioni di spiegabilità tra output SHAP, LIME e Grad-CAM.
  7. Output atteso - Generare risultati di valutazione quantitativa, inclusi accuratezza, precisione, richiamo, F1-score, ROC-AUC, fedeltà e metriche di stabilità. Produrre risultati spiegabili e visualizzazioni adatte per la reportistica scientifica, la valutazione della riproducibilità e l'interpretazione clinica.

7. Valutazione Centrata sull'Uomo

  1. Reclutare 12 professionisti sanitari, composti da 6 medici, 3 radiologi e 3 analisti di dati clinici. Seleziona i partecipanti con esperienza pregressa nel processo decisionale clinico, nell'interpretazione di immagini mediche, nell'analisi sanitaria o nella revisione delle cartelle cliniche elettroniche. Ottieni il consenso informato di tutti i partecipanti prima di avviare la procedura di valutazione.
  2. Selezionare casualmente 100 casi dai dataset di test dopo aver completato l'addestramento del modello e l'analisi della spiegabilità. Generare due condizioni di valutazione per ogni caso:
    1. Output solo per previsione e
    2. previsione accompagnata da informazioni spiegabili. Randomizzare l'ordine di presentazione dei casi e le condizioni di valutazione per minimizzare il bias di presentazione e gli effetti di apprendimento.
  3. Prepara moduli di valutazione standardizzati contenenti risultati di previsione, risultati di spiegazione e questionari di valutazione. Presentare i casi individualmente ai partecipanti utilizzando un'interfaccia di valutazione computerizzata.
  4. Istruire i partecipanti a esaminare ogni caso in modo indipendente senza discutere le risposte con altri valutatori. Consentire ai partecipanti di completare tutte le valutazioni in condizioni sperimentali identiche.
  5. Somministra un questionario su scala Likert a cinque punti adattato da studi di valutazione dell'intelligenza artificiale spiegabili pubblicati. Istruire i partecipanti a valutare fiducia, interpretabilità e usabilità per ogni caso esaminato. Registra le risposte ai questionari elettronicamente e verifica il completamento di tutti gli elementi del sondaggio prima di procedere con l'analisi statistica.
  6. Misurare indicatori oggettivi di utilità clinica durante il processo di valutazione. Registra l'accordo decisionale confrontando le decisioni dei partecipanti con le corrispondenti etichette di riferimento o risultati basati sulla realtà. Calcola l'accordo decisionale come la percentuale di decisioni dei partecipanti che corrispondono al risultato di riferimento.
  7. Registra il tempo di revisione per ogni caso misurando l'intervallo tra la presentazione del caso e la presentazione della risposta finale. Calcola separatamente il tempo medio di revisione per le condizioni solo di previsione e quelle con spiegazione.
  8. Calcola i punteggi medi di fiducia, interpretabilità e usabilità tra tutti i partecipanti e i casi di valutazione. Confrontare i punteggi ottenuti in condizioni solo di previsione e di previsione con spiegazione.
  9. Eseguire test t accoppiati dopo il completamento di tutte le valutazioni dei partecipanti per determinare se differenze in termini di fiducia, interpretabilità, usabilità, accordo decisionale e tempo di revisione siano statisticamente significative. Utilizzare una soglia di significatività di p 0,05 per tutti i confronti statistici.
  10. Calcolare Fleiss Kappa dopo aver raccolto le risposte di tutti i partecipanti per valutare l'accordo tra valutatori. Utilizzare le valutazioni aggregate dei partecipanti per determinare la coerenza delle valutazioni tra i revisori. Interpretare i valori Fleiss Kappa secondo le linee guida stabilite dell'accordo e registrare le statistiche risultanti dell'accordo.
  11. Riassumere la demografia dei partecipanti, la metodologia di valutazione, la progettazione del questionario, le procedure di analisi statistica, le misure di performance oggettiva e i risultati dell'accordo tra valutatori nella Tabella 4.
  12. Esaminare i risultati dei modelli in entrambe le condizioni di valutazione e confrontare le risposte dei partecipanti tra le condizioni. Verifica che le spiegazioni migliorino fiducia, interpretabilità e usabilità senza influire negativamente sulla qualità decisionale.
  13. Confermare la coerenza delle valutazioni dei partecipanti utilizzando la statistica calcolata di Fleiss Kappa. Registra tutti i risultati della valutazione per la successiva segnalazione e la valutazione della riproducibilità.
  14. Output atteso - Generare punteggi di fiducia dei clinici, valutazioni di interpretabilità, valutazioni di usabilità, misure decisione-accordo, statistiche sul tempo di revisione, risultati del test t accoppiato e statistiche di accordo tra valutatori. Produrre prove quantitative che descrivono l'utilità clinica, l'interpretabilità e l'affidabilità del quadro di intelligenza artificiale spiegabile.
ParametroValore
Esperti12
Medici6
Radiologi3
Analisti di Dati Clinici3
Casi esaminati100
Progetto di valutazioneRandomizzato (Solo previsione vs Previsione+Spiegazione)
Strumento di rilevamentoScala di Likert a 5 punti
Valutazione del TrustInterpretabilità, Fiducia, Usabilità
Test statisticoTest t accoppiato (p 0.05)
Affidabilità tra valutatoriFleiss Kappa
Misure OggettiveAccordo decisionale, Tempo di revisione

Tabella 4: Protocollo di valutazione centrata sull'uomo e disegno della valutazione clinica.

Questa tabella presenta il quadro di valutazione clinico utilizzato per verificare l'interpretabilità, l'affidabilità e l'usabilità del sistema di IA spiegabile. Le informazioni riguardanti la demografia dei partecipanti, la metodologia delle case review, la progettazione del sondaggio, le procedure di analisi statistica, la valutazione dell'affidabilità tra valutatori e le misure di valutazione oggettiva sono riassunte.

8. Valutazione della validazione e della riproducibilità

  1. Eseguire studi di validazione e ablazione per valutare la robustezza e l'affidabilità del quadro proposto. Identificare le caratteristiche con punteggi di alta importanza utilizzando i metodi di spiegabilità selezionati. Rimuovere le caratteristiche importanti in modo incrementale e riaddestrare i modelli predittivi dopo ogni passaggio di rimozione delle caratteristiche.
  2. Valutare le prestazioni del modello dopo ogni esperimento di ablazione utilizzando accuratezza, precisione, richiamo, punteggio F1 e metriche ROC-AUC. Confrontare i valori di prestazione risultanti con le prestazioni di base del modello per determinare il contributo delle singole caratteristiche agli esiti predittivi.
  3. Valuta la stabilità delle spiegazioni generando spiegazioni per campioni di input simili utilizzando SHAP, CLIME, Grad-CAM. Confronta i risultati delle spiegazioni tra valutazioni ripetute e quantifica la coerenza utilizzando le metriche di stabilità predefinite. Verifica che le spiegazioni rimangano stabili sotto piccole variazioni di input e ripetute esecuzioni sperimentali.
  4. Registra tutte le procedure sperimentali durante il flusso di lavoro. Documentare operazioni di pre-elaborazione dei dati, procedure di partizionamento dei dataset, architetture di modelli, impostazioni di iperparametri, configurazioni di addestramento, metodi di spiegabilità, strategie di validazione e metriche di valutazione. Memorizza tutti i parametri di configurazione e gli output sperimentali in un formato strutturato per facilitare la riproducibilità e la verifica indipendente.
  5. Esamina tutti i registri sperimentali per garantirne completezza e coerenza. Verifica che il flusso di lavoro possa essere replicato utilizzando le procedure documentate, i file di configurazione e le specifiche software. Mantenere una struttura di flusso di lavoro modulare per facilitare l'adattamento del protocollo per studi futuri e supportare la conversione in un protocollo sperimentale basato su video, conforme ai requisiti metodologici JoVE.

9. Risorse di riproducibilità

  1. Eseguire tutti gli esperimenti utilizzando semi casuali fissi per garantire risultati riproducibili attraverso ripetute esecuzioni. Mantenere il codice sorgente, gli script di preelaborazione, i file di configurazione, le specifiche dell'ambiente, i parametri del modello e gli script di visualizzazione all'interno di un repository accessibile al pubblico.
  2. Fornire istruzioni dettagliate per l'acquisizione del dataset, la pre-elaborazione, l'esecuzione degli esperimenti, l'addestramento del modello, la generazione di spiegabilità, le procedure di validazione e la rigenerazione di tutte le tabelle e figure riportate. Archiviare tutti i componenti del flusso di lavoro necessari per la replica indipendente, incluse specifiche software, flussi di preelaborazione, file di configurazione, istruzioni di accesso al dataset, checkpoint del modello e asset di visualizzazione.
  3. Riassumi le risorse software, i flussi di lavoro di preelaborazione, i file di configurazione, le istruzioni di accesso al dataset e gli asset di riproducibilità utilizzati in tutto il framework nella Tabella 5.
  4. Output atteso - Generare un pacchetto sperimentale riproducibile completo contenente script di preelaborazione, file di configurazione, modelli addestrati, checkpoint del modello, output spiegabili, rapporti di validazione, artefatti di visualizzazione, specifiche software e documentazione necessaria per la replicazione e verifica indipendente del framework proposto.
RisorsaDescrizione
Codice sorgenteScript di implementazione in Python per la preelaborazione dei dati, l'addestramento dei modelli, la spiegabilità e la valutazione
File Ambienterequirements.txt contenente dipendenze e versioni di pacchetti
File di configurazioneImpostazioni dell'architettura del modello, iperparametri e configurazioni degli esperimenti
Semi casuali fissiSeed = 42 utilizzati per esperimenti riproducibili
Istruzioni per l'accesso al datasetCollegamenti e procedure per l'acquisizione di dataset per la sanità pubblica
Preprocessing ScriptScript per la pulizia dei dati, la normalizzazione, la codifica e la selezione delle funzionalità
Script di generazione di figureCopioni per rigenerare tutte le figure manoscritte
Script di generazione di tabelleScript per riprodurre tabelle e metriche riportate
Esempi di inputDataset di esempio e file di input
Esempi di outputRisultati previsionali, spiegazioni e rapporti di valutazione

Tabella 5: Risorse di riproducibilità e risorse sperimentali.

Questa tabella riassume le risorse fornite per supportare la riproducibilità sperimentale, inclusi il codice sorgente, script di preelaborazione, file di configurazione, specifiche dell'ambiente, istruzioni di accesso al dataset, impostazioni di seed casuali fisse, script di generazione di figure e file di input/output di esempio necessari per riprodurre i risultati riportati.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Abbiamo valutato a fondo la componente esplicativa di IA dell'intera nostra pipeline, valutando quanto bene prevedeva diversi tipi di dati sanitari, inclusi sia dati clinici strutturati che immagini mediche. Gli esiti hanno indicato una performance predittiva coerente tra i dataset valutati. Tra i modelli testati, il modello di gradiente boosting ha raggiunto la massima accuratezza al 97,4%, seguito dal modello della foresta casuale al 94,2%. I metodi di deep learning applicati ai set di immagini hanno raggiunto una precisione del 91,3%, mentre i modelli a perceptrone multistrato hanno prodotto risultati leggermente inferiori, il 90,8%. Ciò suggerisce che i modelli di machine learning basati su ensemble si comportano meglio su dati sanitari strutturati, mentre le architetture di deep learning eccellono nei compiti di imaging. La Tabella 6 delinea in dettaglio varie metriche di performance per le funzioni di previsione, tra cui accuratezza, precisione, richiamo e punteggio F1, oltre a metriche di spiegabilità come fedeltà e stabilità. Siamo arrivati a questi dati di performance utilizzando una validazione incrociata a cinque volte e presentando i risultati come valori medi (con intervalli di confidenza del 95%). Gli intervalli di confidenza non solo indicano l'incertezza del modello, ma rendono anche i confronti delle prestazioni predittive più affidabili, tenendo conto della memoria dei dataset e delle differenze nelle architetture dei modelli.

ModelloAccuratezza (%)PrecisioneRichiamoF1-ScoreFidelitàStabilitàIC al 95%
Foresta Casuale94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN (Imaging)91.30.900.910.900.880.8690.1–92.5

Tabella 6: Prestazioni comparative dei modelli predittivi e dei metodi di spiegabilità.
Questa tabella presenta una valutazione comparativa dei modelli di machine learning e deep learning utilizzando metriche predittive di prestazione, tra cui accuratezza, precisione, richiamo, punteggio F1 e ROC-AUC. Inoltre, sono riportate che metriche di spiegabilità come fedeltà, stabilità, comprensibilità e punteggi di fiducia umana forniscono una valutazione completa sia dell'efficacia predittiva che dell'interpretabilità.

I risultati indicano che il Gradient Boosting ha raggiunto la più alta performance predittiva complessiva (97,4% di accuratezza), superando Random Forest di 3,2 punti percentuali e i modelli di deep learning di oltre 6 punti percentuali. Questa osservazione suggerisce che i metodi di apprendimento basati su ensemble sono stati particolarmente efficaci per i dataset sanitari strutturati inclusi in questo studio. La differenza di prestazioni minore tra i modelli CNN e MLP indica che l'aumento della complessità del modello da solo non si traduceva necessariamente in prestazioni predittive superiori nelle condizioni sperimentali valutate.
Per mostrare l'utilità del nostro framework proposto in una varietà di compiti di analisi sanitaria, presentiamo i risultati delle prestazioni previsionali specifiche per dataset nella Tabella 7.

Analisi specifica del dataset.
Le prestazioni variavano tra i dataset a causa delle differenze nella complessità delle caratteristiche, nella dimensione del campione, nella distribuzione delle classi e nella modalità dei dati. Il dataset Breast Cancer ha raggiunto la più alta accuratezza predittiva, probabilmente grazie alla ben definita separabilità delle caratteristiche. Prestazioni leggermente inferiori nei dataset MIMIC-III e NIH Chest X-ray riflettono la maggiore complessità delle cartelle cliniche longitudinali e dei dati di imaging medico. Questi risultati dimostrano che la performance del framework è influenzata dalle caratteristiche del dataset e dal contesto clinico.

DatasetAccuratezza (%)Precisione (%)Richiamo (%)Punteggio F1 (%)
Cancro al seno97.497.297.697.1
Diabete94.293.994.494
MIMIC-III91.39191.591.1
Radiografia toracica del NIH90.890.491.290.6

Tabella 7: Risultati predittivi specifici per dataset.
Prestazioni predittive del framework proposto per l'IA spiegabile su quattro dataset rappresentativi della sanità. Accuratezza, precisione, richiamo e punteggio F1 sono riportati come percentuali (%) sui set di test indipendenti. Valori più alti indicano una migliore performance nella classificazione.

Per valutare le prestazioni predittive, sono stati valutati quattro modelli di machine learning e deep learning, ovvero Gradient Boosting, Random Forest, Convolutional Neural Network (CNN) e Multilayer Perceptron (MLP), su quattro dataset rappresentativi di ambito sanitario. Le prestazioni del modello sono state valutate utilizzando accuratezza, precisione, richiamo, punteggio F1 e metriche ROC-AUC su dataset di test indipendenti dopo una divisione train-validation-test 70:15:15 e una validazione incrociata cinque volte. I miglioramenti nelle prestazioni predittive sono stati determinati confrontando metriche di valutazione specifiche per modello tra condizioni identiche di preprocessing e validazione.
Per illuminare come le prestazioni dei modelli differiscano in vari metodi, la Figura 4 mostra in modo illustrato i vantaggi e gli svantaggi dei modelli di ensemble, reti neurali e deep learning.

figure-results-1
Figura 4: Prestazioni comparative dei modelli di machine learning e deep learning su compiti di previsione sanitaria. (A) Confronto di accuratezza dei modelli Gradient Boosting, Random Forest, CNN e MLP sul dataset di test. (B) Confronto dei punteggi F1 tra modelli Gradient Boosting, Random Forest, CNN e MLP nel dataset di test. (C) Confronto di precisione tra modelli Gradient Boosting, Random Forest, CNN e MLP sul dataset di test. (D) Richiamare il confronto tra i modelli Gradient Boosting, Random Forest, CNN e MLP sul dataset di test. Valori più alti indicano una migliore performance predittiva. Gradient Boosting ha raggiunto le prestazioni complessive più alte su tutte le metriche di valutazione, seguito da Random Forest. Clicca qui per visualizzare una versione più grande di questa figura.

Interpretazione della Prestazione Spiegabile.
SHAP ha costantemente raggiunto i punteggi di fedeltà e stabilità più alti tra i metodi di spiegabilità valutati, indicando un accordo più forte tra spiegazioni generate e previsioni del modello sottostante. La CALC ha mostrato una stabilità relativamente inferiore, suggerendo una maggiore sensibilità alle perturbazioni locali e alla variabilità del campionamento. Grad-CAM forniva spiegazioni visivamente interpretabili per i modelli basati su immagini ma produceva valori di fedeltà leggermente inferiori rispetto a SHAP. Questi risultati indicano che la qualità delle spiegazioni dipende sia dalla tecnica esplicativa selezionata sia dall'architettura predittiva sottostante.

Le tecniche di spiegabilità integrate nella pipeline sono state valutate in termini di prestazioni quantitative e qualitative. In particolare, i metodi di attribuzione delle caratteristiche sono riusciti a scoprire in modo abbastanza coerente la logica interna del modello tra diversi set di dati.
Tutti i metodi considerati nello studio, SHAP, hanno raggiunto la massima fedeltà (0,92) e stabilità (0,89) tra i metodi di spiegabilità valutati. Per dirla semplicemente, le spiegazioni erano rappresentazioni molto accurate di ciò che il modello aveva effettivamente previsto. I metodi di spiegazione locale sono una sorta di finestra attraverso la quale possiamo vedere una previsione specifica e comprendere cosa il modello ha usato come base per la decisione.

La performance interpretabile è stata valutata utilizzando fedeltà, stabilità, comprensibilità e punteggi di fiducia del clinico ottenuti dalla valutazione centrata sull'uomo. Le spiegazioni SHAP, LIME e Grad-CAM sono state confrontate utilizzando dataset identici e modelli addestrati. I miglioramenti nella spiegabilità sono stati valutati confrontando le metriche di qualità della spiegazione e le valutazioni dei clinici tra i metodi di abilità spiegativa valutati. Le tecniche di visualizzazione per modelli di deep learning che lavorano con immagini producono essenzialmente mappe di calore, che identificano le regioni delle immagini con maggiore rilevanza per la previsione del modello. Le distribuzioni dell'importanza delle caratteristiche e i confronti delle prestazioni delle spiegabili tra diversi metodi sono mostrati nella Figura 5.

figure-results-2
Figura 5: Valutazione delle prestazioni della spiegabilità.La figura presenta la performance dei metodi di spiegabilità con l'aiuto di metriche di fedeltà e stabilità. SHAP guida in termini di fedeltà (0,92) e stabilità (0,89), il che riflette un buon accordo tra spiegazioni e previsioni del modello. LIME si rivela il miglior strumento per l'interpretabilità di esempi individuali. D'altra parte, Grad-CAM produce heatmap visive utilizzate principalmente nei modelli di imaging, mostrando grossolanamente le regioni più importanti responsabili della previsione del modello, che, dal punto di vista clinico, potrebbero essere molto rilevanti. Clicca qui per visualizzare una versione più grande di questa figura.

Dopo aver valutato i modelli predittivi e le tecniche per l'interpretabilità, è emerso che la correlazione tra l'accuratezza di un modello e l'affidabilità delle sue spiegazioni è molto forte. Infatti, gli stessi modelli che mostravano miglioramenti nelle previsioni spiegavano i loro risultati con maggiore stabilità e coerenza quando le tecniche di interpretabilità venivano applicate correttamente. I modelli di ensemble si sono rivelati i più interpretabili quando accompagnati da metodi di attribuzione delle caratteristiche, mentre i modelli di deep learning sono stati meglio serviti dai metodi spiegabili basati sulla visualizzazione. Il collegamento che collega l'accuratezza della previsione e l'affidabilità delle spiegazioni si può vedere nella Figura 6, che delinea in grande dettaglio la dinamica concettuale tra modello e spiegabilità.

figure-results-3
Figura 6: Analisi comparativa dei modelli e spiegazione dei metodi di abilità.Il grafico mostra un confronto dettagliato dell'accuratezza e spiega le misure di abilità di vari modelli. Comprende un grafico a scatter che mostra la correlazione tra accuratezza e stabilità della spiegazione, un confronto tabulare delle prestazioni e una matrice di idoneità che delinea i diversi metodi di spiegazione delle capacità SHAP, LIME e Grad-CAM, e la loro efficacia con i diversi tipi di modelli. Il video mostra chiaramente che i modelli di ensemble più SHAP offrono un'ottima interpretabilità, mentre i modelli di deep learning sono spiegabili tramite tecniche di visualizzazione. Clicca qui per visualizzare una versione più grande di questa figura.

La valutazione centrata sull'uomo ha confermato l'utilità reale del sistema suggerito negli ospedali e in altre strutture cliniche. I professionisti medici hanno esaminato i risultati dei modelli con e senza spiegazioni. Mostrare i risultati con spiegazioni ha portato a un notevole aumento della fiducia e interpretabilità degli utenti; Il valore medio del trust è passato da 3,1 a 4,7 su una scala da 1 a 5. L'aumento del punteggio di fiducia da 3,1 a 4,7 rappresenta un miglioramento relativo approssimativo del 51,6%. L'importante accordo tra valutatori (κ di Fleiss = 0,81) indica inoltre una valutazione coerente da parte del clinico sull'utilità della spiegazione. Questi risultati suggeriscono che i risultati di spiegabilità possano migliorare la fiducia degli utenti e facilitare l'interpretazione delle decisioni cliniche assistite dall'IA. I professionisti hanno dichiarato una migliore comprensione dei risultati dei modelli e una maggiore fiducia nel giudizio supportato dall'IA sulle situazioni cliniche, il che evidenzia l'importanza dell'interpretabilità nell'effettiva implementazione dell'assistenza sanitaria.

Abbiamo ulteriormente verificato la robustezza del nostro framework con l'analisi dell'ablazione. La rimozione di caratteristiche critiche che, tramite metodi di spiegabilità, erano ritenute essenziali comportava una grande perdita delle prestazioni di previsione. Pertanto, il risultato riflette che le caratteristiche non erano solo pertinenti, ma anche significative per il compito predittivo. Inoltre, i risultati delle spiegazioni continuavano a mostrare differenze trascurabili quando venivano spiegati diversi campioni di input, mostrando così la stabilità e l'affidabilità dei metodi di spiegabilità.

Per verificare la fattibilità della pipeline per un uso pratico, ne abbiamo misurato la velocità di calcolo. L'introduzione delle tecniche di spiegabilità ha causato un certo aumento del tempo di calcolo, specialmente nell'attribuzione di caratteristiche e nella creazione di visualizzazioni. Tuttavia, il tempo totale di esecuzione era comunque fattibile e non troppo lungo. La Figura 7 mostra come il tempo computazionale viene condiviso tra le diverse fasi della pipeline, come preprocessing, addestramento del modello, generazione di spiegabilità, valutazione e visualizzazione.

figure-results-4
Figura 7: Analisi del tempo di esecuzione della pipeline. Questo grafico mostra come il tempo computazionale è suddiviso tra le varie fasi della pipeline di IA spiegabile, come preprocessing, addestramento del modello, creazione di abilità, valutazione e visualizzazione delle capacità. I dati rivelano che la maggior parte della timeline è occupata dall'addestramento del modello, seguito dall'elaborazione delle abilità spiegatrici. D'altra parte, il tempo dedicato alla pre-elaborazione e alla reportistica è piuttosto limitato. Clicca qui per visualizzare una versione più grande di questa figura.

Abbiamo testato anche la forza del quadro proposto tramite un'analisi di ablazione. Eliminando le caratteristiche essenziali scoperte tramite i metodi di spiegabilità, si è rivelato una chiara diminuzione delle prestazioni predittive, il che è un chiaro segno che queste caratteristiche non sono solo rilevanti ma anche molto importanti. A parte questo, gli output delle spiegazioni sono rimasti abbastanza stabili anche quando c'è stata una leggera variazione nei campioni di input, il che dimostra la coerenza e l'affidabilità delle tecniche di spiegabilità.

In breve, combinando la misurazione della performance predittiva, della spiegabilità e della validazione focalizzata sull'umano, è stato dimostrato che il quadro proposto era efficace. Il sistema non solo faceva previsioni molto accurate, ma rimaneva anche altamente interpretabile e facile da usare. Introdurre metodi di spiegabilità ha reso l'intero processo trasparente senza compromettere le prestazioni del modello. I miglioramenti che abbiamo osservato nell'accuratezza e nell'interpretabilità delle previsioni non sono stati solo ottenuti sotto stretto controllo sperimentale, ma sono stati anche statisticamente significativi, un fatto che dimostra la durata e l'autenticità del metodo proposto. Confronti a coppie tra modelli predittivi sono stati effettuati utilizzando t abbinati tra pieghe di validazione incrociata. Sono state osservate differenze statisticamente significative tra il Gradient Boosting e i modelli concorrenti (p < 0,05), confermando la superiorità della configurazione proposta.

Risultati complessivi.
Collettivamente, i risultati dimostrano che la performance predittiva, la qualità della spiegazione e la fiducia dei clinici possono essere valutate all'interno di un flusso di lavoro unificato e riproducibile. Il framework ha mantenuto prestazioni costanti su molteplici dataset sanitari, supportando al contempo un'interpretazione trasparente tramite SHAP, LIME e spiegazioni Grad-CAM. Tuttavia, i risultati devono essere interpretati nel contesto dei dataset selezionati e delle impostazioni di validazione, e rimane necessaria una validazione esterna aggiuntiva prima della distribuzione nel mondo reale.

DISPONIBILITÀ DEI DATI:
Abbiamo ottenuto i dataset utilizzati nella ricerca attuale da fonti pubbliche, e si possono trovare in archivi dati ben noti. Ad esempio, i dati relativi al cancro al seno e al diabete sono scaricabili dal Repository di Machine Learning UCI all'indirizzo: https://archive.ics.uci.edu/ml/index.php

Si può ottenere il dataset elettronico della cartella clinica (MIMIC-III) tramite Physio Net su:
https://physionet.org/content/mimiciii/1.4/

I dati di imaging a raggi X del torace sono stati prelevati dal dataset NIH Chest X-ray e possono essere trovati su: https://www.kaggle.com/datasets/nih-chest-xrays/data

Tutti i dataset che abbiamo esplorato in questo studio sono anonimizzati e resi pubblici. I passaggi di pre-elaborazione, il modello addestrato e gli output delle capacità spiegative che abbiamo prodotto durante la ricerca sono disponibili tramite l'autore corrispondente se viene fatta una richiesta ragionevole. Il codice sorgente, gli script di preelaborazione, i file di configurazione e le risorse di riproducibilità saranno depositati in un repository pubblico al momento dell'accettazione del manoscritto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio ha sviluppato e valutato un flusso di lavoro di intelligenza artificiale spiegabile riproducibile (XAI) per l'analisi sanitaria che integra modellazione predittiva, valutazione della spiegabilità, valutazione incentrata sul clinico e risorse di riproducibilità all'interno di un unico protocollo. I risultati hanno dimostrato che i modelli di machine learning basati su ensemble, in particolare Gradient Boosting e Random Forest, hanno ottenuto le più alte prestazioni predittive nei dataset strutturati di assistenza sanitaria valutati, mentre i modelli di deep learning erano più adatti per analisi basate su immagini. Questi risultati evidenziano l'importanza di selezionare le architetture dei modelli in base alle caratteristiche dei dati, piuttosto che presumere che modelli più complessi produrranno sempre prestazioni superiori. Un contributo chiave di questo lavoro è l'integrazione di modellazione predittiva, valutazione della spiegabilità, valutazione centrata sull'uomo e pratiche di riproducibilità all'interno di un flusso di lavoro standardizzato. A differenza degli studi che valutano le tecniche di spiegabilità in isolamento, il framework proposto fornisce una metodologia guidata dal protocollo che supporta sperimentazioni trasparenti e riproducibili su diversi dataset sanitari.

L'analisi di spiegabilità ha dimostrato differenze misurabili tra i metodi valutati. SHAP ha raggiunto i punteggi di fedeltà e stabilità più alti nelle condizioni sperimentali valutate, indicando una maggiore concordanza tra spiegazioni generate e previsioni del modello. LIME forniva spiegazioni locali utili ma mostrava una stabilità inferiore, mentre Grad-CAM generava spiegazioni visive intuitive per i dati di imaging. Questi risultati suggeriscono che la qualità della spiegazione dipende sia dal metodo di spiegabilità selezionato sia dal modello predittivo sottostante. La valutazione incentrata sull'uomo ha inoltre dimostrato che l'inclusione delle spiegazioni migliorava la fiducia e l'interpretabilità dei clinici. L'aumento osservato dei punteggi di fiducia e il consistente accordo tra valutatori (κ di Fleiss = 0,81) indicano una valutazione coerente dell'utilità delle spiegazioni tra i partecipanti. Questi risultati supportano il potenziale valore dei metodi di spiegabilità per migliorare la trasparenza e l'accettazione da parte degli utenti nei sistemi di supporto alle decisioni sanitarie.

Devono essere considerate diverse limitazioni nell'interpretazione dei risultati. Innanzitutto, il framework è stato valutato utilizzando un numero limitato di dataset pubblici e potrebbe non rappresentare completamente la variabilità riscontrata negli ambienti clinici reali. In secondo luogo, la valutazione del clinico ha coinvolto una coorte di partecipanti relativamente piccola, il che può limitare la generalizzabilità. In terzo luogo, i metodi di spiegabilità studiati in questo studio sono tecniche post-hoc e quindi restano soggetti a limitazioni note, tra cui la sensibilità alle perturbazioni e le potenziali discrepanze tra spiegazioni e vero ragionamento del modello. Infine, la convalida esterna tra istituzioni sanitarie indipendenti era al di fuori dell'ambito del presente studio.

Le ricerche future dovrebbero indagare l'analisi sanitaria multimodale integrando cartelle cliniche, imaging medico, segnali fisiologici e dati di sensori indossabili. Sono necessari ulteriori lavori per valutare i metodi di spiegazione causale e controfattuale, la quantificazione dell'incertezza, la valutazione dell'equità, l'analisi della calibrazione e la convalida clinica prospettica. Tali studi potrebbero ulteriormente migliorare la trasparenza, l'affidabilità e l'applicabilità dei sistemi di IA spiegabili nel settore sanitario.

Oltre alla valutazione delle prestazioni, dovrebbero essere considerate diverse sfide pratiche di implementazione e modifiche ai protocolli per garantire una robusta distribuzione del framework di IA spiegabile proposto in diversi ambienti sanitari.

Limitazioni dei metodi di spiegabilità

SHAP, LIME e Grad-CAM, pur fornendo utili intuizioni sul comportamento dei modelli, presentano anch'essi diversi svantaggi. È stato osservato in letteratura che questi strumenti possono essere instabili in esecuzioni ripetute, molto sensibili alle perturbazioni, differire tra i dataset e talvolta non riflettere accuratamente le reali ragioni del modello. Pertanto, le spiegazioni post-hoc dovrebbero essere viste solo come prove supplementari e non come rappresentazione effettiva dei meccanismi decisionali causali. La corretta convalida dell'affidabilità delle spiegazioni è ancora un passo fondamentale prima che possano essere utilizzate in contesti clinici di grande impatto.

Questo è anche coerente con i risultati delle recenti ricerche sull'IA biomedica, che hanno sottolineato la necessità di spiegare la validazione dell'affidabilità prima della sua implementazione in contesti clinici. L'integrazione della spiegabilità è stata utilizzata come aspetto chiave della validazione nei sistemi di previsione dell'arresto cardiaco, in modo che possano essere più trasparenti e guadagnare la fiducia delle previsionicliniche 41. Allo stesso modo, la segmentazione delle immagini con ultrasuoni epatici utilizzando tecniche di spiegabilità basate sulla visualizzazione mirava ad aumentare l'interpretabilità senza ignorare il fatto che le spiegazioni post hoc sono limitate. Questi articoli confermano che sono necessari controlli di coerenza delle spiegazioni, test di robustezza delle spiegazioni e validazioni clinicamente significative dei risultati per essere al massimo livello di prontezza clinica all'uso42.

Calibrazione, Equità, Robustezza e Generalizzazione Esterna

Le versioni future del framework proposto includeranno la valutazione della calibrazione probabilistica tramite curve di calibrazione e punteggio Brier, la stima dell'incertezza utilizzando metodi bayesiani e basati su ensemble, l'audit di equità dei sottogruppi demografici e il controllo della robustezza in presenza di dati rumorosi e condizioni di dominio variabili. Queste analisi sono particolarmente importanti in contesti sanitari, dove la fiducia nel modello, la performance equa e l'affidabilità in ambienti clinici in cambiamento influenzano direttamente la sicurezza del paziente e l'adozione clinica. I recenti quadri scientifici abilitati dall'IA hanno sottolineato allo stesso modo l'importanza di sistemi di supporto alle decisioni affidabili, trasparenti e affidabili, oltre alla valutazione predittiva convenzionale delle prestazioni. I recenti quadri scientifici abilitati dall'IA hanno sottolineato analogamente l'importanza di sistemi di supporto decisionale affidabili, trasparenti e affidabili, oltre alla valutazione predittiva delle prestazioni convenzionale 43.

Risoluzione dei problemi e modifiche al protocollo

Diversi aspetti pratici devono essere presi in considerazione per il successo del framework proposto per l'IA spiegabile. Un problema tipico è l'overfitting, ad esempio, quando si addestrano modelli di deep learning su dataset sanitari relativamente piccoli. L'overfitting può essere ridotto applicando validazione incrociata, stop anticipato, regolarizzazione del dropout, aumento dei dati e ottimizzazione approfondita degli iperparametri. Osservare le prestazioni di validazione durante l'addestramento è un buon modo per evitare un modello molto complesso che generalizza male.

Un altro aspetto molto importante nei dataset sanitari è lo squilibrio di classe, cioè i risultati clinici positivi molto più rari dei casi negativi. Per affrontare questo problema, il campionamento stratificato, l'aggiustamento per peso di classe, il sovracampionamento sintetico delle minoranze e l'uso di metriche di valutazione bilanciata come il punteggio F1 e il ROC-AUC dovrebbero far parte della pipeline di modellazione. Ignorare lo squilibrio di classe rischia di produrre metriche di performance che non rappresentano veramente il modello e le previsioni cliniche che potrebbero essere di parte.

I dataset di imaging medico tipicamente non sono perfetti e possono essere corrotti da rumore, artefatti di acquisizione, qualità incoerente, ecc. Questi fattori variano anche a seconda del tipo di dispositivo di imaging. Tali fattori possono influire negativamente sulle prestazioni predittive e influire anche sugli output di spiegabilità. Pertanto, dovrebbero essere applicati passaggi standardizzati di pre-elaborazione, normalizzazione delle immagini, controlli di qualità e tecniche di aumento dei dati per ottenere robustezza e affidabilità del modello.

SHAP consente la deduzione di spiegazioni altamente informative sull'attribuzione delle caratteristiche. Tuttavia, le occorrenze di instabilità non possono essere ignorate, specialmente quando esistono caratteristiche altamente correlate o quando gli esiti del modello sono molto sensibili a piccoli cambiamenti nei dati di input. Per migliorare la coerenza e l'affidabilità delle spiegazioni, si consiglia di scrivere la spiegazione più volte, valutare la stabilità su più run, utilizzare strategie di aggregazione delle funzionalità e confrontarsi con altri metodi di spiegabilità come LIME.

Quando si tratta di dati sanitari su larga scala e di grandi architetture di reti neurali profonde, i limiti di memoria GPU possono diventare uno dei principali vincoli. Le esigenze di memoria possono essere notevolmente ridotte attraverso variazioni della dimensione dei lotti, addestramento di precisione mista, potatura dei modelli, riduzione della dimensionalità delle caratteristiche e adozione di un caricamento efficiente dei dati. Inoltre, i ricercatori che implementano il framework su sistemi a basse risorse potrebbero pensare di utilizzare ambienti di cloud computing o addestramento distribuito.

Il design modulare del framework proposto consente di apportare facilmente modifiche per diverse applicazioni sanitarie. A seconda del compito clinico, gli scienziati possono modificare uno o più modelli previsionali individuali, aggiungere nuovi metodi di spiegazione, utilizzare diversi tipi di dati sanitari insieme o includere moduli di quantificazione e calibrazione dell'incertezza senza modificare il flusso di lavoro complessivo. Questa flessibilità rende il framework utilizzabile in casi di analisi sanitaria molto diversi, pur rimanendo riproducibile e interpretabile.

Considerazioni normative ed etiche:

I sistemi di IA resi più comprensibili possono essere di grande aiuto nell'assistenza sanitaria. Ma non basta. Le regole dei regolatori, che prevedono trasparenza, responsabilità, privacy e sicurezza dei pazienti, devono essere rispettate. Anche se la spiegabilità può aumentare la fiducia e l'interpretabilità, non può da sola garantire la validità clinica. L'implementazione responsabile richiede una validazione clinica prospettica, una valutazione dell'equità, una revisione regolatoria e un monitoraggio post-deployment. Inoltre, la riservatezza del paziente, la supervisione dei clinici e le prestazioni eque tra gruppi demografici dovrebbero essere considerate nell'implementazione futura del quadro. Per essere integrati nei flussi di lavoro clinici reali, i sistemi di IA e i professionisti sanitari devono interagire senza alcun problema. Pertanto, le informazioni spiegabili devono far parte delle attuali cartelle cliniche elettroniche e delle piattaforme di supporto alle decisioni cliniche, non di strumenti separati che funzionano autonomamente. Le scelte finali devono essere fatte dai medici, mentre l'IA spiegabile è semplicemente una tecnologia di supporto che migliora la trasparenza, supporta il ragionamento basato su evidenze e facilita la comunicazione tra operatori sanitari e pazienti.

Questo articolo presenta un protocollo riproducibile per sviluppare, valutare e interpretare sistemi di intelligenza artificiale spiegabili nell'analisi sanitaria. Il contributo è metodologico e orientato al flusso di lavoro, offrendo a ricercatori e clinici un quadro standardizzato che può essere replicato, adattato ed esteso a molteplici applicazioni sanitarie. Combina diversi aspetti come la preelaborazione dei dati, la modellazione predittiva, i metodi di spiegabilità e la valutazione delle prestazioni in un unico modo unificato. La metodologia ha dimostrato forti prestazioni predittive su molteplici dataset sanitari. Quando si tratta di analisi di dati strutturati, gli ensemble di modelli sono i migliori a esibirsi, mentre i modelli di deep learning si dimostrano molto efficaci per compiti di imaging medico. Inoltre, l'uso di tecniche di spiegazione facilita la comprensione dei modelli per gli utenti, poiché offre sia interpretazioni globali che locali dei risultati della previsione. Pertanto, non solo aumenta la fiducia dei clinici, ma anche l'usabilità dei modelli. I risultati indicano che un'IA spiegabile può supportare lo sviluppo di sistemi di analisi sanitaria trasparenti e interpretabili per trovare un compromesso tra accuratezza e interpretabilità dei modelli, essenziali per un'analisi sanitaria affidabile e affidabile. Di conseguenza, il metodo presentato qui è uno strumento molto efficace e semplice per l'analisi dei dati medici che può aiutare i professionisti sanitari nell'utilizzo di tecnologie di IA di cui si fidano. Questo articolo presenta un protocollo riproducibile per sviluppare, valutare e interpretare modelli di intelligenza artificiale spiegabili nell'analisi sanitaria. Integrando la preelaborazione dei dati, la modellazione predittiva, la valutazione della spiegabilità, la valutazione centrata sul clinico e le risorse di riproducibilità all'interno di un flusso di lavoro unificato, il protocollo fornisce un quadro pratico per la ricerca trasparente sull'IA sanitaria. Il flusso di lavoro può essere adattato a diversi dataset sanitari e domini applicabili, supportando implementazioni, valutazioni e reportistiche riproducibili di sistemi di machine learning spiegabili.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi finanziari o conflitti di interesse concorrenti legati a quest'opera. La ricerca è stata condotta in modo indipendente, senza alcuna relazione commerciale o finanziaria che potesse essere considerata un potenziale conflitto di interessi.

Divulgazione sull'Uso dell'Intelligenza Artificiale

Gli strumenti di intelligenza artificiale venivano utilizzati per il perfezionamento del linguaggio, il controllo grammaticale e l'assistenza editoriale durante la preparazione dei manoscritti. Tutti i contenuti scientifici, il disegno sperimentale, l'analisi dei dati, l'interpretazione e la verifica finale dei manoscritti sono stati eseguiti dagli autori. Gli autori hanno esaminato e validato tutti i risultati assistiti dall'IA per garantire accuratezza, integrità e conformità alle linee guida delle riviste.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori desiderano ringraziare le rispettive istituzioni per aver fornito l'infrastruttura necessaria e il supporto alla ricerca per condurre questo studio. Gli autori riconoscono inoltre l'uso di dataset pubblici e strumenti open-source che hanno facilitato lo sviluppo e la valutazione del framework proposto per l'IA spiegabile. Un ringraziamento speciale è rivolto agli esperti del settore che hanno fornito preziose informazioni durante la fase di valutazione centrata sull'uomo.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
GPU WorkstationDipende dal produttoreNAAddestramento di modelli di apprendimento profondo
Jupyter NotebookProject JupyterUltima versione stabileEsecuzione interattiva degli esperimenti
LIMELIMEVersione 0.2.0Spiegazioni interpretabili locali
MatplotlibMatplotlib ProjectVersione 3.9Visualizzazione dei dati
MIMIC-III DatabasePhysioNetVersione 1.4Analisi delle cartelle cliniche elettroniche
NIH Chest X-ray DatasetNIH Clinical CenterDataset pubblicoClassificazione delle malattie toraciche
NumPyNumPy DevelopersVersione 1.26Calcolo numerico e operazioni su array
OpenCVOpenCV FoundationVersione 4.10Preprocessing delle immagini
PandasPandas Development TeamVersione 2.1Manipolazione e preprocessing dei dati
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryDataset pubblicoPrevisione del rischio di diabete
Python 3.11Python Software FoundationVersione 3.11Ambiente di programmazione principale
Scikit-learnscikit-learnVersione 1.5Algoritmi di apprendimento automatico e valutazione
SeabornSeabornVersione 0.13Visualizzazione statistica
SHAPSHAPVersione 0.46Attribuzione e spiegabilità delle caratteristiche
TensorFlowTensorFlowVersione 2.15Sviluppo di modelli di apprendimento profondo
Windows / Ubuntu LinuxMicrosoft / CanonicalNASistema operativo
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryDataset pubblicoDiagnosi del cancro al seno

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

EngineeringExplainable Artificial Intelligence XAIMachine learningdeep learningModel InterpretabilityClinical Decision Support SystemsReproducible Experimental Protocol

Articoli correlati