Questo studio non ha previsto il reclutamento di partecipanti umani, l'accesso a record pazienti identificabili o esperimenti che coinvolgono animali. Il protocollo è stato sviluppato e valutato esclusivamente utilizzando set di dati pubblicamente disponibili e completamente anonimizzati, a scopo di validazione metodologica. Non è stata acceduta né elaborata alcuna informazione sanitaria personale. Pertanto, non è stata richiesta l'approvazione da parte di un Comitato Etico (IRB) o di un Comitato per l’Etica della Ricerca. Il protocollo è stato elaborato in conformità con i principi applicabili in materia di protezione dei dati, incluso il Regolamento Generale sulla Protezione dei Dati brasiliano (LGPD), al fine di supportare future applicazioni che coinvolgano dati clinici.
Selezione e preelaborazione del set di dati
Il protocollo proposto è stato valutato utilizzando set di dati clinici pubblici e completamente anonimizzati, comprendenti record elettronici sanitari strutturati (EHR), dati per la risposta a domande cliniche e set di dati di immagini mediche, per la validazione metodologica. Prima dell'integrazione nella piattaforma, i set di dati hanno subito procedure standardizzate di preelaborazione, incluse la normalizzazione dei dati, la rimozione di record incoerenti o incompleti, la mappatura su risorse HL7 FHIR, la pulizia del testo, la suddivisione in blocchi per il recupero e la generazione di embedding per l'indicizzazione vettoriale. Questi passaggi di preelaborazione hanno garantito coerenza semantica tra fonti di dati eterogenee, facilitando l'interoperabilità e permettendo la riproducibilità del flusso di lavoro proposto, mantenendo al contempo la conformità ai principi applicabili in materia di privacy dei dati.
I set di dati sono stati ottenuti da repository di benchmark pubblicamente disponibili, comunemente utilizzati nella ricerca sull'intelligenza artificiale e sulla salute digitale. Sono stati selezionati per rappresentare informazioni cliniche eterogenee, incluse cartelle cliniche elettroniche strutturate (EHR), narrazioni cliniche non strutturate, compiti di risposta a domande cliniche e metadati di immagini mediche. Piuttosto che valutare una specifica coorte clinica, il protocollo si concentra sulla dimostrazione di un flusso di lavoro implementativo riproducibile, adattabile a diversi set di dati sanitari. La diversità di questi set di dati di benchmark consente la validazione della pipeline di interoperabilità, della Generazione con Recupero Aumentato (RAG) e del framework di ragionamento multi-agente attraverso molteplici modalità di dati clinici.
Configurazione dell'ambiente sperimentale
L'ambiente sperimentale è stato configurato per valutare la piattaforma interoperabile in condizioni controllate e riproducibili. L'architettura comprende moduli di acquisizione dati, livelli di interoperabilità, modelli linguistici di grandi dimensioni (LLM) e componenti di valutazione organizzati in una singola pipeline di elaborazione per l'analisi dei dati medici. Figura 1 illustra l'intero flusso di lavoro, dall'acquisizione dei dati clinici alla generazione degli output diagnostici.

Figura 1: Flusso di lavoro complessivo del sistema che illustra la pipeline di elaborazione dai dati clinici grezzi all'output dello stato della malattia. Il processo inizia con l'acquisizione dei record elettronici di salute (EHR), seguita da filtraggio e pre-elaborazione dei dati per estrarre informazioni sensibili alla malattia. Una fase di progettazione strutturata dei prompt integra conoscenze esperte, definizioni delle malattie e iperparametri, consentendo un'interazione efficace con il modello linguistico di grandi dimensioni (LLM). L'LLM esegue un'inferenza testuale per generare risposte consapevoli del contesto, che vengono successivamente valutate attraverso regole cliniche per determinare lo stato finale della malattia. Il flusso di lavoro evidenzia l'integrazione del pre-elaborazione dei dati, dell'impiego di prompt guidati dalla conoscenza e dell'inferenza basata sull'intelligenza artificiale per supportare il processo decisionale clinico. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Architettura dell'interoperabilità sanitaria
L'infrastruttura backend adotta un'architettura modulare basata su API RESTful per supportare la comunicazione tra i componenti della piattaforma (Figura 2). Questa architettura accoglie informazioni cliniche eterogenee, inclusi referti elettronici strutturati (EHR), annotazioni dei medici e metadati derivati da sistemi di imaging medico. Poiché questi dati provengono da molteplici fonti e formati, l'interoperabilità viene garantita attraverso modelli di dati standardizzati, in particolare il framework Fast Healthcare Interoperability Resources (FHIR)15,16,17.. L'adozione di FHIR favorisce lo scambio strutturato di informazioni preservando scalabilità e flessibilità negli ambienti sanitari distribuiti. Sono stati inoltre integrati meccanismi di comunicazione basati su HL7 per facilitare l'integrazione con sistemi clinici obsoleti, ancora ampiamente utilizzati nelle istituzioni sanitarie16,17.

Figura 2: Architettura del sistema della piattaforma interoperabile proposta. L'interfaccia web comunica con il backend attraverso un'API Flask utilizzando richieste HTTP POST/GET. L'API gestisce il routing, l'elaborazione delle query e l'interazione con fonti di dati strutturate e non strutturate. Un database MySQL memorizza i dati clinici strutturati, mentre un archivio vettoriale basato su FAISS supporta la ricerca per similarità nelle operazioni di recupero. La pipeline basata su LLaMA elabora input testuali e genera risposte utilizzando rappresentazioni vettoriali, abilitando la generazione aumentata da recupero (Retrieval-Augmented Generation, RAG). L'architettura evidenzia l'integrazione di servizi web, gestione di database, recupero vettoriale e inferenza di modelli linguistici di grandi dimensioni in un sistema unificato. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Configurazione del flusso di lavoro multi-agente
L'architettura multi-agente è organizzata in agenti funzionali specializzati, ciascuno responsabile di una fase distinta del flusso di lavoro. Un agente di preelaborazione esegue la normalizzazione dei dati e il mapping FHIR, seguito da un agente di recupero incaricato della ricerca semantica all'interno del database vettoriale. Un agente di ragionamento integra il contesto recuperato con il modello linguistico di grandi dimensioni (LLM) per generare risposte, mentre un agente di validazione verifica la coerenza e la formattazione dell'output prima che la risposta finale venga restituita. La coordinazione tra agenti segue una strategia di orchestrazione sequenziale in cui l'output di ciascun agente funge da input per la fase successiva, garantendo un'implementazione riproducibile e modulare.
Integrazione dei dati clinici
Il livello di integrazione dei dati aggrega informazioni da più fonti cliniche e le prepara per l'elaborazione successiva. La preelaborazione include la normalizzazione dei dati, la tokenizzazione e l'allineamento delle entità per migliorare la coerenza semantica tra dataset eterogenei. Poiché le informazioni cliniche presentano variazioni nella struttura e nella qualità, queste operazioni contribuiscono a ridurre il rumore e a facilitare l'interazione con i modelli di intelligenza artificiale. Sono state inoltre applicate strategie di mappatura strutturata per armonizzare i diversi formati dei dati e mantenere la compatibilità con la pipeline di elaborazione, come illustrato in Figura 315,16,17.

Figura 3: Esempio dettagliato del processo di ragionamento clinico multi-agente. La figura illustra come una richiesta clinica venga analizzata attraverso diverse fasi, tra cui la valutazione della complessità, il reclutamento di specialisti, la discussione collaborativa e la presa finale della decisione. Questo processo dimostra la capacità del sistema di adattare dinamicamente le strategie di ragionamento in base alla complessità della richiesta, migliorando sia l'efficienza che l'accuratezza diagnostica negli scenari di supporto alle decisioni cliniche. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Configurare la pipeline di generazione aumentata dal recupero
La generazione aumentata con recupero (Retrieval-Augmented Generation, RAG) viene integrata per fornire un'analisi consapevole del contesto combinando il recupero delle informazioni con le capacità generative dei modelli linguistici di grandi dimensioni. Le query degli utenti vengono convertite in rappresentazioni vettoriali mediante modelli di embedding e confrontate con il database vettoriale utilizzando una ricerca semantica basata sulla similarità per recuperare i passaggi contestuali più rilevanti. I documenti recuperati vengono quindi combinati con la query originale prima dell'inferenza da parte del modello linguistico (LLM). Questa strategia contribuisce a fornire informazioni contestuali durante la generazione delle risposte ed è associata a una maggiore coerenza fattuale e a una riduzione delle allucinazioni in applicazioni ad alta intensità di conoscenza, come quelle nel settore sanitario18,19. Figura 1 e Figura 3 illustrano il flusso di lavoro complessivo del recupero e il corrispondente processo di ragionamento.
Per ogni richiesta dell'utente, il prompt finale viene costruito dinamicamente combinando la query originale con i passaggi contestuali più rilevanti recuperati dal database vettoriale. Le informazioni recuperate vengono incorporate come evidenza contestuale prima dell'inferenza, consentendo al modello linguistico di generare risposte basate sulle conoscenze sanitarie recuperate, preservando al contempo la coerenza semantica e riducendo le generazioni non supportate.
Progettazione dei prompt e ragionamento multi-agente
Il protocollo incorpora strategie di sollecitazione strutturate per migliorare l'interpretazione contestuale durante la generazione delle risposte. Queste tecniche di sollecitazione, insieme a meccanismi di inferenza avanzati, aiutano a guidare il processo di ragionamento in scenari clinici complessi e sono in linea con i recenti sviluppi riportati in letteratura20.
L'architettura comprende un framework multi-agente composto da moduli specializzati che svolgono funzioni distinte all'interno della pipeline di elaborazione, tra cui convalida dei dati, filtraggio del contesto, supporto al ragionamento clinico e verifica dell'output. L'organizzazione modulare consente l'esecuzione delle attività in modo sequenziale o parallelo, offrendo flessibilità per diverse esigenze di elaborazione (Figura 4). La distribuzione di queste attività su più agenti riduce la dipendenza da un singolo modello linguistico e favorisce un flusso di lavoro di elaborazione più robusto. Questa strategia architetturale è in linea con i recenti sviluppi nell'intelligenza artificiale distribuita e nella progettazione di sistemi intelligenti21,22.

Figura 4: Architettura decisionale multi-agente per il ragionamento clinico. Il processo inizia con una richiesta da parte dell'utente, che viene valutata da un agente verificatore incaricato di determinare la complessità della richiesta. Nei casi complessi, il sistema recluta dinamicamente un team multidisciplinare (MDT) composto da agenti specializzati, che svolgono round iterativi di discussione per analizzare il problema e sintetizzare le conoscenze prima di produrre una decisione finale. Nei casi più semplici, la richiesta viene gestita da un agente medico di medicina generale (PCC), consentendo una risposta più rapida. Questa architettura adattativa bilancia efficienza e profondità analitica, migliorando la qualità delle decisioni e la scalabilità del sistema nelle applicazioni sanitarie. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Valutazione delle prestazioni
Le prestazioni del sistema sono state valutate utilizzando metriche complementari che riflettono sia la qualità linguistica sia la coerenza semantica degli output generati. Il punteggio BLEU è stato applicato per misurare la similarità sintattica in base all'overlap di n-grammi23, mentre ROUGE ha valutato il richiamo e la copertura dei contenuti, in particolare nei compiti di sintesi e estrazione delle informazioni24. La similarità semantica è stata valutata con BERTScore, che utilizza incorporamenti contestuali derivati da modelli basati su transformer per confrontare i testi generati e i testi di riferimento25. Analisi aggiuntive hanno incluso la perplessità e la similarità coseno per esaminare rispettivamente la sicurezza del modello e la coerenza semantica26,27.
Le metriche di valutazione selezionate forniscono prospettive complementari sulle prestazioni del sistema combinando analisi lessicali e semantiche. Questa combinazione è particolarmente rilevante nelle applicazioni sanitarie, dove l'interpretazione contestuale è altrettanto importante della similarità lessicale. La piattaforma è stata valutata in un ambiente computazionale controllato che supporta sia il deployment basato su cloud che quello locale. L'esecuzione locale dei modelli linguistici di grandi dimensioni (LLM) è stata inclusa come opzione per soddisfare i requisiti di privacy dei dati e ridurre la dipendenza da servizi esterni durante l'elaborazione di informazioni cliniche sensibili. Questa strategia di deployment è compatibile con i framework di protezione dei dati ed è adattabile a diversi ambienti operativi4.