Articolo di ricerca

Piattaforma Web Interoperabile Basata su Large Language Models per l'Analisi di Dati Medici: Un Protocollo per il Supporto alle Decisioni Cliniche

49 visualizzazioni

DOI:

10.3791/72085

25 agosto 2026

In questo articolo

Sommario

Questo protocollo descrive l'implementazione di una piattaforma web interoperabile che integra dati clinici basati su FHIR con la generazione migliorata mediante recupero e modelli linguistici di grandi dimensioni multi-agente per il supporto alle decisioni cliniche. Il flusso di lavoro consente un'implementazione riproducibile, l'integrazione standardizzata dei dati e la valutazione dell'analisi dei dati medici assistita da intelligenza artificiale (AI).

Abstract

Il processo decisionale clinico è spesso ostacolato da cartelle cliniche elettroniche frammentate e da una limitata interoperabilità tra sistemi eterogenei di informazione sanitaria. Questo articolo presenta un protocollo passo dopo passo per l'implementazione di una piattaforma web interoperabile che integra dati clinici attraverso lo standard Fast Healthcare Interoperability Resources (FHIR), insieme alla generazione potenziata da recupero (Retrieval-Augmented Generation, RAG), modelli linguistici di grandi dimensioni (Large Language Models, LLMs) e un framework di ragionamento clinico basato su più agenti, al fine di supportare l'analisi dei dati medici e l'assistenza decisionale clinica. Il protocollo descrive l'intero flusso di lavoro, inclusa la configurazione dell'ambiente computazionale, la pre-elaborazione dei dataset clinici, l'integrazione dei dati basata su FHIR, la costruzione di un database vettoriale, la configurazione del recupero, l'ingegnerizzazione dei prompt, l'orchestrazione multi-agente e la valutazione del sistema. I risultati rappresentativi dimostrano la capacità della piattaforma di generare risposte clinicamente rilevanti e coerenti contestualmente, migliorando nel contempo l'interoperabilità semantica tra fonti di dati eterogenee. Le prestazioni del sistema sono state valutate utilizzando metriche quantitative e semantiche complementari, tra cui BLEU, ROUGE, BERTScore e similarità coseno. È stata condotta una valutazione qualitativa mediante l'uso di dataset sanitari di riferimento pubblicamente disponibili e completamente anonimizzati, al fine di valutare la riproducibilità del flusso di lavoro metodologico proposto. L'architettura proposta combina l'interoperabilità sanitaria standardizzata con modelli linguistici potenziati dal recupero, per migliorare il ragionamento contestuale, ridurre le allucinazioni e supportare flussi di lavoro clinici assistiti dall'intelligenza artificiale riproducibili. Questo protocollo fornisce un quadro scalabile e riproducibile per ricercatori e sviluppatori che intendono implementare sistemi sanitari intelligenti, interoperabili e attenti alla privacy, destinati all'assistenza decisionale clinica, all'analisi dei dati medici e alla ricerca traslazionale futura.

Introduzione

Le informazioni sanitarie vengono generate regolarmente in ospedali, centri diagnostici, laboratori e cliniche ambulatoriali, spesso rimanendo distribuite tra sistemi eterogenei di informazione. Questa frammentazione limita l'interoperabilità e restringe l'accesso tempestivo a cartelle cliniche complete, creando sfide persistenti per l'assistenza clinica, l'integrazione dei dati e la gestione sanitaria1,2,3,4.

Le conseguenze di questa frammentazione diventano particolarmente evidenti nei flussi di lavoro clinici che dipendono da un accesso tempestivo alle informazioni del paziente. Quando i professionisti sanitari non riescono a recuperare cartelle cliniche complete e integrate, la valutazione clinica diventa più difficile, aumentando il rischio di decisioni non complete e riducendo l'efficienza dell'erogazione delle cure, in particolare in contesti di emergenza5,6.

I recenti sviluppi nell'intelligenza artificiale (AI), in particolare nei modelli linguistici di grandi dimensioni (LLMs), hanno ampliato l'insieme degli approcci computazionali disponibili per applicazioni nel settore sanitario. Questi modelli sono stati studiati in compiti come l'assistenza diagnostica, il triage clinico e il supporto decisionale. Ad esempio, Jahan et al.5 hanno valutato l'uso dei LLM in compiti biomedici, mentre Taylor et al.7 hanno analizzato modelli affinati per lo screening digitale della salute mentale, riportando risultati incoraggianti in contesti clinici specializzati.

L'applicazione dei modelli linguistici di grandi dimensioni (LLM) si è inoltre estesa a domini clinici più specializzati. Song et al. 49 ne hanno esplorato l'uso nella diagnosi della pneumoconiosi, mentre Chien et al.8 hanno applicato questi modelli per analizzare i modelli di carico di lavoro tra i caregiver informali. In oftalmologia, Xue et al.9 hanno proposto un sistema di risposta a domande per la diagnosi del glaucoma, mentre Tan et al.3 e Wu et al.10 hanno riportato l'uso degli LLM in sistemi diagnostici ibridi e nelle consulenze di medicina tradizionale cinese.

L'uso dei modelli linguistici di grandi dimensioni (LLM) non si limita alle applicazioni cliniche dirette. Zhang et al.11 ne hanno esaminato l'applicazione al riconoscimento delle emozioni in contesti legati alla salute mentale, mentre Sarzaeim et al.12 hanno analizzato sistemi di polizia intelligenti che potrebbero contribuire anche ad analisi relative alla salute pubblica. Questi studi illustrano l'ampia applicabilità degli approcci basati su LLM in diversi ambiti connessi all'assistenza sanitaria.

Sebbene i modelli linguistici di grandi dimensioni (LLM) abbiano ampliato le possibilità di applicazione nel settore sanitario, la loro integrazione negli ambienti clinici è ancora associata a importanti sfide tecniche, organizzative e normative. Il deployment pratico richiede un'adeguata infrastruttura computazionale, una governance efficace dei dati e la conformità a quadri normativi come il Regolamento Generale sulla Protezione dei Dati (GDPR) e la Legge brasiliana generale sulla protezione dei dati (LGPD). Questi quadri normativi stabiliscono requisiti per l'elaborazione sicura ed etica delle informazioni sanitarie sensibili, affrontando al contempo questioni relative alla privacy, all'affidabilità e ai bias algoritmici nei sistemi sanitari assistiti dall'intelligenza artificiale13,14 .

L'interoperabilità tra fonti eterogenee di dati sanitari, inclusi i record sanitari elettronici (EHR), i sistemi di imaging medico e i dispositivi dell'Internet delle Cose (IoT), continua a rappresentare una sfida tecnica significativa per il deployment di soluzioni sanitarie assistite dall'intelligenza artificiale. In questo contesto, framework standardizzati per l'interoperabilità come HL7 FHIR forniscono un meccanismo strutturato per lo scambio di informazioni cliniche tra sistemi diversi, mantenendo la coerenza semantica e supportando un'integrazione scalabile.

Questo lavoro presenta una piattaforma web interoperabile che integra modelli linguistici di grandi dimensioni con standard di interoperabilità sanitaria per supportare l'analisi dei dati medici in ambienti clinici eterogenei. L'architettura proposta combina l'integrazione dei dati basata su HL7 FHIR con la generazione potenziata da recupero (RAG) e un framework di elaborazione multi-agente per fornire un'analisi assistita da intelligenza artificiale sensibile al contesto, mantenendo al contempo l'allineamento con i requisiti applicabili in materia di protezione dei dati, inclusa la Legge brasiliana generale sulla protezione dei dati (LGPD).

Questo protocollo descrive un'architettura interoperabile per l'integrazione di dati clinici eterogenei mediante standard consolidati di interoperabilità sanitaria. Illustra inoltre l'implementazione di una pipeline di elaborazione multi-agente basata su modelli linguistici grandi e piccoli (LLMs e SLMs), insieme a un framework di valutazione che combina metriche quantitative e analisi qualitative per valutare il comportamento della piattaforma proposta.

Protocollo

Questo studio non ha previsto il reclutamento di partecipanti umani, l'accesso a record pazienti identificabili o esperimenti che coinvolgono animali. Il protocollo è stato sviluppato e valutato esclusivamente utilizzando set di dati pubblicamente disponibili e completamente anonimizzati, a scopo di validazione metodologica. Non è stata acceduta né elaborata alcuna informazione sanitaria personale. Pertanto, non è stata richiesta l'approvazione da parte di un Comitato Etico (IRB) o di un Comitato per l’Etica della Ricerca. Il protocollo è stato elaborato in conformità con i principi applicabili in materia di protezione dei dati, incluso il Regolamento Generale sulla Protezione dei Dati brasiliano (LGPD), al fine di supportare future applicazioni che coinvolgano dati clinici.

Selezione e preelaborazione del set di dati

Il protocollo proposto è stato valutato utilizzando set di dati clinici pubblici e completamente anonimizzati, comprendenti record elettronici sanitari strutturati (EHR), dati per la risposta a domande cliniche e set di dati di immagini mediche, per la validazione metodologica. Prima dell'integrazione nella piattaforma, i set di dati hanno subito procedure standardizzate di preelaborazione, incluse la normalizzazione dei dati, la rimozione di record incoerenti o incompleti, la mappatura su risorse HL7 FHIR, la pulizia del testo, la suddivisione in blocchi per il recupero e la generazione di embedding per l'indicizzazione vettoriale. Questi passaggi di preelaborazione hanno garantito coerenza semantica tra fonti di dati eterogenee, facilitando l'interoperabilità e permettendo la riproducibilità del flusso di lavoro proposto, mantenendo al contempo la conformità ai principi applicabili in materia di privacy dei dati.

I set di dati sono stati ottenuti da repository di benchmark pubblicamente disponibili, comunemente utilizzati nella ricerca sull'intelligenza artificiale e sulla salute digitale. Sono stati selezionati per rappresentare informazioni cliniche eterogenee, incluse cartelle cliniche elettroniche strutturate (EHR), narrazioni cliniche non strutturate, compiti di risposta a domande cliniche e metadati di immagini mediche. Piuttosto che valutare una specifica coorte clinica, il protocollo si concentra sulla dimostrazione di un flusso di lavoro implementativo riproducibile, adattabile a diversi set di dati sanitari. La diversità di questi set di dati di benchmark consente la validazione della pipeline di interoperabilità, della Generazione con Recupero Aumentato (RAG) e del framework di ragionamento multi-agente attraverso molteplici modalità di dati clinici.

Configurazione dell'ambiente sperimentale

L'ambiente sperimentale è stato configurato per valutare la piattaforma interoperabile in condizioni controllate e riproducibili. L'architettura comprende moduli di acquisizione dati, livelli di interoperabilità, modelli linguistici di grandi dimensioni (LLM) e componenti di valutazione organizzati in una singola pipeline di elaborazione per l'analisi dei dati medici. Figura 1 illustra l'intero flusso di lavoro, dall'acquisizione dei dati clinici alla generazione degli output diagnostici.

Diagramma di elaborazione dei dati EHR; filtraggio delle note cliniche; inferenza della malattia tramite LLM; processo di diagnosi.
Figura 1: Flusso di lavoro complessivo del sistema che illustra la pipeline di elaborazione dai dati clinici grezzi all'output dello stato della malattia. Il processo inizia con l'acquisizione dei record elettronici di salute (EHR), seguita da filtraggio e pre-elaborazione dei dati per estrarre informazioni sensibili alla malattia. Una fase di progettazione strutturata dei prompt integra conoscenze esperte, definizioni delle malattie e iperparametri, consentendo un'interazione efficace con il modello linguistico di grandi dimensioni (LLM). L'LLM esegue un'inferenza testuale per generare risposte consapevoli del contesto, che vengono successivamente valutate attraverso regole cliniche per determinare lo stato finale della malattia. Il flusso di lavoro evidenzia l'integrazione del pre-elaborazione dei dati, dell'impiego di prompt guidati dalla conoscenza e dell'inferenza basata sull'intelligenza artificiale per supportare il processo decisionale clinico. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Architettura dell'interoperabilità sanitaria

L'infrastruttura backend adotta un'architettura modulare basata su API RESTful per supportare la comunicazione tra i componenti della piattaforma (Figura 2). Questa architettura accoglie informazioni cliniche eterogenee, inclusi referti elettronici strutturati (EHR), annotazioni dei medici e metadati derivati da sistemi di imaging medico. Poiché questi dati provengono da molteplici fonti e formati, l'interoperabilità viene garantita attraverso modelli di dati standardizzati, in particolare il framework Fast Healthcare Interoperability Resources (FHIR)15,16,17.. L'adozione di FHIR favorisce lo scambio strutturato di informazioni preservando scalabilità e flessibilità negli ambienti sanitari distribuiti. Sono stati inoltre integrati meccanismi di comunicazione basati su HL7 per facilitare l'integrazione con sistemi clinici obsoleti, ancora ampiamente utilizzati nelle istituzioni sanitarie16,17.

Diagramma dell'API Flask che mostra richieste POST/GET, query MySQL e integrazione con l'archivio vettoriale FAISS.
Figura 2: Architettura del sistema della piattaforma interoperabile proposta. L'interfaccia web comunica con il backend attraverso un'API Flask utilizzando richieste HTTP POST/GET. L'API gestisce il routing, l'elaborazione delle query e l'interazione con fonti di dati strutturate e non strutturate. Un database MySQL memorizza i dati clinici strutturati, mentre un archivio vettoriale basato su FAISS supporta la ricerca per similarità nelle operazioni di recupero. La pipeline basata su LLaMA elabora input testuali e genera risposte utilizzando rappresentazioni vettoriali, abilitando la generazione aumentata da recupero (Retrieval-Augmented Generation, RAG). L'architettura evidenzia l'integrazione di servizi web, gestione di database, recupero vettoriale e inferenza di modelli linguistici di grandi dimensioni in un sistema unificato. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Configurazione del flusso di lavoro multi-agente

L'architettura multi-agente è organizzata in agenti funzionali specializzati, ciascuno responsabile di una fase distinta del flusso di lavoro. Un agente di preelaborazione esegue la normalizzazione dei dati e il mapping FHIR, seguito da un agente di recupero incaricato della ricerca semantica all'interno del database vettoriale. Un agente di ragionamento integra il contesto recuperato con il modello linguistico di grandi dimensioni (LLM) per generare risposte, mentre un agente di validazione verifica la coerenza e la formattazione dell'output prima che la risposta finale venga restituita. La coordinazione tra agenti segue una strategia di orchestrazione sequenziale in cui l'output di ciascun agente funge da input per la fase successiva, garantendo un'implementazione riproducibile e modulare.

Integrazione dei dati clinici

Il livello di integrazione dei dati aggrega informazioni da più fonti cliniche e le prepara per l'elaborazione successiva. La preelaborazione include la normalizzazione dei dati, la tokenizzazione e l'allineamento delle entità per migliorare la coerenza semantica tra dataset eterogenei. Poiché le informazioni cliniche presentano variazioni nella struttura e nella qualità, queste operazioni contribuiscono a ridurre il rumore e a facilitare l'interazione con i modelli di intelligenza artificiale. Sono state inoltre applicate strategie di mappatura strutturata per armonizzare i diversi formati dei dati e mantenere la compatibilità con la pipeline di elaborazione, come illustrato in Figura 315,16,17.

Diagramma del processo decisionale in ambito sanitario; passaggi: complessità della richiesta, reclutamento, analisi, sintesi.
Figura 3: Esempio dettagliato del processo di ragionamento clinico multi-agente. La figura illustra come una richiesta clinica venga analizzata attraverso diverse fasi, tra cui la valutazione della complessità, il reclutamento di specialisti, la discussione collaborativa e la presa finale della decisione. Questo processo dimostra la capacità del sistema di adattare dinamicamente le strategie di ragionamento in base alla complessità della richiesta, migliorando sia l'efficienza che l'accuratezza diagnostica negli scenari di supporto alle decisioni cliniche. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Configurare la pipeline di generazione aumentata dal recupero

La generazione aumentata con recupero (Retrieval-Augmented Generation, RAG) viene integrata per fornire un'analisi consapevole del contesto combinando il recupero delle informazioni con le capacità generative dei modelli linguistici di grandi dimensioni. Le query degli utenti vengono convertite in rappresentazioni vettoriali mediante modelli di embedding e confrontate con il database vettoriale utilizzando una ricerca semantica basata sulla similarità per recuperare i passaggi contestuali più rilevanti. I documenti recuperati vengono quindi combinati con la query originale prima dell'inferenza da parte del modello linguistico (LLM). Questa strategia contribuisce a fornire informazioni contestuali durante la generazione delle risposte ed è associata a una maggiore coerenza fattuale e a una riduzione delle allucinazioni in applicazioni ad alta intensità di conoscenza, come quelle nel settore sanitario18,19. Figura 1 e Figura 3 illustrano il flusso di lavoro complessivo del recupero e il corrispondente processo di ragionamento.

Per ogni richiesta dell'utente, il prompt finale viene costruito dinamicamente combinando la query originale con i passaggi contestuali più rilevanti recuperati dal database vettoriale. Le informazioni recuperate vengono incorporate come evidenza contestuale prima dell'inferenza, consentendo al modello linguistico di generare risposte basate sulle conoscenze sanitarie recuperate, preservando al contempo la coerenza semantica e riducendo le generazioni non supportate.

Progettazione dei prompt e ragionamento multi-agente

Il protocollo incorpora strategie di sollecitazione strutturate per migliorare l'interpretazione contestuale durante la generazione delle risposte. Queste tecniche di sollecitazione, insieme a meccanismi di inferenza avanzati, aiutano a guidare il processo di ragionamento in scenari clinici complessi e sono in linea con i recenti sviluppi riportati in letteratura20.

L'architettura comprende un framework multi-agente composto da moduli specializzati che svolgono funzioni distinte all'interno della pipeline di elaborazione, tra cui convalida dei dati, filtraggio del contesto, supporto al ragionamento clinico e verifica dell'output. L'organizzazione modulare consente l'esecuzione delle attività in modo sequenziale o parallelo, offrendo flessibilità per diverse esigenze di elaborazione (Figura 4). La distribuzione di queste attività su più agenti riduce la dipendenza da un singolo modello linguistico e favorisce un flusso di lavoro di elaborazione più robusto. Questa strategia architetturale è in linea con i recenti sviluppi nell'intelligenza artificiale distribuita e nella progettazione di sistemi intelligenti21,22.

Diagramma del processo di interrogazione; flusso decisionale per problemi medici semplici e complessi; analisi di squadra.
Figura 4: Architettura decisionale multi-agente per il ragionamento clinico. Il processo inizia con una richiesta da parte dell'utente, che viene valutata da un agente verificatore incaricato di determinare la complessità della richiesta. Nei casi complessi, il sistema recluta dinamicamente un team multidisciplinare (MDT) composto da agenti specializzati, che svolgono round iterativi di discussione per analizzare il problema e sintetizzare le conoscenze prima di produrre una decisione finale. Nei casi più semplici, la richiesta viene gestita da un agente medico di medicina generale (PCC), consentendo una risposta più rapida. Questa architettura adattativa bilancia efficienza e profondità analitica, migliorando la qualità delle decisioni e la scalabilità del sistema nelle applicazioni sanitarie. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Valutazione delle prestazioni

Le prestazioni del sistema sono state valutate utilizzando metriche complementari che riflettono sia la qualità linguistica sia la coerenza semantica degli output generati. Il punteggio BLEU è stato applicato per misurare la similarità sintattica in base all'overlap di n-grammi23, mentre ROUGE ha valutato il richiamo e la copertura dei contenuti, in particolare nei compiti di sintesi e estrazione delle informazioni24. La similarità semantica è stata valutata con BERTScore, che utilizza incorporamenti contestuali derivati da modelli basati su transformer per confrontare i testi generati e i testi di riferimento25. Analisi aggiuntive hanno incluso la perplessità e la similarità coseno per esaminare rispettivamente la sicurezza del modello e la coerenza semantica26,27.

Le metriche di valutazione selezionate forniscono prospettive complementari sulle prestazioni del sistema combinando analisi lessicali e semantiche. Questa combinazione è particolarmente rilevante nelle applicazioni sanitarie, dove l'interpretazione contestuale è altrettanto importante della similarità lessicale. La piattaforma è stata valutata in un ambiente computazionale controllato che supporta sia il deployment basato su cloud che quello locale. L'esecuzione locale dei modelli linguistici di grandi dimensioni (LLM) è stata inclusa come opzione per soddisfare i requisiti di privacy dei dati e ridurre la dipendenza da servizi esterni durante l'elaborazione di informazioni cliniche sensibili. Questa strategia di deployment è compatibile con i framework di protezione dei dati ed è adattabile a diversi ambienti operativi4.

Risultati

Le prestazioni del sistema sono state valutate utilizzando metriche quantitative complementari insieme a un'analisi qualitativa per esaminare sia l'accuratezza linguistica che la coerenza semantica degli output generati. Questa strategia di valutazione combina misure lessicali e semantiche per fornire una caratterizzazione più ampia del comportamento del modello nei compiti di generazione del linguaggio relativi all'assistenza sanitaria.

Tabella 1 presenta i risultati quantitativi ottenuti con BLEU, ROUGE e BERTScore. Queste metriche sono state selezionate perché valutano aspetti complementari del testo generato, inclusi la similarità lessicale, la copertura informativa e l'allineamento semantico, e sono ampiamente utilizzate nella ricerca sul processamento del linguaggio naturale.

GiudicePromptPearsonRMSEMAEHit Rate
Mixtralbreve0.0981.7791.3466/28
zero-shot0.1741.6181.29315/28
few-shot0.4751.6731.3679/28
LLaMA 3breve0.4851.6171.31411/28
zero-shot0.4791.6141.31410/28
few-shot0.4251.6521.33913/28
LLaMA 3.1breve0.3491.6211.31806/28
zero-shot0.681.6141.30712/28
few-shot0.4081.2430.88611/28

Tabella 1: Metriche quantitative di valutazione del sistema proposto.

BLEU è stato utilizzato per quantificare la similarità sintattica in base all'overlap di n-grammi tra gli output generati e i testi di riferimento23. Inizialmente sviluppato per la traduzione automatica, è stato inoltre applicato a un'ampia gamma di compiti di generazione del testo poiché coglie la corrispondenza strutturale tra i testi. Nella presente valutazione, i punteggi BLEU indicano che le risposte generate preservano caratteristiche sintattiche coerenti con gli output di riferimento.

ROUGE è stato utilizzato per valutare la similarità orientata al richiamo, con particolare enfasi sulla copertura delle informazioni rilevanti nei testi generati24. Nelle applicazioni sanitarie, questa metrica è particolarmente utile perché preservare le informazioni clinicamente rilevanti è spesso più importante della riproduzione di una formulazione identica. Come riportato nella Tabella 2, i punteggi ROUGE indicano che le risposte generate mantengono contenuti clinici rilevanti in tutti i casi valutati.

GiudicePromptICC1ICC2ICC3ICC1kICC2kICC3K
Mixtralbreve0.1360.1640.1820.320.370.4
zero-shot0.280.3530.5070.5390.6210.755
few-shot0.2240.3230.5220.4630.5880.766
LLaMA3breve0.2340.3310.5320.4790.5970.773
zero-shot0.2440.340.5510.4920.6070.786
few-shot0.2180.3210.5310.4560.5870.772
LLaMA3.1breve0.5210.5250.5370.7660.7680.777
zero-shot0.2460.3430.560.4950.6110.792
few-shot0.5990.5970.5890.8170.8160.811

Tabella 2: Metriche di accordo tra valutatori (ICC).

BERTScore è stato incluso per valutare la similarità semantica utilizzando incorporamenti contestuali derivati da modelli basati su trasformatori25. A differenza di BLEU e ROUGE, questa metrica confronta i testi in base al significato contestuale piuttosto che all'overlap lessicale, rendendola adatta per la valutazione della generazione del linguaggio clinico. I valori di BERTScore ottenuti in questo studio indicano un elevato grado di allineamento semantico tra le risposte generate e i testi di riferimento corrispondenti.

Le analisi aggiuntive includevano la perplessità e la similarità del coseno per completare le metriche primarie di valutazione. La perplessità è stata calcolata per stimare la prevedibilità degli output generati, con valori più bassi che indicano un'incertezza minore durante la generazione del testo26. La similarità del coseno è stata utilizzata per quantificare l'allineamento tra i vettori di embedding derivati dai testi generati e da quelli di riferimento, fornendo una misura aggiuntiva della coerenza semantica27.

Nel complesso, le metriche di valutazione forniscono informazioni complementari sulle caratteristiche sintattiche, semantiche e contestuali delle risposte generate. Figura 5 riassume la distribuzione dei risultati della valutazione attraverso le metriche analizzate, offrendo una visione d'insieme delle prestazioni del sistema nelle condizioni testate.

I risultati della valutazione sono coerenti con il comportamento previsto della generazione assistita dal reperimento (Retrieval-Augmented Generation, RAG) in applicazioni che richiedono l'accesso a fonti di conoscenza esterne. Incorporando documenti recuperati nel processo di generazione delle risposte, l'architettura fornisce informazioni contestuali aggiuntive che supportano risposte clinicamente rilevanti in scenari ad alta intensità di conoscenza18,19. Strategie strutturate di formulazione dei prompt sono incorporate come meccanismi complementari per guidare il processo di ragionamento e l'interpretazione contestuale, in linea con gli approcci riportati in studi recenti20.

L'analisi qualitativa ha integrato la valutazione quantitativa esaminando l'interpretabilità e la rilevanza clinica degli output generati. Esempi rappresentativi delle risposte del sistema sono mostrati in Figura 3 per diversi tipi di domande cliniche. Questi esempi illustrano come la piattaforma generi risposte coerenti nel contesto in tutti gli scenari valutati, inclusi i casi che coinvolgono informazioni cliniche più complesse.

L'architettura multi-agente distribuisce i compiti di elaborazione tra moduli specializzati responsabili di funzioni complementari all'interno del flusso di lavoro. Questa organizzazione riduce la dipendenza da un singolo modello linguistico e consente molteplici fasi di elaborazione delle informazioni e verifica degli output, in linea con le recenti approcci multi-agente riportati in letteratura21,22. Figura 5 riassume la distribuzione dei risultati della valutazione ottenuti con le diverse strategie di prompting e i modelli linguistici considerati in questo studio.

Grafici a violino che confrontano stimoli motivazionali, metodi: Pearson, MAI, M/F CE; analisi educativa.
Figura 5: Distribuzione delle prestazioni del sistema proposto in diverse strategie di stimolazione e modelli linguistici. (A–F) I grafici a violino illustrano le variazioni nella qualità delle risposte per approcci di stimolazione breve, zero-shot e few-shot utilizzando i modelli LLaMA3, LLaMA3.1 e Mixtral. I risultati evidenziano l'impatto della progettazione degli stimoli sulla coerenza e sulle prestazioni dell'output, dimostrando che strategie strutturate di stimolazione tendono a produrre risposte più stabili e accurate in compiti clinici. Cliccare qui per visualizzare una versione ingrandita di questa figura.

I risultati della valutazione sono coerenti con studi recenti che sostengono la combinazione di metriche lessicali e semantiche per valutare le prestazioni dei modelli linguistici di grandi dimensioni4,12. In particolare, le metriche basate sugli embedding sono diventate sempre più importanti per catturare la similarità contestuale nella generazione del linguaggio in ambito sanitario, dove l'interpretazione semantica va oltre la corrispondenza lessicale28,29.

Nel complesso, la valutazione indica che la piattaforma proposta integra standard di interoperabilità, generazione migliorata mediante recupero (RAG) ed elaborazione multi-agente all'interno di un framework unificato per l'analisi dei dati sanitari. I risultati quantitativi e qualitativi presentati in questo studio supportano la fattibilità del flusso di lavoro proposto nelle condizioni sperimentali valutate e forniscono una base per future validazioni in ambienti clinici reali.

DISPONIBILITÀ DEI DATI

I set di dati utilizzati in questo studio sono disponibili pubblicamente. Il dataset di radiografie toraciche è stato ottenuto dalla raccolta Indiana University Chest X-ray Collection (Open-i, U.S. National Library of Medicine), che include i file indiana_reports.csv e indiana_projections.csv, disponibili all'indirizzo https://openi.nlm.nih.gov/. Il dataset di benchmark MedQA è disponibile pubblicamente tramite il suo repository ufficiale. In questo studio non sono stati utilizzati dati clinici proprietari o identificabili del paziente. Tutte le procedure di preelaborazione sono descritte nella sezione Protocollo per supportare la riproducibilità.

Discussione

La valutazione presentata in questo studio rappresenta una validazione metodologica effettuata utilizzando set di dati sanitari di riferimento disponibili pubblicamente e completamente anonimizzati. Non è stata condotta alcuna validazione clinica prospettica che coinvolgesse professionisti sanitari o reclutamento di pazienti, poiché l'obiettivo di questo lavoro è dimostrare un protocollo di implementazione riproducibile piuttosto che l'efficacia clinica.

I risultati di questo studio suggeriscono che la combinazione di standard di interoperabilità sanitaria con modelli linguistici di grandi dimensioni fornisce un quadro pratico per l'integrazione di informazioni cliniche eterogenee. L'architettura proposta unisce meccanismi strutturati di scambio di dati, tra cui FHIR e HL7, con l'elaborazione del linguaggio basata sull'intelligenza artificiale in un flusso di lavoro unificato, in linea con gli attuali sviluppi nei sistemi sanitari digitali15,16,17.

Un aspetto importante del flusso di lavoro proposto è l'integrazione della generazione potenziata dal recupero (Retrieval-Augmented Generation, RAG) all'interno di un'architettura multi-agente. In questa configurazione, i documenti recuperati forniscono informazioni contestuali aggiuntive durante la generazione della risposta, supportando compiti clinici intensivi dal punto di vista conoscitivo. Questa architettura è coerente con studi recenti che descrivono i meccanismi basati sul recupero come una strategia per migliorare l'ancoraggio contestuale e l'affidabilità delle risposte nelle applicazioni dei modelli linguistici di grandi dimensioni18,19.

Strategie di prompting strutturate sono state incorporate nel flusso di lavoro proposto per supportare l'interpretazione contestuale durante la generazione delle risposte. Studi precedenti hanno riportato che l'ingegnerizzazione dei prompt e le tecniche di ragionamento strutturato possono migliorare le prestazioni dei modelli linguistici di grandi dimensioni in compiti complessi di decisione20. L'approccio adottato in questo protocollo è coerente con questi sviluppi e fornisce un quadro strutturato per l'elaborazione del linguaggio clinico.

Dal punto di vista della valutazione, l'uso di metriche complementari ha permesso di esaminare diverse dimensioni delle prestazioni del sistema. Mentre BLEU e ROUGE forniscono informazioni sulla similarità sintattica e sulla copertura dei contenuti23,24, metriche basate sugli embedding come BERTScore catturano le relazioni semantiche che potrebbero non essere riflesse esclusivamente dalla sovrapposizione lessicale25. Questa strategia di valutazione multidimensionale è in linea con studi di benchmarking recenti che raccomandano di combinare misure lessicali e semantiche nella valutazione dei modelli linguistici di grandi dimensioni in applicazioni sanitarie4,12.

Il flusso di lavoro proposto fornisce un quadro metodologico riproducibile per l'implementazione di sistemi interoperabili di supporto decisionale clinico basati sull'intelligenza artificiale. Invece di confrontare diverse architetture di intelligenza artificiale, questo studio si concentra sulla documentazione completa del flusso di lavoro di implementazione, dell'architettura del sistema, dei meccanismi di interoperabilità e della metodologia di valutazione, al fine di facilitare la riproducibilità e l'adozione futura. Analisi comparative che coinvolgono modelli linguistici di grandi dimensioni convenzionali, configurazioni senza recupero aumentato (RAG), modelli finemente addestrati o approcci tradizionali di apprendimento automatico sono al di fuori dell'ambito di questo contributo metodologico e rappresentano una direzione importante per la ricerca futura.

La futura traduzione del framework proposto in ambienti clinici reali richiederà una ulteriore validazione con professionisti sanitari, nonché il rispetto dei requisiti normativi ed etici applicabili. A seconda dell'uso previsto, tali sistemi potrebbero essere soggetti a regolamentazioni relative al Software come Dispositivo Medico (SaMD) e dovrebbero conformarsi ai requisiti stabiliti dalle autorità regolatorie, tra cui la U.S. Food and Drug Administration (FDA) e il Regolamento Europeo sui Dispositivi Medici (MDR). Inoltre, pratiche solide di governance dei dati, sicurezza informatica, trasparenza e sicurezza clinica saranno essenziali per supportare un'implementazione sicura e responsabile in ambito sanitario.

L'analisi qualitativa ha integrato la valutazione quantitativa illustrando le caratteristiche delle risposte generate in scenari clinici rappresentativi. Gli esempi presentati indicano che la piattaforma è stata in grado di produrre risposte coerenti nel contesto nelle condizioni valutate, fornendo ulteriori informazioni sull'interpretabilità delle risposte oltre le metriche quantitative. Osservazioni simili sono state riportate in studi che applicano modelli linguistici di grandi dimensioni a contesti clinici, inclusi supporto diagnostico e interazione con il paziente28,29,30,31.

L'architettura proposta distribuisce i compiti di elaborazione tra moduli specializzati responsabili di funzioni complementari, tra cui la convalida dei dati, il filtraggio contestuale, il supporto al ragionamento clinico e la verifica dell'output. Questa organizzazione modulare riduce la dipendenza da un singolo modello linguistico e consente fasi successive di elaborazione delle informazioni all'interno del flusso di lavoro. Strategie architetturali simili sono state descritte in studi recenti sui sistemi di intelligenza artificiale distribuiti e sui framework multi-agente progettati per ambienti di decisione complessi21,22.

Diversi aspetti legati all'implementazione possono facilitare la riproducibilità e il deployment del protocollo proposto. Una mappatura coerente delle informazioni cliniche allo standard HL7 FHIR contribuisce a mantenere l'interoperabilità semantica lungo tutta la pipeline di elaborazione dei dati. Analogamente, il preelaboramento dei documenti, le strategie di suddivisione in blocchi, la generazione degli embedding e l'indicizzazione vettoriale influenzano il comportamento del flusso di lavoro basato sulla generazione aumentata da recupero (Retrieval-Augmented Generation) e devono essere configurati e validati in base alle caratteristiche dell'applicazione target. L'ingegnerizzazione dei prompt e l'orchestrazione multi-agente possono inoltre essere affinate in modo iterativo attraverso conoscenze specifiche del dominio e feedback di esperti, al fine di migliorare l'ancoraggio contestuale durante la generazione delle risposte. Queste pratiche implementative sono in linea con i recenti sviluppi nell'ambito dell'intelligenza artificiale affidabile e dei modelli linguistici potenziati da recupero18,19,20.

Alcune limitazioni di questo studio devono essere riconosciute. Sebbene la valutazione abbia combinato metriche quantitative e qualitative complementari, queste misure potrebbero non cogliere appieno tutti gli aspetti del ragionamento clinico. Questa osservazione è in linea con studi precedenti che raccomandano framework di valutazione specifici per dominio nelle applicazioni sanitarie12. Inoltre, la piattaforma è stata valutata in condizioni controllate utilizzando dataset di riferimento pubblici e anonimizzati, che potrebbero non rappresentare pienamente la variabilità e la complessità degli ambienti clinici reali.

La piattaforma proposta è stata sviluppata in conformità con gli standard consolidati di interoperabilità sanitaria. L'adozione di HL7 e FHIR favorisce lo scambio strutturato di dati tra sistemi eterogenei di informazione sanitaria, fornendo un quadro standardizzato per l'integrazione delle informazioni cliniche provenienti da diverse fonti. Questo approccio architetturale è coerente con gli attuali sforzi volti a sviluppare sistemi di intelligenza artificiale interoperabili per ambienti sanitari distribuiti15,16,17.

L'implementazione con successo del flusso di lavoro proposto dipende da diverse fasi metodologiche critiche. In primo luogo, i dati clinici devono essere mappati in modo coerente su risorse standardizzate HL7 FHIR per preservare l'interoperabilità semantica tra sistemi sanitari eterogenei15,17. In secondo luogo, la pre-elaborazione dei documenti, inclusa la normalizzazione, la strategia di suddivisione in blocchi e la generazione degli embedding, deve essere configurata attentamente poiché queste fasi influenzano direttamente la qualità del recupero all'interno della pipeline Retrieval-Augmented Generation (RAG)19,32,33. In terzo luogo, il database vettoriale deve essere ricostruito ogni volta che la base di conoscenza viene aggiornata, al fine di mantenere la coerenza tra i documenti indicizzati e i risultati del recupero. Infine, l'ingegnerizzazione dei prompt e l'orchestrazione multi-agente devono essere validate in modo iterativo utilizzando scenari clinici rappresentativi per migliorare l'accuratezza contestuale, ridurre al minimo le allucinazioni e potenziare la riproducibilità dei flussi di lavoro di supporto decisionale clinico assistiti dall'intelligenza artificiale4,3,20,31.

Dal punto di vista della risoluzione dei problemi, le difficoltà comuni nell'implementazione includono un mapping incompleto delle risorse FHIR, prestazioni ridotte nel recupero associate all'indicizzazione dei documenti o alla configurazione del database vettoriale e risposte compromesse da informazioni contestuali insufficienti o da un'ingegnerizzazione dei prompt non ottimale. Questi problemi possono essere affrontati mediante la validazione delle risorse di interoperabilità, l'ottimizzazione dei parametri di recupero, l'aggiornamento periodico o la ricostruzione del database vettoriale dopo modifiche alla base di conoscenza e una valutazione continua tramite metriche lessicali e semantiche complementari. Queste pratiche supportano un comportamento coerente del sistema e facilitano il deployment e la manutenzione di flussi di lavoro di supporto alle decisioni cliniche assistiti dall'intelligenza artificiale4,12,25,23..

Da un punto di vista pratico, il deployment di modelli linguistici di grandi dimensioni in ambienti sanitari richiede la considerazione delle risorse computazionali e dei requisiti infrastrutturali. Sebbene l'architettura proposta supporti sia l'esecuzione basata su cloud che quella locale, potrebbero essere necessarie ulteriori strategie di ottimizzazione a seconda della scala del deployment e delle risorse computazionali disponibili, in particolare in contesti con risorse limitate4.

Ricerche future potrebbero estendere il flusso di lavoro proposto valutando la piattaforma con set di dati clinici reali e flussi operativi sanitari di routine. Ulteriori indagini potrebbero inoltre esplorare strategie di affinamento specifiche per dominio e l'integrazione di metodi di intelligenza artificiale interpretabili per migliorare l'interpretabilità del modello e supportare la trasparenza durante l'assistenza decisionale clinica. Queste direzioni potrebbero contribuire a una valutazione più ampia della piattaforma in ambienti sanitari pratici.

Nel complesso, questo lavoro presenta un framework riproducibile per l'integrazione di standard di interoperabilità sanitaria, Generazione Aumentata da Recupero (RAG) e architetture di modelli linguistici multi-agente all'interno di un flusso di lavoro unificato per l'elaborazione dei dati clinici. Il protocollo proposto offre un approccio strutturato per implementare e valutare sistemi di analisi dei dati medici assistiti dall'intelligenza artificiale e può costituire un riferimento per futuri sviluppi nei sistemi di supporto alle decisioni cliniche interoperabili.

Dichiarazioni

Gli autori dichiarano di non avere interessi finanziari in conflitto né relazioni personali che potrebbero aver influenzato il lavoro descritto nel presente manoscritto. Gli strumenti di intelligenza artificiale generativa (AI) sono stati utilizzati esclusivamente per assistere nella revisione linguistica, nella correzione grammaticale e nel miglioramento della leggibilità del manoscritto. Tutti i contenuti scientifici, la progettazione dello studio, la metodologia, l'analisi dei dati, l'interpretazione dei risultati e le decisioni editoriali sono stati sviluppati, verificati e approvati dagli autori, che si assumono la piena responsabilità del contenuto del presente manoscritto.

Ringraziamenti

Gli autori desiderano ringraziare il Laboratorio di Sistemi Embedded e Distribuiti (LESC), dell'Università Federale del Ceará (UFC), per aver fornito l'ambiente di ricerca e le discussioni tecniche che hanno sostenuto lo sviluppo di questo lavoro. Gli autori ringraziano inoltre gli sviluppatori e i responsabili della manutenzione del software open source, degli standard di interoperabilità e dei set di dati disponibili pubblicamente utilizzati durante questo studio.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
FAISSMeta Platforms Inc.Versione 1.8.0Database vettoriale utilizzato per la ricerca di similarità nella pipeline di Generazione Aumentata da Recupero (RAG).
Standard FHIRHL7 InternationalRilascio 4 (R4)Standard di interoperabilità sanitaria adottato per lo scambio strutturato di dati clinici.
FlaskPallets ProjectsVersione 3.0.3Framework web Python utilizzato per implementare l'API backend RESTful.
Standard HL7HL7 InternationalVersione 2.xProtocollo di messaggistica legacy utilizzato per l'interoperabilità con i sistemi informativi ospedalieri.
API REST HTTPImplementazione personalizzataN/DStrato di comunicazione RESTful tra frontend, backend, database e servizi di intelligenza artificiale.
LangChainLangChain Inc.Versione 0.3.xFramework utilizzato per integrare modelli linguistici di grandi dimensioni (LLM), ingegneria dei prompt e flussi di lavoro di Generazione Aumentata da Recupero.
LangGraphLangChain Inc.Versione 0.2.xFramework utilizzato per orchestrare il flusso di lavoro di ragionamento clinico multi-agente.
LLaMA 3.1 8B InstructMeta Platforms Inc.Versione 3.1Modello linguistico di grandi dimensioni impiegato per il ragionamento clinico e la generazione di linguaggio naturale.
MySQL Community ServerOracle CorporationVersione 8.0Database relazionale utilizzato per memorizzare dati clinici strutturati.
OllamaOllama Inc.Versione 0.9.xMotore di inferenza locale utilizzato per eseguire modelli linguistici di grandi dimensioni preservando la privacy dei pazienti.
PythonPython Software FoundationVersione 3.11Linguaggio di programmazione utilizzato per implementare l'intera piattaforma.
PyTorchLinux FoundationVersione 2.4Framework di apprendimento profondo utilizzato per l'inferenza di modelli linguistici di grandi dimensioni.
Pipeline di Generazione Aumentata da Recupero (RAG)Implementazione personalizzataN/DFramework di intelligenza artificiale che combina recupero semantico e inferenza di modelli linguistici per la generazione di risposte consapevoli del contesto.
Sentence TransformersHugging Face Inc.all-MiniLM-L6-v2Modello di embedding utilizzato per generare rappresentazioni vettoriali dense a fini di recupero semantico dei documenti.
Ubuntu LinuxCanonical Ltd.Versione 24.04 LTSSistema operativo utilizzato per lo sviluppo e la valutazione sperimentale.
Visual Studio CodeMicrosoft CorporationVersione 1.100Ambiente di sviluppo integrato utilizzato per l'implementazione e il debug del software.

Riferimenti

  1. Chukwu E, Garg L. A systematic review of blockchain in healthcare: frameworks, prototypes, and implementations. IEEE Access. 2020;8:21196-21214. doi:10.1109/ACCESS.2020.2969881.
  2. Al-Nbhany WANA, Zahary AT, Al-Shargabi AA. Blockchain-IoT healthcare applications and trends: a review. IEEE Access. 2024;12:4178-4212. doi:10.1109/ACCESS.2023.3349187.
  3. Tan Y, et al. MedChatZH: a Chinese medical large language model. Comput Biol Med. 2024;172:108290.
  4. OLLAMA TEAM. Ollama: Run Large Language Models locally. Version 0.x. San Francisco: Ollama, 2024.
  5. Jahan I, Laskar MTR, Peng C, Huang JX. A comprehensive evaluation of large language models on benchmark biomedical text processing tasks. Comput Biol Med. 2024;171:108189. doi:10.1016/j.compbiomed.2024.108189.
  6. Liu X, Zhou Y, Wang Z, et al. Disease topic modeling of users' inquiry texts: a text mining-based PQDR-LDA model for analyzing the online medical records. IEEE Trans Eng Manag. 2023.
  7. Taylor N, Kormilitzin A, Lorge I, Nevado-Holgado A, Cipriani A, Joyce DW. Model development for bespoke large language models for digital triage assistance in mental health care. Artif Intell Med. 2024;157:102988.
  8. Song M, et al. PneumoLLM: a large language vision model for pneumonia diagnosis. Med Image Anal. 2024;97:103248.
  9. Chien SC, Yen CM, Chang YH, Chen YE, Liu CC, Hsiao YP, et al. Using large language model (LLM) to identify high-burden informal caregivers in long-term care. Comput Methods Programs Biomed. 2024;255:108329. doi:10.1016/j.cmpb.2024.108329.
  10. Xue X, Zhang D, Sun C, et al. Xiaoqing: a Q&A model for glaucoma based on LLMs. Comput Biol Med. 2024;174:108399.
  11. Wu D, Nie L, Mumtaz RA, Agarwal K. A LLM-based hybrid-transformer diagnosis system in healthcare. IEEE J Biomed Health Inform. 2024.
  12. Zhang Y, et al. LLM-enhanced multi-teacher knowledge distillation for modality-incomplete emotion recognition in daily healthcare. IEEE J Biomed Health Inform. 2024.
  13. Sarzaeim P, Mahmoud QH, Azim A. A framework for LLM-assisted smart policing system. IEEE Access. 2024;12:74915-74929. doi:10.1109/ACCESS.2024.3404862.
  14. Leme RS, Blank M. Lei Geral de Proteção de Dados e segurança da informação na área da saúde. Cad Ibero-Am Direito Sanit. 2020;9(3):210-224. doi:10.17566/ciads.v9i3.690.
  15. Zaganelli MV, Binda Filho DL. O sigilo médico e os dados sensíveis na telemedicina à luz da Lei Geral de Proteção de Dados. RECIIS. 2023;17(3):729-740. doi:10.29397/reciis.v17i3.3689.
  16. Tabari P, Costagliola G, De Rosa M, Boeker M. State-of-the-art Fast Healthcare Interoperability Resources (FHIR)-based data model and structure implementations: systematic scoping review. JMIR Med Inform. 2024.
  17. Martinez T, et al. HL7 systems and interoperability ecosystems in modern healthcare. IEEE Rev Biomed Eng. 2024.
  18. Chen L, et al. HL7 integration and semantic interoperability in distributed healthcare networks. IEEE J Biomed Health Inform. 2024.
  19. Liu W, Li W, Huang W, Gao Y. Security framework for medical data sharing. Telemed E-Health. 2024.
  20. Basile LJ, Carbonara N, Panniello U, Pellegrino R. How can technological resources improve the quality of healthcare service? IEEE Trans Eng Manag. 2024;71:5771-5781. doi:10.1109/TEM.2022.3192405.
  21. Singh A, et al. Prompt engineering in large language models: a survey using SWOT analysis [preprint]. arXiv. 2024
  22. Chen L, Chen Y, Liang W, Li X, Li KC, Wang J, Xiong N. MASS: a multiattribute sketch secure data sharing scheme for IoT wearable medical devices based on blockchain. IEEE Internet Things J. 2025;12(2):1990-2001. doi:10.1109/JIOT.2024.3468733.
  23. Autoridade Nacional de Proteção de Dados (BR). Diretrizes para agentes de tratamento de pequeno porte. Brasília (DF): ANPD; 2021.
  24. Patel R, Kim H. Interoperability in EHR. IEEE Transactions on Biomedical Engineering, v. 70, n. 8, p. 2341-2354, ago. 2023. DOI: 10.1109/TBME.2023.3241567.
  25. Zhang T, Kishore V, Wu F, Weinberger KQ, Artzi Y. BERTScore: evaluating text generation with BERT. In: International Conference on Learning Representations (ICLR); 2020.
  26. Chen X, Lu X, Li Q, Li D, Zhu F. Integration of LLM and Human-AI Coordination for Power Dispatching With Connected Electric Vehicles Under SAGVNs. IEEE Trans Veh Technol. 2025;74(2):1992-2002. doi:10.1109/TVT.2024.3434969
  27. Zhou S, Chen C, Gu HH. Testing and evaluating SNOMED CT web browsers' textual search feature. In: Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM); 2019.
  28. McPeak G, Sautmann A, George O, Hallal A, Simal EA, Schwartz AL, Abaluck J, Ravi N, Pless R. An LLM's medical testing recommendations in a Nigerian clinic: potential and limits of prompt engineering for clinical decision support. In: Proceedings of the 2024 IEEE 12th International Conference on Healthcare Informatics (ICHI); 2024.
  29. LLAMA TEAM, AI @ META. The Llama 3 Herd of Models. arXiv preprint arXiv:2407.21783, 2024. Disponível em: https://arxiv.org/abs/2407.21783.
  30. Conselho Nacional de Saúde (BR). Resolução nº 466, de 12 de dezembro de 2012. Aprova as diretrizes e normas regulamentadoras de pesquisas envolvendo seres humanos. Brasília (DF): Ministério da Saúde; 2012.
  31. Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620:172-180. doi:10.1038/s41586-023-06291-2.
  32. Sahoo P, et al. A systematic survey of prompt engineering in large language models [preprint]. arXiv. 2024. Available from: https://arxiv.org/abs/2402.07927
  33. Yan Y, Hou Y, Xiao Y, Zhang R, Wang Q. KNOWNET: guided health information seeking from LLMs via knowledge graph integration. IEEE Trans Vis Comput Graph. 2024.

Ristampe e permessi

Tag

Integrazione FHIRGenerazione Aumentata da Recupero (RAG)Ragionamento Multi-AgenteDatabase VettorialeInteroperabilità SemanticaPrompt Engineering