$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
In questo studio, abbiamo esaminato l'utilità di un chatbot RAG basato su linee guida che utilizzava una guida clinica web—il JLCS Guidebook for Lung Cancer Patients and Families—come fonte di riferimento informativa. Il chatbot generava risposte basate sui contenuti delle linee guida sfruttando la struttura web della linea guida e recuperando pagine in base alla loro somiglianza con le domande degli utenti. Questo approccio ha dimostrato che il recupero basato sulla similarità, combinato con la generazione di risposte basate su fonti di riferimento alle linee guida, può supportare una trasmissione affidabile ed efficiente di informazioni mediche. Studi recenti hanno evidenziato sia il potenziale che i limiti dei chatbot medici basati su LLM, in particolare riguardo alle allucinazioni e all'affidabilità della risposta 12,13,14. A differenza di studi precedenti che si sono concentrati sui framework generali dei chatbot10, 12, 13, il protocollo attuale dimostra un approccio RAG riproducibile basato su linee guida che recupera contenuti delle linee guida del paziente a livello URL e genera risposte basate su informazioni di riferimento identificabili. Questo studio fornisce quindi un protocollo trasparente per la trasmissione delle informazioni sul cancro, piuttosto che un sistema di chatbot clinico completamente validato.
Invece di addestrare l'IA sull'intero corpus delle linee guida, il nostro sistema selezionava solo le CQ più rilevanti per ogni query utente come informazioni di riferimento (Figura 1). La rilevanza tra il testo della domanda e ogni CQ è stata valutata quantitativamente utilizzando i calcoli di similarità coseno basati su linguaggi di programmazione con rappresentazioni vettoriali TF–IDF. Sulla base di questi punteggi di somiglianza, le CQ sono state classificate e selezionate in ordine decrescente di rilevanza, permettendo l'estrazione sistematica delle fonti di informazione appropriate all'interno della linea guida senza il bisogno di giudizio soggettivo (Tabella 1). Inoltre, la concatenazione dei testi CQ recuperati e la loro presentazione collettiva all'IA ha contribuito a preservare una base probatoria coerente per la generazione delle risposte, migliorando così l'accuratezza e la coerenza contestuale delle risposte generate. Nei sistemi RAG, la generazione di informazioni corrette dipende criticamente da fonti di riferimento accurate e appropriate14. Questo design permetteva al sistema di compensare informazioni che non potevano essere sufficientemente coperte da un singolo CQ, contribuendo a risposte più complete e clinicamente plausibili. Inoltre, RAG consente un recupero flessibile di contenuti CQ aggiornati ed è particolarmente adatto per applicazioni mediche basatesull'evidenza 10,11. Sebbene approcci RAG basati su linee guida siano stati descrittiin precedenza 11,18, il protocollo attuale differisce per l'uso della struttura web basata su CQ esistente di una guida orientata al paziente come principale quadro di recupero. Questo design fornisce un flusso di lavoro trasparente e riproducibile che può essere implementato senza la costruzione manuale di una base di conoscenza o il ritraining del modello.
È importante sottolineare che il chatbot ha limitato le sue risposte all'ambito della linea guida di riferimento. Quando le domande uscivano dal contenuto delle linee guida, il sistema si asteneva esplicitamente dal generare risposte, riducendo così il rischio di risposte non supportate. L'uso della similarità coseno nella selezione dei riferimenti di controllo ha ulteriormente aumentato la sicurezza e l'affidabilità delle risposte generate (Tabella 2). Sono state inoltre recuperate pagine di riferimento per domande al di fuori dell'ambito della linea guida (Tabella 3). I valori di somiglianza coseno erano più alti per le domande in-scope (0,20–0,65) rispetto a quelle fuori campo (0,20–0,31; dati non mostrati), ma punteggi di similarità bassi sono stati comunque assegnati ad alcune pagine delle linee guida anche quando il contenuto non era clinicamente rilevante. Ciò avveniva perché la somiglianza coseno veniva calcolata esclusivamente sulla base dell'abbinamento delle parole chiave tra la query e il testo della linea guida. È importante sottolineare che questi riferimenti a bassa rilevanza non hanno portato a risposte inappropriate, poiché il chatbot si è astenuto dal generare risposte quando non erano disponibili informazioni di riferimento sufficienti. Non sono state identificate allucinazioni durante la revisione manuale nelle condizioni di test definite. La soglia di somiglianza coseno di 0,2 è stata selezionata empiricamente durante i test preliminari per bilanciare sensibilità al recupero e specificità. Sebbene questa soglia fosse efficace nelle condizioni di test attuali, la valutazione sistematica della sensibilità della soglia è stata al di fuori dell'ambito di questo studio sul protocollo. Studi futuri dovrebbero indagare gli effetti di impostazioni alternative di soglia utilizzando dataset di benchmark più ampi e metriche di recupero quantitative. Il comportamento osservato suggerisce che il controllo di output basato su RAG possa essere utile nelle applicazioni di IA medica. Tuttavia, l'attuale valutazione si basava su un numero limitato di domande in-scope ed out-scope ed era intesa principalmente come una prova di concetto del flusso di lavoro proposto. Pertanto, i risultati non devono essere interpretati come una validazione completa dell'accuratezza clinica, della sicurezza o della generalizzabilità.
Questo studio presenta diverse limitazioni tecniche. Abbiamo utilizzato l'analizzatore morfologico giapponese e GPT-3.5-turbo-16k (LLM per la generazione della risposta). L'LLM è stato scelto perché era un modello ampiamente disponibile e stabile al momento dello sviluppo del sistema e permetteva un'implementazione riproducibile del flusso di lavoro proposto. Gli analizzatori morfologici e gli LLM presentano caratteristiche distinte; Pertanto, la scelta di modelli o librerie influenza sia l'accuratezza dell'estrazione delle informazioni sia il contenuto delle risposte generate22,23. Sebbene modelli più recenti (ad esempio, LLM di classe GPT-4 o GPT-5) possano migliorare le prestazioni e la validitàesterna 22, la valutazione di modelli alternativi è stata al di fuori dell'ambito del presente studio sul protocollo. I nuovi LLM possono offrire una migliore capacità di ragionamento, seguito delle istruzioni e qualità delle risposte; tuttavia, l'obiettivo principale di questo studio era valutare la fattibilità di un framework RAG basato su linee guida piuttosto che confrontare le prestazioni dei diversi LLM. Ulteriori ottimizzazioni di questi componenti potrebbero permettere una generazione di risposte più efficiente e accurata, e la validazione utilizzando diverse configurazioni di modelli è necessaria per valutare la generalizzabilità di questi risultati. Inoltre, il presente protocollo è stato sviluppato utilizzando una linea guida in lingua giapponese e un'analisi morfologica giapponese. Sebbene il framework di recupero basato su vettorizzazione TF–IDF, similitudine coseno e RAG sia in linea di principio indipendente dal linguaggio, l'implementazione in altri linguaggi richiederebbe strumenti e validazione specifici per l'elaborazione del testo specifici del linguaggio. Sebbene questo studio fosse limitato a una singola linea guida e quindi non consenta il confronto diretto tra diverse strutture di linee guida, l'organizzazione a livello CQ ha facilitato l'estrazione sistematica dei contenuti delle linee guida e ha supportato la costruzione di informazioni di riferimento per il chatbot RAG basato su linee guida. In particolare, la struttura web della linea guida — in cui ogni CQ è associato a un URL unico — ha svolto un ruolo pratico importante nel consentire uno scraping e un'organizzazione efficienti dei contenuti di riferimento a livello URL. Linee guida con formati diversi, inclusi documenti basati su PDF o siti web senza URL a livello CQ, possono richiedere strategie alternative di segmentazione e recupero. Pertanto, la generalizzazione dell'attuale flusso di lavoro ad altre strutture di linee guida e specialità mediche resta da stabilire. I lavori futuri dovrebbero valutare l'applicabilità di questo approccio su molteplici malattie, formati di linee guida e fonti di informazioni.
I risultati di questo studio forniscono indicazioni pratiche per progettare sistemi di IA con riferimento alle linee guida e dimostrano che un chatbot RAG basato su linee guida che fa riferimento a linee guida cliniche basate sul web ha potenziale come strumento per fornire informazioni mediche legate al cancro. Tuttavia, questo studio rappresenta una valutazione proof-of-concept volta a dimostrare la fattibilità tecnica dei meccanismi di recupero delle linee guida, generazione di risposta e restrizione della risposta e non deve essere interpretato come una validazione clinica formale di un sistema informativo medico. L'efficacia clinica, la sicurezza e gli esiti per gli utenti non sono stati valutati e restano da stabilire attraverso studi futuri. Da un punto di vista etico e di sicurezza dell'utente, limitare le risposte a informazioni supportate dalle linee guida può ridurre il rischio di risposte non supportate o allucinate. Tuttavia, un comportamento eccessivo di rifiuto può anche ridurre la soddisfazione dell'utente e la percepita utilità. I lavori futuri dovrebbero quindi valutare l'equilibrio tra sicurezza e usabilità, mantenendo al contempo adeguate salvaguardie contro la disinformazione. Sfruttando la struttura informativa delle linee guida basate sul web e fornendo risposte mirate alle domande degli utenti, questo sistema potrebbe servire come modello utile per future applicazioni dell'IA nella distribuzione delle informazioni mediche.