Articolo metodologico

Sviluppo di un chatbot di generazione aumentata basata su linee guida basate su linee guida per il recupero che fa riferimento alle linee guida cliniche per il cancro basate sul web

DOI:

10.3791/71099

7 agosto 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo descrive lo sviluppo e la valutazione di un chatbot di generazione aumentata basata su linee guida per il recupero e la riassunzione di contenuti provenienti da linee guida cliniche per il cancro basate sul web, generando risposte basate su riferimenti alle domande degli utenti.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La diffusa disponibilità di informazioni mediche su Internet ha migliorato l'accesso alle conoscenze relative alla salute per i pazienti; tuttavia, ha anche aumentato l'esposizione a informazioni mediche inaccurate. La cura oncologica coinvolge informazioni complesse, rendendo difficile per i pazienti identificare fonti accurate e basate su evidenze. I grandi modelli linguistici permettono l'interazione con il linguaggio naturale ma spesso generano allucinazioni, limitandone l'applicazione nella trasmissione delle informazioni mediche. La generazione aumentata al recupero (RAG) ha il potenziale di mitigare questi rischi basandosi sulle risposte su fonti di riferimento esterne. Questo studio descrive lo sviluppo e la valutazione di un chatbot RAG basato su linee guida che utilizza linee guida cliniche per il cancro disponibili pubblicamente e basate sul web. Il sistema estrae gli URL dalle pagine indice di una linea guida, elabora il testo delle pagine utilizzando analisi morfologica e similarità coseno basata sulla frequenza dei termini–frequenza inversa del documento, e costruisce informazioni di riferimento da pagine altamente rilevanti. Un grande modello linguistico utilizza questi riferimenti per generare risposte vincolate ai contenuti delle linee guida. La Guida JLCS per i Pazienti e le Famiglie di Cancro Polmonare è stata utilizzata come linea guida di riferimento. I set di domande includevano sia i tipi di cancro inclusi nella linea guida che i tipi di cancro fuori ambito per valutare il controllo della risposta. Le informazioni mediche sono state estratte con successo dalle pagine dei contenuti contabili, con il 98% degli URL estratti contenente contenuti medici di riferimento. Per le domande in-scope, il chatbot ha generato risposte riassumendo i contenuti delle linee guida e non sono state identificate allucinazioni durante la revisione manuale secondo le condizioni di test definite. Per le domande fuori ambito, il chatbot ha costantemente rifiutato di rispondere e ha indicato che le informazioni disponibili erano insufficienti. La struttura web della linea guida ha facilitato uno scraping e un'organizzazione efficienti dei contenuti di riferimento a livello URL. Questo protocollo fornisce indicazioni pratiche per costruire sistemi di intelligenza artificiale che forniscono informazioni mediche utilizzando linee guida cliniche basate sul web.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'uso diffuso di internet e dei social media ha facilitato l'accesso alle informazioni medicheper i pazienti 1,2. Le informazioni sulla cura del cancro sono spesso complesse ed estese, rendendo particolarmente difficile per i pazienti identificare fonti accurate, rilevanti e basate su provescientifiche 3. Sebbene le risorse online possano aiutare la comprensione dei pazienti, contengono anche una quantità significativa di informazioni medicheerrate 3, che possono influenzare negativamente le decisioni dei pazienti riguardo alla loro cura4. Poiché la disinformazione legata al cancro può influenzare gli esiti dei pazienti5, c'è una crescente necessità di sistemi di intelligenza artificiale (IA) che possano aiutare gli utenti individuali a cercare, riassumere e interpretare le informazionimediche 6.

I grandi modelli linguistici (LLM) permettono agli utenti di accedere alle informazioni tramite conversazioni in linguaggionaturale 7; Tuttavia, la generazione di disinformazione (cioè allucinazioni) rimane una seria preoccupazione nel campomedico 8,9,10,11. Una fonte chiave di disinformazione è la qualità e l'accuratezza dei dati di addestramento utilizzati per sviluppare il chatbot. Inoltre, la natura statica dell'addestramento del modello fa sì che la conoscenza possa diventare obsoleta nel tempo, limitando la capacità degli LLM di fornire informazioni attuali e contestualmenteappropriate 12,13. Queste limitazioni evidenziano l'importanza di strategie efficaci di gestione della conoscenza per garantire che le risposte dei chatbot rimangano accurate, rilevanti e aggiornate. In particolare, sistemi che possono accedere facilmente e fare riferimento alle risorse attuali basate sull'evidenza, come le linee guida di pratica clinica, sono desiderabili in contesti medici, dove raccomandazioni e standard di cura si evolvono continuamente. Per affrontare questa sfida, la generazione aumentata al recupero (RAG), che genera risposte incorporando informazioni provenienti da fonti di conoscenza esterne, ha ricevuto un'attenzione crescente 10,13,14,15,16,17.

Sebbene il RAG sia stato applicato sempre più ai chatbot medici, è stata data poca attenzione a come le linee guida di pratica clinica dovrebbero essere sistematicamente incorporate come fonti di riferimentoinformative 18. Molte linee guida cliniche sono disponibili pubblicamente sul web; tuttavia, non è chiaro se la loro struttura web esistente possa servire direttamente come framework di recupero per i sistemiRAG 18. Inoltre, metodi pratici per costruire informazioni di riferimento senza lo sviluppo manuale di una base di conoscenza non sono stati ben consolidati.

In questo studio, abbiamo mirato a stabilire principi di progettazione per sistemi di IA con riferimento alle linee guida nel campo medico, sviluppando e valutando un chatbot RAG basato su linee guida che utilizzi linee guida cliniche oncologiche disponibili pubblicamente e basate su internet, consentendo così un accesso semplice e tempestivo alle informazioni basate su linee guida. Come prova di concetto, abbiamo valutato la fattibilità tecnica del recupero delle linee guida, della generazione della risposta e della restrizione della risposta utilizzando la struttura web esistente delle linee guida cliniche disponibili pubblicamente, con l'obiettivo di proporre un protocollo di sviluppo riproducibile per sistemi RAG con riferimento alle linee guida.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio non coinvolge soggetti umani che necessitano di protezione dai rischi legati alla ricerca. Pertanto, non richiede la revisione da parte di un comitato di revisione istituzionale secondo le linee guida etiche giapponesi per la ricerca medica che coinvolge soggettiumani 19. Questo studio è riportato in conformità con le linee guida TRIPOD-LLM per la Segnalazione Trasparente di un Modello Multivariabile per la Prognosi o Diagnosi Individuale(TRIPOD)-LLM 20.

Consulta la Figura 1 per una panoramica schematica del protocollo chatbot RAG basato su linee guida.

figure-protocol-1
Figura 1. Workflow del protocollo chatbot RAG (Retrieval-Augmented Generation Basato su Linee Guida). Panoramica schematica del flusso di lavoro RAG dei chatbot basato su linee guida. Gli URL vengono estratti dalla pagina indice di una guida clinica online e utilizzati per costruire informazioni di riferimento. Le query degli utenti vengono convertite in parole chiave e il contenuto delle pagine web viene elaborato tramite tokenizzazione, vettoriazione frequenza dei termini e frequenza inversa del documento e analisi della similarità coseno per identificare le pagine delle linee guida rilevanti. Informazioni di riferimento selezionate vengono integrate e fornite a un grande modello linguistico per generare risposte basate esclusivamente sul contenuto della linea guida di riferimento. Il pannello a destra riassume gli elementi di valutazione utilizzati per gli URL estratti, le informazioni di riferimento e le risposte dei chatbot. Clicca qui per visualizzare una versione più grande di questa figura.

1. Preparazione delle informazioni di riferimento dalle linee guida basate sul web

  1. Estrai tutti gli URL dalle pagine indice delle linee guida cliniche web target utilizzando BeautifulSoup 4 (libreria di analisi sintattica HTML) implementata nel linguaggio di programmazione Python (versione 3.12).
    NOTA: Implementa lo script di estrazione URL usando il linguaggio di programmazione con i seguenti pacchetti: libreria di analisi HTML (versione 4.12.3) e richieste (libreria di recupero pagina; versione 2.32.3). Installa i pacchetti usando pip. Il codice sorgente completo per l'estrazione degli URL è fornito nel Supplementary File 1. Consulta la Tabella dei Materiali per i dettagli sul software.
  2. Rivedere manualmente tutti gli URL estratti per confermare l'accesso e la rilevanza con successo rispetto alla linea guida clinica target.
  3. Classifica ogni URL come contenente informazioni mediche o non mediche. Esegui la classificazione degli URL da parte di un autore (S.N.).
    NOTA: Le informazioni mediche sono state definite come contenuti di riferimento delle linee guida, inclusi domande cliniche (CQ), domande di base e set di domande. Le informazioni non mediche includevano link, pagine di società o organizzazioni e altri contenuti accessori non idonei per il riferimento.
  4. Compila gli URL validati in un workbook Microsoft Excel (formato .xlsx), con un URL registrato per riga. Memorizza la lista URL risultante come dataset di input per il recupero del testo, la preelaborazione e le analisi di similarità successive.

2. Generazione di parole chiave dalle query degli utenti

  1. Inserisci la query in linguaggio naturale in ChatGPT (Generative Pre-trained Transformer, versione 4o; modello di generazione di parole chiave).
  2. Chiede al modello di estrarre due parole chiave corrispondenti alla query dell'utente.
  3. Usa il seguente prompt, scritto in giapponese, per la generazione di parole chiave:
    "figure-protocol-2"
    (Traduzione inglese: "Estrae due parole chiave dal testo seguente.")
  4. Aggiungi la query in linguaggio naturale dell'utente a questa istruzione e inviala al modello di generazione delle parole chiave per la generazione delle parole chiave.
  5. Non modificare manualmente nessun parametro del modello. Eseguire la generazione di parole chiave utilizzando le impostazioni predefinite del modello di generazione delle parole chiave.
  6. Genera due parole chiave per ogni query dell'utente. Conservare entrambe le parole chiave senza ulteriori modifiche, filtri o selezioni manuali, e utilizzale per i calcoli successivi di somiglianza.
  7. Memorizza le parole chiave generate in un workbook Microsoft Excel (formato .xlsx). Per ogni record, memorizza la query utente originale e le corrispondenti parole chiave generate per il successivo recupero basato sulla somiglianza.

3. Elaborazione del testo e calcolo della similarità

  1. Recupera il contenuto integrale del testo da ogni URL estratto utilizzando la libreria di recupero della pagina web e la libreria di analisi sintetica HTML. Estrae il contenuto testuale dalla sorgente HTML usando la funzione BeautifulSoup get_text().
  2. Pre-elabora il testo estratto della pagina web e le parole chiave generate rimuovendo tag HTML e caratteri non giapponesi.
  3. Eseguire analisi morfologiche giapponesi usando MeCab (versione 0.996; Analizzatore morfologico giapponese) con il dizionario predefinito. Conserva solo i sostantivi e concatenali in una stringa di testo delimitata nello spazio.
  4. Combinare le parole chiave generate in un'unica stringa di testo e applicare le stesse procedure di pre-elaborazione e tokenizzazione utilizzate per il testo delle pagine web.
  5. Genera vettori frequenza dei termini–frequenza inversa del documento (TF–IDF) dal testo della pagina web elaborato e dal testo delle parole chiave utilizzando l'implementazione TfidfVectorizer nella libreria scikit-learn (versione 1.6.1) con le impostazioni dei parametri predefinite.
    NOTA: Tutti i parametri del TfidfVectorizer sono stati lasciati ai valori predefiniti e non sono state applicate impostazioni personalizzate dei parametri.
  6. Calcola la somiglianza coseno tra ciascun vettore di pagina web e il vettore parola chiave usando la funzione di somiglianza coseno.
  7. Classifica gli URL in ordine decrescente secondo i punteggi di similarità del coseno. Non applicare ulteriori criteri di spareggio.
  8. Seleziona le pagine con un punteggio di somiglianza coseno di ≥0,2 come informazioni di riferimento candidato.
    NOTA: La soglia di similitudine coseno (0.2) è stata selezionata empiricamente durante lo sviluppo del sistema per dare priorità al richiamo di recupero ed evitare di escludere contenuti potenzialmente rilevanti delle linee guida.
  9. Conservare tutte le pagine candidata che soddisfano la soglia di somiglianza.

4. Costruzione delle informazioni di riferimento

  1. Estrai sequenzialmente il contenuto testuale delle pagine selezionate dalla parte superiore della lista classificata.
  2. Concatenare i testi estratti per formare un unico documento di riferimento.
  3. Prima di inviarli al LLM, sostituire i caratteri di nuova linea e i caratteri spazi bianchi consecutivi nel testo di riferimento con uno spazio singolo.
  4. Tronca il testo di riferimento concatenato ai primi 4.096 caratteri prima di fornirlo al LLM.
    NOTA: Il limite di troncamento si basava sui caratteri piuttosto che sui token. È stato selezionato empiricamente un limite di 4.096 caratteri per garantire che le informazioni combinate di prompt e riferimento rimanessero entro la capacità di input del modello di generazione di risposta GPT-3.5-turbo-16k.

5. Generazione di risposte basate sull'IA

  1. Fornire le informazioni di riferimento costruite e la query utente originale al modello di generazione di risposta tramite l'interfaccia di programmazione applicativa (API).
  2. Istruire l'IA utilizzando il seguente prompt (scritto interamente in giapponese) per assicurarsi che le risposte vengano generate esclusivamente sulle informazioni di riferimento fornite:
    "Sei un'assistente alle informazioni mediche che fornisce indicazioni ai pazienti oncologici. Genera risposte basandoti esclusivamente sulle seguenti informazioni di riferimento e non utilizzare le tue conoscenze o ragionamenti generali. Le risposte dovrebbero essere dettagliate e facili da comprendere, di circa 500 caratteri. Se le informazioni di riferimento non contengono informazioni sufficienti per rispondere alla domanda, rispondi con: 'Non ci sono informazioni sufficienti nel testo', senza usare alcuna speculazione o conoscenza generale."
  3. Fornire le informazioni di riferimento e la query dell'utente insieme all'interno di un unico messaggio utente. Struttura l'input come: "Informazioni di riferimento: [testo di riferimento]" seguito da "Domanda: [query utente]".
  4. Genera risposte utilizzando il modello di generazione di risposta con le seguenti impostazioni: temperatura = 0,1, lunghezza massima di uscita = 1.024 token, n = 1, e stop = Nessuno.
  5. Ottieni la risposta generata dall'IA per una valutazione successiva.
    NOTA: Invia le informazioni di riferimento e la query dell'utente come un unico messaggio utente. Fornire le istruzioni di generazione delle risposte separatamente come messaggio di sistema.

6. Linee guida di riferimento e formulazione delle domande

  1. Seleziona la Guida JLCS per i Pazienti e le Famiglie con Cancro Polmonare (Lung Guidebook)21, che è disponibile gratuitamente online, come informazione di riferimento per il sistema chatbot RAG basato su linee guida.
  2. Crea due categorie di domande di valutazione basate sul tipo di tumore: tumori timici, che rientrano nell'ambito della linea guida, e glioma pediatrico, che è al di fuori dell'ambito delle informazioni di riferimento.
  3. Formula quattro domande che coprono la diagnosi e il trattamento per ogni tipo di cancro:
    "Quali metodi diagnostici sono disponibili per tumori XX (ad esempio, il glioma timico o pediatrico)?
    "Quali sono gli approcci diagnostici patologici per i tumori XX?"
    "Quali opzioni di trattamento sono disponibili per i tumori XX?"
    "Quali sono le opzioni di trattamento chirurgico per i tumori XX?"
  4. Invia domande relative ai tipi di cancro coperti dalla linea guida web indicata al chatbot. Ad esempio, invia una domanda riguardante la diagnosi del tumore timico utilizzando la Lung Guide come informazione di riferimento.
  5. Invia domande al di fuori della linea guida di riferimento al chatbot per valutarne la capacità di astenersi dall'uso di informazioni esterne o non correlate. Ad esempio, invia una domanda riguardante il glioma pediatrico utilizzando la Lung Guide come informazione di riferimento.
  6. Valuta ogni domanda in una sessione di chat indipendente. Non trasferire la cronologia delle conversazioni tra una domanda e l'altra.
  7. Registra le risposte generate dall'IA per una valutazione successiva.

7. Valutazione della risposta

  1. Effettua una revisione manuale di tutte le risposte generate.
  2. Valuta se ogni risposta contiene allucinazioni.
  3. Valuta se ogni risposta è supportata dalle informazioni contenute nella linea guida di riferimento.
    NOTA: Le allucinazioni sono state definite come risposte contenenti eventi, nomi o termini inesistenti che potrebbero potenzialmente causare dannimedici 14. Tutte le risposte generate sono state esaminate per accuratezza e assenza di allucinazioni da un autore con 8 anni di esperienza in un ospedale universitario, inclusi il supporto al paziente e la comunicazione medica per pazienti con cancro. Qualsiasi incertezza riguardo alla classificazione della risposta è stata risolta attraverso una discussione con un medico coautore con oltre 20 anni di esperienza nei servizi di informazione sul cancro presso il National Cancer Center Japan.
  4. Considera una risposta supportata solo quando tutte le affermazioni clinicamente rilevanti possono essere confermate direttamente dalla linea guida di riferimento recuperata senza richiedere conoscenze aggiuntive o inferenze non supportate.
  5. Classifica ogni risposta usando etichette di risultato predefinite. Classifica le risposte contenenti solo informazioni supportate dalla linea guida di riferimento come "allucinazione assente." Classifica le risposte contenenti informazioni non supportate o fabbricate come "allucinazioni presenti".

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Recuperabilità dei contenuti medici tramite pagine di indice

L'architettura web-scraping raccoglieva gli URL dalla pagina indice della linea guida. Dalla Lung Guidebook, sono stati estratti 106 URL dalla pagina indice, di cui 104 (98%) contenevano informazioni mediche (Tabella Supplementare 1). L'efficacia delle risposte dei chatbot basate sulle pagine di contenuto delle linee guida è riassunta nella Tabella 1. Il chatbot ha generato risposte per tutte e quattro le parole chiave cliniche quando le domande rientravano nell'ambito della linea guida. Per la "diagnosi del tumore timico" e la "diagnosi patologica", sono stati estratti tre URL correlati per ciascuna parola chiave e tutti gli URL estratti sono stati considerati efficaci (100%). Per "metodi di trattamento" e "trattamento chirurgico", sono stati estratti 15 URL per ogni parola chiave, con 14 elementi efficaci (93%).

QueryParole chiaveElementi di contenuto riferiti, nElementi di riferimento efficaci,
n (%)
Quali metodi diagnostici sono disponibili per i tumori timici?Diagnosi di tumore timico33 (100)
Quali sono gli approcci diagnostici patologici per i tumori timici?Diagnosi patologica del tumore timico33 (100)
Quali opzioni di trattamento sono disponibili per i tumori timici?Metodi di trattamento del tumore timico1514 (93)
Quali sono le opzioni di trattamento chirurgico per i tumori timici?Trattamento chirurgico del tumore timico1514 (93)

Tabella 1: Contenuto delle informazioni di riferimento e risposte dei chatbot basate sulla guida JLCS per i pazienti e le famiglie con cancro ai polmoni. Riepilogo delle query degli utenti, parole chiave generate, numero di elementi di contenuto di riferimento identificati tramite recupero basato sulla similarità e numero di elementi di riferimento efficaci contenenti informazioni mediche. Gli elementi di contenuto referenziato rappresentano il numero totale di pagine web correlate identificate a livello URL sulla base di ciascuna parola chiave. Gli elementi di riferimento efficaci rappresentano il numero e la percentuale di pagine web uniche contenenti informazioni mediche dopo aver escluso URL duplicati e pagine non mediche.

Risposte dei chatbot alle domande in-Scope

La Tabella 2 mostra le risposte dei chatbot alle domande che rientravano nell'ambito della linea guida fornita. Quando erano disponibili informazioni di riferimento sufficienti, il chatbot generava risposte riassumendo le parti rilevanti del testo della linea guida. Le risposte generate consistevano in circa 350 caratteri giapponesi. Non sono state identificate allucinazioni durante la revisione manuale nelle condizioni di test definite. Per queste domande in-scope, molteplici elementi effettivamente referenziati supportavano la generazione delle risposte (Tabella 1). Il testo giapponese generato è stato tradotto in inglese utilizzando ChatGPT versione 5.2 e successivamente rivisto dagli investigatori per verificare accuratezza e coerenza con le risposte giapponesi originali.

QueryRisposteNumero di caratteri
Quali metodi diagnostici sono disponibili per i tumori timici?La diagnosi dei tumori timici richiede sia una diagnosi per immagini che una diagnosi patologica. Per la diagnosi per immagini vengono eseguite una TAC toracica e una risonanza magnetica toracica. Il timoma e il carcinoma timico sono tumori solidi che non contengono componenti d'aria o di liquido all'interno del tumore, e l'invasione nei tessuti normali circostanti è nota per essere lieve nel timoma e più pronunciata nel carcinoma timico. Quando gli esami di imaging determinano che non vi è invasione nei tessuti circostanti o che non ci sono tumori distanti dalla lesione primaria (metastasi), il tumore viene resezionato chirurgicamente e viene effettuata una diagnosi patologica utilizzando il campione chirurgico. Quando la resezione chirurgica è difficile, viene eseguita una biopsia guidata dalla TAC e viene effettuata una diagnosi ottenendo una porzione del tessuto tumorale. Nella diagnosi patologica, i timomi sono classificati in base alla proporzione di linfociti normali all'interno del tumore e alla morfologia delle cellule tumorali, mentre i carcinomi timici sono classificati in dettaglio secondo il sottotipo istologico. Per la determinazione dello stadio clinico (stadio), si tiene conto dell'entità della diffusione delle lesioni tumorali timiche e i tumori sono classificati in stadi da I-IV basandosi su tre sistemi di classificazione delle stadi.366
Quali sono gli approcci diagnostici patologici per i tumori timici?Nella diagnosi patologica dei tumori timici, l'esame patologico viene effettuato ottenendo una parte o l'intero tessuto tumorale. I timomi sono classificati in sottotipi come tipo A e tipo AB in base alla proporzione di linfociti normali contenuti nel tumore e alla morfologia delle cellule tumorali. Al contrario, il carcinoma timico è un tumore maligno caratterizzato da atipia cellulare, mentre il carcinoma a cellule squamose è il sottotipo istologico più comune. Attraverso la diagnosi patologica, vengono valutate le caratteristiche biologiche e il grado di progressione tumorale, il che è utile per selezionare le strategie terapeutiche appropriate e prevedere la prognosi. Inoltre, la diagnosi patologica dei tumori timici consente di determinare lo stadio della malattia, fornendo informazioni importanti per la pianificazione del trattamento. La stadiazione clinica è classificata utilizzando tre sistemi—la classificazione Masaoka, la classificazione Masaoka–Koga e la classificazione UICC–TNM—e i tumori sono suddivisi in quattro stadi, dalla fase I alla IV, in base all'entità della diffusione e dell'invasione tumorale. La diagnosi patologica fornisce informazioni indispensabili per il trattamento appropriato e la valutazione prognostica dei tumori timici.330
Quali opzioni di trattamento sono disponibili per i tumori timici?Le opzioni di trattamento per i tumori timici includono la terapia chirurgica (chirurgia), la radioterapia e la terapia farmacologica (chemioterapia). L'intervento chirurgico viene eseguito come una procedura in cui il timo viene completamente resezionato insieme al tumore e, nei casi di timoma, potrebbe non essere necessario un trattamento aggiuntivo. Nel carcinoma timico, la radioterapia post-operatoria può essere aggiunta quando il cancro si è diffuso ai tessuti circostanti. La chemioterapia o chemioradioterapia viene eseguita nei casi in cui l'intervento chirurgico è difficile o in caso di recidiva o metastasi a distanza, e queste sono utilizzate come parte della terapia farmacologica. Inoltre, per il carcinoma timico avanzato o ricorrente, viene eseguito un trattamento incentrato sulla chemioterapia e può essere somministrata una terapia multimodale che combina chirurgia e radioterapia se necessario. Inoltre, per carcinoma timico avanzato o ricorrente dopo la chemioterapia, può essere utilizzato lenvatinib, un agente terapeutico mirato alle molecoli. La combinazione appropriata di modalità di trattamento viene selezionata in base alla condizione della malattia e allo stato clinico del paziente.342
Quali sono le opzioni di trattamento chirurgico per i tumori timici?Il trattamento chirurgico per i tumori timici viene eseguito quando il tumore è giudicato completamente resecabile. In chirurgia, è generalmente prassi standard rimuovere l'intero timo insieme al tumore. Nei casi di timoma, se il tumore è completamente resezionato, non è necessario alcun trattamento aggiuntivo. Al contrario, nei casi di carcinoma timico, quando è presente un'invasione del cancro nei tessuti circostanti, può essere aggiunta una radioterapia postoperatoria adiuvante. Quando l'intervento chirurgico è giudicato difficile, si esegue prima la chemioterapia o la chemioradioterapia, e successivamente si considera l'intervento se diventa fattibile. Se l'intervento chirurgico non può essere eseguito, la chemioterapia o la chemioradioterapia possono essere proseguite. Inoltre, anche quando l'intervento chirurgico è possibile, se la resezione completa non può essere effettuata, possono essere somministrate radioterapie post-operatorie o chemioradioterapia per trattare il tumore residuo. Il trattamento chirurgico viene selezionato in base al tipo di tumore e al grado di progressione della malattia.342

Tabella 2: Risposte generate dal chatbot RAG (Retrieval-Augmented Generation basato su linee guida) basato sulla guida JLCS per pazienti e famiglie di cancro ai polmoni. Risposte rappresentative generate dal chatbot RAG basato su linee guida per domande relative ai tumori timici utilizzando informazioni di riferimento estratte dalla Guida JLCS per Pazienti e Famiglie di Cancro Polmonare (https://www.haigan.gr.jp/public/guidebook/2024/). La tabella include la query dell'utente, la risposta generata dal chatbot e la durata della risposta. Il conteggio dei caratteri è stato misurato nelle risposte originali in giapponese prima della traduzione in inglese usando ChatGPT versione 5.2.

Risposte dei chatbot a domande fuori campo

Le risposte dei chatbot a domande che uscivano dall'ambito della Lung Guide sono riassunte nella Tabella 3. Sebbene fosse stato citato un numero limitato di elementi di contenuto per queste domande, il modello di generazione delle risposte ha determinato che le informazioni di riferimento disponibili erano insufficienti per generare una risposta basata su evidenze. Di conseguenza, il chatbot ha restituito risposte che indicavano informazioni insufficienti per le query fuori ambito. Le affermazioni "Non ci sono informazioni sufficienti nel testo" e "Non ci sono riferimenti." erano risposte predefinite specificate nel prompt di sistema. La prima veniva restituita quando le informazioni di riferimento recuperate non erano sufficienti a rispondere alla domanda, mentre la seconda veniva restituita quando non venivano recuperate informazioni di riferimento.

QueryParole chiaveElementi di contenuto riferiti, nRisposta dei chatbot
Quali metodi diagnostici sono disponibili per il glioma pediatrico?Diagnosi di glioma pediatrico0Non ci sono riferimenti.
Quali sono gli approcci diagnostici patologici per il glioma pediatrico?Diagnosi patologica del glioma pediatrico13Nel testo ci sono informazioni insufficienti.
Quali opzioni di trattamento sono disponibili per il glioma pediatrico?Metodi di trattamento pediatrico del glioma13Nel testo ci sono informazioni insufficienti.
Quali sono le opzioni di trattamento chirurgico per il glioma pediatrico?Trattamento chirurgico del glioma pediatrico12Nel testo ci sono informazioni insufficienti.

Tabella 3: Risposte dei chatbot a domande fuori ambito a livello di domanda clinica basate sulla guida JLCS per pazienti e famiglie di cancro ai polmoni. Risposte generate dal chatbot RAG (retrieval-augmented generation basato su linee guida) per domande al di fuori dell'ambito della linea guida di riferimento. La tabella riassume le domande degli utenti, le parole chiave generate, il numero di elementi di contenuto di riferimento identificati tramite il recupero basato sulla somiglianza e le risposte dei chatbot risultanti. Gli elementi di contenuto referenziato rappresentano il numero totale di pagine web correlate identificate a livello URL sulla base di ciascuna parola chiave. Gli elementi di riferimento efficaci non sono stati calcolati per domande fuori ambito perché il contenuto recuperato non conteneva informazioni rilevanti per la malattia interrogata.

Fascicolo supplementare 1. Codice Python per l'estrazione di URL e testo da linee guida cliniche basate sul web. Il codice utilizzato per estrarre URL e testo delle pagine web dalle pagine degli indici delle linee guida cliniche basate sul web. Gli URL estratti e il contenuto testuale sono stati utilizzati per l'elaborazione successiva del testo, l'analisi di somiglianza e la costruzione delle informazioni di riferimento nel flusso di lavoro RAG (Retrieval-Augmented Generation (RAG) basato su linee guida. Clicca qui per scaricare questo file.

Tabella supplementare 1. Elenco degli URL estratti dalla pagina indice delle linee guida web e la loro classificazione come informazioni mediche o non mediche. Gli URL estratti dalla pagina dell'indice del JLCS Guidebook for Lung Cancer Patients and Families venivano revisionati manualmente e classificati come informazioni mediche o non mediche. Le informazioni mediche sono state definite come contenuti di riferimento per le linee guida, inclusi domande cliniche (CQ), domande di base, set di domande e materiali educativi supplementari rilevanti per la guida dei pazienti. Le informazioni non mediche includevano pagine web della società o delle organizzazioni, pagine di navigazione, link ipertestuali e altri contenuti accessori non utilizzati come informazioni di riferimento per la generazione di risposte da chatbot. La tabella riassume tutti gli URL estratti e i loro risultati di classificazione. *Gli URL sono stati estratti dalla pagina dei contenuti (https://www.haigan.gr.jp/public/guidebook/2024/) del JLCS Guidebook for Lung Cancer Patients and Families. Clicca qui per scaricare questo file.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In questo studio, abbiamo esaminato l'utilità di un chatbot RAG basato su linee guida che utilizzava una guida clinica web—il JLCS Guidebook for Lung Cancer Patients and Families—come fonte di riferimento informativa. Il chatbot generava risposte basate sui contenuti delle linee guida sfruttando la struttura web della linea guida e recuperando pagine in base alla loro somiglianza con le domande degli utenti. Questo approccio ha dimostrato che il recupero basato sulla similarità, combinato con la generazione di risposte basate su fonti di riferimento alle linee guida, può supportare una trasmissione affidabile ed efficiente di informazioni mediche. Studi recenti hanno evidenziato sia il potenziale che i limiti dei chatbot medici basati su LLM, in particolare riguardo alle allucinazioni e all'affidabilità della risposta 12,13,14. A differenza di studi precedenti che si sono concentrati sui framework generali dei chatbot10, 12, 13, il protocollo attuale dimostra un approccio RAG riproducibile basato su linee guida che recupera contenuti delle linee guida del paziente a livello URL e genera risposte basate su informazioni di riferimento identificabili. Questo studio fornisce quindi un protocollo trasparente per la trasmissione delle informazioni sul cancro, piuttosto che un sistema di chatbot clinico completamente validato.

Invece di addestrare l'IA sull'intero corpus delle linee guida, il nostro sistema selezionava solo le CQ più rilevanti per ogni query utente come informazioni di riferimento (Figura 1). La rilevanza tra il testo della domanda e ogni CQ è stata valutata quantitativamente utilizzando i calcoli di similarità coseno basati su linguaggi di programmazione con rappresentazioni vettoriali TF–IDF. Sulla base di questi punteggi di somiglianza, le CQ sono state classificate e selezionate in ordine decrescente di rilevanza, permettendo l'estrazione sistematica delle fonti di informazione appropriate all'interno della linea guida senza il bisogno di giudizio soggettivo (Tabella 1). Inoltre, la concatenazione dei testi CQ recuperati e la loro presentazione collettiva all'IA ha contribuito a preservare una base probatoria coerente per la generazione delle risposte, migliorando così l'accuratezza e la coerenza contestuale delle risposte generate. Nei sistemi RAG, la generazione di informazioni corrette dipende criticamente da fonti di riferimento accurate e appropriate14. Questo design permetteva al sistema di compensare informazioni che non potevano essere sufficientemente coperte da un singolo CQ, contribuendo a risposte più complete e clinicamente plausibili. Inoltre, RAG consente un recupero flessibile di contenuti CQ aggiornati ed è particolarmente adatto per applicazioni mediche basatesull'evidenza 10,11. Sebbene approcci RAG basati su linee guida siano stati descrittiin precedenza 11,18, il protocollo attuale differisce per l'uso della struttura web basata su CQ esistente di una guida orientata al paziente come principale quadro di recupero. Questo design fornisce un flusso di lavoro trasparente e riproducibile che può essere implementato senza la costruzione manuale di una base di conoscenza o il ritraining del modello.

È importante sottolineare che il chatbot ha limitato le sue risposte all'ambito della linea guida di riferimento. Quando le domande uscivano dal contenuto delle linee guida, il sistema si asteneva esplicitamente dal generare risposte, riducendo così il rischio di risposte non supportate. L'uso della similarità coseno nella selezione dei riferimenti di controllo ha ulteriormente aumentato la sicurezza e l'affidabilità delle risposte generate (Tabella 2). Sono state inoltre recuperate pagine di riferimento per domande al di fuori dell'ambito della linea guida (Tabella 3). I valori di somiglianza coseno erano più alti per le domande in-scope (0,20–0,65) rispetto a quelle fuori campo (0,20–0,31; dati non mostrati), ma punteggi di similarità bassi sono stati comunque assegnati ad alcune pagine delle linee guida anche quando il contenuto non era clinicamente rilevante. Ciò avveniva perché la somiglianza coseno veniva calcolata esclusivamente sulla base dell'abbinamento delle parole chiave tra la query e il testo della linea guida. È importante sottolineare che questi riferimenti a bassa rilevanza non hanno portato a risposte inappropriate, poiché il chatbot si è astenuto dal generare risposte quando non erano disponibili informazioni di riferimento sufficienti. Non sono state identificate allucinazioni durante la revisione manuale nelle condizioni di test definite. La soglia di somiglianza coseno di 0,2 è stata selezionata empiricamente durante i test preliminari per bilanciare sensibilità al recupero e specificità. Sebbene questa soglia fosse efficace nelle condizioni di test attuali, la valutazione sistematica della sensibilità della soglia è stata al di fuori dell'ambito di questo studio sul protocollo. Studi futuri dovrebbero indagare gli effetti di impostazioni alternative di soglia utilizzando dataset di benchmark più ampi e metriche di recupero quantitative. Il comportamento osservato suggerisce che il controllo di output basato su RAG possa essere utile nelle applicazioni di IA medica. Tuttavia, l'attuale valutazione si basava su un numero limitato di domande in-scope ed out-scope ed era intesa principalmente come una prova di concetto del flusso di lavoro proposto. Pertanto, i risultati non devono essere interpretati come una validazione completa dell'accuratezza clinica, della sicurezza o della generalizzabilità.

Questo studio presenta diverse limitazioni tecniche. Abbiamo utilizzato l'analizzatore morfologico giapponese e GPT-3.5-turbo-16k (LLM per la generazione della risposta). L'LLM è stato scelto perché era un modello ampiamente disponibile e stabile al momento dello sviluppo del sistema e permetteva un'implementazione riproducibile del flusso di lavoro proposto. Gli analizzatori morfologici e gli LLM presentano caratteristiche distinte; Pertanto, la scelta di modelli o librerie influenza sia l'accuratezza dell'estrazione delle informazioni sia il contenuto delle risposte generate22,23. Sebbene modelli più recenti (ad esempio, LLM di classe GPT-4 o GPT-5) possano migliorare le prestazioni e la validitàesterna 22, la valutazione di modelli alternativi è stata al di fuori dell'ambito del presente studio sul protocollo. I nuovi LLM possono offrire una migliore capacità di ragionamento, seguito delle istruzioni e qualità delle risposte; tuttavia, l'obiettivo principale di questo studio era valutare la fattibilità di un framework RAG basato su linee guida piuttosto che confrontare le prestazioni dei diversi LLM. Ulteriori ottimizzazioni di questi componenti potrebbero permettere una generazione di risposte più efficiente e accurata, e la validazione utilizzando diverse configurazioni di modelli è necessaria per valutare la generalizzabilità di questi risultati. Inoltre, il presente protocollo è stato sviluppato utilizzando una linea guida in lingua giapponese e un'analisi morfologica giapponese. Sebbene il framework di recupero basato su vettorizzazione TF–IDF, similitudine coseno e RAG sia in linea di principio indipendente dal linguaggio, l'implementazione in altri linguaggi richiederebbe strumenti e validazione specifici per l'elaborazione del testo specifici del linguaggio. Sebbene questo studio fosse limitato a una singola linea guida e quindi non consenta il confronto diretto tra diverse strutture di linee guida, l'organizzazione a livello CQ ha facilitato l'estrazione sistematica dei contenuti delle linee guida e ha supportato la costruzione di informazioni di riferimento per il chatbot RAG basato su linee guida. In particolare, la struttura web della linea guida — in cui ogni CQ è associato a un URL unico — ha svolto un ruolo pratico importante nel consentire uno scraping e un'organizzazione efficienti dei contenuti di riferimento a livello URL. Linee guida con formati diversi, inclusi documenti basati su PDF o siti web senza URL a livello CQ, possono richiedere strategie alternative di segmentazione e recupero. Pertanto, la generalizzazione dell'attuale flusso di lavoro ad altre strutture di linee guida e specialità mediche resta da stabilire. I lavori futuri dovrebbero valutare l'applicabilità di questo approccio su molteplici malattie, formati di linee guida e fonti di informazioni.

I risultati di questo studio forniscono indicazioni pratiche per progettare sistemi di IA con riferimento alle linee guida e dimostrano che un chatbot RAG basato su linee guida che fa riferimento a linee guida cliniche basate sul web ha potenziale come strumento per fornire informazioni mediche legate al cancro. Tuttavia, questo studio rappresenta una valutazione proof-of-concept volta a dimostrare la fattibilità tecnica dei meccanismi di recupero delle linee guida, generazione di risposta e restrizione della risposta e non deve essere interpretato come una validazione clinica formale di un sistema informativo medico. L'efficacia clinica, la sicurezza e gli esiti per gli utenti non sono stati valutati e restano da stabilire attraverso studi futuri. Da un punto di vista etico e di sicurezza dell'utente, limitare le risposte a informazioni supportate dalle linee guida può ridurre il rischio di risposte non supportate o allucinate. Tuttavia, un comportamento eccessivo di rifiuto può anche ridurre la soddisfazione dell'utente e la percepita utilità. I lavori futuri dovrebbero quindi valutare l'equilibrio tra sicurezza e usabilità, mantenendo al contempo adeguate salvaguardie contro la disinformazione. Sfruttando la struttura informativa delle linee guida basate sul web e fornendo risposte mirate alle domande degli utenti, questo sistema potrebbe servire come modello utile per future applicazioni dell'IA nella distribuzione delle informazioni mediche.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi in conflitto.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori ringraziano Kenichi Inoue, MD, PhD (Shonan Memorial Hospital Breast Center), per il suo ampio supporto tecnico nello sviluppo del chatbot di generazione potenziata basata su linee guida. Gli autori ringraziano inoltre Chikako Yamaki, PhD, e tutti i membri del team di ricerca presso l'Institute for Cancer Control, National Cancer Center Japan (Tokyo, Giappone), per aver fornito preziosi consigli sull'argomento trattato in questo articolo. Inoltre, gli autori ringraziano Editage per la modifica in lingua inglese. Questo lavoro è stato supportato da una sovvenzione di ricerca per le scienze della salute e del lavoro (R6–Cancer Control–23EA1026).

Materiali

```html

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Beautiful Soup 4 (version 4.12.3)Beautiful Soup ProjectN/ALibreria Python utilizzata per l'estrazione di URL e l'analisi HTML
ChatGPT versione 4oOpenAIN/AUsato per la generazione di parole chiave
GPT-3.5-turboOpenAIN/AUsato per la generazione di risposte
Guida JLCS per pazienti affetti da cancro del polmone e famiglieJapan Lung Cancer SocietyN/ALinea guida clinica basata sul web utilizzata come informazione di riferimento
MeCab (versione 0.996)MeCab ProjectN/AAnalizzatore morfologico giapponese
API di OpenAIOpenAIN/AUsato per la generazione di risposte basate sull'intelligenza artificiale
Python (versione 3.12)Python Software FoundationN/AAmbiente di programmazione
Requests (versione 2.32.3)Requests ProjectN/ALibreria Python utilizzata per il recupero di pagine web
scikit-learn (versione 1.6.1)Sviluppatori scikit-learnN/AUsato per la vettorizzazione TF–IDF e il calcolo della similarità del coseno.
urllib.parsePython Software FoundationN/ALibreria Python utilizzata per la normalizzazione e l'unione di URL
```

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Helft PR, Hlubocky F, Daugherty CK. American oncologists' views of internet use by cancer patients: a mail survey of American Society of Clinical Oncology members. J Clin Oncol. 2003;21(5):942-947.
  2. Chen X, Siu LL. Impact of the media and the internet on oncology: survey of cancer patients and oncologists in Canada. J Clin Oncol. 2001;19(23):4291-4297.
  3. Goto Y, et al. Differences in the quality of information on the internet about lung cancer between the United States and Japan. J Thorac Oncol. 2009;4(7):829-833.
  4. Ogasawara R, et al. Reliability of cancer treatment information on the internet: observational study. JMIR Cancer. 2018;4(2):e10031.
  5. Johnson SB, Park HS, Gross CP, Yu JB. Complementary medicine, refusal of conventional cancer therapy, and survival among patients with curable cancers. JAMA Oncol. 2018;4(10):1375-1381.
  6. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28(1):31-38.
  7. The Lancet Digital Health. ChatGPT: friend or foe? Lancet Digit Health. 2023;5(3):e102.
  8. Huang L, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions. arXiv. 2023;2311.05232.
  9. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):248.
  10. Yang R, et al. Retrieval-augmented generation for generative artificial intelligence in health care. npj Health Syst. 2025;2(2).
  11. Zakka C, et al. Almanac—retrieval-augmented language models for clinical medicine. NEJM AI. 2024;1(2):AIoa2300068.
  12. Chow JCL, Li K. Developing effective frameworks for large language model-based medical chatbots: insights from radiotherapy education with ChatGPT. JMIR Cancer. 2025;11:e66633.
  13. Chow JCL, Li K. Large language models in medical chatbots: opportunities, challenges, and the need to address AI risks. Information. 2025;16(7):549.
  14. Nishisako S, Higashi T, Wakao F. Reducing hallucinations and trade-offs in responses in generative AI chatbots for cancer information: development and evaluation study. JMIR Cancer. 2025;11:e70176.
  15. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  16. Gao Y, et al. Retrieval-augmented generation for large language models: a survey. arXiv. 2023;2312.10997.
  17. Jeong M, Sohn J, Sung M, Kang JJB. Improving medical reasoning through retrieval and self-reflection with retrieval-augmented large language models. Bioinformatics. 2024;40:i119-i129.
  18. Lewis M, et al. Grounding large language models in clinical evidence: a retrieval-augmented generation system for querying UK NICE clinical guidelines. arXiv. 2025;2510.02967.
  19. Ministry of Education, Culture, Sports, Science and Technology; Ministry of Health, Labour and Welfare; Ministry of Economy, Trade and Industry. Ethical guidelines for medical and biological research involving human subjects [Article in Japanese]. Ministry of Health, Labour and Welfare.
  20. Gallifant J, et al. The TRIPOD-LLM reporting guideline for studies using large language models. Nat Med. 2025;31:60-69.
  21. The Japanese Lung Cancer Society. JLCS Guidebook for Lung Cancer Patients and Families. Available at: https://www.haigan.gr.jp/public/guidebook/2024/. Accessed January 21, 2026.
  22. Liu M, et al. Evaluating the effectiveness of advanced large language models in medical knowledge: a comparative study using Japanese national medical examination. Int J Med Inform. 2025;193:105673.
  23. Kudo T, Yamamoto K, Matsumoto Y. Applying conditional random fields to Japanese morphological analysis. In: Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing. 2004:230-237.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

MedicinaNumero 234Numero 234Valore VuotoNumeroModelli Linguistici di Grandi DimensioniGenerazione Aumentata dal Recupero RAGErogazione di Informazioni MedicheIA Medica SicuraRecupero delle Informazioni

Articoli correlati