Artigo de método

Desenvolvimento de um chatbot de geração aumentada baseada em diretrizes de recuperação, referenciando diretrizes clínicas de prática clínica de câncer baseadas na web

DOI:

10.3791/71099

7 de agosto de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo descreve o desenvolvimento e avaliação de um chatbot de geração aumentada baseada em diretrizes de recuperação, que recupera e resume conteúdos de diretrizes clínicas de prática oncênica baseadas na web para gerar respostas baseadas em referências às dúvidas dos usuários.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A ampla disponibilidade de informações médicas na Internet melhorou o acesso ao conhecimento relacionado à saúde para os pacientes; No entanto, também aumentou a exposição a informações médicas imprecisas. O cuidado oncológico envolve informações complexas, dificultando para os pacientes identificarem fontes precisas e baseadas em evidências. Grandes modelos de linguagem possibilitam interação com linguagem natural, mas frequentemente geram alucinações, limitando sua aplicação na entrega de informações médicas. A geração aumentada por recuperação (RAG) tem o potencial de mitigar esses riscos ao fundamentar as respostas em fontes de referência externas. Este estudo descreve o desenvolvimento e avaliação de um chatbot RAG baseado em diretrizes que utiliza diretrizes de prática clínica de câncer disponíveis publicamente e baseadas na web. O sistema extrai URLs das páginas de sumário de uma diretriz, processa o texto das páginas usando análise morfológica e similaridade cosseno com base na frequência de termos–frequência inversa do documento, e constrói informações de referência a partir de páginas altamente relevantes. Um grande modelo de linguagem usa essas referências para gerar respostas restritas a conteúdo de diretrizes. O Guia do JLCS para Pacientes e Famílias com Câncer de Pulmão foi usado como referência diretriz. Os conjuntos de questões incluíam tanto tipos de câncer dentro do escopo cobertos pela diretriz quanto tipos de câncer fora do escopo para avaliar o controle da resposta. Informações médicas foram extraídas com sucesso das páginas de sumário, com 98% dos URLs extraídos contendo conteúdo médico referencial. Para perguntas dentro do escopo, o chatbot gerou respostas resumindo o conteúdo das diretrizes, e nenhuma alucinação foi identificada durante a revisão manual sob as condições de teste definidas. Para perguntas fora do escopo, o chatbot consistentemente se recusou a responder e indicou que as informações disponíveis eram insuficientes. A estrutura web da diretriz facilitou a extração eficiente e a organização do conteúdo de referência no nível da URL. Esse protocolo fornece orientações práticas para construir sistemas de inteligência artificial que fornecem informações médicas utilizando diretrizes de prática clínica baseadas na web.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O uso generalizado da internet e das redes sociais facilitou o acesso dos pacientes às informaçõesmédicas 1,2. As informações sobre o cuidado do câncer são frequentemente complexas e extensas, tornando particularmente difícil para os pacientes identificarem fontes precisas, relevantes e baseadas em evidênciascientíficas 3. Embora os recursos online possam ajudar na compreensão do paciente, eles também contêm uma quantidade substancial de informações médicasincorretas 3, o que pode afetar negativamente as decisões dos pacientes sobre seu cuidado4. Como a desinformação relacionada ao câncer pode afetar os desfechos dos pacientes5, há uma necessidade crescente de sistemas de inteligência artificial (IA) que possam ajudar usuários individuais a buscar, resumir e interpretar informaçõesmédicas 6.

Grandes modelos de linguagem (LLMs) permitem que os usuários acessem informações por meio de conversas em linguagemnatural 7; No entanto, a geração de desinformação (ou seja, alucinações) continua sendo uma preocupação séria no campomédico 8,9,10,11. Uma fonte chave de desinformação é a qualidade e precisão dos dados de treinamento usados para desenvolver o chatbot. Além disso, a natureza estática do treinamento de modelos significa que o conhecimento pode se tornar desatualizado com o tempo, limitando a capacidade dos LLMs de fornecer informações atuais e contextualmenteapropriadas 12,13. Essas limitações destacam a importância de estratégias eficazes de gestão do conhecimento para garantir que as respostas dos chatbots permaneçam precisas, relevantes e atualizadas. Em particular, sistemas que possam acessar e referenciar facilmente recursos atuais baseados em evidências, como diretrizes de prática clínica, são desejáveis em ambientes médicos, onde recomendações e padrões de cuidado evoluem continuamente. Para enfrentar esse desafio, a geração aumentada por recuperação (RAG), que gera respostas incorporando informações de fontes externas de conhecimento, tem recebido atenção crescente 10,13,14,15,16,17.

Embora o RAG tenha sido cada vez mais aplicado a chatbots médicos, pouca atenção tem sido dada a como as diretrizes de prática clínica devem ser incorporadas sistematicamente como fontes de informaçãode referência 18. Muitas diretrizes de prática clínica estão disponíveis publicamente na web; no entanto, ainda não está claro se a estrutura web existente pode servir diretamente como uma estrutura de recuperação para os sistemasRAG 18. Além disso, métodos práticos para construir informações de referência sem desenvolvimento manual de base de conhecimento ainda não foram bem estabelecidos.

Neste estudo, nosso objetivo foi estabelecer princípios de design para sistemas de IA de referência de diretrizes na área médica, desenvolvendo e avaliando um chatbot RAG baseado em diretrizes que utilize diretrizes clínicas de prática clínica de câncer disponíveis publicamente na web, permitindo assim acesso simples e oportuno a informações baseadas em diretrizes. Como prova de conceito, avaliamos a viabilidade técnica da recuperação de diretrizes, geração de resposta e restrição de resposta utilizando a estrutura web existente das diretrizes de prática clínica públicas disponíveis, com o objetivo de propor um protocolo de desenvolvimento reproduzível para sistemas RAG referenciados por diretrizes.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo não envolve sujeitos humanos que necessitam de proteção contra riscos envolvidos na pesquisa. Portanto, não exige revisão por um conselho institucional de revisão, de acordo com as diretrizes éticas japonesas para pesquisa médica envolvendo sujeitoshumanos 19. Este estudo é relatado de acordo com as diretrizes TRIPOD-LLM (Relatório Transparente de um Modelo Multivariável para Prognóstico ou Diagnóstico Individual)(TRIPOD) 20.

Consulte a Figura 1 para uma visão geral esquemática do protocolo de chatbot RAG baseado em diretrizes.

figure-protocol-1
Figura 1. Fluxo de trabalho do protocolo de Geração Aumentada de Recuperação Baseada em Diretrizes (RAG ). Visão esquemática do fluxo de trabalho de chatbot RAG baseado em diretrizes. URLs são extraídas da página de sumário de uma diretriz de prática clínica baseada na web e usadas para construir informações de referência. As consultas dos usuários são convertidas em palavras-chave, e o conteúdo da página web é processado por meio de tokenização, vetorização frequência de termos–frequência inversa do documento e análise de similaridade cosseno para identificar páginas de diretrizes relevantes. Informações de referência selecionadas são integradas e fornecidas a um grande modelo de linguagem para gerar respostas baseadas exclusivamente no conteúdo da diretriz referenciada. O painel à direita resume os itens de avaliação usados para URLs extraídas, informações de referência e respostas de chatbots. Por favor, clique aqui para ver uma versão ampliada desta figura.

1. Preparação de Informações de Referência a partir de Diretrizes Baseadas na Web

  1. Extraia todas as URLs das páginas de índice das diretrizes de prática clínica baseadas na web usando o BeautifulSoup 4 (biblioteca de análise sintática HTML) implementado na linguagem de programação Python (versão 3.12).
    NOTA: Implemente o script de extração de URL usando a linguagem de programação com os seguintes pacotes: biblioteca de análise sintática HTML (versão 4.12.3) e requisições (biblioteca de recuperação de páginas; versão 2.32.3). Instale pacotes usando pip. O código-fonte completo para extração de URL é fornecido no Arquivo Suplementar 1. Consulte a Tabela de Materiais para detalhes do software.
  2. Revise manualmente todas as URLs extraídas para confirmar o acesso bem-sucedido e a relevância para a diretriz de prática clínica alvo.
  3. Classifique cada URL como contendo informações médicas ou não médicas. Realize a classificação de URL por um autor (S.N.).
    NOTA: Informações médicas foram definidas como conteúdo referencial de diretrizes, incluindo perguntas clínicas (CQs), perguntas de contexto e conjuntos de perguntas. Informações não médicas incluíam links, páginas de sociedades ou organizações e outros conteúdos auxiliares que não eram adequados para referência.
  4. Compile as URLs validadas em um livro de exercícios do Microsoft Excel (formato .xlsx), com uma URL registrada por linha. Armazene a lista de URLs resultante como o conjunto de dados de entrada para recuperação de texto subsequente, pré-processamento e análises de similaridade.

2. Geração de palavras-chave a partir de consultas de usuários

  1. Insira a consulta em linguagem natural no ChatGPT (Generative Pre-trained Transformer, versão 4o; modelo de geração de palavras-chave).
  2. Peça ao modelo para extrair duas palavras-chave correspondentes à consulta do usuário.
  3. Use o seguinte prompt, escrito em japonês, para geração de palavras-chave:
    "figure-protocol-2"
    (Tradução em inglês: "Extraia duas palavras-chave do texto a seguir.")
  4. Anexe a consulta de linguagem natural do usuário a essa instrução e submeta ao modelo de geração de palavras-chave para geração de palavras-chave.
  5. Não modifique manualmente nenhum parâmetro do modelo. Realize a geração de palavras-chave usando as configurações padrão do modelo de geração de palavras-chave.
  6. Gerar duas palavras-chave para cada consulta de usuário. Mantenha ambas as palavras-chave sem modificações, filtros ou seleção manual adicionais, e utilize-as para cálculos subsequentes de similaridade.
  7. Armazene as palavras-chave geradas em um livro de exercícios do Microsoft Excel (formato .xlsx). Para cada registro, armazene a consulta original do usuário e suas respectivas palavras-chave geradas para recuperação subsequente baseada em similaridade.

3. Processamento de Texto e Cálculo de Similaridade

  1. Recupere o texto completo de cada URL extraída usando a biblioteca de recuperação da página web e a biblioteca de análise sintática HTML. Extraia o conteúdo de texto da fonte HTML usando a função BeautifulSoup get_text().
  2. Pré-processe o texto extraído da página web e as palavras-chave geradas removendo tags HTML e caracteres não japoneses.
  3. Realizar análise morfológica japonesa usando MeCab (versão 0.996; Analisador morfológico japonês) com o dicionário padrão. Mantenha apenas substantivos e concatene-os em uma cadeia de texto delimitada por espaço.
  4. Combine as palavras-chave geradas em uma única string de texto e aplique os mesmos procedimentos de pré-processamento e tokenização usados para o texto da página web.
  5. Gerar vetores frequência–frequência inversa de documento (TF–IDF) a partir do texto processado da página web e do texto das palavras-chave usando a implementação TfidfVectorizer na biblioteca scikit-learn (versão 1.6.1) com configurações padrão de parâmetros.
    NOTA: Todos os parâmetros do TfidfVectorizer foram mantidos em seus valores padrão, e nenhuma configuração personalizada de parâmetros foi aplicada.
  6. Calcule a semelhança cosseno entre cada vetor de página web e o vetor de palavra-chave usando a função de similaridade cosseno.
  7. Classifice URLs em ordem decrescente de acordo com as pontuações de similaridade cosseno. Não aplique critérios adicionais de desempate.
  8. Selecione páginas com pontuação de similaridade cosseno de ≥0,2 como informações de referência candidata.
    NOTA: O limiar de similaridade cosseno (0,2) foi selecionado empiricamente durante o desenvolvimento do sistema para priorizar a recuperação e evitar excluir conteúdos de diretrizes potencialmente relevantes.
  9. Mantenha todas as páginas de candidatos que atendam ao limite de similaridade.

4. Construção das Informações de Referência

  1. Extraia sequencialmente o conteúdo do texto das páginas selecionadas do topo da lista ranqueada.
  2. Concatene os textos extraídos para formar um único documento de referência.
  3. Antes de submeter ao LLM, substitua os caracteres de nova linha e os caracteres consecutivos de espaço em branco no texto de referência por um único espaço.
  4. Trunque o texto de referência concatenado para os primeiros 4.096 caracteres antes de fornecê-lo ao LLM.
    NOTA: O limite de truncamento era baseado em caracteres, e não em fichas. Um limite de 4.096 caracteres foi selecionado empiricamente para garantir que a informação combinada de prompt e referência permanecesse dentro da capacidade de entrada do modelo de geração de resposta GPT-3.5-turbo-16k.

5. Geração de Respostas Baseada em IA

  1. Forneça as informações de referência construídas e a consulta original do usuário ao modelo de geração de resposta via interface de programação de aplicações (API).
  2. Instrua a IA usando o seguinte prompt (escrito inteiramente em japonês) para garantir que as respostas sejam geradas exclusivamente com base nas informações de referência fornecidas:
    "Você é um assistente de informação médica que orienta pacientes com câncer. Gere respostas baseadas apenas nas seguintes informações de referência e não use seu próprio conhecimento geral ou raciocínio. As respostas devem ser detalhadas e fáceis de entender, com aproximadamente 500 caracteres de extensão. Se a informação de referência não contiver informações suficientes para responder à pergunta, responda: 'Não há informação suficiente no texto', sem usar qualquer especulação ou conhecimento geral."
  3. Forneça as informações de referência e a consulta do usuário em uma única mensagem de usuário. Estruture a entrada como: "Informação de Referência: [texto de referência]" seguido de "Pergunta: [consulta do usuário]".
  4. Gerar respostas usando o modelo de geração de respostas com as seguintes configurações: temperatura = 0,1, comprimento máximo de saída = 1.024 tokens, n = 1 e stop = Nenhum.
  5. Obtenha a resposta gerada por IA para avaliação posterior.
    NOTA: Envie as informações de referência e a consulta do usuário como uma única mensagem de usuário. Forneça as instruções de geração de resposta separadamente como uma mensagem do sistema.

6. Diretrizes de Referência e Formulação de Perguntas

  1. Selecione o Guia JLCS para Pacientes e Famílias com Câncer de Pulmão (Lung Guidebook)21, que está disponível gratuitamente online, como informação de referência para o sistema de chatbot RAG baseado em diretrizes.
  2. Crie duas categorias de perguntas de avaliação baseadas no tipo de câncer: tumores tímicos, que estão dentro do escopo da diretriz, e glioma pediátrico, que está fora do escopo das informações referenciadas.
  3. Formule quatro perguntas sobre diagnóstico e tratamento para cada tipo de câncer:
    "Quais métodos diagnósticos estão disponíveis para tumores XX (por exemplo, glioma tímico ou pediátrico)?"
    "Quais são as abordagens diagnósticas patológicas para tumores XX?"
    "Quais opções de tratamento estão disponíveis para tumores XX?"
    "Quais são as opções de tratamento cirúrgico para tumores XX?"
  4. Envie perguntas relacionadas aos tipos de câncer cobertos pela diretriz web referenciada para o chatbot. Por exemplo, envie uma pergunta sobre diagnóstico de tumor tímico usando o Guia do Pulmão como informação de referência.
  5. Envie perguntas fora do escopo da diretriz de referência ao chatbot para avaliar sua capacidade de se abster de usar informações externas ou não relacionadas. Por exemplo, envie uma pergunta sobre glioma pediátrico usando o Guia do Pulmão como informação de referência.
  6. Avalie cada pergunta em uma sessão de chat independente. Não carregue o histórico de conversa entre as perguntas.
  7. Registre as respostas geradas pela IA para avaliação subsequente.

7. Avaliação de Resposta

  1. Realize uma revisão manual de todas as respostas geradas.
  2. Avalie se cada resposta contém alucinações.
  3. Avalie se cada resposta é apoiada por informações contidas na diretriz de referência.
    NOTA: Alucinações foram definidas como respostas contendo eventos, nomes ou termos inexistentes que poderiam potencialmente causar danos médicos14. Todas as respostas geradas foram revisadas quanto à precisão e ausência de alucinações por um autor com 8 anos de experiência em um hospital universitário, incluindo suporte ao paciente e comunicação médica para pacientes com câncer. Qualquer incerteza sobre a classificação da resposta foi resolvida por meio de uma discussão com um médico coautor com mais de 20 anos de experiência em serviços de informação sobre câncer no Centro Nacional de Câncer do Japão.
  4. Considere uma resposta como sendo apoiada apenas quando todas as afirmações clinicamente relevantes podem ser confirmadas diretamente a partir da diretriz de referência recuperada, sem exigir conhecimento adicional ou inferência não fundamentada.
  5. Classifique cada resposta usando rótulos de resultado pré-definidos. Classifique respostas contendo apenas informações apoiadas pela diretriz de referência como "alucinação ausente". Classifique respostas contendo informações não fundamentadas ou fabricadas como "alucinações presentes".

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Recuperação de Conteúdo Médico por Páginas de Índice

A arquitetura de raspagem web coletava URLs da página de índice da diretriz. Do Lung Guidebook, 106 URLs foram extraídas da página de sumário, das quais 104 (98%) continham informações médicas (Tabela Suplementar 1). A eficácia das respostas do chatbot com base nas páginas de conteúdo das diretrizes é resumida na Tabela 1. O chatbot gerou respostas para todas as quatro palavras-chave clínicas quando as perguntas se enquadravam no escopo da diretriz. Para "diagnóstico de tumor tímico" e "diagnóstico patológico", três URLs relacionadas foram extraídas para cada palavra-chave, e todas as URLs extraídas foram consideradas eficazes (100%). Para "métodos de tratamento" e "tratamento cirúrgico", 15 URLs foram extraídos para cada palavra-chave, com 14 itens eficazes (93%).

ConsultaPalavras-chaveItens de Conteúdo Referenciado, nItens de Referência Eficazes,
n (%)
Quais métodos diagnósticos estão disponíveis para tumores tímicos?Diagnóstico de tumor tímico33 (100)
Quais são as abordagens diagnósticas patológicas para tumores tímicos?Diagnóstico patológico do tumor tímico33 (100)
Quais opções de tratamento existem para tumores tímicos?Métodos de tratamento do tumor tímico1514 (93)
Quais são as opções de tratamento cirúrgico para tumores tímicos?Tratamento cirúrgico do tumor tímico1514 (93)

Tabela 1: Conteúdo das Informações de Referência e Respostas de Chatbots Baseadas no Guia do JLCS para Pacientes e Famílias com Câncer de Pulmão. Resumo das consultas dos usuários, palavras-chave geradas, número de itens de conteúdo referenciados identificados por meio de recuperação baseada em similaridade e número de itens de referência eficazes contendo informações médicas. Itens de conteúdo referenciados representam o número total de páginas web relacionadas identificadas no nível da URL com base em cada palavra-chave. Itens de referência eficazes representam o número e a porcentagem de páginas únicas contendo informações médicas após exclusão de URLs duplicadas e páginas não médicas.

Respostas de Chatbots a Perguntas Dentro do Escopo

A Tabela 2 mostra as respostas do chatbot a perguntas que se enquadraram no escopo da diretriz fornecida. Quando havia informações de referência suficientes disponíveis, o chatbot gerava respostas resumindo partes relevantes do texto da diretriz. As respostas geradas consistiam em aproximadamente 350 caracteres japoneses. Nenhuma alucinação foi identificada durante a revisão manual sob as condições definidas do teste. Para essas perguntas dentro do escopo, múltiplos itens referenciados eficazes suportaram a geração de respostas (Tabela 1). O texto japonês gerado foi traduzido para o inglês usando a versão 5.2 do ChatGPT e posteriormente revisado pelos investigadores quanto à precisão e consistência com as respostas originais em japonês.

ConsultaRespostasNúmero de Caracteres
Quais métodos diagnósticos estão disponíveis para tumores tímicos?O diagnóstico de tumores tímicos requer tanto diagnóstico por imagem quanto diagnóstico patológico. Para diagnóstico por imagem, são realizadas tomografias computadorizadas torácicas e ressonâncias magnéticas torácicas. O timoma e o carcinoma tímico são tumores sólidos que não contêm componentes de ar ou fluido dentro do tumor, e a invasão nos tecidos normais ao redor é conhecida por ser leve no timoma e mais pronunciada no carcinoma tímico. Quando os estudos de imagem determinam que não há invasão nos tecidos circundantes ou que não há tumores distantes da lesão primária (metástases), o tumor é ressecado cirurgicamente e o diagnóstico patológico é realizado usando a amostra cirúrgica. Quando a resseção cirúrgica é difícil, é realizada uma biópsia guiada por tomografia computadorizada e o diagnóstico é feito por meio da obtenção de uma parte do tecido tumoral. No diagnóstico patológico, os timomas são classificados com base na proporção de linfócitos normais dentro do tumor e na morfologia das células tumorais, enquanto os carcinomas tímicos são classificados detalhadamente de acordo com o subtipo histológico. Para a determinação do estágio clínico (estágio), a extensão da disseminação das lesões tumorais tímicas é considerada, e os tumores são classificados em estágios I a IV com base em três sistemas de classificação de estadiamento.366
Quais são as abordagens diagnósticas patológicas para tumores tímicos?No diagnóstico patológico de tumores tímicos, o exame patológico é realizado obtendo parte ou a totalidade do tecido tumoral. Os timomas são classificados em subtipos, como tipo A e tipo AB, com base na proporção de linfócitos normais contidos no tumor e na morfologia das células tumorais. Em contraste, o carcinoma tímico é um tumor maligno caracterizado por atipia celular, e o carcinoma de células escamosas é o subtipo histológico mais comum. Por meio do diagnóstico patológico, as características biológicas e o grau de progressão tumoral são avaliados, o que é útil para selecionar estratégias de tratamento adequadas e prever o prognóstico. Além disso, o diagnóstico patológico de tumores tímicos permite determinar o estágio da doença, fornecendo informações importantes para o planejamento do tratamento. A estadiação clínica é classificada usando três sistemas — a classificação Masaoka, a classificação Masaoka–Koga e a classificação UICC–TNM — e os tumores são categorizados em quatro estágios, do estágio I ao estágio IV, de acordo com a extensão da disseminação e invasão tumoral. O diagnóstico patológico fornece informações indispensáveis para o tratamento adequado e avaliação prognóstica dos tumores tímicos.330
Quais opções de tratamento existem para tumores tímicos?As opções de tratamento para tumores tímicos incluem tratamento cirúrgico (cirurgia), radioterapia e terapia medicamentosa (quimioterapia). A cirurgia é realizada como um procedimento no qual o timo é completamente ressecado junto com o tumor e, em casos de timoma, pode não ser necessário tratamento adicional. No carcinoma tímico, a radioterapia pós-operatória pode ser adicionada quando o câncer já se espalhou para os tecidos ao redor. Quimioterapia ou quimiorradioterapia é realizada em casos em que a cirurgia é difícil ou ocorre recidiva ou metástase distante, e essas são usadas como parte da terapia medicamentosa. Além disso, para carcinoma tímico avançado ou recorrente, é realizado tratamento centrado na quimioterapia, e também pode ser administrada terapia multimodal que combina cirurgia e radioterapia, conforme necessário. Além disso, para carcinoma tímico avançado ou recorrente após quimioterapia, lenvatinibe, um agente terapêutico molecularmente direcionado, pode ser utilizado. A combinação apropriada de modalidades de tratamento é selecionada de acordo com a condição da doença e o status clínico do paciente.342
Quais são as opções de tratamento cirúrgico para tumores tímicos?O tratamento cirúrgico para tumores tímicos é realizado quando o tumor é considerado completamente ressecável. Na cirurgia, geralmente é prática padrão remover todo o timo junto com o tumor. Nos casos de timoma, se o tumor for completamente ressecado, não é necessário tratamento adicional. Em contraste, nos casos de carcinoma tímico, quando há invasão de câncer nos tecidos ao redor, pode-se adicionar radioterapia pós-operatória adjuvante. Quando a cirurgia é considerada difícil, a quimioterapia ou quimiorradioterapia é realizada primeiro, e a cirurgia é considerada posteriormente se tornar viável. Se a cirurgia não puder ser realizada, a quimioterapia ou quimiorradioterapia pode ser continuada. Além disso, mesmo quando a cirurgia for possível, se a resseção completa não puder ser realizada, radioterapia pós-operatória ou quimiorradioterapia podem ser aplicadas para tratar o tumor residual. O tratamento cirúrgico é selecionado adequadamente de acordo com o tipo de tumor e o grau de progressão da doença.342

Tabela 2: Respostas Geradas pelo chatbot Geração Aumentada por Recuperação Baseada em Diretrizes (RAG) baseado no Guia do JLCS para Pacientes e Famílias com Câncer de Pulmão. Respostas representativas geradas pelo chatbot RAG baseado em diretrizes para perguntas relacionadas a tumores tímicos usando informações de referência extraídas do Guia JLCS para Pacientes e Famílias com Câncer de Pulmão (https://www.haigan.gr.jp/public/guidebook/2024/). A tabela inclui a consulta do usuário, a resposta gerada pelo chatbot e o comprimento da resposta. A contagem de caracteres foi medida nas respostas originais em japonês antes da tradução para o inglês usando o ChatGPT versão 5.2.

Respostas de Chatbots a Perguntas Fora do Escopo

As respostas dos chatbots a perguntas que estavam fora do escopo do Guia do Pulmão são resumidas na Tabela 3. Embora um número limitado de itens de conteúdo tenha sido referenciado para essas perguntas, o modelo de geração de respostas determinou que as informações de referência disponíveis eram insuficientes para gerar uma resposta baseada em evidências. Consequentemente, o chatbot respondeu indicando informações insuficientes para consultas fora do escopo. As afirmações "Há informação insuficiente no texto" e "Não há referências." eram respostas pré-definidas especificadas no prompt do sistema. A primeira era retornada quando as informações de referência recuperadas eram insuficientes para responder à pergunta, enquanto a segunda era retornada quando nenhuma informação de referência era recuperada.

ConsultaPalavras-chaveItens de Conteúdo Referenciado, nResposta do Chatbot
Quais métodos diagnósticos estão disponíveis para glioma pediátrico?Diagnóstico de glioma pediátrico0Não há referências.
Quais são as abordagens diagnósticas patológicas para glioma pediátrico?Diagnóstico patológico do glioma pediátrico13Há informações insuficientes no texto.
Quais opções de tratamento estão disponíveis para o glioma pediátrico?Métodos de tratamento do glioma pediátrico13Há informações insuficientes no texto.
Quais são as opções de tratamento cirúrgico para o glioma pediátrico?Tratamento cirúrgico do glioma pediátrico12Há informações insuficientes no texto.

Tabela 3: Respostas de chatbots a perguntas fora do escopo no nível de pergunta clínica, baseadas no guia do JLCS para pacientes e famílias com câncer de pulmão. Respostas geradas pelo chatbot baseado em diretrizes de geração aumentada por recuperação (RAG) para perguntas fora do escopo da diretriz de referência. A tabela resume as consultas dos usuários, as palavras-chave geradas, o número de itens de conteúdo referenciados identificados por meio de recuperação baseada em similaridade e as respostas resultantes dos chatbots. Itens de conteúdo referenciados representam o número total de páginas web relacionadas identificadas no nível da URL com base em cada palavra-chave. Itens de referência eficazes não foram calculados para questões fora do escopo porque o conteúdo recuperado não continha informações relevantes para a doença consultada.

Arquivo Suplementar 1. Código Python para extração de URL e texto a partir de diretrizes de prática clínica baseadas na web. O código usado para extrair URLs e textos das páginas de índices das diretrizes clínicas baseadas na web. As URLs extraídas e o conteúdo textual foram usados para processamento subsequente de texto, análise de similaridade e construção de informações de referência no fluxo de trabalho de chatbot baseado em diretrizes por geração aumentada de recuperação (RAG). Por favor, clique aqui para baixar este arquivo.

Tabela Suplementar 1. Lista de URLs extraídas da página de índice de diretrizes baseadas na web e sua classificação como informações médicas ou não médicas. URLs extraídas da página de sumário do Guia do JLCS para Pacientes e Famílias com Câncer de Pulmão foram revisadas manualmente e classificadas como informações médicas ou não médicas. Informações médicas foram definidas como conteúdo de diretrizes referenciais, incluindo perguntas clínicas (CQs), perguntas de contexto, conjuntos de perguntas e materiais educacionais suplementares relevantes para orientações do paciente. Informações não médicas incluíam páginas da sociedade ou organizações, páginas de navegação, hiperlinks e outros conteúdos auxiliares não usados como referência para geração de respostas de chatbots. A tabela resume todas as URLs extraídas e seus resultados de classificação. *URLs foram extraídas da página de índice (https://www.haigan.gr.jp/public/guidebook/2024/) do Guia JLCS para Pacientes e Famílias com Câncer de Pulmão. Por favor, clique aqui para baixar este arquivo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Neste estudo, examinamos a utilidade de um chatbot RAG baseado em diretrizes que utilizava uma diretriz de prática clínica baseada na web — o Guia JLCS para Pacientes e Famílias com Câncer de Pulmão — como fonte de informação de referência. O chatbot gerava respostas baseadas no conteúdo da diretriz, explorando a estrutura web da diretriz e recuperando páginas com base em sua semelhança com as consultas dos usuários. Essa abordagem demonstrou que a recuperação baseada em similaridade, combinada com geração de respostas referenciadas por diretrizes, pode apoiar a entrega confiável e eficiente de informações médicas. Estudos recentes destacaram tanto o potencial quanto as limitações dos chatbots médicos baseados em LLM, especialmente em relação a alucinações e confiabilidade de resposta12, 13, 14. Diferentemente de estudos anteriores que focaram nos frameworks gerais de chatbot10, 12, 13, o atual protocolo demonstra uma abordagem reprodutível baseada em diretrizes RAG que recupera conteúdo de orientações do paciente no nível da URL e gera respostas fundamentadas em informações de referência identificáveis. Portanto, este estudo fornece um protocolo transparente para a entrega de informações sobre o câncer, em vez de um sistema clínico de chatbot totalmente validado.

Em vez de treinar a IA em todo o corpus de diretrizes, nosso sistema selecionou apenas as CQs mais relevantes para cada consulta de usuário como informação de referência (Figura 1). A relevância entre o texto da pergunta e cada CQ foi avaliada quantitativamente usando cálculos de similaridade cosseno baseados em linguagem de programação com representações vetoriais TF–IDF. Com base nessas pontuações de similaridade, as CQs foram classificadas e selecionadas em ordem decrescente de relevância, permitindo a extração sistemática de fontes de informação apropriadas dentro da diretriz sem depender de julgamento subjetivo (Tabela 1). Além disso, concatenar os textos CQ recuperados e apresentá-los coletivamente à IA ajudou a preservar uma base evidenciária consistente para a geração de respostas, melhorando assim a precisão e a coerência contextual das respostas geradas. Nos sistemas RAG, a geração de informações corretas depende criticamente de fontes de referência precisas eapropriadas 14. Esse design permitiu que o sistema compensasse informações que não poderiam ser suficientemente cobertas por um único CQ, contribuindo para respostas mais abrangentes e clinicamente plausíveis. Além disso, o RAG permite a recuperação flexível de conteúdo CQ atualizado e é bem adequado para aplicações médicas baseadas emevidências 10,11. Embora abordagens RAG baseadas em diretrizes já tenham sidodescritas anteriormente 11,18, o protocolo atual difere pelo uso da estrutura web baseada em CQ existente de uma orientação orientada ao paciente como principal estrutura de recuperação. Esse design oferece um fluxo de trabalho transparente e reproduzível que pode ser implementado sem necessidade de construção manual de base de conhecimento ou retreinamento de modelos.

Importante, o chatbot restringiu suas respostas ao escopo da diretriz referenciada. Quando as perguntas ficavam fora do conteúdo das diretrizes, o sistema explicitamente evitava gerar respostas, reduzindo assim o risco de respostas sem suporte. O uso da similaridade cosseno na seleção de referência de controle aumentou ainda mais a segurança e confiabilidade das respostas geradas (Tabela 2). Páginas de referência também foram acessadas para perguntas fora do escopo da diretriz (Tabela 3). Os valores de similaridade cosseno foram maiores para questões dentro do escopo (0,20–0,65) do que para questões fora do escopo (0,20–0,31; dados não mostrados), mas pontuações baixas de similaridade ainda foram atribuídas a algumas páginas de diretrizes mesmo quando o conteúdo não era clinicamente relevante. Isso ocorreu porque a similaridade cosseno foi calculada unicamente com base na correspondência de palavras-chave entre a consulta e o texto da diretriz. Importante destacar que essas referências de baixa relevância não resultaram em respostas inadequadas, pois o chatbot evitou gerar respostas quando informações de referência suficientes não estavam disponíveis. Nenhuma alucinação foi identificada durante a revisão manual sob as condições definidas do teste. O limiar de similaridade cosseno de 0,2 foi selecionado empiricamente durante testes preliminares para equilibrar sensibilidade e especificidade na recuperação. Embora esse limiar tenha sido eficaz sob as condições atuais do teste, a avaliação sistemática da sensibilidade ao limiar estava além do escopo deste estudo do protocolo. Estudos futuros devem investigar os efeitos de definições alternativas de limiar usando conjuntos de dados de referência maiores e métricas quantitativas de recuperação. O comportamento observado sugere que o controle de saída baseado em RAG pode ser útil em aplicações de IA médica. No entanto, a avaliação atual baseou-se em um número limitado de perguntas dentro e fora do escopo e foi destinada principalmente a uma avaliação de prova de conceito do fluxo de trabalho proposto. Portanto, os achados não devem ser interpretados como uma validação abrangente da precisão clínica, segurança ou generalizabilidade.

Este estudo apresenta várias limitações técnicas. Utilizamos o analisador morfológico japonês e o GPT-3.5-turbo-16k (LLM para geração de resposta). O LLM foi selecionado porque era um modelo amplamente disponível e estável na época do desenvolvimento do sistema e permitia a implementação reprodutível do fluxo de trabalho proposto. Analisadores morfológicos e LLMs possuem características distintas; Assim, a escolha de modelos ou bibliotecas influencia tanto a precisão da extração de informações quanto o conteúdo das respostasgeradas 22,23. Embora modelos mais recentes (por exemplo, LLMs da classe GPT-4 ou GPT-5) possam melhorar o desempenho e a validade externa22, a avaliação de modelos alternativos estava além do escopo do presente estudo de protocolo. LLMs mais novos podem oferecer melhor capacidade de raciocínio, acompanhamento de instruções e qualidade de resposta; no entanto, o objetivo principal deste estudo foi avaliar a viabilidade de uma estrutura RAG baseada em diretrizes, em vez de comparar o desempenho de diferentes LLMs. Uma otimização adicional desses componentes pode permitir uma geração de respostas mais eficiente e precisa, e a validação usando diferentes configurações de modelos é necessária para avaliar a generalizabilidade desses achados. Além disso, o protocolo atual foi desenvolvido usando uma diretriz em japonês e análise morfológica japonesa. Embora o framework de recuperação baseado em vetorização TF–IDF, similaridade cosseno e RAG seja independente da linguagem em princípio, a implementação em outras linguagens exigiria ferramentas e validação específicas de processamento de texto para cada linguagem. Embora este estudo tenha sido limitado a uma única diretriz e, portanto, não permita a comparação direta de diferentes estruturas de diretrizes, a organização em nível CQ facilitou a extração sistemática do conteúdo das diretrizes e apoiou a construção de informações de referência para o chatbot RAG baseado em diretrizes. Em particular, a estrutura web da diretriz — na qual cada CQ está associado a uma URL única — desempenhou um papel prático importante ao possibilitar uma extração eficiente e organização do conteúdo de referência no nível da URL. Diretrizes com diferentes formatos, incluindo documentos baseados em PDF ou sites sem URLs em nível de CQ, podem exigir estratégias alternativas de segmentação e recuperação. Portanto, a generalização do fluxo de trabalho atual para outras estruturas de diretrizes e especialidades médicas ainda precisa ser estabelecida. Trabalhos futuros devem avaliar a aplicabilidade dessa abordagem em múltiplas doenças, formatos de diretrizes e fontes de informação.

As conclusões deste estudo fornecem orientações práticas para o design de sistemas de IA com referência de diretrizes e demonstram que um chatbot RAG baseado em diretrizes que referencia diretrizes clínicas baseadas na web tem potencial como ferramenta para fornecer informações médicas relacionadas ao câncer. No entanto, este estudo representa uma avaliação de prova de conceito destinada a demonstrar a viabilidade técnica de mecanismos de recuperação de diretrizes, geração de resposta e restrição de resposta, e não deve ser interpretado como validação clínica formal de um sistema de informação médica. A eficácia clínica, a segurança e os resultados dos usuários não foram avaliados e ainda precisam ser estabelecidos em estudos futuros. Do ponto de vista ético e de segurança do usuário, restringir respostas a informações apoiadas por diretrizes pode reduzir o risco de respostas sem fundamento ou alucinadas. No entanto, comportamentos excessivos de recusa também podem reduzir a satisfação do usuário e a percepção de utilidade. Trabalhos futuros devem, portanto, avaliar o equilíbrio entre segurança e usabilidade, mantendo as salvaguardas adequadas contra desinformação. Ao aproveitar a estrutura de informação das diretrizes baseadas na web e fornecer respostas focadas às perguntas dos usuários, esse sistema pode servir como um modelo útil para futuras aplicações da IA na entrega de informações médicas.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram não haver interesses concorrentes.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem a Kenichi Inoue, MD, PhD (Shonan Memorial Hospital Breast Center), por seu extenso suporte técnico no desenvolvimento do chatbot de geração aumentada baseada em orientações. Os autores também agradecem a Chikako Yamaki, PhD, e a todos os membros da equipe de pesquisa do Instituto de Controle do Câncer, Centro Nacional de Câncer do Japão (Tóquio, Japão), por fornecer conselhos valiosos sobre o tema abordado neste artigo. Além disso, os autores agradecem à Editage pela edição em inglês. Esse trabalho foi apoiado por uma Bolsa de Pesquisa em Ciências da Saúde e do Trabalho (R6–Controle do Câncer–23EA1026).

Materiais

```html

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Beautiful Soup 4 (versão 4.12.3)Beautiful Soup ProjectN/ABiblioteca Python usada para extração de URL e análise de HTML
ChatGPT versão 4oOpenAIN/AUsado para geração de palavras-chave
GPT-3.5-turboOpenAIN/AUsado para geração de resposta
Guia JLCS para Pacientes e Familiares com Câncer de PulmãoSociedade Japonesa de Câncer de PulmãoN/ADiretriz de prática clínica baseada na web usada como informação de referência
MeCab (versão 0.996)Projeto MeCabN/AAnalisador morfológico japonês
OpenAI APIOpenAIN/AUsado para geração de resposta baseada em IA
Python (versão 3.12)Fundação de Software PythonN/AAmbiente de programação
Requests (versão 2.32.3)Projeto RequestsN/ABiblioteca Python usada para recuperação de páginas da web
scikit-learn (versão 1.6.1)Desenvolvedores scikit-learnN/AUsado para vetorização TF–IDF e cálculo de similaridade cosine.
urllib.parseFundação de Software PythonN/ABiblioteca Python usada para normalização e junção de URL
```

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Helft PR, Hlubocky F, Daugherty CK. American oncologists' views of internet use by cancer patients: a mail survey of American Society of Clinical Oncology members. J Clin Oncol. 2003;21(5):942-947.
  2. Chen X, Siu LL. Impact of the media and the internet on oncology: survey of cancer patients and oncologists in Canada. J Clin Oncol. 2001;19(23):4291-4297.
  3. Goto Y, et al. Differences in the quality of information on the internet about lung cancer between the United States and Japan. J Thorac Oncol. 2009;4(7):829-833.
  4. Ogasawara R, et al. Reliability of cancer treatment information on the internet: observational study. JMIR Cancer. 2018;4(2):e10031.
  5. Johnson SB, Park HS, Gross CP, Yu JB. Complementary medicine, refusal of conventional cancer therapy, and survival among patients with curable cancers. JAMA Oncol. 2018;4(10):1375-1381.
  6. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28(1):31-38.
  7. The Lancet Digital Health. ChatGPT: friend or foe? Lancet Digit Health. 2023;5(3):e102.
  8. Huang L, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions. arXiv. 2023;2311.05232.
  9. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):248.
  10. Yang R, et al. Retrieval-augmented generation for generative artificial intelligence in health care. npj Health Syst. 2025;2(2).
  11. Zakka C, et al. Almanac—retrieval-augmented language models for clinical medicine. NEJM AI. 2024;1(2):AIoa2300068.
  12. Chow JCL, Li K. Developing effective frameworks for large language model-based medical chatbots: insights from radiotherapy education with ChatGPT. JMIR Cancer. 2025;11:e66633.
  13. Chow JCL, Li K. Large language models in medical chatbots: opportunities, challenges, and the need to address AI risks. Information. 2025;16(7):549.
  14. Nishisako S, Higashi T, Wakao F. Reducing hallucinations and trade-offs in responses in generative AI chatbots for cancer information: development and evaluation study. JMIR Cancer. 2025;11:e70176.
  15. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  16. Gao Y, et al. Retrieval-augmented generation for large language models: a survey. arXiv. 2023;2312.10997.
  17. Jeong M, Sohn J, Sung M, Kang JJB. Improving medical reasoning through retrieval and self-reflection with retrieval-augmented large language models. Bioinformatics. 2024;40:i119-i129.
  18. Lewis M, et al. Grounding large language models in clinical evidence: a retrieval-augmented generation system for querying UK NICE clinical guidelines. arXiv. 2025;2510.02967.
  19. Ministry of Education, Culture, Sports, Science and Technology; Ministry of Health, Labour and Welfare; Ministry of Economy, Trade and Industry. Ethical guidelines for medical and biological research involving human subjects [Article in Japanese]. Ministry of Health, Labour and Welfare.
  20. Gallifant J, et al. The TRIPOD-LLM reporting guideline for studies using large language models. Nat Med. 2025;31:60-69.
  21. The Japanese Lung Cancer Society. JLCS Guidebook for Lung Cancer Patients and Families. Available at: https://www.haigan.gr.jp/public/guidebook/2024/. Accessed January 21, 2026.
  22. Liu M, et al. Evaluating the effectiveness of advanced large language models in medical knowledge: a comparative study using Japanese national medical examination. Int J Med Inform. 2025;193:105673.
  23. Kudo T, Yamamoto K, Matsumoto Y. Applying conditional random fields to Japanese morphological analysis. In: Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing. 2004:230-237.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

MedicinaEdi o 234Edi o 234Valor VazioEdi oGrandes Modelos de LinguagemGera o Aumentada de Recupera o RAGEntrega de Informa es M dicasIA M dica SeguraRecupera o de Informa es

Artigos relacionados