$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Neste estudo, examinamos a utilidade de um chatbot RAG baseado em diretrizes que utilizava uma diretriz de prática clínica baseada na web — o Guia JLCS para Pacientes e Famílias com Câncer de Pulmão — como fonte de informação de referência. O chatbot gerava respostas baseadas no conteúdo da diretriz, explorando a estrutura web da diretriz e recuperando páginas com base em sua semelhança com as consultas dos usuários. Essa abordagem demonstrou que a recuperação baseada em similaridade, combinada com geração de respostas referenciadas por diretrizes, pode apoiar a entrega confiável e eficiente de informações médicas. Estudos recentes destacaram tanto o potencial quanto as limitações dos chatbots médicos baseados em LLM, especialmente em relação a alucinações e confiabilidade de resposta12, 13, 14. Diferentemente de estudos anteriores que focaram nos frameworks gerais de chatbot10, 12, 13, o atual protocolo demonstra uma abordagem reprodutível baseada em diretrizes RAG que recupera conteúdo de orientações do paciente no nível da URL e gera respostas fundamentadas em informações de referência identificáveis. Portanto, este estudo fornece um protocolo transparente para a entrega de informações sobre o câncer, em vez de um sistema clínico de chatbot totalmente validado.
Em vez de treinar a IA em todo o corpus de diretrizes, nosso sistema selecionou apenas as CQs mais relevantes para cada consulta de usuário como informação de referência (Figura 1). A relevância entre o texto da pergunta e cada CQ foi avaliada quantitativamente usando cálculos de similaridade cosseno baseados em linguagem de programação com representações vetoriais TF–IDF. Com base nessas pontuações de similaridade, as CQs foram classificadas e selecionadas em ordem decrescente de relevância, permitindo a extração sistemática de fontes de informação apropriadas dentro da diretriz sem depender de julgamento subjetivo (Tabela 1). Além disso, concatenar os textos CQ recuperados e apresentá-los coletivamente à IA ajudou a preservar uma base evidenciária consistente para a geração de respostas, melhorando assim a precisão e a coerência contextual das respostas geradas. Nos sistemas RAG, a geração de informações corretas depende criticamente de fontes de referência precisas eapropriadas 14. Esse design permitiu que o sistema compensasse informações que não poderiam ser suficientemente cobertas por um único CQ, contribuindo para respostas mais abrangentes e clinicamente plausíveis. Além disso, o RAG permite a recuperação flexível de conteúdo CQ atualizado e é bem adequado para aplicações médicas baseadas emevidências 10,11. Embora abordagens RAG baseadas em diretrizes já tenham sidodescritas anteriormente 11,18, o protocolo atual difere pelo uso da estrutura web baseada em CQ existente de uma orientação orientada ao paciente como principal estrutura de recuperação. Esse design oferece um fluxo de trabalho transparente e reproduzível que pode ser implementado sem necessidade de construção manual de base de conhecimento ou retreinamento de modelos.
Importante, o chatbot restringiu suas respostas ao escopo da diretriz referenciada. Quando as perguntas ficavam fora do conteúdo das diretrizes, o sistema explicitamente evitava gerar respostas, reduzindo assim o risco de respostas sem suporte. O uso da similaridade cosseno na seleção de referência de controle aumentou ainda mais a segurança e confiabilidade das respostas geradas (Tabela 2). Páginas de referência também foram acessadas para perguntas fora do escopo da diretriz (Tabela 3). Os valores de similaridade cosseno foram maiores para questões dentro do escopo (0,20–0,65) do que para questões fora do escopo (0,20–0,31; dados não mostrados), mas pontuações baixas de similaridade ainda foram atribuídas a algumas páginas de diretrizes mesmo quando o conteúdo não era clinicamente relevante. Isso ocorreu porque a similaridade cosseno foi calculada unicamente com base na correspondência de palavras-chave entre a consulta e o texto da diretriz. Importante destacar que essas referências de baixa relevância não resultaram em respostas inadequadas, pois o chatbot evitou gerar respostas quando informações de referência suficientes não estavam disponíveis. Nenhuma alucinação foi identificada durante a revisão manual sob as condições definidas do teste. O limiar de similaridade cosseno de 0,2 foi selecionado empiricamente durante testes preliminares para equilibrar sensibilidade e especificidade na recuperação. Embora esse limiar tenha sido eficaz sob as condições atuais do teste, a avaliação sistemática da sensibilidade ao limiar estava além do escopo deste estudo do protocolo. Estudos futuros devem investigar os efeitos de definições alternativas de limiar usando conjuntos de dados de referência maiores e métricas quantitativas de recuperação. O comportamento observado sugere que o controle de saída baseado em RAG pode ser útil em aplicações de IA médica. No entanto, a avaliação atual baseou-se em um número limitado de perguntas dentro e fora do escopo e foi destinada principalmente a uma avaliação de prova de conceito do fluxo de trabalho proposto. Portanto, os achados não devem ser interpretados como uma validação abrangente da precisão clínica, segurança ou generalizabilidade.
Este estudo apresenta várias limitações técnicas. Utilizamos o analisador morfológico japonês e o GPT-3.5-turbo-16k (LLM para geração de resposta). O LLM foi selecionado porque era um modelo amplamente disponível e estável na época do desenvolvimento do sistema e permitia a implementação reprodutível do fluxo de trabalho proposto. Analisadores morfológicos e LLMs possuem características distintas; Assim, a escolha de modelos ou bibliotecas influencia tanto a precisão da extração de informações quanto o conteúdo das respostasgeradas 22,23. Embora modelos mais recentes (por exemplo, LLMs da classe GPT-4 ou GPT-5) possam melhorar o desempenho e a validade externa22, a avaliação de modelos alternativos estava além do escopo do presente estudo de protocolo. LLMs mais novos podem oferecer melhor capacidade de raciocínio, acompanhamento de instruções e qualidade de resposta; no entanto, o objetivo principal deste estudo foi avaliar a viabilidade de uma estrutura RAG baseada em diretrizes, em vez de comparar o desempenho de diferentes LLMs. Uma otimização adicional desses componentes pode permitir uma geração de respostas mais eficiente e precisa, e a validação usando diferentes configurações de modelos é necessária para avaliar a generalizabilidade desses achados. Além disso, o protocolo atual foi desenvolvido usando uma diretriz em japonês e análise morfológica japonesa. Embora o framework de recuperação baseado em vetorização TF–IDF, similaridade cosseno e RAG seja independente da linguagem em princípio, a implementação em outras linguagens exigiria ferramentas e validação específicas de processamento de texto para cada linguagem. Embora este estudo tenha sido limitado a uma única diretriz e, portanto, não permita a comparação direta de diferentes estruturas de diretrizes, a organização em nível CQ facilitou a extração sistemática do conteúdo das diretrizes e apoiou a construção de informações de referência para o chatbot RAG baseado em diretrizes. Em particular, a estrutura web da diretriz — na qual cada CQ está associado a uma URL única — desempenhou um papel prático importante ao possibilitar uma extração eficiente e organização do conteúdo de referência no nível da URL. Diretrizes com diferentes formatos, incluindo documentos baseados em PDF ou sites sem URLs em nível de CQ, podem exigir estratégias alternativas de segmentação e recuperação. Portanto, a generalização do fluxo de trabalho atual para outras estruturas de diretrizes e especialidades médicas ainda precisa ser estabelecida. Trabalhos futuros devem avaliar a aplicabilidade dessa abordagem em múltiplas doenças, formatos de diretrizes e fontes de informação.
As conclusões deste estudo fornecem orientações práticas para o design de sistemas de IA com referência de diretrizes e demonstram que um chatbot RAG baseado em diretrizes que referencia diretrizes clínicas baseadas na web tem potencial como ferramenta para fornecer informações médicas relacionadas ao câncer. No entanto, este estudo representa uma avaliação de prova de conceito destinada a demonstrar a viabilidade técnica de mecanismos de recuperação de diretrizes, geração de resposta e restrição de resposta, e não deve ser interpretado como validação clínica formal de um sistema de informação médica. A eficácia clínica, a segurança e os resultados dos usuários não foram avaliados e ainda precisam ser estabelecidos em estudos futuros. Do ponto de vista ético e de segurança do usuário, restringir respostas a informações apoiadas por diretrizes pode reduzir o risco de respostas sem fundamento ou alucinadas. No entanto, comportamentos excessivos de recusa também podem reduzir a satisfação do usuário e a percepção de utilidade. Trabalhos futuros devem, portanto, avaliar o equilíbrio entre segurança e usabilidade, mantendo as salvaguardas adequadas contra desinformação. Ao aproveitar a estrutura de informação das diretrizes baseadas na web e fornecer respostas focadas às perguntas dos usuários, esse sistema pode servir como um modelo útil para futuras aplicações da IA na entrega de informações médicas.