$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
En este estudio, examinamos la utilidad de un chatbot RAG basado en guías que utilizara una guía de práctica clínica en línea —la Guía JLCS para Pacientes y Familias con Cáncer de Pulmón— como fuente de información de referencia. El chatbot generaba respuestas basadas en el contenido de la guía explotando la estructura web de la guía y recuperando páginas basándose en su similitud con las consultas de los usuarios. Este enfoque demostró que la recuperación basada en similitudes combinada con la generación de respuestas referenciadas a directrices puede apoyar una entrega fiable y eficiente de información médica. Estudios recientes han destacado tanto el potencial como las limitaciones de los chatbots médicos basados en LLM, especialmente en lo que respecta a las alucinaciones y la fiabilidad de la respuesta 12,13,14. A diferencia de estudios anteriores que se centraban en los marcos generales dechatbots 10, 12 y 13, el protocolo actual demuestra un enfoque RAG reproducible basado en guías que recupera contenido de las directrices del paciente a nivel de URL y genera respuestas basadas en información de referencia identificable. Por tanto, este estudio proporciona un protocolo transparente para la entrega de información sobre el cáncer en lugar de un sistema clínico de chatbots completamente validado.
En lugar de entrenar a la IA en todo el corpus de directrices, nuestro sistema seleccionó solo las CQ más relevantes para cada consulta de usuario como información de referencia (Figura 1). La relevancia entre el texto de la pregunta y cada CQ se evaluó cuantitativamente utilizando cálculos de similitud coseno basados en lenguajes de programación con representaciones vectoriales TF–IDF. Basándose en estas puntuaciones de similitud, las CQ se clasificaron y seleccionaron en orden descendente de relevancia, lo que permitió la extracción sistemática de fuentes de información adecuadas dentro de la guía sin depender del juicio subjetivo (Tabla 1). Además, la concatenación de los textos CQ recuperados y su presentación colectiva a la IA ayudó a preservar una base evidencial consistente para la generación de respuestas, mejorando así la precisión y coherencia contextual de las respuestas generadas. En los sistemas RAG, la generación de información correcta depende críticamente de fuentes de referencia precisas yapropiadas 14. Este diseño permitía al sistema compensar información que no podía ser suficientemente cubierta por una única CQ, contribuyendo a respuestas más completas y clínicamente plausibles. Además, RAG permite una recuperación flexible de contenidos CQ actualizados y es muy adecuado para aplicaciones médicas basadas enla evidencia 10,11. Aunque los enfoques RAG basados en guías yase han descrito anteriormente 11,18, el protocolo actual difiere en su uso de la estructura web existente basada en CQ de una guía orientada al paciente como marco principal de recuperación. Este diseño proporciona un flujo de trabajo transparente y reproducible que puede implementarse sin necesidad de construir manualmente la base de conocimientos ni reentrenar el modelo.
Es importante destacar que el chatbot restringió sus respuestas al alcance de la directriz referenciada. Cuando las preguntas quedaban fuera del contenido de las directrices, el sistema se abstenía explícitamente de generar respuestas, reduciendo así el riesgo de respuestas sin fundamento. El uso de similitud coseno para la selección de referencia de control mejoró aún más la seguridad y fiabilidad de las respuestas generadas (Tabla 2). También se consultaron páginas de referencia para preguntas fuera del alcance de la guía (Tabla 3). Los valores de similitud coseno fueron más altos para las preguntas dentro del alcance (0,20–0,65) que para las fuera del ámbito (0,20–0,31; datos no mostrados), pero aún se asignaron puntuaciones bajas de similitud a algunas páginas de guías incluso cuando el contenido no era clínicamente relevante. Esto ocurrió porque la similitud coseno se calculó únicamente en base a la coincidencia de palabras clave entre la consulta y el texto de la guía. Es importante destacar que estas referencias de baja relevancia no resultaron en respuestas inapropiadas, ya que el chatbot se abstuvo de generar respuestas cuando no había suficiente información de referencia. No se identificaron alucinaciones durante la revisión manual bajo las condiciones de prueba definidas. El umbral de similitud coseno de 0,2 se seleccionó empíricamente durante pruebas preliminares para equilibrar la sensibilidad y especificidad a la recuperación. Aunque este umbral fue efectivo bajo las condiciones actuales de prueba, la evaluación sistemática de la sensibilidad al umbral estaba fuera del alcance de este estudio protocolar. Estudios futuros deberían investigar los efectos de los umbrales alternativos utilizando conjuntos de datos de referencia más amplios y métricas de recuperación cuantitativa. El comportamiento observado sugiere que el control de salida basado en RAG puede ser útil en aplicaciones de IA médica. Sin embargo, la evaluación actual se basó en un número limitado de preguntas dentro y fuera del alcance y estaba destinada principalmente como una evaluación de prueba de concepto del flujo de trabajo propuesto. Por lo tanto, los hallazgos no deben interpretarse como una validación exhaustiva de la precisión clínica, la seguridad o la generalizabilidad.
Este estudio presenta varias limitaciones técnicas. Empleamos el analizador morfológico japonés y GPT-3.5-turbo-16k (LLM para generación de respuestas). El LLM fue seleccionado porque era un modelo ampliamente disponible y estable en el momento del desarrollo del sistema y permitía una implementación reproducible del flujo de trabajo propuesto. Los analizadores morfológicos y los LLMs tienen características distintas; Por tanto, la elección de modelos o bibliotecas influye tanto en la precisión de la extracción de información como en el contenido de las respuestasgeneradas 22,23. Aunque modelos más recientes (por ejemplo, LLMs de clase GPT-4 o GPT-5) pueden mejorar el rendimiento y la validezexterna 22, la evaluación de modelos alternativos estaba fuera del alcance del estudio del protocolo actual. Los LLM más recientes pueden ofrecer una mejor capacidad de razonamiento, seguimiento de instrucciones y calidad de respuesta; sin embargo, el objetivo principal de este estudio fue evaluar la viabilidad de un marco RAG basado en directrices en lugar de comparar el rendimiento de diferentes LLMs. Una optimización adicional de estos componentes puede permitir una generación de respuestas más eficiente y precisa, y es necesaria validar utilizando diferentes configuraciones de modelos para evaluar la generalización de estos hallazgos. Además, el presente protocolo se desarrolló utilizando una guía en japonés y un análisis morfológico japonés. Aunque el marco de recuperación basado en vectorización TF–IDF, similitud coseno y RAG es independiente del lenguaje en principio, la implementación en otros lenguajes requeriría herramientas y validación específicas de procesamiento de texto. Aunque este estudio se limitó a una sola guía y, por tanto, no permite la comparación directa de diferentes estructuras de guías, la organización a nivel CQ facilitó la extracción sistemática del contenido de las directrices y apoyó la construcción de información de referencia para el chatbot RAG basado en guías. En particular, la estructura web de la guía —en la que cada CQ está asociado a una URL única— desempeñó un papel práctico importante al permitir un scraping y organización eficientes del contenido de referencia a nivel de URL. Las directrices con diferentes formatos, incluyendo documentos basados en PDF o sitios web sin URL a nivel CQ, pueden requerir estrategias alternativas de segmentación y recuperación. Por lo tanto, la generalización del flujo de trabajo actual a otras estructuras de directrices y especialidades médicas aún está por establecerse. Trabajos futuros deberían evaluar la aplicabilidad de este enfoque a múltiples enfermedades, formatos de directrices y fuentes de información.
Los hallazgos de este estudio ofrecen orientación práctica para diseñar sistemas de IA con referencia de guías y demuestran que un chatbot RAG basado en guías que referencian guías clínicas basadas en la web tiene potencial como herramienta para proporcionar información médica relacionada con el cáncer. Sin embargo, este estudio representa una evaluación de prueba de concepto destinada a demostrar la viabilidad técnica de los mecanismos de recuperación de directrices, generación de respuestas y restricción de respuesta, y no debe interpretarse como una validación clínica formal de un sistema de información médica. La eficacia clínica, la seguridad y los resultados en los usuarios no fueron evaluados y aún están por establecerse en futuros estudios. Desde una perspectiva ética y de seguridad del usuario, restringir las respuestas a información respaldada por las directrices puede reducir el riesgo de respuestas no fundamentadas o alucinadas. Sin embargo, un comportamiento excesivo de rechazo también puede reducir la satisfacción del usuario y la utilidad percibida. Por tanto, los trabajos futuros deberían evaluar el equilibrio entre seguridad y usabilidad, manteniendo al mismo tiempo las salvaguardas adecuadas contra la desinformación. Al aprovechar la estructura de información de las directrices basadas en la web y proporcionar respuestas específicas a las preguntas de los usuarios, este sistema puede servir como un modelo útil para futuras aplicaciones de la IA en la entrega de información médica.