Artículo de método

Desarrollo de un chatbot de generación aumentada basada en guías que referencian guías clínicas de práctica clínica del cáncer basadas en la web

DOI:

10.3791/71099

7 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe el desarrollo y la evaluación de un chatbot de generación aumentada basada en guías que recupera y resume contenido de guías clínicas de práctica oncológica basadas en la web para generar respuestas basadas en referencias a las consultas de los usuarios.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La amplia disponibilidad de información médica en Internet ha mejorado el acceso al conocimiento relacionado con la salud para los pacientes; Sin embargo, también ha aumentado la exposición a información médica inexacta. El cuidado oncológico implica información compleja, lo que dificulta que los pacientes identifiquen fuentes precisas y basadas en la evidencia. Los grandes modelos de lenguaje permiten la interacción con el lenguaje natural, pero con frecuencia generan alucinaciones, limitando su aplicación en la entrega de información médica. La generación aumentada por recuperación (RAG) tiene el potencial de mitigar estos riesgos al fundamentar las respuestas en fuentes de referencia externas. Este estudio describe el desarrollo y la evaluación de un chatbot RAG basado en guías que utiliza guías de práctica clínica del cáncer disponibles públicamente en la web. El sistema extrae URLs de las páginas de índice de una guía, procesa el texto de las páginas mediante análisis morfológico y similitud coseno basada en la frecuencia de términos–frecuencia inversa del documento, y construye información de referencia a partir de páginas altamente relevantes. Un modelo de lenguaje grande utiliza estas referencias para generar respuestas limitadas al contenido directivo. La Guía JLCS para Pacientes y Familias con Cáncer de Pulmón se utilizó como guía de referencia. Los conjuntos de preguntas incluían tanto tipos de cáncer dentro del alcance cubiertos por la guía como tipos de cáncer fuera del alcance para evaluar el control de la respuesta. La información médica se extrajo con éxito de las páginas de índice, con el 98% de las URLs extraídas conteniendo contenido médico referenciable. Para las preguntas dentro del alcance, el chatbot generó respuestas resumiendo el contenido de las directrices, y no se identificaron alucinaciones durante la revisión manual bajo las condiciones de prueba definidas. Para las preguntas fuera de alcance, el chatbot se negó consistentemente a responder e indicó que la información disponible era insuficiente. La estructura web de la guía facilitó un scraping eficiente y la organización del contenido de referencia a nivel de URL. Este protocolo proporciona orientación práctica para construir sistemas de inteligencia artificial que proporcionen información médica utilizando guías de práctica clínica basadas en la web.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El uso generalizado de internet y las redes sociales ha facilitado el acceso a la información médicade los pacientes 1,2. La información sobre el cuidado oncológico suele ser compleja y extensa, lo que dificulta especialmente que los pacientes identifiquen fuentes precisas, relevantes y basadas en evidenciacientífica 3. Aunque los recursos en línea pueden ayudar a comprender a los pacientes, también contienen una cantidad considerable de información médicaincorrecta 3, lo que puede afectar negativamente las decisiones de los pacientes respecto a suatención 4. Dado que la desinformación relacionada con el cáncer puede afectar a los resultados de los pacientes5, existe una necesidad creciente de sistemas de inteligencia artificial (IA) que ayuden a los usuarios individuales a buscar, resumir e interpretar informaciónmédica 6.

Los grandes modelos de lenguaje (LLM) permiten a los usuarios acceder a la información mediante conversaciones en lenguajenatural 7; Sin embargo, la generación de desinformación (es decir, alucinaciones) sigue siendo una preocupación seria en el ámbito médico 8,9,10,11. Una fuente clave de desinformación es la calidad y precisión de los datos de entrenamiento utilizados para desarrollar el chatbot. Además, la naturaleza estática del entrenamiento de modelos significa que el conocimiento puede quedar obsoleto con el tiempo, limitando la capacidad de los LLMs para proporcionar información actual ycontextualmente adecuada 12,13. Estas limitaciones ponen de manifiesto la importancia de estrategias efectivas de gestión del conocimiento para garantizar que las respuestas de los chatbots sigan siendo precisas, relevantes y actualizadas. En particular, los sistemas que puedan acceder y consultar fácilmente recursos actuales basados en la evidencia, como las guías de práctica clínica, son deseables en entornos médicos, donde las recomendaciones y los estándares de atención evolucionan continuamente. Para abordar este desafío, la generación aumentada por recuperación (RAG), que genera respuestas incorporando información de fuentes externas de conocimiento, ha recibido una atención creciente 10,13,14,15,16,17.

Aunque RAG se ha aplicado cada vez más a chatbots médicos, se ha prestado poca atención a cómo deben incorporarse sistemáticamente las guías de práctica clínica como fuentes de informaciónde referencia 18. Muchas guías de práctica clínica están disponibles públicamente en la web; sin embargo, sigue sin estar claro si su estructura web existente puede servir directamente como marco de recuperación para los sistemasRAG 18. Además, no se han establecido bien métodos prácticos para construir información de referencia sin desarrollo manual de bases de conocimiento.

En este estudio, nuestro objetivo fue establecer principios de diseño para sistemas de IA de referencia de guías en el ámbito sanitario mediante el desarrollo y evaluación de un chatbot RAG basado en guías que utilice directrices clínicas de oncología disponibles públicamente en la web, permitiendo así un acceso sencillo y oportuno a la información basada en directrices. Como prueba de concepto, evaluamos la viabilidad técnica de la recuperación de directrices, generación de respuestas y restricción de respuesta utilizando la estructura web existente de guías clínicas disponibles públicamente, con el objetivo de proponer un protocolo de desarrollo reproducible para sistemas RAG referenciados a guías.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio no involucra a sujetos humanos que requieran protección frente a los riesgos asociados a la investigación. Por lo tanto, no requiere revisión por parte de un comité de revisión institucional según las directrices éticas japonesas para la investigación médica que involucre a sujetoshumanos 19. Este estudio se presenta conforme a las directrices TRIPOD-LLM para la Transparencia de Reporte de un Modelo Multivariable para Pronóstico o Diagnóstico Individual(TRIPOD)-LLM 20.

Consulte la Figura 1 para una visión general esquemática del protocolo de chatbot RAG basado en directrices.

figure-protocol-1
Figura 1. Flujo de trabajo del protocolo de chatbot Generación Aumentada por Recuperación Basada en Guías (RAG). Resumen esquemático del flujo de trabajo de chatbot RAG basado en guías. Las URLs se extraen de la página de índice de una guía de práctica clínica basada en la web y se utilizan para construir información de referencia. Las consultas de usuario se convierten en palabras clave y el contenido de la página web se procesa mediante tokenización, vectorización de frecuencia de términos–frecuencia inversa de documentos y análisis de similitud coseno para identificar páginas de directrices relevantes. La información de referencia seleccionada se integra y se proporciona a un modelo de lenguaje grande para generar respuestas basadas únicamente en el contenido de la guía referenciada. El panel derecho resume los elementos de evaluación utilizados para las URLs extraídas, la información de referencia y las respuestas de los chatbots. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

1. Preparación de información de referencia a partir de directrices basadas en la web

  1. Extrae todas las URLs de las páginas de índice de las guías de práctica clínica web objetivo utilizando BeautifulSoup 4 (biblioteca de análisis sintáctico HTML) implementada en el lenguaje de programación Python (versión 3.12).
    NOTA: Implementa el script de extracción de URL usando el lenguaje de programación con los siguientes paquetes: biblioteca de análisis HTML (versión 4.12.3) y peticiones (biblioteca de recuperación de páginas web; versión 2.32.3). Instala paquetes usando pip. El código fuente completo para la extracción de URL se proporciona en el Archivo Suplementario 1. Consulta la Tabla de Materiales para detalles del software.
  2. Revisa manualmente todas las URLs extraídas para confirmar el acceso exitoso y la relevancia para la guía de práctica clínica objetivo.
  3. Clasifica cada URL como conteniendo información médica o no médica. Realiza la clasificación de URL por un solo autor (S.N.).
    NOTA: La información médica se definió como contenido de referencia de las directrices, incluyendo preguntas clínicas (CQ), preguntas de antecedentes y conjuntos de preguntas. La información no médica incluía enlaces, páginas de sociedades u organizaciones y otro contenido auxiliar que no era adecuado para consulta.
  4. Compila las URLs validadas en un libro de trabajo de Microsoft Excel (formato .xlsx), registrando una URL por fila. Almacena la lista de URL resultante como conjunto de datos de entrada para la recuperación de texto, preprocesamiento y análisis de similitud posteriores.

2. Generación de palabras clave a partir de consultas de usuario

  1. Introduce la consulta en lenguaje natural en ChatGPT (Transformador Generativo Preentrenado, versión 4o; modelo de generación de palabras clave).
  2. Pide al modelo que extraiga dos palabras clave correspondientes a la consulta del usuario.
  3. Utiliza el siguiente prompt, escrito en japonés, para generar palabras clave:
    "figure-protocol-2"
    (Traducción al inglés: "Extract two keywords from the following text.")
  4. Añade la consulta de lenguaje natural del usuario a esta instrucción y envíala al modelo de generación de palabras clave para la generación de palabras clave.
  5. No modifique manualmente ningún parámetro del modelo. Realizar la generación de palabras clave utilizando la configuración predeterminada del modelo de generación de palabras clave.
  6. Genera dos palabras clave para cada consulta de usuario. Conserva ambas palabras clave sin modificaciones, filtros o selección manual, y úsalas para cálculos posteriores de similitud.
  7. Guarda las palabras clave generadas en un libro de trabajo de Microsoft Excel (formato .xlsx). Para cada registro, almacena la consulta original del usuario y sus palabras clave generadas correspondientes para una recuperación posterior basada en similitud.

3. Procesamiento de texto y cálculo de similitud

  1. Recupera el texto completo de cada URL extraída usando la biblioteca de recuperación de páginas web y la biblioteca de análisis sintáctico HTML. Extrae contenido de texto del código fuente HTML usando la función BeautifulSoup get_text().
  2. Preprocesa el texto extraído de la página web y las palabras clave generadas eliminando etiquetas HTML y caracteres no japoneses.
  3. Realizar análisis morfológicos japoneses usando MeCab (versión 0.996; analizador morfológico japonés) con el diccionario por defecto. Conserva solo los sustantivos y concatena los nombres en una cadena de texto delimitada por el espacio.
  4. Combina las palabras clave generadas en una sola cadena de texto y aplica los mismos procedimientos de preprocesamiento y tokenización que se usan para el texto de páginas web.
  5. Genera vectores frecuencia–inversa de documento (TF–IDF) de términos a partir del texto procesado de la página web y del texto de palabras clave usando la implementación TfidfVectorizer en la biblioteca scikit-learn (versión 1.6.1) con la configuración de parámetros por defecto.
    NOTA: Todos los parámetros de TfidfVectorizer se dejaron en sus valores predeterminados y no se aplicaron ajustes personalizados de parámetros.
  6. Calcula la similitud coseno entre cada vector de página web y el vector de palabras clave usando la función de similitud coseno.
  7. Clasifica las URLs en orden descendente según las puntuaciones de similitud coseno. No aplique criterios adicionales de desempate.
  8. Selecciona páginas con una puntuación de similitud coseno de ≥0,2 como información de referencia de candidatos.
    NOTA: El umbral de similitud coseno (0.2) fue seleccionado empíricamente durante el desarrollo del sistema para priorizar la recuperación de recuperación y evitar excluir contenido potencialmente relevante de las directrices.
  9. Conserva todas las páginas de candidatos que cumplan con el umbral de similitud.

4. Construcción de la información de referencia

  1. Extrae secuencialmente el contenido de texto de las páginas seleccionadas desde la parte superior de la lista clasificada.
  2. Concatena los textos extraídos para formar un único documento de referencia.
  3. Antes de enviarlo al LLM, sustituye los caracteres de nueva línea y los caracteres en blanco consecutivos en el texto de referencia por un solo espacio.
  4. Trunque el texto de referencia concatenado a los primeros 4.096 caracteres antes de proporcionarlo al LLM.
    NOTA: El límite de truncamiento se basaba en caracteres y no en fichas. Se seleccionó empíricamente un límite de 4.096 caracteres para asegurar que la información combinada de prompt y referencia permaneciera dentro de la capacidad de entrada del modelo de generación de respuesta GPT-3.5-turbo-16k.

5. Generación de respuestas basada en IA

  1. Proporciona la información de referencia construida y la consulta original del usuario al modelo de generación de respuestas a través de la interfaz de programación de aplicaciones (API).
  2. Instruye a la IA usando el siguiente prompt (escrito íntegramente en japonés) para asegurarse de que las respuestas se generen únicamente en base a la información de referencia proporcionada:
    "Eres un asistente de información médica que ofrece orientación a pacientes con cáncer. Genera respuestas basándote únicamente en la siguiente información de referencia y no utilices tu propio conocimiento general ni razonamiento. Las respuestas deben ser detalladas y fáciles de entender, con aproximadamente 500 caracteres de longitud. Si la información de referencia no contiene suficiente información para responder a la pregunta, responde: 'No hay información suficiente en el texto', sin usar especulación ni conocimiento general."
  3. Proporciona la información de referencia y la consulta del usuario juntas en un solo mensaje de usuario. Estructura la entrada como: "Información de referencia: [texto de referencia]" seguido de "Pregunta: [consulta del usuario]".
  4. Genera respuestas usando el modelo de generación de respuestas con los siguientes ajustes: temperatura = 0,1, longitud máxima de salida = 1.024 tokens, n = 1, y stop = ninguno.
  5. Obtén la respuesta generada por IA para su evaluación posterior.
    NOTA: Envía la información de referencia y la consulta del usuario como un solo mensaje de usuario. Proporciona las instrucciones de generación de respuesta por separado como mensaje del sistema.

6. Directrices de referencia y formulación de preguntas

  1. Seleccione la Guía JLCS para Pacientes y Familias con Cáncer de Pulmón (Guía de Pulmón)21, que está disponible gratuitamente en línea, como información de referencia para el sistema de chatbots RAG basado en guías.
  2. Crea dos categorías de preguntas de evaluación basadas en el tipo de cáncer: tumores tímicos, que están dentro del alcance de la guía, y glioma pediátrico, que está fuera del alcance de la información referenciada.
  3. Formula cuatro preguntas que cubran el diagnóstico y tratamiento de cada tipo de cáncer:
    "¿Qué métodos diagnósticos existen para tumores XX (por ejemplo, glioma tímico o pediátrico)?
    "¿Cuáles son los enfoques diagnósticos patológicos para los tumores XX?"
    "¿Qué opciones de tratamiento existen para los tumores XX?"
    "¿Cuáles son las opciones de tratamiento quirúrgico para los tumores XX?"
  4. Envía preguntas relacionadas con los tipos de cáncer cubiertos por la guía web referenciada al chatbot. Por ejemplo, envía una pregunta sobre el diagnóstico de tumores tímicos utilizando la Guía del Pulmón como información de referencia.
  5. Envía preguntas fuera del alcance de la guía de referencia al chatbot para evaluar su capacidad de abstenerse de usar información externa o no relacionada. Por ejemplo, envía una pregunta sobre el glioma pediátrico utilizando la Guía del Pulmón como información de referencia.
  6. Evalúa cada pregunta en una sesión de chat independiente. No traslades el historial de conversación entre preguntas.
  7. Registra las respuestas generadas por IA para su evaluación posterior.

7. Evaluación de la respuesta

  1. Realiza una revisión manual de todas las respuestas generadas.
  2. Evalúa si cada respuesta contiene alucinaciones.
  3. Evalúa si cada respuesta está respaldada por la información contenida en la guía de referencia.
    NOTA: Las alucinaciones se definieron como respuestas que contenían eventos, nombres o términos inexistentes que podrían causar daño médico14. Todas las respuestas generadas fueron revisadas para comprobar su exactitud y ausencia de alucinaciones por un autor con 8 años de experiencia en un hospital universitario, incluyendo apoyo al paciente y comunicación médica para pacientes con cáncer. Cualquier incertidumbre sobre la clasificación de la respuesta se resolvió mediante una conversación con un médico coautor con más de 20 años de experiencia en servicios de información oncológica en el Centro Nacional de Cáncer de Japón.
  4. Considera que una respuesta solo está respaldada cuando todas las afirmaciones clínicamente relevantes puedan ser confirmadas directamente a partir de la guía de referencia recuperada sin requerir conocimientos adicionales ni inferencias no respaldadas.
  5. Clasifica cada respuesta usando etiquetas de resultado predefinidas. Clasifica las respuestas que contienen solo información respaldada por la guía de referencia como "alucinación ausente". Clasifica las respuestas que contengan información sin fundamento o fabricada como "alucinaciones presentes".

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Recuperación de contenido médico mediante páginas de índice

La arquitectura de web-scraping recogía URLs de la página de índice de la guía. De la Guía Pulmonar, se extrajeron 106 URLs de la página de índice, de las cuales 104 (98%) contenían información médica (Tabla Suplementaria 1). La eficacia de las respuestas de los chatbots basadas en las páginas de contenido de las directrices se resume en la Tabla 1. El chatbot generó respuestas para las cuatro palabras clave clínicas cuando las preguntas estaban dentro del alcance de la guía. Para el "diagnóstico de tumor tímico" y el "diagnóstico patológico", se extrajeron tres URLs relacionadas para cada palabra clave, y todas las URLs extraídas se consideraron efectivas (100%). Para "métodos de tratamiento" y "tratamiento quirúrgico", se extrajeron 15 URLs para cada palabra clave, con 14 ítems efectivos (93%).

ConsultaPalabras claveElementos de contenido referenciado, nElementos de referencia efectivos,
n (%)
¿Qué métodos diagnósticos existen para los tumores tímicos?Diagnóstico de tumor tímico33 (100)
¿Cuáles son los enfoques diagnósticos patológicos para los tumores tímicos?Diagnóstico patológico del tumor tímico33 (100)
¿Qué opciones de tratamiento existen para los tumores tímicos?Métodos de tratamiento del tumor tímico1514 (93)
¿Cuáles son las opciones de tratamiento quirúrgico para los tumores tímicos?Tratamiento quirúrgico del tumor tímico1514 (93)

Tabla 1: Contenido de la información de referencia y respuestas de chatbots basadas en la guía JLCS para pacientes y familias con cáncer de pulmón. Resumen de las consultas de los usuarios, palabras clave generadas, número de elementos de contenido referenciados identificados mediante recuperación basada en similitud y número de elementos de referencia efectivos que contienen información médica. Los elementos de contenido referenciados representan el número total de páginas web relacionadas identificadas a nivel de URL en función de cada palabra clave. Los elementos de referencia efectivos representan el número y porcentaje de páginas web únicas que contienen información médica tras excluir URLs duplicadas y páginas web no médicas.

Respuestas de chatbots a preguntas dentro del ámbito

La Tabla 2 muestra las respuestas de los chatbots a preguntas que se ajustan al alcance de la directriz proporcionada. Cuando había suficiente información de referencia disponible, el chatbot generaba respuestas resumiendo partes relevantes del texto de la directriz. Las respuestas generadas consistieron en aproximadamente 350 caracteres japoneses. No se identificaron alucinaciones durante la revisión manual bajo las condiciones de prueba definidas. Para estas preguntas dentro del alcance, múltiples ítems referenciados efectivos apoyaban la generación de respuestas (Tabla 1). El texto japonés generado fue traducido al inglés usando la versión 5.2 de ChatGPT y posteriormente revisado por los investigadores para comprobar su precisión y coherencia con las respuestas japonesas originales.

ConsultaRespuestasRecuento de caracteres
¿Qué métodos diagnósticos existen para los tumores tímicos?El diagnóstico de tumores tímicos requiere tanto diagnóstico por imagen como diagnóstico patológico. Para el diagnóstico por imagen, se realizan TAC de tórax y resonancia magnética de tórax. El timoma y el carcinoma tímico son tumores sólidos que no contienen componentes de aire ni de líquido dentro del tumor, y la invasión en los tejidos normales circundantes se sabe que es leve en el timoma y más pronunciada en el carcinoma tímico. Cuando los estudios de imagen determinan que no hay invasión en los tejidos circundantes ni tumores alejados de la lesión primaria (metástasis), el tumor se reseca quirúrgicamente y se realiza el diagnóstico patológico utilizando la muestra quirúrgica. Cuando la resección quirúrgica es difícil, se realiza una biopsia guiada por TC y se realiza el diagnóstico obteniendo una porción del tejido tumoral. En el diagnóstico patológico, los timomas se clasifican en función de la proporción de linfocitos normales dentro del tumor y la morfología de las células tumorales, mientras que los carcinomas tímicos se clasifican en detalle según el subtipo histológico. Para determinar la etapa clínica (estadio), se tiene en cuenta el grado de diseminación de las lesiones tumorales tímicas, y los tumores se clasifican en las etapas I a IV según tres sistemas de clasificación de estadificación.366
¿Cuáles son los enfoques diagnósticos patológicos para los tumores tímicos?En el diagnóstico patológico de tumores tímicos, el examen patológico se realiza obteniendo una parte o la totalidad del tejido tumoral. Los timomas se clasifican en subtipos como tipo A y tipo AB en función de la proporción de linfocitos normales contenidos en el tumor y la morfología de las células tumorales. En cambio, el carcinoma tímico es un tumor maligno caracterizado por atipia celular, y el carcinoma de células escamosas es el subtipo histológico más común. Mediante el diagnóstico patológico, se evalúan las características biológicas y el grado de progresión tumoral, lo cual es útil para seleccionar estrategias de tratamiento adecuadas y predecir el pronóstico. Además, el diagnóstico patológico de tumores tímicos permite determinar la fase de la enfermedad, proporcionando información importante para la planificación del tratamiento. La estadificación clínica se clasifica mediante tres sistemas: la clasificación Masaoka, la clasificación Masaoka–Koga y la clasificación UICC–TNM, y los tumores se clasifican en cuatro etapas, desde la etapa I hasta la IV, según el grado de diseminación e invasión tumoral. El diagnóstico patológico proporciona información indispensable para el tratamiento adecuado y la evaluación pronóstica de los tumores tímicos.330
¿Qué opciones de tratamiento existen para los tumores tímicos?Las opciones de tratamiento para los tumores tímicos incluyen cirugía (cirugía), radioterapia y terapia farmacológica (quimioterapia). La cirugía se realiza como un procedimiento en el que el timo se reseca completamente junto con el tumor, y en los casos de timoma, puede no ser necesario un tratamiento adicional. En el carcinoma tímico, la radioterapia postoperatoria puede añadirse cuando el cáncer se ha extendido a los tejidos circundantes. La quimioterapia o quimiorradioterapia se realiza en casos en los que la cirugía es difícil o cuando hay recurrencia o metástasis a distancia, y estas se utilizan como parte de la terapia farmacológica. Además, para el carcinoma tímico avanzado o recurrente, se realiza un tratamiento centrado en la quimioterapia, y también se puede administrar terapia multimodal que combine cirugía y radioterapia según sea necesario. Además, para carcinomas tímicos avanzados o recurrentes tras quimioterapia, puede utilizarse lenvatinib, un agente terapéutico molecularmente dirigido. Se selecciona la combinación adecuada de modalidades de tratamiento según la condición de la enfermedad y el estado clínico del paciente.342
¿Cuáles son las opciones de tratamiento quirúrgico para los tumores tímicos?El tratamiento quirúrgico para los tumores tímicos se realiza cuando se considera que el tumor es completamente resecable. En cirugía, generalmente es práctica habitual extirpar todo el timo junto con el tumor. En los casos de timoma, si el tumor está completamente resecado, no se requiere tratamiento adicional. En cambio, en los casos de carcinoma tímico, cuando hay invasión cancerígena en los tejidos circundantes, se puede añadir radioterapia postoperatoria adyuvante. Cuando se considera que la cirugía es difícil, primero se realiza la quimioterapia o quimiorradioterapia, y posteriormente se considera la cirugía si resulta factible. Si no se puede realizar la cirugía, se puede continuar la quimioterapia o la quimiorradioterapia. Además, incluso cuando la cirugía es posible, si no se puede lograr una resección completa, se puede administrar radioterapia postoperatoria o quimiorradioterapia para tratar el tumor residual. El tratamiento quirúrgico se selecciona adecuadamente según el tipo de tumor y el grado de progresión de la enfermedad.342

Tabla 2: Respuestas generadas por el chatbot basado en guías de generación aumentada por recuperación (RAG) basado en la guía JLCS para pacientes y familias con cáncer de pulmón. Respuestas representativas generadas por el chatbot RAG basado en guías para preguntas relacionadas con tumores tímicos utilizando información de referencia extraída de la Guía JLCS para Pacientes y Familias con Cáncer de Pulmón (https://www.haigan.gr.jp/public/guidebook/2024/). La tabla incluye la consulta del usuario, la respuesta generada por el chatbot y la longitud de la respuesta. Los conteos de caracteres se midieron en las respuestas originales en japonés antes de traducirse al inglés usando la versión 5.2 de ChatGPT.

Respuestas de chatbots a preguntas fuera de alcance

Las respuestas de los chatbots a preguntas que quedaban fuera del alcance de la Guía del Pulmón se resumen en la Tabla 3. Aunque se mencionaron un número limitado de elementos de contenido para estas preguntas, el modelo de generación de respuestas determinó que la información de referencia disponible era insuficiente para generar una respuesta basada en la evidencia. En consecuencia, el chatbot devolvió respuestas indicando información insuficiente para consultas fuera de alcance. Las afirmaciones "Hay información insuficiente en el texto" y "No hay referencias." eran respuestas predefinidas especificadas en el prompt del sistema. La primera se devolvía cuando la información de referencia recuperada era insuficiente para responder a la pregunta, mientras que la segunda se devolvía cuando no se recuperaba información de referencia.

ConsultaPalabras claveElementos de contenido referenciado, nRespuesta de chatbots
¿Qué métodos diagnósticos existen para el glioma pediátrico?Diagnóstico de glioma pediátrico0No hay referencias.
¿Cuáles son los enfoques diagnósticos patológicos para el glioma pediátrico?Diagnóstico patológico de glioma pediátrico13No hay suficiente información en el texto.
¿Qué opciones de tratamiento existen para el glioma pediátrico?Métodos de tratamiento del glioma pediátrico13No hay suficiente información en el texto.
¿Cuáles son las opciones de tratamiento quirúrgico para el glioma pediátrico?Tratamiento quirúrgico del glioma pediátrico12No hay suficiente información en el texto.

Tabla 3: Respuestas de chatbots a preguntas fuera de alcance a nivel de pregunta clínica basadas en la guía JLCS para pacientes y familias con cáncer de pulmón. Respuestas generadas por el chatbot basado en guías por generación aumentada por recuperación (RAG) para preguntas fuera del alcance de la guía de referencia. La tabla resume las consultas de los usuarios, las palabras clave generadas, el número de elementos de contenido referenciados identificados mediante la recuperación basada en similitudes y las respuestas resultantes de los chatbots. Los elementos de contenido referenciados representan el número total de páginas web relacionadas identificadas a nivel de URL en función de cada palabra clave. No se calcularon los ítems de referencia efectivos para preguntas fuera de alcance porque el contenido recuperado no contenía información relevante para la enfermedad consultada.

Archivo suplementario 1. Código en Python para la extracción de URL y texto de guías de práctica clínica basadas en la web. El código utilizado para extraer URLs y texto de páginas web de las páginas de índice de las guías clínicas basadas en la web. Las URLs extraídas y el contenido textual se utilizaron para el procesamiento posterior de texto, análisis de similitud y construcción de información de referencia en el flujo de trabajo de chatbot basado en directrices por generación aumentada de recuperación (RAG). Por favor, haga clic aquí para descargar este archivo.

Tabla suplementaria 1. Lista de URLs extraídas de la página web de índice de directrices y su clasificación como información médica o no médica. Las URLs extraídas de la página de índice del Guía JLCS para Pacientes y Familias con Cáncer de Pulmón fueron revisadas manualmente y clasificadas como información médica o no médica. La información médica se definió como contenido de referencia de las directrices, incluyendo preguntas clínicas (CQ), preguntas de contexto, conjuntos de preguntas y materiales educativos complementarios relevantes para la orientación del paciente. La información no médica incluía páginas web de la sociedad u organizaciones, páginas de navegación, hipervínculos y otro contenido auxiliar no utilizado como información de referencia para la generación de respuestas de chatbots. La tabla resume todas las URLs extraídas y sus resultados de clasificación. *Las URLs se extrajeron de la página de índice (https://www.haigan.gr.jp/public/guidebook/2024/) del Manual JLCS para Pacientes y Familias con Cáncer de Pulmón. Por favor, haga clic aquí para descargar este archivo.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En este estudio, examinamos la utilidad de un chatbot RAG basado en guías que utilizara una guía de práctica clínica en línea —la Guía JLCS para Pacientes y Familias con Cáncer de Pulmón— como fuente de información de referencia. El chatbot generaba respuestas basadas en el contenido de la guía explotando la estructura web de la guía y recuperando páginas basándose en su similitud con las consultas de los usuarios. Este enfoque demostró que la recuperación basada en similitudes combinada con la generación de respuestas referenciadas a directrices puede apoyar una entrega fiable y eficiente de información médica. Estudios recientes han destacado tanto el potencial como las limitaciones de los chatbots médicos basados en LLM, especialmente en lo que respecta a las alucinaciones y la fiabilidad de la respuesta 12,13,14. A diferencia de estudios anteriores que se centraban en los marcos generales dechatbots 10, 12 y 13, el protocolo actual demuestra un enfoque RAG reproducible basado en guías que recupera contenido de las directrices del paciente a nivel de URL y genera respuestas basadas en información de referencia identificable. Por tanto, este estudio proporciona un protocolo transparente para la entrega de información sobre el cáncer en lugar de un sistema clínico de chatbots completamente validado.

En lugar de entrenar a la IA en todo el corpus de directrices, nuestro sistema seleccionó solo las CQ más relevantes para cada consulta de usuario como información de referencia (Figura 1). La relevancia entre el texto de la pregunta y cada CQ se evaluó cuantitativamente utilizando cálculos de similitud coseno basados en lenguajes de programación con representaciones vectoriales TF–IDF. Basándose en estas puntuaciones de similitud, las CQ se clasificaron y seleccionaron en orden descendente de relevancia, lo que permitió la extracción sistemática de fuentes de información adecuadas dentro de la guía sin depender del juicio subjetivo (Tabla 1). Además, la concatenación de los textos CQ recuperados y su presentación colectiva a la IA ayudó a preservar una base evidencial consistente para la generación de respuestas, mejorando así la precisión y coherencia contextual de las respuestas generadas. En los sistemas RAG, la generación de información correcta depende críticamente de fuentes de referencia precisas yapropiadas 14. Este diseño permitía al sistema compensar información que no podía ser suficientemente cubierta por una única CQ, contribuyendo a respuestas más completas y clínicamente plausibles. Además, RAG permite una recuperación flexible de contenidos CQ actualizados y es muy adecuado para aplicaciones médicas basadas enla evidencia 10,11. Aunque los enfoques RAG basados en guías yase han descrito anteriormente 11,18, el protocolo actual difiere en su uso de la estructura web existente basada en CQ de una guía orientada al paciente como marco principal de recuperación. Este diseño proporciona un flujo de trabajo transparente y reproducible que puede implementarse sin necesidad de construir manualmente la base de conocimientos ni reentrenar el modelo.

Es importante destacar que el chatbot restringió sus respuestas al alcance de la directriz referenciada. Cuando las preguntas quedaban fuera del contenido de las directrices, el sistema se abstenía explícitamente de generar respuestas, reduciendo así el riesgo de respuestas sin fundamento. El uso de similitud coseno para la selección de referencia de control mejoró aún más la seguridad y fiabilidad de las respuestas generadas (Tabla 2). También se consultaron páginas de referencia para preguntas fuera del alcance de la guía (Tabla 3). Los valores de similitud coseno fueron más altos para las preguntas dentro del alcance (0,20–0,65) que para las fuera del ámbito (0,20–0,31; datos no mostrados), pero aún se asignaron puntuaciones bajas de similitud a algunas páginas de guías incluso cuando el contenido no era clínicamente relevante. Esto ocurrió porque la similitud coseno se calculó únicamente en base a la coincidencia de palabras clave entre la consulta y el texto de la guía. Es importante destacar que estas referencias de baja relevancia no resultaron en respuestas inapropiadas, ya que el chatbot se abstuvo de generar respuestas cuando no había suficiente información de referencia. No se identificaron alucinaciones durante la revisión manual bajo las condiciones de prueba definidas. El umbral de similitud coseno de 0,2 se seleccionó empíricamente durante pruebas preliminares para equilibrar la sensibilidad y especificidad a la recuperación. Aunque este umbral fue efectivo bajo las condiciones actuales de prueba, la evaluación sistemática de la sensibilidad al umbral estaba fuera del alcance de este estudio protocolar. Estudios futuros deberían investigar los efectos de los umbrales alternativos utilizando conjuntos de datos de referencia más amplios y métricas de recuperación cuantitativa. El comportamiento observado sugiere que el control de salida basado en RAG puede ser útil en aplicaciones de IA médica. Sin embargo, la evaluación actual se basó en un número limitado de preguntas dentro y fuera del alcance y estaba destinada principalmente como una evaluación de prueba de concepto del flujo de trabajo propuesto. Por lo tanto, los hallazgos no deben interpretarse como una validación exhaustiva de la precisión clínica, la seguridad o la generalizabilidad.

Este estudio presenta varias limitaciones técnicas. Empleamos el analizador morfológico japonés y GPT-3.5-turbo-16k (LLM para generación de respuestas). El LLM fue seleccionado porque era un modelo ampliamente disponible y estable en el momento del desarrollo del sistema y permitía una implementación reproducible del flujo de trabajo propuesto. Los analizadores morfológicos y los LLMs tienen características distintas; Por tanto, la elección de modelos o bibliotecas influye tanto en la precisión de la extracción de información como en el contenido de las respuestasgeneradas 22,23. Aunque modelos más recientes (por ejemplo, LLMs de clase GPT-4 o GPT-5) pueden mejorar el rendimiento y la validezexterna 22, la evaluación de modelos alternativos estaba fuera del alcance del estudio del protocolo actual. Los LLM más recientes pueden ofrecer una mejor capacidad de razonamiento, seguimiento de instrucciones y calidad de respuesta; sin embargo, el objetivo principal de este estudio fue evaluar la viabilidad de un marco RAG basado en directrices en lugar de comparar el rendimiento de diferentes LLMs. Una optimización adicional de estos componentes puede permitir una generación de respuestas más eficiente y precisa, y es necesaria validar utilizando diferentes configuraciones de modelos para evaluar la generalización de estos hallazgos. Además, el presente protocolo se desarrolló utilizando una guía en japonés y un análisis morfológico japonés. Aunque el marco de recuperación basado en vectorización TF–IDF, similitud coseno y RAG es independiente del lenguaje en principio, la implementación en otros lenguajes requeriría herramientas y validación específicas de procesamiento de texto. Aunque este estudio se limitó a una sola guía y, por tanto, no permite la comparación directa de diferentes estructuras de guías, la organización a nivel CQ facilitó la extracción sistemática del contenido de las directrices y apoyó la construcción de información de referencia para el chatbot RAG basado en guías. En particular, la estructura web de la guía —en la que cada CQ está asociado a una URL única— desempeñó un papel práctico importante al permitir un scraping y organización eficientes del contenido de referencia a nivel de URL. Las directrices con diferentes formatos, incluyendo documentos basados en PDF o sitios web sin URL a nivel CQ, pueden requerir estrategias alternativas de segmentación y recuperación. Por lo tanto, la generalización del flujo de trabajo actual a otras estructuras de directrices y especialidades médicas aún está por establecerse. Trabajos futuros deberían evaluar la aplicabilidad de este enfoque a múltiples enfermedades, formatos de directrices y fuentes de información.

Los hallazgos de este estudio ofrecen orientación práctica para diseñar sistemas de IA con referencia de guías y demuestran que un chatbot RAG basado en guías que referencian guías clínicas basadas en la web tiene potencial como herramienta para proporcionar información médica relacionada con el cáncer. Sin embargo, este estudio representa una evaluación de prueba de concepto destinada a demostrar la viabilidad técnica de los mecanismos de recuperación de directrices, generación de respuestas y restricción de respuesta, y no debe interpretarse como una validación clínica formal de un sistema de información médica. La eficacia clínica, la seguridad y los resultados en los usuarios no fueron evaluados y aún están por establecerse en futuros estudios. Desde una perspectiva ética y de seguridad del usuario, restringir las respuestas a información respaldada por las directrices puede reducir el riesgo de respuestas no fundamentadas o alucinadas. Sin embargo, un comportamiento excesivo de rechazo también puede reducir la satisfacción del usuario y la utilidad percibida. Por tanto, los trabajos futuros deberían evaluar el equilibrio entre seguridad y usabilidad, manteniendo al mismo tiempo las salvaguardas adecuadas contra la desinformación. Al aprovechar la estructura de información de las directrices basadas en la web y proporcionar respuestas específicas a las preguntas de los usuarios, este sistema puede servir como un modelo útil para futuras aplicaciones de la IA en la entrega de información médica.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no declaran intereses en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen a Kenichi Inoue, MD, PhD (Shonan Memorial Hospital Breast Center), por su amplio apoyo técnico en el desarrollo del chatbot de generación aumentada basada en guías. Los autores también agradecen a Chikako Yamaki, PhD, y a todos los miembros del equipo de investigación del Instituto para el Control del Cáncer, Centro Nacional de Cáncer de Japón (Tokio, Japón), por ofrecer valiosos consejos sobre el tema tratado en este artículo. Además, los autores agradecen a Editage la edición en inglés. Este trabajo fue apoyado por una subvención de investigación en Ciencias de la Salud y del Trabajo (R6–Cancer Control–23EA1026).

Materiales

```html

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Beautiful Soup 4 (versión 4.12.3)Beautiful Soup ProjectN/ABiblioteca de Python utilizada para la extracción de URL y el análisis de HTML
ChatGPT versión 4oOpenAIN/AUtilizado para la generación de palabras clave
GPT-3.5-turboOpenAIN/AUtilizado para la generación de respuestas
Libro de guía JLCS para pacientes con cáncer de pulmón y sus familiasSociedad Japonesa de Cáncer de PulmónN/ADirectriz de práctica clínica basada en la web utilizada como información de referencia
MeCab (versión 0.996)Proyecto MeCabN/AAnalizador morfológico japonés
API de OpenAIOpenAIN/AUtilizado para la generación de respuestas basadas en IA
Python (versión 3.12)Fundación de Software PythonN/AEntorno de programación
Requests (versión 2.32.3)Proyecto RequestsN/ABiblioteca de Python utilizada para la obtención de páginas web
scikit-learn (versión 1.6.1)Desarrolladores de scikit-learnN/AUtilizado para la vectorización TF–IDF y el cálculo de similitud coseno.
urllib.parseFundación de Software PythonN/ABiblioteca de Python utilizada para la normalización y unión de URL
```

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Helft PR, Hlubocky F, Daugherty CK. American oncologists' views of internet use by cancer patients: a mail survey of American Society of Clinical Oncology members. J Clin Oncol. 2003;21(5):942-947.
  2. Chen X, Siu LL. Impact of the media and the internet on oncology: survey of cancer patients and oncologists in Canada. J Clin Oncol. 2001;19(23):4291-4297.
  3. Goto Y, et al. Differences in the quality of information on the internet about lung cancer between the United States and Japan. J Thorac Oncol. 2009;4(7):829-833.
  4. Ogasawara R, et al. Reliability of cancer treatment information on the internet: observational study. JMIR Cancer. 2018;4(2):e10031.
  5. Johnson SB, Park HS, Gross CP, Yu JB. Complementary medicine, refusal of conventional cancer therapy, and survival among patients with curable cancers. JAMA Oncol. 2018;4(10):1375-1381.
  6. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28(1):31-38.
  7. The Lancet Digital Health. ChatGPT: friend or foe? Lancet Digit Health. 2023;5(3):e102.
  8. Huang L, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions. arXiv. 2023;2311.05232.
  9. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):248.
  10. Yang R, et al. Retrieval-augmented generation for generative artificial intelligence in health care. npj Health Syst. 2025;2(2).
  11. Zakka C, et al. Almanac—retrieval-augmented language models for clinical medicine. NEJM AI. 2024;1(2):AIoa2300068.
  12. Chow JCL, Li K. Developing effective frameworks for large language model-based medical chatbots: insights from radiotherapy education with ChatGPT. JMIR Cancer. 2025;11:e66633.
  13. Chow JCL, Li K. Large language models in medical chatbots: opportunities, challenges, and the need to address AI risks. Information. 2025;16(7):549.
  14. Nishisako S, Higashi T, Wakao F. Reducing hallucinations and trade-offs in responses in generative AI chatbots for cancer information: development and evaluation study. JMIR Cancer. 2025;11:e70176.
  15. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  16. Gao Y, et al. Retrieval-augmented generation for large language models: a survey. arXiv. 2023;2312.10997.
  17. Jeong M, Sohn J, Sung M, Kang JJB. Improving medical reasoning through retrieval and self-reflection with retrieval-augmented large language models. Bioinformatics. 2024;40:i119-i129.
  18. Lewis M, et al. Grounding large language models in clinical evidence: a retrieval-augmented generation system for querying UK NICE clinical guidelines. arXiv. 2025;2510.02967.
  19. Ministry of Education, Culture, Sports, Science and Technology; Ministry of Health, Labour and Welfare; Ministry of Economy, Trade and Industry. Ethical guidelines for medical and biological research involving human subjects [Article in Japanese]. Ministry of Health, Labour and Welfare.
  20. Gallifant J, et al. The TRIPOD-LLM reporting guideline for studies using large language models. Nat Med. 2025;31:60-69.
  21. The Japanese Lung Cancer Society. JLCS Guidebook for Lung Cancer Patients and Families. Available at: https://www.haigan.gr.jp/public/guidebook/2024/. Accessed January 21, 2026.
  22. Liu M, et al. Evaluating the effectiveness of advanced large language models in medical knowledge: a comparative study using Japanese national medical examination. Int J Med Inform. 2025;193:105673.
  23. Kudo T, Yamamoto K, Matsumoto Y. Applying conditional random fields to Japanese morphological analysis. In: Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing. 2004:230-237.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

MedicinaN mero 234N mero 234Valor vac oN meroModelos de lenguaje extensosGeneraci n aumentada por recuperaci n RAGSuministro de informaci n m dicaIA m dica seguraRecuperaci n de informaci n

Artículos relacionados