Artículo de investigación

Plataforma web interoperable basada en modelos de lenguaje extensos para el análisis de datos médicos: un protocolo para el soporte de decisiones clínicas

49 visualizaciones

DOI:

10.3791/72085

25 de agosto de 2026

En este artículo

Resumen

Este protocolo describe la implementación de una plataforma web interoperable que integra datos clínicos basados en FHIR con generación aumentada por recuperación y modelos grandes de lenguaje multiagente para apoyar la toma de decisiones clínicas. El flujo de trabajo permite la implementación reproducible, la integración estandarizada de datos y la evaluación del análisis de datos médicos asistido por inteligencia artificial (AI).

Resumen

La toma de decisiones clínicas frecuentemente se ve obstaculizada por registros electrónicos de salud fragmentados y una interoperabilidad limitada entre sistemas heterogéneos de información sanitaria. Este artículo presenta un protocolo paso a paso para implementar una plataforma web interoperable que integra datos clínicos mediante el estándar Fast Healthcare Interoperability Resources (FHIR), junto con Generación Aumentada por Recuperación (RAG), Modelos de Lenguaje de Gran Tamaño (LLMs) y un marco de razonamiento clínico multiagente para apoyar el análisis de datos médicos y la asistencia en la toma de decisiones clínicas. El protocolo describe el flujo de trabajo completo, incluyendo la configuración del entorno computacional, el preprocesamiento de conjuntos de datos clínicos, la integración de datos basada en FHIR, la construcción de una base de datos vectorial, la configuración de recuperación, la ingeniería de indicaciones (prompt engineering), la orquestación multiagente y la evaluación del sistema. Los resultados representativos demuestran la capacidad de la plataforma para generar respuestas clínicamente relevantes y coherentes en el contexto, mejorando al mismo tiempo la interoperabilidad semántica entre fuentes de datos heterogéneas. El rendimiento del sistema se evaluó utilizando métricas cuantitativas y semánticas complementarias, incluyendo BLEU, ROUGE, BERTScore y similitud del coseno. Se realizó una evaluación cualitativa utilizando conjuntos de datos de referencia sanitarios de acceso público y completamente anonimizados para evaluar la reproducibilidad del flujo de trabajo metodológico propuesto. La arquitectura propuesta combina la interoperabilidad sanitaria estandarizada con modelos de lenguaje mejorados por recuperación para mejorar el razonamiento contextual, reducir las alucinaciones y apoyar flujos de trabajo clínicos asistidos por inteligencia artificial reproducibles. Este protocolo proporciona un marco escalable y reproducible para investigadores y desarrolladores que buscan implementar sistemas sanitarios inteligentes, interoperables y respetuosos con la privacidad, destinados a la asistencia en la toma de decisiones clínicas, el análisis de datos médicos y futuras investigaciones traslacionales.

Introducción

La información de salud se genera rutinariamente en hospitales, centros de diagnóstico, laboratorios y clínicas ambulatorias, y a menudo permanece distribuida entre sistemas de información heterogéneos. Esta fragmentación limita la interoperabilidad y restringe el acceso oportuno a historiales clínicos completos, creando desafíos persistentes para la atención clínica, la integración de datos y la gestión sanitaria1,2,3,4.

Las consecuencias de esta fragmentación resultan particularmente evidentes en los flujos de trabajo clínicos que dependen del acceso oportuno a la información del paciente. Cuando los profesionales de la salud no pueden recuperar historiales médicos completos e integrados, la evaluación clínica se vuelve más difícil, lo que aumenta el riesgo de toma de decisiones incompleta y reduce la eficiencia en la prestación de la atención, especialmente en entornos de emergencia5,6.

Los recientes avances en inteligencia artificial (IA), particularmente en modelos lingüísticos grandes (LLM), han ampliado el rango de enfoques computacionales disponibles para aplicaciones en salud. Estos modelos se han investigado en tareas como asistencia diagnóstica, triaje clínico y apoyo en la toma de decisiones. Por ejemplo, Jahan et al.5 evaluaron el uso de LLM en tareas biomédicas, mientras que Taylor et al.7 investigaron modelos ajustados para la detección digital de salud mental, reportando resultados alentadores en entornos clínicos especializados.

La aplicación de los modelos de lenguaje grande también se ha expandido a dominios clínicos más especializados. Song et al. 49 exploraron su uso en el diagnóstico de neumoconiosis, mientras que Chien et al.8 aplicaron estos modelos para analizar patrones de carga de trabajo entre cuidadores informales. En oftalmología, Xue et al.9 propusieron un sistema de preguntas y respuestas para el diagnóstico de glaucoma, mientras que Tan et al.3  y Wu et al.10 informaron sobre el uso de modelos de lenguaje grande en sistemas diagnósticos híbridos y consultas de medicina tradicional china.

El uso de los modelos de lenguaje de gran tamaño no se limita a aplicaciones clínicas directas. Zhang et al.11 investigaron su aplicación en el reconocimiento de emociones en escenarios de salud mental, mientras que Sarzaeim et al.12 exploraron sistemas de vigilancia inteligente que también podrían contribuir a análisis relacionados con la salud pública. Estos estudios ilustran la amplia aplicabilidad de los enfoques basados en modelos de lenguaje de gran tamaño en diversos ámbitos relacionados con la atención sanitaria.

Aunque los modelos de lenguaje grandes (LLM) han ampliado las posibilidades para aplicaciones en el ámbito sanitario, su integración en entornos clínicos sigue asociada a importantes desafíos técnicos, organizativos y regulatorios. La implementación práctica requiere una infraestructura computacional adecuada, una gobernanza eficaz de los datos y el cumplimiento de marcos regulatorios como el Reglamento General de Protección de Datos (GDPR) y la Ley Brasileña de Protección de Datos Generales (LGPD). Estos marcos establecen requisitos para el procesamiento seguro y ético de información sanitaria sensible, abordando al mismo tiempo cuestiones relacionadas con la privacidad, la fiabilidad y el sesgo algorítmico en los sistemas sanitarios asistidos por inteligencia artificial13,14 .

La interoperabilidad entre fuentes heterogéneas de datos sanitarios, incluidos los registros electrónicos de salud (EHR), sistemas de imágenes médicas y dispositivos del Internet de las Cosas (IoT), sigue representando un desafío técnico importante para la implementación de soluciones sanitarias asistidas por inteligencia artificial. En este contexto, los marcos estandarizados de interoperabilidad como HL7 FHIR proporcionan un mecanismo estructurado para intercambiar información clínica entre diferentes sistemas, preservando al mismo tiempo la coherencia semántica y apoyando la integración escalable.

Este trabajo presenta una plataforma web interoperable que integra modelos de lenguaje grandes con estándares de interoperabilidad en salud para apoyar el análisis de datos médicos en entornos clínicos heterogéneos. La arquitectura propuesta combina la integración de datos basada en HL7 FHIR con generación aumentada por recuperación (RAG) y un marco de procesamiento multiagente para proporcionar un análisis asistido por inteligencia artificial sensible al contexto, manteniendo alineación con los requisitos aplicables de protección de datos, incluida la Ley General de Protección de Datos de Brasil (LGPD).

Este protocolo describe una arquitectura interoperable para integrar datos clínicos heterogéneos utilizando estándares establecidos de interoperabilidad en atención médica. También detalla la implementación de una canalización de procesamiento multiagente basada en modelos de lenguaje grandes y pequeños (LLMs y SLMs), junto con un marco de evaluación que combina métricas cuantitativas y análisis cualitativos para evaluar el comportamiento de la plataforma propuesta.

Protocolo

Este estudio no implicó la reclutación de participantes humanos, el acceso a registros de pacientes identificables ni experimentos con animales. El protocolo se desarrolló y evaluó exclusivamente utilizando conjuntos de datos disponibles públicamente y completamente anonimizados para la validación metodológica. No se accedió ni procesó ninguna información personal de salud. Por lo tanto, no se requirió la aprobación de una Junta de Revisión Institucional (IRB) ni de un Comité de Ética en Investigación. El protocolo se desarrolló de acuerdo con los principios aplicables de protección de datos, incluida la Ley General de Protección de Datos de Brasil (LGPD), para apoyar aplicaciones futuras que involucren datos clínicos.

Selección y preprocesamiento del conjunto de datos

El protocolo propuesto se evaluó utilizando conjuntos de datos clínicos de acceso público y completamente anonimizados, que incluyen registros electrónicos de salud estructurados (EHR), datos de respuestas a preguntas clínicas y conjuntos de datos de imágenes médicas para la validación metodológica. Antes de su integración en la plataforma, los conjuntos de datos pasaron por procedimientos estandarizados de preprocesamiento, incluyendo la normalización de datos, eliminación de registros inconsistentes o incompletos, mapeo a recursos HL7 FHIR, limpieza del texto, segmentación en fragmentos de recuperación y generación de incrustaciones para indexación vectorial. Estos pasos de preprocesamiento garantizaron la coherencia semántica entre fuentes de datos heterogéneas, facilitando la interoperabilidad y permitiendo la reproducibilidad del flujo de trabajo propuesto, al tiempo que se mantenía el cumplimiento con los principios aplicables de privacidad de datos.

Los conjuntos de datos se obtuvieron de repositorios de referencia públicos comúnmente utilizados en la investigación de inteligencia artificial y salud digital. Se seleccionaron para representar información clínica heterogénea, incluyendo registros electrónicos de salud (EHR) estructurados, narrativas clínicas no estructuradas, tareas de respuesta a preguntas clínicas y metadatos de imágenes médicas. En lugar de evaluar una cohorte clínica específica, el protocolo se centra en demostrar un flujo de trabajo de implementación reproducible que puede adaptarse a diferentes conjuntos de datos de atención médica. La diversidad de estos conjuntos de datos de referencia permite validar la canalización de interoperabilidad, la generación aumentada por recuperación (RAG) y el marco de razonamiento multiagente a través de múltiples modalidades de datos clínicos.

Configuración del entorno experimental

El entorno experimental se configuró para evaluar la plataforma interoperable bajo condiciones controladas y reproducibles. La arquitectura comprende módulos de ingesta de datos, capas de interoperabilidad, modelos lingüísticos grandes (LLMs) y componentes de evaluación organizados en una única canalización de procesamiento para el análisis de datos médicos. Figura 1 ilustra el flujo de trabajo completo, desde la ingesta de datos clínicos hasta la generación de resultados diagnósticos.

Diagrama de procesamiento de datos del EHR; filtrado de notas clínicas; inferencia de enfermedad mediante LLM; proceso de diagnóstico.
Figura 1: Flujo general del sistema que ilustra la tubería de procesamiento desde los datos clínicos brutos hasta la salida del estado de la enfermedad. El proceso comienza con la ingesta de Registros Electrónicos de Salud (EHR), seguida de filtrado y preprocesamiento de datos para extraer información sensible a enfermedades. Una etapa de diseño de indicaciones estructuradas integra conocimiento experto, definiciones de enfermedades e hiperparámetros, permitiendo una interacción eficaz con el Modelo de Lenguaje de Gran Tamaño (LLM). El LLM realiza inferencia de texto para generar respuestas contextualizadas, que posteriormente se evalúan mediante reglas clínicas para determinar el estado final de la enfermedad. El flujo de trabajo destaca la integración del preprocesamiento de datos, la formulación basada en conocimiento y la inferencia basada en inteligencia artificial para apoyar la toma de decisiones clínicas. Haga clic aquí para ver una versión más grande de esta figura.

Arquitectura de interoperabilidad en atención médica

La infraestructura de backend adopta una arquitectura modular basada en API RESTful para apoyar la comunicación entre los componentes de la plataforma (Figura 2). Esta arquitectura acomoda información clínica heterogénea, incluyendo registros electrónicos de salud (EHR) estructurados, notas médicas y metadatos derivados de sistemas de imágenes médicas. Dado que estos datos provienen de múltiples fuentes y formatos, la interoperabilidad se logra mediante modelos de datos estandarizados, particularmente el marco Fast Healthcare Interoperability Resources (FHIR)15,16,17.. La adopción de FHIR facilita el intercambio de información estructurada al tiempo que preserva la escalabilidad y flexibilidad en entornos clínicos distribuidos. También se incorporaron mecanismos de comunicación basados en HL7 para facilitar la integración con sistemas clínicos heredados, que aún se utilizan ampliamente en instituciones sanitarias16,17.

Diagrama de la API Flask que muestra solicitudes POST/GET, consultas MySQL e integración con el almacén vectorial FAISS.
Figura 2: Arquitectura del sistema de la plataforma interoperable propuesta. La interfaz web se comunica con el backend mediante una API Flask utilizando solicitudes HTTP POST/GET. La API gestiona el enrutamiento, el procesamiento de consultas y la interacción con fuentes de datos estructurados y no estructurados. Una base de datos MySQL almacena datos clínicos estructurados, mientras que un almacén vectorial basado en FAISS permite búsquedas de similitud para operaciones de recuperación. La canalización basada en LLaMA procesa entradas de texto y genera respuestas utilizando representaciones vectoriales, posibilitando la generación aumentada por recuperación (Retrieval-Augmented Generation, RAG). La arquitectura destaca la integración de servicios web, gestión de bases de datos, recuperación vectorial e inferencia de modelos de lenguaje grandes en un sistema unificado. Haga clic aquí para ver una versión ampliada de esta figura.

Configuración del flujo de trabajo multiagente

La arquitectura multiagente se organiza en agentes funcionales especializados, responsables de etapas distintas del flujo de trabajo. Un agente de preprocesamiento realiza la normalización de datos y la asignación FHIR, seguido por un agente de recuperación encargado de la búsqueda semántica dentro de la base de datos vectorial. Un agente de razonamiento integra el contexto recuperado con el LLM para generar respuestas, mientras que un agente de validación verifica la coherencia y el formato de la salida antes de que se devuelva la respuesta final. La coordinación entre agentes sigue una estrategia de orquestación secuencial en la que la salida de cada agente sirve como entrada para la etapa siguiente, asegurando una implementación reproducible y modular.

Integración de datos clínicos

La capa de integración de datos agrega información de múltiples fuentes clínicas y la prepara para el procesamiento posterior. El preprocesamiento incluye la normalización de datos, la tokenización y el alineamiento de entidades para mejorar la coherencia semántica entre conjuntos de datos heterogéneos. Dado que la información clínica varía en estructura y calidad, estas operaciones ayudan a reducir el ruido y facilitan la interacción con modelos de inteligencia artificial. También se aplicaron estrategias de mapeo estructurado para armonizar diferentes formatos de datos y mantener la compatibilidad con la canalización de procesamiento, como se ilustra en Figura 315,16,17.

Diagrama del proceso de toma de decisiones en atención médica; pasos: complejidad de la consulta, reclutamiento, análisis, síntesis.
Figura 3: Ejemplo detallado del proceso de razonamiento clínico multiagente. La figura ilustra cómo se analiza una consulta clínica mediante múltiples etapas, incluyendo la evaluación de complejidad, el reclutamiento de especialistas, la discusión colaborativa y la toma final de decisiones. Este proceso demuestra la capacidad del sistema para adaptar dinámicamente las estrategias de razonamiento según la complejidad de la consulta, mejorando tanto la eficiencia como la precisión diagnóstica en escenarios de apoyo a la toma de decisiones clínicas. Haga clic aquí para ver una versión más grande de esta figura.

Configurar la canalización de generación aumentada por recuperación

Se incorpora la generación aumentada por recuperación (Retrieval-Augmented Generation, RAG) para proporcionar un análisis consciente del contexto, combinando la recuperación de información con las capacidades generativas de los modelos grandes de lenguaje. Las consultas del usuario se convierten en representaciones vectoriales mediante modelos de incrustación y se comparan con la base de datos vectorial utilizando una búsqueda semántica por similitud para recuperar los pasajes contextuales más relevantes. Los documentos recuperados se combinan luego con la consulta original antes de la inferencia por parte del modelo grande de lenguaje (LLM). Esta estrategia ayuda a proporcionar información contextual durante la generación de respuestas y se ha asociado con una mayor consistencia factual y una reducción de las alucinaciones en aplicaciones intensivas en conocimiento, incluida la atención sanitaria18,19. Figura 1 y Figura 3 ilustran el flujo de trabajo general de recuperación y el proceso de razonamiento correspondiente.

Para cada solicitud del usuario, el prompt final se construye dinámicamente combinando la consulta original con los pasajes contextuales más relevantes recuperados de la base de datos vectorial. La información recuperada se incorpora como evidencia contextual antes de la inferencia, lo que permite que el modelo de lenguaje genere respuestas basadas en el conocimiento sanitario recuperado, preservando la coherencia semántica y reduciendo las generaciones infundadas.

Ingeniería de indicaciones y razonamiento multiagente

El protocolo incorpora estrategias de estimulación estructurada para mejorar la interpretación contextual durante la generación de respuestas. Estas técnicas de estimulación, junto con mecanismos de inferencia avanzados, ayudan a guiar el proceso de razonamiento en escenarios clínicos complejos y son coherentes con los avances recientes reportados en la literatura20.

La arquitectura incluye un marco multiagente compuesto por módulos especializados que realizan funciones distintas dentro de la tubería de procesamiento, incluyendo validación de datos, filtrado de contexto, apoyo al razonamiento clínico y verificación de resultados. La organización modular permite que las tareas se ejecuten secuencialmente o en paralelo, lo que proporciona flexibilidad para diferentes requisitos de procesamiento (Figura 4). Distribuir estas actividades entre múltiples agentes reduce la dependencia de un único modelo de lenguaje y favorece un flujo de trabajo de procesamiento más robusto. Esta estrategia arquitectónica es coherente con los avances recientes en inteligencia artificial distribuida y diseño de sistemas inteligentes21,22.

Diagrama del proceso de consulta; flujo de decisiones para problemas médicos simples y complejos; análisis en equipo.
Figura 4: Marco de decisión multiagente para el razonamiento clínico. El proceso comienza con una consulta del usuario, que es evaluada por un agente verificador encargado de determinar la complejidad de la consulta. En los casos complejos, el sistema recluta dinámicamente un equipo multidisciplinario (MDT) compuesto por agentes especializados, que llevan a cabo rondas iterativas de discusión para analizar el problema y sintetizar conocimientos antes de producir una decisión final. En los casos más simples, la consulta es gestionada por un agente de clínica primaria (PCC), lo que permite generar respuestas más rápidamente. Esta arquitectura adaptable equilibra eficiencia y profundidad analítica, mejorando la calidad de las decisiones y la escalabilidad del sistema en aplicaciones sanitarias. Haga clic aquí para ver una versión ampliada de esta figura.

Evaluación del rendimiento

El rendimiento del sistema se evaluó utilizando métricas complementarias que capturan tanto la calidad lingüística como la consistencia semántica de las salidas generadas. Se aplicó BLEU para medir la similitud sintáctica basada en la superposición de n-gramas23, mientras que ROUGE evaluó la recuperación y la cobertura del contenido, particularmente en tareas de resumen y extracción de información24. La similitud semántica se evaluó con BERTScore, que utiliza incrustaciones contextuales derivadas de modelos basados en transformadores para comparar los textos generados y los de referencia25. Los análisis adicionales incluyeron la perplejidad y la similitud del coseno para examinar la confianza del modelo y la coherencia semántica, respectivamente26,27.

Las métricas de evaluación seleccionadas ofrecen perspectivas complementarias sobre el rendimiento del sistema al combinar análisis léxicos y semánticos. Esta combinación es particularmente relevante en aplicaciones de atención médica, donde la interpretación contextual es tan importante como la similitud léxica. La plataforma fue evaluada en un entorno computacional controlado que permite tanto el despliegue en la nube como local. La ejecución local de los modelos lingüísticos grandes (LLM) se incluyó como una opción para cumplir con los requisitos de privacidad de los datos y reducir la dependencia de servicios externos al procesar información clínica sensible. Esta estrategia de despliegue es compatible con los marcos de protección de datos y puede adaptarse a diferentes entornos operativos4.

Resultados

El rendimiento del sistema se evaluó utilizando métricas cuantitativas complementarias junto con un análisis cualitativo para examinar tanto la precisión lingüística como la coherencia semántica de las salidas generadas. Esta estrategia de evaluación combina medidas léxicas y semánticas para proporcionar una caracterización más amplia del comportamiento del modelo en tareas de generación de lenguaje relacionadas con la atención sanitaria.

Tabla 1 presenta los resultados cuantitativos obtenidos con BLEU, ROUGE y BERTScore. Estas métricas fueron seleccionadas porque evalúan aspectos complementarios del texto generado, incluyendo similitud léxica, cobertura de información y alineación semántica, y se utilizan ampliamente en la investigación de procesamiento del lenguaje natural.

JuezPromptPearsonRMSEMAETasa de aciertos
Mixtralcorto0.0981.7791.3466/28
sin ejemplos (zero-shot)0.1741.6181.29315/28
pocos ejemplos (few-shot)0.4751.6731.3679/28
LLaMA 3corto0.4851.6171.31411/28
sin ejemplos (zero-shot)0.4791.6141.31410/28
pocos ejemplos (few-shot)0.4251.6521.33913/28
LLaMA 3.1corto0.3491.6211.31806/28
sin ejemplos (zero-shot)0.681.6141.30712/28
pocos ejemplos (few-shot)0.4081.2430.88611/28

Tabla 1: Métricas cuantitativas de evaluación del sistema propuesto.

Se utilizó BLEU para cuantificar la similitud sintáctica basada en la superposición de n-gramas entre las salidas generadas y los textos de referencia23. Originalmente desarrollado para la traducción automática, también se ha aplicado a una amplia variedad de tareas de generación de texto porque captura la correspondencia estructural entre textos. En la evaluación presente, los puntajes BLEU indican que las respuestas generadas conservan características sintácticas consistentes con las salidas de referencia.

ROUGE se utilizó para evaluar la similitud orientada al record, con énfasis en la cobertura de la información relevante en los textos generados24. En aplicaciones de atención médica, esta métrica es particularmente útil porque preservar la información clínicamente relevante suele ser más importante que reproducir la redacción idéntica. Como se informa en Tabla 2, las puntuaciones ROUGE indican que las respuestas generadas conservan contenido clínico relevante en todos los casos evaluados.

JuezPromptICC1ICC2ICC3ICC1kICC2kICC3K
Mixtralcorto0.1360.1640.1820.320.370.4
zero-shot0.280.3530.5070.5390.6210.755
few-shot0.2240.3230.5220.4630.5880.766
LLaMA3corto0.2340.3310.5320.4790.5970.773
zero-shot0.2440.340.5510.4920.6070.786
few-shot0.2180.3210.5310.4560.5870.772
LLaMA3.1corto0.5210.5250.5370.7660.7680.777
zero-shot0.2460.3430.560.4950.6110.792
few-shot0.5990.5970.5890.8170.8160.811

Tabla 2: Métricas de acuerdo entre evaluadores (CCI).

Se incluyó BERTScore para evaluar la similitud semántica utilizando incrustaciones contextuales derivadas de modelos basados en transformadores25. A diferencia de BLEU y ROUGE, esta métrica compara textos según su significado contextual en lugar del solapamiento léxico, lo que la hace adecuada para evaluar la generación de lenguaje clínico. Los valores de BERTScore obtenidos en este estudio indican un alto grado de alineación semántica entre las respuestas generadas y los textos de referencia correspondientes.

Los análisis adicionales incluyeron la perplejidad y la similitud del coseno para complementar las métricas principales de evaluación. Se calculó la perplejidad para estimar la previsibilidad de las salidas generadas, siendo valores más bajos indicativos de una menor incertidumbre durante la generación del texto26. Se utilizó la similitud del coseno para cuantificar el alineamiento entre los vectores de incrustación derivados de los textos generados y de referencia, proporcionando una medida adicional de coherencia semántica27.

En conjunto, las métricas de evaluación proporcionan información complementaria sobre las características sintácticas, semánticas y contextuales de las respuestas generadas. Figura 5 resume la distribución de los resultados de evaluación a través de las métricas evaluadas, ofreciendo una visión general del rendimiento del sistema bajo las condiciones probadas.

Los resultados de la evaluación son coherentes con el comportamiento esperado de la generación aumentada por recuperación (Retrieval-Augmented Generation, RAG) en aplicaciones que requieren acceso a fuentes de conocimiento externas. Al incorporar documentos recuperados en el proceso de generación de respuestas, la arquitectura proporciona información contextual adicional que respalda respuestas clínicamente relevantes en escenarios intensivos en conocimiento18,19. Se incorporan estrategias de formulación estructurada como mecanismos complementarios para guiar el proceso de razonamiento y la interpretación contextual, en línea con los enfoques descritos en estudios recientes20.

El análisis cualitativo complementó la evaluación cuantitativa mediante el examen de la interpretabilidad y la relevancia clínica de las salidas generadas. En la Figura 3 se muestran ejemplos representativos de las respuestas del sistema para diferentes tipos de consultas clínicas. Estos ejemplos ilustran cómo la plataforma genera respuestas contextualmente coherentes en los distintos escenarios evaluados, incluyendo casos que implican información clínica más compleja.

La arquitectura multiagente distribuye las tareas de procesamiento entre módulos especializados responsables de funciones complementarias dentro del flujo de trabajo. Esta organización reduce la dependencia de un único modelo de lenguaje y permite múltiples etapas de procesamiento de información y verificación de resultados, lo cual es consistente con los enfoques multiagente recientes reportados en la literatura21,22. Figura 5 resume la distribución de los resultados de evaluación obtenidos con las diferentes estrategias de indicación y modelos de lenguaje considerados en este estudio.

Gráficos de violín que comparan indicaciones motivacionales, métodos: Pearson, MAI, CE M/F; análisis educativo.
Figura 5: Distribución del rendimiento del sistema propuesto en diferentes estrategias de indicación y modelos de lenguaje. (A–F) Los gráficos de violín ilustran las variaciones en la calidad de las respuestas para enfoques de indicación corta, sin ejemplos (zero-shot) y con pocos ejemplos (few-shot), utilizando los modelos LLaMA3, LLaMA3.1 y Mixtral. Los resultados destacan el impacto del diseño de las indicaciones en la consistencia y el rendimiento de las salidas, demostrando que las estrategias estructuradas de indicación tienden a producir respuestas más estables y precisas en tareas clínicas. Haga clic aquí para ver una versión más grande de esta figura.

Los resultados de la evaluación son coherentes con estudios recientes que abogan por combinar métricas léxicas y semánticas para evaluar el desempeño de modelos grandes de lenguaje4,12. En particular, las métricas basadas en incrustaciones (embedding) se han vuelto cada vez más importantes para capturar la similitud contextual en la generación de lenguaje relacionado con la atención médica, donde la interpretación semántica va más allá del emparejamiento léxico28,29.

En general, la evaluación indica que la plataforma propuesta integra estándares de interoperabilidad, generación aumentada por recuperación (RAG) y procesamiento multiagente dentro de un marco unificado para el análisis de datos en el ámbito sanitario. Los resultados cuantitativos y cualitativos presentados en este estudio respaldan la viabilidad del flujo de trabajo propuesto bajo las condiciones experimentales evaluadas y proporcionan una base para futuras validaciones en entornos clínicos del mundo real.

DISPONIBILIDAD DE LOS DATOS

Los conjuntos de datos utilizados en este estudio están disponibles públicamente. El conjunto de datos de radiografías de tórax se obtuvo de la Colección de Radiografías de Tórax de la Universidad de Indiana (Open-i, Biblioteca Nacional de Medicina de EE. UU.), que incluye los archivos indiana_reports.csv e indiana_projections.csv, disponibles en https://openi.nlm.nih.gov/. El conjunto de datos de referencia MedQA está disponible públicamente a través de su repositorio oficial. En este estudio no se utilizaron datos clínicos propietarios ni identificables de pacientes. Todos los procedimientos de preprocesamiento se describen en la sección Protocolo para favorecer la reproducibilidad.

Discusión

La evaluación presentada en este estudio representa una validación metodológica realizada utilizando conjuntos de datos de referencia en salud disponibles públicamente y completamente anonimizados. No se llevó a cabo ninguna validación clínica prospectiva que involucrara a profesionales de la salud ni reclutamiento de pacientes, ya que el objetivo de este trabajo es demostrar un protocolo de implementación reproducible y no su eficacia clínica.

Los hallazgos de este estudio sugieren que combinar estándares de interoperabilidad en salud con modelos de lenguaje grandes proporciona un marco práctico para integrar información clínica heterogénea. La arquitectura propuesta reúne mecanismos de intercambio de datos estructurados, incluidos FHIR y HL7, con procesamiento del lenguaje basado en inteligencia artificial en un flujo de trabajo unificado que es coherente con los avances actuales en los sistemas de salud digital15,16,17.

Un aspecto importante del flujo de trabajo propuesto es la integración de la generación aumentada por recuperación (RAG) dentro de una arquitectura de múltiples agentes. En esta configuración, los documentos recuperados proporcionan información contextual adicional durante la generación de respuestas, apoyando tareas clínicas intensivas en conocimiento. Este diseño arquitectónico es coherente con estudios recientes que describen los mecanismos basados en recuperación como una estrategia para mejorar el anclaje contextual y la fiabilidad de las respuestas en aplicaciones de modelos grandes de lenguaje18,19.

Se incorporaron estrategias de formulación estructurada en el flujo de trabajo propuesto para apoyar la interpretación contextual durante la generación de respuestas. Estudios previos han reportado que la ingeniería de indicaciones y las técnicas de razonamiento estructurado pueden mejorar el desempeño de los modelos de lenguaje grandes en tareas complejas de toma de decisiones20. El enfoque adoptado en este protocolo es coherente con estos avances y proporciona un marco estructurado para el procesamiento del lenguaje clínico.

Desde una perspectiva de evaluación, el uso de métricas complementarias permitió examinar diferentes dimensiones del rendimiento del sistema. Mientras que BLEU y ROUGE proporcionan información sobre la similitud sintáctica y la cobertura del contenido23,24, métricas basadas en incrustaciones como BERTScore capturan relaciones semánticas que podrían no reflejarse únicamente mediante la superposición léxica25. Esta estrategia de evaluación multidimensional es coherente con estudios recientes de referencia que recomiendan combinar medidas léxicas y semánticas al evaluar modelos grandes de lenguaje en aplicaciones de atención médica4,12.

El flujo de trabajo propuesto ofrece un marco metodológico reproducible para implementar sistemas interoperables de apoyo a la toma de decisiones clínicas basados en inteligencia artificial. En lugar de comparar diferentes arquitecturas de inteligencia artificial, este estudio se centra en documentar el flujo de trabajo completo de implementación, la arquitectura del sistema, los mecanismos de interoperabilidad y la metodología de evaluación, con el fin de facilitar la reproductibilidad y la adopción futura. Los análisis comparativos que involucran modelos convencionales de lenguaje grande (LLM), configuraciones sin RAG, modelos ajustados finamente o enfoques tradicionales de aprendizaje automático quedan fuera del alcance de esta contribución metodológica y representan una dirección importante para investigaciones futuras.

La futura traducción del marco propuesto a entornos clínicos del mundo real requerirá una validación adicional con profesionales de la salud, así como el cumplimiento de los requisitos regulatorios y éticos aplicables. Dependiendo del uso previsto, dichos sistemas podrían estar sujetos a las regulaciones de Software como Dispositivo Médico (SaMD) y deberían cumplir con los requisitos establecidos por las autoridades regulatorias, incluida la Administración de Alimentos y Medicamentos de los Estados Unidos (FDA) y el Reglamento Europeo de Dispositivos Médicos (MDR). Además, prácticas sólidas de gobernanza de datos, ciberseguridad, transparencia y seguridad clínica serán esenciales para apoyar una implementación segura y responsable en entornos de atención médica.

El análisis cualitativo complementó la evaluación cuantitativa al ilustrar las características de las respuestas generadas en diversos escenarios clínicos representativos. Los ejemplos presentados indican que la plataforma fue capaz de producir respuestas contextualmente coherentes bajo las condiciones evaluadas, aportando una visión adicional sobre la interpretabilidad de las respuestas más allá de las métricas cuantitativas. Se han reportado observaciones similares en estudios que aplican modelos de lenguaje grandes a aplicaciones clínicas, incluyendo asistencia diagnóstica e interacción con pacientes28,29,30,31.

La arquitectura propuesta distribuye las tareas de procesamiento entre módulos especializados responsables de funciones complementarias, incluyendo validación de datos, filtrado contextual, apoyo al razonamiento clínico y verificación de resultados. Esta organización modular reduce la dependencia de un único modelo de lenguaje y permite etapas sucesivas de procesamiento de información dentro del flujo de trabajo. Estrategias arquitectónicas similares han sido descritas en estudios recientes sobre sistemas de inteligencia artificial distribuidos y marcos multiagente diseñados para entornos de toma de decisiones complejos21,22.

Varias consideraciones de implementación pueden facilitar la reproducibilidad y el despliegue del protocolo propuesto. La asignación coherente de información clínica al estándar HL7 FHIR ayuda a preservar la interoperabilidad semántica a lo largo de todo el proceso de procesamiento de datos. De manera similar, el preprocesamiento de documentos, las estrategias de fragmentación, la generación de incrustaciones y el indexado vectorial influyen en el comportamiento del flujo de trabajo de Generación Aumentada por Recuperación y deben configurarse y validarse según las características de la aplicación objetivo. La ingeniería de indicaciones y la orquestación multiagente también pueden refinarse de forma iterativa mediante conocimientos específicos del dominio y retroalimentación de expertos para mejorar el anclaje contextual durante la generación de respuestas. Estas prácticas de implementación son coherentes con los avances recientes en inteligencia artificial confiable y modelos de lenguaje mejorados por recuperación18,19,20.

Se deben reconocer algunas limitaciones de este estudio. Aunque la evaluación combinó métricas cuantitativas y cualitativas complementarias, estas medidas podrían no capturar completamente todos los aspectos del razonamiento clínico. Esta observación es consistente con estudios previos que recomiendan marcos de evaluación específicos del dominio para aplicaciones en el ámbito sanitario12. Además, la plataforma fue evaluada bajo condiciones controladas utilizando conjuntos de datos de referencia públicos y anonimizados, que podrían no representar plenamente la variabilidad y complejidad de los entornos clínicos del mundo real.

La plataforma propuesta se desarrolló de acuerdo con los estándares establecidos de interoperabilidad en el sector salud. La adopción de HL7 y FHIR facilita el intercambio estructurado de datos entre sistemas heterogéneos de información sanitaria, proporcionando un marco estandarizado para integrar información clínica procedente de múltiples fuentes. Este enfoque arquitectónico es coherente con los esfuerzos actuales por desarrollar sistemas de inteligencia artificial interoperables para entornos sanitarios distribuidos15,16,17.

La implementación exitosa del flujo de trabajo propuesto depende de varios pasos metodológicos críticos. Primero, los datos clínicos deben asignarse de manera consistente a recursos estandarizados HL7 FHIR para preservar la interoperabilidad semántica entre sistemas sanitarios heterogéneos15,17. Segundo, el preprocesamiento de documentos, incluyendo la normalización, la estrategia de fragmentación y la generación de incrustaciones (embeddings), debe configurarse cuidadosamente porque estas etapas influyen directamente en la calidad de recuperación dentro de la canalización de Generación Aumentada por Recuperación (RAG, por sus siglas en inglés)19,32,33. Tercero, la base de datos vectorial debe reconstruirse cada vez que se actualice la base de conocimiento, para mantener la coherencia entre los documentos indexados y los resultados de recuperación. Finalmente, la ingeniería de indicaciones (prompt engineering) y la orquestación multiagente deben validarse de forma iterativa utilizando escenarios clínicos representativos para mejorar la precisión contextual, minimizar las alucinaciones y potenciar la reproducibilidad de los flujos de trabajo de apoyo a la toma de decisiones clínicas asistidos por inteligencia artificial4,3,20,31.

Desde una perspectiva de solución de problemas, los desafíos comunes de implementación incluyen una asignación incompleta de recursos FHIR, un rendimiento reducido de recuperación asociado al indexado de documentos o a la configuración de la base de datos vectorial, y respuestas afectadas por información contextual insuficiente o una ingeniería de indicaciones subóptima. Estos problemas pueden abordarse mediante la validación de recursos de interoperabilidad, la optimización de los parámetros de recuperación, la actualización periódica o la reconstrucción de la base de datos vectorial tras modificaciones en la base de conocimientos, y la evaluación continua utilizando métricas léxicas y semánticas complementarias. Estas prácticas favorecen un comportamiento consistente del sistema y facilitan la implementación y el mantenimiento de flujos de trabajo asistidos por inteligencia artificial para el apoyo a la toma de decisiones clínicas4,12,25,23..

Desde una perspectiva práctica, la implementación de modelos de lenguaje grandes en entornos sanitarios requiere considerar los recursos computacionales y los requisitos de infraestructura. Aunque la arquitectura propuesta admite ejecución tanto en la nube como local, pueden ser necesarias estrategias adicionales de optimización según la escala de implementación y los recursos computacionales disponibles, particularmente en entornos con recursos limitados4.

La investigación futura podría ampliar el flujo de trabajo propuesto evaluando la plataforma con conjuntos de datos clínicos del mundo real y flujos de trabajo habituales en la atención sanitaria. Asimismo, podrían realizarse investigaciones adicionales para explorar estrategias de ajuste fino específicas del dominio y la integración de métodos de inteligencia artificial interpretables, con el fin de mejorar la interpretabilidad del modelo y apoyar la transparencia durante la asistencia a la toma de decisiones clínicas. Estas líneas de trabajo podrían contribuir a una evaluación más amplia de la plataforma en entornos prácticos de atención sanitaria.

En general, este trabajo presenta un marco reproducible para integrar estándares de interoperabilidad en atención médica, generación aumentada por recuperación (RAG) y arquitecturas de modelos de lenguaje multiagente dentro de un flujo de trabajo unificado para el procesamiento de datos clínicos. El protocolo propuesto ofrece un enfoque estructurado para implementar y evaluar sistemas de análisis de datos médicos asistidos por inteligencia artificial y puede servir como referencia para futuros avances en sistemas de apoyo a la toma de decisiones clínicas interoperables.

Divulgaciones

Los autores declaran que no tienen intereses financieros competitivos ni relaciones personales que pudieran haber influido en el trabajo reportado en este manuscrito. Las herramientas de inteligencia artificial generativa (AI) se utilizaron exclusivamente para ayudar con la edición del lenguaje, la corrección gramatical y las mejoras en la legibilidad del manuscrito. Todo el contenido científico, el diseño del estudio, la metodología, el análisis de datos, la interpretación de los resultados y las decisiones editoriales fueron desarrollados, verificados y aprobados por los autores, quienes asumen la responsabilidad total sobre el contenido de este manuscrito.

Agradecimientos

Los autores desean agradecer al Laboratorio de Sistemas Embebidos y Distribuidos (LESC), de la Universidad Federal de Ceará (UFC), por proporcionar el entorno de investigación y las discusiones técnicas que apoyaron el desarrollo de este trabajo. Los autores también agradecen a los desarrolladores y mantenedores del software de código abierto, los estándares de interoperabilidad y los conjuntos de datos de acceso público utilizados a lo largo de este estudio.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
FAISSMeta Platforms Inc.Version 1.8.0Base de datos vectorial utilizada para la búsqueda de similitud en la canalización de Generación Aumentada por Recuperación (RAG).
Estándar FHIRHL7 InternationalRelease 4 (R4)Estándar de interoperabilidad sanitaria adoptado para el intercambio estructurado de datos clínicos.
FlaskPallets ProjectsVersion 3.0.3Framework web de Python utilizado para implementar la API backend RESTful.
Estándar HL7HL7 InternationalVersion 2.xProtocolo de mensajería heredado utilizado para la interoperabilidad con sistemas de información hospitalarios.
API REST HTTPImplementación personalizadaN/ACapa de comunicación RESTful entre el frontend, backend, base de datos y servicios de inteligencia artificial.
LangChainLangChain Inc.Version 0.3.xFramework utilizado para integrar modelos de lenguaje grandes (LLM), ingeniería de indicaciones y flujos de trabajo de Generación Aumentada por Recuperación.
LangGraphLangChain Inc.Version 0.2.xFramework utilizado para coordinar el flujo de trabajo de razonamiento clínico multiagente.
LLaMA 3.1 8B InstructMeta Platforms Inc.Version 3.1Modelo de lenguaje grande empleado para razonamiento clínico y generación de lenguaje natural.
MySQL Community ServerOracle CorporationVersion 8.0Base de datos relacional utilizada para almacenar datos clínicos estructurados.
OllamaOllama Inc.Version 0.9.xMotor de inferencia local utilizado para ejecutar modelos de lenguaje grandes preservando la privacidad del paciente.
PythonPython Software FoundationVersion 3.11Lenguaje de programación utilizado para implementar la plataforma completa.
PyTorchLinux FoundationVersion 2.4Framework de aprendizaje profundo utilizado para la inferencia de modelos de lenguaje grandes.
Canalización de Generación Aumentada por Recuperación (RAG)Implementación personalizadaN/AFramework de inteligencia artificial que combina recuperación semántica con inferencia de modelos de lenguaje grandes para la generación de respuestas con contexto.
Sentence TransformersHugging Face Inc.all-MiniLM-L6-v2Modelo de incrustación utilizado para generar representaciones vectoriales densas para la recuperación semántica de documentos.
Ubuntu LinuxCanonical Ltd.Version 24.04 LTSSistema operativo utilizado para el desarrollo y la evaluación experimental.
Visual Studio CodeMicrosoft CorporationVersion 1.100Entorno de desarrollo integrado utilizado para la implementación y depuración del software.

Referencias

  1. Chukwu E, Garg L. A systematic review of blockchain in healthcare: frameworks, prototypes, and implementations. IEEE Access. 2020;8:21196-21214. doi:10.1109/ACCESS.2020.2969881.
  2. Al-Nbhany WANA, Zahary AT, Al-Shargabi AA. Blockchain-IoT healthcare applications and trends: a review. IEEE Access. 2024;12:4178-4212. doi:10.1109/ACCESS.2023.3349187.
  3. Tan Y, et al. MedChatZH: a Chinese medical large language model. Comput Biol Med. 2024;172:108290.
  4. OLLAMA TEAM. Ollama: Run Large Language Models locally. Version 0.x. San Francisco: Ollama, 2024.
  5. Jahan I, Laskar MTR, Peng C, Huang JX. A comprehensive evaluation of large language models on benchmark biomedical text processing tasks. Comput Biol Med. 2024;171:108189. doi:10.1016/j.compbiomed.2024.108189.
  6. Liu X, Zhou Y, Wang Z, et al. Disease topic modeling of users' inquiry texts: a text mining-based PQDR-LDA model for analyzing the online medical records. IEEE Trans Eng Manag. 2023.
  7. Taylor N, Kormilitzin A, Lorge I, Nevado-Holgado A, Cipriani A, Joyce DW. Model development for bespoke large language models for digital triage assistance in mental health care. Artif Intell Med. 2024;157:102988.
  8. Song M, et al. PneumoLLM: a large language vision model for pneumonia diagnosis. Med Image Anal. 2024;97:103248.
  9. Chien SC, Yen CM, Chang YH, Chen YE, Liu CC, Hsiao YP, et al. Using large language model (LLM) to identify high-burden informal caregivers in long-term care. Comput Methods Programs Biomed. 2024;255:108329. doi:10.1016/j.cmpb.2024.108329.
  10. Xue X, Zhang D, Sun C, et al. Xiaoqing: a Q&A model for glaucoma based on LLMs. Comput Biol Med. 2024;174:108399.
  11. Wu D, Nie L, Mumtaz RA, Agarwal K. A LLM-based hybrid-transformer diagnosis system in healthcare. IEEE J Biomed Health Inform. 2024.
  12. Zhang Y, et al. LLM-enhanced multi-teacher knowledge distillation for modality-incomplete emotion recognition in daily healthcare. IEEE J Biomed Health Inform. 2024.
  13. Sarzaeim P, Mahmoud QH, Azim A. A framework for LLM-assisted smart policing system. IEEE Access. 2024;12:74915-74929. doi:10.1109/ACCESS.2024.3404862.
  14. Leme RS, Blank M. Lei Geral de Proteção de Dados e segurança da informação na área da saúde. Cad Ibero-Am Direito Sanit. 2020;9(3):210-224. doi:10.17566/ciads.v9i3.690.
  15. Zaganelli MV, Binda Filho DL. O sigilo médico e os dados sensíveis na telemedicina à luz da Lei Geral de Proteção de Dados. RECIIS. 2023;17(3):729-740. doi:10.29397/reciis.v17i3.3689.
  16. Tabari P, Costagliola G, De Rosa M, Boeker M. State-of-the-art Fast Healthcare Interoperability Resources (FHIR)-based data model and structure implementations: systematic scoping review. JMIR Med Inform. 2024.
  17. Martinez T, et al. HL7 systems and interoperability ecosystems in modern healthcare. IEEE Rev Biomed Eng. 2024.
  18. Chen L, et al. HL7 integration and semantic interoperability in distributed healthcare networks. IEEE J Biomed Health Inform. 2024.
  19. Liu W, Li W, Huang W, Gao Y. Security framework for medical data sharing. Telemed E-Health. 2024.
  20. Basile LJ, Carbonara N, Panniello U, Pellegrino R. How can technological resources improve the quality of healthcare service? IEEE Trans Eng Manag. 2024;71:5771-5781. doi:10.1109/TEM.2022.3192405.
  21. Singh A, et al. Prompt engineering in large language models: a survey using SWOT analysis [preprint]. arXiv. 2024
  22. Chen L, Chen Y, Liang W, Li X, Li KC, Wang J, Xiong N. MASS: a multiattribute sketch secure data sharing scheme for IoT wearable medical devices based on blockchain. IEEE Internet Things J. 2025;12(2):1990-2001. doi:10.1109/JIOT.2024.3468733.
  23. Autoridade Nacional de Proteção de Dados (BR). Diretrizes para agentes de tratamento de pequeno porte. Brasília (DF): ANPD; 2021.
  24. Patel R, Kim H. Interoperability in EHR. IEEE Transactions on Biomedical Engineering, v. 70, n. 8, p. 2341-2354, ago. 2023. DOI: 10.1109/TBME.2023.3241567.
  25. Zhang T, Kishore V, Wu F, Weinberger KQ, Artzi Y. BERTScore: evaluating text generation with BERT. In: International Conference on Learning Representations (ICLR); 2020.
  26. Chen X, Lu X, Li Q, Li D, Zhu F. Integration of LLM and Human-AI Coordination for Power Dispatching With Connected Electric Vehicles Under SAGVNs. IEEE Trans Veh Technol. 2025;74(2):1992-2002. doi:10.1109/TVT.2024.3434969
  27. Zhou S, Chen C, Gu HH. Testing and evaluating SNOMED CT web browsers' textual search feature. In: Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM); 2019.
  28. McPeak G, Sautmann A, George O, Hallal A, Simal EA, Schwartz AL, Abaluck J, Ravi N, Pless R. An LLM's medical testing recommendations in a Nigerian clinic: potential and limits of prompt engineering for clinical decision support. In: Proceedings of the 2024 IEEE 12th International Conference on Healthcare Informatics (ICHI); 2024.
  29. LLAMA TEAM, AI @ META. The Llama 3 Herd of Models. arXiv preprint arXiv:2407.21783, 2024. Disponível em: https://arxiv.org/abs/2407.21783.
  30. Conselho Nacional de Saúde (BR). Resolução nº 466, de 12 de dezembro de 2012. Aprova as diretrizes e normas regulamentadoras de pesquisas envolvendo seres humanos. Brasília (DF): Ministério da Saúde; 2012.
  31. Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620:172-180. doi:10.1038/s41586-023-06291-2.
  32. Sahoo P, et al. A systematic survey of prompt engineering in large language models [preprint]. arXiv. 2024. Available from: https://arxiv.org/abs/2402.07927
  33. Yan Y, Hou Y, Xiao Y, Zhang R, Wang Q. KNOWNET: guided health information seeking from LLMs via knowledge graph integration. IEEE Trans Vis Comput Graph. 2024.

Reimpresiones y permisos

Etiquetas

Integración de FHIRGeneración Aumentada por RecuperaciónRazonamiento MultiagenteBase de Datos VectorialInteroperabilidad SemánticaIngeniería de Prompts