Este estudio no implicó la reclutación de participantes humanos, el acceso a registros de pacientes identificables ni experimentos con animales. El protocolo se desarrolló y evaluó exclusivamente utilizando conjuntos de datos disponibles públicamente y completamente anonimizados para la validación metodológica. No se accedió ni procesó ninguna información personal de salud. Por lo tanto, no se requirió la aprobación de una Junta de Revisión Institucional (IRB) ni de un Comité de Ética en Investigación. El protocolo se desarrolló de acuerdo con los principios aplicables de protección de datos, incluida la Ley General de Protección de Datos de Brasil (LGPD), para apoyar aplicaciones futuras que involucren datos clínicos.
Selección y preprocesamiento del conjunto de datos
El protocolo propuesto se evaluó utilizando conjuntos de datos clínicos de acceso público y completamente anonimizados, que incluyen registros electrónicos de salud estructurados (EHR), datos de respuestas a preguntas clínicas y conjuntos de datos de imágenes médicas para la validación metodológica. Antes de su integración en la plataforma, los conjuntos de datos pasaron por procedimientos estandarizados de preprocesamiento, incluyendo la normalización de datos, eliminación de registros inconsistentes o incompletos, mapeo a recursos HL7 FHIR, limpieza del texto, segmentación en fragmentos de recuperación y generación de incrustaciones para indexación vectorial. Estos pasos de preprocesamiento garantizaron la coherencia semántica entre fuentes de datos heterogéneas, facilitando la interoperabilidad y permitiendo la reproducibilidad del flujo de trabajo propuesto, al tiempo que se mantenía el cumplimiento con los principios aplicables de privacidad de datos.
Los conjuntos de datos se obtuvieron de repositorios de referencia públicos comúnmente utilizados en la investigación de inteligencia artificial y salud digital. Se seleccionaron para representar información clínica heterogénea, incluyendo registros electrónicos de salud (EHR) estructurados, narrativas clínicas no estructuradas, tareas de respuesta a preguntas clínicas y metadatos de imágenes médicas. En lugar de evaluar una cohorte clínica específica, el protocolo se centra en demostrar un flujo de trabajo de implementación reproducible que puede adaptarse a diferentes conjuntos de datos de atención médica. La diversidad de estos conjuntos de datos de referencia permite validar la canalización de interoperabilidad, la generación aumentada por recuperación (RAG) y el marco de razonamiento multiagente a través de múltiples modalidades de datos clínicos.
Configuración del entorno experimental
El entorno experimental se configuró para evaluar la plataforma interoperable bajo condiciones controladas y reproducibles. La arquitectura comprende módulos de ingesta de datos, capas de interoperabilidad, modelos lingüísticos grandes (LLMs) y componentes de evaluación organizados en una única canalización de procesamiento para el análisis de datos médicos. Figura 1 ilustra el flujo de trabajo completo, desde la ingesta de datos clínicos hasta la generación de resultados diagnósticos.

Figura 1: Flujo general del sistema que ilustra la tubería de procesamiento desde los datos clínicos brutos hasta la salida del estado de la enfermedad. El proceso comienza con la ingesta de Registros Electrónicos de Salud (EHR), seguida de filtrado y preprocesamiento de datos para extraer información sensible a enfermedades. Una etapa de diseño de indicaciones estructuradas integra conocimiento experto, definiciones de enfermedades e hiperparámetros, permitiendo una interacción eficaz con el Modelo de Lenguaje de Gran Tamaño (LLM). El LLM realiza inferencia de texto para generar respuestas contextualizadas, que posteriormente se evalúan mediante reglas clínicas para determinar el estado final de la enfermedad. El flujo de trabajo destaca la integración del preprocesamiento de datos, la formulación basada en conocimiento y la inferencia basada en inteligencia artificial para apoyar la toma de decisiones clínicas. Haga clic aquí para ver una versión más grande de esta figura.
Arquitectura de interoperabilidad en atención médica
La infraestructura de backend adopta una arquitectura modular basada en API RESTful para apoyar la comunicación entre los componentes de la plataforma (Figura 2). Esta arquitectura acomoda información clínica heterogénea, incluyendo registros electrónicos de salud (EHR) estructurados, notas médicas y metadatos derivados de sistemas de imágenes médicas. Dado que estos datos provienen de múltiples fuentes y formatos, la interoperabilidad se logra mediante modelos de datos estandarizados, particularmente el marco Fast Healthcare Interoperability Resources (FHIR)15,16,17.. La adopción de FHIR facilita el intercambio de información estructurada al tiempo que preserva la escalabilidad y flexibilidad en entornos clínicos distribuidos. También se incorporaron mecanismos de comunicación basados en HL7 para facilitar la integración con sistemas clínicos heredados, que aún se utilizan ampliamente en instituciones sanitarias16,17.

Figura 2: Arquitectura del sistema de la plataforma interoperable propuesta. La interfaz web se comunica con el backend mediante una API Flask utilizando solicitudes HTTP POST/GET. La API gestiona el enrutamiento, el procesamiento de consultas y la interacción con fuentes de datos estructurados y no estructurados. Una base de datos MySQL almacena datos clínicos estructurados, mientras que un almacén vectorial basado en FAISS permite búsquedas de similitud para operaciones de recuperación. La canalización basada en LLaMA procesa entradas de texto y genera respuestas utilizando representaciones vectoriales, posibilitando la generación aumentada por recuperación (Retrieval-Augmented Generation, RAG). La arquitectura destaca la integración de servicios web, gestión de bases de datos, recuperación vectorial e inferencia de modelos de lenguaje grandes en un sistema unificado. Haga clic aquí para ver una versión ampliada de esta figura.
Configuración del flujo de trabajo multiagente
La arquitectura multiagente se organiza en agentes funcionales especializados, responsables de etapas distintas del flujo de trabajo. Un agente de preprocesamiento realiza la normalización de datos y la asignación FHIR, seguido por un agente de recuperación encargado de la búsqueda semántica dentro de la base de datos vectorial. Un agente de razonamiento integra el contexto recuperado con el LLM para generar respuestas, mientras que un agente de validación verifica la coherencia y el formato de la salida antes de que se devuelva la respuesta final. La coordinación entre agentes sigue una estrategia de orquestación secuencial en la que la salida de cada agente sirve como entrada para la etapa siguiente, asegurando una implementación reproducible y modular.
Integración de datos clínicos
La capa de integración de datos agrega información de múltiples fuentes clínicas y la prepara para el procesamiento posterior. El preprocesamiento incluye la normalización de datos, la tokenización y el alineamiento de entidades para mejorar la coherencia semántica entre conjuntos de datos heterogéneos. Dado que la información clínica varía en estructura y calidad, estas operaciones ayudan a reducir el ruido y facilitan la interacción con modelos de inteligencia artificial. También se aplicaron estrategias de mapeo estructurado para armonizar diferentes formatos de datos y mantener la compatibilidad con la canalización de procesamiento, como se ilustra en Figura 315,16,17.

Figura 3: Ejemplo detallado del proceso de razonamiento clínico multiagente. La figura ilustra cómo se analiza una consulta clínica mediante múltiples etapas, incluyendo la evaluación de complejidad, el reclutamiento de especialistas, la discusión colaborativa y la toma final de decisiones. Este proceso demuestra la capacidad del sistema para adaptar dinámicamente las estrategias de razonamiento según la complejidad de la consulta, mejorando tanto la eficiencia como la precisión diagnóstica en escenarios de apoyo a la toma de decisiones clínicas. Haga clic aquí para ver una versión más grande de esta figura.
Configurar la canalización de generación aumentada por recuperación
Se incorpora la generación aumentada por recuperación (Retrieval-Augmented Generation, RAG) para proporcionar un análisis consciente del contexto, combinando la recuperación de información con las capacidades generativas de los modelos grandes de lenguaje. Las consultas del usuario se convierten en representaciones vectoriales mediante modelos de incrustación y se comparan con la base de datos vectorial utilizando una búsqueda semántica por similitud para recuperar los pasajes contextuales más relevantes. Los documentos recuperados se combinan luego con la consulta original antes de la inferencia por parte del modelo grande de lenguaje (LLM). Esta estrategia ayuda a proporcionar información contextual durante la generación de respuestas y se ha asociado con una mayor consistencia factual y una reducción de las alucinaciones en aplicaciones intensivas en conocimiento, incluida la atención sanitaria18,19. Figura 1 y Figura 3 ilustran el flujo de trabajo general de recuperación y el proceso de razonamiento correspondiente.
Para cada solicitud del usuario, el prompt final se construye dinámicamente combinando la consulta original con los pasajes contextuales más relevantes recuperados de la base de datos vectorial. La información recuperada se incorpora como evidencia contextual antes de la inferencia, lo que permite que el modelo de lenguaje genere respuestas basadas en el conocimiento sanitario recuperado, preservando la coherencia semántica y reduciendo las generaciones infundadas.
Ingeniería de indicaciones y razonamiento multiagente
El protocolo incorpora estrategias de estimulación estructurada para mejorar la interpretación contextual durante la generación de respuestas. Estas técnicas de estimulación, junto con mecanismos de inferencia avanzados, ayudan a guiar el proceso de razonamiento en escenarios clínicos complejos y son coherentes con los avances recientes reportados en la literatura20.
La arquitectura incluye un marco multiagente compuesto por módulos especializados que realizan funciones distintas dentro de la tubería de procesamiento, incluyendo validación de datos, filtrado de contexto, apoyo al razonamiento clínico y verificación de resultados. La organización modular permite que las tareas se ejecuten secuencialmente o en paralelo, lo que proporciona flexibilidad para diferentes requisitos de procesamiento (Figura 4). Distribuir estas actividades entre múltiples agentes reduce la dependencia de un único modelo de lenguaje y favorece un flujo de trabajo de procesamiento más robusto. Esta estrategia arquitectónica es coherente con los avances recientes en inteligencia artificial distribuida y diseño de sistemas inteligentes21,22.

Figura 4: Marco de decisión multiagente para el razonamiento clínico. El proceso comienza con una consulta del usuario, que es evaluada por un agente verificador encargado de determinar la complejidad de la consulta. En los casos complejos, el sistema recluta dinámicamente un equipo multidisciplinario (MDT) compuesto por agentes especializados, que llevan a cabo rondas iterativas de discusión para analizar el problema y sintetizar conocimientos antes de producir una decisión final. En los casos más simples, la consulta es gestionada por un agente de clínica primaria (PCC), lo que permite generar respuestas más rápidamente. Esta arquitectura adaptable equilibra eficiencia y profundidad analítica, mejorando la calidad de las decisiones y la escalabilidad del sistema en aplicaciones sanitarias. Haga clic aquí para ver una versión ampliada de esta figura.
Evaluación del rendimiento
El rendimiento del sistema se evaluó utilizando métricas complementarias que capturan tanto la calidad lingüística como la consistencia semántica de las salidas generadas. Se aplicó BLEU para medir la similitud sintáctica basada en la superposición de n-gramas23, mientras que ROUGE evaluó la recuperación y la cobertura del contenido, particularmente en tareas de resumen y extracción de información24. La similitud semántica se evaluó con BERTScore, que utiliza incrustaciones contextuales derivadas de modelos basados en transformadores para comparar los textos generados y los de referencia25. Los análisis adicionales incluyeron la perplejidad y la similitud del coseno para examinar la confianza del modelo y la coherencia semántica, respectivamente26,27.
Las métricas de evaluación seleccionadas ofrecen perspectivas complementarias sobre el rendimiento del sistema al combinar análisis léxicos y semánticos. Esta combinación es particularmente relevante en aplicaciones de atención médica, donde la interpretación contextual es tan importante como la similitud léxica. La plataforma fue evaluada en un entorno computacional controlado que permite tanto el despliegue en la nube como local. La ejecución local de los modelos lingüísticos grandes (LLM) se incluyó como una opción para cumplir con los requisitos de privacidad de los datos y reducir la dependencia de servicios externos al procesar información clínica sensible. Esta estrategia de despliegue es compatible con los marcos de protección de datos y puede adaptarse a diferentes entornos operativos4.