Este estudo não envolveu a recrutamento de participantes humanos, acesso a registros de pacientes identificáveis ou experimentos envolvendo animais. O protocolo foi desenvolvido e avaliado exclusivamente utilizando conjuntos de dados anonimizados e totalmente disponíveis publicamente para validação metodológica. Nenhuma informação de saúde pessoal foi acessada ou processada. Portanto, não foi necessária a aprovação por um Comitê de Ética em Pesquisa (IRB) ou Comitê de Ética em Pesquisa. O protocolo foi desenvolvido de acordo com os princípios aplicáveis de proteção de dados, incluindo a Lei Geral de Proteção de Dados Brasileira (LGPD), para apoiar aplicações futuras envolvendo dados clínicos.
Seleção e pré-processamento do conjunto de dados
O protocolo proposto foi avaliado utilizando conjuntos de dados clínicos de acesso público e totalmente anonimizados, compreendendo prontuários eletrônicos estruturados (EHRs), dados de respostas a perguntas clínicas e conjuntos de dados de imagens médicas para validação metodológica. Antes da integração na plataforma, os conjuntos de dados passaram por procedimentos padronizados de pré-processamento, incluindo normalização dos dados, remoção de registros inconsistentes ou incompletos, mapeamento para recursos HL7 FHIR, limpeza de texto, segmentação em blocos de recuperação e geração de incorporações para indexação vetorial. Essas etapas de pré-processamento garantiram consistência semântica entre fontes de dados heterogêneas, facilitando a interoperabilidade e permitindo a reprodutibilidade do fluxo de trabalho proposto, ao mesmo tempo em que mantiveram a conformidade com os princípios aplicáveis de privacidade de dados.
Os conjuntos de dados foram obtidos de repositórios de referência publicamente disponíveis, comumente utilizados em pesquisas de inteligência artificial e saúde digital. Eles foram selecionados para representar informações clínicas heterogêneas, incluindo prontuários eletrônicos estruturados (EHRs), narrativas clínicas não estruturadas, tarefas de resposta a perguntas clínicas e metadados de imagens médicas. Em vez de avaliar uma coorte clínica específica, o protocolo enfoca a demonstração de um fluxo de trabalho de implementação reproduzível, que pode ser adaptado a diferentes conjuntos de dados de saúde. A diversidade desses conjuntos de dados de referência permite a validação do pipeline de interoperabilidade, da Geração Reforçada por Recuperação (RAG) e do framework de raciocínio multiagente em múltiplas modalidades de dados clínicos.
Configuração do ambiente experimental
O ambiente experimental foi configurado para avaliar a plataforma interoperável em condições controladas e reprodutíveis. A arquitetura compreende módulos de ingestão de dados, camadas de interoperabilidade, modelos linguísticos grandes (LLMs) e componentes de avaliação organizados em um único pipeline de processamento para análise de dados médicos. Figura 1 ilustra o fluxo de trabalho completo, desde a ingestão de dados clínicos até a geração de saídas diagnósticas.

Figura 1: Fluxo geral do sistema ilustrando o pipeline de processamento desde os dados clínicos brutos até a saída do status da doença. O processo inicia com a ingestão de Prontuários Eletrônicos de Saúde (EHR), seguida por filtragem e pré-processamento dos dados para extrair informações sensíveis a doenças. Uma etapa de elaboração de prompts estruturados integra conhecimento especializado, definições de doenças e hiperparâmetros, permitindo uma interação eficaz com o Modelo de Linguagem de Grande Porte (LLM). O LLM realiza inferência textual para gerar respostas contextualizadas, que posteriormente são avaliadas por meio de regras clínicas para determinar o status final da doença. O fluxo de trabalho destaca a integração do pré-processamento de dados, uso de prompts baseados em conhecimento e inferência baseada em IA para apoiar a tomada de decisões clínicas. Clique aqui para visualizar uma versão maior desta figura.
Arquitetura de interoperabilidade em saúde
A infraestrutura de back-end adota uma arquitetura modular baseada em APIs RESTful para apoiar a comunicação entre os componentes da plataforma (Figura 2). Essa arquitetura acomoda informações clínicas heterogêneas, incluindo prontuários eletrônicos estruturados (EHRs), anotações médicas e metadados derivados de sistemas de imagem médica. Como esses dados provêm de múltiplas fontes e formatos, a interoperabilidade é alcançada por meio de modelos padronizados de dados, particularmente o framework Fast Healthcare Interoperability Resources (FHIR)15,16,17.. A adoção do FHIR favorece a troca de informações estruturadas, ao mesmo tempo que preserva escalabilidade e flexibilidade em ambientes clínicos distribuídos. Mecanismos de comunicação baseados no HL7 também foram incorporados para facilitar a integração com sistemas clínicos legados, que ainda são amplamente utilizados em instituições de saúde16,17.

Figura 2: Arquitetura do sistema da plataforma interoperável proposta. A interface web se comunica com o backend por meio de uma API Flask utilizando requisições HTTP POST/GET. A API gerencia roteamento, processamento de consultas e interação com fontes de dados estruturadas e não estruturadas. Um banco de dados MySQL armazena dados clínicos estruturados, enquanto um armazenamento vetorial baseado em FAISS suporta busca por similaridade para operações de recuperação. O pipeline baseado em LLaMA processa entradas textuais e gera respostas utilizando representações vetoriais, permitindo a Geração Reforçada por Recuperação (Retrieval-Augmented Generation – RAG). A arquitetura destaca a integração de serviços web, gerenciamento de banco de dados, recuperação vetorial e inferência de modelos de linguagem grandes em um sistema unificado. Clique aqui para visualizar uma versão maior desta figura.
Configuração do fluxo de trabalho com múltiplos agentes
A arquitetura multiagente é organizada em agentes funcionais especializados, responsáveis por estágios distintos do fluxo de trabalho. Um agente de pré-processamento realiza a normalização dos dados e o mapeamento FHIR, seguido por um agente de recuperação responsável pela busca semântica dentro do banco de dados vetorial. Um agente de raciocínio integra o contexto recuperado com o LLM para gerar respostas, enquanto um agente de validação verifica a consistência e a formatação da saída antes que a resposta final seja retornada. A coordenação dos agentes segue uma estratégia de orquestração sequencial na qual a saída de cada agente serve como entrada para a etapa subsequente, garantindo uma implementação reprodutível e modular.
Integração de dados clínicos
A camada de integração de dados agrega informações de múltiplas fontes clínicas e as prepara para o processamento posterior. O pré-processamento inclui normalização de dados, tokenização e alinhamento de entidades para melhorar a consistência semântica entre conjuntos de dados heterogêneos. Como as informações clínicas variam em estrutura e qualidade, essas operações ajudam a reduzir o ruído e facilitam a interação com modelos de IA. Estratégias de mapeamento estruturado também foram aplicadas para harmonizar diferentes formatos de dados e manter a compatibilidade com o pipeline de processamento, conforme ilustrado na Figura 315,16,17.

Figura 3: Exemplo detalhado do processo de raciocínio clínico com múltiplos agentes. A figura ilustra como uma consulta clínica é analisada por meio de múltiplas etapas, incluindo avaliação da complexidade, recrutamento de especialistas, discussão colaborativa e tomada final de decisão. Esse processo demonstra a capacidade do sistema de adaptar dinamicamente as estratégias de raciocínio com base na complexidade da consulta, melhorando tanto a eficiência quanto a precisão diagnóstica em cenários de suporte à decisão clínica. Clique aqui para visualizar uma versão maior desta figura.
Configurar o pipeline de geração aumentada por recuperação
A Geração Reforçada por Recuperação (Retrieval-Augmented Generation, RAG) é incorporada para fornecer uma análise com consciência de contexto, combinando recuperação de informações com as capacidades gerativas de modelos linguísticos grandes. As consultas do usuário são convertidas em representações vetoriais usando modelos de incorporação e comparadas com a base de dados vetorial por meio de busca semântica de similaridade para recuperar os trechos contextuais mais relevantes. Os documentos recuperados são então combinados com a consulta original antes da inferência pelo modelo linguístico grande (LLM). Essa estratégia ajuda a fornecer informações contextuais durante a geração da resposta e tem sido associada a uma maior consistência factual e redução de alucinações em aplicações intensivas em conhecimento, incluindo a área da saúde18,19. Figura 1 e Figura 3 ilustram o fluxo de trabalho geral de recuperação e o processo de raciocínio correspondente.
Para cada solicitação do usuário, o prompt final é construído dinamicamente combinando a consulta original com os trechos contextuais mais relevantes recuperados do banco de dados vetorial. As informações recuperadas são incorporadas como evidência contextual antes da inferência, permitindo que o modelo de linguagem gere respostas baseadas no conhecimento médico recuperado, preservando a consistência semântica e reduzindo gerações não suportadas.
Engenharia de prompts e raciocínio multiagente
O protocolo incorpora estratégias de estímulo estruturado para melhorar a interpretação contextual durante a geração de respostas. Essas técnicas de estímulo, juntamente com mecanismos avançados de inferência, ajudam a orientar o processo de raciocínio em cenários clínicos complexos e são compatíveis com os avanços recentes relatados na literatura20.
A arquitetura inclui um framework multiagente composto por módulos especializados que executam funções distintas dentro do pipeline de processamento, incluindo validação de dados, filtragem de contexto, suporte ao raciocínio clínico e verificação da saída. A organização modular permite que as tarefas sejam executadas sequencialmente ou em paralelo, proporcionando flexibilidade para diferentes requisitos de processamento (Figura 4). A distribuição dessas atividades entre múltiplos agentes reduz a dependência de um único modelo de linguagem e favorece um fluxo de trabalho de processamento mais robusto. Essa estratégia arquitetônica está alinhada com os avanços recentes em inteligência artificial distribuída e no design de sistemas inteligentes21,22.

Figura 4: Estrutura de decisão com múltiplos agentes para raciocínio clínico. O processo inicia-se com uma consulta do usuário, que é avaliada por um agente verificador responsável por determinar a complexidade da consulta. Em casos complexos, o sistema recruta dinamicamente uma equipe multidisciplinar (EMD) composta por agentes especializados, que realizam rodadas iterativas de discussão para analisar o problema e sintetizar conhecimento antes de produzir uma decisão final. Em casos mais simples, a consulta é tratada por um agente clínico de atenção primária (CAP), permitindo uma resposta mais rápida. Essa arquitetura adaptativa equilibra eficiência e profundidade analítica, melhorando a qualidade das decisões e a escalabilidade do sistema em aplicações na área da saúde. Clique aqui para visualizar uma versão maior desta figura.
Avaliação de desempenho
O desempenho do sistema foi avaliado utilizando métricas complementares que capturam tanto a qualidade linguística quanto a consistência semântica das saídas geradas. O BLEU foi aplicado para medir a similaridade sintática com base na sobreposição de n-gramas23, enquanto o ROUGE avaliou a revocação e a cobertura de conteúdo, especialmente em tarefas de sumarização e extração de informações24. A similaridade semântica foi avaliada com o BERTScore, que utiliza incorporações contextuais derivadas de modelos baseados em transformadores para comparar textos gerados e textos de referência25. Análises adicionais incluíram perplexidade e similaridade do cosseno para examinar, respectivamente, a confiança do modelo e a coerência semântica26,27.
As métricas de avaliação selecionadas fornecem perspectivas complementares sobre o desempenho do sistema, combinando análises léxicas e semânticas. Essa combinação é particularmente relevante em aplicações na área da saúde, onde a interpretação contextual é tão importante quanto a similaridade léxica. A plataforma foi avaliada em um ambiente computacional controlado que suporta implantação baseada em nuvem e local. A execução local de LLMs foi incluída como uma opção para atender aos requisitos de privacidade de dados e reduzir a dependência de serviços externos ao processar informações clínicas sensíveis. Essa estratégia de implantação é compatível com as normas de proteção de dados e pode ser adaptada a diferentes ambientes operacionais4.