Artigo de investigação

Plataforma Web Interoperável Baseada em Modelos de Linguagem de Grande Escala para Análise de Dados Médicos: Um Protocolo para Suporte à Decisão Clínica

49 visualizações

DOI:

10.3791/72085

25 de agosto de 2026

Neste artigo

Resumo

Este protocolo descreve a implementação de uma plataforma web interoperável que integra dados clínicos baseados em FHIR com Geração Reforçada por Recuperação e modelos linguísticos grandes multiagentes para suporte à decisão clínica. O fluxo de trabalho permite a implantação reprodutível, integração padronizada de dados e avaliação da análise de dados médicos assistida por inteligência artificial (AI).

Resumo

A tomada de decisões clínicas é frequentemente dificultada por registros eletrônicos de saúde fragmentados e interoperabilidade limitada entre sistemas heterogêneos de informação em saúde. Este artigo apresenta um protocolo passo a passo para a implementação de uma plataforma web interoperável que integra dados clínicos por meio do padrão Fast Healthcare Interoperability Resources (FHIR), juntamente com Geração Aumentada por Recuperação (RAG), Modelos de Linguagem de Grande Porte (LLMs) e um framework de raciocínio clínico baseado em múltiplos agentes, para apoiar a análise de dados médicos e o suporte à decisão clínica. O protocolo descreve todo o fluxo de trabalho, incluindo a configuração do ambiente computacional, pré-processamento de conjuntos de dados clínicos, integração de dados baseada em FHIR, construção de base de dados vetorial, configuração de recuperação, engenharia de prompts, orquestração de múltiplos agentes e avaliação do sistema. Resultados representativos demonstram a capacidade da plataforma de gerar respostas clinicamente relevantes e contextualmente consistentes, ao mesmo tempo que melhora a interoperabilidade semântica entre fontes de dados heterogêneas. O desempenho do sistema foi avaliado utilizando métricas quantitativas e semânticas complementares, incluindo BLEU, ROUGE, BERTScore e similaridade do cosseno. Uma avaliação qualitativa foi realizada utilizando conjuntos de dados de referência em saúde totalmente anonimizados e de acesso público, a fim de avaliar a reprodutibilidade do fluxo de trabalho metodológico proposto. A arquitetura proposta combina interoperabilidade padronizada em saúde com modelos de linguagem aprimorados por recuperação, visando melhorar o raciocínio contextual, reduzir alucinações e apoiar fluxos de trabalho clínicos inteligentes e reprodutíveis com assistência de IA. Este protocolo fornece um framework escalável e reprodutível para pesquisadores e desenvolvedores que buscam implementar sistemas de saúde interoperáveis, atentos à privacidade e inteligentes, destinados ao suporte à decisão clínica, análise de dados médicos e pesquisas translacionais futuras.

Introdução

Informações de saúde são rotineiramente geradas em hospitais, centros diagnósticos, laboratórios e clínicas ambulatoriais, frequentemente permanecendo distribuídas entre sistemas heterogêneos de informação. Essa fragmentação limita a interoperabilidade e restringe o acesso oportuno a registros completos dos pacientes, criando desafios persistentes para o atendimento clínico, integração de dados e gestão em saúde1,2,3,4.

As consequências dessa fragmentação tornam-se particularmente evidentes em fluxos de trabalho clínicos que dependem do acesso oportuno às informações do paciente. Quando os profissionais de saúde não conseguem recuperar prontuários médicos completos e integrados, a avaliação clínica torna-se mais difícil, aumentando o risco de tomada de decisões incompletas e reduzindo a eficiência na prestação de cuidados, especialmente em situações de emergência5,6.

Desenvolvimentos recentes na Inteligência Artificial (AI), particularmente Modelos de Linguagem de Grande Porte (LLMs), ampliaram o leque de abordagens computacionais disponíveis para aplicações em saúde. Esses modelos têm sido investigados em tarefas como auxílio diagnóstico, triagem clínica e suporte à decisão. Por exemplo, Jahan et al.5 avaliaram o uso de LLMs em tarefas biomédicas, enquanto Taylor et al.7 investigaram modelos ajustados para triagem digital em saúde mental, relatando resultados encorajadores em ambientes clínicos especializados.

A aplicação de LLMs também se expandiu para domínios clínicos mais especializados. Song et al. 49exploraram seu uso no diagnóstico de pneumoconiose, enquanto Chien et al.8 aplicaram esses modelos para analisar padrões de carga de trabalho entre cuidadores informais. Em oftalmologia, Xue et al.9 propuseram um sistema de questionamento e resposta para o diagnóstico de glaucoma, enquanto Tan et al.3 e Wu et al.10 relataram o uso de LLMs em sistemas diagnósticos híbridos e em consultas de medicina tradicional chinesa.

O uso de LLMs não se limita a aplicações clínicas diretas. Zhang et al.11 investigaram sua aplicação no reconhecimento de emoções em cenários de saúde mental, enquanto Sarzaeim et al.12 exploraram sistemas de policiamento inteligentes que também podem contribuir para análises relacionadas à saúde pública. Esses estudos ilustram a ampla aplicabilidade de abordagens baseadas em LLMs em diferentes domínios relacionados à saúde.

Embora os LLMs tenham ampliado as possibilidades para aplicações na área da saúde, sua integração em ambientes clínicos ainda está associada a desafios técnicos, organizacionais e regulatórios importantes. A implantação prática exige infraestrutura computacional adequada, governança eficaz dos dados e conformidade com frameworks regulatórios, como o Regulamento Geral sobre a Proteção de Dados (GDPR) e a Lei Geral de Proteção de Dados Brasileira (LGPD). Esses frameworks estabelecem requisitos para o processamento seguro e ético de informações sensíveis de saúde, abordando questões relacionadas à privacidade, confiabilidade e viés algorítmico em sistemas de saúde assistidos por IA13,14.

A interoperabilidade entre fontes heterogêneas de dados em saúde, incluindo Registros Eletrônicos de Saúde (EHRs), sistemas de imagens médicas e dispositivos da Internet das Coisas (IoT), continua representando um grande desafio técnico para a implantação de soluções de saúde assistidas por IA. Nesse contexto, frameworks padronizados de interoperabilidade, como o HL7 FHIR, fornecem um mecanismo estruturado para trocar informações clínicas entre diferentes sistemas, preservando a consistência semântica e permitindo integração escalável.

Este trabalho apresenta uma plataforma web interoperável que integra modelos linguísticos grandes com padrões de interoperabilidade em saúde para apoiar a análise de dados médicos em ambientes clínicos heterogêneos. A arquitetura proposta combina a integração de dados baseada em HL7 FHIR com geração aumentada por recuperação (RAG) e um framework de processamento multiagente para fornecer análises assistidas por IA com consciência de contexto, mantendo-se alinhada aos requisitos aplicáveis de proteção de dados, incluindo a Lei Geral de Proteção de Dados (LGPD).

Este protocolo descreve uma arquitetura interoperável para integrar dados clínicos heterogêneos utilizando padrões estabelecidos de interoperabilidade em saúde. Também detalha a implementação de um pipeline de processamento multiagente baseado em modelos de linguagem grandes e pequenos (LLMs e SLMs), juntamente com um framework de avaliação que combina métricas quantitativas e análises qualitativas para avaliar o comportamento da plataforma proposta.

Protocolo

Este estudo não envolveu a recrutamento de participantes humanos, acesso a registros de pacientes identificáveis ou experimentos envolvendo animais. O protocolo foi desenvolvido e avaliado exclusivamente utilizando conjuntos de dados anonimizados e totalmente disponíveis publicamente para validação metodológica. Nenhuma informação de saúde pessoal foi acessada ou processada. Portanto, não foi necessária a aprovação por um Comitê de Ética em Pesquisa (IRB) ou Comitê de Ética em Pesquisa. O protocolo foi desenvolvido de acordo com os princípios aplicáveis de proteção de dados, incluindo a Lei Geral de Proteção de Dados Brasileira (LGPD), para apoiar aplicações futuras envolvendo dados clínicos.

Seleção e pré-processamento do conjunto de dados

O protocolo proposto foi avaliado utilizando conjuntos de dados clínicos de acesso público e totalmente anonimizados, compreendendo prontuários eletrônicos estruturados (EHRs), dados de respostas a perguntas clínicas e conjuntos de dados de imagens médicas para validação metodológica. Antes da integração na plataforma, os conjuntos de dados passaram por procedimentos padronizados de pré-processamento, incluindo normalização dos dados, remoção de registros inconsistentes ou incompletos, mapeamento para recursos HL7 FHIR, limpeza de texto, segmentação em blocos de recuperação e geração de incorporações para indexação vetorial. Essas etapas de pré-processamento garantiram consistência semântica entre fontes de dados heterogêneas, facilitando a interoperabilidade e permitindo a reprodutibilidade do fluxo de trabalho proposto, ao mesmo tempo em que mantiveram a conformidade com os princípios aplicáveis de privacidade de dados.

Os conjuntos de dados foram obtidos de repositórios de referência publicamente disponíveis, comumente utilizados em pesquisas de inteligência artificial e saúde digital. Eles foram selecionados para representar informações clínicas heterogêneas, incluindo prontuários eletrônicos estruturados (EHRs), narrativas clínicas não estruturadas, tarefas de resposta a perguntas clínicas e metadados de imagens médicas. Em vez de avaliar uma coorte clínica específica, o protocolo enfoca a demonstração de um fluxo de trabalho de implementação reproduzível, que pode ser adaptado a diferentes conjuntos de dados de saúde. A diversidade desses conjuntos de dados de referência permite a validação do pipeline de interoperabilidade, da Geração Reforçada por Recuperação (RAG) e do framework de raciocínio multiagente em múltiplas modalidades de dados clínicos.

Configuração do ambiente experimental

O ambiente experimental foi configurado para avaliar a plataforma interoperável em condições controladas e reprodutíveis. A arquitetura compreende módulos de ingestão de dados, camadas de interoperabilidade, modelos linguísticos grandes (LLMs) e componentes de avaliação organizados em um único pipeline de processamento para análise de dados médicos. Figura 1 ilustra o fluxo de trabalho completo, desde a ingestão de dados clínicos até a geração de saídas diagnósticas.

Diagrama de processamento de dados de prontuários eletrônicos; filtragem de anotações clínicas; inferência de doença via modelo de linguagem de grande porte; processo de diagnóstico.
Figura 1: Fluxo geral do sistema ilustrando o pipeline de processamento desde os dados clínicos brutos até a saída do status da doença. O processo inicia com a ingestão de Prontuários Eletrônicos de Saúde (EHR), seguida por filtragem e pré-processamento dos dados para extrair informações sensíveis a doenças. Uma etapa de elaboração de prompts estruturados integra conhecimento especializado, definições de doenças e hiperparâmetros, permitindo uma interação eficaz com o Modelo de Linguagem de Grande Porte (LLM). O LLM realiza inferência textual para gerar respostas contextualizadas, que posteriormente são avaliadas por meio de regras clínicas para determinar o status final da doença. O fluxo de trabalho destaca a integração do pré-processamento de dados, uso de prompts baseados em conhecimento e inferência baseada em IA para apoiar a tomada de decisões clínicas. Clique aqui para visualizar uma versão maior desta figura.

Arquitetura de interoperabilidade em saúde

A infraestrutura de back-end adota uma arquitetura modular baseada em APIs RESTful para apoiar a comunicação entre os componentes da plataforma (Figura 2). Essa arquitetura acomoda informações clínicas heterogêneas, incluindo prontuários eletrônicos estruturados (EHRs), anotações médicas e metadados derivados de sistemas de imagem médica. Como esses dados provêm de múltiplas fontes e formatos, a interoperabilidade é alcançada por meio de modelos padronizados de dados, particularmente o framework Fast Healthcare Interoperability Resources (FHIR)15,16,17.. A adoção do FHIR favorece a troca de informações estruturadas, ao mesmo tempo que preserva escalabilidade e flexibilidade em ambientes clínicos distribuídos. Mecanismos de comunicação baseados no HL7 também foram incorporados para facilitar a integração com sistemas clínicos legados, que ainda são amplamente utilizados em instituições de saúde16,17.

Diagrama da API Flask mostrando requisições POST/GET, consultas MySQL e integração com armazenamento vetorial FAISS.
Figura 2: Arquitetura do sistema da plataforma interoperável proposta. A interface web se comunica com o backend por meio de uma API Flask utilizando requisições HTTP POST/GET. A API gerencia roteamento, processamento de consultas e interação com fontes de dados estruturadas e não estruturadas. Um banco de dados MySQL armazena dados clínicos estruturados, enquanto um armazenamento vetorial baseado em FAISS suporta busca por similaridade para operações de recuperação. O pipeline baseado em LLaMA processa entradas textuais e gera respostas utilizando representações vetoriais, permitindo a Geração Reforçada por Recuperação (Retrieval-Augmented Generation – RAG). A arquitetura destaca a integração de serviços web, gerenciamento de banco de dados, recuperação vetorial e inferência de modelos de linguagem grandes em um sistema unificado. Clique aqui para visualizar uma versão maior desta figura.

Configuração do fluxo de trabalho com múltiplos agentes

A arquitetura multiagente é organizada em agentes funcionais especializados, responsáveis por estágios distintos do fluxo de trabalho. Um agente de pré-processamento realiza a normalização dos dados e o mapeamento FHIR, seguido por um agente de recuperação responsável pela busca semântica dentro do banco de dados vetorial. Um agente de raciocínio integra o contexto recuperado com o LLM para gerar respostas, enquanto um agente de validação verifica a consistência e a formatação da saída antes que a resposta final seja retornada. A coordenação dos agentes segue uma estratégia de orquestração sequencial na qual a saída de cada agente serve como entrada para a etapa subsequente, garantindo uma implementação reprodutível e modular.

Integração de dados clínicos

A camada de integração de dados agrega informações de múltiplas fontes clínicas e as prepara para o processamento posterior. O pré-processamento inclui normalização de dados, tokenização e alinhamento de entidades para melhorar a consistência semântica entre conjuntos de dados heterogêneos. Como as informações clínicas variam em estrutura e qualidade, essas operações ajudam a reduzir o ruído e facilitam a interação com modelos de IA. Estratégias de mapeamento estruturado também foram aplicadas para harmonizar diferentes formatos de dados e manter a compatibilidade com o pipeline de processamento, conforme ilustrado na Figura 315,16,17.

Diagrama do processo de tomada de decisões em saúde; etapas: complexidade da consulta, recrutamento, análise, síntese.
Figura 3: Exemplo detalhado do processo de raciocínio clínico com múltiplos agentes. A figura ilustra como uma consulta clínica é analisada por meio de múltiplas etapas, incluindo avaliação da complexidade, recrutamento de especialistas, discussão colaborativa e tomada final de decisão. Esse processo demonstra a capacidade do sistema de adaptar dinamicamente as estratégias de raciocínio com base na complexidade da consulta, melhorando tanto a eficiência quanto a precisão diagnóstica em cenários de suporte à decisão clínica. Clique aqui para visualizar uma versão maior desta figura.

Configurar o pipeline de geração aumentada por recuperação

A Geração Reforçada por Recuperação (Retrieval-Augmented Generation, RAG) é incorporada para fornecer uma análise com consciência de contexto, combinando recuperação de informações com as capacidades gerativas de modelos linguísticos grandes. As consultas do usuário são convertidas em representações vetoriais usando modelos de incorporação e comparadas com a base de dados vetorial por meio de busca semântica de similaridade para recuperar os trechos contextuais mais relevantes. Os documentos recuperados são então combinados com a consulta original antes da inferência pelo modelo linguístico grande (LLM). Essa estratégia ajuda a fornecer informações contextuais durante a geração da resposta e tem sido associada a uma maior consistência factual e redução de alucinações em aplicações intensivas em conhecimento, incluindo a área da saúde18,19. Figura 1 e Figura 3 ilustram o fluxo de trabalho geral de recuperação e o processo de raciocínio correspondente.

Para cada solicitação do usuário, o prompt final é construído dinamicamente combinando a consulta original com os trechos contextuais mais relevantes recuperados do banco de dados vetorial. As informações recuperadas são incorporadas como evidência contextual antes da inferência, permitindo que o modelo de linguagem gere respostas baseadas no conhecimento médico recuperado, preservando a consistência semântica e reduzindo gerações não suportadas.

Engenharia de prompts e raciocínio multiagente

O protocolo incorpora estratégias de estímulo estruturado para melhorar a interpretação contextual durante a geração de respostas. Essas técnicas de estímulo, juntamente com mecanismos avançados de inferência, ajudam a orientar o processo de raciocínio em cenários clínicos complexos e são compatíveis com os avanços recentes relatados na literatura20.

A arquitetura inclui um framework multiagente composto por módulos especializados que executam funções distintas dentro do pipeline de processamento, incluindo validação de dados, filtragem de contexto, suporte ao raciocínio clínico e verificação da saída. A organização modular permite que as tarefas sejam executadas sequencialmente ou em paralelo, proporcionando flexibilidade para diferentes requisitos de processamento (Figura 4). A distribuição dessas atividades entre múltiplos agentes reduz a dependência de um único modelo de linguagem e favorece um fluxo de trabalho de processamento mais robusto. Essa estratégia arquitetônica está alinhada com os avanços recentes em inteligência artificial distribuída e no design de sistemas inteligentes21,22.

Diagrama do processo de consulta; fluxo de decisão para problemas médicos simples versus complicados; análise em equipe.
Figura 4: Estrutura de decisão com múltiplos agentes para raciocínio clínico. O processo inicia-se com uma consulta do usuário, que é avaliada por um agente verificador responsável por determinar a complexidade da consulta. Em casos complexos, o sistema recruta dinamicamente uma equipe multidisciplinar (EMD) composta por agentes especializados, que realizam rodadas iterativas de discussão para analisar o problema e sintetizar conhecimento antes de produzir uma decisão final. Em casos mais simples, a consulta é tratada por um agente clínico de atenção primária (CAP), permitindo uma resposta mais rápida. Essa arquitetura adaptativa equilibra eficiência e profundidade analítica, melhorando a qualidade das decisões e a escalabilidade do sistema em aplicações na área da saúde. Clique aqui para visualizar uma versão maior desta figura.

Avaliação de desempenho

O desempenho do sistema foi avaliado utilizando métricas complementares que capturam tanto a qualidade linguística quanto a consistência semântica das saídas geradas. O BLEU foi aplicado para medir a similaridade sintática com base na sobreposição de n-gramas23, enquanto o ROUGE avaliou a revocação e a cobertura de conteúdo, especialmente em tarefas de sumarização e extração de informações24. A similaridade semântica foi avaliada com o BERTScore, que utiliza incorporações contextuais derivadas de modelos baseados em transformadores para comparar textos gerados e textos de referência25. Análises adicionais incluíram perplexidade e similaridade do cosseno para examinar, respectivamente, a confiança do modelo e a coerência semântica26,27.

As métricas de avaliação selecionadas fornecem perspectivas complementares sobre o desempenho do sistema, combinando análises léxicas e semânticas. Essa combinação é particularmente relevante em aplicações na área da saúde, onde a interpretação contextual é tão importante quanto a similaridade léxica. A plataforma foi avaliada em um ambiente computacional controlado que suporta implantação baseada em nuvem e local. A execução local de LLMs foi incluída como uma opção para atender aos requisitos de privacidade de dados e reduzir a dependência de serviços externos ao processar informações clínicas sensíveis. Essa estratégia de implantação é compatível com as normas de proteção de dados e pode ser adaptada a diferentes ambientes operacionais4.

Resultados

O desempenho do sistema foi avaliado utilizando métricas quantitativas complementares juntamente com análise qualitativa para examinar tanto a precisão linguística quanto a consistência semântica das saídas geradas. Esta estratégia de avaliação combina medidas lexicais e semânticas para fornecer uma caracterização mais ampla do comportamento do modelo em tarefas de geração de linguagem relacionadas à saúde.

Tabela 1 apresenta os resultados quantitativos obtidos com BLEU, ROUGE e BERTScore. Essas métricas foram selecionadas porque avaliam aspectos complementares do texto gerado, incluindo similaridade léxica, cobertura de informações e alinhamento semântico, sendo amplamente utilizadas na pesquisa de processamento de linguagem natural.

AvaliadorPromptPearsonRMSEMAETaxa de Acerto
Mixtralcurto0.0981.7791.3466/28
zero-shot0.1741.6181.29315/28
few-shot0.4751.6731.3679/28
LLaMA 3curto0.4851.6171.31411/28
zero-shot0.4791.6141.31410/28
few-shot0.4251.6521.33913/28
LLaMA 3.1curto0.3491.6211.31806/28
zero-shot0.681.6141.30712/28
few-shot0.4081.2430.88611/28

Tabela 1: Métricas quantitativas de avaliação do sistema proposto.

O BLEU foi utilizado para quantificar a similaridade sintática com base na sobreposição de n-gramas entre as saídas geradas e os textos de referência23. Originalmente desenvolvido para tradução automática, também tem sido aplicado a uma ampla variedade de tarefas de geração de texto, pois capta a correspondência estrutural entre textos. Na avaliação atual, os escores BLEU indicam que as respostas geradas preservam características sintáticas consistentes com as saídas de referência.

O ROUGE foi utilizado para avaliar a similaridade orientada ao recall, com ênfase na cobertura de informações relevantes nos textos gerados24. Em aplicações na área da saúde, essa métrica é particularmente útil porque preservar informações clinicamente relevantes é muitas vezes mais importante do que reproduzir a redação idêntica. Conforme relatado em Tabela 2, os escores ROUGE indicam que as respostas geradas mantêm conteúdo clínico relevante em todos os casos avaliados.

AvaliadorPromptICC1ICC2ICC3ICC1kICC2kICC3K
Mixtralcurto0.1360.1640.1820.320.370.4
zero-shot0.280.3530.5070.5390.6210.755
poucos exemplos0.2240.3230.5220.4630.5880.766
LLaMA3curto0.2340.3310.5320.4790.5970.773
zero-shot0.2440.340.5510.4920.6070.786
poucos exemplos0.2180.3210.5310.4560.5870.772
LLaMA3.1curto0.5210.5250.5370.7660.7680.777
zero-shot0.2460.3430.560.4950.6110.792
poucos exemplos0.5990.5970.5890.8170.8160.811

Tabela 2: Métricas de concordância entre avaliadores (CCI).

O BERTScore foi incluído para avaliar a similaridade semântica utilizando incorporações contextuais derivadas de modelos baseados em transformadores25. Diferentemente do BLEU e do ROUGE, esta métrica compara textos de acordo com o significado contextual em vez da sobreposição léxica, tornando-a adequada para avaliar a geração de linguagem clínica. Os valores de BERTScore obtidos neste estudo indicam um alto grau de alinhamento semântico entre as respostas geradas e os textos de referência correspondentes.

As análises adicionais incluíram perplexidade e similaridade do cosseno para complementar as métricas primárias de avaliação. A perplexidade foi calculada para estimar a previsibilidade das saídas geradas, sendo que valores mais baixos indicam menor incerteza durante a geração de texto26. A similaridade do cosseno foi utilizada para quantificar o alinhamento entre vetores de incorporação derivados dos textos gerados e de referência, fornecendo uma medida adicional de coerência semântica27.

Em conjunto, as métricas de avaliação fornecem informações complementares sobre as características sintáticas, semânticas e contextuais das respostas geradas. Figura 5 resume a distribuição dos resultados da avaliação ao longo das métricas analisadas, fornecendo uma visão geral do desempenho do sistema nas condições testadas.

Os resultados da avaliação são consistentes com o comportamento esperado da Geração Reforçada por Recuperação (Retrieval-Augmented Generation - RAG) em aplicações que exigem acesso a fontes externas de conhecimento. Ao incorporar documentos recuperados no processo de geração de respostas, a arquitetura fornece informações contextuais adicionais que apoiam respostas clinicamente relevantes em cenários intensivos em conhecimento18,19. Estratégias estruturadas de formulação de perguntas são incorporadas como mecanismos complementares para orientar o processo de raciocínio e a interpretação contextual, em conformidade com abordagens relatadas em estudos recentes20.

A análise qualitativa complementou a avaliação quantitativa ao examinar a interpretabilidade e a relevância clínica das saídas geradas. Exemplos representativos das respostas do sistema são apresentados na Figura 3 para diferentes tipos de consultas clínicas. Esses exemplos ilustram como a plataforma gera respostas contextualmente coerentes em todos os cenários avaliados, incluindo casos que envolvem informações clínicas mais complexas.

A arquitetura multiagente distribui tarefas de processamento entre módulos especializados responsáveis por funções complementares dentro do fluxo de trabalho. Essa organização reduz a dependência de um único modelo de linguagem e permite múltiplas etapas de processamento de informações e verificação de saídas, em consonância com abordagens multiagente recentes relatadas na literatura21,22. Figura 5 resume a distribuição dos resultados da avaliação obtidos com as diferentes estratégias de prompt e modelos de linguagem considerados neste estudo.

Gráficos de violino comparando estímulos motivacionais, métodos: Pearson, MAI, M/F CE; análise educacional.
Figura 5: Distribuição de desempenho do sistema proposto em diferentes estratégias de estímulo e modelos de linguagem. (A–F) Os gráficos de violino ilustram as variações na qualidade das respostas para abordagens de estímulo breve, sem exemplos (zero-shot) e com poucos exemplos (few-shot), utilizando os modelos LLaMA3, LLaMA3.1 e Mixtral. Os resultados destacam o impacto do design do estímulo na consistência e no desempenho da saída, demonstrando que estratégias estruturadas de estímulo tendem a produzir respostas mais estáveis e precisas em tarefas clínicas. Clique aqui para visualizar uma versão maior desta figura.

Os resultados da avaliação são consistentes com estudos recentes que defendem a combinação de métricas léxicas e semânticas para avaliar o desempenho de modelos linguísticos grandes4,12. Em particular, métricas baseadas em incorporação (embedding) tornaram-se cada vez mais importantes para capturar a similaridade contextual na geração de linguagem relacionada à saúde, onde a interpretação semântica vai além da correspondência léxica28,29.

De modo geral, a avaliação indica que a plataforma proposta integra padrões de interoperabilidade, Geração Reforçada por Recuperação (RAG) e processamento multiagente em um framework unificado para análise de dados em saúde. Os resultados quantitativos e qualitativos apresentados neste estudo sustentam a viabilidade do fluxo de trabalho proposto nas condições experimentais avaliadas e fornecem uma base para futuras validações em ambientes clínicos do mundo real.

DISPONIBILIDADE DE DADOS

Os conjuntos de dados utilizados neste estudo estão disponíveis publicamente. O conjunto de dados de radiografias de tórax foi obtido a partir da Coleção de Radiografias de Tórax da Universidade de Indiana (Open-i, Biblioteca Nacional de Medicina dos EUA), incluindo os arquivos indiana_reports.csv e indiana_projections.csv, disponíveis em https://openi.nlm.nih.gov/. O conjunto de dados de referência MedQA está disponível publicamente por meio de seu repositório oficial. Nenhum dado clínico proprietário ou identificável de pacientes foi utilizado neste estudo. Todos os procedimentos de pré-processamento são descritos na seção Protocolo para apoiar a reprodutibilidade.

Discussão

A avaliação apresentada neste estudo representa uma validação metodológica realizada utilizando conjuntos de dados de referência em saúde totalmente anonimizados e disponíveis publicamente. Nenhuma validação clínica prospectiva envolvendo profissionais de saúde ou recrutamento de pacientes foi conduzida, pois o objetivo deste trabalho é demonstrar um protocolo de implementação reproduzível, e não a eficácia clínica.

Os resultados deste estudo sugerem que a combinação de padrões de interoperabilidade em saúde com modelos de linguagem de grande porte fornece um framework prático para integrar informações clínicas heterogêneas. A arquitetura proposta reúne mecanismos de troca de dados estruturados, incluindo FHIR e HL7, com processamento de linguagem baseado em IA em um fluxo de trabalho unificado, compatível com os avanços atuais em sistemas de saúde digital15,16,17.

Um aspecto importante do fluxo de trabalho proposto é a integração da Geração Aumentada por Recuperação (RAG) dentro de uma arquitetura multiagente. Nessa configuração, os documentos recuperados fornecem informações contextuais adicionais durante a geração da resposta, apoiando tarefas clínicas intensivas em conhecimento. Esse design arquitetural está de acordo com estudos recentes que descrevem mecanismos baseados em recuperação como uma estratégia para melhorar a fundamentação contextual e a confiabilidade das respostas em aplicações de modelos linguísticos grandes18,19.

Estratégias de elaboração de prompts estruturados foram incorporadas ao fluxo de trabalho proposto para apoiar a interpretação contextual durante a geração de respostas. Estudos anteriores relataram que a engenharia de prompts e as técnicas de raciocínio estruturado podem melhorar o desempenho de modelos de linguagem grandes em tarefas complexas de tomada de decisão20. A abordagem adotada neste protocolo está alinhada com esses avanços e fornece uma estrutura organizada para o processamento de linguagem clínica.

Do ponto de vista da avaliação, o uso de métricas complementares permitiu examinar diferentes dimensões do desempenho do sistema. Enquanto BLEU e ROUGE fornecem informações sobre a similaridade sintática e a cobertura de conteúdo23,24, métricas baseadas em incorporação, como o BERTScore, capturam relações semânticas que podem não ser refletidas apenas pelo sobreposição lexical25. Essa estratégia de avaliação multidimensional está de acordo com estudos recentes de referência que recomendam combinar medidas lexicais e semânticas ao avaliar modelos linguísticos grandes em aplicações na área da saúde4,12.

O fluxo de trabalho proposto fornece um framework metodológico reprodutível para a implementação de sistemas interoperáveis de suporte à decisão clínica baseados em inteligência artificial. Em vez de comparar diferentes arquiteturas de inteligência artificial, este estudo concentra-se em documentar integralmente o fluxo de trabalho de implementação, a arquitetura do sistema, os mecanismos de interoperabilidade e a metodologia de avaliação, com o objetivo de facilitar a reprodutibilidade e a adoção futura. Análises comparativas envolvendo modelos linguísticos grandes convencionais, configurações sem RAG, modelos ajustados ou abordagens tradicionais de aprendizado de máquina estão fora do escopo desta contribuição metodológica e representam uma importante direção para pesquisas futuras.

A futura tradução do framework proposto para ambientes clínicos do mundo real exigirá validação adicional com profissionais de saúde, bem como conformidade com os requisitos regulatórios e éticos aplicáveis. Dependendo do uso pretendido, esses sistemas podem estar sujeitos às regulamentações de Software como Dispositivo Médico (SaMD) e devem cumprir os requisitos estabelecidos pelas autoridades regulatórias, incluindo a Administração de Alimentos e Medicamentos dos Estados Unidos (FDA) e o Regulamento Europeu de Dispositivos Médicos (MDR). Além disso, práticas robustas de governança de dados, cibersegurança, transparência e segurança clínica serão essenciais para apoiar a implantação segura e responsável em ambientes de saúde.

A análise qualitativa complementou a avaliação quantitativa ao ilustrar as características das respostas geradas em cenários clínicos representativos. Os exemplos apresentados indicam que a plataforma foi capaz de produzir respostas contextualmente coerentes nas condições avaliadas, fornecendo uma compreensão adicional sobre a interpretabilidade das respostas além das métricas quantitativas. Observações semelhantes foram relatadas em estudos que aplicam modelos linguísticos grandes em aplicações clínicas, incluindo assistência diagnóstica e interação com o paciente28,29,30,31.

A arquitetura proposta distribui tarefas de processamento entre módulos especializados responsáveis por funções complementares, incluindo validação de dados, filtragem contextual, apoio ao raciocínio clínico e verificação da saída. Essa organização modular reduz a dependência de um único modelo de linguagem e permite estágios sucessivos de processamento de informações dentro do fluxo de trabalho. Estratégias arquitetônicas semelhantes foram descritas em estudos recentes sobre sistemas de IA distribuídos e estruturas multiagente projetadas para ambientes de tomada de decisão complexos21,22.

Várias considerações sobre a implementação podem facilitar a reprodutibilidade e a implantação do protocolo proposto. O mapeamento consistente das informações clínicas para o padrão HL7 FHIR ajuda a preservar a interoperabilidade semântica em todo o pipeline de processamento de dados. Da mesma forma, o pré-processamento de documentos, as estratégias de segmentação, a geração de incorporações e o indexamento vetorial influenciam o comportamento do fluxo de trabalho de Geração Aumentada por Recuperação e devem ser configurados e validados de acordo com as características da aplicação-alvo. A engenharia de prompts e a orquestração multiagente também podem ser aprimoradas de forma iterativa mediante o uso de conhecimento específico do domínio e feedback de especialistas, a fim de melhorar o enraizamento contextual durante a geração de respostas. Essas práticas de implementação estão alinhadas com os avanços recentes em inteligência artificial confiável e modelos de linguagem aprimorados por recuperação18,19,20.

Algumas limitações deste estudo devem ser reconhecidas. Embora a avaliação tenha combinado métricas quantitativas e qualitativas complementares, essas medidas podem não capturar completamente todos os aspectos do raciocínio clínico. Essa observação é consistente com estudos anteriores que recomendam estruturas de avaliação específicas para o domínio em aplicações na área da saúde12. Além disso, a plataforma foi avaliada em condições controladas utilizando conjuntos de dados de referência anonimizados e de acesso público, os quais podem não representar plenamente a variabilidade e a complexidade dos ambientes clínicos do mundo real.

A plataforma proposta foi desenvolvida de acordo com padrões estabelecidos de interoperabilidade em saúde. A adoção de HL7 e FHIR favorece a troca estruturada de dados entre sistemas heterogêneos de informação em saúde, fornecendo uma estrutura padronizada para integrar informações clínicas provenientes de múltiplas fontes. Essa abordagem arquitetônica está alinhada com os esforços atuais para desenvolver sistemas de IA interoperáveis para ambientes de saúde distribuídos15,16,17.

A implementação bem-sucedida do fluxo de trabalho proposto depende de várias etapas metodológicas críticas. Primeiro, os dados clínicos devem ser mapeados de forma consistente para recursos padronizados HL7 FHIR, a fim de preservar a interoperabilidade semântica entre sistemas heterogêneos de saúde15,17. Segundo, o pré-processamento dos documentos, incluindo normalização, estratégia de segmentação e geração de incorporações (embeddings), deve ser cuidadosamente configurado, pois essas etapas influenciam diretamente a qualidade da recuperação dentro do pipeline de Geração Aumentada por Recuperação (RAG, do inglês Retrieval-Augmented Generation)19,32,33. Terceiro, o banco de dados vetoriais deve ser reconstruído sempre que a base de conhecimento for atualizada, a fim de manter a consistência entre os documentos indexados e os resultados de recuperação. Por fim, a engenharia de prompts e a orquestração de múltiplos agentes devem ser validadas iterativamente utilizando cenários clínicos representativos, para melhorar a precisão contextual, minimizar alucinações e aumentar a reprodutibilidade de fluxos de trabalho de suporte à decisão clínica assistidos por IA4,3,20,31.

Do ponto de vista de solução de problemas, desafios comuns de implementação incluem mapeamento incompleto de recursos FHIR, desempenho reduzido na recuperação associado à indexação de documentos ou configuração do banco de dados vetorial e respostas afetadas por informações contextuais insuficientes ou engenharia de prompts subótima. Esses problemas podem ser abordados por meio da validação dos recursos de interoperabilidade, otimização dos parâmetros de recuperação, atualização periódica ou reconstrução do banco de dados vetorial após modificações na base de conhecimento e avaliação contínua utilizando métricas lexicais e semânticas complementares. Essas práticas apoiam um comportamento consistente do sistema e facilitam a implantação e manutenção de fluxos de trabalho de suporte à decisão clínica assistidos por IA4,12,25,23..

Do ponto de vista prático, a implantação de modelos linguísticos grandes em ambientes de saúde exige consideração quanto aos recursos computacionais e requisitos de infraestrutura. Embora a arquitetura proposta suporte tanto execução na nuvem quanto local, estratégias adicionais de otimização podem ser necessárias dependendo da escala da implantação e dos recursos computacionais disponíveis, especialmente em ambientes com restrição de recursos4.

Pesquisas futuras podem ampliar o fluxo de trabalho proposto ao avaliar a plataforma com conjuntos de dados clínicos do mundo real e fluxos de trabalho de saúde habitual. Investigações adicionais também podem explorar estratégias de ajuste fino específicas para o domínio e a integração de métodos de IA explicável para melhorar a interpretabilidade do modelo e apoiar a transparência durante o auxílio à tomada de decisões clínicas. Essas direções podem contribuir para uma avaliação mais ampla da plataforma em ambientes práticos de saúde.

No geral, este trabalho apresenta um framework reprodutível para integrar padrões de interoperabilidade em saúde, Geração Reforçada por Recuperação (RAG) e arquiteturas de modelos linguísticos multiagentes em um fluxo de trabalho unificado de processamento de dados clínicos. O protocolo proposto oferece uma abordagem estruturada para implementar e avaliar sistemas de análise de dados médicos assistidos por IA e pode servir como referência para desenvolvimentos futuros em suporte à decisão clínica interoperável.

Divulgações

Os autores declaram não haver interesses financeiros conflitantes ou relações pessoais que poderiam ter influenciado o trabalho descrito neste manuscrito. Ferramentas de inteligência artificial generativa (IA) foram usadas exclusivamente para auxiliar na edição linguística, correção gramatical e melhoria da legibilidade do manuscrito. Todo o conteúdo científico, o desenho do estudo, a metodologia, a análise de dados, a interpretação dos resultados e as decisões editoriais foram desenvolvidos, verificados e aprovados pelos autores, que assumem total responsabilidade pelo conteúdo deste manuscrito.

Agradecimentos

Os autores gostariam de agradecer ao Laboratório de Sistemas Embarcados e Distribuídos (LESC), da Universidade Federal do Ceará (UFC), pelo fornecimento do ambiente de pesquisa e das discussões técnicas que apoiaram o desenvolvimento deste trabalho. Os autores também agradecem aos desenvolvedores e mantenedores do software de código aberto, das normas de interoperabilidade e dos conjuntos de dados disponíveis publicamente utilizados ao longo deste estudo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
FAISSMeta Platforms Inc.Version 1.8.0Banco de dados vetorial utilizado para busca de similaridade no pipeline de Geração Aumentada por Recuperação (RAG).
Padrão FHIRHL7 InternationalRelease 4 (R4)Padrão de interoperabilidade em saúde adotado para troca estruturada de dados clínicos.
FlaskPallets ProjectsVersion 3.0.3Framework web em Python utilizado para implementar a API backend RESTful.
Padrão HL7HL7 InternationalVersion 2.xProtocolo de mensagens legado utilizado para interoperabilidade com sistemas de informação hospitalar.
API REST HTTPImplementação PersonalizadaN/ACamada de comunicação RESTful entre frontend, backend, banco de dados e serviços de IA.
LangChainLangChain Inc.Version 0.3.xFramework utilizado para integrar LLMs, engenharia de prompts e fluxos de trabalho de Geração Aumentada por Recuperação.
LangGraphLangChain Inc.Version 0.2.xFramework utilizado para orquestrar o fluxo de raciocínio clínico com múltiplos agentes.
LLaMA 3.1 8B InstructMeta Platforms Inc.Version 3.1Modelo de Linguagem de Grande Porte empregado para raciocínio clínico e geração de linguagem natural.
MySQL Community ServerOracle CorporationVersion 8.0Banco de dados relacional utilizado para armazenar dados clínicos estruturados.
OllamaOllama Inc.Version 0.9.xMotor de inferência local utilizado para executar Modelos de Linguagem de Grande Porte preservando a privacidade do paciente.
PythonPython Software FoundationVersion 3.11Linguagem de programação utilizada para implementar a plataforma completa.
PyTorchLinux FoundationVersion 2.4Framework de aprendizado profundo utilizado para inferência em Modelos de Linguagem de Grande Porte.
Pipeline de Geração Aumentada por Recuperação (RAG)Implementação PersonalizadaN/AFramework de IA que combina recuperação semântica com inferência de LLM para geração de respostas com contexto.
Sentence TransformersHugging Face Inc.all-MiniLM-L6-v2Modelo de incorporação utilizado para gerar representações vetoriais densas para recuperação semântica de documentos.
Ubuntu LinuxCanonical Ltd.Version 24.04 LTSSistema operacional utilizado para desenvolvimento e avaliação experimental.
Visual Studio CodeMicrosoft CorporationVersion 1.100Ambiente de desenvolvimento integrado utilizado para implementação e depuração de software.

Referências

  1. Chukwu E, Garg L. A systematic review of blockchain in healthcare: frameworks, prototypes, and implementations. IEEE Access. 2020;8:21196-21214. doi:10.1109/ACCESS.2020.2969881.
  2. Al-Nbhany WANA, Zahary AT, Al-Shargabi AA. Blockchain-IoT healthcare applications and trends: a review. IEEE Access. 2024;12:4178-4212. doi:10.1109/ACCESS.2023.3349187.
  3. Tan Y, et al. MedChatZH: a Chinese medical large language model. Comput Biol Med. 2024;172:108290.
  4. OLLAMA TEAM. Ollama: Run Large Language Models locally. Version 0.x. San Francisco: Ollama, 2024.
  5. Jahan I, Laskar MTR, Peng C, Huang JX. A comprehensive evaluation of large language models on benchmark biomedical text processing tasks. Comput Biol Med. 2024;171:108189. doi:10.1016/j.compbiomed.2024.108189.
  6. Liu X, Zhou Y, Wang Z, et al. Disease topic modeling of users' inquiry texts: a text mining-based PQDR-LDA model for analyzing the online medical records. IEEE Trans Eng Manag. 2023.
  7. Taylor N, Kormilitzin A, Lorge I, Nevado-Holgado A, Cipriani A, Joyce DW. Model development for bespoke large language models for digital triage assistance in mental health care. Artif Intell Med. 2024;157:102988.
  8. Song M, et al. PneumoLLM: a large language vision model for pneumonia diagnosis. Med Image Anal. 2024;97:103248.
  9. Chien SC, Yen CM, Chang YH, Chen YE, Liu CC, Hsiao YP, et al. Using large language model (LLM) to identify high-burden informal caregivers in long-term care. Comput Methods Programs Biomed. 2024;255:108329. doi:10.1016/j.cmpb.2024.108329.
  10. Xue X, Zhang D, Sun C, et al. Xiaoqing: a Q&A model for glaucoma based on LLMs. Comput Biol Med. 2024;174:108399.
  11. Wu D, Nie L, Mumtaz RA, Agarwal K. A LLM-based hybrid-transformer diagnosis system in healthcare. IEEE J Biomed Health Inform. 2024.
  12. Zhang Y, et al. LLM-enhanced multi-teacher knowledge distillation for modality-incomplete emotion recognition in daily healthcare. IEEE J Biomed Health Inform. 2024.
  13. Sarzaeim P, Mahmoud QH, Azim A. A framework for LLM-assisted smart policing system. IEEE Access. 2024;12:74915-74929. doi:10.1109/ACCESS.2024.3404862.
  14. Leme RS, Blank M. Lei Geral de Proteção de Dados e segurança da informação na área da saúde. Cad Ibero-Am Direito Sanit. 2020;9(3):210-224. doi:10.17566/ciads.v9i3.690.
  15. Zaganelli MV, Binda Filho DL. O sigilo médico e os dados sensíveis na telemedicina à luz da Lei Geral de Proteção de Dados. RECIIS. 2023;17(3):729-740. doi:10.29397/reciis.v17i3.3689.
  16. Tabari P, Costagliola G, De Rosa M, Boeker M. State-of-the-art Fast Healthcare Interoperability Resources (FHIR)-based data model and structure implementations: systematic scoping review. JMIR Med Inform. 2024.
  17. Martinez T, et al. HL7 systems and interoperability ecosystems in modern healthcare. IEEE Rev Biomed Eng. 2024.
  18. Chen L, et al. HL7 integration and semantic interoperability in distributed healthcare networks. IEEE J Biomed Health Inform. 2024.
  19. Liu W, Li W, Huang W, Gao Y. Security framework for medical data sharing. Telemed E-Health. 2024.
  20. Basile LJ, Carbonara N, Panniello U, Pellegrino R. How can technological resources improve the quality of healthcare service? IEEE Trans Eng Manag. 2024;71:5771-5781. doi:10.1109/TEM.2022.3192405.
  21. Singh A, et al. Prompt engineering in large language models: a survey using SWOT analysis [preprint]. arXiv. 2024
  22. Chen L, Chen Y, Liang W, Li X, Li KC, Wang J, Xiong N. MASS: a multiattribute sketch secure data sharing scheme for IoT wearable medical devices based on blockchain. IEEE Internet Things J. 2025;12(2):1990-2001. doi:10.1109/JIOT.2024.3468733.
  23. Autoridade Nacional de Proteção de Dados (BR). Diretrizes para agentes de tratamento de pequeno porte. Brasília (DF): ANPD; 2021.
  24. Patel R, Kim H. Interoperability in EHR. IEEE Transactions on Biomedical Engineering, v. 70, n. 8, p. 2341-2354, ago. 2023. DOI: 10.1109/TBME.2023.3241567.
  25. Zhang T, Kishore V, Wu F, Weinberger KQ, Artzi Y. BERTScore: evaluating text generation with BERT. In: International Conference on Learning Representations (ICLR); 2020.
  26. Chen X, Lu X, Li Q, Li D, Zhu F. Integration of LLM and Human-AI Coordination for Power Dispatching With Connected Electric Vehicles Under SAGVNs. IEEE Trans Veh Technol. 2025;74(2):1992-2002. doi:10.1109/TVT.2024.3434969
  27. Zhou S, Chen C, Gu HH. Testing and evaluating SNOMED CT web browsers' textual search feature. In: Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM); 2019.
  28. McPeak G, Sautmann A, George O, Hallal A, Simal EA, Schwartz AL, Abaluck J, Ravi N, Pless R. An LLM's medical testing recommendations in a Nigerian clinic: potential and limits of prompt engineering for clinical decision support. In: Proceedings of the 2024 IEEE 12th International Conference on Healthcare Informatics (ICHI); 2024.
  29. LLAMA TEAM, AI @ META. The Llama 3 Herd of Models. arXiv preprint arXiv:2407.21783, 2024. Disponível em: https://arxiv.org/abs/2407.21783.
  30. Conselho Nacional de Saúde (BR). Resolução nº 466, de 12 de dezembro de 2012. Aprova as diretrizes e normas regulamentadoras de pesquisas envolvendo seres humanos. Brasília (DF): Ministério da Saúde; 2012.
  31. Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620:172-180. doi:10.1038/s41586-023-06291-2.
  32. Sahoo P, et al. A systematic survey of prompt engineering in large language models [preprint]. arXiv. 2024. Available from: https://arxiv.org/abs/2402.07927
  33. Yan Y, Hou Y, Xiao Y, Zhang R, Wang Q. KNOWNET: guided health information seeking from LLMs via knowledge graph integration. IEEE Trans Vis Comput Graph. 2024.

Reimpressões e permissões

Etiquetas

Integração FHIRGeração Aumentada por RecuperaçãoRaciocínio MultiagenteBanco de Dados VetorialInteroperabilidade SemânticaEngenharia de Prompt