Deze studie omvatte geen werving van menselijke deelnemers, geen toegang tot identificeerbare patiëntendossiers en geen experimenten met dieren. Het protocol is uitsluitend ontwikkeld en geëvalueerd met gebruik van publiek toegankelijke en volledig geanonimiseerde datasets voor methodologische validatie. Er is geen toegang tot persoonlijke gezondheidsinformatie verkregen of verwerkt. Daarom was goedkeuring van een Institutionele Toetsingscommissie (IRB) of een Medisch Ethische Toetsingscommissie niet vereist. Het protocol is ontwikkeld in overeenstemming met de geldende principes voor gegevensbescherming, waaronder de Braziliaanse Algemene Gegevensbeschermingswet (LGPD), ter ondersteuning van toekomstige toepassingen met klinische gegevens.
Datasetselectie en preprocessing
Het voorgestelde protocol werd geëvalueerd met behulp van openbaar beschikbare en volledig geanonimiseerde klinische datasets, bestaande uit gestructureerde elektronische patiëntendossiers (EPD's), gegevens van klinische vraag-en-antwoordsets en medische beelddatasets voor methodologische validatie. Voorafgaand aan de integratie in het platform ondergingen de datasets gestandaardiseerde voorbehandelingsprocedures, waaronder datanormalisatie, verwijdering van inconsistente of onvolledige records, mapping naar HL7 FHIR-bronnen, tekstzuivering, segmentatie in retrieval-chunks en het genereren van embeddings voor vectorindexering. Deze voorbehandelingsstappen waarborgden de semantische consistentie tussen heterogene databronnen, wat de interoperabiliteit faciliteerde en de reproduceerbaarheid van de voorgestelde workflow mogelijk maakte, terwijl voldaan werd aan de geldende principes voor gegevensprivacy.
De datasets zijn verkregen uit openbaar toegankelijke benchmark-repositories die veelvuldig worden gebruikt in onderzoek naar kunstmatige intelligentie en digitale gezondheidszorg. Ze zijn geselecteerd om heterogene klinische informatie te representeren, waaronder gestructureerde elektronische patiëntendossiers (EPD's), ongestructureerde klinische narratieven, taken voor klinische vraag-en-antwoordsystemen en metadata van medische beeldvorming. In plaats van een specifieke klinische cohort te evalueren, richt het protocol zich op het demonstreren van een reproduceerbare implementatieworkflow die kan worden aangepast aan verschillende datasets uit de gezondheidszorg. De diversiteit van deze benchmark-datasets maakt validatie mogelijk van de interoperabiliteitspipeline, Retrieval-Augmented Generation (RAG) en het multi-agent redeneerkader over meerdere klinische datamodaliteiten.
Configuratie van de experimentele omgeving
De experimentele omgeving werd geconfigureerd om het interoperabele platform onder gecontroleerde en reproduceerbare omstandigheden te evalueren. De architectuur bestaat uit modules voor gegevensingestie, interoperabiliteitslagen, grote taalmodellen (LLM's) en evaluatiecomponenten, georganiseerd in een enkele verwerkingspipeline voor de analyse van medische gegevens. Figuur 1 illustreert de volledige workflow, van de ingestie van klinische gegevens tot het genereren van diagnostische outputs.

Figuur 1: Algemene systeemworkflow die de verwerkingspijplijn illustreert van ruwe klinische gegevens naar de output van de ziektestatus. Het proces begint met de inname van elektronische patiëntendossiers (EHR), gevolgd door gegevensfiltering en voorbewerking om ziektegevoelige informatie te extraheren. Een fase voor gestructureerd prompt-ontwerp integreert expertkennis, ziektedefinities en hyperparameters, wat een effectieve interactie met het Large Language Model (LLM) mogelijk maakt. Het LLM voert tekstinferentie uit om contextbewuste antwoorden te genereren, die vervolgens via klinische regels worden geëvalueerd om de uiteindelijke ziektestatus te bepalen. De workflow benadrukt de integratie van gegevensvoorbewerking, kennisgestuurde prompting en AI-gebaseerde inferentie ter ondersteuning van de klinische besluitvorming. Klik hier om een grotere versie van deze figuur te bekijken.
Architectuur voor interoperabiliteit in de gezondheidszorg
De backend-infrastructuur maakt gebruik van een modulaire architectuur op basis van RESTful API's om de communicatie tussen de platformcomponenten te ondersteunen (Figuur 2). Deze architectuur faciliteert heterogene klinische informatie, waaronder gestructureerde elektronische patiëntendossiers (EPD's), artsaantekeningen en metadata afgeleid van medische beeldvormingssystemen. Omdat deze gegevens afkomstig zijn uit meerdere bronnen en formaten, wordt interoperabiliteit bereikt via gestandaardiseerde datamodellen, in het bijzonder het Fast Healthcare Interoperability Resources (FHIR)-raamwerk15,16,17..De adoptie van FHIR ondersteunt de gestructureerde informatie-uitwisseling, terwijl de schaalbaarheid en flexibiliteit in gedistribueerde gezondheidszorgomgevingen behouden blijven. HL7-gebaseerde communicatiemechanismen zijn ook geïntegreerd om de integratie met legacy klinische systemen te vergemakkelijken, die nog steeds veelvuldig worden gebruikt in zorginstellingen16,17.

Figuur 2: Systeemarchitectuur van het voorgestelde interoperabele platform. De webinterface communiceert met de backend via een Flask API met behulp van HTTP POST/GET-aanvragen. De API beheert de routing, queryverwerking en interactie met zowel gestructureerde als ongestructureerde gegevensbronnen. Een MySQL-database slaat gestructureerde klinische gegevens op, terwijl een op FAISS gebaseerde vectorstore similarity search ondersteunt voor retrieval-operaties. De op LLaMA gebaseerde pipeline verwerkt tekstuele inputs en genereert antwoorden met behulp van vectorrepresentaties, wat Retrieval-Augmented Generation (RAG) mogelijk maakt. De architectuur benadrukt de integratie van webservices, databasebeheer, vectorretrieval en inferentie van grote taalmodellen in één unified systeem. Klik hier om een grotere versie van deze figuur te bekijken.
Configuratie van multi-agent workflows
De multi-agent architectuur is georganiseerd in gespecialiseerde functionele agenten die verantwoordelijk zijn voor verschillende stadia van de workflow. Een preprocessingsagent voert datanormalisatie en FHIR-mapping uit, gevolgd door een retrieval-agent die verantwoordelijk is voor de semantische zoekopdracht binnen de vectordatabase. Een reasoning-agent integreert de opgehaalde context met het LLM om antwoorden te genereren, terwijl een validatieagent de consistentie en opmaak van de output verifieert voordat het definitieve antwoord wordt teruggegeven. De coördinatie van de agenten volgt een sequentiële orchestratiestrategie waarbij de output van elke agent dient als input voor de volgende fase, wat een reproduceerbare en modulaire implementatie waarborgt.
Integratie van klinische gegevens
De data-integratielaag aggregeert informatie uit meerdere klinische bronnen en bereidt deze voor op verdere verwerking. De preprocessing omvat datanormalisatie, tokenisatie en entity-uitlijning om de semantische consistentie tussen heterogene datasets te verbeteren. Omdat klinische informatie varieert in structuur en kwaliteit, helpen deze bewerkingen om ruis te verminderen en de interactie met AI-modellen te vergemakkelijken. Er werden ook gestructureerde mapping-strategieën toegepast om verschillende dataformaten te harmoniseren en de compatibiliteit met de verwerkingspipeline te behouden, zoals geïllustreerd in Figuur 315,16,17.

Figuur 3: Gedetailleerd voorbeeld van het klinische redeneerproces met meerdere agenten. De figuur illustreert hoe een klinische vraag in meerdere stadia wordt geanalyseerd, waaronder de beoordeling van de complexiteit, de werving van specialisten, collaboratieve discussie en de uiteindelijke besluitvorming. Dit proces demonstreert het vermogen van het systeem om redeneerstrategieën dynamisch aan te passen op basis van de complexiteit van de vraag, wat zowel de efficiëntie als de diagnostische nauwkeurigheid in scenario's voor klinische beslissingsondersteuning verbetert. Klik hier om een grotere versie van deze figuur te bekijken.
Configureer de Retrieval-Augmented Generation-pijplijn
Retrieval-Augmented Generation (RAG) is geïntegreerd om contextbewuste analyse mogelijk te maken door informatieophaal te combineren met de generatieve mogelijkheden van grote taalmodellen. Gebruikersvragen worden via embedding-modellen omgezet in vectorrepresentaties en via een semantische gelijkeniszoekopdracht vergeleken met de vectordatabase om de meest relevante contextuele passages op te halen. De opgehaalde documenten worden vervolgens gecombineerd met de oorspronkelijke vraag voordat de inferentie door het LLM plaatsvindt. Deze strategie helpt bij het verstrekken van contextuele informatie tijdens het genereren van antwoorden en wordt geassocieerd met een verbeterde feitelijke consistentie en verminderde hallucinaties in kennisintensieve toepassingen, waaronder de gezondheidszorg18,19. Figuur 1 en Figuur 3 illustreren de algemene workflow voor het ophalen van gegevens en het bijbehorende redeneerproces.
Voor elk gebruikersverzoek wordt de uiteindelijke prompt dynamisch samengesteld door de oorspronkelijke query te combineren met de meest relevante contextuele passages die uit de vectordatabase zijn opgehaald. De opgehaalde informatie wordt vóór de inferentie als contextueel bewijs geïntegreerd, waardoor het taalmodel in staat is om reacties te genereren die gebaseerd zijn op de opgehaalde kennis over de gezondheidszorg, terwijl de semantische consistentie behouden blijft en ongefundereerde generaties worden verminderd.
Prompt engineering en multi-agent redeneren
Het protocol maakt gebruik van gestructureerde promptingstrategieën om de contextuele interpretatie tijdens het genereren van antwoorden te verbeteren. Deze promptingtechnieken helpen, samen met geavanceerde inferentiemechanismen, om het redeneerproces in complexe klinische scenario's te sturen en zijn in overeenstemming met recente ontwikkelingen die in de literatuur zijn gerapporteerd20.
De architectuur omvat een multi-agent framework dat is samengesteld uit gespecialiseerde modules die verschillende functies binnen de verwerkingspijplijn uitvoeren, waaronder datavalidatie, contextfiltering, ondersteuning bij klinisch redeneren en verificatie van de output. De modulaire organisatie maakt het mogelijk dat taken sequentieel of parallel worden uitgevoerd, wat flexibiliteit biedt voor verschillende verwerkingsvereisten (Figuur 4). Door deze activiteiten over meerdere agenten te verdelen, wordt de afhankelijkheid van één enkel taalmodel verminderd en wordt een robuustere verwerkingsworkflow ondersteund. Deze architecturale strategie is consistent met recente ontwikkelingen in gedistribueerde kunstmatige intelligentie en het ontwerp van intelligente systemen21,22.

Figuur 4: Multi-agent beslissingskader voor klinisch redeneren. Het proces begint met een query van de gebruiker, die wordt geëvalueerd door een agent-checker die verantwoordelijk is voor het beoordelen van de complexiteit van de query. Voor complexe gevallen rekruteert het systeem dynamisch een multidisciplinair team (MDT) van gespecialiseerde agenten die deelnemen aan iteratieve discussierondes om het probleem te analyseren en kennis te synthetiseren voordat er een definitieve beslissing wordt genomen. Voor eenvoudigere gevallen wordt de query afgehandeld door een agent voor eerstelijnszorg (PCC), wat een snellere generatie van het antwoord mogelijk maakt. Deze adaptieve architectuur balanceert efficiëntie en analytische diepgang, waardoor de beslissingskwaliteit en de schaalbaarheid van het systeem in gezondheidszorgtoepassingen worden verbeterd. Klik hier om een grotere versie van deze figuur te bekijken.
Prestatie-evaluatie
De systeemprestaties werden geëvalueerd aan de hand van complementaire metrieken die zowel de linguïstische kwaliteit als de semantische consistentie van de gegenereerde output vastleggen. BLEU werd toegepast om de syntactische gelijkenis te meten op basis van n-gram overlap23, terwijl ROUGE de recall en de dekkingsgraad van de inhoud beoordeelde, in het bijzonder bij taken voor samenvatting en informatie-extractie24. De semantische gelijkenis werd geëvalueerd met BERTScore, dat gebruikmaakt van contextuele embeddings afgeleid van transformer-gebaseerde modellen om gegenereerde teksten en referentieteksten te vergelijken25. Aanvullende analyses omvatten perplexiteit en cosinus-gelijkenis om respectievelijk het modelvertrouwen en de semantische coherentie te onderzoeken26,27.
De geselecteerde evaluatiemetrieken bieden complementaire perspectieven op de systeemprestaties door lexicale en semantische analyses te combineren. Deze combinatie is bijzonder relevant in zorgtoepassingen, waar contextuele interpretatie net zo belangrijk is als lexicale gelijkenis. Het platform werd geëvalueerd in een gecontroleerde computationele omgeving die zowel cloudgebaseerde als lokale implementatie ondersteunt. Lokale uitvoering van LLM's werd als optie opgenomen om te voldoen aan vereisten voor gegevensprivacy en om de afhankelijkheid van externe diensten te verminderen bij het verwerken van gevoelige klinische informatie. Deze implementatiestrategie is compatibel met kaders voor gegevensbescherming en kan worden aangepast aan verschillende operationele omgevingen4.