Forschungsartikel

Interoperable Web-Plattform auf Basis großer Sprachmodelle zur medizinischen Datenanalyse: Ein Protokoll zur Unterstützung klinischer Entscheidungen

49 Aufrufe

DOI:

10.3791/72085

25. August 2026

In diesem Artikel

Zusammenfassung

Dieses Protokoll beschreibt die Implementierung einer interoperablen Webplattform, die FHIR-basierte klinische Daten mit Retrieval-Augmented Generation und Multi-Agent-Modellen mit großer Sprachkapazität für die klinische Entscheidungsunterstützung verbindet. Der Arbeitsablauf ermöglicht eine reproduzierbare Bereitstellung, standardisierte Datenintegration und die Bewertung der Analyse medizinischer Daten mit Unterstützung durch künstliche Intelligenz (AI).

Zusammenfassung

Die klinische Entscheidungsfindung wird häufig durch fragmentierte elektronische Patientenakten und eingeschränkte Interoperabilität zwischen heterogenen Gesundheitsinformationssystemen erschwert. Dieser Artikel stellt ein Schritt-für-Schritt-Protokoll zur Implementierung einer interoperablen Webplattform vor, die klinische Daten über den Standard Fast Healthcare Interoperability Resources (FHIR) integriert und dabei Retrieval-Augmented Generation (RAG), große Sprachmodelle (LLMs) sowie einen mehragentenbasierten klinischen Schlussfolgerungsrahmen nutzt, um die medizinische Datenanalyse und die klinische Entscheidungsunterstützung zu fördern. Das Protokoll beschreibt den gesamten Arbeitsablauf, einschließlich der Konfiguration der Rechenumgebung, der Vorverarbeitung klinischer Datensätze, der datenintegration auf Basis von FHIR, der Erstellung einer Vektordatenbank, der Konfiguration des Abrufs, des Prompt-Engineerings, der Koordination mehrerer Agenten und der Systemevaluierung. Beispiele für Ergebnisse zeigen die Fähigkeit der Plattform, klinisch relevante und kontextuell konsistente Antworten zu generieren, während gleichzeitig die semantische Interoperabilität zwischen heterogenen Datenquellen verbessert wird. Die Systemleistung wurde anhand komplementärer quantitativer und semantischer Metriken bewertet, darunter BLEU, ROUGE, BERTScore und Kosinus-Ähnlichkeit. Eine qualitative Bewertung erfolgte unter Verwendung öffentlich zugänglicher, vollständig anonymisierter Benchmark-Datensätze zur Beurteilung der Reproduzierbarkeit des vorgeschlagenen methodischen Workflows. Die vorgeschlagene Architektur kombiniert standardisierte Gesundheits-Interoperabilität mit abrufverstärkten Sprachmodellen, um kontextuelles Schlussfolgern zu verbessern, Halluzinationen zu reduzieren und reproduzierbare, KI-gestützte klinische Workflows zu unterstützen. Dieses Protokoll bietet einen skalierbaren und reproduzierbaren Rahmen für Forschende und Entwickler, die interoperable, datenschutzfreundliche und intelligente Gesundheitssysteme für die klinische Entscheidungsunterstützung, medizinische Datenanalyse und zukünftige translationale Forschung implementieren möchten.

Einleitung

Gesundheitsinformationen werden routinemäßig in Krankenhäusern, Diagnosezentren, Laboren und ambulanten Kliniken generiert und verbleiben dabei oft in heterogenen Informationssystemen verteilt. Diese Fragmentierung begrenzt die Interoperabilität und erschwert den zeitnahen Zugriff auf umfassende Patientenakten, was nachhaltige Herausforderungen für die klinische Versorgung, die Datenintegration und das Gesundheitsmanagement schafft1,2,3,4.

Die Folgen dieser Fragmentierung werden besonders deutlich in klinischen Arbeitsabläufen, die auf einen zeitnahen Zugriff auf Patienteninformationen angewiesen sind. Wenn medizinisches Fachpersonal nicht vollständige und integrierte Krankenakten abrufen kann, erschwert dies die klinische Beurteilung, erhöht das Risiko unvollständiger Entscheidungsfindung und verringert die Effizienz der Patientenversorgung, insbesondere in Notfallsituationen5,6.

Neuere Entwicklungen in der Künstlichen Intelligenz (KI), insbesondere große Sprachmodelle (Large Language Models, LLMs), haben das Spektrum der verfügbaren rechnergestützten Ansätze für Anwendungen im Gesundheitswesen erweitert. Diese Modelle wurden für Aufgaben wie die Unterstützung bei Diagnosen, die klinische Einordnung von Patienten und die Entscheidungsunterstützung untersucht. Beispielsweise bewerteten Jahan et al.5 den Einsatz von LLMs in biomedizinischen Aufgaben, während Taylor et al.7 feinabgestimmte Modelle für die digitale psychische Gesundheitsvorsorge untersuchten und ermutigende Ergebnisse in spezialisierten klinischen Umgebungen berichteten.

Die Anwendung von LLMs hat sich außerdem auf spezialisiertere klinische Bereiche ausgeweitet. Song et al. 49untersuchten deren Einsatz bei der Diagnose von Pneumokoniosen, während Chien et al.8 diese Modelle zur Analyse von Arbeitsbelastungsmustern bei informellen Pflegepersonen anwandten. In der Augenheilkunde schlugen Xue et al.9 ein Frage-Antwort-System für die Glaukomdiagnose vor, während Tan et al.3 und Wu et al.10 den Einsatz von LLMs in hybriden Diagnosesystemen und bei Beratungen zur traditionellen chinesischen Medizin berichteten.

Die Verwendung von LLMs beschränkt sich nicht auf direkte klinische Anwendungen. Zhang et al.11 untersuchten ihre Anwendung zur Erkennung von Emotionen in psychischen Gesundheitskontexten, während Sarzaeim et al.12 intelligente Polizeisysteme erforschten, die ebenfalls zur Analyse gesundheitsrelevanter Aspekte in der Öffentlichkeit beitragen könnten. Diese Studien verdeutlichen die breite Anwendbarkeit von auf LLMs basierenden Ansätzen in verschiedenen gesundheitsbezogenen Bereichen.

Obwohl große Sprachmodelle die Möglichkeiten für Anwendungen im Gesundheitswesen erweitert haben, ist ihre Integration in klinische Umgebungen weiterhin mit wichtigen technischen, organisatorischen und regulatorischen Herausforderungen verbunden. Eine praktische Implementierung erfordert geeignete Recheninfrastrukturen, effektives Datenmanagement sowie die Einhaltung regulatorischer Rahmenbedingungen wie der Datenschutz-Grundverordnung (DSGVO) und dem brasilianischen Allgemeinen Datenschutzgesetz (LGPD). Diese Rahmenbedingungen legen Anforderungen an die sichere und ethische Verarbeitung sensibler Gesundheitsdaten fest und behandeln dabei Fragen im Zusammenhang mit Datenschutz, Zuverlässigkeit und algorithmischer Voreingenommenheit in KI-gestützten Gesundheitssystemen13,14 .

Die Interoperabilität zwischen heterogenen Gesundheitsdatenquellen, einschließlich elektronischer Patientenakten (EHRs), medizinischen Bildgebungssystemen und Geräten des Internet der Dinge (IoT), stellt weiterhin eine große technische Herausforderung für die Implementierung von KI-gestützten Gesundheitslösungen dar. In diesem Zusammenhang bieten standardisierte Interoperabilitätsrahmenwerke wie HL7 FHIR einen strukturierten Mechanismus zum Austausch klinischer Informationen zwischen verschiedenen Systemen, wobei die semantische Konsistenz erhalten bleibt und eine skalierbare Integration ermöglicht wird.

Diese Arbeit stellt eine interoperable Webplattform vor, die große Sprachmodelle mit Standards für die Interoperabilität im Gesundheitswesen integriert, um die medizinische Datenanalyse in heterogenen klinischen Umgebungen zu unterstützen. Die vorgeschlagene Architektur kombiniert die datenbasierte Integration nach HL7 FHIR mit abrufverstärkter Generierung (Retrieval-Augmented Generation, RAG) und einem Multi-Agenten-Verarbeitungsframework, um kontextbewusste, KI-gestützte Analysen bereitzustellen und gleichzeitig die Einhaltung geltender Datenschutzanforderungen sicherzustellen, darunter das brasilianische Allgemeine Datenschutzgesetz (LGPD).

Dieses Protokoll beschreibt eine interoperable Architektur zur Integration heterogener klinischer Daten mithilfe etablierter Interoperabilitätsstandards im Gesundheitswesen. Außerdem werden die Implementierung einer mehrstufigen Agenten-Verarbeitungspipeline auf der Grundlage großer und kleiner Sprachmodelle (LLMs und SLMs) sowie ein Bewertungsrahmen erläutert, der quantitative Metriken und qualitative Analysen kombiniert, um das Verhalten der vorgeschlagenen Plattform zu beurteilen.

Protokoll

Diese Studie umfasste weder die Rekrutierung von menschlichen Probanden noch den Zugriff auf identifizierbare Patientenakten oder Tierversuche. Das Protokoll wurde ausschließlich anhand öffentlich zugänglicher und vollständig anonymisierter Datensätze zur methodischen Validierung entwickelt und evaluiert. Es erfolgte kein Zugriff auf persönliche Gesundheitsdaten. Daher war keine Genehmigung durch eine zuständige Ethikkommission (IRB oder Research Ethics Committee) erforderlich. Das Protokoll wurde unter Einhaltung geltender Datenschutzgrundsätze, einschließlich des brasilianischen Allgemeinen Datenschutzgesetzes (LGPD), erstellt, um zukünftige Anwendungen mit klinischen Daten zu unterstützen.

Auswahl und Vorverarbeitung des Datensatzes

Das vorgeschlagene Protokoll wurde anhand öffentlich verfügbarer und vollständig anonymisierter klinischer Datensätze evaluiert, die strukturierte Elektronische Patientenakten (EHRs), Daten für klinische Frage-Antwort-Systeme sowie medizinische Bilddatensätze für die methodische Validierung umfassen. Vor der Integration in die Plattform durchliefen die Datensätze standardisierte Vorverarbeitungsschritte, einschließlich Datennormalisierung, Entfernung inkonsistenter oder unvollständiger Einträge, Zuordnung zu HL7 FHIR-Ressourcen, Textbereinigung, Segmentierung in Abrufblöcke und Erzeugung von Einbettungen für die Vektorindizierung. Diese Vorverarbeitungsschritte gewährleisteten semantische Konsistenz über heterogene Datenquellen hinweg, förderten die Interoperabilität und ermöglichten die Reproduzierbarkeit des vorgeschlagenen Workflows, wobei die Einhaltung geltender Datenschutzprinzipien sichergestellt blieb.

Die Datensätze wurden aus öffentlich zugänglichen Benchmark-Repositories bezogen, die üblicherweise in der Forschung zu künstlicher Intelligenz und digitaler Gesundheit verwendet werden. Sie wurden ausgewählt, um heterogene klinische Informationen darzustellen, einschließlich strukturierter Elektronischer Gesundheitsakten (EHRs), unstrukturierter klinischer Texte, klinischer Frage-Antwort-Aufgaben sowie Metadaten zu medizinischen Bildgebungsverfahren. Anstatt eine bestimmte klinische Kohorte zu evaluieren, konzentriert sich das Protokoll auf die Demonstration eines reproduzierbaren Implementierungsworkflows, der an verschiedene Datensätze im Gesundheitswesen angepasst werden kann. Die Vielfalt dieser Benchmark-Datensätze ermöglicht die Validierung der Interoperabilitätspipeline, der Retrieval-Augmented Generation (RAG) sowie des Multi-Agenten-Reasoning-Frameworks über mehrere klinische Datenmodi hinweg.

Konfiguration der experimentellen Umgebung

Die experimentelle Umgebung wurde eingerichtet, um die interoperable Plattform unter kontrollierten und reproduzierbaren Bedingungen zu evaluieren. Die Architektur umfasst Module für die Datenaufnahme, Interoperabilitätsebenen, große Sprachmodelle (LLMs) und Evaluierungskomponenten, die zu einer einzigen Verarbeitungspipeline für die Analyse medizinischer Daten zusammengefasst sind. Abbildung 1 veranschaulicht den gesamten Workflow, von der Aufnahme klinischer Daten bis hin zur Generierung diagnostischer Ergebnisse.

Diagramm zur EHR-Datenverarbeitung; Filterung klinischer Notizen; Krankheitsinferenz mittels LLM; Diagnoseprozess.
Abbildung 1: Übergreifender Systemarbeitsablauf, der die Verarbeitungspipeline von rohen klinischen Daten bis zur Ausgabe des Krankheitsstatus veranschaulicht. Der Prozess beginnt mit der Erfassung elektronischer Gesundheitsakten (EHR), gefolgt von einer Datenfilterung und -vorverarbeitung, um krankheitssensitive Informationen zu extrahieren. In einer Phase der strukturierten Prompt-Entwicklung werden Expertenwissen, Krankheitsdefinitionen und Hyperparameter integriert, um eine effektive Interaktion mit dem großen Sprachmodell (LLM) zu ermöglichen. Das LLM führt eine Textinferenz durch, um kontextbezogene Antworten zu generieren, die anschließend mithilfe klinischer Regeln bewertet werden, um den endgültigen Krankheitsstatus zu bestimmen. Der Arbeitsablauf verdeutlicht die Integration von Datenvorverarbeitung, wissensbasiertem Prompting und KI-gestützter Inferenz zur Unterstützung klinischer Entscheidungsfindung. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Architektur der Gesundheitsversorgungs-Interoperabilität

Die Backend-Infrastruktur verwendet eine modulare Architektur auf Basis von RESTful-APIs, um die Kommunikation zwischen den Plattformkomponenten zu unterstützen (Abbildung 2). Diese Architektur ermöglicht die Verarbeitung heterogener klinischer Informationen, einschließlich strukturierter Elektronischer Gesundheitsakten (EHRs), Arztnotizen und Metadaten aus medizinischen Bildgebungssystemen. Da diese Daten aus mehreren Quellen und Formaten stammen, wird Interoperabilität durch standardisierte Datenmodelle erreicht, insbesondere durch den Fast-Healthcare-Interoperability-Resources-(FHIR-)Standard15,16,17. Die Verwendung von FHIR unterstützt den Austausch strukturierter Informationen und bewahrt gleichzeitig Skalierbarkeit und Flexibilität in verteilten Gesundheitsumgebungen. HL7-basierte Kommunikationsmechanismen wurden ebenfalls integriert, um die Anbindung an bestehende klinische Systeme zu erleichtern, die nach wie vor in vielen Gesundheitseinrichtungen weit verbreitet sind16,17.

Flask-API-Diagramm mit POST/GET-Anfragen, MySQL-Abfragen und FAISS-Vektor-Speicher-Integration.
Abbildung 2: Systemarchitektur der vorgeschlagenen interoperablen Plattform. Die Web-Oberfläche kommuniziert über eine Flask-API mittels HTTP-POST/GET-Anfragen mit dem Backend. Die API übernimmt das Routing, die Abfrageverarbeitung sowie die Interaktion mit strukturierten und unstrukturierten Datenquellen. Eine MySQL-Datenbank speichert die strukturierten klinischen Daten, während ein auf FAISS basierender Vektor-Speicher die Ähnlichkeitssuche für Abrufoperationen unterstützt. Die auf LLaMA basierende Pipeline verarbeitet textuelle Eingaben und erzeugt Antworten mithilfe von Vektorrepräsentationen, wodurch Generierung mit Abrufunterstützung (Retrieval-Augmented Generation, RAG) ermöglicht wird. Die Architektur verdeutlicht die Integration von Webdiensten, Datenbankverwaltung, Vektorabruf und Inferenz großer Sprachmodelle in einem einheitlichen System. Bitte klicken Sie hier, um eine vergrößerte Darstellung dieser Abbildung anzusehen.

Konfiguration eines Multi-Agenten-Workflows

Die Multi-Agenten-Architektur ist in spezialisierte funktionale Agenten unterteilt, die für unterschiedliche Phasen des Arbeitsablaufs verantwortlich sind. Ein Vorverarbeitungs-Agent führt die Daten-Normalisierung und FHIR-Zuordnung durch, gefolgt von einem Abruf-Agenten, der für die semantische Suche innerhalb der Vektordatenbank zuständig ist. Ein Schlussfolgerungs-Agent integriert den abgerufenen Kontext mit dem LLM, um Antworten zu generieren, während ein Validierungs-Agent die Konsistenz und Formatierung der Ausgabe überprüft, bevor die endgültige Antwort zurückgegeben wird. Die Koordination der Agenten folgt einer sequenziellen Orchestrierungsstrategie, bei der die Ausgabe jedes Agenten als Eingabe für die nachfolgende Phase dient, um eine reproduzierbare und modulare Implementierung sicherzustellen.

Klinische Datenintegration

Die Datenebene zur Integration aggregiert Informationen aus mehreren klinischen Quellen und bereitet sie für die nachgeschaltete Verarbeitung auf. Die Vorverarbeitung umfasst die Normalisierung der Daten, die Tokenisierung und die Entitätsabstimmung, um die semantische Konsistenz über heterogene Datensätze hinweg zu verbessern. Da klinische Informationen in Struktur und Qualität variieren, tragen diese Schritte dazu bei, Störungen zu reduzieren und die Interaktion mit KI-Modellen zu erleichtern. Zudem wurden strukturierte Zuordnungsstrategien angewandt, um unterschiedliche Datenformate zu harmonisieren und die Kompatibilität mit der Verarbeitungspipeline sicherzustellen, wie in Abbildung 315,16,17 veranschaulicht.

Diagramm des medizinischen Entscheidungsfindungsprozesses; Schritte: Komplexitätsbewertung der Anfrage, Rekrutierung, Analyse, Synthese.
Abbildung 3: Detailliertes Beispiel des klinischen Multi-Agenten-Schlussfolgerungsprozesses. Die Abbildung veranschaulicht, wie eine klinische Anfrage in mehreren Stufen analysiert wird, einschließlich der Bewertung der Komplexität, der Rekrutierung von Spezialisten, der kollaborativen Diskussion und der endgültigen Entscheidungsfindung. Dieser Prozess zeigt die Fähigkeit des Systems, Schlussfolgerungsstrategien dynamisch an die Komplexität der Anfrage anzupassen, wodurch sowohl die Effizienz als auch die diagnostische Genauigkeit in Szenarien der klinischen Entscheidungsunterstützung verbessert werden. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Konfigurieren der Retrieval-Augmented-Generation-Pipeline

Die Abrufverstärkte Generierung (Retrieval-Augmented Generation, RAG) wird integriert, um eine kontextbewusste Analyse zu ermöglichen, indem die Informationsabrufung mit den generativen Fähigkeiten großer Sprachmodelle kombiniert wird. Benutzeranfragen werden mithilfe von Embedding-Modellen in Vektorrepräsentationen umgewandelt und mittels semantischem Ähnlichkeitssuchverfahren mit der Vektordatenbank abgeglichen, um die relevantesten kontextuellen Textpassagen abzurufen. Die abgerufenen Dokumente werden anschließend vor der Inferenz durch das große Sprachmodell (LLM) mit der ursprünglichen Anfrage kombiniert. Diese Strategie trägt dazu bei, während der Antwortgenerierung kontextuelle Informationen bereitzustellen, und wurde mit verbesserter Faktentreue sowie einer Verringerung von Halluzinationen in wissensintensiven Anwendungen, einschließlich des Gesundheitswesens18,19., in Verbindung gebracht. Abbildung 1 und Abbildung 3 veranschaulichen den gesamten Abrufarbeitsablauf und den entsprechenden Schlussfolgerungsprozess.

Für jede Benutzeranfrage wird der endgültige Prompt dynamisch erstellt, indem die ursprüngliche Anfrage mit den relevantesten kontextuellen Passagen kombiniert wird, die aus der Vektordatenbank abgerufen wurden. Die abgerufenen Informationen werden als kontextuelle Belege vor der Inferenz eingefügt, wodurch das Sprachmodell Antworten erzeugen kann, die auf dem abgerufenen medizinischen Wissen basieren, wobei die semantische Konsistenz erhalten bleibt und unbegründete Aussagen reduziert werden.

Generierung von Prompts und mehrstufige Schlussfolgerungen

Das Protokoll beinhaltet strukturierte Aufforderungsstrategien, um die kontextuelle Interpretation während der Antwortgenerierung zu verbessern. Diese Aufforderungstechniken, zusammen mit fortschrittlichen Schlussfolgerungsmechanismen, unterstützen den Schlussfolgerungsprozess in komplexen klinischen Szenarien und entsprechen jüngsten Entwicklungen, die in der Literatur berichtet wurden20.

Die Architektur umfasst ein Multi-Agenten-Framework, das aus spezialisierten Modulen besteht, welche im Verarbeitungspipeline unterschiedliche Funktionen ausführen, darunter Datenvalidierung, Kontextfilterung, Unterstützung klinischer Schlussfolgerungen und Überprüfung der Ausgabe. Die modulare Organisation ermöglicht die sequenzielle oder parallele Ausführung von Aufgaben und bietet somit Flexibilität für verschiedene Verarbeitungsanforderungen (Abbildung 4). Die Verteilung dieser Aktivitäten auf mehrere Agenten verringert die Abhängigkeit von einem einzelnen Sprachmodell und unterstützt einen robusteren Verarbeitungsablauf. Diese architektonische Strategie entspricht aktuellen Entwicklungen im Bereich der verteilten künstlichen Intelligenz und des Designs intelligenter Systeme21,22.

Abbildungsübersicht zum Abfrageprozess; Entscheidungsfluss für einfache und komplexe medizinische Probleme; Teamanalyse.
Abbildung 4: Entscheidungsrahmen mit mehreren Agenten für klinisches Denken. Der Prozess beginnt mit einer Nutzeranfrage, die von einem Agentenprüfer bewertet wird, der für die Einschätzung der Komplexität der Anfrage zuständig ist. Bei komplexen Fällen rekrutiert das System dynamisch ein fachübergreifendes Team (MDT) spezialisierter Agenten, das mehrere Diskussionsrunden durchführt, um das Problem zu analysieren und Wissen zu integrieren, bevor eine endgültige Entscheidung getroffen wird. Einfachere Fälle werden von einem Hausarztagenten (PCC) bearbeitet, wodurch schnellere Antwortgenerierung ermöglicht wird. Diese adaptive Architektur sorgt für ein Gleichgewicht zwischen Effizienz und analytischer Tiefe und verbessert so die Entscheidungsqualität sowie die Skalierbarkeit des Systems in medizinischen Anwendungen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Leistungsbeurteilung

Die Systemleistung wurde mithilfe komplementärer Metriken bewertet, die sowohl die sprachliche Qualität als auch die semantische Konsistenz der erzeugten Ausgaben erfassen. BLEU wurde angewandt, um die syntaktische Ähnlichkeit basierend auf dem Überlappungsgrad von n-Grammen zu messen23, während ROUGE Rückrufrate und Inhaltsabdeckung bewertete, insbesondere bei Aufgaben wie Textzusammenfassung und Informationsgewinnung24. Die semantische Ähnlichkeit wurde mit BERTScore analysiert, der kontextuelle Embeddings aus transformerbasierten Modellen nutzt, um erzeugte und Referenztexte zu vergleichen25. Zusätzliche Analysen umfassten die Perplexität und die Kosinus-Ähnlichkeit, um jeweils das Modellvertrauen und die semantische Kohärenz zu untersuchen26,27.

Die ausgewählten Evaluierungsmetriken bieten komplementäre Perspektiven auf die Systemleistung, indem sie lexikalische und semantische Analysen kombinieren. Diese Kombination ist besonders relevant für Anwendungen im Gesundheitswesen, bei denen die kontextuelle Interpretation ebenso wichtig ist wie die lexikalische Ähnlichkeit. Die Plattform wurde in einer kontrollierten rechnergestützten Umgebung evaluiert, die sowohl cloudbasierte als auch lokale Bereitstellung unterstützt. Die lokale Ausführung von LLMs wurde als Option einbezogen, um die Anforderungen an den Datenschutz zu erfüllen und die Abhängigkeit von externen Diensten bei der Verarbeitung sensibler klinischer Informationen zu verringern. Diese Bereitstellungsstrategie ist mit Datenschutzrahmenwerken kompatibel und kann an verschiedene betriebliche Umgebungen angepasst werden4.

Ergebnisse

Die Systemleistung wurde mithilfe ergänzender quantitativer Metriken sowie einer qualitativen Analyse bewertet, um sowohl die sprachliche Genauigkeit als auch die semantische Konsistenz der erzeugten Ausgaben zu überprüfen. Diese Evaluationsstrategie kombiniert lexikalische und semantische Maße, um ein umfassenderes Bild des Modellverhaltens bei sprachgenerierenden Aufgaben im Gesundheitswesen zu erhalten.

Tabelle 1 zeigt die quantitativen Ergebnisse, die mit BLEU, ROUGE und BERTScore erzielt wurden. Diese Metriken wurden ausgewählt, da sie komplementäre Aspekte des generierten Textes bewerten, einschließlich lexikalischer Ähnlichkeit, Informationsabdeckung und semantischer Übereinstimmung, und in der Forschung zur natürlichen Sprachverarbeitung weit verbreitet sind.

RichterAufforderungPearsonRMSEMAETrefferquote
Mixtralkurz0.0981.7791.3466/28
Zero-Shot0.1741.6181.29315/28
Few-Shot0.4751.6731.3679/28
LLaMA 3kurz0.4851.6171.31411/28
Zero-Shot0.4791.6141.31410/28
Few-Shot0.4251.6521.33913/28
LLaMA 3.1kurz0.3491.6211.31806/28
Zero-Shot0.681.6141.30712/28
Few-Shot0.4081.2430.88611/28

Tabelle 1: Quantitative Bewertungsmetriken des vorgeschlagenen Systems.

BLEU wurde verwendet, um die syntaktische Ähnlichkeit basierend auf der Überlappung von n-Grammen zwischen generierten Ausgaben und Referenztexten zu quantifizieren23. Ursprünglich für die maschinelle Übersetzung entwickelt, wurde es auch auf eine breite Palette von Textgenerierungsaufgaben angewandt, da es die strukturelle Übereinstimmung zwischen Texten erfasst. In der vorliegenden Bewertung zeigen die BLEU-Scores, dass die generierten Antworten syntaktische Merkmale bewahren, die mit den Referenzausgaben übereinstimmen.

ROUGE wurde verwendet, um die erinnerungsorientierte Ähnlichkeit zu bewerten, wobei der Schwerpunkt auf der Abdeckung relevanter Informationen in den generierten Texten lag24. In Anwendungen im Gesundheitswesen ist diese Metrik besonders nützlich, da die Wahrung klinisch relevanter Informationen oft wichtiger ist als die exakte Wiedergabe der Formulierung. Wie in Tabelle 2 berichtet, zeigen die ROUGE-Werte, dass die generierten Antworten relevante klinische Inhalte über alle evaluierten Fälle hinweg beibehalten.

RichterAufforderungICC1ICC2ICC3ICC1kICC2kICC3K
Mixtralkurz0.1360.1640.1820.320.370.4
Zero-Shot0.280.3530.5070.5390.6210.755
Few-Shot0.2240.3230.5220.4630.5880.766
LLaMA3kurz0.2340.3310.5320.4790.5970.773
Zero-Shot0.2440.340.5510.4920.6070.786
Few-Shot0.2180.3210.5310.4560.5870.772
LLaMA3.1kurz0.5210.5250.5370.7660.7680.777
Zero-Shot0.2460.3430.560.4950.6110.792
Few-Shot0.5990.5970.5890.8170.8160.811

Tabelle 2: Metriken zur Übereinstimmung zwischen Bewertern (ICC).

BERTScore wurde einbezogen, um die semantische Ähnlichkeit anhand kontextueller Einbettungen zu bewerten, die aus transformerbasierten Modellen abgeleitet sind25. Im Gegensatz zu BLEU und ROUGE vergleicht dieses Maß Texte anhand ihrer kontextuellen Bedeutung statt anhand lexikalischer Überschneidungen, wodurch es geeignet für die Bewertung der generierten klinischen Sprache ist. Die in dieser Studie erzielten BERTScore-Werte deuten auf ein hohes Maß an semantischer Übereinstimmung zwischen den generierten Antworten und den entsprechenden Referenztexten hin.

Zusätzliche Analysen umfassten die Berechnung der Perplexität und der Kosinus-Ähnlichkeit, um die primären Evaluierungsmetriken zu ergänzen. Die Perplexität wurde ermittelt, um die Vorhersagbarkeit der erzeugten Texte abzuschätzen, wobei niedrigere Werte auf eine geringere Unsicherheit während der Textgenerierung hinweisen26. Die Kosinus-Ähnlichkeit diente dazu, die Ausrichtung zwischen aus den generierten und Referenztexten abgeleiteten Embedding-Vektoren zu quantifizieren und lieferte so ein zusätzliches Maß für semantische Kohärenz27.

Insgesamt liefern die Evaluierungsmetriken komplementäre Informationen zu den syntaktischen, semantischen und kontextuellen Eigenschaften der generierten Antworten. Abbildung 5 fasst die Verteilung der Evaluierungsergebnisse über die bewerteten Metriken hinweg zusammen und bietet einen Gesamtüberblick über die Systemleistung unter den getesteten Bedingungen.

Die Bewertungsergebnisse stimmen mit dem erwarteten Verhalten der abrufverstärkten Generierung (Retrieval-Augmented Generation, RAG) in Anwendungen überein, die den Zugriff auf externe Wissensquellen erfordern. Durch die Einbindung abgerufener Dokumente in den Antwortgenerierungsprozess stellt die Architektur zusätzliche kontextuelle Informationen bereit, die klinisch relevante Antworten in wissensintensiven Szenarien unterstützen18,19. Strukturierte Prompting-Strategien werden als ergänzende Mechanismen integriert, um den Schlussfolgerungsprozess und die kontextuelle Interpretation zu steuern, was Ansätzen entspricht, die in jüngsten Studien beschrieben wurden20.

Die qualitative Analyse ergänzte die quantitative Bewertung, indem sie die Interpretierbarkeit und klinische Relevanz der generierten Ergebnisse untersuchte. Repräsentative Beispiele für Systemantworten sind in Abbildung 3 für verschiedene Arten klinischer Anfragen dargestellt. Diese Beispiele veranschaulichen, wie die Plattform kontextuell kohärente Antworten in den verschiedenen evaluierten Szenarien erzeugt, einschließlich Fälle mit komplexeren klinischen Informationen.

Die Multi-Agenten-Architektur verteilt Verarbeitungsaufgaben auf spezialisierte Module, die für komplementäre Funktionen innerhalb des Workflows zuständig sind. Diese Organisation verringert die Abhängigkeit von einem einzelnen Sprachmodell und ermöglicht mehrere Stufen der Informationsverarbeitung sowie die Überprüfung der Ergebnisse, was mit aktuellen Multi-Agenten-Ansätzen aus der Literatur übereinstimmt21,22. Abbildung 5 fasst die Verteilung der Bewertungsergebnisse zusammen, die mit den verschiedenen in dieser Studie betrachteten Prompting-Strategien und Sprachmodellen erzielt wurden.

Violin-Diagramme zum Vergleich motivierender Aufforderungen, Methoden: Pearson, MAI, M/W CE; bildungsanalytische Analyse.
Abbildung 5: Leistungsverteilung des vorgeschlagenen Systems über verschiedene Aufforderungsstrategien und Sprachmodelle hinweg. (A–F) Die Violin-Diagramme veranschaulichen Unterschiede in der Antwortqualität bei kurzen, Zero-Shot- und Few-Shot-Aufforderungsansätzen unter Verwendung der Modelle LLaMA3, LLaMA3.1 und Mixtral. Die Ergebnisse verdeutlichen den Einfluss des Aufforderungsdesigns auf die Konsistenz und Leistung der Ausgaben und zeigen, dass strukturierte Aufforderungsstrategien tendenziell stabilere und genauere Antworten bei klinischen Aufgaben erzeugen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Die Evaluierungsergebnisse stimmen mit aktuellen Studien überein, die die Kombination lexikalischer und semantischer Metriken zur Leistungsbeurteilung großer Sprachmodelle empfehlen4,12. Insbesondere Metriken auf Basis von Embeddings haben an Bedeutung gewonnen, um die kontextuelle Ähnlichkeit bei der sprachlichen Generierung im Gesundheitswesen zu erfassen, wo die semantische Interpretation über das bloße lexikalische Übereinstimmen hinausgeht28,29.

Insgesamt zeigt die Bewertung, dass die vorgeschlagene Plattform Interoperabilitätsstandards, die abrufverstärkte Generierung (Retrieval-Augmented Generation, RAG) und die Verarbeitung durch mehrere Agenten in einem einheitlichen Rahmen für die Analyse von Gesundheitsdaten integriert. Die in dieser Studie vorgestellten quantitativen und qualitativen Ergebnisse untermauern die Durchführbarkeit des vorgeschlagenen Workflows unter den untersuchten experimentellen Bedingungen und legen eine Grundlage für zukünftige Validierungen in realen klinischen Umgebungen.

VERFÜGBARKEIT VON DATEN

Die in dieser Studie verwendeten Datensätze sind öffentlich verfügbar. Der Röntgen-Thorax-Datensatz wurde aus der Indiana University Chest X-ray Collection (Open-i, U.S. National Library of Medicine) bezogen, einschließlich der Dateien indiana_reports.csv und indiana_projections.csv, verfügbar unter https://openi.nlm.nih.gov/. Der MedQA-Benchmark-Datensatz ist öffentlich über sein offizielles Repository zugänglich. Es wurden keine proprietären oder patientenidentifizierbaren klinischen Daten in dieser Studie verwendet. Alle Vorverarbeitungsschritte sind im Abschnitt „Protokoll“ beschrieben, um die Reproduzierbarkeit zu gewährleisten.

Diskussion

Die in dieser Studie vorgestellte Bewertung stellt eine methodische Validierung dar, die anhand öffentlich zugänglicher und vollständig anonymisierter Benchmark-Gesundheitsdatensätze durchgeführt wurde. Es erfolgte keine prospektive klinische Validierung mit Gesundheitsfachkräften oder Patientenrekrutierung, da das Ziel dieser Arbeit darin besteht, ein reproduzierbares Implementierungsprotokoll und nicht die klinische Wirksamkeit zu demonstrieren.

Die Ergebnisse dieser Studie deuten darauf hin, dass die Kombination von Standards für die Interoperabilität im Gesundheitswesen mit großen Sprachmodellen einen praktischen Rahmen für die Integration heterogener klinischer Informationen bietet. Die vorgeschlagene Architektur vereint strukturierte Datenaustauschmechanismen, einschließlich FHIR und HL7, mit KI-basierter Sprachverarbeitung in einem einheitlichen Workflow, der mit den aktuellen Entwicklungen in digitalen Gesundheitssystemen übereinstimmt15,16,17.

Ein wichtiger Aspekt des vorgeschlagenen Workflows ist die Integration der Retrieval-Augmented Generation (RAG) in eine Multi-Agenten-Architektur. In dieser Konfiguration liefern abgerufene Dokumente zusätzliche kontextuelle Informationen während der Antwortgenerierung und unterstützen wissensintensive klinische Aufgaben. Dieses architektonische Design entspricht aktuellen Studien, die abrufbasierte Mechanismen als Strategie zur Verbesserung der kontextuellen Fundierung und Zuverlässigkeit von Antworten in Anwendungen großer Sprachmodelle beschreiben18,19.

Strukturierte Prompting-Strategien wurden in den vorgeschlagenen Workflow integriert, um die kontextuelle Interpretation während der Antwortgenerierung zu unterstützen. Frühere Studien haben berichtet, dass Prompt-Engineering und strukturierte Schlussfolgerungstechniken die Leistung großer Sprachmodelle bei komplexen Entscheidungsaufgaben verbessern können20. Der in diesem Protokoll angewandte Ansatz steht im Einklang mit diesen Entwicklungen und bietet einen strukturierten Rahmen für die Verarbeitung klinischer Sprache.

Aus evaluativer Sicht ermöglichte die Verwendung komplementärer Metriken, verschiedene Dimensionen der Systemleistung zu untersuchen. Während BLEU und ROUGE Informationen über die syntaktische Ähnlichkeit und Inhaltsabdeckung liefern23,24, erfassen embeddingsbasierte Metriken wie BERTScore semantische Beziehungen, die allein durch lexikalische Überschneidungen möglicherweise nicht widergespiegelt werden25. Diese mehrdimensionale Evaluationsstrategie stimmt mit jüngsten Benchmarking-Studien überein, die empfehlen, lexikalische und semantische Maße bei der Bewertung großer Sprachmodelle in Gesundheitsanwendungen zu kombinieren4,12.

Der vorgeschlagene Arbeitsablauf bietet einen reproduzierbaren methodischen Rahmen für die Implementierung interoperabler, auf künstlicher Intelligenz basierender klinischer Entscheidungsunterstützungssysteme. Anstatt verschiedene Architekturen der künstlichen Intelligenz gegeneinander zu bewerten, konzentriert sich diese Studie darauf, den gesamten Implementierungsarbeitsablauf, die Systemarchitektur, Interoperabilitätsmechanismen und die Evaluierungsmethodik zu dokumentieren, um Reproduzierbarkeit und zukünftige Übernahme zu erleichtern. Vergleichende Analysen, die konventionelle große Sprachmodelle, Konfigurationen ohne RAG, feinabgestimmte Modelle oder traditionelle maschinelle Lernverfahren einbeziehen, liegen außerhalb des Rahmens dieses methodischen Beitrags und stellen eine wichtige Richtung für zukünftige Forschung dar.

Die zukünftige Übertragung des vorgeschlagenen Rahmens in reale klinische Umgebungen erfordert eine zusätzliche Validierung mit Angehörigen der Gesundheitsberufe sowie die Einhaltung der geltenden regulatorischen und ethischen Anforderungen. Je nach beabsichtigter Verwendung können solche Systeme den Vorschriften für Software als medizinisches Gerät (SaMD) unterliegen und müssen den Anforderungen der zuständigen Aufsichtsbehörden entsprechen, darunter die U.S. Food and Drug Administration (FDA) und die europäische Verordnung über Medizinprodukte (MDR). Darüber hinaus werden robuste Datenhoheit, Cybersicherheit, Transparenz und klinische Sicherheitspraktiken entscheidend sein, um einen sicheren und verantwortungsvollen Einsatz in Gesundheitseinrichtungen zu gewährleisten.

Die qualitative Analyse ergänzte die quantitative Bewertung, indem sie die Merkmale der generierten Antworten anhand repräsentativer klinischer Szenarien veranschaulichte. Die dargestellten Beispiele zeigen, dass die Plattform in der Lage war, unter den untersuchten Bedingungen kontextuell kohärente Antworten zu erzeugen, wodurch zusätzliche Einblicke in die Interpretierbarkeit der Antworten über die quantitativen Metriken hinaus gewonnen wurden. Ähnliche Beobachtungen wurden in Studien berichtet, die große Sprachmodelle auf klinische Anwendungen anwenden, einschließlich der Unterstützung bei der Diagnosestellung und der Interaktion mit Patienten28,29,30,31.

Die vorgeschlagene Architektur verteilt Verarbeitungsaufgaben auf spezialisierte Module, die für komplementäre Funktionen zuständig sind, darunter Datenvalidierung, kontextuelle Filterung, Unterstützung klinischen Schließens und Ausgabeverifikation. Diese modulare Organisation verringert die Abhängigkeit von einem einzelnen Sprachmodell und ermöglicht aufeinanderfolgende Stufen der Informationsverarbeitung innerhalb des Workflows. Ähnliche architektonische Strategien wurden in jüngsten Studien zu verteilten KI-Systemen und Multi-Agenten-Frameworks beschrieben, die für komplexe Entscheidungsumgebungen konzipiert sind21,22.

Mehrere Aspekte bei der Implementierung können die Reproduzierbarkeit und Bereitstellung des vorgeschlagenen Protokolls erleichtern. Eine konsistente Abbildung klinischer Informationen auf den HL7-FHIR-Standard trägt dazu bei, die semantische Interoperabilität während der gesamten Datenverarbeitungspipeline aufrechtzuerhalten. Ebenso beeinflussen die Dokumentenvorverarbeitung, Strategien zur Aufteilung in Abschnitte, die Erzeugung von Embeddings und die Vektorindizierung das Verhalten des Retrieval-Augmented-Generation-Workflows und sollten entsprechend den Eigenschaften der Zielanwendung konfiguriert und validiert werden. Mithilfe domänenspezifischen Wissens und Expertenfeedback kann die Prompt-Engineering sowie die Orchestrierung mehrerer Agenten schrittweise verbessert werden, um die kontextuelle Fundierung während der Antwortgenerierung zu optimieren. Diese Implementierungspraktiken entsprechen aktuellen Entwicklungen im Bereich vertrauenswürdige künstliche Intelligenz und retrieval-erweiterte Sprachmodelle18,19,20.

Einige Einschränkungen dieser Studie sollten anerkannt werden. Obwohl die Bewertung komplementäre quantitative und qualitative Metriken kombinierte, erfassen diese Maßnahmen möglicherweise nicht alle Aspekte der klinischen Entscheidungsfindung vollständig. Diese Beobachtung stimmt mit früheren Studien überein, die fachspezifische Bewertungsrahmen für Anwendungen im Gesundheitswesen empfehlen12. Außerdem wurde die Plattform unter kontrollierten Bedingungen mithilfe öffentlich zugänglicher und anonymisierter Benchmark-Datensätze evaluiert, die die Variabilität und Komplexität realer klinischer Umgebungen möglicherweise nicht vollständig widerspiegeln.

Die vorgeschlagene Plattform wurde gemäß etablierter Standards für die Interoperabilität im Gesundheitswesen entwickelt. Die Anwendung von HL7 und FHIR unterstützt den strukturierten Datenaustausch zwischen heterogenen Informationssystemen im Gesundheitswesen und bietet einen standardisierten Rahmen zur Integration klinischer Informationen aus mehreren Quellen. Dieser architektonische Ansatz steht im Einklang mit aktuellen Bemühungen, interoperable KI-Systeme für verteilte Gesundheitsumgebungen zu entwickeln15,16,17.

Die erfolgreiche Implementierung des vorgeschlagenen Workflows hängt von mehreren kritischen methodischen Schritten ab. Zunächst sollten klinische Daten konsistent auf standardisierte HL7 FHIR-Ressourcen abgebildet werden, um die semantische Interoperabilität zwischen heterogenen Gesundheitssystemen zu gewährleisten15,17. Zweitens muss die Dokumentenvorverarbeitung – einschließlich Normalisierung, Chunking-Strategie und Erzeugung von Embeddings – sorgfältig konfiguriert werden, da diese Phasen die Abrufqualität in der Retrieval-Augmented Generation (RAG)-Pipeline direkt beeinflussen19,32,33. Drittens sollte die Vektordatenbank jedes Mal neu erstellt werden, wenn die Wissensbasis aktualisiert wird, um die Konsistenz zwischen indizierten Dokumenten und Abruffergebnissen aufrechtzuerhalten. Schließlich sollten Prompt-Engineering und die Orchestrierung mehrerer Agenten iterativ anhand repräsentativer klinischer Szenarien validiert werden, um die kontextuelle Genauigkeit zu verbessern, Halluzinationen zu minimieren und die Reproduzierbarkeit von KI-gestützten klinischen Entscheidungsunterstützungs-Workflows zu erhöhen4,3,20,31.

Aus Sicht der Fehlersuche umfassen häufige Implementierungsherausforderungen eine unvollständige FHIR-Ressourcen-Mapping, eine verminderte Abrufleistung aufgrund der Dokumentenindizierung oder der Konfiguration der Vektordatenbank sowie Antworten, die durch unzureichende Kontextinformationen oder suboptimales Prompt-Engineering beeinträchtigt sind. Diese Probleme können durch die Validierung von Interoperabilitätsressourcen, die Optimierung von Abrufparametern, das regelmäßige Aktualisieren oder Neuaufbauen der Vektordatenbank nach Änderungen an der Wissensbasis sowie eine kontinuierliche Bewertung mithilfe komplementärer lexikalischer und semantischer Metriken behoben werden. Diese Maßnahmen unterstützen ein konsistentes Systemverhalten und erleichtern die Bereitstellung und Wartung von KI-gestützten klinischen Entscheidungsunterstützungs-Workflows4,12,25,23..

Aus praktischer Sicht erfordert der Einsatz großer Sprachmodelle in Gesundheitsumgebungen die Berücksichtigung der verfügbaren Rechenressourcen und Infrastrukturvoraussetzungen. Obwohl die vorgeschlagene Architektur sowohl cloudbasierte als auch lokale Ausführung unterstützt, können je nach Umfang der Bereitstellung und den verfügbaren Rechenressourcen, insbesondere in ressourcenbeschränkten Umgebungen, zusätzliche Optimierungsstrategien erforderlich sein4.

Zukünftige Forschungsarbeiten könnten den vorgeschlagenen Arbeitsablauf erweitern, indem sie die Plattform mit realen klinischen Datensätzen und routinemäßigen Gesundheitsversorgungsabläufen evaluieren. Weitere Untersuchungen könnten zudem strategien zur domänenspezifischen Feinabstimmung sowie die Integration erklärbarer KI-Methoden erforschen, um die Modellinterpretierbarkeit zu verbessern und Transparenz während der klinischen Entscheidungsunterstützung zu gewährleisten. Diese Ansätze könnten zu einer umfassenderen Bewertung der Plattform in praktischen Gesundheitsversorgungsumgebungen beitragen.

Insgesamt stellt diese Arbeit einen reproduzierbaren Rahmen für die Integration von Standards zur Interoperabilität im Gesundheitswesen, der abrufverstärkten Generierung (Retrieval-Augmented Generation, RAG) und mehrteiligen Architekturen von Sprachmodellen in einen einheitlichen Workflow zur klinischen Datenverarbeitung vor. Das vorgeschlagene Protokoll bietet einen strukturierten Ansatz zur Implementierung und Bewertung von KI-gestützten Systemen zur medizinischen Datenanalyse und kann als Referenz für zukünftige Entwicklungen im Bereich interoperabler klinischer Entscheidungsunterstützung dienen.

Offenlegungen

Die Autoren erklären, dass keine konkurrierenden finanziellen Interessen oder persönliche Beziehungen bestehen, die die in diesem Manuskript beschriebene Arbeit beeinflusst haben könnten. Generative KI-Tools (künstliche Intelligenz) wurden ausschließlich zur Unterstützung bei der Sprachbearbeitung, Grammatikkorrektur und Verbesserung der Lesbarkeit des Manuskripts eingesetzt. Alle wissenschaftlichen Inhalte, die Studiendurchführung, die Methodik, die Datenanalyse, die Ergebnisinterpretation sowie redaktionelle Entscheidungen wurden von den Autoren entwickelt, überprüft und genehmigt, die die vollständige Verantwortung für den Inhalt dieses Manuskripts übernehmen.

Danksagungen

Die Autoren möchten dem Labor für eingebettete und verteilte Systeme (LESC) der Bundesuniversität von Ceará (UFC) für die Bereitstellung der Forschungsumgebung und technischer Diskussionen danken, die die Entwicklung dieser Arbeit unterstützt haben. Die Autoren danken außerdem den Entwicklern und Betreuern der Open-Source-Software, Interoperabilitätsstandards und öffentlich zugänglichen Datensätze, die in dieser Studie verwendet wurden.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
FAISSMeta Platforms Inc.Version 1.8.0Vektorbasierte Datenbank zur Ähnlichkeitssuche in der Retrieval-Augmented-Generation-(RAG-)Pipeline.
FHIR-StandardHL7 InternationalRelease 4 (R4)Gesundheitsinteroperabilitätsstandard für den strukturierten Austausch klinischer Daten.
FlaskPallets ProjectsVersion 3.0.3Python-Webframework zur Implementierung der RESTful-Backend-API.
HL7-StandardHL7 InternationalVersion 2.xVeralteter Nachrichtenprotokollstandard für die Interoperabilität mit Krankenhausinformationssystemen.
HTTP-REST-APIIndividuelle ImplementierungNicht zutreffendRESTful-Kommunikationsschicht zwischen Frontend, Backend, Datenbank und KI-Diensten.
LangChainLangChain Inc.Version 0.3.xFramework zur Integration von LLMs, Prompt-Engineering und Retrieval-Augmented-Generation-Workflows.
LangGraphLangChain Inc.Version 0.2.xFramework zur Orchestrierung des mehrstufigen klinischen Schlussfolgerungs-Workflows.
LLaMA 3.1 8B InstructMeta Platforms Inc.Version 3.1Großes Sprachmodell für klinische Schlussfolgerungen und natürlichsprachliche Generierung.
MySQL Community ServerOracle CorporationVersion 8.0Relationale Datenbank zur Speicherung strukturierter klinischer Daten.
OllamaOllama Inc.Version 0.9.xLokale Inferenz-Engine zur Ausführung großer Sprachmodelle unter Wahrung der Patientenprivatsphäre.
PythonPython Software FoundationVersion 3.11Programmiersprache zur Implementierung der gesamten Plattform.
PyTorchLinux FoundationVersion 2.4Tiefenlern-Framework für die Inferenz großer Sprachmodelle.
Retrieval-Augmented-Generation-(RAG-)PipelineIndividuelle ImplementierungNicht zutreffendKI-Framework, das semantisches Retrieval mit LLM-Inferenz zur kontextbezogenen Antwortgenerierung kombiniert.
Sentence TransformersHugging Face Inc.all-MiniLM-L6-v2Embedding-Modell zur Erzeugung dichter Vektorrepräsentationen für die semantische Dokumentensuche.
Ubuntu LinuxCanonical Ltd.Version 24.04 LTSBetriebssystem für Entwicklung und experimentelle Evaluation.
Visual Studio CodeMicrosoft CorporationVersion 1.100Integrierte Entwicklungsumgebung für Softwareimplementierung und Debugging.

Referenzen

  1. Chukwu E, Garg L. A systematic review of blockchain in healthcare: frameworks, prototypes, and implementations. IEEE Access. 2020;8:21196-21214. doi:10.1109/ACCESS.2020.2969881.
  2. Al-Nbhany WANA, Zahary AT, Al-Shargabi AA. Blockchain-IoT healthcare applications and trends: a review. IEEE Access. 2024;12:4178-4212. doi:10.1109/ACCESS.2023.3349187.
  3. Tan Y, et al. MedChatZH: a Chinese medical large language model. Comput Biol Med. 2024;172:108290.
  4. OLLAMA TEAM. Ollama: Run Large Language Models locally. Version 0.x. San Francisco: Ollama, 2024.
  5. Jahan I, Laskar MTR, Peng C, Huang JX. A comprehensive evaluation of large language models on benchmark biomedical text processing tasks. Comput Biol Med. 2024;171:108189. doi:10.1016/j.compbiomed.2024.108189.
  6. Liu X, Zhou Y, Wang Z, et al. Disease topic modeling of users' inquiry texts: a text mining-based PQDR-LDA model for analyzing the online medical records. IEEE Trans Eng Manag. 2023.
  7. Taylor N, Kormilitzin A, Lorge I, Nevado-Holgado A, Cipriani A, Joyce DW. Model development for bespoke large language models for digital triage assistance in mental health care. Artif Intell Med. 2024;157:102988.
  8. Song M, et al. PneumoLLM: a large language vision model for pneumonia diagnosis. Med Image Anal. 2024;97:103248.
  9. Chien SC, Yen CM, Chang YH, Chen YE, Liu CC, Hsiao YP, et al. Using large language model (LLM) to identify high-burden informal caregivers in long-term care. Comput Methods Programs Biomed. 2024;255:108329. doi:10.1016/j.cmpb.2024.108329.
  10. Xue X, Zhang D, Sun C, et al. Xiaoqing: a Q&A model for glaucoma based on LLMs. Comput Biol Med. 2024;174:108399.
  11. Wu D, Nie L, Mumtaz RA, Agarwal K. A LLM-based hybrid-transformer diagnosis system in healthcare. IEEE J Biomed Health Inform. 2024.
  12. Zhang Y, et al. LLM-enhanced multi-teacher knowledge distillation for modality-incomplete emotion recognition in daily healthcare. IEEE J Biomed Health Inform. 2024.
  13. Sarzaeim P, Mahmoud QH, Azim A. A framework for LLM-assisted smart policing system. IEEE Access. 2024;12:74915-74929. doi:10.1109/ACCESS.2024.3404862.
  14. Leme RS, Blank M. Lei Geral de Proteção de Dados e segurança da informação na área da saúde. Cad Ibero-Am Direito Sanit. 2020;9(3):210-224. doi:10.17566/ciads.v9i3.690.
  15. Zaganelli MV, Binda Filho DL. O sigilo médico e os dados sensíveis na telemedicina à luz da Lei Geral de Proteção de Dados. RECIIS. 2023;17(3):729-740. doi:10.29397/reciis.v17i3.3689.
  16. Tabari P, Costagliola G, De Rosa M, Boeker M. State-of-the-art Fast Healthcare Interoperability Resources (FHIR)-based data model and structure implementations: systematic scoping review. JMIR Med Inform. 2024.
  17. Martinez T, et al. HL7 systems and interoperability ecosystems in modern healthcare. IEEE Rev Biomed Eng. 2024.
  18. Chen L, et al. HL7 integration and semantic interoperability in distributed healthcare networks. IEEE J Biomed Health Inform. 2024.
  19. Liu W, Li W, Huang W, Gao Y. Security framework for medical data sharing. Telemed E-Health. 2024.
  20. Basile LJ, Carbonara N, Panniello U, Pellegrino R. How can technological resources improve the quality of healthcare service? IEEE Trans Eng Manag. 2024;71:5771-5781. doi:10.1109/TEM.2022.3192405.
  21. Singh A, et al. Prompt engineering in large language models: a survey using SWOT analysis [preprint]. arXiv. 2024
  22. Chen L, Chen Y, Liang W, Li X, Li KC, Wang J, Xiong N. MASS: a multiattribute sketch secure data sharing scheme for IoT wearable medical devices based on blockchain. IEEE Internet Things J. 2025;12(2):1990-2001. doi:10.1109/JIOT.2024.3468733.
  23. Autoridade Nacional de Proteção de Dados (BR). Diretrizes para agentes de tratamento de pequeno porte. Brasília (DF): ANPD; 2021.
  24. Patel R, Kim H. Interoperability in EHR. IEEE Transactions on Biomedical Engineering, v. 70, n. 8, p. 2341-2354, ago. 2023. DOI: 10.1109/TBME.2023.3241567.
  25. Zhang T, Kishore V, Wu F, Weinberger KQ, Artzi Y. BERTScore: evaluating text generation with BERT. In: International Conference on Learning Representations (ICLR); 2020.
  26. Chen X, Lu X, Li Q, Li D, Zhu F. Integration of LLM and Human-AI Coordination for Power Dispatching With Connected Electric Vehicles Under SAGVNs. IEEE Trans Veh Technol. 2025;74(2):1992-2002. doi:10.1109/TVT.2024.3434969
  27. Zhou S, Chen C, Gu HH. Testing and evaluating SNOMED CT web browsers' textual search feature. In: Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM); 2019.
  28. McPeak G, Sautmann A, George O, Hallal A, Simal EA, Schwartz AL, Abaluck J, Ravi N, Pless R. An LLM's medical testing recommendations in a Nigerian clinic: potential and limits of prompt engineering for clinical decision support. In: Proceedings of the 2024 IEEE 12th International Conference on Healthcare Informatics (ICHI); 2024.
  29. LLAMA TEAM, AI @ META. The Llama 3 Herd of Models. arXiv preprint arXiv:2407.21783, 2024. Disponível em: https://arxiv.org/abs/2407.21783.
  30. Conselho Nacional de Saúde (BR). Resolução nº 466, de 12 de dezembro de 2012. Aprova as diretrizes e normas regulamentadoras de pesquisas envolvendo seres humanos. Brasília (DF): Ministério da Saúde; 2012.
  31. Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620:172-180. doi:10.1038/s41586-023-06291-2.
  32. Sahoo P, et al. A systematic survey of prompt engineering in large language models [preprint]. arXiv. 2024. Available from: https://arxiv.org/abs/2402.07927
  33. Yan Y, Hou Y, Xiao Y, Zhang R, Wang Q. KNOWNET: guided health information seeking from LLMs via knowledge graph integration. IEEE Trans Vis Comput Graph. 2024.

Nachdrucke und Genehmigungen

Tags

FHIR-IntegrationRetrieval-Augmented GenerationMulti-Agenten-ReasoningVektordatenbanksemantische InteroperabilitätPrompt Engineering