Artykuł badawczy

Interoperacyjna platforma internetowa oparta na dużych modelach językowych do analizy danych medycznych: protokół wsparcia decyzji klinicznych

49 wyświetleń

DOI:

10.3791/72085

25 sierpnia 2026

W tym artykule

Podsumowanie

Niniejszy protokół opisuje implementację interoperacyjnej platformy internetowej, która integruje dane kliniczne oparte na standardzie FHIR z generowaniem wspomaganym wyszukiwaniem (Retrieval-Augmented Generation) oraz wieloagentowymi dużymi modelami językowymi w celu wsparcia decyzji klinicznych. Przepływ pracy umożliwia odtwarzalne wdrożenie, standaryzowaną integrację danych oraz ewaluację analizy danych medycznych wspomaganej przez sztuczną inteligencję (AI).

Streszczenie

Procesy podejmowania decyzji klinicznych są często utrudnione przez fragmentaryczną dokumentację medyczną w formie elektronicznej oraz ograniczoną interoperacyjność między heterogenicznymi systemami informacji zdrowotnej. Niniejszy artykuł przedstawia szczegółowy protokół wdrażania interoperacyjnej platformy internetowej, która integruje dane kliniczne za pomocą standardu Fast Healthcare Interoperability Resources (FHIR), wraz z wykorzystaniem generowania wspomaganego wyszukiwaniem (RAG), dużych modeli językowych (LLM) oraz wieloagentowego frameworku rozumowania klinicznego w celu wsparcia analizy danych medycznych i decyzji klinicznych. Protokół opisuje kompletny przepływ pracy, w tym konfigurację środowiska obliczeniowego, przetwarzanie wstępne zestawów danych klinicznych, integrację danych w oparciu o FHIR, budowę bazy wektorowej, konfigurację wyszukiwania, inżynierię promptów, orkiestrację wieloagentową oraz ewaluację systemu. Reprezentatywne wyniki wykazują zdolność platformy do generowania klinicznie istotnych i spójnych kontekstowo odpowiedzi przy jednoczesnej poprawie interoperacyjności semantycznej między heterogenicznymi źródłami danych. Wydajność systemu oceniono za pomocą uzupełniających miar ilościowych i semantycznych, w tym BLEU, ROUGE, BERTScore oraz podobieństwa cosinusowego. Przeprowadzono ocenę jakościową z wykorzystaniem publicznie dostępnych, w pełni anonimizowanych referencyjnych zestawów danych medycznych w celu zweryfikowania powtarzalności proponowanego przepływu metodologicznego. Zaproponowana architektura łączy standaryzowaną interoperacyjność opieki zdrowotnej z modelami językowymi wspomaganymi wyszukiwaniem, aby poprawić rozumowanie kontekstowe, ograniczyć halucynacje i wspierać powtarzalne, wspomagane przez AI procesy kliniczne. Protokół ten dostarcza skalowalny i powtarzalny model dla badaczy i programistów dążących do wdrożenia interoperacyjnych, dbających o prywatność i inteligentnych systemów opieki zdrowotnej do wsparcia decyzji klinicznych, analizy danych medycznych oraz przyszłych badań translacyjnych.

Wprowadzenie

Informacje zdrowotne są rutynowo generowane w szpitalach, centrach diagnostycznych, laboratoriach i przychodniach, często pozostając rozproszone pomiędzy heterogenicznymi systemami informacyjnymi. Ta fragmentacja ogranicza interoperacyjność i utrudnia terminowy dostęp do kompleksowej dokumentacji pacjentów, co stwarza trwałe wyzwania dla opieki klinicznej, integracji danych oraz zarządzania opieką zdrowotną1,2,3,4.

Konsekwencje tej fragmentacji stają się szczególnie widoczne w procesach klinicznych, które zależą od terminowego dostępu do informacji o pacjencie. Gdy pracownicy służby zdrowia nie mogą uzyskać pełnej i zintegrowanej dokumentacji medycznej, ocena kliniczna staje się trudniejsza, co zwiększa ryzyko podejmowania niepełnych decyzji i obniża efektywność udzielania opieki, szczególnie w sytuacjach nagłych5,6.

Ostatnie osiągnięcia w dziedzinie sztucznej inteligencji (AI), w szczególności duże modele językowe (LLMs), rozszerzyły zakres podejść obliczeniowych dostępnych w zastosowaniach opieki zdrowotnej. Modele te były badane w zadaniach takich jak pomoc diagnostyczna, triaż kliniczny i wsparcie decyzji. Na przykład Jahan i wsp.5 ocenili zastosowanie LLMs w zadaniach biomedycznych, natomiast Taylor i wsp.7 zbadali dostrojone modele w zakresie cyfrowego przesiewowego badania zdrowia psychicznego, raportując obiecujące wyniki w specjalistycznych warunkach klinicznych.

Zastosowanie modeli LLM rozszerzyło się również na bardziej wyspecjalizowane dziedziny kliniczne. Song i wsp. 49 badali ich wykorzystanie w diagnostyce pylicy płuc, natomiast Chien i wsp.8 zastosowali te modele do analizy wzorców obciążenia pracą opiekunów nieformalnych. W okulistyce Xue i wsp.9 zaproponowali system odpowiadania na pytania w diagnostyce jaskry, a Tan i wsp.3 oraz Wu i wsp.10 opisali zastosowanie LLM w hybrydowych systemach diagnostycznych i konsultacjach w ramach tradycyjnej medycyny chińskiej.

Zastosowanie LLM nie ogranicza się wyłącznie do bezpośrednich aplikacji klinicznych. Zhang i wsp.11 zbadali ich wykorzystanie w rozpoznawaniu emocji w scenariuszach dotyczących zdrowia psychicznego, natomiast Sarzaeim i wsp.12 przeanalizowali inteligentne systemy policyjne, które mogą również przyczynić się do analiz związanych ze zdrowiem publicznym. Badania te ilustrują szeroką stosowalność podejść opartych na LLM w różnych domenach związanych z opieką zdrowotną.

Choć duże modele językowe (LLMs) rozszerzyły możliwości zastosowań w opiece zdrowotnej, ich integracja ze środowiskami klinicznymi wciąż wiąże się z istotnymi wyzwaniami technicznymi, organizacyjnymi i regulacyjnymi. Praktyczne wdrożenie wymaga odpowiedniej infrastruktury obliczeniowej, skutecznego zarządzania danymi oraz zgodności z ramami regulacyjnymi, takimi jak Ogólne rozporządzenie o ochronie danych (GDPR) oraz brazylijska Ogólna ustawa o ochronie danych (LGPD). Ramy te określają wymogi dotyczące bezpiecznego i etycznego przetwarzania wrażliwych informacji zdrowotnych, rozwiązując jednocześnie kwestie związane z prywatnością, niezawodnością i stronniczością algorytmiczną w systemach opieki zdrowotnej wspomaganych przez AI13,14.

Interoperacyjność pomiędzy heterogenicznymi źródłami danych opieki zdrowotnej, w tym elektroniczną dokumentacją medyczną (EHR), systemami obrazowania medycznego oraz urządzeniami Internetu Rzeczy (IoT), nadal stanowi główne wyzwanie techniczne dla wdrażania rozwiązań opieki zdrowotnej wspomaganych przez AI. W tym kontekście ustandaryzowane ramy interoperacyjności, takie jak HL7 FHIR, zapewniają ustrukturyzowany mechanizm wymiany informacji klinicznych pomiędzy różnymi systemami, zachowując jednocześnie spójność semantyczną i wspierając skalowalną integrację.

Niniejsza praca przedstawia interoperacyjną platformę internetową, która integruje duże modele językowe (LLM) ze standardami interoperacyjności opieki zdrowotnej w celu wsparcia analizy danych medycznych w heterogenicznych środowiskach klinicznych. Zaproponowana architektura łączy integrację danych w oparciu o standard HL7 FHIR z generowaniem wspomaganym wyszukiwaniem (RAG) oraz wieloagentowym środowiskiem przetwarzania, aby zapewnić kontekstową analizę wspomaganą przez AI, przy jednoczesnym zachowaniu zgodności z obowiązującymi wymogami dotyczącymi ochrony danych, w tym z brazylijską ogólną ustawą o ochronie danych (LGPD).

Niniejszy protokół opisuje interoperacyjną architekturę służącą do integracji heterogenicznych danych klinicznych z wykorzystaniem uznanych standardów interoperacyjności w ochronie zdrowia. Szczegółowo opisano w nim również implementację wieloagentowego potoku przetwarzania opartego na dużych i małych modelach językowych (LLM oraz SLM), wraz z ramami ewaluacyjnymi łączącymi metryki ilościowe i analizy jakościowe w celu oceny funkcjonowania proponowanej platformy.

Protokół

Niniejsza analiza nie wiązała się z rekrutacją uczestników będących ludźmi, dostępem do identyfikowalnych dokumentacji pacjentów ani eksperymentami na zwierzętach. Protokół został opracowany i oceniony wyłącznie z wykorzystaniem publicznie dostępnych i w pełni anonimowych zbiorów danych w celu walidacji metodologicznej. Nie uzyskano dostępu ani nie przetwarzano żadnych danych osobowych dotyczących stanu zdrowia. W związku z tym nie było wymagane zatwierdzenie przez Instytucjonalną Komisję Rewizyjną (IRB) lub Komisję Etyki Badań. Protokół opracowano zgodnie z obowiązującymi zasadami ochrony danych, w tym brazylijską Ogólną Ustawą o Ochronie Danych (LGPD), aby wspierać przyszłe zastosowania obejmujące dane kliniczne.

Wybór i wstępne przetwarzanie zbioru danych

Zaproponowany protokół został oceniony przy użyciu publicznie dostępnych i w pełni zanonimizowanych zbiorów danych klinicznych, obejmujących ustrukturyzowaną elektroniczną dokumentację medyczną (EHR), dane z systemów odpowiadania na pytania kliniczne oraz zbiory obrazowania medycznego w celu walidacji metodologicznej. Przed integracją z platformą zbiory danych poddano standaryzowanym procedurom wstępnego przetwarzania, w tym normalizacji danych, usuwaniu niespójnych lub niepełnych rekordów, mapowaniu na zasoby HL7 FHIR, oczyszczaniu tekstu, segmentacji na fragmenty do wyszukiwania oraz generowaniu osadzeń (embeddingów) dla indeksowania wektorowego. Kroki wstępnego przetwarzania zapewniły spójność semantyczną w heterogenicznych źródłach danych, co ułatwiło interoperacyjność i umożliwiło reprodukowalność zaproponowanego przepływu pracy, przy jednoczesnym zachowaniu zgodności z obowiązującymi zasadami prywatności danych.

Zbiory danych pozyskano z publicznie dostępnych repozytoriów referencyjnych, powszechnie wykorzystywanych w badaniach nad sztuczną inteligencją i zdrowiem cyfrowym. Wybrano je tak, aby reprezentowały heterogeniczne informacje kliniczne, w tym ustrukturyzowaną elektroniczną dokumentację medyczną (EHR), nieustrukturyzowane opisy kliniczne, zadania z zakresu odpowiadania na pytania kliniczne oraz metadane obrazowania medycznego. Zamiast oceniać konkretną kohortę kliniczną, protokół koncentruje się na zademonstrowaniu odtwarzalnego przepływu pracy wdrożeniowej, który może zostać dostosowany do różnych zbiorów danych opieki zdrowotnej. Różnorodność tych referencyjnych zbiorów danych umożliwia walidację potoku interoperacyjności, generowania wspomaganego wyszukiwaniem (RAG) oraz wieloagentowego systemu rozumowania w wielu modalnościach danych klinicznych.

Konfiguracja środowiska eksperymentalnego

Środowisko eksperymentalne skonfigurowano w celu oceny interoperacyjnej platformy w kontrolowanych i powtarzalnych warunkach. Architektura obejmuje moduły ingestii danych, warstwy interoperacyjności, duże modele językowe (LLMs) oraz komponenty ewaluacyjne zorganizowane w pojedynczy potok przetwarzania do analizy danych medycznych. Rysunek 1 przedstawia kompletny przepływ pracy, od ingestii danych klinicznych po generowanie wyników diagnostycznych.

Schemat przetwarzania danych EHR; filtrowanie notatek klinicznych; wnioskowanie o chorobie za pomocą LLM; proces diagnozowania.
Rysunek 1: Ogólny schemat działania systemu ilustrujący potok przetwarzania od surowych danych klinicznych do wyniku statusu choroby. Proces rozpoczyna się od pobierania elektronicznej dokumentacji medycznej (EHR), po czym następuje filtrowanie i wstępne przetwarzanie danych w celu wyodrębnienia informacji istotnych dla danej choroby. Etap projektowania ustrukturyzowanego promptu integruje wiedzę ekspercką, definicje chorób oraz hiperparametry, co umożliwia efektywną interakcję z dużym modelem językowym (LLM). LLM przeprowadza wnioskowanie tekstowe w celu wygenerowania odpowiedzi uwzględniających kontekst, które są następnie oceniane na podstawie reguł klinicznych w celu ustalenia ostatecznego statusu choroby. Schemat podkreśla integrację wstępnego przetwarzania danych, promptowania opartego na wiedzy oraz wnioskowania opartego na AI w celu wsparcia podejmowania decyzji klinicznych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Architektura interoperacyjności w ochronie zdrowia

Infrastruktura backendowa przyjmuje architekturę modułową opartą na interfejsach RESTful API w celu wsparcia komunikacji między komponentami platformy (Rycina 2). Architektura ta obejmuje heterogeniczne informacje kliniczne, w tym ustrukturyzowaną elektroniczną dokumentację medyczną (EHR), notatki lekarzy oraz metadane pochodzące z systemów obrazowania medycznego. Ponieważ dane te pochodzą z wielu źródeł i formatów, interoperacyjność osiągnięto dzięki ustandaryzowanym modelom danych, w szczególności w ramach standardu Fast Healthcare Interoperability Resources (FHIR)15,16,17..Zastosowanie FHIR wspiera ustrukturyzowaną wymianę informacji przy jednoczesnym zachowaniu skalowalności i elastyczności w rozproszonych środowiskach opieki zdrowotnej. Wprowadzono również mechanizmy komunikacyjne oparte na standardzie HL7, aby ułatwić integrację z przestarzałymi systemami klinicznymi, które są nadal szeroko stosowane w placówkach ochrony zdrowia16,17.

Diagram API Flask pokazujący żądania POST/GET, zapytania MySQL oraz integrację z wektorową bazą danych FAISS.
Rysunek 2: Architektura systemu proponowanej interoperacyjnej platformy. Interfejs sieciowy komunikuje się z zapleczem (backendem) poprzez API Flask przy użyciu żądań HTTP POST/GET. API zarządza routingiem, przetwarzaniem zapytań oraz interakcją z ustrukturyzowanymi i nieustrukturyzowanymi źródłami danych. Baza danych MySQL przechowuje ustrukturyzowane dane kliniczne, natomiast wektorowy magazyn danych oparty na FAISS wspiera wyszukiwanie podobieństw w operacjach odzyskiwania informacji. Potok oparty na LLaMA przetwarza dane wejściowe w formie tekstowej i generuje odpowiedzi przy użyciu reprezentacji wektorowych, umożliwiając generowanie wspomagane wyszukiwaniem (Retrieval-Augmented Generation, RAG). Architektura podkreśla integrację usług sieciowych, zarządzania bazami danych, wyszukiwania wektorowego oraz wnioskowania dużego modelu językowego w ramach jednego, zunifikowanego systemu. Prosimy kliknąć tutaj, aby zobaczyć powiększoną wersję tego rysunku.

Konfiguracja przepływu pracy dla wielu agentów

Architektura wieloagentowa jest zorganizowana w wyspecjalizowane agenty funkcjonalne odpowiedzialne za odrębne etapy przepływu pracy. Agent wstępnego przetwarzania wykonuje normalizację danych i mapowanie FHIR, po którym następuje agent wyszukiwania odpowiedzialny za przeszukiwanie semantyczne w bazie wektorowej. Agent wnioskowania integruje pobrany kontekst z LLM w celu generowania odpowiedzi, podczas gdy agent walidacji weryfikuje spójność i formatowanie wyników przed zwróceniem końcowej odpowiedzi. Koordynacja agentów opiera się na sekwencyjnej strategii orchestracji, w której wynik każdego agenta służy jako dane wejściowe dla następnego etapu, co zapewnia powtarzalną i modularną implementację.

Integracja danych klinicznych

Warstwa integracji danych agreguje informacje z wielu źródeł klinicznych i przygotowuje je do dalszego przetwarzania. Wstępne przetwarzanie obejmuje normalizację danych, tokenizację oraz wyrównywanie encji w celu poprawy spójności semantycznej w heterogenicznych zbiorach danych. Ponieważ informacje kliniczne różnią się strukturą i jakością, operacje te pomagają zredukować szum i ułatwiają interakcję z modelami AI. Zastosowano również strategie mapowania strukturalnego w celu zharmonizowania różnych formatów danych i zachowania kompatybilności z potokiem przetwarzania, co zilustrowano na Rysunku 315,16,17.

Schemat procesu podejmowania decyzji w opiece zdrowotnej; etapy: złożoność zapytania, rekrutacja, analiza, synteza.
Rysunek 3: Szczegółowy przykład procesu wieloagentowego rozumowania klinicznego. Rysunek ilustruje, w jaki sposób zapytanie kliniczne jest analizowane w wielu etapach, obejmujących ocenę złożoności, rekrutację specjalistów, wspólną dyskusję oraz ostateczne podejmowanie decyzji. Proces ten demonstruje zdolność systemu do dynamicznego dostosowywania strategii rozumowania w zależności od złożoności zapytania, co zwiększa zarówno efektywność, jak i dokładność diagnostyczną w scenariuszach wspierania decyzji klinicznych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Konfiguracja potoku generowania rozszerzonego o pobieranie (Retrieval-Augmented Generation)

Generowanie wspomagane wyszukiwaniem (Retrieval-Augmented Generation, RAG) jest wykorzystywane w celu zapewnienia analizy uwzględniającej kontekst poprzez połączenie wyszukiwania informacji z możliwościami generatywnymi dużych modeli językowych. Zapytania użytkownika są przekształcane w reprezentacje wektorowe przy użyciu modeli embeddingowych, a następnie dopasowywane do bazy wektorowej za pomocą semantycznego wyszukiwania podobieństwa w celu pobrania najistotniejszych fragmentów kontekstowych. Pobrane dokumenty są następnie łączone z oryginalnym zapytaniem przed etapem wnioskowania przez LLM. Strategia ta pomaga dostarczyć informacji kontekstowych podczas generowania odpowiedzi i jest powiązana z poprawą spójności faktograficznej oraz redukcją halucynacji w aplikacjach wymagających szerokiej wiedzy, w tym w ochronie zdrowia18,19. Rycina 1 oraz Rycina 3 przedstawiają ogólny schemat przepływu wyszukiwania oraz odpowiadający mu proces wnioskowania.

Dla każdego żądania użytkownika ostateczny prompt jest konstruowany dynamicznie poprzez połączenie oryginalnego zapytania z najbardziej odpowiednimi fragmentami kontekstowymi pobranymi z bazy wektorowej. Pobrane informacje są włączane jako dowody kontekstowe przed wnioskowaniem, co pozwala modelowi językowemu generować odpowiedzi oparte na pobranej wiedzy z zakresu opieki zdrowotnej, przy jednoczesnym zachowaniu spójności semantycznej i ograniczeniu generowania treści niepopartych danymi.

Inżynieria promptów i rozumowanie wieloagentowe

Protokół wykorzystuje ustrukturyzowane strategie promptowania w celu poprawy interpretacji kontekstowej podczas generowania odpowiedzi. Techniki te, wraz z zaawansowanymi mechanizmami wnioskowania, pomagają kierować procesem rozumowania w złożonych scenariuszach klinicznych i są zgodne z ostatnimi doniesieniami w literaturze20.

Architektura obejmuje wieloagentowy system złożony ze wyspecjalizowanych modułów pełniących odrębne funkcje w potoku przetwarzania, w tym walidację danych, filtrowanie kontekstu, wsparcie wnioskowania klinicznego oraz weryfikację wyników. Modularna organizacja umożliwia wykonywanie zadań sekwencyjnie lub równolegle, zapewniając elastyczność w zależności od różnych wymagań przetwarzania (Rysunek 4). Rozdzielenie tych działań pomiędzy wielu agentów zmniejsza zależność od pojedynczego modelu językowego i wspiera bardziej odporny przepływ pracy. Strategia architektoniczna ta jest zgodna z ostatnimi osiągnięciami w dziedzinie rozproszonej sztucznej inteligencji i projektowania inteligentnych systemów21,22.

Schemat procesu zapytań; przepływ decyzji dla prostych i skomplikowanych problemów medycznych; analiza zespołu.
Rysunek 4: Wieloagentowy schemat decyzyjny dla rozumowania klinicznego. Proces rozpoczyna się od zapytania użytkownika, które jest oceniane przez agenta weryfikującego odpowiedzialnego za ocenę złożoności zapytania. W przypadku złożonych kwestii system dynamicznie rekrutuje wielodyscyplinarny zespół (MDT) wyspecjalizowanych agentów, którzy uczestniczą w iteracyjnych rundach dyskusji, aby przeanalizować problem i dokonać syntezy wiedzy przed podjęciem ostatecznej decyzji. W przypadku prostszych spraw zapytanie jest obsługiwane przez agenta lekarza podstawowej opieki zdrowotnej (PCC), co umożliwia szybsze generowanie odpowiedzi. Ta adaptacyjna architektura równoważy wydajność i głębię analityczną, poprawiając jakość decyzji oraz skalowalność systemu w zastosowaniach opieki zdrowotnej. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Ocena wydajności

Wydajność systemu oceniono za pomocą komplementarnych metryk, które oddają zarówno jakość językową, jak i spójność semantyczną wygenerowanych wyników. Do pomiaru podobieństwa syntaktycznego na podstawie nakładania się n-gramów zastosowano BLEU23, natomiast ROUGE posłużyło do oceny pełności (recall) i zakresu treści, szczególnie w zadaniach streszczania i ekstrakcji informacji24. Podobieństwo semantyczne oceniono za pomocą BERTScore, który wykorzystuje osadzenia kontekstowe pochodzące z modeli opartych na transformatorach do porównywania tekstów wygenerowanych i referencyjnych25. Dodatkowe analizy obejmowały perpleksję oraz podobieństwo cosinusowe w celu zbadania odpowiednio pewności modelu i spójności semantycznej26,27.

Wybrane metryki oceny zapewniają komplementarne perspektywy na wydajność systemu poprzez połączenie analiz leksykalnych i semantycznych. Kombinacja ta jest szczególnie istotna w zastosowaniach opieki zdrowotnej, gdzie interpretacja kontekstowa jest tak samo ważna jak podobieństwo leksykalne. Platformę oceniano w kontrolowanym środowisku obliczeniowym, które wspiera zarówno wdrożenie w chmurze, jak i lokalne. Lokalna implementacja modeli LLM została uwzględniona jako opcja w celu spełnienia wymogów dotyczących prywatności danych i zmniejszenia zależności od zewnętrznych usług podczas przetwarzania poufnych informacji klinicznych. Ta strategia wdrożenia jest zgodna z ramami ochrony danych i może zostać dostosowana do różnych środowisk operacyjnych4.

Wyniki

Wydajność systemu oceniono przy użyciu komplementarnych wskaźników ilościowych wraz z analizą jakościową, aby zbadać zarówno poprawność językową, jak i spójność semantyczną wygenerowanych wyników. Strategia oceny ta łączy miary leksykalne i semantyczne, aby zapewnić szerszą charakterystykę zachowania modelu w zadaniach generowania języka związanego z opieką zdrowotną.

Tabela 1 przedstawia wyniki ilościowe uzyskane za pomocą miar BLEU, ROUGE oraz BERTScore. Metryki te wybrano, ponieważ oceniają one komplementarne aspekty wygenerowanego tekstu, w tym podobieństwo leksykalne, zakres informacji oraz spójność semantyczną, i są powszechnie stosowane w badaniach nad przetwarzaniem języka naturalnego.

SędziaPromptPearsonRMSEMAEWskaźnik trafień
Mixtralkrótki0.0981.7791.3466/28
zero-shot0.1741.6181.29315/28
few-shot0.4751.6731.3679/28
LLaMA 3krótki0.4851.6171.31411/28
zero-shot0.4791.6141.31410/28
few-shot0.4251.6521.33913/28
LLaMA 3.1krótki0.3491.6211.31806/28
zero-shot0.681.6141.30712/28
few-shot0.4081.2430.88611/28

Tabela 1: Ilościowe wskaźniki oceny proponowanego systemu.

Do ilościowego określenia podobieństwa syntaktycznego, opartego na nakładaniu się n-gramów pomiędzy wygenerowanymi wynikami a tekstami referencyjnymi, wykorzystano miarę BLEU23. Opracowana pierwotnie na potrzeby tłumaczenia maszynowego, znajduje ona zastosowanie w szerokim zakresie zadań generowania tekstu, ponieważ oddaje ona odpowiedniość strukturalną między tekstami. W niniejszej ocenie wyniki BLEU wskazują, że wygenerowane odpowiedzi zachowują cechy syntaktyczne zgodne z wynikami referencyjnymi.

Do oceny podobieństwa zorientowanego na pełność (recall) wykorzystano miarę ROUGE, kładąc nacisk na zakres istotnych informacji w wygenerowanych tekstach24. W zastosowaniach medycznych metryka ta jest szczególnie użyteczna, ponieważ zachowanie klinicznie istotnych informacji jest często ważniejsze niż odtworzenie identycznego sformułowania. Jak wykazano w Tabeli 2, wyniki ROUGE wskazują, że wygenerowane odpowiedzi zachowują istotną treść kliniczną we wszystkich ocenianych przypadkach.

SędziaPromptICC1ICC2ICC3ICC1kICC2kICC3K
Mixtralkrótki0.1360.1640.1820.320.370.4
zero-shot0.280.3530.5070.5390.6210.755
few-shot0.2240.3230.5220.4630.5880.766
LLaMA3krótki0.2340.3310.5320.4790.5970.773
zero-shot0.2440.340.5510.4920.6070.786
few-shot0.2180.3210.5310.4560.5870.772
LLaMA3.1krótki0.5210.5250.5370.7660.7680.777
zero-shot0.2460.3430.560.4950.6110.792
few-shot0.5990.5970.5890.8170.8160.811

Tabela 2: Wskaźniki zgodności między sędziami (ICC).

W celu oceny podobieństwa semantycznego z wykorzystaniem osadzeń kontekstowych pochodzących z modeli opartych na transformatorach zastosowano BERTScore25. W przeciwieństwie do wskaźników BLEU i ROUGE, metryka ta porównuje teksty pod kątem znaczenia kontekstowego, a nie nakładania się słownictwa, co czyni ją odpowiednią do oceny generowania języka klinicznego. Wartości BERTScore uzyskane w niniejszym badaniu wskazują na wysoki stopień spójności semantycznej między wygenerowanymi odpowiedziami a odpowiadającymi im tekstami referencyjnymi.

Dodatkowe analizy objęły perpleksję oraz podobieństwo cosinusowe, aby uzupełnić główne wskaźniki oceny. Perpleksję obliczono w celu oszacowania przewidywalności generowanych wyników, przy czym niższe wartości wskazywały na mniejszą niepewność podczas generowania tekstu26. Podobieństwo cosinusowe wykorzystano do ilościowego określenia zgodności między wektorami zanurzeń (embedding vectors) pochodzącymi z tekstów wygenerowanych i referencyjnych, co dostarczyło dodatkowej miary spójności semantycznej27.

Wzięte łącznie, metryki ewaluacyjne dostarczają komplementarnych informacji na temat charakterystyki syntaktycznej, semantycznej i kontekstowej generowanych odpowiedzi. Rysunek 5 podsumowuje rozkład wyników ewaluacji w ramach ocenianych metryk, zapewniając ogólny wgląd w wydajność systemu w testowanych warunkach.

Wyniki oceny są zgodne z oczekiwanym działaniem generowania wspomaganego wyszukiwaniem (Retrieval-Augmented Generation, RAG) w aplikacjach wymagających dostępu do zewnętrznych źródeł wiedzy. Poprzez włączenie pobranych dokumentów do procesu generowania odpowiedzi, architektura dostarcza dodatkowych informacji kontekstowych, które wspierają udzielanie klinicznie istotnych odpowiedzi w scenariuszach wymagających szerokiej wiedzy18,19. Strategie ustrukturyzowanego promptowania zostały wprowadzone jako mechanizmy uzupełniające, mające na celu nakierowanie procesu rozumowania i interpretacji kontekstowej, zgodnie z podejściami opisanymi w niedawnych badaniach20.

Analiza jakościowa uzupełniła ocenę ilościową poprzez zbadanie interpretowalności i znaczenia klinicznego wygenerowanych wyników. Reprezentatywne przykłady odpowiedzi systemu dla różnych typów zapytań klinicznych przedstawiono na Rysunku 3. Przykłady te ilustrują sposób, w jaki platforma generuje spójne kontekstowo odpowiedzi w ocenianych scenariuszach, w tym w przypadkach obejmujących bardziej złożone informacje kliniczne.

Architektura wieloagentowa rozdziela zadania przetwarzania pomiędzy wyspecjalizowane moduły odpowiedzialne za komplementarne funkcje w ramach przepływu pracy. Taka organizacja zmniejsza zależność od jednego modelu językowego i umożliwia wieloetapowe przetwarzanie informacji oraz weryfikację wyników, co jest zgodne z aktualnymi podejściami wieloagentowymi opisanymi w literaturze21,22. Rysunek 5 podsumowuje rozkład wyników ewaluacji uzyskanych przy zastosowaniu różnych strategii promptowania oraz modeli językowych rozważanych w niniejszym badaniu.

Wykresy skrzypcowe porównujące podpowiedzi motywacyjne, metody: Pearson, MAI, M/F CE; analiza edukacyjna.
Rysunek 5: Rozkład wydajności proponowanego systemu w zależności od różnych strategii promptowania i modeli językowych. (A–F) Wykresy skrzypcowe ilustrują zmienność jakości odpowiedzi dla podejść z krótkimi promptami, promptowaniem zero-shot oraz few-shot z wykorzystaniem modeli LLaMA3, LLaMA3.1 i Mixtral. Wyniki podkreślają wpływ projektowania promptów na spójność i wydajność wyników, wykazując, że ustrukturyzowane strategie promptowania mają tendencję do generowania bardziej stabilnych i dokładnych odpowiedzi w zadaniach klinicznych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Wyniki oceny są zgodne z niedawnymi badaniami, które opowiadają się za łączeniem metryk leksykalnych i semantycznych w celu oceny wydajności dużych modeli językowych4,12. W szczególności metryki oparte na embeddingach stają się coraz ważniejsze dla uchwycenia podobieństwa kontekstowego w generowaniu języka związanego z opieką zdrowotną, gdzie interpretacja semantyczna wykracza poza dopasowanie leksykalne28,29.

Podsumowując, ocena wskazuje, że proponowana platforma integruje standardy interoperacyjności, generowanie wspomagane wyszukiwaniem (RAG) oraz przetwarzanie wieloagentowe w ramach jednolitej struktury do analizy danych opieki zdrowotnej. Przedstawione w niniejszym badaniu wyniki ilościowe i jakościowe potwierdzają wykonalność proponowanego schematu działania w ocenianych warunkach eksperymentalnych i stanowią podstawę do przyszłej walidacji w rzeczywistych środowiskach klinicznych.

Dostępność danych

Zbiory danych wykorzystane w niniejszym badaniu są ogólnodostępne. Zbiór zdjęć rentgenowskich klatki piersiowej pobrano z Indiana University Chest X-ray Collection (Open-i, U.S. National Library of Medicine), w tym pliki indiana_reports.csv oraz indiana_projections.csv, dostępne pod adresem https://openi.nlm.nih.gov/. Benchmarkowy zbiór danych MedQA jest publicznie dostępny za pośrednictwem oficjalnego repozytorium. W badaniu nie wykorzystano żadnych zastrzeżonych danych klinicznych ani danych umożliwiających identyfikację pacjentów. Wszystkie procedury preprocessingu zostały opisane w sekcji Protokół, aby zapewnić powtarzalność wyników.

Dyskusja

Ocena przedstawiona w niniejszym badaniu stanowi walidację metodologiczną przeprowadzoną z wykorzystaniem publicznie dostępnych i w pełni zanonimizowanych referencyjnych zbiorów danych medycznych. Nie przeprowadzono prospektywnej walidacji klinicznej z udziałem personelu medycznego ani rekrutacją pacjentów, ponieważ celem niniejszej pracy jest zaprezentowanie odtwarzalnego protokołu implementacji, a nie skuteczności klinicznej.

Wyniki niniejszego badania sugerują, że połączenie standardów interoperacyjności opieki zdrowotnej z dużymi modelami językowymi zapewnia praktyczne ramy dla integracji heterogenicznych informacji klinicznych. Zaproponowana architektura łączy mechanizmy wymiany danych strukturalnych, w tym FHIR i HL7, z przetwarzaniem języka opartym na sztucznej inteligencji w ramach ujednoliconego procesu przepływu pracy, który jest zgodny z aktualnymi kierunkami rozwoju cyfrowych systemów zdrowotnych15,16,17.

Ważnym aspektem proponowanego przepływu pracy jest integracja generowania wspomaganego wyszukiwaniem (RAG) w ramach architektury wieloagentowej. W tej konfiguracji pobrane dokumenty dostarczają dodatkowych informacji kontekstowych podczas generowania odpowiedzi, wspierając zadania kliniczne wymagające szerokiej wiedzy. Taka konstrukcja architektoniczna jest zgodna z niedawnymi badaniami, w których mechanizmy oparte na wyszukiwaniu opisano jako strategię poprawy ugruntowania kontekstowego i niezawodności odpowiedzi w zastosowaniach dużych modeli językowych18,19.

W proponowany przepływ pracy włączono strategie ustrukturyzowanego promptowania, aby wspierać interpretację kontekstową podczas generowania odpowiedzi. Wcześniejsze badania wykazały, że inżynieria promptów oraz techniki ustrukturyzowanego rozumowania mogą poprawić wydajność dużych modeli językowych w złożonych zadaniach podejmowania decyzji20. Podejście przyjęte w niniejszym protokole jest zgodne z tymi osiągnięciami i zapewnia ustrukturyzowane ramy dla przetwarzania języka klinicznego.

Z perspektywy ewaluacyjnej zastosowanie komplementarnych metryk pozwoliło na zbadanie różnych wymiarów wydajności systemu. Podczas gdy BLEU i ROUGE dostarczają informacji o podobieństwie syntaktycznym i stopniu pokrycia treści23,24, metryki oparte na embeddingach, takie jak BERTScore, uchwyciły relacje semantyczne, które mogą nie zostać odzwierciedlone przez samo nakładanie się leksykalne25. Ta wielowymiarowa strategia ewaluacji jest zgodna z niedawnymi badaniami benchmarkingowymi, które zalecają łączenie miar leksykalnych i semantycznych podczas oceny dużych modeli językowych w zastosowaniach opieki zdrowotnej4,12.

Proponowany schemat postępowania dostarcza powtarzalnych ram metodologicznych dla wdrażania interoperacyjnych systemów wspomagania decyzji klinicznych opartych na AI. Zamiast porównywania różnych architektur sztucznej inteligencji, niniejsze badanie koncentruje się na udokumentowaniu pełnego procesu wdrażania, architektury systemu, mechanizmów interoperacyjności oraz metodologii ewaluacji, aby ułatwić powtarzalność i przyszłe zastosowania. Analizy porównawcze obejmujące konwencjonalne LLM, konfiguracje z wyłączonym RAG, modele dostrojone (fine-tuned) lub tradycyjne podejścia uczenia maszynowego wykraczają poza zakres tego wkładu metodologicznego i stanowią istotny kierunek przyszłych badań.

Przyszła implementacja proponowanego modelu w rzeczywistych środowiskach klinicznych będzie wymagać dodatkowej walidacji z udziałem personelu medycznego, a także zgodności z obowiązującymi wymogami regulacyjnymi i etycznymi. W zależności od przeznaczenia, takie systemy mogą podlegać przepisom dotyczącym oprogramowania jako wyrobu medycznego (SaMD) i powinny być zgodne z wymaganiami ustanowionymi przez organy regulacyjne, w tym amerykańską Agencję ds. Żywności i Leków (FDA) oraz europejskie rozporządzenie w sprawie wyrobów medycznych (MDR). Ponadto kluczowe dla bezpiecznego i odpowiedzialnego wdrożenia w placówkach ochrony zdrowia będą solidne zasady zarządzania danymi, cyberbezpieczeństwo, przejrzystość oraz praktyki dotyczące bezpieczeństwa klinicznego.

Analiza jakościowa uzupełniła ocenę ilościową, ilustrując charakterystykę wygenerowanych odpowiedzi w reprezentatywnych scenariuszach klinicznych. Przedstawione przykłady wskazują, że platforma była w stanie generować spójne kontekstowo odpowiedzi w ocenianych warunkach, dostarczając dodatkowych informacji na temat interpretowalności odpowiedzi poza metryki ilościowe. Podobne obserwacje zgłaszano w badaniach stosujących duże modele językowe w zastosowaniach klinicznych, w tym w diagnostyce wspomaganej oraz w interakcjach z pacjentem28,29,30,31.

Zaproponowana architektura rozdziela zadania przetwarzania pomiędzy wyspecjalizowane moduły odpowiedzialne za komplementarne funkcje, w tym walidację danych, filtrowanie kontekstowe, wsparcie wnioskowania klinicznego oraz weryfikację wyników. Taka organizacja modułowa zmniejsza zależność od pojedynczego modelu językowego i umożliwia następujące po sobie etapy przetwarzania informacji w ramach przepływu pracy. Podobne strategie architektoniczne opisano w niedawnych badaniach nad rozproszonymi systemami AI oraz frameworkami wieloagentowymi zaprojektowanymi dla złożonych środowisk podejmowania decyzji21,22.

Kilka kwestii związanych z implementacją może ułatwić powtarzalność i wdrożenie proponowanego protokołu. Spójne mapowanie informacji klinicznych do standardu HL7 FHIR pomaga zachować interoperacyjność semantyczną w całym potoku przetwarzania danych. Podobnie wstępne przetwarzanie dokumentów, strategie fragmentacji (chunking), generowanie embeddingów oraz indeksowanie wektorowe wpływają na działanie przepływu pracy Retrieval-Augmented Generation i powinny być konfigurowane oraz walidowane zgodnie z charakterystyką docelowej aplikacji. Projektowanie promptów (prompt engineering) oraz orchestracja wieloagentowa mogą być również iteracyjnie dopracowywane przy użyciu wiedzy dziedzinowej i opinii ekspertów, aby poprawić osadzenie kontekstowe podczas generowania odpowiedzi. Praktyki implementacyjne te są zgodne z ostatnimi osiągnięciami w dziedzinie godnej zaufania sztucznej inteligencji oraz modeli językowych wspomaganych wyszukiwaniem18,19,20.

Należy uznać pewne ograniczenia niniejszego badania. Choć ocena łączyła komplementarne wskaźniki ilościowe i jakościowe, miary te mogą nie w pełni oddawać wszystkie aspekty rozumowania klinicznego. Obserwacja ta jest zgodna z wcześniejszymi badaniami, w których rekomendowano stosowanie ram oceny specyficznych dla danej dziedziny w aplikacjach opieki zdrowotnej12. Ponadto platforma była oceniana w kontrolowanych warunkach z wykorzystaniem publicznie dostępnych i zanonimizowanych zestawów danych referencyjnych, które mogą nie w pełni reprezentować zmienność i złożoność rzeczywistych środowisk klinicznych.

Zaproponowana platforma została opracowana zgodnie z uznanymi standardami interoperacyjności w opiece zdrowotnej. Zastosowanie standardów HL7 i FHIR wspiera ustrukturyzowaną wymianę danych pomiędzy heterogenicznymi systemami informacji medycznej, zapewniając zestandaryzowane ramy dla integracji informacji klinicznych z wielu źródeł. Takie podejście architektoniczne jest zgodne z obecnymi wysiłkami mającymi na celu opracowanie interoperacyjnych systemów AI dla rozproszonych środowisk opieki zdrowotnej15,16,17.

Pomyślna implementacja proponowanego schematu postępowania zależy od kilku krytycznych kroków metodologicznych. Po pierwsze, dane kliniczne powinny być spójnie mapowane na ustandaryzowane zasoby HL7 FHIR w celu zachowania interoperacyjności semantycznej pomiędzy heterogenicznymi systemami opieki zdrowotnej15,17. Po drugie, wstępne przetwarzanie dokumentów, obejmujące normalizację, strategię dzielenia na fragmenty (chunking) oraz generowanie embeddingów, powinno zostać dokładnie skonfigurowane, ponieważ etapy te bezpośrednio wpływają na jakość wyszukiwania w potoku generowania wspomaganego wyszukiwaniem (RAG)19,32,33. Po trzecie, baza danych wektorowych powinna być przebudowywana przy każdej aktualizacji bazy wiedzy, aby utrzymać spójność pomiędzy zaindeksowanymi dokumentami a wynikami wyszukiwania. Na koniec, inżynieria promptów oraz orchestracja wieloagentowa powinny być iteracyjnie walidowane przy użyciu reprezentatywnych scenariuszy klinicznych w celu poprawy dokładności kontekstowej, minimalizacji halucynacji oraz zwiększenia powtarzalności procesów wsparcia decyzji klinicznych wspomaganych przez AI4,3,20,31.

Z punktu widzenia rozwiązywania problemów, typowe wyzwania wdrożeniowe obejmują niepełne mapowanie zasobów FHIR, obniżoną wydajność wyszukiwania związaną z indeksowaniem dokumentów lub konfiguracją bazy wektorowej, a także odpowiedzi uwarunkowane niewystarczającymi informacjami kontekstowymi lub nieoptymalnym projektowaniem promptów (prompt engineering). Problemy te można rozwiązać poprzez walidację zasobów interoperacyjności, optymalizację parametrów wyszukiwania, okresową aktualizację lub przebudowę bazy wektorowej po modyfikacjach bazy wiedzy oraz ciągłą ewaluację z wykorzystaniem uzupełniających metryk leksykalnych i semantycznych. Praktyki te zapewniają spójne działanie systemu i ułatwiają wdrażanie oraz utrzymanie systemów wspomagania decyzji klinicznych opartych na sztucznej inteligencji4,12,25,23..

Z praktycznego punktu widzenia wdrożenie dużych modeli językowych w środowiskach opieki zdrowotnej wymaga rozważenia zasobów obliczeniowych oraz wymagań infrastrukturalnych. Chociaż proponowana architektura wspiera zarówno wykonanie w chmurze, jak i lokalne, mogą być niezbędne dodatkowe strategie optymalizacji w zależności od skali wdrożenia i dostępnych zasobów obliczeniowych, szczególnie w warunkach ograniczenia zasobów4.

Przyszłe badania mogą rozszerzyć proponowany schemat postępowania poprzez ocenę platformy z wykorzystaniem rzeczywistych zestawów danych klinicznych oraz rutynowych procesów opieki zdrowotnej. Dodatkowe analizy mogą również obejmować badanie strategii dostrajania specyficznych dla danej dziedziny oraz integrację metod wyjaśnialnej sztucznej inteligencji (explainable AI), aby zwiększyć interpretowalność modelu i zapewnić przejrzystość podczas wspierania decyzji klinicznych. Kierunki te mogą przyczynić się do szerszej oceny platformy w praktycznych środowiskach opieki zdrowotnej.

Podsumowując, niniejsza praca przedstawia powtarzalne ramy integrujące standardy interoperacyjności opieki zdrowotnej, generowanie wspomagane wyszukiwaniem (Retrieval-Augmented Generation, RAG) oraz wieloagentowe architektury modeli językowych w ramach ujednoliconego przepływu przetwarzania danych klinicznych. Zaproponowany protokół zapewnia ustrukturyzowane podejście do wdrażania i oceny systemów analizy danych medycznych wspomaganych przez AI i może służyć jako punkt odniesienia dla przyszłych rozwoju w zakresie interoperacyjnego wspierania decyzji klinicznych.

Oświadczenia

Autorzy oświadczają, że nie istnieją żadne konkurencyjne interesy finansowe ani relacje osobiste, które mogłyby wpłynąć na pracę przedstawioną w niniejszym manuskrypcie. Narzędzia generatywnej sztucznej inteligencji (AI) zostały wykorzystane wyłącznie w celu pomocy w redakcji językowej, korekcie gramatycznej i poprawie czytelności tekstu. Cała treść naukowa, projekt badania, metodologia, analiza danych, interpretacja wyników oraz decyzje redakcyjne zostały opracowane, zweryfikowane i zatwierdzone przez autorów, którzy biorą pełną odpowiedzialność za treść niniejszego manuskryptu.

Podziękowania

Autorzy pragną podziękować Laboratoriom Systemów Wbudowanych i Rozproszonych (LESC) na Federalnym Uniwersytecie Ceara (UFC) za zapewnienie środowiska badawczego oraz dyskusje techniczne, które wsparły opracowanie niniejszej pracy. Autorzy wyrażają również wdzięczność twórcom i opiekunom oprogramowania o otwartym kodzie źródłowym, standardów interoperacyjności oraz publicznie dostępnych zbiorów danych wykorzystanych w ramach niniejszego badania.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
FAISSMeta Platforms Inc.Version 1.8.0Baza danych wektorowych wykorzystywana do wyszukiwania podobieństwa w potoku Retrieval-Augmented Generation (RAG).
FHIR StandardHL7 InternationalRelease 4 (R4)Standard interoperacyjności w opiece zdrowotnej przyjęty do strukturalnej wymiany danych klinicznych.
FlaskPallets ProjectsVersion 3.0.3Framework webowy Python wykorzystywany do implementacji backendowego API RESTful.
HL7 StandardHL7 InternationalVersion 2.xStarszy protokół przesyłania komunikatów wykorzystywany do interoperacyjności z systemami informacji szpitalnej.
HTTP REST APICustom ImplementationN/AWarstwa komunikacji RESTful pomiędzy frontendem, backendem, bazą danych a usługami AI.
LangChainLangChain Inc.Version 0.3.xFramework wykorzystywany do integracji LLM, prompt engineeringu oraz przepływów Retrieval-Augmented Generation.
LangGraphLangChain Inc.Version 0.2.xFramework wykorzystywany do orkiestracji wieloagentowego przepływu rozumowania klinicznego.
LLaMA 3.1 8B InstructMeta Platforms Inc.Version 3.1Duży model językowy (LLM) zastosowany do rozumowania klinicznego i generowania języka naturalnego.
MySQL Community ServerOracle CorporationVersion 8.0Relacyjna baza danych wykorzystywana do przechowywania strukturalnych danych klinicznych.
OllamaOllama Inc.Version 0.9.xLokalny silnik inferencji wykorzystywany do uruchamiania dużych modeli językowych przy zachowaniu prywatności pacjentów.
PythonPython Software FoundationVersion 3.11Język programowania wykorzystywany do implementacji całej platformy.
PyTorchLinux FoundationVersion 2.4Framework głębokiego uczenia wykorzystywany do inferencji dużych modeli językowych.
Retrieval-Augmented Generation (RAG) PipelineCustom ImplementationN/AFramework AI łączący wyszukiwanie semantyczne z inferencją LLM w celu generowania odpowiedzi świadomych kontekstu.
Sentence TransformersHugging Face Inc.all-MiniLM-L6-v2Model embeddingowy wykorzystywany do generowania gęstych reprezentacji wektorowych dla semantycznego wyszukiwania dokumentów.
Ubuntu LinuxCanonical Ltd.Version 24.04 LTSSystem operacyjny wykorzystywany do rozwoju i ewaluacji eksperymentalnej.
Visual Studio CodeMicrosoft CorporationVersion 1.100Zintegrowane środowisko programistyczne wykorzystywane do implementacji i debugowania oprogramowania.

Bibliografia

  1. Chukwu E, Garg L. A systematic review of blockchain in healthcare: frameworks, prototypes, and implementations. IEEE Access. 2020;8:21196-21214. doi:10.1109/ACCESS.2020.2969881.
  2. Al-Nbhany WANA, Zahary AT, Al-Shargabi AA. Blockchain-IoT healthcare applications and trends: a review. IEEE Access. 2024;12:4178-4212. doi:10.1109/ACCESS.2023.3349187.
  3. Tan Y, et al. MedChatZH: a Chinese medical large language model. Comput Biol Med. 2024;172:108290.
  4. OLLAMA TEAM. Ollama: Run Large Language Models locally. Version 0.x. San Francisco: Ollama, 2024.
  5. Jahan I, Laskar MTR, Peng C, Huang JX. A comprehensive evaluation of large language models on benchmark biomedical text processing tasks. Comput Biol Med. 2024;171:108189. doi:10.1016/j.compbiomed.2024.108189.
  6. Liu X, Zhou Y, Wang Z, et al. Disease topic modeling of users' inquiry texts: a text mining-based PQDR-LDA model for analyzing the online medical records. IEEE Trans Eng Manag. 2023.
  7. Taylor N, Kormilitzin A, Lorge I, Nevado-Holgado A, Cipriani A, Joyce DW. Model development for bespoke large language models for digital triage assistance in mental health care. Artif Intell Med. 2024;157:102988.
  8. Song M, et al. PneumoLLM: a large language vision model for pneumonia diagnosis. Med Image Anal. 2024;97:103248.
  9. Chien SC, Yen CM, Chang YH, Chen YE, Liu CC, Hsiao YP, et al. Using large language model (LLM) to identify high-burden informal caregivers in long-term care. Comput Methods Programs Biomed. 2024;255:108329. doi:10.1016/j.cmpb.2024.108329.
  10. Xue X, Zhang D, Sun C, et al. Xiaoqing: a Q&A model for glaucoma based on LLMs. Comput Biol Med. 2024;174:108399.
  11. Wu D, Nie L, Mumtaz RA, Agarwal K. A LLM-based hybrid-transformer diagnosis system in healthcare. IEEE J Biomed Health Inform. 2024.
  12. Zhang Y, et al. LLM-enhanced multi-teacher knowledge distillation for modality-incomplete emotion recognition in daily healthcare. IEEE J Biomed Health Inform. 2024.
  13. Sarzaeim P, Mahmoud QH, Azim A. A framework for LLM-assisted smart policing system. IEEE Access. 2024;12:74915-74929. doi:10.1109/ACCESS.2024.3404862.
  14. Leme RS, Blank M. Lei Geral de Proteção de Dados e segurança da informação na área da saúde. Cad Ibero-Am Direito Sanit. 2020;9(3):210-224. doi:10.17566/ciads.v9i3.690.
  15. Zaganelli MV, Binda Filho DL. O sigilo médico e os dados sensíveis na telemedicina à luz da Lei Geral de Proteção de Dados. RECIIS. 2023;17(3):729-740. doi:10.29397/reciis.v17i3.3689.
  16. Tabari P, Costagliola G, De Rosa M, Boeker M. State-of-the-art Fast Healthcare Interoperability Resources (FHIR)-based data model and structure implementations: systematic scoping review. JMIR Med Inform. 2024.
  17. Martinez T, et al. HL7 systems and interoperability ecosystems in modern healthcare. IEEE Rev Biomed Eng. 2024.
  18. Chen L, et al. HL7 integration and semantic interoperability in distributed healthcare networks. IEEE J Biomed Health Inform. 2024.
  19. Liu W, Li W, Huang W, Gao Y. Security framework for medical data sharing. Telemed E-Health. 2024.
  20. Basile LJ, Carbonara N, Panniello U, Pellegrino R. How can technological resources improve the quality of healthcare service? IEEE Trans Eng Manag. 2024;71:5771-5781. doi:10.1109/TEM.2022.3192405.
  21. Singh A, et al. Prompt engineering in large language models: a survey using SWOT analysis [preprint]. arXiv. 2024
  22. Chen L, Chen Y, Liang W, Li X, Li KC, Wang J, Xiong N. MASS: a multiattribute sketch secure data sharing scheme for IoT wearable medical devices based on blockchain. IEEE Internet Things J. 2025;12(2):1990-2001. doi:10.1109/JIOT.2024.3468733.
  23. Autoridade Nacional de Proteção de Dados (BR). Diretrizes para agentes de tratamento de pequeno porte. Brasília (DF): ANPD; 2021.
  24. Patel R, Kim H. Interoperability in EHR. IEEE Transactions on Biomedical Engineering, v. 70, n. 8, p. 2341-2354, ago. 2023. DOI: 10.1109/TBME.2023.3241567.
  25. Zhang T, Kishore V, Wu F, Weinberger KQ, Artzi Y. BERTScore: evaluating text generation with BERT. In: International Conference on Learning Representations (ICLR); 2020.
  26. Chen X, Lu X, Li Q, Li D, Zhu F. Integration of LLM and Human-AI Coordination for Power Dispatching With Connected Electric Vehicles Under SAGVNs. IEEE Trans Veh Technol. 2025;74(2):1992-2002. doi:10.1109/TVT.2024.3434969
  27. Zhou S, Chen C, Gu HH. Testing and evaluating SNOMED CT web browsers' textual search feature. In: Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM); 2019.
  28. McPeak G, Sautmann A, George O, Hallal A, Simal EA, Schwartz AL, Abaluck J, Ravi N, Pless R. An LLM's medical testing recommendations in a Nigerian clinic: potential and limits of prompt engineering for clinical decision support. In: Proceedings of the 2024 IEEE 12th International Conference on Healthcare Informatics (ICHI); 2024.
  29. LLAMA TEAM, AI @ META. The Llama 3 Herd of Models. arXiv preprint arXiv:2407.21783, 2024. Disponível em: https://arxiv.org/abs/2407.21783.
  30. Conselho Nacional de Saúde (BR). Resolução nº 466, de 12 de dezembro de 2012. Aprova as diretrizes e normas regulamentadoras de pesquisas envolvendo seres humanos. Brasília (DF): Ministério da Saúde; 2012.
  31. Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620:172-180. doi:10.1038/s41586-023-06291-2.
  32. Sahoo P, et al. A systematic survey of prompt engineering in large language models [preprint]. arXiv. 2024. Available from: https://arxiv.org/abs/2402.07927
  33. Yan Y, Hou Y, Xiao Y, Zhang R, Wang Q. KNOWNET: guided health information seeking from LLMs via knowledge graph integration. IEEE Trans Vis Comput Graph. 2024.

Przedruki i uprawnienia

Tagi

Integracja FHIRgenerowanie wspomagane wyszukiwaniem (RAG)rozumowanie wieloagentowebaza danych wektorowychinteroperacyjność semantycznainżynieria promptów