Analiza wydajności predykcyjnej
Model FedMediFormer-XAI wykazał poprawioną wydajność predykcyjną w porównaniu z ocenianymi modelami unimodalnymi oraz konwencjonalnymi modelami bazowymi. Augmentacja oparta na dyfuzji poprawiła reprezentację klasy mniejszościowej, a wynikową wydajność predykcyjną zestawiono w Tabeli 3. Ewaluacja z wielokrotnym uruchomieniem wykazała stabilną wydajność predykcyjną we wszystkich ocenianych modelach. FedMediFormer-XAI osiągnął najwyższą ogólną wydajność, z dokładnością (accuracy) 94,20 ± 0,34% (95% CI: 93,78–94,62), precyzją (precision) 93,10 ± 0,30% (95% CI: 92,73–93,47), czułością (recall) 92,80 ± 0,28% (95% CI: 92,45–93,15) oraz wynikiem F1-score 92,90 ± 0,28% (95% CI: 92,55–93,25). Model osiągnął współczynnik MCC wynoszący 0,8 ± 0,02 (95% CI: 0,86–0,90) oraz AUC-ROC na poziomie 0,96 ± 0,01 (95% CI: 0,95–0,97). Następną najlepszą ogólną wydajność zapewnił scentralizowany transformer multimodalny, natomiast modele unimodalne i konwencjonalne modele uczenia maszynowego wykazały porównawczo niższą wydajność predykcyjną. Wyniki te wskazują, że multimodalna nauka reprezentacji w połączeniu z optymalizacją federacyjną pozwala na uzyskanie poprawionej i bardziej stabilnej wydajności klasyfikacji cukrzycy.
Badanie ablacyjne
Ablację poszczególnych komponentów wykorzystano do oceny wkładu augmentacji dyfuzyjnej, uczenia federacyjnego, rekomendacji leków opartej na GraphSAGE oraz fuzji multimodalnej. Pełny framework FedMediFormer-XAI osiągnął dokładność na poziomie 94,20 ± 0,34%, precyzję 93,10 ± 0,30%, czułość 92,80 ± 0,28%, wynik F1 92,90 ± 0,28%, współczynnik MCC 0,8 ± 0,02 oraz AUC-ROC 0,96 ± 0,01 w pięciu niezależnych uruchomieniach. Usunięcie augmentacji dyfuzyjnej obniżyło dokładność do 91,80 ± 0,42%, co odpowiada spadkowi o 2,40 punktu procentowego, podczas gdy wynik F1 i AUC-ROC spadły odpowiednio do 90,30 ± 0,38% i 0,94 ± 0,01. Redukcja ta wskazuje na wkład augmentacji opartej na dyfuzji w reprezentację klas mniejszościowych oraz odporność predykcyjną.
Usunięcie uczenia federacyjnego (federated learning) spowodowało spadek dokładności do 93,10 ± 0,37%, co stanowi obniżenie o 1,10 punktu procentowego w stosunku do pełnego modelu. Precyzja (precision), pełność (recall), wskaźnik F1, MCC oraz AUC-ROC uległy również zmniejszeniu i wyniosły odpowiednio 92,20 ± 0,34%, 91,80 ± 0,32%, 92,0 ± 0,3%, 0,86 ± 0,02 oraz 0,95 ± 0,01. Porównanie to wykazuje wpływ konfiguracji federacyjnej na wydajność predykcyjną.
Usunięcie komponentu spersonalizowanych rekomendacji leków opartego na GraphSAGE spowodowało stosunkowo niewielką zmianę w wydajności przewidywania cukrzycy, przy czym dokładność spadła do 93,80 ± 0,35%, a wskaźnik F1 do 92,60 ± 0,30%. Odpowiednie wartości MCC i AUC-ROC wyniosły odpowiednio 0,87 ± 0,02 oraz 0,96 ± 0,01. Wynik ten wskazuje, że GraphSAGE przyczynia się przede wszystkim do spersonalizowanych rekomendacji leków, a nie bezpośrednio do określania wydajności klasyfikacji cukrzycy.
Największy spadek odnotowano po usunięciu fuzji multimodalnej. Dokładność spadła do 87,60 ± 0,5%, co stanowi spadek o 6,60 punktu procentowego, natomiast precyzja, czułość, wskaźnik F1, MCC oraz AUC-ROC spadły odpowiednio do 86,80 ± 0,51%, 85,90 ± 0,54%, 86,30 ± 0,52%, 0,76 ± 0,03 oraz 0,91 ± 0,01. Wynik ten dowodzi znaczenia wspólnego modelowania komplementarnych informacji pochodzących z danych klinicznych, CGM oraz obrazowania siatkówki.
Analiza uczenia federacyjnego
Struktura uczenia federacyjnego umożliwiła kolaboracyjny trening modelu pomiędzy rozproszonymi klientami, przy jednoczesnym zachowaniu zdecentralizowanego przetwarzania surowych danych pacjentów. Podczas treningu lokalny model każdego klienta był dostrajany indywidualnie, a następnie łączony za pomocą metody Federated Averaging. Po 10 rundach komunikacyjnych model globalny zbiegł się, a jego zdolność predykcyjna pozostała spójna z wynikami uczenia scentralizowanego. Struktura uczenia federacyjnego wykazała stabilną zbieżność w kolejnych rundach komunikacyjnych, pomimo heterogenicznego rozkładu danych u klientów. Wymiana chronionych parametrów pozwoliła na zachowanie zdecentralizowanego przetwarzania danych, podczas gdy model globalny utrzymał konkurencyjną wydajność predykcyjną w stosunku do scentralizowanej linii bazowej. Tabela 4 porównuje implementacje scentralizowaną i federacyjną. Uczenie federacyjne wymagało dodatkowego czasu treningu ze względu na narzut komunikacyjny, zachowując jednocześnie wydajność predykcyjną porównywalną z uczeniem scentralizowanym.
Analiza wydajności na poziomie zbiorów danych
Aby ocenić zdolność do generalizacji w różnych modalnościach opieki zdrowotnej, oceniono wydajność dla każdego zbioru danych osobno. Multimodalny model FedMediFormer-XAI wykazał wysoką i ogólnie konkurencyjną wydajność we wszystkich ocenianych zbiorach danych. Osiągnął on dokładność na poziomie odpowiednio 91,8%, 93,1%, 92,4% i 94,2% dla zbiorów danych Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM oraz APTOS 2019. Choć w przypadku zbioru danych APTOS 2019 uzyskano nieco wyższą dokładność (94,7%) i precyzję (93,9%) niż w modelu multimodalnym, proponowane podejście multimodalne utrzymało konkurencyjną wydajność we wszystkich zbiorach danych i osiągnęło wartość AUC-ROC wynoszącą 0,96, co jest porównywalne z najwyższym wynikiem AUC-ROC na poziomie poszczególnych zbiorów. Ogólne wyniki na poziomie zbiorów danych przedstawiono w Tabeli 5. W przypadku pojedynczych zbiorów danych najlepsze wyniki osiągnięto przy samodzielnej analizie obrazów siatkówki, natomiast fuzja multimodalna zapewniła najbardziej stabilne i zrównoważone predykcje.
Analiza spersonalizowanych rekomendacji lekowych
Komponent rekomendacyjny oparty na grafowych sieciach neuronowych został oceniony przy użyciu informacji o skuteczności leków oraz danych o interakcjach lekowych; potencjalne leki uszeregowano zgodnie z wyuczonymi wynikami dopasowania pacjent-lek, a kombinacje przeciwwskazane wykluczono podczas generowania rekomendacji. Zastosowanie formatu grafu heterogenicznego oraz modelowanie interakcji pacjent-lek i lek-lek pozwoliło na przeprowadzenie szczegółowej analizy, co wsparło spersonalizowany dobór leków oraz ocenę bezpieczeństwa. Model rekomendacyjny GraphSAGE skutecznie uchwycił złożone relacje między pacjentami, chorobami, wynikami badań laboratoryjnych a lekami. Spersonalizowane rekomendacje wykazały wysoką wydajność rankingową, zachowując jednocześnie klinicznie istotne wyjaśnienia dzięki analizie sąsiedztwa grafu i atrybucji cech.
Zgodnie z Tabelą 6, moduł spersonalizowanych rekomendacji leków oceniono przy użyciu wskaźników Precision@5, Recall@5 oraz NDCG@5. Metryki te określają istotność i jakość rankingu pięciu najlepszych spersonalizowanych rekomendacji leków wygenerowanych przez moduł rekomendacyjny oparty na GraphSAGE. System rekomendacyjny osiągnął wysoką wydajność rankingu, przy precision = 0.89, recall = 0.84 i NDCG = 0.91.
Analiza wyjaśnialności
Struktura obejmuje SHAP, zintegrowane gradienty (Integrated Gradients), wizualizację uwagi oraz wyjaśnienia kontrfaktyczne, aby wesprzeć interpretację predykcji multimodalnych. SHAP został wykorzystany do ilościowego określenia wkładu na poziomie cech, zintegrowane gradienty do przypisania predykcji do cech wejściowych, wizualizacja uwagi do zbadania fokusu modelu w różnych modalnościach, a wyjaśnienia kontrfaktyczne do identyfikacji zmian cech związanych z alternatywnymi predykcjami. Rycina 8 przedstawia reprezentatywny wykres podsumowujący SHAP wygenerowany przez wytrenowany model FedMediFormer-XAI, natomiast Rycina 9 prezentuje reprezentatywne wizualizacje uwagi wyekstrahowane z wytrenowanego transformera. Ryciny te stanowią wyniki uzyskane z ewaluacji modelu, a nie schematyczne ilustracje proponowanej architektury.
Na Rysunku 8 przedstawiono rankingi istotności cech na poziomie zagregowanym. Cechy o wyższych bezwzględnych wartościach SHAP miały większy wpływ na prognozy modelu i były również zgodne z istniejącą wiedzą kliniczną.
Rysunek 9 przedstawia reprezentatywne wizualizacje uwagi wyekstrahowane bezpośrednio z wytrenowanego modelu FedMediFormer-XAI dla losowo wybranej próbki testowej z zestawu odseparowanego. Wizualizacje obejmują uwagę skupioną na cechach klinicznych, uwagę temporalną CGM, uwagę przestrzenną siatkówki oraz uwagę międzymodalną pomiędzy trzema modalnościami. Wizualizacja uwagi dodatkowo wykazała wyuczony przez model sposób rozkładu uwagi pomiędzy wieloma modalnościami. W wybranej próbce zaobserwowano względnie większą uwagę poświęconą HbA1c, czasowi trwania cukrzycy i wiekowi spośród cech klinicznych, natomiast mapa uwagi CGM wyróżniła kilka okresów z wyraźną zmiennością glikemii. Mapa uwagi siatkówki zidentyfikowała konkretne regiony obrazu przyczyniające się do reprezentacji modelu, a macierz uwagi międzymodalnej wykazała wzorce uwagi zarówno wewnątrzmodalnej, jak i międzymodalnej. Jak pokazano na Rysunku 9, reprezentatywne mapy uwagi pochodzące z modelu wyróżniają wybrane wzorce temporalne glikemii, wpływowe zmienne kliniczne oraz diagnostycznie istotne regiony obrazów siatkówki w próbce testowej z zestawu odseparowanego.
Wyniki oceny zorientowanej na człowieka
Zaprojektowano prospektywny protokół oceny zorientowanej na człowieka w celu zbadania zaufania klinicystów, interpretowalności, użyteczności, użyteczności klinicznej oraz istotności wyjaśnień w warunkach obejmujących samą predykcję oraz predykcję wraz z wyjaśnieniem. W proponowanej ocenie wezmą udział endokrynolodzy, specjaliści diabetologii oraz farmakolodzy kliniczni, po uzyskaniu odpowiedniej zgody Komisji Bioetycznej oraz świadomej zgody uczestników. Ponieważ ocena ta jest przeznaczona do przyszłego wdrożenia prospektywnego, w niniejszym protokole nie raportowano wyników efektów na poziomie klinicystów.
Tabela 7 podsumowuje proponowany prospektywny projekt oceny klinicznej oraz zdefiniowane kryteria oceny wpływu wyjaśnień na zaufanie klinicystów, interpretowalność i postrzeganą użyteczność. W ramach oceny prospektywnej porównane zostaną oceny przewidywań modelu dokonane przez klinicystów z towarzyszącymi im wyjaśnieniami oraz bez nich, z wykorzystaniem zdefiniowanych kryteriów w skali Likerta. Proponowany prospektywny schemat oceny wyjaśnialności zorientowany na człowieka został przedstawiony na Rysunku 10

Rycina 1Ogólna architektura frameworka FedMediFormer-XAI. Schematyczny przegląd struktury FedMediFormer-XAI, przedstawiający multimodalne pozyskiwanie i wstępne przetwarzanie danych, augmentację opartą na dyfuzji, uczenie transformatorów specyficznych dla danej modalności, federacyjne trenowanie modelu, personalizowany dobór leków oparty na GraphSAGE oraz analizę wyjaśnialności. Struktura ta generuje predykcje cukrzycy, personalizowane rekomendacje lekowe oraz interpretowalne wyniki modelu. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.

Rysunek 2Potok akwizycji i wstępnego przetwarzania multimodalnego zbioru danych. Schematyczny przebieg procesu pozyskiwania i wstępnego przetwarzania multimodalnych zbiorów danych wykorzystanych w FedMediFormer-XAI. Dane kliniczne i zdrowotne populacji, zapisy CGM, obrazy siatkówki oraz informacje farmakologiczne poddawane są specyficznej dla danej modalności kontroli jakości, wstępnemu przetwarzaniu, normalizacji, kodowaniu i augmentacji przed konwersją na reprezentacje gotowe do użycia w modelu w celu przeprowadzenia dalszych analiz. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ilustracji.

Rysunek 3: Przebieg procesu augmentacji danych oparty na dyfuzji. Schematyczny przebieg procesu augmentacji ustrukturyzowanych tabelarycznych danych treningowych z wykorzystaniem TabDDPM. Wygenerowane próbki poddawane są ocenie jakości oraz podobieństwa rozkładu przed zintegrowaniem ich z oryginalnymi danymi treningowymi w celu poprawy równowagi klas. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ilustracji.

Rysunek 4Architektura proponowanej multimodalnej struktury transformera. Schemat architektury obejmujący (A) koder TabTransformer dla danych klinicznych, (B) temporal transformer encoder do danych z CGM oraz (C) koder Vision Transformer dla obrazów siatkówki. (D) Reprezentacje specyficzne dla danej modalności są integrowane za pomocą mechanizmu uwagi krzyżowej (cross-modal attention) w celu wygenerowania ujednoliconej reprezentacji multimodalnej. (E) Specyficzne dla zadań głowice predykcyjne generują wyniki modelu. (F) Komponenty regularyzacji i optymalizacji wspierają trenowanie modelu, a (Gproces optymalizacji jest sterowany przez funkcje strat klasyfikacji, regresji oraz spójności międzymodalnej. Wynikowa reprezentacja multimodalna wspiera zadania predykcji, rekomendacji i wyjaśnialności w dalszych etapach analizy. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 5Struktura komunikacyjna uczenia federacyjnego. Schematyczny przebieg procesu uczenia federacyjnego w rozproszonych ośrodkach szpitalnych. Lokalne modele multimodalne są trenowane z wykorzystaniem danych specyficznych dla danego klienta, a zabezpieczone aktualizacje modelu są przesyłane do serwera centralnego w celu przeprowadzenia średniowania federacyjnego (Federated Averaging). Zagregowany model globalny jest następnie redystrybuowany do klientów w kolejnych rundach komunikacyjnych. Schemat przedstawia również bezpieczną wymianę parametrów oraz ocenę wymagań w zakresie prywatności, komunikacji i mocy obliczeniowej. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 6Przepływ pracy w systemie personalizowanych rekomendacji lekowych opartym na grafach. Schematyczny przebieg procesu spersonalizowanego rekomendowania leków w oparciu o GraphSAGE. Dane farmakologiczne oraz dane reprezentujące pacjentów są zorganizowane w postaci grafu heterogenicznego, który obejmuje istotne podmioty i relacje w ramach opieki zdrowotnej. Algorytm GraphSAGE uczy się reprezentacji pacjentów i leków, które są następnie wykorzystywane do obliczenia wyników dopasowania pacjenta do leku i rankingu potencjalnych preparatów. Kombinacje leków przeciwwskazane lub niebezpieczne są filtrowane przed wygenerowaniem końcowych rekomendacji typu Top-K, przy czym informacje oparte na grafie wspierają interpretację tych rekomendacji. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 7Ramy oceny wyjaśnialności. Schematyczny przegląd procesu wyjaśnialności. (A) Analiza SHAP ocenia globalny i lokalny wkład cech; (B) Integrated Gradients dostarcza wyjaśnień opartych na atrybucji; (C) wizualizacja uwagi identyfikuje wpływowe cechy oraz interakcje między modalnościami; i (D) Analiza kontrfaktyczna identyfikuje zmiany cech związane ze zmienionymi predykcjami. Wynikowe wyjaśnienia wspierają interpretację predykcji modelu oraz personalizowane rekomendacje. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 8Reprezentatywna analiza istotności cech SHAP pochodna z modelu, wygenerowana przez wytrenowany model FedMediFormer-XAIWykres podsumowujący SHAP przedstawia rozkład wartości SHAP dla analizowanych próbek, przy czym cechy zostały uszeregowane według ich średniego bezwzględnego wkładu SHAP. Dodatnie wartości SHAP wskazują na wkład w wyższe przewidywane ryzyko cukrzycy, natomiast wartości ujemne wskazują na wkład w niższe przewidywane ryzyko. Kolor reprezentuje odpowiadającą im wartość cechy, przy czym wyższe wartości cech są zaznaczone na czerwono, a niższe na niebiesko. Wykres stanowi rzeczywisty wynik wyjaśnialności pochodzący z modelu, a nie ilustrację schematyczną. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.

Rysunek 9Reprezentatywne wyniki uwagi wygenerowane przez wytrenowany model FedMediFormer-XAI dla jednej losowo wybranej próbki testowej z zestawu wydzielonego. (A) Uwaga poświęcona cechom klinicznym uzyskana z głowicy uwagi multimodalnego transformera, przedstawiająca względne wagi uwagi przypisane do cech klinicznych. (B) Uwaga czasowa w obrębie sekwencji CGM, ilustrująca okresy czasowe, które otrzymały większą uwagę modelu. (C) Uwaga przestrzenna dla obrazu dna siatkówki, obejmująca obraz oryginalny, mapę cieplną uwagi oraz nałożenie uwagi. (D) Uwaga międzymodalna (cross-modal attention) pomiędzy tokenami modalności klinicznej, CGM i siatkówkowej, przedstawiająca ważenie informacji wewnątrzmodalnych i międzymodalnych. Wyświetlone wizualizacje są wynikami wygenerowanymi przez wytrenowany model. Wagi uwagi przedstawiono dla wybranej próbki testowej i należy je interpretować jako wzorce uwagi modelu, a nie jako niezależne miary przyczynowości klinicznej. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
| Zbiór danych | Typ danych | Próbki/Zapisy | Cechy/Zawartość | Cel | Publiczna dostępność |
| Zbiór danych dotyczący cukrzycy u Indian Pima | Tabela kliniczna | 768 pacjentów | 8 zmiennych klinicznych | Przewidywanie ryzyka cukrzycy | Publiczny |
| Wskaźniki zdrowotne dotyczące cukrzycy według CDC | Zdrowie populacyjne | 253 680 rekordów | Dane demograficzne, styl życia, wskaźniki zdrowotne | Analiza ryzyka populacyjnego | Publiczne |
| Zbiór danych OhioT1DM | Szeregi czasowe CGM | 12 badanych | Glukoza, insulina, posiłki, wysiłek fizyczny, sen | Modelowanie czasowe cukrzycy | Publiczny |
| Wykrywanie ślepoty APTOS 2019 | Obrazy siatkówki | 3 62 obrazy | Fotografie dna oka z etykietami stopnia zaawansowania | Analiza retinopatii cukrzycowej | Publiczne |
| Zbiór danych opinii o lekach | Farmakologiczny | 215 063 recenzji | Skuteczność leków, oceny, recenzje | Rekomendacja leku | Publiczny |
| Otwarte dane DrugBank | Graf wiedzy o lekach | Tysiące leków | Interakcje lek-lek, cele, szlaki sygnałowe | Konstrukcja grafu | Dostęp publiczny/akademicki |
Tabela 1: Charakterystyka zbiorów danych. Podsumowanie publicznie dostępnych zbiorów danych wykorzystanych w niniejszym badaniu, w tym typu zbioru danych, wielkości próby, modalności danych, zawartości cech, zamierzonego celu oraz dostępności.
| Zbiór danych | Modalność | Cel predykcji | Poziom fuzji |
| Cukrzyca u Indian Pima | Kliniczne | Klasyfikacja cukrzycy | Osadzanie cech |
| Wskaźniki stanu zdrowia w zakresie cukrzycy według CDC | Zdrowie populacyjne | Przewidywanie ryzyka cukrzycy | Osadzanie cech |
| OhioT1DM | Ciągłe monitorowanie glikemii | Przewidywanie trendów glikemii | Osadzanie cech |
| APTOS 2019 | Obrazy dna oka | Analiza retinopatii cukrzycowej | Osadzanie cech |
| Przegląd leków + DrugBank | Farmakologiczny | Rekomendacja leku | Zanurzanie grafu |
Tabela 2: Strategia integracji multimodalnego zbioru danych. Podsumowanie zbiorów danych wykorzystanych do multimodalnej analizy danych w cukrzycy, zawierające modalność danych, cel predykcji oraz poziom, na którym integrowane są reprezentacje specyficzne dla danej modalności. Dane kliniczne, dane dotyczące zdrowia populacyjnego, dane z ciągłego monitorowania glikemii oraz obrazy siatkówki są reprezentowane jako osadzenia cech (feature embeddings), natomiast informacje farmakologiczne są integrowane za pomocą osadzeń grafowych w celu spersonalizowanej rekomendacji leków.
| Model | Dokładność, Średnia ± SD (95% CI) | Precyzja, średnia ± SD (95% CI) | Czułość, Średnia ± SD (95% CI) | Wskaźnik F1, średnia ± SD (95% CI) | MCC, średnia ± SD (95% CI) | AUC-ROC, średnia ± SD (95% CI) |
| Losowy Las | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.44) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.99) | 0.67 ± 0.03 (0.63–0.71) | 0.88 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.44) | 83.80 ± 0.56 (83.11–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.66–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–88.15) | 87.00 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| Vision Transformer | 88.80 ± 0.50 (88.18–89.42) | 88.20 ± 0.60 (87.46–88.94) | 87.60 ± 0.56 (86.91–88.29) | 87.90 ± 0.56 (87.21–88.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| Transformator czasowy | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| CNN-LSTM | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.77) | 0.91 ± 0.01 (0.90–0.92) |
| Scentralizowany Transformator Multimodalny | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.44) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.88 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
Tabela 3: Wydajność przewidywania cukrzycy. Porównawcza wydajność predykcyjna modelu FedMediFormer-XAI oraz bazowych modeli uczenia maszynowego i głębokiego z wykorzystaniem metryk dokładności (accuracy), precyzji (precision), czułości (recall), wyniku F1 (F1-score), współczynnika MCC oraz AUC-ROC.
| Metryka | Uczenie scentralizowane | Uczenie federacyjne |
| Dokładność (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| Ochrona prywatności | Nie | Tak |
| Wymagane udostępnienie surowych danych | Tak | Nie |
| Rundy komunikacyjne | Nie dotyczy | 100 |
| Czas szkolenia (godziny) | 4.8 | 5.6 |
| Zgodność z przepisami | Umiarkowany | Wysoki |
Tabela 4: Wydajność uczenia federacyjnego w porównaniu z centralnym. Porównanie implementacji uczenia centralnego i federacyjnego pod kątem wydajności predykcyjnej, wymagań dotyczących udostępniania surowych danych, rund komunikacyjnych oraz czasu uczenia.
| Zbiór danych | Dokładność (%) | Precyzja (%) | Czułość (%) | AUC-ROC |
| Zbiór danych dotyczący cukrzycy u Indian Pima | 91.8 | 90.5 | 89.8 | 0.93 |
| Wskaźniki zdrowotne dotyczące cukrzycy według CDC | 93.1 | 92.2 | 91.6 | 0.95 |
| Zbiór danych OhioT1DM | 92.4 | 91.8 | 91.1 | 0.94 |
| Wykrywanie ślepoty APTOS 2019 | 94.7 | 93.9 | 93.5 | 0.96 |
| Fuzja multimodalna (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Tabela 5: Wyniki na poziomie zbiorów danych. Analiza wydajności w poszczególnych zbiorach danych i konfiguracjach fuzji multimodalnej. Wyniki ilustrują wkład różnych modalności danych w ogólną wydajność predykcyjną.
| Metryka | Wartość |
| Precyzja@5 | 0.89 |
| Pełność@5 | 0.84 |
| NDCG@5 | 0.91 |
| Dokładność wykrywania interakcji lekowych | 0.95 |
| Zakres rekomendacji | 0.8 |
| Średni odwrotny rząd (MRR) | 0.86 |
| Wskaźnik zgodności z zasadami bezpieczeństwa | 0.94 |
Tabela 6: Wydajność spersonalizowanych rekomendacji leków. Ocena spersonalizowanych rekomendacji leków opartych na grafach z wykorzystaniem metryk rankingowych, dokładności wykrywania interakcji, pokrycia rekomendacji oraz oceny bezpieczeństwa leczenia.
| Kryterium oceny | Proponowany projekt ewaluacji |
| Zaufanie klinicystów | Ocena w pięciostopniowej skali Likerta |
| Interpretowalność | Ocena w pięciostopniowej skali Likerta |
| Znaczenie kliniczne | Ocena w pięciostopniowej skali Likerta |
| Użyteczność wyjaśnienia | Ocena w pięciostopniowej skali Likerta |
| Postrzegana użyteczność | Ocena w pięciostopniowej skali Likerta |
| Zgodność między sędziami | kappa Fleissa, do obliczenia po ocenie prospektywnej |
| Porównanie statystyczne | Test statystyczny dla par, w zależności od potrzeb po zebraniu danych |
| Uczestnicy | 12 klinicystów, za zgodą komisji etycznej oraz po uzyskaniu świadomej zgody |
| Status oceny | Ocena prospektywna/przyszła |
Tabela 7: Proponowane kryteria oceny skoncentrowane na człowieku. Proponowany prospektywny schemat oceny skoncentrowany na klinicyście w celu oceny użyteczności, istotności klinicznej, interpretowalności, wiarygodności i łatwości obsługi wyjaśnień FedMediFormer-XAI. Ocena obejmuje standaryzowaną ocenę w pięciostopniowej skali Likerta, zgodność między sędziami przy użyciu kappa Fleissa, porównanie statystyczne warunków z samą predykcją oraz predykcją z wyjaśnieniem, a także 95% przedziały ufności. Ocena kliniczna powinna zostać przeprowadzona wyłącznie po uzyskaniu zgody odpowiedniej Komisji Etyki Instytutowej oraz świadomej zgody pacjenta.
Tabela uzupełniająca 1: Strategia walidacji zbioru danychW celu zapewnienia powtarzalności oraz wiarygodnej oceny modelu wdrożono partycjonowanie zbioru danych, procedury walidacji, strategie równoważenia klas oraz środki kontroli jakości. Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela uzupełniająca 2: Parametry modelu dyfuzyjnegoUstawienia konfiguracji modelu dyfuzyjnego TabDDPM, obejmujące parametry trenowania, ustawienia optymalizacji, wymiary ukryte, strategię harmonogramowania szumu oraz specyfikacje generowania próbek syntetycznych. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 3: Konfiguracja transformera multimodalnegoKonfiguracja architektury multimodalnego transformera, obejmująca koder kliniczny, temporalny i obrazowy, wymiary osadzeń i fuzji, głowice uwagi, optymalizator, szybkość uczenia, rozmiar partii, epoki treningowe, kryterium wczesnego zatrzymania oraz skumulowaną funkcję straty treningowej. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 4: Konfiguracja uczenia federacyjnego. Parametry wykorzystane do federacyjnego uczenia z zachowaniem prywatności, w tym liczba uczestniczących szpitali, rundy komunikacyjne, lokalne epoki uczenia, współczynnik partycypacji klientów, algorytm agregacji, optymalizator, szybkość uczenia, metoda szyfrowania, protokół komunikacyjny oraz polityka udostępniania surowych danych. Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela uzupełniająca 5: Konfiguracja GraphSAGE. Konfiguracja heterogenicznego modułu spersonalizowanych rekomendacji leków opartego na GraphSAGE, obejmująca typ grafu, wymiary ukryte i osadzania (embeddingów), liczbę warstw grafu, rozmiar próbkowania sąsiedztwa, optymalizator, szybkość uczenia, rozmiar partii, liczbę epok treningowych, funkcję straty Bayesian Personalized Ranking oraz liczbę rekomendacji czołowych leków. Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela uzupełniająca 6: Metryki oceny wyjaśnialności. Metryki ilościowe i zorientowane na człowieka, stosowane do oceny wyjaśnialności architektury FedMediFormer-XAI. Metryki te oceniają wierność, stabilność, spójność, rzadkość, kompletność, czułość i niefidelność wyjaśnień, a także zgodność między sędziami oraz postrzeganą przez klinicystów jakość wyjaśnień. Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela uzupełniająca 7: Metryki ocenyDo oceny wydajności, odporności, jakości rankingu oraz interpretowalności frameworka wykorzystuje się metryki predykcyjne, uczenia federacyjnego, rekomendacji oraz wyjaśnialności. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 8: Projekt oceny zorientowanej na człowiekaProjekt badania ewaluacyjnego zorientowanego na klinicystę, obejmujący grupy uczestników, warunki oceny, kryteria oceny oraz procedury analizy statystycznej. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 9: Materiał dotyczący odtwarzalnościPodsumowanie zbiorów danych, specyfikacji implementacji, plików konfiguracyjnych, procedur ewaluacyjnych, dokumentacji oraz zapisów eksperymentalnych wymaganych do zapewnienia odtwarzalności proponowanego frameworka FedMediFormer-XAI. Kliknij tutaj, aby pobrać ten plik.