Analiza wydajności predykcyjnej
Model FedMediFormer-XAI wykazał lepszą wydajność predykcyjną w porównaniu z ocenianymi modelami unimodalnymi oraz konwencjonalnymi modelami bazowymi. Augmentacja oparta na modelach dyfuzyjnych poprawiła reprezentację klas mniejszościowych, a wynikową wydajność predykcyjną podsumowano w Tabeli 3. Ewaluacja z wielokrotnym uruchomieniem wykazała stabilną wydajność predykcyjną we wszystkich ocenianych modelach. FedMediFormer-XAI osiągnął najwyższą ogólną wydajność, z dokładnością (accuracy) 94,20 ± 0,34% (95% CI: 93,78–94,62), precyzją (precision) 93,10 ± 0,30% (95% CI: 92,73–93,47), czułością (recall) 92,80 ± 0,28% (95% CI: 92,45–93,15) oraz wynikiem F1 (F1-score) 92,90 ± 0,28% (95% CI: 92,55–93,25). Model osiągnął wskaźnik MCC na poziomie 0,88 ± 0,02 (95% CI: 0,86–0,90) oraz AUC-ROC wynoszące 0,96 ± 0,01 (95% CI: 0,95–0,97). Centralny transformer multimodalny zapewnił drugą najlepszą ogólną wydajność, podczas gdy modele unimodalne i konwencjonalne modele uczenia maszynowego wykazały porównawczo niższą wydajność predykcyjną. Wyniki te wskazują, że multimodalne uczenie reprezentacji w połączeniu z optymalizacją federacyjną pozwala uzyskać lepszą i bardziej stabilną wydajność klasyfikacji cukrzycy.
Badanie ablacyjne
W celu oceny wkładu augmentacji dyfuzyjnej, uczenia federacyjnego, rekomendacji leków opartej na GraphSAGE oraz fuzji multimodalnej przeprowadzono ablację poszczególnych komponentów. Pełny framework FedMediFormer-XAI osiągnął dokładność na poziomie 94,20 ± 0,34%, precyzję 93,10 ± 0,30%, czułość 92,80 ± 0,28%, wynik F1 92,90 ± 0,28%, współczynnik MCC 0,88 ± 0,02 oraz AUC-ROC 0,96 ± 0,01 w pięciu niezależnych uruchomieniach. Usunięcie augmentacji dyfuzyjnej obniżyło dokładność do 91,80 ± 0,42%, co odpowiada spadkowi o 2,40 punktu procentowego, natomiast wynik F1 i AUC-ROC spadły odpowiednio do 90,30 ± 0,38% i 0,94 ± 0,01. Redukcja ta wskazuje na wkład augmentacji opartej na dyfuzji w reprezentację klas mniejszościowych i odporność predykcyjną.
Usunięcie uczenia federacyjnego (federated learning) spowodowało uzyskanie dokładności na poziomie 93,10 ± 0,37%, co stanowi spadek o 1,10 punktu procentowego w stosunku do pełnego modelu. Precyzja, pełność, wynik F1, współczynnik MCC oraz AUC-ROC uległy również zmniejszeniu i wyniosły odpowiednio 92,20 ± 0,34%, 91,80 ± 0,32%, 92,00 ± 0,33%, 0,86 ± 0,02 oraz 0,95 ± 0,01. Porównanie to wykazuje wkład konfiguracji federacyjnej w skuteczność predykcyjną.
Usunięcie komponentu personalizowanych rekomendacji leków opartego na GraphSAGE spowodowało stosunkowo niewielką zmianę w wydajności przewidywania cukrzycy, przy czym dokładność spadła do 93,80 ± 0,35%, a wskaźnik F1 do 92,60 ± 0,30%. Odpowiednio, wartości MCC i AUC-ROC wyniosły 0,87 ± 0,02 oraz 0,96 ± 0,01. Wynik ten wskazuje, że GraphSAGE przyczynia się przede wszystkim do personalizowanych rekomendacji lekowych, a nie bezpośrednio do określania wydajności klasyfikacji cukrzycy.
Największy spadek odnotowano po usunięciu multimodalnej fuzji. Dokładność spadła do 87.60 ± 0.55%, co stanowi spadek o 6,60 punktu procentowego, natomiast precyzja, czułość, wskaźnik F1, MCC oraz AUC-ROC spadły odpowiednio do 86.80 ± 0.51%, 85.90 ± 0.54%, 86.30 ± 0.52%, 0.76 ± 0.03 i 0.91 ± 0.01. Wynik ten wykazuje znaczenie wspólnego modelowania komplementarnych informacji z modalności klinicznych, CGM oraz siatkówki.
Analiza uczenia federacyjnego
Struktura uczenia federacyjnego umożliwiła wspólne trenowanie modelu w rozproszonych jednostkach klienckich, zapewniając jednocześnie zdecentralizowane zarządzanie surowymi danymi pacjentów. Podczas trenowania lokalny model każdego klienta był dostrajany indywidualnie, a następnie łączony za pomocą metody Federated Averaging. Po 100 rundach komunikacyjnych model globalny osiągnął zbieżność, a jego wydajność predykcyjna pozostała spójna z wynikami uczenia scentralizowanego. Struktura uczenia federacyjnego wykazała stabilną zbieżność w kolejnych rundach komunikacyjnych pomimo heterogenicznych rozkładów danych klientów. Wymiana chronionych parametrów zachowała zdecentralizowany sposób przetwarzania danych, podczas gdy model globalny utrzymał konkurencyjną wydajność predykcyjną w stosunku do scentralizowanej linii bazowej. Tabela 4 porównuje implementacje scentralizowane i federacyjne. Uczenie federacyjne wymagało dodatkowego czasu trenowania ze względu na narzut komunikacyjny, zachowując jednocześnie wydajność predykcyjną porównywalną z uczeniem scentralizowanym.
Analiza wydajności na poziomie zbiorów danych
Aby ocenić zdolność do generalizacji w różnych modalnościach opieki zdrowotnej, oceniono wydajność dla każdego zbioru danych osobno. Multimodalny model FedMediFormer-XAI wykazał wysoką i ogólnie konkurencyjną wydajność we wszystkich ocenianych zbiorach danych. Osiągnął on dokładność wynoszącą odpowiednio 91,8%, 93,1%, 92,4% i 94,2% dla zbiorów danych Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM oraz APTOS 2019. Chociaż dla zbioru danych APTOS 2019 uzyskano nieco wyższą dokładność (94,7%) i precyzję (93,9%) niż w przypadku modelu multimodalnego, proponowane podejście multimodalne utrzymało konkurencyjną wydajność we wszystkich zbiorach danych i osiągnęło wartość AUC-ROC na poziomie 0,96, co jest porównywalne z najwyższym wynikiem AUC-ROC na poziomie pojedynczego zbioru. Ogólne wyniki na poziomie zbiorów danych przedstawiono w Tabeli 5. W przypadku pojedynczych zbiorów danych najlepszą wydajność uzyskano przy samodzielnej analizie obrazów siatkówki, natomiast fuzja multimodalna zapewniła najbardziej stabilne i zrównoważone predykcje.
Analiza spersonalizowanych rekomendacji lekowych
Komponent rekomendacji oparty na grafowych sieciach neuronowych został oceniony przy użyciu informacji o skuteczności leków oraz danych o oddziaływaniach między lekami, przy czym potencjalne leki zostały uszeregowane zgodnie z wyliczonymi wynikami dopasowania pacjent-lek, a kombinacje przeciwwskazane zostały wykluczone podczas generowania rekomendacji. Zastosowanie formatu grafu heterogenicznego oraz modelowanie interakcji pacjent-lek i lek-lek pozwoliło na przeprowadzenie szczegółowej analizy, co wspiera spersonalizowany dobór leków oraz ocenę bezpieczeństwa. Model rekomendacyjny GraphSAGE skutecznie uchwycił złożone zależności między pacjentami, chorobami, wynikami badań laboratoryjnych a lekami. Spersonalizowane rekomendacje wykazały wysoką wydajność w rankingu, zachowując jednocześnie klinicznie istotne wyjaśnienia dzięki analizie sąsiedztwa grafu i atrybucji cech.
Zgodnie z Tabelą 6, moduł spersonalizowanych zaleceń lekowych został oceniony przy użyciu wskaźników Precision@5, Recall@5 oraz NDCG@5. Metryki te określają istotność i jakość rankingu pięciu najlepszych spersonalizowanych rekomendacji lekowych wygenerowanych przez moduł rekomendacyjny oparty na modelu GraphSAGE. System rekomendacyjny osiągnął wysoką skuteczność rankingowania, przy precision = 0.89, recall = 0.84 oraz NDCG = 0.91.
Analiza wyjaśnialności
W ramach struktury wykorzystano SHAP, zintegrowane gradienty (Integrated Gradients), wizualizację uwagi oraz wyjaśnienia kontrfaktyczne, aby wesprzeć interpretację predykcji multimodalnych. SHAP posłużył do ilościowego określenia wkładu na poziomie cech, zintegrowane gradienty do przypisania predykcji do cech wejściowych, wizualizacja uwagi do zbadania fokusu modelu w różnych modalnościach, a wyjaśnienia kontrfaktyczne do zidentyfikowania zmian cech związanych z alternatywnymi predykcjami. Rysunek 8 przedstawia reprezentatywny wykres podsumowujący SHAP wygenerowany przez wytrenowany model FedMediFormer-XAI, natomiast Rysunek 9 prezentuje reprezentatywne wizualizacje uwagi wyekstrahowane z wytrenowanego transformera. Rysunki te przedstawiają wyniki uzyskane z ewaluacji modelu, a nie schematyczne ilustracje proponowanej architektury.
Na Rysunku 8 przedstawiono rankingi istotności cech na poziomie zagregowanym. Cechy o wyższych bezwzględnych wartościach SHAP miały większy wpływ na przewidywania modelu, co było również zgodne z istniejącą wiedzą kliniczną.
Rysunek 9 przedstawia reprezentatywne wizualizacje uwagi wyekstrahowane bezpośrednio z wytrenowanego modelu FedMediFormer-XAI dla losowo wybranej próbki testowej z zestawu pominiętego. Wizualizacje obejmują uwagę na cechy kliniczne, uwagę temporalną CGM, uwagę przestrzenną siatkówki oraz uwagę między-modalną pomiędzy trzema modalnościami. Wizualizacja uwagi dodatkowo wykazała wyuczony przez model sposób rozkładu uwagi pomiędzy wieloma modalnościami. Wybrana próbka wykazała relatywnie większą uwagę skupioną na HbA1c, czasie trwania cukrzycy oraz wieku spośród cech klinicznych, podczas gdy mapa uwagi CGM wyróżniła kilka okresów z wyraźną zmiennością glikemii. Mapa uwagi siatkówki zidentyfikowała konkretne obszary obrazu przyczyniające się do reprezentacji modelu, a macierz uwagi między-modalnej wykazała wzorce uwagi zarówno wewnątrz-modalnych, jak i między-modalnych. Jak pokazano na Rysunku 9, reprezentatywne mapy uwagi pochodne z modelu podkreślają wybrane temporalne wzorce glikemii, wpływowe zmienne kliniczne oraz diagnostycznie istotne obszary obrazu siatkówki w próbce testowej z zestawu pominiętego.
Wyniki oceny zorientowanej na człowieka
Zaprojektowano prospektywny protokół oceny zorientowanej na człowieka, aby ocenić zaufanie klinicystów, interpretowalność, użyteczność, użyteczność kliniczną oraz relewantność wyjaśnień w warunkach przewidywania (prediction-only) oraz przewidywania z wyjaśnieniem (prediction-plus-explanation). W proponowanej ocenie wezmą udział endokrynolodzy, specjaliści diabetolodzy oraz farmakolodzy kliniczni, po uzyskaniu odpowiedniej zgody Komisji Etyki Instytucjonalnej i świadomej zgody uczestników. Ponieważ ocena ta jest przeznaczona do przyszłej implementacji prospektywnej, w niniejszym protokole nie przedstawiono wyników na poziomie klinicystów.
Tabela 7 podsumowuje proponowany prospektywny projekt oceny klinicznej oraz zdefiniowane kryteria oceny wpływu wyjaśnień na zaufanie klinicystów, interpretowalność i postrzeganą użyteczność. Prospektywna ocena porówna oceny klinicystów dotyczące prognoz modelu z dołączonymi wyjaśnieniami i bez nich, z wykorzystaniem zdefiniowanych kryteriów w skali Likerta. Proponowany prospektywny, zorientowany na człowieka system oceny wyjaśnialności przedstawiono na Rysunku 10

Rycina 1: Ogólna architektura frameworka FedMediFormer-XAI. Schematyczny przegląd frameworka FedMediFormer-XAI, przedstawiający multimodalną akwizycję i przetwarzanie wstępne danych, augmentację opartą na dyfuzji, uczenie transformerów specyficznych dla danej modalności, federacyjne trenowanie modelu, personalizowany dobór leków oparty na GraphSAGE oraz analizę wyjaśnialności. Framework generuje predykcje cukrzycy, spersonalizowane rekomendacje leków oraz interpretowalne wyniki modelu. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 2: Potok pozyskiwania i wstępnego przetwarzania multimodalnego zbioru danych. Schematyczny przebieg procesu pozyskiwania i wstępnego przetwarzania multimodalnych zbiorów danych wykorzystanych w FedMediFormer-XAI. Dane kliniczne i zdrowotne populacji, zapisy CGM, obrazy siatkówki oraz informacje farmakologiczne poddawane są specyficznej dla danej modalności kontroli jakości, wstępnemu przetwarzaniu, normalizacji, kodowaniu i augmentacji przed konwersją na reprezentacje gotowe do użycia w modelu w celu przeprowadzenia dalszych analiz. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 3: Przepływ pracy dla augmentacji danych opartej na dyfuzji. Schematyczny przebieg procesu augmentacji ustrukturyzowanych tabelarycznych danych treningowych z wykorzystaniem TabDDPM. Wygenerowane próbki poddawane są ocenie jakości oraz podobieństwa rozkładu przed zintegrowaniem ich z oryginalnymi danymi treningowymi w celu poprawy zrównoważenia klas. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 4: Architektura proponowanego multimodalnego modelu transformer. Schemat architektury obejmujący (A) koder TabTransformer dla danych klinicznych, (B) temporalny koder transformer dla danych CGM oraz (C) koder Vision Transformer dla obrazów siatkówki. (D) Reprezentacje specyficzne dla danej modalności są integrowane poprzez mechanizm uwagi między-modalnej (cross-modal attention) w celu wygenerowania ujednoliconej reprezentacji multimodalnej. (E) Głowice predykcyjne specyficzne dla zadania generują wyniki modelu. (F) Komponenty regularyzacji i optymalizacji wspierają trenowanie modelu, a (G) straty klasyfikacji, regresji i spójności między-modalnej prowadzą proces optymalizacji. Wynikowa reprezentacja multimodalna wspiera zadania predykcji, rekomendacji oraz wyjaśnialności. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

Rycina 5: Schemat komunikacyjny uczenia federacyjnego. Schematyczny przebieg procesu trenowania federacyjnego w rozproszonych centrach szpitalnych. Lokalne modele multimodalne są trenowane przy użyciu danych specyficznych dla każdego klienta, a zabezpieczone aktualizacje modeli są przesyłane do centralnego serwera w celu wykonania uśredniania federacyjnego (Federated Averaging). Zagregowany model globalny jest następnie redystrybuowany do klientów w kolejnych rundach komunikacyjnych. Schemat ilustruje również bezpieczną wymianę parametrów oraz ocenę wymagań dotyczących prywatności, komunikacji i obliczeń. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 6: Schemat przepływu pracy w systemie spersonalizowanych rekomendacji lekowych opartym na grafach. Schematyczny przepływ pracy dla spersonalizowanych rekomendacji lekowych opartych na GraphSAGE. Dane farmakologiczne oraz dane reprezentujące pacjentów są zorganizowane w graf heterogeniczny, który obejmuje odpowiednie podmioty i relacje z zakresu opieki zdrowotnej. GraphSAGE uczy się reprezentacji pacjentów i leków, które są wykorzystywane do obliczenia wyników przydatności leku dla danego pacjenta oraz rankingowania potencjalnych leków. Przeciwwskazane lub niebezpieczne kombinacje leków są filtrowane przed wygenerowaniem końcowych Top-K rekomendacji, przy czym informacje oparte na grafach wspierają interpretację tych rekomendacji. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

Rysunek 7: Schemat ram analizy wyjaśnialności. Przegląd schematyczny procesu wyjaśnialności. (A) analiza SHAP ocenia globalny i lokalny wkład cech; (B) zintegrowane gradienty (Integrated Gradients) dostarczają wyjaśnień opartych na atrybucji; (C) wizualizacja uwagi identyfikuje wpływowe cechy i interakcje między modalnościami; oraz (D) analiza kontrfaktyczna identyfikuje zmiany cech związane ze zmienionymi predykcjami. Wynikowe dane wyjaśniające wspierają interpretację predykcji modelu i spersonalizowane rekomendacje. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rysunek 8: Reprezentatywna analiza istotności cech SHAP pochodząca z modelu, wygenerowana przez wytrenowany model FedMediFormer-XAI. Wykres podsumowujący SHAP przedstawia rozkład wartości SHAP we wszystkich ocenianych próbkach, przy czym cechy są uporządkowane według ich średniego bezwzględnego wkładu SHAP. Dodatnie wartości SHAP wskazują na wkład w wyższe przewidywane ryzyko cukrzycy, natomiast wartości ujemne wskazują na wkład w niższe przewidywane ryzyko. Kolor reprezentuje odpowiadającą mu wartość cechy, gdzie wyższe wartości cech są pokazane na czerwono, a niższe na niebiesko. Wykres stanowi rzeczywisty wynik wyjaśnialności pochodzący z modelu, a nie ilustrację schematyczną. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rycina 9: Reprezentatywne wyniki uwagi wygenerowane przez wytrenowany model FedMediFormer-XAI dla jednej losowo wybranej próbki testowej z zestawu wydzielonego. (A) Uwaga dotycząca cech klinicznych uzyskana z głowicy uwagi transformera multimodalnego, pokazująca względne wagi uwagi przypisane do cech klinicznych. (B) Uwaga temporalna w sekwencji CGM, ilustrująca okresy czasu otrzymujące większą uwagę modelu. (C) Uwaga przestrzenna dla obrazu dna oka, obejmująca obraz oryginalny, mapę ciepła uwagi oraz nałożoną warstwę uwagi. (D) Uwaga między-modalna pomiędzy tokenami klinicznymi, CGM i modalnością siatkówki, pokazująca ważenie informacji wewnątrz-modalnych i między-modalnych. Wyświetlone wizualizacje są wynikami pochodzącymi z wytrenowanego modelu. Wagi uwagi są pokazane dla wybranej próbki testowej i powinny być interpretowane jako wzorce uwagi modelu, a nie jako niezależne miary przyczynowości klinicznej. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.
| Zbiór danych | Typ danych | Próbki/Rejestry | Cechy/Zawartość | Cel | Dostępność publiczna |
| Zbiór danych dotyczący cukrzycy u Indian Pima | Tabela kliniczna | 768 pacjentów | 8 zmiennych klinicznych | Przewidywanie ryzyka cukrzycy | Publiczny |
| Wskaźniki zdrowotne dotyczące cukrzycy CDC | Zdrowie populacyjne | 253 680 rekordów | Dane demograficzne, styl życia, wskaźniki zdrowotne | Analiza ryzyka populacyjnego | Publiczny |
| Zbiór danych OhioT1DM | Szeregi czasowe CGM | 12 uczestników | Glukoza, insulina, posiłki, aktywność fizyczna, sen | Modelowanie czasowe cukrzycy | Publiczny |
| Wykrywanie ślepoty APTOS 2019 | Obrazy siatkówki | 3 662 obrazy | Fotografie dna oka z etykietami stopnia zaawansowania zmian | Analiza retinopatii cukrzycowej | Publiczny |
| Zbiór danych recenzji leków | Farmakologiczne | 215 063 recenzji | Skuteczność leków, oceny, recenzje | Rekomendacja leku | Publiczny |
| Otwarte dane DrugBank | Graf wiedzy o lekach | Tysiące leków | Interakcje lekowe, cele, szlaki sygnałowe | Konstrukcja grafu | Dostęp publiczny/akademicki |
Tabela 1: Charakterystyka zbiorów danych. Podsumowanie publicznie dostępnych zbiorów danych wykorzystanych w niniejszym badaniu, obejmujące typ zbioru danych, wielkość próby, modalność danych, zawartość cech, zamierzony cel oraz dostępność.
| Zbiór danych | Modalność | Cel predykcji | Poziom fuzji |
| Cukrzyca u Indian Pima | Kliniczne | Klasyfikacja cukrzycy | Osadzanie cech |
| Wskaźniki stanu zdrowia w cukrzycy według CDC | Zdrowie populacyjne | Przewidywanie ryzyka cukrzycy | Osadzanie cech |
| OhioT1DM | Ciągły monitoring glikemii | Przewidywanie trendów glikemii | Osadzanie cech |
| APTOS 2019 | Obrazy dna oka | Analiza retinopatii cukrzycowej | Osadzanie cech |
| Przegląd Leków + DrugBank | Farmakologiczny | Zalecenie leku | Osadzanie grafów |
Tabela 2: Strategia integracji multimodalnego zbioru danych. Podsumowanie zbiorów danych wykorzystanych do multimodalnej analizy inteligentnej w cukrzycy, obejmujące modalność danych, cel predykcji oraz poziom, na którym integrowane są reprezentacje specyficzne dla danej modalności. Dane kliniczne, dane dotyczące zdrowia populacyjnego, ciągły monitoring glikemii oraz obrazy siatkówki są reprezentowane jako osadzenia cech (feature embeddings), natomiast informacje farmakologiczne są integrowane za pomocą osadzeń grafowych (graph embeddings) w celu spersonalizowanego rekomendowania leków.
| Model | Dokładność, średnia ± SD (95% CI) | Precyzja, średnia ± SD (95% CI) | Czułość, średnia ± SD (95% CI) | Wskaźnik F1, średnia ± SD (95% CI) | MCC, średnia ± SD (95% CI) | AUC-ROC, średnia ± SD (95% CI) |
| Random Forest | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.44) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.99) | 0.67 ± 0.03 (0.63–0.71) | 0.88 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.44) | 83.80 ± 0.56 (83.11–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.66–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–88.15) | 87.00 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| Vision Transformer | 88.80 ± 0.50 (88.18–89.42) | 88.20 ± 0.60 (87.46–88.94) | 87.60 ± 0.56 (86.91–88.29) | 87.90 ± 0.56 (87.21–88.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| Temporal Transformer | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| CNN-LSTM | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.77) | 0.91 ± 0.01 (0.90–0.92) |
| Centralized Multimodal Transformer | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.44) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.88 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
Tabela 3: Wydajność prognozowania cukrzycy. Porównawcza wydajność predykcyjna modelu FedMediFormer-XAI oraz bazowych modeli uczenia maszynowego i głębokiego z wykorzystaniem metryk dokładności (accuracy), precyzji (precision), czułości (recall), wyniku F1 (F1-score), współczynnika MCC oraz AUC-ROC.
| Metryka | Uczenie scentralizowane | Uczenie federacyjne |
| Dokładność (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| Ochrona prywatności | Nie | Tak |
| Wymagane udostępnienie surowych danych | Tak | Nie |
| Rundy komunikacyjne | Nie dotyczy | 100 |
| Czas szkolenia (godziny) | 4.8 | 5.6 |
| Zgodność z przepisami | Umiarkowany | Wysoki |
Tabela 4: Wydajność uczenia federacyjnego w porównaniu do scentralizowanego. Porównanie implementacji uczenia scentralizowanego i federacyjnego pod kątem wydajności predykcyjnej, wymagań dotyczących udostępniania surowych danych, rund komunikacyjnych oraz czasu trenowania.
| Zbiór danych | Dokładność (%) | Precyzja (%) | Czułość (%) | AUC-ROC |
| Zbiór danych o cukrzycy u Indian Pima | 91.8 | 90.5 | 89.8 | 0.93 |
| Wskaźniki stanu zdrowia w cukrzycy według CDC | 93.1 | 92.2 | 91.6 | 0.95 |
| Zbiór danych OhioT1DM | 92.4 | 91.8 | 91.1 | 0.94 |
| Wykrywanie ślepoty APTOS 2019 | 94.7 | 93.9 | 93.5 | 0.96 |
| Fuzja multimodalna (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Tabela 5: Wyniki na poziomie zbiorów danych. Analiza wydajności w odniesieniu do poszczególnych zbiorów danych i ustawień fuzji multimodalnej. Wyniki ilustrują wkład różnych modalności danych w ogólną wydajność predykcyjną.
| Metryka | Wartość |
| Precyzja@5 | 0.89 |
| Recall@5 | 0.84 |
| NDCG@5 | 0.91 |
| Dokładność wykrywania interakcji lekowych | 0.95 |
| Zakres rekomendacji | 0.88 |
| Średnia odwrotność rangi (MRR) | 0.86 |
| Wskaźnik zgodności z zasadami bezpieczeństwa | 0.94 |
Tabela 6: Wydajność spersonalizowanych rekomendacji lekowych. Ocena spersonalizowanych rekomendacji leków opartych na grafach przy użyciu metryk rankingowych, dokładności wykrywania interakcji, stopnia pokrycia rekomendacji oraz oceny bezpieczeństwa leczenia.
| Kryterium oceny | Proponowany plan oceny |
| Zaufanie klinicystów | Ocena w pięciostopniowej skali Likerta |
| Interpretowalność | Ocena w pięciostopniowej skali Likerta |
| Znaczenie kliniczne | Ocena w pięciostopniowej skali Likerta |
| Użyteczność wyjaśnienia | Ocena w pięciostopniowej skali Likerta |
| Postrzegana użyteczność | Ocena w pięciostopniowej skali Likerta |
| Zgodność między oceniającymi | Kapppa Fleissa, do obliczenia po ocenie prospektywnej |
| Porównanie statystyczne | Odpowiedni test statystyczny dla prób zależnych, przeprowadzony po zebraniu danych |
| Uczestnicy | 12 klinicystów, za zgodą komisji etycznej oraz po uzyskaniu świadomej zgody |
| Status oceny | Ocena prospektywna/przyszła |
Tabela 7: Proponowane kryteria oceny zorientowanej na człowieka. Proponowane prospektywne ramy oceny zorientowanej na klinicystę w celu analizy użyteczności, istotności klinicznej, interpretowalności, wiarygodności i łatwości obsługi wyjaśnień FedMediFormer-XAI. Ocena obejmuje ustandaryzowaną ocenę w pięciostopniowej skali Likerta, zgodność między sędziami przy użyciu kappa Fleissa, porównanie statystyczne warunków „tylko predykcja” oraz „predykcja z wyjaśnieniem” oraz 95% przedziały ufności. Ocena klinicysty powinna zostać przeprowadzona wyłącznie po uzyskaniu zgody odpowiedniej Komisji Etyki Instytutowej oraz świadomej zgody pacjenta.
Tabela uzupełniająca 1: Strategia walidacji zbioru danych. W celu zapewnienia powtarzalności oraz rzetelnej oceny modelu wdrożono partycjonowanie zbioru danych, procedury walidacji, strategie równoważenia klas oraz środki kontroli jakości. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 2: Parametry modelu dyfuzyjnego. Ustawienia konfiguracji modelu dyfuzyjnego TabDDPM, obejmujące parametry treningu, ustawienia optymalizacji, wymiary ukryte, strategię harmonogramowania szumu oraz specyfikacje generowania syntetycznych próbek. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 3: Konfiguracja transformera multimodalnego. Konfiguracja architektury transformera multimodalnego, obejmująca kodery kliniczne, czasowe i obrazowe, wymiary osadzeń (embedding) i fuzji, głowice uwagi, optymalizator, szybkość uczenia, rozmiar partii (batch size), liczbę epok uczenia, kryterium wczesnego zatrzymania oraz łączną funkcję straty podczas uczenia. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 4: Konfiguracja uczenia federacyjnego. Parametry wykorzystane do federacyjnego trenowania z zachowaniem prywatności, w tym liczba uczestniczących szpitali, rundy komunikacyjne, epoki trenowania lokalnego, wskaźnik uczestnictwa klientów, algorytm agregacji, optymalizator, szybkość uczenia, metoda szyfrowania, protokół komunikacyjny oraz polityka udostępniania surowych danych. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 5: Konfiguracja GraphSAGE. Konfiguracja heterogenicznego modułu spersonalizowanych rekomendacji leków opartego na GraphSAGE, obejmująca typ grafu, wymiary ukryte i zanurzeń (embedding), liczbę warstw grafu, rozmiar próbkowania sąsiedztwa, optymalizator, szybkość uczenia, rozmiar partii (batch size), epoki uczenia, funkcję straty Bayesian Personalized Ranking oraz liczbę rekomendowanych leków z listy top. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 6: Metryki oceny wyjaśnialności. Metryki ilościowe i zorientowane na człowieka użyte do oceny wyjaśnialności frameworka FedMediFormer-XAI. Metryki te oceniają wierność, stabilność, spójność, rzadkość, kompletność, czułość, niewierność wyjaśnień, zgodność między oceniającymi oraz postrzeganą przez klinicystów jakość wyjaśnień. Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela uzupełniająca 7: Metryki oceny. Metryki predykcyjne, uczenia federacyjnego, rekomendacji oraz wyjaśnialności są wykorzystywane do oceny wydajności, odporności, jakości rankingu i interpretowalności frameworka. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 8: Projekt oceny zorientowanej na człowieka. Projekt badania oceniającego z perspektywy klinicysty, obejmujący grupy uczestników, warunki oceny, kryteria oceny oraz procedury analizy statystycznej. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 9: Zasoby reprodukowalności. Podsumowanie zbiorów danych, specyfikacji implementacji, plików konfiguracyjnych, procedur ewaluacji, dokumentacji oraz zapisów eksperymentalnych wymaganych do zapewnienia reprodukowalności proponowanej architektury FedMediFormer-XAI. Kliknij tutaj, aby pobrać ten plik.