Analysen zur Vorhersageleistung
FedMediFormer-XAI zeigte eine verbesserte Vorhersageleistung im Vergleich zu den evaluierten unimodalen und herkömmlichen Baseline-Modellen. Die diffusionsbasierte Datenaugmentierung verbesserte die Repräsentation der Minderheitenklassen, und die resultierende Vorhersageleistung ist in Tabelle 3 zusammengefasst. Die wiederholte Evaluation ergab eine stabile Vorhersageleistung über alle evaluierten Modelle hinweg. FedMediFormer-XAI erreichte die höchste Gesamtleistung mit einer Genauigkeit von 94,20 ± 0,34 % (95 % KI: 93,78–94,62), einer Präzision von 93,10 ± 0,30 % (95 % KI: 92,73–93,47), einem Recall von 92,80 ± 0,28 % (95 % KI: 92,45–93,15) und einem F1-Score von 92,90 ± 0,28 % (95 % KI: 92,55–93,25). Das Modell erreichte einen MCC von 0,88 ± 0,02 (95 % KI: 0,86–0,90) sowie einen AUC-ROC-Wert von 0,96 ± 0,01 (95 % KI: 0,95–0,97). Der zentralisierte multimodale Transformer erzielte die nächstbeste Gesamtleistung, während die unimodalen und herkömmlichen maschinellen Lernmodelle vergleichsweise geringere Vorhersageleistungen aufwiesen. Diese Ergebnisse zeigen, dass multimodales Repräsentationslernen in Kombination mit federierter Optimierung zu einer verbesserten und stabileren Klassifizierungsleistung bei Diabetes führt.
Ablationsstudie
Eine komponentenweise Ablation wurde verwendet, um den Beitrag der Diffusions-Augmentierung, des föderierten Lernens, der auf GraphSAGE basierenden Arzneimittelempfehlung und der multimodalen Fusion zu bewerten. Der vollständige FedMediFormer-XAI-Ansatz erreichte über fünf unabhängige Durchläufe eine Genauigkeit von 94,20 ± 0,34 %, eine Präzision von 93,10 ± 0,30 %, einen Recall von 92,80 ± 0,28 %, einen F1-Score von 92,90 ± 0,28 %, einen MCC von 0,88 ± 0,02 und einen AUC-ROC-Wert von 0,96 ± 0,01. Der Wegfall der Diffusions-Augmentierung verringerte die Genauigkeit auf 91,80 ± 0,42 %, was einer Abnahme um 2,40 Prozentpunkte entspricht, während der F1-Score und der AUC-ROC-Wert auf 90,30 ± 0,38 % bzw. 0,94 ± 0,01 sanken. Diese Verringerung zeigt den Beitrag der auf Diffusion basierenden Augmentierung zur Repräsentation von Minderheitenklassen und zur Vorhersage-Robustheit an.
Das Entfernen des föderierten Lernens führte zu einer Genauigkeit von 93,10 ± 0,37 %, was einer Abnahme um 1,10 Prozentpunkte im Vergleich zum vollständigen Framework entspricht. Präzision, Sensitivität, F1-Score, MCC und AUC-ROC verringerten sich ebenfalls auf 92,20 ± 0,34 %, 91,80 ± 0,32 %, 92,00 ± 0,33 %, 0,86 ± 0,02 bzw. 0,95 ± 0,01. Dieser Vergleich verdeutlicht den Beitrag der föderierten Konfiguration zur Vorhersageleistung.
Das Entfernen der auf GraphSAGE basierenden Komponente für personalisierte Arzneitempfehlungen führte zu einer vergleichsweise geringen Änderung der Leistung bei der Diabetesvorhersage, wobei die Genauigkeit auf 93,80 ± 0,35 % und der F1-Score auf 92,60 ± 0,30 % sank. Die entsprechenden Werte für MCC und AUC-ROC lagen bei 0,87 ± 0,02 bzw. 0,96 ± 0,01. Dieses Ergebnis zeigt, dass GraphSAGE hauptsächlich zur personalisierten Arzneitempfehlung beiträgt und nicht direkt die Leistung der Diabetesklassifizierung bestimmt.
Der stärkste Rückgang wurde beobachtet, wenn die multimodale Fusion entfernt wurde. Die Genauigkeit sank auf 87,60 ± 0,55 %, was einem Absinken um 6,60 Prozentpunkte entspricht, während Präzision, Sensitivität, F1-Score, MCC und AUC-ROC auf 86,80 ± 0,51 %, 85,90 ± 0,54 %, 86,30 ± 0,52 %, 0,76 ± 0,03 bzw. 0,91 ± 0,01 fielen. Dieses Ergebnis unterstreicht die Bedeutung einer gemeinsamen Modellierung komplementärer Informationen aus klinischen, CGM- und Netzhautmodalitäten.
Föderierte Lernanalyse
Der föderierte Lernansatz ermöglichte ein kollaboratives Modelltraining über verteilte Clients hinweg, während die Rohpatientendaten dezentral verarbeitet blieben. Während des Trainings wurde das lokale Modell jedes Clients individuell feinabgestimmt und anschließend mittels der Methode des föderierten Mittelwerts kombiniert. Nach 100 Kommunikationsrunden konvergierte das globale Modell, und seine Vorhersageleistung blieb mit der zentralisierten Lernmethode vergleichbar. Der föderierte Lernansatz zeigte über die Kommunikationsrunden hinweg eine stabile Konvergenz, trotz heterogener Datenverteilung auf den einzelnen Clients. Der geschützte Austausch von Parametern bewahrte die dezentrale Datenverarbeitung, während das globale Modell eine wettbewerbsfähige Vorhersageleistung im Vergleich zur zentralisierten Referenzmethode beibehielt. Tabelle 4 vergleicht die zentralisierte und die föderierte Implementierung. Föderiertes Lernen erforderte aufgrund des Kommunikationsaufwands zusätzliche Trainingszeit, wobei die Vorhersageleistung mit der des zentralisierten Lernens vergleichbar blieb.
Analyse der Leistung auf Datensatzebene
Um die Generalisierbarkeit über verschiedene Gesundheitsversorgungsmodalitäten hinweg zu bewerten, haben wir die Leistung für jeden Datensatz einzeln analysiert. Das multimodale FedMediFormer-XAI-Modell zeigte eine starke und insgesamt wettbewerbsfähige Leistung über alle untersuchten Datensätze hinweg. Es erreichte eine Genauigkeit von 91,8 %, 93,1 %, 92,4 % bzw. 94,2 % auf den Datensätzen Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM und APTOS 2019. Obwohl der Datensatz APTOS 2019 eine leicht höhere Genauigkeit (94,7 %) und Präzision (93,9 %) erzielte als das multimodale Modell, blieb die vorgeschlagene multimodale Methode in allen Datensätzen wettbewerbsfähig und erreichte einen AUC-ROC-Wert von 0,96, vergleichbar mit dem höchsten AUC-ROC-Wert auf Datensatzebene. Die Gesamtergebnisse auf Datensatzebene sind in Tabelle 5 dargestellt. Bei einzelnen Datensätzen erzielte die Analyse von Netzhautbildern die beste Leistung, wenn sie allein verwendet wurde, während die multimodale Fusion die stabilsten und ausgewogensten Vorhersagen lieferte.
Individuelle Arzneimittel-Empfehlungsanalyse
Die auf einem Graph-Neural-Network basierende Empfehlungskomponente wurde mithilfe von Informationen zur Arzneimittelwirksamkeit und Daten zu Arzneimittelwechselwirkungen evaluiert, wobei potenzielle Arzneimittel gemäß gelernter Patient-Arzneimittel-Eignungswerte sortiert wurden und kontraindizierte Kombinationen bei der Erstellung der Empfehlungen ausgeschlossen wurden. Durch das heterogene Graph-Format sowie die Modellierung von Patient-Arzneimittel- und Arzneimittel-Arzneimittel-Wechselwirkungen konnte eine umfassende Analyse durchgeführt werden, die individuelle Arzneimittelauswahl und Sicherheitsbewertung unterstützt. Das GraphSAGE-Empfehlungsmodell erfasste effektiv komplexe Zusammenhänge zwischen Patienten, Erkrankungen, Laborbefunden und Arzneimitteln. Die personalisierten Empfehlungen wiesen eine hohe Güte bei der Rangfolgenbildung auf und ermöglichten gleichzeitig klinisch aussagekräftige Erklärungen durch Analyse der Graph-Nachbarschaften und Merkmalszuschreibung.
Gemäß Tabelle 6 wurde das Modul zur personalisierten Arzneimittelempfehlung anhand von Precision@5, Recall@5 und NDCG@5 bewertet. Diese Metriken quantifizieren die Relevanz und die Qualität der Rangfolge der fünf besten personalisierten Arzneimittel-Empfehlungen, die vom auf GraphSAGE basierenden Empfehlungsmodul generiert wurden. Das Empfehlungssystem erzielte eine hohe Güte der Rangfolge mit einem Precision-Wert von 0,89, einem Recall-Wert von 0,84 und einem NDCG-Wert von 0,91.
Erklärbarkeitsanalyse
Der Rahmen nutzt SHAP, integrierte Gradienten, Visualisierungen der Aufmerksamkeit (Attention) und kontrafaktische Erklärungen, um die Interpretation multimodaler Vorhersagen zu unterstützen. SHAP wurde verwendet, um den Beitrag einzelner Merkmale zu quantifizieren, integrierte Gradienten, um die Vorhersagen auf Eingabemerkmale zurückzuführen, Aufmerksamkeitsvisualisierungen, um die Fokussierung des Modells über verschiedene Modalitäten hinweg zu untersuchen, und kontrafaktische Erklärungen, um Merkmalsänderungen zu identifizieren, die mit alternativen Vorhersagen verbunden sind. Abbildung 8 zeigt eine repräsentative, vom trainierten FedMediFormer-XAI-Modell erzeugte SHAP-Zusammenfassungsgrafik, während Abbildung 9 repräsentative Aufmerksamkeitsvisualisierungen zeigt, die aus dem trainierten Transformer extrahiert wurden. Diese Abbildungen stellen Ergebnisse dar, die aus der Modellbewertung stammen, und nicht schematische Darstellungen der vorgeschlagenen Architektur.
In Abbildung 8 werden die Rangfolgen der Merkmalswichtigkeit auf aggregierter Ebene dargestellt. Merkmale mit höheren absoluten SHAP-Werten hatten einen stärkeren Einfluss auf die Modellvorhersagen und stimmten zudem gut mit dem bestehenden klinischen Wissen überein.
Abbildung 9 zeigt repräsentative Visualisierungen der Aufmerksamkeit, die direkt aus dem trainierten FedMediFormer-XAI-Modell für eine zufällig ausgewählte Teststichprobe extrahiert wurden. Die Visualisierungen umfassen die Aufmerksamkeit für klinische Merkmale, die zeitliche Aufmerksamkeit für CGM-Daten, die räumliche Aufmerksamkeit für Netzhautbilder sowie die intermodale Aufmerksamkeit zwischen den drei Modalitäten. Die Aufmerksamkeitsvisualisierung verdeutlicht weiterhin die vom Modell gelernte Verteilung der Aufmerksamkeit über mehrere Modalitäten hinweg. Bei der ausgewählten Stichprobe zeigte sich eine vergleichsweise stärkere Fokussierung auf HbA1c, Diabetesdauer und Alter innerhalb der klinischen Merkmale, während die CGM-Aufmerksamkeitskarte mehrere Phasen mit ausgeprägter Glukosevariabilität hervorhob. Die Netzhaut-Aufmerksamkeitskarte identifizierte spezifische Bildbereiche, die zur Modellrepräsentation beitragen, und die intermodale Aufmerksamkeitsmatrix verdeutlichte sowohl intra- als auch intermodale Aufmerksamkeitsmuster. Wie in Abbildung 9 dargestellt, heben die repräsentativen, vom Modell abgeleiteten Aufmerksamkeitskarten ausgewählte zeitliche Glukosemuster, einflussreiche klinische Variablen und diagnostisch relevante Bereiche in Netzhautbildern innerhalb einer ausgewählten Teststichprobe hervor.
Ergebnisse der menschenzentrierten Evaluation
Ein prospektives, menschenzentriertes Evaluationsprotokoll wurde entwickelt, um das Vertrauen der Ärzte, die Interpretierbarkeit, Benutzerfreundlichkeit, klinische Nützlichkeit und Relevanz der Erklärungen unter Bedingungen mit nur Vorhersage und mit Vorhersage plus Erklärung zu bewerten. Die vorgeschlagene Evaluation wird Endokrinologen, Diabetologen und klinische Pharmakologen einbeziehen und verfügt über die erforderliche Genehmigung der Instituts-Ethikkommission sowie informierte Einwilligungen. Da diese Evaluation für eine zukünftige prospektive Durchführung vorgesehen ist, werden in diesem Protokoll keine Ergebniswerte auf Arztebene berichtet.
Tabelle 7 fasst das vorgeschlagene prospektive Design zur Bewertung durch Ärzt:innen sowie die vorab festgelegten Kriterien zur Beurteilung der Auswirkungen von Erklärungen auf das Vertrauen der Ärzt:innen, die Interpretierbarkeit und die wahrgenommene Nützlichkeit zusammen. Die prospektive Evaluation wird die Einschätzungen von Ärzt:innen bezüglich Modellvorhersagen mit und ohne begleitende Erklärungen anhand vordefinierter Likert-Skala-Kriterien vergleichen. Der vorgeschlagene prospektive, auf Menschen ausgerichtete Bewertungsrahmen für Erklärbarkeit ist in Abbildung 10 dargestellt.

Abbildung 1: Gesamtarchitektur des FedMediFormer-XAI-Frameworks. Schematische Übersicht über das FedMediFormer-XAI-Framework, die multimodale Datenerfassung und -vorverarbeitung, diffusionsbasierte Datenaugmentierung, modalitysspezifisches Transformer-Lernen, föderiertes Modelltraining, GraphSAGE-basierte personalisierte Arzneimittelempfehlung sowie Erklärbarkeitsanalyse zeigt. Das Framework erzeugt Diabetesvorhersagen, personalisierte Medikamentenempfehlungen und interpretierbare Modellausgaben. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 2: Erwerb und Vorverarbeitungspipeline für multimodale Datensätze. Schematischer Workflow zur Erfassung und Vorverarbeitung der in FedMediFormer-XAI verwendeten multimodalen Datensätze. Klinische und bevölkerungsbezogene Gesundheitsdaten, CGM-Aufzeichnungen, Netzhautbilder und pharmakologische Informationen durchlaufen modenspezifische Qualitätskontrolle, Vorverarbeitung, Normalisierung, Kodierung und Erweiterung, bevor sie in für das Modell geeignete Darstellungen für die nachgeschaltete Analyse umgewandelt werden. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 3: Workflow zur datenbasierten Augmentierung mittels Diffusionsmodell. Schematischer Workflow zur tabellarischen Datenvergrößerung mithilfe strukturierter Trainingsdaten mit TabDDPM. Generierte Datensätze durchlaufen Qualitäts- und Verteilungsähnlichkeitsanalysen, bevor sie zusammen mit den ursprünglichen Trainingsdaten verwendet werden, um die Klassenbalance zu verbessern. Klicken Sie hier, um eine vergrößerte Darstellung dieser Abbildung anzusehen.

Abbildung 4: Architektur des vorgeschlagenen multimodalen Transformer-Frameworks. Schematische Architektur bestehend aus (A) einem TabTransformer-Encoder für klinische Daten, (B) einem zeitlichen Transformer-Encoder für CGM-Daten und (C) einem Vision-Transformer-Encoder für Netzhautbilder. (D) Modus-spezifische Darstellungen werden über eine cross-modale Aufmerksamkeit integriert, um eine einheitliche multimodale Repräsentation zu erzeugen. (E) Aufgabenspezifische Vorhersageköpfe generieren die Modellausgaben. (F) Regularisierungs- und Optimierungskomponenten unterstützen das Modelltraining, und (G) Klassifizierungs-, Regressions- sowie cross-modale Konsistenzverluste leiten den Optimierungsprozess. Die resultierende multimodale Repräsentation unterstützt nachgelagerte Vorhersage-, Empfehlungs- und Erklärbarkeitsaufgaben. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 5: Kommunikationsarchitektur des föderierten Lernens. Schematischer Ablauf des föderierten Trainings über verteilte Krankenhausclients hinweg. Lokale multimodale Modelle werden anhand kundenspezifischer Daten trainiert, und geschützte Modellaktualisierungen werden an einen zentralen Server zur föderierten Mittelwertbildung übermittelt. Das aggregierte globale Modell wird anschließend erneut an die Clients verteilt, um weitere Kommunikationsrunden zu ermöglichen. Die Architektur veranschaulicht zudem den sicheren Austausch von Parametern sowie die Bewertung von Anforderungen an Datenschutz, Kommunikation und Rechenleistung. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 6: Graphbasierte personalisierte Arzneimittel-Empfehlungsabfolge. Schematische Abfolge für die personalisierte Arzneimittel-Empfehlung basierend auf GraphSAGE. Pharmakologische und Patientenrepräsentationsdaten werden in einem heterogenen Graphen organisiert, der relevante medizinische Entitäten und deren Beziehungen enthält. GraphSAGE lernt Repräsentationen von Patienten und Arzneimitteln, die zur Berechnung von Eignungswerten zwischen Patient und Arzneimittel sowie zur Rangfolge infrage kommender Medikamente verwendet werden. Kontraindizierte oder unsichere Arzneimittelkombinationen werden vor der Erstellung der endgültigen Top-K-Empfehlungen herausgefiltert, wobei graphenbasierte Informationen die Interpretation der Empfehlungen unterstützen. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 7: Rahmenwerk zur Bewertung der Erklärbarkeit. Schematische Übersicht des Erklärbarkeits-Workflows. (A) Die SHAP-Analyse bewertet globale und lokale Merkmalsbeiträge; (B) Integrierte Gradienten liefern erklärungsbasierte Zuordnungen; (C) die Visualisierung der Aufmerksamkeit („Attention“) identifiziert einflussreiche Merkmale und Wechselwirkungen zwischen Modalitäten; und (D) die kontrfaktische Analyse identifiziert Merkmalsänderungen, die mit veränderten Vorhersagen assoziiert sind. Die resultierenden Erklärungsausgaben unterstützen die Interpretation von Modellvorhersagen und personalisierten Empfehlungen. Klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 8: Repräsentative, modellbasierte SHAP-Analyse der Merkmalswichtigkeit, erzeugt durch das trainierte FedMediFormer-XAI-Modell. Das SHAP-Zusammenfassungsdiagramm zeigt die Verteilung der SHAP-Werte über alle ausgewerteten Proben, wobei die Merkmale nach ihrem mittleren absoluten SHAP-Beitrag geordnet sind. Positive SHAP-Werte zeigen Beiträge zu einem höheren vorhergesagten Diabetesrisiko an, während negative Werte Beiträge zu einem niedrigeren vorhergesagten Risiko anzeigen. Die Farbe repräsentiert den jeweiligen Merkmalswert, wobei höhere Werte rot und niedrigere Werte blau dargestellt sind. Die Darstellung zeigt eine tatsächliche, vom Modell generierte Erklärbarkeitsausgabe und keine schematische Illustration. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 9: Repräsentative Aufmerksamkeitsausgaben des trainierten FedMediFormer-XAI-Modells für eine zufällig ausgewählte Teststichprobe aus der Hold-out-Menge. (A) Klinische Merkmalsaufmerksamkeit, gewonnen aus einem Aufmerksamkeitskopf des multimodalen Transformers, zeigt die relativen Aufmerksamkeitsgewichtungen der klinischen Merkmale. (B) Zeitliche Aufmerksamkeit entlang der CGM-Sequenz, die Zeitabschnitte mit höherer Modellaufmerksamkeit veranschaulicht. (C) Räumliche Aufmerksamkeit für das Netzhaut-Fundusbild, einschließlich des Originalbilds, der Aufmerksamkeits-Heatmap und der Überlagerung. (D) Multimodale Aufmerksamkeit zwischen klinischen, CGM- und Netzhautmodalitäts-Token, die intra- und intermodale Informationsgewichtung zeigt. Die dargestellten Visualisierungen sind vom Modell abgeleitete Ausgaben des trainierten Modells. Die Aufmerksamkeitsgewichte beziehen sich auf die ausgewählte Teststichprobe und sollten als Muster der Modellaufmerksamkeit interpretiert werden, nicht als unabhängige Maße klinischer Kausalität. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
| Datensatz | Datentyp | Stichproben/Datensätze | Merkmale/Inhalte | Zweck | Öffentliche Verfügbarkeit |
| Pima Indians Diabetes Datensatz | Klinische Tabellenform | 768 Patienten | 8 klinische Variablen | Diabetes-Risikovorhersage | Öffentlich |
| CDC Diabetes Health Indikatoren | Bevölkerungsgesundheit | 253.680 Datensätze | Demografie, Lebensstil, Gesundheitsindikatoren | Analyse des Bevölkerungsrisikos | Öffentlich |
| OhioT1DM Datensatz | CGM-Zeitreihen | 12 Probanden | Glukose, Insulin, Mahlzeiten, Bewegung, Schlaf | Zeitliche Diabetesmodellierung | Öffentlich |
| APTOS 2019 Blindness Detection | Netzhautbilder | 3.662 Bilder | Augenhintergrundaufnahmen mit Schweregradbezeichnungen | Analyse der diabetischen Retinopathie | Öffentlich |
| Arzneimittel-Bewertungsdatensatz | Pharmakologisch | 215.063 Bewertungen | Arzneimittelwirksamkeit, Bewertungen, Rezensionen | Arzneimittel-Empfehlung | Öffentlich |
| DrugBank Open Data | Arzneimittel-Wissensgraph | Tausende von Arzneimitteln | Arzneimittel-Wechselwirkungen, Zielstrukturen, Signalwege | Graph-Konstruktion | Öffentlich/Akademischer Zugang |
Tabelle 1: Datensatzmerkmale. Zusammenfassung der in dieser Studie verwendeten öffentlich verfügbaren Datensätze, einschließlich Datensatztyp, Stichprobengröße, Datenmodus, Merkmalsinhalt, vorgesehenem Verwendungszweck und Verfügbarkeit.
| Datensatz | Modalität | Vorhersageziel | Fusionsebene |
| Pima Indians Diabetes | Klinisch | Klassifizierung von Diabetes | Feature-Embedding |
| CDC Diabetes Health Indicators | Bevölkerungsgesundheit | Diabetes-Risikovorhersage | Feature-Embedding |
| OhioT1DM | Kontinuierliche Glukoseüberwachung | Glukose-Trendvorhersage | Feature-Embedding |
| APTOS 2019 | Retinale Fundusbilder | Analyse der diabetischen Retinopathie | Feature-Embedding |
| Drug Review + DrugBank | Pharmakologisch | Arzneimittel-Empfehlung | Graph-Embedding |
Tabelle 2: Strategie zur Integration multimodaler Datensätze. Zusammenfassung der für die multimodale Diabetesintelligenz verwendeten Datensätze, einschließlich der Datenmodalität, des Vorhersageziels und der Ebene, auf der modenspezifische Darstellungen integriert werden. Klinische, Bevölkerungsgesundheits-, kontinuierliche Glukosemessungs- und Netzhautbild-Daten werden als Merkmals-Embeddings dargestellt, während pharmakologische Informationen über Graph-Embeddings für personalisierte Arzneimittelempfehlungen integriert werden.
| Modell | Genauigkeit, Mittelwert ± SD (95 % KI) | Precision, Mittelwert ± SD (95 % KI) | Recall, Mittelwert ± SD (95 % KI) | F1-Score, Mittelwert ± SD (95 % KI) | MCC, Mittelwert ± SD (95 % KI) | AUC-ROC, Mittelwert ± SD (95 % KI) |
| Random Forest | 83,60 ± 0,74 (82,68–84,52) | 82,70 ± 0,60 (81,96–83,44) | 81,90 ± 0,56 (81,21–82,59) | 82,30 ± 0,56 (81,61–82,99) | 0,67 ± 0,03 (0,63–0,71) | 0,88 ± 0,01 (0,87–0,89) |
| XGBoost | 85,30 ± 0,71 (84,42–86,18) | 84,70 ± 0,60 (83,96–85,44) | 83,80 ± 0,56 (83,11–84,49) | 84,20 ± 0,56 (83,51–84,89) | 0,70 ± 0,03 (0,66–0,74) | 0,90 ± 0,01 (0,89–0,91) |
| TabTransformer | 87,50 ± 0,52 (86,85–88,15) | 87,00 ± 0,60 (86,26–87,74) | 86,20 ± 0,56 (85,51–86,89) | 86,60 ± 0,56 (85,91–87,29) | 0,75 ± 0,03 (0,71–0,79) | 0,92 ± 0,01 (0,91–0,93) |
| Vision Transformer | 88,80 ± 0,50 (88,18–89,42) | 88,20 ± 0,60 (87,46–88,94) | 87,60 ± 0,56 (86,91–88,29) | 87,90 ± 0,56 (87,21–88,59) | 0,78 ± 0,03 (0,74–0,82) | 0,93 ± 0,01 (0,92–0,94) |
| Temporal Transformer | 87,20 ± 0,51 (86,57–87,83) | 86,60 ± 0,60 (85,86–87,34) | 85,90 ± 0,56 (85,21–86,59) | 86,20 ± 0,56 (85,51–86,89) | 0,74 ± 0,03 (0,70–0,78) | 0,91 ± 0,01 (0,90–0,92) |
| CNN-LSTM | 86,90 ± 0,58 (86,18–87,62) | 86,30 ± 0,60 (85,56–87,04) | 85,60 ± 0,55 (84,92–86,28) | 85,90 ± 0,56 (85,21–86,59) | 0,73 ± 0,03 (0,69–0,77) | 0,91 ± 0,01 (0,90–0,92) |
| Zentraler multimodaler Transformer | 91,30 ± 0,12 (91,15–91,45) | 90,70 ± 0,60 (89,96–91,44) | 90,10 ± 0,56 (89,41–90,79) | 90,40 ± 0,56 (89,71–91,09) | 0,83 ± 0,03 (0,79–0,87) | 0,95 ± 0,01 (0,94–0,96) |
| FedMediFormer-XAI | 94,20 ± 0,34 (93,78–94,62) | 93,10 ± 0,30 (92,73–93,47) | 92,80 ± 0,28 (92,45–93,15) | 92,90 ± 0,28 (92,55–93,25) | 0,88 ± 0,02 (0,86–0,90) | 0,96 ± 0,01 (0,95–0,97) |
Tabelle 3: Vorhersageleistung bei Diabetes. Vergleichende Vorhersageleistung von FedMediFormer-XAI und Baseline-Modellen des maschinellen Lernens und des Deep Learnings anhand der Metriken Genauigkeit, Präzision, Sensitivität, F1-Score, MCC und AUC-ROC.
| Metrik | Zentrales Lernen | Föderiertes Lernen |
| Genauigkeit (%) | 94,7 | 94,2 |
| AUC-ROC | 0,97 | 0,96 |
| Datenschutz | Nein | Ja |
| Teilung roher Daten erforderlich | Ja | Nein |
| Kommunikationsrunden | N/V | 100 |
| Trainingsdauer (Stunden) | 4,8 | 5,6 |
| Einhaltung gesetzlicher Vorschriften | Mäßig | Hoch |
Tabelle 4: Leistung von verbundbasierter im Vergleich zu zentralisierter Lernverfahren. Vergleich zentralisierter und verbundbasierter Lernverfahren hinsichtlich Vorhersagegenauigkeit, Anforderungen an die Weitergabe von Rohdaten, Kommunikationsrunden und Trainingsdauer.
| Datensatz | Genauigkeit (%) | Präzision (%) | Erinnerung (%) | AUC-ROC |
| Pima Indians Diabetes Dataset | 91.8 | 90.5 | 89.8 | 0.93 |
| CDC Diabetes Health Indicators | 93.1 | 92.2 | 91.6 | 0.95 |
| OhioT1DM Dataset | 92.4 | 91.8 | 91.1 | 0.94 |
| APTOS 2019 Blindness Detection | 94.7 | 93.9 | 93.5 | 0.96 |
| Multimodal Fusion (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Tabelle 5: Ergebnisse auf Datensatzebene. Leistungsanalyse über einzelne Datensätze und multimodale Fusionseinstellungen hinweg. Die Ergebnisse veranschaulichen den Beitrag verschiedener Datenmodi zur Gesamtvorhersageleistung.
| Metrik | Wert |
| Precision@5 | 0.89 |
| Recall@5 | 0.84 |
| NDCG@5 | 0.91 |
| Genauigkeit bei der Erkennung von Arzneimittelwechselwirkungen | 0.95 |
| Abdeckung der Empfehlungen | 0.88 |
| Mittlerer reziproker Rang (MRR) | 0.86 |
| Sicherheitskonformitäts-Score | 0.94 |
Tabelle 6: Leistung der personalisierten Arzneimittelempfehlung. Bewertung der graphenbasierten personalisierten Arzneimittelempfehlung anhand von Rangmetriken, Genauigkeit der Interaktionsdetektion, Abdeckung der Empfehlungen und Beurteilung der Arzneimittelsicherheit.
| Bewertungskriterium | Vorgeschlagenes Evaluationsdesign |
| Kliniker-Vertrauen | Bewertung anhand einer Fünf-Punkte-Likert-Skala |
| Interpretierbarkeit | Bewertung anhand einer Fünf-Punkte-Likert-Skala |
| Klinische Relevanz | Bewertung anhand einer Fünf-Punkte-Likert-Skala |
| Nützlichkeit der Erklärung | Bewertung anhand einer Fünf-Punkte-Likert-Skala |
| Empfundene Nützlichkeit | Bewertung anhand einer Fünf-Punkte-Likert-Skala |
| Übereinstimmung zwischen Bewertern | Fleiss-Kappa, das nach der prospektiven Evaluation berechnet wird |
| Statistischer Vergleich | Gepaarter statistischer Test, je nach Art der gesammelten Daten |
| Teilnehmer | 12 Kliniker, vorbehaltlich ethischer Genehmigung und informierter Einwilligung |
| Evaluierungsstatus | Prospektive/zukünftige Evaluation |
Tabelle 7: Vorgeschlagene menschenzentrierte Bewertungskriterien. Vorgeschlagener, auf klinische Fachkräfte ausgerichteter Bewertungsrahmen zur Beurteilung der Nützlichkeit, klinischen Relevanz, Interpretierbarkeit, Vertrauenswürdigkeit und Benutzerfreundlichkeit der Erklärungen von FedMediFormer-XAI. Die Bewertung umfasst eine standardisierte fünfstufige Likert-Skalen-Bewertung, die Übereinstimmung zwischen mehreren Bewertenden mittels Fleiss’ Kappa, einen statistischen Vergleich der Bedingungen „nur Vorhersage“ und „Vorhersage plus Erklärung“ sowie 95 %-Konfidenzintervalle. Die Bewertung durch den Kliniker sollte erst nach Genehmigung durch den zuständigen institutionellen Ethikausschuss und Einholung der informierten Einwilligung durchgeführt werden.
Zusatz-Tabelle 1: Strategie zur Datensatz-Validierung. Die Aufteilung des Datensatzes, Validierungsverfahren, Strategien zur Klassenbalance sowie Maßnahmen zur Qualitätssicherung wurden implementiert, um die Reproduzierbarkeit und eine zuverlässige Modellbewertung sicherzustellen. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Erweiterte Tabelle 2: Parameter des Diffusionsmodells. Konfigurationseinstellungen für das TabDDPM-Diffusionsmodell, einschließlich Trainingsparametern, Optimierungseinstellungen, latenten Dimensionen, Strategie zur Rauschplanung und Spezifikationen zur Erzeugung synthetischer Stichproben. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatz-Tabelle 3: Konfiguration des multimodalen Transformers. Konfiguration der Architektur des multimodalen Transformers, einschließlich der klinischen, zeitlichen und Bilddaten-Encoder, Einbettungs- und Fusionierungsdimensionen, Attention-Köpfe, Optimierer, Lernrate, Batch-Größe, Trainings-Epochen, Kriterium für vorzeitiges Beenden und kombinierter Trainingsverlust. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Erweiterte Tabelle 4: Konfiguration des föderierten Lernens. Parameter, die für das datenschutzfreundliche föderierte Training verwendet wurden, einschließlich der Anzahl beteiligter Krankenhäuser, Kommunikationsrunden, lokalen Trainingsrunden, Teilnahmequote der Clients, Aggregierungsalgorithmus, Optimierer, Lernrate, Verschlüsselungsmethode, Kommunikationsprotokoll und Richtlinie zur Weitergabe von Rohdaten. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzende Tabelle 5: GraphSAGE-Konfiguration. Konfiguration des heterogenen, auf GraphSAGE basierenden Moduls zur personalisierten Arzneimittelempfehlung, einschließlich Graph-Typ, Dimensionen der versteckten Schichten und Einbettungen, Anzahl der Graph-Schichten, Größe der Nachbarschafts-Stichproben, Optimierer, Lernrate, Batch-Größe, Trainings-Epochen, Bayesian Personalized Ranking Loss sowie Anzahl der top Arzneimittel-Empfehlungen. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzende Tabelle 6: Evaluierungsmetriken für Erklärbarkeit. Quantitative und nutzerzentrierte Metriken zur Bewertung der Erklärbarkeit des FedMediFormer-XAI-Frameworks. Die Metriken beurteilen die Treue der Erklärungen, Stabilität, Konsistenz, Sparsamkeit, Vollständigkeit, Sensitivität, Irrelevanz, Übereinstimmung zwischen Bewertern sowie die von Ärzten wahrgenommene Erklärungsqualität. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatz-Tabelle 7: Bewertungsmetriken. Vorhersage-, verbundbasiertes Lernen, Empfehlungs- und Erklärbarkeitsmetriken werden verwendet, um die Leistung, Robustheit, Rangqualität und Interpretierbarkeit des Frameworks zu bewerten. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzende Tabelle 8: Evaluationsdesign mit Fokus auf den Menschen. Design der klinikerzentrierten Evaluationsstudie, einschließlich Teilnehmergruppen, Evaluationsbedingungen, Bewertungskriterien und statistischer Analyseverfahren. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatz-Tabelle 9: Nachvollziehbarkeitsressourcen. Zusammenfassung der Datensätze, Implementierungsspezifikationen, Konfigurationsdateien, Evaluierungsverfahren, Dokumentationen und experimentellen Aufzeichnungen, die erforderlich sind, um die Nachvollziehbarkeit des vorgeschlagenen FedMediFormer-XAI-Frameworks zu unterstützen. Bitte klicken Sie hier, um diese Datei herunterzuladen.