Analyse van de voorspellende prestaties
FedMediFormer-XAI vertoonde verbeterde voorspellende prestaties in vergelijking met de geëvalueerde unimodale en conventionele baseline-modellen. Augmentatie op basis van diffusie verbeterde de representatie van de minderheidsklasse, en de resulterende voorspellende prestaties zijn samengevat in Tabel 3. De evaluatie via herhaalde runs toonde een stabiele voorspellende prestatie aan over de geëvalueerde modellen. FedMediFormer-XAI behaalde de hoogste totale prestatie, met een nauwkeurigheid van 94.20 ± 0.34% (95% BI: 93.78–94.62), precisie van 93.10 ± 0.30% (95% BI: 92.73–93.47), recall van 92.80 ± 0.28% (95% BI: 92.45–93.15) en F1-score van 92.90 ± 0.28% (95% BI: 92.55–93.25). Het model behaalde een MCC van 0.88 ± 0.02 (95% BI: 0.86–0.90) en AUC-ROC van 0.96 ± 0.01 (95% BI: 0.95–0.97). De gecentraliseerde multimodale transformer leverde de op één na beste totale prestatie, terwijl de unimodale en conventionele machine-learningmodellen een relatief lagere voorspellende prestatie vertoonden. Deze resultaten geven aan dat multimodale representatie-learning, gecombineerd met gefedereerde optimalisatie, leidt tot een verbeterde en stabielere prestatie bij de classificatie van diabetes.
Ablatiestudie
Component-gewijze ablatie werd gebruikt om de bijdrage van diffusie-augmentatie, federated learning, GraphSAGE-gebaseerde medicijnrecommendatie en multimodale fusie te beoordelen. Het volledige FedMediFormer-XAI-framework behaalde een nauwkeurigheid van 94.20 ± 0.34%, precisie van 93.10 ± 0.30%, recall van 92.80 ± 0.28%, F1-score van 92.90 ± 0.28%, MCC van 0.88 ± 0.02 en AUC-ROC van 0.96 ± 0.01 over vijf onafhankelijke runs. Het weglaten van diffusie-augmentatie reduceerde de nauwkeurigheid tot 91.80 ± 0.42%, wat overeenkomt met een daling van 2,40 procentpunt, terwijl de F1-score en AUC-ROC respectievelijk daalden naar 90.30 ± 0.38% en 0.94 ± 0.01. Deze afname duidt op de bijdrage van diffusie-gebaseerde augmentatie aan de representatie van minderheidsklassen en de voorspellende robuustheid.
Het weglaten van federated learning resulteerde in een nauwkeurigheid van 93,10 ± 0,37%, wat een afname van 1,10 procentpunt vertegenwoordigt ten opzichte van het volledige framework. Precisie, recall, F1-score, MCC en AUC-ROC werden respectievelijk verminderd tot 92,20 ± 0,34%, 91,80 ± 0,32%, 92,00 ± 0,33%, 0,86 ± 0,02 en 0,95 ± 0,01. Deze vergelijking demonstreert de bijdrage van de federated configuratie aan de predictieve prestaties.
Het verwijderen van het op GraphSAGE gebaseerde component voor gepersonaliseerde geneesmiddelenaanbevelingen resulteerde in een relatief kleine verandering in de prestaties van de diabetesvoorspelling, waarbij de nauwkeurigheid afnam tot 93.80 ± 0.35% en de F1-score tot 92.60 ± 0.30%. De overeenkomstige MCC en AUC-ROC waren respectievelijk 0.87 ± 0.02 en 0.96 ± 0.01. Dit resultaat geeft aan dat GraphSAGE primair bijdraagt aan de gepersonaliseerde medicatieaanbeveling in plaats van direct de prestaties van de diabetesclassificatie te bepalen.
De grootste afname werd waargenomen toen de multimodale fusie werd verwijderd. De nauwkeurigheid daalde tot 87,60 ± 0,55%, wat een afname van 6,60 procentpunt vertegenwoordigt, terwijl precisie, recall, F1-score, MCC en AUC-ROC respectievelijk daalden naar 86,80 ± 0,51%, 85,90 ± 0,54%, 86,30 ± 0,52%, 0,76 ± 0,03 en 0,91 ± 0,01. Deze bevinding demonstreert het belang van het gezamenlijk modelleren van complementaire informatie uit klinische, CGM- en retina-modaliteiten.
Federated learning-analyse
Het raamwerk voor federated learning maakte collaboratieve modeltraining over gedistribueerde cliënten mogelijk, terwijl de gedecentraliseerde verwerking van ruwe patiëntgegevens behouden bleef. Tijdens de training werd het lokale model van elke cliënt individueel verfijnd en gecombineerd via de Federated Averaging-methode. Na 100 communicatierondes convergeerde het globale model en bleef de voorspellende prestatie consistent met gecentraliseerd leren. Het federated learning-raamwerk vertoonde een stabiele convergentie over de communicatierondes heen, ondanks heterogene datadistributies bij de cliënten. Beschermde parameteruitwisseling waarborgde de gedecentraliseerde gegevensverwerking, terwijl het globale model een concurrerende voorspellende prestatie behield ten opzichte van de gecentraliseerde baseline. Tabel 4 vergelijkt de gecentraliseerde en gefedereerde implementaties. Federated learning vereiste extra trainingstijd vanwege de communicatie-overhead, terwijl de voorspellende prestaties vergelijkbaar bleven met gecentraliseerd leren.
Prestatieanalyse op datasetniveau
Om de generaliseerbaarheid over verschillende gezondheidszorgmodaliteiten te evalueren, hebben we de prestaties voor elke dataset afzonderlijk beoordeeld. Het multimodale FedMediFormer-XAI-model vertoonde sterke en over het algemeen concurrerende prestaties over de geëvalueerde datasets. Het behaalde een nauwkeurigheid van respectievelijk 91,8%, 93,1%, 92,4% en 94,2% op de datasets Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM en APTOS 2019. Hoewel de APTOS 2019-dataset een iets hogere nauwkeurigheid (94,7%) en precisie (93,9%) behaalde dan het multimodale model, behield de voorgestelde multimodale benadering concurrerende prestaties over alle datasets en behaalde een AUC-ROC van 0,96, wat vergelijkbaar is met de hoogste AUC-ROC op datasetniveau. De algemene resultaten op datasetniveau worden gepresenteerd in Tabel 5. Voor individuele datasets leverde de analyse van retina-afbeeldingen de beste prestaties op wanneer deze alleen werd gebruikt, terwijl multimodale fusie de meest stabiele en goed gebalanceerde voorspellingen opleverde.
Analyse van gepersonaliseerde medicijnrecommendaties
De op graph neural networks gebaseerde recommendatiecomponent werd geëvalueerd met behulp van informatie over medicatie-effectiviteit en data over geneesmiddelinteracties, waarbij kandidaatmedicijnen werden gerangschikt op basis van geleerde patiënt-medicijn-geschiktheidsscores en gecontra-indiceerde combinaties werden uitgesloten tijdens het genereren van de recommendaties. Door het gebruik van het heterogene grafformaat en de modellering van patiënt-medicijn- en medicijn-medicijninteracties kon een grondige analyse worden uitgevoerd, wat gepersonaliseerde medicijnkeuzes en veiligheidsbeoordelingen ondersteunde. Het GraphSAGE-recommendatiemodel legde effectief complexe relaties vast tussen patiënten, ziekten, laboratoriumbevindingen en medicijnen. Gepersonaliseerde recommendaties vertoonden een hoge rankingprestatie, terwijl klinisch betekenisvolle verklaringen behouden bleven via graph neighborhood-analyse en feature-attributie.
Volgens Tabel 6 werd de module voor gepersonaliseerde medicatie-aanbevelingen geëvalueerd met behulp van Precision@5, Recall@5 en NDCG@5. Deze metrieken kwantificeren de relevantie en de rangschikkingskwaliteit van de top vijf gepersonaliseerde medicatie-aanbevelingen die door de op GraphSAGE gebaseerde aanbevelingsmodule zijn gegenereerd. Het aanbevelingssysteem behaalde sterke rangschikkingsprestaties, met een precision = 0,89, recall = 0,84 en NDCG = 0,91.
Uitlegbaarheidsanalyse
Het raamwerk maakt gebruik van SHAP, Integrated Gradients, attentievisualisatie en contrafeitelijke verklaringen om de interpretatie van multimodale voorspellingen te ondersteunen. SHAP werd gebruikt om bijdragen op kenmerkniveau te kwantificeren, Integrated Gradients om voorspellingen toe te schrijven aan invoerkenmerken, attentievisualisatie om de focus van het model over de modaliteiten heen te onderzoeken, en contrafeitelijke verklaringen om kenmerkveranderingen te identificeren die geassocieerd zijn met alternatieve voorspellingen. Figuur 8 toont een representatieve, model-afgeleide SHAP-samenvattingsplot gegenereerd vanuit het getrainde FedMediFormer-XAI-model, terwijl Figuur 9 representatieve attentievisualisaties toont die zijn geëxtraheerd uit de getrainde transformer. Deze figuren representeren outputs verkregen uit modelevaluatie en zijn geen schematische illustraties van de voorgestelde architectuur.
In Figuur 8 worden de rangschikkingen van het belang van kenmerken op aggregaatniveau gepresenteerd. Kenmerken met hogere absolute SHAP-waarden hadden een grotere invloed op de modelvoorspellingen en kwamen bovendien goed overeen met bestaande klinische kennis.
Figuur 9 presenteert representatieve attention-visualisaties die rechtstreeks zijn geëxtraheerd uit het getrainde FedMediFormer-XAI-model voor een willekeurig geselecteerde testsample. De visualisaties omvatten attention voor klinische kenmerken, temporele CGM-attention, ruimtelijke retina-attention en cross-modale attention tussen de drie modaliteiten. De attention-visualisatie demonstreerde verder de door het model geleerde allocatie van attention over meerdere modaliteiten. De geselecteerde sample vertoonde een relatief sterkere attention voor HbA1c, diabetesduur en leeftijd binnen de klinische kenmerken, terwijl de CGM-attention-map verschillende perioden met prominente glucosevariabiliteit markeerde. De retina-attention-map identificeerde specifieke beeldregio's die bijdragen aan de modelrepresentatie, en de cross-modale attention-matrix demonstreerde zowel intra-modale als cross-modale attention-patronen. Zoals weergegeven in Figuur 9, markeren de representatieve, uit het model afgeleide attention-maps geselecteerde temporele glucosepatronen, invloedrijke klinische variabelen en diagnostisch relevante retina-beeldregio's in een testsample.
Resultaten van de mensgerichte evaluatie
Er is een prospectief mensgericht evaluatieprotocol ontworpen om het vertrouwen van clinici, de interpreteerbaarheid, de bruikbaarheid, het klinische nut en de relevantie van de uitleg te beoordelen onder condities van alleen voorspelling en voorspelling plus uitleg. De voorgestelde evaluatie zal endocrinologen, diabetesspecialisten en klinisch farmacologen betrekken, met de nodige goedkeuring van de Institutionele Ethiekcommissie en geïnformeerde toestemming. Omdat deze evaluatie bedoeld is voor toekomstige prospectieve implementatie, worden de uitkomstscores op clinici-niveau niet vermeld in het huidige protocol.
Tabel 7 vat het voorgestelde prospectieve ontwerp voor de evaluatie door clinici samen, evenals de vooraf gedefinieerde criteria voor het beoordelen van de effecten van uitleg op het vertrouwen, de interpreteerbaarheid en het waargenomen nut van de clinicus. De prospectieve evaluatie zal de beoordelingen van clinici van modelvoorspellingen met en zonder begeleidende uitleg vergelijken met behulp van vooraf gedefinieerde criteria op een Likert-schaal. Het voorgestelde prospectieve, mensgerichte raamwerk voor de evaluatie van uitlegbaarheid wordt gepresenteerd in Figuur 10

Figuur 1: Algemene architectuur van het FedMediFormer-XAI-framework. Schematisch overzicht van het FedMediFormer-XAI-framework, met weergave van multimodale data-acquisitie en preprocessing, diffusie-gebaseerde augmentatie, modaliteitsspecifiek transformer-leren, gefedereerde modeltraining, GraphSAGE-gebaseerde gepersonaliseerde medicamenteuze aanbevelingen en uitlegbaarheidsanalyse. Het framework genereert diabetesvoorspellingen, gepersonaliseerde medicatieaanbevelingen en interpreteerbare modeloutputs. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2: Pijplijn voor multimodal datasetacquisitie en preprocessing. Schematische workflow voor het verkrijgen en voorbewerken van de multimodale datasets die in FedMediFormer-XAI worden gebruikt. Klinische gegevens en gegevens over de volksgezondheid, CGM-registraties, retinabeelden en farmacologische informatie ondergaan modaliteitspecifieke kwaliteitscontrole, preprocessing, normalisatie, codering en augmentatie voordat ze worden omgezet in model-klare representaties voor downstream analyse. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3: Workflow voor data-augmentatie op basis van diffusie. Schematische workflow voor diffusie-gebaseerde augmentatie van gestructureerde tabulaire trainingsgegevens met behulp van TabDDPM. Gegenereerde samples ondergaan kwaliteits- en distributie-similariteitsbeoordelingen voordat ze worden geïntegreerd met de oorspronkelijke trainingsgegevens om de klassebalans te verbeteren. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4: Architectuur van het voorgestelde multimodale transformer-framework. Schematische architectuur bestaande uit (A) een TabTransformer-encoder voor klinische gegevens, (B) een temporele transformer-encoder voor CGM-gegevens en (C) een Vision Transformer-encoder voor retina-afbeeldingen. (D) Modaliteitsspecifieke representaties worden geïntegreerd via cross-modale aandacht om een uniforme multimodale representatie te genereren. (E) Taakspecifieke predictiekoppen genereren modeloutputs. (F) Regularisatie- en optimalisatiecomponenten ondersteunen de modeltraining, en (G) classificatie-, regressie- en cross-modale consistentieverliezen sturen het optimalisatieproces. De resulterende multimodale representatie ondersteunt downstream-taken voor predictie, aanbeveling en uitlegbaarheid. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5: Communicatiekader voor gefedereerd leren. Schematische workflow voor gefedereerde training over gedistribueerde ziekenhuisklets. Lokale multimodale modellen worden getraind met cliëntspecifieke gegevens, en beveiligde modelupdates worden verzonden naar een centrale server voor Federated Averaging. Het geaggregeerde globale model wordt opnieuw verdeeld over de cliënten voor opeenvolgende communicatierondes. Het kader illustreert tevens de beveiligde uitwisseling van parameters en de evaluatie van privacy-, communicatie- en computationele vereisten. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 6: Workflow voor gepersonaliseerde geneesmiddelenaanbeveling op basis van grafen. Schematische workflow voor gepersonaliseerde geneesmiddelenaanbeveling op basis van GraphSAGE. Farmacologische gegevens en patiëntrepresentaties zijn georganiseerd in een heterogene graaf die relevante zorgentiteiten en relaties bevat. GraphSAGE leert patiënt- en geneesmiddelenrepresentaties, die worden gebruikt om geschiktheidsscores voor patiënt-geneesmiddelen te berekenen en kandidaatmedicatie te rangschikken. Gecontra-indiceerde of onveilige combinaties van geneesmiddelen worden gefilterd vóór de generatie van de uiteindelijke Top-K aanbevelingen, waarbij informatie op basis van grafen de interpretatie van de aanbevelingen ondersteunt. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7: Framework voor de beoordeling van uitlegbaarheid. Schematisch overzicht van de workflow voor uitlegbaarheid. (A) SHAP-analyse evalueert globale en lokale feature-bijdragen; (B) Integrated Gradients biedt attributie-gebaseerde verklaringen; (C) aandachtsvisualisatie identificeert invloedrijke features en modaliteitsinteracties; en (D) counterfactual analyse identificeert feature-wijzigingen die geassocieerd zijn met gewijzigde voorspellingen. De resulterende uitleg-outputs ondersteunen de interpretatie van modelvoorspellingen en gepersonaliseerde aanbevelingen. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 8: Representatieve model-afgeleide SHAP-kenmerkbelangingsanalyse gegenereerd door het getrainde FedMediFormer-XAI-model. De SHAP-samenvattingsplot toont de distributie van SHAP-waarden over de geëvalueerde monsters, waarbij kenmerken zijn gerangschikt op basis van hun gemiddelde absolute SHAP-bijdrage. Positieve SHAP-waarden duiden op bijdragen aan een hoger voorspeld risico op diabetes, terwijl negatieve waarden duiden op bijdragen aan een lager voorspeld risico. Kleur representeert de bijbehorende kenmerkwaarde, waarbij hogere kenmerkwaarden in rood en lagere waarden in blauw worden weergegeven. De plot representeert een werkelijke model-afgeleide output van de uitlegbaarheid in plaats van een schematische illustratie. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 9: Representatieve attention-outputs gegenereerd door het getrainde FedMediFormer-XAI-model voor één willekeurig geselecteerd testsample. (A) Klinische kenmerk-attention verkregen uit een attention-head van de multimodale transformer, met de relatieve attention-gewichten die aan klinische kenmerken zijn toegewezen. (B) Temporele attention over de CGM-sequentie, waarbij de tijdsperioden met een hogere model-attention worden geïllustreerd. (C) Ruimtelijke attention voor de retinafundusafbeelding, inclusief de originele afbeelding, de attention-heatmap en de attention-overlay. (D) Cross-modale attention tussen klinische, CGM- en retina-modaliteitstokens, met de intra-modale en cross-modale informatie-weging. De getoonde visualisaties zijn model-afgeleide outputs gegenereerd door het getrainde model. De attention-gewichten worden getoond voor het geselecteerde testsample en dienen te worden geïnterpreteerd als model-attention-patronen en niet als onafhankelijke maten van klinische causaliteit. Klik hier om een grotere versie van deze figuur te bekijken.
| Dataset | Gegevenstype | Monsters/Verslagen | Kenmerken/Inhoud | Doel | Openbare beschikbaarheid |
| Dataset van diabetes bij Pima-indianen | Klinische tabel | 768 patiënten | 8 klinische variabelen | Voorspelling van diabetesrisico | Openbaar |
| CDC-gezondheidsindicatoren voor diabetes | Bevolkingsgezondheid | 253.680 records | Demografie, levensstijl, gezondheidsindicatoren | Populatierisicoanalyse | Openbaar |
| OhioT1DM-dataset | CGM-tijdreeksen | 12 proefpersonen | Glucose, insuline, maaltijden, lichaamsbeweging, slaap | Temporele diabetesmodellering | Openbaar |
| APTOS 2019 Blindheidsdetectie | Retinale beelden | 3.662 afbeeldingen | Fundusfoto's met ernstlabels | Analyse van diabetische retinopathie | Openbaar |
| Dataset met geneesmiddelbeoordelingen | Farmacologisch | 215.063 beoordelingen | Medicijnwerkzaamheid, beoordelingen, recensies | Medicijnadvies | Openbaar |
| DrugBank Open Data | Kennisgraaf voor geneesmiddelen | Duizenden geneesmiddelen | Geneesmiddel-geneesmiddelinteracties, targets, pathways | Graafconstructie | Publieke/Academische Toegang |
Tabel 1: Kenmerken van de dataset. Overzicht van de in deze studie gebruikte openbaar beschikbare datasets, inclusief type dataset, steekproefomvang, datamodaliteit, kenmerkinhoud, beoogde doel en beschikbaarheid.
| Dataset | Modaliteit | Voorspellingsdoel | Fusieniveau |
| Diabetes bij Pima-indianen | Klinisch | Diabetesclassificatie | Kenmerk-embedding |
| CDC Diabetesgezondheidsindicatoren | Bevolkingsgezondheid | Risicovoorspelling voor diabetes | Feature-embedding |
| OhioT1DM | Continue glucosemonitoring | Voorspelling van glucosetrends | Kenmerk-embedding |
| APTOS 2019 | Retinale fundusbeelden | Analyse van diabetische retinopathie | Feature-embedding |
| Medicijnbeoordeling + DrugBank | Farmacologisch | Medicijnaanbeveling | Grafeinbedding |
Tabel 2: Strategie voor integratie van multimodale datasets. Samenvatting van de datasets die zijn gebruikt voor multimodale diabetesintelligentie, inclusief de datamodaliteit, het voorspellingsdoel en het niveau waarop modaliteitspecifieke representaties worden geïntegreerd. Klinische gegevens, gegevens over de volksgezondheid, continue glucosemonitoring en retina-afbeeldingen worden weergegeven als feature-embeddings, terwijl farmacologische informatie wordt geïntegreerd via graph-embeddings voor gepersonaliseerde medicamenteuze aanbevelingen.
| Model | Nauwkeurigheid, Gemiddelde ± SD (95% BI) | Precisie, Gemiddelde ± SD (95% BI) | Recall, Gemiddelde ± SD (95% BI) | F1-score, Gemiddelde ± SD (95% BI) | MCC, Gemiddelde ± SD (95% BI) | AUC-ROC, Gemiddelde ± SD (95% BI) |
| Random Forest | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.44) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.99) | 0.67 ± 0.03 (0.63–0.71) | 0.88 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.44) | 83.80 ± 0.56 (83.11–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.66–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–88.15) | 87.00 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| Vision Transformer | 88.80 ± 0.50 (88.18–89.42) | 88.20 ± 0.60 (87.46–88.94) | 87.60 ± 0.56 (86.91–88.29) | 87.90 ± 0.56 (87.21–88.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| Temporal Transformer | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| CNN-LSTM | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.77) | 0.91 ± 0.01 (0.90–0.92) |
| Gecentraliseerde Multimodale Transformer | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.44) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.88 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
Tabel 3: Prestaties van de diabetesvoorspelling. Vergelijkende voorspellende prestaties van FedMediFormer-XAI en baseline machine learning- en deep learning-modellen met behulp van nauwkeurigheid, precisie, recall, F1-score, MCC en AUC-ROC metrieken.
| Metriek | Gecentraliseerd leren | Federated Learning |
| Nauwkeurigheid (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| Privacybehoud | Nee | Ja |
| Delen van ruwe data vereist | Ja | Nee |
| Communicatierondes | Het is geen tekst beschikbaar om te vertalen. Voer a.u.b. de brontekst in. | 100 |
| Trainingstijd (uren) | 4.8 | 5.6 |
| Naleving van regelgeving | Matig | Hoog |
Tabel 4: Prestaties van gefedereerd versus gecentraliseerd leren. Vergelijking van gecentraliseerde en gefedereerde leerimplementaties met betrekking tot voorspellende prestaties, vereisten voor het delen van ruwe gegevens, communicatierondes en trainingstijd.
| Dataset | Nauwkeurigheid (%) | Precisie (%) | Recall (%) | AUC-ROC |
| Dataset van diabetes bij Pima-indianen | 91.8 | 90.5 | 89.8 | 0.93 |
| CDC-gezondheidsindicatoren voor diabetes | 93.1 | 92.2 | 91.6 | 0.95 |
| OhioT1DM-dataset | 92.4 | 91.8 | 91.1 | 0.94 |
| APTOS 2019 Detectie van Blindheid | 94.7 | 93.9 | 93.5 | 0.96 |
| Multimodale fusie (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Tabel 5: Resultaten op datasetniveau. Prestatieanalyse over individuele datasets en multimodal fusion-instellingen. De resultaten illustreren de bijdrage van verschillende datamodaliteiten aan de algehele voorspellende prestaties.
| Metriek | Waarde |
| Precision@5 | 0.89 |
| Recall@5 | 0.84 |
| NDCG@5 | 0.91 |
| Nauwkeurigheid van detectie van geneesmiddelinteracties | 0.95 |
| Dekking van aanbevelingen | 0.88 |
| Gemiddelde wederkerige rang (MRR) | 0.86 |
| Score voor naleving van veiligheid | 0.94 |
Tabel 6: Prestaties van gepersonaliseerde medicijnrecommendaties. Evaluatie van grafiekgebaseerde gepersonaliseerde medicijnrecommendaties met behulp van rangschikkingsstatistieken, nauwkeurigheid van interactiedetectie, dekkingsgraad van recommendaties en beoordeling van medicatieveiligheid.
| Evaluatiecriterium | Voorgesteld evaluatieontwerp |
| Vertrouwen van de clinicus | Beoordeling via een vijfpunts Likert-schaal |
| Interpreteerbaarheid | Beoordeling met een vijfpuntsschaal van Likert |
| Klinische relevantie | Beoordeling via een vijfpunts Likert-schaal |
| Nut van de toelichting | Beoordeling op een vijfpunts Likert-schaal |
| Waargenomen nut | Beoordeling via een vijfpunts-Likert-schaal |
| Interbeoordelaarsbetrouwbaarheid | Fleiss' kappa, te berekenen na prospectieve evaluatie |
| Statistische vergelijking | Gepaarde statistische toets, naar gelang de verzamelde gegevens |
| Deelnemers | 12 clinici, onder voorbehoud van ethische goedkeuring en geïnformeerde toestemming |
| Evaluatiestatus | Prospectieve/toekomstige evaluatie |
Tabel 7: Voorgestelde mensgerichte evaluatiecriteria. Voorgesteld prospectief kader voor evaluatie door clinici om het nut, de klinische relevantie, de interpreteerbaarheid, de betrouwbaarheid en de bruikbaarheid van FedMediFormer-XAI-uitleg te beoordelen. De evaluatie omvat een gestandaardiseerde beoordeling via een vijfpunts Likert-schaal, interbeoordelaarsbetrouwbaarheid met behulp van de kappa van Fleiss, statistische vergelijking tussen condities met alleen voorspellingen en condities met voorspellingen plus uitleg, en 95% betrouwbaarheidsintervallen. De evaluatie door de clinicus mag pas worden uitgevoerd na goedkeuring van de betreffende institutionele ethische commissie en na verkrijgen van geïnformeerde toestemming.
Aanvullende Tabel 1: Strategie voor datasetvalidatie. Datasetpartitionering, validatieprocedures, strategieën voor klassebalans en kwaliteitscontrollemaatregelen werden geïmplementeerd om reproduceerbaarheid en een betrouwbare modelevaluatie te waarborgen. Klik hier om dit bestand te downloaden.
Aanvullende tabel 2: Parameters van het diffusiemodel. Configuratie-instellingen voor het TabDDPM-diffusiemodel, inclusief trainingsparameters, optimalisatie-instellingen, latente dimensies, strategie voor ruisschema's en specificaties voor de generatie van synthetische monsters. Klik hier om dit bestand te downloaden.
Aanvullende tabel 3: Configuratie van de multimodale transformer. Configuratie van de architectuur van de multimodale transformer, inclusief de klinische, temporele en beeldencoders, embedding- en fusiedimensies, attention heads, optimizer, leerpercentage, batchgrootte, trainings-epochs, early-stopping-criterium en de gecombineerde trainingsverliesfunctie. Klik hier om dit bestand te downloaden.
Aanvullende Tabel 4: Configuratie van federatief leren. Parameters gebruikt voor privacybewuste federatieve training, inclusief het aantal deelnemende ziekenhuizen, communicatierondes, lokale trainingsepochen, cliëntparticipatiegraad, aggregatiealgoritme, optimizer, leerpercentage, encryptiemethode, communicatieprotocol en het beleid voor het delen van ruwe gegevens. Klik hier om dit bestand te downloaden.
Aanvullende Tabel 5: GraphSAGE-configuratie. Configuratie van de heterogene, op GraphSAGE gebaseerde gepersonaliseerde medicijnaanbevelingsmodule, inclusief graaftype, verborgen en embedding-dimensies, aantal graaflagen, buurtbemonsteringsgrootte, optimizer, leerpercentage, batchgrootte, trainings-epochs, Bayesian Personalized Ranking-verlies en het aantal topmedicijnaanbevelingen. Klik hier om dit bestand te downloaden.
Aanvullende tabel 6: Meetwaarden voor de evaluatie van uitlegbaarheid. Kwantitatieve en mensgerichte meetwaarden die worden gebruikt om de uitlegbaarheid van het FedMediFormer-XAI-framework te evalueren. De meetwaarden beoordelen de getrouwheid, stabiliteit, consistentie, spaarsheid, volledigheid, gevoeligheid en infidelity van de uitleg, evenals de overeenstemming tussen beoordelaars en de door clinici waargenomen kwaliteit van de uitleg. Klik hier om dit bestand te downloaden.
Aanvullende tabel 7: Evaluatiemetrieken. Predictieve metrieken, metrieken voor federatief leren, aanbevelingsmetrieken en uitlegbaarheidsmetrieken worden gebruikt om de prestaties, robuustheid, rangschimmingskwaliteit en interpreteerbaarheid van het framework te evalueren. Klik hier om dit bestand te downloaden.
Aanvullende Tabel 8: Mensgerichte evaluatieopzet. Opzet van de op clinici gerichte evaluatiestudie, inclusief participantengroepen, evaluatiecondities, beoordelingscriteria en statistische analyseprocedures. Klik hier om dit bestand te downloaden.
Aanvullende tabel 9: Middelen voor reproduceerbaarheid. Overzicht van de datasets, implementatiespecificaties, configuratiebestanden, evaluatieprocedures, documentatie en experimentele verslagen die nodig zijn om de reproduceerbaarheid van het voorgestelde FedMediFormer-XAI-framework te ondersteunen. Klik hier om dit bestand te downloaden.