Analyse van de predictieve prestaties
FedMediFormer-XAI vertoonde verbeterde predictieve prestaties in vergelijking met de geëvalueerde unimodale en conventionele baselinemodellen. Augmentatie op basis van diffusie verbeterde de representatie van de minderheidsklasse, en de resulterende predictieve prestaties zijn samengevat in Tabel 3. De evaluatie via herhaalde runs toonde stabiele predictieve prestaties aan over de geëvalueerde modellen. FedMediFormer-XAI behaalde de hoogste algehele prestaties, met een nauwkeurigheid van 94.20 ± 0.34% (95% BI: 93.78–94.62), precisie van 93.10 ± 0.30% (95% BI: 92.73–93.47), recall van 92.80 ± 0.28% (95% BI: 92.45–93.15) en een F1-score van 92.90 ± 0.28% (95% BI: 92.5–93.25). Het model behaalde een MCC van 0.8 ± 0.02 (95% BI: 0.86–0.90) en een AUC-ROC van 0.96 ± 0.01 (95% BI: 0.95–0.97). De gecentraliseerde multimodale transformer leverde de op één na beste algehele prestaties, terwijl de unimodale en conventionele machine-learningmodellen een relatief lagere predictieve prestatie vertoonden. Deze resultaten geven aan dat multimodale representatieleersystemen, gecombineerd met federatieve optimalisatie, leiden tot verbeterde en stabielere prestaties bij de classificatie van diabetes.
Ablatiestudie
Componentgewijze ablatie werd gebruikt om de bijdrage van diffusie-augmentatie, federated learning, GraphSAGE-gebaseerde medicijnaanbeveling en multimodale fusie te beoordelen. Het volledige FedMediFormer-XAI-framework behaalde een nauwkeurigheid van 94,20 ± 0,34%, een precisie van 93,10 ± 0,30%, een recall van 92,80 ± 0,28%, een F1-score van 92,90 ± 0,28%, een MCC van 0,8 ± 0,02 en een AUC-ROC van 0,96 ± 0,01 over vijf onafhankelijke runs. Het verwijderen van diffusie-augmentatie verminderde de nauwkeurigheid tot 91,80 ± 0,42%, wat overeenkomt met een daling van 2,40 procentpunt, terwijl de F1-score en AUC-ROC respectievelijk afnamen tot 90,30 ± 0,38% en 0,94 ± 0,01. Deze afname duidt op de bijdrage van diffusie-gebaseerde augmentatie aan de representatie van minderheidsklassen en de predictieve robuustheid.
Het weglaten van federated learning resulteerde in een nauwkeurigheid van 93,10 ± 0,37%, wat een afname van 1,10 procentpunt vertegenwoordigt ten opzichte van het volledige raamwerk. De precisie, recall, F1-score, MCC en AUC-ROC waren eveneens gedaald tot respectievelijk 92,20 ± 0,34%, 91,80 ± 0,32%, 92,0 ± 0,3%, 0,86 ± 0,02 en 0,95 ± 0,01. Deze vergelijking demonstreert de bijdrage van de gefedereerde configuratie aan de voorspellende prestaties.
Het verwijderen van het op GraphSAGE gebaseerde component voor gepersonaliseerde medicijnrecommendatie resulteerde in een relatief kleine verandering in de prestaties van de diabetesvoorspelling, waarbij de nauwkeurigheid afnam tot 93.80 ± 0.35% en de F1-score tot 92.60 ± 0.30%. De overeenkomstige MCC en AUC-ROC waren respectievelijk 0.87 ± 0.02 en 0.96 ± 0.01. Dit resultaat geeft aan dat GraphSAGE primair bijdraagt aan de gepersonaliseerde medicijnrecommendatie en niet direct de prestaties van de diabetesclassificatie bepaalt.
De grootste afname werd waargenomen toen de multimodale fusie werd verwijderd. De nauwkeurigheid daalde naar 87.60 ± 0.5%, wat een afname van 6,60 procentpunt vertegenwoordigt, terwijl precisie, recall, F1-score, MCC en AUC-ROC respectievelijk daalden naar 86.80 ± 0.51%, 85.90 ± 0.54%, 86.30 ± 0.52%, 0.76 ± 0.03 en 0.91 ± 0.01. Dit resultaat demonstreert het belang van het gezamenlijk modelleren van complementaire informatie uit klinische, CGM- en retina-modaliteiten.
Federated learning-analyse
Het federated learning-raamwerk maakte collaboratieve modeltraining over gedistribueerde cliënten mogelijk, terwijl de gedecentraliseerde verwerking van ruwe patiëntgegevens behouden bleef. Tijdens de training werd het lokale model van elke cliënt individueel gefinetuned en gecombineerd via de Federated Averaging-methode. Na 10 communicatierondes convergeerde het globale model, en de voorspellende prestaties bleven consistent met gecentraliseerd leren. Het federated learning-raamwerk vertoonde een stabiele convergentie over de communicatierondes heen, ondanks heterogene datadistributies tussen de cliënten. De uitwisseling van beveiligde parameters waarborgde de gedecentraliseerde gegevensverwerking, terwijl het globale model een concurrerende voorspellende prestatie behield ten opzichte van de gecentraliseerde baseline. Tabel 4 vergelijkt de gecentraliseerde en gefedereerde implementaties. Federated learning vereiste extra trainingstijd vanwege de communicatie-overhead, terwijl de voorspellende prestaties vergelijkbaar bleven met gecentraliseerd leren.
Prestatieanalyse op datasetniveau
Om de generaliseerbaarheid over verschillende gezondheidszorgmodaliteiten te evalueren, hebben we de prestaties voor elke dataset afzonderlijk beoordeeld. Het multimodale FedMediFormer-XAI-model vertoonde sterke en over het algemeen concurrerende prestaties over de geëvalueerde datasets. Het behaalde een nauwkeurigheid van 91,8%, 93,1%, 92,4% en 94,2% op respectievelijk de Pima Indians Diabetes-, CDC Diabetes Health Indicators-, OhioT1DM- en APTOS 2019-datasets. Hoewel de APTOS 2019-dataset een iets hogere nauwkeurigheid (94,7%) en precisie (93,9%) behaalde dan het multimodale model, behield de voorgestelde multimodale benadering concurrerende prestaties over alle datasets en behaalde een AUC-ROC van 0,96, wat vergelijkbaar is met de hoogste AUC-ROC op datasetniveau. De algemene resultaten op datasetniveau worden gepresenteerd in Tabel 5. Voor enkelvoudige datasets behaalde de analyse van retina-afbeeldingen de beste prestaties wanneer deze alleen werd gebruikt, terwijl multimodale fusie de meest stabiele en goed gebalanceerde voorspellingen opleverde.
Analyse van gepersonaliseerde medicatieaanbevelingen
De op graph neural networks gebaseerde aanbevelingscomponent werd geëvalueerd met behulp van informatie over medicatie-effectiviteit en gegevens over geneesmiddelinteracties, waarbij kandidaat-medicatie werd gerangschikt op basis van geleerde scores voor de geschiktheid van de patiënt voor het medicijn en contra-indicaties werden uitgesloten tijdens het genereren van de aanbevelingen. Het gebruik van het heterogene graph-formaat en de modellering van patiënt-medicijn- en medicijn-medicijninteracties konden grondig worden uitgevoerd, waardoor gepersonaliseerde medicatiekeuzes en veiligheidsbeoordelingen werden ondersteund. Het GraphSAGE-aanbevelingsmodel legde effectief de complexe relaties tussen patiënten, ziekten, laboratoriumbevindingen en medicatie vast. Gepersonaliseerde aanbevelingen vertoonden een hoge ranking-prestatie, terwijl klinisch betekenisvolle verklaringen behouden bleven door middel van graph-buurtanalyse en feature-attributie.
Volgens Tabel 6 werd de module voor gepersonaliseerde medicijnaanbevelingen geëvalueerd met behulp van Precision@5, Recall@5 en NDCG@5. Deze metrieken kwantificeren de relevantie en de kwaliteit van de rangschikking van de vijf beste gepersonaliseerde medicatieaanbevelingen die zijn gegenereerd door de op GraphSAGE gebaseerde aanbevelingsmodule. Het aanbevelingssysteem behaalde sterke prestaties in de rangschikking, met een precision = 0.89, recall = 0.84 en NDCG = 0.91.
Uitlegbaarheidsanalyse
Het raamwerk bevat SHAP, Integrated Gradients, attention-visualisatie en contrafeitelijke verklaringen om de interpretatie van multimodale voorspellingen te ondersteunen. SHAP werd gebruikt om bijdragen op kenmerkniveau te kwantificeren, Integrated Gradients om voorspellingen toe te schrijven aan inputkenmerken, attention-visualisatie om de focus van het model over de modaliteiten te onderzoeken, en contrafeitelijke verklaringen om wijzigingen in kenmerken te identificeren die geassocieerd zijn met alternatieve voorspellingen. Figuur 8 toont een representatieve, door het model afgeleide SHAP-samenvattingsplot gegenereerd vanuit het getrainde FedMediFormer-XAI-model, terwijl Figuur 9 representatieve attention-visualisaties toont die zijn geëxtraheerd uit de getrainde transformer. Deze figuren vertegenwoordigen resultaten verkregen uit de modelevaluatie en zijn geen schematische illustraties van de voorgestelde architectuur.
In Figuur 8 worden de rangschikkingen van het belang van kenmerken op aggregaatniveau gepresenteerd. Kenmerken met hogere absolute SHAP-waarden hadden een grotere invloed op de modelvoorspellingen en stemden bovendien goed overeen met bestaande klinische kennis.
Figuur 9 presenteert representatieve attentie-visualisaties die direct zijn geëxtraheerd uit het getrainde FedMediFormer-XAI-model voor een willekeurig geselecteerd testmonster uit de hold-out set. De visualisaties omvatten attentie voor klinische kenmerken, temporele CGM-attentie, ruimtelijke retina-attentie en cross-modale attentie tussen de drie modaliteiten. De attentie-visualisatie demonstreerde verder de door het model geleerde allocatie van attentie over meerdere modaliteiten. Het geselecteerde monster vertoonde een relatief sterkere attentie voor HbA1c, diabetesduur en leeftijd binnen de klinische kenmerken, terwijl de CGM-attentiekaart verschillende perioden met prominente glucosevariabiliteit markeerde. De retina-attentiekaart identificeerde specifieke beeldregio's die bijdroegen aan de modelrepresentatie, en de cross-modale attentiematrix demonstreerde zowel intra-modale als cross-modale attentiepatronen. Zoals getoond in Figuur 9, markeren de representatieve, uit het model afgeleide attentiekaarten geselecteerde temporele glucosepatronen, invloedrijke klinische variabelen en diagnostisch relevante retina-beeldregio's in een testmonster uit de hold-out set.
Resultaten van de mensgerichte evaluatie
Er is een prospectief mensgericht evaluatieprotocol ontworpen om het vertrouwen van clinici, de interpreteerbaarheid, de bruikbaarheid, het klinisch nut en de relevantie van de uitleg te beoordelen onder condities van enkel voorspelling en voorspelling-plus-uitleg. De voorgestelde evaluatie zal endocrinologen, diabetesspecialisten en klinisch farmacologen betrekken, met de nodige goedkeuring van de Institutionele Ethische Commissie en geïnformeerde toestemming. Aangezien deze evaluatie bedoeld is voor toekomstige prospectieve implementatie, worden de uitkomstscores op clinici-niveau niet gerapporteerd in het huidige protocol.
Tabel 7 vat het voorgestelde prospectieve ontwerp voor de evaluatie door clinici samen en de vooraf gedefinieerde criteria voor het beoordelen van de effecten van uitleg op het vertrouwen van de clinicus, de interpreteerbaarheid en het waargenomen nut. De prospectieve evaluatie zal de beoordelingen van clinici van modelvoorspellingen met en zonder bijbehorende uitleg vergelijken aan de hand van vooraf gedefinieerde Likert-schaalcriteria. Het voorgestelde prospectieve, mensgerichte raamwerk voor de evaluatie van uitlegbaarheid wordt gepresenteerd in Figuur 10

Figuur 1Algemene architectuur van het FedMediFormer-XAI-framework. Schematisch overzicht van het FedMediFormer-XAI-framework, met weergave van multimodale data-acquisitie en preprocessing, diffusiegebaseerde augmentatie, modaliteitspecifiek transformer-leren, gefedereerde modeltraining, GraphSAGE-gebaseerde gepersonaliseerde medicijnrecommendatie en uitlegbaarheidsanalyse. Het framework genereert diabetesvoorspellingen, gepersonaliseerde medicatieaanbevelingen en interpreteerbare modeloutputs. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2Multimodale datasetverwerving en preprocessing-pijplijn. Schematische workflow voor de acquisitie en preprocessing van de multimodale datasets die in FedMediFormer-XAI worden gebruikt. Klinische gegevens en populatiegezondheidsgegevens, CGM-registraties, retina-afbeeldingen en farmacologische informatie ondergaan modaliteitsspecifieke kwaliteitscontrole, preprocessing, normalisatie, codering en augmentatie voordat ze worden omgezet in model-klare representaties voor downstream-analyse. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3: Workflow voor data-augmentatie op basis van diffusie. Schematische workflow voor diffusie-gebaseerde augmentatie van gestructureerde tabulaire trainingsgegevens met behulp van TabDDPM. Gegenereerde monsters ondergaan beoordelingen van kwaliteit en distributiesimilariteit voordat ze worden geïntegreerd met de oorspronkelijke trainingsgegevens om de klassenbalans te verbeteren. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4Architectuur van het voorgestelde multimodale transformer-raamwerk. Schematische architectuur bestaande uit (A) een TabTransformer-encoder voor klinische gegevens, (B) een temporele transformer-encoder voor CGM-gegevens, en (C) een Vision Transformer-encoder voor retinabeelden. (D) Modaliteitsspecifieke representaties worden geïntegreerd via cross-modale aandacht om een uniforme multimodale representatie te genereren. (E) Taakspecifieke predictiekoppen genereren modeloutputs. (F) Regularisatie- en optimalisatiecomponenten ondersteunen de modeltraining, en (G) classificatie-, regressie- en cross-modale consistentieverliezen sturen het optimalisatieproces aan. De resulterende multimodale representatie ondersteunt downstream-taken voor predictie, aanbeveling en uitlegbaarheid. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5Communicatiekader voor federated learning. Schematische workflow voor gefedereerde training over gedistribueerde ziekenhuisclients. Lokale multimodale modellen worden getraind met cliëntspecifieke gegevens, en beschermde modelupdates worden verzonden naar een centrale server voor Federated Averaging. Het geaggregeerde globale model wordt herverdeeld over de clients voor opeenvolgende communicatierondes. Het framework illustreert tevens de beveiligde uitwisseling van parameters en de evaluatie van privacy-, communicatie- en computationele vereisten. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 6Graafgebaseerde workflow voor gepersonaliseerde geneesmiddelenaanbeveling. Schematische workflow voor gepersonaliseerde medicijnrecommendatie op basis van GraphSAGE. Farmacologische gegevens en patiëntrepresentatiegegevens worden georganiseerd in een heterogene graaf die relevante gezondheidszorgentiteiten en relaties bevat. GraphSAGE leert representaties van patiënten en medicijnen, die worden gebruikt om geschiktheidsscores voor patiënt-medicijncombinaties te berekenen en kandidaatmedicatie te rangschikken. Gecontra-indiceerde of onveilige medicijncombinaties worden gefilterd vóór de generatie van de uiteindelijke Top-K-aanbevelingen, waarbij graafgebaseerde informatie de interpretatie van de aanbevelingen ondersteunt. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7Raamwerk voor de beoordeling van uitlegbaarheid. Schematisch overzicht van de workflow voor uitlegbaarheid. (A) SHAP-analyse evalueert globale en lokale kenmerkbijdragen; (B) Integrated Gradients biedt attributiegebaseerde verklaringen; (C) aandachtsvisualisatie identificeert invloedrijke kenmerken en modaliteitsinteracties; en (D) Counterfactual analyse identificeert kenmerkswijzigingen die geassocieerd zijn met gewijzigde voorspellingen. De resulterende uitlegoutputs ondersteunen de interpretatie van modelvoorspellingen en gepersonaliseerde aanbevelingen. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 8Representatieve model-afgeleide SHAP-feature-importance-analyse gegenereerd door het getrainde FedMediFormer-XAI-modelDe SHAP-samenvattingsplot toont de distributie van SHAP-waarden over de geëvalueerde monsters, waarbij kenmerken zijn gerangschikt op basis van hun gemiddelde absolute SHAP-bijdrage. Positieve SHAP-waarden duiden op bijdragen aan een hoger voorspeld risico op diabetes, terwijl negatieve waarden duiden op bijdragen aan een lager voorspeld risico. De kleur representeert de corresponderende kenmerkwaarde, waarbij hogere kenmerkwaarden in rood en lagere waarden in blauw worden weergegeven. De plot representeert een daadwerkelijke, uit het model afgeleide output voor uitlegbaarheid en is geen schematische illustratie. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 9Representatieve attention-outputs gegenereerd door het getrainde FedMediFormer-XAI-model voor één willekeurig geselecteerd, buiten het trainingsproces gehouden testsample. (A) Aandacht voor klinische kenmerken verkregen uit een attention head van de multimodale transformer, waarin de relatieve aandachtsgewichten worden weergegeven die aan de klinische kenmerken zijn toegewezen. (B) Temporele aandacht over de CGM-sequentie, waarbij de tijdsperioden met een hogere modelaandacht worden geïllustreerd. (C) Ruimtelijke aandacht voor de afbeelding van het retina-fundus, inclusief de oorspronkelijke afbeelding, de attention heatmap en de attention overlay. (D) Crossmodale aandacht tussen klinische, CGM- en retina-modaliteitstokens, met weergave van intra-modale en crossmodale informatieweging. De getoonde visualisaties zijn modelafgeleide outputs die zijn gegenereerd door het getrainde model. De attentiegewichten worden getoond voor het geselecteerde testmonster en dienen te worden geïnterpreteerd als model-attentiepatronen en niet als onafhankelijke maten voor klinische causaliteit. Klik hier om een grotere versie van deze figuur te bekijken.
| Dataset | Gegevenstype | Monsters/Registers | Kenmerken/Inhoud | Doel | Openbare beschikbaarheid |
| Pima-indianen diabetesdataset | Klinische tabel | 768 patiënten | 8 klinische variabelen | Voorspelling van het risico op diabetes | Openbaar |
| CDC-gezondheidsindicatoren voor diabetes | Bevolkingsgezondheid | 253.680 records | Demografie, levensstijl, gezondheidsindicatoren | Populatierisicoanalyse | Openbaar |
| OhioT1DM-dataset | CGM-tijdreeksen | 12 proefpersonen | Glucose, insuline, maaltijden, lichaamsbeweging, slaap | Temporele diabetesmodellering | Openbaar |
| APTOS 2019 Detectie van Blindheid | Retinale beelden | 3.62 afbeeldingen | Fundusfoto's met ernstlabels | Analyse van diabetische retinopathie | Openbaar |
| Dataset met geneesmiddelenbeoordelingen | Farmacologisch | 215.063 beoordelingen | Effectiviteit van geneesmiddelen, beoordelingen, recensies | Medicijnadvies | Openbaar |
| DrugBank Open Data | Kennisgraaf van geneesmiddelen | Duizenden geneesmiddelen | Interacties tussen geneesmiddelen, targets, signaalpaden | Grafiekconstructie | Openbare/Academische Toegang |
Tabel 1: Kenmerken van de dataset. Overzicht van de in deze studie gebruikte publiek beschikbare datasets, inclusief datasettype, steekproefomvang, datamodaliteit, feature-inhoud, beoogde toepassing en beschikbaarheid.
| Dataset | Modaliteit | Voorspellingsdoel | Fusieniveau |
| Pima Indians Diabetes | Klinisch | Diabetesclassificatie | Feature embedding |
| CDC Diabetes Health Indicators | Bevolkingsgezondheid | Voorspelling van diabetesrisico | Feature embedding |
| OhioT1DM | Continue glucosemonitoring | Voorspelling van glucosetrend | Feature embedding |
| APTOS 2019 | Retinale fundusbeelden | Analyse van diabetische retinopathie | Feature embedding |
| Drug Review + DrugBank | Farmacologisch | Medicijnrecommendatie | Graph embedding |
Tabel 2: Integratiestrategie voor multimodale datasets. Overzicht van de datasets die zijn gebruikt voor multimodale diabetesintelligentie, inclusief de datamodaliteit, het voorspellingsdoel en het niveau waarop modaliteitsspecifieke representaties worden geïntegreerd. Klinische gegevens, populatiegezondheidsgegevens, gegevens van continue glucosemonitoring en retina-afbeeldingen worden weergegeven als feature-embeddings, terwijl farmacologische informatie wordt geïntegreerd via graph-embeddings voor gepersonaliseerde medicamenteuze aanbevelingen.
| Model | Nauwkeurigheid, Gemiddelde ± SD (95% BI) | Precisie, Gemiddelde ± SD (95% BI) | Recall, Gemiddelde ± SD (95% BI) | F1-score, Gemiddelde ± SD (95% BI) | MCC, Gemiddelde ± SD (95% BI) | AUC-ROC, Gemiddelde ± SD (95% BI) |
| Random Forest | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.4) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.9) | 0.67 ± 0.03 (0.63–0.71) | 0.8 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.4) | 83.80 ± 0.56 (83.1–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.6–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–8.15) | 87.0 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| Vision Transformer | 8.80 ± 0.50 (88.18–89.42) | 8.20 ± 0.60 (87.46–8.94) | 87.60 ± 0.56 (86.91–8.29) | 87.90 ± 0.56 (87.21–8.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| Temporal Transformer | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| CNN-LSTM | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.7) | 0.91 ± 0.01 (0.90–0.92) |
| Centralized Multimodal Transformer | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.4) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.8 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
Tabel 3: Prestaties van de diabetesvoorspelling. Vergelijkende voorspellende prestaties van FedMediFormer-XAI en baseline machine learning- en deep learning-modellen met gebruik van accuracy, precisie, recall, F1-score, MCC en AUC-ROC metrieken.
| Metriek | Gecentraliseerd leren | Gefedereerd leren |
| Nauwkeurigheid (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| Privacybehoud | Nee | Ja |
| Delen van ruwe data vereist | Ja | Nee |
| Communicatierondes | Het is geen tekst opgegeven om te vertalen. Voer a.u.b. de brontekst in. | 100 |
| Trainingstijd (uren) | 4.8 | 5.6 |
| Naleving van regelgeving | Gematigd | Hoog |
Tabel 4: Prestaties van gefedereerd versus gecentraliseerd leren. Vergelijking van gecentraliseerde en gefedereerde leerimplementaties met betrekking tot voorspellende prestaties, vereisten voor het delen van ruwe gegevens, communicatierondes en trainingstijd.
| Dataset | Nauwkeurigheid (%) | Precisie (%) | Recall (%) | AUC-ROC |
| Pima Indians Diabetes Dataset | 91.8 | 90.5 | 89.8 | 0.93 |
| CDC Diabetes Health Indicators | 93.1 | 92.2 | 91.6 | 0.95 |
| OhioT1DM Dataset | 92.4 | 91.8 | 91.1 | 0.94 |
| APTOS 2019 Blindness Detection | 94.7 | 93.9 | 93.5 | 0.96 |
| Multimodale Fusie (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Tabel 5: Resultaten op datasetniveau. Prestatieanalyse over individuele datasets en multimodale fusie-instellingen. De resultaten illustreren de bijdrage van verschillende datamodaliteiten aan de algehele voorspellende prestaties.
| Metriek | Waarde |
| Precisie@5 | 0.89 |
| Recall@5 | 0.84 |
| NDCG@5 | 0.91 |
| Nauwkeurigheid van de detectie van geneesmiddelinteracties | 0.95 |
| Dekking van aanbevelingen | 0.88 |
| Gemiddelde Wederkerige Rang (MRR) | 0.86 |
| Score voor naleving van de veiligheidsvoorschriften | 0.94 |
Tabel 6: Prestaties van gepersonaliseerde medicijnrecommendaties. Evaluatie van grafiekgebaseerde gepersonaliseerde medicijnrecommendaties met behulp van rankingsmetrieken, nauwkeurigheid van interactiedetectie, dekkingsgraad van recommendaties en beoordeling van medicatieveiligheid.
| Evaluatiecriterium | Voorgesteld evaluatieontwerp |
| Vertrouwen van de clinicus | Beoordeling met een vijfpunts Likert-schaal |
| Interpreteerbaarheid | Beoordeling via een vijfpunts Likert-schaal |
| Klinische relevantie | Beoordeling met een vijfpunts Likert-schaal |
| Nut van de uitleg | Beoordeling via een vijfpunts Likert-schaal |
| Waargenomen nut | Beoordeling via een vijfpunts Likert-schaal |
| Interbeoordelaarsbetrouwbaarheid | Fleiss' kappa, te berekenen na prospectieve evaluatie |
| Statistische vergelijking | Gepaarde statistische toets, naar gelang de dataverzameling |
| Deelnemers | 12 clinici, onder voorbehoud van ethische goedkeuring en geïnformeerde toestemming |
| Evaluatiestatus | Prospectieve/toekomstige evaluatie |
Tabel 7: Voorgestelde mensgerichte evaluatiecriteria. Voorgesteld prospectief, op de clinicus gericht evaluatiekader voor het beoordelen van het nut, de klinische relevantie, de interpreteerbaarheid, de betrouwbaarheid en de bruikbaarheid van FedMediFormer-XAI-uitleg. De evaluatie omvat een gestandaardiseerde beoordeling op een vijfpunts Likert-schaal, interbeoordelaarsbetrouwbaarheid met behulp van de kappa van Fleiss, statistische vergelijking tussen condities met alleen voorspellingen en condities met voorspellingen plus uitleg, en 95% betrouwbaarheidsintervallen. De evaluatie door de clinicus mag alleen worden uitgevoerd na goedkeuring van dedesbetreffende institutionele ethische commissie en na het verkrijgen van geïnformeerde toestemming.
Aanvullende tabel 1: Validatiestrategie van de datasetDatasetpartitionering, validatieprocedures, strategieën voor klassenbalancering en kwaliteitscontrolemaatregelen werden geïmplementeerd om reproduceerbaarheid en een betrouwbare modelevaluatie te waarborgen. Klik hier om dit bestand te downloaden.
Aanvullende tabel 2: Parameters van het diffusiemodelConfiguratie-instellingen voor het TabDDPM-diffusiemodel, inclusief trainingsparameters, optimalisatie-instellingen, latente dimensies, strategie voor noise scheduling en specificaties voor de generatie van synthetische monsters. Klik hier om dit bestand te downloaden.
Aanvullende tabel 3: Configuratie van de multimodale transformerConfiguratie van de multimodale transformer-architectuur, inclusief de klinische, temporele en beeldencoders, embedding- en fusiedimensies, attention heads, optimizer, leerpercentage, batchgrootte, trainings-epochs, early-stopping-criterium en de gecombineerde trainingsloss. Klik hier om dit bestand te downloaden.
Aanvullende tabel 4: Configuratie van gefedereerd leren. Parameters gebruikt voor privacybehoudende gefedereerde training, waaronder het aantal deelnemende ziekenhuizen, communicatierondes, lokale trainingsepocha's, cliëntparticipatiegraad, aggregatiealgoritme, optimizer, leerpercentage, encryptiemethode, communicatieprotocol en het beleid voor het delen van ruwe gegevens. Klik hier om dit bestand te downloaden.
Aanvullende tabel 5: GraphSAGE-configuratie. Configuratie van de heterogene GraphSAGE-gebaseerde module voor gepersonaliseerde medicijnaanbevelingen, inclusief graftype, verborgen en embedding-dimensies, aantal grafische lagen, buurtbemonsteringsgrootte, optimizer, leerpercentage, batchgrootte, trainingsepochs, Bayesian Personalized Ranking-verlies en het aantal topaanbevelingen voor medicatie. Klik hier om dit bestand te downloaden.
Aanvullende tabel 6: Evaluatiemetrieken voor uitlegbaarheid. Kwantitatieve en mensgerichte metrieken die worden gebruikt om de verklaarbaarheid van het FedMediFormer-XAI-framework te evalueren. De metrieken beoordelen de getrouwheid, stabiliteit, consistentie, sparsiteit, volledigheid, sensitiviteit en infideliteit van de uitleg, evenals de interbeoordelaarsbetrouwbaarheid en de door clinici waargenomen kwaliteit van de uitleg. Klik hier om dit bestand te downloaden.
Aanvullende tabel 7: EvaluatiemetriekenPredictieve metrieken, metrieken voor gefedereerd leren, aanbevelingsmetrieken en uitlegbaarheidsmetrieken worden gebruikt om de prestaties, robuustheid, rankingkwaliteit en interpreteerbaarheid van het framework te evalueren. Klik hier om dit bestand te downloaden.
Aanvullende tabel 8: Ontwerp van de mensgerichte evaluatieOntwerp van de op de clinicus gerichte evaluatiestudie, inclusief deelnemersgroepen, evaluatiecondities, beoordelingscriteria en statistische analyseprocedures. Klik hier om dit bestand te downloaden.
Aanvullende tabel 9: Asset voor reproduceerbaarheids. Overzicht van de datasets, implementatiespecificaties, configuratiebestanden, evaluatieprocedures, documentatie en experimentele verslagen die vereist zijn om de reproduceerbaarheid van het voorgestelde FedMediFormer-XAI-framework te ondersteunen. Klik hier om dit bestand te downloaden.