Het voorgestelde XAI-framework is geïmplementeerd met behulp van de Pima Indians Diabetes Dataset als representatieve dataset voor de gezondheidszorg. De Pima Indians Diabetes Dataset werd gebruikt als enige dataset voor experimentele validatie. Alle gerapporteerde resultaten met betrekking tot voorspellend vermogen, uitlegbaarheid, statistiek en reproduceerbaarheid zijn gegenereerd vanuit deze dataset. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM100, OhioT1DM en BraTS 2021 zijn niet experimenteel geëvalueerd en zijn enkel opgenomen als voorbeelden om de toepasbaarheid van het algemene protocol op verschillende modaliteiten van gezondheidszorggegevens te illustreren. De volledige dataset werd gebruikt nadat ongeldige en dubbele records waren verwijderd, en de gespecificeerde voorbewerkingoperaties werden uitgevoerd vóór de modelontwikkeling. De dataset werd verdeeld in onafhankelijke trainings-, validatie- en testsubsets met behulp van een vooraf gedefinieerde gestratificeerde splitsingsstrategie. De onafhankelijkheid van monsters over de drie subsets werd gehandhaafd om de mogelijkheid van datalekkage te minimaliseren.
Het predictieve model werd geconfigureerd met de vooraf gedefinieerde architectuur en hyperparameters. Het model werd getraind met de Adam-optimizer, waarbij de vooraf gedefinieerde leerfrequentie en batchgrootte werden gehanteerd voor maximaal 10 epochs. Er werd vroegstop toegepast op basis van het validatieverlies, en het model met de beste validatieprestaties werd behouden. Voor de partitionering van de dataset, de modelinitialisatie en herhaalde experimenten werden random seeds opgegeven om de reproduceerbaarheid te verbeteren.
Het getrainde model werd geëvalueerd op de onafhankelijke testset aan de hand van nauwkeurigheid, precisie, recall, specificiteit, F1-score, de Matthews-correlatiecoëfficiënt (MCC), het oppervlak onder de receiver operating characteristic-curve (AUC-ROC) en de gemiddelde precisie (AP). Het voorgestelde model werd vergeleken met de vooraf gedefinieerde basismodellen met gebruik van identieke preprocessing-procedures, datapartities en evaluatieprotocollen. Receiver operating characteristic (ROC)-curves, precisie-recall-curves en een confusiematrix werden gegenereerd op basis van de voorspellingen van de onafhankelijke testset.
Om de stabiliteit van de prestaties te beoordelen, werd een vijfvoudige kruisvalidatie uitgevoerd op de trainingsgegevens. Er werden 95% betrouwbaarheidsintervallen geschat voor de belangrijkste prestatiematrices, en er werden vooraf gedefinieerde statistische vergelijkingen uitgevoerd tussen het voorgestelde model en de basismodellen.
Vijfvoudige kruisvalidatie leverde een nauwkeurigheid op van 93,01 ± 0,48%, een AUC-ROC van 0,954 ± 0,07, een precisie van 92,42 ± 0,87%, een recall van 93,02 ± 0,45% en een F1-score van 92,72 ± 0,62%. De 95% bootstrap-betrouwbaarheidsintervallen geschat op basis van 1.0 resamples waren 0,897–0,973 voor de nauwkeurigheid, 0,890–0,970 voor de precisie, 0,80–0,963 voor de recall, 0,87–0,965 voor de F1-score en 0,931–0,984 voor de AUC-ROC. Statistische vergelijkingen met de CNN-, Random Forest- en SVM-baselinemodellen werden uitgevoerd met de McNemar-test voor nauwkeurigheid, de DeLong-test voor AUC-ROC en gepaarde bootstrap-testen met 1.0 resamples voor de F1-score.
De volledige trainings- en evaluatieprocedure werd herhaald over 10 onafhankelijke runs met verschillende random seeds. De herhaalde runs resulteerden in een AUC-ROC van 0,957 ± 0,008, een nauwkeurigheid van 93,24 ± 0,74% en een F1-score van 92,35 ± 0,92%, wat wijst op een relatief lage variabiliteit over de herhaalde uitvoeringen. De prestatiemetrieken die over de herhaalde uitvoeringen zijn verkregen, werden samengevat met behulp van het gemiddelde en de standaarddeviatie. De variabiliteit tussen de runs werd onderzocht om vast te stellen of de voorspellende prestaties stabiel bleven bij herhaalde uitvoering.
Externe validatie is in het huidige praktijkvoorbeeld niet uitgevoerd omdat er geen onafhankelijke externe dataset is gebruikt. Bijgevolg zijn alle gerapporteerde predictieve, statistische en reproduceerbaarheidsresultaten verkregen uit de Pima Indians Diabetes Dataset met behulp van de vooraf gedefinieerde training-, validatie- en onafhankelijke testpartities. Externe validatie is in het protocol behouden als een optionele procedure voor toepassingen waarbij een onafhankelijke dataset van een andere instelling, populatie, geografische regio of tijdsperiode beschikbaar is.
Modeluitleg werd gegenereerd met behulp van explainability-technieken die toepasbaar zijn op de tabulaire Pima Indians Diabetes Dataset, waaronder SHAP en LIME. De globale feature-belangrijkheid werd geëvalueerd en patiëntspecifieke lokale uitleg werd gegenereerd met behulp van aparte testsamples. De resultaten van de uitleg werden samen met de bijbehorende modelvoorspellingen en feature-waarden geregistreerd om de reproduceerbaarheid en daaropvolgende interpretatie te vergemakkelijken.
Voor de duidelijkheid bestond het huidige uitgewerkte voorbeeld uit de negen kernfasen van de workflow die in Tabel 1 zijn geïdentificeerd. Externe validatie en evaluatie door klinische experts werden behouden als optionele validatiemodules van het algemene protocol. Externe validatie werd niet uitgevoerd omdat er geen onafhankelijke externe dataset is gebruikt, en evaluatie door klinische experts werd niet uitgevoerd omdat er geen formeel expert-evaluatiepaneel was opgenomen in het huidige uitgewerkte voorbeeld. Bijgevolg worden deze optionele modules niet beschouwd als onderdeel van de negenfasige experimentele workflow en worden ze niet gerapporteerd als experimentele resultaten.
De procedures voor preprocessing en dataset-partitionering leverden een gestandaardiseerde dataset op die geschikt is voor modelontwikkeling. Dubbele en inconsistente records werden verwijderd, ontbrekende waarden werden behandeld volgens de vooraf gedefinieerde strategie, numerieke kenmerken werden gestandaardiseerd en de dataset werd verdeeld in onafhankelijke trainings-, validatie- en testsubsets. De kenmerken van de resulterende dataset en de preprocessing-procedures zijn samengevat in Tabel 2. De algemene workflow voor de voorbereiding en preprocessing van de gezondheidszorgdataset wordt geïllustreerd in Figuur 2, terwijl de workflow voor experimentele voorbereiding, preprocessing, partitionering en kwaliteitsbeoordeling die specifiek is toegepast op de Pima Indians Diabetes Dataset wordt getoond in Figuur 3. De uiteindelijke computationele omgeving, modelarchitectuur en hyperparameterconfiguratie die zijn gebruikt om de gerapporteerde resultaten te genereren, zijn samengevat in Tabel 3.
De uitvoering van sectie 3 en 4 leverde een gestandaardiseerde dataset voor de gezondheidszorg op die geschikt is voor modelontwikkeling. De voorbehandelingsprocedures verwijderden dubbele en inconsistente records, imputeerden ontbrekende waarden, standaardiseerden numerieke kenmerken, codeerden categorische variabelen waar van toepassing en verdeelden de dataset in trainings-, validatie- en testsubsets. De resulterende gegevens boden de gestandaardiseerde input die vereist is voor de daaropvolgende modelontwikkeling.
Na voltooiing van Sectie 5 en 6 vertoonde het geconfigureerde model een stabiele convergentie tijdens de training. De leercurven toonden gelijktijdige afnames in de trainings- en validatieverliezen en toenames in de trainings- en validatie-nauwkeurigheid. Hyperparameteroptimalisatie verbeterde de generalisatie van het model, zonder bewijs van aanzienlijke overfitting. Om de reproduceerbaarheid te ondersteunen, is het geoptimaliseerde model gearchiveerd samen met de definitieve architectuur, hyperparameterinstellingen, softwareversies, random seeds en de getrainde modelgewichten. De specificaties voor de modeltraining en de optimalisatie-uitkomsten zijn samengevat in Tabel 4, en de bijbehorende leercurven voor training en validatie worden gepresenteerd in Figuur 4.
In sectie 7 werd de voorspellende prestatie van het model geëvalueerd met behulp van gestandaardiseerde prestatiematen. De geëvalueerde classificatiematen omvatten accuratesse, precisie, recall, specificiteit, F1-score, MCC, AUC-ROC en AP. Het voorgestelde model werd vergeleken met de vooraf gedefinieerde baseline-modellen met gebruikmaking van dezelfde datasetpartities, voorbehandelingsprocedures en evaluatieprotocol. De vergelijking van de voorspellende prestaties wordt gepresenteerd in Tabel 5, terwijl de ROC-curven, precisie-recall-curven, de confusiematrix en de vergelijkende prestatiematen worden weergegeven in Figuur 5.
Na Sectie 8 werden zowel globale als lokale verklaringen van de voorspellingen van het model gegenereerd om de interpreteerbaarheid ervan te evalueren. Modelverklaringen werden gegenereerd met behulp van SHAP en LIME voor de tabulaire Pima Indians Diabetes Dataset, en er werd een patiëntspecifieke contrafeitelijke verklaring opgesteld om een verandering in de voorspelling te illustreren. SHAP werd gebruikt voor het genereren van globale visualisaties van kenmerkbelang, patiëntspecifieke watervaldiagrammen en kenmerkafhankelijkheden, terwijl LIME werd gebruikt om lokale verklaringen te genereren op basis van uitgescheiden testmonsters. De bijbehorende output van de uitlegbaarheid wordt gepresenteerd in Figuur 6.
In de laatste fase van het protocol werden de statistische betrouwbaarheid en reproduceerbaarheid van de workflow geëvalueerd. De volledige workflow werd herhaald over 10 onafhankelijke runs met verschillende random seeds, waarbij dezelfde strategie voor dataset-partitionering, voorbewerkingsparameters, modelarchitectuur, hyperparameters, softwareomgeving en evaluatieprocedures werden gehanteerd. De herhaalde runs resulteerden in een AUC-ROC van 0.957 ± 0.08, een nauwkeurigheid van 93.24 ± 0.74% en een F1-score van 92.35 ± 0.92%, wat duidt op een relatief lage variabiliteit over de herhaalde uitvoeringen.
De stabiliteit van de verklaringen werd in de huidige validatie niet kwantitatief geëvalueerd. Hoewel SHAP- en LIME-verklaringen werden gegenereerd voor de Pima Indians Diabetes Dataset, is er geen aparte analyse uitgevoerd naar de rangcorrelatie of de overlap van kenmerken tussen verschillende runs. Daarom worden er geen numerieke metrieken gerapporteerd voor de stabiliteit van de verklaringen of de overeenstemming in attributie. De kwantitatieve beoordeling van de stabiliteit van verklaringen is behouden in het algemene protocol als een optionele procedure voor reproduceerbaarheid voor toepassingen waarbij herhaalde verklaring-outputs beschikbaar zijn.
Statistische vergelijkingen werden geëvalueerd met behulp van een vooraf gedefinieerde significantiedrempel van p < 0,05. Waar van toepassing werden tweezijdige statistische tests gebruikt, en de overeenkomstige toetsingsstatistieken, p-waarden en 95% betrouwbaarheidsintervallen werden gerapporteerd om de statistische significantie en onzekerheid van de waargenomen prestatieverschillen te kwantificeren. De resultaten van de experimentele statistische validatie en reproduceerbaarheid, inclusief cross-validatieprestaties, betrouwbaarheidsintervallen, statistische vergelijkingen en variabiliteit bij herhaalde runs, zijn samengevat in Tabel 6. De overeenkomstige statistische toetsing en reproduceerbaarheidsanalyses zijn geïllustreerd in Figuur 7.
Deze resultaten leverden experimenteel bewijs voor voorspellende stabiliteit en reproduceerbaarheid onder de geteste computationele omstandigheden en dataset. De computationele omgeving, datasetkenmerken, voorbewerkingsprocedures, modelconfiguratie, statistische analyses en instellingen voor uitlegbaarheid die nodig zijn voor onafhankelijke replicatie, werden gedocumenteerd in overeenstemming met de reproduceerbaarheidschecklist in Tabel 7. In het uitgewerkte validatievoorbeeld van het huidige werk is geen evaluatie van de gegenereerde XAI-outputs door klinische experts uitgevoerd.
Over het algemeen leverde de toepassing van het protocol een gestandaardiseerde gezondheidszorgdataset op die geschikt is voor de ontwikkeling van AI-modellen, evenals een geoptimaliseerd model met vooraf gedefinieerde hyperparameterinstellingen. De workflow maakte een systematische evaluatie van de voorspellende prestaties mogelijk, het genereren van modeluitleg met behulp van toepasbare XAI-technieken en een statistische beoordeling van de robuustheid en reproduceerbaarheid van het model. Samen demonstreerden de resultaten de implementatie en reproduceerbaarheid van de voorgestelde XAI-workflow onder de experimentele omstandigheden die zijn geëvalueerd in het uitgewerkte validatievoorbeeld.

Figuur 1: Negenstaps kernworkflow voor de ontwikkeling van reproduceerbare en uitlegbare AI-modellen in de gezondheidszorg. De workflow bestaat uit (1) definitie van de voorspellingstaak in de gezondheidszorg, (2) configuratie van de computationele omgeving, (3) acquisitie en validatie van de dataset, (4) datapreprocessing, (5) partitioning van de dataset, (6) training van het voorspellende model, (7) evaluatie van de voorspellende prestaties, (8) uitlegbaarheidsanalyse en (9) statistische validatie en beoordeling van de reproduceerbaarheid. Externe validatie en evaluatie door klinische experts worden behandeld als optionele protocoluitbreidingen en zijn niet opgenomen in de negenstaps kernworkflow. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2: Workflow voor de voorbereiding en preprocessing van de gezondheidszorgdataset. (A) Verwerf van gezondheidszorggegevens uit klinische dossiers, medische beeldvorming, fysiologische signalen en multimodale gegevensbronnen. (B) Dataintegratie en preprocessing, inclusief de behandeling van ontbrekende waarden, normalisatie, ruisonderdrukking en augmentatie. (C) Partitionering van de dataset in trainings-, validatie- en testsubsets. (D) Kwaliteitsbeoordeling met weergave van klassendistributie, kenmerkenormalisatie en preprocessing-outputs voorafgaand aan de modelontwikkeling. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3: Experimentele workflow voor de preparatie, preprocessing, partitionering en kwaliteitsbeoordeling van de Pima Indians Diabetes Dataset. De workflow omvat de acquisitie van de dataset, beoordeling van de datakwaliteit, verwerking van ongeldige en ontbrekende waarden, standaardisatie van numerieke kenmerken, partitionering van de dataset in trainings-, validatie- en onafhankelijke testsubsets, en de uiteindelijke kwaliteitsverificatie voorafgaand aan de modelontwikkeling. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4: Experimentele trainings- en validatieleercurves van het voorgestelde model met gebruik van de Pima Indians Diabetes Dataset. (A) Trainings- en validatieverlies over de volledige trainingsperiode. (B) Trainings- en validatieaccuraatheid over de volledige trainingsperiode. (C) Vergroot overzicht van het verlies tijdens epochs 50–10. (D) Vergroot overzicht van de accuraatheid tijdens epochs 50–10. De beste validatieprestatie werd behaald bij epoch 78, met een validatieverlies van 0,142 en een validatieaccuraatheid van 94,6%. Early stopping werd geactiveerd bij epoch 88 met een patience van 10 epochs. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5: Experimentele evaluatie van de predictieve prestaties van het voorgestelde XAI-framework met gebruik van de onafhankelijke testset (n = 154). (A) Receiver operating characteristic (ROC)-curve die de discriminatieprestaties van het voorgestelde XAI-model en de baselinemodellen weergeeft. (B) Precision-recall (PR)-curves die de precisie- en recall-prestaties van het voorgestelde XAI-model en de baselinemodellen weergeven. (C) Confusiematrix van het voorgestelde XAI-model op de onafhankelijke testset, met de bijbehorende accuratesse, sensitiviteit (recall) en specificiteit. (D) Vergelijking van accuratesse, precisie, recall, specificiteit, F1-score, Matthews correlatiecoëfficiënt (MCC), ROC area under the curve (AUC) en gemiddelde precisie (AP) tussen de geëvalueerde modellen. Alle kwantitatieve resultaten in deze figuur komen overeen met het validatie-experiment op de Pima Indians Diabetes Dataset. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 6: Explainability-outputs gegenereerd vanuit onafhankelijke testset-voorspellingen van het voorgestelde model, getraind op de Pima Indians Diabetes Dataset. (A) Globale SHAP-samenvattingsplot die de distributie van kenmerkbijdragen over de testset laat zien. (B) SHAP-kenmerkbelangplot gebaseerd op gemiddelde absolute SHAP-waarden. (C) Patiëntspecifieke SHAP-watervalplot die de bijdragen van individuele kenmerken aan de voorspelde diabeteswaarschijnlijkheid laat zien. (D) LIME-lokale verklaring die de kenmerkbijdragen voor Testpatiënt #125 laat zien. (E) SHAP-afhankelijkheidsplot die de relatie tussen glucosewaarden en hun SHAP-bijdragen laat zien. (F) Patiëntspecifieke counterfactual-verklaring die de minimale kenmerkwijzigingen laat zien die geassocieerd zijn met een verandering in de modelvoorspelling. Afkortingen: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7: Experimentele statistische validatie en reproduceerbaarheidsanalyse van het voorgestelde model met gebruik van de Pima Indians Diabetes Dataset. (A) Prestaties van de vijfvoudige kruisvalidatie op de trainingsset. (B) 95% bootstrap-betrouwbaarheidsintervallen voor de prestaties van de onafhankelijke testset. (C) Statistische vergelijkingen met basismodellen, inclusief de statistische toets, de toetsingsstatistiek, de p-waarde en de significantie. (D) Consistentie van de prestaties over 10 onafhankelijke runs met verschillende willekeurige seeds. McNemar's test werd gebruikt voor gepaarde classificatienauwkeurigheid, de DeLong-test voor gecorreleerde ROC-AUC, en gepaarde bootstrap-testen met 1.0 resamples voor de vergelijking van de F1-score. Klik hier om een grotere versie van deze figuur te bekijken.
| Stadium | Protocolactiviteit | Verwacht resultaat | Implementatiestatus |
| 1 | Selecteer en valideer de gezondheidszorgdataset | Geverifieerde dataset, voorspellingsdoel, klassendistributie en informatie over de datakwaliteit | Uitgevoerd |
| 2 | Configureer de computationele omgeving | Geverifieerde hardware, software, bibliotheken, versies en computationele configuratie | Uitgevoerd |
| 3 | De gezondheidszorggegevens voorbewerken en kwaliteitscontroleren | Gereinigde, getransformeerde en gestandaardiseerde dataset | Uitgevoerd |
| 4 | Partitioneer de dataset | Onafhankelijke trainings-, validatie- en testdatasets | Uitgevoerd |
| 5 | Ontwikkel en optimaliseer het predictieve/XAI-model | Gefinaliseerde modelarchitectuur en hyperparameters | Uitgevoerd |
| 6 | Train en bewaar het model | Getraind model, checkpoint, trainingsconfiguratie en logs | Uitgevoerd |
| 7 | Evalueer de predictieve en computationele prestaties | Prestatiemetrieken van de testset en prestatievergelijkingen | Uitgevoerd |
| 8 | Genereer en evalueer explainability-outputs | SHAP/LIME en toepasbare uitlegoutputs | Uitgevoerd |
| 9 | Voer statistische validatie en een reproduceerbaarheidsbeoordeling uit | Betrouwbaarheidsintervallen, statistische toetsen, resultaten van herhaalde runs en reproduceerbaarheidsmaten | Uitgevoerd |
Tabel 1: Samenvatting van de negenstaps kernprotocol-workflow toegepast in de uitgewerkte validatie met gebruik van de Pima Indians Diabetes Dataset. De tabel maakt onderscheid tussen de negen fasen die zijn geïmplementeerd in het uitgewerkte voorbeeld van de Pima Indians Diabetes Dataset en de externe validatie en klinische expertevaluatie, welke behouden blijven als optionele componenten van het algemene protocol.
| Dataset | Gegevensbron | Klinische toepassing | Gegevensmodaliteit | Proefpersonen/Records | Monsters | Klassen | Klassenverdeling | Training/Validatie/Test | Rol in huidige studie | Validatiestatus | Bron-URL |
| Pima Indians Diabetes Dataset | UCI Machine Learning Repository | Diabetesvoorspelling | Klinisch tabulair | 768 records | 768 | 2 | 500 niet-diabetisch; 268 diabetisch | 60% / 20% / 20% | Primaire experimentele validatiedataset | Uitgevoerd – volledige negenstaps kernworkflow | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), TCGA-BRCA project | Classificatie van borstkanker | Klinisch + histopathologie | 1.098 gevallen | Dataset-afhankelijk per datatype | Eindpunt-afhankelijk | Geen enkele dataset-brede klassenverdeling | Niet van toepassing – geen experimentele splitsing uitgevoerd | Alleen als voorbeeld voor toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), TCGA-UCEC project | Classificatie van endometriumkanker | Klinisch + histopathologie | Projectcohort; omvang hangt af van geselecteerd datatype en filters | Dataset-afhankelijk per datatype | Eindpunt-afhankelijk | Geen enkele dataset-brede klassenverdeling | Niet van toepassing – geen experimentele splitsing uitgevoerd | Alleen als voorbeeld voor toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Clinical Database v1.4 | Voorspelling van klinische uitkomst | Klinische tijdreeksen | 46.520 patiënten | 58.976 IC-opnames | Taakafhankelijk | Geen enkele database-brede klassenverdeling | Niet van toepassing – geen experimentele splitsing uitgevoerd | Alleen als voorbeeld voor toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | International Skin Imaging Collaboration (ISIC) Challenge | Classificatie van huidlaesies | Dermoscopische beelden | Niet van toepassing – beelddataset | 25.31 trainingsbeelden | 8 trainingscategorieën | AKIEC 867; BCC 3.323; BKL 2.624; DF 239; MEL 4.52; NV 12.875; VASC 253; SCC 628 | Niet van toepassing – geen experimentele splitsing uitgevoerd | Alleen als voorbeeld voor toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://challenge.isic-archive.com/landing/2019/ |
| HAM100 | Harvard Dataverse / ISIC Archive | Classificatie van huidlaesies | Dermoscopische beelden | 7.470 unieke laesies | 10.015 beelden | 7 | AKIEC 327; BCC 514; BKL 1.09; DF 15; MEL 1.13; NV 6.705; VASC 142 | Niet van toepassing – geen experimentele splitsing uitgevoerd | Alleen als voorbeeld voor toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | OhioT1DM dataset, publiek verspreid voor onderzoek | Monitoring/voorspelling van diabetes | Klinische tijdreeksen | 12 deelnemers | 24 XML-bestanden verdeeld over trainings-/ontwikkelings- en testgegevens | Continue glucosevoorspelling; geen vaste classificatietaak | Niet van toepassing | Door dataset gedefinieerde trainings-/ontwikkelings- en testbestanden; hier is geen experimentele splitsing uitgevoerd | Alleen als voorbeeld voor toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://pmc.ncbi.nlm.nih.gov/articles/PMC781904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvania | Segmentatie/classificatie van hersentumoren | MRI | 2.040 gevallen in challenge-cohort | 1.251 geannoteerde trainingsgevallen; vier MRI-modaliteiten per geval | Taakafhankelijk | Geen enkele dataset-brede klassenverdeling | Door challenge gedefinieerde cohorten; hier is geen experimentele splitsing uitgevoerd | Alleen als voorbeeld voor toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://www.med.upenn.edu/cbica/brats2021/ |
Tabel 2: Kenmerken van de gezondheidszorgdatasets en toepasbaarheid van het voorgestelde protocol. De tabel vat de gegevensbronnen, klinische toepassingen, modaliteiten, steekproefkenmerken, klassenverdelingen, strategieën voor datasetpartitionering, validatiestatus en broninformatie samen voor de in het protocol overwogen gezondheidszorgdatasets. De Pima Indians Diabetes Dataset dient als het primaire uitgewerkte voorbeeld voor de protocolvalidatie.
| Configuratie-item | Werkelijke ingestelde validatiewaarde | Status / Interpretatie |
| Dataset | Pima Indians Diabetes Dataset | Werkelijke experimentele validatiedataset |
| Algoritme / Model | Tabulair predictief model voor binaire diabetesclassificatie | Gebruik de exacte naam van de architectuur uit het experimentverslag indien afzonderlijk gedocumenteerd |
| Learning Rate | 0,01 | Experimentele instelling |
| Optimizer | Adam | Experimentele instelling |
| Batchgrootte | 32 | Experimentele instelling |
| Maximaal aantal epochs | 100 | Experimentele instelling |
| Verliesfunctie | Cross-Entropy | Experimentele instelling |
| Activatiefunctie | ReLU | Experimentele instelling |
| Dropout | 0,5 | Experimentele instelling |
| Weight Decay | 1e-4 | Experimentele instelling |
| Batchnormalisatie | Ingeschakeld | Experimentele instelling |
| Data-augmentatie / Klassebalancering | Ingeschakeld | Specificeer SMOTE alleen als dit daadwerkelijk is toegepast in de gerapporteerde run |
| Validatiestrategie | 5-voudige kruisvalidatie | Experimentele instelling |
| Early Stopping | Patience = 10 epochs | Experimentele instelling |
| Random Seed | 42 | Gebruik de exacte seed-configuratie die voor het experiment is vastgelegd |
| Herhaalde runs | 10 onafhankelijke runs met verschillende random seeds | Analyse van experimentele reproduceerbaarheid |
| Invoer-afbeeldingsgrootte | Niet van toepassing | Pima-dataset is tabulair |
| Kenmerkdimensie | 512 | Gebruik alleen als dit de uiteindelijke geïmplementeerde kenmerkrepresentatie is |
| Uitlegbaarheid | SHAP + LIME; contrafeitelijke uitleg getoond in Figuur 6 | Werkelijke gerapporteerde XAI-analyse |
| Evaluatiemetrieken | Nauwkeurigheid, precisie, recall, specificiteit, F1-score, MCC, AUC-ROC, AP | Gerapporteerde experimentele evaluatiemetrieken |
| Hardware | NVIDIA GPU | Vervang door exact GPU-model indien vastgelegd |
| Software / Framework | Python 3.1; Scikit-learn; frameworkcomponenten gebruikt door de implementatie | Gebruik exacte pakketversies indien vastgelegd |
Tabel 3: Computationele omgeving, modelarchitectuur en hyperparameterconfiguratie gebruikt voor de implementatie van het protocol. De tabel specificeert het computationele platform, de softwareomgeving, de modelarchitectuur, de inputconfiguratie, de optimalisatieparameters, de regularisatie-instellingen en de reproduceerbaarheidsparameters die zijn gebruikt om de voorgestelde XAI-workflow te implementeren.
| Parameter | Representatieve specificatie / resultaat |
| Optimizer | Adam |
| Leerpercentage | 0.01 |
| Batchgrootte | 32 |
| Maximum aantal epochs | 10 |
| Early-stopping patience | 10 epochs |
| Beste epoch | 78 |
| Early-stopping epoch | 8 |
| Beste validatieverlies | 0.142 |
| Beste validatienauwkeurigheid | 94.6% |
| Trainingsoutput | Trainings- en validatieverlies namen af en convergeerden |
| Validatieoutput | Trainings- en validatienauwkeurigheid namen toe en stabiliseerden |
| Optimalisatieresultaat | Beste modelprestaties behaald bij epoch 78 |
| Overfitting-controle | Early stopping voorkwam verdere optimalisatie voorbij de geselecteerde beste epoch |
Tabel 4: Specificaties voor modeltraining en optimalisatiegegevens. De tabel vat de optimizer, leerpercentage, batchgrootte, maximaal aantal trainingsepochen, validatieprestaties, trainingsconvergentie, optimalisatieresultaat en de strategie voor overfitting-controle samen die tijdens de modelontwikkeling zijn gebruikt.
| Model | Nauwkeurigheid (%) | Precisie (%) | Recall (%) | Specificiteit (%) | F1-score (%) | MCC | AUC (ROC) | AP (PR) |
| Voorgesteld XAI-model | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| Deep Learning (CNN) | 89.1 | 89.8 | 8.1 | 90 | 88.9 | 0.78 | 0.92 | 0.9 |
| Random Forest | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| Support Vector Machine (SVM) | 78.6 | 79.3 | 7.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| Baseline (meeste klasse) | 62.1 | 62.1 | 100 | 0 | 76.6 | 0 | 0.5 | 0.5 |
Tabel 5: Vergelijking van de voorspellende prestaties van de geëvalueerde modellen. De tabel vergelijkt het voorgestelde XAI-model met de geëvalueerde referentiemodellen op basis van nauwkeurigheid, precisie, recall, specificiteit, F1-score, de correlatiecoëfficiënt van Matthews, het oppervlak onder de receiver operating characteristic-curve en de gemiddelde precisie.
| Validatieanalyse | Vergelijking / Metriek | Statistische toets | Toetsstatistiek | p-waarde | Experimenteel resultaat / 95% BI |
| Vijfvoudige kruisvalidatie | Nauwkeurigheid | Beschrijvend (gemiddelde ± SD) | — | — | 93,01 ± 0,48% |
| Vijfvoudige kruisvalidatie | AUC-ROC | Beschrijvend (gemiddelde ± SD) | — | — | 0,954 ± 0,07 |
| Vijfvoudige kruisvalidatie | Precisie | Beschrijvend (gemiddelde ± SD) | — | — | 92,42 ± 0,87% |
| Vijfvoudige kruisvalidatie | Recall | Beschrijvend (gemiddelde ± SD) | — | — | 93,02 ± 0,45% |
| Vijfvoudige kruisvalidatie | F1-score | Beschrijvend (gemiddelde ± SD) | — | — | 92,72 ± 0,62% |
| 95% bootstrap betrouwbaarheidsinterval | Nauwkeurigheid | Bootstrap (1.0 resamples) | — | — | 0,935 [0,897, 0,973] |
| 95% bootstrap betrouwbaarheidsinterval | Precisie | Bootstrap (1.00 resamples) | — | — | 0,930 [0,890, 0,970] |
| 95% bootstrap betrouwbaarheidsinterval | Recall | Bootstrap (1.0 resamples) | — | — | 0,92 [0,880, 0,963] |
| 95% bootstrap betrouwbaarheidsinterval | F1-score | Bootstrap (1.0 resamples) | — | — | 0,926 [0,887, 0,965] |
| 95% bootstrap betrouwbaarheidsinterval | AUC-ROC | Bootstrap (1.0 resamples) | — | — | 0,958 [0,931, 0,984] |
| Voorgesteld model vs. CNN | Nauwkeurigheid (%) | McNemar-toets | 9,32 | 0,023 | Significant (α = 0,05) |
| Voorgesteld model vs. CNN | AUC-ROC | DeLong-toets | 3,87 | 0,01 | Significant (α = 0,05) |
| Voorgesteld model vs. CNN | F1-score | Gepaarde bootstrap (1.00 resamples) | 2,81 | 0,04 | Significant (α = 0,05) |
| Voorgesteld model vs. Random Forest | Nauwkeurigheid (%) | McNemar-toets | 14,27 | 0,02 | Significant (α = 0,05) |
| Voorgesteld model vs. Random Forest | AUC-ROC | DeLong-toets | 5,86 | <0,001 | Significant (α = 0,05) |
| Voorgesteld model vs. Random Forest | F1-score | Gepaarde bootstrap (1.0 resamples) | 4,03 | 0,03 | Significant (α = 0,05) |
| Voorgesteld model vs. SVM | Nauwkeurigheid (%) | McNemar-toets | 16,08 | <0,001 | Significant (α = 0,05) |
| Voorgesteld model vs. SVM | AUC-ROC | DeLong-toets | 6,95 | <0,01 | Significant (α = 0,05) |
| Voorgesteld model vs. SVM | F1-score | Gepaarde bootstrap (1.0 resamples) | 4,62 | <0,01 | Significant (α = 0,05) |
| Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs) | AUC-ROC | Beschrijvend (gemiddelde ± SD) | — | — | 0,957 ± 0,08 |
| Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs) | Nauwkeurigheid (%) | Beschrijvend (gemiddelde ± SD) | — | — | 93,24 ± 0,74% |
| Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs) | F1-score (%) | Beschrijvend (gemiddelde ± SD) | — | — | 92,35 ± 0,92% |
Tabel 6: Statistische validatie- en reproduceerbaarheidsresultaten verkregen uit de experimentele implementatie met gebruik van de Pima Indians Diabetes Dataset. De tabel vat de prestaties van de vijfvoudige kruisvalidatie samen, bootstrap-gebaseerde 95% betrouwbaarheidsintervallen, statistische vergelijkingen van het voorgestelde model met de baseline-modellen en de reproduceerbaarheid van herhaalde runs over 10 onafhankelijke random seeds. Externe validatie en evaluatie door klinische experts zijn in de huidige validatie niet uitgevoerd.
| Nee. | Checklijstitem | Vereiste documentatie | Aanbevolen opname / verificatie |
| 1 | Softwareomgeving | Besturingssysteem, programmeertaal en softwareomgeving | Noteer de exacte versies van het besturingssysteem en de programmeertaal. |
| 2 | Software- en bibliotheekversies | Versies van belangrijke softwarebibliotheken en pakketten | Registreer de exacte namen en versies van pakketten/bibliotheken. |
| 3 | Hardware-specificaties | Specificaties van CPU, GPU, RAM, opslag en accelerator | Leg de gebruikte computerhardware vast. |
| 4 | Identificatie van de dataset | Naam van de dataset, bron, versie en toegangsgegevens | Noteer, waar van toepassing, de exacte bron/versie van de dataset en de datum van toegang. |
| 5 | Datasetkenmerken | Steekproefgrootte en klassendistributie | Registreer het totaal aantal monsters en de klassendistributie voor elke split. |
| 6 | Datasetpartitionering | Strategie voor training, validatie en onafhankelijke testset | Documenteer de splitsingsverhoudingen/aantallen en de stratificatie. |
| 7 | Preventie van datalekkage | Procedure ter voorkoming van informatielekkage | Documentatie over de scheiding van subjecten/monsters en de schatting van parameters voor preprocessing uitsluitend tijdens de training. |
| 8 | Preprocessingparameters | Instellingen voor opschonen, omgang met ontbrekende waarden, normalisatie, codering en transformatie | Registreer alle preprocessing-operaties en parameterwaarden. |
| 9 | Data-augmentatie | Augmentatiemethoden en parameterinstellingen, indien van toepassing | Documenteer methoden, waarschijnlijkheden en parameterbereiken. |
| 10 | Modelarchitectuur | Definitieve modelarchitectuur en configuratie | Documenteer het modeltype, de lagen/componenten, de dimensies en de activatiefuncties. |
| 11 | Hyperparameters | Hyperparameters voor training en optimalisatie | Noteer de leersnelheid, batchgrootte, optimizer, epochs, early stopping en de afgestelde parameters. |
| 12 | Willekeurige seeds | Willekeurige seeds gebruikt voor reproduceerbare uitvoering | Leg de seeds vast voor splitting, initialisatie en herhaalde runs. |
| 13 | Trainingsconfiguratie | Trainingsprocedure en modelselectiestrategie | Documentvalidatie, checkpointing en criteria voor modelselectie. |
| 14 | Evaluatiemetrieken | Vooraf gedefinieerde predictieve en statistische evaluatiemetrieken | Registreer alle gerapporteerde prestatiemaatstaven. |
| 15 | Betrouwbaarheidsintervallen | Onzekerheidsintervallen voor prestatiemaatstaven | Documenteer de procedure voor de schatting van het betrouwbaarheidsinterval (CI) en de bootstrap-resamples waar van toepassing. |
| 16 | Statistische toetsen | Statistische procedures voor modelvergelijking | Documenteer de toets, de statistiek, de p-waarde, de significantiedrempel en de aannames. |
| 17 | Analyse van herhaalde runs | Onafhankelijke uitvoeringen met verschillende willekeurige seeds | Noteer het aantal runs en het gemiddelde ± SD van kernmetrieken. |
| 18 | Configuratie van uitlegbaarheid | Uitlegbaarheidsmethoden en parameterinstellingen | Documenteer SHAP, LIME, Grad-CAM, attention, counterfactuals of toepasbare instellingen. |
| 19 | Beoordeling van de uitlegbaarheid | Objectieve beoordeling van de betrouwbaarheid en het nut van verklaringen | Documenteer de getrouwheid, stabiliteit, infideliteit, lokalisatie en, waar van toepassing, de deskundigenbeoordeling. |
| 20 | Modelartefacten | Getrainde modelgewichten en configuratiebestanden | Archiveer het definitieve getrainde model, de architectuur/configuratie en de selectiegegevens. |
| 21 | Beschikbaarheid van de code | Code vereist voor preprocessing, training, evaluatie en het genereren van verklaringen | Recordrepository of informatie over gecontroleerde code-toegang, indien van toepassing. |
| 22 | Uitvoeringsdocumentatie | Opdrachten, scripts, configuratiebestanden en instructies | Leg de commando's en configuraties vast die nodig zijn om de workflow te reproduceren. |
| 23 | Uitvoerdocumentatie | Voorspellingen, evaluatieresultaten, figuren en verklaringsoutputs | Archiveer de gegenereerde outputs en koppel deze aan het overeenkomstige experiment/de overeenkomstige run. |
| 24 | Verificatie van reproduceerbaarheid | Verificatie van de consistentie over onafhankelijke uitvoeringen | Vergelijk de resultaten van herhaalde runs en rapporteer vooraf gedefinieerde variabiliteitsmaten. |
Tabel 7: Reproduceerbaarheidschecklist voor onafhankelijke replicatie van de voorgestelde XAI-workflow. De checklist specificeert de computationele eisen, datasetvereisten, voorbewerking, modelontwikkeling, evaluatie, statistische validatie, uitlegbaarheid en documentatievereisten die nodig zijn om de experimentele workflow te reproduceren.