Het voorgestelde XAI-framework is geïmplementeerd met gebruik van de Pima Indians Diabetes Dataset als representatieve dataset voor de gezondheidszorg. De Pima Indians Diabetes Dataset werd gebruikt als de enige dataset voor experimentele validatie. Alle gerapporteerde resultaten met betrekking tot predictie, uitlegbaarheid, statistiek en reproduceerbaarheid zijn gegenereerd vanuit deze dataset. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10, OhioT1DM en BraTS 2021 zijn niet experimenteel geëvalueerd en zijn uitsluitend opgenomen als voorbeelden die de toepasbaarheid van het algemene protocol illustreren over verschillende modaliteiten van gezondheidszorggegevens. De volledige dataset werd gebruikt nadat ongeldige en dubbele records waren verwijderd, en de gespecificeerde voorbewerkingoperaties werden uitgevoerd voorafgaand aan de modelontwikkeling. De dataset werd opgedeeld in onafhankelijke trainings-, validatie- en testsubsets met behulp van een vooraf gedefinieerde gestratificeerde splitsingsstrategie. De onafhankelijkheid van monsters over de drie subsets werd gehandhaafd om de mogelijkheid van datalekken te minimaliseren.
Het voorspellende model werd geconfigureerd met behulp van de vooraf gedefinieerde architectuur en hyperparameters. Het model werd getraind met de Adam-optimizer, gebruikmakend van de vooraf gedefinieerde leerfrequentie en batchgrootte gedurende maximaal 10 epochs. Er werd vroegtijdige stopzetting (early stopping) toegepast op basis van het validatieverlies, waarbij het model met de beste validatieprestaties werd behouden. Om de reproduceerbaarheid te verbeteren, werden random seeds gespecificeerd voor de partitionering van de dataset, de modelinitialisatie en herhaalde experimenten.
Het getrainde model werd geëvalueerd op de onafhankelijke testset met behulp van nauwkeurigheid, precisie, recall, specificiteit, F1-score, de correlatiecoëfficiënt van Matthews (MCC), de oppervlakte onder de receiver operating characteristic-curve (AUC-ROC) en de gemiddelde precisie (AP). Het voorgestelde model werd vergeleken met de vooraf gedefinieerde baseline-modellen met gebruikmaking van identieke preprocessing-procedures, datapartities en evaluatieprotocollen. Receiver operating characteristic (ROC)-curves, precisie-recall-curves en een confusiematrix werden gegenereerd op basis van de voorspellingen van de onafhankelijke testset.
Vijfvoudige kruisvalidatie werd uitgevoerd op de trainingsgegevens om de stabiliteit van de prestaties te beoordelen. Er werden 95% betrouwbaarheidsintervallen geschat voor de belangrijkste prestatieindicatoren, en er werden vooraf gedefinieerde statistische vergelijkingen uitgevoerd tussen het voorgestelde model en de basismodellen.
Vijfvoudige kruisvalidatie leverde een nauwkeurigheid op van 93,01 ± 0,48%, een AUC-ROC van 0,954 ± 0,07, een precisie van 92,42 ± 0,87%, een recall van 93,02 ± 0,45% en een F1-score van 92,72 ± 0,62%. De 95% bootstrap-betrouwbaarheidsintervallen geschat uit 1.0 resamples waren 0,897–0,973 voor nauwkeurigheid, 0,890–0,970 voor precisie, 0,80–0,963 voor recall, 0,87–0,965 voor F1-score en 0,931–0,984 voor AUC-ROC. Statistische vergelijkingen met de CNN-, Random Forest- en SVM-basismodellen werden uitgevoerd met de McNemar-test voor nauwkeurigheid, de DeLong-test voor AUC-ROC en gepaarde bootstrap-testen met 1.0 resamples voor de F1-score.
De volledige trainings- en evaluatieprocedure werd herhaald over 10 onafhankelijke runs met verschillende random seeds. De herhaalde runs leverden een AUC-ROC op van 0,957 ± 0,08, een nauwkeurigheid van 93,24 ± 0,74% en een F1-score van 92,35 ± 0,92%, wat duidt op een relatief lage variabiliteit over de herhaalde uitvoeringen. Prestatiemetrieken verkregen over de herhaalde uitvoeringen werden samengevat met behulp van het gemiddelde en de standaarddeviatie. De variabiliteit tussen de runs werd onderzocht om vast te stellen of de voorspellende prestaties stabiel bleven bij herhaalde uitvoering.
Externe validatie is in dit praktijkvoorbeeld niet uitgevoerd omdat er geen onafhankelijke externe dataset is gebruikt. Bijgevolg zijn alle gerapporteerde predictieve, statistische en reproduceerbaarheidsresultaten verkregen uit de Pima Indians Diabetes Dataset met behulp van de vooraf gedefinieerde partities voor training, validatie en onafhankelijke toetsing. Externe validatie is in het protocol behouden als een optionele procedure voor toepassingen waarbij een onafhankelijke dataset van een andere instelling, populatie, geografische regio of tijdsperiode beschikbaar is.
Modeluitleggingen werden gegenereerd met behulp van explainability-technieken die toepasbaar zijn op de tabulaire Pima Indians Diabetes Dataset, waaronder SHAP en LIME. De globale feature importance werd geëvalueerd en patiëntspecifieke lokale uitleggingen werden gegenereerd met behulp van apart gehouden testsamples. De resultaten van de uitleg werden vastgelegd samen met de overeenkomstige modelvoorspellingen en feature-waarden om reproduceerbaarheid en daaropvolgende interpretatie te vergemakkelijken.
Voor de duidelijkheid bestond het huidige praktijkvoorbeeld uit de negen kernfasen van de workflow die zijn geïdentificeerd in Tabel 1. Externe validatie en evaluatie door klinische experts werden behouden als optionele validatiemodules van het algemene protocol. Externe validatie is niet uitgevoerd omdat er geen onafhankelijke externe dataset is gebruikt, en evaluatie door klinische experts is niet uitgevoerd omdat er geen formeel expert-evaluatiepanel was opgenomen in het huidige praktijkvoorbeeld. Bijgevolg worden deze optionele modules niet beschouwd als onderdeel van de experimentele workflow uit negen fasen en worden ze niet gerapporteerd als experimentele resultaten.
De procedures voor preprocessing en dataset-partitionering resulteerden in een gestandaardiseerde dataset die geschikt is voor modelontwikkeling. Dubbele en inconsistente records werden verwijderd, ontbrekende waarden werden behandeld volgens de vooraf gedefinieerde strategie, numerieke kenmerken werden gestandaardiseerd en de dataset werd gepartitioneerd in onafhankelijke trainings-, validatie- en testsubsets. De kenmerken van de resulterende dataset en de preprocessing-procedures zijn samengevat in Tabel 2. De algemene workflow voor de voorbereiding en preprocessing van de gezondheidszorgdataset is geïllustreerd in Figuur 2, terwijl de workflow voor experimentele voorbereiding, preprocessing, partitionering en kwaliteitsbeoordeling die specifiek is toegepast op de Pima Indians Diabetes Dataset wordt getoond in Figuur 3. De uiteindelijke computationele omgeving, modelarchitectuur en hyperparameterconfiguratie die zijn gebruikt om de gerapporteerde resultaten te genereren, zijn samengevat in Tabel 3.
De uitvoering van sectie 3 en 4 leverde een gestandaardiseerde dataset voor de gezondheidszorg op die geschikt is voor modelontwikkeling. De voorbewerkingsprocedures verwijderden dubbele en inconsistente records, vulden ontbrekende waarden aan, standaardiseerden numerieke kenmerken, codeerden categorische variabelen waar van toepassing en verdeelden de dataset in trainings-, validatie- en testsubsets. De resulterende gegevens leverden de gestandaardiseerde input die vereist was voor de daaropvolgende modelontwikkeling.
Na voltooiing van Sectie 5 en 6 vertoonde het geconfigureerde model een stabiele convergentie tijdens de training. De leercurves toonden een gelijktijdige afname van de trainings- en validatieverliezen en een toename van de trainings- en validatienauwkeurigheid. Hyperparameteroptimalisatie verbeterde de generalisatie van het model, zonder bewijs van aanzienlijke overfitting. Ter ondersteuning van de reproduceerbaarheid werd het geoptimaliseerde model gearchiveerd samen met de definitieve architectuur, hyperparameterinstellingen, softwareversies, random seeds en de getrainde modelgewichten. De specificaties voor de modeltraining en de optimalisatiegegevens zijn samengevat in Tabel 4, en de overeenkomstige leercurves voor training en validatie worden gepresenteerd in Figuur 4.
In sectie 7 werd de voorspellende prestatie van het model geëvalueerd met behulp van gestandaardiseerde prestatiemetrieken. De geëvalueerde classificatiemetrieken omvatten nauwkeurigheid, precisie, recall, specificiteit, F1-score, MCC, AUC-ROC en AP. Het voorgestelde model werd vergeleken met de vooraf gedefinieerde baselinemodellen met gebruikmaking van dezelfde datasetpartities, voorbehandelingsprocedures en evaluatieprotocol. De vergelijking van de voorspellende prestaties wordt gepresenteerd in Tabel 5, terwijl de ROC-curven, precisie-recall-curven, de confusiematrix en de vergelijkende prestatiemetrieken worden getoond in Figuur 5.
Na Sectie 8 werden zowel globale als lokale verklaringen van de voorspellingen van het model gegenereerd om de interpreteerbaarheid ervan te evalueren. Modelverklaringen werden gegenereerd met behulp van SHAP en LIME voor de tabelvormige Pima Indians Diabetes Dataset, en er werd een patiëntspecifieke contrafeitelijke verklaring opgesteld om een verandering in de voorspelling te illustreren. SHAP werd gebruikt voor het genereren van globale feature-belangrijkheid en patiëntspecifieke waterval- en feature-afhankelijkheidsvisualisaties, terwijl LIME werd gebruikt om lokale verklaringen te genereren op basis van uitgesloten testmonsters. De overeenkomstige resultaten van de uitlegbaarheid worden gepresenteerd in Figuur 6.
In de laatste fase van het protocol werd de statistische betrouwbaarheid en reproduceerbaarheid van de workflow geëvalueerd. De volledige workflow werd herhaald in 10 onafhankelijke runs met verschillende willekeurige seeds, terwijl dezelfde strategie voor dataset-partitionering, preprocessing-parameters, modelarchitectuur, hyperparameters, softwareomgeving en evaluatieprocedures werden gehanteerd. De herhaalde runs resulteerden in een AUC-ROC van 0,957 ± 0,008, een nauwkeurigheid van 93,24 ± 0,74% en een F1-score van 92,35 ± 0,92%, wat wijst op een relatief lage variabiliteit tussen de herhaalde uitvoeringen.
De stabiliteit van de uitleg werd in de huidige werkvalidatie niet kwantitatief geëvalueerd. Hoewel SHAP- en LIME-uitleggingen werden gegenereerd voor de Pima Indians Diabetes Dataset, is er geen aparte rank-correlatie- of feature-overlapanalyse tussen verschillende runs uitgevoerd. Daarom worden er geen numerieke metrieken voor uitlegstabiliteit of attributie-overeenstemming gerapporteerd. Een kwantitatieve beoordeling van de uitlegstabiliteit is behouden in het algemene protocol als een optionele reproduceerbaarheidsprocedure voor toepassingen waarin herhaalde uitlegoutputs beschikbaar zijn.
Statistische vergelijkingen werden geëvalueerd met gebruik van een vooraf gedefinieerde significantiedrempel van p < 0,05. Tweezijdige statistische tests werden toegepast waar van toepassing, en de overeenkomstige teststatistieken, p-waarden en 95% betrouwbaarheidsintervallen werden gerapporteerd om de statistische significantie en onzekerheid van de waargenomen prestatieverschillen te kwantificeren. De resultaten van de experimentele statistische validatie en reproduceerbaarheid, inclusief de prestaties bij kruisvalidatie, betrouwbaarheidsintervallen, statistische vergelijkingen en variabiliteit bij herhaalde runs, zijn samengevat in Tabel 6. De bijbehorende statistische tests en reproduceerbaarheidsanalyses zijn geïllustreerd in Figuur 7.
Deze resultaten leverden experimenteel bewijs voor voorspellende stabiliteit en reproduceerbaarheid onder de geteste computationele omstandigheden en dataset. De computationele omgeving, datasetkenmerken, voorbewerkingsprocedures, modelconfiguratie, statistische analyses en instellingen voor uitlegbaarheid die nodig zijn voor onafhankelijke replicatie, werden gedocumenteerd in overeenstemming met de reproduceerbaarheidschecklist in Tabel 7. Er is in het uitgewerkte validatievoorbeeld van het huidige werk geen evaluatie van de gegenereerde XAI-outputs door klinische experts uitgevoerd.
Over het algemeen leverde de toepassing van het protocol een gestandaardiseerde dataset voor de gezondheidszorg op die geschikt is voor de ontwikkeling van AI-modellen, evenals een geoptimaliseerd model met vooraf gedefinieerde hyperparameterinstellingen. De workflow maakte een systematische evaluatie van de voorspellende prestaties mogelijk, de generatie van modeluitleg met behulp van toepasbare XAI-technieken, en een statistische beoordeling van de robuustheid en reproduceerbaarheid van het model. Samen demonstreerden de resultaten de implementatie en reproduceerbaarheid van de voorgestelde XAI-workflow onder de experimentele omstandigheden die zijn geëvalueerd in het uitgewerkte validatievoorbeeld.

Figuur 1Negenstaps kernworkflow voor de ontwikkeling van reproduceerbare en uitlegbare AI-modellen in de gezondheidszorg. De workflow bestaat uit (1) definitie van de zorgvoorspellingsopgave, (2) configuratie van de computationele omgeving, (3) acquisitie en validatie van de dataset, (4) preprocessing van de gegevens, (5) partitionering van de dataset, (6) training van het voorspellende model, (7) evaluatie van de voorspellingsprestaties, (8) analyse van de uitlegbaarheid en (9) statistische validatie en beoordeling van de reproduceerbaarheid. Externe validatie en evaluatie door klinische experts worden beschouwd als optionele protocoluitbreidingen en zijn niet opgenomen in de kernworkflow van negen fasen. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2: Workflow voor de voorbereiding en preprocessing van gezondheidszorgdatasets. (A) Verwerving van gezondheidszorggegevens uit klinische dossiers, medische beeldvorming, fysiologische signalen en multimodale gegevensbronnen. (B) Dataintegratie en preprocessing, inclusief de behandeling van ontbrekende waarden, normalisatie, ruisonderdrukking en augmentatie. (C) Partitionering van de dataset in trainings-, validatie- en testsubsets. (D) Kwaliteitsbeoordeling die de klasdistributie, kenmerkenormalisatie en preprocessing-outputs laat zien voorafgaand aan de modelontwikkeling. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3: Experimentele workflow voor de preparatie, preprocessering, partitionering en kwaliteitsbeoordeling van de Pima Indians Diabetes Dataset. De workflow omvat de acquisitie van de dataset, de beoordeling van de datakwaliteit, de verwerking van ongeldige en ontbrekende waarden, de standaardisatie van numerieke kenmerken, het partitioneren van de dataset in trainings-, validatie- en onafhankelijke testsubsets, en de uiteindelijke kwaliteitsverificatie voorafgaand aan de modelontwikkeling. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4: Experimentele trainings- en validatieleercurves van het voorgestelde model met gebruik van de Pima Indians Diabetes Dataset. (A) Trainings- en validatieverlies over de volledige trainingsperiode. (B) Trainings- en validatienauwkeurigheid over de volledige trainingsperiode. (C) Vergrote weergave van het verlies tijdens epochs 50–10. (D) Vergrote weergave van de nauwkeurigheid tijdens epochs 50–10. De beste validatieprestatie werd behaald bij epoch 78, met een validatieverlies van 0,142 en een validatienauwkeurigheid van 94,6%. Early stopping werd geactiveerd bij epoch 8 met een patience van 10 epochs. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5: Experimentele evaluatie van de voorspellende prestaties van het voorgestelde XAI-framework met gebruik van de onafhankelijke testset (n = 154). (A) Receiver operating characteristic (ROC)-curve die de discriminatieprestaties van het voorgestelde XAI-model en de baseline-modellen laat zien. (B) Precision-recall (PR)-curves die de precisie- en recall-prestaties van het voorgestelde XAI-model en de baseline-modellen tonen. (C) Confusiematrix van het voorgestelde XAI-model op de onafhankelijke testset, met de overeenkomstige accuratesse, sensitiviteit (recall) en specificiteit. (D) Vergelijking van nauwkeurigheid, precisie, recall, specificiteit, F1-score, Matthews-correlatiecoëfficiënt (MCC), ROC-oppervlak onder de curve (AUC) en gemiddelde precisie (AP) over de geëvalueerde modellen. Alle kwantitatieve resultaten in deze figuur komen overeen met het validatie-experiment op de Pima Indians Diabetes Dataset. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 6: Explainability-outputs gegenereerd uit voorspellingen op een onafhankelijke testset van het voorgestelde model, getraind op de Pima Indians Diabetes Dataset. (A) Globale SHAP-samenvattingsgrafiek die de distributie van kenmerkbijdragen over de testset weergeeft. (B) SHAP feature-importance plot op basis van gemiddelde absolute SHAP-waarden. (C) Patiëntspecifieke SHAP-watervalplot die de bijdragen van individuele kenmerken aan de voorspelde diabeteskans laat zien. (D(E) LIME-lokale verklaring die de bijdragen van kenmerken voor Testpatiënt #125 laat zien. (E) SHAP-afhankelijkheidsplot die de relatie tussen glucosewaarden en hun SHAP-bijdragen laat zien. (F) Patiëntspecifieke contrafactische verklaring die de minimale wijzigingen in kenmerken laat zien die geassocieerd zijn met een wijziging in de modelvoorspelling. Afkortingen: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7: Experimentele statistische validatie en reproduceerbaarheidsanalyse van het voorgestelde model met gebruik van de Pima Indians Diabetes Dataset. (A) Prestaties bij vijfvoudige kruisvalidatie op de trainingsset. (B) 95% bootstrap-betrouwbaarheidsintervallen voor de prestaties van de onafhankelijke testset. (CStatistische vergelijkingen met baseline-modellen, inclusief de statistische toets, de toetsingsstatistiek, de p-waarde en de significantie.D) Consistentie van de prestaties over 10 onafhankelijke runs met verschillende random seeds. De McNemar-test werd gebruikt voor gepaarde classificatienauwkeurigheid, de DeLong-test voor gecorreleerde ROC-AUC en gepaarde bootstrap-testen met 1.0 resamples voor de vergelijking van de F1-score. Klik hier om een grotere versie van deze figuur te bekijken.
| Fase | Protocolactiviteit | Verwachte output | Implementatiestatus |
| 1 | Selecteer en valideer de gezondheidszorgdataset | Geverifieerde dataset, predictiedoel, klassendistributie en informatie over datakwaliteit | Uitgevoerd |
| 2 | Configureer de computationele omgeving | Geverifieerde hardware, software, bibliotheken, versies en computationele configuratie | Uitgevoerd |
| 3 | Preprocessen en kwaliteitscontrole van de gezondheidszorgdata | Gereinigde, getransformeerde en gestandaardiseerde dataset | Uitgevoerd |
| 4 | Partitioneer de dataset | Onafhankelijke trainings-, validatie- en testdatasets | Uitgevoerd |
| 5 | Ontwikkel en optimaliseer het predictieve/XAI-model | Gefinaliseerde modelarchitectuur en hyperparameters | Uitgevoerd |
| 6 | Train en conserveer het model | Getraind model, checkpoint, trainingsconfiguratie en logs | Uitgevoerd |
| 7 | Evalueer de predictieve en computationele prestaties | Prestatiemetrieken van de testset en prestatievergelijkingen | Uitgevoerd |
| 8 | Genereer en evalueer explainability-outputs | SHAP/LIME en toepasbare uitleg-outputs | Uitgevoerd |
| 9 | Voer statistische validatie en reproduceerbaarheidsbeoordeling uit | Betrouwbaarheidsintervallen, statistische tests, resultaten van herhaalde runs en reproduceerbaarheidsmaten | Uitgevoerd |
Tabel 1: Samenvatting van de negenstaps kernprotocolworkflow toegepast in de uitgewerkte validatie met gebruik van de Pima Indians Diabetes Dataset. De tabel maakt onderscheid tussen de negen fasen die zijn geïmplementeerd in het uitgewerkte voorbeeld van de Pima Indians Diabetes Dataset en de externe validatie en klinische deskundigenevaluatie, die behouden blijven als optionele componenten van het algemene protocol.
| Dataset | Gegevensbron | Klinische toepassing | Gegevensmodaliteit | Proefpersonen/records | Monsters | Klassen | Klassenverdeling | Training/validatie/test | Rol in huidige studie | Validatiestatus | Bron-URL |
| Pima Indians Diabetes Dataset | UCI Machine Learning Repository | Diabetesvoorspelling | Klinisch tabulair | 768 records | 768 | 2 | 50 non-diabetisch; 268 diabetisch | 60% / 20% / 20% | Primaire experimentele validatiedataset | Uitgevoerd – volledige negenstaps kernworkflow | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), TCGA-BRCA project | Classificatie van borstkanker | Klinisch + histopathologie | 1.098 gevallen | Dataset-afhankelijk per datatype | Eindpunt-afhankelijk | Geen enkele dataset-brede klassenverdeling | Niet van toepassing – geen experimentele splitsing uitgevoerd | Enkel voorbeeld van toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), TCGA-UCEC project | Classificatie van endometriumkanker | Klinisch + histopathologie | Projectcohort; grootte hangt af van geselecteerd datatype en filters | Dataset-afhankelijk per datatype | Eindpunt-afhankelijk | Geen enkele dataset-brede klassenverdeling | Niet van toepassing – geen experimentele splitsing uitgevoerd | Enkel voorbeeld van toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Clinical Database v1.4 | Voorspelling van klinische uitkomsten | Klinische tijdreeks | 46.520 patiënten | 58.976 ICU-opnames | Taak-afhankelijk | Geen enkele database-brede klassenverdeling | Niet van toepassing – geen experimentele splitsing uitgevoerd | Enkel voorbeeld van toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | International Skin Imaging Collaboration (ISIC) Challenge | Classificatie van huidlaesies | Dermoscopische beelden | Niet van toepassing – beelddataset | 25.31 trainingsbeelden | 8 trainingscategorieën | AKIEC 867; BCC 3.323; BKL 2.624; DF 239; MEL 4.52; NV 12.875; VASC 253; SCC 628 | Niet van toepassing – geen experimentele splitsing uitgevoerd | Enkel voorbeeld van toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://challenge.isic-archive.com/landing/2019/ |
| HAM10 | Harvard Dataverse / ISIC Archive | Classificatie van huidlaesies | Dermoscopische beelden | 7.470 unieke laesies | 10.015 beelden | 7 | AKIEC 327; BCC 514; BKL 1.09; DF 115; MEL 1.113; NV 6.705; VASC 142 | Niet van toepassing – geen experimentele splitsing uitgevoerd | Enkel voorbeeld van toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | OhioT1DM dataset, publiek gedistribueerd voor onderzoek | Diabetesmonitoring/voorspelling | Klinische tijdreeks | 12 deelnemers | 24 XML-bestanden over trainings-/ontwikkelings- en testgegevens | Continue glucosevoorspelling; geen vaste classificatietaak | Niet van toepassing | Dataset-gedefinieerde trainings-/ontwikkelings- en testbestanden; geen experimentele splitsing hier uitgevoerd | Enkel voorbeeld van toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://pmc.ncbi.nlm.nih.gov/articles/PMC781904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvania | Segmentatie/classificatie van hersentumoren | MRI | 2.040 gevallen in challenge-cohort | 1.251 geannoteerde trainingsgevallen; vier MRI-modaliteiten per geval | Taak-afhankelijk | Geen enkele dataset-brede klassenverdeling | Challenge-gedefinieerde cohorten; geen experimentele splitsing hier uitgevoerd | Enkel voorbeeld van toepasbaarheid van het protocol | Niet gebruikt voor experimentele validatie | https://www.med.upenn.edu/cbica/brats2021/ |
Tabel 2: Kenmerken van de gezondheidszorgdatasets en toepasbaarheid van het voorgestelde protocol. De tabel vat de gegevensbronnen, klinische toepassingen, modaliteiten, monsterkenmerken, klassenverdelingen, partitioneringsstrategieën voor datasets, validatiestatus en broninformatie samen voor de in het protocol beschouwde gezondheidszorgdatasets. De Pima Indians Diabetes Dataset dient als het primaire praktijkvoorbeeld voor de validatie van het protocol.
| Configuratie-item | Werkelijke gevalideerde instelling | Status / Interpretatie |
| Dataset | Pima Indians Diabetes Dataset | Dataset voor feitelijke experimentele validatie |
| Algoritme / Model | Tabulair predictief model voor binaire diabetesclassificatie | Gebruik de exacte architectuurnaam uit het experimentverslag indien deze afzonderlijk is gedocumenteerd |
| Leerpercentage | 0.001 | Experimentele opstelling |
| Optimalisator | Adam | Experimentele opzet |
| Batchgrootte | 32 | Experimentele opzet |
| Maximaal aantal epochs | 100 | Experimentele opstelling |
| Verliesfunctie | Kruisentropie | Experimentele opzet |
| Activatiefunctie | ReLU | Experimentele opstelling |
| Dropout | 0.5 | Experimentele opstelling |
| Weight Decay | 1e-4 | Experimentele opzet |
| Batch-normalisatie | Ingeschakeld | Experimentele opstelling |
| Data-augmentatie / Klassebalancering | Ingeschakeld | Specificeer SMOTE alleen als dit daadwerkelijk is toegepast in de gerapporteerde run |
| Validatiestrategie | 5-voudige kruisvalidatie | Experimentele opzet |
| Vroegtijdige stopzetting | Geduld = 10 epochs | Experimentele opstelling |
| Willekeurige seed | 42 | Gebruik de exacte seed-configuratie die voor het experiment is vastgelegd |
| Herhaalde runs | 10 onafhankelijke runs met verschillende random seeds | Analyse van de experimentele reproduceerbaarheid |
| Input-afbeeldingsgrootte | Niet van toepassing | De Pima-dataset is tabulair |
| Kenmerkdimensie | 512 | Gebruik dit alleen als dit de definitieve geïmplementeerde kenmerkrepresentatie is |
| Uitlegbaarheid | SHAP + LIME; contrafeitelijke verklaring weergegeven in figuur 6 | Feitelijk gerapporteerde XAI-analyse |
| Evaluatiemetrieken | Nauwkeurigheid, precisie, recall, specificiteit, F1-score, MCC, AUC-ROC, AP | Gerapporteerde experimentele evaluatiemetrieken |
| Hardware | NVIDIA GPU | Vervang door het exacte GPU-model indien geregistreerd |
| Software / Framework | Python 3.1; Scikit-learn; door de implementatie gebruikte frameworkcomponenten | Gebruik exacte pakketversies indien geregistreerd |
Tabel 3: Computationele omgeving, modelarchitectuur en hyperparameterconfiguratie gebruikt voor de implementatie van het protocol. De tabel specificeert het computationele platform, de softwareomgeving, de modelarchitectuur, de inputconfiguratie, optimalisatieparameters, regularisatie-instellingen en reproduceerbaarheidsparameters die zijn gebruikt om de voorgestelde XAI-workflow te implementeren.
| Parameter | Representatieve specificatie / resultaat |
| Optimalisator | Adam |
| Leerpercentage | 0.001 |
| Batchgrootte | 32 |
| Maximaal aantal epochs | 100 |
| Early-stopping patience | 10 epochs |
| Beste epoch | 78 |
| Epoch voor voortijdige stopzetting | 88 |
| Beste validatieverlies | 0.142 |
| Beste validatienauwkeurigheid | 94.6% |
| Trainingsoutput | Het trainings- en validatieverlies namen af en convergeerden |
| Validatie-uitvoer | De trainings- en validatienauwkeurigheid namen toe en stabiliseerden |
| Optimalisatieresultaat | Beste modelprestaties behaald bij epoch 78 |
| Beheersing van overfitting | Early stopping voorkwam verdere optimalisatie voorbij de geselecteerde beste epoch |
Tabel 4: Specificaties voor modeltraining en optimalisatie-uitkomsten. De tabel geeft een overzicht van de optimizer, leerpercentage, batchgrootte, maximaal aantal trainingsepochen, validatieprestaties, trainingsconvergentie, optimalisatie-uitkomst en de strategie voor het beheersen van overfitting die zijn gebruikt tijdens de modelontwikkeling.
| Model | Nauwkeurigheid (%) | Precisie (%) | Recall (%) | Specificiteit (%) | F1-score (%) | MCC | AUC (ROC) | AP (PR) |
| Voorgesteld XAI-model | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| Deep Learning (CNN) | 89.1 | 89.8 | 88.1 | 90 | 88.9 | 0.78 | 0.92 | 0.9 |
| Random Forest | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| Support Vector Machine (SVM) | 78.6 | 79.3 | 77.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| Baseline (meerderheidsklasse) | 62.1 | 62.1 | 100 | 0 | 76.6 | 0 | 0.5 | 0.5 |
Tabel 5: Vergelijking van de voorspellende prestaties van de geëvalueerde modellen. De tabel vergelijkt het voorgestelde XAI-model met de geëvalueerde baselinemodellen op basis van nauwkeurigheid, precisie, recall, specificiteit, F1-score, de Matthews correlatiecoëfficiënt, het oppervlak onder de receiver operating characteristic-curve en de gemiddelde precisie.
| Validatieanalyse | Vergelijking / Metriek | Statistische toets | Toetsingsgrootheid | p-waarde | Experimenteel resultaat / 95% BI |
| Vijfvoudige kruisvalidering | Nauwkeurigheid | Beschrijvend (gemiddelde ± SD) | — | — | 93.01 ± 0.48% |
| Vijfvoudige kruisvalidatie | AUC-ROC | Beschrijvend (gemiddelde ± SD) | — | — | 0.954 ± 0.007 |
| Vijfvoudige kruisvalidatie | Precisie | Beschrijvend (gemiddelde ± SD) | — | — | 92.42 ± 0.87% |
| Vijfvoudige kruisvalidatie | Recall | Beschrijvend (gemiddelde ± SD) | — | — | 93.02 ± 0.45% |
| Vijfvoudige kruisvalidatie | F1-score | Beschrijvend (gemiddelde ± SD) | — | — | 92.72 ± 0.62% |
| 95% bootstrap-betrouwbaarheidsinterval | Nauwkeurigheid | Bootstrap (1.0 resamples) | — | — | 0.935 [0.897, 0.973] |
| 95% bootstrap-betrouwbaarheidsinterval | Precisie | Bootstrap (1.0 resamples) | — | — | 0.930 [0.890, 0.970] |
| 95% bootstrap-betrouwbaarheidsinterval | Recall | Bootstrap (1.0 resamples) | — | — | 0.922 [0.880, 0.963] |
| 95% bootstrap-betrouwbaarheidsinterval | F1-score | Bootstrap (1.0 resamples) | — | — | 0.926 [0.887, 0.965] |
| 95% bootstrap-betrouwbaarheidsinterval | AUC-ROC | Bootstrap (1.0 resamples) | — | — | 0.958 [0.931, 0.984] |
| Voorgesteld model versus CNN | Nauwkeurigheid (%) | McNemar-toets | 9.32 | 0.0023 | Significant (α = 0,05) |
| Voorgesteld model vs. CNN | AUC-ROC | DeLong-toets | 3.87 | 0.0001 | Significant (α = 0,05) |
| Voorgesteld model vs. CNN | F1-score | Gepaarde bootstrap (1.0 resamples) | 2.81 | 0.0044 | Significant (α = 0,05) |
| Voorgesteld model versus Random Forest | Nauwkeurigheid (%) | McNemar-toets | 14.27 | 0.0002 | Significant (α = 0,05) |
| Voorgesteld model versus Random Forest | AUC-ROC | DeLong-test | 5.86 | <0.0001 | Significant (α = 0,05) |
| Voorgesteld model versus Random Forest | F1-score | Gepaarde bootstrap (1.0 resamples) | 4.03 | 0.0003 | Significant (α = 0,05) |
| Voorgesteld model vs. SVM | Nauwkeurigheid (%) | McNemar-toets | 16.08 | <0.0001 | Significant (α = 0,05) |
| Voorgesteld model versus SVM | AUC-ROC | DeLongs test | 6.95 | <0.0001 | Significant (α = 0,05) |
| Voorgesteld model vs. SVM | F1-score | Gepaarde bootstrap (1.00 resamples) | 4.62 | <0.0001 | Significant (α = 0,05) |
| Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs) | AUC-ROC | Beschrijvend (gemiddelde ± SD) | — | — | 0.957 ± 0.008 |
| Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs) | Nauwkeurigheid (%) | Beschrijvend (gemiddelde ± SD) | — | — | 93.24 ± 0.74% |
| Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs) | F1-score (%) | Beschrijvend (gemiddelde ± SD) | — | — | 92.35 ± 0.92% |
Tabel 6: Resultaten van statistische validatie en reproduceerbaarheid verkregen uit de experimentele implementatie met gebruik van de Pima Indians Diabetes Dataset. De tabel vat de prestaties van de vijfvoudige kruisvalidatie samen, bootstrap-gebaseerde 95% betrouwbaarheidsintervallen, statistische vergelijkingen van het voorgestelde model met de basismodellen en de reproduceerbaarheid bij herhaalde runs over 10 onafhankelijke willekeurige seeds. Externe validatie en evaluatie door klinische experts zijn in de huidige validatie niet uitgevoerd.
| Nr. | Checklistitem | Vereiste documentatie | Aanbevolen registratie / verificatie |
| 1 | Softwareomgeving | Besturingssysteem, programmeertaal en softwareomgeving | Registreer de exacte versies van het OS en de programmeertaal. |
| 2 | Software- en bibliotheekversies | Versies van belangrijke softwarebibliotheken en pakketten | Registreer de exacte namen en versies van pakketten/bibliotheken. |
| 3 | Hardware-specificaties | Specificaties van CPU, GPU, RAM, opslag en accelerator | Registreer de gebruikte computerhardware. |
| 4 | Datasetidentificatie | Naam, bron, versie en toegangsgegevens van de dataset | Registreer de exacte bron/versie van de dataset en, indien van toepassing, de toegangsdatum. |
| 5 | Datasetkenmerken | Steekproefgrootte en klassenverdeling | Registreer het totaal aantal monsters en de klassenverdeling per split. |
| 6 | Datasetpartitionering | Strategie voor trainings-, validatie- en onafhankelijke testsets | Documenteer de split-proporties/aantallen en stratificatie. |
| 7 | Preventie van datalekken | Procedure die is gebruikt om informatielekkage te voorkomen | Documenteer de scheiding van subjecten/monsters en de schatting van preprocessingparameters uitsluitend op basis van de trainingsset. |
| 8 | Preprocessingparameters | Instellingen voor opschoning, omgang met missende waarden, normalisatie, codering en transformatie | Registreer alle preprocessing-operaties en parameterwaarden. |
| 9 | Data-augmentatie | Augmentatiemethoden en parameterinstellingen, indien van toepassing | Documenteer methoden, waarschijnlijkheden en parameterbereiken. |
| 10 | Modelarchitectuur | Finale modelarchitectuur en configuratie | Documenteer modeltype, lagen/componenten, dimensies en activeringsfuncties. |
| 1 | Hyperparameters | Hyperparameters voor training en optimalisatie | Registreer leerpercentage, batchgrootte, optimizer, epochs, early stopping en afgestelde parameters. |
| 12 | Random seeds | Random seeds gebruikt voor reproduceerbare uitvoering | Registreer seeds voor splitsing, initialisatie en herhaalde runs. |
| 13 | Trainingsconfiguratie | Trainingsprocedure en modelselectiestrategie | Documenteer validatie, checkpointing en modelselectiecriteria. |
| 14 | Evaluatiemetrieken | Vooraf gedefinieerde predictieve en statistische evaluatiemetrieken | Registreer alle gerapporteerde prestatiegegevens. |
| 15 | Betrouwbaarheidsintervallen | Onzekerheidsintervallen voor prestatiegegevens | Documenteer de procedure voor de schatting van het BI en bootstrap-resamples waar van toepassing. |
| 16 | Statistische tests | Statistische procedures voor modelvergelijking | Documenteer de test, statistiek, p-waarde, significantiedrempel en aannames. |
| 17 | Analyse van herhaalde runs | Onafhankelijke uitvoeringen met verschillende random seeds | Registreer het aantal runs en het gemiddelde ± SD van de belangrijkste metrieken. |
| 18 | Configuratie van uitlegbaarheid | Methoden voor uitlegbaarheid en parameterinstellingen | Documenteer SHAP, LIME, Grad-CAM, attention, counterfactual of toepasbare instellingen. |
| 19 | Beoordeling van uitlegbaarheid | Objectieve beoordeling van de betrouwbaarheid en bruikbaarheid van de uitleg | Documenteer getrouwheid, stabiliteit, infidelity, lokalisatie en expertbeoordeling waar van toepassing. |
| 20 | Modelartefacten | Getrainde modelgewichten en configuratiebestanden | Archiveer het finale getrainde model, de architectuur/configuratie en de selectie-informatie. |
| 21 | Beschikbaarheid van code | Code vereist voor preprocessing, training, evaluatie en het genereren van uitleg | Registreer de repository of informatie over gecontroleerde code-toegang, indien van toepassing. |
| 2 | Uitvoeringsdocumentatie | Commando's, scripts, configuratiebestanden en instructies | Registreer de commando's en configuratie die nodig zijn om de workflow te reproduceren. |
| 23 | Uitvoerdocumentatie | Voorspellingen, evaluatieresultaten, figuren en uitlegoutputs | Archiveer gegenereerde outputs en koppel deze aan het corresponderende experiment/run. |
| 24 | Verificatie van reproduceerbaarheid | Verificatie van consistentie over onafhankelijke uitvoeringen | Vergelijk resultaten van herhaalde runs en rapporteer vooraf gedefinieerde variabiliteitsmaten. |
Tabel 7: Reproduceerbaarheidschecklist voor onafhankelijke replicatie van de voorgestelde XAI-workflow. De checklist specificeert de computationele vereisten, dataset, preprocessing, modelontwikkeling, evaluatie, statistische validatie, uitlegbaarheid en documentatie-eisen die nodig zijn om de experimentele workflow te reproduceren.