Methodenartikel

Een reproduceerbaar experimenteel protocol voor het ontwikkelen en evalueren van verklaarbare kunstmatige intelligentiemodellen in gezondheidszorgsystemen

2 weergaven

DOI:

10.3791/73848

15 september 2026

In dit artikel

Samenvatting

Dit protocol presenteert een reproduceerbare workflow voor het ontwikkelen, evalueren en interpreteren van verklaarbare modellen voor kunstmatige intelligentie in de gezondheidszorg. Het integreert gestandaardiseerde datapreparatie, modelontwikkeling, technieken voor verklaarbaarheid, kwantitatieve evaluatie en praktijken voor reproduceerbaarheid om de transparantie, betrouwbaarheid en klinische toepasbaarheid te verbeteren.

Samenvatting

Kunstmatige intelligentie (AI) wordt in toenemende mate aangenomen als een waardevol hulpmiddel voor klinische besluitvorming, ziektevoorspelling, medische diagnose en gepersonaliseerde gezondheidszorg. Echter blijven een gebrek aan transparantie, inconsistente implementatie van methoden voor uitlegbare kunstmatige intelligentie (XAI) en beperkte reproduceerbaarheid belangrijke barrières voor de betrouwbare inzet van AI-modellen in klinische omgevingen. Dit artikel stelt een systematisch, reproduceerbaar en transparant protocol voor voor het ontwikkelen, evalueren en interpreteren van uitlegbare AI-modellen voor toepassingen in de gezondheidszorg. De workflow begint met de configuratie van de computationele omgeving, gevolgd door data-acquisitie en karakterisering, preprocessing, feature engineering, modelontwikkeling, hyperparameteroptimalisatie, evaluatie van de voorspellende prestaties, uitlegbaarheidsanalyse, statistische validatie en reproduceerbaarheidsbeoordeling. Het protocol bevat XAI-methoden zoals SHapley Additive exPlanations (SHAP), Local Interpretable Model-agnostic Explanations (LIME), Gradient-weighted Class Activation Mapping (Grad-CAM), Integrated Gradients, attention-visualisatie en counterfactual explanations om zowel globale als lokale modelinterpretaties te genereren. Het protocol benadrukt verschillende kerncomponenten, waaronder de voorbereiding van gestandaardiseerde datasets voor de gezondheidszorg, de ontwikkeling van stabiele machine learning-modellen, de evaluatie van de voorspellende prestaties, het genereren van klinisch relevante verklaringen en de statistische beoordeling van de reproduceerbaarheid over herhaalde experimenten. Door modelontwikkeling, uitlegbaarheid, kwantitatieve en kwalitatieve evaluatie, statistische validatie en reproduceerbaarheidsbeoordeling te integreren in een uniforme workflow, biedt dit protocol een uitgebreid kader voor de ontwikkeling van transparante en reproduceerbare AI-modellen voor toepassingen in de gezondheidszorg.

Inleiding

AI is een integraal onderdeel geworden van de moderne gezondheidszorg door intelligente analyse van complexe klinische gegevens mogelijk te maken en evidence-based medische besluitvorming te ondersteunen1. De snelle digitalisering van de gezondheidszorg via elektronische patiëntendossiers, medische beeldvormingssystemen, wearables en genomische technologieën heeft geleid tot grote hoeveelheden heterogene data die geavanceerde computationele benaderingen vereisen voor een effectieve interpretatie2.

Algoritmen voor machine learning (ML) en deep learning (DL) hebben opmerkelijke mogelijkheden getoond bij het extraheren van betekenisvolle patronen uit multidimensionale gezondheidszorgdatasets, waardoor de diagnostische nauwkeurigheid, ziektevoorspelling en de beoordeling van patiëntuitkomsten zijn verbeterd3. AI-gebaseerde modellen zijn succesvol toegepast in de radiologie, pathologie, cardiologie, oncologie, oogheelkunde en andere medische specialismen om clinici te ondersteunen bij het detecteren van ziekten in een vroeger stadium en het aanbevelen van gepersonaliseerde behandelstrategieën4. Deze technologieën hebben daarnaast bijgedragen aan workflowoptimalisatie, het verminderen van diagnostische variabiliteit en een verbeterde benutting van middelen in de gezondheidszorg5.

Recente ontwikkelingen in computerhardware, cloudcomputing en open-source AI-frameworks hebben de ontwikkeling en implementatie van intelligente gezondheidszorgapplicaties versneld6. Bijgevolg is AI een belangrijke ondersteunende technologie geworden voor precisiegeneeskunde en klinische beslissingsondersteuningssystemen7. Ondanks deze vorderingen blijft de wijdverbreide adoptie van AI in de routinematige klinische praktijk beperkt, omdat veel hoogpresterende modellen weinig inzicht bieden in hoe hun voorspellingen tot stand komen8.

De meeste deep learning-algoritmen functioneren als complexe black-box-modellen waarin het interne besluitvormingsproces moeilijk te begrijpen is voor clinici en onderzoekers9. Hoewel deze modellen vaak uitstekende voorspellende prestaties leveren, ondermijnt hun gebrek aan transparantie het vertrouwen van de gebruiker en vormt het een uitdaging voor klinische validatie, regelgevende goedkeuring en patiëntveiligheid10. Zorgprofessionals moeten in staat zijn om AI-ondersteunde beslissingen te rechtvaardigen voordat deze worden geïntegreerd in de routinematige klinische praktijk, met name in medische omgevingen met een hoog risico1.

XAI is naar voren gekomen als een effectieve benadering om de transparantie en interpreteerbaarheid van machine learning-modellen te verbeteren12. In plaats van voorspellingsmodellen te behandelen als ondoorzichtige systemen, verschaffen XAI-technieken informatie over de kenmerken, beeldregio's of klinische variabelen die bijdragen aan individuele voorspellingen13. Dergelijke verklaringen stellen clinici in staat om het gedrag van het model beter te begrijpen, potentiële biases te identificeren en vast te stellen of door AI gegenereerde beslissingen consistent zijn met vastgestelde medische kennis14.

Er zijn verschillende technieken voor uitlegbaarheid geïntroduceerd voor toepassingen in de gezondheidszorg. SHapley Additive explanations (SHAP) meten de bijdrage van elke feature aan de modelvoorspelling op basis van coöperatieve speltheorie15. Local Interpretable Model-agnostic Explanations (LIME) maken een vereenvoudigd model en leggen de voorspellingen van het blackbox-model uit16. Voor medische beeldtaken met deep learning-modellen maken Gradient-weighted activation maps (Grad-CAM) heatmaps die visueel de regio's van een afbeelding aangeven die bijdragen aan classificatiebeslissingen17. De combinatie van deze methoden heeft de transparantie van AI-systemen in verschillende domeinen van de gezondheidszorg drastisch verbeterd18.

Ondanks de groeiende aandacht voor uitlegbaarheidsmethoden in de gezondheidszorg, blijft het gebruik ervan in de literatuur gevarieerd. Onderzoekers verschillen niet alleen in het gebruik van preprocessingstrategieën, maar ook in het ontwerp van de modelarchitectuur, de evaluatiemetrieken en zelfs de uitlegtechnieken19. Daarnaast rapporteren veel artikelen een hoge voorspellende nauwkeurigheid, maar laten ze na om een grondige beoordeling te geven van de kwaliteit van de uitleg of de reproduceerbaarheid ervan20.

Reproduceerbaarheid is een van de grootste knelpunten in de moderne AI-wetenschap. In publicaties worden vaak de softwareversie, de computationele omgeving, de preprocessing-pipeline, de hyperparameter-instellingen, de initialisatie van de random seed en de hardwareconfiguraties niet vermeld21. Hierdoor lukt het onafhankelijke onderzoekers vaak niet om gepubliceerde resultaten te reproduceren of de gepubliceerde methoden te verifiëren met behulp van andere datasets of softwareplatforms2. Het gebrek aan gedetailleerde documentatie is een van de factoren die benchmarking-studies, collaboratief onderzoek en de klinische vertaling van AI-systemen belemmeren23.

Gezien deze uitdagingen hebben verschillende organisaties en regelgevende instanties de nadruk gelegd op het belang van transparante, betrouwbare en reproduceerbare AI voor toepassingen in de gezondheidszorg24. Bestaande rapportagerichtlijnen hebben de methodologische verslaglegging verbeterd, maar beschrijven primair wat er gerapporteerd moet worden in plaats van het bieden van gestandaardiseerde experimentele procedures die onderzoekers direct kunnen implementeren25. Bijgevolg blijft er behoefte aan een uitgebreid protocol dat datasetvoorbereiding, modelontwikkeling, analyse van de uitlegbaarheid, statistische evaluatie en reproduceerbaarheidspraktijken integreert in één enkele experimentele workflow26.

Een gestandaardiseerd experimenteel protocol biedt verschillende voordelen voor de healthcare AI-gemeenschap. Bovendien bevordert het methodologische consistentie, vergemakkelijkt het de vergelijking van onafhankelijke studies, vergroot het de transparantie van computationele experimenten en maakt het een betrouwbare validatie van gepubliceerde resultaten mogelijk27. Gestandaardiseerde workflows ondersteunen daarnaast onderwijs/training, collaboratief onderzoek en regelgevende evaluaties door middel van duidelijk gedocumenteerde procedures die reproduceerbaar zijn in verschillende laboratoria en gezondheidsinstellingen28.

Er is een reproduceerbaar experimenteel protocol ontwikkeld en getest voor het trainen en evalueren van AI-modellen in gezondheidszorgsystemen. Het protocol beschrijft standaarden voor het configureren van de computationele omgeving, het voorbewerken van gezondheidszorgdatasets, het ontwikkelen van machine-learningmodellen, het toepassen van XAI-methoden, het evalueren van de predictieve prestaties, het uitvoeren van statistische validatie en het beoordelen van de reproduceerbaarheid29. De integratie van dergelijke componenten in een coherente workflow zal waarschijnlijk de transparantie, betrouwbaarheid en reproduceerbaarheid van AI-onderzoek in de gezondheidszorg vergroten, en helpen bij de ontwikkeling van vertrouwde intelligente gezondheidssystemen30.

Protocol

Het uitgewerkte validatie-experiment maakte gebruik van de publiek toegankelijke, gede-identificeerde Pima Indians Diabetes Dataset en hield geen identificeerbare patiëntgegevens of nieuwe patiëntenwerving in. Daarom waren geïnformeerde toestemming en institutionele IRB/ethische goedkeuring niet vereist, en werden alle analyses uitgevoerd in overeenstemming met de toepasselijke voorwaarden van de dataset en het institutionele onderzoeksbeleid.

Het uitgewerkte validatievoorbeeld maakt gebruik van de publiek beschikbare Pima Indians Diabetes Dataset, die 768 records bevat voor binaire diabetesvoorspelling. De volledige kernworkflow van negen fasen is op deze dataset toegepast. De negen kernfasen bestonden uit datasetselectie en -validatie, configuratie van de computationele omgeving, datapreprocessing, datasetpartitionering, modelontwikkeling en -training, evaluatie van de predictieve en computationele prestaties, uitlegbaarheidsanalyse, statistische validatie en beoordeling van de reproduceerbaarheid. Externe validatie en evaluatie door klinische experts zijn behouden als optionele validatiemodules en zijn in het huidige uitgewerkte voorbeeld niet uitgevoerd. Figuur 1 illustreert de kernworkflow van het protocol, en Tabel 1 vat alleen de negen kernfasen samen die zijn geïmplementeerd in de huidige uitgewerkte validatie; optionele externe validatie en evaluatie door klinische experts worden apart beschreven in het Protocol en zijn niet opgenomen in de negen experimentele fasen.

1. Selecteer en valideer de gezondheidszorgdataset

  1. Selecteer de Pima Indians Diabetes Dataset als de primaire dataset voor het uitgewerkte validatievoorbeeld. Verifieer de bron van de dataset, de steekproefomvang, het voorspellingsdoel, de klassendistributie en de datastructuur.
  2. Pas de vooraf gedefinieerde inclusie-, exclusie- en datakwaliteitscriteria toe. Verwijder dubbele en ongeldige records vóór de modelontwikkeling.
  3. Noteer de bron van de dataset, de kenmerken, de voorspellingsopgave, de klassendistributie, de inclusie- en exclusiecriteria en de partitioneringsstrategie in Tabel 2.
  4. Pas beslissingscriteria toe voor de selectie van de dataset en het model
    1. Definieer het voorspellingsdoel voordat de dataset, modelarchitectuur, voorbewerkingstrategie of uitlegbaarheidsmethode wordt gekozen.
    2. Stem de modaliteit van de dataset af op het voorspellingsdoel. Selecteer tabulaire gegevens voor gestructureerde klinische variabelen, beeldengegevens voor medische beelden, tijdreeksgegevens voor fysiologische signalen, tekstgegevens voor klinische narratieven, of multimodale gegevens wanneer complementaire modaliteiten beschikbaar zijn voor dezelfde patiënt of studie-eenheid.
    3. Evalueer kandidaat-datasets op basis van steekproefomvang, beschikbaarheid van uitkomsten, klassendistributie, ontbrekende gegevens, annotatiekwaliteit, klinische relevantie, volledigheid van de gegevens en toegankelijkheid. Selecteer de dataset die voldoet aan de vooraf gedefinieerde vereisten.
    4. Kies conventionele machine-learning-modellen voor gestructureerde tabulaire gegevens wanneer de steekproefomvang, rekenmiddelen of interpreteerbaarheidseisen het gebruik van complexe architecturen beperken. Kies deep-learning-architecturen wanneer er voldoende trainingsgegevens en hoogdimensionale inputs beschikbaar zijn, zoals medische beelden, fysiologische signalen of klinische tekst.
    5. Selecteer multimodale architecturen alleen wanneer meerdere modaliteiten beschikbaar zijn voor dezelfde patiënt of studie-eenheid en betrouwbaar kunnen worden uitgelijnd zonder informatielekkage te introduceren. Kies voorbewerkingsbewerkingen op basis van de kenmerken van de geselecteerde datamodaliteit.
    6. Selecteer uitlegbaarheidsmethoden op basis van het model en de datamodaliteit. Gebruik model-agnostische methoden zoals SHAP of LIME voor geschikte tabulaire modellen en modaliteitspecifieke methoden zoals Grad-CAM voor beeldgebaseerde modellen, indien van toepassing.
    7. Documenteer de rationele onderbouwing voor de selecties van de dataset, de voorbewerkingstrategie, het model en de uitlegbaarheidsmethode. Bewaar deze beslissingen als onderdeel van het reproduceerbaarheidsverslag.

2. Configureer de computationele omgeving voor de ontwikkeling van het XAI-model

  1. Configureer het besturingssysteem, de CPU, het RAM-geheugen, de opslag en de GPU volgens de vereisten van het geselecteerde model. Maak een geïsoleerde Python-omgeving aan en installeer de vereiste libraries voor machine learning, deep learning, statistiek, visualisatie en XAI.
  2. Registreer de feitelijke computationele omgeving, de modelarchitectuur en de hyperparameters die zijn gebruikt voor de uitgevoerde validatie in Tabel 3. Specificeer de optimizer, de learning rate, de batch size, het maximale aantal epochs, de loss-functie, de regularisatieparameters, de validatiestrategie, de early-stopping-configuratie, de random-seed-configuratie, de explainability-methoden, de hardware, het besturingssysteem, de Python-versie en de relevante versies van de software-libraries. Maak een duidelijk onderscheid tussen deze experimenteel gebruikte instellingen en de algemene of aanbevolen protocolinstellingen.
  3. Gebruik de in Tabel 3 vermelde configuratie bij het reproduceren van de validatie van de Pima Indians Diabetes Dataset en de bijbehorende predictieve, explainability, statistische en reproduceerbaarheidsresultaten.
  4. Voer een validatiescript uit om de succesvolle import van packages, het laden van de dataset, de modeluitvoering en de generatie van output te bevestigen. Bewaar de definitieve configuratie van de omgeving voor de reproduceerbaarheid.

3. Gezondheidszorgdatasets voorbereiden en karakteriseren voor de ontwikkeling van XAI-modellen

  1. Selecteer en verkrijg de gezondheidszorgdataset
    1. Selecteer een zorgdataset die geschikt is voor de gedefinieerde klinische voorspellingsopgave. Evalueer kandidaatdatasets op basis van het onderzoeksdoel, het datatype, de steekproefomvang, de annotatiekwaliteit, de klassenbalans en de klinische relevantie.
    2. Geef de voorkeur aan publiek beschikbare benchmarkdatasets wanneer deze de voorspellingstaak adequaat adresseren en onafhankelijke validatie faciliteren.
    3. Verkrijg de benodigde ethische goedkeuringen, institutionele toestemmingen en autorisatie voor gegevensacces voordat institutionele datasets of interne datasets worden verzameld. Verkrijg de geselecteerde dataset uit een geverifieerd depot of een geautoriseerde institutionele database.
    4. Bewaar de oorspronkelijke datasetbestanden zonder wijzigingen en leg de datasetprovider, versie, acquisitie-informatie, licentievoorwaarden, inclusiecriteria, exclusiecriteria en bijbehorende metadata vast. Organiseer de dataset in afzonderlijke mappen voor ruwe gegevens, annotaties, metadata en aanvullende informatie.
  2. Karakteriseer de dataset voor de gezondheidszorg
    1. Identificeer de predictoren, uitkomstlabels, kenmerktypen, datamodaliteiten en klassenverdelingen. Bepaal het aantal proefpersonen, monsters, kenmerkdimensies en beschikbare annotaties.
    2. Bevestig dat de kenmerken van de dataset compatibel zijn met de geselecteerde AI-methode.
    3. Gebruik de Pima Indians Diabetes Dataset als de enige uitgewerkte experimentele dataset voor het valideren van het negenstaps kernprotocol. Voeg de aanvullende datasets toe die vermeld staan in Tabel 2 uitsluitend om de toepasbaarheid van het algemene protocol aan te tonen over klinische tabulaire gegevens, elektronische gezondheidsdossiers, dermoscopische beelden, fysiologische tijdreeksgegevens en medische beeldvorming. Gebruik deze aanvullende datasets niet voor modeltraining, testen, statistische validatie of het genereren van de gerapporteerde experimentele resultaten.
  3. Beoordeel de datasetkwaliteit
    1. Inspecteer de dataset op dubbele records, corrupte bestanden, ontbrekende waarden, annotatiefouten en onregelmatige gegevensvermeldingen. Verwijder bevestigde dubbele records en corrigeer geverifieerde onregelmatigheden in de opmaak. Documenteer alle kwaliteitscontroleprocedures van de dataset.
    2. Verifieer de correspondentie van beeldvormings-, klinische, laboratorium- en fysiologische gegevens via proefpersoon-identificatoren bij het gebruik van multimodale datasets.
    3. Verwijder dubbele of inconsistente records, behandel ontbrekende waarden, standaardiseer numerieke kenmerken, codeer categorische variabelen en pas modaliteitsspecifieke preprocessing toe. Verdeel de dataset in onafhankelijke trainings-, validatie- en testsets. Raadpleeg Figuur 2 voor de workflow voor de voorbereiding, voorbewerking, partitionering en kwaliteitsbeoordeling van datasets uit de gezondheidszorg.
  4. Waarborg gegevensprivacy en ethische naleving
    1. Verwijder direct identificerende gegevens uit zorggegevens. Pas anonimiserings- of pseudonimiseringsprocedures toe wanneer dit vereist is. Behandel patiëntgezondheidsinformatie in overeenstemming met de geldende ethische eisen, gegevensbescherming, geïnformeerde toestemming en institutionele vereisten.
    2. Leg de toepasselijke ethische goedkeuring, vrijstelling, data-governanceprocedures, anonimiseringsmethoden en de workflow voor de datasetvoorbereiding vast.
    3. Beoordeel potentiële algoritmische bias door de prestaties van het model te vergelijken tussen relevante demografische of klinische subgroepen, wanneer dergelijke informatie beschikbaar is en ethisch is toegestaan.
    4. Documenteer het beoogde gebruik, de doelpopulatie, de beperkingen van het model, potentiële foutmodi, de vereisten voor menselijk toezicht en de toepasselijke ethische vereisten, vereisten voor gegevensbescherming en regelgeving op het gebied van de gezondheidszorg.
    5. Leg vastgestelde beperkingen op het gebied van rechtvaardigheid en overwegingen met betrekking tot verantwoordelijke AI als onderdeel van de definitieve modeldocumentatie.
      OPMERKING: Verkrijg een gestandaardiseerde en gedocumenteerde dataset uit de gezondheidszorg die geschikt is voor de ontwikkeling van AI-modellen, ethisch compliant is en vrij is van grote geïdentificeerde inconsistenties.

4. Voorbereiden en partitioneren van gezondheidszorggegevens voor training van het AI-model

  1. Voer kwaliteitscontrole uit
    1. Inspecteer de dataset op dubbele records, ontbrekende waarden, ongeldige waarden, inconsistente labels, uitschieters en corrupte bestanden.
    2. Verwijder of corrigeer ongeldige waarnemingen volgens vooraf gedefinieerde criteria en leg alle uitsluitingen vast. Verifieer de consistentie van de predictoren en de uitkomstlabels.
  2. Behandel ontbrekende gegevens
    1. Kwantificeer de hoeveelheid ontbrekende gegevens per variabele. Pas de vooraf gedefinieerde imputatie- of uitsluitingsstrategie toe.
    2. Schat de imputatieparameters uitsluitend met behulp van de trainingsgegevens en pas de gefitte transformatie toe op de validatie- en testgegevens.
  3. Normaliseer en transformeer gegevens
    1. Pas feature scaling, normalisatie, encoding, dimensionaliteitsreductie of andere transformaties toe die vereist zijn door het geselecteerde model. Fit alle gegevensafhankelijke transformaties uitsluitend met behulp van de trainingsgegevens.
    2. Pas de gefitte transformaties ongewijzigd toe op de validatie- en testgegevens.
  4. Kwantificeer de klassenonbalans in de trainingsgegevens. Pas klassenweging, SMOTE, oversampling of augmentatie uitsluitend toe op de trainingsdataset. Behoud de oorspronkelijke distributie van de validatie- en testdatasets.
  5. Bevestig dat er geen enkel subject, dubbele waarneming, geaugmenteerd monster, preprocessing-statistiek, feature-selectiecriterium of synthetisch monster wordt gedeeld tussen de trainings- en evaluatiepartities.

5. Ontwikkel en configureer het XAI-model

  1. Definieer de modelarchitectuur door de modaliteiten van de invoergegevens, voorbewerkingoperaties, modaliteitsspecifieke kenmerkencodeerders, het mechanisme voor kenmerkenfusie, de voorspellingslaag en de module voor uitlegbaarheid te specificeren.
  2. Selecteer de machine learning- of deep learning-architectuur op basis van de voorspellingstaak en de invoermodaliteit. Configureer de invoerlaag, de componenten voor kenmerkextractie, de verborgen lagen, de uitvoerlaag en de activeringsfuncties. Definieer de optimizer, de leersnelheid, de batchgrootte, de verliesfunctie, het aantal epochs, de regularisatie, dropout, early stopping en het schema voor de leersnelheid.
  3. Optimaliseer de hyperparameters uitsluitend met behulp van de trainings- en validatiegegevens.
  4. Noteer de definitieve architectuur en hyperparameterconfiguratie in Tabel 3.
  5. Verifieer de compatibiliteit van de invoer-uitvoerdimensies vóór de training.
    OPMERKING: Stel een volledig geconfigureerd XAI-model op dat een geschikte architectuur, gedefinieerde hyperparameters en geïntegreerde technieken voor uitlegbaarheid bevat.

6. Het XAI-model trainen, optimaliseren en bewaren

  1. Laad de vooraf gedefinieerde trainings- en validatiesets en de definitieve modelconfiguratie. Initialiseer het model met de vooraf gedefinieerde random seed en trainingsparameters.
  2. Train het model met de gespecificeerde optimizer, verliesfunctie, batchgrootte en stopcriteria.
  3. Monitor de validatieprestaties en behoud het checkpoint dat overeenkomt met het vooraf gedefinieerde modelselectiecriterium. Evalueer het geselecteerde checkpoint op de onafhankelijke testdataset zonder verdere optimalisatie.
  4. Sla het getrainde model, de preprocessingconfiguratie, de hyperparameters, de random seed en het trainingslogboek op.
    OPMERKING: Verkrijg een geoptimaliseerd XAI-model dat is getraind en gevalideerd met de voorbereide gezondheidszorgdataset. Bewaar het best presterende model, de hyperparameters, de trainingslogs, de preprocessingconfiguratie en de computationele omgeving voor reproduceerbaarheid.

7. Evalueer de voorspellende en computationele prestaties

  1. Beoordeel de predictieve prestaties
    1. Laad het geoptimaliseerde model en de onafhankelijke testdataset na voltooiing van de modeltraining en hyperparameteroptimalisatie. Houd de getrainde modelparameters en de preprocessing-pipeline tijdens het testen ongewijzigd.
    2. Genereer voorspellingen voor alle monsters in de testdataset. Vergelijk de voorspelde output met de overeenkomstige ground-truth labels.
  2. Bereken prestatie-metrieken
    1. Selecteer evaluatiemetrieken op basis van het type predictietaak.
    2. Bereken, indien van toepassing, nauwkeurigheid, precisie, recall, specificiteit, F1-score, gebalanceerde nauwkeurigheid, de Matthews-correlatiecoëfficiënt (MCC) en de area under the receiver operating characteristic curve (AUC-ROC) voor classificatietaken. Bereken, indien van toepassing, de gemiddelde absolute fout (MAE), de root mean square error (RMSE), de determinatiecoëfficiënt (R2) en andere relevante maten voor regressietaken.
  3. Beoordeel modelgeneralisatie en robuustheid
    1. Evalueer het model met behulp van een externe dataset die onafhankelijk van de ontwikkelingsdataset is verzameld, indien dergelijke gegevens beschikbaar zijn.
    2. Geef de voorkeur aan externe datasets afkomstig van een andere zorginstelling, geografische regio of patiëntenpopulatie om de transportabiliteit te beoordelen.
    3. Voer temporele validatie uit met gegevens die in een latere periode zijn verzameld wanneer longitudinale datasets beschikbaar zijn.
    4. Voer multicenter-validatie uit door het definitieve model afzonderlijk te evalueren over de deelnemende instellingen wanneer multicenter-gegevens beschikbaar zijn.
    5. Voer geografische validatie uit met behulp van een onafhankelijke populatie uit een andere geografische regio indien haalbaar.
    6. Rapporteer prestatieverschillen en betrouwbaarheidsintervallen tussen de ontwikkelings- en externe datasets.
  4. Beoordeel de computationele prestaties
    1. Meet de modeltrainingstijd binnen de vooraf gedefinieerde computationele omgeving, de inferentie- en testtijd onder identieke computationele omstandigheden, en het geheugengebruik, de modelgrootte en de hardwarebenutting.
    2. Herhaal computationele metingen over onafhankelijke runs.
    3. Bereken de gemiddelde uitvoeringstijd om het effect van experimentele variabiliteit te verminderen.
  5. Vergelijk modelprestaties
    1. Selecteer geschikte conventionele machine learning- of deep learning-methoden voor comparatieve evaluatie.
    2. Evalueer het voorgestelde XAI-model en de vergelijkingsmodellen met behulp van dezelfde dataset. Pas identieke preprocessing-procedures en evaluatiemetrieken toe op alle vergelijkingsmodellen.
    3. Voer alle comparatieve experimenten uit binnen dezelfde computationele omgeving.
      OPMERKING: Verkrijg experimenteel bewijs van predictieve stabiliteit en reproduceerbaarheid onder de geteste computationele omstandigheden en dataset.

8. XAI-outputs genereren en evalueren

  1. Modeluitleg genereren
    1. Laad het geoptimaliseerde XAI-model. Selecteer evaluatiesamples die niet zijn gebruikt voor de modeltraining. Pas de vooraf gedefinieerde uitlegbaarheidsmethoden toe zonder het getrainde model of de preprocessing-pipeline te wijzigen.
    2. Globale en lokale modeluitleg genereren
      1. Genereer globale uitleg om het algemene gedrag van het voorspellende model te karakteriseren.
      2. Genereer lokale uitleg om individuele modelvoorspellingen te karakteriseren.
      3. Pas SHAP toe op de Pima Indians Diabetes Dataset om globale en lokale uitleg van de tabulaire modelvoorspellingen te genereren.
      4. Genereer een SHAP-summary plot om de algemene richting en grootte van de feature-bijdragen te visualiseren.
      5. Genereer een SHAP-feature-importance plot met behulp van gemiddelde absolute SHAP-waarden om features te rangschikken op basis van hun algemene bijdrage aan de modelvoorspellingen.
      6. Genereer een SHAP-waterfall plot voor een representatieve voorspelling uit de testset om patiëntspecifieke feature-bijdragen te illustreren.
      7. Genereer een SHAP-feature-dependence plot om de relatie tussen een geselecteerde feature en de bijdrage ervan aan de modeloutput te onderzoeken.
      8. Pas LIME toe op representatieve voorspellingen uit de testset om lokale uitleg van individuele modelvoorspellingen te genereren.
      9. Genereer een patiëntspecifieke counterfactual-uitleg om de feature-wijzigingen te illustreren die gepaard gaan met een verandering in de voorspelde uitkomst.
      10. Selecteer aanvullende uitlegbaarheidstechnieken op basis van de datamodaliteit en de modelarchitectuur.
      11. Gebruik Grad-CAM of saliency maps voor compatibele image-based modellen, attention-visualisaties voor transformer-gebaseerde architecturen en Integrated Gradients voor differentieerbare modellen indien van toepassing.
      12. Behandel Grad-CAM, saliency mapping, attention-visualisatie en Integrated Gradients als algemene, modaliteitsafhankelijke protocolopties, en interpreteer of rapporteer deze niet als experimentele resultaten van de validatie van de Pima Indians Diabetes Dataset, tenzij de overeenkomstige analyses daadwerkelijk zijn uitgevoerd.
    3. Uitlegbaarheidsmethoden toepassen op de uitgewerkte Pima-validatie
      1. Pas SHAP en LIME toe op de Pima Indians Diabetes Dataset om globale en lokale uitleg van de tabulaire modelvoorspellingen te genereren.
      2. Genereer SHAP-summary, feature-importance, waterfall- en feature-dependence visualisaties vanuit de Pima-validatieresultaten.
      3. Genereer een LIME-lokale uitleg voor representatieve voorspellingen uit de testset.
      4. Genereer een patiëntspecifieke counterfactual-uitleg om de feature-wijzigingen te illustreren die gepaard gaan met een verandering in de modelvoorspelling.
      5. Behandel Grad-CAM, attention-visualisatie, saliency mapping en Integrated Gradients als modaliteitsafhankelijke uitlegbaarheidsopties voor andere typen zorggegevens en modelarchitecturen.
      6. Rapporteer Grad-CAM, attention-visualisatie, saliency mapping of Integrated Gradients niet als experimentele bevindingen van de uitgewerkte Pima-validatie, tenzij de overeenkomstige analyses daadwerkelijk zijn uitgevoerd.
  2. Kwaliteit van de uitleg evalueren
    1. Beoordeel of de gegenereerde uitleg het voorspellingsproces van het model weerspiegelt. Evalueer de stabiliteit van de uitleg over herhaalde experimentele runs en de consistentie van de uitlegoutput onder identieke computationele omstandigheden.
    2. Beoordeel de gevoeligheid van de uitlegoutput voor wijzigingen in de inputgegevens indien van toepassing. Vergelijk de gegenereerde uitleg met beschikbare domeinkennis of expertinterpretaties.
    3. Identificeer voorspellende features of anatomische regio's die overeenkomen met gevestigde medische kennis wanneer dergelijke vergelijkingen beschikbaar zijn.
    4. Leg de mate van overeenstemming of onenigheid vast tussen de gegenereerde uitleg en de beschikbare klinische interpretatie.
  3. Voorspellingsonzekerheid kwantificeren
    1. Genereer schattingen van de voorspellingsbetrouwbaarheid voor de geëvalueerde samples met behulp van een methode voor onzekerheidsschatting die geschikt is voor de geselecteerde modelarchitectuur en zorgtoepassing.
    2. Pas Monte Carlo-dropout, ensemble-gebaseerde voorspelling, Bayesiaanse inferentie, conformal prediction of een andere gevalideerde benadering voor onzekerheidsschatting toe waar passend.
    3. Herhaal stochastische voorspellingsruns bij gebruik van Monte Carlo-dropout en bereken de gemiddelde voorspelling en voorspellingsvariantie voor elk evaluatiesample.
    4. Rapporteer de voorspellingsbetrouwbaarheid of onzekerheidsintervallen samen met de overeenkomstige modelvoorspellingen.
    5. Evalueer of onzekerheidsschattingen voorspellingen identificeren die geassocieerd zijn met een lagere betrouwbaarheid of een verhoogde voorspellingsfout. Bewaar de methode voor onzekerheidsschatting, parameters, random seeds en gegenereerde onzekerheidsoutputs om reproduceerbaarheid te garanderen.
  4. Uitlegbaarheidsoutputs documenteren en bewaren
    1. Sla alle gegenereerde feature-importance scores, heatmaps, saliency maps, attention-visualisaties en patiëntspecifieke interpretaties op. Sla de uitlegbaarheidsoutputs op met behulp van gestandaardiseerde bestandsformaten. Archiveer de outputs samen met het getrainde model en de preprocessing-configuratie.
    2. Leg de computationele instellingen, uitlegparameters, executietijd en softwareversies vast die zijn gebruikt voor het genereren van de uitleg. Bewaar de volledige documentatie van de uitlegbaarheid om onafhankelijke review en reproduceerbaarheid te vergemakkelijken.
  5. Kwaliteit van de uitleg kwantitatief evalueren
    1. Evalueer de getrouwheid (faithfulness) van de uitleg door de features die als belangrijk zijn geïdentificeerd systematisch te perturberen of te maskeren en de overeenkomstige verandering in de modeloutput te meten. Bereken een score voor de getrouwheid van de uitleg door de grootte van de attributie te vergelijken met de resulterende verandering in de modelvoorspelling.
    2. Evalueer de stabiliteit van de uitleg door uitleg te genereren voor herhaalde runs, geperturbeerde inputs of klinisch vergelijkbare samples en de gelijkenis tussen de resulterende attributiepatronen te berekenen. Bereken de infidelity door de discrepantie te meten tussen de voorspelde outputverandering en de verandering geschat op basis van de attributie van de uitleg onder gecontroleerde inputperturbaties.
    3. Evalueer voor uitleg van medische beelden de lokalisatienauwkeurigheid met behulp van een door een expert gedefinieerde region of interest wanneer referentie-annotaties beschikbaar zijn. Beoordeel het klinisch nut door onafhankelijke evaluaties te verkrijgen van gekwalificeerde klinische experts met behulp van vooraf gedefinieerde interpretatiecriteria.
    4. Bereken de kappa van Cohen of de kappa van Fleiss wanneer meerdere experts onafhankelijk de relevantie of overeenstemming van de uitleg evalueren.
      OPMERKING: Genereer globale en lokale uitleg die het voorspellende gedrag van het getrainde AI-model karakteriseert. Bewaar de uitlegbaarheidsoutputs en overeenkomstige configuraties voor transparante interpretatie en reproduceerbare evaluatie.

9. Voer statistische validatie en reproduceerbaarheidsbeoordeling uit

  1. Voer statistische validatie uit
    1. Selecteer statistische methoden op basis van het studiedoel, het experimentele ontwerp, de datadistributie en de kenmerken van de geëvalueerde variabelen.
    2. Rapporteer continue variabelen als het gemiddelde ± standaarddeviatie of als de mediaan en interkwartielafstand, naar gelang van de situatie, en categorische variabelen als aantallen en percentages.
    3. Voer vijfvoudige kruisvalidatie uit op de trainingsset om de stabiliteit van de modelprestaties te beoordelen en rapporteer de nauwkeurigheid, AUC-ROC, precisie, recall en F1-score als gemiddelde ± standaarddeviatie over de folds. Schat 95% betrouwbaarheidsintervallen voor de prestatiegegevens van de onafhankelijke testset met behulp van 1.0 bootstrap-resamples.
    4. Vergelijk het voorgestelde model met de CNN, Random Forest en SVM baseline-modellen met behulp van de McNemar-test voor gepaarde vergelijkingen van de nauwkeurigheid, de DeLong-test voor gecorreleerde AUC-ROC-vergelijkingen en gepaarde bootstrap-testen met 1.0 resamples voor vergelijkingen van de F1-score.
    5. Rapporteer de overeenkomstige toetsingsstatistiek en de exacte p-waarde voor elke vergelijking en gebruik een tweezijdige significantieniveaus van α = 0.05.
  2. Vergelijk modelprestaties statistisch
    1. Vergelijk het voorgestelde explainable AI-model met de geselecteerde state-of-the-art machine learning en deep learning baseline-modellen.
    2. Pas de Student's t-toets of de Mann-Whitney U-toets toe bij het vergelijken van twee groepen, naar gelang de situatie. Pas eenweg-ANOVA toe voor toepasbare parametrische vergelijkingen met meer dan twee groepen. Pas de Kruskal-Wallis-toets toe voor toepasbare non-parametrische vergelijkingen met meer dan twee groepen.
    3. Beschouw p < 0.05 als statistisch significant, zoals gespecificeerd in het oorspronkelijke manuscript.
    4. Gebruik een tweezijdig significantieniveau van α = 0.05 voor alle vooraf gedefinieerde statistische vergelijkingen en rapporteer de overeenkomstige toetsingsstatistieken en p-waarden.
    5. Rapporteer 95% betrouwbaarheidsintervallen voor de belangrijkste voorspellende prestatiegegevens.
    6. Gebruik bootstrap-resampling om betrouwbaarheidsintervallen voor prestatiematen te schatten wanneer dat gepast is. Gebruik de DeLong-test om gecorreleerde ROC-AUC-waarden te vergelijken wanneer dezelfde subjecten door twee modellen worden geëvalueerd. Gebruik de McNemar-test om gepaarde categorische classificatieresultaten te vergelijken die voor dezelfde subjecten zijn gegenereerd. Gebruik gepaarde bootstrap-procedures om de F1-score of andere afgeleide prestatiematen te vergelijken wanneer dat gepast is.
    7. Evalueer de kalibratie met behulp van kalibratieplots, kalibratieshelling/intercept en de Brier-score wanneer probabilistische voorspellingen beschikbaar zijn.
    8. Gebruik voor de uitgewerkte validatie van de Pima Indians Diabetes Dataset de vooraf gedefinieerde gepaarde statistische vergelijking die is gespecificeerd voor het voorgestelde model en de baseline-modellen. Pas de geselecteerde toets consistent toe op de gepaarde voorspellingen van de testset of de prestatiemetingen van herhaalde runs, naar gelang de vergelijking. Gebruik een tweezijdig significantieniveau van α = 0.05 en rapporteer de toetsingsstatistiek en de exacte p-waarde. Rapporteer geen alternatieve statistische toetsen als zijnde uitgevoerd, tenzij de resultaten daarvan in de sectie Resultaten worden gepresenteerd.
    9. Pas tweezijdige toetsen toe en interpreteer statistische significantie met een vooraf gedefinieerde drempelwaarde van p < 0.05.
  3. Evalueer modelrobuustheid
    1. Herhaal de volledige trainings- en evaluatieprocedure 10 keer met verschillende random seeds, terwijl de vooraf gedefinieerde dataset-partitionering, preprocessingsprocedures, modelarchitectuur, hyperparameters, softwareomgeving en evaluatieprotocol gehandhaafd blijven.
    2. Leg de AUC-ROC, nauwkeurigheid en F1-score vast voor elke onafhankelijke run en rapporteer het gemiddelde ± standaarddeviatie over de 10 runs.
    3. Vergelijk de resulterende prestatiewaarden over de herhaalde runs om de voorspellende stabiliteit en reproduceerbaarheid onder verschillende willekeurige initialisaties te beoordelen.
  4. Evalueer reproduceerbaarheid van de uitlegbaarheid
    1. Genereer feature-attributies, attention-maps of andere uitleguitgangen over meerdere experimentele runs wanneer een beoordeling van de stabiliteit van de uitleg is opgenomen. Vergelijk de uitleguitgangen kwantitatief over herhaalde runs met behulp van een geschikte overeenkomstmaat op basis van gelijkenis of rangorde.
    2. Rapporteer voor de huidige uitgewerkte validatie van de Pima Indians Diabetes Dataset geen kwantitatieve metrieken voor de stabiliteit van de uitleg, tenzij de overeenkomstige herhaalde uitleguitgangen en analyses zijn uitgevoerd.
    3. Evalueer de overeenstemming tussen model-gegenereerde uitleg en interpretaties door clinici wanneer passende klinische evaluaties beschikbaar zijn. Bereken de kappa van Cohen of de kappa van Fleiss, naar gelang de situatie, om de overeenstemming tussen beoordelaars te evalueren.
  5. Documenteer reproduceerbaarheid
    1. Bewaar de ruwe data, preprocessingsprocedures, broncode, getrainde modellen, hyperparameterconfiguraties, uitlegbaarheidsuitgangen, statistische analysescripts en gegenereerde resultaten.
    2. Leg de softwareomgeving en hardwareconfiguratie vast die gedurende de workflow zijn gebruikt. Voer de volledige workflow onafhankelijk opnieuw uit met behulp van de gearchiveerde bestanden en configuraties.
    3. Vergelijk de gerepliceerde voorspellende prestaties met de oorspronkelijke experimentele resultaten, en de gerepliceerde modeluitleg met de oorspronkelijke uitlegbaarheidsuitgangen.
    4. Leg eventuele verschillen vast die tijdens de replicatie zijn waargenomen. Werk de experimentele documentatie bij om de reproduceerbaarheidsobservaties weer te geven die tijdens de onafhankelijke uitvoering zijn geïdentificeerd.
      OPMERKING: Verkrijg statistisch gevalideerde resultaten voor voorspellende prestaties en uitlegbaarheid die over herhaalde experimenten kunnen worden geëvalueerd. Bewaar voldoende computationele, analytische en methodologische documentatie om onafhankelijke verificatie van de volledige workflow mogelijk te maken.
  6. Checklist voor reproduceerbaarheid
    1. Leg de datasetnaam, versie, acquisitiedatum, bron, inclusiecriteria, exclusiecriteria en het uiteindelijke steekproefaantal vast. Leg alle preprocessing-operaties, transformatieparameters, normalisatie-instellingen, feature-selectieprocedures en regels voor dataset-partitionering vast.
    2. Leg het besturingssysteem, de CPU, GPU, RAM, Python-versie, framework-versies en bibliotheekversies vast. Leg alle specificaties van de modelarchitectuur en hyperparameters vast.
    3. Leg de optimizer, learning rate, batch size, het aantal epochs, de verliesfunctie, regularisatie en early-stopping-criteria vast. Leg alle random seeds en instellingen van de random-number-generator vast.
    4. Bewaar getrainde modelgewichten en preprocessing-configuraties. Bewaar trainingslogs, evaluatiescripts, statistische analysescripts en uitlegbaarheidsuitgangen. Leg de model- en softwareversies vast die zijn gebruikt voor de definitieve experimenten.
    5. Bewaar de volledige computationele omgeving die nodig is voor onafhankelijke replicatie.
    6. Documenteer de beschikbaarheid van broncode, datasets, modelgewichten en ondersteunende materialen, onderworpen aan ethische, wettelijke, licentie- en privacyrestricties.
    7. Voer de gearchiveerde workflow onafhankelijk opnieuw uit en vergelijk de gerepliceerde resultaten met de oorspronkelijke resultaten.
    8. Documenteer de volledige reproduceerbaarheidseisen met behulp van de gestandaardiseerde checklist.

Resultaten

Het voorgestelde XAI-framework is geïmplementeerd met behulp van de Pima Indians Diabetes Dataset als representatieve dataset voor de gezondheidszorg. De Pima Indians Diabetes Dataset werd gebruikt als enige dataset voor experimentele validatie. Alle gerapporteerde resultaten met betrekking tot voorspellend vermogen, uitlegbaarheid, statistiek en reproduceerbaarheid zijn gegenereerd vanuit deze dataset. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM100, OhioT1DM en BraTS 2021 zijn niet experimenteel geëvalueerd en zijn enkel opgenomen als voorbeelden om de toepasbaarheid van het algemene protocol op verschillende modaliteiten van gezondheidszorggegevens te illustreren. De volledige dataset werd gebruikt nadat ongeldige en dubbele records waren verwijderd, en de gespecificeerde voorbewerkingoperaties werden uitgevoerd vóór de modelontwikkeling. De dataset werd verdeeld in onafhankelijke trainings-, validatie- en testsubsets met behulp van een vooraf gedefinieerde gestratificeerde splitsingsstrategie. De onafhankelijkheid van monsters over de drie subsets werd gehandhaafd om de mogelijkheid van datalekkage te minimaliseren.

Het predictieve model werd geconfigureerd met de vooraf gedefinieerde architectuur en hyperparameters. Het model werd getraind met de Adam-optimizer, waarbij de vooraf gedefinieerde leerfrequentie en batchgrootte werden gehanteerd voor maximaal 10 epochs. Er werd vroegstop toegepast op basis van het validatieverlies, en het model met de beste validatieprestaties werd behouden. Voor de partitionering van de dataset, de modelinitialisatie en herhaalde experimenten werden random seeds opgegeven om de reproduceerbaarheid te verbeteren.

Het getrainde model werd geëvalueerd op de onafhankelijke testset aan de hand van nauwkeurigheid, precisie, recall, specificiteit, F1-score, de Matthews-correlatiecoëfficiënt (MCC), het oppervlak onder de receiver operating characteristic-curve (AUC-ROC) en de gemiddelde precisie (AP). Het voorgestelde model werd vergeleken met de vooraf gedefinieerde basismodellen met gebruik van identieke preprocessing-procedures, datapartities en evaluatieprotocollen. Receiver operating characteristic (ROC)-curves, precisie-recall-curves en een confusiematrix werden gegenereerd op basis van de voorspellingen van de onafhankelijke testset.

Om de stabiliteit van de prestaties te beoordelen, werd een vijfvoudige kruisvalidatie uitgevoerd op de trainingsgegevens. Er werden 95% betrouwbaarheidsintervallen geschat voor de belangrijkste prestatiematrices, en er werden vooraf gedefinieerde statistische vergelijkingen uitgevoerd tussen het voorgestelde model en de basismodellen.

Vijfvoudige kruisvalidatie leverde een nauwkeurigheid op van 93,01 ± 0,48%, een AUC-ROC van 0,954 ± 0,07, een precisie van 92,42 ± 0,87%, een recall van 93,02 ± 0,45% en een F1-score van 92,72 ± 0,62%. De 95% bootstrap-betrouwbaarheidsintervallen geschat op basis van 1.0 resamples waren 0,897–0,973 voor de nauwkeurigheid, 0,890–0,970 voor de precisie, 0,80–0,963 voor de recall, 0,87–0,965 voor de F1-score en 0,931–0,984 voor de AUC-ROC. Statistische vergelijkingen met de CNN-, Random Forest- en SVM-baselinemodellen werden uitgevoerd met de McNemar-test voor nauwkeurigheid, de DeLong-test voor AUC-ROC en gepaarde bootstrap-testen met 1.0 resamples voor de F1-score.

De volledige trainings- en evaluatieprocedure werd herhaald over 10 onafhankelijke runs met verschillende random seeds. De herhaalde runs resulteerden in een AUC-ROC van 0,957 ± 0,008, een nauwkeurigheid van 93,24 ± 0,74% en een F1-score van 92,35 ± 0,92%, wat wijst op een relatief lage variabiliteit over de herhaalde uitvoeringen. De prestatiemetrieken die over de herhaalde uitvoeringen zijn verkregen, werden samengevat met behulp van het gemiddelde en de standaarddeviatie. De variabiliteit tussen de runs werd onderzocht om vast te stellen of de voorspellende prestaties stabiel bleven bij herhaalde uitvoering.

Externe validatie is in het huidige praktijkvoorbeeld niet uitgevoerd omdat er geen onafhankelijke externe dataset is gebruikt. Bijgevolg zijn alle gerapporteerde predictieve, statistische en reproduceerbaarheidsresultaten verkregen uit de Pima Indians Diabetes Dataset met behulp van de vooraf gedefinieerde training-, validatie- en onafhankelijke testpartities. Externe validatie is in het protocol behouden als een optionele procedure voor toepassingen waarbij een onafhankelijke dataset van een andere instelling, populatie, geografische regio of tijdsperiode beschikbaar is.

Modeluitleg werd gegenereerd met behulp van explainability-technieken die toepasbaar zijn op de tabulaire Pima Indians Diabetes Dataset, waaronder SHAP en LIME. De globale feature-belangrijkheid werd geëvalueerd en patiëntspecifieke lokale uitleg werd gegenereerd met behulp van aparte testsamples. De resultaten van de uitleg werden samen met de bijbehorende modelvoorspellingen en feature-waarden geregistreerd om de reproduceerbaarheid en daaropvolgende interpretatie te vergemakkelijken.

Voor de duidelijkheid bestond het huidige uitgewerkte voorbeeld uit de negen kernfasen van de workflow die in Tabel 1 zijn geïdentificeerd. Externe validatie en evaluatie door klinische experts werden behouden als optionele validatiemodules van het algemene protocol. Externe validatie werd niet uitgevoerd omdat er geen onafhankelijke externe dataset is gebruikt, en evaluatie door klinische experts werd niet uitgevoerd omdat er geen formeel expert-evaluatiepaneel was opgenomen in het huidige uitgewerkte voorbeeld. Bijgevolg worden deze optionele modules niet beschouwd als onderdeel van de negenfasige experimentele workflow en worden ze niet gerapporteerd als experimentele resultaten.

De procedures voor preprocessing en dataset-partitionering leverden een gestandaardiseerde dataset op die geschikt is voor modelontwikkeling. Dubbele en inconsistente records werden verwijderd, ontbrekende waarden werden behandeld volgens de vooraf gedefinieerde strategie, numerieke kenmerken werden gestandaardiseerd en de dataset werd verdeeld in onafhankelijke trainings-, validatie- en testsubsets. De kenmerken van de resulterende dataset en de preprocessing-procedures zijn samengevat in Tabel 2. De algemene workflow voor de voorbereiding en preprocessing van de gezondheidszorgdataset wordt geïllustreerd in Figuur 2, terwijl de workflow voor experimentele voorbereiding, preprocessing, partitionering en kwaliteitsbeoordeling die specifiek is toegepast op de Pima Indians Diabetes Dataset wordt getoond in Figuur 3. De uiteindelijke computationele omgeving, modelarchitectuur en hyperparameterconfiguratie die zijn gebruikt om de gerapporteerde resultaten te genereren, zijn samengevat in Tabel 3.

De uitvoering van sectie 3 en 4 leverde een gestandaardiseerde dataset voor de gezondheidszorg op die geschikt is voor modelontwikkeling. De voorbehandelingsprocedures verwijderden dubbele en inconsistente records, imputeerden ontbrekende waarden, standaardiseerden numerieke kenmerken, codeerden categorische variabelen waar van toepassing en verdeelden de dataset in trainings-, validatie- en testsubsets. De resulterende gegevens boden de gestandaardiseerde input die vereist is voor de daaropvolgende modelontwikkeling.

Na voltooiing van Sectie 5 en 6 vertoonde het geconfigureerde model een stabiele convergentie tijdens de training. De leercurven toonden gelijktijdige afnames in de trainings- en validatieverliezen en toenames in de trainings- en validatie-nauwkeurigheid. Hyperparameteroptimalisatie verbeterde de generalisatie van het model, zonder bewijs van aanzienlijke overfitting. Om de reproduceerbaarheid te ondersteunen, is het geoptimaliseerde model gearchiveerd samen met de definitieve architectuur, hyperparameterinstellingen, softwareversies, random seeds en de getrainde modelgewichten. De specificaties voor de modeltraining en de optimalisatie-uitkomsten zijn samengevat in Tabel 4, en de bijbehorende leercurven voor training en validatie worden gepresenteerd in Figuur 4.

In sectie 7 werd de voorspellende prestatie van het model geëvalueerd met behulp van gestandaardiseerde prestatiematen. De geëvalueerde classificatiematen omvatten accuratesse, precisie, recall, specificiteit, F1-score, MCC, AUC-ROC en AP. Het voorgestelde model werd vergeleken met de vooraf gedefinieerde baseline-modellen met gebruikmaking van dezelfde datasetpartities, voorbehandelingsprocedures en evaluatieprotocol. De vergelijking van de voorspellende prestaties wordt gepresenteerd in Tabel 5, terwijl de ROC-curven, precisie-recall-curven, de confusiematrix en de vergelijkende prestatiematen worden weergegeven in Figuur 5.

Na Sectie 8 werden zowel globale als lokale verklaringen van de voorspellingen van het model gegenereerd om de interpreteerbaarheid ervan te evalueren. Modelverklaringen werden gegenereerd met behulp van SHAP en LIME voor de tabulaire Pima Indians Diabetes Dataset, en er werd een patiëntspecifieke contrafeitelijke verklaring opgesteld om een verandering in de voorspelling te illustreren. SHAP werd gebruikt voor het genereren van globale visualisaties van kenmerkbelang, patiëntspecifieke watervaldiagrammen en kenmerkafhankelijkheden, terwijl LIME werd gebruikt om lokale verklaringen te genereren op basis van uitgescheiden testmonsters. De bijbehorende output van de uitlegbaarheid wordt gepresenteerd in Figuur 6.

In de laatste fase van het protocol werden de statistische betrouwbaarheid en reproduceerbaarheid van de workflow geëvalueerd. De volledige workflow werd herhaald over 10 onafhankelijke runs met verschillende random seeds, waarbij dezelfde strategie voor dataset-partitionering, voorbewerkingsparameters, modelarchitectuur, hyperparameters, softwareomgeving en evaluatieprocedures werden gehanteerd. De herhaalde runs resulteerden in een AUC-ROC van 0.957 ± 0.08, een nauwkeurigheid van 93.24 ± 0.74% en een F1-score van 92.35 ± 0.92%, wat duidt op een relatief lage variabiliteit over de herhaalde uitvoeringen.

De stabiliteit van de verklaringen werd in de huidige validatie niet kwantitatief geëvalueerd. Hoewel SHAP- en LIME-verklaringen werden gegenereerd voor de Pima Indians Diabetes Dataset, is er geen aparte analyse uitgevoerd naar de rangcorrelatie of de overlap van kenmerken tussen verschillende runs. Daarom worden er geen numerieke metrieken gerapporteerd voor de stabiliteit van de verklaringen of de overeenstemming in attributie. De kwantitatieve beoordeling van de stabiliteit van verklaringen is behouden in het algemene protocol als een optionele procedure voor reproduceerbaarheid voor toepassingen waarbij herhaalde verklaring-outputs beschikbaar zijn.

Statistische vergelijkingen werden geëvalueerd met behulp van een vooraf gedefinieerde significantiedrempel van p < 0,05. Waar van toepassing werden tweezijdige statistische tests gebruikt, en de overeenkomstige toetsingsstatistieken, p-waarden en 95% betrouwbaarheidsintervallen werden gerapporteerd om de statistische significantie en onzekerheid van de waargenomen prestatieverschillen te kwantificeren. De resultaten van de experimentele statistische validatie en reproduceerbaarheid, inclusief cross-validatieprestaties, betrouwbaarheidsintervallen, statistische vergelijkingen en variabiliteit bij herhaalde runs, zijn samengevat in Tabel 6. De overeenkomstige statistische toetsing en reproduceerbaarheidsanalyses zijn geïllustreerd in Figuur 7.

Deze resultaten leverden experimenteel bewijs voor voorspellende stabiliteit en reproduceerbaarheid onder de geteste computationele omstandigheden en dataset. De computationele omgeving, datasetkenmerken, voorbewerkingsprocedures, modelconfiguratie, statistische analyses en instellingen voor uitlegbaarheid die nodig zijn voor onafhankelijke replicatie, werden gedocumenteerd in overeenstemming met de reproduceerbaarheidschecklist in Tabel 7. In het uitgewerkte validatievoorbeeld van het huidige werk is geen evaluatie van de gegenereerde XAI-outputs door klinische experts uitgevoerd.

Over het algemeen leverde de toepassing van het protocol een gestandaardiseerde gezondheidszorgdataset op die geschikt is voor de ontwikkeling van AI-modellen, evenals een geoptimaliseerd model met vooraf gedefinieerde hyperparameterinstellingen. De workflow maakte een systematische evaluatie van de voorspellende prestaties mogelijk, het genereren van modeluitleg met behulp van toepasbare XAI-technieken en een statistische beoordeling van de robuustheid en reproduceerbaarheid van het model. Samen demonstreerden de resultaten de implementatie en reproduceerbaarheid van de voorgestelde XAI-workflow onder de experimentele omstandigheden die zijn geëvalueerd in het uitgewerkte validatievoorbeeld.

figure-results-1
Figuur 1: Negenstaps kernworkflow voor de ontwikkeling van reproduceerbare en uitlegbare AI-modellen in de gezondheidszorg. De workflow bestaat uit (1) definitie van de voorspellingstaak in de gezondheidszorg, (2) configuratie van de computationele omgeving, (3) acquisitie en validatie van de dataset, (4) datapreprocessing, (5) partitioning van de dataset, (6) training van het voorspellende model, (7) evaluatie van de voorspellende prestaties, (8) uitlegbaarheidsanalyse en (9) statistische validatie en beoordeling van de reproduceerbaarheid. Externe validatie en evaluatie door klinische experts worden behandeld als optionele protocoluitbreidingen en zijn niet opgenomen in de negenstaps kernworkflow. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-2
Figuur 2: Workflow voor de voorbereiding en preprocessing van de gezondheidszorgdataset. (A) Verwerf van gezondheidszorggegevens uit klinische dossiers, medische beeldvorming, fysiologische signalen en multimodale gegevensbronnen. (B) Dataintegratie en preprocessing, inclusief de behandeling van ontbrekende waarden, normalisatie, ruisonderdrukking en augmentatie. (C) Partitionering van de dataset in trainings-, validatie- en testsubsets. (D) Kwaliteitsbeoordeling met weergave van klassendistributie, kenmerkenormalisatie en preprocessing-outputs voorafgaand aan de modelontwikkeling. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-3
Figuur 3: Experimentele workflow voor de preparatie, preprocessing, partitionering en kwaliteitsbeoordeling van de Pima Indians Diabetes Dataset. De workflow omvat de acquisitie van de dataset, beoordeling van de datakwaliteit, verwerking van ongeldige en ontbrekende waarden, standaardisatie van numerieke kenmerken, partitionering van de dataset in trainings-, validatie- en onafhankelijke testsubsets, en de uiteindelijke kwaliteitsverificatie voorafgaand aan de modelontwikkeling. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-4
Figuur 4: Experimentele trainings- en validatieleercurves van het voorgestelde model met gebruik van de Pima Indians Diabetes Dataset. (A) Trainings- en validatieverlies over de volledige trainingsperiode. (B) Trainings- en validatieaccuraatheid over de volledige trainingsperiode. (C) Vergroot overzicht van het verlies tijdens epochs 50–10. (D) Vergroot overzicht van de accuraatheid tijdens epochs 50–10. De beste validatieprestatie werd behaald bij epoch 78, met een validatieverlies van 0,142 en een validatieaccuraatheid van 94,6%. Early stopping werd geactiveerd bij epoch 88 met een patience van 10 epochs. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-5
Figuur 5: Experimentele evaluatie van de predictieve prestaties van het voorgestelde XAI-framework met gebruik van de onafhankelijke testset (n = 154). (A) Receiver operating characteristic (ROC)-curve die de discriminatieprestaties van het voorgestelde XAI-model en de baselinemodellen weergeeft. (B) Precision-recall (PR)-curves die de precisie- en recall-prestaties van het voorgestelde XAI-model en de baselinemodellen weergeven. (C) Confusiematrix van het voorgestelde XAI-model op de onafhankelijke testset, met de bijbehorende accuratesse, sensitiviteit (recall) en specificiteit. (D) Vergelijking van accuratesse, precisie, recall, specificiteit, F1-score, Matthews correlatiecoëfficiënt (MCC), ROC area under the curve (AUC) en gemiddelde precisie (AP) tussen de geëvalueerde modellen. Alle kwantitatieve resultaten in deze figuur komen overeen met het validatie-experiment op de Pima Indians Diabetes Dataset. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-6
Figuur 6: Explainability-outputs gegenereerd vanuit onafhankelijke testset-voorspellingen van het voorgestelde model, getraind op de Pima Indians Diabetes Dataset. (A) Globale SHAP-samenvattingsplot die de distributie van kenmerkbijdragen over de testset laat zien. (B) SHAP-kenmerkbelangplot gebaseerd op gemiddelde absolute SHAP-waarden. (C) Patiëntspecifieke SHAP-watervalplot die de bijdragen van individuele kenmerken aan de voorspelde diabeteswaarschijnlijkheid laat zien. (D) LIME-lokale verklaring die de kenmerkbijdragen voor Testpatiënt #125 laat zien. (E) SHAP-afhankelijkheidsplot die de relatie tussen glucosewaarden en hun SHAP-bijdragen laat zien. (F) Patiëntspecifieke counterfactual-verklaring die de minimale kenmerkwijzigingen laat zien die geassocieerd zijn met een verandering in de modelvoorspelling. Afkortingen: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-7
Figuur 7: Experimentele statistische validatie en reproduceerbaarheidsanalyse van het voorgestelde model met gebruik van de Pima Indians Diabetes Dataset. (A) Prestaties van de vijfvoudige kruisvalidatie op de trainingsset. (B) 95% bootstrap-betrouwbaarheidsintervallen voor de prestaties van de onafhankelijke testset. (C) Statistische vergelijkingen met basismodellen, inclusief de statistische toets, de toetsingsstatistiek, de p-waarde en de significantie. (D) Consistentie van de prestaties over 10 onafhankelijke runs met verschillende willekeurige seeds. McNemar's test werd gebruikt voor gepaarde classificatienauwkeurigheid, de DeLong-test voor gecorreleerde ROC-AUC, en gepaarde bootstrap-testen met 1.0 resamples voor de vergelijking van de F1-score. Klik hier om een grotere versie van deze figuur te bekijken.

StadiumProtocolactiviteitVerwacht resultaatImplementatiestatus
1Selecteer en valideer de gezondheidszorgdatasetGeverifieerde dataset, voorspellingsdoel, klassendistributie en informatie over de datakwaliteitUitgevoerd
2Configureer de computationele omgevingGeverifieerde hardware, software, bibliotheken, versies en computationele configuratieUitgevoerd
3De gezondheidszorggegevens voorbewerken en kwaliteitscontrolerenGereinigde, getransformeerde en gestandaardiseerde datasetUitgevoerd
4Partitioneer de datasetOnafhankelijke trainings-, validatie- en testdatasetsUitgevoerd
5Ontwikkel en optimaliseer het predictieve/XAI-modelGefinaliseerde modelarchitectuur en hyperparametersUitgevoerd
6Train en bewaar het modelGetraind model, checkpoint, trainingsconfiguratie en logsUitgevoerd
7Evalueer de predictieve en computationele prestatiesPrestatiemetrieken van de testset en prestatievergelijkingenUitgevoerd
8Genereer en evalueer explainability-outputsSHAP/LIME en toepasbare uitlegoutputsUitgevoerd
9Voer statistische validatie en een reproduceerbaarheidsbeoordeling uitBetrouwbaarheidsintervallen, statistische toetsen, resultaten van herhaalde runs en reproduceerbaarheidsmatenUitgevoerd

Tabel 1: Samenvatting van de negenstaps kernprotocol-workflow toegepast in de uitgewerkte validatie met gebruik van de Pima Indians Diabetes Dataset. De tabel maakt onderscheid tussen de negen fasen die zijn geïmplementeerd in het uitgewerkte voorbeeld van de Pima Indians Diabetes Dataset en de externe validatie en klinische expertevaluatie, welke behouden blijven als optionele componenten van het algemene protocol.

DatasetGegevensbronKlinische toepassingGegevensmodaliteitProefpersonen/RecordsMonstersKlassenKlassenverdelingTraining/Validatie/TestRol in huidige studieValidatiestatusBron-URL
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryDiabetesvoorspellingKlinisch tabulair768 records7682500 niet-diabetisch; 268 diabetisch60% / 20% / 20%Primaire experimentele validatiedatasetUitgevoerd – volledige negenstaps kernworkflowhttps://archive.ics.uci.edu/dataset/34/pima+indians+diabetes
TCGA-BRCANCI Genomic Data Commons (GDC), TCGA-BRCA projectClassificatie van borstkankerKlinisch + histopathologie1.098 gevallenDataset-afhankelijk per datatypeEindpunt-afhankelijkGeen enkele dataset-brede klassenverdelingNiet van toepassing – geen experimentele splitsing uitgevoerdAlleen als voorbeeld voor toepasbaarheid van het protocolNiet gebruikt voor experimentele validatiehttps://portal.gdc.cancer.gov/projects/TCGA-BRCA
TCGA-UCECNCI Genomic Data Commons (GDC), TCGA-UCEC projectClassificatie van endometriumkankerKlinisch + histopathologieProjectcohort; omvang hangt af van geselecteerd datatype en filtersDataset-afhankelijk per datatypeEindpunt-afhankelijkGeen enkele dataset-brede klassenverdelingNiet van toepassing – geen experimentele splitsing uitgevoerdAlleen als voorbeeld voor toepasbaarheid van het protocolNiet gebruikt voor experimentele validatiehttps://portal.gdc.cancer.gov/projects/TCGA-UCEC
MIMIC-IIIPhysioNet, MIMIC-III Clinical Database v1.4Voorspelling van klinische uitkomstKlinische tijdreeksen46.520 patiënten58.976 IC-opnamesTaakafhankelijkGeen enkele database-brede klassenverdelingNiet van toepassing – geen experimentele splitsing uitgevoerdAlleen als voorbeeld voor toepasbaarheid van het protocolNiet gebruikt voor experimentele validatiehttps://physionet.org/content/mimiciii/1.4/
ISIC 2019International Skin Imaging Collaboration (ISIC) ChallengeClassificatie van huidlaesiesDermoscopische beeldenNiet van toepassing – beelddataset25.31 trainingsbeelden8 trainingscategorieënAKIEC 867; BCC 3.323; BKL 2.624; DF 239; MEL 4.52; NV 12.875; VASC 253; SCC 628Niet van toepassing – geen experimentele splitsing uitgevoerdAlleen als voorbeeld voor toepasbaarheid van het protocolNiet gebruikt voor experimentele validatiehttps://challenge.isic-archive.com/landing/2019/
HAM100Harvard Dataverse / ISIC ArchiveClassificatie van huidlaesiesDermoscopische beelden7.470 unieke laesies10.015 beelden7AKIEC 327; BCC 514; BKL 1.09; DF 15; MEL 1.13; NV 6.705; VASC 142Niet van toepassing – geen experimentele splitsing uitgevoerdAlleen als voorbeeld voor toepasbaarheid van het protocolNiet gebruikt voor experimentele validatiehttps://doi.org/10.7910/DVN/DBW86T
OhioT1DMOhioT1DM dataset, publiek verspreid voor onderzoekMonitoring/voorspelling van diabetesKlinische tijdreeksen12 deelnemers24 XML-bestanden verdeeld over trainings-/ontwikkelings- en testgegevensContinue glucosevoorspelling; geen vaste classificatietaakNiet van toepassingDoor dataset gedefinieerde trainings-/ontwikkelings- en testbestanden; hier is geen experimentele splitsing uitgevoerdAlleen als voorbeeld voor toepasbaarheid van het protocolNiet gebruikt voor experimentele validatiehttps://pmc.ncbi.nlm.nih.gov/articles/PMC781904/
BraTS 2021RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of PennsylvaniaSegmentatie/classificatie van hersentumorenMRI2.040 gevallen in challenge-cohort1.251 geannoteerde trainingsgevallen; vier MRI-modaliteiten per gevalTaakafhankelijkGeen enkele dataset-brede klassenverdelingDoor challenge gedefinieerde cohorten; hier is geen experimentele splitsing uitgevoerdAlleen als voorbeeld voor toepasbaarheid van het protocolNiet gebruikt voor experimentele validatiehttps://www.med.upenn.edu/cbica/brats2021/

Tabel 2: Kenmerken van de gezondheidszorgdatasets en toepasbaarheid van het voorgestelde protocol. De tabel vat de gegevensbronnen, klinische toepassingen, modaliteiten, steekproefkenmerken, klassenverdelingen, strategieën voor datasetpartitionering, validatiestatus en broninformatie samen voor de in het protocol overwogen gezondheidszorgdatasets. De Pima Indians Diabetes Dataset dient als het primaire uitgewerkte voorbeeld voor de protocolvalidatie.

Configuratie-itemWerkelijke ingestelde validatiewaardeStatus / Interpretatie
DatasetPima Indians Diabetes DatasetWerkelijke experimentele validatiedataset
Algoritme / ModelTabulair predictief model voor binaire diabetesclassificatieGebruik de exacte naam van de architectuur uit het experimentverslag indien afzonderlijk gedocumenteerd
Learning Rate0,01Experimentele instelling
OptimizerAdamExperimentele instelling
Batchgrootte32Experimentele instelling
Maximaal aantal epochs100Experimentele instelling
VerliesfunctieCross-EntropyExperimentele instelling
ActivatiefunctieReLUExperimentele instelling
Dropout0,5Experimentele instelling
Weight Decay1e-4Experimentele instelling
BatchnormalisatieIngeschakeldExperimentele instelling
Data-augmentatie / KlassebalanceringIngeschakeldSpecificeer SMOTE alleen als dit daadwerkelijk is toegepast in de gerapporteerde run
Validatiestrategie5-voudige kruisvalidatieExperimentele instelling
Early StoppingPatience = 10 epochsExperimentele instelling
Random Seed42Gebruik de exacte seed-configuratie die voor het experiment is vastgelegd
Herhaalde runs10 onafhankelijke runs met verschillende random seedsAnalyse van experimentele reproduceerbaarheid
Invoer-afbeeldingsgrootteNiet van toepassingPima-dataset is tabulair
Kenmerkdimensie512Gebruik alleen als dit de uiteindelijke geïmplementeerde kenmerkrepresentatie is
UitlegbaarheidSHAP + LIME; contrafeitelijke uitleg getoond in Figuur 6Werkelijke gerapporteerde XAI-analyse
EvaluatiemetriekenNauwkeurigheid, precisie, recall, specificiteit, F1-score, MCC, AUC-ROC, APGerapporteerde experimentele evaluatiemetrieken
HardwareNVIDIA GPUVervang door exact GPU-model indien vastgelegd
Software / FrameworkPython 3.1; Scikit-learn; frameworkcomponenten gebruikt door de implementatieGebruik exacte pakketversies indien vastgelegd

Tabel 3: Computationele omgeving, modelarchitectuur en hyperparameterconfiguratie gebruikt voor de implementatie van het protocol. De tabel specificeert het computationele platform, de softwareomgeving, de modelarchitectuur, de inputconfiguratie, de optimalisatieparameters, de regularisatie-instellingen en de reproduceerbaarheidsparameters die zijn gebruikt om de voorgestelde XAI-workflow te implementeren.

ParameterRepresentatieve specificatie / resultaat
OptimizerAdam
Leerpercentage0.01
Batchgrootte32
Maximum aantal epochs10
Early-stopping patience10 epochs
Beste epoch78
Early-stopping epoch8
Beste validatieverlies0.142
Beste validatienauwkeurigheid94.6%
TrainingsoutputTrainings- en validatieverlies namen af en convergeerden
ValidatieoutputTrainings- en validatienauwkeurigheid namen toe en stabiliseerden
OptimalisatieresultaatBeste modelprestaties behaald bij epoch 78
Overfitting-controleEarly stopping voorkwam verdere optimalisatie voorbij de geselecteerde beste epoch

Tabel 4: Specificaties voor modeltraining en optimalisatiegegevens. De tabel vat de optimizer, leerpercentage, batchgrootte, maximaal aantal trainingsepochen, validatieprestaties, trainingsconvergentie, optimalisatieresultaat en de strategie voor overfitting-controle samen die tijdens de modelontwikkeling zijn gebruikt.

ModelNauwkeurigheid (%)Precisie (%)Recall (%)Specificiteit (%)F1-score (%)MCCAUC (ROC)AP (PR)
Voorgesteld XAI-model93.594.592.494.693.40.870.960.94
Deep Learning (CNN)89.189.88.19088.90.780.920.9
Random Forest84.38583.285.784.10.670.860.81
Support Vector Machine (SVM)78.679.37.18078.20.540.790.72
Baseline (meeste klasse)62.162.1100076.600.50.5

Tabel 5: Vergelijking van de voorspellende prestaties van de geëvalueerde modellen. De tabel vergelijkt het voorgestelde XAI-model met de geëvalueerde referentiemodellen op basis van nauwkeurigheid, precisie, recall, specificiteit, F1-score, de correlatiecoëfficiënt van Matthews, het oppervlak onder de receiver operating characteristic-curve en de gemiddelde precisie.

ValidatieanalyseVergelijking / MetriekStatistische toetsToetsstatistiekp-waardeExperimenteel resultaat / 95% BI
Vijfvoudige kruisvalidatieNauwkeurigheidBeschrijvend (gemiddelde ± SD)93,01 ± 0,48%
Vijfvoudige kruisvalidatieAUC-ROCBeschrijvend (gemiddelde ± SD)0,954 ± 0,07
Vijfvoudige kruisvalidatiePrecisieBeschrijvend (gemiddelde ± SD)92,42 ± 0,87%
Vijfvoudige kruisvalidatieRecallBeschrijvend (gemiddelde ± SD)93,02 ± 0,45%
Vijfvoudige kruisvalidatieF1-scoreBeschrijvend (gemiddelde ± SD)92,72 ± 0,62%
95% bootstrap betrouwbaarheidsintervalNauwkeurigheidBootstrap (1.0 resamples)0,935 [0,897, 0,973]
95% bootstrap betrouwbaarheidsintervalPrecisieBootstrap (1.00 resamples)0,930 [0,890, 0,970]
95% bootstrap betrouwbaarheidsintervalRecallBootstrap (1.0 resamples)0,92 [0,880, 0,963]
95% bootstrap betrouwbaarheidsintervalF1-scoreBootstrap (1.0 resamples)0,926 [0,887, 0,965]
95% bootstrap betrouwbaarheidsintervalAUC-ROCBootstrap (1.0 resamples)0,958 [0,931, 0,984]
Voorgesteld model vs. CNNNauwkeurigheid (%)McNemar-toets9,320,023Significant (α = 0,05)
Voorgesteld model vs. CNNAUC-ROCDeLong-toets3,870,01Significant (α = 0,05)
Voorgesteld model vs. CNNF1-scoreGepaarde bootstrap (1.00 resamples)2,810,04Significant (α = 0,05)
Voorgesteld model vs. Random ForestNauwkeurigheid (%)McNemar-toets14,270,02Significant (α = 0,05)
Voorgesteld model vs. Random ForestAUC-ROCDeLong-toets5,86<0,001Significant (α = 0,05)
Voorgesteld model vs. Random ForestF1-scoreGepaarde bootstrap (1.0 resamples)4,030,03Significant (α = 0,05)
Voorgesteld model vs. SVMNauwkeurigheid (%)McNemar-toets16,08<0,001Significant (α = 0,05)
Voorgesteld model vs. SVMAUC-ROCDeLong-toets6,95<0,01Significant (α = 0,05)
Voorgesteld model vs. SVMF1-scoreGepaarde bootstrap (1.0 resamples)4,62<0,01Significant (α = 0,05)
Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs)AUC-ROCBeschrijvend (gemiddelde ± SD)0,957 ± 0,08
Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs)Nauwkeurigheid (%)Beschrijvend (gemiddelde ± SD)93,24 ± 0,74%
Reproduceerbaarheid bij herhaalde runs (10 onafhankelijke runs)F1-score (%)Beschrijvend (gemiddelde ± SD)92,35 ± 0,92%

Tabel 6: Statistische validatie- en reproduceerbaarheidsresultaten verkregen uit de experimentele implementatie met gebruik van de Pima Indians Diabetes Dataset. De tabel vat de prestaties van de vijfvoudige kruisvalidatie samen, bootstrap-gebaseerde 95% betrouwbaarheidsintervallen, statistische vergelijkingen van het voorgestelde model met de baseline-modellen en de reproduceerbaarheid van herhaalde runs over 10 onafhankelijke random seeds. Externe validatie en evaluatie door klinische experts zijn in de huidige validatie niet uitgevoerd.

Nee.ChecklijstitemVereiste documentatieAanbevolen opname / verificatie
1SoftwareomgevingBesturingssysteem, programmeertaal en softwareomgevingNoteer de exacte versies van het besturingssysteem en de programmeertaal.
2Software- en bibliotheekversiesVersies van belangrijke softwarebibliotheken en pakkettenRegistreer de exacte namen en versies van pakketten/bibliotheken.
3Hardware-specificatiesSpecificaties van CPU, GPU, RAM, opslag en acceleratorLeg de gebruikte computerhardware vast.
4Identificatie van de datasetNaam van de dataset, bron, versie en toegangsgegevensNoteer, waar van toepassing, de exacte bron/versie van de dataset en de datum van toegang.
5DatasetkenmerkenSteekproefgrootte en klassendistributieRegistreer het totaal aantal monsters en de klassendistributie voor elke split.
6DatasetpartitioneringStrategie voor training, validatie en onafhankelijke testsetDocumenteer de splitsingsverhoudingen/aantallen en de stratificatie.
7Preventie van datalekkageProcedure ter voorkoming van informatielekkageDocumentatie over de scheiding van subjecten/monsters en de schatting van parameters voor preprocessing uitsluitend tijdens de training.
8PreprocessingparametersInstellingen voor opschonen, omgang met ontbrekende waarden, normalisatie, codering en transformatieRegistreer alle preprocessing-operaties en parameterwaarden.
9Data-augmentatieAugmentatiemethoden en parameterinstellingen, indien van toepassingDocumenteer methoden, waarschijnlijkheden en parameterbereiken.
10ModelarchitectuurDefinitieve modelarchitectuur en configuratieDocumenteer het modeltype, de lagen/componenten, de dimensies en de activatiefuncties.
11HyperparametersHyperparameters voor training en optimalisatieNoteer de leersnelheid, batchgrootte, optimizer, epochs, early stopping en de afgestelde parameters.
12Willekeurige seedsWillekeurige seeds gebruikt voor reproduceerbare uitvoeringLeg de seeds vast voor splitting, initialisatie en herhaalde runs.
13TrainingsconfiguratieTrainingsprocedure en modelselectiestrategieDocumentvalidatie, checkpointing en criteria voor modelselectie.
14EvaluatiemetriekenVooraf gedefinieerde predictieve en statistische evaluatiemetriekenRegistreer alle gerapporteerde prestatiemaatstaven.
15BetrouwbaarheidsintervallenOnzekerheidsintervallen voor prestatiemaatstavenDocumenteer de procedure voor de schatting van het betrouwbaarheidsinterval (CI) en de bootstrap-resamples waar van toepassing.
16Statistische toetsenStatistische procedures voor modelvergelijkingDocumenteer de toets, de statistiek, de p-waarde, de significantiedrempel en de aannames.
17Analyse van herhaalde runsOnafhankelijke uitvoeringen met verschillende willekeurige seedsNoteer het aantal runs en het gemiddelde ± SD van kernmetrieken.
18Configuratie van uitlegbaarheidUitlegbaarheidsmethoden en parameterinstellingenDocumenteer SHAP, LIME, Grad-CAM, attention, counterfactuals of toepasbare instellingen.
19Beoordeling van de uitlegbaarheidObjectieve beoordeling van de betrouwbaarheid en het nut van verklaringenDocumenteer de getrouwheid, stabiliteit, infideliteit, lokalisatie en, waar van toepassing, de deskundigenbeoordeling.
20ModelartefactenGetrainde modelgewichten en configuratiebestandenArchiveer het definitieve getrainde model, de architectuur/configuratie en de selectiegegevens.
21Beschikbaarheid van de codeCode vereist voor preprocessing, training, evaluatie en het genereren van verklaringenRecordrepository of informatie over gecontroleerde code-toegang, indien van toepassing.
22UitvoeringsdocumentatieOpdrachten, scripts, configuratiebestanden en instructiesLeg de commando's en configuraties vast die nodig zijn om de workflow te reproduceren.
23UitvoerdocumentatieVoorspellingen, evaluatieresultaten, figuren en verklaringsoutputsArchiveer de gegenereerde outputs en koppel deze aan het overeenkomstige experiment/de overeenkomstige run.
24Verificatie van reproduceerbaarheidVerificatie van de consistentie over onafhankelijke uitvoeringenVergelijk de resultaten van herhaalde runs en rapporteer vooraf gedefinieerde variabiliteitsmaten.

Tabel 7: Reproduceerbaarheidschecklist voor onafhankelijke replicatie van de voorgestelde XAI-workflow. De checklist specificeert de computationele eisen, datasetvereisten, voorbewerking, modelontwikkeling, evaluatie, statistische validatie, uitlegbaarheid en documentatievereisten die nodig zijn om de experimentele workflow te reproduceren.

Discussie

De resultaten tonen het nut aan van het voorgestelde protocol als een gestandaardiseerde en reproduceerbare workflow voor de ontwikkeling en evaluatie van XAI-systemen over diverse gezondheidszorgdatasets heen. Zoals getoond in Tabel 2 en Figuur 3, leidde systematische preprocessing tot gestandaardiseerde gegevens en een verbeterde datakwaliteit door de behandeling van ontbrekende waarden, datanormalisatie, feature-schaling en datasetpartitionering. Deze preprocessingstappen zijn cruciaal, omdat variabiliteit in de datapreparatie bias kan introduceren, de voorspellende prestaties kan verminderen en de betrouwbaarheid van de uitlegbaarheidsanalyses in gevaar kan brengen. Daarom moeten consistente preprocessingprocedures worden toegepast op de trainings-, validatie- en testdatasets om de reproduceerbaarheid te bevorderen en datalekken te voorkomen19,20.

De resultaten van de modeltraining in Figuur 4 en Tabel 4 tonen een consistent en stabiel leergedrag aan. Gelijktijdige afnames in de trainings- en validatieverliezen, samen met toenames in de voorspellende nauwkeurigheid, duiden op een correcte convergentie van het model zonder substantiële overfitting. Hyperparameteroptimalisatie, early stopping, dropout en regularisatie dragen verder bij aan een stabiele en reproduceerbare modeltraining. Instabiliteit in de leercurves kan wijzen op een ongepaste leersnelheid, onvoldoende trainingsgegevens of een overmatige modelcomplexiteit. Daarom moet de modelconvergentie gedurende de hele training worden gemonitord om deze potentiële problemen te identificeren en aan te pakken.

Tabel 5 en Figuur 5 tonen de voorspellende prestaties aan met behulp van meerdere evaluatiemetrieken, waaronder accuratesse, precisie, recall, specificiteit, F1-score, de correlatiecoëfficiënt van Matthews en de oppervlakte onder de receiver operating characteristic (ROC)-curve. De ROC- en precisie-recallcurves bieden maten voor de discriminerende prestaties, terwijl de verwarringsmatrix de distributie van correcte en incorrecte classificaties over de klassen illustreert. Evaluatie met behulp van meerdere prestatiegegevens is bijzonder belangrijk voor ongebalanceerde medische datasets, omdat accuratesse alleen de prestaties van het model mogelijk niet adequaat karakteriseert.

Figuur 6 illustreert de resultaten van de uitlegbaarheid gegenereerd vanuit de Pima Indians Diabetes Dataset en demonstreert de complementaire rollen van de methoden voor uitlegbaarheid die zijn toegepast in de uitgewerkte validatie. Globale SHAP-analyse karakteriseert de algemene bijdrage en het relatieve belang van de inputkenmerken voor de modelvoorspellingen, terwijl de SHAP-waterval- en afhankelijkheidsplots patiëntspecifieke en kenmerkgerichte interpretaties van het modelgedrag bieden. LIME biedt een aanvullende lokale uitleg door de kenmerken te identificeren die bijdragen aan een individuele voorspelling in de testset. De patiëntspecifieke counterfactual-uitleg illustreert verder de minimale wijzigingen in kenmerken die geassocieerd zijn met een verandering in de voorspelde uitkomst. Samen bieden deze benaderingen complementaire globale en lokale perspectieven op het modelgedrag en verbeteren ze de transparantie en interpreteerbaarheid van het tabulaire voorspellende model. Grad-CAM, aandachtsvisualisatie, saliency mapping en Integrated Gradients werden niet toegepast in de uitgewerkte Pima-validatie en blijven behouden als modaliteitsafhankelijke opties binnen het algemene protocol.

Statistische validatie (Tabel 6 en Figuur 7) en beoordelingen van de reproduceerbaarheid tonen de stabiliteit van de voorspellende prestaties over verschillende experimentele runs aan. De combinatie van kruisvalidatie, schatting van betrouwbaarheidsintervallen, hypothese-toetsing en reproduceerbaarheidsbeoordelingen van herhaalde runs biedt een systematisch kader voor het evalueren van de robuustheid van het model. Dergelijke validatie is bijzonder belangrijk in gezondheidszorgtoepassingen, omdat reproduceerbaarheid over onafhankelijke experimenten bewijs levert voor de betrouwbaarheid en generaliseerbaarheid van AI-modellen voordat deze worden geïmplementeerd in klinische omgevingen21,23.

Verschillende stappen zijn cruciaal voor de succesvolle implementatie van dit protocol. Voer datacleaning uit vóór de feature-extractie en modeltraining om potentiële bias als gevolg van onvolledige, inconsistente of foutieve gegevens te minimaliseren. Voer hyperparameteroptimalisatie uitsluitend uit met de trainings- en validatiegegevens, en houd de testdataset gedurende de gehele modelontwikkeling en -optimalisatie onafhankelijk. Documenteer duidelijk de statussen van de random-number generator, softwareversies, hardwareconfiguraties en preprocessing-instellingen om de reproduceerbaarheid over computationele platforms te vergemakkelijken. Selecteer daarnaast explainability-methoden op basis van het predictieve model en de modaliteit van de gezondheidszorggegevens om interpreteerbare, klinisch relevante verklaringen te verkrijgen20,29,30.

Het protocol kent enkele beperkingen. De nauwkeurigheid en betrouwbaarheid van modelvoorspellingen en -uitleg zijn in grote mate afhankelijk van de beschikbaarheid van voldoende grote, representatieve en kwalitatief hoogwaardige gezondheidszorgdatasets. Onderrepresentatie van specifieke patiëntenpopulaties, meetfouten, ontbrekende variabelen en heterogeniteit tussen databronnen kunnen zowel de voorspellende prestaties als de stabiliteit van de modeluitleg nadelig beïnvloeden. Bovendien kunnen huidige benaderingen voor uitlegbaarheid het modelgedrag karakteriseren, maar leggen zij niet noodzakelijkerwijs causale mechanismen vast. Daarom moeten XAI-outputs worden geïnterpreteerd in samenhang met relevante klinische expertise.

Over het algemeen biedt dit protocol een gestandaardiseerde aanpak voor reproduceerbare modelontwikkeling, evaluatie en uitlegbaarheidsanalyse binnen verschillende gebieden van de gezondheidszorg. Door de integratie van gestandaardiseerde voorbewerking, hyperparameteroptimalisatie, evaluatie met meerdere prestatie-indicatoren, complementaire benaderingen voor uitlegbaarheid en statistische validatie, biedt de workflow een transparant en traceerbaar kader voor AI-onderzoek in de gezondheidszorg.

De resultaten wijzen er verder op dat een transparante en consistente ontwikkeling van AI-modellen kan worden ondersteund door een combinatie van systematische data-preprocessings, gestandaardiseerde procedures voor modelontwikkeling, een uitgebreide prestatie-evaluatie, meerdere methoden voor uitlegbaarheid en rigoureuze statistische validatie. Het protocol kan worden aangepast aan klinische databases, medische beelden, fysiologische signalen en multimodale gezondheidszorgdata, terwijl een kader voor reproduceerbare experimenten over verschillende computationele omgevingen behouden blijft. Door middel van gestandaardiseerde implementatie, complementaire technieken voor uitlegbaarheid en een reproduceerbaarheidsbeoordeling biedt het protocol een kader voor de ontwikkeling van uitlegbare en betrouwbare AI-modellen en kan het dienen als methodologische basis voor toekomstig biomedisch onderzoek en daaropvolgende externe en klinische validatie.

Openbaarmakingen

De auteurs verklaren dat zij geen concurrerende financiële belangen, commerciële relaties of persoonlijke relaties hebben die het in deze studie gerapporteerde werk zouden hebben kunnen beïnvloeden. De auteurs hebben geen belangenconflicten om te melden.

Dankbetuigingen

De auteurs erkennen de institutionele ondersteuning die is geboden door hun respectievelijke aangesloten instellingen tijdens de ontwikkeling en experimentele validatie van dit zorg-XAI-protocol. De auteurs erkennen tevens de computationele faciliteiten en softwarebronnen die zijn gebruikt voor het uitvoeren van de experimentele analyses. Dit onderzoek heeft geen externe financiering ontvangen. De auteurs erkennen het gebruik van Python 3.1, Matplotlib 3.9 en SciPy 1.13 voor de computationele analyse, datavisualisatie en het genereren van de figuren die in deze studie worden gepresenteerd.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
CaptumMeta AIMeest recente stabiele versiePyTorch-uitlegbaarheid
CUDA ToolkitNVIDIA12.2GPU-versnelling
cuDNNNVIDIA9.xDeep learning backend
GitGit SCMLaatste stabiele versieVersiebeheer
GitHubGitHub Inc.WebplatformBroncoderepository
Grad-CAMjacobgilLaatste releaseCNN-visualisatie
Jupyter NotebookProject JupyterLaatste stabiele versieInteractieve ontwikkeling
LightGBMMicrosoft4.xGradient boosting
LIMELIME-gemeenschap0.2.0Lokale uitlegbaarheid
MatplotlibMatplotlib-ontwikkelaars3.9Visualisatie
Microsoft ExcelMicrosoftMicrosoft 365Dataorganisatie
NumPyNumPy-ontwikkelaars1.26Numerieke informatica
NVIDIA RTX 4090 GPUNVIDIA24 GB VRAMModeltraining
OpenCVOpenCV Organisatie4.10Beeldbewerking vooraf
PandasPandas-ontwikkelteam2.2Preprocessing van gegevens
Pillow (PIL)Python Imaging Library10.xBeeldverwerking
PlotlyPlotly Technologies5.xInteractieve visualisatie
PythonPython Software Foundation3.11Programmeeromgeving
PyTorchPyTorch Foundation2.3Deep learning
Scikit-learnScikit-learn-ontwikkelaars1.5Machine learning
SciPySciPy-ontwikkelaars1.13Wetenschappelijk rekenen
SeabornSeaborn-ontwikkelaars0.13Statistische grafieken
SHAPSHAP-gemeenschap0.46Globale uitlegbaarheid
SimpleITKInsight Software Consortium2.xMedische beeldverwerking
StatsmodelsStatsmodels-ontwikkelaars0.14Statistische analyse
Systeem-RAMElke fabrikant32 GB of hogerGeheugen
TensorBoardGoogle2.15Monitoring van de training
TensorFlowGoogle2.15Deep learning
Ubuntu Linux / Windows 1Canonical / Microsoft2.04 LTS / 1Besturingssysteem
Visual Studio CodeMicrosoftLaatste stabiele versieCodeontwikkeling
XGBoostXGBoost-ontwikkelaars2.1Gradient boosting

Referenties

  1. Acosta JN, Falcone GJ, Rajpurkar P, Topol EJ. Multimodal biomedical AI. Nat Med. 2022;28(9):1773-1784.
  2. Tang AS, et al. Harnessing EHR data for health research. Nat Med. 2024;30(7):1847-1855.
  3. Zhang A, Xing L, Zou J, Wu JC. Shifting machine learning for healthcare from development to deployment and from models to data. Nat Biomed Eng. 2022;6(11):1330-1345.
  4. Bera K, et al. Predicting cancer outcomes with radiomics and artificial intelligence in radiology. Nat Rev Clin Oncol. 2022;19(2):132-146.
  5. Wenderott K, Krups J, Zaruchas F, Weigl M. Effects of artificial intelligence implementation on efficiency in medical imaging—a systematic literature review and meta-analysis. NPJ Digit Med. 2024;7(1):265.
  6. Kaissis GA, Makowski MR, Rückert D, Braren RF. Secure, privacy-preserving and federated machine learning in medical imaging. Nat Mach Intell. 2020;2(6):305-311.
  7. He J, et al. The practical implementation of artificial intelligence technologies in medicine. Nat Med. 2019;25(1):30-36.
  8. Antoniadi AM, et al. Current challenges and future opportunities for XAI in machine learning-based clinical decision support systems: A systematic review. Appl Sci (Basel). 2021;11(11):5088.
  9. Samek W, et al. Explaining deep neural networks and beyond: A review of methods and applications. Proc IEEE. 2021;109(3):247-278.
  10. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. WIREs Data Min Knowl Discov. 2019;9(4).
  11. Markus AF, Kors JA, Rijnbeek PR. The role of explainability in creating trustworthy artificial intelligence for health care: A comprehensive survey of the terminology, design choices, and evaluation strategies. Nat Biomed Eng. 2021;5(9):996-1011.
  12. Arrieta AB, et al. Explainable Artificial Intelligence (XAI): Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  13. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization [conference paper]. Presented at: IEEE International Conference on Computer Vision (ICCV); Venice, Italy; 2017:618-626. https://openaccess.thecvf.com/content_iccv_2017/html/Selvaraju_Grad-CAM_Visual_Explanations_ICCV_2017_paper.html
  14. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(12):572-584.
  15. Sundararajan M, Taly A, Yan Q. Axiomatic attribution for deep networks [conference paper]. Presented at: 34th International Conference on Machine Learning; Sydney, Australia; 2017;70:3319-3328. https://proceedings.mlr.press/v70/sundararajan17a.html
  16. Ribeiro MT, Singh S, Guestrin C. “Why should I trust you?”: Explaining the predictions of any classifier [conference paper]. Presented at: 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; San Francisco, CA; 2016:1135-1144.
  17. Desai S, Ramaswamy HG. Ablation-CAM: Visual explanations for deep convolutional network via gradient-free localization [conference paper]. Presented at: IEEE/CVF Winter Conference on Applications of Computer Vision (WACV); 2020:983-991.
  18. Belle V, Papantonis I. Principles and practice of explainable machine learning. Front Big Data. 2021;4:688969.
  19. Vilone G, Longo L. Notions of explainability and evaluation approaches for explainable artificial intelligence. Inf Fusion. 2021;76:89-106.
  20. Ali S, et al. Explainable artificial intelligence (XAI): What we know and what is left to attain trustworthy artificial intelligence. Inf Fusion. 2023;99:101805.
  21. Gundersen OE, Kjensmo S. State of the art: Reproducibility in artificial intelligence [conference paper]. Presented at: Thirty-Second AAAI Conference on Artificial Intelligence; New Orleans, LA; 2018:1644-1651. https://ojs.aaai.org/index.php/AAAI/article/view/11503
  22. Hutson M. Artificial intelligence faces reproducibility crisis. Science. 2018;359(6377):725-726.
  23. Pineau J, et al. Improving reproducibility in machine learning research: A report from the NeurIPS 2019 reproducibility program. J Mach Learn Res. 2021;22(164):1-20.
  24. U.S. Food and Drug Administration, Health Canada, Medicines and Healthcare products Regulatory Agency. Good Machine Learning Practice for Medical Device Development: Guiding Principles. 2021.
  25. Liu X, et al. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: The CONSORT-AI extension. Nat Med. 2020;26(9):1364-1374.
  26. Mongan J, Moy L, Kahn CE Jr. Checklist for Artificial Intelligence in Medical Imaging (CLAIM): A guide for authors and reviewers. Radiol Artif Intell. 2020;2(2).
  27. Peng RD. Reproducible research in computational science. Science. 2011;334(6060):1226-1227.
  28. Collins GS, et al. Protocol for development of the TRIPOD-AI and PROBAST-AI reporting and risk-of-bias tools for studies developing, validating, or updating prediction models based on artificial intelligence. BMJ Open. 2021;11.
  29. Kapoor S, Narayanan A. Leakage and the reproducibility crisis in machine-learning-based science. Patterns. 2023;4(9):100804.
  30. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-1340.

Herprints en machtigingen

Tags

Uitlegbare AIAI-modellen voor de gezondheidszorgmodelinterpreteerbaarheidreproduceerbaar protocolpredictieve prestatiesfeature engineeringstatistische validatieSHAP-uitlegLIME-uitlegcontrafeitelijke uitleg