Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Onderzoeksartikel

Een reproduceerbaar protocol voor het ontwikkelen en evalueren van verklaarbare kunstmatige intelligentie-frameworks in gezondheidszorganalyse

93 weergaven

DOI:

10.3791/71999

31 juli 2026

In dit artikel

Samenvatting

Hier presenteren we een reproduceerbaar protocol voor het ontwikkelen en evalueren van verklaarbare kunstmatige intelligentiemodellen voor gezondheidszorganalyse. De workflow integreert datapreprocessing, voorspellende modellering, SHAP-, LIME- en Grad-CAM-gebaseerde verklaarbaarheid, kwantitatieve evaluatie en mensgerichte validatie om transparante en betrouwbare klinische besluitvorming te ondersteunen.

Samenvatting

Verklaarbare Kunstmatige Intelligentie (XAI) wordt steeds meer erkend als een onmisbaar hulpmiddel voor het bouwen van betrouwbare AI-systemen in de gezondheidszorg, waar transparantie en het vermogen om beslissingen uit te leggen essentiële onderdelen zijn van klinische besluitvorming. Deze publicatie presenteert een reproduceerbare experimentele benadering voor het ontwikkelen en evalueren van verklaarbare AI-systemen voor gezondheidszorganalyse. De ontwikkelde pijplijn integreert de stappen van datapreprocessing, voorspellende modellering, interpretatiegeneratie en evaluatie in één naadloze workflow die kan worden toegepast op zowel gestructureerde klinische data als medische beeldvormingsdatasets. Ensemble machine learning-modellen hebben sterke voorspellende prestaties aangetoond op gestructureerde tabulaire datasets, terwijl deep learning-modellen effectief zijn voor het leren van complexe patronen in medische beeldvormingsdata. Technieken zoals SHAP, LIME en Grad-CAM zijn globale en lokale verklaringen die modelinterpretatie vergemakkelijken. Heel behulpzaam. De kwantitatieve beoordeling van het kader omvat veel verschillende maatstaven zoals nauwkeurigheid, precisie, herinnering, F1-score, ROC-AUC, verklaringsmetrieken, trouw en stabiliteit. De resultaten geven aan dat wanneer de experimentele omstandigheden worden gecontroleerd, het kader verbeterde voorspellende prestaties en uitlegkwaliteit onder de geëvalueerde experimentele omstandigheden heeft aangetoond. Als een document dat door protocol wordt geleid, ondersteunt dit werk de reproduceerbaarheid en schaalbaarheid, de blijvende implementatie door andere levende wezens. Dit transparante, begrijpelijke AI-model vormt de basis waarop klinische besluitvormingsondersteuning en zorganalysesystemen vertrouwen krijgen en op grote schaal worden gebruikt.

Inleiding

Kunstmatige intelligentie (AI) is een belangrijk onderdeel geworden van de moderne gezondheidszorg door het ondersteunen van ziektediagnose, prognose, risicostratificatie, medische beeldanalyse en klinischebesluitvorming. Vooruitgang in machine learning en deep learning heeft zorgsystemen in staat gesteld grote hoeveelheden gestructureerde en ongestructureerde data te verwerken, vaak met voorspellende prestaties die vergelijkbaar zijn met of beter zijn dan conventionele statistische benaderingen2. Ondanks deze vooruitgang functioneren veel AI-modellen als complexe black-box-systemen, waardoor het voor clinici en zorgprofessionals moeilijk is te begrijpen hoe voorspellingenworden gegenereerd. Dit gebrek aan transparantie kan vertrouwen, adoptie en verantwoordelijkheid beperken in zorgomgevingenmet hoge inzet 4,5.

Verklaarbare kunstmatige intelligentie (XAI) is naar voren gekomen als een veelbelovende benadering om de transparantie en interpreteerbaarheid van machine learning modellen6 te verbeteren. Veelgebruikte verklaringstechnieken, waaronder SHAP (Shapley additive explanations), LIME (Local interpretable model-agnostic explanations) en Gradient-weighted class activation mapping (Grad-CAM), bieden inzicht in modelgedrag via feature-attributie en visuele verklaringsmechanismen 7,8,9. Deze methoden worden steeds vaker toegepast op zorgtoepassingen ter ondersteuning van klinische interpretatie, modelauditing en beslissingsondersteuning10,11. Verklaarbaarheid alleen garandeert echter geen betrouwbaarheid, reproduceerbaarheid of klinisch nut. Recente studies hebben uitdagingen aangetoond die verband houden met instabiliteit in verklaringen, gevoeligheid voor verstoringen, beperkte validatie door clinici en inconsistenties tussen uitleg en true model redenering 12,13,14,15.

Naast de uitdagingen in de uitlegbaarheid blijft reproduceerbaarheid een belangrijk punt in het onderzoek naar machine learning in de gezondheidszorg 16,17,18. Veel gepubliceerde studies geven beperkte informatie over preprocessingprocedures, softwareomgevingen, hyperparameterconfiguraties, validatiestrategieën en implementatieworkflows, waardoor onafhankelijke replicatie moeilijk is 19,20,21. Bovendien richten AI-studies in de gezondheidszorg zich vaak op voorspellende prestaties, terwijl ze beperkte richtlijnen geven over de kwaliteitsbeoordeling van uitleg, door de arts gerichte evaluatie en praktischeimplementatieoverwegingen. Deze beperkingen kunnen de overgang van verklaarbare AI-systemen van onderzoeksomgevingen naar echte zorgomgevingen belemmeren 23,24,25,26,27.

Huidige workflows van healthcare XAI evalueren individuele verklaringstechnieken of voorspellende modellen vaak geïsoleerd en bieden zelden gestandaardiseerde protocollen die datavoorbereiding, voorspellende modellering, verklaarbaarheidsbeoordeling, mensgerichte evaluatie en reproduceerbaarheidsbronnen integreren 28,29,30,31. Daardoor kunnen onderzoekers en praktijkmensen problemen ondervinden bij het reproduceren van workflows, het vergelijken van verklaringsmethoden of het evalueren van het praktische nut van verklaarbare AI-systemen over verschillende zorgdatasets en toepassingsdomeinen heen. Een uitgebreid en reproduceerbaar protocol is daarom nodig om consistente implementatie, evaluatie en rapportage van verantwoordbare AI-workflows in de gezondheidszorgte faciliteren.

Hier presenteren we een reproduceerbaar protocol voor het ontwikkelen, evalueren en interpreteren van verklaarbare kunstmatige intelligentiesystemen in gezondheidszorganalyse. Het protocol integreert datapreprocessing, voorspellende modellering, uitlegbaarheidsbeoordeling met SHAP, LIME en Grad-CAM, clinici-gerichte evaluatie, validatieprocedures en reproduceerbaarheidsbronnen binnen een uniforme workflow. Het doel is een gestandaardiseerd kader te bieden dat transparante modelontwikkeling, kwaliteitsbeoordeling van uitleg en reproduceerbare implementatie ondersteunt over diverse gezondheidszorgdatasets 36,37,38,39. De methodologische bijdrage van dit werk ligt in de integratie van voorspellende analyse, uitlegbaarheidsevaluatie, validatie van clinici en reproduceerbaarheidspraktijken in één protocol dat geschikt is voor AI-onderzoek, onderwijs en implementatiegerichte studiesin de gezondheidszorg 40,41,42,43.

De belangrijkste bijdrage van dit werk is niet de ontwikkeling van een nieuw verklaarbaarheidsalgoritme.

In plaats daarvan biedt het een gestandaardiseerd, reproduceerbaar en experimenteel gevalideerd protocol dat voorspellende modellering, uitlegbaarheidsbeoordeling, visualisatie, evaluatie en mensgerichte interpretatie integreert in een uniforme workflow die geschikt is voor gezondheidszorganalyse en de verspreiding van JoVE-gebaseerde protocollen. Het primaire doel van dit werk is niet het introduceren van een nieuw voorspellend algoritme, maar het bieden van een gestandaardiseerd, reproduceerbaar en experimenteel gevalideerd protocol voor het implementeren van verklaarbare kunstmatige intelligentie-workflows in gezondheidszorganalyse. Het protocol integreert datapreprocessing, voorspellende modellering, uitlegbaarheidsbeoordeling, clinici-gerichte evaluatie en reproduceerbaarheidsbronnen in een uniform kader dat geschikt is voor adoptie, replicatie en educatieve verspreiding.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Alle datasets die in deze studie zijn gebruikt, zijn verkregen uit publiek beschikbare en volledig geanonimiseerde repositories, waaronder de UCI Machine Learning Repository, PhysioNet MIMIC-III database en NIH Chest X-ray datasets. Er werd geen identificeerbare patiëntinformatie geraadpleegd. De studie voldeed aan de ethische richtlijnen voor institutioneel onderzoek voor secundaire analyse van openbaar beschikbare gedeïdentificeerde gegevens. Formele goedkeuring van de Institutional Review Board was niet vereist omdat er geen menselijke deelnemers direct werden gerekruteerd en er geen beschermde gezondheidsinformatie werd gebruikt.

1. Overzicht van de experimentele kaders

  1. Ontwikkel een reproduceerbare, verklaarbare kunstmatige intelligentie (XAI)-pijplijn voor transparante gezondheidszorganalyse. Organiseer de workflow in de Datalaag, Preprocessing-laag, Modelleerlaag, Uitlegbaarheidslaag, Evaluatielaag en Visualisatielaag.
  2. Integreer deze modules in een uniforme workflow die in staat is gestructureerde klinische gegevens, elektronische patiëntendossiers en medische beeldvormingsdatasets te verwerken.
  3. Zorg ervoor dat elke module bijdraagt aan reproduceerbaarheid, interpreteerbaarheid, schaalbaarheid en gestandaardiseerde experimentele uitvoering.
  4. Ontwerp de modulaire architectuur om continue datastroom te ondersteunen en zorg ervoor dat elke fase van de pijplijn bijdraagt aan reproduceerbaarheid, interpreteerbaarheid en schaalbaarheid gedurende de experimentele workflow.

2. Computationele omgeving en systeemconfiguratie

  1. Installeer de benodigde softwareafhankelijkheden voordat je de workflow uitvoert door een commandoregelterminal te openen en het volgende commando uit te voeren:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Controleer de succesvolle installatie van alle softwarepakketten en controleer compatibiliteit met de softwareversies die in de Materiaaltabel staan vermeld voordat u doorgaat met datapreprocessing en modelontwikkeling.
  3. Gebruik Python 3.11 als de primaire programmeeromgeving. Installeer en configureer NumPy 1.26 en Pandas 2.1 voor datamanipulatie en feature engineering-taken. Installeer Scikit-learn 1.5 voor de ontwikkeling en evaluatie van machine learning-modellen.
  4. Installeer TensorFlow 2.15 voor deep learning-modeltraining en inferentie. Installeer SHAP 0.46 en LIME 0.2.0 voor uitlegbaarheidsanalyse. Installeer OpenCV 4.10 voor beeldverwerkingstaken. Installeer Matplotlib 3.9 en Seaborn 0.13 voor datavisualisatie en resultaatrapportage. Raadpleeg de Materiaaltabel voor volledige softwarespecificaties en implementatiedetails die nodig zijn voor reproduceerbaarheid.
  5. Configureer de computationele omgeving met een werkstation uitgerust met een multi-core processor, grafische verwerkingsunit (GPU) versnelling en voldoende geheugen om grote gezondheidsdatasets en deep learning-workloads te verwerken.
  6. Stel vaste willekeurige seeds in voor datapartitionering, modelinitialisatie en trainingsprocedures om reproduceerbaarheid te garanderen over experimentele runs. Schakel logmechanismen in om voorverwerkingsoperaties, modelconfiguraties, hyperparameterinstellingen, trainingsprocedures en evaluatieresultaten gedurende de workflow vast te leggen.
  7. Configureer de modelarchitecturen, optimalisatieparameters, leersnelheden, batchgroottes, trainingsinstellingen en hyperparameterwaarden volgens de specificaties die in Tabel 1 zijn samengevat. Houd je aan deze instellingen tijdens replicatie-experimenten om consistentie met de gerapporteerde resultaten te waarborgen.
  8. Verwachte Output - Een volledig geconfigureerde en reproduceerbare computationele omgeving met alle benodigde softwarepakketten, hardwarebronnen, logmechanismen en modelconfiguratie-instellingen beschikbaar voor latere datapreprocessing, modelontwikkeling, verklaarbaarheidsanalyse en evaluatieprocedures.
ComponentParameterWaardeBeschrijving
Willekeurig Bosn_estimators100Aantal bomen
Willekeurig Bosmax_depthGeen enkeleBoomdiepte
XGBoostlearning_rate0.01Leertempo
XGBoostn_estimators100Boost-kogels
CNNEpochs25Opleidingsperiodes
CNNbatch_size32Batchgrootte
CNNOptimizerAdamOptimalisatie-algoritme
MLPhidden_layers2Aantal verborgen lagen
MLPActiveringReLUActivatiefunctie
Algemeentrain_split70%Trainingsdataratio
Algemeenvalidation_split15%Validatieratio
Algemeentest_split15%Testverhouding

Tabel 1: Implementatiedetails en hyperparameterconfiguratie.

Deze tabel vat de computationele omgeving, softwarebibliotheken, machine learning- en deep learning-modelconfiguraties, optimalisatie-instellingen, leersnelheden, batchgroottes, trainingsparameters en hyperparameterwaarden samen die tijdens de experimentele evaluatie van het voorgestelde verklaarbare AI-framework zijn gebruikt.

3. Datasetvoorbereiding en -preprocessing

  1. Selecteer openbaar beschikbare gezondheidszorgdatasets om transparantie en reproduceerbaarheid van de experimentele workflow te waarborgen.;
  2. Gebruik vier representatieve zorgscenario's om het voorgestelde kader te valideren: (i) borstkankerdiagnose met behulp van de Wisconsin Breast Cancer Dataset, (ii) diabetesrisicovoorspelling met de Pima Indians Diabetes Dataset, (iii) klinische uitkomstvoorspelling met behulp van MIMIC-III elektronische patiëntendossiers, en (iv) classificatie van thoracale ziekten met de NIH Chest X-ray Dataset. Kies deze datasets om het kader te evalueren over gestructureerde klinische dossiers, longitudinale elektronische patiëntendossiers en medische beeldvormingsmodaliteiten die vaak worden gebruikt in zorgondersteuningssystemen.
  3. Importeer elke dataset in de Python-omgeving en scheid de records in invoerfuncties en doelvariabelen. Organiseer gestructureerde klinische gegevens voor ziektevoorspellingstaken, elektronische patiëntendossiers voor longitudinale uitkomstanalyse en medische beeldvormingsdatasets voor diagnostische classificatietaken. Controleer de integriteit van elke dataset voordat je doorgaat met preprocessing-operaties.
  4. Identificeer en pak ontbrekende waarden aan met behulp van passende imputatietechnieken. Standaardiseer numerieke kenmerken via feature-schaal- en normalisatieprocedures om vergelijkbaarheid tussen variabelen te waarborgen.
  5. Codeer categorische variabelen met geschikte coderingsmethoden op basis van datasetkenmerken. Voer feature-selectie uit met behulp van correlatieanalyse en modelgebaseerde feature-importance-metingen om de meest relevante variabelen te identificeren en de datadimensionaliteit te verminderen.
  6. Verander alle medische beelden naar 224.224 pixels vóór de modeltraining. Normaliseer pixelintensiteitswaarden volgens de eisen van de geselecteerde deep learning-architectuur. Pas data-augmentatietechnieken toe, waaronder beeldrotatie en horizontale flipping, om de generalisatie van het model te verbeteren en overfitting te verminderen. Controleer de beeldkwaliteit en zorg voor consistentie van de beeldafmetingen door de hele dataset.
  7. Beoordeel de integriteit van data door de volledigheid, consistentie en uitlijning van feature-labels te evalueren. Controleer of alle records correct zijn toegewezen aan hun bijbehorende doelklassen. Bekijk de kenmerken van de dataset, waaronder steekproefgrootte, aantal features en datamodaliteit, zoals samengevat in Tabel 2.
  8. Implementeer dataset-specifieke validatieprocedures om methodologische nauwkeurigheid en reproduceerbaarheid te waarborgen. Noteer de steekproefgrootte, klasseverdeling, train-validatie-test splitsingsstrategie, lekkagepreventiemaatregelen, hyperparameteroptimalisatieprocedures, kruisvalidatieontwerp en extern testprotocol voor elke dataset. Vat deze validatieprocedures samen in Tabel 3.
  9. Voer preprocessing-kwaliteitscontroles uit door het beoordelen van ontbrekende waarde, verwijdering van uitschieters, feature-scaling, categorische codering, behoud van klassenverdeling en procedures voor het partitioneren van datasets. Controleer dat preprocessing-operaties consistent worden toegepast op alle datasets.
  10. Bevestig het ontbreken van aanzienlijke datalekken tijdens het partitioneren van datasets. Bekijk de preprocessing-validatieresultaten in Figuur 1 om te waarborgen dat gestandaardiseerde datasets zijn gegenereerd voor latere machine learning- en verklaarbaarheidsanalyses.
  11. Verwachte output - Genereer gereinigde en gestandaardiseerde datasets met ontbrekende waarden die correct zijn geadresseerd, categorische variabelen gecodeerd, numerieke kenmerken genormaliseerd en records gesplitst in trainings-, validatie- en testsubsets. Zorg ervoor dat datasetkenmerken, klasseverdelingen en validatieprocedures overeenkomen met die gerapporteerd in Tabel 2 en Tabel 3, en bevestig succesvolle preprocessingvalidatie zoals geïllustreerd in Figuur 1.
DatasetTypeSamplesKenmerkenDoel
BorstkankerTabulair56930Goedaardig/kwaadaardig
DiabetesTabulair7688Uitkomst van diabetes
MIMIC-IIIEPD~60.000Klinische variabelenSterfte
Röntgenfoto van de borstBeeldvorming~112.000AfbeeldingenZiektelabels

Tabel 2: Kenmerken van de dataset en gebruiksgevallen in de gezondheidszorg.

Deze tabel geeft een samenvatting van de gebruikte gezondheidszorgdatasets in de studie, inclusief type dataset, aantal steekproeven, aantal kenmerken, doelvariabelen, toepassingsdomein voor de gezondheidszorg en bijbehorende klinische gebruikssituaties. De datasets omvatten gestructureerde klinische dossiers, elektronische patiëntendossiers en medische beeldvormingsgegevens om de toepasbaarheid van het kader in diverse zorganalysescenario's aan te tonen.

DatasetSteekproefgrootteKlassenverdelingSplitstrategieLekpreventieHyperparameter ZoekenKruisvalidatieExterne test
Borstkanker (UCI Wisconsin)569357 Benign / 212 Malignant70/15/15Preprocessing alleen voor treinenRasterzoektocht5-voudig gelaagd CVOnafhankelijke Holdout-set
Pima-indianen diabetes768500 Niet-Diabetes / 268 Diabetisch70/15/15Preprocessing alleen voor treinenRasterzoektocht5-voudig gelaagd CVOnafhankelijke Holdout-set
MIMIC-III EHR5274Uitkomstgestratificeerde cohorten70/15/15 PatiëntniveauPatiëntniveau-scheidingWillekeurige zoekopdracht5-voudig patiëntniveau CVOnafhankelijke Holdout-set
NIH Thoraxfoto112120Longontsteking/Normaal gestratificeerd70/15/15Beeldniveau-scheidingWillekeurige zoekopdracht5-voudig gelaagd CVOnafhankelijke Holdout-set

Tabel 3: Validatie op datasetniveau en experimenteel ontwerp.

Deze tabel vat de gebruikte validatiemethodologie voor elke dataset samen, inclusief steekproefgrootte, klassenverdeling, train-validatie-test splitstrategie, lekpreventieprocedures, hyperparameteroptimalisatiemethoden, kruisvalidatieontwerp en externe testprotocollen. Deze maatregelen werden geïmplementeerd om methodologische strengheid, reproduceerbaarheid en onbevooroordeelde modelevaluatie te waarborgen.

figure-protocol-1
Figuur 1: Validatie van de data-voorverwerkingspijplijn.
Validatieresultaten voor belangrijke preprocessing-operaties uitgevoerd vóór modelontwikkeling. (A) Analyse van ontbrekende waarde over representatieve gezondheidszorgkenmerken. (B) Verdeling van een numerieke variabele vóór en na de behandeling van uitschieters. (C) Validatie van feature-schaal met standaardisatie. (D) Categorische coderingsvalidatie. (E) Klassenverdeling na preprocessing. (F) Validatie van de opdeling van trein-validatie-test gegevens. Deze resultaten bevestigen succesvolle voorverwerking en voorbereiding van de datasets voor voorspellende modellering en verklaarbaarheidsanalyse. Klik hier om een grotere versie van deze figuur te bekijken.

4. Systeemarchitectuur van het verklaarbare AI-framework

  1. Organiseer het framework met een gelaagde architectuur om modulaire verwerking te faciliteren, workflowtransparantie te verbeteren en reproduceerbare implementatie te ondersteunen. Configureer de Datalaag om ruwe gezondheidsdatasets te ontvangen en te beheren. Routeer alle binnenkomende datasets door de Data Layer voordat je preprocessing-operaties start.
  2. Voer gegevensopruiming, transformatie, normalisatie, feature engineering en coderingsprocedures uit binnen de Preprocessing-laag. Zorg ervoor dat alle preprocessing-operaties zijn afgerond vóór modelontwikkeling.
  3. Ontwikkel voorspellende modellen binnen de Modeling Layer met behulp van machine learning en deep learning-algoritmen. Train Gradient Boosting, Random Forest, Multilayer Perceptron (MLP) en Convolutional Neural Network (CNN) modellen met behulp van de vooraf verwerkte datasets en geoptimaliseerde hyperparameterconfiguraties.
  4. Pas uitlegbaarheidstechnieken toe binnen de Uitlegbaarheidslaag om modelvoorspellingen te interpreteren. Genereer feature-attributie-uitleg met SHAP en LIME voor gestructureerde datasets. Genereer Grad-CAM heatmaps voor beeldgebaseerde modellen om regio's te visualiseren die bijdragen aan modelvoorspellingen.
  5. Evalueer de voorspellende en verklaarbare prestaties binnen de Evaluatielaag. Bereken nauwkeurigheid, precisie, recall, F1-score, ROC-AUC, trouw, stabiliteit en clinici-gerichte evaluatiemetrics. Registreer alle evaluatie-uitkomsten voor latere analyse en rapportage.
  6. Genereer klinisch interpreteerbare visuele output binnen de Visualisatielaag. Maak prestatievergelijkingsgrafieken, visualisaties van feature-importance, SHAP-samenvattingsdiagrammen, LIME-uitleg, Grad-CAM heatmaps en rapportagedashboards gericht op clinici's. Sla alle visuele output op voor opname in het definitieve experimentele rapport.
  7. Bekijk de volledige frameworkarchitectuur zoals geïllustreerd in Figuur 2 voordat je doorgaat met de workflow-uitvoering.
  8. Verwachte output - Genereer volledig getrainde machine learning- en deep learning-modellen, waaronder Gradient Boosting, Random Forest, CNN en MLP-architecturen. Opslagmodelconfiguraties, geoptimaliseerde hyperparameters, trainingslogs, checkpointbestanden, uitlegbaarheidsuitdata en visualisatie-artefacten voor latere evaluatie en interpreteerbaarheidsanalyse.

figure-protocol-2
Figuur 2: Systeemarchitectuur van het Explainable AI-framework voor gezondheidszorganalyse. Klik hier om een grotere versie van deze figuur te bekijken.

5. Workflow-uitvoering

  1. Verkrijg gezondheidszorgdatasets uit openbaar beschikbare repositories en sla deze op in gestructureerde formaten die geschikt zijn voor machine learning en deep learning-analyse. Bekijk de volledige workflow zoals geïllustreerd in Figuur 3 voordat je de experimentele procedure start.
  2. Voer het opschonen en voorverwerken van gegevens uit volgens de procedures beschreven in Sectie 3. Normaliseer numerieke variabelen met behulp van geschikte schaalmethoden. Cogeer categorische variabelen met geschikte coderingstechnieken. Identificeer en imputeer ontbrekende waarden met behulp van dataset-specifieke imputatiestrategieën. Controleer de gegevenskwaliteit, feature-label-uitlijning en de volledigheid van datasets voordat u doorgaat met modelontwikkeling.
  3. Verdeel elke dataset in trainings-, validatie- en testsubsets om onbevooroordeelde modelevaluatie te ondersteunen. Behoud klasseverdelingen tijdens dataset-partitionering en voer waar toepasselijk maatregelen voor het voorkomen van lekkage uit. Reserveer de testsubset exclusief voor de definitieve modelevaluatie.
  4. Train machine learning-modellen op gestructureerde datasets met behulp van ensemble-gebaseerde algoritmen, waaronder Gradient Boosting en Random Forest. Train deep learning-modellen op beeldvormingsdatasets met behulp van Convolutional Neural Network (CNN)-architecturen die ruimtelijke beeldkenmerken kunnen leren. Werk modelparameters iteratief bij tijdens training en monitor validatieprestaties na elke trainingsperiode. Pas vroegtijdig stoppen toe wanneer validatieprestaties verslechteren of niet verbeteren volgens de vooraf gedefinieerde stopcriteria.
  5. Optimaliseer modelhyperparameters met behulp van systematische zoekstrategieën, waaronder gridzoekopdrachten en gerandomiseerde zoekopdrachten. Pas de leersnelheid, het aantal schatters, boomdiepte, batchgrootte, aantal epochs en andere modelspecifieke parameters aan volgens validatieprestaties. Selecteer het uiteindelijke model op basis van voorspellende prestaties en generalisatiecapaciteit over validatiedatasets.
  6. Pas uitlegbaarheidsmethoden toe nadat je modeltraining hebt afgerond. Genereer globale verklaringen met feature-attributietechnieken om variabelen te identificeren die het sterkst bijdragen aan modelvoorspellingen. Genereer lokale verklaringen om individuele voorspellingsgevallen te analyseren en modelgedrag op steekproefniveau te evalueren. Maak Grad-CAM heatmaps voor beeldclassificatiemodellen om gebieden van het beeld te markeren die bijdragen aan het voorspelde resultaat. Sla alle uitlegresultaten op voor latere analyse en rapportage.
  7. Evalueer de voorspellende prestaties met behulp van nauwkeurigheid, precisie, recall, F1-score en het bedieningsgebied van de ontvanger onder de curve (ROC-AUC). Beoordeel de kwaliteit van de uitleg met behulp van betrouwbaarheids- en stabiliteitsmetrics om de betrouwbaarheid en consistentie van de uitleg te evalueren. Vergelijk modelprestaties over datasets en verklaarbaarheidsmethoden om de robuustheid en generaliseerbaarheid van het framework te beoordelen.
  8. Genereer visualisatie-uitkomsten en analytische rapporten om resultaten op een klinisch interpreteerbare manier te communiceren. Maak prestatievergelijkingsgrafieken, feature-importance plots, SHAP-samenvattingsvisualisaties, LIME-uitlegresultaten, Grad-CAM heatmaps en andere klinisch relevante visualisaties. Bekijk alle visuele uitkomsten om duidelijkheid en consistentie te waarborgen voordat je rapporteert.
  9. Documenteer alle preprocessing-operaties, modelconfiguraties, hyperparameterinstellingen, uitlegbaarheidsprocedures, validatiestrategieën en evaluatieresultaten. Onderhoud gedetailleerde experimentele records om reproduceerbaarheid en onafhankelijke replicatie van de workflow te vergemakkelijken. Controleer de consistentie van de resultaten over herhaalde experimentele runs en archiveer alle workflow-artefacten voor toekomstig gebruik.
  10. Verwachte output - Genereer een volledig getraind voorspellend model met geoptimaliseerde hyperparameters, opgeslagen modelgewichten, trainingslogboeken, prestatiemetrics en uitlegbaarheidsoutputs, inclusief SHAP-uitleg, LIME-uitleg en Grad-CAM heatmaps. Sla alle modelartefacten, evaluatierapporten en visualisatie-uitkomsten op voor latere analyse en reproduceerbaarheidsbeoordeling.

figure-protocol-3
Figuur 3: End-to-end workflow van de Explainable AI-pijplijn. Klik hier om een grotere versie van deze figuur te bekijken.

6. Modelevaluatie en Verklaring Beoordeling

  1. Evalueer de prestaties van voorspellend model met behulp van standaard classificatiemetrics, waaronder nauwkeurigheid, precisie, terugroep, F1-score en het bedieningskarakteristiekgebied van de ontvanger onder de curve (ROC-AUC). Bereken nauwkeurigheid om de algehele classificatiecorrectheid te meten.
  2. Bereken precisie om het aandeel correct geïdentificeerde positieve voorspellingen te beoordelen. Bereken de terugroeping om het vermogen van het model te evalueren om positieve gevallen te identificeren. Bereken de F1-score om precisie en herinnering in balans te brengen. Bereken ROC-AUC om discriminatieprestaties over verschillende classificatiedrempels te beoordelen.
  3. Pas deze evaluatiemetrics consequent toe over alle datasets en modelarchitecturen om objectieve prestatievergelijking te vergemakkelijken. Registreer alle metrische waarden en sla de evaluatieresultaten op voor latere statistische analyse en rapportage.
  4. Beoordeel de prestaties van verklaarbaarheid met behulp van trouw- en stabiliteitsmetrics. Bereken trouwheid om te bepalen in hoeverre gegenereerde verklaringen modelvoorspellingen en besluitvormingsgedrag nauwkeurig weergeven.
  5. Bereken stabiliteit door verklaringen te vergelijken die uit vergelijkbare inputmonsters zijn gegenereerd en de consistentie van uitleg-uitkomsten te kwantificeren. Controleer of getrouwheids- en stabiliteitswaarden voldoen aan de vooraf gedefinieerde kwaliteitscriteria voordat je modeluitleg interpreteert.
  6. Vergelijk de uitlegbaarheid van de prestaties tussen SHAP-, LIME- en Grad-CAM-uitgangen.
  7. Verwachte output - Genereer kwantitatieve evaluatieresultaten, waaronder nauwkeurigheid, precisie, recall, F1-score, ROC-AUC, betrouwbaarheid en stabiliteitsindicatoren. Produceer uitleg en visualisaties die geschikt zijn voor wetenschappelijke rapportages, reproduceerbaarheidsbeoordeling en klinische interpretatie.

7. Mensgerichte evaluatie

  1. Werf 12 zorgprofessionals, bestaande uit 6 artsen, 3 radiologen en 3 klinische data-analisten. Selecteer deelnemers met eerdere ervaring in klinische besluitvorming, interpretatie van medische beelden, gezondheidsanalyse of elektronische patiëntendossierbeoordeling. Verkrijg geïnformeerde toestemming van alle deelnemers voordat je de evaluatieprocedure start.
  2. Selecteer willekeurig 100 gevallen uit de testdatasets na voltooiing van modeltraining en verklaarbaarheidsanalyse. Genereer twee evaluatievoorwaarden voor elke casus:
    1. Alleen voorspellingsoutput en
    2. voorspelling vergezeld van informatie over verklaarbaarheid. Randomiseer de volgorde van presentaties en evaluatievoorwaarden om presentatiebias en leereffecten te minimaliseren.
  3. Bereid gestandaardiseerde evaluatieformulieren voor met voorspellingsresultaten, uitleg en beoordelingsvragenlijsten. Presenteer casussen individueel aan deelnemers via een computergebaseerde evaluatie-interface.
  4. Geef deelnemers opdracht om elk geval onafhankelijk te beoordelen zonder de antwoorden met andere beoordelaars te bespreken. Laat deelnemers alle evaluaties onder identieke experimentele omstandigheden uitvoeren.
  5. Voer een vijfpuntsvragenlijst op Likert-schaal uit, aangepast van gepubliceerde verklarbare evaluatiestudies over kunstmatige intelligentie. Instrueren deelnemers om vertrouwen, interpreteerbaarheid en bruikbaarheid te beoordelen voor elk beoordeeld geval. Noteer de antwoorden op de vragenlijst elektronisch en verifieer de invulling van alle enquête-items voordat je overgaat tot statistische analyse.
  6. Meet objectieve indicatoren van klinische bruikbaarheid tijdens het evaluatieproces. Leg beslissingsovereenkomst vast door de beslissingen van deelnemers te vergelijken met de bijbehorende referentielabels of grondwaarheidsuitkomsten. Bereken beslissingsovereenstemming als het percentage deelnemersbeslissingen dat overeenkomt met het referentieresultaat.
  7. Noteer de beoordelingstijd voor elke zaak door het interval te meten tussen de presentatie van de zaak en het indienen van het eindantwoord. Bereken de gemiddelde beoordelingstijd apart voor voorspellings- en voorspelling-met-uitleg-voorwaarden.
  8. Bereken gemiddelde vertrouwen-, interpreteerbaarheid- en bruikbaarheidsscores voor alle deelnemers en evaluatiegevallen. Vergelijk scores verkregen onder voorspelling-only en voorspelling-met-verklaring-voorwaarden.
  9. Voer na voltooiing van alle deelnemersevaluaties gepaarde t-tests uit om te bepalen of verschillen in vertrouwen, interpreteerbaarheid, bruikbaarheid, besluitovereenstemming en beoordelingstijd statistisch significant zijn. Gebruik een significantiedrempel van p 0,05 voor alle statistische vergelijkingen.
  10. Bereken Fleiss Kappa na het verzamelen van reacties van alle deelnemers om de overeenstemming tussen beoordelaars te beoordelen. Gebruik de geaggregeerde deelnemersbeoordelingen om de consistentie van evaluaties tussen beoordelaars te bepalen. Interpreteer de waarden van Fleiss Kappa volgens vastgestelde overeenkomstrichtlijnen en registreer de resulterende overeenkomststatistieken.
  11. Vat de demografie van de deelnemers, evaluatiemethodologie, het ontwerp van de vragenlijst, statistische analyseprocedures, objectieve prestatiematen en de resultaten van overeenstemming tussen beoordelaars samen in Tabel 4.
  12. Bekijk modelresultaten onder beide evaluatievoorwaarden en vergelijk de reacties van deelnemers over de omstandigheden. Controleer of verklaringen het vertrouwen, de interpreteerbaarheid en bruikbaarheid verbeteren zonder de beslissingskwaliteit negatief te beïnvloeden.
  13. Bevestig de consistentie van de deelnemersbeoordelingen met behulp van de berekende Fleiss Kappa-statistiek. Registreer alle evaluatieresultaten voor latere rapportage en reproduceerbaarheidsbeoordeling.
  14. Verwachte output - Genereer vertrouwensscores van kliniciën, interpreteerbaarheidsbeoordelingen, bruikbaarheidsbeoordelingen, beslissingsovereenkomstmaten, beoordelingsstatistieken, gepaarde t-testresultaten en inter-rater overeenkomststatistieken. Produceer kwantitatieve bewijzen die de klinische bruikbaarheid, interpretatie en betrouwbaarheid van het verklaarbare kunstmatige intelligentiesysteem beschrijven.
ParameterWaarde
Experts12
Artsen6
Radiologen3
Klinische data-analisten3
Beoordeelde zaken100
EvaluatieontwerpGerandomiseerd (alleen voorspelling versus voorspelling+uitleg)
Surveyinstrument5-punts Likert-schaal
TrustbeoordelingInterpreteerbaarheid, Vertrouwen, Bruikbaarheid
Statistische TestGepaarde t-test (p 0,05)
Inter-rater betrouwbaarheidFleiss Kappa
Objectieve MaatregelenBeslissingsovereenkomst, Beoordelingstijd

Tabel 4: Mensgericht evaluatieprotocol en Ontwerp van de Clinici-beoordeling.

Deze tabel presenteert het evaluatiekader voor clinici dat wordt gebruikt om de interpreteerbaarheid, betrouwbaarheid en bruikbaarheid van het verklaarbare AI-systeem te beoordelen. Informatie over de demografie van de deelnemers, de methodologie van case review, het ontwerp van enquêtes, statistische analyseprocedures, inter-rater betrouwbaarheidsbeoordeling en objectieve evaluatiematen wordt samengevat.

8. Validatie- en reproduceerbaarheidsbeoordeling

  1. Voer validatie- en ablatiestudies uit om de robuustheid en betrouwbaarheid van het voorgestelde kader te beoordelen. Identificeer kenmerken met hoge belangrijkheidsscores met behulp van de geselecteerde verklaringsmethoden. Verwijder belangrijke features stapsgewijs en train de voorspellende modellen opnieuw na elke stap van feature-verwijdering.
  2. Evalueer de modelprestaties na elk ablatie-experiment met behulp van nauwkeurigheid, precisie, herinnering, F1-score en ROC-AUC-metrieken. Vergelijk de resulterende prestatiewaarden met de basismodelprestaties om de bijdrage van individuele kenmerken aan voorspellende uitkomsten te bepalen.
  3. Beoordeel de stabiliteit van verklaringen door verklaringen te genereren voor vergelijkbare inputmonsters met SHAP, LIME en Grad-CAM. Vergelijk uitlegresultaten over herhaalde evaluaties en kwantificeer consistentie met behulp van de vooraf gedefinieerde stabiliteitsmetrics. Controleer of verklaringen stabiel blijven bij kleine invoervariaties en herhaalde experimentele runs.
  4. Registreer alle experimentele procedures gedurende de hele workflow. Documenteer voorverwerkingsoperaties voor dataset, dataset-partitioneringsprocedures, modelarchitecturen, hyperparameterinstellingen, trainingsconfiguraties, verklaarbaarheidsmethoden, validatiestrategieën en evaluatiemetrics. Sla alle configuratieparameters en experimentele uitgangen op in een gestructureerd formaat om reproduceerbaarheid en onafhankelijke verificatie te vergemakkelijken.
  5. Bekijk alle experimentele dossiers om volledigheid en consistentie te waarborgen. Controleer of de workflow kan worden gerepliceerd met behulp van de gedocumenteerde procedures, configuratiebestanden en softwarespecificaties. Behoud een modulaire workflowstructuur om de aanpassing van het protocol voor toekomstige studies te faciliteren en ondersteun de overgang naar een videogebaseerd experimenteel protocol dat consistent is met de JoVE-methodologische eisen.

9. Reproduceerbaarheidsbronnen

  1. Voer alle experimenten uit met vaste willekeurige seeds om reproduceerbare resultaten te garanderen over herhaalde runs. Onderhoud broncode, preprocessing-scripts, configuratiebestanden, omgevingsspecificaties, modelparameters en visualisatiescripts binnen een publiek toegankelijke repository.
  2. Geef gedetailleerde instructies voor datasetverwerving, voorverwerking, experimentuitvoering, modeltraining, uitlegbaarheidsgeneratie, validatieprocedures en regeneratie van alle gerapporteerde tabellen en figuren. Archiveer alle workflowcomponenten die nodig zijn voor onafhankelijke replicatie, inclusief softwarespecificaties, preprocessing-workflows, configuratiebestanden, dataset-toegangsinstructies, modelcontrolepunten en visualisatie-assets.
  3. Vat de softwarebronnen, preprocessing-workflows, configuratiebestanden, datasettoegangsinstructies en reproduceerbaarheidsassets samen die door het hele framework worden gebruikt in Tabel 5.
  4. Verwachte output - Genereer een compleet reproduceerbaar experimenteel pakket met preprocessingscripts, configuratiebestanden, getrainde modellen, modelcontrolepunten, uitlegbaarheidsuitgangen, validatierapporten, visualisatie-artefacten, softwarespecificaties en documentatie die nodig is voor onafhankelijke replicatie en verificatie van het voorgestelde framework.
BronBeschrijving
BroncodePython-implementatiescripts voor datapreprocessing, modeltraining, uitlegbaarheid en evaluatie
Omgevingsbestandrequirements.txt die pakketafhankelijkheden en versies bevatten
ConfiguratiebestandenModelarchitectuurinstellingen, hyperparameters en experimentconfiguraties
Opgeloste willekeurige zadenZaad = 42 gebruikt voor reproduceerbare experimenten
Instructies voor datasettoegangLinks en procedures voor het verkrijgen van datasets van de publieke gezondheidszorg
Preprocessing ScriptsScripts voor data-opschoning, normalisatie, codering en feature-selectie
Figuurgeneratie ScriptsScripts om alle manuscriptfiguren te regenereren
Tabelgeneratie-scriptsScripts om gerapporteerde tabellen en metrieken te reproduceren.
VoorbeeldinvoerVoorbeelddatasets en invoerbestanden
VoorbeelduitvoerVoorspellingsresultaten, uitleg en evaluatierapporten

Tabel 5: Reproduceerbaarheidsbronnen en experimentele assets.

Deze tabel vat de bronnen samen die worden geleverd ter ondersteuning van experimentele reproduceerbaarheid, waaronder broncode, preprocessing-scripts, configuratiebestanden, omgevingsspecificaties, dataset-toegangsinstructies, vaste willekeurige seedinstellingen, figuurgeneratiescripts en voorbeeldinvoer-/uitvoerbestanden die nodig zijn om de gerapporteerde resultaten te reproduceren.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

We hebben het verklarende AI-onderdeel van onze hele pijplijn grondig geëvalueerd, waarbij we beoordeelden hoe goed het voorspelde over verschillende soorten zorgdata, waaronder zowel gestructureerde klinische data als medische beelden. De uitkomsten gaven consistente voorspellende prestaties aan over de geëvalueerde datasets. Van de geteste modellen behaalde het gradient boosting-model de hoogste nauwkeurigheid met 97,4%, gevolgd door het random forest-model met 94,2%. Deep learning-met...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Deze studie ontwikkelde en evalueerde een reproduceerbare verklarbare kunstmatige intelligentie (XAI) workflow voor gezondheidszorganalyse die voorspellende modellering, uitlegbaarheidsbeoordeling, clinici-gerichte evaluatie en reproduceerbaarheidsbronnen integreert binnen één protocol. De resultaten toonden aan dat ensemble-gebaseerde machine learning-modellen, met name Gradient Boosting en Random Forest, de hoogste voorspellende prestaties behaalden op de geëvalueerde gestructureerde g...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs verklaren dat zij geen concurrerende financiële belangen of belangenconflicten hebben met betrekking tot dit werk. Het onderzoek werd onafhankelijk uitgevoerd zonder commerciële of financiële relaties die als een potentieel belangenconflict konden worden opgevat.

Openbaarmaking van gebruik van kunstmatige intelligentie

Kunstmatige intelligentie-tools werden gebruikt voor taalverfijning, grammaticacontrole en redactionele ondersteuning tijdens de voorbereiding van manuscripten. Alle wetenschappelijke inhoud, experimentele ontwerpen, data-analyse, interpretatie en definitieve manuscriptverificatie werden uitgevoerd door de auteurs. De auteurs beoordeelden en valideerden alle AI-ondersteunde output om nauwkeurigheid, integriteit en naleving van de richtlijnen van het tijdschrift te waarborgen.

Dankbetuigingen

De auteurs willen hun respectievelijke instellingen bedanken voor het bieden van de benodigde infrastructuur en onderzoeksondersteuning om deze studie uit te voeren. De auteurs erkennen ook het gebruik van publiek beschikbare datasets en open-source tools die de ontwikkeling en evaluatie van het voorgestelde verklaarbare AI-kader hebben vergemakkelijkt. Speciale dank gaat uit aan domeinexperts die waardevolle inzichten hebben geleverd tijdens de mensgerichte evaluatiefase.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
GPU WorkstationFabrikantsafhankelijkNATraining van deep learning-modellen
Jupyter NotebookProject JupyterLaatste stabiele versieInteractieve experimentuitvoering
LIMELIMEVersie 0.2.0Lokale interpretabele verklaringen
MatplotlibMatplotlib ProjectVersie 3.9Datavisualisatie
MIMIC-III DatabasePhysioNetVersie 1.4Analyse van elektronische gezondheidsrecords
NIH Chest X-ray DatasetNIH Clinical CenterOpenbare datasetClassificatie van thoraxaandoeningen
NumPyNumPy-ontwikkelaarsVersie 1.26Numerieke berekeningen en matrixbewerkingen
OpenCVOpenCV FoundationVersie 4.10Afbeeldingsvoorverwerking
PandasPandas Development TeamVersie 2.1Gegevensmanipulatie en voorverwerking
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryOpenbare datasetRisicovoorspelling voor diabetes
Python 3.11Python Software FoundationVersie 3.11Primaire programmeeromgeving
Scikit-learnscikit-learnVersie 1.5Machine learning-algoritmen en evaluatie
SeabornSeabornVersie 0.13Statistische visualisatie
SHAPSHAPVersie 0.46Functietoewijzing en verklaarbaarheid
TensorFlowTensorFlowVersie 2.15Ontwikkeling van deep learning-modellen
Windows / Ubuntu LinuxMicrosoft / CanonicalNABesturingssysteem
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryOpenbare datasetDiagnose van borstkanker

Referenties

  1. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  2. Ribeiro MT, Singh S, Guestrin C. Why should I trust you. Explaining the predictions of any classifier. Presented at: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 1135-44. doi:10.1145/2939672.2939778.
  3. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 2020;128(2):336-59.
  4. Tjoa E, Guan C. A survey on explainable artificial intelligence: Toward medical XAI. IEEE Trans Neural Netw Learn Syst. 2021;32(11):4793-813.
  5. Samek W, et al. Explainable AI: Interpreting, Explaining and Visualizing Deep Learning. Springer; Cham; 2019.
  6. Arrieta AB, et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  7. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. Wiley Interdiscip Rev Data Min Knowl Discov. 2020;10(5):e1312.
  8. Topol E. Deep medicine: How artificial intelligence can make healthcare human again. Nat Med. 2020;25:44-56.
  9. Esteva A, et al. A guide to deep learning in healthcare. Nat Med. 2019;25(1):24-9.
  10. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28:31-38.
  11. Doshi-Velez F, Kim B. Towards a rigorous science of interpretable machine learning. arXiv. 2021. doi:10.48550/arXiv.1702.08608.
  12. Molnar C. Interpretable Machine Learning. Lulu Press; 2022.
  13. Rudin C. Stop explaining black box machine learning models for high-stakes decisions and use interpretable models instead. Nat Mach Intell. 2019;1(5):206-15.
  14. Zhang Q, Zhu S. Visual interpretability for deep learning: A survey. Front Inf Technol Electron Eng. 2020;21:27-39.
  15. Holzinger A, Biemann C, Pattichis CS, Kell DB. What do we need to build explainable AI systems for the medical domain. arXiv. 2020. Available at: https://arxiv.org/abs/1712.09923.
  16. McDermott MB, et al. Reproducibility in machine learning for health. Nat Med. 2021;27:1016-23.
  17. Kelly CJ, et al. Key challenges for delivering clinical impact with AI. BMC Med. 2019;17:195.
  18. Ahmad MA, Teredesai A, Eckert C. Interpretable machine learning in healthcare. Proc ACM Conf Health Inference Learn. 2021;4:1-7.
  19. Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable AI in healthcare. Lancet Digit Health. 2021;3(11):e745-50.
  20. Carvalho DV, Pereira EM, Cardoso JS. Machine learning interpretability: A survey on methods and metrics. Inf Fusion. 2020;58:82-115.
  21. Chen RJ, et al. Synthetic data in healthcare: A narrative review. Nat Biomed Eng. 2021;5:493-97.
  22. Zhou B, et al. Learning deep features for discriminative localization. Presented at: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2016. p. 2921-29.
  23. Vellido A. The importance of interpretability and visualization in machine learning for applications in medicine and health care. Expert Syst Appl. 2020;146:113222.
  24. Lipton ZC. The mythos of model interpretability. Commun ACM. 2018;61(10):36-43.
  25. Guidotti R, et al. A survey of methods for explaining black box models. ACM Comput Surv. 2018;51(5):93.
  26. Suresh H, Guttag J. A framework for understanding unintended consequences of machine learning. Commun ACM. 2021;64(12):42-50.
  27. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-40.
  28. Rajkomar A, Dean J, Kohane I. Machine learning in medicine. N Engl J Med. 2019;380(14):1347-58.
  29. Lundberg SM, Lee SI. A unified approach to interpreting model predictions. Presented at: Advances in Neural Information Processing Systems. 2017;30:4765-74.
  30. Agarwal R, et al. Neural additive models: Interpretable machine learning with neural nets. Presented at: Advances in Neural Information Processing Systems. 2021;34:4699-711.
  31. Singh C, Murdoch WJ, Yu B. Hierarchical interpretations for neural network predictions. Proc Natl Acad Sci U S A. 2020;117(32):19950-57.
  32. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(5):176-85.
  33. Wang F, Preininger A. AI in health care: Applications, challenges, and future directions. Annu Rev Biomed Data Sci. 2019;2:221-52.
  34. Azizi S, et al. Big self-supervised models advance medical AI. Nat Med. 2021;27(8):1431-42.
  35. Zhang Y, et al. Explainable deep learning for healthcare: Methods, applications and challenges. IEEE Access. 2020;8:120455-475.
  36. Holzinger A, et al. Explainable AI methods: A brief overview. Mach Learn Knowl Extr. 2021;3(2):606-27.
  37. Rudin C, Radin J. Why are we using black box models in AI when we do not need to  A lesson from an explainable AI competition. Nat Mach Intell. 2019;1(5):206-15.
  38. Doshi-Velez F, et al. Accountability of AI Under the Law: The Role of Explanation. Harvard University; Cambridge; 2020.
  39. Kaur H, et al. Interpreting interpretability: Understanding data scientists' use of interpretability tools for machine learning. Presented at: Proceedings of the CHI Conference on Human Factors in Computing Systems; 2020. p. 1-14.
  40. Caruana R, et al. Intelligible models for healthcare: Predicting pneumonia risk and hospital 30-day readmission. Presented at: Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2015. p. 1721-30.
  41. Mangalote IAC, et al. Development and validation of a class imbalance-resilient cardiac arrest prediction framework incorporating multiscale aggregation, ICA and explainability. IEEE Trans Biomed Eng. 2025;72(5):1674-84.
  42. Ansari MY, Mangalote IAC, Masri D, Dakua SP. Neural network-based fast liver ultrasound image segmentation. Presented at: 2023 International Joint Conference on Neural Networks; 2023. p. 1-8.
  43. Dakua SP, et al. Artificial intelligence enabled biomineralization for eco-friendly nanomaterial synthesis: Charting future trends. Nano Select. 2025;6(5):e202400118.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Trefwoorden

TechniekEditie 233Editie 233Lege waardeEditieUitlegbare kunstmatige intelligentie XAIMachine learningdeep learningModelinterpreteerbaarheidKlinische beslissingsondersteuningssystemenReproduceerbaar experimenteel protocol