Onderzoeksartikel

Een reproduceerbaar protocol voor het ontwikkelen en evalueren van verklaarbare kunstmatige intelligentie-frameworks in gezondheidszorganalyse

DOI:

10.3791/71999

31 juli 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hier presenteren we een reproduceerbaar protocol voor het ontwikkelen en evalueren van verklaarbare kunstmatige intelligentiemodellen voor gezondheidszorganalyse. De workflow integreert datapreprocessing, voorspellende modellering, SHAP-, LIME- en Grad-CAM-gebaseerde verklaarbaarheid, kwantitatieve evaluatie en mensgerichte validatie om transparante en betrouwbare klinische besluitvorming te ondersteunen.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Verklaarbare Kunstmatige Intelligentie (XAI) wordt steeds meer erkend als een onmisbaar hulpmiddel voor het bouwen van betrouwbare AI-systemen in de gezondheidszorg, waar transparantie en het vermogen om beslissingen uit te leggen essentiële onderdelen zijn van klinische besluitvorming. Deze publicatie presenteert een reproduceerbare experimentele benadering voor het ontwikkelen en evalueren van verklaarbare AI-systemen voor gezondheidszorganalyse. De ontwikkelde pijplijn integreert de stappen van datapreprocessing, voorspellende modellering, interpretatiegeneratie en evaluatie in één naadloze workflow die kan worden toegepast op zowel gestructureerde klinische data als medische beeldvormingsdatasets. Ensemble machine learning-modellen hebben sterke voorspellende prestaties aangetoond op gestructureerde tabulaire datasets, terwijl deep learning-modellen effectief zijn voor het leren van complexe patronen in medische beeldvormingsdata. Technieken zoals SHAP, LIME en Grad-CAM zijn globale en lokale verklaringen die modelinterpretatie vergemakkelijken. Heel behulpzaam. De kwantitatieve beoordeling van het kader omvat veel verschillende maatstaven zoals nauwkeurigheid, precisie, herinnering, F1-score, ROC-AUC, verklaringsmetrieken, trouw en stabiliteit. De resultaten geven aan dat wanneer de experimentele omstandigheden worden gecontroleerd, het kader verbeterde voorspellende prestaties en uitlegkwaliteit onder de geëvalueerde experimentele omstandigheden heeft aangetoond. Als een document dat door protocol wordt geleid, ondersteunt dit werk de reproduceerbaarheid en schaalbaarheid, de blijvende implementatie door andere levende wezens. Dit transparante, begrijpelijke AI-model vormt de basis waarop klinische besluitvormingsondersteuning en zorganalysesystemen vertrouwen krijgen en op grote schaal worden gebruikt.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kunstmatige intelligentie (AI) is een belangrijk onderdeel geworden van de moderne gezondheidszorg door het ondersteunen van ziektediagnose, prognose, risicostratificatie, medische beeldanalyse en klinischebesluitvorming. Vooruitgang in machine learning en deep learning heeft zorgsystemen in staat gesteld grote hoeveelheden gestructureerde en ongestructureerde data te verwerken, vaak met voorspellende prestaties die vergelijkbaar zijn met of beter zijn dan conventionele statistische benaderingen2. Ondanks deze vooruitgang functioneren veel AI-modellen als complexe black-box-systemen, waardoor het voor clinici en zorgprofessionals moeilijk is te begrijpen hoe voorspellingenworden gegenereerd. Dit gebrek aan transparantie kan vertrouwen, adoptie en verantwoordelijkheid beperken in zorgomgevingenmet hoge inzet 4,5.

Verklaarbare kunstmatige intelligentie (XAI) is naar voren gekomen als een veelbelovende benadering om de transparantie en interpreteerbaarheid van machine learning modellen6 te verbeteren. Veelgebruikte verklaringstechnieken, waaronder SHAP (Shapley additive explanations), LIME (Local interpretable model-agnostic explanations) en Gradient-weighted class activation mapping (Grad-CAM), bieden inzicht in modelgedrag via feature-attributie en visuele verklaringsmechanismen 7,8,9. Deze methoden worden steeds vaker toegepast op zorgtoepassingen ter ondersteuning van klinische interpretatie, modelauditing en beslissingsondersteuning10,11. Verklaarbaarheid alleen garandeert echter geen betrouwbaarheid, reproduceerbaarheid of klinisch nut. Recente studies hebben uitdagingen aangetoond die verband houden met instabiliteit in verklaringen, gevoeligheid voor verstoringen, beperkte validatie door clinici en inconsistenties tussen uitleg en true model redenering 12,13,14,15.

Naast de uitdagingen in de uitlegbaarheid blijft reproduceerbaarheid een belangrijk punt in het onderzoek naar machine learning in de gezondheidszorg 16,17,18. Veel gepubliceerde studies geven beperkte informatie over preprocessingprocedures, softwareomgevingen, hyperparameterconfiguraties, validatiestrategieën en implementatieworkflows, waardoor onafhankelijke replicatie moeilijk is 19,20,21. Bovendien richten AI-studies in de gezondheidszorg zich vaak op voorspellende prestaties, terwijl ze beperkte richtlijnen geven over de kwaliteitsbeoordeling van uitleg, door de arts gerichte evaluatie en praktischeimplementatieoverwegingen. Deze beperkingen kunnen de overgang van verklaarbare AI-systemen van onderzoeksomgevingen naar echte zorgomgevingen belemmeren 23,24,25,26,27.

Huidige workflows van healthcare XAI evalueren individuele verklaringstechnieken of voorspellende modellen vaak geïsoleerd en bieden zelden gestandaardiseerde protocollen die datavoorbereiding, voorspellende modellering, verklaarbaarheidsbeoordeling, mensgerichte evaluatie en reproduceerbaarheidsbronnen integreren 28,29,30,31. Daardoor kunnen onderzoekers en praktijkmensen problemen ondervinden bij het reproduceren van workflows, het vergelijken van verklaringsmethoden of het evalueren van het praktische nut van verklaarbare AI-systemen over verschillende zorgdatasets en toepassingsdomeinen heen. Een uitgebreid en reproduceerbaar protocol is daarom nodig om consistente implementatie, evaluatie en rapportage van verantwoordbare AI-workflows in de gezondheidszorgte faciliteren.

Hier presenteren we een reproduceerbaar protocol voor het ontwikkelen, evalueren en interpreteren van verklaarbare kunstmatige intelligentiesystemen in gezondheidszorganalyse. Het protocol integreert datapreprocessing, voorspellende modellering, uitlegbaarheidsbeoordeling met SHAP, LIME en Grad-CAM, clinici-gerichte evaluatie, validatieprocedures en reproduceerbaarheidsbronnen binnen een uniforme workflow. Het doel is een gestandaardiseerd kader te bieden dat transparante modelontwikkeling, kwaliteitsbeoordeling van uitleg en reproduceerbare implementatie ondersteunt over diverse gezondheidszorgdatasets 36,37,38,39. De methodologische bijdrage van dit werk ligt in de integratie van voorspellende analyse, uitlegbaarheidsevaluatie, validatie van clinici en reproduceerbaarheidspraktijken in één protocol dat geschikt is voor AI-onderzoek, onderwijs en implementatiegerichte studiesin de gezondheidszorg 40,41,42,43.

De belangrijkste bijdrage van dit werk is niet de ontwikkeling van een nieuw verklaarbaarheidsalgoritme.

In plaats daarvan biedt het een gestandaardiseerd, reproduceerbaar en experimenteel gevalideerd protocol dat voorspellende modellering, uitlegbaarheidsbeoordeling, visualisatie, evaluatie en mensgerichte interpretatie integreert in een uniforme workflow die geschikt is voor gezondheidszorganalyse en de verspreiding van JoVE-gebaseerde protocollen. Het primaire doel van dit werk is niet het introduceren van een nieuw voorspellend algoritme, maar het bieden van een gestandaardiseerd, reproduceerbaar en experimenteel gevalideerd protocol voor het implementeren van verklaarbare kunstmatige intelligentie-workflows in gezondheidszorganalyse. Het protocol integreert datapreprocessing, voorspellende modellering, uitlegbaarheidsbeoordeling, clinici-gerichte evaluatie en reproduceerbaarheidsbronnen in een uniform kader dat geschikt is voor adoptie, replicatie en educatieve verspreiding.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Alle datasets die in deze studie zijn gebruikt, zijn verkregen uit publiek beschikbare en volledig geanonimiseerde repositories, waaronder de UCI Machine Learning Repository, PhysioNet MIMIC-III database en NIH Chest X-ray datasets. Er werd geen identificeerbare patiëntinformatie geraadpleegd. De studie voldeed aan de ethische richtlijnen voor institutioneel onderzoek voor secundaire analyse van openbaar beschikbare gedeïdentificeerde gegevens. Formele goedkeuring van de Institutional Review Board was niet vereist omdat er geen menselijke deelnemers direct werden gerekruteerd en er geen beschermde gezondheidsinformatie werd gebruikt.

1. Overzicht van de experimentele kaders

  1. Ontwikkel een reproduceerbare, verklaarbare kunstmatige intelligentie (XAI)-pijplijn voor transparante gezondheidszorganalyse. Organiseer de workflow in de Datalaag, Preprocessing-laag, Modelleerlaag, Uitlegbaarheidslaag, Evaluatielaag en Visualisatielaag.
  2. Integreer deze modules in een uniforme workflow die in staat is gestructureerde klinische gegevens, elektronische patiëntendossiers en medische beeldvormingsdatasets te verwerken.
  3. Zorg ervoor dat elke module bijdraagt aan reproduceerbaarheid, interpreteerbaarheid, schaalbaarheid en gestandaardiseerde experimentele uitvoering.
  4. Ontwerp de modulaire architectuur om continue datastroom te ondersteunen en zorg ervoor dat elke fase van de pijplijn bijdraagt aan reproduceerbaarheid, interpreteerbaarheid en schaalbaarheid gedurende de experimentele workflow.

2. Computationele omgeving en systeemconfiguratie

  1. Installeer de benodigde softwareafhankelijkheden voordat je de workflow uitvoert door een commandoregelterminal te openen en het volgende commando uit te voeren:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Controleer de succesvolle installatie van alle softwarepakketten en controleer compatibiliteit met de softwareversies die in de Materiaaltabel staan vermeld voordat u doorgaat met datapreprocessing en modelontwikkeling.
  3. Gebruik Python 3.11 als de primaire programmeeromgeving. Installeer en configureer NumPy 1.26 en Pandas 2.1 voor datamanipulatie en feature engineering-taken. Installeer Scikit-learn 1.5 voor de ontwikkeling en evaluatie van machine learning-modellen.
  4. Installeer TensorFlow 2.15 voor deep learning-modeltraining en inferentie. Installeer SHAP 0.46 en LIME 0.2.0 voor uitlegbaarheidsanalyse. Installeer OpenCV 4.10 voor beeldverwerkingstaken. Installeer Matplotlib 3.9 en Seaborn 0.13 voor datavisualisatie en resultaatrapportage. Raadpleeg de Materiaaltabel voor volledige softwarespecificaties en implementatiedetails die nodig zijn voor reproduceerbaarheid.
  5. Configureer de computationele omgeving met een werkstation uitgerust met een multi-core processor, grafische verwerkingsunit (GPU) versnelling en voldoende geheugen om grote gezondheidsdatasets en deep learning-workloads te verwerken.
  6. Stel vaste willekeurige seeds in voor datapartitionering, modelinitialisatie en trainingsprocedures om reproduceerbaarheid te garanderen over experimentele runs. Schakel logmechanismen in om voorverwerkingsoperaties, modelconfiguraties, hyperparameterinstellingen, trainingsprocedures en evaluatieresultaten gedurende de workflow vast te leggen.
  7. Configureer de modelarchitecturen, optimalisatieparameters, leersnelheden, batchgroottes, trainingsinstellingen en hyperparameterwaarden volgens de specificaties die in Tabel 1 zijn samengevat. Houd je aan deze instellingen tijdens replicatie-experimenten om consistentie met de gerapporteerde resultaten te waarborgen.
  8. Verwachte Output - Een volledig geconfigureerde en reproduceerbare computationele omgeving met alle benodigde softwarepakketten, hardwarebronnen, logmechanismen en modelconfiguratie-instellingen beschikbaar voor latere datapreprocessing, modelontwikkeling, verklaarbaarheidsanalyse en evaluatieprocedures.
ComponentParameterWaardeBeschrijving
Willekeurig Bosn_estimators100Aantal bomen
Willekeurig Bosmax_depthGeen enkeleBoomdiepte
XGBoostlearning_rate0.01Leertempo
XGBoostn_estimators100Boost-kogels
CNNEpochs25Opleidingsperiodes
CNNbatch_size32Batchgrootte
CNNOptimizerAdamOptimalisatie-algoritme
MLPhidden_layers2Aantal verborgen lagen
MLPActiveringReLUActivatiefunctie
Algemeentrain_split70%Trainingsdataratio
Algemeenvalidation_split15%Validatieratio
Algemeentest_split15%Testverhouding

Tabel 1: Implementatiedetails en hyperparameterconfiguratie.

Deze tabel vat de computationele omgeving, softwarebibliotheken, machine learning- en deep learning-modelconfiguraties, optimalisatie-instellingen, leersnelheden, batchgroottes, trainingsparameters en hyperparameterwaarden samen die tijdens de experimentele evaluatie van het voorgestelde verklaarbare AI-framework zijn gebruikt.

3. Datasetvoorbereiding en -preprocessing

  1. Selecteer openbaar beschikbare gezondheidszorgdatasets om transparantie en reproduceerbaarheid van de experimentele workflow te waarborgen.;
  2. Gebruik vier representatieve zorgscenario's om het voorgestelde kader te valideren: (i) borstkankerdiagnose met behulp van de Wisconsin Breast Cancer Dataset, (ii) diabetesrisicovoorspelling met de Pima Indians Diabetes Dataset, (iii) klinische uitkomstvoorspelling met behulp van MIMIC-III elektronische patiëntendossiers, en (iv) classificatie van thoracale ziekten met de NIH Chest X-ray Dataset. Kies deze datasets om het kader te evalueren over gestructureerde klinische dossiers, longitudinale elektronische patiëntendossiers en medische beeldvormingsmodaliteiten die vaak worden gebruikt in zorgondersteuningssystemen.
  3. Importeer elke dataset in de Python-omgeving en scheid de records in invoerfuncties en doelvariabelen. Organiseer gestructureerde klinische gegevens voor ziektevoorspellingstaken, elektronische patiëntendossiers voor longitudinale uitkomstanalyse en medische beeldvormingsdatasets voor diagnostische classificatietaken. Controleer de integriteit van elke dataset voordat je doorgaat met preprocessing-operaties.
  4. Identificeer en pak ontbrekende waarden aan met behulp van passende imputatietechnieken. Standaardiseer numerieke kenmerken via feature-schaal- en normalisatieprocedures om vergelijkbaarheid tussen variabelen te waarborgen.
  5. Codeer categorische variabelen met geschikte coderingsmethoden op basis van datasetkenmerken. Voer feature-selectie uit met behulp van correlatieanalyse en modelgebaseerde feature-importance-metingen om de meest relevante variabelen te identificeren en de datadimensionaliteit te verminderen.
  6. Verander alle medische beelden naar 224.224 pixels vóór de modeltraining. Normaliseer pixelintensiteitswaarden volgens de eisen van de geselecteerde deep learning-architectuur. Pas data-augmentatietechnieken toe, waaronder beeldrotatie en horizontale flipping, om de generalisatie van het model te verbeteren en overfitting te verminderen. Controleer de beeldkwaliteit en zorg voor consistentie van de beeldafmetingen door de hele dataset.
  7. Beoordeel de integriteit van data door de volledigheid, consistentie en uitlijning van feature-labels te evalueren. Controleer of alle records correct zijn toegewezen aan hun bijbehorende doelklassen. Bekijk de kenmerken van de dataset, waaronder steekproefgrootte, aantal features en datamodaliteit, zoals samengevat in Tabel 2.
  8. Implementeer dataset-specifieke validatieprocedures om methodologische nauwkeurigheid en reproduceerbaarheid te waarborgen. Noteer de steekproefgrootte, klasseverdeling, train-validatie-test splitsingsstrategie, lekkagepreventiemaatregelen, hyperparameteroptimalisatieprocedures, kruisvalidatieontwerp en extern testprotocol voor elke dataset. Vat deze validatieprocedures samen in Tabel 3.
  9. Voer preprocessing-kwaliteitscontroles uit door het beoordelen van ontbrekende waarde, verwijdering van uitschieters, feature-scaling, categorische codering, behoud van klassenverdeling en procedures voor het partitioneren van datasets. Controleer dat preprocessing-operaties consistent worden toegepast op alle datasets.
  10. Bevestig het ontbreken van aanzienlijke datalekken tijdens het partitioneren van datasets. Bekijk de preprocessing-validatieresultaten in Figuur 1 om te waarborgen dat gestandaardiseerde datasets zijn gegenereerd voor latere machine learning- en verklaarbaarheidsanalyses.
  11. Verwachte output - Genereer gereinigde en gestandaardiseerde datasets met ontbrekende waarden die correct zijn geadresseerd, categorische variabelen gecodeerd, numerieke kenmerken genormaliseerd en records gesplitst in trainings-, validatie- en testsubsets. Zorg ervoor dat datasetkenmerken, klasseverdelingen en validatieprocedures overeenkomen met die gerapporteerd in Tabel 2 en Tabel 3, en bevestig succesvolle preprocessingvalidatie zoals geïllustreerd in Figuur 1.
DatasetTypeSamplesKenmerkenDoel
BorstkankerTabulair56930Goedaardig/kwaadaardig
DiabetesTabulair7688Uitkomst van diabetes
MIMIC-IIIEPD~60.000Klinische variabelenSterfte
Röntgenfoto van de borstBeeldvorming~112.000AfbeeldingenZiektelabels

Tabel 2: Kenmerken van de dataset en gebruiksgevallen in de gezondheidszorg.

Deze tabel geeft een samenvatting van de gebruikte gezondheidszorgdatasets in de studie, inclusief type dataset, aantal steekproeven, aantal kenmerken, doelvariabelen, toepassingsdomein voor de gezondheidszorg en bijbehorende klinische gebruikssituaties. De datasets omvatten gestructureerde klinische dossiers, elektronische patiëntendossiers en medische beeldvormingsgegevens om de toepasbaarheid van het kader in diverse zorganalysescenario's aan te tonen.

DatasetSteekproefgrootteKlassenverdelingSplitstrategieLekpreventieHyperparameter ZoekenKruisvalidatieExterne test
Borstkanker (UCI Wisconsin)569357 Benign / 212 Malignant70/15/15Preprocessing alleen voor treinenRasterzoektocht5-voudig gelaagd CVOnafhankelijke Holdout-set
Pima-indianen diabetes768500 Niet-Diabetes / 268 Diabetisch70/15/15Preprocessing alleen voor treinenRasterzoektocht5-voudig gelaagd CVOnafhankelijke Holdout-set
MIMIC-III EHR5274Uitkomstgestratificeerde cohorten70/15/15 PatiëntniveauPatiëntniveau-scheidingWillekeurige zoekopdracht5-voudig patiëntniveau CVOnafhankelijke Holdout-set
NIH Thoraxfoto112120Longontsteking/Normaal gestratificeerd70/15/15Beeldniveau-scheidingWillekeurige zoekopdracht5-voudig gelaagd CVOnafhankelijke Holdout-set

Tabel 3: Validatie op datasetniveau en experimenteel ontwerp.

Deze tabel vat de gebruikte validatiemethodologie voor elke dataset samen, inclusief steekproefgrootte, klassenverdeling, train-validatie-test splitstrategie, lekpreventieprocedures, hyperparameteroptimalisatiemethoden, kruisvalidatieontwerp en externe testprotocollen. Deze maatregelen werden geïmplementeerd om methodologische strengheid, reproduceerbaarheid en onbevooroordeelde modelevaluatie te waarborgen.

figure-protocol-1
Figuur 1: Validatie van de data-voorverwerkingspijplijn.
Validatieresultaten voor belangrijke preprocessing-operaties uitgevoerd vóór modelontwikkeling. (A) Analyse van ontbrekende waarde over representatieve gezondheidszorgkenmerken. (B) Verdeling van een numerieke variabele vóór en na de behandeling van uitschieters. (C) Validatie van feature-schaal met standaardisatie. (D) Categorische coderingsvalidatie. (E) Klassenverdeling na preprocessing. (F) Validatie van de opdeling van trein-validatie-test gegevens. Deze resultaten bevestigen succesvolle voorverwerking en voorbereiding van de datasets voor voorspellende modellering en verklaarbaarheidsanalyse. Klik hier om een grotere versie van deze figuur te bekijken.

4. Systeemarchitectuur van het verklaarbare AI-framework

  1. Organiseer het framework met een gelaagde architectuur om modulaire verwerking te faciliteren, workflowtransparantie te verbeteren en reproduceerbare implementatie te ondersteunen. Configureer de Datalaag om ruwe gezondheidsdatasets te ontvangen en te beheren. Routeer alle binnenkomende datasets door de Data Layer voordat je preprocessing-operaties start.
  2. Voer gegevensopruiming, transformatie, normalisatie, feature engineering en coderingsprocedures uit binnen de Preprocessing-laag. Zorg ervoor dat alle preprocessing-operaties zijn afgerond vóór modelontwikkeling.
  3. Ontwikkel voorspellende modellen binnen de Modeling Layer met behulp van machine learning en deep learning-algoritmen. Train Gradient Boosting, Random Forest, Multilayer Perceptron (MLP) en Convolutional Neural Network (CNN) modellen met behulp van de vooraf verwerkte datasets en geoptimaliseerde hyperparameterconfiguraties.
  4. Pas uitlegbaarheidstechnieken toe binnen de Uitlegbaarheidslaag om modelvoorspellingen te interpreteren. Genereer feature-attributie-uitleg met SHAP en LIME voor gestructureerde datasets. Genereer Grad-CAM heatmaps voor beeldgebaseerde modellen om regio's te visualiseren die bijdragen aan modelvoorspellingen.
  5. Evalueer de voorspellende en verklaarbare prestaties binnen de Evaluatielaag. Bereken nauwkeurigheid, precisie, recall, F1-score, ROC-AUC, trouw, stabiliteit en clinici-gerichte evaluatiemetrics. Registreer alle evaluatie-uitkomsten voor latere analyse en rapportage.
  6. Genereer klinisch interpreteerbare visuele output binnen de Visualisatielaag. Maak prestatievergelijkingsgrafieken, visualisaties van feature-importance, SHAP-samenvattingsdiagrammen, LIME-uitleg, Grad-CAM heatmaps en rapportagedashboards gericht op clinici's. Sla alle visuele output op voor opname in het definitieve experimentele rapport.
  7. Bekijk de volledige frameworkarchitectuur zoals geïllustreerd in Figuur 2 voordat je doorgaat met de workflow-uitvoering.
  8. Verwachte output - Genereer volledig getrainde machine learning- en deep learning-modellen, waaronder Gradient Boosting, Random Forest, CNN en MLP-architecturen. Opslagmodelconfiguraties, geoptimaliseerde hyperparameters, trainingslogs, checkpointbestanden, uitlegbaarheidsuitdata en visualisatie-artefacten voor latere evaluatie en interpreteerbaarheidsanalyse.

figure-protocol-2
Figuur 2: Systeemarchitectuur van het Explainable AI-framework voor gezondheidszorganalyse. Klik hier om een grotere versie van deze figuur te bekijken.

5. Workflow-uitvoering

  1. Verkrijg gezondheidszorgdatasets uit openbaar beschikbare repositories en sla deze op in gestructureerde formaten die geschikt zijn voor machine learning en deep learning-analyse. Bekijk de volledige workflow zoals geïllustreerd in Figuur 3 voordat je de experimentele procedure start.
  2. Voer het opschonen en voorverwerken van gegevens uit volgens de procedures beschreven in Sectie 3. Normaliseer numerieke variabelen met behulp van geschikte schaalmethoden. Cogeer categorische variabelen met geschikte coderingstechnieken. Identificeer en imputeer ontbrekende waarden met behulp van dataset-specifieke imputatiestrategieën. Controleer de gegevenskwaliteit, feature-label-uitlijning en de volledigheid van datasets voordat u doorgaat met modelontwikkeling.
  3. Verdeel elke dataset in trainings-, validatie- en testsubsets om onbevooroordeelde modelevaluatie te ondersteunen. Behoud klasseverdelingen tijdens dataset-partitionering en voer waar toepasselijk maatregelen voor het voorkomen van lekkage uit. Reserveer de testsubset exclusief voor de definitieve modelevaluatie.
  4. Train machine learning-modellen op gestructureerde datasets met behulp van ensemble-gebaseerde algoritmen, waaronder Gradient Boosting en Random Forest. Train deep learning-modellen op beeldvormingsdatasets met behulp van Convolutional Neural Network (CNN)-architecturen die ruimtelijke beeldkenmerken kunnen leren. Werk modelparameters iteratief bij tijdens training en monitor validatieprestaties na elke trainingsperiode. Pas vroegtijdig stoppen toe wanneer validatieprestaties verslechteren of niet verbeteren volgens de vooraf gedefinieerde stopcriteria.
  5. Optimaliseer modelhyperparameters met behulp van systematische zoekstrategieën, waaronder gridzoekopdrachten en gerandomiseerde zoekopdrachten. Pas de leersnelheid, het aantal schatters, boomdiepte, batchgrootte, aantal epochs en andere modelspecifieke parameters aan volgens validatieprestaties. Selecteer het uiteindelijke model op basis van voorspellende prestaties en generalisatiecapaciteit over validatiedatasets.
  6. Pas uitlegbaarheidsmethoden toe nadat je modeltraining hebt afgerond. Genereer globale verklaringen met feature-attributietechnieken om variabelen te identificeren die het sterkst bijdragen aan modelvoorspellingen. Genereer lokale verklaringen om individuele voorspellingsgevallen te analyseren en modelgedrag op steekproefniveau te evalueren. Maak Grad-CAM heatmaps voor beeldclassificatiemodellen om gebieden van het beeld te markeren die bijdragen aan het voorspelde resultaat. Sla alle uitlegresultaten op voor latere analyse en rapportage.
  7. Evalueer de voorspellende prestaties met behulp van nauwkeurigheid, precisie, recall, F1-score en het bedieningsgebied van de ontvanger onder de curve (ROC-AUC). Beoordeel de kwaliteit van de uitleg met behulp van betrouwbaarheids- en stabiliteitsmetrics om de betrouwbaarheid en consistentie van de uitleg te evalueren. Vergelijk modelprestaties over datasets en verklaarbaarheidsmethoden om de robuustheid en generaliseerbaarheid van het framework te beoordelen.
  8. Genereer visualisatie-uitkomsten en analytische rapporten om resultaten op een klinisch interpreteerbare manier te communiceren. Maak prestatievergelijkingsgrafieken, feature-importance plots, SHAP-samenvattingsvisualisaties, LIME-uitlegresultaten, Grad-CAM heatmaps en andere klinisch relevante visualisaties. Bekijk alle visuele uitkomsten om duidelijkheid en consistentie te waarborgen voordat je rapporteert.
  9. Documenteer alle preprocessing-operaties, modelconfiguraties, hyperparameterinstellingen, uitlegbaarheidsprocedures, validatiestrategieën en evaluatieresultaten. Onderhoud gedetailleerde experimentele records om reproduceerbaarheid en onafhankelijke replicatie van de workflow te vergemakkelijken. Controleer de consistentie van de resultaten over herhaalde experimentele runs en archiveer alle workflow-artefacten voor toekomstig gebruik.
  10. Verwachte output - Genereer een volledig getraind voorspellend model met geoptimaliseerde hyperparameters, opgeslagen modelgewichten, trainingslogboeken, prestatiemetrics en uitlegbaarheidsoutputs, inclusief SHAP-uitleg, LIME-uitleg en Grad-CAM heatmaps. Sla alle modelartefacten, evaluatierapporten en visualisatie-uitkomsten op voor latere analyse en reproduceerbaarheidsbeoordeling.

figure-protocol-3
Figuur 3: End-to-end workflow van de Explainable AI-pijplijn. Klik hier om een grotere versie van deze figuur te bekijken.

6. Modelevaluatie en Verklaring Beoordeling

  1. Evalueer de prestaties van voorspellend model met behulp van standaard classificatiemetrics, waaronder nauwkeurigheid, precisie, terugroep, F1-score en het bedieningskarakteristiekgebied van de ontvanger onder de curve (ROC-AUC). Bereken nauwkeurigheid om de algehele classificatiecorrectheid te meten.
  2. Bereken precisie om het aandeel correct geïdentificeerde positieve voorspellingen te beoordelen. Bereken de terugroeping om het vermogen van het model te evalueren om positieve gevallen te identificeren. Bereken de F1-score om precisie en herinnering in balans te brengen. Bereken ROC-AUC om discriminatieprestaties over verschillende classificatiedrempels te beoordelen.
  3. Pas deze evaluatiemetrics consequent toe over alle datasets en modelarchitecturen om objectieve prestatievergelijking te vergemakkelijken. Registreer alle metrische waarden en sla de evaluatieresultaten op voor latere statistische analyse en rapportage.
  4. Beoordeel de prestaties van verklaarbaarheid met behulp van trouw- en stabiliteitsmetrics. Bereken trouwheid om te bepalen in hoeverre gegenereerde verklaringen modelvoorspellingen en besluitvormingsgedrag nauwkeurig weergeven.
  5. Bereken stabiliteit door verklaringen te vergelijken die uit vergelijkbare inputmonsters zijn gegenereerd en de consistentie van uitleg-uitkomsten te kwantificeren. Controleer of getrouwheids- en stabiliteitswaarden voldoen aan de vooraf gedefinieerde kwaliteitscriteria voordat je modeluitleg interpreteert.
  6. Vergelijk de uitlegbaarheid van de prestaties tussen SHAP-, LIME- en Grad-CAM-uitgangen.
  7. Verwachte output - Genereer kwantitatieve evaluatieresultaten, waaronder nauwkeurigheid, precisie, recall, F1-score, ROC-AUC, betrouwbaarheid en stabiliteitsindicatoren. Produceer uitleg en visualisaties die geschikt zijn voor wetenschappelijke rapportages, reproduceerbaarheidsbeoordeling en klinische interpretatie.

7. Mensgerichte evaluatie

  1. Werf 12 zorgprofessionals, bestaande uit 6 artsen, 3 radiologen en 3 klinische data-analisten. Selecteer deelnemers met eerdere ervaring in klinische besluitvorming, interpretatie van medische beelden, gezondheidsanalyse of elektronische patiëntendossierbeoordeling. Verkrijg geïnformeerde toestemming van alle deelnemers voordat je de evaluatieprocedure start.
  2. Selecteer willekeurig 100 gevallen uit de testdatasets na voltooiing van modeltraining en verklaarbaarheidsanalyse. Genereer twee evaluatievoorwaarden voor elke casus:
    1. Alleen voorspellingsoutput en
    2. voorspelling vergezeld van informatie over verklaarbaarheid. Randomiseer de volgorde van presentaties en evaluatievoorwaarden om presentatiebias en leereffecten te minimaliseren.
  3. Bereid gestandaardiseerde evaluatieformulieren voor met voorspellingsresultaten, uitleg en beoordelingsvragenlijsten. Presenteer casussen individueel aan deelnemers via een computergebaseerde evaluatie-interface.
  4. Geef deelnemers opdracht om elk geval onafhankelijk te beoordelen zonder de antwoorden met andere beoordelaars te bespreken. Laat deelnemers alle evaluaties onder identieke experimentele omstandigheden uitvoeren.
  5. Voer een vijfpuntsvragenlijst op Likert-schaal uit, aangepast van gepubliceerde verklarbare evaluatiestudies over kunstmatige intelligentie. Instrueren deelnemers om vertrouwen, interpreteerbaarheid en bruikbaarheid te beoordelen voor elk beoordeeld geval. Noteer de antwoorden op de vragenlijst elektronisch en verifieer de invulling van alle enquête-items voordat je overgaat tot statistische analyse.
  6. Meet objectieve indicatoren van klinische bruikbaarheid tijdens het evaluatieproces. Leg beslissingsovereenkomst vast door de beslissingen van deelnemers te vergelijken met de bijbehorende referentielabels of grondwaarheidsuitkomsten. Bereken beslissingsovereenstemming als het percentage deelnemersbeslissingen dat overeenkomt met het referentieresultaat.
  7. Noteer de beoordelingstijd voor elke zaak door het interval te meten tussen de presentatie van de zaak en het indienen van het eindantwoord. Bereken de gemiddelde beoordelingstijd apart voor voorspellings- en voorspelling-met-uitleg-voorwaarden.
  8. Bereken gemiddelde vertrouwen-, interpreteerbaarheid- en bruikbaarheidsscores voor alle deelnemers en evaluatiegevallen. Vergelijk scores verkregen onder voorspelling-only en voorspelling-met-verklaring-voorwaarden.
  9. Voer na voltooiing van alle deelnemersevaluaties gepaarde t-tests uit om te bepalen of verschillen in vertrouwen, interpreteerbaarheid, bruikbaarheid, besluitovereenstemming en beoordelingstijd statistisch significant zijn. Gebruik een significantiedrempel van p 0,05 voor alle statistische vergelijkingen.
  10. Bereken Fleiss Kappa na het verzamelen van reacties van alle deelnemers om de overeenstemming tussen beoordelaars te beoordelen. Gebruik de geaggregeerde deelnemersbeoordelingen om de consistentie van evaluaties tussen beoordelaars te bepalen. Interpreteer de waarden van Fleiss Kappa volgens vastgestelde overeenkomstrichtlijnen en registreer de resulterende overeenkomststatistieken.
  11. Vat de demografie van de deelnemers, evaluatiemethodologie, het ontwerp van de vragenlijst, statistische analyseprocedures, objectieve prestatiematen en de resultaten van overeenstemming tussen beoordelaars samen in Tabel 4.
  12. Bekijk modelresultaten onder beide evaluatievoorwaarden en vergelijk de reacties van deelnemers over de omstandigheden. Controleer of verklaringen het vertrouwen, de interpreteerbaarheid en bruikbaarheid verbeteren zonder de beslissingskwaliteit negatief te beïnvloeden.
  13. Bevestig de consistentie van de deelnemersbeoordelingen met behulp van de berekende Fleiss Kappa-statistiek. Registreer alle evaluatieresultaten voor latere rapportage en reproduceerbaarheidsbeoordeling.
  14. Verwachte output - Genereer vertrouwensscores van kliniciën, interpreteerbaarheidsbeoordelingen, bruikbaarheidsbeoordelingen, beslissingsovereenkomstmaten, beoordelingsstatistieken, gepaarde t-testresultaten en inter-rater overeenkomststatistieken. Produceer kwantitatieve bewijzen die de klinische bruikbaarheid, interpretatie en betrouwbaarheid van het verklaarbare kunstmatige intelligentiesysteem beschrijven.
ParameterWaarde
Experts12
Artsen6
Radiologen3
Klinische data-analisten3
Beoordeelde zaken100
EvaluatieontwerpGerandomiseerd (alleen voorspelling versus voorspelling+uitleg)
Surveyinstrument5-punts Likert-schaal
TrustbeoordelingInterpreteerbaarheid, Vertrouwen, Bruikbaarheid
Statistische TestGepaarde t-test (p 0,05)
Inter-rater betrouwbaarheidFleiss Kappa
Objectieve MaatregelenBeslissingsovereenkomst, Beoordelingstijd

Tabel 4: Mensgericht evaluatieprotocol en Ontwerp van de Clinici-beoordeling.

Deze tabel presenteert het evaluatiekader voor clinici dat wordt gebruikt om de interpreteerbaarheid, betrouwbaarheid en bruikbaarheid van het verklaarbare AI-systeem te beoordelen. Informatie over de demografie van de deelnemers, de methodologie van case review, het ontwerp van enquêtes, statistische analyseprocedures, inter-rater betrouwbaarheidsbeoordeling en objectieve evaluatiematen wordt samengevat.

8. Validatie- en reproduceerbaarheidsbeoordeling

  1. Voer validatie- en ablatiestudies uit om de robuustheid en betrouwbaarheid van het voorgestelde kader te beoordelen. Identificeer kenmerken met hoge belangrijkheidsscores met behulp van de geselecteerde verklaringsmethoden. Verwijder belangrijke features stapsgewijs en train de voorspellende modellen opnieuw na elke stap van feature-verwijdering.
  2. Evalueer de modelprestaties na elk ablatie-experiment met behulp van nauwkeurigheid, precisie, herinnering, F1-score en ROC-AUC-metrieken. Vergelijk de resulterende prestatiewaarden met de basismodelprestaties om de bijdrage van individuele kenmerken aan voorspellende uitkomsten te bepalen.
  3. Beoordeel de stabiliteit van verklaringen door verklaringen te genereren voor vergelijkbare inputmonsters met SHAP, LIME en Grad-CAM. Vergelijk uitlegresultaten over herhaalde evaluaties en kwantificeer consistentie met behulp van de vooraf gedefinieerde stabiliteitsmetrics. Controleer of verklaringen stabiel blijven bij kleine invoervariaties en herhaalde experimentele runs.
  4. Registreer alle experimentele procedures gedurende de hele workflow. Documenteer voorverwerkingsoperaties voor dataset, dataset-partitioneringsprocedures, modelarchitecturen, hyperparameterinstellingen, trainingsconfiguraties, verklaarbaarheidsmethoden, validatiestrategieën en evaluatiemetrics. Sla alle configuratieparameters en experimentele uitgangen op in een gestructureerd formaat om reproduceerbaarheid en onafhankelijke verificatie te vergemakkelijken.
  5. Bekijk alle experimentele dossiers om volledigheid en consistentie te waarborgen. Controleer of de workflow kan worden gerepliceerd met behulp van de gedocumenteerde procedures, configuratiebestanden en softwarespecificaties. Behoud een modulaire workflowstructuur om de aanpassing van het protocol voor toekomstige studies te faciliteren en ondersteun de overgang naar een videogebaseerd experimenteel protocol dat consistent is met de JoVE-methodologische eisen.

9. Reproduceerbaarheidsbronnen

  1. Voer alle experimenten uit met vaste willekeurige seeds om reproduceerbare resultaten te garanderen over herhaalde runs. Onderhoud broncode, preprocessing-scripts, configuratiebestanden, omgevingsspecificaties, modelparameters en visualisatiescripts binnen een publiek toegankelijke repository.
  2. Geef gedetailleerde instructies voor datasetverwerving, voorverwerking, experimentuitvoering, modeltraining, uitlegbaarheidsgeneratie, validatieprocedures en regeneratie van alle gerapporteerde tabellen en figuren. Archiveer alle workflowcomponenten die nodig zijn voor onafhankelijke replicatie, inclusief softwarespecificaties, preprocessing-workflows, configuratiebestanden, dataset-toegangsinstructies, modelcontrolepunten en visualisatie-assets.
  3. Vat de softwarebronnen, preprocessing-workflows, configuratiebestanden, datasettoegangsinstructies en reproduceerbaarheidsassets samen die door het hele framework worden gebruikt in Tabel 5.
  4. Verwachte output - Genereer een compleet reproduceerbaar experimenteel pakket met preprocessingscripts, configuratiebestanden, getrainde modellen, modelcontrolepunten, uitlegbaarheidsuitgangen, validatierapporten, visualisatie-artefacten, softwarespecificaties en documentatie die nodig is voor onafhankelijke replicatie en verificatie van het voorgestelde framework.
BronBeschrijving
BroncodePython-implementatiescripts voor datapreprocessing, modeltraining, uitlegbaarheid en evaluatie
Omgevingsbestandrequirements.txt die pakketafhankelijkheden en versies bevatten
ConfiguratiebestandenModelarchitectuurinstellingen, hyperparameters en experimentconfiguraties
Opgeloste willekeurige zadenZaad = 42 gebruikt voor reproduceerbare experimenten
Instructies voor datasettoegangLinks en procedures voor het verkrijgen van datasets van de publieke gezondheidszorg
Preprocessing ScriptsScripts voor data-opschoning, normalisatie, codering en feature-selectie
Figuurgeneratie ScriptsScripts om alle manuscriptfiguren te regenereren
Tabelgeneratie-scriptsScripts om gerapporteerde tabellen en metrieken te reproduceren.
VoorbeeldinvoerVoorbeelddatasets en invoerbestanden
VoorbeelduitvoerVoorspellingsresultaten, uitleg en evaluatierapporten

Tabel 5: Reproduceerbaarheidsbronnen en experimentele assets.

Deze tabel vat de bronnen samen die worden geleverd ter ondersteuning van experimentele reproduceerbaarheid, waaronder broncode, preprocessing-scripts, configuratiebestanden, omgevingsspecificaties, dataset-toegangsinstructies, vaste willekeurige seedinstellingen, figuurgeneratiescripts en voorbeeldinvoer-/uitvoerbestanden die nodig zijn om de gerapporteerde resultaten te reproduceren.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

We hebben het verklarende AI-onderdeel van onze hele pijplijn grondig geëvalueerd, waarbij we beoordeelden hoe goed het voorspelde over verschillende soorten zorgdata, waaronder zowel gestructureerde klinische data als medische beelden. De uitkomsten gaven consistente voorspellende prestaties aan over de geëvalueerde datasets. Van de geteste modellen behaalde het gradient boosting-model de hoogste nauwkeurigheid met 97,4%, gevolgd door het random forest-model met 94,2%. Deep learning-methoden toegepast op beeldsets behaalden 91,3% nauwkeurigheid, terwijl meerlagige perceptronmodellen iets lagere resultaten opleverden, namelijk 90,8%. Dit suggereert dat ensemble-gebaseerde machine learning-modellen het beste presteren op gestructureerde gezondheidszorgdata, terwijl deep learning-architecturen uitblinken in beeldvormingstaken. Tabel 6 geeft in detail verschillende prestatiemetrics voor voorspellingsfuncties, waaronder nauwkeurigheid, precisie, herinnering en F1-score, evenals verklaarbaarheidsmetrics zoals trouwheid en stabiliteit. We kwamen tot deze prestatiecijfers door gebruik te maken van vijfvoudige kruisvalidatie en het presenteren van resultaten als gemiddelden (met 95% betrouwbaarheidsintervallen). Betrouwbaarheidsintervallen geven niet alleen de onzekerheid van het model aan, maar maken ook vergelijkingen van voorspellende prestaties betrouwbaarder, waarbij rekening wordt gehouden met datasetgeheugen en verschillen in modelarchitecturen.

ModelNauwkeurigheid (%)PrecisieTerugroepingF1-scoreTrouwStabiliteit95% BI
Willekeurig Bos94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN (Beeldvorming)91.30.900.910.900.880.8690.1–92.5

Tabel 6: Vergelijkende prestaties van voorspellende modellen en verklaarbaarheidsmethoden.
Deze tabel presenteert een vergelijkende evaluatie van machine learning- en deep learning-modellen met behulp van voorspellende prestatie-indicatoren, waaronder nauwkeurigheid, precisie, recall, F1-score en ROC-AUC. Daarnaast worden verklaarbaarheidsstatistieken zoals trouw, stabiliteit, begrijpelijkheid en menselijke vertrouwensscores gerapporteerd om een uitgebreide beoordeling te bieden van zowel voorspellende effectiviteit als interpreteerbaarheid.

De resultaten geven aan dat Gradient Boosting de hoogste algehele voorspellende prestatie behaalde (97,4% nauwkeurigheid), waarbij Random Forest met 3,2 procentpunten en de deep learning-modellen met meer dan 6 procentpunten overtroffen. Deze observatie suggereert dat ensemble-gebaseerde leermethoden bijzonder effectief waren voor de gestructureerde gezondheidszorgdatasets die in deze studie zijn opgenomen. Het kleinere prestatieverschil tussen CNN- en MLP-modellen geeft aan dat een verhoogde modelcomplexiteit alleen niet noodzakelijkerwijs leidde tot superieure voorspellende prestaties onder de geëvalueerde experimentele omstandigheden.
Om het nut van ons voorgestelde kader voor diverse zorganalysetaken te tonen, presenteren we de dataset-specifieke voorspellingsresultaten in Tabel 7.

Dataset-specifieke analyse.
De prestaties varieerden per dataset vanwege verschillen in featurecomplexiteit, steekproefgrootte, klassenverdeling en datamodaliteit. De Breast Cancer-dataset behaalde de hoogste voorspellende nauwkeurigheid, waarschijnlijk dankzij de goed gedefinieerde kenmerkscheidbaarheid. Iets lagere prestaties op MIMIC-III en NIH Chest X-ray datasets weerspiegelen de grotere complexiteit van longitudinale klinische dossiers en medische beeldvormingsgegevens. Deze bevindingen tonen aan dat de prestaties van het kader worden beïnvloed door de kenmerken van de dataset en de klinische context.

DatasetNauwkeurigheid (%)Precisie (%)Terugroepen (%)F1-score (%)
Borstkanker97.497.297.697.1
Diabetes94.293.994.494
MIMIC-III91.39191.591.1
NIH Thoraxfoto90.890.491.290.6

Tabel 7: Dataset-specifieke voorspellende prestatieresultaten.
Voorspellende prestaties van het voorgestelde verklaarbare AI-kader over vier representatieve gezondheidszorgdatasets. Nauwkeurigheid, precisie, herinnering en F1-score worden als percentages (%) gerapporteerd op de onafhankelijke testsets. Hogere waarden duiden op betere classificatieprestaties.

Om voorspellende prestaties te beoordelen, werden vier machine learning- en deep learning-modellen, namelijk Gradient Boosting, Random Forest, Convolutional Neural Network (CNN) en Multilayer Perceptron (MLP), geëvalueerd over vier representatieve gezondheidszorgdatasets. De modelprestaties werden beoordeeld met behulp van nauwkeurigheid, precisie, recall, F1-score en ROC-AUC-metrieken op onafhankelijke testdatasets na een 70:15:15 train-validatie-test splitsing en vijfvoudige kruisvalidatie. Verbeteringen in voorspellende prestaties werden bepaald door modelspecifieke evaluatiemetrics te vergelijken over identieke preprocessing- en validatiecondities.
Om te laten zien hoe modelprestaties verschillen in verschillende methoden, toont Figuur 4 de voor- en nadelen van ensemble-, neurale netwerk- en deep learning-modellen op een visuele manier.

figure-results-1
Figuur 4: Vergelijkende prestaties van machine learning- en deep learning-modellen bij zorgvoorspellingstaken. (A) Nauwkeurigheidsvergelijking van Gradient Boosting, Random Forest, CNN en MLP-modellen op de testdataset. (B) F1-score vergelijking van Gradient Boosting, Random Forest, CNN en MLP modellen op de testdataset. (C) Precisievergelijking van Gradient Boosting, Random Forest, CNN en MLP-modellen op de testdataset. (D) Herinnering aan vergelijking van Gradient Boosting, Random Forest, CNN en MLP-modellen op de testdataset. Hogere waarden duiden op betere voorspellende prestaties. Gradient Boosting behaalde de hoogste algehele prestatie over alle evaluatiemetrics, gevolgd door Random Forest. Klik hier om een grotere versie van deze figuur te bekijken.

Interpretatie van verklaarbaarheidsprestaties.
SHAP behaalde consequent de hoogste nauwkeurigheids- en stabiliteitsscores onder de geëvalueerde verklaarbaarheidsmethoden, wat wijst op een sterkere overeenstemming tussen gegenereerde verklaringen en onderliggende modelvoorspellingen. LIME vertoonde relatief lagere stabiliteit, wat wijst op een grotere gevoeligheid voor lokale verstoringen en variabiliteit in bemonstering. Grad-CAM bood visueel interpreteerbare verklaringen voor beeldgebaseerde modellen, maar leverde iets lagere getrouwheidswaarden dan SHAP. Deze bevindingen geven aan dat de kwaliteit van de uitleg afhangt van zowel de gekozen uitlegtechniek als de onderliggende architectuur van het voorspellende model.

De verklaarbaarheidstechnieken die in de pijplijn zijn geïntegreerd, zijn zowel kwantitatief als kwalitatief beoordeeld op hun prestaties. Specifiek zijn feature-attributiemethoden erin geslaagd de interne logica van het model vrij consistent te onthullen over verschillende datasets heen.
Alle in de studie beschouwde methoden, SHAP, behaalden de hoogste nauwkeurigheid (0,92) en stabiliteit (0,89) onder de geëvalueerde verklaarbaarheidsmethoden. Kort gezegd waren de verklaringen zeer nauwkeurige weergaven van wat het model daadwerkelijk voorspelde. Lokale verklaringsmethoden zijn een soort venster waardoor we een specifieke voorspelling kunnen zien en kunnen begrijpen wat het model als basis voor de beslissing heeft gebruikt.

De interpreteerbaarheid werd geëvalueerd met behulp van betrouwbaarheid, stabiliteit, begrijpelijkheid en de vertrouwensscores van de klinisch verkeer, verkregen uit mensgerichte evaluatie. SHAP-, LIME- en Grad-CAM-verklaringen werden vergeleken met identieke datasets en getrainde modellen. Verbeteringen in verklaarbaarheid werden beoordeeld door het vergelijken van uitlegkwaliteitsindicatoren en de beoordelingen van clinici over de geëvalueerde uitlegmethoden. Visualisatietechnieken voor deep learning-modellen die met beelden werken, produceren in feite heatmaps, die de gebieden van de afbeeldingen identificeren die het meest relevant zijn voor de voorspelling van het model. Feature-importance-verdelingen en vergelijkingen van verklaarbaarheidsprestaties over verschillende methoden worden weergegeven in Figuur 5.

figure-results-2
Figuur 5: Uitlegbaarheid Prestatie-evaluatie.De figuur toont de prestaties van verklaarbaarheidsmethoden met behulp van getrouwheids- en stabiliteitsmetrieken. SHAP loopt voorop in trouw (0,92) en stabiliteit (0,89), wat een goede overeenstemming weerspiegelt tussen verklaringen en modelvoorspellingen. LIME blijkt het beste hulpmiddel te zijn voor de interpreteerbaarheid van individuele voorbeelden. Aan de andere kant levert Grad-CAM visuele heatmaps die voornamelijk in beeldvormende modellen worden gebruikt, en toont grofweg de belangrijkste gebieden die verantwoordelijk zijn voor de voorspelling van het model, wat klinisch gezien zeer relevant kan zijn. Klik hier om een grotere versie van deze figuur te bekijken.

Na evaluatie van de voorspellende modellen en technieken voor interpreteerbaarheid bleek dat de correlatie tussen de nauwkeurigheid van een model en de betrouwbaarheid van de verklaringen zeer sterk is. In feite verklaarden dezelfde modellen die voorspellingsverbeteringen lieten zien, hun resultaten met meer stabiliteit en consistentie wanneer de interpreteerbaarheidstechnieken correct werden toegepast. Ensemblemodellen bleken het meest interpreteerbaar wanneer ze werden vergezeld van feature-attributiemethoden, terwijl deep learning-modellen beter werden bediend door visualisatie-gebaseerde verklaarbare methoden. De link die de nauwkeurigheid van voorspelling en de betrouwbaarheid van verklaringen verbindt, is te zien in Figuur 6, die de conceptuele dynamiek tussen model en verklaarbaarheid in groot detail schetst.

figure-results-3
Figuur 6: Vergelijkende analyse van modellen en uitleg van vaardigheidsmethoden.De grafiek toont een gedetailleerde vergelijking van de nauwkeurigheid en legt vaardigheidsmaten van verschillende modellen uit. Het bevat een verstrooiingsgrafiek die de correlatie tussen nauwkeurigheid en uitlegstabiliteit weergeeft, een tabelvergelijking van prestaties en een geschiktheidsmatrix die de verschillende verklarbare vaardigheidsmethoden SHAP, LIME en Grad-CAM en hun effectiviteit met verschillende modeltypes weergeeft. De visuele toont duidelijk aan dat ensemblemodellen plus SHAP uitstekende interpreteerbaarheid bieden, terwijl deep learning-modellen verklaarbaar zijn via visualisatietechnieken. Klik hier om een grotere versie van deze figuur te bekijken.

De mensgerichte evaluatie bevestigde het praktische nut van het voorgestelde systeem in ziekenhuizen en andere medische instellingen. Medische professionals beoordeelden modelresultaten met en zonder uitleg. Het tonen van de resultaten met uitleg leidde tot een aanzienlijke toename van het vertrouwen en de interpreteerbaarheid van gebruikers; De gemiddelde trustwaarde steeg van 3,1 naar 4,7 op een schaal van 1 tot 5. De stijging van de trustscore van 3,1 naar 4,7 vertegenwoordigt een relatieve verbetering van 51,6% bij benadering. De aanzienlijke overeenstemming tussen beoordelaars (Fleiss' κ = 0,81) geeft verder een consistente beoordeling van de therapeuten over de bruikbaarheid van verklaringen. Deze bevindingen suggereren dat uitkomsten van verklaarbaarheid het vertrouwen van gebruikers kunnen verbeteren en de interpretatie van door AI ondersteunde klinische beslissingen kunnen vergemakkelijken. Professionals gaven aan een beter begrip van modelresultaten en een hoger vertrouwen in door AI ondersteunde beoordeling van klinische situaties, wat wijst op het belang van interpreteerbaarheid in de daadwerkelijke implementatie van gezondheidszorg.

We hebben de robuustheid van ons kader verder geverifieerd met ablatieanalyse. Het verwijderen van kritieke kenmerken die, via verklaarbaarheidsmethoden, als essentieel werden beschouwd, leidde tot een groot verlies aan voorspellingsprestaties. De bevinding weerspiegelt dus dat kenmerken niet alleen relevant waren, maar ook significant voor de voorspellende taak. Bovendien bleven de verklaringsresultaten slechts verwaarloosbare verschillen tonen wanneer verschillende invoermonsters werden uitgelegd, wat de stabiliteit en betrouwbaarheid van de verklaarbaarheidsmethoden aantoont.

Om de haalbaarheid van de pijpleiding voor praktisch gebruik te controleren, hebben we de rekensnelheid gemeten. De introductie van uitlegbaarheidstechnieken zorgde voor een toename van de rekentijd, vooral bij het toeschrijven van kenmerken en het creëren van visualisaties. Desalniettemin was de totale uitvoeringstijd nog haalbaar en niet al te lang. Figuur 7 toont hoe de rekentijd wordt verdeeld over verschillende fasen van de pijplijn, zoals preprocessing, modeltraining, uitlegbaarheidsgeneratie, evaluatie en visualisatie.

figure-results-4
Figuur 7: Uitsplitsing van de uitvoeringstijd van de pijplijn. Deze grafiek laat zien hoe rekentijd is verdeeld over verschillende fasen van de verklaarbare AI-pijplijn, zoals preprocessing, modeltraining, het creëren van vaardigheden uitleggen, evaluatie en visualisatie. De gegevens tonen aan dat het grootste deel van de tijdlijn wordt ingenomen door modeltraining, waarna gevolgd wordt door explain ability processing. Aan de andere kant is de tijd die wordt besteed aan preprocessing en rapportage vrij minimaal. Klik hier om een grotere versie van deze figuur te bekijken.

We hebben ook de sterkte van het voorgestelde kader getest via een ablatie-analyse. Het wegnemen van de essentiële kenmerken die via verklaarbaarheidsmethoden zijn ontdekt, toonde een duidelijke afname in voorspellende prestaties, wat een duidelijk teken is dat deze kenmerken niet alleen relevant zijn, maar ook behoorlijk belangrijk. Daarnaast waren de uitlegresultaten vrij stabiel, zelfs bij een kleine verandering in de invoersamples, wat bewijst van de consistentie en betrouwbaarheid van de uitlegbaarheidstechnieken.

Kortom, door de meting van voorspellende prestaties, verklaarbaarheid en mensgerichte validatie te combineren, bleek dat het voorgestelde kader effectief was. Het systeem deed niet alleen zeer nauwkeurige voorspellingen, maar bleef ook zeer interpreteerbaar en gebruiksvriendelijk. Het inzetten van uitlegbaarheidsmethoden maakte het hele proces transparant zonder de prestaties van het model te verminderen. De verbeteringen die we zagen in voorspellingsnauwkeurigheid en interpreteerbaarheid werden niet alleen onder strakke experimentele controle gerealiseerd, maar waren ook statistisch significant, een feit dat spreekt voor de duurzaamheid en authenticiteit van de voorgestelde manier. Paargewijze vergelijkingen tussen voorspellende modellen werden uitgevoerd met behulp van gepaarde t-tests over kruisvalidatiefolders. Statistisch significante verschillen werden waargenomen tussen Gradient Boosting en concurrerende modellen (p & 0,05), wat de superioriteit van de voorgestelde configuratie bevestigde.

Algemene bevindingen.
Gezamenlijk tonen de resultaten aan dat voorspellende prestaties, uitlegkwaliteit en het vertrouwen van clinici kunnen worden geëvalueerd binnen een uniforme en reproduceerbare workflow. Het raamwerk handhaafde consistente prestaties over meerdere zorgdatasets en ondersteunde transparante interpretatie via SHAP-, LIME- en Grad-CAM-uitleg. De bevindingen moeten echter worden geïnterpreteerd binnen de context van de geselecteerde datasets en validatie-instellingen, en aanvullende externe validatie blijft noodzakelijk voordat de implementatie in de praktijk plaatsvindt.

BESCHIKBAARHEID GEGEVENS:
We hebben de datasets die in het huidige onderzoek worden gebruikt verkregen uit openbare bronnen, en ze zijn te vinden in bekende datarepositories. Zo zijn de gegevens over borstkanker en diabetes te downloaden van de UCI Machine Learning Repository op: https://archive.ics.uci.edu/ml/index.php

Men kan de elektronische patiëntendossier-dataset (MIMIC-III) verkrijgen via Physio Net op:
https://physionet.org/content/mimiciii/1.4/

De röntgengegevens van de borst zijn afkomstig uit de NIH Chest X-ray Dataset en zijn te vinden op: https://www.kaggle.com/datasets/nih-chest-xrays/data

Alle datasets die we in deze studie hebben onderzocht, worden geanonimiseerd en openbaar beschikbaar. De preprocessingstappen, het getrainde model en de uitleggende vaardigheidsuitkomsten die we tijdens het onderzoek hebben geproduceerd, zijn beschikbaar via de corresponderende auteur als er een redelijke vraag wordt gedaan. Broncode, preprocessingscripts, configuratiebestanden en reproduceerbaarheidsbronnen worden bij acceptatie van het manuscript in een openbare repository geplaatst.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie ontwikkelde en evalueerde een reproduceerbare verklarbare kunstmatige intelligentie (XAI) workflow voor gezondheidszorganalyse die voorspellende modellering, uitlegbaarheidsbeoordeling, clinici-gerichte evaluatie en reproduceerbaarheidsbronnen integreert binnen één protocol. De resultaten toonden aan dat ensemble-gebaseerde machine learning-modellen, met name Gradient Boosting en Random Forest, de hoogste voorspellende prestaties behaalden op de geëvalueerde gestructureerde gezondheidszorgdatasets, terwijl deep learning-modellen geschikter waren voor beeldgebaseerde analyses. Deze bevindingen benadrukken het belang van het selecteren van modelarchitecturen op basis van datakenmerken in plaats van aan te nemen dat complexere modellen altijd superieure prestaties zullen opleveren. Een belangrijke bijdrage aan dit werk is de integratie van voorspellende modellering, verklaarbaarheidsbeoordeling, mensgerichte evaluatie en reproduceerbaarheidspraktijken binnen een gestandaardiseerde workflow. In tegenstelling tot studies die verklaringstechnieken op zichzelf evalueren, biedt het voorgestelde kader een protocolgedreven methodologie die transparante en reproduceerbare experimenten ondersteunt over diverse gezondheidsdatasets.

De verklaarbaarheidsanalyse toonde meetbare verschillen tussen de geëvalueerde methoden. SHAP behaalde de hoogste nauwkeurigheids- en stabiliteitsscores binnen de geëvalueerde experimentele omstandigheden, wat wijst op een nauwere overeenstemming tussen gegenereerde verklaringen en modelvoorspellingen. LIME gaf nuttige lokale verklaringen maar vertoonde een lagere stabiliteit, terwijl Grad-CAM intuïtieve visuele verklaringen voor beeldvormingsgegevens genereerde. Deze bevindingen suggereren dat de kwaliteit van de verklaring afhangt van zowel de gekozen verklaarbaarheidsmethode als het onderliggende voorspellende model. Mensgerichte evaluatie toonde verder aan dat de opname van verklaringen het vertrouwen en de interpreteerbaarheid van clinici verbeterde. De waargenomen toename van vertrouwensscores en de aanzienlijke overeenstemming tussen beoordelaars (Fleiss' κ = 0,81) duidt op consistente beoordeling van de bruikbaarheid van uitleg tussen de deelnemers. Deze bevindingen ondersteunen de potentiële waarde van verklaarbaarheidsmethoden voor het verbeteren van transparantie en acceptatie van gebruikers in zorgbeslissingsondersteuningssystemen.

Bij het interpreteren van de resultaten moeten verschillende beperkingen worden meegenomen. Ten eerste werd het raamwerk geëvalueerd met een beperkt aantal publiek beschikbare datasets en vertegenwoordigt mogelijk niet volledig de variabiliteit die in klinische omgevingen in de praktijk voorkomt. Ten tweede betrof de klinische evaluatie een relatief kleine deelnemercohort, wat de generaliseerbaarheid kan beperken. Ten derde zijn de verklaarbaarheidsmethoden die in deze studie zijn onderzocht post-hoc technieken en blijven ze daarom onderhevig aan bekende beperkingen, waaronder gevoeligheid voor verstoringen en mogelijke discrepanties tussen verklaringen en true model reasoning. Ten slotte lag externe validatie binnen onafhankelijke zorginstellingen buiten de reikwijdte van de huidige studie.

Toekomstig onderzoek zou multimodale gezondheidsanalyse moeten onderzoeken die klinische dossiers, medische beeldvorming, fysiologische signalen en draagbare sensorgegevens integreren. Er is extra werk nodig om causale en contrafeitelijke verklaringsmethoden, onzekerheidskwantificatie, rechtvaardigheidsbeoordeling, kalibratieanalyse en prospectieve klinische validatie te evalueren. Dergelijke studies kunnen de transparantie, betrouwbaarheid en toepasbaarheid van verklaarbare AI-systemen in de gezondheidszorg verder verbeteren.

Naast prestatie-evaluatie moeten verschillende praktische implementatie-uitdagingen en protocolwijzigingen worden overwogen om een robuuste implementatie van het voorgestelde verklaarbare AI-kader in diverse zorgomgevingen te waarborgen.

Beperkingen van verklaarbaarheidsmethoden

SHAP, LIME en Grad-CAM bieden weliswaar nuttige inzichten over modelgedrag, maar hebben ook verschillende nadelen. In de literatuur is opgemerkt dat deze tools instabiel kunnen zijn bij herhaalde runs, behoorlijk gevoelig kunnen zijn voor verstoringen, verschillen tussen datasets en soms niet nauwkeurig de werkelijke redenen van het model weergeven. Daarom moeten post-hoc verklaringen alleen worden gezien als aanvullend bewijs en niet als de daadwerkelijke weergave van causale besluitvormingsmechanismen. Goede validatie van de betrouwbaarheid van verklaringen blijft een zeer belangrijke stap voordat ze kunnen worden toegepast in zeer impactvolle klinische omgevingen.

Dit komt ook overeen met de bevindingen van recent biomedisch AI-onderzoek, dat de noodzaak benadrukt om betrouwbaarheidsvalidatie te verklaren voordat deze in klinische omgevingen wordt geïmplementeerd. De integratie van verklaarbaarheid is gebruikt als een belangrijk aspect van validatie in systemen voor het voorspellen van hartstilstanden, zodat deze transparanter kunnen zijn en het vertrouwen van klinische voorspellingenkunnen winnen 41. Op dezelfde manier was lever-echografie beeldsegmentatie met behulp van visualisatie-gedreven verklaringstechnieken gericht op het vergroten van de interpreteerbaarheid zonder neer te slaan op het feit dat post-hoc verklaringen beperkt zijn. Deze artikelen bevestigen dat controles op consistentie van verklaringen, robuustheidstests en klinisch betekenisvolle validaties van uitlegbaarheid noodzakelijk zijn om op het hoogste niveau van klinische gebruiksgereedheidte zijn 42.

Kalibratie, Eerlijkheid, Robuustheid en Externe Generalisatie

De toekomstige versies van het voorgestelde kader zullen de evaluatie van de kanskalibratie omvatten met behulp van kalibratiecurves en Brier-score, het schatten van de onzekerheid met behulp van Bayesiaanse en ensemble-gebaseerde methoden, een eerlijkheidsaudit van de demografische subgroepen en robuustheidscontrole bij aanwezigheid van ruisachtige data en veranderende domeinomstandigheden. Deze analyses zijn vooral belangrijk in zorgomgevingen waar modelvertrouwen, eerlijke prestaties en betrouwbaarheid onder veranderende klinische omgevingen direct invloed hebben op patiëntveiligheid en klinische adoptie. Recente AI-ondersteunde wetenschappelijke kaders hebben eveneens het belang benadrukt van betrouwbare, transparante en betrouwbare besluitvormingssystemen die verder gaan dan conventionele voorspellende prestatiebeoordeling. Recente AI-ondersteunde wetenschappelijke kaders hebben eveneens het belang benadrukt van betrouwbare, transparante en betrouwbare besluitvormingsondersteuningssystemen buiten conventionele voorspellende prestatiebeoordeling 43.

Probleemoplossing en protocolwijzigingen

Er moeten verschillende praktische punten worden overwogen voor de succesvolle uitrol van het voorgestelde verklaarbare AI-framework. Een typisch probleem is overfitting, bijvoorbeeld bij het trainen van deep learning-modellen op relatief kleine zorgdatasets. Overfitting kan worden verminderd door cross-validatie, vroegtijdig stoppen, dropout-regularisatie, data-augmentatie en grondige hyperparameteroptimalisatie toe te passen. Het observeren van validatieprestaties tijdens de training is een goede manier om een zeer complex model te vermijden dat slecht generaliseert.

Een ander zeer belangrijk probleem in gezondheidszorgdatasets is een klassenonevenwicht, oftewel dat positieve klinische uitkomsten veel zeldzamer zijn dan negatieve gevallen. Om dit probleem aan te pakken, moeten gestratificeerde steekproeven, klasse-gewicht aanpassing, synthetische minderheidsoversteekproeven en het gebruik van gebalanceerde evaluatiemetrics zoals F1-score en ROC-AUC deel uitmaken van de modelleringspijplijn. Het negeren van klassenongelijkheid loopt het risico prestatie-indicatoren te veroorzaken die niet echt representatief zijn voor het model en klinische voorspellingen die mogelijk bevooroordeeld zijn.

Medische beeldvormingsdatasets zijn doorgaans niet perfect en kunnen beschadigd raken door ruis, acquisitie-artefacten, inconsistente kwaliteit, enzovoort. Deze factoren variëren ook per type beeldvormingsapparaat. Dergelijke factoren kunnen de voorspellende prestaties negatief beïnvloeden en ook de uitdata van verklaarbaarheid beïnvloeden. Daarom moeten gestandaardiseerde preprocessingstappen, beeldnormalisatie, kwaliteitscontroles en data-augmentatietechnieken worden toegepast zodat robuustheid en betrouwbaarheid van het model worden bereikt.

SHAP maakt het mogelijk om zeer informatieve kenmerkattributieverklaringen af te leiden. Echter, het voorkomen van instabiliteit kan niet worden uitgesloten, vooral wanneer sterk gecorreleerde kenmerken bestaan of wanneer modeluitkomsten zeer gevoelig zijn voor kleine veranderingen in de invoergegevens. Om de consistentie en betrouwbaarheid van uitleg te verbeteren, worden aanbevolen om de uitleg meerdere keren te schrijven, stabiliteit over meerdere runs te beoordelen, feature-groeperingsstrategieën te gebruiken en te controleren met andere uitlegmethoden zoals LIME.

Als het gaat om grootschalige gezondheidsdata en enorme diepe neurale netwerkarchitecturen, kunnen GPU-geheugenlimieten een van de grootste beperkingen worden. De geheugenbehoefte kan aanzienlijk worden verlaagd door aanpassingen in batchgrootte, training met gemengde precisie, modelsnoei, vermindering van de dimensie van kenmerken en het invoeren van efficiënte data-laden. Bovendien kunnen onderzoekers die het framework inzetten op systemen met weinig middelen overwegen om cloud computing-omgevingen of gedistribueerde training te gebruiken.

Het modulaire ontwerp van het voorgestelde raamwerk maakt het gemakkelijk mogelijk om wijzigingen aan te brengen voor verschillende zorgtoepassingen. Afhankelijk van de klinische taak kunnen wetenschappers één of meer individuele voorspellingsmodellen wijzigen, nieuwe verklaringsmethoden toevoegen, verschillende soorten gezondheidszorggegevens samen gebruiken, of modules voor onzekerheidskwantificatie en kalibratie opnemen zonder de algehele workflow te veranderen. Deze flexibiliteit helpt het kader bruikbaar te maken in zeer verschillende zorganalyse-casussen, terwijl het toch reproduceerbaar en interpreteerbaar blijft.

Regelgevende en ethische overwegingen:

AI-systemen die beter begrijpelijk worden gemaakt, kunnen een grote hulp zijn in de gezondheidszorg. Maar het is niet genoeg. Regels van de toezichthouder, die oproepen tot transparantie, verantwoordelijkheid, privacy en patiëntveiligheid, moeten worden nageleefd. Zelfs als verklaarbaarheid het vertrouwen en de interpretatie kan vergroten, kan het niet alleen klinische validiteit garanderen. Verantwoorde implementatie vereist prospectieve klinische validatie, eerlijkheidsbeoordeling, regelgevende beoordeling en monitoring na de implementatie. Daarnaast moeten patiëntgeheim, toezicht van clinici en eerlijke prestaties tussen demografische groepen worden meegenomen bij de implementatie van het raamwerk in de toekomst. Om geïntegreerd te worden in de praktijk klinische workflows, moeten AI-systemen en zorgprofessionals zonder problemen met elkaar communiceren. Daarom moet uitlegbaarheidsinformatie deel uitmaken van huidige elektronische patiëntendossiers en klinische besluitvormingsondersteuningsplatforms, en niet van aparte tools die alleen op zichzelf werken. De uiteindelijke keuzes moeten door de artsen worden gemaakt, terwijl verklaarbare AI slechts een helpertechnologie is die transparantie verbetert, evidence-based redenering ondersteunt en de communicatie tussen zorgmedewerkers en patiënten vergemakkelijkt.

Dit artikel presenteert een reproduceerbaar protocol voor het ontwikkelen, evalueren en interpreteren van verklaarbare kunstmatige intelligentiesystemen in gezondheidszorganalyse. De bijdrage is methodologisch en workflowgericht en biedt onderzoekers en clinici een gestandaardiseerd kader dat kan worden gerepliceerd, aangepast en uitgebreid over meerdere zorgtoepassingen. Het combineert verschillende aspecten zoals data-preprocessing, voorspellende modellering, verklaarbaarheidsmethoden en prestatie-evaluatie op één uniforme manier. De methodologie toonde sterke voorspellende prestaties aan over meerdere zorgdatasets. Als het gaat om gestructureerde data-analyse, presteren modelensembles het beste, terwijl deep learning-modellen zeer effectief blijken voor medische beeldvormingstaken. Bovendien maakt het gebruik van uitlegtechnieken het voor gebruikers gemakkelijker om de modellen te begrijpen, omdat het zowel globale als lokale interpretaties van de voorspellingsresultaten biedt. Hierdoor vergroot het niet alleen het vertrouwen van de clinici, maar ook de bruikbaarheid van de modellen. De bevindingen geven aan dat verklaarbare AI de ontwikkeling van transparante en interpreteerbare zorganalysesystemen kan ondersteunen om een compromis te vinden tussen de nauwkeurigheid en interpreteerbaarheid van de modellen, die essentieel zijn voor betrouwbare en betrouwbare gezondheidszorganalyse. Daarom is de hier gepresenteerde methode een zeer effectief en eenvoudig hulpmiddel voor medische data-analyse dat zorgprofessionals kan helpen bij het gebruik van AI-technologieën die zij vertrouwen. Dit artikel presenteert een reproduceerbaar protocol voor het ontwikkelen, evalueren en interpreteren van verklaarbare kunstmatige intelligentiemodellen in gezondheidszorganalyse. Door datapreprocessing, voorspellende modellering, uitlegbaarheidsbeoordeling, clinici-gecentreerde evaluatie en reproduceerbaarheidsbronnen te integreren binnen een uniforme workflow, biedt het protocol een praktisch kader voor transparant AI-onderzoek in de gezondheidszorg. De workflow kan worden aangepast aan diverse gezondheidszorgdatasets en toepassingsdomeinen, wat reproduceerbare implementatie, evaluatie en rapportage van verklaarbare machine learning-systemen ondersteunt.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat zij geen concurrerende financiële belangen of belangenconflicten hebben met betrekking tot dit werk. Het onderzoek werd onafhankelijk uitgevoerd zonder commerciële of financiële relaties die als een potentieel belangenconflict konden worden opgevat.

Openbaarmaking van gebruik van kunstmatige intelligentie

Kunstmatige intelligentie-tools werden gebruikt voor taalverfijning, grammaticacontrole en redactionele ondersteuning tijdens de voorbereiding van manuscripten. Alle wetenschappelijke inhoud, experimentele ontwerpen, data-analyse, interpretatie en definitieve manuscriptverificatie werden uitgevoerd door de auteurs. De auteurs beoordeelden en valideerden alle AI-ondersteunde output om nauwkeurigheid, integriteit en naleving van de richtlijnen van het tijdschrift te waarborgen.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs willen hun respectievelijke instellingen bedanken voor het bieden van de benodigde infrastructuur en onderzoeksondersteuning om deze studie uit te voeren. De auteurs erkennen ook het gebruik van publiek beschikbare datasets en open-source tools die de ontwikkeling en evaluatie van het voorgestelde verklaarbare AI-kader hebben vergemakkelijkt. Speciale dank gaat uit aan domeinexperts die waardevolle inzichten hebben geleverd tijdens de mensgerichte evaluatiefase.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
GPU WorkstationFabrikantsafhankelijkNATraining van deep learning-modellen
Jupyter NotebookProject JupyterLaatste stabiele versieInteractieve experimentuitvoering
LIMELIMEVersie 0.2.0Lokale interpretabele verklaringen
MatplotlibMatplotlib ProjectVersie 3.9Datavisualisatie
MIMIC-III DatabasePhysioNetVersie 1.4Analyse van elektronische gezondheidsrecords
NIH Chest X-ray DatasetNIH Clinical CenterOpenbare datasetClassificatie van thoraxaandoeningen
NumPyNumPy-ontwikkelaarsVersie 1.26Numerieke berekeningen en matrixbewerkingen
OpenCVOpenCV FoundationVersie 4.10Afbeeldingsvoorverwerking
PandasPandas Development TeamVersie 2.1Gegevensmanipulatie en voorverwerking
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryOpenbare datasetRisicovoorspelling voor diabetes
Python 3.11Python Software FoundationVersie 3.11Primaire programmeeromgeving
Scikit-learnscikit-learnVersie 1.5Machine learning-algoritmen en evaluatie
SeabornSeabornVersie 0.13Statistische visualisatie
SHAPSHAPVersie 0.46Functietoewijzing en verklaarbaarheid
TensorFlowTensorFlowVersie 2.15Ontwikkeling van deep learning-modellen
Windows / Ubuntu LinuxMicrosoft / CanonicalNABesturingssysteem
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryOpenbare datasetDiagnose van borstkanker

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

EngineeringExplainable Artificial Intelligence XAIMachine learningdeep learningModel InterpretabilityClinical Decision Support SystemsReproducible Experimental Protocol

Gerelateerde artikelen