Alle datasets die in deze studie zijn gebruikt, zijn verkregen uit publiek beschikbare en volledig geanonimiseerde repositories, waaronder de UCI Machine Learning Repository, PhysioNet MIMIC-III database en NIH Chest X-ray datasets. Er werd geen identificeerbare patiëntinformatie geraadpleegd. De studie voldeed aan de ethische richtlijnen voor institutioneel onderzoek voor secundaire analyse van openbaar beschikbare gedeïdentificeerde gegevens. Formele goedkeuring van de Institutional Review Board was niet vereist omdat er geen menselijke deelnemers direct werden gerekruteerd en er geen beschermde gezondheidsinformatie werd gebruikt.
1. Overzicht van de experimentele kaders
- Ontwikkel een reproduceerbare, verklaarbare kunstmatige intelligentie (XAI)-pijplijn voor transparante gezondheidszorganalyse. Organiseer de workflow in de Datalaag, Preprocessing-laag, Modelleerlaag, Uitlegbaarheidslaag, Evaluatielaag en Visualisatielaag.
- Integreer deze modules in een uniforme workflow die in staat is gestructureerde klinische gegevens, elektronische patiëntendossiers en medische beeldvormingsdatasets te verwerken.
- Zorg ervoor dat elke module bijdraagt aan reproduceerbaarheid, interpreteerbaarheid, schaalbaarheid en gestandaardiseerde experimentele uitvoering.
- Ontwerp de modulaire architectuur om continue datastroom te ondersteunen en zorg ervoor dat elke fase van de pijplijn bijdraagt aan reproduceerbaarheid, interpreteerbaarheid en schaalbaarheid gedurende de experimentele workflow.
2. Computationele omgeving en systeemconfiguratie
- Installeer de benodigde softwareafhankelijkheden voordat je de workflow uitvoert door een commandoregelterminal te openen en het volgende commando uit te voeren:
pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
- Controleer de succesvolle installatie van alle softwarepakketten en controleer compatibiliteit met de softwareversies die in de Materiaaltabel staan vermeld voordat u doorgaat met datapreprocessing en modelontwikkeling.
- Gebruik Python 3.11 als de primaire programmeeromgeving. Installeer en configureer NumPy 1.26 en Pandas 2.1 voor datamanipulatie en feature engineering-taken. Installeer Scikit-learn 1.5 voor de ontwikkeling en evaluatie van machine learning-modellen.
- Installeer TensorFlow 2.15 voor deep learning-modeltraining en inferentie. Installeer SHAP 0.46 en LIME 0.2.0 voor uitlegbaarheidsanalyse. Installeer OpenCV 4.10 voor beeldverwerkingstaken. Installeer Matplotlib 3.9 en Seaborn 0.13 voor datavisualisatie en resultaatrapportage. Raadpleeg de Materiaaltabel voor volledige softwarespecificaties en implementatiedetails die nodig zijn voor reproduceerbaarheid.
- Configureer de computationele omgeving met een werkstation uitgerust met een multi-core processor, grafische verwerkingsunit (GPU) versnelling en voldoende geheugen om grote gezondheidsdatasets en deep learning-workloads te verwerken.
- Stel vaste willekeurige seeds in voor datapartitionering, modelinitialisatie en trainingsprocedures om reproduceerbaarheid te garanderen over experimentele runs. Schakel logmechanismen in om voorverwerkingsoperaties, modelconfiguraties, hyperparameterinstellingen, trainingsprocedures en evaluatieresultaten gedurende de workflow vast te leggen.
- Configureer de modelarchitecturen, optimalisatieparameters, leersnelheden, batchgroottes, trainingsinstellingen en hyperparameterwaarden volgens de specificaties die in Tabel 1 zijn samengevat. Houd je aan deze instellingen tijdens replicatie-experimenten om consistentie met de gerapporteerde resultaten te waarborgen.
- Verwachte Output - Een volledig geconfigureerde en reproduceerbare computationele omgeving met alle benodigde softwarepakketten, hardwarebronnen, logmechanismen en modelconfiguratie-instellingen beschikbaar voor latere datapreprocessing, modelontwikkeling, verklaarbaarheidsanalyse en evaluatieprocedures.
| Component | Parameter | Waarde | Beschrijving |
| Willekeurig Bos | n_estimators | 100 | Aantal bomen |
| Willekeurig Bos | max_depth | Geen enkele | Boomdiepte |
| XGBoost | learning_rate | 0.01 | Leertempo |
| XGBoost | n_estimators | 100 | Boost-kogels |
| CNN | Epochs | 25 | Opleidingsperiodes |
| CNN | batch_size | 32 | Batchgrootte |
| CNN | Optimizer | Adam | Optimalisatie-algoritme |
| MLP | hidden_layers | 2 | Aantal verborgen lagen |
| MLP | Activering | ReLU | Activatiefunctie |
| Algemeen | train_split | 70% | Trainingsdataratio |
| Algemeen | validation_split | 15% | Validatieratio |
| Algemeen | test_split | 15% | Testverhouding |
Tabel 1: Implementatiedetails en hyperparameterconfiguratie.
Deze tabel vat de computationele omgeving, softwarebibliotheken, machine learning- en deep learning-modelconfiguraties, optimalisatie-instellingen, leersnelheden, batchgroottes, trainingsparameters en hyperparameterwaarden samen die tijdens de experimentele evaluatie van het voorgestelde verklaarbare AI-framework zijn gebruikt.
3. Datasetvoorbereiding en -preprocessing
- Selecteer openbaar beschikbare gezondheidszorgdatasets om transparantie en reproduceerbaarheid van de experimentele workflow te waarborgen.;
- Gebruik vier representatieve zorgscenario's om het voorgestelde kader te valideren: (i) borstkankerdiagnose met behulp van de Wisconsin Breast Cancer Dataset, (ii) diabetesrisicovoorspelling met de Pima Indians Diabetes Dataset, (iii) klinische uitkomstvoorspelling met behulp van MIMIC-III elektronische patiëntendossiers, en (iv) classificatie van thoracale ziekten met de NIH Chest X-ray Dataset. Kies deze datasets om het kader te evalueren over gestructureerde klinische dossiers, longitudinale elektronische patiëntendossiers en medische beeldvormingsmodaliteiten die vaak worden gebruikt in zorgondersteuningssystemen.
- Importeer elke dataset in de Python-omgeving en scheid de records in invoerfuncties en doelvariabelen. Organiseer gestructureerde klinische gegevens voor ziektevoorspellingstaken, elektronische patiëntendossiers voor longitudinale uitkomstanalyse en medische beeldvormingsdatasets voor diagnostische classificatietaken. Controleer de integriteit van elke dataset voordat je doorgaat met preprocessing-operaties.
- Identificeer en pak ontbrekende waarden aan met behulp van passende imputatietechnieken. Standaardiseer numerieke kenmerken via feature-schaal- en normalisatieprocedures om vergelijkbaarheid tussen variabelen te waarborgen.
- Codeer categorische variabelen met geschikte coderingsmethoden op basis van datasetkenmerken. Voer feature-selectie uit met behulp van correlatieanalyse en modelgebaseerde feature-importance-metingen om de meest relevante variabelen te identificeren en de datadimensionaliteit te verminderen.
- Verander alle medische beelden naar 224.224 pixels vóór de modeltraining. Normaliseer pixelintensiteitswaarden volgens de eisen van de geselecteerde deep learning-architectuur. Pas data-augmentatietechnieken toe, waaronder beeldrotatie en horizontale flipping, om de generalisatie van het model te verbeteren en overfitting te verminderen. Controleer de beeldkwaliteit en zorg voor consistentie van de beeldafmetingen door de hele dataset.
- Beoordeel de integriteit van data door de volledigheid, consistentie en uitlijning van feature-labels te evalueren. Controleer of alle records correct zijn toegewezen aan hun bijbehorende doelklassen. Bekijk de kenmerken van de dataset, waaronder steekproefgrootte, aantal features en datamodaliteit, zoals samengevat in Tabel 2.
- Implementeer dataset-specifieke validatieprocedures om methodologische nauwkeurigheid en reproduceerbaarheid te waarborgen. Noteer de steekproefgrootte, klasseverdeling, train-validatie-test splitsingsstrategie, lekkagepreventiemaatregelen, hyperparameteroptimalisatieprocedures, kruisvalidatieontwerp en extern testprotocol voor elke dataset. Vat deze validatieprocedures samen in Tabel 3.
- Voer preprocessing-kwaliteitscontroles uit door het beoordelen van ontbrekende waarde, verwijdering van uitschieters, feature-scaling, categorische codering, behoud van klassenverdeling en procedures voor het partitioneren van datasets. Controleer dat preprocessing-operaties consistent worden toegepast op alle datasets.
- Bevestig het ontbreken van aanzienlijke datalekken tijdens het partitioneren van datasets. Bekijk de preprocessing-validatieresultaten in Figuur 1 om te waarborgen dat gestandaardiseerde datasets zijn gegenereerd voor latere machine learning- en verklaarbaarheidsanalyses.
- Verwachte output - Genereer gereinigde en gestandaardiseerde datasets met ontbrekende waarden die correct zijn geadresseerd, categorische variabelen gecodeerd, numerieke kenmerken genormaliseerd en records gesplitst in trainings-, validatie- en testsubsets. Zorg ervoor dat datasetkenmerken, klasseverdelingen en validatieprocedures overeenkomen met die gerapporteerd in Tabel 2 en Tabel 3, en bevestig succesvolle preprocessingvalidatie zoals geïllustreerd in Figuur 1.
| Dataset | Type | Samples | Kenmerken | Doel |
| Borstkanker | Tabulair | 569 | 30 | Goedaardig/kwaadaardig |
| Diabetes | Tabulair | 768 | 8 | Uitkomst van diabetes |
| MIMIC-III | EPD | ~60.000 | Klinische variabelen | Sterfte |
| Röntgenfoto van de borst | Beeldvorming | ~112.000 | Afbeeldingen | Ziektelabels |
Tabel 2: Kenmerken van de dataset en gebruiksgevallen in de gezondheidszorg.
Deze tabel geeft een samenvatting van de gebruikte gezondheidszorgdatasets in de studie, inclusief type dataset, aantal steekproeven, aantal kenmerken, doelvariabelen, toepassingsdomein voor de gezondheidszorg en bijbehorende klinische gebruikssituaties. De datasets omvatten gestructureerde klinische dossiers, elektronische patiëntendossiers en medische beeldvormingsgegevens om de toepasbaarheid van het kader in diverse zorganalysescenario's aan te tonen.
| Dataset | Steekproefgrootte | Klassenverdeling | Splitstrategie | Lekpreventie | Hyperparameter Zoeken | Kruisvalidatie | Externe test |
| Borstkanker (UCI Wisconsin) | 569 | 357 Benign / 212 Malignant | 70/15/15 | Preprocessing alleen voor treinen | Rasterzoektocht | 5-voudig gelaagd CV | Onafhankelijke Holdout-set |
| Pima-indianen diabetes | 768 | 500 Niet-Diabetes / 268 Diabetisch | 70/15/15 | Preprocessing alleen voor treinen | Rasterzoektocht | 5-voudig gelaagd CV | Onafhankelijke Holdout-set |
| MIMIC-III EHR | 5274 | Uitkomstgestratificeerde cohorten | 70/15/15 Patiëntniveau | Patiëntniveau-scheiding | Willekeurige zoekopdracht | 5-voudig patiëntniveau CV | Onafhankelijke Holdout-set |
| NIH Thoraxfoto | 112120 | Longontsteking/Normaal gestratificeerd | 70/15/15 | Beeldniveau-scheiding | Willekeurige zoekopdracht | 5-voudig gelaagd CV | Onafhankelijke Holdout-set |
Tabel 3: Validatie op datasetniveau en experimenteel ontwerp.
Deze tabel vat de gebruikte validatiemethodologie voor elke dataset samen, inclusief steekproefgrootte, klassenverdeling, train-validatie-test splitstrategie, lekpreventieprocedures, hyperparameteroptimalisatiemethoden, kruisvalidatieontwerp en externe testprotocollen. Deze maatregelen werden geïmplementeerd om methodologische strengheid, reproduceerbaarheid en onbevooroordeelde modelevaluatie te waarborgen.

Figuur 1: Validatie van de data-voorverwerkingspijplijn.
Validatieresultaten voor belangrijke preprocessing-operaties uitgevoerd vóór modelontwikkeling. (A) Analyse van ontbrekende waarde over representatieve gezondheidszorgkenmerken. (B) Verdeling van een numerieke variabele vóór en na de behandeling van uitschieters. (C) Validatie van feature-schaal met standaardisatie. (D) Categorische coderingsvalidatie. (E) Klassenverdeling na preprocessing. (F) Validatie van de opdeling van trein-validatie-test gegevens. Deze resultaten bevestigen succesvolle voorverwerking en voorbereiding van de datasets voor voorspellende modellering en verklaarbaarheidsanalyse. Klik hier om een grotere versie van deze figuur te bekijken.
4. Systeemarchitectuur van het verklaarbare AI-framework
- Organiseer het framework met een gelaagde architectuur om modulaire verwerking te faciliteren, workflowtransparantie te verbeteren en reproduceerbare implementatie te ondersteunen. Configureer de Datalaag om ruwe gezondheidsdatasets te ontvangen en te beheren. Routeer alle binnenkomende datasets door de Data Layer voordat je preprocessing-operaties start.
- Voer gegevensopruiming, transformatie, normalisatie, feature engineering en coderingsprocedures uit binnen de Preprocessing-laag. Zorg ervoor dat alle preprocessing-operaties zijn afgerond vóór modelontwikkeling.
- Ontwikkel voorspellende modellen binnen de Modeling Layer met behulp van machine learning en deep learning-algoritmen. Train Gradient Boosting, Random Forest, Multilayer Perceptron (MLP) en Convolutional Neural Network (CNN) modellen met behulp van de vooraf verwerkte datasets en geoptimaliseerde hyperparameterconfiguraties.
- Pas uitlegbaarheidstechnieken toe binnen de Uitlegbaarheidslaag om modelvoorspellingen te interpreteren. Genereer feature-attributie-uitleg met SHAP en LIME voor gestructureerde datasets. Genereer Grad-CAM heatmaps voor beeldgebaseerde modellen om regio's te visualiseren die bijdragen aan modelvoorspellingen.
- Evalueer de voorspellende en verklaarbare prestaties binnen de Evaluatielaag. Bereken nauwkeurigheid, precisie, recall, F1-score, ROC-AUC, trouw, stabiliteit en clinici-gerichte evaluatiemetrics. Registreer alle evaluatie-uitkomsten voor latere analyse en rapportage.
- Genereer klinisch interpreteerbare visuele output binnen de Visualisatielaag. Maak prestatievergelijkingsgrafieken, visualisaties van feature-importance, SHAP-samenvattingsdiagrammen, LIME-uitleg, Grad-CAM heatmaps en rapportagedashboards gericht op clinici's. Sla alle visuele output op voor opname in het definitieve experimentele rapport.
- Bekijk de volledige frameworkarchitectuur zoals geïllustreerd in Figuur 2 voordat je doorgaat met de workflow-uitvoering.
- Verwachte output - Genereer volledig getrainde machine learning- en deep learning-modellen, waaronder Gradient Boosting, Random Forest, CNN en MLP-architecturen. Opslagmodelconfiguraties, geoptimaliseerde hyperparameters, trainingslogs, checkpointbestanden, uitlegbaarheidsuitdata en visualisatie-artefacten voor latere evaluatie en interpreteerbaarheidsanalyse.

Figuur 2: Systeemarchitectuur van het Explainable AI-framework voor gezondheidszorganalyse. Klik hier om een grotere versie van deze figuur te bekijken.
5. Workflow-uitvoering
- Verkrijg gezondheidszorgdatasets uit openbaar beschikbare repositories en sla deze op in gestructureerde formaten die geschikt zijn voor machine learning en deep learning-analyse. Bekijk de volledige workflow zoals geïllustreerd in Figuur 3 voordat je de experimentele procedure start.
- Voer het opschonen en voorverwerken van gegevens uit volgens de procedures beschreven in Sectie 3. Normaliseer numerieke variabelen met behulp van geschikte schaalmethoden. Cogeer categorische variabelen met geschikte coderingstechnieken. Identificeer en imputeer ontbrekende waarden met behulp van dataset-specifieke imputatiestrategieën. Controleer de gegevenskwaliteit, feature-label-uitlijning en de volledigheid van datasets voordat u doorgaat met modelontwikkeling.
- Verdeel elke dataset in trainings-, validatie- en testsubsets om onbevooroordeelde modelevaluatie te ondersteunen. Behoud klasseverdelingen tijdens dataset-partitionering en voer waar toepasselijk maatregelen voor het voorkomen van lekkage uit. Reserveer de testsubset exclusief voor de definitieve modelevaluatie.
- Train machine learning-modellen op gestructureerde datasets met behulp van ensemble-gebaseerde algoritmen, waaronder Gradient Boosting en Random Forest. Train deep learning-modellen op beeldvormingsdatasets met behulp van Convolutional Neural Network (CNN)-architecturen die ruimtelijke beeldkenmerken kunnen leren. Werk modelparameters iteratief bij tijdens training en monitor validatieprestaties na elke trainingsperiode. Pas vroegtijdig stoppen toe wanneer validatieprestaties verslechteren of niet verbeteren volgens de vooraf gedefinieerde stopcriteria.
- Optimaliseer modelhyperparameters met behulp van systematische zoekstrategieën, waaronder gridzoekopdrachten en gerandomiseerde zoekopdrachten. Pas de leersnelheid, het aantal schatters, boomdiepte, batchgrootte, aantal epochs en andere modelspecifieke parameters aan volgens validatieprestaties. Selecteer het uiteindelijke model op basis van voorspellende prestaties en generalisatiecapaciteit over validatiedatasets.
- Pas uitlegbaarheidsmethoden toe nadat je modeltraining hebt afgerond. Genereer globale verklaringen met feature-attributietechnieken om variabelen te identificeren die het sterkst bijdragen aan modelvoorspellingen. Genereer lokale verklaringen om individuele voorspellingsgevallen te analyseren en modelgedrag op steekproefniveau te evalueren. Maak Grad-CAM heatmaps voor beeldclassificatiemodellen om gebieden van het beeld te markeren die bijdragen aan het voorspelde resultaat. Sla alle uitlegresultaten op voor latere analyse en rapportage.
- Evalueer de voorspellende prestaties met behulp van nauwkeurigheid, precisie, recall, F1-score en het bedieningsgebied van de ontvanger onder de curve (ROC-AUC). Beoordeel de kwaliteit van de uitleg met behulp van betrouwbaarheids- en stabiliteitsmetrics om de betrouwbaarheid en consistentie van de uitleg te evalueren. Vergelijk modelprestaties over datasets en verklaarbaarheidsmethoden om de robuustheid en generaliseerbaarheid van het framework te beoordelen.
- Genereer visualisatie-uitkomsten en analytische rapporten om resultaten op een klinisch interpreteerbare manier te communiceren. Maak prestatievergelijkingsgrafieken, feature-importance plots, SHAP-samenvattingsvisualisaties, LIME-uitlegresultaten, Grad-CAM heatmaps en andere klinisch relevante visualisaties. Bekijk alle visuele uitkomsten om duidelijkheid en consistentie te waarborgen voordat je rapporteert.
- Documenteer alle preprocessing-operaties, modelconfiguraties, hyperparameterinstellingen, uitlegbaarheidsprocedures, validatiestrategieën en evaluatieresultaten. Onderhoud gedetailleerde experimentele records om reproduceerbaarheid en onafhankelijke replicatie van de workflow te vergemakkelijken. Controleer de consistentie van de resultaten over herhaalde experimentele runs en archiveer alle workflow-artefacten voor toekomstig gebruik.
- Verwachte output - Genereer een volledig getraind voorspellend model met geoptimaliseerde hyperparameters, opgeslagen modelgewichten, trainingslogboeken, prestatiemetrics en uitlegbaarheidsoutputs, inclusief SHAP-uitleg, LIME-uitleg en Grad-CAM heatmaps. Sla alle modelartefacten, evaluatierapporten en visualisatie-uitkomsten op voor latere analyse en reproduceerbaarheidsbeoordeling.

Figuur 3: End-to-end workflow van de Explainable AI-pijplijn. Klik hier om een grotere versie van deze figuur te bekijken.
6. Modelevaluatie en Verklaring Beoordeling
- Evalueer de prestaties van voorspellend model met behulp van standaard classificatiemetrics, waaronder nauwkeurigheid, precisie, terugroep, F1-score en het bedieningskarakteristiekgebied van de ontvanger onder de curve (ROC-AUC). Bereken nauwkeurigheid om de algehele classificatiecorrectheid te meten.
- Bereken precisie om het aandeel correct geïdentificeerde positieve voorspellingen te beoordelen. Bereken de terugroeping om het vermogen van het model te evalueren om positieve gevallen te identificeren. Bereken de F1-score om precisie en herinnering in balans te brengen. Bereken ROC-AUC om discriminatieprestaties over verschillende classificatiedrempels te beoordelen.
- Pas deze evaluatiemetrics consequent toe over alle datasets en modelarchitecturen om objectieve prestatievergelijking te vergemakkelijken. Registreer alle metrische waarden en sla de evaluatieresultaten op voor latere statistische analyse en rapportage.
- Beoordeel de prestaties van verklaarbaarheid met behulp van trouw- en stabiliteitsmetrics. Bereken trouwheid om te bepalen in hoeverre gegenereerde verklaringen modelvoorspellingen en besluitvormingsgedrag nauwkeurig weergeven.
- Bereken stabiliteit door verklaringen te vergelijken die uit vergelijkbare inputmonsters zijn gegenereerd en de consistentie van uitleg-uitkomsten te kwantificeren. Controleer of getrouwheids- en stabiliteitswaarden voldoen aan de vooraf gedefinieerde kwaliteitscriteria voordat je modeluitleg interpreteert.
- Vergelijk de uitlegbaarheid van de prestaties tussen SHAP-, LIME- en Grad-CAM-uitgangen.
- Verwachte output - Genereer kwantitatieve evaluatieresultaten, waaronder nauwkeurigheid, precisie, recall, F1-score, ROC-AUC, betrouwbaarheid en stabiliteitsindicatoren. Produceer uitleg en visualisaties die geschikt zijn voor wetenschappelijke rapportages, reproduceerbaarheidsbeoordeling en klinische interpretatie.
7. Mensgerichte evaluatie
- Werf 12 zorgprofessionals, bestaande uit 6 artsen, 3 radiologen en 3 klinische data-analisten. Selecteer deelnemers met eerdere ervaring in klinische besluitvorming, interpretatie van medische beelden, gezondheidsanalyse of elektronische patiëntendossierbeoordeling. Verkrijg geïnformeerde toestemming van alle deelnemers voordat je de evaluatieprocedure start.
- Selecteer willekeurig 100 gevallen uit de testdatasets na voltooiing van modeltraining en verklaarbaarheidsanalyse. Genereer twee evaluatievoorwaarden voor elke casus:
- Alleen voorspellingsoutput en
- voorspelling vergezeld van informatie over verklaarbaarheid. Randomiseer de volgorde van presentaties en evaluatievoorwaarden om presentatiebias en leereffecten te minimaliseren.
- Bereid gestandaardiseerde evaluatieformulieren voor met voorspellingsresultaten, uitleg en beoordelingsvragenlijsten. Presenteer casussen individueel aan deelnemers via een computergebaseerde evaluatie-interface.
- Geef deelnemers opdracht om elk geval onafhankelijk te beoordelen zonder de antwoorden met andere beoordelaars te bespreken. Laat deelnemers alle evaluaties onder identieke experimentele omstandigheden uitvoeren.
- Voer een vijfpuntsvragenlijst op Likert-schaal uit, aangepast van gepubliceerde verklarbare evaluatiestudies over kunstmatige intelligentie. Instrueren deelnemers om vertrouwen, interpreteerbaarheid en bruikbaarheid te beoordelen voor elk beoordeeld geval. Noteer de antwoorden op de vragenlijst elektronisch en verifieer de invulling van alle enquête-items voordat je overgaat tot statistische analyse.
- Meet objectieve indicatoren van klinische bruikbaarheid tijdens het evaluatieproces. Leg beslissingsovereenkomst vast door de beslissingen van deelnemers te vergelijken met de bijbehorende referentielabels of grondwaarheidsuitkomsten. Bereken beslissingsovereenstemming als het percentage deelnemersbeslissingen dat overeenkomt met het referentieresultaat.
- Noteer de beoordelingstijd voor elke zaak door het interval te meten tussen de presentatie van de zaak en het indienen van het eindantwoord. Bereken de gemiddelde beoordelingstijd apart voor voorspellings- en voorspelling-met-uitleg-voorwaarden.
- Bereken gemiddelde vertrouwen-, interpreteerbaarheid- en bruikbaarheidsscores voor alle deelnemers en evaluatiegevallen. Vergelijk scores verkregen onder voorspelling-only en voorspelling-met-verklaring-voorwaarden.
- Voer na voltooiing van alle deelnemersevaluaties gepaarde t-tests uit om te bepalen of verschillen in vertrouwen, interpreteerbaarheid, bruikbaarheid, besluitovereenstemming en beoordelingstijd statistisch significant zijn. Gebruik een significantiedrempel van p 0,05 voor alle statistische vergelijkingen.
- Bereken Fleiss Kappa na het verzamelen van reacties van alle deelnemers om de overeenstemming tussen beoordelaars te beoordelen. Gebruik de geaggregeerde deelnemersbeoordelingen om de consistentie van evaluaties tussen beoordelaars te bepalen. Interpreteer de waarden van Fleiss Kappa volgens vastgestelde overeenkomstrichtlijnen en registreer de resulterende overeenkomststatistieken.
- Vat de demografie van de deelnemers, evaluatiemethodologie, het ontwerp van de vragenlijst, statistische analyseprocedures, objectieve prestatiematen en de resultaten van overeenstemming tussen beoordelaars samen in Tabel 4.
- Bekijk modelresultaten onder beide evaluatievoorwaarden en vergelijk de reacties van deelnemers over de omstandigheden. Controleer of verklaringen het vertrouwen, de interpreteerbaarheid en bruikbaarheid verbeteren zonder de beslissingskwaliteit negatief te beïnvloeden.
- Bevestig de consistentie van de deelnemersbeoordelingen met behulp van de berekende Fleiss Kappa-statistiek. Registreer alle evaluatieresultaten voor latere rapportage en reproduceerbaarheidsbeoordeling.
- Verwachte output - Genereer vertrouwensscores van kliniciën, interpreteerbaarheidsbeoordelingen, bruikbaarheidsbeoordelingen, beslissingsovereenkomstmaten, beoordelingsstatistieken, gepaarde t-testresultaten en inter-rater overeenkomststatistieken. Produceer kwantitatieve bewijzen die de klinische bruikbaarheid, interpretatie en betrouwbaarheid van het verklaarbare kunstmatige intelligentiesysteem beschrijven.
| Parameter | Waarde |
| Experts | 12 |
| Artsen | 6 |
| Radiologen | 3 |
| Klinische data-analisten | 3 |
| Beoordeelde zaken | 100 |
| Evaluatieontwerp | Gerandomiseerd (alleen voorspelling versus voorspelling+uitleg) |
| Surveyinstrument | 5-punts Likert-schaal |
| Trustbeoordeling | Interpreteerbaarheid, Vertrouwen, Bruikbaarheid |
| Statistische Test | Gepaarde t-test (p 0,05) |
| Inter-rater betrouwbaarheid | Fleiss Kappa |
| Objectieve Maatregelen | Beslissingsovereenkomst, Beoordelingstijd |
Tabel 4: Mensgericht evaluatieprotocol en Ontwerp van de Clinici-beoordeling.
Deze tabel presenteert het evaluatiekader voor clinici dat wordt gebruikt om de interpreteerbaarheid, betrouwbaarheid en bruikbaarheid van het verklaarbare AI-systeem te beoordelen. Informatie over de demografie van de deelnemers, de methodologie van case review, het ontwerp van enquêtes, statistische analyseprocedures, inter-rater betrouwbaarheidsbeoordeling en objectieve evaluatiematen wordt samengevat.
8. Validatie- en reproduceerbaarheidsbeoordeling
- Voer validatie- en ablatiestudies uit om de robuustheid en betrouwbaarheid van het voorgestelde kader te beoordelen. Identificeer kenmerken met hoge belangrijkheidsscores met behulp van de geselecteerde verklaringsmethoden. Verwijder belangrijke features stapsgewijs en train de voorspellende modellen opnieuw na elke stap van feature-verwijdering.
- Evalueer de modelprestaties na elk ablatie-experiment met behulp van nauwkeurigheid, precisie, herinnering, F1-score en ROC-AUC-metrieken. Vergelijk de resulterende prestatiewaarden met de basismodelprestaties om de bijdrage van individuele kenmerken aan voorspellende uitkomsten te bepalen.
- Beoordeel de stabiliteit van verklaringen door verklaringen te genereren voor vergelijkbare inputmonsters met SHAP, LIME en Grad-CAM. Vergelijk uitlegresultaten over herhaalde evaluaties en kwantificeer consistentie met behulp van de vooraf gedefinieerde stabiliteitsmetrics. Controleer of verklaringen stabiel blijven bij kleine invoervariaties en herhaalde experimentele runs.
- Registreer alle experimentele procedures gedurende de hele workflow. Documenteer voorverwerkingsoperaties voor dataset, dataset-partitioneringsprocedures, modelarchitecturen, hyperparameterinstellingen, trainingsconfiguraties, verklaarbaarheidsmethoden, validatiestrategieën en evaluatiemetrics. Sla alle configuratieparameters en experimentele uitgangen op in een gestructureerd formaat om reproduceerbaarheid en onafhankelijke verificatie te vergemakkelijken.
- Bekijk alle experimentele dossiers om volledigheid en consistentie te waarborgen. Controleer of de workflow kan worden gerepliceerd met behulp van de gedocumenteerde procedures, configuratiebestanden en softwarespecificaties. Behoud een modulaire workflowstructuur om de aanpassing van het protocol voor toekomstige studies te faciliteren en ondersteun de overgang naar een videogebaseerd experimenteel protocol dat consistent is met de JoVE-methodologische eisen.
9. Reproduceerbaarheidsbronnen
- Voer alle experimenten uit met vaste willekeurige seeds om reproduceerbare resultaten te garanderen over herhaalde runs. Onderhoud broncode, preprocessing-scripts, configuratiebestanden, omgevingsspecificaties, modelparameters en visualisatiescripts binnen een publiek toegankelijke repository.
- Geef gedetailleerde instructies voor datasetverwerving, voorverwerking, experimentuitvoering, modeltraining, uitlegbaarheidsgeneratie, validatieprocedures en regeneratie van alle gerapporteerde tabellen en figuren. Archiveer alle workflowcomponenten die nodig zijn voor onafhankelijke replicatie, inclusief softwarespecificaties, preprocessing-workflows, configuratiebestanden, dataset-toegangsinstructies, modelcontrolepunten en visualisatie-assets.
- Vat de softwarebronnen, preprocessing-workflows, configuratiebestanden, datasettoegangsinstructies en reproduceerbaarheidsassets samen die door het hele framework worden gebruikt in Tabel 5.
- Verwachte output - Genereer een compleet reproduceerbaar experimenteel pakket met preprocessingscripts, configuratiebestanden, getrainde modellen, modelcontrolepunten, uitlegbaarheidsuitgangen, validatierapporten, visualisatie-artefacten, softwarespecificaties en documentatie die nodig is voor onafhankelijke replicatie en verificatie van het voorgestelde framework.
| Bron | Beschrijving |
| Broncode | Python-implementatiescripts voor datapreprocessing, modeltraining, uitlegbaarheid en evaluatie |
| Omgevingsbestand | requirements.txt die pakketafhankelijkheden en versies bevatten |
| Configuratiebestanden | Modelarchitectuurinstellingen, hyperparameters en experimentconfiguraties |
| Opgeloste willekeurige zaden | Zaad = 42 gebruikt voor reproduceerbare experimenten |
| Instructies voor datasettoegang | Links en procedures voor het verkrijgen van datasets van de publieke gezondheidszorg |
| Preprocessing Scripts | Scripts voor data-opschoning, normalisatie, codering en feature-selectie |
| Figuurgeneratie Scripts | Scripts om alle manuscriptfiguren te regenereren |
| Tabelgeneratie-scripts | Scripts om gerapporteerde tabellen en metrieken te reproduceren. |
| Voorbeeldinvoer | Voorbeelddatasets en invoerbestanden |
| Voorbeelduitvoer | Voorspellingsresultaten, uitleg en evaluatierapporten |
Tabel 5: Reproduceerbaarheidsbronnen en experimentele assets.
Deze tabel vat de bronnen samen die worden geleverd ter ondersteuning van experimentele reproduceerbaarheid, waaronder broncode, preprocessing-scripts, configuratiebestanden, omgevingsspecificaties, dataset-toegangsinstructies, vaste willekeurige seedinstellingen, figuurgeneratiescripts en voorbeeldinvoer-/uitvoerbestanden die nodig zijn om de gerapporteerde resultaten te reproduceren.