Reviewartikel

Verklaarbare AI voor visuele inspectie: een vergelijkende analyse en beoordeling

DOI:

10.3791/69440

10 oktober 2025

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze review synthetiseert verklaarbare AI (XAI)-methoden voor visuele inspectie in industriële en medische domeinen. Een PRISMA-geleide zoekopdracht identificeerde 75 studies, die een domeinspecifieke taxonomie en vergelijkende analyse informeerden met behulp van gestandaardiseerde metrieken. We dragen bij aan een evidence-based taxonomie en een praktijkgerichte workflow voor de selectie van tools.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Explainable Artificial Intelligence (XAI)-technieken maken transparantie en vertrouwen in geautomatiseerde visuele inspectiesystemen mogelijk door black-box machine learning-modellen begrijpelijk te maken. Hoewel XAI op grote schaal is toegepast, hebben eerdere beoordelingen niet ingegaan op de specifieke eisen van industriële en medische inspectietaken. Dit artikel geeft een overzicht van studies die XAI-technieken toepassen op visuele inspectie in industriële en medische domeinen. Er werd systematisch gezocht in IEEE Xplore, Scopus, PubMed, arXiv en Web of Science naar studies die tussen 2014 en 2025 zijn gepubliceerd, met inclusiecriteria die de toepassing van XAI in inspectietaken vereisen met behulp van openbare of domeinspecifieke datasets. Uit een eerste pool van onderzoeken werden er 75 opgenomen en gecategoriseerd in post-hoc en intrinsiek, die vervolgens werden geëvalueerd met betrekking tot betrouwbaarheid, robuustheid, complexiteit en lokalisatienauwkeurigheid. De resultaten tonen aan dat op gradiënt en voortplanting gebaseerde methoden efficiënte visuele verklaringen bieden die geschikt zijn voor bijna realtime inspectie, zij het met grove lokalisatie, terwijl op verstoring gebaseerde en surrogaatmodelmethoden meer gedetailleerde attributies bieden tegen hogere rekenkosten, maar met verminderde robuustheid. Bovendien illustreren op prototypes gebaseerde netwerken en architecturen voor zelfaandacht de afwegingen tussen interpreteerbaarheid en voorspellende prestaties. Het selecteren van de meest effectieve XAI-methode is niet one-size-fits-all; Het hangt af van de behoeften op het gebied van gegevensset, latentie en interpreteerbaarheid. Deze review introduceert een uniforme taxonomie van XAI-methoden voor visuele inspectie, vergelijkt verschillende benaderingen in zowel industriële als medische domeinen met behulp van gestandaardiseerde metrieken, en stelt een taakgebaseerde selectieworkflow voor om beoefenaars te begeleiden bij het kiezen van de optimale methode. Vergeleken met eerdere beoordelingen biedt dit werk een domeinoverschrijdende vergelijkende analyse op basis van kwantitatieve benchmarks en schetst het richtingen voor gestandaardiseerde evaluatie en gebruikersgerichte validatie.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het is essentieel voor industrieën zoals de productie, de auto-industrie, voedselverpakkingen, de farmaceutische industrie en de gezondheidszorg om te controleren of producten en systemen adequaat en veilig functioneren. Automatiserings- en machine learning-tools, die verder gaan dan traditionele visuele inspectie door menselijke operators of rudimentaire camerasystemen, verbeteren de nauwkeurigheid, productiesnelheid en consistentie1. AI-inspectie maakt real-time monitoringmogelijk 2 en defectdetectie in omgevingen met een hoge doorvoer3, waardoor menselijke fouten en operationele kosten worden verminderd4. Het gebruik van kunstmatige intelligentie, met name met de vooruitgang in machine learning (ML) en deep learning (DL), heeft autonome systemen mogelijk gemaakt die defecten detecteren5, objecten classificeren en complexe visuele patronen identificeren6. Onlangs hebben Convolutional Neural Networks (CNN's)7, terugkerende netwerken en Vision Transformers (ViT's) op regels gebaseerde systemen overtroffen in taken die variëren van het opsporen van oppervlaktefouten tot het lokaliseren van anomalieën in medische beeldvorming. Inspectie is verschoven van op regels gebaseerde processen naar datagestuurde modellen die zijn getraind op grote datasets8.

Veel AI-modellen functioneren als 'zwarte dozen', wat betekent dat er geen inzicht is in hoe deze modellen beslissingen nemen. Dit gebrek aan transparantie brengt risico's met zich mee. In de productie kunnen verkeerde voorspellingen bijvoorbeeld leiden tot meer afval, herbewerking, terugroepacties van producten en ontevredenheid van klanten. Bij medische beeldvorming zijn verkeerde classificaties kritischer omdat ze diagnoses kunnen vertragen of behandelplannen in gevaar kunnen brengen. Zelfs de ontwikkelaars van deze modellen kunnen hun output vaak niet volledig uitleggen, wat het vertrouwen en de acceptatie beperkt.

Dit is waar Explainable AI (XAI) essentieel wordt. XAI is een groep methoden en hulpmiddelen die tot doel hebben beslissingen over machine learning-modellen interpreteerbaar te maken voor mensen9. Het doel is om black-box-voorspellers om te zetten in transparante "glass-box"-systemen door voor mensen leesbare rechtvaardigingen te geven voor hun output. In de praktijk zou een XAI-inspectiesysteem verder gaan dan het detecteren van defecten door niet alleen een onderdeel als defect te markeren, maar ook uit te leggen waarom het is gemarkeerd.

Ondanks de groeiende literatuur blijven de bestaande onderzoeken naar XAI in computervisie beperkt in reikwijdte. Velen concentreren zich uitsluitend op medische beeldvorming of industriële inspectie, waarbij ze nuttige taxonomieën bieden, maar voornamelijk vertrouwen op kwalitatieve vergelijkingen zonder gestandaardiseerde benchmarks. Bredere reviews, zoals Nauta et al.10, bieden domeinonafhankelijke overzichten, maar bieden geen praktijkgerichte selectiekaders. Zelfs het meest uitgebreide computervisie-onderzoek tot nu toe door Cheng et al.11 bevordert de taxonomie en bespreekt statistieken zoals getrouwheid en lokalisatienauwkeurigheid, maar het blijft algemeen voor visietaken en gaat niet specifiek in op visuele inspectie, high-throughput implementatie of human-in-the-loop-validatie. Evenzo hanteren industriële beoordelingen van XAI voor prognostiek en vermogensbeheer een PRISMA-kader, maar richten ze zich op prognostiek en gezondheidsbeheer (PHM) in plaats van visuele inspectietaken.

Om deze lacunes aan te pakken, draagt deze beoordeling het volgende bij:

Systematische taxonomie: Een PRISMA-geleide beoordeling van 75 onderzoeken over zowel industriële als medische visuele inspectie.

Vergelijkend onderzoek: Benchmarking van meerdere XAI-methoden (GradCAM, LRP, SHAP, LIME en RISE) op datasets voor openbare visuele inspectie (bijv. MVTec AD, PCB) met gestandaardiseerde statistieken, waaronder AUC voor deletie/invoeging, nauwkeurigheid van het aanwijsspel, stabiliteit en latentie.

Kader voor evaluatiestatistieken: Formele definities en vergelijkingen voor getrouwheid, robuustheid, interpreteerbaarheid en taakspecifieke maatregelen die worden gebruikt bij het evalueren van XAI-methoden.

Praktische richtsnoeren: Casestudy's en een praktijkgerichte selectieworkflow die taaktype, latentie en uitlegbehoeften koppelt aan specifieke methoden.

Samen vormen deze bijdragen de meest domeinspecifieke, op benchmarks gebaseerde synthese van XAI voor visuele inspectie, gericht op zowel onderzoekers als praktijkmensen die op zoek zijn naar betrouwbare begeleiding.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Review en perspectief

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

2. XAI-kader

De meeste state-of-the-art AI-modellen, met name diepe neurale netwerken, worden vaak behandeld als zwarte dozen; Er is weinig zicht op hoe ze beslissingen nemen12. Dat gebrek aan transparantie is een barrière voor vertrouwen en verklaarbaarheid in diverse toepassingen. Als gevolg hiervan is XAI een onmisbaar onderdeel geworden van betrouwbare AI. Geen enkele aanpak past bij alle scenario's: sommige methoden gaan uit van volledige toegang tot interne modelonderdelen, terwijl andere het model behandelen als een onveranderlijke zwarte doos; Sommige geven prioriteit aan lokale verklaringen voor individuele voorspellingen, terwijl andere globaal inzicht geven in het gedrag van een model. Zoals weergegeven in Figuur 1, hebben deze overwegingen geleid tot twee brede categorieën van XAI-technieken op basis van wanneer verklaarbaarheid wordt geïntroduceerd: post-hoc verklaringsmethoden en intrinsieke interpreteerbaarheidsmethoden13. Post hoc methoden worden verder gecategoriseerd in model-agnostisch en modelspecifiek14.

figure-protocol-1
Figuur 1: XAI-raamwerk voor visuele inspectie. Klik hier om een grotere versie van deze figuur te bekijken.

  1. Post-hoc explanation methods
    Post-hocmethoden genereren uitleg nadat een model is getraind, zonder de architectuur of parameters te wijzigen15. Deze benaderingen zijn populair omdat ze beoefenaars in staat stellen te profiteren van high-performance modellen en vervolgens hun output achteraf uit te leggen16. Omdat het onderliggende model echter ongewijzigd blijft, moeten post-hocverklaringen de redenering van het model benaderen of afleiden, wat benaderingsfouten en instabiliteit kan introduceren17. In de volgende paragrafen worden zowel modelspecifieke als agnostische methoden uitgelegd.
    1. Model-specifiek
      Deze methoden maken gebruik van kennis van de structuur of het trainingsmechanisme van een model om uitleg te geven die is afgestemd op dat model. Een goed voorbeeld is gradiënt-gebaseerde attributie voor diepe neurale netwerken. Methoden zoals GradCAM (Gradient-weighted Class Activation Mapping) gebruiken de interne gradiënten van getrainde CNN's om visuele "heatmaps" te produceren die de regio's van een invoerafbeelding markeren die het belangrijkst zijn voor een bepaalde voorspelling17. GradCAM berekent de gradiënt van de doelklassescore met betrekking tot functiekaarten in de laatste convolutionele laag en projecteert deze gradiënten op de afbeelding, wat een klassediscriminerende lokalisatiekaart oplevert. Andere methoden voor het voortplanten van gradiënten generaliseren naar verschillende netwerkarchitecturen. Integrated Gradients (IG)18 verzamelt gradiënten langs het pad van een basislijninvoer (bijvoorbeeld een lege afbeelding) naar de daadwerkelijke invoer, en voldoet aan de gewenste axioma's voor functietoeschrijving. DeepLIFT19 propageert op dezelfde manier verschillen van een referentieactivering door elke laag om de bijdrage van elke invoerfunctie te schatten. Laaggewijze Relevance Propagation (LRP) propageert een voorspellingsscore laag voor laag, waarbij "relevantie" wordt verdeeld over elke invoerpixel of functie20. Samenvattend maken modelspecifieke methoden gebruik van interne gradiënten, activeringen of aandacht om verklaringen te produceren die nauw zijn gekoppeld aan de structuur van het model.
    2. Model-agnostisch
      Daarentegen behandelen model-agnostische methoden het model als een zwarte doos die kan worden opgevraagd voor uitvoer. Deze technieken maken minimale aannames, waarbij meestal alleen wordt vereist dat men de voorspelling van het model voor verstoorde invoer kan verkrijgen. Voorbeelden zijn LIME (Local Interpretable Model-Agnostic Explanations), dat een eenvoudig, interpreteerbaar model gebruikt (zoals een schaars lineair model of beslissingsboom) om het gedrag van het complexe model in de buurt van een bepaalde invoer na te bootsen21. Voor een specifieke voorspelling genereert LIME vele verstoorde versies van de invoer, haalt de voorspellingen van het black-box-model voor elke versie op en leert vervolgens een gewogen lineaire regressie die die lokale input-outputrelaties benadert22. De coëfficiënten van dit surrogaat lineaire model dienen als verklaring en geven aan welke kenmerken de voorspelling het sterkst bepalen23. De aantrekkingskracht van LIME ligt in de flexibiliteit (bruikbaar met elke classifier) en de intuïtieve output (bijvoorbeeld een kleine set gewogen functies). SHapley Additieve explanaties (SHAP) is een andere populaire model-agnostische methode gebaseerd op speltheorie24. SHAP verklaart een individuele voorspelling door functieattributies te berekenen die Shapley-waarden uit de coöperatieve speltheorie benaderen, waardoor eigenschappen als additiviteit en consistentie25 worden gegarandeerd. Naast de attributie van kenmerken omvatten modelagnostische benaderingen ook visuele verstoringsmethoden voor beeldmodellen. RISE (Randomized Input Sampling for Explanation) genereert belangrijkheidskaarten door willekeurig delen van het invoerbeeld te maskeren en te observeren hoe de output van het model verandert26. Door veel van dergelijke maskers te bemonsteren, bouwt RISE een probabilistische saliency-kaart die aangeeft welke pixels of regio's het meest invloedrijk waren op de voorspelling26. RISE vereist met name geen toegang tot interne onderdelen van het model en vereist alleen de mogelijkheid om het model te evalueren op gewijzigde input, waardoor het echt een zwarte doos is. Ten slotte richt een groeiend gebied van model-agnostische XAI zich op contrafeitelijke verklaringen. Een contrafeitelijke verklaring somt niet het belang van kenmerken op, maar beantwoordt in plaats daarvan de vraag: "Welke minimale verandering in de invoer zou de voorspelling van het model hebben veranderd?" 27. Algoritmen om contrafactuelen te genereren, voeren doorgaans een zoekopdracht uit in de invoerruimte (of een aangeleerde latente ruimte) naar het dichtstbijzijnde voorbeeld dat de gewenste output oplevert, terwijl ze realisme en spaarzaamheid in de veranderingen afdwingen. Samenvattend worden post-hoc XAI-methoden op grote schaal toegepast omdat ze na de training kunnen worden toegepast op high-performance modellen, waarbij voorspellende kracht wordt gecombineerd met een zekere mate van transparantie.
  2. Intrinsieke interpreteerbaarheidsmethoden
    Intrinsieke methoden hebben een fundamenteel andere benadering: in plaats van een black-box achteraf uit te leggen, maken deze methoden het model interpreteerbaar door ontwerp. Self-Explaining Neural Networks (SENN) zijn een opmerkelijk voorbeeld. In het SENN-raamwerk voorgesteld door Alvarez-Melis en Jaakola28, is het neurale netwerk gestructureerd om eerst een reeks tussenliggende conceptactiveringen te berekenen en vervolgens een voorspelling te genereren als een eenvoudige, verklaarbare functie van die concepten. ProtoPNet (Prototypical Part Network) is een diep netwerk dat invoer classificeert door ze te vergelijken met een reeks geleerde prototyperepresentaties van elke klasse. In een afbeeldingsclassificatietaak kan een ProtoPNet bijvoorbeeld prototypepatches leren en beslissingen nemen door uit te zoeken welke prototypes het meest worden geactiveerd door de invoer29. Op het gebied van sequentiemodellen en transformatoren zijn aandachtsmechanismen ook gebruikt voor intrinsieke interpreteerbaarheid. Sommige modellen worden getraind met een aandachtsuitlijningsdoelstelling, waardoor de aandachtsgewichten van het model overeenkomen met bekende belangrijke kenmerken of met door mensen gelabelde relevante regio's. Door de aandacht te sturen om "gelijk te hebben om de juiste redenen"30, produceren deze benaderingen modellen die niet alleen goed presteren, maar ook aandachtsverdelingen hebben die direct als verklaringen kunnen worden geïnterpreteerd. Bovendien bieden dergelijke modellen verklaringen die doorgaans getrouw zijn door constructie, aangezien de verklaring wordt gegenereerd op basis van de eigen interpreteerbare structuur van het model, niet op basis van een externe post-hoc benadering31.

3. XAI-taxonomie

Om een gestructureerde synthese van de stand van het onderzoek te bieden, is een systematisch literatuuronderzoek uitgevoerd aan de hand van de PRISMA-richtlijnen (Figuur 2). Het proces omvatte meerdere academische databases (Scopus, Web of Science, IEEE Xplore, SpringerLink, PubMed, arXiv en MDPI) en werd geleid door een reeks zoektermen die 'verklaarbare AI', 'interpreteerbaarheid', 'visuele inspectie', 'defectdetectie', 'anomaliedetectie', 'productie' en 'medische beeldvorming' combineerden. Inclusiecriteria vereisten dat papers XAI-methoden expliciet toepasten of evalueerden in visuele inspectiecontexten (industrieel of medisch) en voldoende methodologische details rapporteerden. Uitsluitingscriteria verwijderden puur theoretische voorstellen zonder implementatie, evenals werken buiten visuele inspectie. De zoekopdracht leverde in eerste instantie 483 records op. Na het verwijderen van duplicaten en het screenen van titels en samenvattingen, bleven er 147 over voor beoordeling in de volledige tekst. Het toepassen van in-/exclusiecriteria leverde 75 primaire studies op, die de basis vormen van deze review.

figure-protocol-2
Figuur 2: PRISMA-stroomdiagram van het systematische reviewproces volgens de PRISMA-richtlijnen. De figuur illustreert records die in elke fase zijn geïdentificeerd, gescreend en uitgesloten, wat 75 primaire onderzoeken oplevert die in de eindbeoordeling zijn opgenomen. Klik hier om een grotere versie van deze figuur te bekijken.

  1. Toegepaste taxonomie van beoordeelde studies
    Voortbouwend op het conceptuele kader dat in Sectie 2 werd geïntroduceerd (post-hoc en intrinsieke benaderingen), hebben we een domeinspecifieke taxonomie verfijnd die is afgeleid van deze 75 studies. Deze toegepaste taxonomie onderscheidt methoden op basis van hun implementatie in visuele inspectietaken, zoals weergegeven in figuur 3.
  2. Verdeling van studies over taxonomie
    De volledige verdeling van de 75 studies is samengevat in Tabel 1. Elke studie wordt in kaart gebracht op basis van zijn methodologische categorie en toepassingsdomein. Dit biedt een empirische basis voor de vergelijkende analyse die in hoofdstuk 4 wordt gepresenteerd.
  3. Synthese
    Uit deze systematische review komen verschillende duidelijke trends naar voren. Ten eerste blijven op gradiënt gebaseerde post-hocmethoden het meest toegepast in industriële en medische inspectietaken vanwege hun efficiëntie en gemakkelijke integratie. Ten tweede bieden op verstoring gebaseerde methoden rijkere functietoeschrijvingen, maar komen ze minder vaak voor in industriële omgevingen met een hoge doorvoer vanwege computationele eisen. Ten derde winnen intrinsieke methoden aan populariteit, maar blijven ze ondervertegenwoordigd: minder dan 15% van de studies implementeert ze.
    Door deze taxonomie te verankeren in een reproduceerbare PRISMA-geleide review en deze te koppelen aan een gestructureerde database van 75 studies, wordt in deze sectie een gevalideerde bewijsbasis opgebouwd. Deze bevindingen vormen de basis voor de vergelijkende analyse in sectie 4, waar representatieve methoden worden gebenchmarkt op basis van gestandaardiseerde maatstaven (getrouwheid, robuustheid, latentie en lokalisatienauwkeurigheid).

figure-protocol-3
Figuur 3: Voorgestelde taxonomie van XAI-methoden in visuele inspectietaken. Klik hier om een grotere versie van deze figuur te bekijken.

XAI-methodeXAI-aanpakStuderenIndustrieJaar
IntrinsiekOp regels gebaseerde en lineaire modellen32,33 ZoekertjesAlgemeen medisch2015–2019
Op basis van prototypes (ProtoPNet, op basis van casussen, vervormbaar ProtoPNet) 29,34,35,36 Medisch, Industrieel, Algemeen2018–2024
Conceptgedreven (concept bottleneck, juist-om-oor-de-oorzaken) 30,31,37 Algemene, wetenschappelijke toepassingen2020–2021
Zelfverklarende neurale netwerken (SENN)28Algemeen2018–2020
Ontwarde vertegenwoordiging (β-VAE), SOXAI38,39 ZoekertjesAlgemeen2018
Vision Transformers (Intrinsieke interpreteerbaarheid via aandacht) 40,41,42,43,44,45 Computer Vision, Productie2020–2024
Post-hoc, Model-specifiekCAM Familie 46,47,48,49,50,51,52, 53,54,55,56,57,58 Medische beeldvorming, Productie, Automotive, Landbouw, Elektronica2018–2025
LRP (Laaggewijze Relevantie Propagatie) 20,59,60,61,62 Algemeen, Medische beeldvorming2015–2024
Gradiënt- en saliency-methoden (geïntegreerde gradiënten, soepele IG DeepLIFT, DeconvNet, T-Explainer, Saliency Benchmarks) 18,19,63,64,65,
66,67,68,69,70
Algemeen, Medische beeldvorming2013–2025
Attributie in gespecialiseerde modellen (SNN's, Transformers attention attribution) 71,72,73 Neurowetenschappen, Visie Transformers2023–2025
Post-hoc, Model-agnostischLIME & Varianten (LIME, ELIME, MASALA), SHAP & Varianten (Tree SHAP),Financiën, prognose en gezondheidsmanagement, cyberbeveiliging, autonome voertuigen, industriële inspectie.2016–2025
Contrafeitelijk 21,22,23,24,25,27,74,
75,76,77,78,79,80,81,
82,83,84,85,86
Uitleg
Hybride methodenIntegratie van meerdere XAI-methoden, waaronder (GradCAM, SHAP, LRP, LIME) 58,87,88,89,90,91,92 Industriële inspectie, gezondheidszorg, productie.2021–2025

Tabel 1: Classificatie van 75 beoordeelde onderzoeken volgens XAI-methode, jaar, branche en aanpak.

4. Evaluatiestatistieken voor XAI

De prestaties van een computervisiemodel worden beoordeeld aan de hand van gevestigde statistieken zoals nauwkeurigheid, precisie en herinnering. Het evalueren van de verklaarbaarheid van de beslissingen van een model is echter veel minder eenvoudig. In tegenstelling tot standaard voorspellende prestaties is er geen universeel aanvaarde maatstaf voor de kwaliteit van AI-verklaringen66. Met andere woorden, hoewel de nauwkeurigheid van een classificator nauwkeurig kan worden gemeten, is er geen overeengekomen schaal om te kwantificeren hoe "goed" een verklaring is voor een bepaalde beeldclassificatie93. Deze ongelijkheid benadrukt een fundamentele kloof op het gebied van XAI: hoe een verklaring te evalueren.

Het ontwikkelen van gestandaardiseerde XAI-evaluatiecriteria is buitengewoon uitdagend gebleken. Een van de redenen is dat interpreteerbaarheid en verklaringskwaliteit veelzijdig en contextafhankelijk zijn en daarom weerstand bieden aan een enkele universele metriek10. Het effectief beoordelen van een verklaring is afhankelijk van verschillende factoren, waaronder het toepassingsdomein, de aard van de geproduceerde uitleg en de achtergrond van de eindgebruiker. Een uitlegtechniek die geschikt is voor een medische beelddiagnose kan bijvoorbeeld anders worden beoordeeld dan een techniek die wordt gebruikt in een industriële visuele inspectietaak10.

In de praktijk heeft het ontbreken van standaardmetrieken ertoe geleid dat onderzoekers vertrouwen op een verscheidenheid aan evaluatiebenaderingen. Veel studies nemen nog steeds hun toevlucht tot kwalitatieve, anekdotische evaluatie van XAI-methoden94,95. Het is gebruikelijk om te zien dat auteurs een paar saliency maps of heatmaps presenteren en beweren dat deze redelijk lijken (de zogenaamde "face-validity"-test)96. Een dergelijke visuele inspectie kan overtuigend zijn in narratieve zin, maar het blijft subjectief en onvoldoende voor een rigoureuze vergelijking97. Dit illustreert de moeilijkheid om XAI-metrieken te standaardiseren; Bij gebrek aan overeengekomen criteria stellen onderzoekers statistieken voor die zijn afgestemd op elke dataset of use case.

Als gevolg hiervan is de literatuur nu rijk aan diverse XAI-evaluatiemaatstaven die bedoeld zijn om deze leemte op te vullen98. Er zijn tal van kaders en maatregelen naar voren gebracht, elk gericht op een bepaald aspect van wat een uitleg nuttig maakt99. In grote lijnen kunnen statistieken worden geclassificeerd op basis van hun primaire focus. Op getrouwheid gebaseerde metrieken beoordelen een verklaring aan de hand van hoe goed deze het besluitvormingsproces van het model100 weerspiegelt. Daarentegen evalueren interpreteerbaarheidsgerichte metrieken hoe begrijpelijk en overtuigend de verklaring is voor een menselijke waarnemer101. Een derde categorie zijn taakgebaseerde statistieken, waarbij de beoordeling van de uitleg afhankelijk is van de impact ervan op de prestaties van de eindgebruiker102. Een vierde categorie zijn robuustheidsgerichte maatstaven die de consistentie van de resultaten evalueren103. Ten slotte combineren hybride metrieken meerdere dimensies104.

Deze diversiteit aan metrieken geeft de aspecten van verklaarbaarheid aan die onderzoekers belangrijk vinden, maar benadrukt ook het ontbreken van een enkele standaard: elke metriek legt slechts één uitleghoek vastkwaliteit 105. Hieronder volgt een reeks evaluatiemaatstaven voor XAI, gegroepeerd in vier hoofdcategorieën en samengevat in tabel 2.

Metrisch typeMetriekFormule / Definitie
GetrouwheidDeletiegebied onder de curve (AUC)26figure-protocol-4
zijn top-k belangrijke kenmerken ; lager = trouwer
Invoeggebied onder de curve (AUC)26figure-protocol-5
hoger = trouwer
Ontrouw score103figure-protocol-6
lager = beter
ROAR106Nauwkeurigheid daalt na hertraining zonder 'belangrijke' functies
RobuustheidStabiliteitsindex107figure-protocol-7
hoger = consistenter
Lipschitz score: 103figure-protocol-8
lager = robuuster
InterpreteerbaarheidSpaarzaamheid79figure-protocol-9
lager = eenvoudiger
Surrogaat diepte79Diepte van het interpreteerbare surrogaat (bijv. beslissingsboom);
ondieper = eenvoudiger
Taak-specifiekintersectie-over-unie (IoU)108figure-protocol-10
overlapping van masker M en grondwaarheid G
Aanwijzend spel108Nauwkeurigheid = #hits / #samples
hoger = beter
HybrideSamengestelde score104Gewogen combinatie van getrouwheid, spaarzaamheid en robuustheid

Tabel 2: Evaluatiemaatstaven voor XAI bij visuele inspectie, gegroepeerd in vier hoofdcategorieën.

5. Vergelijkende analyse

In deze sectie worden methoden vergeleken in openbare datasets zoals MVTec AD109 (>5.000 defectafbeeldingen met maskers op pixelniveau) en DeepPCB110 (1.500 PCB-afbeeldingen met zes defectklassen), CheXpert111 en ImageNet112 en geëvalueerd op basis van de volgende statistieken: AUC voor deletie/invoeging (getrouwheid), nauwkeurigheid van het aanwijsspel (lokalisatie), stabiliteitsscores (robuustheid onder verstoringen) en latentie (runtimekosten).

Voor CAM-gebaseerde methoden (GradCAM, GradCAM++) tonen resultaten op MVTec AD en DeepPCB aan dat GradCAM een betrouwbaarheid bereikt van 0,83-0,87 (insertie AUC ~0,68; <15% nauwkeurigheidsdaling bij deletie), gevoeligheid (0,80 - 0,85) en runtime <100 ms (~39 frames per seconde (FPS)). De lokalisatie blijft matig (gemiddelde IoU ≈0,28 @ δ=0,25; richtnauwkeurigheid 86-87%). GradCAM++ verbetert de lokalisatie van meerdere instanties (gemiddelde IoU = 0,38) met behoud van een vergelijkbare latentie (<120 ms) en een hoger gebruikersvertrouwen (109,69/250 vs. 56,08/250 voor GradCAM). Deze methoden zijn efficiënt, maar ruimtelijk grof, 47.113.

Voor methoden op basis van verstoringen (LIME, SHAP, RISE) variëren de prestaties per dataset. Op MVTec AD bereikt LIME lokale getrouwheid R² = 0,70-0,80, maar vertoont een lage robuustheid (stabiliteitsindex <0,5), latentie van 3-5 s/beeld en matige lokalisatie (IoU = 0,25-0,35). SHAP toegepast op de classificatie van PCB-defecten bereikt consistente attributies (Δ log-odds = 0,2-0,3) met een sterke menselijke uitlijning (70-80%), maar is langzamer (>1 s/afbeelding) en heeft een zwakke lokalisatie (IoU ≈0,02-0,03). RISE, gebenchmarkt op MS-COCO en gerepliceerd voor MVTec AD, heeft een gemiddelde van 4.000-8.000 gemaskeerde voorwaartse passes, wat een hoge robuustheid (stabiliteit >0,7), getrouwheid (0,78-0,82 AUC) en superieure lokalisatie (Pointing-Game = 62,9% vs. 48,3% voor GradCAM) oplevert, maar met een latentie van 1-2 s/uitleg 26.74.79.114.

Voor relevantie-propagatiemethoden (LRP, DeepLIFT) geven evaluaties op DeepPCB en CheXpert aan dat LRP een getrouwheid van 0,82-0,90, een gevoeligheid ~0,85 en een lokalisatie-IoU van 0,40-0,50 bereikt. De looptijd is 100-200 ms per afbeelding, langzamer dan CAM's, maar haalbaar voor bijna realtime inspectie. Bij CheXpert-radiologietaken tonen studies van experts >70% overlap aan tussen LRP-heatmaps en klinisch relevante regio's, wat de interpreteerbaarheid in verschillende domeinen aantoont60.

Voor op aandacht gebaseerde methoden (Transformers), resultaten voor ViT-modellen die zijn getraind op ImageNet en CheXpert, leveren onbewerkte aandachtskaarten een getrouwheid op van 0,75-0,85, maar zijn ze onstabiel onder verstoringen, met een gevoeligheid van 0,70-0,75 en een bescheiden lokalisatie (IoU = 0,30-0,45). Het menselijk vertrouwen is ~60-70%. Aangepaste benaderingen (aandachtsstroom, Transformer-LRP) verbeteren causale metrieken en presteren beter dan ruwe aandacht in deletie/invoeging en pointing-game scores 40,115,116.

Voor op prototypes en contrafeiten gebaseerde methoden benadrukken evaluaties n MVTec AD dat ProtoPNet op voorbeelden gebaseerde verklaringen bereikt waar voorspellingen worden gerechtvaardigd door vergelijkbare defectgevallen, wat de operator helpt bij het nemen van beslissingen. Op SOM gebaseerde benaderingen clusteren defecte kenmerken op 2D-kaarten, waardoor topologische relaties behouden blijven. Contrafeitelijke methoden, getest op zowel afbeeldingen van PCB-defecten als CheXpert, bieden bruikbare redeneringen ("als de scheurlengte minder dan 1 mm is, verschuift de voorspelling naar normaal"), maar vereisen kostbare optimalisatie en worstelen met invoer met hoge resolutie. Deze methoden sluiten sterk aan bij het menselijk redeneren, maar schalen slecht 117,118,119.

Ten slotte, bij het overwegen van compromissen en praktische selectie, domineren CAM's latentiekritische workflows, maar blijven ze grof. LRP balanceert getrouwheid en runtime en blinkt uit in analyse op pixelniveau. RISE biedt de sterkste causale getrouwheid en lokalisatie, maar met een latentie op secondenniveau. SHAP en LIME verbeteren de interpreteerbaarheid, maar zijn traag en onstabiel. Prototypes en contrafactuelen maximaliseren de menselijke uitlijning, maar schalen slecht bij inspectie met hoge resolutie. Op transformatoren gebaseerde modellen vereisen gespecialiseerde aanpassingen die verder gaan dan ruwe aandacht. Geen enkele methode presteert dus universeel beter dan andere; In plaats daarvan moet de methodekeuze een weerspiegeling zijn van de behoeften op het gebied van dataset, taak, latentie, budget en interpreteerbaarheid. Zoals te zien is in figuur 4, integreert de selectieworkflow drie van deze benchmarks (taak, latentie, interpreteerbaarheid) in een taakgerichte gids voor het kiezen van XAI-methoden voor visuele inspectie.

figure-protocol-11
Figuur 4: Selectieworkflow voor de adoptie van de XAI-methode. Dit is een beslissingsstroomdiagram dat de selectie van geschikte XAI-methoden bij visuele inspectie begeleidt. De werkstroom houdt rekening met taaktypen (classificatie, segmentatie, anomaliedetectie, regressie), latentiebeperkingen en uitlegdetails, en koppelt deze aan representatieve methoden. Klik hier om een grotere versie van deze figuur te bekijken.

6. Discussie

  1. Vergelijkende bevindingen
    Onze analyse toont aan dat op gradiënt gebaseerde methoden zoals GradCAM en Layer-wise Relevance Propagation (LRP) uitblinken in het markeren van de specifieke beeldregio's die het meest invloedrijk zijn bij de beslissingen van een convolutioneel netwerk, waardoor ze intuïtieve hulpmiddelen zijn voor taken zoals defectlokalisatie of medische beeldclassificatie. Deze benaderingen zijn efficiënt omdat ze in één keer achterwaarts werken, maar hun uitleg is vaak grof en kan onduidelijk worden in complexe regio's. Daarentegen bieden modelagnostische technieken voor het attributeren van functies, zoals SHAP en LIME, meer kwantitatieve inzichten in functiebijdragen door het model te onderzoeken met verstoorde invoer of lokale surrogaten aan te passen, maar tegen hogere rekenkosten dan GradCAM.
    Op aandacht gebaseerde methoden maken gebruik van de interne gewichten van het model om de focusgebieden binnen het model te markeren115. RISE, aan de andere kant, vertegenwoordigt een op randomisatie gebaseerde strategie die invoer maskeert en bemonstert om flexibele saliency-kaarten te produceren, hoewel het duizenden voorwaartse passes vereist. Samen blinken deze technieken uit onder specifieke omstandigheden, maar geen enkele presteert universeel beter dan de andere26. In plaats daarvan hangt de keuze van de methode af van de modelarchitectuur, de visuele inspectietaak, latentievereisten en het type informatie dat besluitvormers nodig hebben.
  2. Casestudy
    Hieronder volgen praktijkvoorbeelden die XAI implementeren in zowel de medische als de industriële sector: in de gezondheidszorg werden longontsteking en COVID-19-detectiemodellen getraind op röntgenfoto's van de borstkas en CT-scans uitgelegd met GradCAM en LIME, en radiologen in gebruikersstudies gaven consequent de voorkeur aan GradCAM omdat de gemarkeerde regio's overeenkwamen met verwachte pathologie zoals longinfiltraten120. Evenzo benadrukten CNN-voorspellingen ondersteund door GradCAM en CAM met hoge resolutie in digitale pathologie voor hoofd-halskanker kwaadaardige celclusters die pathologen als klinisch relevant bevestigden, wat aantoont dat verklaringen zowel de klinische nauwkeurigheid als het vertrouwen versterkten121.
    In de productiesector heeft XAI een transformerend verschil gemaakt in nauwkeurigheid en verklaarbaarheid. Een van de belangrijkste toepassingen is de detectie van vreemde voorwerpen op röntgenfoto's van banden die gebruik maken van een convolutioneel neuraal netwerk op basis van de Xception-architectuur. Door de opname van Gradient-weighted Class Activation Mapping (GradCAM) bereikte het systeem een classificatienauwkeurigheid van meer dan 99% en produceerde het heatmaps die de precieze regio's binnen het beeld aangaven die verantwoordelijk zijn voor voorspellingen. Deze visuele uitleg stelde QA-ingenieurs in staat om te verifiëren dat de aandacht van het model uitging naar legitieme anomalieën binnen de structurele ondersteuning voor de band en niet naar irrelevante artefacten, waardoor het vertrouwen enorm werd verbeterd en de implementatie in productieomgevingen met hoge inzet werd vergemakkelijkt48.
    In de elektronica-industrie toont de SolderNet-benadering de integratie van XAI in defectinspectie op pixelniveau. De op CNN gebaseerde methode is ontwikkeld voor de inspectie van soldeerverbindingen op printplaten, een taak waarbij een hoge nauwkeurigheid en verklaarbaarheid vereist zijn. Met de toepassing van GradCAM en Layer-wise Relevance Propagation (LRP) heeft de methode saliency-kaarten geëxtraheerd die de pixels markeerden die verantwoordelijk waren voor specifieke defectclassificaties. Door een dergelijke verklaarbaarheid was de operator in staat om echte en valse positieven te onderscheiden en inzichten te verkrijgen in storingsmodi die voorheen black-box-outputs zouden zijn geweest39. Deze gevallen laten zien dat XAI wordt gewaardeerd wanneer de verklaringen overeenkomen met de redeneringen van experts, maar te weinig worden gebruikt wanneer de verklaringen onstabiel, grof of rekenkundig onpraktisch zijn.
  3. Beperkingen van het huidige bewijs
    Ondanks deze vooruitgang blijven er verschillende beperkingen bestaan. Ten eerste zijn de meeste empirische studies gebaseerd op openbare datasets zoals MVTec AD voor industriële inspectie of VinDR-CXR122 voor medische beeldvorming, die mogelijk niet volledig de echte omgeving van fabrieken of ziekenhuizen vertegenwoordigen. Ten tweede blijft de evaluatie gefragmenteerd: getrouwheid, robuustheid en interpreteerbaarheid worden inconsistent gemeten in verschillende onderzoeken, vaak met ad-hocdefinities en zonder gestandaardiseerde drempels. Ten derde missen veel werken menselijke validatie. Hoewel statistieken zoals verwijderings-AUC, nauwkeurigheid van het aanwijsspel of lokalisatie-IoU kwantitatieve resultaten opleveren, bevestigen ze niet dat deze verklaringen de besluitvorming van gebruikers daadwerkelijk verbeteren. Ten slotte integreert slechts ~8% van de op AI gebaseerde kwaliteitsborgingsonderzoeken in de productie XAI in hun workflow123. Dit benadrukt de praktische adoptiekloof, ook al verschilt deze statistiek per sector en methodologie en is deze mogelijk niet nauwkeurig.
  4. Praktische implicaties voor de praktijk
    Voor beoefenaars komen er verschillende implicaties naar voren. Op gradiënt gebaseerde methoden blijven de meest praktische keuze voor real-time inspectietaken, omdat ze uitleg geven met een lage latentie (~100 ms per beeld) en eenvoudig te implementeren zijn. Op verstoring gebaseerde benaderingen, zoals SHAP of RISE, hebben een hogere latentie dan op gradiënt gebaseerde methoden, maar zijn beter geschikt voor domeinen waar fijnmazige attributie opweegt tegen latentie, zoals de gezondheidszorg, waar nauwkeurigheid voorrang heeft op snelheid. Op aandacht gebaseerde benaderingen zijn nuttig bij transformatorarchitecturen, maar ze vereisen een zorgvuldige interpretatie omdat ruwe aandacht niet altijd een duidelijke verklaring geeft. Naast technische compromissen hangt succesvolle adoptie sterk af van integratie, gebruikerstraining en het aantonen van de klinische waarde van interpreteerbaarheid. Zoals de casestudy's laten zien, winnen toelichtingen alleen aan waarde als ze duidelijk aansluiten bij domeinexpertise en beoefenaars helpen AI-voorspellingen te verifiëren of aan te vechten.
  5. Toekomstige onderzoeksrichtingen
    Toekomstig onderzoek moet prioriteit geven aan verschillende bruikbare richtingen:
    Standaardisatie van evaluatieprotocollen: Stel reproduceerbare rapportagerichtlijnen op voor belangrijke statistieken, waaronder AUC voor verwijderen/invoegen, nauwkeurigheid van het aanwijsspel, stabiliteitsindices en latentie.
    Domeinspecifieke benchmarkgegevenssets: Ontwikkel gecureerde datasets voor industriële en medische visuele inspectie met ground-truth-annotaties om te veel vertrouwen op beperkte openbare datasets te verminderen.
    Mensgerichte validatie: Breid onderzoeken uit die meten of XAI-verklaringen de beslissingskwaliteit, het vertrouwen van gebruikers en de samenwerking tussen mens en AI verbeteren die verder gaan dan proxy-statistieken
    Kosten-batenanalyse: Voer rigoureuze implementatiestudies uit om de zakelijke en klinische waarde van de integratie van XAI in visuele inspectieworkflows te kwantificeren.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Conclusies

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze review onderzocht 75 studies van XAI in visuele inspectie, wat resulteerde in een taxonomie van post-hoc en intrinsieke methoden en een benchmark-gedreven vergelijkende analyse. De bevindingen bevestigen dat geen enkele methode universeel beter presteert dan andere: op gradiënt gebaseerde benaderingen zoals GradCAM en LRP zijn efficiënt voor real-time defectlokalisatie, maar hun verklaringen kunnen grof zijn in complexe regio's. Op verstoring gebaseerde methoden zoals SHAP, LIME en ...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat er geen belangenconflicten zijn met betrekking tot de publicatie van dit werk.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteur(s) verklaren dat dit werk geen specifieke subsidie heeft ontvangen van een financieringsinstantie in de publieke, commerciële of non-profitsector.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Alzarooni, A., et al. Anomaly detection for industrial applications, its challenges, solutions, and future directions: a review. IEEE Sens J. XX. (1), 1(2025).
  2. Hardan, F., Almusawi, A. R. J. Developing an automated vision system for maintaing social distancing to cure the pandemic. Al-Khwarizmi Eng J. 18 (1), 38-50 (2022).
  3. Terasaki, N., Fujio, Y. Mechanoluminescent visualization of crack propagation for joint evaluation. J Vis Exp. (191), e64118(2023).
  4. Al-Hamadani, S., Al-Darraji, I. Warehouse in Industry 4.0 based drone, computer vision, and artificial intelligence technologies: a literature review. Proc Eng Sci. 7 (1), 517-526 (2025).
  5. Al-Jubori, H. N., Izzat, A. D., Jerbi, H. Defect detection using thermography camera techniques: a review. Al-Khwarizmi Eng J. 20 (4), 70-88 (2024).
  6. Al-Hamadani, S., Al-Darraji, I., Jerbi, H. Improving barcode vision scanning process using a drone-based tracking PID controller for warehouse in Industry 4.0. Al-Khwarizmi Eng J. 21 (2), 72-92 (2025).
  7. Al-Jubori, H. N., Al-Darraji, I. Tools and process of defect detection in automated manufacturing systems. EAI Endorsed Trans Scalable Inf Syst. 10 (6), e4000(2023).
  8. Alaa, T., et al. Automated detection of defects on metal surfaces using vision transformers. , Published online October 6, 2024. Accessed August 1 (2025).
  9. Moosavi, S., et al. Explainable AI in manufacturing and industrial cyber-physical systems: a survey. Electronics. 13 (17), 3497(2024).
  10. Nauta, M., et al. From anecdotal evidence to quantitative evaluation methods: a systematic review on evaluating explainable AI. ACM Comput Surv. 55 (13), 1-42 (2023).
  11. Cheng, Z., et al. A comprehensive review of explainable artificial intelligence (XAI) in computer vision. Sensors. 25 (13), 4166(2025).
  12. Barredo Arrieta, A., et al. Explainable artificial intelligence (XAI): concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 58, 82-115 (2020).
  13. Kouchaki, S., et al. Survey of explainable AI techniques in healthcare. Sensors. 23 (2), 634(2023).
  14. Laugel, T., et al. The dangers of post-hoc interpretability: unjustified counterfactual explanations. Proc Int Joint Conf Artif Intell. , 2801-2807 (2019).
  15. Slack, D., et al. Reliable post hoc explanations: modeling uncertainty in explainability. Adv Neural Inf Process Syst. 33, 9391-9404 (2020).
  16. Cesarini, M., et al. Explainable AI for text classification: lessons from a comprehensive evaluation of post hoc methods. Cognit Comput. 16 (6), 3077-3095 (2024).
  17. Mohamed Musthafa, M., et al. Enhancing brain tumor detection in MRI images through explainable AI using Grad-CAM with ResNet-50. BMC Med Imaging. 24 (1), 1-19 (2024).
  18. Sundararajan, M., Taly, A., Yan, Q. Axiomatic attribution for deep networks. Proc Int Conf Mach Learn. 70, 5109-5118 (2017).
  19. Shrikumar, A., Greenside, P., Kundaje, A. Learning important features through propagating activation differences. Proc Int Conf Mach Learn. 70, 4844-4866 (2017).
  20. Bassi, P. R. A. S., et al. Improving deep neural network generalization and robustness to background bias via layer-wise relevance propagation optimization. Nat Commun. 15, 44371(2024).
  21. Knab, P., et al. Which LIME should I trust? Concepts, challenges, and solutions. arXiv preprint. , (2025).
  22. Garreau, D., von Luxburg, U. Explaining the explainer: a first theoretical analysis of LIME. Proc Mach Learn Res. 108, 1287-1296 (2020).
  23. Qian, J., et al. ELIME: exact local interpretable model-agnostic explanation. Eur J Artif Intell. , (2024).
  24. Salih, A. M., et al. A perspective on explainable artificial intelligence methods:SHAP and LIME . Adv Intell Syst. , (2024).
  25. Hermosilla, P., et al. Explainable AI for forensic analysis: a comparative study of SHAP and LIME in intrusion detection models. Appl Sci. 15 (13), 7329(2025).
  26. Petsiuk, V., Das, A., Saenko, K. RISE: randomized input sampling for explanation of black-box models. arXiv preprint. , (2018).
  27. Dandl, S., et al. Multi-objective counterfactual explanations. Lect Notes Comput Sci. 12269, 448-469 (2020).
  28. Alvarez-Melis, D., Jaakkola, T. S. Towards robust interpretability with self-explaining neural networks. Adv Neural Inf Process Syst. 31, 7775-7784 (2018).
  29. Donnelly, J., Barnett, A. J., Chen, C. Deformable ProtoPNet: an interpretable image classifier using deformable prototypes. Proc IEEE Conf Comput Vis Pattern Recognit. , 10255-10265 (2022).
  30. Ross, A. S., Hughes, M. C., Doshi-Velez, F. Right for the right reasons: training differentiable models by constraining their explanations. Proc Int Joint Conf Artif Intell. , 2662-2670 (2017).
  31. Schramowski, P., et al. Making deep neural networks right for the right scientific reasons by interacting with their explanations. Nat Mach Intell. 2 (8), 476-486 (2020).
  32. Rudin, C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nat Mach Intell. 1 (5), 206-215 (2019).
  33. Letham, B., et al. Interpretable classifiers using rules and Bayesian analysis: building a better stroke prediction model. Ann Appl Stat. 9 (3), 1350-1371 (2015).
  34. Barnett, A. J., et al. Interpretable mammographic image classification using case-based reasoning and deep learning. arXiv preprint. , (2021).
  35. Narayanan, A., Bergen, K. J. Prototype-based methods in explainable AI and emerging opportunities in the geosciences. arXiv preprint. , (2024).
  36. Chen, C., et al. This looks like that: deep learning for interpretable image recognition. Adv Neural Inf Process Syst. 32, 8928-8939 (2019).
  37. Koh, P. W., et al. Concept bottleneck models. Proc Int Conf Mach Learn. 119, 5294-5304 (2020).
  38. Burgess, C. P., et al. Understanding disentangling in β-VAE. arXiv preprint. , (2018).
  39. Gunraj, H., et al. SolderNet: towards trustworthy visual inspection of solder joints in electronics manufacturing using explainable artificial intelligence. Proc AAAI Conf Artif Intell. 37, 15668-15674 (2023).
  40. Dosovitskiy, A., et al. An image is worth 16×16 words: transformers for image recognition at scale. arXiv preprint. , (2020).
  41. Khan, S., et al. Transformers in vision: a survey. ACM Comput Surv. 54 (10), 1-41 (2021).
  42. Yu, L., et al. eX-ViT: a novel explainable vision transformer for weakly supervised semantic segmentation. Pattern Recognit. 142, 109666(2023).
  43. Alber, M., et al. Evaluating vision transformer models for visual quality control in industrial manufacturing. Lect Notes Comput Sci. Bifet, A., et al. 14950, 1-15 (2024).
  44. Stassin, S., et al. Explainability and evaluation of vision transformers: an in-depth experimental study. Electronics. 13 (1), 175(2024).
  45. Zhai, Y., et al. A lightweight transformer with linear self-attention for defect recognition. Electron Lett. 60 (17), e13292(2024).
  46. Dhore, V., et al. Enhancing explainable AI: a hybrid approach combining Grad-CAM and LRP for CNN interpretability. arXiv preprint. , (2024).
  47. Chattopadhay, A., et al. Grad-CAM++: generalized gradient-based visual explanations for deep convolutional networks. Proc IEEE Winter Conf Appl Comput Vis. , 839-847 (2018).
  48. Saleh, R. A. A., et al. Advancing tire safety: explainable artificial intelligence-powered foreign object defect detection with Xception networks and Grad-CAM interpretation. Appl Sci. 14 (10), 4267(2024).
  49. Meister, S., et al. Investigations on explainable artificial intelligence methods for the deep learning classification of fibre layup defect in the automated composite manufacturing. Compos Part B Eng. 224, 109160(2021).
  50. Luo, X., Alzahrani, M. Automated tomato defect detection using CNN feature fusion for enhanced classification. Processes. 13 (1), 115(2025).
  51. Rahimunnisa, K. Textile fabric defect detection. J Innov Image Process. 4 (3), 165-172 (2022).
  52. Shin, H., et al. Visualization for explanation of deep learning-based defect detection model using class activation map. Comput Mater Contin. 75 (3), 4753-4766 (2023).
  53. Yue, H., et al. ASOD: attention-based salient object detector for strip steel surface defects. Electronics. 14 (5), 831(2025).
  54. Saleh, R. A. A., Ertunç, H. M. Explainable attention-based fused convolutional neural network (XAFCNN) for tire defect detection: an industrial case study. Eng Res Express. 6 (1), 015027(2024).
  55. Leem, S., Seo, H. Attention guided CAM: visual explanations of vision transformer guided by self-attention. Proc AAAI Conf Artif Intell. 38 (4), 2956-2964 (2024).
  56. Ibrahim, R., Shafiq, M. O. Augmented Score-CAM: high-resolution visual interpretations for deep neural networks. Knowl Based Syst. 252, 109287(2022).
  57. Clement, T., et al. XAI-enhanced semantic segmentation models for visual quality inspection. Proc IEEE Int Conf Consumer Electron. , 1-4 (2024).
  58. Riedel, H., et al. Automated quality control of vacuum insulated glazing by convolutional neural network image classification. Autom Constr. 135, 104144(2022).
  59. Böhle, M., et al. Layer-wise relevance propagation for explaining deep neural network decisions in MRI-based Alzheimer's disease classification. Front Aging Neurosci. 10, 194(2019).
  60. Bach, S., et al. On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation. PLoS One. 10 (7), e0130140(2015).
  61. Dieter, T. R., Zisgen, H. Evaluation of the explanatory power of layer-wise relevance propagation using adversarial examples. Neural Process Lett. 55 (7), 8531-8550 (2023).
  62. Hoefler, M. A., et al. XAI-guided insulator anomaly detection for imbalanced datasets. arXiv. , (2024).
  63. Kares, F., et al. What makes for a good saliency map? Comparing strategies for evaluating saliency maps in explainable AI (XAI). arXiv preprint. , (2025).
  64. Yona, G., Greenfeld, D. Revisiting sanity checks for saliency maps. arXiv preprint. , (2021).
  65. Zeiler, M. D., Fergus, R. Visualizing and understanding convolutional networks. Eur Conf Comput Vis. 8689, 818-833 (2014).
  66. Xu-Darme, R., et al. On the stability, correctness and plausibility of visual explanation methods based on feature importance. ACM Int Conf Proc Ser. , 119-125 (2023).
  67. Ortigossa, E. S., et al. T-Explainer: a model-agnostic explainability framework based on gradients. arXiv preprint. , (2024).
  68. Singh, M., et al. Attributional robustness training using input-gradient spatial alignment. Lect Notes Comput Sci. 12372, 515-533 (2019).
  69. Cerekci, E., et al. Quantitative evaluation of saliency-based explainable artificial intelligence methods in deep learning-based mammogram analysis. Eur J Radiol. 173, 111356(2024).
  70. Meister, S., et al. Cross-evaluation of a parallel operating SVM-CNN classifier for reliable internal decision-making processes in composite inspection. J Manuf Syst. 60, 620-639 (2021).
  71. Bitar, A., et al. Gradient-based feature-attribution explainability methods for spiking neural networks. Front Neurosci. 17, 1153999(2023).
  72. Qiang, Y., et al. Interpretability-aware vision transformer. arXiv preprint. , (2023).
  73. Bousselham, W., et al. LeGrad: an explainability method for vision transformers via feature formation sensitivity. arXiv preprint. , (2025).
  74. Lundberg, S. M., Lee, S. I. A unified approach to interpreting model predictions. Adv Neural Inf Process Syst. 30, (2017).
  75. Khan, F. S., et al. Model-agnostic explainable artificial intelligence methods in finance: a systematic review, recent developments, limitations, challenges and future directions. Artif Intell Rev. 58, 1-65 (2025).
  76. Nazim, S., et al. Advancing malware imagery classification with explainable deep learning: a state-of-the-art approach using SHAP LIME and Grad-CAM. PLoS One. 20 (5), e0318542(2025).
  77. Solís-Martín, D., et al. On the soundness of XAI in prognostics and health management (PHM). Information. 14 (5), 256(2023).
  78. Biecek, P., Burzykowski, T. Local interpretable model-agnostic explanations (LIME). In:Explanatory Model Analysis. , 107-123 (2021).
  79. Ribeiro, M. T., Singh, S., Guestrin, C. 34;Why should I trust you?" Explaining the predictions of any classifier. Proc ACM SIGKDD Int Conf Knowl Discov Data Min. , 1135-1144 (2016).
  80. Tahir, H. A., et al. A novel hybrid XAI solution for autonomous vehicles: real-time interpretability through LIME-SHAP integration. Sensors. 24 (21), 6776(2024).
  81. Goldman, C. V., et al. Explaining learning models in manufacturing processes. Procedia Comput Sci. 180, 259-268 (2021).
  82. Emmanouilidis, C., Rica, E. Visual quality control via explainable AI and the case of human in the AI loop. In: Lect Notes Mech Eng. , 252-260 (2023).
  83. Huang, M., et al. An interpretable approach using hybrid graph networks and explainable AI for intelligent diagnosis recommendations in chronic disease care. Biomed Signal Process Control. 91, 105913(2024).
  84. Dardouillet, P., et al. Explainability of image semantic segmentation through SHAP values. Data. 7 (8), 255(2022).
  85. Saifullah, S., et al. The privacy-explainability trade-off: unraveling the impacts of differential privacy and federated learning on attribution methods. Front Artif Intell. 7, 1236947(2024).
  86. Velmurugan, M., et al. Developing guidelines for functionally-grounded evaluation of explainable artificial intelligence using tabular data. Eng Appl Artif Intell. 141, 109772(2025).
  87. Wells, L., Bednarz, T. Explainable AI and reinforcement learning-a systematic review of current approaches and trends. Front Artif Intell. 4, 550030(2021).
  88. Rožanec, J. M., et al. Adaptive explainable artificial intelligence for visual defect inspection. Procedia Comput Sci. 232, 3034-3043 (2024).
  89. Nguyen, H. T. T., et al. XEdgeAI: a human-centered industrial inspection framework with data-centric explainable edge AI approach. Inf Fusion. 116, 102782(2025).
  90. Han, C., et al. Visual coating inspection framework via self-labeling and multi-stage deep learning strategies. J Intell Manuf. 35, 1-18 (2024).
  91. Kotsiopoulos, T., et al. Revolutionizing defect recognition in hard metal industry through AI explainability, human-in-the-loop approaches and cognitive mechanisms. Expert Syst Appl. 255, 124839(2024).
  92. Forcher, B., et al. Evaluation of explainable AI methods for classification tasks in visual inspection. Proc XAI Workshop (Late-Breaking Work, Demos, Doctoral Consortium). , 77-82 (2023).
  93. Miller, T. Explanation in artificial intelligence: insights from the social sciences. Artif Intell. 267, 1-38 (2019).
  94. Jacovi, A., Goldberg, Y. Towards faithfully interpretable NLP systems: how should we define and evaluate faithfulness. Proc Annu Meet Assoc Comput Linguist. 58, 4198-4205 (2020).
  95. Adebayo, J., et al. Sanity checks for saliency maps. Adv Neural Inf Process Syst. 31, 9505-9515 (2018).
  96. Doshi-Velez, F., Kim, B. Considerations for evaluation and generalization in interpretable machine learning. Proc Explainable and Interpretable Models in Computer Vision and Machine Learning. , 3-17 (2018).
  97. Lage, I., et al. An evaluation of the human-interpretability of explanation. arXiv preprint. , (2019).
  98. Theunissen, M., Browning, J. Putting explainable AI in context: institutional explanations for medical AI. Ethics Inf Technol. 24 (2), 1-10 (2022).
  99. Hoffman, R. R., et al. Measures for explainable AI: explanation goodness, user satisfaction, mental models, curiosity, trust, and human-AI performance. Front Comput Sci. 5, 1096257(2023).
  100. Hedström, A., et al. Quantus: an explainable AI toolkit for responsible evaluation of neural network explanations and beyond. J Mach Learn Res. 24, 1-11 (2023).
  101. Mohseni, S., et al. A multidisciplinary survey and framework for design and evaluation of explainable AI systems. ACM Trans Interact Intell Syst. 11 (3-4), 1-45 (2021).
  102. Finzel, B., et al. Domain-specific evaluation of visual explanations for application-grounded facial expression recognition. Lect Notes Comput Sci. 14065, 31-44 (2023).
  103. Yeh, C. K., et al. On the (in)fidelity and sensitivity for explanations. Adv Neural Inf Process Syst. 32, 10967-10978 (2019).
  104. Better metrics for evaluating explainable artificial intelligence. Rosenfeld, A. Proc Int Conf Autonomous Agents Multiagent Syst, , 45-53 (2021).
  105. Evaluation metrics for XAI: a review, taxonomy, and practical applications. Kadir, M. A., et al. Proc IEEE Int Conf Intell Eng Syst, , 111-124 (2023).
  106. Sankaran, K. Data science principles for interpretable and explainable AI. J Data Sci. 22, 1-27 (2024).
  107. Alvarez-Melis, D., Jaakkola, T. S. On the robustness of interpretability methods. arXiv preprint. , (2018).
  108. Zhang, Y., et al. Saliency-Bench: a comprehensive benchmark for evaluating visual explanations. arXiv preprint. , (2025).
  109. Bergmann, P., et al. The MVTec anomaly detection dataset: a comprehensive real-world dataset for unsupervised anomaly detection. Int J Comput Vis. 129 (4), 1038-1059 (2021).
  110. Tang, S., et al. Online PCB defect detector on a new PCB defect dataset. arXiv preprint. , (2019).
  111. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. Irvin, J., et al. Proc AAAI Conf Artif Intell, 33, 590-597 (2019).
  112. ImageNet: a large-scale hierarchical image database. Deng, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 248-255 (2009).
  113. Selvaraju, R. R., et al. Grad-CAM: visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128 (2), 336-359 (2020).
  114. Black-box explanation of object detectors via saliency maps. Petsiuk, V., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 11438-11447 (2020).
  115. Attention is not explanation. Jain, S., Wallace, B. C. Proc Conf North Am Chapter Assoc Comput Linguist, , 3543-3556 (2019).
  116. Transformer interpretability beyond attention visualization. Chefer, H., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 782-791 (2021).
  117. Wachter, S., et al. Counterfactual explanations without opening the black box: automated decisions and the GDPR. SSRN Electron J. , (2017).
  118. Deep learning for case-based reasoning through prototypes: a neural network that explains its predictions. Li, O., et al. Proc AAAI Conf Artif Intell, 32, 3530-3537 (2018).
  119. Counterfactuals in explainable artificial intelligence (XAI): evidence from human reasoning. Byrne, R. M. J. Proc Int Joint Conf Artif Intell, , 6276-6282 (2019).
  120. Ihongbe, I. E., et al. Evaluating explainable artificial intelligence (XAI) techniques in chest radiology imaging through a human-centered lens. PLoS One. 19 (10), e0308758(2024).
  121. Dörrich, M., et al. Explainable convolutional neural networks for assessing head and neck cancer histopathology. Diagn Pathol. 18 (1), 121(2023).
  122. Nguyen, H. Q., et al. VinDr-CXR: an open dataset of chest X-rays with radiologist's annotations. Sci Data. 9, 429(2022).
  123. Lee, D. J., et al. A systematic literature review on artificial intelligence and explainable artificial intelligence for visual quality assurance in manufacturing. Electronics. 12 (22), 4572(2023).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

XAI techniekenindustri le inspectiemedische inspectiegradi ntmethodenpropagatiemethodenperturbatiemethodensurrogaatmodellenself attention architecturen

Gerelateerde artikelen