Derleme makalesi

Görsel İnceleme için Açıklanabilir Yapay Zeka: Karşılaştırmalı Bir Analiz ve İnceleme

DOI:

10.3791/69440

10 Ekim 2025

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu derleme, endüstriyel ve tıbbi alanlarda görsel inceleme için açıklanabilir AI (XAI) yöntemlerini sentezlemektedir. PRISMA rehberliğinde yapılan bir araştırma, alana özgü bir sınıflandırma ve standartlaştırılmış ölçümler kullanarak karşılaştırmalı analiz hakkında bilgi veren 75 çalışma belirledi. Takım seçimi için kanıta dayalı bir taksonomiye ve uygulayıcı odaklı bir iş akışına katkıda bulunuyoruz.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Açıklanabilir Yapay Zeka (XAI) teknikleri, kara kutu makine öğrenimi modellerini anlaşılır hale getirerek otomatik görsel denetim sistemlerinde şeffaflık ve güven sağlar. XAI yaygın olarak uygulanmış olsa da, önceki incelemeler endüstriyel ve tıbbi denetim görevlerinin özel taleplerini ele almamıştır. Bu makale, XAI tekniklerini endüstriyel ve tıbbi alanlarda görsel incelemeye uygulayan çalışmaları gözden geçirmektedir. IEEE Xplore, Scopus, PubMed, arXiv ve Web of Science'da 2014 ile 2025 yılları arasında yayınlanan çalışmalar için sistematik bir araştırma yapıldı ve dahil edilme kriterleri, XAI'nin kamuya açık veya alana özgü veri kümeleri kullanılarak denetim görevlerinde uygulanmasını gerektirdi. İlk çalışma havuzundan 75 tanesi dahil edildi ve post-hoc ve içsel olarak kategorize edildi ve bunlar daha sonra aslına uygunluk, sağlamlık, karmaşıklık ve yerelleştirme doğruluğu açısından değerlendirildi. Sonuçlar, gradyan ve yayılma tabanlı yöntemlerin, kaba lokalizasyonla da olsa, neredeyse gerçek zamanlı incelemeye uygun verimli görsel açıklamalar sunduğunu, pertürbasyon tabanlı ve vekil model yöntemlerinin ise daha yüksek hesaplama maliyetiyle ancak daha az sağlamlıkla daha ayrıntılı atıflar sağladığını göstermektedir. Ek olarak, prototip tabanlı ağlar ve öz-dikkat mimarileri, yorumlanabilirlik ve tahmine dayalı performans arasındaki dengeyi göstermektedir. En etkili XAI yöntemini seçmek herkese uyan tek bir çözüm değildir; veri kümesine, gecikmeye ve yorumlanabilirlik gereksinimlerine bağlıdır. Bu derleme, görsel inceleme için XAI yöntemlerinin birleşik bir sınıflandırmasını tanıtmakta, standartlaştırılmış ölçümler kullanarak hem endüstriyel hem de tıbbi alanlardaki farklı yaklaşımları karşılaştırmakta ve uygulayıcılara en uygun yöntemi seçmede rehberlik etmek için göreve dayalı bir seçim iş akışı önermektedir. Önceki incelemelerle karşılaştırıldığında, bu çalışma, nicel kıyaslamalara dayanan alanlar arası karşılaştırmalı bir analiz sunar ve standartlaştırılmış değerlendirme ve kullanıcı merkezli doğrulama için yönergeleri ana hatlarıyla belirtir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

İmalat, otomotiv, gıda ambalajı, ilaç ve sağlık gibi sektörlerin ürün ve sistemlerin yeterli ve güvenli bir şekilde çalıştığını doğrulaması önemlidir. İnsan operatörler veya ilkel kamera tabanlı sistemler tarafından gerçekleştirilen geleneksel görsel incelemenin ötesine geçen otomasyon ve makine öğrenimi araçları doğruluğu, üretim hızını ve tutarlılığı artırır1. Yapay zeka denetimi, yüksek verimli ortamlarda gerçek zamanlı izleme2 ve kusur tespitine3 olanak tanıyarak insan hatasını ve operasyonel maliyetleri azaltır4. Yapay zekanın kullanımı, özellikle makine öğrenimi (ML) ve derin öğrenmedeki (DL) gelişmelerle birlikte, kusurları tespit eden5, nesneleri sınıflandıran ve karmaşık görsel kalıpları tanımlayan otonom sistemleri mümkün kılmıştır6. Son zamanlarda, Evrişimli Sinir Ağları (CNN'ler)7, tekrarlayan ağlar ve Görüntü Transformatörleri (ViT'ler), tıbbi görüntülemede yüzey kusuru tespitinden anormallik lokalizasyonuna kadar uzanan görevlerde kural tabanlı sistemleri geride bırakmıştır. Denetim, kural tabanlı süreçlerden büyük veri kümeleri üzerinde eğitilmiş veri odaklı modellere kaymıştır8.

Birçok yapay zeka modeli "kara kutu" işlevi görüyor, yani bu modellerin nasıl karar verdiğine dair hiçbir fikir yok. Bu şeffaflık eksikliği riskler barındırıyor. Örneğin üretimde yanlış tahminler israfın artmasına, yeniden çalışmaya, ürünün geri çağrılmasına ve müşteri memnuniyetsizliğine yol açabilir. Tıbbi görüntülemede yanlış sınıflandırmalar, tanıları geciktirebileceği veya tedavi planlarını tehlikeye atabileceği için daha kritiktir. Bu modellerin geliştiricileri bile çoğu zaman çıktılarını tam olarak açıklayamıyor, bu da güveni ve benimsenmeyi sınırlıyor.

Açıklanabilir Yapay Zekanın (XAI) gerekli hale geldiği yer burasıdır. XAI, makine öğrenimi modeli kararlarını insanlar tarafından yorumlanabilir hale getirmeyi amaçlayan bir grup yöntem ve araçtır9. Amacı, çıktıları için insan tarafından okunabilir gerekçeler sağlayarak kara kutu tahmincilerini şeffaf "cam kutu" sistemlerine dönüştürmektir. Uygulamada, XAI özellikli bir denetim sistemi, yalnızca bir parçayı kusurlu olarak işaretlemekle kalmayıp aynı zamanda neden işaretlendiğini de açıklayarak kusur tespitinin ötesine geçecektir.

Büyüyen literatüre rağmen, bilgisayarlı görmede XAI ile ilgili mevcut anketlerin kapsamı sınırlı kalmaktadır. Birçoğu dar bir şekilde tıbbi görüntüleme veya endüstriyel denetime odaklanır, yararlı sınıflandırmalar sunar, ancak öncelikle standartlaştırılmış kıyaslamalar olmadan niteliksel karşılaştırmalara dayanır. Nauta ve ark.10 gibi daha geniş incelemeler, alandan bağımsız genel bakışlar sağlar, ancak uygulayıcı odaklı seçim çerçeveleri sunmakta yetersiz kalır. Cheng ve ark.11 tarafından bugüne kadarki en kapsamlı bilgisayarlı görü araştırması bile taksonomiyi ilerletmekte ve aslına uygunluk ve yerelleştirme doğruluğu gibi ölçütleri tartışmaktadır, ancak görme görevlerinde genel kalmakta ve görsel inceleme, yüksek verimli dağıtım veya döngüdeki insan doğrulamasını özel olarak ele almamaktadır. Benzer şekilde, XAI'nin prognostik ve varlık yönetimi için endüstriyel incelemeleri bir PRISMA çerçevesini benimser ancak görsel inceleme görevlerinden ziyade Prognostik ve Sağlık Yönetimine (PHM) odaklanır.

Bu boşlukları gidermek için bu inceleme aşağıdakilere katkıda bulunmaktadır:

Sistematik taksonomi: Hem endüstriyel hem de tıbbi görsel muayenede 75 çalışmanın PRISMA rehberliğinde gözden geçirilmesi.

Karşılaştırmalı analiz: Birden fazla XAI yönteminin (GradCAM, LRP, SHAP, LIME ve RISE) genel görsel inceleme veri kümeleri (örneğin, MVTec AD, PCB) üzerinde silme/ekleme AUC'si, işaretleme oyunu doğruluğu, kararlılığı ve gecikme gibi standartlaştırılmış ölçümlerle karşılaştırılması.

Değerlendirme metrikleri çerçevesi: XAI yöntemlerinin değerlendirilmesinde kullanılan aslına uygunluk, sağlamlık, yorumlanabilirlik ve göreve özgü ölçümler için resmi tanımlar ve denklemler.

Pratik rehberlik: Vaka çalışmaları ve görev türünü, gecikmeyi ve açıklama ihtiyaçlarını belirli yöntemlere bağlayan uygulayıcı odaklı bir seçim iş akışı.

Bu katkılar birlikte, hem araştırmacıları hem de güvenilir rehberlik arayan uygulayıcıları hedefleyen, görsel inceleme için XAI'nin en alana özgü, kıyaslama temelli sentezini oluşturur.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

İnceleme ve perspektif

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

2. XAI çerçevesi

En son teknolojiye sahip yapay zeka modellerinin çoğu, özellikle de derin sinir ağları, genellikle kara kutu olarak kabul edilir; nasıl karar verdiklerine dair çok az görünürlük var12. Bu şeffaflık eksikliği, çeşitli uygulamalarda güven ve açıklanabilirliğin önünde bir engeldir. Sonuç olarak XAI, güvenilir yapay zekanın vazgeçilmez bir parçası haline geldi. Tek bir yaklaşım tüm senaryolara uymaz: bazı yöntemler modelin iç bileşenlerine tam erişim olduğunu varsayarken, diğerleri modeli değişmez bir kara kutu olarak ele alır; Bazıları bireysel tahminler için yerel açıklamalara öncelik verirken, diğerleri bir modelin davranışına ilişkin küresel içgörü sağlar. Şekil 1'de gösterildiği gibi, bu düşünceler, açıklanabilirliğin ne zaman tanıtıldığına bağlı olarak iki geniş XAI tekniği kategorisine yol açmıştır: post-hoc açıklama yöntemleri ve içsel yorumlanabilirlik yöntemleri13. Post hoc yöntemler ayrıca modelden bağımsız ve modele özgü14 olarak kategorize edilir.

figure-protocol-1
Şekil 1: Görsel inceleme için XAI çerçevesi. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

  1. Post-hoc explanation methods
    Post-hoc yöntemler, bir model eğitildikten sonra, mimarisini veya parametrelerini değiştirmeden açıklamalar üretir15. Bu yaklaşımlar popülerdir çünkü uygulayıcıların yüksek performanslı modellerden yararlanmasına ve ardından çıktılarını geriye dönük olarak açıklamasına olanak tanır16. Bununla birlikte, temel model değişmeden kaldığından, post-hoc açıklamalar modelin mantığına yaklaşmalı veya çıkarımda bulunmalıdır, bu da yaklaşım hatası ve kararsızlığa neden olabilir17. Aşağıdaki bölümlerde hem modele özgü hem de agnostik yöntemler açıklanmaktadır.
    1. Modele özel
      Bu yöntemler, bir modelin yapısı veya eğitim mekanizması hakkındaki bilgilerden yararlanarak o modele özel açıklamalar sağlar. Bunun başlıca örneği, derin sinir ağları için gradyan tabanlı ilişkilendirmedir. GradCAM (Gradyan Ağırlıklı Sınıf Aktivasyon Haritalaması) gibi yöntemler, belirli bir tahmin için en önemli olan bir girdi görüntüsünün bölgelerini vurgulayan görsel "ısı haritaları" üretmek için eğitilmiş CNN'lerin dahili gradyanlarını kullanır17. GradCAM, son evrişimli katmandaki özellik haritalarına göre hedef sınıf puanının gradyanını hesaplar ve bu gradyanları görüntüye yansıtarak sınıf ayrımcı bir yerelleştirme haritası verir. Diğer gradyan yayılım yöntemleri, farklı ağ mimarilerine genelleştirilir. Entegre Degradeler (IG)18 , temel bir girdiden (örneğin, boş bir görüntü) gerçek girdiye giden yol boyunca degradeleri biriktirir ve özellik ilişkilendirmesi için istenen aksiyomları karşılar. DeepLIFT19 , her bir giriş özelliğinin katkısını tahmin etmek için benzer şekilde bir referans aktivasyonundan elde edilen farklılıkları her katmana yayar. Katman Bazında Alaka Yayılımı (LRP), bir tahmin puanını katman katman geri yayar ve her giriş pikseline veya özelliğe20 "alaka düzeyi" dağıtır. Özetle, modele özgü yöntemler, modelin yapısına sıkı sıkıya bağlı açıklamalar üretmek için dahili gradyanlardan, aktivasyonlardan veya dikkatten yararlanır.
    2. Modelden bağımsız
      Buna karşılık, modelden bağımsız yöntemler, modeli çıktılar için sorgulanabilen bir kara kutu olarak ele alır. Bu teknikler minimum varsayımlarda bulunur ve tipik olarak yalnızca modelin bozulmuş girdiler için tahmininin elde edilmesini gerektirir. Örnekler arasında, belirli bir girdi21 civarında karmaşık modelin davranışını taklit etmek için basit, yorumlanabilir bir model (seyrek bir doğrusal model veya karar ağacı gibi) kullanan LIME (Yerel Yorumlanabilir Model-Agnostik Açıklamalar) yer alır. Belirli bir öngörü için, LIME girdinin birçok bozulmuş versiyonunu oluşturur, her biri için kara kutu modelinin tahminlerini alır ve daha sonra bu yerel girdi-çıktı ilişkilerine22 yaklaşan ağırlıklı bir doğrusal regresyon öğrenir. Bu vekil doğrusal modelin katsayıları, hangi özelliklerin tahmini en güçlü şekilde yönlendirdiğini gösteren bir açıklama görevi görür23. LIME'ın çekiciliği esnekliğinde (herhangi bir sınıflandırıcıyla kullanılabilir) ve sezgisel çıktısında (örneğin, küçük bir dizi ağırlıklı özellik) yatmaktadır. SHapley Additive ExPlanations (SHAP), oyun teorisine dayanan bir başka popüler modelden bağımsız yöntemdir24. SHAP, işbirlikçi oyun teorisinden Shapley değerlerine yaklaşan özellik atıflarını hesaplayarak, toplamlılık ve tutarlılık gibi özellikleri sağlayarak bireysel bir tahmini açıklar25. Özellik ilişkilendirmenin ötesinde, modelden bağımsız yaklaşımlar aynı zamanda görüntü modelleri için görsel bozulma yöntemlerini de içerir. RISE (Açıklama için Rastgele Giriş Örneklemesi), girdi görüntüsünün bölümlerini rastgele maskeleyerek ve modelin çıktısının nasıl değiştiğini gözlemleyerek önem haritaları oluşturur26. RISE, bu tür birçok maskeyi örnekleyerek, hangi piksellerin veya bölgelerin tahmin26 için en etkili olduğunu gösteren olasılıksal bir belirginlik haritası oluşturur. Özellikle, RISE, modelin iç kısımlarına erişim gerektirmez ve yalnızca modeli değiştirilmiş girdiler üzerinde değerlendirme yeteneği gerektirir, bu da onu gerçekten kara kutu haline getirir. Son olarak, modelden bağımsız XAI'nin büyüyen bir alanı, karşı olgusal açıklamalara odaklanmaktadır. Karşı olgusal bir açıklama, özelliklerin önemlerini sıralamaz, bunun yerine şu soruyu yanıtlar: "Girdideki hangi minimum değişiklik, modelin tahminini değiştirirdi?" 27. Karşı olgusal değerler üreten algoritmalar, değişikliklerde gerçekçiliği ve seyrekliği zorlarken, istenen çıktıyı veren en yakın örnek için tipik olarak girdi alanında (veya öğrenilmiş bir gizli uzayda) bir arama gerçekleştirir. Özetle, post-hoc XAI yöntemleri, eğitimden sonra yüksek performanslı modellere uygulanabildikleri ve tahmin gücünü bir dereceye kadar şeffaflıkla birleştirebildikleri için yaygın olarak benimsenmektedir.
  2. İçsel yorumlanabilirlik yöntemleri
    İçsel yöntemler temelde farklı bir yaklaşım benimser: Bir kara kutuyu sonradan açıklamak yerine, bu yöntemler modeli tasarım yoluyla yorumlanabilir hale getirir. Kendini Açıklayan Sinir Ağları (SENN) dikkate değer bir örnektir. Alvarez-Melis ve Jaakola28 tarafından önerilen SENN çerçevesinde, sinir ağı önce bir dizi ara kavram aktivasyonunu hesaplayacak ve ardından bu kavramların basit, açıklanabilir bir işlevi olarak bir tahmin oluşturacak şekilde yapılandırılmıştır. ProtoPNet (Prototip Parça Ağı), girdileri her sınıfın bir dizi öğrenilmiş prototip temsiliyle karşılaştırarak sınıflandıran derin bir ağdır. Örneğin, bir görüntü sınıflandırma görevinde, bir ProtoPNet prototip yamalarını öğrenebilir ve hangi prototiplerin girdi29 tarafından en çok etkinleştirildiğini bularak kararlar verebilir. Dizi modelleri ve transformatörler alanında, içsel yorumlanabilirlik için de dikkat mekanizmalarından yararlanılmıştır. Bazı modeller, modelin dikkat ağırlıklarını bilinen önemli özelliklere veya insan etiketli ilgili bölgelere karşılık gelmeye teşvik eden bir dikkat hizalama hedefiyle eğitilir. Dikkati "doğru nedenlerle doğru" olmaya yönlendirerek30, bu yaklaşımlar sadece iyi performans gösteren değil, aynı zamanda doğrudan açıklama olarak yorumlanabilecek dikkat dağılımlarına sahip modeller üretir. Ayrıca, bu tür modeller, açıklama harici bir post-hoc yaklaşımdan değil, modelin kendi yorumlanabilir yapısından üretildiğinden, yapı gereği tipik olarak sadık açıklamalar sağlar31.

3. XAI taksonomisi

Araştırma durumunun yapılandırılmış bir sentezini sağlamak için, PRISMA kılavuzları kullanılarak sistematik bir literatür taraması yapılmıştır (Şekil 2). Süreç birden fazla akademik veri tabanını (Scopus, Web of Science, IEEE Xplore, SpringerLink, PubMed, arXiv ve MDPI) içeriyordu ve "açıklanabilir yapay zeka", "yorumlanabilirlik", "görsel inceleme", "kusur tespiti", "anormallik tespiti", "üretim" ve "tıbbi görüntüleme"yi birleştiren bir dizi arama terimi tarafından yönlendirildi. Dahil etme kriterleri, makalelerin görsel inceleme bağlamlarında (endüstriyel veya tıbbi) XAI yöntemlerini açıkça uygulamasını veya değerlendirmesini ve yeterli metodolojik ayrıntıyı bildirmesini gerektiriyordu. Hariç tutma kriterleri, uygulama yapılmadan tamamen teorik önerileri ve görsel inceleme dışındaki çalışmaları kaldırdı. Arama başlangıçta 483 kayıt aldı. Kopyalar kaldırıldıktan ve başlıklar ve özetler tarandıktan sonra, 147 tanesi tam metin incelemesi için kaldı. Dahil etme/dışlama kriterleri uygulandığında, bu incelemenin temelini oluşturan 75 birincil çalışma ortaya çıktı.

figure-protocol-2
Şekil 2: PRISMA yönergelerini izleyen sistematik inceleme sürecinin PRISMA akış şeması. Şekil, her aşamada tanımlanan, taranan ve hariç tutulan kayıtları göstermekte ve son incelemeye dahil edilen 75 birincil çalışmayı ortaya koymaktadır. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

  1. İncelenen çalışmaların uygulamalı taksonomisi
    Bölüm 2'de tanıtılan kavramsal çerçeveye (post-hoc ve içsel yaklaşımlar) dayanarak, bu 75 çalışmadan türetilen alana özgü bir taksonomiyi geliştirdik. Bu uygulamalı taksonomi, Şekil 3'te gösterildiği gibi yöntemleri görsel inceleme görevlerindeki uygulamalarına göre ayırt eder.
  2. Çalışmaların taksonomiye göre dağılımı
    75 çalışmanın tam dağılımı Tablo 1'de özetlenmiştir. Her çalışma kendi metodolojik kategorisi ve uygulama alanıyla eşleştirilmiştir. Bu, Bölüm 4'te sunulan karşılaştırmalı analiz için ampirik bir temel sağlar.
  3. Sentez
    Bu sistematik incelemeden birkaç net eğilim ortaya çıkıyor. İlk olarak, gradyan tabanlı post-hoc yöntemler , verimlilikleri ve entegrasyon kolaylıkları nedeniyle endüstriyel ve tıbbi denetim görevlerinde en yaygın olarak benimsenen yöntemler olmaya devam etmektedir. İkincisi, pertürbasyona dayalı yöntemler daha zengin özellik atıfları sağlar, ancak hesaplama talepleri nedeniyle yüksek verimli endüstriyel ortamlarda daha az yaygındır. Üçüncüsü, içsel yöntemler ilgi görüyor ancak yeterince temsil edilmiyor ve çalışmaların 'inden azı bunları uyguluyor.
    Bu taksonomiyi tekrarlanabilir PRISMA kılavuzluğunda bir incelemeye bağlayarak ve 75 çalışmadan oluşan yapılandırılmış bir veri tabanına bağlayarak, bu bölüm doğrulanmış bir kanıt temeli oluşturur. Bu bulgular, temsili yöntemlerin standartlaştırılmış ölçümler (aslına uygunluk, sağlamlık, gecikme ve yerelleştirme doğruluğu) arasında kıyaslandığı Bölüm 4'teki karşılaştırmalı analize zemin hazırlamaktadır.

figure-protocol-3
Şekil 3: Görsel inceleme görevlerinde XAI yöntemlerinin önerilen taksonomisi. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

XAI YöntemiXAI YaklaşımıOkumakEndüstriYıl
IçselKural Tabanlı & Doğrusal Modeller32,33Genel tıp2015–2019
Prototip tabanlı (ProtoPNet, Case tabanlı, Deformable ProtoPNet) 29,34,35,36 Medikal, Endüstriyel, Genel2018–2024
Konsept odaklı (Konsept Darboğazı, Doğru Nedenlerle) 30,31,37 Genel, Bilimsel Uygulamalar2020–2021
Kendi Kendini Açıklayan Sinir Ağları (SENN)28Genel2018–2020
Çözülmüş Temsil (β-VAE),SOXAI38,39Genel2018
Vision Transformers (Dikkat yoluyla içsel yorumlanabilirlik) 40,41,42,43,44,45 Bilgisayarla Görme, Üretim2020–2024
Post-hoc, Modele özelCAM Ailesi 46,47,48,49,50,51,52, 53,54,55,56,57,58 Tıbbi Görüntüleme, İmalat, Otomotiv, Tarım, Elektronik2018–2025
LRP (Katman Bazında Alaka Yayılımı) 20,59,60,61,62 Genel, Tıbbi Görüntüleme2015–2024
Gradient & Saliency Yöntemleri (Entegre Gradients, Smooth IG DeepLIFT, DeconvNet, T-Explainer, Saliency Benchmarks) 18,19,63,64,65,
66,67,68,69,70
Genel, Tıbbi Görüntüleme2013–2025
Özelleşmiş Modellerde İlişkilendirme (SNN'ler, Transformers dikkat ilişkilendirme) 71,72,73 Sinirbilim, Görme Transformatörleri2023–2025
Post-hoc, Model-agnostikKİREÇ & Varyantlar (LIME, ELIME, MASALA), SHAP & Varyantlar (Ağaç SHAP),Finans, Prognostik ve Sağlık Yönetimi, Siber Güvenlik, Otonom Araçlar, Endüstriyel Denetim.2016–2025
Counterfactual 21,22,23,24,25,27,74,
75,76,77,78,79,80,81,
82,83,84,85,86
Açıklama
Hibrit yöntemler(GradCAM,SHAP, LRP,LIME) dahil olmak üzere birden fazla XAI yönteminin entegrasyonu 58,87,88,89,90,91,92 Endüstriyel Denetim, Sağlık, İmalat.2021–2025

Tablo 1: İncelenen 75 çalışmanın XAI yöntemine, yılına, sektörüne ve yaklaşımına göre sınıflandırılması.

4. XAI için değerlendirme metrikleri

Bir bilgisayarla görme modelinin performansı doğruluk, kesinlik ve hatırlama gibi köklü ölçütlerle değerlendirilir. Ancak, bir modelin kararlarının açıklanabilirliğini değerlendirmek çok daha az basittir. Standart tahmin performansından farklı olarak, yapay zeka açıklamalarının kalitesi için evrensel olarak kabul edilmiş bir ölçüt yoktur66. Başka bir deyişle, bir sınıflandırıcının doğruluğu kesin olarak ölçülebilirken, belirli bir görüntü sınıflandırması93 için bir açıklamanın ne kadar "iyi" olduğunu ölçmek için üzerinde anlaşmaya varılmış bir ölçek yoktur. Bu eşitsizlik, XAI alanındaki temel bir boşluğu vurgulamaktadır: bir açıklamanın nasıl değerlendirileceği.

Standartlaştırılmış XAI değerlendirme kriterleri geliştirmenin son derece zor olduğu kanıtlanmıştır. Bunun bir nedeni, yorumlanabilirlik ve açıklama kalitesinin çok yönlü ve bağlama bağlı olması ve bu nedenle tek bir evrensel ölçüte10 direnmesidir. Bir açıklamanın etkili bir şekilde değerlendirilmesi, uygulama alanı, üretilen açıklamanın niteliği ve son kullanıcının geçmişi dahil olmak üzere çeşitli faktörlere dayanır. Örneğin, tıbbi görüntü teşhisi için uygun bir açıklama tekniği, endüstriyel bir görsel inceleme görevinde10 kullanılandan farklı şekilde değerlendirilebilir.

Uygulamada, standart ölçütlerin olmaması, araştırmacıları çeşitli değerlendirme yaklaşımlarına güvenmeye yöneltmiştir. Birçok çalışma hala XAI yöntemlerinin nitel, anekdotsal değerlendirmesine başvurmaktadır94,95. Yazarların birkaç belirginlik haritası veya ısı haritası sunduğunu ve bunların makul göründüğünü iddia ettiğini görmek yaygındır ("yüz geçerliliği" testi96 olarak adlandırılır). Bu tür bir görsel inceleme, anlatı anlamında ikna edici olabilir, ancak öznel kalır ve titiz bir karşılaştırma için yetersiz kalır97. Bu, XAI metriklerini standartlaştırmanın zorluğunu göstermektedir; Üzerinde anlaşmaya varılan kriterlerin yokluğunda araştırmacılar, her veri kümesine veya kullanım durumuna göre uyarlanmış ölçümler önermektedir.

Sonuç olarak, literatür artık bu boşluğu doldurmayı amaçlayan çeşitli XAI değerlendirme ölçütleriyle doludur98. Her biri bir açıklamayı yararlı kılan şeyin belirli bir yönünü hedefleyen çok sayıda çerçeve ve önlem öne sürülmüştür99. Genel olarak, metrikler birincil odaklarına göre sınıflandırılabilir. Aslına uygun metrikler, bir açıklamayı model100'ün karar sürecini ne kadar iyi yansıttığına göre değerlendirir. Buna karşılık, yorumlanabilirlik merkezli metrikler, açıklamanın bir insan gözlemci için ne kadar anlaşılır ve ikna edici olduğunu değerlendirir101. Üçüncü bir kategori, açıklamanın değerlendirilmesinin son kullanıcı performansı üzerindeki etkisine bağlı olduğu göreve dayalı ölçümlerdir102. Dördüncü bir kategori, sonuçlarıntutarlılığını değerlendiren sağlamlık odaklı metriklerdir 103. Son olarak, hibrit metrikler birden çok boyutu birleştirir104.

Bu metrik çeşitliliği, araştırmacıların önemli olduğunu düşündüğü açıklanabilirlik yönlerini gösterir, ancak aynı zamanda tek bir standardın eksikliğini de vurgular: her metrik, açıklama kalitesinin yalnızca bir açısını yakalar105. Aşağıda, XAI için bir dizi değerlendirme metriği dört ana kategoride gruplandırılmış ve Tablo 2'de özetlenmiştir.

Metrik TürüMetrikFormül / Tanım
SadakatEğrinin altındaki Silme Alanı (AUC)26figure-protocol-4
en önemli özelliklerdir; daha düşük = daha sadık
Eğrinin Altındaki Ekleme Alanı (AUC)26figure-protocol-5
daha yüksek = daha sadık
Sadakatsizlik puanı103figure-protocol-6
daha düşük = daha iyi
KÜKREME106'Önemli' özellikler olmadan yeniden eğitimden sonra doğruluk düşüyor
SağlamlıkKararlılık indeksi107figure-protocol-7
daha yüksek = daha tutarlı
Lipschitz puanı: 103figure-protocol-8
daha düşük = daha sağlam
YorumlanabilirlikSeyreklik79figure-protocol-9
daha düşük = daha basit
Vekil derinlik79Yorumlanabilir vekilin derinliği (örneğin, karar ağacı);
daha sığ = daha basit
Göreve özelbirleşme üzerinden kesişme (IoU)108figure-protocol-10
M maskesi ile temel gerçek G'nin örtüşmesi
İşaret Oyunu108Doğruluk = #hits / #samples
daha yüksek = daha iyi
MelezBileşik puan104Aslına uygunluk, seyreklik ve sağlamlığın ağırlıklı kombinasyonu

Tablo 2: Görsel incelemede XAI için değerlendirme metrikleri dört ana kategoride gruplandırılmıştır.

5. Karşılaştırmalı analiz

Bu bölümde yöntemler, MVTec AD109 (piksel düzeyinde maskelere sahip >5.000 kusurlu görüntü) ve DeepPCB110 (altı kusur sınıfına sahip 1.500 PCB görüntüsü), CheXpert111 ve ImageNet112 gibi genel veri kümeleri arasında karşılaştırılır ve aşağıdaki metriklere göre değerlendirilir: Silme/Ekleme AUC (aslına uygunluk), İşaret Etme Oyunu doğruluğu (yerelleştirme), kararlılık puanları (bozulmalar altında sağlamlık) ve gecikme (çalışma zamanı maliyeti).

CAM tabanlı yöntemler için (GradCAM, GradCAM++) MVTec AD ve DeepPCB'deki sonuçlar, GradCAM'in 0,83-0,87 aslına uygunluk (ekleme AUC ~0,68;

figure-protocol-11













Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu derleme, görsel incelemede XAI'nin 75 çalışmasını inceledi ve post-hoc ve içsel yöntemlerin bir taksonomisi ve kıyaslama odaklı bir karşılaştırmalı analiz ile sonuçlandı. Bulgular, hiçbir yöntemin evrensel olarak diğerlerinden daha iyi performans göstermediğini doğrulamaktadır: GradCAM ve LRP gibi gradyan tabanlı yaklaşımlar, gerçek zamanlı kusur lokalizasyonu için etkilidir, ancak açıklamaları karmaşık bölgelerde kaba olabilir. SHAP, LIME ve RISE gibi pertürbasyona dayalı yöntemler d...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, bu çalışmanın yayınlanması ile ilgili herhangi bir çıkar çatışması olmadığını beyan eder.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazar(lar), bu çalışmanın kamu, ticari veya kar amacı gütmeyen sektörlerdeki herhangi bir finansman kuruluşundan özel bir hibe almadığını beyan eder.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Alzarooni, A., et al. Anomaly detection for industrial applications, its challenges, solutions, and future directions: a review. IEEE Sens J. XX. (1), 1(2025).
  2. Hardan, F., Almusawi, A. R. J. Developing an automated vision system for maintaing social distancing to cure the pandemic. Al-Khwarizmi Eng J. 18 (1), 38-50 (2022).
  3. Terasaki, N., Fujio, Y. Mechanoluminescent visualization of crack propagation for joint evaluation. J Vis Exp. (191), e64118(2023).
  4. Al-Hamadani, S., Al-Darraji, I. Warehouse in Industry 4.0 based drone, computer vision, and artificial intelligence technologies: a literature review. Proc Eng Sci. 7 (1), 517-526 (2025).
  5. Al-Jubori, H. N., Izzat, A. D., Jerbi, H. Defect detection using thermography camera techniques: a review. Al-Khwarizmi Eng J. 20 (4), 70-88 (2024).
  6. Al-Hamadani, S., Al-Darraji, I., Jerbi, H. Improving barcode vision scanning process using a drone-based tracking PID controller for warehouse in Industry 4.0. Al-Khwarizmi Eng J. 21 (2), 72-92 (2025).
  7. Al-Jubori, H. N., Al-Darraji, I. Tools and process of defect detection in automated manufacturing systems. EAI Endorsed Trans Scalable Inf Syst. 10 (6), e4000(2023).
  8. Alaa, T., et al. Automated detection of defects on metal surfaces using vision transformers. , Published online October 6, 2024. Accessed August 1 (2025).
  9. Moosavi, S., et al. Explainable AI in manufacturing and industrial cyber-physical systems: a survey. Electronics. 13 (17), 3497(2024).
  10. Nauta, M., et al. From anecdotal evidence to quantitative evaluation methods: a systematic review on evaluating explainable AI. ACM Comput Surv. 55 (13), 1-42 (2023).
  11. Cheng, Z., et al. A comprehensive review of explainable artificial intelligence (XAI) in computer vision. Sensors. 25 (13), 4166(2025).
  12. Barredo Arrieta, A., et al. Explainable artificial intelligence (XAI): concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 58, 82-115 (2020).
  13. Kouchaki, S., et al. Survey of explainable AI techniques in healthcare. Sensors. 23 (2), 634(2023).
  14. Laugel, T., et al. The dangers of post-hoc interpretability: unjustified counterfactual explanations. Proc Int Joint Conf Artif Intell. , 2801-2807 (2019).
  15. Slack, D., et al. Reliable post hoc explanations: modeling uncertainty in explainability. Adv Neural Inf Process Syst. 33, 9391-9404 (2020).
  16. Cesarini, M., et al. Explainable AI for text classification: lessons from a comprehensive evaluation of post hoc methods. Cognit Comput. 16 (6), 3077-3095 (2024).
  17. Mohamed Musthafa, M., et al. Enhancing brain tumor detection in MRI images through explainable AI using Grad-CAM with ResNet-50. BMC Med Imaging. 24 (1), 1-19 (2024).
  18. Sundararajan, M., Taly, A., Yan, Q. Axiomatic attribution for deep networks. Proc Int Conf Mach Learn. 70, 5109-5118 (2017).
  19. Shrikumar, A., Greenside, P., Kundaje, A. Learning important features through propagating activation differences. Proc Int Conf Mach Learn. 70, 4844-4866 (2017).
  20. Bassi, P. R. A. S., et al. Improving deep neural network generalization and robustness to background bias via layer-wise relevance propagation optimization. Nat Commun. 15, 44371(2024).
  21. Knab, P., et al. Which LIME should I trust? Concepts, challenges, and solutions. arXiv preprint. , (2025).
  22. Garreau, D., von Luxburg, U. Explaining the explainer: a first theoretical analysis of LIME. Proc Mach Learn Res. 108, 1287-1296 (2020).
  23. Qian, J., et al. ELIME: exact local interpretable model-agnostic explanation. Eur J Artif Intell. , (2024).
  24. Salih, A. M., et al. A perspective on explainable artificial intelligence methods:SHAP and LIME . Adv Intell Syst. , (2024).
  25. Hermosilla, P., et al. Explainable AI for forensic analysis: a comparative study of SHAP and LIME in intrusion detection models. Appl Sci. 15 (13), 7329(2025).
  26. Petsiuk, V., Das, A., Saenko, K. RISE: randomized input sampling for explanation of black-box models. arXiv preprint. , (2018).
  27. Dandl, S., et al. Multi-objective counterfactual explanations. Lect Notes Comput Sci. 12269, 448-469 (2020).
  28. Alvarez-Melis, D., Jaakkola, T. S. Towards robust interpretability with self-explaining neural networks. Adv Neural Inf Process Syst. 31, 7775-7784 (2018).
  29. Donnelly, J., Barnett, A. J., Chen, C. Deformable ProtoPNet: an interpretable image classifier using deformable prototypes. Proc IEEE Conf Comput Vis Pattern Recognit. , 10255-10265 (2022).
  30. Ross, A. S., Hughes, M. C., Doshi-Velez, F. Right for the right reasons: training differentiable models by constraining their explanations. Proc Int Joint Conf Artif Intell. , 2662-2670 (2017).
  31. Schramowski, P., et al. Making deep neural networks right for the right scientific reasons by interacting with their explanations. Nat Mach Intell. 2 (8), 476-486 (2020).
  32. Rudin, C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nat Mach Intell. 1 (5), 206-215 (2019).
  33. Letham, B., et al. Interpretable classifiers using rules and Bayesian analysis: building a better stroke prediction model. Ann Appl Stat. 9 (3), 1350-1371 (2015).
  34. Barnett, A. J., et al. Interpretable mammographic image classification using case-based reasoning and deep learning. arXiv preprint. , (2021).
  35. Narayanan, A., Bergen, K. J. Prototype-based methods in explainable AI and emerging opportunities in the geosciences. arXiv preprint. , (2024).
  36. Chen, C., et al. This looks like that: deep learning for interpretable image recognition. Adv Neural Inf Process Syst. 32, 8928-8939 (2019).
  37. Koh, P. W., et al. Concept bottleneck models. Proc Int Conf Mach Learn. 119, 5294-5304 (2020).
  38. Burgess, C. P., et al. Understanding disentangling in β-VAE. arXiv preprint. , (2018).
  39. Gunraj, H., et al. SolderNet: towards trustworthy visual inspection of solder joints in electronics manufacturing using explainable artificial intelligence. Proc AAAI Conf Artif Intell. 37, 15668-15674 (2023).
  40. Dosovitskiy, A., et al. An image is worth 16×16 words: transformers for image recognition at scale. arXiv preprint. , (2020).
  41. Khan, S., et al. Transformers in vision: a survey. ACM Comput Surv. 54 (10), 1-41 (2021).
  42. Yu, L., et al. eX-ViT: a novel explainable vision transformer for weakly supervised semantic segmentation. Pattern Recognit. 142, 109666(2023).
  43. Alber, M., et al. Evaluating vision transformer models for visual quality control in industrial manufacturing. Lect Notes Comput Sci. Bifet, A., et al. 14950, 1-15 (2024).
  44. Stassin, S., et al. Explainability and evaluation of vision transformers: an in-depth experimental study. Electronics. 13 (1), 175(2024).
  45. Zhai, Y., et al. A lightweight transformer with linear self-attention for defect recognition. Electron Lett. 60 (17), e13292(2024).
  46. Dhore, V., et al. Enhancing explainable AI: a hybrid approach combining Grad-CAM and LRP for CNN interpretability. arXiv preprint. , (2024).
  47. Chattopadhay, A., et al. Grad-CAM++: generalized gradient-based visual explanations for deep convolutional networks. Proc IEEE Winter Conf Appl Comput Vis. , 839-847 (2018).
  48. Saleh, R. A. A., et al. Advancing tire safety: explainable artificial intelligence-powered foreign object defect detection with Xception networks and Grad-CAM interpretation. Appl Sci. 14 (10), 4267(2024).
  49. Meister, S., et al. Investigations on explainable artificial intelligence methods for the deep learning classification of fibre layup defect in the automated composite manufacturing. Compos Part B Eng. 224, 109160(2021).
  50. Luo, X., Alzahrani, M. Automated tomato defect detection using CNN feature fusion for enhanced classification. Processes. 13 (1), 115(2025).
  51. Rahimunnisa, K. Textile fabric defect detection. J Innov Image Process. 4 (3), 165-172 (2022).
  52. Shin, H., et al. Visualization for explanation of deep learning-based defect detection model using class activation map. Comput Mater Contin. 75 (3), 4753-4766 (2023).
  53. Yue, H., et al. ASOD: attention-based salient object detector for strip steel surface defects. Electronics. 14 (5), 831(2025).
  54. Saleh, R. A. A., Ertunç, H. M. Explainable attention-based fused convolutional neural network (XAFCNN) for tire defect detection: an industrial case study. Eng Res Express. 6 (1), 015027(2024).
  55. Leem, S., Seo, H. Attention guided CAM: visual explanations of vision transformer guided by self-attention. Proc AAAI Conf Artif Intell. 38 (4), 2956-2964 (2024).
  56. Ibrahim, R., Shafiq, M. O. Augmented Score-CAM: high-resolution visual interpretations for deep neural networks. Knowl Based Syst. 252, 109287(2022).
  57. Clement, T., et al. XAI-enhanced semantic segmentation models for visual quality inspection. Proc IEEE Int Conf Consumer Electron. , 1-4 (2024).
  58. Riedel, H., et al. Automated quality control of vacuum insulated glazing by convolutional neural network image classification. Autom Constr. 135, 104144(2022).
  59. Böhle, M., et al. Layer-wise relevance propagation for explaining deep neural network decisions in MRI-based Alzheimer's disease classification. Front Aging Neurosci. 10, 194(2019).
  60. Bach, S., et al. On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation. PLoS One. 10 (7), e0130140(2015).
  61. Dieter, T. R., Zisgen, H. Evaluation of the explanatory power of layer-wise relevance propagation using adversarial examples. Neural Process Lett. 55 (7), 8531-8550 (2023).
  62. Hoefler, M. A., et al. XAI-guided insulator anomaly detection for imbalanced datasets. arXiv. , (2024).
  63. Kares, F., et al. What makes for a good saliency map? Comparing strategies for evaluating saliency maps in explainable AI (XAI). arXiv preprint. , (2025).
  64. Yona, G., Greenfeld, D. Revisiting sanity checks for saliency maps. arXiv preprint. , (2021).
  65. Zeiler, M. D., Fergus, R. Visualizing and understanding convolutional networks. Eur Conf Comput Vis. 8689, 818-833 (2014).
  66. Xu-Darme, R., et al. On the stability, correctness and plausibility of visual explanation methods based on feature importance. ACM Int Conf Proc Ser. , 119-125 (2023).
  67. Ortigossa, E. S., et al. T-Explainer: a model-agnostic explainability framework based on gradients. arXiv preprint. , (2024).
  68. Singh, M., et al. Attributional robustness training using input-gradient spatial alignment. Lect Notes Comput Sci. 12372, 515-533 (2019).
  69. Cerekci, E., et al. Quantitative evaluation of saliency-based explainable artificial intelligence methods in deep learning-based mammogram analysis. Eur J Radiol. 173, 111356(2024).
  70. Meister, S., et al. Cross-evaluation of a parallel operating SVM-CNN classifier for reliable internal decision-making processes in composite inspection. J Manuf Syst. 60, 620-639 (2021).
  71. Bitar, A., et al. Gradient-based feature-attribution explainability methods for spiking neural networks. Front Neurosci. 17, 1153999(2023).
  72. Qiang, Y., et al. Interpretability-aware vision transformer. arXiv preprint. , (2023).
  73. Bousselham, W., et al. LeGrad: an explainability method for vision transformers via feature formation sensitivity. arXiv preprint. , (2025).
  74. Lundberg, S. M., Lee, S. I. A unified approach to interpreting model predictions. Adv Neural Inf Process Syst. 30, (2017).
  75. Khan, F. S., et al. Model-agnostic explainable artificial intelligence methods in finance: a systematic review, recent developments, limitations, challenges and future directions. Artif Intell Rev. 58, 1-65 (2025).
  76. Nazim, S., et al. Advancing malware imagery classification with explainable deep learning: a state-of-the-art approach using SHAP LIME and Grad-CAM. PLoS One. 20 (5), e0318542(2025).
  77. Solís-Martín, D., et al. On the soundness of XAI in prognostics and health management (PHM). Information. 14 (5), 256(2023).
  78. Biecek, P., Burzykowski, T. Local interpretable model-agnostic explanations (LIME). In:Explanatory Model Analysis. , 107-123 (2021).
  79. Ribeiro, M. T., Singh, S., Guestrin, C. 34;Why should I trust you?" Explaining the predictions of any classifier. Proc ACM SIGKDD Int Conf Knowl Discov Data Min. , 1135-1144 (2016).
  80. Tahir, H. A., et al. A novel hybrid XAI solution for autonomous vehicles: real-time interpretability through LIME-SHAP integration. Sensors. 24 (21), 6776(2024).
  81. Goldman, C. V., et al. Explaining learning models in manufacturing processes. Procedia Comput Sci. 180, 259-268 (2021).
  82. Emmanouilidis, C., Rica, E. Visual quality control via explainable AI and the case of human in the AI loop. In: Lect Notes Mech Eng. , 252-260 (2023).
  83. Huang, M., et al. An interpretable approach using hybrid graph networks and explainable AI for intelligent diagnosis recommendations in chronic disease care. Biomed Signal Process Control. 91, 105913(2024).
  84. Dardouillet, P., et al. Explainability of image semantic segmentation through SHAP values. Data. 7 (8), 255(2022).
  85. Saifullah, S., et al. The privacy-explainability trade-off: unraveling the impacts of differential privacy and federated learning on attribution methods. Front Artif Intell. 7, 1236947(2024).
  86. Velmurugan, M., et al. Developing guidelines for functionally-grounded evaluation of explainable artificial intelligence using tabular data. Eng Appl Artif Intell. 141, 109772(2025).
  87. Wells, L., Bednarz, T. Explainable AI and reinforcement learning-a systematic review of current approaches and trends. Front Artif Intell. 4, 550030(2021).
  88. Rožanec, J. M., et al. Adaptive explainable artificial intelligence for visual defect inspection. Procedia Comput Sci. 232, 3034-3043 (2024).
  89. Nguyen, H. T. T., et al. XEdgeAI: a human-centered industrial inspection framework with data-centric explainable edge AI approach. Inf Fusion. 116, 102782(2025).
  90. Han, C., et al. Visual coating inspection framework via self-labeling and multi-stage deep learning strategies. J Intell Manuf. 35, 1-18 (2024).
  91. Kotsiopoulos, T., et al. Revolutionizing defect recognition in hard metal industry through AI explainability, human-in-the-loop approaches and cognitive mechanisms. Expert Syst Appl. 255, 124839(2024).
  92. Forcher, B., et al. Evaluation of explainable AI methods for classification tasks in visual inspection. Proc XAI Workshop (Late-Breaking Work, Demos, Doctoral Consortium). , 77-82 (2023).
  93. Miller, T. Explanation in artificial intelligence: insights from the social sciences. Artif Intell. 267, 1-38 (2019).
  94. Jacovi, A., Goldberg, Y. Towards faithfully interpretable NLP systems: how should we define and evaluate faithfulness. Proc Annu Meet Assoc Comput Linguist. 58, 4198-4205 (2020).
  95. Adebayo, J., et al. Sanity checks for saliency maps. Adv Neural Inf Process Syst. 31, 9505-9515 (2018).
  96. Doshi-Velez, F., Kim, B. Considerations for evaluation and generalization in interpretable machine learning. Proc Explainable and Interpretable Models in Computer Vision and Machine Learning. , 3-17 (2018).
  97. Lage, I., et al. An evaluation of the human-interpretability of explanation. arXiv preprint. , (2019).
  98. Theunissen, M., Browning, J. Putting explainable AI in context: institutional explanations for medical AI. Ethics Inf Technol. 24 (2), 1-10 (2022).
  99. Hoffman, R. R., et al. Measures for explainable AI: explanation goodness, user satisfaction, mental models, curiosity, trust, and human-AI performance. Front Comput Sci. 5, 1096257(2023).
  100. Hedström, A., et al. Quantus: an explainable AI toolkit for responsible evaluation of neural network explanations and beyond. J Mach Learn Res. 24, 1-11 (2023).
  101. Mohseni, S., et al. A multidisciplinary survey and framework for design and evaluation of explainable AI systems. ACM Trans Interact Intell Syst. 11 (3-4), 1-45 (2021).
  102. Finzel, B., et al. Domain-specific evaluation of visual explanations for application-grounded facial expression recognition. Lect Notes Comput Sci. 14065, 31-44 (2023).
  103. Yeh, C. K., et al. On the (in)fidelity and sensitivity for explanations. Adv Neural Inf Process Syst. 32, 10967-10978 (2019).
  104. Better metrics for evaluating explainable artificial intelligence. Rosenfeld, A. Proc Int Conf Autonomous Agents Multiagent Syst, , 45-53 (2021).
  105. Evaluation metrics for XAI: a review, taxonomy, and practical applications. Kadir, M. A., et al. Proc IEEE Int Conf Intell Eng Syst, , 111-124 (2023).
  106. Sankaran, K. Data science principles for interpretable and explainable AI. J Data Sci. 22, 1-27 (2024).
  107. Alvarez-Melis, D., Jaakkola, T. S. On the robustness of interpretability methods. arXiv preprint. , (2018).
  108. Zhang, Y., et al. Saliency-Bench: a comprehensive benchmark for evaluating visual explanations. arXiv preprint. , (2025).
  109. Bergmann, P., et al. The MVTec anomaly detection dataset: a comprehensive real-world dataset for unsupervised anomaly detection. Int J Comput Vis. 129 (4), 1038-1059 (2021).
  110. Tang, S., et al. Online PCB defect detector on a new PCB defect dataset. arXiv preprint. , (2019).
  111. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. Irvin, J., et al. Proc AAAI Conf Artif Intell, 33, 590-597 (2019).
  112. ImageNet: a large-scale hierarchical image database. Deng, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 248-255 (2009).
  113. Selvaraju, R. R., et al. Grad-CAM: visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128 (2), 336-359 (2020).
  114. Black-box explanation of object detectors via saliency maps. Petsiuk, V., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 11438-11447 (2020).
  115. Attention is not explanation. Jain, S., Wallace, B. C. Proc Conf North Am Chapter Assoc Comput Linguist, , 3543-3556 (2019).
  116. Transformer interpretability beyond attention visualization. Chefer, H., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 782-791 (2021).
  117. Wachter, S., et al. Counterfactual explanations without opening the black box: automated decisions and the GDPR. SSRN Electron J. , (2017).
  118. Deep learning for case-based reasoning through prototypes: a neural network that explains its predictions. Li, O., et al. Proc AAAI Conf Artif Intell, 32, 3530-3537 (2018).
  119. Counterfactuals in explainable artificial intelligence (XAI): evidence from human reasoning. Byrne, R. M. J. Proc Int Joint Conf Artif Intell, , 6276-6282 (2019).
  120. Ihongbe, I. E., et al. Evaluating explainable artificial intelligence (XAI) techniques in chest radiology imaging through a human-centered lens. PLoS One. 19 (10), e0308758(2024).
  121. Dörrich, M., et al. Explainable convolutional neural networks for assessing head and neck cancer histopathology. Diagn Pathol. 18 (1), 121(2023).
  122. Nguyen, H. Q., et al. VinDr-CXR: an open dataset of chest X-rays with radiologist's annotations. Sci Data. 9, 429(2022).
  123. Lee, D. J., et al. A systematic literature review on artificial intelligence and explainable artificial intelligence for visual quality assurance in manufacturing. Electronics. 12 (22), 4572(2023).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

XAI TeknikleriEnd striyel DenetimT bbi DenetimGradyan Y ntemleriYay l m Y ntemleriPert rbasyon Y ntemleriVekil Modellerz Dikkat Mimarileri

İlgili makaleler