이 검토는 산업 및 의료 영역의 육안 검사를 위한 설명 가능한 AI(XAI) 방법을 종합합니다. PRISMA 유도 검색을 통해 75개의 연구가 식별되어 표준화된 지표를 사용하여 영역별 분류 및 비교 분석을 알렸습니다. 우리는 도구 선택을 위한 증거 기반 분류법과 실무자 중심의 워크플로를 제공합니다.
리뷰 논문
이 검토는 산업 및 의료 영역의 육안 검사를 위한 설명 가능한 AI(XAI) 방법을 종합합니다. PRISMA 유도 검색을 통해 75개의 연구가 식별되어 표준화된 지표를 사용하여 영역별 분류 및 비교 분석을 알렸습니다. 우리는 도구 선택을 위한 증거 기반 분류법과 실무자 중심의 워크플로를 제공합니다.
XAI(Explainable Artificial Intelligence) 기술은 블랙박스 머신 러닝 모델을 이해하기 쉽게 만들어 자동화된 육안 검사 시스템의 투명성과 신뢰를 가능하게 합니다. XAI는 널리 적용되었지만 이전 검토에서는 산업 및 의료 검사 작업의 특정 요구 사항을 다루지 않았습니다. 이 논문은 산업 및 의료 영역 전반에 걸쳐 육안 검사에 XAI 기술을 적용하는 연구를 검토합니다. IEEE Xplore, Scopus, PubMed, arXiv 및 Web of Science에서 2014년에서 2025년 사이에 발표된 연구에 대해 체계적인 검색이 수행되었으며, 포함 기준은 공개 또는 도메인별 데이터 세트를 사용하는 검사 작업에 XAI를 적용해야 한다는 것입니다. 초기 연구 풀에서 75개가 포함되고 사후 및 내재로 분류된 다음 충실도, 견고성, 복잡성 및 위치 파악 정확도와 관련하여 평가되었습니다. 결과는 그래디언트 및 전파 기반 방법은 대략적인 위치 파악이 있지만 거의 실시간 검사에 적합한 효율적인 시각적 설명을 제공하는 반면, 섭동 기반 및 대리 모델 방법은 더 높은 계산 비용으로 더 자세한 속성을 제공하지만 견고성은 감소한 것으로 나타났습니다. 또한 프로토타입 기반 네트워크와 자기 주의 아키텍처는 해석 가능성과 예측 성능 간의 균형을 보여줍니다. 가장 효과적인 XAI 방법을 선택하는 것은 모든 경우에 적용되는 것이 아닙니다. 데이터 세트, 대기 시간 및 해석 가능성 요구 사항에 따라 다릅니다. 이 검토는 육안 검사를 위한 XAI 방법의 통합 분류를 소개하고, 표준화된 지표를 사용하여 산업 및 의료 영역 모두에서 다양한 접근 방식을 비교하며, 실무자가 최적의 방법을 선택하도록 안내하는 작업 기반 선택 워크플로를 제안합니다. 이전 검토와 비교하여 이 작업은 정량적 벤치마크에 기반한 교차 영역 비교 분석을 제공하고 표준화된 평가 및 사용자 중심 검증을 위한 방향을 설명합니다.
제조, 자동차, 식품 포장, 제약, 의료 등의 산업에서는 제품과 시스템이 적절하고 안전하게 작동하는지 확인하는 것이 필수적입니다. 인간 작업자가 수행하는 전통적인 육안 검사나 초보적인 카메라 기반 시스템을 뛰어넘는 자동화 및 머신 러닝 도구는 정확도, 생산 속도 및 일관성을 향상시킵니다1. AI 검사를 통해 실시간 모니터링2 및 처리량이 많은 환경3에서 결함 감지가 가능하여 인적 오류와 운영 비용이 절감됩니다4. 특히 기계 학습(ML) 및 딥 러닝(DL)의 발전으로 인공 지능의 사용으로결함을 감지하고5, 물체를 분류하고, 복잡한시각적 패턴을 식별하는 자율 시스템이 가능해졌습니다6. 최근 CNN(Convolutional Neural Networks)7, 순환 네트워크 및 ViT(Vision Transformers)는 표면 결함 탐지에서 의료 영상의 이상 위치 파악에 이르는 작업에서 규칙 기반 시스템을 능가했습니다. 검사는 규칙 기반 프로세스에서 대규모 데이터 세트에 대해 훈련된 데이터 기반 모델로 전환되었습니다8.
많은 AI 모델은 "블랙박스"로 기능하므로 이러한 모델이 어떻게 결정을 내리는지에 대한 통찰력이 없습니다. 이러한 투명성 부족은 위험을 초래합니다. 예를 들어, 제조업에서 잘못된 예측은 낭비, 재작업, 제품 리콜 및 고객 불만 증가로 이어질 수 있습니다. 의료 영상에서 오분류는 진단을 지연시키거나 치료 계획을 손상시킬 수 있으므로 더욱 중요합니다. 이러한 모델의 개발자조차도 출력을 완전히 설명하지 못하는 경우가 많아 신뢰와 채택이 제한됩니다.
이것이 바로 설명 가능한 AI(XAI)가 필수적인 곳입니다. XAI는 기계 학습 모델 결정을 인간이 해석할 수 있도록 하는 것을 목표로 하는 방법 및 도구 그룹입니다9. 그 목표는 출력에 대해 사람이 읽을 수 있는 정당성을 제공하여 블랙박스 예측기를 투명한 "유리 상자" 시스템으로 바꾸는 것입니다. 실제로 XAI 지원 검사 시스템은 부품에 결함이 있는 것으로 플래그를 지정하는 것뿐만 아니라 플래그가 지정된 이유를 설명함으로써 결함 감지를 넘어섭니다.
문헌이 늘어나고 있음에도 불구하고 컴퓨터 비전의 XAI에 대한 기존 설문 조사는 여전히 범위가 제한적입니다. 많은 사람들이 의료 영상이나 산업 검사에 좁게 집중하여 유용한 분류법을 제공하지만 표준화된 벤치마크 없이 주로 정성적 비교에 의존합니다. Nauta et al.10과 같은 광범위한 리뷰는 도메인에 구애받지 않는 개요를 제공하지만 실무자 중심의 선택 프레임워크를 제공하지는 않습니다. Cheng et al.11 에 의한 현재까지 가장 포괄적인 컴퓨터 비전 설문조사조차도 분류를 발전시키고 충실도 및 현지화 정확도와 같은 지표를 논의하지만 비전 작업 전반에 걸쳐 일반적이며 육안 검사, 고처리량 배포 또는 휴먼 인 더 루프 검증을 구체적으로 다루지는 않습니다. 마찬가지로 예후 및 자산 관리를 위한 XAI에 대한 산업 검토는 PRISMA 프레임워크를 채택하지만 육안 검사 작업보다는 예후 및 건강 관리(PHM)에 중점을 둡니다.
이러한 격차를 해소하기 위해 이 검토는 다음과 같은 기여를 합니다.
체계적인 분류: 산업 및 의료 육안 검사 전반에 걸친 75개 연구에 대한 PRISMA 안내 검토.
비교 분석: 삭제/삽입 AUC, 포인팅 게임 정확도, 안정성 및 대기 시간을 포함한 표준화된 메트릭을 사용하여 공개 육안 검사 데이터 세트(예: MVTec AD, PCB)에서 여러 XAI 방법(GradCAM, LRP, SHAP, LIME 및 RISE)을 벤치마킹합니다.
평가 메트릭 프레임워크: XAI 방법을 평가하는 데 사용되는 충실도, 견고성, 해석 가능성 및 작업별 측정에 대한 공식적인 정의 및 방정식입니다.
실용적인 지침: 사례 연구 및 작업 유형, 대기 시간 및 설명 요구 사항을 특정 방법에 연결하는 실무자 중심의 선택 워크플로.
이러한 기여는 신뢰할 수 있는 지침을 찾는 연구자와 실무자 모두를 대상으로 육안 검사를 위한 XAI의 가장 도메인별적이고 벤치마크에 기반한 합성을 확립합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
2. XAI 프레임워크
대부분의 최첨단 AI 모델, 특히 심층 신경망은 종종 블랙박스로 취급됩니다. 그들이 어떻게 결정을 내리는지에 대한 가시성이 거의 없습니다12. 이러한 투명성 부족은 다양한 애플리케이션에서 신뢰와 설명 가능성에 대한 장벽입니다. 그 결과 XAI는 신뢰할 수 있는 AI의 필수 요소가 되었습니다. 모든 시나리오에 맞는 단일 접근 방식은 없습니다: 일부 방법은 모델 내부에 대한 전체 액세스를 가정하는 반면 다른 방법은 모델을 변경할 수 없는 블랙박스로 취급합니다. 일부는 개별 예측에 대한 로컬 설명을 우선시하는 반면, 다른 일부는 모델의 동작에 대한 글로벌 통찰력을 제공합니다. 그림 1에 묘사된 바와 같이, 이러한 고려 사항은 설명 가능성이 도입되는 시기에 따라 XAI 기술의 두 가지 광범위한 범주, 즉 사후 설명 방법과 본질적인 해석 가능성 방법13으로 이어졌습니다. 사후 방법은 모델에 구애받지 않는 방법과 모델별로 더 분류됩니다14.

그림 1: 육안 검사를 위한 XAI 프레임워크. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
3. XAI 분류
연구 상태의 구조화된 종합을 제공하기 위해 PRISMA 지침을 사용하여 체계적인 문헌 검토를 수행했습니다(그림 2). 이 프로세스에는 여러 학술 데이터베이스(Scopus, Web of Science, IEEE Xplore, SpringerLink, PubMed, arXiv 및 MDPI)가 포함되었으며 "설명 가능한 AI", "해석 가능성", "육안 검사", "결함 감지", "이상 감지", "제조" 및 "의료 영상 "을 결합한 일련의 검색어가 안내되었습니다. 포함 기준은 논문이 육안 검사 맥락(산업 또는 의료)에서 XAI 방법을 명시적으로 적용하거나 평가하고 충분한 방법론적 세부 사항을 보고해야 했습니다. 제외 기준은 구현되지 않은 순전히 이론적인 제안과 육안 검사 이외의 작업을 제거했습니다. 검색은 처음에 483개의 기록을 검색했습니다. 중복 항목을 제거하고 제목과 초록을 선별한 후 전체 텍스트 검토를 위해 147개가 남았습니다. 포함/제외 기준을 적용하면 이 검토의 기초를 형성하는 75개의 1차 연구가 산출되었습니다.

그림 2: PRISMA 지침에 따른 체계적 검토 프로세스의 PRISMA 흐름도. 이 그림은 각 단계에서 식별, 선별 및 제외된 기록을 보여주며, 최종 검토에 포함된 75개의 1차 연구를 산출합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3: 육안 검사 작업에서 XAI 방법의 제안된 분류법. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
| XAI 방법 | XAI 접근 방식 | 공부 | 산업 | 년 |
| 본질적인 | 규칙 기반 및 선형 모델 | 32,33 | 일반 의학 | 2015–2019 |
| 프로토타입 기반(ProtoPNet, Case-based, Deformable ProtoPNet) | 29,34,35,36 | 의료, 산업, 일반 | 2018–2024 | |
| 개념 중심(개념 병목 현상, 올바른 이유에 대한 권리) | 30,31,37 | 일반, 과학 응용 | 2020–2021 | |
| 자기 설명 신경망(SENN) | 28 | 일반 | 2018–2020 | |
| 얽힌 표현(β-VAE),SOXAI | 38,39 | 일반 | 2018 | |
| 비전 트랜스포머(주의를 통한 본질적인 해석 가능성) | 40,41,42,43,44,45 | 컴퓨터 비전, 제조 | 2020–2024 | |
| 사후, 모델별 | CAM 제품군 | 46,47,48,49,50,51,52, 53,54,55,56,57,58 | 의료 영상, 제조, 자동차, 농업, 전자 | 2018–2025 |
| LRP(레이어별 관련성 전파) | 20,59,60,61,62 | 일반, 의료 영상 | 2015–2024 | |
| 그래디언트 및 현저성 방법(통합 그래디언트, Smooth IG, DeepLIFT, DeconvNet, T-Explainer, Saliency Benchmarks) | 18,19,63,64,65, 66,67,68,69,70 | 일반, 의료 영상 | 2013–2025 | |
| 특수 모델의 어트리뷰션(SNN, 트랜스포머 어텐션 어트리뷰션) | 71,72,73 | 신경과학, 비전 트랜스포머 | 2023–2025 | |
| 사후, 모델에 구애받지 않음 | 석회 및 변형(LIME, ELIME, MASALA), SHAP 및 변형(트리 SHAP), | 금융, 예후 및 건강 관리, 사이버 보안, 자율 주행 차량, 산업 검사. | 2016–2025 | |
| 반사실 | 21,22,23,24,25,27,74, 75,76,77,78,79,80,81, 82,83,84,85,86 | |||
| 설명 | ||||
| 하이브리드 방법 | (GradCAM, SHAP, LRP, LIME)을 포함한 여러 XAI 방법 통합 | 58,87,88,89,90,91,92 | 산업 검사, 의료, 제조. | 2021–2025 |
표 1: XAI 방법, 연도, 산업 및 접근 방식에 따른 75개의 검토된 연구 분류.
4. XAI에 대한 평가 지표
컴퓨터 비전 모델의 성능은 정확도, 정밀도 및 재현율과 같은 잘 확립된 지표로 판단됩니다. 그러나 모델 결정의 설명 가능성을 평가하는 것은 훨씬 덜 간단합니다. 표준 예측 성능과 달리 AI 설명의 품질에 대해 보편적으로 인정되는 지표는 없습니다66. 다시 말해, 분류기의 정확도는 정확하게 측정될 수 있지만, 주어진 이미지 분류(93)에 대한 설명이 얼마나 "좋은" 것인지를 정량화하기 위해 합의된 척도는 없다. 이러한 차이는 XAI 분야의 근본적인 격차, 즉 설명을 평가하는 방법을 강조합니다.
표준화된 XAI 평가 기준을 개발하는 것은 매우 어려운 것으로 입증되었습니다. 한 가지 이유는 해석 가능성과 설명 품질이 다면적이고 상황에 따라 달라지기 때문에 단일 보편적 지표에 저항하기 때문입니다10. 설명을 효과적으로 평가하는 것은 응용 프로그램 도메인, 생성된 설명의 성격, 최종 사용자의 배경 등 여러 요소에 의존합니다. 예를 들어, 의료 영상 진단에 적합한 설명 기술은 산업 육안 검사 작업(10)에서 사용되는 것과 다르게 평가될 수 있다.
실제로 표준 지표가 없기 때문에 연구자들은 다양한 평가 접근 방식에 의존하게 되었습니다. 많은 연구가 여전히 XAI 방법에 대한 정성적, 일화적 평가에 의존하고 있습니다 94,95. 저자가 몇 가지 현저성 맵이나 히트맵을 제시하고 이것이 합리적으로 보인다고 주장하는 것을 흔히 볼 수 있습니다(소위 "얼굴 타당성" 테스트)96. 이러한 육안 검사는 서술적 의미에서 설득력이 있을 수 있지만 여전히 주관적이며 엄격한 비교에는 불충분합니다97. 이는 XAI 메트릭을 표준화하는 것이 얼마나 어려운지 보여줍니다. 합의된 기준이 없는 경우 연구자는 각 데이터 세트 또는 사용 사례에 맞는 지표를 제안합니다.
그 결과, 이제 문헌에는 이 격차를 메우기 위한 다양한 XAI 평가 지표가 풍부합니다98. 수많은 프레임워크와 조치가 제시되었으며, 각 프레임워크와 조치는 설명을 유용하게 만드는 특정 측면을 대상으로 합니다99. 일반적으로 메트릭은 주요 초점에 따라 분류할 수 있습니다. 충실도 기반 메트릭은 모델(100)의 의사결정 과정을 얼마나 잘 반영하는지에 따라 설명을 판단한다. 대조적으로, 해석 가능성 중심 메트릭은 설명이 인간 관찰자에게 얼마나 이해 가능하고 설득력이 있는지를 평가합니다101. 세 번째 범주는 작업 기반 메트릭으로, 설명의 평가는 최종 사용자 성능에 미치는 영향에 따라 달라집니다102. 네 번째 범주는 결과의 일관성을 평가하는 견고성 지향 메트릭입니다(103). 마지막으로, 하이브리드 메트릭은 여러 차원을 결합합니다104.
이러한 메트릭의 다양성은 연구자들이 중요하다고 생각하는 설명 가능성의 측면을 나타내지만 단일 표준의 부족을 강조하기도 합니다: 각 메트릭은 설명 품질의 한 각도만 포착합니다105. 다음에서는 XAI에 대한 다양한 평가 지표를 네 가지 주요 범주로 그룹화하고 표 2에 요약합니다.
| 메트릭 유형 | 메트릭 | 공식 / 정의 |
| 충실도 | 곡선 아래 삭제 면적(AUC)26 | ![]() 상위 K 중요한 기능입니다. 더 낮음 = 더 충실함 |
| 곡선 아래 삽입 면적(AUC)26 | ![]() 더 높음 = 더 충실함 | |
| 불륜 점수103 | ![]() 낮음 = 더 좋습니다 | |
| 포효106 | '중요한' 기능 없이 재훈련 후 정확도 떨어짐 | |
| 견고성 | 안정성 지수107 | ![]() 더 높음 = 더 일관성 있음 |
| 립시츠 점수103 | ![]() 더 낮음 = 더 견고함 | |
| 해석 가능성 | 희소성79 | ![]() 더 낮음 = 더 단순함 |
| 대리 깊이79 | 해석 가능한 대용물의 깊이(예: 의사 결정 트리); 더 얕은 = 더 단순함 | |
| 작업별 | 교차 오버 유니온(IoU)108 | ![]() 마스크 M과 실측 G의 겹침 |
| 포인팅 게임108 | 정확도 = #hits / #samples 더 높음 = 더 좋습니다 | |
| 잡종 | 종합 점수104 | 충실도, 희소성 및 견고성의 가중 조합 |
표 2: 육안 검사에서 XAI에 대한 평가 지표는 네 가지 주요 범주로 그룹화됩니다.
5. 비교 분석
이 섹션에서는 MVTec AD109 (픽셀 수준 마스크가 있는 >5,000개의 결함 이미지) 및 DeepPCB110 (6개의 결함 클래스가 있는 1,500개의 PCB 이미지), CheXpert111 및 ImageNet112 와 같은 공개 데이터 세트에서 방법을 비교하고 삭제/삽입 AUC(충실도), 포인팅 게임 정확도(현지화), 안정성 점수(섭동 하에서의 견고성) 및 대기 시간(런타임 비용)과 같은 지표에 걸쳐 평가됩니다.
CAM 기반 방법(GradCAM, GradCAM++)의 경우 MVTec AD 및 DeepPCB의 결과는 GradCAM이 0.83-0.87(삽입 AUC ~0.68; <삭제 시 15% 정확도 저하), 감도(0.80 - 0.85) 및 런타임 <100ms(~39fps))의 충실도를 달성한다는 것을 보여줍니다. 국소화는 보통으로 유지됩니다(평균 IoU≈0.28 @ δ=0.25, 포인팅 정확도 86-87%). GradCAM++는 유사한 대기 시간(<120ms)과 더 높은 사용자 신뢰도(109.69/250 대 GradCAM의 경우 56.08/250)를 유지하면서 다중 인스턴스 현지화(평균 IoU = 0.38)를 개선합니다. 이러한 방법은 효율적이지만 공간적으로 거칠다47,113.
섭동 기반 방법(LIME, SHAP, RISE)의 경우 성능은 데이터 세트에 따라 다릅니다. MVTec AD에서 LIME은 로컬 충실도 R² = 0.70-0.80에 도달하지만 낮은 견고성(안정성 지수 <0.5), 3-5초/이미지의 대기 시간 및 중간 정도의 현지화(IoU = 0.25-0.35)를 보여줍니다. PCB 결함 분류에 적용된 SHAP는 강력한 인간 정렬(70-80%)으로 일관된 속성(Δ 로그 확률 = 0.2-0.3)을 달성하지만 속도가 느리고(>1초/이미지) 국소화가 약합니다(IoU≈0.02-0.03). MS-COCO를 벤치마킹하고 MVTec AD용으로 복제된 RISE는 평균 4,000-8,000개의 마스킹된 포워드 패스를 수행하여 높은 견고성(안정성 >0.7), 충실도(0.78-0.82 AUC) 및 우수한 현지화(포인팅 게임 = 62.9% 대 GradCAM의 경우 48.3%)를 제공하지만 1-2초/설명 대기 시간은 26,74,79,114입니다.
관련성 전파 방법(LRP, DeepLIFT)의 경우 DeepPCB 및 CheXpert에 대한 평가에 따르면 LRP는 0.82-0.90의 충실도, 감도 ~0.85 및 0.40-0.50의 국소화 IoU를 달성합니다. 런타임은 이미지당 100-200ms로 CAM보다 느리지만 거의 실시간 검사가 가능합니다. CheXpert 방사선과 작업에서 전문가 연구에 따르면 LRP 히트맵과 임상 관련 영역 사이에 >70%가 겹쳐져 도메인 전반에 걸쳐 해석 가능성이 입증되었습니다60.
ImageNet 및 CheXpert에서 훈련된 ViT 모델의 결과인 어텐션 기반 방법(Transformers)의 경우 원시 어텐션 맵은 0.75-0.85의 충실도를 산출하지만 0.70-0.75의 민감도와 적당한 국소화(IoU = 0.30-0.45)로 섭동 하에서 불안정합니다. 인간의 신뢰는 ~60-70%입니다. 적응된 접근 방식(주의 흐름, Transformer-LRP)은 인과 지표를 개선하여 삭제/삽입 및 포인팅 게임 점수 40,115,116에서 원시 주의력을 능가합니다.
프로토타입 및 반사실 기반 방법의 경우 MVTec AD의 평가는 ProtoPNet이 유사한 결함 사례에 의해 예측이 정당화되어 운영자의 의사 결정을 돕는 예시 기반 설명을 달성한다는 점을 강조합니다. SOM 기반 접근 방식은 2D 맵에서 결함 특징을 클러스터링하여 위상 관계를 보존합니다. PCB 결함 이미지와 CheXpert 모두에서 테스트된 반사실적 방법은 실행 가능한 추론("균열 길이가 1mm 미만이면 예측이 정상으로 전환됨")을 제공하지만 비용이 많이 드는 최적화가 필요하고 고해상도 입력으로 어려움을 겪습니다. 이러한 방법은 인간의 추론과 강력하게 일치하지만 규모는117,118,119에 미치지 못합니다.
마지막으로, 절충안과 실질적인 선택을 고려할 때 CAM은 대기 시간이 중요한 워크플로를 지배하지만 여전히 거칠습니다. LRP는 충실도와 런타임의 균형을 유지하여 픽셀 수준 분석에 탁월합니다. RISE는 가장 강력한 인과적 충실성과 현지화를 제공하지만 대기 시간은 초 수준입니다. SHAP 및 LIME은 해석 가능성을 향상시키지만 느리고 불안정합니다. 프로토타입과 반사실은 사람의 정렬을 극대화하지만 고해상도 검사에서는 확장성이 떨어집니다. 트랜스포머 기반 모델에는 원시적인 주의를 넘어서는 특수한 적응이 필요합니다. 따라서 어떤 단일 방법이 보편적으로 다른 방법보다 성능이 뛰어나지 않습니다. 대신 방법 선택은 데이터 세트, 작업, 대기 시간, 예산 및 해석 가능성 요구 사항을 반영해야 합니다. 그림 4에서 볼 수 있듯이 선택 워크플로는 이러한 벤치마크 중 세 가지(작업, 대기 시간, 해석 가능성)를 육안 검사에서 XAI 방법을 선택하기 위한 작업 지향 가이드에 통합합니다.

그림 4: XAI 방법 채택을 위한 선택 워크플로우. 이것은 육안 검사에서 적절한 XAI 방법을 선택하는 것을 안내하는 의사 결정 순서도입니다. 워크플로는 작업 유형(분류, 세분화, 이상 탐지, 회귀), 대기 시간 제약 조건 및 설명 세부 정보를 고려하고 이를 대표적인 메서드에 연결합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
6. 토론
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 검토는 육안 검사에서 XAI에 대한 75건의 연구를 조사하여 사후 및 내재적 방법의 분류와 벤치마크 기반 비교 분석을 도출했습니다. 연구 결과는 단일 방법이 보편적으로 다른 방법보다 성능이 우수하지 않음을 확인시켜 줍니다: GradCAM 및 LRP와 같은 그래디언트 기반 접근 방식은 실시간 결함 위치 파악에 효율적이지만 복잡한 영역에서는 설명이 거칠 수 있습니다. SHAP, LIME 및 RISE와 같은 섭동 기반 방법은 더 미세한 디테일과 강력한 충실도를 제공하지만 높은 대기 시간과 계산 비용으로 인해 실제로는 종종 실패합니다. 주의 기반 방법은 트랜스포머 내부를 활용하지만 원시 주의가 인과적 추론을 반영하지 않을 때 신뢰할 수 없습니다. LRP는 자세한 설명을 생성하지만 여전히 CAM 기반 접근 방식보다 비용이 많이 듭니다. 이러한 한계는 XAI의 효율성이 방법이 적용되는 상황에 크게 의존한다는 것을 분명히 보여줍니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자는 이 저작물의 출판과 관련하여 이해 상충이 없음을 선언합니다.
저자는 이 작업이 공공, 상업 또는 비영리 부문의 자금 지원 기관으로부터 특정 보조금을 받지 않았음을 선언합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청