이 글은 시간 가중치, 인과 추론, 계층적 귀속이 해석 가능성 최적화에 미치는 영향을 평가하는 것을 목표로 합니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
이 글은 시간 가중치, 인과 추론, 계층적 귀속이 해석 가능성 최적화에 미치는 영향을 평가하는 것을 목표로 합니다.
지난 몇 년간 데이터 기반 모델의 큰 발전으로 인해 투명성과 해석 가능성에 대한 필요성이 더욱 커졌으며, 이를 통해 설명 가능한 인공지능(XAI)이 등장했습니다. 여러 전통적인 XAI 접근법이 널리 퍼져 있습니다; 그러나 이들은 동적 관계를 해석하는 데 한계가 있다. 현재 연구는 시간적 가중치, 인과 추론, 계층적 귀속, 해석 가능성 최적화에 중점을 둔 새로운 Ensemble SHapley Additive exPlanations(SHAP) 프레임워크인 TCHSHAP를 제안하여 이 한계를 해결하는 것을 목표로 합니다. TCHSHAP는 지수적 감소를 통해 시간적 가중치를 부여하여 현재 정보를 역사적 정보보다 우선시합니다. 더 나아가, 인과관계 추론은 상관관계를 인과관계에서 분리하여 실질적인 통찰을 얻습니다. 또한, 계층적 귀속은 세분적(지역 수준)과 집계된 수준(특징 그룹 영향)에서의 통찰을 제공합니다. 이러한 접근법들은 보다 해석 가능하고 설명 가능한 모델을 구현하기 위해 통합됩니다. 제안된 모델의 효능을 검증하기 위해, Kaggle에서 수집한 작물 수확량 데이터셋을 대상으로 실험을 수행했습니다. 실험 평가에 앞서 데이터 전처리는 원핫 인코딩을 사용하여 수행됩니다. 데이터 정규화는 최소-최대 스케일링으로 수행되며, 이상치는 4분위 범위를 통해 제거됩니다. 실험 평가를 위해 저자들은 무작위 숲에 SHAP XAI 모델을 사용했습니다. 제안된 TCHSHAP 모델의 효능을 평가할 때, 전통적 SHAP의 평균 예측치가 161.137인 반면, 시간적 가중치와 인과 추론을 포함하면 161.506까지 상승하여 시간적 및 인과적 유의성 활용의 효과를 지지하는 것으로 관찰됩니다. 또한, 계층적 귀속 과정에서 농업적 특징이 목표 변수에 대해 가장 강한 우세를 보이는 것이 관찰됩니다. 이러한 지배 뒤에는 지리적, 환경적 요인이 순서대로 따릅니다. 따라서 얻어진 결과는 제안된 접근법이 전역 및 국소 해석 가능성을 향상시키는 데 효과적임을 입증하며, 사용자의 모델 예측에 대한 신뢰를 강화합니다. 현재 연구는 모델 성능에 영향을 주지 않으면서 투명성과 해석 가능성을 개선하는 방법을 제시합니다. 제안된 모델은 복잡한 데이터 기반 응용 분야에서 해석 가능하고 효율적인 회귀 모델링을 가능하게 하여 실제 환경에서 널리 적용할 수 있게 합니다.
회귀분석은 기후 모델링, 재무 예측, 의료 진단, 농업 수확량 추정 등 여러 영역을 포함하는 예측 분석에서 중요한 역할을합니다. 그러나 회귀 모델, 특히 Gradient Boosting Machines(GBM), 랜덤 포레스트, 딥 뉴럴 네트워크(DNN)와 같은 비선형 및 고용량 모델의 설명되지 않은 결과는 투명성과 실행 가능한 인사이트가 필요한 응용 분야에서 상당한 도전 과제를 제기합니다. 이 해석 가능성의 격차는 아직 초기 단계인 설명 가능한 인공지능(XAI) 기술을 활용함으로써 메울 수 있습니다. 현재 SHAP과 로컬 해석 가능한 모델 무관성 설명(LIME)과 같은 기존 XAI 프레임워크는 정적인 특징 설명만 제공합니다3. 이 XAI 기법들은 현재 시간 의존성, 계층적 특징 구조, 인과관계를 포함하는 회귀 작업의 복잡성을 설명하지 못해 연구 경로 4,5를 만듭니다. 이러한 요인들을 고려하지 않아 XAI는 때때로 잘못된 결론을 도출할 수 있습니다. 예를 들어, 전통적인 SHAP은....
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
참고: 이 절에서는 제안된 앙상블 방법과 그림 1에 나타난 모든 제안된 수정안을 논의합니다.
데이터 준비
제안된 프레임워크의 효과를 검증하기 위해, 저자들은 Kaggle17에서 수집한 작물 수확량 데이터셋에 실험을 수행했습니다. 이 데이터셋은 1997년부터 2020년까지 다양한 작물에 대한 인도 농업 데이터로 구성되어 있으며, 2025년 3월에 접근되었습니다. 이 데이터셋은 계절, crop_year, 비료, 농약, 작물, 수확량(목표 변수) 등 다양한 특징을 포함합니다. 고려 중인 데이터셋은 범주 값을 처리하기 위해 원핫 인코딩을 사용하여 효율성을 높이기 위해 사전 처리됩니다. 계절, 작곡, 상태 같은 범주별 특징은 원핫 인코딩됩니다. MinMax 스케일링은 면적, 생산량, annual_rainfall, 비료, 농약 등 수치 특징을 [0,1] 범위까지 확장하는 데도 사용됩니다. 이상치를 다루기 위해 임계값 Q1 - 1.5 • IQR17의 4분위 범....
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 섹션에서는 실험 연구 중 사용된 다양한 방법을 적용하여 얻은 결과를 논의하며, 다음과 같은 여러 하위 섹션으로 구성됩니다:
데이터 수집 및 전처리
제안된 프레임워크의 실험적 평가를 수행하기 위해 Kaggle19에서 작물 수확량에 관한 데이터셋을 수집하였습니다. 수집된 데이터는 라벨 인코딩, 스케일링, 앞서 논의한 이상치 제거 등 사전 처리되었습니다. 원하는 목표 집합에 따라 변수들의 특징 유의성을 평가했습니다. 고려 중인 데이터셋의 특징 중요성 그래프는 그림 2에 나타.......
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
본 연구의 주요 목적은 전통적인 SHAP 모델에 시간적 가중치, 인과 추론, 계층적 유의성을 통합하여 TCHSHAP 모델을 도출하는 것입니다. XAI 기법에 이러한 구성 요소를 포함하는 목적은 결과의 해석 가능성을 높이기 위함입니다. 시간적 가중치를 위해 우리는 최근 값에 더 많은 가중치를 부여하는 지수 감소 기법을 고려했습니다. 인과 유의성에서는 저자들이 예측 변수에 미치는 다양한 특징의 직접적인 영향을 평가하려고 합니다. 또한, 입력 매개변수는 결과를 더 잘 이해하기 위해 다양한 계층적 특징으로 분류됩니다. 제안된 해결책의 효과를 검증하기 위해 저자들은 Kaggle에서 이용 가능한 crop_yield 데이터셋을 검토했습니다. 얻어진 결과는 시간적 가중치, 인과 추론, 계층적 귀속(TCHSHAP에서 제안된 바와 같이)이 전통적 SHAP의 한계를 해결함으로써 해석 가능성을 향상시키는 데 기여함을 명확히 보여줍니다20,21
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충이 없다고 선언한다.
이 작업은 FCT – 과학 및 기술 재단(Fundação para a Ciência e a Tecnologia, I.P.)을 통해 국가 자금으로 지원되며, 프로그램 계약 UID/05105/2025에 따라 운영됩니다.
....액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| ELI5 | 0.13.0 | 파이파이 | |
| 라임 | 0.2.0.1 | 파이파이 | |
| 엔비디아 DGX A100 GPU 서버 | CPU 듀얼 AMD Rome 7742, 총 128코어 | 엔비디아 | |
| 시스템 메모리 1TB | |||
| 파이썬 | 3.1 | 파이썬 | |
| 샾 | 0.41.0 | 파이파이 | |
| 시킷-학습 | 1.3.0 | 파이파이 | |
| 텐서플로우 | 2.13 | 텐서 플로우 | |
| XGBoost | 1.7.6 | 파이파이 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.