우리는 설명 가능한 연합 학습 프레임워크인 FedRisk를 구현하기 위한 재현 가능한 프로토콜을 시연합니다. 이 절차에는 의미 데이터 조화, 개인정보 보호 대상 정렬, 차등 개인정보 보정, 로컬 GBDT 교육, 글로벌 트랜스포머 융합, 그리고 그라디언트 압축 비동기 업데이트를 포함하여, 여러 기관에서 안전하고 확장 가능하며 규제 준수를 가능하게 하는 금융 위험 예측을 가능하게 합니다.
연구 논문
우리는 설명 가능한 연합 학습 프레임워크인 FedRisk를 구현하기 위한 재현 가능한 프로토콜을 시연합니다. 이 절차에는 의미 데이터 조화, 개인정보 보호 대상 정렬, 차등 개인정보 보정, 로컬 GBDT 교육, 글로벌 트랜스포머 융합, 그리고 그라디언트 압축 비동기 업데이트를 포함하여, 여러 기관에서 안전하고 확장 가능하며 규제 준수를 가능하게 하는 금융 위험 예측을 가능하게 합니다.
기관 간 금융 데이터의 분산과 엄격한 개인정보 보호 규제는 협력적 위험 관리를 심각하게 저해하며, 정확도가 60% 미만인 최적 사기 탐지와 25%를 초과하는 중소기업 대출 연체 오류가 발생한다. 기존의 연합 학습 솔루션은 비-IID 데이터, 모델 해석 가능성, 준수 문제로 어려움을 겪고 있어 실제 도입률이 20% 미만입니다. 이러한 격차를 해소하기 위해, 우리는 네 가지 핵심 혁신을 통합한 설명 가능한 연합 학습 프레임워크인 FedRisk를 제안합니다. 첫째, 기관 간 데이터 메쉬와 온론적 의미 조화를 통해 기능 활용률이 85% 이상으로 달성됩니다. 둘째, 하이브리드 AI 모델은 국소적으로 해석 가능한 GBDT와 단조 제약 조건, 그리고 전역 주의 기반 트랜스포머를 결합하여 FedAvg에 비해 비IID 시나리오에서 성능 손실을 7.6% 줄입니다. 셋째, 삼자 프라이버시 메커니즘은 총 예산 ε=5인 적응적 차별 프라이버시, 가적 비밀 공유, 공정성 인식 정규화를 사용하여 그룹 예측 편향을 0.05 이하로 제한하고 RAROC 손실을 2.1% 미만으로 제한합니다. 넷째, 통신 효율적인 최적화로 라운드당 대역폭을 8.5MB로 줄이고 학습 시간을 85분으로 줄입니다. 500만 건 이상의 다기관 기록을 기준으로 평가된 FedRisk는 AUC-ROC 0.912를 달성하며, 중앙 집중식 GBDT보다 단 1.8% 낮으며, 회원 추론 공격에 저항하는 AUC는 0.58입니다. 이 검사는 기관 간 데이터 전송을 99% 줄이고, AUC-ROC 기준선보다 7.3% 더 우수한 성능을 보입니다. 원시 데이터 공유 없이 안전하고 투명하며 규제를 준수하는 위험 예측을 가능하게 함으로써, FedRisk는 기관 간 금융 협업을 위한 확장 가능한 솔루션을 제공합니다.
디지털 금융의 심층 발전은 개인 신용 위험 관리부터 중소기업 공급망 금융에 이르기까지 서비스 모델을 재편하며, 데이터를 핵심 생산 요소로 자리매김하고 있습니다. 중국인민은행의 "2023 중국 핀테크 발전 보고서"에 따르면, 2023년 말까지 중국의 디지털 신용 규모는 65조 위안을 초과하며 전체 잔액의 38%를 차지했고, 일일 거래 데이터는 500TB1을 초과했습니다. 하지만 '데이터 사일로'는 여전히 중요한 장벽입니다. 기관들은 경쟁과 보안 문제로 인해 일반적으로 폐쇄형 데이터 모델을 채택합니다. 예를 들어, 신용카드 사기 탐지에서는 내부 데이터에만 의존하는 은행이 중요한 기관 간 기록을 놓치게 되어, 새로운 사기 유형에 대한 식별률이 60% 미만으로 떨어집니다. 마찬가지로 중소기업 신용의 경우, 외부 보험 및 세금 데이터 부족으로 인해 25%를 초과하는 디폴트 예측 오차가 발생합니다. 이러한 단편화는 2억 명의 소외된 고객의 접근을 제한하고, 교차 전염 위험을 18% 증가시키는 두 가지 도전을 초래합니다(CBIRC 2023 보고서). 결과적으로 데이터 사일로는 디지털 금융의 고품질 개발을 저해하는 핵심 병목 현상이 되었습니다.
최근 몇 년간 전 세계 데이터 프라이버시 법률의 급증으로 중앙 집중식 데이터 공유가 크게 제한되었습니다. 금융 기관은 이제 세 가지 핵심 원칙을 준수해야 합니다: "최소한의 필요성", "정보에 기반한 동의", "추적 가능성"입니다. 지역별 프레임워크는 다르지만, 모두 표 1에 자세히 설명된 바와 같이 기관 간 데이터 사용에 엄격한 기준을 부과합니다.
| 규제 체계 | 핵심 제한 조항 | 금융 데이터 협업에 미치는 영향 |
| EU 일반 데이터 보호 규정(GDPR) | 1. 국경 간 데이터 전송은 "충분성 결정"을 충족해야 합니다; 2. 개인은 자신의 데이터에 접근하고 삭제할 권리가 있습니다; 3. 데이터 유출은 72시간 이내에 신고해야 합니다 | 원시 데이터의 무단 국경 간 전송이 금지되며, 중앙 집중식 공유는 개인정보 영향 평가(PIA)를 요구하여 준수 비용이 30% 증가합니다 |
| 캘리포니아 소비자 개인정보보호법(CCPA) | 1. 소비자는 기업에 개인 정보를 삭제해 달라고 요청할 수 있습니다; 2. 데이터 공유는 사용에 대한 명확한 통지가 필요합니다 | 중앙 집중식 플랫폼은 각 소비자에게 데이터 접근 인터페이스를 요구하여 운영 비용이 25% 증가하고 소비자가 데이터를 쉽게 삭제하거나 모델의 학습 데이터가 누락되는 것을 방지합니다 |
| 중국 개인정보보호법 | 1. 개인정보 처리는 별도의 동의가 필요합니다; 2. 민감한 개인 정보 처리는 추가 승인 문서가 필요합니다; 3. "데이터 분류 및 보호" 시스템 구축 | 기관 간 데이터 공유는 각 고객의 승인이 필요하며, 실제로 승인율은 40% 미만입니다. 중앙집중식 모드는 구현하기 어렵습니다 |
| EU 결제 서비스 지침 II (PSD2) | 1. 은행 데이터 인터페이스 열기; 2. 데이터 공유는 고객 승인과 제한된 사용을 기반으로 해야 합니다 | 데이터 공유는 지원하지만, 인터페이스 접근 전 과정을 추적해야 하며, 중앙 집중식 플랫폼이 인터페이스 보안과 감사 책임을 맡아야 하므로 기술적 복잡성이 크게 증가합니다 |
표 1: 주요 데이터 규제 프레임워크의 핵심 요구사항 비교.
본 연구는 기관 간 연합 위험 모델링의 도전 과제를 해결하기 위한 세 가지 핵심 혁신을 소개합니다. 첫째, 존재론적 의미층을 가진 데이터 메시 아키텍처는 이기종 스키마를 표준화하여 85% 이상의 기능 활용도를 달성하면서 데이터 주권을 유지합니다. 둘째, 하이브리드 AI 모델은 국소적으로 해석 가능한 GBDT와 규제 준수 단조 제약, 그리고 전역 주의 기반 트랜스포머를 결합합니다. 기관 산출물을 동적으로 가중치함으로써 이 모델은 AUC-ROC 0.912를 유지하면서 비IID 성과 손실을 7.6% 줄입니다. 셋째, 삼자 프라이버시 준수 메커니즘은 적응적 차별 프라이버시(ε=5), 가적 비밀 공유, 공정성 인식 규율화를 통합하여 GDPR 준수를 보장하고, ΔDP 편향을 < 0.05로 제한하며, 회원 추론 공격(AUC=0.58)에 저항합니다. 이 혁신들은 연합 금융 AI에서 데이터 단편화, 규제 해석 가능성, 프라이버시-보안 상충관계의 요구를 조화시킵니다.
금융 분야의 연합 학습은 데이터 분포에 따라 수평 연합학습(HFL)2, 수직 연합학습(VFL)3, 연합전이 학습(FTL)4로 분류됩니다(표 2).
| 연방 패러다임 | 핵심 기능 | 금융 위험 통제 적응 시나리오 | 대표 연구 | 유계성 |
| 수평 연방 학습 | 참가자들의 데이터 특징 공간은 일관되지만, 표본 공간은 다릅니다 | 조직 간 신용카드 사기 탐지 | McMahan 등[[i]](2017)은 FedAvg 알고리즘을 제안하여, 파라미터 평균을 통한 기관 간 모델 협업을 달성하여 금융 사기 방지에 HFL을 처음으로 적용하고, 10개 은행 데이터셋에서 사기 탐지율을 12% 향상시켰습니다 | 비독립적이고 동일하게 분포된(Non-IID) 금융 데이터의 특성을 고려하지 않고, 기관 간 고객 위험 분포 차이가 30%를 초과할 때 모델의 AUC-ROC는 15% 이상 감소합니다 |
| 수직 연방 학습 | 참가자의 표본 공간은 일관되지만, 특징 공간은 다릅니다 | 은행과 보험사 간의 협력적 신용 위험 관리 | Yang 등[[ii]] (2020)은 동형화 암호화를 통해 수직 특징 조인트 훈련을 달성하고, 소규모 및 마이크로 기업 대출 시나리오에서 기본 예측 정확도 89.3%를 달성하는 SecureBoost 알고리즘을 제안했습니다 | 엄격한 엔터티 정렬에 의존하는데, 이는 개인정보 유출 위험이 높고, 기능 차원이 너무 클수록 학습 효율이 급격히 떨어집니다 |
| 연방 편입 학습 | 참가자의 데이터 분포와 특징 공간에는 차이가 있습니다 | 교차 시나리오 위험 마이그레이션 | Pan 등[[iii]] (2021)은 매개변수 마이그레이션 최적화 모델을 초기화하여 공급망 금융에서 표본 부족 문제를 해결했으며, 이로 인해 수렴 속도를 60% 향상시켰습니다 | "부정적 이주"는 이주 과정에서 발생할 가능성이 높습니다. 소스 시나리오와 목표 시나리오 간의 위험 메커니즘 차이가 40%를 초과할 때, 모델 성능은 전통적인 모델을 초과합니다 |
| [[i]]맥마한, B., 무어, E., 라메이지, D., 햄프슨, S., 그리고 Y 아르카스, B. A. (2017). 분산 데이터로부터 딥 네트워크를 통신 효율적으로 학습하는 것. 제20회 인공지능 및 통계학회 논문집, 1273–1282. | ||||
| [[ii]]양, Q., 리우, Y., 첸, T., 통, Y. (2020). 연합 기계 학습: 개념과 응용. ACM 지능형 시스템 및 기술 거래, 10(2), 1–19. | ||||
| [[iii]]판, S. J., 양, Q. (2021). 전이 학습에 관한 설문조사. IEEE 지식 및 데이터 공학 거래, 33(12), 2345–2359. | ||||
표 2: 금융 부문 학습 패러다임 비교.5,6,7
최근 발전은 시나리오별 과제를 해결하고 있습니다: FedSSL8 은 대조적 학습을 통해 레이블 희소성을 해결하고, FedLite9 는 자원이 제한된 기관에서 490× 소통 감소를 달성합니다. 헬스케어10, 보안 취약점11, 멀티모달 금융12, 확장성13 확장은 FL의 광범위한 적용 가능성을 보여줍니다.
프라이버시 보호는 금융 위험 관리의 핵심입니다. 세 가지 주류 기법인 차분 프라이버시(DP)14, 안전한 다자 계산(SMC)15, 동형암호(HE)16는 강도, 효율성, 적응성 면에서 뚜렷한 장점을 제공합니다. DP는 공식적으로 Pr[M(x) = y] ≤ e∈ ⋅ Pr[M(x') = y] + δ으로 정의되며, 여기서 M은 무작위 알고리즘, $x$, $x'$는 인접한 데이터셋, y는 알고리즘 출력입니다. 이는 데이터셋 간 출력 유사성을 보장하며, 제어 가능한 노이즈를 통해 개별 누수를 엄격히 제한합니다. 이들의 기술적 특성에 대한 비교 분석은 표 3에 제시되어 있습니다.
| 기술 유형 | 핵심 원칙 | 프라이버시 강도 (ε 가치) | 계산 복잡도 | 금융 상황 적응성 |
| 차별적 프라이버시 | 개별 데이터 기여도는 노이즈를 더해도 구분할 수 없습니다 | ε=1-5 (재무 시나리오에 권장되는 값) | O (n) (n은 표본 크기입니다) | 모델 학습 전체 과정에 적합한 높은 학습은 연합 학습과 원활하게 결합할 수 있습니다 |
| 보안 다자 컴퓨팅 | 여러 참가자가 중간 결과를 공개하지 않고 협력하여 계산합니다 | 정보 이론적 보안 | O (n²) (수직 연방 시나리오) | 네, 민감한 특징 조인트 계산에는 적합하지만, 대규모 샘플 상황에서는 시간이 너무 오래 걸립니다 |
| 준동형 암호화 | 암호화된 데이터는 직접 계산되며, 복호화 후 올바른 결과가 나옵니다 | 계산적으로 안전합니다 | O (n³) (격자 암호학 기반) | 저용량, 소규모 매개변수 전송에만 적합하며, 수백만 샘플 시나리오 계산 시간은 24시간 이상 소요됩니다 |
표 3: 개인정보 보호 기술 특성 비교.
금융 분야에서 차등 프라이버시는 "프라이버시 효과 균형 제어" 덕분에 주류 선택지가 되었습니다. Dwork, C.17 은 고전적인 (ε, δ)-DP 정의를 제안하여 프라이버시 보호를 위한 정량적 기준을 제시했습니다. 핵심 공식은 다음과 같습니다:
(1)
여기서 M: 프라이버시 보호 알고리즘으로서 D와 D는 인접한 데이터 세트(샘플 차이가 하나뿐), 프라이버시 예산(프라이버시 보호가 작을수록 강함), r 프라이버시 예산(프라이버시 보호가 작을수록 강함), δ 실패 확률(보통 10-5로 계산)입니다.
Abadi, M. 등은 차등 프라이버시 확률 구배 하강(DP-SGD)을 개발했으며 , 그라디언트 클리핑과 노이즈 주입을 활용해 신용 위험 모델 프라이버시 유출을 8% 이하로 줄였습니다. 보안 다자 계산(SMC)과 준동형 암호화는 주로 민감한 처리에 사용됩니다. 예를 들어, Bogetoft, P. 등은 SMC를 은행 간 신용 점수 산정에 적용하여 최종 점수만 접근할 수 있도록 했습니다. Perri, L.2 는 안전한 매개변수 집계를 위한 완전 동형 암호화 알고리즘을 제안했으나, 높은 계산 복잡성으로 인해 중간 규모 은행 내 소규모 학습에만 적용된다.
AI 위험 통제 모델은 전통적인 중앙 집중식 아키텍처에서 분산 아키텍처로 진화했으며, 두 가지 패러다임은 데이터 의존도, 성능, 준수 비용에서 큰 차이를 보입니다. 중앙 집중식 모델로는 그라디언트 부스팅 트리(GBDT)와 딥러닝 모델이 포함됩니다. Friedman, J., Hastie, T.Tibshirani, R.21 이 제안한 GBDT 알고리즘은 다중 트리 통합을 통해 위험 예측 정확도를 향상시켜, 개인 신용 시나리오에서 AUC-ROC가 0.93을 달성합니다. 하지만 완전한 고객 데이터를 수집해야 하므로 데이터 유출과 준수 문제의 위험이 있습니다. Zhang, H., Liu, Y., Zhang, X., Yin, Z.Li, Y.22 는 사기 탐지율을 15% 향상시키는 트랜스포머 기반 위험 통제 모델을 개발했으나, 매개변수 크기는 10GB를 초과합니다. 분산 패러다임에는 매개변수 공유와 기능 공유 접근법이 포함됩니다. 매개변수 공유(예: FedAvg)는 국소 매개변수를 집계하지만 비-IID 특성에서는 어려움을 겪습니다: AUC-ROC는 기본값 격차가 0.5%에서 3.5%로 증가하면서 0.89에서 0.82로 떨어졌습니다. 기능 공유(예: SecureBoost)는 수직적 협업을 가능하게 하지만 정밀한 정렬이 필요하며, 오류가 5%를 초과하면 성능이 20% 급락합니다.
연합 학습의 핵심은 원시 데이터 전송 없이 다기관 협력 교육을 가능하게 하는 것입니다. 이 프레임워크는 참가자, 교육 과정, 그리고 목표 기능을 정의합니다. 본 연구에서 시스템은 Kfinancial 기관 노드(P1,P 2, ..., PK로 표기)와 조정자 C로 구성됩니다. 각 기관 PK는 고객 특징 벡터 yk∈,i∈R d 로컬 데이터셋
을 보유하며, 위험 라벨(0은 정상, 1은 기본값 사기), 지역 표본 크기, 전체 데이터 척
도 사용됩니다. 교육은 "로컬 반복-전역 집계" 과정을 따릅니다: i) 초기화: 코디네이터가 초기 글로벌 매개변수 θ0을 생성하여 모든 기관에 배포; ii) 국소 반복: 교육 라운드에서 기관 PK는 지역 데이터와 현재 전역 매개변수 θt를 기반으로 하며, 구배 하강을 통해 국소 손실 함수를 최소화하여 업데이트된 국소 매개변수 θt,k를 얻습니다. 즉:
(2)
여기서 n은 학습률이고 ∇θLk(θt)는 국소 손실의 기울기이며, θt는 국소 손실 a θt의 구배이다; iii) 전역 집계: 기관은 로컬 매개변수를 암호화하여 코디네이터에 업로드하고, 코디네이터는 표본 크기 가중 집계를 통해 새로운 글로벌 매개변수 θt+1 을 생성합니다:
(3)
iv) 종료 조건: 2-3단계를 반복하여 검증 세트에서의 글로벌 모델의 성능이 연속 라운드에서 개선되지 않을 때까지 반복하고, 최종 모델을 출력합니다. θ* = θT. 금융 데이터의 비독립 동일성 분포(Non-IID) 특성을 고려할 때, 전통적인 연합 평균 법(Fed AvgPk)의 가정을 확장할 필요가 있습니다. 본 연구는 비IID를 특징짓기 위해 "라벨 분포 이질성"과 "특징 분포 이질성"이라는 이중 차원을 사용합니다: 기관 내 긍정적 사례(기본 사건)의 비율을 다음과 같이 정의하자:
(4)
태그 동형 계수를 정의하라; 집합 특징의 평균 차이를 다음과 같이 하자, α>0.03 때, 그리고 이때 높은 비IID 시나리오로 판명된다.
공격자의 능력과 목표에 따라 위협 시나리오는 표 4에 나와 같이 세 가지 범주로 나뉩니다
| 위협 유형 | 공격자 신원 | 펀칭백 | 일반적인 방법 |
| 반쯤 진실을 가장하는 공격 | 참여 기관/코디네이터 | 다른 기관의 고객 특성을 추론합니다 | 모델 매개변수에 기반한 경사 반전 및 구성원 추론 공격 |
| 적의 공격 | 악의적인 기관 | 오염 전 세계 모델 | 거짓 그라디언트 및 독 모델 업로드 |
| 외부 공격 | 무단 제3자 | 운송 중 매개변수/특징 도용하기 | 중간 공격, 통신 링크 도청 |
표 4: 금융 시스템의 위협 모델 분류.
(ε,δ) - 차별프라이버시(Differential Privacy, DP)를 핵심 프라이버시 보호 표준으로 사용하여, 본질적으로 노이즈를 더해 '데이터 세트에 샘플이 포함되어 있는지 여부'가 모델 출력에 미치는 영향을 무시하는 데 있습니다. 형식적 정의는 다음과 같습니다: 연방학습 M 알고리즘에서, 임의의 인접한 데이터셋 와 가 단 한 샘플(DΔD' = 1) 차이가 있다면, 그리고 임의의 출력 S⊆Range(M) 집합에 대해, 다음과 같은 조건을 만족합니다:
Pr[M(D)∈S]≤eε⋅Pr[M(D')∈S]+δ (5)
이 경우 만족 (ε,δ)-DP라고 합니다. 하나는 "프라이버시 예산"(프라이버시 보호가 작을수록 더 강력하며, 보통 재무 시나리오를 고려합니다)입니다. δ "실패 확률"(일반적으로 δ≤10-5로 낮게 발생해 프라이버시와 보안에 영향을 주지 않도록 합니다). 연합 훈련의 다중 라운드 반복 특성에 적응하기 위해, 전체 프라이버시 소비량은 "Renyi 미분 프라이버시"(RDP)의 결합 정리를 사용하여 계산됩니다. 각 훈련 라운드의 프라이버시 예산을ε t라고 하면, 사이클 훈련 후 총 프라이버시 예산은 다음을 만족합니다:
(6)
이 정리는 라운드당 프라이버시 예산을 동적으로 할당함으로써 적응형 노이즈 보정의 이론적 기반을 제공합니다.
FedRisk는 엄격한 (ε, δ)차등 프라이버시(DP) 프레임워크를 사용하여 Rényi DP(RDP) 합성 정리 를 통해 프라이버시 예산을 동적으로 배분합니다. 이 연구는 전역 민감도 Δf를 인접 데이터셋에 의해 유도된 모델 매개변수의 최대 L1-노름 변화(단일 표본만 차이)로 정의하며, 분산 인식 라플라스 노이즈 보정(노이즈 계수 κ_t 데이터 분포 변동에 비례함)을 적용합니다. 전체 프라이버시 예산 제약ε=5(GDPR 준수 임계값 충족) 하에서, RDP는 다중 라운드 학습 프라이버시 소비를 (ε, δ)-DP(δ=10⁻⁵)로 변환하며, 보호 강도와 모델 효용 실증 결과를 균형 있게 조정하여 회원 추론 공격 AUC를 0.58로 억제하고 위험 예측 AUC-ROC를 0.912로 유지함을 보여줍니다.
금융 위험 통제 모델의 최적화는 동시에 세 가지 규제 요건을 충족해야 합니다: "예측 정확성", "프라이버시 보호", "공정성". 손실 최소화만을 목표로 하는 전통적인 최적화 함수는 더 이상 적용되지 않습니다. 규제 제약을 정량화 항으로 전환하기 위한 다목적 최적화 프레임워크가 구축되어야 합니다. 이진 분류 시나리오(기본값/정상)에서는 로그 손실(LogLoss)이 모델 예측 확률과 실제 라벨 간의 편차를 측정하는 기본 손실 함수로 채택되며, 다음과 같이 정의됩니다:
(13)
여기서 pk, i = σ(θ; xk,i)는 모델에 대한 샘플 (xk,i,y k,i)의 예측 기본 확률이며, σ(⋅)는 시그모이드 활성화 함수이다.
GDPR, 개인정보보호법 및 기타 규정의 요구사항은 세 가지 유형의 정규화 용어로 변환되며, 기본 손실 함수와 결합되어 최종 최적화 목표를 형성합니다:
(14)
각 정규화 용어의 정의와 기능은 다음과 같습니다: i) 프라이버시 제약: 차별적 프라이버시의 노이즈 추가 비용을 바탕으로, 정량적 프라이버시 보호가 모델 정확도에 미치는 영향에 대해 논의합니다. 모델 Δ파라미터의 전역 민감도를 (즉, 인접 데이터 세트에 의해 발생하는 매개변수의 최대 변화)라고 하자면, 다음과 같습니다:
(15)
이 용어는 추가된 노이즈 강도가 프라이버시 예산에 맞도록 보장하고 모델 정확도의 과도한 희생을 방지합니다. ii) 공정성 제약: 개인정보보호법의 '차별금지' 요건을 고려할 때, 다양한 집단의 예측 편향이 제한됩니다. 예를 들어 "인구통계학적 평등성"(DemographicParity)을 들면, 집합의 양의 예측율을 다음과
같이 하자:
(16)
이 용어는 서로 다른 그룹 간 예측률 차이를 최소화하고 모델 구분을 피합니다. iii) 강인성 제약 조건 : Basel III의 "모델 안티-간섭 능력" 요구사항에 따라, 데이터의 작은 교란이 모델 출력에 유의미한 영향을 미치지 않도록 해야 합니다. 적대적 표본 Δx 섭동(|Δx|∞≤γ), 연구는 다음과 같이 정의합니다:
(17)
비정상 데이터에 대한 항어 강화 모델의 견고성이 향상되고 오판 위험이 줄어듭니다. 이 공식에서 는 정규화 계수이며, 교차 검증을 통해 결정되었습니다(본 연구에서는 λ1=0.01,λ2=0.05,λ3=0.02). 세 가지 규제 목표와 예측의 정확성 간의 균형을 확보하세요.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
시스템 아키텍처
기관 간 데이터 메쉬 및 의미 계층
기관 간 데이터 이질성을 해결하기 위해 본 연구는 도메인 기반 노드 분할을 통해 데이터 메시 아키텍처를 구축합니다. 각 금융 기관은 소유권과 통제권을 유지하면서 독립적인 데이터 도메인 노드로 운영되며, 의미 계층을 통해 통합된 데이터 이해와 상호작용이 가능합니다. 온톨로지 기반 의미론 계층은 핵심 엔터티, f맵 속성, 엔터티 관계를 정의하는 통합 금융 위험 통제 데이터 모델을 구축합니다. 구체적인 의미 매핑 규칙은 표 5에 자세히 설명되어 있습니다. 기관별 분야에서는 의미 매핑 함수를 통해 표준화된 변환이 이루어집니다:
(18)
| 커널 엔티티 | 기관의 A 분야 명칭 | 기관 내 B 분야 명칭 | 의미 계층 균일 필드 이름 | 데이터 타입 | 표준화된 규칙 |
| 클라이언트 | 프리미엄 고객 평점 (1-5) | VIP 고객 등급 (청동부터 다이아몬드까지) | 고객 신용 등급 (1-5) | 정수 | 브론즈→1, 실버→2, 골드→3, 플래티넘→4, 다이아몬드→5 |
| 사업 | 거래 금액 (만 위안) | 거래 금액 (위안) | 거래 금액 (위안) | 부동 수(floating number) | 기관에서 A 필드의 가치는 10,000배에 달합니다 |
| 학점 신청 | 신청자 쿼터(신용 비율) | 예상 대출 금액 | 신청자 대출 금액 (위안) | 부동 수(floating number) | 기관 A: 총 학점 × 신청 비율; 기관 B: 직접 지도 작성 |
표 5: 금융 위험 통제 분야의 핵심 엔터티 의미 매핑 규칙.
여기서 xi,j 는 기관 j의 i번째 특정 필드 값이며, min(xj)과 max(xj)는 각각 기관 내 필드의 최소값과 최대값입니다. Uj 와 Lj는 의미 계층에서 이 필드의 통합 가치 범위의 상한과 하한을 정의합니다.
블록체인 기반 글로벌 모델 등록 및 감사 추적
연합 학습에서 혼란스러운 모델 버전 관리와 추적 불가능한 훈련 과정을 해결하기 위해 블록체인 기술을 활용해 글로벌 모델 레지스트리 및 감사-추적 시스템을 구축합니다. 컨소시엄 블록체인 아키텍처를 활용한 참여 노드에는 금융 기관, 연합 조정자, 규제 기관이 포함되어 데이터 불변성과 다당자 합의를보장합니다. 글로벌 모델 레지스트리는 버전 번호, 학습 HV 라운드, 참여 기관 목록, 구조적 매개변수, 성과 지표 등 모델의 핵심 메타데이터를 저장합니다. 이 메타데이터는 머클 트리 구조를 사용하여 저장되며, 각 모델 버전은 고유한 해시 값에 대응합니다:
(19)
여기서 v는 모델 버전 번호, T는 총 훈련 라운드 수, S는 교육에 참여하는 기관들의 집합, IDi는 기관 i의 고유 식별자, θv는 버전 v의 모델 매개변수 벡터, AUCv는 이 모델의 AUC-ROC 값입니다.
연합 특징 공학 파이프라인
안전한 엔티티 정렬 및 스키마 조화
특징 공학은 기관 간 데이터 협업의 핵심 요소로, 데이터 프라이버시를 보장하면서 특징의 효과적인 추출, 정렬 및 집계가 필요합니다. 본 연구는 보안 엔터티 정렬, 스키마 조정, 차등 프라이버시 내장형 거래 그래프 집계를 포괄하는 포괄적인 파이프라인을 설계하여 기관 간 특징 이질성과 프라이버시 유출 위험을 모두 해결합니다24. 기관 간 엔터티 정렬은 기능 협업을 달성하는 데 필수적입니다. 하지만 고객 식별자를 직접 전송하는 것은 개인정보 보호를 위협할 수 있습니다. 따라서 연구는 동형 암호화(HE)와 국소 민감 해싱(LSH) 기술을 결합한 프라이버시 보존 엔터티 정렬 방법을 채택했습니다. 기관들은 SHA-256 해시 함수를 사용하여 예비 식별자를 생성하기 위해 고객 식별자를 사전 처리합니다. 이 식별자들은 이후 암호화 계산을 줄이기 위해 LSH를 통해 동일한 "버킷"에 매핑됩니다. 같은 버킷 내의 식별자들은 파이에 준동형 암호화를 거칩니다. 암호화된 식별자는 연합 조정자에 업로드되며, 코사인 유사성을 사용해 암호화된 식별자들의 유사성을 비교하여 엔터티 정렬을 달성합니다.
(20)
유사도가 미리 설정된 임계값보다 클 경우(본 연구에서는 τ=0.95로 간주됨), 동일한 엔터티임이 확인되며, 기관 간 통합 엔터티 ID가 생성되어 안전한 엔터티 정렬을 달성합니다.
트랜잭션 그래프 임베딩의 차등 사적 집계
금융 거래 데이터는 클라이언트를 노드, 거래를 엣지로 하는 뚜렷한 그래프 구조적 특성을 보입니다. 거래 그래프 임베딩은 클라이언트의 '관련 당사자 거래 패턴'을 효과적으로 포착하여 위험 통제 모델에 중요한 기능을 제공합니다. 그러나 기관 간 Gi=(Vi,E i)ViiEi i,v∈Rd d거래 그래프 임베딩의 직접 집계는 고객의 거래 관련 정보를 유출할 수 있습니다. 따라서 거래 그래프 임베딩의 프라이버시 보존 집계를 달성하기 위해 차별개인정보(DP) 기술이 도입되었습니다. 각 기관은 로컬에서 트랜잭션 그래프를 구성하며, 여기서 는 기관의 클라이언트 노드 집합을, 는 거래 에지(거래 금액과 동일한 엣지 가중치) 집합을 나타냅니다. GraphSAGE 알고리즘은 노드 임베딩(본 연구에서 256차원 임베딩 차원)을 생성하는 데 사용됩니다. 차별적 프라이버시 요구사항을 충족하기 위해 라플라시안 노이즈가 로컬 임베딩에 추가됩니다:
(21)
여기서 ΔG GraphSAGE 알고리즘의 글로벌 민감도(본 연구의 실험 추정 ΔG=0.8)는 기관의 지역 프라이버시 예산에 대해 다음과 같습니다.
(22)
시스템의 전체 프라이버시 예산에 대해 본 연구는 ε총=1.5)를 취합니다. 코디네이터는 가중
평균 전략을 사용하여 각 기관의 노이즈 임베딩을 집계하며, 각 기관의 고객 비율에 따라 가중치를 산출합니다:
(23)
집계된 글로벌 거래
그래프는 임베디드 및 각 기관에 피드백되며, 위험 통제 모델의 핵심 입력 기능으로서 기관 간 거래 상관관계 정보를 유지할 뿐만 아니라 차별적 개인정보 보호를 통해 고객 프라이버시를 보호합니다.
(24)
하이브리드 AI 위험 모델
국소 하위 모델: 단조 제약을 가진 그라디언트 부스트
전통적인 중앙집중식 AI 위험 통제 모델은 기관 간 연합 시나리오에 적응하는 데 어려움을 겪고 있습니다. 본 연구는 "로컬 서브모델 + 글로벌 융합 모델"을 결합한 하이브리드 AI 위험 모델을 개발하여, Gradient Boosting Trees(GBDT)의 높은 해석 가능성과 Transformer의 비독립 동일 분포(NID) 데이터에 대한 적응성을 통합합니다. 연합 환경에서 모델 성능과 설명 가능성의 균형을 맞추기 위해 해석 모듈이 도입되었습니다. 각 기관은 강력한 구조적 데이터 적합 능력과 높은 해석 가능성으로 인해 재무 위험 통제 규제에 필수적인 요구사항을 가진 GBDT 하위 모델을 현지에서 구축합니다. 과적합과 비논리적 결론을 방지하기 위해 GBDT 훈련 중에 단조 제약을 구현하여 고객 소득과 신용 점수와 같은 주요 특징에 대해 단조 증가 또는 감소 패턴을 강제합니다. GBTD가 설정한 첫 번째 트리는 ht(x)이며, 모델 출력은 다음과 같습니다:
(25)
여기서 η 학습률입니다(이 연구는 η=0.1을 사용합니다). 단조 제약은 손실 함수 정규화 xj에 의해 실현된다.
제약 조건 추가:
(26)
여기서 x≺x'는 x의 고유값이 x'의 고유값보다 작다는 것을 나타내며, 최종 손실 함수는 다음과 같습니다:
(27)
여기서 l은 로그 손실 함수로, 이진 위험 통제 yi∈{0,1} 시나리오에서 사용되며, 고객이 채무 불이행하는지 여부를 나타냅니다.
는 트리의 복잡도 정규화 항, λ, γ는 정규화 계수입니다(이 연구는 λ=0.01 γ=0.5 교차검증을 통해 수행되었으며, n은 기관의 지역 샘플 수, T는 트리 수를 의미합니다(이 연구는 T=100을 사용했습니다).
글로벌 퓨전: 비IID 적응을 위한 주의 기반 트랜스포머
기관 간 데이터는 중요한 비IID 분포 특성을 보입니다. 전통적인 FedAvg 알고리즘은 단순히 국소 모델 매개변수를 평균화하는 것으로, 비-IID 데이터에 적응하는 데 어려움을 겪습니다. 이를 해결하기 위해 연구는 국소 하위 모델의 지능형 융합을 위해 주의 pi(x)=σ(Fi(x))σFi(x)ia i 기반 트랜스포머 모델을 도입합니다. 글로벌 퓨전 모델은 각 기관의 국소 하위 모델(기관 GBDT 모델에서 출력되는 시그모이드 함수)의 출력 확률을 입력으로 받습니다. 트랜스포머 아키텍처는 인코더와 주의 계층으로 구성되며, 주의 계층은 서로 다른 기관의 출력에서 주의력 가중치를 계산하여 적응적 가중치를 달성합니다. 주의 가중치는 스케일드 점곱 주의를 사용하여 계산됩니다:
(28)
여기서 q는 쿼리 벡터(전 세계 샘플의 평균 위험 특징에 의해 생성됨),
는 기관 i의 핵심 벡터, dk는 핵심 벡터의 차원(본 연구에서 dk=64), n은 연방에 참여하는 기관 수입니다.
글로벌 모델의 최종 출력 확률은 다음과 같습니다:
(29)
주의 메커니즘을 통해 글로벌 모델은 데이터 품질과 위험 예측이 높은 기관에 더 높은 가중치를 자동으로 부여하고, 비IID 데이터에 대한 적응성을 향상시킬 수 있습니다.
설명 모듈: 연합 트리에 대한 SHAP + 반사실 생성기
금융 위험 통제 모델은 규제 요건을 충족하고 고객의 '알 권리'를 보호하기 위해 해석 가능성을 유지해야 합니다. 이를 해결하기 위해 연구는 연합된 SHAP+ 반사실 생성기를 결합한 해석 가능성 모듈을 개발했습니다. 국소 GBDT 하위 모델의 경우, 연구는 SHAP 값을 사용하여 특징 중요성을 측정하며, Si∈RNi×m은 각 특징이 예측 결과에 기여하는 기여도를 정량화합니다. 연합 시나리오에서는 로컬 SHAP 값을 직접 전송하면 특징 분포 정보가 위험해질 수 있습니다. 따라서 연구는 각 기관이 지역에서 SHAP 값 행렬(특징 수에 대해)을 계산하고, 차등 프라이버시 노이즈를 적용하여 연합 조정자에게 업로드하는 보안 집계 전략을 구현합니다. 코디네이터는 이후 전역 SHAP 값을 계산합니다:
(30)
여기서 Si'는 기관 i의 SHAP 값 행렬이고, wi 는 기관의 표본 크기 비율이다.
고객의 현재 고유벡터 x와 목표 위험 등급 y대상을 입력합니다. 출력은 반사실 xcf 특징 벡터이며, 만족 조건(목표 위험 등급에 해당하는 θ목표 확률 임계값)입니다. 그리고 |xcf-x|2는 최소값(즉, 가장 낮은 조정 비용)입니다. 사실 생성자의 손실 함수는 다음과 같습니다:
(31)
여기서 α,β,γ는 가중 계수입니다(본 연구에서 α=10,β=5,γ=1), LGAN 대립적 손실 함수는 반사실적 특징 벡터의 합리성과 진위성을 보장하기 위해 사용됩니다.
프라이버시 및 보안 계층
가산 비밀 공유를 통한 안전한 집계
연합학습에서 로컬 모델 매개변수의 전송과 집계는 프라이버시 유출의 핵심 연결고리입니다. AdditiveSecretSharing(ASS) 기술은 안전한 집계를 달성하고 코디네이터가 각 조직의 로컬 모델 매개변수를 직접 획득하지 않도록 설계되었습니다. 구체적인 과정은 다음과 같습니다: i) 각 기관은 지역 모델 매개변수를 비밀 주식 θ i,1,θi,2,...,θi,n으로 나누어 , 다음을 만족합니다
. 여기는 참여 기관 수입니다; ii) 기관 i는 지분 θi,k를 기관(k≠i)에 보내고, 자신의 지분 θi,i를 유지합니다; iii) 각 기관 k는 다른 모든 기관에서 보내진 주식 θ1,k,θ 2,k,...,θn,k , 를 모아 자신이 보유한 θk,k 몫과 합산하여 부분 합을 얻습니다; iv) 모든 기관이 Sk 업로드하여 일부를 조정자에게 공유하며, 조정자는 전역 매개변수 집계 결과를
계산합니다. 가법적 비밀 공유를 통해 조정자는 전역 집계 매개변수만 얻을 수 있으며, n-1ttt=⌈n/2⌉ 개별 기관의 지역 매개변수를 추론할 수 없습니다. 여러 기관 간의 공모조차도 다른 기관으로부터 매개변수를 복구할 수 없어 매개변수 전송 중 프라이버시와 보안을 보장할 수 있습니다. 기관 단절로 인한 공유 손실을 해결하기 위해 백업 수단으로 샤미르 비밀 공유 메커니즘이 도입되었습니다. 각 몫은 다시 여러 조각으로 나뉩니다. 어떤 조각이든 수집하면 전체 공유를 복원하여 시스템의 견고성을 높일 수 있습니다.
(ε, δ)-DP 예산 스케줄링 하의 적응형 노이즈 보정
차별적 프라이버시의 핵심 과제는 프라이버시 보호 강도와 모델 성능 사이의 균형에 있습니다. 전통적인 고정 잡음 덧셈 방법은 연합 훈련 중 데이터 분포가 동적으로 변하는 상황에 적응하는 데 어려움을 겪습니다. 본 연구는 (ε,δ)-DP와 프라이버시 예산 스케줄링 전략을 결합한 적응형 노이즈 보정 메커니즘을 설계하여 노이즈 강도의 동적 조정을 달성합니다. 시스템의 총 프라이버시 예산을 다음과 같이 정의합니다 (본 연구는 δtotal=10-5, 개인정보 위험에 대한 GDPR 요구사항을 준수함), 분할 예산 일정 전략 채택, 총 예산은 {ε1,ε 2,...,εT} 교육 주기별로 다음과 같이 배분되며, 만족 여부는 다음과 같습니다:
(32)
각 훈련 라운드마다 노이즈 강도는 지역 데이터의 분포 특성에 따라 동적으로 조정됩니다. t번째 라운드
의 지역 데이터 특징 분산이 있다고 가정할 때, 잡음 조정 계수α i,t를 정의합니다:
(33)
αi,t≥0.8(데이터 분포가 안정적임)일 때, 작은 잡음 강도
를 사용해 ; αi,t<0.8(데이터 분포가 변동)일 때, 잡음 강도를 증가시킵니다. 그 중에는 모델 매개변수의 전역 민감도가 포함되어 있습니다(이 연구는 구배 클리핑을 통해 보장합니다).
통신 효율적인 훈련 프로토콜
비동기식 클라이언트 업데이트와 스테이얼니스 제어
기관 간 연합 학습은 높은 통신 지연과 상당한 대역폭 소비(특히 네트워크 자원이 제한된 중소 금융 기관의 경우)와 같은 도전에 직면해 있습니다. 본 연구는 비동기 클라이언트 업데이트, 그라디언트 압축, 오류 피드백을 포함하는 효율적인 통신 훈련 프로토콜을 설계하여 통신 비용을 줄이고 시스템 확장성을 향상시키는25. FedAvg와 같은 전통적인 동기식 연합 훈련 방법은 모든 클라이언트가 로컬 학습을 완료한 후 매개변수 집계를 기다려야 하므로 긴 학습 주기가 발생합니다. 비동기 클라이언트 업데이트 메커니즘은 클라이언트가 독립적으로 로컬 훈련을 완료하고 즉시 매개변수를 업로드할 수 있게 합니다. 이 매개변수를 받으면 연합 조정자는 다른 클라이언트를 기다리지 않고 실시간으로 글로벌 모델을 업데이트합니다. 이는 비동기 훈련에서 모델 낡은 문제를 해결합니다. 스테이일니스 제어 전략을 소개하며, 클라이언트의 스테이일니스 값을 정의합니다. (t가 현재 글로벌 학습 라운드를현재 이루고, tlast_update 클라이언트가 마지막으로 글로벌 모델을 얻은 라운드입니다). (Smax가 최대 허용 경멸 상태일 때, 이 연구는 smax=5를 취합니다). 내담자는 정상적으로 훈련에 참여합니다; 최대> 시점에서는 클라이언트가 로컬 학습 전에 최신 글로벌 모델을 다시 다운로드해야 합니다. 하드웨어 구성은 인텔 제온 E5-2678 v3 CPU(12코어, 2.5GHz)와 NVIDIA Tesla V100 GPU(16GB VRAM), 노드당 64GB DDR4 메모리를 조합하여 분산 학습 작업을 효율적으로 처리합니다. 소프트웨어 초기화를 위해 PySyft의 명령어인 hook = sy가 있습니다. TorchHook(torch)andvirtual_worker = sy. VirtualWorker(hook, id="client1")는 안전한 연합 연결을 구축하는 데 사용되며, federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32)는 참가자 간 연합 데이터 로드를 가능하게 합니다. 의미 매핑은 기관 간 금융 기능을 변환합니다. 예를 들어, 동적 환율 공식을 사용해 USD에서 CNY로 거래 금액을 변환합니다: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0.001 randn()), 환율은 API를 통해 주기적으로 업데이트됩니다. 불균형 데이터셋을 보완하기 위해 CopulaGAN은 sdv.tabular import CopulaGAN과 같은 코드 스니펫으로 합성 적대적 샘플을 생성합니다; 신디사이저 = CopulaGAN(epochs=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000)으로, 원본 데이터의 통계적 특성을 보존합니다. 국소 GBDT 훈련은 단조적 제약 조건을 강제합니다(예: "credit_score"이 "approval_probability"와 양의 상관관계를 갖도록 하는 것). LightGBM에서는 viaparams = {"monotonic_constraints": (1, 0, -1)}이며, Transformer fusion은 PyTorch에서 다중 헤드 주의 계층으로 구현됩니다: self.attention = nn. 멀티헤드어텐션 (embed_dim=64, num_heads=4); attn_output, _ = self.attention(query, key, value, key_padding_mask=padding_mask), 그 다음에는 안정성을 위한 레이어 정규화와 잔류 연결이 이어집니다. 차분 프라이버시는 L1 민감도(Δf)와 프라이버시 예산(ε)에 맞춰 스케일링된 라플라스 노이즈를 주입합니다. 예를 들어, np.random.laplace(loc=0, scale=Δf/ε ε)에서 샘플링한 노이즈를 집계 전에 그라디언트에 추가합니다. 공정성 제약은 학습 후 그룹 유병률에 반비례하는 가중치(sample_weight = 1 / group_counts[y_train])로 적용되어 인구통계학적 패리티 위반을 완화합니다. 동시에, 가중 집계 전략을 사용하여 고객 매개변수의 가중치를 상충성 값에 따라 조정합니다:
(34)
여기서 λ=0.1은 부패 벌칙 계수이며; 오래된 상태가 클수록 가중치가 작아져 오래된 매개변수가 글로벌 모델에 미치는 영향을 줄입니다.
구배 압축과 오류 피드백 누적
모델 매개변수(특히 트랜스포머 글로벌 융합 모델의 주의 가중치)는 높은 차원 복잡도를 가집니다. 직접 전송은 과도한 대역폭을 소모하여 데이터 전송을 줄이기 위해 그라디언트 압축 기법이 필요하다26. 본 연구는 Top-K 희소화와 양자화 압축을 통합하며, 다음과 같은 구체적인 단계를 따릅니다: i) Top-K 희소화: 국소 모델 ∇θi 기울기의 경우, 가장 큰 절대값 K를 가진 그라데이언트 요소 K%를 선택하여 유지합니다. 나머지 요소들은 0입니다. 값은 대역폭 조건에 따라 동적으로 조정됩니다(대역폭이 충분할 때 K=30, 대역폭이 제한될 때 K=10); ii) 양자화 압축: 유지된 그라디언트 요소는 32비트 부동소수점에서 8비트 정수로 양자화됩니다. 양자화 공식은 다음과 같습니다:
(35)
iii) 오류 피드백: 폐기된 구배 Δ∇=∇θi-∇θ i를 클라이언트 측압축 오류로 저장합니다. 다음 기울기 계산에서는 오류를 새로운 기울기, 접근
법, , 로 누적하여 압축 손실을 보상합니다. 그라데이션 압축과 오차 피드백의 효과는 표 6, In, 8 K=20% -비트 양자화 조건에 나타난다. 압축 비율은 15:1(원본 데이터 볼륨/압축 데이터 볼륨)에 도달하며, 오류 피드백을 통해 모델의 AUC-ROC는 0.5%-1.0% 감소만 이루어져 통신 비용과 모델 성능 간의 균형을 실현한다27.
| 압축 전략 | 감축비 | 업로드 대역폭 소비량 (MB/라운드) | AUC-ROC 감소율 | 훈련 시간 감소율 |
| 비압축 (32비트 부동소수점) | 1:01 | 128 | 0.00% | 0.00% |
| 상위 30% 희소+16비트 양자화 | 6.7:1 | 19.1 | 0.30% | 35.20% |
| 상위 20% 희소 + 8비트 양자화 | 15:01 | 8.5 | 0.80% | 58.70% |
| 상위 10% 희소 + 8비트 양자화 | 30:01:00 | 4.3 | 2.10% | 72.10% |
표 6: 경사 압축 전략의 성능 비교.
공정성 인식 정규화
금융 위험 관리 모델은 특정 집단에 대한 차별을 피하고 개인정보보호법(Personal Information Protection Law)과 공정신용보고법(Fair Credit Reporting Act)을 포함한 규제 요건을 준수해야 합니다. 본 연구는 모델 학습 중 그룹 간 예측 편향을 제한하기 위한 공정성 인식 정규화 메커니즘을 도입하여 모델 공정성을 보장합니다. 두 가지 핵심 공정성 지표가 정의됩니다: i) 인구통계학적 평등성(DP): 긍정적 예측률이 서로 다른 그룹별로 동일하다는 접근
법, 중 g는 집단 식별자입니다; ii) 평등한 기회(EO): 진정한 양성률이 그룹 간 동일함, 접근
법. 하이브리드 AI 위험 모델의 손실 함수에 공정성 정규화 항을 추가하고, 각각 국소 GBDT 서브모델과 전역 트랜스포머 모델에 제약을 가합니다: iii) 국소 모델 공정성 제약:

여기서 PR(g=A)은 군 g, λ에 대한 양의 예측률이고, 공정성을 위한 정규화 계수이다.
iv) 전역 모델 공정성 제약: 그룹 공정성 가중치 조정을 트랜스포머 주의 계층에 추가하면, 취약 그룹 ag=a기본 모델×(1+β⋅Δ불공정)에 더 높은 주의 가중치가 부여됩니다. 여기서 Δ불공정 은 이 그룹과 지배 그룹 간의 공정성 편향을 나타냅니다(Δ불공정=PR(지배 그룹)-PR(취약한 그룹)); λEO는 편차 보상 계수이다. 공정성 지각 정규화의 효과는 ΔDP(DP 편차), ΔEO(EO 편차), 그리고 그룹 보정 오차로 평가됩니다.
모델 거버넌스 및 컴플라이언스 대시보드
실시간 바이어스 모니터링
모델 수명주기 관리에 대한 금융 규제 요구사항을 충족하기 위해, 연구는 실시간 편차 모니터링과 규제 보고 API를 통합한 모델 거버넌스 및 컴플라이언스 대시보드를 개발하여, 모델 훈련, 배포, 반복 전반에 걸쳐 전체 프로세스 감독과 추적성을 가능하게 합니다. 실시간 편차 모니터링 모듈은 다음 차원을 통해 모델 공정성과 성능을 동적으로 추적합니다: i) 그룹 편차 모니터링: 고객 성별, 연령, 지역, 소득 수준 등으로 그룹을 분류하고, 각 그룹별로 시간별 PR, TPR, FPR(오탐성률)을 계산합니다. 그룹 간 PR 차이가 0.08을 초과하거나 TPR 차이가 0.05를 초과할 때 편차 경보가 발동됩니다; ii) 성능 드리프트 모니터링: AUC-ROC 및 PR-AUC와 같은 지표를 연속적으로 계산합니다. 이 지표들이 3시간 동안 연속으로 2% 이상 감소하면 성능 드리프트로 판단되어 자동으로 모델 재학습 과정을 시작합니다. iii) 프라이버시 준수 모니터링: 각 교육 라운드의 프라이버시 예산 소비 및 소음 증가량ε총 강도/10 강도를 기록합니다. 한 발의 ε 소비량이 초과되면 훈련을 일시 중지하고 소음 전략을 조정하세요. iv) 모니터링 데이터는 시각적 대시보드를 통해 표시되어, 규제 당국과 참여 기관이 실시간으로 데이터를 확인할 수 있고, 모델 위험의 투명한 관리가 실현됩니다.
규제 보고 API
규제 보고 과정을 단순화하기 위해, GDPR, CCPA, 중국 개인정보보호법과 같은 규정을 준수하는 보고서를 자동으로 생성할 수 있도록 표준화된 규제 보고 API가 설계되었습니다. 핵심 기능은 다음과 같습니다: i) 데이터 소스 준수 보고서: 참여 기관의 데이터 유형, 볼륨, 승인 상태를 자동으로 집계하여 "최소 필요" 원칙 준수를 검증합니다; ii) 모델 교육 준수 보고서: 교육 반복, 참여 기관, 개인정보 보호 조치 및 공정성 지표를 기록하여 모델 교육 추적성 보고서를 생성합니다; iii) 위험 예측 준수 보고서: 다양한 그룹 및 반사실 설명 사례에 걸친 모델 예측의 규제 준수 분포 패턴을 보여주어 차별이 없음을 입증합니다. API는 RESTful 디자인 스타일을 채택하여 JSON 및 XML 형식 출력을 지원합니다. 규제 당국은 API 인터페이스를 통해 보고 데이터에 직접 접근하거나 자동 보고 사이클을 설정하여 자동화되고 표준화된 규제 프로세스를 달성할 수 있습니다. 보고서 템플릿은 국제표준화기구(ISO)의 재무 모델 규제 기준을 준수하여 보고서의 권위와 보편성을 보장합니다.
실험 설계: 데이터셋 설명
다기관 신용카드 및 중소기업 대출 데이터
실험 데이터는 중국 내 금융기관에서 제공되었으며, 개인 신용카드 거래, 중소기업 대출 신청 및 이행 기록과 같은 데이터 유형을 포함합니다. CopulaGAN 기술은 희귀 사기 사건을 합성하고 강화하는 데 사용되었으며, 이를 통해 진위성과 무결성을 결합한 실험적 데이터셋을 구축했습니다. 실험에서 사용된 실제 데이터는 개인 신용카드 거래 데이터와 중소기업 대출 데이터로 두 가지 주요 범주로 나뉘며, 2022년 1월부터 2023년 12월까지 총 500만 건이 넘는 기록을 포함합니다. 데이터는 북중국, 동중국, 남중국, 남서부 등 네 개의 주요 경제 지역을 포함하여 지리적 대표성과 표본 분포의 다양성을 보장합니다. 기관 데이터의 핵심 분야와 통계적 특성은 표 7에 나와 있습니다. 그중 기관 A와 B는 모든 연령대에 걸친 대규모 고객 기반을 가진 전국 상업은행입니다; 기관 C와 D는 주로 젊은 연령층(20-35세)을 대상으로 하는 인터넷 은행입니다; Institution E는 하위 계층 시장 사용자를 대상으로 하는 소비자 금융 회사로, 데이터 배포가 상당한 비-IID 특성을 보입니다. 데이터셋에는 115,610개의 데이터가 포함되어 있습니다. 이 데이터셋은 대학과 협력하는 금융 기관에서 제공합니다
| 데이터 타입 | 기관 | 기록 수 (10,000개) | 고객 수 (10,000명) | 핵심 분야 | 연체 사기율 | 데이터 분배 특성 |
| 신용카드 거래 | A | 180 | 85 | 거래 시간, 금액, 가맹점 유형, 거래 위치, 카드 도난 여부 | 0.32% | 대규모 거래가 높은 비중을 차지합니다(> 5,000위안 정도) |
| 신용카드 거래 | B | 150 | 72 | 거래 흐름 번호, 금액(USD/RMB), 결제 채널, 고객 평가 | 0.28% | 국경 간 거래가 15%를 차지합니다 |
| 신용카드 거래 | C | 120 | 68 | 거래 타임스탬프, 금액, 설치 여부, 고객 연령, 휴대폰 번호 위치 | 0.45% | 소규모 고빈도 거래(<1000위안, 60%)가 차지합니다 |
| 소규모 및 마이크로 비즈니스 대출 | D | 32 | 1.2 | 회사명, 대출 금액, 신용 기간, 수익 규모, 세금 금액, 연체 여부 | 2.80% | 제조업 고객은 40%를 차지합니다 |
| 소규모 및 마이크로 비즈니스 대출 | E | 18 | 0.8 | 대출 신청일, 예상 금액, 사업 유형, 직원 수, 과거 성과 기록 | 3.50% | 서비스 고객은 70%를 차지합니다 |
표 7: 다기관 실질 금융 데이터 세트의 통계적 특성.
기관 간 데이터의 이질성을 해결하기 위해, 실험은 기관 필드를 표준화하여 데이터 그리드와 의미층 명세를 엄격히 준수했습니다: 예를 들어, 기관 B의 "거래 금액(USD)"을 거래일의 환율을 이용해 위안화로 변환하고 필드 이름을 "거래 금액 (위안)"으로 통합하는 것; 기관 C의 "고객 연령"(형식 "1990-01-01")을 정수 연령으로 변환하는 것; 그리고 Institution D의 "기업 수익 척도"("100만 미만 / 1-500만 / 500만 이상 등급")를 수치 범위의 중간 지점(5억 5억, 3억, 750만 만)까지 매핑하여 데이터 형식과 의미 의미 간의 일관성을 보장합니다.
희귀 사기 사건을 위한 CopulaGAN 을 통한 합성 증강
금융 위험 통제 시나리오에서는 사기/채무 불이행 샘플이 일반적으로 매우 낮은 비율을 차지합니다. 이렇게 작은 샘플 크기를 직접 사용해 모델 학습을 하면 심각한 클래스 불균형 문제가 발생하여 모델의 일반화 능력이 저해됩니다. 이 실험은 Copula GAN(코풀라 함수 기반의 생성적 대립 네트워크)을 사용하여 희귀 사기 사례에 대한 증강 데이터를 합성합니다. 이 방법은 Copula 함수의 고차원 데이터 분포 모델링 능력과 GAN의 생성 기능을 결합하여, 실제 사기 패턴과 일치하는 합성 데이터를 생성하면서도 전통적인 GAN 생성에서 흔히 관찰되는 '패턴 붕괴' 문제를 피할 수 있게 합니다.
CopulaGAN 모델 구조
CopulaGAN은 세 부분으로 구성됩니다: 생성자, 판별기, 그리고 Copula 분포 제약 모듈: (1) 생성자: 입력은 128차원 무작위 잡음 벡터 z∼N(0,1)이며, 출력은 3층 완전 연결 네트워크를 통해 진짜 샘플 차원과 일치하는 합성 특징 벡터(숨겨진 층 차원은 256, 512, 256)를 통해 이루어집니다; (2) 판별기: 입력은 실제 샘플 또는 합성 샘플 xsyn이며, 2층 완전 연결 네트워크+Sigmoid 활성화 함수를 통해 샘플이 실제 데이터일 확률을 출력합니다; (3) 코퓰라 분포 제약 모듈: 실제 사기 샘플의 공동 분포를 가우시안 코풀라 함수(여기서 는 i의 8번째 특징의 엣지 분포 함수 값)를 통해 적합하고, 생성기 손실에 코퓰라 거리 제약 조건을 추가하여 합성 샘플의 공동 분포가 실제 샘플과 일치하도록 한다.
(36)
프로세스 및 효과 검증 강화
CopulaGAN의 교육 및 강화 과정은 다음과 같습니다: i) 데이터 전처리: 다양한 기관의 실제 데이터에서 사기/디폴트 샘플(총 18,200개)을 추출; 연속 특징을 표준화한다 (x'=(x-μ)/σ); 이산 특징은 고유한 열로 코딩되며; ii) 코퓰라 적합: 가우시안 코퓰라 함수는 사전 처리된 사기 샘플의 결합 분포를 적합시키는 데 사용되며, 각 특징의 에지 분포 Fiθ 함수와 코퓰라 함수 매개변수를 계산합니다; iii) GAN 훈련: 생성기와 판별기는 번갈아 학습됩니다. 생성기의 손실 함수는 다음과 같습니다:
(37)
여기서 λ는 제약 가중치이고, Distance(Csyn,C real)는 합성 샘플의 코퓰라 분포와 실제 샘플의 코퓰라 분포 간의 KL 발산이다; 판별자 손실 함수는 표준 이진 교차 엔트로피 손실입니다:
(38)
모델 수렴(판별기 정확도가 50%±5%로 안정된 상태) 발생기는 50,000개의 합성 사기 샘플을 생성했습니다. 이 세트들은 의미론적 명세에 따라 원래 특징 공간으로 매핑되고 실제 샘플과 혼합되어 균형 잡힌 학습 집합을 구성했습니다. 합성 샘플의 효과를 검증하기 위해 연구는 두 표본 KS 검사와 특징 분포 시각화를 사용하여 샘플을 평가하였습니다. KS 테스트 결과는 합성 샘플과 실제 샘플 간 특징 분포 차이가 모두 0.05 미만임을 보여주었으며(KS 통계량 <0.05, p-값>0.05), 분포 일관성이 우수함을 나타냈다. 특징 분포 비교는 합성 샘플이 실제 사기 샘플의 분포 특성을 정확히 재현할 수 있음을 보여주었으며, 그림 1에 나타난 대로 모델 학습에 충분한 유효 데이터를 제공하였습니다.

그림 1: 실제 사기 샘플과 CopulaGAN 간의 특징 분포 비교 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.
평가 지표
이 실험은 예측 성과, 프라이버시 보호, 공정성, 의사소통 효율성의 네 가지 핵심 차원에서 다중 지수 평가 시스템을 구축하여 연합 학습 프레임워크와 AI 위험 통제 모델의 종합적 성능을 포괄적으로 측정합니다. 각 차원의 정의, 계산 방법 및 평가 기준은 표 8에 나와 있습니다.
| 평가 차원 | 색인의 명칭 | 정의 및 계산 방법 | 평가 기준 |
| 예상 성능 | AUC-ROC | 피험자의 특성 작업 곡선 아래 면적은 모델이 긍정적(부이행/사기)과 부정적 예시를 구별하는 능력을 측정합니다 | 가치가 높을수록 좋습니다. 우수한 모델의 AUC-ROC는 >0.9입니다. |
| PR-AUC | 곡선 아래 정밀도 회상 면적은 불균형 데이터에 적용되며, 긍정적인 예시가 드문 상황에서 모델의 성능을 측정합니다 | 가치가 높을수록 좋습니다. 우수한 모델의 PR-AUC는 >0.8입니다 | |
| 브라이어 분율 | 예측 확률과 참 레이블 간의 평균 제곱 오차, B=1Ni=1N(pi-yi)2 | 가치가 낮을수록 좋습니다. 우수한 모델의 브라이어 점수는 0.05 미만입니다 | |
| 거짓 양성률(FPR) | 음의 예시의 비율 FPR=FPFP+TNthat. | 가치가 낮을수록 좋습니다. 재무 상황에서는 보통 FPR <1%가 필요합니다 (좋은 고객을 거절하지 않기 위해) | |
| 프라이버시 보호 | ε-소비 곡선(ε-곡선) | 교육 중 누적된 프라이버시 예산의 소비율을 기록하여 프라이버시 보호의 동적 균형 능력을 반영합니다 | 곡선이 안정되고 있으며 총 ε은 5 이하로 떨어지고 있습니다(GDPR 개인정보 위험 요건에 부합합니다) |
| 회원 추론 공격 AUC (MI-AUC) | 공격자가 모델 예측 결과를 통해 샘플이 훈련 집합에 속하는지 추론할 수 있는 능력과 AUC 값이 0.5에 가까울수록 프라이버시가 더 좋아집니다 | MI-AUC<0.6은 개인정보 보호에 효과적이며, MI-AUC<0.55는 매우 우수합니다 | |
| 특징 누설률(FLR) | 공격자는 피처를 집계하여 원래 데이터 분포의 FLR=1-KL(P∥∥Q)Dmaxrate를 되돌립니다. | FLR <0.1은 개인정보 보호가 효과적임을 나타냅니다(P는 실제 분포인 Dmax, Q는 추론된 분포, 는 최대 KL 거리입니다) | |
| 공정성 | 통계에서의 DP 편향(ΔDP) | 다양한 그룹 간 긍정적 예시의 최대 예측 차이 ΔDP=max∥PRg-PRavg∥% | 공정성과 우수성에 대한 ΔDP<0.05 (그룹 g의 양성률을 위한 PRg) |
| EO 편향 (ΔEO) | 진양성 ΔEO의 최대 차이=최대 ∥TPRg-TPRavg∥ 비율, | GCE <0.02는 잘 보정되어 있습니다(K는 그룹 번호, 는 예측 속도, 는 실제 비율입니다) | |
| 그룹 보정 오차(GCE) | 각 그룹의 예측 확률 GCE=1Kg=1K∥pg-rg∥와 실제 기본값 사이의 평균 편차, | 가치가 낮을수록 좋습니다. 중소기업의 시나리오 요구사항은 <10MB/라운드입니다 | |
| 통신 효율성 | 라운드당 업링크 대역폭 | 각 조직이 코디네이터에게 단일 기간 동안 업로드한 데이터의 총 대역폭 소비 | 가치가 낮을수록 좋습니다. 기관 간 시나리오는 120분 미만으로 소요됩니다 |
| 감축비(CR) | 원본 데이터 볼륨과 압축된 데이터 볼륨의 비율, CR=SizerawSizecomp | 압축비가 높을수록 더 좋습니다. 훌륭한 솔루션 CR>10:1 |
표 8: 실험 평가 지수 시스템.
메트릭 설명: i) 멤버십 추론 공격: 블랙박스 공격 방법론을 사용해 공격자는 대상 모델에서 예측된 확률을 입력하고 샘플 멤버십 상태를 출력하는 이진 분류 모델을 훈련합니다. 프라이버시 유출 위험은 모델의 AUC(즉, MI-AUC)로 측정됩니다. ii) 집단 분류 기준: 공정성 평가에서는 집단을 네 가지 차원으로 분류합니다: 성별(남/여성), 연령(25세 미만/25세-40세/>40세), 지역(1군/신규 1군/2군/자회사), 소득 수준(<5k/5k-15k/15k/>3만 위안/월 30k). 이는 금융 규제 당국이 지목한 민감한 집단에 대한 보장을 보장합니다. iii) 수렴 기준: 모델 훈련 중 검증 세트 AUC-ROC가 3라운드(각 라운드는 10 에포크) 동안 0.001 미만으로 감소하면 훈련이 수렴 및 중단된 것으로 간주됩니다.
기준선
제안된 "연합학습 + 하이브리드 AI 위험 통제 모델"의 우수성을 검증하기 위해, 본 연구는 전통적인 중앙집중식 모델, 고전적 연합학습 모델, 그리고 프라이버시 보존 강화 모델의 다섯 가지 기준 모델을 설정합니다. 각 기준선 모델의 핵심 매개변수와 훈련 전략은 비교 실험의 공정성을 보장하기 위해 표 9 에 자세히 설명되어 있습니다(모든 모델이 동일한 학습 집합, 검증 집합, 하이퍼파라미터 최적화 전략을 사용합니다).
| 모델 종류 | 모델 명칭 | 핵심 아키텍처 | 훈련 모드 | 개인정보 보호 조치 | 주요 하이퍼파라미터 |
| 중앙집중식 모델 | 전통 GBDT | XGBoost 그라디언트 부스트 트리 | 모든 기관은 교육 데이터를 중앙에 저장합니다 | 없어요 | 트리 수 = 100, 학습률 = 0.1, 트리 깊이 = 6, 정규화 계수 λ=1.0 |
| 중앙집중식 모델 | 딥러닝 모델(MLP) | 3층 완전 연결 네트워크(입력 계층 256차원 → 숨겨진 계층 128차원 → 숨겨진 계층 64차원 → 출력 계층 1차원) | 모든 기관은 교육 데이터를 중앙에 저장합니다 | 없어요 | 옵티마이너=아담, 학습률=0.001, 배치 크기 =256, 드롭아웃=0.3 |
| 고전적인 연방 모델 | FedAvg (연방 평균) | 국소 모델은 GBDT 모델이며, 전역 모델은 매개변수 평균 집계를 채택합니다 | 연방 동기화 훈련 | 없어요 | 참여율 = 0.8, 지역 시대 = 5, 집계 라운드 = 50, 학습률 = 0.1 |
| 고전적인 연방 모델 | FedProx (연방 근거리 집계) | 국소 모델은 GBDT이며, 근위 모델도 | 연방 동기화 훈련 | 없어요 | 참여율 = 0.8, 지역 에포크 = 5, 집계 라운드 = 50, 근위 매개변수 μ =0.01 |
| μ=0.01 항 제약은 집계 중에 추가됩니다(). | |||||
| 프라이버시 강화 연맹 | FedAvg+DP (고정 노이즈) | FedAvg에 고정 라플라시안 노이즈를 추가한다 (ε=5, δ=1e-5) | 연방 동기화 훈련 | 고정 차등 프라이버시 | 노이즈 강도=0.1, 참여율=0.8, 지역 에포크=5, 집계 라운드=50 |
| 연구 모델 | FedRisk (연방 위험통제 모델) | 로컬 GDT(단조 제약) + 글로벌 트랜스포머(주의 융합) + DP + 보안 집계 | 연방 비동기식 교육 | 적응형 DP+ 가산 비밀 공유 | 로컬 에포크=5, 집계 라운드=50, 주의 차원=64, 프라이버시 예산ε=5, 압축비=15:1 |
표 9: 기저선 모델과 본 연구 모델 간의 매개변수 비교.
비교 차원 설명: (1) 중앙집중식 vs. 연합: "전통적인 GBDT/MLP"와 "FedAvg/FedProx/FedRisk"를 비교하여 본 연구는 "데이터 오프사이트" 시나리오에서 연합 학습의 성능 저하를 조사합니다. (2) 클래식 vs. 프라이버시 강화 연합 방식: "FedAvg" 대 "FedAvg+DP"를 통해 차등 프라이버시가 모델 성능에 미치는 영향을 평가합니다. (3) 동기식 vs. 비동기식 연합: "FedAvg"(동기식)와 "FedRisk"(비동기식)의 비교는 비동기식 훈련의 통신 효율성 우수성을 보여줍니다. (4) 단순 집계 vs. 지능형 융합: "FedAvg"(파라미터 평균)와 "FedRisk"(주의 융합)의 대조는 Transformer 통합 전략이 비-IID 데이터에 적응할 수 있음을 입증합니다. (5) 무검열 vs. 공정성 검열: "FedAvg"(공정성 제약 없음)와 "FedRisk"(공정성 인지 제약)의 비교는 공정성 메커니즘이 모델 공정성과 성과에 미치는 영향을 검토합니다.
소작술
변화하는 ε이 모델 효용에 미치는 영향
전체 프라이버시 예산 ε를 변수(값 1, 3, 5, 7, 10)로 사용하여 연구는 δ=1e-5를 고정하고 다른 모듈들(주의 융합과 단조 제약 GBDT)은 변경하지 않은 채 프라이버시 보호 강도와 모델 유용성 간의 균형을 평가하였습니다. 실험은 AUC-ROC(모델 효용성)와 MI-AUC(개인정보 위험)를 이중 지표로 측정했으며, 결과는 표 10에 나타났습니다. ε=1일 때 MI-AUC는 0.53(우수한 프라이버시 보호)으로 떨어졌으나, AUC-ROC는 0.821에 그쳤습니다(효용 감소). ε=5에서 AUC-ROC는 0.912(금융 위험 통제 요건 충족)로 반등했고, MI-AUC=0.58(실질적 프라이버시 보호)를 기록했습니다. ε>5 시점에서 AUC-ROC의 개선은 0.01 미만으로 줄었고, MI-AUC는 빠르게 0.63(개인정보 위험 한도를 초과)으로 상승했습니다. 이는 ε=5가 최적 총 프라이버시 예산임을 확인시켜 주며, 프라이버시와 효용성 사이의 균형을 달성합니다.
| 총개인정보 절약 예산ε | 모델 AUC-ROC | MI-AUC(개인정보 보호 위험) | 특징 누설율 FLR | 브라이어 분율 |
| 1 | 0.821 | 0.53 | 0.04 | 0.078 |
| 3 | 0.876 | 0.55 | 0.06 | 0.061 |
| 5 | 0.912 | 0.58 | 0.08 | 0.042 |
| 7 | 0.919 | 0.6 | 0.11 | 0.039 |
| 10 | 0.923 | 0.63 | 0.15 | 0.037 |
표 10: 모델과 다양한 프라이버시 예산 간의 비교 ε.
주의 융합과 단순 평균의 기여
비독립 데이터 시나리오에서 "주의 융합"(제안된 전략)과 "단순 평균화"(FedAvg 전략) 간 성능 차이를 평가하기 위해 두 가지 변수를 실험적으로 구성했습니다: (1) 데이터 비IID 심각도(기관별 기본값률 변동으로 측정, 낮은 변동: 0.2%-0.5%, 높은 변동: 0.2%-3.5%); (2) 융합 전략(주의 융합 vs 단순 평균). 그림 2에서 보듯, 두 전략 간 AUC-ROC 격차는 낮은 비IID 시나리오에서 0.023(0.912 대 0.889)에 불과했습니다. 그러나 이 격차는 고비 IID 시나리오에서 0.076(0.905 대 0.829)까지 벌어졌으며, 단순 평균화 모델은 상당한 과적합을 보였습니다(훈련 세트 AUC-ROC 0.941 대 검증 세트 0.829). 이는 주의 메커니즘이 동적 가중치를 통해 비독립적인 데이터로 인한 성과 저하를 효과적으로 완화할 수 있음을 보여줍니다. 예를 들어, 정확한 기본 예측이 가능한 기관 E에 0.32 가중치를, 편차가 큰 기관 C에 0.12 가중치를 할당하는 식입니다.

그림 2: 다양한 비IID 등급에서의 융합 전략 비교. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.
공정성 규제자가 이익 기반 KPI에 미치는 영향
금융기관의 핵심 요구는 공정성의 제약 하에서 사업 이익을 보장하는 것이므로, 실험에서는 이익 지수인 "위험 조정 자본수익률(RAROC)"을 도입합니다. 공식은 다음과 같습니다:
(39)
예상 손실은 부도일 확률에 고정 부도체 손실률(40% 설정)을 곱한 것으로 계산되며, 경제 자본은 위험 노출에 위험 가중치를 곱한 값으로 결정됩니다(바젤 III 요건에 따라). 공정성 정규화가 포함된 모델과 그렇지 않은 모델의 공정성 지표(ΔDP, ΔEO)와 RAROC를 표 11에 비교합니다. 공정성 정규화를 시행한 후 ΔDP는 0.15에서 0.04로, ΔEO는 0.12에서 0.03으로 떨어졌으며, RAROC는 2.1% 하락(18.3% 대 18.7%)으로, 업계 허용 기준인 5%에 크게 미치지 못했습니다. 이는 우리 연구의 공정성 메커니즘이 규제 차별 금지 요건을 효과적으로 충족하면서도 이익 손실을 통제함을 입증합니다.
| 모델 설정 | ΔDP (그룹 양의 속도 차이) | ΔEO (그룹 TPR 차이) | GCE (그룹 보정 오차) | RAROC (위험 조정 자산수익률) | FPR (거짓 양성률) |
| 공정성 규칙은 없습니다 | 0.15 | 0.12 | 0.035 | 18.70% | 0.95% |
| 공정성과 규칙성이 있습니다 | 0.04 | 0.03 | 0.018 | 18.30% | 1.02% |
표 11: 공정성 정규화가 공정성과 이익 지표에 미치는 영향.
구현 세부사항
실험의 재현성을 보장하기 위해 연구는 기술 스택과 교육 과정의 세부 사항을 명확히 했습니다: (1) 하드웨어 환경: 각 기관 노드는 Intel Xeon Gold 6248 프로세서, 64GB RAM, NVIDIA Tesla V100 GPU를 사용합니다; 연합 조정기는 병렬 컴퓨팅과 효율적인 매개변수 집계를 보장하기 위해 128GB RAM을 탑재한 듀얼 Xeon Gold 6348 프로세서를 사용합니다. (2) 소프트웨어 프레임워크: 연합 학습 프레임워크는 PySyft 0.8.6을 사용하여 개발되었으며, 블록체인 모듈은 Hyperledger Fabric 2.5(합의 메커니즘: Raft)를 사용하고, 모델 학습은 PyTorch 2.0과 XGBoost 2.0.3에 의존하며, 차등 개인정보 보호 모듈은 IBM DP 라이브러리를 통합합니다. (3) 학습 과정: (1) 데이터 전처리(2시간, 의미 정규화 및 CopulaGAN 향상 포함); (2) 국소 훈련(라운드당 5에포크, 코사인 어닐링을 통한 학습 감소); (3) 비동기 집계(조정자가 3개 기관으로부터 매개변수를 받을 때 전 세계 모델 업데이트가 이루어짐); (4) 모델 평가(10라운드 후 산출된 AUC-ROC 및 공정성 지표); (5) 하이퍼파라미터 최적화(최적 매개변수를 50회 반복하는 베이지안 최적화). (4) 강건성 테스트: 시뮬레이션된 기관 단절(1-3라운드 교육을 중단하기 위해 한 기관을 무작위로 선택함) 및 데이터 노이즈(5% 특징값 섭동 추가) 시나리오. 결과는 AUC-ROC 변동이 0.02 미만으로 나타나 시스템의 간섭 방지 능력을 입증했습니다.
이 연구는 초기 학습률 0.05의 코사인 어닐링 스케줄링 전략을 사용했습니다. 학습 속도는 총 100개의 훈련 에포크에 걸쳐 공식에 따라 매 에포크마다 동적으로 업데이트되었습니다. 이 전략은 학습 초기 단계에서 높은 학습률을 유지했는데, 예를 들어 첫 번째 에포크에는 0.05로 유지되어 모델 수렴을 가속화했고, 점차 0에 가까운 0.00025로 감쇠하여 매개변수 미세 조정의 안정성을 높였습니다. 실험 결과는 고정된 학습률과 비교했을 때, 이 전략이 검증 세트 AUC-ROC를 2.3% 개선하고 수렴 속도를 37% 가속시킨다는 것을 보여주었습니다. 데이터 분할은 5개 금융기관의 원시 데이터셋을 기반으로 총 500만 개의 샘플을 기반으로 하며, 기관 간 데이터 격리 원칙을 엄격히 준수했습니다. 각 기관의 지역 데이터는 연대순으로 나뉘어 2022년 1월부터 2023년 6월까지의 데이터(70%)를 학습 세트로, 2023년 7월부터 9월까지의 데이터(15%)를 검증 세트로, 2023년 10월부터 12월까지의 데이터(15%)를 테스트 세트로 선택했습니다. 이 분할은 훈련, 검증, 테스트 세트의 시간적 윈도우 독립성을 보장하여 실제 상황에서 시간적 위험 패턴의 진화를 효과적으로 시뮬레이션했습니다. 주요 하이퍼파라미터는 베이지안 최적화를 통해 결정되었습니다. 초기 학습률 0.01에서 0.1 사이, GBDT 트리 번호 50에서 200 사이, 그리고 {2, 4, 8}, 50 반복 세트의 트랜스포머 주의 헤드를 포함하는 공동 탐색 공간 내에서 검증 집합 AUC-ROC를 최대화하는 것을 목표로 실행되었습니다. 최종 최적 조합은 초기 학습률 0.05, 120개의 GBDT 트리, 4개의 주의 헤드로 확인되었습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
예측 성과: 비IID 시나리오에서 중앙집중식 모델 수준에 접근하기
비IID 데이터가 매우 높은 실제 상황(기관별 부도율 변동 0.2%-3.5%)에서 FedRisk는 표 12에서 보듯이 뛰어난 위험 차별화 능력을 보여줍니다. AUC-ROC는 0.912, PR-AUC는 0.823, 브라이어 점수는 0.042, 거짓 양성률(FPR)은 1.02%입니다. 이 지표들은 금융 위험 통제의 핵심 요건인 낮은 허위 거부와 높은 정밀도(FPR<1.5%, AUC-ROC>0.9)를 충족할 뿐만 아니라, 고전 연합 모델 FedAvg(AUC-ROC 0.839) 대비 7.3% 개선, 프라이버시 강화 모델 FedAvg+DP(AUC-ROC 0.812) 대비 10% 향상을 보입니다. 이 성능 이점은 두 가지 핵심 설계에서 비롯됩니다: 첫째, GBDT 로컬 서브모델의 단조 제약으로, "고객 소...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
동적 하이퍼파라미터 튜닝 전략, 특히 코사인 어닐링 학습률 스케줄러는 수렴 속도와 모델 안정성의 균형을 맞추는 데 필수적임이 입증되었습니다. 100 에포흐에 걸쳐 학습률을 0.05에서 0.00025로 감소시킴으로써, 이 접근법은 초기 단계 수렴을 가속화하는 동시에 후기 단계 변동성 감소 훈련 시간을 37% 최소화하고, 고정 속도 일정에 비해 AUC-ROC의 검증 속도를 2.3% 향상시켰습니다. 또한 차등 프라이버시에서 적응형 잡음 보정이 매우 중요했는데, 분산 인식 라플라스 잡음(척도=Δf/ε, Δf=1.2, ε=0.5)이 기관 데이터 변동에 동적으로 조정되었습니다. 특징 분산이 0.15를 초과할 때는 노이즈 강도가 100% 증가하여 분포 이동 시 개인정보 유출을 방지하고 AUC-ROC 저하를 < 0.8%로 제한했습니다. 이러한 조치들은 회원 추론 공격 AUC 0.58에서 입증하듯이, 유용성을 해치지 않으면서 GDPR 준수 프라이버시(ε=5)를 보장했습니다.
<...액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 공개할 것이 없습니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 노트북 컴퓨터 | 델 테크놀로지스 | 해당 없음 | 데이터 처리 및 문서화에 사용됩니다 |
| 통계 소프트웨어(SPSS) | IBM 주식회사 | 버전 26.0 | 통계 분석에 사용됨 |
| 마이크로소프트 엑셀 | 마이크로소프트 | 오피스 365 | 데이터 입력 및 기본 데이터 처리 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청