$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Архитектура системы
Межинституциональная сетка данных и семантический слой
Для решения межинституциональной гетерогенности данных исследование строит архитектуру Data Mesh с помощью доменно-ориентированного разделения узлов. Каждое финансовое учреждение функционирует как независимый узел домена данных, сохраняя при этом права собственности и контроля, при этом семантический уровень обеспечивает единое понимание и взаимодействие с данными. Семантический слой на основе онтологий устанавливает единую модель данных по контролю финансовых рисков, определяя основные сущности,атрибуты f-карты и отношения между сущностями. Конкретные правила семантического отображения изложены в таблице 5. Для специализированных областей стандартизированные преобразования достигаются с помощью функций семантического отображения:
(18)
| Сущность ядра | Название учреждения в области A | Название поля B в учреждении | Имя поля семантического слоя униформы | Тип данных | Стандартизированные правила |
| Клиент | Премиальный рейтинг клиентов (1-5) | Уровни VIP-клиентов (от бронзового до алмазного) | Кредитный рейтинг клиентов (1-5) | Целое число | Бронза→1, Серебро→2, Золото→3, Платина→4, Бриллиант→5 |
| Бизнес | Сумма сделки (десять тысяч юаней) | Сумма транзакции (юань) | Сумма транзакции (юань) | Плавающее число | Стоимость поля A в учреждении составляет 10 000 раз больше |
| Заявка на кредит | Квота заявителей (кредитный коэффициент) | Ожидаемая сумма кредита | Сумма кредита заявителя (юань) | Плавающее число | Учреждение A: Общее отношение кредитов × суммы заявки; Учреждение B: прямое картографирование |
Таблица 5: Правила семантического отображения основных сущностей в области контроля финансовых рисков.
Здесь xi,j — i-е удельное значение поля учреждения j, min(xj) и max(xj) — минимальные и максимальные значения поля внутри учреждения соответственно, Uj иL j определяют верхний и нижний пределы унифицированного диапазона значений для этого поля на семантическом слое.
Глобальный реестр моделей на основе блокчейна и аудитский след
Для решения проблем хаотичного управления версиями моделей и неотслеживаемых процессов обучения в федеративном обучении используется технология блокчейн для создания глобального реестра моделей и системы аудита — трассировки. Используя архитектуру блокчейн-консорциума, участвующие узлы включают финансовые учреждения, федеративных координаторов и регулирующие органы, обеспечивая неизменность данных и многопартийный консенсус23. Глобальный реестр моделей хранит основные метаданные моделей, включая номера версий, обучающие раундыH v, списки участвующих учреждений, структурные параметры и показатели эффективности. Эти метаданные хранятся с использованием структуры дерева Меркла, при этом каждая версия модели соответствует уникальному хеш-значению:
(19)
Здесь v — номер версии модели, T — общее количество обучающих раундов, S — совокупность учреждений, участвующих в обучении, IDi — уникальный идентификатор учреждения i, θv — вектор параметров модели для версии v, а AUCv — значение AUC-ROC этой версии модели.
Конвейер федеративного инжиниринга признаков
Безопасное выравнивание сущностей и гармонизация схем
Инженерия функций является основным компонентом межинституционального сотрудничества с данными, требуя эффективного извлечения, согласования и агрегирования функций при обеспечении конфиденциальности данных. Это исследование разрабатывает комплексный конвейер, включающий защищённое согласование сущности, координацию схем и агрегацию графов транзакций с дифференциальной конфиденциальностью, чтобы решить как межинституциональную гетерогенность, так и риски утечкиконфиденциальности 24. Межинституциональное согласование является необходимым для достижения сотрудничества по функциям. Однако прямая передача идентификаторов клиентов нарушает конфиденциальность. Поэтому исследование использует метод выравнивания сущностей, сохраняющий конфиденциальность, сочетающий гомоморфное шифрование (HE) с технологией локально чувствительного хеширования (LSH). Учреждения предварительно обрабатывают идентификаторы клиентов с помощью хеш-функций SHA-256 для генерации предварительных идентификаторов. Эти идентификаторы затем отображаются в одном «ведре» через LSH для снижения последующих вычислений шифрования. Идентификаторы внутри одного кота проходят гомоморфное шифрование Пайе. Зашифрованные идентификаторы загружаются в федеративного координатора, который достигает выравнивания сущностей путём сравнения сходства зашифрованных идентификаторов с помощью косинусоидального сходства.
(20)
Когда сходство превышает заранее установленный порог (в данном исследовании оно принимается как τ=0,95), определяется, что это одна и та же сущность, и генерируется единый идентификатор сущности между учреждениями для обеспечения безопасного выравнивания сущности.
Дифференциально частная агрегация вложенных графов транзакций
Данные финансовых операций демонстрируют характерные графово-структурированные характеристики (клиенты выступают узлами, а транзакции — рёбрами). Встраивание в граф транзакций эффективно фиксирует паттерны транзакций связанных клиентов, предоставляя критически важные функции для моделей контроля рисков. Однако прямая агрегация межинституциональных графов транзакций Gi=(V i,E i)ViiEie i,v∈r dd транзакционных графов может раскрыть информацию, связанную с транзакциями клиентов. Поэтому внедрена технология DifferentialPrivacy (DP) для достижения сохранения конфиденциальности агрегации вложений в графы транзакций. Каждое учреждение локально строит граф транзакций, где представлен набор клиентских узлов для учреждения и представляет набор рёбер транзакций (веса ребер, равные суммам транзакций). Алгоритм GraphSAGE используется для генерации вложений узлов (с 256-мерными измерениями вложения в данном исследовании). Для соответствия требованиям по дифференциальной конфиденциальности к локальным встраиваниям добавляется шум лапласа:
(21)
Здесь ΔG глобальная чувствительность алгоритма GraphSAGE (оценена экспериментом в данном исследовании ΔG=0,8), для локального бюджета конфиденциальности агентства,
(22)
Для общего бюджета конфиденциальности системы в этом исследованииε всего=1,5). Координатор агрегирует шумовые вложения в каждое учреждение, используя стратегию
взвешенного среднего, с весами, основанными на проценте клиентов каждого учреждения:
(23)
Агрегированный глобальный граф транзакций
встроен и передаётся обратно каждому учреждению. Как ключевая функция модели контроля рисков, он не только сохраняет информацию о корреляции транзакций между учреждениями, но и защищает конфиденциальность клиентов через дифференциальную конфиденциальность.
(24)
Гибридная модель риска ИИ
Локальные подмодели: градиентное усиление с монотонными ограничениями
Традиционные централизованные модели контроля рисков ИИ испытывают трудности с адаптацией к межинституциональным федеративным сценариям. В данном исследовании разрабатывается гибридная модель риска ИИ, объединяющая «локальные подмодели + глобальная модель синтеза», интегрируя высокую интерпретируемость градиентных бустерных деревьев (GBDT) с адаптивностью Transformer к ненезависимым и идентично распределённым (NID) данным. Вводится модуль интерпретации для баланса между производительностью и объяснимостью модели в федеративных средах. Каждое учреждение локально разрабатывает подмодели GBDT, выбираемые за их сильную структурную подгонку данных и высокую интерпретируемость — необходимые требования для регулирования финансового контроля рисков. Чтобы избежать перенагонов и нелогичных выводов, во время обучения GBDT вводятся монотонные ограничения, обеспечивая монотонное увеличение или уменьшение закономерностей для ключевых показателей, таких как доход клиентов и кредитные рейтинги. Первое дерево, заданное GBTD, — это ht(x), а выход модели выглядит следующим образом:
(25)
Здесь η — скорость обучения (в этом исследовании η=0,1). Монотонное ограничение реализуется регулярированием функции потерь xj.
Добавьте термин ограничения:
(26)
Здесь x≺x' означает, что собственное значение x меньше собственного значения x', а конечная функция потерь выглядит:
(27)
Здесь l — логарифмическая функция потерь (используемая в сценарии бинарного контроля риска yi∈{0,1}, указывающая на дефолт клиента).
— это член регуляризации сложности для дерева, λ и γ — коэффициент регуляризации (Это исследование проводилось с помощью λ=0,01 γ=0,5 кросс-валидации,n i — количество локальных выборок для учреждения i, T — количество деревьев (в этом исследовании было T=100).
Глобальный синтез: Трансформер на основе внимания для адаптации Non-IID
Межинституциональные данные демонстрируют значительные характеристики распределения Non-IID. Традиционные алгоритмы FedAvg, которые просто усредняют параметры локальной модели, испытывают трудности с адаптацией к данным Non-IID. Для решения этой проблемы в исследовании введена модель трансформера attentionp i(x)=σ(Fi(x))σFi(x)ia i-основанная на i-образе для интеллектуального слияния локальных подмоделей. Глобальная модель слияния принимает на вход выходные вероятности из локальной подмодели каждого учреждения (выходы сигмоидной функции из институциональных моделей GBDT). Архитектура Transformer состоит из энкодера и слоя внимания, где уровень внимания рассчитывает веса внимания из выходных данных разных учреждений для достижения адаптивного взвешивания. Веса внимания рассчитываются с помощью масштабированного точечного произведения внимания:
(28)
Здесь q — вектор запроса (порождённый средними признаками риска глобальных выборок),
— ключевой вектор учреждения i,d k — размерность ключевого вектора (в этом исследовании dk=64), n — количество агентств, участвующих в федерации.
Итоговая вероятность выхода глобальной модели составляет:
(29)
Благодаря механизму внимания глобальная модель может автоматически присваивать больший вес учреждениям с высоким качеством данных и точным прогнозированием рисков, а также повышать адаптивность к данным Non-IID.
Модуль объяснимости: SHAP на федеративных деревьях + генератор контрфактов
Модели контроля финансовых рисков должны сохранять интерпретируемость для удовлетворения нормативных требований и защиты права клиентов знать. Для решения этой задачи исследование разрабатывает модуль интерпретируемости, объединяющий федеративные генераторы контрфактов SHAP+. Для локальных подмоделей GBDT исследование использует значения SHAP для измерения важности признаков, которые Si∈R Ni×mm количественно оценивают вклад каждого признака в результаты прогнозирования. В федеративных сценариях прямая передача локальных значений SHAP может скомпрометировать информацию о распределении признаков. Поэтому исследование реализует стратегию безопасной агрегации, при которой каждое учреждение локально вычисляет матрицу значений SHAP (для количества признаков), применяет дифференциальный шум конфиденциальности к значениям SHAP и загружает их в федеративного координатора. Затем координатор вычисляет глобальные значения SHAP:
(30)
Здесь Si' — это матрица значений SHAP учреждения i, а wi — доля размера выборки учреждений.
Вводим текущий собственный вектор клиента x и целевой рейтинг риска y, Вывод — это антифактический вектор признаков xcf, удовлетворённый (порогвероятности целевой цели соответствующий рейтингу риска цели). и |xcf-x|2 — минимум (то есть минимальная стоимость корректировки). Функция потерь генератора фактов выглядит следующим образом:
(31)
Здесь α,β,γ — коэффициенты веса (в данном исследовании α=10,β=5,γ=1),L GAN Функция состязательных потерь используется для GAN для обеспечения рациональности и подлинности контрфактического вектора признаков.
Уровень конфиденциальности и безопасности
Безопасная агрегация с помощью аддитивного совместного использования секретов
В федеративном обучении передача и агрегирование локальных параметров модели являются ключевым звеном в утечках конфиденциальности. Технология AdditiveSecretSharing (ASS) применяется для обеспечения безопасной агрегации и предотвращения прямого приобретения локальных параметров каждой организации координатором. Конкретный процесс выглядит следующим образом: i) Каждое учреждение разделяет локальные параметры модели на секретные акции θi, 1, θi, 2,...,θi,n, удовлетворяющее
, Вот количество участвующих учреждений; ii) Учреждение i отправляет долю θi,k в учреждение (k≠i), сохраняет свою долю θi,i; iii) Каждое учреждение k собирает акции, отправленные всеми другими учреждениями θ1,k,θ 2,k,...,θn,k, и суммирует их с долей θk,k, сохранившейся у него, получает частную сумму; iv) Все учреждения загрузят и передают часть информации координатору, координатор вычисляет результаты
агрегации глобальных параметров. С помощью аддитивного обмена секретами координатор может получить только глобальные агрегированные параметры и не может вывести n-1ttt=⌈n/2⌉ не вывести локальные параметры какого-либо отдельного учреждения. Даже сговор между несколькими учреждениями не может восстановить параметры от других, обеспечивая конфиденциальность и безопасность во время передачи параметров. Для устранения потери акций, вызванных институциональными разрывами, в качестве резервного варианта вводится механизм обмена секретами Шамира. Каждая доля дополнительно делится на фрагменты. Собирая любой фрагмент, можно восстановить полную долю, что повышает устойчивость системы.
Адаптивная калибровка шума в рамках ( ε, δ)-DP бюджетного планирования
Основная проблема дифференциальной конфиденциальности заключается в балансе между силой защиты конфиденциальности и производительностью модели. Традиционные методы сложения с фиксированным шумом испытывают трудности с адаптацией к ситуациям, когда распределение данных динамически меняется во время федеративного обучения. В этом исследовании разработан адаптивный механизм калибровки шума на основе (ε,δ)-DP, в сочетании с стратегией планирования бюджета на основе конфиденциальности, чтобы достичь динамической корректировки интенсивности шума. Определите общий бюджет на конфиденциальность системы как (Это исследование занимаетδ всего=10-5 , соответствует требованиям GDPR по риску конфиденциальности), Примените стратегию сегментированного бюджетного планирования, Общий бюджет распределяется на {ε1,ε 2,...,ε цикл обучения следующим образом, выполнено:
(32)
В каждом этапе обучения интенсивность шума динамически корректируется в соответствии с характеристиками распределения локальных данных . При условии, что дисперсия локальных характеристик данных t-го раунда учреждения равна
, Определим коэффициент корректировки шума αi,t:
(33)
Когда αi,t≥0.8 (распределение данных стабильно), при небольшой интенсивности
шума ; Когда αi,t<0.8 (распределение данных колеблется) , увеличивает интенсивность шума . Среди них — глобальная чувствительность параметров модели (это исследование обеспечивает градиентное клиппинг).
Протокол обучения, эффективный для коммуникации
Асинхронные обновления клиентов с контролем застоявшихся
Межинституциональное федеративное обучение сталкивается с такими трудностями, как высокая задержка связи и значительное потребление пропускной способности (особенно для малых и средних финансовых учреждений с ограниченными сетевыми ресурсами). В данном исследовании разработан эффективный протокол обучения коммуникации, включающий асинхронные обновления клиентов, градиентное сжатие и обратную связь с ошибками для снижения затрат на связь и повышения масштабируемостисистемы 25. Традиционные синхронные федеративные методы обучения, такие как FedAvg, требуют ожидания, пока все клиенты завершат локальное обучение, прежде чем агрегировать параметры, что приводит к длительным циклам обучения. Асинхронный механизм обновления клиента позволяет клиентам самостоятельно проходить локальное обучение и сразу загружать параметры. Получив эти параметры, федеративный координатор обновляет глобальную модель в реальном времени, не ожидая других клиентов. Это решает проблему устаревших моделей в асинхронном обучении . Введение стратегии контроля застоявшихся характеристик определите значение застоявшегося для клиента (для текущего глобального тренировочного раунда tlast_update Раунд, в котором клиент последний раз получил глобальную модель). Когда (Smax — максимальная допустимая застоявость, это исследование принимает smax=5) . Клиент участвует в обучении обычно; Максимум> этого времени клиенту нужно снова скачать последнюю глобальную модель перед локальным обучением. Аппаратная конфигурация состоит из процессоров Intel Xeon E5-2678 v3 (12 ядер, 2,5 ГГц), в сочетании с видеопроцессорами NVIDIA Tesla V100 (16 ГБ видеопамяти) и 64 ГБ памяти DDR4 на узел для эффективной обработки распределённых обучающих задач. Для программной инициализации используются команды PySyft, такие как hook = sy. TorchHook(факел)andvirtual_worker = sy. VirtualWorker(hook, id="client1") используются для установления безопасных федеративных соединений, а federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) обеспечивает федеративную загрузку данных между участниками. Семантическое отображение преобразует финансовые особенности между учреждениями — например, конвертируя суммы транзакций из USD в юань по динамической формуле обменного курса: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0,001 randn()), где курс обмена периодически обновляется через API. Для дополнения несбалансированных наборов данных CopulaGAN генерирует синтетические состязательные выборки с помощью фрагмента кода, подобного импорту sdv.tabular CopulaGAN; синтезатор = CopulaGAN(эпохи=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000), сохраняя статистические свойства исходных данных. Локальная тренировка GBDT обеспечивает монотонные ограничения (например, гарантируя, что "credit_score" положительно коррелирует с "approval_probability") viaparams = {"monotonic_constraints": (1, 0, -1)}в LightGBM, тогда как синтез трансформаторов реализуется в PyTorch с многоголовыми слоями внимания:self.attention = nn. MultiheadAttention (embed_dim=64, num_heads=4); attn_output, _ = self.attention (запрос, ключ, значение, key_padding_mask=padding_mask), за которым следует нормализация слоёв и остаточные связи для устойчивости. Дифференциальная приватность вводит шум Лапласа, масштабированный до чувствительности L1 (Δf) и бюджета конфиденциальности (ε), например, добавляя шум, дискретированный из np.random.laplace(loc=0, масштаб=Δf/ε), где Δf=1.2 и ε=0.5-, в градиенты до агрегации. Ограничения справедливости применяются после обучения путём перевзвешивания выборок обратно пропорционально их групповой распространённости (sample_weight = 1 / group_counts[y_train]), чтобы смягчить нарушения демографического паритета. В то же время стратегия взвешенной агрегации используется для корректировки веса параметров клиента в зависимости от значения застоявшегося:
(34)
где λ=0,1 — коэффициент штрафа к застоявшемся; Чем больше застоявшийся, тем меньше вес, что снижает влияние устаревших параметров на глобальную модель.
Градиентное сжатие и накопление ошибок
Параметры модели (особенно веса внимания в глобальных термоядерных моделях Transformer) обладают высокой размерной сложностью. Прямая передача потребляла бы чрезмерную пропускную способность, что требовало бы градиентного сжатия для снижения передачиданных 26. В этом исследовании интегрируется спарсификация Top-K с квантованием, следуя следующим этапам: i) Top-K разрежен: для локальной модели ∇θi градиента, выберите элемент градиента K% с наибольшим абсолютным значением для сохранения, K Остальные элементы равны нулю, Значение динамически корректируется в зависимости от условия пропускания (когда полоса пропускания достаточно K=30, когда пропускная способность ограничена K=10); ii) Квантование: Сохраняемые элементы градиента квантуются с 32-битной плавающей запятой в 8-битные целые числа. Формула квантования выглядит так:
(35)
iii) Обратная связь по ошибке: Сохранить отброшенный градиент Δ∇=∇θi-∇θiсжатую ошибку при сжатии на стороне клиента, В следующем вычислении градиента ошибка накапливается в новый градиент, подход,
, Компенсировать потери при сжатии. Влияние градиентного сжатия и обратной связи ошибок показано в таблице 6, In, 8 K=20% -битных условий квантования. Степень сжатия достигает 15:1 (исходный объем данных/сжатый объём), а при обратной связи ошибок AUC-ROC модели уменьшается только на 0,5%–1,0%, что обеспечивает баланс между затратами на коммуникацию и производительностьюмодели 27.
| Стратегии сжатия | Коэффициент восстановления | Потребление пропускной способности загрузки (МБ/раунд) | Темп снижения AUC-ROC | Скорость сокращения времени обучения |
| Несжатая (32-битная плавающая запятая) | 1:01 | 128 | 0.00% | 0.00% |
| Топ-30% разрежённая+16-битная квантование | 6.7:1 | 19.1 | 0.30% | 35.20% |
| Верхнее 20% разреженное + 8-битное квантование | 15:01 | 8.5 | 0.80% | 58.70% |
| Верхнее 10% разреженное + 8-битное квантование | 30:01:00 | 4.3 | 2.10% | 72.10% |
Таблица 6: Сравнение эффективности стратегий градиентного сжатия.
Регуляризация, ориентированная на справедливость
Модели контроля финансовых рисков должны избегать дискриминации по отношению к определённым группам и соответствовать нормативным требованиям, включая Закон о защите личной информации и Закон о справедливой кредитной отчетности. В данном исследовании вводится механизм регуляризации, ориентированный на справедливость, чтобы ограничить межгрупповые предположения прогноза во время обучения модели, обеспечивая её справедливость. Определяются два основных индикатора справедливости: i) Демографический паритет (DP): Процент положительных прогнозов равен для разных групп, подход,
, , Среди g — идентификатор группы; ii) Равные возможности (EO): истинный положительный показатель равен между группами, подход
. Добавьте термины регуляризации справедливости к функции потерь гибридной модели риска ИИ и накладывают ограничения на локальную подмодель GBDT и глобальную модель Transformer соответственно: iii) Ограничения локальной модели справедливости модели:

Здесь PR(g=A) — это положительная скорость предсказания для группы g, λ, а — коэффициент регуляризации справедливости.
iv) Глобальное ограничение справедливости модели: Добавьте корректировку веса групповой справедливости к слою внимания Трансформера, выход модели для уязвимых группg=a основа×(1+β⋅Δнесправедливо) получает более высокий вес внимания, Здесь Δнесправедливый представляет собой смещение справедливости между этой группой и доминирующей группой (Δнесправедливо=PR (доминирующая группа)-PR (уязвимые группы)); λEO — коэффициент компенсации отклонения. Влияние регуляризации восприятия справедливости оценивается по ΔDP (отклонение DP), ΔEO (отклонение EO) и ошибке калибровки групп.
Панель управления моделью и соответствия
Мониторинг смещения в реальном времени
Для соответствия требованиям финансового регулирования управления жизненным циклом модели исследование разработало дашборд управления и соответствия моделей, интегрирующий API мониторинга отклонений в реальном времени и регуляторной отчетности, что позволяет осуществлять полный надзор и отслеживание на протяжении всего обучения, внедрения и итерации моделей. Модуль мониторинга отклонений в реальном времени обеспечивает динамическое отслеживание справедливости и производительности модели по следующим параметрам: i) Мониторинг групповых отклонений: категоризация групп по полу, возрасту, региону, уровню дохода и т.д., расчет PR, TPR и FPR (FPR) для каждой группы почасово. Предупреждения об отклонениях срабатывают, когда различия между группами PR превышают 0,08 или различия TPR превышают 0,05; ii) Мониторинг дрейфа производительности: непрерывное вычисление метрик, таких как AUC-ROC и PR-AUC. Когда эти показатели снижаются более чем на 2% подряд в течение трёх часов, это определяется как дрейф производительности, автоматически запуская процесс переобучения модели. iii) Мониторинг соблюдения конфиденциальности: Фиксируйте расход бюджета на приватность и добавление шума εобщей интенсивности каждого этапа обучения в 10. Когда расход ε одного выстрела превышает, приостановите тренировку и скорректируйте стратегию шума. iv) Мониторинговые данные отображаются через визуальные панели, позволяющие регуляторам и участвующим организациям видеть их в реальном времени и обеспечивая прозрачное управление рисками модели.
API регуляторной отчетности
Для упрощения процесса регуляторной отчетности разработан стандартизированный API для поддержки автоматической генерации отчетов, соответствующих таким нормативным требованиям, как GDPR, CCPA и Закон Китая о защите персональной информации. Основные функции включают: i) Отчет о соблюдении данных источников: автоматически агрегирует типы данных, объемы и статус авторизации участвующих учреждений для проверки соответствия принципу «минимально необходимого»; ii) Отчёт о соблюдении стандартов обучения модели: фиксирует итерации обучения, участвующие учреждения, меры защиты конфиденциальности и метрики справедливости для создания отчёта по отслеживаемости обучения модели; iii) Отчет о соблюдении рисков по прогнозированию: отображает законом-соответствующие шаблоны распределения моделей прогнозов по разным группам и контрфактические объяснения для демонстрации отсутствия дискриминации. API использует стиль проектирования RESTful, поддерживающий выводы в форматах JSON и XML. Регулирующие органы могут напрямую получать доступ к данным отчетов через API или устанавливать автоматические циклы отчетности для достижения автоматизированных и стандартизированных регуляторных процессов. Шаблоны отчётов соответствуют нормативным стандартам финансовой модели Международной организации по стандартизации (ISO), обеспечивая авторитет и универсальность отчетов.
Экспериментальный дизайн: описание набора данных
Данные по многоинституциональным кредитным картам и кредитам МСП
Экспериментальные данные поступали от финансовых учреждений Китая и охватывают такие типы данных, как операции по личным кредитным картам и записи заявок и исполнения кредитов МСП. Технология CopulaGAN была использована для синтеза и улучшения редких мошеннических событий, создавая экспериментальный набор данных, сочетающий подлинность и целостность. Реальные данные, использованные в эксперименте, включают две основные категории: данные о личных транзакциях по кредитным картам и данные по займам малого и среднего бизнеса, в сумме более 5 миллионов записей, охватывающих период с января 2022 по декабрь 2023 года. Данные охватывают четыре основных экономических региона — Северный Китай, Восточный Китай, Южный Китай и Юго-Западный Китай — чтобы обеспечить географическую репрезентативность и разнообразие распределения выборок. Основные области и статистические характеристики институциональных данных показаны в таблице 7. Среди них Учреждения A и B — это общенациональные коммерческие банки с большой клиентской базой всех возрастных групп; Учреждения C и D — это интернет-банки, в основном обслуживающие молодую аудиторию (20-35 лет); Institution E — это компания по потребительскому финансированию, ориентированная на пользователей на рынках низшего уровня, при этом распределение данных обладает значимыми характеристиками Non-IID. Набор данных содержит 115610 единиц данных. Набор данных предоставляется финансовыми учреждениями, сотрудничающими с университетами
| Тип данных | Учреждение | Количество рекордов (10 000) | Количество клиентов (10 000) | Основные области | Уровень мошенничества по умолчанию | Характеристики распределения данных |
| Транзакции по кредитным картам | A | 180 | 85 | Время транзакции, сумма, тип торговца, местоположение транзакции, вопрос о краже карты | 0.32% | Крупные транзакции составляют большую долю (> 5000 юаней) |
| Транзакции по кредитным картам | B | 150 | 72 | Номер потока транзакций, сумма (USD/RMB), платёжный канал, рейтинг клиента | 0.28% | Трансграничные транзакции составляют 15% |
| Транзакции по кредитным картам | C | 120 | 68 | Время проведения транзакции, сумма, установка, возраст клиента, местоположение номера мобильного телефона | 0.45% | Мелкая высокочастотная торговля (<1000 юаней составляет 60%) |
| Кредиты для малого и микробизнеса | D | 32 | 1.2 | Название компании, сумма кредита, срок кредита, шкала дохода, сумма налога, задолженность | 2.80% | Производственные заказчики составляют 40% |
| Кредиты для малого и микробизнеса | E | 18 | 0.8 | Дата подачи заявки на кредит, ожидаемая сумма, тип бизнеса, количество сотрудников, исторические показатели эффективности | 3.50% | Клиенты услуг составляют 70% |
Таблица 7: Статистические характеристики многоинституционального реального финансового набора данных.
Чтобы решить гетерогенность межинституциональных данных, эксперимент строго придерживался спецификаций сетки данных и семантического уровня, стандартизируя институциональные поля: например, конвертация «суммы транзакции (USD)» Учреждения B в юань с использованием курса даты транзакции и унификации имени поля в «сумму транзакции (YUAN)»; преобразование «клиентского возраста» Учреждения C (формат «1990-01-01») в целочисленный возраст; а также сопоставление «масштаба корпоративного дохода» Учреждения D (классифицированного как «ниже 1 миллиона / 1-5 миллионов / более 5 миллионов») с промежуточными точками числовых диапазонов (500 000, 3 000 000, 7 500 000), обеспечивая согласованность формата данных и семантического значения.
Синтетическая аугментация через CopulaGAN для редких случаев мошенничества
В сценариях контроля финансовых рисков выборки мошенничества/дефолта обычно составляют крайне низкую долю. Прямое использование таких малых размеров выборки для обучения моделей приведёт к серьёзным проблемам классового дисбаланса, что ухудшит возможности модели по обобщению. Эксперимент использует Copula GAN (генеративную состязательную сеть, основанную на функциях Copula) для синтеза дополненных данных по редким случаям мошенничества. Этот метод сочетает способность функции Копулы моделировать высокомерные распределения данных с генеративными возможностями GAN, позволяя создавать синтетические данные, соответствующие реальным мошенническим паттернам, при этом избегая проблемы «коллапса паттерна», часто наблюдаемой при традиционной генерации GAN.
Структура модели CopulaGAN
CopulaGAN состоит из трёх частей: генератор, дискриминатор и модуль ограничения распределения Копулы: (1) Генератор: Вход — это 128-мерный вектор случайного шума z∼N(0,1), а вывод — синтетический вектор признаков, согласованный с истинной размерностью выборки, через 3-слоевую полностью связную сеть (размеры скрытого слоя: 256, 512, 256); (2) Дискриминатор: вход — это реальный выборка или синтетический образец xsyn, и через двухслойную полностью связанную сеть + функцию активации Sigmoid выводит вероятность того, что выборка является реальной информацией; (3) Модуль ограничения распределения Копулы: Подгонить совместное распределение вещественных образцов мошенничества через гауссовскую функцию Копулы (где — значение функции рёберного распределения 8-го признака i) и добавить ограничение расстояния Копулы в потери генератора, чтобы обеспечить согласованность совместимости синтетических образцов с действительными образцами.
(36)
Улучшение проверки процессов и эффектов
Процесс обучения и совершенствования CopulaGAN следующий: i) Предобработка данных: извлечь мошеннические/стандартные образцы (всего 18 200) из реальных данных различных учреждений; Стандартизировать непрерывные признаки (x'=(x-μ)/σ); Отдельные признаки кодируются с помощью уникального тепла; ii) Подгонка Копулы: Гауссовская функция Копулы используется для совместного распределения предварительно обработанных образцов мошенничества. Вычислить распределение краёв функции Fiθ и параметры функции Копулы каждой особенности; iii) Обучение GAN: Генератор и дискриминатор обучаются поочерёдно. Функция потерь генератора выглядит:
(37)
Здесь λ — вес ограничения, а Distance(C syn,C real) — дивергенция KL между распределением Копулы синтетических образцов и распределением Копулы реальных выборок; Функция потерь дискриминатора является стандартной бинарной потерей перекрёстной энтропии:
(38)
После сходимости модели (с точностью дискриминатора, стабилизированной на уровне 50%±5%) генератор произвел 50 000 синтетических образцов мошенничества. Они отображались обратно в исходное пространство признаков согласно семантическим спецификациям и смешивались с реальными образцами для создания сбалансированного обучающего набора. Для проверки эффективности синтетических образцов исследование оценивало их с помощью двухобразного теста KS и визуализации распределения признаков. Результаты теста KS показали, что различия в распределении признаков между синтетическими и реальными выборками были ниже 0,05 (статистика KS <0,05, p-значение>0,05), что указывает на хорошую согласованность распределения. Сравнение распределения признаков показало, что синтетические образцы могут точно воспроизводить характеристики распределения реальных образцов мошенничества, обеспечивая достаточные достоверные данные для обучения модели, как показано на рисунке 1.

Рисунок 1: Сравнение распределения признаков между реальными образцами мошенничества и CopulaGAN. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой цифры.
Метрики оценки
Эксперимент строит многоиндексную систему оценки из четырёх основных измерений: производительность прогнозирования, защита конфиденциальности, справедливость и эффективность коммуникации для комплексного измерения эффективности федеративного фреймворка обучения и модели управления рисками ИИ. Определение, метод расчёта и критерии оценки каждого измерения приведены в таблице 8.
| Измерения оценки | Название индекса | Определение и метод расчёта | Критерий оценки |
| Предполагаемая производительность | AUC-ROC | Область под характеристической рабочей кривой испытуемого измеряет способность модели различать положительные (дефолт/мошенничество) и отрицательные примеры | Чем выше стоимость, тем лучше. AUC-ROC отличной модели — >0,9 |
| PR-AUC | Область точного воспоминания под кривой, применимая к несбалансированным данным, измеряет производительность модели в сценариях, где положительные примеры редки | Чем выше стоимость, тем лучше. PR-AUC отличной модели — >0,8 |
| Фракция Бриера | Средняя квадратическая ошибка между предсказанной вероятностью и истинной меткой,B=1Ni=1N(pi-yi)2 | Чем ниже стоимость, тем лучше. Балл Брайера отличной модели составляет менее 0,05 |
| Процент ложноположительных результатов (FPR) | Доля отрицательных примеров FPR=FPFP+TN, что | Чем ниже стоимость, тем лучше. В финансовых ситуациях обычно требуется FPR <1% (чтобы не отказывать хорошим клиентам) |
| Защита конфиденциальности | ε-Кривая потребления (ε-кривая) | Фиксируйте темп потребления накопленного бюджета конфиденциальности во время обучения, чтобы отразить динамический баланс в защите конфиденциальности | Кривая выравнивается, и общий ε меньше или равен 5 (в соответствии с требованиями GDPR по риску конфиденциальности) |
| Атака на рассуждение членов AUC (MI-AUC) | Способность злоумышленника определить, принадлежит ли выборка к учебному набору, исходя из результатов прогноза модели, и чем ближе значение AUC к 0.5, тем лучше конфиденциальность | MI-AUC<0.6 эффективна для защиты конфиденциальности, MI-AUC<0.55 — отлично |
| Коэффициент утечки признаков (FLR) | Злоумышленник агрегирует признаки, чтобы обратить ошибку FLR=1-KL(P∥∥Q)Dmaxrate исходного распределения данных, | FLR <0.1 указывает на эффективность защиты конфиденциальности (P — Dmax — истинное распределение, Q — предполагаемое распределение, а — максимальное расстояние KL) |
| Справедливость | Смещение DP в статистике (ΔDP) | Максимальная разница в предсказании ΔDP=max∥PRg-PRavg∥rate положительных примеров между различными группами, | ΔDP<0,05 — за справедливость, за превосходство (PRg — положительный процент группы g) |
| Смещение EO (ΔEO) | Максимальная разница в истинно положительных показателях ΔEO=max∥TPRg-TPRavg∥avg между разными группами, | GCE <0.02 хорошо откалибрована (K — групповое число, прогнозируемая скорость, а — фактическая скорость) |
| Ошибка групповой калибровки (GCE) | Среднее отклонение между предсказанной вероятностью GCE=1Kg=1K∥pg-rg∥ каждой группы и фактической скоростью дефолта, | Чем ниже стоимость, тем лучше. Требования к сценариям малых и средних организаций составляют <10 МБ/раунд |
| Эффективность связи | Пропускная способность восходящего канала на один раунд | Общее потребление пропускной способности данных, загруженных каждой организацией координатору за один раз | Чем ниже стоимость, тем лучше. Межинституциональные сценарии требуют менее 120 минут |
| Коэффициент восстановления (CR) | Отношение исходного объёма данных к сжатому объёму данных,CR=SizerawSizecomp | Чем выше степень сжатия, тем лучше. Отличные решения CR>10:1 |
Таблица 8: Экспериментальная система индексов оценки.
Объяснение метрики: i) Атака на вывод членства: Используя методологию атак «чёрного ящика», злоумышленник обучает бинарную модель классификации, которая вводит предсказанные вероятности из целевой модели и выводит статус принадлежности выборки. Риск утечки конфиденциальности измеряется AUC модели (то есть MI-AUC). ii) Критерии классификации групп: Для оценки справедливости группы делятся по четырём измерениям: пол (мужчина/женщина), возраст (до 25/25-40/>40), регион (рынки первого уровня/новые первое/второе/дочерние рынки) и уровень дохода (<5k/5k-15k/15k-30k/>30k юаней/месяц). Это обеспечивает покрытие чувствительных групп, выявленных финансовыми регуляторами. iii) Критерии сходимости: Во время обучения моделей, если валидационный набор AUC-ROC показывает снижение менее чем 0,001 за три последовательных раунда (каждый раунд содержит 10 эпох), обучение считается сходящимся, и остановленным.
Исходные показатели
Для подтверждения превосходства предлагаемой «Федеративной модели обучения + гибридной модели управления рисками ИИ» в этом исследовании выделяются пять базовых моделей: традиционные централизованные модели, классические федеративные модели обучения и усовершенствованные модели, сохраняющие конфиденциальность. Основные параметры и стратегии обучения каждой базовой модели подробно изложены в Таблице 9 для обеспечения справедливости в сравнительных экспериментах (все модели используют одинаковые обучающие наборы, валидационные наборы и стратегии гиперпараметрической оптимизации).
| Типы моделей | Название модели | Основная архитектура | Режим тренировки | Меры защиты конфиденциальности | Ключевые гиперпараметры |
| Централизованная модель | Традиция GBDT | Дерево усиления градиентов XGBoost | Все учреждения централизованно хранят обучающие данные | Не было | Количество деревьев =100, скорость обучения =0,1, глубина дерева =6, коэффициент регуляризации λ=1,0 |
| Централизованная модель | Модель глубокого обучения (MLP) | Трёхслойная полностью связанная сеть (входный уровень 256 измерений → скрытый слой 128 → скрытый слой 64 измерения → выходной слой 1) | Все учреждения централизованно хранят обучающие данные | Не было | Optimizer=Adam, скорость обучения=0.001, размер партии=256, Dropout=0.3 |
| Классическая федеральная модель | FedAvg (федеральный средний показатель) | Локальная модель — GBDT, а глобальная модель использует агрегирование усредненных параметров | Федеральное синхронное обучение | Не было | Уровень участия = 0,8, локальная эпоха = 5, раунд агрегации = 50, скорость обучения =0,1 |
| Классическая федеральная модель | FedProx (федеральная агрегация ближнего конца) | Локальная модель — GBDT, а проксимальная | Федеральное синхронное обучение | Не было | Коэффициент участия = 0,8, локальная эпоха = 5, агрегационный раунд = 50, проксимальный параметр μ =0,01 |
μ=0.01 Ограничение на термин добавляется во время агрегации (). |
| Федерация, поддерживающая конфиденциальность | FedAvg+DP (фиксированный шум) | Добавить фиксированный лапласианский шум в FedAvg (ε=5, δ=1e-5) | Федеральное синхронное обучение | Фиксированная дифференциальная конфиденциальность | Интенсивность шума = 0,1, уровень участия=0,8, локальная эпоха = 5, раунды агрегации = 50 |
| Модель исследования | FedRisk (Федеральная модель контроля рисков) | Локальный GDT (монотонное ограничение) + глобальный трансформатор (внимание слияние) + DP + безопасная агрегация | Федеральное асинхронное обучение | Адаптивный аддитивный секретный обмен DP+ | Локальная эпоха=5, агрегационные раунды=50, измерение внимания=64, приватный бюджет = 5, коэффициент сжатия = 15:1 |
Таблица 9: Сравнение параметров между базовой моделью и этой моделью исследования.
Сравнительное объяснение измерений: (1) Централизованное против федеративного: Сравнивая «традиционный GBDT/MLP» с «FedAvg/FedProx/FedRisk», это исследование рассматривает ухудшение эффективности федеративного обучения в сценариях «данных вне сайта». (2) Классика против федеративных систем с повышением конфиденциальности: Через «FedAvg» против «FedAvg+DP» исследование оценивает влияние дифференциальной приватности на производительность модели. (3) Синхронный и асинхронный федеративный: сравнение «FedAvg» (синхронный) и «FedRisk» (асинхронный) демонстрирует преимущества асинхронного обучения в эффективности коммуникации. (4) Простая агрегация против интеллектуального синтеза: Контраст между «FedAvg» (усреднение параметров) и «FedRisk» (слияние внимания) подтверждает адаптивность стратегий интеграции трансформеров к данным Non-IID. (5) Отсутствие цензуры против цензуры справедливости: сравнение между «FedAvg» (без ограничений справедливости) и «FedRisk» (ограничения, учитывающие справедливость) изучает влияние механизмов справедливости на справедливость и производительность моделей.
Исследования абляции
Влияние различных ε на полезность модели
Используя общий бюджет конфиденциальности ε как переменную (со значениями 1, 3, 5, 7 и 10), исследование зафиксировало δ=1e-5, сохранив при этом другие модули (слияние внимания и монотонное ограничение GBDT) без изменений для оценки компромисса между силой защиты конфиденциальности и полезностью модели. Эксперимент измерял как AUC-ROC (утилиту модели), так и MI-AUC (риск конфиденциальности) как двойные индикаторы, результаты которых приведены в Таблице 10. Когда ε=1, MI-AUC упал до 0,53 (отличная защита конфиденциальности), а AUC-ROC достиг всего 0,821 (значительная потеря полезности). При ε=5 AUC-ROC восстановился до 0,912 (соответствуя требованиям по контролю финансовых рисков) с MI-AUC=0,58 (эффективная защита конфиденциальности). Когда ε>5, улучшение AUC-ROC составило менее 0,01, тогда как MI-AUC быстро выросло до 0,63 (превысив лимиты рисков конфиденциальности). Это подтверждает, что ε=5 является оптимальным общим бюджетом конфиденциальности, обеспечивая баланс между конфиденциальностью и полезностью.
| Total Privacy Budgetε | Модель AUC-ROC | MI-AUC (риск конфиденциальности) | Коэффициент утечки признаков (FLR) | Фракция Бриера |
| 1 | 0.821 | 0.53 | 0.04 | 0.078 |
| 3 | 0.876 | 0.55 | 0.06 | 0.061 |
| 5 | 0.912 | 0.58 | 0.08 | 0.042 |
| 7 | 0.919 | 0.6 | 0.11 | 0.039 |
| 10 | 0.923 | 0.63 | 0.15 | 0.037 |
Таблица 10: Сравнение производительности модели с разными бюджетами конфиденциальности ε.
Вклад слияния внимания по сравнению с простым усреднением
Для оценки различий в эффективности между «слиянием внимания» (предлагаемая стратегия) и «простым усреднением» (стратегия FedAvg) в ненезависимых сценариях данных были экспериментально настроены две переменные: (1) Не-IID тяжесть данных (измеряется по специфическим для учреждения вариацией частоты по умолчанию, низкая вариация: 0,2%-0,5%, высокая: 0,2%-3,5%); (2) Стратегии слияния (синтез внимания против простого усреднения). Как показано на рисунке 2, разрыв между двумя стратегиями составлял всего 0,023 (0,912 против 0,889) в сценариях с низким уровнем Non-IID. Однако этот разрыв увеличился до 0,076 (0,905 против 0,829) в случаях с высоким уровнем Non-IID, при этом простая модель усреднения демонстрировала значительное переподгонку (обучающий набор AUC-ROC 0,941 против валидационного набора 0,829). Это демонстрирует, что механизмы внимания могут эффективно смягчать ухудшение производительности, вызванное ненезависимыми данными, с помощью динамического взвешивания — например, присвоения веса 0,32 учреждению E с точными стандартными прогнозами и 0,12 веса институту C с большими отклонениями.

Рисунок 2: Сравнение стратегий термоядерного синтеза при различных степенях Non-IID. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.
Влияние регуляризаторов справедливости на прибыльные KPI
Основное требование финансовых учреждений — обеспечить прибыль бизнеса в условиях справедливости, поэтому эксперимент вводит индекс, ориентированный на прибыль — «риск-скорректированная рентабельность капитала (RAROC)», формула выглядит следующим образом:
(39)
Ожидаемый убыток рассчитывается как вероятность дефолта, умноженная на фиксированную ставку потерь по дефолту (установленную на уровне 40%), тогда как экономический капитал определяется как риск, умноженный на вес риска (согласно требованиям Базель III). Метрики справедливости (ΔDP, ΔEO) и RAROC модели с регуляризацией справедливости по сравнению с моделью без неё сравниваются в таблице 11. После внедрения регуляризации справедливости ΔDP снизился с 0,15 до 0,04, ΔEO снизился с 0,12 до 0,03, а RAROC снизился всего на 2,1% (18,3% против 18,7%), значительно ниже допустимого отраслевого порога в 5%. Это демонстрирует, что механизм справедливости в нашем исследовании эффективно соответствует нормативным требованиям о недискриминации при одновременном контроле потерь прибыли.
| Настройка модели | ΔDP (разница положительных показателей группы) | ΔEO (различие группового TPR) | GCE (ошибка групповой калибровки) | RAROC (Риск-скорректированная доходность активов) | FPR (процент ложноположительных результатов) |
| Нет правила справедливости | 0.15 | 0.12 | 0.035 | 18.70% | 0.95% |
| Есть справедливость и регулярность | 0.04 | 0.03 | 0.018 | 18.30% | 1.02% |
Таблица 11: Влияние регуляризации справедливости на показатели справедливости и прибыли.
Детали реализации
Для обеспечения воспроизводимости эксперимента исследование уточнило технический стек и детали процесса обучения: (1) Аппаратная среда: каждый институциональный узел использует процессоры Intel Xeon Gold 6248, 64 ГБ оперативной памяти и видеокарты NVIDIA Tesla V100; федеративный координатор использует два процессора Xeon Gold 6348 с 128 ГБ оперативной памяти для обеспечения параллельных вычислений и эффективной агрегации параметров. (2) Программный фреймворк: федеративный фреймворк обучения разработан с использованием PySyft 0.8.6, блокчейн-модуль использует Hyperledger Fabric 2.5 (консенсусный механизм: Raft), обучение модели основано на PyTorch 2.0 и XGBoost 2.0.3, а дифференциальный модуль конфиденциальности интегрирует библиотеку IBM DP. (3) Процесс обучения: (1) Предварительная обработка данных (2 часа, включая семантическую нормализацию и улучшение CopulaGAN); (2) Локальное обучение (5 эпох за раунд, скорость обучения снижается за счёт косинусного отжига); (3) Асинхронная агрегация (глобальные обновления модели происходят, когда координатор получает параметры от 3 учреждений); (4) Оценка модели (метрики AUC-ROC и справедливости рассчитываются после 10 раундов); (5) Гиперпараметрическая оптимизация (байесовская оптимизация с 50 итерациями для определения оптимальных параметров). (4) Тестирование надёжности: имитация институциональных разрывов (случайный выбор одного учреждения для остановки 1-3 этапов обучения) и сценарии шума данных (добавление 5% возмущений значения признаков). Результаты показали колебания AUC-ROC ниже 0,02, что демонстрирует способность системы противодействовать интерференциям.
В этом исследовании использовалась стратегия планирования косинусного отжига с начальной скоростью обучения 0,05. Скорость обучения динамически обновлялась в каждой эпохе согласно формуле на протяжении всего 100 обучающих эпох. Эта стратегия поддерживала высокую скорость обучения на ранних этапах обучения, например, 0,05 в первой эпохе, чтобы ускорить сходимость моделей, и постепенно снижала её почти до нуля, например 0,00025 на сотой эпохе, чтобы повысить стабильность тонкой настройки параметров. Экспериментальные результаты показали, что по сравнению с фиксированной скоростью обучения эта стратегия улучшила валидационный набор AUC-ROC на 2,3% и ускорила скорость сходимости на 37%. Разделение данных было основано на исходном наборе данных из пяти финансовых учреждений общей сложностью 5 миллионов выборок, строго придерживаясь принципа межинституциональной изоляции данных. Местные данные из каждого учреждения были разделены хронологически: данные с января 2022 по июнь 2023 года в качестве обучающего набора (70%), данные с июля по сентябрь 2023 года как валидационный набор (15%) и данные с октября по декабрь 2023 года как тестовый набор (15%). Это разделение обеспечивало временную независимость наборов обучения, валидации и тестов, эффективно моделируя эволюцию паттернов временного риска в реальных ситуациях. Ключевые гиперпараметры определялись с помощью байесовской оптимизации. В совместном поисковом пространстве с начальной скоростью обучения от 0,01 до 0,1, номерами деревьев GBDT от 50 до 200 и головками внимания трансформеров из набора {2, 4, 8}, было выполнено 50 итераций с целью максимизации валидационного набора AUC-ROC. Окончательная оптимальная комбинация была определена как начальная скорость обучения 0,05, 120 деревьев GBDT и 4 головы внимания.