מאמר מחקר

מודל למידה מאוחד להסבר לשיתוף פעולה ובקרת סיכונים בנתונים פיננסיים דיגיטליים בין-מוסדיים

DOI:

10.3791/69805

3 במרץ 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

אנו מדגימים פרוטוקול שניתן לשחזור ליישום FedRisk, מסגרת למידה פדרטיבית שניתן להסביר. ההליך כולל הרמוניזציה סמנטית של נתונים, יישור ישויות לשמירה על פרטיות, כיול פרטיות דיפרנציאלי, הדרכה מקומית ל-GBDT, מיזוג גלובלי של טרנספורמר, ועדכונים אסינכרוניים דחוסים-גרדיאנט, המאפשרים חיזוי סיכונים פיננסיים מאובטח, ניתן להרחבה ובהתאם לרגולציה בין מספר מוסדות.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פיצול הנתונים הפיננסיים בין מוסדות ותקנות פרטיות מחמירות פוגעים קשות בניהול סיכונים שיתופי, מה שמוביל לזיהוי הונאות לא אופטימלי בדיוק מתחת ל-60% ולשגיאות חדלות פירעון גבוהות של ההלוואות לעסקים קטנים ובינוניים העולות על 25%. פתרונות למידה פדרטיביים קיימים מתמודדים עם אתגרים בנתונים שאינם IID, יכולת פרשנות מודלים וציות, מה שמוביל לשיעורי אימוץ בעולם האמיתי מתחת ל-20%. כדי להתמודד עם פערים אלו, אנו מציעים את FedRisk, מסגרת למידה פדרטיבית להסבר המשלבת ארבעה חידושים מרכזיים. ראשית, רשת נתונים בין-מוסדית עם הרמוניזציה סמנטית אונטולוגית משיגה ניצול תכונות מעל 85%. שנית, מודל היברידי של בינה מלאכותית משלב GBDT מקומי שניתן לפרשנות עם מגבלות מונוטוניות וטרנספורמר גלובלי מבוסס תשומת לב, ומפחית אובדן ביצועים בתרחישים שאינם IID ב-7.6% בהשוואה ל-FedAvg. שלישית, מנגנון פרטיות משולש עושה שימוש בפרטיות דיפרנציאלית אדפטיבית עם תקציב כולל של ε=5, שיתוף סודות מצטברים ורגולוריזציה מודעת להגינות, מה שמגביל הטיית חיזוי קבוצתית מתחת ל-0.05 ואובדן RAROC מתחת ל-2.1%. רביעית, אופטימיזציות יעילות לתקשורת מפחיתות את רוחב הפס לכל סבב ל-8.5 MB ואת זמן ההדרכה ל-85 דקות. בהערכה על למעלה מ-5 מיליון רשומות רב-מוסדיות, FedRisk השיגה AUC-ROC של 0.912, רק 1.8% פחות מ-GBDT מרכזי, תוך עמידה בפני התקפות הסקת חברות עם AUC של 0.58. הוא מפחית את העברת הנתונים בין מוסדות ב-99% ומעלה על קווי הבסיס הקלאסיים של פלורידה ב-7.3% ב-AUC-ROC. על ידי מתן אפשרות לחיזוי סיכונים מאובטח, שקוף ותואם לרגולציה ללא שיתוף נתונים גולמיים, FedRisk מספקת פתרון ניתן להרחבה לשיתוף פעולה פיננסי בין-מוסדי.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הפיתוח המעמיק של הפיננסים הדיגיטליים משנה מודלים של שירותים, מבקרת סיכוני אשראי אישיים ועד מימון שרשרת אספקה לעסקים קטנים ובינוניים, ומבסס את הנתונים כגורם ייצור מרכזי. לפי "דוח פיתוח הפינטק של סין לשנת 2023" של ה-PBOC, עד סוף 2023, סולם האשראי הדיגיטלי של סין עלה על 65 טריליון יואן, המהווים 38% מהיתרה הכוללת, כאשר נתוני העסקאות היומיים עולים על 500TB1. עם זאת, "מבודדי נתונים" נותרו מחסום משמעותי. מוסדות בדרך כלל מאמצים מודלים סגורים של נתונים בשל תחרות וחששות אבטחה. לדוגמה, בזיהוי הונאות בכרטיסי אשראי, בנקים התלויים אך ורק על נתונים פנימיים מפספסים רישומים קריטיים בין מוסדות, מה שמוביל לשיעורי זיהוי מתחת ל-60% עבור סוגי הונאות חדשים. באופן דומה, עבור אשראי לעסקים קטנים ובינוניים, היעדר נתוני ביטוח ומיסוי חיצוניים מוביל לשגיאות חיזוי חדלות הפירעון העולות על 25%. פיצול זה יוצר אתגרים כפולים: הגבלת הגישה ל-200 מיליון לקוחות מוחלשים והעלאת הסיכון להדבקה צולבת ב-18% (דוח CBIRC 2023). כתוצאה מכך, מבודדי נתונים הפכו לצוואר הבקבוק המרכזי שמפריע לפיתוח איכותי של פיננסים דיגיטליים.

בשנים האחרונות, עלייה בחוקי פרטיות המידע הגלובליים הגבילה משמעותית את שיתוף הנתונים המרכזי. מוסדות פיננסיים חייבים כעת להיצמד לשלושה עקרונות מרכזיים: "צורך מינימלי", "הסכמה מדעת" ו"מעקב". למרות שהמסגרות האזוריות משתנות, כולן מטילות סף מחמיר לשימוש בנתונים בין-מוסדי, כפי שמפורט בטבלה 1.

מסגרת רגולטוריתמשפטים מגבילים מרכזייםהשפעה על שיתוף פעולה בנתונים פיננסיים
תקנת הגנת המידע הכללית של האיחוד האירופי (GDPR)1. העברת נתונים חוצת גבולות חייבת לעמוד ב"קביעת מספקות"; 2. לפרטים יש זכות לגשת ולמחוק את הנתונים שלהם; 3. יש לדווח על פרצות מידע בתוך 72 שעותהעברה לא מורשית של נתונים גולמיים חוצת גבולות אסורה, ושיתוף מרכזי דורש הערכת השפעת פרטיות (PIA), מה שמעלה את עלויות הציות ב-30%
חוק פרטיות הצרכן של קליפורניה (CCPA)1. צרכנים יכולים לבקש מחברות למחוק את הנתונים האישיים שלהן; 2. שיתוף נתונים דורש הודעה ברורה על מה שישמשפלטפורמות מרכזיות דורשות ממשקי גישה לנתונים לכל צרכן, מה שמעלה את עלויות התפעול ב-25% ומקל על הצרכנים למחוק נתונים ולגרום לחסרי נתוני אימון למודל
חוק הגנת המידע האישי של סין1. עיבוד מידע אישי דורש הסכמה נפרדת; 2. עיבוד מידע אישי רגיש דורש מסמכי הרשאה נוספים; 3. הקמת מערכת "סיווג והגנה על נתונים"שיתוף נתונים בין-מוסדי דורש אישור מכל לקוח, ושיעור ההרשאה בפועל נמוך מ-40%. מצב מרכזי קשה ליישום
הוראת שירותי התשלום של האיחוד האירופי II (PSD2)1. לפתוח את ממשק נתוני הבנק; 2. שיתוף נתונים צריך להתבסס על הרשאת לקוח ושימוש מוגבללמרות שהוא תומך בשיתוף נתונים, הוא דורש מעקב אחר כל תהליך הגישה לממשק, והפלטפורמה המרכזית תישא באחריות לאבטחת הממשק ולביקורת, מה שמגביר משמעותית את המורכבות הטכנית

טבלה 1: השוואת דרישות ליבה של מסגרות רגולטוריות מרכזיות לנתונים.

מחקר זה מציג שלושה חידושים מרכזיים להתמודדות עם אתגרים במודל סיכונים פדרטיביים בין-מוסדיים. ראשית, ארכיטקטורת רשת נתונים עם שכבת סמנטיקה אונטולוגית מסטנדרטית סכמות הטרוגניות, ומשיגה ניצול של מעל 85% תכונות תוך שמירה על ריבונות הנתונים. שנית, מודל בינה מלאכותית היברידי משלב GBDT מקומי שניתן לפרשנות עם מגבלות מונוטוניות תואמות רגולציה וטרנספורמר גלובלי מבוסס תשומת לב. על ידי שקילול דינמי של תפוקות מוסדיות, מודל זה מפחית את אובדן הביצועים של Non-IID ב-7.6% תוך שמירה על AUC-ROC של 0.912. שלישית, מנגנון תלת-חלקי לציות לפרטיות משלב פרטיות דיפרנציאלית אדפטיבית (ε=5), שיתוף סודות מצטברים ורגוליזציה מודעת להגינות כדי להבטיח עמידה ב-GDPR, להגביל הטיית ΔDP ל-< 0.05, ולהתנגד להתקפות הסקת חברות (AUC=0.58). יחד, החידושים הללו מיישבים את הדרישות של פיצול נתונים, פרשנות רגולטורית, ופשרות פרטיות-אבטחה בבינה מלאכותית פיננסית פדרלית.

למידה מאוחדת בתחום הפיננסים מחולקת ללמידה מאוחדת אופקית (HFL)2), למידה מאוחדת אנכית (VFL)3, ולמידה מהעברה מאוחדת (FTL)4 בהתבסס על התפלגות הנתונים (טבלה 2).

פרדיגמה פדרליתתכונות ליבהתרחיש התאמת בקרת סיכונים פיננסייםמחקרים ייצוגייםגבולות
למידה פדרלית אופקיתמרחב הנתונים של המשתתפים עקבי, אך מרחב הדגימה שונהזיהוי הונאות בכרטיסי אשראי בין-ארגונימקמהן ואחרים [[i]](2017) הציעו את אלגוריתם FedAvg, אשר לראשונה יישם HFL למאבק בהונאה פיננסית על ידי השגת שיתוף פעולה במודלים חוצי מוסדות באמצעות ממוצע פרמטרים, ושיפר את שיעור זיהוי ההונאה ב-12% במאגר נתונים של 10 בנקיםללא התחשבות במאפיינים הלא-עצמאיים והמפוזרים זהה (שאינם IID) של נתונים פיננסיים, כאשר ההפרש בהתפלגות סיכון הלקוחות בין מוסדות עולה על 30%, ה-AUC-ROC של המודל יורד ביותר מ-15%
למידה פדרלית אנכיתמרחב הדגימה של המשתתפים עקבי, אך מרחב התכונות שונהשליטה שיתופית בסיכוני אשראי בין בנקים לחברות ביטוחיאנג ואח' [[ii]] (2020) הציעו את אלגוריתם SecureBoost, המשיג אימון משותף לתכונות אנכיות באמצעות הצפנה הומומורפית, ומגיע לשיעור דיוק חיזוי חדלות פירעון של 89.3% בתרחיש הלוואות עסקיות קטנות ומיקרוהוא מסתמך על יישור ישות קפדני, שיש בו סיכון גבוה לדליפת פרטיות, ויעילות האימון יורדת בחדות כאשר ממד התכונה גדול מדי
למידת העברה פדרליתישנם הבדלים בהתפלגות הנתונים ובמרחב התכונות של המשתתפיםנדידת סיכונים בין-תרחישיםPan ואחרים.[[iii]] (2021) פתרו את בעיית המחסור במדגם במימון שרשרת האספקה על ידי אתחול מודל אופטימיזציית הגירת הפרמטרים, ששיפר את מהירות ההתכנסות ב-60%"הגירה שלילית" צפויה להתרחש במהלך תהליך ההגירה. כאשר הפרש מנגנון הסיכון בין תרחיש המקור לתרחיש היעד עולה על 40%, ביצועי המודל עולים על המודל המסורתי
[[i]]מקמהן, ב., מור, א., רמאג', ד., המפסון, ס., & י ארקס, ב. א. (2017). למידה יעילה בתקשורת של רשתות עמוקות מנתונים מבוזרים. פרסומי הכנס הבינלאומי ה-20 לבינה מלאכותית וסטטיסטיקה, 1273–1282.
[[ii]]יאנג, ק., ליו, י., צ'ן, ט., & טונג, י. (2020). למידת מכונה מאוחדת: מושג ויישומים. ACM Transactions on Intelligent Systems and Technology, 10(2), 1–19.
[[iii]]פאן, ס. ג'., & יאנג, ק. (2021). סקר על למידה בהעברה. IEEE Transactions on Knowledge and Data Engineering, 33(12), 2345–2359.

טבלה 2: השוואת פרדיגמות למידה במגזר הפיננסי.5,6,7

התקדמות אחרונה מתמודדת עם אתגרים ספציפיים לתרחישים: FedSSL8 מתמודד עם מחסור בתוויות באמצעות למידה ניגודית, בעוד FedLite9 משיג הפחתת תקשורת של 490× למוסדות עם משאבים מוגבלים. הרחבות לבריאות10, פגיעויות אבטחה11, פיננסים רב-מודליים12, וסקלביליות13 מדגימות את היישום הרחב של FL.

הגנה על פרטיות היא מרכזית לשליטה בסיכונים פיננסיים. שלוש הטכניקות המרכזיות – פרטיות דיפרנציאלית (DP)14, חישוב מאובטח רב-צדדי (SMC)15, והצפנה הומומורפית (HE)16 – מציעות יתרונות מובחנים בחוזקה, יעילות וגמישות. DP מוגדר פורמלית על ידי Pr[M(x) = y] ≤ e ⋅ Pr[M(x') = y] + δ, כאשר M מייצג את האלגוריתם האקראי, $x$ ו-$x'$ מציינים מערכי נתונים שכנים, ו-y הוא פלט האלגוריתם. דבר זה מבטיח דמיון פלט בין מערכי נתונים, תוך הגבלת דליפה אישית באמצעות רעש שניתן לשליטה. ניתוח השוואתי של המאפיינים הטכניים שלהם מוצג בטבלה 3.

סוג הטכנולוגיהעקרונות יסודחוזק הפרטיות (ערך ε)מורכבות חישובהתאמה לתרחיש פיננסי
פרטיות שונהתרומות בודדות למערך הנתונים אינן ניתנות להבחנה על ידי הוספת רעשε=1-5 (ערך מומלץ לתרחישים פיננסיים)O (n) (n הוא גודל המדגם)תיכון, המתאים לכל תהליך ההכשרה המודלית, ניתן לשילוב בצורה חלקה עם למידה פדרטיבית
מחשוב רב-צדדי מאובטחמספר משתתפים משתפים פעולה לחישוב מבלי לחשוף תוצאות בינייםאבטחה תיאורטית של מידעO (n²) (תרחיש פדרלי אנכי)כן, היא מתאימה לחישוב מפרק תכונות רגישות, אך זה לוקח יותר מדי זמן בתרחישי דגימות גדולות
הצפנה הומומורפיתהנתונים המוצפנים מחושבים ישירות והתוצאה הנכונה מתקבלת לאחר הפענוחמאובטח חישוביתO (n³) (מבוסס על קריפטוגרפיה של רשת)נמוך, מתאים רק להעברת פרמטרים בקנה מידה קטן, מיליוני דגימות זמן חישוב תרחישים של יותר מ-24 שעות

טבלה 3: השוואת מאפייני טכנולוגיית הגנת פרטיות.

ביישומים פיננסיים, פרטיות דיפרנציאלית הפכה לבחירה המרכזית בשל "בקרת איזון אפקט פרטיות" שלה. Dwork, C.17 הציע את ההגדרה הקלאסית (ε, δ)-DP, שמספקת סטנדרט כמותי להגנה על פרטיות. הנוסחה המרכזית היא כדלקמן:

משוואה 3(1)

כאן M כאלגוריתם להגנת פרטיות, D ו-D הם מערך נתונים סמוך (הבדל מדגם אחד בלבד), תקציב פרטיות (ככל שההגנה על הפרטיות קטנה יותר, כך חזקה יותר), r תקציב פרטיות (ככל שההגנה על פרטיות קטנה יותר, כך חזקה יותר), δ ההסתברות לכישלון (בדרך כלל נלקחת 10-5).

עבאדי, מ. ואחרים, 18 פיתחו את Differential Privacy Stochastic Gradient Descent (DP-SGD), המשתמש בחיתוך גרדיאנט והזרקת רעש כדי להפחית את דליפת פרטיות מודל סיכון האשראי לפחות מ-8%. חישוב רב-צדדי מאובטח (SMC) והצפנה הומומורפית משמשים בעיקר לעיבוד רגיש. לדוגמה, Bogetoft, P. ואחרים, 19 יישמו את SMC על דירוג אשראי חוצה בנקים, תוך הבטחה שרק ציונים סופיים יהיו נגישים. Perri, L.2 הציע אלגוריתם הצפנה הומומורפי מלא לאגרגציה מאובטחת של פרמטרים, אם כי מורכבות חישובית גבוהה מגבילה את יישומו לאימון בקנה מידה קטן בקרב בנקים בגודל בינוני.

מודלים של בקרת סיכונים בבינה מלאכותית התפתחו מארכיטקטורות מרכזיות מסורתיות לארכיטקטורות מבוזרות, כאשר שני פרדיגמות מראות הבדלים משמעותיים בתלות בנתונים, בביצועים ובעלויות ציות. מודלים מרכזיים כוללים עצים להגברת גרדיאנט (GBDT) ומודלים של למידה עמוקה. אלגוריתם GBDT שהוצע על ידי Friedman, J., Hastie, T.Tibshirani, R.21 משפר את דיוק חיזוי הסיכון באמצעות אינטגרציה מרובת עצים, ומשיג AUC-ROC של 0.93 בתרחישי אשראי אישי. עם זאת, הדבר דורש איסוף נתוני לקוחות מלאים, מה שמציב סיכון לפרצות מידע ואתגרים לציות. ז'אנג, ה., ליו, י., ג'אנג, X., יין, Z.Li, Y.22 פיתחו מודל בקרת סיכונים מבוסס שנאי המשפר את שיעורי זיהוי ההונאה ב-15%, אך גודל הפרמטרים שלו עולה על 10 גיגה-בייט. הפרדיגמה המפוזרת כוללת גישות שיתוף פרמטרים ושיתוף תכונות. שיתוף פרמטרים (למשל, FedAvg) מאגד פרמטרים מקומיים אך מתקשה במאפיינים שאינם IID: AUC-ROC ירד מ-0.89 ל-0.82 כאשר פערי שיעורי ברירת מחדל עלו מ-0.5% ל-3.5%. שיתוף תכונות (למשל, SecureBoost) מאפשר שיתוף פעולה אנכי אך דורש יישור מדויק, כאשר הביצועים יורדים ב-20% כאשר השגיאות עולות על 5%.

ליבת הלמידה הפדרטיבית היא לאפשר הכשרה שיתופית רב-מוסדית ללא העברת נתונים גולמיים. מסגרת זו מגדירה את המשתתפים, תהליך ההכשרה ותפקיד המטרה. במחקר זה, המערכת מורכבת מצמתים של KFinancial (מסומנים כ-P1,P 2, ..., PK) ומתאם C. כל מוסד PK מחזיק במערך משוואה 10נתונים מקומי , Xk,i∈Rd שהם וקטורי תכונות הלקוח yk,i∈{0,1}, עבור תוויות סיכון (0 הוא נורמלי, 1 הוא הונאת ברירת מחדל), גודל מדגם מקומי, סולם משוואה 13נתונים מלא. ההכשרה מתבצעת בתהליך "איטרציה מקומית-אגרגציה גלובלית": i) אתחול: המתאם מייצר פרמטרים גלובליים ראשוניים θ0 ומפיץ אותם לכל המוסדות; ii) איטרציה מקומית: בסבב ההכשרה, המוסד PK מבוסס על נתונים מקומיים ופרמטרים גלובליים נוכחיים θt, וממזער את פונקציית ההפסד המקומית באמצעות ירידת גרדיאנט, ומקבלים את הפרמטרים המקומיים המעודכנים θt,k, כלומר:

משוואה 18(2)

כאשר n הוא קצב הלמידה ו-∇θLkt) הוא הגרדיאנט של האובדן המקומי, a θt הוא הגרדיאנט של האובדן המקומי a θt; iii) אגרגציה גלובלית: המוסד מצפין ומעלה פרמטר מקומי למתאם, המתאם מייצר פרמטרים גלובליים חדשים θt+1 לפי אגרגציה משוקללת בגודל המדגם:

משוואה 22(3)

iv) תנאי סיום: חזרו על שלבים 2-3 עד שביצועי המודל הגלובלי על קבוצת האימות לא משתפרים בסבבים עוקבים, הפלט את המודל הסופי. θ* = θT. בהינתן מאפייני ההתפלגות הזהה הלא-עצמאית (Non-IID) של נתונים פיננסיים, יש להרחיב את ההנחות של ממוצע פדרלי מסורתי (Fed AvgPk). מחקר זה עושה שימוש בממדים כפולים של "הטרוגניות בהתפלגות תווית" ו"הטרוגניות התפלגות תכונות" כדי לאפיין את ה-Non-IID: יש להגדיר את שיעור המקרים החיוביים (אירועים ברירת מחדל) במוסדות כך:

משוואה 24(4)

הגדר את מקדם האיזומורפיזם של התג ; יהי ההפרש הממוצע בין תכונות הקבוצה הוא , כאשר α>0.03 וכאשר נקבע שזה תרחיש שאינו IID גבוה.

בהתאם ליכולת ומטרת התוקף, תרחישי האיום מחולקים לשלוש קטגוריות, כפי שמוצג בטבלה 4

סוג האיוםזהות התוקפיםשק אגרוףאמצעים טיפוסיים
מתקפה חצי-אמיתיתמוסדות משתתפים/רכזיםהסקת מאפייני הלקוחות של מוסדות אחריםהתקפות היפוך גרדיאנט והסקת חברים המבוססות על פרמטרי המודל
התקפה עוינתמוסדות זדונייםמודל זיהום גלובליהעלאת גרדיאנטים שגויים ומודלים של רעל
התקפה חיצוניתצדדים שלישיים לא מורשיםגניבת פרמטרים/תכונות במהלך המעברהתקפות ביניים, האזנה לקישורי תקשורת

טבלה 4: סיווג מודל איומים של המערכת הפיננסית.

באמצעות (ε,δ) - פרטיות דיפרנציאלית (פרטיות דיפרנציאלית, DP) כסטנדרט הגנת פרטיות מרכזי, מהותה היא להוסיף רעש כך שניתן יהיה להתעלם מהשפעת "האם מערך הנתונים מכיל דגימה" על פלט המודל. ההגדרה הפורמלית היא כדלקמן: עבור אלגוריתמים של M בלמידה מאוחדת, אם עבור כל שני מערכי נתונים סמוכים ו- ששונים רק במדגם אחד (DΔD' = 1), כמו גם כל קבוצת S⊆Range(M) פלט, היא מקיימת:

Pr[M(D)∈S]≤eε⋅Pr[M(D')∈S]+δ (5)

אז זה נקרא מרוצה (ε,δ)-DP. אחד מהם הוא "תקציב הפרטיות" (ככל שההגנה על פרטיות קטנה יותר, כך היא חזקה יותר, והתרחיש הפיננסי בדרך כלל נלקח), δ ל"הסתברות לכשל" (בדרך כלל δ≤10-5 כדי להבטיח שאירועים בעלי הסתברות נמוכה לא ישפיעו על פרטיות וביטחון). כדי להסתגל למאפייני האיטרציה הרב-סיבובית של אימון פדרטי, צריכת הפרטיות הכוללת מחושבת באמצעות משפט השילוב של "פרטיות דיפרנציאלית רני" (RDP). תן לתקציב הפרטיות של כל סבב הכשרה להיות εt, ואז תקציב הפרטיות הכולל לאחר ההכשרה של המחזור מספק:

משוואה 32(6)

משפט זה מספק בסיס תיאורטי לכיול רעש אדפטיבי על ידי הקצאה דינמית של תקציב הפרטיות לכל סבב.

FedRisk עושה שימוש במסגרת פרטיות דיפרנציאלית (DP) קפדנית (ε, δ), ומקצה תקציבי פרטיות באופן דינמי באמצעות משפט הרכב רני DP (RDP). הוא מגדיר רגישות גלובלית Δf כשינוי מקסימלי בנורמת L1 בפרמטרי המודל שנגרם על ידי מערכי נתונים סמוכים (השונים בדגימה אחת), עם כיול רעש לפלס מודע לשונות (מקדם רעש κ_t פרופורציונלי לתנודות התפלגות הנתונים). במסגרת מגבלת תקציב הפרטיות הכוללת ε=5 (עומדת בספי עמידה ב-GDPR), RDP ממיר צריכת פרטיות אימון רב-סבבי ל-(ε, δ)-DP (δ=10⁻⁵), איזון בין חוזק ההגנה לתוצאות אמפיריות של תועלת המודלים מראות שזה מדכא AUC התקפת הסקת חברים ל-0.58 תוך שמירה על AUC-ROC של חיזוי סיכון ב-0.912.

אופטימיזציה של מודלים של בקרת סיכונים פיננסיים חייבת לעמוד בו-זמנית בשלוש דרישות רגולטוריות: "דיוק חיזוי", "הגנה על פרטיות" ו"הוגנות". פונקציות אופטימיזציה מסורתיות שמטרתן רק מזעור הפסדים כבר אינן רלוונטיות. יש להקים מסגרת אופטימיזציה רב-מטרתית שתהפוך מגבלות רגולטוריות למונחי רגולריזציה כמותיים. בתרחישי סיווג בינאריים (ברירת מחדל/נורמלית), אובדן לוגריתם (LogLoss) מאומץ כפונקציית ההפסד הבסיסית למדידת הסטייה בין הסתברויות חזויות על ידי המודל לבין תוויות בפועל, המוגדרת כך:

משוואה 33(13)

כאשר pk,i = σ(θ; xk,i) היא ההסתברות החזויה לברירת מחדל של המדגם (xk,i,y k,i) עבור המודל, σ(⋅) היא פונקציית ההפעלה של סיגמואיד.

דרישות ה-GDPR, חוק הגנת המידע האישי ותקנות נוספות מומרת לשלושה סוגי מונחי רגולריזציה, המשולבים עם פונקציית ההפסד הבסיסית ליצירת מטרת האופטימיזציה הסופית:

משוואה 37(14)

ההגדרה והפונקציה של כל מונח רגולריזציה הן: i) מגבלות פרטיות: בהתבסס על עלות הוספת רעש של פרטיות דיפרנציאלית, נדונה השפעת ההגנה הכמותית על פרטיות על דיוק המודל. יהי הרגישות הגלובלית של פרמטרי המודל Δ (כלומר, השינוי המקסימלי בפרמטרים הנגרם על ידי מערכי נתונים סמוכים), אז:

משוואה 39(15)

מונח זה מבטיח שעוצמת הרעש המוגברת תואמת את תקציב הפרטיות ומונע הקרבה מופרזת של דיוק המודלים. ii) מגבלת הוגנות: לאור דרישות ה"אנטי-אפליה" בחוק הגנת המידע האישי, הטיית החיזוי של קבוצות שונות מוגבלת. קחו לדוגמה את "שוויון דמוגרפי" (DemographicParity), יהי שיעור החיזוי החיובי של הקבוצה , משוואה 41אז:

משוואה 210 (16)

מונח זה ממזער את ההבדל בשיעור החיזוי בין קבוצות שונות ומונע אפליה במודל. iii) מגבלות עמידות: בתגובה לדרישות "יכולת המודל נגד הפרעות" בבאזל III, יש לוודא שהפרעות קטנות בנתונים אינן משפיעות משמעותית על פלט המודל. על ידי הוספת הפרעות Δx לדוגמה יריבה (מספקות את |Δx|≤γ), המחקר מגדיר:

משוואה 45(17)

החוסן של מודל המונח שיפור לנתונים חריגים משתפר והסיכון לטעות בשיפוט מצטמצם. בנוסחה זו, הוא מקדם הרגולריזציה, הוא נקבע באמצעות אימות צולב (במחקר זה λ1=0.01,λ2=0.05,λ3=0.02), להבטיח איזון בין שלושת היעדים הרגולטוריים לבין דיוק התחזית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ארכיטקטורת מערכת

רשת נתונים בין-מוסדית ושכבה סמנטית

כדי להתמודד עם הטרוגניות בין מוסדות בנתונים, המחקר בונה ארכיטקטורת Data Mesh באמצעות חלוקת צמתים מונחית תחום. כל מוסד פיננסי פועל כצומת תחום נתונים עצמאי תוך שמירה על זכויות בעלות ושליטה, כאשר השכבה הסמנטית מאפשרת הבנה ואינטראקציה מאוחדת של הנתונים. שכבת הסמנטיקה מבוססת האונטולוגיה יוצרת מודל נתונים מאוחד לבקרת סיכונים פיננסיים, המגדיר ישויות ליבה, תכונותמפת f ויחסי ישויות. כללי מיפוי סמנטי ספציפיים מפורטים בטבלה 5. בתחומים ספציפיים למוסד, המרות סטנדרטיות מושגות באמצעות פונקציות מיפוי סמנטי:

משוואה 48(18)

ישות גרעיןשם השדה A של המוסדשם תחום B במוסדשם שדה אחיד של שכבת סמנטיקהסוג הנתוניםכללים סטנדרטיים
לקוחדירוג לקוחות פרימיום (1-5)רמות לקוח VIP (ברונזה ליהלום)דירוג אשראי לקוחות (1-5)מספרים שלמיםברונזה→1, כסף→2, זהב→3, פלטינה→4, יהלום→5
עסקיםסכום העסקה (עשרת אלפים יואן)סכום העסקה (יואן)סכום העסקה (יואן)מספר צףערך שדה ה-A במוסד הוא פי 10,000
בקשת קרדיטמכסת המועמדים (יחס קרדיטים)סכום האשראי הצפויסכום הלוואה למבקש (יואן)מספר צףמוסד א': יחס סך האשראי × סכום הבקשה; מוסד B: מיפוי ישיר

טבלה 5: כללי מיפוי סמנטי של ישויות ליבה בתחום בקרת הסיכונים הפיננסיים.

כאן xi,j ערך השדה הספציפי i-th של המוסד j, min(xj) ו-max(xj) הם הערכים המינימליים והמקסימליים של השדה בתוך המוסד, בהתאמה, Uj ו-Lj מגדירים את הגבולות העליונים והתחתונים של טווח הערכים המאוחדים של שדה זה בשכבה הסמנטית.

רישום וביקורת גלובליים מבוססי בלוקצ'יין

כדי לפתור בעיות של ניהול גרסאות מודל כאוטי ותהליכי אימון בלתי ניתנים למעקב בלמידה מאוחדת, נעשה שימוש בטכנולוגיית בלוקצ'יין להקמת מערכת רישום גלובלית של מודלים ומערכת מעקב ביקורתית. באמצעות ארכיטקטורת בלוקצ'יין של קונסורציום, הצמתים המשתתפים כוללים מוסדות פיננסיים, רכזים פדרטיביים וגופים רגולטוריים, מה שמבטיח אי-שינוי נתונים והסכמה רב-צדדית23. רישום המודלים הגלובלי מאחסן מטא-דאטה מרכזיים של מודלים, כולל מספרי גרסאות, סבבי הדרכהHv, רשימות של מוסדות משתתפים, פרמטרים מבניים ומדדי ביצועים. מטא-דאטה זו נשמרת באמצעות מבנה עץ מרקל, כאשר כל גרסת מודל מתאימה לערך גיבוב ייחודי:

משוואה 57(19)

כאן v הוא מספר גרסת המודל, T הוא סך סבבי האימון, S הוא אוסף המוסדות המשתתפים בהכשרה, IDi הוא מזהה ייחודי של מוסד i, θv הוא וקטור הפרמטר של המודל עבור הגרסה v, ו-AUCv הוא ערך AUC-ROC של גרסה זו של המודל המוצג.

צינור הנדסת תכונות מאוחד

יישור ישיות מאובטח והרמוניזציה של סכימות

הנדסת תכונות משמשת כרכיב מרכזי בשיתוף פעולה בין-מוסדי בנתונים, ודורשת חילוץ, יישור ואגרגציה יעילים של תכונות תוך שמירה על פרטיות הנתונים. מחקר זה מתכנן צינור מקיף הכולל יישור ישות מאובטח, תיאום סכימות ואגרגציה של גרפים של עסקאות מוטמעת פרטיות דיפרנציאלית, כדי להתמודד עם הטרוגניות תכונות חוצות מוסדות וסיכוני דליפת פרטיות24. יישור בין ישויות בין-מוסדי הוא חיוני להשגת שיתוף פעולה בתכונות. עם זאת, שידור ישיר של מזהי לקוחות יפגע בפרטיות. לכן, המחקר מאמץ שיטת יישור ישויות השומרת על פרטיות, המשלבת הצפנה הומומורפית (HE) עם טכנולוגיית גיבוב רגיש למיקום (LSH). מוסדות מעבדים מראש מזהי לקוחות באמצעות פונקציות גיבוב SHA-256 ליצירת מזהים ראשוניים. מזהים אלו ממופים לאותו "דלי" דרך LSH כדי להפחית את חישוב ההצפנה הבא. מזהים בתוך אותו דלי עוברים הצפנה הומומורפית של פיילייה. המזהים המוצפנים מועלים למתאם הפדרטיבי, שמשיג יישור ישויות על ידי השוואת דמיון בין מזהים מוצפנים באמצעות דמיון קוסינוס.

משוואה 64(20)

כאשר הדמיון גדול מהסף שנקבע מראש (במחקר זה, הוא נחשב כ-τ=0.95), נקבע שמדובר באותה ישות, ונוצר מזהה ישות מאוחד בין מוסדות כדי להשיג יישור ישות מאובטח.

אגרגציה פרטית דיפרנציאלית של הטמעות גרף עסקאות

נתוני העסקאות הפיננסיות מציגים מאפיינים מובנים גרפים מובחנים (כאשר לקוחות הם צמתים ועסקאות הן קשתות). הטמעת גרף העסקאות לוכדת ביעילות את דפוסי העסקאות של הלקוח עם צד קשור, ומספקת תכונות קריטיות למודלים של בקרת סיכונים. עם זאת, איגום ישיר של הטבעות גרף עסקאות חוצות מוסדות Gi=(Vi,E i)ViiEie i,v∈Rdd עשוי לדלוף מידע הקשור לעסקאות של לקוחות. לכן, טכנולוגיית DifferentialPrivacy (DP) הוכנסה כדי להשיג אגרגציה של הטמעות גרפי עסקאות לשמירה על פרטיות. כל מוסד בונה באופן מקומי גרף עסקאות, כאשר מייצג את קבוצת צמתים הלקוחות של המוסד ומייצג את קבוצת קשתות העסקה (משקלי קשתות השוות לסכומי העסקה). אלגוריתם GraphSAGE משמש ליצירת הטמעות-צמתים (עם ממדים של 256 ממד במחקר זה). כדי לעמוד בדרישות פרטיות דיפרנציאלית, רעש לפלסיאני מתווסף להטמעות:

משוואה 67(21)

כאן ΔG רגישות גלובלית של אלגוריתם GraphSAGE (הוערך בניסוי במחקר זה ΔG=0.8), עבור תקציב הפרטיות המקומי של הסוכנות,

משוואה 70(22)

עבור תקציב הפרטיות הכולל של המערכת, מחקר זה לוקחε בסך הכל=1.5). המתאם מאגד את הטמעת הרעש של כל מוסד באמצעות אסטרטגיית ממוצע משוקלל משוואה 72 , עם משקלים המבוססים על אחוז הלקוחות בכל מוסד:

משוואה 73(23)

גרף העסקאות משוואה 200 הגלובלי המצטבר מוטמע ומוזן חזרה לכל מוסד. כתכונה מרכזית במודל בקרת הסיכונים, הוא לא רק שומר על מידע הקורלציה של עסקאות בין-מוסדיות, אלא גם מגן על פרטיות הלקוחות באמצעות פרטיות דיפרנציאלית.

משוואה 201 (24)

מודל סיכון היברידי של בינה מלאכותית

תתי-מודלים מקומיים: הגברת גרדיאנט עם אילוצים מונוטוניים

מודלים מסורתיים של בקרה מרכזית בסיכונים מבוססי בינה מלאכותית מתקשים להסתגל לתרחישים מאוגדים בין מוסדות. מחקר זה מפתח מודל סיכון היברידי מבוסס בינה מלאכותית המשלב "תתי-מודלים מקומיים + מודל מיזוג גלובלי", ומשלב את יכולת הפרשנות הגבוהה של עצי הגברת הגרדיאנט (GBDT) עם היכולת של טרנספורמר להסתגלות לנתונים לא עצמאיים ומפוזרים זהה (NID). מודול פרשנות מוצג כדי לאזן בין ביצועי מודל להסברים בסביבות מאוחדות. כל מוסד בונה באופן מקומי תתי-מודלים של GBDT, שנבחרו בשל יכולת התאמת נתונים מבנית חזקה ויכולת פרשנות גבוהה – דרישות חיוניות לרגולציה של בקרת סיכונים פיננסיים. כדי למנוע התאמת יתר ומסקנות לא הגיוניות, מיושמים מגבלות מונוטוניות במהלך ההכשרה של GBDT, המאכפות דפוסים מונוטוניים של עלייה או ירידה עבור תכונות מרכזיות כמו הכנסות לקוחות וציוני אשראי. העץ הראשון שנקבע על ידי GBTD הוא ht(x), והפלט של המודל הוא:

משוואה 76(25)

כאן, η הוא קצב הלמידה (מחקר זה דורש η=0.1). אילוץ מונוטוני מתממש על ידי רגולריזציה של פונקציית הפסד xj.

הוסף איבר אילוצ:

משוואה 80(26)

כאן, x≺x' מייצג שהערך העצמי של x קטן מהערך העצמי של x', ופונקציית ההפסד הסופית היא:

משוואה 84(27)

כאן, l היא פונקציית ההפסד הלוגריתמית (המשמשת בתרחיש בקרת הסיכון הבינארי yi∈{0,1}, המציינת האם הלקוח מבצע את ברירת המחדל). משוואה 87 הוא מונח הרגולריזציה של המורכבות עבור העץ, λ ו-γ הם מקדם הרגולריזציה (מחקר זה נערך באמצעות λ=0.01 γ=0.5 אימות צולב, ni הוא מספר המדגמים המקומיים של המוסד i,T הוא מספר העצים (מחקר זה לקח T=100).

מיזוג גלובלי: טרנספורמטור מבוסס קשב להתאמה ללא IID

נתונים בין-מוסדיים מציגים מאפייני התפלגות משמעותיים שאינם IID. אלגוריתמים מסורתיים של FedAvg, שמבצעים פשוט ממוצע פרמטרים מקומיים של המודל, מתקשים להסתגל לנתונים שאינם IID. כדי להתמודד עם זה, המחקר מציג מודל קשב p(i(x)=σ(Fi(x))σFi(x)ia מבוססi למיזוג חכם של תת-מודלים מקומיים. מודל ההיתוך הגלובלי מקבל כקלט את הסתברויות הפלט מתת-המודל המקומי של כל מוסד (פלטי פונקציית סיגמואיד ממודלים מוסדיים של GBDT). ארכיטקטורת הטרנספורמר מורכבת מקודד ושכבת תשומת לב, שבה שכבת הקשב מחשבת משקלי תשומת לב מתוצרי מוסדות שונים כדי להשיג משקל אדפטיבי. משקלי הקשב מחושבים באמצעות קשב נקודתי-מכפל מדורג:

משוואה 94(28)

כאן, q הוא וקטור השאילתה (הנוצר על ידי תכונות הסיכון הממוצעות של מדגמים גלובליים), משוואה 96 הוא וקטור המפתח של המוסד i,d k הוא ממד וקטור המפתח (במחקר זה dk=64), n הוא מספר הסוכנויות המשתתפות בפדרציה.

ההסתברות הסופית של המודל הגלובלי היא:

משוואה 101(29)

באמצעות מנגנון הקשב, המודל הגלובלי יכול להעניק משקל גבוה יותר אוטומטית למוסדות בעלי איכות נתונים גבוהה וחיזוי סיכונים מדויק, ולשפר את ההתאמה לנתונים שאינם IID.

מודול הסברנות: SHAP על עצים מאוחדים + מחולל נגד עובדות

מודלים של בקרת סיכונים פיננסיים חייבים לשמור על פרשנות כדי לעמוד בדרישות הרגולציה ולהגן על זכות הלקוחות לדעת. כדי להתמודד עם זה, המחקר מפתח מודול פרשנות המשלב מחוללי SHAP+ מאוחדים. עבור תתי-מודלים מקומיים של GBDT, המחקר עושה שימוש בערכי SHAP למדידת חשיבות התכונות, אשר SiR N i×mמכמת את תרומת כל תכונה לתוצאות החיזוי. בתרחישים מאוחדים, שידור ישיר של ערכי SHAP מקומיים עלול לפגוע במידע על התפלגות התכונות. לכן, המחקר מיישם אסטרטגיית אגרגציה מאובטחת שבה כל מוסד מחשב מקומית את מטריצת ערכי SHAP (למספר תכונות), מיישם רעש פרטיות דיפרנציאלי לערכי SHAP, ומעלה אותם למתאם המאוחד. המתאם מחשב אז את ערכי SHAP הגלובליים:

משוואה 103(30)

כאן, Si' הוא מטריצת הערך של SHAP של המוסד i, ו-wi הוא היחס מגודל המדגם של המוסדות.

הכנס את וקטור העצמי הנוכחי של הלקוח x ואת דירוג הסיכון היעדיy, הפלט הוא וקטור תכונה אנטי-עובדתי xcf, מסופק (סף ההסתברותשל יעד θ התואם לדירוג הסיכון היעד). ו|xcf-x|2 המינימום (כלומר, עלות ההתאמה הנמוכה ביותר). פונקציית האובדן של מחולל העובדות היא:

משוואה 110(31)

כאן α,β,γ הם מקדמי המשקל (במחקר זה α=10,β=5,γ=1),LGAN פונקציית ההפסד היריבה משמשת עבור GAN כדי להבטיח את הרציונליות והאותנטיות של וקטור התכונה הנגד-עובדתי.

שכבת פרטיות ואבטחה

אגרגציה מאובטחת עם שיתוף סודות מצטברים

בלמידה מאוחדת, העברת ואגרגציה של פרמטרי מודל מקומיים היא קישור מרכזי בדליפת פרטיות. טכנולוגיית AdditiveSecretSharing (ASS) מאומצת להשגת אגרגציה מאובטחת ולמנוע רכישה ישירה של פרמטרי מודל מקומיים של כל ארגון על ידי המתאמ. התהליך הספציפי הוא כדלקמן: i) כל מוסד יחלק את פרמטרי המודל המקומיים למניות סודיות θ i,1,θi,2,...,θi,n , ומקיים משוואה 118, להלן מספר המוסדות המשתתפים; ii) המוסד i שולח את החלק θi,k למוסד (k≠i), שומר על חלקו θi,i; iii) כל מוסד k אוסף מניות שנשלחו על ידי כל המוסדות האחרים θ1,k,θ 2,k,...,θn,k , ומסכם זאת עם θk,k המניה שנשמרת על ידו, ומקבלים את הסכום החלקי ; iv) כל המוסדותיעלו וישתפו חלק ממנו עם המתאמ, המתאם מחשב את תוצאות משוואה 126אגרגציית הפרמטרים הגלובלית . באמצעות שיתוף סוד מצטבר, המתאם יכול לקבל רק פרמטרים מצטברים גלובליים ואינו יכול להסיק n-1ttt=⌈n/2⌉ את הפרמטרים המקומיים של מוסד מסוים. אפילו שיתוף פעולה בין מספר מוסדות אינו יכול לשחזר פרמטרים מאחרים, מה שמבטיח פרטיות ואבטחה במהלך העברת הפרמטרים. כדי להתמודד עם אובדן מניות הנגרם מניתוקים מוסדיים, מנגנון שיתוף סוד שמיר הוצג כגיבוי. כל מניה מחולקת עוד לקטעים. על ידי איסוף כל קטע, ניתן לשחזר את החלק המלא, ובכך לשפר את עמידות המערכת.

כיול רעש אדפטיבי לפי לוח זמנים תקציבי (ε, δ)-DP

האתגר המרכזי של פרטיות דיפרנציאלית טמון באיזון בין חוזק הגנת הפרטיות לביצועי הדגם. שיטות החיבור המסורתיות של רעש קבוע מתקשות להסתגל לתרחישים שבהם התפלגויות הנתונים משתנות באופן דינמי במהלך האימון המאוחד. מחקר זה מתכנן מנגנון כיול רעש אדפטיבי המבוסס על (ε,δ)-DP, בשילוב עם אסטרטגיית תזמון תקציב פרטיות, כדי להשיג התאמה דינמית של עוצמת הרעש. הגדר את תקציב הפרטיות הכולל של המערכת כך (מחקר זה לוקח δסך = 10-5 , עומד בדרישות ה-GDPR לסיכון פרטיות), אימץ את אסטרטגיית תזמון התקציב המקוטעת, התקציב הכולל מוקצה למחזור ההכשרה {ε1,ε 2,...,εT} כדלקמן, ממולא:

משוואה 130(32)

בכל סבב אימון, עוצמת הרעש מותאמת דינמית בהתאם למאפייני ההתפלגות של הנתונים המקומיים. בהנחה שהשונות של תכונות הנתונים המקומיות של סבב ה-t של המוסד היא משוואה 132, הגדר את מקדם התאמת הרעש αi,t:

משוואה 134(33)

כאשר αi,t≥0.8 (התפלגות הנתונים יציבה), באמצעות עוצמת משוואה 136רעש קטנה ; כאשר αi,t<0.8 (התפלגות הנתונים משתנה) , מגבירים את עוצמת הרעש . ביניהן, הרגישות הגלובלית של פרמטרי המודל (מחקר זה מבטיח באמצעות חיתוך גרדיאנט).

פרוטוקול אימון יעיל בתקשורת

עדכוני לקוח אסינכרוניים עם בקרת שעון

למידה פדרטיבית בין-מוסדית מתמודדת עם אתגרים כמו עיכוב תקשורת גבוה וצריכת רוחב פס משמעותית (במיוחד עבור מוסדות פיננסיים קטנים ובינוניים עם משאבי רשת מוגבלים). מחקר זה מעצב פרוטוקול אימון תקשורת יעיל הכולל עדכוני לקוח אסינכרוניים, דחיסת גרדיאנטים ומשוב שגיאות כדי להפחית עלויות תקשורת ולשיפוריכולת ההתרחבות של המערכת. שיטות אימון סינכרוניות מסורתיות כמו FedAvg דורשות המתנה שכל הלקוחות יסיימו את ההכשרה המקומית לפני צבירת הפרמטרים, מה שמוביל למחזורי הכשרה ארוכים. מנגנון עדכון הלקוח האסינכרוני מאפשר ללקוחות להשלים באופן עצמאי אימון מקומי ולהעלות מיד פרמטרים. עם קבלת הפרמטרים הללו, המתאם המאוחד מעדכן את המודל הגלובלי בזמן אמת מבלי להמתין ללקוחות אחרים. זה פותר את בעיית המודל המיושנות באימון אסינכרוני. בהצגת אסטרטגיית בקרת השעמות, הגדר את ערך הקיפאון עבור הלקוח ,(עבור סבב ההכשרה הגלובלי הנוכחי,t last_update הסיבוב שבו הלקוח קיבל את המודל הגלובלי לאחרונה). כאשר (Sמקסימום הוא העייפות המקסימלית המותרת, מחקר זה לוקח sמקסימום=5). הלקוח משתתף בהכשרה כרגיל; במקסימום הזמןהזה> הלקוח צריך להוריד שוב את הדגם הגלובלי העדכני לפני ההדרכה המקומית. תצורת החומרה כוללת מעבדי Intel Xeon E5-2678 v3 (12 ליבות, 2.5GHz) המשולבים עם כרטיסי NVIDIA Tesla V100 (16GB VRAM) וזיכרון DDR4 של 64GB לכל צומת לטיפול יעיל בעומסי עבודה מבוזרים. לאתחול תוכנה, פקודות PySyft כמו hook = sy. TorchHook(torch)andvirtual_worker = sy. VirtualWorker(hook, id="client1") משמשים להקמת חיבורים מאוחדים מאובטחים, בעוד federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) מאפשר טעינת נתונים מאוחדת בין המשתתפים. מיפוי סמנטי משנה תכונות פיננסיות בין מוסדות – למשל, המרת סכומי העסקה מדולר אמריקאי ל-CNY באמצעות נוסחת שער חליפין דינמית: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0.001 randn()), שבה שער החליפין מתעדכן מעת לעת באמצעות API (API). כדי להעשיר מאגרי נתונים לא מאוזנים, CopulaGAN מייצר דגימות סינתטיות של עוינות עם קטע קוד כמו מ-sdv.tabular import CopulaGAN; סינתיסייזר = CopulaGAN(אפוקים=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000), תוך שמירה על תכונות סטטיסטיות של הנתונים המקוריים. ההכשרה המקומית של GBDT אוכפת מגבלות מונוטוניות (למשל, להבטיח ש"credit_score" מתואמת באופן חיובי עם "approval_probability") ויאפרמים = {"monotonic_constraints": (1, 0, -1)}ב-LightGBM, בעוד שמיזוג טרנספורמר מיושם ב-PyTorch עם שכבות קשב מרובות ראש:self.attention = nn. MultiheadAttention (embed_dim=64, num_heads=4); attn_output, _ = self.attention(שאילתה, מפתח, ערך, key_padding_mask=padding_mask), ואחריו נרמול שכבה וחיבורים שאריים ליציבות. פרטיות דיפרנציאלית מזריקה רעש לפלס מותאם לרגישות L1 (Δf) ולתקציב הפרטיות (ε) – לדוגמה, הוספת רעש שנדגם מ-np.random.laplace(loc=0, scale=Δf/ε) כאשר Δf=1.2 ו-ε=0.5 למדרגות לפני האגרגציה. מגבלות הוגנות מיושמות לאחר האימון על ידי שינוי משקל המדגמים הפוך לשכיחות הקבוצתית שלהם (sample_weight = 1 / group_counts[y_train]) כדי לצמצם הפרות שוויון דמוגרפי. במקביל, אסטרטגיית האגרגציה המשוקללת משמשת לכיוון משקל פרמטרי הלקוח בהתאם לערך השחוק:

משוואה 143(34)

כאשר λ=0.1 הוא מקדם עונש הקישה; ככל שהעייפות גדולה יותר, כך המשקל קטן יותר, מה שמפחית את השפעת הפרמטרים המיושנים על המודל הגלובלי.

דחיסת גרדיאנט והצטברות משוב שגיאות

פרמטרי המודל (במיוחד משקלי הקשב במודלים גלובליים של ההיתוך של טרנספורמר) הם בעלי מורכבות ממדית גבוהה. שידור ישיר היה צורך רוחב פס מופרז, מה שמחייב טכניקות דחיסת גרדיאנט להפחתת העברת נתונים26. מחקר זה משלב פיזור טופ-K עם דחיסת קוונטיזציה, בהתאם לשלבים הספציפיים הבאים: i) Top-K sfrase: עבור המודל המקומי ∇θi גרדיאנט, בחר את אלמנט הגרדיאנט K% עם הערך המוחלט הגדול ביותר לשמור, K שאר האלמנטים הם אפס, הערך מותאם דינמית בהתאם לתנאי רוחב הפס (כאשר רוחב הפס מספיק K=30, כאשר רוחב הפס מוגבל K=10); ii) דחיסת קוונטיזציה: האלמנטים הגרדיאנטיים השמורים מקוונטיזציה מנקודה צפה של 32 ביט למספרים שלמים של 8 ביט. נוסחת הקוונטיזציה היא:

משוואה 150(35)

  

iii) משוב שגיאה: אחסון הגרדיאנט הנזרק Δ∇=∇θi-∇θi שגיאת דחיסה בצד הלקוח. בחישוב הגרדיאנט הבא, השגיאה מצטברת לגרדיאנט החדש, גישה, משוואה 202 , מפצה על הפסדי דחיסה. השפעות דחיסת הגרדיאנט ומשוב שגיאה מוצגות בטבלה 6, In, תנאי קוונטיזציה 8 K=20% סיביות, יחס הדחיסה מגיע ל-15:1 (נפח נתונים מקורי/נפח נתונים דחוס), ובאמצעות משוב שגיאות, AUC-ROC של המודל יורד רק ב-0.5%-1.0%, ומביא את האיזון בין עלות התקשורת לביצועי המודל27.

אסטרטגיות דחיסהיחס הפחתהצריכת רוחב פס בהעלאה (MB/round)שיעור הירידה של AUC-ROCקצב קיצור זמן האימון
לא דחוס (נקודה צפה 32 ביט)1:011280.00%0.00%
קוונטיזציה של 30% עליונים עם דלילות + 16 ביט6.7:119.10.30%35.20%
20% עליונים של דלירות + קוונטיזציה של 8 ביט15:018.50.80%58.70%
10% עליונים של דליל + קוונטיזציה של 8 ביט30:01:004.32.10%72.10%

טבלה 6: השוואת ביצועים של אסטרטגיות דחיסת גרדיאנט.

רגולריזציה מודעת להוגנות

מודלים של בקרת סיכונים פיננסיים חייבים להימנע מאפליה נגד קבוצות מסוימות ולעמוד בדרישות רגולטוריות, כולל חוק הגנת המידע האישי וחוק דיווח האשראי ההוגן. מחקר זה מציג מנגנון רגולריזציה מודע להוגנות כדי להגביל הטיות חיזוי בין-קבוצתיות במהלך אימון המודלים, ומבטיח הוגנות במודל. מוגדרים שני מדדי הוגנות מרכזיים: i) שוויון דמוגרפי (DP): שיעור החיזוי החיובי שווה עבור קבוצות שונות, גישה, משוואה 154, מבין g יש מזהה קבוצתי; ii) שוויון הזדמנויות (EO): שיעור החיובי האמיתי שווה בין קבוצות, גישה משוואה 155. הוסף מונחי רגולריזציה של הוגנות לפונקציית ההפסד של מודל הסיכון ההיברידי של הבינה המלאכותית, והטיל מגבלות על תת-מודל GBDT המקומי ועל מודל הטרנספורמר הגלובלי בהתאמה: iii) מגבלות הוגנות למודל המקומי:

משוואה 156

כאן PR(g=A) הוא קצב החיזוי החיובי עבור הקבוצה g, λ ו- הוא מקדם הרגולריזציה להגינות.

iv) מגבלת הוגנות במודל גלובלית: מוסיפים את התאמת משקל ההגינות הקבוצתית לשכבת הקשב של הטרנספורמר, פלט המודל עבור קבוצות פגיעות ag=a base×(1+β⋅Δלא הוגן) מקבל משקל תשומת לב גבוה יותר, כאן, Δלא הוגן מייצג את הטיית ההוגנות בין קבוצה זו לקבוצה הדומיננטית (Δלא הוגן=PR (קבוצה דומיננטית)-PR (קבוצות פגיעות)); λEO הוא מקדם פיצוי הסטייה. השפעת רגולריזציה של תפיסת ההגינות מוערכת על ידי ΔDP (סטיית DP), ΔEO (סטיית EO) ושגיאת כיול קבוצתית.

לוח מחוונים למודלים של ממשל וציות

ניטור הטיה בזמן אמת

כדי לעמוד בדרישות הרגולציה הפיננסית בניהול מחזור חיים של המודלים, המחקר פיתח לוח מחוונים לממשל מודלים וציות המשלב ממשקי API של ניטור סטיות בזמן אמת ודיווח רגולטורי, ומאפשר פיקוח מלא של תהליכים ומעקב לאורך כל תקופת ההדרכה, הפריסה והאיטרציה של המודלים. מודול ניטור הסטיות בזמן אמת משיג מעקב דינמי אחר הוגנות וביצועים של מודל דרך הממדים הבאים: i) ניטור סטיות קבוצתיות: סיווג קבוצות לפי מגדר לקוח, גיל, אזור, רמת הכנסה וכו', חישוב PR, TPR ו-FPR (שיעור חיובי שגוי) לכל קבוצה לפי שעה. התרעות סטייה מופעלות כאשר הבדלי PR בין קבוצות עולים על 0.08 או הבדלי TPR עולים על 0.05; ii) ניטור סטיית ביצועים: חישוב רציף של מדדים כמו AUC-ROC ו-PR-AUC. כאשר מדדים אלו יורדים ביותר מ-2% ברציפות במשך שלוש שעות, זה נקבע כסטיית ביצועים, ומתחיל אוטומטית את תהליך האימון מחדש של המודל. iii) ניטור ציות לפרטיות: רשם את צריכת תקציב הפרטיות ואת הוספת הרעש εעוצמה כוללת של כל סבב אימון. כאשר צריכת ε של כדור אחד עולה על זה, עצרו את האימון והתאימו את אסטרטגיית הרעש. iv) נתוני ניטור מוצגים דרך לוחות מחוונים ויזואליים, המאפשרים לרגולטורים ולמוסדות המשתתפים לצפות בהם בזמן אמת, ולהשיג ניהול שקוף של סיכוני המודלים.

API לדיווח רגולטורי

כדי לפשט את תהליך הדיווח הרגולטורי, תוכנן API לדיווח רגולטורי סטנדרטי כדי לתמוך ביצירה אוטומטית של דוחות התואמים לרגולציות כמו GDPR, CCPA וחוק הגנת המידע האישי של סין. הפונקציות המרכזיות כוללות: i) דוח עמידה במקורות נתונים: מאגד אוטומטית סוגי נתונים, נפחים וסטטוס הרשאה של המוסדות המשתתפים כדי לוודא עמידה בעיקרון "המינימום הנדרש"; ii) דוח עמידה בדרישות הדרכה מודלית: איטרציות הדרכת רשומות, מוסדות משתתפים, אמצעי הגנה על פרטיות ומדדי הוגנות ליצירת דוח מעקב אחר הדרכה מודלית; iii) דוח ציות לחיזוי סיכונים: מציג דפוסי התפלגות תואמי רגולציה של תחזיות מודל בין קבוצות שונות ומקרים של הסברים נגדיים להוכחת אי-אפליה. ה-API מאמץ סגנון עיצוב RESTful, התומך בפלטים בפורמט JSON ו-XML. הרשויות הרגולטוריות יכולות לגשת ישירות לנתוני הדיווח דרך ממשקי API או להגדיר מחזורי דיווח אוטומטיים להשגת תהליכים רגולטוריים אוטומטיים וסטנדרטיים. תבניות הדוח עומדות בסטנדרטים של מודל הרגולציה הפיננסי של הארגון הבינלאומי לתקינה (ISO), ומבטיחים את הסמכות והאוניברסליות של הדוחות.

עיצוב ניסוי: תיאור מאגר הנתונים

נתוני כרטיסי אשראי והלוואות לעסקים קטנים ובינוניים רב-מוסדיים

הנתונים הניסיוניים הגיעו ממוסדות פיננסיים בסין, וכללו סוגי נתונים כגון עסקאות אישיות בכרטיסי אשראי ורשומות בקשות והשלמת הלוואות של עסקים קטנים ובינוניים. טכנולוגיית CopulaGAN שימשה לסינתזה ושיפור אירועים נדירים של הונאה, ובכך לבנות מאגר נתונים ניסיוני המשלב אותנטיות עם שלמות. הנתונים האמיתיים ששימשו בניסוי כוללים שתי קטגוריות עיקריות: נתוני עסקאות כרטיסי אשראי אישיות ונתוני הלוואות לעסקים קטנים ובינוניים, בסך הכל מעל 5 מיליון רשומות הנפרשות מינואר 2022 ועד דצמבר 2023. הנתונים מכסים ארבעה אזורים כלכליים עיקריים – צפון סין, מזרח סין, דרום סין ודרום-מערב סין – כדי להבטיח ייצוג גאוגרפי וגיוון בהתפלגות המדגם. התחומים המרכזיים והמאפיינים הסטטיסטיים של הנתונים המוסדיים מוצגים בטבלה 7. ביניהם, מוסדות A ו-B הם בנקים מסחריים ארציים עם בסיס לקוחות גדול בכל קבוצות הגיל; מוסדות C ו-D הם בנקים אינטרנטיים המשרתים בעיקר את האוכלוסייה הצעירה (20-35); Institution E היא חברת מימון צרכני המיועדת למשתמשים בשווקים נמוכים, כאשר הפצת הנתונים מציגה מאפיינים משמעותיים שאינם IID. מערך הנתונים מכיל 115610 פריטי נתונים. מערך הנתונים מסופק על ידי מוסדות פיננסיים שמשתפים פעולה עם אוניברסיטאות

סוג הנתוניםמוסדמספר התקליטים (10,000)מספר הלקוחות (10,000)שדות ליבהשיעור הונאת חדלות פירעוןמאפייני התפלגות הנתונים
עסקאות בכרטיסי אשראיA18085זמן העסקה, סכום, סוג סוחר, מיקום העסקה, האם לגנוב את הכרטיס0.32%עסקאות גדולות מהוות אחוז גבוה (> 5000 יואן)
עסקאות בכרטיסי אשראיB15072מספר זרימת עסקאות, סכום (USD/RMB), ערוץ תשלום, דירוג לקוח0.28%עסקאות חוצות גבולות מהוות 15%
עסקאות בכרטיסי אשראיC12068חותמת זמן לעסקה, סכום, האם להתקין, גיל הלקוח, מיקום מספר הטלפון הנייד0.45%מסחר קטן בתדירות גבוהה (<1000 יואן) מהווה 60%)
הלוואות לעסקים קטנים וקטניםD321.2שם החברה, סכום ההלוואה, תקופת האשראי, סולם הכנסות, סכום מס, האם פיגר2.80%לקוחות הייצור מהווים 40%
הלוואות לעסקים קטנים וקטניםE180.8תאריך בקשת ההלוואה, סכום צפוי, סוג העסק, מספר העובדים, רישום ביצועים היסטורי3.50%לקוחות שירות מהווים 70%

טבלה 7: מאפיינים סטטיסטיים של מאגר נתונים פיננסיים ריאליים רב-מוסדי.

כדי להתמודד עם ההטרוגניות של נתונים בין-מוסדיים, הניסוי דבק בקפדנות במפרטי רשת הנתונים והשכבה הסמנטית על ידי סטנדרטיזציה של שדות מוסדיים: לדוגמה, המרת "סכום העסקה (USD)" של מוסד B ל-RMB באמצעות שער החליפין של תאריך העסקה ואיחוד שם השדה ל"סכום עסקה (YOAN)"; המרת "גיל הלקוח" של מוסד C (פורמט "1990-01-01") לגיל שלם; ומיפוי "סולם ההכנסות הארגוני" של מוסד D (מסווג כ"מתחת ל-1 מיליון / 1-5 מיליון / מעל 5 מיליון") לנקודות אמצע בטווחים מספריים (500,000,3,000,000,7,500,000), תוך הבטחת עקביות בין פורמט הנתונים למשמעות סמנטית.

הרחבה סינתטית דרך CopulaGAN לאירועי הונאה נדירים

בתרחישי בקרת סיכונים פיננסיים, מדגמים של הונאה/חדלות פירעון מהווים בדרך כלל אחוז נמוך מאוד. שימוש ישיר בגודל מדגם כה קטן לצורך אימון מודלים היה מוביל לבעיות חוסר איזון חמורות במחלקות, מה שפוגע ביכולות ההכללה של המודל. הניסוי עושה שימוש ב-Copula GAN (רשת יריבה גנרטיבית המבוססת על פונקציות Copula) כדי לסנתז נתונים מוגברים למקרים נדירים של הונאות. שיטה זו משלבת את יכולת פונקציית Copula למודל התפלגויות נתונים בממדים גבוהים עם יכולות הגנרטיביות של GAN, ומאפשרת יצירת נתונים סינתטיים התואמים לדפוסי הונאה אמיתיים, תוך הימנעות מבעיית "קריסת תבניות" הנפוצה ביצירת GAN מסורתית.

מבנה מודל CopulaGAN

CopulaGAN מורכב משלושה חלקים: מחולל, מבחין ומודול אילוצים להתפלגות קופולה: (1) גנרטור: קלט הוא וקטור רעש אקראי בעל 128 ממד z∼N(0,1), ומפיק וקטור תכונות סינתטי התואם לממד הדגימה האמיתי דרך רשת מחוברת במלואה בת 3 שכבות (ממדי השכבה הנסתרת הם 256, 512, 256); (2) מבחין: הקלט הוא דגימה אמיתית או דגימהסינתטית x סינטר, ובאמצעות פונקציית הפעלה של רשת+סיגמואיד מחוברת במלואה בשתי שכבות, מפיקה את ההסתברות שהמדגם הוא נתונים אמיתיים; (3) מודול אילוצי התפלגות קופולה: מתאימים את ההתפלגות המשותפת של דגימות הונאה ממשיות דרך פונקציית קופולה גאוסית (כאשר הוא ערך פונקציית ההתפלגות הקשתית של התכונה השמינית של i), והוספת אילוץ מרחק קופולה באובדן הגנרטור כדי להבטיח שההתפלגות המשותפת של דגימות סינתטיות תואמת לדגימות הממשיות.

משוואה 165(36)

שיפור התהליך ואימות האפקט

תהליך ההכשרה והשיפור של CopulaGAN הוא כדלקמן: i) עיבוד נתונים מוקדם: חילוץ דגימות הונאה/ברירת מחדל (18,200 בסך הכל) מהנתונים האמיתיים של מוסדות שונים; תקנון תכונות רציפות (x'=(x-μ)/σ); תכונות נפרדות מקודדות בחום ייחודי; ii) התאמת קופולה: פונקציית הקופולה הגאוסית משמשת להתאמת ההתפלגות המשותפת של דגימות ההונאה המעובדות מראש, חישוב התפלגות הקשתות Fiθ ופרמטרי פונקציית קופולה של כל תכונה; iii) אימון GAN: הגנרטור והדיסקרימינטור מאומנים לסירוגין. פונקציית ההפסד של הגנרטור היא:

משוואה 168(37)

כאן, λ הוא משקל האילוצ, ו-Distance (Csyn,C real) הוא הסטייה של KL בין התפלגות הקופולה של דגימות סינתטיות לבין התפלגות הקופולה של דגימות ממשיות; פונקציית אובדן המבחין היא אובדן אנטרופיה צולבת בינארי סטנדרטי:

משוואה 170(38)

לאחר התכנסות המודלים (עם דיוק ההבחנה התייצב ב-50%±5%), הגנרטור הפיק 50,000 דגימות הונאה סינתטית. אלו מופו חזרה למרחב התכונות המקורי לפי מפרטים סמנטיים ואוחדו עם דגימות אמיתיות לבניית סט אימון מאוזן. כדי לאמת את יעילות הדגימות הסינתטיות, המחקר העריך אותן באמצעות מבחן KS דו-דגמי והדמיית התפלגות תכונות. תוצאות מבחן KS הראו שההבדלים בהתפלגות התכונות בין מדגמים סינתטיים למממשיים היו כולם מתחת ל-0.05 (סטטיסטיקת KS <0.05, ערך p>0.05), מה שמעיד על עקביות טובה בהתפלגות. השוואת התפלגות תכונות הראתה כי דגימות סינתטיות יכולות לשחזר במדויק את מאפייני ההתפלגות של דגימות הונאה אמיתיות, ולספק נתונים תקפים מספקים לאימון מודלים כפי שמוצג באיור 1.

איור 1
איור 1: השוואה בין התפלגות תכונות בין דגימות הונאה אמיתיות ל-CopulaGAN אנא לחצו כאן לצפייה בגרסה גדולה יותר של האיור.

מדדי הערכה

הניסוי בונה מערכת הערכה רב-מדדית מארבעה ממדים מרכזיים: ביצועי חיזוי, הגנת פרטיות, הוגנות ויעילות תקשורת, כדי למדוד באופן מקיף את הביצועים המקיפים של מסגרת הלמידה הפדרטיבית ומודל בקרת סיכונים בבינה מלאכותית. ההגדרה, שיטת החישוב וקריטריוני ההערכה של כל ממד מוצגים בטבלה 8.

ממדי הערכהשם האינדקסהגדרה ושיטת חישובקריטריון הערכה
ביצועים מוערכיםAUC-ROCהשטח מתחת לעקומת העבודה האופיינית של הנבדק מודד את יכולת המודל להבחין בין דוגמאות חיוביות (ברירת מחדל/הונאה) לשליליותככל שהערך גבוה יותר, כך טוב יותר. ה-AUC-ROC של הדגם המצוין הוא>0.9
PR-AUCשטח דיוק-שליפה מתחת לעקומה, הרלוונטי לנתונים לא מאוזנים, מודד את ביצועי המודל בתרחישים שבהם דוגמאות חיוביות נדירותככל שהערך גבוה יותר, כך טוב יותר. PR-AUC של דגם מצוין הוא>0.8
שבר בריירשגיאת ריבוע ממוצעת בין הסתברות חזויה לתווית אמיתית, B=1Ni=1N(pi-yi)2ככל שהערך נמוך יותר, כך טוב יותר. ציון ברייר של דגם מצוין הוא פחות מ-0.05
שיעור חיובי שגוי (FPR)החלק של דוגמאות שליליות FPR=FPFP+TNשככל שהערך נמוך יותר, כך טוב יותר. תרחישים פיננסיים בדרך כלל דורשים FPR <1% (כדי להימנע מדחיית לקוחות טובים)
הגנה על פרטיותעקומת ε-צריכה (ε-עקומה)רשמו את קצב הצריכה של תקציב הפרטיות המצטברε במהלך ההכשרה כדי לשקף את האיזון הדינמי של יכולת הגנת הפרטיותהעקומה מתאזנת והסך ε קטן או שווה ל-5 (בהתאם לדרישות סיכון פרטיות ב-GDPR)
התקפת ההסקה של החברים AUC (MI-AUC)היכולת של התוקף להסיק אם מדגם שייך לקבוצת האימון מתוצאות חיזוי המודל, וככל שערך AUC קרוב יותר ל-0.5, כך הפרטיות טובה יותרMI-AUC<0.6 יעיל להגנה על פרטיות, MI-AUC<0.55 מצוין
שיעור דליפת תכונות (FLR)התוקף מאגד את התכונות כדי להפוך את השגיאה FLR=1-KL(P∥∥Q)Dmaxrate של התפלגות הנתונים המקורית,FLR <0.1 מציין שהגנה על פרטיות היא יעילה (P היא Dmax ההתפלגות האמיתית, Q היא ההתפלגות המוסקת, והיא המרחק המרבי של KL)
הוגנותהטיית DP בסטטיסטיקה (ΔDP)ההפרש המרבי בתחזית ΔDP=max∥PRg-PRavg∥rate של דוגמאות חיוביות בין קבוצות שונות,ΔDP<0.05 עבור הוגנות, למצוינות (PRg עבור שיעור חיובי בקבוצה g)
הטיית EO (ΔEO)ההפרש המקסימלי בשיעורי ΔEO=max∥TPRg-TPRavg∥ בין קבוצות שונות,GCE <0.02 מכויל היטב (K הוא מספר הקבוצה, הוא הקצב החזויה, והוא הקצב בפועל)
שגיאת כיול קבוצתית (GCE)הסטייה הממוצעת בין ההסתברות החזויה GCE=1Kg=1K∥pg-rg∥ של כל קבוצה לבין שיעור ברירת המחדל בפועל,ככל שהערך נמוך יותר, כך טוב יותר. דרישות התסריט של ארגונים קטנים ובינוניים הן <10MB לכל סבב
יעילות תקשורתרוחב פס של uplink לכל סבבסך צריכת רוחב הפס של הנתונים שהועלו על ידי כל ארגון למתאם במהלך צריכת רוחב פסככל שהערך נמוך יותר, כך טוב יותר. תרחישים בין-מוסדיים דורשים פחות מ-120 דקות
יחס הפחתה (CR)היחס בין נפח הנתונים המקורי לנפח הנתונים הדחוס, CR=SizerawSizecompככל שיחס הדחיסה גבוה יותר, כך טוב יותר. פתרונות מצוינים CR>10:1

טבלה 8: מערכת אינדקס הערכה ניסיונית.

הסבר מטרי: i) התקפת הסקת חברות: באמצעות מתודולוגיית התקפת קופסה שחורה, התוקף מאמן מודל סיווג בינארי שמזין הסתברויות חזויות מהמודל היעד ומפיק את מצב חברות המדגם. סיכון דליפת הפרטיות נמדד על ידי AUC של המודל (כלומר, MI-AUC). ii) קריטריוני סיווג קבוצתיים: בהערכת הוגנות, הקבוצות מסווגות בארבעה ממדים: מגדר (זכר/נקבה), גיל (מתחת ל-25/25-40/>40), אזור (שווקים מדרג ראשון/דרג ראשון חדש/שכבה שנייה/שווקים משותפים), ורמת הכנסה (<5,000/5,000-15,000/>30,000 יואן/חודש). דבר זה מבטיח כיסוי של קבוצות רגישות שזוהו על ידי רגולטורים פיננסיים. iii) קריטריוני התכנסות: במהלך אימון המודלים, אם קבוצת האימות AUC-ROC מראה ירידה של פחות מ-0.001 בשלושה סבבים רצופים (כל סבב מכיל 10 אפוקים), האימון נחשב כמתכנס ומופסק.

קווי בסיס

כדי לאמת את העליונות של "מודל בקרת סיכונים ללמידה מאוחדת + בינה מלאכותית היברידית", מחקר זה קובע חמישה מודלים בסיסיים: מודלים מרכזיים מסורתיים, מודלים קלאסיים של למידה מאוחדת, ומודלים משופרים השומרי פרטיות. הפרמטרים המרכזיים ואסטרטגיות האימון של כל מודל בסיס מפורטים בטבלה 9 כדי להבטיח הוגנות בניסויים השוואתיים (כל המודלים משתמשים במערכות אימון זהות, מערכות אימות ואסטרטגיות אופטימיזציה של היפרפרמטרים).

סוגי דגמיםשם הדגםארכיטקטורה מרכזיתמצב אימוןאמצעי הגנה על פרטיותהיפרפרמטרים מרכזיים
מודל מרכזימסורת GBDTעץ הגברת שיפוע XGBoostכל המוסדות מאחסנים את נתוני ההכשרה באופן מרכזילאמספר עצים = 100, קצב למידה = 0.1, עומק עץ = 6, מקדם רגולריזציה λ=1.0
מודל מרכזימודל למידה עמוקה (MLP)רשת מחוברת במלואה בת שלוש שכבות (שכבת קלט 256 ממדים → שכבה נסתרת 128 → שכבה נסתרת 64 ממדים → שכבת פלט 1)כל המוסדות מאחסנים את נתוני ההכשרה באופן מרכזילאאופטימייסר=אדם, קצב למידה=0.001, גודל אצווה=256, Dropout=0.3
מודל פדרלי קלאסיFedAvg (הממוצע הפדרלי)המודל המקומי הוא GBDT, והמודל הגלובלי מאמץ אגרגציה ממוצעת של פרמטריםאימונים פדרליים מסונכרניםלאשיעור השתתפות = 0.8, עידן מקומי = 5, סבב אגרגציה = 50, קצב למידה = 0.1
מודל פדרלי קלאסיFedProx (אגרגציה פדרלית לסוף הקרוב)המודל המקומי הוא GBDT, והפרוקסימליאימונים פדרליים מסונכרניםלאשיעור השתתפות = 0.8, עידן מקומי = 5, סבב אגרגציה = 50, פרמטר פרוקסימלי μ = 0.01
μ=0.01
אילוץ מונחים מתווסף במהלך האגרגציה ().
הפדרציה המועצמת לפרטיותFedAvg+DP (רעש קבוע)הוסף רעש לפלסיאני קבוע ל-FedAvg (ε=5, δ=1e-5)אימונים פדרליים מסונכרניםפרטיות דיפרנציאלית קבועהעוצמת רעש=0.1, שיעור השתתפות=0.8, תקופה מקומית=5, סבבי אגרגציה=50
מודל המחקרFedRisk (מודל בקרת סיכונים פדרלי)GDT מקומי (אילוץ מונוטוני) + טרנספורמר גלובלי (מיזוג תשומת לב) + DP + אגרגציה מאובטחתאימון אסינכרוני פדרלישיתוף סודות אדפטיבי DP+עידן מקומי=5, סבבי אגרגציה=50, מימד תשומת לב=64, תקציב פרטיותε=5, יחס דחיסה=15:1

טבלה 9: השוואת פרמטרים בין מודל הבסיס למודל המחקר הזה.

הסבר השוואתי: (1) מרכזי מול פדרטי: על ידי השוואה בין "GBDT/MLP מסורתי" ל"FedAvg/FedProx/FedRisk", מחקר זה בוחן את הידרדרות הביצועים של למידה פדרטיבית בתרחישי "נתונים מחוץ לאתר". (2) קלאסי מול פרטיות משופרת: באמצעות "FedAvg" לעומת "FedAvg+DP", המחקר מעריך את השפעת הפרטיות השונה על ביצועי המודלים. (3) סינכרוני מול אסינכרוני Federated: ההשוואה בין "FedAvg" (סינכרוני) ל-"FedRisk" (אסינכרוני) מדגימה את יתרונות יעילות התקשורת של אימון אסינכרוני. (4) אגרגציה פשוטה מול מיזוג אינטליגנטי: הניגוד בין "FedAvg" (ממוצע פרמטרים) ל-"FedRisk" (מיזוג תשומת לב) מאשר את יכולת ההסתגלות של אסטרטגיות אינטגרציית טרנספורמרים לנתונים שאינם IID. (5) אי-צנזורה מול צנזורה של הוגנות: ההשוואה בין "FedAvg" (ללא מגבלות הוגנות) ל-"FedRisk" (מגבלות מודעות להוגנות) בוחנת את השפעות מנגנוני ההגינות על הוגנות וביצועים במודל.

מחקרי אבלציה

השפעה של ε משתנה על תועלת המודל

באמצעות תקציב הפרטיות הכולל ε כמשתנה (עם ערכים של 1, 3, 5, 7 ו-10), המחקר קבע את δ=1e-5 תוך שמירה על מודולים אחרים (מיזוג תשומת לב ומגבלה מונוטונית GBDT) ללא שינוי כדי להעריך את הפשרה בין חוזק הגנת הפרטיות לתועלת המודל. הניסוי מדד הן AUC-ROC (תועלת המודל) והן MI-AUC (סיכון פרטיות) כמדדים כפולים, כאשר התוצאות מוצגות בטבלה 10. כאשר ε=1, MI-AUC ירד ל-0.53 (הגנה מצוינת על פרטיות), אך AUC-ROC הגיע רק ל-0.821 (אובדן משמעותי בשימושיות). ב-ε=5, AUC-ROC התאושש ל-0.912 (עומד בדרישות בקרת סיכונים פיננסיים) עם MI-AUC=0.58 (הגנה אפקטיבית על פרטיות). ב-ε>5, השיפור ב-AUC-ROC היה פחות מ-0.01, בעוד ש-MI-AUC עלה במהירות ל-0.63 (מעבר למגבלות סיכון הפרטיות). דבר זה מאשר ש-ε=5 הוא תקציב הפרטיות הכולל האופטימלי, ומשיג איזון בין פרטיות לשימושיות.

תקציב פרטיות כוללεדגם AUC-ROCMI-AUC (סיכון פרטיות)קצב דליפת תכונות FLRשבר ברייר
10.8210.530.040.078
30.8760.550.060.061
50.9120.580.080.042
70.9190.60.110.039
100.9230.630.150.037

טבלה 10: השוואת ביצועי מודלים עם תקציבי פרטיות שונים ε.

תרומה של מיזוג קשב לעומת ממוצע פשוט

כדי להעריך את ההבדלים בביצועים בין "מיזוג תשומת לב" (האסטרטגיה המוצעת) ל"ממוצע פשוט" (אסטרטגיית FedAvg) בתרחישי נתונים לא עצמאיים, שני משתנים הוגדרו ניסויים: (1) חומרת נתונים שאינה IID (נמדדת על ידי שינויים בשיעור חדלות פירעון ספציפית למוסד, שונות נמוכה: 0.2%-0.5%, שונות גבוהה: 0.2%-3.5%); (2) אסטרטגיות מיזוג (מיזוג קשב לעומת ממוצע פשוט). כפי שמוצג באיור 2, הפער בין AUC ל-ROC בין שתי האסטרטגיות היה רק 0.023 (0.912 לעומת 0.889) בתרחישים שאינו IID נמוך. עם זאת, פער זה התרחב ל-0.076 (0.905 לעומת 0.829) בתרחישים ללא IID גבוהים, כאשר מודל הממוצע הפשוט הציג התאמה יתר משמעותית (סט אימון AUC-ROC 0.941 לעומת סט אימות 0.829). דבר זה מראה שמנגנוני קשב יכולים להפחית ביעילות את הידרדרות הביצועים הנגרמת על ידי נתונים לא עצמאיים באמצעות שקילות דינמיות – כגון הקצאת משקל של 0.32 למוסד E עם תחזיות ברירת מחדל מדויקות ומשקל 0.12 למוסד C עם סטיות גדולות יותר.

איור 2
איור 2: השוואה בין אסטרטגיות מיזוג בדרגות שונות שאינן IID. אנא לחצו כאן לצפייה בגרסה רחבה יותר של איור זה.

השפעת רגולרייזרים של הוגנות על מדדי ביצוע מבוססי רווח

הדרישה המרכזית של המוסדות הפיננסיים היא להבטיח רווחי עסקים תחת מגבלת ההגינות, ולכן הניסוי מציג מדד מוכוון רווח - "תשואה מותאמת לסיכון על ההון (RAROC)". הנוסחה היא כדלקמן:

משוואה 171(39)

ההפסד הצפוי מחושב כהסתברות חדלות המחדל מוכפלת בשיעור ההפסד הקבוע (שנקבע כ-40%), בעוד שההון הכלכלי נקבע על ידי החשיפה לסיכון מוכפלת במשקל הסיכון (לפי דרישות באזל III). מדדי ההגינות (ΔDP, ΔEO) ו-RAROC של המודל עם רגולריזציה של הוגנות לעומת המודל ללא הוגנות מושווים בטבלה 11. לאחר יישום הסדרת הוגנות, ΔDP ירד מ-0.15 ל-0.04, ΔEO ירד מ-0.12 ל-0.03, ו-RAROC ירד רק ב-2.1% (18.3% לעומת 18.7%), משמעותית מתחת לסף המקובל בתעשייה של 5%. דבר זה מראה שמנגנון ההגינות במחקר שלנו עומד ביעילות בדרישות רגולטוריות לאי-אפליה תוך שליטה בהפסדי רווחים.

הגדרת הדגםΔDP (הפרש קצב חיובי בקבוצה)ΔEO (הפרש TPR בקבוצה)GCE (שגיאת כיול קבוצתי)RAROC (תשואה מותאמת סיכון על נכסים)FPR (שיעור חיובי שגוי)
חוק ללא הוגנות0.150.120.03518.70%0.95%
יש הוגנות וסדירות0.040.030.01818.30%1.02%

טבלה 11: השפעת הסדרת ההגינות על מדדי הוגנות ורווח.

פרטי היישום

כדי להבטיח שחזוריות של הניסוי, המחקר הבהיר את פרטי המערך הטכני ותהליך האימון: (1) סביבת חומרה: כל צומת מוסדי משתמש במעבדי Intel Xeon Gold 6248, זיכרון RAM של 64GB וכרטיסי NVIDIA Tesla V100; המתאם המאוחד משתמש במעבדי Xeon Gold 6348 כפולים עם זיכרון RAM של 128GB כדי להבטיח מחשוב מקבילי ואגרגציה יעילה של פרמטרים. (2) מסגרת תוכנה: מסגרת הלמידה הפדרציאלית מפותחת באמצעות PySyft 0.8.6, מודול הבלוקצ'יין משתמש ב-Hyperledger Fabric 2.5 (מנגנון קונצנזוס: Raft), אימון מודלים מתבסס על PyTorch 2.0 ו-XGBoost 2.0.3, בעוד שמודול הפרטיות הדיפרנציאלי משלב את IBM DP Library. (3) תהליך ההדרכה: (1) קדם-עיבוד נתונים (שעתיים, כולל נרמול סמנטי ושיפור CopulaGAN); (2) אימון מקומי (5 עידנים בכל סבב, קצב הלמידה ירד באמצעות אנילינג קוסינוס); (3) אגרגציה אסינכרונית (עדכוני מודלים גלובליים מתרחשים כאשר המתאם מקבל פרמטרים משלושה מוסדות); (4) הערכת מודלים (מדדי AUC-ROC והגינות שחושבו לאחר 10 סבבים); (5) אופטימיזציה של היפרפרמטרים (אופטימיזציה בייסיאנית עם 50 איטרציות לקביעת פרמטרים אופטימליים). (4) בדיקות עמידות: ניתוקים מוסדיים מדומים (בחירה אקראית של מוסד אחד לעצור 1-3 סבבי הדרכה) ורעש נתונים (הוספת 5% הפרעות ערך תכונה). התוצאות הראו תנודות AUC-ROC מתחת ל-0.02, מה שהדגים את יכולת ההגנה מפני הפרעות של המערכת.

מחקר זה השתמש באסטרטגיית תזמון אנילינג קוסינוס עם קצב למידה התחלתי של 0.05. קצב הלמידה עודכן דינמית בכל תקופה לפי הנוסחה על פני 100 תקופות אימון. אסטרטגיה זו שמרה על קצב למידה גבוה בשלבים הראשונים של האימון, למשל 0.05 בעידן הראשון, כדי להאיץ את התכנסות המודלים, והורידה אותה בהדרגה לכמעט אפס, למשל 0.00025 בעידן המיא, כדי לשפר את יציבות כיוונון הפרמטרים. תוצאות ניסויים הראו שבהשוואה לקצב למידה קבוע, אסטרטגיה זו שיפרה את קבוצת האימות AUC-ROC ב-2.3% ואת מהירות ההתכנסות המואצת ב-37%. חלוקת הנתונים התבססה על מערך נתונים גולמי מחמישה מוסדות פיננסיים בסך כולל של 5 מיליון מדגמים, תוך שמירה קפדנית על עקרון בידוד הנתונים בין המוסדות. הנתונים המקומיים מכל מוסד חולקו כרונולוגית, כאשר הנתונים מינואר 2022 עד יוני 2023 הם מערך ההכשרה (70%), הנתונים מיולי עד ספטמבר 2023 כסט האימות (15%), והנתונים מאוקטובר עד דצמבר 2023 כמערך הבדיקה (15%). חלוקה זו הבטיחה את עצמאות החלון הזמני של מערכות האימון, האימות והבדיקה, ובכך סימלה ביעילות את התפתחות דפוסי הסיכון הזמני בתרחישים אמיתיים. היפרפרמטרים מרכזיים נקבעו באמצעות אופטימיזציה בייסיאנית. בתוך מרחב חיפוש משותף הכולל קצב למידה התחלתי בין 0.01 ל-0.1, מספרי עץ GBDT בין 50 ל-200, וראשי תשומת לב של טרנספורמר מהסט {2, 4, 8}, בוצעו 50 איטרציות במטרה למקסם את קבוצת האימות AUC-ROC. השילוב האופטימלי הסופי זוהה כקצב למידה התחלתי של 0.05, 120 עצי GBDT ו-4 ראשי קשב.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ביצועים חיזויים: גישה לרמת המודלים המרכזיים בתרחישים שאינם IID

בתרחישים בעולם האמיתי עם נתונים ללא IID גבוהים (שינויים בשיעור חדלות פירעון מוסדית של 0.2%-3.5%), FedRisk מראה יכולות יוצאות דופן של הבחנה בסיכונים, כפי שמוצג בטבלה 12. ה-AUC-ROC שלה מגיע ל-0.912, PR-AUC הוא 0.823, ציון Brier הוא 0.042, ושיעור חיובי שגוי (FPR) 1.02%. מדדים אלו לא רק עומדים בדרישות הליבה של בקרת סיכונים פיננסיים – דחייה שקרית נמוכה ודיוק גבוה (FPR<1...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

אסטרטגיית כוונון ההיפרמטרים הדינמיים, ובמיוחד מתזמן קצב הלמידה עם אנילינג קוסינוס, התבררה כחיונית לאיזון בין מהירות ההתכנסות ליציבות המודל. על ידי הפחתת קצב הלמידה מ-0.05 ל-0.00025 לאורך 100 תקופות, גישה זו האיצה התכנסות בשלבים מוקדמים תוך הפחתת זמן האימון בשלבים מאוחרים שמפחיתים תנודתיות ב-37% ושיפורה את האימות AUC-ROC ב-2.3% לעומת לוחות זמנים בקצב קבוע. קריטי לא פחות היה כיול רעש אדפטיבי בפרטיות דיפרנציאלית, שבו רעש לפלס מודע לשונות (סולם=Δf/ε, Δf=1.2, ε=0.5) מותאם דינמית לתנודות בנתונ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין מה לחשוף.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
מחשב ניידדל טכנולוגיותלא זמיןמשמש לעיבוד נתונים ותיעוד
תוכנה סטטיסטית (SPSS)חברת IBMגרסה 26.0משמש לניתוח סטטיסטי
מיקרוסופט אקסלמיקרוסופטמשרד 365הזנת נתונים וטיפול בסיסי בנתונים

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).
  2. Zhang, X., Mavromatis, A., Vafeas, A., Nejabati, R., Simeonidou, D. Federated feature selection for horizontal federated learning in IoT networks. IEEE Internet Things J. 10 (11), 10095-10112 (2023).
  3. Liu, Y., et al. Vertical federated learning: concepts, advances, and challenges. IEEE Trans. Knowl. Data Eng. 36 (7), 3615-3634 (2024).
  4. Saha, S., Ahmad, T. Federated transfer learning: concept and applications. Intell. Artif. 15 (1), 35-44 (2020).
  5. McMahan, H. B., Moore, E., Ramage, D., Hampson, S., Arcas, B. A. Y. Communication-efficient learning of deep networks from decentralized data. In Proc. 20th Int. Conf. Artif. Intell. Stat. , 1273-1282 (2017).
  6. Yang, Q., Liu, Y., Chen, T., Tong, Y. Federated machine learning: concept and applications. ACM Trans. Intell. Syst. Technol. 10 (2), Article 12(2019).
  7. Pan, S. J., Yang, Q. A survey on transfer learning. IEEE Trans. Knowl. Data Eng. 22 (10), 1345-1359 (2010).
  8. Long, Z., Wang, J., Wang, Y., Xiao, H., Ma, F. FedCon: a contrastive framework for federated semi-supervised learning. arXiv. , (2021).
  9. Wang, J., et al. FedLite: a scalable approach for federated learning on resource-constrained clients. arXiv. , (2022).
  10. Hanser, T., et al. Data-driven federated learning in drug discovery with knowledge distillation. Nat. Mach. Intell. 7, 1-14 (2025).
  11. Feng, Y., et al. A survey of security threats in federated learning. Complex Intell. Syst. 11 (2), 165(2025).
  12. Chen, D., et al. Bridging data silos in finance via federated learning. IEEE Netw. , https://ieeexplore.ieee.org/document/11062627 (2025).
  13. Haripriya, R., et al. Navigating the fusion of federated learning and big data: a systematic review for the AI landscape. Clust. Comput. 28 (5), 1-27 (2025).
  14. Dong, J., Roth, A., Su, W. J. Gaussian differential privacy. J. R. Stat. Soc. Ser. B Stat. Methodol. 84 (1), 3-37 (2022).
  15. Bayatbabolghani, F., Blanton, M. Secure comparison protocols for privacy-preserving federated learning. In Proc. 2018 ACM SIGSAC Conf. Comput. Commun. Secur. , 2157-2159 (2018).
  16. Acar, A., Aksu, H., Uluagac, A. S., Conti, M. A survey on homomorphic encryption schemes: theory and implementation. ACM Comput. Surv. 51 (4), (2018).
  17. Dwork, C. Differential privacy. In Proc. Int. Colloq. Automata Lang. Program. , 1-19 (2006).
  18. Abadi, M., et al. Deep learning with differential privacy. In Proc. 2016 ACM SIGSAC Conf. Comput. Commun. Secur. , 308-318 (2016).
  19. Bogetoft, P., et al. Secure multiparty computation goes live. In Financ. Cryptogr. Data Secur. 5628, 325-343 (2009).
  20. Perri, L. What's new in the 2023 Gartner Hype Cycle for emerging technologies. , https://www.gartner.com/en/articles/what-s-new-in-the-2023-gartner-hype-cycle-for-emerging-technologies (2023).
  21. Friedman, J., Hastie, T., Tibshirani, R. The elements of statistical learning. , Springer. New York. (2001).
  22. Zhang, H., Liu, Y., Zhang, X., Yin, Z., Li, Y. A lightweight approach for federated learning in edge devices. In Proc. 7th Int. Conf. Artif. Intell. Big Data (ICAIBD). , 53-58 (2024).
  23. Liu, J., Liu, P., Ou, Z., Zhang, G., Song, M. Optimizing edge intelligence through privacy-preserving learning. In Proc. Int. Conf. Edge Comput. , 419-429 (2024).
  24. Kim, J., Kim, K., Sohn, M., Park, G. Deep model-based security-aware entity alignment method for edge-specific knowledge graphs. Sustainability. 14 (14), 8877(2022).
  25. Xue, J., Qu, Z., Xu, J., Liu, Y., Lu, Z. Bandwidth allocation for federated learning with wireless providers and cost constraints. IEEE Trans. Mob. Comput. 23 (6), 7470-7482 (2024).
  26. Sharma, M., Kaur, P. Scalable federated learning for smart city applications. In Proc. 2nd Int. Conf. Informatics (ICI). , 1-4 (2023).
  27. Li, B., Zheng, S., Raman, P., Shrivastava, A., Giannakis, G. B. Contractive error feedback for gradient compression. arXiv. , (2023).
  28. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

Explainable AICross Institutional CollaborationFinancial Risk ControlData PrivacyNon IID DataModel InterpretabilityDifferential PrivacyFraud DetectionSME Loan Default

מאמרים קשורים