$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
ארכיטקטורת מערכת
רשת נתונים בין-מוסדית ושכבה סמנטית
כדי להתמודד עם הטרוגניות בין מוסדות בנתונים, המחקר בונה ארכיטקטורת Data Mesh באמצעות חלוקת צמתים מונחית תחום. כל מוסד פיננסי פועל כצומת תחום נתונים עצמאי תוך שמירה על זכויות בעלות ושליטה, כאשר השכבה הסמנטית מאפשרת הבנה ואינטראקציה מאוחדת של הנתונים. שכבת הסמנטיקה מבוססת האונטולוגיה יוצרת מודל נתונים מאוחד לבקרת סיכונים פיננסיים, המגדיר ישויות ליבה, תכונותמפת f ויחסי ישויות. כללי מיפוי סמנטי ספציפיים מפורטים בטבלה 5. בתחומים ספציפיים למוסד, המרות סטנדרטיות מושגות באמצעות פונקציות מיפוי סמנטי:
(18)
| ישות גרעין | שם השדה A של המוסד | שם תחום B במוסד | שם שדה אחיד של שכבת סמנטיקה | סוג הנתונים | כללים סטנדרטיים |
| לקוח | דירוג לקוחות פרימיום (1-5) | רמות לקוח VIP (ברונזה ליהלום) | דירוג אשראי לקוחות (1-5) | מספרים שלמים | ברונזה→1, כסף→2, זהב→3, פלטינה→4, יהלום→5 |
| עסקים | סכום העסקה (עשרת אלפים יואן) | סכום העסקה (יואן) | סכום העסקה (יואן) | מספר צף | ערך שדה ה-A במוסד הוא פי 10,000 |
| בקשת קרדיט | מכסת המועמדים (יחס קרדיטים) | סכום האשראי הצפוי | סכום הלוואה למבקש (יואן) | מספר צף | מוסד א': יחס סך האשראי × סכום הבקשה; מוסד B: מיפוי ישיר |
טבלה 5: כללי מיפוי סמנטי של ישויות ליבה בתחום בקרת הסיכונים הפיננסיים.
כאן xi,j ערך השדה הספציפי i-th של המוסד j, min(xj) ו-max(xj) הם הערכים המינימליים והמקסימליים של השדה בתוך המוסד, בהתאמה, Uj ו-Lj מגדירים את הגבולות העליונים והתחתונים של טווח הערכים המאוחדים של שדה זה בשכבה הסמנטית.
רישום וביקורת גלובליים מבוססי בלוקצ'יין
כדי לפתור בעיות של ניהול גרסאות מודל כאוטי ותהליכי אימון בלתי ניתנים למעקב בלמידה מאוחדת, נעשה שימוש בטכנולוגיית בלוקצ'יין להקמת מערכת רישום גלובלית של מודלים ומערכת מעקב ביקורתית. באמצעות ארכיטקטורת בלוקצ'יין של קונסורציום, הצמתים המשתתפים כוללים מוסדות פיננסיים, רכזים פדרטיביים וגופים רגולטוריים, מה שמבטיח אי-שינוי נתונים והסכמה רב-צדדית23. רישום המודלים הגלובלי מאחסן מטא-דאטה מרכזיים של מודלים, כולל מספרי גרסאות, סבבי הדרכהHv, רשימות של מוסדות משתתפים, פרמטרים מבניים ומדדי ביצועים. מטא-דאטה זו נשמרת באמצעות מבנה עץ מרקל, כאשר כל גרסת מודל מתאימה לערך גיבוב ייחודי:
(19)
כאן v הוא מספר גרסת המודל, T הוא סך סבבי האימון, S הוא אוסף המוסדות המשתתפים בהכשרה, IDi הוא מזהה ייחודי של מוסד i, θv הוא וקטור הפרמטר של המודל עבור הגרסה v, ו-AUCv הוא ערך AUC-ROC של גרסה זו של המודל המוצג.
צינור הנדסת תכונות מאוחד
יישור ישיות מאובטח והרמוניזציה של סכימות
הנדסת תכונות משמשת כרכיב מרכזי בשיתוף פעולה בין-מוסדי בנתונים, ודורשת חילוץ, יישור ואגרגציה יעילים של תכונות תוך שמירה על פרטיות הנתונים. מחקר זה מתכנן צינור מקיף הכולל יישור ישות מאובטח, תיאום סכימות ואגרגציה של גרפים של עסקאות מוטמעת פרטיות דיפרנציאלית, כדי להתמודד עם הטרוגניות תכונות חוצות מוסדות וסיכוני דליפת פרטיות24. יישור בין ישויות בין-מוסדי הוא חיוני להשגת שיתוף פעולה בתכונות. עם זאת, שידור ישיר של מזהי לקוחות יפגע בפרטיות. לכן, המחקר מאמץ שיטת יישור ישויות השומרת על פרטיות, המשלבת הצפנה הומומורפית (HE) עם טכנולוגיית גיבוב רגיש למיקום (LSH). מוסדות מעבדים מראש מזהי לקוחות באמצעות פונקציות גיבוב SHA-256 ליצירת מזהים ראשוניים. מזהים אלו ממופים לאותו "דלי" דרך LSH כדי להפחית את חישוב ההצפנה הבא. מזהים בתוך אותו דלי עוברים הצפנה הומומורפית של פיילייה. המזהים המוצפנים מועלים למתאם הפדרטיבי, שמשיג יישור ישויות על ידי השוואת דמיון בין מזהים מוצפנים באמצעות דמיון קוסינוס.
(20)
כאשר הדמיון גדול מהסף שנקבע מראש (במחקר זה, הוא נחשב כ-τ=0.95), נקבע שמדובר באותה ישות, ונוצר מזהה ישות מאוחד בין מוסדות כדי להשיג יישור ישות מאובטח.
אגרגציה פרטית דיפרנציאלית של הטמעות גרף עסקאות
נתוני העסקאות הפיננסיות מציגים מאפיינים מובנים גרפים מובחנים (כאשר לקוחות הם צמתים ועסקאות הן קשתות). הטמעת גרף העסקאות לוכדת ביעילות את דפוסי העסקאות של הלקוח עם צד קשור, ומספקת תכונות קריטיות למודלים של בקרת סיכונים. עם זאת, איגום ישיר של הטבעות גרף עסקאות חוצות מוסדות Gi=(Vi,E i)ViiEie i,v∈Rdd עשוי לדלוף מידע הקשור לעסקאות של לקוחות. לכן, טכנולוגיית DifferentialPrivacy (DP) הוכנסה כדי להשיג אגרגציה של הטמעות גרפי עסקאות לשמירה על פרטיות. כל מוסד בונה באופן מקומי גרף עסקאות, כאשר מייצג את קבוצת צמתים הלקוחות של המוסד ומייצג את קבוצת קשתות העסקה (משקלי קשתות השוות לסכומי העסקה). אלגוריתם GraphSAGE משמש ליצירת הטמעות-צמתים (עם ממדים של 256 ממד במחקר זה). כדי לעמוד בדרישות פרטיות דיפרנציאלית, רעש לפלסיאני מתווסף להטמעות:
(21)
כאן ΔG רגישות גלובלית של אלגוריתם GraphSAGE (הוערך בניסוי במחקר זה ΔG=0.8), עבור תקציב הפרטיות המקומי של הסוכנות,
(22)
עבור תקציב הפרטיות הכולל של המערכת, מחקר זה לוקחε בסך הכל=1.5). המתאם מאגד את הטמעת הרעש של כל מוסד באמצעות אסטרטגיית ממוצע משוקלל
, עם משקלים המבוססים על אחוז הלקוחות בכל מוסד:
(23)
גרף העסקאות
הגלובלי המצטבר מוטמע ומוזן חזרה לכל מוסד. כתכונה מרכזית במודל בקרת הסיכונים, הוא לא רק שומר על מידע הקורלציה של עסקאות בין-מוסדיות, אלא גם מגן על פרטיות הלקוחות באמצעות פרטיות דיפרנציאלית.
(24)
מודל סיכון היברידי של בינה מלאכותית
תתי-מודלים מקומיים: הגברת גרדיאנט עם אילוצים מונוטוניים
מודלים מסורתיים של בקרה מרכזית בסיכונים מבוססי בינה מלאכותית מתקשים להסתגל לתרחישים מאוגדים בין מוסדות. מחקר זה מפתח מודל סיכון היברידי מבוסס בינה מלאכותית המשלב "תתי-מודלים מקומיים + מודל מיזוג גלובלי", ומשלב את יכולת הפרשנות הגבוהה של עצי הגברת הגרדיאנט (GBDT) עם היכולת של טרנספורמר להסתגלות לנתונים לא עצמאיים ומפוזרים זהה (NID). מודול פרשנות מוצג כדי לאזן בין ביצועי מודל להסברים בסביבות מאוחדות. כל מוסד בונה באופן מקומי תתי-מודלים של GBDT, שנבחרו בשל יכולת התאמת נתונים מבנית חזקה ויכולת פרשנות גבוהה – דרישות חיוניות לרגולציה של בקרת סיכונים פיננסיים. כדי למנוע התאמת יתר ומסקנות לא הגיוניות, מיושמים מגבלות מונוטוניות במהלך ההכשרה של GBDT, המאכפות דפוסים מונוטוניים של עלייה או ירידה עבור תכונות מרכזיות כמו הכנסות לקוחות וציוני אשראי. העץ הראשון שנקבע על ידי GBTD הוא ht(x), והפלט של המודל הוא:
(25)
כאן, η הוא קצב הלמידה (מחקר זה דורש η=0.1). אילוץ מונוטוני מתממש על ידי רגולריזציה של פונקציית הפסד xj.
הוסף איבר אילוצ:
(26)
כאן, x≺x' מייצג שהערך העצמי של x קטן מהערך העצמי של x', ופונקציית ההפסד הסופית היא:
(27)
כאן, l היא פונקציית ההפסד הלוגריתמית (המשמשת בתרחיש בקרת הסיכון הבינארי yi∈{0,1}, המציינת האם הלקוח מבצע את ברירת המחדל).
הוא מונח הרגולריזציה של המורכבות עבור העץ, λ ו-γ הם מקדם הרגולריזציה (מחקר זה נערך באמצעות λ=0.01 γ=0.5 אימות צולב, ni הוא מספר המדגמים המקומיים של המוסד i,T הוא מספר העצים (מחקר זה לקח T=100).
מיזוג גלובלי: טרנספורמטור מבוסס קשב להתאמה ללא IID
נתונים בין-מוסדיים מציגים מאפייני התפלגות משמעותיים שאינם IID. אלגוריתמים מסורתיים של FedAvg, שמבצעים פשוט ממוצע פרמטרים מקומיים של המודל, מתקשים להסתגל לנתונים שאינם IID. כדי להתמודד עם זה, המחקר מציג מודל קשב p(i(x)=σ(Fi(x))σFi(x)ia מבוססi למיזוג חכם של תת-מודלים מקומיים. מודל ההיתוך הגלובלי מקבל כקלט את הסתברויות הפלט מתת-המודל המקומי של כל מוסד (פלטי פונקציית סיגמואיד ממודלים מוסדיים של GBDT). ארכיטקטורת הטרנספורמר מורכבת מקודד ושכבת תשומת לב, שבה שכבת הקשב מחשבת משקלי תשומת לב מתוצרי מוסדות שונים כדי להשיג משקל אדפטיבי. משקלי הקשב מחושבים באמצעות קשב נקודתי-מכפל מדורג:
(28)
כאן, q הוא וקטור השאילתה (הנוצר על ידי תכונות הסיכון הממוצעות של מדגמים גלובליים),
הוא וקטור המפתח של המוסד i,d k הוא ממד וקטור המפתח (במחקר זה dk=64), n הוא מספר הסוכנויות המשתתפות בפדרציה.
ההסתברות הסופית של המודל הגלובלי היא:
(29)
באמצעות מנגנון הקשב, המודל הגלובלי יכול להעניק משקל גבוה יותר אוטומטית למוסדות בעלי איכות נתונים גבוהה וחיזוי סיכונים מדויק, ולשפר את ההתאמה לנתונים שאינם IID.
מודול הסברנות: SHAP על עצים מאוחדים + מחולל נגד עובדות
מודלים של בקרת סיכונים פיננסיים חייבים לשמור על פרשנות כדי לעמוד בדרישות הרגולציה ולהגן על זכות הלקוחות לדעת. כדי להתמודד עם זה, המחקר מפתח מודול פרשנות המשלב מחוללי SHAP+ מאוחדים. עבור תתי-מודלים מקומיים של GBDT, המחקר עושה שימוש בערכי SHAP למדידת חשיבות התכונות, אשר Si∈R N i×mמכמת את תרומת כל תכונה לתוצאות החיזוי. בתרחישים מאוחדים, שידור ישיר של ערכי SHAP מקומיים עלול לפגוע במידע על התפלגות התכונות. לכן, המחקר מיישם אסטרטגיית אגרגציה מאובטחת שבה כל מוסד מחשב מקומית את מטריצת ערכי SHAP (למספר תכונות), מיישם רעש פרטיות דיפרנציאלי לערכי SHAP, ומעלה אותם למתאם המאוחד. המתאם מחשב אז את ערכי SHAP הגלובליים:
(30)
כאן, Si' הוא מטריצת הערך של SHAP של המוסד i, ו-wi הוא היחס מגודל המדגם של המוסדות.
הכנס את וקטור העצמי הנוכחי של הלקוח x ואת דירוג הסיכון היעדיy, הפלט הוא וקטור תכונה אנטי-עובדתי xcf, מסופק (סף ההסתברותשל יעד θ התואם לדירוג הסיכון היעד). ו|xcf-x|2 המינימום (כלומר, עלות ההתאמה הנמוכה ביותר). פונקציית האובדן של מחולל העובדות היא:
(31)
כאן α,β,γ הם מקדמי המשקל (במחקר זה α=10,β=5,γ=1),LGAN פונקציית ההפסד היריבה משמשת עבור GAN כדי להבטיח את הרציונליות והאותנטיות של וקטור התכונה הנגד-עובדתי.
שכבת פרטיות ואבטחה
אגרגציה מאובטחת עם שיתוף סודות מצטברים
בלמידה מאוחדת, העברת ואגרגציה של פרמטרי מודל מקומיים היא קישור מרכזי בדליפת פרטיות. טכנולוגיית AdditiveSecretSharing (ASS) מאומצת להשגת אגרגציה מאובטחת ולמנוע רכישה ישירה של פרמטרי מודל מקומיים של כל ארגון על ידי המתאמ. התהליך הספציפי הוא כדלקמן: i) כל מוסד יחלק את פרמטרי המודל המקומיים למניות סודיות θ i,1,θi,2,...,θi,n , ומקיים
, להלן מספר המוסדות המשתתפים; ii) המוסד i שולח את החלק θi,k למוסד (k≠i), שומר על חלקו θi,i; iii) כל מוסד k אוסף מניות שנשלחו על ידי כל המוסדות האחרים θ1,k,θ 2,k,...,θn,k , ומסכם זאת עם θk,k המניה שנשמרת על ידו, ומקבלים את הסכום החלקי ; iv) כל המוסדותיעלו וישתפו חלק ממנו עם המתאמ, המתאם מחשב את תוצאות
אגרגציית הפרמטרים הגלובלית . באמצעות שיתוף סוד מצטבר, המתאם יכול לקבל רק פרמטרים מצטברים גלובליים ואינו יכול להסיק n-1ttt=⌈n/2⌉ את הפרמטרים המקומיים של מוסד מסוים. אפילו שיתוף פעולה בין מספר מוסדות אינו יכול לשחזר פרמטרים מאחרים, מה שמבטיח פרטיות ואבטחה במהלך העברת הפרמטרים. כדי להתמודד עם אובדן מניות הנגרם מניתוקים מוסדיים, מנגנון שיתוף סוד שמיר הוצג כגיבוי. כל מניה מחולקת עוד לקטעים. על ידי איסוף כל קטע, ניתן לשחזר את החלק המלא, ובכך לשפר את עמידות המערכת.
כיול רעש אדפטיבי לפי לוח זמנים תקציבי (ε, δ)-DP
האתגר המרכזי של פרטיות דיפרנציאלית טמון באיזון בין חוזק הגנת הפרטיות לביצועי הדגם. שיטות החיבור המסורתיות של רעש קבוע מתקשות להסתגל לתרחישים שבהם התפלגויות הנתונים משתנות באופן דינמי במהלך האימון המאוחד. מחקר זה מתכנן מנגנון כיול רעש אדפטיבי המבוסס על (ε,δ)-DP, בשילוב עם אסטרטגיית תזמון תקציב פרטיות, כדי להשיג התאמה דינמית של עוצמת הרעש. הגדר את תקציב הפרטיות הכולל של המערכת כך (מחקר זה לוקח δסך = 10-5 , עומד בדרישות ה-GDPR לסיכון פרטיות), אימץ את אסטרטגיית תזמון התקציב המקוטעת, התקציב הכולל מוקצה למחזור ההכשרה {ε1,ε 2,...,εT} כדלקמן, ממולא:
(32)
בכל סבב אימון, עוצמת הרעש מותאמת דינמית בהתאם למאפייני ההתפלגות של הנתונים המקומיים. בהנחה שהשונות של תכונות הנתונים המקומיות של סבב ה-t של המוסד היא
, הגדר את מקדם התאמת הרעש αi,t:
(33)
כאשר αi,t≥0.8 (התפלגות הנתונים יציבה), באמצעות עוצמת
רעש קטנה ; כאשר αi,t<0.8 (התפלגות הנתונים משתנה) , מגבירים את עוצמת הרעש . ביניהן, הרגישות הגלובלית של פרמטרי המודל (מחקר זה מבטיח באמצעות חיתוך גרדיאנט).
פרוטוקול אימון יעיל בתקשורת
עדכוני לקוח אסינכרוניים עם בקרת שעון
למידה פדרטיבית בין-מוסדית מתמודדת עם אתגרים כמו עיכוב תקשורת גבוה וצריכת רוחב פס משמעותית (במיוחד עבור מוסדות פיננסיים קטנים ובינוניים עם משאבי רשת מוגבלים). מחקר זה מעצב פרוטוקול אימון תקשורת יעיל הכולל עדכוני לקוח אסינכרוניים, דחיסת גרדיאנטים ומשוב שגיאות כדי להפחית עלויות תקשורת ולשיפוריכולת ההתרחבות של המערכת. שיטות אימון סינכרוניות מסורתיות כמו FedAvg דורשות המתנה שכל הלקוחות יסיימו את ההכשרה המקומית לפני צבירת הפרמטרים, מה שמוביל למחזורי הכשרה ארוכים. מנגנון עדכון הלקוח האסינכרוני מאפשר ללקוחות להשלים באופן עצמאי אימון מקומי ולהעלות מיד פרמטרים. עם קבלת הפרמטרים הללו, המתאם המאוחד מעדכן את המודל הגלובלי בזמן אמת מבלי להמתין ללקוחות אחרים. זה פותר את בעיית המודל המיושנות באימון אסינכרוני. בהצגת אסטרטגיית בקרת השעמות, הגדר את ערך הקיפאון עבור הלקוח ,(עבור סבב ההכשרה הגלובלי הנוכחי,t last_update הסיבוב שבו הלקוח קיבל את המודל הגלובלי לאחרונה). כאשר (Sמקסימום הוא העייפות המקסימלית המותרת, מחקר זה לוקח sמקסימום=5). הלקוח משתתף בהכשרה כרגיל; במקסימום הזמןהזה> הלקוח צריך להוריד שוב את הדגם הגלובלי העדכני לפני ההדרכה המקומית. תצורת החומרה כוללת מעבדי Intel Xeon E5-2678 v3 (12 ליבות, 2.5GHz) המשולבים עם כרטיסי NVIDIA Tesla V100 (16GB VRAM) וזיכרון DDR4 של 64GB לכל צומת לטיפול יעיל בעומסי עבודה מבוזרים. לאתחול תוכנה, פקודות PySyft כמו hook = sy. TorchHook(torch)andvirtual_worker = sy. VirtualWorker(hook, id="client1") משמשים להקמת חיבורים מאוחדים מאובטחים, בעוד federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) מאפשר טעינת נתונים מאוחדת בין המשתתפים. מיפוי סמנטי משנה תכונות פיננסיות בין מוסדות – למשל, המרת סכומי העסקה מדולר אמריקאי ל-CNY באמצעות נוסחת שער חליפין דינמית: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0.001 randn()), שבה שער החליפין מתעדכן מעת לעת באמצעות API (API). כדי להעשיר מאגרי נתונים לא מאוזנים, CopulaGAN מייצר דגימות סינתטיות של עוינות עם קטע קוד כמו מ-sdv.tabular import CopulaGAN; סינתיסייזר = CopulaGAN(אפוקים=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000), תוך שמירה על תכונות סטטיסטיות של הנתונים המקוריים. ההכשרה המקומית של GBDT אוכפת מגבלות מונוטוניות (למשל, להבטיח ש"credit_score" מתואמת באופן חיובי עם "approval_probability") ויאפרמים = {"monotonic_constraints": (1, 0, -1)}ב-LightGBM, בעוד שמיזוג טרנספורמר מיושם ב-PyTorch עם שכבות קשב מרובות ראש:self.attention = nn. MultiheadAttention (embed_dim=64, num_heads=4); attn_output, _ = self.attention(שאילתה, מפתח, ערך, key_padding_mask=padding_mask), ואחריו נרמול שכבה וחיבורים שאריים ליציבות. פרטיות דיפרנציאלית מזריקה רעש לפלס מותאם לרגישות L1 (Δf) ולתקציב הפרטיות (ε) – לדוגמה, הוספת רעש שנדגם מ-np.random.laplace(loc=0, scale=Δf/ε) כאשר Δf=1.2 ו-ε=0.5 למדרגות לפני האגרגציה. מגבלות הוגנות מיושמות לאחר האימון על ידי שינוי משקל המדגמים הפוך לשכיחות הקבוצתית שלהם (sample_weight = 1 / group_counts[y_train]) כדי לצמצם הפרות שוויון דמוגרפי. במקביל, אסטרטגיית האגרגציה המשוקללת משמשת לכיוון משקל פרמטרי הלקוח בהתאם לערך השחוק:
(34)
כאשר λ=0.1 הוא מקדם עונש הקישה; ככל שהעייפות גדולה יותר, כך המשקל קטן יותר, מה שמפחית את השפעת הפרמטרים המיושנים על המודל הגלובלי.
דחיסת גרדיאנט והצטברות משוב שגיאות
פרמטרי המודל (במיוחד משקלי הקשב במודלים גלובליים של ההיתוך של טרנספורמר) הם בעלי מורכבות ממדית גבוהה. שידור ישיר היה צורך רוחב פס מופרז, מה שמחייב טכניקות דחיסת גרדיאנט להפחתת העברת נתונים26. מחקר זה משלב פיזור טופ-K עם דחיסת קוונטיזציה, בהתאם לשלבים הספציפיים הבאים: i) Top-K sfrase: עבור המודל המקומי ∇θi גרדיאנט, בחר את אלמנט הגרדיאנט K% עם הערך המוחלט הגדול ביותר לשמור, K שאר האלמנטים הם אפס, הערך מותאם דינמית בהתאם לתנאי רוחב הפס (כאשר רוחב הפס מספיק K=30, כאשר רוחב הפס מוגבל K=10); ii) דחיסת קוונטיזציה: האלמנטים הגרדיאנטיים השמורים מקוונטיזציה מנקודה צפה של 32 ביט למספרים שלמים של 8 ביט. נוסחת הקוונטיזציה היא:
(35)
iii) משוב שגיאה: אחסון הגרדיאנט הנזרק Δ∇=∇θi-∇θi שגיאת דחיסה בצד הלקוח. בחישוב הגרדיאנט הבא, השגיאה מצטברת לגרדיאנט החדש, גישה,
, מפצה על הפסדי דחיסה. השפעות דחיסת הגרדיאנט ומשוב שגיאה מוצגות בטבלה 6, In, תנאי קוונטיזציה 8 K=20% סיביות, יחס הדחיסה מגיע ל-15:1 (נפח נתונים מקורי/נפח נתונים דחוס), ובאמצעות משוב שגיאות, AUC-ROC של המודל יורד רק ב-0.5%-1.0%, ומביא את האיזון בין עלות התקשורת לביצועי המודל27.
| אסטרטגיות דחיסה | יחס הפחתה | צריכת רוחב פס בהעלאה (MB/round) | שיעור הירידה של AUC-ROC | קצב קיצור זמן האימון |
| לא דחוס (נקודה צפה 32 ביט) | 1:01 | 128 | 0.00% | 0.00% |
| קוונטיזציה של 30% עליונים עם דלילות + 16 ביט | 6.7:1 | 19.1 | 0.30% | 35.20% |
| 20% עליונים של דלירות + קוונטיזציה של 8 ביט | 15:01 | 8.5 | 0.80% | 58.70% |
| 10% עליונים של דליל + קוונטיזציה של 8 ביט | 30:01:00 | 4.3 | 2.10% | 72.10% |
טבלה 6: השוואת ביצועים של אסטרטגיות דחיסת גרדיאנט.
רגולריזציה מודעת להוגנות
מודלים של בקרת סיכונים פיננסיים חייבים להימנע מאפליה נגד קבוצות מסוימות ולעמוד בדרישות רגולטוריות, כולל חוק הגנת המידע האישי וחוק דיווח האשראי ההוגן. מחקר זה מציג מנגנון רגולריזציה מודע להוגנות כדי להגביל הטיות חיזוי בין-קבוצתיות במהלך אימון המודלים, ומבטיח הוגנות במודל. מוגדרים שני מדדי הוגנות מרכזיים: i) שוויון דמוגרפי (DP): שיעור החיזוי החיובי שווה עבור קבוצות שונות, גישה,
, מבין g יש מזהה קבוצתי; ii) שוויון הזדמנויות (EO): שיעור החיובי האמיתי שווה בין קבוצות, גישה
. הוסף מונחי רגולריזציה של הוגנות לפונקציית ההפסד של מודל הסיכון ההיברידי של הבינה המלאכותית, והטיל מגבלות על תת-מודל GBDT המקומי ועל מודל הטרנספורמר הגלובלי בהתאמה: iii) מגבלות הוגנות למודל המקומי:

כאן PR(g=A) הוא קצב החיזוי החיובי עבור הקבוצה g, λ ו- הוא מקדם הרגולריזציה להגינות.
iv) מגבלת הוגנות במודל גלובלית: מוסיפים את התאמת משקל ההגינות הקבוצתית לשכבת הקשב של הטרנספורמר, פלט המודל עבור קבוצות פגיעות ag=a base×(1+β⋅Δלא הוגן) מקבל משקל תשומת לב גבוה יותר, כאן, Δלא הוגן מייצג את הטיית ההוגנות בין קבוצה זו לקבוצה הדומיננטית (Δלא הוגן=PR (קבוצה דומיננטית)-PR (קבוצות פגיעות)); λEO הוא מקדם פיצוי הסטייה. השפעת רגולריזציה של תפיסת ההגינות מוערכת על ידי ΔDP (סטיית DP), ΔEO (סטיית EO) ושגיאת כיול קבוצתית.
לוח מחוונים למודלים של ממשל וציות
ניטור הטיה בזמן אמת
כדי לעמוד בדרישות הרגולציה הפיננסית בניהול מחזור חיים של המודלים, המחקר פיתח לוח מחוונים לממשל מודלים וציות המשלב ממשקי API של ניטור סטיות בזמן אמת ודיווח רגולטורי, ומאפשר פיקוח מלא של תהליכים ומעקב לאורך כל תקופת ההדרכה, הפריסה והאיטרציה של המודלים. מודול ניטור הסטיות בזמן אמת משיג מעקב דינמי אחר הוגנות וביצועים של מודל דרך הממדים הבאים: i) ניטור סטיות קבוצתיות: סיווג קבוצות לפי מגדר לקוח, גיל, אזור, רמת הכנסה וכו', חישוב PR, TPR ו-FPR (שיעור חיובי שגוי) לכל קבוצה לפי שעה. התרעות סטייה מופעלות כאשר הבדלי PR בין קבוצות עולים על 0.08 או הבדלי TPR עולים על 0.05; ii) ניטור סטיית ביצועים: חישוב רציף של מדדים כמו AUC-ROC ו-PR-AUC. כאשר מדדים אלו יורדים ביותר מ-2% ברציפות במשך שלוש שעות, זה נקבע כסטיית ביצועים, ומתחיל אוטומטית את תהליך האימון מחדש של המודל. iii) ניטור ציות לפרטיות: רשם את צריכת תקציב הפרטיות ואת הוספת הרעש εעוצמה כוללת של כל סבב אימון. כאשר צריכת ε של כדור אחד עולה על זה, עצרו את האימון והתאימו את אסטרטגיית הרעש. iv) נתוני ניטור מוצגים דרך לוחות מחוונים ויזואליים, המאפשרים לרגולטורים ולמוסדות המשתתפים לצפות בהם בזמן אמת, ולהשיג ניהול שקוף של סיכוני המודלים.
API לדיווח רגולטורי
כדי לפשט את תהליך הדיווח הרגולטורי, תוכנן API לדיווח רגולטורי סטנדרטי כדי לתמוך ביצירה אוטומטית של דוחות התואמים לרגולציות כמו GDPR, CCPA וחוק הגנת המידע האישי של סין. הפונקציות המרכזיות כוללות: i) דוח עמידה במקורות נתונים: מאגד אוטומטית סוגי נתונים, נפחים וסטטוס הרשאה של המוסדות המשתתפים כדי לוודא עמידה בעיקרון "המינימום הנדרש"; ii) דוח עמידה בדרישות הדרכה מודלית: איטרציות הדרכת רשומות, מוסדות משתתפים, אמצעי הגנה על פרטיות ומדדי הוגנות ליצירת דוח מעקב אחר הדרכה מודלית; iii) דוח ציות לחיזוי סיכונים: מציג דפוסי התפלגות תואמי רגולציה של תחזיות מודל בין קבוצות שונות ומקרים של הסברים נגדיים להוכחת אי-אפליה. ה-API מאמץ סגנון עיצוב RESTful, התומך בפלטים בפורמט JSON ו-XML. הרשויות הרגולטוריות יכולות לגשת ישירות לנתוני הדיווח דרך ממשקי API או להגדיר מחזורי דיווח אוטומטיים להשגת תהליכים רגולטוריים אוטומטיים וסטנדרטיים. תבניות הדוח עומדות בסטנדרטים של מודל הרגולציה הפיננסי של הארגון הבינלאומי לתקינה (ISO), ומבטיחים את הסמכות והאוניברסליות של הדוחות.
עיצוב ניסוי: תיאור מאגר הנתונים
נתוני כרטיסי אשראי והלוואות לעסקים קטנים ובינוניים רב-מוסדיים
הנתונים הניסיוניים הגיעו ממוסדות פיננסיים בסין, וכללו סוגי נתונים כגון עסקאות אישיות בכרטיסי אשראי ורשומות בקשות והשלמת הלוואות של עסקים קטנים ובינוניים. טכנולוגיית CopulaGAN שימשה לסינתזה ושיפור אירועים נדירים של הונאה, ובכך לבנות מאגר נתונים ניסיוני המשלב אותנטיות עם שלמות. הנתונים האמיתיים ששימשו בניסוי כוללים שתי קטגוריות עיקריות: נתוני עסקאות כרטיסי אשראי אישיות ונתוני הלוואות לעסקים קטנים ובינוניים, בסך הכל מעל 5 מיליון רשומות הנפרשות מינואר 2022 ועד דצמבר 2023. הנתונים מכסים ארבעה אזורים כלכליים עיקריים – צפון סין, מזרח סין, דרום סין ודרום-מערב סין – כדי להבטיח ייצוג גאוגרפי וגיוון בהתפלגות המדגם. התחומים המרכזיים והמאפיינים הסטטיסטיים של הנתונים המוסדיים מוצגים בטבלה 7. ביניהם, מוסדות A ו-B הם בנקים מסחריים ארציים עם בסיס לקוחות גדול בכל קבוצות הגיל; מוסדות C ו-D הם בנקים אינטרנטיים המשרתים בעיקר את האוכלוסייה הצעירה (20-35); Institution E היא חברת מימון צרכני המיועדת למשתמשים בשווקים נמוכים, כאשר הפצת הנתונים מציגה מאפיינים משמעותיים שאינם IID. מערך הנתונים מכיל 115610 פריטי נתונים. מערך הנתונים מסופק על ידי מוסדות פיננסיים שמשתפים פעולה עם אוניברסיטאות
| סוג הנתונים | מוסד | מספר התקליטים (10,000) | מספר הלקוחות (10,000) | שדות ליבה | שיעור הונאת חדלות פירעון | מאפייני התפלגות הנתונים |
| עסקאות בכרטיסי אשראי | A | 180 | 85 | זמן העסקה, סכום, סוג סוחר, מיקום העסקה, האם לגנוב את הכרטיס | 0.32% | עסקאות גדולות מהוות אחוז גבוה (> 5000 יואן) |
| עסקאות בכרטיסי אשראי | B | 150 | 72 | מספר זרימת עסקאות, סכום (USD/RMB), ערוץ תשלום, דירוג לקוח | 0.28% | עסקאות חוצות גבולות מהוות 15% |
| עסקאות בכרטיסי אשראי | C | 120 | 68 | חותמת זמן לעסקה, סכום, האם להתקין, גיל הלקוח, מיקום מספר הטלפון הנייד | 0.45% | מסחר קטן בתדירות גבוהה (<1000 יואן) מהווה 60%) |
| הלוואות לעסקים קטנים וקטנים | D | 32 | 1.2 | שם החברה, סכום ההלוואה, תקופת האשראי, סולם הכנסות, סכום מס, האם פיגר | 2.80% | לקוחות הייצור מהווים 40% |
| הלוואות לעסקים קטנים וקטנים | E | 18 | 0.8 | תאריך בקשת ההלוואה, סכום צפוי, סוג העסק, מספר העובדים, רישום ביצועים היסטורי | 3.50% | לקוחות שירות מהווים 70% |
טבלה 7: מאפיינים סטטיסטיים של מאגר נתונים פיננסיים ריאליים רב-מוסדי.
כדי להתמודד עם ההטרוגניות של נתונים בין-מוסדיים, הניסוי דבק בקפדנות במפרטי רשת הנתונים והשכבה הסמנטית על ידי סטנדרטיזציה של שדות מוסדיים: לדוגמה, המרת "סכום העסקה (USD)" של מוסד B ל-RMB באמצעות שער החליפין של תאריך העסקה ואיחוד שם השדה ל"סכום עסקה (YOAN)"; המרת "גיל הלקוח" של מוסד C (פורמט "1990-01-01") לגיל שלם; ומיפוי "סולם ההכנסות הארגוני" של מוסד D (מסווג כ"מתחת ל-1 מיליון / 1-5 מיליון / מעל 5 מיליון") לנקודות אמצע בטווחים מספריים (500,000,3,000,000,7,500,000), תוך הבטחת עקביות בין פורמט הנתונים למשמעות סמנטית.
הרחבה סינתטית דרך CopulaGAN לאירועי הונאה נדירים
בתרחישי בקרת סיכונים פיננסיים, מדגמים של הונאה/חדלות פירעון מהווים בדרך כלל אחוז נמוך מאוד. שימוש ישיר בגודל מדגם כה קטן לצורך אימון מודלים היה מוביל לבעיות חוסר איזון חמורות במחלקות, מה שפוגע ביכולות ההכללה של המודל. הניסוי עושה שימוש ב-Copula GAN (רשת יריבה גנרטיבית המבוססת על פונקציות Copula) כדי לסנתז נתונים מוגברים למקרים נדירים של הונאות. שיטה זו משלבת את יכולת פונקציית Copula למודל התפלגויות נתונים בממדים גבוהים עם יכולות הגנרטיביות של GAN, ומאפשרת יצירת נתונים סינתטיים התואמים לדפוסי הונאה אמיתיים, תוך הימנעות מבעיית "קריסת תבניות" הנפוצה ביצירת GAN מסורתית.
מבנה מודל CopulaGAN
CopulaGAN מורכב משלושה חלקים: מחולל, מבחין ומודול אילוצים להתפלגות קופולה: (1) גנרטור: קלט הוא וקטור רעש אקראי בעל 128 ממד z∼N(0,1), ומפיק וקטור תכונות סינתטי התואם לממד הדגימה האמיתי דרך רשת מחוברת במלואה בת 3 שכבות (ממדי השכבה הנסתרת הם 256, 512, 256); (2) מבחין: הקלט הוא דגימה אמיתית או דגימהסינתטית x סינטר, ובאמצעות פונקציית הפעלה של רשת+סיגמואיד מחוברת במלואה בשתי שכבות, מפיקה את ההסתברות שהמדגם הוא נתונים אמיתיים; (3) מודול אילוצי התפלגות קופולה: מתאימים את ההתפלגות המשותפת של דגימות הונאה ממשיות דרך פונקציית קופולה גאוסית (כאשר הוא ערך פונקציית ההתפלגות הקשתית של התכונה השמינית של i), והוספת אילוץ מרחק קופולה באובדן הגנרטור כדי להבטיח שההתפלגות המשותפת של דגימות סינתטיות תואמת לדגימות הממשיות.
(36)
שיפור התהליך ואימות האפקט
תהליך ההכשרה והשיפור של CopulaGAN הוא כדלקמן: i) עיבוד נתונים מוקדם: חילוץ דגימות הונאה/ברירת מחדל (18,200 בסך הכל) מהנתונים האמיתיים של מוסדות שונים; תקנון תכונות רציפות (x'=(x-μ)/σ); תכונות נפרדות מקודדות בחום ייחודי; ii) התאמת קופולה: פונקציית הקופולה הגאוסית משמשת להתאמת ההתפלגות המשותפת של דגימות ההונאה המעובדות מראש, חישוב התפלגות הקשתות Fiθ ופרמטרי פונקציית קופולה של כל תכונה; iii) אימון GAN: הגנרטור והדיסקרימינטור מאומנים לסירוגין. פונקציית ההפסד של הגנרטור היא:
(37)
כאן, λ הוא משקל האילוצ, ו-Distance (Csyn,C real) הוא הסטייה של KL בין התפלגות הקופולה של דגימות סינתטיות לבין התפלגות הקופולה של דגימות ממשיות; פונקציית אובדן המבחין היא אובדן אנטרופיה צולבת בינארי סטנדרטי:
(38)
לאחר התכנסות המודלים (עם דיוק ההבחנה התייצב ב-50%±5%), הגנרטור הפיק 50,000 דגימות הונאה סינתטית. אלו מופו חזרה למרחב התכונות המקורי לפי מפרטים סמנטיים ואוחדו עם דגימות אמיתיות לבניית סט אימון מאוזן. כדי לאמת את יעילות הדגימות הסינתטיות, המחקר העריך אותן באמצעות מבחן KS דו-דגמי והדמיית התפלגות תכונות. תוצאות מבחן KS הראו שההבדלים בהתפלגות התכונות בין מדגמים סינתטיים למממשיים היו כולם מתחת ל-0.05 (סטטיסטיקת KS <0.05, ערך p>0.05), מה שמעיד על עקביות טובה בהתפלגות. השוואת התפלגות תכונות הראתה כי דגימות סינתטיות יכולות לשחזר במדויק את מאפייני ההתפלגות של דגימות הונאה אמיתיות, ולספק נתונים תקפים מספקים לאימון מודלים כפי שמוצג באיור 1.

איור 1: השוואה בין התפלגות תכונות בין דגימות הונאה אמיתיות ל-CopulaGAN אנא לחצו כאן לצפייה בגרסה גדולה יותר של האיור.
מדדי הערכה
הניסוי בונה מערכת הערכה רב-מדדית מארבעה ממדים מרכזיים: ביצועי חיזוי, הגנת פרטיות, הוגנות ויעילות תקשורת, כדי למדוד באופן מקיף את הביצועים המקיפים של מסגרת הלמידה הפדרטיבית ומודל בקרת סיכונים בבינה מלאכותית. ההגדרה, שיטת החישוב וקריטריוני ההערכה של כל ממד מוצגים בטבלה 8.
| ממדי הערכה | שם האינדקס | הגדרה ושיטת חישוב | קריטריון הערכה |
| ביצועים מוערכים | AUC-ROC | השטח מתחת לעקומת העבודה האופיינית של הנבדק מודד את יכולת המודל להבחין בין דוגמאות חיוביות (ברירת מחדל/הונאה) לשליליות | ככל שהערך גבוה יותר, כך טוב יותר. ה-AUC-ROC של הדגם המצוין הוא>0.9 |
| PR-AUC | שטח דיוק-שליפה מתחת לעקומה, הרלוונטי לנתונים לא מאוזנים, מודד את ביצועי המודל בתרחישים שבהם דוגמאות חיוביות נדירות | ככל שהערך גבוה יותר, כך טוב יותר. PR-AUC של דגם מצוין הוא>0.8 |
| שבר ברייר | שגיאת ריבוע ממוצעת בין הסתברות חזויה לתווית אמיתית, B=1Ni=1N(pi-yi)2 | ככל שהערך נמוך יותר, כך טוב יותר. ציון ברייר של דגם מצוין הוא פחות מ-0.05 |
| שיעור חיובי שגוי (FPR) | החלק של דוגמאות שליליות FPR=FPFP+TNש | ככל שהערך נמוך יותר, כך טוב יותר. תרחישים פיננסיים בדרך כלל דורשים FPR <1% (כדי להימנע מדחיית לקוחות טובים) |
| הגנה על פרטיות | עקומת ε-צריכה (ε-עקומה) | רשמו את קצב הצריכה של תקציב הפרטיות המצטברε במהלך ההכשרה כדי לשקף את האיזון הדינמי של יכולת הגנת הפרטיות | העקומה מתאזנת והסך ε קטן או שווה ל-5 (בהתאם לדרישות סיכון פרטיות ב-GDPR) |
| התקפת ההסקה של החברים AUC (MI-AUC) | היכולת של התוקף להסיק אם מדגם שייך לקבוצת האימון מתוצאות חיזוי המודל, וככל שערך AUC קרוב יותר ל-0.5, כך הפרטיות טובה יותר | MI-AUC<0.6 יעיל להגנה על פרטיות, MI-AUC<0.55 מצוין |
| שיעור דליפת תכונות (FLR) | התוקף מאגד את התכונות כדי להפוך את השגיאה FLR=1-KL(P∥∥Q)Dmaxrate של התפלגות הנתונים המקורית, | FLR <0.1 מציין שהגנה על פרטיות היא יעילה (P היא Dmax ההתפלגות האמיתית, Q היא ההתפלגות המוסקת, והיא המרחק המרבי של KL) |
| הוגנות | הטיית DP בסטטיסטיקה (ΔDP) | ההפרש המרבי בתחזית ΔDP=max∥PRg-PRavg∥rate של דוגמאות חיוביות בין קבוצות שונות, | ΔDP<0.05 עבור הוגנות, למצוינות (PRg עבור שיעור חיובי בקבוצה g) |
| הטיית EO (ΔEO) | ההפרש המקסימלי בשיעורי ΔEO=max∥TPRg-TPRavg∥ בין קבוצות שונות, | GCE <0.02 מכויל היטב (K הוא מספר הקבוצה, הוא הקצב החזויה, והוא הקצב בפועל) |
| שגיאת כיול קבוצתית (GCE) | הסטייה הממוצעת בין ההסתברות החזויה GCE=1Kg=1K∥pg-rg∥ של כל קבוצה לבין שיעור ברירת המחדל בפועל, | ככל שהערך נמוך יותר, כך טוב יותר. דרישות התסריט של ארגונים קטנים ובינוניים הן <10MB לכל סבב |
| יעילות תקשורת | רוחב פס של uplink לכל סבב | סך צריכת רוחב הפס של הנתונים שהועלו על ידי כל ארגון למתאם במהלך צריכת רוחב פס | ככל שהערך נמוך יותר, כך טוב יותר. תרחישים בין-מוסדיים דורשים פחות מ-120 דקות |
| יחס הפחתה (CR) | היחס בין נפח הנתונים המקורי לנפח הנתונים הדחוס, CR=SizerawSizecomp | ככל שיחס הדחיסה גבוה יותר, כך טוב יותר. פתרונות מצוינים CR>10:1 |
טבלה 8: מערכת אינדקס הערכה ניסיונית.
הסבר מטרי: i) התקפת הסקת חברות: באמצעות מתודולוגיית התקפת קופסה שחורה, התוקף מאמן מודל סיווג בינארי שמזין הסתברויות חזויות מהמודל היעד ומפיק את מצב חברות המדגם. סיכון דליפת הפרטיות נמדד על ידי AUC של המודל (כלומר, MI-AUC). ii) קריטריוני סיווג קבוצתיים: בהערכת הוגנות, הקבוצות מסווגות בארבעה ממדים: מגדר (זכר/נקבה), גיל (מתחת ל-25/25-40/>40), אזור (שווקים מדרג ראשון/דרג ראשון חדש/שכבה שנייה/שווקים משותפים), ורמת הכנסה (<5,000/5,000-15,000/>30,000 יואן/חודש). דבר זה מבטיח כיסוי של קבוצות רגישות שזוהו על ידי רגולטורים פיננסיים. iii) קריטריוני התכנסות: במהלך אימון המודלים, אם קבוצת האימות AUC-ROC מראה ירידה של פחות מ-0.001 בשלושה סבבים רצופים (כל סבב מכיל 10 אפוקים), האימון נחשב כמתכנס ומופסק.
קווי בסיס
כדי לאמת את העליונות של "מודל בקרת סיכונים ללמידה מאוחדת + בינה מלאכותית היברידית", מחקר זה קובע חמישה מודלים בסיסיים: מודלים מרכזיים מסורתיים, מודלים קלאסיים של למידה מאוחדת, ומודלים משופרים השומרי פרטיות. הפרמטרים המרכזיים ואסטרטגיות האימון של כל מודל בסיס מפורטים בטבלה 9 כדי להבטיח הוגנות בניסויים השוואתיים (כל המודלים משתמשים במערכות אימון זהות, מערכות אימות ואסטרטגיות אופטימיזציה של היפרפרמטרים).
| סוגי דגמים | שם הדגם | ארכיטקטורה מרכזית | מצב אימון | אמצעי הגנה על פרטיות | היפרפרמטרים מרכזיים |
| מודל מרכזי | מסורת GBDT | עץ הגברת שיפוע XGBoost | כל המוסדות מאחסנים את נתוני ההכשרה באופן מרכזי | לא | מספר עצים = 100, קצב למידה = 0.1, עומק עץ = 6, מקדם רגולריזציה λ=1.0 |
| מודל מרכזי | מודל למידה עמוקה (MLP) | רשת מחוברת במלואה בת שלוש שכבות (שכבת קלט 256 ממדים → שכבה נסתרת 128 → שכבה נסתרת 64 ממדים → שכבת פלט 1) | כל המוסדות מאחסנים את נתוני ההכשרה באופן מרכזי | לא | אופטימייסר=אדם, קצב למידה=0.001, גודל אצווה=256, Dropout=0.3 |
| מודל פדרלי קלאסי | FedAvg (הממוצע הפדרלי) | המודל המקומי הוא GBDT, והמודל הגלובלי מאמץ אגרגציה ממוצעת של פרמטרים | אימונים פדרליים מסונכרנים | לא | שיעור השתתפות = 0.8, עידן מקומי = 5, סבב אגרגציה = 50, קצב למידה = 0.1 |
| מודל פדרלי קלאסי | FedProx (אגרגציה פדרלית לסוף הקרוב) | המודל המקומי הוא GBDT, והפרוקסימלי | אימונים פדרליים מסונכרנים | לא | שיעור השתתפות = 0.8, עידן מקומי = 5, סבב אגרגציה = 50, פרמטר פרוקסימלי μ = 0.01 |
μ=0.01 אילוץ מונחים מתווסף במהלך האגרגציה (). |
| הפדרציה המועצמת לפרטיות | FedAvg+DP (רעש קבוע) | הוסף רעש לפלסיאני קבוע ל-FedAvg (ε=5, δ=1e-5) | אימונים פדרליים מסונכרנים | פרטיות דיפרנציאלית קבועה | עוצמת רעש=0.1, שיעור השתתפות=0.8, תקופה מקומית=5, סבבי אגרגציה=50 |
| מודל המחקר | FedRisk (מודל בקרת סיכונים פדרלי) | GDT מקומי (אילוץ מונוטוני) + טרנספורמר גלובלי (מיזוג תשומת לב) + DP + אגרגציה מאובטחת | אימון אסינכרוני פדרלי | שיתוף סודות אדפטיבי DP+ | עידן מקומי=5, סבבי אגרגציה=50, מימד תשומת לב=64, תקציב פרטיותε=5, יחס דחיסה=15:1 |
טבלה 9: השוואת פרמטרים בין מודל הבסיס למודל המחקר הזה.
הסבר השוואתי: (1) מרכזי מול פדרטי: על ידי השוואה בין "GBDT/MLP מסורתי" ל"FedAvg/FedProx/FedRisk", מחקר זה בוחן את הידרדרות הביצועים של למידה פדרטיבית בתרחישי "נתונים מחוץ לאתר". (2) קלאסי מול פרטיות משופרת: באמצעות "FedAvg" לעומת "FedAvg+DP", המחקר מעריך את השפעת הפרטיות השונה על ביצועי המודלים. (3) סינכרוני מול אסינכרוני Federated: ההשוואה בין "FedAvg" (סינכרוני) ל-"FedRisk" (אסינכרוני) מדגימה את יתרונות יעילות התקשורת של אימון אסינכרוני. (4) אגרגציה פשוטה מול מיזוג אינטליגנטי: הניגוד בין "FedAvg" (ממוצע פרמטרים) ל-"FedRisk" (מיזוג תשומת לב) מאשר את יכולת ההסתגלות של אסטרטגיות אינטגרציית טרנספורמרים לנתונים שאינם IID. (5) אי-צנזורה מול צנזורה של הוגנות: ההשוואה בין "FedAvg" (ללא מגבלות הוגנות) ל-"FedRisk" (מגבלות מודעות להוגנות) בוחנת את השפעות מנגנוני ההגינות על הוגנות וביצועים במודל.
מחקרי אבלציה
השפעה של ε משתנה על תועלת המודל
באמצעות תקציב הפרטיות הכולל ε כמשתנה (עם ערכים של 1, 3, 5, 7 ו-10), המחקר קבע את δ=1e-5 תוך שמירה על מודולים אחרים (מיזוג תשומת לב ומגבלה מונוטונית GBDT) ללא שינוי כדי להעריך את הפשרה בין חוזק הגנת הפרטיות לתועלת המודל. הניסוי מדד הן AUC-ROC (תועלת המודל) והן MI-AUC (סיכון פרטיות) כמדדים כפולים, כאשר התוצאות מוצגות בטבלה 10. כאשר ε=1, MI-AUC ירד ל-0.53 (הגנה מצוינת על פרטיות), אך AUC-ROC הגיע רק ל-0.821 (אובדן משמעותי בשימושיות). ב-ε=5, AUC-ROC התאושש ל-0.912 (עומד בדרישות בקרת סיכונים פיננסיים) עם MI-AUC=0.58 (הגנה אפקטיבית על פרטיות). ב-ε>5, השיפור ב-AUC-ROC היה פחות מ-0.01, בעוד ש-MI-AUC עלה במהירות ל-0.63 (מעבר למגבלות סיכון הפרטיות). דבר זה מאשר ש-ε=5 הוא תקציב הפרטיות הכולל האופטימלי, ומשיג איזון בין פרטיות לשימושיות.
| תקציב פרטיות כוללε | דגם AUC-ROC | MI-AUC (סיכון פרטיות) | קצב דליפת תכונות FLR | שבר ברייר |
| 1 | 0.821 | 0.53 | 0.04 | 0.078 |
| 3 | 0.876 | 0.55 | 0.06 | 0.061 |
| 5 | 0.912 | 0.58 | 0.08 | 0.042 |
| 7 | 0.919 | 0.6 | 0.11 | 0.039 |
| 10 | 0.923 | 0.63 | 0.15 | 0.037 |
טבלה 10: השוואת ביצועי מודלים עם תקציבי פרטיות שונים ε.
תרומה של מיזוג קשב לעומת ממוצע פשוט
כדי להעריך את ההבדלים בביצועים בין "מיזוג תשומת לב" (האסטרטגיה המוצעת) ל"ממוצע פשוט" (אסטרטגיית FedAvg) בתרחישי נתונים לא עצמאיים, שני משתנים הוגדרו ניסויים: (1) חומרת נתונים שאינה IID (נמדדת על ידי שינויים בשיעור חדלות פירעון ספציפית למוסד, שונות נמוכה: 0.2%-0.5%, שונות גבוהה: 0.2%-3.5%); (2) אסטרטגיות מיזוג (מיזוג קשב לעומת ממוצע פשוט). כפי שמוצג באיור 2, הפער בין AUC ל-ROC בין שתי האסטרטגיות היה רק 0.023 (0.912 לעומת 0.889) בתרחישים שאינו IID נמוך. עם זאת, פער זה התרחב ל-0.076 (0.905 לעומת 0.829) בתרחישים ללא IID גבוהים, כאשר מודל הממוצע הפשוט הציג התאמה יתר משמעותית (סט אימון AUC-ROC 0.941 לעומת סט אימות 0.829). דבר זה מראה שמנגנוני קשב יכולים להפחית ביעילות את הידרדרות הביצועים הנגרמת על ידי נתונים לא עצמאיים באמצעות שקילות דינמיות – כגון הקצאת משקל של 0.32 למוסד E עם תחזיות ברירת מחדל מדויקות ומשקל 0.12 למוסד C עם סטיות גדולות יותר.

איור 2: השוואה בין אסטרטגיות מיזוג בדרגות שונות שאינן IID. אנא לחצו כאן לצפייה בגרסה רחבה יותר של איור זה.
השפעת רגולרייזרים של הוגנות על מדדי ביצוע מבוססי רווח
הדרישה המרכזית של המוסדות הפיננסיים היא להבטיח רווחי עסקים תחת מגבלת ההגינות, ולכן הניסוי מציג מדד מוכוון רווח - "תשואה מותאמת לסיכון על ההון (RAROC)". הנוסחה היא כדלקמן:
(39)
ההפסד הצפוי מחושב כהסתברות חדלות המחדל מוכפלת בשיעור ההפסד הקבוע (שנקבע כ-40%), בעוד שההון הכלכלי נקבע על ידי החשיפה לסיכון מוכפלת במשקל הסיכון (לפי דרישות באזל III). מדדי ההגינות (ΔDP, ΔEO) ו-RAROC של המודל עם רגולריזציה של הוגנות לעומת המודל ללא הוגנות מושווים בטבלה 11. לאחר יישום הסדרת הוגנות, ΔDP ירד מ-0.15 ל-0.04, ΔEO ירד מ-0.12 ל-0.03, ו-RAROC ירד רק ב-2.1% (18.3% לעומת 18.7%), משמעותית מתחת לסף המקובל בתעשייה של 5%. דבר זה מראה שמנגנון ההגינות במחקר שלנו עומד ביעילות בדרישות רגולטוריות לאי-אפליה תוך שליטה בהפסדי רווחים.
| הגדרת הדגם | ΔDP (הפרש קצב חיובי בקבוצה) | ΔEO (הפרש TPR בקבוצה) | GCE (שגיאת כיול קבוצתי) | RAROC (תשואה מותאמת סיכון על נכסים) | FPR (שיעור חיובי שגוי) |
| חוק ללא הוגנות | 0.15 | 0.12 | 0.035 | 18.70% | 0.95% |
| יש הוגנות וסדירות | 0.04 | 0.03 | 0.018 | 18.30% | 1.02% |
טבלה 11: השפעת הסדרת ההגינות על מדדי הוגנות ורווח.
פרטי היישום
כדי להבטיח שחזוריות של הניסוי, המחקר הבהיר את פרטי המערך הטכני ותהליך האימון: (1) סביבת חומרה: כל צומת מוסדי משתמש במעבדי Intel Xeon Gold 6248, זיכרון RAM של 64GB וכרטיסי NVIDIA Tesla V100; המתאם המאוחד משתמש במעבדי Xeon Gold 6348 כפולים עם זיכרון RAM של 128GB כדי להבטיח מחשוב מקבילי ואגרגציה יעילה של פרמטרים. (2) מסגרת תוכנה: מסגרת הלמידה הפדרציאלית מפותחת באמצעות PySyft 0.8.6, מודול הבלוקצ'יין משתמש ב-Hyperledger Fabric 2.5 (מנגנון קונצנזוס: Raft), אימון מודלים מתבסס על PyTorch 2.0 ו-XGBoost 2.0.3, בעוד שמודול הפרטיות הדיפרנציאלי משלב את IBM DP Library. (3) תהליך ההדרכה: (1) קדם-עיבוד נתונים (שעתיים, כולל נרמול סמנטי ושיפור CopulaGAN); (2) אימון מקומי (5 עידנים בכל סבב, קצב הלמידה ירד באמצעות אנילינג קוסינוס); (3) אגרגציה אסינכרונית (עדכוני מודלים גלובליים מתרחשים כאשר המתאם מקבל פרמטרים משלושה מוסדות); (4) הערכת מודלים (מדדי AUC-ROC והגינות שחושבו לאחר 10 סבבים); (5) אופטימיזציה של היפרפרמטרים (אופטימיזציה בייסיאנית עם 50 איטרציות לקביעת פרמטרים אופטימליים). (4) בדיקות עמידות: ניתוקים מוסדיים מדומים (בחירה אקראית של מוסד אחד לעצור 1-3 סבבי הדרכה) ורעש נתונים (הוספת 5% הפרעות ערך תכונה). התוצאות הראו תנודות AUC-ROC מתחת ל-0.02, מה שהדגים את יכולת ההגנה מפני הפרעות של המערכת.
מחקר זה השתמש באסטרטגיית תזמון אנילינג קוסינוס עם קצב למידה התחלתי של 0.05. קצב הלמידה עודכן דינמית בכל תקופה לפי הנוסחה על פני 100 תקופות אימון. אסטרטגיה זו שמרה על קצב למידה גבוה בשלבים הראשונים של האימון, למשל 0.05 בעידן הראשון, כדי להאיץ את התכנסות המודלים, והורידה אותה בהדרגה לכמעט אפס, למשל 0.00025 בעידן המיא, כדי לשפר את יציבות כיוונון הפרמטרים. תוצאות ניסויים הראו שבהשוואה לקצב למידה קבוע, אסטרטגיה זו שיפרה את קבוצת האימות AUC-ROC ב-2.3% ואת מהירות ההתכנסות המואצת ב-37%. חלוקת הנתונים התבססה על מערך נתונים גולמי מחמישה מוסדות פיננסיים בסך כולל של 5 מיליון מדגמים, תוך שמירה קפדנית על עקרון בידוד הנתונים בין המוסדות. הנתונים המקומיים מכל מוסד חולקו כרונולוגית, כאשר הנתונים מינואר 2022 עד יוני 2023 הם מערך ההכשרה (70%), הנתונים מיולי עד ספטמבר 2023 כסט האימות (15%), והנתונים מאוקטובר עד דצמבר 2023 כמערך הבדיקה (15%). חלוקה זו הבטיחה את עצמאות החלון הזמני של מערכות האימון, האימות והבדיקה, ובכך סימלה ביעילות את התפתחות דפוסי הסיכון הזמני בתרחישים אמיתיים. היפרפרמטרים מרכזיים נקבעו באמצעות אופטימיזציה בייסיאנית. בתוך מרחב חיפוש משותף הכולל קצב למידה התחלתי בין 0.01 ל-0.1, מספרי עץ GBDT בין 50 ל-200, וראשי תשומת לב של טרנספורמר מהסט {2, 4, 8}, בוצעו 50 איטרציות במטרה למקסם את קבוצת האימות AUC-ROC. השילוב האופטימלי הסופי זוהה כקצב למידה התחלתי של 0.05, 120 עצי GBDT ו-4 ראשי קשב.