הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר שיטה

פרוטוקול ניסיוני להגירה מאובטחת של נתונים בענן המונחית על ידי בינה מלאכותית הסבירה תוך שימוש בנתוני בריאות סינתטיים

302 צפיות

DOI:

10.3791/71612

14 באוגוסט 2026

במאמר זה

סיכום

שיטה זו מציגה מסגרת מקיפה המבוססת על בינה מלאכותית הניתנת להסבר (XAI) כדי לאפשר הגירה מאובטחת של נתוני בריאות לענן, תוך שימוש במערך נתונים סינתטי של בריאות בתוך סביבת ענן מבוקרת. התוצאה היא אב-טיפוס המשלב אבטחת אפס-אמון (zero-trust), בקרת גישה מבוססת זמן וזיהוי חריגות ניתן להסבר, כדי לתמוך בשקיפות ובאבטחה של תהליך ההגירה.

תקציר

במערכות בריאות, מתבצעת יותר ויותר הגירה של נתונים לענן, אך דבר זה משנה גם את הזמנים שבהם העברת הנתונים מהווה ככל הנראה את הסיכון הגבוה ביותר מבחינת אבטחה. מאמר זה מתאר פרוטוקול הדיר בביצוע להגירה מאובטחת של נתוני ענן המבוססת על בינה מלאכותית ניתנת להסבר (XAI), תוך שימוש במערך נתונים סינתטי של בריאות ובסביבת ענן מבוקרת. המסגרה שפותחה משלבת ארכיטקטורת zero-trust, הרשאת מינימום זמנית (temporal least privilege), תקשורת מוצפנת, ניטור מרכזי וזיהוי חריגות ניתן להסבר, כדי להשיג הגירה מאובטחת, שקופה וניתנת לביקורת יותר. הבדיקות נעשו באמצעות מערך נתונים של 10 GB של רשומות בריאות אלקטרוניות סינתטיות, הכולל כ-20 מיליון רשומות הפרוסות על פני 28 טבלאות רלציוניות. תהליך ההגירה בוצע בשירותי Amazon web services (AWS) באמצעות בסיסי נתונים מסוג PostgreSQL ורשתות וירטואליות פרטיות. לצורך זיהוי חריגות נעשה שימוש ב-Isolation Forest, ו-Shapley additive explanations (SHAP) שימשו לפירוש מאובטח של אירועים. המסגרת הוערכה בעשרה ניסיונות הגירה נפרדים תוך שימוש במדדים כגון משך חשיפת האישוריים, זמן זיהוי אירועים, דיוק זיהוי חריגות, השהיית הגירה ושלמות הנתונים. תחת התצורה שנבדקה, חשיפת האישוריים הופחתה מ-24 h ל-1 h (הפחתה של 95.8%), דיוק זיהוי החריגות היה 97.4%, זמן זיהוי האירועים הופחת לכ-15 min, ושלמות נתונים של 100% נשמרה באמצעות אימות checksum. עם זאת, אמצעי האבטחה המחמירים יותר הובילו לעלייה ממוצעת של 11% בהשהיית ההגירה. תוצאות אלו מדגימות את הפוטנציאל שבשילוב של AI ניתנת להסבר עם זרימות עבודה של הגירת ענן מאובטחת לניהול נתוני בריאות.

מבוא

מחשוב ענן הוא כיום חלק בלתי נפרד ממערכות הבריאות ברחבי העולם, והוא מציע אחסון ניתן להרחבה, משאבים חישוביים ואת היכולת להחליף רשומות רפואיות, לתמוך במערכות תמיכה בקבלת החלטות ולאפשר ניתוחי נתונים בריאותיים באמצעות הענן1,2,3. עם שדרוג מערכות המידע של מוסדות בריאות רבים, המעבר לענן הפך עבורם לצעד חיוני כדי להעביר את נתוני הבריאות הרגישים השמורים במערכות מקומיות מיושנות אל הענן4. הגירה נכונה מובילה לאחזור נתונים קל יותר, להרצת פעולות באופן יעיל יותר ולתמיכה בניתוחים עם רמות גבוהות יותר של אינטליגנציה, אך במקביל, לא ניתן להתעלם מסיכוני אבטחה ופרטיות חמורים למדי הכרוכים בהעברת נתונים ממקום אחד למשנהו5.

שלב ההגירה הוא רגע פגיע ידוע במחזור החיים של הנתונים, מכיוון שנתוני בריאות מועברים באופן פעיל בין מערכות ורשתות מעצם טבעו של התהליך6. בנוסף, ארגונים עלולים להיות חשופים לאיומים כגון פריצה להרשאות גישה, גישה לא מורשית, יירוט נתונים, תכניות מניפולציה ואפילו אובדן נתונים במהלך שלב ההגירה6,7. סביבות בריאות הן פחות חסונות מפני סיכונים אלו, כיוון שמידע על מטופלים הוא רגיש ביותר ולפיכך דורש את הרמה הגבוהה ביותר של עמידה בנורמות רגולטוריות ובאמצעי אבטחה8,9. ללא זאת, לא ניתן להבטיח את סודיות הנתונים, את שלמותם ואת האחריות עליהם, אם זרימת העבודה של ההגירה אינה מאובטחת ואינה ניתנת לניטור10,11.

מספר מסגרות ותקני אבטחה פותחו בניסיון לשפר את אבטחת הענן. לדוגמה, ארכיטקטורת ה-Zero Trust של המכון הלאומי לתקנים וטכנולוגיה (NIST) מתמקדת באימות מתמיד של משתמשים, התקנים ושירותים12, בעוד שמסגרות לאימוץ ענן מספקות הנחיות בנושאי ממשל, ניהול זהויות, הצפנה וניטור13. למעשה, שיטות אבטחת ענן כיום מתמקדות באוטומציה, תשתית כקוד (infrastructure-as-code) וניטור רציף14,15. בעוד שגישות אלו מבוססות על עקרונות אבטחה בעלי ערך, הן עוסקות במידה רבה בפריסה כללית של ענן ובסביבות תפעוליות, ולא בתהליך ההגירה עצמו16. למעשה, הן כמעט ואינן מציגות נהלים מפורטים, הניתנים לשחזור ובצעים שלב-אחר-שלב, לביצוע זרימות עבודה של הגירת נתוני ענן רפואיים מאובטחת, המשלבות ניהול זהויות, העברה מאובטחת של נתונים, תיקוף, ניטור והקשחה לאחר ההגירה17.

זיהוי חריגות באמצעות למידת מכונה (Machine learning anomaly detection) הוכר כטכנולוגיה מועילה לניטור אבטחה של סביבות ענן. הוא מזהה פעילות מערכת חריגה וכן אירועי אבטחה פוטנציאליים18. עם זאת, שיטות רבות לזיהוי חריגות הן מערכות סגורות שאינן מספקות הסברים על הרציונל העומד מאחורי סימון אירוע אבטחה19. חוסר היכולת להסביר החלטות שקיבלו המערכת מפחית את האמון של מנהלי המערכת, מקשה על ביצוע ביקורת ומקטין את ערכן של החלטות אבטחה אוטומטיות בסביבות בריאות רגולטוריות קפדניות20. שיטות של בינה מלאכותית ניתנת להסבר (XAI), כגון SHapley Additive exPlanations (SHAP) ו-Local Interpretable Model-agnostic Explanations (LIME), לא רק מספקות הסברים ברורים לתחזיות של למידת מכונה, אלא גם משפרות את ההבנה, האחריות והביטחון במערכות לניטור אבטחה21,22.

אף על פי שאבטחת ענן ובינה מלאכותית הניתנת להסבר (explainable AI) התקדמו בצעדי ענק, עדיין קיים מחסור בפרוטוקולים ניסויים הניתנים לשחזור המשלבים בקרות הגירה מאובטחות עם ניטור אבטחה ניתן להסבר לצורכי אינטגרציה23. מחקרים קיימים מתמקדים ברובם ברכיבים בודדים בלבד, כגון הצפנה, בקרת גישה, זיהוי חריגות או ממשל ענן, ושום מקור אינו מציע מתודולוגיה משולבת שניתן ליישם, להעריך ולשחזר באופן שיטתי24. מעבר לכך, כמעט ואין מחקרים שניסו לאחד עקרונות אבטחה של אמון אפס (zero-trust), הרשאה מינימלית זמנית (temporal least privilege), יכולת צפייה מרכזית וזיהוי חריגות ניתן להסבר לכדי זרימת עבודה אחת להגירת ענן בתחום הבריאות25,26.

מאמר זה מציג מסגרת מבוססת AI הסברי (Explainable AI) להגירה מאובטחת של נתוני ענן במערכות בריאות כדי למלא חלל זה. הארכיטקטורה המוצעת משתמשת במודל אפס-אמון (zero-trust), גישה מוגבלת בזמן, תקשורת מאובטחת, רישום וניטור מרכזיים, וזיהוי אנומליות הסברי מבוסס SHAP בתהליך הגירה מסודר27,28. הפרוטוקול מהווה מדריך שלב-אחר-שלב להטמעה, ניטור והערכה של הגירה מאובטחת של נתוני בריאות תחת תנאים ניסיוניים. באמצעות שילוב של בקרות אבטחה עם ניטור הסברי מבוסס AI, מסגרת זו שואפת להעלות את רמת השקיפות, היכולת לביקורת והאבטחה לאורך כל מחזור חיי ההגירה29,30.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

במחקר זה נעשה שימוש במערך נתונים סינתטי מלא של שירותי בריאות, אשר הופק לצורך הערכה ניסיונית של הגירה מאובטחת של נתונים לענן. לא נעשה שימוש בנתונים אמיתיים של מטופלים, במידע בריאותי מוגן (PHI) או ברשומות בריאות מזוהות. לפיכך, לא נדרש אישור של ועדת הלסינקי (IRB) או הסכמה מדעת. כל החומרים ששימשו במחקר זה כלולים ב- טבלת חומרים.

1. סקירה כללית

  1. הגדירו סביבת הגירה מאובטחת לענן המורכבת משכבת מקור, שכבת מוקד הגירה (migration hub), שכבת יעד, שכבת רשת, שכבת ניהול זהויות והרשאות, שכבת ניטור (observability) ושכבת בינה מלאכותית ניתנת להסבר (explainable AI).
  2. פרוסו את כל הרכיבים בתוך סביבות ענן מבודדות כדי לתמוך בהגירה מאובטחת של נתוני בריאות. הקימו ערוצי תקשורת מוצפנים בין כל רכיבי המערכת.
  3. בצעו את הפרוטוקול באמצעות הכנת מערכי נתונים, הגדרת סביבה, פריסת ארכיטקטורה, הגירה מאובטחת, ניטור חריגות ואימות לאחר ההגירה. הארכיטקטורה הכללית של מסגרת ההגירה המאובטחת של נתוני ענן מבוססת בינה מלאכותית ניתנת להסבר המוצעת מוצגת ב-איור 1.

דיאגרמת הגירה של בסיס נתונים לענן; מפרטי ל-AWS; כוללת שכבות של ניטור ובקרה (observability), אבטחה ובינה מלאכותית.
איור 1: ארכיטקטורה כללית של מסגרת להגירה מאובטחת של נתוני ענן מבוססת בינה מלאכותית הניתנת להסבר (XAI) עבור מערכות בריאות. המסגרת מורכבת משכבת ניהול זהויות וגישה, שכבת בסיס נתונים מקור, שכבת מרכז הגירה, שכבת בסיס נתונים בענן יעד, שכבת אבטחת רשת, שכבת ניטור (observability), שכבת ניטור בינה מלאכותית ניתנת להסבר, ושירותי אבטחה וממשל חוצי-שכבות. הארכיטקטורה משלבת בקרת גישה זמנית של הרשאות מינימליות, תקשורת מוצפנת ב-TLS 1.3, אימות שלמות מבוסס checksum, ניטור אבטחה רציף והסבירות מבוססת SHAP כדי לספק הגירה מאובטחת, שקופה וניתנת לשחזור של בסיסי נתונים רפואיים. איור זה נוצר על ידי המחברים באמצעות Microsoft PowerPoint (Microsoft 365). אנא לחץ כאן כדי לצפות בגרסה מורחבת של איור זה.

2. הגדרת סביבת המחשוב

  1. הגדרת הסביבה החישובית
    1. הכינו את המשאבים החישוביים הדרושים להגירה מאובטחת של נתונים לענן ולניטור המבוסס על בינה מלאכותית ניתנת להסבר (explainable AI).
    2. התקינו והגדירו את כל החומרה, התוכנה, שירותי הענן, מסדי הנתונים, כלי האבטחה וספריות הלמידה המכנית המפורטים ב- טבלת חומריםיש לוודא שכל הרכיבים הנדרשים תקינים ופעילים לפני תחילת ניסוי ההגירה.
  2. הגדרת סביבת הענן
    1. הקימו סביבת ענן המאובטחת להגירת נתוני בריאות. הגדירו VPC פרטי לתקשורת רציפה בין מקור הנתונים, מרכז ההגירה (migration hub) ומערכות היעד. השתמשו בהצפנה חזקה לא רק בעת אחסון הנתונים, אלא גם בעת העברתם.
    2. הכינו את מסד הנתונים של היעד ואת שירותי ההגירה בהתאם לפרטים המוזכרים ב- טבלת חומרים.
  3. הגדר את ניהול הזהויות והגישה. הגדר את שירותי הניטור והרישום.

3. הכנה ותיאור של מערך הנתונים

  1. צור סט נתונים סינתטי של שירותי בריאות באמצעות ספריית Faker של Python המפורטת בטבלת החומרים. הגדר מאפיינים דמוגרפיים, כולל גיל המטופל, מין, מוצא אתני ומיקום גיאוגרפי, באמצעות התפלגויות הסתברות שהוגדרו מראש.
  2. צור מידע קליני, כולל אבחנות, תוצאות מעבדה, תרופות, אלרגיות, הליכים ואשפוזים בבית חולים, תוך שמירה על קשרים קליניים ריאליסטיים.
  3. צור מפגשי מטופלים לרוחבי זמן (longitudinal) על ידי שיוך ביקורים מרובים למטופלים בודדים בהתאם להתפלגויות תדירות ביקורים שהוגדרו מראש.
  4. צור חותמות זמן עבור אשפוזים, בדיקות מעבדה, מתן תרופות, סיכומי שחרור ויומני ביקורת (audit logs) באמצעות סדר אירועים כרונולוגי.
  5. הכנס ערכים חסרים ריאליסטיים מבחינה קלינית, רשומות כפולות ותצפיות חריגות (outliers) בהתאם להתפלגויות איכות נתונים שהוגדרו מראש.
  6. החלף את כל המידע המזהה אישית (PII) בערכים סינתטיים שנוצרו באמצעות ספריית Faker. אחת את השלמות הרפרנציאלית (referential integrity) והעקביות הלוגית לפני ייצוא סט הנתונים. ייצא את סט הנתונים המאומת בפורמט SQL התואם ל-PostgreSQL. הגדר את סט הנתונים כך שיתמוך בתרחישי הגירה ריאליסטיים של נתוני בריאות. מאפייני סט הנתונים שנוצר מסוכמים ב-Table 1.
  7. הגדר קשרי מסד נתונים. הגדר את Patient_ID כמפתח ראשי (primary key) עבור טבלת המטופלים. בסס קשרי מפתחות זרים (foreign-key) בין טבלאות המטופלים, הביקורים, המעבדה, התרופות ויומני הביקורת. ודא את השלמות הרפרנציאלית בכל הטבלאות לפני תחילת ההגירה.
  8. דמה מאפייני נתוני בריאות ריאליסטיים. צור גילאי מטופלים באמצעות התפלגות נורמלית. צור תדירויות ביקורים באמצעות התפלגות פואסון. הכנס ערכים חסרים בשיעור של 5% כדי לדמות חוסר שלמות של רשומות רפואיות אלקטרוניות (EHR) מהעולם האמיתי. החלף את כל מזהי המטופלים בערכים מוצפנים (hashed) לפני ההגירה. ודא שכל הרשומות שנוצרו תואמות לאילוצי הסכמה שהוגדרו מראש.
  9. אתק את סט הנתונים שנוצר על ידי בדיקת עקביות הסכמה, שלמות רפרנציאלית, ערכים חסרים, רשומות כפולות ואילוצי איכות שהוגדרו מראש לפני ההגירה.
פרמטרערך
סוג מערך הנתוניםמערך נתוני EHR סינתטי לבריאות
גודל מערך הנתונים10 GB
סה"כ רשומות20 מיליון
מספר טבלאות5 טבלאות ליבה - 28 טבלאות רלציוניות
רשומות מטופלים5,000,000
רשומות ביקורים10,000,000
תוצאות מעבדה4,000,000
רשומות תרופות3,000,000
יומני ביקורת5,000,000
מפתח ראשיPatient_ID
שיעור ערכים חסרים5%
התפלגות גיליםהתפלגות נורמלית
תדירות ביקוריםהתפלגות פואסון
סף תקינות<0.1% הפרות

טבלה 1: מאפיינים של מערך הנתונים הסינתטי של שירותי הבריאות ששימש לתיקוף הפרוטוקול. הטבלה מספקת סקירה כללית של מערך הנתונים, כגון גודל מסד הנתונים, מספר הטבלאות היחסיות, סך הרשומות, מאפייני מטופלים, משתנים קליניים ומאפייני תיקוף לשחזור ניסויי ההגירה המאובטחת.

4. פריסת ארכיטקטורת המערכת

  1. הטמיעו את ארכיטקטורת הגירת הענן המאובטחת המורכבת משכבת המקור, שכבת מומחב הגירה (migration hub), שכבת היעד, שכבת אבטחת רשת, שכבת נצפיות (observability) ושכבת בינה מלאכותית ניתנת להסבר (explainable AI). ארכיטקטורת המערכת שהוטמעה במחקר זה מוצגת ב-איור 2.
  2. המסגרת מורכבת משש שכבות עבודה, אשר במהלך תהליך ההגירה מבצעות את תפקידן אחת אחרי השנייה. השכבה הראשונה, שכבת המקור (Source Layer), היא זו המכילה את מסד הנתונים הסינתטי של שירותי הבריאות.
  3. מומחב ההגירה (Migration Hub) הוא הגוף האחראי על חילוץ סכמה, העברת נתונים מוצפנת, אימות שלמות ותזמור ההגירה. שכבת היעד היא המקום שבו מסד הנתונים שהוגיר מאוחסן ב-Amazon RDS PostgreSQL.
  4. שכבת אבטחת הרשת היא זו המאבטחת את כל התקשרויות באמצעות נקודות קצה פרטיות של VPC, הצפנת TLS 1.3, קבוצות אבטחה (security groups) ורשימות בקרת גישה לרשת (NACLs).
  5. שכבת הנצפיות היא זו שאוספת באופן רציף יומני אימות, יומני הגירה, יומני פעילות של מסד הנתונים ואירועי אבטחה בעזרת Amazon CloudWatch.
  6. שכבת ה-AI הניתנת להסבר היא זו המקבלת את הטלמטריה של האבטחה שנאספה, מעבירה אותה דרך אלגוריתם Isolation Forest ומפיקה הסברים מבוססי SHAP עבור האנומליות שנמצאו. כל שכבות הארכיטקטורה מתקשרות זו עם זו דרך ערוצי רשת פרטיים המאומתים לאורך כל זרימת העבודה של ההגירה.
  7. הטמיעו ואמתו את סביבת מסד נתוני המקור כדי להבטיח גישה מאובטחת וזמינות נתונים לפני ההגירה.
    1. הקימו מסד נתונים PostgreSQL 16 עם מערך הנתונים הסינתטי של שירותי הבריאות. שמרו מידע על מטופלים, פרטי ביקורים, תוצאות מעבדה, רשומות תרופות ויומני ביקורת במסד נתוני המקור.
    2. הגבילו את הגישה למסד הנתונים לשירותי הגירה מורשים ולמשתמשים מנהליים בלבד. אמתו את זמינות מסד הנתונים ואת הקישוריות לפני תחילת פעולות ההגירה.
  8. הגדירו את מומחב ההגירה כדי לתאם חילוץ סכמה, העברת נתונים מוצפנת ותזמור הגירה.
    1. הטמיעו שרת הגירה ייעודי בתוך ענן פרטי וירטואלי (VPC) פרטי. הגדירו שירותי תזמור הגירה כדי לתאם פעילויות של חילוץ סכמה, העברת נתונים ואימות.
    2. הפעילו שירותי אימות סכמה כדי לוודא תאימות בין סביבת המקור לסביבת היעד. הפעילו שירותי אימות שלמות כדי לתקף את הנתונים שהוגרו במהלך ואחרי ההעברה. אמתו את התקשורת בין מומחב ההגירה למערכות מסדי הנתונים לפני ביצוע משימות ההגירה.
  9. הטמיעו את שכבת היעד. הטמיעו Amazon RDS PostgreSQL 16 כסביבת מסד נתוני היעד. הפעילו שירותי גיבוי ושחזור אוטומטיים. הפעילו הצפנת AES-256 עבור נתונים המאוחסנים במסד נתוני היעד.
  10. הגדירו אבטחת רשת. בטלו את כל כתובות ה-IP הציבוריות המשויכות למשאבי ההגירה. התירה תקשורת אך ורק דרך נקודות קצה פרטיות בתוך ה-VPC. הגדירו רשימות בקרת גישה לרשת (NACLs) וקבוצות אבטחה. הפעילו הצפנת TLS 1.3 עבור כל התקשרויות בין רכיבי המערכת. ודאו שאין נקודות קצה נגישות לציבור שנותרו פעילות.
  11. הגדירו ניטור מרכזי כדי לאסוף באופן רציף אירועי אבטחה, יומני הגירה ומדדי ביצועי מערכת.
    1. הפעילו שירותי רישום וניטור של Amazon CloudWatch. אספו יומני אימות, יומני הגירה, יומני פעילות של מסד הנתונים ויומני אירועי אבטחה. הגדירו שמירת יומנים למשך 365 ימים. הפעילו אחסון יומנים בלתי ניתן לשינוי (immutable) כדי לתמוך בדרישות ביקורת ותאימות. אמתו איסוף מדדים בזמן אמת ויצירת התראות.
  12. הגדירו את סביבת ה-AI הניתנת להסבר לביצוע זיהוי אנומליות בזמן אמת והפקת הסברי אבטחה ניתנים לפירוש.
    1. הטמיעו שירותי זיהוי אנומליות בתוך סביבת הניטור. הגדירו את מסגרת ה-AI הניתנת להסבר לעיבוד טלמטריית אבטחה שנוצרה במהלך ההגירה. חברו את זרמי טלמטריית האבטחה מהמקור, ממומחב ההגירה, ממסד נתוני היעד וממשירותי הניטור.
    2. הפעילו זיהוי אנומליות בזמן אמת ויצירת הסברים מבוססי SHAP. אמתו קליטה מוצלחת של נתוני טלמטריה לפני תחילת ניסויי ההגירה.

תרשים תהליך הגירת נתונים עם PostgreSQL, AWS RDS, אבטחה, ניטור (observability) וניטור מבוסס בינה מלאכותית (AI).
איור 2: ארכיטקטורת הפריסה של מסגרת העברת הענן המאובטחת לשירותי בריאות. סביבת הפריסה ממחישה את מסד נתוני מקור ה-PostgreSQL המכיל את מערך הנתונים הסינתטי של שירותי הבריאות, את מוקד ההגירה הייעודי בתוך ענן פרטי וירטואלי (VPC), את מסד נתוני היעד Amazon RDS PostgreSQL, את שכבת אבטחת הרשת, ניטור מרכזי באמצעות Amazon CloudWatch ואת שכבת הניטור של בינה מלאכותית ניתנת להסבר (Explainable Artificial Intelligence). כל התקשורת מתבצעת דרך נקודות קצה פרטיות המוגנות על ידי הצפנת TLS 1.3. איור זה נוצר על ידי המחברים באמצעות Microsoft PowerPoint (Microsoft 365). אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

5. זרימת עבודה להגירה מאובטחת

הערה: בצע את תהליך ההגירה המאובטח על ידי ביצוע מידול איומים, העברת סכימה, הגירת נתונים מאובטחת, תיקוף ההגירה והקשחה לאחר ההגירה.

  1. זהו איומי אבטחה פוטנציאליים ומפה בקרות הפחתה מתאימות לפני תחילת תהליך ההגירה.
    1. זהה נכסי הגירה, וקטורי תקיפה פוטנציאליים ותרחישי תקיפת סייבר ריאליסטיים.  
    2. הערך גניבת הרשאות כתוצאה מאסימוני אימות שנפרצו, תקיפות פנימיות הכוללות גישה ניהולית לא מורשית, תקיפות replay המכוונות לבקשות אימות שנלכדו בעבר, תקיפות man-in-the-middle (MITM) המנסות ליירט ערוצי תקשורת מוצפנים, שינוי סכימה (schema tampering) שנועד לשנות מבני מסדי נתונים במהלך ההגירה, ותקיפות העלאת הרשאות שמטרתן השגת הרשאות ניהוליות לא מורשות.
    3. בדוק אם שימוש בניהול הרשאות זמני של מינימום הרשאות (temporal least-privilege) מספיק למניעת גניבת הרשאות ותקיפות העלאת הרשויות. ודא שתקשורת המוצפנת באמצעות TLS 1.3 מגנה מפני תקיפות replay ותקיפות man-in-the-middle.
    4. ודא שמדיניות ניהול זהויות וגישה (IAM) מונעת גישה ניהולית לא מורשית. ודא שרישום ביקורת רציף שומר תיעוד של כל פעילויות ההגירה הקשורות לאבטחה. ודא שבדיקה באמצעות checksum מסוג SHA-256 מסוגלת לזהות שינויים לא מורשים בסכימה או בנתונים.
    5. ודא שמסגרת זיהוי האנומליות הניתנת להסבר יכולה לאתר פעילויות הגירה חריגות וכן לספק הסברי אבטחה הניתנים לפירוש. צור מפת בקרת אבטחה עבור כל איום שזוהה. ודא שכל האיומים שזוהו מופחתים כראוי לפני תחילת הגירת מסד הנתונים. המחברים סיכמו את מודל האיומים ובקרות האבטחה ב-טבלה 2.
  2. העבר את סכימת מסד הנתונים. חלץ הגדרות סכימה ממסד נתוני PostgreSQL המקור. תקף את תאימות הסכימה עם סביבת מסד הנתונים של היעד. ודא את מבני הטבלאות, מפתחות ראשיים, מפתחות זרים, אינדקסים ואילוצים. פרוס את הגדרות הסכימה המתוקפות במסד נתוני היעד. אשר פריסה מוצלחת של הסכימה לפני העברת הנתונים.
  3. הגר נתוני בריאות באופן מאובטח באמצעות ערוצי תקשורת מוצפנים תוך ניטור רציף של פעילויות ההגירה.
    1. הגדר את גודל אצווה ההגירה ל-10,000 רשומות לטרנזקציה. הקם ערוצי תקשורת מוצפנים באמצעות TLS 1.3. העבר נתונים דרך נקודות קצה של רשת פרטית בתוך ענן פרטי וירטואלי (VPC).
    2. הפעל ניסיונות הרצה חוזרת אוטומטיים עם מקסימום של שלושה ניסיונות עבור טרנזקציות שנכשלו.
      ​שמור על קצב העברת נתונים שבין 100 MB/s ל-150 MB/s. נטר את פעילויות ההגירה באופן רציף לאורך תהליך ההעברה. רשום את כל אירועי ההגירה ביומני ביקורת מרכזיים.
  4. אמת את שלמות והשלמת ההגירה על ידי השוואת checksums, ספירת רשומות ומבני מסדי נתונים.
    1. צור ערכי hash מסוג SHA-256 עבור כל טבלאות המקור לפני ההגירה, וערכי hash מסוג SHA-256 עבור כל טבלאות היעד לאחר ההגירה. התאם בין ערכי ה-checksum של המקור והיעד. בצע הצלבה של ספירת השורות עבור מסדי נתוני המקור והיעד. בדוק את העקביות של הסכימות, קשרי הטבלאות ואילוצי מסד הנתונים. הגדר את ההגירה כהצלחה רק כאשר ערכי ה-checksum, ספירת הרשומות ומבני הסכימה זהים.
  5. הסר הרשאות זמניות וסיים את הגדרת בקרות האבטחה לאחר השלמה מוצלחת של הגירת הנתונים.
    1. בטל את כל הרשאת ההגירה הזמניות מיד לאחר השלמת ההגירה. הסר הרשאות הגירה מוגברות מחשבונות שירות. ארכב את יומני הביקורת ורשומות ניטור האבטחה.
    2. ודא השלמה מוצלחת של נהלי הגיבוי. הוצא משימוש שרתי הגירה זמניים ומשאבים תומכים. בצע סקירת אבטחה סופית של הסביבה שהוגרה. תיעד את תוצאות ההגירה ואת תוצאות האימות. זרימת העבודה של ההגירה המאובטחת המלאה ששימשה במחקר זה מוצגת ב-איור 3.
תרחיש איוםבקרת אבטחהשיטת גילויצמצום השפעות
גניבת פרטי גישההרשאה מינימלית זמנית (TLP)יומני IAMביטול אוטומטי של אישורי גישה
מתקפת פניםבקרת גישה מבוססת תפקידים (RBAC)יומני ביקורת + SHAPסיום הפגישה
מתקפת השחזורTLS 1.3 + אימות Nonceניטור רשתותדחיית בקשות כפולות
התקפת "אדם באמצע" (Man-in-the-Middle - MITM)הצפנת TLS 1.3אימות תעודהתקשורת מוצפנת
שינוי זדוני של סכימהסכום ביקורת SHA-256 + אימות סכימהאימות שלמותשחזור סכימה מאושרת
הסלמת הרשאותאכיפת מדיניות IAMיומני אבטחהביטול הרשאות

טבלה 2:  מודל איומים ואמצעי האבטחה המתאימים שננקטו במסגרת ההגירה המוצעת. הטבלה מפרטת את איומי האבטחה הנציגים העיקריים ואת מנגנוני ההפגרה התואמים להם, המבוססים על עקרונות אבטחה של אמון אפס (zero-trust), הצפנה, ניהול זהויות, אימות שלמות, ניטור וזיהוי חריגות ניתן להסבר.

תרשים זרימת עבודה של הגירת נתונים: מידול איומים, העברה מאובטחת, אימות, ביקורת, השלמה.
איור 3: זרימת העבודה של פרוטוקול הגירת מסד נתונים מאובטח בענן המוצע. הפרוטוקול מורכב משבעה שלבים עוקבים: מידול איומים, העברת סכימה, הגירת מסד נתונים מאובטחת, אימות נתונים שהוגרו, הקשחה לאחר הגירה, רישום ביקורת וארכוב, והשלמת ההגירה. ניטור אבטחה, תקשורת מוצפנת, ניהול זהויות, רישום בלתי ניתן לשינוי וזיהוי חריגות ניתן להסבר נשמרים לאורך כל זרימת העבודה של ההגירה. איור זה נוצר על ידי המחברים באמצעות Microsoft PowerPoint (Microsoft 365). אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

6. הגדרת ניטור של בינה מלאכותית ניתנת להסבר (explainable AI)

הערה: מתווה התהליך הוא: זיהוי מאפייני אבטחה של הגירה, בניית מודל לזיהוי אי-סדירויות, זיהוי מקרים שבהם פעולות הגירה הן חשודות, והפקת תוצאות ניתנות להסבר באמצעות שיטות פרשנות של SHAP.

  1. יש להוציא ולעבד מקדימה מאפייני טלמטריית אבטחה הדרושים לזיהוי חריגות ולניתוח יכולת הסבר.
    1. אספו יומני אבטחה משרתי מסדי נתונים, שרתי אימות, שרתי אפליקציות ומערכות ניטור רשת. רכזו את כל האירועים הקשורים להגירה למאגר יומנים מרכזי. הסירו רשומות כפולות ורשומות חסרות. סנכרנו את חתימות הזמן בין כל מקורות היומנים באמצעות זמן אוניברסלי מתואם (UTC).
    2. חשבו את תדירות הגישה עבור כל משתמש במהלך פעולות ההגירה. רשמו את מספר ניסיונות ההתחברות שנכשלו עבור כל חשבון. נטרו שינויים בכתובות ה-IP של המקור לאורך מפגשי ההגירה.
    3. מדוד את משך סשן המשתמש מרגע תחילת ההתחברות ועד לסיומה. חשב את נפחי העברת הנתונים הנכנסים והיוצאים במהלך פעולות ההגירה. נרמל את כל המאפיינים שהופקו באמצעות נורמליזציית Min-Max.
    4. טבלה 3 מסכם את מאפייני האבטחה המשמשים לזיהוי חריגות ולניתוח יכולת הסבר.
  2. אמן ותקף את מודל ה-Isolation Forest באמצעות מערך הנתונים של מאפייני האבטחה שהוכן.
    1. חלק את מערך הנתונים. חלק את מערך הנתונים באופן אקראי לקבוצת אימון (70%), קבוצת תיקוף (15%) וקבוצת בדיקה (15%). שמור על התפלגות עקבית של אירועים נורמליים ואנומליים בכל תתי-הקבוצות.
    2. בחירת מודל בינה מלאכותית ניתנת להסבר (Explainable AI). בחרו באלגוריתם Isolation Forest מכיוון שהוא מזהה ביעילות פעילויות הגירה חריגות ללא צורך בנתוני אימון מתויגים. השתמשו באלגוריתם כדי לבודד תצפיות חריגות באמצעות חלוקה רנדומית רקורסיבית של מרחב המאפיינים. 
    3. יש להחיל את SHAP TreeExplainer כדי לכמת את התרומה של כל מאפיין אבטחה לחיזוי האנומליה ולשפר את השקיפות של תהליך ניטור האבטחה.
    4. הגדר את מודל זיהוי האנומליות. אתחל מודל Isolation Forest. הגדר את המודל באמצעות הפרמטרים המופיעים ב- טבלה 4.
    5. הגדירו את הניסוח המתמטי המשמש לחישוב ציוני חריגה (anomaly scores) והסבירו את תרומת המאפיינים (feature contributions).
      1. הגדר את וקטור מאפייני האבטחה עבור כל אירוע נדידה כפי שמוצג במשוואה 1.
        נראה שלא סופק טקסט לתרגום. אנא ספק את הטקסט באנגלית שברצונך לתרגם לעברית.i = [נא לספק את הטקסט למסמך שברצונך לתרגם.1 , נא לספק את הטקסט באנגלית שברצונך לתרגם.2, נא לספק את הטקסט באנגלית שברצונך לתרגם.3, נא לספק את הטקסט למסירה לצורך תרגום.4, נא ספק את הטקסט באנגלית שברצונך לתרגם.5 ] (1)
        כאשר x1 מציין את תדירות הגישה, x2 מייצג את מספר ניסיונות ההתחברות שנכשלו, x3 מציין את תדירות שינוי כתובת ה-IP, x4 מציין את משך הסשן, ו-x5 מציין את נפח העברת הנתונים.
      2. חלץ את מאפייני האבטחה מיומני ההגירה. נרמל את כל ערכי המאפיינים לפני אימון המודל. חשב את ציון השגרירות (anomaly score) של Isolation Forest עבור כל אירוע הגירה באמצעות משוואה 2.
        משוואה סטטיסטית המראה כי \( S(X,n) = \frac{2E(h(X))}{c(n)} \), הרלוונטית למחקרי ניתוח נתונים.    (2)
        איפה S(X,n( ) מציין את ציון האנומליה של תצפית X, X מציין את וקטור מאפייני האבטחה, E(h(X)) הוא אורך הנתיב הצפוי של תצפית X, c(n) הוא אורך הנתיב הממוצע של חיפושים שלא הצליחו בעץ חיפוש בינארי, ו-n הוא המספר הכולל של דגימות האימון. מקדם הנורמליזציה מחושב כפי שמוצג במשוואה 3.
        משוואת מושג קומבינטורי; נוסחת c(n) המשמשת בניתוח הסתברותי וסטטיסטי.   (3)
        כאשר H(n-1) מייצג את המספר ההרמוני ה-(n-1). 
      3. סווג אירועי נדידה עם ציוני אנומליה הגבוהים מסף ההחלטה שהוגדר מראש כבלתי תקינים.
      4. יש להחיל את שיטת SHAP (SHapley Additive exPlanations) כדי להסביר את תרומתו של כל מאפיין אבטחה לחיזוי האנומליה. חשבו את ערך ה-SHAP עבור מאפיין i באמצעות משוואה 4.
        משוואת ערך שאפלי (Shapley value); Φi=ΣS⊆Fi(|S|!(|F|-|S|-1)!/|F|!) [f(S∪{i})-f(S)] בתורת המשחקים השיתופית.   (4)
        כאשר (F) מייצגת את קבוצת המאפיינים המלאה, (S) מייצגת תת-קבוצה של מאפיינים, ו-((.f)) מייצגת את פונקציית החיזוי של ה-Isolation Forest.
      5. חשב את חשיבות התכונות הגלובלית על ידי חישוב ערך ה-SHAP המוחלט הממוצע באמצעות משוואה 5.
        נוסחת שיווי משקל סטטי I_i = (1/N)Σ|ϕ_ij|; משוואה מתמטית בדיאגרמה של פיזיקה.    (5)
        כאשר (N) מציין את המספר הכולל של אירועי נדידה.
      6. דרג את מאפייני האבטחה בהתאם לערכי ה-SHAP המוחלטים הממוצעים שלהם. הפק תרשימי סיכום (summary plots), תרשימי תלות (dependence plots) ותרשימי כוח (force plots) של SHAP כדי להמחיש ויזואלית את חשיבות המאפיינים הגלובלית והמקומית.
    6. אמנו את מודל ה-Isolation Forest באמצעות מערך נתוני האימון. העריכו את ביצועי המודל באמצעות מערך נתוני האימות. במידת הצורך, שנו את ספי הלזיה (contamination thresholds). שמרו את תצורת המודל המניבה את הביצועים הטובים ביותר. תקפו את ביצועי המודל. קבעו מדדים כגון דיוק (accuracy), ערך ניבוי חיובי (precision), רגישות (recall), מדד F1 ו-ROC-AUC. רשמו את מדדי ביצועי המודל לצורך השוואה מאוחרת.
  3. יש להחיל את המודל המאומן כדי לזהות אירועי נדידה חריגים ולסווג פעילויות חשודות.
    1. בצע חיזוי חריגות. החל את מודל ה-Isolation Forest המאומן על מערך נתוני הבדיקה. הפק ציוני חריגות עבור כל אירועי ההגירה.
    2. זהה פעילויות חשודות. קבע אם אירועי נדידה הם טיפוסיים או חריגים. סמן כחשודים את אותם אירועים החורגים מרמות חריגה שנקבעו מראש. הפק תיעוד חריגות לצורך בדיקה ביטחונית.
    3. השלמת תהליך זיהוי האנומליות מניבה ציוני אנומליה, מסווגת אירועי נדידה כנורמליים או אנומליים, מודדת את יעילות הזיהוי באמצעות ניתוח ROC, ומאתרת אנומליות אבטחה מרכזיות. דגימות של פלטיים שהופקו על ידי התהליך המתוכנן מוצגות ב- איור 4.
    4. סווגו את האנומליות שזוהו. חלקו את האנומליות לאנומליות אימות, אנומליות רשת, אנומליות הפעלה (session) ואנומליות העברת נתונים. שמרו את תוויות האנומליות לצורך ניתוח ההסברים.
    5. הערך את ביצועי הזיהוי. בדוק את אירועי האבטחה שתועדו עד כה. לאחר מכן, בעזרתם כנקודת ייחוס, הערך את האנומליות שזוהו וקבע אילו מהן היו אנומליות אמיתיות. קבע את קצב זיהוי האנומליות ואת שיעור הפוזיטיביים השגויים (false positives). נסח תיעוד רשמי של דיוק הזיהוי כדי לאפשר את שחזורו.
  4. צור הסברים מבוססי SHAP כדי לפרש את תרומתן של תכונות אבטחה בודדות לחיזויים של חריגות.
    1. הגדירו את סביבת ה-SHAP. טענו את מודל ה-Isolation Forest המאומן. אתחלו את ה-SHAP TreeExplainer. ודאו את השילוב המוצלח בין מודל זיהוי האנומליות למסגרת ההסביריות (explainability framework).
    2. בחר דגימות רקע. בחר באופן אקראי 1,000 דגימות מייצגות מתוך סט נתוני האימון. השתמש בדגימות שנבחרו כסט נתוני הרקע של SHAP. חשב ערכי SHAP. חשב ערכי SHAP עבור כל האנומליות שזוהו. מדוד את התרומות של תכונות בודדות לחיזויים של האנומליות. שמור את פלטי ה-SHAP לצורך ניתוח נוסף.
    3. ייצרו הסברים גלובליים. צרו תרשימי סיכום SHAP המראים את חשיבות המאפיינים הכוללת. ייצרו תרשימי עמודות SHAP המבוססים על ערכי SHAP מוחלטים ממוצעים. הפקו תרשימי תלות SHAP עבור מאפיינים בעלי השפעה גבוהה.
    4. ייצרו הסברים מקומיים. בחרו אירועי הגירה חריגים מייצגים. צרו תרשימי כוח (force plots) ותרשימי מפל (waterfall plots) של SHAP. הדמישו ויזואלית את תרומות המאפיינים האחראיות לכל חריגה.
    5. פלטי הסבר מייצגים שהופקו במהלך תהליך הפרשנות מוצגים ב- איור 5ויזואליזציות אלו מדגימות את חשיבות המאפיינים הגלובלית, דירוגי תרומת המאפיינים, קשרי תלות בין מאפייני אבטחה משפיעים והסברים מקומיים עבור חריגות הגירה בודדות.
    6. דרג את מאפייני האבטחה. חשב את ערכי ה-SHAP המוחלטים הממוצעים עבור כל המאפיינים. דרג את המאפיינים בהתאם לתרומתם לזיהוי חריגות. זהה את מדדי האבטחה המשפיעים ביותר על אבטחת ההגירה. טבלה 5 מסכם את דירוגי חשיבות המאפיינים המבוססים על SHAP.
    7. אששו את עקביות ההסברים. חזרו על ניתוח SHAP בחמישה הרצות ניסיוניות בלתי תלויות. מדדו את יציבות ועקביות ההסברים. ודאו שדירוגי המאפיינים נותרים יציבים לאורך ניתוחים חוזרים.
      הערה: טבלה 6 מספק בעיות נפוצות הנתקלות במהלך זיהוי חריגות ניתן להסבר (explainable anomaly detection) ופעולות מתקנות מומלצות.
מאפייןתיאורמטרה
תדירות גישהמספר בקשות הגישה של משתמשים במהלך ההגירהזיהוי דפוסי גישה חריגים
מספר ניסיונות התחברות שנכשלומספר ניסיונות אימות שנכשלוזיהוי ניסיונות גישה לא מורשים או התקפות מסוג brute-force
שינויים בכתובת ה-IPתדירות שינויי כתובות IP של המקורזיהוי התנהגות רשת חשודה
משך הסשןמשך מפגשי משתמש במהלך ההגירהזיהוי פעילויות סשן חריגות
נפח העברת נתוניםכמות הנתונים שהועברו במהלך ההגירהזיהוי תנועת נתונים חריגה או דליפת נתונים

טבלה 3: מאפייני טלמטריית אבטחה המשמשים לזיהוי חריגות הניתן להסבר. הטבלה מציגה את מאפייני האבטחה שננטרו במהלך הגירת בסיס הנתונים, את משמעותם, הדרכים שבהן הם נמדדו, וכיצד הם סייעו בזיהוי חריגות ובניתוח יכולת ההסבר.

פרמטרערךתיאור
אלגוריתםיער בידוד (Isolation Forest)מודל לזיהוי חריגות
מספר האומנים (n_estimators)100מספר עצי בידוד
זיהום0.02פרופורציית האנומליות הצפויה
מספר דגימות מקסימליאוטומטידגימות שנעשה בהן שימוש לכל עץ
מצב אקראי42זרע לשחזור (Reproducibility seed)
בוטסטראפ (bootstrap)שקרדגימה ללא החזרה
סט אימון70%נתוני אימון של מודל
ערכת תיקוף15%תיקוף היפר-פרמטרים
סט בדיקה15%הערכה סופית של המודל

טבלה 4: תצורת Isolation Forest ששימשה לזיהוי חריגות במהלך הגירה מאובטחת של מסד נתונים. טבלה זו מפרטת את הגדרות ההיפר-פרמטרים של מודל ה-Isolation Forest לאימון, כגון אופן פיצול מערך הנתונים, רמת הזיהום (contamination), מספר האומדנים (estimators), ה-seed האקראי והגדרות ההערכה.

זיהוי חריגות בניתוח נתונים; גרף התפלגות, תרשים סיווג, עקומת ROC, דוגמאות לחריגות.
איור 4: פלטיים מייצגים של מסגרת זיהוי החריגות במהלך הגירה מאובטחת של נתוני ענן. (A) התפלגות ציוני חריגות של Isolation Forest המציגה את סף החריגות. (B) סיווג אירועי הגירה לקטגוריות נורמליות וחריגות. (C) עקומת מאפייני מקלט (ROC) המדגימה את ביצועי מודל ה-Isolation Forest (AUC = 0.97 ± 0.01). (D) אירועי הגירה חריגים מייצגים המציגים ציוני חריגות, תוויות חזויות, מאפייני אבטחה משפיעים וקטגוריות חריגות. איור זה הופק על ידי המחברים באמצעות Python 3.11 (Matplotlib 3.9) ועוצב באמצעות Microsoft PowerPoint (Microsoft 365). נא ללחוץ כאן להצגת גרסה מוגדלת של איור זה.

תרשימי ניתוח SHAP; כוללים תרשימי סיכום, עמודות, תלות וכוח להסבר של ניקוד חריגות.
איור 5: דוגמאות לפלטי יכולת הסבר מבוססי SHAP שהופקו במהלך פירוש חריגות. (A) תרשים סיכום SHAP המדגיש את המאפיינים החשובים ביותר באופן גלובלי. (B) דירוג של מאפייני אבטחה בהתבסס על ערך ה-SHAP המוחלט הממוצע שלהם. (C) תרשימי תלות SHAP המדגימים כיצד מספר ניסיונות ההתחברות שנכשלו ונפח העברת הנתונים משפיעים על חיזוי החריגות. (D) תרשים כוח SHAP המספק הסבר מקומי עבור אירוע הגירה חריג טיפוסי. תרשימים אלו מציגים את יכולת הפירוש הגלובלית והמקומית של מודל זיהוי החריגות המוצע. איור זה נוצר על ידי המחברים באמצעות Python 3.11 (Matplotlib 3.9) ועוצב באמצעות Microsoft PowerPoint (Microsoft 365). אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

דירוגמאפייןערך SHAP מוחלט ממוצעפירוש
1מספר ניסיונות התחברות כושלים0.352המדד המשפיע ביותר על פעילות חריגה
2נפח העברת נתונים0.287תורם משמעותי לזיהוי חריגות
3שינויים בכתובת IP0.221מעיד על התנהגות רשת חשודה
4משך סשן0.184קשור לסשנים חריגים של משתמשים
5תדירות גישה0.156משקף דפוסי גישה חריגים

טבלה 5:  ציוני חשיבות מאפיינים של SHAP עבור נתוני טלמטריה של אבטחה. הטבלה מציגה את דירוג מאפייני האבטחה על פי ערכי ה-SHAP המוחלטים הממוצעים שלהם ומפרטת את תרומתם המסבה לחיזוי של אנומליות.

בעיהסיבה אפשריתפתרון מומלץ
זוהו מעט חריגותפרמטר הזיהום נמוך מדיהעלה את סף הזיהום ואמן מחדש את המודל.
שיעור גבוה של חיוביים שגוייםיומני הגירה רועשים או לא עקבייםנקה את נתוני היומן ונרמל את מאפייני האבטחה לפני אימון המודל.
הסברי SHAP לא יציביםמדגמי רקע לא מספיקיםהגדל את מספר מדגמי הרקע המייצגים המשמשים את SHAP.
דיוק נמוך בזיהוי חריגותחוסר איזון במאפיינים או עיבוד מקדים לא מספקהחל נרמול מאפיינים, איזון ונהלי בקרת איכות.
התכנסות איטית של המודלסט נתונים גדול או משאבים חישוביים מוגבליםבצע אופטימיזציה להיפר-פרמטרים או השתמש ב-GPU/עיבוד מקבילי.
כבלי תקשורת/כשלים בתקשורתחוסר יציבות ברשת במהלך הניטוראמת ערוצי תקשורת מאובטחים וחזור על הסנכרון.
מאפייני אבטחה חסריםאיסוף יומנים חלקיאמת את מקורות היומנים לפני חילוץ המאפיינים והפק את סט נתוני המאפיינים מחדש.

טבלה 6: מדריך לפתרון בעיות בהגירה מאובטחת של מסדי נתונים המבוססת על בינה מלאכותית הניתנת להסבר (Explainable Artificial Intelligence). טבלה זו מספקת סיכום של בעיות יישום נפוצות, סיבות אפשריות, סימנים אבחנתיים, פעולות מומלצות ותוצאות הצפויות כתוצאה מביצוע הפרוטוקול והשחזרותו.

7. הערכת ביצועים

הערה: סעיף זה מתאר את ההליך הניסיוני ששימש להשוואה בין מסגרת ההגירה הבסיסית לבין מסגרת ההגירה המוצעת המבוססת על בינה מלאכותית ניתנת להסבר (explainable AI) בגישת zero-trust. הערכת הביצועים כוללת אבטחה, יכולת זיהוי חריגות, יעילות הגירה ותיקוף סטטיסטי תחת תנאים ניסיוניים זהים.

  1. הגדירו הן את סביבת הבסיס והן את הסביבה המוצעת תחת תנאים זהים, כדי לאפשר השוואה הוגנת של הביצועים.
    1. הגדירו את סביבת ההגירה הקונבנציונלית. הגדירו אישורי גישה סטטיים לטווח ארוך עם תקופת תוקף העולה על 24 שעות. הפעילו נקודות קצה של רשת ציבורית לצורך גישה למסד הנתונים. בטלו את מנגנוני זיהוי האנומליות וההסברתיות מבוססי ה-AI. נטרו את פעילויות ההגירה באופן ידני באמצעות יומני אבטחה קונבנציונליים. תעדו את אירועי ההגירה לצורך השוואת ביצועים מאוחרת יותר.
    2. הגדירו את מסגרת המעבר לאפס-אמון (Zero-Trust). הפעילו הרשאות זמניות של מינימום פריווילגיה (least-privilege) עם פקיעה אוטומטית עם השלמת המעבר. בטלו את כל נקודות הקצה של הרשת הציבורית. הפעילו תקשורת רשת פרטית באמצעות ערוצים מאובטחים.
    3. יש לפרוס את מודל זיהוי החריגות Isolation Forest המאומן. יש להפעיל את SHAP TreeExplainer לצורך פרשנות המודל. הגדירו ניטור אבטחה אוטומטי לאורך כל תהליך ההגירה. ודאו קיום תקשורת מאובטחת בין כל מרכיבי ההגירה לפני הביצוע.
  2. בצעו ניסויי נדידה חוזרים תחת תנאים מבוקרים כדי להעריך את השחזוריות של המסגרת.
    1. בצע ניסוי נדידה. ערוך עשרה ניסויי נדידה עצמאיים הן עבור סביבת הבסיס והן עבור הסביבה המוצעת. שמור על תצורות חומרה, תוכנה ורשת זהות לאורך כל הניסויים.
    2. העבר 10 GB של נתוני בריאות במהלך כל הרצה ניסיונית. חזור על כל הניסויים תחת תנאי עומס עבודה זהים. רשום אירועי אבטחה, יומני הגירה, פלטי זיהוי חריגות וזמני ביצוע במהלך כל ניסוי.
    3. יש לאמת את שלמות ההגירה. יש לחשב סכומי ביקורת (checksums) מסוג SHA-256 לפני ואחרי ההגירה. יש לוודא שלמות מלאה של הנתונים לאחר כל ניסוי הגירה. יש לתעד את תוצאות אימות סכומי הביקורת.
  3. חשב מדדי אבטחה כמותיים, מדדי הגירה ומדדי זיהוי חריגות לצורך הערכה השוואתית.
    1. מדוד את ביצועי האבטחה. מדוד את משך זמן החשיפה של נתוני הזיהוי. חשב את מספר נתוני הזיהוי שנחשפו במהלך ההגירה. מדוד את זמן זיהוי האירוע. רשום את משך זמן החשיפה לרשת ציבורית.
    2. הערך את ביצועי זיהוי האנומליות. חשב את הדיוק (accuracy), המדויקות (precision), הרגישות (recall), מדד F1 ואת השטח תחת עקום מאפייני הפעולה של מקלט (AUC). הערך את ביצועי המיגרציה. מדוד את השהיית המיגרציה הכוללת וחשב את תפוקת המיגרציה. רשום את תקורה התקשורתית שנוצרה כתוצאה ממנגנוני האבטחה.
    3. בצעו תיקוף סטטיסטי. חשבו את הממוצע וסטיית התקן עבור כל מדדי הביצועים. חשבו רווחי סמך של 95%. בצעו מבחני t של Student למדגמים מזווגים כדי להשוות בין מסגרת הבסיס למסגרת המוצעת. הגדירו מובהקות סטטיסטית עבור p < 0.05. תוצאות מייצגות של הערכת ביצועים שהופקו במהלך ההשוואה הניסויית מוצגות ב- איור 6.
    4. טבלה 7 מסכם את השוואת הביצועים הכמותית בין קו הבסיס לבין מסגרת ההגירה המוצעת.
      טבלה 8 מסכם בעיות יישום נפוצות המופיעות במהלך הגירה מאובטחת של בסיסי נתונים, את סיבבותיהן האפשריות ואת פעולות התיקון המומלצות.

תרשימי השוואה של חשיפת הרשאות וזיהוי חריגות; ניתוח נתונים, שיפור תהליכים.
איור 6: השוואת ביצועים בין מסגרת ההגירה הבסיסית לבין מסגרת הגירת הענן המאובטחת המוצעת, המבוססת על zero-trust ו-explainable AI. (A) השוואה של משך חשיפת ההרשאות באמצעות הרשאות בעלות פריבילגיות מינימליות לטווח ארוך ובאופן זמני. (B) השוואה של מדדי ביצועי זיהוי חריגות, כולל accuracy, precision, recall, F1-score ו-AUC. (C) השוואה של השהיית ההגירה לאורך עשר הרצות ניסיוניות עצמאיות, המראה כי העלייה בהשהיה נותרה מתחת לסף הקבלה שהוגדר מראש. (D) השוואה סטטיסטית של מדדי ביצוע מרכזיים באמצעות מבחני paired Student's t-tests, המציגה הבדלי ממוצעים ורווחי סמך של 95%. פסי השגיאה מייצגים רווחי סמך של 95% מעשר הרצות ניסיוניות עצמאיות. איור זה הופק על ידי המחברים באמצעות Python 3.11 (Matplotlib 3.9) ועוצב באמצעות Microsoft PowerPoint (Microsoft 365). נא ללחוץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

מדד ביצועיםמסגרת בסיס (ממוצע ± סטיית תקן)מסגרת מוצעת (ממוצע ± סטיית תקן)שיפוררווח בר-סמך של 95%pערך-p
משך חשיפה לאשראי (שעות)24.70 ± 1.320.42 ± 0.18הפחתה של 98.3%23.6–24.9<0.001
דיוק זיהוי חריגות (%)72.4 ± 2.194.6 ± 1.3+22.2%20.8–23.5<0.001
דיוק (%)68.1 ± 2.592.7 ± 1.5+24.6%23.1–26.0<0.001
רגישות (%)70.3 ± 2.493.1 ± 1.6+22.8%21.4–24.2<0.001
מדד F1 (%)69.2 ± 2.292.9 ± 1.4+23.7%22.3–25.0<0.001
שטח תחת העקומה0.78 ± 0.030.97 ± 0.01+0.190.17–0.21<0.001
שהיית נדידה (דקות)87.6 ± 3.297.4 ± 2.911.2% הוצאות תקורה8.9–10.70.002
שלמות הנתונים (%)99.8100.0שיפור של 0.2%0.1–0.30.031
חשיפה לרשת ציבוריתפעילהוסרהוסרו לחלוטיןלא רלוונטי<0.001

טבלה 7: מסגרות להגירה מאובטחת של מסדי נתונים - בסיס להשוואה ומסגרות מוצעות: השוואת ביצועים. הטבלה מציגה את משך החשיפה של נתוני הזיהוי, את יעילות זיהוי האנומליות, את השהיית ההגירה, את שלמות הנתונים ואת השיפורים באבטחה שנבחנו באופן כמותי במהלך תיקוף הפרוטוקול.

גיליוןסיבה אפשריתהפתרון המומלץ
שגיאה באימות הגירהאישורי גישה זמניים שפג תוקפם או שאינם תקפיםיש להנפיק מחדש הרשאות זמניות (temporal credentials) ולאמת את מדיניות ה-IAM לפני הפעלת תהליך ההגירה מחדש.
שהיית נדידה גבוההעומס ברשת או רוחב פס לא מספיקבצעו אופטימיזציה של ניתוב הרשת, תזמנו את ההגירה לזמני תנועה נמוכה, ואמתו את הקישוריות של נקודות הקצה.
התראות שגויות על חריגות (False-positive)סף זיהום לא נכון ב-Isolation Forestכוון את פרמטר הזיהום באמצעות מערך הנתונים לתיקוף ואמן מחדש את המודל.
הסברי SHAP לא יציביםדגימות רקע בלתי מספיקות או שאינן מייצגותהגדילו את גודל מדגם הרקע של ה-SHAP והבטיחו דגימה מייצגת.
אי-התאמה בשלמות הנתוניםהגירה שהופסקה או העברת נתונים פגומההפעל מחדש את המיגרציה לאחר אימות ערכי checksum של SHA-256 ועקביות בין המקור ליעד.
כשל בחיבור מאובטח לנקודת קצהשגיאות הגדרה של חומת אש או של TLSיש לאמת את תעודות ה-SSL/TLS, את כללי חומת האש ואת הגדרות נקודת הקצה הפרטית (private endpoint).
דיוק נמוך בזיהוי חריגותחילוץ מאפיינים חסר או עיבוד מקדמי לקויבצע סקירה של הנדסת המאפיינים (feature engineering), נרמל את מאפייני האבטחה ואמן מחדש את המודל.
בעיות התכנסות של המודלהיפר-פרמטרים לא מתאימיםיש להתאים את פרמטרי הלמידה ולתקף את ביצועי המודל לפני הפריסה.

טבלה 8: מדריך לפתרון בעיות עבור הגירה מאובטחת של מאגרי מידע רפואיים. הטבלה מפרטת שגיאות נפוצות בתהליך ההגירה, הגורמים האפשריים להן, הצעדים התיקוניים המומלצים והתוצאות הצפויות, וזאת כדי להבטיח ביצוע מהימן של פרוטוקול ההגירה המאובטח.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

סקירה ניסיונית

פרוטוקול הגירת נתוני ענן מאובטח מבוסס בינה מלאכותית הניתנת להסבר (XAI) הוערך באמצעות מערך נתונים סינתטי של שירותי בריאות, הכולל כ-20 מיליון רשומות של תיקים רפואיים אלקטרוניים (EHR) המפוזרות על פני 28 טבלאות של מסד נתונים רלציוני, בנפח כולל של 10 GB. הניסויים נערכו בסביבת ענן של Amazon Web Services (AWS) תוך שימוש ב-Amazon RDS PostgreSQL 16, רשת Virtual Private Cloud (VPC) פרטית, תקשורת מוצפנת ב-TLS 1.3 ושירותי ניטור מרכזיים. עשרה ניסויי הגירה עצמאיים בוצעו תחת ת...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

במחקר זה, פותח פרוטוקול להגירה מאובטחת וניתנת לשחזור של מסד נתונים בענן, המשלב עקרונות אבטחה של אמון אפס (zero-trust), בקרת גישה המבוססת על זמן וזכות מינימלית (time-based least-privilege), בינה מלאכותית ניתנת להסבר (XAI) וניטור אבטחה רציף, וכל זאת במסגרת מערך ניסיוני מוגבל. כתיבת מאמר זה לא נועדה להציג אלגוריתם הגירה חדש; לפיכך, המחברים מציגים בעיקר זרימת עבודה סטנדרטית המאפשרת לחוקרים ואנשי מקצוע לבצע, להעריך ולשחזר הגירה מאובטחת של מסד נתונים רפואי באמצעות שלבים פרוצדורליים מוגדרים בבירור. הצלחתו של יישום הפרוטוקול נשע...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

המחברים מצהירים כי אין להם ניגודי אינטרסים כספיים, קשרים מסחריים או קשרים אישיים שעלולים היו להשפיע על העבודה המדווחת במחקר זה. למחברים אין ניגודי אינטרסים להצהיר עליהם. כל החומרים הדרושים לשחזור המתודולוגיה המוצגת במחקר זה זמינים לציבור במאגר GitHub. המאגר זמין בכתובת: https://github.com/priyankanalawade896-tech/XAI-Secure-Cloud-Data-Migration. המאגר מכיל נתוני ייחוס שנוצרו באופן סינתטי בלבד ואינו כולל כל מידע אמיתי על מטופלים, מידע רפואי מוגן או רשומות בריאות שניתן להגדיר מהן את זהות המטופל.

תודות

המחברים מודים על התמיכה המוסדית שניתנה על ידי המוסדות השייכים להם במהלך הפיתוח והערכה של פרוטוקול זה. המחברים מודים גם על השימוש במתקני מחשוב מוסדיים ובמשאבי מחשוב ענן שסייעו לתיקוף הניסיוני של מסגרת הגירה מאובטחת של נתוני ענן המוצעת.
מחקר זה לא קיבל מימון חיצוני. המחקר נערך באמצעות מתקני מחקר מוסדיים ומשאבי מחשוב שסופקו על ידי המוסדות השייכים למחברים. לא התקבל מימון ממענקים או תמיכה כספית מכל סוכנות מימון ציבורית, מסחרית או ללא מטרות רווח.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
הצפנת AESNISTAES-256הצפנת נתונים במצב מנוחה
Amazon RDS PostgreSQLAmazon Web ServicesPostgreSQL 16בסיס נתונים יעד
פלטפורמת ענןAmazon Web ServicesAWSתשתית ענן
CloudWatchAmazon Web Servicesהגרסה היציבה האחרונהניטור ותיעוד לוגים
DockerDocker Inc.27.0קונטנריזציה
FakerFaker Developers30.0יצירת נתונים סינתטיים
GPUNVIDIARTX 409024 GB VRAM
MatplotlibMatplotlib Developers3.9ויזואליזציה
NumPyNumPy Developers1.26עיבוד מספרי
מערכת הפעלהCanonicalUbuntu 22.04 LTSסביבת מערכת
PandasPyData2.2עיבוד נתונים
PostgreSQLPostgreSQL Global Development Group16בסיס נתונים מקור
PythonPython Software Foundation3.11שפת תכנות
Scikit-learnScikit-learn Developers1.5למידת מכונה
SHAPSHAP Developers0.46בינה מלאכותית ניתנת להסבר
TerraformHashiCorp1.8הקצאת תשתיות
TLSIETFTLS 1.3הצפנת נתונים במעבר
ענן פרטי וירטואליAmazon Web ServicesVPCסביבת רשת פרטית
תחנת עבודהDell/HPNAIntel Xeon Gold 6226R, 64 GB RAM, 1 TB SSD

מקורות

  1. Kindervag J. Build security into your network's DNA: The Zero Trust Network Architecture. Cambridge (MA): Forrester Research; 2010.
  2. Rose S, Borchert O, Mitchell S, Connelly S. Zero Trust Architecture. NIST Special Publication 800-207. Gaithersburg (MD): National Institute of Standards and Technology; 2020. doi:10.6028/NIST.SP.800-207.
  3. Rieke N, et al. The future of digital health with federated learning. NPJ Digit Med. 2020;3:119. doi:10.1038/s41746-020-00323-1.
  4. Kairouz P, McMahan HB, Avent B, Bellet A, Bennis M, Bhagoji AN, et al. Advances and open problems in federated learning. Found Trends Mach Learn. 2021;14(1-2):1-210. doi:10.1561/2200000083.
  5. Nguyen DC, Ding M, Pathirana PN, Seneviratne A, Li J, Niyato D, et al. Privacy-preserving federated learning: A comprehensive survey. IEEE Commun Surv Tutor. 2021;23(3):1622-1651. doi:10.1109/COMST.2021.3075434.
  6. Sarker IH. AI-driven cybersecurity: An overview, security intelligence modeling, and research directions. SN Comput Sci. 2021;2:173. doi:10.1007/s42979-021-00557-0.
  7. Kuo AM. Opportunities and challenges of cloud computing to improve health care services. J Med Internet Res. 2011;13(3):e67. doi:10.2196/jmir.1867.
  8. Kota TK. Cloud migration for healthcare data: Challenges and solutions. Nanotechnol Percept. 2024;20:3048-3062.
  9. Rancea A, Anghel I, Cioara T. Edge computing in healthcare: Innovations, opportunities, and challenges. Future Internet. 2024;16(9):329.
  10. Mersha M, et al. Explainable artificial intelligence: A survey of needs, techniques, applications, and future direction. Neurocomputing. 2024;599:128111. doi:10.1016/j.neucom.2024.128111.
  11. Mennella C, Maniscalco U, De Pietro G, Esposito M. Ethical and regulatory challenges of AI technologies in healthcare: A narrative review. Heliyon. 2024;10(4):e26297. doi:10.1016/j.heliyon.2024.e26297.
  12. Roppelt JS, Kanbach DK, Kraus S. Artificial intelligence in healthcare institutions: A systematic literature review on influencing factors. Technol Soc. 2024;76:102443. doi:10.1016/j.techsoc.2023.102443.
  13. Lekkala S, Avula R, Gurijala P. Next-Gen firewalls: Enhancing cloud security with generative AI. J Artif Intell Cloud Comput. 2024;3(4):1-9. doi:10.47363/JAICC/2024(3)404.
  14. Al-Hammuri K, Gebali F, Kanan A. ZTCloudGuard: Zero Trust context-aware access management framework to avoid medical errors in the era of generative AI and cloud-based health information ecosystems. AI. 2024;5(3):1111-1131. doi:10.3390/ai5030055.
  15. Pfeifer B, Sirocchi C, Bloice MD, Kreuzthaler M, Urschler M. Federated unsupervised random forest for privacy-preserving patient stratification. Bioinformatics. 2024;40(Suppl 2):ii198-ii207. doi:10.1093/bioinformatics/btae382.
  16. Li T, Sahu AK, Talwalkar A, Smith V. Federated learning: Challenges, methods, and future directions. IEEE Signal Process Mag. 2020;37(3):50-60. doi:10.1109/MSP.2020.2975749.
  17. Lundberg SM, Lee SI. A unified approach to interpreting model predictions. In: Proceedings of the 31st International Conference on Neural Information Processing Systems (NeurIPS); 2017. p. 4768-4777.
  18. Ribeiro MT, Singh S, Guestrin C. "Why should I trust you?": Explaining the predictions of any classifier. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 1135-1144. doi:10.1145/2939672.2939778.
  19. Ortigossa ES, Gonçalves T, Nonato LG. Explainable artificial intelligence (XAI)—From theory to methods and applications. IEEE Access. 2024;12:80799-80846. doi:10.1109/ACCESS.2024.3409843.
  20. Chaddad A, et al. Explainable, domain-adaptive, and federated artificial intelligence in medicine. IEEE/CAA J Autom Sin. 2023;10(4):859-876. doi:10.1109/JAS.2023.123123.
  21. Albshaier L, Almarri S, Albuali A. Federated learning for cloud and edge security: A systematic review of challenges and AI opportunities. Electronics. 2025;14(5):1019. doi:10.3390/electronics14051019.
  22. Vani MS, Sudhakar RV, Mahendar A, et al. Personalized health monitoring using explainable AI: Bridging trust in predictive healthcare. Sci Rep. 2025;15:31892. doi:10.1038/s41598-025-15867-z.
  23. Zakhmi K, et al. Evolving Zero Trust architectures for AI-driven cyber threats in healthcare and other high-risk data environments: A systematic review. Cureus. 2025;17(6):e85446. doi:10.7759/cureus.85446.
  24. Selvaperumal D, et al. Artificial intelligence-enabled zero-trust cyber security framework for smart healthcare infrastructure. Int J Artif Intell Mach Learn. 2026;6(2 Suppl):204-217. doi:10.51483/IJAIML.6.2s.2026.204-217.
  25. Abbas SR, Seol H, Abbas Z, Lee SW. Exploring the role of artificial intelligence in smart healthcare: A capability and function-oriented review. Healthcare (Basel). 2025;13(14):1642. doi:10.3390/healthcare13141642.
  26. Al-Nafjan A, et al. Artificial intelligence in predictive healthcare: A systematic review. J Clin Med. 2025;14(19):6752. doi:10.3390/jcm14196752.
  27. Qureshi SS, et al. Advanced AI-driven intrusion detection for securing cloud-based industrial IoT. Egypt Inform J. 2025;30:100644. doi:10.1016/j.eij.2025.100644.
  28. Chen T, Guestrin C. XGBoost: A scalable tree boosting system. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 785-794. doi:10.1145/2939672.2939785.
  29. Liu FT, Ting KM, Zhou ZH. Isolation Forest. In: Proceedings of the 8th IEEE International Conference on Data Mining; 2008. p. 413-422. doi:10.1109/ICDM.2008.17.
  30. Abadi M, Agarwal A, Barham P, Brevdo E, Chen Z, Citro C, et al. TensorFlow: A system for large-scale machine learning. In: Proceedings of the 12th USENIX Symposium on Operating Systems Design and Implementation (OSDI); 2016. p. 265-283.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

Shapley