$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מחקר זה השתמש במאגר נתונים זמין לציבור מפלטפורמת Kaggle (תמונות תוכנית קומה ופרטיהן, זמינות בכתובת: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; גישה ב-16 באפריל 2026). הוא לא כלל משתתפים אנושיים, בעלי חיים או נתונים מזוהים אישיים; לכן, לא נדרשו אישור אתי והסכמה מדעת.
פרוטוקול זה מציג מסגרת מונחית בינה מלאכותית לניתוח אוטומטי של תמונות תוכניות קומה למגורים, עם דגש על עיצוב מודע למרחב ומכוון בריאות. זרימת העבודה הניסיונית המלאה מוצגת באיור 1. הפרוטוקול נועד לגשר על הפער בין חיזוי תכונות ארכיטקטוניות ברמה נמוכה לבין קבלת החלטות ממוקדת יישומים ברמה גבוהה. היא משלבת DL, מידול קבוצתי ובינה מלאכותית מוסברת כדי לספק פתרון מדויק, חזק וניתן לפרשנות לניתוח פריסות מגורים. המסגרת מורכבת ממספר שלבים, החל ברכישת נתונים ועיבוד מוקדם, ולאחר מכן למידת תכונות באמצעות CNNs עמוקים, חיזוי מטא-אנסמבל, ולבסוף סיווג ברמת יישום. בתחילה, תמונות תוכנית הקומה והמאפיינים האדריכליים המתאימות להן מעובדים מראש באמצעות שינוי גודל, נרמול והרחבת נתונים כדי להבטיח עקביות ולשפר את ההכללה. כל תמונות תוכנית הקומה שונו לגודל של 224 × 224 פיקסלים ונרמלו לטווח [0, 1]. הגדלת נתונים יושמה במהלך האימון באמצעות הפיכה אופקית אקראית, סיבוב, זום ושינוי רוחב/גובה כדי לשפר הכללת מודל ולהפחית התאמת יתר. לא הוחל הפיכה אנכית. פרמטרי ההרחבה המלאים ופרטי היישום מסופקים בקובץ המשלים 1. הנתונים המעובדים שימשו לאחר מכן לאימון מודלים מרובים של DL לחילוץ ותחזית תכונות. כל המודלים הבסיסיים והמטא-לומד של CARE-MIRV-Net אומנו באמצעות תצורה עקבית, הכוללת הגדלת נתונים, עצירה מוקדמת ותזמון קצב למידה אדפטיבי. הפסקה מוקדמת ניטרה אובדן אימות (val_loss) עם ערך סבלנות של 5 אפוקים, ומשקלי המודל הטובים ביותר שוחזרו אוטומטית לאחר האימון. תזמון קצב למידה אדפטיבי יושם באמצעות ReduceLROnPlateau, שעקב אחרי אובדן האימות והפחית את קצב הלמידה פי 0.3 לאחר שני עידנים ללא שיפור, עם קצב למידה מינימלי של 1 × 10⁻7. פרטי יישום מלאים והגדרות פרמטרים מסופקים בקובץ משלים 1. מערך הנתונים חולק באקראי לקבוצות אימון ובדיקות באמצעות יחס מפוצל של 80:20. השתמשו בזרע אקראי קבוע (42) כדי להבטיח שחזוריות. פרטי היישום המלאים מסופקים בקובץ משלים 1.

איור 1. תהליך העבודה של מסגרת CARE-MIRV-Net לניתוח תוכניות קומות למגורים. סקירה סכמטית של הפרוטוקול המוצע. תהליך העבודה כולל (1) רכישת מערכי נתונים ועיבוד מוקדם, (2) למידת תכונות וחיזוי באמצעות MobileNetV2, InceptionV3, ResNet101 ו-VGG16, (3) חיזוי מטא-אנסמבל מבוסס ערימה באמצעות CARE-MIRV-Net, (4) סיווג פריסת מגורים מבוסס חוקים, (5) ניתוח פרשנות מבוסס SHapley Additive exPlanations (SHAP), ו-(6) הערכת ביצועים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
בשלב השני, ארבעה CNN מאומנים מראש, MobileNetV2, InceptionV3, ResNet101 ו-VGG16, מועסקים כלומדים בסיסיים. כל מודל מותאם באמצעות למידת העברה כדי לחזות מאפיינים אדריכליים מרכזיים, כולל שטח, מספר חדרי שינה, חדרי אמבטיה ומוסכים. לכל מודל למידת העברה, השכבות התחתונות שהוכשרו מראש נשמרו קפואים, בעוד שהשכבות העליונות וראש הרגרסיה המותאם אישית כוונו במהלך האימון. תצורות כיוונון מדויקות ספציפיות לדגם מסופקות בקובץ המשלים 1. מודלים אלה לוכדים היבטים שונים של מידע מרחבי: MobileNetV2 מספק חילוץ תכונות יעיל, InceptionV3 לוכד דפוסים מרחביים רב-קנה מידה, ResNet101 לומד ייצוגים היררכיים עמוקים, ו-VGG16 מבטיח למידת תכונות יציבה ועקבית. המגוון בין המודלים הללו משפר את יכולת הייצוג הכוללת של המסגרת.
כדי לשפר עוד יותר את הדיוק והעמידות של התחזית, מוצע מודל מטא-אנסמבל מבוסס ערימה, המסומן כ-CARE-MIRV-Net. בשלב זה, התחזיות מכל המודלים הבסיסיים מתאגדות יחד ליצירת מרחב תכונות מממד גבוה יותר, שמוקלט למטה-לומד. תחזיות מודל בסיס נוצרות לראשונה באופן עצמאי באמצעות מודלים מאומנים כמו MobileNetV2, InceptionV3, ResNet101 ו-VGG16. תחזיות אלו מחוברות לאחר מכן ליצירת וקטור המטה-תכונה שבו משתמש המטה-לומד. כדי למנוע דליפת נתונים, מאגרי הנתונים של האימון והבדיקה מופרדים בקפדנות, והמטא-לומד מאומן רק על תחזיות שנוצרו מנתוני האימון. המטה-מודל, שהוא רשת עצבית מחוברת לחלוטין, מאומן ללמוד את השילוב האופטימלי של פלטי מודל בסיס כדי לייצר תחזיות משופרות. המודל המטא מורכב משתי שכבות מחוברות לחלוטין עם 512 ו-256 נוירונים באמצעות הפעלת ReLU, ואחריהן שכבות נשירה (0.4 ו-0.3) ושכבת פלט ליניארית. המודל מאומן באמצעות אופטימייזר אדם (קצב למידה = 0.0001), גודל אצווה של 32, ועד 15 אפוקים. עצירה מוקדמת יושמה על ידי ניטור אובדן אימות (val_loss) עם ערך סבלנות של 5 אפוקים. קריטריון השיפור המינימלי (min_delta) הוגדר לערך ברירת המחדל של TensorFlow של 0, ומשקלי המודל הטובים ביותר שוחזרו אוטומטית לאחר האימון. תזמון קצב למידה אדפטיבי יושם באמצעות ReduceLROnPlateau callback, שעקב אחרי אובדן האימות והפחית את קצב הלמידה פי 0.3 לאחר שתי תקופות רצופות ללא שיפור. קצב הלמידה המינימלי הוגדר ל-1 × 10⁻7, ופרמטר הקירור השתמש בערך TensorFlow ברירת המחדל של 0. שיטת אנסמבל זו מפחיתה הטיות של מודלים בודדים ומשפרת הכללה באמצעות חוזקות משלימות של ארכיטקטורות מרובות. מידע מפורט על היישום מסופק בקובץ משלים 1.
לאחר החיזוי, מתווספת שכבת פרשנות להמרת הפלטים המספריים להחלטות ברמת היישום. תכניות מגורים ניתן לסווג לשלוש קטגוריות בהתבסס על תחזיות מאפיינים אדריכליים: טיפול בקשישים, טיפול רפואי משולב (רפואי), ושימוש כללי במגורים. סיווג זה מתבצע באמצעות כללי החלטה מבוססי סף מוגדרים מראש המבוססים על השטח החזוי, מספר חדרי השינה ומספר חדרי האמבטיה. הקטגוריה עם הציון הגבוה ביותר מוקצת כסיווג הסופי, בעוד שהתיקו נפתר על ידי בחירת הקטגוריה שמקיימת את מספר הקריטריונים הגדול ביותר של החלטה. כללי הניקוד המלאים וספי הסיווג מסופקים בקובץ המשלים 2 (אלגוריתם 1). פעולה זו מאפשרת למסגרת לספק מידע מעשי לעיצוב דיור למגורים.
המסגרת משתמשת בבינה מלאכותית ניתנת להסבר עם SHAP כדי לספק שקיפות ויכולת פרשנות. רכיב זה בוחן את תרומת התחזיות מכל מודל בסיס לפלט של המטא-מודל. ניתוח SHAP בוצע באמצעות KERNELExplainer של SHAP (גרסת SHAP 0.51.0) עם 100 דגימות אימון שנבחרו באקראי כמערך הנתונים הרקע ו-50 דגימות בדיקה ליצירת הסברים. הקונפיגורציה המלאה של SHAP, כולל בחירת דגימה רקע והגדרות יישום, מסופקת בקובץ המשלים 1. שכבת ההסבר מסייעת להבין את תהליך קבלת ההחלטות על ידי מדידת חשיבות המאפיין והצגת דפוסי תרומה, ובכך לשפר את שקיפות ואמינות המודל. המסגרת המוצעת מוערכת באמצעות MAE ו-R2 בכל משתני היעד. לחיזוי ריבוי פלטים, MAE חושב כהפרש האבסולוטי הממוצע בין הערכים בפועל לחזוי בכל משתני היעד, בעוד ש-R2 חושב על ידי השוואת השונות המוסברת של התחזיות לערכי האמת הקרקעית המתאימים לכל פלט. הניתוחים הכמותיים והאיכותיים מצביעים על כך שה-CARE-MIRV-Net המוצע משפר את דיוק החיזוי ותומך בסיווג פריסת מגורים מבוסס כללים. אמינות הסיווג הוערכה בהתבסס על דיוק תחזיות הרגרסיה הבסיסיות ועקביות שכבת ההחלטה מבוססת הכללים. המסגרת היא פתרון מתאים וניתן להרחבה לניתוח חכם של תכניות קומה, וניתן ליישם אותה בדיור חכם, תכנון לטיפול בקשישים ותכנון מגורים ממוקד בבריאות. רשימה מלאה של מערכי נתונים, חבילות תוכנה, ספריות, משאבי חומרה וכלים חישוביים ששימשו במחקר זה מסופקת בטבלת החומרים. קוד מקור, מידע על תצורת הסביבה, מפרטי תלות תוכנה וסקריפטי יישום הנדרשים לשחזור תהליך העבודה המדווח מסופקים בקובץ משלים 1.
אלגוריתם לפרוטוקול
המסגרת המוצעת נוקטת בגישה רב-שלבית לעיבוד תוכניות קומה מבוססות תמונה של בתים פרטיים ולהפקת פלטים חיזויים והחלטותיים, כפי שמוצג באלגוריתם 1 בקובץ המשלים 2. תהליך זה מתחיל בעיבוד נתונים מוקדם, שבו תמונות הקלט משתנות לרזולוציה סטנדרטית ומנורמלות כדי לספק אחידות לאורך כל מאגר הנתונים. כל תמונות תוכנית הקומה שונו לגודל של 224 × 224 פיקסלים ונרמלו לטווח [0, 1]. שלב זה מייעל את התמונות ללמידה באמצעות רשתות עצביות עמוקות ומגביר את ההתכנסות הכוללת של המודלים. השלב השני כולל שימוש במספר מודלים של DL כלומדים בסיסיים, כולל MobileNetV2, InceptionV3, ResNet101 ו-VGG16. באופן עצמאי, כל מודל לוקח את התמונות הנכנסות ומעריך מאפיינים אדריכליים חשובים כמו שטח רבוע ומספר חדרי השינה, חדרי הרחצה והמוסכים. מערך הנתונים חולק באקראי לקבוצות אימון ובדיקות באמצעות יחס פיצול של 80:20, והשתמשו בזרע אקראי קבוע להבטחת שחזוריות. מודלים אלו לוכדים תכונות מרחביות שונות של תוכניות הקומה ומספקים תחזיות משלימות. ייצוג התכונות נבנה לאחר מכן על ידי ערימת הפלטים של כל מודל בסיס ליצירת ייצוג תכונה יחיד. פלט משותף זה מוזן לאחר מכן למודל מטא-אנסמבל, CARE-MIRV-Net, שמאומן לשלב את התחזיות של כל מודלי הבסיס. תחזיות מודל הבסיס נוצרו באופן עצמאי וחוברו ליצירת וקטור המטא-תכונה. דליפת נתונים נמנעה באמצעות הפרדה קפדנית של מאגרי הנתונים של האימון והבדיקה. המטא-מודל משפר את התחזיות הללו ומפיק את תחזיות התכונות האדריכליות הסופיות. המטא-מודל כלל שכבות מחוברות לחלוטין עם 512 ו-256 נוירונים, פונקציות הפעלה של ReLU, שיעורי נשירה של 0.4 ו-0.3, אופטימייזר אדם (קצב למידה = 0.0001), גודל אצווה של 32, ועד 15 אפוקי אימון עם הפסקה מוקדמת. לאחר החיזוי, משתמשים בשכבת החלטה כדי להקשרם את התוצאות. לפי הערכים המוערכים, כל תכנון מגורים מסווג כטיפול בקשישים, טיפול רפואי או שימוש מגורים כללי. קטגוריות מגורים הוקצו באמצעות כללי ניקוד מבוססי סף מוגדרים מראש שמקורם במאפייני תכנית הקומה החזויים. הקטגוריה עם הציון הגבוה ביותר נבחרה כסיווג הסופי. ספי סיווג מלאים וכללי החלטה מסופקים באלגוריתם 1 (קובץ משלים 2). לבסוף, המסגרת משלבת רכיב הסבר המבוסס על SHAP כדי להעריך את השפעת כל מודל בסיס על התחזית הסופית. ניתוח SHAP בוצע כפי שתואר קודם ובקובץ המשלים 1. רכיב זה מגביר את השקיפות ועוזר להבנת תהליך קבלת ההחלטות. היעילות והישימות של הגישה המוצעת הוערכו באמצעות מדדי ביצוע סטנדרטיים של רגרסיה. הביצועים הוערכו באמצעות ריצה ניסויית אחת עם זרע אקראי קבוע.
מודלים להערכה
בחלק זה מוצגים מודלי DL ששימשו במחקר, כולל מודלי הבסיס הבודדים ו-CARE-MIRV-Net המוצע. מודלי הבנצ'מרק נבחרו לייצג ארכיטקטורות DL מגוונות ואומצו באופן נרחב. MobileNetV2 נכללה כרשת קלה ויעילה חישובית, ו-InceptionV3 נבחרה בשל יכולתה ללכוד תכונות מרחביות רב-קניות. ResNet101 נבחר בשל יכולת הלמידה השארית העמוקה שלו לחילוץ תכונות היררכי, ו-VGG16 נכלל כארכיטקטורה קונבולוציונית מבוססת. כל מודלי הבנצ'מרק אומנו באמצעות פרוצדורות קדם-עיבוד זהות, הגדרות הרחבת נתונים, חלוקות מאגרי נתונים, פרמטרי אופטימיזציה, גודל אצווה ותצורת אימון כדי להבטיח הערכה השוואתית הוגנת.
MobileNetV2:
MobileNetV2 היא מערכת CNN קטנה וקומפקטית שתוכננה להיות מהירה, בעלת ביצועים גבוהים ועם מורכבות חישובית נמוכה יותר. הוא מציג כמה מהחידושים המרכזיים כמו חיבורים שאריתיים הפוכים וצווארי בקבוק ליניאריים, שמאפשרים חילוץ תכונות יעיל ועדיין בעלי עוצמת ייצוג גבוהה. MobileNetV2 יכול להשתמש בקונבולוציות מופרדות בעומק כדי למזער משמעותית את סך כל הפרמטרים ואת עלות החישוב של רשתות קונבולוציוניות מסורתיות, ולכן מותאם היטב לבעיות למידה מבוססות תמונה גדולות.
MobileNetV2 משמש במסגרת המוצעת כאחד ממודלי ה-DL הבסיסיים לחיזוי המאפיינים האדריכליים של תמונות תכנית קומה למגורים. המודל מסוגל ללמוד דפוסים מרחביים כמו התפלגות חדרים, צפיפות פריסה וארגון מבני המתרחשים בתכניות קומה ביעילות בזכות העיצוב היעיל שלו. ייצוגים מלומדים כאלה ממלאים תפקיד חשוב בהערכת מאפיינים חשובים כמו שטח, מספר חדרי השינה, חדרי הרחצה והמוסכים במדויק. MobileNetV2 הוא מודל קל משקל, שהוא מועמד טוב להיכלל במסגרת המטא-אנסמבל המוצעת. הוא מוסיף תכונות משלימות לדגמי DL אחרים, ומגביר את החוסן וההכללה הכוללת של המערכת. למידת מודל זו חשובה מאוד מבחינת שיפור דיוק התחזיות ובסיוע בסיווג עיצובים למגורים המבוססים על שירותי בריאות.
מודל MobileNetV2 מאומן באמצעות אסטרטגיית למידת העברה עם משקלים מאומנים מראש ממאגר הנתונים של ImageNet. תמונות הקלט מותאמות לגודל קבוע של 224 × 224 × 3, התואם לארכיטקטורה. התמונות שונו לגודל של 224 × 224 פיקסלים, נורמל לטווח [0, 1], והוגדלו באמצעות הפיכה אקראית, סיבוב, זום והעברה. גודל אצווה של 32 שימש במהלך האימונים. ראש הסיווג הראשוני של MobileNetV2 הוסר והוחלף בראש רגרסיה. ראש הרגרסיה כלל שכבת Global Average Pooling ואחריה שכבות מחוברות לחלוטין עם 512 ו-256 נוירונים, נרמול אצווה, שכבות נדירות (0.4 ו-0.3), ושכבת פלט ליניארית בת ארבעה נוירונים. כדי להקל על התאמת הדומיין, השכבות התחתונות שמאומנות מראש הוקפאו, בעוד שהשכבות העליונות החל מ-block_13_expand וראש הרגרסיה המותאם אישית כוונו בדיוק. גישה סלקטיבית זו מאפשרת למודל לשמור על תכונות ויזואליות כלליות תוך למידת תכונות מרחביות ייחודיות לתחום של תמונות בתכנית קומה. מפות התכונות שהופקו מעובדות דרך שכבת Global Average Pooling ושכבות מחוברות במלואן עם 512 ו-256 נוירונים באמצעות הפעלת ReLU. כדי לשפר הכללה ולהפחית התאמת יתר, משולבות שכבות נרמול אצווה ודרופאאוט (0.4 ו-0.3). שכבת הפלט הסופית מכילה ארבעה נוירונים עם הפעלה ליניארית התואמת את התכונות הארכיטקטוניות החזויות. אופטימייזר אדם שימש עם קצב למידה של 0.0001 ופרמטרי ברירת מחדל של TensorFlow/Keras (β₁ = 0.9, β₂ = 0.999, ε = 1 × 10⁻7, amsgrad = שקר). לחיזוי רב-פלט, MAE ו-R2 חושבו על ידי השוואת הערכים החזויים והאמיתיים לכל משתנה יעד ואז ממוצע התוצאות בכל הפלטים. הפסקה מוקדמת יושמה בהתבסס על אובדן אימות, והפחתת קצב הלמידה האדפטיבית שימשה לשיפור ההתכנסות. ההכשרה בוצעה עד 15 תקופות.
InceptionV3:
InceptionV3 היא ארכיטקטורת CNN עמוקה המסוגלת ללכוד תכונות רב-קנה מידה באמצעות פעולות קונבולוציה מקבילות. היא מבוססת על מודול Inception, המשתמש במגוון גדלי מסננים באותה שכבה כדי להפיק בו זמנית תכונות דקות וגרעיניות גסות. סוג עיצוב ארכיטקטורה זה מאפשר לרשת ללמוד היררכיות מרחביות מורכבות ולהיות יעילה חישובית. בנוסף לכך, InceptionV3 עושה שימוש בקונבולוציות מפוקדות והפחתת ממדים, שמגבירים את הביצועים וממזערים עלויות חישוביות.
InceptionV3 מיושמת במסגרת המוצעת כמפיק תכונות יעיל לניתוח תמונות של תוכניות קומה למגורים. תוכניות קומה מורכבות ממגוון דפוסים מרחביים, כגון גודל חדרים, תוכניות מבניות וקישוריות, מה שמצריך למידה רב-קנית של תכונות. ארכיטקטורת Inception מתאימה במיוחד למשימה זו בכך שהיא מסוגלת לייצג מאפיינים מקומיים (למשל, חדרים קטנים) ומבנים גלובליים (למשל, ארגון הפריסה הכוללת) בו-זמנית. InceptionV3 מספק ייצוגים משלימים למודלים אחרים כמו MobileNetV2 בהקשר של מסגרת המטה-אנסמבל. מגוון התחזיות גדל בזכות יכולתו למודל יחסים מרחביים מורכבים, וזה חשוב לשיפור ביצועי הקבוצה. דבר זה מסייע בסופו של דבר בחיזוי טוב יותר של מאפיינים אדריכליים ומחזק את הסיווג בהמשך של עיצוב דיור ידידותי לקשישים ומשולב בתחום הבריאות.
מודל InceptionV3 מאומן באמצעות גישת למידת העברה עם משקלים מאומנים מראש מתוך מאגר הנתונים של ImageNet. תמונות הקלט מותאמות ל-224 × 224 × 3 כדי להבטיח תאימות לארכיטקטורת הרשת ועקביות בכל המודלים במסגרת. התמונות שונו לגודל של 224 × 224 פיקסלים, נורמל לטווח [0, 1], והוגדלו באמצעות הפיכה אקראית, סיבוב, זום והעברה. גודל אצווה של 32 שימש במהלך האימונים.
שכבות הסיווג המקוריות של InceptionV3 הוסרו, וראש רגרסיה מותאם אישית מוצג כדי לאפשר חיזוי ריבוי פלטים. ראש הרגרסיה המותאם אישית כלל שכבת Global Average Pooling ואחריה שכבות מחוברות לחלוטין עם 512 ו-256 נוירונים, נרמול אצווה, שכבות dropout (0.4 ו-0.3), ושכבת פלט ליניארית בת ארבעה נוירונים. הבסיס הקונבולוציוני מכוון חלקית, כאשר השכבות התחתונות המאומנות מראש מוקפאות והשכבות העליונות יחד עם ראש הרגרסיה המותאם אישית מותאמות ללמידת תכונות תכנית קומה ייחודיות לתחום, תוך שמירה על ייצוגים ויזואליים כלליים שנרכשו במהלך ההכשרה המוקדמת. לאחר עמוד השדרה הקונבולוציוני, שכבת Global Average Pooling ממירה את מפות התכונות לייצוג תכונות קומפקטית. לאחר מכן מגיעות שכבות מחוברות לחלוטין המכילות 512 ו-256 נוירונים עם פונקציות הפעלה של ReLU. כדי למזער התאמת יתר ולשפר הכללה, מיישמים שיעורי נשירה של 0.4 ו-0.3. שכבת הפלט הסופית מורכבת מארבעה נוירונים עם הפעלה ליניארית המתאימה לחיזוי שטח השטח, מספר חדרי השינה, מספר חדרי הרחצה ומספר המוסכים. המודל מאומן באמצעות אופטימייזר אדם עם קצב למידה של 0.0001, גודל אצווה של 32, ועד 15 תקופות אימון עם עצירה מוקדמת והפחתת קצב למידה אדפטיבית כדי להבטיח התכנסות יציבה.
ResNet101:
ResNet101 הוא מבנה עמוק של CNN שנבנה על עקרון הלמידה השיורית, שמאפשר לאמן רשתות עמוקות מאוד על ידי התגברות על בעיית הגרדיאנט המתעלם. הוא מוסיף חיבורים שאריים, או מה שנקרא חיבורי דילוג, שמאפשרים לרשת ללמוד מיפוי זהות ולשמר מידע בין שכבות. ארכיטקטורה זו משפרת מאוד את יציבות האימון ומאפשרת למודל ללמוד תכונות היררכיות מורכבות. ל-ResNet101 יש קיבולת ייצוג עמוקה של 101 שכבות ולכן הוא יעיל מאוד במשימות שדורשות תכונות מרחביות נוספות.
ResNet101 ישמש במסגרת המוצעת כמפיק תכונות בקיבולת גבוהה, שינתח את תמונות תוכניות הקומה למגורים. המודל יכול לשמש לייצוג יחסים מרחביים מורכבים, כולל קישוריות חדרים, מורכבות פריסה ושינויים מבניים, בשל הארכיטקטורה העמוקה שלו. תכונות אלו חיוניות לחיזוי מדויק של מאפיינים אדריכליים כמו שטח רבוע, חדרי שינה, חדרי אמבטיה ומוסכים. בעיצוב המטא-אנסמבל, ResNet101 הוא רכיב משמעותי ומספק ייצוגים עמוקים ומופשטים של תכונות. ResNet101 מתמקדת יותר בתכונות מבניות עדינות ולכן מגוונת יותר בקרב לומדים בסיסיים בהשוואה למודלים קלים כמו MobileNetV2. הטרוגניות זו ממלאת תפקיד חיוני בשיפור ביצועי הרכב ותחזיות חזקות, במיוחד כאשר מדובר בסיווג מגורים מבוסס בריאות.
ResNet101 מאומן באמצעות גישת למידת העברה עם משקלים מאומנים מראש מתוך מערך הנתונים של ImageNet. תמונות הקלט מותאמות ל-224 × 224 × 3, מה שמבטיח תאימות אדריכלית ועקביות בכל המודלים במסגרת. התמונות שונו לגודל של 224 × 224 פיקסלים, נורמל לטווח [0, 1], והוגדלו באמצעות הפיכה אקראית, סיבוב, זום והעברה. גודל אצווה של 32 שימש במהלך האימונים. ראש הסיווג המקורי של ResNet101 הוסר (include_top=False), והוכנס ראש רגרסיה מותאם אישית לאפשר חיזוי ריבוי פלטים. ראש הרגרסיה כלל שכבת Global Average Pooling ואחריה שכבות מחוברות לחלוטין עם 512 ו-256 נוירונים, נרמול אצווה, שכבות נדירות (0.4 ו-0.3), ושכבת פלט ליניארית בת ארבעה נוירונים. כדי לאזן בין שימוש חוזר בתכונות לבין התאמת תחום, השכבות התחתונות שהיו מאומנות מראש הוקפאו, בעוד שהשכבות העמוקות שמתחילות מ-conv4_block1_1_conv וראש הרגרסיה המותאם אישית כוונו בדיוק. אסטרטגיית האימון הסלקטיבית הזו מאפשרת למודל לשמור על תכונות ויזואליות כלליות תוך התאמת ייצוגים ברמה גבוהה יותר לתמונות בתכנית קומה. הפלט של בסיס הקונבולוציוני עובר דרך שכבת Global Average Pooling כדי ליצור ייצוג תכונות קומפקטי. לאחר מכן מגיעות שכבות מחוברות במלואן עם 512 ו-256 נוירונים המשתמשים בפונקציות הפעלה של ReLU. נורמליזציה באצווה מיושמת לייצוב הלמידה, ושכבות נשירה עם קצב של 0.4 ו-0.3 משולבות כדי להפחית התאמת יתר ולשפר הכללה. שכבת הפלט הסופית מכילה ארבעה נוירונים עם הפעלה ליניארית המתאימה לשטח, מספר חדרי השינה, חדרי הרחצה והמוסכים. אופטימייזר אדם שימש עם קצב למידה של 0.0001, כפי שמתואר בתצורת האימון. הרחבת נתונים כללה הפיכת נתונים אקראית, סיבוב, זום והעברה לשיפור הכללת המודלים. הכשרה בוצעה עד 15 תקופות עם הפסקה מוקדמת בהתבסס על אובדן אימות והפחתת קצב הלמידה האדפטיבית.
VGG16:
VGG16 היא ארכיטקטורת רשת עצבית פשוטה מסוג קונבולוציוני עמוק, שהיא יעילה ופשוטה במשימות זיהוי חזותי. היא מורכבת מ-16 שכבות בעיצוב רגולרי או הומוגני הכולל מסננים קטנים של 3 × 3 קונבולוציוניים, המאפשרים ללמידה של ייצוגי תכונות היררכיים על ידי הרשת. הארכיטקטורה ממוקדת עומק ופשטנית, מה שאומר שהיא מסוגלת ללכוד פרטים ברמה נמוכה כמו קצוות, טקסטורות ומבנים סמנטיים ברמה גבוהה. VGG16, עם העיצוב הרגיל והביצועים הטובים שלו, הוא כיום בחירה פופולרית ללמידת העברה במשימות הקשורות לתמונה.
במודל המוצע, VGG16 משמש כמודל בסיס ל-DL כדי לגזור מאפיינים מרחביים של תמונות של תוכניות קומות למגורים. העובדה שהוא מאורגן מאפשרת לו להיות שימושי מאוד בלכידת הפרטים העדינים של דפוסי פריסה כמו גבולות חדרים, יישורים מבניים וארגון מרחבי. המאפיינים חיוניים לחיזוי יעיל של מאפייני האדריכלות כמו רגל רבוע, חדרי שינה, חדרי רחצה ומוסכים. במערכת המטה-אנסמבל, VGG16 מספק ייצוגים יציבים ומוכללים היטב. VGG16 מציע גישה מאוזנת יותר לחילוץ תכונות בהשוואה לארכיטקטורות עמוקות יותר, כמו ResNet101, וארכיטקטורות רב-סקאלה כמו InceptionV3, מה שמגדיל את המגוון של הלומדים הבסיסיים. הטרוגניות זו קריטית לשיפור ביצועי האנסמבל והתחזיות האמינות לסיווג מגורים ממוקדי בריאות.
מודל VGG16 מאומן באמצעות גישת למידת העברה עם משקלים מאומנים מראש ממאגר הנתונים של ImageNet. תמונות הקלט מותאמות ל-224 × 224 × 3 כדי להבטיח תאימות לארכיטקטורה ועקביות בין כל המודלים במסגרת. התמונות שונו לגודל של 224 × 224 פיקסלים, נורמל לטווח [0, 1], והוגדלו באמצעות הפיכה אקראית, סיבוב, זום והעברה. גודל אצווה של 32 שימש במהלך האימונים. שכבות הסיווג המקוריות מוסרות (include_top=שקרי), ונוסף ראש רגרסיה מותאם אישית כדי להתאים את המודל לחיזוי ריבוי פלטים. ראש הרגרסיה כלל שכבת Global Average Pooling ואחריה שכבות מחוברות לחלוטין עם 512 ו-256 נוירונים, נרמול אצווה, שכבות נדירות (0.4 ו-0.3), ושכבת פלט ליניארית בת ארבעה נוירונים. השכבות התחתונות שהיו מאומנות מראש היו קפואים, בעוד שהשכבות שהתחילו מ-block4_conv1 וראש הרגרסיה המותאם אישית כוונו היטב. אסטרטגיה זו מאפשרת למודל לשמור על מאפיינים חזותיים כלליים תוך כדי לימוד ייצוגים ספציפיים לתחום הרלוונטי לניתוח תוכניות קומה. תכונות הפלט של בסיס הקונבולוציוני מועברות דרך שכבת Global Average Pooling ליצירת וקטור תכונות קומפקטי. לאחר מכן מגיעות שכבות מחוברות במלואן עם 512 ו-256 נוירונים המשתמשים בפונקציות הפעלה של ReLU. שכבות נורמליזציה ואספקטיבה עם קצב של 0.4 ו-0.3 משולבות לייצוב האימון, להפחתת התאמת יתר ולשפר הכללה. שכבת הפלט הסופית מכילה ארבעה נוירונים עם הפעלה ליניארית המתאימה לשטח, מספר חדרי השינה, חדרי הרחצה וחיזויי המוסך. אופטימייזר אדם שימש עם קצב למידה של 0.0001, כפי שמתואר בתצורת האימון. הרחבת נתונים כללה הפיכת נתונים אקראית, סיבוב, זום והעברה לשיפור הכללת המודלים. הכשרה בוצעה עד 15 תקופות עם הפסקה מוקדמת בהתבסס על אובדן אימות והפחתת קצב הלמידה האדפטיבית.
CARE-MIRV-Net (מודל DL מטא-אנסמבל מוצע):
ה-CARE-MIRV-Net המוצע (Context-Aware Residential Ensemble המשתמש ב-MobileNetV2, InceptionV3, ResNet101 ו-VGG16 Network) הוא מסגרת DL מבוססת ערימה, שמטרתה לשפר את הערכת המאפיינים האדריכליים על בסיס תמונות תכנית קומה למגורים. הארכיטקטורה משלבת CNNים הטרוגניים שונים על ידי ניצול היתרונות הסינרגטיים שלהם בהפקת תכונות. המודל המוצע מבוסס על שילוב של ארכיטקטורה קלה, עמוקה ורב-קנה מידה שמגבירה ביצועים חיזויים ומספקת עמידות במגוון רחב של תכנוני מגורים. בניגוד לטכניקות המסורתיות המבוססות על מודל יחיד, CARE-MIRV-Net פועלת בגישת למידה היררכית, שבה מודלים בסיסיים מספקים תחזיות ראשוניות, אשר לאחר מכן משתפרות על ידי הלומד המטא.
כשמדובר בעיצוב מגורים שמודע למרחב ולבריאות, הפרשנות הנכונה של תכניות הקומה היא בעלת חשיבות עליונה. מודלים של DL בודדים נוטים להיות לא מספקים להכללת דפוסים ארכיטקטוניים שונים. המסגרת המוצעת תתגבר על חולשה זו באמצעות ארבע ארכיטקטורות שונות: MobileNetV2, InceptionV3, ResNet101 ו-VGG16, שמביאות יכולות ייצוג שונות משלהן. ניתן להשתמש ב-MobileNetV2 להפקת תכונות ביעילות והוא קל משקל; InceptionV3 לומד דפוסים מרחביים במגוון סולמות; ResNet101 לומדת ייצוגים היררכיים עמוקים; ו-VGG16 לומדת תכונות באופן עקבי ואמין. שילוב של מודלים אלו מאפשר למסגרת לאמץ הן את המאפיינים המרחביים המקומיים והן את התכונות הגלובליות, מה שמשפר את הדיוק והאמינות של התכונות החזויות כמו שטח, מספר חדרי השינה, חדרי הרחצה והמוסכים. התחזיות הנ״ל יכולות לשמש גם לחיזוי סיווג נוסף של תכניות מגורים לכלול מגורים ידידותיים לקשישים, משולבים עם שירותי בריאות ומגורים כלליים.
CARE-MIRV-Net מיושמת באמצעות אסטרטגיית אנסמבל דו-שלבית המבוססת על ערימה. בשלב הראשון, ארבעת מודלי הבסיס מייצרים באופן עצמאי תחזיות למשתני היעד. קלטי מטא-לומדים נוצרו על ידי חיבור פלטי החיזוי שנוצרו על ידי מודלים בסיסיים מאומנים על נתוני האימון. תחזיות מחוברות אלו יצרו את וקטורי המטא-תכונה ב-16 הממדים ששימשו לאימון מטא-מודל. דליפת מידע נמנעה באמצעות הפרדה קפדנית של מאגרי הנתונים של האימון והבדיקה, ולא נעשה שימוש בדגימות בדיקה במהלך ההכשרה במודל-בסיס או במטה-מודל. אותם מאגרי נתונים של אימון ואימות ששימשו למודלים הבסיסיים שימשו במהלך תהליך ההצטברות. במהלך האימון וההסקה, וקטור המטה-תכונות בעל 16 ממד נבנה על ידי חיבור ארבעת פלטי החיזוי שנוצרו על ידי MobileNetV2, InceptionV3, ResNet101 ו-VGG16. מכיוון שכל מודל מייצר וקטור פלט ארבע-ממדי, הייצוג המחובר מייצר קלט 16-ממדי למטה-לומד. טרנספורמציה זו משלבת את התחזיות מכל מודלי הבסיס ומשמשת כקלט לשלב השני של המסגרת. השלב השני כולל בניית מטא-לומד רשת עצבית מחוברת במלואה כדי ללמוד את השילוב האופטימלי של תחזיות מודל בסיס. המטה-לומד כלל שכבות מחוברות לחלוטין עם 512 ו-256 נוירונים, הפעלה של ReLU, נרמול באצוות, שיעורי נשירה של 0.4 ו-0.3, ושכבת פלט ליניארית בת ארבעה נוירונים. שכבות נופלות עם קצב 0.4 ו-0.3 יושמו לאחר השכבות הצפופות כדי להפחית התאמת יתר ולשפר את ההכללה. המטא-מודל אומן באמצעות אופטימייזר אדם עם קצב למידה של 0.0001, גודל אצווה של 32, ועד 15 אפוקים עם הפסקה מוקדמת והפחתת קצב למידה אדפטיבית. נתוני האימות שימשו למעקב אחר ביצועי המודל במהלך האימון ולבחירת המודל בעל הביצועים הטובים ביותר. לאחר ההדרכה, מודל המטה-אנסמבל יצר תחזיות סופיות על ידי שילוב פלטים מכל הלומדים הבסיסיים. MAE ו-R2 שימשו להערכת ביצועי CARE-MIRV-Net. לחיזוי רב-פלט, MAE ו-R2 חושבו על ידי השוואת הערכים החזויים והאמיתיים לכל משתנה יעד ואז ממוצע התוצאות בכל הפלטים. התוצאות התקבלו מריצת ניסוי אחת באמצעות זרע אקראי קבוע. המסגרת המוצעת משפרת את יכולת החיזוי על ידי שילוב מספר מבני DL באמצעות מנגנון ערימה ומתן ניתוח ניתן לפרשנות של תוכניות קומות למגורים. דבר זה הופך את CARE-MIRV-Net לרלוונטי בהקשר של עיצוב מגורים ממוקד זקנה וטיפול רפואי. קוד המקור, מידע על תצורת הסביבה, מפרטי התלות בתוכנה ותיעוד היישום מסופקים בקובץ משלים 1.
הערכת ביצועים
ניתוח ביצועים של המסגרת המוצעת מתבצע כדי לקבוע את כוח החיזוי שלה, עמידותה וביצועי הכללה על פני מאפיינים אדריכליים שונים. ניתוחים כמותיים ואיכותניים מתבצעים כדי לאשר את תועלת המודל המוצע. הליך ההערכה כולל גם מדדי רגרסיה סטנדרטיים וגם סביבות ניסוי מבוקרות כדי לאפשר השוואה הוגנת למודלים הבסיסיים. הניסויים נערכו באמצעות ריצה אחת של ניסוי עם זרע אקראי קבוע כדי להבטיח שחזוריות ועקביות בכל המודלים המדורגים והמוצעים.
פרמטרי ביצועים:
שני מדדי רגרסיה ידועים, MAE ו-R2, משמשים להערכת ביצועי המסגרת המוצעת. MAE מודד את עוצמת שגיאות החיזוי הממוצעת ומספק אינדיקציה ברורה לקרבה בין הערכים החזויים לערכים בפועל. לעומת זאת, ערך R2 משמש להערכת שיעור השונות במשתני היעד המוסברים על ידי המודל, המשקף את כוח החיזוי הכולל שלו. שילוב של מדדים אלו מספק הערכה מקיפה של הדיוק וביצועי הכללה של כל התכונות האדריכליות החזויות. לחיזוי רב-פלט, MAE ו-R2 חושבו על ידי השוואת הערכים החזויים והאמיתיים לכל משתנה יעד ואז ממוצע התוצאות בכל הפלטים.
מערכת ניסיונית:
הניסויים נערכו בסביבת מחשוב ענן באמצעות פייתון (גרסה 3.12.12). הפרוטוקול המוצע יושם באמצעות TensorFlow (גרסה 2.19.0), Keras (גרסה 3.13.2), NumPy (גרסה 2.4.6), Pandas (גרסה 2.3.3), Scikit-learn (גרסה 1.6.1), Matplotlib (גרסה 3.9) ו-SHAP (גרסה 0.51.0). הסביבה החישובית השתמשה במעבד Intel Xeon שפעל בתדר 2.20 GHz עם כ-31GB זיכרון מערכת. הניסויים בוצעו על מערכת הפעלה Ubuntu 22.04 LTS שהשתמשה בכרטיסי NVIDIA Tesla T4 × 2. מערך הנתונים כולל 2,640 תמונות של תכנית קומה למגורים שעברו עיבוד מוקדם וחולקו למערכי הדרכה ובדיקות. מערך הנתונים חולק ביחס חלוקה של 80:20, מה שהוביל ל-2,112 דגימות אימון ו-528 דגימות בדיקה. MobileNetV2, InceptionV3, ResNet101 ו-VGG16 הם ארבעה מודלים של DL שאומנו בגישת כיוונון עדין עם למידת העברה. לאחר מכן נבנה מודל מטא-אנסמבל מבוסס ערימה, CARE-MIRV-Net, לשילוב תחזיות ממודלים בסיסיים אלו. כל דגם אומן בתנאים אחידים, כולל שינוי גודל תמונה ל-224 × 224 פיקסלים, הגדלת נתונים והפסקה מוקדמת להפחתת התאמת יתר. שדרוג נתונים כלל הפיכת נתונים אקראית, סיבוב, זום והעברה. גודל אצווה של 32 ומקסימום 15 תקופות אימונים שימשו, כאשר הפסקה מוקדמת התבססה על אובדן אימות והפחתת קצב למידה אדפטיבית. הניתוח הסופי בוצע על מערך מבחן נסתר כדי לספק הערכה בלתי מוטה ואמינה של ביצועים. מערך הבדיקות הנסתר נוצר במהלך חלוקת מערך הנתונים הראשוני ונשאר מבודד לחלוטין לאורך כל אימון ופיתוח המודלים כדי להבטיח הערכת ביצועים בלתי מוטה.
תיאור מאגר נתונים:
מערך הנתונים התומך בממצאי מחקר זה זמין לציבור בפלטפורמת Kaggle תחת הכותרת "תמונות בתכנית קומה ופרטיהן"28. מערך הנתונים זמין ב: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (ניגש ב-16 באפריל 2026). הנתונים כוללים 2,640 תמונות בתכנית קומה למגורים ומטא-דאטה אדריכלית מאורגן. כל דוגמה היא תכנית דיור ייחודית, המספקת מגוון רחב של תכניות מגורים בגדלים, תצורות וסידורים מרחביים שונים. גודל מאגר הנתונים מספיק לאימון מבוסס DL ומכיל מגוון דפוסים ארכיטקטוניים. מאגר הנתונים מורכב מתמונה דו-ממדית של תוכנית קומה ותכונות מספריות קשורות המתארות את המאפיינים המבניים של המגורים. תכונות אלו כוללות את שטח השטח הכולל, מספר חדרי השינה, מספר חדרי הרחצה ומספר המוסכים. יתרה מזאת, כל רשומה מכילה נתיב תמונה, המאפשר מיפוי ישיר של קלטים ויזואליים לתוויות. משתני מאגר הנתונים כוללים את תמונת תוכנית הקומה, מסלול התמונה, שטח רבוע, מספר חדרי השינה, מספר חדרי הרחצה ומספר המוסכים. תמונת תכנית הקומה משמשת כתכונת קלט, בעוד שהמאפיינים האדריכליים משמשים כמטרות חיזוי. לכן, מערך הנתונים מתאים ללמידה מפוקחת, כאשר תמונות משמשות כתכונות קלט ותכונות ארכיטקטוניות משמשות כיעדי רגרסיה.
מאגר הנתונים מכיל מגוון רחב של תכניות מגורים, החל מתוכניות קומפקטיות עם פחות חדרים ועד לפריסות גדולות מרובות חדרים. שונות זו מאפשרת למידה של ייצוגים מרחביים משמעותיים, כולל התפלגות חדרים, צפיפות פריסה ומורכבות מבנית. גיוון זה חשוב במיוחד למסגרת המוצעת, שכן הוא תומך בסיווג תוכניות הקומה לתכניות מגורים ידידותיות לקשישים, משולבות עם שירותי בריאות ותוכניות מגורים כלליות. לפני אימון המודלים, מערך הנתונים מעובד באמצעות רצף של פרה-עיבוד כדי להבטיח עקביות ותאימות למודלים של DL. כל התמונות שונו ל-224 × 224 פיקסלים ונרמלו לטווח [0, 1] לפני האימון. מערך הנתונים מאורגן על ידי התאמת מסלולי התמונה למטא-דאטה המתאימים, ולאחר מכן הוא מופרד לתת-קבוצות אימון ובדיקות כדי להקל על ניתוח ביצועים. מערך הנתונים חולק באקראי לקבוצות אימון ובדיקות באמצעות יחס מפוצל של 80:20. רשומות המכילות תמונה מלאה ומידע מטא-דאטה נכללו בניתוח, בעוד שרשומות לא שלמות או לא תקפות הוצאו. במהלך חלוקת מערך הנתונים שימש זרע אקראי קבוע כדי להבטיח שחזוריות. מערך הנתונים מספק בסיס מפורט לניתוח מונחה בינה מלאכותית של תוכניות קומות למגורים. השילוב של 2,640 תמונות עם הערות ותכונות אדריכליות מגוונות תומך במידול רגרסיה מרובה פלטים ומאפשר שילוב של אינטליגנציה מרחבית עם קבלת החלטות עיצוב מגורים המכוון לבריאות.