استخدمت هذه الدراسة مجموعة بيانات متاحة للجمهور من منصة كاجل (صور مخطط الأرضية وتفاصيلها، متاحة على: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details؛ تم الوصول إليها في 16 أبريل 2026). لم يشمل المشاركين البشر، أو الحيوانات، أو البيانات الشخصية القابلة للتعريف؛ لذلك، لم تكن الموافقة الأخلاقية والموافقة المستنيرة مطلوبة.
يقدم هذا البروتوكول إطارا مدفوعا بالذكاء الاصطناعي للتحليل الآلي لصور مخططات الطوابق السكنية، مع تركيز على التصميم الواعي المكاني والموجه للرعاية الصحية. يتم عرض سير العمل التجريبي الكامل في الشكل 1. تم تصميم البروتوكول لسد الفجوة بين التنبؤ بالميزات المعمارية منخفضة المستوى واتخاذ القرار الموجه للتطبيقات على مستوى عال. يدمج التعلم العميق، ونمذجة المجموعات الجماعية، والذكاء الاصطناعي القابل للتفسير لتوفير حل دقيق ومتين وقابل للتفسير لتحليل تخطيطات السكن. يتكون الإطار من عدة مراحل، تبدأ بجمع البيانات والمعالجة المسبقة، تليها تعلم الميزات باستخدام CNNs العميقة، والتنبؤ بمجموعات الميتا، وأخيرا التصنيف على مستوى التطبيق. في البداية، تتم معالجة صور مخطط الطوابق وخصائصها المعمارية المقابلة مسبقا من خلال تغيير الحجم، والتطبيع، وتعزيز البيانات لضمان الاتساق وتحسين التعميم. تم تغيير حجم جميع صور مخطط الطوابق إلى 224 × 224 بكسل وتم تطبيعها إلى النطاق [0, 1]. تم تطبيق تعزيز البيانات أثناء التدريب باستخدام الانقلاب الأفقي العشوائي، والدوران، والتكبير، وتغيير العرض/الارتفاع لتحسين تعميم النموذج وتقليل الإفراط في التوافق. لم يتم تطبيق أي انقلاب عمودي. تم توفير معايير التعزيز الكاملة وتفاصيل التنفيذ في الملف التكميلي 1. ثم تم استخدام البيانات المعالجة لتدريب نماذج DL متعددة على استخراج الميزات والتنبؤ. تم تدريب جميع النماذج الأساسية ومتعلم CARE-MIRV-Net الميتا باستخدام تكوين متسق، يشمل تعزيز البيانات، والتوقف المبكر، وجدولة معدل التعلم التكيفي. تم مراقبة فقدان التحقق (val_loss) في التوقف المبكر بقيمة صبر قدرها 5 فترات فارغ، وكانت أوزان النماذج الأفضل تستعاد تلقائيا بعد التدريب. تم تنفيذ جدولة معدل التعلم التكيفي باستخدام استدعاء ReduceLROnPlateau، الذي راقب فقدان التحقق وخفض معدل التعلم بمقدار 0.3 بعد عصرين دون تحسين، مع معدل تعلم أدنى 1 × 10⁻7. يتم توفير تفاصيل التنفيذ الكاملة وإعدادات المعلمات في الملف التكميلي 1. تم تقسيم مجموعة البيانات عشوائيا إلى مجموعات تدريب واختبار باستخدام نسبة تقسيم 80:20. تم استخدام بذرة عشوائية ثابتة (42) لضمان قابلية التكرار. تفاصيل التنفيذ الكاملة متوفرة في الملف التكميلي 1.

الشكل 1. سير عمل إطار عمل CARE-MIRV-Net لتحليل مخططات الطوابق السكنية. نظرة عامة تخطيطية للبروتوكول المقترح. يشمل سير العمل (1) جمع مجموعات البيانات والمعالجة المسبقة، (2) تعلم الميزات والتنبؤ باستخدام MobileNetV2 وInceptionV3 وResNet101 وVGG16، و(3) التنبؤ بمجموعات الفوقات باستخدام CARE-MIRV-Net باستخدام التكديس، و(4) تصنيف التخطيط السكني القائم على القواعد، (5) تحليل تفسير التفسير المعتمد على SHAP المعتمد على SHAP، و(6) تقييم الأداء. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
في المرحلة الثانية، يتم توظيف أربع CNNs مدربة مسبقا، MobileNetV2، InceptionV3، ResNet101، وVGG16، كمتعلمين أساسيين. يتم ضبط كل نموذج بدقة باستخدام التعلم الانتقالي للتنبؤ بالخصائص المعمارية الرئيسية، بما في ذلك المساحة وعدد غرف النوم والحمامات والجراجات. لكل نموذج تعلم النقل، تم إبقاء الطبقات السفلية المدربة مسبقا مجمدة، بينما تم ضبط الطبقات العليا ورأس الانحدار المخصص أثناء التدريب. تم توفير تكوينات دقيقة تفصيلية لضبط النموذج في الملف التكميلي 1. تلتقط هذه النماذج جوانب مختلفة من المعلومات المكانية: يوفر MobileNetV2 استخراجا فعالا للميزات، ويلتقط InceptionV3 أنماطا مكانية متعددة المقاييس، ويتعلم ResNet101 تمثيلات هرمية عميقة، ويضمن VGG16 تعلم ميزات مستقر ومتسق. التنوع بين هذه النماذج يعزز القدرة التمثيلية العامة للإطار.
لتعزيز دقة ومتانة التنبؤ أكثر، يقترح نموذج ميتا-أنسامبل قائم على التكديس، ويرمز إليه ب CARE-MIRV-Net. في هذه الخطوة، يتم تجميع التنبؤات من جميع النماذج الأساسية معا لإنشاء فضاء ميزات أعلى، وهو إدخال لمتعلم فوقي. يتم أولا توليد توقعات النموذج الأساسي بشكل مستقل باستخدام نماذج MobileNetV2 وInceptionV3 وResNet101 وVGG16 المدربة. ثم يتم ربط هذه التنبؤات لتشكيل متجه الميزة الفوقية الذي يستخدمه المتعلم الفوقي. لمنع تسرب البيانات، يتم فصل مجموعات بيانات التدريب والاختبار بشكل صارم، ويتم تدريب المتعلم الفوقي فقط على التنبؤات المولدة من بيانات التدريب. النموذج الفوقي، وهو شبكة عصبية متصلة بالكامل، مدرب على تعلم التركيبة المثلى من مخرجات النموذج الأساسي لإنتاج توقعات دقيقة. يتكون النموذج التيه من طبقتين متصلتين بالكامل مع 512 و256 عصبية عصبية باستخدام تفعيل ReLU، تليها طبقات انقطاع (0.4 و0.3) وطبقة إخراج خطية. يتم تدريب النموذج باستخدام محسن آدم (معدل التعلم = 0.0001)، وحجم دفعة 32، وحتى 15 عصرا. تم تنفيذ الإيقاف المبكر من خلال مراقبة فقدان التحقق (val_loss) بقيمة صبر تبلغ 5 فترات فارغ. تم تعيين معيار التحسين الأدنى (min_delta) على القيمة الافتراضية ل TensorFlow وهي 0، وتم استعادة أوزان أفضل نماذج تلقائيا بعد التدريب. تم تنفيذ جدولة معدل التعلم التكيفي باستخدام استدعاء ReduceLROnPlateau، الذي راقب فقدان التحقق وخفض معدل التعلم بمقدار 0.3 مرة بعد عصرين متتاليين دون تحسين. تم ضبط الحد الأدنى لمعدل التعلم على 1 × 10⁻7، واستخدم معلم التهدئة القيمة الافتراضية TensorFlow وهي 0. تقلل هذه الطريقة الجماعية من تحيزات النماذج الفردية وتحسن التعميم من خلال نقاط القوة التكميلية لعدة معماريات. معلومات التنفيذ التفصيلية موفرة في الملف التكميلي 1.
بعد التنبؤ، تضاف طبقة تفسير لتحويل المخرجات الرقمية إلى قرارات على مستوى التطبيق. يمكن تصنيف تخطيطات السكن إلى ثلاث فئات بناء على توقعات الخصائص المعمارية: رعاية كبار السن، والرعاية الصحية المتكاملة (الرعاية الطبية)، والاستخدام السكني العام. يتم إجراء هذا التصنيف باستخدام قواعد قرار محددة مسبقا بناء على المساحة المتوقعة، وعدد غرف النوم، وعدد الحمامات. يتم تعيين الفئة التي حصلت على أعلى درجة كتصنيف نهائي، بينما يتم حل التعادل باختيار الفئة التي تحقق أكبر عدد من معايير القرار. تم توفير قواعد التسجيل الكاملة وعتبات التصنيف في الملف التكميلي 2 (الخوارزمية 1). يتيح هذا الإجراء للإطار تقديم معلومات عملية لتصميم المساكن السكنية.
يستخدم الإطار ذكاء اصطناعيا قابلا للتفسير مع تقنية SHAP لتوفير الشفافية وقابلية التفسير. يفحص هذا المكون مساهمة التنبؤات من كل نموذج أساسي في مخرجات النموذج الفوقي. تم إجراء تحليل SHAP باستخدام معالج SHAP KernelExplainer (إصدار SHAP 0.51.0) مع 100 عينة تدريب مختارة عشوائيا كمجموعة بيانات خلفية و50 عينة اختبار لتوليد التفسير. يتم توفير التكوين الكامل ل SHAP، بما في ذلك اختيار العينات في الخلفية وإعدادات التنفيذ، في الملف التكميلي 1. تساعد طبقة التفسير على فهم عملية اتخاذ القرار من خلال قياس أهمية الميزة وعرض أنماط المساهمات، مما يحسن من شفافية النموذج وموثوقيته. يتم تقييم الإطار المقترح باستخدام MAE و R2 عبر جميع المتغيرات المستهدفة. بالنسبة للتنبؤ بعدة مخرجات، تم حساب MAE كمتوسط الفرق المطلق بين القيم الفعلية والمتوقعة عبر جميع المتغيرات المستهدفة، بينما تم حساب R2 بمقارنة التباين المفسر للتنبؤات مع قيم الحقيقة الأرضية المقابلة لكل مخرجات. تشير التحليلات الكمية والنوعية إلى أن مشروع CARE-MIRV-Net المقترح يحسن دقة التنبؤ ويدعم تصنيف تخطيط السكن القائم على القواعد. تم تقييم موثوقية التصنيف بناء على دقة توقعات الانحدار الأساسية وثبات طبقة القرار القائمة على القواعد. يعد الإطار حلا مناسبا وقابلا للتوسع لتحليل مخطط الطوابق الذكي ويمكن تطبيقه على الإسكان الذكي، وتخطيط رعاية كبار السن، وتصميم السكن الموجه للرعاية الصحية. قائمة كاملة بمجموعات البيانات، وحزم البرمجيات، والمكتبات، والموارد العمادية، والأدوات الحاسوبية المستخدمة في هذه الدراسة مقدمة في جدول المواد. يتم توفير الشيفرة المصدرية، ومعلومات تكوين البيئة، ومواصفات اعتماد البرمجيات، وسكريبتات التنفيذ اللازمة لإعادة إنتاج سير العمل المبلغ عنه في الملف التكميلي 1.
خوارزمية البروتوكول
يتبع الإطار المقترح نهجا متعدد المراحل لمعالجة مخططات الطوابق القائمة على الصور للمنازل السكنية وإنتاج مخرجات تنبؤية ومستوى قرار، كما هو موضح في الخوارزمية 1 في الملف التكميلي 2. تبدأ هذه العملية بمعالجة البيانات المسبقة، حيث يتم إعادة تكبير صور الإدخال إلى دقة قياسية وتطبيعها لتوفير التوحيد في جميع أنحاء مجموعة البيانات. تم تغيير حجم جميع صور مخطط الطوابق إلى 224 × 224 بكسل وتم تطبيعها إلى النطاق [0, 1]. تعمل هذه الخطوة على تحسين الصور للتعلم عبر الشبكات العصبية العميقة وتعزز تقارب النموذج بشكل عام. المرحلة الثانية تتضمن استخدام عدة نماذج DL كمتعلمين أساسيين، بما في ذلك MobileNetV2 وInceptionV3 وResNet101 وVGG16. بشكل مستقل، يأخذ كل نموذج الصور المدخلة ويقدر الميزات المعمارية المهمة مثل المساحة وعدد غرف النوم والحمامات والكراجات. تم تقسيم مجموعة البيانات عشوائيا إلى مجموعات تدريب واختبار باستخدام نسبة تقسيم 80:20، وتم استخدام بذرة عشوائية ثابتة لضمان قابلية التكرار. تلتقط هذه النماذج خصائص مكانية مختلفة لمخططات الطوابق وتوفر توقعات مكملة. يتم بعد ذلك بناء تمثيل الميزة عن طريق تكديس مخرجات كل نموذج أساسي لإنشاء تمثيل ميزة واحد. يتم تغذية هذا الناتج المشترك لاحقا في نموذج ميتا-تجميعي، CARE-MIRV-Net، الذي تم تدريبه على دمج توقعات جميع النماذج الأساسية. تم توليد تنبؤات النموذج الأساسي بشكل مستقل وربطها لتشكيل متجه الميزة الفوقية. تم منع تسرب البيانات من خلال الفصل الصارم بين مجموعات بيانات التدريب والاختبار. يقوم النموذج التلوي بتحسين هذه التنبؤات وينتج التنبؤات النهائية للسمات المعمارية. تكون النموذج التيه من طبقات متصلة بالكامل تحتوي على 512 و256 عصبونا، ووظائف تنشيط ReLU، ومعدلات انقطاع 0.4 و0.3، ومحسن آدم (معدل التعلم = 0.0001)، وحجم دفعة 32، وما يصل إلى 15 فترة تدريب مع توقف مبكر. بعد التنبؤ، تستخدم طبقة القرار لوضع النتائج في سياقها. وفقا للقيم المقدرة، يتم تصنيف كل تخطيط سكني كرعاية للمسنين، الرعاية الطبية، أو الاستخدام السكني العام. تم تعيين الفئات السكنية باستخدام قواعد تسجيل النقاط المحددة مسبقا بناء على العتبات المستمدة من سمات مخطط الطوابق المتوقعة. تم اختيار الفئة التي حصلت على أعلى درجة كتصنيف نهائي. تم توفير عتبات التصنيف الكاملة وقواعد القرار في الخوارزمية 1 (الملف التكميلي 2). أخيرا، يتضمن الإطار مكونا قابلية التفسير يعتمد على SHAP لتقييم تأثير كل نموذج أساسي على التوقع النهائي. تم إجراء تحليل SHAP كما هو موضح سابقا وفي الملف التكميلي 1. يزيد هذا المكون من الشفافية ويساعد في فهم عملية اتخاذ القرار. تم تقييم فعالية وفعالية النهج المقترح باستخدام مقاييس أداء الانحدار القياسية. تم تقييم الأداء باستخدام تجربة واحدة مع بذرة عشوائية ثابتة.
نماذج التقييم
في هذا القسم، تعرض نماذج DL المستخدمة في الدراسة، بما في ذلك كل من النماذج الأساسية الفردية ونموذج CARE-MIRV-Net المقترح. تم اختيار النماذج المعيارية لتمثيل هياكل DL المتنوعة والمعتمدة على نطاق واسع. تم تضمين MobileNetV2 كشبكة خفيفة الوزن وفعالة حسابيا، وتم اختيار InceptionV3 لقدرتها على التقاط الميزات المكانية متعددة المقاييس. تم اختيار ResNet101 بسبب قدرته العميقة على التعلم المتبقي لاستخراج الميزات بشكل هرمي، وتم تضمين VGG16 كبنية التفافية راسخة. تم تدريب جميع نماذج المعيار باستخدام إجراءات معالجة مسبقة متطابقة، وإعدادات تعزيز البيانات، وتقسيمات مجموعات البيانات، ومعلمات التحسين، وحجم الدفعة، وتكوين التدريب لضمان تقييم مقارن عادل.
MobileNetV2:
موبايل نت V2 هو نظام CNN صغير ومضغوط تم تصميمه ليكون سريعا وعالي الأداء وبتعقيد حسابي أقل. يقدم بعضا من الابتكارات الرئيسية مثل الوصلات المتبقية المقلوبة وعنقات الاختناقات الخطية، التي تسهل استخراج الميزات بكفاءة ولا تزال تتمتع بقوة تمثيلية عالية. يمكن ل MobileNetV2 استخدام الالتفافات القابلة للفصل من حيث العمق لتقليل عدد المعاملات الكلي والتكلفة الحسابية للشبكات الالتفافية التقليدية بشكل كبير، وبالتالي فهو متكيف جيدا مع مشاكل التعلم الكبيرة القائمة على الصور.
يستخدم MobileNetV2 في الإطار المقترح كأحد نماذج DL الأساسية للتنبؤ بالخصائص المعمارية لصور مخطط الطوابق السكنية. يستطيع النموذج تعلم الأنماط المكانية مثل توزيع الغرف، كثافة التخطيط، والتنظيم الهيكلي التي تحدث في مخططات الطوابق بفعالية بفضل تصميمه الفعال. تلعب هذه التمثيلات المكتسبة دورا مهما في تقدير الميزات المهمة مثل المساحة المربعة، وعدد غرف النوم، والحمامات، والكراجات بدقة. MobileNetV2 هو نموذج خفيف الوزن، وهو مرشح جيد ليتم تضمينه في إطار عمل الميتا-أنسامبل المقترح. تضيف بعض الميزات المكملة لنماذج DL الأخرى، وتعزز المتانة والتعميم بشكل عام. يعد هذا التعلم النموذجي مهما جدا من حيث تحسين دقة التنبؤات والمساعدة في تصنيف تصاميم السكن بناء على الرعاية الصحية.
نموذج MobileNetV2 مدرب باستخدام استراتيجية التعلم التحويلي مع أوزان مدربة مسبقا من مجموعة بيانات ImageNet. يتم تكبير صور الإدخال إلى حجم ثابت 224 × 224 × 3، وهو متوافق مع البنية. تم تغيير حجم الصور إلى 224 × 224 بكسل، وتم تطبيعها إلى النطاق [0, 1]، وتم تعزيزها باستخدام التقليب العشوائي، والدوران، والتكبير، والتنقل. تم استخدام دفعة بحجم 32 خلال التدريب. تمت إزالة رأس التصنيف الأولي لموبايل نت V2 واستبداله برأس انحدار. تكون رأس الانحدار من طبقة تجميع متوسط عالمي تليها طبقات متصلة بالكامل تحتوي على 512 و256 عصبوية، وتطبيع دفعي، وطبقات انقطاع (0.4 و0.3)، وطبقة إخراج خطية مكونة من أربعة عصبونات. لتسهيل التكيف مع المجال، تم تجميد الطبقات السفلية المدربة مسبقا، بينما تم ضبط الطبقات العليا التي تبدأ من block_13_expand ورأس الانحدار المخصص بدقة. يتيح هذا النهج الانتقائي للنموذج الاحتفاظ بالميزات البصرية العامة أثناء تعلم السمات المكانية الخاصة بالمجال لصور مخطط الأرضية. تتم معالجة خرائط الميزات المستخرجة من خلال طبقة تجميع المتوسط العالمي وطبقات متصلة بالكامل مع 512 و256 عصبية عصبية باستخدام تفعيل ReLU. لتعزيز التعميم وتقليل الإفراط في التركيب، يتم دمج طبقات التطبيع الدفعي وطبقات الانقطاع (0.4 و0.3). تحتوي الطبقة النهائية على أربعة خلايا عصبية مع تنشيط خطي يتوافق مع السمات المعمارية المتوقعة. تم استخدام محسن آدم بمعدل تعلم 0.0001 ومعلمات TensorFlow/Keras الافتراضية (β₁ = 0.9، β₂ = 0.999، ε = 1 × 10⁻7، amsgrad = خاطئ). للتنبؤ بالمخرجات المتعددة، تم حساب MAE و R2 عن طريق مقارنة القيم المتوقعة والفعلية لكل متغير مستهدف ثم حساب المتوسط بين النتائج عبر جميع المخرجات. تم تطبيق التوقف المبكر بناء على فقدان التحقق، واستخدم تقليل معدل التعلم التكيفي لتحسين التقارب. تم إجراء التدريب لمدة تصل إلى 15 فترة تدريبية.
InceptionV3:
InceptionV3 هي بنية CNN عميقة قادرة على التقاط ميزات متعددة المقاييس باستخدام عمليات التفافية متوازية. تعتمد على وحدة Inception، التي تستخدم أحجام مرشحات متنوعة في نفس الطبقة لاستخراج ميزات دقيقة الحبيبات والخشنة في نفس الوقت. يتيح هذا النوع من تصميم العمارة للشبكة تعلم التسلسلات الهرمية المكانية المعقدة وأن تكون فعالة حسابيا. وفوق ذلك، يستخدم InceptionV3 الالتفافات الموحدة وتقليل الأبعاد، مما يعزز الأداء ويقلل من التكاليف الحاسوبية.
يتم تطبيق InceptionV3 في الإطار المقترح كأداة فعالة لاستخراج الميزات لتحليل صور مخططات الطوابق السكنية. تتكون مخططات الطوابق من أنماط مكانية متنوعة، مثل أحجام الغرف، المخططات الهيكلية، والترابط، مما يتطلب التعلم متعدد المقاييس للميزات. تعد هندسة البداية أكثر ملاءمة لهذه المهمة لأنها قادرة على تمثيل التفاصيل المحلية (مثل الغرف الصغيرة) والهياكل العامة (مثل تنظيم التخطيط العام) في نفس الوقت. يوفر InceptionV3 تمثيلات مكملة لنماذج أخرى مثل MobileNetV2 في سياق إطار عمل الميتا-أنسامبل. تزداد تنوع التوقعات بفضل قدرته على نمذجة العلاقات المكانية المعقدة، وهذا مهم في تحسين أداء الفرقة. يساعد ذلك في النهاية على التنبؤ بشكل أفضل بالخصائص المعمارية ويعزز التصنيف اللاحق لتصميم المساكن الصديقة لكبار السن والمتكاملة مع الرعاية الصحية.
يتم تدريب نموذج InceptionV3 باستخدام نهج التعلم التحويلي مع أوزان مدربة مسبقا من مجموعة بيانات ImageNet. يتم تكبير صور الإدخال إلى 224 × 224 × 3 لضمان التوافق مع بنية الشبكة والاتساق عبر جميع النماذج داخل الإطار. تم تغيير حجم الصور إلى 224 × 224 بكسل، وتم تطبيعها إلى النطاق [0, 1]، وتم تعزيزها باستخدام التقليب العشوائي، والدوران، والتكبير، والتنقل. تم استخدام دفعة بحجم 32 خلال التدريب.
تمت إزالة طبقات التصنيف الأصلية من InceptionV3، وتم إدخال رأس انحدار مخصص لتمكين التنبؤ بعدة مخرجات. تكون رأس الانحدار المخصص من طبقة تجميع متوسط عالمي تليها طبقات متصلة بالكامل تحتوي على 512 و256 عصبويا، وتطبيع دفعي، وطبقات انسحاب (0.4 و0.3)، وطبقة إخراج خطية مكونة من أربعة عصبونات. القاعدة الالفافية مضبوطة جزئيا، حيث يتم تجميد الطبقات السفلية المدربة مسبقا، والطبقات العليا مع رأس الانحدار المخصص مضبوطة بدقة لتعلم ميزات مخطط الطابق الخاصة بالمجال مع الاحتفاظ بالتمثيلات البصرية العامة التي تم اكتسابها أثناء التدريب المسبق. بعد العمود الفقري الالتفافي، تحول طبقة تجميع المتوسط العالمي خرائط الميزات إلى تمثيل ميزات مضغوط. يتبع ذلك طبقات متصلة بالكامل تحتوي على 512 و256 عصبية عصبية ذات وظائف تنشيط ReLU. لتقليل الإفراط في التوافق وتحسين التعميم، يتم تطبيق معدلات التسرب بين 0.4 و0.3. تتكون طبقة الإخراج النهائية من أربعة عصبونات مع تنشيط خطي يتوافق مع التنبؤ بالمساحة المربعة، وعدد غرف النوم، وعدد الحمامات، وعدد الكراجات. يتم تدريب النموذج باستخدام محسن آدم بمعدل تعلم 0.0001، وحجم دفعة 32، وحتى 15 فترة تدريب مع توقف مبكر وتقليل معدل التعلم التكيفي لضمان تقارب مستقر.
ResNet101:
يعد ResNet101 هيكلا عميقا من CNN مبني على مبدأ التعلم المتبقي الذي يتيح تدريب شبكات عميقة جدا من خلال تجاوز مشكلة التدرج المتلاشي. يضيف اتصالات متبقية، أو ما يسمى اتصالات التخطي، التي تمكن الشبكة من تعلم خرائط الهوية والاحتفاظ بالمعلومات عبر الطبقات. تعزز هذه البنية بشكل كبير استقرار التدريب وتسمح للنموذج بتعلم خصائص هرمية معقدة. يتمتع ResNet101 بسعة تمثيلية عميقة تبلغ 101 طبقة، وبالتالي فهو فعال جدا في المهام التي تتطلب ميزات مكانية إضافية.
سيتم استخدام ResNet101 في الإطار المقترح كأداة استخراج ميزات عالية السعة، والتي ستقوم بتحليل صور مخططات الطوابق السكنية. يمكن استخدام النموذج لتمثيل العلاقات المكانية المعقدة، بما في ذلك ترابط الغرف، وتعقيد التخطيط، والتغيرات الهيكلية، بسبب هيكله العميق. تعد هذه الميزات حاسمة في التنبؤ بدقة بالميزات المعمارية مثل المساحة المربعة، وغرف النوم، والحمامات، والجراجات. في تصميم الميتا-أنسامبل، يعد ResNet101 مكونا مهما ويوفر تمثيلات ميزات عميقة ومجردة. تركز ResNet101 أكثر على الميزات الهيكلية الدقيقة، وبالتالي فهي أكثر تنوعا بين المتعلمين الأساسي مقارنة بالنماذج الخفيفة مثل MobileNetV2. يلعب هذا التباين دورا أساسيا في تعزيز أداء المجموعة والتنبؤات القوية، خاصة عند التعامل مع تصنيف السكن القائم على الرعاية الصحية.
يتم تدريب ResNet101 باستخدام نهج التعلم التحويلي مع أوزان مدربة مسبقا من مجموعة بيانات ImageNet. يتم تعديل الصور المدخلة إلى 224 × 224 × 3، مما يضمن التوافق والاتساق المعماري عبر جميع النماذج داخل الإطار. تم تغيير حجم الصور إلى 224 × 224 بكسل، وتم تطبيعها إلى النطاق [0, 1]، وتم تعزيزها باستخدام التقليب العشوائي، والدوران، والتكبير، والتنقل. تم استخدام دفعة بحجم 32 خلال التدريب. تمت إزالة رأس التصنيف الأصلي ل ResNet101 (include_top=خطأ)، وتم إدخال رأس انحدار مخصص لتمكين التنبؤ بعدة مخرجات. تكون رأس الانحدار من طبقة تجميع متوسط عالمي تليها طبقات متصلة بالكامل تحتوي على 512 و256 عصبوية، وتطبيع دفعي، وطبقات انقطاع (0.4 و0.3)، وطبقة إخراج خطية مكونة من أربعة عصبونات. لتحقيق التوازن بين إعادة استخدام الميزات وتكييف المجال، تم تجميد الطبقات المنخفضة المدربة مسبقا، بينما تم ضبط الطبقات الأعمق التي تبدأ من conv4_block1_1_conv ورأس الانحدار المخصص بدقة. تمكن هذه الاستراتيجية الانتقائية للنموذج من الاحتفاظ بميزات بصرية عامة مع تكييف التمثيلات الأعلى المستوى مع صور مخطط الأرضية. يتم تمرير مخرج القاعدة الالتفافية عبر طبقة تجميع متوسط عالمي لتوليد تمثيل ميزات مضغوط. يتبع ذلك طبقات متصلة بالكامل تحتوي على 512 و256 عصبية عصبية تستخدم وظائف تفعيل ReLU. يتم تطبيق التطبيع الدفعي لتثبيت التعلم، ويتم دمج طبقات الانسحاب بمعدلات 0.4 و0.3 لتقليل الإفراط في التوافق وتحسين التعميم. تحتوي الطبقة النهائية على أربعة عصبونات مع تنشيط خطي يتوافق مع مساحة القدم المربعة، وعدد غرف النوم، والحمامات، والكراجات. تم استخدام محسن آدم بمعدل تعلم 0.0001، كما هو موضح في تكوين التدريب. شملت زيادة البيانات التقليب العشوائي، والدوران، والتكبير، والتحريك لتحسين تعميم النموذج. تم إجراء التدريب لمدة تصل إلى 15 فترة مع توقف مبكر بناء على فقدان التحقق وتقليل معدل التعلم التكيفي.
VGG16:
VGG16 هو بنية شبكة عصبية بسيطة من النوع الالتفافي العميق، وهي فعالة وبسيطة في مهام التعرف البصري. يتكون من 16 طبقة بتصميم منتظم أو متجانس يتضمن مرشحات التفافية صغيرة من 3 × 3، مما يسهل تعلم تمثيلات الميزات الهرمية بواسطة الشبكة. الهندسة المعمارية تركز على العمق وبسيطة، مما يعني أنها قادرة على التقاط تفاصيل منخفضة المستوى مثل الحواف والملمس والهياكل الدلالية عالية المستوى. VGG16، بتصميمه المنتظم وأدائه الجيد، أصبح الآن خيارا شائعا كأساسي عند تنفيذ التعلم التحويلي في المهام المتعلقة بالصور.
في النموذج المقترح، يستخدم VGG16 كنموذج DL أساسي لاشتقاق الميزات المكانية لصور مخططات الطوابق السكنية. كونها منظمة تمكنها من أن تكون مفيدة جدا في التقاط التفاصيل الدقيقة لأنماط التخطيط مثل حدود الغرف، ومحاذاة الهيكل، والتنظيم المكاني. تعد هذه الميزات ضرورية في التنبؤ الفعال بخصائص العمارة مثل الأقدام المربعة، وغرف النوم، والحمامات، والكراجات. في نظام المجموعات الميتا، يوفر VGG16 تمثيلات ميزات مستقرة ومعممة بشكل جيد. يقدم VGG16 نهجا أكثر توازنا لاستخراج الميزات مقارنة بالمعماريات الأعمق مثل ResNet101، والمعماريات متعددة المقاييس مثل InceptionV3، مما يزيد من تنوع المتعلمين الأساسيين. هذا التباين ضروري في تعزيز أداء المجموعة والتوقعات الموثوقة لتصنيف السكن الموجه للرعاية الصحية.
تم تدريب نموذج VGG16 باستخدام نهج التعلم التحويلي مع أوزان مدربة مسبقا من مجموعة بيانات ImageNet. يتم تكبير صور الإدخال إلى 224 × 224 × 3 لضمان التوافق مع البنية والاتساق عبر جميع النماذج داخل الإطار. تم تغيير حجم الصور إلى 224 × 224 بكسل، وتم تطبيعها إلى النطاق [0, 1]، وتم تعزيزها باستخدام التقليب العشوائي، والدوران، والتكبير، والتنقل. تم استخدام دفعة بحجم 32 خلال التدريب. تمت إزالة طبقات التصنيف الأصلية (include_top=خطأ)، وتمت إضافة رأس انحدار مخصص لتكييف النموذج مع التنبؤ بالإخراج المتعدد. تكون رأس الانحدار من طبقة تجميع متوسط عالمي تليها طبقات متصلة بالكامل تحتوي على 512 و256 عصبوية، وتطبيع دفعي، وطبقات انقطاع (0.4 و0.3)، وطبقة إخراج خطية مكونة من أربعة عصبونات. كانت الطبقات المدربة مسبقا منخفضة مجمدة، بينما كانت الطبقات التي تبدأ من block4_conv1 ورأس الانحدار المخصص مضبوطة بدقة. تمكن هذه الاستراتيجية النموذج من الاحتفاظ بالخصائص البصرية العامة أثناء تعلم التمثيلات الخاصة بالمجالات ذات الصلة بتحليل مخططات الطوابق. يتم تمرير ميزات مخرجات القاعدة الالتفافية عبر طبقة تجميع متوسط عالمي لتوليد متجه ميزات مضغوط. يتبع ذلك طبقات متصلة بالكامل تحتوي على 512 و256 عصبية عصبية تستخدم وظائف تفعيل ReLU. يتم دمج طبقات تطبيع الدفعات وطبقات الانسحاب بمعدلات 0.4 و0.3 لاستقرار التدريب، وتقليل الإفراط في التركيب، وتحسين التعميم. تحتوي الطبقة النهائية على أربعة خلايا عصبية مع تنشيط خطي يتوافق مع المساحة المربعة، وعدد غرف النوم، والحمامات، وتوقعات المرآب. تم استخدام محسن آدم بمعدل تعلم 0.0001، كما هو موضح في تكوين التدريب. شملت زيادة البيانات التقليب العشوائي، والدوران، والتكبير، والتحريك لتحسين تعميم النموذج. تم إجراء التدريب لمدة تصل إلى 15 فترة مع توقف مبكر بناء على فقدان التحقق وتقليل معدل التعلم التكيفي.
CARE-MIRV-Net (نموذج DL المقترح لمجموعة ميتا-إنسامبل):
النموذج المقترح CARE-MIRV-Net (مجموعة سكنية واع للسياق باستخدام شبكة MobileNetV2 وInceptionV3 وResNet101 وVGG16) هو إطار عمل DL قائم على التكديس يهدف إلى تحسين تقدير الميزات المعمارية بناء على صور مخطط الطوابق السكنية. تجمع هذه البنية بين شبكات CNN غير المتجانسة المختلفة من خلال استغلال مزاياها التآزرية في استخراج الميزات. يعتمد النموذج المقترح على مزيج من العمارة الخفيفة والعميقة والمتعددة المقاييس التي تعزز الأداء التنبؤي وتوفر متانة في مجموعة واسعة من التصاميم السكنية. على عكس التقنيات التقليدية القائمة على نموذج واحد، تتبع CARE-MIRV-Net نهج التعلم الهرمي، حيث توفر النماذج الأساسية تنبؤات أولية، ثم يتم تحسينها بواسطة المتعلم الفوقي.
عندما يتعلق الأمر بتصميم سكني يركز على المكانية والصحة، فإن التفسير الصحيح لتخطيطات الطوابق هو في غاية الأهمية. تميل نماذج DL الفردية إلى أن تكون غير كافية في تعميم أنماط معمارية مختلفة. سيتغلب الإطار المقترح على هذه الضعف باستخدام أربع بنى مختلفة: MobileNetV2، InceptionV3، ResNet101، وVGG16، والتي تقدم قدرات تمثيلية مختلفة خاصة بها. يمكن استخدام MobileNetV2 لاستخراج الميزات بكفاءة وهو خفيف الوزن؛ يتعلم InceptionV3 الأنماط المكانية عبر عدة مقاييس؛ يتعلم ResNet101 تمثيلات هرمية عميقة؛ ويتعلم VGG16 الميزات بشكل مستمر وموثوق. يسهل الجمع بين هذه النماذج الإطار لاحتضان كل من السمات المكانية المحلية والعالمية، مما يعزز دقة وموثوقية الميزات المتوقعة مثل المساحة المربعة، وعدد غرف النوم، والحمامات، والكراجات. يمكن أيضا استخدام التوقعات السابقة للتنبؤ بتصنيف إضافي لتخطيطات السكن لتشمل المناسبات لكبار السن، والمتكاملة مع الرعاية الصحية، والسكنية العامة.
يتم تنفيذ CARE-MIRV-Net باستخدام استراتيجية جماعية تعتمد على التكديس من مرحلتين. في المرحلة الأولى، تولد النماذج الأساسية الأربعة بشكل مستقل تنبؤات للمتغيرات المستهدفة. تم توليد مدخلات المتعلمين الفوقيين عن طريق ربط مخرجات التنبؤ التي أنتجتها النماذج الأساسية المدربة على بيانات التدريب. شكلت هذه التنبؤات المتراكمة المتجهات الميتا ذات الستة عشر بعدا المستخدمة في تدريب النموذج الفوقي. تم منع تسرب المعلومات من خلال الفصل الصارم بين مجموعات بيانات التدريب والاختبار، ولم تستخدم أي عينات اختبار خلال تدريب النموذج الأساسي أو النموذج الفوقي. تم استخدام نفس مجموعات بيانات التدريب والتحقق المستخدمة للنماذج الأساسية أثناء عملية التكديس. خلال كل من التدريب والاستنتاج، تم بناء متجه الميزات-ميزات الستة عشر بعد عن طريق دمج مخرجات التنبؤ الأربعة التي تولدها MobileNetV2 وInceptionV3 وResNet101 وVGG16. وبما أن كل نموذج يولد متجه إخراج رباعي الأبعاد، فإن التمثيل المتسلسل ينتج مدخلا 16 بعدا للمتعلم الفوقي. يجمع هذا التحويل بين التنبؤات من جميع النماذج الأساسية ويعمل كمدخل للمرحلة الثانية من الإطار. المرحلة الثانية تتضمن بناء متعلم ميتا لشبكة عصبية متصلة بالكامل لتعلم التركيبة المثلى من توقعات النموذج الأساسي. تكون المتعلم الفوقي من طبقات متصلة بالكامل تحتوي على 512 و256 عصبوية، وتنشيط ReLU، وتطبيع دفعاتي، ومعدلات انقطاع 0.4 و0.3، وطبقة إخراج خطية مكونة من أربعة عصبونات. تم تطبيق طبقات الانزلاق بمعدلات 0.4 و0.3 بعد الطبقات الكثيفة لتقليل الإفراط في التركيب وتحسين التعميم. تم تدريب النموذج الفوقي باستخدام محسن آدم بمعدل تعلم 0.0001، وحجم دفعة 32، وحتى 15 حقبة مع توقف مبكر وتقليل معدل التعلم التكيفي. تم استخدام بيانات التحقق لمراقبة أداء النموذج أثناء التدريب ولاختيار النموذج الأعلى أداء. بعد التدريب، أنتج نموذج الميتا-أنسامبل توقعات نهائية من خلال دمج مخرجات جميع المتعلمين الأساسيين. تم استخدام MAE وR2 لتقييم أداء CARE-MIRV-Net. للتنبؤ بالمخرجات المتعددة، تم حساب MAE و R2 عن طريق مقارنة القيم المتوقعة والفعلية لكل متغير مستهدف ثم حساب المتوسط بين النتائج عبر جميع المخرجات. تم الحصول على النتائج من تجربة واحدة باستخدام بذرة عشوائية ثابتة. يحسن الإطار المقترح القدرة التنبؤية من خلال دمج عدة هياكل DL عبر آلية تكديس وتوفير تحليل قابل للتفسير لمخططات الطوابق السكنية. وهذا يجعل CARE-MIRV-Net قابلا للتطبيق في سياق تصميم سكني يركز على كبار السن ويشمل الرعاية الصحية. يتم توفير الشيفرة المصدرية، ومعلومات تكوين البيئة، ومواصفات اعتماد البرمجيات، وتوثيق التنفيذ في الملف التكميلي 1.
تقييم الأداء
يتم إجراء تحليل الأداء للإطار المقترح لتحديد قوته التنبؤية، ومتانته، وأداء التعميم عبر خصائص معمارية مختلفة. تجرى تحليلات كمية ونوعية لتأكيد فائدة النموذج المقترح. يتضمن إجراء التقييم كل من مقاييس الانحدار القياسية وبيئات تجريبية مضبوطة لتمكين المقارنة العادلة مع النماذج الأساسية. أجريت التجارب باستخدام تجربة واحدة مع بذرة عشوائية ثابتة لضمان قابلية التكرار والاتساق عبر جميع النماذج المعيارية والمقترحة.
معايير الأداء:
يستخدم مقياسان معروفان للانحدار، MAE وR2، لتقييم أداء الإطار المقترح. يقيس MAE متوسط مقدار أخطاء التنبؤ ويوفر مؤشرا واضحا على القرب بين القيم المتوقعة والقيم الفعلية. وعلى العكس، تستخدم قيمة R2 لتقييم نسبة التباين في المتغيرات المستهدفة التي يفسرها النموذج، مما يعكس قوته التنبؤية الإجمالية. يوفر مزيج من هذه المقاييس تقييما شاملا لدقة وأداء التعميم لجميع الميزات المعمارية المتوقعة. للتنبؤ بالمخرجات المتعددة، تم حساب MAE و R2 عن طريق مقارنة القيم المتوقعة والفعلية لكل متغير مستهدف ثم حساب المتوسط بين النتائج عبر جميع المخرجات.
إعداد تجريبي:
أجريت التجارب في بيئة حوسبة سحابية باستخدام بايثون (الإصدار 3.12.12). تم تنفيذ البروتوكول المقترح باستخدام TensorFlow (الإصدار 2.19.0)، Keras (الإصدار 3.13.2)، NumPy (الإصدار 2.4.6)، Pandas (الإصدار 2.3.3)، Scikit-learn (الإصدار 1.6.1)، Matplotlib (الإصدار 3.9)، وSHAP (الإصدار 0.51.0). استخدمت البيئة الحاسوبية معالج Intel Xeon يعمل بسرعة 2.20 جيجاهرتز مع ذاكرة نظام تقارب 31 جيجابايت. أجريت التجارب على نظام تشغيل أوبونتو 22.04 LTS باستخدام معالجات NVIDIA Tesla T4 × 2 GPU. تحتوي مجموعة البيانات على 2,640 صورة لمخطط الطوابق السكنية تم معالجتها مسبقا وتقسيمها إلى مجموعات بيانات تدريب واختبار. تم تقسيم مجموعة البيانات باستخدام نسبة تقسيم 80:20، مما أدى إلى 2,112 عينة تدريب و528 عينة اختبار. MobileNetV2 وInceptionV3 وResNet101 وVGG16 هي أربعة نماذج DL تم تدريبها باستخدام نهج الضبط الدقيق مع التعلم التحويلي. ثم تم بناء نموذج ميتا-أنسامبل قائم على التكديس، CARE-MIRV-Net، لدمج التنبؤات من هذه النماذج الأساسية. تم تدريب كل نموذج تحت ظروف موحدة، بما في ذلك تغيير حجم الصورة إلى 224 × 224 بكسل، وزيادة البيانات، والتوقف المبكر لتقليل الإفراط في التركيب. شملت زيادة البيانات التقليب العشوائي، والدوران، والتكبير، وتغيير الوزن. تم استخدام حجم دفعة 32 وحد أقصى 15 فترة تدريب، مع التوقف المبكر بناء على فقدان التحقق وتقليل معدل التعلم التكيفي. تم إجراء التحليل النهائي على مجموعة اختبارات مخفية لتقديم تقييم غير متحيز وموثوق للأداء. تم إنشاء مجموعة الاختبار المخفية أثناء تقسيم مجموعة البيانات الأولي وظلت معزولة تماما طوال تدريب وتطوير النموذج لضمان تقييم أداء غير متحيز.
وصف مجموعة البيانات:
مجموعة البيانات المستخدمة لدعم نتائج هذه الدراسة متاحة للجمهور على منصة كاجل تحت عنوان "صور مخطط الطابق وتفاصيلها"28. مجموعة البيانات متاحة على: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (تم الوصول إليه في 16 أبريل 2026). تتكون البيانات من 2,640 صورة مخطط للطابق السكني وبيانات وصفية معمارية منظمة. كل عينة هي خطة سكن مميزة، توفر مجموعة واسعة من التصاميم السكنية بأحجام وتكوينات وترتيبات مكانية مختلفة. حجم مجموعة البيانات كاف للتدريب القائم على التعلم ويحتوي على أنماط معمارية متنوعة. تتكون مجموعة البيانات من صورة مخطط طابق ثنائي الأبعاد وسمات رقمية ذات صلة تصف الخصائص الهيكلية للمقر. تشمل هذه الميزات المساحة الإجمالية، وعدد غرف النوم، وعدد الحمامات، وعدد الكراجات. علاوة على ذلك، يحتوي كل سجل على مسار صورة، مما يسمح بتعيين مباشر للمدخلات البصرية إلى التسميات. تشمل متغيرات مجموعة البيانات صورة مخطط الطابق، مسار الصورة، المساحة المربعة، عدد غرف النوم، عدد الحمامات، وعدد الكراجات. تعمل صورة مخطط الطابق كميزة إدخال، بينما تستخدم السمات المعمارية كأهداف توقع. لذلك، فإن مجموعة البيانات مناسبة للتعلم تحت الإشراف، حيث تستخدم الصور كميزات إدخال وخصائص معمارية كأهداف انحدار.
تحتوي مجموعة البيانات على مجموعة واسعة من التصاميم السكنية، تتراوح بين التصاميم المدمجة ذات الغرف المنخفضة إلى التصاميم متعددة الغرف الكبيرة. تمكن هذه التغيرات من تعلم تمثيلات مكانية ذات معنى، بما في ذلك توزيع الغرف، كثافة التخطيط، وتعقيد الهيكل. يعد هذا التنوع مهما بشكل خاص للإطار المقترح، حيث يدعم تصنيف مخططات الطوابق إلى مخططات تناسب كبار السن، ومتكاملة مع الرعاية الصحية، وتخطيطات سكنية عامة. قبل تدريب النموذج، تتم معالجة مجموعة البيانات من خلال سلسلة من إجراءات المعالجة المسبقة لضمان الاتساق والتوافق مع نماذج التعلم المنخفض. تم تغيير حجم جميع الصور إلى 224 × 224 بكسل وتم تطبيعه إلى النطاق [0, 1] قبل التدريب. ثم يتم تنظيم مجموعة البيانات من خلال مطابقة مسارات الصور مع البيانات الوصفية المقابلة لها، ثم يتم تقسيمها إلى مجموعات تدريب واختبار لتسهيل تحليل الأداء. تم تقسيم مجموعة البيانات عشوائيا إلى مجموعات تدريب واختبار باستخدام نسبة تقسيم 80:20. تم تضمين السجلات التي تحتوي على معلومات كاملة عن الصور والبيانات الوصفية في التحليل، بينما تم استبعاد السجلات غير المكتملة أو غير الصالحة. تم استخدام بذرة عشوائية ثابتة أثناء تقسيم مجموعات البيانات لضمان قابلية التكرار. توفر مجموعة البيانات أساسا مفصلا لتحليل مخططات الطوابق السكنية المدعوم بالذكاء الاصطناعي. يدعم الجمع بين 2,640 صورة مشروحة وسمات معمارية متنوعة نمذجة الانحدار متعدد المخرجات ويتيح دمج الذكاء المكاني مع اتخاذ قرارات تصميم السكن الموجه للرعاية الصحية.