В этом исследовании использовался общедоступный набор данных с платформы Kaggle (Изображения планировок этажей и их детали, доступны по адресу: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; дата обращения: 16 апреля 2026 года). В ней не были задействованы человеческие участники, животные или лично идентифицируемые данные; поэтому этическое одобрение и информированное согласие не требовались.
Этот протокол представляет собой рамки на базе искусственного интеллекта для автоматизированного анализа изображений планов жилых домов с акцентом на пространственную и ориентированную на здравоохранение проектирование. Полный экспериментальный рабочий процесс представлен на рисунке 1. Протокол разработан для преодоления разрыва между низкоуровневым прогнозированием архитектурных особенностей и высокоуровневым прикладным принятием решений. Он интегрирует DL, ансамблевое моделирование и объяснимый ИИ, обеспечивая точное, надёжное и интерпретируемое решение для анализа планировок жилых домов. Фреймворк состоит из нескольких этапов: начинается с сбора и предварительной обработки данных, затем обучение признакам с использованием глубоких CNN, мета-ансамблевое предсказание и, наконец, классификация на уровне приложения. Изначально изображения планировки этажей и соответствующие им архитектурные характеристики предварительно обрабатываются через изменение размера, нормализацию и дополнение данных для обеспечения согласованности и улучшения обобщения. Все изображения на плане этажей были изменены до 224 × 224 пикселей и нормализованы до диапазона [0, 1]. Дополнение данных применялось во время обучения с использованием случайного горизонтального переворота, вращения, масштабирования и смещения ширины/высоты для улучшения обобщения модели и снижения перенагона. Вертикальное переворот не применялось. Полные параметры дополнения и детали реализации приведены в дополнительном файле 1. Обработанные данные затем использовались для обучения нескольких моделей DL для извлечения и прогнозирования признаков. Все базовые модели и мета-обучающийся CARE-MIRV-Net были обучены с использованием согласованной конфигурации, включая дополнение данных, раннюю остановку и адаптивное планирование по скорости обучения. Раннее прекращение контролировало потерю валидации (val_loss) с показателем терпения 5 эпох, а лучшие веса модели восстанавливались автоматически после тренировки. Адаптивное планирование по скорости обучения было реализовано с помощью callback ReduceLROnPlateau, который отслеживал потерю валидации и снижал скорость обучения в 0,3 раза после двух эпох без улучшения, при минимальной скорости обучения 1 × 10⁻7. Полные детали реализации и настройки параметров приведены в Дополнительном файле 1. Набор данных был случайным образом разделён на обучающие и тестовые наборы с использованием соотношения 80:20. Для обеспечения воспроизводимости использовалась фиксированная случайная семя (42). Полная информация о реализации приведена в Дополнительном файле 1.

Рисунок 1. Рабочий процесс фреймворка CARE-MIRV-Net для анализа планировки жилых домов . Схематический обзор предлагаемого протокола. Рабочий процесс включает (1) сбор и предобработку наборов данных, (2) обучение и прогнозирование функций с использованием MobileNetV2, InceptionV3, ResNet101 и VGG16, (3) мета-ансамблевое прогнозирование на основе стекинга с использованием CARE-MIRV-Net, (4) классификацию расположения жилых домов на основе правил, (5) анализ интерпретируемости на основе SHapley Additive exPlanations (SHAP) и (6) оценку производительности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
На втором этапе используются четыре предварительно обученных CNN — MobileNetV2, InceptionV3, ResNet101 и VGG16 — в качестве базовых учащихся. Каждая модель тонко настраивается с помощью трансферного обучения для прогнозирования ключевых архитектурных характеристик, включая площадь, количество спален, ванных комнат и гаражей. Для каждой модели трансферного обучения нижние предварительно обученные слои оставались замороженными, а верхние слои и кастомная регрессионная головка были тонко настраиваны во время обучения. Подробные конфигурации тонкой настройки, специфичные для моделей, приведены в Дополнительном файле 1. Эти модели отражают различные аспекты пространственной информации: MobileNetV2 обеспечивает эффективное извлечение признаков, InceptionV3 фиксирует многомасштабные пространственные паттерны, ResNet101 изучает глубокие иерархические представления, а VGG16 обеспечивает стабильное и последовательное обучение признакам. Разнообразие этих моделей повышает общую репрезентационную способность фреймворка.
Для дальнейшего повышения точности и надёжности прогнозирования предлагается мета-ансамблевая модель на основе стекинга, обозначенная как CARE-MIRV-Net. На этом этапе предсказания всех базовых моделей объединяются для создания пространства признаков с более высокой размерностью, которое входит мета-обучающемуся. Прогнозы базовой модели сначала генерируются независимо с использованием обученных моделей MobileNetV2, InceptionV3, ResNet101 и VGG16. Эти предсказания затем объединяются в мета-вектор признаков, используемый мета-обучающимся. Чтобы предотвратить утечку данных, наборы данных для обучения и тестирования строго разделены, и мета-обучающийся обучается только на основе прогнозов, полученных на основе обучающих данных. Мета-модель, являющаяся полностью связанной нейронной сетью, обучена изучать оптимальное сочетание выходов базовой модели для получения уточнённых предсказаний. Метамодель состоит из двух полностью связанных слоёв с 512 и 256 нейронами с активацией ReLU, за которыми следуют слои dropout (0,4 и 0,3) и линейный выходной слой. Модель обучается с использованием оптимизатора Адама (скорость обучения = 0,0001), размер партии 32 и до 15 эпох. Ранняя остановка осуществлялась с помощью мониторинга потери валидации (val_loss) с терпением 5 эпох. Минимальный критерий улучшения (min_delta) был установлен на 0 по умолчанию в TensorFlow, а лучшие веса модели восстанавливались автоматически после обучения. Адаптивное планирование по скорости обучения было реализовано с использованием callback ReduceLROnPlateau, который отслеживал потерю валидации и снижал скорость обучения в 0,3 раза после двух последовательных эпох без улучшения. Минимальная скорость обучения была установлена на 1 × 10⁻7, а параметр перезарядки использовал стандартное значение TensorFlow 0. Этот ансамблевой метод снижает искажения отдельных моделей и улучшает обобщение за счёт взаимодополняющих сильных сторон нескольких архитектур. Подробная информация о реализации приведена в Дополнительном файле 1.
После прогнозирования добавляется слой интерпретации для преобразования числовых выходов в решения на уровне применения. Планировки жилых домов можно разделить на три класса на основе прогнозов архитектурных особенностей: для пожилых, интегрированное с медицинским обслуживанием (медицинское обслуживание) и общее жилое использование. Эта классификация проводится с использованием заранее определённых пороговых правил принятия решений, основанных на прогнозируемой площади, числе спален и количества ванных комнат. Категория с наивысшим баллом присваивается в качестве финальной классификации, тогда как ничьи решаются выбором категории, удовлетворяющей большему числу критериев решения. Полные правила подсчёта очков и пороги классификации приведены в Дополнительном файле 2 (Алгоритм 1). Это действие позволяет структуре предоставлять практическую информацию для проектирования жилого жилья.
Фреймворк использует объяснимый ИИ с SHAP для обеспечения прозрачности и интерпретируемости. Этот компонент анализирует вклад предсказаний из каждой базовой модели в результат мета-модели. Анализ SHAP проводился с использованием SHAP KernelExplainer (SHAP версии 0.51.0) с 100 случайно выбранными обучающими выборками в качестве фонового набора данных и 50 тестовыми образцами для генерации объяснений. Полная конфигурация SHAP, включая выбор фонового образца и настройки реализации, представлена в дополнительном файле 1. Слой объяснимости помогает понять процесс принятия решений, измеряя важность признаков и отображая закономерности вклада, тем самым повышая прозрачность и надёжность моделей. Предлагаемая структура оценивается с использованием MAE иR 2 по всем целевых переменным. Для многорезультатного прогнозирования MAE вычислялась как средняя абсолютная разница между фактическими и предсказанными значениями по всем целевой переменной, тогда какR 2 рассчитывалась путём сравнения объяснённой дисперсии предсказаний с соответствующими значениями правдивости для каждого выхода. Количественные и качественные анализы показывают, что предлагаемый CARE-MIRV-Net повышает точность прогнозирования и поддерживает классификацию жилых домов на основе правил. Надёжность классификации оценивалась на основе точности базовых регрессионных прогнозов и согласованности слоя принятия решений на основе правил. Эта структура является подходящим и масштабируемым решением для интеллектуального анализа планировки этажей и может применяться к умному жилью, планированию ухода за пожилыми людьми и ориентированному на здравоохранение жилых домов. Полный список наборов данных, программных пакетов, библиотек, аппаратных ресурсов и вычислительных инструментов, использованных в данном исследовании, приведён в Таблице материалов. Исходный код, информация о конфигурации среды, спецификации программных зависимости и скрипты реализации, необходимые для воспроизведения отчетного рабочего процесса, приведены в Дополнительном файле 1.
Алгоритм протокола
Предлагаемая структура использует многоступенчатый подход к обработке планов этажей жилых домов на основе изображений и получения прогнозных и результатов на уровне принятия решений, как показано в Алгоритме 1 в Дополнительном файле 2. Этот процесс начинается с предварительной обработки данных, при которой входные изображения изменяются до стандартного разрешения и нормализуются для обеспечения равномерности по всему набору данных. Все изображения на плане этажей были изменены до 224 × 224 пикселей и нормализованы до диапазона [0, 1]. Этот этап оптимизирует изображения для обучения с помощью глубоких нейронных сетей и улучшает общую сходимость моделей. Второй этап включает использование нескольких моделей DL в качестве базовых обучающихся, включая MobileNetV2, InceptionV3, ResNet101 и VGG16. Каждая модель отдельно берет входные изображения и оценивает важные архитектурные особенности, такие как площадь и количество спален, ванных комнат и гаражей. Набор данных был случайным образом разделён на обучающие и тестовые наборы с использованием соотношения 80:20, при этом использовался фиксированный случайный сид для обеспечения воспроизводимости. Эти модели отражают различные пространственные свойства планировок и предоставляют дополняющие прогнозы. Представление признаков затем строится путём сложения выходов каждой базовой модели для создания единого представления признаков. Этот совместный выход впоследствии подаётся в мета-ансамблевую модель CARE-MIRV-Net, которая обучается объединять предсказания всех базовых моделей. Прогнозы базовой модели генерировались независимо и объединялись для формирования мета-вектора. Утечка данных была предотвращена за счёт строгого разделения наборов данных для обучения и тестирования. Метамодель уточняет эти прогнозы и формирует итоговые прогнозы архитектурных атрибутов. Метамодель состояла из полностью связанных слоёв с 512 и 256 нейронами, функций активации ReLU, частот выбывания 0,4 и 0,3, оптимизатора Адама (скорость обучения = 0,0001), размера партии 32 и до 15 эпох обучения с ранней остановкой. После прогнозирования используется слой принятия решений для контекстуализации результатов. Согласно оценочным значениям, каждая жилая планировка классифицируется как уход за пожилыми, медицинский уход или общее жилое использование. Жилые категории присваивались с использованием заранее заданных пороговых правил оценки оценок, основанных на прогнозируемых характеристиках планировки этажей. Категория с наивысшим баллом была выбрана в качестве финальной классификации. Полные пороги классификации и правила принятия решений приведены в Алгоритме 1 (Дополнительный файл 2). Наконец, фреймворк включает компонент объяснимости на основе SHAP для оценки влияния каждой базовой модели на итоговое предсказание. Анализ SHAP был проведён как описано ранее и в дополнительном файле 1. Этот компонент повышает прозрачность и помогает понять процесс принятия решений. Эффективность и жизнеспособность предлагаемого подхода оценивались с помощью стандартных показателей регрессионной эффективности. Производительность оценивалась с помощью одного экспериментального запуска с фиксированным случайным заседом.
Модели оценки
В этом разделе представлены модели DL, использованные в исследовании, включая как отдельные базовые модели, так и предлагаемую CARE-MIRV-Net. Эталонные модели были выбраны для представления разнообразных и широко применяемых архитектур DL. MobileNetV2 была включена как лёгкая и вычислительная эффективная сеть, а InceptionV3 была выбрана за способность захватывать многомасштабные пространственные особенности. ResNet101 был выбран благодаря глубокой возможности остаточного обучения для иерархического извлечения признаков, а VGG16 был включён как хорошо зарекомендовавшая себя сверточная архитектура. Все эталонные модели были обучены с использованием идентичных процедур предварительной обработки, настроек дополнения данных, разделов наборов данных, параметров оптимизации, размера пакета и конфигурации обучения для обеспечения справедливой сравнительной оценки.
MobileNetV2:
MobileNetV2 — это небольшая и компактная CNN-система, спроектированная для быстрой, высокопроизводительной работы и меньшей вычислительной сложности. В ней представлены некоторые из основных инноваций, таких как инвертированные остаточные соединения и линейные узкие места, которые обеспечивают эффективное извлечение признаков и при этом обладают высокой репрезентационной силой. MobileNetV2 может использовать глубинно разделяемые свёртки для значительного минимизации общего количества параметров и вычислительных затрат традиционных сверточных сетей, что хорошо адаптируется для больших задач обучения на основе изображений.
MobileNetV2 используется в предлагаемой структуре как одна из базовых моделей DL для прогнозирования архитектурных характеристик изображений планировок жилых домов. Модель способна эффективно изучать пространственные закономерности, такие как распределение помещений, плотность планировки и структурная организация, встречающиеся в планировках этажей. Такие приобретённые представления играют важную роль в точной оценке таких важных объектов, как площадь квадратных метров, количество спален, ванных комнат и гаражей. MobileNetV2 — это лёгкая модель, которая хорошо подходит для включения в предлагаемый фреймворк мета-ансамбля. Он добавляет некоторые дополняющие представления признаков к другим моделям DL и повышает общую надёжность и обобщение системы. Это обучение моделей очень важно для повышения точности прогнозов и для помощи в классификации жилых проектов на основе здравоохранения.
Модель MobileNetV2 обучается с использованием стратегии трансферного обучения с предварительно обученными весами из набора данных ImageNet. Входные изображения масштабируются до фиксированного размера 224 × 224 × 3, что совместимо с архитектурой. Изображения были изменены до 224 × 224 пикселей, нормализованы до диапазона [0, 1] и дополнены с помощью случайного переворота, вращения, масштабирования и смещения. Во время обучения использовалась партия из 32 экземпляров. Начальная головка классификации MobileNetV2 была удалена и заменена регрессионной головкой. Регрессионная головка состояла из слоя глобального среднего пулирования, за которым следовали полностью связанные слои с 512 и 256 нейронами, пакетная нормализация, слои выпадения (0,4 и 0,3) и линейный выходной слой из четырёх нейронов. Для облегчения адаптации доменов нижние предварительно обученные слои были заморожены, тогда как верхние слои, начинающиеся с block_13_expand, и кастомная регрессионная головка были тонко настроены. Такой подход к селективному обучению позволяет модели сохранять общие визуальные особенности, одновременно изучая специфические пространственные атрибуты изображений планировки этажей. Извлеченные карты признаков обрабатываются через слой глобального среднего пула и полностью связанные слои с нейронами 512 и 256 с помощью активации ReLU. Для улучшения обобщения и снижения перенагонки используются слои пакетной нормализации и выпадения (0.4 и 0.3). Последний выходной слой содержит четыре нейрона с линейной активацией, соответствующей предсказанным архитектурным атрибутам. Оптимизатор Адама использовался с скоростью обучения 0,0001 и стандартными параметрами TensorFlow/Keras (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = ложь). Для многорезультатного прогнозирования MAE иR2 вычислялись путём сравнения предсказанных и фактических значений для каждой целевой переменной и усреднения результатов по всем выходным данным. Ранняя остановка применялась на основе потери валидации, а адаптивное снижение скорости обучения применялось для улучшения сходимости. Обучение проводилось до 15 эпох.
InceptionV3:
InceptionV3 — это глубокая архитектура CNN, способная фиксировать многомасштабные характеристики с помощью параллельных сверточных операций. Он основан на модуле Inception, который использует различные размеры фильтров в одном слое для одновременного извлечения как мелкозернистых, так и грубых элементов. Такой тип архитектурного проектирования позволяет сети изучать сложные пространственные иерархии и быть вычислительно эффективной. Кроме того, InceptionV3 использует факторизированные свёртки и уменьшение размерности, которые повышают производительность и минимизируют вычислительные затраты.
InceptionV3 применяется в предлагаемой структуре как эффективный экстрактор признаков для анализа изображений планировок жилых домов. Планировки этажей состоят из различных пространственных паттернов, таких как размеры помещений, структурные планы и связность, что требует многомасштабного обучения признакам. Архитектура Inception особенно лучше подходит для этой задачи, поскольку способна одновременно представлять локальные особенности (например, небольшие комнаты) и глобальные структуры (например, организацию общей планировки). InceptionV3 предоставляет дополняющие представления к другим моделям, таким как MobileNetV2, в контексте мета-ансамблевой структуры. Разнообразие прогнозов увеличивается благодаря способности моделировать сложные пространственные связи, что важно для повышения эффективности ансамбля. Это в конечном итоге помогает лучше прогнозировать архитектурные особенности и укрепляет дальнейшую классификацию жилищного дизайна, ориентированного на пожилых людей и интегрированного с медицинским страхованием.
Модель InceptionV3 обучается с использованием подхода трансферного обучения с предобученными весами из набора данных ImageNet. Входные изображения масштабируются до 224 × 224 × 3 для обеспечения совместимости с сетевой архитектурой и согласованности всех моделей внутри фреймворка. Изображения были изменены до 224 × 224 пикселей, нормализованы до диапазона [0, 1] и дополнены с помощью случайного переворота, вращения, масштабирования и смещения. Во время обучения использовалась партия из 32 экземпляров.
Исходные слои классификации InceptionV3 удалены, а также добавлена собственная регрессионная головка для многовыходного прогнозирования. Кастомная регрессионная головка состояла из слоя глобального среднего пулирования, за которым следовали полностью связанные слои с 512 и 256 нейронами, пакетная нормализация, слои выпадения (0,4 и 0,3) и линейный выходной слой из четырёх нейронов. Сверточная основа частично тонко настроена: нижние предварительно обученные слои заморожены, а верхние слои вместе с кастомной регрессионной головкой — тонко настроены для изучения специфических элементов планировки, сохраняя общие визуальные представления, полученные во время предварительного обучения. После сверточной основы слой глобального среднего пула преобразует карты признаков в компактное представление признаков. За ним следуют полностью связанные слои, содержащие 512 и 256 нейронов с функциями активации ReLU. Для минимизации переподгонки и улучшения обобщения применяются частоты выбывания 0,4 и 0,3. Последний выходной слой состоит из четырёх нейронов с линейной активацией, соответствующей прогнозированию площади квадратных метров, количества спален, количества ванных комнат и количества гаражей. Модель обучена с использованием оптимизатора Адама с скоростью обучения 0,0001, размером партии 32 и до 15 эпох обучения с ранним остановкой и адаптивным снижением скорости обучения для обеспечения стабильной сходимости.
ResNet101:
ResNet101 — это глубокая структура CNN, построенная на принципе остаточного обучения, которая позволяет обучать чрезвычайно глубокие сети, преодолевая задачу нулевого градиента. Он добавляет остаточные соединения, или так называемые пропускные соединения, которые позволяют сети изучать идентификационные отображения и сохранять информацию на разных уровнях. Эта архитектура значительно повышает стабильность обучения и позволяет модели изучать сложные иерархические характеристики. ResNet101 обладает глубоким репрезентативным потенциалом в 101 слой и, следовательно, очень эффективен в задачах, требующих дополнительных пространственных признаков.
ResNet101 будет использоваться в предлагаемой структуре как экстрактор с высокой ёмкостью, который будет анализировать изображения планировок жилых домов. Модель может использоваться для представления сложных пространственных отношений, включая связность помещений, сложность планировки и структурные вариации, благодаря глубокой архитектуре. Эти особенности критически важны для точного прогнозирования архитектурных объектов, таких как площадь квадратных метров, спальни, ванные комнаты и гаражи. В мета-ансамблевом дизайне ResNet101 является важным компонентом и предоставляет глубокие и абстрактные представления признаков. ResNet101 больше ориентирован на детализированные структурные особенности и, следовательно, более разнообразен среди базовых обучающихся по сравнению с легкими моделями, такими как MobileNetV2. Эта гетерогенность играет важную роль в улучшении эффективности ансамбля и надёжных прогнозов, особенно при медицинской классификации жилых домов.
ResNet101 обучается с использованием метода трансферного обучения с предобученными весами из набора данных ImageNet. Входные изображения масштабируются до 224 × 224 × 3, что обеспечивает архитектурную совместимость и согласованность между всеми моделями внутри фреймворка. Изображения были изменены до 224 × 224 пикселей, нормализованы до диапазона [0, 1] и дополнены с помощью случайного переворота, вращения, масштабирования и смещения. Во время обучения использовалась партия из 32 экземпляров. Исходная головка классификации ResNet101 удалена (include_top=Ложь), а также добавлена собственная регрессионная головка для многовыходного прогнозирования. Регрессионная головка состояла из слоя глобального среднего пулирования, за которым следовали полностью связанные слои с 512 и 256 нейронами, пакетная нормализация, слои выпадения (0,4 и 0,3) и линейный выходной слой из четырёх нейронов. Для баланса между повторным использованием функций и адаптацией домена нижние предварительно обученные слои были заморажены, тогда как более глубокие слои, начинающиеся с conv4_block1_1_conv и кастомная регрессионная головка были тонко настроены. Такая селективная стратегия обучения позволяет модели сохранять общие визуальные черты, адаптируя более высокоуровневые изображения к изображениям планировок. Выход сверточной базы проходит через слой глобального среднего пула для генерации компактного представления признаков. За этим следуют полностью связанные слои с нейронами 512 и 256 с использованием функций активации ReLU. Пакетная нормализация применяется для стабилизации обучения, а также добавлены слои dropout с частотами 0,4 и 0,3 для снижения перенагона и улучшения обобщения. Последний выходной слой содержит четыре нейрона с линейной активацией, соответствующей площади квадратных футов, количеству спален, ванных комнат и гаражей. Оптимизатор Адама использовался с скоростью обучения 0,0001, как описано в обучающей конфигурации. Дополнение данных включало случайное переворачивание, вращение, масштабирование и сдвиг для улучшения обобщения моделей. Обучение проводилось до 15 эпох с ранней остановкой на основе потери валидации и снижения адаптивной скорости обучения.
VGG16:
VGG16 — это простая архитектура нейронных сетей глубокого сверточного типа, эффективная и простая в задачах визуального распознавания. Он состоит из 16 слоёв с регулярной или однородной конструкцией, включающей небольшие 3 × 3 сверточных фильтра, которые облегчают изучение иерархических представлений признаков сетью. Архитектура ориентирована на глубину и упрощённа, что позволяет фиксировать низкоуровневые детали, такие как края, текстуры и семантические структуры высокого уровня. VGG16, благодаря своему обычному дизайну и хорошей производительности, сейчас является популярным выбором основной основы при выполнении трансферного обучения в задачах, связанных с изображением.
В предлагаемой модели VGG16 используется как базовая модель DL для получения пространственных признаков изображений планировок жилых домов. Сам факт его организации позволяет ему быть очень полезным для запечатления тонких деталей схем планировки, таких как границы помещений, структурные выравнивания и пространственная организация. Эти особенности критически важны для эффективного прогнозирования архитектурных особенностей, таких как квадратные футы, спальни, ванные комнаты и гаражи. В системе метаансамбля VGG16 обеспечивает стабильные и хорошо обобщённые представления признаков. VGG16 предлагает более сбалансированный подход к извлечению признаков по сравнению с более глубокими архитектурами, такими как ResNet101, и мультимасштабными архитектурами, такими как InceptionV3, что увеличивает разнообразие базовых обучающихся. Эта гетерогенность критически важна для повышения эффективности ансамбля и надежных прогнозов по ориентированной на здравоохранение жилых домов.
Модель VGG16 обучается с использованием подхода трансферного обучения с предобученными весами из набора данных ImageNet. Входные изображения масштабируются до 224 × 224 × 3 для обеспечения совместимости с архитектурой и согласованности между всеми моделями внутри фреймворка. Изображения были изменены до 224 × 224 пикселей, нормализованы до диапазона [0, 1] и дополнены с помощью случайного переворота, вращения, масштабирования и смещения. Во время обучения использовалась партия из 32 экземпляров. Исходные слои классификации удалены (include_top=Ложно), а также добавлена собственная регрессионная головка для адаптации модели для многовыходного прогнозирования. Регрессионная головка состояла из слоя глобального среднего пулирования, за которым следовали полностью связанные слои с 512 и 256 нейронами, пакетная нормализация, слои выпадения (0,4 и 0,3) и линейный выходной слой из четырёх нейронов. Нижние предварительно обученные слои были заморожены, тогда как слои, начинающиеся с block4_conv1, и кастомная регрессионная головка были тонко настроены. Эта стратегия позволяет модели сохранять общие визуальные характеристики, одновременно изучая предметно-специфические представления, релевантные для анализа планировки этажей. Выходные признаки сверточной базы проходят через слой глобального среднего пула для генерации компактного вектора признаков. За этим следуют полностью связанные слои с нейронами 512 и 256 с использованием функций активации ReLU. Пакетные нормировки и слои выпадения с частотами 0,4 и 0,3 включены для стабилизации тренировок, снижения перенагонки и улучшения обобщения. Последний выходной слой содержит четыре нейрона с линейной активацией, соответствующей квадратным метрам, числу спален, ванных комнат и прогнозам гаража. Оптимизатор Адама использовался с скоростью обучения 0,0001, как описано в обучающей конфигурации. Дополнение данных включало случайное переворачивание, вращение, масштабирование и сдвиг для улучшения обобщения моделей. Обучение проводилось до 15 эпох с ранней остановкой на основе потери валидации и снижения адаптивной скорости обучения.
CARE-MIRV-Net (предлагаемая мета-ансамблевая модель DL):
Рекомендуемый CARE-MIRV-Net (Context-Aware Residential Ensemble, использующий MobileNetV2, InceptionV3, ResNet101 и VGG16 Network) — это мета-ансамбль DL-фреймворк на основе стека, направленный на улучшение оценки архитектурных особенностей на основе фотографий планировки жилых помещений. Архитектура объединяет различные гетерогенные CNN, используя их синергетические преимущества при извлечении признаков. Предлагаемая модель основана на сочетании лёгкой, глубокой и многомасштабной архитектуры, что повышает предсказательные характеристики и обеспечивает надёжность в широком спектре жилых планировок. В отличие от традиционных методов на основе одной модели, CARE-MIRV-Net использует иерархический подход к обучению, при котором базовые модели предоставляют начальные прогнозы, которые затем улучшаются мета-учеником.
Когда речь идёт о пространственном и заботящемся о здоровье жилых проектах, правильная интерпретация планировок этажей имеет первостепенное значение. Одиночные модели DL, как правило, недостаточны для обобщения различных архитектурных паттернов. Предлагаемый фреймворк преодолеет этот недостаток, используя четыре различных архитектуры: MobileNetV2, InceptionV3, ResNet101 и VGG16, которые открывают свои собственные возможности представления. MobileNetV2 можно использовать для эффективного извлечения функций и является лёгким; InceptionV3 изучает пространственные паттерны на нескольких уровнях; ResNet101 изучает глубокие иерархические представления; а VGG16 стабильно и надёжно осваивает функции. Сочетание этих моделей позволяет создать структуру для включения как локальных, так и глобальных пространственных характеристик, что повышает точность и надёжность прогнозируемых объектов, таких как площадь квадратных метров, количество спален, ванных комнат и гаражей. Приведённые выше прогнозы также могут быть использованы для дальнейшей классификации жилых районов, включая ориентированные на пожилых, интегрированные с медицинским обслуживанием и общие жилые помещения.
CARE-MIRV-Net реализуется с использованием двухступенчатой стратегии ансамбля на основе стекирования. На первом этапе четыре базовые модели независимо генерируют прогнозы для целевых переменных. Входные данные мета-обучающегося генерировались путём объединения прогнозных результатов, полученных обученными базовыми моделями, с обучающими данными. Эти конкатенированные предсказания образовывали 16-мерные векторы метапризнаков, используемые для обучения метамоделей. Утечка информации предотвращалась строгим разделением наборов данных для обучения и тестирования, и при обучении базовой модели и метамодели не использовались тестовые образцы. Те же наборы данных для обучения и валидации, что использовались для базовых моделей, были использованы в процессе стекирования. В процессе обучения и вывода 16-мерный вектор метапризнаков был построен путём объединения четырёх прогнозных выходов, генерируемых MobileNetV2, InceptionV3, ResNet101 и VGG16. Поскольку каждая модель генерирует четырёхмерный выходной вектор, конкатенированное представление генерирует 16-мерный вход для мета-обучающегося. Это преобразование объединяет предсказания всех базовых моделей и служит входным элементом для второго этапа фреймворка. Второй этап включает создание полностью связанного нейронного сетевого мета-обучающегося для изучения оптимальной комбинации предсказаний базовой модели. Мета-обучающийся состоял из полностью связанных слоёв с 512 и 256 нейронами, активации ReLU, пакетной нормализации, частоты выбывания 0,4 и 0,3, а также линейного выходного слоя из четырёх нейронов. После плотных слоёв наносились слои дропаута с частотами 0,4 и 0,3 для снижения перенасадки и улучшения обобщения. Метамодель была обучена с использованием оптимизатора Адама с скоростью обучения 0,0001, размером партии 32 и до 15 эпох с ранней остановкой и адаптивным снижением скорости обучения. Данные валидации использовались для мониторинга производительности модели во время обучения и выбора самой эффективной модели. После обучения мета-ансамблевая модель генерировала окончательные прогнозы путём объединения результатов всех базовых учащихся. MAE иR 2 использовались для оценки эффективности CARE-MIRV-Net. Для многорезультатного прогнозирования MAE иR2 вычислялись путём сравнения предсказанных и фактических значений для каждой целевой переменной и усреднения результатов по всем выходным данным. Результаты были получены в результате одного экспериментального запуска с фиксированным случайным началом. Предлагаемая структура улучшает предсказательные способности за счёт объединения нескольких структур DL с помощью механизма накладки и предоставления интерпретируемого анализа планировок жилых помещений. Это делает CARE-MIRV-Net применимым в контексте жилого проектирования, ориентированного на гериатрию и здравоохранение. Исходный код, информация о конфигурации среды, спецификации программных зависимостей и документация по реализации приведены в дополнительном файле 1.
Оценка эффективности
Проводится анализ производительности предлагаемой структуры для определения её прогностической способности, прочности и обобщающих характеристик по различным архитектурным характеристикам. Проводятся количественные и качественные анализы для подтверждения полезности предлагаемой модели. Процедура оценки включает как стандартные регрессионные показатели, так и контролируемые экспериментальные среды для справедливого сравнения с базовыми моделями. Эксперименты проводились с использованием одного экспериментального запуска с фиксированным случайным началом для обеспечения воспроизводимости и согласованности во всех эталонных и предлагаемых моделях.
Параметры производительности:
Для оценки эффективности предлагаемой структуры используются два хорошо известных регрессионных показателя — MAE иR2. MAE измеряет среднюю величину ошибок предсказания и предоставляет чёткое представление о близости между предсказанными и фактическими значениями. Напротив, значение R2 используется для оценки доли дисперсии в целевых переменных, объясняемых моделью, отражая её общую прогностическую силу. Сочетание этих метрик обеспечивает всестороннюю оценку точности и обобщения всех предсказанных архитектурных элементов. Для многорезультатного прогнозирования MAE иR2 вычислялись путём сравнения предсказанных и фактических значений для каждой целевой переменной и усреднения результатов по всем выходным данным.
Экспериментальная установка:
Эксперименты проводились в облачной среде с использованием Python (версия 3.12.12). Предлагаемый протокол был реализован с использованием TensorFlow (версия 2.19.0), Keras (версия 3.13.2), NumPy (версия 2.4.6), Pandas (версия 2.3.3), Scikit-learn (версия 1.6.1), Matplotlib (версия 3.9) и SHAP (версия 0.51.0). Вычислительная среда использовала процессор Intel Xeon, работающий на частоте 2,20 ГГц и примерно 31 ГБ системной памяти. Эксперименты проводились на операционной системе Ubuntu 22.04 LTS с использованием NVIDIA Tesla T4 × 2 GPU. Набор данных содержит 2640 изображений планировок жилых домов, которые были предварительно обработаны и разделены на учебные и тестовые наборы данных. Набор данных был разделен с использованием соотношения 80:20, в результате чего получилось 2 112 обучающих и 528 тестовых образцов. MobileNetV2, InceptionV3, ResNet101 и VGG16 — четыре модели DL, обученные с использованием тонкой настройки с использованием трансферного обучения. Затем была построена мета-ансамблевая модель на основе стекинга CARE-MIRV-Net для объединения предсказаний из этих базовых моделей. Каждая модель тренировалась в одинаковых условиях, включая изменение размера изображения до 224 × 224 пикселей, увеличение данных и раннюю остановку для снижения перенагона. Дополнение данных включало случайное переворачивание, вращение, масштабирование и перемещение. Использовался размер партии 32 и максимум 15 эпох обучения, с ранним прекращением работы на основе потери валидации и снижения адаптивной скорости обучения. Окончательный анализ проводился на скрытом тестовом наборе для обеспечения объективной и надёжной оценки производительности. Скрытый тестовый набор генерировался во время первоначального разделения данных и оставался полностью изолированным на протяжении всего обучения и разработки модели, чтобы обеспечить беспривзятую оценку производительности.
Описание набора данных:
Набор данных, использованный для поддержки результатов этого исследования, общедоступен на платформе Kaggle под названием «Изображения планировок этажей и их детали»28. Набор данных доступен по адресу: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (дата обращения: 16 апреля 2026 года). Данные состоят из 2 640 изображений планировок жилых помещений и организованных архитектурных метаданных. Каждый образец представляет собой уникальный жилой план, который предлагает широкий спектр жилых планировок с разными размерами, конфигурациями и пространственными планировками. Размер набора данных достаточно для обучения на основе DL и содержит разнообразные архитектурные паттерны. Набор данных состоит из двухмерного изображения планировки этажа и связанных числовых характеристик, описывающих структурные характеристики жилого дома. К этим характеристикам относятся общая площадь, количество спален, количество ванных комнат и количество гаражей. Кроме того, каждая запись содержит путь изображения, который позволяет напрямую сопоставлять визуальные входы на метки. Переменные набора данных включают изображение плана этажа, путь изображения, площадь площади, количество спален, количество ванных комнат и количество гаражей. Изображение плана этажа служит входной функцией, а архитектурные атрибуты — как цели прогнозирования. Таким образом, набор данных подходит для контролируемого обучения: изображения служат входными элементами, а архитектурные атрибуты — регрессионными целями.
Набор данных содержит широкий спектр жилых планировок — от компактных с меньшим количеством комнат до больших многокомнатных планировок. Эта вариабельность позволяет изучать значимые пространственные представления, включая распределение помещений, плотность планировки и структурную сложность. Это разнообразие особенно важно для предлагаемой структуры, поскольку она поддерживает классификацию планировок этажей на ориентированные на пожилые, интегрированные с медицинским обслуживанием и общие жилые планировки. Перед обучением модели набор данных обрабатывается через последовательность процедур предварительной обработки для обеспечения согласованности и совместимости с моделями DL. Все изображения были изменены до 224 × 224 пикселей и нормализованы до диапазона [0, 1] перед обучением. Затем набор данных организуется путём сопоставления путей изображений с соответствующими метаданными, после чего он делится на учебные и тестовые подмножества для облегчения анализа производительности. Набор данных был случайным образом разделён на обучающие и тестовые наборы с использованием соотношения 80:20. В анализ включались записи, содержащие полную информацию о изображениях и метаданных, тогда как неполные или некорректные записи исключались. Фиксированный случайный seed использовался при разбиении набора данных для обеспечения воспроизводимости. Набор данных предоставляет подробную основу для анализа планировок жилых домов на основе ИИ. Сочетание 2 640 аннотированных изображений и разнообразных архитектурных характеристик поддерживает многовыходное регрессионное моделирование и позволяет интегрировать пространственный интеллект с принятием решений в области жилого проектирования, ориентированного на здравоохранение.