$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Предложенная платформа для автоматизированного прототипирования пользовательских интерфейсов (UI) была оценена с использованием интегрированного набора данных, состоящего из 5 128 экранов UI из трех источников: 4 000 изображений RICO, 1 000 экранов ENRICO и 128 образцов UI с цветовой аннотацией из набора данных UI Color Dataset от Guo. Этот смешанный набор данных представляет собой сбалансированный эталон для оценки точности обнаружения компонентов, структурной ясности макета, согласованности между несколькими экранами и перцептивной цветовой гармонии.
Экспериментальные результаты показывают, что модель детектирования на базе Faster R-CNN обеспечивает точность распознавания компонентов 92,4% и эффективно обобщает данные для различных стилей мобильных пользовательских интерфейсов. Кроме того, включение аннотаций шаблонов ENRICO улучшает логику построения макета, что приводит к увеличению четкости макета на 18,7% и более точному сохранению порядка чтения. В экспериментах по оценке цвета модуль цветового моделирования на основе CAM02-UCS генерирует палитры, которые, согласно оценкам дизайнеров, на 24,5% более гармоничны и обладают более высокой перцептивной равномерностью по сравнению с традиционными методами генерации палитр на базе RGB и LAB. Более того, моделирование многоэкранной согласованности обеспечивает улучшение выравнивания между экранами и единообразия типографики на 28%. Пользовательские исследования с участием 30 человек демонстрируют снижение воспринимаемой когнитивной нагрузки на 31% при взаимодействии с прототипами, созданными с помощью предлагаемой системы. В совокупности эти результаты указывают на то, что сочетание детектирования компонентов, перцептивного цветового моделирования и когнитивной оптимизации позволяет создавать прототипы пользовательских интерфейсов, которые являются не только структурно точными, но также визуально целостными и когнитивно эффективными. В Таблице 3 представлены симуляционная среда и технические настройки, использованные для оценки предлагаемого фреймворка прототипирования пользовательских интерфейсов. Вычислительно затратные процедуры обучения Faster R-CNN и модулей согласованности макета поддерживались высокопроизводительным графическим процессором NVIDIA RTX 4090. Все эксперименты проводились в среде Ubuntu 22.04 с использованием PyTorch 2.0 для реализации глубокого обучения.
| Параметр | Конфигурация |
| Аппаратное обеспечение | NVIDIA RTX 4090 GPU (24 GB), Intel i9 Processor, 64 GB RAM |
| Операционная система | Ubuntu 22.04 LTS |
| Фреймворк глубокого обучения | PyTorch 2.0 |
| Базовая сеть (backbone) Faster R-CNN | ResNet-50 + FPN |
| Разрешение изображений | 480 × 800 (нормализовано для всех наборов данных) |
| Размер пакета при обучении | 8 |
| Оптимизатор | AdamW (LR = 1e−4, Weight Decay = 0.01) |
| Количество эпох | 40 |
| Цветовое пространство моделирования | CAM02-UCS |
| Кластеризация для извлечения палитры | K-means (k = 5) |
| Кластеризация макета | DBSCAN (ε = 20, min_samples = 3) |
Таблица 3: Параметры реализации и экспериментальная конфигурация предлагаемого фреймворка. В таблице обобщены сведения о аппаратном и программном обеспечении, использованном для обучения и оценки модели, включая вычислительные ресурсы, операционную систему, фреймворк глубокого обучения, архитектуру модели, разрешение изображений, параметры обучения, стратегию оптимизации, цветовое пространство моделирования, а также методы кластеризации, использованные для извлечения палитры и группировки макета.
Архитектура Faster R-CNN использует базовую сеть ResNet-50 с сетью признаков FPN для обнаружения широкого спектра детализированных компонентов пользовательского интерфейса (UI). Перед обработкой все изображения UI единообразно масштабируются до 480 × 800 пикселей. Обучение проводится в течение 60 эпох с использованием оптимизатора SGD при размере пакета 16 для обеспечения стабильной сходимости. Генератор цветовой палитры использует CAM02-UCS с кластеризацией K-means, в то время как DBSCAN применяется для кластеризации структурного макета. Эти технические настройки гарантируют, что полученные результаты UI являются воспроизводимыми, стабильными и высокоточными. Для проведения комплексной оценки предлагаемой системы автоматизированного прототипирования UI используются четыре категории метрик оценки:
i) эффективность обнаружения компонентов, проанализированная с использованием точности (precision), полноты (recall), F1-меры (F1-score), пересечения над объединением (IoU) и средней средней точности (mAP), которые количественно определяют точность модели Faster R-CNN при идентификации компонентов пользовательского интерфейса в наборах данных RICO и ENRICO;
ii) четкость макета и структурная согласованность, измеряемые с помощью ошибки выравнивания (AE), точности группировки, правильности порядка чтения и показателей согласованности между экранами, полученных на основе ограничений шаблонов проектирования;
iii) Перцептивное качество цвета, оцениваемое с помощью перцепционного расстояния CAM02-UCS (ΔE_UCS), коэффициентов контрастности WCAG 2.1, индекса разнообразия и показателей гармонии цветов, основанных на системе оценки цветов пользовательского интерфейса по Гуо;
iv) Метрики когнитивной эффективности, ориентированные на пользователя, включая когнитивную нагрузку, измеренную с помощью индекса нагрузки при выполнении задач НАСА (NASA-TLX), оценки эстетической согласованности и эффективность выполнения задач.
Эти показатели позволяют оценить систему не только с точки зрения точности обнаружения, но и с точки зрения перцептивной гармонии, качества удобства использования и когнитивного опыта.
Метрики детекции компонентов
Точность (precision) характеризует степень корректности модели при предсказании компонентов пользовательского интерфейса (UI) без генерации ложноположительных результатов. Высокая точность означает, что большинство предсказанных ограничивающих рамок соответствуют действительным элементам UI. Полнота (recall) измеряет способность модели идентифицировать все релевантные компоненты UI на экране. Высокая полнота указывает на то, что модель успешно обнаруживает большинство эталонных компонентов. F1-мера, определяемая как гармоническое среднее между точностью и полнотой, обеспечивает сбалансированную оценку и особенно полезна в случаях, когда компоненты UI распределены по наборам данных неравномерно.
Метрика IoU определяет степень перекрытия предсказанной ограничивающей рамки с истинной ограничивающей рамкой. В задачах детектирования объектов обычно используются пороги IoU 0,5 и 0,75 для представления умеренных и строгих условий оценки. mAP обобщает эффективность детектирования по нескольким порогам IoU. Метрика mAP@0.5:0.95 обеспечивает более надежную оценку путем усреднения точности по порогам от 0,5 до 0,95 с шагом 0,05 и поэтому широко признана в качестве стандартного эталона для детектирования объектов.
Результаты детектирования в трех наборах данных указывают на то, что предложенный модуль детектирования компонентов работает стабильно эффективно. Количественные результаты представлены в Таблице 4. В наборе данных RICO достигнуты самые высокие показатели: точность (precision) 0,91, полнота (recall) 0,88 и F1-мера 0,89, что обусловлено наличием большого и разнообразного набора аннотаций компонентов пользовательского интерфейса (UI). Набор ENRICO демонстрирует несколько более низкие показатели из-за более упрощенной структуры и меньшего количества аннотированных типов компонентов. В наборе данных Guo зафиксирована самая низкая F1-мера (0,81), что, вероятно, связано с большей визуальной вариативностью и меньшим количеством стандартизированных шаблонов разметки, что затрудняет детектирование. В целом, эти результаты подтверждают, что модель сохраняет высокую эффективность детектирования компонентов при различных стилях дизайна UI и характеристиках наборов данных.
| Набор данных | Точность | Полнота (Recall) | F-мера |
| RICO | 0.91 | 0.88 | 0.89 |
| ЭНРИКО | 0.87 | 0.84 | 0.85 |
| Го`уо | 0.83 | 0.8 | 0.81 |
Таблица 4: Эффективность обнаружения компонентов в различных наборах данных. В таблице представлены точность (precision), полнота (recall) и F1-мера для обнаружения компонентов пользовательского интерфейса в наборах данных RICO, ENRICO и Guo, что демонстрирует эффективность модели обнаружения.
Рисунок 3 демонстрирует эффективность модели на наборах данных RICO, ENRICO и Guo при порогах IoU 0,5 и 0,75. Как и ожидалось, значения mAP выше при IoU 0,5 из-за менее строгих требований к перекрытию. Для RICO последовательно регистрируются самые высокие значения mAP (0,89 при IoU 0,5 и 0,78 при IoU 0,75), что отражает полноту и согласованность его аннотаций. ENRICO демонстрирует несколько более низкие значения, в то время как для Guo зафиксированы самые низкие показатели из-за большего разнообразия стилей макета и плотности компонентов. Тенденция к снижению показателей при более строгих порогах IoU иллюстрирует, что сложность набора данных напрямую влияет на устойчивость детектирования.

Рисунок 3. Средняя средняя точность (mAP) при порогах пересечения над объединением (IoU) 0.5 и 0.75 для различных наборов данных. Линейный график сравнивает эффективность детектирования компонентов в наборах данных RICO, ENRICO и Guo. Ось x представляет наборы данных, а ось y отображает значения mAP. Две кривые соответствуют порогам IoU 0.5 и 0.75, иллюстрируя изменение производительности при разных уровнях строгости детектирования. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 4 демонстрирует значение mAP@IoU(0.5:0.95) для каждого набора данных, обеспечивая более широкую оценку эффективности детектирования по десяти порогам IoU. Результаты выявляют явную тенденцию к снижению от RICO (0.61) к ENRICO (0.57) и Guo (0.52), что подтверждает наилучшую обобщающую способность предложенной модели детектирования на более крупных и структурированных наборах данных. Эта более строгая усредненная метрика подчеркивает незначительное снижение производительности, которое может быть незаметно при оценке с одним пороговым значением. Данные результаты указывают на то, что, хотя модель демонстрирует высокие показатели на всех наборах данных, повышенное разнообразие макетов и вариативность компонентов создают дополнительные сложности при строгой оценке в стиле COCO. Результаты детектирования представлены на рисунках 3 и 4, которые содержат количественное сравнение mAP при различных уровнях IoU.

Рисунок 4. Средняя средняя точность (mAP), усредненная по порогам пересечения над объединением (IoU) от 0,5 до 0,95 для различных наборов данных. Линейный график демонстрирует эффективность обнаружения компонентов в наборах данных RICO, ENRICO и Guo с использованием метрики mAP, усредненной по порогам IoU в диапазоне от 0,5 до 0,95. Ось x представляет наборы данных, а ось y указывает соответствующие значения mAP, представленные в шкале от 0 до 1, что отражает производительность модели при различных порогах обнаружения. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.
Метрики качества макета
Качество макета оценивается с помощью AE, точности группировки (GA) и точности порядка чтения (ROA), которые в совокупности позволяют оценить структурную правильность, перцептивную организацию и когнитивную читаемость сгенерированных макетов пользовательского интерфейса.
Ошибка выравнивания.
AE (отклонение в пикселях) показывает, насколько точно элементы пользовательского интерфейса (UI) выровнены относительно идеальных линий выравнивания, таких как левые, правые, верхние направляющие или базовые линии. Более низкое значение AE указывает на то, что элементы расположены единообразно с минимальным визуальным искажением, что повышает читаемость и общую ясность дизайна. Этот показатель особенно важен для оценки когнитивного уточнения макета, так как нарушение выравнивания прерывает визуальный поток и увеличивает воспринимаемую сложность. На рисунке 5 показано значение AE для наборов данных RICO, ENRICO и Guo, измеренное как среднее отклонение в пикселях от идеальных линий выравнивания. Результаты показывают, что в RICO достигнуто самое низкое значение AE (4.2 px), что указывает на более последовательные структурные паттерны компонентов UI в этом наборе данных, что облегчает выравнивание для модели. Далее следует ENRICO с умеренным отклонением выравнивания 6.1 px, что отражает сочетание хорошо структурированных и разнообразных макетов экранов. В наборе данных Guo зафиксировано самое высокое значение AE (7.4 px) из-за большего разнообразия в размещении компонентов и нестандартных структур макета, которые затрудняют уточнение на основе выравнивания. В целом, эти результаты демонстрируют, что модель сохраняет высокую точность выравнивания во всех наборах данных, несмотря на возрастающую сложность макетов.

Рисунок 5. Ошибка выравнивания по наборам данных. На рисунке показана ошибка выравнивания по наборам данных; более низкие значения указывают на более точное выравнивание. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Точность группировки (GA).
GA количественно определяет, насколько эффективно модель группирует связанные компоненты пользовательского интерфейса (UI), например, на основе принципов гештальт-психологии, таких как близость, сходство и непрерывность. Более высокая точность группировки указывает на то, что модель сохраняет намеренную структуру элементов UI, что позволяет пользователям интерпретировать интерфейс более естественно. Эта метрика особенно полезна для оценки того, насколько успешно модуль уточнения макета организует контент в значимые визуальные группы. На Рисунке 6 представлена зависимость GA, достигнутая предлагаемой платформой на трех наборах данных. Набор данных ENRICO демонстрирует самую высокую медианную GA и наименьший межквартильный размах, что указывает на стабильную и последовательную эффективность группировки благодаря четко определенным макетам с размеченными паттернами. Набор данных RICO показывает умеренную точность группировки с более высокой вариативностью, что, вероятно, обусловлено его большим разнообразием и сложностью макетов. В наборе данных Guo UI Color зафиксирована более низкая точность группировки, так как его образцы визуально гетерогенны и в меньшей степени ориентированы на структурный макет. В целом, результаты показывают, что модуль когнитивного уточнения макета работает надежно на различных наборах данных, демонстрируя наилучшие показатели группировки на структурно согласованных данных.

Рисунок 6. Распределение точности группировки по наборам данных. На диаграмме размаха показана точность группировки на основе принципов Гештальта для наборов данных RICO, ENRICO и Guo’s UI Color. Прямоугольники представляют межквартильный размах, центральная линия указывает медиану, а «усы» обозначают диапазон значений. Ось x представляет наборы данных, а ось y показывает показатели точности группировки. Размер выборки n=5128 экранов пользовательского интерфейса (RICO: 4000, ENRICO: 1000 и Guo: 128). Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.
Точность порядка чтения (ROA).
Точность порядка чтения (reading order accuracy, ROA) определяет, насколько точно модель предсказывает естественный поток чтения экрана пользовательского интерфейса, который обычно следует шаблону сверху вниз и слева направо. Соблюдение правильного порядка чтения имеет решающее значение для удобства использования, ясности навигации и соответствия установленным канонам дизайна. Более высокий показатель ROA указывает на то, что система сохраняет ожидаемые паттерны когнитивного сканирования. На рисунке 7 показан показатель ROA на различных этапах оценки для наборов данных RICO, ENRICO и Guo. ENRICO стабильно демонстрирует самый высокий ROA благодаря своей регулярной и ориентированной на паттерны структуре макета, что позволяет более точно предсказывать последовательности чтения, подобные человеческим. RICO демонстрирует умеренную производительность с небольшой вариативностью, что отражает большее разнообразие и сложность реальных интерфейсов. Набор данных Guo показывает самый низкий ROA, так как многие из его экранов визуально насыщенны, но лишены четко определенных иерархий чтения. В целом, эти результаты указывают на то, что предлагаемый модуль уточнения когнического макета работает наиболее надежно на структурированных наборах данных, сохраняя при этом стабильные прогнозы порядка чтения для различных дизайнов пользовательских интерфейсов.

Рисунок 7. Точность порядка чтения на различных этапах оценки для нескольких наборов данных. На линейном графике показана точность порядка чтения на этапах оценки для наборов данных RICO, ENRICO и Guo’s UI Color. Ось x представляет этап оценки, а ось y указывает на точность порядка чтения. Каждая кривая соответствует набору данных, иллюстрируя изменения в сохранении визуального потока на последовательных этапах оценки. Этап оценки представляет собой стадии прогрессивного уточнения предлагаемой структуры. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.
Показатель согласованности макета (LCS)
Показатель согласованности макета (layout consistency score, LCS) измеряет степень стабильности сгенерированных макетов пользовательского интерфейса (UI) на нескольких экранах одного и того же приложения. Это включает согласованность отступов, правил выравнивания, типографических зон и паттернов группировки. Более высокий балл указывает на улучшенную взаимосвязь между экранами, что обеспечивает более единый и интуитивно понятный пользовательский опыт (UX). На рисунке 8 представлены значения LCS, измеренные на нескольких этапах оценки для наборов данных RICO, ENRICO и Guo’s UI Color. Набор данных ENRICO стабильно демонстрирует самые высокие значения LCS благодаря размеченным по паттернам и структурно однородным экранам UI, что способствует более стабильному обучению согласованности между экранами. Напротив, набор данных RICO демонстрирует умеренную, но неуклонно растущую согласованность, что объясняется способностью модели к обобщению на основе крайне разнообразных макетов UI. Как и ожидалось, в наборе данных Guo зафиксированы самые низкие значения LCS, так как он ориентирован преимущественно на цветовые характеристики, а не на структурный макет, что затрудняет обеспечение согласованности между несколькими экранами. В целом, эти результаты показывают, что предложенный модуль межэкранной согласованности наиболее эффективно работает на наборах данных, ориентированных на паттерны, при этом обеспечивая заметные улучшения для всех исследуемых наборов данных.

Рисунок 8. Показатель согласованности макета на разных этапах оценки для нескольких наборов данных. На линейном графике показаны показатели согласованности макета на разных этапах оценки для наборов данных RICO, ENRICO и Guo’s UI Color. Ось x представляет этап оценки, а ось y указывает показатели согласованности макета. Каждая кривая соответствует набору данных и иллюстрирует улучшение структурной связности сгенерированных интерфейсов на последовательных этапах оценки. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Метрики качества цвета
Сгенерированные цветовые темы пользовательского интерфейса оцениваются с помощью пяти метрик, основанных на перцептивном восприятии и производных от CAM02-UCS: ΔE (перцептивное различие цветов), которая количественно определяет перцептивное единообразие цветов палитры; коэффициент контрастности (на основе WCAG 2.1), который оценивает читаемость элементов переднего и заднего планов; индекс цветовой гармонии (CHI), измеряющий эстетическую совместимость оттенков; показатель цветового разнообразия (CDS), отражающий вариативность в перцептивном цветовом пространстве; и показатель выраженности цвета (CPS), который оценивает баланс и доминирование цветов в палитре. В совокупности эти метрики обеспечивают комплексную оценку как эстетического качества, так и функциональных характеристик цвета с точки зрения удобства использования. Результаты показывают, что предлагаемый метод обеспечивает более низкое значение ΔE, равное 4.12, что указывает на улучшенное перцептивное единообразие цветов. Коэффициент контрастности 6.21 подтверждает соответствие стандартам доступности, обеспечивая повышенную читаемость. В Таблице 5 представлено количественное сравнение предлагаемого модуля цветового моделирования с базовыми методами. CHI увеличивается с 0.61 до 0.83, что свидетельствует об улучшении эстетической связности цветовых переходов. Кроме того, CDS увеличивается более чем на 50%, демонстрируя, что сгенерированные палитры сохраняют более богатое разнообразие, не создавая при этом визуального шума. Более высокие значения CPS указывают на сбалансированное распределение доминирующих цветов, предотвращая перенасыщение каким-либо одним оттенком. В целом, эти результаты подтверждают эффективность модуля цветового моделирования на базе CAM02-UCS в создании гармоничных, читаемых и перцептивно оптимизированных цветовых схем пользовательского интерфейса.
| Метрика | Определение | Предлагаемый метод | Исходный уровень1 | Улучшение (%) |
| ΔE (CAM02-UCS) | Перцептивное различие цветов | 4.12 | 7.85 | на 47,5% ниже |
| Коэффициент контрастности (WCAG) | Читабельность пар «передний план – фон» | 6.21 | 4.38 | 41.80% |
| CHI (индекс цветовой гармонии) | Цветовой тон & хроматическая гармония | 0.83 | 0.61 | 36.10% |
| CDS (показатель цветового разнообразия) | Дисперсия в J′a′b′ космос | 18.70 | 12.40 | 50.80% |
| CPS (показатель выраженности цвета) | Стабильность доминирующих цветов | 0.72 | 0.55 | 30.90% |
Таблица 5: Количественное сравнение метрик качества цвета между предлагаемым и базовым методами. В таблице представлены метрики оценки качества цвета, включая перцептивную разность цветов (ΔE в CAM02-UCS), коэффициент контрастности (WCAG), индекс цветовой гармонии (CHI), показатель цветового разнообразия (CDS) и показатель цветовой выраженности (CPS). Результаты предлагаемого метода сравниваются с базовыми значениями с указанием процента улучшения.
Демографические данные участников и дизайн исследования
В процессе оценки приняли участие в общей сложности 30 человек. Возраст участников составлял от 20 до 35 лет (средний возраст: 26,4 ± 3,2 года). В когорту вошли представители различных профессий, включая инженеров по программному обеспечению, студентов и UI/UX-дизайнеров. Согласно данным о владении компьютером, предоставленным самими участниками, 40% были классифицированы как пользователи среднего уровня, 35% — как продвинутые пользователи и 25% — как начинающие. Примерно половина участников имела предварительный опыт в UI/UX-дизайне или смежных областях, в то время как остальные — нет. Такое разнообразие обеспечило сбалансированную оценку с учетом различных уровней технической подготовки и знакомства с принципами дизайна.
Метрики пользовательского исследования
Оценка, ориентированная на пользователя, была проведена с использованием нескольких показателей, включая NASA-TLX, шкалу юзабилити системы (SUS), показатель эстетической гармонии (AHS), время эффективности поиска (SET) и рейтинг согласованности между экранами (CSCR), для оценки когнитивной нагрузки, удобства использования, визуальной привлекательности, эффективности и согласованности.
Метрика NASA-TLX количественно определяет умственную нагрузку путем измерения таких факторов, как умственные требования, усилия и уровень разочарования. Более низкие баллы указывают на снижение когнитивной нагрузки и облегчение взаимодействия. Предложенный фреймворк последовательно приводил к более низким показателям NASA-TLX во всех наборах данных, что свидетельствует о снижении умственных усилий. Это улучшение можно объяснить интеграцией принципов когнитивного дизайна, включая группировку по Гештальту, оптимизированные интервалы и улучшенную визуальную иерархию, что в совокупности способствует более интуитивной навигации. Метрика SUS предоставляет стандартизированный показатель юзабилити в диапазоне от 0 до 100, где более высокие значения указывают на улучшенную удобство использования и ясность. Предложенный фреймворк достиг более высоких показателей SUS по сравнению с базовыми методами, что отражает улучшения как в структурном макете, так и в четкости цветопередачи. Улучшенное выравнивание, интервалы и поток навигации способствовали созданию интерфейсов, которые пользователи воспринимали как более интуитивно понятные и функционально целостные. AHS, измеряемый по 7-балльной шкале Лайкерта, оценивает воспринимаемую визуальную привлекательность и гармонию цветов. Интерфейсы, созданные с использованием модуля цветового моделирования на основе CAM02-UCS, достигли более высоких значений AHS, что указывает на более плавные цветовые переходы и более визуально сбалансированные палитры. Участники последовательно предпочитали эти интерфейсы благодаря улучшенному контрасту, согласованности оттенков и уменьшению визуального шума, что подчеркивает важность перцептивного цветового моделирования в дизайне пользовательского интерфейса. SET измеряет время, необходимое пользователям для поиска целевых элементов интерфейса при выполнении задач визуального поиска. Более низкие значения SET указывают на улучшенную визуальную организацию и иерархию. Предложенный фреймворк значительно сократил SET во всех наборах данных, демонстрируя, что интеграция группировки по Гештальту, интервалов с учетом внимания и усовершенствованных структур макета обеспечивает более быстрое и эффективное взаимодействие. Метрика CSCR оценивает согласованность дизайна интерфейса на нескольких экранах. Более высокие баллы указывают на лучшую непрерывность макета, цвета и структурной организации. Предложенный фреймворк достиг более высоких значений CSCR, что отражает эффективность модуля многоэкранной согласованности в поддержании стабильных цветовых схем, интервалов и иерархических структур в интерфейсах.
Рисунок 9 представляет результаты сравнительного пользовательского исследования по всем метрикам (NASA-TLX, SUS, AHS, SET и CSCR) для наборов данных RICO, ENRICO и Guo. В целом, по всем показателям оценки наблюдаются стабильные улучшения. Примечательно, что набор данных Guo демонстрирует лучшие результаты по пользовательским метрикам, включая более низкую когнитивную нагрузку (NASA-TLX), более высокую удобство использования (SUS), улучшенную эстетическую гармонию (AHS), сокращение времени эффективности поиска (SET) и улучшенную согласованность между экранами (CSCR). Однако эти результаты требуют тщательной интерпретации. Улучшение показателей UX, наблюдаемое для набора данных Guo, обусловлено прежде всего высокой согласованностью цветов и относительно более простой визуальной композицией, а не превосходством качества структурного макета. Несмотря на то, что пользователи воспринимают эти интерфейсы как более визуально гармоничные и менее когнитивно затратные, предыдущие результаты показывают, что набор данных Guo демонстрирует плохие показатели с точки зрения выравнивания, группировки и порядка чтения. Это подчеркивает важное различие между перцептивными и структурными факторами в дизайне пользовательского интерфейса. В то время как перцептивные атрибуты, такие как цветовая гармония, значительно улучшают UX, структурная точность и согласованность макета остаются критически важными для функциональной применимости. Следовательно, оптимальный дизайн интерфейса требует баланса между перцептивной гармонией и структурной корректностью.

Рисунок 9. Сравнение показателей пользовательского исследования по различным наборам данных. Групповая столбчатая диаграмма сравнивает показатели пользовательского исследования для наборов данных RICO, ENRICO и UI Color Datasets от Guo. Ось x представляет метрики оценки, включая индекс нагрузки при выполнении задачи NASA (NASA-TLX), шкалу юзабилити системы (SUS), оценку эстетической гармонии (AHS), время структурной эффективности (SET) и коэффициент кросс-экранной согласованности (CSCR), в то время как ось y указывает соответствующие баллы. Столбцы отражают производительность для каждого набора данных, иллюстрируя различия в удобстве использования, когнитивной нагрузке, эстетическом качестве и согласованности интерфейса. NASA-TLX (0–100, чем ниже, тем лучше), SUS (0–100, чем выше, тем лучше), AHS (шкала Лайкерта 1–7), SET (s, чем ниже, тем лучше) и CSCR (0–1, чем выше, тем лучше). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Статистическая проверка гипотез
Для дальнейшей проверки выдвинутых гипотез (H1–H4) была проведена проверка статистической значимости по ключевым показателям оценки, включая качество макета, когнитивную нагрузку, гармонию цветов и показатели юзабилити (Таблица 6). Результаты представлены в виде среднего значения ± стандартного отклонения; статистическая значимость оценивалась с помощью парных t-критериев с 95% доверительным интервалом (p < 0.05). Результаты показывают, что предлагаемый фреймворк обеспечивает статистически значимые улучшения по сравнению с базовыми подходами по нескольким показателям, включая точность выравнивания, точность группировки, порядок чтения, когнитивную нагрузку (NASA-TLX) и показатели гармонии цветов. В частности, снижение когнитивной нагрузки и улучшение показателей юзабилити демонстрируют высокозначимые различия (p < 0.01). Эти данные подтверждают, что интеграция принципов когнитивного дизайна и перцептивного моделирования цвета ведет к измеримым и статистически значимым улучшениям качества пользовательского интерфейса, что подтверждает гипотезы H1–H4.
| Показатель | Исходный уровень (Среднее ± SD) | Предложенный вариант (Среднее ± SD) | Улучшение (%) | p-значение | Значимость |
| Ошибка выравнивания (↓) | 7.8 ± 1.2 | 4.2 ± 0.9 | 46.10% | 0.003 | Значимо |
| Точность группировки (↑) | 0.68 ± 0.05 | 0.82 ± 0.04 | 20.50% | 0.001 | Значимо |
| Точность порядка чтения (↑) | 0.72 ± 0.06 | 0.87 ± 0.03 | 20.80% | 0.002 | Значимо |
| NASA-TLX (↓) | 68.5 ± 5.4 | 47.2 ± 4.8 | 31.10% | 0.0005 | Высокозначимо |
| Балл SUS (↑) | 71.3 ± 6.2 | 88.9 ± 4.5 | 24.70% | 0.0008 | Высокозначимо |
| Индекс цветовой гармонии (↑) | 0.61 ± 0.07 | 0.83 ± 0.05 | 36.00% | 0.001 | Значимо |
| Коэффициент контрастности (↑) | 4.1 ± 0.6 | 6.2 ± 0.5 | 51.20% | 0.002 | Значимо |
Таблица 6: Статистическое сравнение показателей эффективности базовых и предлагаемых методов. В таблице представлены среднее значение и стандартное отклонение (mean ± SD) для ключевых показателей эффективности, включая ошибку выравнивания, точность группировки, точность порядка чтения, индекс нагрузки NASA (NASA-TLX), шкалу юзабилити системы (SUS), индекс цветовой гармонии и коэффициент контрастности. Приведены показатели процентного улучшения, p-значения и уровни статистической значимости. Символ (↑) означает, что более высокие значения являются лучшими, а (↓) — что более низкие значения являются лучшими. Статистическая значимость оценивалась при p < 0.05.
Наблюдения по конкретному набору данных
Относительно более низкие показатели структурных метрик, наблюдаемые на наборе данных Guo, могут быть обусловлены его внутренними характеристиками. Набор данных Guo меньше, чем RICO и ENRICO, и ориентирован преимущественно на перцептивные цветовые признаки, а не на структурированные аннотации макета. В результате в нем наблюдается более высокая вариативность размещения компонентов, более слабая иерархическая организация и менее последовательная структура макета на разных экранах. Эти свойства усложняют структурное обучение и оптимизацию макета, что объясняет более низкие результаты в метриках выравнивания, группировки и порядка чтения, несмотря на высокие показатели в перцептивных и ориентированных на пользователя оценках.
Абляционное исследование
Абляционное исследование позволяет оценить вклад каждого модуля в предлагаемую структуру путем систематического удаления отдельных компонентов и анализа их влияния на качество макета, моделирование цвета и эффективность детектирования. Качество макета оценивается с помощью AE, GA, ROA и LCS. AE отражает позиционное отклонение элементов пользовательского интерфейса, где более высокие значения указывают на более слабую пространственную структуру. GA оценивает эффективность организации компонентов в соответствии с принципами Гештальта. ROA измеряет сохранность логического визуального потока, в то время как LCS количественно определяет структурную согласованность между экранами с точки зрения выравнивания, интервалов и организации макета. Снижение качества цвета оценивается с помощью ΔE (перцептивной разности цветов), CHI и CDS, которые в совокупности позволяют оценить перцептивную равномерность, эстетическую согласованность и богатство палитры. Эффективность детектирования оценивается с помощью mAP, точности (precision) и полноты (recall), что позволяет количественно определить влияние замены модуля Faster R-CNN на более простую модель детектирования. В совокупности эти метрики обеспечивают комплексную оценку вклада каждого модуля в общую производительность системы.
В таблице 7 обобщен вклад каждого модуля и приведено сравнение предлагаемого фреймворка с существующими подходами к генерации пользовательских интерфейсов (UI). Полная модель демонстрирует наилучшие показатели по всем метрикам качества макета, цветового моделирования и детектирования, что доказывает синергетический эффект когнитивного дизайна, перцептивного моделирования цвета и глубокого визуального анализа. При удалении модуля цветового моделирования значение ΔE значительно увеличивается, в то время как показатели CHI и CDS существенно снижаются, что указывает на потерю перцептивной равномерности и цветовой гармонии. Это подтверждает важность моделирования на основе CAM02-UCS для сохранения эстетического и перцептивного качества. Удаление модуля когнического макета приводит к значительному увеличению AE и заметному снижению GA и ROA, что демонстрирует необходимость применения принципов когнитивного дизайна для создания структурно связных и читаемых макетов. Удаление модуля согласованности между экранами приводит к снижению LCS, что подтверждает его роль в поддержании единообразных шаблонов макета на нескольких экранах. Замена детектора Faster R-CNN на более простую CNN приводит к резкому падению mAP, точности (precision) и полноты (recall), что подчеркивает критическую важность надежного детектирования компонентов в общем конвейере обработки. По сравнению с базовыми методами, включая pix2code, REDRAW и LDGM, предлагаемый фреймворк последовательно превосходит все подходы по точности макета, визуальной связности и перцептивному качеству цвета.
| Метод / Модуль | АЭ ↓ | ГА ↑ | Рамановский оптический анализ (ROA) ↑ | СМЖ ↑ | ΔЕ ↓ | ХИ (хитозан) ↑ | кодирующая последовательность ↑ | среднее среднее значение точности (mAP) ↑ |
| Цветовой модуль извлечен | 0.14 | 0.86 | 0.92 | 0.84 | 7.85 | 0.61 | 12.4 | 0.9 |
| Модуль когнитивной разметки удален | 0.18 | 0.72 | 0.73 | 0.69 | 4.21 | 0.79 | 17.9 | 0.89 |
| Устранение несогласованности между несколькими экранами | 0.17 | 0.81 | 0.88 | 0.62 | 4.18 | 0.81 | 17.3 | 0.9 |
| Замена Faster R-CNN на простую CNN | 0.16 | 0.85 | 0.91 | 0.85 | 4.15 | 0.82 | 18.1 | 0.74 |
| Pix2Code | 0.25 | 0.61 | 0.65 | 0.51 | 10.2 | 0.48 | 9.6 | 0.65 |
| ПЕРЕРИСОВАТЬ | 0.21 | 0.66 | 0.72 | 0.56 | 8.7 | 0.52 | 11.4 | 0.72 |
| LDGM (Layout Diffusion) | 0.19 | 0.74 | 0.79 | 0.63 | 6.9 | 0.59 | 13.8 | 0.8 |
| Предлагаемая полная модель | 0.12 | 0.89 | 0.94 | 0.87 | 4.12 | 0.83 | 18.7 | 0.91 |
Таблица 7: Исследование влияния отдельных компонентов (абляционный анализ) и сравнительный анализ производительности предлагаемой структуры и базовых методов. В таблице оценивается вклад отдельных компонентов путем сравнения полной предлагаемой модели с вариантами, в которых удалены определенные модули (модуль цвета, модуль когнитивного макета, многоэкранная согласованность, а также замена Faster R-CNN простым CNN), а также с базовыми методами (pix2code, REDRAW и LDGM). Производительность оценивается с помощью ошибки выравнивания (AE), точности группировки (GA), точности порядка чтения (ROA), показателя согласованности макета (LCS), перцептивной разности цветов (ΔE), индекса цветовой гармонии (CHI), показателя цветового разнообразия (CDS) и средней средней точности (mAP). (↑) означает, что более высокие значения лучше, а (↓) — что более низкие значения лучше.
ДОСТУПНОСТЬ ДАННЫХ:
Наборы данных, использованные в данном исследовании, доступны по следующим ссылкам: набор данных RICO: https://interactionmining.org/rico; набор данных ENRICO: https://github.com/luileito/enrico; набор данных UI Color от Guo: https://github.com/guozhongke/UI-Color-Dataset.
Дополнительный файл 1. Математические формулировки и расширенные сведения о реализации.В этом файле представлены подробные математические формулировки и алгоритмические рабочие процессы, лежащие в основе предлагаемого фреймворка для автоматизированного прототипирования пользовательского интерфейса (UI). Он включает в себя обучение обнаружению компонентов, извлечение паттернов макета, моделирование цветовой гармонии, единую целевую функцию прототипирования UI, детали детектирования Faster R-CNN, расчеты пространственного расстояния и сходства выравнивания, построение логического дерева UI, перцептивное моделирование цвета на основе CAM02-UCS, оптимизацию когнитивного дизайна, моделирование согласованности между несколькими экранами, а также Алгоритмы S1–S3.Пожалуйста, нажмите здесь, чтобы скачать этот файл.