$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El marco propuesto para prototipado automatizado de interfaz de usuario (UI) fue evaluado utilizando un conjunto de datos integrado de 5.128 pantallas de interfaz de usuario procedentes de tres fuentes: 4.000 imágenes de RICO, 1.000 pantallas de ENRICO y 128 muestras de interfaz de usuario anotadas por color del conjunto de datos UI Color de Guo. Este conjunto de datos combinado proporciona un punto de referencia bien equilibrado para evaluar la precisión en la detección de componentes, la claridad estructural del diseño, la coherencia entre múltiples pantallas y la armonía perceptual del color.
Los resultados experimentales demuestran que el modelo de detección basado en Faster R-CNN alcanza una precisión del 92,4 % en la detección de componentes y se generaliza eficazmente a diversas estilos de interfaces móviles. Además, la incorporación de anotaciones de patrones ENRICO mejora el razonamiento del diseño, lo que resulta en un aumento del 18,7 % en la claridad del diseño y una mejor preservación del orden de lectura. En experimentos de evaluación del color, el módulo de modelado del color basado en CAM02-UCS genera paletas que son un 24,5 % más armónicas, según la evaluación de diseñadores, y logra una mayor uniformidad perceptual en comparación con los métodos tradicionales de generación de paletas basados en RGB y LAB. Asimismo, el modelado de consistencia multiscreen logra una mejora del 28 % en la alineación entre pantallas y la consistencia de la tipografía. Estudios con usuarios que incluyeron a 30 participantes muestran una reducción del 31 % en la carga cognitiva percibida al interactuar con prototipos generados por el sistema propuesto. En conjunto, estos resultados indican que combinar la detección de componentes, el modelado del color perceptual y la optimización cognitiva produce prototipos de interfaz de usuario que no solo son estructuralmente precisos, sino también visualmente coherentes y cognitivamente eficientes. Tabla 3 destaca el entorno de simulación y los ajustes técnicos utilizados para evaluar el marco propuesto de prototipado de interfaces. Los procedimientos computacionalmente intensivos de entrenamiento de Faster R-CNN y los módulos de consistencia del diseño fueron respaldados por una GPU NVIDIA RTX 4090 de alto rendimiento. Todos los experimentos se realizaron en un entorno Ubuntu 22.04 utilizando PyTorch 2.0 para la implementación del aprendizaje profundo.
| Parámetro | Configuración |
| Hardware | GPU NVIDIA RTX 4090 (24 GB), procesador Intel i9, 64 GB de RAM |
| Sistema operativo | Ubuntu 22.04 LTS |
| Entorno de aprendizaje profundo | PyTorch 2.0 |
| Estructura base de Faster R-CNN | ResNet-50 + FPN |
| Resolución de imagen | 480 × 800 (normalizada en todos los conjuntos de datos) |
| Tamaño del lote de entrenamiento | 8 |
| Optimizador | AdamW (LR = 1e−4, decaimiento del peso = 0,01) |
| Épocas | 40 |
| Espacio de modelado de color | CAM02-UCS |
| Agrupamiento para extracción de paleta | K-means (k = 5) |
| Agrupamiento de distribución | DBSCAN (ε = 20, min_samples = 3) |
Tabla 3: Parámetros de implementación y configuración experimental del marco propuesto. La tabla resume la configuración de hardware y software utilizada para el entrenamiento y la evaluación del modelo, incluyendo los recursos computacionales, sistema operativo, framework de aprendizaje profundo, arquitectura del modelo, resolución de imagen, parámetros de entrenamiento, estrategia de optimización, espacio de modelado de color y métodos de agrupamiento utilizados para la extracción de paletas y la agrupación de distribuciones.
La arquitectura Faster R-CNN emplea una base ResNet-50 con una FPN para detectar una amplia gama de componentes de interfaz de usuario de gran detalle. Todas las imágenes de interfaz de usuario se redimensionan uniformemente a 480 × 800 píxeles antes del procesamiento. El entrenamiento se realiza durante 60 épocas utilizando el optimizador SGD, con un tamaño de lote de 16 para garantizar una convergencia estable. El generador de paletas de colores utiliza CAM02-UCS con agrupamiento K-means, mientras que DBSCAN se utiliza para el agrupamiento del diseño estructural. Estas configuraciones técnicas aseguran que los resultados generados de interfaz de usuario sean reproducibles, estables y de alta fidelidad. Para proporcionar una evaluación integral del marco propuesto de prototipado automatizado de interfaz de usuario, se emplean cuatro categorías de métricas de evaluación:
i) Rendimiento en la detección de componentes, analizado mediante precisión, exhaustividad, puntuación F1, intersección sobre unión (IoU) y precisión media promedio (mAP), que cuantifican la exactitud del modelo Faster R-CNN para identificar componentes de interfaz de usuario en los conjuntos de datos RICO y ENRICO;
ii) Claridad del diseño y consistencia estructural, medida mediante el error de alineación (AE), precisión en el agrupamiento, corrección del orden de lectura y puntuaciones de consistencia entre pantallas derivadas de las restricciones de los patrones de diseño;
iii) Calidad perceptual del color, evaluada mediante la distancia perceptual CAM02-UCS (ΔE_UCS), las relaciones de contraste WCAG 2.1, el índice de diversidad y las puntuaciones de armonía cromática inspiradas en el marco de evaluación de colores de interfaz de usuario de Guo;
iv) Métricas de eficiencia cognitiva centradas en el usuario, incluyendo la carga cognitiva medida por el índice de carga de trabajo de la NASA (NASA-TLX), las calificaciones de coherencia estética y la eficiencia en la finalización de tareas.
Estas métricas permiten evaluar el marco no solo en términos de precisión de detección, sino también en cuanto a armonía perceptual, calidad de usabilidad y experiencia cognitiva.
Métricas de detección de componentes
La precisión describe la exactitud del modelo al predecir componentes de la interfaz de usuario sin generar falsos positivos. Una alta precisión implica que la mayoría de los cuadros delimitadores predichos corresponden a elementos de interfaz válidos. La exhaustividad (recall) mide la capacidad del modelo para identificar todos los componentes de interfaz relevantes en una pantalla. Una alta exhaustividad indica que el modelo detecta con éxito la mayoría de los componentes reales. El puntaje F1, definido como el promedio armónico de la precisión y la exhaustividad, proporciona una evaluación equilibrada y es particularmente útil cuando los componentes de interfaz están distribuidos de manera desigual entre los conjuntos de datos.
La métrica IoU mide en qué medida el cuadro delimitador predicho se superpone con el cuadro delimitador real. En las tareas de detección de objetos, los umbrales de IoU de 0,5 y 0,75 se utilizan comúnmente para representar condiciones de evaluación moderadas y estrictas. La mAP resume el rendimiento de detección a través de múltiples umbrales de IoU. La métrica mAP@0,5:0,95 proporciona una evaluación más robusta al promediar la precisión a través de umbrales desde 0,5 hasta 0,95 en pasos de 0,05 y, por lo tanto, es ampliamente aceptada como un punto de referencia estándar para la detección de objetos.
Los resultados de detección en los tres conjuntos de datos indican que el módulo propuesto de detección de componentes tiene un rendimiento consistentemente alto. Los resultados cuantitativos se presentan en la Tabla 4. El conjunto de datos RICO alcanza el rendimiento más alto, con una precisión de 0,91, una exhaustividad de 0,88 y una puntuación F1 de 0,89, gracias a su amplio conjunto diverso de anotaciones de componentes de interfaz de usuario. ENRICO muestra puntuaciones ligeramente más bajas debido a su estructura más simplificada y a la menor cantidad de tipos de componentes anotados. El conjunto de datos Guo registra la puntuación F1 más baja (0,81), probablemente debido a una mayor variación visual y a patrones de diseño menos estandarizados, lo que dificulta la detección. En general, estos resultados confirman que el modelo mantiene un rendimiento robusto en la detección de componentes en distintos estilos de diseño de interfaces de usuario y características de conjuntos de datos.
| Conjunto de datos | Precisión | Recuperación | Puntaje F1 |
| RICO | 0.91 | 0.88 | 0.89 |
| ENRICO | 0.87 | 0.84 | 0.85 |
| Guo | 0.83 | 0.8 | 0.81 |
Tabla 4: Rendimiento de la detección de componentes en diferentes conjuntos de datos. La tabla presenta la precisión, recuperación y puntuación F1 para la detección de componentes de interfaz de usuario en los conjuntos de datos RICO, ENRICO y Guo, lo que demuestra la eficacia del modelo de detección.
Figura 3 muestra el rendimiento del modelo en los conjuntos de datos RICO, ENRICO y Guo con umbrales de IoU de 0,5 y 0,75. Como era de esperar, los valores de mAP son más altos a un IoU de 0,5 debido al requisito de superposición más flexible. RICO presenta consistentemente los valores más altos de mAP (0,89 a un IoU de 0,5 y 0,78 a un IoU de 0,75), lo que refleja la riqueza y coherencia de sus anotaciones. ENRICO muestra valores ligeramente más bajos, mientras que Guo registra las puntuaciones más bajas debido a una mayor variación en el estilo de diseño y la densidad de componentes. La tendencia decreciente con umbrales de IoU más estrictos ilustra que la complejidad del conjunto de datos influye directamente en la robustez de la detección.

Figura 3. Precisión media (mAP) en umbrales de intersección sobre unión (IoU) de 0,5 y 0,75 a través de conjuntos de datos. El gráfico de líneas compara el rendimiento de detección de componentes en los conjuntos de datos RICO, ENRICO y Guo. El eje x representa los conjuntos de datos y el eje y muestra los valores de mAP. Dos curvas corresponden a umbrales de IoU de 0,5 y 0,75, ilustrando la variación del rendimiento bajo diferentes niveles de rigurosidad en la detección. Haga clic aquí para ver una versión más grande de esta figura.
Figura 4 presenta la mAP@IoU(0,5:0,95) para cada conjunto de datos, proporcionando una evaluación más amplia del rendimiento de detección a través de diez umbrales de IoU. Los resultados revelan una tendencia claramente descendente desde RICO (0,61) hasta ENRICO (0,57) y Guo (0,52), lo que confirma que el modelo de detección propuesto se generaliza mejor en conjuntos de datos más grandes y más estructurados. Esta métrica promediada más estricta resalta degradaciones sutiles del rendimiento que podrían no ser evidentes bajo una evaluación con un único umbral. Estos hallazgos indican que, aunque el modelo tiene un buen desempeño en todos los conjuntos de datos, la mayor diversidad de diseños y la variabilidad de los componentes introducen desafíos adicionales bajo una evaluación rigurosa al estilo COCO. Los resultados de detección se presentan en Figuras 3 y 4, que proporcionan comparaciones cuantitativas de la mAP en diferentes niveles de IoU.

Figura 4. Precisión media promedio (mAP) promediada sobre umbrales de intersección sobre unión (IoU) desde 0,5 hasta 0,95 en diferentes conjuntos de datos. El gráfico de líneas muestra el rendimiento en la detección de componentes en los conjuntos de datos RICO, ENRICO y Guo, utilizando la métrica mAP promediada sobre umbrales de IoU que van desde 0,5 hasta 0,95. El eje x representa los conjuntos de datos, y el eje y indica los valores correspondientes de mAP reportados en una escala de 0 a 1, reflejando el desempeño del modelo bajo umbrales de detección variables. Haga clic aquí para ver una versión más grande de esta figura.
Métricas de calidad del diseño
La calidad del diseño se evalúa utilizando AE, precisión de agrupamiento (GA) y precisión del orden de lectura (ROA), que en conjunto evalúan la corrección estructural, la organización perceptual y la legibilidad cognitiva de los diseños de interfaz de usuario generados.
Error de alineación.
AE (desviación basada en píxeles) indica qué tan bien los elementos de la interfaz de usuario se alinean con líneas de alineación ideales, como guías izquierda, derecha, superior o de línea base. Un valor AE más bajo indica que los elementos están dispuestos de forma consistente con una distorsión visual mínima, lo que mejora la legibilidad y la claridad general del diseño. Esta métrica es particularmente importante para evaluar el refinamiento del diseño cognitivo, ya que el desalineamiento interrumpe el flujo visual y aumenta la complejidad percibida. Figura 5 ilustra el AE en los conjuntos de datos RICO, ENRICO y Guo, medido como la desviación promedio en píxeles respecto a las líneas de alineación ideales. Los resultados muestran que RICO logra el AE más bajo (4,2 px), lo que indica que los componentes de interfaz de usuario en este conjunto de datos presentan patrones estructurales más consistentes, facilitando así el alineamiento para el modelo. ENRICO sigue con una desviación de alineación moderada de 6,1 px, reflejando una combinación de diseños de pantalla bien estructurados y variados. El conjunto de datos Guo registra el AE más alto (7,4 px), debido a su mayor diversidad en la colocación de componentes y estructuras de diseño no estándar, lo que dificulta el refinamiento basado en alineación. En general, estos resultados demuestran que el modelo mantiene una alta precisión de alineación en todos los conjuntos de datos, a pesar del aumento en la complejidad del diseño.

Figura 5. Error de alineación entre conjuntos de datos. La figura muestra el error de alineación entre conjuntos de datos; valores más bajos indican una mejor alineación. Haga clic aquí para ver una versión más grande de esta figura.
Precisión del agrupamiento (GA).
GA cuantifica qué tan eficazmente el modelo agrupa componentes de interfaz de usuario (UI) relacionados, por ejemplo, según principios de la Gestalt como proximidad, similitud y continuidad. Una mayor precisión de agrupamiento indica que el modelo conserva la estructura prevista de los elementos de la interfaz, permitiendo a los usuarios interpretar la interfaz de manera más natural. Esta métrica es particularmente útil para evaluar si el módulo de refinamiento de diseño organiza correctamente el contenido en grupos visuales significativos. Figura 6 presenta la distribución de GA alcanzada por el marco propuesto en los tres conjuntos de datos. El conjunto de datos ENRICO muestra la mediana GA más alta y el rango intercuartílico más pequeño, lo que indica un rendimiento de agrupamiento estable y consistente debido a sus diseños bien definidos y etiquetados por patrones. El conjunto de datos RICO muestra una precisión de agrupamiento moderada con mayor variabilidad, probablemente debido a su mayor diversidad y complejidad de diseño. El conjunto de datos Guo UI Color registra una menor precisión de agrupamiento, ya que sus muestras son visualmente heterogéneas y menos enfocadas en la estructura del diseño. En general, los resultados indican que el módulo cognitivo de refinamiento de diseño funciona de manera confiable en diferentes conjuntos de datos, logrando el mejor desempeño de agrupamiento en datos estructuralmente consistentes.

Figura 6. Distribución de la precisión de agrupamiento entre conjuntos de datos. El gráfico de caja muestra la precisión de agrupamiento basada en los principios de la Gestalt en los conjuntos de datos RICO, ENRICO y Guo sobre colores de interfaz de usuario. Las cajas representan el rango intercuartílico, la línea central indica la mediana y los bigotes denotan el rango de valores. El eje x representa los conjuntos de datos y el eje y muestra las puntuaciones de precisión de agrupamiento. El tamaño de la muestra es n=5128 pantallas de interfaz de usuario (RICO: 4000, ENRICO: 1000 y Guo: 128). Haga clic aquí para ver una versión más grande de esta figura.
Precisión del orden de lectura (ROA).
La precisión del orden de lectura (ROA) mide con qué exactitud el modelo predice el flujo natural de lectura de una pantalla de interfaz de usuario, que generalmente sigue un patrón de arriba hacia abajo y de izquierda a derecha. Mantener el orden de lectura correcto es esencial para la usabilidad, la claridad de la navegación y la coherencia con las convenciones de diseño establecidas. Un ROA más alto indica que el sistema conserva patrones esperados de exploración cognitiva. Figura 7 muestra el ROA en diferentes etapas de evaluación para los conjuntos de datos RICO, ENRICO y Guo. ENRICO alcanza consistentemente el ROA más alto debido a su estructura de diseño regular y orientada a patrones, lo que permite una predicción más precisa de secuencias de lectura similares a las humanas. RICO muestra un rendimiento moderado con una ligera variabilidad, reflejando su mayor diversidad y complejidad del mundo real. El conjunto de datos Guo presenta el ROA más bajo, ya que muchas de sus pantallas son visualmente ricas pero carecen de jerarquías de lectura claramente definidas. En general, estos resultados indican que el módulo propuesto de refinamiento del diseño cognitivo funciona de manera más confiable en conjuntos de datos estructurados, al tiempo que mantiene predicciones estables del orden de lectura en diversos diseños de interfaz de usuario.

Figura 7. Precisión del orden de lectura en las distintas etapas de evaluación para múltiples conjuntos de datos. El gráfico de líneas muestra la precisión del orden de lectura en las distintas fases de evaluación para los conjuntos de datos RICO, ENRICO y Guo’s UI Color. El eje x representa la etapa de evaluación, y el eje y indica la precisión del orden de lectura. Cada curva corresponde a un conjunto de datos, ilustrando los cambios en la conservación del flujo visual a lo largo de las sucesivas etapas de evaluación. La etapa de evaluación representa las fases progresivas de refinamiento del marco propuesto. Haga clic aquí para ver una versión ampliada de esta figura.
Puntuación de consistencia de diseño (LCS)
La puntuación de consistencia de diseño (LCS) mide cuán consistentemente se mantienen los diseños de interfaz de usuario generados en múltiples pantallas dentro de la misma aplicación. Esto incluye consistencia en el espaciado, las reglas de alineación, las regiones tipográficas y los patrones de agrupamiento. Una puntuación más alta indica una mayor coherencia entre pantallas, lo que resulta en una experiencia de usuario más unificada e intuitiva. Figura 8 presenta el LCS medido en varias etapas de evaluación para los conjuntos de datos de color de interfaz de usuario RICO, ENRICO y Guo. El conjunto de datos ENRICO alcanza consistentemente los valores más altos de LCS debido a sus pantallas de interfaz de usuario etiquetadas por patrones y estructuralmente uniformes, lo que facilita un aprendizaje más estable de la consistencia entre pantallas. En contraste, el conjunto de datos RICO muestra una consistencia moderada pero en mejora constante, atribuible a la capacidad del modelo para generalizar a través de diseños de interfaz de usuario altamente diversos. Como era de esperar, el conjunto de datos Guo registra los valores más bajos de LCS, ya que se centra principalmente en las características de color en lugar del diseño estructural, lo que hace más difícil la consistencia entre múltiples pantallas. En general, estos resultados indican que el módulo propuesto de consistencia entre pantallas funciona más eficazmente en conjuntos de datos orientados a patrones, aunque sigue proporcionando mejoras medibles en todos los conjuntos de datos.

Figura 8. Puntuación de consistencia de diseño en las distintas etapas de evaluación para múltiples conjuntos de datos. El gráfico de líneas muestra las puntuaciones de consistencia de diseño según la etapa de evaluación para los conjuntos de datos de interfaces de usuario RICO, ENRICO y Guo. El eje x representa la etapa de evaluación y el eje y indica las puntuaciones de consistencia de diseño. Cada curva corresponde a un conjunto de datos e ilustra la mejora en la coherencia estructural de las interfaces generadas a lo largo de las sucesivas etapas de evaluación. Haga clic aquí para ver una versión más grande de esta figura.
Métricas de calidad del color
Los temas de color de interfaz de usuario generados se evalúan mediante cinco métricas basadas en la percepción, derivadas del CAM02-UCS: ΔE (diferencia perceptual de color), que cuantifica la uniformidad perceptual entre los colores de la paleta; la relación de contraste (basada en WCAG 2.1), que evalúa la legibilidad entre elementos de primer plano y fondo; el índice de armonía cromática (CHI), que mide la compatibilidad estética entre tonos; la puntuación de diversidad cromática (CDS), que refleja la variación dentro del espacio de color perceptual; y la puntuación de prominencia cromática (CPS), que evalúa el equilibrio y la dominancia de los colores dentro de la paleta. Juntas, estas métricas proporcionan una evaluación integral de la calidad estética y del rendimiento cromático orientado a la usabilidad. Los resultados demuestran que el método propuesto logra un valor de ΔE más bajo de 4,12, lo que indica una mayor uniformidad perceptual entre los colores. Una relación de contraste de 6,21 confirma el cumplimiento con las normas de accesibilidad, garantizando una mejor legibilidad. Tabla 5 presenta una comparación cuantitativa entre el módulo de modelado de color propuesto y los métodos de referencia. El CHI aumenta de 0,61 a 0,83, lo que indica una mayor cohesión estética en las transiciones de color. Además, la CDS aumenta en más del 50 %, demostrando que las paletas generadas mantienen una variación más rica sin introducir ruido visual. Valores más altos de CPS indican una distribución equilibrada de colores dominantes, evitando la saturación excesiva de cualquier tono único. En conjunto, estos resultados confirman la eficacia del módulo de modelado cromático basado en CAM02-UCS para generar esquemas de color de interfaz de usuario armónicos, legibles y optimizados perceptualmente.
| Métrica | Definición | Método propuesto | Línea de base1 | Mejora (%) |
| ΔE (CAM02-UCS) | Diferencia de color perceptual | 4.12 | 7.85 | 47,5 % menor |
| Relación de contraste (WCAG) | Legibilidad de los pares FG–BG | 6.21 | 4.38 | 41.80% |
| Índice de Armonía de Color (CHI) | Matiz & armonía cromática | 0.83 | 0.61 | 36.10% |
| CDS (Puntuación de Diversidad de Color) | Varianza en J′a′b′ espacio | 18.70 | 12.40 | 50.80% |
| CPS (Puntuación de Relevancia de Color) | Estabilidad de los colores dominantes | 0.72 | 0.55 | 30.90% |
Tabla 5: Comparación cuantitativa de métricas de calidad del color entre los métodos propuesto y de referencia. La tabla presenta métricas de evaluación para la calidad del color, incluyendo la diferencia de color perceptual (ΔE en CAM02-UCS), la relación de contraste (WCAG), el índice de armonía del color (CHI), la puntuación de diversidad del color (CDS) y la puntuación de prominencia del color (CPS). Se comparan los resultados del método propuesto con los valores de referencia, junto con los porcentajes de mejora.
Características demográficas de los participantes y diseño del estudio
Un total de 30 participantes participaron en el proceso de evaluación. Los participantes tenían edades comprendidas entre 20 y 35 años (edad media: 26,4 ± 3,2 años). La cohorte incluyó individuos con diversos antecedentes, entre ellos ingenieros de software, estudiantes y diseñadores de interfaces de usuario y experiencia de usuario (UI/UX). Según su competencia informática autodeclarada, el 40 % de los participantes se clasificaron como usuarios intermedios, el 35 % como usuarios avanzados y el 25 % como principiantes. Aproximadamente la mitad de los participantes tenían experiencia previa en diseño UI/UX o campos relacionados, mientras que el resto no la tenía. Esta diversidad garantizó una evaluación equilibrada en diferentes niveles de experiencia técnica y familiaridad con el diseño.
Métricas del estudio con usuarios
Se realizó una evaluación centrada en el usuario utilizando múltiples métricas, incluyendo la NASA-TLX, la escala de usabilidad del sistema (SUS), la puntuación de armonía estética (AHS), el tiempo de eficiencia de búsqueda (SET) y la calificación de consistencia entre pantallas (CSCR), para evaluar la carga cognitiva, la usabilidad, el atractivo visual, la eficiencia y la consistencia.
La métrica NASA-TLX cuantifica la carga mental midiendo factores como la demanda mental, el esfuerzo y la frustración. Puntuaciones más bajas indican una carga cognitiva reducida y una interacción más sencilla. El marco propuesto produjo consistentemente puntuaciones más bajas en la NASA-TLX en todos los conjuntos de datos, lo que indica un menor esfuerzo mental. Esta mejora puede atribuirse a la integración de principios de diseño cognitivo, incluyendo agrupamiento de Gestalt, espaciado optimizado y jerarquía visual mejorada, que en conjunto facilitan una navegación más intuitiva. La métrica SUS proporciona una puntuación estandarizada de usabilidad que varía de 0 a 100, donde valores más altos indican una mejor usabilidad y claridad. El marco propuesto obtuvo puntuaciones más altas en la SUS en comparación con los métodos de referencia, reflejando mejoras tanto en el diseño estructural como en la claridad del color. Una alineación, espaciado y flujo de navegación mejorados contribuyeron a interfaces que los usuarios percibieron como más intuitivas y funcionalmente coherentes. El AHS, medido en una escala Likert de 7 puntos, evalúa el atractivo visual percibido y la armonía cromática. Las interfaces generadas utilizando el módulo de modelado de color basado en CAM02-UCS alcanzaron valores más altos de AHS, lo que indica transiciones de color más suaves y paletas visualmente más equilibradas. Los participantes mostraron una preferencia constante por estas interfaces debido a un mejor contraste, coherencia de matiz y menor saturación visual, destacando la importancia del modelado perceptual del color en el diseño de interfaces. El SET mide el tiempo necesario para que los usuarios localicen elementos objetivo de la interfaz durante tareas de búsqueda visual. Valores más bajos de SET indican una mejor organización y jerarquía visual. El marco propuesto redujo significativamente el SET en todos los conjuntos de datos, demostrando que la integración de agrupamiento de Gestalt, espaciado guiado por la atención y estructuras de diseño refinadas permite una interacción más rápida y eficiente. La métrica CSCR evalúa la consistencia del diseño de la interfaz en múltiples pantallas. Puntuaciones más altas indican una mejor continuidad en el diseño, el color y la organización estructural. El marco propuesto alcanzó valores más altos de CSCR, reflejando la eficacia del módulo de consistencia multiscreen para mantener esquemas de color estables, espaciado y estructuras jerárquicas coherentes a través de las interfaces.
Figura 9 presenta los resultados del estudio comparativo con usuarios para todas las métricas (NASA-TLX, SUS, AHS, SET y CSCR) en los conjuntos de datos RICO, ENRICO y Guo. En general, se observan mejoras consistentes en todas las métricas de evaluación. En particular, el conjunto de datos Guo demuestra un rendimiento superior en métricas centradas en el usuario, incluyendo una carga cognitiva menor (NASA-TLX), una usabilidad más alta (SUS), una armonía estética mejorada (AHS), un tiempo de eficiencia de búsqueda reducido (SET) y una mayor consistencia entre pantallas (CSCR). Sin embargo, estos resultados requieren una interpretación cuidadosa. Las métricas de experiencia de usuario (UX) mejoradas observadas para el conjunto de datos Guo se atribuyen principalmente a su fuerte consistencia de color y composición visual relativamente más sencilla, más que a una calidad superior en el diseño estructural. Aunque los usuarios perciben estas interfaces como más armoniosas visualmente y menos exigentes cognitivamente, resultados previos demuestran que el conjunto de datos Guo tiene un desempeño deficiente en cuanto a alineación, agrupación y orden de lectura. Esto resalta una distinción importante entre factores perceptuales y estructurales en el diseño de interfaces de usuario. Si bien los atributos perceptuales, como la armonía de color, mejoran significativamente la experiencia de usuario, la precisión estructural y la consistencia del diseño siguen siendo fundamentales para la usabilidad funcional. Por lo tanto, un diseño óptimo de interfaz de usuario requiere un equilibrio entre armonía perceptual y corrección estructural.

Figura 9. Comparación de métricas del estudio con usuarios en diferentes conjuntos de datos. El gráfico de barras agrupadas compara las métricas del estudio con usuarios en los conjuntos de datos RICO, ENRICO y Guo’s UI Color Datasets. El eje x representa métricas de evaluación, incluyendo el Índice de Carga de Trabajo de la NASA (NASA-TLX), la Escala de Usabilidad del Sistema (SUS), la Puntuación de Armonía Estética (AHS), el Tiempo de Eficiencia Estructural (SET) y la Tasa de Consistencia entre Pantallas (CSCR), mientras que el eje y indica las puntuaciones correspondientes. Las barras representan el desempeño de cada conjunto de datos, mostrando diferencias en usabilidad, carga cognitiva, calidad estética y consistencia de la interfaz. NASA-TLX (0–100, menor es mejor), SUS (0–100, mayor es mejor), AHS (1–7 Likert), SET (s, menor es mejor) y CSCR (0–1, mayor es mejor). Haga clic aquí para ver una versión más grande de esta figura.
Validación estadística de hipótesis
Para validar aún más las hipótesis propuestas (H1–H4), se realizó una prueba de significancia estadística sobre métricas clave de evaluación, incluyendo calidad del diseño, carga cognitiva, armonía del color y medidas de usabilidad (Tabla 6). Los resultados se presentan como media ± desviación estándar, y la significancia estadística se evaluó mediante pruebas t pareadas con un intervalo de confianza del 95 % (p < 0,05). Los resultados indican que el marco propuesto logra mejoras estadísticamente significativas frente a los enfoques básicos en múltiples métricas, incluyendo precisión de alineación, precisión de agrupamiento, orden de lectura, carga cognitiva (NASA-TLX) y medidas de armonía del color. En particular, las reducciones en la carga cognitiva y las mejoras en las métricas de usabilidad muestran diferencias altamente significativas (p < 0,01). Estos hallazgos confirman que la integración de principios de diseño cognitivo y modelado perceptual del color conduce a mejoras medibles y estadísticamente significativas en la calidad de la interfaz de usuario, respaldando así las hipótesis H1–H4.
| Métrica | Línea base (Media ± DE) | Propuesta (Media ± DE) | Mejora (%) | valor p | Significancia |
| Error de alineación (↓) | 7.8 ± 1.2 | 4.2 ± 0.9 | 46.10% | 0.003 | Significativo |
| Precisión de agrupamiento (↑) | 0.68 ± 0.05 | 0.82 ± 0.04 | 20.50% | 0.001 | Significativo |
| Precisión del orden de lectura (↑) | 0.72 ± 0.06 | 0.87 ± 0.03 | 20.80% | 0.002 | Significativo |
| NASA-TLX (↓) | 68.5 ± 5.4 | 47.2 ± 4.8 | 31.10% | 0.0005 | Altamente significativo |
| Puntuación SUS (↑) | 71.3 ± 6.2 | 88.9 ± 4.5 | 24.70% | 0.0008 | Altamente significativo |
| Índice de armonía cromática (↑) | 0.61 ± 0.07 | 0.83 ± 0.05 | 36.00% | 0.001 | Significativo |
| Relación de contraste (↑) | 4.1 ± 0.6 | 6.2 ± 0.5 | 51.20% | 0.002 | Significativo |
Tabla 6: Comparación estadística de las métricas de desempeño entre los métodos de referencia y el método propuesto. La tabla presenta la media y la desviación estándar (media ± DE) de métricas clave de desempeño, incluyendo error de alineación, precisión en agrupamiento, precisión en orden de lectura, Índice de Carga de Trabajo NASA (NASA-TLX), escala de usabilidad del sistema (SUS), índice de armonía cromática y relación de contraste. Se indican los porcentajes de mejora, los valores p y los niveles de significancia estadística. (↑) indica que valores más altos son mejores, y (↓) indica que valores más bajos son mejores. La significancia estadística se evaluó con p < 0,05.
Observaciones específicas del conjunto de datos
El rendimiento relativamente inferior observado en las métricas estructurales en el conjunto de datos Guo puede atribuirse a sus características inherentes. El conjunto de datos Guo es más pequeño que RICO y ENRICO y se centra principalmente en características de color perceptuales en lugar de anotaciones de diseño estructurado. Como resultado, presenta una mayor variabilidad en la colocación de componentes, una organización jerárquica más débil y estructuras de diseño menos consistentes entre pantallas. Estas propiedades dificultan más el aprendizaje estructural y la optimización del diseño, lo que explica el menor rendimiento en las métricas de alineación, agrupamiento y orden de lectura, a pesar del buen desempeño en evaluaciones perceptuales y centradas en el usuario.
Estudio de ablación
El estudio de ablación evalúa la contribución de cada módulo dentro del marco propuesto mediante la eliminación sistemática de componentes individuales y el análisis de su impacto en la calidad del diseño, la modelización del color y el rendimiento de detección. La calidad del diseño se evalúa utilizando AE, GA, ROA y LCS. AE refleja la desviación posicional de los elementos de la interfaz de usuario, donde valores más altos indican una estructura espacial más débil. GA evalúa la eficacia con la que los componentes se organizan según los principios de la Gestalt. ROA mide la preservación del flujo visual lógico, mientras que LCS cuantifica la coherencia estructural entre pantallas en términos de alineación, espaciado y organización del diseño. La degradación de la calidad del color se evalúa mediante ΔE (diferencia de color perceptual), CHI y CDS, que conjuntamente evalúan la uniformidad perceptual, la coherencia estética y la riqueza de la paleta. El rendimiento de detección se evalúa mediante mAP, precisión y exhaustividad, que cuantifican el impacto de reemplazar el módulo Faster R-CNN por un modelo de detección más simple. En conjunto, estas métricas proporcionan una evaluación integral de cómo cada módulo contribuye al rendimiento general del sistema.
Tabla 7 resume la contribución de cada módulo y compara el marco propuesto con enfoques existentes de generación de interfaces de usuario. El modelo completo alcanza el mejor desempeño en todas las métricas de calidad de diseño, modelado de color y detección, lo que demuestra que el diseño cognitivo, el modelado perceptual de color y la comprensión visual profunda tienen un efecto sinérgico. Cuando se elimina el módulo de modelado de color, ΔE aumenta significativamente, mientras que CHI y CDS disminuyen considerablemente, lo que indica una pérdida de uniformidad perceptual y armonía cromática. Esto confirma la importancia del modelado basado en CAM02-UCS para mantener la calidad estética y perceptual. La eliminación del módulo de diseño cognitivo provoca un aumento significativo en AE y disminuciones notables en GA y ROA, lo que demuestra que los principios de diseño cognitivo son esenciales para producir diseños estructuralmente coherentes y legibles. La supresión del módulo de consistencia entre pantallas conduce a una reducción en LCS, confirmando su papel en el mantenimiento de patrones de diseño consistentes en múltiples pantallas. Reemplazar el detector Faster R-CNN por una CNN más simple resulta en una marcada disminución en mAP, precisión y recuperación, destacando la importancia crítica de una detección robusta de componentes en todo el proceso. En comparación con métodos básicos, incluidos pix2code, REDRAW y LDGM, el marco propuesto supera consistentemente a todos los enfoques en precisión de diseño, coherencia visual y calidad perceptual del color.
| Método / Módulo | AE ↓ | GA ↑ | ROA ↑ | LCS ↑ | ΔE ↓ | CHI ↑ | CDS ↑ | mAP ↑ |
| Módulo de color eliminado | 0.14 | 0.86 | 0.92 | 0.84 | 7.85 | 0.61 | 12.4 | 0.9 |
| Módulo de distribución cognitiva eliminado | 0.18 | 0.72 | 0.73 | 0.69 | 4.21 | 0.79 | 17.9 | 0.89 |
| Consistencia multi-pantalla eliminada | 0.17 | 0.81 | 0.88 | 0.62 | 4.18 | 0.81 | 17.3 | 0.9 |
| Faster R-CNN sustituido por CNN simple | 0.16 | 0.85 | 0.91 | 0.85 | 4.15 | 0.82 | 18.1 | 0.74 |
| Pix2Code | 0.25 | 0.61 | 0.65 | 0.51 | 10.2 | 0.48 | 9.6 | 0.65 |
| REDRAW | 0.21 | 0.66 | 0.72 | 0.56 | 8.7 | 0.52 | 11.4 | 0.72 |
| LDGM (Difusión de distribución) | 0.19 | 0.74 | 0.79 | 0.63 | 6.9 | 0.59 | 13.8 | 0.8 |
| Modelo completo propuesto | 0.12 | 0.89 | 0.94 | 0.87 | 4.12 | 0.83 | 18.7 | 0.91 |
Tabla 7: Estudio de ablación y análisis comparativo del rendimiento del marco propuesto y los métodos básicos. La tabla evalúa el impacto de componentes individuales mediante la comparación del modelo completo propuesto con variantes en las que se eliminan módulos específicos (módulo de color, módulo de distribución cognitiva, consistencia entre pantallas y sustitución de Faster R-CNN por una CNN sencilla), así como con métodos básicos (pix2code, REDRAW y LDGM). El rendimiento se evalúa mediante el error de alineación (AE), la precisión de agrupamiento (GA), la precisión del orden de lectura (ROA), la puntuación de consistencia de distribución (LCS), la diferencia de color perceptual (ΔE), el índice de armonía de color (CHI), la puntuación de diversidad de color (CDS) y la precisión media promedio (mAP). (↑) indica que valores más altos son mejores, y (↓) indica que valores más bajos son mejores.
DISPONIBILIDAD DE LOS DATOS:
Los conjuntos de datos utilizados en este estudio están disponibles en los siguientes enlaces: conjunto de datos RICO: https://interactionmining.org/rico; conjunto de datos ENRICO: https://github.com/luileito/enrico; conjunto de datos de color de interfaz de usuario de Guo: https://github.com/guozhongke/UI-Color-Dataset.
Archivo complementario 1. Formulaciones matemáticas y detalles extendidos de implementación. Este archivo proporciona las formulaciones matemáticas detalladas y los flujos de trabajo algorítmicos que respaldan el marco propuesto de prototipado automatizado de interfaces de usuario (UI). Incluye el entrenamiento de detección de componentes, extracción de patrones de disposición, modelado de armonía de color, el objetivo unificado de prototipado de interfaces de usuario, detalles de detección mediante Faster R-CNN, cálculos de similitud de alineación y distancia espacial, construcción de árboles lógicos de interfaces de usuario, modelado de color perceptual basado en CAM02-UCS, optimización de diseño cognitivo, modelado de consistencia entre pantallas y los Algoritmos S1–S3.Haga clic aquí para descargar este archivo.