$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Le cadre de prototypage d'interface utilisateur automatisé proposé a été évalué à l'aide d'un ensemble de données intégré comprenant 5 128 écrans d'interface utilisateur provenant de trois sources : 4 000 images RICO, 1 000 écrans ENRICO et 128 échantillons d'interfaces utilisateur annotés en couleurs provenant de la base de données UI Color de Guo. Cet ensemble de données mixte fournit une référence bien équilibrée pour évaluer la précision de détection des composants, la clarté structurelle de la disposition, la cohérence entre plusieurs écrans et l'harmonie perceptive des couleurs.
Les résultats expérimentaux montrent que le modèle de détection basé sur Faster R-CNN atteint une précision de détection des composants de 92,4 % et se généralise efficacement à divers styles d'interfaces mobiles. De plus, l'intégration d'annotations de motifs provenant d'ENRICO améliore le raisonnement de la disposition, entraînant une augmentation de 18,7 % de la clarté de la mise en page et une meilleure préservation de l'ordre de lecture. Dans les expériences d'évaluation des couleurs, le module de modélisation des couleurs piloté par CAM02-UCS génère des palettes qui sont, selon les évaluations des designers, 24,5 % plus harmonieuses et offrent une uniformité perceptive supérieure par rapport aux méthodes traditionnelles de génération de palettes basées sur RGB et LAB. Par ailleurs, la modélisation de la cohérence entre écrans permet une amélioration de 28 % de l'alignement inter-écrans et de la cohérence typographique. Des études utilisateurs impliquant 30 participants montrent une réduction de 31 % de la charge cognitive perçue lors de l'interaction avec les prototypes produits par le système proposé. Ensemble, ces résultats indiquent que la combinaison de la détection de composants, de la modélisation perceptive des couleurs et de l'optimisation cognitive permet de produire des prototypes d'interface qui sont non seulement structurellement précis, mais aussi visuellement cohérents et cognitivement efficaces. Tableau 3 met en évidence l'environnement de simulation et les paramètres techniques utilisés pour évaluer le cadre de prototypage d'interface proposé. Les procédures de formation intensives en calcul pour Faster R-CNN et les modules de cohérence de la disposition ont été réalisées à l'aide d'un GPU haute performance NVIDIA RTX 4090. Toutes les expériences ont été menées dans un environnement Ubuntu 22.04 en utilisant PyTorch 2.0 pour l'implémentation de l'apprentissage profond.
| Paramètre | Configuration |
| Matériel | NVIDIA RTX 4090 GPU (24 GB), processeur Intel i9, 64 Go de RAM |
| Système d'exploitation | Ubuntu 22.04 LTS |
| Framework d'apprentissage profond | PyTorch 2.0 |
| Backbone Faster R-CNN | ResNet-50 + FPN |
| Résolution d'image | 480 × 800 (normalisée pour tous les jeux de données) |
| Taille du lot d'entraînement | 8 |
| Optimiseur | AdamW (LR = 1e−4, décroissance du poids = 0,01) |
| Époques | 40 |
| Espace de modélisation des couleurs | CAM02-UCS |
| Regroupement pour l'extraction de la palette | K-means (k = 5) |
| Regroupement de la disposition | DBSCAN (ε = 20, min_samples = 3) |
Tableau 3 : Paramètres de mise en œuvre et configuration expérimentale du cadre proposé. Le tableau résume la configuration matérielle et logicielle utilisée pour l'entraînement et l'évaluation du modèle, incluant les ressources informatiques, le système d'exploitation, le framework d'apprentissage profond, l'architecture du modèle, la résolution des images, les paramètres d'entraînement, la stratégie d'optimisation, l'espace de modélisation des couleurs, ainsi que les méthodes de regroupement utilisées pour l'extraction de la palette et le regroupement de la disposition.
L'architecture Faster R-CNN utilise un réseau ResNet-50 comme base avec un FPN afin de détecter un large éventail de composants d'interface utilisateur finement détaillés. Toutes les images d'interface sont redimensionnées uniformément à 480 × 800 pixels avant traitement. L'entraînement est effectué sur 60 époques à l'aide de l'optimiseur SGD, avec une taille de lot de 16 pour garantir une convergence stable. Le générateur de palette de couleurs utilise CAM02-UCS combiné à un regroupement par K-moyennes, tandis que DBSCAN est utilisé pour le regroupement de la disposition structurelle. Ces paramètres techniques assurent que les résultats d'interface utilisateur générés sont reproductibles, stables et de haute fidélité. Afin d'évaluer de manière complète le cadre proposé de prototypage automatisé d'interface utilisateur, quatre catégories de métriques d'évaluation sont utilisées :
i) Les performances de détection des composants, analysées à l'aide de la précision, du rappel, du score F1, de l'intersection sur l'union (IoU) et de la précision moyenne (mAP), qui quantifient l'exactitude du modèle Faster R-CNN dans l'identification des composants d'interface utilisateur sur les jeux de données RICO et ENRICO ;
ii) La clarté de la disposition et la cohérence structurelle, mesurées à l’aide de l’erreur d’alignement (AE), de la précision du regroupement, de la justesse de l’ordre de lecture et des scores de cohérence entre écrans dérivés des contraintes des motifs de conception ;
iii) La qualité perceptive des couleurs, évaluée à l'aide de la distance perceptuelle CAM02-UCS (ΔE_UCS), des rapports de contraste WCAG 2.1, de l'indice de diversité et de scores d'harmonie des couleurs inspirés du cadre d'évaluation des couleurs d'interface utilisateur de Guo ;
iv) Des métriques d'efficacité cognitive centrées sur l'utilisateur, incluant la charge cognitive mesurée par l'indice de charge mentale NASA (NASA-TLX), les évaluations de cohérence esthétique et l'efficacité d'exécution des tâches.
Ces métriques permettent d'évaluer le cadre non seulement en termes de précision de détection, mais aussi en termes d'harmonie perceptive, de qualité d'utilisation et d'expérience cognitive.
Métriques de détection des composants
La précision décrit l'exactitude du modèle dans la prédiction des composants d'interface utilisateur sans générer de faux positifs. Une précision élevée implique que la majorité des boîtes englobantes prédites correspondent à des éléments d'interface valide. Le rappel mesure la capacité du modèle à identifier tous les composants d'interface pertinents sur un écran. Un rappel élevé indique que le modèle détecte avec succès la plupart des composants de référence. Le score F1, défini comme la moyenne harmonique de la précision et du rappel, fournit une évaluation équilibrée et est particulièrement utile lorsque les composants d'interface sont répartis de manière inégale dans les ensembles de données.
La métrique IoU mesure dans quelle mesure la boîte englobante prédite se superpose à la boîte englobante de référence. Dans les tâches de détection d'objets, des seuils IoU de 0,5 et 0,75 sont couramment utilisés pour représenter des conditions d'évaluation modérées et strictes. La mAP résume la performance de détection sur plusieurs seuils IoU. La métrique mAP@0,5:0,95 fournit une évaluation plus robuste en moyennant la précision sur des seuils allant de 0,5 à 0,95 par pas de 0,05, et est donc largement acceptée comme référence standard pour la détection d'objets.
Les résultats de détection sur les trois ensembles de données indiquent que le module de détection de composants proposé offre des performances régulières et élevées. Les résultats quantitatifs sont présentés dans le Tableau 4. L'ensemble de données RICO atteint les performances les plus élevées, avec une précision de 0,91, un rappel de 0,88 et un score F1 de 0,89, grâce à son vaste ensemble d'annotations de composants d'interface utilisateur, très diversifié. ENRICO présente des scores légèrement inférieurs en raison de sa structure plus simplifiée et du nombre réduit de types de composants annotés. L'ensemble de données Guo enregistre le score F1 le plus faible (0,81), probablement en raison de variations visuelles plus importantes et de motifs de disposition moins standardisés, ce qui rend la détection plus difficile. Dans l'ensemble, ces résultats confirment que le modèle conserve des performances robustes en matière de détection de composants, quelles que soient les styles de conception d'interface utilisateur et les caractéristiques des ensembles de données.
| Jeu de données | Précision | Rappel | Score F1 |
| RICO | 0.91 | 0.88 | 0.89 |
| ENRICO | 0.87 | 0.84 | 0.85 |
| Guo | 0.83 | 0.8 | 0.81 |
Tableau 4 : Performances de détection des composants sur différents ensembles de données. Le tableau présente la précision, le rappel et le score F1 pour la détection des composants d'interface utilisateur sur les ensembles de données RICO, ENRICO et Guo, démontrant l'efficacité du modèle de détection.
Figure 3 montre les performances du modèle sur les jeux de données RICO, ENRICO et Guo à des seuils d’intersection sur l’union (IoU) de 0,5 et 0,75. Comme prévu, les valeurs de mAP sont plus élevées à un IoU de 0,5 en raison d'une exigence de recouvrement plus permissive. RICO présente systématiquement les valeurs de mAP les plus élevées (0,89 à un IoU de 0,5 et 0,78 à un IoU de 0,75), reflétant la richesse et la cohérence de ses annotations. ENRICO affiche des valeurs légèrement inférieures, tandis que Guo enregistre les scores les plus bas en raison d'une plus grande variation du style de mise en page et de la densité des composants. La tendance à la baisse observée avec des seuils d’IoU plus stricts illustre que la complexité du jeu de données influence directement la robustesse de la détection.

Figure 3. Précision moyenne (mAP) aux seuils d'intersection sur union (IoU) de 0,5 et 0,75 selon les jeux de données. Le graphique en courbes compare les performances de détection des composants sur les jeux de données RICO, ENRICO et Guo. L'axe des abscisses représente les jeux de données, et l'axe des ordonnées indique les valeurs de mAP. Deux courbes correspondent aux seuils d’IoU de 0,5 et 0,75, illustrant la variation des performances selon différents niveaux de sévérité de détection. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Figure 4 présente le mAP@IoU(0,5:0,95) pour chaque jeu de données, offrant une évaluation plus large des performances de détection à travers dix seuils IoU. Les résultats révèlent une tendance clairement décroissante, passant de RICO (0,61) à ENRICO (0,57) puis à Guo (0,52), confirmant que le modèle de détection proposé se généralise mieux sur des jeux de données plus grands et plus structurés. Cette métrique moyennée plus stricte met en évidence des dégradations subtiles des performances qui pourraient ne pas être apparentes lors d'une évaluation à seuil unique. Ces résultats indiquent que, bien que le modèle affiche de bonnes performances sur l'ensemble des jeux de données, une diversité accrue des agencements et une plus grande variabilité des composants introduisent des défis supplémentaires dans le cadre d'une évaluation rigoureuse de type COCO. Les résultats de détection sont présentés dans les Figures 3 et 4, qui fournissent des comparaisons quantitatives du mAP à différents niveaux IoU.

Figure 4. Précision moyenne (mAP) moyennée sur les seuils d'intersection sur union (IoU) allant de 0,5 à 0,95 à travers les jeux de données. Le graphique en courbes illustre les performances de détection des composants sur les jeux de données RICO, ENRICO et Guo, en utilisant la métrique mAP moyennée sur des seuils IoU variant de 0,5 à 0,95. L'axe des abscisses représente les jeux de données, et l'axe des ordonnées indique les valeurs mAP correspondantes rapportées sur une échelle de 0 à 1, reflétant les performances du modèle sous différents seuils de détection. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Métriques de qualité de la disposition
La qualité de la disposition est évaluée à l'aide de l'AE, de la précision du regroupement (GA) et de la précision de l'ordre de lecture (ROA), qui évaluent collectivement la justesse structurelle, l'organisation perceptive et la lisibilité cognitive des dispositions d'interface utilisateur générées.
Erreur d'alignement.
L'AE (écart au pixel près) indique dans quelle mesure les éléments d'interface sont alignés par rapport à des lignes d'alignement idéales, telles que les repères gauche, droit, supérieur ou de la ligne de base. Une valeur d'AE plus faible indique que les éléments sont disposés de manière cohérente avec une distorsion visuelle minimale, améliorant ainsi la lisibilité et la clarté globale du design. Ce critère est particulièrement important pour évaluer l'affinage de la disposition cognitive, car un mauvais alignement perturbe le flux visuel et augmente la complexité perçue. Figure 5 illustre l'AE sur les jeux de données RICO, ENRICO et Guo, mesurée comme l'écart moyen en pixels par rapport aux lignes d'alignement idéales. Les résultats montrent que RICO atteint la plus faible valeur d'AE (4,2 px), indiquant que les composants d'interface de ce jeu de données présentent des motifs structurels plus cohérents, ce qui facilite l'alignement pour le modèle. ENRICO suit avec un écart d'alignement modéré de 6,1 px, reflétant une combinaison de mises en page bien structurées et variées. Le jeu de données Guo enregistre la valeur d'AE la plus élevée (7,4 px), en raison d'une plus grande diversité dans le positionnement des composants et de structures de mise en page non standard, ce qui rend plus difficile l'affinage basé sur l'alignement. Dans l'ensemble, ces résultats démontrent que le modèle conserve une grande précision d'alignement sur l'ensemble des jeux de données, malgré une complexité croissante des mises en page.

Figure 5. Erreur d'alignement entre les jeux de données. La figure montre l'erreur d'alignement entre les jeux de données ; des valeurs plus faibles indiquent un meilleur alignement. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Précision du regroupement (GA).
L'analyse de regroupement (GA) quantifie dans quelle mesure le modèle regroupe efficacement les composants d'interface utilisateur (UI) apparentés, par exemple selon les principes de la Gestalt tels que la proximité, la similarité et la continuité. Une précision de regroupement plus élevée indique que le modèle préserve la structure prévue des éléments d'interface, permettant aux utilisateurs d'interpréter l'interface de manière plus naturelle. Cette métrique est particulièrement utile pour évaluer si le module d'affinement de la disposition parvient effectivement à organiser le contenu en groupes visuels significatifs. Figure 6 présente la distribution de la GA obtenue par le cadre proposé sur les trois jeux de données. Le jeu de données ENRICO présente la médiane de GA la plus élevée et l'intervalle interquartile le plus faible, indiquant une performance de regroupement stable et cohérente grâce à ses dispositions bien définies et étiquetées selon des motifs. Le jeu de données RICO montre une précision de regroupement modérée avec une variabilité plus importante, probablement en raison de sa plus grande diversité et de la complexité de ses dispositions. Le jeu de données Guo UI Color enregistre une précision de regroupement inférieure, car ses échantillons sont visuellement hétérogènes et moins centrés sur la structure de la disposition. Dans l'ensemble, les résultats indiquent que le module cognitif d'affinement de la disposition fonctionne de manière fiable sur l'ensemble des jeux de données, offrant les meilleures performances de regroupement sur des données structurellement cohérentes.

Figure 6. Répartition de la précision du regroupement selon les ensembles de données. Le graphique en boîte montre la précision du regroupement fondée sur les principes de la Gestalt à travers les ensembles de données RICO, ENRICO et Guo’s UI Color. Les boîtes représentent l'intervalle interquartile, la ligne centrale indique la médiane, et les moustaches indiquent l'étendue des valeurs. L'axe des abscisses représente les ensembles de données, et l'axe des ordonnées montre les scores de précision du regroupement. La taille de l'échantillon est n=5128 écrans d'interface utilisateur (RICO : 4000, ENRICO : 1000 et Guo : 128). Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Précision de l'ordre de lecture (ROA).
La précision de l'ordre de lecture (ROA) mesure dans quelle mesure le modèle prédit précisément le flux de lecture naturel d'un écran d'interface utilisateur, généralement selon un motif de haut en bas et de gauche à droite. Le maintien d'un ordre de lecture correct est essentiel pour l'utilisabilité, la clarté de la navigation et la cohérence avec les conventions de conception établies. Un ROA plus élevé indique que le système préserve les schémas de balayage cognitif attendus. Figure 7 présente le ROA à travers différentes étapes d'évaluation pour les jeux de données RICO, ENRICO et Guo. ENRICO atteint systématiquement le ROA le plus élevé en raison de sa structure de mise en page régulière et orientée motif, ce qui permet une prédiction plus précise de séquences de lecture proches de celles des humains. RICO montre une performance modérée avec une légère variabilité, reflétant sa plus grande diversité et sa complexité proche du monde réel. Le jeu de données Guo présente le ROA le plus faible, car de nombreux écrans sont riches visuellement mais manquent de hiérarchies de lecture clairement définies. Dans l'ensemble, ces résultats indiquent que le module proposé de raffinement de la mise en page cognitive fonctionne de manière plus fiable sur des jeux de données structurés tout en maintenant des prédictions stables de l'ordre de lecture à travers des conceptions d'interfaces utilisateur variées.

Figure 7. Précision de l’ordre de lecture au cours des étapes d’évaluation pour plusieurs ensembles de données. Le graphique en courbes montre la précision de l’ordre de lecture au fil des étapes d’évaluation pour les ensembles de données RICO, ENRICO et Guo’s UI Color. L’axe des abscisses représente l’étape d’évaluation, et l’axe des ordonnées indique la précision de l’ordre de lecture. Chaque courbe correspond à un ensemble de données, illustrant les variations dans la préservation du flux visuel au cours des étapes successives d’évaluation. L’étape d’évaluation représente les phases progressives de raffinement du cadre proposé. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Score de cohérence de la mise en page (LCS)
Le score de cohérence de disposition (LCS) mesure dans quelle mesure les dispositions d'interface utilisateur générées sont maintenues de façon cohérente sur plusieurs écrans au sein d'une même application. Cela inclut la cohérence en matière d'espacement, de règles d'alignement, de zones typographiques et de motifs de regroupement. Un score plus élevé indique une meilleure cohérence entre les écrans, ce qui se traduit par une expérience utilisateur plus unifiée et intuitive. Figure 8 présente le LCS mesuré à travers plusieurs étapes d'évaluation pour les ensembles de données RICO, ENRICO et Guo sur les couleurs d'interface utilisateur. L'ensemble de données ENRICO atteint systématiquement les valeurs LCS les plus élevées, grâce à ses écrans d'interface utilisateur étiquetés par motifs et structurellement uniformes, ce qui facilite un apprentissage plus stable de la cohérence entre écrans. En revanche, l'ensemble de données RICO montre une cohérence modérée mais en amélioration constante, attribuable à la capacité du modèle à généraliser à partir de dispositions d'interface utilisateur très variées. Comme prévu, l'ensemble de données Guo enregistre les valeurs LCS les plus faibles, car il se concentre principalement sur les caractéristiques de couleur plutôt que sur la structure de la disposition, ce qui rend la cohérence entre plusieurs écrans plus difficile. Dans l'ensemble, ces résultats indiquent que le module proposé de cohérence entre écrans fonctionne le plus efficacement sur des ensembles de données axés sur les motifs, tout en apportant des améliorations mesurables sur tous les ensembles de données.

Figure 8. Score de cohérence de la disposition au cours des étapes d'évaluation pour plusieurs ensembles de données. Le graphique en courbes montre les scores de cohérence de la disposition selon les étapes d'évaluation pour les ensembles de données RICO, ENRICO et Guo’s UI Color. L'axe des abscisses représente l'étape d'évaluation et l'axe des ordonnées indique les scores de cohérence de la disposition. Chaque courbe correspond à un ensemble de données, illustrant l'amélioration de la cohérence structurelle des interfaces générées au fil des étapes successives d'évaluation. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Métriques de qualité des couleurs
Les thèmes de couleurs d'interface générés sont évalués à l'aide de cinq métriques fondées sur la perception, dérivées de CAM02-UCS : ΔE (différence de couleur perçue), qui quantifie l'uniformité perceptive entre les couleurs de la palette ; le rapport de contraste (basé sur les WCAG 2.1), qui évalue la lisibilité entre les éléments au premier plan et en arrière-plan ; l'indice d'harmonie des couleurs (CHI), qui mesure la compatibilité esthétique entre les teintes ; le score de diversité des couleurs (CDS), qui reflète la variation dans l'espace perceptif des couleurs ; et le score de prédominance des couleurs (CPS), qui évalue l'équilibre et la dominance des couleurs au sein de la palette. Ensemble, ces métriques offrent une évaluation complète de la qualité esthétique et des performances des couleurs orientées vers l'utilisabilité. Les résultats montrent que la méthode proposée atteint une valeur de ΔE plus faible de 4,12, indiquant une meilleure uniformité perceptive entre les couleurs. Un rapport de contraste de 6,21 confirme la conformité aux normes d'accessibilité, assurant ainsi une lisibilité améliorée. Tableau 5 présente une comparaison quantitative entre le module de modélisation des couleurs proposé et les méthodes de référence. Le CHI augmente de 0,61 à 0,83, indiquant une meilleure cohésion esthétique dans les transitions de couleurs. De plus, le CDS augmente de plus de 50 %, démontrant que les palettes générées conservent une variation plus riche sans introduire de désordre visuel. Des valeurs de CPS plus élevées indiquent une répartition équilibrée des couleurs dominantes, évitant la sur-saturation par une teinte unique. Dans l'ensemble, ces résultats établissent l'efficacité du module de modélisation des couleurs basé sur CAM02-UCS pour générer des schémas de couleurs d'interface harmonieux, lisibles et optimisés sur le plan perceptif.
| Métrique | Définition | Méthode proposée | Ligne de base1 | Amélioration (%) |
| ΔE (CAM02-UCS) | Différence de couleur perceptive | 4.12 | 7.85 | 47,5 % de moins |
| Rapport de contraste (WCAG) | Lisibilité des paires FG–BG | 6.21 | 4.38 | 41.80% |
| ICH (Indice de harmonie des couleurs) | Teinte & harmonie des couleurs | 0.83 | 0.61 | 36.10% |
| CDS (indice de diversité des couleurs) | Variance en J′a′b′ espace | 18.70 | 12.40 | 50.80% |
| CPS (Score de prédominance des couleurs) | Stabilité des couleurs dominantes | 0.72 | 0.55 | 30.90% |
Tableau 5 : Comparaison quantitative des métriques de qualité des couleurs entre la méthode proposée et les méthodes de référence. Le tableau présente des métriques d'évaluation de la qualité des couleurs, incluant la différence de couleur perçue (ΔE en CAM02-UCS), le rapport de contraste (WCAG), l'indice d'harmonie des couleurs (CHI), le score de diversité des couleurs (CDS) et le score de prédominance des couleurs (CPS). Les résultats de la méthode proposée sont comparés aux valeurs de référence, ainsi qu'aux améliorations en pourcentage.
Données démographiques des participants et conception de l'étude
Un total de 30 participants ont pris part au processus d'évaluation. Les participants avaient un âge compris entre 20 et 35 ans (âge moyen : 26,4 ± 3,2 ans). La cohorte comprenait des individus aux origines variées, notamment des ingénieurs logiciels, des étudiants et des concepteurs UI/UX. Selon leur niveau d'aisance informatique auto-déclaré, 40 % des participants ont été classés comme utilisateurs intermédiaires, 35 % comme utilisateurs avancés et 25 % comme débutants. Environ la moitié des participants avaient une expérience préalable en conception UI/UX ou dans des domaines connexes, tandis que les autres participants n'en avaient pas. Cette diversité a permis d'assurer une évaluation équilibrée à travers différents niveaux de compétence technique et de familiarité avec la conception.
Métriques de l'étude utilisateur
Une évaluation centrée sur l'utilisateur a été menée à l'aide de plusieurs métriques, notamment l'échelle NASA-TLX, l'échelle de facilité d'utilisation du système (SUS), le score d'harmonie esthétique (AHS), le temps d'efficacité de recherche (SET) et l'évaluation de la cohérence entre écrans (CSCR), afin d'évaluer la charge cognitive, la facilité d'utilisation, l'attrait visuel, l'efficacité et la cohérence.
La métrique NASA-TLX quantifie la charge mentale en mesurant des facteurs tels que la demande mentale, l'effort et la frustration. Des scores plus faibles indiquent une charge cognitive réduite et une interaction plus aisée. Le cadre proposé a systématiquement conduit à des scores NASA-TLX inférieurs sur l'ensemble des jeux de données, ce qui traduit un moindre effort mental. Cette amélioration s'explique par l'intégration de principes de conception cognitive, notamment le regroupement de type Gestalt, un espacement optimisé et une hiérarchie visuelle renforcée, qui facilitent collectivement une navigation plus intuitive. La métrique SUS fournit un score normalisé d'utilisabilité compris entre 0 et 100, où des valeurs plus élevées indiquent une meilleure utilisabilité et clarté. Le cadre proposé a obtenu des scores SUS supérieurs par rapport aux méthodes de référence, reflétant des améliorations tant au niveau de la disposition structurelle que de la clarté des couleurs. Un alignement, un espacement et un flux de navigation améliorés ont contribué à des interfaces perçues par les utilisateurs comme plus intuitives et fonctionnellement cohérentes. L'AHS, mesurée sur une échelle de Likert à 7 points, évalue l'attrait visuel perçu et l'harmonie des couleurs. Les interfaces générées à l'aide du module de modélisation des couleurs basé sur CAM02-UCS ont obtenu des valeurs d'AHS plus élevées, indiquant des transitions de couleur plus douces et des palettes plus équilibrées visuellement. Les participants ont systématiquement préféré ces interfaces en raison d'un contraste amélioré, d'une cohérence des teintes et d'une réduction de la surcharge visuelle, soulignant l'importance de la modélisation perceptive des couleurs dans la conception d'interfaces utilisateur. Le SET mesure le temps nécessaire aux utilisateurs pour localiser des éléments cibles de l'interface lors de tâches de recherche visuelle. Des valeurs de SET plus faibles indiquent une meilleure organisation et hiérarchie visuelles. Le cadre proposé a significativement réduit le SET sur tous les jeux de données, démontrant que l'intégration du regroupement de type Gestalt, d'un espacement guidé par l'attention et de structures de mise en page affinées permet une interaction plus rapide et plus efficace. La métrique CSCR évalue la cohérence de la conception de l'interface sur plusieurs écrans. Des scores plus élevés indiquent une meilleure continuité en matière de disposition, de couleur et d'organisation structurelle. Le cadre proposé a obtenu des valeurs CSCR plus élevées, reflétant l'efficacité du module de cohérence multi-écran à maintenir des schémas de couleurs stables, un espacement constant et des structures hiérarchiques uniformes à travers les interfaces.
Figure 9 présente les résultats de l'étude comparative auprès des utilisateurs pour l'ensemble des métriques (NASA-TLX, SUS, AHS, SET et CSCR) sur les jeux de données RICO, ENRICO et Guo. Dans l'ensemble, des améliorations cohérentes sont observées pour toutes les métriques d'évaluation. Notamment, le jeu de données Guo démontre une performance supérieure dans les métriques centrées sur l'utilisateur, notamment une charge cognitive plus faible (NASA-TLX), une utilisabilité plus élevée (SUS), une harmonie esthétique améliorée (AHS), un temps de recherche plus court (SET) et une meilleure cohérence entre écrans (CSCR). Toutefois, ces résultats nécessitent une interprétation attentive. Les gains observés dans les métriques d'expérience utilisateur (UX) pour le jeu de données Guo sont principalement attribuables à une forte cohérence chromatique et à une composition visuelle relativement plus simple, plutôt qu'à une qualité supérieure du plan de disposition structurelle. Bien que les utilisateurs perçoivent ces interfaces comme plus harmonieuses visuellement et moins exigeantes cognitivement, des résultats antérieurs montrent que le jeu de données Guo obtient de mauvais résultats en ce qui concerne l'alignement, le regroupement et l'ordre de lecture. Cela met en évidence une distinction importante entre les facteurs perceptuels et les facteurs structurels en conception d'interface utilisateur. Alors que les attributs perceptuels, tels que l'harmonie des couleurs, améliorent significativement l'expérience utilisateur, la précision structurelle et la cohérence de la disposition restent essentielles pour une utilisabilité fonctionnelle. Par conséquent, une conception optimale d'interface utilisateur exige un équilibre entre harmonie perceptuelle et justesse structurelle.

Figure 9. Comparaison des métriques de l'étude utilisateur entre les jeux de données. Le graphique à barres groupées compare les métriques de l'étude utilisateur entre les jeux de données RICO, ENRICO et Guo’s UI Color Datasets. L'axe des abscisses représente les métriques d'évaluation, notamment l'indice de charge de travail NASA (NASA-TLX), l'échelle de facilité d'utilisation du système (SUS), le score d'harmonie esthétique (AHS), le temps d'efficacité structurelle (SET) et le taux de cohérence entre écrans (CSCR), tandis que l'axe des ordonnées indique les scores correspondants. Les barres illustrent les performances pour chaque jeu de données, mettant en évidence les différences en termes de convivialité, de charge cognitive, de qualité esthétique et de cohérence de l'interface. NASA-TLX (0–100, plus bas est meilleur), SUS (0–100, plus élevé est meilleur), AHS (1–7, échelle de Likert), SET (s, plus bas est meilleur) et CSCR (0–1, plus élevé est meilleur). Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Validation statistique des hypothèses
Afin de valider davantage les hypothèses proposées (H1–H4), des tests de significativité statistique ont été effectués sur des métriques d'évaluation clés, notamment la qualité de la mise en page, la charge cognitive, l'harmonie des couleurs et les mesures d'utilisabilité (Tableau 6). Les résultats sont exprimés sous la forme moyenne ± écart-type, et la significativité statistique a été évaluée à l'aide de tests t appariés avec un intervalle de confiance de 95 % (p < 0,05). Les résultats indiquent que le cadre proposé permet des améliorations statistiquement significatives par rapport aux approches de référence sur plusieurs métriques, notamment la précision de l'alignement, la précision du regroupement, l'ordre de lecture, la charge cognitive (NASA-TLX) et les mesures d'harmonie des couleurs. Notamment, les réductions de la charge cognitive et les améliorations des métriques d'utilisabilité montrent des différences hautement significatives (p < 0,01). Ces résultats confirment que l'intégration de principes de conception cognitive et de modélisation perceptive des couleurs conduit à des améliorations mesurables et statistiquement significatives de la qualité de l'interface utilisateur, soutenant ainsi les hypothèses H1–H4.
| Métrique | Valeur de base (moyenne ± ÉT) | Proposé (moyenne ± ÉT) | Amélioration (%) | valeur-p | Signification |
| Erreur d'alignement (↓) | 7,8 ± 1,2 | 4,2 ± 0,9 | 46,10 % | 0,003 | Significatif |
| Précision du regroupement (↑) | 0,68 ± 0,05 | 0,82 ± 0,04 | 20,50 % | 0,001 | Significatif |
| Précision de l'ordre de lecture (↑) | 0,72 ± 0,06 | 0,87 ± 0,03 | 20,80 % | 0,002 | Significatif |
| NASA-TLX (↓) | 68,5 ± 5,4 | 47,2 ± 4,8 | 31,10 % | 0,0005 | Très significatif |
| Note SUS (↑) | 71,3 ± 6,2 | 88,9 ± 4,5 | 24,70 % | 0,0008 | Très significatif |
| Indice d'harmonie des couleurs (↑) | 0,61 ± 0,07 | 0,83 ± 0,05 | 36,00 % | 0,001 | Significatif |
| Rapport de contraste (↑) | 4,1 ± 0,6 | 6,2 ± 0,5 | 51,20 % | 0,002 | Significatif |
Tableau 6 : Comparaison statistique des métriques de performance entre les méthodes de base et la méthode proposée. Le tableau présente la moyenne et l'écart type (moyenne ± ÉT) pour les métriques de performance clés, notamment l'erreur d'alignement, la précision du regroupement, la précision de l'ordre de lecture, l'indice de charge de travail NASA (NASA-TLX), l'échelle d'utilisabilité du système (SUS), l'indice d'harmonie des couleurs et le rapport de contraste. Les améliorations en pourcentage, les valeurs de p et les niveaux de signification statistique sont indiqués. (↑) indique que des valeurs plus élevées sont préférables, et (↓) indique que des valeurs plus faibles sont préférables. La signification statistique a été évaluée à p < 0,05.
Observations spécifiques à l'ensemble de données
Les performances relativement inférieures observées pour les métriques structurelles sur le jeu de données Guo peuvent être attribuées à ses caractéristiques intrinsèques. Le jeu de données Guo est plus petit que RICO et ENRICO et se concentre principalement sur les caractéristiques perçues des couleurs plutôt que sur des annotations de mise en page structurée. En conséquence, il présente une plus grande variabilité dans le placement des composants, une organisation hiérarchique plus faible et des structures de mise en page moins cohérentes d’un écran à l’autre. Ces propriétés rendent l’apprentissage structurel et l’optimisation de la disposition plus difficiles, ce qui explique les performances inférieures en matière d’alignement, de regroupement et d’ordre de lecture, malgré des résultats solides dans les évaluations perceptuelles et centrées sur l’utilisateur.
Étude d'ablation
L'étude d'ablation évalue la contribution de chaque module du cadre proposé en supprimant systématiquement des composants individuels et en analysant leur impact sur la qualité de la mise en page, la modélisation des couleurs et les performances de détection. La qualité de la mise en page est évaluée à l'aide de l'AE, de la GA, de la ROA et de la LCS. L'AE reflète l'écart de position des éléments d'interface utilisateur, des valeurs plus élevées indiquant une structure spatiale plus faible. La GA évalue dans quelle mesure les composants sont organisés selon les principes de la Gestalt. La ROA mesure la préservation du flux visuel logique, tandis que la LCS quantifie la cohérence structurelle entre écrans en termes d'alignement, d'espacement et d'organisation de la mise en page. La dégradation de la qualité des couleurs est évaluée à l'aide du ΔE (différence de couleur perçue), du CHI et du CDS, qui évaluent collectivement l'uniformité perceptive, la cohérence esthétique et la richesse de la palette. Les performances de détection sont évaluées à l'aide du mAP, de la précision et du rappel, qui quantifient l'impact du remplacement du module Faster R-CNN par un modèle de détection plus simple. Ensemble, ces métriques fournissent une évaluation complète de la manière dont chaque module contribue aux performances globales du système.
Tableau 7 résume la contribution de chaque module et compare le cadre proposé avec les approches existantes de génération d'interface utilisateur. Le modèle complet atteint les meilleures performances sur tous les indicateurs de qualité de mise en page, de modélisation des couleurs et de détection, démontrant que la conception cognitive, la modélisation perceptive des couleurs et la compréhension visuelle profonde ont un effet synergique. Lorsque le module de modélisation des couleurs est supprimé, le ΔE augmente significativement, tandis que le CHI et le CDS diminuent fortement, indiquant une perte d'uniformité perceptive et d'harmonie des couleurs. Ceci confirme l'importance de la modélisation fondée sur CAM02-UCS pour préserver la qualité esthétique et perceptive. La suppression du module de mise en page cognitive entraîne une augmentation significative de l'AE et des baisses notables du GA et du ROA, démontrant que les principes de conception cognitive sont essentiels pour produire des mises en page structurellement cohérentes et lisibles. La suppression du module de cohérence multiscreen conduit à une réduction du LCS, confirmant son rôle dans le maintien de motifs de mise en page cohérents sur plusieurs écrans. Le remplacement du détecteur Faster R-CNN par un CNN plus simple entraîne une forte baisse du mAP, de la précision et du rappel, soulignant l'importance cruciale d'une détection robuste des composants dans l'ensemble du processus. Par rapport aux méthodes de référence, notamment pix2code, REDRAW et LDGM, le cadre proposé surpasse systématiquement toutes les approches en matière de précision de la mise en page, de cohérence visuelle et de qualité perceptive des couleurs.
| Méthode / Module | AE ↓ | GA ↑ | ROA ↑ | LCS ↑ | ΔE ↓ | CHI ↑ | CDS ↑ | mAP ↑ |
| Module de couleur supprimé | 0.14 | 0.86 | 0.92 | 0.84 | 7.85 | 0.61 | 12.4 | 0.9 |
| Module de disposition cognitive supprimé | 0.18 | 0.72 | 0.73 | 0.69 | 4.21 | 0.79 | 17.9 | 0.89 |
| Suppression de la cohérence multi-écran | 0.17 | 0.81 | 0.88 | 0.62 | 4.18 | 0.81 | 17.3 | 0.9 |
| Faster R-CNN remplacé par un CNN simple | 0.16 | 0.85 | 0.91 | 0.85 | 4.15 | 0.82 | 18.1 | 0.74 |
| Pix2Code | 0.25 | 0.61 | 0.65 | 0.51 | 10.2 | 0.48 | 9.6 | 0.65 |
| REDRAW | 0.21 | 0.66 | 0.72 | 0.56 | 8.7 | 0.52 | 11.4 | 0.72 |
| LDGM (diffusion de la disposition) | 0.19 | 0.74 | 0.79 | 0.63 | 6.9 | 0.59 | 13.8 | 0.8 |
| Modèle complet proposé | 0.12 | 0.89 | 0.94 | 0.87 | 4.12 | 0.83 | 18.7 | 0.91 |
Tableau 7 : Étude d'ablation et analyse comparative des performances du cadre proposé et des méthodes de référence. Ce tableau évalue l'impact des composants individuels en comparant le modèle complet proposé à des variantes dans lesquelles certains modules sont supprimés (module de couleur, module de disposition cognitive, cohérence multiscreen et remplacement de Faster R-CNN par un CNN simple), ainsi qu'aux méthodes de référence (pix2code, REDRAW et LDGM). Les performances sont évaluées à l'aide de l'erreur d'alignement (AE), de la précision du regroupement (GA), de la précision de l'ordre de lecture (ROA), du score de cohérence de la disposition (LCS), de la différence de couleur perçue (ΔE), de l'indice d'harmonie des couleurs (CHI), du score de diversité des couleurs (CDS) et de la précision moyenne (mAP). (↑) indique que des valeurs plus élevées sont préférables, et (↓) indique que des valeurs plus faibles sont préférables.
DISPONIBILITÉ DES DONNÉES :
Les ensembles de données utilisés dans cette étude sont disponibles aux liens suivants : ensemble de données RICO : https://interactionmining.org/rico ; ensemble de données ENRICO : https://github.com/luileito/enrico ; ensemble de données sur les couleurs d'interface utilisateur de Guo : https://github.com/guozhongke/UI-Color-Dataset.
Fichier supplémentaire 1. Formulations mathématiques et détails d'implémentation étendus. Ce fichier fournit les formulations mathématiques détaillées et les flux algorithmiques soutenant le cadre de prototypage automatisé d'interface utilisateur proposé. Il inclut l'apprentissage de la détection de composants, l'extraction de motifs de disposition, la modélisation de l'harmonie des couleurs, l'objectif unifié de prototypage d'interface utilisateur, les détails de détection de Faster R-CNN, les calculs de distance spatiale et de similarité d'alignement, la construction de l'arbre logique d'interface utilisateur, la modélisation perceptive des couleurs basée sur CAM02-UCS, l'optimisation de conception cognitive, la modélisation de la cohérence multisupport et les algorithmes S1 à S3.Veuillez cliquer ici pour télécharger ce fichier.