$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Il framework proposto per la prototipazione automatica di interfacce utente è stato valutato utilizzando un dataset integrato composto da 5.128 schermate di interfacce utente provenienti da tre fonti: 4.000 immagini RICO, 1.000 schermate ENRICO e 128 campioni di interfacce utente con annotazioni colore del Guo’s UI Color Dataset. Questo dataset combinato fornisce un benchmark ben bilanciato per valutare l'accuratezza nel rilevamento dei componenti, la chiarezza strutturale del layout, la coerenza tra più schermate e l'armonia percettiva dei colori.
I risultati sperimentali dimostrano che il modello di rilevamento basato su Faster R-CNN raggiunge un'accuratezza del 92,4% nel rilevamento dei componenti e generalizza efficacemente attraverso diversi stili di interfacce utente mobili. Inoltre, l'inserimento di annotazioni di pattern ENRICO migliora il ragionamento sul layout, determinando un aumento del 18,7% nella chiarezza del layout e una migliore preservazione dell'ordine di lettura. Negli esperimenti di valutazione del colore, il modulo di modellazione cromatica basato su CAM02-UCS genera tavolozze che risultano il 24,5% più armoniose secondo le valutazioni di designer, raggiungendo anche una maggiore uniformità percettiva rispetto ai metodi tradizionali di generazione di tavolozze basati su RGB e LAB. Inoltre, la modellazione della coerenza tra schermate ottiene un miglioramento del 28% nell'allineamento tra schermate e nella coerenza della tipografia. Studi con utenti, che hanno coinvolto 30 partecipanti, mostrano una riduzione del 31% del carico cognitivo percepito durante l'interazione con i prototipi prodotti dal sistema proposto. Nel complesso, questi risultati indicano che la combinazione di rilevamento dei componenti, modellazione percettiva del colore e ottimizzazione cognitiva produce prototipi di interfaccia utente che non sono solo strutturalmente accurati, ma anche visivamente coerenti e cognitivamente efficienti. Tabella 3 evidenzia l'ambiente di simulazione e le impostazioni tecniche utilizzate per valutare il framework proposto di prototipazione dell'interfaccia utente. Le procedure di addestramento computazionalmente intensive di Faster R-CNN e dei moduli di coerenza del layout sono state supportate da una GPU ad alte prestazioni NVIDIA RTX 4090. Tutti gli esperimenti sono stati condotti in un ambiente Ubuntu 22.04 utilizzando PyTorch 2.0 per l'implementazione del deep learning.
| Parametro | Configurazione |
| Hardware | NVIDIA RTX 4090 GPU (24 GB), processore Intel i9, 64 GB di RAM |
| Sistema operativo | Ubuntu 22.04 LTS |
| Framework di deep learning | PyTorch 2.0 |
| Backbone Faster R-CNN | ResNet-50 + FPN |
| Risoluzione dell'immagine | 480 × 800 (normalizzata per tutti i dataset) |
| Dimensione del batch di addestramento | 8 |
| Ottimizzatore | AdamW (LR = 1e−4, Weight Decay = 0,01) |
| Epoche | 40 |
| Spazio cromatico di modellizzazione | CAM02-UCS |
| Clustering per l'estrazione della tavolozza | K-means (k = 5) |
| Clustering del layout | DBSCAN (ε = 20, min_samples = 3) |
Tabella 3: Parametri di implementazione e configurazione sperimentale del framework proposto. La tabella riassume l'hardware e il setup software utilizzati per l'addestramento e la valutazione del modello, inclusi le risorse computazionali, il sistema operativo, il framework di apprendimento profondo, l'architettura del modello, la risoluzione delle immagini, i parametri di addestramento, la strategia di ottimizzazione, lo spazio di modellazione del colore e i metodi di clustering utilizzati per l'estrazione della tavolozza e il raggruppamento del layout.
L'architettura Faster R-CNN utilizza un backbone ResNet-50 con un FPN per rilevare un'ampia gamma di componenti UI finemente dettagliati. Tutte le immagini UI vengono ridimensionate uniformemente a 480 × 800 pixel prima dell'elaborazione. L'addestramento viene eseguito per 60 epoche utilizzando l'ottimizzatore SGD, con una dimensione del batch di 16 per garantire una convergenza stabile. Il generatore della tavolozza dei colori utilizza CAM02-UCS con clustering K-means, mentre DBSCAN viene impiegato per il clustering del layout strutturale. Queste impostazioni tecniche garantiscono che i risultati UI generati siano riproducibili, stabili e ad alta fedeltà. Per fornire una valutazione completa del framework proposto per il prototipaggio automatico di interfacce utente, vengono utilizzate quattro categorie di metriche di valutazione:
i) Prestazioni nel rilevamento dei componenti, analizzate mediante precisione, richiamo, punteggio F1, intersezione rispetto all'unione (IoU) e precisione media media (mAP), che quantificano l'accuratezza del modello Faster R-CNN nell'identificare i componenti dell'interfaccia utente nei dataset RICO ed ENRICO;
ii) Chiarezza del layout e coerenza strutturale, misurate attraverso l'errore di allineamento (AE), l'accuratezza del raggruppamento, la correttezza dell'ordine di lettura e i punteggi di coerenza tra schermate derivati da vincoli di modelli progettuali;
iii) Qualità percettiva del colore, valutata utilizzando la distanza percettiva CAM02-UCS (ΔE_UCS), i rapporti di contrasto WCAG 2.1, l'indice di diversità e i punteggi di armonia cromatica ispirati al framework di valutazione dei colori per interfacce utente di Guo;
iv) Metriche di efficienza cognitiva centrate sull'utente, incluse il carico cognitivo misurato dall'indice di carico di lavoro NASA (NASA-TLX), le valutazioni di coerenza estetica e l'efficienza nel completamento dei compiti.
Queste metriche consentono di valutare il framework non solo in termini di accuratezza di rilevamento, ma anche in termini di armonia percettiva, qualità di usabilità ed esperienza cognitiva.
Metriche di rilevamento dei componenti
La precisione descrive l'esattezza del modello nel prevedere i componenti dell'interfaccia utente senza generare falsi positivi. Un'elevata precisione implica che la maggior parte dei riquadri previsti corrisponda a elementi dell'interfaccia utente validi. Il richiamo misura la capacità del modello di identificare tutti i componenti dell'interfaccia utente rilevanti su uno schermo. Un alto richiamo indica che il modello riesce a rilevare la maggior parte dei componenti reali. Il punteggio F1, definito come la media armonica tra precisione e richiamo, fornisce una valutazione bilanciata ed è particolarmente utile quando i componenti dell'interfaccia utente sono distribuiti in modo non uniforme tra i dataset.
La metrica IoU misura quanto bene il riquadro previsto si sovrappone al riquadro reale di riferimento. Nei compiti di rilevamento di oggetti, soglie IoU di 0,5 e 0,75 sono comunemente utilizzate per rappresentare condizioni di valutazione moderate e rigorose. L'mAP riassume le prestazioni di rilevamento attraverso diverse soglie IoU. La metrica mAP@0.5:0.95 fornisce una valutazione più robusta, mediando la precisione su soglie comprese tra 0,5 e 0,95 con incrementi di 0,05, ed è pertanto ampiamente accettata come standard di riferimento per il rilevamento di oggetti.
I risultati di rilevamento ottenuti sui tre dataset indicano che il modulo proposto per il rilevamento dei componenti offre prestazioni costantemente elevate. I risultati quantitativi sono presentati nella Tabella 4. Il dataset RICO raggiunge le prestazioni più elevate, con una precisione di 0,91, un richiamo di 0,88 e un punteggio F1 di 0,89, grazie all'ampio insieme diversificato di annotazioni dei componenti dell'interfaccia utente. ENRICO mostra punteggi leggermente inferiori a causa della sua struttura più semplificata e del minor numero di tipi di componenti annotati. Il dataset Guo registra il punteggio F1 più basso (0,81), probabilmente a causa di una maggiore variazione visiva e di un numero ridotto di schemi di layout standardizzati, il che rende il rilevamento più complesso. Nel complesso, questi risultati confermano che il modello mantiene prestazioni solide nel rilevamento dei componenti attraverso diversi stili di progettazione dell'interfaccia utente e caratteristiche dei dataset.
| Set di dati | Precisione | Recupero | Punteggio F1 |
| RICO | 0.91 | 0.88 | 0.89 |
| ENRICO | 0.87 | 0.84 | 0.85 |
| Guo | 0.83 | 0.8 | 0.81 |
Tabella 4: Prestazioni del rilevamento dei componenti nei vari dataset. La tabella riporta precisione, richiamo e punteggio F1 per il rilevamento dei componenti dell'interfaccia utente nei dataset RICO, ENRICO e Guo, dimostrando l'efficacia del modello di rilevamento.
Figura 3 mostra le prestazioni del modello nei dataset RICO, ENRICO e Guo a soglie di IoU di 0,5 e 0,75. Come previsto, i valori di mAP sono più elevati a un IoU di 0,5 a causa del requisito di sovrapposizione meno stringente. RICO riporta costantemente i valori di mAP più alti (0,89 a un IoU di 0,5 e 0,78 a un IoU di 0,75), riflettendo la ricchezza e la coerenza delle sue annotazioni. ENRICO mostra valori leggermente inferiori, mentre Guo riporta i punteggi più bassi a causa della maggiore variabilità nello stile di layout e nella densità dei componenti. L'andamento decrescente con soglie di IoU più rigorose illustra come la complessità del dataset influenzi direttamente la robustezza del rilevamento.

Figura 3. Precisione media (mAP) ai valori soglia di intersezione rispetto all'unione (IoU) di 0,5 e 0,75 nei diversi dataset. Il grafico a linee confronta le prestazioni di rilevamento dei componenti nei dataset RICO, ENRICO e Guo. L'asse x rappresenta i dataset, mentre l'asse y mostra i valori di mAP. Due curve corrispondono ai valori soglia di IoU di 0,5 e 0,75, illustrando la variazione delle prestazioni a seconda del livello di severità del rilevamento. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Figura 4 mostra l'mAP@IoU(0,5:0,95) per ciascun dataset, fornendo una valutazione più ampia delle prestazioni di rilevamento su dieci soglie IoU. I risultati rivelano una chiara tendenza discendente da RICO (0,61) a ENRICO (0,57) e Guo (0,52), confermando che il modello di rilevamento proposto generalizza meglio su dataset più grandi e strutturati. Questa metrica media più rigorosa evidenzia lievi degradazioni delle prestazioni che potrebbero non essere evidenti in una valutazione a soglia singola. Questi risultati indicano che, sebbene il modello presti bene su tutti i dataset, una maggiore diversità nei layout e una maggiore variabilità dei componenti introducono ulteriori sfide in una valutazione rigorosa secondo lo standard COCO. I risultati del rilevamento sono presentati in Figure 3 e 4, che forniscono confronti quantitativi dell'mAP a diversi livelli di IoU.

Figura 4. Precisione media (mAP) media calcolata sui valori di intersezione rispetto all'unione (IoU) con soglie comprese tra 0,5 e 0,95 nei vari dataset. Il grafico a linee mostra le prestazioni nel rilevamento degli elementi nei dataset RICO, ENRICO e Guo, utilizzando la metrica mAP media calcolata su soglie di IoU comprese tra 0,5 e 0,95. L'asse x rappresenta i dataset, mentre l'asse y indica i corrispondenti valori di mAP riportati su una scala da 0 a 1, che riflettono le prestazioni del modello in base a diverse soglie di rilevamento. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Parametri di qualità del layout
La qualità del layout viene valutata utilizzando l'AE, l'accuratezza del raggruppamento (GA) e l'accuratezza dell'ordine di lettura (ROA), che insieme valutano la correttezza strutturale, l'organizzazione percettiva e la leggibilità cognitiva dei layout dell'interfaccia utente generati.
Errore di allineamento.
AE (deviazione basata sui pixel) indica quanto bene gli elementi dell'interfaccia utente sono allineati rispetto a linee di allineamento ideali, come guide sinistra, destra, superiore o della linea di base. Un valore AE più basso indica che gli elementi sono disposti in modo coerente con una minima distorsione visiva, migliorando la leggibilità e la chiarezza complessiva del design. Questa metrica è particolarmente importante per valutare il perfezionamento del layout cognitivo, poiché un allineamento errato interrompe il flusso visivo e aumenta la complessità percepita. Figura 5 illustra l'AE nei dataset RICO, ENRICO e Guo, misurata come deviazione media in pixel rispetto alle linee di allineamento ideali. I risultati mostrano che RICO raggiunge il valore AE più basso (4,2 px), indicando che i componenti dell'interfaccia utente in questo dataset presentano pattern strutturali più coerenti, rendendo l'allineamento più semplice per il modello. ENRICO segue con una deviazione di allineamento moderata di 6,1 px, riflettendo una combinazione di layout di schermata ben strutturati e variabili. Il dataset Guo registra il valore AE più alto (7,4 px), a causa della maggiore diversità nel posizionamento dei componenti e di strutture di layout non standard, che rappresentano una sfida per il perfezionamento basato sull'allineamento. Nel complesso, questi risultati dimostrano che il modello mantiene un'elevata accuratezza di allineamento attraverso i diversi dataset, nonostante l'aumento della complessità del layout.

Figura 5. Errore di allineamento tra dataset. La figura mostra l'errore di allineamento tra dataset; valori più bassi indicano un migliore allineamento. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Accuratezza del raggruppamento (GA).
GA quantifica quanto efficacemente il modello raggruppa i componenti dell'interfaccia utente (UI) correlati, ad esempio in base ai principi della Gestalt come prossimità, somiglianza e continuità. Un'accuratezza di raggruppamento più elevata indica che il modello preserva la struttura prevista degli elementi dell'interfaccia utente, consentendo agli utenti di interpretare l'interfaccia in modo più naturale. Questa metrica è particolarmente utile per valutare se il modulo di affinamento del layout organizza correttamente i contenuti in gruppi visivi significativi. Figura 6 mostra la distribuzione di GA ottenuta dal framework proposto nei tre dataset. Il dataset ENRICO presenta la GA mediana più alta e l'intervallo interquartile più ridotto, indicando prestazioni di raggruppamento stabili e coerenti grazie ai suoi layout ben definiti e con etichette di pattern. Il dataset RICO mostra un'accuratezza di raggruppamento moderata con maggiore variabilità, probabilmente a causa della maggiore diversità e complessità dei layout. Il dataset Guo UI Color registra un'accuratezza di raggruppamento inferiore, poiché i suoi campioni sono visivamente eterogenei e meno focalizzati sulla struttura del layout. Nel complesso, i risultati indicano che il modulo cognitivo di affinamento del layout funziona in modo affidabile su tutti i dataset, raggiungendo le migliori prestazioni di raggruppamento sui dati strutturalmente coerenti.

Figura 6. Distribuzione dell'accuratezza di raggruppamento nei diversi dataset. Il grafico a scatola mostra l'accuratezza di raggruppamento basata sui principi di Gestalt nei dataset RICO, ENRICO e Guo’s UI Color. Le scatole rappresentano l'intervallo interquartile, la linea centrale indica la mediana e i baffi indicano l'intervallo dei valori. L'asse x rappresenta i dataset, mentre l'asse y mostra i punteggi di accuratezza di raggruppamento. La dimensione del campione è n=5128 schermate di interfacce utente (RICO: 4000, ENRICO: 1000 e Guo: 128). Cliccare qui per visualizzare una versione ingrandita di questa figura.
Accuratezza dell'ordine di lettura (ROA).
L'accuratezza dell'ordine di lettura (ROA) misura quanto accuratamente il modello prevede il flusso naturale di lettura di una schermata di interfaccia utente, che generalmente segue un percorso dall'alto verso il basso e da sinistra a destra. Mantenere un ordine di lettura corretto è essenziale per l'usabilità, la chiarezza della navigazione e la coerenza con le convenzioni di progettazione consolidate. Un valore più elevato di ROA indica che il sistema preserva i modelli cognitivi di scansione attesi. Figura 7 mostra l'ROA attraverso diverse fasi di valutazione per i dataset RICO, ENRICO e Guo. ENRICO ottiene costantemente l'ROA più alto grazie alla sua struttura di layout regolare e orientata ai pattern, che consente una previsione più accurata di sequenze di lettura simili a quelle umane. RICO mostra prestazioni moderate con una leggera variabilità, riflettendo la sua maggiore diversità e complessità del mondo reale. Il dataset Guo presenta l'ROA più basso, poiché molte delle sue schermate sono ricche dal punto di vista visivo ma mancano di gerarchie di lettura chiaramente definite. Nel complesso, questi risultati indicano che il modulo proposto di affinamento del layout cognitivo funziona in modo più affidabile su dataset strutturati, mantenendo al contempo previsioni stabili dell'ordine di lettura in diverse progettazioni di interfacce utente.

Figura 7. Accuratezza dell'ordine di lettura attraverso le fasi di valutazione per diversi dataset. Il grafico a linee mostra l'accuratezza dell'ordine di lettura attraverso le fasi di valutazione per i dataset RICO, ENRICO e Guo’s UI Color. L'asse x rappresenta la fase di valutazione, e l'asse y indica l'accuratezza dell'ordine di lettura. Ogni curva corrisponde a un dataset, illustrando i cambiamenti nel mantenimento del flusso visivo attraverso le successive fasi di valutazione. La fase di valutazione rappresenta le fasi progressive di affinamento del framework proposto. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Punteggio di coerenza del layout (LCS)
Il punteggio di coerenza del layout (LCS) misura quanto i layout dell'interfaccia utente generati vengano mantenuti in modo coerente attraverso più schermate all'interno della stessa applicazione. Ciò include coerenza nei margini, nelle regole di allineamento, nelle aree tipografiche e nei modelli di raggruppamento. Un punteggio più elevato indica una maggiore coerenza tra schermate, con conseguente esperienza utente più unificata e intuitiva. Figura 8 mostra l'LCS misurato in diverse fasi di valutazione per i dataset di colori dell'interfaccia utente RICO, ENRICO e Guo. Il dataset ENRICO ottiene costantemente i valori LCS più alti grazie alle schermate di interfaccia utente etichettate per modello e strutturalmente uniformi, che favoriscono un apprendimento più stabile della coerenza tra schermate. Al contrario, il dataset RICO mostra una coerenza moderata ma in costante miglioramento, attribuibile alla capacità del modello di generalizzare attraverso layout di interfaccia utente altamente diversificati. Come previsto, il dataset Guo registra i valori LCS più bassi, poiché è principalmente focalizzato sulle caratteristiche cromatiche piuttosto che sul layout strutturale, rendendo più difficile la coerenza tra più schermate. Nel complesso, questi risultati indicano che il modulo proposto per la coerenza tra schermate funziona in modo più efficace su dataset orientati ai modelli, pur fornendo miglioramenti misurabili su tutti i dataset.

Figura 8. Punteggio di coerenza del layout nelle diverse fasi di valutazione per più set di dati. Il grafico a linee mostra i punteggi di coerenza del layout nelle diverse fasi di valutazione per i set di dati RICO, ENRICO e Guo’s UI Color. L'asse x rappresenta la fase di valutazione e l'asse y indica i punteggi di coerenza del layout. Ogni curva corrisponde a un set di dati e illustra il miglioramento della coerenza strutturale delle interfacce generate nelle successive fasi di valutazione. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Parametri di qualità del colore
I temi di colore dell'interfaccia utente generati vengono valutati utilizzando cinque metriche basate sulla percezione, derivate da CAM02-UCS: ΔE (differenza cromatica percettiva), che quantifica l'uniformità percettiva tra i colori della tavolozza; rapporto di contrasto (basato su WCAG 2.1), che valuta la leggibilità tra elementi di primo piano e di sfondo; indice di armonia cromatica (CHI), che misura la compatibilità estetica tra le diverse tonalità; punteggio di diversità cromatica (CDS), che riflette la variazione all'interno dello spazio cromatico percettivo; e punteggio di rilevanza cromatica (CPS), che valuta l'equilibrio e la predominanza dei colori all'interno della tavolozza. Nel complesso, queste metriche forniscono una valutazione completa sia della qualità estetica sia delle prestazioni cromatiche orientate all'usabilità. I risultati dimostrano che il metodo proposto raggiunge un valore inferiore di ΔE pari a 4,12, indicando un miglioramento dell'uniformità percettiva tra i colori. Un rapporto di contrasto pari a 6,21 conferma l'aderenza agli standard di accessibilità, garantendo una maggiore leggibilità. Tabella 5 presenta un confronto quantitativo tra il modulo di modellazione cromatica proposto e i metodi di riferimento. L'indice CHI aumenta da 0,61 a 0,83, indicando una maggiore coesione estetica nelle transizioni cromatiche. Inoltre, il CDS aumenta di oltre il 50%, dimostrando che le tavolozze generate mantengono una variazione più ricca senza introdurre confusione visiva. Valori più elevati di CPS indicano una distribuzione equilibrata dei colori dominanti, evitando la sovrasaturazione di una singola tonalità. Nel complesso, questi risultati dimostrano l'efficacia del modulo di modellazione cromatica basato su CAM02-UCS nella generazione di schemi cromatici per l'interfaccia utente armoniosi, leggibili e ottimizzati dal punto di vista percettivo.
| Metrica | Definizione | Metodo proposto | Condizione iniziale1 | Miglioramento (%) |
| ΔE (CAM02-UCS) | Differenza cromatica percettiva | 4.12 | 7.85 | 47,5% inferiore |
| Rapporto di contrasto (WCAG) | Leggibilità delle coppie FG–BG | 6.21 | 4.38 | 41.80% |
| CHI (Indice di Armonia Cromatica) | Tonalità & armonia cromatica | 0.83 | 0.61 | 36.10% |
| CDS (punteggio di diversità cromatica) | Varianza in J′a′b′ spazio | 18.70 | 12.40 | 50.80% |
| CPS (Punteggio di Rilevanza Cromatica) | Stabilità dei colori dominanti | 0.72 | 0.55 | 30.90% |
Tabella 5: Confronto quantitativo delle metriche di qualità del colore tra il metodo proposto e i metodi di riferimento. La tabella presenta metriche di valutazione della qualità del colore, inclusa la differenza cromatica percettiva (ΔE in CAM02-UCS), il rapporto di contrasto (WCAG), l'indice di armonia cromatica (CHI), il punteggio di diversità cromatica (CDS) e il punteggio di rilevanza cromatica (CPS). I risultati del metodo proposto vengono confrontati con i valori di riferimento, insieme ai miglioramenti percentuali.
Caratteristiche demografiche dei partecipanti e disegno dello studio
Un totale di 30 partecipanti ha preso parte al processo di valutazione. L'età dei partecipanti era compresa tra i 20 e i 35 anni (età media: 26,4 ± 3,2 anni). Il gruppo comprendeva individui con background diversi, tra cui ingegneri del software, studenti e progettisti UI/UX. In base alla competenza informatica auto-dichiarata, il 40% dei partecipanti è stato classificato come utente intermedio, il 35% come utente avanzato e il 25% come principiante. Circa la metà dei partecipanti aveva esperienza pregressa in progettazione UI/UX o settori affini, mentre i restanti non ne avevano. Questa diversità ha garantito una valutazione equilibrata tra diversi livelli di competenza tecnica e familiarità con il design.
Parametri dello studio sull'utilizzatore
È stata condotta una valutazione centrata sull'utente utilizzando diverse metriche, tra cui NASA-TLX, scala di usabilità del sistema (SUS), punteggio di armonia estetica (AHS), tempo di efficienza della ricerca (SET) e valutazione della coerenza tra schermi (CSCR), per valutare carico cognitivo, usabilità, attrattiva visiva, efficienza e coerenza.
La metrica NASA-TLX quantifica il carico mentale misurando fattori come la richiesta cognitiva, lo sforzo e la frustrazione. Punteggi più bassi indicano un carico cognitivo ridotto e una maggiore facilità d'interazione. Il framework proposto ha prodotto costantemente punteggi NASA-TLX inferiori in tutti i set di dati, indicando uno sforzo mentale ridotto. Questo miglioramento può essere attribuito all'integrazione di principi di progettazione cognitiva, tra cui il raggruppamento secondo la teoria della Gestalt, un interasse ottimizzato e una gerarchia visiva potenziata, che insieme favoriscono una navigazione più intuitiva. La metrica SUS fornisce un punteggio standardizzato di usabilità compreso tra 0 e 100, in cui valori più elevati indicano un'usabilità e una chiarezza migliorate. Il framework proposto ha ottenuto punteggi SUS superiori rispetto ai metodi di base, riflettendo miglioramenti sia nel layout strutturale che nella chiarezza cromatica. Un allineamento, un interasse e un flusso di navigazione migliorati hanno contribuito a creare interfacce percepite dagli utenti come più intuitive e funzionalmente coerenti. L'AHS, misurato su una scala Likert a 7 punti, valuta l'estetica visiva percepita e l'armonia cromatica. Le interfacce generate utilizzando il modulo di modellazione del colore basato su CAM02-UCS hanno ottenuto valori AHS più elevati, indicando transizioni cromatiche più fluide e palette più equilibrate dal punto di vista visivo. I partecipanti hanno mostrato una preferenza costante per queste interfacce grazie a un contrasto migliore, una maggiore coerenza tra le tonalità e una riduzione del disordine visivo, evidenziando l'importanza della modellazione cromatica percettiva nella progettazione dell'interfaccia utente. Il SET misura il tempo necessario agli utenti per individuare elementi specifici dell'interfaccia durante compiti di ricerca visiva. Valori SET più bassi indicano una migliore organizzazione e gerarchia visiva. Il framework proposto ha ridotto significativamente il SET in tutti i set di dati, dimostrando che l'integrazione del raggruppamento secondo la teoria della Gestalt, di un interasse guidato dall'attenzione e di strutture di layout perfezionate consente un'interazione più rapida ed efficiente. La metrica CSCR valuta la coerenza della progettazione dell'interfaccia utente attraverso schermate multiple. Punteggi più elevati indicano una migliore continuità nel layout, nel colore e nell'organizzazione strutturale. Il framework proposto ha ottenuto valori CSCR più alti, riflettendo l'efficacia del modulo per la coerenza multischermo nel mantenere costanti le combinazioni cromatiche, gli interassi e le strutture gerarchiche tra le diverse interfacce.
Figura 9 presenta i risultati dello studio comparativo con utenti per tutte le metriche (NASA-TLX, SUS, AHS, SET e CSCR) nei dataset RICO, ENRICO e Guo. Nel complesso, si osservano miglioramenti costanti in tutte le metriche di valutazione. In particolare, il dataset Guo dimostra prestazioni superiori nelle metriche centrate sull'utente, inclusi un carico cognitivo ridotto (NASA-TLX), un'usabilità maggiore (SUS), un'armonia estetica migliore (AHS), un tempo ridotto per l'efficienza di ricerca (SET) e una maggiore coerenza tra schermate (CSCR). Tuttavia, questi risultati richiedono un'interpretazione accurata. I miglioramenti osservati nelle metriche di esperienza utente (UX) per il dataset Guo sono attribuibili principalmente alla forte coerenza cromatica e alla composizione visiva relativamente più semplice, piuttosto che a una qualità superiore del layout strutturale. Sebbene gli utenti percepiscano queste interfacce come più armoniose dal punto di vista visivo e meno gravose dal punto di vista cognitivo, risultati precedenti mostrano che il dataset Guo ha prestazioni scadenti in termini di allineamento, raggruppamento e ordine di lettura. Ciò evidenzia una distinzione importante tra fattori percettivi e fattori strutturali nella progettazione dell'interfaccia utente (UI). Sebbene attributi percettivi come l'armonia cromatica migliorino significativamente l'esperienza utente, l'accuratezza strutturale e la coerenza del layout rimangono fondamentali per l'usabilità funzionale. Pertanto, una progettazione ottimale dell'interfaccia richiede un equilibrio tra armonia percettiva e correttezza strutturale.

Figura 9. Confronto delle metriche dello studio utente tra diversi dataset. Il grafico a barre raggruppate confronta le metriche dello studio utente tra i dataset RICO, ENRICO e Guo’s UI Color Dataset. L'asse x rappresenta le metriche di valutazione, tra cui NASA Task Load Index (NASA-TLX), scala di usabilità del sistema (SUS), punteggio di armonia estetica (AHS), tempo di efficienza strutturale (SET) e tasso di coerenza tra schermate (CSCR), mentre l'asse y indica i punteggi corrispondenti. Le barre rappresentano le prestazioni per ciascun dataset, evidenziando le differenze in termini di usabilità, carico cognitivo, qualità estetica e coerenza dell'interfaccia. NASA-TLX (0–100, valore inferiore indica prestazioni migliori), SUS (0–100, valore superiore indica prestazioni migliori), AHS (1–7 scala Likert), SET (s, valore inferiore indica prestazioni migliori) e CSCR (0–1, valore superiore indica prestazioni migliori). Cliccare qui per visualizzare una versione ingrandita di questa figura.
Validazione statistica delle ipotesi
Per validare ulteriormente le ipotesi proposte (H1–H4), è stata eseguita un'analisi statistica sulla significatività di metriche chiave di valutazione, inclusi la qualità del layout, il carico cognitivo, l'armonia cromatica e le misurazioni di usabilità (Tabella 6). I risultati sono espressi come media ± deviazione standard, e la significatività statistica è stata valutata mediante test t appaiati con un intervallo di confidenza del 95% (p < 0,05). I risultati indicano che il framework proposto ottiene miglioramenti statisticamente significativi rispetto agli approcci di base in diverse metriche, tra cui accuratezza dell'allineamento, accuratezza del raggruppamento, ordine di lettura, carico cognitivo (NASA-TLX) e misure di armonia cromatica. In particolare, le riduzioni del carico cognitivo e i miglioramenti nelle metriche di usabilità mostrano differenze altamente significative (p < 0,01). Questi risultati confermano che l'integrazione di principi di progettazione cognitiva e di modelli percettivi per il colore determina miglioramenti misurabili e statisticamente significativi nella qualità dell'interfaccia utente, sostenendo così le ipotesi H1–H4.
| Metrica | Condizione iniziale (Media ± DS) | Proposta (Media ± DS) | Miglioramento (%) | valore p | Significatività |
| Errore di allineamento (↓) | 7,8 ± 1,2 | 4,2 ± 0,9 | 46,10% | 0,003 | Significativo |
| Precisione del raggruppamento (↑) | 0,68 ± 0,05 | 0,82 ± 0,04 | 20,50% | 0,001 | Significativo |
| Precisione dell'ordine di lettura (↑) | 0,72 ± 0,06 | 0,87 ± 0,03 | 20,80% | 0,002 | Significativo |
| NASA-TLX (↓) | 68,5 ± 5,4 | 47,2 ± 4,8 | 31,10% | 0,0005 | Altamente significativo |
| Punteggio SUS (↑) | 71,3 ± 6,2 | 88,9 ± 4,5 | 24,70% | 0,0008 | Altamente significativo |
| Indice di armonia cromatica (↑) | 0,61 ± 0,07 | 0,83 ± 0,05 | 36,00% | 0,001 | Significativo |
| Rapporto di contrasto (↑) | 4,1 ± 0,6 | 6,2 ± 0,5 | 51,20% | 0,002 | Significativo |
Tabella 6: Confronto statistico delle metriche di prestazione tra il metodo di riferimento e i metodi proposti. La tabella riporta la media e la deviazione standard (media ± DS) per le principali metriche di prestazione, inclusi l'errore di allineamento, l'accuratezza del raggruppamento, l'accuratezza dell'ordine di lettura, l'Indice di Carico di Lavoro NASA (NASA-TLX), la scala di usabilità del sistema (SUS), l'indice di armonia cromatica e il rapporto di contrasto. Sono riportati i miglioramenti percentuali, i valori p e i livelli di significatività statistica. (↑) indica che valori più alti sono migliori, e (↓) indica che valori più bassi sono migliori. La significatività statistica è stata valutata per p < 0,05.
Osservazioni specifiche per il dataset
Le prestazioni relativamente più basse osservate nelle metriche strutturali sul dataset Guo possono essere attribuite alle sue caratteristiche intrinseche. Il dataset Guo è più piccolo rispetto a RICO ed ENRICO e si concentra principalmente su caratteristiche cromatiche percettive piuttosto che su annotazioni strutturate di layout. Di conseguenza, presenta una maggiore variabilità nel posizionamento dei componenti, un'organizzazione gerarchica più debole e strutture di layout meno coerenti tra le schermate. Queste proprietà rendono più difficile l'apprendimento strutturale e l'ottimizzazione del layout, spiegando le prestazioni inferiori nelle metriche di allineamento, raggruppamento e ordine di lettura, nonostante le ottime prestazioni nelle valutazioni percettive e centrate sull'utente.
Studio di ablazione
Lo studio di ablazione valuta il contributo di ciascun modulo all'interno del framework proposto rimuovendo sistematicamente singoli componenti e analizzandone l'impatto sulla qualità del layout, sulla modellazione del colore e sulle prestazioni di rilevamento. La qualità del layout viene valutata utilizzando AE, GA, ROA e LCS. AE riflette la deviazione posizionale degli elementi dell'interfaccia utente, dove valori più elevati indicano una struttura spaziale più debole. GA valuta quanto efficacemente i componenti siano organizzati secondo i principi della Gestalt. ROA misura il mantenimento del flusso visivo logico, mentre LCS quantifica la coerenza strutturale tra schermate in termini di allineamento, spaziatura e organizzazione del layout. Il degrado della qualità cromatica viene valutato mediante ΔE (differenza cromatica percettiva), CHI e CDS, parametri che insieme valutano l'uniformità percettiva, la coerenza estetica e la ricchezza della tavolozza cromatica. Le prestazioni di rilevamento vengono valutate utilizzando mAP, precisione e richiamo, che quantificano l'impatto della sostituzione del modulo Faster R-CNN con un modello di rilevamento più semplice. Nel complesso, questi indicatori forniscono una valutazione completa del contributo di ciascun modulo alle prestazioni complessive del sistema.
Tabella 7 riassume il contributo di ciascun modulo e confronta il framework proposto con gli approcci esistenti per la generazione di interfacce utente. Il modello completo raggiunge le migliori prestazioni in tutte le metriche di qualità del layout, modellazione del colore e rilevamento, dimostrando che progettazione cognitiva, modellazione percettiva del colore e comprensione visiva profonda hanno un effetto sinergico. Quando il modulo di modellazione del colore viene rimosso, il ΔE aumenta significativamente, mentre CHI e CDS diminuiscono notevolmente, indicando una perdita di uniformità percettiva e armonia cromatica. Ciò conferma l'importanza della modellazione basata su CAM02-UCS nel mantenimento della qualità estetica e percettiva. La rimozione del modulo cognitivo per il layout determina un aumento significativo dell'AE e diminuzioni evidenti di GA e ROA, dimostrando che i principi di progettazione cognitiva sono essenziali per produrre layout strutturalmente coerenti e leggibili. L'eliminazione del modulo di coerenza tra più schermate porta a una riduzione dell'LCS, confermandone il ruolo nel mantenimento di schemi di layout coerenti su schermate multiple. Sostituire il rilevatore Faster R-CNN con una CNN più semplice provoca un netto calo di mAP, precisione e richiamo, evidenziando l'importanza fondamentale di un rilevamento robusto dei componenti nell'intero processo. Rispetto ai metodi di base, inclusi pix2code, REDRAW e LDGM, il framework proposto supera costantemente tutti gli approcci in termini di accuratezza del layout, coerenza visiva e qualità percettiva del colore.
| Metodo / Modulo | AE ↓ | GA ↑ | ROA ↑ | LCS ↑ | ΔE ↓ | CHI ↑ | CDS ↑ | mAP ↑ |
| Modulo del colore rimosso | 0.14 | 0.86 | 0.92 | 0.84 | 7.85 | 0.61 | 12.4 | 0.9 |
| Modulo della disposizione cognitiva rimosso | 0.18 | 0.72 | 0.73 | 0.69 | 4.21 | 0.79 | 17.9 | 0.89 |
| Coerenza multi-schermo rimossa | 0.17 | 0.81 | 0.88 | 0.62 | 4.18 | 0.81 | 17.3 | 0.9 |
| Faster R-CNN sostituito con una semplice CNN | 0.16 | 0.85 | 0.91 | 0.85 | 4.15 | 0.82 | 18.1 | 0.74 |
| Pix2Code | 0.25 | 0.61 | 0.65 | 0.51 | 10.2 | 0.48 | 9.6 | 0.65 |
| REDRAW | 0.21 | 0.66 | 0.72 | 0.56 | 8.7 | 0.52 | 11.4 | 0.72 |
| LDGM (Diffusione della disposizione) | 0.19 | 0.74 | 0.79 | 0.63 | 6.9 | 0.59 | 13.8 | 0.8 |
| Modello completo proposto | 0.12 | 0.89 | 0.94 | 0.87 | 4.12 | 0.83 | 18.7 | 0.91 |
Tabella 7: Analisi comparativa delle prestazioni e studio di ablazione del framework proposto e dei metodi di base. La tabella valuta l'impatto dei singoli componenti confrontando il modello completo proposto con varianti in cui specifici moduli sono rimossi (modulo colore, modulo di layout cognitivo, coerenza multiscreen e sostituzione di Faster R-CNN con una semplice CNN), nonché con metodi di base (pix2code, REDRAW e LDGM). Le prestazioni sono valutate utilizzando l'errore di allineamento (AE), l'accuratezza di raggruppamento (GA), l'accuratezza dell'ordine di lettura (ROA), il punteggio di coerenza del layout (LCS), la differenza percettiva del colore (ΔE), l'indice di armonia cromatica (CHI), il punteggio di diversità cromatica (CDS) e la precisione media (mAP). (↑) indica che valori più alti sono migliori, e (↓) indica che valori più bassi sono migliori.
DISPONIBILITÀ DEI DATI:
I set di dati utilizzati in questo studio sono disponibili ai seguenti collegamenti: set di dati RICO: https://interactionmining.org/rico; set di dati ENRICO: https://github.com/luileito/enrico; set di dati sui colori dell'interfaccia utente di Guo: https://github.com/guozhongke/UI-Color-Dataset.
File supplementare 1. Formulazioni matematiche e dettagli estesi di implementazione. Questo file fornisce le formulazioni matematiche dettagliate e i flussi algoritmici a supporto del framework proposto per la prototipazione automatica di interfacce utente (UI). Include il training per il rilevamento dei componenti, l'estrazione dei modelli di layout, la modellizzazione dell'armonia cromatica, l'obiettivo unificato per la prototipazione dell'interfaccia utente, i dettagli del rilevamento con Faster R-CNN, i calcoli della distanza spaziale e della similarità di allineamento, la costruzione dell'albero logico dell'interfaccia utente, la modellizzazione percettiva del colore basata su CAM02-UCS, l'ottimizzazione del design cognitivo, la modellizzazione della coerenza tra più schermate e gli Algoritmi S1–S3.Clicca qui per scaricare questo file.