$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מסגרת אב-הטיפוס האוטומטית לממשקי משתמש (UI) המוצעת הוערכה באמצעות סט נתונים משולב של 5,128 מסכי UI משלושה מקורות: 4,000 תמונות RICO, 1,000 מסכי ENRICO, ו-128 דגימות UI עם הערות צבע מתוך ה-UI Color Dataset של Guo. סט נתונים מעורב זה מספק נקודת ייחוס (benchmark) מאוזנת להערכת דיוק זיהוי רכיבים, בהירות מבנית של הפריסה, עקביות בין מסכים והרמוניה צבעונית תפיסתית.
תוצאות ניסיוניות מדגימות כי מודל הזיהוי המבוסס על Faster R-CNN משיג דיוק של 92.4% בזיהוי רכיבים ומכליל ביעילות סגנונות ממשק משתמש (UI) ניידים מגוונים. יתרה מכך, שילוב של השראות דפוס ENRICO משפר את הסקת המסקנות לגבי הפריסה, מה שמוביל לעלייה של 18.7% בבהירות הפריסה ולשיפור בשימור סדר הקריאה. בניסויי הערכת צבע, מודול מידול הצבעים המונהג על ידי CAM02-UCS מייצר פלטות הרמוניות יותר ב-24.5%, על פי הערכות מעצבים, ומשיג אחידות תפיסתית גבוהה יותר בהשוואה לשיטות מסורתיות ליצירת פלטות המבוססות על RGB ו-LAB. בנוסף, מידול עקביות רב-מסכי משיג שיפור של 28% ביישור בין מסכים ובבעקביות הטיפוגרפיה. מחקרי משתמש שכללו 30 משתתפים מדגימים הפחתה של 31% בעומס הקוגניטיבי הנתפס בעת אינטראקציה עם אב-טיפוסים שהופקו על ידי המערכת המוצעת. יחד, תוצאות אלו מצביעות על כך ששילוב של זיהוי רכיבים, מידול צבע תפיסתי ואופטימיזציה קוגניטיבית מפיק אב-טיפוסים של UI שהם לא רק מדויקים מבנית, אלא גם קוהרנטיים חזותית ויעילים קוגניטיבית. טבלה 3 מדגישה את סביבת הסימולציה וההגדרות הטכניות ששימשו להערכת מסגרת אב-הטיפוס של ה-UI המוצעת. הליכי האימון עתירי המחשוב של Faster R-CNN ומודולי עקביות הפריסה נתמכו על ידי GPU בעל ביצועים גבוהים מסוג NVIDIA RTX 4090. כל הניסויים בוצעו בסביבת Ubuntu 22.04 תוך שימוש ב-PyTorch 2.0 עבור מימוש הלמידה העמוקה.
| פרמטר | תצורה |
| חומרה | NVIDIA RTX 4090 GPU (24 GB), Intel i9 Processor, 64 GB RAM |
| מערכת הפעלה | Ubuntu 22.04 LTS |
| מסגרת למידה עמוקה | PyTorch 2.0 |
| Backbone של Faster R-CNN | ResNet-50 + FPN |
| רזולוציית תמונה | 480 × 800 (נורמליזציה לכל מערכי הנתונים) |
| גודל Batch לאימון | 8 |
| אופטימייזר | AdamW (LR = 1e−4, Weight Decay = 0.01) |
| Epochs | 40 |
| מרחב מידול צבעים | CAM02-UCS |
| קישור (Clustering) להוצאת פלטת צבעים | K-means (k = 5) |
| קישור (Clustering) של פריסה | DBSCAN (ε = 20, min_samples = 3) |
טבלה 3: פרמטרי יישום ותצורה ניסיונית של המסגרת המוצעת. הטבלה מסכמת את הגדרות החומרה והתוכנה ששימשו לאימון ולהערכה של המודל, כולל משאבים חישוביים, מערכת הפעלה, מסגרת למידה עמוקה, ארכיטקטורת מודל, רזולוציית תמונה, פרמטרי אימון, אסטרטגיית אופטימיזציה, מרחב מידול צבע ושיטות קיבץ ששימשו להוצאת פלטות צבעים ולקביעת קבוצות פריסה.
ארכיטקטורת ה-Faster R-CNN משתמשת ב-backbone מסוג ResNet-50 עם FPN כדי לזהות מגוון רחב של רכיבי UI בעלי רזולוציה גבוהה (fine-grained). כל תמונות ה-UI מותאמות באופן אחיד לגודל של 480 × 800 פיקסלים לפני העיבוד. האימון מבוצע לאורך 60 epochs באמצעות אופטימייזר SGD, עם גודל batch של 16 כדי להבטיח התכנסות יציבה. מחולל פלטת הצבעים משתמש ב-CAM02-UCS עם מקבץ K-means, בעוד ש-DBSCAN משמש למקבץ פריסות מבניות (structural layout clustering). הגדרות טכניות אלו מבטיחות שתוצאות ה-UI הנוצרות יהיו ניתנות לשחזור, יציבות ובנאמנות גבוהה (high-fidelity). כדי לספק הערכה מקיפה של מסגרת אב-הטיפוס האוטומטית המוצעת ל-UI, נעשה שימוש בארבע קטגוריות של מדדי הערכה:
i) ביצועי זיהוי רכיבים, שנותחו באמצעות דיוק (precision), רגישות (recall), מדד F1, חפיפה מעל איחוד (IoU) ודיוק ממוצע מרבי (mAP), המכמתים את דיוק מודל ה-Faster R-CNN בזיהוי רכיבי ממשק משתמש (UI) במאגרי הנתונים RICO ו-ENRICO;
ii) בהירות הפריסה ועקביות מבנית, הנמדדות באמצעות שגיאת יישור (AE), דיוק הקיבוץ, נכונות סדר הקריאה ומדדי עקביות בין מסכים הגזורים מאילוצי תבנית עיצוב;
iii) איכות צבע תפיסית, שהוערכה באמצעות מרחק תפיסתי של CAM02-UCS (ΔE_UCS), יחסי ניגודיות של WCAG 2.1, מדד גיוון וציוני הרמוניית צבעים בהשראת מסגרת הערכת צבעי ממשק משתמש (UI) של Guo;
iv) מדדי יעילות קוגניטיבית ממוקדי-משתמש, כולל עומס קוגניטיבי שנמדד באמצעות מדד עומס המטלות של נאס"א (NASA-TLX), דירוגי קוהרנטיות אסתטית ויעילות השלמת מטלות.
מדדים אלו מאפשרים להעריך את המסגרת לא רק במונחים של דיוק הזיהוי, אלא גם במונחים של הרמוניה תפיסתית, איכות השימושיות וחוויה קוגניטיבית.
מדדי זיהוי רכיבים
דיוק (Precision) מתאר את מידת הדייקנות של המודל בניבוי רכיבי UI ללא יצירת זיהויים שגויים (false positives). דיוק גבוה מרמז על כך שרוב תיבות התחום (bounding boxes) שנחזו תואמות לרכיבי UI תקפים. רגישות (Recall) מודדת את יכולתו של המודל לזהות את כל רכיבי ה-UI הרלוונטיים במסך. רגישות גבוהה מעידה על כך שהמודל מזהה בהצלחה את מרבית הרכיבים המוגדרים כאמת (ground-truth). מדד F1, המוגדר כממוצע הרמוני של הדיוק והרגישות, מספק הערכה מאוזנת והוא שימושי במיוחד כאשר רכיבי ה-UI מפוזרים באופן לא אחיד במאגרי הנתונים.
מדד ה-IoU מודד עד כמה תיבת התחום החזויה חופפת לתיבת התחום של ה-ground truth. במטלות זיהוי אובייקטים, נהוג להשתמש בספי IoU של 0.5 ו-0.75 כדי לייצג תנאי הערכה מתונים ומחמירים. mAP מסכם את ביצועי הזיהוי על פני מספר ספי IoU. מדד ה-mAP@0.5:0.95 מספק הערכה חסונה יותר על ידי חישוב ממוצע של הדיוק (precision) על פני ספים מ-0.5 עד 0.95 במרווחים של 0.05, ולכן הוא מקובל באופן נרחב כבנצ'מרק סטנדרטי לזיהוי אובייקטים.
תוצאות הזיהוי בשלושת מערכי הנתונים מעידות כי מודול זיהוי הרכיבים המוצע פועל בצורה עקבית וטובה. תוצאות כמותיות מוצגות בטבלה 4. מערך הנתונים RICO משיג את הביצועים הגבוהים ביותר, עם דיוק (precision) של 0.91, רגישות (recall) של 0.88 וציון F1 של 0.89, וזאת הודות לקבוצה גדולה ומגוונת של תוויות רכיבי UI. ENRICO מראה ציונים נמוכים יותר מעט בשל מבנהו המפושט יותר ומספר קטן יותר של סוגי רכיבים מתויגים. מערך הנתונים Guo רשם את ציון ה-F1 הנמוך ביותר (0.81), ככל הנראה בשל שונות ויזואלית גדולה יותר ופחות תבניות פריסה סטנדרטיות, ההופכות את הזיהוי למאתגר יותר. באופן כללי, תוצאות אלו מאשרות כי המודל שומר על ביצועי זיהוי רכיבים חסונים על פני סגנונות עיצוב UI ומאפייני מערכי נתונים שונים.
| מערך נתונים | דיוק | השבה | מדד F1 |
| RICO | 0.91 | 0.88 | 0.89 |
| אנריקו | 0.87 | 0.84 | 0.85 |
| גואו | 0.83 | 0.8 | 0.81 |
טבלה 4: ביצועי זיהוי רכיבים במאגרי נתונים שונים. הטבלה מציגה את הדיוק (precision), הrecall ומדד ה-F1 עבור זיהוי רכיבי ממשק משתמש (UI) במאגרי הנתונים RICO, ENRICO ו-Guo, ומדגימה את יעילותו של מודל הזיהוי.
איור 3 מציג את ביצועי המודל במערכי הנתונים RICO, ENRICO ו-Guo בספי IoU של 0.5 ו-0.75. כצפוי, ערכי mAP גבוהים יותר ב-IoU 0.5 בשל דרישת חפיפה מקלה יותר. RICO מדווח באופן עקבי על ערכי mAP הגבוהים ביותר (0.89 ב-IoU 0.5 ו-0.78 ב-IoU 0.75), דבר המשקף את העושר והעקביות של האנוטציות שבו. ENRICO מראה ערכים נמוכים מעט יותר, בעוד ש-Guo מדווח על הציונים הנמוכים ביותר בשל שונות רבה יותר בסגנון הפריסה ובצפיפות הרכיבים. המגמה היורדת עם ספי IoU מחמירים יותר ממחישה כי מורכבות מערך הנתונים משפיעה ישירות על חוסן הזיהוי.

איור 3. דיוק ממוצע מרבי (mAP) בספי רכיבי intersection over union (IoU) של 0.5 ו-0.75 במערכי נתונים שונים. תרשים הקו משווה את ביצועי זיהוי הרכיבים במערכי הנתונים RICO, ENRICO ו-Guo. ציר ה-x מייצג את מערכי הנתונים, וציר ה-y מציג את ערכי ה-mAP. שתי העקומות תואמות לספי IoU של 0.5 ו-0.75, וממחישות את השינוי בביצועים תחת רמות מחמירות שונות של זיהוי. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.
איור 4 מציג את ה-mAP@IoU(0.5:0.95) עבור כל מערך נתונים, ובכך מספק הערכה רחבה יותר של ביצועי הזיהוי על פני עשרה ספי IoU. התוצאות חושפות מגמה יורדת ברורה מ-RICO (0.61) ל-ENRICO (0.57) ול-Guo (0.52), מה שמאשש כי מודל הזיהוי המוצע מראה הכללה מיטבית במערכי נתונים גדולים ומובנים יותר. מדד ממוצע מחמיר זה מדגיש ירידות ביצועים קלות שעשויות שלא להיות גלויות תחת הערכה של סף בודד. ממצאים אלו מעידים כי, למרות שהמודל מפגין ביצועים חזקים בכל מערכי הנתונים, גיוון רב יותר בפריסה ושונות ברכיבים מציבים אתגרים נוספים תחת הערכה קפדנית מסוג COCO. תוצאות הזיהוי מוצגות באיורים 3 ו-4, המספקים השוואות כמותיות של mAP ברמות IoU שונות.

איור 4. דיוק ממוצע משוקלל (mAP) ממוצע על פני ספי חיתוך מעל איחוד (IoU) מ-0.5 עד 0.95 במערכי נתונים שונים.תרשים הקווים מציג את ביצועי זיהוי הרכיבים במערכי הנתונים RICO, ENRICO ו-Guo באמצעות מדד ה-mAP ממוצע על פני ספי IoU בטווח שבין 0.5 ל-0.95. ציר ה-x מייצג את מערכי הנתונים, וציר ה-y מציין את ערכי ה-mAP התואמים המדווחים בסולם של 0–1, המשקפים את ביצועי המודל תחת ספי זיהוי משתנים. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.
מדדי איכות הפריסה
איכות הפריסה מוערכת באמצעות AE, דיוק קיבוץ (GA) ודיוק סדר קריאה (ROA), אשר יחד מעריכים את הנכונות המבנית, הארגון התפיסתי והקריאות הקוגניטיבית של פריסות ממשק המשתמש שנוצרו.
שגיאת יישור.
AE (סטייה מבוססת פיקסלים) מעיד על מידת הדיוק שבה רכיבי ממשק המשתמש (UI) מיושרים עם קווי יישור אידיאליים, כגון קווי guia לשמאל, ימין, למעלה או קווי בסיס (baseline). AE נמוך יותר מעיד על כך שהרכיבים מסודרים באופן עקבי עם עיוות חזותי מינימלי, מה שמשפר את הקריאות ואת בהירות העיצוב הכללית. מדד זה חשוב במיוחד להערכת זיקוק פריסה קוגניטיבי, שכן חוסר יישור משבש את הזרימה החזותית ומגביר את המורכבות הנתפסת. איור 5 ממחיש את ה-AE במאגרי הנתונים RICO, ENRICO ו-Guo, כפי שנמדד כסטיית פיקסלים ממוצעת מקווי יישור אידיאליים. התוצאות מראות ש-RICO משיג את ה-AE הנמוך ביותר (4.2 px), מה שמעיד על כך שרכיבי ה-UI במאגר נתונים זה מציגים דפוסים מבניים עקביים יותר, המקלים על היישור עבור המודל. ENRICO נמצא במקום השני עם סטיית יישור מתונה של 6.1 px, המשקפת שילוב של פריסות מסך מובנות היטב וגיווניות. מאגר הנתונים Guo רשם את ה-AE הגבוה ביותר (7.4 px), בשל הגיוון הרב יותר במיקום הרכיבים ומבני פריסה שאינם סטנדרטיים, המאתגרים את הזיקוק המבוסס על יישור. באופן כללי, תוצאות אלו מדגימות כי המודל שומר על דיוק יישור גבוה במגוון מאגרי נתונים, למרות המורכבות הגוברת של הפריסה.

איור 5. שגיאת יישור בין סטים של נתונים.האיור מציג את שגיאת היישור בין סטים של נתונים; ערכים נמוכים יותר מעידים על יישור טוב יותר. אנא לחצו כאן כדי להציג גרסה מוגדלת של איור זה.
דיוק קיבוץ (GA).
GA מכמת באיזו יעילות המודל מקבץ רכיבי UI קשורי, לדוגמה, על בסיס עקרונות הגשטלט כגון קרבה, דמיון והמשכיות. דיוק קיבוץ גבוה יותר מעיד על כך שהמודל משמר את המבנה המכוון של אלמנטי ה-UI, ובכך מאפשר למשתמשים לפרש את הממשק באופן טבעי יותר. מדד זה שימושי במיוחד להערכה אם מודול זיקוק הפריסה ארגן בהצלחה את התוכן לקבוצות חזותיות בעלות משמעות. איור 6 מציג את התפלגות ה-GA שהושגה על ידי המסגרה המוצעת בשלושת מאגרי הנתונים. מאגר הנתונים ENRICO מראה את החציון הגבוה ביותר של GA ואת הטווח הבין-רבעוני הקטן ביותר, מה שמעיד על ביצועי קיבוץ יציבים ועקביים בשל פריסות מוגדרות היטב ומסומנות לפי תבניות. מאגר הנתונים RICO מראה דיוק קיבוץ בינוני עם שונות גבוהה יותר, ככל הנראה בשל הגיוון הרב ומורכבות הפריסה שבו. מאגר הנתונים Guo UI Color רשם דיוק קיבוץ נמוך יותר, שכן הדגימות בו הן הטרוגניות חזותית ופחות ממוקדות בפריסה מבנית. באופן כללי, התוצאות מעידות כי מודול זיקוק הפריסה הקוגניטיבי פועל באופן מהימן על פני מאגרי נתונים שונים, ומשיג את ביצועי הקיבוץ הטובים ביותר בנתונים עקביים מבנית.

איור 6. התפלגות דיוק הקיבוץ (grouping accuracy) במערכי נתונים שונים. תרשים הקופסה (box plot) מציג את דיוק הקיבוץ המבוסס על עקרונות גשטאלט במערכי הנתונים RICO, ENRICO ו-Guo’s UI Color. הקופסאות מייצגות את הטווח הבינ-רבעוני, הקו המרכזי מציין את החציון, והשערים (whiskers) מציינים את טווח הערכים. ציר ה-x מייצג את מערכי הנתונים, וציר ה-y מציג את ציוני דיוק הקיבוץ. גודל המדגם n=5128 מסכי ממשק משתמש (RICO: 4000, ENRICO: 1000, ו-Guo: 128). אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.
דיוק סדר הקריאה (ROA).
דיוק סדר הקריאה (ROA) מודד עד כמה המודל חוזה במדויק את זרימת הקריאה הטבעית של מסך ממשק משתמש (UI), שבדרך כלל עוקבת אחר תבנית מלמעלה למטה וממשמאל לימין. שמירה על סדר קריאה נכון חיונית עבור שמישות, בהירות ניווט ועקביות עם מוסכמות עיצוב מקובלות. ROA גבוה מעיד על כך שהמערכת משמרת דפוסי סריקה קוגניטיביים צפויים. איור 7 מציג את ה-ROA בשלבי הערכה שונים עבור מאגרי הנתונים RICO, ENRICO ו-Guo. ENRICO משיג בעקביות את ה-ROA הגבוה ביותר הודות למבנה פריסה סדיר ומכוון-תבנית, המאפשר חיזוי מדויק יותר של רצפי קריאה דמויי-אנוש. RICO מראה ביצועים בינוניים עם שונות קלה, המשקפת את הגיוון הרב יותר ואת המורכבות מהעולם האמיתי. מאגר הנתונים Guo מציג את ה-ROA הנמוך ביותר, שכן מסכים רבים בו עשירים חזותית אך חסרים היררכיות קריאה מוגדרות בבירור. באופן כללי, תוצאות אלו מעידות כי מודול זיקוק הפריסה הקוגניטיבי המוצע פועל בצורה האמינה ביותר במאגרי נתונים מובנים, תוך שמירה על חיזויים יציבים של סדר הקריאה על פני עיצובי UI מגוונים.

איור 7. דיוק סדר הקריאה לאורך שלבי ההערכה עבור מספר מאגרי נתונים. תרשים הקו מציג את דיוק סדר הקריאה לאורך שלבי ההערכה עבור מאגרי הנתונים RICO, ENRICO ו-Guo’s UI Color. ציר ה-x מייצג את שלב ההערכה, וציר ה-y מציין את דיוק סדר הקריאה. כל עקומה תואמת למאגר נתונים, וממחישה את השינויים בשימור הזרימה הוויזואלית לאורך שלבי הערכה עוקבים. שלב ההערכה הוא ייצוג של שלבי הזיקוק הפרוגרסיביים של המסגרת המוצעת. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.
מדד עקביות פריסה (LCS)
מדד עקביות הפריסה (LCS) מודד עד כמה פריסות ממשק המשתמש (UI) הנוצרות נשמרות בעקביות על פני מספר מסכים בתוך אותה אפליקציה. מדד זה כולל עקביות בריווח, כללי יישור, אזורי טיפוגרפיה ותבניות קיבוץ. ציון גבוה יותר מעיד על קוהרנטיות משופרת בין מסכים, מה שמוביל לחוויית משתמש (UX) מאוחדת ואינטואיטיבית יותר. איור 8 מציג את ה-LCS שנמדד על פני מספר שלבי הערכה עבור מאגרי הנתונים RICO, ENRICO ו-Guo’s UI Color. מאגר הנתונים ENRICO משיג בעקביות את ערכי ה-LCS הגבוהים ביותר הודות למסכי ה-UI בעלי התיוג התבניתי והמבנה האחיד, המקלים על למידה יציבה יותר של עקביות בין מסכים. לעומת זאת, מאגר הנתונים RICO מדגים עקביות מתונה אך משתפרת בהתמדה, מה שניתן לייחוס ליכולתו של המודל להכליל פריסות UI מגוונות מאוד. כצפוי, מאגר הנתונים של Guo רשם את ערכי ה-LCS הנמוכים ביותר, מאחר והוא מתמקד בעיקר במאפייני צבע ולא בפריסה מבנית, מה שהופך את העקביות בין מספר מסכים למאתגרת יותר. באופן כללי, תוצאות אלו מעידות כי מודול עקביות בין-מסכי המשתמש המוצע פועל בצורה היעילה ביותר על מאגרי נתונים מכווני-תבנית, בעודו מספק שיפורים מדידים בכל מאגרי הנתונים.

איור 8. ציון עקביות הפריסה לאורך שלבי ההערכה עבור מספר סטים של נתונים.תרשים הקו מציג ציוני עקביות פריסה לאורך שלבי ההערכה עבור סטים הנתונים RICO, ENRICO ו-Guo’s UI Color. ציר ה-x מייצג את שלב ההערכה וציר ה-y מציין את ציוני עקביות הפריסה. כל עקומה תואמת לסט נתונים, וממחישה את השיפור בלכידות המבנית של הממשקים הנוצרים לאורך שלבי הערכה עוקבים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.
מדדי איכות צבע
ערכות הצבעים שנוצרו עבור ממשק המשתמש (UI) מוערכות באמצעות חמישה מדדים מבוססי תפיסה הנגזרים מ-CAM02-UCS: ΔE (הבדל צבע תפיסתי), המכמת את האחידות התפיסתית בין צבעי הפלטה; יחס ניגודיות (מבוסס על WCAG 2.1), המעריך את קריאות האלמנטים שעל הרקע לעומת הרקע עצמו; מדד הרמוניית צבעים (CHI), המודד תאימות אסתטית בין גוונים; ציון גיוון צבעים (CDS), המשקף את השונות בתוך מרחב הצבע התפיסתי; וציון בולטות צבעים (CPS), המעריך את האיזון והדומיננטיות של הצבעים בתוך הפלטה. יחד, מדדים אלו מספקים הערכה מקיפה הן של האיכות האסתטית והן של ביצועי הצבעים מהיבטי שמישות. התוצאות מדגימות כי השיטה המוצעת משיגה ערך ΔE נמוך יותר של 4.12, המעיד על אחידות תפיסתית משופרת בין הצבעים. יחס ניגודיות של 6.21 מאשר עמידה בתקני נגישות, מה שמבטיח קריאות משופרת. טבלה 5 מציגה השוואה כמותית בין מודול מידול הצבעים המוצע לבין שיטות בסיס. ה-CHI עולה מ-0.61 ל-0.83, דבר המצביע על לכידות אסתטית משופרת במעברי הצבעים. בנוסף, ה-CDS עולה ביותר מ-50%, מה שמוכיח כי הפלטות הנוצרות שומרות על גיוון עשיר יותר ללא יצירת עומס ויזואלי. ערכי CPS גבוהים יותר מעידים על התפלגות מאוזנת של צבעים דומיננטיים, המונעת רוויה יתרה של גוון בודד. באופן כללי, תוצאות אלו מבססות את יעילותו של מודול מידול הצבעים המבוסס על CAM02-UCS ביצירת סכמות צבעים לממשק משתמש שהן הרמוניות, קריאות ואופטימליות מבחינה תפיסתית.
| מדד | הגדרה | השיטה המוצעת | קו בסיס1 | שיפור (%) |
| ΔE (CAM02-UCS) | הבדל צבע תפיסתי | 4.12 | 7.85 | נמוך ב-47.5% |
| יחס ניגודיות (WCAG) | קריאות של זוגות רקע-קדמה (FG–BG) | 6.21 | 4.38 | 41.80% |
| CHI (מדד הרמוניה של צבעים) | גוון & הרמוניה כרומטית | 0.83 | 0.61 | 36.10% |
| מדד גיוון צבעים (CDS - Color Diversity Score) | שונות ב-J′a′b′ חלל | 18.70 | 12.40 | 50.80% |
| CPS (מדד בולטות צבע) | יציבות של צבעים דומיננטיים | 0.72 | 0.55 | 30.90% |
טבלה 5: השוואה כמותית של מדדי איכות צבע בין השיטה המוצעת לשיטות הבסיס. הטבלה מציגה מדדי הערכה לאיכות צבע, הכוללים הפרש צבע תפיסתי (ΔE ב-CAM02-UCS), יחס ניגודיות (WCAG), מדד הרמוניה של צבע (CHI), ציון גיוון צבעים (CDS) וציון בולטות צבע (CPS). תוצאות השיטה המוצעת מושוות לערכי הבסיס, לצד שיעורי השיפור באחוזים.
דמוגרפיה של המשתתפים ומערך המחקר
בסך הכל השתתפו 30 נסיינים בתהליך ההערכה. גילאי המשתתפים נעו בין 20 ל-35 שנים (גיל ממוצע: 26.4 ± 3.2 שנים). העובדה כללה אנשים מרקעים מגוונים, ביניהם מהנדסי תוכנה, סטודנטים ומעצבי UI/UX. על סמך דיווח עצמי של מיומנות במחשב, 40% מהמשתתפים סווגו כמשתמשים ברמה בינונית, 35% כמשתמשים מתקדמים ו-25% כמתחילים. לכשלי מחצית מהמשתתפים הייתה ניסיון קודם בעיצוב UI/UX או בתחומים קשורים, בעוד ששאר המשתתפים היו ללא ניסיון כזה. גיוון זה הבטיח הערכה מאוזנת על פני רמות שונות של מומחיות טכנית והיכרות עם עיצוב.
מדדי מחקר משתמשים
הערכה ממוקדת-משתמש בוצעה באמצעות מדדים מרובים, כולל NASA-TLX, סולם שמישות מערכת (SUS), ציון הרמוניה אסתטית (AHS), זמן יעילות חיפוש (SET) ודירוג עקביות בין-מסכים (CSCR), כדי להעריך עומס קוגניטיבי, שמישות, משיכה ויזואלית, יעילות ועקביות.
מדד NASA-TLX מכמת עומס מנטלי על ידי מדידת גורמים כגון דרישה מנטלית, מאמץ ותסכול. ציונים נמוכים יותר מעידים על עומס קוגניטיבי מופחת ושיפור בקלות האינטראקציה. המסגרת המוצעת הובילה בעקביות לציוני NASA-TLX נמוכים יותר בכל מערכי הנתונים, מה שמעיד על מאמץ מנטלי מופחת. שיפור זה ניתן לייחס לשילוב של עקרונות עיצוב קוגניטיביים, הכוללים קיבוץ גשטלט (Gestalt grouping), ריווח מותאם והיררכיה חזותית משופרת, אשר יחד מקלים על ניווט אינטואיטיבי יותר. מדד SUS מספק ציון שמישות סטנדרטי הנע בין 0 ל-100, כאשר ערכים גבוהים יותר מעידים על שמישות ובהירות משופרות. המסגרת המוצעת השיגה ציוני SUS גבוהים יותר בהשוואה לשיטות הבסיס, מה שמשקף שיפורים הן בפריסה המבנית והן בבהירות הצבעים. יישור משופר, ריווח וזרימת ניווט תרמו לממשקים שהמשתמשים תפסו כאינטואיטיביים וקוהרנטיים יותר מבחינה תפקודית. מדד AHS, הנמדד בסולם ליקרט בן 7 נקודות, מעריך את המשיכה החזותית הנתפסת ואת הרמוניית הצבעים. ממשקים שנוצרו באמצעות מודול מידול הצבעים המבוסס על CAM02-UCS השיגו ערכי AHS גבוהים יותר, המעידים על מעברי צבע חלקים יותר ופלטות צבעים מאוזנות יותר חזותית. המשתתפים העדיפו בעקביות ממשקים אלה בשל ניגודיות משופרת, קוהרנטיות של גוונים וצמצום של עומס חזותי, מה שמדגיש את חשיבות מידול הצבעים התפיסתי בעיצוב ממשקי משתמש (UI). מדד SET מודד את הזמן הנדרש למשתמשים כדי לאתר אלמנטים של ממשק משתמש במהלך משימות חיפוש חזותי. ערכי SET נמוכים יותר מעידים על ארגון והיררכיה חזותית משופרים. המסגרת המוצעת הפחיתה משמעותית את ה-SET בכל מערכי הנתונים, ובכך הוכיחה ששילוב של קיבוץ גשטלט, ריווח מונחה-קשב ומבני פריסה מזוקקים מאפשר אינטראקציה מהירה ויעילה יותר. מדד CSCR מעריך את עקביות עיצוב ממשק המשתמש על פני מספר מסכים. ציונים גבוהים יותר מעידים על רציפות טובה יותר בפריסה, בצבע ובארגון המבני. המסגרת המוצעת השיגה ערכי CSCR גבוהים יותר, מה שמשקף את יעילותו של מודול העקביות הרב-מסכית בשמירה על סכמות צבעים, ריווח ומבנים היררכיים יציבים על פני הממשקים.
איור 9 מציג את תוצאות מחקר המשתמשים ההשוואתי עבור כל המדדים (NASA-TLX, SUS, AHS, SET ו-CSCR) במאגרי הנתונים RICO, ENRICO ו-Guo. באופן כללי, נצפו שיפורים עקביים בכל מדדי ההערכה. במידה ניכרת, מאגר הנתונים Guo מראה ביצועים עדיפים במדדים הממוקדים במשתמש, כולל עומס קוגניטיבי נמוך יותר (NASA-TLX), שמישות גבוהה יותר (SUS), הרמוניה אסתטית משופרת (AHS), זמן יעילות חיפוש מופחת (SET) ועקביות משופרת בין מסכים (CSCR). עם זאת, תוצאות אלו דורשות פרשנות זהירה. מדדי ה-UX המשופרים שנצפו במאגר הנתונים Guo מיוחסים בעיקר לעקביות הצבעים החזקה שלו ולהרכב ויזואלי פשוט יחסית, ולא לאיכות עדיפה של הפריסה המבנית. בעוד שהמשתמשים תופסים ממשקים אלו כהרמוניים יותר ויזואלית ופחות תובעניים קוגניטיבית, תוצאות קודמות מראות כי מאגר הנתונים Guo מציג ביצועים נחיתים במונחים של יישור, קיבוץ וסדר קריאה. הדבר מדגיש הבחנה חשובה בין גורמים תפיסתיים למבניים בעיצוב UI. בעוד שתכונות תפיסתיות, כגון הרמוניות צבעים, משפרות משמעותית את ה-UX, דיוק מבני ועקביות פריסה נותרים קריטיים לשמישות פונקציונלית. לפיכך, עיצוב UI אופטימלי דורש איזון בין הרמוניה תפיסית לנכונות מבנית.

איור 9. השוואה של מדדי מחקר משתמשים בין סטים של נתונים. תרשים העמודות מקבוצים משווה מדדי מחקר משתמשים בין סטי הנתונים RICO, ENRICO ו-Guo’s UI Color. ציר ה-x מייצג מדדי הערכה, הכוללים את מדד עומס המשימות של נאס"א (NASA-TLX), סולם שמישות המערכת (SUS), ציון הרמוניה אסתטית (AHS), זמן יעילות מבנית (SET), ושיעור עקביות בין מסכים (CSCR), בעוד שציר ה-y מציין את הציונים המתאימים. העמודות מייצגות את הביצועים עבור כל סט נתונים, וממחישות הבדלים בשמישות, בעומס קוגניטיבי, באיכות אסתטית ובעקביות הממשק. NASA-TLX (0–100, נמוך יותר הוא טוב יותר), SUS (0–100, גבוה יותר הוא טוב יותר), AHS (1–7 Likert), SET (s, נמוך יותר הוא טוב יותר), ו-CSCR (0–1, גבוה יותר הוא טוב יותר). אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.
תיקוף סטטיסטי של היפותזות
כדי לתקף עוד יותר את ההשערות המוצעות (H1–H4), בוצעו בדיקות מובהקות סטטיסטיות עבור מדדי הערכה מרכזיים, הכוללים איכות פריסה, עומס קוגניטיבי, הרמוניה של צבעים ומדדי שמישות (טבלה 6). התוצאות מדווחות כממוצע ± סטיית תקן, והמובהקות הסטטיסטית נבחנה באמצעות מבחני t למדגמים מזווגים עם רווח סמך של 95% (p < 0.05). התוצאות מצביעות על כך שהמסגרת המוצעת משיגה שיפורים מובהקים סטטיסטית לעומת גישות הבסיס במגוון מדדים, כולל דיוק יישור, דיוק קיבוץ, סדר קריאה, עומס קוגניטיבי (NASA-TLX) ומדדי הרמוניה של צבעים. במידה ניכרת, הפחתות בעומס הקוגניטיבי ושיפורים במדדי השמישות מראים הבדלים מובהקים מאוד (p < 0.01). ממצאים אלו מאששים כי שילוב של עקרונות עיצוב קוגניטיביים ומידול צבע תפיסתי מוביל לשיפורים מדידים ומובהקים סטטיסטית באיכות ממשק המשתמש (UI), ובכך תומכים בהשערות H1–H4.
| מדד | קו בסיס (Mean ± SD) | המוצע המוצע (Mean ± SD) | שיפור (%) | p-value | מובהקות |
| שגיאת יישור (↓) | 7.8 ± 1.2 | 4.2 ± 0.9 | 46.10% | 0.003 | מובהק |
| דיוק הקיבוץ (↑) | 0.68 ± 0.05 | 0.82 ± 0.04 | 20.50% | 0.001 | מובהק |
| דיוק סדר הקריאה (↑) | 0.72 ± 0.06 | 0.87 ± 0.03 | 20.80% | 0.002 | מובהק |
| NASA-TLX (↓) | 68.5 ± 5.4 | 47.2 ± 4.8 | 31.10% | 0.0005 | מובהק מאוד |
| ציון SUS (↑) | 71.3 ± 6.2 | 88.9 ± 4.5 | 24.70% | 0.0008 | מובהק מאוד |
| מדד הרמוניה צבעונית (↑) | 0.61 ± 0.07 | 0.83 ± 0.05 | 36.00% | 0.001 | מובהק |
| יחס ניגודיות (↑) | 4.1 ± 0.6 | 6.2 ± 0.5 | 51.20% | 0.002 | מובהק |
טבלה 6: השוואה סטטיסטית של מדדי ביצועים בין שיטת הבסיס לשיטות המוצעות. הטבלה מציגה את הממוצע וסטיית התקן (mean ± SD) עבור מדדי ביצועים מרכזיים, כולל שגיאת יישור, דיוק בקיבוץ, דיוק בסדר הקריאה, מדד עומס המשימה של NASA (NASA-TLX), סולם שמישות מערכת (SUS), מדד הרמוניה של צבעים ויחס ניגודיות. מדווחים שיעורי שיפור באחוזים, ערכי p ורמות מובהקות סטטיסטית. (↑) מציין כי ערכים גבוהים יותר הם טובים יותר, ו-(↓) מציין כי ערכים נמוכים יותר הם טובים יותר. המובהקות הסטטיסטית הוערכה ב-p < 0.05.
תצפיות ספציפיות למערך הנתונים
ניתן לייחס את הביצועים הנמוכים יחסית שנצפו במדדים מבניים במערך הנתונים של Guo למאפייניו המובנים. מערך הנתונים של Guo קטן יותר מ-RICO ו-ENRICO ומתמקד בעיקר במאפייני צבע תפיסתיים ולא באנוטציות של פריסה מבנית. כתוצאה מכך, הוא מראה שונות גבוהה יותר במיקום הרכיבים, ארגון היררכי חלש יותר ומבני פריסה פחות עקביים בין המסכים. תכונות אלו הופכות את הלמידה המבנית ואת אופטימיזציית הפריסה למאתגרות יותר, מה שמסביר את הביצועים הנמוכים במדדי יישור, קיבוץ וסדר קריאה, למרות ביצועים חזקים בהערכות תפיסתיות ומרוכזות-משתמש.
ניתוח השפעת רכיבים (Ablation study)
מחקר האבליציה (ablation study) מעריך את התרומה של כל מודול במסגרת המוצעת על ידי הסרה שיטתית של רכיבים בודדים וניתוח השפעתם על איכות הפריסה (layout), מידול הצבעים וביצועי הגילוי. איכות הפריסה מוערכת באמצעות AE, GA, ROA ו-LCS. מדד ה-AE משקף את הסטייה המיקומית של אלמנטים בממשק המשתמש (UI), כאשר ערכים גבוהים יותר מעידים על מבנה מרחבי חלש יותר. GA מעריך עד כמה הרכיבים מאורגנים ביעילות לפי עקרונות הגשטאלט. ROA מודד את השמירה על זרימה חזותית לוגית, בעוד ש-LCS מכמת את העקביות המבנית בין מסכים שונים במונחים של יישור, ריווח וארגון הפריסה. נסיגת איכות הצבע מוערכת באמצעות ΔE (הפרש צבע תפיסתי), CHI ו-CDS, המעריכים יחד את האחידות התפיסית, הקוהרנטיות האסתטית ועשירות הפלטה. ביצועי הגילוי מוערכים באמצעות mAP, precision ו-recall, המכמתים את ההשפעה של החלפת מודול ה-Faster R-CNN במודל גילוי פשוט יותר. יחד, מדדים אלו מספקים הערכה מקיפה של האופן שבו כל מודול תורם לביצועי המערכת הכוללים.
טבלה 7 מסכמת את התרומה של כל מודול ומשווה בין המסגרת המוצעת לגישות קיימות ליצירת ממשקי משתמש (UI). המודל המלא משיג את הביצועים הטובים ביותר בכל מדדי איכות הפריסה, מידול הצבע והזיהוי, דבר המוכיח כי לעיצוב קוגניטיבי, מידול צבע תפיסתי והבנה חזותית עמוקה יש אפקט סינרגטי. כאשר מודול מידול הצבע מוסר, ה-ΔE עולה משמעותית, בעוד שערכי ה-CHI וה-CDS יורדים במידה ניכרת, מה שמעיד על אובדן של אחידות תפיסית והרמוניה צבעונית. הדבר מאשר את חשיבותו של מידול מבוסס CAM02-UCS בשמירה על איכות אסתטית ותפיסית. הסרת מודול הפריסה הקוגניטיבי גורמת לעלייה משמעותית ב-AE ולירידה בולטת ב-GA וב-ROA, מה שמוכיח כי עקרונות עיצוב קוגניטיביים חיוניים ליצירת פריסות קוהרנטיות מבנית וקריאות. הסרת מודול העקביות הרב-מסכית מובילה להפחתה ב-LCS, מה שמאשר את תפקידו בשמירה על דפוסי פריסה עקביים לאורך מספר מסכים. החלפת גלאי ה-Faster R-CNN ב-CNN פשוט יותר גורמת לירידה חדה ב-mAP, בדיוק (precision) ובבזיהוי (recall), דבר המדגיש את החשיבות הקריטית של זיהוי רכיבים חסון בתוך תהליך העבודה הכולל. בהשוואה לשיטות בסיס (baseline), כולל pix2code, REDRAW ו-LDGM, המסגרת המוצעת עולה בעקביות על כל הגישות בדיוק הפריסה, בקוהרנטיות חזותית ובאיכות צבע תפיסית.
| שיטה / מודול | AE ↓ | GA ↑ | ROA ↑ | LCS ↑ | ΔE ↓ | CHI ↑ | CDS ↑ | mAP ↑ |
| מודול צבע הוסר | 0.14 | 0.86 | 0.92 | 0.84 | 7.85 | 0.61 | 12.4 | 0.9 |
| מודול פריסה קוגניטיבי הוסר | 0.18 | 0.72 | 0.73 | 0.69 | 4.21 | 0.79 | 17.9 | 0.89 |
| עקביות רב-מסכית הוסרה | 0.17 | 0.81 | 0.88 | 0.62 | 4.18 | 0.81 | 17.3 | 0.9 |
| Faster R-CNN הוחלף ב-Simple CNN | 0.16 | 0.85 | 0.91 | 0.85 | 4.15 | 0.82 | 18.1 | 0.74 |
| Pix2Code | 0.25 | 0.61 | 0.65 | 0.51 | 10.2 | 0.48 | 9.6 | 0.65 |
| REDRAW | 0.21 | 0.66 | 0.72 | 0.56 | 8.7 | 0.52 | 11.4 | 0.72 |
| LDGM (Layout Diffusion) | 0.19 | 0.74 | 0.79 | 0.63 | 6.9 | 0.59 | 13.8 | 0.8 |
| המודל המלא המוצע | 0.12 | 0.89 | 0.94 | 0.87 | 4.12 | 0.83 | 18.7 | 0.91 |
טבלה 7: מחקר אבלציה (Ablation study) וניתוח ביצועים השוואתי של המסגרה המוצעת ושיטות הבסיס. הטבלה מעריכה את ההשפעה של רכיבים בודדים על ידי השוואת המודל המוצע המלא עם גרסאות שבהן הוסרו מודולים ספציפיים (מודול צבע, מודול פריסה קוגניטיבית, עקביות רב-מסכית, והחלפת Faster R-CNN ב-CNN פשוט), וכן שיטות בסיס (pix2code, REDRAW ו-LDGM). הביצועים מוערכים באמצעות שגיאת יישור (AE), דיוק קיבוץ (GA), דיוק סדר קריאה (ROA), ציון עקביות פריסה (LCS), הפרש צבע תפיסתי (ΔE), מדד הרמוניית צבע (CHI), ציון גיוון צבע (CDS) ודיוק ממוצע משוקלל (mAP). (↑) מעיד כי ערכים גבוהים יותר הם טובים יותר, ו-(↓) מעיד כי ערכים נמוכים יותר הם טובים יותר.
זמינות נתונים:
מערכי הנתונים ששימשו במחקר זה זמינים בקישורים הבאים: מערך נתוני RICO: https://interactionmining.org/rico; מערך נתוני ENRICO: https://github.com/luileito/enrico; מערך נתוני צבעי ממשק משתמש של Guo: https://github.com/guozhongke/UI-Color-Dataset.
קובץ משלים 1. ניסוחים מתמטיים ופרטי יישום מורחבים. קובץ זה מספק את הניסוחים המתמטיים המפורטים ואת זרימות העבודה האלגוריתמיות התומכות במסגרת המוצעת לאב-טיפוס אוטומטי של ממשק משתמש (UI). הוא כולל אימון לגילוי רכיבים, חילוץ תבניות פריסה, מידול הרמוניית צבעים, יעד מאוחד לאב-טיפוס UI, פרטי גילוי באמצעות Faster R-CNN, חישובים של מרחק מרחבי ודמיון יישור, בניית עץ UI לוגי, מידול צבע תפיסתי מבוסס CAM02-UCS, אופטימיזציה של עיצוב קוגניטיבי, מידול עקביות רב-מסכי ואלגוריתמים S1–S3.אנא לחצו כאן להורדת הקובץ.