$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تم تقييم إطار عمل نماذج واجهات المستخدم الآلي المقترح باستخدام مجموعة بيانات متكاملة تضم 5,128 شاشة واجهة مستخدم من ثلاثة مصادر: 4,000 صورة من RICO، و 1,000 شاشة من ENRICO، و 128 عينة واجهة مستخدم مشروحة بالألوان من مجموعة بيانات Guo لألوان واجهات المستخدم. وتوفر مجموعة البيانات المختلطة هذه معياراً متوازناً لتقييم دقة اكتشاف المكونات، ووضوح الهيكل التخطيطي، والاتساق عبر الشاشات المتعددة، والتناغم اللوني الإدراكي.
تظهر النتائج التجريبية أن نموذج الكشف القائم على Faster R-CNN يحقق دقة في الكشف عن المكونات تصل إلى 92.4%، كما يتميز بقدرة فعالة على التعميم عبر أنماط متنوعة من واجهات المستخدم للهواتف المحمولة. علاوة على ذلك، فإن دمج تعليقات أنماط ENRICO يعزز الاستدلال في التخطيط، مما أدى إلى زيادة بنسبة 18.7% في وضوح التخطيط وتحسين الحفاظ على ترتيب القراءة. وفي تجارب تقييم الألوان، تولد وحدة نمذجة الألوان الموجهة بواسطة CAM02-UCS لوحات ألوان أكثر تناسقاً بنسبة 24.5% وفقاً لتقييمات المصممين، وتحقق تماثلاً إدراكياً أعلى مقارنة بطرق توليد لوحات الألوان التقليدية القائمة على RGB و LAB. بالإضافة إلى ذلك، تحقق نمذجة الاتساق متعدد الشاشات تحسناً بنسبة 28% في المحاذاة عبر الشاشات واتساق الطباعة. وتظهر دراسات المستخدمين التي شملت 30 مشاركاً انخفاضاً بنسبة 31% في العبء المعرفي المدرك عند التفاعل مع النماذج الأولية التي أنتجها النظام المقترح. وتشير هذه النتائج مجتمعة إلى أن الجمع بين الكشف عن المكونات، ونمذجة الألوان الإدراكية، والتحسين المعرفي ينتج نماذج أولية لواجهة المستخدم ليست دقيقة هيكلياً فحسب، بل متماسكة بصرياً وفعالة معرفياً أيضاً. يسلط الجدول 3 الضوء على بيئة المحاكاة والإعدادات التقنية المستخدمة لتقييم إطار عمل النماذج الأولية لواجهة المستخدم المقترح. وقد دُعمت إجراءات التدريب كثيفة الحوسبة لنموذج Faster R-CNN ووحدات اتساق التخطيط بواسطة وحدة معالجة رسومات NVIDIA RTX 4090 عالية الأداء. وقد أُجريت جميع التجارب في بيئة Ubuntu 22.04 باستخدام PyTorch 2.0 لتنفيذ التعلم العميق.
| المَعلمة | التكوين |
| الأجهزة | NVIDIA RTX 4090 GPU (24 GB), Intel i9 Processor, 64 GB RAM |
| نظام التشغيل | Ubuntu 22.04 LTS |
| إطار التعلم العميق | PyTorch 2.0 |
| العمود الفقري لـ Faster R-CNN | ResNet-50 + FPN |
| دقة الصورة | 480 × 800 (مُوحّدة عبر جميع مجموعات البيانات) |
| حجم دفعة التدريب | 8 |
| المُحسِّن | AdamW (LR = 1e−4, Weight Decay = 0.01) |
| عدد الدورات (Epochs) | 40 |
| فضاء نمذجة الألوان | CAM02-UCS |
| التجميع لاستخراج لوحة الألوان | K-means (k = 5) |
| تجميع المخطط | DBSCAN (ε = 20, min_samples = 3) |
الجدول 3: معلمات التنفيذ والتكوين التجريبي للإطار المقترح. يلخص الجدول إعدادات الأجهزة والبرمجيات المستخدمة لتدريب النموذج وتقييمه، بما في ذلك الموارد الحسابية، ونظام التشغيل، وإطار التعلم العميق، وبنية النموذج، ودقة الصورة، ومعلمات التدريب، واستراتيجية التحسين، وفضاء نمذجة الألوان، وطرق التجميع المستخدمة لاستخراج لوحة الألوان وتجميع التخطيط.
تستخدم بنية Faster R-CNN عمود فقري من نوع ResNet-50 مع شبكة هرمية الميزات (FPN) للكشف عن مجموعة واسعة من مكونات واجهة المستخدم الدقيقة. يتم تغيير حجم جميع صور واجهة المستخدم بشكل موحد إلى 480 × 800 بكسل قبل المعالجة. يتم إجراء التدريب على مدار 60 حقبة (epochs) باستخدام محسن SGD، مع حجم دفعة يبلغ 16 لضمان التقارب المستقر. يستخدم مولد لوحة الألوان نظام CAM02-UCS مع تجميع K-means، بينما يُستخدم DBSCAN لتجميع المخطط الهيكلي. تضمن هذه الإعدادات التقنية أن تكون نتائج واجهة المستخدم المولدة قابلة للتكرار ومستقرة وعالية الدقة. ولتقديم تقييم شامل لإطار عمل النمذجة الأولية المؤتمتة لواجهة المستخدم المقترح، يتم استخدام أربع فئات من مقاييس التقييم:
أ) أداء اكتشاف المكونات، والذي تم تحليله باستخدام الدقة (precision)، والاستدعاء (recall)، ومقياس F1-score، والتقاطع فوق الاتحاد (IoU)، ومتوسط الدقة المتوسطة (mAP)، وهي مقاييس تحدد مدى دقة نموذج Faster R-CNN في التعرف على مكونات واجهة المستخدم عبر مجموعتي بيانات RICO وENRICO؛
2) وضوح التخطيط والاتساق الهيكلي، ويتم قياسهما من خلال خطأ المحاذاة (AE)، ودقة التجميع، وصحة ترتيب القراءة، ودرجات الاتساق عبر الشاشات المشتقة من قيود نمط التصميم؛
iii) جودة اللون الإدراكية، التي تم تقييمها باستخدام المسافة الإدراكية CAM02-UCS (ΔE_UCS)، ونسب تباين WCAG 2.1، ومؤشر التنوع، ودرجات التناغم اللوني المستوحاة من إطار عمل Guo لتقييم ألوان واجهة المستخدم؛
4) مقاييس الكفاءة المعرفية المتمحورة حول المستخدم، بما في ذلك الحمل المعرفي الذي تم قياسه بواسطة مؤشر ناسا لحمل المهام (NASA-TLX)، وتقييمات التماسك الجمالي، وكفاءة إنجاز المهام.
تتيح هذه المقاييس تقييم إطار العمل ليس فقط من حيث دقة الكشف، ولكن أيضاً من حيث التناغم الإدراكي، وجودة القابلية للاستخدام، والتجربة المعرفية.
مقاييس الكشف عن المكونات
تصف الدقة (Precision) مدى إحكام النموذج في التنبؤ بمكونات واجهة المستخدم دون إنشاء إيجابيات كاذبة. وتعني الدقة العالية أن معظم صناديق الإحاطة المتوقعة تتوافق مع عناصر واجهة مستخدم صالحة. أما الاستدعاء (Recall) فيقيس قدرة النموذج على تحديد جميع مكونات واجهة المستخدم ذات الصلة على الشاشة. ويشير الاستدعاء العالي إلى أن النموذج ينجح في اكتشاف معظم المكونات المرجعية (ground-truth). ويوفر مقياس F1-score، الذي يُعرف بأنه المتوسط الهندسي للدقة والاستدعاء، تقييماً متوازناً ويكون مفيداً بشكل خاص عندما تكون مكونات واجهة المستخدم موزعة بشكل غير متساوٍ عبر مجموعات البيانات.
يقيس مقياس IoU مدى تداخل صندوق الإحاطة المتوقع مع صندوق الإحاطة الحقيقي. وفي مهام اكتشاف الكائنات، تُستخدم عتبات IoU بقيمة 0.5 و0.75 عادةً لتمثيل شروط تقييم متوسطة وصارمة. ويلخص mAP أداء الاكتشاف عبر عتبات IoU متعددة. ويوفر مقياس mAP@0.5:0.95 تقييمًا أكثر قوة من خلال حساب متوسط الدقة عبر العتبات من 0.5 إلى 0.95 بخطوات قدرها 0.05، وعليه فهو مقبول على نطاق واسع كمعيار قياسي لاكتشاف الكائنات.
تشير نتائج الكشف عبر مجموعات البيانات الثلاث إلى أن وحدة كشف المكونات المقترحة تعمل بشكل جيد ومتسق. وتظهر النتائج الكمية في الجدول 4. حققت مجموعة بيانات RICO أعلى أداء، بدقة بلغت 0.91، واستدعاء بنسبة 0.88، ومقياس F1 قدره 0.89، وذلك بفضل مجموعتها الكبيرة والمتنوعة من تعليقات مكونات واجهة المستخدم. وتظهر مجموعة ENRICO درجات أقل قليلاً بسبب هيكلها الأكثر تبسيطاً وقلة أنواع المكونات المشروحة. وسجلت مجموعة بيانات Guo أدنى مقياس F1 (0.81)، ويرجع ذلك على الأرجح إلى التباين البصري الأكبر وقلة أنماط التخطيط الموحدة، مما يجعل عملية الكشف أكثر صعوبة. وبشكل عام، تؤكد هذه النتائج أن النموذج يحافظ على أداء قوي في كشف المكونات عبر مختلف أنماط تصميم واجهة المستخدم وخصائص مجموعات البيانات.
| مجموعة البيانات | الدقة | الاستدعاء | مقياس F1 |
| RICO | 0.91 | 0.88 | 0.89 |
| ENRICO | 0.87 | 0.84 | 0.85 |
| Guo | 0.83 | 0.8 | 0.81 |
الجدول 4: أداء الكشف عن المكونات عبر مجموعات البيانات. يعرض الجدول الدقة (precision)، والاستدعاء (recall)، ومقياس F1-score للكشف عن مكونات واجهة المستخدم عبر مجموعات بيانات RICO وENRICO وGuo، مما يوضح فعالية نموذج الكشف.
يوضح الشكل 3 أداء النموذج عبر مجموعات بيانات RICO وENRICO وGuo عند عتبات IoU تبلغ 0.5 و0.75. وكما هو متوقع، تكون قيم mAP أعلى عند IoU 0.5 بسبب متطلبات التداخل الأكثر تساهلاً. تسجل RICO باستمرار أعلى قيم mAP (0.89 عند IoU 0.5 و0.78 عند IoU 0.75)، مما يعكس ثراء وتماسك تعليقاتها التوضيحية. وتظهر ENRICO قيمًا أقل قليلاً، بينما تسجل Guo أدنى الدرجات بسبب التباين الأكبر في نمط التنسيق وكثافة المكونات. ويوضح الاتجاه التنازلي مع عتبات IoU الأكثر صرامة أن تعقيد مجموعة البيانات يؤثر بشكل مباشر على متانة الكشف.

الشكل 3. متوسط الدقة المتوسطة (mAP) عند عتبات التقاطع فوق الاتحاد (IoU) البالغة 0.5 و0.75 عبر مجموعات البيانات. يقارن المخطط الخطي أداء اكتشاف المكونات عبر مجموعات بيانات RICO وENRICO وGuo. يمثل المحور السيني (x) مجموعات البيانات، بينما يوضح المحور الصادي (y) قيم mAP. ويتوافق المنحنيان مع عتبات IoU البالغة 0.5 و0.75، مما يوضح تباين الأداء تحت مستويات مختلفة من صرامة الاكتشاف. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
الشكل 4 يعرض mAP@IoU(0.5:0.95) لكل مجموعة بيانات، مما يوفر تقييماً أوسع لأداء الكشف عبر عشر عتبات IoU. وتكشف النتائج عن اتجاه تنازلي واضح من RICO (0.61) إلى ENRICO (0.57) وGuo (0.52)، مما يؤكد أن نموذج الكشف المقترح يحقق أفضل تعميم على مجموعات البيانات الأكبر والأكثر هيكلة. ويسلط هذا المقياس المتوسط الأكثر صرامة الضوء على تدهورات طفيفة في الأداء قد لا تكون واضحة عند التقييم باستخدام عتبة واحدة. وتشير هذه النتائج إلى أنه على الرغم من الأداء القوي للنموذج عبر جميع مجموعات البيانات، فإن زيادة تنوع المخططات وتغير المكونات تفرض تحديات إضافية في ظل التقييم الصارم وفق نمط COCO. وتظهر نتائج الكشف في الشكلين 3 و4، واللذين يقدمان مقارنات كمية لـ mAP عبر مستويات IoU المختلفة.

الشكل 4. متوسط الدقة المتوسطة (mAP) المحسوب عبر عتبات التقاطع فوق الاتحاد (IoU) من 0.5 إلى 0.95 عبر مجموعات البيانات. يوضح المخطط الخطي أداء الكشف عن المكونات عبر مجموعات بيانات RICO و ENRICO و Guo باستخدام مقياس mAP المحسوب عبر عتبات IoU التي تتراوح من 0.5 إلى 0.95. يمثل المحور السيني مجموعات البيانات، ويشير المحور الصادي إلى قيم mAP المقابلة المسجلة على مقياس من 0 إلى 1، مما يعكس أداء النموذج تحت عتبات كشف متغيرة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
مقاييس جودة التخطيط
يتم تقييم جودة التخطيط باستخدام AE، ودقة التجميع (GA)، ودقة ترتيب القراءة (ROA)، والتي تقيم مجتمعةً الصحة الهيكلية، والتنظيم الإدراكي، والقابلية المعرفية للقراءة لتخطيطات واجهة المستخدم الناتجة.
خطأ في المحاذاة.
يشير AE (الانحراف القائم على البكسل) إلى مدى محاذاة عناصر واجهة المستخدم مع خطوط المحاذاة المثالية، مثل أدلة المحاذاة لليسار أو اليمين أو الأعلى أو خط الأساس. ويشير انخفاض قيمة AE إلى أن العناصر مرتبة بشكل متسق مع حد أدنى من التشوه البصري، مما يحسن القابلية للقراءة ووضوح التصميم العام. وتعتبر هذه المقياس مهمًا بشكل خاص لتقييم تحسين التخطيط المعرفي، حيث أن عدم المحاذاة يقطع التدفق البصري ويزيد من التعقيد الملحوظ. يوضح الشكل 5 قيمة AE عبر مجموعات بيانات RICO وENRICO وGuo، مقاسة كمتوسط انحراف البكسل عن خطوط المحاذاة المثالية. وتظهر النتائج أن RICO تحقق أدنى AE (4.2 px)، مما يشير إلى أن مكونات واجهة المستخدم في مجموعة البيانات هذه تظهر أنماطًا هيكلية أكثر اتساقًا، مما يسهل عملية المحاذاة بالنسبة للنموذج. وتليها ENRICO بانحراف محاذاة متوسط قدره 6.1 px، مما يعكس مزيجًا من تخطيطات الشاشة جيدة الهيكلة والمتنوعة. بينما تسجل مجموعة بيانات Guo أعلى AE (7.4 px)، وذلك بسبب تنوعها الأعلى في وضع المكونات وهياكل التخطيط غير القياسية، والتي تشكل تحديًا للتحسين القائم على المحاذاة. وبشكل عام، تثبت هذه النتائج أن النموذج يحافظ على دقة محاذاة قوية عبر مجموعات البيانات المختلفة، رغم زيادة تعقيد التخطيط.

الشكل 5. خطأ المحاذاة عبر مجموعات البيانات. يوضح الشكل خطأ المحاذاة عبر مجموعات البيانات؛ حيث تشير القيم الأدنى إلى محاذاة أفضل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
دقة التجميع (GA).
تقيس دقة التجميع (GA) مدى فعالية النموذج في تجميع مكونات واجهة المستخدم ذات الصلة، على سبيل المثال، بناءً على مبادئ الجشطالت مثل التقارب والتشابه والاستمرارية. وتشير دقة التجميع الأعلى إلى أن النموذج يحافظ على الهيكل المقصود لعناصر واجهة المستخدم، مما يمكن المستخدمين من تفسير الواجهة بشكل طبيعي أكثر. وتعد هذه المترية مفيدة بشكل خاص لتقييم ما إذا كانت وحدة تحسين التخطيط تنجح في تنظيم المحتوى إلى مجموعات بصرية ذات معنى. يوضح الشكل 6 توزيع دقة التجميع (GA) التي حققها الإطار المقترح عبر المجموعات الثلاث من البيانات. تُظهر مجموعة بيانات ENRICO أعلى قيمة وسيطة لدقة التجميع وأصغر نطاق ربيعي، مما يشير إلى أداء تجميع مستقر ومتسق نظرًا لتخطيطاتها المحددة جيدًا والمصنفة حسب الأنماط. بينما تظهر مجموعة بيانات RICO دقة تجميع متوسطة مع تباين أعلى، ويرجع ذلك على الأرجح إلى تنوعها الأكبر وتعقيد التخطيط فيها. وتسجل مجموعة بيانات Guo UI Color دقة تجميع أقل، حيث أن عيناتها غير متجانسة بصرياً وأقل تركيزاً على التخطيط الهيكلي. وبشكل عام، تشير النتائج إلى أن وحدة تحسين التخطيط المعرفي تعمل بشكل موثوق عبر مجموعات البيانات، حيث تحقق أفضل أداء تجميع في البيانات المتسقة هيكلياً.

الشكل 6. توزيع دقة التجميع عبر مجموعات البيانات. يوضح المخطط الصندوقي دقة التجميع بناءً على مبادئ الجشتالت عبر مجموعات بيانات RICO وENRICO وGuo’s UI Color. تمثل الصناديق المدى الربيعي، ويشير الخط المركزي إلى الوسيط، بينما تدل الشعيرات على نطاق القيم. يمثل المحور السيني مجموعات البيانات، ويوضح المحور الصادي درجات دقة التجميع. حجم العينة n=5128 شاشة واجهة مستخدم (RICO: 4000، وENRICO: 1000، وGuo: 128). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
دقة ترتيب القراءة (ROA).
تقيس دقة ترتيب القراءة (ROA) مدى دقة النموذج في التنبؤ بتدفق القراءة الطبيعي لشاشة واجهة المستخدم، والذي يتبع عادةً نمطاً من الأعلى إلى الأسفل ومن اليسار إلى اليمين. ويعد الحفاظ على ترتيب القراءة الصحيح أمراً أساسياً لسهولة الاستخدام، ووضوح التنقل، والاتساق مع اتفاقيات التصميم المعتمدة. وتشير قيمة ROA المرتفعة إلى أن النظام يحافظ على أنماط المسح المعرفي المتوقعة. يوضح الشكل 7 قيمة ROA عبر مراحل تقييم مختلفة لمجموعات بيانات RICO وENRICO وGuo. تحقق ENRICO باستمرار أعلى قيمة ROA نظراً لهيكل تخطيطها المنتظم والموجه وفق أنماط محددة، مما يسمح بتنبؤ أكثر دقة بتسلسلات القراءة الشبيهة بالبشر. وتظهر RICO أداءً متوسطاً مع تباين طفيف، مما يعكس تنوعها الأكبر وتعقيدها في العالم الحقيقي. أما مجموعة بيانات Guo فتظهر أدنى قيمة ROA، حيث أن العديد من شاشاتها غنية بصرياً ولكنها تفتقر إلى تسلسلات هرمية واضحة للقراءة. وبشكل عام، تشير هذه النتائج إلى أن وحدة تحسين التخطيط المعرفي المقترحة تعمل بموثوقية أكبر في مجموعات البيانات المنظمة، مع الحفاظ على تنبؤات مستقرة لترتيب القراءة عبر تصميمات واجهات المستخدم المتنوعة.

الشكل 7. دقة ترتيب القراءة عبر مراحل التقييم لمجموعات بيانات متعددة. يوضح المخطط الخطي دقة ترتيب القراءة عبر خطوات التقييم لمجموعات بيانات RICO و ENRICO و Guo’s UI Color. يمثل المحور السيني (x) مرحلة التقييم، ويشير المحور الصادي (y) إلى دقة ترتيب القراءة. يمثل كل منحنى مجموعة بيانات، مما يوضح التغيرات في الحفاظ على التدفق البصري عبر مراحل التقييم المتتالية. تمثل مرحلة التقييم مراحل التنقيح التدريجي لإطار العمل المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
درجة اتساق المخطط (LCS)
تقيس درجة اتساق التخطيط (LCS) مدى الحفاظ على اتساق تخطيطات واجهة المستخدم المُنشأة عبر شاشات متعددة داخل التطبيق نفسه. ويشمل ذلك الاتساق في المسافات، وقواعد المحاذاة، ومناطق الطباعة، وأنماط التجميع. وتشير الدرجة الأعلى إلى تحسن في التماسك عبر الشاشات، مما يؤدي إلى تجربة مستخدم (UX) أكثر توحيداً وبداهة. يعرض الشكل 8 درجة LCS التي تم قياسها عبر مراحل تقييم متعددة لمجموعات بيانات RICO وENRICO وGuo’s UI Color. تحقق مجموعة بيانات ENRICO باستمرار أعلى قيم لـ LCS نظراً لشاشات واجهة المستخدم الموحدة هيكلياً والمصنفة حسب الأنماط، مما يسهل التعلم الأكثر استقراراً للاتساق عبر الشاشات. وفي المقابل، تظهر مجموعة بيانات RICO اتساقاً متوسطاً ولكنه يتحسن بشكل مطرد، وهو ما يعزى إلى قدرة النموذج على التعميم عبر تخطيطات واجهة مستخدم شديدة التنوع. وكما هو متوقع، تسجل مجموعة بيانات Guo أدنى قيم LCS، لأنها تركز بشكل أساسي على خصائص الألوان بدلاً من التخطيط الهيكلي، مما يجعل الاتساق عبر الشاشات المتعددة أكثر صعوبة. وبشكل عام، تشير هذه النتائج إلى أن وحدة الاتساق المقترحة عبر الشاشات تعمل بأكبر قدر من الفعالية في مجموعات البيانات الموجهة نحو الأنماط، بينما لا تزال توفر تحسينات ملموسة عبر جميع مجموعات البيانات.

الشكل 8. درجة اتساق التخطيط عبر مراحل التقييم لمجموعات بيانات متعددة. يوضح المخطط الخطي درجات اتساق التخطيط عبر مراحل التقييم لمجموعات بيانات RICO وENRICO وGuo’s UI Color. يمثل المحور السيني (x) مرحلة التقييم، بينما يشير المحور الصادي (y) إلى درجات اتساق التخطيط. يمثل كل منحنى مجموعة بيانات، مما يوضح التحسن في التماسك الهيكلي للواجهات المُولدة عبر مراحل التقييم المتتالية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
مقاييس جودة اللون
يتم تقييم سمات ألوان واجهة المستخدم المُولدة باستخدام خمسة مقاييس قائمة على الإدراك مشتقة من CAM02-UCS: ΔE (فرق اللون الإدراكي)، والذي يحدد كمياً التجانس الإدراكي بين ألوان اللوحة؛ ونسبة التباين (بناءً على WCAG 2.1)، والتي تقيم قابلية القراءة بين عناصر المقدمة والخلفية؛ ومؤشر التناغم اللوني (CHI)، الذي يقيس التوافق الجمالي بين التدرجات اللونية؛ ودرجة تنوع الألوان (CDS)، التي تعكس التباين ضمن الفضاء اللوني الإدراكي؛ ودرجة بروز اللون (CPS)، التي تقيم التوازن وهيمنة الألوان داخل اللوحة. وتوفر هذه المقاييس مجتمعة تقييماً شاملاً لكل من الجودة الجمالية وأداء الألوان الموجه نحو سهولة الاستخدام. وتظهر النتائج أن الطريقة المقترحة تحقق قيمة ΔE أقل تبلغ 4.12، مما يشير إلى تحسن في التجانس الإدراكي عبر الألوان. وتؤكد نسبة تباين تبلغ 6.21 الامتثال لمعايير إمكانية الوصول، مما يضمن تعزيز قابلية القراءة. يعرض الجدول 5 مقارنة كمية بين وحدة نمذجة الألوان المقترحة والطرق المرجعية. حيث ارتفع مؤشر CHI من 0.61 إلى 0.83، مما يشير إلى تحسن التماسك الجمالي في الانتقالات اللونية. بالإضافة إلى ذلك، زادت درجة CDS بنسبة تزيد عن 50%، مما يثبت أن اللوحات المُولدة تحافظ على تباين أغنى دون إحداث فوضى بصرية. وتشير قيم CPS الأعلى إلى توزيع متوازن للألوان السائدة، مما يمنع التشبع المفرط لأي تدرج لوني واحد. وبشكل عام، تؤكد هذه النتائج فعالية وحدة نمذجة الألوان القائمة على CAM02-UCS في توليد مخططات ألوان لواجهة المستخدم تكون متناغمة، وقابلة للقراءة، ومُحسّنة إدراكياً.
| مقياس | تعريف | الطريقة المقترحة | الخط المرجعي1 | التحسن (%) |
| Δإي (CAM02-UCS) | الفرق اللوني الإدراكي | 4.12 | 7.85 | أقل بنسبة 47.5% |
| نسبة التباين (WCAG) | مقروئية أزواج المقدمة والخلفية (FG-BG) | 6.21 | 4.38 | 41.80% |
| مؤشر التناغم اللوني (CHI) | تدرج لوني & التناغم اللوني | 0.83 | 0.61 | 36.10% |
| درجة تنوع الألوان (CDS) | التباين في J′a′b′ الفضاء | 18.70 | 12.40 | 50.80% |
| درجة بروز اللون (CPS) | ثبات الألوان السائدة | 0.72 | 0.55 | 30.90% |
الجدول 5: مقارنة كمية لمقاييس جودة اللون بين الطرق المقترحة والمرجعية. يعرض الجدول مقاييس تقييم جودة اللون، بما في ذلك فرق اللون الإدراكي (ΔE في CAM02-UCS)، ونسبة التباين (WCAG)، ومؤشر التناغم اللوني (CHI)، ودرجة تنوع الألوان (CDS)، ودرجة بروز اللون (CPS). تمت مقارنة نتائج الطريقة المقترحة بالقيم المرجعية، جنباً إلى جنب مع نسب التحسن.
الديموغرافيا الخاصة بالمشاركين وتصميم الدراسة
شارك ما مجموعه 30 مشاركاً في عملية التقييم. تراوحت أعمار المشاركين بين 20 و35 عاماً (متوسط العمر: 26.4 ± 3.2 سنة). تضمنت المجموعة أفراداً من خلفيات متنوعة، بما في ذلك مهندسو برمجيات، وطلاب، ومصممو واجهة المستخدم وتجربة المستخدم (UI/UX). وبناءً على الكفاءة الذاتية في استخدام الكمبيوتر، تم تصنيف 40% من المشاركين كمستخدمين متوسطي المستوى، و35% كمستخدمين متقدمين، و25% كمبتدئين. وكان لدى نصف المشاركين تقريباً خبرة سابقة في تصميم واجهة المستخدم وتجربة المستخدم (UI/UX) أو المجالات ذات الصلة، بينما لم يمتلك بقية المشاركين هذه الخبرة. وقد ضمن هذا التنوع إجراء تقييم متوازن عبر مختلف مستويات الخبرة التقنية والإلمام بمبادئ التصميم.
مقاييس دراسة المستخدم
أُجري تقييم متمحور حول المستخدم باستخدام مقاييس متعددة، شملت مؤشر NASA-TLX، ومقياس سهولة استخدام النظام (SUS)، ودرجة التناغم الجمالي (AHS)، ووقت كفاءة البحث (SET)، وتقييم الاتساق عبر الشاشات (CSCR)، وذلك لتقييم الحمل المعرفي، وسهولة الاستخدام، والجاذبية البصرية، والكفاءة، والاتساق.
يقوم مقياس NASA-TLX بتحديد العبء الذهني كمياً من خلال قياس عوامل مثل المتطلبات الذهنية والجهد والإحباط. وتشير الدرجات المنخفضة إلى انخفاض الحمل المعرفي وتحسن سهولة التفاعل. وقد أدى الإطار المقترح باستمرار إلى درجات NASA-TLX أقل في جميع مجموعات البيانات، مما يشير إلى انخفاض الجهد الذهني. ويمكن إرجاع هذا التحسن إلى دمج مبادئ التصميم المعرفي، بما في ذلك تجميع غيشتالت (Gestalt grouping)، والمسافات المحسنة، والتسلسل الهرمي البصري المعزز، والتي تسهل مجتمعة عملية التنقل بشكل أكثر بديهية. ويوفر مقياس SUS درجة سهولة استخدام معيارية تتراوح من 0 إلى 100، حيث تشير القيم الأعلى إلى تحسن في سهولة الاستخدام والوضوح. وحقق الإطار المقترح درجات SUS أعلى مقارنة بالطرق المرجعية، مما يعكس تحسينات في كل من التخطيط الهيكلي ووضوح الألوان. وقد ساهم تحسين المحاذاة والتباعد وتدفق التنقل في إنشاء واجهات اعتبرها المستخدمون أكثر بديهية وتماسكاً من الناحية الوظيفية. أما مقياس AHS، الذي يُقاس وفق مقياس ليكرت المكون من 7 نقاط، فيقيم الجاذبية البصرية الملحوظة والتناغم اللوني. وقد حققت الواجهات التي تم إنشاؤها باستخدام وحدة نمذجة الألوان القائمة على CAM02-UCS قيم AHS أعلى، مما يشير إلى انتقالات لونية أكثر سلاسة ولوحات ألوان أكثر توازناً بصرياً. وفضل المشاركون هذه الواجهات باستمرار بسبب تحسن التباين وتناسق التدرج اللوني وتقليل الفوضى البصرية، مما يسلط الضوء على أهمية نمذجة الألوان الإدراكية في تصميم واجهة المستخدم (UI). ويقيس SET الوقت المطلوب من المستخدمين لتحديد عناصر واجهة المستخدم المستهدفة أثناء مهام البحث البصري؛ حيث تشير قيم SET المنخفضة إلى تحسن في التنظيم والتسلسل الهرمي البصري. وقد خفض الإطار المقترح قيمة SET بشكل كبير عبر جميع مجموعات البيانات، مما يثبت أن دمج تجميع غيشتالت، والتباعد الموجه بالانتباه، وهياكل التخطيط المنقحة، يتيح تفاعلاً أسرع وأكثر كفاءة. ويقيم مقياس CSCR مدى اتساق تصميم واجهة المستخدم عبر شاشات متعددة، حيث تشير الدرجات الأعلى إلى استمرارية أفضل في التخطيط واللون والتنظيم الهيكلي. وحقق الإطار المقترح قيم CSCR أعلى، مما يعكس فعالية وحدة الاتساق متعدد الشاشات في الحفاظ على مخططات ألوان ومسافات وهياكل هرمية مستقرة عبر الواجهات.
الشكل 9 يعرض نتائج دراسة المستخدم المقارنة لجميع المقاييس (NASA-TLX وSUS وAHS وSET وCSCR) عبر مجموعات بيانات RICO وENRICO وGuo. وبشكل عام، لوحظت تحسينات مستمرة في جميع مقاييس التقييم. ومن الجدير بالذكر أن مجموعة بيانات Guo أظهرت أداءً متفوقاً في المقاييس المتمحورة حول المستخدم، بما في ذلك انخفاض الحمل المعرفي (NASA-TLX)، وزيادة القابلية للاستخدام (SUS)، وتحسن التناغم الجمالي (AHS)، وتقليل زمن كفاءة البحث (SET)، وتحسن الاتساق عبر الشاشات (CSCR). ومع ذلك، فإن هذه النتائج تتطلب تفسيراً دقيقاً؛ إذ تُعزى مقاييس تجربة المستخدم (UX) المحسنة الملحوظة في مجموعة بيانات Guo أساساً إلى اتساق ألوانها القوي وتكوينها البصري الأبسط نسبياً، وليس إلى جودة التخطيط الهيكلي المتفوقة. وبينما يرى المستخدمون أن هذه الواجهات أكثر تناغماً بصرياً وأقل تطلباً من الناحية المعرفية، إلا أن النتائج السابقة أظهرت أن مجموعة بيانات Guo تؤدي بشكل ضعيف من حيث المحاذاة والتجميع وترتيب القراءة. وهذا يسلط الضوء على تمييز مهم بين العوامل الإدراكية والهيكلية في تصميم واجهة المستخدم (UI). فبينما تعمل السمات الإدراكية، مثل التناغم اللوني، على تعزيز تجربة المستخدم بشكل كبير، تظل الدقة الهيكلية واتساق التخطيط أمرين حاسمين للقابلية الوظيفية للاستخدام. وبناءً على ذلك، يتطلب التصميم الأمثل لواجهة المستخدم توازناً بين التناغم الإدراكي والصحة الهيكلية.

الشكل 9. مقارنة مقاييس دراسة المستخدم عبر مجموعات البيانات. يقارن المخطط الشريطي المجمّع مقاييس دراسة المستخدم عبر مجموعات بيانات RICO وENRICO وGuo’s UI Color. يمثل المحور السيني مقاييس التقييم، بما في ذلك مؤشر ناسا لحمل المهام (NASA-TLX)، ومقياس سهولة استخدام النظام (SUS)، ودرجة التناغم الجمالي (AHS)، ووقت الكفاءة الهيكلية (SET)، ومعدل الاتساق عبر الشاشات (CSCR)، بينما يشير المحور الصادي إلى الدرجات المقابلة. تمثل الأشرطة الأداء لكل مجموعة بيانات، مما يوضح الاختلافات في سهولة الاستخدام، والحمل المعرفي، والجودة الجمالية، واتساق الواجهة. NASA-TLX (0–100، الأقل هو الأفضل)، SUS (0–100، الأعلى هو الأفضل)، AHS (مقياس ليكرت 1–7)، SET (s، الأقل هو الأفضل)، وCSCR (0–1، الأعلى هو الأفضل). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
التحقق الإحصائي من الفرضيات
لمزيد من التحقق من صحة الفرضيات المقترحة (H1–H4)، تم إجراء اختبارات الدلالة الإحصائية على مقاييس التقييم الرئيسية، بما في ذلك جودة التنسيق، والعبء المعرفي، والتناغم اللوني، ومقاييس سهولة الاستخدام (الجدول 6). تم تسجيل النتائج في صورة المتوسط ± الانحراف المعياري، وقُيمت الدلالة الإحصائية باستخدام اختبارات t المقترنة مع فاصل ثقة 95% (p < 0.05). وتشير النتائج إلى أن الإطار المقترح يحقق تحسينات ذات دلالة إحصائية مقارنة بالمنهجيات المرجعية عبر مقاييس متعددة، بما في ذلك دقة المحاذاة، ودقة التجميع، وترتيب القراءة، والعبء المعرفي (NASA-TLX)، ومقاييس التناغم اللوني. والجدير بالذكر أن الانخفاض في العبء المعرفي والتحسينات في مقاييس سهولة الاستخدام أظهرت فروقاً ذات دلالة إحصائية عالية (p < 0.01). وتؤكد هذه النتائج أن دمج مبادئ التصميم المعرفي ونمذجة الألوان الإدراكية يؤدي إلى تحسينات ملموسة وذات دلالة إحصائية في جودة واجهة المستخدم (UI)، مما يدعم الفرضيات H1–H4.
| المقياس | الخط الأساسي (Mean ± SD) | المقترح (Mean ± SD) | التحسن (%) | قيمة p-value | الدلالة الإحصائية |
| خطأ المحاذاة (↓) | 7.8 ± 1.2 | 4.2 ± 0.9 | 46.10% | 0.003 | دال إحصائياً |
| دقة التجميع (↑) | 0.68 ± 0.05 | 0.82 ± 0.04 | 20.50% | 0.001 | دال إحصائياً |
| دقة ترتيب القراءة (↑) | 0.72 ± 0.06 | 0.87 ± 0.03 | 20.80% | 0.002 | دال إحصائياً |
| NASA-TLX (↓) | 68.5 ± 5.4 | 47.2 ± 4.8 | 31.10% | 0.0005 | دال إحصائياً بدرجة عالية |
| درجة SUS (↑) | 71.3 ± 6.2 | 88.9 ± 4.5 | 24.70% | 0.0008 | دال إحصائياً بدرجة عالية |
| مؤشر التناغم اللوني (↑) | 0.61 ± 0.07 | 0.83 ± 0.05 | 36.00% | 0.001 | دال إحصائياً |
| نسبة التباين (↑) | 4.1 ± 0.6 | 6.2 ± 0.5 | 51.20% | 0.002 | دال إحصائياً |
الجدول 6: مقارنة إحصائية لمقاييس الأداء بين الطرق المرجعية والطرق المقترحة. يعرض الجدول المتوسط والانحراف المعياري (mean ± SD) لمقاييس الأداء الرئيسية، بما في ذلك خطأ المحاذاة، ودقة التجميع، ودقة ترتيب القراءة، ومؤشر ناسا لعبء المهام (NASA-TLX)، ومقياس سهولة استخدام النظام (SUS)، ومؤشر التناغم اللوني، ونسبة التباين. كما تم رصد نسب التحسن، وقيم p، ومستويات الدلالة الإحصائية. يشير الرمز (↑) إلى أن القيم الأعلى هي الأفضل، ويشير الرمز (↓) إلى أن القيم الأدنى هي الأفضل. تم تقييم الدلالة الإحصائية عند p < 0.05.
ملاحظات خاصة بمجموعة البيانات
يمكن إرجاع الأداء المنخفض نسبيًا الملاحظ في المقاييس الهيكلية لمجموعة بيانات Guo إلى خصائصها المتأصلة. فمجموعة بيانات Guo أصغر من RICO وENRICO، وتركز بشكل أساسي على سمات اللون الإدراكية بدلاً من التعليقات التوضيحية للهيكل التنظيمي. ونتيجة لذلك، تظهر هذه المجموعة تباينًا أعلى في وضع المكونات، وتنظيمًا هرميًا أضعف، وهياكل تخطيط أقل اتساقًا عبر الشاشات. تجعل هذه الخصائص تعلم الهيكل وتحسين التخطيط أكثر صعوبة، مما يفسر انخفاض الأداء في مقاييس المحاذاة، والتجميع، وترتيب القراءة، على الرغم من الأداء القوي في التقييمات الإدراكية والتقييمات التي تركز على المستخدم.
دراسة الاستئصال
تقيم دراسة الاستئصال مساهمة كل وحدة ضمن الإطار المقترح من خلال إزالة المكونات الفردية بشكل منهجي وتحليل تأثيرها على جودة التخطيط، ونمذجة الألوان، وأداء الكشف. يتم تقييم جودة التخطيط باستخدام AE وGA وROA وLCS؛ حيث يعكس AE الانحراف الموضعي لعناصر واجهة المستخدم، وتشير القيم الأعلى إلى ضعف البنية المكانية. ويقيم GA مدى فعالية تنظيم المكونات وفقاً لمبادئ غيشتالت (Gestalt). ويقيس ROA مدى الحفاظ على التدفق البصري المنطقي، بينما يحدد LCS الاتساق الهيكلي عبر الشاشات من حيث المحاذاة والتباعد وتنظيم التخطيط. كما يتم تقييم تدهور جودة الألوان باستخدام ΔE (فرق اللون الإدراكي)، وCHI، وCDS، والتي تقيم مجتمعة التوحيد الإدراكي، والتماسك الجمالي، وثراء لوحة الألوان. أما أداء الكشف فيتم تقييمه باستخدام mAP والدقة (precision) والاستدعاء (recall)، والتي تحدد كمياً تأثير استبدال وحدة Faster R-CNN بنموذج كشف أبسط. وتوفر هذه المقاييس مجتمعة تقييماً شاملاً لكيفية مساهمة كل وحدة في الأداء العام للنظام.
الجدول 7 يلخص مساهمة كل وحدة ويقارن الإطار المقترح مع مناهج توليد واجهات المستخدم الحالية. يحقق النموذج الكامل أفضل أداء عبر جميع مقاييس جودة التخطيط، ونمذجة الألوان، والكشف، مما يثبت أن التصميم المعرفي، ونمذجة الألوان الإدراكية، والفهم البصري العميق لها تأثير تآزري. وعندما تتم إزالة وحدة نمذجة الألوان، تزداد قيمة ΔE بشكل ملحوظ، بينما تنخفض قيم CHI و CDS بشكل كبير، مما يشير إلى فقدان التجانس الإدراكي والتناغم اللوني. وهذا يؤكد أهمية النمذجة القائمة على CAM02-UCS في الحفاظ على الجودة الجمالية والإدراكية. ويؤدي حذف وحدة التخطيط المعرفي إلى زيادة كبيرة في AE وانخفاض ملحوظ في GA و ROA، مما يثبت أن مبادئ التصميم المعرفي ضرورية لإنتاج تخطيطات متماسكة هيكلياً وسهلة القراءة. كما يؤدي إزالة وحدة اتساق الشاشات المتعددة إلى انخفاض في LCS، مما يؤكد دورها في الحفاظ على أنماط تخطيط متسقة عبر شاشات متعددة. وينتج عن استبدال كاشف Faster R-CNN بشبكة CNN أبسط انخفاض حاد في mAP والدقة والاستدعاء، مما يسلط الضوء على الأهمية البالغة للكشف القوي عن المكونات في مسار العمل الإجمالي. وبالمقارنة مع الطرق المرجعية، بما في ذلك pix2code و REDRAW و LDGM، يتفوق الإطار المقترح باستمرار على جميع المناهج من حيث دقة التخطيط، والتماسك البصري، وجودة الألوان الإدراكية.
| الطريقة / الوحدة | AE ↓ | GA ↑ | ROA ↑ | LCS ↑ | ΔE ↓ | CHI ↑ | CDS ↑ | mAP ↑ |
| إزالة وحدة اللون | 0.14 | 0.86 | 0.92 | 0.84 | 7.85 | 0.61 | 12.4 | 0.9 |
| إزالة وحدة التخطيط المعرفي | 0.18 | 0.72 | 0.73 | 0.69 | 4.21 | 0.79 | 17.9 | 0.89 |
| إزالة اتساق الشاشات المتعددة | 0.17 | 0.81 | 0.88 | 0.62 | 4.18 | 0.81 | 17.3 | 0.9 |
| استبدال Faster R-CNN بـ Simple CNN | 0.16 | 0.85 | 0.91 | 0.85 | 4.15 | 0.82 | 18.1 | 0.74 |
| Pix2Code | 0.25 | 0.61 | 0.65 | 0.51 | 10.2 | 0.48 | 9.6 | 0.65 |
| REDRAW | 0.21 | 0.66 | 0.72 | 0.56 | 8.7 | 0.52 | 11.4 | 0.72 |
| LDGM (Layout Diffusion) | 0.19 | 0.74 | 0.79 | 0.63 | 6.9 | 0.59 | 13.8 | 0.8 |
| النموذج الكامل المقترح | 0.12 | 0.89 | 0.94 | 0.87 | 4.12 | 0.83 | 18.7 | 0.91 |
الجدول 7: دراسة الاستئصال وتحليل الأداء المقارن للإطار المقترح والطرق المرجعية. يقيم الجدول تأثير المكونات الفردية من خلال مقارنة النموذج المقترح الكامل مع متغيرات تم فيها إزالة وحدات محددة (وحدة اللون، وحدة التخطيط المعرفي، اتساق الشاشات المتعددة، واستبدال Faster R-CNN بشبكة CNN بسيطة)، بالإضافة إلى الطرق المرجعية (pix2code و REDRAW و LDGM). يتم تقييم الأداء باستخدام خطأ المحاذاة (AE)، ودقة التجميع (GA)، ودقة ترتيب القراءة (ROA)، ودرجة اتساق التخطيط (LCS)، وفرق اللون الإدراكي (ΔE)، ومؤشر تناغم الألوان (CHI)، ودرجة تنوع الألوان (CDS)، ومتوسط الدقة المتوسطة (mAP). يشير الرمز (↑) إلى أن القيم الأعلى هي الأفضل، والرمز (↓) يشير إلى أن القيم الأدنى هي الأفضل.
توفّر البيانات:
تتوفر مجموعات البيانات المستخدمة في هذه الدراسة عبر الروابط التالية: مجموعة بيانات RICO: https://interactionmining.org/rico؛ ومجموعة بيانات ENRICO: https://github.com/luileito/enrico؛ ومجموعة بيانات Guo لألوان واجهة المستخدم (UI Color Dataset): https://github.com/guozhongke/UI-Color-Dataset.
الملف التكميلي 1. الصيغ الرياضية وتفاصيل التنفيذ الموسعة. يوفر هذا الملف الصيغ الرياضية التفصيلية وسير العمل الخوارزمي الذي يدعم إطار عمل النمذجة الأولية المؤتمتة لواجهة المستخدم المقترح. ويتضمن التدريب على اكتشاف المكونات، واستخراج أنماط التخطيط، ونمذجة التناغم اللوني، والهدف الموحد للنمذجة الأولية لواجهة المستخدم، وتفاصيل اكتشاف Faster R-CNN، وحسابات المسافة المكانية وتشابه المحاذاة، وبناء شجرة واجهة المستخدم المنطقية، ونمذجة الألوان الإدراكية القائمة على CAM02-UCS، وتحسين التصميم المعرفي، ونمذجة اتساق الشاشات المتعددة، والخوارزميات من S1 إلى S3.يرجى النقر هنا لتحميل هذا الملف.