مقالة منهجية

بروتوكول لتعلم سمات الصور بناءً على طوبولوجيا مكونات الملابس على مستوى الصورة لاسترجاع مراجع التصميم

1 مشاهدات

DOI:

10.3791/72103

سبتمبر 1, 2026

في هذه المقالة

ملخص

يعمل هذا البروتوكول على توليد تمثيلات للملابس تدرك الهيكل البنيوي من خلال دمج تحليل المكونات الدلالي، ونمذجة الطوبولوجيا، وترميز الميزات ثنائي المسار، والدمج الموجه بالبنية. وهو يُمكّن باحثي الرؤية الحاسوبية والملابس من إجراء استرجاع للملابس ومقارنتها بالمراجع التصميمية بناءً على تنظيم المكونات وتخطيط الصورة الظلية بدلاً من اللون أو الملمس.

الملخص

غالباً ما تركز طرق استرجاع صور الملابس على اللون والملمس، مما قد يؤدي إلى حدوث خلط بين الملابس التي تتشابه في المظهر ولكنها تختلف في توزيع مكوناتها. تقدم هذه الدراسة بروتوكولاً لتعلم الميزات المدركة للمكونات من أجل استرجاع صور الملابس ومقارنة مراجع التصميم. يقوم البروتوكول بتحليل المناطق الدلالية للملابس، وبناء رسم بياني لمكونات الملابس على مستوى الصورة، وتشفير المظهر وعلاقات المكونات بشكل متوازٍ، ثم دمج كلا التمثيلين باستخدام خسائر الاتساق الهيكلي، والعلاقة الهيكلية، والتمييز الهيكلي. تم توحيد صور DeepFashion2 لتصبح بمقاس 512 x 512 بكسل، وحُللت باستخدام HRNet-W48، وشُفرت باستخدام ResNet-50 والتلافيف الرسومية (graph convolution)، ثم قُيمت من خلال الاسترجاع الهيكلي والتجميع. حقق النموذج الكامل مؤشر اتساق هيكلي قدره 0.81، ومؤشر تمييز هيكلي قدره 0.71، ومعدل استدعاء Recall@5 بنسبة 89.2%، ومتوسط دقة متوسطة بنسبة 86.4%، ومعامل صورة ظلية قدره 0.74. يدعم هذا البروتوكول استرجاع هيكل الملابس، والمقارنة الهيكلية، وتحديد موقع الاختلافات عندما لا يمثل المظهر السطحي بناء الملابس بشكل موثوق.

المقدمة

مع استمرار دمج الرؤية الحاسوبية والذكاء الاصطناعي في صناعة الملابس، توسع تحليل صور الملابس تدريجياً من مهام التعرف الأساسية إلى التحليل الموجه نحو التصميم ودعم اتخاذ القرار1,2. وفي عملية تصميم الملابس، يعتمد التمييز بين مخططات التصميم على التكوين الهيكلي والعلاقات بين المكونات أكثر من اعتماده على الاختلافات البسيطة في المظهر، مما يجعل التعبير الهيكلي لميزات صور الملابس في المساعدة على التصميم عاملاً رئيسياً يؤثر على فعالية التحليل3,4. ومع ذلك، لا تزال معظم الطرق المرئية الحالية تعتمد على الملمس واللون والخطوط الخارجية العامة كميزات أساسية لها، مما يجعل من الصعب تحليل التسلسلات الهرمية للملابس واختلافات البناء بشكل منهجي أثناء عملية التصميم5,6. لذا، فإن تطوير طريقة لتعلم ميزات الصور المدركة للهيكل للمساعدة في تصميم الملابس يعد أمراً هاماً لتحسين موضوعية واتساق تحليل التصميم7. ويعد هذا البروتوكول مناسباً عندما تتشابه الملابس في الألوان أو الملامس أو الخطوط الخارجية العامة، ولكنها تختلف في تنظيم المكونات، أو أنماط الاتصال، أو التوزيع المكاني. وفي ظل هذه الظروف، تميل التمثيلات التي تركز على المظهر إلى وضع التصاميم المختلفة هيكلياً بالقرب من بعضها البعض في حيز الميزات، مما يضعف موثوقية الاسترجاع ومقارنة التصاميم. ويتناول هذا البروتوكول المهام التي تشكل فيها العلاقات بين مكونات الملابس الأساس الرئيسي للاسترجاع الهيكلي، وتقييم التصميم، وتحليل الاختلافات الموضعية.

من حيث مقياس البيانات، وتعقيد النماذج، وتنوع المهام، أحرزت الأبحاث الحالية حول التحليل والفهم التلقائي لصور الملابس تقدماً ملحوظاً8,9. ومع ذلك، في التطبيقات العملية، غالباً ما تدرج المعلومات الهيكلية للملابس بشكل ضمني في نتائج التقسيم أو الكشف، ولا يتم أخذها في الاعتبار في النمذجة الموحدة لمرحلة تعلم الميزات، مما يؤدي إلى غياب التمييز المستقر بين التصاميم الهيكلية المختلفة في فضاء الميزات10,11. كما أن العلاقات المكانية، والقيود الهرمية، والهياكل الطوبولوجية بين مكونات الملابس لا يتم ترميزها بشكل صريح، مما يجعل من الصعب على تمثيلات الميزات عكس الاختلافات الهيكلية على مستوى التصميم12,13. إن غياب النمذجة الهيكلية الصريحة يحد من دقة التحليل وموثوقية القرار لميزات صور الملابس في سيناريوهات المساعدة على التصميم، مما يشكل عائقاً رئيسياً أمام تطوير أنظمة تصميم ذكية ذات فهم دلالي أعمق14.

لدعم تعلم وتحليل سمات صور الملابس، استكشفت الدراسات ذات الصلة عدة توجهات تقنية15. حيث مكنت طرق التجزئة الدلالية وتحليل الملابس من التحديد الدقيق لمناطق ومكونات الملابس من خلال التعليق التوضيحي على مستوى البكسل، مما وفر أساساً لاستخراج المعلومات الهيكلية16,17. وقد دمجت طرق استرجاع الملابس القائمة على استعلام الصور بين الطوبولوجيا ودمج اللون والنسيج، ومحاذاة الانتباه العالمي والمحلي، وتحليل الملابس، والتمثيل متعدد المقاييس ومتعدد الحبيبات، والانتباه المتبقي مع اختيار السمات. وتعالج هذه الطرق البحث في الكتالوجات، والمطابقة بين المستهلك والمتجر، واسترجاع المنتجات عبر النطاقات، والبحث المرئي في التجارة الإلكترونية. وترتبط إعدادات تطبيقاتها ارتباطاً وثيقاً باسترجاع المراجع التصميمية لأن كل طريقة تقوم بتصنيف صور الملابس بناءً على استعلام مرئي، رغم أن تمثيلاتهم لا تحافظ على تجاور المكونات المحددة وعلاقات الترتيب الرأسي طوال عملية دمج السمات18,19,20. وفي الوقت ذات وذلك، قدمت الأبحاث المتعلقة بسيناريوهات التصميم والتوصية تدريجياً الدمج متعدد الوسائط، ونمذجة العلاقات، وتحليل الأسلوب، مما أدى إلى توسيع حدود تطبيق السمات المرئية للملابس21,22. وبالرغم من أن هذه الطرق قد أحرزت تقدماً في مهامها الخاصة، إلا أن سماتها الأساسية لا تزال تعتمد إلى حد كبير على أوصاف المظهر، ولم يتم نمذجة المعلومات الهيكلية بشكل موحد كقيد متأصل لتعلم السمات، مما يجعل من الصعب تلبية احتياجات المساعدة في تصميم الملابس فيما يتعلق بالمحاذاة الهيكلية والمقارنة الهيكلية23.

لمعالجة القصور في قدرة التمايز الهيكلي في المساعدة على تصميم الملابس، تقترح هذه الورقة طريقة لتعلم ميزات الصور تعتمد على إدراك هيكل الملابس. تدمج هذه الطريقة نتائج تحليل الملابس والمعلومات الهيكلية الأساسية في مرحلة إدخال صور الملابس، مع نمذجة مناطق مكونات الملابس، والعلاقات المكانية، والروابط الهرمية بشكل مشترك. حيث يعمل ترميز العلاقات الهيكلية ومحاذاة الميزات المرئية على دمج قيود الملابس صراحةً في عملية تعلم الميزات، مما ينتج تمثيلاً يحافظ على المظهر المرئي والاتساق الهيكلي معاً. وتحدد هذه الميزة الاختلافات الهيكلية للملابس ضمن مساحة موحدة، مما يوفر أساساً مستقراً لتحليل التشابه الهيكلي اللاحق، والتجميع الهيكلي، واتخاذ القرارات المساعدة في التصميم، وهو ما يؤدي بدوره إلى تخفيف مشكلة تداخل الميزات الناتجة عن غياب النمذجة الهيكلية في الطرق الحالية. وبخلاف استراتيجيات الاسترجاع المرئي العامة التي تعامل المعلومات الهيكلية كسمات مساعدة مرتبطة بشكل فضفاض، يقوم هذا الإطار ببناء آلية لتعديل الميزات تتمحور حول العلاقات الطوبولوجية. وتشجع هذه الآلية التمثيل المكتسب على اتباع تنظيم مناطق الملابس المرئية مع تقليل الاستجابات التي تهيمن عليها الأنسجة. تمثل كل عقدة في الرسم البياني منطقة دلالية على مستوى الصورة، وتصف كل علاقة في الرسم البياني المجاورة المرئية أو الموضع النسبي المعياري في مستوى الصورة. ويدعم التضمين الناتج مقارنة تخطيط المكونات وتنظيم الصورة الظلية عبر صور الملابس. ولا تعد هذه المناطق والعلاقات قطعاً لأنماط الخياطة، أو وصلات الغرز، أو معالم البناء، أو معاملات التدريج. وبالمقارنة مع طرق الاسترجاع الموجهة بالمظهر، يحافظ هذا البروتوكول على طوبولوجيا المكونات الصريحة طوال عملية تعلم الميزات بدلاً من معاملة المعلومات الهيكلية كـ نتيجة تحليل لاحقة. وبالمقارنة مع النهج التي تقدم الإشارات الهيكلية كمدخلات مساعدة فقط، فإن الترميز ثنائي المسار والدمج المتسق طوبولوجياً يحافظان على العلاقات الهندسية مع تقليل الاستجابات التي تهيمن عليها الأنسجة. ويدعم التمثيل الناتج استرجاع هيكل الملابس، والتجميع الهيكلي، وفحص المراجع التصميمية، وتحليل اختلافات التصميم الموضعية، مع توفير أدلة على مستوى المكونات تظل قابلة للتفسير ضمن عملية تصميم الملابس. تشمل الأبحاث ذات الصلة بهذا البروتوكول تعلم ميزات صور الملابس، ونمذجة هيكل الملابس، والتمثيل المدرك للهيكل، والتحليل المرئي للمساعدة في تصميم الملابس.

على مستوى تمثيل السمات، ركزت أبحاث صور الملابس لفترة طويلة على نمذجة المظهر، واستخراج السمات العميقة، والتمثيل متعدد المقاييس24,25. وقد استخدمت الأعمال المبكرة الشبكات العصبية الالتفافية لإجراء نمذجة شاملة (end-to-end) لصور الملابس لمهام التصنيف والاسترجاع ومطابقة التشابه26,27. ولاحقاً، تم إدخال دمج السمات متعدد المقاييس والتعلم عبر النطاقات للتخفيف من الاختلافات في صور الملابس تحت زوايا رؤية ووضعيات وظروف تصوير مختلفة28,29. وفي مهام الاسترجاع، استُخدمت آليات الانتباه واستراتيجيات ضغط السمات لتحسين القدرة التمييزية للسمات والكفاءة الحسابية30,31. وتحقق هذه الطرق تمييزاً موثوقاً للمظهر، إلا أن عمليات تعلم السمات فيها لا تزال تركز على المعلومات البصرية العامة وتفتقر إلى تمثيلات منهجية للهياكل الداخلية للملابس32. كما تدمج طرق استرجاع الأزياء المركبة صورة مرجعية مع تعليمات تعديل نصية، ولكن نمط الاستعلام فيها يختلف عن بروتوكول الاستعلام المعتمد على الصور فقط والمُدرس هنا. لذا، تمت مراجعتها كاتجاه استرجاع تجاري ذي صلة ولم تُدرج في المقارنة الكمية لأن إدخال نصوص إضافية من شأنه أن يمنع التقييم المنضبط للاستعلامات الصورية.

مع تحول تحليل صور الملابس من التمييز القائم على المظهر إلى الفهم البنيوي، ركزت الأبحاث بشكل متزايد على نمذجة مكونات الملابس، والعلاقات الهندسية، والروابط الطوبولوجية33. وقد حققت شبكات التجزئة الدلالية تحليلاً على مستوى مكونات الملابس من خلال إسقاط الميزات وآليات الانتباه المتعدد، مما وفر أساساً موثوقاً لاستخراج المعلومات البنيوية34,35. كما ساهمت طرق اكتشاف النقاط الرئيسية ونمذجة الطوبولوجيا البنيوية في توصيف العلاقة بين الخطوط الخارجية للملابس والهياكل المحلية، مما عزز قدرة النموذج على تمثيل السمات الهندسية للملابس36,37. وقد قدمت دراسات عدة هياكل بيانية وشبكات استدلال علاقاتي لنمذجة العلاقات بين مكونات الملابس، مما أدى إلى تحسين التعرف دقيق التفاصيل وأداء الاسترجاع عبر المجالات38,39. وقد أثبتت هذه الأعمال الدور الهام للمعلومات البنيوية في التحليل البصري، إلا أن البنية تُستخدم في الغالب كسمة مساعدة أو نتيجة وسيطة، ولم يتم بعد تطوير نظام لتعلم الميزات تكون القيود البنيوية في جوهره40.

في مجال المساعدة في تصميم الملابس، دعمت هذه التطورات توصيات التصميم، وتحليل النمط، وبناء الأنظمة التفاعلية، وتقييم التصميم الموجه نحو الهيكل41. وقد حققت الأبحاث في أنظمة التوصية مطابقة الملابس والتوصيات الشخصية من خلال دمج السمات البصرية مع تفضيلات المستخدم42. كما استكشفت الأعمال المتعلقة بالمساعدة في التصميم مسارات جديدة لدعم التصميم الذكي عبر الجمع بين النماذج التوليدية، ونمذجة النمط، وآليات التعاون بين الإنسان والحاسوب43. وقد أدت الأبحاث حول القياس الافتراضي، وقياس المقاسات، ونقل النمط إلى توسيع نطاق تطبيق التحليل البصري للملابس طوال عملية التصميم والإنتاج. وبالرغم من أن هذه الدراسات قد أغنت الأشكال التقنية للمساعدة في تصميم الملابس، إلا أن سماتها البصرية الأساسية لا تزال مدفوعة بشكل أساسي بالمظهر الخارجي، وتفتقر إلى تمثيل موحد لهيكل التصميم من أجل التحليل. وفي المقابل، تتعامل هذه الورقة مع هيكل الملابس كقيد أساسي في تمثيل السمات، وتقدم طريقة تمثيل بصري للتحليل الهيكلي في المساعدة في تصميم الملابس.

على الرغم من هذه التطورات، فإن الأساليب الحديثة في التصميم التوليدي غالباً ما تتعامل مع الظروف الهيكلية كصفوف توجيه مكاني فضفاضة ضمن عمليات الانتشار. وتمثل أطر تحليل الهياكل المعاصرة التضاريس كعلامات دلالية مساعدة، منفصلة عن مساحة التضمين المرئي الأساسية. ويغير الإطار المقترح هذه الآلية من خلال تحديد قيد تضاريسي قائم على المسبقات الرسومية يعمل بشكل صريح على تعديل تعلم الميزات المرئية على مستوى المكونات. ويشجع هدف الاتساق متعدد المستويات الملابس ذات التخطيطات المكونات المتشابهة على مستوى الصورة على البقاء متقاربة في مساحة الميزات، بينما يفصل بين الملابس ذات التنظيمات المختلفة للمناطق المرئية. ويقلل هذا الهدف من الاعتماد على الملمس في إعدادات الاسترجاع التي تم تقييمها، ولكنه لا يؤسس لثبات تجاه التغيرات في المادة أو الوضعية أو الخلفية. ينبغي اختيار هذا البروتوكول عندما تحتوي الصورة المدخلة على قطعة ملابس فردية مرئية بشكل كافٍ، وتحتفظ المكونات الدلالية بحدود يمكن تحديدها، ويتطلب الهدف التحليلي مقارنة هيكلية على مستوى المكونات بدلاً من التعرف العام على الفئة. هذا البروتوكول مخصص لباحثي الرؤية الحاسوبية، وباحثي تصميم الملابس، وفرق تطوير الملابس الرقمية المشاركة في التحليل المرئي الحساس للهيكل. وهو غير مخصص للمهام التي تركز حصرياً على التعرف على اللون أو المادة، أو للصور التي تكون فيها تضاريس الملابس محجوبة إلى حد كبير. يقدم البروتوكول التالي سير العمل بدءاً من إعداد مجموعة البيانات ورسم خرائط الاحتمالات الدلالية، وصولاً إلى بناء العلاقات الهندسية، وترميز الميزات ثنائي التدفق، والدمج الموجه هيكلياً، والتحسين القائم على الاتساق. يتلخص سير العمل الكامل في الشكل 1.

البروتوكول

تستخدم هذه الدراسة مجموعات بيانات لصور الملابس متاحة للعامة، ولا تقوم بتجنيد مشاركين بشريين، أو جمع معلومات تحديد الهوية الشخصية، أو إجراء تجارب على الحيوانات، أو استخدام مواد بيولوجية. وبناءً على ذلك، فإن الموافقة الأخلاقية المؤسسية والموافقة المستنيرة غير مطلبتين.

1. بيئة البرمجيات وتكوين المشروع

  1. ضع ملفات المشروع التي تم إصدارها في دليل يتوفر فيه مساحة تخزين كافية، وافتح نافذة Terminal في الدليل الرئيسي للمشروع.
  2. قم بتشغيل الأمر conda env create -f environment.yml لإنشاء البيئة البرمجية. ثم قم بتشغيل الأمر conda activate garment_structure لتنشيط البيئة.
  3. قم بتشغيل الأوامر python --version و conda --version و pip show numpy و pip show torch و pip show torchvision و nvidia-smi. واحفظ المخرجات الكاملة لهذه الأوامر في ملف software_versions.txt.
  4. استخدم نفس البيئة المسجلة لعمليات المعالجة المسبقة، والتدريب، والاستنتاج، وقياس الكفاءة، والتقييم. وسجل اسم ملف نقطة الفحص (checkpoint) لنموذج HRNet-W48 وقيمة SHA-256 الخاصة به، ومعرف أوزان ResNet-50 المدربة مسبقاً على ImageNet وقيمة SHA-256 الخاصة بها، ومصدر إصدار DeepFashion2، ومعرف مستودع الكود المصدري في نفس الملف.
  5. أنشئ الأدلة data_raw و data_processed و parser_outputs و structural_priors و feature_outputs و checkpoints و logs و evaluation_results تحت الدليل الرئيسي للمشروع.
  6. افتح الملف configs/protocol.yaml. وأدخل دليل DeepFashion2 في خانة dataset_root، ومسار نقطة فحص HRNet-W48 المدربة مسبقاً في خانة parser_checkpoint، ودليل مخرجات المشروع في خانة output_root.
  7. اضبط input_height على 512، و input_width على 512، و batch_size على 32، و structural_categories_per_batch على 8، و samples_per_category على 4، و random_seed على 42، و feature_dimension على 512، و structural_constraint_weight على 1.0، و structural_relationship_weight على 0.5، و structural_discrimination_weight على 1.0، و separation_threshold على 0.3.
  8. اضبط المُحسن (optimizer) على mini-batch stochastic gradient descent. واضبط initial_learning_rate على 0.0001، و momentum على 0.9، و weight_decay على 0.0005، و max_epochs على 120، و learning_rate_schedule على multi-step decay، و learning_rate_decay_factor على 0.1. وأدخل حقب الاضمحلال (decay epochs) التي تم التحقق منها والمستخدمة في الإعدادات الصادرة في خانة learning_rate_milestones.
  9. قم بتشغيل الأمر python tools/export_experiment_tables.py --config configs/protocol.yaml --output evaluation_results. وصَدِّر إعدادات النموذج الكاملة إلى ملف model_setting_statistics.csv. وتحقق من أن الملف المُصدَّر يسجل حجم الصورة المدخلة، وتنسيق الإدخال، وتكوين الدفعة (batch composition)، والمُحسن، ومعدل التعلم، وجدول معدل التعلم، وعدد الحقب (epochs)، واضمحلال الأوزان، والزخم (momentum)، واحتمالات التعزيز (augmentation probabilities)، وبُعد الميزات، وأوزان الخسارة الهيكلية، وعتبة الفصل، والبذور العشوائية، وقاعدة اختيار نقطة الفحص، وعدد التشغيلات المستقلة.
  10. المخرجات المتوقعة: التأكد من أن البيئة البرمجية تبدأ دون أخطاء في التبعيات، وأن ملف software_versions.txt يحتوي على سجل البيئة، وأن جميع أدلة المخرجات موجودة، وأن ملف configs/protocol.yaml يحتوي على مسارات مطلقة صحيحة وإعدادات عددية دقيقة.
    ملاحظة: استخدم نفس البيئة وملف الإعدادات أثناء معالجة البيانات، وتدريب النموذج، والاستنتاج، والتقييم. واحفظ نسخة من ملف configs/protocol.yaml مع كل نقطة فحص مدربة.
    ​استكشاف الأخطاء وإصلاحها: إذا توقف إنشاء البيئة بسبب عدم توفر حزمة ما، فقم بإزالة البيئة غير المكتملة، وتحقق من قنوات الحزم في environment.yml، ثم أعد إنشاء البيئة. إذا لم يبلغ الأمر nvidia-smi عن وجود وحدة معالجة رسوميات، فتوقف عن تدريب النموذج واستعد برنامج تشغيل الرسوميات وبيئة CUDA runtime. إذا ظهر خطأ في الدليل أثناء التنفيذ، فاستبدل المسارات النسبية بمسارات مطلقة وتحقق من صلاحية الكتابة في output_root.

2. قبول الصور المدخلة، وبناء مجموعة البيانات، والمعالجة المسبقة

  1. استخدم فقط الملفات ذات الامتدادات JPG أو JPEG أو PNG. استخدم صور RGB ذات 8 بت تحتوي على قطعة ملابس رئيسية واحدة.
  2. احتفظ بصور RGB ذات 8 بت بعرض وارتفاع لا يقل عن 512 بكسل وقطعة ملابس رئيسية واحدة يمكن تحديدها. ارفض الصورة عندما تشغل مقدمة قطعة الملابس أقل من 15% من مساحة الصورة الكاملة، أو عندما يتطابق أكثر من 5% من حدود قناع قطعة الملابس مع حدود الصورة، أو عندما تتجاوز منطقة قطعة الملابس الثانوية 10% من مساحة قطعة الملابس الرئيسية، أو عندما تتجاوز المنطقة المحجوبة المقدرة 20% من قناع قطعة الملابس الرئيسية، أو عندما يكون تباين استجابة Laplacian أقل من 100.
  3. سجل معرف الصورة، والقيمة المقاسة، وقاعدة الاستبعاد التي تم تفعيلها، ومسار التعليق التوضيحي في ملف excluded_samples.csv.
  4. طبق قواعد قبول المدخلات على صور DeepFashion2 المصدرية قبل التصنيف الهيكلي وتقسيم البيانات. سجل كل معرف صورة مقبول ومرفوض، وتقسيم مجموعة البيانات الأصلي، ومعرف التعليق التوضيحي لقطعة الملابس، ومعرف الزوج المصدر، ونسبة مساحة المقدمة، ونسبة تلامس الحدود، ونسبة الحجب، ودرجة التمويه، وحالة الاحتفاظ النهائية في ملف data_filtering_manifest.csv.
  5. قم بتشغيل python tools/prepare_data.py --config configs/protocol.yaml.
  6. اقرأ مربع الإحاطة لقطعة الملابس من التعليقات التوضيحية لمجموعة البيانات. قم بتوسيع مربع الإحاطة بنسبة 5% من عرضه وارتفاعه، دون تجاوز حدود الصورة.
  7. قم بقص منطقة قطعة الملابس، مع الحفاظ على نسبة العرض إلى الارتفاع الأصلية، وأضف حشوة صفرية لتشكيل صورة مربعة، وقم بتغيير حجم الصورة المحشوة إلى 512 x 512 بكسل.
  8. حول الصورة التي تم تغيير حجمها إلى تنسور RGB بقيم نقطة عائمة. اقسم قيمة كل بكسل على 255.
  9. قم بتطبيع القنوات الحمراء والخضراء والزرقاء بمتوسطات 0.485 و 0.456 و 0.406 وانحرافات معيارية تبلغ 0.229 و 0.224 و 0.225.
  10. طبق القلب الأفقي باحتمالية 0.5 والمحو العشوائي باحتمالية 0.2 على صور التدريب. طبق فقط القص الحتمي، والحشو، وتغيير الحجم، والتطبيع على صور التحقق والاختبار.
  11. قم بتشغيل python tools/assign_structural_levels.py --config configs/protocol.yaml بعد إنشاء خرائط المكونات ذات السبع قنوات ومصفوفات الحدود المشتركة والترتيب الرأسي. لكل صورة محتفظ بها، احسب عدد العقد النشطة، وعدد المكونات المتصلة، وعدد عقد التفرع، وعدد الدورات المستقلة، وأطول مسار ترتيب رأسي موجه. عرف عقدة التفرع بأنها عقدة نشطة متصلة بثلاث عقد نشطة أخرى على الأقل في رسم الحدود المشتركة البياني.
  12. خصص S1 عندما يكون الرسم البياني متصلاً، ولا يحتوي على دورة مستقلة، ولا يحتوي على عقدة تفرع، ويكون أطول مسار ترتيب رأسي فيه لا يتجاوز حافتين. خصص S2 عندما يكون الرسم البياني متصلاً، ولا يحتوي على دورة مستقلة، ويحتوي على عقدة تفرع واحدة بالضبط، ويكون أطول مسار ترتيب رأسي فيه لا يتجاوز حافتين. خصص S3 عندما يكون الرسم البياني متصلاً، ولا يحتوي على دورة مستقلة، ويحتوي على عقدتي تفرع على الأقل أو مسار ترتيب رأسي يتكون من ثلاث حافات على الأقل. خصص S4 عندما يكون الرسم البياني متصلاً، ويحتوي على دورة مستقلة واحدة بالضبط، ويكون مسار الترتيب الرأسي فيه لا يتجاوز حافتين. خصص S5 عندما يحتوي الرسم البياني على دورتين مستقلتين على الأقل أو يحتوي على دورة مستقلة واحدة مع مسار ترتيب رأسي يتكون من ثلاث حافات على الأقل.
  13. طبق القواعد بالترتيب S5، S4، S3، S2، و S1 واحفظ إحصائيات الرسم البياني المحسوبة، والمستوى المخصص، ومعرف القاعدة في ملف structural_level_manifest.csv.
  14. قم بتوليد تسميات S1-S5 الأولية تلقائياً من أقنعة المكونات ومصفوفات العلاقات المحفوظة. ميز العينة بأنها غامضة هيكلياً عندما يحتوي الرسم البياني لمكوناتها على أكثر من مكون متصل واحد، أو عندما يكون متوسط أقصى احتمال للمكون داخل مقدمة قطعة الملابس أقل من 0.60، أو عندما يشغل مكون نشط أقل من 1% من مقدمة قطعة الملابس، أو عندما يتغير المستوى الهيكلي المخصص لها بعد تغيير عرض تلامس الحدود من بكسل واحد إلى بكسلين.
  15. اعرض كل عينة غامضة على مؤلفين لإجراء فحص مستقل للصورة المصدر، وخريطة المكونات، ومصفوفة الحدود المشتركة، ومصفوفة الترتيب الرأسي، والرسم البياني الأولي. احتفظ بالتسمية عندما يتفق الفحصان. اعرض حالة عدم الاتفاق على مؤلف ثالث واستخدم قرار الأغلبية كتسمية نهائية. استبعد العينة عندما لا يتم استرداد علاقة مكونات مستقرة بعد المراجعة. سجل التسمية التلقائية، وتسميات المراجعة، وسبب عدم الاتفاق، والتسمية النهائية، وحالة الاستبعاد في ملف structural_label_audit.csv.
  16. احسب قيمة SHA-256 لكل ملف مصدري محتفظ به واحسب هاش إدراكي 64-بت من قص قطعة الملابس المطبّع. ضع الصور ذات قيم SHA-256 المتطابقة في نفس مجموعة التكرار المطابق تماماً. ضع الصور التي تملك هاشات إدراكية بمسافة هامينج لا تزيد عن أربعة في نفس مجموعة التكرار القريب بعد التحقق من أنها تنبع من نفس مثيل قطعة الملابس.
  17. ادمج جميع الصور التي تشترك في نفس معرف الزوج المصدري لـ DeepFashion2 أو هوية قطعة الملابس في مجموعة مصدرية واحدة. احفظ هاشات الملفات، والهاشات الإدراكية، والمعرفات المصدرية، ومعرفات مجموعة التكرار في ملف duplicate_group_manifest.csv.
  18. قم بإجراء تقسيم البيانات على مستوى المجموعة المصدرية بدلاً من مستوى الصورة الفردية. خصص كل مجموعة تكرار مطابق تماماً، ومجموعة تكرار قريب، ومجموعة هوية مصدرية بالكامل لمجموعة فرعية واحدة. تحقق من جميع الأزواج المتقاطعة بين المجموعات الفرعية بعد التقسيم واكتب كل تعارض هوية مكتشف، وتعارض هاش، وتعارض هاش إدراكي في ملف leakage_audit.csv. أعد بناء البيانات حتى لا يحتوي ملف leakage_audit.csv على أي سجلات متقاطعة بين المجموعات الفرعية غير محلولة.
  19. قم بتقسيم المجموعات المصدرية طبقاً لتسميات S1-S5 النهائية وخصص مجموعات كاملة لمجموعات التدريب والتحقق والاختبار وفقاً للتخصيص المعتمد الموضح في الجدول 1. أبلغ عن العدد الدقيق للصور وعدد المجموعات المصدرية لكل مستوى هيكلي ومجموعة فرعية.
  20. احسب النسب المئوية الفعلية للتدريب والتحقق والاختبار من المجموعة النهائية المحتفظ بها بدلاً من مجموعة البيانات غير المصفاة. لا تستخدم صور التحقق، أو صور الاختبار، أو الصور المستبعدة بسبب الغموض، أو الصور التي تنتمي إلى مجموعات التكرار الخاصة بها أثناء تعلم المعلمات، أو تحديد العتبة، أو ضبط قواعد المستوى الهيكلي، أو اختيار نقطة التحقق.
  21. احفظ الصور المعالجة في data_processed/images. احفظ ملفات train_manifest.csv و validation_manifest.csv و test_manifest.csv و pair_manifest.csv و structural_level_manifest.csv في data_processed/manifests.
  22. اقرأ التسميات الهيكلية النهائية، وحالة المراجعة، ومعرفات مجموعة التكرار، ومعرفات المجموعة المصدرية، وتسميات المجموعات الفرعية من البيانات المعالجة. احسب عدد العينات المقبولة تلقائياً، والعينات المراجعة يدوياً، واستبعادات الغموض، واستبعادات التكرار، والمجموعات المصدرية، وصور التدريب، وصور التحقق، وصور الاختبار من S1 إلى S5.
  23. احسب نسب المجموعات الفرعية المحققة، ومتوسط عدد العقد النشطة، ومتوسط عدد عقد التفرع، ومتوسط عدد الدورات المستقلة، ومتوسط عمق الترتيب الرأسي، ومتوسط عدد الحواف المحددة النوع. احفظ الإحصائيات الكاملة في evaluation_results/dataset_statistics.csv.
  24. المخرجات المتوقعة: تأكد من أن كل صورة مقبولة هي صورة RGB ذات 8 بت بحجم 512 x 512 بكسل ولديها سجل تصفية واحد، وتسمية مستوى هيكلي نهائية واحدة، ومعرف مجموعة مصدرية واحد، ومعرف مجموعة تكرار واحد، وتسمية مجموعة فرعية واحدة، ومسار تعليق توضيحي صالح واحد. تأكد من أن كل عينة غامضة لديها سجل مراجعة كامل. تأكد من عدم ظهور أي معرف مصدري، أو مجموعة تكرار مطابق تماماً، أو مجموعة تكرار قريب، أو هوية قطعة ملابس في أكثر من مجموعة فرعية واحدة. تأكد من أن أعداد الصور في train_manifest.csv و validation_manifest.csv و test_manifest.csv و dataset_statistics.csv متطابقة.
    ملاحظة: احتفظ بالصور الأصلية غير المعالجة في data_raw. لا تطبق زيادة البيانات العشوائية على صور التحقق أو الاختبار.
    ​استكشاف الأخطاء وإصلاحها: إذا أدى القص إلى إزالة ياقة أو كم أو حاشية أو ساق بنطال، فاستعد التعليقات التوضيحية الأصلية وقم بتوسيع هامش الحدود المحتفظ به. إذا ظهرت قطعة الملابس ممددة، فتحقق من وجود الحشو المربع قبل تغيير الحجم. إذا كانت الصورة المعالجة تحتوي على قناة واحدة أو أربع قنوات، فحول الملف المصدري إلى RGB بـ 8 بت وأعد تشغيل المعالجة المسبقة. إذا ظهرت معرفات مكررة عبر المجموعات الفرعية، فأعد بناء جميع بيانات المجموعات الفرعية قبل التدريب.

3. تحليل المكونات المرئية المقيدة بالمقدمة ورسم خرائط الاحتمالات

  1. قم بتشغيل python tools/parse_components.py --config configs/protocol.yaml.
  2. قم بتحميل نقطة تفتيش (checkpoint) التحليل الدلالي للملابس HRNet-W48 سابقة التدريب من parser_checkpoint. تحقق من أن نقطة التفتيش تُخرج فئات مكونات الملابس المحددة بواسطة تعيين توصيفات مجموعة البيانات. قم بتحويل شبكة التحليل الدلالي إلى وضع التقييم وعطل حساب التدرج (gradient calculation).
  3. اقرأ الصور المعالجة من train_manifest.csv وvalidation_manifest.csv وtest_manifest.csv بالتتابع.
  4. استخرج موتر استجابة دلالي (semantic response tensor) مكوناً من سبع قنوات من كل صورة إدخال، واضبط قيمة K لتكون سبعة طوال سير العمل. استخدم ترتيب الفئات الثابت: منطقة الحاشية العلوية (Upper Trim Region)، منطقة خط الرقبة (Neckline Region)، منطقة الصدر (Bodice Region)، منطقة الجزء السفلي الأيسر من الملابس (Left Lower-Garment Region)، منطقة الجزء السفلي الأيمن من الملابس (Right Lower-Garment Region)، منطقة الجزء السفلي الأوسط من الملابس (Middle Lower-Garment Region)، ومنطقة الحاشية السفلية (Hem Region). حافظ على هذا الترتيب في خرائط الاحتمالات، ومصفوفات المكونات، ومصفوفات الرسوم البيانية، ومصفوفات الميزات، والبيانات التعريفية (manifests)، وملفات التصور.
  5. طبق دالة softmax على طول بُعد القناة لتوليد خريطة احتمالات المكونات الدلالية P. تحقق من أن مجموع الاحتمالات عبر جميع قنوات K يساوي واحداً عند كل بكسل ضمن نطاق سماحية قدره 0.0001.
  6. قم بتحميل قناع المقدمة (foreground mask) للملابس من توصيفات مجموعة البيانات وقم بمحاذاته مع الصورة المعالجة بحجم 512 x 512. اضبط احتمالية كل مكون خارج مقدمة الملابس على صفر. أعد تطبيع احتمالات المكونات داخل قناع المقدمة على طول بُعد القناة.
  7. تحقق من أن كل منطقة مكون نشطة تظل داخل مقدمة الملابس. ارفض العينة التي تم تحليلها إذا امتدت منطقة مكون ملونة إلى الجدار المحيط، أو الأرضية، أو الستارة، أو أي منطقة خلفية أخرى. سجل معرف الصورة المرفوضة وخطأ التحليل في parsing_quality_log.csv.
  8. احسب نسبة تغطية المقدمة لكل مكون، وضع علامة على المكونات ذات المناطق المجزأة أو المناطق المعزولة غير المدعومة للفحص اليدوي.
  9. احفظ موتر الاستجابة الدلالي في parser_outputs/logits. احفظ خريطة الاحتمالات في parser_outputs/probability_maps. احفظ معاينة للمكونات مرمزة بالألوان في parser_outputs/previews.
  10. المخرجات المتوقعة: تأكد من أن كل صورة مقبولة تنتج خريطة احتمالات واحدة مقيدة بالمقدمة مكونة من سبع قنوات وبحجم مكاني 512 x 512 بكسل، وموتر استجابة دلالي واحد مكون من سبع قنوات، وصورة معاينة واحدة. تأكد من أن مؤشرات القنوات من واحد إلى سبعة تتبع ترتيب المكونات الثابت المحدد في الخطوة 3.4. تأكد من أن جميع مناطق المكونات الملونة تظل داخل مقدمة الملابس وأن بكسلات الخلفية لها احتمالية مكون صفرية. تأكد من أن معرف الملف يطابق الإدخال المقابل في البيان التعريفي المصدر.
    ملاحظة: احتفظ باحتمالات المكونات المستمرة داخل مقدمة الملابس أثناء النمذجة الهيكلية. تعامل مع المناطق الناتجة كمنطاق تحليل بصري. لا تفسر حدودها على أنها خطوط خياطة، أو خطوط قص، أو كنتور قطع النمط، أو بنسات (darts)، أو علامات تحديد (notches)، أو مراجع تدريج القياسات.
    ​استكشاف الأخطاء وإصلاحها: إذا أظهرت جميع القنوات احتمالات موحدة تقريباً، فتحقق من parser_checkpoint، وترتيب قنوات RGB، وتطبيع الصور. إذا ظل أحد المكونات غائباً عبر مجموعة فرعية كاملة، فقارن مؤشر التوصيف مع مؤشر قناة مخرجات المحلل. إذا امتدت ألوان المكونات إلى الخلفية، فتحقق من محاذاة قناع المقدمة، وإعدادات الاستيفاء (interpolation)، وإحداثيات التوصيف قبل بناء الرسم البياني. إذا امتدت منطقة بصرية عبر مناطق ملابس متعددة غير مرتبطة، فضع علامة على العينة كفشل في التحليل واستبعدها من توليد الأولويات الهيكلية. إذا كانت احتمالات القنوات لا تساوي واحداً، فطبق دالة softmax على طول بُعد القناة بدلاً من أي من البُعدين المكانيين. إذا كان هناك ملف مخرجات مفقود، فحدد موقع المعرف المعالج النهائي في سجل المحلل واستأنف التحليل من المعرف التالي.

4. نمذجة هندسة المكونات والعلاقات المكانية على مستوى الصورة

  1. قم بتحميل موتر الميزات المرئية الضحلة وخريطة الاحتمال P المقابلة لكل صورة.
  2. اضرب كل متجه ميزات مكاني في الاحتمال المخصص للمكون الدلالي المقابل.
  3. اجمع متجهات الميزات المرجحة عبر الأبعاد المكانية واقسم المجموع على الكتلة الاحتمالية الكلية للمكون.
  4. خصص متجهاً صفرياً ومؤشراً للعقدة غير النشطة لأي مكون ذو كتلة احتمالية صفرية.
  5. طبق تطبيع L2 على كل تضمين مكون نشط وقم بتكديس التضمينات وفقاً لترتيب المكونات الدلالية الثابت.
  6. احسب إحداثيات المركز الأفقية والرأسية لمستوى الصورة لكل مكون مرئي من توزيع الاحتمالات المقيد بالمقدمة. قم بتطبيع الإحداثيات بناءً على عرض الصورة وارتفاعها.
  7. احسب الانتشار الأفقي والرأسي لمستوى الصورة لكل مكون مرئي في نفس نظام الإحداثيات المطبق. استخدم هذه القيم فقط لوصف مدى المنطقة المرئية في الصورة المعالجة.
  8. أنشئ سبع عقد بيانية وفقاً لترتيب المكونات الثابت، واحتفظ بالمكونات غير النشطة كعقد صفرية. أنشئ مصفوفة حدود مشتركة بحجم 7 × 7 باستخدام تلامس الجيران الثمانية بين أقنعة مكونات المقدمة. أنشئ مصفوفة ترتيب رأسي بحجم 7 × 7 باستخدام العلاقات الثابتة من منطقة الحافة العلوية (Upper Trim Region) إلى منطقة خط الرقبة (Neckline Region)، ومن منطقة خط الرقبة إلى منطقة الصدر (Bodice Region)، ومن منطقة الصدر إلى كل منطقة من مناطق الملابس السفلية، ومن كل منطقة ملابس سفلية إلى منطقة الحاشية (Hem Region). خزن كل علاقة صالحة في كلا الاتجاهين.
  9. أضف حلقة ذاتية (self-loop) لكل عقدة نشطة قبل الالتفاف البياني (graph convolution)، وأبقِ العلاقات المتصلة بالعقد غير النشطة عند الصفر.
  10. احسب إزاحة المركز النسبية والتشتت المكاني النسبي بين كل زوج مرتب من المكونات الدلالية. قم بتكديس القيم الهندسية الزوجية لتكوين موتر العلاقات الهندسية.
  11. احسب الضرب النقطي بين كل زوج من تضمينات المكونات المطبعة. طبق دالة softmax على مستوى الصفوف لمصفوفة التشابه الناتجة واستخدم القيم كأوزان للعلاقات.
  12. اضرب موتر العلاقات الهندسية في أوزان العلاقات المقابلة وقم بتجميع العلاقات المرجحة لكل مكون.
  13. احفظ مصفوفة تضمين المكونات، ومصفوفة مركز المكونات، ومصفوفة التشتت المكاني، ومصفوفة الحدود المشتركة، ومصفوفة الترتيب الرأسي، ومصفوفة الحلقة الذاتية، ومصفوفة أوزان العلاقات، وقناع العقد غير النشطة، ورسم خرائط تسمية المكونات، وتمثيل الأولويات الهيكلية في structural_priors. احفظ كل مصفوفة بسبعة صفوف وسبعة أعمدة حيثما كان ذلك مناسباً. تظهر عملية الإنشاء الكاملة من خريطة المكونات المقيدة بالمقدمة إلى أولوية طوبولوجيا مكونات الملابس على مستوى الصورة في الشكل 2.
  14. أنشئ تراكب الرسم البياني للمكونات لكل عينة تصور من خريطة الاحتمالات المقيدة بالمقدمة، ومصفوفة مركز المكونات، ومصفوفة الجوار المحددة النوع، وقناع العقد غير النشطة، ورسم خرائط تسمية المكونات.
  15. ضع كل عقدة نشطة في مركز المكون المقابل. ارسم حوافاً صلبة للحدود المشتركة في المقدمة وحوافاً متقطعة لعلاقات الترتيب الرأسي المحددة مسبقاً.
  16. احفظ كل تراكب بياني في structural_priors/visualizations باستخدام معرف الصورة المصدر. سجل مسار الصورة المصدر، ومسار خريطة الاحتمالات، ومسار مركز المكونات، ومسار الجوار المحدد النوع، ومسار قناع العقد غير النشطة، ومعرف نقطة فحص التحليل الدلالي، ومسار تراكب الرسم البياني في component_graph_visualization_manifest.csv.
  17. المخرجات المتوقعة: تأكد من أن كل صورة تنتج مصفوفة تضمين مكونات بـ K من الصفوف، ومصفوفة جوار محددة النوع بـ K من الصفوف و K من الأعمدة، ومصفوفة أوزان علاقات بـ K من الصفوف و K من الأعمدة، وقناع عقد غير نشطة بـ K من القيم، وتمثيل واحد للأولويات الهيكلية على مستوى الصورة. تأكد من أن كل عينة تصور مختارة تنتج تراكب رسم بياني للمكونات تظل فيه العقد النشطة ضمن مناطق الملابس المقابلة.
    ملاحظة: حافظ على نفس ترتيب المكونات المرئية عبر جميع المصفوفات، والبيانات، والرسوم البيانية، وملفات الميزات، وتراكبات الرسوم البيانية. تعامل مع مراكز المكونات، وقيم الانتشار المكاني، وعلاقات الرسم البياني كواصفات لمنطقة الملابس في مستوى الصورة. لا تفسر الرسم البياني للمكونات كـ هيكل وضعية بشرية أو تشتق عقده من إحداثيات المفاصل التشريحية. لا تحول هذه الواصفات إلى أطوال درزات، أو أنصاف أقطار منحنيات، أو سعة بنسات، أو مواضع علامات، أو اتجاهات خطوط النسيج، أو زيادات التدرج، أو أبعاد قطع الباترون.
    ​استكشاف الأخطاء وإصلاحها: إذا كانت المصفوفة تحتوي على قيمة غير عددية، فافحص مقام الكتلة الاحتمالية وتطبيع الإحداثيات. إذا تركزت أوزان العلاقات على مكون واحد، فاطرح الحد الأقصى للصف من مصفوفة التشابه قبل تطبيق softmax. إذا اختلف عدد عقد الرسم البياني بين الصور، فتحقق من أن المكونات غير النشطة تظل موجودة كمتجهات صفرية بدلاً من إزالتها.

5. ترميز الميزات الواعي بالبنية ثنائي التدفق

  1. قم بتحميل أوزان ResNet-50 المدربة مسبقاً على ImageNet، ثم قم بإزالة طبقات التجميع والتصنيف النهائية.
  2. مرر كل صورة ملابس مُطبعة من خلال ResNet-50 واستخرج تينسور المظهر (appearance tensor) من مرحلة العمود الفقري (backbone stage) المحددة بواسطة appearance_stage في ملف configs/protocol.yaml. تحقق من اسم المرحلة، وعدد قنوات الإخراج، والأبعاد المكانية للإخراج الناتجة عن مرحلة العمود الفقري المختارة لصورة مدخلة بحجم 512 x 512 بكسل. استخدم المرحلة نفسها في كل من عمليات التدريب، والاستدلال، ودراسات الاستئصال (ablation)، وعمليات المقارنة.
  3. قم بتغيير حجم خريطة الاحتمالات الدلالية (semantic probability map) لتناسب الحجم المكاني لتينسور سمات المظهر من خلال الاستيفاء الخطي الثنائي (bilinear interpolation). اضرب تينسور سمات المظهر في كل خريطة احتمالات مكون مُعاد تحجيمها، ثم قم بتجميع الاستجابات المرجحة عبر الأبعاد المكانية.
  4. مرر كل تضمين مظهر للمكون (component appearance embedding) من خلال طبقة إعادة معايرة القنوات (channel-recalibration layer) المحددة في ملف configs/protocol.yaml. سجل نوع الطبقة، وبُعد الإدخال، وبُعد الإخراج، ونسبة الاختزال، ودالة التنشيط، وقاعدة مشاركة المعاملات. قم برص متجهات المكونات السبعة الناتجة وفق الترتيب الدلالي الثابت لتكوين مصفوفة سمات المظهر.
  5. مرر كل متجه علاقة هندسية من خلال طبقة الإسقاط الهيكلي (structural projection layer) واضبط بُعد الإخراج على 512. قم ببناء رسم المكونات البياني (component graph) باستخدام مصفوفة أوزان العلاقات وقناع العقد غير النشطة (inactive-node mask).
  6. طبق طبقتين من التلافيف الرسومية (graph convolutional layers) ببُعد إدخال 512 وبُعد إخراج 512. طبق تطبيع الدفعة (batch normalization) بعد كل طبقة تلافيف رسومية، ثم طبق دالة LeakyReLU. سجل قيمة الميل السالب المستخدمة في LeakyReLU. طبق قناع العقد غير النشطة بعد كل طبقة للحفاظ على سمات صفرية للمكونات غير النشطة.
  7. طبق المحاذاة الدلالية (semantic alignment) باستخدام تضمينات المكونات المُطبعة، وقم برص المتجهات الناتجة لتكوين مصفوفة السمات الهيكلية.
  8. المخرج المتوقع: تأكد من أن كل صورة تنتج مصفوفة سمات مظهر واحدة ومصفوفة سمات هيكلية واحدة. تأكد من أن كلتا المصفوفتين تحتويان على K من الصفوف و 512 من الأعمدة.
    ملاحظة: أبقِ المكونات غير النشطة كمتجهات صفرية وحافظ على ترتيب المكونات الذي تم تحديده أثناء بناء المسبق الهيكلي (structural-prior).
    استكشاف الأخطاء وإصلاحها: إذا كانت مصفوفتا السمات تحتويان على أعداد صفوف مختلفة، فافحص تعيين الفئات الدلالية والتعامل مع العقد غير النشطة. إذا أبلغ ضرب المصفوفات عن خطأ في الأبعاد، فتحقق من أن مخرج الإسقاط الهيكلي وأبعاد قنوات المظهر كلاهما 512. إذا ظلت السمات الهيكلية صفرية لجميع المكونات النشطة، فتحقق من إضافة حواف الرسم البياني وأوزان العلاقات إلى الدفعة الحالية.

6. دمج السمات الموجه بالبنية

  1. طبق تسلسل دمج الميزات الموجه بالبنية الموضح في الشكل 3. مرر مصفوفة الميزات البنيوية عبر طبقة وزن الدمج وطبق دالة التنشيط المحددة بواسطة fusion_activation في configs/protocol.yaml. سجل اسم التنشيط، وبُعد الإدخال، وبُعد الإخراج، وما إذا كانت المعلمات مشتركة عبر عقد المكونات السبع.
  2. تحقق من أن مصفوفة الوزن البنيوية الناتجة تحتوي على K من الصفوف و 512 من الأعمدة.
  3. اضرب مصفوفة ميزات المظهر في مصفوفة الوزن البنيوية عنصرًا بعنصر.
  4. قم بدمج مصفوفة المظهر المعدلة ومصفوفة الميزات البنيوية على طول بُعد القناة.
  5. قم بدمج متجه المظهر المعدل ذو الـ 512 بُعد والمتجه البنيوي ذو الـ 512 بُعد لكل مكون لتكوين متجه ذو 1024 بُعد. مرر المتجه المدمج عبر طبقة إسقاط الدمج وقلل بُعده من 1024 إلى 512.
  6. أضف مصفوفة الميزات البنيوية الأصلية إلى المصفوفة المسقطة من خلال اتصال متبقٍ (residual connection).
  7. كدس متجهات المكونات المدمجة بالترتيب الدلالي الثابت وطبق تسوية L2 على التمثيل المسطح المدرك للبنية.
  8. احفظ مصفوفة الوزن البنيوية، ومصفوفة المظهر المعدلة، ومصفوفة المكونات المدمجة، والتمثيل النهائي المدرك للبنية في feature_outputs.
  9. المخرجات المتوقعة: تأكد من أن كل صورة تنتج مصفوفة مكونات مدمجة واحدة تحتوي على K من الصفوف و 512 من الأعمدة، ومتجه ميزات واحد مدرك للبنية ومسوى مرتبط بمعرف الصورة المصدر.
    ملاحظة: احتفظ بمصفوفة الوزن البنيوية ومصفوفة المكونات المدمجة لتصور الاستجابة وتحليل الاختلاف المحلي.
    ​استكشاف الأخطاء وإصلاحها: إذا استمرت القيم المدمجة في النمو، فافحص مخرجات التنشيط وطبقة التسوية. إذا اقتربت جميع الأوزان البنيوية من القيمة نفسها، فتحقق من تباين الميزات البنيوية عبر الصور ومن وصول التدرجات إلى طبقة الدمج. إذا لم تتطابق ملفات الميزات ومعرفات الصور، فأعد بناء بيان المخرجات قبل التدريب أو تقييم الاسترجاع.

7. تدريب النموذج وتحسين الاتساق

  1. قم بتحميل قيم البذور العشوائية الخمس المسجلة في configs/seeds.yaml. لكل عملية تشغيل، حدد نفس البذرة العشوائية للغة Python وNumPy وعمليات PyTorch CPU وجميع أجهزة CUDA. قم بتفعيل الخوارزميات الحتمية (deterministic algorithms)، وتعطيل وضع cuDNN benchmark، وسجل قيم البذور الخمس الدقيقة في دليل التشغيل المقابل.
  2. قم بتحميل بيان التدريب المعالج (processed training manifest)، وبيان الأزواج (pair manifest)، وخرائط الاحتمالات، والأولويات الهيكلية (structural priors).
  3. قم بتكوين كل دفعة تدريب (training batch) بحيث تشتمل على ثماني فئات هيكلية وأربع عينات متغيرة المظهر من كل فئة.
  4. احسب فقدان الاتساق الهيكلي (structural consistency loss) من أزواج العينات الإيجابية التي تشترك في نفس الأولوية الهيكلية.
  5. احسب فقدان اتساق العلاقة الهيكلية (structural relationship consistency loss) من المسافات الزوجية بين سمات المكونات.
  6. احسب فقدان التمييز الهيكلي (structural discrimination loss) من أزواج العينات السلبية ذات الهياكل غير المتجانسة وقم بتطبيق عتبة الفصل البالغة 0.3.
  7. ادمج هدف المظهر، وهدف الاتساق الهيكلي، وهدف العلاقة الهيكلية، وهدف التمييز الهيكلي باستخدام الأوزان المخزنة في configs/protocol.yaml. تظهر عملية تحسين فضاء السمات التي تحكمها الأهداف الهيكلية الثلاثة في الشكل 4.
  8. قم بتشغيل python train.py --config configs/protocol.yaml. حدّث جميع المعلمات القابلة للتدريب باستخدام خوارزمية نزول التدرج العشوائي للدفعات الصغيرة (mini-batch stochastic gradient descent) باستخدام معدل التعلم الأولي، والزخم (momentum)، واضمحلال الوزن (weight decay)، وعدد العصور (epoch count)، وعامل الاضمحلال، وعصور الاضمحلال المحددة في الخطوة 1.8. سجل معدل التعلم بعد كل عصر في سجل التدريب.
  9. سجل إجمالي الفقدان، وفقدان المظهر، وفقدان الاتساق الهيكلي، وفقدان العلاقة الهيكلية، وفقدان التمييز الهيكلي، ومعدل التعلم، ومؤشر الاتساق الهيكلي (SCI)، ومؤشر التمييز الهيكلي (SDI)، وRecall@5 بعد كل عصر.
  10. قم بتقييم النموذج على validation_manifest.csv بعد كل عصر. احفظ نقطة التحقق (checkpoint) المرتبطة بأعلى SCI للتحقق في checkpoints/selected_model.pth.
  11. كرر التدريب خمس مرات باستخدام البذور العشوائية الخمس المسجلة. احفظ كل ملف تكوين، وسجل تدريب، ونقطة تحقق مختارة في دليل تشغيل منفصل.
  12. المخرجات المتوقعة: تأكد من أن كل عملية تشغيل تنتج سجل تدريب، وسجل تحقق، وملف مقاييس على مستوى العصر، ونقطة تحقق واحدة مختارة. تأكد من أن نقطة التحقق المختارة تستند إلى أداء التحقق بدلاً من أداء الاختبار.
    ملاحظة: استخدم نفس بيانات التدريب والتحقق والاختبار في كل مقارنة للنماذج وتجربة استئصال (ablation experiment).
    ​استكشاف الأخطاء وإصلاحها: إذا أصبح الفقدان غير عددي، أوقف التدريب، وافحص كتل الاحتمالات للمكونات، وقلل معدل التعلم بمعامل 10، وأعد التشغيل من أحدث نقطة تحقق صالحة. إذا ظل SCI للتحقق دون تغيير بينما ينخفض فقدان التدريب، تحقق من وصول التدرجات إلى معلمات انتشار الرسوم البيانية والدمج. إذا نفدت ذاكرة الرسوميات، قلل حجم الدفعة وحافظ على حجم دفعة فعال قدره 32 من خلال تراكم التدرج (gradient accumulation). إذا تغير أداء التحقق بشكل حاد بين عمليات التشغيل، تحقق من البذرة العشوائية المسجلة وترتيب بيان البيانات.

8. الاستدلال والاسترجاع والعنقودة والتحقق من المخرجات

  1. قم بتشغيل python infer.py --config configs/protocol.yaml --checkpoint checkpoints/selected_model.pth. قم بتوليد خرائط الاحتمالية، والمسبقات الهيكلية، ومصفوفات سمات المظهر، ومصفوفات السمات الهيكلية، ومصفوفات المكونات المدمجة، ومتجهات السمات النهائية لكل صورة اختبار.
  2. احفظ جميع مخرجات الاستدلال تحت feature_outputs/test وسجل مساراتها في test_feature_manifest.csv. احسب تشابه جيب التمام (cosine similarity) بين كل سمة استعلام وجميع سمات المعرض. رتب معرفات المعرض بترتيب تنازلي حسب التشابه. احفظ أعلى خمس نتائج ترتيباً لكل استعلام في evaluation_results/retrieval_results.csv.
  3. لكل عينة استرجاع مختارة للتصور المرئي، قم بتحميل مصفوفة التجاور المحددة النوع، ومصفوفة أوزان العلاقات، ومصفوفة مركز المكون، وقناع العقد غير النشطة، وتعيين تسميات المكونات، ومصفوفة المكونات المدمجة لصورة الاستعلام. قم بتحميل الملفات نفسها لأعلى نتيجة ترتيباً ولدها النموذج المدرك للهيكل.
  4. قم بتمثيل الرسم البياني لمكونات الاستعلام والرسم البياني لمكونات الصورة المسترجعة من مراكز المكونات المحفوظة ومصفوفات التجاور المحددة النوع. حافظ على الترتيب الثابت للمكونات وأنواع العلاقات المستخدمة أثناء استدلال النموذج.
  5. قم بتمثيل مصفوفة التجاور المحددة النوع للاستعلام كمصفوفة فئوية. استخدم قيم مصفوفة منفصلة لعلاقات العقد غير النشطة، والحدود المشتركة، والترتيب الرأسي. ضع تسميات للمحاور الأفقية والرأسية باستخدام معرفات المكونات المخزنة في تعيين تسميات المكونات.
  6. طبق معايرة L2 على مصفوفة المكونات المدمجة للاستعلام ومصفوفة المكونات المدمجة للصورة المسترجعة. احسب تشابه جيب التمام بين كل مكون استعلام وكل مكون في الصورة المسترجعة. احفظ مصفوفة مراسلة المكونات الناتجة ذات الأبعاد K × K في evaluation_results/structural_retrieval_evidence.
  7. لكل زوج مرجعي-مستهدف مختار لتحليل الاختلاف الموضعي، قم بتحميل مصفوفة التجاور المحددة النوع، ومصفوفة مركز المكون، ومصفوفة التشتت المكاني، ومصفوفة أوزان العلاقات، ومصفوفة المكونات المدمجة لكلتا الصورتين.
  8. احسب الفرق المطلق بين مصفوفاتي التجاور المحددتين النوع. احسب الفروق المطلقة في إزاحة مركز المكون، والتشتت المكاني، وأوزان العلاقات باستخدام الترتيب الثابت للمكونات. احفظ مصفوفة اختلاف الطوبولوجيا ومصفوفة اختلاف العلاقات الهندسية الناتجة في evaluation_results/structural_difference_evidence.
  9. احسب مسافة L2 بين الصفوف المتناظرة في مصفوفتي المكونات المدمجتين. قم بمعايرة المسافات على مستوى المكونات وتعيينها للعقد في الرسم البياني للمكونات المستهدفة. زد عرض الحافة وفقاً للفرق المعاير في وزن العلاقة. احفظ الرسم البياني الناتج لاختلاف المكونات بعد الدمج.
  10. سجل معرفات الصور، ومسارات المصفوفات، ومسارات الرسوم البيانية، وترتيب المكونات، ومعرف نقطة التحقق (checkpoint)، ومسارات مخرجات التصور المرئي في structural_visualization_manifest.csv. ولد جميع التصورات الهيكلية برمجياً من الملفات المسجلة؛ ولا تضف عقد الرسوم البيانية أو حوافها أو قيم المصفوفات يدوياً.
  11. طبق خوارزمية K-Means بخمس مجموعات على متجهات السمات النهائية واحفظ تعيينات المجموعات في evaluation_results/cluster_assignments.csv. قم بتشغيل python evaluate.py --config configs/protocol.yaml --feature_dir feature_outputs/test.
  12. احسب SCI وSDI وRecall@5 ومتوسط الدقة المتوسطة (mAP) ومعامل السيلويت (silhouette coefficient) لكل تشغيل. استخدم SCI لتقييم تكتل السمات المعايرة التي تشترك في نفس التسمية الهيكلية، واستخدم SDI لتقييم الفصل بين التسميات الهيكلية المختلفة. استخدم Recall@5 لتقييم ما إذا كان هناك تطابق هيكلي ذو صلة يظهر في قائمة الاسترجاع القصيرة، واستخدم mAP لتقييم جودة الترتيب عبر المعرض بأكمله. استخدم معامل السيلويت فقط لتحليل التجميع.
  13. احسب المتوسط الحسابي والانحراف المعياري للعينة عبر خمس عمليات تشغيل مستقلة. احتفظ بالقيم الخمس على مستوى التشغيل لكل طريقة ومقياس. لا تطبق معايرة الحد الأدنى والأقصى (min-max)، أو معايرة الرتبة، أو إعادة القياس بناءً على الطرق التي تتم مقارنتها. أجرِ اختبار t المقترن باستخدام النتائج التي تم الحصول عليها تحت نفس البذرة العشوائية وسجل إحصائية الاختبار وقيمة الدلالة الدقيقة ثنائية الطرف.
  14. قارن عدد معرفات الاختبار المعالجة، وملفات السمات، وسجلات الاسترجاع، وتعيينات المجموعات. قم بحل كل تعارض قبل الإبلاغ عن نتائج التقييم أو تفسيرها.
  15. المخرجات المتوقعة: تأكد من أن كل صورة اختبار لديها سجل استدلال كامل واحد، وقائمة استرجاع واحدة، وتعيين مجموعة واحدة، ومجموعة واحدة من مدخلات التقييم. تأكد من أن كل حالة استرجاع مختارة للتصور المرئي لها رسم بياني لمكونات الاستعلام، ورسم بياني لمكونات الصورة المسترجعة، ومصفوفة تجاور محددة النوع، ومصفوفة مراسلة المكونات المدمجة.
  16. تأكد من أن كل حالة اختلاف هيكلي لها مصفوفة اختلاف طوبولوجي، ومصفوفة اختلاف علاقات هندسية، ورسم بياني لاختلاف المكونات بعد الدمج، وخريطة حرارية للاختلاف المكاني، وتراكب استجابة. تأكد من أن جميع ملفات التصور المرئي مرتبطة بمصفوفاتها المصدر عبر structural_visualization_manifest.csv. احفظ الخريطة الحرارية النقية، وتراكب الصورة المستهدفة، وقناع المقدمة، وإحداثيات منطقة الاستجابة العليا لكل حالة مصورة.
  17. اقبل استجابة الفرق المحسوبة فقط عندما تتداخل منطقة الاستجابة العالية السائدة مع مقدمة الملابس وتظل مدعومة بتغيير مصفوفة التجاور المحددة النوع المقابلة، وتغيير العلاقة الهندسية، وأدلة مسافة المكونات بعد الدمج. إذا وقعت أقوى استجابة بشكل أساسي خارج مقدمة الملابس، فافحص مخرجات التحليل، والرسم البياني للمكونات، وسجل الدمج.
    ملاحظة: استخدم نقطة التحقق المختارة من مجموعة التحقق للاستدلال على مجموعة الاختبار. لا تختار أو تستبدل نقطة التحقق وفقاً لمقاييس مجموعة الاختبار. استخدم نفس ترتيب المكونات، وقاعدة العقد غير النشطة، وتشفير نوع العلاقة، وعملية المعايرة عند توليد الرسوم البيانية والمصفوفات أثناء الاستدلال والتصور المرئي.
    ​استكشاف الأخطاء وإصلاحها: إذا توقف الاستدلال قبل معالجة جميع صور الاختبار، حدد المعرف النهائي في سجل الاستدلال واستأنف من المعرف التالي. إذا كانت نتائج الاسترجاع تهيمن عليها 유사ية الألوان، فافحص مسبقات الهيكل ومخرجات الدمج، وتحقق من نجاح تحميل نقطة التحقق. إذا أبلغ التقييم عن معرفات مكررة، فأعد بناء test_feature_manifest.csv وأزل السجلات المكررة قبل إعادة الحساب. إذا أنتجت خوارزمية K-Means مجموعة فارغة، فتحقق من معايرة السمات وأعد تشغيل التجميع باستخدام البذرة العشوائية المسجلة.

9. التقييم المقارن للنماذج

  1. قم بتشغيل python compare_models.py --config configs/protocol.yaml.
  2. قم بتدريب وتقييم كل من ResNet-50، وPart-based Convolutional Baseline (PCB)، وGCN، وFashionGraph، وSwin Transformer، وCLIP، وTopology Feature Histogram with Color and Texture Fusion، وAttention-Guided Cascade Network، وMMFL-Net، وFARE-RNET، والطريقة المقترحة باستخدام نفس بيانات التدريب والتحقق والاختبار.
  3. استخدم نفس حجم الصورة، وعمليات المعالجة المسبقة، وعصور التدريب (epochs)، وحجم الدفعة الفعلي (batch size)، واستعلامات التقييم، وتنفيذ المقاييس لكل طريقة.
  4. احتفظ بالتجميع المتوسط العام (global average pooling) لنموذج ResNet-50. طبق محاذاة الشرائط الأفقية في PCB. طبق رسمًا بيانيًا ثابتًا للملابس على مستوى الصورة في GCN. طبق استدلال الرسم البياني الديناميكي الموجه بالسمات في FashionGraph. استخدم مشفرات الصور القياسية لـ Swin Transformer وCLIP. نفذ Topology Feature Histogram with Color and Texture Fusion باستخدام واصفات الطوبولوجيا واللون والملمس. نفذ Attention-Guided Cascade Network باستخدام فروع الميزات العالمية والمحلية مع تحليل الملابس. نفذ MMFL-Net باستخدام فروع ميزات متعددة المقاييس ومتعددة الحبيبات. نفذ FARE-RNET باستخدام الانتباه المتبقي، واختيار الميزات، والترميز السياقي المتوسع.
  5. استخدم فقط فرع استعلام الصور لكل طريقة من طرق المقارنة. أعد تدريب كل طريقة قابلة للتدريب على بيان التدريب المشترك واختر نقطة التحقق (checkpoint) الخاصة بها من بيان التحقق المشترك. أنشئ قائمة معرض مرتبة لكل استعلام اختبار.
  6. قم بإسقاط كل تضمين مُتعلم (learned embedding) إلى 512 بُعدًا من خلال طبقة خطية قابلة للتدريب ومسجلة عندما يختلف بُعدها الأصلي. طبق تسوية L2 قبل ترتيب تشابه جيب التمام (cosine-similarity). استخدم نفس تخصيص الاستعلام-المعرض وتنفيذ المقاييس لجميع الطرق.
  7. كرر كل طريقة مقارنة باستخدام نفس البذور العشوائية الخمسة. أبلغ عن المتوسط والانحراف المعياري للعينة لكل من SCI وSDI وRecall@5 وmAP ومعامل السيلويت (silhouette coefficient). لكل مقياس، أجْرِ اختبار t المزدوج ثنائي الجانب بين الطريقة المقترحة وكل طريقة مقارنة باستخدام النتائج التي تم الحصول عليها تحت نفس البذرة العشوائية. سجل القيم الخمس على مستوى التشغيل، وإحصائية الاختبار، ودرجات الحرية، وقيمة p الدقيقة في evaluation_results/comparison_metrics.csv.
  8. احسب SCI وSDI وRecall@5 وmAP ومعامل السيلويت لكل طريقة. احفظ جميع القيم على مستوى التشغيل والقيم المجمعة في evaluation_results/comparison_metrics.csv.
  9. المخرجات المتوقعة: تأكد من أن comparison_metrics.csv يحتوي على نفس حقول المقاييس ونفس عدد التشغيلات المستقلة لكل طريقة مقارنة.
    ملاحظة: لا تغير تقسيمات البيانات، أو كود المقاييس، أو تخصيص الاستعلام-المعرض بين طرق المقارنة.
    استكشاف الأخطاء وإصلاحها: إذا أنتج نموذج المقارنة بُعد ميزة غير 512، أضف طبقة إسقاط خطية مسجلة واحدة قبل حساب المقياس وقم بتدريب تلك الطبقة مع النموذج المقابل. إذا فشل النموذج في التقارب تحت معدل التعلم المشترك، استخدم معدل التعلم المحدد في تنفيذه المنشور واحتفظ بجميع الظروف التجريبية المتبقية. سجل كل إعداد خاص بالطريقة في سجل المقارنة.

النتائج

تم تنفيذ جميع التجارب المذكورة باستخدام بيئة الأجهزة والبرامج الموثقة في الجدول 2 وجدول المواد. وقد استُخدمت نفس إصدارات برنامج تشغيل الرسومات، وCUDA، وcuDNN، وPython، وNumPy، وPyTorch، وtorchvision طوال مراحل المعالجة المسبقة، والتدريب، والاستنتاج، والتقييم. وتلخص الجدول 2 وجدول المواد بيئة الأجهزة والبرامج الكاملة. كما يلخص الجدول 1 مجموعات بيانات التدريب والتحقق والاختبار التي تمت معالجتها، جنبًا إلى جنب مع إحصائيات الطوبولوجيا على مستوى الصور. ويلخص الجدول 2 التكوين العام المستخدم لجميع طرق المقارنة.

نتائج التقييم المقارن

اتبع التقييم المقارن تقسيمات البيانات الشائعة، وعمليات المعالجة المسبقة، وضوابط التدريب، وتعاريف المقاييس المحددة في أقسام البروتوكول 7-9. يقارن الجدول 3 بين المشفرات المرئية العامة، والنماذج المحاذية للأجزاء، وتمثيلات الملابس القائمة على الرسوم البيانية، وشبكات استرجاع الأزياء عبر النطاقات، وطرق دمج الطوبولوجيا والمظهر، وطرق الاسترجاع المرئي للتجارة الإلكترونية، حيث تم تقييم جميعها باستخدام بروتوكول استعلام الصور نفسه. وتشتمل الطرق الخاصة بالنطاق على مخطط ميزات الطوبولوجيا مع دمج اللون والملمس (TFH-CT)، والشبكة المتتالية الموجهة بالانتباه (AGC-Net)، وشبكة تعلم الميزات متعددة المقاييس وتعدد الحبيبات (MMFL-Net)، واسترجاع الأزياء باستخدام الشبكة المتبقية مع تحسين سرب بلقاط (FARE-RNET). تم تسجيل جميع مقاييس التقييم في الجدول 3 كمتوسط وانحراف معياري للعينة عبر خمس تشغيلات مستقلة باستخدام نفس البذور العشوائية، وبيان التدريب، وبيان التحقق، وبيان الاختبار، وتعيين الاستعلام-المعرض، وتنفيذ المقياس. تم حساب قيم p- المزدوجة بشكل منفصل لكل من SCI وSDI وRecall@5 وmAP ومعامل الصورة الظلية (silhouette coefficient) من خلال مقارنة كل طريقة بالطريقة المقترحة في ظل ظروف بذور عشوائية متطابقة. وتوفر هذه النتائج الأساس الكمي للتحليلات اللاحقة المتعلقة بالتصور الهيكلي، والاسترجاع، والتجميع، والتحليلات الموجهة للتصميم.

نتائج البروتوكول النموذجية وتفسيرها

يُستدل على التنفيذ الناجح للبروتوكول عندما يضع الرسم البياني للمكونات على مستوى الصورة، والمعاد بناؤه من ملفات التحليل والرسم البياني المحفوظة، كل عقدة نشطة داخل منطقة الملابس المقابلة لها، ويحافظ على أنواع العلاقات المسجلة في مصفوفة التجاور المحددة، كما هو موضح في الشكل 5C. كما يجب أن تظل الاستجابة المدركة للبنية مركزة على مقدمة الملابس، كما هو موضح في الشكل 5D. ويعرض الشكل 6E نتيجة استرجاع متوقعة، حيث تقلل الطريقة المقترحة من تأثير الخلفية الحمراء وتسترجع ملابس الجزء العلوي من الجسم بدلاً من الأشياء الحمراء غير ذات الصلة. كما يوضح الشكل 6B–G أن ترتيب الاسترجاع مدعوم بعلاقات المكونات على مستوى الصورة وتطابق المكونات بعد الدمج. وتعكس هذه النتيجة استعادة الفئة العامة للملابس، على الرغم من أن طول الأكمام والطوبولوجيا المحلية لا تزال متفاوتة بين العينات المسترجعة.

تشمل حالات الفشل الشائعة التنشيط الذي يهيمن عليه الملمس في الشكل 5B، والاسترجاع المدفوع بلون الخلفية في الصف العلوي من الشكل 6، والتنشيط المتبقي في الخلفية في الشكل 7. يجب تفسير الشكل 7 على أنه تحديد موقع جزئي لأن الاستجابة السائدة تتبع الصورة الظلية السفلى للجسم المتضخمة وحدود الملابس اليمنى، بينما يظل التنشيط المتبقي في مناطق الخلفية المجاورة. لا يُعتبر تحديد الموقع مدعومًا هيكليًا إلا عندما تحدد مصفوفة فرق الطوبولوجيا، ومصفوفة فرق العلاقة الهندسية، ورسم بياني لفرق المكونات بعد الدمج، والاستجابة المكانية مناطق ملابس متسقة. وتشير البؤرة المكانية الساخنة التي لا تصحبها تغييرات مقابلة في المصفوفة أو المكونات إلى وجود تداخل بصري بدلاً من دليل هيكلي.

تعتبر عملية تشغيل البروتوكول صالحة عندما تنتج كل صورة مقبولة خريطة احتمالية دلالية معيرة، ومصفوفة علاقات مكونة من K من الصفوف و K من الأعمدة، ومصفوفات ميزات المظهر والهيكل مكونة من K من الصفوف و 512 من الأعمدة، ومتجه ميزات مدمج محدود مرتبط بمعرف الصورة الصحيح. يجب أن يؤكد الفحص البصري أن الطوبولوجيا تتبع مكونات الملابس، وأن استجابة المقدمة تتجاوز استجابة الخلفية، وأن نتائج الاسترجاع يتم توجيهها بواسطة فئة الملابس وهيكلها بدلاً من لون الخلفية. تشير خرائط الاحتمالية المجزأة، أو عقد المكونات المفقودة، أو المصفوفات غير الرقمية، أو استجابات الخلفية المنتشرة، أو الاسترجاع الذي يهيمن عليه اللون إلى تنفيذ غير ناجح، مما يتطلب فحص عمليات التحليل، أو بناء المخطط، أو دمج الميزات، أو تحميل نقاط التحقق.

التحليل المرئي لاستجابات مكونات الملابس على مستوى الصورة

تقارن الشكل 5 بين النموذج المرجعي ResNet-50 والنموذج المدرك للمكونات باستخدام نفس صورة قطعة الملابس. يوضح الشكل 5B خريطة تنشيط الفئات للنموذج المرجعي الخاص بالمظهر. ويعرض الشكل 5C رسمًا بيانيًا لمكونات الملابس على مستوى الصورة تم إعادة بنائه من خريطة الاحتمالات المقيدة بالمقدمة، ومصفوفة مراكز المكونات، ومصفوفة التجاور المحددة النوع، وقناع العقد غير النشطة، وتعيين تسميات المكونات التي تم إنشاؤها في أقسام البروتوكول 3 و4. ويقدم الشكل 5D استجابة التنشيط للتمثيل المدمج. لم يتم استخدام أي مقدر لوضعية الجسم البشري أو تعليقات توضيحية لمفاصل الجسم البشري لإنشاء الشكل 5C.

تركزت الاستجابة الأساسية على مناطق الملمس المحلية في الجزء السفلي من الملابس ولم تتبع باستمرار الحدود الكاملة للملابس، كما هو موضح في الشكل 5B. في الشكل 5C، تتوافق كل عقدة مع مركز منطقة مكون نشطة من الملابس، بينما يمثل كل ضلع حدوداً مشتركة للمقدمة أو علاقة ترتيب عمودية محددة مسبقاً. ويعكس الرسم البياني تنظيم مناطق الملابس ولا يمثل المفاصل التشريحية البشرية. غطت الاستجابة المدركة للبنية المقدمة الرئيسية للملابس مع الحفاظ على تنشيط أقل في معظم مناطق الخلفية، كما هو موضح في الشكل 5D. وتشير هذه النتائج إلى أن الرسم البياني للمكونات ووحدة دمج الميزات قللا من التنشيط الذي يهيمن عليه الملمس في الصورة التي تم تقييمها.

تحليل التشابه الهيكلي للملابس ونتائج المرجع التصميمي

يعرض الشكل 6 ترتيب الاسترجاع إلى جانب الأدلة الهيكلية المستخدمة لتفسيره. يسجل رسم بياني لمكونات الاستعلام في الشكل 6B مناطق الملابس النشطة وعلاقاتها المحددة، بينما تكشف المصفوفة في الشكل 6C نمط العلاقات المقدم لعملية انتشار الرسم البياني. تظل نتائج الخط المرجعي في الشكل 6D خاضعة لسيطرة إشارات المظهر الحمراء. وتحافظ النتائج المدركة للهيكل في الشكل 6E على فئة ملابس الجزء العلوي من الجسم عبر مختلف الألوان والخلفيات. ويسمح الرسم البياني للمكونات الخاص بالنتيجة الأعلى ترتيباً في الشكل 6F بالمقارنة المباشرة مع الرسم البياني للاستعلام، كما تكشف مصفوفة التطابق في الشكل 6G ما إذا كانت المكونات التي تشترك في نفس المعرفات تظل متسقة بعد الدمج الموجه هيكلياً. ويجب تفسير التطابق القطري بالتزامن مع العقد المفقودة وعلاقات الرسم البياني المتغيرة؛ حيث إن التشابه القوي في المظهر دون توافق في الرسم البياني لا يشكل استرجاعاً هيكلياً ناجحاً.

تحتفظ الملابس المسترجعة بالفئة العامة، إلا أن الاختلافات في تكوين الأكمام وعلاقات المكونات المحلية تشير إلى عدم اكتمال التطابق دقيق التفاصيل. وقد حققت الطريقة المقترحة معدل استدعاء Recall@5 بنسبة 89.2% ومتوسط دقة عام mAP بنسبة 86.4%، كما ورد في الجدول 3تصف هذه القيم الكمية أداء التصنيف، بينما الشكل 6ب–G يوفر أدلة هيكلية متوسطة تدعم هذا التفسير. وبناءً عليه، يقتصر استنتاج الاسترجاع على تحسن المقاومة للتداخل الناتج عن لون الخلفية، وتنظيم أقوى للمكونات على مستوى الصورة في ظل الاستعلام المختبر.

الاستجابة للاختلاف الهيكلي ودعم تحليل التصميم

خريطة الحرارة لفرق الاستجابة الصافي في الشكل 7H يُظهر أن الاستجابة السائدة تتركز على الصورة الظلية المتضخمة للجزء السفلي من الجسم والحد الأيمن لملابس الصورة المستهدفة. والطبقة المتراكبة في الشكل 7I يُظهر أن أقوى استجابة تظل متوافقة مع مقدمة القطعة الملبسية الرئيسية، بينما تظل التنشيطات الأضعف في مناطق الستارة والجدار المجاورة كتدخل خلفي متبقٍ. ويجب تفسير الاستجابة المكانية جنباً إلى جنب مع الرسم البياني للمكونات وأدلة المصفوفة المعروضة في الأشكال 7 ج-زتُعتبر الاستجابة فرقاً هيكلياً صالحاً فقط عندما تتوافق منطقة الملابس ذات الاستجابة العالية مع التغير في التجاور، والتغير في العلاقة الهندسية، ونمط المسافة بين المكونات بعد الدمج.

يتم قبول الفرق الهيكلي فقط عندما يكون التغيير في التجاور المكتوب في الشكل 7E أو التغيير في العلاقة الهندسية في الشكل 7F مصحوباً بزيادة في مسافة المكون في الشكل 7G واستجابة مكانية محاذية للمقدمة في الشكل 7H،I. وتستوفي منطقة الجزء السفلي المتوسعة وحدود الملابس اليمنى هذا المعيار عبر المراحل. أما التنشيط فوق الستارة والجدار فلا يتوافق مع تغييرات في عقد المكونات، أو أنماط العلاقات، أو مسافات المكونات المدمجة، وبالتالي يتم رفضه باعتباره تداخلاً متبقياً غير هيكلي. وتدعم هذه النتيجة تحديد موقع الفرق على مستوى الصورة، ولكنها لا تثبت وجود تباين في أنماط الخياطة أو معايير الإنشاء.

تحليل التوزيع المكاني للميزات وتحليل التجمعات الهيكلية

يكشف تحليل توزيع فضاء الميزات الكامن عن قدرة النموذج على تمييز الدلالات الهيكلية للملابس. يبحث هذا التحليل فيما إذا كان المسبق الهيكلي ينظم الملابس ذات التكوينات الطوبولوجية المختلفة في منوعات ميزات متميزة. تم اختيار خمس فئات هيكلية ممثلة من مجموعة الاختبار، وهي: القمصان ذات الأكمام القصيرة، والسراويل، والتنانير، والمعاطف الطويلة، والفساتين. تم إسقاط متجهات الميزات عالية الأبعاد على مستوى ثنائي الأبعاد باستخدام تضمين الجوار العشوائي الموزع t (t-SNE). وتم تقييم تماسك العينات المتشابهة وانفصال العينات غير المتشابهة لتوصيف تنظيم الدلالات الهيكلية في فضاء الميزات. يظهر توزيع t-SNE لفضاء الميزات المدرك للهيكل في الشكل 8.

شكَّل إسقاط t-SNE خمس مناطق سمات رئيسية مع تداخل محدود بين الفئات المتجاورة، كما هو موضح في الشكل 8أتظهر عينات ممثلة تقابل مناطق الفئات الخمس في الشكل 8بيعكس مؤشر التماسك البنيوي (SCI) البالغ 0.81 مدى تماسك العينات التي تشترك في نفس التصنيف البنيوي، بينما يعكس مؤشر التمايز البنيوي (SDI) البالغ 0.71 مدى الفصل بين العينات ذات التصنيفات البنيوية المختلفة، وفقاً لما ورد في الجدول 3 وتم تصويرها في الشكل 8وينبغي تفسير هذه المؤشرات على أنها مقاييس لتوزيع فضاء الميزات، ولا تحدد بشكل مباشر معدل الإنذارات الكاذبة. وقد شغلت القمصان والتنانير ذات الأكمام القصيرة مناطق رئيسية مختلفة في فضاء الميزات المسقط، بينما ظلت مجموعة صغيرة من العينات بالقرب من الحدود الفاصلة بين الفئات المتجاورة، كما هو موضح في الشكل 8أكما أظهرت السراويل والفساتين انفصالاً واضحاً عن الفئات المجاورة. ويشير هذا التوزيع إلى أن المعلومات المسبقة للرسم البياني (graph prior) قد ساهمت في التنظيم الهيكلي على مستوى الفئة دون إحداث انفصال تام بين العناقيد. ويفصل التقييم هنا بين جودة التمثيل وفعالية الاسترجاع؛ حيث يقيس مؤشر SCI ما إذا كانت الملابس التي تشترك في ذات الملصق الهيكلي تظل متقاربة في فضاء الميزات المكتسب، بينما يقيس مؤشر SDI ما إذا كانت الملابس ذات الملصقات الهيكلية المختلفة تظل منفصلة. وتتوافق هذه المقاييس مع هدف التمثيل الهيكلي للبروتوكول. أما مقياس Recall@5 فيقيس ما إذا كانت قطعة الملابس ذات الصلة هيكلياً تظهر ضمن أول خمس نتائج مسترجعة، بينما يقيس متوسط الدقة المتوسطة (mAP) جودة التصنيف عبر جميع عينات المعرض ذات الصلة. وتتوافق هذه المقاييس مع هدف استرجاع المراجع التصميمية. وقد استُخدم معامل السلوويت (silhouette coefficient) فقط لتقييم أداء التجميع، نظراً لأن مؤشري SCI وSDI يصفان بالفعل تنظيم فضاء الميزات.

يوضح الشكل 9 نتائج خمس تشغيلات خام لأربع طرق تمثيلية دون إجراء تسوية بين الطرق. يعرض الشكل 9A مؤشري SCI وSDI بمقياسهما الأصلي، بينما يعرض الشكل 9B Recall@5 وmAP كنسب مئوية. وتُظهر علامات التشغيل الفردية وخطوط خطأ الانحراف المعياري التباين المرتبط بتدريب النموذج بدلاً من الاكتفاء بالتصنيف الإجمالي. حققت الطريقة المرجعية القائمة على المظهر قيمة SCI بلغت 0.62، بينما حققت الطريقة المقترحة قيمة SCI بلغت 0.81 وقيمة SDI بلغت 0.71 (الجدول 3 والشكل 9A). وتشير نتائج SCI وSDI إلى تماسك أقوى داخل التسمية الواحدة وفصل أكبر بين التسميات المختلفة في ظل ظروف التقييم المذكورة. كما حققت الطريقة المقترحة Recall@5 بنسبة 89.2% وmAP بنسبة 86.4% (الجدول 3 والشكل 9B). وتقيم مقاييس الاسترجاع هذه خصائص تصنيف مختلفة ويتم تفسيرها بشكل منفصل عن SCI وSDI. ويشير الترتيب المتسق للطرق عبر المقاييس الأربعة إلى وجود توافق بين جودة التمثيل وأداء الاسترجاع، ولكن هذا لا يعني أن التحسن النسبي متماثل عبر أبعاد التقييم الأربعة.

تجارب الاستئصال وتحليل فعالية الوحدات الهيكلية

تقارن تجربة الاستئصال النموذج الكامل ببدائل تم فيها إزالة المسبق الهيكلي أو وحدة الدمج. تستخدم جميع التكوينات الثلاثة نفس الصور المرجعية والمستهدفة، مما يتيح مقارنة مباشرة لاستجابة الخلفية وتركيز التحديد الموضعي. يقوم البديل الخالي من المسبق الهيكلي بإزالة الرسم البياني لمكونات الملابس على مستوى الصورة وقيود العلاقات الخاصة به، مع الاعتماد فقط على العمود الفقري التلافيفي لاستخراج ميزات المظهر؛ أما البديل غير المدمج فيحتفظ باستنتاج الرسم البياني ولكنه يزيل الهرم الميزاتي، مستخدمًا الميزات الدلالية رفيعة المستوى فقط. تكشف الخرائط الحرارية للفروق المرئية عن الأدوار المحددة لكل وحدة في كبح الضوضاء وتحديد الحدود؛ ويظهر مقارنة نوعية لاستجابات الفرق الهيكلي تحت تكوينات الوحدات المختلفة في الشكل 10.

تم عرض خرائط الاستجابة في الشكل 10C–E باستخدام مقياس استجابة مشترك وإعدادات تراكب متطابقة. أنتج المتغير الذي يفتقر إلى البنية المسبقة (structure prior) تنشيطاً قوياً في الخلفية اليسرى وحول المناطق البيئية غير ذات الصلة، كما هو موضح في الشكل 10C. أما المتغير الذي يفتقر إلى وحدة الدمج (fusion module)، فقد قلل جزءاً من تلك الاستجابة خارج الملابس، ولكنه ظل يحتفظ بانتشار أوسع فوق قطعة الملابس السفلية والمنطقة المحيطة بالجانب الأيمن، كما هو موضح في الشكل 10D. وعمل النموذج الكامل على تقليص الاستجابة السائدة بشكل أكبر نحو المقدمة الرئيسية للملابس، كما هو موضح في الشكل 10E. يوضح الشكل 10F بشكل مباشر الفرق في الاستجابات المقتصرة على المقدمة بين المتغير غير المدمج والنموذج الكامل، مما يظهر أن النموذج الكامل يثبط الانتشار الجانبي المتبقي مع الحفاظ على الاستجابة الرئيسية المتوافقة مع الملابس. تشير هذه النتائج إلى أن البنية المسبقة قللت بشكل أساسي من الضوضاء البيئية، وأن وحدة الدمج حسّنت بشكل أكبر من تركيز الاستجابة والتوافق الهيكلي. يمثل الشكل 10E تحسناً نسبياً وليس إزالة كاملة لتنشيط الخلفية.

يوضح الجدول 4 قيم SCI وSDI وRecall@5 للمتغيرات التي تفتقر إلى المسبق الهيكلي (structure prior)، والتي تفتقر إلى وحدة الدمج (fusion module)، ومع النموذج الكامل. وقد أدى إزالة المسبق الهيكلي إلى خفض قيمة SCI من 0.81 إلى 0.65 وخفض Recall@5 من 89.2% إلى 74.5%. كما أدت إزالة وحدة الدمج إلى خفض قيمة SDI من 0.71 إلى 0.64 وخفض Recall@5 من 89.2% إلى 85.1%، أي بنقص قدره 4.1 نقطة مئوية. وتشير هذه النتائج إلى أن المسبق الهيكلي كان له تأثير أكبر على الاتساق الهيكلي والاسترجاع، بينما أدى دمج الميزات إلى تحسين المواءمة بين معلومات المظهر والمعلومات الهيكلية.

يقارن تحليل الكفاءة التكلفة الحسابية للنموذج الكامل مع النموذج المرجعي ResNet-50. تطلب النموذج المرجعي ResNet-50 حوالي 25.6 مليون معلمة و 4.1 مليار عملية نقطة عائمة. بينما تطلب النموذج الكامل المدرك للبنية 29.3 مليون معلمة و 5.4 مليار عملية نقطة عائمة. وكان متوسط وقت الاستنتاج 15 مللي ثانية لكل صورة للنموذج المرجعي و 22 مللي ثانية لكل صورة للنموذج الكامل، أي بزيادة قدرها 7 مللي ثانية. وتشير هذه النتيجة إلى تكلفة حسابية ملموسة يجب أخذها في الاعتبار عند تطبيق البروتوكول في سير العمل الحساس للوقت (الجدول 5). وقد تم تحديد وزن القيد البنيوي من خلال مجموعة التحقق قبل تقييم الاختبار النهائي. حيث تم فحص استدعاء التحقق Recall@5 عند أوزان قيد بنيوي بلغت 0.1، 0.3، 0.5، 0.8، 1.0، 1.2، 1.5، و 2.0. وتم تثبيت وزن قدره 1.0 لكل عملية تدريب واختبار لاحقة. ويوثق الشكل 11 عملية اختيار وزن القيد البنيوي بقيمة 1.0 بناءً على التحقق.

figure-results-1
الشكل 1: سير العمل العام لبروتوكول تعلم ميزات صور الملابس المدركة للهيكل. يتم معالجة صورة الملابس المدخلة بواسطة فرع ميزات المظهر وفرع ميزات هيكلية يستخدم التحليل الدلالي ونمذجة الرسوم البيانية المكانية. وتتم معالجة هذين التمثيلين بواسطة وحدة الدمج الموجهة هيكلياً لتوليد الميزة النهائية المدركة للهيكل. وتعمل خسارة الاتساق الهيكلي، وخسارة التمييز الهيكلي، وخسارة العلاقة الهيكلية معاً على تقييد حيز الميزات. يوضح الشكل كيفية دمج مظهر الملابس وطوبولوجيا المكونات طوال عملية تعلم الميزات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-2
الشكل 2: بناء مسبق لطوبولوجيا مكونات الملابس على مستوى الصورة. (أ) صورة الملابس المدخلة I. (ب) خريطة المكونات المرئية المقيدة بالمقدمة P، حيث تشير سبعة ألوان إلى مناطق الملابس على مستوى الصورة. يتم استبعاد جميع بكسلات الخلفية من قنوات المكونات. (ج) مخطط علاقات المكونات على مستوى الصورة G. تمثل العقد مناطق الملابس المرئية، وتمثل الحواف المتصلة الحدود المشتركة في المقدمة، بينما تمثل العلاقات المتقطعة الترتيب الرأسي المحدد مسبقاً. تدعم الخريطة والمخطط استرجاع الصور ومقارنة الهياكل المرئية. وهي لا تمثل قطع أنماط الخياطة، أو هندسة الدرزات، أو هياكل البنسات، أو معاملات التدريج، أو تعليمات القص. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-3
الشكل 3وحدة دمج الميزات الموجهة بالبنية. يتم تحويل السمة البنيوية بواسطة التعيين الخطي ودالة التنشيط Ψ لتوليد وزن هيكلي. يقوم الوزن الهيكلي بتعديل سمة المظهر من خلال عملية ضرب عنصر بعنصر. ثم يتم دمج سمة المظهر المعدلة مع السمة الهيكلية وإسقاطهما بواسطة Wc، وبعد ذلك تُضاف السمة الهيكلية المتبقية لتوليد سمة المكون النهائية. يوضح الشكل أن المعلومات الهيكلية تنظم وزن سمة المظهر قبل عملية الدمج النهائية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-4
الشكل 4: تحسين فضاء الميزات تحت قيود الاتساق الهيكلي. (A) يتم تقريب العينات التي تنتمي إلى نفس الفئة الهيكلية من خلال فقدان الاتساق الهيكلي، بينما يتم الحفاظ على العلاقات بين مكوناتها الداخلية بواسطة فقدان العلاقة الهيكلية. (B) يتم دفع العينات من الفئات الهيكلية المختلفة بعيداً عن بعضها بواسطة فقدان التمييز الهيكلي. يوضح الشكل كيف تعمل الأهداف الهيكلية الثلاثة معاً على زيادة التراص داخل الفئة الواحدة والتباعد بين الفئات المختلفة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-5
الشكل 5: استجابات ميزات الملابس الممثلة وتصور الرسم البياني للمكونات. (A) صورة الملابس المدخلة. (B) استجابة تفعيل الفئة للنموذج المرجعي للمظهر ResNet-50. (C) تمت إعادة بناء الرسم البياني لمكونات الملابس على مستوى الصورة من خريطة المكونات المقتصرة على المقدمة، ومصفوفة مركز المكون، ومصفوفة الجوار المحددة النوع، وقناع العقد غير النشطة، وتعيين تسميات المكونات، والتي تم حفظها خلال أقسام البروتوكول 3 و 4. تشير العقد إلى مناطق الملابس النشطة، وتشير الحواف المتصلة إلى حدود المقدمة المشتركة، وتشير الحواف المتقطعة إلى علاقات الترتيب الرأسي المحددة مسبقاً. (D) استجابة التفعيل للتمثيل المدمج المدرك للمكونات. وتظهر المقارنة الفرق بين التفعيل الذي يهيمن عليه النسيج والتفعيل الموجه بمنطقة الملابس. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-6
الشكل 6: نتائج الاسترجاع والأدلة الهيكلية المتوسطة تحت تأثير تداخل الخلفية الحمراء. (A) صورة الاستعلام. (B) يتم إنشاء رسم بياني لمكونات الاستعلام من مراكز المكونات المحفوظة ومصفوفة المجاورة المحددة النوع. (C) مصفوفة المجاورة المحددة النوع للاستعلام، حيث تميز قيم المصفوفة بين العلاقات غير النشطة، وحدود المقدمة المشتركة، وعلاقات الترتيب الرأسي المحددة مسبقاً. (D) تم إنتاج أفضل ثلاث نتائج استرجاع بواسطة خط الأساس المعتمد على المظهر. (E) تم إنتاج أفضل ثلاث نتائج بواسطة التمثيل المدرك للهيكل. (F) الرسم البياني للمكونات لأعلى نتيجة مرتبة بناءً على الإدراك الهيكلي. (G) مصفوفة تطابق المكونات بعد الدمج بين الاستعلام والنتيجة الأعلى ترتيباً. يشير التطابق القطري العالي إلى الاتفاق بين المكونات ذات المعرفات المتطابقة، بينما تشير الاستجابات الضعيفة أو المزاحة إلى تنظيم مكونات مفقود أو غير متطابق. تحافظ نتائج الاسترجاع على الفئة العامة للجزء العلوي من الجسم ولكنها لا تحقق اتفاقاً كاملاً في تكوين الأكمام والطوبولوجيا المحلية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-7
الشكل 7: تتبع الاختلاف الهيكلي من توبولوجيا الملابس على مستوى الصورة إلى الاستجابة المكانية. (أ) الصورة المرجعية. (ب) الصورة المستهدفة. (ج) مخطط المكونات المرجعي. (د) مخطط المكونات المستهدف. تم إعادة بناء كلا المخططين من مراكز المكونات المحفوظة ومصفوفات التجاور النوعية. (هـ) مصفوفة اختلاف التجاور النوعي. (و) تم اشتقاق اختلاف العلاقة الهندسية من إزاحة مركز المكون، والتشتت المكاني، والتغيرات في وزن العلاقة. (ز) مخطط اختلاف المكونات بعد الدمج، حيث تمثل كثافة العقد المسافة المعيرة بين متجهات المكونات المدمجة المقابلة، ويمثل عرض الحافة التغير في وزن العلاقة. (ح) تم عرض الخريطة الحرارية لاستجابة الاختلاف المكاني الصرف باستخدام نفس مقياس الاستجابة الثابت المستخدم في التراكب. (ط) الاستجابة متراكبة على الصورة المستهدفة. يتم قبول الاختلاف الهيكلي فقط عندما يظل تغير التجاور، وتغير العلاقة الهندسية، وتغير مسافة المكونات، والاستجابة الحرارية المحاذية للمقدمة متسقة. يُعامل تنشيط الخلفية دون دليل مطابق على وجود مكونات أو علاقات على أنه تداخل متبقٍ وليس اختلافاً صحيحاً في هيكل الملابس. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-8
الشكل 8: تجميع فضاء السمات المدرك للبنية. (أ) إسقاط t-SNE للقمصان ذات الأكمام القصيرة، والسراويل، والتنانير، والمعاطف الطويلة، والفساتين. تشكل الفئات الخمس مناطق سمات رئيسية مع تداخل محدود بالقرب من الحدود الفاصلة بينها. (ب) صور اختبار ممثلة تم تعيينها للفئات الخمس من الملابس، حيث يتوافق لون الإطار مع لون الفئة في (أ). يوضح الشكل التنظيم البنيوي على مستوى الفئة مع الاحتفاظ بعدد قليل من العينات بالقرب من مناطق الفئات المتجاورة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-9
الشكل 9: مقارنة الأداء الخام عبر هيكل فضاء الميزات وأهداف ترتيب الاسترجاع. (أ) SCI و SDI للمعيار المرجعي المعتمد على المظهر، ونموذج الهيكل الضعيف، ونموذج الهيكل الصريح، والطريقة المقترحة. (ب) Recall@5 و mAP للطرق الأربع نفسها. تشير العلامات الكبيرة إلى المتوسط الحسابي عبر خمس عمليات تشغيل مستقلة، وتشير خطوط الخطأ إلى الانحراف المعياري للعينة، وتشير العلامات الصغيرة إلى نتائج مستوى التشغيل. يتم عرض SCI و SDI على مقياس ثابت من صفر إلى واحد، بينما يتم عرض Recall@5 و mAP على مقياس نسبة مئوية ثابت من صفر إلى مائة. لم يتم تطبيق أي تسوية (min-max normalization) أو إعادة تحجيم عبر الطرق. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-10
الشكل 10: استجابات الفرق الهيكلي تحت تكوينات نماذج مختلفة. (A) الصورة المرجعية. (B) الصورة المستهدفة. (C) استجابة المتغير الخالي من التوجيه الهيكلي المسبق. (D) استجابة المتغير الخالي من وحدة الدمج. (E) استجابة النموذج الكامل. تم عرض (C–E) باستخدام نفس مقياس الاستجابة المعياري، وخريطة الألوان، وإعدادات التراكب. (F) فرق الاستجابة المطلق المقيد بالمقدمة بين المتغير غير المدمج والنموذج الكامل. يحافظ النموذج الكامل على الاستجابة الأساسية المحاذية للملابس مع تقليل الانتشار المتبقي خارج المنطقة الهيكلية الرئيسية. وتظهر المقارنة أن التوجيه الهيكلي المسبق يقلل من التداخل خارج نطاق الملابس، وأن وحدة الدمج تزيد من حدة الاستجابة الهيكلية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-11
الشكل 11: اختيار وزن القيد الهيكلي بناءً على التحقق. يتم عرض استدعاء التحقق Recall@5 عند أوزان القيد الهيكلي 0.1 و0.3 و0.5 و0.8 و1.0 و1.2 و1.5 و2.0. تمثل كل نقطة المتوسط الحسابي عبر خمس عمليات تحقق، ويمثل كل خط خطأ الانحراف المعياري للعينة. تم تثبيت الوزن عند 1.0 قبل تقييم الاختبار النهائي. يوثق هذا الشكل إجراء اختيار المعلمات ولا يشكل مساهمة معمارية مستقلة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الجدول 1: تخصيص مجموعة البيانات وإحصائيات طبولوجيا مستوى الصورة عبر المجموعات الفرعية للملابس من S1 إلى S5. يوضح الجدول أعداد صور التدريب، والتحقق، والاختبار، والعدد الإجمالي للصور، بالإضافة إلى متوسط عدد المكونات الدلالية، وعدد العقد النشطة، وعدد الحواف المحددة النوع، وعدد معالم مستوى الصورة المحددة لكل مستوى هيكلي. تم استخراج جميع القيم من بيانات المظاهر المعالجة. تم الحصول على أعداد صور التدريب والتحقق والاختبار من مظاهر المجموعات الفرعية النهائية بعد المراجعة الهيكلية، والتحكم في مجموعات التكرار، وفحص التسريب، بينما حُسبت إحصائيات الطبولوجيا من سجلات الرسم البياني النهائية باستخدام نفس ترتيب المكونات وتعريفات العلاقات المطبقة أثناء تقييم النموذج. يرجى النقر هنا لتحميل هذا الملف.

الجدول 2: إعدادات البيئة الحسابية، وتكوين المدخلات، والتعزيز، والتمثيل، والتحسين، والخسارة، وقابلية التكرار المستخدمة في البروتوكول. يوضح الجدول الإصدارات الدقيقة لنظام التشغيل، والمعالج، والذاكرة المثبتة، ووحدة معالجة الرسومات، وذاكرة الرسومات، وبرنامج تشغيل الرسومات، وCUDA، وcuDNN، وPython، وNumPy، وPyTorch، وtorchvision، بالإضافة إلى حجم الصورة، وبناء الدفعة، والمحسن، وجدول معدل التعلم، وعدد الحقب، والبذور العشوائية، وأبعاد التمثيل، وأوزان الهدف الهيكلي. ترتبط كل قيمة بملف software_versions.txt، أو configs/protocol.yaml، أو سجل التدريب المقابل. يرجى النقر هنا لتنزيل هذا الملف.

الجدول 3: مقارنة كمية بين نماذج التمثيل البصري العامة، ونماذج الملابس القائمة على الرسوم البيانية، وطرق استرجاع الأزياء الخاصة بمجال محدد. يوضح الجدول تركيز الاسترجاع، ونمط الاستعلام، و SCI، و SDI، و Recall@5، و mAP، ومعامل الصورة الظلية لإحدى عشرة طريقة تحت نفس تقسيمات البيانات وبروتوكول التقييم. يتم تسجيل كل مقياس كمتوسط وانحراف معياري للعينة عبر خمس تشغيلات مستقلة. تم الحصول على قيم p المسجلة من اختبارات t المزدوجة ثنائية الجانب التي تقارن كل طريقة مقارنة بالطريقة المقترحة، باستخدام النتائج الناتجة تحت نفس البذور العشوائية الخمسة. تم التعامل مع الطريقة المقترحة كصف مرجعي. يرجى النقر هنا لتنزيل هذا الملف.

الجدول 4: نتائج الاستئصال لوحدة البنية المسبقة ودمج الميزات. يوضح الجدول مقاييس SCI وSDI وRecall@5 للمتغير الخالي من البنية المسبقة، والمتغير الخالي من وحدة الدمج، والنموذج الكامل. يؤدي إزالة البنية المسبقة إلى انخفاض أكبر في SCI وRecall@5، بينما تؤدي إزالة وحدة الدمج إلى تقليل SDI ومحاذاة الاستجابة. ويسجل النموذج الكامل أعلى قيمة لجميع المقاييس الثلاثة. يرجى النقر هنا لتحميل هذا الملف.

الجدول 5: الكفاءة الحسابية لنموذج ResNet-50 المرجعي والنموذج الكامل المدرك للبنية. يوضح الجدول المعاملات القابلة للتدريب، وعمليات الفاصلة العائمة لكل صورة، ومتوسط وقت الاستدلال لكل صورة في ظل نفس بيئة الأجهزة والبرامج الموثقة في الجدول 2 وجدول المواد. يستخدم كلا النموذجين نفس دقة الصورة، وإعدادات دفعة الاستدلال، وعمليات المعالجة المسبقة، وإجراء التوقيت. يضيف النموذج الكامل 3.7 مليون معامل، و1.3 مليار عملية فاصلة عائمة، و7 مللي ثانية من وقت الاستدلال لكل صورة مقارنة بالنموذج المرجعي. يرجى النقر هنا لتحميل هذا الملف.

المناقشة

تعد مراحل البروتوكول الأكثر أهمية هي المعالجة المسبقة للحفاظ على الملابس، وتحليل المكونات الدلالية المقيد بالمقدمة. ويتم اشتقاق مراكز المكونات، وقيم التشتت المكاني، وعلاقات الحدود المشتركة، وعلاقات الترتيب الرأسي، وأوزان العلاقات، والتمثيلات المدمجة، جميعها من مخرجات التحليل. أما تسرب الحدود، ومناطق المكونات المدمجة، ومناطق المكونات المفقودة، وتعيينات القنوات غير الصحيحة، فإنها تنتقل عبر بناء المخطط ودمج الميزات. وقد تؤدي هذه الأخطاء إلى إنتاج ملفات مخططات بأبعاد صحيحة، بينما تظل علاقات المكونات الممثلة غير متوافقة مع قطعة الملابس الأصلية. لذا، يجب التحقق من خريطة الاحتمالية، والتقييد بالمقدمة، ومعاينة المكونات، وسجل جودة التحليل قبل قبول المسبق الهيكلي.

يتطلب بناء الرسم البياني ودمج الميزات ترتيباً ثابتاً للمكونات الدلالية. ويُشتق الرسم البياني من مكونات الملابس في المقدمة وعلاقاتها على مستوى مستوي الصورة. وتعرض أشكال الاسترجاع وتحديد موقع الاختلاف مسار المعالجة الهيكلية بدلاً من عرض الصور المصنفة النهائية أو الخرائط الحرارية للاستجابة فقط. وتوثق مصفوفات الجوار المحددة علاقات المكونات المنفصلة، بينما توثق مصفوفات العلاقات الهندسية التنظيم المكاني الموحد، وتوثق مصفوفات المكونات ما بعد الدمج التمثيل المستخدم للاسترجاع وتحديد الموقع. ولا ينبغي قبول الاستنتاجات الهيكلية إلا عندما تتوافق هذه التمثيلات الوسيطة مع المخرج المرئي النهائي. لا يستخدم الرسم البياني للمكونات المعالم التشريحية، أو إحداثيات المفاصل البشرية، أو شبكة تقدير الوضعية. ولا ينبغي قبول تراكب الرسم البياني إلا عندما يتم إعادة إنتاج عقده وأنواع علاقاته من ملفات المكونات والجوار المحفوظة. ويجب أن تظل المكونات غير النشطة كمتجهات صفرية مع مؤشرات العقد غير النشطة، كما يجب أن تحتوي مصفوفات ميزات المظهر والميزات الهيكلية كل منها على K من الصفوف و 512 عموداً قبل عملية الدمج. وتمنع هذه التحققات تفسير عدم محاذاة العقد وأخطاء الأبعاد على أنها سلوك للنموذج.

يجب أن يبدأ استكشاف الأخطاء وإصلاحها عند أول مخرجات وسيطة غير صالحة. تشير خرائط الاحتمالية الموحدة إلى أخطاء في نقطة التحقق، أو التطبيع، أو فهرس الفئة؛ وتشير المصفوفات الهيكلية غير الرقمية إلى مقامات احتمالية غير صالحة أو قياسات إحداثيات خاطئة؛ كما تشير الاستجابات المنتشرة والاسترجاع الذي يهيمن عليه اللون إلى ضعف الأولويات الهيكلية، أو فشل الدمج، أو تحميل نقطة تحقق غير صحيحة. يجب أن تؤكد سجلات التدريب وجود التدرجات في الرسم البياني وطبقات الدمج، بالإضافة إلى اختيار نقطة التحقق بناءً على التحقق من الصحة. لا ينبغي استخدام استجابة الحرارة المرئية كاستنتاج هيكلي مستقل، بل يجب مراجعتها مقابل قناع المقدمة المحفوظ، وتغيير المجاورة المكتوب، ومصفوفة العلاقات الهندسية، ورسم بياني لفروق المكونات بعد الدمج. يشير التنشيط المتبقي خارج مقدمة الملابس إلى محدودية خصوصية الاستجابة بدلاً من وجود فرق هيكلي مثبت.

بالمقارنة مع الاسترجاع القائم على المظهر، يقدم هذا البروتوكول توبولوجيا المكونات قبل تعلم المقياس. وبالمقارنة مع القيود الهيكلية الضعيفة ونماذج الرسوم البيانية ذات التوبولوجيا الثابتة، تعمل أوزان العلاقات الدلالية على تكييف انتشار الرسم البياني مع قطعة الملابس الحالية. حقق النموذج الكامل معامل SCI قدره 0.81، ومعامل SDI قدره 0.71، وRecall@5 بنسبة 89.2%، وmAP بنسبة 86.4%، ومعامل silhouette قدره 0.74، كما هو موضح في الجدول 3. أدت الوحدات الهيكلية الإضافية إلى زيادة عدد المعلمات من 25.6 مليون إلى 29.3 مليون، وزيادة وقت الاستدلال من 15 إلى 22 ميلي ثانية لكل صورة، كما هو موضح في الجدول 4. وتكمن المساهمة التقنية لهذا البروتوكول في بناء رسم بياني لمكونات الملابس على مستوى الصورة، والترميز المتوازي للمظهر وعلاقات المكونات، وآلية دمج الميزات الموجهة هيكلياً، وأهداف الاتساق الهيكلي والعلاقة والتمييز. أما مسح التحقق المذكور في الشكل 11 فيهدف فقط إلى تحديد معامل تدريب ثابت، ولا يتم تقديمه كمساهمة في بنية الشبكة أو تصميم دالة الهدف.

يظل البروتوكول حساساً تجاه حالات الانسداد الشديد، والملابس المتداخلة، وصور المصدر الصغيرة، وتنوع الوضعيات، والخلفيات المعقدة، والملابس التي لا يتوافق تنظيمها المرئي مع مخطط المناطق السبع الثابت. قد تؤدي التصميمات غير المتماثلة، والطبقات القابلة للفصل، والثنيات الكثيفة، والملابس السفلية متعددة الطبقات، والمناطق الزخرفية المتداخلة إلى دمج عدة مناطق دلالية أو إدخال علاقات بين المكونات غير موجودة في تعريف الرسم البياني الحالي. قد يؤدي الانسداد إلى تثبيط مكون نشط، أو إزاحة مركز احتماليته، وإزالة علاقة حدود مشتركة صالحة. يوضح الشكل 6 استعادة فئة الجزء العلوي من الجسم بشكل تقريبي ولكن مع مطابقة غير كاملة لطوبولوجيا الأكمام، بينما تحتفظ الشكلان 7 و 10 باستجابات في مناطق الخلفية المجاورة. وتظهر هذه النتائج أن أبعاد الموتر الصالحة واتصال الرسم البياني لا يضمنان تفسيراً هيكلياً صحيحاً من الناحية الدلالية. وبناءً على ذلك، تدعم الدراسة الحالية الاسترجاع القائم على الصور، والتجميع، وتحديد مواقع الاختلاف، بدلاً من كفاءة سير عمل التصميم أو التقدير المباشر لمعايير النمط. أُجريت جميع التجارب الكمية في الدراسة الحالية على مجموعة DeepFashion2 التي تم الاحتفاظ بها وإعادة تسميتها هيكلياً. ولا تثبت النتائج الحالية المتانة عبر مجموعات بيانات مستقلة ذات تصنيفات ملابس مختلفة، أو معايير تعليق توضيحي، أو فئات ملابس ثقافية، أو مصادر صور، أو بيئات استحواذ مختلفة. قد يتطلب النقل إلى مجموعة بيانات أخرى إعادة تعيين القنوات السبع للمكونات وإعادة بناء مخطط العلاقات المحددة. لذا، فإن الاستنتاجات الواردة تقتصر على توزيع البيانات التي تم تقييمها وتعريف المكونات على مستوى الصورة.

في حدود هذه القيود، يوفر البروتوكول تسلسلاً قابلاً للتكرار من صور الملابس إلى تمثيلات مدركة للمكونات من خلال التحليل الدلالي، ونمذجة العلاقات الهندسية، والترميز ثنائي التدفق، والدمج الموجه بالبنية. ستستخدم عمليات التحقق المستقبلية مجموعات بيانات ملابس مستقلة ذات أنظمة تعليق توضيحي، وفئات ملابس، ووضعيات، وظروف خلفية مختلفة. كما ستدرس ما إذا كان تعيين المناطق السبع الحالي يتطلب توسيعاً ليشمل هياكل الملابس غير المتماثلة، والمتعددة الطبقات، والقابلة للفصل، والهياكل المرتبطة بثقافات محددة. وتظل مسودات التصميم المرسومة يدوياً، والاختلافات عبر الأقمشة، وتعديل الأنماط البارامترية اتجاهات تطبيقية منفصلة تتطلب بيانات وإجراءات تقييم خاصة بكل مهمة. كما تتطلب كفاءة الاستخدام المهني ومراجعة التصميم دراسة منفصلة وموثقة للمشاركين البشريين مع تحديد المشاركين، ومعايير التقييم، والإجراءات الإحصائية.

الإفصاحات

لا يوجد لدى المؤلفين أي تضارب في المصالح للإفصاح عنه.

شكر وتقدير

تم دعم هذا العمل من خلال الدفعة الثانية من مشاريع إصلاح التدريس الجامعي الرئيسية على مستوى المقاطعة خلال الخطة الخمسية الرابعة عشرة، وذلك بموجب المشروع المعنون "إصلاح واستكشاف تدريس «تصميم الملابس والأزياء» استناداً إلى نموذج البناء المشترك «تكامل ثلاثي، دمج ثلاثي»" (مشروع رقم JGZD2024096).

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
وحدة المعالجة المركزيةشركة إنتل (Intel Corporation)Intel Core i9-13900K، ٢٤ نواة، ٣٢ مسار معالجة، وبسرعة تصل إلى ٥.٨٠ جيجاهرتز
كوندا (Conda)Anaconda, Inc.، anaconda.comMiniconda3 23.11.0
مجموعة أدوات CUDAشركة NVIDIA، developer.nvidia.comCUDA 11.8
cuDNNشركة NVIDIA، developer.nvidia.comcuDNN 8.9.7
مجموعة بيانات DeepFashion2جامعة هونج كونج الصينية، github.com/switchablenorms/DeepFashion2الإصدار الرسمي لـ DeepFashion2، الإصدار 1.0
وحدة معالجة الرسومياتشركة NVIDIANVIDIA GeForce RTX 4090, 24 GB GDDR6X
نقطة تفتيش التحقق من التحليل الدلالي لشبكة HRNet-W48مشروع HRNet، github.com/HRNet/HRNet-Semantic-Segmentationhrnet_w48_garment_parser_7class.pth، نقطة فحص المشروع الإصدار 1.0
أوزان ResNet-50 مسبقة التدريب على ImageNetPyTorch Foundation, pytorch.orgResNet50_Weights.IMAGENET1K_V2
مكتبة Matplotlibفريق تطوير Matplotlib، matplotlib.orgالإصدار 3.8.2
NumPyمطورو NumPy، numpy.orgالإصدار 1.26.4
برنامج تشغيل رسومات NVIDIANVIDIA Corporationالإصدار 546.33
OpenCV-Pythonفريق OpenCV، opencv.orgالإصدار 4.8.1.78
نظام التشغيلشركة مايكروسوفت (Microsoft Corporation)Windows 11 Pro 23H2، 64-بت، إصدار نظام التشغيل 22631.3155
بانداز (Pandas)فريق تطوير Pandas، pandas.pydata.orgالإصدار 2.1.4
بايثونمؤسسة برمجيات بايثون (Python Software Foundation)، python.orgالإصدار 3.10.13
PyTorchPyTorch Foundation, pytorch.orgالإصدار 2.1.2 مع CUDA 11.8
PyYAMLمشروع PyYAML، pyyaml.orgالإصدار 6.0.1
scikit-learnمطورو scikit-learn، scikit-learn.orgالإصدار 1.3.2
SciPyمطورو SciPy، scipy.orgالإصدار 1.11.4
مستودع الكود المصدريأرشيف الكود المصدري التكميلي المُقدم مع المخطوطةبروتوكول طوبولوجيا الملابس، الإصدار 1.0
جهاز التخزينسامسونج للإلكترونياتSamsung 990 PRO NVMe SSD, 2 تيرابايت
ذاكرة النظامكينغستون تكنولوجي (Kingston Technology)Kingston FURY Beast DDR5, 64 جيجابايت، 2 × 32 جيجابايت، 5600 ميجاهرتز
torchvisionPyTorch Foundation, pytorch.orgالإصدار 0.16.2 مع CUDA 11.8
محطة عملمحطة عمل للتعلم العميق مصممة خصيصاًIntel Core i9-13900K، وNVIDIA GeForce RTX 4090، وذاكرة بسعة 64 جيجابايت، وقرص تخزين NVMe SSD بسعة 2 تيرابايت

المراجع

  1. Xiang Z, Zhu C, Qian M, Shen Y, Shao Y. FashionSegNet: a model for high-precision semantic segmentation of clothing images. Vis Comput. 2024;40:1711-1727. doi:10.1007/s00371-023-02881-3.
  2. Sun K, Zhang J, Zhang P, Yuan K, Li G. TsrNet: a two-stage unsupervised approach for clothing region-specific textures style transfer. J Vis Commun Image Represent. 2023;91:103778. doi:10.1016/j.jvcir.2023.103778.
  3. Yang N, Ma X. Enhanced composed fashion image retrieval with a multi-hop reasoning framework. Sci Rep. 2025;15:32217. doi:10.1038/s41598-025-17402-6.
  4. Karthika Priya D, Sathyabama B. FARE-RNET: fashion cloth retrieval via Egret Swarm Optimization-based Convolutional Attention Module integrated ResNet. Int J Comput Intell Syst. 2026;19:29. doi:10.1007/s44196-025-00979-1.
  5. Köktürk Güzel BE. Efficient image retrieval in fashion: leveraging clustering and principal component analysis for search space reduction. Erzincan Univ J Sci Technol. 2024;17:638-649. doi:10.18185/erzifbed.1500279.
  6. Zhang X, Sun H, Ma J. Research on clothing image retrieval combining topology features with color texture features. Mathematics. 2024;12:2363. doi:10.3390/math12152363.
  7. Abbas W, Zhang Z, Asim M, Chen J, Ahmad S. AI-driven precision clothing classification: revolutionizing online fashion retailing with hybrid two-objective learning. Information. 2024;15:196. doi:10.3390/info15040196.
  8. Shirkhani S, Mokayed H, Saini R, Hum YC. Study of AI-driven fashion recommender systems. SN Comput Sci. 2023;4:514. doi:10.1007/s42979-023-01932-9.
  9. Balloni E, Pietrini R, Frontoni E, Mancini A, Paolanti M. OutfitAI: shop the outfit with a deep learning-based intelligent expert system. Multimed Tools Appl. 2025;84:40195-40214. doi:10.1007/s11042-025-20753-x.
  10. Kachbal I, El Abdellaoui S. Computer vision for fashion: a systematic review of design generation, simulation, and personalized recommendations. Information. 2026;17:11. doi:10.3390/info17010011.
  11. Saranya MS, Geetha P. Cross-domain fashion cloth retrieval via novel attention-guided cascade neural network and clothing parsing. Comput Vis Image Underst. 2023;235:103777. doi:10.1016/j.cviu.2023.103777.
  12. Ning T, Gao Y, Han Y. Segmentation of ethnic clothing patterns with fusion of multiple attention mechanisms. Complex Intell Syst. 2024;10:5759-5770. doi:10.1007/s40747-024-01457-5.
  13. Jiang A, Liu L, Fu X, Liu L, Peng W. Clothing hierarchical feature representation and association learning for cross-modal fashion retrieval. J Comput Aided Des Comput Graph. 2025;37:654-667. doi:10.3724/SP.J.1089.2023-00263.
  14. An H, Lee KY, Choi Y, Park M. Conceptual framework of hybrid style in fashion image datasets for machine learning. Fash Text. 2023;10:18. doi:10.1186/s40691-023-00338-8.
  15. Adel M, Mohammed AM, Elsaid AH, Abdelatey A. Deep learning for new fashion product demand prediction: integrating visual similarity and demand correction in cold-start scenarios. Int J Data Sci Anal. 2026;22:9. doi:10.1007/s41060-025-00888-8.
  16. Tang Y, Ye D, Tao F, Du G. Enhanced group relation learning via aligned attention masking for fashion product captioning. J King Saud Univ Comput Inf Sci. 2025;37:170. doi:10.1007/s44443-025-00195-z.
  17. Lyu X, Li X, Zhang Y, Lu W. Two-stage method for clothing feature detection. Big Data Cogn Comput. 2024;8:35. doi:10.3390/bdcc8040035.
  18. Tang G, Yu F, Li H, Shi Y, Liu L, Peng T, et al. ClothSeg: semantic segmentation network with feature projection for clothing parsing. J Vis Commun Image Represent. 2023;97:103980. doi:10.1016/j.jvcir.2023.103980.
  19. Cao S, Chai W, Hao S, Zhang Y, Chen H, Wang G. DiffFashion: reference-based fashion design with structure-aware transfer by diffusion models. IEEE Trans Multimedia. 2024;26:3962-3975. doi:10.1109/TMM.2023.3318297.
  20. Hou J, Lu Y, Yang Y, Liu Z. PDN: a priori dictionary network for fashion parsing. Appl Sci. 2024;14:3509. doi:10.3390/app14083509.
  21. Moratelli N, Barraco M, Morelli D, Cornia M, Baraldi L, Cucchiara R. Fashion-oriented image captioning with external knowledge retrieval and fully attentive gates. Sensors. 2023;23:1286. doi:10.3390/s23031286.
  22. Islam T, Miron A, Liu X, Li Y. Deep learning in virtual try-on: a comprehensive survey. IEEE Access. 2024;12:29475-29502. doi:10.1109/ACCESS.2024.3368612.
  23. Yan H, Zhang H, Liu L, Zhou D, Xu X, Zhang Z, et al. Toward intelligent design: an AI-based fashion designer using generative adversarial networks aided by sketch and rendering generators. IEEE Trans Multimedia. 2023;25:2323-2338. doi:10.1109/TMM.2022.3146010.
  24. Xie Z, Zhou Z, Wang Z, Ding H, Ma L. Multi-scale spatial feature-guided cloth landmark estimation. J Comput Aided Des Comput Graph. 2022;34:1763-1771. doi:10.3724/SP.J.1089.2022.19189.
  25. Jiang J, Wu D, Deng H, Long Y, Tang W, Li X, et al. HAIGEN: towards human-AI collaboration for facilitating creativity and style generation in fashion design. Proc ACM Interact Mob Wearable Ubiquitous Technol. 2024;8:107. doi:10.1145/3678518.
  26. Danner M, Brake E, Kosel G, Kyosev Y, Rose K, Rätsch M, et al. AI-assisted pattern generator for garment design. Commun Dev Assem Text Prod. 2024;5:195-206. doi:10.25367/cdatp.2024.5.p195-206.
  27. Bao C, Zhang X, Chen J, Miao Y. MMFL-net: multi-scale and multi-granularity feature learning for cross-domain fashion retrieval. Multimed Tools Appl. 2023;82:37905-37937. doi:10.1007/s11042-022-13648-8.
  28. Yang G. Clothing design style recommendation using optimized semantic-preserved generative adversarial network. J Electr Syst. 2024;20 Suppl 3:2396-2409. doi:10.52783/jes.3064.
  29. Wang Z, Tao X, Zeng X, Xing Y, Xu Z, Bruniaux P. Design of customized garments towards sustainable fashion using 3D digital simulation and machine learning-supported human-product interactions. Int J Comput Intell Syst. 2023;16:16. doi:10.1007/s44196-023-00189-7.
  30. Wu J, Huang Y, Gao M, Gao Z, Zhao J, Zhang H, et al. A two-stream hybrid convolution-transformer network architecture for clothing-change person re-identification. IEEE Trans Multimedia. 2024;26:5326-5339. doi:10.1109/TMM.2023.3331569.
  31. Khalid M, Keming M, Hussain T. Design and implementation of clothing fashion style recommendation system using deep learning. Rom J Inf Technol Autom Control. 2021;31:123-136. doi:10.33436/v31i4y202110.
  32. Wang Y, Liu L, Fu X, Liu L. MCCP: multi-modal fashion compatibility and conditional preference model for personalized clothing recommendation. Multimed Tools Appl. 2024;83:9621-9645. doi:10.1007/s11042-023-15659-5.
  33. Ma J, Sun H, Yang D, Zhang H. Personalized fashion recommendations for diverse body shapes and local preferences with contrastive multimodal cross-attention network. ACM Trans Intell Syst Technol. 2024;15:82. doi:10.1145/3637217.
  34. Yu Z, Zhao Y, Hong B, Jin Z, Huang J, Cai D, et al. Apparel-invariant feature learning for person re-identification. IEEE Trans Multimedia. 2022;24:4482-4492. doi:10.1109/TMM.2021.3119133.
  35. Peng D, Liu R, Lu J, Zhang S. Unsupervised multi-modal modeling of fashion styles with visual attributes. Appl Soft Comput. 2022;115:108214. doi:10.1016/j.asoc.2021.108214.
  36. Mathews A, Sejal N, Venugopal KR. Analysis of content based image retrieval using deep feature extraction and similarity matching. Int J Adv Comput Sci Appl. 2022;13:646-655. doi:10.14569/IJACSA.2022.0131277.
  37. Zhang C, Ji X, Cai L. Clothing recommendation with multimodal feature fusion: price sensitivity and personalization optimization. Appl Sci. 2025;15:4591. doi:10.3390/app15084591.
  38. Zhao M, Gao S, Ma J, Zhang Z. Joint clothes image detection and search via anchor-free framework. Neural Netw. 2022;155:84-94. doi:10.1016/j.neunet.2022.08.011.
  39. Fontanini T, Ferrari C. Would your clothes look good on me? Towards transferring clothing styles with adaptive instance normalization. Sensors. 2022;22:5002. doi:10.3390/s22135002.
  40. Kim S, Moon H, Oh J, Lee Y, Kwon H, Kim S. Automatic measurements of garment sizes using computer vision deep learning models and point cloud data. Appl Sci. 2022;12:5286. doi:10.3390/app12105286.
  41. Chang YH, Zhang YY. Deep learning for clothing style recognition using YOLOv5. Micromachines. 2022;13:1678. doi:10.3390/mi13101678.
  42. de Medeiros Dantas IJ, Curth M, Freire AG. Exploring databases for training models in machine learning in the fashion industry. DAT J. 2024;9:157-174. doi:10.29147/datjournal.v9i2.877.
  43. Zhu S, Zou X, Qian J, Wong WK. Learning structured relation embeddings for fine-grained fashion attribute recognition. IEEE Trans Multimedia. 2024;26:1652-1664. doi:10.1109/TMM.2023.3284593.

إعادة الطباعة والأذونات

الوسوم

DeepFashion2 HRNet W48 ResNet 50