مقالة منهجية

بروتوكول لتعلم سمات الصور بناءً على طوبولوجيا مكونات الملابس على مستوى الصورة لاسترجاع مراجع التصميم

29 مشاهدة

⸱

DOI:

10.3791/72103

⸱

سبتمبر 1, 2026

في هذه المقالة

ملخص

يعمل هذا البروتوكول على توليد تمثيلات للملابس تدرك الهيكل البنيوي من خلال دمج تحليل المكونات الدلالي، ونمذجة الطوبولوجيا، وترميز الميزات ثنائي المسار، والدمج الموجه بالبنية. وهو يُمكّن باحثي الرؤية الحاسوبية والملابس من إجراء استرجاع للملابس ومقارنتها بالمراجع التصميمية بناءً على تنظيم المكونات وتخطيط الصورة الظلية بدلاً من اللون أو الملمس.

الملخص

غالباً ما تركز طرق استرجاع صور الملابس على اللون والملمس، مما قد يؤدي إلى حدوث خلط بين الملابس التي تتشابه في المظهر ولكنها تختلف في توزيع مكوناتها. تقدم هذه الدراسة بروتوكولاً لتعلم الميزات المدركة للمكونات من أجل استرجاع صور الملابس ومقارنة مراجع التصميم. يقوم البروتوكول بتحليل المناطق الدلالية للملابس، وبناء رسم بياني لمكونات الملابس على مستوى الصورة، وتشفير المظهر وعلاقات المكونات بشكل متوازٍ، ثم دمج كلا التمثيلين باستخدام خسائر الاتساق الهيكلي، والعلاقة الهيكلية، والتمييز الهيكلي. تم توحيد صور DeepFashion2 لتصبح بمقاس 512 x 512 بكسل، وحُللت باستخدام HRNet-W48، وشُفرت باستخدام ResNet-50 والتلافيف الرسومية (graph convolution)، ثم قُيمت من خلال الاسترجاع الهيكلي والتجميع. حقق النموذج الكامل مؤشر اتساق هيكلي قدره 0.81، ومؤشر تمييز هيكلي قدره 0.71، ومعدل استدعاء Recall@5 بنسبة 89.2%، ومتوسط دقة متوسطة بنسبة 86.4%، ومعامل صورة ظلية قدره 0.74. يدعم هذا البروتوكول استرجاع هيكل الملابس، والمقارنة الهيكلية، وتحديد موقع الاختلافات عندما لا يمثل المظهر السطحي بناء الملابس بشكل موثوق.

المقدمة

مع استمرار دمج الرؤية الحاسوبية والذكاء الاصطناعي في صناعة الملابس، توسع تحليل صور الملابس تدريجياً من مهام التعرف الأساسية إلى التحليل الموجه نحو التصميم ودعم اتخاذ القرار1,2. وفي عملية تصميم الملابس، يعتمد التمييز بين مخططات التصميم على التكوين الهيكلي والعلاقات بين المكونات أكثر من اعتماده على الاختلافات البسيطة في المظهر، مما يجعل التعبير الهيكلي لميزات صور الملابس في المساعدة على التصميم عاملاً رئيسياً يؤثر على فعالية التحليل3,4. ومع ذلك، لا تزال معظم الطرق المرئية الحالية تعتمد على الملمس واللون والخطوط الخارجية العامة كميزات أساسية لها، مما يجعل من الصعب تحليل التسلسلات الهرمية للملابس واختلافات البناء بشكل منهجي أثناء عملية التصميم5,6. لذا، فإن تطوير طريقة لتعلم ميزات الصور المدركة للهيكل للمساعدة في تصميم الملابس يعد أمراً هاماً لتحسين موضوعية واتساق تحليل التصميم7. ويعد هذا البروتوكول مناسباً عندما تتشابه الملابس في الألوان أو الملامس أو الخطوط الخارجية العامة، ولكنها تختلف في تنظيم المكونات، أو أنماط الاتصال، أو التوزيع المكاني. وفي ظل هذه الظروف، تميل التمثيلات التي تركز على المظهر إلى وضع التصاميم المختلفة هيكلياً بالقرب من بعضها البعض في حيز الميزات، مما يضعف موثوقية الاسترجاع ومقارنة التصاميم. ويتناول هذا البروتوكول المهام التي تشكل فيها العلاقات بين مكونات الملابس الأساس الرئيسي للاسترجاع الهيكلي، وتقييم التصميم، وتحليل الاختلافات الموضعية.

من حيث مقياس البيانات، وتعقيد النماذج، وتنوع المهام، أحرزت الأبحاث الحالية حول التحليل والفهم التلقائي لصور الملابس تقدماً ملحوظاً8,9. ومع ذلك، في التطبيقات العملية، غالباً ما تدرج المعلومات الهيكلية للملابس بشكل ضمني في نتائج التقسيم أو الكشف، ولا يتم أخذها في الاعتبار في النمذجة الموحدة لمرحلة تعلم الميزات، مما يؤدي إلى غياب التمييز المستقر بين التصاميم الهيكلية المختلفة في فضاء الميزات10,11. كما أن العلاقات المكانية، والقيود الهرمية، والهياكل الطوبولوجية بين مكونات الملابس لا يتم ترميزها بشكل صريح، مما يجعل من الصعب على تمثيلات الميزات عكس الاختلافات الهيكلية على مستوى التصميم12,13. إن غياب النمذجة الهيكلية الصريحة يحد من دقة التحليل وموثوقية القرار لميزات صور الملابس في سيناريوهات المساعدة على التصميم، مما يشكل عائقاً رئيسياً أمام تطوير أنظمة تصميم ذكية ذات فهم دلالي أعمق14.

لدعم تعلم وتحليل سمات صور الملابس، استكشفت الدراسات ذات الصلة عدة توجهات تقنية15. حيث مكنت طرق التجزئة الدلالية وتحليل الملابس من التحديد الدقيق لمناطق ومكونات الملابس من خلال التعليق التوضيحي على مستوى البكسل، مما وفر أساساً لاستخراج المعلومات الهيكلية16,17. وقد دمجت طرق استرجاع الملابس القائمة على استعلام الصور بين الطوبولوجيا ودمج اللون والنسيج، ومحاذاة الانتباه العالمي والمحلي، وتحليل الملابس، والتمثيل متعدد المقاييس ومتعدد الحبيبات، والانتباه المتبقي مع اختيار السمات. وتعالج هذه الطرق البحث في الكتالوجات، والمطابقة بين المستهلك والمتجر، واسترجاع المنتجات عبر النطاقات، والبحث المرئي في التجارة الإلكترونية. وترتبط إعدادات تطبيقاتها ارتباطاً وثيقاً باسترجاع المراجع التصميمية لأن كل طريقة تقوم بتصنيف صور الملابس بناءً على استعلام مرئي، رغم أن تمثيلاتهم لا تحافظ على تجاور المكونات المحددة وعلاقات الترتيب الرأسي طوال عملية دمج السمات18,19,20. وفي الوقت ذات وذلك، قدمت الأبحاث المتعلقة بسيناريوهات التصميم والتوصية تدريجياً الدمج متعدد الوسائط، ونمذجة العلاقات، وتحليل الأسلوب، مما أدى إلى توسيع حدود تطبيق السمات المرئية للملابس21,22. وبالرغم من أن هذه الطرق قد أحرزت تقدماً في مهامها الخاصة، إلا أن سماتها الأساسية لا تزال تعتمد إلى حد كبير على أوصاف المظهر، ولم يتم نمذجة المعلومات الهيكلية بشكل موحد كقيد متأصل لتعلم السمات، مما يجعل من الصعب تلبية احتياجات المساعدة في تصميم الملابس فيما يتعلق بالمحاذاة الهيكلية والمقارنة الهيكلية23.

لمعالجة القصور في قدرة التمايز الهيكلي في المساعدة على تصميم الملابس، تقترح هذه الورقة طريقة لتعلم ميزات الصور تعتمد على إدراك هيكل الملابس. تدمج هذه الطريقة نتائج تحليل الملابس والمعلومات الهيكلية الأساسية في مرحلة إدخال صور الملابس، مع نمذجة مناطق مكونات الملابس، والعلاقات المكانية، والروابط الهرمية بشكل مشترك. حيث يعمل ترميز العلاقات الهيكلية ومحاذاة الميزات المرئية على دمج قيود الملابس صراحةً في عملية تعلم الميزات، مما ينتج تمثيلاً يحافظ على المظهر المرئي والاتساق الهيكلي معاً. وتحدد هذه الميزة الاختلافات الهيكلية للملابس ضمن مساحة موحدة، مما يوفر أساساً مستقراً لتحليل التشابه الهيكلي اللاحق، والتجميع الهيكلي، واتخاذ القرارات المساعدة في التصميم، وهو ما يؤدي بدوره إلى تخفيف مشكلة تداخل الميزات الناتجة عن غياب النمذجة الهيكلية في الطرق الحالية. وبخلاف استراتيجيات الاسترجاع المرئي العامة التي تعامل المعلومات الهيكلية كسمات مساعدة مرتبطة بشكل فضفاض، يقوم هذا الإطار ببناء آلية لتعديل الميزات تتمحور حول العلاقات الطوبولوجية. وتشجع هذه الآلية التمثيل المكتسب على اتباع تنظيم مناطق الملابس المرئية مع تقليل الاستجابات التي تهيمن عليها الأنسجة. تمثل كل عقدة في الرسم البياني منطقة دلالية على مستوى الصورة، وتصف كل علاقة في الرسم البياني المجاورة المرئية أو الموضع النسبي المعياري في مستوى الصورة. ويدعم التضمين الناتج مقارنة تخطيط المكونات وتنظيم الصورة الظلية عبر صور الملابس. ولا تعد هذه المناطق والعلاقات قطعاً لأنماط الخياطة، أو وصلات الغرز، أو معالم البناء، أو معاملات التدريج. وبالمقارنة مع طرق الاسترجاع الموجهة بالمظهر، يحافظ هذا البروتوكول على طوبولوجيا المكونات الصريحة طوال عملية تعلم الميزات بدلاً من معاملة المعلومات الهيكلية كـ نتيجة تحليل لاحقة. وبالمقارنة مع النهج التي تقدم الإشارات الهيكلية كمدخلات مساعدة فقط، فإن الترميز ثنائي المسار والدمج المتسق طوبولوجياً يحافظان على العلاقات الهندسية مع تقليل الاستجابات التي تهيمن عليها الأنسجة. ويدعم التمثيل الناتج استرجاع هيكل الملابس، والتجميع الهيكلي، وفحص المراجع التصميمية، وتحليل اختلافات التصميم الموضعية، مع توفير أدلة على مستوى المكونات تظل قابلة للتفسير ضمن عملية تصميم الملابس. تشمل الأبحاث ذات الصلة بهذا البروتوكول تعلم ميزات صور الملابس، ونمذجة هيكل الملابس، والتمثيل المدرك للهيكل، والتحليل المرئي للمساعدة في تصميم الملابس.

على مستوى تمثيل السمات، ركزت أبحاث صور الملابس لفترة طويلة على نمذجة المظهر، واستخراج السمات العميقة، والتمثيل متعدد المقاييس24,25. وقد استخدمت الأعمال المبكرة الشبكات العصبية الالتفافية لإجراء نمذجة شاملة (end-to-end) لصور الملابس لمهام التصنيف والاسترجاع ومطابقة التشابه26,27. ولاحقاً، تم إدخال دمج السمات متعدد المقاييس والتعلم عبر النطاقات للتخفيف من الاختلافات في صور الملابس تحت زوايا رؤية ووضعيات وظروف تصوير مختلفة28,29. وفي مهام الاسترجاع، استُخدمت آليات الانتباه واستراتيجيات ضغط السمات لتحسين القدرة التمييزية للسمات والكفاءة الحسابية30,31. وتحقق هذه الطرق تمييزاً موثوقاً للمظهر، إلا أن عمليات تعلم السمات فيها لا تزال تركز على المعلومات البصرية العامة وتفتقر إلى تمثيلات منهجية للهياكل الداخلية للملابس32. كما تدمج طرق استرجاع الأزياء المركبة صورة مرجعية مع تعليمات تعديل نصية، ولكن نمط الاستعلام فيها يختلف عن بروتوكول الاستعلام المعتمد على الصور فقط والمُدرس هنا. لذا، تمت مراجعتها كاتجاه استرجاع تجاري ذي صلة ولم تُدرج في المقارنة الكمية لأن إدخال نصوص إضافية من شأنه أن يمنع التقييم المنضبط للاستعلامات الصورية.

مع تحول تحليل صور الملابس من التمييز القائم على المظهر إلى الفهم البنيوي، ركزت الأبحاث بشكل متزايد على نمذجة مكونات الملابس، والعلاقات الهندسية، والروابط الطوبولوجية33. وقد حققت شبكات التجزئة الدلالية تحليلاً على مستوى مكونات الملابس من خلال إسقاط الميزات وآليات الانتباه المتعدد، مما وفر أساساً موثوقاً لاستخراج المعلومات البنيوية34,35. كما ساهمت طرق اكتشاف النقاط الرئيسية ونمذجة الطوبولوجيا البنيوية في توصيف العلاقة بين الخطوط الخارجية للملابس والهياكل المحلية، مما عزز قدرة النموذج على تمثيل السمات الهندسية للملابس36,37. وقد قدمت دراسات عدة هياكل بيانية وشبكات استدلال علاقاتي لنمذجة العلاقات بين مكونات الملابس، مما أدى إلى تحسين التعرف دقيق التفاصيل وأداء الاسترجاع عبر المجالات38,39. وقد أثبتت هذه الأعمال الدور الهام للمعلومات البنيوية في التحليل البصري، إلا أن البنية تُستخدم في الغالب كسمة مساعدة أو نتيجة وسيطة، ولم يتم بعد تطوير نظام لتعلم الميزات تكون القيود البنيوية في جوهره40.

في مجال المساعدة في تصميم الملابس، دعمت هذه التطورات توصيات التصميم، وتحليل النمط، وبناء الأنظمة التفاعلية، وتقييم التصميم الموجه نحو الهيكل41. وقد حققت الأبحاث في أنظمة التوصية مطابقة الملابس والتوصيات الشخصية من خلال دمج السمات البصرية مع تفضيلات المستخدم42. كما استكشفت الأعمال المتعلقة بالمساعدة في التصميم مسارات جديدة لدعم التصميم الذكي عبر الجمع بين النماذج التوليدية، ونمذجة النمط، وآليات التعاون بين الإنسان والحاسوب43. وقد أدت الأبحاث حول القياس الافتراضي، وقياس المقاسات، ونقل النمط إلى توسيع نطاق تطبيق التحليل البصري للملابس طوال عملية التصميم والإنتاج. وبالرغم من أن هذه الدراسات قد أغنت الأشكال التقنية للمساعدة في تصميم الملابس، إلا أن سماتها البصرية الأساسية لا تزال مدفوعة بشكل أساسي بالمظهر الخارجي، وتفتقر إلى تمثيل موحد لهيكل التصميم من أجل التحليل. وفي المقابل، تتعامل هذه الورقة مع هيكل الملابس كقيد أساسي في تمثيل السمات، وتقدم طريقة تمثيل بصري للتحليل الهيكلي في المساعدة في تصميم الملابس.

على الرغم من هذه التطورات، فإن الأساليب الحديثة في التصميم التوليدي غالباً ما تتعامل مع الظروف الهيكلية كصفوف توجيه مكاني فضفاضة ضمن عمليات الانتشار. وتمثل أطر تحليل الهياكل المعاصرة التضاريس كعلامات دلالية مساعدة، منفصلة عن مساحة التضمين المرئي الأساسية. ويغير الإطار المقترح هذه الآلية من خلال تحديد قيد تضاريسي قائم على المسبقات الرسومية يعمل بشكل صريح على تعديل تعلم الميزات المرئية على مستوى المكونات. ويشجع هدف الاتساق متعدد المستويات الملابس ذات التخطيطات المكونات المتشابهة على مستوى الصورة على البقاء متقاربة في مساحة الميزات، بينما يفصل بين الملابس ذات التنظيمات المختلفة للمناطق المرئية. ويقلل هذا الهدف من الاعتماد على الملمس في إعدادات الاسترجاع التي تم تقييمها، ولكنه لا يؤسس لثبات تجاه التغيرات في المادة أو الوضعية أو الخلفية. ينبغي اختيار هذا البروتوكول عندما تحتوي الصورة المدخلة على قطعة ملابس فردية مرئية بشكل كافٍ، وتحتفظ المكونات الدلالية بحدود يمكن تحديدها، ويتطلب الهدف التحليلي مقارنة هيكلية على مستوى المكونات بدلاً من التعرف العام على الفئة. هذا البروتوكول مخصص لباحثي الرؤية الحاسوبية، وباحثي تصميم الملابس، وفرق تطوير الملابس الرقمية المشاركة في التحليل المرئي الحساس للهيكل. وهو غير مخصص للمهام التي تركز حصرياً على التعرف على اللون أو المادة، أو للصور التي تكون فيها تضاريس الملابس محجوبة إلى حد كبير. يقدم البروتوكول التالي سير العمل بدءاً من إعداد مجموعة البيانات ورسم خرائط الاحتمالات الدلالية، وصولاً إلى بناء العلاقات الهندسية، وترميز الميزات ثنائي التدفق، والدمج الموجه هيكلياً، والتحسين القائم على الاتساق. يتلخص سير العمل الكامل في الشكل 1.

البروتوكول

تستخدم هذه الدراسة مجموعات بيانات لصور الملابس متاحة للعامة، ولا تقوم بتجنيد مشاركين بشريين، أو جمع معلومات تحديد الهوية الشخصية، أو إجراء تجارب على الحيوانات، أو استخدام مواد بيولوجية. وبناءً على ذلك، فإن الموافقة الأخلاقية المؤسسية والموافقة المستنيرة غير مطلبتين.

1. بيئة البرمجيات وتكوين المشروع

  1. ضع ملفات المشروع التي تم إصدارها في دليل يتوفر فيه مساحة تخزين كافية، وافتح نافذة Terminal في الدليل الرئيسي للمشروع.
  2. قم بتشغيل الأمر conda env create -f environment.yml لإنشاء البيئة البرمجية. ثم قم بتشغيل الأمر conda activate garment_structure لتنشيط البيئة.
  3. قم بتشغيل الأوامر python --version و conda --version و pip show numpy و pip show torch و pip show torchvision و nvidia-smi. واحفظ المخرجات الكاملة لهذه الأوامر في ملف software_versions.txt.
  4. استخدم نفس البيئة المسجلة لعمليات المعالجة المسبقة، والتدريب، والاستنتاج، وقياس الكفاءة، والتقييم. وسجل اسم ملف نقطة الفحص (checkpoint) لنموذج HRNet-W48 وقيمة SHA-256 الخاصة به، ومعرف أوزان ResNet-50 المدربة مسبقاً على ImageNet وقيمة SHA-256 الخاصة بها، ومصدر إصدار DeepFashion2، ومعرف مستودع الكود المصدري في نفس الملف.
  5. أنشئ الأدلة data_raw و data_processed و parser_outputs و structural_priors و feature_outputs و checkpoints و logs و evaluation_results تحت الدليل الرئيسي للمشروع.
  6. افتح الملف configs/protocol.yaml. وأدخل دليل DeepFashion2 في خانة dataset_root، ومسار نقطة فحص HRNet-W48 المدربة مسبقاً في خانة parser_checkpoint، ودليل مخرجات المشروع في خانة output_root.
  7. اضبط input_height على 512، و input_width على 512، و batch_size على 32، و structural_categories_per_batch على 8، و samples_per_category على 4، و random_seed على 42، و feature_dimension على 512، و structural_constraint_weight على 1.0، و structural_relationship_weight على 0.5، و structural_discrimination_weight على 1.0، و separation_threshold على 0.3.
  8. اضبط المُحسن (optimizer) على mini-batch stochastic gradient descent. واضبط initial_learning_rate على 0.0001، و momentum على 0.9، و weight_decay على 0.0005، و max_epochs على 120، و learning_rate_schedule على multi-step decay، و learning_rate_decay_factor على 0.1. وأدخل حقب الاضمحلال (decay epochs) التي تم التحقق منها والمستخدمة في الإعدادات الصادرة في خانة learning_rate_milestones.
  9. قم بتشغيل الأمر python tools/export_experiment_tables.py --config configs/protocol.yaml --output evaluation_results. وصَدِّر إعدادات النموذج الكاملة إلى ملف model_setting_statistics.csv. وتحقق من أن الملف المُصدَّر يسجل حجم الصورة المدخلة، وتنسيق الإدخال، وتكوين الدفعة (batch composition)، والمُحسن، ومعدل التعلم، وجدول معدل التعلم، وعدد الحقب (epochs)، واضمحلال الأوزان، والزخم (momentum)، واحتمالات التعزيز (augmentation probabilities)، وبُعد الميزات، وأوزان الخسارة الهيكلية، وعتبة الفصل، والبذور العشوائية، وقاعدة اختيار نقطة الفحص، وعدد التشغيلات المستقلة.
  10. المخرجات المتوقعة: التأكد من أن البيئة البرمجية تبدأ دون أخطاء في التبعيات، وأن ملف software_versions.txt يحتوي على سجل البيئة، وأن جميع أدلة المخرجات موجودة، وأن ملف configs/protocol.yaml يحتوي على مسارات مطلقة صحيحة وإعدادات عددية دقيقة.
    ملاحظة: استخدم نفس البيئة وملف الإعدادات أثناء معالجة البيانات، وتدريب النموذج، والاستنتاج، والتقييم. واحفظ نسخة من ملف configs/protocol.yaml مع كل نقطة فحص مدربة.
    ​استكشاف الأخطاء وإصلاحها: إذا توقف إنشاء البيئة بسبب عدم توفر حزمة ما، فقم بإزالة البيئة غير المكتملة، وتحقق من قنوات الحزم في environment.yml، ثم أعد إنشاء البيئة. إذا لم يبلغ الأمر nvidia-smi عن وجود وحدة معالجة رسوميات، فتوقف عن تدريب النموذج واستعد برنامج تشغيل الرسوميات وبيئة CUDA runtime. إذا ظهر خطأ في الدليل أثناء التنفيذ، فاستبدل المسارات النسبية بمسارات مطلقة وتحقق من صلاحية الكتابة في output_root.

2. قبول الصور المدخلة، وبناء مجموعة البيانات، والمعالجة المسبقة

  1. استخدم فقط الملفات ذات الامتدادات JPG أو JPEG أو PNG. استخدم صور RGB ذات 8 بت تحتوي على قطعة ملابس رئيسية واحدة.
  2. احتفظ بصور RGB ذات 8 بت بعرض وارتفاع لا يقل عن 512 بكسل وقطعة ملابس رئيسية واحدة يمكن تحديدها. ارفض الصورة عندما تشغل مقدمة قطعة الملابس أقل من 15% من مساحة الصورة الكاملة، أو عندما يتطابق أكثر من 5% من حدود قناع قطعة الملابس مع حدود الصورة، أو عندما تتجاوز منطقة قطعة الملابس الثانوية 10% من مساحة قطعة الملابس الرئيسية، أو عندما تتجاوز المنطقة المحجوبة المقدرة 20% من قناع قطعة الملابس الرئيسية، أو عندما يكون تباين استجابة Laplacian أقل من 100.
  3. سجل معرف الصورة، والقيمة المقاسة، وقاعدة الاستبعاد التي تم تفعيلها، ومسار التعليق التوضيحي في ملف excluded_samples.csv.
  4. طبق قواعد قبول المدخلات على صور DeepFashion2 المصدرية قبل التصنيف الهيكلي وتقسيم البيانات. سجل كل معرف صورة مقبول ومرفوض، وتقسيم مجموعة البيانات الأصلي، ومعرف التعليق التوضيحي لقطعة الملابس، ومعرف الزوج المصدر، ونسبة مساحة المقدمة، ونسبة تلامس الحدود، ونسبة الحجب، ودرجة التمويه، وحالة الاحتفاظ النهائية في ملف data_filtering_manifest.csv.
  5. قم بتشغيل python tools/prepare_data.py --config configs/protocol.yaml.
  6. اقرأ مربع الإحاطة لقطعة الملابس من التعليقات التوضيحية لمجموعة البيانات. قم بتوسيع مربع الإحاطة بنسبة 5% من عرضه وارتفاعه، دون تجاوز حدود الصورة.
  7. قم بقص منطقة قطعة الملابس، مع الحفاظ على نسبة العرض إلى الارتفاع الأصلية، وأضف حشوة صفرية لتشكيل صورة مربعة، وقم بتغيير حجم الصورة المحشوة إلى 512 x 512 بكسل.
  8. حول الصورة التي تم تغيير حجمها إلى تنسور RGB بقيم نقطة عائمة. اقسم قيمة كل بكسل على 255.
  9. قم بتطبيع القنوات الحمراء والخضراء والزرقاء بمتوسطات 0.485 و 0.456 و 0.406 وانحرافات معيارية تبلغ 0.229 و 0.224 و 0.225.
  10. طبق القلب الأفقي باحتمالية 0.5 والمحو العشوائي باحتمالية 0.2 على صور التدريب. طبق فقط القص الحتمي، والحشو، وتغيير الحجم، والتطبيع على صور التحقق والاختبار.
  11. قم بتشغيل python tools/assign_structural_levels.py --config configs/protocol.yaml بعد إنشاء خرائط المكونات ذات السبع قنوات ومصفوفات الحدود المشتركة والترتيب الرأسي. لكل صورة محتفظ بها، احسب عدد العقد النشطة، وعدد المكونات المتصلة، وعدد عقد التفرع، وعدد الدورات المستقلة، وأطول مسار ترتيب رأسي موجه. عرف عقدة التفرع بأنها عقدة نشطة متصلة بثلاث عقد نشطة أخرى على الأقل في رسم الحدود المشتركة البياني.
  12. خصص S1 عندما يكون الرسم البياني متصلاً، ولا يحتوي على دورة مستقلة، ولا يحتوي على عقدة تفرع، ويكون أطول مسار ترتيب رأسي فيه لا يتجاوز حافتين. خصص S2 عندما يكون الرسم البياني متصلاً، ولا يحتوي على دورة مستقلة، ويحتوي على عقدة تفرع واحدة بالضبط، ويكون أطول مسار ترتيب رأسي فيه لا يتجاوز حافتين. خصص S3 عندما يكون الرسم البياني متصلاً، ولا يحتوي على دورة مستقلة، ويحتوي على عقدتي تفرع على الأقل أو مسار ترتيب رأسي يتكون من ثلاث حافات على الأقل. خصص S4 عندما يكون الرسم البياني متصلاً، ويحتوي على دورة مستقلة واحدة بالضبط، ويكون مسار الترتيب الرأسي فيه لا يتجاوز حافتين. خصص S5 عندما يحتوي الرسم البياني على دورتين مستقلتين على الأقل أو يحتوي على دورة مستقلة واحدة مع مسار ترتيب رأسي يتكون من ثلاث حافات على الأقل.
  13. طبق القواعد بالترتيب S5، S4، S3، S2، و S1 واحفظ إحصائيات الرسم البياني المحسوبة، والمستوى المخصص، ومعرف القاعدة في ملف structural_level_manifest.csv.
  14. قم بتوليد تسميات S1-S5 الأولية تلقائياً من أقنعة المكونات ومصفوفات العلاقات المحفوظة. ميز العينة بأنها غامضة هيكلياً عندما يحتوي الرسم البياني لمكوناتها على أكثر من مكون متصل واحد، أو عندما يكون متوسط أقصى احتمال للمكون داخل مقدمة قطعة الملابس أقل من 0.60، أو عندما يشغل مكون نشط أقل من 1% من مقدمة قطعة الملابس، أو عندما يتغير المستوى الهيكلي المخصص لها بعد تغيير عرض تلامس الحدود من بكسل واحد إلى بكسلين.
  15. اعرض كل عينة غامضة على مؤلفين لإجراء فحص مستقل للصورة المصدر، وخريطة المكونات، ومصفوفة الحدود المشتركة، ومصفوفة الترتيب الرأسي، والرسم البياني الأولي. احتفظ بالتسمية عندما يتفق الفحصان. اعرض حالة عدم الاتفاق على مؤلف ثالث واستخدم قرار الأغلبية كتسمية نهائية. استبعد العينة عندما لا يتم استرداد علاقة مكونات مستقرة بعد المراجعة. سجل التسمية التلقائية، وتسميات المراجعة، وسبب عدم الاتفاق، والتسمية النهائية، وحالة الاستبعاد في ملف structural_label_audit.csv.
  16. احسب قيمة SHA-256 لكل ملف مصدري محتفظ به واحسب هاش إدراكي 64-بت من قص قطعة الملابس المطبّع. ضع الصور ذات قيم SHA-256 المتطابقة في نفس مجموعة التكرار المطابق تماماً. ضع الصور التي تملك هاشات إدراكية بمسافة هامينج لا تزيد عن أربعة في نفس مجموعة التكرار القريب بعد التحقق من أنها تنبع من نفس مثيل قطعة الملابس.
  17. ادمج جميع الصور التي تشترك في نفس معرف الزوج المصدري لـ DeepFashion2 أو هوية قطعة الملابس في مجموعة مصدرية واحدة. احفظ هاشات الملفات، والهاشات الإدراكية، والمعرفات المصدرية، ومعرفات مجموعة التكرار في ملف duplicate_group_manifest.csv.
  18. قم بإجراء تقسيم البيانات على مستوى المجموعة المصدرية بدلاً من مستوى الصورة الفردية. خصص كل مجموعة تكرار مطابق تماماً، ومجموعة تكرار قريب، ومجموعة هوية مصدرية بالكامل لمجموعة فرعية واحدة. تحقق من جميع الأزواج المتقاطعة بين المجموعات الفرعية بعد التقسيم واكتب كل تعارض هوية مكتشف، وتعارض هاش، وتعارض هاش إدراكي في ملف leakage_audit.csv. أعد بناء البيانات حتى لا يحتوي ملف leakage_audit.csv على أي سجلات متقاطعة بين المجموعات الفرعية غير محلولة.
  19. قم بتقسيم المجموعات المصدرية طبقاً لتسميات S1-S5 النهائية وخصص مجموعات كاملة لمجموعات التدريب والتحقق والاختبار وفقاً للتخصيص المعتمد الموضح في الجدول 1. أبلغ عن العدد الدقيق للصور وعدد المجموعات المصدرية لكل مستوى هيكلي ومجموعة فرعية.
  20. احسب النسب المئوية الفعلية للتدريب والتحقق والاختبار من المجموعة النهائية المحتفظ بها بدلاً من مجموعة البيانات غير المصفاة. لا تستخدم صور التحقق، أو صور الاختبار، أو الصور المستبعدة بسبب الغموض، أو الصور التي تنتمي إلى مجموعات التكرار الخاصة بها أثناء تعلم المعلمات، أو تحديد العتبة، أو ضبط قواعد المستوى الهيكلي، أو اختيار نقطة التحقق.
  21. احفظ الصور المعالجة في data_processed/images. احفظ ملفات train_manifest.csv و validation_manifest.csv و test_manifest.csv و pair_manifest.csv و structural_level_manifest.csv في data_processed/manifests.
  22. اقرأ التسميات الهيكلية النهائية، وحالة المراجعة، ومعرفات مجموعة التكرار، ومعرفات المجموعة المصدرية، وتسميات المجموعات الفرعية من البيانات المعالجة. احسب عدد العينات المقبولة تلقائياً، والعينات المراجعة يدوياً، واستبعادات الغموض، واستبعادات التكرار، والمجموعات المصدرية، وصور التدريب، وصور التحقق، وصور الاختبار من S1 إلى S5.
  23. احسب نسب المجموعات الفرعية المحققة، ومتوسط عدد العقد النشطة، ومتوسط عدد عقد التفرع، ومتوسط عدد الدورات المستقلة، ومتوسط عمق الترتيب الرأسي، ومتوسط عدد الحواف المحددة النوع. احفظ الإحصائيات الكاملة في evaluation_results/dataset_statistics.csv.
  24. المخرجات المتوقعة: تأكد من أن كل صورة مقبولة هي صورة RGB ذات 8 بت بحجم 512 x 512 بكسل ولديها سجل تصفية واحد، وتسمية مستوى هيكلي نهائية واحدة، ومعرف مجموعة مصدرية واحد، ومعرف مجموعة تكرار واحد، وتسمية مجموعة فرعية واحدة، ومسار تعليق توضيحي صالح واحد. تأكد من أن كل عينة غامضة لديها سجل مراجعة كامل. تأكد من عدم ظهور أي معرف مصدري، أو مجموعة تكرار مطابق تماماً، أو مجموعة تكرار قريب، أو هوية قطعة ملابس في أكثر من مجموعة فرعية واحدة. تأكد من أن أعداد الصور في train_manifest.csv و validation_manifest.csv و test_manifest.csv و dataset_statistics.csv متطابقة.
    ملاحظة: احتفظ بالصور الأصلية غير المعالجة في data_raw. لا تطبق زيادة البيانات العشوائية على صور التحقق أو الاختبار.
    ​استكشاف الأخطاء وإصلاحها: إذا أدى القص إلى إزالة ياقة أو كم أو حاشية أو ساق بنطال، فاستعد التعليقات التوضيحية الأصلية وقم بتوسيع هامش الحدود المحتفظ به. إذا ظهرت قطعة الملابس ممددة، فتحقق من وجود الحشو المربع قبل تغيير الحجم. إذا كانت الصورة المعالجة تحتوي على قناة واحدة أو أربع قنوات، فحول الملف المصدري إلى RGB بـ 8 بت وأعد تشغيل المعالجة المسبقة. إذا ظهرت معرفات مكررة عبر المجموعات الفرعية، فأعد بناء جميع بيانات المجموعات الفرعية قبل التدريب.

3. تحليل المكونات المرئية المقيدة بالمقدمة ورسم خرائط الاحتمالات

  1. قم بتشغيل python tools/parse_components.py --config configs/protocol.yaml.
  2. قم بتحميل نقطة تفتيش (checkpoint) التحليل الدلالي للملابس HRNet-W48 سابقة التدريب من parser_checkpoint. تحقق من أن نقطة التفتيش تُخرج فئات مكونات الملابس المحددة بواسطة تعيين توصيفات مجموعة البيانات. قم بتحويل شبكة التحليل الدلالي إلى وضع التقييم وعطل حساب التدرج (gradient calculation).
  3. اقرأ الصور المعالجة من train_manifest.csv وvalidation_manifest.csv وtest_manifest.csv بالتتابع.
  4. استخرج موتر استجابة دلالي (semantic response tensor) مكوناً من سبع قنوات من كل صورة إدخال، واضبط قيمة K لتكون سبعة طوال سير العمل. استخدم ترتيب الفئات الثابت: منطقة الحاشية العلوية (Upper Trim Region)، منطقة خط الرقبة (Neckline Region)، منطقة الصدر (Bodice Region)، منطقة الجزء السفلي الأيسر من الملابس (Left Lower-Garment Region)، منطقة الجزء السفلي الأيمن من الملابس (Right Lower-Garment Region)، منطقة الجزء السفلي الأوسط من الملابس (Middle Lower-Garment Region)، ومنطقة الحاشية السفلية (Hem Region). حافظ على هذا الترتيب في خرائط الاحتمالات، ومصفوفات المكونات، ومصفوفات الرسوم البيانية، ومصفوفات الميزات، والبيانات التعريفية (manifests)، وملفات التصور.
  5. طبق دالة softmax على طول بُعد القناة لتوليد خريطة احتمالات المكونات الدلالية P. تحقق من أن مجموع الاحتمالات عبر جميع قنوات K يساوي واحداً عند كل بكسل ضمن نطاق سماحية قدره 0.0001.
  6. قم بتحميل قناع المقدمة (foreground mask) للملابس من توصيفات مجموعة البيانات وقم بمحاذاته مع الصورة المعالجة بحجم 512 x 512. اضبط احتمالية كل مكون خارج مقدمة الملابس على صفر. أعد تطبيع احتمالات المكونات داخل قناع المقدمة على طول بُعد القناة.
  7. تحقق من أن كل منطقة مكون نشطة تظل داخل مقدمة الملابس. ارفض العينة التي تم تحليلها إذا امتدت منطقة مكون ملونة إلى الجدار المحيط، أو الأرضية، أو الستارة، أو أي منطقة خلفية أخرى. سجل معرف الصورة المرفوضة وخطأ التحليل في parsing_quality_log.csv.
  8. احسب نسبة تغطية المقدمة لكل مكون، وضع علامة على المكونات ذات المناطق المجزأة أو المناطق المعزولة غير المدعومة للفحص اليدوي.
  9. احفظ موتر الاستجابة الدلالي في parser_outputs/logits. احفظ خريطة الاحتمالات في parser_outputs/probability_maps. احفظ معاينة للمكونات مرمزة بالألوان في parser_outputs/previews.
  10. المخرجات المتوقعة: تأكد من أن كل صورة مقبولة تنتج خريطة احتمالات واحدة مقيدة بالمقدمة مكونة من سبع قنوات وبحجم مكاني 512 x 512 بكسل، وموتر استجابة دلالي واحد مكون من سبع قنوات، وصورة معاينة واحدة. تأكد من أن مؤشرات القنوات من واحد إلى سبعة تتبع ترتيب المكونات الثابت المحدد في الخطوة 3.4. تأكد من أن جميع مناطق المكونات الملونة تظل داخل مقدمة الملابس وأن بكسلات الخلفية لها احتمالية مكون صفرية. تأكد من أن معرف الملف يطابق الإدخال المقابل في البيان التعريفي المصدر.
    ملاحظة: احتفظ باحتمالات المكونات المستمرة داخل مقدمة الملابس أثناء النمذجة الهيكلية. تعامل مع المناطق الناتجة كمنطاق تحليل بصري. لا تفسر حدودها على أنها خطوط خياطة، أو خطوط قص، أو كنتور قطع النمط، أو بنسات (darts)، أو علامات تحديد (notches)، أو مراجع تدريج القياسات.
    ​استكشاف الأخطاء وإصلاحها: إذا أظهرت جميع القنوات احتمالات موحدة تقريباً، فتحقق من parser_checkpoint، وترتيب قنوات RGB، وتطبيع الصور. إذا ظل أحد المكونات غائباً عبر مجموعة فرعية كاملة، فقارن مؤشر التوصيف مع مؤشر قناة مخرجات المحلل. إذا امتدت ألوان المكونات إلى الخلفية، فتحقق من محاذاة قناع المقدمة، وإعدادات الاستيفاء (interpolation)، وإحداثيات التوصيف قبل بناء الرسم البياني. إذا امتدت منطقة بصرية عبر مناطق ملابس متعددة غير مرتبطة، فضع علامة على العينة كفشل في التحليل واستبعدها من توليد الأولويات الهيكلية. إذا كانت احتمالات القنوات لا تساوي واحداً، فطبق دالة softmax على طول بُعد القناة بدلاً من أي من البُعدين المكانيين. إذا كان هناك ملف مخرجات مفقود، فحدد موقع المعرف المعالج النهائي في سجل المحلل واستأنف التحليل من المعرف التالي.

4. نمذجة هندسة المكونات والعلاقات المكانية على مستوى الصورة

  1. قم بتحميل موتر الميزات المرئية الضحلة وخريطة الاحتمال P المقابلة لكل صورة.
  2. اضرب كل متجه ميزات مكاني في الاحتمال المخصص للمكون الدلالي المقابل.
  3. اجمع متجهات الميزات المرجحة عبر الأبعاد المكانية واقسم المجموع على الكتلة الاحتمالية الكلية للمكون.
  4. خصص متجهاً صفرياً ومؤشراً للعقدة غير النشطة لأي مكون ذو كتلة احتمالية صفرية.
  5. طبق تطبيع L2 على كل تضمين مكون نشط وقم بتكديس التضمينات وفقاً لترتيب المكونات الدلالية الثابت.
  6. احسب إحداثيات المركز الأفقية والرأسية لمستوى الصورة لكل مكون مرئي من توزيع الاحتمالات المقيد بالمقدمة. قم بتطبيع الإحداثيات بناءً على عرض الصورة وارتفاعها.
  7. احسب الانتشار الأفقي والرأسي لمستوى الصورة لكل مكون مرئي في نفس نظام الإحداثيات المطبق. استخدم هذه القيم فقط لوصف مدى المنطقة المرئية في الصورة المعالجة.
  8. أنشئ سبع عقد بيانية وفقاً لترتيب المكونات الثابت، واحتفظ بالمكونات غير النشطة كعقد صفرية. أنشئ مصفوفة حدود مشتركة بحجم 7 × 7 باستخدام تلامس الجيران الثمانية بين أقنعة مكونات المقدمة. أنشئ مصفوفة ترتيب رأسي بحجم 7 × 7 باستخدام العلاقات الثابتة من منطقة الحافة العلوية (Upper Trim Region) إلى منطقة خط الرقبة (Neckline Region)، ومن منطقة خط الرقبة إلى منطقة الصدر (Bodice Region)، ومن منطقة الصدر إلى كل منطقة من مناطق الملابس السفلية، ومن كل منطقة ملابس سفلية إلى منطقة الحاشية (Hem Region). خزن كل علاقة صالحة في كلا الاتجاهين.
  9. أضف حلقة ذاتية (self-loop) لكل عقدة نشطة قبل الالتفاف البياني (graph convolution)، وأبقِ العلاقات المتصلة بالعقد غير النشطة عند الصفر.
  10. احسب إزاحة المركز النسبية والتشتت المكاني النسبي بين كل زوج مرتب من المكونات الدلالية. قم بتكديس القيم الهندسية الزوجية لتكوين موتر العلاقات الهندسية.
  11. احسب الضرب النقطي بين كل زوج من تضمينات المكونات المطبعة. طبق دالة softmax على مستوى الصفوف لمصفوفة التشابه الناتجة واستخدم القيم كأوزان للعلاقات.
  12. اضرب موتر العلاقات الهندسية في أوزان العلاقات المقابلة وقم بتجميع العلاقات المرجحة لكل مكون.
  13. احفظ مصفوفة تضمين المكونات، ومصفوفة مركز المكونات، ومصفوفة التشتت المكاني، ومصفوفة الحدود المشتركة، ومصفوفة الترتيب الرأسي، ومصفوفة الحلقة الذاتية، ومصفوفة أوزان العلاقات، وقناع العقد غير النشطة، ورسم خرائط تسمية المكونات، وتمثيل الأولويات الهيكلية في structural_priors. احفظ كل مصفوفة بسبعة صفوف وسبعة أعمدة حيثما كان ذلك مناسباً. تظهر عملية الإنشاء الكاملة من خريطة المكونات المقيدة بالمقدمة إلى أولوية طوبولوجيا مكونات الملابس على مستوى الصورة في الشكل 2.
  14. أنشئ تراكب الرسم البياني للمكونات لكل عينة تصور من خريطة الاحتمالات المقيدة بالمقدمة، ومصفوفة مركز المكونات، ومصفوفة الجوار المحددة النوع، وقناع العقد غير النشطة، ورسم خرائط تسمية المكونات.
  15. ضع كل عقدة نشطة في مركز المكون المقابل. ارسم حوافاً صلبة للحدود المشتركة في المقدمة وحوافاً متقطعة لعلاقات الترتيب الرأسي المحددة مسبقاً.
  16. احفظ كل تراكب بياني في structural_priors/visualizations باستخدام معرف الصورة المصدر. سجل مسار الصورة المصدر، ومسار خريطة الاحتمالات، ومسار مركز المكونات، ومسار الجوار المحدد النوع، ومسار قناع العقد غير النشطة، ومعرف نقطة فحص التحليل الدلالي، ومسار تراكب الرسم البياني في component_graph_visualization_manifest.csv.
  17. المخرجات المتوقعة: تأكد من أن كل صورة تنتج مصفوفة تضمين مكونات بـ K من الصفوف، ومصفوفة جوار محددة النوع بـ K من الصفوف و K من الأعمدة، ومصفوفة أوزان علاقات بـ K من الصفوف و K من الأعمدة، وقناع عقد غير نشطة بـ K من القيم، وتمثيل واحد للأولويات الهيكلية على مستوى الصورة. تأكد من أن كل عينة تصور مختارة تنتج تراكب رسم بياني للمكونات تظل فيه العقد النشطة ضمن مناطق الملابس المقابلة.
    ملاحظة: حافظ على نفس ترتيب المكونات المرئية عبر جميع المصفوفات، والبيانات، والرسوم البيانية، وملفات الميزات، وتراكبات الرسوم البيانية. تعامل مع مراكز المكونات، وقيم الانتشار المكاني، وعلاقات الرسم البياني كواصفات لمنطقة الملابس في مستوى الصورة. لا تفسر الرسم البياني للمكونات كـ هيكل وضعية بشرية أو تشتق عقده من إحداثيات المفاصل التشريحية. لا تحول هذه الواصفات إلى أطوال درزات، أو أنصاف أقطار منحنيات، أو سعة بنسات، أو مواضع علامات، أو اتجاهات خطوط النسيج، أو زيادات التدرج، أو أبعاد قطع الباترون.
    ​استكشاف الأخطاء وإصلاحها: إذا كانت المصفوفة تحتوي على قيمة غير عددية، فافحص مقام الكتلة الاحتمالية وتطبيع الإحداثيات. إذا تركزت أوزان العلاقات على مكون واحد، فاطرح الحد الأقصى للصف من مصفوفة التشابه قبل تطبيق softmax. إذا اختلف عدد عقد الرسم البياني بين الصور، فتحقق من أن المكونات غير النشطة تظل موجودة كمتجهات صفرية بدلاً من إزالتها.

5. ترميز الميزات الواعي بالبنية ثنائي التدفق

  1. قم بتحميل أوزان ResNet-50 المدربة مسبقاً على ImageNet، ثم قم بإزالة طبقات التجميع والتصنيف النهائية.
  2. مرر كل صورة ملابس مُطبعة من خلال ResNet-50 واستخرج تينسور المظهر (appearance tensor) من مرحلة العمود الفقري (backbone stage) المحددة بواسطة appearance_stage في ملف configs/protocol.yaml. تحقق من اسم المرحلة، وعدد قنوات الإخراج، والأبعاد المكانية للإخراج الناتجة عن مرحلة العمود الفقري المختارة لصورة مدخلة بحجم 512 x 512 بكسل. استخدم المرحلة نفسها في كل من عمليات التدريب، والاستدلال، ودراسات الاستئصال (ablation)، وعمليات المقارنة.
  3. قم بتغيير حجم خريطة الاحتمالات الدلالية (semantic probability map) لتناسب الحجم المكاني لتينسور سمات المظهر من خلال الاستيفاء الخطي الثنائي (bilinear interpolation). اضرب تينسور سمات المظهر في كل خريطة احتمالات مكون مُعاد تحجيمها، ثم قم بتجميع الاستجابات المرجحة عبر الأبعاد المكانية.
  4. مرر كل تضمين مظهر للمكون (component appearance embedding) من خلال طبقة إعادة معايرة القنوات (channel-recalibration layer) المحددة في ملف configs/protocol.yaml. سجل نوع الطبقة، وبُعد الإدخال، وبُعد الإخراج، ونسبة الاختزال، ودالة التنشيط، وقاعدة مشاركة المعاملات. قم برص متجهات المكونات السبعة الناتجة وفق الترتيب الدلالي الثابت لتكوين مصفوفة سمات المظهر.
  5. مرر كل متجه علاقة هندسية من خلال طبقة الإسقاط الهيكلي (structural projection layer) واضبط بُعد الإخراج على 512. قم ببناء رسم المكونات البياني (component graph) باستخدام مصفوفة أوزان العلاقات وقناع العقد غير النشطة (inactive-node mask).
  6. طبق طبقتين من التلافيف الرسومية (graph convolutional layers) ببُعد إدخال 512 وبُعد إخراج 512. طبق تطبيع الدفعة (batch normalization) بعد كل طبقة تلافيف رسومية، ثم طبق دالة LeakyReLU. سجل قيمة الميل السالب المستخدمة في LeakyReLU. طبق قناع العقد غير النشطة بعد كل طبقة للحفاظ على سمات صفرية للمكونات غير النشطة.
  7. طبق المحاذاة الدلالية (semantic alignment) باستخدام تضمينات المكونات المُطبعة، وقم برص المتجهات الناتجة لتكوين مصفوفة السمات الهيكلية.
  8. المخرج المتوقع: تأكد من أن كل صورة تنتج مصفوفة سمات مظهر واحدة ومصفوفة سمات هيكلية واحدة. تأكد من أن كلتا المصفوفتين تحتويان على K من الصفوف و 512 من الأعمدة.
    ملاحظة: أبقِ المكونات غير النشطة كمتجهات صفرية وحافظ على ترتيب المكونات الذي تم تحديده أثناء بناء المسبق الهيكلي (structural-prior).
    استكشاف الأخطاء وإصلاحها: إذا كانت مصفوفتا السمات تحتويان على أعداد صفوف مختلفة، فافحص تعيين الفئات الدلالية والتعامل مع العقد غير النشطة. إذا أبلغ ضرب المصفوفات عن خطأ في الأبعاد، فتحقق من أن مخرج الإسقاط الهيكلي وأبعاد قنوات المظهر كلاهما 512. إذا ظلت السمات الهيكلية صفرية لجميع المكونات النشطة، فتحقق من إضافة حواف الرسم البياني وأوزان العلاقات إلى الدفعة الحالية.

6. دمج السمات الموجه بالبنية

  1. طبق تسلسل دمج الميزات الموجه بالبنية الموضح في الشكل 3. مرر مصفوفة الميزات البنيوية عبر طبقة وزن الدمج وطبق دالة التنشيط المحددة بواسطة fusion_activation في configs/protocol.yaml. سجل اسم التنشيط، وبُعد الإدخال، وبُعد الإخراج، وما إذا كانت المعلمات مشتركة عبر عقد المكونات السبع.
  2. تحقق من أن مصفوفة الوزن البنيوية الناتجة تحتوي على K من الصفوف و 512 من الأعمدة.
  3. اضرب مصفوفة ميزات المظهر في مصفوفة الوزن البنيوية عنصرًا بعنصر.
  4. قم بدمج مصفوفة المظهر المعدلة ومصفوفة الميزات البنيوية على طول بُعد القناة.
  5. قم بدمج متجه المظهر المعدل ذو الـ 512 بُعد والمتجه البنيوي ذو الـ 512 بُعد لكل مكون لتكوين متجه ذو 1024 بُعد. مرر المتجه المدمج عبر طبقة إسقاط الدمج وقلل بُعده من 1024 إلى 512.
  6. أضف مصفوفة الميزات البنيوية الأصلية إلى المصفوفة المسقطة من خلال اتصال متبقٍ (residual connection).
  7. كدس متجهات المكونات المدمجة بالترتيب الدلالي الثابت وطبق تسوية L2 على التمثيل المسطح المدرك للبنية.
  8. احفظ مصفوفة الوزن البنيوية، ومصفوفة المظهر المعدلة، ومصفوفة المكونات المدمجة، والتمثيل النهائي المدرك للبنية في feature_outputs.
  9. المخرجات المتوقعة: تأكد من أن كل صورة تنتج مصفوفة مكونات مدمجة واحدة تحتوي على K من الصفوف و 512 من الأعمدة، ومتجه ميزات واحد مدرك للبنية ومسوى مرتبط بمعرف الصورة المصدر.
    ملاحظة: احتفظ بمصفوفة الوزن البنيوية ومصفوفة المكونات المدمجة لتصور الاستجابة وتحليل الاختلاف المحلي.
    ​استكشاف الأخطاء وإصلاحها: إذا استمرت القيم المدمجة في النمو، فافحص مخرجات التنشيط وطبقة التسوية. إذا اقتربت جميع الأوزان البنيوية من القيمة نفسها، فتحقق من تباين الميزات البنيوية عبر الصور ومن وصول التدرجات إلى طبقة الدمج. إذا لم تتطابق ملفات الميزات ومعرفات الصور، فأعد بناء بيان المخرجات قبل التدريب أو تقييم الاسترجاع.

7. تدريب النموذج وتحسين الاتساق

  1. قم بتحميل قيم البذور العشوائية الخمس المسجلة في configs/seeds.yaml. لكل عملية تشغيل، حدد نفس البذرة العشوائية للغة Python وNumPy وعمليات PyTorch CPU وجميع أجهزة CUDA. قم بتفعيل الخوارزميات الحتمية (deterministic algorithms)، وتعطيل وضع cuDNN benchmark، وسجل قيم البذور الخمس الدقيقة في دليل التشغيل المقابل.
  2. قم بتحميل بيان التدريب المعالج (processed training manifest)، وبيان الأزواج (pair manifest)، وخرائط الاحتمالات، والأولويات الهيكلية (structural priors).
  3. قم بتكوين كل دفعة تدريب (training batch) بحيث تشتمل على ثماني فئات هيكلية وأربع عينات متغيرة المظهر من كل فئة.
  4. احسب فقدان الاتساق الهيكلي (structural consistency loss) من أزواج العينات الإيجابية التي تشترك في نفس الأولوية الهيكلية.
  5. احسب فقدان اتساق العلاقة الهيكلية (structural relationship consistency loss) من المسافات الزوجية بين سمات المكونات.
  6. احسب فقدان التمييز الهيكلي (structural discrimination loss) من أزواج العينات السلبية ذات الهياكل غير المتجانسة وقم بتطبيق عتبة الفصل البالغة 0.3.
  7. ادمج هدف المظهر، وهدف الاتساق الهيكلي، وهدف العلاقة الهيكلية، وهدف التمييز الهيكلي باستخدام الأوزان المخزنة في configs/protocol.yaml. تظهر عملية تحسين فضاء السمات التي تحكمها الأهداف الهيكلية الثلاثة في الشكل 4.
  8. قم بتشغيل python train.py --config configs/protocol.yaml. حدّث جميع المعلمات القابلة للتدريب باستخدام خوارزمية نزول التدرج العشوائي للدفعات الصغيرة (mini-batch stochastic gradient descent) باستخدام معدل التعلم الأولي، والزخم (momentum)، واضمحلال الوزن (weight decay)، وعدد العصور (epoch count)، وعامل الاضمحلال، وعصور الاضمحلال المحددة في الخطوة 1.8. سجل معدل التعلم بعد كل عصر في سجل التدريب.
  9. سجل إجمالي الفقدان، وفقدان المظهر، وفقدان الاتساق الهيكلي، وفقدان العلاقة الهيكلية، وفقدان التمييز الهيكلي، ومعدل التعلم، ومؤشر الاتساق الهيكلي (SCI)، ومؤشر التمييز الهيكلي (SDI)، وRecall@5 بعد كل عصر.
  10. قم بتقييم النموذج على validation_manifest.csv بعد كل عصر. احفظ نقطة التحقق (checkpoint) المرتبطة بأعلى SCI للتحقق في checkpoints/selected_model.pth.
  11. كرر التدريب خمس مرات باستخدام البذور العشوائية الخمس المسجلة. احفظ كل ملف تكوين، وسجل تدريب، ونقطة تحقق مختارة في دليل تشغيل منفصل.
  12. المخرجات المتوقعة: تأكد من أن كل عملية تشغيل تنتج سجل تدريب، وسجل تحقق، وملف مقاييس على مستوى العصر، ونقطة تحقق واحدة مختارة. تأكد من أن نقطة التحقق المختارة تستند إلى أداء التحقق بدلاً من أداء الاختبار.
    ملاحظة: استخدم نفس بيانات التدريب والتحقق والاختبار في كل مقارنة للنماذج وتجربة استئصال (ablation experiment).
    ​استكشاف الأخطاء وإصلاحها: إذا أصبح الفقدان غير عددي، أوقف التدريب، وافحص كتل الاحتمالات للمكونات، وقلل معدل التعلم بمعامل 10، وأعد التشغيل من أحدث نقطة تحقق صالحة. إذا ظل SCI للتحقق دون تغيير بينما ينخفض فقدان التدريب، تحقق من وصول التدرجات إلى معلمات انتشار الرسوم البيانية والدمج. إذا نفدت ذاكرة الرسوميات، قلل حجم الدفعة وحافظ على حجم دفعة فعال قدره 32 من خلال تراكم التدرج (gradient accumulation). إذا تغير أداء التحقق بشكل حاد بين عمليات التشغيل، تحقق من البذرة العشوائية المسجلة وترتيب بيان البيانات.

8. الاستدلال والاسترجاع والعنقودة والتحقق من المخرجات

  1. قم بتشغيل python infer.py --config configs/protocol.yaml --checkpoint checkpoints/selected_model.pth. قم بتوليد خرائط الاحتمالية، والمسبقات الهيكلية، ومصفوفات سمات المظهر، ومصفوفات السمات الهيكلية، ومصفوفات المكونات المدمجة، ومتجهات السمات النهائية لكل صورة اختبار.
  2. احفظ جميع مخرجات الاستدلال تحت feature_outputs/test وسجل مساراتها في test_feature_manifest.csv. احسب تشابه جيب التمام (cosine similarity) بين كل سمة استعلام وجميع سمات المعرض. رتب معرفات المعرض بترتيب تنازلي حسب التشابه. احفظ أعلى خمس نتائج ترتيباً لكل استعلام في evaluation_results/retrieval_results.csv.
  3. لكل عينة استرجاع مختارة للتصور المرئي، قم بتحميل مصفوفة التجاور المحددة النوع، ومصفوفة أوزان العلاقات، ومصفوفة مركز المكون، وقناع العقد غير النشطة، وتعيين تسميات المكونات، ومصفوفة المكونات المدمجة لصورة الاستعلام. قم بتحميل الملفات نفسها لأعلى نتيجة ترتيباً ولدها النموذج المدرك للهيكل.
  4. قم بتمثيل الرسم البياني لمكونات الاستعلام والرسم البياني لمكونات الصورة المسترجعة من مراكز المكونات المحفوظة ومصفوفات التجاور المحددة النوع. حافظ على الترتيب الثابت للمكونات وأنواع العلاقات المستخدمة أثناء استدلال النموذج.
  5. قم بتمثيل مصفوفة التجاور المحددة النوع للاستعلام كمصفوفة فئوية. استخدم قيم مصفوفة منفصلة لعلاقات العقد غير النشطة، والحدود المشتركة، والترتيب الرأسي. ضع تسميات للمحاور الأفقية والرأسية باستخدام معرفات المكونات المخزنة في تعيين تسميات المكونات.
  6. طبق معايرة L2 على مصفوفة المكونات المدمجة للاستعلام ومصفوفة المكونات المدمجة للصورة المسترجعة. احسب تشابه جيب التمام بين كل مكون استعلام وكل مكون في الصورة المسترجعة. احفظ مصفوفة مراسلة المكونات الناتجة ذات الأبعاد K × K في evaluation_results/structural_retrieval_evidence.
  7. لكل زوج مرجعي-مستهدف مختار لتحليل الاختلاف الموضعي، قم بتحميل مصفوفة التجاور المحددة النوع، ومصفوفة مركز المكون، ومصفوفة التشتت المكاني، ومصفوفة أوزان العلاقات، ومصفوفة المكونات المدمجة لكلتا الصورتين.
  8. احسب الفرق المطلق بين مصفوفاتي التجاور المحددتين النوع. احسب الفروق المطلقة في إزاحة مركز المكون، والتشتت المكاني، وأوزان العلاقات باستخدام الترتيب الثابت للمكونات. احفظ مصفوفة اختلاف الطوبولوجيا ومصفوفة اختلاف العلاقات الهندسية الناتجة في evaluation_results/structural_difference_evidence.
  9. احسب مسافة L2 بين الصفوف المتناظرة في مصفوفتي المكونات المدمجتين. قم بمعايرة المسافات على مستوى المكونات وتعيينها للعقد في الرسم البياني للمكونات المستهدفة. زد عرض الحافة وفقاً للفرق المعاير في وزن العلاقة. احفظ الرسم البياني الناتج لاختلاف المكونات بعد الدمج.
  10. سجل معرفات الصور، ومسارات المصفوفات، ومسارات الرسوم البيانية، وترتيب المكونات، ومعرف نقطة التحقق (checkpoint)، ومسارات مخرجات التصور المرئي في structural_visualization_manifest.csv. ولد جميع التصورات الهيكلية برمجياً من الملفات المسجلة؛ ولا تضف عقد الرسوم البيانية أو حوافها أو قيم المصفوفات يدوياً.
  11. طبق خوارزمية K-Means بخمس مجموعات على متجهات السمات النهائية واحفظ تعيينات المجموعات في evaluation_results/cluster_assignments.csv. قم بتشغيل python evaluate.py --config configs/protocol.yaml --feature_dir feature_outputs/test.
  12. احسب SCI وSDI وRecall@5 ومتوسط الدقة المتوسطة (mAP) ومعامل السيلويت (silhouette coefficient) لكل تشغيل. استخدم SCI لتقييم تكتل السمات المعايرة التي تشترك في نفس التسمية الهيكلية، واستخدم SDI لتقييم الفصل بين التسميات الهيكلية المختلفة. استخدم Recall@5 لتقييم ما إذا كان هناك تطابق هيكلي ذو صلة يظهر في قائمة الاسترجاع القصيرة، واستخدم mAP لتقييم جودة الترتيب عبر المعرض بأكمله. استخدم معامل السيلويت فقط لتحليل التجميع.
  13. احسب المتوسط الحسابي والانحراف المعياري للعينة عبر خمس عمليات تشغيل مستقلة. احتفظ بالقيم الخمس على مستوى التشغيل لكل طريقة ومقياس. لا تطبق معايرة الحد الأدنى والأقصى (min-max)، أو معايرة الرتبة، أو إعادة القياس بناءً على الطرق التي تتم مقارنتها. أجرِ اختبار t المقترن باستخدام النتائج التي تم الحصول عليها تحت نفس البذرة العشوائية وسجل إحصائية الاختبار وقيمة الدلالة الدقيقة ثنائية الطرف.
  14. قارن عدد معرفات الاختبار المعالجة، وملفات السمات، وسجلات الاسترجاع، وتعيينات المجموعات. قم بحل كل تعارض قبل الإبلاغ عن نتائج التقييم أو تفسيرها.
  15. المخرجات المتوقعة: تأكد من أن كل صورة اختبار لديها سجل استدلال كامل واحد، وقائمة استرجاع واحدة، وتعيين مجموعة واحدة، ومجموعة واحدة من مدخلات التقييم. تأكد من أن كل حالة استرجاع مختارة للتصور المرئي لها رسم بياني لمكونات الاستعلام، ورسم بياني لمكونات الصورة المسترجعة، ومصفوفة تجاور محددة النوع، ومصفوفة مراسلة المكونات المدمجة.
  16. تأكد من أن كل حالة اختلاف هيكلي لها مصفوفة اختلاف طوبولوجي، ومصفوفة اختلاف علاقات هندسية، ورسم بياني لاختلاف المكونات بعد الدمج، وخريطة حرارية للاختلاف المكاني، وتراكب استجابة. تأكد من أن جميع ملفات التصور المرئي مرتبطة بمصفوفاتها المصدر عبر structural_visualization_manifest.csv. احفظ الخريطة الحرارية النقية، وتراكب الصورة المستهدفة، وقناع المقدمة، وإحداثيات منطقة الاستجابة العليا لكل حالة مصورة.
  17. اقبل استجابة الفرق المحسوبة فقط عندما تتداخل منطقة الاستجابة العالية السائدة مع مقدمة الملابس وتظل مدعومة بتغيير مصفوفة التجاور المحددة النوع المقابلة، وتغيير العلاقة الهندسية، وأدلة مسافة المكونات بعد الدمج. إذا وقعت أقوى استجابة بشكل أساسي خارج مقدمة الملابس، فافحص مخرجات التحليل، والرسم البياني للمكونات، وسجل الدمج.
    ملاحظة: استخدم نقطة التحقق المختارة من مجموعة التحقق للاستدلال على مجموعة الاختبار. لا تختار أو تستبدل نقطة التحقق وفقاً لمقاييس مجموعة الاختبار. استخدم نفس ترتيب المكونات، وقاعدة العقد غير النشطة، وتشفير نوع العلاقة، وعملية المعايرة عند توليد الرسوم البيانية والمصفوفات أثناء الاستدلال والتصور المرئي.
    ​استكشاف الأخطاء وإصلاحها: إذا توقف الاستدلال قبل معالجة جميع صور الاختبار، حدد المعرف النهائي في سجل الاستدلال واستأنف من المعرف التالي. إذا كانت نتائج الاسترجاع تهيمن عليها 유사ية الألوان، فافحص مسبقات الهيكل ومخرجات الدمج، وتحقق من نجاح تحميل نقطة التحقق. إذا أبلغ التقييم عن معرفات مكررة، فأعد بناء test_feature_manifest.csv وأزل السجلات المكررة قبل إعادة الحساب. إذا أنتجت خوارزمية K-Means مجموعة فارغة، فتحقق من معايرة السمات وأعد تشغيل التجميع باستخدام البذرة العشوائية المسجلة.

9. التقييم المقارن للنماذج

  1. قم بتشغيل python compare_models.py --config configs/protocol.yaml.
  2. قم بتدريب وتقييم كل من ResNet-50، وPart-based Convolutional Baseline (PCB)، وGCN، وFashionGraph، وSwin Transformer، وCLIP، وTopology Feature Histogram with Color and Texture Fusion، وAttention-Guided Cascade Network، وMMFL-Net، وFARE-RNET، والطريقة المقترحة باستخدام نفس بيانات التدريب والتحقق والاختبار.
  3. استخدم نفس حجم الصورة، وعمليات المعالجة المسبقة، وعصور التدريب (epochs)، وحجم الدفعة الفعلي (batch size)، واستعلامات التقييم، وتنفيذ المقاييس لكل طريقة.
  4. احتفظ بالتجميع المتوسط العام (global average pooling) لنموذج ResNet-50. طبق محاذاة الشرائط الأفقية في PCB. طبق رسمًا بيانيًا ثابتًا للملابس على مستوى الصورة في GCN. طبق استدلال الرسم البياني الديناميكي الموجه بالسمات في FashionGraph. استخدم مشفرات الصور القياسية لـ Swin Transformer وCLIP. نفذ Topology Feature Histogram with Color and Texture Fusion باستخدام واصفات الطوبولوجيا واللون والملمس. نفذ Attention-Guided Cascade Network باستخدام فروع الميزات العالمية والمحلية مع تحليل الملابس. نفذ MMFL-Net باستخدام فروع ميزات متعددة المقاييس ومتعددة الحبيبات. نفذ FARE-RNET باستخدام الانتباه المتبقي، واختيار الميزات، والترميز السياقي المتوسع.
  5. استخدم فقط فرع استعلام الصور لكل طريقة من طرق المقارنة. أعد تدريب كل طريقة قابلة للتدريب على بيان التدريب المشترك واختر نقطة التحقق (checkpoint) الخاصة بها من بيان التحقق المشترك. أنشئ قائمة معرض مرتبة لكل استعلام اختبار.
  6. قم بإسقاط كل تضمين مُتعلم (learned embedding) إلى 512 بُعدًا من خلال طبقة خطية قابلة للتدريب ومسجلة عندما يختلف بُعدها الأصلي. طبق تسوية L2 قبل ترتيب تشابه جيب التمام (cosine-similarity). استخدم نفس تخصيص الاستعلام-المعرض وتنفيذ المقاييس لجميع الطرق.
  7. كرر كل طريقة مقارنة باستخدام نفس البذور العشوائية الخمسة. أبلغ عن المتوسط والانحراف المعياري للعينة لكل من SCI وSDI وRecall@5 وmAP ومعامل السيلويت (silhouette coefficient). لكل مقياس، أجْرِ اختبار t المزدوج ثنائي الجانب بين الطريقة المقترحة وكل طريقة مقارنة باستخدام النتائج التي تم الحصول عليها تحت نفس البذرة العشوائية. سجل القيم الخمس على مستوى التشغيل، وإحصائية الاختبار، ودرجات الحرية، وقيمة p الدقيقة في evaluation_results/comparison_metrics.csv.
  8. احسب SCI وSDI وRecall@5 وmAP ومعامل السيلويت لكل طريقة. احفظ جميع القيم على مستوى التشغيل والقيم المجمعة في evaluation_results/comparison_metrics.csv.
  9. المخرجات المتوقعة: تأكد من أن comparison_metrics.csv يحتوي على نفس حقول المقاييس ونفس عدد التشغيلات المستقلة لكل طريقة مقارنة.
    ملاحظة: لا تغير تقسيمات البيانات، أو كود المقاييس، أو تخصيص الاستعلام-المعرض بين طرق المقارنة.
    استكشاف الأخطاء وإصلاحها: إذا أنتج نموذج المقارنة بُعد ميزة غير 512، أضف طبقة إسقاط خطية مسجلة واحدة قبل حساب المقياس وقم بتدريب تلك الطبقة مع النموذج المقابل. إذا فشل النموذج في التقارب تحت معدل التعلم المشترك، استخدم معدل التعلم المحدد في تنفيذه المنشور واحتفظ بجميع الظروف التجريبية المتبقية. سجل كل إعداد خاص بالطريقة في سجل المقارنة.

النتائج

نُفذت جميع التجارب المذكورة باستخدام بيئة الأجهزة والبرمجيات الموثقة في الجدول 2 وجدول المواد. وقد استُخدمت الإصدارات ذاتها من برنامج تشغيل الرسومات، وCUDA، وcuDNN، وPython، وNumPy، وPyTorch، وtorchvision طوال مراحل المعالجة المسبقة، والتدريب، والاستدلال، والتقييم. وتلخص الجدول 2 وجدول المواد بيئة الأجهزة والبرمجيات الكاملة. بينما يلخص الجدول 1 مجموعات بيانات التدريب والتحقق والاختبار المعالجة، إلى جانب إحصائيات الطوبولوجيا على مستوى الصورة. كما يلخص الجدول 2 الإعدادات العامة المستخدمة في جميع طرق المقارنة.

نتائج التقييم المقارن

اتبع التقييم المقارن تقسيمات البيانات الشائعة، وعمليات المعالجة المسبقة، وضوابط التدريب، وتعريفات المقاييس المحددة في أقسام البروتوكول 7-9. تقارن Table 3 بين المشفرات البصرية العامة، والنماذج المحاذية للأجزاء، وتمثيلات الملابس القائمة على الرسوم البيانية، وشبكات استرجاع الأزياء عبر النطاقات، وطرق دمج الطوبولوجيا والمظهر، وطرق الاسترجاع البصري للتجارة الإلكترونية، حيث تم تقييم جميع هذه الطرق باستخدام بروتوكول الاستعلام عن الصور نفسه. وتتكون الطرق الخاصة بالنطاق من مخطط ميزات الطوبولوجيا مع دمج اللون والملمس (TFH-CT)، والشبكة المتتالية الموجهة بالانتباه (AGC-Net)، وشبكة تعلم الميزات متعددة المقاييس ومتعددة الحبيبات (MMFL-Net)، واسترجاع الأزياء باستخدام الشبكة المتبقية مع تحسين سرب إيغريت (FARE-RNET). تم تقديم جميع مقاييس التقييم في Table 3 كمتوسط وانحراف معياري للعينة عبر خمس عمليات تشغيل مستقلة باستخدام نفس البذور العشوائية، وبيان التدريب، وبيان التحقق، وبيان الاختبار، وتعيين الاستعلام-المعرض، وتنفيذ المقياس. تم حساب قيم p- المزدوجة بشكل منفصل لكل من SCI وSDI وRecall@5 وmAP ومعامل silhouette من خلال مقارنة كل طريقة بالطريقة المقترحة تحت ظروف البذور العشوائية المتطابقة. وتوفر هذه النتائج الأساس الكمي للتصور الهيكلي، والاسترجاع، والتجميع، والتحليلات الموجهة نحو التصميم اللاحقة.

نتائج البروتوكول النموذجية وتفسيرها

يُستدل على نجاح تنفيذ البروتوكول عندما يضع الرسم البياني للمكونات على مستوى الصورة، والذي تمت إعادة بنائه من ملفات التحليل والرسم البياني المحفوظة، كل عقدة نشطة داخل منطقة الملابس المقابلة لها، ويحافظ على أنواع العلاقات المسجلة في مصفوفة التجاور المحددة، كما هو موضح في الشكل 5C. ويجب أن تظل الاستجابة المدركة للبنية مركزة على مقدمة الملابس، كما هو موضح في الشكل 5D. ويقدم الشكل 6E نتيجة استرجاع متوقعة حيث تقلل الطريقة المقترحة من تأثير الخلفية الحمراء وتسترجع ملابس الجزء العلوي من الجسم بدلاً من الأجسام الحمراء غير ذات الصلة. كما يوضح الشكل 6B–G أن ترتيب الاسترجاع مدعوم بعلاقات المكونات على مستوى الصورة وتطابق المكونات بعد الدمج. تعكس هذه النتيجة استعادة فئة الملابس العامة، على الرغم من أن طول الأكمام والطوبولوجيا المحلية لا تزال تختلف بين العينات المسترجعة.

تشمل حالات الفشل الشائعة التنشيط الذي تهيمن عليه الملامح في الشكل 5B، والاسترجاع المدفوع بلون الخلفية في الصف العلوي من الشكل 6، والتنشيط المتبقي للخلفية في الشكل 7. يجب تفسير الشكل 7 على أنه تحديد موضع جزئي لأن الاستجابة السائدة تتبع الصورة الظلية للجزء السفلي من الجسم المتضخم وحد الملابس الأيمن، بينما يظل التنشيط المتبقي في مناطق الخلفية المجاورة. ولا يُعتبر تحديد الموضع مدعومًا هيكليًا إلا عندما تحدد مصفوفة فرق الطوبولوجيا، ومصفوفة فرق العلاقة الهندسية، ورسم بياني لفرق المكونات بعد الدمج، والاستجابة المكانية مناطق ملابس متسقة. أما النقطة الساخنة المكانية التي لا يصاحبها تغيرات في المصفوفة أو المكونات فهي تشير إلى تداخل بصري بدلاً من وجود دليل هيكلي.

تُعتبر عملية تشغيل البروتوكول صالحة عندما تنتج كل صورة مقبولة خريطة احتمالات دلالية مُطبعة (normalized semantic probability map)، ومصفوفة علاقات مكونة من K من الصفوف و K من الأعمدة، ومصفوفات سمات المظهر والسمات الهيكلية مكونة من K من الصفوف و 512 عموداً، ومتجه سمات مدمج محدود مرتبط بمعرّف الصورة الصحيح. يجب أن يؤكد الفحص البصري أن الطوبولوجيا تتبع مكونات الملابس، وأن استجابة المقدمة تتجاوز استجابة الخلفية، وأن نتائج الاسترجاع يتم توجيهها بواسطة فئة الملابس وهيكلها بدلاً من لون الخلفية. وتشير خرائط الاحتمالات المجزأة، أو العقد المفقودة للمكونات، أو المصفوفات غير الرقمية، أو استجابات الخلفية المنتشرة، أو الاسترجاع الذي يهيمن عليه اللون إلى تنفيذ غير ناجح، مما يتطلب فحص عمليات التحليل (parsing)، أو بناء الرسم البياني، أو دمج السمات، أو تحميل نقاط التحقق (checkpoint loading).

التحليل البصري لاستجابات مكونات الملابس على مستوى الصورة

تقارن الشكل 5 بين الخط المرجعي لنموذج ResNet-50 والنموذج المدرك للمكونات باستخدام نفس صورة الملابس. يوضح الشكل 5B خريطة تنشيط الفئة للخط المرجعي للمظهر. ويعرض الشكل 5C رسمًا بيانيًا لمكونات الملابس على مستوى الصورة، والذي تم إعادة بنائه من خريطة الاحتمالات المقيدة بالخلفية، ومصفوفة مراكز المكونات، ومصفوفة التجاور المحددة النوع، وقناع العقد غير النشطة، وتعيين تسميات المكونات التي تم إنشاؤها في أقسام البروتوكول 3 و4. بينما يعرض الشكل 5D استجابة التنشيط للتمثيل المدمج. ولم يتم استخدام أي مقدر لوضعية الجسم البشري أو تعليقات توضيحية لمفاصل الجسم البشري لإنشاء الشكل 5C.

تركزت الاستجابة المرجعية على مناطق النسيج المحلية في قطعة الملابس السفلية ولم تتبع حدود قطعة الملابس الكاملة بشكل متسق، كما هو موضح في الشكل 5B. في الشكل 5C، تتوافق كل عقدة مع مركز منطقة مكون نشطة من قطعة الملابس، بينما يمثل كل ضلع حدود مقدمة مشتركة أو علاقة ترتيب عمودي محددة مسبقاً. يعكس الرسم البياني تنظيم مناطق قطعة الملابس ولا يمثل المفاصل التشريحية البشرية. غطت الاستجابة المدركة للبنية مقدمة قطعة الملابس الرئيسية مع الحفاظ على تنشيط منخفض في معظم مناطق الخلفية، كما هو موضح في الشكل 5D. تشير هذه النتائج إلى أن الرسم البياني للمكونات ووحدة دمج السمات قد قللا من التنشيط المهيمن عليه بالنسيج في الصورة التي تم تقييمها.

نتائج تحليل التشابه الهيكلي للملابس ومرجع التصميم

يوضح الشكل 6 ترتيب استرجاع النتائج إلى جانب الأدلة الهيكلية المستخدمة لتفسير هذا الترتيب. يسجل رسم المكونات البياني للاستعلام في الشكل 6B مناطق الملابس النشطة وعلاقاتها المحددة، بينما تكشف المصفوفة في الشكل 6C نمط العلاقات المقدم لعملية انتشار الرسم البياني. وتظل نتائج الخط الأساسي في الشكل 6D خاضعة لسيطرة إشارات المظهر الحمراء. أما النتائج المدركة للهيكل في الشكل 6E فتحافظ على فئة ملابس الجزء العلوي من الجسم عبر مختلف الألوان والخلفيات. ويسمح الرسم البياني للمكونات لأعلى نتيجة ترتيباً في الشكل 6F بإجراء مقارنة مباشرة مع الرسم البياني للاستعلام، وتكشف مصفوفة المراسلة في الشكل 6G ما إذا كانت المكونات التي تشترك في المعرفات نفسها تظل متسقة بعد الدمج الموجه هيكلياً. يجب تفسير المراسلة القطرية بالتزامن مع العقد المفقودة وعلاقات الرسم البياني المتغيرة. إن التشابه القوي في المظهر دون توافق في الرسم البياني لا يشكل استرجاعاً هيكلياً ناجحاً.

تحتفظ الملابس المسترجعة بالفئة العامة، إلا أن الاختلافات في تكوين الأكمام وعلاقات المكونات المحلية تشير إلى عدم اكتمال التطابق دقيق التفاصيل. حققت الطريقة المقترحة قيمة Recall@5 بلغت 89.2% وقيمة mAP بلغت 86.4%، كما هو موضح في الجدول 3. تصف هذه القيم الكمية أداء التصنيف، بينما يوفر الشكل 6B–G أدلة هيكلية وسيطة تدعم هذا التفسير. وبناءً على ذلك، تقتصر نتيجة الاسترجاع على تحسين مقاومة التداخل الناتج عن لون الخلفية وتنظيم أقوى للمكونات على مستوى الصورة في ظل الاستعلام المختبر.

الاستجابة للاختلافات الهيكلية ودعم تحليل التصميم

الخريطة الحرارية لصافي استجابة الفرق في الشكل 7H يظهر أن الاستجابة السائدة تتركز على المخطط الخارجي المتضخم للجزء السفلي من الجسم والحد الأيمن لملابس الصورة المستهدفة. أما التراكب في الشكل 7I يُظهر أن أقوى استجابة تظل متوافقة مع مقدمة الملابس الرئيسية، بينما تظل الاستثارة الأضعف في مناطق الستارة والجدار المجاورة بمثابة تداخل خلفي متبقٍ. ويجب تفسير الاستجابة المكانية بالاقتران مع الرسم البياني للمكونات وأدلة المصفوفة المعروضة في الأشكال 7ج-زتُعتبر الاستجابة فرقاً هيكلياً صالحاً فقط عندما تكون منطقة الملابس ذات الاستجابة العالية متوافقة مع التغير في التجاور، والتغير في العلاقة الهندسية، ونمط المسافة بين المكونات بعد الدمج.

يتم قبول الاختلاف الهيكلي فقط عندما يكون التغير في التجاور المكتوب في الشكل 7E أو التغير في العلاقة الهندسية في الشكل 7F مصحوباً بزيادة في مسافة المكون في الشكل 7G واستجابة مكانية محاذية للمقدمة في الشكل 7H،I. وتستوفي منطقة الجزء السفلي من الجسم المتوسعة وحدود الملابس اليمنى هذا المعيار عبر المراحل. أما التنشيط فوق الستارة والجدار فلا يتوافق مع تغيرات في عقد المكونات، أو أنماط العلاقات، أو مسافات المكونات المدمجة، وبالتالي يتم رفضه باعتباره تداخلاً متبقياً غير هيكلي. وتدعم هذه النتيجة تحديد موقع الاختلاف على مستوى الصورة، ولكنها لا تثبت وجود تباين في أنماط الخياطة أو معاملات التصنيع.

تحليل التوزيع المكاني للميزات وتحليل العناقيد الهيكلية

يكشف تحليل توزيع فضاء الميزات الكامن عن قدرة النموذج على التمييز بين الدلالات الهيكلية للملابس. يبحث هذا التحليل فيما إذا كان المسبق الهيكلي ينظم الملابس ذات التكوينات الطوبولوجية المختلفة في منوعات ميزات متميزة. تم اختيار خمس فئات هيكلية تمثيلية من مجموعة الاختبار، وهي: القمصان ذات الأكمام القصيرة، والسراويل، والتنانير، والمعاطف الطويلة، والفساتين. تم إسقاط متجهات الميزات عالية الأبعاد على مستوى ثنائي الأبعاد باستخدام تقنية تضمين الجوار العشوائي الموزع t (t-SNE). كما تم تقييم تماسك العينات المتشابهة وانفصال العينات غير المتشابهة لتوصيف تنظيم الدلالات الهيكلية في فضاء الميزات. يظهر توزيع t-SNE لفضاء الميزات المدرك للهيكل في الشكل 8.

شكّل إسقاط t-SNE خمس مناطق ميزات رئيسية مع تداخل محدود بين الفئات المجاورة، كما هو موضح في الشكل 8A. وتظهر العينات التمثيلية المقابلة لمناطق الفئات الخمس في الشكل 8B. ويعكس مؤشر SCI البالغ 0.81 مدى تماسك العينات التي تشترك في نفس التسمية الهيكلية، بينما يعكس مؤشر SDI البالغ 0.71 درجة الفصل بين العينات ذات التسميات الهيكلية المختلفة، كما ورد في الجدول 3 وتم تصويره في الشكل 8. يجب تفسير هذه المؤشرات كمقاييس لتوزيع فضاء الميزات ولا تحدد بشكل مباشر معدل الإنذارات الكاذبة. وقد شغلت القمصان ذات الأكمام القصيرة والتنانير مناطق رئيسية مختلفة في فضاء الميزات المسقط، بينما ظل عدد صغير من العينات بالقرب من حدود الفئات المجاورة، كما هو موضح في الشكل 8A. كما أظهرت السراويل والفساتين فصلاً واضحاً عن الفئات المجاورة. ويشير هذا التوزيع إلى أن المسبق الرسومي (graph prior) ساهم في التنظيم الهيكلي على مستوى الفئة دون إحداث فصل تام للعناقيد. يفصل التقييم بين جودة التمثيل وفعالية الاسترجاع؛ حيث يقيم SCI ما إذا كانت الملابس التي تشترك في نفس التسمية الهيكلية تظل متماسكة في فضاء الميزات المكتسب، بينما يقيم SDI ما إذا كانت الملابس ذات التسميات الهيكلية المختلفة تظل منفصلة. وتتوافق هذه المقاييس مع هدف التمثيل الهيكلي للبروتوكول. أما Recall@5 فيقيس ما إذا كانت قطعة الملابس ذات الصلة هيكلياً تظهر ضمن أول خمس نتائج مسترجعة، بينما يقيس mAP جودة التصنيف عبر جميع عينات المعرض ذات الصلة. وتتوافق هذه المقاييس مع هدف استرجاع المراجع التصميمية. وقد استُخدم معامل الصورة الظلية (silhouette coefficient) لتقييم أداء التجميع فقط لأن SCI وSDI يصفان بالفعل تنظيم فضاء الميزات.

الشكل 9 يوضح النتائج الخام لخمس تجارب لأربع طرق تمثيلية دون إجراء تسوية مشتركة بين الطرق. يعرض الشكل 9A مؤشري SCI وSDI بمقياسهما الأصلي، بينما يعرض الشكل 9B مقياسي Recall@5 وmAP كنسب مئوية. وتُظهر علامات التشغيل الفردية وخطوط خطأ الانحراف المعياري التباين المرتبط بتدريب النموذج بدلاً من مجرد التصنيف الإجمالي. حقق الخط المرجعي المعتمد على المظهر قيمة SCI بلغت 0.62، بينما حققت الطريقة المقترحة قيمة SCI بلغت 0.81 وقيمة SDI بلغت 0.71 (الجدول 3 والشكل 9A). وتشير نتائج SCI وSDI إلى تماسك أقوى داخل التصنيف الواحد وفصل أوضح بين التصنيفات المختلفة في ظل الإعدادات التي تم تقييمها. كما حققت الطريقة المقترحة قيمة Recall@5 بلغت 89.2% وقيمة mAP بلغت 86.4% (الجدول 3 والشكل 9B). وتقيم مقاييس الاسترجاع هذه خصائص تصنيف مختلفة ويتم تفسيرها بشكل منفصل عن SCI وSDI. ويشير الترتيب المتسق للطرق عبر المقاييس الأربعة إلى وجود توافق بين جودة التمثيل وأداء الاسترجاع، ولكن هذا لا يعني أن التحسن النسبي متماثل عبر أبعاد التقييم الأربعة.

تجارب الاستئصال وتحليل فعالية الوحدات الهيكلية

تقارن تجربة الاستئصال (ablation experiment) النموذج الكامل مع متغيرات تم فيها إزالة المسبق الهيكلي (structural prior) أو وحدة الدمج (fusion module). تستخدم جميع التكوينات الثلاثة نفس الصور المرجعية والمستهدفة، مما يسمح بمقارنة مباشرة لاستجابة الخلفية وتركيز التوطين. يقوم المتغير الخالي من المسبق الهيكلي بإزالة رسم بياني لمكونات الملابس على مستوى الصورة وقيود العلاقات الخاصة به، مع الاعتماد فقط على العمود الفقري التلافيفي لاستخراج ميزات المظهر؛ أما المتغير غير المدمج فيحتفظ باستدلال الرسم البياني ولكنه يزيل الهرم الميزاتي، مستخدماً الميزات الدلالية عالية المستوى فقط. وتكشف خرائط الحرارة للفروق المرئية عن الأدوار المحددة لكل وحدة في كبح الضجيج وتحديد الحدود؛ ويظهر مقارنة نوعية لاستجابات الفرق الهيكلي في ظل تكوينات الوحدات المختلفة في الشكل 10.

تم تقديم خرائط الاستجابة في الشكل 10C–E باستخدام مقياس استجابة مشترك وإعدادات تراكب متطابقة. أنتج المتغير الخالي من البنية المسبقة (structure prior) تنشيطاً قوياً في الخلفية اليسرى وحول المناطق البيئية غير ذات الصلة، كما هو موضح في الشكل 10C. أما المتغير الخالي من وحدة الدمج (fusion module)، فقد قلل جزءاً من تلك الاستجابة الخارجة عن حدود الملابس، ولكنه ظل يحتفظ بانتشار أوسع فوق الجزء السفلي من الملابس والمنطقة المحيطة بالجانب الأيمن، كما هو موضح في الشكل 10D. وعلاوة على ذلك، قام النموذج الكامل بتقليص الاستجابة السائدة نحو المقدمة الرئيسية للملابس، كما هو موضح في الشكل 10E. ويقوم الشكل 10F بتصور مباشر للفرق في الاستجابات المقتصرة على المقدمة بين المتغير غير المدمج والنموذج الكامل، مما يظهر أن النموذج الكامل يثبط الانتشار الجانبي المتبقي مع الحفاظ على الاستجابة الرئيسية المتوافقة مع الملابس. وتشير هذه النتائج إلى أن البنية المسبقة قللت بشكل أساسي من الضوضاء البيئية، وأن وحدة الدمج حسنت بشكل أكبر من تركيز الاستجابة والمحاذاة الهيكلية. يمثل الشكل 10E تحسناً نسبياً وليس إزالة كاملة لتنشيط الخلفية.

الجدول 4 يوضح قيم SCI و SDI و Recall@5 للمتغيرات بدون المسبق الهيكلي (structure prior)، وبدون وحدة الدمج (fusion module)، ومع النموذج الكامل. أدىت إزالة المسبق الهيكلي إلى خفض SCI من 0.81 إلى 0.65 وخفض Recall@5 من 89.2% إلى 74.5%. بينما أدت إزالة وحدة الدمج إلى خفض SDI من 0.71 إلى 0.64 وخفض Recall@5 من 89.2% إلى 85.1%، وهو انخفاض قدره 4.1 نقطة مئوية. وتشير هذه النتائج إلى أن المسبق الهيكلي كان له تأثير أكبر على الاتساق الهيكلي والاسترجاع، بينما أدى دمج الميزات إلى تحسين المحاذاة بين معلومات المظهر والمعلومات الهيكلية.

يقارن تحليل الكفاءة بين التكلفة الحسابية للنموذج الكامل والنموذج المرجعي ResNet-50. تطلب النموذج المرجعي ResNet-50 نحو 25.6 مليون معلمة و4.1 مليار عملية نقطة عائمة. بينما تطلب النموذج الكامل المدرك للبنية 29.3 مليون معلمة و5.4 مليار عملية نقطة عائمة. وكان متوسط وقت الاستدلال 15 مللي ثانية لكل صورة للنموذج المرجعي و22 مللي ثانية لكل صورة للنموذج الكامل، أي بزيادة قدرها 7 مللي ثانية. تشير هذه النتيجة إلى وجود تكلفة حسابية ملموسة يجب مراعاتها عند تطبيق البروتوكول في سير العمل الحساس للوقت (الجدول 5)). تم تحديد وزن القيد البنيوي من مجموعة التحقق قبل تقييم الاختبار النهائي. وفُحص معدل الاستدعاء Validation Recall@5 عند أوزان قيد بنيوي بلغت 0.1، 0.3، 0.5، 0.8، 1.0، 1.2، 1.5، و2.0. وقد تم تثبيت وزن 1.0 لكل عملية تدريب واختبار لاحقة. ويوضح الشكل 11 عملية اختيار وزن القيد البنيوي 1.0 بناءً على التحقق.

مخطط التعلم العميق الذي يوضح مسار معالجة الصور القائم على الشبكات العصبونية التلافيفية (CNN) مع وحدة دمج واستخراج الميزات لمهام اتساق البنية والتمييز.
الشكل 1: سير العمل العام لبروتوكول تعلم ميزات صور الملابس المدركة للبنية. تتم معالجة صورة الملابس المدخلة بواسطة فرع ميزات المظهر وفرع ميزات بنيوية يستخدم التحليل الدلالي ونمذجة الرسوم البيانية المكانية. وتتم معالجة هذين التمثيلين بواسطة وحدة الدمج الموجهة بنيويًا لإنتاج الميزة النهائية المدركة للبنية. وتعمل خسارة الاتساق البنيوي، وخسارة التمييز البنيوي، وخسارة العلاقة البنيوية مجتمعين على تقييد حيز الميزات. يوضح الشكل كيفية دمج مظهر الملابس وطوبولوجيا المكونات طوال عملية تعلم الميزات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

عملية تقسيم الملابس؛ مخطط لتقسيم المناطق وعقد الشبكة التي توضح الاتصالات.
الشكل 2: بناء طوبولوجيا مسبقة لمكونات الملابس على مستوى الصورة. (A) صورة الملابس المدخلة I. (B) خريطة المكونات المرئية المقيدة بالمقدمة P، حيث تشير سبعة ألوان إلى مناطق الملابس على مستوى الصورة. يتم استبعاد جميع بكسلات الخلفية من قنوات المكونات. (C) مخطط علاقات المكونات على مستوى الصورة G. تمثل العقد مناطق الملابس المرئية، وتمثل الحواف المتصلة الحدود المشتركة في المقدمة، بينما تمثل العلاقات المتقطعة الترتيب الرأسي المحدد مسبقاً. تدعم الخريطة والمخطط استرجاع الصور ومقارنة البنية المرئية. وهي لا تمثل قطع أنماط الخياطة، أو هندسة طبقات الخياطة، أو هياكل الثنيات، أو معايير التدرج، أو تعليمات القص. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

مخطط دمج السمات مع التعيين الخطي، ودالة التنشيط، واتصالات وزن الهيكل.
الشكل 3: وحدة دمج السمات الموجهة بالهيكل. يتم تحويل السمات الهيكلية عن طريق التعيين الخطي ودالة التنشيط Ψ لإنتاج وزن هيكلي. يقوم الوزن الهيكلي بتعديل سمات المظهر من خلال الضرب العنصري. يتم دمج سمات المظهر المعدلة والسمات الهيكلية وإسقاطهما بواسطة Wc، وبعد ذلك تُضاف السمة الهيكلية المتبقية لإنتاج سمة المكون النهائية. يوضح الشكل أن المعلومات الهيكلية تنظم وزن سمات المظهر قبل الدمج النهائي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

مخطط تكييف النطاق مع عمليات دفع الفئة A إلى B، و L_sc، و L_sd، و L_fr في طريقة البحث.
الشكل 4: تحسين فضاء الميزات تحت قيود الاتساق الهيكلي. (أ) يتم تقريب العينات التي تنتمي إلى نفس الفئة الهيكلية من خلال فقدان اتساق الهيكل، بينما يتم الحفاظ على العلاقات بين مكوناتها الداخلية بواسطة فقدان علاقة الهيكل. (ب) يتم دفع العينات من الفئات الهيكلية المختلفة بعيدًا عن بعضها البعض بواسطة فقدان تمييز الهيكل. يوضح الشكل كيف تزيد الأهداف الهيكلية الثلاثة بشكل مشترك من تماسك العينات داخل الفئة الواحدة والتباعد بين الفئات المختلفة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تحليل التوازن الساكن، مخطط خريطة حرارية لتوزيع الإجهاد الهيكلي، دراسة في الميكانيكا الحيوية.
الشكل 5: استجابات ممثلة لميزات الملابس وتصور الرسم البياني للمكونات. (A) صورة الملابس المدخلة. (B) استجابة تنشيط الفئة لنموذج ResNet-50 المرجعي للمظهر. (C) تم إعادة بناء الرسم البياني لمكونات الملابس على مستوى الصورة من خريطة المكونات المقيدة بالمقدمة، ومصفوفة مراكز المكونات، ومصفوفة التجاور المحددة النوع، وقناع العقد غير النشطة، وتعيين تسميات المكونات، والتي تم حفظها خلال أقسام البروتوكول 3 و4. تشير العقد إلى مناطق الملابس النشطة، وتدل الحواف المتصلة على حدود المقدمة المشتركة، بينما تشير الحواف المتقطعة إلى علاقات الترتيب الرأسي المحددة مسبقاً. (D) استجابة التنشيط للتمثيل المدمج المدرك للمكونات. تُظهر المقارنة الفرق بين التنشيط الذي يهيمن عليه النسيج والتنشيط الموجه بمناطق الملابس. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تحليل صورة الاستعلام باستخدام رسم بياني للمكونات، ومصفوفة التجاور، وأفضل نتائج الاسترجاع؛ طرق مدركة للبنية.
الشكل 6: نتائج الاسترجاع والأدلة البنيوية الوسيطة في ظل تداخل الخلفية الحمراء. (A) صورة الاستعلام. (B) تم توليد الرسم البياني لمكونات الاستعلام من مراكز المكونات المحفوظة ومصفوفة التجاور المحددة النوع. (C) مصفوفة التجاور المحددة النوع للاستعلام، حيث تميز قيم المصفوفة بين العلاقات غير النشطة، وحدود المقدمة المشتركة، وعلاقات الترتيب الرأسي المحددة مسبقاً. (D) أفضل ثلاث نتائج استرجاع تم إنتاجها بواسطة خط الأساس للمظهر. (E) أفضل ثلاث نتائج تم إنتاجها بواسطة التمثيل المدرك للبنية. (F) الرسم البياني للمكونات لأعلى نتيجة مرتبة وفقاً للبنية المدركة. (G) مصفوفة تطابق المكونات بعد الدمج بين الاستعلام والنتيجة الأعلى ترتيباً. يشير التطابق القطري العالي إلى الاتفاق بين المكونات ذات المعرفات نفسها، بينما تشير الاستجابات الضعيفة أو المزاحة إلى تنظيم مكونات مفقود أو غير متطابق. تحافظ نتائج الاسترجاع على فئة الجزء العلوي من الجسم بشكل تقريبي ولكنها لا تحقق اتفاقاً كاملاً في تكوين الأكمام والطوبولوجيا المحلية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تحليل الفرق في الأجسام المرئية؛ توضح الرسوم البيانية والخرائط الحرارية الفروق المكانية وفروق المكونات في الصور.
الشكل 7: تتبع الفرق الهيكلي من طوبولوجيا الملابس على مستوى الصورة إلى الاستجابة المكانية. (A) الصورة المرجعية. (B) الصورة المستهدفة. (C) الرسم البياني للمكونات المرجعية. (D) الرسم البياني للمكونات المستهدفة. تم إعادة بناء كلا الرسمين البيانيين من مراكز المكونات المحفوظة ومصفوفات التجاور المحددة. (E) مصفوفة الفرق في التجاور المحدد. (F) يتم اشتقاق الفرق في العلاقة الهندسية من إزاحة مركز المكون، والتشتت المكاني، والتغيرات في وزن العلاقة. (G) الرسم البياني لفرق المكونات بعد الدمج، حيث تمثل كثافة العقدة المسافة المعيارية بين متجهات المكونات المدمجة المقابلة، ويمثل عرض الحافة التغير في وزن العلاقة. (H) تم إنشاء الخريطة الحرارية لاستجابة الفرق المكاني الصرف باستخدام نفس مقياس الاستجابة الثابت المستخدم في التراكب. (I) الاستجابة المتراكبة على الصورة المستهدفة. يتم قبول الفرق الهيكلي فقط عندما يظل التغير في التجاور، والتغير في العلاقة الهندسية، والتغير في مسافة المكون، والاستجابة الحرارية المحاذية للمقدمة متسقين. ويتم التعامل مع تنشيط الخلفية دون وجود دليل مقابل على المكونات أو العلاقات على أنه تداخل متبقٍ وليس فرقاً صالحاً في هيكل الملابس. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

مخطط توزيع الميزات، تصنيف هيكلي خاضع للإشراف؛ تجميع عناصر الموضة؛ فئات الملابس.
الشكل 8: تجميع فضاء الميزات المدرك للهيكل. (A) إسقاط t-SNE للقمصان ذات الأكمام القصيرة، والسراويل، والتنانير، والمعاطف الطويلة، والفساتين. تشكل الفئات الخمس مناطق ميزات رئيسية مع تداخل محدود بالقرب من الحدود الفاصلة بينها. (B) صور اختبار تمثيلية مُخصصة لفئات الملابس الخمس، حيث يتوافق لون الإطار مع لون الفئة في (A). يوضح الشكل التنظيم الهيكلي على مستوى الفئة مع الاحتفاظ بعدد صغير من العينات بالقرب من مناطق الفئات المتجاورة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

مقارنة لأداء النموذج في رسوم بيانية؛ تحليل مقاييس SCI/SDI ونسب Recall@mAP.
الشكل 9: مقارنة الأداء الخام عبر بنية فضاء الميزات وأهداف تصنيف الاسترجاع. (A) قيم SCI وSDI لكل من الخط المرجعي الموجه بالمظهر، ونموذج البنية الضعيفة، ونموذج البنية الصريحة، والطريقة المقترحة. (B) قيم Recall@5 وmAP للطرق الأربع نفسها. تشير العلامات الكبيرة إلى المتوسط الحسابي عبر خمس عمليات تشغيل مستقلة، وتشير خطوط الخطأ إلى الانحراف المعياري للعينة، بينما تشير العلامات الصغيرة إلى نتائج كل عملية تشغيل على حدة. يتم عرض SCI وSDI على مقياس ثابت من صفر إلى واحد، بينما يتم عرض Recall@5 وmAP على مقياس نسبة مئوية ثابت من صفر إلى مائة. لم يتم تطبيق أي تسوية min-max أو إعادة تحجيم عبر الطرق. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تصوير لوني لامرأة تعزف على آلة تقليدية، يبرز مناطق التركيز، مخطط.
الشكل 10: استجابات الفرق الهيكلي تحت تكوينات مختلفة للنماذج. (A) الصورة المرجعية. (B) الصورة المستهدفة. (C) استجابة المتغير الخالي من المسبق الهيكلي. (D) استجابة المتغير الخالي من وحدة الدمج. (E) استجابة النموذج الكامل. (C–E) تم عرضها باستخدام نفس مقياس الاستجابة الموحد، وخريطة الألوان، وإعدادات التراكب. (F) فرق الاستجابة المطلق المقيد بالمقدمة بين المتغير غير المدمج والنموذج الكامل. يحافظ النموذج الكامل على الاستجابة الرئيسية المحاذية للملابس مع تقليل الانتشار المتبقي خارج المنطقة الهيكلية الرئيسية. وتظهر المقارنة أن المسبق الهيكلي يقلل من التداخل خارج نطاق الملابس، وأن وحدة الدمج تزيد من حدة الاستجابة الهيكلية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

رسم بياني لوزن القيد الهيكلي مقابل استدعاء التحقق، λ=1.0 هي القيمة المثلى؛ مخطط تحليل البيانات.
الشكل 11: اختيار وزن القيد الهيكلي بناءً على التحقق. تم تسجيل استدعاء التحقق Validation Recall@5 عند أوزان للقيد الهيكلي بلغت 0.1، 0.3، 0.5، 0.8، 1.0، 1.2، 1.5، و2.0. تمثل كل نقطة المتوسط الحسابي لخمس جولات من التحقق، ويمثل كل خط خطأ الانحراف المعياري للعينة. تم تثبيت الوزن عند 1.0 قبل تقييم الاختبار النهائي. يوثق هذا الشكل إجراء اختيار المعلمات ولا يشكل مساهمة معمارية مستقلة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الجدول 1: توزيع مجموعة البيانات وإحصائيات الطوبولوجيا على مستوى الصور عبر المجموعات الفرعية للملابس من S1 إلى S5. يوضح الجدول أعداد صور التدريب، والتحقق، والاختبار، والعدد الإجمالي للصور، جنباً إلى جنب مع متوسط عدد المكونات الدلالية، وعدد العقد النشطة، وعدد الحواف المحددة النوع، وعدد المعالم المحددة على مستوى مستوى الصورة لكل مستوى هيكلي. جميع القيم مستمدة من بيانات بيان البيانات المعالجة. تم الحصول على أعداد صور التدريب والتحقق والاختبار من البيانات النهائية للمجموعات الفرعية بعد المراجعة الهيكلية، والتحكم في مجموعات التكرار، وفحص التسريب، بينما تم حساب إحصائيات الطوبولوجيا من سجلات الرسم البياني النهائية باستخدام نفس ترتيب المكونات وتعريفات العلاقات المطبقة أثناء تقييم النموذج. يرجى النقر هنا لتنزيل هذا الملف.

الجدول 2: بيئة الحوسبة، وتكوين المدخلات، والتعزيز، والتمثيل، والتحسين، والخسارة، وإعدادات إمكانية التكرار المستخدمة في البروتوكول. يوضح الجدول الإصدارات الدقيقة لنظام التشغيل، والمعالج، والذاكرة المثبتة، ووحدة معالجة الرسوميات، وذاكرة الرسوميات، وبرنامج تشغيل الرسوميات، وCUDA، وcuDNN، وPython، وNumPy، وPyTorch، وtorchvision، بالإضافة إلى حجم الصورة، وبناء الدفعة، والمحسن، وجدول معدل التعلم، وعدد الدورات، والبذور العشوائية، وأبعاد التمثيل، وأوزان الهدف الهيكلي. كل قيمة مرتبطة بملف software_versions.txt، أو configs/protocol.yaml، أو سجل التدريب المقابل. يرجى النقر هنا لتنزيل هذا الملف.

الجدول 3: مقارنة كمية بين نماذج التمثيل المرئي العام، ونماذج الملابس القائمة على الرسوم البيانية، وطرق استرجاع الأزياء الخاصة بالمجال. يوضح الجدول تركيز الاسترجاع، ونمط الاستعلام، وSCI، وSDI، وRecall@5، وmAP، ومعامل الصورة الظلية لإحدى عشرة طريقة تحت نفس تقسيمات البيانات وبروتوكول التقييم. يتم تقديم كل مقياس كمتوسط وانحراف معياري للعينة عبر خمس عمليات تشغيل مستقلة. تم الحصول على قيم p المذكورة من اختبارات t المزدوجة ثنائية الجانب التي تقارن كل طريقة مقارنة بالطريقة المقترحة، باستخدام النتائج الناتجة تحت نفس البذور العشوائية الخمسة. تُعامل الطريقة المقترحة كصف مرجعي. يرجى النقر هنا لتحميل هذا الملف.

الجدول 4: نتائج الاستئصال لوحدة البنية المسبقة ووحدة دمج الميزات. يوضح الجدول قيم SCI وSDI وRecall@5 للمتغير الخالي من البنية المسبقة، والمتغير الخالي من وحدة الدمج، والنموذج الكامل. يؤدي إزالة البنية المسبقة إلى انخفاض أكبر في SCI وRecall@5، بينما تؤدي إزالة وحدة الدمج إلى تقليل SDI ومحاذاة الاستجابة. ويسجل النموذج الكامل أعلى قيمة لجميع المقاييس الثلاثة. يرجى النقر هنا لتنزيل هذا الملف.

الجدول 5: الكفاءة الحسابية للنموذج المرجعي ResNet-50 والنموذج الكامل المدرك للبنية. يوضح الجدول المعلمات القابلة للتدريب، وعمليات الفاصلة العائمة لكل صورة، ومتوسط وقت الاستدلال لكل صورة في ظل بيئة الأجهزة والبرمجيات المحددة بدقة في الجدول 2 وجدول المواد. يستخدم كلا النموذجين نفس دقة الصورة، وإعدادات دفعة الاستدلال، وعمليات المعالجة المسبقة، وإجراء التوقيت. يضيف النموذج الكامل 3.7 مليون معلمة، و1.3 مليار عملية فاصلة عائمة، و7 ميلي ثانية من وقت الاستدلال لكل صورة مقارنة بالنموذج المرجعي. يرجى النقر هنا لتحميل هذا الملف.

المناقشة

تعد مراحل البروتوكول الأكثر أهمية هي المعالجة المسبقة للحفاظ على الملابس، وتحليل المكونات الدلالية المقيد بالمقدمة. ويتم اشتقاق مراكز المكونات، وقيم التشتت المكاني، وعلاقات الحدود المشتركة، وعلاقات الترتيب الرأسي، وأوزان العلاقات، والتمثيلات المدمجة، جميعها من مخرجات التحليل. أما تسرب الحدود، ومناطق المكونات المدمجة، ومناطق المكونات المفقودة، وتعيينات القنوات غير الصحيحة، فإنها تنتقل عبر بناء المخطط ودمج الميزات. وقد تؤدي هذه الأخطاء إلى إنتاج ملفات مخططات بأبعاد صحيحة، بينما تظل علاقات المكونات الممثلة غير متوافقة مع قطعة الملابس الأصلية. لذا، يجب التحقق من خريطة الاحتمالية، والتقييد بالمقدمة، ومعاينة المكونات، وسجل جودة التحليل قبل قبول المسبق الهيكلي.

يتطلب بناء الرسم البياني ودمج الميزات ترتيباً ثابتاً للمكونات الدلالية. ويُشتق الرسم البياني من مكونات الملابس في المقدمة وعلاقاتها على مستوى مستوي الصورة. وتعرض أشكال الاسترجاع وتحديد موقع الاختلاف مسار المعالجة الهيكلية بدلاً من عرض الصور المصنفة النهائية أو الخرائط الحرارية للاستجابة فقط. وتوثق مصفوفات الجوار المحددة علاقات المكونات المنفصلة، بينما توثق مصفوفات العلاقات الهندسية التنظيم المكاني الموحد، وتوثق مصفوفات المكونات ما بعد الدمج التمثيل المستخدم للاسترجاع وتحديد الموقع. ولا ينبغي قبول الاستنتاجات الهيكلية إلا عندما تتوافق هذه التمثيلات الوسيطة مع المخرج المرئي النهائي. لا يستخدم الرسم البياني للمكونات المعالم التشريحية، أو إحداثيات المفاصل البشرية، أو شبكة تقدير الوضعية. ولا ينبغي قبول تراكب الرسم البياني إلا عندما يتم إعادة إنتاج عقده وأنواع علاقاته من ملفات المكونات والجوار المحفوظة. ويجب أن تظل المكونات غير النشطة كمتجهات صفرية مع مؤشرات العقد غير النشطة، كما يجب أن تحتوي مصفوفات ميزات المظهر والميزات الهيكلية كل منها على K من الصفوف و 512 عموداً قبل عملية الدمج. وتمنع هذه التحققات تفسير عدم محاذاة العقد وأخطاء الأبعاد على أنها سلوك للنموذج.

يجب أن يبدأ استكشاف الأخطاء وإصلاحها عند أول مخرجات وسيطة غير صالحة. تشير خرائط الاحتمالية الموحدة إلى أخطاء في نقطة التحقق، أو التطبيع، أو فهرس الفئة؛ وتشير المصفوفات الهيكلية غير الرقمية إلى مقامات احتمالية غير صالحة أو قياسات إحداثيات خاطئة؛ كما تشير الاستجابات المنتشرة والاسترجاع الذي يهيمن عليه اللون إلى ضعف الأولويات الهيكلية، أو فشل الدمج، أو تحميل نقطة تحقق غير صحيحة. يجب أن تؤكد سجلات التدريب وجود التدرجات في الرسم البياني وطبقات الدمج، بالإضافة إلى اختيار نقطة التحقق بناءً على التحقق من الصحة. لا ينبغي استخدام استجابة الحرارة المرئية كاستنتاج هيكلي مستقل، بل يجب مراجعتها مقابل قناع المقدمة المحفوظ، وتغيير المجاورة المكتوب، ومصفوفة العلاقات الهندسية، ورسم بياني لفروق المكونات بعد الدمج. يشير التنشيط المتبقي خارج مقدمة الملابس إلى محدودية خصوصية الاستجابة بدلاً من وجود فرق هيكلي مثبت.

بالمقارنة مع الاسترجاع القائم على المظهر، يقدم هذا البروتوكول توبولوجيا المكونات قبل تعلم المقياس. وبالمقارنة مع القيود الهيكلية الضعيفة ونماذج الرسوم البيانية ذات التوبولوجيا الثابتة، تعمل أوزان العلاقات الدلالية على تكييف انتشار الرسم البياني مع قطعة الملابس الحالية. حقق النموذج الكامل معامل SCI قدره 0.81، ومعامل SDI قدره 0.71، وRecall@5 بنسبة 89.2%، وmAP بنسبة 86.4%، ومعامل silhouette قدره 0.74، كما هو موضح في الجدول 3. أدت الوحدات الهيكلية الإضافية إلى زيادة عدد المعلمات من 25.6 مليون إلى 29.3 مليون، وزيادة وقت الاستدلال من 15 إلى 22 ميلي ثانية لكل صورة، كما هو موضح في الجدول 4. وتكمن المساهمة التقنية لهذا البروتوكول في بناء رسم بياني لمكونات الملابس على مستوى الصورة، والترميز المتوازي للمظهر وعلاقات المكونات، وآلية دمج الميزات الموجهة هيكلياً، وأهداف الاتساق الهيكلي والعلاقة والتمييز. أما مسح التحقق المذكور في الشكل 11 فيهدف فقط إلى تحديد معامل تدريب ثابت، ولا يتم تقديمه كمساهمة في بنية الشبكة أو تصميم دالة الهدف.

يظل البروتوكول حساساً تجاه حالات الانسداد الشديد، والملابس المتداخلة، وصور المصدر الصغيرة، وتنوع الوضعيات، والخلفيات المعقدة، والملابس التي لا يتوافق تنظيمها المرئي مع مخطط المناطق السبع الثابت. قد تؤدي التصميمات غير المتماثلة، والطبقات القابلة للفصل، والثنيات الكثيفة، والملابس السفلية متعددة الطبقات، والمناطق الزخرفية المتداخلة إلى دمج عدة مناطق دلالية أو إدخال علاقات بين المكونات غير موجودة في تعريف الرسم البياني الحالي. قد يؤدي الانسداد إلى تثبيط مكون نشط، أو إزاحة مركز احتماليته، وإزالة علاقة حدود مشتركة صالحة. يوضح الشكل 6 استعادة فئة الجزء العلوي من الجسم بشكل تقريبي ولكن مع مطابقة غير كاملة لطوبولوجيا الأكمام، بينما تحتفظ الشكلان 7 و 10 باستجابات في مناطق الخلفية المجاورة. وتظهر هذه النتائج أن أبعاد الموتر الصالحة واتصال الرسم البياني لا يضمنان تفسيراً هيكلياً صحيحاً من الناحية الدلالية. وبناءً على ذلك، تدعم الدراسة الحالية الاسترجاع القائم على الصور، والتجميع، وتحديد مواقع الاختلاف، بدلاً من كفاءة سير عمل التصميم أو التقدير المباشر لمعايير النمط. أُجريت جميع التجارب الكمية في الدراسة الحالية على مجموعة DeepFashion2 التي تم الاحتفاظ بها وإعادة تسميتها هيكلياً. ولا تثبت النتائج الحالية المتانة عبر مجموعات بيانات مستقلة ذات تصنيفات ملابس مختلفة، أو معايير تعليق توضيحي، أو فئات ملابس ثقافية، أو مصادر صور، أو بيئات استحواذ مختلفة. قد يتطلب النقل إلى مجموعة بيانات أخرى إعادة تعيين القنوات السبع للمكونات وإعادة بناء مخطط العلاقات المحددة. لذا، فإن الاستنتاجات الواردة تقتصر على توزيع البيانات التي تم تقييمها وتعريف المكونات على مستوى الصورة.

في حدود هذه القيود، يوفر البروتوكول تسلسلاً قابلاً للتكرار من صور الملابس إلى تمثيلات مدركة للمكونات من خلال التحليل الدلالي، ونمذجة العلاقات الهندسية، والترميز ثنائي التدفق، والدمج الموجه بالبنية. ستستخدم عمليات التحقق المستقبلية مجموعات بيانات ملابس مستقلة ذات أنظمة تعليق توضيحي، وفئات ملابس، ووضعيات، وظروف خلفية مختلفة. كما ستدرس ما إذا كان تعيين المناطق السبع الحالي يتطلب توسيعاً ليشمل هياكل الملابس غير المتماثلة، والمتعددة الطبقات، والقابلة للفصل، والهياكل المرتبطة بثقافات محددة. وتظل مسودات التصميم المرسومة يدوياً، والاختلافات عبر الأقمشة، وتعديل الأنماط البارامترية اتجاهات تطبيقية منفصلة تتطلب بيانات وإجراءات تقييم خاصة بكل مهمة. كما تتطلب كفاءة الاستخدام المهني ومراجعة التصميم دراسة منفصلة وموثقة للمشاركين البشريين مع تحديد المشاركين، ومعايير التقييم، والإجراءات الإحصائية.

الإفصاحات

لا يوجد لدى المؤلفين أي تضارب في المصالح للإفصاح عنه.

شكر وتقدير

تم دعم هذا العمل من خلال الدفعة الثانية من مشاريع إصلاح التدريس الجامعي الرئيسية على مستوى المقاطعة خلال الخطة الخمسية الرابعة عشرة، وذلك بموجب المشروع المعنون "إصلاح واستكشاف تدريس «تصميم الملابس والأزياء» استناداً إلى نموذج البناء المشترك «تكامل ثلاثي، دمج ثلاثي»" (مشروع رقم JGZD2024096).

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
وحدة المعالجة المركزيةشركة إنتل (Intel Corporation)Intel Core i9-13900K، ٢٤ نواة، ٣٢ مسار معالجة، وبسرعة تصل إلى ٥.٨٠ جيجاهرتز
كوندا (Conda)Anaconda, Inc.، anaconda.comMiniconda3 23.11.0
مجموعة أدوات CUDAشركة NVIDIA، developer.nvidia.comCUDA 11.8
cuDNNشركة NVIDIA، developer.nvidia.comcuDNN 8.9.7
مجموعة بيانات DeepFashion2جامعة هونج كونج الصينية، github.com/switchablenorms/DeepFashion2الإصدار الرسمي لـ DeepFashion2، الإصدار 1.0
وحدة معالجة الرسومياتشركة NVIDIANVIDIA GeForce RTX 4090, 24 GB GDDR6X
نقطة تفتيش التحقق من التحليل الدلالي لشبكة HRNet-W48مشروع HRNet، github.com/HRNet/HRNet-Semantic-Segmentationhrnet_w48_garment_parser_7class.pth، نقطة فحص المشروع الإصدار 1.0
أوزان ResNet-50 مسبقة التدريب على ImageNetPyTorch Foundation, pytorch.orgResNet50_Weights.IMAGENET1K_V2
مكتبة Matplotlibفريق تطوير Matplotlib، matplotlib.orgالإصدار 3.8.2
NumPyمطورو NumPy، numpy.orgالإصدار 1.26.4
برنامج تشغيل رسومات NVIDIANVIDIA Corporationالإصدار 546.33
OpenCV-Pythonفريق OpenCV، opencv.orgالإصدار 4.8.1.78
نظام التشغيلشركة مايكروسوفت (Microsoft Corporation)Windows 11 Pro 23H2، 64-بت، إصدار نظام التشغيل 22631.3155
بانداز (Pandas)فريق تطوير Pandas، pandas.pydata.orgالإصدار 2.1.4
بايثونمؤسسة برمجيات بايثون (Python Software Foundation)، python.orgالإصدار 3.10.13
PyTorchPyTorch Foundation, pytorch.orgالإصدار 2.1.2 مع CUDA 11.8
PyYAMLمشروع PyYAML، pyyaml.orgالإصدار 6.0.1
scikit-learnمطورو scikit-learn، scikit-learn.orgالإصدار 1.3.2
SciPyمطورو SciPy، scipy.orgالإصدار 1.11.4
مستودع الكود المصدريأرشيف الكود المصدري التكميلي المُقدم مع المخطوطةبروتوكول طوبولوجيا الملابس، الإصدار 1.0
جهاز التخزينسامسونج للإلكترونياتSamsung 990 PRO NVMe SSD, 2 تيرابايت
ذاكرة النظامكينغستون تكنولوجي (Kingston Technology)Kingston FURY Beast DDR5, 64 جيجابايت، 2 × 32 جيجابايت، 5600 ميجاهرتز
torchvisionPyTorch Foundation, pytorch.orgالإصدار 0.16.2 مع CUDA 11.8
محطة عملمحطة عمل للتعلم العميق مصممة خصيصاًIntel Core i9-13900K، وNVIDIA GeForce RTX 4090، وذاكرة بسعة 64 جيجابايت، وقرص تخزين NVMe SSD بسعة 2 تيرابايت

المراجع

  1. Xiang Z, Zhu C, Qian M, Shen Y, Shao Y. FashionSegNet: a model for high-precision semantic segmentation of clothing images. Vis Comput. 2024;40:1711-1727. doi:10.1007/s00371-023-02881-3.
  2. Sun K, Zhang J, Zhang P, Yuan K, Li G. TsrNet: a two-stage unsupervised approach for clothing region-specific textures style transfer. J Vis Commun Image Represent. 2023;91:103778. doi:10.1016/j.jvcir.2023.103778.
  3. Yang N, Ma X. Enhanced composed fashion image retrieval with a multi-hop reasoning framework. Sci Rep. 2025;15:32217. doi:10.1038/s41598-025-17402-6.
  4. Karthika Priya D, Sathyabama B. FARE-RNET: fashion cloth retrieval via Egret Swarm Optimization-based Convolutional Attention Module integrated ResNet. Int J Comput Intell Syst. 2026;19:29. doi:10.1007/s44196-025-00979-1.
  5. Köktürk Güzel BE. Efficient image retrieval in fashion: leveraging clustering and principal component analysis for search space reduction. Erzincan Univ J Sci Technol. 2024;17:638-649. doi:10.18185/erzifbed.1500279.
  6. Zhang X, Sun H, Ma J. Research on clothing image retrieval combining topology features with color texture features. Mathematics. 2024;12:2363. doi:10.3390/math12152363.
  7. Abbas W, Zhang Z, Asim M, Chen J, Ahmad S. AI-driven precision clothing classification: revolutionizing online fashion retailing with hybrid two-objective learning. Information. 2024;15:196. doi:10.3390/info15040196.
  8. Shirkhani S, Mokayed H, Saini R, Hum YC. Study of AI-driven fashion recommender systems. SN Comput Sci. 2023;4:514. doi:10.1007/s42979-023-01932-9.
  9. Balloni E, Pietrini R, Frontoni E, Mancini A, Paolanti M. OutfitAI: shop the outfit with a deep learning-based intelligent expert system. Multimed Tools Appl. 2025;84:40195-40214. doi:10.1007/s11042-025-20753-x.
  10. Kachbal I, El Abdellaoui S. Computer vision for fashion: a systematic review of design generation, simulation, and personalized recommendations. Information. 2026;17:11. doi:10.3390/info17010011.
  11. Saranya MS, Geetha P. Cross-domain fashion cloth retrieval via novel attention-guided cascade neural network and clothing parsing. Comput Vis Image Underst. 2023;235:103777. doi:10.1016/j.cviu.2023.103777.
  12. Ning T, Gao Y, Han Y. Segmentation of ethnic clothing patterns with fusion of multiple attention mechanisms. Complex Intell Syst. 2024;10:5759-5770. doi:10.1007/s40747-024-01457-5.
  13. Jiang A, Liu L, Fu X, Liu L, Peng W. Clothing hierarchical feature representation and association learning for cross-modal fashion retrieval. J Comput Aided Des Comput Graph. 2025;37:654-667. doi:10.3724/SP.J.1089.2023-00263.
  14. An H, Lee KY, Choi Y, Park M. Conceptual framework of hybrid style in fashion image datasets for machine learning. Fash Text. 2023;10:18. doi:10.1186/s40691-023-00338-8.
  15. Adel M, Mohammed AM, Elsaid AH, Abdelatey A. Deep learning for new fashion product demand prediction: integrating visual similarity and demand correction in cold-start scenarios. Int J Data Sci Anal. 2026;22:9. doi:10.1007/s41060-025-00888-8.
  16. Tang Y, Ye D, Tao F, Du G. Enhanced group relation learning via aligned attention masking for fashion product captioning. J King Saud Univ Comput Inf Sci. 2025;37:170. doi:10.1007/s44443-025-00195-z.
  17. Lyu X, Li X, Zhang Y, Lu W. Two-stage method for clothing feature detection. Big Data Cogn Comput. 2024;8:35. doi:10.3390/bdcc8040035.
  18. Tang G, Yu F, Li H, Shi Y, Liu L, Peng T, et al. ClothSeg: semantic segmentation network with feature projection for clothing parsing. J Vis Commun Image Represent. 2023;97:103980. doi:10.1016/j.jvcir.2023.103980.
  19. Cao S, Chai W, Hao S, Zhang Y, Chen H, Wang G. DiffFashion: reference-based fashion design with structure-aware transfer by diffusion models. IEEE Trans Multimedia. 2024;26:3962-3975. doi:10.1109/TMM.2023.3318297.
  20. Hou J, Lu Y, Yang Y, Liu Z. PDN: a priori dictionary network for fashion parsing. Appl Sci. 2024;14:3509. doi:10.3390/app14083509.
  21. Moratelli N, Barraco M, Morelli D, Cornia M, Baraldi L, Cucchiara R. Fashion-oriented image captioning with external knowledge retrieval and fully attentive gates. Sensors. 2023;23:1286. doi:10.3390/s23031286.
  22. Islam T, Miron A, Liu X, Li Y. Deep learning in virtual try-on: a comprehensive survey. IEEE Access. 2024;12:29475-29502. doi:10.1109/ACCESS.2024.3368612.
  23. Yan H, Zhang H, Liu L, Zhou D, Xu X, Zhang Z, et al. Toward intelligent design: an AI-based fashion designer using generative adversarial networks aided by sketch and rendering generators. IEEE Trans Multimedia. 2023;25:2323-2338. doi:10.1109/TMM.2022.3146010.
  24. Xie Z, Zhou Z, Wang Z, Ding H, Ma L. Multi-scale spatial feature-guided cloth landmark estimation. J Comput Aided Des Comput Graph. 2022;34:1763-1771. doi:10.3724/SP.J.1089.2022.19189.
  25. Jiang J, Wu D, Deng H, Long Y, Tang W, Li X, et al. HAIGEN: towards human-AI collaboration for facilitating creativity and style generation in fashion design. Proc ACM Interact Mob Wearable Ubiquitous Technol. 2024;8:107. doi:10.1145/3678518.
  26. Danner M, Brake E, Kosel G, Kyosev Y, Rose K, Rätsch M, et al. AI-assisted pattern generator for garment design. Commun Dev Assem Text Prod. 2024;5:195-206. doi:10.25367/cdatp.2024.5.p195-206.
  27. Bao C, Zhang X, Chen J, Miao Y. MMFL-net: multi-scale and multi-granularity feature learning for cross-domain fashion retrieval. Multimed Tools Appl. 2023;82:37905-37937. doi:10.1007/s11042-022-13648-8.
  28. Yang G. Clothing design style recommendation using optimized semantic-preserved generative adversarial network. J Electr Syst. 2024;20 Suppl 3:2396-2409. doi:10.52783/jes.3064.
  29. Wang Z, Tao X, Zeng X, Xing Y, Xu Z, Bruniaux P. Design of customized garments towards sustainable fashion using 3D digital simulation and machine learning-supported human-product interactions. Int J Comput Intell Syst. 2023;16:16. doi:10.1007/s44196-023-00189-7.
  30. Wu J, Huang Y, Gao M, Gao Z, Zhao J, Zhang H, et al. A two-stream hybrid convolution-transformer network architecture for clothing-change person re-identification. IEEE Trans Multimedia. 2024;26:5326-5339. doi:10.1109/TMM.2023.3331569.
  31. Khalid M, Keming M, Hussain T. Design and implementation of clothing fashion style recommendation system using deep learning. Rom J Inf Technol Autom Control. 2021;31:123-136. doi:10.33436/v31i4y202110.
  32. Wang Y, Liu L, Fu X, Liu L. MCCP: multi-modal fashion compatibility and conditional preference model for personalized clothing recommendation. Multimed Tools Appl. 2024;83:9621-9645. doi:10.1007/s11042-023-15659-5.
  33. Ma J, Sun H, Yang D, Zhang H. Personalized fashion recommendations for diverse body shapes and local preferences with contrastive multimodal cross-attention network. ACM Trans Intell Syst Technol. 2024;15:82. doi:10.1145/3637217.
  34. Yu Z, Zhao Y, Hong B, Jin Z, Huang J, Cai D, et al. Apparel-invariant feature learning for person re-identification. IEEE Trans Multimedia. 2022;24:4482-4492. doi:10.1109/TMM.2021.3119133.
  35. Peng D, Liu R, Lu J, Zhang S. Unsupervised multi-modal modeling of fashion styles with visual attributes. Appl Soft Comput. 2022;115:108214. doi:10.1016/j.asoc.2021.108214.
  36. Mathews A, Sejal N, Venugopal KR. Analysis of content based image retrieval using deep feature extraction and similarity matching. Int J Adv Comput Sci Appl. 2022;13:646-655. doi:10.14569/IJACSA.2022.0131277.
  37. Zhang C, Ji X, Cai L. Clothing recommendation with multimodal feature fusion: price sensitivity and personalization optimization. Appl Sci. 2025;15:4591. doi:10.3390/app15084591.
  38. Zhao M, Gao S, Ma J, Zhang Z. Joint clothes image detection and search via anchor-free framework. Neural Netw. 2022;155:84-94. doi:10.1016/j.neunet.2022.08.011.
  39. Fontanini T, Ferrari C. Would your clothes look good on me? Towards transferring clothing styles with adaptive instance normalization. Sensors. 2022;22:5002. doi:10.3390/s22135002.
  40. Kim S, Moon H, Oh J, Lee Y, Kwon H, Kim S. Automatic measurements of garment sizes using computer vision deep learning models and point cloud data. Appl Sci. 2022;12:5286. doi:10.3390/app12105286.
  41. Chang YH, Zhang YY. Deep learning for clothing style recognition using YOLOv5. Micromachines. 2022;13:1678. doi:10.3390/mi13101678.
  42. de Medeiros Dantas IJ, Curth M, Freire AG. Exploring databases for training models in machine learning in the fashion industry. DAT J. 2024;9:157-174. doi:10.29147/datjournal.v9i2.877.
  43. Zhu S, Zou X, Qian J, Wong WK. Learning structured relation embeddings for fine-grained fashion attribute recognition. IEEE Trans Multimedia. 2024;26:1652-1664. doi:10.1109/TMM.2023.3284593.

إعادة الطباعة والأذونات

الوسوم

استرجاع صور الملابسالاتساق الهيكليصور DeepFashion2تحليل HRNet-W48ترميز ResNet-50الالتفاف المخططيالمقارنة الهيكليةتحديد موقع الاختلاف