כל הניסויים שדווחו בוצעו באמצעות סביבת החומרה והתוכנה המתועדת בטבלה 2 ובטבלת החומרים. אותן גרסאות של מנהל התקן הגרפי, CUDA, cuDNN, Python, NumPy, PyTorch ו-torchvision שימשו לאורך כל שלבי העיבוד המקדים, האימון, ההסקה וההערכה. סביבת החומרה והתוכנה המלאה מסוכמת בטבלה 2 ובטבלת החומרים. טבלה 1 מסכמת את מערכי נתוני האימון, האימות והבדיקה המעובדים יחד עם סטטיסטיקות טופולוגיות ברמת התמונה. טבלה 2 מסכמת את התצורה המשותפת ששימשה עבור כל שיטות ההשוואה.
תוצאות הערכה השוואתית
ההערכה ההשוואית בוצעה על פי חלוקות הנתונים, פעולות עיבוד המקדמי, בקרות האימון והגדרות המדדים הנפוצות שפורטו בסעיפים 7–9 של הפרוטוקול. Table 3 משווה בין מקודדי ראייה כלליים, מודלים מיושרים לחלקים (part-aligned models), ייצוגי בגדים מבוססי גרפים, רשתות אחזור אופנה בין-דומיינים, שיטות היתוך של טופולוגיה ומראה, ושיטות אחזור חזותי של מסחר אלקטרוני, כאשר כולן הוערכו באמצעות אותו פרוטוקול שאילתת-תמונה. השיטות הספציפיות לדומיין כוללות את Topology Feature Histogram with Color and Texture Fusion (TFH-CT), Attention-Guided Cascade Network (AGC-Net), Multi-scale and Multi-granularity Feature Learning Network (MMFL-Net), ו-Fashion Retrieval using Residual Network with Egret Swarm Optimization (FARE-RNET). כל מדדי ההערכה ב-Table 3 מדווחים כממוצע וסטיית תקן של המדגם על פני חמש הרצות עצמאיות תוך שימוש באותם זרעי אקראיות (random seeds), מניפסט אימון, מניפסט תיקוף, מניפסט בדיקה, הקצאת שאילתה-גלריה ומימוש מדד. ערכי ה-p-הזוגיים חושבו בנפרד עבור SCI, SDI, Recall@5, mAP ומקדם silhouette על ידי השוואת כל שיטה לשיטה המוצעת תחת תנאי זרעי-אקראיות תואמים. תוצאות אלו מספקות את הבסיס הכמותי לניתוחי הוויזואליזציה המבנית, האחזור, הקיבוץ (clustering) והניתוחים המכוונים לעיצוב שיבואו לאחר מכן.
תוצאות פרוטוקול מייצגות ופירושן
ביצוע מוצלח של הפרוטוקול יתבטא כאשר גרף הרכיבים ברמת התמונה, המשוחזר מקובצי הניתוח והגרף השמורים, ימקם כל צומת פעיל בתוך אזור הבגד התואם לו וישמר את סוגי הקשרים המתועדים במטריצת הסמיכות המתוייגת, כפי שמוצג ב-איור 5C. התגובה המודעת למבנה צריכה להישאר מרוכזת בקדמת הבגד, כפי שמוצג ב-איור 5D. איור 6E מציג תוצאת שליפה צפויה שבה השיטה המוצעת מפחיתה את השפעת הרקע האדום ושולפת בגדי פלג גוף עליון במקום עצמים אדומים שאינם קשורים. איור 6B–G מדגים גם כי דירוג השליפה נתמך על ידי קשרי רכיבים ברמת התמונה והתאמת רכיבים לאחר מיזוג. תוצאה זו משקפת שחזור של קטגוריית הבגד הגסה, למרות שאורך השרוול והטופולוגיה המקומית עדיין משתנים בין הדגימות שנשלפו.
מקרי כישלון נפוצים כוללים את ההפעלה הנשלטת על ידי מרקם ב-איור 5B, את השליפה המונעת מצבע הרקע בשורה העליונה של איור 6, ואת הפעלת הרקע השיורית ב-איור 7. יש לפרש את איור 7 כמיקום חלקי, מכיוון שהתגובה הדומיננטית עוקבת אחר קווי המתאר המוגדלים של החלק התחתון של הגוף ואת גבול הבגד הימני, בעוד שהפעלה שיורית נשארת באזורי רקע סמוכים. המיקום נחשב נתמך מבנית רק כאשר מטריצת הפרשי הטופולוגיה, מטריצת הפרשי היחסים הגאומטריים, גרף הפרשי הרכיבים לאחר מיזוג, והתגובה המרחבית מזהים אזורי בגד עקביים. נקודה חמה מרחבית ללא שינויים תואמים במטריצה או ברכיבים מעידה על הפרעה חזותית ולא על ראיה מבנית.
הרצת פרוטוקול נחשבת לתקפה כאשר כל תמונה מקובלת מניבה מפת הסתברות סמנטית מנורמלת, מטריצת יחסים עם K שורות ו-K עמודות, מטריצות מאפייני מראה ומבנה עם K שורות ו-512 עמודות, ווקטור מאפיינים מאוחד סופי המקושר למזהה התמונה הנכון. בדיקה ויזואלית צריכה לאשר שהטופולוגיה עוקבת אחר רכיבי הבגד, שהתגובה של הרקע הקדמי עולה על התגובה של הרקע, ושתוצאות השליפה מונחות על ידי קטגוריית הבגד ומבנהו ולא על ידי צבע הרקע. מפות הסתברות מקוטעות, צמתי רכיבים חסרים, מטריצות שאינן מספריות, תגובות רקע מפוזרות או שליפה הנשלטת על ידי צבע מעידות על ביצוע לא מוצלח ומחייבות בדיקה של הניתוח (parsing), בניית הגרף, איחוד המאפיינים או טעינת נקודות הסימון (checkpoint loading).
ניתוח ויזואלי של תגובות רכיבי ביגוד ברמת התמונה
איור 5 משווה בין Baseline של ResNet-50 לבין המודל המודע לרכיבים תוך שימוש באותה תמונת בגד. איור 5B מציג את מפת הפעלת המחלקה (class activation map) עבור ה-Baseline של המראה. איור 5C מציג את גרף רכיבי הבגד ברמת התמונה ששוחזר ממפת ההסתברות המוגבלת לרקע, מטריצת מרכז הרכיבים, מטריצת סמיכות מתוייגת, מסכת צמתים לא פעילים ומיפוי תוויות רכיבים שנוצרו בסעיפים 3 ו-4 של הפרוטוקול. איור 5D מציג את תגובת ההפעלה של הייצוג הממוזג. לא נעשה שימוש במעריך תנוחת גוף אנושית או בסימון מפרקים אנושיים כדי ליצור את איור 5C.
התגובה הבסיסית התרכזה באזורי טקסטורה מקומיים בחלק התחתון של הלבוש ולא עקבה בעקביות אחר גבול הלבוש המלא, כפי שמוצג ב-איור 5B. ב-איור 5C, כל צומת תואם למרכז של אזור רכיב לבוש פעיל, בעוד שכל קשר מייצג גבול קדמה משותף או קשר סדר אנכי שהוגדר מראש. הגרף משקף את ארגון אזורי הלבוש ואינו מייצג מפרקים אנטומיים אנושיים. התגובה המודעת למבנה כיסתה את קדמת הלבוש העיקרית תוך שמירה על הפעלה נמוכה יותר ברוב אזורי הרקע, כפי שמוצג ב-איור 5D. תוצאות אלו מעידות כי גרף הרכיבים ומודול היתוך התכונות הפחיתו את ההפעלה השלטה של הטקסטורה בתמונה שנבדקה.
ניתוח דמיון מבני של ביגוד ותוצאות ייחוס לעיצוב
איור 6 מציג את דירוג השליפה יחד עם הראיות המבניות ששימשו לפירושו. גרף רכיבי השאילתה ב-איור 6B מתעד אזורי ביגוד פעילים ואת הקשרים המסוגים שלהם, בעוד שהמטריצה ב-איור 6C חושפת את תבנית הקשרים שהוזנה להפצה הגרפית (graph propagation). תוצאות הבסיס (baseline) ב-איור 6D נותרות נשלטות על ידי רמזי מראה אדומים. התוצאות המודעות למבנה ב-איור 6E שומרות על קטגוריית ביגוד פלג גוף עליון על פני צבעים ורקעים שונים. גרף הרכיבים של התוצאה בעלת הדירוג הגבוה ביותר ב-איור 6F מאפשר השוואה ישירה עם גרף השאילתה, ומטריצת ההתאמה ב-איור 6G חושפת האם רכיבים בעלי מזהים זהים נותרים מיושרים לאחר מיזוג מונחה-מבנה. יש לפרש את ההתאמה האלכסונית יחד עם צמתים חסרים וקשרי גרף ש변경된. דמיון מראה חזק ללא התאמה גרפית אינו מהווה שליפה מבנית מוצלחת.
הבגדים שנשלו פלטו את הקטגוריה הגסה, אך הבדלים בתצורת השרוולים ובקשרים בין רכיבים מקומיים מעידים על התאמה לא מלאה ברמה עדינה. השיטה המוצעת השיגה Recall@5 של 89.2% ו-mAP של 86.4%, כפי שדווח ב-טבלה 3. ערכים כמותיים אלה מתארים את ביצועי הדירוג, בעוד ש-איור 6B–G מספק ראיות מבניות ביניים התומכות בפרשנות. לפיכך, מסקנת השליפה מוגבלת לעמידות משופרת להפרעות של צבע הרקע ולארגון רכיבים חזק יותר ברמת התמונה תחת השאילתה שנבדקה.
מענה להבדלים מבניים ותמיכה בניתוח תכנון
מפת החום של תגובת ההפרש הטהורה ב- איור 7H מראה כי התגובה הדומיננטית מרוכזת במערכת קווי המתאר המורחבת של פלג הגוף התחתון ובגבול הבגד הימני של תמונת המטרה. השכבה העליונה ב- איור 7I מראה כי התגובה החזקה ביותר נותרת מיושרת עם קדמת הבגד המרכזי, בעוד שהפעלה חלשה יותר באזורי הווילון והקיר הסמוכים נותרת כהפרעה רקעית שיורית. יש לפרש את התגובה המרחבית יחד עם גרף הרכיבים וראיות המטריצה המוצגים ב- איורים 7C–Gתגובה תיחשב כהבדל מבני תקף רק כאשר אזור הבגד בעל התגובה הגבוהה עקבי עם השינוי בסמיכות, השינוי ביחסים גיאומטריים ותבנית מרחק הרכיבים לאחר מיזוג.
הבדל מבני מתקבל רק כאשר שינוי בסמיכות המוקלד ב-איור 7E או שינוי ביחס הגיאומטרי ב-איור 7F מלווים במרחק רכיבים מוגבר ב-איור 7G ובתגובה מרחבית המיושרת לקדמה (foreground-aligned) ב-איור 7H,I. אזור פלג הגוף התחתון המורחב וגבול הבגד הימני מקיימים קריטריון חוצה-שלבים זה. אקטיבציה מעל הווילון והקיר אינה תואמת לשינויים בצמתי רכיבים, בדפוסי יחסים או במרחקי רכיבים ממוזגים, ולכן נדחית כהפרעה שיורית שאינה מבנית. התוצאה תומכת במיקום הבדלים ברמת התמונה, אך אינה קובעת שונות בדפוסי התפירה או בפרמטרי הבנייה.
ניתוח התפלגות מרחבית של מאפיינים וניתוח אשכולות מבניים
ניתוח ההתפלגות של מרחב המאפיינים החבוי (latent feature space) חושף את יכולתו של המודל להבחין בין הסמנטיקה המבנית של הבגדים. ניתוח זה בוחן האם הידע המוקדם המבני (structural prior) מארגן פריטי לבוש בעלי תצורות טופולוגיות שונות למניפולדים (manifolds) נפרדים של מאפיינים. נבחרו חמש קטגוריות מבניות מייצגות מקבוצת הבדיקה — חולצות עם שרוול קצר, מכנסיים, חצאיות, מעילים ארוכים ושמלות. וקטורי המאפיינים רב-הממדיים הוקרינו למישור דו-ממדי באמצעות t-distributed stochastic neighbor embedding (t-SNE). הלכידות של דגימות דומות וההפרדה בין דגימות שונות הוערכו כדי לאפיין את הארגון של הסמנטיקה המבנית במרחב המאפיינים. התפלגות ה-t-SNE של מרחב המאפיינים המודע למבנה מוצגת ב-איור 8.
ההקרנה בשיטת t-SNE יצרה חמישה אזורי מאפיינים עיקריים עם חפיפה מוגבלת בין קטגוריות שכנות, כפי שמוצג ב- איור 8Aדגימות מייצגות התואמות לחמשת אזורי הקטגוריות מוצגות ב- איור 8Bה-SCI, העומד על 0.81, משקף את הדחיסות של דגימות בעלות תגית מבנית זהה, וה-SDI, העומד על 0.71, משקף את ההפרדה בין דגימות בעלות תגיות מבניות שונות, כפי שדווח ב- טבלה 3 והוצגו ב- איור 8מדדים אלו יש לפרש כמדדים של התפלגות במרחב התכונות, והם אינם קובעים באופן ישיר שיעור התראות שגואות. חולצות קצרות וחצאיות תפסו אזורים עיקריים שונים במרחב התכונות המושלך, בעוד שמספר קטן של דגימות נותרו סמוך לגבולות קטגוריה גובלים, כפי שמוצג ב- איור 8Aמכנסיים ושמלות הראו גם הם הפרדה ברורה מקטגוריות סמוכות. התפלגות זו מעידה על כך שה-graph prior תרם לארגון מבני ברמת הקטגוריה מבלי להוביל להפרדה מוחלטת של אשכולות (clusters). ההערכה מבדילה בין איכות הייצוג לבין יעילות השליפה. מדד ה-SCI בוחן האם פריטי לבוש בעלי תווית מבנית זהה נותרים דחוסים במרחב המאפיינים שנלמד, בעוד ש-SDI בוחן האם פריטי לבוש בעלי תוויות מבניות שונות נותרים מופרדים. מדדים אלו תואמים את יעד הייצוג המבני של הפרוטוקול. מדד ה-Recall@5 מודד האם פריט לבוש רלוונטי מבנית מופיע בקרב חמש תוצאות השליפה הראשונות, בעוד ש-mAP מודד את איכות הדירוג על פני כל דגימות הגלריה הרלוונטיות. מדדים אלו תואמים את יעד השליפה לפי ייחוס עיצובי. מקדם הסילואט (silhouette coefficient) שימש להערכת ביצועי האשכולה בלבד, כיוון ש-SCI ו-SDI כבר מאפיינים את הארגון של מרחב המאפיינים.
איור 9 מציג את תוצאות הגלם של חמישה הרצות עבור ארבע שיטות מייצגות ללא נרמול בין-שיטתי. איור 9A מציג את ה-SCI וה-SDI בסולם המקורי שלהם, בעוד ש-איור 9B מציג את ה-Recall@5 וה-mAP כאחוזים. סימני ההרצות הבודדות וקווי השגיאה של סטיית התקן מראים את השונות הקשורה לאימון המודל ולא רק את הדירוג המצטבר. קו הבסיס המונע ממראה השיג SCI של 0.62, בעוד שהשיטה המוצעת השיגה SCI של 0.81 ו-SDI של 0.71 (טבלה 3 ו-איור 9A). תוצאות ה-SCI וה-SDI מעידות על דחיסות חזקה יותר בתוך תווית והפרדה חזקה יותר בין תוויות תחת התנאים שנבחנו. השיטה המוצעת השיגה Recall@5 של 89.2% ו-mAP של 86.4% (טבלה 3 ו-איור 9B). מדדי אחזור אלו מעריכים מאפייני דירוג שונים ומפורשים בנפרד מה-SCI וה-SDI. הסדר העקבי של השיטות בארבעת המדדים מעיד על התאמה בין איכות הייצוג לביצועי האחזור, אך אין בכך כדי לרמוז שהשיפור היחסי הוא זהה בארבעה ממדי ההערכה.
ניסויי אבלציה וניתוח יעילות של מודולים מבניים
ניסוי האבלאציה (ablation experiment) משווה בין המודל המלא לבין וריאנטים שבהם הוסרו ה-structural prior או מודול ההיתוך (fusion module). כל שלושת התצורות משתמשות באותן תמונות ייחוס ומטרה, מה שמאפשר השוואה ישירה של תגובת הרקע וריכוז הלוקליזציה. הווריאנט ללא ה-structure prior מסיר את הגרף של רכיבי הבגד ברמת התמונה ואת אילורי הקשרים שלו, ומסתמך אך ורק על ה-convolutional backbone כדי לחלץ מאפייני מראה; הווריאנט ללא ההיתוך שומר על הסקת המסקנות מהגרף אך מסיר את פירמידת המאפיינים, תוך שימוש במאפיינים סמנטיים ברמה גבוהה בלבד. מפות חום של הבדלים הממומשות ויזואלית חושפות את התפקידים הספציפיים של כל מודול בדיכוי רעשים ובהגדרת גבולות; השוואה איכותית של תגובות הבדל מבניות תחת תצורות מודול שונות מוצגת ב-איור 10.
מפות התגובה ב-איור 10C–E הוצגו באמצעות סולם תגובה משותף והגדרות שכבה זהות. הגרסה ללא ה-structure prior הפיקה הפעלה חזקה ברקע השמאלי ומסביב לאזורי סביבה לא קשורים, כפי שמוצג ב-איור 10C. הגרסה ללא מודול ה-fusion הפחיתה חלק מתגובה זו שמחוץ לבגד, אך עדיין שמרה על פריסה רחבה יותר על הבגד התחתון ובאזור הסביבתי בצד ימין, כפי שמוצג ב-איור 10D. המודל המלא כיווץ עוד יותר את התגובה הדומיננטית לעבר קדמה הבגד המרכזית, כפי שמוצג ב-איור 10E. איור 10F מציג באופן ישיר את ההבדל בתגובות המוגבלות לקדמה בין גרסת ה-non-fusion למודל המלא, ומראה כי המודל המלא מדכא פריסה לטרלית שיורית תוך שימור התגובה העיקרית המיושראת לבגד. תוצאות אלו מעידות כי ה-structure prior הפחית בעיקר רעשי סביבה וכי מודול ה-fusion שיפר עוד יותר את ריכוז התגובה ואת היישור המבני. איור 10E מייצג שיפור יחסי ולא הסרה מוחלטת של הפעלה ברקע.
טבלה 4 מציגה את ערכי ה-SCI, ה-SDI וה-Recall@5 עבור הגרסאות ללא המידע המוקדם על המבנה (structure prior), ללא מודול האיחוד (fusion module), ועבור המודל המלא. הסרת המידע המוקדם על המבנה הפחיתה את ה-SCI מ-0.81 ל-0.65 והפחיתה את ה-Recall@5 מ-89.2% ל-74.5%. הסרת מודול האיחוד הפחיתה את ה-SDI מ-0.71 ל-0.64 והפחיתה את ה-Recall@5 מ-89.2% ל-85.1%, ירידה של 4.1 נקודות אחוז. תוצאות אלו מעידות כי למידע המוקדם על המבנה הייתה השפעה גדולה יותר על העקביות המבנית והשליפה, בעוד שאיחוד תכונות שיפר את ההלימה בין מידע על המראה למידע מבני.
ניתוח היעילות משווה את העלות החישובית של המודל המלא אל מול בסיס ההשוואה של ResNet-50. בסיס ההשוואה ResNet-50 דרש 25.6 מיליון פרמטרים ו-4.1 מיליארד פעולות נקודה צפה. המודל המלא המודע למבנה דרש 29.3 מיליון פרמטרים ו-5.4 מיליארד פעולות נקודה צפה. זמן ההסקה הממוצע היה 15 מילישניות לתמונה עבור בסיס ההשוואה ו-22 מילישניות לתמונה עבור המודל המלא, עלייה של 7 מילישניות. תוצאה זו מצביעה על עלות חישובית מדידה שיש להביאה בחשבון בעת פריסת הפרוטוקול בתהליכי עבודה רגישים לזמן (טבלה 5). משקל האילוץ המבני נקבע מתוך קבוצת האימות לפני הערכת הבדיקה הסופית. נבדק Recall@5 של אימות עבור משקלי אילוץ מבני של 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5 ו-2.0. משקל של 1.0 נקבע עבור כל הרצת אימון ובדיקה עוקבת. איור 11 מתעד את הבחירה במשקל אילוץ מבני של 1.0 המבוססת על האימות.

איור 1: זרימת העבודה הכללית של פרוטוקול למידת מאפייני תמונות בגדים מודעי-מבנה. תמונת הבגד הקלטית מעובדת על ידי ענף מאפייני מראה וענף מאפיינים מבניים המשתמש בניתוח סמנטי ומידול גרף מרחבי. שני הייצוגים מעובדים על ידי מודול המיזוג המונחה-מבנה כדי להפיק את המאפיין הסופי המודע-מבנה. הפסד עקביות מבנית, הפסד אפליה מבנית והפסד קשר מבני מגבילים יחד את מרחב המאפיינים. האיור מראה כיצד מראה הבגד והטופולוגיה של רכיביו משולבים לאורך למידת המאפיינים. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 2: בנייה מוקדמת של טופולוגיית רכיבי בגד ברמת התמונה. (A) תמונת הבגד הקלט I. (B) מפת רכיבים ויזואלית מוגבלת לרקע הקדמי P, שבה שבעה צבעים מציינים אזורי בגד ברמת התמונה. כל פיקסלי הרקע מוחרגים מערוצי הרכיבים. (C) גרף קשרי רכיבים ברמת התמונה G. צמתים מייצגים אזורי בגד גלויים, קשתות רציפות מייצגות גבולות משותפים ברקע הקדמי, וקשרים מקווקווים מייצגים סדר אנכי שהוגדר מראש. המפה והגרף תומכים באחזור תמונות ובהשוואת מבנה ויזואלי. הם אינם מייצגים חלקי תבנית תפירה, גיאומטריית תפרים, מבני פנימה (darts), פרמטרי גדילה (grading) או הוראות גזירה. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 3: מודול מיזוג מאפיינים מונחה-מבנה. המאפיין המבני עובר טרנספורמציה על ידי מיפוי ליניארי ופונקציית אקטיבציה Ψ כדי ליצור משקולת מבנית. המשקולת המבנית מווסתת את מאפיין המראה באמצעות כפל איבר-איבר. מאפיין המראה המנוظم והמאפיין המבני משרשרו ומושלכים על ידי Wc, ולאחר מכן נוסף המאפיין המבני השאריתי כדי ליצור את מאפיין הרכיב הסופי. האיור מראה כי מידע מבני מווסת את שקלול מאפייני המראה לפני המיזוג הסופי. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 4: אופטימיזציה של מרחב המאפיינים תחת מגבלות עקביות מבנית. (A) דגימות השייכות לאותה מחלקה מבנית נמשכות קרוב יותר באמצעות הפסד העקביות המבנית, בעוד שקשרי הרכיבים הפנימיים שלהן נשמרים על ידי הפסד הקשר המבני. (B) דגימות ממחלקות מבניות שונות נדחפות הרחק זו מזו על ידי הפסד האפליה המבנית. האיור מראה כיצד שלושת היעדים המבניים מגבירים במשותף את הדחיסות בתוך המחלקה ואת ההפרדה בין המחלקות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 5: תגובות מייצגות של מאפייני בגד וויזואליזציה של גרף רכיבים. (A) תמונת הבגד שהוכנסה כקלט. (B) תגובת הפעלת המחלקה (class activation response) של Baseline המראה של ResNet-50. (C) גרף רכיבי הבגד ברמת התמונה ששוחזר ממפת הרכיבים המוגבלת לרקע, מטריצת מרכזי הרכיבים, מטריצת סמיכות טיפוסית, מסכת צמתי-לא-פעילים ומיפוי תוויות רכיבים, שנשמרו במהלך סעיפים 3 ו-4 של הפרוטוקול. צמתים מייצגים אזורי בגד פעילים, קווים רציפים מייצגים גבולות רקע משותפים, וקווים מקווקוים מייצגים יחסי סדר אנכיים שהוגדרו מראש. (D) תגובת ההפעלה של הייצוג הממזג מודעות-רכיבים. ההשוואה מראה את ההבדל בין הפעלה השלטה על ידי מרקם לבין הפעלה המונחית על ידי אזורי הבגד. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

איור 6: תוצאות אחזור וראיות מבניות ביניים תחת הפרעה של רקע אדום. (A) תמונת השאילתה. (B) גרף רכיבי השאילתה נוצר ממרכזי הרכיבים השמורים וממטריצת הסמיכות המוקלדת. (C) מטריצת הסמיכות המוקלדת של השאילתה, שבה ערכי המטריצה מבחינים בין יחסים לא פעילים, גבולות רקע משותפים ויחסי סדר אנכיים שהוגדרו מראש. (D) שלוש תוצאות האחזור המובילות הופקו על ידי בסיס המראה (appearance baseline). (E) שלוש התוצאות המובילות הופקו על ידי ייצוג מודע-מבנה. (F) גרף הרכיבים של התוצאה המודעת-מבנה בדירוג הגבוה ביותר. (G) מטריצת התאמת הרכיבים לאחר מיזוג בין השאילתה לתוצאה בדירוג הגבוה ביותר. התאמה אלכסונית גבוהה מעידה על הסכמה בין רכיבים בעלי מזהים זהים, בעוד שתגובות חלשות או מוסטות מעידות על ארגון רכיבים חסר או לא תואם. תוצאות האחזור שומרות על קטגוריית פלג גוף עליון גסה אך אינן קובעות הסכמה מלאה בתצורת השרוול ובטופולוגיה המקומית. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 7: מעקב אחר הבדלים מבניים מטופולוגיית הבגד ברמת התמונה לתגובה מרחבית. (A) תמונת הייחוס. (B) תמונת המטרה. (C) גרף רכיבי הייחוס. (D) גרף רכיבי המטרה. שני הגרפים שוחזרו ממרכזי הרכיבים השמורים וממטריצות סמיכות מתוייגות. (E) מטריצת הבדלי הסמיכות המתוייגת. (F) ההבדל ביחסים הגאומטריים נגזר מהעתקת מרכז הרכיב, פיזור מרחבי ושינויים במשקל היחס. (G) גרף הבדלי הרכיבים שלאחר איחוד (post-fusion), שבו עוצמת הצומת מייצגת את המרחק הנורמלי בין וקטורי הרכיבים המאוחדים המתאימים, ורוחב הקשת מייצג את השינוי במשקל היחס. (H) מפת חום של תגובת הבדל מרחבית טהורה שרונדרה באמצעות אותו קנה מידה קבוע של תגובה כמו בשכבת העל (overlay). (I) התגובה המוטלת כשכבת על על תמונת המטרה. הבדל מבני מתקבל רק כאשר השינוי בסמיכות, השינוי ביחס הגאומטרי, השינוי במרחק הרכיבים ותגובת החום המיושרת לרקע נותרים עקביים. הפעלה של הרקע ללא ראיות תואמות לרכיבים או יחסים נחשבת להפרעה שיורית ולא כהבדל תקף במבנה הבגד. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 8: מקבץ מרחב-תכונות מודע-מבנה. (A) השלכת t-SNE של חולצות עם שרוול קצר, מכנסיים, חצאיות, מעילים ארוכים ושמלות. חמש הקטגוריות יוצרות אזורי תכונות עיקריים עם חפיפה מוגבלת ליד הגבולות ביניהם. (B) תמונות בדיקה מייצגות המשויכות לחמש קטגוריות הביגוד, כאשר צבע המסגרת תואם לצבע הקטגוריה ב-(A). האיור מראה ארגון מבני ברמת הקטגוריה תוך שמירה על מספר קטן של דגימות ליד אזורי קטגוריות סמוכות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 9: השוואת ביצועים גולמית על פני מבנה מרחב-תכונות ומטרות דירוג-שליפה. (A) SCI ו-SDI עבור קו הבסיס מונחה-מראה, מודל בעל מבנה חלש, מודל בעל מבנה מפורש, והשיטה המוצעת. (B) Recall@5 ו-mAP עבור אותן ארבע שיטות. סמנים גדולים מציינים את הממוצע האריתמטי על פני חמישה ריצות עצמאיות, קווי שגיאה מציינים את סטיית התקן של המדגם, וסמנים קטנים מציינים את תוצאות הרמה של כל ריצה. SCI ו-SDI מוצגים בקנה מידה קבוע מאפס עד אחד, בעוד ש-Recall@5 ו-mAP מוצגים בקנה מידה אחוזי קבוע מאפס עד מאה. לא הוחלה נורמליזציית min-max או שינוי קנה מידה בין שיטות. אנא לחצו כאן להצגת גרסה גדולה יותר של איור זה.

איור 10: תגובות להבדלים מבניים תחת תצורות מודול שונות. (A) תמונת הייחוס. (B) תמונת המטרה. (C) התגובה של הגרסה ללא המידע המבני המקדים (structure prior). (D) התגובה של הגרסה ללא מודול האיחוד (fusion module). (E) התגובה של המודל המלא. (C–E) מוצגים באמצעות אותו קנה מידה של תגובה מנורמלת, מפת צבעים והגדרות שכבה. (F) הפרש התגובה המוחלט המוגבל לרקע בין הגרסה ללא האיחוד לבין המודל המלא. המודל המלא שומר על התגובה העיקרית המיושרת לבגד תוך הפחתת פיזור שאריות מחוץ לאזור המבני המרכזי. ההשוואה מראה כי המידע המבני המקדים מפחית הפרעות מחוץ לבגד וכי מודול האיחוד מחדד עוד יותר את התגובה המבנית. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 11: בחירה של משקל האילוץ המבני המבוססת על תיקוף. ה-Validation Recall@5 מדווח עבור משקלי אילוץ מבניים של 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5, ו-2.0. כל נקודה מייצגת את הממוצע האריתמטי של חמש הרצות תיקוף, וכל קו שגיאה מייצג את סטיית התקן של המדגם. המשקל נקבע על 1.0 לפני הערכת הבדיקה הסופית. איור זה מתעד את הליך בחירת הפרמטרים ואינו מהווה תרומה ארכיטקטונית עצמאית. אנא לחץ כאן כדי לצפות בגרסה מורחבת של איור זה.
טבלה 1: הקצאת מערכי נתונים וסטטיסטיקות טופולוגיות ברמת התמונה עבור תתי-קבוצות הבגדים S1 עד S5. הטבלה מציגה את מספר התמונות לאימון, לתיקוף, לבדיקה ובסך הכל, יחד עם ממוצע מספר הרכיבים הסמנטיים, מספר הצמתים הפעילים, מספר הקשתות המתוייגות ומספר נקודות הציון המסומנות במישור התמונה עבור כל רמה מבנית. כל הערכים הופקו ממניפסטי הנתונים המעובדים. מספר התמונות לאימון, לתיקוף ולבדיקה התקבלו ממניפסטי תתי-הקבוצות הסופיים לאחר סקירה מבנית, בקרת קבוצות כפולות ובדיקת דליפת נתונים, בעוד שסטטיסטיקות הטופולוגיה חושבו מרשומות הגרף הסופיות תוך שימוש באותם סדר רכיבים והגדרות יחסים שיושמו במהלך הערכת המודל. אנא לחץ כאן להורדת קובץ זה.
טבלה 2: הגדרות הסביבה החישובית, תצורת קלט, הרחבה (augmentation), ייצוג, אופטימיזציה, פונקציית הפסד והגדרות לשחזור ששימשו לאורך הפרוטוקול. הטבלה מפרטת את גרסאות מערכת ההפעלה, המעבד, הזיכרון המותקן, יחידת עיבוד הגרפיקה, זיכרון הגרפיקה, מנהל התקן הגרפיקה, CUDA, cuDNN, Python, NumPy, PyTorch ו-torchvision, יחד עם גודל התמונה, בניית ה-batch, האופטימייזר, לוח הזמנים של קצב הלמידה, מספר ה-epochs, זרעי אקראיות (random seeds), ממדי הייצוג ומשקולות היעד המבניות. כל ערך מקושר לקובץ software_versions.txt, לקובץ configs/protocol.yaml או לרשומת האימון המתאימה. אנא לחצו כאן להורדת הקובץ.
טבלה 3: השוואה כמותית של מודלים כלליים לייצוג חזותי, מודלים של בגדים מבוססי גרפים ושיטות אחזור אופנה ספציפיות לתחום. הטבלה מציגה את מיקוד האחזור, מודליות השאילתה, SCI, SDI, Recall@5, mAP ומקדם הסילואט עבור אחת עשרה שיטות תחת אותן חלוקות נתונים ופרוטוקול הערכה. כל מדד מדווח כממוצע וסטיית תקן של מדגם על פני חמישה הרצות עצמאיות. ערכי ה-p המדווחים התקבלו ממבחני t זוגיים דו-כיווניים שהשוו כל שיטת השוואה לשיטה המוצעת, תוך שימוש בתוצאות שהופקו תחת אותם חמישה זרעים אקראיים. השיטה המוצעת משמשת כשורת הייחוס. אנא לחצו כאן כדי להוריד קובץ זה.
טבלה 4: תוצאות אבלציה עבור מודול המבנה המקדים והיתוך התכונות. הטבלה מציגה את ה-SCI, ה-SDI וה-Recall@5 עבור הגרסה ללא המידע המקדים המבני (structural prior), הגרסה ללא מודול המיזוג (fusion module), והמודל המלא. הסרת המידע המקדים המבני גורמת לירידה גדולה יותר ב-SCI וב-Recall@5, בעוד שהסרת מודול המיזוג מפחיתה את ה-SDI ואת יישור התגובה (response alignment). המודל המלא רשום עם הערך הגבוה ביותר בכל שלושת המדדים. אנא לחצו כאן להורדת קובץ זה.
טבלה 5: יעילות חישובית של מודל הבסיס ResNet-50 ושל המודל המלא המודע למבנה. הטבלה מציגה פרמטרים הניתנים לאימון, מספר פעולות נקודה צפה לכל תמונה, וזמן הסקה ממוצע לכל תמונה תחת סביבת החומרה והתוכנה המדויקת המתועדת בטבלה 2 ובטבלת החומרים. שני המודלים משתמשים באותה רזולוציית תמונה, הגדרות עבור גודל אצווה (batch) להסקה, פעולות עיבוד מקדים ופרוצדורת תזמון. המודל המלא מוסיף 3.7 מיליון פרמטרים, 1.3 מיליארד פעולות נקודה צפה ו-7 מילישניות של זמן הסקה לכל תמונה ביחס למודל הבסיס. אנא לחץ כאן להורדת קובץ זה.