Raporlanan tüm deneyler, Tablo 2 ve Materyaller Tablosu'nda belgelenen donanım ve yazılım ortamı kullanılarak gerçekleştirilmiştir. Ön işleme, eğitim, çıkarım ve değerlendirme süreçlerinin tamamında aynı grafik sürücüsü, CUDA, cuDNN, Python, NumPy, PyTorch ve torchvision sürümleri kullanılmıştır. Eksiksiz donanım ve yazılım ortamı Tablo 2 ve Materyaller Tablosu'nda özetlenmiştir. Tablo 1, işlenmiş eğitim, doğrulama ve test veri setlerini görüntü düzeyindeki topoloji istatistikleri ile birlikte özetlemektedir. Tablo 2, tüm karşılaştırma yöntemleri için kullanılan ortak yapılandırmayı özetlemektedir.
Karşılaştırmalı değerlendirme sonuçları
Karşılaştırmalı değerlendirme; Protokol bölümleri 7–9'da belirtilen ortak veri bölümlendirmelerini, ön işleme işlemlerini, eğitim kontrollerini ve metrik tanımlarını takip etmiştir. Tablo 3; genel görsel kodlayıcıları, parça hizalamalı modelleri, graf tabanlı giysi temsillerini, alanlar arası moda erişim ağlarını, topoloji ve görünüm füzyon yöntemlerini ve e-ticaret görsel erişim yöntemlerini, tamamı aynı görüntü-sorgu protokolü kullanılarak değerlendirilmiş şekilde karşılaştırmaktadır. Alana özgü yöntemler; Renk ve Doku Füzyonlu Topoloji Özellik Histogramı (TFH-CT), Dikkat Rehberli Kademeli Ağ (AGC-Net), Çok Ölçekli ve Çok Tanelilikli Özellik Öğrenme Ağı (MMFL-Net) ve Egret Sürü Optimizasyonlu Artık Ağ kullanan Moda Erişimi (FARE-RNET) yöntemlerinden oluşmaktadır. Tablo 3'teki tüm değerlendirme metrikleri; aynı rastgele tohumlar, eğitim manifestosu, doğrulama manifestosu, test manifestosu, sorgu-galeri ataması ve metrik uygulaması kullanılarak yapılan beş bağımsız çalıştırmanın ortalaması ve örnek standart sapması olarak raporlanmıştır. Eşleştirilmiş p- değerleri; her bir yöntem, eşleşmiş rastgele tohum koşulları altında önerilen yöntemle karşılaştırılarak SCI, SDI, Recall@5, mAP ve siluet katsayısı için ayrı ayrı hesaplanmıştır. Bu sonuçlar, sonraki yapısal görselleştirme, erişim, kümeleme ve tasarım odaklı analizler için nicel temeli sağlamaktadır.
Temsili protokol sonuçları ve yorumlanması
Kaydedilen ayrıştırma ve grafik dosyalarından yeniden yapılandırılan görüntü düzeyindeki bileşen grafiği, Şekil 5C'de gösterildiği gibi her aktif düğümü ilgili giysi bölgesinin içine yerleştirdiğinde ve tipli komşuluk matrisinde kaydedilen ilişki türlerini koruduğunda protokolün başarıyla uygulandığı belirtilmiş olur. Yapı-bilinçli yanıt, Şekil 5D'de gösterildiği gibi giysi ön planında yoğunlaşmaya devam etmelidir. Şekil 6E, önerilen yöntemin kırmızı arka planın etkisini azalttığı ve ilgisiz kırmızı nesneler yerine üst vücut giysilerini getirdiği beklenen bir geri getirme sonucunu sunmaktadır. Şekil 6B–G ayrıca geri getirme sıralamasının görüntü düzeyindeki bileşen ilişkileri ve füzyon sonrası bileşen karşılıklılığı ile desteklendiğini göstermektedir. Bu sonuç, kol uzunluğu ve yerel topoloji getirilen örnekler arasında hala farklılık gösterse de, kaba giysi kategorisinin geri kazanıldığını yansıtmaktadır.
Yaygın başarısızlık durumları arasında Şekil 5B'deki doku baskın aktivasyon, Şekil 6'nın üst satırındaki arka plan rengi kaynaklı geri çağırma ve Şekil 7'deki kalıntı arka plan aktivasyonu yer almaktadır. Baskın yanıt, genişletilmiş alt vücut silüetini ve sağ giysi sınırını takip ederken, komşu arka plan bölgelerinde kalıntı aktivasyon devam ettiği için Şekil 7 kısmi lokalizasyon olarak yorumlanmalıdır. Lokalizasyonun yapısal olarak desteklendiği, ancak topoloji fark matrisi, geometrik ilişki fark matrisi, füzyon sonrası bileşen fark grafiği ve uzamsal yanıt tutarlı giysi bölgelerini tanımladığında kabul edilir. Matristeki veya bileşenlerdeki karşılık gelen değişiklikler olmaksızın ortaya çıkan uzamsal bir sıcak nokta, yapısal bir kanıttan ziyade görsel bir girişime işaret eder.
Kabul edilen her görüntünün normalize edilmiş bir semantik olasılık haritası, K satır ve K sütunlu bir ilişki matrisi, K satır ve 512 sütunlu görünüm ve yapısal özellik matrisleri ve doğru görüntü tanımlayıcısına bağlı sonlu bir birleştirilmiş özellik vektörü ürettiğinde, bir protokol çalışması geçerli kabul edilir. Görsel inceleme; topolojinin giysi bileşenlerini takip ettiğini, ön plan yanıtının arka plan yanıtını aştığını ve geri getirme sonuçlarının arka plan renginden ziyade giysi kategorisi ve yapısı tarafından yönlendirildiğini doğrulamalıdır. Parçalanmış olasılık haritaları, eksik bileşen düğümleri, sayısal olmayan matrisler, yaygın arka plan yanıtları veya renk odaklı geri getirme işlemleri, yürütmenin başarısız olduğunu gösterir ve ayrıştırma, graf oluşturma, özellik birleştirme veya kontrol noktası yükleme işlemlerinin incelenmesini gerektirir.
Görüntü düzeyindeki giysi bileşeni tepkilerinin görsel analizi
Şekil 5, aynı giysi görüntüsünü kullanarak ResNet-50 temel modelini bileşen farkındalıklı model ile karşılaştırmaktadır. Şekil 5B, görünüm temel modeline ait sınıf aktivasyon haritasını göstermektedir. Şekil 5C, Protokol bölümleri 3 ve 4'te oluşturulan ön plan kısıtlı olasılık haritası, bileşen merkez matrisi, tipli komşuluk matrisi, inaktif düğüm maskesi ve bileşen etiket eşlemesinden yeniden yapılandırılan görüntü düzeyindeki giysi bileşeni grafiğini sunmaktadır. Şekil 5D, birleştirilmiş temsilin aktivasyon yanıtını sunmaktadır. Şekil 5C'yi oluşturmak için herhangi bir insan poz tahmincisi veya insan eklem anotasyonu kullanılmamıştır.
Şekil 5B'de gösterildiği gibi, temel yanıt alt giysi parçalarındaki yerel doku bölgelerinde yoğunlaşmış ve giysi sınırının tamamını tutarlı bir şekilde takip etmemiştir. Şekil 5C'de, her düğüm aktif bir giysi bileşeni bölgesinin merkezine karşılık gelirken, her kenar ortak bir ön plan sınırını veya önceden tanımlanmış bir dikey düzen ilişkisini temsil eder. Grafik, giysi bölgesi organizasyonunu yansıtır ve insan anatomik eklemlerini temsil etmez. Şekil 5D'de gösterildiği gibi, yapı duyarlı yanıt, çoğu arka plan alanında düşük aktivasyonu korurken ana giysi ön planını kapsamıştır. Bu sonuçlar, bileşen grafiğinin ve özellik füzyon modülünün değerlendirilen görüntüdeki doku baskın aktivasyonu azalttığını göstermektedir.
Kıyafet yapısal benzerlik analizi ve tasarım referans sonuçları
Şekil 6, geri çağırma sıralamasını ve bunu yorumlamak için kullanılan yapısal kanıtları sunmaktadır. Şekil 6B'deki sorgu bileşen grafiği, aktif giysi bölgelerini ve bunların türlendirilmiş ilişkilerini kaydederken, Şekil 6C'deki matris, grafpropagation'a sağlanan ilişki modelini ortaya koymaktadır. Şekil 6D'deki temel sonuçlar, kırmızı görünüm ipuçlarının hakimiyetinde kalmaya devam etmektedir. Şekil 6E'deki yapıya duyarlı sonuçlar, farklı renkler ve arka planlar boyunca üst gövde giysi kategorisini korumaktadır. Şekil 6F'deki en yüksek sıralamalı sonucun bileşen grafiği, sorgu grafiği ile doğrudan karşılaştırmaya olanak tanır ve Şekil 6G'deki karşılık matrisi, aynı tanımlayıcıları paylaşan bileşenlerin yapı kılavuzlu füzyondan sonra hizalı kalıp kalmadığını ortaya çıkarır. Diyagonal karşılık, eksik düğümler ve değişen graf ilişkileri ile birlikte ortaklaşa yorumlanmalıdır. Graf uyumu olmaksızın mevcut olan güçlü görünüm benzerliği, başarılı bir yapısal geri çağırma teşkil etmez.
Geri getirilen giysiler genel kategoriyi korumaktadır, ancak kol konfigürasyonundaki farklılıklar ve yerel bileşen ilişkileri, ince taneli karşılıklılığın eksik olduğunu göstermektedir. Önerilen yöntem, Tablo 3'te bildirildiği üzere %89,2'lik bir Recall@5 ve %86,4'lük bir mAP değerine ulaşmıştır. Bu nicel değerler sıralama performansını tanımlarken, Şekil 6B–G yorumu destekleyen ara yapısal kanıtlar sunmaktadır. Dolayısıyla, geri getirme sonucu, test edilen sorgu altında arka plan rengi girişimine karşı gelişmiş direnç ve daha güçlü görüntü düzeyinde bileşen organizasyonu ile sınırlıdır.
Yapısal fark yanıtı ve tasarım analizi desteği
Şekil 7H'deki saf fark-yanıt ısı haritası, baskın yanıtın hedef görüntünün büyütülmüş alt vücut siluetinde ve sağ giysi sınırında yoğunlaştığını göstermektedir. Şekil 7I'deki bindirme, en güçlü yanıtın ana giysi ön planıyla hizalı kaldığını, bitişik perde ve duvar bölgelerindeki daha zayıf aktivasyonun ise kalıntı arka plan girişimi olarak kaldığını göstermektedir. Uzamsal yanıt, Şekil 7C–G'de sunulan bileşen grafiği ve matris kanıtlarıyla birlikte yorumlanmalıdır. Bir yanıt, yalnızca yüksek yanıtlı giysi bölgesi; komşuluk değişimi, geometrik ilişki değişimi ve füzyon sonrası bileşen-mesafe deseni ile tutarlı olduğunda geçerli bir yapısal fark olarak kabul edilir.
Yapısal bir fark, yalnızca Şekil 7E'deki yazılmış bitişiklik değişikliği veya Şekil 7F'deki geometrik ilişki değişikliğine, Şekil 7G'deki artmış bileşen mesafesinin ve Şekil 7H,I'deki ön planla hizalanmış uzamsal yanıtın eşlik etmesi durumunda kabul edilir. Genişletilmiş alt vücut bölgesi ve sağ giysi sınırı bu aşamalar arası kriteri karşılamaktadır. Perde ve duvar üzerindeki aktivasyon, bileşen düğümlerindeki, ilişki kalıplarındaki veya birleştirilmiş bileşen mesafelerindeki değişikliklerle örtüşmemekte ve bu nedenle yapısal olmayan kalıntı girişim olarak reddedilmektedir. Sonuç, görüntü düzeyinde fark lokalizasyonunu desteklemektedir ancak dikiş kalıplarında veya konstrüksiyon parametrelerinde bir varyasyon olduğunu kanıtlamamaktadır.
Özellik uzamsal dağılımı ve yapısal küme analizi
Gizli özellik uzayının dağılımının analiz edilmesi, modelin kıyafetlerin yapısal semantiğini ayırt etme yeteneğini ortaya koymaktadır. Bu analiz, yapısal önbilginin farklı topolojik konfigürasyonlara sahip giysileri belirgin özellik manifoldlarına organize edip etmediğini incelemektedir. Test setinden beş temsili yapısal kategori —kısa kollu üstler, pantolonlar, etekler, uzun paltolar ve elbiseler— seçilmiştir. Yüksek boyutlu özellik vektörleri, t-dağılımlı stokastik komşu gömme (t-SNE) yöntemi kullanılarak iki boyutlu bir düzleme yansıtılmıştır. Özellik uzayındaki yapısal semantiğin organizasyonunu karakterize etmek için benzer örneklerin uyumu ve benzer olmayan örneklerin ayrımı değerlendirilmiştir. Yapı farkındalıklı özellik uzayının t-SNE dağılımı Şekil 8'de gösterilmiştir.
Şekil 8A'da gösterildiği gibi, t-SNE projeksiyonu, komşu kategoriler arasında sınırlı örtüşmenin olduğu beş ana özellik bölgesi oluşturmuştur. Beş kategori bölgesine karşılık gelen temsili örnekler Şekil 8B'de gösterilmiştir. Tablo 3'te rapor edilen ve Şekil 8'de görselleştirilen 0.81'lik SCI değeri, aynı yapısal etiketi paylaşan örneklerin kompaklığını; 0.71'lik SDI değeri ise farklı yapısal etiketlere sahip örnekler arasındaki ayrımı yansıtmaktadır. Bu indeksler, özellik alanı dağılımının ölçümleri olarak yorumlanmalı ve doğrudan bir yanlış alarm oranı belirlememelidir. Şekil 8A'da görüldüğü üzere, kısa kollu üstler ve etekler projeksiyon özellik alanında farklı ana bölgeleri işgal ederken, az sayıda örnek komşu kategori sınırlarının yakınında kalmıştır. Pantolonlar ve elbiseler de komşu kategorilerden belirgin bir ayrım göstermiştir. Bu dağılım, grafik ön bilgisinin (graph prior), tam bir küme ayrışması yaratmaksızın kategori düzeyindeki yapısal organizasyona katkıda bulunduğunu göstermektedir. Değerlendirme, temsil kalitesini geri çağırma etkinliğinden ayırır. SCI, aynı yapısal etiketi paylaşan giysilerin öğrenilen özellik alanında kompakt kalıp kalmadığını değerlendirirken; SDI, farklı yapısal etiketlere sahip giysilerin ayrı kalıp kalmadığını değerlendirir. Bu metrikler, protokolün yapısal temsil hedefiyle örtüşmektedir. Recall@5, yapısal olarak ilgili bir giysinin geri çağrılan ilk beş sonuç arasında yer alıp almadığını ölçerken; mAP, tüm ilgili galeri örnekleri genelindeki sıralama kalitesini ölçer. Bu metrikler, tasarım referansı geri çağırma hedefiyle örtüşmektedir. SCI ve SDI zaten özellik alanı organizasyonunu tanımladığı için, silüet katsayısı yalnızca kümeleme performansını değerlendirmek amacıyla kullanılmıştır.
Şekil 9, yöntemler arası normalizasyon yapılmadan dört temsilci yöntem için beş tekrarlı ham sonuçları raporlamaktadır. Şekil 9A SCI ve SDI değerlerini orijinal ölçeklerinde sunarken, Şekil 9B Recall@5 ve mAP değerlerini yüzdeler halinde sunmaktadır. Bireysel çalışma işaretleyicileri ve standart sapma hata çizgileri, yalnızca toplam sıralamayı değil, model eğitimiyle ilişkili varyasyonu göstermektedir. Görünüm odaklı temel yöntem 0,62'lik bir SCI elde ederken, önerilen yöntem 0,81'lik bir SCI ve 0,71'lik bir SDI elde etmiştir (Tablo 3 ve Şekil 9A). SCI ve SDI sonuçları, değerlendirilen koşullar altında etiket içi daha güçlü bir kompaktlık ve etiketler arası daha güçlü bir ayrım olduğunu göstermektedir. Önerilen yöntem %89,2'lik bir Recall@5 ve %86,4'lük bir mAP elde etmiştir (Tablo 3 ve Şekil 9B). Bu geri çağırma metrikleri farklı sıralama özelliklerini değerlendirir ve SCI ve SDI'dan ayrı olarak yorumlanır. Yöntemlerin dört metrik genelindeki tutarlı sıralaması, temsil kalitesi ile geri çağırma performansı arasında bir uyum olduğunu göstermektedir; ancak bu durum, dört değerlendirme boyutu genelinde göreceli iyileşmenin aynı olduğu anlamına gelmemektedir.
Ablasyon deneyleri ve yapısal modül etkinlik analizi
Ablasyon deneyi, tam modeli, yapısal ön bilgi veya füzyon modülünün kaldırıldığı varyantlarla karşılaştırır. Her üç konfigürasyon da aynı referans ve hedef görüntüleri kullanarak arka plan yanıtının ve lokalizasyon konsantrasyonunun doğrudan karşılaştırılmasına olanak tanır. Yapısal ön bilgisiz varyant, görüntü düzeyindeki giysi bileşeni grafiğini ve buna bağlı ilişki kısıtlamalarını kaldırarak görünüm özelliklerini çıkarmak için yalnızca konvolüsyonel omurgaya dayanır; füzyon içermeyen varyant ise graf çıkarımını korur ancak özellik piramidini kaldırarak yalnızca üst düzey semantik özellikleri kullanır. Görselleştirilmiş fark ısı haritaları, her bir modülün gürültü bastırma ve sınır belirlemedeki özel rollerini ortaya koymaktadır; farklı modül konfigürasyonları altındaki yapısal fark yanıtlarının kalitatif bir karşılaştırması Şekil 10'da gösterilmiştir.
Şekil 10C–E'deki yanıt haritaları, ortak bir yanıt ölçeği ve özdeş bindirme ayarları kullanılarak oluşturulmuştur. Şekil 10C'de görüldüğü üzere, yapı ön bilgisi (structure prior) olmayan varyant, sol arka planda ve ilgisiz çevresel bölgelerin etrafında güçlü aktivasyon üretmiştir. Füzyon modülü olmayan varyant, bu giysi dışı yanıtın bir kısmını azaltmış ancak Şekil 10D'de gösterildiği gibi alt giysi ve sağ yan çevreleyen bölge üzerinde hala daha geniş bir yayılım sergilemiştir. Tam model, Şekil 10E'de gösterildiği üzere baskın yanıtı ana giysi ön planına doğru daha fazla daraltmıştır. Şekil 10F, füzyon içermeyen varyant ile tam model arasındaki ön plana kısıtlanmış yanıt farkını doğrudan görselleştirerek, tam modelin temel giysiyle hizalı yanıtı korurken kalıntı yan yayılımı baskıladığını göstermektedir. Bu sonuçlar, yapı ön bilgisinin temel olarak çevresel gürültüyü azalttığını ve füzyon modülünün yanıt konsantrasyonu ile yapısal hizalamayı daha da iyileştirdiğini göstermektedir. Şekil 10E arka plan aktivasyonunun tamamen kaldırılmasından ziyade göreli bir iyileşmeyi temsil etmektedir.
Tablo 4; yapı ön bilgisi (structure prior) olmayan, füzyon modülü olmayan ve tam model varyantları için SCI, SDI ve Recall@5 değerlerini sunmaktadır. Yapı ön bilgisinin kaldırılması, SCI değerini 0,81'den 0,65'e ve Recall@5 değerini %89,2'den %74,5'e düşürmüştür. Füzyon modülünün kaldırılması ise SDI değerini 0,71'den 0,64'e ve Recall@5 değerini %89,2'den %85,1'e indirmiş, bu da 4,1 yüzdelik puanlık bir azalma anlamına gelmiştir. Bu sonuçlar, yapı ön bilgisinin yapısal tutarlılık ve geri çağırma üzerinde daha büyük bir etkiye sahip olduğunu, öznitelik füzyonunun ise görünüm ile yapısal bilgi arasındaki hizalamayı iyileştirdiğini göstermektedir.
Verimlilik analizi, tam modelin hesaplama maliyetini ResNet-50 temel modeli ile karşılaştırmaktadır. ResNet-50 temel modeli 25,6 milyon parametre ve 4,1 milyar kayan nokta işlemi gerektirmiştir. Tam yapı-duyarlı model ise 29,3 milyon parametre ve 5,4 milyar kayan nokta işlemi gerektirmiştir. Ortalama çıkarım süresi temel model için görüntü başına 15 milisaniye, tam model için ise görüntü başına 22 milisaniye olup 7 milisaniyelik bir artış göstermiştir. Bu sonuç, protokolün zamana duyarlı iş akışlarına uygulanması sırasında dikkate alınması gereken ölçülebilir bir hesaplama maliyetine işaret etmektedir (Tablo 5)). Yapısal kısıt ağırlığı, nihai test değerlendirmesinden önce doğrulama setinden belirlenmiştir. Doğrulama Recall@5 değerleri; 0,1; 0,3; 0,5; 0,8; 1,0; 1,2; 1,5 ve 2,0 yapısal kısıt ağırlıklarında incelenmiştir. Sonraki her eğitim ve test çalışması için 1,0 ağırlığı sabitlenmiştir. Şekil 11 , 1,0 yapısal kısıt ağırlığının doğrulama tabanlı seçimini belgelemektedir.

Şekil 1: Yapı duyarlı giysi görüntüsü özellik öğrenme protokolünün genel iş akışı. Giriş giysi görüntüsü, bir görünüm özelliği dalı ve semantik ayrıştırma ile uzamsal grafik modelleme kullanan bir yapısal özellik dalı tarafından işlenir. İki temsil, nihai yapı duyarlı özelliği oluşturmak için yapı güdümlü füzyon modülü tarafından işlenir. Yapısal tutarlılık kaybı, yapısal ayrıştırma kaybı ve yapısal ilişki kaybı özellik uzayını ortaklaşa kısıtlar. Şekil, özellik öğrenimi boyunca giysi görünümünün ve bileşen topolojisinin nasıl entegre edildiğini göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 2: Görüntü düzeyinde bir giysi bileşeni topolojisinin ön inşası. (A) Giriş giysi görüntüsü I. (B) Yedi rengin görüntü düzeyindeki giysi bölgelerini belirttiği, ön plana kısıtlanmış görsel bileşen haritası P. Tüm arka plan pikselleri bileşen kanallarından hariç tutulmuştur. (C) Görüntü düzeyindeki bileşen ilişki grafiği G. Düğümler görünür giysi bölgelerini, düz çizgiler paylaşılan ön plan sınırlarını ve kesikli çizgiler önceden tanımlanmış dikey sıralamayı temsil eder. Harita ve grafik, görüntü geri çağırma ve görsel yapı karşılaştırmayı destekler. Bunlar dikiş kalıbı parçalarını, dikiş geometrisini, pens yapılarını, seri büyütme parametrelerini veya kesim talimatlarını temsil etmez. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 3: Yapı kılavuzlu öznitelik füzyon modülü. Yapısal öznitelik, bir yapı ağırlığı oluşturmak için lineer eşleme ve aktivasyon fonksiyonu Ψ ile dönüştürülür. Yapı ağırlığı, eleman bazlı çarpma yoluyla görünüm özniteliğini modüle eder. Modüle edilmiş görünüm özniteliği ile yapısal öznitelik birleştirilir ve Wc ile projekte edilir; ardından nihai bileşen özniteliğini oluşturmak için rezidüel yapısal öznitelik eklenir. Şekil, yapısal bilginin nihai füzyondan önce görünüm özniteliği ağırlıklandırmasını düzenlediğini göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 4: Yapısal tutarlılık kısıtlamaları altında öznitelik alanı optimizasyonu. (A) Aynı yapısal sınıfa ait örnekler, yapı tutarlılığı kaybı aracılığıyla birbirine yaklaştırılırken, dahili bileşen ilişkileri yapı ilişkisi kaybı ile korunur. (B) Farklı yapısal sınıflardan gelen örnekler, yapı ayrıştırma kaybı ile birbirinden uzaklaştırılır. Şekil, üç yapısal amacın sınıf içi sıkılığı ve sınıflar arası ayrımı birlikte nasıl artırdığını göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 5: Temsili giysi özelliği yanıtları ve bileşen-grafik görselleştirmesi. (A) Girdi giysi görüntüsü. (B) ResNet-50 görünüm temel modelinin sınıf aktivasyon yanıtı. (C) Görüntü düzeyindeki giysi bileşen grafiği; Protokol bölümleri 3 ve 4 sırasında kaydedilen ön plana kısıtlanmış bileşen haritası, bileşen merkez matrisi, tipli komşuluk matrisi, inaktif-düğüm maskesi ve bileşen etiket eşlemesinden yeniden oluşturulmuştur. Düğümler aktif giysi bölgelerini, düz çizgiler paylaşılan ön plan sınırlarını ve kesikli çizgiler önceden tanımlanmış dikey-sıra ilişkilerini belirtir. (D) Birleştirilmiş bileşen farkındalıklı temsilin aktivasyon yanıtı. Karşılaştırma, doku baskın aktivasyon ile giysi bölgesi kılavuzlu aktivasyon arasındaki farkı göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 6: Kırmızı arka plan girişimi altında geri çağırma sonuçları ve ara yapısal kanıtlar. (A) Sorgu görüntüsü. (B) Sorgu bileşen grafiği, kaydedilen bileşen merkezlerinden ve türlendirilmiş komşuluk matrisinden oluşturulmuştur. (C) Matris değerlerinin inaktif ilişkileri, paylaşılan ön plan sınırlarını ve önceden tanımlanmış dikey sıra ilişkilerini ayırt ettiği sorgu türlendirilmiş komşuluk matrisi. (D) Görünüm tabanlı referans tarafından üretilen en iyi üç geri çağırma sonucu. (E) Yapı-duyarlı temsil tarafından üretilen en iyi üç sonuç. (F) En yüksek sıralamaya sahip yapı-duyarlı sonucun bileşen grafiği. (G) Sorgu ile en yüksek sıralamaya sahip sonuç arasındaki füzyon sonrası bileşen karşılık matrisi. Yüksek diyagonal karşılıklık, aynı tanımlayıcılara sahip bileşenler arasındaki uyumu gösterirken; zayıf veya kaymış yanıtlar, eksik veya uyumsuz bileşen organizasyonuna işaret eder. Geri çağırma sonuçları, kaba üst gövde kategorisini korumakta ancak kol konfigürasyonu ve yerel topolojide tam bir uyum sağlamamaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 7: Görüntü düzeyindeki giysi topolojisinden mekansal yanıta kadar yapısal fark izleme. (A) Referans görüntü. (B) Hedef görüntü. (C) Referans bileşen grafiği. (D) Hedef bileşen grafiği. Her iki grafik de kaydedilen bileşen merkezlerinden ve tiplendirilmiş komşuluk matrislerinden yeniden oluşturulmuştur. (E) Tiplendirilmiş komşuluk fark matrisi. (F) Geometrik ilişki farkı; bileşen merkezi yer değiştirmesi, mekansal dağılım ve ilişki ağırlığındaki değişikliklerden türetilmiştir. (G) Düğüm yoğunluğunun karşılık gelen birleştirilmiş bileşen vektörleri arasındaki normalize edilmiş mesafeyi, kenar genişliğinin ise ilişki ağırlığı değişimini temsil ettiği füzyon sonrası bileşen fark grafiği. (H) Saf mekansal fark-yanıt ısı haritası, üst katmanla aynı sabit yanıt ölçeği kullanılarak oluşturulmuştur. (I) Hedef görüntü üzerine bindirilmiş yanıt. Yapısal bir fark, yalnızca komşuluk değişimi, geometrik ilişki değişimi, bileşen mesafesi değişimi ve ön planla hizalı ısı yanıtı tutarlı kaldığında kabul edilir. Bileşenlerin veya ilişkilerin karşılık gelen kanıtları olmaksızın meydana gelen arka plan aktivasyonu, geçerli bir giysi yapısı farkı yerine artık girişim olarak değerlendirilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 8: Yapı farkındalıklı öznitelik alanı kümeleme. (A) Kısa kollu üstler, pantolonlar, etekler, uzun paltolar ve elbiselerin t-SNE projeksiyonu. Beş kategori, aralarındaki sınırlarda sınırlı örtüşme ile ana öznitelik bölgelerini oluşturmaktadır. (B) Beş giysi kategorisine atanmış temsilci test görüntüleri; kenarlık rengi (A) bölümündeki kategori rengine karşılık gelmektedir. Şekil, komşu kategori bölgelerinin yakınında az sayıda örnek tutarken kategori düzeyindeki yapısal organizasyonu göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 9: Özellik-uzay yapısı ve geri çağırma-sıralama hedefleri genelinde ham performans karşılaştırması. (A) Görünüm tabanlı temel model, zayıf yapılı model, açık yapılı model ve önerilen yöntem için SCI ve SDI değerleri. (B) Aynı dört yöntem için Recall@5 ve mAP değerleri. Büyük işaretçiler beş bağımsız çalışmanın aritmetik ortalamasını, hata çizgileri örnek standart sapmayı ve küçük işaretçiler çalışma düzeyindeki sonuçları göstermektedir. SCI ve SDI sıfırdan bire kadar sabit bir ölçekte, Recall@5 ve mAP ise sıfırdan yüze kadar sabit bir yüzde ölçeğinde görüntülenmiştir. Herhangi bir min-max normalizasyonu veya yöntemler arası yeniden ölçeklendirme uygulanmamıştır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 10: Farklı modül konfigürasyonları altındaki yapısal fark yanıtları. (A) Referans görüntü. (B) Hedef görüntü. (C) Yapısal ön bilgisi (structure prior) olmayan varyantın yanıtı. (D) Füzyon modülü olmayan varyantın yanıtı. (E) Tam modelin yanıtı. (C–E) aynı normalize edilmiş yanıt ölçeği, renk haritası ve bindirme ayarları kullanılarak oluşturulmuştur. (F) Füzyon olmayan varyant ile tam model arasındaki ön planla sınırlandırılmış mutlak yanıt farkı. Tam model, ana yapısal bölgenin dışındaki artık yayılımı azaltırken, giysiyle hizalanmış temel yanıtı korur. Karşılaştırma, yapısal ön bilginin giysi dışı girişimi azalttığını ve füzyon modülünün yapısal yanıtı daha da keskinleştirdiğini göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 11: Yapısal kısıtlama ağırlığının doğrulama tabanlı seçimi. 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5 ve 2.0 yapısal kısıtlama ağırlıklarında Doğrulama Recall@5 değerleri raporlanmıştır. Her nokta beş doğrulama çalışması boyunca alınan aritmetik ortalamayı, her hata çizgisi ise örnek standart sapmasını göstermektedir. Ağırlık, final test değerlendirmesinden önce 1.0 olarak sabitlenmiştir. Bu şekil, parametre seçim prosedürünü belgelemekte olup bağımsız bir mimari katkı teşkil etmemektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.
Tablo 1: S1'den S5'e kadar olan giysi alt kümelerinde veri kümesi tahsisi ve görüntü düzeyindeki topoloji istatistikleri. Tablo; eğitim, doğrulama, test ve toplam görüntü sayılarını, her bir yapısal seviye için ortalama semantik bileşen sayısı, aktif düğüm sayısı, tipli kenar sayısı ve açıklanmış görüntü düzlemi işaret noktası sayısı ile birlikte raporlamaktadır. Tüm değerler, işlenmiş veri manifestolarından oluşturulmuştur. Eğitim, doğrulama ve test görüntü sayıları; yapısal inceleme, kopya grup kontrolü ve sızıntı denetiminden sonraki nihai alt küme manifestolarından elde edilmiş; topoloji istatistikleri ise model değerlendirmesi sırasında uygulananlarla aynı bileşen sırası ve ilişki tanımlamaları kullanılarak nihai grafik kayıtlarından hesaplanmıştır. Lütfen bu dosyayı indirmek için buraya tıklayınız.
Tablo 2: Protokol boyunca kullanılan hesaplama ortamı, girdi konfigürasyonu, artırma, temsil, optimizasyon, kayıp ve tekrarlanabilirlik ayarları. Tablo; işletim sistemi, işlemci, yüklü bellek, grafik işlem birimi, grafik belleği, grafik sürücüsü, CUDA, cuDNN, Python, NumPy, PyTorch ve torchvision versiyonlarının yanı sıra görüntü boyutu, grup oluşturma, optimize edici, öğrenme oranı çizelgesi, epok sayısı, rastgele tohumlar, temsil boyutları ve yapısal hedef ağırlıklarını bildirmektedir. Her değer software_versions.txt, configs/protocol.yaml veya ilgili eğitim kaydıyla ilişkilendirilmiştir. Lütfen bu dosyayı indirmek için buraya tıklayın.
Tablo 3: Genel görsel temsil modellerinin, grafik tabanlı giysi modellerinin ve alana özgü moda erişim yöntemlerinin nicel karşılaştırması. Tablo; aynı veri bölümleri ve değerlendirme protokolü altında on bir yöntem için erişim odağını, sorgu modalitesini, SCI, SDI, Recall@5, mAP ve siluet katsayısını raporlamaktadır. Her bir metrik, beş bağımsız çalıştırma üzerinden ortalama ve örnek standart sapma olarak bildirilmiştir. Raporlanan p-değerleri, aynı beş rastgele tohum altında üretilen sonuçlar kullanılarak, her bir karşılaştırma yönteminin önerilen yöntemle kıyaslandığı iki yönlü eşleştirilmiş t-testlerinden elde edilmiştir. Önerilen yöntem, referans satır olarak kabul edilmiştir. Bu dosyayı indirmek için lütfen buraya tıklayın.
Tablo 4: Yapısal ön bilgi ve özellik-füzyon modülü için ablasyon sonuçları. Tablo; yapısal ön bilgi içermeyen varyant, füzyon modülü içermeyen varyant ve tam model için SCI, SDI ve Recall@5 değerlerini raporlamaktadır. Yapısal ön bilginin kaldırılması SCI ve Recall@5 değerlerinde daha büyük bir azalmaya yol açarken, füzyon modülünün kaldırılması SDI ve yanıt hizalamasını azaltmaktadır. Tam model, her üç metrik için de en yüksek değeri kaydetmiştir. Bu dosyayı indirmek için lütfen buraya tıklayın.
Tablo 5: ResNet-50 temel modelinin ve tam yapı-farkındalıklı modelin hesaplama verimliliği. Tablo, Tablo 2'de ve Materyaller Tablosunda belgelenen donanım ve yazılım ortamı altında eğitilebilir parametreleri, görüntü başına kayan nokta işlemlerini ve görüntü başına ortalama çıkarım süresini rapor etmektedir. Her iki model de aynı görüntü çözünürlüğünü, çıkarım paket ayarını, ön işleme işlemlerini ve zamanlama prosedürünü kullanmaktadır. Tam model, temel modele kıyasla 3,7 milyon parametre, 1,3 milyar kayan nokta işlemi ve görüntü başına 7 milisaniyelik çıkarım süresi eklemektedir. Bu dosyayı indirmek için lütfen buraya tıklayın.