본 프로토콜은 시맨틱 컴포넌트 파싱, 토폴로지 모델링, 듀얼 스트림 특징 인코딩 및 구조 가이드 융합을 통합하여 구조 인식 의류 표현형을 생성합니다. 이를 통해 컴퓨터 비전 및 의류 연구자는 색상이나 질감이 아닌, 컴포넌트 구성 및 실루엣 배치를 기반으로 의류 검색 및 디자인 참조 비교를 수행할 수 있습니다.
본 프로토콜은 시맨틱 컴포넌트 파싱, 토폴로지 모델링, 듀얼 스트림 특징 인코딩 및 구조 가이드 융합을 통합하여 구조 인식 의류 표현형을 생성합니다. 이를 통해 컴퓨터 비전 및 의류 연구자는 색상이나 질감이 아닌, 컴포넌트 구성 및 실루엣 배치를 기반으로 의류 검색 및 디자인 참조 비교를 수행할 수 있습니다.
의류 이미지 검색 방법은 주로 색상과 질감을 강조하는 경향이 있으며, 이는 외형은 비슷하지만 구성 요소의 배치가 다른 의류 간의 혼동을 야기할 수 있습니다. 본 연구에서는 의류 이미지 검색 및 디자인 참조 비교를 위한 구성 요소 인식 특징 학습 프로토콜을 제시합니다. 이 프로토콜은 의류의 의미론적 영역을 분석하고, 이미지 수준의 의류 구성 요소 그래프를 구축하며, 외형과 구성 요소 간의 관계를 병렬적으로 인코딩한 후, 구조적 일관성, 구조적 관계 및 구조적 판별 손실을 사용하여 두 표현을 융합합니다. DeepFashion2 이미지를 512 x 512 픽셀로 표준화하고 HRNet-W48로 분석하며, ResNet-50 및 그래프 컨볼루션을 통해 인코딩한 후 구조적 검색 및 클러스터링을 통해 평가하였습니다. 전체 모델은 0.81의 구조적 일관성 지수, 0.71의 구조적 판별 지수, 89.2%의 Recall@5, 86.4%의 평균 정밀도 평균(mAP), 그리고 0.74의 실루엣 계수를 달성했습니다. 본 프로토콜은 표면 외형만으로는 의류 구조를 신뢰성 있게 나타낼 수 없을 때, 의류 구조 검색, 구조적 비교 및 차이 위치 파악을 지원합니다.
컴퓨터 비전과 인공지능의 의류 산업 통합이 지속됨에 따라, 의류 이미지 분석은 기본적인 인식 작업에서 디자인 중심의 분석 및 의사 결정 지원으로 점차 확대되었습니다1,2. 의류 디자인 프로세스에서 디자인 안의 구분은 단순한 외관의 차이보다는 구조적 구성과 구성 요소 간의 관계에 더 많이 의존하며, 이는 디자인 보조 시 의류 이미지 특징의 구조적 표현력이 분석의 효과를 결정짓는 핵심 요인이 됩니다3,4. 그러나 기존의 대부분의 시각적 방법들은 여전히 질감, 색상, 전체적인 윤곽을 주요 특징으로 사용하고 있어, 디자인 과정 중 의복의 계층 구조와 구성 차이를 체계적으로 분석하는 데 어려움이 있습니다5,6. 따라서 의류 디자인 보조를 위해 구조 인지형 이미지 특징 학습 방법을 개발하는 것은 디자인 분석의 객관성과 일관성을 향상시키는 데 중요합니다7. 본 프로토콜은 의복들이 유사한 색상, 질감 또는 전체적인 윤곽을 공유하지만 구성 요소의 조직, 연결 패턴 또는 공간적 배치가 다른 경우에 적합합니다. 이러한 조건에서 외관 중심의 표현 방식은 구조적으로 서로 다른 디자인을 특징 공간에서 가깝게 배치하는 경향이 있어, 검색 및 디자인 비교의 신뢰성을 떨어뜨립니다. 본 프로토콜은 의복 구성 요소 간의 관계가 구조적 검색, 디자인 평가 및 국소적 차이 분석의 주요 기초가 되는 과제들을 다룹니다.
데이터 규모, 모델 복잡성 및 작업 다양성 측면에서 의류 이미지의 자동 분석 및 이해에 관한 현재 연구는 상당한 진전을 이루었습니다8,9. 하지만 실제 응용 분야에서 의류의 구조적 정보는 종종 세그멘테이션(segmentation)이나 검출 결과에 암묵적으로 포함되어 있으며, 특징 학습 단계의 통합 모델링에서 고려되지 않아 특징 공간 내에서 서로 다른 구조적 디자인 간의 안정적인 구분이 부족한 실정입니다10,11. 의복 구성 요소 간의 공간적 관계, 계층적 제약 및 위상 구조가 명시적으로 인코딩되지 않아, 특징 표현이 디자인 수준에서의 구조적 차이를 반영하기 어렵습니다12,13. 명시적인 구조적 모델링의 부재는 디자인 보조 시나리오에서 의류 이미지 특징의 분석 입도와 결정 신뢰성을 제한하며, 이는 더 깊은 세만틱 이해를 갖춘 지능형 디자인 시스템 개발의 주요 장애물이 되고 있습니다14.
의류 이미지 특징 학습 및 분석을 지원하기 위해 관련 연구들에서는 여러 기술적 방향을 탐색해 왔습니다15. 시맨틱 세그멘테이션(semantic segmentation) 및 의류 파싱(garment parsing) 방법은 픽셀 수준의 어노테이션을 통해 의류 영역과 구성 요소의 세밀한 묘사를 가능하게 하여 구조적 정보 추출의 기반을 제공했습니다16,17. 이미지 쿼리 기반의 의류 검색 방법에는 토폴로지 및 색상-질감 융합, 전역 및 지역 어텐션 정렬, 의류 파싱, 다중 스케일 및 다중 입도 표현, 그리고 특징 선택을 포함한 잔차 어텐션(residual attention) 등이 도입되었습니다. 이러한 방법들은 카탈로그 검색, 소비자-매장 매칭, 교차 도메인 제품 검색 및 이커머스 시각 검색 문제를 해결합니다. 각 방법이 시각적 쿼리를 기반으로 의류 이미지의 순위를 매기기 때문에 그 적용 환경은 디자인 참조 검색과 밀접한 관련이 있지만, 특징 융합 과정 전반에서 유형별 구성 요소의 인접성 및 수직적 순서 관계를 보존하지는 않습니다18,19,20. 한편, 디자인 및 추천 시나리오에 관한 연구에서는 멀티모달 융합, 관계 모델링 및 스타일 분석이 점진적으로 도입되어 의류 시각 특징의 응용 범위가 확장되었습니다21,22. 이러한 방법들이 각자의 과제에서 진전을 이루었음에도 불구하고, 핵심 특징은 여전히 상당 부분 외형 묘사에 기반하고 있으며, 구조적 정보가 특징 학습을 위한 내재적 제약 조건으로 일관되게 모델링되지 않아 구조적 정렬 및 구조적 비교를 통한 의류 디자인 지원 요구를 충족시키기 어려운 실정입니다23.
의류 디자인 보조 분야에서 부족한 구조적 차별화 능력을 해결하기 위해, 본 논문은 의류 구조 인식을 기반으로 한 이미지 특징 학습 방법을 제안합니다. 이 방법은 의류 분석 결과와 핵심 구조 정보를 의류 이미지 입력 단계에 통합하여, 의류 구성 요소 영역, 공간적 관계 및 계층적 연결을 공동으로 모델링합니다. 구조적 관계 인코딩과 시각적 특징 정렬은 의류 제약 조건을 특징 학습 과정에 명시적으로 통합하여, 시각적 외형과 구조적 일관성을 모두 유지하는 표현을 생성합니다. 이러한 특징은 단일 공간 내에서 의류의 구조적 차이를 특성화하여 이후의 구조적 유사도 분석, 구조적 클러스터링 및 디자인 보조 의사결정을 위한 안정적인 기반을 제공함으로써, 기존 방법의 구조적 모델링 부재로 인해 발생하는 특징 혼동 문제를 완화합니다. 구조적 정보를 느슨하게 연결된 보조 속성으로 취급하는 일반적인 시각적 검색 전략과 달리, 본 프레임워크는 위상 관계 중심의 특징 변조 메커니즘을 구축합니다. 이 메커니즘은 학습된 표현이 가시적인 의류 영역 조직을 따르도록 유도하는 동시에 텍스처 중심의 반응을 감소시킵니다. 각 그래프 노드는 이미지 수준의 시맨틱 영역을 나타내며, 각 그래프 관계는 이미지 평면에서의 가시적 인접성 또는 정규화된 상대적 위치를 설명합니다. 결과적으로 생성된 임베딩은 여러 의류 이미지 간의 구성 요소 배치 및 실루엣 조직의 비교를 지원합니다. 이러한 영역과 관계는 재단 패턴 조각, 솔기 연결, 제작 랜드마크 또는 그레이딩 파라미터가 아닙니다. 외형 중심의 검색 방법과 비교하여, 본 프로토콜은 구조적 정보를 하위 분석 결과로 취급하는 대신 특징 학습 전 과정에서 명시적인 구성 요소 위상을 유지합니다. 구조적 단서를 보조 입력으로만 도입하는 접근 방식과 비교하여, 이중 스트림 인코딩과 위상 일관성 융합은 기하학적 관계를 보존하면서 텍스처 중심의 반응을 감소시킵니다. 결과적으로 생성된 표현은 의류 구조 검색, 구조적 클러스터링, 디자인 참조 스크리닝 및 국소적 디자인 차이 분석을 지원하며, 의류 디자인 과정에서 해석 가능한 구성 요소 수준의 근거를 제공합니다. 본 프로토콜과 관련된 연구 분야는 의류 이미지 특징 학습, 의류 구조 모델링, 구조 인식 표현 및 의류 디자인 보조를 위한 시각적 분석을 포괄합니다.
특징 표현 수준에서 의류 이미지 연구는 오랫동안 외형 모델링, 심층 특징 추출 및 다중 스케일 표현에 집중해 왔습니다24,25. 초기 연구에서는 합성곱 신경망을 사용하여 분류, 검색 및 유사도 매칭 작업을 위한 의류 이미지의 엔드-투-엔드 모델링을 수행했습니다26,27. 이후 서로 다른 시야각, 포즈 및 촬영 조건 하에서의 의류 이미지 차이를 완화하기 위해 다중 스케일 특징 융합 및 교차 도메인 학습이 도입되었습니다28,29. 검색 작업에서는 특징의 변별력과 계산 효율성을 높이기 위해 어텐션 메커니즘과 특징 압축 전략이 사용되었습니다30,31. 이러한 방법들은 신뢰할 수 있는 외형 변별을 가능하게 하지만, 특징 학습 과정이 여전히 전역적인 시각 정보에 집중되어 있어 의복 내부 구조에 대한 체계적인 표현이 부족합니다32. 구성 패션 검색 방법은 참조 이미지와 텍스트 수정 지시어를 추가로 결합하지만, 이는 본 연구에서 다루는 이미지 전용 프로토콜과는 쿼리 모달리티가 다릅니다. 해당 방법들은 관련 상용 검색 방향으로 검토되었으며, 추가적인 텍스트 입력이 통제된 이미지 쿼리 평가를 방해할 수 있으므로 정량적 비교에서는 제외되었습니다.
의류 이미지 분석이 외형 식별에서 구조적 이해로 전환됨에 따라, 의복 구성 요소, 기하학적 관계 및 위상학적 연결을 모델링하는 연구가 점점 더 주목받고 있습니다33. 시맨틱 세그멘테이션 네트워크는 특징 투영과 다중 어텐션 메커니즘을 통해 의류 구성 요소 수준의 분석을 달성함으로써 구조적 정보 추출을 위한 신뢰할 수 있는 기반을 제공했습니다34,35. 키포인트 검출 및 구조적 위상 모델링 방법은 의복 외곽선과 국소 구조 간의 관계를 더욱 구체화하여 의류의 기하학적 특징을 표현하는 모델의 능력을 향상시켰습니다36,37. 여러 연구에서는 그래프 구조와 관계 추론 네트워크를 도입하여 의류 구성 요소 간의 관계를 모델링함으로써 세밀한 인식 및 교차 도메인 검색 성능을 개선했습니다38,39. 이러한 연구들은 시각적 분석에서 구조적 정보의 중요한 역할을 입증했으나, 구조는 주로 보조적인 특징이나 중간 결과로 사용되었을 뿐, 구조적 제약을 핵심으로 하는 특징 학습 시스템은 아직 개발되지 않은 상태입니다40.
의류 디자인 지원 분야에서 이러한 발전은 디자인 추천, 스타일 분석, 대화형 시스템 구축 및 구조 중심의 디자인 평가를 뒷받침해 왔습니다41. 추천 시스템 연구는 시각적 특징과 사용자 선호도를 결합하여 의류 매칭 및 개인 맞춤형 추천을 구현하였습니다42. 디자인 지원 관련 연구는 생성 모델, 스타일 모델링 및 인간-컴퓨터 협업 메커니즘을 결합하여 지능형 디자인 지원을 위한 새로운 경로를 탐색해 왔습니다43. 가상 피팅, 사이즈 측정 및 스타일 전이 연구는 디자인과 생산 공정 전반에 걸쳐 의류 시각 분석의 응용 범위를 넓혔습니다. 이러한 연구들이 의류 디자인 지원의 기술적 형태를 풍성하게 했음에도 불구하고, 핵심 시각적 특징은 여전히 주로 외형에 기반하고 있으며 분석을 위한 디자인 구조의 통합된 표현 방식이 부족한 실정입니다. 이와 대조적으로, 본 논문에서는 의복 구조를 특징 표현의 핵심 제약 조건으로 취급하며, 의류 디자인 지원의 구조적 분석을 위한 시각적 표현 방법을 제공합니다.
이러한 발전에도 불구하고, 생성형 디자인의 최근 방법들은 구조적 조건을 확산 과정 내의 느슨한 공간 안내 행렬로 처리하는 경우가 많습니다. 현대의 구조적 파싱 프레임워크는 토폴로지를 기본 시각적 임베딩 공간과 분리된 보조 세맨틱 레이블로 표현합니다. 제안된 프레임워크는 컴포넌트 수준에서 시각적 특징 학습을 명시적으로 조절하는 그래프 사전 기반의 토폴로지 제약 조건을 정의함으로써 이러한 메커니즘을 변경합니다. 다층적 일관성 목적 함수는 이미지 수준의 컴포넌트 레이아웃이 유사한 의류가 특징 공간 내에서 가깝게 유지되도록 하는 동시에, 가시 영역 구성이 다른 의류는 서로 분리되도록 유도합니다. 이 목적 함수는 평가된 검색 설정에서 텍스처 의존도를 낮추지만, 재질, 포즈 또는 배경의 변화에 대한 불변성을 확립하지는 않습니다. 입력 이미지에 개별 의류가 충분히 가시적이고, 세맨틱 컴포넌트가 식별 가능한 경계를 유지하며, 분석 목적이 거친 카테고리 인식보다는 컴포넌트 수준의 구조적 비교를 요구할 때 이 프로토콜을 선택해야 합니다. 본 프로토콜은 구조 민감성 시각 분석을 수행하는 컴퓨터 비전 연구원, 의류 디자인 연구원 및 디지털 의류 개발 팀을 대상으로 합니다. 색상이나 재질 인식에만 집중하는 작업 또는 의류 토폴로지가 대부분 가려진 이미지에는 적합하지 않습니다. 다음 프로토콜은 데이터셋 준비와 세맨틱 확률 매핑부터 기하학적 관계 구축, 듀얼 스트림 특징 인코딩, 구조 안내 융합 및 일관성 기반 최적화에 이르는 워크플로우를 제시합니다. 전체 워크플로우는 그림 1에 요약되어 있습니다.
본 연구는 공개적으로 이용 가능한 의류 이미지 데이터셋을 사용하며, 인간 대상자 모집, 개인 식별 정보 수집, 동물 실험 수행 또는 생물학적 제제 사용을 포함하지 않습니다. 따라서 기관 윤리 위원회의 승인 및 고지된 동의 절차는 해당되지 않습니다.
1. 소프트웨어 환경 및 프로젝트 구성
2. 입력 이미지 수용, 데이터셋 구축 및 전처리
3. 전경 제한 시각 구성 요소 파싱 및 확률 매핑
4. 이미지 수준의 구성 요소 기하학 및 공간 관계 모델링
5. 이중 스트림 구조 인식 특징 인코딩
6. 구조 기반 특성 융합
7. 모델 학습 및 일관성 최적화
8. 추론, 검색, 클러스터링 및 출력 검증
9. 비교 모델 평가
보고된 모든 실험은 표 2 및 재료 표에 기록된 하드웨어 및 소프트웨어 환경을 사용하여 수행되었습니다. 전처리, 훈련, 추론 및 평가 전 과정에서 동일한 그래픽 드라이버, CUDA, cuDNN, Python, NumPy, PyTorch 및 torchvision 버전이 사용되었습니다. 전체 하드웨어 및 소프트웨어 환경은 표 2와 재료 표에 요약되어 있습니다. 표 1은 처리된 훈련, 검증 및 테스트 데이터셋을 이미지 수준의 위상 통계와 함께 요약하여 보여줍니다. 표 2는 모든 비교 방법에 사용된 공통 설정을 요약하고 있습니다.
비교 평가 결과
비교 평가는 프로토콜 섹션 7~9에 명시된 공통 데이터 분할, 전처리 작업, 훈련 제어 및 지표 정의를 따랐습니다. 표 3에서는 동일한 이미지 쿼리 프로토콜을 사용하여 평가한 일반 시각 인코더, 부분 정렬 모델, 그래프 기반 의류 표현, 교차 도메인 패션 검색 네트워크, 위상 및 외형 융합 방법, 그리고 이커머스 시각 검색 방법을 비교합니다. 도메인 특화 방법으로는 색상 및 질감 융합 기반 위상 특징 히스토그램(TFH-CT), 어텐션 가이드 캐스케이드 네트워크(AGC-Net), 다중 스케일 및 다중 세밀도 특징 학습 네트워크(MMFL-Net), 그리고 Egret Swarm Optimization 기반 잔차 네트워크를 이용한 패션 검색(FARE-RNET)이 포함됩니다. 표 3의 모든 평가 지표는 동일한 랜덤 시드, 훈련 매니페스트, 검증 매니페스트, 테스트 매니페스트, 쿼리-갤러리 할당 및 지표 구현을 사용하여 5회 독립적으로 실행한 결과의 평균과 표본 표준 편차로 보고되었습니다. 대응 표본 p-값은 일치하는 랜덤 시드 조건에서 각 방법을 제안된 방법과 비교하여 SCI, SDI, Recall@5, mAP 및 실루엣 계수에 대해 각각 계산되었습니다. 이러한 결과는 이후의 구조적 시각화, 검색, 클러스터링 및 디자인 지향 분석을 위한 정량적 근거를 제공합니다.
대표적인 프로토콜 결과 및 해석
저장된 파싱 및 그래프 파일로부터 재구성된 이미지 수준의 컴포넌트 그래프가 모든 활성 노드를 해당 의류 영역 내에 배치하고, 그림 5C에 표시된 것처럼 타입 지정 인접 행렬에 기록된 관계 유형을 유지할 때 프로토콜이 성공적으로 실행된 것으로 판단합니다. 구조 인식 응답은 그림 5D에 표시된 것처럼 의류 전경에 집중되어 있어야 합니다. 그림 6E는 제안된 방법이 빨간색 배경의 영향을 줄여 무관한 빨간색 물체가 아닌 상의 의류를 검색하는 예상 검색 결과를 보여줍니다. 그림 6B–G는 또한 검색 순위가 이미지 수준의 컴포넌트 관계 및 융합 후 컴포넌트 대응에 의해 뒷받침됨을 입증합니다. 이러한 결과는 소매 길이와 국소적 위상(topology)이 검색된 샘플 간에 여전히 다르지만, 대략적인 의류 카테고리가 회복되었음을 반영합니다.
일반적인 실패 사례로는 그림 5B의 질감 중심 활성화, 그림 6의 상단 행에 나타난 배경색 기반 검색, 그리고 그림 7의 잔류 배경 활성화 등이 있습니다. 그림 7의 경우, 지배적인 응답이 확대된 하체 실루엣과 오른쪽 의복 경계선을 따르는 반면 인접한 배경 영역에는 잔류 활성화가 남아 있으므로 부분적 국소화로 해석해야 합니다. 위상 차이 행렬, 기하학적 관계 차이 행렬, 융합 후 컴포넌트 차이 그래프 및 공간 응답이 일관된 의복 영역을 식별할 때에만 국소화가 구조적으로 뒷받침된 것으로 간주합니다. 행렬이나 컴포넌트의 상응하는 변화 없이 나타나는 공간적 핫스팟은 구조적 증거라기보다 시각적 간섭을 나타냅니다.
수락된 모든 이미지가 정규화된 의미론적 확률 맵, K행 K열의 관계 행렬, K행 512열의 외관 및 구조 특징 행렬, 그리고 올바른 이미지 식별자와 연결된 유한한 융합 특징 벡터를 생성했을 때 프로토콜 실행이 유효한 것으로 간주합니다. 시각적 검사를 통해 토폴로지가 의류 구성 요소를 따르는지, 전경 응답이 배경 응답보다 큰지, 그리고 검색 결과가 배경색이 아닌 의류 카테고리와 구조에 의해 유도되는지를 확인해야 합니다. 단편화된 확률 맵, 누락된 구성 요소 노드, 비숫자 행렬, 확산된 배경 응답 또는 색상 중심의 검색 결과는 실행 실패를 나타내며, 파싱, 그래프 구축, 특징 융합 또는 체크포인트 로딩에 대한 검토가 필요합니다.
이미지 수준의 의류 구성 요소 반응에 대한 시각적 분석
그림 5는 동일한 의류 이미지를 사용하여 ResNet-50 베이스라인과 구성 요소 인식 모델을 비교합니다. 그림 5B는 외형 베이스라인의 클래스 활성화 맵을 보여줍니다. 그림 5C는 프로토콜 섹션 3과 4에서 생성된 전경 제한 확률 맵, 구성 요소 중심 행렬, 유형별 인접 행렬, 비활성 노드 마스크 및 구성 요소 레이블 매핑을 통해 재구성된 이미지 수준의 의류 구성 요소 그래프를 나타냅니다. 그림 5D는 융합된 표현의 활성 응답을 나타냅니다. 그림 5C를 생성하는 데 인간 포즈 추정기나 인간 관절 주석은 사용되지 않았습니다.
그림 5B에서 보듯이, 베이스라인 응답은 하의의 국소적인 질감 영역에 집중되었으며 의복의 전체 경계를 일관되게 따르지 않았습니다. 그림 5C에서 각 노드는 활성화된 의복 구성 요소 영역의 중심에 해당하며, 각 엣지는 공유된 전경 경계 또는 사전 정의된 수직 순서 관계를 나타냅니다. 이 그래프는 의복 영역의 구성을 반영하며 인체의 해부학적 관절을 나타내는 것은 아닙니다. 그림 5D에서 보듯이, 구조 인식 응답은 대부분의 배경 영역에서 낮은 활성도를 유지하면서 주요 의복 전경을 포괄하였습니다. 이러한 결과는 구성 요소 그래프와 특징 융합 모듈이 평가 대상 이미지에서 질감 중심의 활성화를 감소시켰음을 나타냅니다.
의류 구조적 유사성 분석 및 디자인 참조 결과
그림 6은 검색 순위와 이를 해석하는 데 사용된 구조적 근거를 보여줍니다. 그림 6B의 쿼리 구성 요소 그래프는 활성 의류 영역과 그 유형별 관계를 기록하며, 그림 6C의 행렬은 그래프 전파에 제공된 관계 패턴을 나타냅니다. 그림 6D의 베이스라인 결과는 여전히 빨간색의 외형 단서가 지배적입니다. 그림 6E의 구조 인식 결과는 서로 다른 색상과 배경에서도 상의 의류 카테고리를 유지합니다. 그림 6F에서 가장 순위가 높은 결과의 구성 요소 그래프를 통해 쿼리 그래프와 직접 비교할 수 있으며, 그림 6G의 대응 행렬은 동일한 식별자를 공유하는 구성 요소들이 구조 기반 융합 후에도 정렬 상태를 유지하는지 보여줍니다. 대각선 대응은 누락된 노드 및 변경된 그래프 관계와 함께 종합적으로 해석되어야 합니다. 그래프 일치 없이 외형만 유사한 경우는 성공적인 구조적 검색으로 간주되지 않습니다.
검색된 의류들은 대분류 범주는 유지하고 있으나, 소매 구성 및 국부적 구성 요소 간의 관계 차이는 세밀한 대응이 불완전함을 나타냅니다. 제안된 방법은 표 3에 보고된 바와 같이 Recall@5 89.2%와 mAP 86.4%를 달성했습니다. 이러한 정량적 수치는 랭킹 성능을 설명하며, 그림 6B–G는 해석을 뒷받침하는 중간 구조적 증거를 제공합니다. 따라서 검색 결론은 테스트된 쿼리 하에서 배경색 간섭에 대한 내성이 향상되었으며 이미지 수준의 구성 요소 조직화가 더 강력해진 것으로 제한됩니다.
구조적 차이 반응 및 설계 분석 지원
~에서의 순수 차이 반응 히트맵은 그림 7H 지배적인 반응이 대상 이미지의 확대된 하체 실루엣과 오른쪽 의복 경계에 집중되어 있음을 보여줍니다. 다음의 오버레이에서는 그림 7I 가장 강한 응답은 주요 의류 전경과 일치하는 반면, 인접한 커튼 및 벽 영역의 더 약한 활성화는 잔류 배경 간섭으로 남아 있음을 보여줍니다. 공간적 응답은 다음에 제시된 컴포넌트 그래프 및 행렬 증거와 함께 해석되어야 합니다. 그림 7C–G응답은 고응답 의류 영역이 인접성 변화, 기하학적 관계 변화, 그리고 융합 후 구성 요소 간 거리 패턴과 일치하는 경우에만 유효한 구조적 차이로 처리됩니다.
그림 7E의 유형화된 인접성 변화 또는 그림 7F의 기하학적 관계 변화가 그림 7G의 구성 요소 거리 증가 및 그림 7H,I의 전경 정렬 공간 응답과 동반될 때만 구조적 차이로 인정됩니다. 확장된 하체 영역과 오른쪽 의류 경계는 이러한 교차 단계 기준을 충족합니다. 커튼과 벽면의 활성화는 구성 요소 노드, 관계 패턴 또는 융합된 구성 요소 거리의 변화와 일치하지 않으며, 따라서 비구조적 잔류 간섭으로 간주하여 기각됩니다. 이 결과는 이미지 수준의 차이 국소화를 뒷받침하지만, 봉제 패턴이나 제작 파라미터의 변동을 입증하는 것은 아닙니다.
특징 공간 분포 및 구조적 클러스터 분석
잠재 특징 공간(latent feature space)의 분포를 분석하면 의류의 구조적 시맨틱을 식별하는 모델의 능력을 확인할 수 있습니다. 본 분석에서는 구조적 사전 정보가 서로 다른 위상적 구성을 가진 의류를 서로 다른 특징 매니폴드로 조직화하는지 조사합니다. 테스트 세트에서 대표적인 5가지 구조적 범주인 반소매 상의, 바지, 스커트, 롱코트, 원피스를 선정하였습니다. 고차원 특징 벡터는 t-분포 확률적 이웃 임베딩(t-SNE)을 사용하여 2차원 평면으로 투영되었습니다. 특징 공간 내 구조적 시맨틱의 조직 상태를 특성화하기 위해 유사한 샘플의 응집도와 서로 다른 샘플 간의 분리도를 평가하였습니다. 구조 인식 특징 공간의 t-SNE 분포는 그림 8에 나타나 있습니다.
그림 8A에 나타난 바와 같이, t-SNE 투영 결과 인접 범주 간의 중첩이 제한적인 5개의 주요 특징 영역이 형성되었습니다. 5개 범주 영역에 해당하는 대표 샘플들은 그림 8B에 제시되어 있습니다. 표 3에 보고되고 그림 8에서 시각화된 바와 같이, 0.81의 SCI는 동일한 구조적 레이블을 공유하는 샘플들의 응집도를 반영하며, 0.71의 SDI는 서로 다른 구조적 레이블을 가진 샘플 간의 분리도를 반영합니다. 이러한 지표들은 특징 공간 분포의 척도로 해석되어야 하며, 오경보율(false-alarm rate)을 직접적으로 설정하는 것은 아닙니다. 그림 8A에서 보이듯, 반팔 상의와 스커트는 투영된 특징 공간에서 서로 다른 주요 영역을 차지하였으며, 소수의 샘플만이 인접 범주 경계 근처에 머물렀습니다. 바지와 원피스 또한 인접 범주와 명확한 분리를 보였습니다. 이러한 분포는 그래프 사전 정보가 완전한 클러스터 분리를 생성하지 않으면서도 범주 수준의 구조적 조직화에 기여했음을 나타냅니다. 본 평가는 표현 품질과 검색 효율성을 분리하여 분석합니다. SCI는 동일한 구조적 레이블을 공유하는 의류가 학습된 특징 공간에서 응집된 상태를 유지하는지 평가하는 반면, SDI는 서로 다른 구조적 레이블을 가진 의류가 분리된 상태를 유지하는지 평가합니다. 이러한 지표들은 프로토콜의 구조적 표현 목표에 해당합니다. Recall@5는 구조적으로 관련 있는 의류가 검색 결과의 상위 5개 내에 나타나는지 측정하며, mAP는 모든 관련 갤러리 샘플에 걸친 순위 품질을 측정합니다. 이 지표들은 디자인 참조 검색 목표에 해당합니다. SCI와 SDI가 이미 특징 공간 조직화를 특성화하므로, 실루엣 계수는 클러스터링 성능을 평가하는 데에만 사용되었습니다.
그림 9는 방법 간 정규화 없이 네 가지 대표 방법론에 대해 5회 실행한 원시 결과를 나타냅니다. 그림 9A는 원래 척도에서의 SCI와 SDI를 보여주며, 그림 9B는 Recall@5와 mAP를 백분율로 보여줍니다. 개별 실행 마커와 표준 편차 오차선은 단순한 종합 순위가 아닌 모델 학습과 관련된 변동성을 나타냅니다. 외형 기반 베이스라인은 0.62의 SCI를 달성한 반면, 제안된 방법은 0.81의 SCI와 0.71의 SDI를 달성하였습니다(표 3 및 그림 9A). SCI 및 SDI 결과는 평가 설정 하에서 라벨 내 응집력과 라벨 간 분리도가 더 강력함을 나타냅니다. 제안된 방법은 89.2%의 Recall@5와 86.4%의 mAP를 달성하였습니다(표 3 및 그림 9B). 이러한 검색 메트릭은 서로 다른 순위 특성을 평가하며, SCI 및 SDI와는 별개로 해석됩니다. 네 가지 메트릭 전체에서 일관된 방법론 순위는 표현 품질과 검색 성능 사이의 일치성을 나타내지만, 이것이 네 가지 평가 차원 전반에서 상대적 개선 정도가 동일함을 의미하지는 않습니다.
어블레이션 실험 및 구조적 모듈의 유효성 분석
절제 실험(ablation experiment)을 통해 전체 모델을 구조적 사전 정보(structural prior) 또는 융합 모듈(fusion module)이 제거된 변형 모델들과 비교합니다. 세 가지 구성 모두 동일한 참조 이미지와 타겟 이미지를 사용하여 배경 응답과 국소화 집중도를 직접적으로 비교할 수 있도록 하였습니다. 구조적 사전 정보가 없는 변형 모델은 이미지 레벨의 의류 구성 요소 그래프와 그 관계 제약 조건을 제거하고, 외형 특징 추출을 위해 컨볼루션 백본에만 의존합니다. 융합이 없는 변형 모델은 그래프 추론은 유지하지만 특징 피라미드(feature pyramid)를 제거하고 고수준의 시맨틱 특징만을 사용합니다. 시각화된 차이 히트맵(difference heatmaps)을 통해 노이즈 억제와 경계 정의에서 각 모듈이 수행하는 구체적인 역할을 확인할 수 있으며, 서로 다른 모듈 구성에 따른 구조적 차이 응답의 정성적 비교가 그림 10에 제시되어 있습니다.
그림 10C–E의 응답 맵은 공유된 응답 척도와 동일한 오버레이 설정으로 렌더링되었습니다. 구조적 사전 지식(structure prior)이 없는 변이 모델은 그림 10C에 나타난 바와 같이 왼쪽 배경과 무관한 환경 영역 주변에서 강한 활성화를 생성했습니다. 퓨전 모듈(fusion module)이 없는 변이 모델은 의복 외 응답의 일부를 감소시켰으나, 그림 10D에서 보이듯 하의 및 우측 주변 영역에 걸쳐 여전히 더 넓은 확산을 유지했습니다. 전체 모델은 그림 10E와 같이 주된 응답을 주요 의복 전경 방향으로 더욱 수축시켰습니다. 그림 10F는 비퓨전 변이 모델과 전체 모델 간의 전경 제한 응답 차이를 직접적으로 시각화하며, 전체 모델이 주요 의복 정렬 응답은 보존하면서 잔여 측면 확산을 억제함을 보여줍니다. 이러한 결과는 구조적 사전 지식이 주로 환경 노이즈를 감소시켰으며, 퓨전 모듈이 응답 집중도와 구조적 정렬을 추가로 개선했음을 나타냅니다. 그림 10E 는 배경 활성화의 완전한 제거보다는 상대적인 개선을 나타냅니다.
표 4는 구조적 사전 정보(structure prior)가 없는 변체, 융합 모듈(fusion module)이 없는 변체, 그리고 전체 모델에 대한 SCI, SDI 및 Recall@5를 나타냅니다. 구조적 사전 정보를 제거했을 때 SCI는 0.81에서 0.65로, Recall@5는 89.2%에서 74.5%로 감소했습니다. 융합 모듈을 제거했을 때 SDI는 0.71에서 0.64로, Recall@5는 89.2%에서 85.1%로 4.1%포인트 감소했습니다. 이러한 결과는 구조적 사전 정보가 구조적 일관성과 검색에 더 큰 영향을 미쳤으며, 특징 융합(feature fusion)은 외형 정보와 구조 정보 간의 정렬을 개선했음을 나타냅니다.
효율성 분석을 통해 전체 모델과 ResNet-50 베이스라인의 계산 비용을 비교하였습니다. ResNet-50 베이스라인은 25.6 million 개의 파라미터와 4.1 billion 회의 부동 소수점 연산이 필요했습니다. 전체 구조 인식 모델은 29.3 million 개의 파라미터와 5.4 billion 회의 부동 소수점 연산이 필요했습니다. 이미지당 평균 추론 시간은 베이스라인의 경우 15 milliseconds, 전체 모델의 경우 22 milliseconds로 7 milliseconds 증가하였습니다. 이 결과는 시간 민감도가 높은 워크플로우에 해당 프로토콜을 배포할 때 고려해야 할 측정 가능한 계산 비용이 발생함을 나타냅니다(표 5)). 구조적 제약 가중치는 최종 테스트 평가 전 검증 데이터셋(validation split)을 통해 결정되었습니다. 구조적 제약 가중치를 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5, 2.0으로 설정하여 검증 Recall@5를 조사하였습니다. 이후의 모든 훈련 및 테스트 실행에는 1.0의 가중치를 고정하여 적용하였습니다. 그림 11 은 검증 기반의 구조적 제약 가중치 1.0 선택 과정을 보여줍니다.

그림 1: 구조 인식 의류 이미지 특징 학습 프로토콜의 전체 워크플로우. 입력 의류 이미지는 외형 특징 브랜치와 시맨틱 파싱 및 공간 그래프 모델링을 사용하는 구조적 특징 브랜치에 의해 처리됩니다. 두 표현은 구조 안내 융합 모듈에 의해 처리되어 최종 구조 인식 특징을 생성합니다. 구조적 일관성 손실, 구조적 판별 손실 및 구조적 관계 손실이 특징 공간을 공동으로 제약합니다. 이 그림은 특징 학습 전반에 걸쳐 의류의 외형과 구성 요소의 위상이 어떻게 통합되는지를 보여줍니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 2: 이미지 수준의 의류 구성 요소 토폴로지 사전 구축. (A) 입력 의류 이미지 I. (B) 전경으로 제한된 시각적 구성 요소 맵 P이며, 여기서 7가지 색상은 이미지 수준의 의류 영역을 나타냅니다. 모든 배경 픽셀은 구성 요소 채널에서 제외됩니다. (C) 이미지 수준의 구성 요소 관계 그래프 G. 노드는 가시적인 의류 영역을 나타내고, 실선 엣지는 공유된 전경 경계를 나타내며, 점선 관계는 사전 정의된 수직 순서를 나타냅니다. 이 맵과 그래프는 이미지 검색 및 시각적 구조 비교를 지원합니다. 이는 재단 패턴 조각, 솔기 기하학, 다트 구조, 그레이딩 파라미터 또는 절단 지침을 나타내지 않습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3: 구조 가이드 특징 융합 모듈. 구조적 특징은 선형 매핑과 활성화 함수 Ψ에 의해 변환되어 구조 가중치를 생성한다. 구조 가중치는 요소별 곱셈을 통해 외형 특징을 조절한다. 조절된 외형 특징과 구조적 특징은 연결된 후 Wc에 의해 투영되며, 이후 잔차 구조적 특징이 더해져 최종 컴포넌트 특징을 생성한다. 이 그림은 최종 융합 전 구조 정보가 외형 특징 가중치를 조절함을 보여준다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 4: 구조적 일관성 제약 조건 하의 특징 공간 최적화. (A) 동일한 구조적 클래스에 속하는 샘플들은 구조 일관성 손실을 통해 서로 가깝게 끌어당겨지며, 내부 구성 요소 간의 관계는 구조 관계 손실에 의해 보존된다. (B) 서로 다른 구조적 클래스의 샘플들은 구조 판별 손실에 의해 서로 멀어지게 된다. 이 그림은 세 가지 구조적 목적 함수가 어떻게 공동으로 클래스 내 응집도를 높이고 클래스 간 분리도를 증가시키는지 보여준다. 여기 를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 5: 대표적인 의류 특징 반응 및 컴포넌트 그래프 시각화. (A) 입력 의류 이미지. (B) ResNet-50 외형 베이스라인의 클래스 활성화 반응. (C) 프로토콜 섹션 3 및 4 동안 저장된 전경 제한 컴포넌트 맵, 컴포넌트 중심 행렬, 유형별 인접 행렬, 비활성 노드 마스크 및 컴포넌트 레이블 매핑으로부터 이미지 수준의 의류 컴포넌트 그래프를 재구성함. 노드는 활성 의류 영역을 나타내고, 실선 엣지는 공유된 전경 경계를 나타내며, 점선 엣지는 사전 정의된 수직 순서 관계를 나타냄. (D) 융합된 컴포넌트 인식 표현의 활성화 반응. 비교를 통해 텍스처 중심의 활성화와 의류 영역 유도 활성화의 차이를 보여줌. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 6: 적색 배경 간섭 하에서의 검색 결과 및 중간 구조적 증거. (A) 쿼리 이미지. (B) 저장된 컴포넌트 중심점과 유형화된 인접 행렬로부터 생성된 쿼리 컴포넌트 그래프. (C) 쿼리 유형화된 인접 행렬로, 행렬 값은 비활성 관계, 공유 전경 경계 및 사전 정의된 수직 순서 관계를 구분한다. (D) 외형 베이스라인에 의해 생성된 상위 3개의 검색 결과. (E) 구조 인식 표현에 의해 생성된 상위 3개의 결과. (F) 가장 높은 순위의 구조 인식 결과의 컴포넌트 그래프. (G) 쿼리와 가장 높은 순위 결과 사이의 퓨전 후 컴포넌트 대응 행렬. 높은 대각 대응은 동일한 식별자를 가진 컴포넌트 간의 일치를 나타내며, 약하거나 어긋난 응답은 컴포넌트 구성의 누락 또는 불일치를 나타낸다. 검색 결과는 대략적인 상의 카테고리를 유지하지만, 소매 구성 및 국소 위상에서는 완전한 일치를 형성하지 않는다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 7: 이미지 수준의 의복 토폴로지에서 공간적 응답까지의 구조적 차이 추적. (A) 참조 이미지. (B) 대상 이미지. (C) 참조 컴포넌트 그래프. (D) 대상 컴포넌트 그래프. 두 그래프 모두 저장된 컴포넌트 중심점과 유형별 인접 행렬로부터 재구성되었습니다. (E) 유형별 인접 차이 행렬. (F) 기하학적 관계 차이는 컴포넌트 중심점 변위, 공간적 분산 및 관계 가중치의 변화로부터 도출됩니다. (G) 융합 후 컴포넌트 차이 그래프로, 노드 강도는 대응하는 융합된 컴포넌트 벡터 간의 정규화된 거리를 나타내며 엣지 너비는 관계 가중치의 변화를 나타냅니다. (H) 순수 공간 차이 응답 히트맵은 오버레이와 동일한 고정 응답 척도를 사용하여 렌더링되었습니다. (I) 대상 이미지 위에 오버레이된 응답. 구조적 차이는 인접성 변화, 기하학적 관계 변화, 컴포넌트 거리 변화 및 전경 정렬 히트 응답이 일관되게 유지될 때만 인정됩니다. 컴포넌트나 관계의 상응하는 근거 없이 나타나는 배경 활성화는 유효한 의복 구조 차이가 아닌 잔류 간섭으로 처리됩니다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 8: 구조 인식 특징 공간 클러스터링. (A) 반소매 상의, 바지, 스커트, 롱코트 및 원피스의 t-SNE 투영 결과. 다섯 가지 카테고리는 경계 부근에서 제한적인 중첩을 보이며 주요 특징 영역을 형성한다. (B) 다섯 가지 의류 카테고리로 할당된 대표 테스트 이미지들이며, 테두리 색상은 (A)의 카테고리 색상과 일치한다. 이 그림은 인접한 카테고리 영역 근처에 소수의 샘플을 유지하면서 카테고리 수준의 구조적 조직화를 보여준다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 9: 특징 공간 구조 및 검색 순위 목표에 따른 원시 성능 비교. (A) 외형 중심 베이스라인, 약한 구조 모델, 명시적 구조 모델 및 제안된 방법의 SCI 및 SDI. (B) 동일한 네 가지 방법의 Recall@5 및 mAP. 큰 마커는 5회 독립 실행의 산술 평균을, 오차선은 표본 표준 편차를, 작은 마커는 개별 실행 결과를 나타냄. SCI와 SDI는 0에서 1까지의 고정 척도로 표시되며, Recall@5와 mAP는 0에서 100%까지의 고정 백분율 척도로 표시됨. 최소-최대 정규화 또는 방법 간 재스케일링은 적용되지 않음. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 10: 서로 다른 모듈 구성에 따른 구조적 차이 응답. (A) 참조 이미지. (B) 타겟 이미지. (C) 구조적 사전 정보(structure prior)가 없는 변형 모델의 응답. (D) 퓨전 모듈이 없는 변형 모델의 응답. (E) 전체 모델의 응답. (C–E)는 동일한 정규화 응답 척도, 컬러 맵 및 오버레이 설정을 사용하여 렌더링되었습니다. (F) 비-퓨전 변형 모델과 전체 모델 간의 전경 제한 절대 응답 차이. 전체 모델은 주요 구조 영역 외부의 잔여 확산을 줄이면서 의복에 정렬된 주요 응답을 유지합니다. 이 비교는 구조적 사전 정보가 의복 외부의 간섭을 줄이며, 퓨전 모듈이 구조적 응답을 더욱 정교하게 만든다는 것을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 11: 검증 기반의 구조적 제약 가중치 선택. 구조적 제약 가중치가 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5, 2.0일 때의 Validation Recall@5 결과가 보고되었다. 각 점은 5회의 검증 실행에 대한 산술 평균을 나타내며, 각 오차선은 표본 표준 편차를 나타낸다. 가중치는 최종 테스트 평가 전에 1.0으로 고정되었다. 이 그림은 파라미터 선택 절차를 기록한 것이며, 독립적인 아키텍처 기여를 구성하지 않는다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
표 1: S1에서 S5 의류 서브셋 전체의 데이터셋 할당 및 이미지 레벨 토폴로지 통계. 본 표는 훈련, 검증, 테스트 및 총 이미지 수와 함께, 각 구조적 수준에 대한 평균 시맨틱 구성 요소 수, 활성 노드 수, 유형 엣지 수 및 주석 처리된 이미지 평면 랜드마크 수를 나타냅니다. 모든 값은 처리된 데이터 매니페스트로부터 생성되었습니다. 훈련, 검증 및 테스트 이미지 수는 구조적 검토, 중복 그룹 제어 및 누출 검사 후의 최종 서브셋 매니페스트에서 얻었으며, 토폴로지 통계는 모델 평가 중에 적용된 것과 동일한 구성 요소 순서 및 관계 정의를 사용하여 최종 그래프 레코드로부터 계산되었습니다. 여기를 클릭하여 이 파일을 다운로드하십시오.
표 2: 프로토콜 전반에 걸쳐 사용된 계산 환경, 입력 구성, 증강, 표현, 최적화, 손실 및 재현성 설정. 이 표는 운영 체제, 프로세서, 설치된 메모리, 그래픽 처리 장치, 그래픽 메모리, 그래픽 드라이버, CUDA, cuDNN, Python, NumPy, PyTorch 및 torchvision 버전을 이미지 크기, 배치 구성, 최적화 도구, 학습률 스케줄, 에포크 횟수, 랜덤 시드, 표현 차원 및 구조적 목적 가중치와 함께 보고합니다. 각 값은 software_versions.txt, configs/protocol.yaml 또는 해당 훈련 기록과 연결되어 있습니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.
표 3: 일반 시각 표현 모델, 그래프 기반 의류 모델 및 도메인 특화 패션 검색 방법의 정량적 비교. 이 표는 동일한 데이터 분할 및 평가 프로토콜 하에서 11가지 방법에 대한 검색 초점, 쿼리 모달리티, SCI, SDI, Recall@5, mAP 및 실루엣 계수를 나타낸다. 모든 지표는 5회의 독립적인 실행에 대한 평균 및 표본 표준 편차로 보고되었다. 보고된 p-값은 동일한 5개의 무작위 시드 하에서 생성된 결과를 사용하여, 각 비교 방법을 제안된 방법과 비교한 양측 대응표본 t-검정(two-sided paired t-tests)을 통해 얻었다. 제안된 방법이 기준 행으로 처리되었다. 이 파일을 다운로드하려면 여기를 클릭하십시오.
표 4: 구조적 사전 지식 및 특징 융합 모듈에 대한 어블레이션 결과. 이 표는 구조적 사전 지식이 없는 변형 모델, 융합 모듈이 없는 변형 모델, 그리고 전체 모델에 대한 SCI, SDI 및 Recall@5를 보고합니다. 구조적 사전 지식을 제거하면 SCI와 Recall@5가 더 크게 감소하는 반면, 융합 모듈을 제거하면 SDI와 응답 정렬이 감소합니다. 전체 모델이 세 가지 지표 모두에서 가장 높은 수치를 기록했습니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.
표 5: ResNet-50 베이스라인과 전체 구조 인식 모델의 계산 효율성. 이 표는 표 2 및 재료 표에 기록된 것과 동일한 하드웨어 및 소프트웨어 환경에서 학습 가능한 파라미터 수, 이미지당 부동 소수점 연산 횟수, 이미지당 평균 추론 시간을 나타냅니다. 두 모델 모두 동일한 이미지 해상도, 추론 배치 설정, 전처리 작업 및 시간 측정 절차를 사용합니다. 전체 모델은 베이스라인 대비 파라미터 3.7 million 개, 부동 소수점 연산 1.3 billion 회, 이미지당 추론 시간 7 milliseconds가 추가되었습니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.
가장 중요한 프로토콜 단계는 의류 보존 전처리와 전경 제한 세그먼트 구성 요소 파싱입니다. 구성 요소 중심, 공간 분산 값, 공유 경계 관계, 수직 순서 관계, 관계 가중치 및 융합 표현은 모두 파싱 출력 결과로부터 도출됩니다. 경계 누출, 병합된 구성 요소 영역, 누락된 구성 요소 영역 및 잘못된 채널 할당은 그래프 구축 및 특징 융합 과정을 통해 전파됩니다. 이러한 오류는 표현된 구성 요소 관계가 원본 의류와 일치하지 않음에도 불구하고 유효한 차원을 가진 그래프 파일을 생성할 수 있습니다. 따라서 구조적 사전 정보(structural prior)를 수용하기 전에 확률 맵, 전경 제한, 구성 요소 미리보기 및 파싱 품질 기록을 반드시 확인해야 합니다.
그래프 구축 및 특징 융합에는 시맨틱 구성 요소의 고정된 순서가 필요합니다. 그래프는 전경 의류 구성 요소와 이들의 이미지 평면 관계로부터 도출됩니다. 검색 및 차이 국소화 도표는 단순히 최종 순위 이미지나 응답 히트맵만을 보여주는 것이 아니라 구조적 처리 경로를 드러냅니다. 유형별 인접 행렬은 개별 구성 요소 간의 관계를 기록하고, 기하학적 관계 행렬은 정규화된 공간 조직을 기록하며, 융합 후 구성 요소 행렬은 검색 및 국소화에 사용된 표현을 기록합니다. 구조적 결론은 이러한 중간 표현들이 최종 시각적 출력과 일치할 때만 수용되어야 합니다. 구성 요소 그래프는 해부학적 랜드마크, 인체 관절 좌표 또는 포즈 추정 네트워크를 사용하지 않습니다. 그래프 오버레이는 해당 노드와 관계 유형이 저장된 구성 요소 및 인접 파일로부터 재현될 때만 수용되어야 합니다. 비활성 구성 요소는 비활성 노드 표시자와 함께 제로 벡터로 유지되어야 하며, 외형 및 구조 특징 행렬은 융합 전에 각각 K행 512열을 포함해야 합니다. 이러한 검증은 노드 정렬 불량 및 차원 오류가 모델의 동작으로 해석되는 것을 방지합니다.
문제 해결은 가장 처음으로 나타난 유효하지 않은 중간 출력물부터 시작해야 합니다. 균일한 확률 맵은 체크포인트, 정규화 또는 카테고리 인덱스 오류를 나타내며, 비숫자 구조 행렬은 유효하지 않은 확률 분모 또는 좌표 스케일링을 나타냅니다. 확산된 응답과 색상이 지배적인 검색 결과는 약한 구조적 사전 정보, 퓨전 실패 또는 잘못된 체크포인트 로딩을 의미합니다. 학습 로그를 통해 그래프와 퓨전 레이어의 그래디언트 및 검증 기반의 체크포인트 선택 여부를 확인해야 합니다. 시각적 히트 응답을 단독적인 구조적 결론으로 사용해서는 안 됩니다. 이는 저장된 포그라운드 마스크, 입력된 인접성 변화, 기하학적 관계 행렬 및 퓨전 후의 컴포넌트 차이 그래프와 대조하여 확인해야 합니다. 의류 포그라운드 외부의 잔류 활성화는 검증된 구조적 차이가 아니라 응답 특이성이 제한적임을 나타냅니다.
외형 기반 검색과 비교하여, 본 프로토콜은 메트릭 학습 이전에 구성 요소 위상을 도입합니다. 약한 구조적 제약 및 고정 위상 그래프 모델과 비교했을 때, 시맨틱 관계 가중치는 그래프 전파를 현재 의류에 맞게 조정합니다. Table 3에 보고된 바와 같이, 전체 모델은 SCI 0.81, SDI 0.71, Recall@5 89.2%, mAP 86.4% 및 실루엣 계수 0.74를 달성했습니다. Table 4에 보고된 바와 같이, 추가적인 구조적 모듈로 인해 파라미터 수는 25.6 million에서 29.3 million으로 증가했으며, 이미지당 추론 시간은 15 milliseconds에서 22 milliseconds로 증가했습니다. 본 프로토콜의 기술적 기여는 이미지 레벨의 의류 구성 요소 그래프 구축, 외형 및 구성 요소 관계의 병렬 인코딩, 구조 가이드 특징 융합 메커니즘, 그리고 구조적 일관성, 관계 및 판별 목적 함수에 있습니다. Figure 11에 보고된 검증 스윕은 고정 학습 계수를 결정하기 위한 용도로만 사용되었으며, 네트워크 아키텍처나 목적 함수 설계에 대한 기여로 제시된 것이 아닙니다.
본 프로토콜은 심한 가려짐, 겹쳐진 의류, 작은 소스 이미지, 포즈 변화, 복잡한 배경, 그리고 가시적인 구조가 고정된 7개 영역 스키마와 일치하지 않는 의류에 대해 여전히 민감하게 반응합니다. 비대칭 디자인, 탈부착 가능 레이어, 밀집된 드레이핑, 다층 하의, 겹쳐진 장식 영역은 여러 의미적 영역을 병합하거나 현재의 그래프 정의에 없는 구성 요소 관계를 도입할 수 있습니다. 가려짐 현상은 활성 구성 요소를 억제하고, 확률 중심점을 이동시키며, 유효한 공유 경계 관계를 제거할 수 있습니다. 그림 6은 거친 상체 범주는 복구되었으나 소매 토폴로지 매칭은 불완전함을 보여주며, 그림 7 및 10은 인접한 배경 영역에 응답이 남아 있음을 보여줍니다. 이러한 결과는 유효한 텐서 차원과 그래프 연결성이 의미적으로 정확한 구조적 해석을 보장하지 않는다는 것을 나타냅니다. 따라서 본 연구는 디자인 워크플로우 효율성이나 패턴 파라미터의 직접적인 추정보다는 이미지 기반 검색, 클러스터링 및 차이 국소화를 지원합니다. 본 연구의 모든 정량적 실험은 유지 및 구조적으로 재레이블링된 DeepFashion2 코호트를 대상으로 수행되었습니다. 현재의 결과는 서로 다른 의류 분류 체계, 어노테이션 표준, 문화적 의류 범주, 이미지 소스 또는 획득 환경을 가진 독립적인 데이터셋 전체에 대한 견고성을 입증하는 것은 아닙니다. 다른 데이터셋으로 이전하려면 7개 구성 요소 채널을 다시 매핑하고 유형화된 관계 스키마를 재구성해야 할 수 있습니다. 따라서 보고된 결론은 평가된 데이터 분포 및 이미지 레벨의 구성 요소 정의로 제한됩니다.
이러한 제한 범위 내에서, 본 프로토콜은 시맨틱 파싱, 기하학적 관계 모델링, 듀얼 스트림 인코딩 및 구조 가이드 융합을 통해 의류 이미지로부터 구성 요소 인식 표현까지의 재현 가능한 시퀀스를 제공합니다. 향후 검증에서는 서로 다른 주석 시스템, 의류 카테고리, 포즈 및 배경 조건을 가진 독립적인 의류 데이터셋을 사용할 예정입니다. 또한, 현재의 7개 영역 매핑이 비대칭, 레이어드, 탈부착 가능 및 문화적 특성이 반영된 의류 구조로 확장되어야 하는지 검토할 것입니다. 수작업 디자인 스케치, 원단 간 변이 및 파라미터화된 패턴 조정은 작업별 데이터와 평가 절차가 필요한 별도의 응용 방향으로 남아 있습니다. 전문적인 사용성 및 디자인 리뷰 효율성은 정의된 참가자, 평가 기준 및 통계 절차를 갖춘 별도의 문서화된 인간 대상 연구가 필요합니다.
저자들은 선언할 이해관계 충돌이 없습니다.
본 연구는 제14차 5개년 계획 기간 동안의 제2차 성급 핵심 학부 교육 개혁 프로젝트의 지원을 받았으며, 프로젝트 명칭은 “3가지 통합, 3가지 융합” 공동 구축 모델에 기반한 “의류 및 복장 디자인” 교육 개혁 및 탐구(프로젝트 번호 JGZD2024096)입니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 중앙 처리 장치 | Intel Corporation | Intel Core i9-13900K, 24코어, 32스레드, 최대 5.80 GHz | |
| Conda | Anaconda, Inc., anaconda.com | Miniconda3 23.11.0 | |
| CUDA 툴킷 | NVIDIA Corporation, developer.nvidia.com | CUDA 11.8 | |
| cuDNN | NVIDIA Corporation, developer.nvidia.com | cuDNN 8.9.7 | |
| DeepFashion2 데이터셋 | 홍콩 중문대학교, github.com/switchablenorms/DeepFashion2 | 공식 DeepFashion2 릴리스, 버전 1.0 | |
| 그래픽 처리 장치 | NVIDIA Corporation | NVIDIA GeForce RTX 4090, 24 GB GDDR6X | |
| HRNet-W48 시맨틱 파싱 체크포인트 | HRNet 프로젝트, github.com/HRNet/HRNet-Semantic-Segmentation | hrnet_w48_garment_parser_7class.pth, 프로젝트 체크포인트 버전 1.0 | |
| ImageNet으로 사전 훈련된 ResNet-50 가중치 | PyTorch Foundation, pytorch.org | ResNet50_Weights.IMAGENET1K_V2 | |
| Matplotlib | Matplotlib 개발팀, matplotlib.org | 버전 3.8.2 | |
| NumPy | NumPy 개발자, numpy.org | 버전 1.26.4 | |
| NVIDIA 그래픽 드라이버 | NVIDIA Corporation | 버전 546.33 | |
| OpenCV-Python | OpenCV 팀, opencv.org | 버전 4.8.1.78 | |
| 운영체제 | Microsoft Corporation | Windows 11 Pro 23H2, 64비트, OS 빌드 22631.3155 | |
| 판다스 | Pandas 개발 팀, pandas.pydata.org | 버전 2.1.4 | |
| 파이썬 | Python Software Foundation, python.org | 버전 3.10.13 | |
| PyTorch | PyTorch Foundation, pytorch.org | CUDA 11.8 기반 버전 2.1.2 | |
| PyYAML | PyYAML 프로젝트, pyyaml.org | 버전 6.0.1 | |
| scikit-learn | scikit-learn 개발자, scikit-learn.org | 버전 1.3.2 | |
| SciPy | SciPy 개발자, scipy.org | 버전 1.11.4 | |
| 소스 코드 저장소 | 원고와 함께 제출된 보조 소스 코드 아카이브 | 의류 토폴로지 프로토콜, 버전 1.0 | |
| 저장 장치 | 삼성전자 | Samsung 990 PRO NVMe SSD, 2 TB | |
| 시스템 메모리 | Kingston Technology | Kingston FURY Beast DDR5, 64 GB, 2개 × 32 GB, 5600 MHz | |
| torchvision | PyTorch Foundation, pytorch.org | CUDA 11.8 기반 버전 0.16.2 | |
| 워크스테이션 | 사용자 정의 제작 딥러닝 워크스테이션 | Intel Core i9-13900K, NVIDIA GeForce RTX 4090, 64 GB 메모리, 2 TB NVMe SSD |