방법 논문

디자인 참조 검색을 위한 이미지 수준 의류 구성 요소 토폴로지 기반의 이미지 특징 학습 프로토콜

1 조회수

DOI:

10.3791/72103

2026년 9월 1일

이 논문에서

요약

본 프로토콜은 시맨틱 컴포넌트 파싱, 토폴로지 모델링, 듀얼 스트림 특징 인코딩 및 구조 가이드 융합을 통합하여 구조 인식 의류 표현형을 생성합니다. 이를 통해 컴퓨터 비전 및 의류 연구자는 색상이나 질감이 아닌, 컴포넌트 구성 및 실루엣 배치를 기반으로 의류 검색 및 디자인 참조 비교를 수행할 수 있습니다.

초록

의류 이미지 검색 방법은 주로 색상과 질감을 강조하는 경향이 있으며, 이는 외형은 비슷하지만 구성 요소의 배치가 다른 의류 간의 혼동을 야기할 수 있습니다. 본 연구에서는 의류 이미지 검색 및 디자인 참조 비교를 위한 구성 요소 인식 특징 학습 프로토콜을 제시합니다. 이 프로토콜은 의류의 의미론적 영역을 분석하고, 이미지 수준의 의류 구성 요소 그래프를 구축하며, 외형과 구성 요소 간의 관계를 병렬적으로 인코딩한 후, 구조적 일관성, 구조적 관계 및 구조적 판별 손실을 사용하여 두 표현을 융합합니다. DeepFashion2 이미지를 512 x 512 픽셀로 표준화하고 HRNet-W48로 분석하며, ResNet-50 및 그래프 컨볼루션을 통해 인코딩한 후 구조적 검색 및 클러스터링을 통해 평가하였습니다. 전체 모델은 0.81의 구조적 일관성 지수, 0.71의 구조적 판별 지수, 89.2%의 Recall@5, 86.4%의 평균 정밀도 평균(mAP), 그리고 0.74의 실루엣 계수를 달성했습니다. 본 프로토콜은 표면 외형만으로는 의류 구조를 신뢰성 있게 나타낼 수 없을 때, 의류 구조 검색, 구조적 비교 및 차이 위치 파악을 지원합니다.

서론

컴퓨터 비전과 인공지능의 의류 산업 통합이 지속됨에 따라, 의류 이미지 분석은 기본적인 인식 작업에서 디자인 중심의 분석 및 의사 결정 지원으로 점차 확대되었습니다1,2. 의류 디자인 프로세스에서 디자인 안의 구분은 단순한 외관의 차이보다는 구조적 구성과 구성 요소 간의 관계에 더 많이 의존하며, 이는 디자인 보조 시 의류 이미지 특징의 구조적 표현력이 분석의 효과를 결정짓는 핵심 요인이 됩니다3,4. 그러나 기존의 대부분의 시각적 방법들은 여전히 질감, 색상, 전체적인 윤곽을 주요 특징으로 사용하고 있어, 디자인 과정 중 의복의 계층 구조와 구성 차이를 체계적으로 분석하는 데 어려움이 있습니다5,6. 따라서 의류 디자인 보조를 위해 구조 인지형 이미지 특징 학습 방법을 개발하는 것은 디자인 분석의 객관성과 일관성을 향상시키는 데 중요합니다7. 본 프로토콜은 의복들이 유사한 색상, 질감 또는 전체적인 윤곽을 공유하지만 구성 요소의 조직, 연결 패턴 또는 공간적 배치가 다른 경우에 적합합니다. 이러한 조건에서 외관 중심의 표현 방식은 구조적으로 서로 다른 디자인을 특징 공간에서 가깝게 배치하는 경향이 있어, 검색 및 디자인 비교의 신뢰성을 떨어뜨립니다. 본 프로토콜은 의복 구성 요소 간의 관계가 구조적 검색, 디자인 평가 및 국소적 차이 분석의 주요 기초가 되는 과제들을 다룹니다.

데이터 규모, 모델 복잡성 및 작업 다양성 측면에서 의류 이미지의 자동 분석 및 이해에 관한 현재 연구는 상당한 진전을 이루었습니다8,9. 하지만 실제 응용 분야에서 의류의 구조적 정보는 종종 세그멘테이션(segmentation)이나 검출 결과에 암묵적으로 포함되어 있으며, 특징 학습 단계의 통합 모델링에서 고려되지 않아 특징 공간 내에서 서로 다른 구조적 디자인 간의 안정적인 구분이 부족한 실정입니다10,11. 의복 구성 요소 간의 공간적 관계, 계층적 제약 및 위상 구조가 명시적으로 인코딩되지 않아, 특징 표현이 디자인 수준에서의 구조적 차이를 반영하기 어렵습니다12,13. 명시적인 구조적 모델링의 부재는 디자인 보조 시나리오에서 의류 이미지 특징의 분석 입도와 결정 신뢰성을 제한하며, 이는 더 깊은 세만틱 이해를 갖춘 지능형 디자인 시스템 개발의 주요 장애물이 되고 있습니다14.

의류 이미지 특징 학습 및 분석을 지원하기 위해 관련 연구들에서는 여러 기술적 방향을 탐색해 왔습니다15. 시맨틱 세그멘테이션(semantic segmentation) 및 의류 파싱(garment parsing) 방법은 픽셀 수준의 어노테이션을 통해 의류 영역과 구성 요소의 세밀한 묘사를 가능하게 하여 구조적 정보 추출의 기반을 제공했습니다16,17. 이미지 쿼리 기반의 의류 검색 방법에는 토폴로지 및 색상-질감 융합, 전역 및 지역 어텐션 정렬, 의류 파싱, 다중 스케일 및 다중 입도 표현, 그리고 특징 선택을 포함한 잔차 어텐션(residual attention) 등이 도입되었습니다. 이러한 방법들은 카탈로그 검색, 소비자-매장 매칭, 교차 도메인 제품 검색 및 이커머스 시각 검색 문제를 해결합니다. 각 방법이 시각적 쿼리를 기반으로 의류 이미지의 순위를 매기기 때문에 그 적용 환경은 디자인 참조 검색과 밀접한 관련이 있지만, 특징 융합 과정 전반에서 유형별 구성 요소의 인접성 및 수직적 순서 관계를 보존하지는 않습니다18,19,20. 한편, 디자인 및 추천 시나리오에 관한 연구에서는 멀티모달 융합, 관계 모델링 및 스타일 분석이 점진적으로 도입되어 의류 시각 특징의 응용 범위가 확장되었습니다21,22. 이러한 방법들이 각자의 과제에서 진전을 이루었음에도 불구하고, 핵심 특징은 여전히 상당 부분 외형 묘사에 기반하고 있으며, 구조적 정보가 특징 학습을 위한 내재적 제약 조건으로 일관되게 모델링되지 않아 구조적 정렬 및 구조적 비교를 통한 의류 디자인 지원 요구를 충족시키기 어려운 실정입니다23.

의류 디자인 보조 분야에서 부족한 구조적 차별화 능력을 해결하기 위해, 본 논문은 의류 구조 인식을 기반으로 한 이미지 특징 학습 방법을 제안합니다. 이 방법은 의류 분석 결과와 핵심 구조 정보를 의류 이미지 입력 단계에 통합하여, 의류 구성 요소 영역, 공간적 관계 및 계층적 연결을 공동으로 모델링합니다. 구조적 관계 인코딩과 시각적 특징 정렬은 의류 제약 조건을 특징 학습 과정에 명시적으로 통합하여, 시각적 외형과 구조적 일관성을 모두 유지하는 표현을 생성합니다. 이러한 특징은 단일 공간 내에서 의류의 구조적 차이를 특성화하여 이후의 구조적 유사도 분석, 구조적 클러스터링 및 디자인 보조 의사결정을 위한 안정적인 기반을 제공함으로써, 기존 방법의 구조적 모델링 부재로 인해 발생하는 특징 혼동 문제를 완화합니다. 구조적 정보를 느슨하게 연결된 보조 속성으로 취급하는 일반적인 시각적 검색 전략과 달리, 본 프레임워크는 위상 관계 중심의 특징 변조 메커니즘을 구축합니다. 이 메커니즘은 학습된 표현이 가시적인 의류 영역 조직을 따르도록 유도하는 동시에 텍스처 중심의 반응을 감소시킵니다. 각 그래프 노드는 이미지 수준의 시맨틱 영역을 나타내며, 각 그래프 관계는 이미지 평면에서의 가시적 인접성 또는 정규화된 상대적 위치를 설명합니다. 결과적으로 생성된 임베딩은 여러 의류 이미지 간의 구성 요소 배치 및 실루엣 조직의 비교를 지원합니다. 이러한 영역과 관계는 재단 패턴 조각, 솔기 연결, 제작 랜드마크 또는 그레이딩 파라미터가 아닙니다. 외형 중심의 검색 방법과 비교하여, 본 프로토콜은 구조적 정보를 하위 분석 결과로 취급하는 대신 특징 학습 전 과정에서 명시적인 구성 요소 위상을 유지합니다. 구조적 단서를 보조 입력으로만 도입하는 접근 방식과 비교하여, 이중 스트림 인코딩과 위상 일관성 융합은 기하학적 관계를 보존하면서 텍스처 중심의 반응을 감소시킵니다. 결과적으로 생성된 표현은 의류 구조 검색, 구조적 클러스터링, 디자인 참조 스크리닝 및 국소적 디자인 차이 분석을 지원하며, 의류 디자인 과정에서 해석 가능한 구성 요소 수준의 근거를 제공합니다. 본 프로토콜과 관련된 연구 분야는 의류 이미지 특징 학습, 의류 구조 모델링, 구조 인식 표현 및 의류 디자인 보조를 위한 시각적 분석을 포괄합니다.

특징 표현 수준에서 의류 이미지 연구는 오랫동안 외형 모델링, 심층 특징 추출 및 다중 스케일 표현에 집중해 왔습니다24,25. 초기 연구에서는 합성곱 신경망을 사용하여 분류, 검색 및 유사도 매칭 작업을 위한 의류 이미지의 엔드-투-엔드 모델링을 수행했습니다26,27. 이후 서로 다른 시야각, 포즈 및 촬영 조건 하에서의 의류 이미지 차이를 완화하기 위해 다중 스케일 특징 융합 및 교차 도메인 학습이 도입되었습니다28,29. 검색 작업에서는 특징의 변별력과 계산 효율성을 높이기 위해 어텐션 메커니즘과 특징 압축 전략이 사용되었습니다30,31. 이러한 방법들은 신뢰할 수 있는 외형 변별을 가능하게 하지만, 특징 학습 과정이 여전히 전역적인 시각 정보에 집중되어 있어 의복 내부 구조에 대한 체계적인 표현이 부족합니다32. 구성 패션 검색 방법은 참조 이미지와 텍스트 수정 지시어를 추가로 결합하지만, 이는 본 연구에서 다루는 이미지 전용 프로토콜과는 쿼리 모달리티가 다릅니다. 해당 방법들은 관련 상용 검색 방향으로 검토되었으며, 추가적인 텍스트 입력이 통제된 이미지 쿼리 평가를 방해할 수 있으므로 정량적 비교에서는 제외되었습니다.

의류 이미지 분석이 외형 식별에서 구조적 이해로 전환됨에 따라, 의복 구성 요소, 기하학적 관계 및 위상학적 연결을 모델링하는 연구가 점점 더 주목받고 있습니다33. 시맨틱 세그멘테이션 네트워크는 특징 투영과 다중 어텐션 메커니즘을 통해 의류 구성 요소 수준의 분석을 달성함으로써 구조적 정보 추출을 위한 신뢰할 수 있는 기반을 제공했습니다34,35. 키포인트 검출 및 구조적 위상 모델링 방법은 의복 외곽선과 국소 구조 간의 관계를 더욱 구체화하여 의류의 기하학적 특징을 표현하는 모델의 능력을 향상시켰습니다36,37. 여러 연구에서는 그래프 구조와 관계 추론 네트워크를 도입하여 의류 구성 요소 간의 관계를 모델링함으로써 세밀한 인식 및 교차 도메인 검색 성능을 개선했습니다38,39. 이러한 연구들은 시각적 분석에서 구조적 정보의 중요한 역할을 입증했으나, 구조는 주로 보조적인 특징이나 중간 결과로 사용되었을 뿐, 구조적 제약을 핵심으로 하는 특징 학습 시스템은 아직 개발되지 않은 상태입니다40.

의류 디자인 지원 분야에서 이러한 발전은 디자인 추천, 스타일 분석, 대화형 시스템 구축 및 구조 중심의 디자인 평가를 뒷받침해 왔습니다41. 추천 시스템 연구는 시각적 특징과 사용자 선호도를 결합하여 의류 매칭 및 개인 맞춤형 추천을 구현하였습니다42. 디자인 지원 관련 연구는 생성 모델, 스타일 모델링 및 인간-컴퓨터 협업 메커니즘을 결합하여 지능형 디자인 지원을 위한 새로운 경로를 탐색해 왔습니다43. 가상 피팅, 사이즈 측정 및 스타일 전이 연구는 디자인과 생산 공정 전반에 걸쳐 의류 시각 분석의 응용 범위를 넓혔습니다. 이러한 연구들이 의류 디자인 지원의 기술적 형태를 풍성하게 했음에도 불구하고, 핵심 시각적 특징은 여전히 주로 외형에 기반하고 있으며 분석을 위한 디자인 구조의 통합된 표현 방식이 부족한 실정입니다. 이와 대조적으로, 본 논문에서는 의복 구조를 특징 표현의 핵심 제약 조건으로 취급하며, 의류 디자인 지원의 구조적 분석을 위한 시각적 표현 방법을 제공합니다.

이러한 발전에도 불구하고, 생성형 디자인의 최근 방법들은 구조적 조건을 확산 과정 내의 느슨한 공간 안내 행렬로 처리하는 경우가 많습니다. 현대의 구조적 파싱 프레임워크는 토폴로지를 기본 시각적 임베딩 공간과 분리된 보조 세맨틱 레이블로 표현합니다. 제안된 프레임워크는 컴포넌트 수준에서 시각적 특징 학습을 명시적으로 조절하는 그래프 사전 기반의 토폴로지 제약 조건을 정의함으로써 이러한 메커니즘을 변경합니다. 다층적 일관성 목적 함수는 이미지 수준의 컴포넌트 레이아웃이 유사한 의류가 특징 공간 내에서 가깝게 유지되도록 하는 동시에, 가시 영역 구성이 다른 의류는 서로 분리되도록 유도합니다. 이 목적 함수는 평가된 검색 설정에서 텍스처 의존도를 낮추지만, 재질, 포즈 또는 배경의 변화에 대한 불변성을 확립하지는 않습니다. 입력 이미지에 개별 의류가 충분히 가시적이고, 세맨틱 컴포넌트가 식별 가능한 경계를 유지하며, 분석 목적이 거친 카테고리 인식보다는 컴포넌트 수준의 구조적 비교를 요구할 때 이 프로토콜을 선택해야 합니다. 본 프로토콜은 구조 민감성 시각 분석을 수행하는 컴퓨터 비전 연구원, 의류 디자인 연구원 및 디지털 의류 개발 팀을 대상으로 합니다. 색상이나 재질 인식에만 집중하는 작업 또는 의류 토폴로지가 대부분 가려진 이미지에는 적합하지 않습니다. 다음 프로토콜은 데이터셋 준비와 세맨틱 확률 매핑부터 기하학적 관계 구축, 듀얼 스트림 특징 인코딩, 구조 안내 융합 및 일관성 기반 최적화에 이르는 워크플로우를 제시합니다. 전체 워크플로우는 그림 1에 요약되어 있습니다.

프로토콜

본 연구는 공개적으로 이용 가능한 의류 이미지 데이터셋을 사용하며, 인간 대상자 모집, 개인 식별 정보 수집, 동물 실험 수행 또는 생물학적 제제 사용을 포함하지 않습니다. 따라서 기관 윤리 위원회의 승인 및 고지된 동의 절차는 해당되지 않습니다.

1. 소프트웨어 환경 및 프로젝트 구성

  1. 배포된 프로젝트 파일들을 저장 공간이 충분한 디렉토리에 배치하고, 프로젝트 루트 디렉토리에서 터미널을 엽니다.
  2. conda env create -f environment.yml을 실행하여 소프트웨어 환경을 생성합니다. conda activate garment_structure를 실행하여 환경을 활성화합니다.
  3. python --version, conda --version, pip show numpy, pip show torch, pip show torchvision, 그리고 nvidia-smi를 실행합니다. 전체 명령 출력 내용을 software_versions.txt에 저장합니다.
  4. 전처리, 학습, 추론, 효율성 측정 및 평가에 동일하게 기록된 환경을 사용합니다. HRNet-W48 체크포인트 파일명과 SHA-256 값, ImageNet 사전 학습된 ResNet-50 가중치 식별자와 SHA-256 값, DeepFashion2 배포 소스, 그리고 소스 코드 저장소 식별자를 동일한 파일에 기록합니다.
  5. 프로젝트 루트 디렉토리 아래에 data_raw, data_processed, parser_outputs, structural_priors, feature_outputs, checkpoints, logs, evaluation_results 디렉토리를 생성합니다.
  6. configs/protocol.yaml 파일을 엽니다. dataset_root에 DeepFashion2 디렉토리를, parser_checkpoint에 사전 학습된 HRNet-W48 체크포인트 경로를, output_root에 프로젝트 출력 디렉토리를 입력합니다.
  7. input_height를 512, input_width를 512, batch_size를 32, structural_categories_per_batch를 8, samples_per_category를 4, random_seed를 42, feature_dimension을 512, structural_constraint_weight를 1.0, structural_relationship_weight를 0.5, structural_discrimination_weight를 1.0, 그리고 separation_threshold를 0.3으로 설정합니다.
  8. 옵티마이저를 mini-batch stochastic gradient descent로 설정합니다. initial_learning_rate를 0.0001, momentum을 0.9, weight_decay를 0.0005, max_epochs를 120, learning_rate_schedule을 multi-step decay, learning_rate_decay_factor를 0.1로 설정합니다. 배포된 설정에서 사용된 검증된 감쇠 에포크를 learning_rate_milestones에 입력합니다.
  9. python tools/export_experiment_tables.py --config configs/protocol.yaml --output evaluation_results를 실행합니다. 전체 모델 설정을 model_setting_statistics.csv로 내보냅니다. 내보낸 파일에 입력 이미지 크기, 입력 형식, 배치 구성, 옵티마이저, 학습률, 학습률 스케줄, 에포크 수, 가중치 감쇠, 모멘텀, 증강 확률, 특징 차원, 구조적 손실 가중치, 분리 임계값, 랜덤 시드, 체크포인트 선택 규칙 및 독립 실행 횟수가 기록되었는지 확인합니다.
  10. 예상 결과: 소프트웨어 환경이 종속성 오류 없이 시작되고, software_versions.txt에 환경 기록이 포함되어 있으며, 모든 출력 디렉토리가 존재하고, configs/protocol.yaml에 유효한 절대 경로와 수치 설정이 포함되어 있는지 확인합니다.
    참고: 데이터 처리, 모델 학습, 추론 및 평가 중에 동일한 환경과 설정 파일을 사용하십시오. 학습된 모든 체크포인트와 함께 configs/protocol.yaml의 복사본을 저장하십시오.
    ​문제 해결: 패키지를 사용할 수 없어 환경 생성이 중단되는 경우, 불완전한 환경을 제거하고 environment.yml의 패키지 채널을 확인한 후 환경을 다시 생성하십시오. nvidia-smi가 그래픽 처리 장치를 보고하지 않는 경우, 모델 학습을 중단하고 그래픽 드라이버와 CUDA 런타임을 복구하십시오. 실행 중 디렉토리 오류가 발생하는 경우, 상대 경로를 절대 경로로 변경하고 output_root에 대한 쓰기 권한을 확인하십시오.

2. 입력 이미지 수용, 데이터셋 구축 및 전처리

  1. JPG, JPEG 또는 PNG 확장자 파일만 사용하십시오. 단일 주요 의류가 포함된 8비트 RGB 이미지를 사용하십시오.
  2. 너비와 높이가 최소 512픽셀이고 식별 가능한 주요 의류가 하나 포함된 8비트 RGB 이미지를 유지하십시오. 의류 전경이 전체 이미지 영역의 15% 미만을 차지하는 경우, 의류 마스크 경계의 5% 이상이 이미지 테두리와 겹치는 경우, 보조 의류 영역이 주요 의류 영역의 10%를 초과하는 경우, 추정 폐색 영역이 주요 의류 마스크의 20%를 초과하는 경우, 또는 라플라시안 응답의 분산이 100 미만인 경우 해당 이미지를 제외하십시오.
  3. 이미지 식별자, 측정값, 트리거된 제외 규칙 및 어노테이션 경로를 excluded_samples.csv에 기록하십시오.
  4. 구조적 레이블링 및 데이터 분할 전에 DeepFashion2 소스 이미지에 입력 수락 규칙을 적용하십시오. 수락 및 제외된 모든 이미지 식별자, 원본 데이터셋 분할, 의류 어노테이션 식별자, 소스 쌍 식별자, 전경 영역 비율, 경계 접촉 비율, 폐색 비율, 블러 점수 및 최종 유지 상태를 data_filtering_manifest.csv에 기록하십시오.
  5. python tools/prepare_data.py --config configs/protocol.yaml을 실행하십시오.
  6. 데이터셋 어노테이션에서 의류 바운딩 박스를 읽으십시오. 이미지 경계를 벗어나지 않는 범위 내에서 바운딩 박스의 너비와 높이를 각각 5%씩 확장하십시오.
  7. 의류 영역을 크롭하고 원본 가로세로 비율을 유지하며, 제로 패딩을 추가하여 정사각형 이미지를 만든 다음, 패딩된 이미지를 512 x 512픽셀로 크기 조정하십시오.
  8. 크기가 조정된 이미지를 부동 소수점 값의 RGB 텐서로 변환하십시오. 각 픽셀 값을 255로 나누십시오.
  9. 빨강, 초록, 파랑 채널을 평균 0.485, 0.456, 0.406 및 표준 편차 0.229, 0.224, 0.225로 정규화하십시오.
  10. 훈련 이미지에는 0.5의 확률로 수평 뒤집기와 0.2의 확률로 랜덤 삭제를 적용하십시오. 검증 및 테스트 이미지에는 결정론적 크롭, 패딩, 크기 조정 및 정규화만 적용하십시오.
  11. 7채널 컴포넌트 맵과 공유 경계 및 수직 순서 행렬이 생성된 후 python tools/assign_structural_levels.py --config configs/protocol.yaml을 실행하십시오. 유지된 모든 이미지에 대해 활성 노드 수, 연결 컴포넌트 수, 분기 노드 수, 독립 사이클 수 및 최장 유향 수직 순서 경로를 계산하십시오. 분기 노드는 공유 경계 그래프에서 적어도 3개의 다른 활성 노드와 연결된 활성 노드로 정의합니다.
  12. 그래프가 연결되어 있고 독립 사이클이 없으며 분기 노드가 없고 최장 수직 순서 경로가 2개의 엣지를 초과하지 않는 경우 S1을 할당하십시오. 그래프가 연결되어 있고 독립 사이클이 없으며 분기 노드가 정확히 하나 있고 최장 수직 순서 경로가 2개의 엣지를 초과하지 않는 경우 S2를 할당하십시오. 그래프가 연결되어 있고 독립 사이클이 없으며 분기 노드가 적어도 두 개 있거나 수직 순서 경로가 적어도 3개의 엣지인 경우 S3를 할당하십시오. 그래프가 연결되어 있고 독립 사이클이 정확히 하나 있으며 수직 순서 경로가 2개의 엣지를 초과하지 않는 경우 S4를 할당하십시오. 그래프에 독립 사이클이 적어도 두 개 있거나 하나의 독립 사이클과 함께 수직 순서 경로가 적어도 3개의 엣지인 경우 S5를 할당하십시오.
  13. S5, S4, S3, S2, S1 순으로 규칙을 적용하고 계산된 그래프 통계, 할당된 레벨 및 규칙 식별자를 structural_level_manifest.csv에 저장하십시오.
  14. 저장된 컴포넌트 마스크와 관계 행렬로부터 예비 S1-S5 레이블을 자동으로 생성하십시오. 컴포넌트 그래프에 연결 컴포넌트가 둘 이상 포함된 경우, 의류 전경 내부의 평균 최대 컴포넌트 확률이 0.60보다 낮은 경우, 활성 컴포넌트가 의류 전경의 1% 미만을 차지하는 경우, 또는 경계 접촉 너비가 1픽셀에서 2픽셀로 변경된 후 할당된 구조적 레벨이 변경되는 경우 해당 샘플을 구조적으로 모호한 것으로 표시하십시오.
  15. 모든 모호한 샘플을 두 명의 저자에게 제출하여 소스 이미지, 컴포넌트 맵, 공유 경계 행렬, 수직 순서 행렬 및 예비 그래프를 독립적으로 검토하게 하십시오. 두 검토 결과가 일치하는 경우 해당 레이블을 유지하십시오. 불일치하는 경우 세 번째 저자에게 제출하고 다수결 결정으로 최종 레이블을 정하십시오. 검토 후에도 안정적인 컴포넌트 관계가 복구되지 않는 샘플은 제외하십시오. 자동 레이블, 검토 레이블, 불일치 사유, 최종 레이블 및 제외 상태를 structural_label_audit.csv에 기록하십시오.
  16. 유지된 모든 소스 파일의 SHA-256 값을 계산하고 정규화된 의류 크롭 이미지로부터 64비트 지각 해시를 계산하십시오. SHA-256 값이 동일한 이미지는 동일한 완전 중복 그룹에 배치하십시오. 지각 해시의 해밍 거리가 4 이하인 이미지는 동일한 의류 인스턴스에서 기인했음을 확인한 후 동일한 유사 중복 그룹에 배치하십시오.
  17. 동일한 DeepFashion2 소스 쌍 식별자 또는 의류 ID를 공유하는 모든 이미지를 하나의 소스 그룹으로 병합하십시오. 파일 해시, 지각 해시, 소스 식별자 및 중복 그룹 식별자를 duplicate_group_manifest.csv에 저장하십시오.
  18. 개별 이미지 수준이 아닌 소스 그룹 수준에서 데이터 분할을 수행하십시오. 모든 완전 중복 그룹, 유사 중복 그룹 및 소스 ID 그룹을 완전히 하나의 서브셋에 할당하십시오. 분할 후 모든 서브셋 간 쌍을 확인하고 탐지된 모든 ID 충돌, 해시 충돌 및 지각 해시 충돌을 leakage_audit.csv에 기록하십시오. leakage_audit.csv에 해결되지 않은 서브셋 간 기록이 없을 때까지 매니페스트를 다시 생성하십시오.
  19. 최종 S1-S5 레이블에 따라 소스 그룹을 층화하고 Table 1에 표시된 검증된 할당량에 따라 전체 그룹을 훈련, 검증 및 테스트 서브셋에 할당하십시오. 모든 구조적 레벨과 서브셋에 대해 정확한 이미지 수와 소스 그룹 수를 보고하십시오.
  20. 필터링되지 않은 데이터셋이 아닌 최종 유지된 코호트로부터 실제 훈련, 검증 및 테스트 백분율을 계산하십시오. 파라미터 학습, 임계값 결정, 구조적 레벨 규칙 조정 또는 체크포인트 선택 중에 검증 이미지, 테스트 이미지, 모호하여 제외된 이미지 또는 해당 중복 그룹에 속한 이미지를 사용하지 마십시오.
  21. 처리된 이미지를 data_processed/images에 저장하십시오. train_manifest.csv, validation_manifest.csv, test_manifest.csv, pair_manifest.csv 및 structural_level_manifest.csv를 data_processed/manifests에 저장하십시오.
  22. 처리된 매니페스트에서 최종 구조적 레이블, 검토 상태, 중복 그룹 식별자, 소스 그룹 식별자 및 서브셋 레이블을 읽으십시오. S1부터 S5까지 자동 수락된 샘플, 수동 검토된 샘플, 모호성 제외, 중복 제외, 소스 그룹, 훈련 이미지, 검증 이미지 및 테스트 이미지의 수를 세십시오.
  23. 실제 서브셋 비율, 평균 활성 노드 수, 평균 분기 노드 수, 평균 독립 사이클 수, 평균 수직 순서 깊이 및 평균 타입 엣지 수를 계산하십시오. 전체 통계를 evaluation_results/dataset_statistics.csv에 저장하십시오.
  24. 예상 출력: 모든 수락된 이미지가 512 x 512픽셀 크기의 8비트 RGB 이미지이며, 하나의 필터링 기록, 하나의 최종 구조적 레벨 레이블, 하나의 소스 그룹 식별자, 하나의 중복 그룹 식별자, 하나의 서브셋 레이블 및 하나의 유효한 어노테이션 경로를 가지고 있는지 확인하십시오. 모든 모호한 샘플이 완전한 검토 기록을 가지고 있는지 확인하십시오. 어떤 소스 식별자, 완전 중복 그룹, 유사 중복 그룹 또는 의류 ID도 둘 이상의 서브셋에 나타나지 않는지 확인하십시오. train_manifest.csv, validation_manifest.csv, test_manifest.csv 및 dataset_statistics.csv의 이미지 수가 동일한지 확인하십시오.
    참고: 처리되지 않은 원본 이미지는 data_raw에 보존하십시오. 검증 또는 테스트 이미지에 랜덤 증강을 적용하지 마십시오.
    ​문제 해결: 크롭으로 인해 칼라, 소매, 밑단 또는 바지 가랑이가 제거된 경우, 원본 어노테이션을 복원하고 유지 경계 마진을 넓히십시오. 의류가 늘어나 보이면 크기 조정 전에 정사각형 패딩이 적용되었는지 확인하십시오. 처리된 이미지에 채널이 하나 또는 네 개가 포함된 경우, 소스 파일을 8비트 RGB로 변환하고 전처리를 다시 실행하십시오. 서브셋 간에 중복 식별자가 발생하는 경우, 훈련 전에 모든 서브셋 매니페스트를 다시 생성하십시오.

3. 전경 제한 시각 구성 요소 파싱 및 확률 매핑

  1. python tools/parse_components.py --config configs/protocol.yaml을 실행하십시오.
  2. parser_checkpoint에서 사전 학습된 HRNet-W48 의류 시맨틱 파싱 체크포인트를 로드하십시오. 체크포인트가 데이터셋 어노테이션 매핑에 정의된 의류 구성 요소 카테고리를 출력하는지 확인하십시오. 시맨틱 파싱 네트워크를 평가 모드로 전환하고 그래디언트 계산을 비활성화하십시오.
  3. train_manifest.csv, validation_manifest.csv, test_manifest.csv에서 처리된 이미지를 순차적으로 읽으십시오.
  4. 각 입력 이미지에서 하나의 7채널 시맨틱 응답 텐서를 추출하고, 전체 워크플로에서 K를 7로 설정하십시오. Upper Trim Region, Neckline Region, Bodice Region, Left Lower-Garment Region, Right Lower-Garment Region, Middle Lower-Garment Region, Hem Region의 고정된 카테고리 순서를 사용하십시오. 확률 맵, 구성 요소 행렬, 그래프 행렬, 특징 행렬, 매니페스트 및 시각화 파일에서 이 순서를 유지하십시오.
  5. 채널 차원을 따라 softmax를 적용하여 시맨틱 구성 요소 확률 맵 P를 생성하십시오. 모든 K 채널의 확률 합이 모든 픽셀에서 0.0001의 허용 오차 내로 1이 되는지 확인하십시오.
  6. 데이터셋 어노테이션에서 의류 전경 마스크를 로드하여 512 x 512 처리된 이미지와 정렬하십시오. 의류 전경 외부의 모든 구성 요소 확률을 0으로 설정하십시오. 전경 마스크 내부의 구성 요소 확률을 채널 차원을 따라 다시 정규화하십시오.
  7. 모든 활성 구성 요소 영역이 의류 전경 내에 남아 있는지 확인하십시오. 색상이 지정된 구성 요소 영역이 주변 벽, 바닥, 커튼 또는 기타 배경 영역으로 확장되는 경우 파싱된 샘플을 거부하십시오. 거부된 이미지 식별자와 파싱 오류를 parsing_quality_log.csv에 기록하십시오.
  8. 모든 구성 요소에 대해 전경 커버리지 비율을 계산하고, 파편화된 영역이나 지원되지 않는 고립된 영역이 있는 구성 요소는 수동 검사를 위해 표시하십시오.
  9. 시맨틱 응답 텐서를 parser_outputs/logits에 저장하십시오. 확률 맵을 parser_outputs/probability_maps에 저장하십시오. 색상 코딩된 구성 요소 미리보기를 parser_outputs/previews에 저장하십시오.
  10. 예상 결과: 수락된 각 이미지가 공간 크기 512 x 512 픽셀의 7채널 전경 제한 확률 맵 하나, 7채널 시맨틱 응답 텐서 하나, 그리고 미리보기 이미지 하나를 생성하는지 확인하십시오. 채널 인덱스 1부터 7까지가 단계 3.4에 정의된 고정 구성 요소 순서를 따르는지 확인하십시오. 모든 색상 구성 요소 영역이 의류 전경 내에 유지되고 배경 픽셀의 구성 요소 확률이 0인지 확인하십시오. 파일 식별자가 소스 매니페스트의 해당 항목과 일치하는지 확인하십시오.
    참고: 구조 모델링 중에 의류 전경 내부의 연속적인 구성 요소 확률을 유지하십시오. 결과 영역을 시각적 분석 영역으로 취급하십시오. 해당 경계를 솔선, 재단선, 패턴 조각 윤곽선, 다트, 노치 또는 그레이딩 참조선으로 해석하지 마십시오.
    ​문제 해결: 모든 채널에서 확률이 거의 균일하게 나타나면 parser_checkpoint, RGB 채널 순서 및 이미지 정규화를 확인하십시오. 전체 서브셋에서 특정 구성 요소가 계속 누락되면 어노테이션 인덱스를 파서 출력 채널 인덱스와 비교하십시오. 구성 요소 색상이 배경으로 확장되면 그래프 구축 전에 전경 마스크 정렬, 보간 설정 및 어노테이션 좌표를 확인하십시오. 시각적 영역이 서로 관련 없는 여러 의류 영역에 걸쳐 있으면 해당 샘플을 파싱 실패로 표시하고 구조적 사전 정보 생성에서 제외하십시오. 채널 확률의 합이 1이 되지 않으면 공간 차원이 아닌 채널 차원을 따라 softmax를 적용하십시오. 출력 파일이 누락된 경우, 파서 로그에서 마지막으로 처리된 식별자를 찾아 다음 식별부터 파싱을 재개하십시오.

4. 이미지 수준의 구성 요소 기하학 및 공간 관계 모델링

  1. 각 이미지에 대해 얕은 시각적 특징 텐서와 그에 해당하는 확률 맵 P를 로드합니다.
  2. 모든 공간 특징 벡터에 해당 세그먼트 구성 요소에 할당된 확률을 곱합니다.
  3. 가중치가 적용된 특징 벡터를 공간 차원에 대해 합산하고, 합계를 해당 구성 요소의 총 확률 질량으로 나눕니다.
  4. 확률 질량이 0인 모든 구성 요소에는 제로 벡터와 비활성 노드 표시자를 할당합니다.
  5. 모든 활성 구성 요소 임베딩에 L2 정규화를 적용하고, 고정된 세그먼트 구성 요소 순서에 따라 임베딩을 쌓습니다.
  6. 전경 제한 확률 분포로부터 각 시각적 구성 요소의 이미지 평면 수평 및 수직 중심 좌표를 계산합니다. 이미지 너비와 높이로 좌표를 정규화합니다.
  7. 동일한 정규화 좌표계에서 각 시각적 구성 요소의 이미지 평면 수평 및 수직 확산도를 계산합니다. 이 값들은 처리된 이미지에서 가시 영역 범위를 설명하는 용도로만 사용합니다.
  8. 고정된 구성 요소 순서에 따라 7개의 그래프 노드를 생성하고, 비활성 구성 요소는 제로 노드로 유지합니다. 전경 구성 요소 마스크 간의 8-이웃 접촉을 이용하여 7 x 7 공유 경계 행렬을 구축합니다. Upper Trim Region에서 Neckline Region으로, Neckline Region에서 Bodice Region으로, Bodice Region에서 각 하의 영역으로, 그리고 각 하의 영역에서 Hem Region으로 이어지는 고정 관계를 사용하여 7 x 7 수직 순서 행렬을 구축합니다. 모든 유효한 관계를 양방향으로 저장합니다.
  9. 그래프 컨볼루션 전에 모든 활성 노드에 셀프 루프를 추가하고, 비활성 노드와 연결된 관계는 0으로 유지합니다.
  10. 모든 정렬된 세그먼트 구성 요소 쌍 사이의 상대적 중심 변위와 상대적 공간 분산을 계산합니다. 쌍별 기하학적 값들을 쌓아 기하학적 관계 텐서를 형성합니다.
  11. 정규화된 구성 요소 임베딩의 모든 쌍 사이의 내적을 계산합니다. 결과 유사도 행렬에 행 단위 소프트맥스(softmax)를 적용하고, 이 값들을 관계 가중치로 사용합니다.
  12. 기하학적 관계 텐서에 해당 관계 가중치를 곱하고, 모든 구성 요소에 대해 가중치 관계를 집계합니다.
  13. 구성 요소 임베딩 행렬, 구성 요소 중심 행렬, 공간 분산 행렬, 공유 경계 행렬, 수직 순서 행렬, 셀프 루프 행렬, 관계 가중치 행렬, 비활성 노드 마스크, 구성 요소 레이블 매핑 및 구조적 사전 표현을 structural_priors에 저장합니다. 해당되는 경우 모든 행렬을 7행 7열로 저장합니다. 전경 제한 구성 요소 맵에서 이미지 수준 의류 구성 요소 토폴로지 사전에 이르는 전체 구축 과정은 그림 2에 나와 있습니다.
  14. 전경 제한 확률 맵, 구성 요소 중심 행렬, 유형 지정 인접 행렬, 비활성 노드 마스크 및 구성 요소 레이블 매핑을 사용하여 각 시각화 샘플에 대한 구성 요소 그래프 오버레이를 생성합니다.
  15. 각 활성 노드를 해당 구성 요소 중심에 배치합니다. 공유 전경 경계는 실선 엣지로, 사전 정의된 수직 순서 관계는 점선 엣지로 그립니다.
  16. 각 그래프 오버레이를 소스 이미지 식별자를 사용하여 structural_priors/visualizations에 저장합니다. 소스 이미지 경로, 확률 맵 경로, 구성 요소 중심 경로, 유형 지정 인접 경로, 비활성 노드 마스크 경로, 세그먼트 파싱 체크포인트 식별자 및 그래프 오버레이 경로를 component_graph_visualization_manifest.csv에 기록합니다.
  17. 예상 결과: 모든 이미지에서 K행의 구성 요소 임베딩 행렬, K행 K열의 유형 지정 인접 행렬, K행 K열의 관계 가중치 행렬, K개 값의 비활성 노드 마스크 및 하나의 이미지 수준 구조적 사전 표현이 생성되는지 확인합니다. 선택된 모든 시각화 샘플에서 활성 노드가 해당 의류 영역 내에 유지되는 구성 요소 그래프 오버레이가 생성되는지 확인합니다.
    참고: 모든 행렬, 매니페스트, 그래프, 특징 파일 및 그래프 오버레이에서 동일한 시각적 구성 요소 순서를 유지하십시오. 구성 요소 중심, 공간 확산 값 및 그래프 관계를 이미지 평면의 의류 영역 기술자로 취급하십시오. 구성 요소 그래프를 사람의 포즈 스켈레톤으로 해석하거나 해부학적 관절 좌표로부터 노드를 유도하지 마십시오. 이러한 기술자를 솔기 길이, 곡선 반경, 다트 분량, 노치 위치, 식서 방향, 그레이딩 증분 또는 패턴 조각 치수로 변환하지 마십시오.
    ​문제 해결: 행렬에 비수치 값이 포함된 경우, 확률 질량 분모와 좌표 정규화를 점검하십시오. 관계 가중치가 하나의 구성 요소에 집중되는 경우, 소프트맥스 적용 전 유사도 행렬에서 행 최댓값을 빼십시오. 이미지 간에 그래프 노드 수가 다른 경우, 비활성 구성 요소가 제거되지 않고 제로 벡터로 남아 있는지 확인하십시오.

5. 이중 스트림 구조 인식 특징 인코딩

  1. ImageNet으로 사전 학습된 ResNet-50 가중치를 로드하고, 마지막 풀링 층과 분류 층을 제거합니다.
  2. 정규화된 각 의류 이미지를 ResNet-50에 통과시키고, configs/protocol.yaml의 appearance_stage에서 정의한 백본 단계로부터 외관 텐서를 추출합니다. 512 x 512 픽셀의 입력 이미지에 대해 선택한 백본 단계에서 생성되는 단계 이름, 출력 채널 수 및 출력 공간 차원을 확인합니다. 모든 학습, 추론, 어블레이션 및 비교 실행에서 동일한 단계를 사용하십시오.
  3. 이차 선형 보간법(bilinear interpolation)을 통해 시맨틱 확률 맵을 외관 특징 텐서의 공간 크기로 조정합니다. 외관 특징 텐서에 크기가 조정된 각 구성 요소 확률 맵을 곱한 다음, 공간 차원에 대해 가중 응답을 집계합니다.
  4. 모든 구성 요소 외관 임베딩을 configs/protocol.yaml에 정의된 채널 재보정 층에 통과시킵니다. 층 유형, 입력 차원, 출력 차원, 감소 비율, 활성화 함수 및 파라미터 공유 규칙을 기록합니다. 결과로 나온 7개의 구성 요소 벡터를 고정된 시맨틱 순서로 쌓아 외관 특징 행렬을 형성합니다.
  5. 모든 기하학적 관계 벡터를 구조적 투영 층에 통과시키고 출력 차원을 512로 설정합니다. 관계 가중치 행렬과 비활성 노드 마스크를 사용하여 구성 요소 그래프를 구축합니다.
  6. 입력 차원 512, 출력 차원 512의 그래프 합성곱 층 두 개를 적용합니다. 각 그래프 합성곱 층 다음에 배치 정규화를 적용하고 LeakyReLU를 적용합니다. LeakyReLU에 사용된 음수 기울기(negative-slope) 값을 기록합니다. 각 층 후에 비활성 노드 마스크를 적용하여 비활성 구성 요소에 대해 제로 특징을 유지합니다.
  7. 정규화된 구성 요소 임베딩을 사용하여 시맨틱 정렬을 적용하고, 결과 벡터를 쌓아 구조적 특징 행렬을 형성합니다.
  8. 예상 결과: 각 이미지에서 하나의 외관 특징 행렬과 하나의 구조적 특징 행렬이 생성되는지 확인합니다. 두 행렬 모두 K개의 행과 512개의 열을 포함하고 있는지 확인합니다.
    참고: 비활성 구성 요소는 제로 벡터로 유지하고, 구조적 사전 구축 중에 설정된 구성 요소 순서를 보존하십시오.
    문제 해결: 두 특징 행렬의 행 수가 다른 경우, 시맨틱 범주 매핑과 비활성 노드 처리 과정을 점검하십시오. 행렬 곱셈에서 차원 오류가 보고되면, 구조적 투영 출력과 외관 채널 차원이 모두 512인지 확인하십시오. 모든 활성 구성 요소에 대해 구조적 특징이 0으로 남아 있는 경우, 그래프 엣지와 관계 가중치가 현재 배치에 추가되었는지 확인하십시오.

6. 구조 기반 특성 융합

  1. 그림 3에 표시된 구조 가이드 특징 융합 시퀀스를 적용합니다. 구조 특징 행렬을 융합 가중치 층에 통과시키고 configs/protocol.yaml의 fusion_activation에서 정의된 활성화 함수를 적용합니다. 활성화 함수 이름, 입력 차원, 출력 차원 및 7개 구성 노드 간에 파라미터가 공유되는지 여부를 기록합니다.
  2. 생성된 구조 가중치 행렬이 K개의 행과 512개의 열을 포함하는지 확인합니다.
  3. 외형 특징 행렬과 구조 가중치 행렬을 요소별로 곱합니다.
  4. 변조된 외형 행렬과 구조 특징 행렬을 채널 차원을 따라 연결합니다.
  5. 각 구성 요소에 대해 512차원의 변조된 외형 벡터와 512차원의 구조 벡터를 연결하여 1024차원 벡터를 형성합니다. 연결된 벡터를 융합 투영 층에 통과시켜 차원을 1024에서 512로 줄입니다.
  6. 잔차 연결을 통해 투영된 행렬에 원래의 구조 특징 행렬을 더합니다.
  7. 융합된 구성 요소 벡터를 고정된 시맨틱 순서로 쌓고, 평탄화된 구조 인식 표현형에 L2 정규화를 적용합니다.
  8. 구조 가중치 행렬, 변조된 외형 행렬, 융합된 구성 요소 행렬 및 최종 구조 인식 표현형을 feature_outputs에 저장합니다.
  9. 예상 결과: 모든 이미지가 K개의 행과 512개의 열을 가진 하나의 융합 구성 요소 행렬과 소스 이미지 식별자에 연결된 하나의 정규화된 구조 인식 특징 벡터를 생성하는지 확인합니다.
    참고: 응답 시각화 및 로컬 차이 분석을 위해 구조 가중치 행렬과 융합 구성 요소 행렬을 유지하십시오.
    ​문제 해결: 융합된 값이 계속 증가하는 경우, 활성화 출력과 정규화 층을 점검하십시오. 모든 구조 가중치가 동일한 값에 수렴하는 경우, 이미지 간에 구조 특징이 다양하게 나타나는지 그리고 융합 층이 그래디언트를 수신하는지 확인하십시오. 특징 파일과 이미지 식별자가 일치하지 않는 경우, 학습 또는 검색 평가 전에 출력 매니페스트를 다시 생성하십시오.

7. 모델 학습 및 일관성 최적화

  1. configs/seeds.yaml에 기록된 5개의 무작위 시드 값을 로드합니다. 각 실행마다 Python, NumPy, PyTorch CPU 연산 및 모든 CUDA 장치에 대해 동일한 무작위 시드를 설정합니다. 결정론적 알고리즘을 활성화하고, cuDNN 벤치마크 모드를 비활성화하며, 해당 실행 디렉토리에 정확한 5개의 시드 값을 기록합니다.
  2. 전처리된 훈련 매니페스트, 쌍 매니페스트, 확률 맵 및 구조적 사전 정보를 로드합니다.
  3. 8개의 구조 범주와 각 범주당 4개의 외형 변화 샘플로 모든 훈련 배치를 구성합니다.
  4. 동일한 구조적 사전 정보를 공유하는 양성 샘플 쌍으로부터 구조적 일관성 손실을 계산합니다.
  5. 구성 요소 특징 간의 쌍별 거리로부터 구조적 관계 일관성 손실을 계산합니다.
  6. 이질적인 구조를 가진 음성 샘플 쌍으로부터 구조적 판별 손실을 계산하고 0.3의 분리 임계값을 적용합니다.
  7. 외형 목적 함수, 구조적 일관성 목적 함수, 구조적 관계 목적 함수 및 구조적 판별 목적 함수를 configs/protocol.yaml에 저장된 가중치로 결합합니다. 세 가지 구조적 목적 함수에 의해 제어되는 특징 공간 최적화 프로세스는 그림 4에 나와 있습니다.
  8. python train.py --config configs/protocol.yaml을 실행합니다. 단계 1.8에 정의된 초기 학습률, 모멘텀, 가중치 감쇠, 에포크 수, 감쇠 인자 및 감쇠 에포크를 사용하여 미니 배치 확률적 경사 하강법으로 모든 학습 가능 파라미터를 업데이트합니다. 매 에포크 후의 학습률을 훈련 로그에 기록합니다.
  9. 매 에포크 후 총 손실, 외형 손실, 구조적 일관성 손실, 구조적 관계 손실, 구조적 판별 손실, 학습률, 구조적 일관성 지수(SCI), 구조적 판별 지수(SDI) 및 Recall@5를 기록합니다.
  10. 매 에포크 후 validation_manifest.csv에서 모델을 평가합니다. 가장 높은 검증 SCI와 관련된 체크포인트를 checkpoints/selected_model.pth에 저장합니다.
  11. 기록된 5개의 무작위 시드를 사용하여 훈련을 5회 반복합니다. 각 설정 파일, 훈련 로그 및 선택된 체크포인트를 별도의 실행 디렉토리에 저장합니다.
  12. 예상 출력: 각 실행에서 훈련 로그, 검증 로그, 에포크 수준의 메트릭 파일 및 하나의 선택된 체크포인트가 생성되는지 확인합니다. 선택된 체크포인트가 테스트 성능이 아닌 검증 성능을 기반으로 하는지 확인합니다.
    참고: 모든 모델 비교 및 어블레이션 실험에서 동일한 훈련, 검증 및 테스트 매니페스트를 사용하십시오.
    ​문제 해결: 손실 값이 숫자가 아니게 될 경우, 훈련을 중단하고 구성 요소 확률 질량을 검토한 후 학습률을 10배 낮추고 최신 유효 체크포인트부터 재시작하십시오. 훈련 손실은 감소하지만 검증 SCI가 변하지 않는 경우, 그래프 전파 및 융합 파라미터에 그레이디언트가 전달되는지 확인하십시오. 그래픽 메모리가 부족한 경우, 배치 크기를 줄이고 그레이디언트 누적을 통해 유효 배치 크기를 32로 유지하십시오. 실행 간에 검증 성능이 급격히 변하는 경우, 기록된 무작위 시드와 데이터 매니페스트 순서를 확인하십시오.

8. 추론, 검색, 클러스터링 및 출력 검증

  1. python infer.py --config configs/protocol.yaml --checkpoint checkpoints/selected_model.pth를 실행하십시오. 모든 테스트 이미지에 대해 확률 맵, 구조적 사전 정보(structural priors), 외형 특징 행렬, 구조적 특징 행렬, 융합 구성 요소 행렬 및 최종 특징 벡터를 생성하십시오.
  2. 모든 추론 출력물을 feature_outputs/test 아래에 저장하고 그 경로를 test_feature_manifest.csv에 기록하십시오. 모든 쿼리 특징과 모든 갤러리 특징 사이의 코사인 유사도를 계산하십시오. 갤러리 식별자를 유사도 내림차순으로 정렬하십시오. 각 쿼리에 대해 가장 높은 순위의 결과 5개를 evaluation_results/retrieval_results.csv에 저장하십시오.
  3. 시각화를 위해 선택된 모든 검색 샘플에 대해, 쿼리 이미지의 유형별 인접 행렬, 관계 가중치 행렬, 구성 요소 중심 행렬, 비활성 노드 마스크, 구성 요소 레이블 매핑 및 융합 구성 요소 행렬을 로드하십시오. 구조 인식 모델에 의해 생성된 가장 높은 순위 결과에 대해서도 동일한 파일들을 로드하십시오.
  4. 저장된 구성 요소 중심과 유형별 인접 행렬로부터 쿼리 구성 요소 그래프와 검색된 이미지의 구성 요소 그래프를 렌더링하십시오. 모델 추론 중에 사용된 고정된 구성 요소 순서와 관계 유형을 유지하십시오.
  5. 쿼리 유형별 인접 행렬을 범주형 행렬로 렌더링하십시오. 비활성, 공유 경계 및 수직 순서 관계에 대해 서로 다른 행렬 값을 사용하십시오. 구성 요소 레이블 매핑에 저장된 구성 요소 식별자로 가로 및 세로축에 레이블을 지정하십시오.
  6. 쿼리 융합 구성 요소 행렬과 검색된 이미지 융합 구성 요소 행렬에 L2 정규화를 적용하십시오. 모든 쿼리 구성 요소와 모든 검색된 이미지 구성 요소 사이의 코사인 유사도를 계산하십시오. 결과로 얻은 K × K 구성 요소 대응 행렬을 evaluation_results/structural_retrieval_evidence에 저장하십시오.
  7. 국소 차이 분석을 위해 선택된 모든 참조-대상 쌍에 대해, 두 이미지의 유형별 인접 행렬, 구성 요소 중심 행렬, 공간 분산 행렬, 관계 가중치 행렬 및 융합 구성 요소 행렬을 로드하십시오.
  8. 두 유형별 인접 행렬 사이의 절대 차이를 계산하십시오. 고정된 구성 요소 순서를 사용하여 구성 요소 중심 변위, 공간 분산 및 관계 가중치의 절대 차이를 계산하십시오. 결과로 얻은 위상 차이 행렬과 기하학적 관계 차이 행렬을 evaluation_results/structural_difference_evidence에 저장하십시오.
  9. 두 융합 구성 요소 행렬의 대응하는 행 사이의 L2 거리를 계산하십시오. 구성 요소 수준의 거리를 정규화하고 이를 대상 구성 요소 그래프의 노드에 할당하십시오. 관계 가중치의 정규화된 차이에 따라 엣지 너비를 증가시키십시오. 결과로 얻은 융합 후 구성 요소 차이 그래프를 저장하십시오.
  10. 이미지 식별자, 행렬 경로, 그래프 경로, 구성 요소 순서, 체크포인트 식별자 및 시각화 출력 경로를 structural_visualization_manifest.csv에 기록하십시오. 기록된 파일로부터 모든 구조적 시각화 자료를 프로그램 방식으로 생성하십시오. 그래프 노드, 그래프 엣지 또는 행렬 값을 수동으로 추가하지 마십시오.
  11. 최종 특징 벡터에 5개의 클러스터를 갖는 K-Means를 적용하고 클러스터 할당 결과를 evaluation_results/cluster_assignments.csv에 저장하십시오. python evaluate.py --config configs/protocol.yaml --feature_dir feature_outputs/test를 실행하십시오.
  12. 각 실행에 대해 SCI, SDI, Recall@5, 평균 정밀도(mAP) 및 실루엣 계수를 계산하십시오. SCI를 사용하여 동일한 구조적 레이블을 공유하는 정규화된 특징의 조밀도를 평가하고, SDI를 사용하여 서로 다른 구조적 레이블 간의 분리도를 평가하십시오. Recall@5를 사용하여 짧은 검색 목록에 관련 구조적 일치 항목이 나타나는지 평가하고, mAP를 사용하여 전체 갤러리에 걸친 순위 품질을 평가하십시오. 실루엣 계수는 클러스터링 분석에만 사용하십시오.
  13. 5회의 독립적인 실행에 대해 산술 평균과 표본 표준 편차를 계산하십시오. 모든 방법과 지표에 대해 5개의 실행 수준 값을 유지하십시오. 비교 대상 방법들에 따라 min-max 정규화, 순위 정규화 또는 리스케일링을 적용하지 마십시오. 동일한 랜덤 시드 하에서 얻은 결과를 사용하여 대응 표본 t-검정을 수행하고 검정 통계량과 정확한 양측 유의 확률 값을 기록하십시오.
  14. 처리된 테스트 식별자, 특징 파일, 검색 기록 및 클러스터 할당의 수를 비교하십시오. 평가 결과를 보고하거나 해석하기 전에 모든 불일치를 해결하십시오.
  15. 예상 출력: 모든 테스트 이미지가 하나의 완전한 추론 기록, 하나의 검색 목록, 하나의 클러스터 할당 및 한 세트의 평가 입력을 가지고 있는지 확인하십시오. 시각화를 위해 선택된 모든 검색 사례가 쿼리 구성 요소 그래프, 검색된 이미지 구성 요소 그래프, 유형별 인접 행렬 및 융합 구성 요소 대응 행렬을 가지고 있는지 확인하십시오.
  16. 모든 구조적 차이 사례가 위상 차이 행렬, 기하학적 관계 차이 행렬, 융합 후 구성 요소 차이 그래프, 공간 차이 히트맵 및 응답 오버레이를 가지고 있는지 확인하십시오. 모든 시각화 파일이 structural_visualization_manifest.csv를 통해 소스 행렬과 연결되어 있는지 확인하십시오. 시각화된 각 사례에 대해 순수 히트맵, 대상 이미지 오버레이, 전경 마스크 및 최고 응답 영역 좌표를 저장하십시오.
  17. 계산된 차이 응답은 지배적인 고응답 영역이 의류 전경과 겹치고, 대응하는 유형별 인접 변화, 기하학적 관계 변화 및 융합 후 구성 요소 거리 증거에 의해 뒷받침될 때만 수용하십시오. 가장 강한 응답이 주로 의류 전경 외부에 떨어지는 경우, 파싱 출력, 구성 요소 그래프 및 융합 기록을 검토하십시오.
    참고: 테스트 세트에 대한 추론에는 검증 세트에서 선택된 체크포인트를 사용하십시오. 테스트 세트 지표에 따라 체크포인트를 선택하거나 교체하지 마십시오. 추론 및 시각화 중에 그래프와 행렬을 생성할 때 동일한 구성 요소 순서, 비활성 노드 규칙, 관계 유형 인코딩 및 정규화 프로세스를 사용하십시오.
    ​문제 해결: 모든 테스트 이미지를 처리하기 전에 추론이 중단되면, 추론 로그에서 마지막 식별자를 찾아 다음 식별자부터 재개하십시오. 검색 결과가 색상 유사도에 의해 지배되는 경우, 구조적 사전 정보 및 융합 출력물을 검토하고 체크포인트 로딩이 성공했는지 확인하십시오. 평가에서 중복 식별자가 보고되면, test_feature_manifest.csv를 다시 생성하고 재계산 전에 중복 기록을 제거하십시오. K-Means가 빈 클러스터를 생성하는 경우, 특징 정규화를 확인하고 기록된 랜덤 시드로 클러스터링을 다시 실행하십시오.

9. 비교 모델 평가

  1. python compare_models.py --config configs/protocol.yaml을 실행하십시오.
  2. 동일한 훈련, 검증 및 테스트 매니페스트를 사용하여 ResNet-50, 부위 기반 컨볼루션 베이스라인(PCB), GCN, FashionGraph, Swin Transformer, CLIP, 색상 및 질감 융합을 이용한 위상 특징 히스토그램, 어텐션 가이드 캐스케이드 네트워크, MMFL-Net, FARE-RNET 및 제안된 방법을 훈련하고 평가하십시오.
  3. 모든 방법론에 대해 동일한 이미지 크기, 전처리 작업, 훈련 에포크, 유효 배치 크기, 평가 쿼리 및 메트릭 구현을 사용하십시오.
  4. ResNet-50에 전역 평균 풀링을 유지하십시오. PCB에 수평 스트립 정렬을 적용하십시오. GCN에 고정 이미지 수준 의류 그래프를 적용하십시오. FashionGraph에 속성 유도 동적 그래프 추론을 적용하십시오. Swin Transformer 및 CLIP의 표준 이미지 인코더를 사용하십시오. 토폴로지, 색상 및 질감 기술자를 사용하여 색상 및 질감 융합 기반 토폴로지 특징 히스토그램을 구현하십시오. 의류 파싱을 포함한 전역 및 지역 특징 분기를 사용하여 어텐션 유도 캐스케이드 네트워크를 구현하십시오. 다중 스케일 및 다중 입도 특징 분기를 사용하여 MMFL-Net을 구현하십시오. 잔차 어텐션, 특징 선택 및 확장 컨텍스트 인코딩을 사용하여 FARE-RNET을 구현하십시오.
  5. 모든 비교 방법의 이미지 쿼리 분기만을 사용하십시오. 학습 가능한 모든 방법을 공통 학습 매니페스트로 재학습시키고, 공통 검증 매니페스트에서 해당 체크포인트를 선택하십시오. 모든 테스트 쿼리에 대해 순위가 매겨진 갤러리 목록을 생성하십시오.
  6. 원래 차원이 다를 경우, 등록된 학습 가능 선형 층을 통해 모든 학습된 임베딩을 512차원으로 투영하십시오. 코사인 유사도 순위 산정 전에 L2 정규화를 적용하십시오. 모든 방법에 대해 동일한 쿼리-갤러리 할당 및 메트릭 구현을 사용하십시오.
  7. 동일한 5개의 무작위 시드(random seed)를 사용하여 모든 비교 방법을 반복하십시오. SCI, SDI, Recall@5, mAP 및 실루엣 계수(silhouette coefficient)의 평균과 표본 표준 편차를 보고하십시오. 각 지표에 대해, 동일한 무작위 시드 하에서 얻은 결과를 사용하여 제안 방법과 모든 비교 방법 간의 양측 대응 표본 t-검정(two-sided paired t-test)을 수행하십시오. 5회의 실행 수준 값, 검정 통계량, 자유도 및 정확한 p-값을 기록하십시오. pevaluation_results/comparison_metrics.csv 파일의 -값.
  8. 모든 방법-에 대해 SCI, SDI, Recall@5, mAP 및 실루엣 계수를 계산하십시오. 모든 실행 수준 및 집계 값을 evaluation_results/comparison_metrics.csv에 저장하십시오.
  9. comparison_metrics.csv 파일에 모든 비교 방법에 대해 동일한 메트릭 필드와 동일한 횟수의 독립 실행 결과가 포함되어 있는지 확인하십시오.
    참고: 비교 방법 간에 데이터 파티션, 메트릭 코드 또는 쿼리-갤러리 할당을 변경하지 마십시오.
    문제 해결: 비교 모델이 512 이외의 특성 차원을 생성하는 경우, 메트릭 계산 전에 단일 등록 선형 투영 층을 추가하고 해당 모델과 함께 그 층을 학습시키십시오. 모델이 일반적인 학습률에서 수렴하지 않는 경우, 해당 모델의 공개된 구현체에 명시된 학습률을 사용하고 나머지 모든 실험 조건은 유지하십시오. 방법론별 모든 설정 값을 비교 로그에 기록하십시오.

결과

보고된 모든 실험은 표 2재료 표에 기록된 하드웨어 및 소프트웨어 환경을 사용하여 수행되었습니다. 전처리, 훈련, 추론 및 평가 전 과정에서 동일한 그래픽 드라이버, CUDA, cuDNN, Python, NumPy, PyTorch 및 torchvision 버전이 사용되었습니다. 전체 하드웨어 및 소프트웨어 환경은 표 2재료 표에 요약되어 있습니다. 표 1은 처리된 훈련, 검증 및 테스트 데이터셋을 이미지 수준의 위상 통계와 함께 요약하여 보여줍니다. 표 2는 모든 비교 방법에 사용된 공통 설정을 요약하고 있습니다.

비교 평가 결과

비교 평가는 프로토콜 섹션 7~9에 명시된 공통 데이터 분할, 전처리 작업, 훈련 제어 및 지표 정의를 따랐습니다. 표 3에서는 동일한 이미지 쿼리 프로토콜을 사용하여 평가한 일반 시각 인코더, 부분 정렬 모델, 그래프 기반 의류 표현, 교차 도메인 패션 검색 네트워크, 위상 및 외형 융합 방법, 그리고 이커머스 시각 검색 방법을 비교합니다. 도메인 특화 방법으로는 색상 및 질감 융합 기반 위상 특징 히스토그램(TFH-CT), 어텐션 가이드 캐스케이드 네트워크(AGC-Net), 다중 스케일 및 다중 세밀도 특징 학습 네트워크(MMFL-Net), 그리고 Egret Swarm Optimization 기반 잔차 네트워크를 이용한 패션 검색(FARE-RNET)이 포함됩니다. 표 3의 모든 평가 지표는 동일한 랜덤 시드, 훈련 매니페스트, 검증 매니페스트, 테스트 매니페스트, 쿼리-갤러리 할당 및 지표 구현을 사용하여 5회 독립적으로 실행한 결과의 평균과 표본 표준 편차로 보고되었습니다. 대응 표본 p-값은 일치하는 랜덤 시드 조건에서 각 방법을 제안된 방법과 비교하여 SCI, SDI, Recall@5, mAP 및 실루엣 계수에 대해 각각 계산되었습니다. 이러한 결과는 이후의 구조적 시각화, 검색, 클러스터링 및 디자인 지향 분석을 위한 정량적 근거를 제공합니다.

대표적인 프로토콜 결과 및 해석

저장된 파싱 및 그래프 파일로부터 재구성된 이미지 수준의 컴포넌트 그래프가 모든 활성 노드를 해당 의류 영역 내에 배치하고, 그림 5C에 표시된 것처럼 타입 지정 인접 행렬에 기록된 관계 유형을 유지할 때 프로토콜이 성공적으로 실행된 것으로 판단합니다. 구조 인식 응답은 그림 5D에 표시된 것처럼 의류 전경에 집중되어 있어야 합니다. 그림 6E는 제안된 방법이 빨간색 배경의 영향을 줄여 무관한 빨간색 물체가 아닌 상의 의류를 검색하는 예상 검색 결과를 보여줍니다. 그림 6B–G는 또한 검색 순위가 이미지 수준의 컴포넌트 관계 및 융합 후 컴포넌트 대응에 의해 뒷받침됨을 입증합니다. 이러한 결과는 소매 길이와 국소적 위상(topology)이 검색된 샘플 간에 여전히 다르지만, 대략적인 의류 카테고리가 회복되었음을 반영합니다.

일반적인 실패 사례로는 그림 5B의 질감 중심 활성화, 그림 6의 상단 행에 나타난 배경색 기반 검색, 그리고 그림 7의 잔류 배경 활성화 등이 있습니다. 그림 7의 경우, 지배적인 응답이 확대된 하체 실루엣과 오른쪽 의복 경계선을 따르는 반면 인접한 배경 영역에는 잔류 활성화가 남아 있으므로 부분적 국소화로 해석해야 합니다. 위상 차이 행렬, 기하학적 관계 차이 행렬, 융합 후 컴포넌트 차이 그래프 및 공간 응답이 일관된 의복 영역을 식별할 때에만 국소화가 구조적으로 뒷받침된 것으로 간주합니다. 행렬이나 컴포넌트의 상응하는 변화 없이 나타나는 공간적 핫스팟은 구조적 증거라기보다 시각적 간섭을 나타냅니다.

수락된 모든 이미지가 정규화된 의미론적 확률 맵, K행 K열의 관계 행렬, K행 512열의 외관 및 구조 특징 행렬, 그리고 올바른 이미지 식별자와 연결된 유한한 융합 특징 벡터를 생성했을 때 프로토콜 실행이 유효한 것으로 간주합니다. 시각적 검사를 통해 토폴로지가 의류 구성 요소를 따르는지, 전경 응답이 배경 응답보다 큰지, 그리고 검색 결과가 배경색이 아닌 의류 카테고리와 구조에 의해 유도되는지를 확인해야 합니다. 단편화된 확률 맵, 누락된 구성 요소 노드, 비숫자 행렬, 확산된 배경 응답 또는 색상 중심의 검색 결과는 실행 실패를 나타내며, 파싱, 그래프 구축, 특징 융합 또는 체크포인트 로딩에 대한 검토가 필요합니다.

이미지 수준의 의류 구성 요소 반응에 대한 시각적 분석

그림 5는 동일한 의류 이미지를 사용하여 ResNet-50 베이스라인과 구성 요소 인식 모델을 비교합니다. 그림 5B는 외형 베이스라인의 클래스 활성화 맵을 보여줍니다. 그림 5C는 프로토콜 섹션 3과 4에서 생성된 전경 제한 확률 맵, 구성 요소 중심 행렬, 유형별 인접 행렬, 비활성 노드 마스크 및 구성 요소 레이블 매핑을 통해 재구성된 이미지 수준의 의류 구성 요소 그래프를 나타냅니다. 그림 5D는 융합된 표현의 활성 응답을 나타냅니다. 그림 5C를 생성하는 데 인간 포즈 추정기나 인간 관절 주석은 사용되지 않았습니다.

그림 5B에서 보듯이, 베이스라인 응답은 하의의 국소적인 질감 영역에 집중되었으며 의복의 전체 경계를 일관되게 따르지 않았습니다. 그림 5C에서 각 노드는 활성화된 의복 구성 요소 영역의 중심에 해당하며, 각 엣지는 공유된 전경 경계 또는 사전 정의된 수직 순서 관계를 나타냅니다. 이 그래프는 의복 영역의 구성을 반영하며 인체의 해부학적 관절을 나타내는 것은 아닙니다. 그림 5D에서 보듯이, 구조 인식 응답은 대부분의 배경 영역에서 낮은 활성도를 유지하면서 주요 의복 전경을 포괄하였습니다. 이러한 결과는 구성 요소 그래프와 특징 융합 모듈이 평가 대상 이미지에서 질감 중심의 활성화를 감소시켰음을 나타냅니다.

의류 구조적 유사성 분석 및 디자인 참조 결과

그림 6은 검색 순위와 이를 해석하는 데 사용된 구조적 근거를 보여줍니다. 그림 6B의 쿼리 구성 요소 그래프는 활성 의류 영역과 그 유형별 관계를 기록하며, 그림 6C의 행렬은 그래프 전파에 제공된 관계 패턴을 나타냅니다. 그림 6D의 베이스라인 결과는 여전히 빨간색의 외형 단서가 지배적입니다. 그림 6E의 구조 인식 결과는 서로 다른 색상과 배경에서도 상의 의류 카테고리를 유지합니다. 그림 6F에서 가장 순위가 높은 결과의 구성 요소 그래프를 통해 쿼리 그래프와 직접 비교할 수 있으며, 그림 6G의 대응 행렬은 동일한 식별자를 공유하는 구성 요소들이 구조 기반 융합 후에도 정렬 상태를 유지하는지 보여줍니다. 대각선 대응은 누락된 노드 및 변경된 그래프 관계와 함께 종합적으로 해석되어야 합니다. 그래프 일치 없이 외형만 유사한 경우는 성공적인 구조적 검색으로 간주되지 않습니다.

검색된 의류들은 대분류 범주는 유지하고 있으나, 소매 구성 및 국부적 구성 요소 간의 관계 차이는 세밀한 대응이 불완전함을 나타냅니다. 제안된 방법은 표 3에 보고된 바와 같이 Recall@5 89.2%와 mAP 86.4%를 달성했습니다. 이러한 정량적 수치는 랭킹 성능을 설명하며, 그림 6B–G는 해석을 뒷받침하는 중간 구조적 증거를 제공합니다. 따라서 검색 결론은 테스트된 쿼리 하에서 배경색 간섭에 대한 내성이 향상되었으며 이미지 수준의 구성 요소 조직화가 더 강력해진 것으로 제한됩니다.

구조적 차이 반응 및 설계 분석 지원

~에서의 순수 차이 반응 히트맵은 그림 7H 지배적인 반응이 대상 이미지의 확대된 하체 실루엣과 오른쪽 의복 경계에 집중되어 있음을 보여줍니다. 다음의 오버레이에서는 그림 7I 가장 강한 응답은 주요 의류 전경과 일치하는 반면, 인접한 커튼 및 벽 영역의 더 약한 활성화는 잔류 배경 간섭으로 남아 있음을 보여줍니다. 공간적 응답은 다음에 제시된 컴포넌트 그래프 및 행렬 증거와 함께 해석되어야 합니다. 그림 7C–G응답은 고응답 의류 영역이 인접성 변화, 기하학적 관계 변화, 그리고 융합 후 구성 요소 간 거리 패턴과 일치하는 경우에만 유효한 구조적 차이로 처리됩니다.

그림 7E의 유형화된 인접성 변화 또는 그림 7F의 기하학적 관계 변화가 그림 7G의 구성 요소 거리 증가 및 그림 7H,I의 전경 정렬 공간 응답과 동반될 때만 구조적 차이로 인정됩니다. 확장된 하체 영역과 오른쪽 의류 경계는 이러한 교차 단계 기준을 충족합니다. 커튼과 벽면의 활성화는 구성 요소 노드, 관계 패턴 또는 융합된 구성 요소 거리의 변화와 일치하지 않으며, 따라서 비구조적 잔류 간섭으로 간주하여 기각됩니다. 이 결과는 이미지 수준의 차이 국소화를 뒷받침하지만, 봉제 패턴이나 제작 파라미터의 변동을 입증하는 것은 아닙니다.

특징 공간 분포 및 구조적 클러스터 분석

잠재 특징 공간(latent feature space)의 분포를 분석하면 의류의 구조적 시맨틱을 식별하는 모델의 능력을 확인할 수 있습니다. 본 분석에서는 구조적 사전 정보가 서로 다른 위상적 구성을 가진 의류를 서로 다른 특징 매니폴드로 조직화하는지 조사합니다. 테스트 세트에서 대표적인 5가지 구조적 범주인 반소매 상의, 바지, 스커트, 롱코트, 원피스를 선정하였습니다. 고차원 특징 벡터는 t-분포 확률적 이웃 임베딩(t-SNE)을 사용하여 2차원 평면으로 투영되었습니다. 특징 공간 내 구조적 시맨틱의 조직 상태를 특성화하기 위해 유사한 샘플의 응집도와 서로 다른 샘플 간의 분리도를 평가하였습니다. 구조 인식 특징 공간의 t-SNE 분포는 그림 8에 나타나 있습니다.

그림 8A에 나타난 바와 같이, t-SNE 투영 결과 인접 범주 간의 중첩이 제한적인 5개의 주요 특징 영역이 형성되었습니다. 5개 범주 영역에 해당하는 대표 샘플들은 그림 8B에 제시되어 있습니다. 표 3에 보고되고 그림 8에서 시각화된 바와 같이, 0.81의 SCI는 동일한 구조적 레이블을 공유하는 샘플들의 응집도를 반영하며, 0.71의 SDI는 서로 다른 구조적 레이블을 가진 샘플 간의 분리도를 반영합니다. 이러한 지표들은 특징 공간 분포의 척도로 해석되어야 하며, 오경보율(false-alarm rate)을 직접적으로 설정하는 것은 아닙니다. 그림 8A에서 보이듯, 반팔 상의와 스커트는 투영된 특징 공간에서 서로 다른 주요 영역을 차지하였으며, 소수의 샘플만이 인접 범주 경계 근처에 머물렀습니다. 바지와 원피스 또한 인접 범주와 명확한 분리를 보였습니다. 이러한 분포는 그래프 사전 정보가 완전한 클러스터 분리를 생성하지 않으면서도 범주 수준의 구조적 조직화에 기여했음을 나타냅니다. 본 평가는 표현 품질과 검색 효율성을 분리하여 분석합니다. SCI는 동일한 구조적 레이블을 공유하는 의류가 학습된 특징 공간에서 응집된 상태를 유지하는지 평가하는 반면, SDI는 서로 다른 구조적 레이블을 가진 의류가 분리된 상태를 유지하는지 평가합니다. 이러한 지표들은 프로토콜의 구조적 표현 목표에 해당합니다. Recall@5는 구조적으로 관련 있는 의류가 검색 결과의 상위 5개 내에 나타나는지 측정하며, mAP는 모든 관련 갤러리 샘플에 걸친 순위 품질을 측정합니다. 이 지표들은 디자인 참조 검색 목표에 해당합니다. SCI와 SDI가 이미 특징 공간 조직화를 특성화하므로, 실루엣 계수는 클러스터링 성능을 평가하는 데에만 사용되었습니다.

그림 9는 방법 간 정규화 없이 네 가지 대표 방법론에 대해 5회 실행한 원시 결과를 나타냅니다. 그림 9A는 원래 척도에서의 SCI와 SDI를 보여주며, 그림 9B는 Recall@5와 mAP를 백분율로 보여줍니다. 개별 실행 마커와 표준 편차 오차선은 단순한 종합 순위가 아닌 모델 학습과 관련된 변동성을 나타냅니다. 외형 기반 베이스라인은 0.62의 SCI를 달성한 반면, 제안된 방법은 0.81의 SCI와 0.71의 SDI를 달성하였습니다(표 3그림 9A). SCI 및 SDI 결과는 평가 설정 하에서 라벨 내 응집력과 라벨 간 분리도가 더 강력함을 나타냅니다. 제안된 방법은 89.2%의 Recall@5와 86.4%의 mAP를 달성하였습니다(표 3그림 9B). 이러한 검색 메트릭은 서로 다른 순위 특성을 평가하며, SCI 및 SDI와는 별개로 해석됩니다. 네 가지 메트릭 전체에서 일관된 방법론 순위는 표현 품질과 검색 성능 사이의 일치성을 나타내지만, 이것이 네 가지 평가 차원 전반에서 상대적 개선 정도가 동일함을 의미하지는 않습니다.

어블레이션 실험 및 구조적 모듈의 유효성 분석

절제 실험(ablation experiment)을 통해 전체 모델을 구조적 사전 정보(structural prior) 또는 융합 모듈(fusion module)이 제거된 변형 모델들과 비교합니다. 세 가지 구성 모두 동일한 참조 이미지와 타겟 이미지를 사용하여 배경 응답과 국소화 집중도를 직접적으로 비교할 수 있도록 하였습니다. 구조적 사전 정보가 없는 변형 모델은 이미지 레벨의 의류 구성 요소 그래프와 그 관계 제약 조건을 제거하고, 외형 특징 추출을 위해 컨볼루션 백본에만 의존합니다. 융합이 없는 변형 모델은 그래프 추론은 유지하지만 특징 피라미드(feature pyramid)를 제거하고 고수준의 시맨틱 특징만을 사용합니다. 시각화된 차이 히트맵(difference heatmaps)을 통해 노이즈 억제와 경계 정의에서 각 모듈이 수행하는 구체적인 역할을 확인할 수 있으며, 서로 다른 모듈 구성에 따른 구조적 차이 응답의 정성적 비교가 그림 10에 제시되어 있습니다.

그림 10C–E의 응답 맵은 공유된 응답 척도와 동일한 오버레이 설정으로 렌더링되었습니다. 구조적 사전 지식(structure prior)이 없는 변이 모델은 그림 10C에 나타난 바와 같이 왼쪽 배경과 무관한 환경 영역 주변에서 강한 활성화를 생성했습니다. 퓨전 모듈(fusion module)이 없는 변이 모델은 의복 외 응답의 일부를 감소시켰으나, 그림 10D에서 보이듯 하의 및 우측 주변 영역에 걸쳐 여전히 더 넓은 확산을 유지했습니다. 전체 모델은 그림 10E와 같이 주된 응답을 주요 의복 전경 방향으로 더욱 수축시켰습니다. 그림 10F는 비퓨전 변이 모델과 전체 모델 간의 전경 제한 응답 차이를 직접적으로 시각화하며, 전체 모델이 주요 의복 정렬 응답은 보존하면서 잔여 측면 확산을 억제함을 보여줍니다. 이러한 결과는 구조적 사전 지식이 주로 환경 노이즈를 감소시켰으며, 퓨전 모듈이 응답 집중도와 구조적 정렬을 추가로 개선했음을 나타냅니다. 그림 10E 는 배경 활성화의 완전한 제거보다는 상대적인 개선을 나타냅니다.

표 4는 구조적 사전 정보(structure prior)가 없는 변체, 융합 모듈(fusion module)이 없는 변체, 그리고 전체 모델에 대한 SCI, SDI 및 Recall@5를 나타냅니다. 구조적 사전 정보를 제거했을 때 SCI는 0.81에서 0.65로, Recall@5는 89.2%에서 74.5%로 감소했습니다. 융합 모듈을 제거했을 때 SDI는 0.71에서 0.64로, Recall@5는 89.2%에서 85.1%로 4.1%포인트 감소했습니다. 이러한 결과는 구조적 사전 정보가 구조적 일관성과 검색에 더 큰 영향을 미쳤으며, 특징 융합(feature fusion)은 외형 정보와 구조 정보 간의 정렬을 개선했음을 나타냅니다.

효율성 분석을 통해 전체 모델과 ResNet-50 베이스라인의 계산 비용을 비교하였습니다. ResNet-50 베이스라인은 25.6 million 개의 파라미터와 4.1 billion 회의 부동 소수점 연산이 필요했습니다. 전체 구조 인식 모델은 29.3 million 개의 파라미터와 5.4 billion 회의 부동 소수점 연산이 필요했습니다. 이미지당 평균 추론 시간은 베이스라인의 경우 15 milliseconds, 전체 모델의 경우 22 milliseconds로 7 milliseconds 증가하였습니다. 이 결과는 시간 민감도가 높은 워크플로우에 해당 프로토콜을 배포할 때 고려해야 할 측정 가능한 계산 비용이 발생함을 나타냅니다(표 5)). 구조적 제약 가중치는 최종 테스트 평가 전 검증 데이터셋(validation split)을 통해 결정되었습니다. 구조적 제약 가중치를 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5, 2.0으로 설정하여 검증 Recall@5를 조사하였습니다. 이후의 모든 훈련 및 테스트 실행에는 1.0의 가중치를 고정하여 적용하였습니다. 그림 11 은 검증 기반의 구조적 제약 가중치 1.0 선택 과정을 보여줍니다.

figure-results-1
그림 1: 구조 인식 의류 이미지 특징 학습 프로토콜의 전체 워크플로우. 입력 의류 이미지는 외형 특징 브랜치와 시맨틱 파싱 및 공간 그래프 모델링을 사용하는 구조적 특징 브랜치에 의해 처리됩니다. 두 표현은 구조 안내 융합 모듈에 의해 처리되어 최종 구조 인식 특징을 생성합니다. 구조적 일관성 손실, 구조적 판별 손실 및 구조적 관계 손실이 특징 공간을 공동으로 제약합니다. 이 그림은 특징 학습 전반에 걸쳐 의류의 외형과 구성 요소의 위상이 어떻게 통합되는지를 보여줍니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-results-2
그림 2: 이미지 수준의 의류 구성 요소 토폴로지 사전 구축. (A) 입력 의류 이미지 I. (B) 전경으로 제한된 시각적 구성 요소 맵 P이며, 여기서 7가지 색상은 이미지 수준의 의류 영역을 나타냅니다. 모든 배경 픽셀은 구성 요소 채널에서 제외됩니다. (C) 이미지 수준의 구성 요소 관계 그래프 G. 노드는 가시적인 의류 영역을 나타내고, 실선 엣지는 공유된 전경 경계를 나타내며, 점선 관계는 사전 정의된 수직 순서를 나타냅니다. 이 맵과 그래프는 이미지 검색 및 시각적 구조 비교를 지원합니다. 이는 재단 패턴 조각, 솔기 기하학, 다트 구조, 그레이딩 파라미터 또는 절단 지침을 나타내지 않습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-results-3
그림 3: 구조 가이드 특징 융합 모듈. 구조적 특징은 선형 매핑과 활성화 함수 Ψ에 의해 변환되어 구조 가중치를 생성한다. 구조 가중치는 요소별 곱셈을 통해 외형 특징을 조절한다. 조절된 외형 특징과 구조적 특징은 연결된 후 Wc에 의해 투영되며, 이후 잔차 구조적 특징이 더해져 최종 컴포넌트 특징을 생성한다. 이 그림은 최종 융합 전 구조 정보가 외형 특징 가중치를 조절함을 보여준다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-results-4
그림 4: 구조적 일관성 제약 조건 하의 특징 공간 최적화. (A) 동일한 구조적 클래스에 속하는 샘플들은 구조 일관성 손실을 통해 서로 가깝게 끌어당겨지며, 내부 구성 요소 간의 관계는 구조 관계 손실에 의해 보존된다. (B) 서로 다른 구조적 클래스의 샘플들은 구조 판별 손실에 의해 서로 멀어지게 된다. 이 그림은 세 가지 구조적 목적 함수가 어떻게 공동으로 클래스 내 응집도를 높이고 클래스 간 분리도를 증가시키는지 보여준다. 여기 를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

figure-results-5
그림 5: 대표적인 의류 특징 반응 및 컴포넌트 그래프 시각화. (A) 입력 의류 이미지. (B) ResNet-50 외형 베이스라인의 클래스 활성화 반응. (C) 프로토콜 섹션 3 및 4 동안 저장된 전경 제한 컴포넌트 맵, 컴포넌트 중심 행렬, 유형별 인접 행렬, 비활성 노드 마스크 및 컴포넌트 레이블 매핑으로부터 이미지 수준의 의류 컴포넌트 그래프를 재구성함. 노드는 활성 의류 영역을 나타내고, 실선 엣지는 공유된 전경 경계를 나타내며, 점선 엣지는 사전 정의된 수직 순서 관계를 나타냄. (D) 융합된 컴포넌트 인식 표현의 활성화 반응. 비교를 통해 텍스처 중심의 활성화와 의류 영역 유도 활성화의 차이를 보여줌. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

figure-results-6
그림 6: 적색 배경 간섭 하에서의 검색 결과 및 중간 구조적 증거. (A) 쿼리 이미지. (B) 저장된 컴포넌트 중심점과 유형화된 인접 행렬로부터 생성된 쿼리 컴포넌트 그래프. (C) 쿼리 유형화된 인접 행렬로, 행렬 값은 비활성 관계, 공유 전경 경계 및 사전 정의된 수직 순서 관계를 구분한다. (D) 외형 베이스라인에 의해 생성된 상위 3개의 검색 결과. (E) 구조 인식 표현에 의해 생성된 상위 3개의 결과. (F) 가장 높은 순위의 구조 인식 결과의 컴포넌트 그래프. (G) 쿼리와 가장 높은 순위 결과 사이의 퓨전 후 컴포넌트 대응 행렬. 높은 대각 대응은 동일한 식별자를 가진 컴포넌트 간의 일치를 나타내며, 약하거나 어긋난 응답은 컴포넌트 구성의 누락 또는 불일치를 나타낸다. 검색 결과는 대략적인 상의 카테고리를 유지하지만, 소매 구성 및 국소 위상에서는 완전한 일치를 형성하지 않는다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

figure-results-7
그림 7: 이미지 수준의 의복 토폴로지에서 공간적 응답까지의 구조적 차이 추적. (A) 참조 이미지. (B) 대상 이미지. (C) 참조 컴포넌트 그래프. (D) 대상 컴포넌트 그래프. 두 그래프 모두 저장된 컴포넌트 중심점과 유형별 인접 행렬로부터 재구성되었습니다. (E) 유형별 인접 차이 행렬. (F) 기하학적 관계 차이는 컴포넌트 중심점 변위, 공간적 분산 및 관계 가중치의 변화로부터 도출됩니다. (G) 융합 후 컴포넌트 차이 그래프로, 노드 강도는 대응하는 융합된 컴포넌트 벡터 간의 정규화된 거리를 나타내며 엣지 너비는 관계 가중치의 변화를 나타냅니다. (H) 순수 공간 차이 응답 히트맵은 오버레이와 동일한 고정 응답 척도를 사용하여 렌더링되었습니다. (I) 대상 이미지 위에 오버레이된 응답. 구조적 차이는 인접성 변화, 기하학적 관계 변화, 컴포넌트 거리 변화 및 전경 정렬 히트 응답이 일관되게 유지될 때만 인정됩니다. 컴포넌트나 관계의 상응하는 근거 없이 나타나는 배경 활성화는 유효한 의복 구조 차이가 아닌 잔류 간섭으로 처리됩니다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

figure-results-8
그림 8: 구조 인식 특징 공간 클러스터링. (A) 반소매 상의, 바지, 스커트, 롱코트 및 원피스의 t-SNE 투영 결과. 다섯 가지 카테고리는 경계 부근에서 제한적인 중첩을 보이며 주요 특징 영역을 형성한다. (B) 다섯 가지 의류 카테고리로 할당된 대표 테스트 이미지들이며, 테두리 색상은 (A)의 카테고리 색상과 일치한다. 이 그림은 인접한 카테고리 영역 근처에 소수의 샘플을 유지하면서 카테고리 수준의 구조적 조직화를 보여준다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-results-9
그림 9: 특징 공간 구조 및 검색 순위 목표에 따른 원시 성능 비교. (A) 외형 중심 베이스라인, 약한 구조 모델, 명시적 구조 모델 및 제안된 방법의 SCI 및 SDI. (B) 동일한 네 가지 방법의 Recall@5 및 mAP. 큰 마커는 5회 독립 실행의 산술 평균을, 오차선은 표본 표준 편차를, 작은 마커는 개별 실행 결과를 나타냄. SCI와 SDI는 0에서 1까지의 고정 척도로 표시되며, Recall@5와 mAP는 0에서 100%까지의 고정 백분율 척도로 표시됨. 최소-최대 정규화 또는 방법 간 재스케일링은 적용되지 않음. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

figure-results-10
그림 10: 서로 다른 모듈 구성에 따른 구조적 차이 응답. (A) 참조 이미지. (B) 타겟 이미지. (C) 구조적 사전 정보(structure prior)가 없는 변형 모델의 응답. (D) 퓨전 모듈이 없는 변형 모델의 응답. (E) 전체 모델의 응답. (C–E)는 동일한 정규화 응답 척도, 컬러 맵 및 오버레이 설정을 사용하여 렌더링되었습니다. (F) 비-퓨전 변형 모델과 전체 모델 간의 전경 제한 절대 응답 차이. 전체 모델은 주요 구조 영역 외부의 잔여 확산을 줄이면서 의복에 정렬된 주요 응답을 유지합니다. 이 비교는 구조적 사전 정보가 의복 외부의 간섭을 줄이며, 퓨전 모듈이 구조적 응답을 더욱 정교하게 만든다는 것을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

figure-results-11
그림 11: 검증 기반의 구조적 제약 가중치 선택. 구조적 제약 가중치가 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5, 2.0일 때의 Validation Recall@5 결과가 보고되었다. 각 점은 5회의 검증 실행에 대한 산술 평균을 나타내며, 각 오차선은 표본 표준 편차를 나타낸다. 가중치는 최종 테스트 평가 전에 1.0으로 고정되었다. 이 그림은 파라미터 선택 절차를 기록한 것이며, 독립적인 아키텍처 기여를 구성하지 않는다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

표 1: S1에서 S5 의류 서브셋 전체의 데이터셋 할당 및 이미지 레벨 토폴로지 통계. 본 표는 훈련, 검증, 테스트 및 총 이미지 수와 함께, 각 구조적 수준에 대한 평균 시맨틱 구성 요소 수, 활성 노드 수, 유형 엣지 수 및 주석 처리된 이미지 평면 랜드마크 수를 나타냅니다. 모든 값은 처리된 데이터 매니페스트로부터 생성되었습니다. 훈련, 검증 및 테스트 이미지 수는 구조적 검토, 중복 그룹 제어 및 누출 검사 후의 최종 서브셋 매니페스트에서 얻었으며, 토폴로지 통계는 모델 평가 중에 적용된 것과 동일한 구성 요소 순서 및 관계 정의를 사용하여 최종 그래프 레코드로부터 계산되었습니다. 여기를 클릭하여 이 파일을 다운로드하십시오.

표 2: 프로토콜 전반에 걸쳐 사용된 계산 환경, 입력 구성, 증강, 표현, 최적화, 손실 및 재현성 설정. 이 표는 운영 체제, 프로세서, 설치된 메모리, 그래픽 처리 장치, 그래픽 메모리, 그래픽 드라이버, CUDA, cuDNN, Python, NumPy, PyTorch 및 torchvision 버전을 이미지 크기, 배치 구성, 최적화 도구, 학습률 스케줄, 에포크 횟수, 랜덤 시드, 표현 차원 및 구조적 목적 가중치와 함께 보고합니다. 각 값은 software_versions.txt, configs/protocol.yaml 또는 해당 훈련 기록과 연결되어 있습니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

표 3: 일반 시각 표현 모델, 그래프 기반 의류 모델 및 도메인 특화 패션 검색 방법의 정량적 비교. 이 표는 동일한 데이터 분할 및 평가 프로토콜 하에서 11가지 방법에 대한 검색 초점, 쿼리 모달리티, SCI, SDI, Recall@5, mAP 및 실루엣 계수를 나타낸다. 모든 지표는 5회의 독립적인 실행에 대한 평균 및 표본 표준 편차로 보고되었다. 보고된 p-값은 동일한 5개의 무작위 시드 하에서 생성된 결과를 사용하여, 각 비교 방법을 제안된 방법과 비교한 양측 대응표본 t-검정(two-sided paired t-tests)을 통해 얻었다. 제안된 방법이 기준 행으로 처리되었다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

표 4: 구조적 사전 지식 및 특징 융합 모듈에 대한 어블레이션 결과. 이 표는 구조적 사전 지식이 없는 변형 모델, 융합 모듈이 없는 변형 모델, 그리고 전체 모델에 대한 SCI, SDI 및 Recall@5를 보고합니다. 구조적 사전 지식을 제거하면 SCI와 Recall@5가 더 크게 감소하는 반면, 융합 모듈을 제거하면 SDI와 응답 정렬이 감소합니다. 전체 모델이 세 가지 지표 모두에서 가장 높은 수치를 기록했습니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

표 5: ResNet-50 베이스라인과 전체 구조 인식 모델의 계산 효율성. 이 표는 표 2 및 재료 표에 기록된 것과 동일한 하드웨어 및 소프트웨어 환경에서 학습 가능한 파라미터 수, 이미지당 부동 소수점 연산 횟수, 이미지당 평균 추론 시간을 나타냅니다. 두 모델 모두 동일한 이미지 해상도, 추론 배치 설정, 전처리 작업 및 시간 측정 절차를 사용합니다. 전체 모델은 베이스라인 대비 파라미터 3.7 million 개, 부동 소수점 연산 1.3 billion 회, 이미지당 추론 시간 7 milliseconds가 추가되었습니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

토론

가장 중요한 프로토콜 단계는 의류 보존 전처리와 전경 제한 세그먼트 구성 요소 파싱입니다. 구성 요소 중심, 공간 분산 값, 공유 경계 관계, 수직 순서 관계, 관계 가중치 및 융합 표현은 모두 파싱 출력 결과로부터 도출됩니다. 경계 누출, 병합된 구성 요소 영역, 누락된 구성 요소 영역 및 잘못된 채널 할당은 그래프 구축 및 특징 융합 과정을 통해 전파됩니다. 이러한 오류는 표현된 구성 요소 관계가 원본 의류와 일치하지 않음에도 불구하고 유효한 차원을 가진 그래프 파일을 생성할 수 있습니다. 따라서 구조적 사전 정보(structural prior)를 수용하기 전에 확률 맵, 전경 제한, 구성 요소 미리보기 및 파싱 품질 기록을 반드시 확인해야 합니다.

그래프 구축 및 특징 융합에는 시맨틱 구성 요소의 고정된 순서가 필요합니다. 그래프는 전경 의류 구성 요소와 이들의 이미지 평면 관계로부터 도출됩니다. 검색 및 차이 국소화 도표는 단순히 최종 순위 이미지나 응답 히트맵만을 보여주는 것이 아니라 구조적 처리 경로를 드러냅니다. 유형별 인접 행렬은 개별 구성 요소 간의 관계를 기록하고, 기하학적 관계 행렬은 정규화된 공간 조직을 기록하며, 융합 후 구성 요소 행렬은 검색 및 국소화에 사용된 표현을 기록합니다. 구조적 결론은 이러한 중간 표현들이 최종 시각적 출력과 일치할 때만 수용되어야 합니다. 구성 요소 그래프는 해부학적 랜드마크, 인체 관절 좌표 또는 포즈 추정 네트워크를 사용하지 않습니다. 그래프 오버레이는 해당 노드와 관계 유형이 저장된 구성 요소 및 인접 파일로부터 재현될 때만 수용되어야 합니다. 비활성 구성 요소는 비활성 노드 표시자와 함께 제로 벡터로 유지되어야 하며, 외형 및 구조 특징 행렬은 융합 전에 각각 K행 512열을 포함해야 합니다. 이러한 검증은 노드 정렬 불량 및 차원 오류가 모델의 동작으로 해석되는 것을 방지합니다.

문제 해결은 가장 처음으로 나타난 유효하지 않은 중간 출력물부터 시작해야 합니다. 균일한 확률 맵은 체크포인트, 정규화 또는 카테고리 인덱스 오류를 나타내며, 비숫자 구조 행렬은 유효하지 않은 확률 분모 또는 좌표 스케일링을 나타냅니다. 확산된 응답과 색상이 지배적인 검색 결과는 약한 구조적 사전 정보, 퓨전 실패 또는 잘못된 체크포인트 로딩을 의미합니다. 학습 로그를 통해 그래프와 퓨전 레이어의 그래디언트 및 검증 기반의 체크포인트 선택 여부를 확인해야 합니다. 시각적 히트 응답을 단독적인 구조적 결론으로 사용해서는 안 됩니다. 이는 저장된 포그라운드 마스크, 입력된 인접성 변화, 기하학적 관계 행렬 및 퓨전 후의 컴포넌트 차이 그래프와 대조하여 확인해야 합니다. 의류 포그라운드 외부의 잔류 활성화는 검증된 구조적 차이가 아니라 응답 특이성이 제한적임을 나타냅니다.

외형 기반 검색과 비교하여, 본 프로토콜은 메트릭 학습 이전에 구성 요소 위상을 도입합니다. 약한 구조적 제약 및 고정 위상 그래프 모델과 비교했을 때, 시맨틱 관계 가중치는 그래프 전파를 현재 의류에 맞게 조정합니다. Table 3에 보고된 바와 같이, 전체 모델은 SCI 0.81, SDI 0.71, Recall@5 89.2%, mAP 86.4% 및 실루엣 계수 0.74를 달성했습니다. Table 4에 보고된 바와 같이, 추가적인 구조적 모듈로 인해 파라미터 수는 25.6 million에서 29.3 million으로 증가했으며, 이미지당 추론 시간은 15 milliseconds에서 22 milliseconds로 증가했습니다. 본 프로토콜의 기술적 기여는 이미지 레벨의 의류 구성 요소 그래프 구축, 외형 및 구성 요소 관계의 병렬 인코딩, 구조 가이드 특징 융합 메커니즘, 그리고 구조적 일관성, 관계 및 판별 목적 함수에 있습니다. Figure 11에 보고된 검증 스윕은 고정 학습 계수를 결정하기 위한 용도로만 사용되었으며, 네트워크 아키텍처나 목적 함수 설계에 대한 기여로 제시된 것이 아닙니다.

본 프로토콜은 심한 가려짐, 겹쳐진 의류, 작은 소스 이미지, 포즈 변화, 복잡한 배경, 그리고 가시적인 구조가 고정된 7개 영역 스키마와 일치하지 않는 의류에 대해 여전히 민감하게 반응합니다. 비대칭 디자인, 탈부착 가능 레이어, 밀집된 드레이핑, 다층 하의, 겹쳐진 장식 영역은 여러 의미적 영역을 병합하거나 현재의 그래프 정의에 없는 구성 요소 관계를 도입할 수 있습니다. 가려짐 현상은 활성 구성 요소를 억제하고, 확률 중심점을 이동시키며, 유효한 공유 경계 관계를 제거할 수 있습니다. 그림 6은 거친 상체 범주는 복구되었으나 소매 토폴로지 매칭은 불완전함을 보여주며, 그림 7 및 10은 인접한 배경 영역에 응답이 남아 있음을 보여줍니다. 이러한 결과는 유효한 텐서 차원과 그래프 연결성이 의미적으로 정확한 구조적 해석을 보장하지 않는다는 것을 나타냅니다. 따라서 본 연구는 디자인 워크플로우 효율성이나 패턴 파라미터의 직접적인 추정보다는 이미지 기반 검색, 클러스터링 및 차이 국소화를 지원합니다. 본 연구의 모든 정량적 실험은 유지 및 구조적으로 재레이블링된 DeepFashion2 코호트를 대상으로 수행되었습니다. 현재의 결과는 서로 다른 의류 분류 체계, 어노테이션 표준, 문화적 의류 범주, 이미지 소스 또는 획득 환경을 가진 독립적인 데이터셋 전체에 대한 견고성을 입증하는 것은 아닙니다. 다른 데이터셋으로 이전하려면 7개 구성 요소 채널을 다시 매핑하고 유형화된 관계 스키마를 재구성해야 할 수 있습니다. 따라서 보고된 결론은 평가된 데이터 분포 및 이미지 레벨의 구성 요소 정의로 제한됩니다.

이러한 제한 범위 내에서, 본 프로토콜은 시맨틱 파싱, 기하학적 관계 모델링, 듀얼 스트림 인코딩 및 구조 가이드 융합을 통해 의류 이미지로부터 구성 요소 인식 표현까지의 재현 가능한 시퀀스를 제공합니다. 향후 검증에서는 서로 다른 주석 시스템, 의류 카테고리, 포즈 및 배경 조건을 가진 독립적인 의류 데이터셋을 사용할 예정입니다. 또한, 현재의 7개 영역 매핑이 비대칭, 레이어드, 탈부착 가능 및 문화적 특성이 반영된 의류 구조로 확장되어야 하는지 검토할 것입니다. 수작업 디자인 스케치, 원단 간 변이 및 파라미터화된 패턴 조정은 작업별 데이터와 평가 절차가 필요한 별도의 응용 방향으로 남아 있습니다. 전문적인 사용성 및 디자인 리뷰 효율성은 정의된 참가자, 평가 기준 및 통계 절차를 갖춘 별도의 문서화된 인간 대상 연구가 필요합니다.

공개 사항

저자들은 선언할 이해관계 충돌이 없습니다.

감사의 글

본 연구는 제14차 5개년 계획 기간 동안의 제2차 성급 핵심 학부 교육 개혁 프로젝트의 지원을 받았으며, 프로젝트 명칭은 “3가지 통합, 3가지 융합” 공동 구축 모델에 기반한 “의류 및 복장 디자인” 교육 개혁 및 탐구(프로젝트 번호 JGZD2024096)입니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
중앙 처리 장치Intel CorporationIntel Core i9-13900K, 24코어, 32스레드, 최대 5.80 GHz
CondaAnaconda, Inc., anaconda.comMiniconda3 23.11.0
CUDA 툴킷NVIDIA Corporation, developer.nvidia.comCUDA 11.8
cuDNNNVIDIA Corporation, developer.nvidia.comcuDNN 8.9.7
DeepFashion2 데이터셋홍콩 중문대학교, github.com/switchablenorms/DeepFashion2공식 DeepFashion2 릴리스, 버전 1.0
그래픽 처리 장치NVIDIA CorporationNVIDIA GeForce RTX 4090, 24 GB GDDR6X
HRNet-W48 시맨틱 파싱 체크포인트HRNet 프로젝트, github.com/HRNet/HRNet-Semantic-Segmentationhrnet_w48_garment_parser_7class.pth, 프로젝트 체크포인트 버전 1.0
ImageNet으로 사전 훈련된 ResNet-50 가중치PyTorch Foundation, pytorch.orgResNet50_Weights.IMAGENET1K_V2
MatplotlibMatplotlib 개발팀, matplotlib.org버전 3.8.2
NumPyNumPy 개발자, numpy.org버전 1.26.4
NVIDIA 그래픽 드라이버NVIDIA Corporation버전 546.33
OpenCV-PythonOpenCV 팀, opencv.org버전 4.8.1.78
운영체제Microsoft CorporationWindows 11 Pro 23H2, 64비트, OS 빌드 22631.3155
판다스Pandas 개발 팀, pandas.pydata.org버전 2.1.4
파이썬Python Software Foundation, python.org버전 3.10.13
PyTorchPyTorch Foundation, pytorch.orgCUDA 11.8 기반 버전 2.1.2
PyYAMLPyYAML 프로젝트, pyyaml.org버전 6.0.1
scikit-learnscikit-learn 개발자, scikit-learn.org버전 1.3.2
SciPySciPy 개발자, scipy.org버전 1.11.4
소스 코드 저장소원고와 함께 제출된 보조 소스 코드 아카이브의류 토폴로지 프로토콜, 버전 1.0
저장 장치삼성전자Samsung 990 PRO NVMe SSD, 2 TB
시스템 메모리Kingston TechnologyKingston FURY Beast DDR5, 64 GB, 2개 × 32 GB, 5600 MHz
torchvisionPyTorch Foundation, pytorch.orgCUDA 11.8 기반 버전 0.16.2
워크스테이션사용자 정의 제작 딥러닝 워크스테이션Intel Core i9-13900K, NVIDIA GeForce RTX 4090, 64 GB 메모리, 2 TB NVMe SSD

참고문헌

  1. Xiang Z, Zhu C, Qian M, Shen Y, Shao Y. FashionSegNet: a model for high-precision semantic segmentation of clothing images. Vis Comput. 2024;40:1711-1727. doi:10.1007/s00371-023-02881-3.
  2. Sun K, Zhang J, Zhang P, Yuan K, Li G. TsrNet: a two-stage unsupervised approach for clothing region-specific textures style transfer. J Vis Commun Image Represent. 2023;91:103778. doi:10.1016/j.jvcir.2023.103778.
  3. Yang N, Ma X. Enhanced composed fashion image retrieval with a multi-hop reasoning framework. Sci Rep. 2025;15:32217. doi:10.1038/s41598-025-17402-6.
  4. Karthika Priya D, Sathyabama B. FARE-RNET: fashion cloth retrieval via Egret Swarm Optimization-based Convolutional Attention Module integrated ResNet. Int J Comput Intell Syst. 2026;19:29. doi:10.1007/s44196-025-00979-1.
  5. Köktürk Güzel BE. Efficient image retrieval in fashion: leveraging clustering and principal component analysis for search space reduction. Erzincan Univ J Sci Technol. 2024;17:638-649. doi:10.18185/erzifbed.1500279.
  6. Zhang X, Sun H, Ma J. Research on clothing image retrieval combining topology features with color texture features. Mathematics. 2024;12:2363. doi:10.3390/math12152363.
  7. Abbas W, Zhang Z, Asim M, Chen J, Ahmad S. AI-driven precision clothing classification: revolutionizing online fashion retailing with hybrid two-objective learning. Information. 2024;15:196. doi:10.3390/info15040196.
  8. Shirkhani S, Mokayed H, Saini R, Hum YC. Study of AI-driven fashion recommender systems. SN Comput Sci. 2023;4:514. doi:10.1007/s42979-023-01932-9.
  9. Balloni E, Pietrini R, Frontoni E, Mancini A, Paolanti M. OutfitAI: shop the outfit with a deep learning-based intelligent expert system. Multimed Tools Appl. 2025;84:40195-40214. doi:10.1007/s11042-025-20753-x.
  10. Kachbal I, El Abdellaoui S. Computer vision for fashion: a systematic review of design generation, simulation, and personalized recommendations. Information. 2026;17:11. doi:10.3390/info17010011.
  11. Saranya MS, Geetha P. Cross-domain fashion cloth retrieval via novel attention-guided cascade neural network and clothing parsing. Comput Vis Image Underst. 2023;235:103777. doi:10.1016/j.cviu.2023.103777.
  12. Ning T, Gao Y, Han Y. Segmentation of ethnic clothing patterns with fusion of multiple attention mechanisms. Complex Intell Syst. 2024;10:5759-5770. doi:10.1007/s40747-024-01457-5.
  13. Jiang A, Liu L, Fu X, Liu L, Peng W. Clothing hierarchical feature representation and association learning for cross-modal fashion retrieval. J Comput Aided Des Comput Graph. 2025;37:654-667. doi:10.3724/SP.J.1089.2023-00263.
  14. An H, Lee KY, Choi Y, Park M. Conceptual framework of hybrid style in fashion image datasets for machine learning. Fash Text. 2023;10:18. doi:10.1186/s40691-023-00338-8.
  15. Adel M, Mohammed AM, Elsaid AH, Abdelatey A. Deep learning for new fashion product demand prediction: integrating visual similarity and demand correction in cold-start scenarios. Int J Data Sci Anal. 2026;22:9. doi:10.1007/s41060-025-00888-8.
  16. Tang Y, Ye D, Tao F, Du G. Enhanced group relation learning via aligned attention masking for fashion product captioning. J King Saud Univ Comput Inf Sci. 2025;37:170. doi:10.1007/s44443-025-00195-z.
  17. Lyu X, Li X, Zhang Y, Lu W. Two-stage method for clothing feature detection. Big Data Cogn Comput. 2024;8:35. doi:10.3390/bdcc8040035.
  18. Tang G, Yu F, Li H, Shi Y, Liu L, Peng T, et al. ClothSeg: semantic segmentation network with feature projection for clothing parsing. J Vis Commun Image Represent. 2023;97:103980. doi:10.1016/j.jvcir.2023.103980.
  19. Cao S, Chai W, Hao S, Zhang Y, Chen H, Wang G. DiffFashion: reference-based fashion design with structure-aware transfer by diffusion models. IEEE Trans Multimedia. 2024;26:3962-3975. doi:10.1109/TMM.2023.3318297.
  20. Hou J, Lu Y, Yang Y, Liu Z. PDN: a priori dictionary network for fashion parsing. Appl Sci. 2024;14:3509. doi:10.3390/app14083509.
  21. Moratelli N, Barraco M, Morelli D, Cornia M, Baraldi L, Cucchiara R. Fashion-oriented image captioning with external knowledge retrieval and fully attentive gates. Sensors. 2023;23:1286. doi:10.3390/s23031286.
  22. Islam T, Miron A, Liu X, Li Y. Deep learning in virtual try-on: a comprehensive survey. IEEE Access. 2024;12:29475-29502. doi:10.1109/ACCESS.2024.3368612.
  23. Yan H, Zhang H, Liu L, Zhou D, Xu X, Zhang Z, et al. Toward intelligent design: an AI-based fashion designer using generative adversarial networks aided by sketch and rendering generators. IEEE Trans Multimedia. 2023;25:2323-2338. doi:10.1109/TMM.2022.3146010.
  24. Xie Z, Zhou Z, Wang Z, Ding H, Ma L. Multi-scale spatial feature-guided cloth landmark estimation. J Comput Aided Des Comput Graph. 2022;34:1763-1771. doi:10.3724/SP.J.1089.2022.19189.
  25. Jiang J, Wu D, Deng H, Long Y, Tang W, Li X, et al. HAIGEN: towards human-AI collaboration for facilitating creativity and style generation in fashion design. Proc ACM Interact Mob Wearable Ubiquitous Technol. 2024;8:107. doi:10.1145/3678518.
  26. Danner M, Brake E, Kosel G, Kyosev Y, Rose K, Rätsch M, et al. AI-assisted pattern generator for garment design. Commun Dev Assem Text Prod. 2024;5:195-206. doi:10.25367/cdatp.2024.5.p195-206.
  27. Bao C, Zhang X, Chen J, Miao Y. MMFL-net: multi-scale and multi-granularity feature learning for cross-domain fashion retrieval. Multimed Tools Appl. 2023;82:37905-37937. doi:10.1007/s11042-022-13648-8.
  28. Yang G. Clothing design style recommendation using optimized semantic-preserved generative adversarial network. J Electr Syst. 2024;20 Suppl 3:2396-2409. doi:10.52783/jes.3064.
  29. Wang Z, Tao X, Zeng X, Xing Y, Xu Z, Bruniaux P. Design of customized garments towards sustainable fashion using 3D digital simulation and machine learning-supported human-product interactions. Int J Comput Intell Syst. 2023;16:16. doi:10.1007/s44196-023-00189-7.
  30. Wu J, Huang Y, Gao M, Gao Z, Zhao J, Zhang H, et al. A two-stream hybrid convolution-transformer network architecture for clothing-change person re-identification. IEEE Trans Multimedia. 2024;26:5326-5339. doi:10.1109/TMM.2023.3331569.
  31. Khalid M, Keming M, Hussain T. Design and implementation of clothing fashion style recommendation system using deep learning. Rom J Inf Technol Autom Control. 2021;31:123-136. doi:10.33436/v31i4y202110.
  32. Wang Y, Liu L, Fu X, Liu L. MCCP: multi-modal fashion compatibility and conditional preference model for personalized clothing recommendation. Multimed Tools Appl. 2024;83:9621-9645. doi:10.1007/s11042-023-15659-5.
  33. Ma J, Sun H, Yang D, Zhang H. Personalized fashion recommendations for diverse body shapes and local preferences with contrastive multimodal cross-attention network. ACM Trans Intell Syst Technol. 2024;15:82. doi:10.1145/3637217.
  34. Yu Z, Zhao Y, Hong B, Jin Z, Huang J, Cai D, et al. Apparel-invariant feature learning for person re-identification. IEEE Trans Multimedia. 2022;24:4482-4492. doi:10.1109/TMM.2021.3119133.
  35. Peng D, Liu R, Lu J, Zhang S. Unsupervised multi-modal modeling of fashion styles with visual attributes. Appl Soft Comput. 2022;115:108214. doi:10.1016/j.asoc.2021.108214.
  36. Mathews A, Sejal N, Venugopal KR. Analysis of content based image retrieval using deep feature extraction and similarity matching. Int J Adv Comput Sci Appl. 2022;13:646-655. doi:10.14569/IJACSA.2022.0131277.
  37. Zhang C, Ji X, Cai L. Clothing recommendation with multimodal feature fusion: price sensitivity and personalization optimization. Appl Sci. 2025;15:4591. doi:10.3390/app15084591.
  38. Zhao M, Gao S, Ma J, Zhang Z. Joint clothes image detection and search via anchor-free framework. Neural Netw. 2022;155:84-94. doi:10.1016/j.neunet.2022.08.011.
  39. Fontanini T, Ferrari C. Would your clothes look good on me? Towards transferring clothing styles with adaptive instance normalization. Sensors. 2022;22:5002. doi:10.3390/s22135002.
  40. Kim S, Moon H, Oh J, Lee Y, Kwon H, Kim S. Automatic measurements of garment sizes using computer vision deep learning models and point cloud data. Appl Sci. 2022;12:5286. doi:10.3390/app12105286.
  41. Chang YH, Zhang YY. Deep learning for clothing style recognition using YOLOv5. Micromachines. 2022;13:1678. doi:10.3390/mi13101678.
  42. de Medeiros Dantas IJ, Curth M, Freire AG. Exploring databases for training models in machine learning in the fashion industry. DAT J. 2024;9:157-174. doi:10.29147/datjournal.v9i2.877.
  43. Zhu S, Zou X, Qian J, Wong WK. Learning structured relation embeddings for fine-grained fashion attribute recognition. IEEE Trans Multimedia. 2024;26:1652-1664. doi:10.1109/TMM.2023.3284593.

재인쇄 및 허가

태그

DeepFashion2HRNet W48ResNet 50