본 프로토콜은 유니폼 색상과 선수 번호 정보를 통합하여 신뢰도 변동, 가려짐 및 시각적으로 유사한 선수의 외형 속에서도 궤적 연관성과 ID 일관성을 향상시키는 스포츠 비디오용 신뢰도 기반 다중 객체 추적 워크플로우를 설명합니다.
방법 논문
본 프로토콜은 유니폼 색상과 선수 번호 정보를 통합하여 신뢰도 변동, 가려짐 및 시각적으로 유사한 선수의 외형 속에서도 궤적 연관성과 ID 일관성을 향상시키는 스포츠 비디오용 신뢰도 기반 다중 객체 추적 워크플로우를 설명합니다.
스포츠 비디오의 다중 객체 추적(Multi-Object Tracking, MOT)은 전술 분석, 선수 행동 해석 및 자동화된 통계 분석을 위한 궤적 정보를 제공합니다. 그러나 스포츠 시나리오에서는 급격한 방향 전환, 갑작스러운 정지, 빈번한 가림 현상 및 시각적으로 유사한 팀원이 자주 등장하며, 이로 인해 검출 신뢰도의 변동과 프레임 간 연관 과정에서의 ID 혼동이 발생합니다. 이러한 문제를 해결하기 위해 본 연구에서는 저지 시맨틱 퓨전(jersey semantic fusion) 기반의 신뢰도 유도형 스포츠 MOT 방법인 JerseyTrack을 제시합니다. 이 워크플로우는 각 프레임의 신뢰도 분포에 따라 검출 박스를 고, 중, 저 신뢰도 구간으로 적응적으로 분할합니다. 고신뢰도 검출은 주로 모션 유사성을 사용하여 연관시키며, 중 및 저신뢰도 검출은 컬러 클러스터링과 경량 광학 문자 인식(Optical Character Recognition, OCR) 모델을 통해 추출한 저지 색상 및 선수 번호 특징을 추가로 통합합니다. 이러한 시맨틱 특징은 보조 매칭 단계에서 모션 정보와 융합되어 궤적 연속성과 ID 일관성을 향상시킵니다. 이 방법은 SportsMOT 데이터셋을 통해 평가되었습니다. JerseyTrack은 88.9%의 다중 객체 추적 정확도(Multiple Object Tracking Accuracy, MOTA), 74.3%의 ID F1 스코어(IDentity F1 Score, IDF1), 69.9%의 고차 추적 정확도(Higher Order Tracking Accuracy, HOTA)를 달성하여, 평가된 스포츠 추적 환경에서 향상된 추적 성능을 입증했습니다. 본 프로토콜은 스포츠 비디오의 다중 객체 추적 성능을 개선하기 위해 신뢰도 유도 연관과 저지 시맨틱 정보를 통합하는 재현 가능한 워크플로우를 제공합니다.
다중 객체 추적(Multi-object tracking, MOT)은 비디오 시퀀스에서 지속적인 객체 위치 파악 및 식별 유지를 가능하게 하여, 스포츠 비디오 애플리케이션에서 선수의 궤적 추출, 전술 분석 및 자동화된 통계 분석을 지원합니다1,2,3. 신뢰할 수 있는 시각적 정보는 스포츠 과학의 종목별 의사 결정 및 성과 평가와도 관련이 있으며, 이는 후속 스포츠 분석을 위한 안정적인 비디오 기반 움직임 데이터의 가치를 더욱 강조합니다4. 스포츠 시나리오에서 전술 데이터의 신뢰성은 추적 궤적의 연속성과 타겟 식별의 일관성에 달려 있습니다.
일반적인 MOT 시나리오와 비교했을 때, 스포츠 영상에는 급격한 방향 전환, 갑작스러운 정지, 점프, 밀집된 상호작용 및 빈번한 폐색(occlusion)이 포함되어 있습니다. 이러한 요인들은 검출 박스(detection-box) 신뢰도의 상당한 변동을 야기하고 저신뢰도 검출 빈도를 높여, 궤적 연관(trajectory association)을 방해할 수 있습니다5,6. 통일된 팀 유니폼은 일반적인 외관 특징의 판별 능력을 더욱 저하시키며, 외관이 유사한 팀원 간의 정체성 혼동을 증가시킵니다7,8. 폐색과 외관 유사성이 동일한 시퀀스에서 발생하면 검출 신뢰도가 감소하고 타겟 외관 정보가 불완전해져, 궤적 연관 및 정체성 유지가 더욱 어려워집니다9,10. MOT에서 재식별(Re-ID)이란 정체성 관련 시각적 증거를 사용하여 프레임, 폐색 구간 또는 재진입 사례 전반에 걸쳐 동일한 타겟 정체성을 연관시키는 프로세스를 의미합니다. 팀 스포츠 영상에서는 동일 팀 선수들이 유사한 유니폼과 체형을 공유하는 경우가 많으므로 일반적인 Re-ID 단서가 약화될 수 있습니다. 기술 문헌 검토에 따르면 스포츠 MOT의 궤적 단편화와 정체성 혼동은 일반적으로 검출 신뢰도 활용과 정체성 단서 강화라는 두 가지 상호 보완적인 접근 방식을 통해 해결됩니다. JerseyTrack은 색상 및 선수 번호 정보를 모든 검출에 일률적으로 적용하는 대신, 검출 품질에 따라 유니폼 시맨틱 단서의 사용을 조절함으로써 이 두 가지 접근 방식의 접점에 위치합니다.
본 연구에서는 저지 시맨틱 퓨전(jersey semantic fusion) 기반의 신뢰도 안내 스포츠 MOT 방법인 JerseyTrack을 제시합니다. 이 방법은 선수가 식별 가능한 저지를 착용하고 있으며, 검출 결과가 신뢰도 점수와 함께 바운딩 박스를 제공하는 팀 스포츠 비디오를 위해 설계되었습니다. JerseyTrack은 선수 검출, 신뢰도 수준 분할, 저지 시맨틱 특징 추출, 그리고 캐스케이드 프레임 간 연관(cascaded inter-frame association)의 네 가지 주요 구성 요소로 이루어져 있습니다. 검출 신뢰도를 사용하여 검출 대상을 고신뢰도, 중신뢰도, 저신뢰도 그룹으로 적응적으로 분할하며, 각 그룹은 서로 다른 연관 전략을 통해 처리됩니다. 고신뢰도 검출 대상은 주로 모션 정보를 통해 연관되는 반면, 중신뢰도 및 저신뢰도 검출 대상은 시각적 근거가 약할 때 신원 유지 능력을 향상시키기 위해 저지 색상과 선수 번호 정보를 추가로 통합합니다. 이 방법은 전술 분석 및 선수 행동 해석과 같이 안정적인 선수 궤적이 필요한 스포츠 비디오 분석 작업에 적용하기 위한 것입니다.
제안된 접근 방식에는 운영상의 한계도 존재합니다. 유니폼 시맨틱 추출은 심한 가려짐, 모션 블러, 낮은 이미지 해상도, 비정상적인 유니폼 자세 또는 보이지 않는 선수 번호의 영향을 받을 수 있습니다. 이러한 경우, 유니폼 기반 시맨틱 단서가 불완전해질 수 있으며, 연관 과정은 모션 일관성과 다중 프레임 검증에 더 크게 의존하게 됩니다. 따라서 본 연구의 성능 주장은 평가된 데이터셋과 실험 설정으로 제한됩니다. SportsMOT 데이터셋을 이용한 실험 결과, JerseyTrack은 테스트된 스포츠 트래킹 조건 하에서 평가된 트래킹 지표를 개선하고 ID 전환 이벤트를 감소시키는 것으로 나타났습니다. 스포츠 비디오 내 MOT의 주요 어려움은 빠른 움직임, 가려짐 및 외형 유사성 조건에서 궤적 연속성과 ID 일관성을 유지하는 데 있습니다. JerseyTrack과 관련된 기존 연구들은 크게 두 가지 연구 방향으로 분류할 수 있는데, 하나는 궤적 연관을 위해 검출 신뢰도를 사용하는 것이고, 다른 하나는 스포츠 특화 시맨틱 특징을 통해 ID 단서를 강화하는 것입니다.
검출 신뢰도(Detection confidence)는 검출 박스의 신뢰성을 추정하고 다중 객체 추적(MOT)에서 궤적 연관(trajectory association)을 안내하는 데 널리 사용되어 왔습니다. 초기 추적 방법들은 대개 신뢰도를 이진 필터링 기준으로 처리하여, 오탐(false positives)을 줄이기 위해 고정된 임계값 미만의 검출 결과는 제거하였습니다11,12. 이러한 전략은 노이즈가 섞인 검출을 줄여주지만, 폐색(occlusion), 급격한 움직임 또는 낮은 이미지 품질로 인해 실제 타겟을 제거할 수 있으며, 이는 궤적 단절(trajectory fragmentation)로 이어집니다13,14,15. 유사한 필터링 전략들을 통해 고정된 신뢰도 임계값이 장면의 변화와 검출 품질에 민감하다는 것이 밝혀진 바 있습니다16,17. 저신뢰도 검출 결과의 활용도를 높이기 위해, ByteTrack은 저신뢰도 박스를 2차 매칭을 위한 후보 타겟으로 유지하고, 움직임 유사성과 궤적 이력을 통해 이를 기존 궤적과 연결하는 연관 전략을 도입했습니다18. McByte는 시간적으로 전파된 세그멘테이션 마스크를 연관 단서로 통합함으로써 스포츠 MOT 연관성을 더욱 확장하였으며, 비디오별 추가 학습 없이도 빠른 움직임, 폐색 및 카메라 이동 조건에서의 강건성을 향상시켰습니다19. 관련 연구들 또한 연관 과정에서 약하지만 잠재적으로 유효한 타겟을 유지하기 위해 저신뢰도 검출의 활용 방식을 조정해 왔습니다20,21,22. 이후 신뢰도 적응형 연관 전략들은 움직임 일관성과 검출 신뢰도에 따라 매칭 기준을 정교화했습니다23,24,25. 검출 박스 회귀 및 궤적 평활화 최적화에 기반한 궤적 정교화 방법들 또한 궤적 단절을 줄이는 데 사용되었습니다26,27,28. 추가적인 정교화 전략들은 복잡한 움직임 조건에서 궤적 연속성을 유지하기 위한 상보적인 지원을 제공합니다29. 시간적 일관성 객체 흐름(Temporal coherent object flow)은 프레임 간 객체 수준의 시간적 일관성을 추가로 모델링하여, 복잡한 MOT 시나리오에서 궤적 중단을 줄이기 위한 또 다른 연관 중심적 접근 방식을 제공합니다30. 추적기 융합(Tracker fusion) 방법들 또한 여러 추적기의 출력값으로부터 학습하며, 학습 기반의 선택 또는 융합 전략을 사용하여 다양한 MOT 벤치마크 전반에서 추적 강건성을 향상시킵니다31. 종합적으로 이러한 연구들은 신뢰도 인식 연관이 단절된 궤적을 복구하는 데 도움이 됨을 나타냅니다. 그러나 동일 팀의 선수들이 유사한 시각적 외형을 가질 때, 신뢰도와 움직임 단서만으로는 정체성 정보가 제한적입니다. 이러한 방법들이 일반적인 시나리오에서는 궤적 단절을 효과적으로 완화하지만, 스포츠 환경에서는 동일 팀 선수들이 매우 유사한 시각적 외형을 갖는 경우가 많아 신뢰도와 움직임 정보에만 의존해서는 정체성 차별화를 위한 충분한 근거를 제공할 수 없다는 내재적 한계가 있습니다32,33,34. 저신뢰도 박스가 효과적으로 회수되더라도, 특징 유사성으로 인해 정체성 전환(identity switching)이 발생할 수 있으며, 이는 스포츠 분석의 엄격한 정체성 일관성 요구사항을 충족하기 어렵게 만듭니다.
스포츠 특화 정체성 단서 또한 운동선수 추적의 정체성 식별 능력을 향상시키는 데 사용되어 왔습니다. 팀 색상 및 선수 번호와 같은 유니폼의 의미론적 정보는 일반적인 외형 임베딩보다 스포츠 상황에 더 직접적으로 연관된 정체성 단서를 제공합니다35,36,37. 유니폼 색상은 팀 수준의 식별을 지원하고 팀 간 혼동을 줄이는 데 사용되었으며, 선수 번호 인식은 번호 영역이 보이고 읽을 수 있을 때 더 세밀한 정체성 단서를 제공합니다38,39. 기존의 스포츠 추적 연구들은 밀집된 스포츠 환경에서 선수 연관성을 개선하기 위해 도메인 특화 시각 특징과 유니폼 색상 인식을 통합해 왔습니다40,41. 유니폼 번호 인식 및 합성 번호 데이터에 관한 관련 연구는 저해상도 또는 부분적으로 가려진 조건에서의 정체성 모델링을 더욱 뒷받침합니다42,43. 이러한 연구들은 유니폼 의미론이 스포츠 MOT의 정체성 표현을 강화할 수 있음을 나타냅니다. 그러나 대부분의 의미론 강화 추적 방법은 검출 신뢰도와 의미론적 특징 품질 사이의 관계를 충분히 모델링하지 않습니다. 신뢰도가 높은 검출 결과는 이미 신뢰할 수 있는 공간 및 외형 정보를 포함하고 있을 수 있어, 반복적인 의미론적 추출의 효율성이 떨어질 수 있습니다. 신뢰도가 낮은 검출 결과는 흔히 가림, 흐림, 절단 또는 저해상도 문제로 인해 색상 및 선수 번호 단서의 신뢰도가 낮아집니다. 이러한 한계는 유니폼 의미론을 모든 검출 결과에 일률적으로 적용하는 대신, 검출 품질에 따라 도입하는 신뢰도 기반 연관 설계의 동기가 됩니다. 검토된 연구들에 따르면 신뢰도 인지 연관과 유니폼 의미론 모델링은 스포츠 MOT의 서로 다른 측면을 다룹니다. 신뢰도 기반 전략은 주로 검출 결과의 연관 참여 여부와 기존 궤적과의 매칭 방법을 결정하는 반면, 유니폼 의미론 전략은 주로 스포츠 특화 단서를 통해 정체성 표현을 강화합니다. 그러나 이 두 메커니즘은 흔히 별개의 구성 요소로 설계됩니다. 그 결과, 의미론적 단서가 검출 품질에 따라 항상 조정되는 것은 아니며, 신뢰도 수준이 연관 과정에서 색상 및 선수 번호 정보의 사용을 직접적으로 제어하지 못합니다. 이러한 분리는 팀 스포츠 비디오에서 궤적 단절과 정체성 혼동을 통합적으로 처리하는 데 한계가 됩니다. 남은 연구 과제는 동일한 추적 워크플로우 내에서 검출 신뢰도 품질 평가와 유니폼 의미론 연관을 연결하는 것입니다.
본 연구는 공개적으로 이용 가능한 벤치마크 비디오 데이터셋인 SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 및 MOT20의 2차 분석을 수행하였습니다. 피험자 모집, 중재 수행 및 새로운 인간 대상 데이터 수집은 이루어지지 않았습니다. 방콕 톤부리 대학교(Bangkok Thonburi University)의 해당 기관 요건에 따라 본 연구에 대한 윤리 위원회의 승인은 필요하지 않았습니다.
다음 프로토콜은 데이터 준비부터 트래킹 평가까지 JerseyTrack을 재현하는 데 사용된 워크플로를 설명합니다. 이 워크플로는 그림 1에 요약된 바와 같이 데이터셋 준비, 검출기 준비, 저지 시맨틱 추출, 신뢰 수준 분할, 신뢰 기반 연관, 트래킹 추론 및 성능 평가를 포함합니다. 필요한 소프트웨어, 데이터셋 및 하드웨어 리소스는 재료 표에 나열되어 있습니다.

그림 1. JerseyTrack 방법의 전체 워크플로. 워크플로는 유니폼 시맨틱 특징 추출, 초기 객체 매칭, 신뢰도 기반 보조 매칭 및 특징 융합으로 구성된다. 감지된 선수 영역에서 팀 색상과 선수 번호 특징을 추출하여 연관 과정에 통합함으로써 불확실한 감지 조건에서도 궤적 매칭 성능을 향상시킨다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
1. 데이터 세트 및 디렉토리 구조 준비
2. 검출기 출력 준비
3. 저지 시맨틱 특징 추출
(2)
예측된 플레이어 수 범주를 나타냅니다.4. 파티션 검출 신뢰 수준
(4)
그림 2. 신뢰도 기반 연관 전략. 적응형 신뢰도 클러스터링을 사용하여 검출 신뢰도를 고신뢰도, 중신뢰도, 저신뢰도 구간으로 분할하는 워크플로우이다. 고신뢰도 검출은 모션 유사성을 사용하여 연관시키고, 중신뢰도 검출은 모션과 저지 시맨틱 유사성을 결합하여 연관시키며, 저신뢰도 검출은 다중 프레임 검증을 통한 시맨틱 보조 궤적 복구에 사용된다. 오른쪽 패널은 신뢰도 분할 및 연관에 사용된 수학적 공식화를 요약한 것이다. 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3. 검출 신뢰도 점수 분포. 히스토그램은 SportsMOT 데이터셋의 축구, 농구, 배구 시퀀스에 대해 5개의 신뢰 구간 내에 있는 운동선수 검출 박스의 수를 보여준다. 이 분포는 평가된 스포츠 카테고리 간의 검출기 신뢰도 차이를 나타낸다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
5. 신뢰도 기반 연관성 실행
(5)
~을(를) 나타냅니다 I프레임 내 -번째 궤적 k,
칼만 예측 궤적 상태를 나타내며, dj 후보 검출을 나타내며,
는 예측된 궤적 상태의 역공분산 행렬을 나타내며, Smot 예측 궤적과 검출 값 사이의 이동 거리를 나타냅니다.
(7)
(8)
그림 4저지 시맨틱 특징 추출. 대표 선수 검출 결과에 저지 시맨틱 추출 모듈에서 생성된 추출 팀 색상 기술자와 선수 번호 정보가 주석으로 추가됩니다. 이후 추출된 시맨틱 특징은 신뢰도 기반 데이터 연관 과정에 통합됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
6. 추적 추론 실행 및 결과 내보내기
7. 추적 성능 평가
본 섹션에서는 평가된 스포츠 다중 객체 추적 실험을 통해 얻은 정량적 및 정성적 결과를 보고합니다. 결과는 추적 정확도, ID 유지 능력, 연관 품질 및 테스트 데이터셋 설정 하에서의 강건성에 중점을 둡니다. 성능 주장은 프로토콜 및 구현 설정에서 설명한 평가 방법, 데이터셋, 탐지기 출력 및 평가 툴킷 구성으로 제한됩니다.
실험 설정 및 평가 설계
데이터셋 및 전처리:
검출기 준비, 추적 추론 및 정량적 평가를 위한 기본 벤치마크로 SportsMOT가 사용되었습니다. 이 데이터셋은 축구, 농구 및 배구 시나리오에 걸쳐 240개의 비디오 시퀀스와 150,000개 이상의 이미지 프레임을 포함하고 있습니다(그림 5). 공식 평가에서, 주요 SportsMOT 결과는 프로토콜에 기술된 검출기 출력, 추적 구성 및 TrackEval 설정과 함께 검증 분할(validation split)을 사용하여 계산되었습니다. 데이터셋 간의 직접적인 메트릭 수준 비교보다는 서로 다른 데이터셋 유형 간의 성능 전이를 조사하기 위해 TeamTrack, SoccerNet Tracking, MOT17 및 MOT20을 대상으로 교차 데이터셋 평가를 수행하였습니다.

그림 5. 평가에 사용된 대표 데이터셋. 예시 프레임은 실험적 평가에 사용된 대표적인 축구, 농구 및 배구 시퀀스를 보여준다. 이 그림은 평가된 데이터셋 전반에 걸쳐 카메라 관점, 선수 밀도 및 장면 복잡성의 변화를 강조한다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
SportsMOT 데이터는 공식 데이터셋 구조에 따라 정리되었으며, 프로토콜에 설명된 탐지기 학습 형식으로 변환되었습니다. 변환된 SportsMOT 학습 및 검증 데이터에는 90개의 시퀀스, 55,544개의 프레임, 608,152개의 어노테이션 객체가 포함되었습니다. 학습 파티션은 탐지기 준비 및 파라미터 튜닝에 사용되었으며, 검증 파티션은 본 연구에서 보고된 공식 추적 평가에 사용되었습니다. 모든 입력 프레임은 프로토콜과 재료 표에 보고된 탐지기 설정에 따라 크기가 조정되었습니다. 탐지기 준비, 시맨틱 특징 추출, 추적 추론 및 TrackEval 평가 과정에서 동일한 전처리 절차를 적용함으로써, 보고된 차이가 데이터 처리의 차이가 아닌 주로 추적 연관 전략을 반영하도록 하였습니다.
평가 지표:
추적 성능은 재료 표에 나열된 평가 툴킷으로 구현된 MOTChallenge 호환 평가 프로토콜을 사용하여 평가되었습니다. 보고된 지표는 스포츠 MOT 성능의 세 가지 측면인 전반적인 추적 정확도, ID 보존 및 탐지-연관 품질을 설명합니다. MOTA, IDF1 및 HOTA가 주요 평가 지표로 사용되었습니다44,45. MOTA는 거짓 양성(false positives), 거짓 음성(false negatives) 및 ID 전환(identity switches)을 종합하여 전반적인 추적 정확도 점수로 요약합니다. IDF1은 예측된 궤적과 정답(ground-truth) ID 사이의 일관성을 측정합니다. HOTA는 탐지 정확도와 연관 정확도를 공동으로 평가하므로 타겟 국소화와 궤적 연관 사이의 균형을 특성화합니다. DetA와 AssA는 보완적 지표로 보고되었습니다. FP, FN 및 ID 전환(ID)은 오탐지, 미탐지 및 ID 변경과 관련된 오류 원인을 특성화하는 데 사용되었습니다. SportsMOT의 방법 간 비교를 위해, 탐지기 변동 및 평가 설정 차이의 영향을 줄이고자 동일한 탐지기 출력과 평가 툴킷 구성을 사용하였습니다. 데이터셋 간 비교의 경우, 지표 값은 서로 다른 데이터셋 간의 절대적인 성능 우위의 증거라기보다 데이터셋 내 평가 결과로 해석되었습니다.
실험 환경 및 파라미터 설정:
실험은 재료 표에 나열된 하드웨어 및 소프트웨어 리소스를 사용하여 수행되었습니다. 검출기 준비, 추적 추론 및 성능 평가 과정 전반에 걸쳐 일관성을 유지하기 위해 기본 SportsMOT 실험 전반에 동일한 계산 환경, 검출기 프레임워크, 검출기 출력 및 평가 툴킷이 사용되었습니다. 재료 표에 나열된 검출기 프레임워크는 배치 크기 16, 초기 학습률 0.01, 80회의 학습 에포크로 훈련되었습니다. 저지 시맨틱 추출 모듈의 경우, 색상 클러스터링에는 K = 3인 K-means가 사용되었으며, OCR 분기에는 입력 크기가 128 × 64 픽셀인 경량 합성곱 순환 신경망이 사용되었습니다. OCR 분기는 재료 표에 나열된 적응형 옵티마이저를 사용하여 학습률 1 × 10⁻3, 가중치 감쇠 1 × 10⁻5, 배치 크기 64, 40회의 학습 에포크로 최적화되었습니다. 시맨틱 특징 추출 모듈 훈련 중 추가적인 학습률 스케줄링은 사용되지 않았습니다. OCR 손실 가중치 계수(γ)는 사용자 정의 하이퍼파라미터로 처리되었으며, 검증 세트 성능에 따라 선택되었습니다. 신뢰 수준 계층화에는 적응형 K-means 분할이 사용되었으며, 여기서 τ₁과 τ₂는 추론 전 수동으로 사전 정의되는 대신 각 프레임의 검출 신뢰도 분포로부터 계산되었습니다.
스포츠 및 시나리오 복잡성에 따른 추적 성능 분석
다양한 스포츠 및 장면 조건에서의 정량적 성능:
추적 성능은 스포츠 범주와 장면 복잡도라는 두 가지 그룹화 요인 하에 평가되었습니다. 스포츠 범주 분석에는 축구, 농구 및 배구 시퀀스가 포함되었습니다. 장면 복잡도 분석에서는 평가된 시퀀스 전반에 걸쳐 동일한 그룹화 기준을 사용하여 폐색 수준, 이동 속도 및 타겟 밀도를 고려하였습니다. 보고된 지표는 프로토콜 섹션 7에 설명된 평가 프로토콜을 따랐습니다.
그림 6은 다양한 스포츠 범주 및 장면 복잡도 조건에서의 정량적 추적 결과를 요약하여 보여줍니다. 그림 6A는 축구, 농구 및 배구 시퀀스에 걸친 MOTA 및 DetA를 나타냅니다. 그림 6B는 가려짐, 이동 속도 및 타겟 밀도의 서로 다른 수준에 따른 MOTA 변동을 나타냅니다. 그림 6C는 각 장면 복잡도 차원에 대한 누적 FP 및 FN 수를 나타냅니다.

그림 6. 스포츠 범주 및 장면 조건에 따른 추적 성능. (A) 축구, 농구, 배구 및 전체 평균에 대한 다중 객체 추적 정확도(MOTA)와 검출 정확도(DetA). (B) 폐색, 선수 밀도 및 움직임 복잡도의 수준이 서로 다른 대표적인 장면 조건별 MOTA. (C) 평가된 장면 조건별 거짓 양성(FP) 및 거짓 음성(FN) 수. 여기를 클릭하여 이 그림의 확대 버전을 확인하십시오.
세 가지 스포츠 카테고리 전체에서 JerseyTrack은 평균 88.9%의 MOTA와 평균 80.2%의 DetA를 달성했습니다. 스포츠 카테고리 간 MOTA 차이는 1.3%포인트였으며, 배구 시퀀스에서 가장 높은 MOTA(89.2%)가, 농구 시퀀스에서 가장 낮은 MOTA(87.9%)가 관찰되었습니다. 농구 시퀀스에서 관찰된 더 낮은 MOTA는 평가 대상 시퀀스 내의 빈번한 근접 상호작용과 밀집된 폐색(occlusion) 현상과 일치합니다. 가벼운 폐색, 낮은 이동 속도, 희소한 타겟 분포를 포함한 덜 복잡한 장면 조건에서 MOTA는 각각 91.8%, 93.1%, 93.8%에 도달했습니다. 더 복잡한 장면 조건에서는 MOTA가 심한 폐색 시 84.9%, 고속 이동 시 83.6%, 밀집된 타겟 분포 시 83.1%로 감소했습니다. 이러한 결과는 장면의 복잡성이 증가함에 따라 추적 성능이 감소했지만, 평가된 스포츠 시나리오 전반에서 보고된 범위 내로 유지되었음을 보여줍니다.
대표적인 스포츠 시나리오 전반의 추적 일관성:
그림 7은 밀집된 선수 간 상호작용, 장기간의 부분적 가려짐, 급격한 방향 전환이라는 세 가지 까다로운 스포츠 시나리오에서 JerseyTrack의 시간적 일관성을 보여주는 대표적인 추적 사례를 제시합니다. 이러한 대표 시퀀스 전반에 걸쳐, 추적기는 빈번한 선수 간 겹침과 역동적인 움직임에도 불구하고 일관된 궤적 ID를 유지했습니다. ID 파편화는 주로 심각한 가려짐이 발생하거나 저지 시맨틱 정보를 일시적으로 사용할 수 없을 때 관찰되었으나, 신뢰도 기반 연관 전략을 통해 신뢰할 수 있는 검출이 다시 나타난 후 궤적을 복구할 수 있었습니다. 이러한 대표 사례들은 평가된 스포츠 추적 조건 하에서 안정적인 ID 보존 능력을 입증함으로써 그림 6에 표시된 정량적 결과들을 정성적으로 뒷받침합니다.

그림 7. JerseyTrack에 의해 생성된 대표적인 추적 결과. 농구, 축구 및 배구 시퀀스의 연속 프레임은 추적 과정 중 선수들의 식별 정보와 궤적이 유지됨을 보여준다. 색상이 지정된 경계 상자는 연속적인 비디오 프레임 전반에 걸쳐 유지되는 추적된 식별 정보를 나타낸다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
정체성 보존을 위한 제거 실험 결과:
신뢰도 기반 연관 전략과 저지 시맨틱 융합 모듈이 ID 유지에 기여하는 정도를 조사하기 위해 어블레이션 분석을 수행하였습니다. V0(신뢰도 기반 연관 및 저지 시맨틱 융합이 없는 베이스라인), V1(신뢰도 기반 연관만 사용한 변형 모델), V2(저지 시맨틱 융합만 사용한 변형 모델), 그리고 두 구성 요소가 모두 포함된 전체 JerseyTrack 설정인 V3의 네 가지 모델 변형을 비교하였습니다. 평가는 IDs, IDF1, ID 정밀도(IDP), ID 재현율(IDR)을 포함한 ID 관련 지표에 중점을 두었습니다. 대표적인 ID 유지 패턴은 그림 8에 나타나 있습니다.

그림 8. 신뢰도 기반 저지 시맨틱 연관성의 어블레이션 분석. (A) 평가된 모델 변형들에 대한 전체 ID 전환(IDs) 및 ID F1 스코어(IDF1). (B) 대표적인 까다로운 추적 시나리오 하에서 전체 모델(V3)과 베이스라인 구성(V0) 간의 IDs 비교. (C) 다양한 추적 시나리오에 따른 전체 모델의 IDF1, ID 정밀도(IDP) 및 ID 재현율(IDR). 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
전체 SportsMOT 검증 설정에서, 전체 V3 구성은 4가지 모델 변체 중 가장 적은 수의 ID와 가장 높은 IDF1을 기록했습니다. V3는 2,768개의 ID를 기록하여 V0보다 ID 전환 횟수를 477회 줄였으며, IDF1은 74.3%를 달성하여 V0 대비 7.1% 포인트 증가했습니다. 이러한 결과는 평가된 스포츠 트래킹 조건 하에서 두 모듈이 ID 보존에 공동으로 기여했음을 나타냅니다. 단일 모듈 변체와 전체 구성을 비교한 결과, 두 모듈이 트래킹 오류의 서로 다른 원인에 영향을 미친다는 것이 추가로 확인되었습니다. 신뢰도 기반 연관 전략은 불안정한 검출 신뢰도 및 위치 추정 불확실성과 관련된 매칭 오류를 줄였으며, 저지 시맨틱 융합 모듈은 모션 정보만으로는 불충분할 때 추가적인 ID 정보를 제공했습니다. 전체 V3 구성은 어느 단일 모듈 변체보다 더 우수한 ID 관련 성능을 달성했으며, 이는 두 모듈이 중복된 기여가 아닌 상호 보완적인 기여를 했음을 시사합니다.
시나리오 수준의 결과에서는 정체성 유지 조건이 더 까다로울수록 더 큰 차이가 나타났습니다. 장시간의 폐색(occlusion) 동안 V3는 215개의 ID를 기록한 반면, V0는 482개를 기록했습니다. 6~10명의 선수가 포함된 조밀한 동일 팀 시나리오에서 V3는 328개의 ID를 기록했고, V0는 615개를 기록했습니다. 고속 방향 전환 시 V3는 482개의 ID를 기록한 반면, V0는 960개를 기록했습니다. 이러한 감소는 폐색 및 조밀한 상호작용 중에 시맨틱 큐(semantic cues)를 사용하려는 의도와 급격한 움직임 동안 변동하는 검출 신뢰도 하에서 신뢰도 기반 연관(confidence-guided association)을 수행한 것과 일치합니다. 그림 8C에 표시된 IDP 및 IDR 추세는 ID 수의 감소가 정체성 정밀도(identity precision)나 정체성 재현율(identity recall)의 상당한 감소를 동반하지 않았음을 나타냅니다. 전체 구성은 평가된 까다로운 시나리오 전반에서 71% 이상의 IDF1 값을 유지했으며, 조밀한 동일 팀 상호작용 및 고속 방향 전환 시 더 낮은 값이 관찰되었습니다. 이러한 결과는 평가된 조건 하에서 정체성 일관성이 향상되었음을 나타내며, 조밀한 상호작용과 급격한 움직임이 성능 저하의 주요 잔류 원인임을 확인시켜 줍니다.
교차 데이터셋 평가 결과:
SportsMOT에서 관찰된 추적 동작이 서로 다른 데이터셋 조건에서도 유지되는지 확인하기 위해 교차 데이터셋 평가를 수행하였습니다. 평가에는 두 개의 스포츠 특화 데이터셋인 SoccerNet Tracking과 TeamTrack, 그리고 두 개의 일반 MOT 데이터셋인 MOT17과 MOT20이 포함되었습니다. 본 실험의 목적은 서로 다른 데이터셋 유형 간의 성능 전이를 조사하는 것이었습니다. 어노테이션 프로토콜, 장면 구성, 카메라 시점 및 타겟 카테고리가 서로 다르기 때문에, 해당 결과는 데이터셋 간의 직접적인 지표 수준의 우위를 주장하는 데 사용되지 않았습니다.
표 1은 교차 데이터셋 평가 결과를 요약한 것입니다. 스포츠 특화 데이터셋에서 JerseyTrack은 주요 SportsMOT 검증 설정과 비교하여 상대적으로 안정적인 MOTA 및 IDF1 값을 유지했습니다. 이러한 경향은 반복되는 유니폼, 밀집된 선수 간 상호작용, 빈번한 폐색을 포함하여 추적 장면이 팀 스포츠의 시각적 특성을 유지할 때, 신뢰도 기반 연관 전략과 저지 관련 시맨틱 단서가 계속해서 효과적이었음을 시사합니다. 일반 MOT 데이터셋에서 본 방법은 경쟁력 있는 MOTA 및 DetA 값을 유지한 반면, IDF1은 스포츠 특화 데이터셋에서 관찰된 것보다 낮았습니다. 이러한 패턴은 시맨틱 퓨전 모듈에서 사용되는 저지 색상 및 선수 번호 단서가 MOT17 및 MOT20에는 존재하지 않는다는 점과 일치합니다. 이러한 조건 하에서 신뢰도 기반 연관 구성 요소는 여전히 적용 가능했지만, 시맨틱 브랜치는 팀 스포츠 비디오에서보다 정체성 특화 정보를 적게 제공했습니다. 전반적으로, 이러한 결과는 JerseyTrack이 일반 보행자 추적 데이터셋보다 스포츠 특화 시각적 시맨틱을 포함하는 데이터셋으로 더 효과적으로 전이되었음을 나타냅니다. 따라서 교차 데이터셋 평가는 본 방법이 스포츠 지향적 추적기로서 의도된 응용 분야에 적합함을 뒷받침하는 동시에, 명시적인 저지 시맨틱의 부재가 비스포츠 MOT 데이터셋에 대한 제한 요인임을 확인해 줍니다.
| 데이터셋 | MOTA↑ | IDF1↑ | DetA↑ | FPS↑ |
| SoccerNet Tracking | 86.8 | 71.3 | 77.9 | 32.1 |
| TeamTrack | 86.2 | 70.7 | 77.3 | 32.8 |
| MOT17 | 84.7 | 69.5 | 76.1 | 33.9 |
| MOT20 | 84.1 | 68.9 | 75.3 | 33.2 |
표 1: 데이터셋 간 교차 평가 결과. 4개의 공개 벤치마크 데이터셋에서 평가한 JerseyTrack의 추적 성능입니다. 다중 객체 추적 정확도(MOTA), ID F1 스코어(IDF1), 검출 정확도(DetA) 및 초당 프레임 수(FPS)로 측정된 처리 속도가 보고되었습니다. MOTA, IDF1, DetA 및 FPS의 경우 값이 높을수록 성능이 우수함을 나타냅니다.
제어된 섭동 조건 하에서의 강건성
스포츠 비디오에서 흔히 발생하는 시각적 및 탐지 품질 방해 요소 하에서 JerseyTrack의 안정성을 조사하기 위해 제어된 섭동 실험을 수행하였습니다. 평가된 섭동은 시맨틱 특징 섭동, 탐지 박스 섭동, 환경 섭동의 세 가지 범주로 분류되었습니다. 시맨틱 특징 섭동에는 선수 번호 가림, 이미지 블러, 해상도 저하 및 유사한 저지 색상이 포함되었습니다. 탐지 박스 섭동에는 바운딩 박스 오프셋, 탐지 신뢰도 변동 및 오탐지 박스가 포함되었습니다. 환경 섭동에는 비와 유사한 노이즈, 안개와 유사한 저하, 강한 조명 및 그림자 간섭이 포함되었습니다. 그림 9는 이러한 섭동 조건에서의 트래킹 성능을 요약하여 보여줍니다. 시맨틱 특징 섭동 하에서는 선수 번호의 가시성과 크롭 품질이 저하됨에 따라 트래킹 성능이 감소하였습니다. 선수 번호 영역의 40%가 가려졌을 때, 섭동이 없는 조건과 비교하여 MOTA는 3.2% 포인트, IDF1은 5.3% 포인트 감소한 반면, 시맨틱 추출 정확도는 86.7%를 유지하였습니다. 이러한 결과는 하나의 시맨틱 단서가 덜 신뢰할 수 있게 되었을 때 저지 색상과 선수 번호 단서가 상호 보완적인 정보를 제공했음을 나타냅니다. 탐지 박스 섭동 하에서 본 방법은 급격한 실패보다는 완만한 성능 저하를 보였습니다. 탐지 박스가 ±10 픽셀만큼 이동하고 신뢰도 점수가 가우시안 노이즈로 섭동되었을 때, MOTA의 감소폭은 3% 포인트 미만으로 유지되었으며, ID 전환(IDs)의 증가폭은 16% 이내로 유지되었습니다. 이러한 경향은 중간 및 낮은 신뢰도의 탐지 결과가 높은 신뢰도의 탐지에 적용되는 것과 동일한 전략이 아닌 추가적인 연관 제약 조건을 사용하여 처리되는 신뢰도 기반 연관 전략과 일치합니다.

그림 9. 제어된 섭동 하에서의 강건성 평가. (A) 등번호 가림 증가에 따른 다중 객체 추적 정확도(MOTA), IDentity F1 Score(IDF1) 및 ID 전환(IDs)의 변화. (B) 대표적인 간섭 조건 하에서의 성능 저하. (C) 다양한 간섭 유형에 따른 IDs의 증가. (D) 평가된 섭동 조건 하에서의 저지 시맨틱 추출 정확도. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.
환경 섭동 하에서, 평가된 조건에 따른 주요 추적 지표의 감소 폭은 5% 포인트 미만으로 유지되었으며, 시맨틱 추출 정확도는 87.2%를 유지했습니다. HSV 기반 색상 기술자(descriptor)를 사용하여 조명 변화에 대한 민감도를 낮춘 반면, OCR 분기는 흐릿하거나 품질이 저하된 일부 이미지 크롭에서도 유효한 선수 번호 정보를 보존했습니다. 이러한 결과는 시맨틱 모듈의 신뢰도가 여전히 저지의 가시성과 크롭 품질에 의존함에도 불구하고, 평가된 섭동 조건 하에서 계속 사용 가능했음을 나타냅니다. 전반적으로 제어된 섭동 실험을 통해 JerseyTrack이 평가된 시맨틱, 검출 품질 및 환경 섭동 하에서도 측정 가능한 추적 성능을 유지함을 보여주었습니다. 이러한 결과는 테스트된 섭동 범위 내에서 해석되어야 합니다. 체계적인 시야 밖 재식별, 심각한 배경 혼잡 및 장기적인 완전 가려짐은 본 실험에서 별도로 평가되지 않았으며, 고찰(Discussion) 섹션에서 한계점으로 논의됩니다.
모듈 기여도 및 특징 판별 분석
제안된 두 구성 요소가 정체성 관련 추적 성능에 어떤 영향을 미치는지 조사하기 위해 모듈 기여도 및 특징 판별력을 추가로 분석하였습니다. 모듈 기여도 분석에는 제거 분석(ablation analysis)에서 정의된 4가지 모델 변형을 사용하였으며, 특징 판별력 분석에서는 전통적인 Re-ID 특징, 색상 전용 특징, 선수 번호 전용 특징, 그리고 융합된 저지 시맨틱 특징을 비교하였습니다. 특징 분리도를 설명하기 위해 클래스 간/클래스 내 거리 비율을 사용하였으며, 값이 클수록 동일 정체성 내의 변동 대비 서로 다른 정체성 간의 분리가 더 큼을 의미합니다. 표 2는 모듈 기여도 분석 결과를 요약한 것입니다. 전체 평가에서 신뢰도 기반 연관 전략의 추정 기여도는 41.7%, 저지 시맨틱 융합의 추정 기여도는 47.6%였으며, 나머지 10.7%는 두 구성 요소의 결합 사용에 의한 것으로 나타났습니다. 이러한 값은 두 구성 요소 모두 관찰된 성능 향상에 기여했음을 나타내며, 전체 구성의 경우 어느 한 구성 요소만 사용했을 때보다 두 요소를 결합하여 사용했을 때 더 큰 이점을 얻었음을 보여줍니다. 기여 패턴은 장면 유형에 따라 다르게 나타났습니다. 심한 폐색(occlusion) 상황에서는 저지 시맨틱 융합의 추정 기여도가 69.4%로 증가하였는데, 이는 선수가 부분적으로 또는 일시적으로 가려졌을 때 모션 큐(motion cues)의 신뢰도가 낮아지는 것과 일치하는 결과입니다. 고속 이동 상황에서는 신뢰도 기반 연관의 추정 기여도가 44.3%에 달했고, 결합 이득은 20.6%에 이르렀습니다. 이는 빠른 움직임이나 위치 측정의 불확실성으로 인해 검출 신뢰도가 변동할 때 신뢰도 수준 분할이 더 중요해졌음을 시사합니다.
| 모델 변형 | 테스트 시나리오 | MOTA↑ | IDF1↑ | IDs↓ | 모듈 기여도 | 시너지 이득 |
| V0 (기준선) | 전체 장면 | 83.5 | 67.2 | 3245 | – | – |
| 심한 폐색 장면 | 77.8 | 61.5 | 3862 | – | – | |
| 고속 이동 장면 | 77.1 | 62.3 | 3689 | – | – | |
| V1 (신뢰도 기반 연관) | 전체 장면 | 86.3 | 70.9 | 2893 | 41.7 | – |
| 심한 폐색 장면 | 80.9 | 65.9 | 3415 | 29.8 | – | |
| 고속 이동 장면 | 81.4 | 67.9 | 3024 | 44.3 | – | |
| V2 (유니폼 시맨틱 연관) | 전체 장면 | 85.2 | 71.8 | 2937 | 47.6 | – |
| 심한 폐색 장면 | 82.7 | 72.8 | 2753 | 69.4 | – | |
| 고속 이동 장면 | 80.1 | 66.8 | 3157 | 35.1 | – | |
| V3 (전체 JerseyTrack) | 전체 장면 | 88.9 | 74.3 | 2768 | – | 10.7 |
| 심한 폐색 장면 | 84.9 | 75.6 | 2689 | – | 0.8 | |
| 고속 이동 장면 | 83.6 | 71.5 | 2842 | – | 20.6 |
표 2: 모듈 기여도에 대한 어블레이션 분석. 전체, 심한 폐쇄 및 고속 이동 시나리오에서 다양한 JerseyTrack 모델 변형의 성능 비교. 다중 객체 추적 정확도(MOTA), IDentity F1 점수(IDF1), ID 전환 횟수(IDs)를 추정된 모듈 기여도 및 시너지 이득과 함께 보고하였다. MOTA, IDF1, 모듈 기여도 및 시너지 이득은 값이 높을수록 성능이 좋음을 나타내며, IDs는 값이 낮을수록 성능이 좋음을 나타낸다.
표 3은 특징 판별 분석 결과를 요약한 것입니다. 융합된 저지 의미론적 특징(fused jersey semantic feature)은 클래스 간/클래스 내 거리 비율이 5.63을 달성했으며, 이는 기존 Re-ID 특징의 1.82와 비교하여 거리 비율 측정값에서 209.3%의 상대적 개선을 보였습니다. 색상 전용 및 선수 번호 전용 특징 또한 기존 Re-ID 특징에 비해 특징 분리도를 향상시켰으나, 각 개별 단서는 유사한 팀 색상, 선수 번호 가려짐, 모션 블러 및 판독 불가능한 저지 영역을 포함한 특정 실패 사례에 취약한 상태로 남았습니다. 평가된 특징 표현들 중 융합된 의미론적 표현이 가장 높은 특징 분리도를 달성했으며, 이는 소거 분석(ablation analysis)에서 관찰된 가장 높은 IDF1 및 가장 낮은 ID 수와 일치했습니다. 이러한 결과는 운동선수들의 외형이 유사하고 모션 정보만으로는 불충분한 스포츠 MOT 상황에서, 저지 전용 의미론적 단서를 보완적인 식별 정보로 사용하는 것을 뒷받침합니다. 이러한 관찰 결과는 평가된 SportsMOT 설정에 국한되며, 저지 의미론이 모든 스포츠 비디오의 모든 식별 모호성을 해결한다는 근거로 해석되어서는 안 됩니다.
| 특징 유형 | 클래스 간/클래스 내 거리 비율 | 상대적 개선도 (%) | IDF1↑ | IDs↓ |
| 전통적인 Re-ID 특징 | 1.82 | – | 65.7 | 3482 |
| 팀 색상 특징 | 3.17 | 74.2 | 69.8 | 3125 |
| 선수 번호 특징 | 3.49 | 91.8 | 70.5 | 3018 |
| 융합된 저지 시맨틱 특징 | 5.63 | 209.3 | 74.3 | 2768 |
표 3: 다양한 특징 표현의 판별 분석. 전통적인 재식별(Re-ID) 특징, 유니폼 색상 특징, 선수 번호 특징 및 융합된 세맨틱 특징을 사용한 특징 판별 비교. 클래스 간/클래스 내 거리 비율, 특징 판별의 상대적 개선도, IDentity F1 Score (IDF1) 및 ID 교체(IDs) 횟수를 보고하였다. 거리 비율, 상대적 개선도, IDF1의 경우 값이 높을수록 성능이 좋음을 나타내며, IDs의 경우 값이 낮을수록 성능이 좋음을 나타낸다.
기존 MOT 방법과의 벤치마크 비교
동일한 SportsMOT 검증 설정 하에서 JerseyTrack을 대표적인 MOT 방법들과 비교하기 위해 벤치마크 비교를 수행하였습니다. 비교 대상 방법에는 QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT 및 MOTR이 포함되었습니다. 모든 방법은 검출기의 변동성보다는 추적 연관 성능에 집중하여 비교할 수 있도록 재료 표에 기재된 검출기 프레임워크에 의해 생성된 동일한 검출기 출력값을 사용하였습니다. 평가는 프로토콜 섹션 7에 정의된 지표를 사용하여 수행되었습니다. 주요 평가 지표에는 MOTA, HOTA 및 IDF1이 포함되었습니다. 보조 지표에는 DetA, AssA, FPs, FNs 및 IDs가 포함되었습니다. 표 4는 SportsMOT 검증 세트에 대한 정량적 비교를 요약하며, 그림 10은 평가된 스포츠 장면 전반에 걸친 추적 정확도, 추론 속도 및 HOTA 분포의 시각적 비교를 보여줍니다. JerseyTrack은 비교 방법들 중 가장 높은 MOTA인 88.9%를 달성하였습니다. 이 값은 Deep OC-SORT(87.8%)보다 1.1% 포인트 높고, ByteTrack(86.4%)보다 2.5% 포인트 높았습니다. 따라서 평가된 SportsMOT 검증 설정 하에서 JerseyTrack은 비교 방법들 중 가장 높은 종합 추적 정확도를 달성하였습니다. HOTA의 경우, JerseyTrack은 69.9%를 달성하였으며, 이는 Deep OC-SORT의 64.4% 및 ByteTrack의 62.8%와 대비됩니다. 이러한 차이는 각각 5.5% 포인트와 7.1% 포인트의 향상에 해당하며, 이는 동일한 평가 설정 하에서 검출 및 연관 성능 간의 더 높은 균형을 나타냅니다.
| 방법 | MOTA↑ | HOTA↑ | IDF1↑ | DetA↑ | AssA↑ | FP↓ | FN↓ | IDs↓ |
| QDTrack | 75.9 | 53.7 | 51.6 | 65.6 | 39.7 | 96,324 | 89,871 | 8,216 |
| DeepSORT | 77.6 | 54.1 | 53.2 | 67.3 | 44 | 76,228 | 86,319 | 6,836 |
| ByteTrack | 86.4 | 62.8 | 67.7 | 73.8 | 50.9 | 33,752 | 78,698 | 4,192 |
| FairMOT | 84.1 | 54.7 | 62.5 | 77.8 | 47.8 | 45,187 | 83,620 | 4,817 |
| Deep OC-SORT | 87.8 | 64.4 | 69.9 | 78.2 | 52.1 | 25,012 | 74,385 | 3,211 |
| MOTR | 82.9 | 57.2 | 58.4 | 68.9 | 46.1 | 54,931 | 85,063 | 5,137 |
| JerseyTrack | 88.9 | 69.9 | 74.3 | 80.2 | 54.3 | 21,953 | 67,160 | 2,768 |
표 4: SportsMOT 검증 세트에서 JerseyTrack과 대표적인 다중 객체 추적 방법들의 성능 비교. SportsMOT 검증 데이터셋을 이용한 JerseyTrack과 대표적인 다중 객체 추적(MOT) 방법들의 비교. 보고된 지표에는 다중 객체 추적 정확도(MOTA), 고차 추적 정확도(HOTA), IDentity F1 스코어(IDF1), 검출 정확도(DetA), 연관 정확도(AssA), 위양성(FP), 위음성(FN) 및 ID 전환(IDs) 횟수가 포함된다. MOTA, HOTA, IDF1, DetA, AssA의 경우 값이 높을수록 성능이 우수하며, FP, FN, IDs의 경우 값이 낮을수록 성능이 우수함을 나타낸다.

그림 10. 대표적인 다중 객체 추적 방법과의 성능 비교. (A) SportsMOT 데이터셋에서 평가된 JerseyTrack과 대표적인 다중 객체 추적 방법들의 다중 객체 추적 정확도(MOTA) 및 초당 프레임 수(FPS) 비교. (B) 평가된 추적 방법들에 따른 고차 추적 정확도(HOTA)의 분포. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
ID 유지 성능 측면에서 JerseyTrack은 IDF1 74.3%를 달성하였으며, 이는 Deep OC-SORT의 69.9%와 ByteTrack의 67.7% 대비 높은 수치이다. 또한 JerseyTrack은 2,768개의 ID를 기록하였는데, 이는 Deep OC-SORT가 기록한 3,211개의 ID와 ByteTrack이 기록한 4,192개의 ID보다 적은 수치이다. 이러한 관찰 결과는 Figure 8 및 Table 2에 제시된 어블레이션 결과와 일치하며, 여기서 완전한 JerseyTrack 구성은 베이스라인 모델 변형들에 비해 ID 전환을 감소시켰다. 검출 및 연관 품질의 경우, JerseyTrack은 DetA 80.2%와 AssA 54.3%를 달성하였다. Deep OC-SORT와 비교했을 때, JerseyTrack은 DetA를 2.0% 포인트, AssA를 2.2% 포인트 향상시켰다. 또한 JerseyTrack은 Table 4에 보고된 다른 비교 방법들보다 더 적은 FP 및 FN을 생성하여, 21,953 FP와 67,160 FN을 기록하였다. 전반적으로, 벤치마크 비교 결과 SportsMOT 검증 설정 하에서 평가된 방법들 중 JerseyTrack이 주요 트래킹 지표에서 가장 높은 수치를 달성했음을 보여주었다. 이러한 결과는 신뢰도 기반 연관(confidence-guided association) 및 저지 시맨틱 퓨전(jersey semantic fusion)을 통해 얻은 ID 유지 및 연관 안정성의 개선 사항과 일치한다. 본 비교는 본 연구에서 사용된 공통 검출기 출력 및 SportsMOT 검증 구성으로 제한된다.
매개변수 민감도 결과
SportsMOT 검증 설정 하에서 주요 구현 파라미터가 추적 성능에 미치는 영향을 조사하기 위해 파라미터 민감도 분석을 수행하였습니다. OCR 손실 가중치 계수(γ), 신뢰 수준 계층적 클러스터 수(K), 그리고 OCR 네트워크 학습률(η)의 세 가지 파라미터를 평가하였습니다. 표 5는 서로 다른 파라미터 설정에서 얻은 MOTA, IDF1, HOTA 및 IDs를 요약하여 보여줍니다.
| 매개변수 | 값 | MOTA↑ | IDF1↑ | HOTA↑ | IDs↓ |
| OCR 손실 가중치 (γ) | 0.2 | 84.7 | 69.4 | 66.2 | 2,944 |
| 0.4 | 86.3 | 71.5 | 68.2 | 2,893 | |
| 0.6 | 87.9 | 73.1 | 68.9 | 2,815 | |
| 0.8 (최적) | 88.9 | 74.3 | 69.9 | 2,768 | |
| 1 | 88.2 | 73.8 | 69.3 | 2,792 | |
| 신뢰도 클러스터 수 (K) | 2 | 86.7 | 72.1 | 68.5 | 2,876 |
| 3 (최적) | 88.9 | 74.3 | 69.9 | 2,768 | |
| 4 | 88.1 | 73.6 | 69.7 | 2,803 | |
| 5 | 87.3 | 72.8 | 69.2 | 2,851 | |
| OCR 학습률 (η) | 1 × 10⁻⁴ | 85.9 | 70.8 | 67.3 | 2,934 |
| 5 × 10⁻⁴ | 87.6 | 72.7 | 68.7 | 2,832 | |
| 1 × 10⁻³ (최적) | 88.9 | 74.3 | 69.9 | 2,768 | |
| 5 × 10⁻³ | 87.8 | 73.2 | 69 | 2,817 | |
| 1 × 10⁻² | 86.5 | 71.6 | 68.7 | 2,889 |
표 5: 파라미터 민감도 분석. JerseyTrack에 대해 서로 다른 파라미터 설정을 사용하여 얻은 추적 성능입니다. 광학 문자 인식(OCR) 손실 가중치 계수(γ), 신뢰 클러스터 수(K) 및 OCR 학습률(η)의 서로 다른 값에 대해 다중 객체 추적 정확도(MOTA), IDentity F1 Score(IDF1), 고차 추적 정확도(HOTA) 및 ID 전환 횟수(IDs)를 보고합니다. 최적으로 식별된 파라미터 값은 보고된 실험에 사용된 설정에 해당합니다. MOTA, IDF1 및 HOTA의 경우 값이 높을수록 성능이 좋음을 나타내며, IDs의 경우 값이 낮을수록 성능이 좋음을 나타냅니다.
OCR 손실 가중치 계수(γ)의 경우, γ = 0.8에서 가장 우수한 성능이 확인되었습니다. 이 설정에서 JerseyTrack은 88.9%의 MOTA, 74.3%의 IDF1, 69.9%의 HOTA 및 2,768개의 ID를 달성했습니다. γ를 0.2로 낮추었을 때 MOTA, IDF1, HOTA는 각각 84.7%, 69.4%, 66.2%로 감소한 반면, ID 수는 2,944개로 증가했습니다. γ를 1.0으로 높였을 때는 γ = 0.8일 때와 비교하여 성능 지표가 약간 감소하여 MOTA 88.2%, IDF1 73.8%, HOTA 69.3% 및 2,792개의 ID를 기록했습니다. 이러한 결과는 OCR 감독이 불충분할 경우 선수 번호 식별 능력이 저하되며, OCR 손실 가중치를 평가된 최적값 이상으로 높여도 테스트 조건 하에서는 추적 성능이 개선되지 않았음을 나타냅니다.
신뢰 수준 계층적 클러스터 수(K)의 경우, K = 3에서 최적의 성능이 확인되었습니다. 이 설정은 방법 섹션에서 설명한 고, 중, 저 신뢰도 연관 전략에 해당합니다. K = 2일 때 신뢰도 분할의 세분성이 낮아졌으며, MOTA, IDF1, HOTA는 각각 86.7%, 72.1%, 68.5%로 감소했습니다. K가 4 또는 5로 증가했을 때도 K = 3 대비 성능이 감소했으며, 이는 과도한 분할이 검출 결과를 지나치게 좁은 신뢰도 그룹으로 나누어 연관 전략의 안정성을 떨어뜨렸음을 시사합니다. 이러한 결과는 평가된 JerseyTrack 구성에서 세 가지 신뢰 수준을 사용하는 것이 적절함을 뒷받침합니다.
OCR 네트워크 학습률(η)의 경우, η = 1 × 10-3에서 가장 우수한 성능이 확인되었습니다. 이보다 낮은 1 × 10-4의 학습률에서는 MOTA, IDF1, HOTA가 각각 85.9%, 70.8%, 67.3%로 감소했으며, ID 수는 2,934개로 증가했습니다. 반면 1 × 10-2의 더 높은 학습률에서는 MOTA, IDF1, HOTA가 각각 86.5%, 71.6%, 68.7%로 감소했고, ID 수는 2,889개로 증가했습니다. 이러한 결과는 OCR 브랜치가 학습률 선택에 민감하며, 평가 조건 하에서 1 × 10-3이 선수 번호 인식과 ID 유지 성능 사이의 최적의 균형을 제공함을 나타냅니다.
전반적으로, 표 5는 파라미터 조합 γ = 0.8, K = 3, η = 1 × 10-3이 가장 낮은 ID 수와 함께 가장 높은 MOTA, IDF1 및 HOTA 평가값을 생성했음을 보여줍니다. 민감도 분석 결과, 이러한 파라미터 값에서 적절한 편차가 발생했을 때 추적 성능에 측정 가능한 변화가 있었으나 급격한 변화는 나타나지 않았습니다. 이에 따라, 본 연구에서 보고된 벤치마크 비교 및 주요 SportsMOT 검증 실험에는 이러한 파라미터 설정이 사용되었습니다.
데이터 가용성
본 연구의 결과를 뒷받침하는 원본 평가 요약, 최종 트래킹 출력물, 환경 기록, 데이터셋 매핑 파일 및 중간 요약 파일은 공개 저장소인 https://doi.org/10.5281/zenodo.21274353에서 확인할 수 있습니다. SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 및 MOT20을 포함하여 본 연구에 사용된 기존 공개 벤치마크 데이터셋은 각 제공처에서 확인할 수 있으며, 해당 저장소에서는 재배포되지 않습니다.
본 연구에서는 검출 신뢰도 분할과 저지 시맨틱 단서를 결합한 신뢰도 기반의 스포츠 MOT 워크플로를 평가하였습니다. 신뢰도 기반 연관과 시맨틱 특징 융합은 다중 객체 추적의 데이터 연관을 개선하기 위한 보완적 전략으로 연구되어 왔습니다12,20,23,24,46. 결과에 따르면, 전체 JerseyTrack 설정은 평가된 SportsMOT 검증 환경에서 아이덴티티 보존 및 연관 안정성을 향상시켰습니다. 주요 SportsMOT 검증 결과, MOTA 88.9%, HOTA 69.9%, IDF1 74.3%, DetA 80.2%, 그리고 AssA 54.3%를 달성하였습니다. 이 수치들은 프로토콜에 기술된 검출기 출력 소스, 데이터셋 분할 및 TrackEval 설정 범위 내에서 해석되어야 합니다.
워크플로의 핵심 단계는 신뢰도 수준 분할로, 이를 통해 검출기 출력의 신뢰도에 따라 서로 다른 연관 전략을 적용할 수 있습니다20,22,23,24. JerseyTrack은 검출 내용을 고-, 중-, 저-신뢰도 그룹으로 분리함으로써, 서로 다른 신뢰도 수준의 검출 내용에 대해 각기 다른 연관 규칙을 적용합니다. 고-신뢰도 검출은 주로 이동 일관성을 통해 연관시키며, 중-신뢰도 검출은 이동 및 유니폼 시맨틱을 함께 사용합니다. 저-신뢰도 검출은 새로운 궤적을 초기화하는 데 사용되지 않으며, 궤적 복구 단계에서만 고려됩니다. 이러한 설계는 취약한 검출이나 거짓 양성(false positives)으로 인해 불안정한 ID가 생성될 위험을 줄이는 동시에, 추가적인 시맨틱 근거가 있을 때 부분적인 검출 내용이 복구에 기여할 수 있도록 합니다8,11,20. 두 번째 핵심 단계는 유니폼 시맨틱 추출입니다. 팀 색상 특징은 팀 수준의 제약 조건을 제공하며, 선수 번호 특징은 번호 영역이 보이고 읽을 수 있을 때 더 세밀한 ID 단서를 제공합니다35,41,42,43. 어블레이션 결과에 따르면, 이러한 단서들은 이동 기반 연관의 신뢰도가 낮은 동일 팀 간의 밀집된 상호작용 및 가려짐(occlusion) 사례에서 가장 유용합니다. 그러나 유니폼 시맨틱은 이동 연관을 완전히 대체하기보다 보조적인 근거로 처리해야 합니다. 선수 번호는 블러, 잘림, 뒷모습 포즈, 심한 가려짐 또는 낮은 이미지 해상도로 인해 읽지 못할 수 있습니다. 또한 팀 색상 특징은 번호 정보를 사용할 수 없을 때 같은 팀의 선수들을 구분할 수 없습니다35,42,43. 교차 데이터셋 결과는 본 방법의 적용 범위를 더욱 명확히 해줍니다. JerseyTrack은 시맨틱 분기(branch)가 유니폼 색상과 선수 번호 단서를 중심으로 설계되었기 때문에, 일반 보행자 MOT 데이터셋보다 팀 스포츠 데이터셋에 더 자연스럽게 전이되었습니다19,33,34,35,36,37. 일반 MOT 데이터셋에서도 신뢰도 기반 연관 구성 요소는 여전히 적용 가능했지만, 스포츠 특화 시맨틱 분기가 제공하는 ID 정보는 적었습니다. 따라서 본 방법은 선수들이 구별 가능한 유니폼을 입고 있으며 시맨틱 추출을 위해 유니폼 영역이 충분히 보이는 팀 스포츠 비디오에 가장 적합합니다19,33,34,35,36,37.
몇 가지 한계점이 남아 있다. 첫째, 본 방법은 검출기 출력의 품질에 의존하므로, 심각한 검출 누락이나 부정확한 바운딩 박스는 모션 예측과 시맨틱 크롭핑의 신뢰도를 모두 떨어뜨린다14,17,46. 둘째, 현재 구현에서는 장기적인 시야 밖 재식별(out-of-view re-identification)이 별도로 최적화되지 않았다. 선수가 장기간 카메라 시야를 벗어났다가 나중에 다시 진입하는 경우, 현재의 궤적 복구 전략으로는 원래의 ID를 복구하기에 불충분할 수 있다19,34. 셋째, 심한 배경 클러터, 선수 간의 겹침, 모션 블러 및 읽을 수 없는 저지 번호는 시맨틱 특징의 신뢰도를 낮출 수 있다14,35,42,46. 넷째, 현재의 평가는 공개 벤치마크 데이터셋과 통제된 섭동 설정에 집중되었다. 카메라 컷, 줌 변경 및 비표준 시점이 포함된 방송 영상에 배포하려면 추가적인 전처리 또는 재식별 모듈이 필요할 수 있다19,33,34.
주요한 실질적 함의는 신뢰도 기반 연관(confidence-guided association)과 유니폼 특정 세맨틱 단서를 검출기 구조의 변경 없이 모듈형 MOT 파이프라인에 통합할 수 있다는 점입니다. 이러한 기능은 선수 궤적 추출, 팀 이동 분석, 전술적 이벤트 리뷰 및 반자동 비디오 어노테이션과 같은 스포츠 분석 작업에 적용 가능합니다1,4,33,36. 향후 연구는 보다 강력한 시야 밖 재식별(out-of-view re-identification), 배경 클러터 처리, 시간적 특징 집계, 그리고 심한 블러나 폐색 상황에서도 더 견고한 선수 번호 인식에 집중해야 합니다14,19,34,46.
요약하자면, JerseyTrack은 신뢰도 기반 연관(confidence-guided association)과 유니폼 시맨틱 융합(jersey semantic fusion)을 결합한 스포츠 MOT 방법입니다. 이 방법은 탐지 결과들을 고신뢰도, 중신뢰도, 저신뢰도 그룹으로 분할하고 탐지 신뢰도에 따라 서로 다른 연관 규칙을 적용하며, 중신뢰도 연관 및 궤적 복원 과정에서 유니폼 색상과 선수 번호 단서를 보조적인 식별 정보로 사용합니다. 평가된 SportsMOT 검증 설정 하에서, JerseyTrack은 평가된 베이스라인 구성 대비 향상된 추적 정확도와 식별 보존 능력을 보여주었습니다. 어블레이션 결과, 전체 구성은 베이스라인 및 단일 모듈 변형 모델에 비해 식별 전환(identity switches)을 감소시켰으며, 벤치마크 비교에서는 동일한 탐지기 출력 및 평가 구성 하에서 주요 추적 지표들이 더 높은 수치를 나타냈습니다. 이러한 결과는 팀 스포츠 영상 내 선수 추적 시, 특히 유니폼 영역이 보이고 팀 색상이나 선수 번호 정보가 보충적인 식별 근거를 제공하는 경우, 신뢰도 수준 정보와 유니폼 특화 시맨틱 단서를 사용하는 것이 유효함을 뒷받침합니다20,35,46. 확인된 한계점들을 해결한다면, 제안된 워크플로우를 더욱 까다로운 스포츠 추적 시나리오에 적용하는 능력을 더욱 향상시킬 수 있을 것입니다.
저자들은 재정적 이해관계의 충돌이 없음을 밝힙니다.
저자들은 밝힐 감사 인사가 없습니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| CUDA Runtime | NVIDIA | Version 12.8 | 검출기 학습, 의미론적 특징 추출 및 추적 추론에 사용되는 GPU 컴퓨팅 런타임. |
| EasyOCR | Jaided AI | Version 1.7.2 | 선수 번호 인식에 사용되는 광학 문자 인식 툴킷. |
| JerseyTrack 소스 코드 | 저자 | N/A | 데이터 준비, 의미론적 특징 추출, 신뢰도 분할, 추적, 후처리 및 평가 스크립트를 포함하는 사용자 정의 구현. 다음에서 이용 가능: https://doi.org/10.5281/zenodo.21274352 |
| 경량 CRNN OCR 모델 | 저자 | N/A | 선수 번호 인식에 사용되는 사용자 정의 합성곱 재귀 신경망(CRNN). |
| MOT17 데이터셋 | MOTChallenge | N/A | 교차 데이터셋 평가에 사용되는 공개 벤치마크 데이터셋. 다음에서 이용 가능: https://motchallenge.net/data/MOT17/ |
| MOT20 데이터셋 | MOTChallenge | N/A | 교차 데이터셋 평가에 사용되는 공개 벤치마크 데이터셋. 다음에서 이용 가능: https://motchallenge.net/data/MOT20/ |
| motmetrics | motmetrics 개발자 | Version 1.4.0 | 진단적 다중 객체 추적 메트릭 계산에 사용되는 라이브러리. |
| NVIDIA GPU | NVIDIA | GeForce RTX 5090 D V2 | 검출기 학습 및 추적 추론에 사용되는 그래픽 처리 장치. |
| NVIDIA GPU 드라이버 | NVIDIA | Version 610.62 | 실험 환경에서 사용된 GPU 드라이버. |
| NumPy | NumPy 개발자 | Version 2.4.4 | 특징 처리 및 데이터 핸들링에 사용되는 수치 계산 라이브러리. |
| OpenCV | OpenCV | Version 4.10.0 | 이미지 로드, 크롭, 전처리 및 시각화에 사용되는 컴퓨터 비전 라이브러리. |
| Python | Python Software Foundation | Version 3.12.2 | 전체 워크플로우에 사용된 프로그래밍 언어. |
| PyTorch | PyTorch Foundation | Version 2.11.0+cu128 | 검출기 및 의미론적 모델 구현에 사용된 딥러닝 프레임워크. |
| scikit-learn | scikit-learn 개발자 | Version 1.9.0 | 저지 색상 추출 및 신뢰도 분할 중 K-means 클러스터링에 사용된 머신러닝 라이브러리. |
| SoccerNet Tracking 데이터셋 | SoccerNet | N/A | 교차 데이터셋 평가에 사용되는 공개 축구 추적 벤치마크. 다음에서 이용 가능: https://www.soccer-net.org/tasks/tracking |
| SportsMOT 데이터셋 | SportsMOT Benchmark | N/A | 검출기 준비 및 추적 평가에 사용된 기본 벤치마크 데이터셋. 다음에서 이용 가능: https://deeperaction.github.io/datasets/sportsmot.html |
| TeamTrack 데이터셋 | TeamTrack Benchmark | N/A | 교차 데이터셋 평가에 사용되는 공개 스포츠 추적 벤치마크. 다음에서 이용 가능: https://atomscott.github.io/TeamTrack/ |
| Torchvision | PyTorch Foundation | Version 0.26.0+cu128 | 이미지 변환 및 모델 지원을 위해 PyTorch와 함께 사용되는 컴퓨터 비전 라이브러리. |
| TrackEval | TrackEval 개발자 | Version 1.3.0 | 다중 객체 추적 정확도(MOTA), IDentity F1 스코어(IDF1), 고차 추적 정확도(HOTA), 검출 정확도(DetA), 연관 정확도(AssA), 위양성(FP), 위음성(FN) 및 ID 전환(IDs)을 계산하는 데 사용되는 평가 툴킷. |
| Ultralytics | Ultralytics | Version 8.4.90 | 검출기를 학습시키고 선수 검출 결과를 생성하는 데 사용된 객체 검출 프레임워크. |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청