방법 논문

유니폼 시맨틱 퓨전을 이용한 스포츠 비디오용 신뢰도 기반 다중 객체 추적 방법

DOI:

10.3791/71557

2026년 8월 14일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 프로토콜은 유니폼 색상과 선수 번호 정보를 통합하여 신뢰도 변동, 가려짐 및 시각적으로 유사한 선수의 외형 속에서도 궤적 연관성과 ID 일관성을 향상시키는 스포츠 비디오용 신뢰도 기반 다중 객체 추적 워크플로우를 설명합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

스포츠 비디오의 다중 객체 추적(Multi-Object Tracking, MOT)은 전술 분석, 선수 행동 해석 및 자동화된 통계 분석을 위한 궤적 정보를 제공합니다. 그러나 스포츠 시나리오에서는 급격한 방향 전환, 갑작스러운 정지, 빈번한 가림 현상 및 시각적으로 유사한 팀원이 자주 등장하며, 이로 인해 검출 신뢰도의 변동과 프레임 간 연관 과정에서의 ID 혼동이 발생합니다. 이러한 문제를 해결하기 위해 본 연구에서는 저지 시맨틱 퓨전(jersey semantic fusion) 기반의 신뢰도 유도형 스포츠 MOT 방법인 JerseyTrack을 제시합니다. 이 워크플로우는 각 프레임의 신뢰도 분포에 따라 검출 박스를 고, 중, 저 신뢰도 구간으로 적응적으로 분할합니다. 고신뢰도 검출은 주로 모션 유사성을 사용하여 연관시키며, 중 및 저신뢰도 검출은 컬러 클러스터링과 경량 광학 문자 인식(Optical Character Recognition, OCR) 모델을 통해 추출한 저지 색상 및 선수 번호 특징을 추가로 통합합니다. 이러한 시맨틱 특징은 보조 매칭 단계에서 모션 정보와 융합되어 궤적 연속성과 ID 일관성을 향상시킵니다. 이 방법은 SportsMOT 데이터셋을 통해 평가되었습니다. JerseyTrack은 88.9%의 다중 객체 추적 정확도(Multiple Object Tracking Accuracy, MOTA), 74.3%의 ID F1 스코어(IDentity F1 Score, IDF1), 69.9%의 고차 추적 정확도(Higher Order Tracking Accuracy, HOTA)를 달성하여, 평가된 스포츠 추적 환경에서 향상된 추적 성능을 입증했습니다. 본 프로토콜은 스포츠 비디오의 다중 객체 추적 성능을 개선하기 위해 신뢰도 유도 연관과 저지 시맨틱 정보를 통합하는 재현 가능한 워크플로우를 제공합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

다중 객체 추적(Multi-object tracking, MOT)은 비디오 시퀀스에서 지속적인 객체 위치 파악 및 식별 유지를 가능하게 하여, 스포츠 비디오 애플리케이션에서 선수의 궤적 추출, 전술 분석 및 자동화된 통계 분석을 지원합니다1,2,3. 신뢰할 수 있는 시각적 정보는 스포츠 과학의 종목별 의사 결정 및 성과 평가와도 관련이 있으며, 이는 후속 스포츠 분석을 위한 안정적인 비디오 기반 움직임 데이터의 가치를 더욱 강조합니다4. 스포츠 시나리오에서 전술 데이터의 신뢰성은 추적 궤적의 연속성과 타겟 식별의 일관성에 달려 있습니다.

일반적인 MOT 시나리오와 비교했을 때, 스포츠 영상에는 급격한 방향 전환, 갑작스러운 정지, 점프, 밀집된 상호작용 및 빈번한 폐색(occlusion)이 포함되어 있습니다. 이러한 요인들은 검출 박스(detection-box) 신뢰도의 상당한 변동을 야기하고 저신뢰도 검출 빈도를 높여, 궤적 연관(trajectory association)을 방해할 수 있습니다5,6. 통일된 팀 유니폼은 일반적인 외관 특징의 판별 능력을 더욱 저하시키며, 외관이 유사한 팀원 간의 정체성 혼동을 증가시킵니다7,8. 폐색과 외관 유사성이 동일한 시퀀스에서 발생하면 검출 신뢰도가 감소하고 타겟 외관 정보가 불완전해져, 궤적 연관 및 정체성 유지가 더욱 어려워집니다9,10. MOT에서 재식별(Re-ID)이란 정체성 관련 시각적 증거를 사용하여 프레임, 폐색 구간 또는 재진입 사례 전반에 걸쳐 동일한 타겟 정체성을 연관시키는 프로세스를 의미합니다. 팀 스포츠 영상에서는 동일 팀 선수들이 유사한 유니폼과 체형을 공유하는 경우가 많으므로 일반적인 Re-ID 단서가 약화될 수 있습니다. 기술 문헌 검토에 따르면 스포츠 MOT의 궤적 단편화와 정체성 혼동은 일반적으로 검출 신뢰도 활용과 정체성 단서 강화라는 두 가지 상호 보완적인 접근 방식을 통해 해결됩니다. JerseyTrack은 색상 및 선수 번호 정보를 모든 검출에 일률적으로 적용하는 대신, 검출 품질에 따라 유니폼 시맨틱 단서의 사용을 조절함으로써 이 두 가지 접근 방식의 접점에 위치합니다.

본 연구에서는 저지 시맨틱 퓨전(jersey semantic fusion) 기반의 신뢰도 안내 스포츠 MOT 방법인 JerseyTrack을 제시합니다. 이 방법은 선수가 식별 가능한 저지를 착용하고 있으며, 검출 결과가 신뢰도 점수와 함께 바운딩 박스를 제공하는 팀 스포츠 비디오를 위해 설계되었습니다. JerseyTrack은 선수 검출, 신뢰도 수준 분할, 저지 시맨틱 특징 추출, 그리고 캐스케이드 프레임 간 연관(cascaded inter-frame association)의 네 가지 주요 구성 요소로 이루어져 있습니다. 검출 신뢰도를 사용하여 검출 대상을 고신뢰도, 중신뢰도, 저신뢰도 그룹으로 적응적으로 분할하며, 각 그룹은 서로 다른 연관 전략을 통해 처리됩니다. 고신뢰도 검출 대상은 주로 모션 정보를 통해 연관되는 반면, 중신뢰도 및 저신뢰도 검출 대상은 시각적 근거가 약할 때 신원 유지 능력을 향상시키기 위해 저지 색상과 선수 번호 정보를 추가로 통합합니다. 이 방법은 전술 분석 및 선수 행동 해석과 같이 안정적인 선수 궤적이 필요한 스포츠 비디오 분석 작업에 적용하기 위한 것입니다.

제안된 접근 방식에는 운영상의 한계도 존재합니다. 유니폼 시맨틱 추출은 심한 가려짐, 모션 블러, 낮은 이미지 해상도, 비정상적인 유니폼 자세 또는 보이지 않는 선수 번호의 영향을 받을 수 있습니다. 이러한 경우, 유니폼 기반 시맨틱 단서가 불완전해질 수 있으며, 연관 과정은 모션 일관성과 다중 프레임 검증에 더 크게 의존하게 됩니다. 따라서 본 연구의 성능 주장은 평가된 데이터셋과 실험 설정으로 제한됩니다. SportsMOT 데이터셋을 이용한 실험 결과, JerseyTrack은 테스트된 스포츠 트래킹 조건 하에서 평가된 트래킹 지표를 개선하고 ID 전환 이벤트를 감소시키는 것으로 나타났습니다. 스포츠 비디오 내 MOT의 주요 어려움은 빠른 움직임, 가려짐 및 외형 유사성 조건에서 궤적 연속성과 ID 일관성을 유지하는 데 있습니다. JerseyTrack과 관련된 기존 연구들은 크게 두 가지 연구 방향으로 분류할 수 있는데, 하나는 궤적 연관을 위해 검출 신뢰도를 사용하는 것이고, 다른 하나는 스포츠 특화 시맨틱 특징을 통해 ID 단서를 강화하는 것입니다.

검출 신뢰도(Detection confidence)는 검출 박스의 신뢰성을 추정하고 다중 객체 추적(MOT)에서 궤적 연관(trajectory association)을 안내하는 데 널리 사용되어 왔습니다. 초기 추적 방법들은 대개 신뢰도를 이진 필터링 기준으로 처리하여, 오탐(false positives)을 줄이기 위해 고정된 임계값 미만의 검출 결과는 제거하였습니다11,12. 이러한 전략은 노이즈가 섞인 검출을 줄여주지만, 폐색(occlusion), 급격한 움직임 또는 낮은 이미지 품질로 인해 실제 타겟을 제거할 수 있으며, 이는 궤적 단절(trajectory fragmentation)로 이어집니다13,14,15. 유사한 필터링 전략들을 통해 고정된 신뢰도 임계값이 장면의 변화와 검출 품질에 민감하다는 것이 밝혀진 바 있습니다16,17. 저신뢰도 검출 결과의 활용도를 높이기 위해, ByteTrack은 저신뢰도 박스를 2차 매칭을 위한 후보 타겟으로 유지하고, 움직임 유사성과 궤적 이력을 통해 이를 기존 궤적과 연결하는 연관 전략을 도입했습니다18. McByte는 시간적으로 전파된 세그멘테이션 마스크를 연관 단서로 통합함으로써 스포츠 MOT 연관성을 더욱 확장하였으며, 비디오별 추가 학습 없이도 빠른 움직임, 폐색 및 카메라 이동 조건에서의 강건성을 향상시켰습니다19. 관련 연구들 또한 연관 과정에서 약하지만 잠재적으로 유효한 타겟을 유지하기 위해 저신뢰도 검출의 활용 방식을 조정해 왔습니다20,21,22. 이후 신뢰도 적응형 연관 전략들은 움직임 일관성과 검출 신뢰도에 따라 매칭 기준을 정교화했습니다23,24,25. 검출 박스 회귀 및 궤적 평활화 최적화에 기반한 궤적 정교화 방법들 또한 궤적 단절을 줄이는 데 사용되었습니다26,27,28. 추가적인 정교화 전략들은 복잡한 움직임 조건에서 궤적 연속성을 유지하기 위한 상보적인 지원을 제공합니다29. 시간적 일관성 객체 흐름(Temporal coherent object flow)은 프레임 간 객체 수준의 시간적 일관성을 추가로 모델링하여, 복잡한 MOT 시나리오에서 궤적 중단을 줄이기 위한 또 다른 연관 중심적 접근 방식을 제공합니다30. 추적기 융합(Tracker fusion) 방법들 또한 여러 추적기의 출력값으로부터 학습하며, 학습 기반의 선택 또는 융합 전략을 사용하여 다양한 MOT 벤치마크 전반에서 추적 강건성을 향상시킵니다31. 종합적으로 이러한 연구들은 신뢰도 인식 연관이 단절된 궤적을 복구하는 데 도움이 됨을 나타냅니다. 그러나 동일 팀의 선수들이 유사한 시각적 외형을 가질 때, 신뢰도와 움직임 단서만으로는 정체성 정보가 제한적입니다. 이러한 방법들이 일반적인 시나리오에서는 궤적 단절을 효과적으로 완화하지만, 스포츠 환경에서는 동일 팀 선수들이 매우 유사한 시각적 외형을 갖는 경우가 많아 신뢰도와 움직임 정보에만 의존해서는 정체성 차별화를 위한 충분한 근거를 제공할 수 없다는 내재적 한계가 있습니다32,33,34. 저신뢰도 박스가 효과적으로 회수되더라도, 특징 유사성으로 인해 정체성 전환(identity switching)이 발생할 수 있으며, 이는 스포츠 분석의 엄격한 정체성 일관성 요구사항을 충족하기 어렵게 만듭니다.

스포츠 특화 정체성 단서 또한 운동선수 추적의 정체성 식별 능력을 향상시키는 데 사용되어 왔습니다. 팀 색상 및 선수 번호와 같은 유니폼의 의미론적 정보는 일반적인 외형 임베딩보다 스포츠 상황에 더 직접적으로 연관된 정체성 단서를 제공합니다35,36,37. 유니폼 색상은 팀 수준의 식별을 지원하고 팀 간 혼동을 줄이는 데 사용되었으며, 선수 번호 인식은 번호 영역이 보이고 읽을 수 있을 때 더 세밀한 정체성 단서를 제공합니다38,39. 기존의 스포츠 추적 연구들은 밀집된 스포츠 환경에서 선수 연관성을 개선하기 위해 도메인 특화 시각 특징과 유니폼 색상 인식을 통합해 왔습니다40,41. 유니폼 번호 인식 및 합성 번호 데이터에 관한 관련 연구는 저해상도 또는 부분적으로 가려진 조건에서의 정체성 모델링을 더욱 뒷받침합니다42,43. 이러한 연구들은 유니폼 의미론이 스포츠 MOT의 정체성 표현을 강화할 수 있음을 나타냅니다. 그러나 대부분의 의미론 강화 추적 방법은 검출 신뢰도와 의미론적 특징 품질 사이의 관계를 충분히 모델링하지 않습니다. 신뢰도가 높은 검출 결과는 이미 신뢰할 수 있는 공간 및 외형 정보를 포함하고 있을 수 있어, 반복적인 의미론적 추출의 효율성이 떨어질 수 있습니다. 신뢰도가 낮은 검출 결과는 흔히 가림, 흐림, 절단 또는 저해상도 문제로 인해 색상 및 선수 번호 단서의 신뢰도가 낮아집니다. 이러한 한계는 유니폼 의미론을 모든 검출 결과에 일률적으로 적용하는 대신, 검출 품질에 따라 도입하는 신뢰도 기반 연관 설계의 동기가 됩니다. 검토된 연구들에 따르면 신뢰도 인지 연관과 유니폼 의미론 모델링은 스포츠 MOT의 서로 다른 측면을 다룹니다. 신뢰도 기반 전략은 주로 검출 결과의 연관 참여 여부와 기존 궤적과의 매칭 방법을 결정하는 반면, 유니폼 의미론 전략은 주로 스포츠 특화 단서를 통해 정체성 표현을 강화합니다. 그러나 이 두 메커니즘은 흔히 별개의 구성 요소로 설계됩니다. 그 결과, 의미론적 단서가 검출 품질에 따라 항상 조정되는 것은 아니며, 신뢰도 수준이 연관 과정에서 색상 및 선수 번호 정보의 사용을 직접적으로 제어하지 못합니다. 이러한 분리는 팀 스포츠 비디오에서 궤적 단절과 정체성 혼동을 통합적으로 처리하는 데 한계가 됩니다. 남은 연구 과제는 동일한 추적 워크플로우 내에서 검출 신뢰도 품질 평가와 유니폼 의미론 연관을 연결하는 것입니다.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 공개적으로 이용 가능한 벤치마크 비디오 데이터셋인 SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 및 MOT20의 2차 분석을 수행하였습니다. 피험자 모집, 중재 수행 및 새로운 인간 대상 데이터 수집은 이루어지지 않았습니다. 방콕 톤부리 대학교(Bangkok Thonburi University)의 해당 기관 요건에 따라 본 연구에 대한 윤리 위원회의 승인은 필요하지 않았습니다.

다음 프로토콜은 데이터 준비부터 트래킹 평가까지 JerseyTrack을 재현하는 데 사용된 워크플로를 설명합니다. 이 워크플로는 그림 1에 요약된 바와 같이 데이터셋 준비, 검출기 준비, 저지 시맨틱 추출, 신뢰 수준 분할, 신뢰 기반 연관, 트래킹 추론 및 성능 평가를 포함합니다. 필요한 소프트웨어, 데이터셋 및 하드웨어 리소스는 재료 표에 나열되어 있습니다.

figure-protocol-1
그림 1. JerseyTrack 방법의 전체 워크플로. 워크플로는 유니폼 시맨틱 특징 추출, 초기 객체 매칭, 신뢰도 기반 보조 매칭 및 특징 융합으로 구성된다. 감지된 선수 영역에서 팀 색상과 선수 번호 특징을 추출하여 연관 과정에 통합함으로써 불확실한 감지 조건에서도 궤적 매칭 성능을 향상시킨다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

1. 데이터 세트 및 디렉토리 구조 준비

  1. 재료 표(Table of Materials)에 나열된 공개 벤치마크 데이터셋을 다운로드하십시오. 검출기 준비 및 트래킹 평가를 위한 기본 데이터셋으로 SportsMOT를 사용하십시오. 교차 데이터셋 평가를 위해 TeamTrack, SoccerNet Tracking, MOT17, MOT20를 유지하십시오.
  2. 모든 데이터셋을 통합된 프로젝트 디렉토리에 저장하십시오. 검출기, 시맨틱 추출 모듈, 트래킹 모듈 및 평가 툴킷이 동일한 시퀀스 식별자를 사용하도록 하십시오.
  3. 본 연구에서 사용된 데이터 준비 스크립트를 사용하여 공식 SportsMOT 어노테이션을 검출기 학습 형식으로 변환하십시오. 다음 명령어를 실행하십시오:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. 데이터 준비 스크립트(scripts/prepare_data.py)는 JerseyTrack 소스 코드 저장소(https://doi.org/10.5281/zenodo.21274352)에서 제공됩니다. Python 3.12, PyTorch 2.11.0, OpenCV 4.10 이상을 포함한 필수 소프트웨어 종속성은 environment.yml에 명시되어 있습니다. 다음 명령어를 사용하여 소프트웨어 환경을 구성하십시오: conda env create -f environment.yml. 다음 명령어를 사용하여 데이터 준비 스크립트를 실행하십시오: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. 변환을 통해 검출기 학습 설정 파일인 data\processed\SportsMOT_yolo\data.yaml과 변환 매니페스트 파일인 data\processed\SportsMOT_yolo\conversion_manifest.csv가 생성되었는지 확인하십시오.
    참고: 본 연구에서 변환된 SportsMOT 학습 및 검증 데이터셋은 90개의 시퀀스, 55,544개의 프레임 및 608,152개의 어노테이션 객체를 포함하고 있습니다.
  6. 대표 시퀀스들을 검토하여 프레임 순서, 바운딩 박스 좌표 및 ID 라벨이 원본 벤치마크 어노테이션과 일관되게 유지되는지 확인하십시오.
  7. 모든 방법이 동일한 데이터셋 분할 및 평가 프로토콜을 사용하도록, 검출기 준비, 트래킹 추론 및 평가 전 과정에서 변환된 어노테이션 파일을 수정 없이 보존하십시오.
    참고: 이 섹션의 예상 결과물은 변환된 어노테이션, 변환 매니페스트 및 검출기 준비와 트래킹 평가에 필요한 데이터셋 분할 파일이 포함된 표준화된 SportsMOT 검출기 학습 디렉토리입니다.

2. 검출기 출력 준비

  1. 준비된 SportsMOT 훈련 분할 세트를 사용하여 객체 검출기를 미세 조정하십시오. 다음에서 정의된 분류 손실 및 경계 상자 회귀 손실을 사용하여 검출기를 최적화하십시오. 식 1구현 설정 및 다음 항목에 보고된 검출기 입력 해상도, 배치 크기, 학습률, 학습 에포크 횟수 및 기타 학습 파라미터를 사용하십시오. 재료 목록
    L결정계수 = L화면 지우기 + L상자   (1)
    여기서, L결정계수  전체 검출기 손실 L을 나타냅니다.cls  분류 손실 $L$을 나타냅니다.상자 이며 바운딩 박스 회귀 손실을 나타냅니다.
    참고: 주요 실험(내부 실험 식별자 e3)에 사용된 검출기 체크포인트는 SportsMOT YOLO 형식 데이터셋 설정(data/processed/SportsMOT_yolo/data.yaml)과 Ultralytics YOLO 프레임워크를 사용하여 학습되었습니다. 다음 명령어를 사용하여 검출기 학습을 수행하십시오: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. 학습 후, 생성된 최적 성능의 체크포인트를 사용하여 다음 명령어로 검증 시퀀스에 대한 검출기 출력을 생성하십시오: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. 학습 완료 후, 학습된 검출기 체크포인트와 해당 메타데이터 파일 및 학습 로그를 저장하십시오.
    참고: 본 연구에서 정식 실험에 사용된 검출기 체크포인트는 다음과 같이 저장되었습니다:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. 해당 메타데이터 파일은 outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json으로 저장되었습니다. 주요 SportsMOT 검증 실험에 사용된 검출기 출력 디렉토리는 outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections입니다.
  3. 학습된 검출기를 각 검증 시퀀스에 실행하여 선수의 바운딩 박스와 신뢰도 점수를 생성하십시오. 프레임 인덱스, 바운딩 박스 좌표, 검출 신뢰도 및 클래스 레이블이 포함된 검출 파일을 시퀀스별로 하나씩 내보내십시오.
    참고: 주요 실험에 사용된 SportsMOT 검증 실행에서, 0.05의 신뢰도 임계값을 적용하여 343,990건의 운동선수 검출 결과가 생성되었다.
  4. 추적 추론을 수행하기 전에 검출기 출력 디렉토리를 검사하십시오. 모든 시퀀스에 해당하는 검출 파일이 있는지, 프레임 인덱스가 준비된 이미지 시퀀스와 일치하는지, 그리고 모든 검출 기록에 신뢰도 점수가 포함되어 있는지 확인하십시오.
    참고: 이 섹션의 예상 결과물은 저지 의미 추출(jersey semantic extraction), 신뢰 수준 분할(confidence-level partitioning) 및 추적 연관(tracking association)의 입력값으로 사용되는 완전한 검출기 출력 디렉터리입니다.

3. 저지 시맨틱 특징 추출

  1. 검출기 출력 파일을 사용하여 각 비디오 프레임에서 선수 영역을 크롭하십시오. 크롭된 각 선수 이미지는 시퀀스 식별자, 프레임 인덱스 및 검출 인덱스와 함께 저장하십시오. 이미지 콘텐츠가 누락되었거나 경계 상자가 이미지 경계 밖으로 확장된 유효하지 않은 크롭 이미지는 제외하십시오. 각 크롭 파일 이름과 원래의 검출 기록 간의 연결성을 유지하여, 추출된 시맨틱 특징이 트래킹 연관 과정에서 해당 검출 결과와 일치하도록 하십시오.
  2. 본 연구에서 사용된 시맨틱 추출 스크립트를 사용하여 크롭된 선수 이미지에서 저지 색상 특징을 추출하십시오.
    참고: 시맨틱 특징 추출 스크립트(scripts/extract_fast_color_semantics.py 및 scripts/formal_extract_semantics.py)는 JerseyTrack 소스 코드 저장소(https://doi.org/10.5281/zenodo.21274352)에서 사용할 수 있습니다. 별도의 설정 파일은 필요하지 않으며, 모든 런타임 파라미터는 명령줄 인수를 통해 제공됩니다.
    다음 명령어를 사용하여 저지 색상 기술어(jersey-color descriptors)를 생성합니다: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. 다음 명령어를 사용하여 OCR 모델로 선수 번호 의미론적 특징(player-number semantic features)을 생성합니다: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. 생성된 저지 색상 기술어와 선수 번호 확률 출력값은 시퀀스 식별자(sequence identifier)로 연결되며, 트래킹 연관 과정에서 사용되는 의미론적 특징 파일로 통합됩니다.
  3. 각각의 크롭된 선수 이미지를 색상, 채도, 명도(HSV) 색 공간으로 변환하십시오. 저지 영역에서 전경 픽셀을 추출하고, K = 3인 K-평균 군집화(K-means clustering)를 사용하여 지배적인 저지 색상을 요약하십시오. 특징 비교 전, 결과로 얻은 색상 기술자를 L2 정규화를 통해 정규화하십시오.
  4. 입력 크기가 128인 크롭된 선수 이미지들을 사용하여 등번호 인식 분기(branch)를 학습시킨다. × 64 픽셀. 본 연구에서 채택한 약지도 학습 라벨링 절차를 사용하여 선수 번호 유사 라벨(pseudo-labels)을 생성하십시오. 선수 번호 영역이 보이지 않거나, 읽을 수 없거나, 심하게 가려졌거나, 신뢰도가 낮은 크롭(crop) 이미지는 광학 문자 인식(OCR) 손실 계산에서 제외하십시오.
  5. 다음에서 정의된 교차 엔트로피 손실을 사용하여 OCR 분기를 최적화하십시오. 식 2.
    figure-protocol-2 (2)
    여기에서, L광학 문자 인식 는 OCR 손실을 나타내며, yi 은 지도 학습된 플레이어 번호 라벨을 나타내며, figure-protocol-3 예측된 플레이어 수 범주를 나타냅니다.
  6. 제시된 적응형 옵티마이저, 학습률, 배치 크기, 가중치 감쇠 및 학습 기간을 사용하여 시맨틱 특징 추출 모듈을 최적화하십시오. 재료 표. 다음에서 정의된 전체 학습 목적 함수를 사용하여 검출기 손실과 OCR 손실을 결합하십시오. 식 3.
    L총합 = L결정계수 + γL광학 문자 인식(OCR)   (3)
    여기서, L합계 전체 훈련 손실을 나타내며, L결정계수 ~에서 정의된 검출기 손실을 나타냅니다. 식 1, L광학 문자 인식 ~에서 정의된 OCR 손실을 나타냅니다. 식 2, 그리고 OCR 손실에 대한 사용자 정의 가중치 계수를 나타냅니다.
  7. 훈련된 OCR 브랜치를 각 크롭된 선수 이미지에 적용하십시오. 각 크롭 이미지에 대해 예측된 선수 번호 범주 또는 확률 벡터를 저장하십시오. 선수 번호가 보이지 않거나 OCR 신뢰도가 구현 단계에서 정의한 임계값보다 낮은 경우, 강제로 예측하지 말고 선수 번호 특징을 사용할 수 없음(unavailable)으로 기록하십시오.
  8. 저지 색상 기술자와 선수 번호 출력을 트래킹 모듈에서 사용하는 의미론적 특징 파일로 결합하십시오.
    참고: 주요 SportsMOT 검증 실행에서 시맨틱 추출 스크립트는 누락된 프레임이나 잘못된 크롭 없이 343,990건의 탐지 데이터를 처리하였습니다. 현재 수정 패키지의 시맨틱 추출 요약에 따르면, 평가된 SportsMOT 설정 하에서 전체 색상 및 OCR 시맨틱 추출 정확도는 86.7%로 보고되었습니다. 이 섹션의 기대 결과물은 각 유효 탐지 레코드가 유니폼 색상 기술자, 가능할 경우의 선수 번호 출력값, 그리고 추적 연관성을 위한 시맨틱 정보 가용 여부를 나타내는 플래그와 연결된 시맨틱 특징 파일입니다.

4. 파티션 검출 신뢰 수준

  1. 각 비디오 시퀀스에 대한 검출기 출력 파일을 로드합니다. 각 프레임에서 모든 선수 검출 결과의 신뢰도 점수를 수집합니다.
  2. 그림 2에 표시된 신뢰도 기반 연관 워크플로우에 따라, K = 3인 K-평균 군집화(K-means clustering)를 사용하여 프레임 수준의 신뢰도 점수를 고, 중, 저 신뢰도 구간으로 분할합니다. 식 4에 따라 군집 내 분산을 최소화하여 적응형 신뢰도 임계값을 결정합니다.
    figure-protocol-4  (4)
    여기서 sd 는 검출 d의 신뢰도 점수를 나타내고, D1, D2, D3은 각각 고, 중, 저 신뢰도 구간을 나타내며, μ1, μ2, μ3은 세 구간의 평균 신뢰도 점수를 나타냅니다. 또한  τ1 및  τ2는 K-평균 군집화 결과로부터 얻은 적응형 신뢰도 임계값을 나타냅니다.
    참고: 신뢰도 분할 스크립트(scripts/formal_partition_confidence.py)는 JerseyTrack 소스 코드 저장소(https://doi.org/10.5281/zenodo.21274352)에서 사용할 수 있습니다. 신뢰도 분할 모듈은 NumPy 기반의 1차원 K-평균 군집화 절차(K = 3)를 사용합니다. 별도의 설정 파일은 필요하지 않으며, 입력 디렉토리, 출력 디렉토리 및 군집화 파라미터는 명령줄 인수를 통해 지정합니다. 다음 명령어를 사용하여 신뢰도 분할 절차를 실행하십시오: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. NumPy 버전을 포함한 필요한 소프트웨어 종속성은 environment.yml에 명시되어 있습니다.
  3. 검출기 출력 디렉토리를 입력으로 사용하여 신뢰도 분할 절차를 실행합니다.
    참고: 본 연구에서 검출기 출력 디렉토리는 outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections였으며, 신뢰도 분할 출력 디렉토리는 outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence였습니다. 생성된 출력 파일에는 시퀀스별 신뢰도 CSV 파일, _confidence_frame_summary.csv 및 _confidence_runtime.csv가 포함되었습니다.
  4. 모든 검출 결과에 신뢰도 수준 레이블을 할당합니다. 고신뢰도 검출은 모션 기반 연관(motion-based association)용으로, 중신뢰도 검출은 모션-시맨틱 연관(motion-semantic association)용으로, 저신뢰도 검출은 궤적 복구(trajectory recovery) 전용으로 레이블을 지정합니다. 할당된 신뢰도 수준 레이블과 함께 원래의 신뢰도 점수를 유지합니다.
  5. 그림 3에 예시된 것처럼 신뢰도 점수 분포와 대표 프레임을 검토합니다. 고신뢰도 검출이 주로 완전하고 신뢰할 수 있는 선수 경계 상자(bounding box)에 해당하며, 중 및 저신뢰도 검출은 주로 부분적으로 가려지거나, 폐색되었거나, 흐릿하거나, 약하게 검출된 결과들을 포함하는지 확인합니다.
    참고: 이 섹션의 예상 결과물은 모든 검출에 대해 검출 인덱스, 원래 신뢰도 점수, 할당된 신뢰도 수준 및 프레임 수준 적응형 신뢰도 임계값이 포함된 신뢰도 분할 파일입니다.

figure-protocol-5
그림 2. 신뢰도 기반 연관 전략. 적응형 신뢰도 클러스터링을 사용하여 검출 신뢰도를 고신뢰도, 중신뢰도, 저신뢰도 구간으로 분할하는 워크플로우이다. 고신뢰도 검출은 모션 유사성을 사용하여 연관시키고, 중신뢰도 검출은 모션과 저지 시맨틱 유사성을 결합하여 연관시키며, 저신뢰도 검출은 다중 프레임 검증을 통한 시맨틱 보조 궤적 복구에 사용된다. 오른쪽 패널은 신뢰도 분할 및 연관에 사용된 수학적 공식화를 요약한 것이다. 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-protocol-6
그림 3. 검출 신뢰도 점수 분포. 히스토그램은 SportsMOT 데이터셋의 축구, 농구, 배구 시퀀스에 대해 5개의 신뢰 구간 내에 있는 운동선수 검출 박스의 수를 보여준다. 이 분포는 평가된 스포츠 카테고리 간의 검출기 신뢰도 차이를 나타낸다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

5. 신뢰도 기반 연관성 실행

  1. 각 비디오 시퀀스에 대해 검출기 출력 파일, 의미론적 특징 파일 및 신뢰도 분할 파일을 로드하십시오. 첫 번째 유효 검출 결과들을 사용하여 트래커를 초기화하고, 추적되는 각 운동선수에 대해 하나의 궤적 상태를 유지하십시오. 이후의 각 프레임에 대해, 칼만 필터 이동 모델을 사용하여 모든 기존 궤적의 위치를 예측하십시오.
  2. 정의된 마할라노비스 거리(Mahalanobis distance)를 사용하여 각 예측 궤적과 후보 검출값 사이의 운동 유사도를 계산하십시오. 식 5.
    figure-protocol-7  (5)
    여기에, figure-protocol-8 ~을(를) 나타냅니다 I프레임 내 -번째 궤적 k, figure-protocol-9 칼만 예측 궤적 상태를 나타내며, dj 후보 검출을 나타내며, figure-protocol-10 는 예측된 궤적 상태의 역공분산 행렬을 나타내며, Smot 예측 궤적과 검출 값 사이의 이동 거리를 나타냅니다.
    참고: 핵심 연관 워크플로우는 jerseytrack/formal_tracker.py에 구현되어 있으며 scripts/formal_track.py를 통해 실행됩니다. 두 파일 모두 JerseyTrack 소스 코드 저장소(https://doi.org/10.5281/zenodo.21274352)에서 이용 가능합니다. 별도의 설정 파일은 필요하지 않습니다. 신뢰도 임계값, 최대 트랙 수명, 모션 가중치 계수 및 중심 거리 가중치를 포함한 모든 런타임 파라미터는 커맨드 라인 인수를 통해 제공됩니다. 전체 실행 명령 및 파라미터 설정은 단계 6.2에 제공되어 있습니다. 본 구현에서는 헝가리안 매칭을 위해 SciPy의 linear sum assignment 알고리즘을 사용하며, 비용 기반 연관을 위해 NumPy를 사용합니다.
  3. 검출기 출력 파일(detector-output file), 의미론적 특징 파일(semantic-feature file) 및 신뢰도 분할 파일(confidence-partition file)을 입력값으로 사용하여 추적 워크플로를 실행하십시오.
    참고: 본 연구에서 핵심 트래커는 jerseytrack\formal_tracker.py에 구현되었으며, 추적 워크플로우는 scripts\formal_track.py를 사용하여 실행되었습니다.
  4. 운동 일관성을 사용하여 신뢰도가 높은 검출 결과들을 기존 궤적과 연관시킵니다. 매칭된 궤적들을 업데이트하고, 매칭되지 않은 고신뢰도 검출 결과가 궤적 초기화 기준을 충족하는 경우에만 새로운 궤적을 초기화합니다.
  5. 다음에서 예시로 보여주는 저지 시맨틱 추출 결과물을 검토하십시오. 그림 4, 그리고 팀 색상 기술자와 선수 번호 특징을 다음의 기준에 따라 결합하여 각 탐지 결과에 대한 저지 의미 특징 벡터를 구축합니다. 식 6.
    f주사전자현미경 제공된 텍스트가 없습니다. 번역할 소스 텍스트를 입력해 주세요.;f아이디] (6)
    여기에서, f주사 전자 현미경 (SEM) 융합된 의미 특징 벡터를 나타내며, f 팀 색상 기술자를 나타내며, f식별자 OCR 분기(branch)에서 생성된 선수 번호 특징을 나타냅니다.
  6. 모션 유사도와 저지 시맨틱 유사도를 결합하여 중간 신뢰도 검출 결과들을 연관시킨다. 다음 식에 따라 융합 매칭 점수를 계산한다. 식 7.
    figure-protocol-11 (7)
    여기에서는, S주사전자현미경 궤적과 후보 검출 결과의 의미론적 특징 벡터 간의 코사인 유사도를 나타내며, S모터(motor) ~에서 정의된 이동 거리를 나타냅니다. 식 5, 그리고 λ 운동 및 시맨틱 유사성 항의 균형을 맞추는 적응형 융합 계수를 나타냅니다.
  7. 다음의 식에 따라 적응형 융합 계수를 계산하십시오. 식 8.
    figure-protocol-12 (8)
    여기서, λ초기 운동 가중치 계수를 나타내며, σsd 현재 프레임 내 검출 신뢰도 점수의 표준편차를 나타내며, σ최대 정규화에 사용되는 최대 신뢰 점수 표준 편차를 나타냅니다.
  8. 신뢰도가 낮은 검출 결과는 궤적 복구 목적으로만 사용하십시오. 시맨틱 정보가 존재하고 복구 기준이 충족되는 경우에만 신뢰도가 낮은 검출 결과를 중단된 궤적과 매칭하십시오. 궤적 식별자를 복원하기 전에 다중 프레임 검증을 적용하고, 검증을 통과하지 못한 검출 결과는 폐기하십시오.
    참고: 선수 번호 기능을 사용할 수 없는 경우, 선수 번호 일치를 강제하기보다 가용한 시맨틱 정보와 모션 일관성을 사용하여 연관 분석을 수행하십시오. 이 섹션의 기대 결과물은 궤적 ID, 바운딩 박스, 신뢰 수준 레이블, 모션 비용, 시맨틱 정보 및 최종 연관 결정이 포함된 프레임별 트래킹 기록입니다. 개정 증거 패키지에서 트래킹 결과는 다음 경로에 저장되었습니다: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
그림 4저지 시맨틱 특징 추출. 대표 선수 검출 결과에 저지 시맨틱 추출 모듈에서 생성된 추출 팀 색상 기술자와 선수 번호 정보가 주석으로 추가됩니다. 이후 추출된 시맨틱 특징은 신뢰도 기반 데이터 연관 과정에 통합됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

6. 추적 추론 실행 및 결과 내보내기

  1. 준비된 검출기 출력 파일, 시맨틱 특징 파일 및 신뢰도 분할 파일을 사용하여 각 비디오 시퀀스에 대해 추적 추론을 실행합니다. 궤적 상태, 시맨틱 이력 및 궤적 복구 결정이 시퀀스 전체에서 일관되게 업데이트되도록 비디오 프레임을 시간 순서대로 처리합니다. 데이터셋별 설정이 명시적으로 보고되지 않는 한, 평가된 모든 시퀀스에 대해 동일한 추론 구성을 사용합니다.
    참고: 추적 추론은 JerseyTrack 소스 코드 저장소(https://doi.org/10.5281/zenodo.21274352)에서 제공되는 scripts/formal_track.py를 사용하여 실행되었습니다. 별도의 구성 파일은 필요하지 않습니다. 다음 명령어를 사용하여 추적 추론을 실행하십시오: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. 지정되지 않은 모든 매개변수는 보관된 소스 코드에 기록된 기본값을 유지했습니다.
  2. 추론 후, 다음 명령어를 사용하여 기본 후처리 시퀀스를 적용합니다: python scripts/merge_tracklets.py 및 python scripts/sweep_track_filter.py --min-len 95.
  3. 평가 툴킷에서 요구하는 형식으로 추적 결과를 내보냅니다. 프레임 인덱스, 궤적 ID, 바운딩 박스 좌표 및 벤치마크 평가 형식에 필요한 모든 필드를 포함합니다. 각 결과 파일이 해당 정답(ground-truth) 주석 파일과 매칭될 수 있도록 일관된 파일 명명 규칙을 사용하여 시퀀스당 하나의 추적 결과 파일을 저장합니다.
  4. 본 연구에서 사용된 후처리 작업만 적용합니다. 수정 패키지에 설명된 후처리 스크립트를 사용하여 트랙렛 병합 및 트랙 필터링을 수행합니다.
    참고: 본 연구의 후처리 워크플로우에서는 다음 스크립트들을 사용했습니다:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. 정량적 평가 전에 내보낸 추적 결과를 검사합니다. 각 시퀀스 내에서 궤적 ID가 숫자로 유지되고 일관되는지, 누락된 프레임 인덱스가 없는지, 모든 바운딩 박스가 이미지 경계 내에 있는지 확인합니다.
    참고: 이 섹션의 예상 결과는 정량적 평가를 위한 시퀀스 레벨의 추적 결과 파일 전체 세트입니다.

7. 추적 성능 평가

  1. 재료 표(Table of Materials)에 나열된 평가 툴킷을 사용하여 내보낸 트래킹 결과 파일을 평가하십시오. 각 트래킹 결과 파일을 그에 해당하는 정답(ground-truth) 어노테이션 파일 및 데이터셋 분할과 매칭하십시오. 성능 차이가 평가 설정이 아닌 트래킹 결과로 인해 발생하는 것을 보장하기 위해, 비교되는 모든 방법론에 대해 동일한 평가 구성을 사용하십시오.
  2. 다음 명령어를 사용하여 평가를 실행하십시오.
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    참고: 평가는 JerseyTrack 재현성 패키지에 보관된 표준 TrackEval(Version 1.3.0) 메트릭 구현을 사용하여 수행되었습니다. Higher Order Tracking Accuracy (HOTA), CLEAR 또는 Identity 메트릭 구현에는 어떠한 수정도 가하지 않았습니다. 리포지토리에는 evaluation/trackeval/scripts/run_mot_challenge.py에 위치한 MOTChallenge 스타일의 실행 래퍼가 포함되어 있으며, 이는 데이터셋과 결과 경로를 설정하고 표준 TrackEval 평가 메트릭을 호출합니다.
  3. Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1), Higher Order Tracking Accuracy (HOTA), Detection Accuracy (DetA), Association Accuracy (AssA), 위양성(FPs), 위음성(FNs) 및 ID 전환(identity-switching) 이벤트를 포함하여 원고에 보고된 평가 메트릭을 기록하십시오. 평가 요약본을 표로 내보내고, 검증을 위해 시퀀스별 평가 파일을 보관하십시오.
  4. JerseyTrack을 베이스라인 방법들과 비교할 때, 모든 방법론에 대해 동일한 데이터셋 분할, 검출기 출력 및 평가 구성을 사용하십시오. 각 비교에 대한 데이터셋, 검출기 출력 소스, 평가 툴킷 구성 및 메트릭 값을 기록하십시오.
  5. 평가 로그를 검사하여 모든 시퀀스가 성공적으로 평가되었는지, 누락된 트래킹 결과 파일은 없는지 확인하십시오.
    참고: 본 연구에서 기본 TrackEval 요약 파일은 outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt에 저장되었습니다. 이 섹션의 예상 결과물은 보고된 결과와 이후의 검증을 뒷받침하는 시퀀스별 메트릭 파일 및 완전한 평가 요약 표입니다.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 섹션에서는 평가된 스포츠 다중 객체 추적 실험을 통해 얻은 정량적 및 정성적 결과를 보고합니다. 결과는 추적 정확도, ID 유지 능력, 연관 품질 및 테스트 데이터셋 설정 하에서의 강건성에 중점을 둡니다. 성능 주장은 프로토콜 및 구현 설정에서 설명한 평가 방법, 데이터셋, 탐지기 출력 및 평가 툴킷 구성으로 제한됩니다.

실험 설정 및 평가 설계

데이터셋 및 전처리:

검출기 준비, 추적 추론 및 정량적 평가를 위한 기본 벤치마크로 SportsMOT가 사용되었습니다. 이 데이터셋은 축구, 농구 및 배구 시나리오에 걸쳐 240개의 비디오 시퀀스와 150,000개 이상의 이미지 프레임을 포함하고 있습니다(그림 5). 공식 평가에서, 주요 SportsMOT 결과는 프로토콜에 기술된 검출기 출력, 추적 구성 및 TrackEval 설정과 함께 검증 분할(validation split)을 사용하여 계산되었습니다. 데이터셋 간의 직접적인 메트릭 수준 비교보다는 서로 다른 데이터셋 유형 간의 성능 전이를 조사하기 위해 TeamTrack, SoccerNet Tracking, MOT17 및 MOT20을 대상으로 교차 데이터셋 평가를 수행하였습니다.

figure-results-1
그림 5. 평가에 사용된 대표 데이터셋. 예시 프레임은 실험적 평가에 사용된 대표적인 축구, 농구 및 배구 시퀀스를 보여준다. 이 그림은 평가된 데이터셋 전반에 걸쳐 카메라 관점, 선수 밀도 및 장면 복잡성의 변화를 강조한다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

SportsMOT 데이터는 공식 데이터셋 구조에 따라 정리되었으며, 프로토콜에 설명된 탐지기 학습 형식으로 변환되었습니다. 변환된 SportsMOT 학습 및 검증 데이터에는 90개의 시퀀스, 55,544개의 프레임, 608,152개의 어노테이션 객체가 포함되었습니다. 학습 파티션은 탐지기 준비 및 파라미터 튜닝에 사용되었으며, 검증 파티션은 본 연구에서 보고된 공식 추적 평가에 사용되었습니다. 모든 입력 프레임은 프로토콜과 재료 표에 보고된 탐지기 설정에 따라 크기가 조정되었습니다. 탐지기 준비, 시맨틱 특징 추출, 추적 추론 및 TrackEval 평가 과정에서 동일한 전처리 절차를 적용함으로써, 보고된 차이가 데이터 처리의 차이가 아닌 주로 추적 연관 전략을 반영하도록 하였습니다.

평가 지표:

추적 성능은 재료 표에 나열된 평가 툴킷으로 구현된 MOTChallenge 호환 평가 프로토콜을 사용하여 평가되었습니다. 보고된 지표는 스포츠 MOT 성능의 세 가지 측면인 전반적인 추적 정확도, ID 보존 및 탐지-연관 품질을 설명합니다. MOTA, IDF1 및 HOTA가 주요 평가 지표로 사용되었습니다44,45. MOTA는 거짓 양성(false positives), 거짓 음성(false negatives) 및 ID 전환(identity switches)을 종합하여 전반적인 추적 정확도 점수로 요약합니다. IDF1은 예측된 궤적과 정답(ground-truth) ID 사이의 일관성을 측정합니다. HOTA는 탐지 정확도와 연관 정확도를 공동으로 평가하므로 타겟 국소화와 궤적 연관 사이의 균형을 특성화합니다. DetA와 AssA는 보완적 지표로 보고되었습니다. FP, FN 및 ID 전환(ID)은 오탐지, 미탐지 및 ID 변경과 관련된 오류 원인을 특성화하는 데 사용되었습니다. SportsMOT의 방법 간 비교를 위해, 탐지기 변동 및 평가 설정 차이의 영향을 줄이고자 동일한 탐지기 출력과 평가 툴킷 구성을 사용하였습니다. 데이터셋 간 비교의 경우, 지표 값은 서로 다른 데이터셋 간의 절대적인 성능 우위의 증거라기보다 데이터셋 내 평가 결과로 해석되었습니다.

실험 환경 및 파라미터 설정:

실험은 재료 표에 나열된 하드웨어 및 소프트웨어 리소스를 사용하여 수행되었습니다. 검출기 준비, 추적 추론 및 성능 평가 과정 전반에 걸쳐 일관성을 유지하기 위해 기본 SportsMOT 실험 전반에 동일한 계산 환경, 검출기 프레임워크, 검출기 출력 및 평가 툴킷이 사용되었습니다. 재료 표에 나열된 검출기 프레임워크는 배치 크기 16, 초기 학습률 0.01, 80회의 학습 에포크로 훈련되었습니다. 저지 시맨틱 추출 모듈의 경우, 색상 클러스터링에는 K = 3인 K-means가 사용되었으며, OCR 분기에는 입력 크기가 128 × 64 픽셀인 경량 합성곱 순환 신경망이 사용되었습니다. OCR 분기는 재료 표에 나열된 적응형 옵티마이저를 사용하여 학습률 1 × 10⁻3, 가중치 감쇠 1 × 10⁻5, 배치 크기 64, 40회의 학습 에포크로 최적화되었습니다. 시맨틱 특징 추출 모듈 훈련 중 추가적인 학습률 스케줄링은 사용되지 않았습니다. OCR 손실 가중치 계수(γ)는 사용자 정의 하이퍼파라미터로 처리되었으며, 검증 세트 성능에 따라 선택되었습니다. 신뢰 수준 계층화에는 적응형 K-means 분할이 사용되었으며, 여기서 τ₁과 τ₂는 추론 전 수동으로 사전 정의되는 대신 각 프레임의 검출 신뢰도 분포로부터 계산되었습니다.

스포츠 및 시나리오 복잡성에 따른 추적 성능 분석

다양한 스포츠 및 장면 조건에서의 정량적 성능:

추적 성능은 스포츠 범주와 장면 복잡도라는 두 가지 그룹화 요인 하에 평가되었습니다. 스포츠 범주 분석에는 축구, 농구 및 배구 시퀀스가 포함되었습니다. 장면 복잡도 분석에서는 평가된 시퀀스 전반에 걸쳐 동일한 그룹화 기준을 사용하여 폐색 수준, 이동 속도 및 타겟 밀도를 고려하였습니다. 보고된 지표는 프로토콜 섹션 7에 설명된 평가 프로토콜을 따랐습니다. 

그림 6은 다양한 스포츠 범주 및 장면 복잡도 조건에서의 정량적 추적 결과를 요약하여 보여줍니다. 그림 6A는 축구, 농구 및 배구 시퀀스에 걸친 MOTA 및 DetA를 나타냅니다. 그림 6B는 가려짐, 이동 속도 및 타겟 밀도의 서로 다른 수준에 따른 MOTA 변동을 나타냅니다. 그림 6C는 각 장면 복잡도 차원에 대한 누적 FP 및 FN 수를 나타냅니다.

figure-results-2
그림 6. 스포츠 범주 및 장면 조건에 따른 추적 성능. (A) 축구, 농구, 배구 및 전체 평균에 대한 다중 객체 추적 정확도(MOTA)와 검출 정확도(DetA). (B) 폐색, 선수 밀도 및 움직임 복잡도의 수준이 서로 다른 대표적인 장면 조건별 MOTA. (C) 평가된 장면 조건별 거짓 양성(FP) 및 거짓 음성(FN) 수. 여기를 클릭하여 이 그림의 확대 버전을 확인하십시오.

세 가지 스포츠 카테고리 전체에서 JerseyTrack은 평균 88.9%의 MOTA와 평균 80.2%의 DetA를 달성했습니다. 스포츠 카테고리 간 MOTA 차이는 1.3%포인트였으며, 배구 시퀀스에서 가장 높은 MOTA(89.2%)가, 농구 시퀀스에서 가장 낮은 MOTA(87.9%)가 관찰되었습니다. 농구 시퀀스에서 관찰된 더 낮은 MOTA는 평가 대상 시퀀스 내의 빈번한 근접 상호작용과 밀집된 폐색(occlusion) 현상과 일치합니다. 가벼운 폐색, 낮은 이동 속도, 희소한 타겟 분포를 포함한 덜 복잡한 장면 조건에서 MOTA는 각각 91.8%, 93.1%, 93.8%에 도달했습니다. 더 복잡한 장면 조건에서는 MOTA가 심한 폐색 시 84.9%, 고속 이동 시 83.6%, 밀집된 타겟 분포 시 83.1%로 감소했습니다. 이러한 결과는 장면의 복잡성이 증가함에 따라 추적 성능이 감소했지만, 평가된 스포츠 시나리오 전반에서 보고된 범위 내로 유지되었음을 보여줍니다.

대표적인 스포츠 시나리오 전반의 추적 일관성:

그림 7은 밀집된 선수 간 상호작용, 장기간의 부분적 가려짐, 급격한 방향 전환이라는 세 가지 까다로운 스포츠 시나리오에서 JerseyTrack의 시간적 일관성을 보여주는 대표적인 추적 사례를 제시합니다. 이러한 대표 시퀀스 전반에 걸쳐, 추적기는 빈번한 선수 간 겹침과 역동적인 움직임에도 불구하고 일관된 궤적 ID를 유지했습니다. ID 파편화는 주로 심각한 가려짐이 발생하거나 저지 시맨틱 정보를 일시적으로 사용할 수 없을 때 관찰되었으나, 신뢰도 기반 연관 전략을 통해 신뢰할 수 있는 검출이 다시 나타난 후 궤적을 복구할 수 있었습니다. 이러한 대표 사례들은 평가된 스포츠 추적 조건 하에서 안정적인 ID 보존 능력을 입증함으로써 그림 6에 표시된 정량적 결과들을 정성적으로 뒷받침합니다.

figure-results-3
그림 7. JerseyTrack에 의해 생성된 대표적인 추적 결과. 농구, 축구 및 배구 시퀀스의 연속 프레임은 추적 과정 중 선수들의 식별 정보와 궤적이 유지됨을 보여준다. 색상이 지정된 경계 상자는 연속적인 비디오 프레임 전반에 걸쳐 유지되는 추적된 식별 정보를 나타낸다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

정체성 보존을 위한 제거 실험 결과:

신뢰도 기반 연관 전략과 저지 시맨틱 융합 모듈이 ID 유지에 기여하는 정도를 조사하기 위해 어블레이션 분석을 수행하였습니다. V0(신뢰도 기반 연관 및 저지 시맨틱 융합이 없는 베이스라인), V1(신뢰도 기반 연관만 사용한 변형 모델), V2(저지 시맨틱 융합만 사용한 변형 모델), 그리고 두 구성 요소가 모두 포함된 전체 JerseyTrack 설정인 V3의 네 가지 모델 변형을 비교하였습니다. 평가는 IDs, IDF1, ID 정밀도(IDP), ID 재현율(IDR)을 포함한 ID 관련 지표에 중점을 두었습니다. 대표적인 ID 유지 패턴은 그림 8에 나타나 있습니다.

figure-results-4
그림 8. 신뢰도 기반 저지 시맨틱 연관성의 어블레이션 분석. (A) 평가된 모델 변형들에 대한 전체 ID 전환(IDs) 및 ID F1 스코어(IDF1). (B) 대표적인 까다로운 추적 시나리오 하에서 전체 모델(V3)과 베이스라인 구성(V0) 간의 IDs 비교. (C) 다양한 추적 시나리오에 따른 전체 모델의 IDF1, ID 정밀도(IDP) 및 ID 재현율(IDR). 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

전체 SportsMOT 검증 설정에서, 전체 V3 구성은 4가지 모델 변체 중 가장 적은 수의 ID와 가장 높은 IDF1을 기록했습니다. V3는 2,768개의 ID를 기록하여 V0보다 ID 전환 횟수를 477회 줄였으며, IDF1은 74.3%를 달성하여 V0 대비 7.1% 포인트 증가했습니다. 이러한 결과는 평가된 스포츠 트래킹 조건 하에서 두 모듈이 ID 보존에 공동으로 기여했음을 나타냅니다. 단일 모듈 변체와 전체 구성을 비교한 결과, 두 모듈이 트래킹 오류의 서로 다른 원인에 영향을 미친다는 것이 추가로 확인되었습니다. 신뢰도 기반 연관 전략은 불안정한 검출 신뢰도 및 위치 추정 불확실성과 관련된 매칭 오류를 줄였으며, 저지 시맨틱 융합 모듈은 모션 정보만으로는 불충분할 때 추가적인 ID 정보를 제공했습니다. 전체 V3 구성은 어느 단일 모듈 변체보다 더 우수한 ID 관련 성능을 달성했으며, 이는 두 모듈이 중복된 기여가 아닌 상호 보완적인 기여를 했음을 시사합니다.

시나리오 수준의 결과에서는 정체성 유지 조건이 더 까다로울수록 더 큰 차이가 나타났습니다. 장시간의 폐색(occlusion) 동안 V3는 215개의 ID를 기록한 반면, V0는 482개를 기록했습니다. 6~10명의 선수가 포함된 조밀한 동일 팀 시나리오에서 V3는 328개의 ID를 기록했고, V0는 615개를 기록했습니다. 고속 방향 전환 시 V3는 482개의 ID를 기록한 반면, V0는 960개를 기록했습니다. 이러한 감소는 폐색 및 조밀한 상호작용 중에 시맨틱 큐(semantic cues)를 사용하려는 의도와 급격한 움직임 동안 변동하는 검출 신뢰도 하에서 신뢰도 기반 연관(confidence-guided association)을 수행한 것과 일치합니다. 그림 8C에 표시된 IDP 및 IDR 추세는 ID 수의 감소가 정체성 정밀도(identity precision)나 정체성 재현율(identity recall)의 상당한 감소를 동반하지 않았음을 나타냅니다. 전체 구성은 평가된 까다로운 시나리오 전반에서 71% 이상의 IDF1 값을 유지했으며, 조밀한 동일 팀 상호작용 및 고속 방향 전환 시 더 낮은 값이 관찰되었습니다. 이러한 결과는 평가된 조건 하에서 정체성 일관성이 향상되었음을 나타내며, 조밀한 상호작용과 급격한 움직임이 성능 저하의 주요 잔류 원인임을 확인시켜 줍니다.

교차 데이터셋 평가 결과:

SportsMOT에서 관찰된 추적 동작이 서로 다른 데이터셋 조건에서도 유지되는지 확인하기 위해 교차 데이터셋 평가를 수행하였습니다. 평가에는 두 개의 스포츠 특화 데이터셋인 SoccerNet Tracking과 TeamTrack, 그리고 두 개의 일반 MOT 데이터셋인 MOT17과 MOT20이 포함되었습니다. 본 실험의 목적은 서로 다른 데이터셋 유형 간의 성능 전이를 조사하는 것이었습니다. 어노테이션 프로토콜, 장면 구성, 카메라 시점 및 타겟 카테고리가 서로 다르기 때문에, 해당 결과는 데이터셋 간의 직접적인 지표 수준의 우위를 주장하는 데 사용되지 않았습니다.

표 1은 교차 데이터셋 평가 결과를 요약한 것입니다. 스포츠 특화 데이터셋에서 JerseyTrack은 주요 SportsMOT 검증 설정과 비교하여 상대적으로 안정적인 MOTA 및 IDF1 값을 유지했습니다. 이러한 경향은 반복되는 유니폼, 밀집된 선수 간 상호작용, 빈번한 폐색을 포함하여 추적 장면이 팀 스포츠의 시각적 특성을 유지할 때, 신뢰도 기반 연관 전략과 저지 관련 시맨틱 단서가 계속해서 효과적이었음을 시사합니다. 일반 MOT 데이터셋에서 본 방법은 경쟁력 있는 MOTA 및 DetA 값을 유지한 반면, IDF1은 스포츠 특화 데이터셋에서 관찰된 것보다 낮았습니다. 이러한 패턴은 시맨틱 퓨전 모듈에서 사용되는 저지 색상 및 선수 번호 단서가 MOT17 및 MOT20에는 존재하지 않는다는 점과 일치합니다. 이러한 조건 하에서 신뢰도 기반 연관 구성 요소는 여전히 적용 가능했지만, 시맨틱 브랜치는 팀 스포츠 비디오에서보다 정체성 특화 정보를 적게 제공했습니다. 전반적으로, 이러한 결과는 JerseyTrack이 일반 보행자 추적 데이터셋보다 스포츠 특화 시각적 시맨틱을 포함하는 데이터셋으로 더 효과적으로 전이되었음을 나타냅니다. 따라서 교차 데이터셋 평가는 본 방법이 스포츠 지향적 추적기로서 의도된 응용 분야에 적합함을 뒷받침하는 동시에, 명시적인 저지 시맨틱의 부재가 비스포츠 MOT 데이터셋에 대한 제한 요인임을 확인해 줍니다.

데이터셋MOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86.871.377.932.1
TeamTrack86.270.777.332.8
MOT1784.769.576.133.9
MOT2084.168.975.333.2

표 1: 데이터셋 간 교차 평가 결과. 4개의 공개 벤치마크 데이터셋에서 평가한 JerseyTrack의 추적 성능입니다. 다중 객체 추적 정확도(MOTA), ID F1 스코어(IDF1), 검출 정확도(DetA) 및 초당 프레임 수(FPS)로 측정된 처리 속도가 보고되었습니다. MOTA, IDF1, DetA 및 FPS의 경우 값이 높을수록 성능이 우수함을 나타냅니다.

제어된 섭동 조건 하에서의 강건성

스포츠 비디오에서 흔히 발생하는 시각적 및 탐지 품질 방해 요소 하에서 JerseyTrack의 안정성을 조사하기 위해 제어된 섭동 실험을 수행하였습니다. 평가된 섭동은 시맨틱 특징 섭동, 탐지 박스 섭동, 환경 섭동의 세 가지 범주로 분류되었습니다. 시맨틱 특징 섭동에는 선수 번호 가림, 이미지 블러, 해상도 저하 및 유사한 저지 색상이 포함되었습니다. 탐지 박스 섭동에는 바운딩 박스 오프셋, 탐지 신뢰도 변동 및 오탐지 박스가 포함되었습니다. 환경 섭동에는 비와 유사한 노이즈, 안개와 유사한 저하, 강한 조명 및 그림자 간섭이 포함되었습니다. 그림 9는 이러한 섭동 조건에서의 트래킹 성능을 요약하여 보여줍니다. 시맨틱 특징 섭동 하에서는 선수 번호의 가시성과 크롭 품질이 저하됨에 따라 트래킹 성능이 감소하였습니다. 선수 번호 영역의 40%가 가려졌을 때, 섭동이 없는 조건과 비교하여 MOTA는 3.2% 포인트, IDF1은 5.3% 포인트 감소한 반면, 시맨틱 추출 정확도는 86.7%를 유지하였습니다. 이러한 결과는 하나의 시맨틱 단서가 덜 신뢰할 수 있게 되었을 때 저지 색상과 선수 번호 단서가 상호 보완적인 정보를 제공했음을 나타냅니다. 탐지 박스 섭동 하에서 본 방법은 급격한 실패보다는 완만한 성능 저하를 보였습니다. 탐지 박스가 ±10 픽셀만큼 이동하고 신뢰도 점수가 가우시안 노이즈로 섭동되었을 때, MOTA의 감소폭은 3% 포인트 미만으로 유지되었으며, ID 전환(IDs)의 증가폭은 16% 이내로 유지되었습니다. 이러한 경향은 중간 및 낮은 신뢰도의 탐지 결과가 높은 신뢰도의 탐지에 적용되는 것과 동일한 전략이 아닌 추가적인 연관 제약 조건을 사용하여 처리되는 신뢰도 기반 연관 전략과 일치합니다.

figure-results-5
그림 9. 제어된 섭동 하에서의 강건성 평가. (A) 등번호 가림 증가에 따른 다중 객체 추적 정확도(MOTA), IDentity F1 Score(IDF1) 및 ID 전환(IDs)의 변화. (B) 대표적인 간섭 조건 하에서의 성능 저하. (C) 다양한 간섭 유형에 따른 IDs의 증가. (D) 평가된 섭동 조건 하에서의 저지 시맨틱 추출 정확도. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

환경 섭동 하에서, 평가된 조건에 따른 주요 추적 지표의 감소 폭은 5% 포인트 미만으로 유지되었으며, 시맨틱 추출 정확도는 87.2%를 유지했습니다. HSV 기반 색상 기술자(descriptor)를 사용하여 조명 변화에 대한 민감도를 낮춘 반면, OCR 분기는 흐릿하거나 품질이 저하된 일부 이미지 크롭에서도 유효한 선수 번호 정보를 보존했습니다. 이러한 결과는 시맨틱 모듈의 신뢰도가 여전히 저지의 가시성과 크롭 품질에 의존함에도 불구하고, 평가된 섭동 조건 하에서 계속 사용 가능했음을 나타냅니다. 전반적으로 제어된 섭동 실험을 통해 JerseyTrack이 평가된 시맨틱, 검출 품질 및 환경 섭동 하에서도 측정 가능한 추적 성능을 유지함을 보여주었습니다. 이러한 결과는 테스트된 섭동 범위 내에서 해석되어야 합니다. 체계적인 시야 밖 재식별, 심각한 배경 혼잡 및 장기적인 완전 가려짐은 본 실험에서 별도로 평가되지 않았으며, 고찰(Discussion) 섹션에서 한계점으로 논의됩니다.

모듈 기여도 및 특징 판별 분석

제안된 두 구성 요소가 정체성 관련 추적 성능에 어떤 영향을 미치는지 조사하기 위해 모듈 기여도 및 특징 판별력을 추가로 분석하였습니다. 모듈 기여도 분석에는 제거 분석(ablation analysis)에서 정의된 4가지 모델 변형을 사용하였으며, 특징 판별력 분석에서는 전통적인 Re-ID 특징, 색상 전용 특징, 선수 번호 전용 특징, 그리고 융합된 저지 시맨틱 특징을 비교하였습니다. 특징 분리도를 설명하기 위해 클래스 간/클래스 내 거리 비율을 사용하였으며, 값이 클수록 동일 정체성 내의 변동 대비 서로 다른 정체성 간의 분리가 더 큼을 의미합니다. 표 2는 모듈 기여도 분석 결과를 요약한 것입니다. 전체 평가에서 신뢰도 기반 연관 전략의 추정 기여도는 41.7%, 저지 시맨틱 융합의 추정 기여도는 47.6%였으며, 나머지 10.7%는 두 구성 요소의 결합 사용에 의한 것으로 나타났습니다. 이러한 값은 두 구성 요소 모두 관찰된 성능 향상에 기여했음을 나타내며, 전체 구성의 경우 어느 한 구성 요소만 사용했을 때보다 두 요소를 결합하여 사용했을 때 더 큰 이점을 얻었음을 보여줍니다. 기여 패턴은 장면 유형에 따라 다르게 나타났습니다. 심한 폐색(occlusion) 상황에서는 저지 시맨틱 융합의 추정 기여도가 69.4%로 증가하였는데, 이는 선수가 부분적으로 또는 일시적으로 가려졌을 때 모션 큐(motion cues)의 신뢰도가 낮아지는 것과 일치하는 결과입니다. 고속 이동 상황에서는 신뢰도 기반 연관의 추정 기여도가 44.3%에 달했고, 결합 이득은 20.6%에 이르렀습니다. 이는 빠른 움직임이나 위치 측정의 불확실성으로 인해 검출 신뢰도가 변동할 때 신뢰도 수준 분할이 더 중요해졌음을 시사합니다.

모델 변형테스트 시나리오MOTA↑IDF1↑IDs↓모듈 기여도시너지 이득
V0 (기준선)전체 장면83.567.23245
심한 폐색 장면77.861.53862
고속 이동 장면77.162.33689
V1 (신뢰도 기반 연관)전체 장면86.370.9289341.7
심한 폐색 장면80.965.9341529.8
고속 이동 장면81.467.9302444.3
V2 (유니폼 시맨틱 연관)전체 장면85.271.8293747.6
심한 폐색 장면82.772.8275369.4
고속 이동 장면80.166.8315735.1
V3 (전체 JerseyTrack)전체 장면88.974.3276810.7
심한 폐색 장면84.975.626890.8
고속 이동 장면83.671.5284220.6

표 2: 모듈 기여도에 대한 어블레이션 분석. 전체, 심한 폐쇄 및 고속 이동 시나리오에서 다양한 JerseyTrack 모델 변형의 성능 비교. 다중 객체 추적 정확도(MOTA), IDentity F1 점수(IDF1), ID 전환 횟수(IDs)를 추정된 모듈 기여도 및 시너지 이득과 함께 보고하였다. MOTA, IDF1, 모듈 기여도 및 시너지 이득은 값이 높을수록 성능이 좋음을 나타내며, IDs는 값이 낮을수록 성능이 좋음을 나타낸다.

표 3은 특징 판별 분석 결과를 요약한 것입니다. 융합된 저지 의미론적 특징(fused jersey semantic feature)은 클래스 간/클래스 내 거리 비율이 5.63을 달성했으며, 이는 기존 Re-ID 특징의 1.82와 비교하여 거리 비율 측정값에서 209.3%의 상대적 개선을 보였습니다. 색상 전용 및 선수 번호 전용 특징 또한 기존 Re-ID 특징에 비해 특징 분리도를 향상시켰으나, 각 개별 단서는 유사한 팀 색상, 선수 번호 가려짐, 모션 블러 및 판독 불가능한 저지 영역을 포함한 특정 실패 사례에 취약한 상태로 남았습니다. 평가된 특징 표현들 중 융합된 의미론적 표현이 가장 높은 특징 분리도를 달성했으며, 이는 소거 분석(ablation analysis)에서 관찰된 가장 높은 IDF1 및 가장 낮은 ID 수와 일치했습니다. 이러한 결과는 운동선수들의 외형이 유사하고 모션 정보만으로는 불충분한 스포츠 MOT 상황에서, 저지 전용 의미론적 단서를 보완적인 식별 정보로 사용하는 것을 뒷받침합니다. 이러한 관찰 결과는 평가된 SportsMOT 설정에 국한되며, 저지 의미론이 모든 스포츠 비디오의 모든 식별 모호성을 해결한다는 근거로 해석되어서는 안 됩니다.

특징 유형클래스 간/클래스 내 거리 비율상대적 개선도 (%)IDF1↑IDs↓
전통적인 Re-ID 특징1.8265.73482
팀 색상 특징3.1774.269.83125
선수 번호 특징3.4991.870.53018
융합된 저지 시맨틱 특징5.63209.374.32768

표 3: 다양한 특징 표현의 판별 분석. 전통적인 재식별(Re-ID) 특징, 유니폼 색상 특징, 선수 번호 특징 및 융합된 세맨틱 특징을 사용한 특징 판별 비교. 클래스 간/클래스 내 거리 비율, 특징 판별의 상대적 개선도, IDentity F1 Score (IDF1) 및 ID 교체(IDs) 횟수를 보고하였다. 거리 비율, 상대적 개선도, IDF1의 경우 값이 높을수록 성능이 좋음을 나타내며, IDs의 경우 값이 낮을수록 성능이 좋음을 나타낸다.

기존 MOT 방법과의 벤치마크 비교

동일한 SportsMOT 검증 설정 하에서 JerseyTrack을 대표적인 MOT 방법들과 비교하기 위해 벤치마크 비교를 수행하였습니다. 비교 대상 방법에는 QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT 및 MOTR이 포함되었습니다. 모든 방법은 검출기의 변동성보다는 추적 연관 성능에 집중하여 비교할 수 있도록 재료 표에 기재된 검출기 프레임워크에 의해 생성된 동일한 검출기 출력값을 사용하였습니다. 평가는 프로토콜 섹션 7에 정의된 지표를 사용하여 수행되었습니다. 주요 평가 지표에는 MOTA, HOTA 및 IDF1이 포함되었습니다. 보조 지표에는 DetA, AssA, FPs, FNs 및 IDs가 포함되었습니다. 표 4는 SportsMOT 검증 세트에 대한 정량적 비교를 요약하며, 그림 10은 평가된 스포츠 장면 전반에 걸친 추적 정확도, 추론 속도 및 HOTA 분포의 시각적 비교를 보여줍니다. JerseyTrack은 비교 방법들 중 가장 높은 MOTA인 88.9%를 달성하였습니다. 이 값은 Deep OC-SORT(87.8%)보다 1.1% 포인트 높고, ByteTrack(86.4%)보다 2.5% 포인트 높았습니다. 따라서 평가된 SportsMOT 검증 설정 하에서 JerseyTrack은 비교 방법들 중 가장 높은 종합 추적 정확도를 달성하였습니다. HOTA의 경우, JerseyTrack은 69.9%를 달성하였으며, 이는 Deep OC-SORT의 64.4% 및 ByteTrack의 62.8%와 대비됩니다. 이러한 차이는 각각 5.5% 포인트와 7.1% 포인트의 향상에 해당하며, 이는 동일한 평가 설정 하에서 검출 및 연관 성능 간의 더 높은 균형을 나타냅니다.

방법MOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓IDs↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
ByteTrack86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
MOTR82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

표 4: SportsMOT 검증 세트에서 JerseyTrack과 대표적인 다중 객체 추적 방법들의 성능 비교. SportsMOT 검증 데이터셋을 이용한 JerseyTrack과 대표적인 다중 객체 추적(MOT) 방법들의 비교. 보고된 지표에는 다중 객체 추적 정확도(MOTA), 고차 추적 정확도(HOTA), IDentity F1 스코어(IDF1), 검출 정확도(DetA), 연관 정확도(AssA), 위양성(FP), 위음성(FN) 및 ID 전환(IDs) 횟수가 포함된다. MOTA, HOTA, IDF1, DetA, AssA의 경우 값이 높을수록 성능이 우수하며, FP, FN, IDs의 경우 값이 낮을수록 성능이 우수함을 나타낸다.

figure-results-6
그림 10. 대표적인 다중 객체 추적 방법과의 성능 비교. (A) SportsMOT 데이터셋에서 평가된 JerseyTrack과 대표적인 다중 객체 추적 방법들의 다중 객체 추적 정확도(MOTA) 및 초당 프레임 수(FPS) 비교. (B) 평가된 추적 방법들에 따른 고차 추적 정확도(HOTA)의 분포. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

ID 유지 성능 측면에서 JerseyTrack은 IDF1 74.3%를 달성하였으며, 이는 Deep OC-SORT의 69.9%와 ByteTrack의 67.7% 대비 높은 수치이다. 또한 JerseyTrack은 2,768개의 ID를 기록하였는데, 이는 Deep OC-SORT가 기록한 3,211개의 ID와 ByteTrack이 기록한 4,192개의 ID보다 적은 수치이다. 이러한 관찰 결과는 Figure 8 Table 2에 제시된 어블레이션 결과와 일치하며, 여기서 완전한 JerseyTrack 구성은 베이스라인 모델 변형들에 비해 ID 전환을 감소시켰다. 검출 및 연관 품질의 경우, JerseyTrack은 DetA 80.2%와 AssA 54.3%를 달성하였다. Deep OC-SORT와 비교했을 때, JerseyTrack은 DetA를 2.0% 포인트, AssA를 2.2% 포인트 향상시켰다. 또한 JerseyTrack은 Table 4에 보고된 다른 비교 방법들보다 더 적은 FP 및 FN을 생성하여, 21,953 FP와 67,160 FN을 기록하였다. 전반적으로, 벤치마크 비교 결과 SportsMOT 검증 설정 하에서 평가된 방법들 중 JerseyTrack이 주요 트래킹 지표에서 가장 높은 수치를 달성했음을 보여주었다. 이러한 결과는 신뢰도 기반 연관(confidence-guided association) 및 저지 시맨틱 퓨전(jersey semantic fusion)을 통해 얻은 ID 유지 및 연관 안정성의 개선 사항과 일치한다. 본 비교는 본 연구에서 사용된 공통 검출기 출력 및 SportsMOT 검증 구성으로 제한된다.

매개변수 민감도 결과

SportsMOT 검증 설정 하에서 주요 구현 파라미터가 추적 성능에 미치는 영향을 조사하기 위해 파라미터 민감도 분석을 수행하였습니다. OCR 손실 가중치 계수(γ), 신뢰 수준 계층적 클러스터 수(K), 그리고 OCR 네트워크 학습률(η)의 세 가지 파라미터를 평가하였습니다. 표 5는 서로 다른 파라미터 설정에서 얻은 MOTA, IDF1, HOTA 및 IDs를 요약하여 보여줍니다.

매개변수MOTA↑IDF1↑HOTA↑IDs↓
OCR 손실 가중치 (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (최적)88.974.369.92,768
188.273.869.32,792
신뢰도 클러스터 수 (K)286.772.168.52,876
3 (최적)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
OCR 학습률 (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (최적)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

표 5: 파라미터 민감도 분석. JerseyTrack에 대해 서로 다른 파라미터 설정을 사용하여 얻은 추적 성능입니다. 광학 문자 인식(OCR) 손실 가중치 계수(γ), 신뢰 클러스터 수(K) 및 OCR 학습률(η)의 서로 다른 값에 대해 다중 객체 추적 정확도(MOTA), IDentity F1 Score(IDF1), 고차 추적 정확도(HOTA) 및 ID 전환 횟수(IDs)를 보고합니다. 최적으로 식별된 파라미터 값은 보고된 실험에 사용된 설정에 해당합니다. MOTA, IDF1 및 HOTA의 경우 값이 높을수록 성능이 좋음을 나타내며, IDs의 경우 값이 낮을수록 성능이 좋음을 나타냅니다.

OCR 손실 가중치 계수(γ)의 경우, γ = 0.8에서 가장 우수한 성능이 확인되었습니다. 이 설정에서 JerseyTrack은 88.9%의 MOTA, 74.3%의 IDF1, 69.9%의 HOTA 및 2,768개의 ID를 달성했습니다. γ를 0.2로 낮추었을 때 MOTA, IDF1, HOTA는 각각 84.7%, 69.4%, 66.2%로 감소한 반면, ID 수는 2,944개로 증가했습니다. γ를 1.0으로 높였을 때는 γ = 0.8일 때와 비교하여 성능 지표가 약간 감소하여 MOTA 88.2%, IDF1 73.8%, HOTA 69.3% 및 2,792개의 ID를 기록했습니다. 이러한 결과는 OCR 감독이 불충분할 경우 선수 번호 식별 능력이 저하되며, OCR 손실 가중치를 평가된 최적값 이상으로 높여도 테스트 조건 하에서는 추적 성능이 개선되지 않았음을 나타냅니다.

신뢰 수준 계층적 클러스터 수(K)의 경우, K = 3에서 최적의 성능이 확인되었습니다. 이 설정은 방법 섹션에서 설명한 고, 중, 저 신뢰도 연관 전략에 해당합니다. K = 2일 때 신뢰도 분할의 세분성이 낮아졌으며, MOTA, IDF1, HOTA는 각각 86.7%, 72.1%, 68.5%로 감소했습니다. K가 4 또는 5로 증가했을 때도 K = 3 대비 성능이 감소했으며, 이는 과도한 분할이 검출 결과를 지나치게 좁은 신뢰도 그룹으로 나누어 연관 전략의 안정성을 떨어뜨렸음을 시사합니다. 이러한 결과는 평가된 JerseyTrack 구성에서 세 가지 신뢰 수준을 사용하는 것이 적절함을 뒷받침합니다.

OCR 네트워크 학습률(η)의 경우, η = 1 × 10-3에서 가장 우수한 성능이 확인되었습니다. 이보다 낮은 1 × 10-4의 학습률에서는 MOTA, IDF1, HOTA가 각각 85.9%, 70.8%, 67.3%로 감소했으며, ID 수는 2,934개로 증가했습니다. 반면 1 × 10-2의 더 높은 학습률에서는 MOTA, IDF1, HOTA가 각각 86.5%, 71.6%, 68.7%로 감소했고, ID 수는 2,889개로 증가했습니다. 이러한 결과는 OCR 브랜치가 학습률 선택에 민감하며, 평가 조건 하에서 1 × 10-3이 선수 번호 인식과 ID 유지 성능 사이의 최적의 균형을 제공함을 나타냅니다.

전반적으로, 표 5는 파라미터 조합 γ = 0.8, K = 3, η = 1 × 10-3이 가장 낮은 ID 수와 함께 가장 높은 MOTA, IDF1 및 HOTA 평가값을 생성했음을 보여줍니다. 민감도 분석 결과, 이러한 파라미터 값에서 적절한 편차가 발생했을 때 추적 성능에 측정 가능한 변화가 있었으나 급격한 변화는 나타나지 않았습니다. 이에 따라, 본 연구에서 보고된 벤치마크 비교 및 주요 SportsMOT 검증 실험에는 이러한 파라미터 설정이 사용되었습니다.

데이터 가용성

본 연구의 결과를 뒷받침하는 원본 평가 요약, 최종 트래킹 출력물, 환경 기록, 데이터셋 매핑 파일 및 중간 요약 파일은 공개 저장소인 https://doi.org/10.5281/zenodo.21274353에서 확인할 수 있습니다. SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 및 MOT20을 포함하여 본 연구에 사용된 기존 공개 벤치마크 데이터셋은 각 제공처에서 확인할 수 있으며, 해당 저장소에서는 재배포되지 않습니다.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구에서는 검출 신뢰도 분할과 저지 시맨틱 단서를 결합한 신뢰도 기반의 스포츠 MOT 워크플로를 평가하였습니다. 신뢰도 기반 연관과 시맨틱 특징 융합은 다중 객체 추적의 데이터 연관을 개선하기 위한 보완적 전략으로 연구되어 왔습니다12,20,23,24,46. 결과에 따르면, 전체 JerseyTrack 설정은 평가된 SportsMOT 검증 환경에서 아이덴티티 보존 및 연관 안정성을 향상시켰습니다. 주요 SportsMOT 검증 결과, MOTA 88.9%, HOTA 69.9%, IDF1 74.3%, DetA 80.2%, 그리고 AssA 54.3%를 달성하였습니다. 이 수치들은 프로토콜에 기술된 검출기 출력 소스, 데이터셋 분할 및 TrackEval 설정 범위 내에서 해석되어야 합니다.

워크플로의 핵심 단계는 신뢰도 수준 분할로, 이를 통해 검출기 출력의 신뢰도에 따라 서로 다른 연관 전략을 적용할 수 있습니다20,22,23,24. JerseyTrack은 검출 내용을 고-, 중-, 저-신뢰도 그룹으로 분리함으로써, 서로 다른 신뢰도 수준의 검출 내용에 대해 각기 다른 연관 규칙을 적용합니다. 고-신뢰도 검출은 주로 이동 일관성을 통해 연관시키며, 중-신뢰도 검출은 이동 및 유니폼 시맨틱을 함께 사용합니다. 저-신뢰도 검출은 새로운 궤적을 초기화하는 데 사용되지 않으며, 궤적 복구 단계에서만 고려됩니다. 이러한 설계는 취약한 검출이나 거짓 양성(false positives)으로 인해 불안정한 ID가 생성될 위험을 줄이는 동시에, 추가적인 시맨틱 근거가 있을 때 부분적인 검출 내용이 복구에 기여할 수 있도록 합니다8,11,20. 두 번째 핵심 단계는 유니폼 시맨틱 추출입니다. 팀 색상 특징은 팀 수준의 제약 조건을 제공하며, 선수 번호 특징은 번호 영역이 보이고 읽을 수 있을 때 더 세밀한 ID 단서를 제공합니다35,41,42,43. 어블레이션 결과에 따르면, 이러한 단서들은 이동 기반 연관의 신뢰도가 낮은 동일 팀 간의 밀집된 상호작용 및 가려짐(occlusion) 사례에서 가장 유용합니다. 그러나 유니폼 시맨틱은 이동 연관을 완전히 대체하기보다 보조적인 근거로 처리해야 합니다. 선수 번호는 블러, 잘림, 뒷모습 포즈, 심한 가려짐 또는 낮은 이미지 해상도로 인해 읽지 못할 수 있습니다. 또한 팀 색상 특징은 번호 정보를 사용할 수 없을 때 같은 팀의 선수들을 구분할 수 없습니다35,42,43. 교차 데이터셋 결과는 본 방법의 적용 범위를 더욱 명확히 해줍니다. JerseyTrack은 시맨틱 분기(branch)가 유니폼 색상과 선수 번호 단서를 중심으로 설계되었기 때문에, 일반 보행자 MOT 데이터셋보다 팀 스포츠 데이터셋에 더 자연스럽게 전이되었습니다19,33,34,35,36,37. 일반 MOT 데이터셋에서도 신뢰도 기반 연관 구성 요소는 여전히 적용 가능했지만, 스포츠 특화 시맨틱 분기가 제공하는 ID 정보는 적었습니다. 따라서 본 방법은 선수들이 구별 가능한 유니폼을 입고 있으며 시맨틱 추출을 위해 유니폼 영역이 충분히 보이는 팀 스포츠 비디오에 가장 적합합니다19,33,34,35,36,37.

몇 가지 한계점이 남아 있다. 첫째, 본 방법은 검출기 출력의 품질에 의존하므로, 심각한 검출 누락이나 부정확한 바운딩 박스는 모션 예측과 시맨틱 크롭핑의 신뢰도를 모두 떨어뜨린다14,17,46. 둘째, 현재 구현에서는 장기적인 시야 밖 재식별(out-of-view re-identification)이 별도로 최적화되지 않았다. 선수가 장기간 카메라 시야를 벗어났다가 나중에 다시 진입하는 경우, 현재의 궤적 복구 전략으로는 원래의 ID를 복구하기에 불충분할 수 있다19,34. 셋째, 심한 배경 클러터, 선수 간의 겹침, 모션 블러 및 읽을 수 없는 저지 번호는 시맨틱 특징의 신뢰도를 낮출 수 있다14,35,42,46. 넷째, 현재의 평가는 공개 벤치마크 데이터셋과 통제된 섭동 설정에 집중되었다. 카메라 컷, 줌 변경 및 비표준 시점이 포함된 방송 영상에 배포하려면 추가적인 전처리 또는 재식별 모듈이 필요할 수 있다19,33,34.

주요한 실질적 함의는 신뢰도 기반 연관(confidence-guided association)과 유니폼 특정 세맨틱 단서를 검출기 구조의 변경 없이 모듈형 MOT 파이프라인에 통합할 수 있다는 점입니다. 이러한 기능은 선수 궤적 추출, 팀 이동 분석, 전술적 이벤트 리뷰 및 반자동 비디오 어노테이션과 같은 스포츠 분석 작업에 적용 가능합니다1,4,33,36. 향후 연구는 보다 강력한 시야 밖 재식별(out-of-view re-identification), 배경 클러터 처리, 시간적 특징 집계, 그리고 심한 블러나 폐색 상황에서도 더 견고한 선수 번호 인식에 집중해야 합니다14,19,34,46.

요약하자면, JerseyTrack은 신뢰도 기반 연관(confidence-guided association)과 유니폼 시맨틱 융합(jersey semantic fusion)을 결합한 스포츠 MOT 방법입니다. 이 방법은 탐지 결과들을 고신뢰도, 중신뢰도, 저신뢰도 그룹으로 분할하고 탐지 신뢰도에 따라 서로 다른 연관 규칙을 적용하며, 중신뢰도 연관 및 궤적 복원 과정에서 유니폼 색상과 선수 번호 단서를 보조적인 식별 정보로 사용합니다. 평가된 SportsMOT 검증 설정 하에서, JerseyTrack은 평가된 베이스라인 구성 대비 향상된 추적 정확도와 식별 보존 능력을 보여주었습니다. 어블레이션 결과, 전체 구성은 베이스라인 및 단일 모듈 변형 모델에 비해 식별 전환(identity switches)을 감소시켰으며, 벤치마크 비교에서는 동일한 탐지기 출력 및 평가 구성 하에서 주요 추적 지표들이 더 높은 수치를 나타냈습니다. 이러한 결과는 팀 스포츠 영상 내 선수 추적 시, 특히 유니폼 영역이 보이고 팀 색상이나 선수 번호 정보가 보충적인 식별 근거를 제공하는 경우, 신뢰도 수준 정보와 유니폼 특화 시맨틱 단서를 사용하는 것이 유효함을 뒷받침합니다20,35,46. 확인된 한계점들을 해결한다면, 제안된 워크플로우를 더욱 까다로운 스포츠 추적 시나리오에 적용하는 능력을 더욱 향상시킬 수 있을 것입니다.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 재정적 이해관계의 충돌이 없음을 밝힙니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 밝힐 감사 인사가 없습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
CUDA RuntimeNVIDIAVersion 12.8검출기 학습, 의미론적 특징 추출 및 추적 추론에 사용되는 GPU 컴퓨팅 런타임.
EasyOCRJaided AIVersion 1.7.2선수 번호 인식에 사용되는 광학 문자 인식 툴킷.
JerseyTrack 소스 코드저자N/A데이터 준비, 의미론적 특징 추출, 신뢰도 분할, 추적, 후처리 및 평가 스크립트를 포함하는 사용자 정의 구현. 다음에서 이용 가능: https://doi.org/10.5281/zenodo.21274352
경량 CRNN OCR 모델저자N/A선수 번호 인식에 사용되는 사용자 정의 합성곱 재귀 신경망(CRNN).
MOT17 데이터셋MOTChallengeN/A교차 데이터셋 평가에 사용되는 공개 벤치마크 데이터셋. 다음에서 이용 가능: https://motchallenge.net/data/MOT17/
MOT20 데이터셋MOTChallengeN/A교차 데이터셋 평가에 사용되는 공개 벤치마크 데이터셋. 다음에서 이용 가능: https://motchallenge.net/data/MOT20/
motmetricsmotmetrics 개발자Version 1.4.0진단적 다중 객체 추적 메트릭 계산에 사용되는 라이브러리.
NVIDIA GPUNVIDIAGeForce RTX 5090 D V2검출기 학습 및 추적 추론에 사용되는 그래픽 처리 장치.
NVIDIA GPU 드라이버NVIDIAVersion 610.62실험 환경에서 사용된 GPU 드라이버.
NumPyNumPy 개발자Version 2.4.4특징 처리 및 데이터 핸들링에 사용되는 수치 계산 라이브러리.
OpenCVOpenCVVersion 4.10.0이미지 로드, 크롭, 전처리 및 시각화에 사용되는 컴퓨터 비전 라이브러리.
PythonPython Software FoundationVersion 3.12.2전체 워크플로우에 사용된 프로그래밍 언어.
PyTorchPyTorch FoundationVersion 2.11.0+cu128검출기 및 의미론적 모델 구현에 사용된 딥러닝 프레임워크.
scikit-learnscikit-learn 개발자Version 1.9.0저지 색상 추출 및 신뢰도 분할 중 K-means 클러스터링에 사용된 머신러닝 라이브러리.
SoccerNet Tracking 데이터셋SoccerNetN/A교차 데이터셋 평가에 사용되는 공개 축구 추적 벤치마크. 다음에서 이용 가능: https://www.soccer-net.org/tasks/tracking
SportsMOT 데이터셋SportsMOT BenchmarkN/A검출기 준비 및 추적 평가에 사용된 기본 벤치마크 데이터셋. 다음에서 이용 가능: https://deeperaction.github.io/datasets/sportsmot.html
TeamTrack 데이터셋TeamTrack BenchmarkN/A교차 데이터셋 평가에 사용되는 공개 스포츠 추적 벤치마크. 다음에서 이용 가능: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationVersion 0.26.0+cu128이미지 변환 및 모델 지원을 위해 PyTorch와 함께 사용되는 컴퓨터 비전 라이브러리.
TrackEvalTrackEval 개발자Version 1.3.0다중 객체 추적 정확도(MOTA), IDentity F1 스코어(IDF1), 고차 추적 정확도(HOTA), 검출 정확도(DetA), 연관 정확도(AssA), 위양성(FP), 위음성(FN) 및 ID 전환(IDs)을 계산하는 데 사용되는 평가 툴킷.
UltralyticsUltralyticsVersion 8.4.90검출기를 학습시키고 선수 검출 결과를 생성하는 데 사용된 객체 검출 프레임워크.

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

SportsMOT

관련 논문