Yöntem makalesi

Forma Semantik Füzyonu Kullanan Spor Videoları İçin Güven Tabanlı Çoklu Nesne İzleme Yöntemi

DOI:

10.3791/71557

14 Ağustos 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, güven odaklı çoklu nesne izleme iş akışını spor videoları için tanımlamakta olup; güven dalgalanmaları, örtüşmeler ve görsel olarak benzer atlet görünümleri altında yörünge ilişkilendirmesini ve kimlik tutarlılığını iyileştirmek için forma rengi ve oyuncu numarası bilgilerini entegre eder.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Spor videolarında Çoklu Nesne İzleme (MOT), taktiksel analiz, oyuncu davranışı yorumlama ve otomatik istatistiksel analizler için yörünge bilgisi sağlar. Ancak, spor senaryoları sıklıkla hızlı yön değişimleri, ani duruşlar, sık kapanmalar (oklüzyon) ve görsel olarak benzer takım arkadaşları içerir; bu durum, kareler arası ilişkilendirme sırasında tespit güveninde dalgalanmalara ve kimlik karışıklığına yol açar. Bu zorlukların üstesinden gelmek için bu çalışma, forma semantik füzyonuna dayalı, güven odaklı bir spor MOT yöntemi olan JerseyTrack'i sunmaktadır. İş akışı, tespit kutularını her karenin güven dağılımına göre yüksek, orta ve düşük güven aralıklarına adaptif olarak ayırır. Yüksek güvenli tespitler öncelikle hareket benzerliği kullanılarak ilişkilendirilirken; orta ve düşük güvenli tespitler, renk kümeleme ve hafif bir Optik Karakter Tanıma (OCR) modeli aracılığıyla çıkarılan forma rengi ve oyuncu numarası özelliklerini ek olarak bünyesine katar. Bu semantik özellikler, yörünge sürekliliğini ve kimlik tutarlılığını artırmak için ek eşleştirme sırasında hareket bilgileriyle birleştirilir. Yöntem, SportsMOT veri seti üzerinde değerlendirilmiştir. JerseyTrack; %88,9 Çoklu Nesne İzleme Doğruluğu (MOTA), %74,3 Kimlik F1 Puanı (IDF1) ve %69,9 Yüksek Dereceli İzleme Doğruluğu (HOTA) elde ederek, değerlendirilen spor izleme ortamında geliştirilmiş bir izleme performansı sergilemiştir. Bu protokol, spor videolarında çoklu nesne izlemeyi iyileştirmek için güven odaklı ilişkilendirmenin forma semantik bilgileriyle entegre edilmesine yönelik tekrarlanabilir bir iş akışı sunmaktadır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Çoklu nesne takibi (MOT), video dizilerinde sürekli nesne yerelleştirmesi ve kimlik koruması sağlar; spor videosu uygulamalarında sporcu yörünge çıkarımı, taktiksel analiz ve otomatik istatistiksel analizi destekler1,2,3. Güvenilir görsel bilgiler, spor bilimlerinde spora özgü karar verme ve performans değerlendirmesiyle de ilişkilidir; bu da sonraki spor analizleri için videodan türetilen kararlı hareket verilerinin değerini daha da vurgulamaktadır4. Spor senaryolarında, taktiksel verilerin güvenilirliği, takip yörüngelerinin sürekliliğine ve hedef kimliklerinin tutarlılığına bağlıdır.

Genel MOT senaryolarıyla karşılaştırıldığında, spor videoları hızlı yön değişimleri, ani duruşlar, sıçramalar, yoğun etkileşimler ve sık occlusion durumları içerir. Bu faktörler, tespit kutusu güveninde önemli dalgalanmalara neden olur ve düşük güvenli tespitlerin sıklığını artırarak yörünge ilişkilendirmesini kesintiye uğratabilir5,6. Tek tip takım formaları, genel görünüm özelliklerinin ayırt edici yeteneğini daha da azaltır ve görsel olarak benzer takım arkadaşları arasında kimlik karışıklığını artırır7,8. Occlusion ve görünüm benzerliği aynı dizide meydana geldiğinde, tespit güveni azalır ve hedef görünüm bilgisi eksik hale gelir; bu da yörünge ilişkilendirme ve kimlik koruma zorluğunu artırır9,10. MOT'ta, yeniden tanımlama (Re-ID), kimlikle ilgili görsel kanıtlar kullanılarak aynı hedef kimliğinin kareler, occlusion dönemleri veya yeniden giriş durumları boyunca ilişkilendirilmesi sürecini ifade eder. Takım sporları videolarında, aynı takımdaki sporcuların genellikle benzer üniformalara ve vücut görünümlerine sahip olması nedeniyle genel Re-ID ipuçları zayıflayabilir. Teknik literatür incelemesi, spor MOT'undaki yörünge parçalanması ve kimlik karışıklığının yaygın olarak iki tamamlayıcı yaklaşımla ele alındığını göstermektedir: tespit güveni kullanımı ve kimlik ipucu geliştirme. JerseyTrack, renk ve oyuncu numarası bilgilerini tüm tespitlere tekdüze şekilde uygulamak yerine, forma semantik ipuçlarının kullanımını tespit kalitesine göre düzenleyerek bu yaklaşımların kesişim noktasında konumlandırılmıştır.

Bu çalışma, forma anlamsal füzyonuna dayalı, güven odaklı bir spor MOT yöntemi olan JerseyTrack'i sunmaktadır. Yöntem, sporcuların görünür formalar giydiği ve tespit sonuçlarının güven skorlarıyla birlikte sınırlayıcı kutular sağladığı takım sporu videoları için tasarlanmıştır. JerseyTrack dört ana bileşeni birleştirir: sporcu tespiti, güven düzeyi bölümlendirme, forma anlamsal özellik çıkarımı ve kademeli kareler arası ilişkilendirme. Tespit güveni, tespitleri yüksek, orta ve düşük güvenli gruplara uyarlanabilir şekilde bölmek için kullanılır ve bu gruplar farklı ilişkilendirme stratejileri kullanılarak işlenir. Yüksek güvenli tespitler öncelikle hareket bilgisi aracılığıyla ilişkilendirilirken, orta ve düşük güvenli tespitler, görsel kanıtların zayıf olduğu durumlarda kimlik korumasını iyileştirmek için ek olarak forma rengi ve oyuncu numarası bilgilerini içerir. Yöntem, taktiksel analiz ve oyuncu davranışı yorumlama gibi stabil sporcu yörüngeleri gerektiren spor videosu analiz görevleri için amaçlanmıştır.

Önerilen yaklaşımın operasyonel sınırlamaları da bulunmaktadır. Forma semantik çıkarımı; şiddetli kapanma (oklüzyon), hareket bulanıklığı, düşük görüntü çözünürlüğü, anormal forma pozları veya görünmeyen oyuncu numaralarından etkilenebilir. Bu durumlarda, formaya dayalı semantik ipuçları yetersiz kalabilir ve ilişkilendirme süreci daha çok hareket tutarlılığına ve çok kareli doğrulamaya dayanır. Bu nedenle, bu çalışmadaki performans iddiaları, değerlendirilen veri setleri ve deneysel ortamlarla sınırlıdır. SportsMOT veri seti üzerinde yapılan deneyler, JerseyTrack'in test edilen spor takip koşulları altında değerlendirilen takip metriklerini iyileştirdiğini ve kimlik değiştirme (identity-switching) olaylarını azalttığını göstermektedir. Spor videolarında MOT'un temel zorluğu, hızlı hareket, kapanma ve görünüm benzerliği altında yörünge sürekliliğini ve kimlik tutarlılığını korumaktır. JerseyTrack ile ilgili mevcut çalışmalar genel olarak iki araştırma yönüne ayrılabilir: yörünge ilişkilendirmesi için tespit güveninin kullanımı ve spora özgü semantik özellikler aracılığıyla kimlik ipuçlarının geliştirilmesi.

Tespit güven değeri, tespit kutularının güvenilirliğini tahmin etmek ve MOT'ta yörünge ilişkilendirmesine rehberlik etmek için yaygın olarak kullanılmıştır. Erken dönem izleme yöntemleri, güven değerini genellikle ikili bir filtreleme kriteri olarak ele almış ve yanlış pozitifleri azaltmak için sabit bir eşiğin altındaki tespitleri kaldırmıştır11,12. Bu strateji gürültülü tespitleri azaltsa da, oklüzyon (örtünme), hızlı hareket veya düşük görüntü kalitesi altındaki gerçek hedeflerin de atılmasına neden olarak yörünge parçalanmasıyla sonuçlanabilmektedir13,14,15. Benzer filtreleme stratejileri, sabit güven eşiklerinin sahne varyasyonuna ve tespit kalitesine karşı duyarlı olduğunu da göstermiştir16,17. Düşük güvenli tespitlerin kullanımını geliştirmek için ByteTrack, düşük güvenli kutuları ikincil eşleştirme için aday hedefler olarak tutan ve bunları hareket benzerliği ile yörünge geçmişi üzerinden mevcut yörüngelerle bağlayan bir ilişkilendirme stratejisi sunmuştur18. McByte, zamansal olarak yayılmış segmentasyon maskelerini bir ilişkilendirme ipucu olarak ekleyerek spor MOT ilişkilendirmesini daha da genişletmiş; video başına ek eğitim gerektirmeden hızlı hareket, oklüzyon ve kamera kayması koşulları altında dayanıklılığı artırmıştır19. İlgili çalışmalar, ilişkilendirme sırasında zayıf ancak potansiyel olarak geçerli hedefleri tutmak için düşük güvenli tespitlerin kullanımını da düzenlemiştir20,21,22. Güvene duyarlı ilişkilendirme stratejileri, daha sonra eşleştirme kriterlerini hareket tutarlılığına ve tespit güvenilirliğine göre rafine etmiştir23,24,25. Tespit kutusu regresyonu ve yörünge pürüzsüzlüğü optimizasyonuna dayalı yörünge rafinasyon yöntemleri de yörünge parçalanmasını azaltmak için kullanılmıştır26,27,28. Ek rafinasyon stratejileri, karmaşık hareket koşulları altında yörünge sürekliliğinin korunması için tamamlayıcı destek sağlamaktadır29. Zamansal tutarlı nesne akışı, kareler arası nesne düzeyinde zamansal tutarlılığı daha ayrıntılı modellerken, karmaşık MOT senaryolarında yörünge kesintilerini azaltmak için ilişkilendirme odaklı başka bir yaklaşım sunmaktadır30. İzleyici füzyon yöntemleri ayrıca birden fazla izleyicinin çıktılarından öğrenmekte ve farklı MOT kıyaslamalarında izleme dayanıklılığını artırmak için öğrenici tabanlı seçim veya füzyon stratejileri kullanmaktadır31. Topluca bakıldığında bu çalışmalar, güvende farkındalık yaratan ilişkilendirmenin kesintiye uğramış yörüngeleri geri kazanmaya yardımcı olduğunu göstermektedir; ancak, aynı takımdaki oyuncuların görsel görünümleri benzer olduğunda, güven ve hareket ipuçları sınırlı kimlik bilgisi sağlamaktadır. Bu yöntemler genel senaryolarda yörünge parçalanmasını etkili bir şekilde hafifletse de, spor ortamlarında doğuştan gelen sınırlamalarla karşı karşıyadır; çünkü aynı takımdaki oyuncular genellikle oldukça benzer görsel görünümlere sahiptir ve yalnızca güven ve hareket bilgilerine güvenmek, kimlik ayrımı için yeterli bir temel sağlayamaz32,33,34. Düşük güvenli kutular etkili bir şekilde geri çağrıldığında bile, özellik benzerliği hala kimlik değişimlerine yol açabilmekte ve spor analizinin katı kimlik tutarlılığı gereksinimlerini karşılamayı zorlaştırmaktadır.

Spora özgü kimlik ipuçları, sporcu takibinde kimlik ayrımını iyileştirmek için de kullanılmıştır. Takım rengi ve oyuncu numarası gibi forma semantik bilgileri, genel görünüm gömmelerinden ziyade spor senaryolarıyla daha doğrudan ilişkili kimlik ipuçları sağlar35,36,37. Forma rengi, takım düzeyindeki ayrımı desteklemek ve takımlar arası karışıklığı azaltmak için kullanılırken, oyuncu numarası tanıma, numara bölgesinin görünür ve okunabilir olduğu durumlarda daha hassas bir kimlik ipucu sağlar38,39. Mevcut spor takip çalışmaları, kalabalık spor koşulları altında oyuncu ilişkilendirmesini iyileştirmek için alana özgü görsel özellikleri ve forma rengi tanımayı dahil etmiştir40,41. Forma numarası tanıma ve sentetik numara verileri üzerine yapılan ilgili çalışmalar, düşük çözünürlüklü veya kısmen gizlenmiş koşullar altında kimlik modellemeyi daha da desteklemektedir42,43. Bu çalışmalar, forma semantiğinin spor MOT'unda kimlik temsilini güçlendirebileceğini göstermektedir. Ancak, semantik olarak geliştirilmiş takip yöntemlerinin çoğu, tespit güveni ile semantik özellik kalitesi arasındaki ilişkiyi yeterince modellememektedir. Yüksek güvenli tespitler zaten güvenilir uzamsal ve görünüm bilgileri içerebilir, bu da tekrarlanan semantik çıkarımı daha az verimli hale getirir. Düşük güvenli tespitler ise genellikle gizlenme, bulanıklık, kırpılma veya düşük çözünürlükten etkilenerek renk ve oyuncu numarası ipuçlarının güvenilirliğini azaltır. Bu sınırlama, forma semantiğinin tüm tespitlere tek tip uygulanması yerine tespit kalitesine göre sunulduğu güven odaklı bir ilişkilendirme tasarımını tetiklemektedir. İncelenen çalışmalar, güven duyarlı ilişkilendirmenin ve forma semantik modellemesinin spor MOT'unun farklı yönlerini ele aldığını göstermektedir. Güvene dayalı stratejiler temel olarak bir tespitin ilişkilendirmeye katılıp katılmaması gerektiğini ve mevcut yörüngelerle nasıl eşleşmesi gerektiğini belirlerken, forma semantik stratejileri öncelikle spora özgü ipuçları aracılığıyla kimlik temsilini geliştirir. Bununla birlikte, bu iki mekanizma genellikle ayrı bileşenler olarak tasarlanmıştır. Sonuç olarak, semantik ipuçları her zaman tespit kalitesine göre ayarlanmaz ve güven seviyeleri ilişkilendirme sırasında renk ve oyuncu numarası bilgilerinin kullanımını doğrudan düzenlemez. Bu ayrım, takım sporu videolarında yörünge parçalanması ve kimlik karışıklığının ortaklaşa ele alınmasını sınırlar. Mevcut araştırma boşluğu, aynı takip iş akışı içerisinde tespit güveni kalite değerlendirmesi ile forma semantik ilişkilendirmesinin birbirine bağlanmasında yatmaktadır.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma; SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 ve MOT20 adlı, halka açık kıyaslama video veri setlerinin ikincil analizini içermektedir. Herhangi bir katılımcı alınmamış, herhangi bir müdahale gerçekleştirilmemiş ve yeni insan denek verisi toplanmamıştır. Bangkok Thonburi Üniversitesi'nin geçerli kurumsal gereklilikleri uyarınca, bu çalışma için etik kurul onayı gerekmemiştir.

Aşağıdaki protokol, veri hazırlığından takip değerlendirmesine kadar JerseyTrack'i yeniden üretmek için kullanılan iş akışını açıklamaktadır. İş akışı; Şekil 1'de özetlendiği üzere veri seti hazırlama, dedektör hazırlama, forma semantik çıkarımı, güven düzeyi bölümlendirme, güven kılavuzlu ilişkilendirme, takip çıkarımı ve performans değerlendirmesini içermektedir. Gerekli yazılımlar, veri setleri ve donanım kaynakları Materyaller Tablosu'nda listelenmiştir.

figure-protocol-1
Şekil 1. JerseyTrack yönteminin genel iş akışı. İş akışı; forma semantik özellik çıkarımı, başlangıç nesne eşleştirmesi, güven odaklı tamamlayıcı eşleştirme ve özellik füzyonundan oluşmaktadır. Belirlenen atlet bölgelerinden takım rengi ve oyuncu numarası özellikleri çıkarılır ve belirsiz tespit koşulları altında yörünge eşleştirmesini iyileştirmek için ilişkilendirme sürecine dahil edilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

1. Veri setlerini ve dizin yapısını hazırlayın

  1. Materyaller Tablosunda listelenen halka açık kıyaslama veri setlerini indirin. Detektör hazırlama ve izleme değerlendirmesi için birincil veri seti olarak SportsMOT'u kullanın. Veri setleri arası değerlendirme için TeamTrack, SoccerNet Tracking, MOT17 ve MOT20'yi saklayın.
  2. Tüm veri setlerini birleşik bir proje dizini altında depolayın. Detektörün, semantik çıkarım modülünün, izleme modülünün ve değerlendirme araç setinin özdeş sekans tanımlayıcıları kullandığından emin olun.
  3. Bu çalışmada kullanılan veri hazırlama betiğini kullanarak resmi SportsMOT açıklamalarını detektör eğitim formatına dönüştürün. Şu komutu çalıştırın:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Veri hazırlama betiği (scripts/prepare_data.py), JerseyTrack kaynak kod deposunda (https://doi.org/10.5281/zenodo.21274352) mevcuttur. Gerekli yazılım bağımlılıkları; Python 3.12, PyTorch 2.11.0 ve OpenCV 4.10 veya daha yeni sürümler dahil olmak üzere environment.yml dosyasında belirtilmiştir. Yazılım ortamını şu komutu kullanarak yapılandırın: conda env create -f environment.yml. Veri hazırlama betiğini şu komutu kullanarak çalıştırın: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Dönüştürme işleminin detektör eğitim yapılandırma dosyasını (data\processed\SportsMOT_yolo\data.yaml) ve dönüştürme manifestosunu (data\processed\SportsMOT_yolo\conversion_manifest.csv) oluşturduğunu doğrulayın.
    NOT: Bu çalışmada, dönüştürülmüş SportsMOT eğitim ve doğrulama veri seti 90 sekans, 55.544 kare ve 608.152 etiketlenmiş nesne içermiştir.
  6. Kare sırasının, sınırlayıcı kutu koordinatlarının ve kimlik etiketlerinin orijinal kıyaslama açıklamalarıyla tutarlı kaldığını doğrulamak için temsilci sekansları inceleyin.
  7. Tüm yöntemlerin aynı veri seti bölümünü ve değerlendirme protokolünü kullanması için, dönüştürülmüş açıklama dosyalarını detektör hazırlama, izleme çıkarımı ve değerlendirme süreçleri boyunca değişiklik yapmadan koruyun.
    NOT: Bu bölümün beklenen sonucu; dönüştürülmüş açıklamaları, dönüştürme manifestosunu ve detektör hazırlama ile izleme değerlendirmesi için gerekli olan veri seti bölümleme dosyalarını içeren standartlaştırılmış bir SportsMOT detektör eğitim dizinidir.

2. Detektör çıkışlarını hazırlayın

  1. Hazırlanan SportsMOT eğitim seti kullanılarak nesne dedektörünü ince ayar ile optimize edin. Dedektörü, Denklem 1'de tanımlanan sınıflandırma kaybı ve sınırlayıcı kutu regresyon kaybını kullanarak optimize edin. Uygulama kurulumunda ve Materyal Tablosu'nda bildirilen dedektör giriş çözünürlüğünü, grup boyutunu, öğrenme oranını, eğitim epok sayısını ve diğer eğitim parametrelerini kullanın.
    Ldet = Lcls + Lbox   (1)
    Burada, Ldet  toplam dedektör kaybını, Lcls  sınıflandırma kaybını, Lbox  ise sınırlayıcı kutu regresyon kaybını ifade eder.
    NOT: Birincil deneylerde kullanılan dedektör kontrol noktası (dahili deney tanımlayıcısı e3), Ultralytics YOLO çerçevesi ve SportsMOT YOLO-formatlı veri seti yapılandırması (data/processed/SportsMOT_yolo/data.yaml) kullanılarak eğitilmiştir. Dedektör eğitimini şu komutu kullanarak gerçekleştirin: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Eğitimden sonra, doğrulama dizileri için dedektör çıktılarını oluşturmak amacıyla elde edilen en iyi performanslı kontrol noktasını şu komutu kullanarak kullanın: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Eğitimden sonra, eğitilmiş dedektör kontrol noktasını, ilgili meta veri dosyasını ve eğitim günlüğünü kaydedin.
    NOT: Bu çalışmada, resmi deneyler için kullanılan dedektör kontrol noktası şu şekilde kaydedilmiştir:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. İlgili meta veri dosyası şu şekilde kaydedilmiştir: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. Ana SportsMOT doğrulama deneyleri için kullanılan dedektör-çıktı dizini şudur: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Sporcu sınırlayıcı kutularını ve güven puanlarını oluşturmak için eğitilmiş dedektörü her bir doğrulama dizisi üzerinde çalıştırın. Her dizi için kare indeksini, sınırlayıcı kutu koordinatlarını, tespit güvenini ve sınıf etiketini içeren bir tespit dosyası dışa aktarın.
    NOT: Ana deneylerde kullanılan SportsMOT doğrulama çalışmasında, 0,05'lik bir güven eşiği 343.990 sporcu tespiti oluşturmuştur.
  4. Takip çıkarımı öncesinde dedektör-çıktı dizinini inceleyin. Her dizinin karşılık gelen bir tespit dosyasına sahip olduğunu, kare indekslerinin hazırlanan görüntü dizisiyle eşleştiğini ve her tespit kaydının bir güven puanı içerdiğini doğrulayın.
    NOT: Bu bölümün beklenen sonucu; forma semantik çıkarımı, güven seviyesi bölümlendirmesi ve takip ilişkilendirmesi için girdi görevi gören eksiksiz bir dedektör-çıktı dizinidir.

3. Forma semantik özelliklerini çıkarın

  1. Dedektör çıktı dosyalarını kullanarak her video karesinden sporcu bölgelerini kırpın. Kırpılan her sporcu görüntüsünü; sekans tanımlayıcısı, kare indeksi ve tespit indeksi ile birlikte kaydedin. Görüntü içeriği eksik olan veya sınırlayıcı kutuları görüntü sınırlarının dışına taşan geçersiz kırpmaları hariç tutun. Ayıklanan semantik özelliklerin, izleme ilişkilendirmesi sırasında ilgili tespite eşleştirilebilmesi için her kırpma dosya adı ile orijinal tespit kaydı arasındaki bağlantıyı koruyun.
  2. Bu çalışmada kullanılan semantik ayıklama betiğini kullanarak, kırpılan sporcu görüntülerinden forma rengi özelliklerini ayıklayın.
    NOT: Semantik özellik ayıklama betikleri (scripts/extract_fast_color_semantics.py ve scripts/formal_extract_semantics.py), JerseyTrack kaynak kod deposunda (https://doi.org/10.5281/zenodo.21274352) mevcuttur. Ayrı bir yapılandırma dosyası gerekmez; tüm çalışma zamanı parametreleri komut satırı bağımsız değişkenleri aracılığıyla sağlanır.
    Aşağıdaki komutu kullanarak forma rengi tanımlayıcılarını oluşturun: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Aşağıdaki komutu kullanarak OCR modeli ile oyuncu numarası semantik özelliklerini oluşturun: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Oluşturulan forma rengi tanımlayıcıları ve oyuncu numarası olasılık çıktıları, sekans tanımlayıcısı ile ilişkilendirilir ve izleme ilişkilendirmesi sırasında kullanılan semantik özellik dosyalarında birleştirilir.
  3. Kırpılan her sporcu görüntüsünü Hue, Saturation, Value (HSV) renk uzayına dönüştürün. Forma bölgesinden ön plan piksellerini ayıklayın ve baskın forma rengini K = 3 olan K-ortalamalar kümelemesi ile özetleyin. Özellik karşılaştırmasından önce, ortaya çıkan renk tanımlayıcısını L2 normalizasyonu kullanarak normalize edin.
  4. Oyuncu numarası tanıma kolunu, 128 × 64 piksel giriş boyutundaki kırpılmış sporcu görüntülerini kullanarak eğitin. Bu çalışmada uygulanan zayıf denetimli etiketleme prosedürünü kullanarak oyuncu numarası sözde etiketleri oluşturun. Görünmeyen, okunmayan, ciddi şekilde örtülmüş veya düşük güvenilirlikli oyuncu numarası bölgelerine sahip kırpmaları Optik Karakter Tanıma (OCR) kayıp hesaplamasından hariç tutun.
  5. OCR kolunu, Denklem 2'de tanımlanan çapraz entropi kaybı ile optimize edin.
    figure-protocol-2 (2)
    Burada, Locr OCR kaybını, yi  denetimli oyuncu numarası etiketini ve figure-protocol-3 tahmin edilen oyuncu numarası kategorisini belirtir.
  6. Semantik özellik ayıklama modülünü, Malzemeler Tablosu'nda listelenen adaptif optimize edici, öğrenme oranı, yığın boyutu, ağırlık azalması ve eğitim süresini kullanarak optimize edin. Dedektör kaybı ve OCR kaybını, Denklem 3'te tanımlanan toplam eğitim hedefi ile birleştirin.
    Ltotal = Ldet + γLocr   (3)
    Burada, Ltotal toplam eğitim kaybını, Ldet Denklem 1'de tanımlanan dedektör kaybını, Locr Denklem 2'de tanımlanan OCR kaybını ve γ OCR kaybı için kullanıcı tarafından tanımlanan ağırlıklandırma katsayısını belirtir.
  7. Eğitilen OCR kolunu her bir kırpılmış sporcu görüntüsüne uygulayın. Her kırpma için tahmin edilen oyuncu numarası kategorisini veya olasılık vektörünü kaydedin. Oyuncu numarası görünmüyorsa veya OCR güven değeri uygulamada tanımlanan eşiğin altındaysa, zorlama bir tahmin yapmak yerine oyuncu numarası özelliğini kullanılamaz olarak kaydedin.
  8. Forma rengi tanımlayıcısını ve oyuncu numarası çıktısını, izleme modülü tarafından kullanılan semantik özellik dosyasında birleştirin.
    NOT: Ana SportsMOT doğrulama çalışmasında, semantik ayıklama betiği, eksik kare veya geçersiz kırpma olmaksızın 343.990 tespiti işlemiştir. Mevcut revizyon paketinde, semantik ayıklama özeti, değerlendirilen SportsMOT ayarları altında genel renk ve OCR semantik ayıklama doğruluğunun %86,7 olduğunu bildirmiştir. Bu bölümden beklenen sonuç; her geçerli tespit kaydının bir forma rengi tanımlayıcısına, mevcut olduğunda bir oyuncu numarası çıktısına ve izleme ilişkilendirmesi için semantik bilgilerin mevcut olup olmadığını belirten bir bayrağa bağlandığı bir semantik özellik dosyasıdır.

4. Bölümleme tespit güven düzeyleri

  1. Her video dizisi için dedektör çıktı dosyasını yükleyin. Her karedeki tüm sporcu tespitlerinin güven puanlarını toplayın.
  2. Şekil 2'de gösterilen güven odaklı ilişkilendirme iş akışını takip ederek, K = 3 ile K-ortalama kümeleme yöntemini kullanarak kare düzeyindeki güven puanlarını yüksek, orta ve düşük güven aralıklarına ayırın. Uyarlamalı güven eşiklerini, Denklem 4'e göre küme içi varyansı minimize ederek belirleyin.
    figure-protocol-4  (4)
    Burada, sd tespit d'nin güven puanını; D1, D2 ve D3 sırasıyla yüksek, orta ve düşük güven aralıklarını; μ1, μ2 ve μ3 üç aralığın ortalama güven puanlarını;  τ1 ve  τ2 ise K-ortalama kümeleme sonuçlarından elde edilen uyarlamalı güven eşiklerini belirtir.
    NOT: Güven bölümlendirme betiği (scripts/formal_partition_confidence.py), JerseyTrack kaynak kod deposunda (https://doi.org/10.5281/zenodo.21274352) mevcuttur. Güven bölümlendirme modülü, K = 3 ile NumPy tabanlı tek boyutlu bir K-ortalama kümeleme prosedürü kullanır. Ayrı bir konfigürasyon dosyası gerekmez; giriş dizini, çıkış dizini ve kümeleme parametresi komut satırı bağımsız değişkenleri aracılığıyla belirtilir. Güven bölümlendirme prosedürünü şu komutu kullanarak yürütün: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. NumPy sürümü dahil gerekli yazılım bağımlılıkları environment.yml dosyasında belirtilmiştir.
  3. Dedektör çıktı dizinini giriş olarak kullanarak güven bölümlendirme prosedürünü çalıştırın.
    NOT: Bu çalışmada, dedektör çıktı dizini şuydu: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. Güven bölümlendirme çıktı dizini şuydu: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Oluşturulan çıktı dosyaları, dizi başına güven CSV dosyalarını, _confidence_frame_summary.csv ve _confidence_runtime.csv dosyalarını içeriyordu.
  4. Her tespite bir güven düzeyi etiketi atayın. Hareket tabanlı ilişkilendirme için yüksek güvenli tespitleri, hareket-semantik ilişkilendirme için orta güvenli tespitleri ve yalnızca yörünge kurtarma için düşük güvenli tespitleri etiketleyin. Orijinal güven puanını, atanan güven düzeyi etiketiyle birlikte koruyun.
  5. Şekil 3'te örneklendiği gibi güven puanı dağılımlarını ve temsili kareleri inceleyin. Yüksek güvenli tespitlerin ağırlıklı olarak tam ve güvenilir sporcu sınırlayıcı kutularına karşılık geldiğini, orta ve düşük güvenli tespitlerin ise temel olarak kısmi, engellenmiş, bulanık veya zayıf tespitler içerdiğini doğrulayın.
    NOT: Bu bölümün beklenen sonucu; her tespit için tespit indeksini, orijinal güven puanını, atanan güven düzeyini ve kare düzeyindeki uyarlamalı güven eşiklerini içeren bir güven bölümlendirme dosyasıdır.

figure-protocol-5
Şekil 2. Güven odaklı ilişkilendirme stratejisi. İş akışı, adaptif güven kümelemesi kullanarak tespit güvenini yüksek, orta ve düşük güven aralıklarına ayırır. Yüksek güvenli tespitler hareket benzerliği kullanılarak, orta güvenli tespitler birleşik hareket ve forma semantik benzerliği kullanılarak ilişkilendirilir; düşük güvenli tespitler ise çok kareli doğrulama ile semantik destekli yörünge kurtarma için kullanılır. Sağ panel, güven bölümlendirme ve ilişkilendirme için kullanılan matematiksel formülasyonu özetlemektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-protocol-6
Şekil 3. Tespit güven puanlarının dağılımı. Histogram, SportsMOT veri setindeki futbol, basketbol ve voleybol sekansları için beş güven aralığındaki sporcu tespit kutularının sayısını göstermektedir. Dağılım, değerlendirilen spor kategorileri arasında dedektör güveni açısındanki farkları ortaya koymaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

5. Güven odaklı ilişkilendirmeyi çalıştırın

  1. Her video dizisi için dedektör-çıktı dosyasını, anlamsal-özellik dosyasını ve güven-bölüntü dosyasını yükleyin. İzleyiciyi ilk geçerli tespitleri kullanarak başlatın ve izlenen her sporcu için bir yörünge durumu sürdürün. Sonraki her kare için, mevcut her yörüngenin konumunu Kalman filtresi hareket modelini kullanarak tahmin edin.
  2. Her tahmin edilen yörünge ile aday tespit arasındaki hareket benzerliğini, Denklem 5'te tanımlanan Mahalanobis mesafesini kullanarak hesaplayın.
    figure-protocol-7  (5)
    Burada, figure-protocol-8 k karesindeki I-ıncı yörüngeyi, figure-protocol-9 Kalman ile tahmin edilen yörünge durumunu, dj aday tespiti, figure-protocol-10 tahmin edilen yörünge durumunun ters kovaryans matrisini ve Smot tahmin edilen yörünge ile tespit arasındaki hareket mesafesini ifade eder.
    NOT: Temel ilişkilendirme iş akışı jerseytrack/formal_tracker.py dosyasında uygulanmış ve scripts/formal_track.py üzerinden yürütülmüştür; her iki dosya da JerseyTrack kaynak kod deposunda (https://doi.org/10.5281/zenodo.21274352) mevcuttur. Ayrı bir yapılandırma dosyasına gerek yoktur. Güven eşikleri, maksimum izleme yaşı, hareket-ağırlık katsayıları ve merkez-mesafe ağırlığı dahil tüm çalışma zamanı parametreleri komut satırı argümanları aracılığıyla sağlanır. Tam yürütme komutu ve parametre ayarları Adım 6.2'de sunulmuştur. Uygulama, Macar eşleştirmesi için SciPy'nin lineer toplam atama algoritmasını ve maliyet tabanlı ilişkilendirme için NumPy'yi kullanır.
  3. Girişler olarak dedektör-çıktı dosyası, anlamsal-özellik dosyası ve güven-bölüntü dosyasını kullanarak izleme iş akışını çalıştırın.
    NOT: Bu çalışmada, temel izleyici jerseytrack\formal_tracker.py dosyasında uygulanmış ve izleme iş akışı scripts\formal_track.py kullanılarak yürütülmüştür.
  4. Yüksek güvenli tespitleri hareket tutarlılığını kullanarak mevcut yörüngelerle ilişkilendirin. Eşleşen yörüngeleri güncelleyin ve yeni yörüngeleri yalnızca eşleşmeyen yüksek güvenli tespitler yörünge başlatma kriterlerini karşıladığında başlatın.
  5. Şekil 4'te gösterilen forma anlamsal çıkarma çıktılarını inceleyin ve takım renk tanımlayıcısı ile oyuncu numarası özelliğini Denklem 6'ya göre birleştirerek her tespit için forma anlamsal özellik vektörünü oluşturun.
    fsem = [fcol;fid] (6)
    Burada, fsem  birleştirilmiş anlamsal özellik vektörünü, fcol takım renk tanımlayıcısını ve fid OCR kolu tarafından üretilen oyuncu numarası özelliğini ifade eder.
  6. Hareket benzerliğini forma anlamsal benzerliği ile birleştirerek orta güvenli tespitleri ilişkilendirin. Birleştirilmiş eşleştirme puanını Denklem 7'ye göre hesaplayın.
    figure-protocol-11 (7)
    Burada, Ssem yörünge ile aday tespitin anlamsal özellik vektörleri arasındaki kosinüs benzerliğini, Smot Denklem 5'te tanımlanan hareket mesafesini ve  λ hareket ve anlamsal benzerlik terimlerini dengeleyen adaptif füzyon katsayısını ifade eder.
  7. Adaptif füzyon katsayısını Denklem 8'e göre hesaplayın.
    figure-protocol-12 (8)
    Burada, λ başlangıç hareket-ağırlık katsayısını,  σsd mevcut karedeki tespit-güven puanlarının standart sapmasını ve  σmax normalizasyon için kullanılan maksimum güven-puanı standart sapmasını ifade eder.
  8. Düşük güvenli tespitleri yalnızca yörünge kurtarma için kullanın. Düşük güvenli tespitleri kesintiye uğramış yörüngelerle yalnızca anlamsal bilgi mevcut olduğunda ve kurtarma kriterleri karşılandığında eşleştirin. Bir yörünge kimliğini geri yüklemeden önce çok kareli doğrulama uygulayın ve doğrulamadan geçemeyen tespitleri atın.
    NOT: Oyuncu numarası özelliği mevcut olmadığında, zorlama bir oyuncu numarası eşleşmesi yerine mevcut anlamsal bilgileri ve hareket tutarlılığını kullanarak ilişkilendirme yapın. Bu bölümün beklenen sonucu; yörünge kimliklerini, sınırlayıcı kutuları, güven seviyesi etiketlerini, hareket maliyetlerini, anlamsal bilgileri ve nihai ilişkilendirme kararlarını içeren kare bazlı bir izleme kaydıdır. Revizyon kanıt paketinde, izleme sonuçları şurada saklanmıştır: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
Şekil 4. Forma semantik özellik çıkarımı. Temsili sporcu tespitleri, forma semantik çıkarım modülü tarafından oluşturulan çıkarılmış takım rengi tanımlayıcıları ve oyuncu numarası bilgileri ile etiketlenmiştir. Çıkarılan semantik özellikler daha sonra güven odaklı veri ilişkilendirmeye dahil edilmektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

6. İzleme çıkarımını çalıştırın ve sonuçları dışa aktarın

  1. Hazırlanan detektör çıktı dosyaları, semantik özellik dosyaları ve güven bölümlendirme dosyalarını kullanarak her bir video dizisi için takip çıkarımı gerçekleştirin. Yörünge durumlarının, semantik geçmişin ve yörünge kurtarma kararlarının dizi boyunca tutarlı bir şekilde güncellenmesi için video karelerini kronolojik sırayla işleyin. Veri setine özel bir ayar açıkça belirtilmediği sürece, değerlendirilen tüm diziler için aynı çıkarım yapılandırmasını kullanın.
    NOT: Takip çıkarımı, JerseyTrack kaynak kod deposunda (https://doi.org/10.5281/zenodo.21274352) bulunan scripts/formal_track.py kullanılarak yürütülmüştür. Ayrı bir yapılandırma dosyasına gerek yoktur. Takip çıkarımını şu komutu kullanarak çalıştırın: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Belirtilmeyen tüm parametreler, arşivlenmiş kaynak kodda kayıtlı varsayılan değerlerini korumuştur.
  2. Çıkarımın ardından, şu komutları kullanarak birincil son işleme dizisini uygulayın: python scripts/merge_tracklets.py ve python scripts/sweep_track_filter.py --min-len 95.
  3. Takip sonuçlarını, değerlendirme araç setinin gerektirdiği formatta dışa aktarın. Kare indeksini, yörünge kimliğini, sınırlayıcı kutu koordinatlarını ve kıyaslama değerlendirme formatı tarafından gerekli olan tüm alanları ekleyin. Her bir sonuç dosyasının karşılık gelen yer gerçekliği etiket dosyasıyla eşleştirilebilmesi için tutarlı bir dosya adlandırma kuralı kullanarak her dizi için bir takip sonucu dosyası kaydedin.
  4. Yalnızca bu çalışmada kullanılan son işleme işlemlerini uygulayın. Revizyon paketinde açıklanan son işleme betiklerini kullanarak tracklet birleştirme ve takip filtreleme işlemlerini gerçekleştirin.
    NOT: Bu çalışmada, son işleme iş akışında şu betikler kullanılmıştır:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Nicel değerlendirme öncesinde dışa aktarılan takip sonuçlarını inceleyin. Yörünge kimliklerinin her dizi içinde sayısal ve tutarlı kaldığını, hiçbir kare indeksinin eksik olmadığını ve tüm sınırlayıcı kutuların görüntü sınırları içinde kaldığını doğrulayın.
    NOT: Bu bölümün beklenen çıktısı, nicel değerlendirmeye hazır, dizi düzeyinde eksiksiz bir takip sonucu dosyaları setidir.

7. İzleme performansını değerlendirin

  1. Dışa aktarılan takip-sonuç dosyalarını, Malzemeler Tablosu'nda listelenen değerlendirme araç seti ile değerlendirin. Her takip-sonuç dosyasını, ilgili yer gerçekliği (ground-truth) açıklama dosyası ve veri seti bölümü ile eşleştirin. Performans farklarının değerlendirme ayarlarından ziyade takip sonuçlarından kaynaklandığından emin olmak için karşılaştırılan tüm yöntemler için aynı değerlendirme yapılandırmasını kullanın.
  2. Değerlendirmeyi aşağıdaki komutu kullanarak çalıştırın
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    NOT: Değerlendirme, JerseyTrack yeniden üretilebilirlik paketi içinde arşivlenen standart TrackEval (Sürüm 1.3.0) metrik uygulaması kullanılarak gerçekleştirilmiştir. Yüksek Dereceli Takip Doğruluğu (HOTA), CLEAR veya Kimlik metrik uygulamalarında herhangi bir değişiklik yapılmamıştır. Depo, evaluation/trackeval/scripts/run_mot_challenge.py konumunda bulunan ve veri seti ile sonuç yollarını yapılandırıp standart TrackEval değerlendirme metriklerini çağıran MOTChallenge tarzı yürütme sarmalayıcısını içerir.
  3. Çoklu Nesne Takip Doğruluğu (MOTA), Kimlik F1 Puanı (IDF1), Yüksek Dereceli Takip Doğruluğu (HOTA), Tespit Doğruluğu (DetA), İlişkilendirme Doğruluğu (AssA), yanlış pozitifler (FPs), yanlış negatifler (FNs) ve kimlik değiştirme olayları dahil olmak üzere makalede raporlanan değerlendirme metriklerini kaydedin. Değerlendirme özetini bir tablo olarak dışa aktarın ve doğrulama için dizi başına değerlendirme dosyalarını saklayın.
  4. JerseyTrack'i temel yöntemlerle karşılaştırırken, tüm yöntemler için aynı veri seti bölümünü, detektör çıktılarını ve değerlendirme yapılandırmasını kullanın. Her karşılaştırma için veri setini, detektör çıktı kaynağını, değerlendirme araç seti yapılandırmasını ve metrik değerlerini kaydedin.
  5. Tüm dizilerin başarıyla değerlendirildiğini ve hiçbir takip-sonuç dosyasının eksik olmadığını doğrulamak için değerlendirme günlüklerini inceleyin.
    NOT: Bu çalışmada, birincil TrackEval özet dosyası şurada saklanmıştır: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Bu bölümün beklenen sonucu, raporlanan Sonuçları ve sonraki doğrulamayı destekleyen dizi başına metrik dosyalarıyla birlikte eksiksiz bir değerlendirme özet tablosudur.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu bölüm, değerlendirilen spor çoklu nesne izleme deneylerinden elde edilen nicel ve nitel sonuçları rapor etmektedir. Sonuçlar; izleme doğruluğu, kimlik koruma, ilişkilendirme kalitesi ve test edilen veri seti ayarları altındaki dayanıklılığa odaklanmaktadır. Performans iddiaları, Protokol ve Uygulama Kurulumunda açıklanan değerlendirilen yöntemler, veri setleri, dedektör çıktıları ve değerlendirme araç kiti yapılandırması ile sınırlandırılmıştır.

Deneysel düzenek ve değerlendirme tasarımı

Veri seti ve ön işleme:

Dedektör hazırlığı, takip çıkarımı ve kantitatif değerlendirme için birincil karşılaştırma ölçütü olarak SportsMOT kullanılmıştır. Veri seti; futbol, basketbol ve voleybol senaryolarını kapsayan 240 video dizisi ve 150.000'den fazla görüntü karesi içermektedir (Şekil 5). Resmi değerlendirmede, temel SportsMOT sonuçları; doğrulama seti ile birlikte, Protokol'de açıklanan dedektör çıktıları, takip konfigürasyonu ve TrackEval ayarları kullanılarak hesaplanmıştır. Veri setleri arasında doğrudan metrik düzeyinde karşılaştırmalar yapmak yerine, farklı veri seti türleri arasındaki performans aktarımını incelemek amacıyla TeamTrack, SoccerNet Tracking, MOT17 ve MOT20 üzerinde veri seti arası değerlendirme gerçekleştirilmiştir.

figure-results-1
Şekil 5. Değerlendirme için kullanılan temsili veri setleri. Örnek kareler, deneysel değerlendirme için kullanılan temsili futbol, basketbol ve voleybol sekanslarını göstermektedir. Şekil, değerlendirilen veri setleri arasındaki kamera bakış açısı, oyuncu yoğunluğu ve sahne karmaşıklığına dair varyasyonları vurgulamaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

SportsMOT verileri, resmi veri seti yapısına göre düzenlendi ve Protokol'de açıklanan dedektör eğitim formatına dönüştürüldü. Dönüştürülen SportsMOT eğitim ve doğrulama verileri 90 sekans, 55.544 kare ve 608.152 etiketli nesne içeriyordu. Eğitim bölümü dedektör hazırlama ve parametre ayarı için kullanılırken, doğrulama bölümü bu çalışmada raporlanan resmi takip değerlendirmesi için kullanıldı. Tüm giriş kareleri, Protokol'de ve Malzemeler Tablosu'nda belirtilen dedektör konfigürasyonuna göre yeniden boyutlandırıldı. Raporlanan farklılıkların, veri işlemedeki farklılıklardan ziyade temel olarak takip ilişkilendirme strateesini yansıtması için dedektör hazırlama, anlamsal özellik çıkarımı, takip çıkarımı ve TrackEval değerlendirmesi sırasında aynı ön işleme prosedürü uygulandı.

Değerlendirme göstergeleri:

Takip performansı, Materyal Tablosunda listelenen değerlendirme araç kiti ile uygulanan MOTChallenge uyumlu bir değerlendirme protokolü kullanılarak değerlendirilmiştir. Bildirilen metrikler, spor MOT performansının üç yönünü tanımlar: genel takip doğruluğu, kimlik koruma ve tespit-ilişkilendirme kalitesi. Birincil değerlendirme metrikleri olarak MOTA, IDF1 ve HOTA kullanılmıştır44,45. MOTA; yanlış pozitifleri, yanlış negatifleri ve kimlik değişimlerini genel bir takip doğruluğu puanında özetler. IDF1, öngörülen yörüngeler ile gerçek kimlikler arasındaki tutarlılığı ölçer. HOTA, tespit doğruluğu ile ilişkilendirme doğruluğunu ortaklaşa değerlendirir ve bu nedenle hedef yerelleştirme ile yörünge ilişkilendirmesi arasındaki dengeyi tanımlar. DetA ve AssA tamamlayıcı metrikler olarak raporlanmıştır. Yanlış tespitler, kaçırılan tespitler ve kimlik değişiklikleri ile ilgili hata kaynaklarını tanımlamak için FP'ler, FN'ler ve Kimlik Değişimleri (ID'ler) kullanılmıştır. SportsMOT üzerindeki yöntemler arası karşılaştırmalar için, dedektör varyasyonunun ve değerlendirme ayarı farklılıklarının etkisini azaltmak amacıyla aynı dedektör çıktıları ve değerlendirme araç kiti yapılandırması kullanılmıştır. Veri setleri arası karşılaştırmalar için metrik değerleri, farklı veri setleri arasında mutlak performans üstünlüğünün bir kanıtı olarak değil, veri seti içi değerlendirme sonuçları olarak yorumlanmıştır.

Deneysel ortam ve parametre yapılandırması:

Deneyler, Materyaller Tablosu'nda listelenen donanım ve yazılım kaynakları kullanılarak gerçekleştirilmiştir. Detektör hazırlama, izleme çıkarımı ve performans değerlendirme süreçlerinde tutarlılığı sağlamak amacıyla, birincil SportsMOT deneyleri boyunca aynı hesaplama ortamı, detektör çerçevesi, detektör çıktıları ve değerlendirme araç kiti kullanılmıştır. Materyaller Tablosu'nda listelenen detektör çerçevesi; 16'lık bir grup boyutu (batch size), 0,01'lik bir başlangıç öğrenme oranı ve 80 eğitim epoku kullanılarak eğitilmiştir. Forma semantik çıkarım modülünde, renk kümelemesi için K = 3 ile K-means kullanılmış ve OCR dalında 128 × 64 piksel giriş boyutuna sahip hafif bir evrişimli yinelemeli sinir ağı kullanılmıştır. OCR dalı, Materyaller Tablosu'nda listelenen adaptif optimize edici ile 1 × 10⁻3 öğrenme oranı, 1 × 10⁻5 ağırlık azalması (weight decay), 64'lük bir grup boyutu ve 40 eğitim epoku kullanılarak optimize edilmiştir. Semantik özellik çıkarım modülünün eğitimi sırasında ek bir öğrenme oranı çizelgelemesi kullanılmamıştır. OCR-kayıp ağırlıklandırma katsayısı (γ), kullanıcı tanımlı bir hiperparametre olarak ele alınmış ve doğrulama seti performansına göre seçilmiştir. Güven düzeyi tabakalandırmasında, τ₁ ve τ₂'nin çıkarımdan önce manuel olarak ön tanımlanması yerine, her karenin tespit-güven dağılımından hesaplandığı adaptif K-means bölümlendirmesi kullanılmıştır.

Sporlar ve senaryo karmaşıklığı genelinde performans takibi

Farklı spor ve sahne koşulları altında kantitatif performans:

İzleme performansı iki gruplandırma faktörü altında değerlendirilmiştir: spor kategorisi ve sahne karmaşıklığı. Spor kategorisi analizi futbol, basketbol ve voleybol sekanslarını içermiştir. Sahne karmaşıklığı analizi, değerlendirilen sekanslar boyunca aynı gruplandırma kriterleri kullanılarak oklüzyon seviyesi, hareket hızı ve hedef yoğunluğunu dikkate almıştır. Rapor edilen metrikler, Protokol Bölüm 7'de açıklanan değerlendirme protokolünü takip etmiştir. 

Şekil 6, farklı spor kategorileri ve sahne karmaşıklığı koşulları altındaki kantitatif takip sonuçlarını özetlemektedir. Şekil 6A, futbol, basketbol ve voleybol sekansları genelindeki MOTA ve DetA değerlerini bildirmektedir. Şekil 6B, farklı oklüzyon seviyeleri, hareket hızı ve hedef yoğunluğu altındaki MOTA varyasyonunu bildirmektedir. Şekil 6C, her bir sahne karmaşıklığı boyutu için üst üste yığılmış FP ve FN sayılarını bildirmektedir.

figure-results-2
Şekil 6. Spor kategorileri ve sahne koşullarına göre takip performansı. (A) Futbol, basketbol, voleybol ve genel ortalama için Çoklu Nesne Takip Doğruluğu (MOTA) ve Tespit Doğruluğu (DetA). (B) Farklı oklüzyon seviyeleri, oyuncu yoğunluğu ve hareket karmaşıklığına sahip temsili sahne koşullarına göre MOTA. (C) Değerlendirilen sahne koşullarına göre Yanlış Pozitif (FP) ve Yanlış Negatif (FN) sayıları. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Üç spor kategorisinde JerseyTrack, ortalama %88.9 MOTA ve ortalama %80.2 DetA elde etmiştir. Spor kategorileri arasındaki MOTA farkı 1.3 yüzde puanı olup, en yüksek MOTA voleybol sekanslarında (%89.2), en düşük MOTA ise basketbol sekanslarında (%87.9) gözlemlenmiştir. Basketbol sekansları için gözlemlenen daha düşük MOTA değeri, değerlendirilen sekanslardaki yakın mesafe etkileşimlerinin ve yoğun oklüzyonun daha sık gerçekleşmesiyle tutarlıdır. Hafif oklüzyon, düşük hareket hızı ve seyrek hedef dağılımı gibi daha az karmaşık sahne koşulları altında MOTA sırasıyla %91.8, %93.1 ve %93.8 değerlerine ulaşmıştır. Daha karmaşık sahne koşulları altında ise MOTA; ağır oklüzyonda %84.9'a, yüksek hızlı harekette %83.6'ya ve yoğun hedef dağılımında %83.1'e düşmüştür. Bu sonuçlar, takip performansının sahne karmaşıklığı arttıkça azaldığını, ancak değerlendirilen spor senaryoları genelinde bildirilen aralıkta kaldığını göstermektedir.

Temsili spor senaryoları genelinde tutarlılığın izlenmesi:

Şekil 7, JerseyTrack'in üç zorlu spor senaryosu altındaki zamansal tutarlılığını örnekleyen temsilci takip örneklerini sunmaktadır: yoğun oyuncu etkileşimleri, uzun süreli kısmi oklüzyon ve hızlı yön değişimleri. Bu temsilci diziler boyunca takipçi, sık gerçekleşen sporcu örtüşmelerine ve dinamik hareketlere rağmen tutarlı yörünge kimliklerini korumuştur. Kimlik parçalanması öncelikle şiddetli oklüzyon sırasında veya forma semantiği geçici olarak kullanılamaz hale geldiğinde gözlemlenmiştir; ancak güven odaklı ilişkilendirme stratejisi, güvenilir tespitlerin yeniden ortaya çıkmasının ardından yörüngenin geri kazanılmasını sağlamıştır. Bu temsilci örnekler, değerlendirilen spor takibi koşulları altında stabil kimlik korumayı göstererek Şekil 6'da sunulan nicel sonuçları nitel olarak desteklemektedir.

figure-results-3
Şekil 7. JerseyTrack tarafından üretilen temsili takip sonuçları. Basketbol, futbol ve voleybol sekanslarından alınan ardışık kareler, takip sırasında sporcu kimliklerinin ve yörüngelerinin korunduğunu göstermektedir. Renkli sınırlayıcı kutular, ardışık video kareleri boyunca korunan takip edilen kimlikleri temsil eder. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Kimlik koruma için ablasyon sonuçları:

Güven odaklı ilişkilendirme stratejisinin ve forma semantik füzyon modülünün kimlik korumaya olan katkılarını incelemek için bir ablasyon analizi gerçekleştirilmiştir. Dört model varyantı karşılaştırılmıştır: güven odaklı ilişkilendirme veya forma semantik füzyon içermeyen temel model V0; yalnızca güven odaklı ilişkilendirmeyi kullanan varyant V1; yalnızca forma semantik füzyonu kullanan varyant V2 ve her iki bileşeni de içeren tam JerseyTrack konfigürasyonu V3. Değerlendirme; IDs, IDF1, Kimlik Hassasiyeti (IDP) ve Kimlik Duyarlılığı (IDR) dahil olmak üzere kimlikle ilgili metriklere odaklanmıştır. Temsili kimlik koruma örüntüleri Şekil 8'de gösterilmiştir.

figure-results-4
Şekil 8. Güven odaklı forma semantik ilişkilendirmesinin ablasyon analizi. (A) Değerlendirilen model varyantları için Toplam Kimlik Değişimleri (IDs) ve Kimlik F1 Skoru (IDF1). (B) Temsili zorlayıcı izleme senaryoları altında tam model (V3) ile temel yapılandırmanın (V0) IDs karşılaştırması. (C) Farklı izleme senaryoları genelinde tam modelin IDF1, Kimlik Hassasiyeti (IDP) ve Kimlik Duyarlılığı (IDR) değerleri. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Genel SportsMOT doğrulama ortamında, dört model varyantı arasında en düşük ID sayısı ve en yüksek IDF1 değeri tam V3 konfigürasyonu tarafından elde edilmiştir. V3, V0'dan 477 daha az kimlik değişimi anlamına gelen 2.768 ID kaydetmiş ve V0'a göre 7,1 yüzdelik puan artış anlamına gelen %74,3'lük bir IDF1 değerine ulaşmıştır. Bu sonuçlar, değerlendirilen spor takibi koşulları altında iki modülün kimlik korumasına ortaklaşa katkıda bulunduğunu göstermektedir. Tek modüllü varyantların tam konfigürasyonla karşılaştırılması, iki modülün farklı takip hatası kaynaklarını etkilediğini daha net bir şekilde ortaya koymuştur. Güven odaklı ilişkilendirme stratejisi, istikrarsız tespit güveni ve lokalizasyon belirsizliği ile ilişkili eşleştirme hatalarını azaltırken; forma semantik füzyon modülü, yalnızca hareket bilgisinin yetersiz kaldığı durumlarda ek kimlik bilgisi sağlamıştır. Tam V3 konfigürasyonu, tek modüllü varyantların her birinden daha iyi kimlik performansına ulaşmış ve bu durum, iki modülün birbirini tekrarlayan değil, birbirini tamamlayıcı katkılar sunduğunu göstermiştir.

Senaryo düzeyindeki sonuçlar, kimlik korumanın daha zor olduğu koşullar altında daha büyük farklar olduğunu göstermiştir. Uzun süreli oklüzyon sırasında, V0 için 482 ID'ye karşılık V3 215 ID kaydetmiştir. 6–10 oyuncu içeren yoğun aynı takım senaryolarında, V0 için 615 ID'ye karşılık V3 328 ID kaydetmiştir. Yüksek hızlı yön değişimleri altında, V0 için 960 ID'ye karşılık V3 482 ID kaydetmiştir. Bu azalmalar, oklüzyon ve yoğun etkileşimler sırasında semantik ipuçlarının hedeflenen kullanımıyla ve hızlı hareket sırasında dalgalanan tespit güveni altında güven odaklı ilişkilendirme ile tutarlıdır. Şekil 8C'de gösterilen IDP ve IDR eğilimleri, ID'lerdeki azalmanın kimlik kesinliğinde veya kimlik geri çağırmasında önemli bir azalma ile birlikte gerçekleşmediğini göstermektedir. Tam konfigürasyon, değerlendirilen zorlu senaryolar boyunca IDF1 değerlerini %71'in üzerinde tutmuş; en düşük değerler yoğun aynı takım etkileşimleri ve yüksek hızlı yön değişimleri altında gözlemlenmiştir. Bu sonuçlar, değerlendirilen koşullar altında iyileştirilmiş kimlik tutarlılığını gösterirken, yoğun etkileşimleri ve hızlı hareketi performans kaybının temel kalan kaynakları olarak tanımlamaktadır.

Veri seti arası değerlendirme sonuçları:

SportsMOT üzerinde gözlemlenen takip davranışının farklı veri kümesi koşulları altında korunup korunmadığını incelemek için veri kümeleri arası değerlendirme yapılmıştır. Değerlendirme, spora özgü iki veri kümesi olan SoccerNet Tracking ve TeamTrack ile MOT17 ve MOT20 olmak üzere iki genel MOT veri kümesini içermiştir. Bu deneyin amacı, farklı veri kümesi türleri arasındaki performans aktarımını incelemekti. Notasyon protokolleri, sahne kompozisyonu, kamera bakış açıları ve hedef kategorileri farklı olduğundan, sonuçlar veri kümeleri arasında doğrudan metrik düzeyinde bir üstünlük iddiası için kullanılmamıştır.

Tablo 1, veri kümeleri arası değerlendirme sonuçlarını özetlemektedir. Spora özgü veri kümelerinde JerseyTrack, ana SportsMOT doğrulama kurulumuna kıyasla nispeten istikrarlı MOTA ve IDF1 değerleri sergilemiştir. Bu eğilim; tekrarlanan üniformalar, yoğun sporcu etkileşimleri ve sık kapanmalar dahil olmak üzere takip sahneleri takım sporu görsel özelliklerini koruduğunda, güven odaklı ilişkilendirme stratejisinin ve forma ile ilgili semantik ipuçlarının etkili kalmaya devam ettiğini göstermektedir. Genel MOT veri kümelerinde yöntem, rekabetçi MOTA ve DetA değerlerini korurken, IDF1 değerleri spora özgü veri kümeleri için gözlemlenenden daha düşük çıkmıştır. Bu durum, semantik füzyon modülü tarafından kullanılan forma rengi ve oyuncu numarası ipuçlarının MOT17 ve MOT20'de bulunmamasıyla tutarlıdır. Bu koşullar altında, güven odaklı ilişkilendirme bileşeni uygulanabilir kalırken, semantik dalı takım sporu videolarına kıyasla daha az kimlik odaklı bilgi sağlamıştır. Genel olarak bu sonuçlar, JerseyTrack'in spora özgü görsel semantikler içeren veri kümelerine, genel yaya takip veri kümelerinden daha etkili bir şekilde aktarıldığını göstermektedir. Dolayısıyla, veri kümeleri arası değerlendirme, yöntemin spor odaklı bir takipçi olarak planlanan uygulamasını desteklerken, açık forma semantiklerinin eksikliğinin spor dışı MOT veri kümeleri için sınırlayıcı bir faktör olduğunu da ortaya koymaktadır.

Veri KümesiMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86.871.377.932.1
TeamTrack86.270.777.332.8
MOT1784.769.576.133.9
MOT2084.168.975.333.2

Tablo 1: Veri seti arası değerlendirme sonuçları. JerseyTrack'in dört halka açık kıyaslama veri setinde değerlendirilen takip performansı. Çoklu Nesne Takip Doğruluğu (MOTA), Kimlik F1 Skoru (IDF1), Algılama Doğruluğu (DetA) ve Saniye Başına Kare (FPS) olarak ölçülen işlem hızı raporlanmıştır. MOTA, IDF1, DetA ve FPS için daha yüksek değerler daha iyi performansa işaret eder.

Kontrollü pertürbasyon koşulları altında dayanıklılık

Spor videolarında karşılaşılan yaygın görsel ve tespit kalitesi bozulmaları altında JerseyTrack'in stabilitesini incelemek için kontrollü perturbasyon deneyleri gerçekleştirilmiştir. Değerlendirilen perturbasyonlar üç kategoriye ayrılmıştır: semantik öznitelik perturbasyonu, tespit kutusu perturbasyonu ve çevresel perturbasyon. Semantik öznitelik perturbasyonları; oyuncu numarası oklüzyonu, görüntü bulanıklığı, çözünürlük düşüşü ve benzer forma renklerini içermektedir. Tespit kutusu perturbasyonları; sınırlayıcı kutu kayması, tespit güven puanı dalgalanması ve yanlış tespit kutularını içermektedir. Çevresel perturbasyonlar ise yağmur benzeri gürültü, sis benzeri bozulma, güçlü aydınlatma ve gölge girişimlerini içermektedir. Şekil 9, bu perturbasyon koşulları altındaki izleme performansını özetlemektedir. Semantik öznitelik perturbasyonu altında, oyuncu numarası görünürlüğü ve kırpma kalitesi kötüleştikçe izleme performansı azalmıştır. Oyuncu numarası bölgesinin %40'ı oklüzyona uğradığında, perturbasyonsuz duruma kıyasla MOTA 3,2 yüzde puanı ve IDF1 5,3 yüzde puanı azalırken, semantik çıkarım doğruluğu %86,7 seviyesinde kalmıştır. Bu sonuçlar, bir semantik ipucu daha az güvenilir hale geldiğinde, forma rengi ve oyuncu numarası ipuçlarının birbirini tamamlayıcı bilgiler sağladığını göstermektedir. Tespit kutusu perturbasyonu altında, yöntem ani bir başarısızlık yerine orta düzeyde bir performans düşüşü sergilemiştir. Tespit kutuları ±10 piksel kaydırıldığında ve güven puanları Gauss gürültüsü ile perturb edildiğinde, MOTA'daki düşüş 3 yüzde puanının altında kalmış ve ID artışı %16 sınırları içinde kalmıştır. Bu eğilim, orta ve düşük güvenli tespitlerin, yüksek güvenli tespitlere uygulanan stratejinin aksine ek ilişkilendirme kısıtlamaları kullanılarak işlendiği güven odaklı ilişkilendirme stratejisi ile tutarlıdır.

figure-results-5
Şekil 9. Kontrollü pertürbasyonlar altında dayanıklılık değerlendirmesi. (A) Artan forma numarası oklüzyonu ile Çoklu Nesne İzleme Doğruluğu (MOTA), Kimlik F1 Skoru (IDF1) ve Kimlik Değişimlerindeki (IDs) değişiklikler. (B) Temsili girişim koşulları altında performans kaybı. (C) Farklı girişim türleri altında IDs artışı. (D) Değerlendirilen pertürbasyon koşulları altında forma semantik çıkarım doğruluğu. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Çevresel perturbasyonlar altında, değerlendirilen koşullarda birincil takip metriklerindeki düşüşler %5'in altında kalmış ve anlamsal çıkarım doğruluğu %87,2 olarak gerçekleşmiştir. HSV tabanlı renk tanımlayıcıların kullanımı, aydınlatma değişikliklerine karşı duyarlılığı azaltırken, OCR kolu bulanık veya bozulmuş görüntü kırpıntılarının bir alt kümesi için kullanılabilir oyuncu numarası bilgilerini korumuştur. Bu sonuçlar, güvenilirliği forma görünürlüğüne ve kırpıntı kalitesine bağlı kalmaya devam etse de, anlamsal modülün değerlendirilen perturbasyon koşulları altında kullanılabilir kaldığını göstermektedir. Genel olarak, kontrollü perturbasyon deneyleri, JerseyTrack'in değerlendirilen anlamsal, tespit kalitesi ve çevresel perturbasyonlar altında ölçülebilir takip performansını koruduğunu göstermiştir. Bu bulgular, test edilen perturbasyon aralığı dahilinde yorumlanmalıdır. Görüş alanı dışı sistematik yeniden tanımlama, şiddetli arka plan karmaşası ve uzun süreli tam oklüzyon bu deneyde ayrı olarak değerlendirilmemiş olup Tartışma bölümünde kısıtlamalar olarak ele alınmıştır.

Modül katkısı ve özellik ayrım analizi

İki önerilen bileşenin kimlikle ilgili takip performansını nasıl etkilediğini incelemek için modül katkısı ve özellik ayrımı daha detaylı analiz edilmiştir. Modül katkısı analizinde, ablasyon analizinde tanımlanan dört model varyantı kullanılmış; özellik ayrımı analizinde ise geleneksel Re-ID özellikleri, yalnızca renk özellikleri, yalnızca oyuncu numarası özellikleri ve birleştirilmiş forma semantik özellikleri karşılaştırılmıştır. Özellik ayrılabilirliğini tanımlamak için sınıflar arası/sınıf içi mesafe oranı kullanılmış olup, daha yüksek değerler aynı kimlik içindeki varyasyona kıyasla farklı kimlikler arasında daha fazla ayrım olduğunu göstermiştir. Tablo 2, modül katkısı analizini özetlemektedir. Genel değerlendirmede, güven odaklı ilişkilendirme stratejisinin tahmini katkısı %41,7, forma semantik birleştirmesinin tahmini katkısı %47,6 olmuş ve kalan %10,7 iki bileşenin birlikte kullanımına bağlanmıştır. Bu değerler, her iki bileşenin de gözlemlenen iyileşmeye katkıda bulunduğunu, tam konfigürasyonun ise tek bir bileşenden ziyade her ikisinin birlikte kullanımından fayda sağladığını göstermektedir. Katkı örüntüsü sahne türlerine göre farklılık göstermiştir. Yoğun tıkanma (occlusion) durumunda, forma semantik birleştirmenin tahmini katkısı %69,4'e yükselmiştir; bu durum, sporcular kısmen veya geçici olarak tıkandığında hareket ipuçlarının güvenilirliğinin azalmasıyla tutarlıdır. Yüksek hızlı hareket altında, güven odaklı ilişkilendirmenin tahmini katkısı %44,3'e, birleşik kazanç ise %20,6'ya ulaşmıştır; bu da hızlı hareket veya yerelleştirme belirsizliği nedeniyle tespit güveni dalgalandığında, güven düzeyi bölümlendirmenin daha anlamlı hale geldiğini göstermektedir.

Model varyantıTest senaryosuMOTA↑IDF1↑IDs↓Modül katkısıSinerjik kazanç
V0 (Temel Hat)Genel sahne83.567.23245
Şiddetli tıkanıklığın olduğu sahneler77.861.53862
Yüksek hızlı hareket sahnesi77.162.33689
V1 (Güven odaklı ilişkilendirme)Genel sahne86.370.9289341.7
Şiddetli tıkanıklığın olduğu sahneler80.965.9341529.8
Yüksek hızlı hareket sahnesi81.467.9302444.3
V2 (Forma semantik ilişkilendirme)Genel sahne85.271.8293747.6
Şiddetli tıkanıklığın olduğu sahneler82.772.8275369.4
Yüksek hızlı hareket sahnesi80.166.8315735.1
V3 (Tam JerseyTrack)Genel sahne88.974.3276810.7
Şiddetli tıkanıklığın olduğu sahneler84.975.626890.8
Yüksek hızlı hareket sahnesi83.671.5284220.6

Tablo 2: Modül katkılarının ablasyon analizi. Genel, şiddetli kapanma ve yüksek hızlı hareket senaryoları altında farklı JerseyTrack model varyantlarının performans karşılaştırması. Çoklu Nesne İzleme Doğruluğu (MOTA), Kimlik F1 Skoru (IDF1) ve Kimlik Değişimi (IDs) sayısı, tahmin edilen modül katkısı ve sinerjik kazanç ile birlikte raporlanmıştır. MOTA, IDF1, modül katkısı ve sinerjik kazanç için daha yüksek değerler daha iyi performansa işaret ederken, IDs için daha düşük değerler daha iyi performansı göstermektedir.

Tablo 3, özellik ayırdetme analizini özetlemektedir. Birleştirilmiş forma semantik özelliği, geleneksel Re-ID özelliklerinin 1,82'lik değerine kıyasla 5,63'lük bir sınıflar arası/sınıf içi mesafe oranı elde etmiş olup, bu durum mesafe oranı ölçümünde %209,3'lük bir bağıl iyileşmeye karşılık gelmektedir. Sadece renk ve sadece oyuncu numarasına dayalı özellikler de geleneksel Re-ID özelliklerine kıyasla özellik ayrıştırılabilirliğini artırmıştır; ancak her bir bireysel ipucu, benzer takım renkleri, oyuncu numarası kapanması, hareket bulanıklığı ve okunamaz forma bölgeleri dahil olmak üzere belirli başarısızlık durumlarına karşı hassas kalmıştır. Değerlendirilen özellik temsilleri arasında, birleştirilmiş semantik temsil en yüksek özellik ayrıştırılabilirliğini sağlamış ve ablasyon analizinde gözlemlenen en yüksek IDF1 ile en düşük ID sayısına karşılık gelmiştir. Bu bulgular, sporcuların benzer görünümlere sahip olduğu ve tek başına hareket bilgisinin yetersiz kaldığı spor MOT uygulamalarında, formaya özgü semantik ipuçlarının tamamlayıcı kimlik bilgisi olarak kullanımını desteklemektedir. Bu gözlemler, değerlendirilen SportsMOT ortamı ile sınırlıdır ve forma semantiğinin her spor videosundaki tüm kimlik belirsizliklerini giderdiğine dair bir kanıt olarak yorumlanmamalıdır.

Özellik tipiSınıflar Arası/Sınıf İçi Mesafe OranıGöreli İyileşme (%)IDF1↑Kimlikler↓
Geleneksel Yeniden Tanımlama (Re-ID) özellikleri1.8265.73482
Takım rengi özellikleri3.1774.269.83125
Oyuncu sayısı özellikleri3.4991.870.53018
Kaynaştırılmış jarse semantik özellikleri5.63209.374.32768

Tablo 3: Farklı öznitelik temsillerinin ayırt etme analizi.Geleneksel yeniden tanımlama (Re-ID) öznitelikleri, forma rengi öznitelikleri, oyuncu numarası öznitelikleri ve birleştirilmiş semantik öznitelikler kullanılarak öznitelik ayırt etmenin karşılaştırılması. Sınıflar arası/sınıf içi mesafe oranı, öznitelik ayırt etmedeki göreceli iyileşme, Kimlik F1 Skoru (IDF1) ve Kimlik Değişimi (IDs) sayısı rapor edilmiştir. Mesafe oranı, göreceli iyileşme ve IDF1 için daha yüksek değerler daha iyi performansı, IDs için ise daha düşük değerler daha iyi performansı göstermektedir.

Mevcut MOT yöntemleri ile kıyaslama karşılaştırması

JerseyTrack'i temsilci MOT yöntemleriyle aynı SportsMOT doğrulama ayarı altında karşılaştırmak için bir kıyaslama analizi gerçekleştirilmiştir. Karşılaştırılan yöntemler arasında QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT ve MOTR yer almıştır. Karşılaştırmanın detektör varyasyonundan ziyade takip ilişkilendirme performansına odaklanması amacıyla tüm yöntemler, Materyaller Tablosunda listelenen detektör çatısı tarafından oluşturulan aynı detektör çıktılarını kullanmıştır. Değerlendirmede, Protokol Bölüm 7'de tanımlanan metrikler kullanılmıştır. Birincil değerlendirme metrikleri MOTA, HOTA ve IDF1'den oluşmuştur. Yardımcı metrikler ise DetA, AssA, FPs, FNs ve IDs'yi içermiştir. Tablo 4, SportsMOT doğrulama seti üzerindeki nicel karşılaştırmayı özetlemekte ve Şekil 10, değerlendirilen spor sahneleri genelinde takip doğruluğu, çıkarım hızı ve HOTA dağılımının görsel bir karşılaştırmasını sunmaktadır. JerseyTrack, karşılaştırılan yöntemler arasında %88,9 ile en yüksek MOTA değerine ulaşmıştır. Bu değer, Deep OC-SORT'un değerinden (%87,8) 1,1 yüzde puan, ByteTrack'in değerinden (%86,4) ise 2,5 yüzde puan daha yüksektir. Dolayısıyla JerseyTrack, değerlendirilen SportsMOT doğrulama ayarı altında, karşılaştırılan yöntemler arasında en yüksek genel takip doğruluğunu elde etmiştir. HOTA için JerseyTrack %69,9 değerine ulaşırken; Deep OC-SORT %64,4 ve ByteTrack %62,8 değerine ulaşmıştır. Bu farklar sırasıyla 5,5 ve 7,1 yüzde puanlık iyileşmelere karşılık gelmekte olup, aynı değerlendirme ayarı altında deteksiyon ve ilişkilendirme performansı arasında daha yüksek bir denge olduğunu göstermektedir.

YöntemMOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓IDs↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
ByteTrack86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
MOTR82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

Tablo 4: JerseyTrack'in ve temsili çoklu nesne izleme yöntemlerinin SportsMOT doğrulama bölümündeki performans karşılaştırması.JerseyTrack'in, SportsMOT doğrulama veri kümesi üzerinde temsili çoklu nesne izleme (MOT) yöntemleri ile karşılaştırması. Bildirilen metrikler arasında Çoklu Nesne İzleme Doğruluğu (MOTA), Yüksek Dereceli İzleme Doğruluğu (HOTA), Kimlik F1 Skoru (IDF1), Algılama Doğruluğu (DetA), İlişkilendirme Doğruluğu (AssA), Yanlış Pozitifler (FP), Yanlış Negatifler (FN) ve Kimlik Değişimleri (IDs) sayısı yer almaktadır. MOTA, HOTA, IDF1, DetA ve AssA için yüksek değerler daha iyi performansı, FP, FN ve IDs için ise düşük değerler daha iyi performansı göstermektedir.

figure-results-6
Şekil 10. Temsili çoklu nesne izleme yöntemleriyle performans karşılaştırması. (A) SportsMOT veri kümesinde değerlendirilen JerseyTrack ve temsili çoklu nesne izleme yöntemleri için Çoklu Nesne İzleme Doğruluğu (MOTA) ve Saniye Başına Kare Sayısının (FPS) karşılaştırması. (B) Değerlendirilen izleme yöntemleri genelinde Yüksek Dereceli İzleme Doğruluğunun (HOTA) dağılımı. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Kimlik koruma açısından JerseyTrack, Deep OC-SORT'un %69,9'una ve ByteTrack'in %67,7'sine kıyasla %74,3'lük bir IDF1 değerine ulaşmıştır. JerseyTrack ayrıca, Deep OC-SORT tarafından kaydedilen 3.211 ID'den ve ByteTrack tarafından kaydedilen 4.192 ID'den daha az olan 2.768 ID kaydetmiştir. Bu gözlemler, tam JerseyTrack konfigürasyonunun temel model varyantlarına kıyasla kimlik değişimini azalttığı Şekil 8  ve Tablo 2'de sunulan ablasyon sonuçlarıyla tutarlıdır. Tespit ve ilişkilendirme kalitesi için JerseyTrack %80,2 DetA ve %54,3 AssA elde etmiştir. Deep OC-SORT ile karşılaştırıldığında JerseyTrack, DetA'yı 2,0 yüzdelik puan ve AssA'yı 2,2 yüzdelik puan artırmıştır. JerseyTrack ayrıca, Tablo 4'te rapor edilen karşılaştırılan diğer yöntemlerden daha az FP ve FN üreterek 21.953 FP ve 67.160 FN kaydetmiştir. Genel olarak, karşılaştırma kıyaslaması, SportsMOT doğrulama ayarları altında değerlendirilen yöntemler arasında JerseyTrack'in temel takip metrikleri için en yüksek değerlere ulaştığını göstermiştir. Bu sonuçlar, güven odaklı ilişkilendirme ve forma semantik füzyonu kullanılarak elde edilen kimlik koruma ve ilişkilendirme stabilitesindeki gözlemlenen iyileştirmelerle tutarlıdır. Karşılaştırma, bu çalışmada kullanılan ortak dedektör çıktıları ve SportsMOT doğrulama konfigürasyonu ile sınırlıdır.

Parametre duyarlılık sonuçları

SportsMOT doğrulama ayarları altında, temel uygulama parametrelerinin izleme performansını nasıl etkilediğini incelemek için parametre duyarlılık analizi yapılmıştır. Üç parametre değerlendirilmiştir: OCR kayıp ağırlıklandırma katsayısı (γ), güven düzeyi hiyerarşik küme sayısı (K) ve OCR ağı öğrenme hızı (η). Tablo 5, farklı parametre ayarları altında elde edilen MOTA, IDF1, HOTA ve ID değerlerini özetlemektedir.

ParametreDeğerMOTA↑IDF1↑HOTA↑IDs↓
OCR kayıp ağırlığı (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (optimal)88.974.369.92,768
188.273.869.32,792
Güven kümeleri sayısı (K)286.772.168.52,876
3 (optimal)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
OCR öğrenme oranı (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (optimal)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

Tablo 5: Parametre duyarlılık analizi. JerseyTrack için farklı parametre ayarları kullanılarak elde edilen izleme performansı. Optik Karakter Tanıma (OCR) kayıp ağırlıklandırma katsayısının (γ), güven kümeleri sayısının (K) ve OCR öğrenme hızının (η) farklı değerleri için Çoklu Nesne İzleme Doğruluğu (MOTA), Kimlik F1 Skoru (IDF1), Yüksek Dereceli İzleme Doğruluğu (HOTA) ve Kimlik Değişimi (IDs) sayısı rapor edilmiştir. Optimal olarak belirlenen parametre değerleri, rapor edilen deneylerde kullanılan ayarlara karşılık gelmektedir. MOTA, IDF1 ve HOTA için yüksek değerler daha iyi performansa işaret ederken, IDs için düşük değerler daha iyi performansa işaret eder.

OCR-kayıp ağırlıklandırma katsayısı (γ) için en iyi değerlendirilen performans γ = 0.8 değerinde elde edilmiştir. Bu ayar altında JerseyTrack %88.9 MOTA, %74.3 IDF1, %69.9 HOTA ve 2.768 ID değerine ulaşmıştır. γ değeri 0.2'ye düşürüldüğünde MOTA, IDF1 ve HOTA sırasıyla %84.7, %69.4 ve %66.2'ye gerilemiş, buna karşın ID sayısı 2.944'e yükselmiştir. γ değeri 1.0'a çıkarıldığında ise performans metrikleri γ = 0.8'e kıyasla hafifçe azalarak %88.2 MOTA, %73.8 IDF1, %69.3 HOTA ve 2.792 ID şeklinde gerçekleşmiştir. Bu sonuçlar, yetersiz OCR denetiminin oyuncu numarası ayrımını azalttığını, OCR-kayıp ağırlıklandırmasının değerlendirilen optimum değerin üzerine çıkarılmasının ise test edilen koşullar altında takip performansını artırmadığını göstermektedir.

Güven düzeyi hiyerarşik küme sayısı (K) için, en iyi değerlendirilen performans K = 3 değerinde elde edilmiştir. Bu ayar, yöntemde açıklanan yüksek, orta ve düşük güvenilirlikli ilişkilendirme stratejisine karşılık gelmektedir. K = 2 olduğunda, güven bölümlemesi daha az ayrıntılı hale gelmiş ve MOTA, IDF1 ile HOTA değerleri sırasıyla %86,7, %72,1 ve %68,5'e düşmüştür. K değeri 4 veya 5'e yükseltildiğinde, performans K = 3'e kıyasla yine azalmış; bu durum, aşırı bölümlemenin tespitleri gereğinden fazla dar güven gruplarına ayırdığını ve ilişkilendirme stratejisinin kararlılığını düşürdüğünü göstermiştir. Bu sonuçlar, değerlendirilen JerseyTrack konfigürasyonunda üç güven düzeyinin kullanılmasını desteklemektedir.

OCR ağının öğrenme hızı (η) için en iyi değerlendirilen performans η = 1 × 10-3 değerinde elde edilmiştir. 1 × 10-4 şeklindeki daha düşük bir öğrenme hızında MOTA, IDF1 ve HOTA sırasıyla %85,9, %70,8 ve %67,3'e düşerken, ID sayısı 2.934'e yükselmiştir. 1 × 10-2 şeklindeki daha yüksek bir öğrenme hızında ise MOTA, IDF1 ve HOTA sırasıyla %86,5, %71,6 ve %68,7'ye düşmüş, ID sayısı ise 2.889'a yükselmiştir. Bu sonuçlar, OCR kolunun öğrenme hızı seçimine karşı hassas olduğunu ve değerlendirilen koşullar altında 1 × 10-3 değerinin, oyuncu sayısı tanıma ile kimlik koruma performansı arasında en iyi dengeyi sağladığını göstermektedir.

Genel olarak, Tablo 5, γ = 0.8, K = 3 ve η = 1 × 10-3 parametre kombinasyonunun, en düşük ID sayısı ile birlikte en yüksek değerlendirilmiş MOTA, IDF1 ve HOTA değerlerini ürettiğini göstermektedir. Duyarlılık analizi ayrıca, bu parametre değerlerinden meydana gelen orta düzeydeki sapmaların, izleme performansında ölçülebilir ancak ani olmayan değişikliklere yol açtığını göstermiştir. Buna uygun olarak, bu parametre ayarları karşılaştırmalı analiz ve bu çalışmada raporlanan birincil SportsMOT doğrulama deneyleri için kullanılmıştır.

Veri Kullanılabilirliği

Bu çalışmanın bulgularını destekleyen ham değerlendirme özetleri, nihai takip çıktıları, ortam kayıtları, veri seti eşleştirme dosyaları ve ara özet dosyaları, https://doi.org/10.5281/zenodo.21274353 adresindeki halka açık bir depoda mevcuttur. SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 ve MOT20 dahil olmak üzere bu çalışmada kullanılan orijinal halka açık kıyaslama veri setleri, ilgili sağlayıcılarından temin edilebilir ve depoda yeniden dağıtılmamıştır.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, tespit güveni bölümlendirmesini forma semantik ipuçlarıyla birleştiren, güven odaklı bir spor MOT iş akışını değerlendirmiştir. Güven odaklı ilişkilendirme ve semantik özellik füzyonu, çoklu nesne takibinde veri ilişkilendirmesini iyileştirmeye yönelik tamamlayıcı stratejiler olarak araştırılmıştır12,20,23,24,46. Sonuçlar, eksiksiz JerseyTrack konfigürasyonunun, değerlendirilen SportsMOT doğrulama ayarları altında kimlik korumayı ve ilişkilendirme stabilitesini iyileştirdiğini göstermektedir. Ana SportsMOT doğrulama sonucu %88.9 MOTA, %69.9 HOTA, %74.3 IDF1, %80.2 DetA ve %54.3 AssA değerlerine ulaşmıştır. Bu değerler, Protokol'de açıklanan dedektör çıktı kaynağı, veri seti ayrımı ve TrackEval konfigürasyonu çerçevesinde yorumlanmalıdır.

İş akışındaki kritik bir adım, dedektör çıktılarının güvenilirliğine göre farklı ilişkilendirme stratejilerinin uygulanmasına olanak tanıyan güven düzeyi bölümlendirmesidir20,22,23,24. JerseyTrack, tespitleri yüksek, orta ve düşük güven gruplarına ayırarak, farklı güvenilirlik düzeylerindeki tespitlere farklı ilişkilendirme kuralları uygular. Yüksek güvenli tespitler temel olarak hareket tutarlılığı üzerinden ilişkilendirilirken, orta güvenli tespitlerde hareket ve forma semantiği birlikte kullanılır. Düşük güvenli tespitler yeni yörüngeler başlatmak için kullanılmaz ve yalnızca yörünge kurtarma sırasında dikkate alınır. Bu tasarım, zayıf tespitlerin veya yanlış pozitiflerin istikrarsız kimlikler oluşturma riskini azaltırken, ek semantik kanıtlar mevcut olduğunda kısmi tespitlerin kurtarmaya katkıda bulunmasına olanak tanımıştır8,11,20. İkinci kritik adım forma semantik çıkarımıdır. Takım rengi özellikleri takım düzeyinde bir kısıtlama sağlarken, oyuncu numarası özellikleri, numara bölgesi görünür ve okunabilir olduğunda daha hassas bir kimlik ipucu sağlar35,41,42,43. Ablasyon sonuçları, bu ipuçlarının, yalnızca harekete dayalı ilişkilendirmenin daha az güvenilir olduğu yoğun aynı takım etkileşimi ve oklüzyon durumlarında en yararlı olduğunu göstermektedir. Ancak forma semantiği, hareket ilişkilendirmesinin tamamen yerine konması şeklinde değil, yardımcı kanıt olarak değerlendirilmelidir. Oyuncu numaraları bulanıklık, kırpılma, arkadan görünüm pozları, şiddetli oklüzyon veya düşük görüntü çözünürlüğü nedeniyle okunamaz olabilir. Takım rengi özellikleri ayrıca, numara bilgisi mevcut olmadığında aynı takımdaki sporcuları birbirinden ayıramaz35,42,43. Veri kümeleri arası sonuçlar, yöntemin kapsamını daha da netleştirmektedir. Semantik dalın forma rengi ve oyuncu numarası ipuçları etrafında tasarlanmış olması nedeniyle, JerseyTrack genel yaya MOT veri kümelerinden ziyade takım sporu veri kümelerine daha doğal bir şekilde aktarılmıştır19,33,34,35,36,37. Genel MOT veri kümelerinde, güven güdümlü ilişkilendirme bileşeni uygulanabilir kalmış ancak spora özgü semantik dal daha az kimlik bilgisi sağlamıştır. Bu nedenle yöntem, sporcuların ayırt edilebilir üniformalar giydiği ve forma bölgesinin semantik çıkarım için yeterince görünür olduğu takım sporu videoları için en uygundur19,33,34,35,36,37.

Bazı sınırlamalar devam etmektedir. Birincisi, yöntem dedektör çıktılarının kalitesine bağlıdır; ciddi tespit kaçırmaları veya hatalı sınırlayıcı kutular, hem hareket tahmininin hem de semantik kırpmanın güvenilirliğini azaltır14,17,46. İkincisi, mevcut uygulamada uzun süreli görüş alanı dışı yeniden tanımlama ayrı olarak optimize edilmemiştir. Bir sporcu uzun bir süre kamera görüş alanından ayrıldığında ve daha sonra tekrar girdiğinde, mevcut yörünge kurtarma stratejisi orijinal kimliği geri yüklemek için yeterli olmayabilir19,34. Üçüncüsü, ciddi arka plan karmaşası, üst üste binen oyuncular, hareket bulanıklığı ve okunmayan forma numaraları semantik özelliklerin güvenilirliğini azaltabilir14,35,42,46. Dördüncüsü, mevcut değerlendirme genel kıyaslama veri setlerine ve kontrollü pertürbasyon ayarlarına odaklanmıştır; kamera kesimleri, zum değişiklikleri ve standart dışı bakış açılarına sahip yayın videolarındaki uygulama, ek ön işleme veya yeniden tanımlama modülleri gerektirebilir19,33,34.

Temel pratik çıkarım, güvenilirlik odaklı ilişkilendirmenin ve formaya özel semantik ipuçlarının, dedektör yapısını değiştirmeden modüler bir MOT hattına entegre edilebileceğidir. Bu yetenek; sporcu yörünge çıkarımı, takım hareket analizi, taktik olay incelemesi ve yarı otomatik video açıklama gibi spor analiz görevleri için uygulanabilirdir1,4,33,36. Gelecekteki çalışmalar; daha güçlü görüş alanı dışı yeniden tanımlama, arka plan karmaşasının yönetimi, zamansal özellik toplama ve şiddetli bulanıklık veya tıkanıklık altında daha sağlam oyuncu numarası tanıma konularına odaklanmalıdır14,19,34,46.

Özetle JerseyTrack, güven odaklı ilişkilendirmeyi forma semantik füzyonu ile birleştiren bir spor MOT yöntemidir. Bu yöntem, tespitleri yüksek, orta ve düşük güven gruplarına ayırmakta ve tespit güvenilirliğine göre farklı ilişkilendirme kuralları uygularken, orta güvenli ilişkilendirme ve yörünge kurtarma işlemleri sırasında forma rengi ve oyuncu numarası ipuçlarını yardımcı kimlik bilgileri olarak kullanmaktadır. Değerlendirilen SportsMOT doğrulama ayarları altında JerseyTrack, değerlendirilen temel yapılandırmalara kıyasla gelişmiş takip doğruluğu ve kimlik koruma performansı sergilemiştir. Ablasyon sonuçları, tam yapılandırmanın temel yapılandırmaya ve tek modüllü varyantlara kıyasla kimlik değişimlerini azalttığını, kıyaslama karşılaştırması ise ortak detektör çıktısı ve değerlendirme yapılandırması altında temel takip metrikleri için daha yüksek değerler elde edildiğini göstermiştir. Bu bulgular, özellikle forma bölgelerinin görünür olduğu ve takım rengi veya oyuncu numarası bilgilerinin ek kimlik kanıtı sağladığı durumlarda, takım sporu videolarında sporcu takibi için güven düzeyi bilgisinin ve formaya özgü semantik ipuçlarının kullanımını desteklemektedir20,35,46. Belirlenen sınırlamaların giderilmesi, önerilen iş akışının daha zorlu spor takip senaryolarına uygulanabilirliğini daha da artırabilir.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, herhangi bir finansal çıkar çatışması olmadığını beyan ederler.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların beyan edeceği herhangi bir teşekkür yoktur.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
CUDA RuntimeNVIDIAVersiyon 12.8Dedektör eğitimi, anlamsal özellik çıkarımı ve takip çıkarımı için kullanılan GPU hesaplama çalışma zamanı.
EasyOCRJaided AIVersiyon 1.7.2Oyuncu numarası tanıma için kullanılan optik karakter tanıma araç kiti.
JerseyTrack kaynak koduYazarlarN/AVeri hazırlama, anlamsal özellik çıkarımı, güven bölümlendirme, takip, son işlem ve değerlendirme betiklerini içeren özel uygulama. Şu adreste mevcuttur: https://doi.org/10.5281/zenodo.21274352
Hafifletilmiş CRNN OCR modeliYazarlarN/AOyuncu numarası tanıma için kullanılan özel evrişimli tekrarlayan sinir ağı (CRNN).
MOT17 veri setiMOTChallengeN/AÇapraz veri seti değerlendirmesi için kullanılan halka açık kıyaslama veri seti. Şu adresten temin edilebilir: https://motchallenge.net/data/MOT17/
MOT20 veri setiMOTChallengeN/AÇapraz veri seti değerlendirmesi için kullanılan halka açık kıyaslama veri seti. Şu adresten temin edilebilir: https://motchallenge.net/data/MOT20/
motmetricsmotmetrics GeliştiricileriVersiyon 1.4.0Tanısal çoklu nesne takip metriği hesaplaması için kullanılan kütüphane.
NVIDIA GPUNVIDIAGeForce RTX 5090 D V2Dedektör eğitimi ve takip çıkarımı için kullanılan grafik işlem birimi.
NVIDIA GPU SürücüsüNVIDIAVersiyon 610.62Deneysel ortamda kullanılan GPU sürücüsü.
NumPyNumPy GeliştiricileriVersiyon 2.4.4Özellik işleme ve veri yönetimi için kullanılan sayısal hesaplama kütüphanesi.
OpenCVOpenCVVersiyon 4.10.0Görüntü yükleme, kırpma, ön işleme ve görselleştirme için kullanılan bilgisayarlı görü kütüphanesi.
PythonPython Software FoundationVersiyon 3.12.2İş akışı boyunca kullanılan programlama dili.
PyTorchPyTorch FoundationVersiyon 2.11.0+cu128Dedektör ve anlamsal model uygulaması için kullanılan derin öğrenme çerçevesi.
scikit-learnscikit-learn GeliştiricileriVersiyon 1.9.0Forma rengi çıkarımı ve güven bölümlendirme sırasında K-ortalama kümeleme için kullanılan makine öğrenimi kütüphanesi.
SoccerNet Takip veri setiSoccerNetN/AÇapraz veri seti değerlendirmesi için kullanılan halka açık futbol takip kıyaslaması. Şu adresten temin edilebilir: https://www.soccer-net.org/tasks/tracking
SportsMOT veri setiSportsMOT KıyaslamasıN/ADedektör hazırlığı ve takip değerlendirmesi için kullanılan birincil kıyaslama veri seti. Şu adresten temin edilebilir: https://deeperaction.github.io/datasets/sportsmot.html
TeamTrack veri setiTeamTrack KıyaslamasıN/AÇapraz veri seti değerlendirmesi için kullanılan halka açık spor takip kıyaslaması. Şu adresten temin edilebilir: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationVersiyon 0.26.0+cu128Görüntü dönüşümü ve model desteği için PyTorch ile birlikte kullanılan bilgisayarlı görü kütüphanesi.
TrackEvalTrackEval GeliştiricileriVersiyon 1.3.0Çoklu Nesne Takip Doğruluğu (MOTA), Kimlik F1 Puanı (IDF1), Yüksek Dereceli Takip Doğruluğu (HOTA), Algılama Doğruluğu (DetA), İlişkilendirme Doğruluğu (AssA), yanlış pozitifler (FP), yanlış negatifler (FN) ve kimlik değişimlerini (IDs) hesaplamak için kullanılan değerlendirme araç kiti.
UltralyticsUltralyticsVersiyon 8.4.90Dedektörü eğitmek ve sporcu algılamaları oluşturmak için kullanılan nesne algılama çerçevesi.

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

G ven Odakl TakipOyuncu Y r ngesiHareket Benzerli iForma RengiOptik Karakter Tan maKimlik Tutarl lSportsMOT Veri Seti

İlgili makaleler