Artigo de método

Um Método de Rastreamento de Múltiplos Objetos Guiado por Confiança para Vídeos Esportivos Utilizando Fusão Semântica de Camisas

DOI:

10.3791/71557

14 de agosto de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo descreve um fluxo de trabalho de rastreamento múltiplo de objetos guiado por confiança para vídeos esportivos que integra informações sobre a cor da camisa e o número do jogador para melhorar a associação de trajetórias e a consistência de identidade diante de flutuações de confiança, oclusões e aparências visualmente semelhantes dos atletas.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O rastreamento múltiplo de objetos (MOT) em vídeos esportivos fornece informações de trajetória para análise tática, interpretação do comportamento dos jogadores e análise estatística automatizada. No entanto, cenários esportivos frequentemente envolvem mudanças rápidas de direção, paradas bruscas, oclusões frequentes e companheiros de equipe visualmente semelhantes, resultando em flutuações na confiança da detecção e confusão de identidade durante a associação entre quadros. Para enfrentar esses desafios, este estudo apresenta o JerseyTrack, um método de MOT esportivo orientado pela confiança e baseado na fusão semântica de camisas. O fluxo de trabalho particiona adaptativamente as caixas de detecção em intervalos de alta, média e baixa confiança, de acordo com a distribuição de confiança de cada quadro. As detecções de alta confiança são associadas principalmente com base na similaridade de movimento, enquanto as detecções de média e baixa confiança incorporam adicionalmente características da cor da camisa e do número do jogador, extraídas por meio de agrupamento de cores e um modelo leve de Reconhecimento Óptico de Caracteres (OCR). Esses atributos semânticos são fundidos com informações de movimento durante a correspondência complementar para melhorar a continuidade da trajetória e a consistência de identidade. O método foi avaliado no conjunto de dados SportsMOT. O JerseyTrack alcançou 88,9% de precisão no rastreamento múltiplo de objetos (MOTA), 74,3% de pontuação F1 de identidade (IDF1) e 69,9% de precisão no rastreamento de ordem superior (HOTA), demonstrando um desempenho aprimorado no cenário de rastreamento esportivo avaliado. Este protocolo fornece um fluxo de trabalho reproduzível para integrar a associação orientada pela confiança com informações semânticas da camisa, a fim de melhorar o rastreamento múltiplo de objetos em vídeos esportivos.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O rastreamento múltiplo de objetos (MOT) fornece localização contínua de objetos e manutenção de identidade em sequências de vídeo, apoiando a extração de trajetórias de atletas, análise tática e análise estatística automatizada em aplicações com vídeos esportivos1,2,3. Informações visuais confiáveis também estão relacionadas à tomada de decisões específica do esporte e à avaliação de desempenho na ciência do esporte, enfatizando ainda mais o valor de dados de movimento derivados de vídeo estáveis para análises esportivas posteriores4. Em cenários esportivos, a confiabilidade dos dados táticos depende da continuidade das trajetórias de rastreamento e da consistência das identidades dos alvos.

Em comparação com cenários gerais de MOT, vídeos esportivos contêm mudanças rápidas de direção, paradas bruscas, saltos, interações densas e oclusões frequentes. Esses fatores provocam flutuações substanciais na confiança das caixas de detecção e aumentam a frequência de detecções com baixa confiança, o que pode interromper a associação de trajetórias5,6. As camisetas uniformes das equipes reduzem ainda mais a capacidade discriminativa de características gerais de aparência e aumentam a confusão de identidade entre companheiros de equipe visualmente semelhantes7,8. Quando a oclusão e a semelhança de aparência ocorrem na mesma sequência, a confiança na detecção diminui e as informações sobre a aparência do alvo tornam-se incompletas, aumentando a dificuldade de associação de trajetórias e manutenção de identidade9,10. Em MOT, reidentificação (Re-ID) refere-se ao processo de associar a mesma identidade de alvo entre quadros, períodos de oclusão ou casos de reentrada, utilizando evidências visuais relacionadas à identidade. Em vídeos de esportes coletivos, os indicadores gerais de Re-ID podem ser enfraquecidos porque atletas da mesma equipe frequentemente compartilham uniformes e aparências corporais semelhantes. A revisão da literatura técnica indica que fragmentação de trajetórias e confusão de identidade em MOT esportivo são comumente abordadas por meio de duas abordagens complementares: utilização da confiança na detecção e aprimoramento de pistas de identidade. O JerseyTrack posiciona-se na interseção dessas abordagens, regulando o uso de pistas semânticas da camiseta de acordo com a qualidade da detecção, em vez de aplicar uniformemente informações de cor e número do jogador a todas as detecções.

Este estudo apresenta o JerseyTrack, um método de MOT esportivo orientado por confiança e baseado na fusão semântica de camisetas. O método foi projetado para vídeos de esportes coletivos em que os atletas usam camisetas visíveis e os resultados da detecção fornecem caixas delimitadoras com pontuações de confiança. O JerseyTrack combina quatro componentes principais: detecção de atletas, particionamento por nível de confiança, extração de características semânticas da camiseta e associação interquadro em cascata. A confiança da detecção é utilizada para particionar adaptativamente as detecções em grupos de alta, média e baixa confiança, que são processados usando estratégias de associação diferentes. As detecções de alta confiança são associadas principalmente por meio de informações de movimento, enquanto as detecções de média e baixa confiança incorporam adicionalmente informações sobre a cor da camiseta e o número do jogador para melhorar a manutenção da identidade quando as evidências visuais são fracas. O método destina-se a tarefas de análise de vídeos esportivos que exigem trajetórias estáveis de atletas, como análise tática e interpretação do comportamento do jogador.

A abordagem proposta também apresenta limitações operacionais. A extração semântica de camisas pode ser afetada por oclusão severa, borrão de movimento, baixa resolução da imagem, poses anômalas das camisas ou números de jogadores invisíveis. Nessas situações, as pistas semânticas baseadas nas camisas podem tornar-se incompletas, e o processo de associação depende mais fortemente da consistência de movimento e da verificação multiquadro. Portanto, as afirmações de desempenho neste estudo estão restritas aos conjuntos de dados avaliados e às configurações experimentais. Experimentos no conjunto de dados SportsMOT mostram que o JerseyTrack melhora as métricas de rastreamento avaliadas e reduz os eventos de troca de identidade sob as condições de rastreamento esportivo testadas. A principal dificuldade do rastreamento múltiplo de objetos (MOT) em vídeos esportivos reside na manutenção da continuidade da trajetória e da consistência de identidade diante de movimentos rápidos, oclusões e similaridade de aparência. Estudos existentes relacionados ao JerseyTrack podem ser amplamente categorizados em duas direções de pesquisa: o uso da confiança da detecção para associação de trajetórias e o aprimoramento de pistas de identidade por meio de características semânticas específicas de esportes.

A confiança na detecção tem sido amplamente utilizada para estimar a confiabilidade das caixas de detecção e orientar a associação de trajetórias em MOT. Métodos iniciais de rastreamento geralmente tratavam a confiança como um critério binário de filtragem, nos quais detecções abaixo de um limiar fixo eram removidas para reduzir falsos positivos11,12. Essa estratégia reduz detecções ruidosas, mas também pode descartar alvos reais sob oclusão, movimento rápido ou baixa qualidade de imagem, resultando em fragmentação de trajetórias13,14,15. Estratégias de filtragem semelhantes também demonstraram que limiares fixos de confiança são sensíveis à variação da cena e à qualidade da detecção16,17. Para melhorar o uso de detecções com baixa confiança, o ByteTrack introduziu uma estratégia de associação que mantém caixas com baixa confiança como alvos candidatos para correspondência secundária e as vincula a trajetórias existentes por meio de similaridade de movimento e histórico de trajetória18. O McByte estende ainda mais a associação em MOT esportivo ao incorporar máscaras de segmentação propagadas temporalmente como uma pista de associação, melhorando a robustez sob condições de movimento rápido, oclusão e deslocamento da câmera, sem necessidade de treinamento adicional por vídeo19. Estudos relacionados também ajustaram o uso de detecções com baixa confiança para manter alvos fracos, mas potencialmente válidos, durante a associação20,21,22. Estratégias de associação adaptativas à confiança posteriormente refinaram os critérios de correspondência com base na consistência de movimento e na confiabilidade da detecção23,24,25. Métodos de refinamento de trajetórias baseados em regressão da caixa de detecção e otimização da suavidade da trajetória também foram utilizados para reduzir a fragmentação de trajetórias26,27,28. Estratégias adicionais de refinamento fornecem suporte complementar para manter a continuidade da trajetória em condições de movimento complexo29. O fluxo temporal coerente de objetos modela ainda mais a consistência temporal em nível de objeto entre quadros, fornecendo outra abordagem orientada à associação para reduzir interrupções de trajetória em cenários complexos de MOT30. Métodos de fusão de rastreadores também aprendem a partir das saídas de múltiplos rastreadores e utilizam estratégias de seleção ou fusão baseadas em aprendizado para melhorar a robustez do rastreamento em diferentes benchmarks de MOT31. Em conjunto, esses estudos indicam que a associação sensível à confiança ajuda a recuperar trajetórias interrompidas; no entanto, pistas de confiança e movimento fornecem informações limitadas sobre identidade quando jogadores do mesmo time possuem aparências visuais semelhantes. Embora esses métodos aliviem efetivamente a fragmentação de trajetórias em cenários gerais, enfrentam limitações inerentes em contextos esportivos, pois jogadores do mesmo time frequentemente têm aparências visuais altamente semelhantes, e depender exclusivamente de informações de confiança e movimento não fornece base suficiente para diferenciação de identidade32,33,34. Mesmo quando caixas com baixa confiança são recuperadas com eficácia, a similaridade de características ainda pode levar à troca de identidade, dificultando o atendimento aos rigorosos requisitos de consistência de identidade na análise esportiva.

Indicadores específicos de identidade esportiva também têm sido utilizados para melhorar a discriminação de identidade no rastreamento de atletas. Informações semânticas da camisa, como cor do time e número do jogador, fornecem pistas identitárias mais diretamente relacionadas a cenários esportivos do que incorporações gerais de aparência35,36,37. A cor da camisa tem sido usada para apoiar a discriminação em nível de equipe e reduzir a confusão entre times, enquanto o reconhecimento do número do jogador fornece uma pista identitária mais precisa quando a região do número está visível e legível38,39. Estudos existentes sobre rastreamento esportivo incorporaram características visuais específicas do domínio e reconhecimento da cor da camisa para melhorar a associação de jogadores em condições esportivas lotadas40,41. Trabalhos relacionados sobre reconhecimento de número da camisa e dados sintéticos de números apoiam ainda mais a modelagem de identidade em condições de baixa resolução ou oclusão parcial42,43. Esses estudos indicam que a semântica da camisa pode fortalecer a representação de identidade no rastreamento de múltiplos objetos em esportes (MOT). No entanto, a maioria dos métodos de rastreamento aprimorados por semântica não modela suficientemente a relação entre a confiança na detecção e a qualidade da característica semântica. Detecções de alta confiança podem já conter informações espaciais e de aparência confiáveis, tornando a extração semântica repetida menos eficiente. Detecções de baixa confiança frequentemente sofrem com oclusão, desfoque, truncamento ou baixa resolução, reduzindo a confiabilidade das pistas de cor e número do jogador. Essa limitação motiva um design de associação guiado por confiança, no qual a semântica da camisa é introduzida de acordo com a qualidade da detecção, em vez de ser aplicada uniformemente a todas as detecções. Os estudos revisados mostram que a associação consciente da confiança e a modelagem semântica da camisa abordam diferentes aspectos do MOT esportivo. As estratégias baseadas em confiança determinam principalmente se uma detecção deve participar da associação e como ela deve ser combinada com trajetórias existentes, enquanto as estratégias semânticas de camisa aprimoram principalmente a representação de identidade por meio de pistas específicas do esporte. No entanto, esses dois mecanismos são frequentemente projetados como componentes separados. Como resultado, as pistas semânticas nem sempre são ajustadas de acordo com a qualidade da detecção, e os níveis de confiança não regulam diretamente o uso das informações de cor e número do jogador durante a associação. Essa separação limita o tratamento conjunto de fragmentação de trajetória e confusão de identidade em vídeos de esportes coletivos. A lacuna de pesquisa remanescente reside na vinculação da avaliação da qualidade da confiança na detecção com a associação semântica da camisa dentro do mesmo fluxo de trabalho de rastreamento.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo envolveu análise secundária de conjuntos de dados de vídeo de referência disponíveis publicamente, nomeadamente SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 e MOT20. Nenhum participante foi recrutado, nenhuma intervenção foi realizada e nenhum dado novo envolvendo seres humanos foi coletado. A aprovação do comitê de ética não foi necessária para este estudo, conforme as exigências institucionais aplicáveis da Universidade Bangkok Thonburi.

O protocolo a seguir descreve o fluxo de trabalho utilizado para reproduzir o JerseyTrack, desde a preparação dos dados até a avaliação do rastreamento. O fluxo de trabalho inclui a preparação do conjunto de dados, a preparação do detector, a extração semântica da camisa, a partição por nível de confiança, a associação orientada pela confiança, a inferência de rastreamento e a avaliação de desempenho, conforme resumido na Figura 1. O software necessário, os conjuntos de dados e os recursos de hardware são listados na Tabela de Materiais.

figure-protocol-1
Figura 1. Fluxo geral do método JerseyTrack. O fluxo de trabalho consiste na extração de características semânticas da camisa, correspondência inicial de objetos, correspondência suplementar orientada por confiança e fusão de características. Características de cor do time e número do jogador são extraídas das regiões de atletas detectadas e incorporadas ao processo de associação para melhorar a correspondência de trajetórias em condições de detecção incertas. Clique aqui para visualizar uma versão maior desta figura.

1. Prepare os conjuntos de dados e a estrutura de diretórios

  1. Baixe os conjuntos de dados de referência públicos listados na Tabela de Materiais. Utilize o SportsMOT como conjunto de dados principal para preparação do detector e avaliação do rastreamento. Mantenha os conjuntos TeamTrack, SoccerNet Tracking, MOT17 e MOT20 para avaliação entre conjuntos de dados.
  2. Armazene todos os conjuntos de dados em um diretório de projeto unificado. Certifique-se de que o detector, o módulo de extração semântica, o módulo de rastreamento e o kit de avaliação utilizem identificadores de sequência idênticos.
  3. Converta as anotações oficiais do SportsMOT para o formato de treinamento do detector usando o script de preparação de dados empregado neste estudo. Execute o seguinte comando:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. O script de preparação de dados (scripts/prepare_data.py) está disponível no repositório de código-fonte do JerseyTrack (https://doi.org/10.5281/zenodo.21274352). As dependências de software necessárias estão especificadas no arquivo environment.yml, incluindo Python 3.12, PyTorch 2.11.0 e OpenCV 4.10 ou posterior. Configure o ambiente de software usando o seguinte comando: conda env create -f environment.yml. Execute o script de preparação de dados usando o seguinte comando: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Verifique se a conversão gerou o arquivo de configuração para treinamento do detector: data\processed\SportsMOT_yolo\data.yaml e o manifesto de conversão: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    NOTA: Neste estudo, o conjunto de treinamento e validação do SportsMOT convertido continha 90 sequências, 55.544 quadros e 608.152 objetos anotados.
  6. Inspeccione sequências representativas para verificar se a ordem dos quadros, as coordenadas das caixas delimitadoras e os rótulos de identidade permanecem consistentes com as anotações originais do conjunto de referência.
  7. Mantenha os arquivos de anotação convertidos sem modificações durante toda a preparação do detector, inferência de rastreamento e avaliação, de modo que todos os métodos utilizem a mesma partição do conjunto de dados e o mesmo protocolo de avaliação.
    NOTA: O resultado esperado desta seção é um diretório padronizado de treinamento do detector SportsMOT contendo as anotações convertidas, o manifesto de conversão e os arquivos de divisão do conjunto de dados necessários para a preparação do detector e avaliação do rastreamento.

2. Prepare as saídas do detector

  1. Ajuste fino do detector de objetos utilizando o conjunto de treinamento preparado do SportsMOT. Otimize o detector usando a perda de classificação e a perda de regressão da caixa delimitadora definidas na Equação 1. Utilize a resolução de entrada do detector, tamanho do lote, taxa de aprendizado, número de épocas de treinamento e outros parâmetros de treinamento relatados na configuração de implementação e na Tabela de Materiais
    Ldet = Lcls + Lbox   (1)
    Aqui, Ldet  denota a perda total do detector, Lcls  denota a perda de classificação, Lbox  denota a perda de regressão da caixa delimitadora.
    NOTA: O ponto de controle do detector usado nos experimentos principais (identificador interno do experimento e3) foi treinado usando o framework Ultralytics YOLO com a configuração do conjunto de dados no formato YOLO do SportsMOT (data/processed/SportsMOT_yolo/data.yaml). Execute o treinamento do detector usando o seguinte comando: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Após o treinamento, use o ponto de controle com melhor desempenho resultante para gerar as saídas do detector para as sequências de validação usando o seguinte comando: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Salve o ponto de controle do detector treinado, o arquivo de metadados correspondente e o log de treinamento após o treinamento.
    NOTA: Neste estudo, o ponto de controle do detector usado para os experimentos formais foi salvo como:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. O arquivo de metadados correspondente foi salvo como: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. O diretório de saída do detector usado para os experimentos principais de validação do SportsMOT foi: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Execute o detector treinado em cada sequência de validação para gerar caixas delimitadoras dos atletas e pontuações de confiança. Exporte um arquivo de detecção para cada sequência contendo o índice do quadro, coordenadas da caixa delimitadora, confiança da detecção e rótulo da classe.
    NOTA: Na execução de validação do SportsMOT usada para os experimentos principais, um limiar de confiança de 0,05 gerou 343.990 detecções de atletas.
  4. Inspecione o diretório de saída do detector antes da inferência de rastreamento. Confirme que cada sequência possui um arquivo de detecção correspondente, que os índices dos quadros correspondem à sequência de imagens preparada e que cada registro de detecção contém uma pontuação de confiança.
    NOTA: O resultado esperado desta seção é um diretório de saída do detector completo que servirá como entrada para a extração semântica da camisa, particionamento por nível de confiança e associação de rastreamento.

3. Extrair características semânticas da camisa

  1. Utilize os arquivos de saída do detector para recortar as regiões dos atletas de cada quadro do vídeo. Salve cada imagem recortada do atleta com seu identificador de sequência, índice do quadro e índice de detecção. Exclua recortes inválidos com conteúdo de imagem ausente ou caixas delimitadoras que extrapolam os limites da imagem. Mantenha o vínculo entre cada nome de arquivo do recorte e seu registro de detecção original, de modo que as características semânticas extraídas possam ser associadas à detecção correspondente durante a associação no rastreamento.
  2. Extraia características de cor da camisa a partir das imagens recortadas dos atletas utilizando o script de extração semântica empregado neste estudo.
    NOTA: Os scripts de extração de características semânticas (scripts/extract_fast_color_semantics.py e scripts/formal_extract_semantics.py) estão disponíveis no repositório de código-fonte JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Nenhum arquivo de configuração separado é necessário; todos os parâmetros de execução são fornecidos por meio de argumentos da linha de comando.
    Gere descritores de cor da camisa utilizando o seguinte comando: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Gere características semânticas do número do jogador utilizando o modelo OCR com o seguinte comando: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Os descritores de cor da camisa gerados e as saídas de probabilidade do número do jogador são vinculados pelo identificador de sequência e combinados nos arquivos de características semânticas utilizados durante a associação no rastreamento.
  3. Converta cada imagem recortada do atleta para o espaço de cor Matiz, Saturação, Valor (HSV). Extraia os pixels de primeiro plano da região da camisa e resuma a cor dominante da camisa utilizando agrupamento K-médias com K = 3. Normalize o descritor de cor resultante utilizando normalização L2 antes da comparação de características.
  4. Treine o ramo de reconhecimento do número do jogador utilizando imagens recortadas dos atletas com um tamanho de entrada de 128 × 64 pixels. Gere rótulos pseudo-rotulados do número do jogador utilizando o procedimento de rotulagem fracamente supervisionado empregado neste estudo. Exclua recortes com regiões do número do jogador invisíveis, ilegíveis, severamente ocluídas ou com baixa confiança do cálculo da perda OCR (Reconhecimento Óptico de Caracteres).
  5. Optimize o ramo OCR utilizando a perda de entropia cruzada definida na Equação 2.
    figure-protocol-2 (2)
    Aqui, Locr denota a perda OCR, yi denota o rótulo supervisionado do número do jogador e figure-protocol-3 denota a categoria prevista do número do jogador.
  6. Optimize o módulo de extração de características semânticas utilizando o otimizador adaptativo, taxa de aprendizado, tamanho do lote, decaimento de peso e duração do treinamento listados na Tabela de Materiais. Combine a perda do detector e a perda OCR utilizando o objetivo total de treinamento definido na Equação 3.
    Ltotal = Ldet + γLocr   (3)
    Aqui, Ltotaldenota a perda total de treinamento, Ldet denota a perda do detector definida na Equação 1, Locr denota a perda OCR definida na Equação 2, e denota o coeficiente de ponderação definido pelo usuário para a perda OCR.
  7. Aplique o ramo OCR treinado a cada imagem recortada do atleta. Salve a categoria prevista do número do jogador ou o vetor de probabilidade para cada recorte. Se o número do jogador não estiver visível ou a confiança do OCR estiver abaixo do limiar definido na implementação, registre a característica do número do jogador como indisponível, em vez de forçar uma previsão.
  8. Combine o descritor de cor da camisa e a saída do número do jogador no arquivo de características semânticas utilizado pelo módulo de rastreamento.
    NOTA: Na execução principal de validação do SportsMOT, o script de extração semântica processou 343.990 detecções sem quadros ausentes ou recortes inválidos. No pacote de revisão atual, o resumo da extração semântica relatou uma precisão geral de extração semântica de cor e OCR de 86,7% na configuração SportsMOT avaliada. O resultado esperado desta seção é um arquivo de características semânticas no qual cada registro de detecção válido está vinculado a um descritor de cor da camisa, uma saída do número do jogador quando disponível e uma marca indicando se a informação semântica está disponível para a associação no rastreamento.

4. Níveis de confiança na detecção de partições

  1. Carregue o arquivo de saída do detector para cada sequência de vídeo. Colete as pontuações de confiança de todas as detecções de atletas em cada quadro.
  2. Divida as pontuações de confiança por quadro em intervalos de alta, média e baixa confiança usando agrupamento K-means com K = 3, seguindo o fluxo de trabalho de associação guiada por confiança mostrado na Figura 2. Determine os limiares adaptativos de confiança minimizando a variância intra-cluster de acordo com a Equação 4.
    figure-protocol-4  (4)
    Aqui, sd denota a pontuação de confiança da detecção d; D1, D2 e D3 denotam os intervalos de alta, média e baixa confiança, respectivamente; μ1, μ2 e μ3 denotam as pontuações médias de confiança dos três intervalos; e τ1 e τ2 denotam os limiares adaptativos de confiança obtidos a partir dos resultados do agrupamento K-means.
    NOTA: O script de particionamento de confiança (scripts/formal_partition_confidence.py) está disponível no repositório de código-fonte do JerseyTrack (https://doi.org/10.5281/zenodo.21274352). O módulo de particionamento de confiança utiliza um procedimento de agrupamento K-means unidimensional baseado em NumPy com K = 3. Nenhum arquivo de configuração separado é necessário; o diretório de entrada, diretório de saída e parâmetro de agrupamento são especificados por meio de argumentos de linha de comando. Execute o procedimento de particionamento de confiança usando o seguinte comando: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. As dependências de software necessárias, incluindo a versão do NumPy, são especificadas em environment.yml.
  3. Execute o procedimento de particionamento de confiança usando o diretório de saída do detector como entrada.
    NOTA: Neste estudo, o diretório de saída do detector era: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. O diretório de saída do particionamento de confiança era: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Os arquivos de saída gerados incluíram os arquivos CSV de confiança por sequência, _confidence_frame_summary.csv e _confidence_runtime.csv.
  4. Atribua um rótulo de nível de confiança a cada detecção. Rotule as detecções de alta confiança para associação baseada em movimento, as de média confiança para associação de movimento-semântica e as de baixa confiança apenas para recuperação de trajetória. Preserve a pontuação original de confiança juntamente com o rótulo de nível de confiança atribuído.
  5. Inspeccione as distribuições das pontuações de confiança e quadros representativos, conforme ilustrado na Figura 3. Verifique se as detecções de alta confiança correspondem predominantemente a caixas delimitadoras completas e confiáveis dos atletas, enquanto as detecções de média e baixa confiança contêm principalmente detecções parciais, ocluídas, desfocadas ou fracas.
    NOTA: O resultado esperado desta seção é um arquivo de particionamento de confiança contendo o índice da detecção, pontuação original de confiança, nível de confiança atribuído e limiares adaptativos de confiança por quadro para cada detecção.

figure-protocol-5
Figura 2. Estratégia de associação orientada pela confiança. O fluxo de trabalho particiona a confiança da detecção em intervalos de alta, média e baixa confiança utilizando agrupamento adaptativo de confiança. As detecções de alta confiança são associadas usando similaridade de movimento, as detecções de média confiança são associadas usando similaridade combinada de movimento e semântica da camisa, e as detecções de baixa confiança são utilizadas na recuperação de trajetórias assistida por semântica com verificação de múltiplos quadros. O painel direito resume a formulação matemática utilizada para a partição de confiança e associação. Clique aqui para visualizar uma versão maior desta figura.

figure-protocol-6
Figura 3. Distribuição dos escores de confiança de detecção. O histograma mostra o número de caixas de detecção de atletas em cinco intervalos de confiança para sequências de futebol, basquete e vôlei no conjunto de dados SportsMOT. A distribuição ilustra as diferenças na confiança do detector entre as categorias esportivas avaliadas. Clique aqui para visualizar uma versão maior desta figura.

5. Executar a associação guiada por confiança

  1. Carregue o arquivo de saída do detector, o arquivo de características semânticas e o arquivo de partição de confiança para cada sequência de vídeo. Inicialize o rastreador usando as primeiras detecções válidas e mantenha um estado de trajetória para cada atleta rastreado. Para cada quadro subsequente, preveja a posição de todas as trajetórias existentes usando o modelo de movimento do filtro de Kalman.
  2. Calcule a similaridade de movimento entre cada trajetória prevista e a detecção candidata usando a distância de Mahalanobis definida na Equação 5.
    figure-protocol-7  (5)
    Aqui, figure-protocol-8 denota a trajetória I-ésima no quadro k, figure-protocol-9 denota o estado previsto da trajetória pelo Kalman, dj denota a detecção candidata, figure-protocol-10 denota a matriz de covariância inversa do estado da trajetória prevista, e Smot denota a distância de movimento entre a trajetória prevista e a detecção.
    NOTA: O fluxo de trabalho principal de associação é implementado em jerseytrack/formal_tracker.py e executado por meio de scripts/formal_track.py, ambos disponíveis no repositório de código-fonte do JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Nenhum arquivo de configuração separado é necessário. Todos os parâmetros de execução, incluindo os limiares de confiança, idade máxima da trajetória, coeficientes de peso do movimento e peso da distância do centro, são fornecidos por meio de argumentos da linha de comando. O comando completo de execução e as configurações de parâmetros são fornecidos na Etapa 6.2. A implementação utiliza o algoritmo de atribuição de soma linear do SciPy para correspondência húngara e o NumPy para associação baseada em custo.
  3. Execute o fluxo de trabalho de rastreamento usando o arquivo de saída do detector, o arquivo de características semânticas e o arquivo de partição de confiança como entradas.
    NOTA: Neste estudo, o rastreador principal foi implementado em jerseytrack\formal_tracker.py, e o fluxo de trabalho de rastreamento foi executado usando scripts\formal_track.py.
  4. Associe detecções de alta confiança com trajetórias existentes usando a consistência de movimento. Atualize as trajetórias correspondidas e inicialize novas trajetórias apenas quando detecções de alta confiança não correspondidas satisfaçam os critérios de inicialização da trajetória.
  5. Examine as saídas da extração semântica de camisa ilustradas na Figura 4, e construa o vetor de características semânticas da camisa para cada detecção combinando o descritor de cor da equipe e a característica do número do jogador de acordo com a Equação 6.
    fsem = [fcol;fid] (6)
    Aqui, fsem denota o vetor de características semânticas fundido, fcol denota o descritor de cor da equipe, e fid denota a característica do número do jogador gerada pelo ramo OCR.
  6. Associe detecções de confiança média combinando a similaridade de movimento com a similaridade semântica da camisa. Calcule a pontuação de correspondência fundida de acordo com a Equação 7.
    figure-protocol-11 (7)
    Aqui, Ssem denota a similaridade cosseno entre os vetores de características semânticas da trajetória e da detecção candidata, Smot denota a distância de movimento definida na Equação 5, e λ denota o coeficiente de fusão adaptativo que equilibra os termos de similaridade de movimento e semântica.
  7. Calcule o coeficiente de fusão adaptativo de acordo com a Equação 8.
    figure-protocol-12 (8)
    Aqui, λdenota o coeficiente inicial de peso do movimento, σsd denota o desvio padrão das pontuações de confiança de detecção no quadro atual, e σmax denota o desvio padrão máximo da pontuação de confiança usado para normalização.
  8. Use detecções de baixa confiança apenas para recuperação de trajetória. Associe detecções de baixa confiança com trajetórias interrompidas somente quando a informação semântica estiver disponível e os critérios de recuperação forem satisfeitos. Aplique verificação de múltiplos quadros antes de restaurar a identidade de uma trajetória, e descarte detecções que falharem na verificação.
    NOTA: Quando a característica do número do jogador não estiver disponível, realize a associação usando as informações semânticas disponíveis e a consistência de movimento, em vez de forçar uma correspondência de número de jogador. O resultado esperado desta seção é um registro de rastreamento quadro a quadro contendo identidades de trajetória, caixas delimitadoras, rótulos de nível de confiança, custos de movimento, informações semânticas e decisões finais de associação. No pacote de evidências da revisão, os resultados de rastreamento foram armazenados em: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
Figura 4. Extração de características semânticas da camisa. Detecções representativas de atletas são anotadas com os descritores de cor da equipe e as informações de número do jogador geradas pelo módulo de extração semântica da camisa. As características semânticas extraídas são posteriormente incorporadas à associação de dados orientada por confiança. Clique aqui para visualizar uma versão maior desta figura.

6. Executar a inferência de rastreamento e exportar os resultados

  1. Execute a inferência de rastreamento para cada sequência de vídeo usando os arquivos preparados de saída do detector, arquivos de características semânticas e arquivos de partição de confiança. Processe os quadros de vídeo em ordem cronológica para que os estados de trajetória, histórico semântico e decisões de recuperação de trajetória sejam atualizados de forma consistente ao longo da sequência. Utilize a mesma configuração de inferência para todas as sequências avaliadas, salvo quando uma configuração específica do conjunto de dados for explicitamente relatada.
    NOTA: A inferência de rastreamento foi executada usando o script/formal_track.py, disponível no repositório de código-fonte do JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Nenhum arquivo de configuração separado é necessário. Execute a inferência de rastreamento usando o seguinte comando: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Todos os parâmetros não especificados mantiveram os valores padrão registrados no código-fonte arquivado.
  2. Após a inferência, aplique a sequência principal de pós-processamento usando os seguintes comandos: python scripts/merge_tracklets.py e python scripts/sweep_track_filter.py --min-len 95.
  3. Exporte os resultados de rastreamento no formato exigido pela ferramenta de avaliação. Inclua o índice do quadro, identidade da trajetória, coordenadas da caixa delimitadora e todos os campos exigidos pelo formato de avaliação do benchmark. Salve um arquivo de resultados de rastreamento para cada sequência, utilizando uma convenção consistente de nomenclatura de arquivos, de modo que cada arquivo de resultado possa ser associado ao seu respectivo arquivo de anotação de referência.
  4. Aplique apenas as operações de pós-processamento utilizadas neste estudo. Realize a fusão de segmentos de trajetória (tracklets) e a filtragem de trajetórias usando os scripts de pós-processamento descritos no pacote de revisão.
    NOTA: Neste estudo, o fluxo de trabalho de pós-processamento utilizou os seguintes scripts:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Inspeccione os resultados de rastreamento exportados antes da avaliação quantitativa. Confirme que as identidades das trajetórias permanecem numéricas e consistentes dentro de cada sequência, que nenhum índice de quadro está ausente e que todas as caixas delimitadoras permanecem dentro dos limites da imagem.
    NOTA: O resultado esperado desta seção é um conjunto completo de arquivos de resultados de rastreamento em nível de sequência, prontos para avaliação quantitativa.

7. Avaliar o desempenho do rastreamento

  1. Avalie os arquivos de resultados de rastreamento exportados utilizando o kit de avaliação listado na Tabela de Materiais. Associe cada arquivo de resultado de rastreamento ao arquivo de anotação de referência correspondente e à divisão do conjunto de dados. Utilize a mesma configuração de avaliação para todos os métodos comparados, garantindo que as diferenças de desempenho decorram dos resultados de rastreamento e não das configurações de avaliação.
  2. Execute a avaliação utilizando o seguinte comando
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    NOTA: A avaliação foi realizada utilizando a implementação padrão das métricas do TrackEval (Versão 1.3.0), arquivada dentro do pacote de reprodutibilidade JerseyTrack. Nenhuma modificação foi feita nas implementações das métricas Higher Order Tracking Accuracy (HOTA), CLEAR ou Identity. O repositório inclui o wrapper de execução no estilo MOTChallenge localizado em evaluation/trackeval/scripts/run_mot_challenge.py, que configura os caminhos dos conjuntos de dados e dos resultados e invoca as métricas padrão de avaliação do TrackEval.
  3. Registre as métricas de avaliação relatadas no manuscrito, incluindo Acurácia no Rastreamento de Múltiplos Objetos (MOTA), Pontuação F1 de Identidade (IDF1), Acurácia de Rastreamento de Ordem Superior (HOTA), Acurácia de Detecção (DetA), Acurácia de Associação (AssA), falsos positivos (FPs), falsos negativos (FNs) e eventos de troca de identidade. Exporte o resumo da avaliação como uma tabela e mantenha os arquivos de avaliação por sequência para verificação.
  4. Ao comparar o JerseyTrack com métodos de referência, utilize a mesma divisão do conjunto de dados, saídas do detector e configuração de avaliação para todos os métodos. Registre o conjunto de dados, a fonte das saídas do detector, a configuração do kit de avaliação e os valores das métricas para cada comparação.
  5. Examine os logs de avaliação para verificar se todas as sequências foram avaliadas com sucesso e se nenhum arquivo de resultado de rastreamento está ausente.
    NOTA: Neste estudo, o arquivo resumo principal do TrackEval foi armazenado em: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. O resultado esperado nesta seção é uma tabela completa de resumo da avaliação, juntamente com os arquivos de métricas por sequência que sustentam os Resultados relatados e a verificação subsequente.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta seção apresenta os resultados quantitativos e qualitativos obtidos a partir dos experimentos avaliados de rastreamento múltiplo em esportes. Os resultados enfocam a precisão do rastreamento, a preservação de identidade, a qualidade da associação e a robustez nas configurações do conjunto de dados testadas. As afirmações sobre desempenho restringem-se aos métodos avaliados, conjuntos de dados, saídas do detector e configuração da ferramenta de avaliação descritos no Protocolo e na Configuração de Implementação.

Configuração experimental e desenho da avaliação

Conjunto de dados e pré-processamento:

O SportsMOT foi utilizado como referência principal para a preparação do detector, inferência de rastreamento e avaliação quantitativa. O conjunto de dados contém 240 sequências de vídeo e mais de 150.000 quadros de imagem em cenários de futebol, basquete e vôlei (Figura 5). Na avaliação formal, os principais resultados do SportsMOT foram calculados utilizando a divisão de validação juntamente com as saídas do detector, configuração de rastreamento e configurações do TrackEval descritas no Protocolo. A avaliação cruzada entre conjuntos de dados foi realizada nos conjuntos TeamTrack, SoccerNet Tracking, MOT17 e MOT20 para examinar a transferência de desempenho entre diferentes tipos de conjuntos de dados, e não para fazer comparações diretas em nível de métricas entre os conjuntos de dados.

figure-results-1
Figura 5. Conjuntos de dados representativos utilizados para avaliação. Quadros de exemplo ilustram sequências representativas de futebol, basquete e vôlei utilizadas para avaliação experimental. A figura destaca as variações no ponto de vista da câmera, densidade de jogadores e complexidade da cena entre os conjuntos de dados avaliados. Clique aqui para visualizar uma versão maior desta figura.

Os dados do SportsMOT foram organizados de acordo com a estrutura oficial do conjunto de dados e convertidos para o formato de treinamento do detector descrito no Protocolo. Os dados de treinamento e validação do SportsMOT convertidos continham 90 sequências, 55.544 quadros e 608.152 objetos anotados. A partição de treinamento foi utilizada para o preparo do detector e ajuste de parâmetros, enquanto a partição de validação foi usada para a avaliação formal de rastreamento relatada neste estudo. Todos os quadros de entrada foram redimensionados de acordo com a configuração do detector descrita no Protocolo e na Tabela de Materiais. O mesmo procedimento de pré-processamento foi aplicado durante o preparo do detector, extração de características semânticas, inferência de rastreamento e avaliação com o TrackEval, de modo que as diferenças relatadas refletissem principalmente a estratégia de associação de rastreamento e não diferenças no processamento dos dados.

Indicadores de avaliação:

O desempenho do rastreamento foi avaliado usando um protocolo de avaliação compatível com o MOTChallenge, implementado com o kit de avaliação listado na Tabela de Materiais. As métricas relatadas descrevem três aspectos do desempenho do rastreamento múltiplo em esportes: precisão geral do rastreamento, preservação de identidade e qualidade da detecção e associação. MOTA, IDF1 e HOTA foram utilizadas como métricas principais de avaliação44,45. A MOTA resume falsos positivos, falsos negativos e trocas de identidade em uma pontuação geral de precisão de rastreamento. A IDF1 mede a consistência entre as trajetórias previstas e as identidades reais. A HOTA avalia conjuntamente a precisão da detecção e a precisão da associação, caracterizando, portanto, o equilíbrio entre localização do alvo e associação da trajetória. DetA e AssA foram relatadas como métricas complementares. FPs, FNs e Trocas de Identidade (IDs) foram utilizadas para caracterizar fontes de erro relacionadas a detecções incorretas, detecções perdidas e mudanças de identidade. Para comparações entre métodos no SportsMOT, foram utilizadas as mesmas saídas do detector e configuração do kit de avaliação, a fim de reduzir a influência da variação do detector e das diferenças nas configurações de avaliação. Para comparações entre conjuntos de dados, os valores das métricas foram interpretados como resultados de avaliação dentro do mesmo conjunto de dados, e não como evidência de superioridade absoluta de desempenho entre diferentes conjuntos de dados.

Ambiente experimental e configuração de parâmetros:

Os experimentos foram conduzidos utilizando os recursos de hardware e software listados na Tabela de Materiais. O mesmo ambiente computacional, estrutura do detector, saídas do detector e kit de avaliação foram utilizados em todos os experimentos principais de SportsMOT para manter a consistência durante a preparação do detector, inferência de rastreamento e avaliação de desempenho. A estrutura do detector listada na Tabela de Materiais foi treinada com um tamanho de lote de 16, uma taxa de aprendizado inicial de 0,01 e 80 épocas de treinamento. No módulo de extração semântica de camisas, o agrupamento de cores utilizou K-médias com K = 3, e o ramo OCR utilizou uma rede neural recorrente convolucional leve com um tamanho de entrada de 128 × 64 pixels. O ramo OCR foi otimizado utilizando o otimizador adaptativo listado na Tabela de Materiais com uma taxa de aprendizado de 1 × 10⁻3, uma decaimento de peso de 1 × 10⁻5, um tamanho de lote de 64 e 40 épocas de treinamento. Nenhum agendamento adicional de taxa de aprendizado foi utilizado durante o treinamento do módulo de extração de características semânticas. O coeficiente de ponderação da perda OCR (γ) foi tratado como um hiperparâmetro definido pelo usuário e selecionado com base no desempenho no conjunto de validação. A estratificação por nível de confiança utilizou particionamento adaptativo por K-médias, no qual τ₁ e τ₂ foram calculados a partir da distribuição de confiança de detecção de cada quadro, em vez de serem pré-definidos manualmente antes da inferência.

Desempenho no rastreamento entre esportes e complexidade de cenário

Desempenho quantitativo sob diferentes esportes e condições de cena:

O desempenho de rastreamento foi avaliado sob dois fatores de agrupamento: categoria do esporte e complexidade da cena. A análise por categoria de esporte incluiu sequências de futebol, basquete e vôlei. A análise de complexidade da cena considerou o nível de oclusão, velocidade do movimento e densidade do alvo, utilizando os mesmos critérios de agrupamento em todas as sequências avaliadas. As métricas relatadas seguiram o protocolo de avaliação descrito na Seção 7 do Protocolo. 

Figura 6 resume os resultados de rastreamento quantitativo sob diferentes categorias esportivas e condições de complexidade de cena. Figura 6A apresenta MOTA e DetA nas sequências de futebol, basquete e vôlei. Figura 6B apresenta a variação de MOTA sob diferentes níveis de oclusão, velocidade de movimento e densidade de alvo. Figura 6C apresenta os totais acumulados de FP e FN para cada dimensão de complexidade de cena.

figure-results-2
Figura 6. Desempenho de rastreamento nas categorias esportivas e condições de cena. (A) Precisão no Rastreamento de Múltiplos Objetos (MOTA) e Precisão na Detecção (DetA) no futebol, basquete, vôlei e na média geral. (B) MOTA nas condições representativas de cena com diferentes níveis de oclusão, densidade de jogadores e complexidade de movimento. (C) Números de Falsos Positivos (FPs) e Falsos Negativos (FNs) nas condições de cena avaliadas. Clique aqui para visualizar uma versão maior desta figura.

Nas três categorias esportivas, o JerseyTrack alcançou uma média de MOTA de 88,9% e uma média de DetA de 80,2%. A diferença na MOTA entre as categorias esportivas foi de 1,3 ponto percentual, com a MOTA mais alta observada nas sequências de vôlei (89,2%) e a mais baixa nas sequências de basquete (87,9%). A menor MOTA observada nas sequências de basquete é consistente com a maior frequência de interações em curta distância e oclusão densa nas sequências avaliadas. Em condições de cena menos complexas, incluindo oclusão leve, baixa velocidade de movimento e distribuição esparsa de alvos, a MOTA atingiu 91,8%, 93,1% e 93,8%, respectivamente. Em condições de cena mais complexas, a MOTA diminuiu para 84,9% sob oclusão pesada, 83,6% em movimento de alta velocidade e 83,1% em distribuição densa de alvos. Esses resultados mostram que o desempenho do rastreamento diminuiu à medida que a complexidade da cena aumentou, permanecendo dentro da faixa relatada nos cenários esportivos avaliados.

Rastreamento da consistência em cenários esportivos representativos:

Figura 7 apresenta exemplos representativos de rastreamento que ilustram a consistência temporal do JerseyTrack em três cenários esportivos desafiadores: interações densas entre jogadores, oclusão parcial prolongada e mudanças rápidas de direção. Ao longo dessas sequências representativas, o rastreador manteve identidades de trajetória consistentes, apesar da frequente sobreposição entre atletas e movimentos dinâmicos. A fragmentação de identidade foi observada principalmente durante oclusões severas ou quando as características da camisa ficaram temporariamente indisponíveis; no entanto, a estratégia de associação orientada por confiança permitiu a recuperação da trajetória quando detecções confiáveis reapareceram. Esses exemplos representativos apoiam qualitativamente os resultados quantitativos apresentados na Figura 6, demonstrando a preservação estável de identidade sob as condições de rastreamento esportivo avaliadas.

figure-results-3
Figura 7. Resultados representativos de rastreamento gerados pelo JerseyTrack. Quadros consecutivos de sequências de basquete, futebol e vôlei ilustram a manutenção das identidades e trajetórias dos atletas durante o rastreamento. Caixas delimitadoras coloridas representam identidades rastreadas mantidas ao longo de quadros de vídeo sucessivos. Clique aqui para visualizar uma versão maior desta figura.

Resultados da ablação para preservação de identidade:

Foi realizada uma análise de ablação para examinar as contribuições da estratégia de associação orientada pela confiança e do módulo de fusão semântica de camisas na preservação de identidade. Quatro variantes do modelo foram comparadas: V0, a linha de base sem associação orientada pela confiança ou fusão semântica de camisas; V1, a variante que utiliza apenas associação orientada pela confiança; V2, a variante que utiliza apenas fusão semântica de camisas; e V3, a configuração completa do JerseyTrack, que incorpora ambos os componentes. A avaliação concentrou-se em métricas relacionadas à identidade, incluindo IDs, IDF1, Precisão de Identidade (IDP) e Revocação de Identidade (IDR). Os padrões representativos de preservação de identidade são mostrados na Figura 8.

figure-results-4
Figura 8. Análise de ablação da associação semântica de camisa orientada pela confiança. (A) Número total de trocas de identidade (IDs) e pontuação IDentity F1 (IDF1) para as variantes do modelo avaliadas. (B) Comparação das IDs entre o modelo completo (V3) e a configuração básica (V0) em cenários representativos de rastreamento desafiadores. (C) IDF1, Precisão de Identidade (IDP) e Revocação de Identidade (IDR) do modelo completo em diferentes cenários de rastreamento. Clique aqui para visualizar uma versão maior desta figura.

Na configuração geral de validação do SportsMOT, a configuração completa V3 produziu o menor número de IDs e o maior IDF1 entre as quatro variantes do modelo. A V3 registrou 2.768 IDs, representando 477 trocas de identidade a menos do que a V0, e alcançou um IDF1 de 74,3%, o que representa um aumento de 7,1 pontos percentuais em relação à V0. Esses resultados indicam que os dois módulos contribuíram conjuntamente para a preservação da identidade nas condições de rastreamento esportivo avaliadas. A comparação das variantes com módulo único com a configuração completa mostrou ainda que os dois módulos afetaram diferentes fontes de erro de rastreamento. A estratégia de associação orientada por confiança reduziu erros de correspondência associados à instabilidade na confiança da detecção e à incerteza na localização, enquanto o módulo de fusão semântica da camisa forneceu informações adicionais de identidade quando a informação de movimento sozinha era insuficiente. A configuração completa V3 obteve desempenho superior em relação às métricas de identidade em comparação com cada variante de módulo único, sugerindo que os dois módulos proporcionaram contribuições complementares e não redundantes.

Os resultados em nível de cenário mostraram diferenças maiores sob condições mais desafiadoras de preservação de identidade. Durante occlusões de longa duração, o V3 registrou 215 IDs em comparação com 482 do V0. Em cenários densos com jogadores do mesmo time contendo 6–10 participantes, o V3 registrou 328 IDs em comparação com 615 do V0. Sob mudanças rápidas de direção em alta velocidade, o V3 registrou 482 IDs em comparação com 960 do V0. Essas reduções são consistentes com o uso pretendido de pistas semânticas durante occlusões e interações densas, bem como com a associação guiada por confiança sob flutuações na confiança da detecção durante movimentos rápidos. As tendências de IDP e IDR mostradas na Figura 8C indicam que a redução no número de IDs não foi acompanhada por uma redução substancial na precisão de identidade ou na recordação de identidade. A configuração completa manteve valores de IDF1 acima de 71% em todos os cenários desafiadores avaliados, com valores mais baixos observados em interações densas entre jogadores do mesmo time e mudanças rápidas de direção em alta velocidade. Esses resultados indicam uma melhoria na consistência de identidade sob as condições avaliadas, ao mesmo tempo em que identificam interações densas e movimento rápido como as principais fontes remanescentes de degradação de desempenho.

Resultados da avaliação entre conjuntos de dados:

A avaliação entre conjuntos de dados foi realizada para examinar se o comportamento de rastreamento observado no SportsMOT poderia ser mantido sob diferentes condições de conjuntos de dados. A avaliação incluiu dois conjuntos de dados específicos para esportes, SoccerNet Tracking e TeamTrack, e dois conjuntos de dados gerais de MOT, MOT17 e MOT20. O objetivo deste experimento foi analisar a transferência de desempenho entre diferentes tipos de conjuntos de dados. Os resultados não foram utilizados para afirmar superioridade direta em nível de métricas entre conjuntos de dados, pois os protocolos de anotação, a composição das cenas, os pontos de vista das câmeras e as categorias de alvo diferem.

Tabela 1 resume os resultados da avaliação entre conjuntos de dados. Nos conjuntos de dados específicos de esportes, o JerseyTrack manteve valores relativamente estáveis de MOTA e IDF1 em comparação com a configuração principal de validação do SportsMOT. Essa tendência sugere que a estratégia de associação orientada por confiança e as pistas semânticas relacionadas às camisas permaneceram eficazes quando as cenas de rastreamento mantiveram características visuais de esportes coletivos, incluindo uniformes repetidos, interações densas entre atletas e oclusão frequente. Nos conjuntos de dados gerais de MOT, o método manteve valores competitivos de MOTA e DetA, enquanto o IDF1 foi menor do que o observado nos conjuntos de dados específicos de esportes. Esse padrão é consistente com a ausência de pistas de cor da camisa e número do jogador no MOT17 e MOT20, que são utilizadas pelo módulo de fusão semântica. Nessas condições, o componente de associação orientada por confiança permaneceu aplicável, enquanto o ramo semântico contribuiu com menos informações específicas de identidade do que nas vídeos de esportes coletivos. De modo geral, esses resultados indicam que o JerseyTrack se transferiu mais eficazmente para conjuntos de dados contendo semântica visual específica de esportes do que para conjuntos de dados gerais de rastreamento de pedestres. A avaliação entre conjuntos de dados, portanto, apoia a aplicação pretendida do método como um rastreador voltado para esportes, ao mesmo tempo que identifica a ausência de semântica explícita de camisas como um fator limitante para conjuntos de dados MOT não esportivos.

Conjunto de dadosMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86,871,377,932,1
TeamTrack86,270,777,332,8
MOT1784,769,576,133,9
MOT2084,168,975,333,2

Tabela 1: Resultados da avaliação entre conjuntos de dados. Desempenho de rastreamento do JerseyTrack avaliado em quatro conjuntos de dados de referência públicos. São apresentados a Acurácia no Rastreamento de Múltiplos Objetos (MOTA), o Escore F1 de Identidade (IDF1), a Acurácia de Detecção (DetA) e a velocidade de processamento medida em Quadros por Segundo (FPS). Valores mais altos indicam melhor desempenho para MOTA, IDF1, DetA e FPS.

Robustez sob condições controladas de perturbação

Experimentos de perturbação controlada foram realizados para examinar a estabilidade do JerseyTrack sob perturbações visuais e de qualidade de detecção comuns em vídeos esportivos. As perturbações avaliadas foram agrupadas em três categorias: perturbação de características semânticas, perturbação de caixas de detecção e perturbação ambiental. As perturbações de características semânticas incluíram oclusão do número do jogador, desfoque da imagem, degradação da resolução e cores de camisetas semelhantes. As perturbações de caixas de detecção incluíram deslocamento da caixa delimitadora, flutuação da confiança da detecção e caixas de detecção falsas. As perturbações ambientais incluíram ruído semelhante à chuva, degradação semelhante à névoa, iluminação intensa e interferência de sombras. Figura 9 resume o desempenho do rastreamento sob essas condições de perturbação. Sob perturbação de características semânticas, o desempenho do rastreamento diminuiu à medida que a visibilidade do número do jogador e a qualidade do recorte pioraram. Quando 40% da região do número do jogador foi ocluída, o MOTA diminuiu em 3,2 pontos percentuais e o IDF1 diminuiu em 5,3 pontos percentuais em relação à condição sem perturbação, enquanto a precisão na extração semântica permaneceu em 86,7%. Esses resultados indicam que as pistas de cor da camiseta e número do jogador forneceram informações complementares quando uma das pistas semânticas tornou-se menos confiável. Sob perturbação de caixas de detecção, o método exibiu uma degradação moderada de desempenho, em vez de falha abrupta. Quando as caixas de detecção foram deslocadas em ±10 pixels e as pontuações de confiança foram perturbadas com ruído gaussiano, a diminuição no MOTA permaneceu abaixo de 3 pontos percentuais, e o aumento no número de IDs permaneceu dentro de 16%. Essa tendência é consistente com a estratégia de associação guiada pela confiança, na qual detecções de confiança média e baixa são processadas usando restrições adicionais de associação, em vez da mesma estratégia aplicada a detecções de alta confiança.

figure-results-5
Figura 9. Avaliação da robustez sob perturbações controladas. (A) Alterações na Acurácia de Rastreamento de Múltiplos Objetos (MOTA), Pontuação F1 de Identidade (IDF1) e Trocas de Identidade (IDs) com aumento da oclusão do número da camisa. (B) Degradação do desempenho sob condições representativas de interferência. (C) Aumento nas IDs sob diferentes tipos de interferência. (D) Acurácia na extração semântica da camisa sob as condições de perturbação avaliadas. Clique aqui para visualizar uma versão maior desta figura.

Sob perturbações ambientais, as reduções nas métricas primárias de rastreamento permaneceram abaixo de 5 pontos percentuais nas condições avaliadas, e a precisão da extração semântica manteve-se em 87,2%. O uso de descritores de cor baseados em HSV reduziu a sensibilidade a mudanças na iluminação, enquanto o ramo de OCR manteve informações utilizáveis dos números dos jogadores para um subconjunto de recortes de imagem borrados ou degradados. Esses resultados indicam que o módulo semântico permaneceu utilizável sob as condições de perturbação avaliadas, embora sua confiabilidade continue dependendo da visibilidade das camisas e da qualidade dos recortes. De modo geral, os experimentos controlados de perturbação mostraram que o JerseyTrack manteve desempenho de rastreamento mensurável sob as perturbações semânticas, de qualidade de detecção e ambientais avaliadas. Esses achados devem ser interpretados dentro do intervalo de perturbação testado. A reidentificação sistemática fora do campo de visão, o excesso de elementos de fundo e a oclusão completa de longa duração não foram avaliados separadamente neste experimento e são discutidos como limitações na seção Discussão.

Análise de contribuição de módulos e discriminação de características

A contribuição do módulo e a discriminação de características foram analisadas mais detalhadamente para examinar como os dois componentes propostos afetaram o desempenho no rastreamento relacionado à identidade. A análise de contribuição do módulo utilizou as quatro variantes do modelo definidas na análise de ablação, enquanto a análise de discriminação de características comparou características tradicionais de reidentificação (Re-ID), características baseadas apenas na cor, características baseadas apenas no número do jogador e características semânticas fundidas da camisa. A razão entre a distância interclasses e intraclasses foi utilizada para descrever a separabilidade das características, em que valores maiores indicam maior separação entre identidades diferentes em relação à variação dentro da mesma identidade. Tabela 2 resume a análise de contribuição do módulo. Na avaliação geral, a contribuição estimada da estratégia de associação guiada por confiança foi de 41,7%, a contribuição estimada da fusão semântica da camisa foi de 47,6% e os 10,7% restantes foram atribuídos ao uso combinado dos dois componentes. Esses valores indicam que ambos os componentes contribuíram para a melhoria observada, enquanto a configuração completa se beneficiou do uso conjunto dos dois componentes, e não de cada componente isoladamente. O padrão de contribuição variou conforme os tipos de cena. Em occlusões intensas, a contribuição estimada da fusão semântica da camisa aumentou para 69,4%, o que é consistente com a menor confiabilidade das pistas de movimento quando os atletas estavam parcial ou temporariamente ocultos. Em movimento de alta velocidade, a contribuição estimada da associação guiada por confiança atingiu 44,3%, e o ganho combinado atingiu 20,6%, indicando que a partição por nível de confiança tornou-se mais relevante quando a confiança da detecção flutuou devido ao movimento rápido ou à incerteza na localização.

Variante do modeloCenário de testeMOTA↑IDF1↑IDs↓Contribuição do móduloGanho sinérgico
V0 (Linha de base)Cena geral83,567,23245
Cenas severamente ocluídas77,861,53862
Cena de movimento em alta velocidade77,162,33689
V1 (Associação orientada por confiança)Cena geral86,370,9289341,7
Cenas severamente ocluídas80,965,9341529,8
Cena de movimento em alta velocidade81,467,9302444,3
V2 (Associação semântica de camisa)Cena geral85,271,8293747,6
Cenas severamente ocluídas82,772,8275369,4
Cena de movimento em alta velocidade80,166,8315735,1
V3 (JerseyTrack completo)Cena geral88,974,3276810,7
Cenas severamente ocluídas84,975,626890,8
Cena de movimento em alta velocidade83,671,5284220,6

Tabela 2: Análise de ablação das contribuições dos módulos. Comparação de desempenho de diferentes variantes do modelo JerseyTrack em cenários gerais, com oclusão severa e com movimento em alta velocidade. A Acurácia no Rastreamento de Múltiplos Objetos (MOTA), o Escore F1 de Identidade (IDF1) e o número de Trocas de Identidade (IDs) são apresentados juntamente com a contribuição estimada do módulo e o ganho sinérgico. Valores mais altos indicam melhor desempenho para MOTA, IDF1, contribuição do módulo e ganho sinérgico, enquanto valores mais baixos indicam melhor desempenho para IDs.

Tabela 3 resume a análise de discriminação de características. A característica semântica combinada da camisa alcançou uma razão de distância interclasse/intraclasse de 5,63, comparada a 1,82 para características tradicionais de Re-ID, correspondendo a uma melhoria relativa de 209,3% na medida da razão de distância. As características baseadas apenas na cor e apenas no número do jogador também melhoraram a separabilidade das características em relação às características tradicionais de Re-ID, embora cada pista individual permaneça suscetível a casos específicos de falha, incluindo cores semelhantes entre times, oclusão do número do jogador, borrão de movimento e regiões da camisa ilegíveis. Entre as representações de características avaliadas, a representação semântica combinada alcançou a maior separabilidade de características e correspondeu ao maior valor de IDF1 e à menor contagem de identidades observada na análise de ablação. Esses resultados apoiam o uso de pistas semânticas específicas da camisa como informação complementar de identidade para o rastreamento múltiplo em esportes (MOT) quando os atletas têm aparências semelhantes e a informação de movimento sozinha é insuficiente. Essas observações estão limitadas ao cenário SportsMOT avaliado e não devem ser interpretadas como evidência de que a semântica da camisa resolve toda ambiguidade de identidade em todos os vídeos esportivos.

Tipo de característicaRazão entre distância interclasse/intraclasseMelhoria relativa (%)IDF1↑IDs↓
Características tradicionais de reidentificação1.8265.73482
Características de cor da equipe3.1774,269,83125
Características do número do jogador3.4991,870,53018
Características semânticas combinadas da camisa5,63209,374,32768

Tabela 3: Análise de discriminação de diferentes representações de características. Comparação da discriminação de características utilizando características tradicionais de reidentificação (Re-ID), características de cor da camisa, características do número do jogador e características semânticas fundidas. São apresentadas a razão entre distância interclasse e intraclasse, a melhoria relativa na discriminação de características, a pontuação F1 de Identidade (IDF1) e o número de trocas de identidade (IDs). Valores mais altos indicam melhor desempenho para a razão de distância, melhoria relativa e IDF1, enquanto valores mais baixos indicam melhor desempenho para IDs.

Comparação de referência com métodos existentes de rastreamento de múltiplos objetos

Foi realizada uma comparação de referência para comparar o JerseyTrack com métodos representativos de MOT no mesmo cenário de validação SportsMOT. Os métodos comparados incluíram QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT e MOTR. Todos os métodos utilizaram as mesmas saídas do detector geradas pelo framework do detector listado na Tabela de Materiais, de modo que a comparação se concentrasse no desempenho da associação de rastreamento e não na variação do detector. A avaliação utilizou as métricas definidas na Seção 7 do Protocolo . As métricas principais de avaliação incluíram MOTA, HOTA e IDF1. As métricas auxiliares incluíram DetA, AssA, FPs, FNs e IDs. Tabela 4 resume a comparação quantitativa na divisão de validação SportsMOT, e Figura 10 apresenta uma comparação visual da precisão de rastreamento, velocidade de inferência e distribuição de HOTA nos cenários esportivos avaliados. O JerseyTrack obteve o maior valor de MOTA entre os métodos comparados, atingindo 88,9%. Esse valor foi 1,1 ponto percentual maior que o do Deep OC-SORT (87,8%) e 2,5 pontos percentuais maior que o do ByteTrack (86,4%). No cenário de validação SportsMOT avaliado, o JerseyTrack alcançou, portanto, a maior precisão geral de rastreamento entre os métodos comparados. Para HOTA, o JerseyTrack atingiu 69,9%, comparado a 64,4% do Deep OC-SORT e 62,8% do ByteTrack. Essas diferenças correspondem a melhorias de 5,5 e 7,1 pontos percentuais, respectivamente, indicando um equilíbrio superior entre desempenho de detecção e associação no mesmo cenário de avaliação.

MétodoMOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓IDs↓
QDTrack75,953,751,665,639,796.32489.8718.216
DeepSORT77,654,153,267,34476.22886.3196.836
ByteTrack86,462,867,773,850,933.75278.6984.192
FairMOT84,154,762,577,847,845.18783.6204.817
Deep OC-SORT87,864,469,978,252,125.01274.3853.211
MOTR82,957,258,468,946,154.93185.0635.137
JerseyTrack88,969,974,380,254,321.95367.1602.768

Tabela 4: Comparação de desempenho do JerseyTrack e de métodos representativos de rastreamento multiobjeto no conjunto de validação SportsMOT. Comparação do JerseyTrack com métodos representativos de rastreamento multiobjeto (MOT) no conjunto de dados de validação SportsMOT. As métricas relatadas incluem a Acurácia de Rastreamento Multiobjeto (MOTA), Acurácia de Rastreamento de Ordem Superior (HOTA), Pontuação F1 de Identidade (IDF1), Acurácia de Detecção (DetA), Acurácia de Associação (AssA), Falsos Positivos (FP), Falsos Negativos (FN) e o número de Trocas de Identidade (IDs). Valores mais altos indicam melhor desempenho para MOTA, HOTA, IDF1, DetA e AssA, enquanto valores mais baixos indicam melhor desempenho para FP, FN e IDs.

figure-results-6
Figura 10. Comparação de desempenho com métodos representativos de rastreamento múltiplo de objetos. (A) Comparação da Acurácia de Rastreamento de Múltiplos Objetos (MOTA) e Quadros por Segundo (FPS) para o JerseyTrack e métodos representativos de rastreamento múltiplo de objetos avaliados no conjunto de dados SportsMOT. (B) Distribuição da Acurácia de Rastreamento de Ordem Superior (HOTA) entre os métodos de rastreamento avaliados. Clique aqui para visualizar uma versão maior desta figura.

Para a preservação de identidade, o JerseyTrack alcançou um IDF1 de 74,3%, comparado com 69,9% do Deep OC-SORT e 67,7% do ByteTrack. O JerseyTrack também registrou 2.768 IDs, menos do que os 3.211 IDs registrados pelo Deep OC-SORT e os 4.192 IDs registrados pelo ByteTrack. Essas observações são consistentes com os resultados da análise por exclusão apresentados na Figura 8  e na Tabela 2, nos quais a configuração completa do JerseyTrack reduziu as trocas de identidade em relação às variantes do modelo de referência. Para a qualidade de detecção e associação, o JerseyTrack obteve um DetA de 80,2% e um AssA de 54,3%. Em comparação com o Deep OC-SORT, o JerseyTrack melhorou o DetA em 2,0 pontos percentuais e o AssA em 2,2 pontos percentuais. O JerseyTrack também produziu menos FP e FN do que os outros métodos comparados relatados na Tabela 4, registrando 21.953 FP e 67.160 FN. No geral, a comparação de referência mostrou que o JerseyTrack alcançou os valores mais altos para as métricas principais de rastreamento entre os métodos avaliados no cenário de validação SportsMOT. Esses resultados são consistentes com as melhorias observadas na preservação de identidade e na estabilidade de associação obtidas com a associação guiada por confiança e a fusão semântica de camisas. A comparação limita-se às saídas do detector compartilhado e à configuração de validação SportsMOT utilizada neste estudo.

Resultados da sensibilidade dos parâmetros

Foi realizada uma análise de sensibilidade de parâmetros para examinar como parâmetros-chave de implementação afetaram o desempenho de rastreamento na configuração de validação SportsMOT. Três parâmetros foram avaliados: o coeficiente de ponderação da perda OCR (γ), o número de agrupamento hierárquico por nível de confiança (K) e a taxa de aprendizado da rede OCR (η). Tabela 5 resume os valores de MOTA, IDF1, HOTA e IDs obtidos sob diferentes configurações de parâmetros.

ParâmetroValorMOTA↑IDF1↑HOTA↑IDs↓
Peso da perda OCR (γ)0,284,769,466,22.944
0,486,371,568,22.893
0,687,973,168,92.815
0,8 (ótimo)88,974,369,92.768
188,273,869,32.792
Número de agrupamentos de confiança (K)286,772,168,52.876
3 (ótimo)88,974,369,92.768
488,173,669,72.803
587,372,869,22.851
Taxa de aprendizado OCR (η)1 × 10⁻⁴85,970,867,32.934
5 × 10⁻⁴87,672,768,72.832
1 × 10⁻³ (ótimo)88,974,369,92.768
5 × 10⁻³87,873,2692.817
1 × 10⁻²86,571,668,72.889

Tabela 5: Análise de sensibilidade de parâmetros. Desempenho de rastreamento obtido utilizando diferentes configurações de parâmetros para o JerseyTrack. A Acurácia de Rastreamento de Múltiplos Objetos (MOTA), o Escore F1 de Identidade (IDF1), a Acurácia de Rastreamento de Ordem Superior (HOTA) e o número de Trocas de Identidade (IDs) são relatados para diferentes valores do coeficiente de ponderação da perda de Reconhecimento Óptico de Caracteres (OCR) (γ), do número de agrupamentos de confiança (K) e da taxa de aprendizado do OCR (η). Os valores de parâmetros identificados como ótimos correspondem às configurações utilizadas nos experimentos relatados. Valores mais altos indicam melhor desempenho para MOTA, IDF1 e HOTA, enquanto valores mais baixos indicam melhor desempenho para IDs.

Para o coeficiente de ponderação da perda OCR (γ), o melhor desempenho avaliado foi obtido em γ = 0,8. Nessas condições, o JerseyTrack alcançou um MOTA de 88,9%, um IDF1 de 74,3%, um HOTA de 69,9% e 2.768 IDs. Quando γ foi reduzido para 0,2, os valores de MOTA, IDF1 e HOTA diminuíram para 84,7%, 69,4% e 66,2%, respectivamente, enquanto o número de IDs aumentou para 2.944. Quando γ foi aumentado para 1,0, as métricas de desempenho diminuíram ligeiramente em comparação com γ = 0,8, resultando em um MOTA de 88,2%, um IDF1 de 73,8%, um HOTA de 69,3% e 2.792 IDs. Esses resultados indicam que uma supervisão insuficiente da OCR reduziu a discriminação dos números dos jogadores, enquanto o aumento da ponderação da perda OCR além do valor ótimo avaliado não melhorou o desempenho de rastreamento nas condições testadas.

Para o número hierárquico de agrupamento por nível de confiança (K), o melhor desempenho avaliado foi obtido em K = 3. Essa configuração corresponde à estratégia de associação de alta, média e baixa confiança descrita no método. Quando K = 2, a partição por confiança foi menos granular, e MOTA, IDF1 e HOTA diminuíram para 86,7%, 72,1% e 68,5%, respectivamente. Quando K aumentou para 4 ou 5, o desempenho também diminuiu em relação a K = 3, sugerindo que uma partição excessiva dividiu as detecções em grupos de confiança excessivamente estreitos e reduziu a estabilidade da estratégia de associação. Esses resultados apoiam o uso de três níveis de confiança na configuração avaliada do JerseyTrack.

Para a taxa de aprendizado (η) da rede OCR, o melhor desempenho avaliado foi obtido em η = 1 × 10-3. Em uma taxa de aprendizado menor de 1 × 10-4, MOTA, IDF1 e HOTA diminuíram para 85,9%, 70,8% e 67,3%, respectivamente, enquanto o número de IDs aumentou para 2.934. Em uma taxa de aprendizado maior de 1 × 10-2, MOTA, IDF1 e HOTA diminuíram para 86,5%, 71,6% e 68,7%, respectivamente, enquanto o número de IDs aumentou para 2.889. Esses resultados indicam que o ramo OCR foi sensível à seleção da taxa de aprendizado, sendo que 1 × 10-3 proporcionou o melhor equilíbrio entre o reconhecimento do número dos jogadores e o desempenho na preservação de identidades nas condições avaliadas.

No geral, a Tabela 5 mostra que a combinação de parâmetros γ = 0.8, K = 3 e η = 1 × 10-3 produziu os valores mais altos avaliados de MOTA, IDF1 e HOTA, juntamente com o menor número de IDs. A análise de sensibilidade também mostrou que desvios moderados desses valores de parâmetros resultaram em mudanças mensuráveis, mas não abruptas, no desempenho do rastreamento. Assim, essas configurações de parâmetros foram utilizadas para a comparação de referência e os experimentos principais de validação do SportsMOT relatados neste estudo.

Disponibilidade de Dados

Os resumos brutos de avaliação, as saídas finais de rastreamento, os registros do ambiente, os arquivos de mapeamento do conjunto de dados e os arquivos intermediários de resumo que sustentam os resultados deste estudo estão disponíveis em um repositório público em https://doi.org/10.5281/zenodo.21274353. Os conjuntos de dados públicos originais utilizados neste estudo, incluindo SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 e MOT20, estão disponíveis por meio de seus respectivos provedores e não são redistribuídos no repositório.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo avaliou um fluxo de trabalho de rastreamento múltiplo de objetos em esportes guiado por confiança, que combina a partição baseada na confiança da detecção com pistas semânticas das camisetas. A associação guiada por confiança e a fusão de características semânticas foram investigadas como estratégias complementares para melhorar a associação de dados no rastreamento múltiplo de objetos12,20,23,24,46. Os resultados mostram que a configuração completa do JerseyTrack melhorou a preservação de identidade e a estabilidade da associação na configuração de validação SportsMOT avaliada. O principal resultado de validação SportsMOT alcançou um MOTA de 88,9%, um HOTA de 69,9%, um IDF1 de 74,3%, um DetA de 80,2% e um AssA de 54,3%. Esses valores devem ser interpretados dentro da fonte de saída do detector, divisão do conjunto de dados e configuração do TrackEval descritas no Protocolo.

Uma etapa crítica no fluxo de trabalho é a partição por nível de confiança, que permite aplicar diferentes estratégias de associação de acordo com a confiabilidade das saídas do detector20,22,23,24. Ao separar as detecções em grupos de alta, média e baixa confiança, o JerseyTrack aplica regras de associação distintas às detecções com diferentes níveis de confiabilidade. As detecções de alta confiança são principalmente associadas por consistência de movimento, enquanto as de média confiança utilizam conjuntamente o movimento e a semântica da camisa. As detecções de baixa confiança não são usadas para inicializar novas trajetórias e são consideradas apenas durante a recuperação de trajetórias. Esse design reduziu o risco de que detecções fracas ou falsos positivos criassem identidades instáveis, ao mesmo tempo em que permitiu que detecções parciais contribuíssem para a recuperação quando evidências semânticas adicionais estavam disponíveis8,11,20. A segunda etapa crítica é a extração da semântica da camisa. As características da cor da equipe fornecem uma restrição em nível de equipe, enquanto as características do número do jogador fornecem uma pista de identidade mais refinada quando a região do número está visível e legível35,41,42,43. Os resultados de ablação indicam que essas pistas são mais úteis em casos de interação densa entre membros da mesma equipe e occlusões, nos quais a associação baseada apenas no movimento é menos confiável. No entanto, a semântica da camisa deve ser tratada como evidência auxiliar, e não como substituição completa da associação por movimento. Os números dos jogadores podem ser ilegíveis sob desfoque, truncamento, poses de costas, occlusões severas ou baixa resolução da imagem. As características da cor da equipe também não conseguem distinguir atletas da mesma equipe quando a informação do número não está disponível35,42,43. Os resultados com conjuntos de dados cruzados esclarecem ainda mais o escopo do método. O JerseyTrack se transferiu de forma mais natural para conjuntos de dados de esportes coletivos do que para conjuntos de dados gerais de rastreamento de pedestres (MOT), porque o ramo semântico foi projetado com base nas pistas de cor da camisa e número do jogador19,33,34,35,36,37. Em conjuntos de dados MOT gerais, o componente de associação orientada pela confiança permaneceu aplicável, mas o ramo semântico específico para esportes contribuiu com menos informação de identidade. Portanto, o método é mais adequado para vídeos de esportes coletivos nos quais os atletas usam uniformes distinguíveis e a região da camisa é suficientemente visível para a extração semântica19,33,34,35,36,37.

Várias limitações permanecem. Primeiro, o método depende da qualidade das saídas do detector; detecções perdidas graves ou caixas delimitadoras imprecisas reduzem a confiabilidade tanto da previsão de movimento quanto do recorte semântico14,17,46. Segundo, a reidentificação de longo prazo fora do campo de visão não foi otimizada separadamente na implementação atual. Quando um atleta sai do campo de visão da câmera por um período prolongado e depois retorna, a estratégia atual de recuperação de trajetória pode não ser suficiente para restaurar a identidade original19,34. Terceiro, poluição de fundo acentuada, sobreposição de jogadores, borrão de movimento e números nas camisetas ilegíveis podem reduzir a confiabilidade das características semânticas14,35,42,46. Quarto, a avaliação atual concentrou-se em conjuntos de dados de referência públicos e configurações de perturbação controladas; a implantação em vídeos de transmissão com cortes de câmera, mudanças de zoom e pontos de vista não padronizados pode exigir pré-processamento adicional ou módulos de reidentificação19,33,34.

A principal implicação prática é que a associação orientada por confiança e as pistas semânticas específicas da camisa podem ser integradas a um fluxo de trabalho modular de rastreamento de múltiplos objetos sem alterar a estrutura do detector. Essa capacidade é aplicável a tarefas de análise esportiva, como extração de trajetórias de atletas, análise de movimentação de equipe, revisão de eventos táticos e anotação de vídeo semi-automática1,4,33,36. Trabalhos futuros devem focar em reidentificação mais robusta fora do campo de visão, tratamento de ruídos de fundo, agregação de características temporais e reconhecimento mais confiável de números de jogadores sob desfoque severo ou oclusão14,19,34,46.

Em resumo, o JerseyTrack é um método de MOT esportivo que combina associação guiada por confiança com fusão semântica de camisetas. O método particiona as detecções em grupos de alta, média e baixa confiança e aplica diferentes regras de associação de acordo com a confiabilidade das detecções, utilizando ao mesmo tempo as cores das camisetas e os números dos jogadores como informações auxiliares de identidade durante a associação de confiança média e a recuperação de trajetórias. Na configuração de validação SportsMOT avaliada, o JerseyTrack demonstrou maior precisão no rastreamento e melhor preservação de identidade em comparação com as configurações básicas avaliadas. Os resultados de análise ablativa mostraram que a configuração completa reduziu as trocas de identidade em comparação com a configuração básica e com as variantes de módulo único, e a comparação com benchmarks revelou valores superiores nas métricas principais de rastreamento sob configurações compartilhadas de saída do detector e de avaliação. Esses resultados apoiam o uso de informações por nível de confiança e pistas semânticas específicas da camiseta para o rastreamento de atletas em vídeos de esportes coletivos, especialmente quando as regiões das camisetas são visíveis e as informações sobre a cor da equipe ou o número do jogador fornecem evidências complementares de identidade20,35,46. O enfrentamento das limitações identificadas pode melhorar ainda mais a aplicabilidade do fluxo de trabalho proposto em cenários de rastreamento esportivo mais desafiadores.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não têm conflitos financeiros de interesse.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm agradecimentos a declarar.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Tempo de execução CUDANVIDIAVersão 12.8Tempo de execução de computação GPU utilizado para o treinamento do detector, extração de características semânticas e inferência de rastreamento.
EasyOCRJaided AIVersão 1.7.2Kit de ferramentas de reconhecimento óptico de caracteres utilizado para o reconhecimento de números dos jogadores.
Código-fonte do JerseyTrackAutoresN/AImplementação personalizada contendo os scripts de preparação de dados, extração de características semânticas, particionamento de confiança, rastreamento, pós-processamento e avaliação. Disponível em: https://doi.org/10.5281/zenodo.21274352
Modelo OCR CRNN leveAutoresN/ARede neural convolucional recorrente (CRNN) personalizada utilizada para o reconhecimento de números dos jogadores.
Conjunto de dados MOT17MOTChallengeN/AConjunto de dados público de referência utilizado para avaliação entre conjuntos de dados. Disponível em: https://motchallenge.net/data/MOT17/
Conjunto de dados MOT20MOTChallengeN/AConjunto de dados público de referência utilizado para avaliação entre conjuntos de dados. Disponível em: https://motchallenge.net/data/MOT20/
motmetricsDesenvolvedores do motmetricsVersão 1.4.0Biblioteca utilizada para o cálculo diagnóstico de métricas de rastreamento de múltiplos objetos.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Unidade de processamento gráfico utilizada para o treinamento do detector e inferência de rastreamento.
Driver da GPU NVIDIANVIDIAVersão 610.62Driver da GPU utilizado no ambiente experimental.
NumPyDesenvolvedores do NumPyVersão 2.4.4Biblioteca de computação numérica utilizada para processamento de características e manipulação de dados.
OpenCVOpenCVVersão 4.10.0Biblioteca de visão computacional utilizada para carregamento, recorte, pré-processamento e visualização de imagens.
PythonPython Software FoundationVersão 3.12.2Linguagem de programação utilizada em todo o fluxo de trabalho.
PyTorchPyTorch FoundationVersão 2.11.0+cu128Framework de aprendizado profundo utilizado para a implementação do detector e do modelo semântico.
scikit-learnDesenvolvedores do scikit-learnVersão 1.9.0Biblioteca de aprendizado de máquina utilizada para agrupamento K-means durante a extração de cor da camisa e particionamento de confiança.
Conjunto de dados SoccerNet TrackingSoccerNetN/AConjunto de dados público de rastreamento de futebol utilizado para avaliação entre conjuntos de dados. Disponível em: https://www.soccer-net.org/tasks/tracking
Conjunto de dados SportsMOTSportsMOT BenchmarkN/AConjunto de dados principal de referência utilizado para preparação do detector e avaliação de rastreamento. Disponível em: https://deeperaction.github.io/datasets/sportsmot.html
Conjunto de dados TeamTrackTeamTrack BenchmarkN/AConjunto de dados público de rastreamento esportivo utilizado para avaliação entre conjuntos de dados. Disponível em: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationVersão 0.26.0+cu128Biblioteca de visão computacional utilizada com o PyTorch para transformação de imagens e suporte a modelos.
TrackEvalDesenvolvedores do TrackEvalVersão 1.3.0Kit de ferramentas de avaliação utilizado para calcular a Acurácia de Rastreamento de Múltiplos Objetos (MOTA), Pontuação F1 de Identidade (IDF1), Acurácia de Rastreamento de Ordem Superior (HOTA), Acurácia de Detecção (DetA), Acurácia de Associação (AssA), falsos positivos (FP), falsos negativos (FN) e trocas de identidade (IDs).
UltralyticsUltralyticsVersão 8.4.90Framework de detecção de objetos utilizado para treinar o detector e gerar detecções de atletas.

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Rastreamento Guiado por Confian aTrajet ria do JogadorSimilaridade de MovimentoCor da CamisetaReconhecimento ptico de CaracteresConsist ncia de IdentidadeConjunto de Dados SportsMOT

Artigos relacionados