$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Esta seção apresenta os resultados quantitativos e qualitativos obtidos a partir dos experimentos avaliados de rastreamento múltiplo em esportes. Os resultados enfocam a precisão do rastreamento, a preservação de identidade, a qualidade da associação e a robustez nas configurações do conjunto de dados testadas. As afirmações sobre desempenho restringem-se aos métodos avaliados, conjuntos de dados, saídas do detector e configuração da ferramenta de avaliação descritos no Protocolo e na Configuração de Implementação.
Configuração experimental e desenho da avaliação
Conjunto de dados e pré-processamento:
O SportsMOT foi utilizado como referência principal para a preparação do detector, inferência de rastreamento e avaliação quantitativa. O conjunto de dados contém 240 sequências de vídeo e mais de 150.000 quadros de imagem em cenários de futebol, basquete e vôlei (Figura 5). Na avaliação formal, os principais resultados do SportsMOT foram calculados utilizando a divisão de validação juntamente com as saídas do detector, configuração de rastreamento e configurações do TrackEval descritas no Protocolo. A avaliação cruzada entre conjuntos de dados foi realizada nos conjuntos TeamTrack, SoccerNet Tracking, MOT17 e MOT20 para examinar a transferência de desempenho entre diferentes tipos de conjuntos de dados, e não para fazer comparações diretas em nível de métricas entre os conjuntos de dados.

Figura 5. Conjuntos de dados representativos utilizados para avaliação. Quadros de exemplo ilustram sequências representativas de futebol, basquete e vôlei utilizadas para avaliação experimental. A figura destaca as variações no ponto de vista da câmera, densidade de jogadores e complexidade da cena entre os conjuntos de dados avaliados. Clique aqui para visualizar uma versão maior desta figura.
Os dados do SportsMOT foram organizados de acordo com a estrutura oficial do conjunto de dados e convertidos para o formato de treinamento do detector descrito no Protocolo. Os dados de treinamento e validação do SportsMOT convertidos continham 90 sequências, 55.544 quadros e 608.152 objetos anotados. A partição de treinamento foi utilizada para o preparo do detector e ajuste de parâmetros, enquanto a partição de validação foi usada para a avaliação formal de rastreamento relatada neste estudo. Todos os quadros de entrada foram redimensionados de acordo com a configuração do detector descrita no Protocolo e na Tabela de Materiais. O mesmo procedimento de pré-processamento foi aplicado durante o preparo do detector, extração de características semânticas, inferência de rastreamento e avaliação com o TrackEval, de modo que as diferenças relatadas refletissem principalmente a estratégia de associação de rastreamento e não diferenças no processamento dos dados.
Indicadores de avaliação:
O desempenho do rastreamento foi avaliado usando um protocolo de avaliação compatível com o MOTChallenge, implementado com o kit de avaliação listado na Tabela de Materiais. As métricas relatadas descrevem três aspectos do desempenho do rastreamento múltiplo em esportes: precisão geral do rastreamento, preservação de identidade e qualidade da detecção e associação. MOTA, IDF1 e HOTA foram utilizadas como métricas principais de avaliação44,45. A MOTA resume falsos positivos, falsos negativos e trocas de identidade em uma pontuação geral de precisão de rastreamento. A IDF1 mede a consistência entre as trajetórias previstas e as identidades reais. A HOTA avalia conjuntamente a precisão da detecção e a precisão da associação, caracterizando, portanto, o equilíbrio entre localização do alvo e associação da trajetória. DetA e AssA foram relatadas como métricas complementares. FPs, FNs e Trocas de Identidade (IDs) foram utilizadas para caracterizar fontes de erro relacionadas a detecções incorretas, detecções perdidas e mudanças de identidade. Para comparações entre métodos no SportsMOT, foram utilizadas as mesmas saídas do detector e configuração do kit de avaliação, a fim de reduzir a influência da variação do detector e das diferenças nas configurações de avaliação. Para comparações entre conjuntos de dados, os valores das métricas foram interpretados como resultados de avaliação dentro do mesmo conjunto de dados, e não como evidência de superioridade absoluta de desempenho entre diferentes conjuntos de dados.
Ambiente experimental e configuração de parâmetros:
Os experimentos foram conduzidos utilizando os recursos de hardware e software listados na Tabela de Materiais. O mesmo ambiente computacional, estrutura do detector, saídas do detector e kit de avaliação foram utilizados em todos os experimentos principais de SportsMOT para manter a consistência durante a preparação do detector, inferência de rastreamento e avaliação de desempenho. A estrutura do detector listada na Tabela de Materiais foi treinada com um tamanho de lote de 16, uma taxa de aprendizado inicial de 0,01 e 80 épocas de treinamento. No módulo de extração semântica de camisas, o agrupamento de cores utilizou K-médias com K = 3, e o ramo OCR utilizou uma rede neural recorrente convolucional leve com um tamanho de entrada de 128 × 64 pixels. O ramo OCR foi otimizado utilizando o otimizador adaptativo listado na Tabela de Materiais com uma taxa de aprendizado de 1 × 10⁻3, uma decaimento de peso de 1 × 10⁻5, um tamanho de lote de 64 e 40 épocas de treinamento. Nenhum agendamento adicional de taxa de aprendizado foi utilizado durante o treinamento do módulo de extração de características semânticas. O coeficiente de ponderação da perda OCR (γ) foi tratado como um hiperparâmetro definido pelo usuário e selecionado com base no desempenho no conjunto de validação. A estratificação por nível de confiança utilizou particionamento adaptativo por K-médias, no qual τ₁ e τ₂ foram calculados a partir da distribuição de confiança de detecção de cada quadro, em vez de serem pré-definidos manualmente antes da inferência.
Desempenho no rastreamento entre esportes e complexidade de cenário
Desempenho quantitativo sob diferentes esportes e condições de cena:
O desempenho de rastreamento foi avaliado sob dois fatores de agrupamento: categoria do esporte e complexidade da cena. A análise por categoria de esporte incluiu sequências de futebol, basquete e vôlei. A análise de complexidade da cena considerou o nível de oclusão, velocidade do movimento e densidade do alvo, utilizando os mesmos critérios de agrupamento em todas as sequências avaliadas. As métricas relatadas seguiram o protocolo de avaliação descrito na Seção 7 do Protocolo.
Figura 6 resume os resultados de rastreamento quantitativo sob diferentes categorias esportivas e condições de complexidade de cena. Figura 6A apresenta MOTA e DetA nas sequências de futebol, basquete e vôlei. Figura 6B apresenta a variação de MOTA sob diferentes níveis de oclusão, velocidade de movimento e densidade de alvo. Figura 6C apresenta os totais acumulados de FP e FN para cada dimensão de complexidade de cena.

Figura 6. Desempenho de rastreamento nas categorias esportivas e condições de cena. (A) Precisão no Rastreamento de Múltiplos Objetos (MOTA) e Precisão na Detecção (DetA) no futebol, basquete, vôlei e na média geral. (B) MOTA nas condições representativas de cena com diferentes níveis de oclusão, densidade de jogadores e complexidade de movimento. (C) Números de Falsos Positivos (FPs) e Falsos Negativos (FNs) nas condições de cena avaliadas. Clique aqui para visualizar uma versão maior desta figura.
Nas três categorias esportivas, o JerseyTrack alcançou uma média de MOTA de 88,9% e uma média de DetA de 80,2%. A diferença na MOTA entre as categorias esportivas foi de 1,3 ponto percentual, com a MOTA mais alta observada nas sequências de vôlei (89,2%) e a mais baixa nas sequências de basquete (87,9%). A menor MOTA observada nas sequências de basquete é consistente com a maior frequência de interações em curta distância e oclusão densa nas sequências avaliadas. Em condições de cena menos complexas, incluindo oclusão leve, baixa velocidade de movimento e distribuição esparsa de alvos, a MOTA atingiu 91,8%, 93,1% e 93,8%, respectivamente. Em condições de cena mais complexas, a MOTA diminuiu para 84,9% sob oclusão pesada, 83,6% em movimento de alta velocidade e 83,1% em distribuição densa de alvos. Esses resultados mostram que o desempenho do rastreamento diminuiu à medida que a complexidade da cena aumentou, permanecendo dentro da faixa relatada nos cenários esportivos avaliados.
Rastreamento da consistência em cenários esportivos representativos:
Figura 7 apresenta exemplos representativos de rastreamento que ilustram a consistência temporal do JerseyTrack em três cenários esportivos desafiadores: interações densas entre jogadores, oclusão parcial prolongada e mudanças rápidas de direção. Ao longo dessas sequências representativas, o rastreador manteve identidades de trajetória consistentes, apesar da frequente sobreposição entre atletas e movimentos dinâmicos. A fragmentação de identidade foi observada principalmente durante oclusões severas ou quando as características da camisa ficaram temporariamente indisponíveis; no entanto, a estratégia de associação orientada por confiança permitiu a recuperação da trajetória quando detecções confiáveis reapareceram. Esses exemplos representativos apoiam qualitativamente os resultados quantitativos apresentados na Figura 6, demonstrando a preservação estável de identidade sob as condições de rastreamento esportivo avaliadas.

Figura 7. Resultados representativos de rastreamento gerados pelo JerseyTrack. Quadros consecutivos de sequências de basquete, futebol e vôlei ilustram a manutenção das identidades e trajetórias dos atletas durante o rastreamento. Caixas delimitadoras coloridas representam identidades rastreadas mantidas ao longo de quadros de vídeo sucessivos. Clique aqui para visualizar uma versão maior desta figura.
Resultados da ablação para preservação de identidade:
Foi realizada uma análise de ablação para examinar as contribuições da estratégia de associação orientada pela confiança e do módulo de fusão semântica de camisas na preservação de identidade. Quatro variantes do modelo foram comparadas: V0, a linha de base sem associação orientada pela confiança ou fusão semântica de camisas; V1, a variante que utiliza apenas associação orientada pela confiança; V2, a variante que utiliza apenas fusão semântica de camisas; e V3, a configuração completa do JerseyTrack, que incorpora ambos os componentes. A avaliação concentrou-se em métricas relacionadas à identidade, incluindo IDs, IDF1, Precisão de Identidade (IDP) e Revocação de Identidade (IDR). Os padrões representativos de preservação de identidade são mostrados na Figura 8.

Figura 8. Análise de ablação da associação semântica de camisa orientada pela confiança. (A) Número total de trocas de identidade (IDs) e pontuação IDentity F1 (IDF1) para as variantes do modelo avaliadas. (B) Comparação das IDs entre o modelo completo (V3) e a configuração básica (V0) em cenários representativos de rastreamento desafiadores. (C) IDF1, Precisão de Identidade (IDP) e Revocação de Identidade (IDR) do modelo completo em diferentes cenários de rastreamento. Clique aqui para visualizar uma versão maior desta figura.
Na configuração geral de validação do SportsMOT, a configuração completa V3 produziu o menor número de IDs e o maior IDF1 entre as quatro variantes do modelo. A V3 registrou 2.768 IDs, representando 477 trocas de identidade a menos do que a V0, e alcançou um IDF1 de 74,3%, o que representa um aumento de 7,1 pontos percentuais em relação à V0. Esses resultados indicam que os dois módulos contribuíram conjuntamente para a preservação da identidade nas condições de rastreamento esportivo avaliadas. A comparação das variantes com módulo único com a configuração completa mostrou ainda que os dois módulos afetaram diferentes fontes de erro de rastreamento. A estratégia de associação orientada por confiança reduziu erros de correspondência associados à instabilidade na confiança da detecção e à incerteza na localização, enquanto o módulo de fusão semântica da camisa forneceu informações adicionais de identidade quando a informação de movimento sozinha era insuficiente. A configuração completa V3 obteve desempenho superior em relação às métricas de identidade em comparação com cada variante de módulo único, sugerindo que os dois módulos proporcionaram contribuições complementares e não redundantes.
Os resultados em nível de cenário mostraram diferenças maiores sob condições mais desafiadoras de preservação de identidade. Durante occlusões de longa duração, o V3 registrou 215 IDs em comparação com 482 do V0. Em cenários densos com jogadores do mesmo time contendo 6–10 participantes, o V3 registrou 328 IDs em comparação com 615 do V0. Sob mudanças rápidas de direção em alta velocidade, o V3 registrou 482 IDs em comparação com 960 do V0. Essas reduções são consistentes com o uso pretendido de pistas semânticas durante occlusões e interações densas, bem como com a associação guiada por confiança sob flutuações na confiança da detecção durante movimentos rápidos. As tendências de IDP e IDR mostradas na Figura 8C indicam que a redução no número de IDs não foi acompanhada por uma redução substancial na precisão de identidade ou na recordação de identidade. A configuração completa manteve valores de IDF1 acima de 71% em todos os cenários desafiadores avaliados, com valores mais baixos observados em interações densas entre jogadores do mesmo time e mudanças rápidas de direção em alta velocidade. Esses resultados indicam uma melhoria na consistência de identidade sob as condições avaliadas, ao mesmo tempo em que identificam interações densas e movimento rápido como as principais fontes remanescentes de degradação de desempenho.
Resultados da avaliação entre conjuntos de dados:
A avaliação entre conjuntos de dados foi realizada para examinar se o comportamento de rastreamento observado no SportsMOT poderia ser mantido sob diferentes condições de conjuntos de dados. A avaliação incluiu dois conjuntos de dados específicos para esportes, SoccerNet Tracking e TeamTrack, e dois conjuntos de dados gerais de MOT, MOT17 e MOT20. O objetivo deste experimento foi analisar a transferência de desempenho entre diferentes tipos de conjuntos de dados. Os resultados não foram utilizados para afirmar superioridade direta em nível de métricas entre conjuntos de dados, pois os protocolos de anotação, a composição das cenas, os pontos de vista das câmeras e as categorias de alvo diferem.
Tabela 1 resume os resultados da avaliação entre conjuntos de dados. Nos conjuntos de dados específicos de esportes, o JerseyTrack manteve valores relativamente estáveis de MOTA e IDF1 em comparação com a configuração principal de validação do SportsMOT. Essa tendência sugere que a estratégia de associação orientada por confiança e as pistas semânticas relacionadas às camisas permaneceram eficazes quando as cenas de rastreamento mantiveram características visuais de esportes coletivos, incluindo uniformes repetidos, interações densas entre atletas e oclusão frequente. Nos conjuntos de dados gerais de MOT, o método manteve valores competitivos de MOTA e DetA, enquanto o IDF1 foi menor do que o observado nos conjuntos de dados específicos de esportes. Esse padrão é consistente com a ausência de pistas de cor da camisa e número do jogador no MOT17 e MOT20, que são utilizadas pelo módulo de fusão semântica. Nessas condições, o componente de associação orientada por confiança permaneceu aplicável, enquanto o ramo semântico contribuiu com menos informações específicas de identidade do que nas vídeos de esportes coletivos. De modo geral, esses resultados indicam que o JerseyTrack se transferiu mais eficazmente para conjuntos de dados contendo semântica visual específica de esportes do que para conjuntos de dados gerais de rastreamento de pedestres. A avaliação entre conjuntos de dados, portanto, apoia a aplicação pretendida do método como um rastreador voltado para esportes, ao mesmo tempo que identifica a ausência de semântica explícita de camisas como um fator limitante para conjuntos de dados MOT não esportivos.
| Conjunto de dados | MOTA↑ | IDF1↑ | DetA↑ | FPS↑ |
| SoccerNet Tracking | 86,8 | 71,3 | 77,9 | 32,1 |
| TeamTrack | 86,2 | 70,7 | 77,3 | 32,8 |
| MOT17 | 84,7 | 69,5 | 76,1 | 33,9 |
| MOT20 | 84,1 | 68,9 | 75,3 | 33,2 |
Tabela 1: Resultados da avaliação entre conjuntos de dados. Desempenho de rastreamento do JerseyTrack avaliado em quatro conjuntos de dados de referência públicos. São apresentados a Acurácia no Rastreamento de Múltiplos Objetos (MOTA), o Escore F1 de Identidade (IDF1), a Acurácia de Detecção (DetA) e a velocidade de processamento medida em Quadros por Segundo (FPS). Valores mais altos indicam melhor desempenho para MOTA, IDF1, DetA e FPS.
Robustez sob condições controladas de perturbação
Experimentos de perturbação controlada foram realizados para examinar a estabilidade do JerseyTrack sob perturbações visuais e de qualidade de detecção comuns em vídeos esportivos. As perturbações avaliadas foram agrupadas em três categorias: perturbação de características semânticas, perturbação de caixas de detecção e perturbação ambiental. As perturbações de características semânticas incluíram oclusão do número do jogador, desfoque da imagem, degradação da resolução e cores de camisetas semelhantes. As perturbações de caixas de detecção incluíram deslocamento da caixa delimitadora, flutuação da confiança da detecção e caixas de detecção falsas. As perturbações ambientais incluíram ruído semelhante à chuva, degradação semelhante à névoa, iluminação intensa e interferência de sombras. Figura 9 resume o desempenho do rastreamento sob essas condições de perturbação. Sob perturbação de características semânticas, o desempenho do rastreamento diminuiu à medida que a visibilidade do número do jogador e a qualidade do recorte pioraram. Quando 40% da região do número do jogador foi ocluída, o MOTA diminuiu em 3,2 pontos percentuais e o IDF1 diminuiu em 5,3 pontos percentuais em relação à condição sem perturbação, enquanto a precisão na extração semântica permaneceu em 86,7%. Esses resultados indicam que as pistas de cor da camiseta e número do jogador forneceram informações complementares quando uma das pistas semânticas tornou-se menos confiável. Sob perturbação de caixas de detecção, o método exibiu uma degradação moderada de desempenho, em vez de falha abrupta. Quando as caixas de detecção foram deslocadas em ±10 pixels e as pontuações de confiança foram perturbadas com ruído gaussiano, a diminuição no MOTA permaneceu abaixo de 3 pontos percentuais, e o aumento no número de IDs permaneceu dentro de 16%. Essa tendência é consistente com a estratégia de associação guiada pela confiança, na qual detecções de confiança média e baixa são processadas usando restrições adicionais de associação, em vez da mesma estratégia aplicada a detecções de alta confiança.

Figura 9. Avaliação da robustez sob perturbações controladas. (A) Alterações na Acurácia de Rastreamento de Múltiplos Objetos (MOTA), Pontuação F1 de Identidade (IDF1) e Trocas de Identidade (IDs) com aumento da oclusão do número da camisa. (B) Degradação do desempenho sob condições representativas de interferência. (C) Aumento nas IDs sob diferentes tipos de interferência. (D) Acurácia na extração semântica da camisa sob as condições de perturbação avaliadas. Clique aqui para visualizar uma versão maior desta figura.
Sob perturbações ambientais, as reduções nas métricas primárias de rastreamento permaneceram abaixo de 5 pontos percentuais nas condições avaliadas, e a precisão da extração semântica manteve-se em 87,2%. O uso de descritores de cor baseados em HSV reduziu a sensibilidade a mudanças na iluminação, enquanto o ramo de OCR manteve informações utilizáveis dos números dos jogadores para um subconjunto de recortes de imagem borrados ou degradados. Esses resultados indicam que o módulo semântico permaneceu utilizável sob as condições de perturbação avaliadas, embora sua confiabilidade continue dependendo da visibilidade das camisas e da qualidade dos recortes. De modo geral, os experimentos controlados de perturbação mostraram que o JerseyTrack manteve desempenho de rastreamento mensurável sob as perturbações semânticas, de qualidade de detecção e ambientais avaliadas. Esses achados devem ser interpretados dentro do intervalo de perturbação testado. A reidentificação sistemática fora do campo de visão, o excesso de elementos de fundo e a oclusão completa de longa duração não foram avaliados separadamente neste experimento e são discutidos como limitações na seção Discussão.
Análise de contribuição de módulos e discriminação de características
A contribuição do módulo e a discriminação de características foram analisadas mais detalhadamente para examinar como os dois componentes propostos afetaram o desempenho no rastreamento relacionado à identidade. A análise de contribuição do módulo utilizou as quatro variantes do modelo definidas na análise de ablação, enquanto a análise de discriminação de características comparou características tradicionais de reidentificação (Re-ID), características baseadas apenas na cor, características baseadas apenas no número do jogador e características semânticas fundidas da camisa. A razão entre a distância interclasses e intraclasses foi utilizada para descrever a separabilidade das características, em que valores maiores indicam maior separação entre identidades diferentes em relação à variação dentro da mesma identidade. Tabela 2 resume a análise de contribuição do módulo. Na avaliação geral, a contribuição estimada da estratégia de associação guiada por confiança foi de 41,7%, a contribuição estimada da fusão semântica da camisa foi de 47,6% e os 10,7% restantes foram atribuídos ao uso combinado dos dois componentes. Esses valores indicam que ambos os componentes contribuíram para a melhoria observada, enquanto a configuração completa se beneficiou do uso conjunto dos dois componentes, e não de cada componente isoladamente. O padrão de contribuição variou conforme os tipos de cena. Em occlusões intensas, a contribuição estimada da fusão semântica da camisa aumentou para 69,4%, o que é consistente com a menor confiabilidade das pistas de movimento quando os atletas estavam parcial ou temporariamente ocultos. Em movimento de alta velocidade, a contribuição estimada da associação guiada por confiança atingiu 44,3%, e o ganho combinado atingiu 20,6%, indicando que a partição por nível de confiança tornou-se mais relevante quando a confiança da detecção flutuou devido ao movimento rápido ou à incerteza na localização.
| Variante do modelo | Cenário de teste | MOTA↑ | IDF1↑ | IDs↓ | Contribuição do módulo | Ganho sinérgico |
| V0 (Linha de base) | Cena geral | 83,5 | 67,2 | 3245 | – | – |
| Cenas severamente ocluídas | 77,8 | 61,5 | 3862 | – | – |
| Cena de movimento em alta velocidade | 77,1 | 62,3 | 3689 | – | – |
| V1 (Associação orientada por confiança) | Cena geral | 86,3 | 70,9 | 2893 | 41,7 | – |
| Cenas severamente ocluídas | 80,9 | 65,9 | 3415 | 29,8 | – |
| Cena de movimento em alta velocidade | 81,4 | 67,9 | 3024 | 44,3 | – |
| V2 (Associação semântica de camisa) | Cena geral | 85,2 | 71,8 | 2937 | 47,6 | – |
| Cenas severamente ocluídas | 82,7 | 72,8 | 2753 | 69,4 | – |
| Cena de movimento em alta velocidade | 80,1 | 66,8 | 3157 | 35,1 | – |
| V3 (JerseyTrack completo) | Cena geral | 88,9 | 74,3 | 2768 | – | 10,7 |
| Cenas severamente ocluídas | 84,9 | 75,6 | 2689 | – | 0,8 |
| Cena de movimento em alta velocidade | 83,6 | 71,5 | 2842 | – | 20,6 |
Tabela 2: Análise de ablação das contribuições dos módulos. Comparação de desempenho de diferentes variantes do modelo JerseyTrack em cenários gerais, com oclusão severa e com movimento em alta velocidade. A Acurácia no Rastreamento de Múltiplos Objetos (MOTA), o Escore F1 de Identidade (IDF1) e o número de Trocas de Identidade (IDs) são apresentados juntamente com a contribuição estimada do módulo e o ganho sinérgico. Valores mais altos indicam melhor desempenho para MOTA, IDF1, contribuição do módulo e ganho sinérgico, enquanto valores mais baixos indicam melhor desempenho para IDs.
Tabela 3 resume a análise de discriminação de características. A característica semântica combinada da camisa alcançou uma razão de distância interclasse/intraclasse de 5,63, comparada a 1,82 para características tradicionais de Re-ID, correspondendo a uma melhoria relativa de 209,3% na medida da razão de distância. As características baseadas apenas na cor e apenas no número do jogador também melhoraram a separabilidade das características em relação às características tradicionais de Re-ID, embora cada pista individual permaneça suscetível a casos específicos de falha, incluindo cores semelhantes entre times, oclusão do número do jogador, borrão de movimento e regiões da camisa ilegíveis. Entre as representações de características avaliadas, a representação semântica combinada alcançou a maior separabilidade de características e correspondeu ao maior valor de IDF1 e à menor contagem de identidades observada na análise de ablação. Esses resultados apoiam o uso de pistas semânticas específicas da camisa como informação complementar de identidade para o rastreamento múltiplo em esportes (MOT) quando os atletas têm aparências semelhantes e a informação de movimento sozinha é insuficiente. Essas observações estão limitadas ao cenário SportsMOT avaliado e não devem ser interpretadas como evidência de que a semântica da camisa resolve toda ambiguidade de identidade em todos os vídeos esportivos.
| Tipo de característica | Razão entre distância interclasse/intraclasse | Melhoria relativa (%) | IDF1↑ | IDs↓ |
| Características tradicionais de reidentificação | 1.82 | – | 65.7 | 3482 |
| Características de cor da equipe | 3.17 | 74,2 | 69,8 | 3125 |
| Características do número do jogador | 3.49 | 91,8 | 70,5 | 3018 |
| Características semânticas combinadas da camisa | 5,63 | 209,3 | 74,3 | 2768 |
Tabela 3: Análise de discriminação de diferentes representações de características. Comparação da discriminação de características utilizando características tradicionais de reidentificação (Re-ID), características de cor da camisa, características do número do jogador e características semânticas fundidas. São apresentadas a razão entre distância interclasse e intraclasse, a melhoria relativa na discriminação de características, a pontuação F1 de Identidade (IDF1) e o número de trocas de identidade (IDs). Valores mais altos indicam melhor desempenho para a razão de distância, melhoria relativa e IDF1, enquanto valores mais baixos indicam melhor desempenho para IDs.
Comparação de referência com métodos existentes de rastreamento de múltiplos objetos
Foi realizada uma comparação de referência para comparar o JerseyTrack com métodos representativos de MOT no mesmo cenário de validação SportsMOT. Os métodos comparados incluíram QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT e MOTR. Todos os métodos utilizaram as mesmas saídas do detector geradas pelo framework do detector listado na Tabela de Materiais, de modo que a comparação se concentrasse no desempenho da associação de rastreamento e não na variação do detector. A avaliação utilizou as métricas definidas na Seção 7 do Protocolo . As métricas principais de avaliação incluíram MOTA, HOTA e IDF1. As métricas auxiliares incluíram DetA, AssA, FPs, FNs e IDs. Tabela 4 resume a comparação quantitativa na divisão de validação SportsMOT, e Figura 10 apresenta uma comparação visual da precisão de rastreamento, velocidade de inferência e distribuição de HOTA nos cenários esportivos avaliados. O JerseyTrack obteve o maior valor de MOTA entre os métodos comparados, atingindo 88,9%. Esse valor foi 1,1 ponto percentual maior que o do Deep OC-SORT (87,8%) e 2,5 pontos percentuais maior que o do ByteTrack (86,4%). No cenário de validação SportsMOT avaliado, o JerseyTrack alcançou, portanto, a maior precisão geral de rastreamento entre os métodos comparados. Para HOTA, o JerseyTrack atingiu 69,9%, comparado a 64,4% do Deep OC-SORT e 62,8% do ByteTrack. Essas diferenças correspondem a melhorias de 5,5 e 7,1 pontos percentuais, respectivamente, indicando um equilíbrio superior entre desempenho de detecção e associação no mesmo cenário de avaliação.
| Método | MOTA↑ | HOTA↑ | IDF1↑ | DetA↑ | AssA↑ | FP↓ | FN↓ | IDs↓ |
| QDTrack | 75,9 | 53,7 | 51,6 | 65,6 | 39,7 | 96.324 | 89.871 | 8.216 |
| DeepSORT | 77,6 | 54,1 | 53,2 | 67,3 | 44 | 76.228 | 86.319 | 6.836 |
| ByteTrack | 86,4 | 62,8 | 67,7 | 73,8 | 50,9 | 33.752 | 78.698 | 4.192 |
| FairMOT | 84,1 | 54,7 | 62,5 | 77,8 | 47,8 | 45.187 | 83.620 | 4.817 |
| Deep OC-SORT | 87,8 | 64,4 | 69,9 | 78,2 | 52,1 | 25.012 | 74.385 | 3.211 |
| MOTR | 82,9 | 57,2 | 58,4 | 68,9 | 46,1 | 54.931 | 85.063 | 5.137 |
| JerseyTrack | 88,9 | 69,9 | 74,3 | 80,2 | 54,3 | 21.953 | 67.160 | 2.768 |
Tabela 4: Comparação de desempenho do JerseyTrack e de métodos representativos de rastreamento multiobjeto no conjunto de validação SportsMOT. Comparação do JerseyTrack com métodos representativos de rastreamento multiobjeto (MOT) no conjunto de dados de validação SportsMOT. As métricas relatadas incluem a Acurácia de Rastreamento Multiobjeto (MOTA), Acurácia de Rastreamento de Ordem Superior (HOTA), Pontuação F1 de Identidade (IDF1), Acurácia de Detecção (DetA), Acurácia de Associação (AssA), Falsos Positivos (FP), Falsos Negativos (FN) e o número de Trocas de Identidade (IDs). Valores mais altos indicam melhor desempenho para MOTA, HOTA, IDF1, DetA e AssA, enquanto valores mais baixos indicam melhor desempenho para FP, FN e IDs.

Figura 10. Comparação de desempenho com métodos representativos de rastreamento múltiplo de objetos. (A) Comparação da Acurácia de Rastreamento de Múltiplos Objetos (MOTA) e Quadros por Segundo (FPS) para o JerseyTrack e métodos representativos de rastreamento múltiplo de objetos avaliados no conjunto de dados SportsMOT. (B) Distribuição da Acurácia de Rastreamento de Ordem Superior (HOTA) entre os métodos de rastreamento avaliados. Clique aqui para visualizar uma versão maior desta figura.
Para a preservação de identidade, o JerseyTrack alcançou um IDF1 de 74,3%, comparado com 69,9% do Deep OC-SORT e 67,7% do ByteTrack. O JerseyTrack também registrou 2.768 IDs, menos do que os 3.211 IDs registrados pelo Deep OC-SORT e os 4.192 IDs registrados pelo ByteTrack. Essas observações são consistentes com os resultados da análise por exclusão apresentados na Figura 8 e na Tabela 2, nos quais a configuração completa do JerseyTrack reduziu as trocas de identidade em relação às variantes do modelo de referência. Para a qualidade de detecção e associação, o JerseyTrack obteve um DetA de 80,2% e um AssA de 54,3%. Em comparação com o Deep OC-SORT, o JerseyTrack melhorou o DetA em 2,0 pontos percentuais e o AssA em 2,2 pontos percentuais. O JerseyTrack também produziu menos FP e FN do que os outros métodos comparados relatados na Tabela 4, registrando 21.953 FP e 67.160 FN. No geral, a comparação de referência mostrou que o JerseyTrack alcançou os valores mais altos para as métricas principais de rastreamento entre os métodos avaliados no cenário de validação SportsMOT. Esses resultados são consistentes com as melhorias observadas na preservação de identidade e na estabilidade de associação obtidas com a associação guiada por confiança e a fusão semântica de camisas. A comparação limita-se às saídas do detector compartilhado e à configuração de validação SportsMOT utilizada neste estudo.
Resultados da sensibilidade dos parâmetros
Foi realizada uma análise de sensibilidade de parâmetros para examinar como parâmetros-chave de implementação afetaram o desempenho de rastreamento na configuração de validação SportsMOT. Três parâmetros foram avaliados: o coeficiente de ponderação da perda OCR (γ), o número de agrupamento hierárquico por nível de confiança (K) e a taxa de aprendizado da rede OCR (η). Tabela 5 resume os valores de MOTA, IDF1, HOTA e IDs obtidos sob diferentes configurações de parâmetros.
| Parâmetro | Valor | MOTA↑ | IDF1↑ | HOTA↑ | IDs↓ |
| Peso da perda OCR (γ) | 0,2 | 84,7 | 69,4 | 66,2 | 2.944 |
| 0,4 | 86,3 | 71,5 | 68,2 | 2.893 |
| 0,6 | 87,9 | 73,1 | 68,9 | 2.815 |
| 0,8 (ótimo) | 88,9 | 74,3 | 69,9 | 2.768 |
| 1 | 88,2 | 73,8 | 69,3 | 2.792 |
| Número de agrupamentos de confiança (K) | 2 | 86,7 | 72,1 | 68,5 | 2.876 |
| 3 (ótimo) | 88,9 | 74,3 | 69,9 | 2.768 |
| 4 | 88,1 | 73,6 | 69,7 | 2.803 |
| 5 | 87,3 | 72,8 | 69,2 | 2.851 |
| Taxa de aprendizado OCR (η) | 1 × 10⁻⁴ | 85,9 | 70,8 | 67,3 | 2.934 |
| 5 × 10⁻⁴ | 87,6 | 72,7 | 68,7 | 2.832 |
| 1 × 10⁻³ (ótimo) | 88,9 | 74,3 | 69,9 | 2.768 |
| 5 × 10⁻³ | 87,8 | 73,2 | 69 | 2.817 |
| 1 × 10⁻² | 86,5 | 71,6 | 68,7 | 2.889 |
Tabela 5: Análise de sensibilidade de parâmetros. Desempenho de rastreamento obtido utilizando diferentes configurações de parâmetros para o JerseyTrack. A Acurácia de Rastreamento de Múltiplos Objetos (MOTA), o Escore F1 de Identidade (IDF1), a Acurácia de Rastreamento de Ordem Superior (HOTA) e o número de Trocas de Identidade (IDs) são relatados para diferentes valores do coeficiente de ponderação da perda de Reconhecimento Óptico de Caracteres (OCR) (γ), do número de agrupamentos de confiança (K) e da taxa de aprendizado do OCR (η). Os valores de parâmetros identificados como ótimos correspondem às configurações utilizadas nos experimentos relatados. Valores mais altos indicam melhor desempenho para MOTA, IDF1 e HOTA, enquanto valores mais baixos indicam melhor desempenho para IDs.
Para o coeficiente de ponderação da perda OCR (γ), o melhor desempenho avaliado foi obtido em γ = 0,8. Nessas condições, o JerseyTrack alcançou um MOTA de 88,9%, um IDF1 de 74,3%, um HOTA de 69,9% e 2.768 IDs. Quando γ foi reduzido para 0,2, os valores de MOTA, IDF1 e HOTA diminuíram para 84,7%, 69,4% e 66,2%, respectivamente, enquanto o número de IDs aumentou para 2.944. Quando γ foi aumentado para 1,0, as métricas de desempenho diminuíram ligeiramente em comparação com γ = 0,8, resultando em um MOTA de 88,2%, um IDF1 de 73,8%, um HOTA de 69,3% e 2.792 IDs. Esses resultados indicam que uma supervisão insuficiente da OCR reduziu a discriminação dos números dos jogadores, enquanto o aumento da ponderação da perda OCR além do valor ótimo avaliado não melhorou o desempenho de rastreamento nas condições testadas.
Para o número hierárquico de agrupamento por nível de confiança (K), o melhor desempenho avaliado foi obtido em K = 3. Essa configuração corresponde à estratégia de associação de alta, média e baixa confiança descrita no método. Quando K = 2, a partição por confiança foi menos granular, e MOTA, IDF1 e HOTA diminuíram para 86,7%, 72,1% e 68,5%, respectivamente. Quando K aumentou para 4 ou 5, o desempenho também diminuiu em relação a K = 3, sugerindo que uma partição excessiva dividiu as detecções em grupos de confiança excessivamente estreitos e reduziu a estabilidade da estratégia de associação. Esses resultados apoiam o uso de três níveis de confiança na configuração avaliada do JerseyTrack.
Para a taxa de aprendizado (η) da rede OCR, o melhor desempenho avaliado foi obtido em η = 1 × 10-3. Em uma taxa de aprendizado menor de 1 × 10-4, MOTA, IDF1 e HOTA diminuíram para 85,9%, 70,8% e 67,3%, respectivamente, enquanto o número de IDs aumentou para 2.934. Em uma taxa de aprendizado maior de 1 × 10-2, MOTA, IDF1 e HOTA diminuíram para 86,5%, 71,6% e 68,7%, respectivamente, enquanto o número de IDs aumentou para 2.889. Esses resultados indicam que o ramo OCR foi sensível à seleção da taxa de aprendizado, sendo que 1 × 10-3 proporcionou o melhor equilíbrio entre o reconhecimento do número dos jogadores e o desempenho na preservação de identidades nas condições avaliadas.
No geral, a Tabela 5 mostra que a combinação de parâmetros γ = 0.8, K = 3 e η = 1 × 10-3 produziu os valores mais altos avaliados de MOTA, IDF1 e HOTA, juntamente com o menor número de IDs. A análise de sensibilidade também mostrou que desvios moderados desses valores de parâmetros resultaram em mudanças mensuráveis, mas não abruptas, no desempenho do rastreamento. Assim, essas configurações de parâmetros foram utilizadas para a comparação de referência e os experimentos principais de validação do SportsMOT relatados neste estudo.
Disponibilidade de Dados
Os resumos brutos de avaliação, as saídas finais de rastreamento, os registros do ambiente, os arquivos de mapeamento do conjunto de dados e os arquivos intermediários de resumo que sustentam os resultados deste estudo estão disponíveis em um repositório público em https://doi.org/10.5281/zenodo.21274353. Os conjuntos de dados públicos originais utilizados neste estudo, incluindo SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 e MOT20, estão disponíveis por meio de seus respectivos provedores e não são redistribuídos no repositório.