Para verificar a eficácia do modelo proposto de fusão YOLOv11 e CNN no monitoramento de segurança em linhas de produção, foi construído um conjunto de dados que abrange diversos cenários de riscos à segurança. Este conjunto contém 12.000 imagens de cenas de linhas de produção, divididas em conjuntos de treinamento, validação e teste na proporção 7:1,5:1,5, com uma semente aleatória fixa de 42. Ele abrange diversas condições de trabalho, incluindo iluminação normal, baixa iluminação, oclusão parcial, oclusão acentuada, desfoque de movimento e fundos complexos. O limiar de confiança para inferência foi definido em 0,5 e o limiar de supressão não máxima (NMS) foi definido em 0,45. Todos os experimentos foram repetidos três vezes e os resultados são apresentados como média ± desvio padrão. As categorias de anotação são trabalhadores, capacetes de segurança, braços robóticos, áreas perigosas, ferramentas e veículos, utilizando o formato PASCAL Visual Object Classes (VOC). O limiar de interseção sobre união (IoU) é definido como 0,5 e a consistência das anotações é verificada por meio de validação cruzada entre duas pessoas. As imagens de entrada foram uniformemente redimensionadas para 640 × 640 e aumentadas com dados Mosaic. O treinamento foi realizado utilizando o otimizador SGD com taxa de aprendizado inicial de 0,01, momento de 0,9, decaimento de peso de 0,0005 e tamanho de lote de 32. O treinamento foi executado por 200 épocas, sendo utilizada a programação de annealing cosseno para ajustar a taxa de aprendizado.
Para avaliar minuciosamente a eficácia do modelo, foram utilizadas diversas métricas de avaliação: precisão média (mAP), quadros por segundo (FPS) para medir a taxa de processamento de quadros de imagem, precisão para avaliar a exatidão das previsões positivas, revocação para medir a capacidade do modelo em detectar verdadeiros positivos e área sob a curva (AUC) para indicar a área sob a curva característica de operação do receptor (ROC), refletindo assim a capacidade geral de classificação do modelo. As fórmulas de cálculo são apresentadas nas Equações (4), (5), (6), (7), (8), (9), (10), (11):
(4)
(5)
(6)
Revocação
(7)
(8)
(9)
(10)
(11)
Aqui, mAP@0.5 indica a precisão média média em um limiar de IoU de 0,5; N é o número de categorias; APi é a precisão média da i-ésima categoria; e mAP@[0.5:0.95] é o mAP médio calculado ao longo dos limiares de IoU de 0,5 a 0,95. TP, FP, FN e TN representam os números de verdadeiros positivos, falsos positivos, falsos negativos e verdadeiros negativos, respectivamente. F é o número total de quadros processados, T é o tempo total de processamento, TPR é a taxa de verdadeiros positivos e FPR é a taxa de falsos positivos.
Para o componente de detecção YOLOv11, a função de perda é apresentada na Equação (12):
(12)
Onde Lcoord denota o desvio entre o quadro previsto e o quadro real, Lconf mede o erro de confiança do quadro previsto, Lclass mede o erro de predição de categoria, e λcoord, λconf e λclass são os coeficientes de peso utilizados para equilibrar as perdas correspondentes.
A análise dos dados na Tabela 1 mostra que o método proposto alcança um mAP@0.5 de 0,91 e um mAP@0.5:0.95 de 0,82, representando melhorias de 0,04 e 0,04, respectivamente, em comparação com o YOLOv5. Seu escore F1 é de 0,935, o que também é superior ao dos modelos comparativos. A velocidade de detecção é de 120 FPS, quatro vezes maior que a do Faster R-CNN, mas ligeiramente inferior à do YOLOv10 e do YOLOv11. O número de parâmetros é de 6,7M, apenas 1,5M a mais que o YOLOv11, com uma melhoria de 0,03 no mAP@0.5. Em comparação com o EfficientDet, que possui custo computacional semelhante, a precisão é 0,06 maior, enquanto o número de parâmetros é 56% menor. Os dados demonstram que a fusão multi-escala e o mecanismo de atenção introduzidos melhoram efetivamente a precisão na detecção de alvos pequenos, alcançando um bom equilíbrio entre velocidade e precisão. Em resumo, o nosso método proposto alcança um equilíbrio entre precisão e velocidade de detecção. O mAP@0.5 é 0,02 maior que o do segundo melhor modelo, o escore F1 atinge 0,935 e os 6,7M de parâmetros são suficientes para implantação prática. O mecanismo de fusão multi-escala e atenção aprimora o reconhecimento de alvos pequenos e ocluídos em cenas complexas. O modelo equilibra precisão e eficiência, tornando-o adequado para cenários em tempo real, como monitoramento de segurança industrial. Vale ressaltar que todos os modelos comparativos utilizam pesos pré-treinados oficiais, com resolução de entrada uniforme de 640 × 640, limiar de NMS de 0,45 e limiar de confiança de 0,5.
| Método | mAP@0.5 | mAP@0.5:0.95 | Pontuação F1 | FPS | Parâmetros (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| NOSSO | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
Tabela 1: Tabela abrangente de comparação do desempenho dos modelos. A análise dos dados mostra que o método proposto alcança mAP@0.5 de 0,91 e mAP@0.5:0,95 de 0,82, representando melhorias de 0,04 e 0,04, respectivamente, em relação ao YOLOv5. Seu escore F1 é de 0,935, o que também é superior aos dos modelos comparativos. A velocidade de detecção é de 120 FPS, quatro vezes maior que a do Faster R-CNN, mas ligeiramente inferior à do YOLOv10 e do YOLOv11. O número de parâmetros é de 6,7 M, apenas 1,5 M a mais que o YOLOv11, com uma melhoria de 0,03 no mAP@0.5. Em comparação com o EfficientDet, que possui custo computacional semelhante, a precisão é 0,06 maior, enquanto o número de parâmetros é 56% menor. Os dados demonstram que a fusão multi-escala e o mecanismo de atenção introduzidos melhoram efetivamente a precisão na detecção de alvos pequenos, alcançando um bom equilíbrio entre velocidade e precisão. Em resumo, o nosso método proposto alcança um equilíbrio entre precisão e velocidade de detecção. O mAP@0.5 é 0,02 maior que o do segundo melhor modelo, o escore F1 atinge 0,935 e os 6,7 M de parâmetros são suficientes para implantação prática. O mecanismo de fusão multi-escala e atenção aprimora o reconhecimento de alvos pequenos e ocluídos em cenas complexas. O modelo equilibra precisão e eficiência, tornando-o adequado para cenários em tempo real, como monitoramento de segurança industrial. Vale ressaltar que todos os modelos comparativos utilizam pesos pré-treinados oficiais, com resolução de entrada uniforme de 640 × 640, limiar uniforme de NMS de 0,45 e limiar de confiança uniforme de 0,5.
Figura 2 apresenta uma análise aprofundada dos tipos de detecção incorreta do modelo. O YOLOv11 + CNN apresenta a menor taxa de detecções incorretas em fundo (85 vezes/10.000 quadros), com a maioria das detecções incorretas ocorrendo em objetos semelhantes (62 vezes) e em cenas parcialmente ocluídas (48 vezes). A análise da curva ROC indica que a taxa de verdadeiros positivos (TPR) do modelo atingiu 0,9 (AUC = 0,98) com uma taxa de falsos positivos (FPR) de 0,1, e o espaçamento mais estreito entre as curvas apoia a alta confiabilidade da confiança na detecção. Esses resultados de análise não apenas sustentam o desempenho do modelo, mas também fornecem um roteiro técnico claro para a otimização subsequente de detecções incorretas, particularmente mediante o fortalecimento de sua capacidade de distinguir objetos semelhantes.

Figura 2. Análise de erro. Análise dos tipos de detecção incorreta do modelo. O YOLOv11 + CNN apresenta a menor taxa de detecções incorretas de fundo (85 vezes/10.000 quadros), com a maioria das detecções incorretas concentrada em objetos semelhantes (62 vezes) e cenas parcialmente ocluídas (48 vezes). A análise da curva ROC indica que a taxa de verdadeiros positivos (TPR) do modelo atingiu 0,9 (AUC = 0,98) com uma taxa de falsos positivos (FPR) de 0,1, e o menor espaçamento entre as curvas apoia a confiabilidade da confiança na detecção. Esses resultados de análise não apenas comprovam o desempenho do modelo, mas também fornecem um roteiro técnico claro para a otimização subsequente de detecções incorretas, particularmente ao reforçar sua capacidade de distinguir objetos semelhantes. Clique aqui para visualizar uma versão maior desta figura.
Figura 3 compara o desempenho do modelo em várias plataformas de hardware. O YOLOv11 + CNN alcança uma latência ultra-baixa de 18 ms na unidade de processamento tensorial de borda (TPU), com uma flutuação de apenas ±2 ms, e o consumo de energia é controlado em 15 W. Testes de taxa de transferência demonstram que o modelo atinge uma velocidade de processamento de 70 FPS em dispositivos de computação de borda Jetson Xavier, com a latência do percentil 99 controlada dentro de 50 ms. Esses indicadores de desempenho de implantação permitem que ele se adapte às necessidades de implantação em diversas plataformas de computação em áreas industriais. A análise de erro mostra ainda que o modelo pode manter um desempenho estável em ambientes com recursos limitados, demonstrando sua aplicabilidade em engenharia.

Figura 3. Desempenho na implantação. Comparação do desempenho do modelo em várias plataformas de hardware. O YOLOv11 + CNN alcança uma latência ultra-baixa de 18 ms na Edge TPU (com uma flutuação de apenas ±2 ms), e o consumo de energia é controlado em 15 W. Os testes de taxa de transferência demonstram que o modelo atinge uma velocidade de processamento de 70 FPS em dispositivos de computação de borda Jetson Xavier, com a latência do percentil 99 mantida dentro de 50 ms. Esses indicadores de desempenho na implantação indicam que ele pode atender às necessidades de implantação em diversas plataformas de computação em ambientes industriais. A análise de erros mostra ainda que o modelo consegue manter desempenho estável em ambientes com recursos limitados, demonstrando sua aplicabilidade em engenharia. Clique aqui para visualizar uma versão maior desta figura.
Figura 4 compara as diferenças no desempenho de detecção de cada modelo nas seis categorias-alvo. O YOLOv11 + CNN alcançou uma precisão de 0,96 na tarefa de reconhecimento de capacete de segurança, superando o modelo de referência em 4 pontos percentuais. O gráfico pontilhado indica que o modelo apresenta flutuações mínimas de desempenho entre as categorias (±0,05), refletindo suas capacidades de generalização. A matriz de confusão, apresentada como um mapa de calor, revela uma detecção falsa mútua de 15% entre a área perigosa e o braço robótico. Esse resultado fornece uma orientação clara para a otimização subsequente do modelo.

Figura 4. Análise de detecção por categoria. Comparação das diferenças de desempenho de cada modelo nas seis categorias-alvo. O YOLOv11 + CNN alcançou uma acurácia de 0,96 na tarefa de reconhecimento de capacete de segurança, superando o modelo de referência em quatro pontos percentuais. O gráfico pontilhado indica que o modelo apresenta flutuações mínimas de desempenho entre as categorias (±0,05), refletindo suas capacidades de generalização. A matriz de confusão, apresentada como um mapa de calor, revela uma detecção falsa mútua de 15% entre a área de risco e o braço robótico. Esse resultado fornece uma direção clara para a otimização subsequente do modelo. Clique aqui para visualizar uma versão maior desta figura.
Figura 5 fornece um registro abrangente do processo de treinamento para cada modelo. O YOLOv11 + CNN apresenta a taxa de convergência mais rápida, com a perda caindo para 0,1 em menos de 30 épocas, e a diferença entre a curva de mAP do conjunto de validação e a do conjunto de treinamento é consistentemente inferior a 1%. A análise do gráfico da banda de erro mostra que o mAP@0,5 final do modelo na validação é estável em 0,94 ± 0,01, e sua amplitude de flutuação de desempenho é apenas um terço daquela do RetinaNet. Esses resultados corroboram a eficácia do protocolo de treinamento conjunto. O modelo demonstra vantagens de desempenho nos estágios iniciais do treinamento, indicando que seu design arquitetônico permite que aprenda características rapidamente.

Figura 5. Análise do processo de treinamento. Registro do processo de treinamento para cada modelo. O YOLOv11 + CNN apresenta a taxa de convergência mais rápida (a perda cai para 0,1 em menos de 30 épocas), e a diferença entre a curva de mAP do conjunto de validação e a do conjunto de treinamento é sempre inferior a 1%. A análise do gráfico de faixa de erro mostra que o mAP@0,5 final de validação do modelo é estável em 0,94 ± 0,01, e a amplitude da flutuação de desempenho é apenas um terço daquela do RetinaNet. Esses resultados comprovam a eficácia do protocolo de treinamento conjunto. O modelo demonstra vantagens de desempenho nos estágios iniciais do treinamento, indicando que seu design arquitetônico permite que aprenda características rapidamente. Clique aqui para visualizar uma versão maior desta figura.
Tabela 2 apresenta os resultados quantitativos de desempenho para diferentes modelos de detecção em ambientes complexos. Os dados de teste em condições padrão de iluminação e em diversos cenários extremos mostram que o YOLOv11 + CNN mantém desempenho ótimo sob todas as condições. Em condições padrão de iluminação, o mAP@0,5 deste modelo atingiu 0,91, significativamente melhor do que o YOLOv5 (0,87) e o Faster R-CNN (0,84). Com a deterioração das condições ambientais, o desempenho de cada modelo diminui em graus variados, mas o YOLOv11 + CNN demonstra a maior robustez ambiental: em condições de pouca luz (< 50 lux), o desempenho diminui apenas 3% (para 0,88), o que é melhor do que a redução de 5% observada no modelo comparativo; em cenários com alta oclusão (> 50%), seu mAP ainda pode ser mantido em 0,78, e a degradação de desempenho (13%) é significativamente menor do que a do YOLOv5 (15%) e do Faster R-CNN (16%). Esses resultados demonstram que o YOLOv11 + CNN melhora a adaptabilidade do modelo a fatores complexos, como variações de iluminação e oclusões, por meio de mecanismos aprimorados de fusão de características e atenção, apoiando assim aplicações práticas em cenários industriais.
| Condição do Teste | YOLOv11 + CNN | YOLOv5 | Faster R-CNN | Flutuação de Desempenho |
| Luminosidade Padrão | 0,91 | 0,87 | 0,84 | 0,01 |
| Baixa Luminosidade (< 50 lux) | 0,88 (-3%) | 0,82 (-5%) | 0,79 (-5%) | 0,02 |
| Oclusão Parcial (30%–50%) | 0,85 (-6%) | 0,80 (-7%) | 0,76 (-8%) | 0,03 |
| Oclusão Acentuada (> 50%) | 0,78 (-13%) | 0,72 (-15%) | 0,68 (-16%) | 0,04 |
| Desfoque por Movimento | 0,83 (-8%) | 0,77 (-10%) | 0,73 (-11%) | 0,05 |
Tabela 2: Tabela de análise quantitativa da adaptabilidade ambiental. Desempenho de diferentes modelos de detecção em ambientes complexos por meio de análise quantitativa. Dados de teste desde condições de iluminação padrão até diversos cenários extremos mostram que o YOLOv11 + CNN mantém o desempenho mais alto em todas as condições de teste. Em condições padrão de iluminação, o mAP@0,5 desse modelo atingiu 0,91, significativamente melhor do que o YOLOv5 (0,87) e o Faster R-CNN (0,84). Com a deterioração das condições ambientais, o desempenho de cada modelo diminui em graus variados, mas o YOLOv11 + CNN demonstra a maior robustez ambiental entre os modelos avaliados: em condições de pouca luz (< 50 lux), o desempenho diminui apenas 3% (para 0,88), o que é melhor do que a redução de 5% do modelo comparativo; em cenários com forte oclusão (> 50%), seu mAP ainda pode ser mantido em 0,78, e a degradação de desempenho (13%) é significativamente menor do que a do YOLOv5 (15%) e do Faster R-CNN (16%). Esses resultados demonstram que o YOLOv11 + CNN melhora a adaptabilidade do modelo a fatores complexos, como variações de iluminação e interferência por oclusão, por meio de um mecanismo aprimorado de fusão de características e um design de atenção, apoiando aplicações práticas em cenários industriais.
Tabela 3 mostra que o otimizador SGD foi utilizado neste experimento, com um momento de 0,9 para acelerar a convergência e suprimir oscilações. Uma taxa de aprendizado inicial de 0,01 foi utilizada com recozimento cossenoide, que diminuiu gradualmente durante o treinamento para aprimorar a otimização. Um decaimento de peso de 0,0005 foi introduzido para aplicar regularização L2 e reduzir o sobreajuste. Um tamanho de lote de 32 equilibrou a eficiência computacional com a estabilidade na estimativa do gradiente. As 200 épocas de treinamento garantiram convergência suficiente. Os parâmetros foram adaptados à tarefa de detecção em estágio único, equilibrando velocidade e precisão do treinamento.
| Parâmetro | Valor |
| Otimizador | SGD |
| Taxa de aprendizado inicial | 0.01 |
| Momento | 0.9 |
| Decaimento do peso | 0.0005 |
| Tamanho do lote | 32 |
| Épocas de treinamento | 200 |
| Agendamento da taxa de aprendizado | Recozimento cosseno |
Tabela 3: Tabela de hiperparâmetros de treinamento. O otimizador SGD foi utilizado neste experimento, com um momento de 0,9 para acelerar a convergência e suprimir oscilações. Uma taxa de aprendizado inicial de 0,01 foi utilizada com recozimento cosseno, que diminuiu gradualmente durante o treinamento para refinar a otimização. Uma redução de peso de 0,0005 foi introduzida para aplicar regularização L2 e reduzir o sobreajuste. Um tamanho de lote de 32 equilibrou a eficiência computacional com a estabilidade na estimativa do gradiente. As 200 épocas de treinamento garantiram convergência suficiente. Os parâmetros foram adaptados à tarefa de detecção em estágio único, equilibrando velocidade e precisão do treinamento.
Tabela 4 mostra que, utilizando o YOLOv11 como referência, o mAP@0.5 é 0,89. A introdução da fusão multi-escala isoladamente reduz a precisão para 0,88. A adição sequencial de atenção de canal e atenção espacial melhora a precisão para 0,90 e 0,89, respectivamente. A precisão combinada de todos os módulos atinge 0,91, um aumento de 0,02 em relação à referência. Os dados indicam que a atenção de canal melhora diretamente a precisão, e o desempenho combinado da multi-escala e da atenção é o melhor.
| Configuração | mAP@0.5 |
| YOLOv11 (linha de base) | 0.89 |
| + Fusão multi-escala | 0.88 |
| + Multi-escala + atenção de canal | 0.9 |
| + Multi-escala + atenção espacial | 0.89 |
| Módulo completo (YOLOv11 + CNN) | 0.91 |
Tabela 4: Tabela de teste de ablação. Usando YOLOv11 como referência, o mAP@0.5 é 0,89. Introduzir apenas a fusão multi-escala reduz a precisão para 0,88. Adicionar atenção de canal ou atenção espacial após a fusão multi-escala melhora a precisão para 0,90 e 0,89, respectivamente. A precisão combinada de todos os módulos atinge 0,91, um aumento de 0,02 em relação à referência. Os dados mostram que a atenção de canal proporciona ganhos maiores do que a atenção espacial nesta configuração, e que o desempenho combinado da fusão multi-escala e da atenção é o melhor possível.
Figura 6 avalia sistematicamente o desempenho do modelo em ambientes extremos. O mAP do YOLOv11 + CNN diminuiu apenas 6% (para 0,88) em condições de pouca luz e ainda manteve um mAP de 0,78 (8% acima do referencial) em cenas fortemente ocluídas. Esses resultados demonstram que o modelo exibe adaptabilidade ambiental, abordando eficazmente as variações comuns de iluminação e problemas de oclusão parcial na produção industrial, apoiando assim o funcionamento estável do sistema de detecção.

Figura 6. Adaptabilidade ambiental. Uma avaliação sistemática do desempenho do modelo em ambientes extremos. O mAP do YOLOv11 + CNN diminuiu apenas 6% (para 0,88) em condições de pouca luz, e ainda manteve um mAP de 0,78 (8% acima do referencial) em cenas fortemente ocluídas. Esses resultados demonstram que o modelo exibe adaptabilidade ambiental, abordando efetivamente as variações comuns de iluminação e problemas de oclusão local na produção industrial, apoiando assim o funcionamento estável do sistema de detecção. Clique aqui para visualizar uma versão maior desta figura.
Figura 7 compara as diferenças na distribuição de características entre YOLOv11 e YOLOv11 + CNN em seis tipos de alvos industriais por meio da redução de dimensionalidade t-SNE. A figura à esquerda mostra que as características do modelo básico YOLOv11 exibem uma dispersão intraclasse significativa (distância intraclasse 2,34 ± 0,15), particularmente nas categorias "Zona de Perigo" (vermelho) e "Veículo" (roxo), onde há uma sobreposição acentuada, o que está de acordo com a taxa de detecção incorreta de 15% no grupo experimental 3. A figura à direita mostra que o modelo aprimorado YOLOv11 + CNN melhora significativamente a compacidade intraclasse por meio do módulo de realce de características, aumentando em 1,8 vez a distância média entre os centros de agrupamento dentro de cada categoria.

Figura 7. Comparação da Distribuição de Características por t-SNE. Uma comparação das diferenças na distribuição de características entre YOLOv11 e YOLOv11 + CNN em seis tipos de alvos industriais por meio da redução de dimensionalidade t-SNE. A figura à esquerda mostra que as características do modelo básico YOLOv11 exibem uma dispersão intraclasse significativa (distância intraclasse 2,34 ± 0,15), particularmente nas classes "Zona de Perigo" (vermelho) e "Veículo" (roxo), onde há uma sobreposição substancial, o que é consistente com a taxa de detecção falsa de 15% no grupo experimental 3. A figura à direita mostra que o modelo aprimorado YOLOv11 + CNN melhora significativamente a compacidade intraclasse por meio do módulo de realce de características, e a distância média entre os centros dos agrupamentos em cada categoria aumenta em 1,8 vez. Clique aqui para visualizar uma versão maior desta figura.
Figura 8 verifica a contribuição de cada módulo por meio de experimentos sistemáticos de ablação. Os resultados da ablação mostram que adicionar atenção de canal após a fusão multi-escala aumenta o mAP@0,5 para 0,90, enquanto adicionar atenção espacial aumenta o mAP@0,5 para 0,89. O módulo completo alcança o maior mAP@0,5 de 0,91. A visualização por mapa de calor mostra que o mecanismo de atenção composto pode simultaneamente realçar a resposta de detecção no centro da área perigosa (valor de ativação: +0,15) e em alvos pequenos na borda (+0,08). Os dados experimentais demonstram que a fusão de características multi-escala e os mecanismos de atenção possuem um efeito cumulativo, permitindo que o modelo atenda aos requisitos de detecção de alvos em diferentes escalas.

Figura 8. Experimento modular de ablação. Verificação da contribuição de cada módulo por meio de experimentos sistemáticos de ablação. Os resultados de ablação mostram que a adição de atenção de canal após a fusão multi-escala aumenta o mAP@0.5 para 0,90, enquanto a adição de atenção espacial aumenta o mAP@0.5 para 0,89. O módulo completo alcança o maior mAP@0.5 de 0,91. A visualização por mapa de calor mostra que o mecanismo de atenção composto pode simultaneamente realçar a resposta de detecção no centro da área perigosa (valor de ativação: +0,15) e em alvos pequenos na borda (+0,08). Os dados experimentais demonstram que a fusão de características multi-escala e os mecanismos de atenção possuem um efeito cumulativo, permitindo que o modelo atenda aos requisitos de detecção de alvos em diferentes escalas. Clique aqui para visualizar uma versão maior desta figura.
DISPONIBILIDADE DE DADOS:
Imagens completas e fluxos de vídeo brutos da linha de produção estão sujeitos a restrições de confidencialidade industrial e não são divulgados publicamente. Uma Descrição do Conjunto de Dados Suplementar (Arquivo Suplementar 1) fornece detalhes sobre a aquisição do conjunto de dados, distribuições de categorias e cenários, especificações de anotação, procedimentos de controle de qualidade, divisões dos dados, pré-processamento e procedimentos de aumento de dados. Um Pseudocódigo e Estrutura para Reprodutibilidade (Arquivo Suplementar 2) fornece um fluxo de trabalho em nível de pseudocódigo, descrições de configuração e orientações para reprodução. Um subconjunto anonimizado e materiais adicionais de apoio podem ser solicitados ao autor correspondente para pesquisa acadêmica sem fins comerciais, sujeito a restrições institucionais e de confidencialidade.
Arquivo Suplementar 1. Descrição do conjunto de dados suplementar. Este arquivo descreve o protocolo de aquisição do conjunto de dados, cobertura de cenários, distribuição de classes, especificações de anotação, procedimentos de controle de qualidade, divisão entre treinamento/validação/teste, pré-processamento e procedimentos de aumento de dados. Clique aqui para baixar este arquivo.
Arquivo Suplementar 2. Pseudocódigo e estrutura para reprodutibilidade. Este arquivo fornece detalhes em nível de pseudocódigo sobre o fluxo de trabalho e a configuração para pré-processamento, treinamento, avaliação e implantação, além de descrever restrições sobre gravações industriais brutas e acesso a materiais complementares. Clique aqui para baixar este arquivo.