Artigo de método

Monitoramento de Segurança de Linha de Produção em Tempo Real Utilizando Detecção de Objetos Baseada em Deep Learning e Aprimoramento de Características

28 vistas

DOI:

10.3791/70968

21 de agosto de 2026

Neste artigo

Resumo

Este artigo propõe um método de monitoramento de segurança em linhas de produção que integra a versão 11 do You Only Look Once (YOLOv11) com redes neurais convolucionais. O método alcançou precisão média em 0,91 no limiar de interseção sobre união de 0,5 (mAP@0,5), mAP@0,5:0,95 de 0,82 e 120 quadros por segundo em uma unidade de processamento gráfico, superando os modelos de referência avaliados.

Resumo

Com o aprofundamento da Indústria 4.0, os níveis de automação e inteligência das linhas de produção melhoraram significativamente, exigindo maior desempenho em tempo real, precisão e segurança no monitoramento. Os sistemas tradicionais de monitoramento, que dependem de inspeções manuais ou decisões baseadas em limiares simples, geralmente apresentam tempos de resposta lentos, altas taxas de falsos alarmes e inteligência limitada. Portanto, este artigo propõe um sistema de monitoramento de segurança em linhas de produção que integra a versão 11 do You Only Look Once (YOLOv11) com uma rede neural convolucional (CNN). Primeiro, as imagens adquiridas foram pré-processadas. Em seguida, o YOLOv11 foi utilizado para identificar trabalhadores, equipamentos e potenciais riscos em tempo real. Depois, introduziu-se uma rede CNN aprimorada com fusão de características em múltiplas escalas e mecanismos de atenção para melhorar a capacidade de extração de características de alvos pequenos e ocluídos. Por fim, os resultados da detecção foram fundidos com as características aprimoradas pela CNN para avaliar o estado de segurança. Experimentos foram realizados utilizando um conjunto de dados de segurança em linha de produção criado pelos autores, empregando o otimizador de descida de gradiente estocástico (SGD) com momento 0,9, taxa de aprendizado inicial de 0,01, decaimento de peso de 0,0005, ajuste da taxa de aprendizado com resfriamento cosseno, tamanho de lote de 32 e treinamento por 200 épocas. A mAP@0,5 e a velocidade de detecção em quadros por segundo (FPS) foram utilizadas como métricas de avaliação para comparação com os algoritmos de referência avaliados. Os resultados mostram que o sistema proposto alcançou uma mAP@0,5 de 0,91 e uma velocidade de detecção de 120 FPS. O sistema também demonstrou desempenho robusto em condições complexas, como sombreamento e variações de iluminação, evidenciando sua eficácia e potencial de aplicação prática no monitoramento de segurança em linhas de produção.

Introdução

Na produção industrial moderna, a segurança é a pedra angular para garantir a eficiência da produção e o bem-estar das pessoas. O ambiente da linha de produção geralmente envolve equipamentos mecânicos de alta velocidade, processos tecnológicos complexos e operações colaborativas que incluem múltiplas tarefas. Qualquer pequeno risco potencial à segurança pode provocar acidentes graves na produção, resultando em perdas econômicas significativas e até mesmo fatalidades. Portanto, é fundamental estabelecer um sistema inteligente, eficiente e em tempo real de monitoramento da segurança para aprimorar a segurança na produção industrial1,2.

Os métodos tradicionais de monitoramento de segurança dependem principalmente de vigilância manual por vídeo e diversos sensores (como sensores infravermelhos, de fumaça e de vibração)3. O monitoramento manual não é apenas ineficiente, mas também propenso a detecções não realizadas devido à fadiga da equipe de monitoramento, e não consegue fornecer cobertura contínua e abrangente. Embora os sensores possam oferecer certa função de alerta precoce, seu alcance de detecção é limitado e eles são sensíveis a interferências ambientais, resultando em problemas acentuados de falsos alarmes4. Os sistemas inteligentes de monitoramento tornaram-se um foco crescente de pesquisa. A análise em tempo real de um fluxo de vídeo por meio de um algoritmo de aprendizado profundo pode identificar automaticamente eventos anormais, comportamentos inseguros e riscos potenciais, melhorando assim significativamente a inteligência do sistema de monitoramento4,5.

A detecção de objetos é uma tecnologia fundamental em monitoramento inteligente. Como representantes dos detectores de objetos de única etapa, os algoritmos da série You Only Look Once (YOLO) demonstram vantagens significativas. Do YOLOv1 ao YOLOv8, esse conjunto de algoritmos passou por um desenvolvimento contínuo, com aprimoramentos na arquitetura da rede, função de perda e metodologia de treinamento, entre outros aspectos6,7. O YOLOv11, em particular, alcançou maior precisão na detecção mantendo uma alta taxa de quadros, especialmente quando confrontado com fundos complexos e alvos densamente agrupados8.

No entanto, apesar do seu excelente desempenho em tarefas gerais de detecção de objetos, o YOLOv11 ainda enfrenta desafios em cenários específicos de monitoramento de segurança em linhas de produção9. Por exemplo, a precisão de detecção do YOLOv11 pode diminuir quando os trabalhadores estão parcialmente ocultos por equipamentos ou quando os sinais de segurança são pequenos e se assemelham muito à cor do fundo. Isso exige que o modelo possua capacidades mais fortes de extração de características e compreensão semântica10.

As redes neurais convolucionais (CNNs) possuem grandes capacidades na extração de características de imagens11. Ao projetar arquiteturas de rede mais profundas e complexas, as CNNs podem aprender características de imagem mais ricas e abstratas. Combinar uma CNN com o YOLOv11 aproveita as capacidades rápidas de detecção do YOLOv11 e a extração profunda de características da CNN, construindo assim um sistema de monitoramento de segurança mais robusto e inteligente.

Com base nisso, este artigo propõe um sistema de monitoramento de segurança em linha de produção utilizando YOLOv11 e uma CNN. Os aspectos inovadores deste estudo incluem: (1) propor uma arquitetura de fusão profunda de YOLOv11 e uma CNN aprimorada; (2) introduzir fusão de características em múltiplas escalas e um mecanismo de atenção composto para aprimorar o reconhecimento de características-chave de segurança; e (3) verificar as vantagens de desempenho do modelo em um conjunto de dados de cenas complexas construído pelo próprio autor.

Desenvolvimento dos algoritmos da série YOLO
Desde sua introdução inicial por Redmon et al. em 201512, o algoritmo You Only Look Once (YOLO) tem despertado grande interesse. Diferentemente dos detectores de duas etapas que dependem de propostas de regiões, o YOLO trata a detecção de objetos como uma tarefa de regressão. Ao prever diretamente as classes e posições dos objetos em uma imagem, o YOLO aumenta significativamente a velocidade de detecção, tornando-o adequado para uso em tempo real13.

Como o trabalho pioneiro desta série, o YOLOv1 alcança pela primeira vez a detecção de alvos de ponta a ponta14. O YOLOv1 envolve particionar a imagem de entrada em uma estrutura de grade, na qual cada célula da grade, geralmente organizada em um formato S × S, tem a tarefa de detectar objetos que se encontram dentro de seus limites.

Especificamente, a saída do YOLOv1 é um tensor. Dentro do S × S × (B × 5 + C), a predição de cada caixa delimitadora contém 5 elementos: coordenada do ponto central (x,y), largura w, altura h e confiança c. O processo de cálculo é ilustrado na Equação (1):
Fórmula de probabilidade e Interseção sobre União (IoU) para análise de detecção de objetos.   (1)

Entre eles, Pr(Object) representa a probabilidade de haver um alvo na grade, e IOU representa a razão entre a interseção e a união entre a caixa delimitadora prevista e a caixa real. Cada célula da grade também prevê um conjunto de probabilidades de classe, Pr representando a probabilidade de o alvo pertencer à i-ésima classe na presença de um alvo. A função de perda do YOLOv1 é composta por três componentes principais: a perda para a predição de coordenadas, a perda para a estimativa de confiança e a perda para a predição de categoria15.

O YOLOv2 introduz a normalização por lotes, um classificador de alta resolução e uma estratégia de treinamento em múltiplas escalas, o que melhora a estabilidade e a precisão16. O YOLOv3 utiliza o Darknet-53 como sua rede de base e se inspira no conceito da Rede de Pirâmide de Características (FPN) para aprimorar a detecção de alvos17.

O YOLOv4 realizou diversas otimizações com base no YOLOv3, introduzindo tecnologias como a Cross Stage Partial Network (CSPNet)18, a Path Aggregation Network (PANet)19 e o aumento de dados Mosaic para melhorar ainda mais o desempenho do modelo. O YOLOv5 trouxe contribuições significativas para a engenharia, oferecendo uma implementação mais fácil de usar e mais eficiente20.

Nos últimos anos, a série YOLO continuou a evoluir, com versões como YOLOv6, YOLOv7 e YOLOv8 sendo lançadas uma após a outra. Ao introduzir a estrutura Extended Efficient Layer Aggregation Network (E-ELAN) e técnicas de reparametrização de modelos, o YOLOv7 alcança novos avanços tanto em velocidade quanto em precisão. Essas melhorias não apenas aumentam a eficiência da aprendizagem de características, mas também otimizam o desempenho de inferência da rede, permitindo que o YOLOv7 supere versões anteriores e muitos detectores convencionais em diversas tarefas de detecção de objetos em tempo real. O YOLOv8 aprimora ainda mais a estrutura da rede, adota um design livre de âncoras, simplifica o modelo e melhora sua capacidade de generalização21.

Com base nas vantagens das versões anteriores, o YOLOv11, utilizado neste estudo, foi otimizado para cenários industriais complexos. Suas principais melhorias incluem uma rede de extração de características, um módulo de fusão de características mais eficiente e um design de função de perda mais robusto. Essas melhorias permitem que o YOLOv11 apresente um desempenho superior ao lidar com oclusões, alvos pequenos e fundos complexos em ambientes de produção. O YOLOv11 é uma versão da série YOLO lançada pela Ultralytics. Em comparação com o YOLOv8, ele aprimora o módulo C3K2 e o caminho de fusão de características, além de introduzir uma estratégia adaptativa de caixas âncora, proporcionando assim uma robustez de detecção mais forte em cenários industriais.

Base e progresso da rede neural convolucional (CNN)
A rede neural convolucional (CNN) é um modelo fundamental que influenciou profundamente o sucesso do aprendizado profundo na visão computacional. Ela opera extraindo características locais da imagem por meio de operações convolucionais e, posteriormente, reduzindo a dimensionalidade das características por meio de operações de agrupamento, alcançando assim uma abstração hierárquica da imagem22.

Uma CNN típica é composta por múltiplas camadas convolucionais, de agrupamento e totalmente conectadas. A camada convolucional varre a imagem de entrada com um kernel de convolução, calcula produtos escalares sobre regiões locais e produz um mapa de características. O processo de cálculo é mostrado na Equação (2):

Diagrama da operação de convolução; notação matemática para modelos de aprendizado de máquina.   (2)

Onde x é a imagem de entrada, wk e bk são os pesos e o viés do kernel de convolução, respectivamente, e Expressão matemática y_ij^k, potencialmente relacionada a operações de matriz ou tensor usadas em algoritmos. são os valores do mapa de características de saída na posição (i,j). A camada de agrupamento geralmente utiliza Max Pooling ou Average Pooling. A camada totalmente conectada é responsável por extrair características e prever probabilidades de classificação.

Com base nisso, este artigo propõe um módulo de realce de características CNN para o YOLOv11, composto por dois ramos paralelos: um ramo de convolução multi-escala que utiliza kernels de convolução 3 × 3 e 5 × 5 para extrair características em múltiplas escalas; e um ramo de atenção que conecta sequencialmente os módulos de atenção de canal (Squeeze-and-Excitation) e de atenção espacial, a fim de realçar as características discriminativas dos alvos principais. As saídas dos dois ramos são fundidas por meio de adição elemento a elemento, e a função de perda correspondente de realce de características é apresentada na fórmula (3):

 Fórmula matemática para a coordenação da função de perda L=λcoordLcoord+λconfLconf+λclsLcls+λfeatLfeat (3)

Lcoord é a perda de regressão das coordenadas da caixa delimitadora; Lconf é a perda de confiança do alvo; Lcls é a perda de classificação de categoria; Lfeat é a perda de realce de características, utilizada para restringir as características discriminativas de alvos pequenos e alvos ocluídos extraídas pelo módulo de realce da CNN; λcoord, λconf, λcls, λfeat são os coeficientes de peso dos termos de perda correspondentes. Para esta tarefa, define-se λfeat = 0,05, e os demais pesos são balanceados de acordo com os requisitos da tarefa de detecção.

Estruturas clássicas de CNN, como VGGNet23 e ResNet24, obtiveram grande sucesso em tarefas de classificação de imagens. Entre essas arquiteturas, a ResNet mitiga efetivamente o problema do gradiente que desaparece no treinamento de redes profundas, facilitando assim a construção de estruturas de rede mais profundas e complexas.

Em tarefas de detecção de objetos, a CNN geralmente é usada como extrator de características (backbone). Por exemplo, Darknet, Darknet parcial em múltiplos estágios (CSPDarknet), etc., na série de algoritmos YOLO, são todos baseados na CNN25. Para aprimorar as capacidades de extração de características, os pesquisadores propuseram diversas estruturas aprimoradas de CNN. Por exemplo, o módulo Inception extrai características em paralelo por meio de kernels de convolução de múltiplas escalas. A DenseNet potencializa a reutilização de características com conexões densas. A Rede Squeeze-and-Excitation ajusta adaptativamente a importância dos canais de características por meio de mecanismos de atenção26.

Neste estudo, projetamos um módulo CNN aprimorado para aumentar as capacidades de extração de características do YOLOv11. Este módulo combina a fusão de características em múltiplas escalas com um mecanismo de atenção para capturar de forma mais eficaz as informações-chave de segurança em cenários de linha de produção.

Situação da aplicação do aprendizado profundo no monitoramento de segurança industrial
O aprendizado profundo tem obtido grande destaque no monitoramento de segurança industrial. Algoritmos baseados em CNN são empregados para determinar se os trabalhadores estão usando corretamente capacetes de segurança, detectar intrusões não autorizadas em zonas perigosas e monitorar o estado de equipamentos com defeito27.

Em termos de reconhecimento de comportamento, CNNs 3D e redes neurais recorrentes são utilizadas para analisar o comportamento operacional dos trabalhadores e identificar ações potencialmente inseguras. Por exemplo, ao analisar as sequências de postura dos trabalhadores, pode-se determinar se eles estão violando os procedimentos operacionais de segurança28.

YOLO e Faster R-CNN são amplamente utilizados para detecção de pessoal e equipamentos em vídeos de vigilância em tempo real. Por exemplo, um sistema de detecção em tempo real de capacetes baseado no YOLOv5 foi proposto na literatura, melhorando efetivamente a inteligência na gestão da segurança em canteiros de obras29.

Embora alguns avanços tenham sido feitos nas pesquisas existentes, vários desafios permanecem. Primeiro, as cenas industriais geralmente apresentam iluminação complexa, oclusão e interferência de fundo, o que impõe requisitos rigorosos quanto à robustez do algoritmo. Segundo, o desempenho em tempo real é um requisito fundamental, e o algoritmo deve alcançar inferência de alta velocidade mantendo a precisão. Por fim, as pesquisas existentes concentram-se principalmente na detecção de tarefa única e carecem de exploração da fusão de informações multissensoriais e de análises abrangentes30.

Neste estudo, o modelo proposto de fusão YOLOv11 e CNN tem como objetivo enfrentar os desafios mencionados e alcançar um monitoramento abrangente e em tempo real dos riscos à segurança na linha de produção, melhorando as capacidades de extração e fusão de características.

Protocolo

Algoritmo YOLOv11 e CNN

Arquitetura geral do sistema
O sistema de monitoramento de segurança em linha de produção proposto neste artigo adota uma arquitetura híbrida que combina o YOLOv11 com uma CNN aprimorada para alcançar monitoramento de segurança em tempo real com alta precisão e alta velocidade. Conforme mostrado na Figura 1, o sistema é composto principalmente por um módulo de pré-processamento de entrada, um módulo de detecção de objetos YOLOv11, um módulo de aprimoramento de características por CNN e um módulo de decisão por fusão. A imagem de entrada é inicialmente normalizada e aumentada pelo módulo de pré-processamento para melhorar a capacidade de generalização do modelo. Em seguida, as características são extraídas pelo backbon CSPDarknet, e o campo receptivo é ampliado pelo módulo de agrupamento piramidal espacial rápido (SPPF). As características em múltiplas escalas são fundidas após o aumento da resolução, e a atenção de canal e a atenção espacial são aplicadas sequencialmente às características fundidas para aprimorar ainda mais a representação discriminativa dos alvos principais. O módulo de aprimoramento de características por CNN é inserido após as saídas das camadas C3, C4 e C5 da rede principal do YOLOv11, recebendo mapas de características em múltiplas escalas com tamanhos de 80 × 80 × 256, 40 × 40 × 512 e 20 × 20 × 1.024, respectivamente. O módulo de aprimoramento de características por CNN aprimora ainda mais a extração de características para alvos pequenos e ocluídos. Por fim, o módulo de decisão por fusão combina os resultados de detecção do YOLOv11 com as características aprimoradas pela CNN e os otimiza conjuntamente por meio de uma função de perda projetada para gerar a localização precisa, a categoria e a pontuação de confiança do alvo.

Estrutura de detecção YOLOv11
O YOLOv11 introduziu várias melhorias essenciais que aproveitam os pontos fortes da estrutura de detecção de única fase da série YOLO. Sua arquitetura é dividida em três componentes principais: uma rede de base (backbone), uma rede de fusão de características e uma cabeça de detecção. A rede de base utiliza uma estrutura CSPDarknet aprimorada. A rede de fusão de características incorpora conexões locais entre estágios e convoluções separáveis por profundidade, inspirando-se em redes piramidais de características e redes de agregação de caminhos para mesclar efetivamente características de múltiplas escalas.

Módulo de realce de características
O módulo de realce de características tem como objetivo melhorar a sensibilidade do modelo a características-chave de segurança. Ele processa os mapas de características produzidos por cada camada da rede principal YOLOv11, fundindo informações em diferentes escalas por meio de operações de interpolação para cima e para baixo. Especificamente, o ramo multi-escala captura a diversidade espacial de escala, enquanto o ramo de atenção realça dinamicamente os canais e respostas posicionais principais. Esses dois ramos não atuam de forma independente, mas são complementares e fundidos por meio de conexões residuais e realocação de características. O mapa de características processado pelo módulo de realce em cada escala é ajustado para corresponder ao número original de canais do mapa de características por meio de uma convolução 1 × 1, e então fundido com o mapa de características original do YOLOv11 por meio de adição elemento a elemento. O mapa de características fundido é então encaminhado para a rede piramidal de características subsequente (FPN) para fusão multi-escala, formando assim uma representação hierárquica de características de segurança. Para garantir uma integração perfeita entre os módulos, adota-se uma estratégia de treinamento conjunto de ponta a ponta, sendo a função de perda composta pela perda de detecção do YOLOv11 e pela perda de realce de características do módulo CNN.

Diagrama de rede neural convolucional; inclui módulos Conv, ELAN, SPPF para o processo de detecção de imagem.
Figura 1. Algoritmo YOLOv11-CNN. O módulo de realce de características tem como objetivo amplificar a sensibilidade do modelo a características críticas de segurança. Ele processa mapas de características provenientes de várias camadas do modelo principal YOLOv11, fundindo características de diferentes escalas por meio de operações de interpolação para cima e para baixo. Além disso, incorpora mecanismos de atenção espacial e de canal. Para garantir uma integração perfeita entre os módulos YOLOv11 e CNN, é empregada uma estratégia de treinamento conjunto. Durante o treinamento, os parâmetros de ambos os módulos são otimizados de ponta a ponta. A função de perda combina a perda de detecção do YOLOv11 com a perda de realce de características do módulo CNN. Clique aqui para visualizar uma versão maior desta figura.

Resultados

Para verificar a eficácia do modelo proposto de fusão YOLOv11 e CNN no monitoramento de segurança em linhas de produção, foi construído um conjunto de dados que abrange diversos cenários de riscos à segurança. Este conjunto contém 12.000 imagens de cenas de linhas de produção, divididas em conjuntos de treinamento, validação e teste na proporção 7:1,5:1,5, com uma semente aleatória fixa de 42. Ele abrange diversas condições de trabalho, incluindo iluminação normal, baixa iluminação, oclusão parcial, oclusão acentuada, desfoque de movimento e fundos complexos. O limiar de confiança para inferência foi definido em 0,5 e o limiar de supressão não máxima (NMS) foi definido em 0,45. Todos os experimentos foram repetidos três vezes e os resultados são apresentados como média ± desvio padrão. As categorias de anotação são trabalhadores, capacetes de segurança, braços robóticos, áreas perigosas, ferramentas e veículos, utilizando o formato PASCAL Visual Object Classes (VOC). O limiar de interseção sobre união (IoU) é definido como 0,5 e a consistência das anotações é verificada por meio de validação cruzada entre duas pessoas. As imagens de entrada foram uniformemente redimensionadas para 640 × 640 e aumentadas com dados Mosaic. O treinamento foi realizado utilizando o otimizador SGD com taxa de aprendizado inicial de 0,01, momento de 0,9, decaimento de peso de 0,0005 e tamanho de lote de 32. O treinamento foi executado por 200 épocas, sendo utilizada a programação de annealing cosseno para ajustar a taxa de aprendizado.

Para avaliar minuciosamente a eficácia do modelo, foram utilizadas diversas métricas de avaliação: precisão média (mAP), quadros por segundo (FPS) para medir a taxa de processamento de quadros de imagem, precisão para avaliar a exatidão das previsões positivas, revocação para medir a capacidade do modelo em detectar verdadeiros positivos e área sob a curva (AUC) para indicar a área sob a curva característica de operação do receptor (ROC), refletindo assim a capacidade geral de classificação do modelo. As fórmulas de cálculo são apresentadas nas Equações (4), (5), (6), (7), (8), (9), (10), (11):

fórmula de cálculo de mAP, mAP@0.5=1/NΣ(Ni=1)APi, métrica, precisão, análise de dados.  (4)
fórmula de cálculo da Precisão Média Média (mAP); equação Σ para análise de avaliação de dados.  (5)
fórmula de precisão, TP/(TP+FP), equação para análise de resultados de aprendizado de máquina, métrica concisa.  (6)
Revocação fórmula de precisão, TP/(TP+FN), equação, análise estatística, avaliação de aprendizado de máquina. (7)
equação de equilíbrio estático FPS=F/T mostrando cálculo de força por tempo na física.  (8)
fórmula da taxa de verdadeiro positivo, TPR=TP/(TP+FN), equação de análise estatística.  (9)
fórmula da taxa de falso positivo, FPR=FP/(FP+TN), análise estatística, uso educacional.  (10)
fórmula de AUC AUC=∫₀¹TPR(x)dx; diagrama matemático para interpretação de análise de dados.  (11)

Métricas de precisão-rechamada; mAP@0.5, mAP@[0.5:0.95], VP, FP, FN, precisão, revocação; análise de dados.  Aqui, mAP@0.5 indica a precisão média média em um limiar de IoU de 0,5; N é o número de categorias; APi é a precisão média da i-ésima categoria; e mAP@[0.5:0.95] é o mAP médio calculado ao longo dos limiares de IoU de 0,5 a 0,95. TP, FP, FN e TN representam os números de verdadeiros positivos, falsos positivos, falsos negativos e verdadeiros negativos, respectivamente. F é o número total de quadros processados, T é o tempo total de processamento, TPR é a taxa de verdadeiros positivos e FPR é a taxa de falsos positivos.
Para o componente de detecção YOLOv11, a função de perda é apresentada na Equação (12):

Fórmula da função de perda: \( \text{LOSS} = \lambda_{\text{coord}} \cdot L_{\text{coord}} + \lambda_{\text{conf}} \cdot L_{\text{conf}} + \lambda_{\text{class}} \cdot L_{\text{class}} \).     (12)

Diagrama da equação de equilíbrio estático: L_coord, L_conf, L_class; λ_coord, λ_conf, λ_class.  Onde Lcoord denota o desvio entre o quadro previsto e o quadro real, Lconf mede o erro de confiança do quadro previsto, Lclass mede o erro de predição de categoria, e λcoord, λconf e λclass são os coeficientes de peso utilizados para equilibrar as perdas correspondentes.

A análise dos dados na Tabela 1 mostra que o método proposto alcança um mAP@0.5 de 0,91 e um mAP@0.5:0.95 de 0,82, representando melhorias de 0,04 e 0,04, respectivamente, em comparação com o YOLOv5. Seu escore F1 é de 0,935, o que também é superior ao dos modelos comparativos. A velocidade de detecção é de 120 FPS, quatro vezes maior que a do Faster R-CNN, mas ligeiramente inferior à do YOLOv10 e do YOLOv11. O número de parâmetros é de 6,7M, apenas 1,5M a mais que o YOLOv11, com uma melhoria de 0,03 no mAP@0.5. Em comparação com o EfficientDet, que possui custo computacional semelhante, a precisão é 0,06 maior, enquanto o número de parâmetros é 56% menor. Os dados demonstram que a fusão multi-escala e o mecanismo de atenção introduzidos melhoram efetivamente a precisão na detecção de alvos pequenos, alcançando um bom equilíbrio entre velocidade e precisão. Em resumo, o nosso método proposto alcança um equilíbrio entre precisão e velocidade de detecção. O mAP@0.5 é 0,02 maior que o do segundo melhor modelo, o escore F1 atinge 0,935 e os 6,7M de parâmetros são suficientes para implantação prática. O mecanismo de fusão multi-escala e atenção aprimora o reconhecimento de alvos pequenos e ocluídos em cenas complexas. O modelo equilibra precisão e eficiência, tornando-o adequado para cenários em tempo real, como monitoramento de segurança industrial. Vale ressaltar que todos os modelos comparativos utilizam pesos pré-treinados oficiais, com resolução de entrada uniforme de 640 × 640, limiar de NMS de 0,45 e limiar de confiança de 0,5.

MétodomAP@0.5mAP@0.5:0.95Pontuação F1FPSParâmetros (M)
YOLOv50.870.780.891307.1
EfficientDet0.850.730.885015.3
RetinaNet0.820.680.854537.6
Faster R-CNN0.840.70.873045.2
YOLOv100.890.770.881355.3
YOLOv110.880.750.8951405.2
NOSSO0.910.820.9351206.7

Tabela 1: Tabela abrangente de comparação do desempenho dos modelos. A análise dos dados mostra que o método proposto alcança mAP@0.5 de 0,91 e mAP@0.5:0,95 de 0,82, representando melhorias de 0,04 e 0,04, respectivamente, em relação ao YOLOv5. Seu escore F1 é de 0,935, o que também é superior aos dos modelos comparativos. A velocidade de detecção é de 120 FPS, quatro vezes maior que a do Faster R-CNN, mas ligeiramente inferior à do YOLOv10 e do YOLOv11. O número de parâmetros é de 6,7 M, apenas 1,5 M a mais que o YOLOv11, com uma melhoria de 0,03 no mAP@0.5. Em comparação com o EfficientDet, que possui custo computacional semelhante, a precisão é 0,06 maior, enquanto o número de parâmetros é 56% menor. Os dados demonstram que a fusão multi-escala e o mecanismo de atenção introduzidos melhoram efetivamente a precisão na detecção de alvos pequenos, alcançando um bom equilíbrio entre velocidade e precisão. Em resumo, o nosso método proposto alcança um equilíbrio entre precisão e velocidade de detecção. O mAP@0.5 é 0,02 maior que o do segundo melhor modelo, o escore F1 atinge 0,935 e os 6,7 M de parâmetros são suficientes para implantação prática. O mecanismo de fusão multi-escala e atenção aprimora o reconhecimento de alvos pequenos e ocluídos em cenas complexas. O modelo equilibra precisão e eficiência, tornando-o adequado para cenários em tempo real, como monitoramento de segurança industrial. Vale ressaltar que todos os modelos comparativos utilizam pesos pré-treinados oficiais, com resolução de entrada uniforme de 640 × 640, limiar uniforme de NMS de 0,45 e limiar de confiança uniforme de 0,5.

Figura 2 apresenta uma análise aprofundada dos tipos de detecção incorreta do modelo. O YOLOv11 + CNN apresenta a menor taxa de detecções incorretas em fundo (85 vezes/10.000 quadros), com a maioria das detecções incorretas ocorrendo em objetos semelhantes (62 vezes) e em cenas parcialmente ocluídas (48 vezes). A análise da curva ROC indica que a taxa de verdadeiros positivos (TPR) do modelo atingiu 0,9 (AUC = 0,98) com uma taxa de falsos positivos (FPR) de 0,1, e o espaçamento mais estreito entre as curvas apoia a alta confiabilidade da confiança na detecção. Esses resultados de análise não apenas sustentam o desempenho do modelo, mas também fornecem um roteiro técnico claro para a otimização subsequente de detecções incorretas, particularmente mediante o fortalecimento de sua capacidade de distinguir objetos semelhantes.

Curva ROC e gráfico de barras comparando modelos de detecção de objetos: AUC, análise de falsos alarmes por tipo.
Figura 2. Análise de erro. Análise dos tipos de detecção incorreta do modelo. O YOLOv11 + CNN apresenta a menor taxa de detecções incorretas de fundo (85 vezes/10.000 quadros), com a maioria das detecções incorretas concentrada em objetos semelhantes (62 vezes) e cenas parcialmente ocluídas (48 vezes). A análise da curva ROC indica que a taxa de verdadeiros positivos (TPR) do modelo atingiu 0,9 (AUC = 0,98) com uma taxa de falsos positivos (FPR) de 0,1, e o menor espaçamento entre as curvas apoia a confiabilidade da confiança na detecção. Esses resultados de análise não apenas comprovam o desempenho do modelo, mas também fornecem um roteiro técnico claro para a otimização subsequente de detecções incorretas, particularmente ao reforçar sua capacidade de distinguir objetos semelhantes. Clique aqui para visualizar uma versão maior desta figura.

Figura 3 compara o desempenho do modelo em várias plataformas de hardware. O YOLOv11 + CNN alcança uma latência ultra-baixa de 18 ms na unidade de processamento tensorial de borda (TPU), com uma flutuação de apenas ±2 ms, e o consumo de energia é controlado em 15 W. Testes de taxa de transferência demonstram que o modelo atinge uma velocidade de processamento de 70 FPS em dispositivos de computação de borda Jetson Xavier, com a latência do percentil 99 controlada dentro de 50 ms. Esses indicadores de desempenho de implantação permitem que ele se adapte às necessidades de implantação em diversas plataformas de computação em áreas industriais. A análise de erro mostra ainda que o modelo pode manter um desempenho estável em ambientes com recursos limitados, demonstrando sua aplicabilidade em engenharia.

Gráficos de comparação de taxa de transferência e latência para modelos YOLO em diferentes dispositivos; análise de desempenho dos dispositivos.
Figura 3. Desempenho na implantação. Comparação do desempenho do modelo em várias plataformas de hardware. O YOLOv11 + CNN alcança uma latência ultra-baixa de 18 ms na Edge TPU (com uma flutuação de apenas ±2 ms), e o consumo de energia é controlado em 15 W. Os testes de taxa de transferência demonstram que o modelo atinge uma velocidade de processamento de 70 FPS em dispositivos de computação de borda Jetson Xavier, com a latência do percentil 99 mantida dentro de 50 ms. Esses indicadores de desempenho na implantação indicam que ele pode atender às necessidades de implantação em diversas plataformas de computação em ambientes industriais. A análise de erros mostra ainda que o modelo consegue manter desempenho estável em ambientes com recursos limitados, demonstrando sua aplicabilidade em engenharia. Clique aqui para visualizar uma versão maior desta figura.

Figura 4 compara as diferenças no desempenho de detecção de cada modelo nas seis categorias-alvo. O YOLOv11 + CNN alcançou uma precisão de 0,96 na tarefa de reconhecimento de capacete de segurança, superando o modelo de referência em 4 pontos percentuais. O gráfico pontilhado indica que o modelo apresenta flutuações mínimas de desempenho entre as categorias (±0,05), refletindo suas capacidades de generalização. A matriz de confusão, apresentada como um mapa de calor, revela uma detecção falsa mútua de 15% entre a área perigosa e o braço robótico. Esse resultado fornece uma orientação clara para a otimização subsequente do modelo.

Matriz de confusão e gráfico de desempenho por categoria; análise de precisão, revocação e pontuação F1, modelo de segurança.
Figura 4. Análise de detecção por categoria. Comparação das diferenças de desempenho de cada modelo nas seis categorias-alvo. O YOLOv11 + CNN alcançou uma acurácia de 0,96 na tarefa de reconhecimento de capacete de segurança, superando o modelo de referência em quatro pontos percentuais. O gráfico pontilhado indica que o modelo apresenta flutuações mínimas de desempenho entre as categorias (±0,05), refletindo suas capacidades de generalização. A matriz de confusão, apresentada como um mapa de calor, revela uma detecção falsa mútua de 15% entre a área de risco e o braço robótico. Esse resultado fornece uma direção clara para a otimização subsequente do modelo. Clique aqui para visualizar uma versão maior desta figura.

Figura 5 fornece um registro abrangente do processo de treinamento para cada modelo. O YOLOv11 + CNN apresenta a taxa de convergência mais rápida, com a perda caindo para 0,1 em menos de 30 épocas, e a diferença entre a curva de mAP do conjunto de validação e a do conjunto de treinamento é consistentemente inferior a 1%. A análise do gráfico da banda de erro mostra que o mAP@0,5 final do modelo na validação é estável em 0,94 ± 0,01, e sua amplitude de flutuação de desempenho é apenas um terço daquela do RetinaNet. Esses resultados corroboram a eficácia do protocolo de treinamento conjunto. O modelo demonstra vantagens de desempenho nos estágios iniciais do treinamento, indicando que seu design arquitetônico permite que aprenda características rapidamente.

Gráfico de caixa e gráfico de violino comparando o mAP de validação e a perda de treinamento de modelos de aprendizado de máquina.
Figura 5. Análise do processo de treinamento. Registro do processo de treinamento para cada modelo. O YOLOv11 + CNN apresenta a taxa de convergência mais rápida (a perda cai para 0,1 em menos de 30 épocas), e a diferença entre a curva de mAP do conjunto de validação e a do conjunto de treinamento é sempre inferior a 1%. A análise do gráfico de faixa de erro mostra que o mAP@0,5 final de validação do modelo é estável em 0,94 ± 0,01, e a amplitude da flutuação de desempenho é apenas um terço daquela do RetinaNet. Esses resultados comprovam a eficácia do protocolo de treinamento conjunto. O modelo demonstra vantagens de desempenho nos estágios iniciais do treinamento, indicando que seu design arquitetônico permite que aprenda características rapidamente. Clique aqui para visualizar uma versão maior desta figura.

Tabela 2 apresenta os resultados quantitativos de desempenho para diferentes modelos de detecção em ambientes complexos. Os dados de teste em condições padrão de iluminação e em diversos cenários extremos mostram que o YOLOv11 + CNN mantém desempenho ótimo sob todas as condições. Em condições padrão de iluminação, o mAP@0,5 deste modelo atingiu 0,91, significativamente melhor do que o YOLOv5 (0,87) e o Faster R-CNN (0,84). Com a deterioração das condições ambientais, o desempenho de cada modelo diminui em graus variados, mas o YOLOv11 + CNN demonstra a maior robustez ambiental: em condições de pouca luz (< 50 lux), o desempenho diminui apenas 3% (para 0,88), o que é melhor do que a redução de 5% observada no modelo comparativo; em cenários com alta oclusão (> 50%), seu mAP ainda pode ser mantido em 0,78, e a degradação de desempenho (13%) é significativamente menor do que a do YOLOv5 (15%) e do Faster R-CNN (16%). Esses resultados demonstram que o YOLOv11 + CNN melhora a adaptabilidade do modelo a fatores complexos, como variações de iluminação e oclusões, por meio de mecanismos aprimorados de fusão de características e atenção, apoiando assim aplicações práticas em cenários industriais.

Condição do TesteYOLOv11 + CNNYOLOv5Faster R-CNNFlutuação de Desempenho
Luminosidade Padrão0,910,870,840,01
Baixa Luminosidade (< 50 lux)0,88 (-3%)0,82 (-5%)0,79 (-5%)0,02
Oclusão Parcial (30%–50%)0,85 (-6%)0,80 (-7%)0,76 (-8%)0,03
Oclusão Acentuada (> 50%)0,78 (-13%)0,72 (-15%)0,68 (-16%)0,04
Desfoque por Movimento0,83 (-8%)0,77 (-10%)0,73 (-11%)0,05

Tabela 2: Tabela de análise quantitativa da adaptabilidade ambiental. Desempenho de diferentes modelos de detecção em ambientes complexos por meio de análise quantitativa. Dados de teste desde condições de iluminação padrão até diversos cenários extremos mostram que o YOLOv11 + CNN mantém o desempenho mais alto em todas as condições de teste. Em condições padrão de iluminação, o mAP@0,5 desse modelo atingiu 0,91, significativamente melhor do que o YOLOv5 (0,87) e o Faster R-CNN (0,84). Com a deterioração das condições ambientais, o desempenho de cada modelo diminui em graus variados, mas o YOLOv11 + CNN demonstra a maior robustez ambiental entre os modelos avaliados: em condições de pouca luz (< 50 lux), o desempenho diminui apenas 3% (para 0,88), o que é melhor do que a redução de 5% do modelo comparativo; em cenários com forte oclusão (> 50%), seu mAP ainda pode ser mantido em 0,78, e a degradação de desempenho (13%) é significativamente menor do que a do YOLOv5 (15%) e do Faster R-CNN (16%). Esses resultados demonstram que o YOLOv11 + CNN melhora a adaptabilidade do modelo a fatores complexos, como variações de iluminação e interferência por oclusão, por meio de um mecanismo aprimorado de fusão de características e um design de atenção, apoiando aplicações práticas em cenários industriais.

Tabela 3 mostra que o otimizador SGD foi utilizado neste experimento, com um momento de 0,9 para acelerar a convergência e suprimir oscilações. Uma taxa de aprendizado inicial de 0,01 foi utilizada com recozimento cossenoide, que diminuiu gradualmente durante o treinamento para aprimorar a otimização. Um decaimento de peso de 0,0005 foi introduzido para aplicar regularização L2 e reduzir o sobreajuste. Um tamanho de lote de 32 equilibrou a eficiência computacional com a estabilidade na estimativa do gradiente. As 200 épocas de treinamento garantiram convergência suficiente. Os parâmetros foram adaptados à tarefa de detecção em estágio único, equilibrando velocidade e precisão do treinamento.

ParâmetroValor
OtimizadorSGD
Taxa de aprendizado inicial0.01
Momento0.9
Decaimento do peso0.0005
Tamanho do lote32
Épocas de treinamento200
Agendamento da taxa de aprendizadoRecozimento cosseno

Tabela 3: Tabela de hiperparâmetros de treinamento. O otimizador SGD foi utilizado neste experimento, com um momento de 0,9 para acelerar a convergência e suprimir oscilações. Uma taxa de aprendizado inicial de 0,01 foi utilizada com recozimento cosseno, que diminuiu gradualmente durante o treinamento para refinar a otimização. Uma redução de peso de 0,0005 foi introduzida para aplicar regularização L2 e reduzir o sobreajuste. Um tamanho de lote de 32 equilibrou a eficiência computacional com a estabilidade na estimativa do gradiente. As 200 épocas de treinamento garantiram convergência suficiente. Os parâmetros foram adaptados à tarefa de detecção em estágio único, equilibrando velocidade e precisão do treinamento.

Tabela 4 mostra que, utilizando o YOLOv11 como referência, o mAP@0.5 é 0,89. A introdução da fusão multi-escala isoladamente reduz a precisão para 0,88. A adição sequencial de atenção de canal e atenção espacial melhora a precisão para 0,90 e 0,89, respectivamente. A precisão combinada de todos os módulos atinge 0,91, um aumento de 0,02 em relação à referência. Os dados indicam que a atenção de canal melhora diretamente a precisão, e o desempenho combinado da multi-escala e da atenção é o melhor.

ConfiguraçãomAP@0.5
YOLOv11 (linha de base)0.89
+ Fusão multi-escala0.88
+ Multi-escala + atenção de canal0.9
+ Multi-escala + atenção espacial0.89
Módulo completo (YOLOv11 + CNN)0.91

Tabela 4: Tabela de teste de ablação. Usando YOLOv11 como referência, o mAP@0.5 é 0,89. Introduzir apenas a fusão multi-escala reduz a precisão para 0,88. Adicionar atenção de canal ou atenção espacial após a fusão multi-escala melhora a precisão para 0,90 e 0,89, respectivamente. A precisão combinada de todos os módulos atinge 0,91, um aumento de 0,02 em relação à referência. Os dados mostram que a atenção de canal proporciona ganhos maiores do que a atenção espacial nesta configuração, e que o desempenho combinado da fusão multi-escala e da atenção é o melhor possível.

Figura 6 avalia sistematicamente o desempenho do modelo em ambientes extremos. O mAP do YOLOv11 + CNN diminuiu apenas 6% (para 0,88) em condições de pouca luz e ainda manteve um mAP de 0,78 (8% acima do referencial) em cenas fortemente ocluídas. Esses resultados demonstram que o modelo exibe adaptabilidade ambiental, abordando eficazmente as variações comuns de iluminação e problemas de oclusão parcial na produção industrial, apoiando assim o funcionamento estável do sistema de detecção.

Gráficos de desempenho do modelo de detecção de objetos; análise do impacto da iluminação e oclusão; métricas mAP@0,5.
Figura 6. Adaptabilidade ambiental. Uma avaliação sistemática do desempenho do modelo em ambientes extremos. O mAP do YOLOv11 + CNN diminuiu apenas 6% (para 0,88) em condições de pouca luz, e ainda manteve um mAP de 0,78 (8% acima do referencial) em cenas fortemente ocluídas. Esses resultados demonstram que o modelo exibe adaptabilidade ambiental, abordando efetivamente as variações comuns de iluminação e problemas de oclusão local na produção industrial, apoiando assim o funcionamento estável do sistema de detecção. Clique aqui para visualizar uma versão maior desta figura.

Figura 7 compara as diferenças na distribuição de características entre YOLOv11 e YOLOv11 + CNN em seis tipos de alvos industriais por meio da redução de dimensionalidade t-SNE. A figura à esquerda mostra que as características do modelo básico YOLOv11 exibem uma dispersão intraclasse significativa (distância intraclasse 2,34 ± 0,15), particularmente nas categorias "Zona de Perigo" (vermelho) e "Veículo" (roxo), onde há uma sobreposição acentuada, o que está de acordo com a taxa de detecção incorreta de 15% no grupo experimental 3. A figura à direita mostra que o modelo aprimorado YOLOv11 + CNN melhora significativamente a compacidade intraclasse por meio do módulo de realce de características, aumentando em 1,8 vez a distância média entre os centros de agrupamento dentro de cada categoria.

Gráfico de agrupamento de características YOLOv11 versus YOLOv11+CNN, análise de distância intraclasse, visualização de dados.
Figura 7. Comparação da Distribuição de Características por t-SNE. Uma comparação das diferenças na distribuição de características entre YOLOv11 e YOLOv11 + CNN em seis tipos de alvos industriais por meio da redução de dimensionalidade t-SNE. A figura à esquerda mostra que as características do modelo básico YOLOv11 exibem uma dispersão intraclasse significativa (distância intraclasse 2,34 ± 0,15), particularmente nas classes "Zona de Perigo" (vermelho) e "Veículo" (roxo), onde há uma sobreposição substancial, o que é consistente com a taxa de detecção falsa de 15% no grupo experimental 3. A figura à direita mostra que o modelo aprimorado YOLOv11 + CNN melhora significativamente a compacidade intraclasse por meio do módulo de realce de características, e a distância média entre os centros dos agrupamentos em cada categoria aumenta em 1,8 vez. Clique aqui para visualizar uma versão maior desta figura.

Figura 8 verifica a contribuição de cada módulo por meio de experimentos sistemáticos de ablação. Os resultados da ablação mostram que adicionar atenção de canal após a fusão multi-escala aumenta o mAP@0,5 para 0,90, enquanto adicionar atenção espacial aumenta o mAP@0,5 para 0,89. O módulo completo alcança o maior mAP@0,5 de 0,91. A visualização por mapa de calor mostra que o mecanismo de atenção composto pode simultaneamente realçar a resposta de detecção no centro da área perigosa (valor de ativação: +0,15) e em alvos pequenos na borda (+0,08). Os dados experimentais demonstram que a fusão de características multi-escala e os mecanismos de atenção possuem um efeito cumulativo, permitindo que o modelo atenda aos requisitos de detecção de alvos em diferentes escalas.

Gráfico de estudo de ablação do realce de características em estruturas YOLO com mapas de atenção; análise de desempenho.
Figura 8. Experimento modular de ablação. Verificação da contribuição de cada módulo por meio de experimentos sistemáticos de ablação. Os resultados de ablação mostram que a adição de atenção de canal após a fusão multi-escala aumenta o mAP@0.5 para 0,90, enquanto a adição de atenção espacial aumenta o mAP@0.5 para 0,89. O módulo completo alcança o maior mAP@0.5 de 0,91. A visualização por mapa de calor mostra que o mecanismo de atenção composto pode simultaneamente realçar a resposta de detecção no centro da área perigosa (valor de ativação: +0,15) e em alvos pequenos na borda (+0,08). Os dados experimentais demonstram que a fusão de características multi-escala e os mecanismos de atenção possuem um efeito cumulativo, permitindo que o modelo atenda aos requisitos de detecção de alvos em diferentes escalas. Clique aqui para visualizar uma versão maior desta figura.

DISPONIBILIDADE DE DADOS:
Imagens completas e fluxos de vídeo brutos da linha de produção estão sujeitos a restrições de confidencialidade industrial e não são divulgados publicamente. Uma Descrição do Conjunto de Dados Suplementar (Arquivo Suplementar 1) fornece detalhes sobre a aquisição do conjunto de dados, distribuições de categorias e cenários, especificações de anotação, procedimentos de controle de qualidade, divisões dos dados, pré-processamento e procedimentos de aumento de dados. Um Pseudocódigo e Estrutura para Reprodutibilidade (Arquivo Suplementar 2) fornece um fluxo de trabalho em nível de pseudocódigo, descrições de configuração e orientações para reprodução. Um subconjunto anonimizado e materiais adicionais de apoio podem ser solicitados ao autor correspondente para pesquisa acadêmica sem fins comerciais, sujeito a restrições institucionais e de confidencialidade.

Arquivo Suplementar 1. Descrição do conjunto de dados suplementar. Este arquivo descreve o protocolo de aquisição do conjunto de dados, cobertura de cenários, distribuição de classes, especificações de anotação, procedimentos de controle de qualidade, divisão entre treinamento/validação/teste, pré-processamento e procedimentos de aumento de dados. Clique aqui para baixar este arquivo.

Arquivo Suplementar 2. Pseudocódigo e estrutura para reprodutibilidade. Este arquivo fornece detalhes em nível de pseudocódigo sobre o fluxo de trabalho e a configuração para pré-processamento, treinamento, avaliação e implantação, além de descrever restrições sobre gravações industriais brutas e acesso a materiais complementares. Clique aqui para baixar este arquivo.

Discussão

Os resultados experimentais mostram que o modelo proposto de fusão YOLOv11–CNN melhora a precisão de detecção e o desempenho em tempo real para monitoramento de segurança em linhas de produção. Aproveitando a detecção eficiente em estágio único do YOLOv11 e o realce de características do módulo CNN, o sistema identificou trabalhadores, equipamentos e áreas perigosas sob condições complexas de iluminação e oclusão. A fusão de características em múltiplas escalas e os mecanismos de atenção aprimoraram a capacidade de focar nos elementos-chave de segurança, fornecendo evidências visuais interpretáveis para alerta precoce.

O sistema possui valor prático para linhas de produção em ambientes como a fabricação de automóveis e montagem eletrônica, onde o monitoramento em tempo real pode reduzir a dependência da inspeção manual e encurtar os tempos de resposta a possíveis riscos de segurança. Para alvos pequenos, como parafusos e ferramentas, e para alvos de trabalhadores parcialmente ocultos por braços robóticos ou outros equipamentos, a fusão de características em múltiplas escalas e os mecanismos de atenção melhoram a capacidade do modelo de extrair e enfatizar características relacionadas à segurança. Essas melhorias são relevantes para ambientes produtivos nos quais os alvos variam em tamanho e visibilidade.

No entanto, este estudo ainda apresenta limitações claras. Sob oclusão severa ou iluminação muito baixa, o desempenho do modelo pode diminuir porque as informações das características do alvo tornam-se incompletas, e as características convolucionais existentes podem ser insuficientes. O novo módulo de realce de características CNN adiciona 1,5 M de parâmetros adicionais, o que pode aumentar a carga computacional em dispositivos de borda de baixo custo e limitar a implantação em ambientes com restrição de recursos. Este estudo utiliza dados de imagens em luz visível e não integra informações de sensores multimodais, como imagens térmicas infravermelhas ou radar de ondas milimétricas; portanto, o desempenho pode ser limitado em cenários industriais extremos, como escuridão total ou fumaça.

Pesquisas futuras focarão nas seguintes direções: enxugamento de modelos com base em poda estruturada e distilação de conhecimento para reduzir a carga de parâmetros mantendo o desempenho de detecção; construção de um quadro de detecção por fusão multimodal visível-infravermelho para melhorar a capacidade de detecção em ambientes com iluminação extrema e fumaça; introdução de um módulo Transformer leve para substituir parte das camadas convolucionais e aprimorar a extração de características contextuais de longa distância; e desenvolvimento de um subsistema de reconhecimento de comportamento anormal de ponta a ponta para apoiar todo o fluxo de trabalho, desde a detecção de alvos até o alerta precoce de comportamentos.

Em conclusão, este estudo concentra-se em um sistema de monitoramento de segurança em linhas de produção que integra os algoritmos YOLOv11 e CNN para permitir a detecção em tempo real e o alerta precoce de possíveis riscos de segurança em ambientes industriais complexos. Por meio de verificação experimental, o modelo fusionado demonstrou vantagens de desempenho na precisão de detecção de objetos e na velocidade de inferência. Com sua arquitetura eficiente de detecção em única etapa e extração de características otimizada, o YOLOv11 obteve bom desempenho na identificação rápida de trabalhadores, equipamentos e áreas perigosas, além de capturar com precisão elementos-chave de segurança em cenários de linha de produção. Ao mesmo tempo, a introdução do módulo CNN aprimorado aumentou ainda mais a captura de características e a detecção de alvos parcialmente ocultos. No monitoramento de segurança em linhas de produção, o modelo foca automaticamente nas áreas-chave de segurança na imagem por meio de análise visual, fornecendo uma base interpretável para alertas de segurança. O modelo fusionado demonstrou forte adaptabilidade e estabilidade em diversos cenários de linha de produção, incluindo usinagem, montagem e armazenamento. O trabalho principal deste artigo é o seguinte:

(1) Foi projetada uma arquitetura de fusão profunda de YOLOv11 e CNN para equilibrar velocidade e precisão de detecção.
(2) Foi implementado um mecanismo de fusão de características em múltiplas escalas e otimização por atenção para aumentar a capacidade de foco em elementos-chave de segurança em cenários complexos.
(3) Experimentos realizados no conjunto de dados de segurança de linha de produção criado internamente mostraram que o modelo atingiu um mAP@0.5 de 0,91 e uma velocidade de detecção de 120 FPS. Em testes com cenários cruzados, o modelo demonstrou desempenho estável.

Estudos de caso típicos mostraram que, em condições padrão de iluminação, um capacete de segurança com apenas 40% de exposição foi detectado com precisão por meio da fusão multi-escala e atenção de canal (confiança 0,93), enquanto o modelo de referência o identificou incorretamente como fundo. Em cenários com pouca luz, quando um trabalhador entrou em uma área de risco, a atenção espacial delimitou com sucesso o alvo com linhas direcionais, ao passo que o método comparativo falhou em detectá-lo. Os erros incluíram uma chave inglesa sendo detectada incorretamente como uma ferramenta devido à semelhança de textura com o fundo sob oclusão severa, e um capacete de segurança não sendo detectado devido a uma baixa relação sinal-ruído à distância em condições de pouca luz, revelando limitações na representação de características em condições extremas. Esses resultados indicam que o modelo é robusto em cenários normais e moderadamente complexos, mas ainda necessita de aprimoramento em condições extremas.

Divulgações

Os autores não têm conflitos de interesse a declarar.

Agradecimentos

Este trabalho foi patrocinado em parte pela Fundação de Pesquisa Científica da Universidade de Taizhou para Talentos Avançados "Pesquisa sobre tecnologias-chave de detecção de precisão para manufatura inteligente" (TZXY2020QDJJ006).

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
API COCO   N/AFerramenta de avaliação utilizada para a avaliação da precisão na detecção de alvos e análise estatística.
CUDA 11.4NVIDIAN/APlataforma de computação paralela utilizada com o framework PyTorch 1.12.
Edge TPU   N/APlataforma de implantação utilizada para testes de latência e consumo de energia; a latência relatada foi de 18 ms e o consumo de energia foi de 15 W.
Dispositivo de computação edge Jetson XavierNVIDIA   Dispositivo de computação edge utilizado para testes de taxa de transferência; a velocidade de processamento relatada foi de 70 FPS com latência do percentil 99 dentro de 50 ms.
GPU NVIDIA Tesla V100NVIDIA   GPU utilizada no servidor de treinamento/avaliação.
PyTorch 1.12   N/AFramework de aprendizado profundo utilizado para treinamento e avaliação do modelo.
scikit-learn    N/AFerramenta de avaliação/análise estatística utilizada para avaliação do modelo.
Conjunto de dados de segurança de linha de produção construído internamenteN/AN/AConjunto de dados com 12.000 imagens de cenas de linha de produção no formato VOC, abrangendo iluminação padrão, baixa iluminação, oclusão parcial, oclusão acentuada, borrão de movimento e fundos complexos; seis categorias de anotação: trabalhadores, capacetes de segurança, braços robóticos, áreas perigosas, ferramentas e veículos.
Servidor de treinamento       Servidor equipado com GPU NVIDIA Tesla V100 e sistema operacional Ubuntu 20.04.
Sistema operacional Ubuntu 20.04     N/ASistema operacional utilizado no servidor de treinamento/avaliação.
Formato de anotação VOCN/AN/AFormato de anotação utilizado para o conjunto de dados de segurança de linha de produção construído internamente.
Modelo de detecção de objetos YOLOv11UltralyticsN/AModelo de detecção de objetos utilizado para detectar trabalhadores, equipamentos e potenciais riscos em tempo real.

Referências

  1. Ramadan MNA, Ali MAH, Jaber H, Alkhedher M. Blockchain-secured IoT-federated learning for industrial air pollution monitoring: a mechanistic approach to exposure prediction and environmental safety. Ecotoxicol Environ Saf. 2025;300:118442.
  2. Ahn J, et al. SafeFac: video-based smart safety monitoring for preventing industrial work accidents. Expert Syst Appl. 2023;215:119397.
  3. Natha S, et al. A scalable and generalized deep ensemble model for road anomaly detection in surveillance videos. Comput Mater Contin. 2024;81(3):3707-3729.
  4. Diallo AR, Homri L, Dantan JY. Reducing false alarms in fault detection: a comparative analysis between conformal prediction and classical methods applied to PCA and autoencoders. J Process Control. 2025;152:103495.
  5. Cheng X, Han Y, Zhang W. Development of intelligent monitoring system for soil erosion in pipeline engineering based on deep learning. Comput Electr Eng. 2025;126:110432.
  6. Yan H, et al. A global feature fusion and adaptive optimization method to enhance detection accuracy and computational efficiency based on YOLOv8. Alexandria Eng J. 2025;129:538-552.
  7. Samma H, Al-Azani S, El-Ferik S. UAV-based real-time face detection using YOLOv7. Transp Res Procedia. 2025;84:331-338.
  8. Gong X, Yu J, Zhang H, Dong X. AED-YOLO11: a small object detection model based on YOLO11. Digit Signal Process. 2025;166:105411.
  9. Li R, Xiao K, Lin S, Wu Z. Enhancing aquatic ecosystem monitoring through fish jumping behavior analysis and YOLOv5: applications in freshwater fish identification. J Environ Manage. 2025;391:126413.
  10. Zhang D, Gao Q, Chen Z, Lin Z. Semantic feature refinement of YOLO for human mask detection in dense crowded. J Vis Commun Image Represent. 2025;107:104399.
  11. Choi MJ, Ku DG, Lee SJ. Integrated YOLO and CNN algorithms for evaluating degree of walkway breakage. KSCE J Civ Eng. 2022;26(8):3570-3577.
  12. Li Y, et al. Underwater acoustic intelligent spectrum sensing with multimodal data fusion: an Mul-YOLO approach. Future Gener Comput Syst. 2025;173:107880.
  13. Jiang D, et al. Real-time tracker of chicken for poultry based on attention mechanism-enhanced YOLO-Chicken algorithm. Comput Electron Agric. 2025;237:110640.
  14. Yang X, et al. Automated concrete bridge damage detection using an efficient Vision Transformer-enhanced anchor-free YOLO. Engineering. 2025;51:311-326.
  15. Fuertes D, et al. People detection with omnidirectional cameras using a spatial grid of deep learning foveatic classifiers. Digit Signal Process. 2022;126:103473.
  16. Deepak GD, Bhat SK. Maximizing YOLOv2 efficiency: a study on multiclass detection of indoor objects. Results Eng. 2025;26:105405.
  17. Zhang C, et al. Personnel target detection in infrared environment based on YOLOv3-tinier network and its FPGA implementation. Infrared Phys Technol. 2025;150:106015.
  18. Zhou Y. A YOLO-NL object detector for real-time detection. Expert Syst Appl. 2024;238:122256.
  19. Asadollahpour E, Rahmannejad R, Asghari A, Abdollahipour A. Back analysis of closure parameters of Panet equation and Burger's model of Babolak water tunnel conveyance. Int J Rock Mech Min Sci. 2014;68:159-166.
  20. Anguchamy KK, Palanisamy V. Real-time object detection using improvised YOLOv4 and feature mapping technique for autonomous driving. Expert Syst Appl. 2025;280:127452.
  21. Khan AT, Jensen SM, Khan AR. Advancing precision agriculture: a comparative analysis of YOLOv8 for multi-class weed detection in cotton cultivation. Artif Intell Agric. 2025;15(2):182-191.
  22. Raushan R, Singhal V, Jha RK. Damage detection in concrete structures with multi-feature backgrounds using the YOLO network family. Autom Constr. 2025;170:105887.
  23. Zarboubi M, Bellout A, Chabaa S, Dliou A. CustomBottleneck-VGGNet: advanced tomato leaf disease identification for sustainable agriculture. Comput Electron Agric. 2025;232:110066.
  24. Xie F, et al. Wine variety traceability by data fusion of near-infrared spectroscopy and mid-infrared spectroscopy combined with GAF and ResNet. Chemom Intell Lab Syst. 2025;264:105468.
  25. Huang J, et al. Estimation of the orientation of potatoes and detection bud eye position using potato orientation detection you only look once with fast and accurate features for the movement strategy of intelligent cutting robots. Eng Appl Artif Intell. 2025;142:109923.
  26. Huang Y, et al. Human intrusion detection with distributed fiber optic data based on Squeeze-Excitation and hierarchical connection enhancement network. Opt Fiber Technol. 2025;94:104297.
  27. Qi R, et al. Mechanical fault diagnosis of on-load tap changers using time-frequency vibration analysis and a lightweight YOLO model. Measurement. 2025;256:118441.
  28. Yan J, Wang Z. YOLO V3+VGG16-based automatic operations monitoring and analysis in a manufacturing workshop under Industry 4.0. J Manuf Syst. 2022;63:134-142.
  29. Nazli NANM, et al. A real-time system for detecting personal protective equipment compliance using deep learning model YOLOv5. Procedia Comput Sci. 2024;245:647-656.
  30. Xiao Y, et al. The prediction of kiwi quality attributes based on multi-source data fusion comprehensive analysis model using HSI and FHSI. J Food Compos Anal. 2025;144:107645.

Reimpressões e permissões

Etiquetas

Monitoramento em Tempo RealDetec o por Aprendizagem ProfundaYOLOv11Rede Neural ConvolucionalFus o de Caracter sticas MultiescalaMecanismo de Aten oAutoma o Industrial