Na produção industrial moderna, a segurança é a pedra angular para garantir a eficiência da produção e o bem-estar das pessoas. O ambiente da linha de produção geralmente envolve equipamentos mecânicos de alta velocidade, processos tecnológicos complexos e operações colaborativas que incluem múltiplas tarefas. Qualquer pequeno risco potencial à segurança pode provocar acidentes graves na produção, resultando em perdas econômicas significativas e até mesmo fatalidades. Portanto, é fundamental estabelecer um sistema inteligente, eficiente e em tempo real de monitoramento da segurança para aprimorar a segurança na produção industrial1,2.
Os métodos tradicionais de monitoramento de segurança dependem principalmente de vigilância manual por vídeo e diversos sensores (como sensores infravermelhos, de fumaça e de vibração)3. O monitoramento manual não é apenas ineficiente, mas também propenso a detecções não realizadas devido à fadiga da equipe de monitoramento, e não consegue fornecer cobertura contínua e abrangente. Embora os sensores possam oferecer certa função de alerta precoce, seu alcance de detecção é limitado e eles são sensíveis a interferências ambientais, resultando em problemas acentuados de falsos alarmes4. Os sistemas inteligentes de monitoramento tornaram-se um foco crescente de pesquisa. A análise em tempo real de um fluxo de vídeo por meio de um algoritmo de aprendizado profundo pode identificar automaticamente eventos anormais, comportamentos inseguros e riscos potenciais, melhorando assim significativamente a inteligência do sistema de monitoramento4,5.
A detecção de objetos é uma tecnologia fundamental em monitoramento inteligente. Como representantes dos detectores de objetos de única etapa, os algoritmos da série You Only Look Once (YOLO) demonstram vantagens significativas. Do YOLOv1 ao YOLOv8, esse conjunto de algoritmos passou por um desenvolvimento contínuo, com aprimoramentos na arquitetura da rede, função de perda e metodologia de treinamento, entre outros aspectos6,7. O YOLOv11, em particular, alcançou maior precisão na detecção mantendo uma alta taxa de quadros, especialmente quando confrontado com fundos complexos e alvos densamente agrupados8.
No entanto, apesar do seu excelente desempenho em tarefas gerais de detecção de objetos, o YOLOv11 ainda enfrenta desafios em cenários específicos de monitoramento de segurança em linhas de produção9. Por exemplo, a precisão de detecção do YOLOv11 pode diminuir quando os trabalhadores estão parcialmente ocultos por equipamentos ou quando os sinais de segurança são pequenos e se assemelham muito à cor do fundo. Isso exige que o modelo possua capacidades mais fortes de extração de características e compreensão semântica10.
As redes neurais convolucionais (CNNs) possuem grandes capacidades na extração de características de imagens11. Ao projetar arquiteturas de rede mais profundas e complexas, as CNNs podem aprender características de imagem mais ricas e abstratas. Combinar uma CNN com o YOLOv11 aproveita as capacidades rápidas de detecção do YOLOv11 e a extração profunda de características da CNN, construindo assim um sistema de monitoramento de segurança mais robusto e inteligente.
Com base nisso, este artigo propõe um sistema de monitoramento de segurança em linha de produção utilizando YOLOv11 e uma CNN. Os aspectos inovadores deste estudo incluem: (1) propor uma arquitetura de fusão profunda de YOLOv11 e uma CNN aprimorada; (2) introduzir fusão de características em múltiplas escalas e um mecanismo de atenção composto para aprimorar o reconhecimento de características-chave de segurança; e (3) verificar as vantagens de desempenho do modelo em um conjunto de dados de cenas complexas construído pelo próprio autor.
Desenvolvimento dos algoritmos da série YOLO
Desde sua introdução inicial por Redmon et al. em 201512, o algoritmo You Only Look Once (YOLO) tem despertado grande interesse. Diferentemente dos detectores de duas etapas que dependem de propostas de regiões, o YOLO trata a detecção de objetos como uma tarefa de regressão. Ao prever diretamente as classes e posições dos objetos em uma imagem, o YOLO aumenta significativamente a velocidade de detecção, tornando-o adequado para uso em tempo real13.
Como o trabalho pioneiro desta série, o YOLOv1 alcança pela primeira vez a detecção de alvos de ponta a ponta14. O YOLOv1 envolve particionar a imagem de entrada em uma estrutura de grade, na qual cada célula da grade, geralmente organizada em um formato S × S, tem a tarefa de detectar objetos que se encontram dentro de seus limites.
Especificamente, a saída do YOLOv1 é um tensor. Dentro do S × S × (B × 5 + C), a predição de cada caixa delimitadora contém 5 elementos: coordenada do ponto central (x,y), largura w, altura h e confiança c. O processo de cálculo é ilustrado na Equação (1):
(1)
Entre eles, Pr(Object) representa a probabilidade de haver um alvo na grade, e IOU representa a razão entre a interseção e a união entre a caixa delimitadora prevista e a caixa real. Cada célula da grade também prevê um conjunto de probabilidades de classe, Pr representando a probabilidade de o alvo pertencer à i-ésima classe na presença de um alvo. A função de perda do YOLOv1 é composta por três componentes principais: a perda para a predição de coordenadas, a perda para a estimativa de confiança e a perda para a predição de categoria15.
O YOLOv2 introduz a normalização por lotes, um classificador de alta resolução e uma estratégia de treinamento em múltiplas escalas, o que melhora a estabilidade e a precisão16. O YOLOv3 utiliza o Darknet-53 como sua rede de base e se inspira no conceito da Rede de Pirâmide de Características (FPN) para aprimorar a detecção de alvos17.
O YOLOv4 realizou diversas otimizações com base no YOLOv3, introduzindo tecnologias como a Cross Stage Partial Network (CSPNet)18, a Path Aggregation Network (PANet)19 e o aumento de dados Mosaic para melhorar ainda mais o desempenho do modelo. O YOLOv5 trouxe contribuições significativas para a engenharia, oferecendo uma implementação mais fácil de usar e mais eficiente20.
Nos últimos anos, a série YOLO continuou a evoluir, com versões como YOLOv6, YOLOv7 e YOLOv8 sendo lançadas uma após a outra. Ao introduzir a estrutura Extended Efficient Layer Aggregation Network (E-ELAN) e técnicas de reparametrização de modelos, o YOLOv7 alcança novos avanços tanto em velocidade quanto em precisão. Essas melhorias não apenas aumentam a eficiência da aprendizagem de características, mas também otimizam o desempenho de inferência da rede, permitindo que o YOLOv7 supere versões anteriores e muitos detectores convencionais em diversas tarefas de detecção de objetos em tempo real. O YOLOv8 aprimora ainda mais a estrutura da rede, adota um design livre de âncoras, simplifica o modelo e melhora sua capacidade de generalização21.
Com base nas vantagens das versões anteriores, o YOLOv11, utilizado neste estudo, foi otimizado para cenários industriais complexos. Suas principais melhorias incluem uma rede de extração de características, um módulo de fusão de características mais eficiente e um design de função de perda mais robusto. Essas melhorias permitem que o YOLOv11 apresente um desempenho superior ao lidar com oclusões, alvos pequenos e fundos complexos em ambientes de produção. O YOLOv11 é uma versão da série YOLO lançada pela Ultralytics. Em comparação com o YOLOv8, ele aprimora o módulo C3K2 e o caminho de fusão de características, além de introduzir uma estratégia adaptativa de caixas âncora, proporcionando assim uma robustez de detecção mais forte em cenários industriais.
Base e progresso da rede neural convolucional (CNN)
A rede neural convolucional (CNN) é um modelo fundamental que influenciou profundamente o sucesso do aprendizado profundo na visão computacional. Ela opera extraindo características locais da imagem por meio de operações convolucionais e, posteriormente, reduzindo a dimensionalidade das características por meio de operações de agrupamento, alcançando assim uma abstração hierárquica da imagem22.
Uma CNN típica é composta por múltiplas camadas convolucionais, de agrupamento e totalmente conectadas. A camada convolucional varre a imagem de entrada com um kernel de convolução, calcula produtos escalares sobre regiões locais e produz um mapa de características. O processo de cálculo é mostrado na Equação (2):
(2)
Onde x é a imagem de entrada, wk e bk são os pesos e o viés do kernel de convolução, respectivamente, e
são os valores do mapa de características de saída na posição (i,j). A camada de agrupamento geralmente utiliza Max Pooling ou Average Pooling. A camada totalmente conectada é responsável por extrair características e prever probabilidades de classificação.
Com base nisso, este artigo propõe um módulo de realce de características CNN para o YOLOv11, composto por dois ramos paralelos: um ramo de convolução multi-escala que utiliza kernels de convolução 3 × 3 e 5 × 5 para extrair características em múltiplas escalas; e um ramo de atenção que conecta sequencialmente os módulos de atenção de canal (Squeeze-and-Excitation) e de atenção espacial, a fim de realçar as características discriminativas dos alvos principais. As saídas dos dois ramos são fundidas por meio de adição elemento a elemento, e a função de perda correspondente de realce de características é apresentada na fórmula (3):
(3)
Lcoord é a perda de regressão das coordenadas da caixa delimitadora; Lconf é a perda de confiança do alvo; Lcls é a perda de classificação de categoria; Lfeat é a perda de realce de características, utilizada para restringir as características discriminativas de alvos pequenos e alvos ocluídos extraídas pelo módulo de realce da CNN; λcoord, λconf, λcls, λfeat são os coeficientes de peso dos termos de perda correspondentes. Para esta tarefa, define-se λfeat = 0,05, e os demais pesos são balanceados de acordo com os requisitos da tarefa de detecção.
Estruturas clássicas de CNN, como VGGNet23 e ResNet24, obtiveram grande sucesso em tarefas de classificação de imagens. Entre essas arquiteturas, a ResNet mitiga efetivamente o problema do gradiente que desaparece no treinamento de redes profundas, facilitando assim a construção de estruturas de rede mais profundas e complexas.
Em tarefas de detecção de objetos, a CNN geralmente é usada como extrator de características (backbone). Por exemplo, Darknet, Darknet parcial em múltiplos estágios (CSPDarknet), etc., na série de algoritmos YOLO, são todos baseados na CNN25. Para aprimorar as capacidades de extração de características, os pesquisadores propuseram diversas estruturas aprimoradas de CNN. Por exemplo, o módulo Inception extrai características em paralelo por meio de kernels de convolução de múltiplas escalas. A DenseNet potencializa a reutilização de características com conexões densas. A Rede Squeeze-and-Excitation ajusta adaptativamente a importância dos canais de características por meio de mecanismos de atenção26.
Neste estudo, projetamos um módulo CNN aprimorado para aumentar as capacidades de extração de características do YOLOv11. Este módulo combina a fusão de características em múltiplas escalas com um mecanismo de atenção para capturar de forma mais eficaz as informações-chave de segurança em cenários de linha de produção.
Situação da aplicação do aprendizado profundo no monitoramento de segurança industrial
O aprendizado profundo tem obtido grande destaque no monitoramento de segurança industrial. Algoritmos baseados em CNN são empregados para determinar se os trabalhadores estão usando corretamente capacetes de segurança, detectar intrusões não autorizadas em zonas perigosas e monitorar o estado de equipamentos com defeito27.
Em termos de reconhecimento de comportamento, CNNs 3D e redes neurais recorrentes são utilizadas para analisar o comportamento operacional dos trabalhadores e identificar ações potencialmente inseguras. Por exemplo, ao analisar as sequências de postura dos trabalhadores, pode-se determinar se eles estão violando os procedimentos operacionais de segurança28.
YOLO e Faster R-CNN são amplamente utilizados para detecção de pessoal e equipamentos em vídeos de vigilância em tempo real. Por exemplo, um sistema de detecção em tempo real de capacetes baseado no YOLOv5 foi proposto na literatura, melhorando efetivamente a inteligência na gestão da segurança em canteiros de obras29.
Embora alguns avanços tenham sido feitos nas pesquisas existentes, vários desafios permanecem. Primeiro, as cenas industriais geralmente apresentam iluminação complexa, oclusão e interferência de fundo, o que impõe requisitos rigorosos quanto à robustez do algoritmo. Segundo, o desempenho em tempo real é um requisito fundamental, e o algoritmo deve alcançar inferência de alta velocidade mantendo a precisão. Por fim, as pesquisas existentes concentram-se principalmente na detecção de tarefa única e carecem de exploração da fusão de informações multissensoriais e de análises abrangentes30.
Neste estudo, o modelo proposto de fusão YOLOv11 e CNN tem como objetivo enfrentar os desafios mencionados e alcançar um monitoramento abrangente e em tempo real dos riscos à segurança na linha de produção, melhorando as capacidades de extração e fusão de características.