Artigo de investigação

Modelo de Detecção de Objetos em Tempo Real para Identificação de Marcas de Cigarros Baseado em uma Arquitetura de Regressão de Estágio Único Aprimorada

DOI:

10.3791/69657

9 de janeiro de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para enfrentar desafios como oclusão e mudanças de iluminação em armazéns automatizados, este artigo apresenta uma Arquitetura de Regressão de Estágio Único aprimorada para a detecção de marcas de caixas de cigarros. Ao integrar amostragem adaptativa para baixo, um mecanismo de atenção invertido eficiente e multi-escala e uma cabeça de detecção dinâmica, o modelo proposto alcança um inventário inteligente preciso e em tempo real.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O reconhecimento visual para estoque automatizado de cigarros enfrenta obstáculos significativos, incluindo mudanças na iluminação, dimensões diversas das caixas e oclusão parcial de características, que complicam a verificação da marca e a detecção de caixas deslocadas. Este artigo propõe um modelo aprimorado de detecção em tempo real para lidar com problemas de reconhecimento de imagens e melhorar a precisão. Primeiramente, um módulo adaptativo de downsampling é implantado para substituir o módulo de convolução downsampling tanto na espinha dorsal quanto na rede neckbone da série YOLO como detector base ou original, que efetivamente mantém mais detalhes de características e realiza a leveza do modelo. Em segundo lugar, é introduzido um módulo de atenção invertido eficiente e multiescala para capturar as informações do contexto espacial de diferentes escalas e gerar um mapa de atenção espacial mais preciso, que melhora a precisão da predição do modelo de base para características complexas e alvos de oclusão. Por fim, um módulo de cabeça de detecção dinâmica substitui a cabeça de detecção original do modelo de base e realiza a detecção de objetos em múltiplas escalas no mapa de características extraído das redes da espinha dorsal e do pescoço para alcançar posicionamento e divisão de categorias precisas do alvo previsto. Para avaliar o desempenho do modelo aprimorado em campo, construímos um conjunto de dados visual da marca das caixas de cigarros. O conjunto de dados foi ampliado usando técnicas específicas de copiar e colar específicas da região e técnicas tradicionais de aumento, e o conjunto de dados obtido inclui fundo complexo, oclusão e sobreposição, alvo pequeno e outros fatores. O experimento demonstra que o modelo aprimorado apresentado neste artigo atende efetivamente aos requisitos para detecção em tempo real no campo. O modelo proposto alcança um mAP de 97,9%, com parâmetros e FLOPs de 1.849.679 e 5,1 G, respectivamente. Comparado ao modelo base, o modelo proposto melhora o mAP em 0,9%, reduzindo parâmetros em 28,78% e as operações em ponto flutuante em 1,4 G. Além disso, o modelo atinge uma velocidade de inferência de 38,5 FPS, satisfazendo os requisitos para detecção industrial em tempo real.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A manufatura e a logística modernas dependem fortemente dos Sistemas Automatizados de Armazenamento e Recuperação (AS/RS)1 para alcançar armazenamento de alta densidade, manuseio eficiente de materiais e gerenciamento preciso de estoque. AS/RS tornou-se um meio crucial que pode ajudar as empresas a melhorar a eficiência dos armazéns e reduzir custos, devido à sua alta eficiência e características inteligentes. Com uma base de prateleiras multicamadas e diversos equipamentos de carregamento e descarga, o AS/RS é um sistema mecatrônico controlado por computador, que integra múltiplas tecnologias, incluindo mecânica, eletrônica, ciência da computação, comunicações, redes, sensores e controleautomático 2,3. O AS/RS realiza o armazenamento e manuseio eficientes, precisos e seguros de mercadorias por meio da integração e otimização de prateleiras, guindastes empilhadores, linhas de transportadora, sistemas de controle e outros equipamentos, o que aumenta significativamente a eficiência do armazenamento. A integração da visão computacional no AS/RS, um aspecto fundamental da Indústria 4.0, possibilita níveis sem precedentes de automação e inteligência ao permitir que os sistemas vejam e tomem decisões baseadas em dadosvisuais 4.

Com a ampla aplicação do AS/RS nas fábricasde tabaco 5, foi proposta uma nova exigência de estoque para marcas de caixas de cigarros. Os métodos manuais tradicionais de inventário sofrem com ineficiência, altas taxas de detecção de falsas detecções e riscos à segurança, que não atendem às necessidades do AS/RS. Com o avanço contínuo da tecnologia de visão computacional, as soluções de visão artificial são cada vez mais aplicadas nos domínios de inspeçãoindustrial 6,7,8. Como informações de marca com padrões e textos únicos são impressas em cada caixa de cigarros, a tecnologia de reconhecimento de imagens baseada em visão artificial permite a identificação da marca e o estoque das caixas de cigarros.

Desde 2012, algoritmos de detecção de objetos baseados em aprendizado profundo trouxeram avanços significativos ao reconhecimentode imagens 9,10,11. Desde os primeiros modelos de detecção de objetos de dois estágios como o R-CNN12 até os modelos contemporâneos de detecção de objetos de estágio único dominados pelos modelos da série YOLO como detector baseou original 13, 14, 15, essas abordagens deram uma contribuição significativa para o desenvolvimento de algoritmos de detecção de objetos. Tarefas inteligentes de inventário utilizam cada vez mais modelos de detecção de objetos para identificar e localizar múltiplos alvos com precisão em imagens ou vídeos. Li et al.16 propuseram um método inteligente de avaliação integrando sensores de pesagem e tecnologia de reconhecimento de imagem para melhorar a eficiência e a precisão do inventário. Wang et al.17 usaram máscara R-CNN para segmentar o número da estante e a posição do título a partir da imagem do dorso do livro. Sun et al.18 projetaram um sistema integrado de reconhecimento visual, que usava o OpenCV para reconhecer os códigos bidimensionais em materiais e prateleiras em modo múltiplo. Eles otimizaram o detector original (v5s) introduzindo o mecanismo de atenção C3CBAM e a atribuição de rótulos SimOTA para aprimorar as funções de perda e garantir uma detecção precisa de múltiplos materiais.

No campo da detecção de objetos, enquanto modelos de dois estágios — representados pelo Faster R-CNN — possuem vantagens tradicionais em precisão de detecção, seus mecanismos complexos de geração de propostas de regiões resultam em velocidades de inferência relativamente lentas. Consequentemente, eles têm dificuldades para atender aos rigorosos requisitos de desempenho em tempo real em cenáriosindustriais 19,20. Em contraste, a arquitetura baseada em regressão trata a detecção de objetos como um único problema de regressão, prevendo diretamente as localizações dos alvos e as probabilidades das categorias a partir de imagens de entrada. Esse design arquitetônico permite que os modelos superem significativamente a maioria dos modelos de dois estágios em termos de eficiência de inferência, redução de peso e flexibilidade de implantação, mantendo a precisão competitiva. Assim, essa arquitetura tornou-se a solução preferida para a detecção industrialem tempo real 21.

O ecossistema original do modelo continua a evoluir rapidamente, com variantes recentes abordando desafios específicos. Por exemplo, o detector original (v12)22 foca em aprimorar ainda mais a otimização do tempo de treinamento e o refinamento arquitetônico para melhores concessões de precisão e eficiência. Enquanto isso, o detector original (World)23 introduz capacidades de detecção de vocabulário aberto, permitindo inferência em tempo real de uma vasta gama de objetos além das categorias do conjunto de treinamento por meio da modelagem de linguagem de visão. Embora esses avanços ultrapassem os limites da detecção de objetos de uso geral, este trabalho foca em uma aplicação industrial especializada onde a robustez a desafios específicos, como oclusão parcial e variância de iluminação, é fundamental, e o espaço de categorias é fixo e conhecido a priori. Como a versão mais quente dessa família de modelos, o modelobásico 24 herda vantagens do detector original (v8)25,26; Ele não apenas reduz o número de parâmetros do modelo, mas também considera um equilíbrio entre eficiência de detecção e precisão. Comparado a outros modelos de detecção de objetos, ele se destaca em tarefas de reconhecimento visual.

O desafio de detectar caixas de cigarros pequenas ou parcialmente ocluídas é uma manifestação de um problema mais amplo na visão computacional. A detecção de pequenos objetos tem sido pesquisada ativamente, com abordagens que vão desde refinamentos de rede de pirâmide de características (FPN) 27 até mecanismos de atenção conscientes do contexto, que inspiram a integração do processamento de características em múltiplas escalas. Além disso, a busca pela eficiência operacional em um ambiente industrial exige um modelo leve. Inspirados pelos conceitos de arquitetura eficiente explorados no MobileNetV328 eGhostNet 29, esses conceitos usam convolução profunda e transformação linear para reduzir a complexidade computacional enquanto mantêm a capacidade de apresentação, então escolhemos alguns módulos leves para melhorar o modelo. Portanto, para lidar com o estoque das marcas de caixas de cigarros e os fatores que influenciam o estoque, como mudanças na iluminação, diferenças de tamanho das características entre várias marcas e oclusão parcial entre as caixas de cigarros, propomos neste artigo um modelo aprimorado de detecção de objetos com arquitetura de regressão de estágio único.

As principais inovações do modelo proposto são três. Primeiro, o módulo Adaptive Downsampling (ADown)30é implantado para substituir a rede convolucional padrão tanto na espinha dorsal quanto na rede neckbone. Esse design inovador mitiga a perda de informação durante a compressão de recursos, o que é fundamental para preservar logos e textos de pequenas marcas. Segundo, um mecanismo invertido de Atenção Multiescala Eficiente (iEMA) é introduzido para capacitar o modelo com percepção contextual dinâmica e multi-escala, aumentando significativamente seu desempenho em caixas pequenas e parcialmente ocluídas. Terceiro, a cabeça de detecção original é substituída pelo módulo DynamicHead31 , que unifica atenções conscientes de escala, espaço e tarefas, permitindo localização e classificação mais precisas entre alvos de tamanhos muito diferentes. Essas modificações arquitetônicas são coesas para tratar dos pontos críticos específicos da identificação de marcas de cigarros em ambientes industriais.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O conjunto de dados utilizado neste artigo foi adquirido do campo AS/RS do Departamento de Logística da Longyan Tobacco Industry Co., Ltd. Este estudo não envolveu participantes humanos nem animais. Não era necessário aprovar éticamente.

Aquisição e configuração de conjuntos de dados
Configuração de hardware: Instalar uma câmera industrial (por exemplo, MV-CA013-A0GM) equipada com uma lente de distância focal de 8 mm (por exemplo, MVL-HF0828M-6MPE) na plataforma de carga do guindaste empilhador. Conecte a câmera a um PC de controle via cabo GigE e um dispositivo de acesso sem fio (por exemplo, BH-ANT5158S-14HV, BH-MS-AC1600HWH). Posicione uma faixa de luz LED (por exemplo, MV-LLDS-1002-38-W) ao redor da câmera para garantir uma iluminação uniforme.

Configuração dos parâmetros da câmera: Configure a câmera usando o software do fabricante (por exemplo, MVS). Defina a resolução de aquisição para 1280 x 1024 pixels. Defina o modo de gatilho para Gatilho Hardware e sincronize-o com o sistema de posicionamento do guindaste empilhador. Ajuste o tempo de exposição para 100 ms e o ganho para 5 dB para minimizar o desfoque de movimento e o ruído. A distância de trabalho entre a câmera e as caixas de cigarros é de aproximadamente 550 mm.

Coleta de imagens: Uma câmera industrial com gatilho captura uma imagem automaticamente toda vez que uma bandeja é posicionada durante o armazenamento e retirada das caixas de cigarros. Colete um total de 4.835 imagens brutas; imagens típicas são mostradas na Figura 1.

Anotação de imagem: Use a ferramenta de código aberto LabelImg. Para cada imagem, desenhe caixas delimitadoras ao redor de cada característica visível da marca de cigarro. Atribua o nome da marca correto (por exemplo, Hongzhuang, Gutian) como etiqueta de classe para cada caixa delimitadora. Salve as anotações em um formato padrão de detecção de estágio único, com um arquivo txt por imagem.

Controle de qualidade: Um segundo anotador revisa aleatoriamente 20% das imagens anotadas. Quaisquer discrepâncias são discutidas e resolvidas, garantindo a consistência da rotulagem.

Estratégia de aumento de dados
Esta seção detalha tanto técnicas tradicionais quanto avançadas de aumento aplicadas aos conjuntos de dados. Os dados iniciais e os dados aumentados são combinados em um novo conjunto de dados, que então é dividido em conjunto de treinamento, conjunto de validação e conjunto de teste para garantir a justiça na avaliação.

Aumento tradicional de dados32: Essas transformações são aplicadas em tempo real pelo pipeline de treinamento (por exemplo, usando as bibliotecas Albumentations ou PyTorch Transforms) com uma probabilidade definida para cada lote.

Transformações geométricas: Rotação: Gira aleatoriamente as imagens em um ângulo entre -45° e +45°. Escalonamento: Escala aleatoriamente imagens por um fator entre 0,8 e 1,2. Inversão horizontal: Inverta aleatoriamente as imagens horizontalmente com 100% de probabilidade. Recorte aleatório: Recorte aleatoriamente uma seção entre 80% e 100% da área original da imagem.

Transformações fotométricas: Brilho e Contraste: Ajuste o brilho e o contraste por um fator escolhido aleatoriamente entre [0,6, 1,4]. Ruído gaussiano: Adicione ruído gaussiano com um desvio padrão escolhido aleatoriamente entre [0, 0,01 * 255] até 10% das imagens. Desfoque Gaussiano: Aplique um desfoque Gaussiano com tamanho de kernel de 3x3 a 10% das imagens.

Simulação de oclusão: Coloque aleatoriamente de 1 a 3 manchas retangulares de oclusão (cobrindo até 5% da área da imagem cada) nas imagens. Os patches são preenchidos com ruído aleatório ou valores médios de pixels da imagem.

Aumento avançado de dados: copiar e colar específico por região
Motivação e impacto: A principal motivação para esse aumento direcionado foi abordar uma questão crítica de dados: várias marcas de cigarros tiveram pouquíssimas ocorrências (até apenas uma imagem). Uma divisão padrão aleatória de validação de trem poderia potencialmente alocar todas as instâncias de uma marca rara para um único conjunto (por exemplo, todas para o conjunto de teste), resultando em que o modelo não teria oportunidade de aprender ou validar essa marca. Esse método aumentou artificialmente o tamanho da amostra dessas marcas sub-representadas, garantindo que cada marca tenha um número suficiente de instâncias distribuídas entre os conjuntos de treinamento, validação e teste. Essa etapa fundamental previne falhas catastróficas em categorias raras e é pré-requisito para qualquer desempenho significativo do modelo e generalização em todo o conjunto de marcas.

Essa etapa requer um modelo segmental de linha base pré-treinado no conjunto de dados inicial e no Modelo Segment Anything (SAM)33.

Segmentar objetos fonte: Para imagens de caixas de cigarros de marcas sub-representadas, use o modelo SAM para gerar máscaras de segmentação precisas. Use o modo de apontamento, clicando no recurso de marca da Caixa de Cigarros para iniciar a segmentação. Valide e refina manualmente as máscaras geradas para garantir precisão. Salve as imagens segmentadas das caixas de cigarros com fundos transparentes como arquivos PNG. Isso cria uma biblioteca de instâncias isoladas de objetos.

Gerar máscaras de fundo: Use o modelo segmental de linha base pré-treinado para realizar segmentação de instâncias em um conjunto de imagens de fundo (imagens com espaço livre amplo ou fundos simples). O modelo gerará máscaras binárias indicando as regiões já ocupadas por objetos.

Processar máscaras e colar objetos: Para cada máscara de fundo, use a biblioteca OpenCV (função 'cv2.approxPolyDP' com fator épsilon de 0,02 * perímetro de contorno) para realizar ajuste de curvas e linearizar as bordas da máscara, obtendo uma representação poligonal simplificada do espaço livre. Identifique a maior área de polígono contígua dentro da máscara de fundo como a região da pasta alvo. Selecione aleatoriamente um objeto de origem segmentada da biblioteca. Redimensione-a (mantendo a razão de aspecto) e aplique uma transformação afim (rotação menor entre -5° e +5°, e leve cisalhamento) para caber naturalmente na região da pasta de destino, garantindo que ela não se sobreponha aos limites dos objetos existentes. Use o alpha blending para colar o objeto transformado de forma fluida na imagem de fundo no local calculado. O arcabouço geral da tecnologia de aumento de dados baseado na técnica de copiar e colar em áreas específicas é mostrado na Figura 2. Gerar programáticamente um novo arquivo de anotação txt correspondente para o objeto colado, atualizando as coordenadas da caixa delimitadora e o rótulo da classe.

Conjunto de dados final aumentado: Este processo offline gera 600 novas imagens sintéticas. Combine-as com as 4.835 imagens originais e mais 1.167 imagens geradas aplicando as técnicas tradicionais de aumento descritas acima para formar o conjunto final de dados de 6.602 imagens. Divida o conjunto final em conjuntos de treinamento (70%, 4.621 imagens), validação (20%, 1.320 imagens) e teste (10%, 661 imagens), garantindo que as imagens da mesma sequência original sejam mantidas dentro da mesma divisão para evitar vazamento de dados.

Modificação do modelo para construir o detector aprimorado proposto
Algoritmos otimizados de detecção de objetos34 alcançaram progressos notáveis na inspeção industrial nos últimos anos. Esta seção fornece um procedimento detalhado, passo a passo, para modificar a arquitetura do modelo de referência para criar o modelo proposto. As modificações são implementadas editando o arquivo de configuração do modelo (por exemplo, config.yaml) e garantindo que as definições de módulos personalizados correspondentes estejam incluídas na base de código. A justificativa para cada modificação é fornecida para elucidar seu papel no enfrentamento de desafios específicos de detecção. A estrutura do modelo proposto é mostrada na Figura 3.

Substituição dos módulos de downsampling pelo módulo ADown: O módulo padrão Convolution-BatchNorm-SiLU (CBS) usado para downsampling emprega uma única convolução strided (strided), que pode atuar como um gargalode informações 35, potencialmente descartando recursos finos cruciais para reconhecer pequenas caixas de cigarros e logotipos detalhados de marcas. O módulo ADown foi projetado para aliviar isso implementando uma estrutura de duplo ramo que captura e preserva um conjunto mais rico de características durante a redução de resolução espacial. Um ramo prioriza a retenção de detalhes locais de alta frequência, enquanto o outro captura uma visão mais ampla e rica em contexto. A fusão dessas características complementares resulta em uma representação mais robusta e informativa para camadas subsequentes.

Etapas de ação para implementar
Definição do módulo: Garanta que um módulo personalizado do PyTorch chamado ADown esteja definido nos arquivos de definição do modelo do projeto. Este módulo deve conter dois ramos paralelos. O primeiro ramo deve consistir em uma camada de convolução bidimensional com um núcleo 3x3 e um passo de 2. O segundo ramo deve consistir sequencialmente em uma camada de max-pooling 2x2 (com passo 2) seguida por uma camada de convolução 1x1. As saídas desses dois ramos devem ser concatenadas ao longo da dimensão do canal, e o mapa de características resultante é então passado por uma camada final de convolução 1x1 para integrar os canais e produzir a saída. A estrutura do módulo ADown é mostrada na Figura 4.

Edição do arquivo de configuração: Abra o arquivo de configuração do modelo de referência (config.yaml). Identifique sistematicamente cada instância do módulo CBS configurada para amostragem reduzida (ou seja, onde o parâmetro de passo está definido como 2). Substitua cada uma dessas entradas do módulo CBS pelo novo módulo ADown.

Motivação de projeto: O design do ADown é motivado pela necessidade de mitigar a perda de informação em convoluções padrão stridadas, que podem ser prejudiciais para objetos pequenos. Sua estrutura de duplo ramo é inspirada na ideia do processamento paralelo para capturar tanto detalhes espaciais de alta frequência (via convolução) quanto informações contextuais de baixa frequência (via pooling), proporcionando assim uma representação de características multiescala mais rica para camadas subsequentes.

Integração do módulo iEMA
Fundamento e princípio de projeto: Para aprimorar a capacidade do modelo de detectar pequenos alvos e aqueles parcialmente ocultos, é essencial incorporar um mecanismo que possa modelar efetivamente contextos espaciais em múltiplas escalas. O módulo iEMA alcança isso ao incorporar um componente Eficiente de Atenção Multiescala (EMA)36 dentro de uma estrutura de bloco residual invertido (iRMB)37 . O iRMB fornece uma base computacionalmente eficiente usando convoluções separáveis em profundidade, enquanto o componente EMA captura explicitamente interações espaciais em escala cruzada por meio de um projeto paralelo multi-ramo. Essa integração permite que o modelo recalibre dinamicamente os pesos das características, focando a atenção nas regiões espaciais mais discriminatórias em diferentes escalas, melhorando assim o reconhecimento sob oclusão e para objetos pequenos.

Etapas de ação e implementação
Definição do módulo: Certifique-se de que um módulo personalizado do PyTorch chamado iEMA esteja definido. Este módulo deve primeiro implementar um bloco residual invertido. Esse bloco normalmente começa com uma convolução pontual para expansão do canal, seguida por uma convolução em profundidade (por exemplo, 3x3) para extração de características espaciais, e finalmente uma convolução pontual para projeção do canal. Imediatamente após esse bloqueio, o mecanismo de atenção da EMA deve ser implementado. O mecanismo EMA normalmente emprega convoluções agrupadas e interações interdimensionais para gerar eficientemente um mapa de atenção espacial multiescala sem excesso de sobrecarga computacional. A estrutura do módulo iEMA é mostrada na Figura 5.

Edição de arquivos de configuração: No arquivo de configuração config.yaml, localize as seções que definem a rede neck, especificamente as camadas imediatamente após os módulos C2f. Nesses locais estratégicos, insira uma nova camada que chame o módulo iEMA.

Motivação de projeto: O módulo iEMA é baseado no princípio de melhorar a discriminabilidade de características integrando extração local de características (via convolução em profundidade) com um mecanismo de modelagem global de contexto (EMA) leve, porém eficaz. Essa abordagem híbrida permite que o modelo foque de forma adaptativa em regiões informativas em diferentes escalas, o que é crucial para reconhecer logotipos e textos de marcas parcialmente visíveis.

Substituição da cabeça de detecção pelo módulo DynamicHead
Fundamento e princípio de design: A cabeça de detecção original pode não lidar de forma ideal com a variação significativa de escala das caixas de cigarros e a complexa interação entre tarefas de localização e classificação. O módulo DynamicHead aborda isso unificando três formas de atenção em uma estrutura coerente: consciente da escala, consciente do espaço e atenção consciente da tarefa. O componente consciente da escala funde dinamicamente características de diferentes níveis da pirâmide de características, garantindo que objetos de todos os tamanhos sejam representados de forma eficaz. O componente espacialmente consciente emprega uma estratégia de amostragem esparsa para focar recursos computacionais nas regiões mais informativas dentro dos mapas de características. O componente consciente da tarefa adapta a representação de características especificamente para os objetivos distintos da regressão de caixas delimitadoras e classificação de categorias. Essa abordagem unificada leva a previsões mais precisas e robustas.

Etapas de ação e implementação
Definição do módulo: Este é um módulo complexo que abrange os três mecanismos de atenção descritos pelas Equações (1) a (4). Sua estrutura interna incluirá camadas para calcular pesos em escala, realizar atenção espacial deformável e aplicar transformações de características específicas para cada tarefa.

Equação 1(1)

Equação 2(2)

Equação 3(3)

Equação 4(4)

Onde WL(F) denota o mapa final de características refinado pela atenção, obtido aplicando sequencialmente o πL(F) consciente da escala, o πS(F) consciente da escala e os mecanismos de atenção C F) conscientes da tarefa à característica de entrada F. Especificamente, na Eq. (2), πL(F) calcula um peso de atenção em escala primeiro fazendo uma média entre dimensões espaciais (S) e canais (C), passando-o por uma função linear f(⋅) e uma ativação sigmoide dura σ(⋅). Na Eq. (3), πS(F) realiza atenção espacial esparsa ao agregar características de K pontos-chave amostrados pk, cada um com um deslocamento aprendível Δpk para focar em regiões discriminativas e um escalar de importância Δm k. Na Eq. (4), πC(F) implementa uma atenção consciente da tarefa aplicando uma transformação linear (governada por parâmetros aprendidos (α1, β1,α 2,β 2)) a cada canal e selecionando a resposta máxima, permitindo que a cabeça se especialize em tarefas de classificação e regressão. A estrutura do módulo DynamicHead é mostrada na Figura 6.

Edição de arquivo de configuração: No arquivo config.yaml, encontre a seção que define a cabeça do modelo, que originalmente contém o módulo Detect. Substitua por uma nova entrada que chame o módulo DynamicHead.

Motivação de projeto: O módulo DynamicHead se baseia na observação de que as cabeças de detecção de objetos devem ser adaptativas à escala, localização espacial e tarefa. Seu arcabouço unificado de atenção, formalizado em Eqs. (1-4), permite que o modelo recalibre dinamicamente as respostas das características com base nessas três dimensões, levando a previsões mais robustas contra variações de escala e bagunça de fundo.

Treinamento em modelos
Certifique-se de que o PyTorch 2.1.0, CUDA 12.1 e todas as dependências estejam instalados.

Comando de treinamento
Antes de retreinar, prepare os dados da imagem dividida e os dados de anotação em um formato padrão de detecção de estágio único. Crie um arquivo .yaml contendo o caminho da imagem e a categoria de dados. De acordo com a melhoria do modelo, o arquivo .yaml original do detector é substituído pelo arquivo .yaml proposto do modelo. Escreva o arquivo train.py, importe o pacote detector de estágio único, carregue o modelo de treinamento e o caminho de dados, e defina alguns parâmetros de treinamento, incluindo imgze=640, epochs=100, batch=4, workers=0, dispositivo='0', otimizador='SGD', close_mosaic=10, etc.

Hiperparâmetros: Os parâmetros principais são: tamanho da imagem de entrada (640 x 640), tamanho do lote (4), taxa inicial de aprendizado (0,01) com agendador de recozimento cosseno, otimizador SGD com momento (0,937) e decaimento de peso (0,0005). A ampliação em mosaico é ativada por padrão.

Monitoramento do treinamento: O processo de treinamento gerará métricas para cada época. Monitore as curvas para perda de treinamento/validação e mAP em 0,5 para garantir convergência e evitar superajuste. Treinar para 100 épocas geralmente é suficiente.

Avaliação e implantação de modelos
Avaliação: Após o treino, o melhor modelo é salvo como runs/train/exp/weights/best.pt. Avalie no conjunto de vals usando: bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. O script gera Precisão, Recall, mAP em 0,5, etc. Confirme que o mAP atinge o limite exigido (por exemplo, 97,9%).

Inferência para verificação: Execute inferência em imagens de amostra para verificar visualmente os resultados da detecção: bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Ao verificar o raciocínio, é possível obter os resultados de detecção de cada imagem e a velocidade de detecção do modelo.

Implantação: Para implantação em tempo real no sistema do guindaste empilhador, converta o modelo PyTorch (best.pt, ~4,7 MB) para um formato como TensorRT ou ONNX para otimizar a velocidade de inferência. A saída final são caixas delimitadoras com etiquetas de classe (nomes de marcas) e pontuações de confiança.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ambiente experimental e definição de parâmetros
Experimentos para verificar o desempenho do modelo proposto foram realizados no framework de deep learning PyTorch, e detalhes do ambiente experimental estão listados na Tabela 1. Aqui, usamos um conjunto de dados especial contendo 6.602 imagens que foi dividido aleatoriamente em conjuntos de treinamento, validação e teste em uma proporção de 7:2:1. Todos os experimentos usaram imagens de entrada com resolução de 640 x 640 e taxa inicial...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Compromisso entre precisão e eficiência
Uma conquista central desse modelo é seu equilíbrio superior entre precisão e eficiência computacional. Como evidenciado na Tabela 2, o modelo apresentado alcança o maior mAP enquanto simultaneamente possui o menor número de parâmetros e o segundo menor FLOPs entre os modelos de detector de estágio único comparados. Isso se traduz diretamente em benefícios práticos: um modelo menor é mais rápido de implantar, re...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram não ter interesses financeiros concorrentes diretos. Essa pesquisa foi realizada em colaboração com a Longyan Tobacco Industrial Co., Ltd., onde os autores Hongli Deng e Wencan Li trabalham, e a Baoji Cigarette Factory, onde o autor Baobin Luo trabalha. Essas afiliações forneceram o cenário de aplicação e os dados de campo para o estudo. Os autores acadêmicos (Jun Liu, Jianguang Yi, Feng Yang, Xiaobo Zhao) não declaram conflitos financeiros ou não financeiros de interesse em relação à publicação desta obra.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse trabalho foi financiado pelo Método de Medição de Temperatura para Tarugo de Fundição Baseado em Refletor Precedido e Multicomprimento de Onda (Nº LZY24E050002), financiado pelos Fundos Conjuntos da Fundação Provincial de Ciências Naturais de Zhejiang da China, e pelo Método Online de Medição de Campo de Temperatura de Cavidade de Concha Não Fechada e Não Isotérmica (Nº 2023K231), financiado pelo Projeto de Planejamento de Ciência e Tecnologia de Quzhou.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Leitor de códigoHikvisionID5050Equipamento Hikvision: Usado para ler códigos de barras em paletes, Preciso conectar uma fonte de alimentação 24V
Câmera industrialHikvisionMV-CA013-A0GM, MV-CS016-10GMPreciso conectar a fonte de alimentação 24V
Luz LEDHIKROBOTMV-LLDS-1002-38-WUma fonte de luz em faixa de um metro fornece condições de iluminação suficientes para a câmera
LenteHikvisionMVL-HF0828M-6MPEdistância focal: 8mm, faixa de abertura: F2.8~F16, pixel: 6 milhões
MVSHikvisionV4.5.1Software Hikvision: Usado para depuração de câmeras, definição de parâmetros de câmera e coleta de dados
PycharmJetBrains2020.1.3 x64Usado para treinamento de modelos de deep learning e desenvolvimento de sistemas de detecção
Vários suportes metálicosLongyan Tobacco Industrial Co., Ltd.7075-T6 Liga de AlumínioUsado para consertar câmeras e leitores de código
Vários cabos de redeLongyan Tobacco Industrial Co., Ltd.Cabeça de Cristal RJ45Conecte a estação base entre o computador industrial e o ponto de acesso sem fio, conecte a câmera e o switch, etc
SwicthTP-LinkTL-SH1005Existem 8 interfaces de cabo Ethernet que requerem fonte de alimentação de 220V
Mestre da VisãoHikvisionV4.3.0Software Hikvision: Usado para correspondência de modelos e detecção de resultados de imagens
Dispositivo de AP sem fioShandong HuachuangxunlianBH-ANT5158S-14HV, BH-MS-AC1600HWHDevido ao movimento em grande escala exigido pelo guindaste empilhador, o cabo de rede não pode conectar a câmera ao computador industrial, e um dispositivo de acesso sem fio é necessário para garantir o funcionamento suave da rede de câmeras

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Vídeo em breve

Artigos relacionados