Artigo de investigação

Avaliação em Tempo Real da Ordem do Alinhamento do Tabaco Cortado Usando um Modelo de Regressão de Estágio Único Aprimorado

DOI:

10.3791/71669

29 de maio de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um modelo aprimorado de regressão de estágio único é desenvolvido para a detecção em tempo real da ordem de alinhamento do tabaco cortado. A abordagem integra três otimizações estruturais e um método personalizado de previsão de orientação para aumentar a precisão da detecção enquanto reduz os parâmetros do modelo e a complexidade computacional, permitindo uma avaliação eficiente do alinhamento do tabaco cortado em ambientes industriais de produção.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A ordem do tabaco cortado, definida como a consistência do alinhamento do tabaco cortado ao longo do eixo do cigarro, é um fator crítico na otimização da qualidade da produção. A avaliação precisa e automatizada dessa propriedade continua sendo desafiadora devido às estruturas complexas das cordas e às condições variáveis de imagem. Um modelo de regressão de estágio único aprimorado é desenvolvido para permitir a detecção confiável da ordem de alinhamento do tabaco cortado. A abordagem incorpora três modificações arquitetônicas: um método interativo de downsampling multifrequência para preservar informações de características, uma estratégia de fusão complementar tripla para melhorar a representação de características em múltiplas escalas, e uma cabeça de detecção dinâmica para melhorar a localização em diferentes escalas. Além disso, é implementado um método personalizado de previsão de orientação para quantificar a ordem do alinhamento. O modelo é avaliado com base em um conjunto de dados de imagens industriais, alcançando uma precisão média de 89,9%, uma precisão de 90,6% e uma recordação de 88,7%. Comparado ao modelo base, a abordagem proposta reduz os parâmetros do modelo em 30,8% (de 2,6M para 1,8M) e a complexidade computacional em 21,5% (de 6,5G para 5,1G), ao mesmo tempo em que melhora o desempenho. No geral, o método permite uma avaliação eficiente e precisa da ordem de alinhamento do tabaco cortado e demonstra adequação para aplicações industriais em tempo real.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A ordem do tabaco cortado refere-se ao grau de alinhamento axial do tabaco cortado dentro de um cigarro. Compreender os fatores que influenciam essa propriedade, como a morfologia do tabaco e os parâmetros pneumáticos de transporte, é essencial para otimizar os processos de corte e montagem. Consequentemente, investigar esses fatores influenciadores tornou-se uma estratégia fundamental para as empresas do tabaco que buscam reduzir custos e melhorar a eficiência da produção. A avaliação tradicional da ordem do tabaco cortado baseia-se em métodos manuais, que são ineficientes e frequentemente carecem de consistência e precisão. Portanto, há uma necessidade urgente na indústria por um sistema automatizado, preciso e de detecção em tempo real para otimizar os processos de produção. Com o rápido avanço do deep learning, a avaliação automatizada da ordem do tabaco cortado baseada na detecção de objetos tornou-se viável. No entanto, a implementação desses sistemas de avaliação em linhas de produção continua sendo um tema de pesquisa amplamente inexplorado. No entanto, a tecnologia de visão computacional foi aplicada com sucesso a tarefas de inspeção em outroscampos, fornecendo referências valiosas para este estudo. Nesse contexto, detectores baseados em redes neurais convolucionais (CNN) emergiram como o paradigma dominante e geralmente são categorizados em abordagens de dois estágios, como o Faster R-CNN2, e estruturas de estágio único, comoa série 3,4 You Only Look Once (YOLO).

Nos últimos anos, algoritmos de detecção de objetos baseados em aprendizado profundo, especialmente o framework Faster R-CNN, demonstraram potencial significativo em diversos domínios. No entanto, sua aplicação direta a cenários industriais e profissionais específicos é frequentemente limitada por ambientes operacionais complexos e requisitos únicos de tarefas. Consequentemente, diversas melhorias personalizadas foram propostas para enfrentar esses desafios. Na análise de imagens médicas, por exemplo, Su et al.5 focaram em otimizar parâmetros e refinar arquiteturas de rede para aumentar a precisão da detecção de pequenos alvos críticos na detecção de nódulos pulmonares. Na detecção de defeitos industriais, Chen et al.6 abordaram a interferência de textura na inspeção de tecidos integrando filtros Gabor — otimizados via algoritmos genéticos — na espinha dorsal Faster R-CNN para suprimir efetivamente fundos complexos. Para superar os desafios da escassez de dados e da complexidade ambiental na detecção de alvos subaquáticos, Zeng et al.7 introduziram uma rede de oclusão adversarial. Essa rede compete com o detector durante o treinamento, obrigando o modelo a aprender características mais robustas e, assim, mitigando o sobreajuste. Além disso, para tarefas de recuperação detalhadas, como identificação de instâncias específicas, Li et al.8 aprimoraram o Faster R-CNN por meio de estratégias de concatenação de camada de características e ajuste fino, melhorando significativamente seu desempenho em imagens de baixa resolução. Wang et al.9 propuseram recentemente uma estrutura Faster R-CNN multipartido, preservando a privacidade, que permite computação segura em imagens criptografadas e parâmetros de modelo por meio de protocolos inovadores para divisão segura, exponenciação e logaritmo. Sun et al.10 demonstraram a eficácia de um R-CNN mais rápido aprimorado no reconhecimento de múltiplos tipos de defeitos nos cubos das rodas, alcançando uma precisão média (mAP) maior do que a R-CNN e YOLOv3. Juntos, esses esforços ressaltam a evolução contínua do Faster R-CNN rumo a maior adaptabilidade, robustez e aplicabilidade em diversos cenários do mundo real. Paralelamente a esses avanços em detectores de dois estágios, estruturas de estágio único como a série YOLO também passaram por desenvolvimento substancial.

Como uma alternativa proeminente aos detectores de dois estágios, a série YOLO ganhou reconhecimento significativo tanto nas comunidades industrial quanto de pesquisa devido à sua arquitetura eficiente e excelente desempenho em detecção em tempo real. Desde a introdução do modelo de primeira geração por Redmon et al.11em 2016, iterações sucessivas têm abordado progressivamente várias limitações técnicas, levando pesquisadores a desenvolver adaptações especializadas para aplicações específicas de domínio. Em sistemas de monitoramento de tráfego, por exemplo, Jamtsho et al.12 implementaram o YOLOv2 combinado com um algoritmo de rastreamento de centroide para identificar com precisão placas de motociclistas sem capacete em transmissões de vídeo, reduzindo efetivamente falsos positivos enquanto mantêm uma alta taxa de detecção de 98,52%. Para ambientes subaquáticos desafiadores, Neelamegam et al.13 desenvolveram um modelo híbrido YOLO-Transformer que integra a capacidade de detecção em tempo real do YOLO com mecanismos de atenção baseados em transformadores para maior compreensão contextual. Ao incorporar dados em tempo real de sensores IoT sobre fatores ambientais como turbidez e níveis de luz, o modelo se adapta dinamicamente às condições mutáveis, alcançando uma precisão de detecção de 97,5% e superando modelos convencionais em cenários ruidosos e de baixa visibilidade. De forma semelhante, Zhang et al.14 propuseram um modelo YOLO aprimorado para aplicações de sensoriamento remoto. Para enfrentar desafios de representação insuficiente de características e confusão de fundo, eles introduziram módulos especializados para aprimoramento de características, fusão multiescala e consciência global do contexto, que melhoram significativamente a precisão da detecção de objetos pequenos. Coletivamente, esses estudos demonstram a evolução contínua da série YOLO rumo a maior adaptabilidade, robustez e eficácia em diversos cenários do mundo real.

Apesar desses avanços, versões recentes da família YOLO, como o YOLOv113, não são inerentemente otimizadas para as complexidades texturais e estruturais específicas do tabaco cortado em ambientes industriais. Suas operações padrão de amostragem reduzida podem levar à perda de características finas que são cruciais para distinguir o tabaco alinhado do cortado desordenado. Além disso, suas cabeças de detecção em escala fixa têm dificuldades para lidar efetivamente com a natureza multiescala das características do tabaco sob condições de imagem variadas.

Para enfrentar esses desafios, este artigo propõe um modelo de regressão de estágio único aprimorado baseado no YOLOv11n, combinado com um método personalizado de predição de orientação, para uma detecção online robusta da ordem do tabaco cortado. As principais contribuições deste artigo são triplas. (1) É proposto um método de amostragem interativa multifrequência (MFID). Operações padrão de convolução strided ou pooling descartam informações detalhadas, enquanto o MFID decompõe explicitamente características em componentes de baixa e alta frequência usando a transformada wavelet de Haar. Essa abordagem preserva mais informações originais e mitiga a perda de informação durante a reamostragem. (2) Um método de fusão complementar tripla (TCF) é projetado para melhorar a qualidade das características ao fundir informações semânticas rasas, médias e profundas. Embora operações simples de concatenação ou adição sejam comumente usadas para fusão de características, a TCF introduz uma fusão ponderada guiada por camada intermediária com ramos de peso inverso, alcançando assim complementaridade entre informações semânticas e detalhadas. (3) Uma cabeça de detecção dinâmica (DynamicHead) é introduzida para substituir a cabeça de detecção original. A cabeça de detecção original depende de operações de convolução em escala fixa; em contraste, o DynamicHead integra mecanismos de atenção conscientes de escala, espacialmente e conscientes da tarefa. Isso permite o ajuste dinâmico da importância das características e uma fusão de características multiescala mais flexível e eficaz, melhorando assim a capacidade do modelo de localizar e classificar com precisão características relacionadas à ordem.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo não envolveu indivíduos humanos, animais vertebrados ou tecidos regulados; portanto, não era necessária aprovação ética nem aprovação de um conselho de revisão institucional. O conjunto de dados utilizado neste estudo foi obtido da Longyan Tobacco Industry Co., Ltd. Imagens foram coletadas de cinco lotes de produção independentes ao longo de um período de três meses. A amostragem foi realizada aleatoriamente em diferentes horários do dia (manhã, tarde e noite) para capturar variações naturais nas condições de produção. O conjunto de dados inclui amostras que cobrem uma faixa de umidade do tabaco de 12% a 18%, velocidades de corte de 1,5, 2,0 e 2,5 m/s, e pressões pneumáticas de transporte de 0,4, 0,5 e 0,6 MPa, garantindo assim a cobertura das condições típicas de produção.

Aquisição e Configuração de Conjuntos de Dados
Configuração de hardware
O sistema de aquisição de imagem foi configurado para atender aos requisitos de detecção da ordem do tabaco cortado em cigarros que não queimarem por calor. Consistia principalmente em uma câmera industrial, uma lente industrial, uma fonte de luz de visão e uma unidade de controle industrial. O sistema utilizava uma câmera industrial MV-CH120-10GC combinada com uma lente industrial MVL-KF0818M-12MP para capturar imagens em alta definição da região do tabaco cortado na superfície de varetas de cigarro seccionadas. A câmera estava posicionada a uma distância de trabalho de 150 mm da superfície da vara do cigarro. A fonte de luz LED em faixa era montada coaxialmente com a câmera a uma distância de 80 mm do alvo, com um ângulo de incidência de 45°. A imagem foi realizada dentro de um gabinete preto fosco para eliminar a interferência da luz ambiente. O gabinete é um capuz de alumínio pintado de preto fosco, com dimensões internas de 400 mm (largura) × 350 mm (profundidade) × 300 mm (altura), e superfícies internas revestidas com tinta preta-fosca (refletância < 5% a 550 nm) para minimizar reflexos internos e garantir condições de iluminação consistentes. Para garantir a qualidade e consistência da imagem, uma fonte de luz MV-LRDS-H-95-30-W foi usada para estabelecer um ambiente de iluminação estável, minimizando o impacto das variações da luz ambiente na extração de contornos dos fios de tabaco e no reconhecimento da orientação. As imagens adquiridas eram recebidas, processadas e armazenadas por um computador industrial PC1010-AX360, que também realizava algoritmos subsequentes de reconhecimento, cálculo de resultados e saída de interface. Nenhuma calibração explícita da câmera ou correção de distorção foi realizada, pois a combinação de câmera industrial e lente apresentava distorção radial desprezível (menos de 0,5% nas bordas da imagem) dentro do campo de visão de 896 × 1600 pixels. A câmera e a fonte de luz eram montadas rigidamente em um quadro fixo para garantir estabilidade posicional durante a aquisição da imagem. A intensidade da fonte de luz foi mantida em um nível constante durante toda a aquisição da imagem. O campo de visão foi configurado para cobrir totalmente a região exposta do tabaco cortado dentro da estrutura de suporte de aço.

Configuração dos parâmetros da câmera
A aquisição de imagem era acionada, e imagens eram capturadas após o cigarro da amostra ser posicionado, seccionado e então salvo em formato JPG. Para garantir a consistência das imagens adquiridas, os parâmetros de aquisição eram definidos manualmente. Especificamente, a resolução da imagem foi definida para 896 × 1600. O tempo de exposição foi inicialmente definido para 4000 μs e podia ser ajustado em uma faixa de 3000 a 6000 μs, de acordo com o brilho no local. Todo o ajuste de parâmetros foi realizado com a amostra colocada dentro do gabinete preto fosco descrito acima, sob condições de iluminação totalmente controladas. Não havia luz ambiente externa durante a sintonia, pois o sistema de imagem operava em um ambiente totalmente fechado com as luzes do ambiente apagadas. O ganho foi inicialmente ajustado para 2 dB e controlado em uma faixa de 0 a 6 dB com base nos níveis de ruído. O valor gama foi definido para 0,8, e o balanço de branco foi configurado com parâmetros fixos. Os parâmetros finais de aquisição foram definidos da seguinte forma: tempo de exposição = 4000 μs, ganho = 2 dB, gama = 0,8, modo de balanço de branco = fixo, resolução da imagem = 896 × 1600 pixels e formato da imagem = JPG. Para o balanço de branco, era utilizado o modo de parâmetros fixos. A calibração era realizada usando um cartão de referência branco padrão (X-Rite ColorChecker) colocado na posição da amostra. Os ganhos nos canais vermelho e azul foram ajustados até que os valores RGB do cartão branco fossem equalizados com uma variação de ±2%. Após a calibração, os parâmetros de balanço de branco foram fixados da seguinte forma: ganho vermelho = 1,2, ganho verde = 1,0 (fixo) e ganho azul = 1,5. A calibração era realizada uma vez após cada inicialização do sistema ou sempre que a fonte de luz mostrava sinais de envelhecimento que podiam causar deriva na temperatura da cor. Essas configurações ajudaram a garantir limites claros do tabaco cortado e uma distribuição estável de brilho, além de atender aos requisitos de processamento para segmentação subsequente dos fios de tabaco, cálculo de orientação e análise de orden.

Coleção de imagens
A aquisição de imagem teve como alvo a área de tabaco cortado exposta na superfície de hastes de cigarro que não queimam após a secção. Durante a detecção, a amostra do cigarro era primeiro entregue à estação de inspeção, onde sua postura e posição eram ajustadas e fixadas pelo mecanismo de posicionamento da amostra. O mecanismo de posicionamento consiste em uma grampa pneumática com guias de alinhamento em V. O sistema alcança uma repetibilidade posicional de ±0,5 mm ao longo de 1000 ciclos consecutivos, conforme comprovado por medições do sensor de deslocamento a laser. Subsequentemente, o material de envolvimento externo era estável seccionado pelo mecanismo de corte, expondo totalmente o tabaco cortado superficialmente dentro do campo de visão do sistema de visão. Uma lâmina circular rotativa (diâmetro 50 mm, espessura 0,3 mm, material aço de alta velocidade) foi utilizada. A profundidade de corte foi ajustada para 1,5 mm com uma velocidade de rotação de 300 rpm. A consistência do corte era monitorada por feedback linear do codificador, mantendo variação de espessura dentro de ±0,05 mm. Uma vez que a posição da amostra estava estável e a região de imagem claramente definida, a aquisição de imagem era realizada usando a câmera industrial sob iluminação estável fornecida pela fonte de luz. Um total de 634 imagens foram coletadas; imagens típicas são mostradas na Figura 1. O conjunto de dados inclui três níveis de densidade de tabaco (baixo, médio, alto; aproximadamente 180, 220 e 260 mg/cm 3), orientações das fibras que vão de −180° a 180°, e condições de iluminação que vão desde a iluminação normal até condições de borda com pouca luz. A iluminância foi medida usando um luxímetro digital calibrado (TA8133, precisão ±3%) com o sensor posicionado na superfície da amostra. A faixa normal de iluminação medida é de 200–800 lux, fornecida pela fonte de luz LED em tira dentro do coifão fechado, sem vazamento de luz ambiente. O valor de baixa faixa (aproximadamente 200 lux) representa uma condição de caso limite criada pela escurecimento da fonte de luz para avaliar a robustez do modelo. Além disso, oclusão parcial das fitas de tabaco (variando de 10% a 50%) está presente em aproximadamente 30% das imagens. Essas variações refletem a real diversidade das linhas de produção.

figure-protocol-1
Figura 1. Imagens representativas brutas do tabaco cortado adquiridas pelo sistema de visão. (a–h) Exemplos representativos de imagens brutas de tabaco cortado capturadas em condições de campo industrial usando o sistema de aquisição de imagem. As imagens foram obtidas com resolução de 896 × 1600 pixels sob iluminação controlada, usando uma fonte de luz em faixa para garantir brilho uniforme e minimizar interferências ambientais. Essas imagens ilustram variações na distribuição, densidade e orientação das fitas de tabaco antes do processamento do modelo. Por favor, clique aqui para ver uma versão ampliada desta figura.

Anotação de imagem
Usando a ferramenta de código aberto LabelImg, caixas delimitadoras foram desenhadas ao redor de estruturas visíveis de suporte de tabaco cortado e aço. O ângulo correto era atribuído como rótulo para cada caixa delimitadora. O eixo horizontal (0°) foi definido como a direção para a direita paralela à borda inferior da imagem. Para cada fio de tabaco, a função de medição de ângulo da ferramenta de anotação era usada para desenhar uma linha ao longo do eixo principal do fio. O ângulo era registrado como o ângulo entre esse eixo e a referência horizontal (alcance: −180° a 180°). As anotações eram salvas no formato padrão de detecção de estágio único, com um arquivo TXT correspondente a cada imagem. Cada arquivo .txt contém linhas formatadas como: class_id x_center y_center largura de altura. As coordenadas são normalizadas para [0,1] em relação às dimensões da imagem. Classe 0 = fibra de tabaco, classe 1 = suporte de aço. O rótulo do ângulo é armazenado como uma sexta coluna no arquivo de .txt de anotação, adicionado após os cinco campos padrão do YOLO. O formato exato por linha é: class_id x_center y_center ângulo de altura de largura. O valor do ângulo é armazenado em graus como um número de ponto flutuante variando de −180,0 a 180,0, com dois números decimais (por exemplo, 45,75). Linha de exemplo: 0 0,5230 0,4170 0,0850 0,0620 38,25.

Controle de qualidade
Um segundo anotador revisou aleatoriamente 20% das imagens anotadas. A seleção aleatória foi realizada usando a função random.sample() da biblioteca aleatória em Python com uma semente aleatória fixa de 2024. Uma lista de todos os nomes de arquivos de imagem foi gerada, e 20% das imagens foram amostradas sem substituição usando esse gerador de números aleatórios seeded, garantindo seleção reprodutível através de procedimentos repetidos de controle de qualidade. Quaisquer discrepâncias foram discutidas e resolvidas, garantindo a consistência da rotulagem. A concordância entre anotadores foi avaliada usando desvio angular: a diferença absoluta média entre os rótulos angulares dos dois anotadores foi de 2,8° (desvio padrão = 1,5°). Anotações com desvio >5° foram revisadas e reconciliadas.

Modelo de Regressão de Estágio Único para Detecção de Ordem de Tabaco Cortado
A detecção da ordem de alinhamento do tabaco cortado é crucial para melhorar tanto o processo de fabricação quanto a qualidade do produto final na produção de cigarros. No entanto, essa tarefa de inspeção enfrenta vários desafios, incluindo sobreposição de tabaco cortado, tamanhos pequenos de alvos e iluminação desigual, todos os quais comprometem a precisão e a robustez da detecção. Um modelo de regressão aprimorado de estágio único baseado no YOLOv11n é utilizado para a detecção online da ordem do tabaco cortado. A estrutura proposta identifica com precisão as características morfológicas do tabaco cortado durante a formação da haste de cigarro, permitindo a detecção confiável da regularidade do alinhamento enquanto melhora a precisão, robustez e capacidade de processamento em tempo real. A configuração geral do modelo proposto de regressão de estágio único é mostrada na Figura 2.

figure-protocol-2
Figura 2. Arquitetura geral do modelo de regressão de estágio único proposto. O diagrama ilustra toda a estrutura da rede, incluindo a espinha dorsal, o pescoço e a cabeça de detecção. A espinha dorsal extrai recursos multiescala, incorporando módulos interativos de downsampling multifrequência (MFID) para preservar informações de características. O braço integra características usando a estratégia de fusão complementar tripla (TCF) para representação multinível aprimorada. A cabeça de detecção adota o módulo DynamicHead, que integra mecanismos de atenção conscientes de escala (πL), conscientes espacialmente (πS) e conscientes de tarefas (πC) para melhorar o desempenho em localização e classificação. Por favor, clique aqui para ver uma versão ampliada desta figura.

Módulo de Redução de Amostragem de Informação Multifrequência (MFID)
Na rede backbone do YOLOv11, a operação convolucional com um passo de 2 realiza a reamostragem pulando os pixels. Esse processo descarta diretamente metade da informação espacial, resultando na perda de detalhes de alta frequência (por exemplo, bordas e texturas de objetos pequenos) e perda significativa de informação para alvos pequenos. Além disso, as operações de max-pooling e average-pooling na espinha dorsal também descartam informações detalhadas dentro das regiões dos objetos, características suaves e introduzem ruído, todos os quais afetam negativamente o aprendizado de características.

Para resolver essas questões, é introduzido um módulo MFID, inspirado no conceito de decomposição hierárquicawavelet 15,16. Este módulo primeiro decompõe as características em duas partes complementares usando a transformada wavelet de Haar: informações de fundo de baixa frequência, que aprimoram a classificação, e detalhes de alta frequência ricos em bordas e texturas, que melhoram a detecção de pequenos alvos. Para fortalecer ainda mais a percepção de pequenos alvos, o módulo MFID incorpora dois ramos adicionais: um ramo max-pooling que aproveita a invariância de tradução para preservar características finas de pequenos alvos, e um ramo de convolução strided, que utiliza parâmetros aprendíveis para alcançar maior capacidade representacional e composição de informação mais rica. Por meio dessa estrutura multiramificada, o módulo MFID preserva informações espaciais e de frequência mais completas durante a reamostragem (downsampling). A arquitetura do módulo MFID é ilustrada na Figura 3.

figure-protocol-3
Figura 3. Estrutura do módulo MFID. O módulo MFID separa as características de entrada em componentes de baixa e alta frequência usando uma transformada wavelet de Haar para preservar informações estruturais críticas durante a downsampling. HLL denota o componente de aproximação de baixa frequência, enquanto HLH, HHL e HHH representam componentes de detalhe de alta frequência nas direções horizontal, vertical e diagonal, respectivamente. O símbolo 2↓ indica amostragem descendente em duas dobras. Mapas de características de múltiplos ramos são fundidos por meio de mecanismos de concatenação e gate para melhorar a representação de características. Por favor, clique aqui para ver uma versão ampliada desta figura.

Durante a amostragem descendente, a imagem é decomposta usando a transformada wavelet de Haar, adotada por sua simplicidade e eficiência na decomposição de características de baixa e alta frequência, tornando-a adequada para tarefas de detecção em tempo real. HL e H H denotam, respectivamente, os filtros de decomposição passa-baixa e passa-alta, e são usados para extrair informações de baixa e alta frequência da imagem. A função base wavelet e a função de escalonamento para uma transformada de Haar unidimensional e de um nível são definidas usando a Equação 1 da seguinte forma:

figure-protocol-4 (1)

A função base de Haar é definida usando a Equação 2 da seguinte forma:

figure-protocol-5 (2)

Aqui, parâmetros j e k denotam, respectivamente, o coeficiente de escala e a quantidade de translação da função base de Haar. Especificamente, a função base de Haar de ordem zero é definida usando a Equação 3 da seguinte forma:

figure-protocol-6 (3)

Na Figura 3, o símbolo 2↓ indica amostragem descendente dupla (dupla amostragem descendente). Uma decomposição em wavelet de Haar em dois níveis gera quatro componentes: a aproximação de baixa frequência (HLL) e os componentes de detalhe de alta frequência nas direções horizontal (HLH), vertical (HHL) e diagonal (HHH). O componente HLL carrega informações de contorno, fundo e globais, enquanto os componentes de alta frequência (HLH, HHL e HHH) capturam características de borda, textura e granulação fina.

Os componentes de alta frequência HLH, HHL e HHH obtidos após a dupla amostragem de redução são concatenados pela operação Concat, integrando assim as informações detalhadas multidirecionais para gerar a informação figure-protocol-7detalhada integrada de alta frequência, conforme mostrado na Equação 4.

figure-protocol-8 (4)

Posteriormente, a fusão de informações secundárias é realizada no ramo max-pooling para integrar características detalhadas com características globais, gerando assim informações figure-protocol-9reconstruídas , conforme mostrado na Equação 5, que incorpora um conjunto mais amplo de características salientes e reutiliza informações detalhadas de alta frequência para uma representação aprimorada das características.

figure-protocol-10 (5)

Posteriormente, um mecanismo de gate é empregado para regular dinamicamente o fluxo de informação, e ele figure-protocol-11 é utilizado para guiar a identificação de pequenas características alvo dentro do figure-protocol-12, preservando características úteis enquanto suprime interferências ruidosas inerentes e inúteis. O mecanismo de gate é definido como: gating(x) = Linear_2(ReLU(Linear_1(x))), onde Linear_1 reduz a dimensão do canal em um fator de redução de 4, e Linear_2 a restaura à dimensão original do canal. A saída do mecanismo de cancelamento é passada por uma ativação sigmoide para produzir pesos de modulação na faixa [0,1]. Os parâmetros aprendíveis incluem as matrizes de peso e os termos de viés de ambas as camadas lineares, que são inicializados usando inicialização uniforme. Isso garante que informações detalhadas e críticas das características sejam devidamente balanceadas e utilizadas, resultando na característica figure-protocol-13 detalhada final conforme apresentada na Equação 6.

figure-protocol-14 (6)

Por fim, as informações de downsampling de stride-convolução, o vetor de baixa frequência e a característica detalhada final são concatenados via Concat para expandir a interação de downsampling de características em múltiplas dimensões e faixas de frequência, conforme mostrado na Equação 7.

figure-protocol-15 (7)

Etapas de ação para implementar
Definição de módulo
Um módulo personalizado do PyTorch chamado MFID deve ser definido dentro dos arquivos de definição do modelo do projeto. A implementação deste módulo consiste em quatro caminhos paralelos: (1) Transformada wavelet: uma decomposição em dois níveis é aplicada ao mapa de características de entrada usando filtros wavelet de Haar predefinidos, gerando um componente de aproximação de baixa frequência e componentes de detalhe de alta frequência nas direções horizontal, vertical e diagonal, após o que os três componentes de alta frequência são concatenados; (2) Max-pooling: max-pooling é aplicado à entrada para preservar características salientes; (3) Convolução stridée: a amostragem padrão é realizada através de uma camada convolucional com uma passada de 2; (4) Reconstrução e fusão de características: primeiro, as informações de alta frequência obtidas da transformada wavelet são fundidas com as características do ramo de max-pooling; Subsequentemente, um mecanismo de gate guiado pela informação de baixa frequência é empregado para filtrar características de grão fino; Por fim, as características processadas de grão fino, os componentes de baixa frequência e a saída de convolução strided são concatenados para obter o mapa final de características amostrado em miniatura.

Edição de arquivos de configuração
O arquivo de configuração do modelo base (config.yaml) deve ser aberto. Todas as instâncias de módulos padrão de downsampling tanto na espinha dorsal quanto na rede neckbone devem ser identificadas sistematicamente. Cada entrada identificada no módulo de downsampling deve então ser substituída pelo módulo MFID.

Motivação de projeto
O módulo MFID foi projetado para mitigar a perda de informação em operações padrão de downamostragem, o que é particularmente prejudicial à detecção de objetos pequenos. Seu conceito central é inspirado na decomposição hierárquica wavelet. Ao separar explicitamente informações globais de baixa frequência das informações detalhadas de alta frequência na imagem e processá-las de acordo, o módulo garante que características críticas de textura e bordas sejam preservadas durante a reamostra de amostragem. A incorporação dos ramos de max-pooling e convolução strided captura e complementa ainda mais características a partir de perspectivas complementares — especificamente, invariância de tradução versus representação aprendível. Por meio da fusão multiram, o módulo oferece às camadas de rede subsequentes uma representação de características multifrequência mais informativa e robusta. Todos os parâmetros arquitetônicos não especificados e configurações de camadas seguem as configurações padrão de implementação do framework YOLOv11n dentro do PyTorch.

Módulo de Fusão de Características Triplas Cruzadas (TCF)
No estágio de fusão de características do pescoço da arquitetura de rede YOLOv11, uma operação simples de concatenação é normalmente usada para mesclar mapas de características da mesma escala. No entanto, essa abordagem direta tem limitações claras: primeiro, ela não leva totalmente em conta as diferenças semânticas entre características em diferentes níveis; Segundo, a falta de modelagem explícita das correlações entre canais torna as características de pequenos alvos propensas à diluição ou perda durante a fusão, comprometendo assim o desempenho da detecção. Para resolver essas questões, um método de fusão mais interativo, chamado módulo TCF, foiintroduzido em 17. Esse método emprega uma estratégia de fusão progressiva multinível que orienta o fluxo de informação para a detecção de pequenos alvos por meio da transmissão entre camadas. Também incorpora operações não lineares adicionais para explorar informações de nível profundo em diferentes escalas, aprimorando assim a fusão de características multiescala. Diferentemente dos módulos convencionais que dependem de adição simples ou fusão média, o TCF adota uma abordagem de fusão ponderada. Isso permite que aprenda de forma adaptativa informações detalhadas em cada nível, otimize dinamicamente as vias de extração de informações e foque nas características mais discriminativas, melhorando, em última análise, a precisão da detecção. A arquitetura do módulo TCF está ilustrada na Figura 4.

figure-protocol-16
Figura 4. Estrutura do módulo TCF. O módulo TCF realiza fusão de características em múltiplos níveis em camadas rasas, médias e profundas para melhorar a representação de pequenos alvos. P representa mapas de características de entrada em diferentes níveis. Conv indica operações de convolução, Upsample indica upsampling de características, e AdaptiveAvgPool representa o pooling de média adaptativa. O módulo integra características calibradas por meio de fusão ponderada e interação entre camadas para aprimorar a complementaridade semântica e espacial das características. Por favor, clique aqui para ver uma versão ampliada desta figura.

Na tarefa de detecção de objetos, as informações contidas na característica de camada profunda Pi+1 e na característica de camada rasa Pi-1 diferem significativamente. Para potencializar a fusão de informações entre camadas, a camada intermediária Pi é introduzida como a camada final de fusão de características para equilibrar as diferenças entre informações de características em diferentes níveis.

Primeiro, as informações de entrada das camadas rasa, média e profunda são processadas usando a função de ativação Sigmoid para gerar características figure-protocol-17ponderadas , figure-protocol-18, e figure-protocol-19, que servem para fortalecer características-chave e enfraquecer as redundantes, como mostrado na Equação 8.

figure-protocol-20 (8)

Segundo, as informações de entrada das camadas rasas, médias e profundas são multiplicadas elemento a elemento pelas características ponderadas mapeadas para gerar características figure-protocol-21calibradas , figure-protocol-22, e figure-protocol-23, conforme mostrado na Equação 9. A importância das características é ajustada dinamicamente pelo mecanismo de atenção do peso, alcançando assim a seleção e recalibração adaptativa das características.

figure-protocol-24 (9)

No estágio de fusão de características da camada intermediária, dois ramos de peso inverso são aproveitados para fundir-se com as características calibradas da camada rasa e profunda, respectivamente, filtrando as informações detalhadas falsas induzidas pelo ruído nas características da camada rasa e a informação semântica associada enviesada nas características da camada profunda. Subsequentemente, as informações multibranch são integradas, e as características originais, calibradas e interativas dessa camada, assim como as características calibradas de camada rasa e profunda, são fundidas. Isso alcança a preservação e complementação das informações de características multiescala, mitiga os problemas de perda de informação em pequenos alvos e erro de julgamento, e finalmente gera características figure-protocol-25fundidas de camada intermediária , que são formuladas usando a Equação 10 da seguinte forma:

figure-protocol-26 (10)

As associações entre a camada rasa, camada profunda e camada média são estabelecidas separadamente, como mostrado nas Equações 11 e 12.

figure-protocol-27 (11)

figure-protocol-28 (12)

Por fim, as saídas dos três caminhos de fusão de características são concatenadas via operação Concat para preservar a independência de características de cada caminho individual. Informações-chave de cada caminho são aprendidas dinamicamente com base nos pesos α, β e γ, que são definidos como parâmetros escalares aprendíveis inicializados em 1.0 e otimizados via retropropagação durante o treinamento, permitindo balanceamento dinâmico das contribuições de caminhos rasos, médios e profundos de características. Além disso, operações convolucionais são empregadas para agregar informações contextuais, eliminar respostas incoerentes na fronteira de características causadas por concatenação entre camadas e otimizar a aquisição e representação refinada de informações detalhadas de pequenos alvos. O processo é formulado usando a Equação 13 da seguinte forma:

figure-protocol-29 (13)

Etapas de ação para implementar
Definição de módulo
Um módulo personalizado do PyTorch chamado TCF deve ser definido dentro dos arquivos de definição do modelo do projeto. Este módulo recebe como entrada os mapas de características de camada rasa, camada intermediária e camada profunda extraídos de diferentes estágios da rede backbone. Seu fluxo interno de processamento consiste em três etapas principais: (1) Calibração de características: a função Sigmoide é aplicada a cada uma das três camadas de características de entrada para gerar mapas de peso, que são então multiplicados elemento a elemento com os mapas originais para aprimorar características-chave enquanto suprimem as redundantes; (2) Fusão interativa: na fase de fusão de características da camada intermediária, dois ramos de peso inverso são introduzidos para fundir-se com as características calibradas da camada rasa e profunda, respectivamente, filtrando informações detalhadas falsas induzidas pelo ruído nas características da camada rasa e informações semânticas associadas enviesadas nas características da camada profunda; (3) Agregação multicaminho: as características originais, características calibradas, recursos interativos e características fundidas com informações superficiais e profundas são integradas, após as quais operações convolucionais são aplicadas para eliminar respostas incoerentes na fronteira de características causadas pela concatenação entre camadas, gerando por última vez características fundidas ricas em informações multiescala.

Edição de arquivos de configuração
O arquivo de configuração do modelo (config.yaml) deve ser aberto. As seções de fusão de características na rede neck—especificamente, as camadas onde características de diferentes estágios da rede backbone são fundidas—devem estar localizadas. Nessas posições, as camadas originais de operações simples de concatenação devem ser substituídas por uma chamada ao módulo TCF, garantindo que as entradas do módulo estejam corretamente conectadas às características rasas, médias e profundas correspondentes.

Motivação de projeto
O design do módulo TCF é motivado pelos desafios da disparidade e perda de informação durante a fusão de características. Características superficiais são ricas em detalhes, mas contêm bastante ruído, enquanto as características profundas apresentam semântica forte, porém baixa resolução. Para resolver isso, o módulo TCF introduz uma funcionalidade de camada intermediária como balanceador de informações e incorpora caminhos cuidadosamente projetados de calibração, interação e agregação para maximizar as vantagens complementares das características entre níveis. A motivação subjacente é estabelecer um mecanismo de fusão mais eficaz, capaz de avaliar dinamicamente a importância das características em cada nível e integrar seletivamente a informação. Como resultado, ele gera uma representação de características de alta qualidade para a cabeça de detecção subsequente, rica em detalhes e informações semânticas, tornando-a particularmente adequada para reconhecimento de objetos pequenos.

Módulo DynamicHead
O componente cabeça de detecção serve ao propósito fundamental de realizar reconhecimento multiescala de objetos em representações de características geradas pela espinha dorsal e pelas redes de fusão de características. Esse processo permite a localização espacial precisa dos objetos detectados, a atribuição categórica e a estimativa de confiabilidade das previsões da caixa delimitadora. Dadas as variações substanciais de escala das características-alvo nos dados visuais e a densa concentração de propostas de caixas delimitadoras em certos quadros, a identificação precisa do tabaco cortado requer a análise de padrões multiescala. Para resolver isso, o método adota a arquiteturaDynamicHead 18 como substituta da cabeça nativa de detecção no YOLOv11n, estabelecendo uma estrutura de autoatenção que integra mecanismos conscientes de escala, espacialmente e conscientes de tarefas para aprimorar tanto a capacidade de detecção quanto a eficiência operacional. A configuração estrutural do componente DynamicHead está ilustrada na Figura 5.

figure-protocol-30
Figura 5. Estrutura do módulo de detecção Dynamichead. O módulo DynamicHead incorpora três mecanismos sequenciais de atenção: consciente da escala (πL), consciente do espaço (πS) e consciente da tarefa (πC). Esses componentes ajustam dinamicamente a importância das características em escalas, regiões espaciais e tarefas de detecção. Esse design melhora tanto a precisão da localização quanto o desempenho da classificação ao permitir o refinamento adaptativo de características dentro da cabeça de detecção. Por favor, clique aqui para ver uma versão ampliada desta figura.

Essa arquitetura compreende três unidades de atenção especializadas: componentes conscientes de escala (πL), conscientes do espaço (πS) e conscientes da tarefa (πC). O mecanismo de atenção consciente da escala (πL) primeiro faz a média do mapa de características de entrada entre dimensões espaciais e de canais. O resultado é passado por uma camada linear de projeção seguida por uma ativação sigmoide dura para gerar pesos de escala, que são então multiplicados elemento a elemento pelo mapa de características original. O mecanismo de atenção espacialmente consciente (πS) emprega convolução deformável com K = 9 pontos de amostragem selecionados de forma esparsa. Ela prevê vetores de deslocamento Δpk e escalares de modulação Δm k para cada ponto de amostragem, e então agrega as características amostradas para produzir pesos de atenção espacial. O mecanismo de atenção consciente da tarefa (πC) aplica uma transformação linear aprendível a cada canal de forma independente, usando dois conjuntos de parâmetros (α1, β1 e α2, β2). Ele seleciona a resposta máxima entre as duas representações transformadas para adaptar dinamicamente as características para tarefas de classificação e regressão. Finalmente, esses três mecanismos de atenção são aplicados sequencialmente ao mapa de características de entrada como F_out = πC(πS(πL(F) · F) · F) · F. O mecanismo consciente da escala emprega ponderação de características cruzadas para combinar representações multiresolução de forma adaptativa, refinando assim a sensibilidade do modelo a variações dimensionais. O componente espacialmente consciente implementa ponderação regional de ênfase dentro dos mapeamentos de características, direcionando o foco computacional para entidades em primeiro plano enquanto suprime interferências de fundo irrelevantes. Enquanto isso, o módulo consciente da tarefa modula dinamicamente as representações de saída para objetivos específicos, refinando tanto os resultados de classificação quanto de regressão para fortalecer a precisão do modelo e a robustez operacional. O procedimento computacional está formalizado nas Equações 14–17.

figure-protocol-31 (14)

figure-protocol-32 (15)

figure-protocol-33 (16)

figure-protocol-34 (17)

Aqui, WL(F) denota a representação de características enriquecidas pela atenção, enquanto πL(F), πS(F) e πC(F) correspondem, respectivamente, a operações de atenção orientadas à escala, espacial e orientada a tarefas. A transformação f representa uma camada linear de projeção, σ(x) indica processamento de ativação sigmoide dura, K especifica a quantidade de pontos espaciais pouco selecionados, pk+Δp k introduz ajustes de posição para enfatizar áreas discriminantes, Δmk constitui uma medida de significância treinável para o ponto espacial pk, e α(F) e β(F) são funções paramétricas aprendíveis que regem limiares de ativação. Entre eles, K é definido para 9 em todos os experimentos, pois esse valor proporciona cobertura espacial suficiente mantendo a eficiência computacional.

Etapas de ação para implementar
Definição de módulo
Um módulo personalizado do PyTorch chamado DynamicHead deve ser definido dentro dos arquivos de definição do modelo do projeto. A implementação deste módulo consiste em três unidades de atenção aplicadas sequencialmente: (1) Atenção consciente da escala: camadas de características em diferentes escalas são ponderadas dinamicamente usando parâmetros aprendíveis; (2) Atenção espacialmente consciente: baseada no conceito de convolução deformável, esta unidade foca em localizações espaciais esparsas, porém discriminativas, dentro dos mapas de características; (3) Atenção consciente da tarefa: limiares de ativação são aprendidos dinamicamente para otimizar representações de características para tarefas de classificação e regressão, respectivamente. Esses três mecanismos de atenção são aplicados sequencialmente à pirâmide de características de entrada, produzindo em última instância características para previsão. Todos os módulos foram implementados usando operações padrão do PyTorch, incluindo camadas convolucionais, camadas lineares, funções de ativação e mecanismos de atenção conforme descrito acima.

Edição de arquivos de configuração
O arquivo de configuração do modelo (config.yaml) deve ser aberto. A seção que define a cabeça de detecção deve estar localizada. A configuração original da cabeça de detecção, que normalmente compreende uma série de camadas convolucionais para classificação e regressão, deve ser substituída por uma chamada ao módulo DynamicHead, garantindo que sua entrada esteja conectada à pirâmide de características da saída pela rede do pescoço.

Motivação de projeto
Cabeças de detecção tradicionais normalmente aplicam o mesmo conjunto de parâmetros convolucionais a todas as camadas de características, localizações espaciais e tarefas, sem adaptabilidade específica para cada tarefa. A introdução do módulo DynamicHead é motivada pela complexidade das tarefas de detecção, visando desacoplar e enfrentar esses desafios por meio de uma arquitetura unificada baseada em atenção. Sua motivação de design é tripla: (1) focar adaptativamente em camadas de características correspondentes a alvos de diferentes tamanhos via módulo consciente de escala; (2) concentrar recursos computacionais nas regiões alvo em primeiro plano em vez de em segundo plano via o módulo de consciência espacial; e (3) otimizar dinamicamente representações de características para os objetivos distintos de classificação e regressão por meio do módulo consciente da tarefa. Essa combinação de desacoplamento e otimização dinâmica melhora a precisão de localização e a confiabilidade da classificação do modelo para alvos densamente dispostos e multiescala, como tabaco cortado.

Método de Avaliação Personalizado para a Ordem do Tabaco Cortado
Descrição do módulo e princípio de projeto: A avaliação quantitativa da ordem de alinhamento do tabaco cortado é essencial para avaliar a estabilidade do processo de fabricação e prever a qualidade do produto final na produção de cigarros. Métodos tradicionais de avaliação dependem da inspeção visual manual, que é subjetiva, consome tempo e não consegue fornecer medições quantitativas consistentes. Para resolver essas limitações, é utilizado um método personalizado de predição de ângulo integrado ao detector de regressão de estágio único aprimorado. O princípio fundamental desse método é estabelecer uma estrutura de referência espacial usando a estrutura de suporte de aço dentro da haste do cigarro como referência geométrica. Como o suporte de aço mantém uma orientação fixa durante a fabricação, ele serve como uma linha de referência ideal para calcular a orientação relativa do tabaco cortado individualmente. Ao medir os ângulos absolutos do tabaco cortado detectado e do suporte de aço em relação à linha de referência horizontal e, posteriormente, calcular suas diferenças angulares relativas, o método fornece uma avaliação quantitativa da ordem do alinhamento. Um ângulo relativo zero indica paralelismo perfeito entre um fio e o suporte, enquanto o aumento do desvio angular indica um alinhamento mais baixo. O eixo de referência horizontal é definido como a linha paralela à borda inferior da imagem, orientada da esquerda para a direita. Esse eixo corresponde a 0°, com ângulos positivos medidos no sentido anti-horário e ângulos negativos medidos no sentido horário a partir desse eixo. A métrica final de ordem é obtida fazendo a média dos ângulos relativos de todos os fios detectados dentro de uma imagem, permitindo uma gradação consistente e objetiva de qualidade.

Etapas de ação para implementar
Definição do módulo de cálculo de ângulo
Implemente um módulo de pós-processamento que processe as saídas de detecção do modelo de regressão de estágio único aprimorado. Para cada objeto detectado (tabaco cortado e suporte de aço), extraia as coordenadas da caixa delimitadora. Calcule as coordenadas do ponto central para cada objeto detectado usando a Equação 18. Calcule as coordenadas do ponto central da imagem com base nas dimensões da imagem usando a Equação 19.

figure-protocol-35
figure-protocol-36(18)

figure-protocol-37
figure-protocol-38(19)

onde x₁, x₂, y₁, y₂ denotam as coordenadas dos quatro cantos da caixa delimitadora detectada para um fio de tabaco ou para o suporte de aço; cx e c y representam as coordenadas de seus respectivos pontos centrais dentro da região de detecção; W e h indicam a largura e a altura da imagem do cigarro; d,x e d, y definem as coordenadas do ponto central da imagem.

Cálculo de ângulo absoluto
Para cada estrebante de tabaco detectado e o suporte de aço, calcule o vetor do centro da imagem até o centro do objeto. Calcule o ângulo absoluto relativo à linha de referência horizontal usando a função arctangente, conforme formulado na Equação 20. O ângulo é calculado usando atan2(d_y, d_x), onde atan2 é a função tangente inversa de quatro quadrantes disponível na biblioteca matemática em Python. Essa função retorna valores no intervalo (−π, π] radianos, que são então convertidos em graus, resultando em ângulos de saída no intervalo (−180°, 180°]. O manuseio por quadrantes é automático com atan2, baseado nos sinais de d_y e d_x. Isso resulta emUm aço para o suporte de aço e umcorte A para cada fibra de tabaco.

figure-protocol-39 (20)

Cálculo do ângulo relativo
Para cada fibra de tabaco detectada, calcule-se o ângulo relativo subtraindo o ângulo absoluto do suporte de aço do ângulo absoluto do fio, conforme mostrado na Equação 21. O valor absoluto garante medições positivas de desvio angular.

figure-protocol-40 (21)

Geração de métricas de ordem
Agregue os ângulos relativos de todos os fios detectados dentro de uma única imagem. Calcule o ângulo relativo médio somando todos os ângulos relativos To e dividindo pelo número total de fios detectados n, conforme formulado na Equação 22. Esse valor médio serve como medida quantitativa da ordem de alinhamento para aquela imagem.

figure-protocol-41 (22)

Implementação de classificação de qualidade
Implemente uma função de classificação que mapeie o valor calculado para notas qualitativas com base em limiares pré-definidos, conforme definido na Equação 23. Os limites de classificação (0°–30° = Excelente, 30°–60° = Bom, >60° = Pobre) foram estabelecidos com base em consulta com três especialistas em controle de qualidade da Longyan Tobacco Industry Co., Ltd. Esses especialistas avaliaram independentemente 200 imagens amostrais e correlacionaram os ângulos relativos médios calculados com a qualidade de alinhamento percebida, usando uma escala de três categorias (Excelente, Bom e Ruim). Os limites de 30° e 60° foram selecionados como cortes de consenso onde o acordo entre especialistas ultrapassou 90%. Essa avaliação permite uma interpretação intuitiva dos resultados quantitativos para o pessoal de controle de qualidade.

figure-protocol-42 (23)

Edição de arquivos de configuração
O arquivo de configuração do modelo (config.yaml ou model.yaml) deve ser aberto. A seção de pós-processamento ou a parte de configurações de inferência da configuração deve estar localizada. O módulo personalizado de cálculo de ângulos deve ser devidamente referenciado e habilitado. As configurações de análise sintática de saída devem ser verificadas para extrair corretamente as coordenadas da caixa delimitadora tanto para tabaco cortado quanto para o suporte de aço. Não é necessária inserção de camadas adicionais para esse método de avaliação, pois ele opera como um módulo de pós-processamento após as saídas da cabeça de detecção.

Motivação de projeto
O design desse método personalizado de avaliação é motivado pela necessidade de transformar a inspeção visual subjetiva em medições quantitativas objetivas e reprodutíveis. A inspeção manual tradicional sofre de variabilidade entre observadores e não pode fornecer dados numéricos contínuos para otimização do processo. Ao utilizar o suporte de aço como referência geométrica natural dentro da haste, o método elimina a necessidade de marcadores de calibração externos e garante consistência na medição entre diferentes imagens e lotes de produção. O uso de vetores de ponto central e cálculos de arctangente fornece uma abordagem matematicamente robusta e computacionalmente eficiente para a estimativa de ângulos, tornando-a adequada para implantação em tempo real. Esse cálculo vetorial do centro da imagem ao centro do objeto é projetado para ser invariante ao campo de visão da câmera e à posição da vareta dentro da imagem, garantindo assim robustez sob condições variadas de captura. A estratégia de média entre múltiplas fibras detectadas leva em conta as variações naturais na orientação das fibras e gera uma métrica de ordem geral estatisticamente confiável. Um sistema de classificação de três níveis traduz medições numéricas contínuas em categorias de qualidade acionáveis, facilitando a tomada rápida de decisões no controle de qualidade da linha de produção. No geral, essa abordagem integrada combina as capacidades de detecção do modelo de regressão de estágio único aprimorado com cálculos geométricos precisos, permitindo uma avaliação abrangente e automatizada da ordem de alinhamento do tabaco cortado.

Treinamento de modelos para detecção de ordem no tabaco cortado
PyTorch 2.1.0, Compute Unified Device Architecture (CUDA) 12.1, e todas as dependências devem estar devidamente instaladas. A implementação segue pipelines padrão do PyTorch YOLO e pode ser reproduzida com base nas descrições detalhadas dos módulos e etapas de configuração fornecidas.

Comando de treinamento
Antes do retreinamento, o conjunto de dados de imagens particionado e os arquivos de anotação no formato padrão de detecção de estágio único (por exemplo, formato YOLO com um arquivo de .txt por imagem) devem ser preparados. Deve-se criar um arquivo .yaml de configuração de conjunto especificando os caminhos das imagens, número de classes (suporte de tabaco cortado e aço) e nomes de classes. Com base nas melhorias do modelo descritas anteriormente, o arquivo de configuração .yaml do detector original deve ser substituído pelo arquivo .yaml do modelo proposto, que incorpora os módulos MFID, TCF e DynamicHead. O script train.py deve ser escrito ou modificado para importar o pacote detector de estágio único, carregar o modelo de treinamento e a configuração do conjunto de dados, e definir os seguintes parâmetros de treinamento: imgsz=640, epochs=100, batch=4, workers=0, device='0', otimizador='SGD', close_mosaic=10, etc. A semente aleatória foi fixada em 42, e os pesos dos modelos foram inicializados usando a estratégia padrão fornecida pelo framework de aprendizado profundo. A reprodutibilidade era garantida definindo torch.backends.cudnn.deterministic = True e torch.backends.cudnn.benchmark = False.

Hiperparâmetros
Os principais hiperparâmetros configurados para treinamento são os seguintes: resolução de imagem de entrada de 896 × 1600 pixels; tamanho do lote de 4, limitado pela memória da GPU; taxa inicial de aprendizado de 0,01 com um agendador de recozimento cosseno para decaimento gradual; otimizador de descida do gradiente estocástico (SGD) com momento de 0,912 para acelerar a convergência; e decaimento do peso de 0,0004 para regularização. As imagens foram normalizadas usando média [0,485, 0,456, 0,406] e desvio padrão [0,229, 0,224, 0,225]. O aumento incluiu viragem horizontal aleatória (50%), ajuste aleatório de brilho (±20%) e rotação aleatória (±15°). A ampliação em mosaico é ativada por padrão durante os primeiros períodos de treinamento para aumentar a robustez do modelo a escalas e oclusões de objetos variados. Ele é desativado nas últimas 10 épocas (close_mosaic = 10) para refinar a precisão da detecção.

Monitoramento de treinamento
Durante o treinamento, o framework gera métricas abrangentes em cada época. A função de perda é uma soma ponderada de três componentes: perda de classificação (entropia cruzada binária [BCE] com logitas), perda por localização (interseção completa sobre perda de união [IoU]) e perda de objetividade (BCE). Os pesos totais de perda foram definidos como λ_cls = 0,5, λ_box = 0,05 e λ_obj = 1,0. As curvas de perda de treinamento e validação devem ser monitoradas para garantir convergência estável e detectar quaisquer sinais de sobreajuste. O mAP com limiar de IoU de 0,5 (mAP@0,5) no conjunto de validação é usado como o principal indicador de desempenho para a detecção de fios de tabaco cortados. Dado o tamanho do conjunto de dados e a complexidade do modelo, o treinamento para 100 épocas é tipicamente suficiente para convergência. O checkpoint do modelo com melhor desempenho é automaticamente salvo com base no mAP de validação.

Avaliação e Implantação de Modelos
Avaliação
Após a conclusão do treinamento, os pesos ideais do modelo são salvos como runs/train/exp/weights/best.pt. O modelo treinado deve ser avaliado no conjunto dedicado de validação usando o seguinte comando: python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. O script de avaliação gera métricas de desempenho chave, incluindo precisão, recall e mAP@0,5, para ambas as classes de detecção (tabaco cortado e suporte de aço). O mAP deve ser verificado para atender ao limiar exigido para implantação industrial (por exemplo, >95% para detecção de fios). O limiar de implantação (mAP >95% para detecção de fios) representa um requisito interno de desempenho para o ambiente industrial alvo. O resultado relatado reflete desempenho em um conjunto diversificado de testes que inclui casos extremos desafiadores. O mAP do modelo para condições rotineiras de produção ultrapassa 96% quando avaliado em um subconjunto filtrado para iluminação ideal e oclusão mínima. O subconjunto de produção rotineira foi definido pelos seguintes critérios: iluminação na faixa de 500–800 lux (iluminação ideal), porcentagem de oclusão inferior a 10% (sobreposição mínima) e ausência de reflexões especulares visíveis. Esse subconjunto contém 427 imagens, representando aproximadamente 67% do conjunto de teste. Esse subconjunto corresponde às condições padrão de produção diurna sob iluminação normal e arranjo bem orientado dos fios.

Verificação de inferência
Para validar visualmente o desempenho de detecção do modelo em imagens não vistas, a inferência é realizada em imagens de teste de exemplo usando o seguinte comando: python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Esse comando gera imagens anotadas com caixas delimitadoras ao redor de suportes de tabaco e aço cortados detectados. A velocidade de inferência foi medida em uma GPU NVIDIA GeForce RTX 3080 Ti (12 GB de VRAM) usando CUDA 12.1 e PyTorch 2.1.0. Os quadros por segundo (FPS) reportados foram calculados como a média de mais de 100 passes consecutivos para frente após 50 iterações de aquecimento. Além disso, a velocidade de inferência (em quadros por segundo) é reportada para confirmar sua adequação em tempo real para o ambiente de implantação.

Implantação de modelos
Para permitir a implantação em tempo real no sistema de controle industrial, o modelo treinado do PyTorch (best.pt, aproximadamente 7–9 MB) deve ser exportado para um formato otimizado de inferência, como TensorRT ou Open Neural Network Exchange (ONNX). Essa conversão melhora a velocidade de inferência enquanto mantém a precisão da detecção. Para exportação ONNX, use: torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["images"], output_names=["outputs"]). Para conversão TensorRT, use: trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096. O modo de precisão FP16 era usado para otimizar a velocidade de inferência. O modelo final implantado gera coordenadas de caixa delimitadora, rótulos de classe (fio de tabaco cortado ou suporte de aço) e pontuações de confiança para cada objeto detectado, que servem como entradas para o método personalizado de avaliação de ângulo usado para quantificar a ordem do tabaco cortado.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ambiente Experimental
Todos os experimentos foram realizados usando o framework de deep learning PyTorch, com configurações detalhadas de hardware e software resumidas na Tabela 1. Um total de 634 imagens foi dividido aleatoriamente em conjuntos de treinamento, validação e teste na proporção de 7:2:1. Durante o treinamento, as imagens de entrada foram redimensionadas uniformemente para 896 × 1600 pixels, e a taxa inicial de aprendizado foi definida pa...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Uma vantagem chave do modelo proposto na detecção da ordem do tabaco cortado é seu equilíbrio entre precisão da detecção e eficiência computacional. Essa tarefa requer processamento em tempo real de numerosos tabacos de granulação fina em imagens de alta resolução, impondo exigências rigorosas de precisão e velocidade do modelo. Como mostrado na Tabela 2, o modelo proposto alcança o maior mAP@0,5 (89,9%) para detectar suportes de tabaco e aço cortados entre os detectores...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram não ter interesses financeiros concorrentes diretos. Essa pesquisa foi conduzida na Longyan Tobacco Industrial Co., Ltd., que forneceu o cenário de aplicação e os dados de campo para o estudo. Os autores acadêmicos declaram não haver conflitos financeiros ou não financeiros de interesse em relação à publicação desta obra.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta pesquisa foi financiada pelo projeto de tecnologia de medição de produção para produtos de cigarro que não queimam por calor e controle de temperatura e umidade ambiental (Grant No. FJZYKJJH2022YB014).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Leitor de códigoHikvisionID5050Usava para ler códigos de barras em paletes; requer fonte de alimentação de 24 V
Conjunto de dados (imagens de tabaco cortado)Longyan Tobacco Industrial Co., Ltd.N/AConjunto de dados de imagens personalizados do tabaco cortado usado para treinamento, validação e testes de modelos
Framework de aprendizado profundo (PyTorch 2.1.0)Fundação PyTorchSoftware de código abertoUsado para desenvolvimento e treinamento de modelos de deep learning
Câmera industrialHikvisionMV-CH120-10GCUsado para aquisição de imagens; requer fonte de alimentação de 24 V
Computador industrialTecnologia YanzhiPC1010-AX360Usado para processamento de imagens, inferência de modelos e armazenamento de dados
Fonte de luz LEDHikrobotMV-LRDS-H-95-30-WFonte de luz em faixa que proporciona iluminação estável para imagens
LenteHikvisionMVL-KF0818M-12MPDistância focal: 8 mm; faixa de abertura: F1.8 e traço; F16; Resolução de 12 MP
Suportes metálicosLongyan Tobacco Industrial Co., Ltd.7075-T6 Liga de AlumínioUsado para montar e estabilizar componentes de hardware
Cabos de redeLongyan Tobacco Industrial Co., Ltd.Cabeça de Cristal RJ45Usado para conectar computadores industriais, câmeras e dispositivos de rede
Python (versão 3.9)Fundação de Software PythonSoftware de código abertoAmbiente de programação para implementação
TrocaTP-LinkTL-SH10058 portas Ethernet; requer fonte de alimentação de 220 V
Ponto de acesso sem fio (módulo de comunicação industrial)Shandong Huachuang XunlianBH-ANT5158S-14HV; BH-MS-AC1600HWHPossibilita comunicação sem fio entre câmera e computador industrial
Software de controle de câmera (MVS)HikvisionV4.5.1Usado para depuração de câmeras, configuração de parâmetros e aquisição de dados
Software de processamento de visão (Vision Master)HikvisionV4.3.0Usado para correspondência de modelos e detecção de resultados de imagens
Ambiente de desenvolvimento integrado (PyCharm)JetBrains2020.1.3 x64Usado para desenvolvimento de modelos e implementação de sistemas
Kit de Ferramentas CUDA (versão 12.1)NVIDIAKit de ferramentas de software (sem número de catálogo)Permite aceleração de GPU para treinamento e inferência

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Avalia o de Ordena oDetec o em Tempo RealSubamostragem de Caracter sticasFus o de Caracter sticas MultiescalaCabe a de Detec o Din micaPredi o de Orienta oConjunto de Dados de Imagens IndustriaisOtimiza o da Qualidade de Produ o

Artigos relacionados